ARTICLE · 1121506
FLUX3上4K Wan3文档模式 Mirage本地免费 | AI视频动漫制作
视频生成的战场,已经从"生成"挪到了"生成之后"
先说结论:过去一周 AI 视频领域真正的变化,没有一条发生在"谁生成的画质更好"上。变化全在生成之后——放大、改分辨率、剪辑、动效、以及把文档直接变视频。
这其实是行业成熟的信号。当一梯队模型的画质差距收窄到 2 分以内,价格差却还有 6 成的时候,钱就会流向能降低成本的那一层。
一、分辨率:FLUX 3 Video 把 2K/4K 拉进明码标价
Black Forest Labs 从 9 月 10 日起为 FLUX 3 Video 列出 QHD 与 UHD 输出档,价格写得很清楚:
| 输出规格 | 价格(每秒) |
|---|---|
| QHD(2K) | $0.40 |
| UHD(4K) | $0.80 |
| Video-to-video(2K) | $0.65 |
| Video-to-video(4K) | $0.95 |
同时 FLUX 3 本体仍可生成最长 20 秒的 FHD 带音频视频。8 月 20 日上线的 FLUX Video Upscale 支持 1.5x 到 3x 放大、最高 4K,作用在 20 秒以内的片段上。
这里有个很容易踩的坑,值得单独说一句:
只放大你已经确认通过的那一条,不要放你还在纠结的草稿。
4K 的价格是 2K 的两倍,而大多数竖屏社交内容根本不需要 4K 母版。按交付物定价,不要按习惯定价。
如果最终交付是 1080p,ByteDance Upscaler Video 从 3 credits 起步,Topaz Upscale Video 从 4 credits 起步,都比直接生成 4K 便宜得多。
二、输入侧:Wan 3.0 的文档模式被低估了
阿里在 8 月 24 日正式发布 Wan 3.0,公布的规格是 30 秒、30fps、480p/720p/1080p,音频默认开启,最多支持 10 张图、5 个视频、5 个音频参考。
但真正该关注的是它的 document mode——把 PDF、演示文稿或网页直接转成视频。
这是"输入形态"的突破。过去所有视频模型的输入都是"描述画面",现在可以直接吃一份文档。对企业培训、产品介绍、财报摘要这类内容,等于跳过了一整道脚本转分镜的人工。
需要注意的落差:官方口径的 30 秒是阿里的说法,部分第三方平台上的 Wan 3.0 行最高只到 15 秒。实际做法通常是"两条 + 一剪"。
在 Versely 上,Wan 3.0 从 6 credits 起,更快的 Prime 档从 11 credits 起。当需求还在变、又希望草稿里就有声音时,它是起草阶段最划算的一档。
三、剪辑层:Mirage 发布 Tesseract,本地引擎免费
Mirage(前身是 Captions)在 9 月 22 日发布了 Tesseract。它不是生成模型,而是agent 驱动的剪辑与动效套件,而且本地引擎免费。
这件事的方向意义大于产品本身:剪辑工具开始用"智能体"而不是"时间轴"作为交互入口。你描述想要什么,它去素材里找、去拼、去加动效。
配合开源剪映替代 OpenCut(GitHub 91,458 星)一起看,AIGC 工作流的成本大头正在被拆掉——生成要钱,但剪辑和动效正在变便宜甚至免费。
四、分发层:Runway 没发新模型,改做别人的模型入口
Runway 9 月 17-18 日的更新日志显示,它的 MCP 接入了 Kling O3 4K、Kling 3.0 Standard、motion control 以及帧率转换。
Runway 自己最新的模型仍是 Gen-4.5,9 月没有新模型。它的动作是把别家的模型装进自己的生态。Gen-4.5 行从 200 credits 起,仍定位为镜头控制的选择。
这个策略不新鲜,但在视频领域第一次这么明确:平台价值开始脱离自研模型。对用户是好事——一个入口里比价、比画质、比速度。
五、可灵 4.0:从"抽卡"到"分镜"
可灵 Kling 4.0 定档 10 月上线,参数升级不小:
- 单次原生生成时长从 15 秒翻倍到 30 秒,多次续拍最长可延展到 2 分钟;
- 单次最多支持 15 项多模态参考(10 张图、5 个视频、7 个主体);
- 关键帧输入从上一代的首尾两帧,扩到最多 10 张;
- 提示词上限 8000 tokens;
- 输出 4K/1080p 的 10-bit HDR,21:9 画幅即将上线。
最值得盯的是那 10 张关键帧。上一代只有首尾帧时,AI 视频本质上是抽卡——你给开头和结尾,中间怎么走全看运气。能塞 10 张关键帧,等于可以分段控制,AI 视频第一次从抽卡变成了分镜。
这对批量生产商品短视频的团队意义很直接:可以按脚本交付了。过去做一条 30 秒商品视频,要么实拍、要么剪素材库,AI 只能做几秒补间;现在 2 分钟连续生成 + 关键帧控制,一条完整短视频可以在 AI 里跑完。
官方公众号评论区最高赞的问题不是"有多强",而是"多少钱"。工具能力的门槛在下降,成本的门槛还没降。
背景数据:可灵 2026 年 7 月完成约 30 亿美元独立融资,投后估值约 180 亿美元,对赌 5 年上市;按证券时报口径,Seedance 国内市占率超 80%。
六、当前价格坐标(统一折算到一条 8 秒片段)
各家报价口径不一(分辨率、是否含音频差异很大),以下为公开对比给出的归一化结果:
| 模型 | 归一化价格 | 备注 |
|---|---|---|
| Hailuo | 约 $0.08 | 最低档 |
| Wan 2.6 / Vidu Q3 | $0.07/秒 | 含音频 |
| Seedance 2.0 Fast | $0.09/秒 | 走量首选 |
| Veo 3.1 Lite | $0.05/秒 | 低价档 |
| Veo 3.1(4K) | 约 $4.80 | 最高档 |
价格跨度从 0.08 美元到 4.80 美元,同一个交付物差 60 倍。这就是为什么"先定交付规格,再选模型"必须成为流程的第一步。
七、选型建议
- 草稿阶段:Wan 3.0(6 credits 起,含原生音频),需求还在变时用它最省。
- 定稿阶段:按交付分辨率选,1080p 走生成 + 上采样,4K 直接生成。
- 长片阶段:可灵 4.0 的 10 张关键帧,是目前唯一能把"分镜"落地的能力。
- 批量阶段:Mirage Tesseract + OpenCut 这类免费/开源剪辑层,把成本压在生成这一环。
- 企业内容:优先试 Wan 3.0 文档模式,跳过脚本转分镜的人工环节。
参考来源
- Versely - AI video in October 2026:https://www.versely.studio/blog/state-of-ai-video-oct-2026
- Kenerate AI - Every Model by Maker:https://kenerateai.com/ai-video-models
- AIToolsRecap - Best AI Text to Video Tools in 2026:https://aitoolsrecap.com/Blog/best-ai-tools-text-to-video-2026
- Black Forest Labs:https://bfl.ai/