深度·观察

30秒能做什么?够泡一杯咖啡,够等一个红绿灯,够在电梯里和邻居寒暄两句。
但对于AI视频生成来说,30秒是一道分水岭。在此之前的所有AI视频模型,本质上都在做同一件事——生成一个镜头。
5秒也好,10秒也好,15秒也好,画面再精美,它也只是一个片段,一段动图,一个"看,我能动"的技术展示。
而阿里Wan3.0在8月6日开启公测时交出的答卷是:单次生成30秒视频,一镜到底,连贯叙事,角色一致,导演级运镜。
这意味着AI视频终于跨过了"会动"的阶段,进入了"会讲故事"的阶段。
Wan3.0到底能做什么?
先把功用说清楚。Wan3.0的核心能力可以概括为四个字:万、长、真、编。
Wan3.0 四大核心能力
万——万物皆可生视频。首次支持doc、xls、ppt、pdf、md等文档格式输入。上传一份产品PPT,配上提示词,直接生成一支完整的形象片。
文本、图片、音频、视频四种模态也全能作为参考素材。Wan3.0从"视频生成模型"跃迁为"信息表达载体"。
长——30秒一镜到底。单段30秒生成让叙事节奏游刃有余,连续运镜、蒙太奇叙事得以充分表达。
还支持智能时长推荐和视频延长功能,创意可以自然生长。
真——千人千面的真实感。人物五官与皮肤细节细腻刻画,微表情与肢体动作彼此联动,群像场景中不同人物呈现不同情绪。
角色、道具、场景在多镜头间高一致性保持,连续创作不再"跳戏"。
编——画面、剧情、台词皆可改。视频编辑能力大幅提升,支持修改已生成视频的画面内容、剧情走向和台词对白。不满意可以改,而不是推倒重来。

价格也足够有诚意——
480P 0.3元/秒
720P 0.6元/秒
1080P 1.2元/秒
一条30秒1080P视频,成本36元。对比传统拍摄一条宣传片动辄数万元的人力、场地、设备成本,这个价格意味着什么,每个做过内容的人心里都有数。
从5秒到30秒:一条进化暗线
Wan3.0不是凭空出现的。回溯这条产品线的发展轨迹,你会发现一条清晰的进化暗线——每一次迭代都在回答同一个问题:AI视频,到底能替代多少"人"的工作?
Wan 2.1
2025年2月开源。14B参数,支持文生视频和图生视频,5秒480P。
首个在VBench榜单超越Sora的开源模型。
回答的问题:AI能不能生成像样的视频?
能。
Wan 2.2
2025年7月。引入MoE混合专家架构,效率飞跃,消费级显卡可运行。
回答的问题:普通人能不能用得起?
能。
Wan 2.5
2025年9月。原生音画同步,单一管道同时处理视觉、语言和声音。
回答的问题:AI视频能不能自带声音?
能。
Wan 2.6
2025年12月。多镜头叙事、角色跨镜头一致性、15秒视频。
回答的问题:AI视频能不能讲一个完整的故事?
开始能了。
Wan 3.0
2026年8月公测。30秒一镜到底、文档直接转视频、千人千面真实感、视频编辑能力。
回答的问题:AI视频能不能成为生产力工具?
能了。

把五个版本连起来看,迭代逻辑一目了然:时长在拉长,模态在扩展,真实感在逼近现实,定位从"内容生成"升级为"生产力工具"。
每一步都不是炫技,而是在解决一个具体的"不能"——不能太短、不能太贵、不能有声音、不能保持角色一致、不能输入文档。
到现在,这些"不能"正在被逐个抹平。
"AI视频的进化史,就是一条不断消灭'但是'的路线图。Wan2.1说'我能生成视频',但只能5秒。
Wan3.0说'我能讲一个故事',这次没有'但是'了。"
对新媒体运营和短视频创作者,这意味着什么?
说完了技术,说说人。Wan3.0公测对三类创作者的意义截然不同。
对新媒体运营:过去做一支产品宣传片,流程是写脚本→找素材→剪辑→配音→审片,少则三天多则一周。现在上传一份产品PPT,配上提示词,30秒出片。
这意味着运营人员从"执行者"变成了"导演"——你不再需要会剪辑,但你需要会提需求。核心能力从"操作工具"转移到了"描述想法"。
对短视频创作者:Wan3.0最实际的意义是试错成本降到几乎为零。36元一条1080P视频,你可以一天生成20条不同风格的内容,测出哪条数据好就推哪条。
以前是"想好再做",现在是"做了再想"。内容生产的逻辑从"精打细算"变成了"海量试错、快速迭代"。
对AI视频工具的选型者:Wan3.0全系列开源(Apache 2.0协议),API价格行业最低档之一,公测覆盖阿里云百炼、万相官网、千问创作、堆友等六大平台。
如果你正在为团队评估AI视频工具,Wan3.0的出现改变了选型坐标系:开源意味着可私有化部署、数据不出域;低价意味着可规模化调用;30秒时长意味着够用——三个条件凑齐,很多团队的采购决策可以从"观望"推进到"试用"了。

"当一条视频的成本从'一个团队一周'变成'一个人一个下午',被改变的不是视频本身,而是谁有资格做视频。"
技术向前,人也得向前
当然,Wan3.0不是没有短板。官方自己也承认,声音质感和文字准确度方面仍有进步空间。
AI生成的视频在情绪的微妙层次、叙事的节奏呼吸感上,和真人拍摄仍有可感知的差距。
但这不影响一个事实:AI视频生成正在从"玩具"变成"工具",从"能看"变成"能用"。
每一次技术迭代,都会引发两种焦虑:一种叫"它会不会取代我",一种叫"别人都在用我是不是该学"。
对于新媒体从业者来说,正确的姿势不是焦虑,而是上手。
Wan3.0已经在六大平台开放公测,千问App灰度推送中。
注册一个账号,上传一份PPT,输入一段提示词,30秒后你会得到一条属于你的AI视频。
然后你就知道——它不会取代你,但会取代那个不用它的你。

"工具的进化从来不是为了让创作者消失,而是为了让创作者只剩创作本身。当执行不再是门槛,创意就成了唯一的护城河。"
写在最后
从Wan2.1到Wan3.0,一年半时间,五个版本。
每一次迭代看起来都是参数的优化、时长的增加、模态的扩展。
但如果把时间轴拉长,你会发现这其实是一条叙事的进化史——
5秒的时候,AI在说"我能动"。
15秒的时候,AI在说"我能连起来"。
30秒的时候,AI在说"我能讲一个故事"。
下一个版本它会说什么?也许是"我能讲你的故事"。
而到那时候,真正值钱的不是AI能生成什么,而是你能告诉它生成什么。

当生成不再是瓶颈,想象力就是唯一的生产力......
夜雨聆风