乐于分享
好东西不私藏

Wan3.0 公测!30 秒 + 文档直转视频,阿里把 AI 视频的战场换了

Wan3.0 公测!30 秒 + 文档直转视频,阿里把 AI 视频的战场换了

8 月 6 日晚间,阿里云官宣新一代视频生成模型 Wan3.0 开启公测。

阿里 Wan3.0 开启公测,单次 30 秒追平行业第一梯队,首创 PPT/PDF 直转视频,720P 仅 0.6 元 / 秒。不是画质天花板,但可能是最能干活的模型。


    30 秒原生直出:从 "生成一个镜头" 到 "讲完一段故事"

    单次生成 30 秒,这是 Wan3.0 最直观的升级。

    别小看这个数字。在此之前,可灵原生单段只有 10 秒,Google Veo3.1 单段 8 秒,能和它掰手腕的只有字节 Seedance2.5 的 30 秒原生直出。

    30 秒意味着什么?意味着 AI 视频第一次从 "生成一个镜头" 进化到了 "讲述一段完整的故事"。

    一镜到底、连续运镜、起承转合 —— 这些长镜头语言,在 10 秒以内是施展不开的。但 30 秒足够讲清楚一个产品卖点、一个科普知识点、或者一段剧情小短片。

    实测下来,30 秒的完成度比预期高。用《大鱼海棠》十周年的题材测了一段 "神之围楼→少女化大鱼→海天相接" 的一镜到底,镜头从围楼天井缓缓升起,少女接住海棠花纵身跃入夜空化作红色大鱼,穿过云层、游过海天相接、潜入深蓝海面收尾。

    运镜自然流畅,人物形象保持一致,30 秒里故事的起承转合完整走完。

    唯一的小瑕疵在变身瞬间,人鱼形体之间少了一两帧明确的因果过渡。但瑕不掩瑜,"30 秒叙事" 这个卖点是立住了。

    此外,Wan3.0 还支持智能时长推—— 不指定总时长时,模型会根据提示词内容自动判断最佳时长。配合视频扩展功能,理论上可以拼出更长的成片。


    文档直转视频:阿里把 "生产力" 场景捅破了

    如果说 30 秒是追平,那文档转视频就是超车。

    Wan3.0 在文本、图片、音频、视频四种基础模态之外,首次支持 doc、xls、ppt、pdf、md 等文档格式输入,甚至支持网页链接。官方口号很嚣张:"万物皆可生视频"。

    这在全行业是独一份的。

    限制条件: 单个文件≤100MB、≤50 页。这个限制说实话不算宽,但方向是对的 —— 办公素材直接变成视频,正是所有人都在等的 "生产力" 场景。

    实测了一下,用一份 8 页的虚拟产品 PPT(AR 智能眼镜 "NOVA 智见")上传,让 Wan3.0 做成 30 秒产品介绍视频。

    链路真的跑通了。Wan3.0 从 PPT 里读懂了核心卖点:45g 轻量化、12 小时续航、55° 大视场角逐条上屏,结尾的品牌 Slogan 一字不差。

    不足也很明显:它把 "产品介绍视频" 理解成了电影感广告片,而不是 PPT 页面切换;产品外观在不同镜头间有明显漂移;跑步场景的人物还有轻微残影。

    但作为 "文字→PPT→视频" 一键成片的第一版,卖点没瞎编、数据对得上、文字全正确 —— 这条差异化链路,已经具备真实可用性。

    对从业者来说,这意味着什么? 意味着课件动画、产品演示、会议汇报、教学视频这些之前需要专业剪辑的场景,门槛被大幅拉低了。


    性价比打法:价格战打到了新维度

    Wan3.0 的定价走的是性价比路线。

    480P/720P/1080P 的 API 价格分别为0.3/0.6/1.2 元 / 秒。30 秒的 1080P 成片大约 36 元一条。

    对比一下:

    • 上一代 Wan2.7 的 1080P 是 1 元 / 秒,Wan3.0 反而涨了 0.2 元

    • 但横向对比可灵、即梦的订阅价,仍算克制

    • 720P 0.6 元 / 秒,约为主流模型六折

    阿里的策略很清楚:不在画质上死磕天花板,而是用性价比把使用门槛打下来,让更多人用得起、用得频繁。

    这和阿里云一贯的打法一致 —— 先把规模做起来,再通过规模效应降低成本。

    对中小团队和人创作者来说, 一条 30 秒的 720P 视频,成本 18 元。如果是做自媒体内容、产品演示、教学课件,这个成本完全可控。对比雇剪辑或者用订阅制竞品,性价比优势明显。

    当然,API 目前还在公测阶段,接口将于近期全量开放。正式商用后的价格是否会调整,还需要观察。


    不是画质天花板,但可能是最能干活的模型

    把所有测试摆在一起,Wan3.0 的强项和弱项都很清楚。

    强的是 "干活" 的能力:

    • 30 秒长叙事能完整讲完故事

    • 中文文字渲染稳定得超出预期(官方自认的短板反而没掉链子)

    • 文档转视频这条全行业独有的链路真的能用

    • 人物演技不再是木偶式表演,"笑着流泪" 的情绪递进处理得相当高级

    • 多风格渲染不串味,浮世绘和赛博朋克都立住了

    弱的是 "当世界模拟器" 的能力:

    • 精细的道具会锁不住形,表壳会变色、眼镜会换造型

    • 多机位物理一致性还是中间态,四视角做不到严格同步

    • 声音质感和文字准确度仍有进步空间(官方原话)

    说白了,Wan3.0 选的不是 "最强" 路线,而是 "最能干活" 路线。 这在 "刷分炫技" 渐渐退潮、竞争转向生产流程嵌入的当下,反而可能是最务实的策略。


    结语

    行业的竞争逻辑正在变。从 "谁的画质更好" 到 "谁更能融入工作流",从 "技术炫技" 到 "生产力工具"—— 这个转向,阿里比谁都清楚。

    Wan3.0 不是终点,而是一个信号:AI 视频的下半场,比的不只是谁生成得更逼真,而是谁能让更多人、在更多场景里,真正用起来。

    聚焦AIGC前沿,为你赋能漫剧创作风向

    洞见行业未来机遇;与万千创作者同行

    一起抢占AIGC漫剧时代先机

    作为专注内容产业深度报道的观察者

    我们持续追踪漫剧赛道的政策演变与生态变革