乐于分享
好东西不私藏

Wan3.0公测了,30秒时长和文档生视频这次最值得说

Wan3.0公测了,30秒时长和文档生视频这次最值得说

今天刷到消息,阿里万相的Wan3.0开公测了。、

从Wan1.0到现在,万相模型家族一共迭代了8个版本。我一直在跟这个系列,每次更新都会关注。

这次3.0版本有两个变化我觉得值得单独聊聊,一个是单次能生成30秒视频,另一个是能直接读文档来生成视频。其他方面的升级也有,但这两个最能改变实际使用时的感受。

先说时长。

之前用视频生成模型,单段大多在5到10秒,好一点的能到15秒。10秒能干什么?一个画面里发生一件事就结束了,镜头刚铺开就得收。

Wan3.0把单段拉到了30秒,实际用起来感受完全不一样。30秒可以讲一小段故事,人物走动、场景切换、情绪推进都能放进去,连续运镜和一镜到底这类镜头语言终于有施展的空间了。

Wan3.0还加了智能时长功能,你写提示词的时候它会根据内容推荐合适的时长。觉得30秒不够,还能用视频延长功能接着往下生成,故事走向和剧情都能继续发展。这两个搭配起来,从"拍一个镜头"变成了"讲一段故事",创作空间大了不少。

文档生视频这件事,我觉得比时长更值得说。

Wan3.0之前支持文本、图片、音频、视频四种输入,这些算是标配。这次它把输入范围扩展到了文档格式,doc、xls、ppt、pdf、txt、key、pages、numbers、md都行,最多传一个文件或链接,大小不超过100MB,页数不超过50页。

很多人手头最现成的素材就是文档和表格。产品介绍是ppt,业务汇报是excel,教学材料是pdf。以前要把这些东西变成视频,得先拆内容、写脚本、找素材、做动画,一套走下来少说半天。现在传上去配上提示词,模型直接帮你出教学课件、产品演示、动态图表或者业务汇报的视频。

背后是Wan3.0的提示词工程和指令遵循能力。模型能读懂各种格式的输入,按提示词调度素材和控制画面,把不同格式的信息串成连贯的视频。以前要人工拆解再重组的素材,现在模型帮你处理了。

画面真实感这块也得说,这是视频生成模型能不能当生产力工具的关键。画面再清晰,看着假也没法用。

Wan3.0在文生视频里着重做了人物。之前AI生成的人像有个通病,油腻,千篇一律,看多了像同一个人的不同造型。这次五官和皮肤细节刻画更细,情绪表达更自然克制,微表情和肢体动作之间有联动。群像场景也能分别呈现不同人物的情绪,不再是一堆脸挤在一个画面里。

一致性是生产力场景最在意的东西。全能参考任务中,Wan3.0能精准复刻参考素材的细节。比如角色,五官、发型发色、形体、服饰、配饰这些细粒度特征都能稳定保持,不会突然变一个人。道具也一样,多角度外观、硬件结构、Logo和材质细节不会乱变。这两个之外,场景里角色站位和机位视角的关系能准确处理,影视调性也能精准渲染,多种风格混着用不容易串味。

数字化信息的呈现也提了一档。图表、数据和界面内容的色彩搭配更和谐,信息呈现更流畅,不像以前那样一看就知道是AI做的。

视频编辑方面,Wan3.0能修改画面、剧情和台词。不过官方也承认,声音质感和文字准确度还有进步空间。这个态度我比较认可,知道哪里不够比把所有功能都说成完美要靠谱。

这些能力最终还是要回到实际场景里。影视创作可能是最先受益的,30秒时长加上真实场景还原和一致性,做短剧、MV、Vlog的创作者可以用更低成本完成作品。以前AI视频只能做几秒的特效片段,现在能撑起完整叙事了。

广告行业对质量和定制化的要求一直很高,家电、彩妆、汽车、快消这些行业,从产品展示到品牌叙事都能用Wan3.0做创意内容。设计创意和文旅传播也有用武之地,产品UI演示、数据可视化、城市形象片这些以前要花大量时间做动画或实地取景的活,现在成本能降下来不少。

最后说怎么用。Wan3.0现在在阿里云百炼、万镜一刻、万相官网、千问创作PC端、IF STUDIO和堆友开启公测,千问APP上是灰度开放。API价格方面,480P每秒0.3元,720P每秒0.6元,1080P每秒1.2元,接口近期全量开放。能不能真正进入日常创作流程,得用了才知道。

立即体验:

阿里云百炼:

https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/wan3.0-video

万镜一刻:

https://www.yikeai.com/

万相官网:

http://wanxiang.aliyun.com

千问创作PC端:

https://c.qianwen.com/

IF STUDIO:
https://ifs.iconfont.cn/
堆友:
https://d.design/