最近我各平台的号全都被中式美学的AIGC占领了。
我先是在某音刷得很上瘾。但更让我没想到的是,老外们居然也很热衷于看这类视频。

评论区里除了惊叹于这种风格和炫酷效果之外,还有不少人在问用到的都是些什么模型。
看到这些,我不禁感慨:现在不仅是中式美学和文化的影响力在逐渐扩大,国内的各大视频模型也跟打了鸡血一样接连迭代升级,都挤进了全球第一梯队。
先是H3再是SD2.5,现在Wan3.0也横空出世,那它和其他模型相比又有什么值得说道说道的呢?
简单概括,第一大亮点就是Wan3.0现在成了继SD2.5后第二个拥有单段30秒生成视频的模型。
另一大升级是,Wan3.0如今真正实现了万物皆可生成视频:现有的视频模型大多仅支持以文字、图像、视频和音频作为输入。
而Wan3.0如今进一步支持将pdf、excel、ppt、markdown甚至是网页链接等作为输入参考。这真是我头一回在视频模型上看到这么多样的输入方式。
30秒单次生成视频+全模态输入的能力,也是让我的好奇心达到顶点。
于是我第一时间进行了体验。
这些天高强度用下来我想说Wan3在真人场景下的表现十分亮眼,配合上30s的一次成片无疑给了创作者更多的叙事发挥空间,多模态的输入方式或许也会成为未来模型进步和优化的方向。
那效果究竟如何?接下来我们就一起来看看吧。
原生30秒一次成片,更自由的叙事空间
看到30秒成片的能力我还挺惊讶的,毕竟这在当前主流的视频模型中都算得上是非常稀缺的。
一次生成视频的时间越长,就意味着人物变脸和模型漂移的风险越大。30秒的视频按24帧算就是720张图,而且不是720张独立的图,是720张连续的图。
所以更长的视频时间,一方面意味着对模型更大的考验,另一方面也意味着更完整的叙事和更大的创作自由度。
我们接下来看看实际效果究竟如何。
我先给了一个真人场景的任务,做一个清晨遛狗的30秒生活Vlog:
不得不说这个效果完全到了以假乱真的地步:从人物的五官、皮肤细节到狗的毛发,再到环境的光影和细节刻画。
我真以为自己在看油管的Vlog博主。
接下来再给Wan3安排一个更高难度、更复杂的任务:生成一支30秒、一镜到底的玩具世界巨型Boss 3D CG短片。
来看看它究竟能不能经受检验:
整体来看,全片的动作和特效都十分密集地呈现了,而且人物的服装、武器、脸部特征也保持了一致性,长镜头的连续性也表现得不错。
但这种复杂任务也容易暴露出一些逻辑缺陷,比如发射出去的炮弹飞翔的角度有些错误。
当30秒一键成片碰上这样复杂运镜、信息密集的指令时,一些细小的逻辑问题就难以避免。
这种时候就需要我们在可能出现逻辑问题的提示词上,更精细地打磨、约束,同时也要力求模型更强的理解能力。
在提示词上我的经验是要将优化重点放在动作拆解、角色与道具一致性、空间关系约束,以及分段生成和逐镜头检查上。
先保证基本逻辑准确,再逐步叠加复杂运镜和特效,才能进一步提升成片的稳定性。
精细的真实场景和精准的数字场景
大家还记得我做的第一个30秒真人Vlog视频吗,不得不说wan3的真人画面美感确实是惊艳到我了。
我就又往这个方向做了几个案例,大家一起看看效果:
其实这个案例我本来是想做一个时间静止的定格效果的。
但大家也都看到了,时间静止的时候,画面中能动的主体理应只有右边的女孩,可画面中的过山车还是会有轻微的移动,可能需要更精准的提示词来控制。
不过有一说一,在画面真实感和人物细节这方面,Wan3的表现也是真没得喷。
我们再来看一个:
这个案例就更精细了,做出来都让我怀疑是不是直接从哪个电影还是纪录片里面截取的。
头饰上的珍珠和戏服上的绸缎质感、老师傅的皱纹和手上的纹路,还有徒弟的戏妆、神态,所有细节几乎都真实得无可挑剔了。
再来一个节奏更快、要素更多的案例:
真人和虚拟动画融合的视频还是挺有意思的,有点像一个日式拉面的广告宣传片。
这种任务算是把模型整体的能力做一个比较全面的体现,可圈可点的地方不少。比如人物和食物的质感、镜头画面的切换和整体节奏的把控。
不过我感觉最后出炉的拉面还可以多加点汤,让整体看起来更有食欲。
除了真实场景的画面美感,Wan3.0在数字场景也有很值得唠一唠的地方。
相信大家多少都在生成视频中碰到过文字乱码、UI混乱这类情况。
Wan3.0这次也着重强调了它精准渲染数字化信息的能力,我们拿一个案例来看看:
这是一支展现多媒体UI的视频案例,我们可以看到整体的风格保持了很一致的液体玻璃形态。
在UI界面里,不仅每个按键的文字和图标都很稳定、没有出现乱码,界面下方的代码块也一直很精细,每个单词和符号都是准确无误的。
谁懂这对于我一个经常生成了一个效果很好的视频,但中间一定会出现文字乱码的人是多大的救赎!
全模态输入,万物皆可生成视频
其实相比于以上的内容,Wan3的这个亮点,更是让我期待值拉满:
从文本、图像、音频、视频的基础模态,首次拓展到各种文档形态和网页链接。它会读懂文档或者网页中的信息将其作为参考,以此来进行创作生成。
听起来完全是打破了现有视频模型的输入桎梏,拓展了视频生成的又一边界。
我先给了一份10页的虚构跑车产品的PDF,让它根据PDF内的信息,生成制作一支跑车发布短片,来看看真实效果是否能如同我期待的一样:
一份产品介绍PDF就能跑出这么一条宣传片,也确实有把我给到的的产品信息和跑车形态完整展现,整体运镜、画面和节奏也做得还不错。
接着我又给到他苹果官网的iPhone 17产品网页链接,让它根据这个生成一支产品宣传片:
效果距离苹果官方出品的广告还是有差距,但对于手机整体展示的效果也还过得去。
Wan3.0能打,但我有更多期待
看到这儿,相信大家能看出来Wan3.0在真人质感、光影、服装材质,还有UI里的文字和代码,完成度都很高。有些片段单独截出来看,我都很难信它们是我自己用AI生成的。
它很会做画面,但在复杂长视频的生成中也容易出现一些小的逻辑问题。
效果越复杂,人物、道具和空间关系就很可能出错,镜头越长,这些小问题也越容易积在一起。并且模型在碰上生成长视频或复杂任务时解析时间就会拉长不少。
现在我对于这个模型的期待也很具体:修复复杂任务中的逻辑漏洞,把多模态输入玩出更多花样。
如果能把这两件事落到实处,Wan3.0会成为一个上限更高的创作工具。
我是路人甲,前数据分析、产品人,现创业者。关注AIGC人工智能,分享实用的AI应用。让AI变成你触手可及的生产力。
夜雨聆风