
其他领域我不敢说,但视频生成这块,字节绝对是妥妥的顶流。
如果追求高质量,比如电影级别质感或者长叙事需求,目前Seedance 2.5断档领先。
但回到量产的场景,比如短漫剧、电商主图视频、营销素材规模化生成,这些对成本更敏感的场景,那更需要一个性价比模型。
所以我花了两天时间,把Seedance 2.0 fast和MiniMax H3这两个性价比牌桌上的重量级选手拉到一起PK了下。
初窥门径
第一个case是一个茶馆场景的测试。
我让两个模型分别做一个茶馆老人倒茶的画面,主要考验模型对“凤凰三点头”这个动作的理解。
H3场景布置没问题,茶杯、茶水和局部动作都有,可惜有几个Bug。倒完第一杯茶后第三个茶杯自己满上了;第四个空杯从一开始就冒着热气。
Seedance 2.0 fast生成的视频老人、铜壶、桌椅和侧逆光都有,动作虽然不算教科书级准确,但物理逻辑都是对的,依次倒满前四个茶杯,拿起最后一个茶杯,镜头随之推近。
总的来说,第一个case两个模型完成得都还可以,尤其是水壶冒出的热气,很真实。但就物理规律遵循,我觉得Seedance 2.0 fast的完成度更好。
商品营销素材
七夕刚过,想必经典神仙水深受各位男同胞喜爱(可以不花心思盲送)。
这组case就是做一个高质感的广告宣传视频,参考图如下:

整体的运镜、光影细节、镜头推拉感提示词,我都是按照大片质感来设计的。
先看效果对比:
此视频为模型特效演示,与商品无关
左边H3的光带和反射都有,但部分瓶身变成了偏乳白的不透明效果,并且在第一次切换画面的时候,套装里的几个护肤品像参考图一样立起来了,看起来比较死板;反观右边的Seedance 2.0 fast,其他眼霜、面霜被中间的神仙水吸附到一起,产品排列更有纵深,暗调背景也更适配,没有抢掉产品的注意力。
这组我会把票投给Seedance 2.0 fast,因为它对广告的理解和细节处理更好。
人物画中画
这个case我设计了一个画中画的效果。
一个女孩按下拍立得的快门,把打印出来的相片放在显影盘内,让照片慢慢显形。接着镜头缓慢推进,照片中又出现开头的场景。
两组视频的对比如下:
H3在第4秒出现相片悬浮的问题,在显影盘内相片瞬间显性,过渡感不够强,而Seedance 2.0 fast是缓慢显形的,不过四周出现了斑驳瑕疵。
最后结尾我特意设计的画中画,比较考验模型对嵌套画面叙事逻辑的理解。很可惜H3最后只展示了静态的相片,而Seedance 2.0 fast则让人物动起来了,眼神深邃凝视着镜头。这才是我想要的循环。
反物理学
正确的见多了,反常识的咱们也来试试 
我的设想是,一个女生拿着水壶倒水,结果杯里的水反重力往天花板汇聚,形成一条水柱,美其名曰水天相接。
效果如下:
H3一开始杯中就有水,倒了水以后水平面变化不明显,后面的水柱有种固态感,不是我想要的液状柱体,Seedance 2.0 fast的水柱更真实一点。
最后在天花板形成的超大水球,里面包含人物的倒影,两个模型效果差不多,玻璃折射和液体质感有细微区别。
但总体而言,Seedance 2.0 fast生成的画面更有氛围感,营造出一种幽暗、神秘的氛围。
效果这块是仁者见仁智者见智,毕竟大家的关注点都不一样。大家可以把自己的想法留在评论区~
动画测试
这一轮我让两个模型做一个小动画。
动画情节梗概是:小牛采集了一箩筐胡萝卜放在桌子上,转身去整理草垛。兔子看到后偷了一根,结果被小牛发现了,但牛牛并没有责怪兔子,而是友好地分享更多的胡萝卜。
动画看起来简单,实际上很容易暴露模型有没有真正理解角色关系。
先看看生成的视频:
H3的风格饱和度更高,非常卡通化。但很可惜,最后牛牛和兔子坐下吃胡萝卜的时候,桌子突然消失;Seedance 2.0 fast的画风我更喜欢,质感非常好,并且全程基本没出现明显问题。
再深入对比会发现,两组卡通形象的表情有很大差异。H3的形象看着比较朴素单纯,但Seedance 2.0 fast的角色表情,看起来更戏剧化,有点像猫和老鼠的感觉。
做动画最重要的不是剧情精彩、动作华丽、关系链复杂,角色的面部表情细节才是整个动画中的精华。
这也是为什么猫和老鼠会成为绝世经典佳作的原因。
诺兰直呼内行
最近刚看完《奥德赛》,被电影美学所震撼。所以最后一组case,我想做一个类似诺兰风格的电影片段。
我给的任务,是历经多年漂泊的英雄,站在爱琴海悬崖上的残破石庙拱门下,远眺海平线。
H3背景里的蓝天、大海、断壁残垣建筑都很真实,海浪拍击着海岸。但在第8秒切换人物近景的时候,跳转得有点突然。
大家可以看看Seedance 2.0 fast,镜头推向人脸的时候是有一个过渡的,当眼泪从脸颊滑落的时候,缓缓地闭上眼,最后微微一笑。
这样处理在情感表达上可以表达很多细节,不禁让人产生联想,这也许是一个刚打完胜仗的勇士,或者是星球上最后一位幸存者。
写在最后
全部case测完,我们聊聊成本。
MiniMax H3(768P)的API单价0.5元/秒,比Seedance 2.0 fast的0.6元/秒稍低一点,看定价H3更划算。
但实际的使用成本不是这么算的。
AI视频生成绝对免不了抽卡,也就是你需要生成多少次才能得到一个可用的结果。
一个case如果跑一次就过,成本就是15秒×单价;如果跑三次才过,成本直接乘以3。
从这次6个case的实测来看,Seedance 2.0 fast的指令遵循率更高,基本不用二次抽卡,大部分可以直接用或者微调后用。
当然,以上抽卡率是基于6个case的样本估算,实际使用中不同场景的通过率会有差异。但指令遵循上的优势,可以让综合使用成本更低。
最后,说说不同场景下怎么选择模型。
如果追求电影级质感、长叙事、真人感,首选SOTA模型Seedance2.5。不用犹豫,出来的东西确实能打。影视级广告片、品牌TVC、精品短剧,该花的钱得花。
量产场景,追求画质和成本平衡,Seedance 2.0 fast综合最优。从这次实测来看,它在产品展示、人物叙事、动画风格上都有可用的表现,尤其在指令遵循和品牌调性还原上明显领先。
但耐不住H3开源了,且在特定场景下的静态材质渲染上有自己的优势,如果你的场景不复杂,H3可以考虑。
视频模型的进化速度确实超乎想象,往后看这场仗只会越打越凶。厂商卷得越狠,单价压得越低,出片越稳,最后受益的还是咱们。
期待下一轮旗舰迭代,Seedance 直接掀桌子。
本文发表于公众号【莫理】
▽▽▽
夜雨聆风