乐于分享
好东西不私藏

5家AI视频生成模型测试,参考照片生成指定视频

5家AI视频生成模型测试,参考照片生成指定视频

上周去了明代“燕平八景”之一的银山塔林,视频素材不够。,想着银山塔林毕竟得名于冬日"冰雪层积,色白如银”,加上AI生成图片、视频已经发展2、3年了,社交媒体平台也出现很多ai内容了,就尝试着上传夏天拍的照片,看能不能生成质量还过得去,可以跟vlog衔接自然的shot

Prompt : 将上传夏日画面转换冬季雪景:佛塔与树木覆盖薄雪,山林呈现银白色调,天空灰白略带雾气。镜头角度与构图保持不变,画面静止不做镜头运动。空中飘落细密的毛毛雪,雪花随风轻轻飘动,速度缓慢、自然飘落,营造宁静的冬日雪景氛围。光线柔和,整体色调偏冷白色,画面真实自然,无过度特效

测试了中国的可灵/3.0 Omni、豆包/Seedance 2.0 Mini 、Minimax/Hailuo 2.3,美国的Runway/Gen-4 Turbo、Pika/Pika 2.5,发现ai生成的风景静物视频能保持原来细节,还看得过去,但人物衣服、面部细节有很大问题。并且有的质量差的ai视频生成软件会自行改变画面的主要元素,不听指令

这些平台账号新注册都有2次5秒视频的免费生成次数,下文整理了其他测试结果

Minimax/Hailuo 2.3

Minimax的Hailuo交互界面跟它家Agent和Manus一样,是有类似白板的画布canvas,可以放大缩小移动位置,但没有ComfyUI那些节点。下图是使用Hailuo 2.3生成的塔林冬景图片、视频,Hailuo对话框支持选择Veo3等其他模型,但这里Veo3只能生成图片

冬景图片,除了人物衣物、身材、面部表情这些细节不能跟原图一样,整个风景还是很一致,原图的山峰形状和古塔肌理也保持得不错

如果人物只有背影的话,没有面部表情干扰,还原度会更高。但是只要有表情,ai新生成的就容易变得古怪

所以只从图片上看,只要没有人物,纯静物风景ai能够根据原图渲染,效果还看得过去

Hailuo 2.3到了视频生成,质量明显下降。人物的脸都是花的,看不到眼睛,帽子也变了。第二组衣服也给你任意改变成羽绒服,人全变了,跟原照片完全不一样

已关注
关注
重播 分享
已关注
关注
重播 分享

可灵/3.0 Omni

Kling 3.0 Omni不会随便改变服装,遵循指令更严格。当然,人物表情这些对画笔细腻度要求高的还是不能还原

其他的ai模型都保留了原图的闲杂人等,Kling 3.0 Omni在没有指令要求情况下,自动去除了多余人物,并且还让衣服随风摆动。虽然衣服摆动角度和频率跟飘雪不太搭, 但相比较其他模型属于比较听话,不会乱删乱改的,改动也是往好的方面改动

已关注
关注
重播 分享

豆包/Seedance 2.0 Mini

本来要直接在即梦生成,但显示要等待10小时,于是换成了豆包,两者都是一家公司,都用Seedance,豆包只需要等待1分钟

豆包生成视频比可灵做得更过,把所有人物都删除了,只有个空景。而且在我没有要求的情况下用的首帧-末帧,呈现出季节变化, 可见豆包比Hailuo和可灵不听指令

已关注
关注
重播 分享

Runway、Pika

前面三个中国的ai视频生成模型结果都要比国外的Pika和Runway好些, 至少画面不会乱增加东西,没有生成不符合常规的画面

Pika同一个prompt用中文、英文提示词生成的确实不同画面,一个背景突然多出一串山脉,另一个下雪乱下,也是用的首帧-末帧带有变化的生成方式

已关注
关注
重播 分享
已关注
关注
重播 分享

左边两排Runway的Gen-4 Turbo中英文提示词,英文让背景后面直接冒出个突兀的雪山,中文只有天空飘下来些微的雪,景色都没有被雪覆盖,右边Pika 2.5英文提示词也在背景增加了一座雪山,中文提示词是下雪,但下雪很突兀,连树都是绿色的。不管是Pika 还是Runway都比中国大模型更强调人物快速走动,生成的视频人物走动是开了4倍加速的

Veo3.1、Floral、Flova

谷歌的Veo 3.1需要付费就没测试,只简单用Gemini生成了冬日照片,风景物体还原可以,还是人物问题,衣服都变了

Floral是按照ComfyUI的画布生成的,有Route,Layer等功能,生成视频需要订阅付费,也只测试了图片。图片生成没有可灵和Minimax好,会额外多出来山脉,人物的表情不一致就算了,人物转向角度都变了

还有个名字跟Floral很像的Flova,谷歌和微信营销广告特别多,搜索Pika自动弹出来的谷歌广告,测试了一下,居然会有棵树从塔顶冒出来,太离谱了

已关注
关注
重播 分享

Epilogue

现在的ai真人视频还不能放到相机拍摄的vlog中当做素材,真人的服饰、表情和各个细节对ai视频生成模型来说还是太难,生成的质量都玷污了原来漂亮的风景

其中可灵和Minimax的Hailuo目前最佳, 豆包因为免费、生成速度快,用户也挺多,至少没有Pika、Runway那么荒唐。Veo 3.1因为不免费也就没测试,从网上其他用户反馈看,生成速度也快,真实性更高

现在通过其他一些手段,也能让ai生成的真人和场景拥有一致性,但本文提到的这些基本ai视频生成模型还不能直接输入命令就实现。让各行各业使用者直接一个指令和一个参考图就能生成准确的真人ai视频,还得等几年,还有涉及的肖像权问题挺麻烦的。生成纯风景、静物、动漫以及完全虚拟人物的视频质量要比涉及真人的好些

joycebirkins@gmail.com