夜雨聆风学习资料网

ARTICLE · 1110135

我让10款AI帮我剪了条Vlog,表现让我惊讶...

我让10款AI帮我剪了条Vlog,表现让我惊讶...

先看这张图。

奶油色的点阵纸,白边照片,手写字体,邮票邮戳一样不少。这是我越南旅行 vlog 里的一页。它不是我剪的,是 AI 剪的。

而且剪出这一页的 AI ,只是这场比赛的参赛选手之一。

事情要从头说起。

上个月,我去越南加云南玩了八天:昆明出发,河口过关,老街进越南,河内、岘港、会安,一路玩到腿软。两个人的八天,我用影石 Luna Ultra 拍下了 620 多个文件,整整 26GB 。

回来打开文件夹的那一刻,我人傻了:全部预览一遍都要花半天,剪完?下辈子吧。

但我转念一想:现在 AI 都这么强了,凭什么不让它们替我剪?

说干就干。我把市面上主流的 10 款大模型全喊来了:腾讯混元 Hy4 、 Kimi K2.8 、 MiniMax M3 、豆包 2.1 Turbo 、 Kimi K3 、豆包 2.1 Pro 、 DeepSeek V4.1 Flash 、 ChatGPT-6 、 GLM 5.3 Flash 、 GLM 5.3 。

规则很简单,也很残忍:

同一场旅行,同一份 26GB 素材,同一份提示词:明亮、清透、轻微偏暖,要松弛感,先高光预览再出标题,夏日手帐风。全部使用各家的官方 Agent 工具,让它们开始剪辑。

那说到 AI 剪辑,是不是有很多小伙伴觉得就是使用咱们日常使用的 Pr 、剪映这类工具呢?

那其实 AI 剪视频跟人不一样:它们是写脚本,批量自动分析素材、生成字幕和手帐卡片,再一段一段渲染出来。

10 条片子看完,有惊艳,也有惊吓。

最终成绩单先放这儿:

排名模型得分一句话点评
🥇
GLM 5.3
9.1
不是 vlog ,是一本装订好的旅行杂志
🥈
GLM 5.3 Flash
8.8
提示词执行最准,声音处理全场最强
🥉
ChatGPT-6
8.6
最懂素材结构,把整本手帐做活了
4
DeepSeek V4.1 Flash
8.3
选片鬼才,配乐自己用代码合成
5
豆包 2.1 Pro
8.0
没有短板的六边形战士,但太稳了
6
Kimi K3
7.8
开场最美文案最绝,败给一个乱码
7
豆包 2.1 Turbo
6.5
全场最用力用错地方
8
MiniMax M3
6.2
克制真实,但声音轻得像蚊子
9
Kimi K2.8
6.0
审美在线,执行粗糙
10
腾讯混元 Hy4
4.0
交付都没完成,垫底

💀 第 10 名 腾讯混元 Hy4  | 4 分

四个字评价:「交付事故」

说实话,它的前半段没我想象的差:满屏电影感,平均 3 秒一个镜头,会安的灯笼、岘港的海岸线都知道放大展示,选片眼光在线。

我一度以为它要逆袭。

然后,我瞥了一眼播放器。

画面,停在 4 分 27 秒。音频,一路跑到 6 分 23 秒。

也就是说:最后将近两分钟,全是黑屏,只有 BGM 在孤独地响。

还没完。我翻了翻它的输出文件夹,一个 0 字节的导出失败文件,就那么大咧咧地躺着。

它翻车了,但它自己压根不知道——因为导出之后,它没有检查。

剪得好不好是一回事,文件能不能完整播放,是另一回事。

交付都没完成,神仙选片也救不了你。 4 分,垫底。

· · ·

🎨 第 9 名 Kimi K2.8  | 6 分

一个只管美、不管死活的艺术家

K2.8 的审美真没得黑:会安的黄墙、灯笼、夜市,被它做成一本英文旅行手帐。拍立得、胶带、撕纸边、小涂鸦全都有,还有英文注释,风格统一得像买来的。

但它有三个毛病,个个致命:

一,转场全靠闪白。动不动冒出一帧接近全白的画面——不像翻手帐,像屏幕坏了。

二,节奏慢到离谱。镜头时长中位数 11 秒,最长一段接近 40 秒。我要的是松弛感,不是 PPT 轮播。

三,最离谱的:我的行程有 8 天,它剪到第 7 天,直接剧终。最后一天呢?被它吃了。

风格成立,执行粗糙。 6 分。

· · ·

🤫 第 8 名 MiniMax M3  | 6.2 分

闷声干活的老实人,声音也是真的闷

M3 走极简路线:不搞花哨排版,只留高光预览、标题、日期卡、结尾卡。

真实是真的,偷懒也是真的——大量素材没有重新设计,竖屏照片直接怼进 16:9 画布,两边黑边宽得能再放一部电影。

最要命的是声音:综合响度只有-26.9 LUFS ,全场最轻,跟最响的差了约 15dB 。看它的片子,我的手指就没离开过音量键。

结尾还特别仓促:先黑屏近 8 秒,最后一句「把夏天装进手帐里」只停留 2 秒——话都没说完就散场了。

6.2 分,可惜了这份克制。

· · ·

🎬 第 7 名 豆包 2.1 Turbo  | 6.5 分

把力气全用错了地方的卷王

全场最卷,也最偏题。

青橙调、暗角、胶片颗粒,胶片感确实给你拉满了。可我的提示词白纸黑字写着:明亮、清透、轻微偏暖。

它交上来的,是一部偏暗偏冷的公路电影。

开场顺序也是反的:要求先预览再出标题,它上来就把标题怼你脸上。竖屏素材做了模糊背景填充,但两边有明显的涂抹感;响度-24.7 LUFS ,也偏轻。

但你真不能说它没本事, 72 个镜头,全部列成剪辑清单,一条不落;最后一天没素材,它还知道拿机舱照片和第一天的车站做首尾呼应。

能力有,方向偏。 6.5 分。

· · ·

✍️ 第 6 名 Kimi K3  | 7.8 分

文案封神,败给一个方块字

K3 的开场,是十款里最惊艳的:会安灯笼街、龙桥喷火、火车街,连续三个高光镜头甩完,标题卡压上来——「两个人的八天」,路线、纸飞机、邮戳、胶带,安排得明明白白。

更绝的是文案:

「离开岘港那天下雨了。」「夜市里的手作摊。」「有人在天上飞。」

这不像 AI 在介绍景点,这像一个刚旅行回来的朋友,在照片背后随手写的话。

我差点就宣布它提前毕业了。

直到我在第七天的路线图正中间,看到一个方框乱码。它想放个小飞机图标,字体不支持。就这一个方块,卡在片子最中间,想忽略都难。

离「可以直接发」就差最后一道质检,它没做。

7.8 分,一个方块字引发的败笔。

· · ·

🛡️ 第 5 名 豆包 2.1 Pro  | 8 分

六边形战士,但没有记忆点

先说清楚: Pro 的能力明显强于 Turbo 。该有的全有:开场预览、标题卡、日期卡、结尾卡;画面明亮,风格清新。

竖屏素材的处理甚至称得上聪明:不硬裁横屏,而是做成一张足够大的拍立得纸卡,放在柔和的虚化背景上——构图保住了,黑边也消失了。

它还把 Live Photo 里的动态内容提取出来,自己生成了三段原创配乐。

但看完整个片子,我愣了三秒:**有哪个画面,是我能记住的?**一幕都没有。

每一项都合格,每一项都差一口气——完成度很高,个性约等于无,一份标准答案。

对了,别再说豆包模型不行了:它只是稳得让你挑不出毛病,也夸不出花。

8 分。

· · ·

🎵 第 4 名 DeepSeek V4.1 Flash  | 8.3 分

选片鬼才,兼职程序员

DeepSeek 的选片,是这次最让我服的之一:铁路隧道里的剪影、暮色下的海边、深夜的教堂——每个镜头都精准踩在光线和构图最好的那一秒。

全片约 80 个镜头,平均 3.7 秒一个,快而不乱,全场看起来最爽快。

更离谱的是,它连 BGM 都是自己用代码合成的:木吉他、贝斯、沙锤,零外部采样,再把街市、海浪、火车的现场声混进去。响度-11.6 LUFS ,全场最响。

最后一天没素材,它没有拿别的日期糊弄,而是画了一张返程动车票——老街、河口、昆明南, C560 。

就这一张票:克制、聪明,还有点浪漫。

扣分项:手帐元素用得太少,很多细节要按暂停才看得见。

8.3 分。

· · ·

📖 第 3 名 ChatGPT-6  | 8.6 分

它把整本手帐「盘活」了

先交代: GPT-6 开的是弱思考档, Astra 的 Ultra 额度,实在烧不起。

即便如此,它依然是全场最懂素材结构的一个。这批照片里混着不少 Live Photo ,很多模型把它们当普通照片, GPT-6 把 12 张动态图全部提取出来,再加上 14 段视频。

接近 5 分钟的成片里,有 3 分 07 秒是真正在动的画面。

海浪在拍,锦鲤在游,街上的人和车一直在走。别的模型是让照片缓缓放大、假装在动;它是直接把整本手帐做活了。标题页也不是干巴巴的淡入,而是像翻开一本笔记本。

最后一天没素材,它做了一页「返程」,用时间轴标出老街、河口、昆明。

最离谱的是版权意识:音乐署名文案全给准备好了,直接复制进发布简介就能发。这觉悟,很多人类博主都没有。

扣分:声音偏轻,个别转场闪白。

8.6 分。

· · ·

📏 第 2 名 GLM 5.3 Flash  | 8.8 分

如果只看「听话程度」,它是第一

GLM 5.3 Flash 对提示词的执行,精确得像用尺子量过:画面明亮、清透、偏暖,一个字都没跑偏。

开篇预览结束,一张贴在纸面上的日本桥拍立得标题卡;每天一张日期卡,日期、星期、地点、天气全齐。

最绝的是旁边那条行程进度线,旅行走到哪一天,线路就亮到哪一天。

但它真正的杀手锏是声音:火车街那段,火车贴脸开过来的瞬间,背景音乐自动降到三成,让真实的火车呼啸当主角,现场声完整保留。从头到尾,用户不用碰一下音量键。

输在哪?版式太乖。全片基本都是单张拍立得,稳是稳,少了那种让人忍不住暂停截图的「哇」。

8.8 分,以微小差距屈居第二。

· · ·

🏆 第 1 名 GLM 5.3  | 9.1 分

它剪的不是 vlog ,是一本杂志

看它第一眼,我就知道这次冠军没了悬念。

它不像一条 vlog ,更像一本排版、印刷、装订完成的旅行杂志:奶油色点阵纸、白边照片、鼠尾草绿和珊瑚橘的胶带、邮票、邮戳、手写字体——所有元素都属于同一套视觉语言。

有的页面单张照片,有的两张错落拼贴;位置、倾斜角度、留白,全都设计过。每天的卡片,连星期、天气、温度都标了出来。

缺点也很直白:全片只用了约 30 张照片、 7 段视频,素材利用率全场倒数;个别竖排文字离边缘太近,差点被裁掉。

但综合视觉、声音、叙事、完成度来看——它就是最接近「专业作品」的那一条。 9.1 分,实至名归。

· · ·

💰 但是 冠军的账单 比你想象中烧钱

封神的代价,是钱包先阵亡

GLM 5.3 不具备视觉能力,分析素材时视觉接口频繁报错。它想了个狠招:自己写了个本地识别脚本。

聪明是真聪明,烧也是真烧——

这条 9.1 分的片子,烧掉了整整两个 5 小时额度。

对比一下:第二名 GLM 5.3 Flash ,只用了一个额度的 20%; GPT-6 弱思考,用了 50%。

所以这份榜单还有个隐藏款:性价比之王, GLM 5.3 Flash 。

· · ·

写在最后: 10 条片子看完,三点暴论

第一,模型们已经会「看懂」素材了。 GPT-6 知道 Live Photo 里藏着会动的画面;所有模型都发现我给的行程单和实际景点对不上——并且都自己纠正了。

第二,缺素材的时候,才见真功夫。最后一天没有拍摄素材:有的一剪到第 7 天直接跑路,有的拿机舱照片首尾呼应,有的画了张动车票,有的做了整页返程。没素材可用的时候,才是 AI 能力真正分层的地方。

第三,交完作业会不会回头检查,是分水岭。混元 4 那个 0 字节文件,就静静躺在文件夹里。当然,这些未必全是模型的锅, Agent 工具( Harness )也得背一半。

回到最初的问题: AI 现在能独立剪 vlog 吗?

实测答案:能。前几名已经做到「不用大改,直接能发」。

但 AI 剪辑真正的差距,早就不是会不会切镜头了——是审美统不统一,是素材有没有被真正读懂,

以及,它能不能意识到自己哪里没做好。

最后这三条,恰好也是人做内容最贵的东西。

相关学习资料