乐于分享
好东西不私藏

用AI为旅拍长视频写文案

用AI为旅拍长视频写文案

暑假带全家去南疆旅游,拍了很多视频素材,我把喀什的一日游整理成一个大概7分钟的Vlog,然后写具体的文案。

由于已经远离了文艺青年的年纪,文案写得很痛苦。

试了一下剪映的AI文案功能,出来的效果惨不忍睹。

主要问题在于AI无法吞下整个长视频。AI不知道上下文,只能根据片段场景写文案,那当然是不行的。

工作流

短期内,我们应该看不到能低成本吞下长视频的AI,换一种思路,让LLM回归老本行,先把视频变成文字描述,再让LLM根据文字描述写文案。

工作流

现在的LLM 上下文都高达1M Tokens,大概是50万汉字,已经是一本小说的容量,足够应付长视频了。

视频转图像

视频截屏不需要调用AI,只需要 opencv-python-headless ,叫AI写个程序抽帧即可。

截取图像的质量建议设置为很低,节省Tokens的消耗和处理时间。

以一个7分钟的视频为例,如果每2秒截一次屏,一共产生约210个图像。

图像转文字

用最便宜的多态LLM。我选的是小米的Mimo V2.5,价格和Deepseek Flash一样便宜,能力足够胜任这个任务。

如果不想手搓一个Agent,那就用python脚本调用Opencode(或其他agent),对每一个图像生成文字描述。比如下面这个截屏:生成的描述如下:

时间戳

34.0 s(取自文件名)

画面描述

一位戴米色渔夫帽、穿粉色T恤、背黑色双肩包的年轻女子侧身行走在狭窄巷道中,身后墙壁前摆放着多盆绿植,一辆黑色自行车停靠在墙边。画面底部出现白色中文字幕。

字幕

我们仍然连第一个打卡点都找不到

原视频的某些部分可能已经有文案,所以我特别让AI识别出字幕,为AI指明文案框架。AI一般倾向于保留已有的文案。

处理一个图像需要N秒,处理200多个图像岂不要等很久?因此,我的程序支持并发调用,同时调用M个Mimo V2.5处理,速度快M倍。

我用的是Opencode Go套餐,非常便宜,就算使劲蹬,处理完210个图像后,5小时使用进度条还是保持0%不动。

从文字描述生成文案

这是最关键的环节。

还是以上面的210个截屏描述为例,合并后约3.2万个字,这个上下文长度对AI压力不大,但比较考验文采。

我给的Prompt如下:

你是一位视频文案撰写者。请先读取视频的逐帧画面描述文件(output/wishes/combined.md),理解整个视频的内容脉络,然后为它撰写一份完整的视频文案。

视频中频繁出现的小女孩和少年男孩分别是我的女儿和儿子。

视频大概分为几个部分:开场白 -> 寻找昆仑塔拍摄机位 -> 在古丽的家观看表演 -> 网红高抛冲奶茶 -> 女儿喂鸽子 -> 豪华餐厅吃晚餐,女儿和儿子跳舞

特别注意转场的文案。

要求:

  • 主题思想:人不可能同时拥有青春和对青春的感悟
  • 文案风格:情感
  • 文案用途:生活Vlog
  • 文案节奏必须与画面描述的时间顺序呼应,标注大致对应的时间段
  • 输出格式:视频标题(可选多个备选)+ 正文/旁白文案,关键旁白要标注时间戳(MM:SS)

其中主题思想非常重要,这是灵魂,没有这个,AI通常会写出流水账,偶尔会天马行空让你苦笑不得。

另一个需要列明的是人物关系。上述例子中,Mimo V2.5识别出的是:

一位戴米色渔夫帽、穿粉色T恤、背黑色双肩包的年轻女子侧身行走在狭窄巷道中

AI不知道这个女子是我女儿,因此我要告诉它:“视频中频繁出现的小女孩和少年男孩分别是我的女儿和儿子”

模型选择

最后生成文案的关键环节,我尝试了国内3个顶尖模型(Kimi K3,Qwen 3.8 Max,GLM 5.2),外加梁圣的实力强劲、费用约等于无的Deepseek Flash。效果排名从好到坏大致如下:

GLM 5.2

文案非常贴合我给定的主题思想,很多金句可以直接使用:

优秀的转场

旧电视曾经播过别人的青春,老钟表曾走过别人的从前,

而她,正拥有着自己还浑然不觉的、最好的年纪。

喀什的夜,从一壶热茶和一张馕开始。

"爷爷的爷爷的爸爸的馕"——光这个店名,就压了五代人的光阴。

优秀的尾声

我忽然意识到——

他们正在经历的,是我永远回不去的时光。

此刻的每一个笑容、每一次旋转、每一阵大笑,

都是他们将来会怀念,却再也拍不出来的画面。

Kimi K3

Kimi之前的模型文采是最好的,作为国产最贵模型的K3,显然也不错。

K3的转场做得特别好,这也是我着重对AI提的要求,K3做得最好:

有些热闹会散场,但胃里的热气不会。

从古丽的家出来,古城的另一半,是用味道记住的。

古城的每一个转角,都像有人提前替你布置好了惊喜。

然后,我们在这条堆满旧时光的小巷里,停了下来。

结尾也不错,但是不如Deepseek Flash

所以我能做的,只是替他们把这一刻,好好地记下来。

06:42(黑屏字幕)

——等他们长大以后,慢慢看。

Deepseek V4 Flash

完美的结尾

很多年后,他们或许会忘了这一天。

没关系,我记得。

Qwen 3.8 Max

无视了我给的主题,全是流水账,相当于用更精简的语言描述了一次视频。我基本无采纳它的文案。

尽管有多个顶尖AI给的文案,最后还是花费了我一番脑力,把精华提取再糅合在一起,人的参与在现阶段还是少不了。

One More Thing

以上整个工作流我都写成了自动脚本程序,可用git clone: https://github.com/DominicHong/VideoScript.git

我用AI写程序 + 提示词 + 说明 一共只花了不到半小时。

而纯手工的这篇文章花了几个小时。

一方面,AI带来超乎想象的生产力提高;

另一方面,坚持古法写作的我,是否值得读者您的一点鼓励呢?

不敢奢望打赏,只是如果你也要注册Opencode Go的话,不妨用下面的链接:

https://opencode.ai/go?ref=3EJ2HVTNMK

你和我都会获赠Token额度。