暑假带全家去南疆旅游,拍了很多视频素材,我把喀什的一日游整理成一个大概7分钟的Vlog,然后写具体的文案。
由于已经远离了文艺青年的年纪,文案写得很痛苦。
试了一下剪映的AI文案功能,出来的效果惨不忍睹。
主要问题在于AI无法吞下整个长视频。AI不知道上下文,只能根据片段场景写文案,那当然是不行的。
工作流
短期内,我们应该看不到能低成本吞下长视频的AI,换一种思路,让LLM回归老本行,先把视频变成文字描述,再让LLM根据文字描述写文案。

现在的LLM 上下文都高达1M Tokens,大概是50万汉字,已经是一本小说的容量,足够应付长视频了。
视频转图像
视频截屏不需要调用AI,只需要 opencv-python-headless ,叫AI写个程序抽帧即可。
截取图像的质量建议设置为很低,节省Tokens的消耗和处理时间。
以一个7分钟的视频为例,如果每2秒截一次屏,一共产生约210个图像。
图像转文字
用最便宜的多态LLM。我选的是小米的Mimo V2.5,价格和Deepseek Flash一样便宜,能力足够胜任这个任务。
如果不想手搓一个Agent,那就用python脚本调用Opencode(或其他agent),对每一个图像生成文字描述。比如下面这个截屏:
生成的描述如下:
时间戳
34.0 s(取自文件名)
画面描述
一位戴米色渔夫帽、穿粉色T恤、背黑色双肩包的年轻女子侧身行走在狭窄巷道中,身后墙壁前摆放着多盆绿植,一辆黑色自行车停靠在墙边。画面底部出现白色中文字幕。
字幕
我们仍然连第一个打卡点都找不到
原视频的某些部分可能已经有文案,所以我特别让AI识别出字幕,为AI指明文案框架。AI一般倾向于保留已有的文案。
处理一个图像需要N秒,处理200多个图像岂不要等很久?因此,我的程序支持并发调用,同时调用M个Mimo V2.5处理,速度快M倍。
我用的是Opencode Go套餐,非常便宜,就算使劲蹬,处理完210个图像后,5小时使用进度条还是保持0%不动。
从文字描述生成文案
这是最关键的环节。
还是以上面的210个截屏描述为例,合并后约3.2万个字,这个上下文长度对AI压力不大,但比较考验文采。
我给的Prompt如下:
你是一位视频文案撰写者。请先读取视频的逐帧画面描述文件(output/wishes/combined.md),理解整个视频的内容脉络,然后为它撰写一份完整的视频文案。
视频中频繁出现的小女孩和少年男孩分别是我的女儿和儿子。
视频大概分为几个部分:开场白 -> 寻找昆仑塔拍摄机位 -> 在古丽的家观看表演 -> 网红高抛冲奶茶 -> 女儿喂鸽子 -> 豪华餐厅吃晚餐,女儿和儿子跳舞
特别注意转场的文案。
要求:
主题思想:人不可能同时拥有青春和对青春的感悟 文案风格:情感 文案用途:生活Vlog 文案节奏必须与画面描述的时间顺序呼应,标注大致对应的时间段 输出格式:视频标题(可选多个备选)+ 正文/旁白文案,关键旁白要标注时间戳(MM:SS)
其中主题思想非常重要,这是灵魂,没有这个,AI通常会写出流水账,偶尔会天马行空让你苦笑不得。
另一个需要列明的是人物关系。上述例子中,Mimo V2.5识别出的是:
一位戴米色渔夫帽、穿粉色T恤、背黑色双肩包的年轻女子侧身行走在狭窄巷道中
AI不知道这个女子是我女儿,因此我要告诉它:“视频中频繁出现的小女孩和少年男孩分别是我的女儿和儿子”
模型选择
最后生成文案的关键环节,我尝试了国内3个顶尖模型(Kimi K3,Qwen 3.8 Max,GLM 5.2),外加梁圣的实力强劲、费用约等于无的Deepseek Flash。效果排名从好到坏大致如下:
GLM 5.2
文案非常贴合我给定的主题思想,很多金句可以直接使用:
优秀的转场
旧电视曾经播过别人的青春,老钟表曾走过别人的从前,
而她,正拥有着自己还浑然不觉的、最好的年纪。
喀什的夜,从一壶热茶和一张馕开始。
"爷爷的爷爷的爸爸的馕"——光这个店名,就压了五代人的光阴。
优秀的尾声
我忽然意识到——
他们正在经历的,是我永远回不去的时光。
此刻的每一个笑容、每一次旋转、每一阵大笑,
都是他们将来会怀念,却再也拍不出来的画面。
Kimi K3
Kimi之前的模型文采是最好的,作为国产最贵模型的K3,显然也不错。
K3的转场做得特别好,这也是我着重对AI提的要求,K3做得最好:
有些热闹会散场,但胃里的热气不会。
从古丽的家出来,古城的另一半,是用味道记住的。
古城的每一个转角,都像有人提前替你布置好了惊喜。
然后,我们在这条堆满旧时光的小巷里,停了下来。
结尾也不错,但是不如Deepseek Flash
所以我能做的,只是替他们把这一刻,好好地记下来。
06:42(黑屏字幕)
——等他们长大以后,慢慢看。
Deepseek V4 Flash
完美的结尾
很多年后,他们或许会忘了这一天。
没关系,我记得。
Qwen 3.8 Max
无视了我给的主题,全是流水账,相当于用更精简的语言描述了一次视频。我基本无采纳它的文案。
尽管有多个顶尖AI给的文案,最后还是花费了我一番脑力,把精华提取再糅合在一起,人的参与在现阶段还是少不了。
One More Thing
以上整个工作流我都写成了自动脚本程序,可用git clone: https://github.com/DominicHong/VideoScript.git
我用AI写程序 + 提示词 + 说明 一共只花了不到半小时。
而纯手工的这篇文章花了几个小时。
一方面,AI带来超乎想象的生产力提高;
另一方面,坚持古法写作的我,是否值得读者您的一点鼓励呢?
不敢奢望打赏,只是如果你也要注册Opencode Go的话,不妨用下面的链接:
https://opencode.ai/go?ref=3EJ2HVTNMK
你和我都会获赠Token额度。
夜雨聆风