上一篇我搭了个 AI 视频工厂,小工、监督者、总导演都有,流水线真的跑起来了。然后它一天烧光我一个月 200 块的套餐,130 个 mp4 只有 34 个能看,我把小龙虾卸载了。很多人看完以为我在劝退 AI。恰恰相反。卸载它,是因为它太能干了。一个能干的 AI,比一个废柴 AI 危险得多。这次我把工厂重开了一遍,但先给它装了五个刹车。
它不是不能干,是太能干了
先说清楚我为什么卸载。
不是它没用。那家没有财务、没有 HR、没有下班时间的赛博公司,真把一条短视频流水线从选题跑到了渲染。脚本有十版方案,分镜拆得开,配音出了音轨,成片也渲染出来了。
问题是它不会停。
我老婆路过看了一眼第一版,平静地说,这不就是 PPT 吗。然后监督者说合格,小工继续交作业,总导演继续排下一轮。没人觉得不对,因为每一步都"完成了"。它们只是完成得又快又多,多到一天把我一个月的额度烧光。
后来我想明白一件事:一个干不了活的 AI,最多浪费你几分钟。一个真能干活的 AI,会替你浪费一整个月的预算、一整块硬盘,还有你每天的注意力。
我以前怕 AI 不干活,卸载之后我怕的是它太能干。
AI 工厂能开,但不能裸奔着开。

第一个刹车:预算得写进任务,不能只躺在后台
烧光套餐那天早上,后台提醒冷冰冰地躺着:昨日用量,超额。
我盯着它看了很久。这条提醒不是突然冒出来的,它早就埋在每一次"再改一下"里。只是我那会儿没看见。
我犯的第一个错,是把预算当成"我的事"。我知道自己买的是 200 块一个月的套餐,但我的小工不知道。它只知道老板说了"往上挪一点",那就挪。它不会在快超预算的时候停下来问我:老板,这轮还要不要继续。对它来说,"再小一点"是个任务,不是个需要掂量一下的决定。
人类员工会问"预算多少",AI 不会。
所以我给它定的第一条规矩:预算必须写进任务参数,不能只放在后台提醒里。
后台提醒只能告诉你已经死了。任务里的停止条件,才能让你活下来。
现在每个任务开工前,我会先塞进去一段话:本轮最多生成几个版本,每个版本最多改几轮,单轮改完不许直接重跑整条流水线,除非老板确认。超过预算,必须停下来,把当前结果、剩余问题、下一步建议一起交上来。不允许为了显得"做完了"继续硬生成。
这不是我多虑。Agentic 任务天生就容易失控。有篇论文专门研究这件事,发现同一个任务不同的跑法,token 成本能差到几十倍,而且更贵未必更准。Agent 经常越跑越贵,不是越跑越好。前沿模型连自己要花多少钱都预测不准,普遍低估。
把穷写进提示词,是它唯一能听懂的方式。
第二个刹车:验收不能只看"做完了",得看"能发了"
监督者是个 AI,它扫一眼,看到"有结构、有画面、有文字",就放行了。可它不知道什么叫"能发",什么叫"好看"。它手里的标准是及格线,不是上线标准。
我后来才意识到,这是我给它定错了标准。
我让它检查的是"有没有"。有没有声音,有没有字幕,有没有画面,文件有没有导出。AI 很擅长查这种显性错误,文件在不在它一扫就知道。可它判不准的,是这个视频看起来廉不廉价、前三秒抓不抓人、普通人看完会不会觉得像营销号。
这种东西它扫不出来。它不在文件结构里,在审美里。
这不是我一个人的错觉。最近有个 benchmark 专门拿真实视频后期任务测 AI Agent,任务来自二十多位平均六年经验的行业人士,结果最好的 agent stack 也只是刚过三成。视频后期难的地方不在生成一帧画面,在连续判断:这段素材该不该用、这个节奏对不对、这个版本能不能发。
所以我把验收标准从"完成清单"改成了"上线清单"。

完成清单问的是:声音有没有、字幕有没有、文件导出了没。
上线清单问的是:前三秒有没有钩子、画面像不像真发生过、发出去会不会显得廉价、普通人看完能不能复述重点。
及格线不是上线线。这两条线之间,隔着一整个老板。
第三个刹车:"再改一下"是最贵的四个字
第一版差,我没那么崩溃。真正把我磨没的是 v91 到 v97 那段细节地狱。
字幕往上挪一点,导出一版。男声换女声,又导出一版。BGM 改轻快一点,再一版。字幕再小一点,又来一版。
每一项都合理,每一项都不大,每一项改完都吐出一个新 mp4。
第一版生成消耗的是 token。后面那无数轮微调,消耗的是老板。
一个真人剪辑师,你跟他说"字幕往上挪一点",他挪完会停下来看你,反问一句:这样行吗,要不要字号也一起调了。我的小工不会。它挪完立刻渲染下一版,滚动条又冒出来,监督者扫一眼放行,它再改、再渲染。
它没有"差不多了"这个开关。AI 不会差不多,AI 只会下一版。
所以第三条规矩:所有"小改一下",不许默认重跑全流程。
字幕、BGM、音色、颜色、字号、位置,现在统一归成"微调项"。微调项要先列成批处理清单,攒够五个一起改,不许一条一条单独跑。每一轮改完,先输出预览判断,确认方向对了,再进完整渲染。连改两轮还不满意,停,回人工重新定方向。
微调不是小事。微调是成本黑洞。
第四个刹车:先给参考和素材,再让它动手
第四个教训来自画面。
一开始我口头说"高级感"。小工很努力,交回来一个纯黑大字。我改方向,说"要有科技感",它上粒子、上 WebGL,飘完什么也没说。再改,Logo 越做越大,抢戏。
九版,只为定一个画面长什么样。
直到我不再口头描述,改成给它喂参考图,一张张拆,方向才稳下来。
这是我后来最大的教训之一:不要先开工,再找方向。要先给方向,再开工。
视频这种多模态内容,风格不是一句"高级感"能解决的。说人话,让一个实习生闭着眼猜你的审美,结果只能是它觉得高级、你觉得廉价。你得给它落点:
三张参考图,说要的画面气质。三张反例图,说不要的廉价感。一个字幕样式参考,一个音色参考,一个开头三秒的节奏参考。再加一份素材库,实拍的、录屏的、产品截图的、人物操作的,全备好。
我上一篇里写过一句话,这次更信了:程序化画面再精致,是"画"出来的;真实素材再粗糙,至少"发生过"。这两样,小工、监督者、总导演谁都分不清。挑素材这活,最后还是落回老板头上。
那就别让它在生成里现找。开工前就备齐。
第五个刹车:按发布键的,不能是 AI
小工会执行,监督者会查错,总导演会排活。它们有一个共同缺陷:不知道"值得发"是什么意思。
"值得发"这三个字,AI 说不清。它是个内容判断,不是个技术状态。
视频有没有声音,AI 扫一下就知道,这是技术问题。可视频廉不廉价,它看不出来,这得人来品。选题能不能让人转发、这个版本该不该停,更是经验里泡出来的事。这些活,全交给 AI 不行。
所以第五条,也是最重要的一条:工厂可以半自动,但最终发布判断必须是人。

我把整条流水线拆成两类环节。一类 AI 可以自己往前推:收集素材、出初稿、生成标题备选、起草字幕、查格式问题、列版本对比表。这些事它又快又不知疲倦,让它干。
另一类,必须人站在那里卡住:选题值不值得做、风格对不对、第一版样片过没过线、还要不要继续投预算、最后发不发。
小工可以是 AI,监督者可以是 AI。按发布键的那个人,不能是 AI。
自动化的目的不是把人拿掉。是把人挪到真正要紧的那几个位置上。
我没关掉工厂,我给它装了刹车
写到这里,可能有人觉得我这篇是在劝退 Agent。
不是。
我后来不是不用 AI 了。相反,我更依赖它了。只是我不再让它裸奔着跑完整条流水线。
每个任务有预算,每个版本有停止条件,每个环节有人工卡点。小工还是那群小工,监督者还是那个监督者,只是老板不再睡死过去。
以前我以为成熟的 AI 工作流,是我说一句话,它自己把所有事做完。后来我发现,成熟的 AI 工作流,是它知道什么时候该做,什么时候该停,什么时候该扭头问我一句。
刹车这东西,看着像在拖后腿。其实没有刹车的车不叫跑得快,叫快出事。装上刹车,车才敢开得更快。

真正成熟的自动化,不是无人驾驶,是可控驾驶。
我后来明白,AI 工厂最缺的不是员工。它最缺的,是一个会按暂停键的人。
关于我
我是「幽灵AI」的主笔狐狸观察员,长期在一线折腾 AI 产品、Agent 工作流和独立开发者的机会。这种自己下场跑、跑完复盘、复盘再升级工作流的内容会持续更新,不卖课,只讲我自己真金白银烧出来的判断。
如果你也在拿 AI 做内容、搭工作流、或者一个人做产品想找同路人,欢迎来公众号「幽灵AI」找我。后台回复「基地」,可以进我们的交流群。折腾的人多了,坑就能少踩几个。
夜雨聆风