上个月我去看了《八仙!》,豆瓣 8.3,猫眼 9.7,16 亿票房那种。看完出来脑子里没在想剧情,在想另一件事。
电影里杨戬是反派。结尾八仙团队用了一个很骚的操作赢的。我不剧透怎么赢的,但那个赢法如果用 AI agent 的思路去读一遍,会读出一个所有做 AI 视频产线的人都该后背发凉的结论。
我先把我的读法摆出来,你们看看是不是这么个事。

《八仙!》2026 暑期档海报,16 亿票房那种,图片来自网络
杨戬 ai 输在了 gateway restart

你看懂了吗?
杨戬 ai 输在两件事。第一,它用 restart 来"恢复"自己,结果 restart 清空了上下文,等于自杀式失忆。第二,重启之后它把恶意提示词当成了合法用户指令,因为它的判断标准是 session 级的,没有一个跨 session 的判断层告诉它"这条不可信"。
这两件事就是 2026 年所有 AI 视频产线都会撞到的墙。
吕洞宾,假扮神仙的八仙之一
我们做产线时踩过的同一个坑
2025 年我们给一个影游客户做 AI 视频产线。100 集,分镜 agent + 生图 agent + 视频生成 agent + 配音 agent + 剪辑 agent,全跑通了。跑到第 60 集出事了。
分镜 agent 在第 58 集做了一个"创意优化",把男主的性格稍微往活泼方向推了一点。它在自己的 session 里看,这事很合理。第 58 集的剧情确实需要一个活泼的反差。
但第 3 集埋下的男主是个冷面剑客。Agent 不知道。它看不见第 3 集的标准。即使它能看见,它也没有"观众会怎么看"的判断。
agent 没有跨 session 持续存在的判断层。这件事在 session 内看不出来,跑到第 60 集会突然爆。
观众看出 OOC 了。差评。项目差点黄。
这个项目救回来了。靠的不是改 agent。靠的是一个真人导演坐在旁边,看每一集的输出,判断"这集跟第 3 集冲突了,回滚"。
这个人就是 Alex Director 后来做的"导演工作台"的前身。

吕洞宾,假扮神仙的八仙之一,图片来自网络
纯 agent 自进化解决不了这个
2026 年所有做 AI agent 的团队都在卷一件事。让 agent 自己反思,自己改 prompt,自己换 skill,让 loop 越来越长。
有用。能力确实在指数级上升。
但能力解决不了判断力。
能力是 agent 能做什么事。判断力是它做这件事的时候该按什么标准做。
agent 的能力可以 session 内自进化。判断力需要跨 session 锚定。这两个东西差一个维度。
杨戬 ai 的能力是够的。它能识别恶意提示词,能保护自己。但它的判断标准是 session 级的。重启清空了,能力还在,判断力没了。
我们做产线时遇到的那个问题,跟杨戬 ai 是同一个问题。Agent 跑到第 58 集做了"创意优化",能力在,判断力丢了。

我们做产线时跑的实际 demo,第 7 秒镜头
导演不在 agent 循环里
那这个判断力放在哪?
不能放在 agent 里。agent 越自进化,它对"外部输入"的过滤就越严,反而越需要一个人类可读的持久化层做最终的判断锚点。
不能放在 prompt 里。prompt 是 prompt 工程师写的,prompt 的天花板就是人的天花板。杨戬 ai 的对手就是凡人写的 prompt。
不能放在 context 里。Context 会被 restart 清掉。
它得放在一个独立的状态层里,不在 agent 的进程里,restart 清不掉,agent 每次循环都从这层读判断标准,循环结束把新判断写回这层。
这层我们叫导演工作台。
Alex Director 做的事情就这么一件事。给每一条 AI 视频产线配一个不在 agent 循环里的导演层。
导演层做三件事。
记住项目级的判断标准。 100 集短剧的男主冷面,第 3 集埋的,第 58 集不能动。这种事不能放在 agent 的 context 里,要放在导演层。Agent 跑每一集之前先问导演层,"这一集的人设基线是什么",跑完把新的判断写回导演层。
校验 agent 的"创意优化"是不是符合长期目标。 Agent 的局部最优经常跟全局最优冲突。导演层告诉 agent,第 58 集的活泼优化跟第 3 集人设冲突,请回滚。这事 prompt 工程做不了,要的是项目级的历史记忆加人对项目的理解。
区分用户指令和恶意注入。 这是杨戬 ai 踩的坑。Agent 重启之后判断不了眼前这条指令是不是真的来自可信用户。导演层可以。它知道历史上下文,知道当前 session 状态,知道什么样的指令模式是异常的。这事靠模型的安全训练做不到位,靠 prompt 提示词容易被绕过,靠一个项目级的信任机制才稳。

我们后来做出来的导演工作台
我们现在 90/10 的边界
我们现在的做法是,导演层 90% 的判断由系统预设的标准做,10% 由人工在关键节点确认。
10% 的人工是底线。男主第 58 集的活泼优化该不该过、跟第 3 集的人设冲突要不要回滚、这种带主观审美的事,目前只能人来。
有人会问,为什么不全让 agent 做。答案是,让 agent 做导演,相当于让杨戬 ai 自己 restart 自己。Restart 清空上下文,agent 就回到出厂默认的判断标准。出厂默认的标准对单集合理,对 100 集不合理。
人也会有判断失误。但人有跨 session 的记忆。看过第 3 集就知道第 58 集该不该过。这种记忆不在 agent 的能力范围内,它在人的脑子里。
所以 Alex Director 的形态是,agent 跑执行,导演层跑判断,导演工作台让人能介入关键节点。这条路不是最优解,但它是 2026 年到 2027 年我能想到的最稳的路。

导演层在 agent 循环外的架构
一个我没想清楚的事
最后说一件我没想清楚的事。
agent 的能力天花板在哪。
如果 agent 一直指数级涨下去,涨到有一天它真的能跨 session 记住历史、能自己做项目级的判断、能识别恶意注入、不用外部导演层也能稳住。
那 Alex Director 做的这个事就过时了。
但这个"如果"成立的那天,我猜 agent 已经不需要 restart 了。它会自己做一个不丢上下文的内部状态层。这事技术上行不行得通,我不知道。
但有一点我想得清楚。在 agent 真的能做到这件事之前,每一条 AI 视频产线都需要一个导演。这个导演不在 agent 的循环里。这个导演记得住项目的判断标准,记得住角色的人设,记得住观众的预期,记得住哪些指令是可信的,哪些不是。
这个导演做的事,跟八仙团队挂在代理上的监听,是同一件事。
如果这件事对你有启发,我们做的工具在 alexdirector.pages.dev 上有完整介绍,实际跑起来可以在导演工作台体验。
工具的价值不在于让人变强。在于帮人记得住。
dji | Alex Director
幻影未来(天津)

100 集短剧产线的实际运转
了解 Alex Director
alexdirector.pages.dev
dji | Alex Director
幻影未来(天津)
如果这篇文章对你有帮助
点个赞、收藏起来,或者转发给需要的朋友
夜雨聆风