做了一个AI漫剧工具后,发现最难的根本不是“生成视频”(完结)上篇,我们聊了AI漫剧生产流水线中的7个核心Agent,本质上就是:专业的事情,交给专业的Agent。做了一个AI漫剧工具后,发现最难的根本不是“生成视频”(上)中篇,我们继续往下拆,聊了这7个Agent背后的协作架构,以及真正落地时踩过的一些坑。说到底,就是解决一个问题:怎么让一群Agent,稳定地把事情做完。做了一个AI漫剧工具后,发现最难的根本不是“生成视频”(中)这一篇,我们聊两个更实际的问题:过程中人应该如何参与?以及,如果让我重新做一次,我会怎么做?打破“全自动”滤镜:让AI干苦力,让人做决策我们最开始的目标是:让AI自动生成漫剧(剧本丢进去,最后直接出来漫剧)。这个目标,跟大多数AI产品一样,光是听起来就觉得很牛逼。可是,真正做的时候才发现,这纯粹是技术视角的理想主义。真实的生产作业链根本不是:AI做 → 人看。而是极其繁琐的:AI做 → 人确认 → AI继续做 → 人修改 → AI重做 → AI质检 → 人最终确认。所以最后我们没有追求:100%自动化。而是追求:合理的人机协作。合理的人机协作合理分配:把“该交给谁的事情”分清楚既然放弃了“100%”自动化,那人就必须参与。核心解法就是把边界划清楚:AI负责“量”,人负责“判断”。🤖 AI 负责(重复、量大、规则明确的活)🧑💻 人工负责(需审美、要背锅的决策点)大规模阅读剧本剧本确认信息提取角色/场景/道具确认资产整理分镜审核Prompt生成Prompt优化批量生图/生视频最终审核真正的内容生产者,永远不希望:“AI替我决定一切。”他们真正想要的是:“AI把80%的重复劳动做掉,但重要的20%让我说了算。”所以,如果重新做一次,我会按4个阶段操盘回头看整个项目,我深刻体会到:AI产品不适合一上来就追求“大而全”。如果让我重新做一次,我会按照下面4个阶段推进。4个阶段第一阶段:先跑通最小闭环不要一开始就追求:一键生成100集。先把最小闭环跑通:1个剧本 → 1集 → 10个镜头。剧本能不能正确解析?资产能不能正常提取?角色能不能生成?分镜能不能拆?视频能不能生成?前后能不能串起来?以上这些问题没解决之前,谈100集没有任何意义。把链路跑通比什么都重要。第二阶段:死磕稳定性链路跑通之后,你会发现:单个Agent能跑,不代表系统能用。还需要重点解决:Agent输出格式、资产一致性、状态管理、失败重试、断点续跑等问题。这些东西听起来没有“AI生成视频”那么酷,对于用户来说甚至是无感的,但恰恰是这些东西,决定了系统能否进入生产阶段。因为一次生成成功不难,难的是连续生成100次、1000次,还能知道每一步出了什么问题。第三阶段:再提效率当系统稳定后,再考虑效率。比如:批量生成、并行任务、自动审核、Prompt模板等。这个阶段的目标也很明确:以前需要人一直盯着,现在让系统自己在后台跑。比如以前生成10个镜头,需要人一个个点击。现在可以直接提交任务,后台批量执行,人只需要在关键节点回来确认结果。这时候,AI才真正开始从“玩具”变成“生产力”。第四阶段:最后追求自动化到了这一步,才适合继续减少人工介入。比如:人确认剧本 → AI自动提取资产 → 自动生成 → 自动审核 → 异常回退 → 人处理异常 → AI继续执行最终形成一个真正意义上的人机协作闭环。但这里有一个很重要的前提:自动化建立在稳定性之上。否则,很容易出现一种非常尴尬的情况:看起来自动化程度很高,实际上失败率也很高。这样的“自动化”没有任何意义。做完这个项目,我把对Agent的认知推翻了以前,我理解的Agent:Agent = 一个会自己思考、自己调用工具的大模型。但做完AI漫剧工具后,我反而觉得:Agent只是一个执行单元。真正决定产品能力的是:Workflow+ State + Data + Tool + Feedback也就是:工作流 + 状态 + 数据 + 工具 + 反馈。工作流 + 状态 + 数据 + 工具 + 反馈7个Agent本身其实并没有那么重要,今天可以是7个,明天可能变成10个。甚至,基础模型能力一升级,可能压缩到2个就够了。但是,那些沉淀在底层的资产ID、角色设定、场景设定、分镜结构、任务状态、审核流、用户反馈、重试机制,这些才是一个AI生产系统真正的壁垒。AI漫剧真正的竞争,不是“生成一个更好的镜头”现在,单独生成一个漂亮镜头,已经没有那么稀奇了。真正难的是:谁能让1000个镜头稳定地属于同一部作品。角色能不能一致?场景能不能一致?剧情能不能一致?镜头能不能衔接?资产能不能复用?失败能不能恢复?修改能不能局部进行?这些才是决定AI漫剧能不能走向规模化生产的命门。这也是为什么最近的一些长篇影视生成研究,开始从“单镜头生成”进一步转向世界状态、跨镜头一致性、状态演化和自动验证。比如2026年发布的FilmWorld,就把小说到电影的生成拆成世界构建、状态演化、镜头规划、视觉生成和闭环验证等环节,本质上也是在解决一个问题:怎么让一个复杂的视觉世界,在长时间、多场景的生成过程中保持稳定。这和我们在AI漫剧产品里遇到的问题,其实非常像。总结:从“工具”到“流水线”最后,用一句话总结这次AI漫剧产品从0到1的经历:我们一开始想做的是一个“会生成视频的AI工具”,最后真正做出来的,其实是一条“让AI稳定生产内容的流水线”。而这可能也是我现在对Agent产品最直观的理解:Agent不是产品本身,让Agent稳定地完成一件复杂的事情,才是产品。至于AI漫剧的下一步,我觉得也会越来越有意思。当“生成”本身逐渐变成基础能力之后,真正值得做的,可能就不再只是怎么生成一个镜头,而是:怎么让AI真正理解一部作品,并且和人一起,把它持续做下去。这可能才是AI内容生产真正走向工业化之后,值得继续探索的事情。