「工具越容易用,品味越值钱」
前几天有个读者给我发了个链接,说"明哥你看看这个开源项目"。我点开一看——ai-video-agent,一个开源的 AI 视频生成智能体。
说实话,我第一反应是"又一个 AI 视频工具"。毕竟我入坑就是从做 AI 视频开始的,2023 年那会儿拿 MidJourney 加 Gen2 拼了 693 张图、185 个镜头才剪出一支预告片。这两年 AI 视频工具多得我数不过来,从 Runway 到 Pika 到 Sora 到可灵,几乎每个月都有一个「颠覆行业」的产品出来。
但这个项目让我多看了两眼——不是因为功能多强大,而是它的设计思路踩中了我一直在说的 Loop Engineering。

它到底是什么
简单说,这是一个基于 Next.js 搭建的开源 AI 视频工作台。你把文字输进去,它自动帮你完成分镜、生图、配音、字幕,最后输出一条短视频。
两种模式:
如果你做过视频就知道,传统流程是:写脚本→画分镜→做素材→配音→剪辑→调色。每一步都要切不同的工具,改一个分镜可能整个流程重来。这个项目把全链路打通了,而且做得比我想的更细。
它支持对话式编辑——你说「第三个分镜改一下,换成这个描述」,它只改那个分镜,不用全部重跑。长任务还能断点续生成,中断了重启会保留之前生成的图片和音频,不浪费 API 额度。这一层的设计,说实话,比很多大公司的产品想得都细。
代码托管在 gitcc,MIT 协议开源,Docker 一键部署。如果你有技术基础,两小时就能搭起自己的视频生成服务。
用我的框架扒一扒
我习惯用自己那套 「工具 vs 品味」 的框架看所有 AI 产品,这次也不例外。
工具层面: 它做得相当不错。多模型兼容层、断点续生成、单镜重绘——这些都是实打实解决痛点的功能。特别是那个 Agent 自主任务规划,能自动识别用户意图,区分「新建视频」还是「修改分镜」,这比我见过的很多商业化产品都自然。
品味层面: 这才是关键。工具再好,最后输出的视频好不好看,取决于使用者的审美。它内置了三套视觉风格帮你降低入门门槛,但最终的上限还是在你自己的品味里。
「AI 负责提速,品味决定上限」
这个项目完美诠释了这一点。它把重复劳动剥离了,把创作空间留给了你。
再用我另一个框架——「AI = 管理镜片」——来分析一下这个工具的 AI 在什么层级。
它不需要你手写 Prompt(执行层),但需要你给出清晰的方向(策略层)——「我要做一个 XX 主题的科普视频」,而不是「帮我生成一个视频」。如果你能给它一个明确的目标,它跑出来的结果会远超那些只会说「随便做个视频」的人。这恰好就是我一直在说的:AI 用得好不好,跟你会不会管人是同一件事。
有意思的是,这个项目里 AI 的「管理」方式和我说的 Loop Engineering 的底层逻辑一致——你定义目标,它自动拆解任务,不需要你在执行层一件一件下指令。从 Prompt Engineering 到 Loop Engineering 的进化,在这个小项目里已经能看到雏形了。
到底谁应该用
说完了好的,说点实话。
我花了一个下午读了它的源码。架构确实清晰,Next.js 14 + Prisma + MySQL,统一封装了 OpenAI 兼容接口,绘图和 TTS 可以分开配置服务商。一个 API 挂了能自动降级跳过,不会中断整个流程。这比我想象的成熟。
但我也有两个顾虑。
顾虑一:重度依赖外部 API
绘图、大模型、TTS 全靠第三方接口。你的生成成本是浮动的,API 挂了你就用不了。如果能支持本地模型运行,我会更放心推荐给普通用户。不过对于技术团队来说,这反而是一个优势——可以灵活切换供应商,不被任何一家绑定。
顾虑二:部署门槛不低
虽然提供了 Docker 一键启动,但 MySQL、Prisma 迁移、环境变量配置这些东西,对没有技术背景的内容创作者来说,还是劝退的。所以这个项目真正适合的人群,不是「想轻松做视频的人」,而是有一定技术能力、想搭建自己视频生产流水线的人。
简单说:不是工具不好,是它的受众比想象中窄。它是一个极好的技术底座,但不是一个面向大众的消费产品。
说了这么多
总的来看,ai-video-agent 是一个完成度相当高的开源项目。它的设计思路,尤其是对话式编辑和断点续生成,确实是奔着解决实际问题去的。
但它的真正价值,可能不在「让每个人都能做视频」——因为做视频从来都不是工具问题,是审美问题、叙事问题、目标定义的问题。
工具的价值在于:当你已经有品味的时候,它能帮你把想法快速变成现实。
就像我当年做流浪地球预告片,如果有这个工具,可能不用花 5 个晚上拼 693 张图。但如果没有那 693 张图的审美训练,有工具也做不出那个效果。
「工具可以复制,品味不能。」
如果你觉得今天这篇有收获,欢迎 点赞、在看、转发 三连,我们下篇见。*
夜雨聆风