ARTICLE · 977497
OpenMontage:把 AI 编程助手变成一整间视频制作工坊
今天给大家推荐的项目是 OpenMontage,它自称是第一个开源的「智能体视频生产系统」。你不需要打开剪辑软件,只要在 Claude Code、Cursor、Codex 这类 AI 编程助手里说一句「做一条 60 秒讲解神经网络的短片」,它就会顺着调研、写脚本、生成素材、剪辑、合成的完整流程把片子做出来。
它最大的不同在于不做单点生成,而是做整条流水线。市面上多数 AI 视频工具给你一段片段,OpenMontage 给你一套带审批、带成本记录、带自检的生产流程。对普通创作者来说,这意味着从「拿到一堆碎片再自己拼」变成「拿到一个可以继续改的项目」。
❝项目名称: OpenMontage
主要语言: Python、HTML、TypeScript
Stars: 53.1k
Forks: 6.6k
项目链接: https://github.com/calesthio/OpenMontage

做一条短片,为什么总是卡在中间
想过自己做一条科普短片吗?流程通常是:查资料、写脚本、找配音配乐画面,最后进剪辑软件对时间轴、打字幕、压视频。
问题不在某一步太难,而在于步骤太散。真正耗时间的是切换和返工:脚本改一句,配音要重录,画面要重排,字幕要重对。近两年的 AI 工具解决了「素材从哪来」,却没解决「素材怎么变成一条完整的片子」,你依然要自己当导演和质检。
OpenMontage 的思路是把导演流程写成文件,交给 AI 智能体去跑。根据官方 README,每条流水线都固定按 research → proposal → script → scene_plan → assets → edit → compose 推进,每个阶段配一份 Markdown「阶段导演技能」说明该怎么做。

十余条成品流水线,覆盖常见内容形态
README 列出的流水线有十余条,每条对应一种成品:动画讲解片、动态图形、数字人口播、电影感预告、长视频切片、纪录片式蒙太奇、屏幕演示、播客改视频、多语言配音与本地化等。
想做知识类内容,走 Animated Explainer; 手上有一段两小时直播,用 Clip Factory 批量切出可发的短片; 只想用真实影像不想用 AI 生成画面,走 Documentary Montage。
这条纪录片流水线值得单独说。官方明确区分了两种做法:一种是把静态图片做成运镜(很多「免费 AI 视频」其实只是这个),另一种是从 Pexels、Archive.org、NASA、Wikimedia 等免费与开放来源检索真实动态素材,语义排序后剪成时间轴再渲染。后者才是它强调的差异点。
零密钥也能出片,可选密钥换更多能力
这是它对普通用户最实际的一点:不配任何付费 API 也能跑通全流程。
官方说明 make setup 之后即可获得的免费能力包括:
旁白用 Piper TTS,本地离线合成; 素材来自 Archive.org、NASA、Wikimedia Commons 等开放档案; 合成用 Remotion(React 渲染)或 HyperFrames(HTML/CSS/GSAP 渲染); 后期用 FFmpeg 做编码、字幕烧入、音频混合; 字幕内置生成,带逐词时间轴。
如果你愿意接入密钥,能力会明显扩展:README 记录了 20 多个视频生成方案、15 个以上图像方案、10 个以上语音方案,涵盖 Kling、Veo、Runway、Seedance、FLUX、ElevenLabs 等。有 GPU 的话还能启用本地视频生成模型,把这部分成本降到零。
值得注意的是,README 中的成本数字来自作者自己的示例作品,例如一条 60 秒动画短片记为 1.33 美元。这是特定配置下的单次结果,不代表你的花费。
花钱之前先卡一道闸
AI 生成最让人不安的地方是「钱花出去了,东西不能用」。OpenMontage 在这件事上做了几层约束。
人工审批是强制的。 提案、脚本、分镜、素材、发布这几个节点都要你签字,检查点写入器会拒绝没有审批记录却标为完成的阶段。 渲染前有校验闸。 说好「动态为主」却有八成静态图,或渲染器族缺失,会被直接拦住,不浪费算力。 渲染后自查。 用 ffprobe 校验,抽四个位置的帧检查黑帧与错位叠加,分析音量是否静音或削波,核对字幕。自查不通过,片子不会交给你。 幻灯片风险评分。 从重复度、装饰性画面、运动感弱等六个维度打分,避免做出「会动的 PPT」。 预算控制。 支持预估、预留、对账三步,默认总预算上限 10 美元,单次操作超过 0.50 美元暂停确认。
配套还有一块本地看板 Backlot,把流水线状态、脚本页、分镜卡和每一笔花销显示出来,让你能看见智能体正在做什么,而不是只看聊天记录。

技术实现:把编排权交给智能体本身
它的核心在于一个「智能体优先」的架构:项目里没有代码编排器,你的 AI 编程助手就是编排器。
交互层是你已有的 AI 编程助手,通过 CLAUDE.md、CURSOR.md、COPILOT.md、CODEX.md等指令文件接入,都指向共享的AGENT_GUIDE.md。能力层是 tools/下 100 多个注册工具,按视频、音频、图形、增强、分析、数字人、字幕分类,注册表自动发现新工具。知识层分三级: tools/与pipeline_defs/说明「有什么」,skills/说明「该怎么用」,.agents/skills/提供外部技术知识包。Python 只负责提供工具和持久化,创作决策、编排逻辑、审查标准都放在可读的 YAML 清单与 Markdown 技能文件里,配 20 多份 JSON Schema 做契约校验。 渲染交给 Remotion 与 HyperFrames,运行时在提案阶段锁定,中途静默切换被视为治理违规。
这种组合的好处是可读可改:你不满意某个阶段的做法,改一个 Markdown 文件就行,不用读源码。代价是它依赖一个足够可靠的智能体,且需要本地环境齐备——README 要求 Python 3.10 及以上、FFmpeg、Node.js 18 及以上,加一个能读文件并执行代码的 AI 编程助手。

值不值得试
OpenMontage 最值得关注的不是接了多少模型,而是它把「制片流程」本身开源了:流水线清单、阶段技能、质量闸、决策日志都摆在明面上,可以逐条检查和修改。
它适合已经在用 AI 编程助手、又要持续产出视频的人——知识类创作者、做产品演示的团队、需要把长内容切成短片的运营。截至本次查询,仓库采用 AGPLv3 协议,最近一次提交在 2026 年 8 月 22 日,尚未发布正式 Release,社区 PR 合并活跃。
如果你只想快速拿一条 15 秒片段,它偏重了;但如果你想把「做视频」变成一条可复现、可审计、能反复跑的流程,这个项目值得花一晚上装起来试试。
项目地址:https://github.com/calesthio/OpenMontage
资料来源
GitHub Trending(Daily):https://github.com/trending 项目仓库:https://github.com/calesthio/OpenMontage 项目 README:https://github.com/calesthio/OpenMontage/blob/main/README.md GitHub API 仓库数据:https://api.github.com/repos/calesthio/OpenMontage 官方网站:https://www.openmontage.video/