过去一年,AI 视频工具的热度几乎都集中在“文生视频”上:输入一句提示词,模型生成几秒钟画面。它们很惊艳,但也有一个明显问题——更像是在生成“单个镜头”,而不是在完成一支真正的视频。
真正的视频制作并不只是“生成画面”。它还包括选题研究、脚本写作、分镜设计、素材搜集、配音、字幕、剪辑、音乐、调色、转场和最终合成。换句话说,视频生产本质上是一条复杂流水线,而不是一个简单按钮。
OpenMontage 并不是另一个单纯的视频生成模型,而是一个开源的 Agentic 视频生产系统。你可以把它理解成:让 Claude Code、Cursor、Copilot、Windsurf、Codex 这类 AI 编程助手,变成一个会读文件、会调用工具、会跑代码、会做剪辑决策的“视频制作团队”。https://github.com/calesthio/OpenMontage

用户只需要用自然语言描述想做什么,比如“做一个关于黑洞形成的科普视频”,Agent 就会沿着一套生产流程往下走:先研究资料,再写脚本,再选择视觉风格,再生成或寻找素材,再配音、加字幕、剪辑,最后渲染成完整视频。
更重要的是,OpenMontage 想解决一个常见误区:很多所谓“免费 AI 视频”,本质上只是把几张静态图片做成 Ken Burns 式推拉动画,再加上旁白和字幕,看起来像视频,但并没有真正的运动素材。
OpenMontage 当然也可以做这种 image-based video,但它还提供另一条路线:用真实视频素材来剪辑。系统可以从 Archive.org、NASA、Wikimedia Commons,以及 Pexels、Unsplash、Pixabay 等免费或开放素材来源中建立素材库,通过语义检索找到真正的运动片段,然后把这些片段剪进时间线,合成为一支纪录片式视频。
这就让它和普通“图像动起来”的工具区别开来。它更像一个自动化剪辑师:不是凭空生成所有画面,而是在开放素材库中寻找合适镜头,把它们组织成一个有节奏、有结构、有叙事的视频。
OpenMontage 还有一个很实用的入口:从参考视频开始。很多时候,我们并不是不知道要做什么,而是已经看过一个喜欢的 YouTube Short、Reel、TikTok 或本地视频,希望“做一个类似的,但换成我的主题”。OpenMontage 可以分析参考视频的字幕、节奏、场景、关键帧和风格,然后给出 2 到 3 个不同方案:哪些地方保留参考视频的节奏和结构,哪些地方改成新的选题、视觉处理和叙事角度,预计会花多少钱,用当前工具最终大概能做到什么效果。
这比传统提示词工作流更接近真实制作。传统方式常常要求用户自己写出完美 prompt,但大多数人其实说不清“我想要什么风格”。参考视频相当于把审美和结构直接交给系统,让 Agent 从中提炼制作语言。
从工具栈看,OpenMontage 也很强调“零 API Key 起步”。比如配音可以用 Piper TTS,本地离线生成旁白;画面可以来自开放视频库和免费图库;合成可以用 Remotion 或 HyperFrames;后期处理依赖 FFmpeg;字幕系统则可以生成带词级时间轴的字幕。对于不想一上来就购买大量商业 API 的创作者,这一点很友好。
它的另一个特点是“工程化”。OpenMontage 不只是把工具串起来,而是引入了质量门槛、预算控制和决策日志。比如在正式渲染前,系统会检查方案是不是违背了交付承诺:如果用户要求“motion-led video”,但方案里 80% 都是静态图片,那就会被拦下来。渲染后,系统还会用 ffprobe 检查视频文件,抽取帧查看黑屏或叠字问题,分析音频是否静音或爆音,并确认字幕是否存在。
这其实体现了 AI Agent 产品的一个新方向:不是让模型一次性给出结果,而是让它沿着可检查、可恢复、可审计的流程完成任务。
官方案例
"SIGNAL FROM TOMORROW" — a cinematic sci-fi trailer fully produced through OpenMontage: concept, script, scene plan, Veo-generated motion clips, soundtrack, and Remotion composition.
"THE LAST BANANA" — a 60-second Pixar-style animated short about a lonely banana who finds friendship with a kiwi. 6 Kling v3-generated motion clips (via fal.ai), Google Chirp3-HD narration, royalty-free piano music, TikTok-style word-level captions, and Remotion composition. Total cost: $1.33.
"VOID — Neural Interface" — a product ad produced with just one API key (OpenAI). 4 AI-generated images (gpt-image-1), TTS narration, auto-sourced royalty-free music, word-level subtitles via WhisperX, and Remotion data visualizations. Total cost: $0.69. Zero manual asset work.
"Afternoon in Candyland" — a Ghibli-style anime animation. A little girl's whimsical afternoon adventure through candy gates, gumdrop rivers, and lollipop gardens. 12 FLUX-generated images with multi-image crossfade, cinematic camera motion (zoom, pan, Ken Burns), sparkle/petal/firefly particle overlays, and ambient music with auto-detected energy offset. Total cost: $0.15. No video generation, no manual editing.
"Mori no Seishin" — a Ghibli-style anime animation of a forest spirit's journey through ancient woods. 12 FLUX-generated images with parallax crossfade, drift and pan camera motion, firefly and petal particles, cinematic vignette lighting, and ambient forest soundtrack. Total cost: $0.15. Still images brought to life through Remotion's animation engine.
"Into the Abyss" — a deep ocean exploration rendered in anime style. Bioluminescent gardens, coral cathedrals, and creatures of light — 12 FLUX-generated images with sparkle and mist particle overlays, light-ray effects, smooth camera motion, and ambient oceanic soundtrack. Total cost: $0.15. Zero video generation APIs needed.
试用
安装

要求

生成计划

素材下载

最后视频

夜雨聆风