乐于分享
好东西不私藏

AI短视频工具:MoneyPrinterTurbo 上手前必读

AI短视频工具:MoneyPrinterTurbo 上手前必读

MoneyPrinterTurbo 是一款开源 AI 短视频生成工具。你给主题,它自动写脚本、匹配素材、合成配音字幕并输出高清短视频。

106.9k

GitHub Stars

v1.3.4

最新版本

15+

LLM 提供商。

 

图注:MoneyPrinterTurbo WebUI 主界面。

小白先看懂。

这是一个自动短视频流水线。输入主题后,它调用大模型写文案。接着从素材库或本地文件夹中匹配画面。最后配上语音、字幕和背景音乐,渲染成 9:16 或 16:9 的视频。

适合:批量生产短视频素材的自媒体运营。快速验证内容方向的小团队。有本地素材池需要自动混剪的创作者。愿意折腾本地部署的技术用户。

不适合:要求画面与脚本逐帧对应的品牌广告。没有 API Key 也不愿配置云端服务。对视频版权和素材一致性要求极高的商用项目。

核心限制:成片质量取决于大模型对主题的理解、素材库的画面匹配度,以及你对参数的调整。它不能替代专业剪辑。

前置条件。

本地部署需要 Python 3.11 或更高版本。支持 Windows 10、macOS 11.0+ 和主流 Linux。Windows 用户尤其注意:项目路径不要包含中文、空格或特殊字符,否则启动脚本和 ffmpeg 检测容易报错。

硬件参考。

 最低:4 核 CPU / 4 GB RAM / 无 GPU。

 推荐:6 到 8 核 CPU / 8 GB RAM / 4 GB 显存。

 理想:8 核及以上 / 16 GB RAM / 8 GB 显存。

 主要用云端大模型和在线素材时,CPU 与内存比 GPU 更重要。开启 Whisper 本地转录或批量生成时,GPU 会明显提速。

四种安装方式。

AI Agent 技能:让支持 Skill 文档的 Agent 加载 docs/skill/SKILL.md 并指定主题。Agent 会自动完成安装和生成。

Windows 一键包:从 GitHub Releases 下载解压,路径用英文短路径。先 update.bat 再 start.bat。启动后浏览器自动打开,空白则换 Chrome 或 Edge。

Docker 部署:用 docker-compose.release.yml 拉取 GHCR 预构建镜像。首次启动前把 config.example.toml 复制为 config.toml。WebUI 在 8501 端口,API 文档在 8080 端口。

手动部署:macOS / Linux 推荐 uv python install 3.11 后 uv sync --frozen。然后 sh webui.sh 启动界面,uv run python main.py 启动 API 服务。

Token 与成本。

项目代码不收钱,但生成视频时会调用外部服务。成本可以拆成三块。

大模型调用(最大变量)。

 默认 Provider 是 Moonshot / Kimi,用于写脚本和提炼关键词。你需要在 config.toml 填入 API Key。

 海外可选 OpenAI、Google Gemini、DeepSeek、Azure OpenAI、xAI Grok。

 国内可选阿里云通义千问、字节火山引擎、MiniMax、小米 MiMo。

 想零成本可配成本地 Ollama。代价是脚本质量和速度依赖你的硬件。

语音合成(可零成本)。

 默认 Edge TTS(WebUI 中显示为 Azure TTS V1)不需要 API Key

 海外可选 Azure TTS V2、ElevenLabs、Google Gemini。

 国内可选 SiliconFlow、小米 MiMo,也可自托管 Chatterbox。这些需要对应平台凭证。

素材、字幕与发布(按需付费)。

 默认素材源 Pexels / Pixabay / Coverr 提供免费 API Key,也可使用本地素材。

 字幕默认用 Edge TTS 时间戳,免费且无需 GPU。切换 Whisper 本地模型需要下载模型文件,但没有按次计费。

 可选 TwelveLabs 语义排序、Sonilo 背景音乐、Upload-Post 多平台发布,按对应平台价格计费。

注意

账单由你填写的 LLM / TTS / 素材提供商决定。批量生成前先确认账户余额和限速。

适用场景。

它是主题驱动的素材拼接工具,不是文生视频引擎。最匹配的场景如下。

批量选题测试:用默认 Edge TTS + Pexels 快速生成口播短视频,验证哪些主题有流量。

本地素材混剪:把会议、产品、课程片段自动拼接。画面可控,版权清晰。

多语言出海:同一主题生成中英文脚本与配音,适配不同平台。

接入自有产品:通过 REST API 把生成能力集成到自己的工具链。

不太适合的包括:人物口型同步、完全原创画面、脚本与画面强对应的广告片。这些需要文生视频或图生视频模型,而 MoneyPrinterTurbo 当前依赖素材库拼接。

社区反馈。

仓库 2024 年 3 月创建,MIT 协议。最新版本 v1.3.4 发布于 2026 年 8 月。GitHub Stars 为 106884。Forks 为 16215。Watchers 为 657。Open issues 仅 25 条。近期更新集中在 WebUI 改进、新增模型提供商和 Docker 镜像发布。

Issue 区暴露了几类高频问题,安装前建议有预期。

FIXWindows 路径与配置错误:项目路径含中文或空格、config.toml 解析失败、ffmpeg 检测不到。解决方式是用英文短路径,并按报错手动指定 ffmpeg_path。

FIX素材与脚本不匹配:素材库返回的画面与关键词相关度有限。建议开启 match_materials_to_script,或直接改用本地素材。

FIXAPI 404 / Provider 配置错:多数是因为 base_url 或模型 ID 填错。项目通过 OpenAI 兼容层接入多数服务,但不同平台的 endpoint 和模型名并不通用。

FIXWhisper 模型下载失败:国内或受限网络容易从 Hugging Face 下载失败。可手动下载后放到 ./models/whisper-large-v3。

FIX功能请求集中:社区在催更批量生成、参数记忆、文本/图像直接生成视频、更多模型提供商。v1.3.4 已加入任务管理和自定义 Whisper prompt。

总体来看,这是一个高星、低 issue、快迭代的项目。但上手曲线对非技术用户并不平缓。Windows 用户、无 API Key 用户、以及对成片一致性要求高的用户,都需要多一层准备。

结论:先问自己三个问题。

在 clone 仓库之前,建议先确认。

1. 我是否有至少一个 LLM API Key,或者愿意配置本地 Ollama?

2. 我接受素材库拼接的质量上限,还是需要逐帧可控的画面?

3. 我是否愿意处理 Windows 路径、ffmpeg、模型下载等环境细节?

三个答案都是“是”,MoneyPrinterTurbo 是一个值得本地部署的短视频自动化工具。只要有一个“否”,就建议先用在线封装版,或等一键包进一步降低门槛。

SOURCES

GitHub 仓库 harry0703/MoneyPrinterTurbo。

README.md 与安装说明。

config.example.toml。

pyproject.toml。

Releases v1.3.4。

Open Issues 抽样(2026 年 8 月)。