抖音上祁博士的数字人Agent一天卖50万。开源方案Pixelle-Video,22K Star,从写脚本到配图到语音到合成,一条龙自动出片。本文从安装到出片全流程实测。
抖音上有个叫祁博士的号,靠一套数字人 Agent 系统,一天能卖 50 万。
当我刷到的时候,脑子里就一个念头:这玩意,开源方案肯定有吧?
还真有。而且已经不是"有个 Demo 能跑"的阶段了——Pixelle-Video,GitHub 22K star,Apache 2.0 协议,从写脚本到加 BGM 到出片,全自动。输入一个主题,它能帮你走完短视频生产的整条流水线。
这篇文章带你从零开始,在自己电脑上把这条流水线跑通。
🔍 它到底能做什么
一句话:你给它一个主题,它给你一个成品短视频。
不只是"生成一段画面配上音乐"那种。Pixelle-Video 的流水线分了四步,每一步都可控、可换、可调:
文案生成 → LLM 根据主题写解说词。你可以用通义千问、GPT-4o、DeepSeek,或者本地跑 Ollama,完全免费。也可以跳过 AI,直接贴你自己的脚本文案。
配图规划 → 把文案拆成逐句分镜,每句话自动配图。支持 ComfyUI 本地出图、RunningHub 云端出图,或者直接调 DashScope/Seedream/Kling 这些模型 API 出图或出视频。配图尺寸、风格、提示词前缀全可以调。
语音合成 → Edge-TTS(免费)、Index-TTS,支持上传参考音频做声音克隆。多语言,有预览功能,不满意可以换。
视频合成 → 把画面、语音、字幕、BGM 拼成成品。模板系统支持静态文字模板、图片背景模板、视频背景模板。输出横屏竖屏方形全支持。
这套流水线不是"一键出片然后听天由命"。每个环节都有参数可以调,从 LLM 模型选型到 TTS 音色到画面分辨率——你知道每一步在干什么,也能控制每一步怎么做。
📦 安装:Windows 一键包 vs 源码部署
这是小白最关心的一步。Pixelle-Video 给了两条路。
方案一:Windows 一键整合包(推荐新手)
去 GitHub Releases 页面下载最新整合包,解压,双击 start.bat。浏览器自动打开 http://localhost:8501。不需要装 Python,不需要装 ffmpeg,不需要配环境变量。
然后只做一件事:在 Web 界面的「系统配置」里填 API Key。至少配一个 LLM(比如通义千问的 API Key,阿里云百炼平台免费申请),配一个图像生成方式(ComfyUI 本地地址或者 API 模型)。
就这两步。配完就能开始生成。
方案二:源码安装(macOS / Linux / 喜欢折腾的用户)
# 1. 装 uv(Python 包管理器)
# 去 https://docs.astral.sh/uv/getting-started/installation/ 按你的系统选
# 2. 装 ffmpeg
# macOS: brew install ffmpeg
# Ubuntu: sudo apt install ffmpeg
# 3. 克隆项目
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
# 4. 启动
uv run streamlit run web/app.py
浏览器自动打开 http://localhost:8501。后面的配置和 Windows 一样。
我自己在 Linux 上跑了一遍,从 clone 到看到 Web 界面,不到 3 分钟。uv 会自动处理所有 Python 依赖,ffmpeg 系统一般都有。
⚙️ 配置:三个必须搞懂的设置
打开 Web 界面后,左边是内容输入,中间是语音和视觉设置,右边是生成按钮和预览。但我建议先不急着生成——先把「系统配置」里的三个东西搞清楚。
① LLM 配置——决定文案质量
这里决定了谁帮你写脚本。选项很多:通义千问(便宜,中文好)、GPT-4o(贵但质量高)、DeepSeek(性价比高)、Ollama(本地跑,完全免费)。
我的建议:先用通义千问跑通流程,成本几乎为零。等你会调参数了,再上更强的模型。
② ComfyUI / RunningHub——决定画面质量
这是整个系统最核心的地方。Pixelle-Video 本身不做图像生成,它调度 ComfyUI 工作流或 API 模型来出图。
如果你有显卡(8G 显存以上),强烈建议本地部署 ComfyUI。配上 image_flux.json 这样的工作流,画质完全不输付费工具。没有显卡?用 RunningHub 云端——需要 API Key,按量付费,但不用自己搭 ComfyUI。
③ API 媒体模型——直连供应商
2026 年 6 月刚更新的功能。可以不走 ComfyUI,直接调模型供应商的 API 出图或出视频。支持 OpenAI/GPT Image、DashScope/Wan/HappyHorse、Seedream/Seedance、Kling AI。
配置里还能设本地代理(http://127.0.0.1:9090),解决网络问题。
一个关键认知:Pixelle-Video 不是"又一个视频生成工具"。它是一个编排层——把 LLM、ComfyUI、TTS、视频合成这些原子能力串成一个可定制的流水线。你可以换 LLM、换出图方式、换 TTS 引擎、换视频模板,但流水线结构不变。
🔥 实操案例:做一个知识科普短视频
说了一堆配置,不如跑一个真实案例。我选了一个很常见的场景:做一个 60 秒的历史知识短视频,主题是「为什么古代中国的航海技术领先世界但最终没有开启大航海时代」。
第一步:输入主题,生成文案
在左侧栏输入主题,LLM 选通义千问。点生成。大概 10 秒,文案出来了——5 段话,每段 15-20 秒的解说量。质量不算惊艳,但结构完整,有引入、有论据、有结论。如果觉得不够好,换个 LLM 重新生成,或者直接手动改。
第二步:配图风格
中间栏选 ComfyUI 工作流 image_flux.json。提示词前缀我写了:Chinese ink painting style, historical documentary look, warm tones。
图像尺寸 1024×1024。视频模板选 image_default.html。
第三步:语音合成
TTS 选 Edge-TTS,中文女声。点预览听了一下,自然度还行——不像真人但不像机器人。如果你有自己的声音素材,可以上传做声音克隆,效果会好很多。
第四步:BGM
Pixelle-Video 内置了几首背景音乐。我用了一首偏沉稳的,符合历史主题。
第五步:点击生成
系统开始跑。文案 → 6 张配图(每句话一张)→ 语音合成 → 视频合成。整个过程大约 4 分钟(我用的 ComfyUI 本地 + 3060 显卡)。生成完自动预览。
坦白说,第一版效果一般。配图风格偏暗,语音节奏有点赶。但问题不在工具——在我没调参数。
于是我改了三个东西:提示词前缀加上了 bright, high contrast、把 LLM 换成 GPT-4o 重新生成文案(更短句、更口语化)、TTS 换了一个更慢的语速。第二版效果明显好了很多——画面明亮,解说节奏舒服,像一条能做号的视频。
这个小实验的收获:Pixelle-Video 不是"输入主题→出神片"的黑箱。它更像一套专业的视频制作工具链,你越懂调参数,出片质量越高。但即使完全不懂,默认配置出来的东西也勉强能发——比你自己从零开始做快 10 倍。
🆕 三个值得单说的新功能
Pixelle-Video 更新很勤快。最近半年加了几个重要的模块,不只是"优化体验",而是拓展了整个工具的边界。
数字人口播
2026 年 1 月加的。如果你需要一个"人"对着镜头讲话——口播类短视频的核心形态——这个模块提供了一个数字人方案。配合多语言 TTS,可以做韩语、日语、英语的口播。虽然目前还没到"以假乱真"的程度,但作为内容生产工具已经很实用了。
动作迁移
上传一段参考视频和一张图片,系统把视频里的动作迁移到图片上。比如上传一段跳舞的视频和一张卡通猫的图——出来的就是一只跳舞的卡通猫。这个功能目前更多是演示性质,但方向很明确:未来可以让你的数字人做任何你指定的动作。
直连 API 模型
2026 年 6 月刚加的。在 WebUI 里直接配 DashScope/Seedance/Kling 等 API。之前要走 ComfyUI 才能调这些模型,现在可以直接配。对有 API Key 的用户来说,少了一层中间环节。
这三个功能加在一起,Pixelle-Video 的定位已经从"自动剪视频的工具"变成了"短视频内容工厂"。你可以做纯图文视频、数字人口播、动作迁移创意视频——全在一个工具里。
💰 成本:从零元到百元,丰俭由人
这是我觉得 Pixelle-Video 最实在的地方——它不逼你花钱。
完全免费方案:Ollama(本地 LLM)+ ComfyUI 本地部署 + Edge-TTS(免费 TTS)= 0 元/月。前提是你有显卡,愿意花时间搭 ComfyUI。
推荐方案:通义千问 API(约 0.5 元/千 token)+ ComfyUI 本地 + Edge-TTS = 每月几块钱。这是我最推荐的组合——文案质量比 Ollama 好,成本几乎为零。
追求质量方案:GPT-4o + ComfyUI 本地/云端 + Index-TTS = 每月几十到上百。适合对文案和画面有较高要求的创作者。
全云端方案:GPT-4o + RunningHub 云端 + API 出图 = 每月上百到几百。适合没显卡、不想折腾环境、追求省心的用户。
对比祁博士那套卖钱的系统(几千到几万不等),Pixelle-Video 免费开源、Apache 2.0 协议——你可以商用,可以二开,可以部署在自己的服务器上给团队用。没有任何授权费。
🧩 和其他工具比,它强在哪
Pixelle-Video 不是第一个做自动短视频的。MoneyPrinterTurbo、NarratoAI、MoneyPrinterPlus 都在做类似的事。那它有什么不一样?
最核心的差异:模块化和可替换性。其他工具大多是一个固定 pipeline——LLM 文案 + 某个固定的出图方式 + 某个固定的 TTS。
Pixelle-Video 把每个环节都做成了可替换的模块。你可以用 ComfyUI,也可以用 API;可以用 Edge-TTS,也可以用 Index-TTS;可以用内置模板,也可以自己写 HTML 模板。
每个模块的配置都在 WebUI 里可视化操作,不需要改代码。
第二个差异:学术背景。Pixelle-Video 背后是一个系列学术工作——FilmAgent(SIGGRAPH Asia 2024)、Anim-Director(SIGGRAPH Asia 2024)、ComfyUI-Copilot(ACL 2025)、AniMaker(SIGGRAPH Asia 2025)。
它是一条持续近两年的研究-工程管线,跟"一个开发者一时兴起做的 side project"有本质区别。这带来了两个好处:设计上更严谨(比如分镜规划的逻辑不是拍脑袋),更新有持续性保障。
⚠️ 注意事项和踩坑提醒
工具再好,也有几个坑得提前说清楚。
第一,ComfyUI 的门槛不低。Pixelle-Video 本身很简单——WebUI 很直观。但 ComfyUI 的安装、工作流的调试、模型下载,这需要一些动手能力。
如果你以前没碰过 Stable Diffusion 那套东西,可能需要花一个下午搞定。
第二,出片质量的上限取决于你对参数的了解。默认配置出来的视频能发,但想做好,你必须学会调 LLM 文案风格、配图提示词、TTS 语速和音色。这需要几次实验。
第三,显卡是硬门槛。完全免费方案需要本地 GPU。8G 显存是起点,速度可以接受;16G 以上会比较舒服。没显卡的话只能走云端,成本会上去。
第四,数字人效果目前还不完美。口型同步、表情自然度还在迭代中。如果你追求的是"和真人主播一样",目前还达不到。但作为"能看的口播内容"没问题。
👤 谁该关注这个项目
👤 如果你在做短视频号,每天为了内容制作发愁 → Pixelle-Video 能让你从"每天花 2 小时做一条"变成"花 10 分钟调参数"。不是替代你,是帮你把重复劳动自动化。
👤 如果你是小团队的内容负责人,想批量生产短视频但招不起剪辑 → 搭一套 Pixelle-Video + ComfyUI,一个人等于一个剪辑组。
👤 如果你对 AI Agent/工作流搭建感兴趣 → Pixelle-Video 是一个教科书级的编排层案例——它把最好的原子工具串起来,自己不造轮子。这个设计思路值得学习。
👤 如果你是技术开发者,想二开商用 → Apache 2.0 协议,随便改。已经有团队基于它做垂直领域的视频生成方案。
从手动剪辑到自动流水线,差的不只是时间
短视频制作这件事,过去三年经历了三个阶段。
第一个阶段:手动剪辑。一个人一台电脑,剪一条 60 秒视频可能要一小时。
第二个阶段:模板化。剪映这类工具让小白也能做视频,但创意和文案还是得自己来。
第三个阶段——也就是 Pixelle-Video 代表的阶段——全自动流水线。输入一个想法,AI 完成文案、画面、语音、合成。你只做最后的质量控制。
这不是"AI 取代创作者"。一个能写出好主题的人,配上一套自动流水线,一天可以产出一个剪辑组一周的量。差的不是时间,是杠杆。
22K 人给这个项目点了 Star。他们已经看到了这个方向。
你也该试试。
图源:GitHub 公开仓库 AIDC-AI/Pixelle-Video,README 截图与文档。项目基于 Apache 2.0 协议开源。
夜雨聆风