前两天一个朋友跟我吐槽,说想做视频号副业,报了个"AI短视频训练营",交了899,学完发现最值钱的那一招,就是教他用软件自动生成文案、自动配音、自动剪视频。
我听完就笑了。那玩意儿他一分钱不用花。GitHub 上有人早做成了开源工具,4.4k star,下载下来双击就能跑。
说真的,做短视频最贵的从来不是设备或素材,是你被"副业课"割的那一刀。
你不是不会做短视频,你是被剪辑这道坎吓退的
很多人心里都住着一个"做短视频"的念头。
想做带货,手机里拍了一堆产品素材;想做知识科普,脑子里有观点就是开不了口;想做治愈系语录号,存了一文件夹好看的风景空镜。
但最后都没动。为什么?卡在剪辑。
你打开剪映,面对时间轴上几十段素材,脑子是懵的:先放哪段?配什么音乐?字幕怎么跟得上人声?配音要自己录,一录就结巴。好不容易剪完一条,两小时过去了,发出去三个赞。
"我不是这块料。"这是绝大多数人的结论。
但我越看越觉得,这个结论下早了。你不是不会做内容,你是被"剪辑"这件技术活在门口吓退了,而这件事,现在其实可以整个交给机器。

那些卖你几千块的课,核心就这一招
市面上"AI短视频副业课"五花八门,话术都差不多:教你用 AI 写脚本、用 AI 配音、用工具自动混剪、批量起号、矩阵放大。
听起来很高深对吧?好像不交钱就摸不到门道,不交钱就会被时代甩下。
我跟你讲句大实话:这些课里真正能落地的核心能力,就是一个"自动流水线"——把文案、配音、字幕、剪辑串成一条线,你只管喂素材,机器负责跑完。
这事儿开源社区早就有人做出来了,而且免费。
它就是「短视频工厂」(Short Video Factory),一个 GitHub 上 4.4k+ star 的开源桌面软件。你不用看懂代码,下载安装包双击就能用,跟装个微信差不多门槛。
那些课收你几千块教的"AI能力",这个工具白送。我不是说所有课都是割韭菜,系统性的陪跑对纯小白有它的价值。但如果你要的只是"自动写文案、自动配音、自动混剪"这一套,真没必要先交一笔智商税。
它是怎么把一条视频"造"出来的
我尽量说人话,不堆术语。
整个过程你只需要干两件事:写一句需求,准备好视频素材。剩下的,软件自己跑。
第一步,写提示词。比如你告诉它:"给一款无线蓝牙耳机写30秒带货文案,卖点是降噪和长续航。"它调用一个 AI 大模型,几秒钟吐出分镜脚本。
第二步,把你的视频片段丢进一个文件夹。剩下的混剪、配乐,软件自动搞定。
中间到底发生了什么?它用 AI 把你的文案写成脚本,调用语音合成把文字念出来(同时自动生成对齐的字幕),再从你的素材库里随机抽片段、按语音时长裁切拼接,最后叠上背景音乐,渲染成一条成片。竖屏 1080×1920、横屏 1920×1080,你要哪种它出哪种。
最烦人的字幕对齐它顺手就解决了。字幕的时间戳是直接从语音生成出来的,不会出现"第三秒画面还在放前一句、字幕却跳到下一句"的尴尬。以前手动拖字幕轨对时间,对得人眼晕,现在这一步直接没有。
一条视频从"一堆素材"到"能发的成片",你按的按钮不超过三个。

最关键是,这里面最容易被课拿来说事的两条——配音 和 写文案——它都给你免了。
语音合成用的是微软 Edge 那个"大声朗读"引擎(EdgeTTS),内置几百种音色,中文有晓晓、云扬,不用你付一分钱,也不用你去申请什么 Key。
写文案接的是通用的 AI 接口,官方直接推荐一个免费的模型(GLM-4.5-Flash),注册就能用。当然你也可以换成 DeepSeek、Kimi 或者自己本地部署的模型,想用哪个接哪个,只要接口兼容标准格式就行。
一句话:别人拿这几样拼成课卖你钱,它把它们拼成工具送你用。
你可以算笔账。以前做一条带货短视频:写脚本半小时,自己录配音反复重来二十分钟,对齐字幕十五分钟,剪素材找 BGM 又是一个钟头。保守说,两三个小时才出一条,还是糙的。用这个工具,写一句需求、丢一文件夹素材、点一下渲染,喝口水的功夫成片就出来了。这不是"快一点",是把你最耗神的步骤整个删掉。
最让我放心的一点:你的素材不出这台电脑
做内容的人,多少都有点素材隐私焦虑。
我见过有人不敢用云端剪辑工具,怕自己的产品素材、没公开的内容被传到别人服务器上。这种担心不矫情,是真问题,尤其电商和做私域的,素材就是生意本身。
「短视频工厂」这款工具,从设计上就规避了这点:它基本全程在本地跑。
你的视频素材、你的各项配置、你生成的成片,全存在你电脑本地的数据库里(SQLite),不上传任何云端。除了调用你自己配置的 AI 接口和微软的语音服务,它不碰你的数据。

对一个怕内容被抄、怕素材外泄的人来说,这一点有时候比"免费"还重要。你用着顺手,心里也踏实。
想搞矩阵号批量产出?它也能扛
如果你只是一个人做一个号,上面那些功能已经够用了。
但有些人想的是另一件事:矩阵号。一个产品同时铺五六个号,内容形式差不多,但要持续地出。
这种需求,手动剪会累死。这款工具里有个"批量任务":你配好一个任务,它按设定循环自动合成多条视频。素材库里多丢点片段,它就能一直给你出片,适合做矩阵号批量生产。
我不是鼓吹你去铺一堆号搞搬运,那没意义。但如果你本来就有真实需求——比如电商上架几十个 SKU,每个都要配一条短视频——这个功能能替你省下一个剪辑师的人力。
我见过一个小卖家,淘宝店二十来个 SKU,以前每次上新都卡在"没视频"。后来素材拍一批扔进去,配不同的文案批量出,一个下午把全店短视频补齐了。这种活儿不性感,但省下来的时间,是真金白银。

谁最适合用这个工具(对号入座)
不想绕弯子,直接列人:
如果你属于上面任何一类,又一直卡在"不会剪、没时间剪",那这条路子你该试试。

新手怎么上手,三步出片
怕复杂?我给你拆成最笨的三步。
第一步,下载安装包。 去 GitHub 的 Releases 页面,选你系统对应的那一个:Windows 是 exe,mac 是 dmg,Linux 是 AppImage。下载,双击,装好。全程不需要你配任何开发环境,这是它最良心的地方——很多同类开源项目要你装 Node、配依赖,直接劝退一半人,它直接打包好了原生安装包。
第二步,配置一下 AI。 打开软件,在文案区点"配置",填三样东西:模型名字、接口地址、你的 Key。用官方推荐那个免费的就行,填完点"测试",通了就保存。
第三步,一键生成。 在提示词框写你的需求,点"生成"出文案,挑个喜欢的音色,点"渲染"。等进度条跑完,成片就在你指定的文件夹里了。

就这样。没有第二步的第二步,没有隐藏关卡,没有"扫码进群领取进阶教程"。
几个你可能踩的坑,先说清楚
任何工具都有脾气,我挑几个最常见的,免得你到时候抓瞎。
macOS 第一次打开可能弹"无法验证开发者"。这是开源项目没做苹果公证导致的,不是软件有毒。去系统设置-隐私与安全性,点"仍要打开"就行,或者终端敲一行命令解除隔离。
加了背景音乐后人声忽大忽小?这是早期版本的老毛病,已经修好了,把软件升到最新版(v1.2.1 以上)就好。
语音合成失败,先检查网络能不能连上微软那个语音服务,公司内网可能把相关连接拦了。
想换模型、接本地 Ollama 都行,只要接口兼容标准格式就能填进去用。
这些坑项目的文档里都写了,遇到问题先去翻一眼,比在群里瞎问强。
泼盆冷水:工具不是印钞机
最后说点不好听但有用的。
工具再好,也不替你想内容。AI 写出来的文案是及格线,不是爆款保证;批量出的视频是数量,不是质量。它能把你从最累的苦力里捞出来,让你把劲使在刀刃上,但红不红,最后还是看你那点真东西。
别指望装了软件明天就变现。它解决的是"做不出来"的问题,解决不了"做不火"的问题。这两件事,得分开想。
说回开头那件事
我那个花899报课的朋友,听完我讲完这工具,沉默了三秒,说了句:"早知道我把这钱买排骨不香吗。"
香。当然香。
工具是死的,主意是活的。一个免费开源、本地运行、数据不出本机的 AI 剪辑工具摆在那,你接不接,取决于你想不想动。
想做视频号副业、想给产品配短视频、想做语录号但一直没开张的人,我今天把路指到这了。
剩下那道坎,其实早就不在剪辑上了。
项目地址(自取,免费):
你被"AI副业课"割过最狠的一次是多少钱?或者你最想用 AI 帮你把哪种视频自动化?评论区聊聊,我挑几个帮你看看怎么落地。
如果这篇文章帮你省下了一笔智商税,转发给那个正准备报课的朋友,比请他吃饭实在。
往期推荐
夜雨聆风