
做短视频的创作者,几乎都踩过这几个坑:
在线AI工具要上传全部文案、素材,敏感内容担心泄露;
剪映、各类SaaS平台有导出次数、水印、付费额度限制;
写一段语录,要分软件找背景图、AI配音、手动调字幕、加BGM,来回切换软件半小时起步;
批量做情感语录、知识口播、中老年短视频,重复操作耗光时间。
今天给大家拆解一款2026年全新升级的本地开源短视频工具 AI Media Assistant(原项目ai_caption_video)。
全程在电脑本地运行,所有文案、图片、视频只存在你的硬盘,不上传任何云端服务器;网页可视化操作,不用精通剪辑,输入多行文字,自动匹配画面、配音、字幕、背景音乐,一键导出完整MP4,兼顾小白易用性与专业开发者二次开发能力。
一、核心优势:它和线上剪辑工具最大的区别
1. 100%本地离线运行,数据完全可控
绝大多数AI视频工具是云端SaaS,你的原创文案、未发布素材、商业脚本都会上传第三方服务器,存在隐私、版权风险。
AI Media Assistant默认仅监听本地地址127.0.0.1,所有素材、项目缓存、生成视频全部保存在本机文件夹,无任何数据外传,适合:
做私密语录、企业内部培训视频;
产出原创独家内容,不想素材泄露;
政企、教育从业者,有数据不出本地合规需求。
2. 一站式全链路,不用多软件来回切换
传统图文转视频流程:写文案→找背景图→打开配音工具生成语音→剪辑软件导入素材、调字幕、加背景音乐、渲染导出。
这款工具把整套流程整合在一个浏览器网页里,单页面完成全部操作,无需切换软件。
3. 完全开源免费,无水印、无导出次数限制
MIT开源协议,个人、商用均可免费使用,没有在线工具的会员、额度、强制水印套路;支持Windows/macOS双系统,家用电脑就能部署。
二、开箱即用全功能,覆盖90%自媒体短视频场景
1. 多行文案精细化管理,逐句独立编辑
左侧文案栏支持分段录入,每一行文字单独作为一个视频片段,系统用UUID绑定对应配图、字幕样式、配音时长:
新建、复制、删除项目,自动保存所有编辑进度;
一键标记文案重点词,字幕自动高亮突出;
单句修改、替换图片、重配语音,不用整体重新渲染。
2. 多套成熟字幕模板,适配各类短视频风格
内置现成模板库,开箱即用无需手动调参数:
情感大字模板:适合人生语录、读书感悟、中老年短视频;
古风模板:国风文案、诗词、传统文化内容;
滚动队列字幕:知识科普、资讯解说;
支持自定义字号、颜色、描边、排版,浏览器预览和最终导出视频字幕效果完全一致,不会出现预览和成片错位。
3. AI智能自动配图,内置海量本地素材库
工具自带本地资源包,不用联网搜图:
情感风景、古风、人文、老年向背景图库;
自动匹配每行文案情绪分配图片,同项目不会重复配图;
支持手动上传自定义图片、替换单片段背景,自由度拉满。
4. 双大模型TTS配音,音色自然可控
集成两套主流本地语音模型,全部离线推理,无需调用第三方语音API:
OmniVoice、Qwen3‑TTS双引擎可选;
支持参考音频复刻音色、调节语速、切换男女声;
配音任务由后台独立进程处理,渲染时不卡顿网页操作。
5. 背景音乐系统,音量自动避让人声
内置免费商用BGM曲库,支持三种使用方式:
随机匹配情绪背景音乐;
手动上传自己的音频文件;
调节BGM音量,生成视频时自动压低背景音乐,保证人声清晰。
6. 后台异步渲染,任务可视化管理
TTS配音、视频渲染全部交给Worker后台进程,渲染期间可以继续编辑新项目:
实时查看任务进度、随时取消、失败一键重试;
渲染完成直接在网页预览,一键下载高清MP4;
所有输出视频统一归档在本地output文件夹,方便批量导出。
三、清晰模块化技术架构,专业开发者友好
项目采用前后端分离架构,代码分层清晰,便于二次开发、自定义改造:
apps/├─ web/ 前端页面:React+TS+Vite,可视化操作面板└─ api/ 后端接口:FastAPI,负责项目、素材、任务管理workers/└─ render_worker/ 独立后台进程,处理配音、视频渲染,不阻塞前端packages/media_core/ 音视频核心引擎:字幕排版、TTS桥接、FFmpeg合成storage/ 本地存储目录├─ resources/ 内置背景图、字体、BGM、音色素材├─ projects/ SQLite数据库,保存所有文案、项目配置├─ uploads/ 用户上传自定义图片、音频└─ outputs/ 最终导出的成片视频
底层基于FFmpeg完成视频拼接、字幕封装,解决音画同步、分辨率裁切等常见剪辑难题,仓库配套完整开发文档。
四、双系统一键部署教程,小白也能跑起来
硬件&环境基础要求
系统:Windows10/11 或 macOS
Python3.11+、Node.js20+、FFmpeg(加入系统环境变量)
语音模型需自行下载,放置项目models文件夹,Windows与Mac模型包不通用
Windows启动步骤
下载Release压缩包解压到本地文件夹; 文件夹内打开PowerShell,执行初始化脚本:
powershell -ExecutionPolicy Bypass -File scripts\setup_windows.ps13. 后续启动直接运行:
powershell -ExecutionPolicy Bypass -File scripts\start_windows.ps14. 浏览器打开地址:http://127.0.0.1:8123
macOS启动步骤
解压安装包,终端赋予脚本权限: chmod +x scripts/setup_macos.sh scripts/start_macos.sh./scripts/setup_macos.sh日常启动: ./scripts/start_macos.sh访问网页端:http://127.0.0.1:8123
部署完成后打开网页,直接输入文案就能开始创作,仓库docs文件夹内置完整用户使用手册,遇到问题可查阅。
五、适合哪些创作者落地使用?
情感语录/读书博主
批量产出人生感悟、金句短视频,内置风景、古风素材+大字字幕模板,10分钟产出多条成片。
知识、财经、教育自媒体
不用真人出镜,文字转口播视频,搭配清晰字幕,适合科普、课程短视频。
中老年、人文国风账号
专属古风、怀旧背景图库,适配中老年用户审美,批量起号降低创作成本。
企业市场/内部培训
本地离线处理内部文案,数据不外流,低成本制作产品介绍、内部教学短片。
程序员、AI工具二次开发者
完整开源工程,可基于FastAPI接口对接自有工作流,自定义素材、配音、渲染逻辑。
六、总结:本地AI视频工具的最优开源选择
目前市面上图文转视频工具分两类:
一类是云端SaaS,操作简单但有隐私、付费、水印限制;
另一类是本地工具,但大多只有命令行,无可视化网页,新手门槛极高。
AI Media Assistant完美折中:浏览器可视化操作+全本地离线渲染+完整开源架构,普通人不用懂代码就能批量做短视频,开发者可自由修改底层逻辑。
从一段文字到带配音、字幕、背景音乐的完整MP4,全流程本地闭环,兼顾效率、隐私与免费商用,做短视频矩阵、批量产出内容的创作者值得上手部署。
开源项目地址:https://github.com/alexchan197611/ai_media_assistant
夜雨聆风