乐于分享
好东西不私藏

ai_media_assistant:本地开源 AI 短视频工具,文案、配图、配音、字幕一站式搞定

ai_media_assistant:本地开源 AI 短视频工具,文案、配图、配音、字幕一站式搞定

做短视频的创作者,几乎都踩过这几个坑:

在线AI工具要上传全部文案、素材,敏感内容担心泄露;

剪映、各类SaaS平台有导出次数、水印、付费额度限制;

写一段语录,要分软件找背景图、AI配音、手动调字幕、加BGM,来回切换软件半小时起步;

批量做情感语录、知识口播、中老年短视频,重复操作耗光时间。

今天给大家拆解一款2026年全新升级的本地开源短视频工具 AI Media Assistant(原项目ai_caption_video)。

全程在电脑本地运行,所有文案、图片、视频只存在你的硬盘,不上传任何云端服务器;网页可视化操作,不用精通剪辑,输入多行文字,自动匹配画面、配音、字幕、背景音乐,一键导出完整MP4,兼顾小白易用性与专业开发者二次开发能力。

一、核心优势:它和线上剪辑工具最大的区别

1. 100%本地离线运行,数据完全可控

绝大多数AI视频工具是云端SaaS,你的原创文案、未发布素材、商业脚本都会上传第三方服务器,存在隐私、版权风险。

AI Media Assistant默认仅监听本地地址127.0.0.1,所有素材、项目缓存、生成视频全部保存在本机文件夹,无任何数据外传,适合:

做私密语录、企业内部培训视频;

产出原创独家内容,不想素材泄露;

政企、教育从业者,有数据不出本地合规需求。

2. 一站式全链路,不用多软件来回切换

传统图文转视频流程:写文案→找背景图→打开配音工具生成语音→剪辑软件导入素材、调字幕、加背景音乐、渲染导出。

这款工具把整套流程整合在一个浏览器网页里,单页面完成全部操作,无需切换软件。

3. 完全开源免费,无水印、无导出次数限制

MIT开源协议,个人、商用均可免费使用,没有在线工具的会员、额度、强制水印套路;支持Windows/macOS双系统,家用电脑就能部署。

二、开箱即用全功能,覆盖90%自媒体短视频场景

1. 多行文案精细化管理,逐句独立编辑

左侧文案栏支持分段录入,每一行文字单独作为一个视频片段,系统用UUID绑定对应配图、字幕样式、配音时长:

新建、复制、删除项目,自动保存所有编辑进度;

一键标记文案重点词,字幕自动高亮突出;

单句修改、替换图片、重配语音,不用整体重新渲染。

2. 多套成熟字幕模板,适配各类短视频风格

内置现成模板库,开箱即用无需手动调参数:

情感大字模板:适合人生语录、读书感悟、中老年短视频;

古风模板:国风文案、诗词、传统文化内容;

滚动队列字幕:知识科普、资讯解说;

支持自定义字号、颜色、描边、排版,浏览器预览和最终导出视频字幕效果完全一致,不会出现预览和成片错位。

3. AI智能自动配图,内置海量本地素材库

工具自带本地资源包,不用联网搜图:

情感风景、古风、人文、老年向背景图库;

自动匹配每行文案情绪分配图片,同项目不会重复配图;

支持手动上传自定义图片、替换单片段背景,自由度拉满。

4. 双大模型TTS配音,音色自然可控

集成两套主流本地语音模型,全部离线推理,无需调用第三方语音API:

OmniVoice、Qwen3‑TTS双引擎可选;

支持参考音频复刻音色、调节语速、切换男女声;

配音任务由后台独立进程处理,渲染时不卡顿网页操作。

5. 背景音乐系统,音量自动避让人声

内置免费商用BGM曲库,支持三种使用方式:

随机匹配情绪背景音乐;

手动上传自己的音频文件;

调节BGM音量,生成视频时自动压低背景音乐,保证人声清晰。

6. 后台异步渲染,任务可视化管理

TTS配音、视频渲染全部交给Worker后台进程,渲染期间可以继续编辑新项目:

实时查看任务进度、随时取消、失败一键重试;

渲染完成直接在网页预览,一键下载高清MP4;

所有输出视频统一归档在本地output文件夹,方便批量导出。

三、清晰模块化技术架构,专业开发者友好

项目采用前后端分离架构,代码分层清晰,便于二次开发、自定义改造:

apps/├─ web/ 前端页面:React+TS+Vite,可视化操作面板└─ api/ 后端接口:FastAPI,负责项目、素材、任务管理workers/└─ render_worker/ 独立后台进程,处理配音、视频渲染,不阻塞前端packages/media_core/ 音视频核心引擎:字幕排版、TTS桥接、FFmpeg合成storage/ 本地存储目录├─ resources/ 内置背景图、字体、BGM、音色素材├─ projects/ SQLite数据库,保存所有文案、项目配置├─ uploads/ 用户上传自定义图片、音频└─ outputs/ 最终导出的成片视频

底层基于FFmpeg完成视频拼接、字幕封装,解决音画同步、分辨率裁切等常见剪辑难题,仓库配套完整开发文档。

四、双系统一键部署教程,小白也能跑起来

硬件&环境基础要求

系统:Windows10/11 或 macOS

Python3.11+、Node.js20+、FFmpeg(加入系统环境变量)

语音模型需自行下载,放置项目models文件夹,Windows与Mac模型包不通用

Windows启动步骤

  1. 下载Release压缩包解压到本地文件夹;
  2. 文件夹内打开PowerShell,执行初始化脚本:
powershell -ExecutionPolicy Bypass -File scripts\setup_windows.ps1

3. 后续启动直接运行:

powershell -ExecutionPolicy Bypass -File scripts\start_windows.ps1

4. 浏览器打开地址:http://127.0.0.1:8123

macOS启动步骤

  1. 解压安装包,终端赋予脚本权限:
    chmod +x scripts/setup_macos.sh scripts/start_macos.sh./scripts/setup_macos.sh
  2. 日常启动:
    ./scripts/start_macos.sh
  3. 访问网页端:http://127.0.0.1:8123

部署完成后打开网页,直接输入文案就能开始创作,仓库docs文件夹内置完整用户使用手册,遇到问题可查阅。

五、适合哪些创作者落地使用?

情感语录/读书博主

批量产出人生感悟、金句短视频,内置风景、古风素材+大字字幕模板,10分钟产出多条成片。

知识、财经、教育自媒体

不用真人出镜,文字转口播视频,搭配清晰字幕,适合科普、课程短视频。

中老年、人文国风账号

专属古风、怀旧背景图库,适配中老年用户审美,批量起号降低创作成本。

企业市场/内部培训

本地离线处理内部文案,数据不外流,低成本制作产品介绍、内部教学短片。

程序员、AI工具二次开发者

完整开源工程,可基于FastAPI接口对接自有工作流,自定义素材、配音、渲染逻辑。

六、总结:本地AI视频工具的最优开源选择

目前市面上图文转视频工具分两类:

一类是云端SaaS,操作简单但有隐私、付费、水印限制;

另一类是本地工具,但大多只有命令行,无可视化网页,新手门槛极高。

AI Media Assistant完美折中:浏览器可视化操作+全本地离线渲染+完整开源架构,普通人不用懂代码就能批量做短视频,开发者可自由修改底层逻辑。

从一段文字到带配音、字幕、背景音乐的完整MP4,全流程本地闭环,兼顾效率、隐私与免费商用,做短视频矩阵、批量产出内容的创作者值得上手部署。

开源项目地址:https://github.com/alexchan197611/ai_media_assistant
欢迎在评论区留言讨论!如果觉得这篇文章对你有帮助,别忘了点赞、在看、转发三连支持!
关注我,后续还会分享更多干货!