先回答一个最现实的问题:为什么要把 H3 装到自己电脑上?

三个理由:
第一,免费——网页版一条15秒2K视频一块多钱,本地跑只费电;
第二,不限量——不用排队、不用看会员额度,提示词随便试;
第三,数据不出你的机器——素材、产品图、商业项目全在本地,对很多团队这一条就是刚需。
H3 是8月3日刚开源的33B视频模型,生成视频的同时还能生成同步的立体声音频。
好消息是,它对消费级显卡做了适配,安装过程已经被 ComfyUI 社区"傻瓜化"了。跟着下面几步走,半小时内能出第一条片。
一、第一步:确认你的显卡能不能跑
先看硬件,别急着下载。
社区实测下来的参考线:

- 12-16GB显存
(如RTX 3060 12G、4060 Ti 16G):能跑,但要降低分辨率、靠内存分担,最好有64GB系统内存
- 24GB显存
(RTX 4090/5090):舒适区,5秒768p视频大约5分半钟一条
- 8GB显存及以下
别硬撑了,直接用海螺网页版,体验更好

一句话:显卡决定速度,内存决定能不能启动。硬盘预留至少50GB空间。
二、第二步:安装 ComfyUI(认准 0.30.0 以上版本)

H3 在 ComfyUI 里是原生节点,但版本必须是 0.30.0 或更高,旧版本没有。


小白最省事的方式是去 ComfyUI 官网下载 Windows 整合包,解压即用。

已经装过的朋友,用启动器点"升级"就行——别手动 git pull,除非你想体验"报错三小时、回滚两秒钟"。
三、第三步:下载模型文件,放对文件夹
这是最关键的一步,文件放错位置就识别不到。

需要下载5个文件,国内用户建议从魔搭社区(modelscope.cn,搜 MiniMax-H3)下载,比 Hugging Face 快得多:
minimax_h3_fl2va_pruned_nvfp4.safetensors(约12.5G,文生/图生视频用)
minimax_h3_ref2va_pruned_nvfp4.safetensors(约12.5G,参考生视频用)
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(约15G,文本编码器)
minimax_h3_video_vae_fp16.safetensors(视频VAE)
minimax_h3_audio_vae_fp32.safetensors(音频VAE)
下载后按这个结构放进 ComfyUI 安装目录:
全套约34GB。如果你只想先试水,可以只下 fl2va 主模型加编码器加两个VAE,先玩文生视频。

四、第四步:拖入官方工作流
不用自己搭节点。
打开 Comfy-Org 在 Hugging Face 的 MiniMax-H3 页面,里面有三套官方工作流模板:T2V(文生视频)、I2V(图生视频)、R2V(参考生视频)。

下载 JSON 文件,直接拖进 ComfyUI 界面,整个工作流就搭好了。


注意一个小细节:
模板默认引用的是 int8 版本的模型名,在 UNETLoader 节点的下拉框里,把它换成你下载的 nvfp4 文件名即可——一个节点的事,其他不用动。
五、第五步:生成你的第一条视频
参数别贪大,按这个保守组合来:
分辨率用默认的 864×480(熟练后再拉到 1344×768)
时长先来 5 秒
采样步数保持默认 20 步
提示词有个心法:一个主体、一个动作、一个运镜。比如"荒漠远景、牛仔特写、骑马追逐、多镜头切换全都安排上了,西部牛仔那股苍凉劲儿"。
另外 H3 的声音是和画面一起生成的,所以记得把声音也写进提示词:对话用引号标出来,环境音写明("咖啡馆背景声""户外风声"),想要安静就注明"无声"。
点生成,去泡杯茶。4090/5090 大约五六分钟,小显存会更久。
六、避坑指南:这四件事提前知道
七、不想折腾?也没关系
说实话,本地部署适合两类人:
高频使用者(生成的量足够把显卡钱省回来)和数据敏感型团队。
如果你只是偶尔做一两条,海螺网页版65元会员能出80多秒2K视频,可能更划算。
工具没有高下,只有合不合适。

装好之后,建议先拿一个真实需求练手:给店里的产品拍几张照片,用 R2V 工作流生成一条15秒的小宣传片,你会直观感受到"本地免费抽卡"的快乐。
安装过程中卡在哪一步了?
评论区留下你的显卡型号和报错,我尽量帮你看看。
觉得教程有用,转发给那个想玩AI视频又怕踩坑的朋友。
H3 现已开源!
① Hugging Face:huggingface.co/MiniMaxAI/MiniMax-H3
② 魔搭社区:modelscope.cn/models/MiniMax/MiniMax-H3
与前沿大脑同步在线,让思维时刻领先
扫描下方二维码,加入AI交流群
↓↓↓


夜雨聆风