先给心急的兄弟们一个定心丸:RTX 4070 Laptop 8GB显存 + 32GB内存,已经验证可以本地跑通MiniMax H3文生视频,还带声音。 网传的“500秒压到200秒”是真的,我顺手优化到了150秒(2分半)。
别听网上瞎传非要什么A100、4090,咱们臭打游戏的笔记本也能当视频工作站。这篇帖子没废话,就是让你直接抄作业,我已经把全套家伙事儿打包好了,你只需要动动鼠标。
我的配置,你对号入座 先看看咱俩是不是一个赛道的。我的机器是RTX 4070 Laptop(8G显存),内存32GB,系统是Windows。按理说这配置在炼丹圈属于“低保户”,但事实证明完全够用。只要你显卡是8G显存(比如4060、4070笔记本或桌面卡),内存有32G,这篇教程就是给你写的。
看下实际生成效果
先看疗效,再说怎么吃 我知道你们最关心速度,直接上干货(都是我机器上实跑的数据):
裸跑(啥优化没有):生成一段832x480的5秒视频,每步耗时18秒,总共干了6分钟。这时候确实慢得想砸电脑,别急,这是8G显存被20多G的模型逼着“换层”的正常现象。
优化拉满(抄我作业后):同样的分辨率,直接干到2分30秒整段出片。你没看错,从6分钟压到2分半。
如果贪心点想跑1080P(1024x576):时间会涨到大概9分钟,画质确实好,但建议偶尔玩玩,平时还是用480p图个快。
提速三板斧(这才是核心) 网上优化教程一大堆,大部分都是瞎扯。我实测下来,真正有用的就这三板斧,按收益排序,第一招不搞,后面全白搭。
第一招(最大杀器):换torch cu130 + comfy-kitchen 这个你们可能看不懂,直接抄命令就行。原理就是让显卡走硬件反量化,不然就是软件在那瞎算,一步17秒死活下不来。这一条不做,后面的TeaCache和SageAttention都是摆设。
第二招(白捡三倍速):挂上MiniMaxH3 TeaCache 这玩意儿纯Python写的,不修改核心文件,安全又稳。你就把它当成一个插件,一头插在模型加载器上,另一头插在采样器前面就行。作者实测从306秒干到102秒,咱们8G卡收益更大。
第三招(锦上添花):SageAttention 1.0.6 注意!这里有个血泪教训:千万锁死1.0.6版本,千万别手贱升级到2.2.0,否则直接CUDA崩溃给你看。Windows用户还需要装个triton-windows,不然跑不起来。
整个加速链路的连接顺序我给你们摆出来了,照着连:
UNETLoader → PatchSageAttentionKJ(auto) → MiniMaxH3 TeaCache → SigmaShift(12/3) → KSampler → DecodeAndSaveVideo
模型怎么选?直接照搬我的组合 模型选不对,8G显存直接爆。我试了一堆组合,这套是速度和画质的黄金平衡点:
主模型:一定要下那个带pruned_int8_convrot后缀的,大小大概19.5GB。别下66G的BF16原版,那不是咱这配置该想的事。
文本编码器:选nvfp4_awq这个版本,14.6GB,专门给40系显卡优化的。
VAE:视频用fp16,音频用fp32,别问为什么,抄就完了。
这套组合拳打下来,模型精度肉眼几乎看不出来损失,但显存从60G+被干到了21G,8G卡就能塞进去跑。
懒人专用:一键便携包(解压即用) 我知道你们看到装环境、敲命令行就头疼。我把整个项目——包括Python运行环境、ComfyUI、上面的模型、所有加速节点——全部打成了一个自包含包。
你只需要三步:
百度网盘:https://pan.baidu.com/s/1BWmwQpjkWLeVQ_8DXy91GA?pwd=xidf 提取码 xidf 下载我扔网盘里的压缩包(密码123)。
解压到任意盘(建议D盘或E盘,路径别带中文)。
双击首次使用-修复路径.bat,等它跑完;然后双击启动ComfyUI.bat。
浏览器打开http://127.0.0.1:8188,把工作流文件夹里的minimax_h3_t2v_8g加速.json拖进去,改改提示词,点击“Queue Prompt”就完了。
啥都不用装,解压就能跑。
直接抄作业的参数表 怕你们调不明白,我直接把能稳定出片的参数贴出来,对着填就行:
主模型:minimax_h3_fl2va_pruned_int8_convrot
文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq
分辨率:想快就填832x480,想画质好点填1024x576(必须是32的倍数)
帧数:124帧(对应24fps,大概5.17秒)
采样步数:固定20步(少于12步音频会爆音,别问怎么知道的)
采样器:euler / 调度器:simple
CFG:1.0 / denoise:1.0
TeaCache参数:rel_l1_thresh设0.15,start设2,end设-2
Sigma Shift:视频填12,音频填3(这俩分开填)
提示词技巧:想要什么画面就写画面描述,想控制声音就在末尾加指令。比如要背景音乐就写“disco music with driving bass”,不要声音就写“No dialogue, no music”。
我踩过的雷,你就别踩了(避坑清单) 最后这点最重要,都是我用时间换来的教训:
缓存节点只选一个! TeaCache、EasyCache、TE-Speed这些,别贪心叠加,选一个用就行,叠多了不仅不加速还容易崩。
SageAttention锁死1.0.6,这事儿我说三遍。
480p起步,768p封顶。8G卡别一上来就怼1080P,容易抽卡失败,先从480p试水,成功了再往上加。
机械硬盘别碰。模型文件几十G,换层频繁,机械盘会卡到你怀疑人生,必须是固态(NVMe SSD)。
Turbo LoRA先别碰。那玩意儿还是早期实验版,画质偏软,而且需要非剪枝的主模型(+34GB),咱们8G卡带不动。
尾巴 8G显存不是天花板,只是门槛。这套组合拳打下来,咱们笔记本也能当视频工作站。参数全在这了,照着抄完记得回来点个赞,也欢迎评论区交流你们的实测时间,看看谁优化得比我更快!
(全文数据均为RTX 4070 Laptop 8G实跑,配置和流程均已验证)
夜雨聆风