先纠正一个被问烂了的问题
8月3日 MiniMax H3 开放权重之后,我后台被同一类问题刷屏了。
"丰年,H3都能在家用电脑上跑了,我们公司的内容中台是不是该重构了?"
"Seedance 还充不充?"
"本地部署是不是一把梭,全迁过去?"
上周三晚上,一个做家居带货的学员直接给我打语音:"哥,人家4090在家跑 H3,一条片几分钱电费。我上个月云端账单三千八,是不是当了冤大头?"
我问了他三个问题:你一个月出多少条片?多少条是必须1080P交付的?多少条是投流测试的草稿?
他愣了半天,一条都答不上来。
账都没算明白,就开始心疼钱——这不是纠结,是没账。
过去十天,我干了三件事:把工作室的4080跑通了 H3、租了云端4090 48G做对照、把官方和各平台的价目表一页页翻出来对了账。
今天这篇文章,不聊情怀,不聊技术信仰,就聊一件事:如果 MiniMax 可以本地部署跑视频,你的AI内容中台应该怎么改造。
全文讲透三件事:第一,本地部署已经到了什么水位,哪些素材必须尽快迁回本地;第二,在线版本怎么用才最省钱,提示词怎么写才能把算力费打下来;第三,哪些内容你必须老老实实交给 Seedance 2.5,一分钱都省不得。
九千字,读完你能给自己的品牌画一张「内容成本地图」。值不值,读完你说了算。
第一章:先立框架——中台沉淀的不是工具,是两样资产
我一直想跟学员和品牌客户把一句话讲透:我们不是教提示词的,我可以随手送你几百套提示词,那不值钱。
AI内容时代,真正能成为品牌资产的,只有两样东西。
第一样,提示词的框架。
不是某一条提示词,是你这个品牌专属的提示词写法——你也可以叫它 skill,叫它模板库。模型三个月换一代,提示词一条一条会过时,但框架不会。框架是你对"怎么把想法翻译成模型听得懂的话"这件事的全部理解,它能跟着模型一起迁移。
第二样,人物资产。
人物资产分两种。
一种是真实人物资产:这个人真实存在,是你的主播、你的达人,你用AI把她的面部特征1:1精准复刻下来,她睡觉的时候我让她出片。
另一种是虚拟人物资产:这个人不存在,但她专属于你的品牌。她的脸一眼看上去,就是一张卖护肤品的脸、卖大健康产品的脸、卖数码产品的脸——这种脸自带流量。
这两类人物资产库,加上提示词框架,才是每个品牌在AI内容时代真正该往中台里沉淀的东西。
想明白这个前提,"中台怎么改造"就不是一个买不买显卡的问题,而是一个结构问题:你的资产放哪条生产线,你的预算怎么在这几条生产线之间分配。
下面开始算账。
第二章:本地部署已经到商业级了——但先算清三笔账
先把一个事实钉死:本地部署Minimax 拿到的是"半个H3"

我把怎么部署的详细文章放在上面图片里了,点击就可以访问。
很多人被"开源"两个字冲昏了头。
我必须先泼这盆冷水:你下载到本地的,是 H3-Base 这个33B的生成主体,不是完整的产品能力。
H3的完整流水线是三段:Context-IR 负责把大白话改写成模型爱吃的格式,Base 负责生成768P级画面和声音,Regenerate-2K 负责把768P重画成2K。
开源的只有中间那一段。前面那个只走官方API,后面那个至今闭源。
所以本地H3的天花板清清楚楚:768P级分辨率,单次最长15.08秒,原生画布短边768。想要官方原味的2K,多少钱都得走API。这不是你显卡的错,是人家的商业模式本来就这么设计的。
但768P能干的活,覆盖日常内容生产的七八成,但是慢!很慢!
冷水泼完,说点热的。
我用了一个多礼拜,又把国内外一堆实测翻完,本地768P的真实能力清单是这样的:
文生视频、图生视频、参考生视频,三条路全通。纯文字生成场景、给张首帧让它动起来、给9张参考图锁角色长相,全跑在本地,一分钱不按秒收。
原生立体声是白捡的杀器。对白、环境音、配乐跟画面同一次推理出来,唇形同步是天生的,不用后期对轨。
文字渲染是 H3 的看家本领。招牌、字幕、包装上的字,H3是这一代模型里出字最稳的之一,本来就是为广告、电商、品牌营销调的。
多比例全支持。9:16竖屏、16:9横屏、方图、4:3、3:4,短视频矩阵要的规格全覆盖。
还有一个常被忽略的能力:本地支持 LoRA 微调。你可以拿自己的产品图、自己的模特形象去喂一个小模型,让 H3 越来越懂你家的货。这件事云端API做不了——微调权,是开源权重给本地玩家的独占红利。
注意,这正好接上了序章说的"人物资产"。你的虚拟人物、你的产品形象,在本地是可以被"养"出来的。
再补一句实话:抖音和快手的服务端压缩,会帮你遮掉768P一半的瑕疵。你手机里刷到的"高清大片",相当一部分源头分辨率并不比768P高多少。平台替你完成了最后一公里,这是本地768P能当主力分辨率的隐藏原因。
日更短视频、投流素材、私域内容、产品氛围片——这些占了中小团队视频需求的七八成,全在768P的射程里。
本地的三笔账:电费、折旧、时间
网上一堆人说"本地跑不要钱"。这话对一半——不按秒收钱,不等于没有成本。
第一笔,电费,我给你算到分。
4090 48G 跑一条10秒的768P视频,热跑约12分钟。整机高负载功耗按500瓦估,12分钟就是0.1度电。居民电价峰谷平均6毛一度——一条10秒视频,电费6分钱。
4080更快一点,10分钟一条,功耗400瓦上下,电费4分钱。5070 Ti 那个档位,10秒片约8分钟,电费不到4分钱。算上模型加载、算上废片翻倍,一条片子电费也就一毛钱上下。商用电贵一点?翻倍,两毛。写字楼空调摊一点?三毛。撑死不过五毛。
同样一条10秒片,走云端768P是5块钱,走2K是8块钱,走Seedance 720P是11到14块。
本地一毛,云端五块起步。边际成本差50倍到100倍。
第二笔,硬件折旧。
一张4090级别的卡,一万五上下,整机按两万算、三年折旧,一天十几块。你要是三天打鱼两天晒网,一天就跑两条片,摊下来一条片的折旧比云端还贵——本地省钱的前提,是量。机器转得越满,每秒成本越薄。
平衡点我也算过:整机两万,云端768P一条10秒片省5块,大约跑4000条回本。日更团队一天草稿加正片跑30条,四个多月回本,剩下两年半全是净赚。但你一个月就跑50条,回本期拉到六七年,那时候卡都迭代两代了。
买卡之前先数自己的片单,别先数钱。
不想买卡的,还有中间态:云端包月租一台带 ComfyUI 的4090 48G,关机不扣费,模型自己管。
第三笔,时间。
本地10秒片等10到12分钟,云端API提交完你去喝茶。但注意,时间是相对的:云端高峰也排队,免费档只给两个并发。你以为是"提交完去喝茶",有时候是"提交完去排队"。本地的慢是确定的慢,云端的快是不确定的快。
碳基苦力的时间,硅基算力的电费,都得进成本表。只算电费的,是玩家;三笔都算的,才是生意人。
四条半边界,画死了别硬闯
这四件事,是2026年8月这个时间点,本地明确干不了或干不好的:
一,官方2K。闭源。社区超分能拉到1080p顶一顶,但那和 Regenerate-2K"带着原始上下文重画"不是一回事——小字和细节,一个是猜,一个是还原。
二,单次15秒封顶。你填60秒也只给你15.08秒。长内容必须分镜生成再剪辑,本地是"分段包工",不是"一镜到底"。
三,复杂人物的肢体细节。多人互动、大幅度动作、手部特写,翻车率明显上升。这是行业共性难题,不是 H3 独有。
四,稳定的中文口播。我实测下来最膈应的一条:提示词里明明指定了中文台词,生成出来不一定稳。画面没毛病,台词飘了。口播戏现阶段要拆开做——画面归 H3,台词后期配。
还有半个边界,叫"赌概率"。本地不怕多轮——多一轮五分钱;怕的是你把"多轮"当成"必成"。复杂片在本地死磕二十轮,不如一开始就认清车道。
记住这四条半。本地 H3 是一台不是那么太优秀的"日常慢速内容生产机器",但不是"全能交付机器"。
第三章:在线版本怎么用才省钱——答案写在提示词里
先看价目表:0.5加0.3,一分钱便宜都不给你
本地毕竟只能跑768P,交付级的2K还得走在线。2026年8月最新核实的价目:
MiniMax H3 官方API:2K视频每秒0.8元,768P每秒0.5元,768P重生成到2K每秒0.3元。一条15秒的768P成片7块5,15秒2K十二块。
注意这个定价心机:0.5加0.3正好等于0.8。先出768P草稿再升2K,和直接出2K一个价——官方没给"先打样"留一分钱便宜,打样省的只是你扔掉的废片。
再看补贴价。LibTV 上线大促期间,768P低至0.1元一秒,2K低至0.2元一秒,一抽四、一抽八全配齐——但最低价跟年度会员档位挂钩,而且这是平台补贴价,不是模型的常态定价。有创作者实测,同样的素材和提示词,H3出2K画质只要132积分,Seedance 2.0出1080P要680积分,差五倍。
我的建议:能吃多久吃多久,
但做预算按官方价打底,把补贴价当红利,别当常态。
你的算力费,一半交了「抽卡税」
好,现在说重点。在线版本怎么省钱?
很多人以为答案是"挑便宜的平台充会员"。错了。
做AI视频的公司,钱到底烧在哪?我的答案只有一个:抽卡。
一条提示词扔进去,模型给你一条废片。改两个字再扔,还是废片。一个镜头十连抽、二十连抽,积分像自来水一样流走。我管这个叫「抽卡税」——提示词写不明白,就要不停地给模型交税。
这笔税有多狠?一条15秒2K视频3块钱,提示词命中率80%的人和命中率20%的人,实际单条成本差了四倍。模型越便宜,抽卡越不心疼,烂提示词烧起钱来反而越没有知觉。
抽卡税能不能省?能。而且省法的答案,就写在 MiniMax 的官方提示词文档里。
Minimax 官方文档里的省钱密码:四段结构
那份官方视频提示词写作指南,我从头到尾读了三遍。官方自己把公式印在文档里:
完整镜头描述 = 镜头序列 + 主体细节 + 环境光影 + 运镜音效。
拆开看:
第一,镜头拆分。用 Shot 1、Shot 2 区分分镜,控制每段时长和切换。你不拆,模型就自己给你剪,剪成什么样全凭缘分。
第二,主体刻画。外貌、穿搭、动作、神态,写得越精细,人物稳定性越高。你只写"一个女人",它每条给你换一个女人。
第三,场景氛围。空间、布景、光线、色调。光源不写清楚,画面里的光就会打架——这是翻车重灾区。
第四,镜头运动加音频。推、拉、摇、环绕还是固定机位,环境音、人声、背景音乐,都要标注。
文档里还有几条"禁用要点",条条都是钱:不要只写静态画面,必须给连续动作;画面里的文字、字幕、对话气泡要单独标注;多张参考素材要分别标明用途——哪张是人脸参考、哪张是动作参考、哪张是场景参考。H3最多能吃9张参考图,你不标注用途,它就给你乱用。
发现规律了吗?官方文档的每一条规定,翻译过来都是同一句话:你少给一个维度的信息,模型就自由发挥一个维度。自由发挥就是翻车,翻车就是重抽,重抽就是烧钱。
提示词不是文学创作,是一份配置单。配置单填全,一次成片;填不全,拿积分赌运气。
从四段到九维:把官方标准变成生产线「我们AI编导课讲什么」
官方四段结构是好东西,
但它有个问题:知道和做到之间,隔着几百条废片。
你自己写的时候,怎么检查漏没漏维度?漏了哪个?用什么词补?写带货片子和写短剧,补法一样吗?
这就是我们点金手做「九维控场提示词」的原因。我们把官方四段拆成了九个导演维度槽位:视觉吸睛、镜头语言、灯光氛围、主体动作、情绪表情、物理交互、场景环境、转化指令、负面强控。
你把自己写好的、乱糟糟的提示词扔进去,它干三件事:
第一,拆稿归位。每个词组拆出来归进九个槽位,哪几个槽位是空的,一目了然。
第二,补缺不创作。缺的维度按导演思维补上,每维最多补1到3个词,但你的主体、核心动作、叙事顺序、商业卖点,一字不动。它是格式刷,不是重写器。
第三,负面强控兜底。九个维度里,镜头语言、灯光氛围、负面强控这三个是「安全三件套」,缺了必补——这是我们拿几百条实测提示词换来的经验,镜头定住、光统一、负面词兜底,翻车概率直接砍掉一大半。
九维之上,我们还内置了三套人脸正姿引擎:口播片走摄影纪实版、短剧走电影质感版、探店带货走素人抓拍版。人脸假不假,直接决定完播和转化,这一刀必须单独下。
一句话总结:官方文档告诉你什么是对的,九维控场保证你每次都对。
"最省钱的写法"的真正含义——不是少花钱,是让每一分钱都不打废片。
第四章:哪些内容必须用 Seedance 2.5——一分钱都省不得
先认清:云端贵的那部分,买的是本地没有的能力
很多人觉得云端平台黑心——一秒钟一块钱,抢钱呢?
错了。云端每秒收你一块钱,收的不是算力费,是「能力差价」。
7月31号 H3 发布,同一天,字节把 Seedance 2.5 全量放了出来。虎嗅在两家上线当天拿同一套题做了三轮同题PK:第一轮奇幻短片,H3守住了空间一致性和电影质感,但遗漏了部分分镜指令;2.5完成了运镜要求,但空间结构乱了。第二轮广告片,H3视觉更接近商业成片,但动作和镜头落点不准;2.5执行更准,质感稍弱。
同一天上线,同一个题库,打平。但注意,打平只发生在15秒以内这个擂台上。
2.5干的事,是直接把战场换了:30秒直出、60秒套娃、180秒超长模式、时间戳控制——第3秒转身、第5秒转场、第18秒掉眼泪,精确到秒下达指令。官方实测3分钟跨度内人物长相、服装、场景从头到尾不变样。
这些能力,H3一项都没有。不是弱,是没有。
打个比喻:H3是后期包装车间,文字渲染、Logo演绎、花字动效、品牌视觉一致性,再加全球第一的指令式编辑——一个后期机房的活儿。Seedance 是前期拍摄剧组,复杂运镜、多人互动、高张力画面、物理可信度,再加2.5的时间戳控制——一个剧组的活儿。
你说这俩是对手?这俩明明是上下游。
这五类内容,老老实实交「能力税,买会员,花积分!」
我给云端贵价视频起了个名,叫「能力税」——你不是在为一秒视频付费,是在为"本地没有的能力"交税。这五类,税躲不掉:
第一类:交付级的1080P和2K。品牌方验收、户外大屏、电商详情页首屏。客户要的就是分辨率,你交768P就是砸招牌。
第二类:超过15秒的剧情内容。短剧正片、品牌故事片、任何需要完整叙事节拍的片子。30秒直出、180秒超长,2.5是唯一解,H3连参赛资格都没有。
第三类:复杂动作和物理交互。舞蹈、运动、打斗、多人对手戏、液体布料火焰。这里有个反直觉的账:贵的模型一次成,比便宜的模型十次成,总账可能更省。算成本要算"单次价格乘平均尝试次数",不是只算单价。
第四类:人物特写对白戏。脸部大特写、情绪表演、指定台词的口播。H3的真人表演把塑料感去掉了,但表情偏"平"——做品牌广告没问题,做短剧人物要在镜头前哭、要崩溃、要愤怒,"温吞"就是短板。头部科技博主数字生命卡兹克那句话说得精准:某些需要超强张力的镜头,H3没有 Seedance 效果好。
第五类:没时间伺候机器的人。这一条不是视频类型,是人的类型。本地部署要维护环境、管模型版本、盯显存。你团队里没有那个爱折腾的人,云端贵出来的钱,就是省心的服务费。省心也是成本,别只盯着每秒单价。
反过来,这五类直接交给 H3 跑到爽
一,日更短视频的背景素材和氛围片,768P绰绰有余。
二,投流素材的批量草稿。千川素材一天测几十条,一条5秒云端768P两块五,本地五分钱电费。试错阶段是AI视频最大的浪费源,也是本地部署最大的金矿。
三,角色系列短片。R2V锁住角色长相,本地免费反复生成,连载剧情号、IP番外,成本几乎为零。
四,电商文字类视频。卖点卡、价格牌、招牌场景——H3的文字保持对 Seedance 2.0 是反超不是平替。
五,敏感素材。客户未发布的新品、有保密协议的内容——数据不出你办公室。这条值多少钱,做乙方的都懂。
第五章:三车道分流法——AI内容中台改造的施工图纸
算完账、画完边界,给你一张能直接用的施工图。我把它叫做「三车道分流法」:任何一条视频需求来了,先问三个问题,自动分流。
第一问:交付分辨率要多少?768P能过验收,进本地车道;必须1080P或2K,进云端车道。
第二问:画面复杂度几级?单场景、小幅度运镜、单人或无人,本地车道;多镜头叙事、复杂动作、多人互动,云端车道。
第三问:这条片子是草稿还是交付?试错期的一切版本,本地车道;定稿交付,按前两问的结果走。
三个问题问完,90%的片子有了自己的车道。剩下10%的模糊地带,记住一个默认原则:先本地跑草稿,满意了再决定要不要云端精修。草稿永远本地,这是铁律。
为什么是铁律?因为草稿的宿命是被扔掉。25版草稿里能活下来的通常只有一两版——给注定要扔的东西花每秒八毛,是内容行业最隐蔽的浪费。云端计费页面上那些"几块钱一条"的小额扣款,月底加起来,就是一台新显卡。
混合打法就是:本地出768P草稿,云端做2K精修。我拿一条真实片子算全账——15秒产品氛围片,从创意到交付:本地试25版草稿,电费两块五;定稿走官方重生成升2K,4块5;
全片总成本7块钱。
同样这条片纯云端路线,接近200块。一条差28倍,一个月100条,就是两万块的差距——一个剪辑师的工资,从账本里省出来了。
再往上叠一层:草稿验证过的方向,正式交付该上2.5上2.5。用H3低成本测方向,用小预算投流看数据,数据好的方向交给2.5攻成片,改稿再扔回H3的精准编辑——一条prompt改5个地方,改完质感不掉。
这,就是一个内容中台该有的样子:本地管"量",云端管"尖";本地管"试",云端管"交"。
第六章:内容分层的能力,就是我们说的「预算决策力」
写到这,把底牌亮出来。
你有没有发现,这篇文章通篇讲的"什么内容用什么模型、预算怎么分、提示词怎么写",其实就是我们 AI 编导课六力培养模型里的几项硬功夫。

预算决策力——清晰了解各平台积分消耗速度与性价比,按内容需求灵活选型、多平台混合生产,实现算力与Token成本最优配置。这篇文章的每一笔账,都是预算决策力的演算。
平台操控力——Seedance、可灵、MiniMax,每家平台的情报你得第一手掌握。哪个模型升级了、哪个平台在补贴、哪个能力闭源了,晚知道一周,账就算错一个月。
提示词架构力——四段结构、九维控场、五大公式,框架在手,模型随便换。
再加上导演叙事力、人物资产力、内容工程力——平台操控、提示词架构、算力决策、导演叙事、数字人资产、爆款工程,六大能力,构成一个「内容提示词工程师」的完整职业坐标系。
我把这套东西从两天的线下课,升级成了365天的线上学习平台:提示词网站、线上社群、以周为单位更新的AI编导内参报告,整个沉淀为一个职业技能培养模型。不是教你玩AI工具,是把AI变成你的一门手艺、一个岗位、一份资产。
去年10月我们开出国内第一期AI编导课,到今天开到第13期,学员都是国内头部品牌企业——他们拿课堂上的提示词框架,直接产出投放视频和TVC成片。在国内垂类的文生视频提示词课里,我们是有相当知名度的,这个不靠吹,靠一期一期学员的反馈说话。
8月14号到15号,石家庄,两天线下集训,带产品来、带成片走、带认证走。这篇九千字讲的本地部署怎么落地、三车道怎么分流、九维控场怎么用、双模型组合拳怎么打——课上全部拆成可以直接照抄的模板。
但这只是配菜。主菜是让你成为那个"会写字的人"。
最后说几句,门槛打穿之后,剩下的壁垒只有两个
最后说一层很多人没看透的。
H3把"每秒成本"打到了地板,但它打掉的是价格,不是分工。
算力贵的时候,大家拼的是谁充得起钱;算力便宜到本地一毛一条之后,人人都能无限试错——试错不再是壁垒,"一次就试对"成了壁垒。
门槛打穿之后,行业剩下的壁垒只有两个:你的审美,和你的提示词工程。
以前买算力是门槛,现在 H3 把算力门槛打穿了。当人人都有打印机,值钱的是会写字的人。
模型会换,牌桌会翻,但"会用提示词指挥算力"这个本事,一旦长在你身上,谁都拿不走。
上升期,靠算力多赢;下半场,靠提示词少输。我金句真多啊。
更多AI编导内容提示词干货文章点下方:
MiniMax官方提示词文档读了三遍后,告诉你视频提示词怎么写最能省积分和算力!
万字长文:MinimaxH3/SeeDance2.0/2.5全维度测评
十大升级告诉你:为什么 MiniMax H3 终于配做 Seedance 的对手了?
夜雨聆风