你的算力费,一半交了「抽卡税」
如果你问我,做AI视频的公司,钱到底烧在哪?
我的答案只有一个:抽卡。
一条提示词扔进去,模型给你一条废片。改两个字再扔,还是废片。一个镜头十连抽、二十连抽,积分像自来水一样流走。很多老板月底一看账单,素材没出几条,算力费先干出去大几千。
我管这个叫「抽卡税」——提示词写不明白,就要不停地给模型交税。

这里没有神话,只有计算。抽卡税能不能省?能。而且省法的答案,就写在MiniMax的官方提示词文档里。
这篇文章,我想把这件事一次性讲透。
第一章:牌桌变了——MiniMax H3掀了Seedance的桌子
先说大势。
做AI视频的人都知道,过去这一年多,视频生成这个牌桌上,Seedance一家独大。画质好、生态全,但你没得选,价格人家说了算。
7月31号,MiniMax把H3开源了。
我先给结论,再给数字:
H3的效果,能平替Seedance 2.0 fast大约80%的场景,价格却不到一半。详细的内容大家看我写的这个万字长文,评测得非常的细致。
万字长文:MinimaxH3/SeeDance2.0/2.5全维度测评
注意,80%这个数字不是我拍脑袋的。是做漫剧量产的一线团队,把生产工具里的模型直接换成H3、直出一批视频之后给的实测结论。现在大部分漫剧工作流的主力规格,本来就是fast 480P超分到720P在跑——H3正好卡在这个量产档位上。
再报一组更狠的数字:
同规格实测,H3生成2K视频、一次出4条,消耗370积分;Seedance 2.0跑1080P,要1904积分。活动期间,H3的价格低至0.1元每秒。
什么意思?同样的预算,别人抽一次卡,你抽五次。
而且H3还有一个杀手锏:一抽四、一抽八。一条提示词,一次直接给你四个版本,表情、动作、镜头节奏各不相同,挑最满意的一条用就行。
素材量就是选片空间,选片空间就是成片率。
很多人看到这会说:那我把模型全换成H3不就省钱了?
这是极大的误解。
第二章:垄断打破之后,分水岭不是模型,是提示词
你以为省钱的关键是换便宜模型,其实是让便宜模型听话。
为什么以前漫剧团队宁愿多花钱也要用Seedance?画质吗?不是。单论画面惊艳度,有些模型比它更炸。
真正的原因是三个字:可控性。
提示词优化到位的情况下,Seedance的抽卡次数是可控的——你大致知道写什么样的提示词,几次之内能出能用的片。而有些模型,你怎么抽都是赌,抽到最后只能自己降低预期,捏着鼻子接受一条。
现在H3把这条路打通了。它对提示词的遵循度极高,人物动作自然,前后逻辑合理,能完成复杂的动作和镜头调度,不会突然给你做出一些莫名其妙的动作来。官方文档里,文生视频的提示词上限开到了2000字——Seedance那边也是2000字封顶,这个规格就是对标着专业工作流去的。
看明白了吗?
模型越听话,提示词就越值钱。
以前模型不可控,提示词写得再好也是白搭,大家拼的是谁积分多、谁命好。现在模型可控了,同一台机器、同一份积分,提示词写得好的人一次成片,写得烂的人十连抽全废。
差距从这一刻起,不在显卡上,在提示词上。
提示词,就是算力的杠杆,
Minimax省钱的前提是你会写精准控场提示词。
第三章:MiniMax官方文档里的省钱密码——四段结构
我把MiniMax官方那份视频提示词写作指南,从头到尾读了三遍。
官方自己把「完整镜头描述」的公式印在文档里:
完整镜头描述 = 镜头序列 + 主体细节 + 环境光影 + 运镜音效。
拆开看:
第一,镜头拆分。用Shot 1、Shot 2区分分镜,控制每段的时长和画面切换。你不拆,模型就自己给你剪,剪成什么样全凭缘分。
第二,主体刻画。外貌、穿搭、动作、神态,写得越精细,人物稳定性越高。你只写「一个女人」,它每条给你换一个女人。
第三,场景氛围。空间、布景、光线、色调。光这一项,是翻车重灾区——光源不写清楚,画面里的光就会打架。
第四,镜头运动加音频。推、拉、摇、环绕还是固定机位,环境音、人声、背景音乐,都要标注。
文档里还有几条「禁用要点」,条条都是钱:
不要只写静态画面,必须给连续动作——静态描述出来的东西大概率不能用,这一条就是一次重抽。
画面里的文字、字幕、对话气泡要单独标注——不标注,乱码满天飞,又是一次重抽。
多参考素材要分别标明用途:哪张是人脸参考、哪张是动作参考、哪张是场景参考。H3最多能吃9张参考图,还能文字、图片、视频、音频联合输入,但你不标注用途,它就给你乱用。
发现规律了吗?
官方文档的每一条规定,翻译过来都是同一句话:你少给一个维度的信息,模型就自由发挥一个维度。自由发挥就是翻车,翻车就是重抽,重抽就是烧钱。
提示词不是文学创作,是一份配置单。配置单填全,一次成片;填不全,拿积分赌运气。
第四章:从四段到九维——把官方标准变成可复制的生产线
官方四段结构是好东西,但它有个问题:知道和做到之间,隔着几百条废片。
你自己写的时候,怎么检查漏没漏维度?漏了哪个?用什么词补?写带货片子和写短剧,补法一样吗?
这就是我们点金手做「九维控场提示词」的原因。
我们把官方的四段结构,拆成了九个导演维度槽位:视觉吸睛、镜头语言、灯光氛围、主体动作、情绪表情、物理交互、场景环境、转化指令、负面强控。

你把自己写好的、乱糟糟的提示词扔给它,它干三件事:
第一,拆稿归位。把你原稿里每一个词组拆出来,归进九个槽位,哪几个槽位是空的,一目了然。
第二,补缺不创作。缺的维度按导演思维补上,每维最多补1到3个词。但你的主体、核心动作、叙事顺序、商业卖点,一字不动。它是格式刷,不是重写器——刷完还是你的稿子,只是更专业。
第三,负面强控兜底。九个维度里,镜头语言、灯光氛围、负面强控这三个是「安全三件套」,缺了必补。这是我们拿几百条实测提示词换来的经验:镜头定住、光统一、负面词兜底,翻车概率直接砍掉一大半。
官方文档说「不要写静态画面」「字幕要单独标注」,落到九维里,就是第④主体动作和第⑨负面强控。官方讲原则,九维给执行。
九维之上,我们还内置了三套人脸正姿引擎——口播片走摄影纪实版、短剧走电影质感版、探店带货走素人抓拍版。因为人脸假不假,直接决定完播和转化,这一刀必须单独下。
一句话总结:官方文档告诉你什么是对的,九维控场保证你每次都对。
抽卡次数砍半,省下来的积分是实打实的钱。这才是「最省钱的写法」的真正含义——不是少花钱,是让每一分钱都不打废片。
模型会换代,AI编导提示词的本事不会换。

最后说几句。
我程序员出身,买过几百万的显卡,做过一年数字人,我见过太多人死在「差生文具多」上——模型出一个追一个,会员开了一堆,提示词还是那三句半。
时代变了。H3这一开源,闭源视频模型横行霸道的日子基本宣告结束。以后的算力只会越来越便宜,便宜到人人用得起。
到那时候,拼什么?
拼谁能用提示词,把算力指挥得指哪打哪。
模型会换,牌桌会翻,但「会用提示词指挥算力」这个本事,一旦长在你身上,谁都拿不走。
我们把提示词升级为了九维控场提示词,不单单是四镜,而是在四镜之上,要做到精准控场,精准的控制内容的输出。在之前,Seedance 2.0和其他的文本生成视频时代是无法做到这件事的!
8月14号、15号,我们点金手的AI编导课,两天时间,就把这套东西装进你的业务里——九维控场提示词怎么用、三套人脸引擎怎么调、文生图生视频怎么搭进你现有的生产线。不是讲概念,是手把手出片。
能省算力,谁还烧算力?能一次成片,谁还十连抽?
上升期,靠算力多赢;下半场,靠提示词少输。
评论区里,老板们聊一聊:你上个月的抽卡税,交了多少?
更多Ai编导提示词文生视频干货文章:
夜雨聆风