ARTICLE · 1055573
fal.ai 的 MiniMax H3 Max,到底划不划算?
内容摘要
fal.ai 上的 MiniMax H3 Max 被称作短剧视频的性价比之选。把价格、速度和隐藏成本算一遍:它的优势真实存在,但只在你愿意改流程的前提下成立。

做 AI 短剧的人最近常被问到一个问题:fal.ai 上的 MiniMax H3 Max,值不值得换过去?
这个问题很容易答错,因为大多数人一上手就去比"每秒多少钱",而真正的差距其实藏在三个地方:它是不同的模型、它的便宜是限时的、它的速度优势伴随一组没写在价格表上的前提。下面按成本、速度、能力、风险四条线拆开讲。
一、先绕开一个坑:H3 Max 不是 Hailuo 的"Max 档"
这是最常见的误解。很多人以为 H3 Max 是 Hailuo 02 或 Hailuo 2.3 的高配版本,就像手机的标准版和 Pro 版。不是。
Hailuo 02 和 Hailuo 2.3 在 fal 上根本没有 Max 档。H3 Max 属于新一代的 H3 家族,是 MiniMax 与 fal 联合发布、由 fal 在 MiniMax H3 基础上再训练出来的变体。fal 自己的说法是:它针对"更强的提示词遵循"和"更好的画面"做了调优,并且和 fal 的推理栈做了联合优化。
所以正确的做法是把它当做一个新模型来评估,而不是当老模型的一次升级。这也解释了后面那个看起来矛盾的现象——它在价格上和官方几乎一样,在速度上却快出一个数量级。
二、价格:按秒计费,促销是唯一的便宜窗口
fal 的视频模型按"生成出来的秒数"计费,并且随分辨率分档。以下是 2026 年 9 月下旬的官方价目(单位:美元/秒):
打"5 折"的三行,是限时促销,2026 年 9 月 30 日结束。之后 H3 Max 图生视频回到 480p/768p/1080p 分别 0.05/0.08/0.16 美元每秒。
1. 和官方、和其他平台比,它到底贵不贵
把 fal 的原价和 MiniMax 官方 API 放在一起,会看到一个很有意思的结果:
- MiniMax 官方 H3-Max:480P 每秒 0.05 美元,768P 每秒 0.08 美元。
- fal 的 H3 Max:原价 0.05 和 0.08,和官方一模一样;促销期才是它的一半。
也就是说,fal 并没有在 H3 Max 上做价格优势,它做的是速度优势。而老一代的 Hailuo 2.3,在 fal、Replicate、Novita 上的价格也完全一致——768P 六秒都是 0.28 美元,1080P 六秒都是 0.49 美元。这类模型的价格基本是全网统一的,中间商不靠差价赚钱。
唯一的例外是非 Max 的 H3:fal 报 768P 每秒 0.06 美元,比官方的 0.08 美元低 25%。如果你不需要极限速度,这条线反而更便宜。
2. 参考图另算钱,这才是短剧的隐藏成本
如果你们的流程是"给模型喂一组分镜参考图,让它照着画",那真正要看的不是上面那张表,而是"参考图生视频"这个端点。
它按参考图的尺寸收"token 费":前 4096 个 token 免费,超出部分每 1000 token 收 0.02 美元。图片会先把短边缩到 1024 像素再算 token,所以:
- 1:1 方图,1K token,约 0.02 美元
- 16:9 或 9:16 竖图,1824 token,约 0.036 美元
一集短剧一个镜头通常喂 9 张竖版九宫格参考图,那就是 9 × 1824 ≈ 16416 个 token,扣掉免费的 4096,计费 12320 个 token,约 0.25 美元。这个数字单看很小,但它让"参考图模式"和"单首帧模式"的价差一下子显出来了。
三、换算到自己的账:一个镜头到底多少钱
把上面的数字代进一个真实场景:15 秒、768P、9 张竖版参考图,也就是短剧分镜的典型配置。
走 fal 的参考图端点:视频 15 × 0.08 = 1.20 美元,参考图约 0.25 美元,合计约 1.45 美元/镜。
这个端点不打折,所以这就是它的全价。
但如果改成"只喂一张首帧图"的普通图生视频,促销价下 15 × 0.04 = 0.60 美元/镜,用 Turbo 更是只有 15 × 0.02 = 0.30 美元/镜。代价是你丢掉了多参考图带来的画面控制力——这是短剧最需要的东西。
作为对照,我们自己的短剧管线走的是 metaso.cn 网关,计量单位是"H3 积分"。账本记录一个镜头约 181.5 积分(提示词优化 5.70 + 参考图 22.80 + 768P/15 秒输出 153.00)。用官方价反推,153 积分对应官方的 1.20 美元,也就是1 积分约等于 0.0078 美元。按这个折算,一个镜头约 1.42 美元。
需要说明:这个汇率是用官方价推出来的,不是 metaso 公布的,仅供参考。
把三个数字并排放:
- 现在(metaso,9 张参考图):约 1.42 美元/镜
- fal 参考图端点(9 张参考图,不打折):约 1.45 美元/镜
- fal 单首帧端点(促销):约 0.60 美元/镜
- fal Turbo 单首帧(促销):约 0.30 美元/镜
结论很直白:如果沿用九宫格多参考图的流程,换到 fal 一点都不省钱;只有愿意改成单首帧,在促销期内才能省一半到七成。
四、速度:这才是 H3 Max 真正的杀手锏
价格上没便宜多少,速度上却是断层式的差距。fal 自己公布的推理耗时(不含排队):
注意 15 秒那栏:生成一条 15 秒的视频只花约 15 秒,基本是"片子多长就等多久"。作为对比,老一代模型在各大平台都要一分半到四分钟:
- Replicate 上的 Hailuo 2.3,6 秒 / 768p,实测 96.8 秒
- Replicate 上的 Hailuo 02,6 秒 / 1080p,实测 217.8 秒
- WaveSpeed 上的 Hailuo 2.3 标准档,自报 92 到 110 秒
也就是说,同样一条片子,新一代和上一代差了十到一百倍。fal 的说法是:H3 Max 的吞吐量约是官方 H3 端点的 35 倍,比"质量相当的产品"平均快 15 倍。
1. 但秒级数字藏着三个前提
第一个前提:不含排队和冷启动。fal 公布的 2.46 秒是"已经在运行的热 GPU 上"纯推理的时间。端到端还要叠加排队、提示词扩展和编码。fal 自己公开的冷启动数据是:准备阶段中位数 43 秒,整体冷启动中位数 48 秒。空载时是秒级,冷启动时可能退回一分钟以上。
第二个前提:提示词扩展会吃掉速度。fal 把提示词优化折进了同一次请求,有 disabled、balanced、quality 三档。balanced 大约多花 1 秒,quality 最多要花 30 秒——正好把速度优势抵消掉一批。
第三个前提:参考图端点的耗时没有公开数据。你们那 9 张九宫格 tile 走的是参考图端点,而 fal 只公布了图生视频和文生视频的耗时。参考文件越多,耗时越长,这个增量没人能给准数。
五、除了快和便宜,fal 还多给了什么
这些是官方通道目前没有的能力,对做剧的人来说才是长期价值:
- 相机控制:用关键帧控制镜头环绕、俯仰、远近,做运镜不用碰运气。
- 对口型:按音频驱动口型,可选 2K 输出,省掉一条单独的驱动链路。
- 实时连续流:导演模式可以边下指令边连续生成,按秒计费(每场最低 60 秒)。
- 参考视频与参考音频:除了图片,还能把视频片段和音频当成参考素材。
- LoRA 训练:训练 1000 步约 5 到 15 美元,可以训自己的风格或角色,训练完在自己的端点上加载。
- 原生立体声:配乐、对白、拟音、环境声随画面一起出来,还支持从参考录音克隆音色。对于配音还没接通的团队,这一条可能比省钱更重要。
- 时长灵活:5 到 15 秒按秒计费,重刷短镜头时不用为整段付费。
- 每天 5 次免费:登录 fal 的账号每天有 5 次 H3 Max 免费额度,用来试画面质量很合适。
六、风险:什么时候它不划算
- 促销 9 月 30 日到期。过期之后,单首帧端点的价格翻倍,相对现在的通道就没优势了。
- 多参考图端点从不打折。九宫格那套连续性策略,恰好落在最贵且不促销的那条线上。
- H3 Max 原生只到 768p。它的 1080p 是从 768p 做的一次精修,要真正的 2K/4K,得切回非 Max 的 H3。
- 跨境成本不在单价里。网络、支付、发票和合规都要单独算账。
七、我的建议:先做一次同镜对照,不要直接切
最有价值的动作不是迁移,而是一次对照实验。
挑一到两个已经做好的分镜,用 fal 的单首帧图生视频端点(促销价,15 秒约 0.6 美元)重跑一遍,然后和老版本并排看:在只有一张首帧图的情况下,站位、朝向、人物间距和背景物体的连续性掉了多少。
如果画面能接受,那在促销期内把它当成补镜头和重刷的廉价快速通道;如果连续性明显不行,那按现有流程,fal 并不划算。真正该考虑换过去的情况是两类:你需要 2K/4K,或者你需要相机控制、口型驱动这些官方通道给不了的能力。
顺带一个立刻能做的动作:fal 每天 5 次免费额度,足够你把"速度"和"画面"这两个问题一次测完。