AI视频价格砍到主流1/3!国产MiniMax H3发布,2K原生立体声还官宣开源
AI视频生成最近有多火,不用我多说。你刷到的那些"科技感"画面,不少就是它产的。
但真自己上手玩过的人都知道,这玩意儿烧钱。按秒计费,想要高清、想要时长,价格蹭蹭往上走,普通人玩两回就缩回去了。
前天,国产的MiniMax把价格打下来了。
价格,是这次最狠的地方

H3是MiniMax 7月31日发布的全能多模态生成模型。一句话概括:文本、图片、视频、音频一起理解,直接生成带原生立体声的视频,最高2K分辨率、15秒。
官方博客给了两个硬数字:
2K分辨率下,H3每秒的价格不到主流模型的三分之一; 768p下,比主流720p的价格还便宜一半以上。
这话的分量得拆开看。以前AI视频是"高清=贵"的死结,想要2K就得掏大钱,普通人只能拿低清凑合。H3直接把2K做成默认档位,价格还只有主流的三分之一。这不叫降价,这叫把门槛拆了。
便宜之外,它把"全能"做成了卖点
光便宜还不够,H3这次真正想干的事,是把视频生成从"各管一摊"变成"一个模型通吃"。
这里选了几个官方宣传视频
H3视频生成:
原生立体音
H3应用场景
电影片头
产品网站
以前视频生成是一堆细分模型各管一摊:文生视频、图生视频、首尾帧、主体参考、动作参考……声音更是另外一摊,配乐、音效、人声分开搞。做一条片子,要在好几个工具之间来回倒腾。
H3把这些全并进一个模型。官方给的例子很直观:你给它一段参考视频、一张图、一段音频,用一句话说清"镜头运动学视频1,人物按图片2的样子唱歌,声音跟音频3一致",它自己就能把多模态信息揉在一起出片。
背后的技术叫Contextual Omni Representation,大白话就是:模型真正"看懂"了你说的关系,而不是傻乎乎只认一个输入框。官方说它特别擅长指令跟随、文字和品牌呈现、动作迁移——做广告、做电商、做UI演示的,都是冲着这几样来的。
官宣开源,但权重还没落地
更狠的是,MiniMax官宣H3开源,权重未来几天放出。
视频生成这块,一直是闭源模型的天下。Sora、Veo这些,权重看都不给你看。MiniMax要当那个把视频生成也拽进开源生态的——对开发者来说,这意味着能自己微调、能部署到自己硬件上,不用再被闭源API的价格和规则拿捏。
该泼的冷水也得泼。
第一,开源是官宣了,但权重还没落地。官网写的是"未来几天放出",我写稿这会儿去查,官方仓库还没影儿。"coming days"这种说法,余地留得很大,等真放出来才算数。
第二,15秒、2K是上限,不是日常。真拿去做一支完整片子,还是一段段拼、一段段调。
第三,价格对比是"每秒"口径,主流模型也各有各的档位。闭源这边其实早就松动了——Sora 5月底直接停服,我当时写过《Sora停了,AI电影凉了,学术界也炸了》。现在还站着的Veo们,面对三分之一的价格,不可能一直端着不动。
但方向是清楚的:视频生成正在复制大模型走过的路——先贵后便宜,先闭源后开源,先各管一摊后全能通吃。价格被打下来,普通人玩得起,这本身就是最大的进步。
至于H3能不能兑现"开源+全能"的承诺,那是另一个问题。等权重放出来,跑一跑就知道了。
数据来源:MiniMax官方博客(minimax.io)
以上。既然看到这儿了,如果觉得不错,随手「点赞、在看、转发」三连;想第一时间收到推送,给我加个星标⭐~谢谢你读到这里,我们下期见。
夜雨聆风