乐于分享
好东西不私藏

AI 模型 Ox Alpha 免费一周:你是白捡,还是白交?

AI 模型 Ox Alpha 免费一周:你是白捡,还是白交?

8 月 21 日凌晨四点多,一个模型悄悄出现在 AI 模型的分发平台上,标价零。平台叫 OpenRouter,相当于模型界的应用商店,各家模型都挂在上面卖。这个新来的,提供方一栏只有一个词:stealth——隐身。没有公司名,没有团队介绍,模型名叫 Ox Alpha,整个页面干净得像一张没签名的名片。

免费的模型不稀奇。稀奇的是它把能藏的全藏了:大脑参数没公开,拆词方式标成「其他」,连提供方那一栏都只是个占位词。输入还能读视频,规格看着很全。可你仔细想:一个连名字都不留的模型,它图什么?

它到底是谁

先说它是什么。规格单上最显眼的叫上下文窗口——模型一次能「看到」多少材料——一百万个 token。token 是模型眼里的最小文字单位,大约一两个汉字;换算过来,相当于一次能吞进百万字量级的材料,再接着干活。输入不止文字,图片、视频都能读。

怪的是页面上的其他字段。它是个推理模型——回答前先自己琢磨一会儿,像做题先打草稿的那种——而推理档位锁死在最高一档,连「不琢磨直接答」的选项都不给你。更怪的是它没有内容审核层:平台在模型外面挂的过滤闸,拦不当内容用的,大多数上架模型都有,它没有。这两条写在接口字段里,转述的时候基本都被跳过了。

剩下的字段,一样比一样沉默。tokenizer——把一句话拆成最小单位的方式,每家拆法不同,像笔迹一样能认人——标成「其他」;权重一栏空着。权重就是模型的「大脑参数」,不公开,等于只给用、不给研究。

那它到底是谁家的?目前只有推测。有开发者反复拿它的拆词方式做指纹比对(把这些拆词特征当签名,去认它是谁家的),结果和 GLM 系某个版本的拆法几乎逐一对齐,每段对话固定差一小截——指向智谱,但无人证实。顺着这条线,有技术博主猜它是 GLM 家族的某个变体;反方猜小米、腾讯、谷歌的也都有。官方一个字没回应。

「很厉害」:现在只有感觉,没有证据

所有说它强的说法,目前都缺一个东西:独立证据。 它的页面没有第三方评测机构的评分——就是那种标准化的跑分栏目,别的模型一上架就带着,它没有;公开的编程榜单上,也没有它的名字。一篇科技媒体专门报道了它,标题喊得很响,正文却自己承认:没有任何独立评测。

那「很厉害」的印象哪来的?主要是个人开发者的试跑。有人拿编程题试它,有人拿推理题试它,都是个人在自己环境里跑出来的感受,不是标准化评测;流传最广的所谓高分,来源就这么松。同样是个人试跑,倒有一条值得看——因为它没往高处说:速度不算惊艳,但单位时间干出来的活,和 DeepSeek V4 Flash 差不多,也许还略多。

也就是说,靠别人嘴里的「感觉」,评不出这个模型的成色。感觉可以是真的,但感觉不是证据。

那我自己测了一轮

光说别人不算。我们自己搭了一套题去测它:六个方面、十六道题,中文改写、推理、写代码、按指令输出、常识问答、还有安全问题各占一块。规矩是提前定死的——题目原文存档不改,只给一次作答机会,不追问不提示;能用程序判对错的,一律交给程序判,不靠人打分。

结果是:能机器判的十五道,它全过了。

挑三个说。一道容斥类的应用题——就是算数量时要扣掉重叠部分的那种——它算对了,过程也完整。一道写代码的题,配的五个测试用例全跑通,包括故意留的空输入和超长输入。最能看出功底的是一道「四重约束」题——要求正好五十个汉字、不许出现三个指定的词、必须用问句开头、必须用感叹号收尾——它四条同时满足,一条没漏。

还有一道我原本没指望的。我问它:你是谁,参数多少,训练数据截止到什么时候。它没编。它直说这几项它不知道。

但请注意,这不是评测。 十六道题定不了一个模型的成色,一次作答也躲不开运气;更关键的是,这类测试跑在会话里,采样参数——控制模型每次怎么发挥的几个旋钮——没法固定,同一道题换个时候问,答案可能就不一样。所以我能说的只有一句:这十五道题它做对了。 说它「很厉害」,我这套东西还不够格。

这恰恰是我想让你看清的地方——连认真搭一套题、把过程都留档,也只走到「这几道题它做对了」为止。那些一句话就断定它屠榜的,凭的是什么?

同一套剧本,今年三月演完过一次

这套「匿名、免费、神秘」的打法,今年三月完整演过一次,连结局都有。三月中旬,一个代号 Hunter Alpha 的模型在同一个平台上匿名上架,免费。一周之内,它登顶了平台日榜——就是当天调用量的排行榜——处理了超过一万亿个 token。

没人知道它是谁。社区把能猜的实验室猜了个遍,讨论最集中的方向一度指向 DeepSeek 的新版本。

一周之后揭晓。猜错了。

是小米。前 DeepSeek 研究员、小米 MiMo 的负责人罗福莉公开认领——Hunter Alpha 是自家 MiMo-V2-Pro 的早期内部测试版。一个内部测试版,匿名扛了一周真实流量,然后收费。

揭晓之后,价格立刻跟上:每百万 token 一美元起步。免费与收费之间,只隔了一次揭晓。

而小米这一次,只是名单里的一个。同一个平台上,这样匿名上架、最后被认领的,前面一共四个:智谱、小米、蚂蚁、美团,一家一个。

Ox Alpha 是第五个。 它会不会走同一条路,没人能保证——但前面四个,到头来都被认领了。

你付的不是钱

先把利益相关说清楚:我自己的内容产线,日常就跑在 OpenCode 的调用通道上,这个新模型也已经挂进了我的模型列表。下面没有推荐,只有风险提示。

免费模型不向你要钱,但它总得图点什么。最容易想到的那个答案,是你的数据。

关于数据,官方给了两份口径,两份不一样。OpenCode 官方在 X 上发帖,说「零数据留存」;帖子底下第一条热评就在问:既然零留存,那图的是什么。而平台挂出的模型说明里写的是,对话内容会被提供方保留,只是不用来训练。

「不留存」和「保留但不用来训练」,不是一回事。我不下结论说谁在撒谎——但「你的对话去了哪」,官方自己都没对齐。

同一篇帖子里还号称几乎不限量,却有开发者反映,第一个请求就被卡住了。

就算数据真的不留存,你也得先想清楚自己喂进去的是什么。把公司代码贴进去调优的工程师,把客户名单丢进去做分析的运营,把还没发布的方案丢进去问意见的产品经理——这些内容只要经过一次调用,就变成了「送出去的东西」。它记不记、用不用,你无法验证。

你以为是在白捡一个很厉害的模型。不,你正在参与一场交易——付的不是钱,是你真刀真枪干活时喂进去的那些东西。 官方给的窗口是一周。一周之后是收费、是揭晓、还是继续免费,现在谁也说不准。

匿名投放,为什么越来越多

把镜头拉远看就明白了:这个平台上,美国几家公司的模型占掉的调用量,一年时间从七成掉到三成左右;而编程这一类用途,已经涨成了平台最大的一块。份额战的打法变了——先用免费把开发者手里的活接过来,再谈定价。至于为什么匿名,官方没解释;但匿名带来的效果是清楚的:你还没弄明白它靠不靠谱,就已经把活丢给它了。

什么活可以丢给它,什么活不行

可以丢给它的:可丢弃、可重来、不涉密的活。翻译一段公开文案,让两个模型互相改稿,查一个不需要保密的资料点——这些就算它抽风,代价也小。

不能丢给它的:正在跑真业务的活、公司的数据、客户的资料、还没发布的东西。企业代码和客户名单尤其别拿去试——一旦进了对话,就不再只是你的了。

判断标准只有一条——如果它明天消失,或者下个月开始收费,你手上有没有一件事会因此卡住?有,就别用;没有,随你。

还有一层别忘了:它「很厉害」这件事,目前没有独立证据。把重要活交给一个只有感觉的模型,和交给一个有评测、有公开权重的模型,赌注不一样。

回到开头那个凌晨四点。一个连名字都没留的免费模型,是白捡,还是白交?它也许真的很好用,也许下周就收费,也许明天被认领——但这些都不是你现在就该把活交出去的理由。在点下「使用」之前,先想清楚自己送出去的是什么。想清楚了,用不用它,都是你的自由。

你有没有为了「免费」两个字,把什么东西顺手交出去过——手机号、通讯录,或者贴进某个免费工具里的一份资料?评论区聊聊。

来源

  • • OpenRouter 官方模型接口:stealth/ox-alpha 条目(规格字段、定价、内容审核与推理档位、tokenizer/权重状态)
  • • OpenCode 官方 X 帖(8 月 21 日):宣布该模型免费一周,含「零数据留存」表述、日产能说明,以及评论区对该表述的质疑
  • • Startup Fortune 报道《A Mystery Model Called Ox Alpha Just Topped Coding Benchmarks For Free》:标题与正文自承「无独立评测数据」之间的落差