

2026年8月14日,中国科技圈被一枚双响炮炸醒了。
这次公开的是实打实的模型权重文件,已经躺在 Hugging Face 的服务器上,向全世界每一个人开放下载。
阿里通义千问团队干了一件让整个硅谷都倒吸一口凉气的事:他们把家族最强的2.4万亿参数巨兽和能塞进你家里游戏显卡的27B小钢炮,在同一天,全开源了。
是的,别再盯着闭源API那点可怜的token报价单了。游戏规则,从今天起,彻底变了
2.4T权重落地,“旗舰必须闭源”的说法站不住了
体量最大的是 Qwen3.8-2.4T-A95B。2.4万亿总参数,像一座数字版的珠穆朗玛峰,工程师更关心它的设计:这是一个MoE(混合专家)架构的巨物,拥有多达 512个专家模块,每次推理只激活其中10个加上1个共享专家。它虽然“身躯”庞大如天体,每一口呼吸只动用 95B的活跃参数。
这是什么概念?以前你家里想碰这种级别的模型,想都不要想。现在,虽然大部分人依然不会真的去下载那几个TB的权重文件(开玩笑,光硬盘就要一块专门的了),但关键是SiliconFlow、DeepInfra、Together这些主流推理云,在Day-0当天就把它架好了。
价格被直接打到了地板:输入 $2.00 / 百万 token,输出 $6.00。一场关于算力成本的血洗,就在你睡午觉的时候完成了。2.4T 模型卡使用专用的 qwen3.8-max 许可,和 27B 的 Apache 2.0 并不相同。

▲ SiliconFlow 在开放当天就宣布 Qwen3.8-2.4T-A95B 上线,并给出了极具杀伤力的 API 定价
“SoTA at home”:这是属于极客的浪漫,也是闭源厂商的噩梦
把这场发布会从“技术新闻”推向“社会事件”的,是那颗 27B 稠密模型。
请记住这个名字:Qwen3.8-27B。这是一个带着杀气的缩小版,目标就是塞进一张合适的显卡。稠密意味着所有参数都要参与计算;64 层网络里,有 48 层是Gated DeltaNet线性注意力,另有 16 层采用传统的全注意力。这种混合架构能显著压低长上下文推理时的 KV 缓存压力。
社区博主 Ahmad 贴出了一张深夜截图,配文写着:“SoTA at home,家里的机器,也能跑前沿模型。” 而官方团队的回复更绝,简直凡尔赛到了极点:“Yes, it's me , your SoTA at home!”
官方放出的跑分里,这个 27B 的“小家伙”在 OSWorld(电脑操作)上拿到84.3分,对照表中的 Opus 4.6 Max 为 72.7 分;AndroidWorld(手机操作)则是81.9对62.0。这些数字来自厂商测试,外部独立复跑还需要时间。

▲ 一句“家里的SOTA”,彻底点燃了本地模型社区的肾上腺素
Apache 2.0 协议足以让无数开发者连夜起立鼓掌。开发者可以在遵守许可证要求的前提下修改、商用和再分发 27B 模型,权重由此成了可以亲手改造的工具。

▲ 官方 Hugging Face 模型卡首页,Apache-2.0 的标志就是一道赦免令
卡里封神:一张旧显卡,装下你的“全能秘书”
为了让这神迹落地,生态圈的响应像密集的鼓点,一家接着一家。
vLLM 几乎是在官方发帖的同一时间段放出了 Day-0 支持声明。他们甚至贴心地算好了账:一张英伟达 GB300 显卡,在 1M 超长上下文下,还能塞下 大约 6.6M 个 KV token,能在同一张卡上同时跑满 6 个完整长度的序列。玩量化?官方给了 BF16 和 FP8,社区大神 @inferact 连更变态的 NVFP4 都给你配好了。
模型还内置了 MTP 投机解码,它会提前猜测后续 token,验证通过便能提升生成速度。官方实测短提示接受率:BF16 是 92.2%,FP8 是 84.8%。你感觉不到它在工作,它就已经把工作干完了。
Unsloth AI 也是秒级响应,直接把动态量化的 GGUF 包怼在了你脸上:想吃低保的,Q2_K 压缩到 9.98GB,一张老 12GB 卡就能跑;想过日子的,Q4_K_M 只要 15.41GB,一张 24GB 的 3090 或 4090,就能让一个能看图片、能改代码、能查文档的 Apache 2.0 多模态智能体在你桌子底下嗡嗡作响。

▲ 社区量化包同步上线,这是硬核玩家最爱的一集
甚至连硬件巨头 AMD 都跑来蹭了这波热度,宣布 Ryzen AI Max+ 和 Radeon AI PRO R9700 也能 Day-0 跑起来。以前只能当生产力冤大头的专业卡,现在被模型逼着开始重新计算自己的性价比。

▲ 连 AMD 都来抢位了,开源模型的号召力可见一斑
“操作之神”还是“思考之王”?一次关于权威的祛魅
热闹之外也得泼点冷水,看看它究竟在哪些任务上失分。
独立分析博主 Origin 做了一张很有意思的分差条形图。他像审计一样逐项比对 27B 和 Opus 4.6 Max 的公开跑分:十九项里,Qwen3.8-27B 拿下了十五项,尤其是 OSWorld、AndroidWorld、文档处理这些“动手操作现实世界”的任务,赢得摧枯拉朽。
但红字标出的那四项败绩,恰恰卡在了一个微妙的位置:HLE(人类终极考试)、GPQA(博士级科学问答)、Terminal Bench(终端长程工程)、仓库级生成。这些是什么?是极致的推理深度,是那种需要模型在脑子里反复盘算、构建世界观、甚至质疑题干的“沉思派”任务。

▲ 红色柱体是 27B 不如对手的项,值得深思
这些结果显示,Qwen3.8-27B 的优势集中在操作任务,深度推理仍有短板。它能流畅地帮你点开浏览器、翻找文件、操控虚拟机。在纯粹、抽象、脱离具身环境的思维马拉松里,27B 的参数量依然是一个物理天花板。
这也是为什么阿里要双轨操作:用 27B 的 Apache 2.0 去编织本地开发者生态,去占领边缘算力和私有化需求;再用 2.4T 的开放权重去云端冲击闭源大厂的最后堡垒。27B 面向个人开发者,2.4T 则承担企业级云端需求。这盘棋,下得比它模型里的注意力机制还要精密。
狂飙之后,留下了一个没有围墙的世界
回顾这十一天,发布节奏排得很紧8月3日,Max API 上线,博客预告“下周开源”;8月13日,2.4T 巨兽的重量级文件包在 Hugging Face 出现;8月14日,27B 权重落地,vLLM、Unsloth、AMD 全线跟进。
这次发布已经超出“刷存在感”的范畴,开放权重模型又向闭源商业服务逼近了一步。
省下某个网站每月二十美元的订阅费,也绕开聊天框预设的交互方式。准备一块显存合适的显卡,下载一个几十GB的量化文件,然后你会听到风扇轰然作响,那是属于你自己的智慧,在替你去征服那些无穷无尽的电子表格、深夜的代码库、还有那些无处安放的想象力。
那辆名为“通用人工智能”的列车,以前只对头等舱乘客开放。今天,通义千问在每一张普通人的车票上,都盖上了Apache 2.0的印章。
属于闭源世界的那个“苹果税”时代,也许还没终结。但今天,它的城墙,被这两个一轻一重的模型,从不同的方向,同时撞出了裂缝。

夜雨聆风