夜雨聆风学习资料网

ARTICLE · 1033555

昨天写27B能塞进你电脑,今天有人把它压到5.9GB塞进浏览器

昨天写27B能塞进你电脑,今天有人把它压到5.9GB塞进浏览器

新视界探索者 · AI 赛道日更观察

昨天写27B能塞进你电脑,今天有人把它压到5.9GB塞进浏览器

PrismML 三值量化 Qwen3.8-27B,98.2% 能力留住,打开网页就能跑

昨天我刚写完一篇 Qwen3.8-27B 能在你电脑上跑的文章,今早刷手机又看到一条:有人把同一款 27B 压到了 5.9GB,说浏览器打开就能用。我盯着那个数字看了好一会——5.9GB,比我手机里几张照片加起来还小。

放出这东西的是 PrismML,模型叫 Bonsai 2 27B。它不是新训练出来的,是拿阿里千问的 Qwen3.8-27B 做了极致压缩。说白了,昨天那篇的主角,今天换了身更轻的行头。

它到底怎么压的

办法叫三值量化。正常大模型的权重是几十位小数的浮点数,Bonsai 2 把它只留三个值:-1、0、+1,再配上 FP16 的分组缩放。算下来每个权重平均只花 1.76 个比特。整包体积从全精度的五十多 GB,掉到了 5.9GB,缩了大概 9 倍。

你大概会担心压这么狠能力还在不在。PrismML 给的说法是,综合基准分数保住了 98.2%,只掉了 1.5 分左右。掉的不是重点,留下来的是大局。

为什么比又发个大模型更让人高兴

我自己的判断:这件事的甜头不在参数,在"门槛"。过去想跑 27B,怎么也得一张 16GB 显存的卡,还得会配环境。现在 5.9GB 这个体积,直接能在浏览器里用 WebGPU 跑,不用装本地程序,不用租 GPU。

我试过在脑子里推演那个场景:你打开一个网页,等几秒模型加载完,就能在本地跟一个 27B 对话、让它写代码、看图。资料全程不离开这台设备。对怕资料外传的人,这比什么旗舰 API 都踏实。

它真正强在哪

划重点

Bonsai 2 这一代提升最明显的,不是单纯打分,是写代码的智能体活、多模态推理、还有长线调工具这三块。它留着 262K 的上下文,能看图,在 RTX 5090 上能跑到 143 token 每秒。协议是 Apache 2.0,能免费商用。

换句话说,它压完不是个只能聊天的残血版。本地写脚本、读图、跑一连串工具调用,这些才是它冲着去保留的本事。对想在自己机器上搭 Agent 的人,这点比多几分配方实在。

压缩前后摆这儿

体积对照

全精度版:约 52GB,得靠显卡三值版:5.9GB,浏览器或笔记本就能动分数折损:98.2% 保留,掉 1.5 分显存门槛:从 16GB 显卡 → 一块支持 WebGPU 的浏览器

两月前 PrismML 出过第一代 Bonsai 27B,当时证明了本地能跑。这一代把三值量化推到了能用的水平——路线不是把模型做小,是把同一个模型压得更省。端侧 AI 的比拼,正从"谁能跑"转向"谁跑得省"。

怎么动手试

说点实在的,怎么上手。PrismML 放出了能在浏览器直接跑的版本,你不用配 Python、不用装 CUDA。找个支持 WebGPU 的浏览器——现在 Chrome、Edge 基本都认——打开它的 demo 页面,等模型加载完就能聊。

我估了一下体验:5.9GB 要先把权重拉进内存,头几秒在转圈,然后就能在本地对话、传图让它看。你的机器内存要是 16GB 往上,跑起来不慌;内存紧的笔记本,加载时会吃点力,但比装一整套本地推理环境省事太多。

上手要什么

浏览器:Chrome 或 Edge 新版,认 WebGPU内存:16GB 往上更稳,加载更快网络:首次要拉 5.9GB 权重,拉完可留本地成本:零,Apache 2.0 免费商用

对你意味着什么

如果你昨天看我那篇动了心思,今天这个更适合手头没显卡的人。浏览器打开就能试,不用先花钱买卡。

当然要泼点冷水:浏览器里跑,速度看你的机器,复杂推理肯定比云端旗舰慢。它适合"轻量但经常在本地跑"的活——改个小脚本、理个本地文档、跑个私人问答。真要冲重活,还是上显卡或云端。

还有个现实约束得说清:5.9GB 是塞进浏览器了,但它吃的是内存不是显存。你一边开着十几个网页、一边跑模型,内存会紧。想稳,关掉多余的标签再试。这不是魔法,是压缩换来的便利,代价就是重活别指望它。

有意思的是它压的就是 Qwen3.8-27B。昨天那款登顶 Hugging Face 的开源模型,今天直接压进了浏览器——国产开源这条线,正把"能跑"的门槛一点点往下拽。

最后说几句

本地大模型这条线,这两周肉眼可见地在往"普通人设备"上挪。昨天是消费级显卡,今天是浏览器。下一步会不会是手机,我挺好奇。

你试过在浏览器里跑本地模型吗?用的哪款、卡不卡,评论区告诉我,我也想去踩踩这个坑。

来源说明

本文说到科技动态,依据掘金「衍辉AI速递 9.18」、ai-tldr.dev(2026-09-18)、PrismML 官方发布整理。模型体积和分数拿官方实测为准,浏览器跑的效果看具体硬件。

我是新视界探索者,专注盯全球 AI 动态。本地能跑的国产模型,我会继续跟进实测。

相关学习资料