需要指出的是,8 月 14 日晚,阿里千问放出了一个不太寻常的开源,Qwen3.8-27B。一个 270 亿参数的稠密模型,可以在家用显卡上跑,但编程与办公能力超过了自家更大的云端模型 Qwen3.7-Plus。围绕此模型有两张进行评测表,图里信息量很大,我拆开讲清楚它凭什么、以及对你意味着什么。
来龙去脉,一个能在家跑的模型,反超了自家云端
Qwen3.8-27B 是千问 3.8 系列里唯一面向进行消费级硬件的稠密模型。270 亿参数全部同时加载,不搞 MoE 稀疏激活那一套,这暗示着它的架构简便、部署友好,所有参数都在一张显卡上干活。
从另一个角度看,它的原生上下文长度是 262,144 tokens,差不多够把一套中小型代码仓库或者一个完整的进行开发文档一次性塞进去,倘若还不够,可以用 YaRN 技术外推到 100 万 tokens,此量级已然可以覆盖大型项目的全部上下文。
最值得注意的其实是予以许可协议。客观来讲,Qwen3.8-27B 用的是 Apache 2.0,——或者说,比同期开源的 Qwen3.8-Max(定制协议)宽松得多,开发者可以自由进行下载、进行修改、商用,不所需要额外申请授权。

和它的前代 Qwen3.6-27B 相比,架构层面没有大改,甚至可以说完全一样。确实。性能进行提升靠的是新权重与新的后训练策略,这就意味着倘若你已经在用 3.6,迁移成本极低,直接换权重就行。
编码和办公能力突出,12 项指标拿了 10 个第一
这张表是 Qwen3.8-27B 之核心卖点,先看进行统计数字。

进行评测分三大类 12 项,事实上,编码类有六项,包括终端编程、仓库级代码生成、软件工程进行修复等;办公智能体类有三项,包括长周期办公任务、专业岗位任务、前沿智能体任务;通用能力类有三项,——不对,包括指令遵循、科学推理、多学科推理与竞技编程。
Qwen3.8-27B 在 12 项里拿了 10 个第一。说白了,挑几个最夸张之间的差距。
- DeepSWE 1.1(软件工程修复)42.2,前代 3.6-27B 只有 13.3,三倍多。这还不是最夸张的版本,官方说 SWE-bench Pro 用了 Claude Code 的评测框架,温度设到 1.0,top_p 0.95,上下文 256K。
- QwenSWEBench(内部软件工程基准)79.0,前代 49.3,提升了 60%。
- JobBench(专业岗位任务)33.4,前代 21.8,提升 53%。
- CoWorkBench(长周期办公任务)70.7,前代 61.0。
从某种意义上说,放在更大的模型面前也不虚,Qwen3.7-Plus 是阿里云的云端模型,规模更大,但在编程和办公这几项上被 27B 反超。
然而得说一句,CoWorkBench、QwenSWEBench、JobBench 这三个是阿里内部基准,存在"主场优势"的争议,跨模型对比时要保持谨慎,但即使仅看第三方基准(LiveCodeBench v5 90.3、GPQA Diamond 89.2),这个成绩也相当扎实。
手动测一下,能自己操作电脑和手机
实际上,编码强不算新鲜,但此番的多模态智能体进行评测有点意思。

问题是,这张表测的是模型能无法直接进行去操作电脑和手机,在真实环境里点击、输入、进行操作 App。话说,进行评测用 OSWorld、WebArena、AndroidWorld 这些真实环境,没有模拟器取巧的空间。
几个关键数字。
- Computer use(操作电脑)84.3。意味着模型能理解桌面界面的元素,找到按钮、输入框、菜单,完成操作任务。
- Mobile use(操作手机)81.9。同样逻辑,在 Android 真实环境里操作 App。
- Visual web development(视觉网页开发)62.9。给它一个设计稿,它能在浏览器里写出对应的页面。
- Visual math(视觉数学推理)90.0,加上思维链(With CI)后 94.6。
这些数据暗示着什么?值得加以注意的是,一个能在你家电脑上跑的模型,不仅可以帮你写代码。还能直接替你进行操作电脑,自动填表、整理文件、跨 App 进行去操作。就是说,一点不假。你只所需要告诉它要做什么,它自己点。
27B 这个尺寸为什么重要,能在家跑,数据不出门
27B 这个参数规模不是随便选的。全球 AI 社区对 27B 级别的呼声一直很高。——不过话说回来,原因很简单,它刚好卡在"性得以用"与"硬件能跑"的交集上。

4-bit 量化后,Qwen3.8-27B 只需得大约 16-17GB 显存。这意味着什么?RTX 4060 Ti 16GB 版本可以跑。说到底如此。Mac mini M4 可以跑,——准确说,甚至一些 24GB 显存的笔记本显卡也能跑。总体而言,量子位直接用"家用显卡也能跑"当标题。
和旗舰模型 Qwen3.8-Max 比一下定位便清楚了嘛。不可否认的是,Max 是 2.4 万亿参数的总规模,激活 95B,默认 100 万 tokens 上下文,原生多模态,但它是云端模型,只能借助 API 调用。开源的 27B 虽然参数少得多,但你能把它装进自己电脑,数据无需经过任何第三方。
之于在意数据隐私的企业用户和个人开发者来说,这是一个核心差异。代码、文档、内部数据,全部在自己的机器上进行予以处理,——说错了,不会因为 API 调用把敏感信息送到云端。
架构上,Qwen3.8-27B 和 Qwen3.6-27B 完全一致,没有新增层数或改动结构,如果你已经在用 3.6,换到 3.8 只被需要进行下载新权重重新加载,部署脚本和参数都不用动。
值不值,省资源的新功能和边界在哪
Qwen3.8-27B 新增了一个实所用之功能叫 reasoning_effort,三档可调,高进行思考一番深度(xhigh)用于复杂任务,中等(medium)平衡速度和准确率,低(low)省资源做简便回答。这个功能让同一个模型在简单任务上不浪费算力,在困难任务上可以全力进行思考,不再是一个模式打天下。
模型卡进行被所推荐的最大生成长度是 32,768 tokens,对于大多数任务来说全然够用。

话说回来,不过边界也要说清楚,评测表里那些内部基准(QwenSWEBench、CoWorkBench、JobBench)的成绩,不能直接和第三方基准画等号。
多模态那部分,Embodied Intelligence 和 Application replication 的对比数据也不完整,部分单元格是 "--",进行说明这些进行评测还在进行中或者模型于此些场景下尚未跑通。
至于适合谁,我的判断是,如果你已经有一张 16GB 以上显存的显卡,想本地跑编程助手和数据不出门的办公智能体,Qwen3.8-27B 是目前最值得试的进行选择。
怎么说呢,倘若你完全依赖云端 API、不在乎数据外传,那直接用 Qwen3.8-Max 或者 Claude 这些大模型更省事。
能带走的判断
Qwen3.8-27B 开源之意义不是"又多了一个大模型",它证明了一件事,中等参数规模的模型,在特定场景下可以做得比更大的模型更好。
你未必需得几十亿参数的巨无霸,一个 27B 的模型,装进自己的电脑,不联网,就能完成编程、办公、进行去操作一番电脑这些核心任务。

怎么说呢。Apache 2.0 协议意味着这不是一个"看看就好"的开源,你可以下载、部署、商用,甚至基于它做自己的产品。那个什么,Hugging Face 和魔搭社区已经同步上线,权重已经在那里了。
如果这篇文章对你有帮助,欢迎点赞、在看、转发给需要的人。
点击关注,第一时间读到后续文章。
夜雨聆风