乐于分享
好东西不私藏

想要本地AI助手的,千问Qwen3.8-27B值得装

想要本地AI助手的,千问Qwen3.8-27B值得装

想要本地AI助手的,千问Qwen3.8-27B值得装

8月14日晚上,千问把一个27B参数的稠密模型开源了,Apache 2.0协议,能下载能部署能商用。我刷到消息第一反应不是看跑分,是去查显存。这篇文章是我翻了HuggingFace模型卡、千问官方博客、量子位报道和几篇部署教程后整理的,没亲自下载跑过,性能数字都标注了出处。

我刷到这条消息时去翻了什么

8月14日晚上,我在量子位的推送里看到「Qwen3.8-27B开源了,家用显卡也能跑」这条标题。第一反应不是兴奋,是怀疑。27B参数的稠密模型,家用显卡跑得动?我打开HuggingFace的Qwen/Qwen3.8-27B模型卡看了看,又去翻了千问官方博客,再找了byteiota和buildfastwithai两篇部署教程交叉核对显存数字。

翻完一圈我的判断变了。这次开源的不是普通的小模型更新,是千问把旗舰Qwen3.8-Max(2.4万亿参数MoE)和27B稠密模型两头同时放出来,27B那头是给个人开发者和中小团队本地用的。我把它理解成「旗舰和桌面之间搭了一座桥」,桥这头是云端的2.4T旗舰,桥那头是你电脑里的27B,中间靠Apache 2.0这个开源许可连通。

我先把基本盘讲清楚,再算显存账,最后说哪些人值得装。


千问Qwen3.8-27B到底是什么

我翻HuggingFace模型卡确认的几个关键数字。参数规模27.78B,稠密(Dense)架构,不是MoE那种稀疏激活。原生上下文262144 tokens,通过YaRN技术可以外推到1M tokens,但buildfastwithai的教程里特意提醒,生产部署建议围绕262K来规划,1M是理论值不是日常用量。

它是个原生多模态模型,文本、图像、视频都能输入。模型卡里写支持STEM图表、文档、真实世界图像,视频能处理到小时级。这一点对我这种做内容的人有用,我经常要把截图丢给AI看,原生多模态比单独接个视觉模块省事。

许可证是Apache 2.0。量子位的报道原话是「所有人都可免费下载部署及商用」。这个点很重要,Apache 2.0让你可以把它塞进自己的商业产品里卖,不用给千问分钱(旗舰2.4T-Max不一样,后面会说)。

我还查到一组背景数字。千问官方说截至目前累计开源460余个模型,全球下载总量超30亿次,衍生模型超30万个。这些是千问自己的统计,我没办法独立核实,但能侧面说明这个开源家族的生态规模。


编程能力,27B怎么反超更大的Qwen3.7-Plus

这是我最想讲清楚的一段。千问官方模型卡里放了一组对比数据,Qwen3.8-27B在编程相关基准上反超了自家更大的Qwen3.7-Plus

我把模型卡里的几个关键数字摘出来,全部是千问自报,未第三方独立复现,先声明这一点。

       
                                           
基准测试Qwen3.8-27BQwen3.7-PlusQwen3.6-27B
SWE-bench Pro(真实代码任务)61.757.653.5
DeepSWE 1.1(软件工程)42.214.213.3
QwenSWEBench79.059.249.3
Terminal-Bench 2.1(终端操作)73.064.063.4
LiveCodeBench v6(竞赛编程)90.389.683.9
       
     

SWE-bench Pro从57.6提到61.7,涨了4.1分。DeepSWE 1.1从14.2飙到42.2,直接翻了将近3倍。QwenSWEBench从59.2到79.0,涨了将近20分。这些是千问自己测的,模型卡里没附第三方复现,我读的时候心里打了折扣,但量级差距摆在那里,即使打完折也是明显的代际提升。

还有一个我没想到的数字。OSWorld-Verified这个电脑操作基准,Qwen3.8-27B拿了84.3分,Qwen3.6-27B是63.9,Qwen3.7-Plus是73.3。OSWorld测的是AI操控图形界面干真实任务的能力,84.3这个分在27B这个量级里相当高。byteiota的分析原话是「a 20-point jump on a computer-use benchmark that measures real GUI agent tasks」。

我注意到一个反差点。千问同期放出的旗舰Qwen3.8-Max在SWE-bench Pro上是67.7,27B是61.7,差6分。但Max是2.4万亿参数MoE,27B是27B稠密,用大约九十分之一的参数量做到了旗舰九成的编程能力。这是我理解这座「桥」的关键。


一张显卡能不能跑,显存账算给你看

这是我最在意的一段,因为我家电脑就是RTX 4090。千问官方模型卡和博客里都没写显存要求,这个数字我是在第三方教程里找到的。

byteiota的教程(8月15日发布)给的数字是,4-bit量化下权重约16-17GB,加上KV cache实际占用20-24GB,RTX 4090(24GB)是消费级的最低门槛

buildfastwithai的部署指南给的更细,我直接抄过来。

       
                                           
量化精度权重显存适用显卡
Q3(3-bit)约13GB16GB卡勉强
Q4(4-bit)约16GBRTX 4090(24GB)舒适
Q6(6-bit)约21GB24GB卡吃紧
FP8约27-28GBL40S或RTX 6000 Ada
BF16(全精度)约54-56GBH100/H200级别
       
     

这里有个坑我得说清楚。16-17GB是「只算权重」的数字,看着好像16GB卡也能跑,但实际跑起来还有KV cache、上下文长度、并发请求数都要吃显存。byteiota原话是「the real number is 20–24 GB」,我建议按这个数来规划,别按权重数。

部署方式我查了几条路。最简单的是Ollama,一行命令ollama run qwen3.8:27b就能跑4-bit GGUF量化版。生产环境用vLLM或SGLang,模型卡里都给了适配文档链接。Unsloth在开源几小时内就放出了GGUF动态量化版本。这些是我从教程里读到的,我没亲手跑过任何一条命令,Ollama那行命令能不能直接跑通我没验证。


reasoning_effort这个新开关是什么

模型卡里有个新功能我单独拎出来讲。reasoning_effort参数,三档可调。

  • xhigh是默认档,千问说用于需要深入分析的复杂任务
  • medium是平衡档,准确性和速度折中
  • low是高效档,优化速度和成本

它的逻辑是按任务难度控制思考深度。简单问答用low档省算力,复杂推理用xhigh档保准确。这个对本地部署尤其有意义,因为本地算力是死的,不像云端可以弹性扩容,能省一点是一点。

模型卡里还有个配套参数preserve_thinking,默认开启,作用是跨对话轮次保留完整推理链。我没亲自调过这两个参数,描述都来自模型卡原文。


旗舰2.4T和27B什么关系,Apache 2.0有没有坑

这是我想讲清楚的另一个反差点。千问这次同时开源了两个东西,一个是27B稠密,一个是旗舰Qwen3.8-Max(2.4万亿参数MoE,激活95B)。startupfortune的报道里点出了关键区别。

27B是纯Apache 2.0,随便商用。2.4T-Max虽然也放了权重,但对大收入用户有商业限制,具体是「large revenue-generating users to share revenue」,就是赚大钱要分成。我没在千问官方博客里找到具体的收入门槛数字,这个细节等我下次部署时再核实,文章里就不瞎写了。

这个分层设计我理解为千问的「桥」策略。云端旗舰走API收费养模型,桌面27B走Apache 2.0占生态。对个人和小团队来说,27B那头是真正能拿走用的。

还有个行业背景不能不提。DeepSeek V4 Pro的API从8月17日开始涨价50%到1100%,这是startupfortune和TechWireAsia的报道。V4-Pro输出token峰值从每百万0.87美元涨到3.96美元。这个时间点开源一个能本地跑的27B,时机选得很巧。我自己的判断是,云端API涨价越凶,本地开源模型的替代价值越高,千问这步棋是踩着DeepSeek的涨价节点下的。


我的判断,哪些人值得装,哪些人先别急

我先把丑话说前面。这篇文章里所有性能数字都来自千问官方模型卡,未第三方独立复现。模型卡里的benchmark是千问自己测的,社区验证还要等几天。4-bit量化的显存数字来自byteiota和buildfastwithai的第三方教程,不是千问官方数据。我没亲自下载部署,没在本地跑过任何一个任务,Ollama那行命令能不能直接通我没验证。这些是读这篇文章前要先知道的事。

三类人我建议可以装。一是已经有RTX 4090或24GB以上显卡的开发者,沉没成本已经在那了,下载试试不亏。二是做编程助手、文档处理、截图理解这类多模态应用的中小团队,Apache 2.0能商用这个条件比很多闭源API值钱。三是对数据隐私敏感的场景,金融、医疗、法律这些不能把数据丢云端的行业,本地部署是合规刚需。

两类人我建议先别急。一是显卡低于16GB的,Q3量化虽然能跑但性能损耗大,不如直接用云端API。二是想要旗舰级编程能力的,27B的SWE-bench Pro是61.7,旗舰Max是67.7,差6分,真要做生产级代码助手还是上Max的API更稳。

我自己的打算。我家电脑是RTX 4090,理论上是「能装」的那档。但我打算等一周,看社区跑出来的实测数据再决定。模型卡里的数字是千问自报,我想看独立复现。如果一周后社区反馈能对上模型卡的七成,我就装。

最后一句。千问这次开源的不只是一个模型,是把「旗舰能力搬到桌面」这条路径走通了。27B这个尺寸是AI社区呼声最高的,千问选这个尺寸开源不是随便选的。桥搭好了,能不能走通看你自己的显卡和需求。


作者 Neurich,公众号聚焦AI前沿工具分享,每天聊一款我关注的AI产品到底是什么、能干什么、适合谁用。这篇文章信息来源包括千问官方博客(qwen.ai/blog?id=qwen3.8)、HuggingFace模型卡(Qwen/Qwen3.8-27B)、量子位8月14日报道、byteiota技术分析、startupfortune报道、buildfastwithai部署指南、腾讯新闻鞭牛士8月15日报道。未亲自下载部署模型,所有性能数字为千问官方自报未第三方独立复现,显存数字来自第三方教程非千问官方数据。