
这周科技圈有点热闹。阿里把Qwen3.8-27B开源了,270亿参数,量化之后24G显存就能跑——也就是说,你家里那张打游戏用的RTX 4090,现在可以直接驱动一个在好几个Agent榜单上把Claude Opus 4.6 Max挤到身后的模型。

差不多同一时间,DeepSeek发了新框架DeepSeek Harness,口号"万物皆插件",几天时间GitHub上长出700多个插件仓库。有人给AI装了18款小游戏,有人装了个"2005年中文互联网广告"模拟器,还有人写了个插件,唯一功能是让AI每次回完话补一句"谢谢你,鲸鱼大人"。
"开源要反超闭源"这话我们听过八百遍了。但这周的事儿放在一起看,有点不一样——这次不是"实验室里能跑",是"你自己电脑上就能跑"。

一、先验货:这张显卡真的能打?
按惯例,先泼冷水:开源模型的跑分,历来水分充足,榜单领先不等于体验领先。所以先看数字,再看真人在干嘛。
先说模型本身。Qwen3.8-27B,名字里的27B就是270亿参数。这个尺寸很微妙:比它大的模型,家用电脑一般塞不下;比它小的,性能又不太够看。它量化之后24G显存就能跑,RTX 3090、4090这类游戏卡直接带得动。原生多模态,原生262K上下文,还能扩到1M——整个代码库扔进去分析,是设计场景而不是噱头。

跑分直接上对比对象:Claude Opus 4.6 Max,闭源阵营目前的顶配之一。几个Agent向的榜单上——
·SWE-bench Pro(真实软件工程):Qwen3.8-27B领先8.3分
·QwenSWEBench:领先15.2分
·OSWorld-Verified(真实电脑操作):84.3 对 72.7
·AndroidWorld(安卓真机操作):81.9 对 62.0,差了快20分
·CoWorkBench:70.7 对 68.2



这组数字先别急着信,有三处值得掰扯。
第一,出处。数字来自Qwen官方发布材料,比哪些榜、怎么比,是发布方自己挑的。其中QwenSWEBench本身就是Qwen自家的测试集——自家场地自家裁判,那个15.2分的领先,听听就好。含金量更高的是OSWorld、AndroidWorld这种第三方榜单:领先幅度大,作假难度也高。
第二,赛道。赢的全是Agent操作类任务:写代码、点鼠标、戳手机。这类任务吃专项训练,小模型猛喂数据是能堆上去的。而大参数模型真正的优势——长任务的连贯性、边角案例、复杂推理的稳健性——恰恰不容易变成榜单数字。27B"全面超越"旗舰在物理上讲不通,真实情况大概率是:具体任务互有胜负,Qwen在擅长的项目上反超。
第三,配置。榜单成绩一般是全精度跑的,你显卡里跑的是量化版,中间这道量化还要再折掉一点体验。

不过,榜单可以挑、配置可以做局,社区拿到模型之后干的事没法安排剧本。有人让它在俄罗斯方块里自己加了两个功能:屏幕抖动特效和奖励倍增器——从"会写代码"到"会给自己加戏",中间差的是对产品的那点感觉。另一拨人在GH200上跑10路并发、262K上下文,首token延迟不到10毫秒。还有人拿它处理一部1935年的11分钟老电影,157秒提取出96个带时间戳的事件,误差2秒左右,全程单卡。这些不像是刷榜能刷出来的。
而且这件事的关键从来不在分数,在账单:闭源模型按token收费,用得越多花得越多;跑在自己显卡上的模型,电费忽略不计,随便造。更别说数据全程不出门——对很多公司来说,光这一条就比跑分值钱。


架构上值得记一笔:64层里48层是线性注意力(Gated DeltaNet),只有16层是全注意力。不关心原理没关系,记住结论就行:这是它能在家用显卡上塞下超长上下文的原因之一。
还有个贴心的小设计:reasoning_effort(就是思考强度啦)分高中低三档,简单问题不让它过度思考浪费算力,难题再火力全开,还支持保留思考过程给下一轮复用。
一句话总结这部分:以前我们管开源模型叫"平替",这次在特定任务上,平替开始抢正主的活了。

二、生态引爆:700多个插件,正经的和不正经的
模型强只是一半,另一半是有人玩。
DeepSeek Harness(下称DSH)8月13日发布,主打"万物皆插件"(Everything is a Plugin)。截至发稿,GitHub上带dsh-plugin标签的仓库超过700个。一个框架发布几天,生态自己长成了一片。

先说正经的:
·dsh-agent-teams:组多智能体团队。队长接需求、拆任务、设依赖,队员各干各的还能互发消息,你以上帝视角围观全程。相当于给AI搭了个赛博项目组。
·dsh-memory-evolve:跨会话长期记忆,还能感知Git分支。你上周提过"部署端口是8080",这周开新会话它还记得。
·dsh-claude-move / claude-bridge:一键把Claude Code的记忆、Skills、会话搬过来。搬家工具都给你备好了,多少有点挑衅的意思。(这个好用,帮我搬家了)
·Better Sidebar:直接把终端变成一个mini IDE。
再说不太正经的,但我恰恰觉得这些才是真信号:
·dsh-minigames:18款小游戏——俄罗斯方块、坦克大战、贪吃蛇、扫雷、数独、吃豆人、华容道……等模型跑任务的间隙来一局。
·dsh-ads:复刻2005年中文互联网广告风格:侧栏广告、信息流、角落弹窗、开屏,一个不少。
·dsh-web-ui:二次元电子宠物加皮肤中心,作者自己说"梦回QQ空间"。
·deepseek-manners:全场最抽象。唯一功能:让AI每次回复后自动补一句"谢谢你,鲸鱼大人"。

为什么说抽象插件才是真信号?因为只有当一个工具的用户真的多、真的闲、真的把它当日常了,才会有人给它写"谢谢你鲸鱼大人"。没人会给用一周就卸载的软件写这种东西。

对照着看:GPTs商店当年开放时也是几天涌入几万个应用,然后大部分石沉大海。区别在于GPTs是"平台赏饭吃"——接口、分发、规则都捏在官方手里;DSH是真开源,模型给底座、框架给接口,剩下的开发者自己会长出来。有点像改装车:原厂给你台素车、敞开引擎盖,配件随便加。700个插件,就是700种改法。
三、另一边:热闹背后,账单正在路上
到这里听起来全是好消息?还有第三条线。

就在这波开源狂欢的同一周,GitHub发布了Secure Open Source Fund第四期的复盘文章。这个基金给50个开源项目投了超过50万美元,每个项目1万美元,专门用来修安全问题。名单里全是老熟人:FastAPI、LangChain、ONNX、etcd、ZooKeeper、Pillow、core-js、htmx……

为什么突然聊这个?因为AI时代,开源的安全逻辑变了。

复盘里提到一个案例:Nasiko,一个AI Agent平台,在项目期间真实遭遇了供应链问题。他们列出的风险清单全是AI特有的——不可信的Agent、提示词注入、密钥暴露。翻译一下:以前攻击者要骗的是人,现在可以直接骗Agent,而Agent手里往往捏着你的密钥和权限。
GitHub的总结说得很克制,但值得抄下来:AI能帮维护者更快地调查、排序和响应,但上下文、判断和"什么该上线"的责任,仍然得由人来扛。
再回头看那700多个DSH插件,感受就不太一样了。插件生态繁荣的另一面,是信任链变长:你装一个插件,等于让一段陌生代码进入你的工作流——而你的工作流里现在有AI、有你的代码库、可能有你的密钥。GitHub讨论区里已经有人在担心插件水化、作者弃坑、插件冲突,都是生态长大的烦恼,但也都是真问题。
得说清楚:这不是说开源危险、闭源就安全——闭源一样出事,出了事你连代码都看不了。我想说的是:开源这波反攻,模型和生态都追上来了,但"随手装个插件"背后那套信任机制,还没跟上。热闹是真热闹,账单也真在路上,只是还没寄到。(github上的插件我也是看至少千星才敢用的)

结尾
以前开源模型追的是"能不能用":跑分差一点,但免费,凑合用。这次追的是"好不好用,还在不在你自己的机器上":Agent能力追平甚至反超,家用显卡直接跑,生态自己长。闭源阵营的护城河没干,但水位确实在降。
下次你升级显卡的时候,那可能就不只是一张游戏卡了。(当然,你必须面对老黄精妙的刀法)
参考资料
1. Qwen官方博客·Qwen3.8发布公告:https://qwen.ai/blog?id=qwen3.8
2. HuggingFace·Qwen3.8-27B官方模型卡:https://huggingface.co/Qwen/Qwen3.8-27B
3. GitHub·DeepSeek Harness官方仓库:https://github.com/deepseek-ai/deepseek-harness
4. GitHub Blog·Secure Open Source Fund第四期复盘:https://github.blog/open-source/maintainers/what-50-open-source-projects-taught-us-about-security-in-the-ai-era/
夜雨聆风