
Qwen3.8-Max 这次亮相,最该看的不是模型名字,而是开源模型开始卷“连续干活”。
2.4 万亿参数,Qwen 家族迄今最强。首个 Max 级开源权重模型,权重下周开放。Frontend Code Arena 排到第 4,1668 分,和 Claude Opus 5 High 只差 1 分。
这 1 分很抓人。它把 Qwen3.8-Max 从普通发布稿里拎了出来:至少在前端代码任务这个切面上,它已经站到 Claude Opus 5、Kimi K3 旁边。

更关键的是长任务。Qwen3.8-Max 从零做了一个 oh-my-cli 项目,16 天自主运行后。仓库留下 265 次 commits、127 个 PR、151 个 issues。它不是只吐一段代码,而是把反馈、issue、测试、日志和修 bug 串成一轮工程循环。

论文复现那组数字更硬。它手里只有《Unified Data Selection for LLM Reasoning》论文,连续工作约 5 天,125 小时不间断。写下约 7600 行代码,执行超过 1100 步操作,跑了 33 轮 GPU 训练。前 37 小时先搭完整流水线,再复现论文的 6 项主要结论。
后面还继续跑科研循环。4 轮探索,18 种改进想法,每一轮结果再喂回下一轮,最后在 AIME24 上比论文原方法多了 2.7 分。这个信号比“会写代码”更有分量:它开始能把一个开放问题拆成实验,再根据结果调整方向。

多模态比赛也给了一个工作场景。WWW2025 多模态对话意图识别挑战赛,526 支人类队伍同场。Qwen3.8-Max 读规则、搭方案、调模型融合,45 次提交把准确率从 0.60 拉到 0.853,击败 458 支人类队伍。


办公和长程任务里,数字更像一张压力测试清单。量化策略研发调度约 330 个子任务,完成约 6000 次回测;芯片设计沙箱里跑约 500 轮交互、71 次评估、13 个关键里程碑;365 天电商经营模拟里。以 416252 元总现金胜出,回报 4.16 倍。
这些案例都来自发布展示,不能直接当成第三方实测结论。但它们指向同一个变化:AI 编程工具的竞争,不再只看补全速度和榜单名次,还要看能不能在长上下文、多工具、多轮失败里把活收住。
对开发者来说,下一步不是立刻换工具。而是等权重开放后看三件事:第三方能不能复现这些结果,跑长任务的成本能不能压下来,小模型 Qwen3.8-27B 本地运行后能不能保住关键能力。
如果这三件事有一件跑通,开源模型在 AI 编程工具里的位置就会变得很不一样。它可能不是马上替掉 Claude Code、Codex 或 Cursor,但会把“开源模型能不能交付长任务”这个问题,推到台前。
真正该等的,不是一个营销稿,而是权重开放后,第三方能不能把这套长任务流程复现出来。到那时,成本、稳定性、失败恢复、工具适配,才会从展示页上的词,变成你能拿来选型的硬指标真正常见的误判,是把一次漂亮展示当成已经能稳定上生产。权重开放之后,第三方复现、失败恢复、成本和小模型表现,才会决定它到底是样机还是工具。
夜雨聆风