1. Z.ai 开源 GLM-5.2:753B 参数在 SWE-bench Pro 上反超 GPT-5.5,API 价格不到对手 1/6
发生了什么
6 月 16 日,中国 AI 创业公司 Z.ai(原智谱 AI)发布 GLM-5.2——一个 753B 参数的开源权重 LLM,目标是拿下"长周期"自主编程与工程任务。模型权重以 MIT 协议开放下载,1M token 上下文窗口稳定可商用,API 定价 $1.40/M 输入 + $4.40/M 输出(缓存输入 $0.26/M),企业订阅起价 $12.60/月,Pro 版 $50.40/月,Max 版 $112/月。
在第三方基准上,GLM-5.2 在 SWE-bench Pro 上拿到 62.1(GPT-5.5 58.6、上一代 GLM-5.1 58.4),FrontierSWE 长周期任务 74.4%(GPT-5.5 72.6%、Claude Opus 4.8 75.1%),MCP-Atlas 77.0(GPT-5.5 75.3),Humanity's Last Exam with tools 54.7(GPT-5.5 52.2),PostTrainBench 34.3% vs GPT-5.5 25.0%——多项"agentic 工具调用 + 长周期工程"基准直接超越 GPT-5.5,并在长尾指标上与 Claude Opus 4.8 几乎打平。
架构层面,GLM-5.2 引入 "IndexShare"——每 4 层稀疏注意力复用同一个 indexer,在 1M 上下文下把每 token 的 FLOPs 砍掉 2.9 倍;升级版 MTP 层让投机解码的接受 token 长度提升最多 20%。X 平台用户 @scaling01 直接挑明:"OpenAI、Anthropic 的 API 定价 90%+ 毛利,可能在系统性诈骗开发者。"
为什么重要
"成本曲线"被开源中国厂商第一次拉到西方前沿价格的 1/6 以内。 GLM-5.2 输出价格 $4.40/M,DeepSeek-V4-Pro 仅 $0.87/M,而 Anthropic Sonnet 4.6 是 $15、Opus 4.8 是 $25、GPT-5.5 是 $30——价格差不是 2-3 倍,而是 6-12 倍,且能力差距已经从"代际"缩到"百分点"。更要命的是 753B 模型声称"盈利"且不依赖最新 Blackwell 芯片,这意味着 API 经济的"稀缺溢价"叙事在技术层面已被证伪。Nadella 昨天才警告"token economics 把企业烧穿",GLM-5.2 几乎是这个警告的工程级解药。
MIT 许可证击穿了"地缘围栏 + 可接受使用政策"的双重护城河。 Z.ai 的技术文档明文标注"无地区限制,技术访问无边界"——结合上周特朗普政府禁止外国国民使用 Claude Fable 5、Anthropic 反手把模型下线全用户的事件,MIT 开源 + 海外可下载 = 西方前沿模型第一次有了"主权独立"替代品。GLM Coding Plan 已经 day-one 接入 Claude Code、OpenClaw、Cline、Kilo Code、Crush、Factory 等 20+ 主流 coding harness,企业切换成本几乎为零。Anthropic 的"模型即护城河"逻辑在企业级市场第一次遭遇制度性的"绕道"路径。
架构创新"IndexShare"指向 1M 上下文的成本拐点。 长上下文的真正瓶颈一直是"全文档注意力重算",传统解法要么截断(丢信息)、要么稀疏化(精度掉)。IndexShare 用"每 4 层共享一个 indexer"在精度和成本之间取了一个工程甜点——1M 上下文 FLOPs 直接砍 2.9 倍。这条技术路径一旦被西方厂商复制(DeepSeek、Qwen、Meta 都可能跟进),整个 agent + 长文档 RAG 赛道的基础设施成本会在未来 6-9 个月系统性下降一个数量级,连带让"长上下文是否是伪需求"的争论有了一个明确答案。
值得关注的点
- 看 7 月底之前 Z.ai 能否在 Hugging Face 下载量上跑过 DeepSeek-V4-Pro——开源中国模型的"刷榜能力"早已被验证,真正的胜负手是"开发者实际下载 + 微调 + 部署"的留存曲线。
- 看 Anthropic、OpenAI 是否会跟进推出"区域受限 + 商用受限"以外的新商业 SKU——如果它们被迫把 Sonnet、Opus 价格对标到 GLM-5.2 同一档($4-5/M 输出),整个前沿模型行业的单位经济模型会塌方;如果不跟进,2-3 个季度内企业大客户会从"试用 OpenAI"转向"主用 GLM"。
2. 斯坦福 DeLM:没有"中央调度"的 multi-agent 框架,砍掉 50% 成本还能涨 10.5% 准确率
发生了什么
6 月 16 日,斯坦福 Yuzhen Mao 与 Azalia Mirhoseini 发布论文,提出 DeLM(Decentralized Language Model)框架——一个去中心化的多 agent 系统,没有传统意义上的"主 agent / orchestrator"在中间指挥。每个 agent 直接读写"共享上下文"(一个经过验证的"gist"知识库,记录已验证的发现、失败、约束),并从"任务队列"里独立领取子任务,异步推进。
系统流程:初始化拆任务入队 → agent 并行执行 → 结果压缩成可复用的 gist + 反向校验证据 → 队列空时由最后一个完成 agent 决定是否继续或交付。SWE-bench Verified 上 DeLM 比最强基线高 10.5%,单任务成本下降约 50%;LongBench-v2 多文档问答上,DeLM 在 GPT-5.4、Claude Sonnet、Gemini Flash、DeepSeek-V4-Pro 四个模型族上全部拿到最高分。Mao 在 X 解释核心机制:"失败被写入共享上下文,后面的 agent 读到的不是空白,而是'这条路别走'"——"约束"一旦验证就变成强制共享状态,后续 agent 继承、绕开、不再重复犯同样的错。
为什么重要
挑战了 multi-agent 系统的"中央调度"范式。 当前主流框架(LangGraph、CrewAI、AutoGen、Anthropic 的 agent SDK、OpenAI 的 Swarm)几乎都把"主 agent 当路由器、合并器、广播器"当作默认架构。DeLM 论文用一个反直觉的发现戳破这个默认:随着子任务数量增加,主 agent 会变成"通信 + 整合的双重瓶颈",且会"稀释、遗漏、扭曲"有用的中间结果,导致后续 agent 在不完整上下文下反复回弹、重新检索、重新委派——latency 累积,成本指数级上升。DeLM 用"异步 + 共享 + 验证"替代"同步 + 中央 + 合并",本质上把 multi-agent 从"主从架构"重构为"对等架构",让"加 agent"等于"加吞吐"而不是"加延迟"。
"Unfoldable gist"机制把上下文管理做成可工程化的成本控制旋钮。 DeLM 不让 agent 共享完整 trace(会爆上下文),也不只用紧凑摘要(会丢细节),而是用"可展开"——默认看短 gist,遇到需要时再 opt-in 展开成详细摘要 + 原始证据。这种"coarse-to-fine"机制让协调本身不再是另一个"长上下文瓶颈",反而成为精度和成本的可调杠杆。这给了企业一个非常实操的工程模式:与其雇更多 agent,不如让现有 agent 共享失败 + 共享约束——50% 成本下降的来源不是"算法更快",而是"不重复劳动"。
让"模型不是瓶颈,编排才是"成为可量化命题。 SWE-bench Verified +10.5% / 成本 -50% 这个数据组合在 agent 行业里几乎是前所未有的"双向优势"(通常性能提升伴随成本上升)。它意味着企业部署 multi-agent 系统时,应该重新评估"我们到底需要多少并行度"和"我们能不能让失败可共享"——这比"换更强的模型"性价比高得多。对 agent 中间件公司(LangChain、LangGraph、CrewAI、Letta)来说,DeLM 是一个清晰的"产品路线被论文公开挑战"的信号:要么把去中心化 + 共享上下文做成产品级特性,要么客户会自己用这套模式。
值得关注的点
- 看 LangGraph、CrewAI、Anthropic Agent SDK、OpenAI Swarm 哪一个会先在产品层面引入"共享 gist + 失败广播"机制——DeLM 的核心思想门槛不高,胜出者会是把它工程化到企业级稳定性 + 监控可观测性的玩家。
- 看 DeepSWE、GLM-5.2、Claude Opus 4.8 这类"强单 agent"模型在 DeLM 这种"弱单 agent + 强协调"架构下能否进一步放大优势——如果可以,"模型强 + 协调强"的双重叠加可能让 SWE-bench Verified 在 3-6 个月内突破 90%,整个 agent 编码赛道的天花板会被快速抬高。
本日报由自动化流程生成 | VentureBeat | 2026年6月18日
夜雨聆风