GLM 5.2 搭配 Pi 后,在这份基准中进入了最高能力档位,质量与测试中的 Opus 4.8 配置在统计上接近。它的平均任务成本是 1.28 美元,作为对比,文中选择的 Opus 4.8 配置是 1.94 美元。这个结果至少说明,开源模型已经值得放进真实项目的候选名单,而不是只拿来做简单任务。如果换成不同代码库、语言、提示质量、部署方式和推理服务,结果都可能变化。我不会因为一份内部测试就直接换掉现有模型,但会愿意拿自己的任务再跑一轮对比。
如果是我,我会这么选
如果现在让我选 AI 编程工具,我会重点看四件事:我更愿意把 Pi 看成一个轻量、可定制的选项,而不是标准答案。Claude Code、Codex 和其他 Harness 也各有自己的工具、安全能力和工作流取舍。工具选择没必要站队。先把自己的任务成本、成功率和上下文消耗测清楚,再决定该换模型,还是该调整 Harness 和工作流。
参考
1. Databricks 内部基准
标题:Benchmarking Coding Agents on Databricks’ Multi-Million Line Codebase作者:Vinay Gaba、Ankit Mathur、Rishabh Singh、Patrick Wendell、Matei Zaharia发布方:Databricks Blog发布时间:2026 年 7 月 8 日地址: