为什么同一个 AI,换套工具就从 99 分掉到 91 分?
最近一组关于 DeepSeek V4 Pro 的工程测试,出现了一个反直觉现象:同一个模型,在相近任务上,成绩可以从 99 分降到 91 分;换一种配置后,又回到 98 或 99 分。这说明模型本身重要,但它工作的“环境”同样重要。
AI 也需要一张合适的工作台
这里的环境,不只是操作系统或显卡,还包括模型能看到哪些工具、提示词怎么写、文件如何读取,以及上下文如何管理。
研究者通常把这套组合叫作 harness,可以理解为 AI 的工作台:模型是工程师,工具是桌上的设备,提示词则像岗位说明书。换一张工作台,工程师能发挥出的水平可能完全不同。
这次测试使用的是一个包含 Python、ESP-IDF 和权限逻辑的工程任务。下面的分数只代表模型在这个项目和这些配置中的交付表现,不是通用能力排名。
结果为什么差这么多?
DeepSeek V4 Pro 正式版在 OpenCode 中进行了四次测试,成绩分别是 91、96、91、93,平均约 92.75 分。
随后,研究者使用 DeepSeek Harness 做了几组对照:
- minimal 配置:99、96 分;
- standard 配置:91 分;
- PTC,也就是把工具包装成一个代码入口:92 分;
- Windows 上的两阶段配置:98、99 分。
如果只是“换了官方工具”就能涨分,那么 standard 和 PTC 也应该同样变强。但它们在相同的 WSL 和 max 环境下仍只有 91 和 92 分。因此,Linux、官方 Harness 或单一代码入口,都不足以单独解释差异。
minimal 不只是少几个工具
最容易产生的误解是:minimal 之所以得分高,只是因为它给模型的工具更少。
但从官方源码看,minimal 的特殊之处不止于此。它使用一条完整的 system prompt,只暴露 bash 和文件编辑两个工具。官方测试把它描述为发送“exact RL prompt and schemas”,也就是与强化学习训练时对齐的提示词和工具结构。
Schema 可以理解为工具的“说明书格式”:工具叫什么、需要哪些参数、返回什么结果。对模型来说,这种结构可能就是训练中学会的行动模式。
相比之下,standard 配置挂载了大约 26 个工具和控制功能,包括搜索、计划、上下文压缩和子代理等。工具更多,模型也必须持续决定:现在该用哪个工具?是否需要制定计划?什么时候停止?
这就像给工程师配备了整间实验室,却没有告诉他最熟悉的操作流程。
关键可能发生在第一次请求
两阶段实验进一步缩小了问题范围。
研究者让模型第一次请求时只看到两个工具,完成第一次调用后再恢复 standard 的 25 项。两次测试分别得到 98 和 99 分,模型后续也确实使用了完整工具。
这说明高分不一定要求模型从头到尾处在“极简环境”里。更可能是第一次请求帮助模型建立了熟悉的行动轨迹,后面即使工具变多,也没有立刻偏离。
换句话说,模型会根据最初看到的提示词和工具形状,判断“我应该以什么方式工作”。
这对我们理解 AI 有什么启发?
第一,模型能力和使用方式不能完全分开。一个模型在某种 agent scaffold,也就是代理框架中表现很好,换到另一个框架后未必稳定。
第二,工具越多不一定越强。工具需要被选择、理解和管理。如果工具描述、上下文注入和模型训练习惯不匹配,额外能力反而可能变成额外干扰。
第三,测评结果必须带上配置条件。“某模型得了 99 分”还不够,还要知道使用了什么提示词、工具和上下文管理方式。
当然,这组实验也不能证明某一句 system prompt 单独造成了全部提升,更不能据此宣布 V4 Pro 在所有代码任务上都等同于其他顶尖模型。现有证据支持的、更稳妥的结论是:V4 Pro 具备很高的工程能力上限,但对 harness 的依赖比较明显;在与训练接口更接近的工作台上,它更容易发挥出这个上限。
所以,下次比较 AI 时,除了问“哪个模型更强”,也许还应该多问一句:它是在什么样的工作台上完成这项工作的?
参考
报告内容
夜雨聆风