ARTICLE · 1110247
那个最火的 AI 编程工具,其实一半的活不是它自己干的
那个最火的 AI 编程工具,其实一半的活不是它自己干的
真实 Token 消耗榜第一的 Agent,官方描述里有 40 多个内置工具、跨会话记忆、自己造技能。能力的大头不在模型里。

▼ 3 秒钟速读
CORE TAKEAWAY
Agent 的能力大头来自工具和记忆,不来自模型。配工具比换模型更值得花时间。
阅读预计耗时:约 5 分钟
完整阅读版
选 AI 工具的时候,大部分人的注意力只有一个焦点:用的什么模型。
但如果你去看那些"真正在干活"的 Agent 是怎么配的,会发现一件反直觉的事——它们的能力大头,可能压根不在模型那边。
这个判断有据可依。我去翻了 OpenRouter 官方对榜上产品的描述原文,描述里写得最多的不是模型,是工具。
THE EVIDENCE 01
先看证据:官方描述里有什么
OpenRouter 的 App & Agent 页面对每个产品的介绍,是官方口径。排名第一的 Hermes Agent,描述原文列出了这么几样东西:
请注意这个比例:这段描述里,关于"模型"的信息几乎为零,全在讲工具、记忆、自动化。一家做 Agent 的公司,把描述重心放在这里,是有理由的。
你调的不是模型,是一套"模型 + 工具 + 记忆"的系统。
WHY 02
为什么工具比模型更影响结果
回到那个老问题:模型能力是固定的,为什么工具配置能拉开差距?
因为Agent 干活的真实形态,是一串动作,不是一次回答。
读取
模型先要知道项目长什么样。有没有文件读取工具,决定它是在猜还是在看。
检索
要改一个函数,得先找到所有调用点。没有搜索工具,它只能靠上下文里恰好出现的信息。
验证
改完能不能自己跑测试?没有执行工具,它就只能"觉得"改对了。这一步是分水岭。
记忆
下次遇到同类问题,是从零推理,还是直接调用上次验证过的做法?这就是记忆机制的价值。
这四步里,每一步都对应一个工具。缺一个,链条就断一环。 而模型再强,没有"跑测试"这个工具,它也没法自己验证结果。
一个直接的推论
所以"同一个模型换个 Harness 差 26 个百分点"这件事,不是模型的问题,是这四步缺了几步的问题。
HOW TO APPLY 03
那具体该怎么配
知道了原理,落到动作上就是一件事:先补链条,再谈模型。
为什么把模型放最后? 不是模型不重要,而是模型是这几项里最不可控的一个——你只能等它更新,别的你随时能改。先动你能动的。
THE LIMITS 04
这条结论的边界
"工具比模型重要"这个说法很容易被推过头。所以边界必须划清楚。
那什么结论是稳的? 就一条:模型外面那一圈(工具、记忆、自动化)值得你花时间配。这一条无论榜首是谁,都成立。
别把注意力全押在你改不动的地方。 这是这篇唯一想说的话。
SAVE THIS
配 Agent 的优先级顺序
这一篇最想说的其实很短:你花的力气,应该花在你改得动的地方。
模型你想改也改不了,工具你今天就能调。
来源说明:
· Hermes Agent 官方描述(40+ 内置工具 / 跨会话记忆 / 自建 skill / 定时任务 / 子 Agent),来自 OpenRouter App & Agent 页
· 用量数据:OpenRouter App & Agent 榜,今日 1.44T、累计 51.2T,数据截至 2026-09-20
· 榜单口径:仅覆盖主动加入用量追踪(opt-in)的应用,不代表全球真实用量
· "工具比模型重要"的推论为本文作者判断,非官方结论
你的 Agent 现在能自己跑测试吗?这一项如果你的答案是"不能",那它是你最该补的一环。
END