夜雨聆风学习资料网

ARTICLE · 1110247

那个最火的 AI 编程工具,其实一半的活不是它自己干的

那个最火的 AI 编程工具,其实一半的活不是它自己干的
AI趋势老王

那个最火的 AI 编程工具,其实一半的活不是它自己干的

真实 Token 消耗榜第一的 Agent,官方描述里有 40 多个内置工具、跨会话记忆、自己造技能。能力的大头不在模型里。

▼ 3 秒钟速读

1
在 OpenRouter 的真实用量榜上,Hermes Agent 排第一(今日 1.44T tokens,累计 51.2T)。
2
官方对它的描述原文写着:40+ 内置工具、跨会话持久记忆、从经验里构建可复用的 skill。
3
这意味着:你以为在比哪个模型强,但真正拉开差距的可能是模型外面那一圈工具和记忆机制。
4
诚实提醒:"40+" 是官方自述,我没有逐个核验;"一半的活"是修辞,不是测量数据。

CORE TAKEAWAY

Agent 的能力大头来自工具和记忆,不来自模型。配工具比换模型更值得花时间。

阅读预计耗时:约 5 分钟

完整阅读版

选 AI 工具的时候,大部分人的注意力只有一个焦点:用的什么模型。

但如果你去看那些"真正在干活"的 Agent 是怎么配的,会发现一件反直觉的事——它们的能力大头,可能压根不在模型那边。

这个判断有据可依。我去翻了 OpenRouter 官方对榜上产品的描述原文,描述里写得最多的不是模型,是工具。

THE EVIDENCE 01

先看证据:官方描述里有什么

OpenRouter 的 App & Agent 页面对每个产品的介绍,是官方口径。排名第一的 Hermes Agent,描述原文列出了这么几样东西:

内置工具
**40+**,含网页搜索、浏览器自动化、视觉
记忆机制
**跨会话持久记忆**,不是每次从零开始
自我改进
**从经验中构建可复用的 skill**
自动化
**定时任务** 与 **子 Agent**(subagents)

请注意这个比例:这段描述里,关于"模型"的信息几乎为零,全在讲工具、记忆、自动化。一家做 Agent 的公司,把描述重心放在这里,是有理由的。

你调的不是模型,是一套"模型 + 工具 + 记忆"的系统。

WHY 02

为什么工具比模型更影响结果

回到那个老问题:模型能力是固定的,为什么工具配置能拉开差距?

因为Agent 干活的真实形态,是一串动作,不是一次回答。

1

读取

模型先要知道项目长什么样。有没有文件读取工具,决定它是在猜还是在看。

2

检索

要改一个函数,得先找到所有调用点。没有搜索工具,它只能靠上下文里恰好出现的信息。

3

验证

改完能不能自己跑测试?没有执行工具,它就只能"觉得"改对了。这一步是分水岭。

4

记忆

下次遇到同类问题,是从零推理,还是直接调用上次验证过的做法?这就是记忆机制的价值。

这四步里,每一步都对应一个工具。缺一个,链条就断一环。 而模型再强,没有"跑测试"这个工具,它也没法自己验证结果。

一个直接的推论

所以"同一个模型换个 Harness 差 26 个百分点"这件事,不是模型的问题,是这四步缺了几步的问题。

HOW TO APPLY 03

那具体该怎么配

知道了原理,落到动作上就是一件事:先补链条,再谈模型。

01
先看有没有执行能力 —— 能读能写但不会跑,等于闭着眼改代码。这项优先级最高。
02
再看有没有检索能力 —— 项目一大,"找不到调用点"就是最大的浪费。
03
然后看记忆 —— 有没有把踩过的坑存下来。没有记忆的 Agent,每次都在重犯同样的错。
04
接着看定时与子 Agent —— 这是把单次对话变成"常驻助手"的关键一跳。
05
最后才看模型 —— 上面四项齐了,再用榜单去挑模型,这时候挑才有意义。

为什么把模型放最后? 不是模型不重要,而是模型是这几项里最不可控的一个——你只能等它更新,别的你随时能改。先动你能动的。

THE LIMITS 04

这条结论的边界

"工具比模型重要"这个说法很容易被推过头。所以边界必须划清楚。

·
"40+" 是官方自述 —— 我没有逐个核验工具数量,也没测每个工具的实际可用度
·
"一半的活"是修辞 —— 我没有测量过工具与模型对结果的贡献占比,这不是数据
·
榜单是 OpenRouter 口径 —— 只覆盖走它 API 且主动上报的应用,不是全球真实用量
·
案例是单一来源 —— 用榜首产品的官方描述推"普遍规律",样本量是 1

那什么结论是稳的? 就一条:模型外面那一圈(工具、记忆、自动化)值得你花时间配。这一条无论榜首是谁,都成立。

别把注意力全押在你改不动的地方。 这是这篇唯一想说的话。

SAVE THIS

配 Agent 的优先级顺序

01
执行能力 —— 能读能写但不会跑测试,等于闭着眼改代码,优先级最高
02
检索能力 —— 项目一大,找不到调用点就是最大浪费
03
记忆机制 —— 没有记忆的 Agent 每次都在重犯同样的错
04
定时与子 Agent —— 把单次对话变成常驻助手的关键一跳
05
模型 —— 上面四项齐了再去挑,这时候挑才有意义

这一篇最想说的其实很短:你花的力气,应该花在你改得动的地方。

模型你想改也改不了,工具你今天就能调。

来源说明:

· Hermes Agent 官方描述(40+ 内置工具 / 跨会话记忆 / 自建 skill / 定时任务 / 子 Agent),来自 OpenRouter App & Agent 页

· 用量数据:OpenRouter App & Agent 榜,今日 1.44T、累计 51.2T,数据截至 2026-09-20

· 榜单口径:仅覆盖主动加入用量追踪(opt-in)的应用,不代表全球真实用量

· "工具比模型重要"的推论为本文作者判断,非官方结论

你的 Agent 现在能自己跑测试吗?这一项如果你的答案是"不能",那它是你最该补的一环。

END

相关学习资料