ARTICLE · 1123709
AI Agent 用的 token 是人类 5 倍:但 85% 是在「重读旧内容」
QUOTE
Agent 烧的不是它读了多少,而是这些上下文得一直占着最贵的那层内存。
—— 甬洁AI
Futurum Group CEO Daniel Newman 在 9 月 30 日的一条推文里说:「AI 被 AI 使用的量,目前是人类使用量的 5 倍。这个数字会加速到 10 倍,然后越来越高。」他引的是 a16z 基于 OpenRouter 数据做的图:8 月 agent 用了 7.3 万亿 token,人类只有 1.4 万亿。但有个关键反转——agent 的 token 大部分是在重读它已经看过的东西。
本文看点
01
5 倍,冲向 10 倍
02
85% 是缓存
03
代价转给内存
01
5X AND CLIMBING
数据:5 倍,而且朝着 10 倍去
7.3 万亿
Agent token(8 月)
1.4 万亿
人类 token(8 月)
交叉点出现在今年 2 月:那是 agent 用量第一次超过人类的月份。从那之后,OpenRouter 的数据显示 agent 用量涨了 14 倍,而人类用量只涨了 2.8 倍。
OpenRouter 是「领先的 AI 模型网关与路由平台」。它把每个 API key 分成三类:agentic、mixed、human,靠一套「7 信号加权综合评分」,输入包括工具调用率、对话轮数、请求间隔时间等。混合类(可能兼有 agent 与人类行为)同期涨了 4.7 倍——具体怎么分,会影响 agent 领先人类的幅度。
几处需要留意:这份数据衡量的是 token 量而不是花费;只来自一个平台;趋势并不完全一致,4 月和 7 月都有回落。但 agent 用量确实在别处也在涨——麦肯锡 2026 年 AI 状况调查里,大型机构中「已在规模化使用 AI agent」的受访者占 40%,一年前是 27%。
02
THE TWIST
关键反转:85% 是缓存,96% 是重读
a16z 引 OpenRouter 数据指出:agent 的 token 里超过 85% 来自缓存提示词。缓存 token 比从头处理便宜得多,但——它仍然要占住内存。
这个模式在一家呼叫中心咨询公司的日志里也能看到:它租了 Nvidia H200 测 DeepSeek,而它自己 9 月在 Claude Code 上的 agent 用量里,「96% 的输入都是在重读旧对话」。
「token 数会高估真实账单,但内存的硬件成本是实打实的。」
03
MEMORY PRESSURE
代价转嫁到内存:KV cache 撑爆 HBM
缓存 token 几乎贡献了全部的相对增长。模型把这些存下来的上下文放在所谓的 KV cache 里,而按 Tom’s Hardware 此前的报道,「KV cache 正在超出 GPU 的 HBM 容量」。a16z 本身是 OpenRouter 的投资方,它把这件事和高带宽内存(HBM)需求上升直接挂上了钩。
而内存本来就已经紧张。美光预计 RAM 与存储的短缺会在 2027、2028 年进一步恶化,客户要付比今年更高的价,同时内存厂商优先把 HBM 留给 AI 数据中心。
如果「5 倍会变成 10X、20X、30X」成真,想买内存的 PC 用户就要和越来越多的 agent 抢货。
∞
THE END
结语
一句话:Agent 用 token 像喝水,但喝下去的大多是「回锅水」——真正烧钱的不是它读了多少,而是这些上下文必须一直占着最贵的那层内存。所以「AI 用量 5 倍于人类」这个数字,既是需求信号,也是一道正在传导到内存与 HBM 供应链的压力。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。