夜雨聆风学习资料网

ARTICLE · 1126262

你的AI agent,70%算力浪费了

你的AI agent,70%算力浪费了

你的AI agent,70%算力浪费了

先说结论:你每天烧钱跑的 agent,有四到七成调用,根本轮不到大模型出手。

本周 X 上一条帖子又火了一轮:NVIDIA 的研究人员拆了三个开源 agent 系统,估算其中 40%~70% 的 LLM 调用可以交给小语言模型(SLM)处理。帖子下面一片"原来我一直给大模型交智商税"。

但有个前提必须先说破:这不是本周的新研究。 NVIDIA 那篇《Small Language Models are the Future of Agentic AI》是 2025 年 6 月的 arXiv 预印本,作者 Peter Belcak 等人。本周(2026 年 9 月)是 X 用户 @jianw851 把它重新翻出来炒热的。旧论文被重新包装成新闻,本身就是个值得聊的现象——这个放到最后说,先聊数字为什么站得住。

一、"浪费"是怎么算出来的

NVIDIA 给 SLM 划了条线:小于 10B 参数、能在消费级设备上实时推理。低于这条线的模型,在 agent 系统的多数调用里已经够用、更合适、也更省钱。

具体拆到三个系统:MetaGPT 60% 的调用可替代,Open Operator 40%,Cradle 70%。

为什么这些调用不需要大模型?因为 agent 干的大部分活,不是"思考",是"盖章"。

你让 agent 整理一份报销单,它实际执行的步骤是:读入一段文本、判断类别、抽几个字段、调一个 API、返回一段 JSON。每一步都是固定套路,不需要灵光一闪。这就好比让首席专家去盖公章——章盖得再漂亮,这个活本身配不上他的时薪。

成本差多少?论文口径:7B 小模型比 70-175B 大模型,在延迟、能耗、算力上便宜 10~30 倍。

二、真正值钱的是脚手架,不是参数

如果故事停在"小模型也能用",那只是个省钱小贴士。CMU 在 2026 年 7 月的一篇论文里给出了更有意思的部分:小模型开箱不好用,但可以被"调教"到反超。

论文标题直接把答案写脸上了:《Better Harnesses, Smaller Models》——harness,就是套在模型外面那层工作流脚手架。

预算审批这个案例最能说明问题:

  • 大模型 gemini-3.1-pro + 通用脚手架:准确率 97.3%,每次 $0.22,70 秒
  • 小模型 gemma-4-26b-a4b + 通用脚手架:准确率 75.0%,不够用
  • 同一个小模型 + 专门适配的脚手架:准确率 98.3%,每次 $0.018,33 秒

准确率反超,成本不到大模型的十分之一。

那个"适配"改了什么?没换模型、没加参数,只做了三件事:把系统提示重写成逐步工作流、把工具集从 6 个筛到 5 个、加了一个防死循环的 Python Hook。然后一个 meta-agent 自动迭代了 23 次。

整个实验规模是 7 个业务任务 × 3 个 SLM 家族 = 21 组配对。优化脚手架后,16/21 显著提升,7 组追平了小模型和大模型的差距。论文的最佳结果:小模型恢复大模型 89.7% 的性能,花 4% 的成本(部分表述为 8%,以论文表格为准)。

最关键的祛魅点在这里:小模型失败的主因是指令跟随和知识缺口,不是推理能力。这两类问题都能靠脚手架缓解,不需要更大的模型。换句话说,我们过去把"它不听话"误诊成了"它不够聪明"。

三、祛魅要祛到底:这条结论有边界

如果文章到这儿收尾,就成了另一篇"小模型万岁"的布道。论文自己划了边界,必须讲清楚。

CMU 的适用性结论:低多样性任务(固定工作流,比如考勤、预算审批)适配后能到 ~89%;高多样性任务(比如代码重构)只有 ~68%。

也就是说,"小模型+好脚手架反超"只在重复性任务上成立。你的活越像流水线,小模型越香;越像创作,越还得靠大模型。

NVIDIA 论文自己也没说全用小模型。它主张的是异构系统:routine 窄任务交给 SLM,复杂推理和开放对话保留大模型。这不是"换掉",是"分工"。

四、公道话

大模型崇拜被祛魅,不等于这些研究在说大模型没用。

痛点是真实的:过去两年,很多人默认"最强的模型干所有事最省心",结果为一个抄字段的调用付了推理的钱。问题出在匹配度,不在方向。前沿模型在开放式推理、长链路研究、创作上的能力,目前没有任何小模型能替。

真正该改的是一个习惯:别按"哪个模型最强"选,按"这一步需要哪种能力"选。

五、旧论文为什么本周才火

回到开头那个点。NVIDIA 的论文 2025 年 6 月就挂在 arXiv 上了,为什么拖到 2026 年 9 月才在中文圈刷屏?

因为叙事比事实跑得快。论文刚发那会儿,行业主流情绪是"越大越贵越好",一个"小模型够用"的结论没人愿意接。等到算力成本压不住、agent 铺进真实业务、账单开始疼了,同一篇论文突然就"应景"了。

这不是 NVIDIA 的问题,是传播的规律:一条内容什么时候算新闻,不取决于它哪天被写出来,取决于大家哪天开始需要相信它。

顺带一提,帖子里还引了个 Gartner 预测:到 2027 年,企业使用小任务专用模型的数量将是通用大模型的 3 倍。这个数字我们没核到 Gartner 原始报告,系 X 帖转述,仅供参考。

六、所以你的 agent 该怎么改

三句话:

  1. 先翻你 agent 的调用日志,把"盖章类"调用挑出来——路由、抽取、调工具、返 JSON,这些是 SLM 的活。
  2. 挑出来的部分别急着换小模型,先把脚手架做扎实:分步工作流、精简工具集、防循环 hook。不换脚手架直接换小模型,就是那个 75%。
  3. 开放式推理、创作、研究,继续用前沿模型。这不是妥协,是分工。

省下来的不是零头。按论文口径,是 10~30 倍。

欢迎来评论区聊聊。您的点赞、收藏、转发,是我日后更新的最大鼓励。

相关学习资料