最近GitHub上有个项目火了,叫"Caveman"(原始人)。
它的卖点用它自己的话来说是这样的:
"Skill make agent talk like caveman. Why use many token when few do trick. Filler die. Code, commands stay byte-exact. 65% output token saved. Every reply. Forever."
翻译成人话:这个技能让AI编程助手像原始人一样说话。能用一个词就不用一句话。废话全删,代码和命令一字不改。号称每次回复都能省65%的输出token。永久有效。适配30多种AI助手。GitHub上很多star。
听起来太香了对吧?每天跟AI编程助手打交道,光token费用就是一笔不小的开支。如果能省65%……

📷 跟AI说原始人话真能省钱吗
JetBrains(就是做IntelliJ IDEA那家公司)的研究团队看到了这个项目,决定认真测一测。他们花了106美元,跑了240次实验,结果发现——
实际省了8.5%。不是65%。差了将近8倍。
为什么差距这么大
先解释一下"Caveman"到底干了什么。
安装了这个技能的AI编程助手,在回复你的时候会把所有"废话"删掉。比如正常情况下AI会说:"好的,我来帮你修改这个函数。首先我们需要……"——Caveman会把这些全部删掉,直接给你代码。
"Why use many token when few do trick."
这个思路本身没问题。大语言模型的输出确实包含大量自然语言解释、思考过程、礼貌用语。如果你只想要代码和结果,这些确实是浪费。
但JetBrains的研究团队指出了一个关键问题:
AI编程助手不是聊天机器人。它的输出大部分是代码、文件修改、工具调用——这些东西Caveman自己说了不会动。
换句话说,Caveman只能压缩AI"说话"的部分,但AI编程助手的大部分输出根本不是"说话",而是干活的工具调用和代码。
打个比方:你去餐厅吃饭,账单上有菜钱和服务费。Caveman帮你省了服务费(可能省了不少),但菜钱一分没少。问题是你的账单大头是菜钱。
实验是怎么做的
JetBrains的实验设计相当严谨,值得拆解一下。
测试框架:Harbor 0.17——一个Docker沙箱化的测试系统,能做任务级别的验证和配对对比。
被测对象:Claude Code 2.1.200(无头模式),使用Claude Sonnet 5模型,推理强度设为low。
测试基准:SkillsBench(benchflow/skillsbench),86个任务(总共87个,排除1个)。每个任务由自己的测试用例自动评分,0到1分,1分代表完全解决。
两组对比:
A组(对照组):标准Claude Code,不装Caveman
B组(实验组):安装Caveman并强制激活(每次回复都用原始人模式)
注意"强制激活"这个细节。Caveman正常情况下是用户手动触发的——你说"caveman mode"它才生效。但JetBrains强制它在每次回复中都激活,这意味着他们测的是Caveman的最佳情况。在正常使用中,节省只会更少。
实验量:3轮重复,大约240次计费实验。
三个核心发现

📷 token节省实测对比
发现一:实际节省8.5%,不是65%
JetBrains做了三轮测试:
第一轮(10个任务,跑1次):节省了29.5%。看起来不错?但样本太小。
第二轮(10个任务,每个跑3次):节省了6.7%。大幅缩水。
第三轮(86个任务,跑1次):节省了8.5%。这是最终结论。
从592k token降到542k token,在82个配对任务上。
那个29.5%的早期结果没有复现。随着样本量增大,节省率收敛到了8.5%。而声称的65%?完全不在图表范围内。
为什么?因为编程助手的大部分输出token是代码、diff、工具调用和精确的错误信息。Caveman正确地保留了这些原封不动。只有工具调用之间的叙述文字被压缩了——但叙述文字本身就不多。
发现二:质量没有可检测的下降
这是JetBrains最关心的问题:让AI少说话,会不会让它干活更差?
答案是不会。
在82个配对任务中:
8个任务:装了Caveman的组得分更高
10个任务:装了Caveman的组得分更低
64个任务:两组得分一样
符号检验(sign test)显示p值=0.82。在统计学上,这意味着两组之间没有任何显著差异。平均任务得分对照组0.326 vs 实验组0.311,差距只有0.015分。
换句话说:Caveman确实改变了AI说话的方式——回复确实变成了原始人风格——但它不影响AI干活的实际质量。
代码产物完全不受影响。风格转换本身工作得很好。只是省下的token没有声称的那么多。
发现三:成本节省是真的,但很脆弱
理论上8.5%的token节省应该转化为大约10%的成本降低。
在大多数任务上确实如此。但JetBrains的全量测试中出现了一个意外:
一个依赖审计任务在实验组中膨胀超过了200k token的长上下文定价阶梯,单次计费8.29美元,而对照组同一任务只花了0.33美元。
就这一个任务就让整个实验组的总成本反而比对照组高了11.6%:40.60美元 vs 36.39美元。
但JetBrains很诚实地指出:这是任务的特性,不是技能的问题。在更早的一轮测试中,同一个任务在对照组也出现过3.25美元的异常值。
为什么这件事值得认真对待
你可能会说:"一个GitHub项目吹了牛,有什么大不了的?"
大不在项目本身,在于这件事暴露的一个行业趋势。
过去一年,AI编程助手的使用成本成了所有开发团队的心病。Cursor、GitHub Copilot、Claude Code——这些工具确实能提高效率,但账单也在飞速增长。一个中型团队每月花在AI API上的费用可能上万甚至几万美元。
在这种焦虑下,"省65% token"这种承诺特别有杀伤力。很多开发者和团队管理者会直接信,装上就用,不会去做JetBrains这样的严谨测试。
JetBrains花了106美元、跑了240次实验,才搞清楚一个声称能省65%的工具实际只能省8.5%。这不是一个技术问题,是一个信息不对称问题。
类似的情况在AI工具生态里到处都是:
某个提示词模板号称能让AI输出质量提升10倍,但没人测过它的对照组。某个RAG方案号称检索准确率99%,但测试集只有20条数据。某个微调服务号称让模型性能翻倍,但比较对象是最基础的原模型,没加任何prompt engineering。
AI领域现在最大的问题不是技术不够好,而是太多人说的话没法验证。
JetBrains的这篇测试报告做了一件很多人应该做但没人做的事:拿一个流行工具的声称,花钱花时间认真验证。
"Claim cheap to make. Verify expensive."
声称很便宜。验证很贵。
这句话应该贴在每个AI工具的README上面。
那到底该不该用Caveman
JetBrains最后的建议出人意料地中肯:
"Use it if you like it. It is fun, and it costs you nothing measurable in quality. Just do not expect huge savings on daily agentic tasks: a high-single-digit percentage is the realistic ceiling."
翻译:喜欢就用。挺好玩的。质量上不会有什么损失。但别指望在日常编程任务中省大钱——个位数百分比是现实天花板。
它不会让你的AI助手变差。它确实能让回复更简洁。如果每天大量使用AI助手,8.5%的节省积少成多也不是小数目。
但65%这个数字,确实属于营销话术的范畴了。
〜〜〜〜〜〜〜
这件事给我一个感触。AI工具生态正在快速膨胀,每天都有新的项目、新的技能、新的"革命性突破"冒出来。大多数都缺乏严格验证。
不是每个团队都有JetBrains的资源和专业能力去做240次对照实验。但至少我们可以学会一件事:看到一个特别诱人的数字时,先问一句"这个数字是怎么测出来的"。
65%省token的广告,测出来是8.5%。
这个差距不是四舍五入的误差。是8倍。
在AI的世界里,如果你不验证,你永远不知道你买的到底是65%还是8.5%。而验证的成本,往往比你想的便宜——JetBrains只花了106美元。
106美元搞清楚一个行业流行工具的真实效果。这笔钱花得值。
夜雨聆风