乐于分享
好东西不私藏

别再让 AI 废话了:这个插件砍掉 65% 的输出 token

别再让 AI 废话了:这个插件砍掉 65% 的输出 token
你有没有被 AI 的废话气到过?问一个简单的 bug,AI 先跟你寒暄三句:

"当然可以!我很乐意帮你解决这个问题。你遇到的这个问题很可能是因为……"

等它真正说到点子上,已经过了 200 个 token。

代码解释也是一样。明明一句话能说清楚的事,非要铺垫背景、展开分析、总结结论,绕一大圈。

你不是一个人。

这是所有大模型的通病——训练数据里的人类就是这么说话的,模型学了个十成十。

但问题是,你用 AI 是为了干活,不是为了听它讲脱口秀。每一个多余的字,都是在烧你的钱、占你的上下文窗口、耗你的时间。

有没有办法让 AI 少说废话,只说干货

有。它叫 Caveman(穴居人)

二、Caveman 到底是什么?

一句话:Caveman 是一个给 AI 编码 Agent 用的「闭嘴插件」。

装上之后,你的 Claude Code、Cursor、Copilot、Gemini 等 30 多种 Agent,都会从「话痨模式」切换到「穴居人模式」——只说关键词,不说废话。

来感受一下对比:

正常 AI(69 tokens)
Caveman(19 tokens)
The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle. When you pass an inline object as a prop, React's shallow comparison sees it as a different object every time, which triggers a re-render. I'd recommend using useMemo to memoize the object.
New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.

同一个问题,同样的答案,字数减少了 72%。

技术信息一点没少,但所有的客套话、过渡语、铺垫句全被砍掉了。

Caveman 的口号非常精准:

why use many token when few do trick(少数 token 能搞定的事,为啥要用那么多?)

截至 2026 年 7 月,这个项目已经拿到了 82.5K Star,Fork 4.6K,是近期 AI 工具圈最火的项目之一。

三、用一个类比讲懂它的思路

把 AI 想象成一个话痨的顾问

你问他一个问题,他先要跟你寒暄,再讲行业背景,然后分析三种可能性,最后才给结论。整个过程 10 分钟,但结论其实只有 30 秒。

Caveman 做的事,就像你提前跟这个顾问约定:

"以后回答我,只说结论和关键依据。铺垫、客套、过渡句,全都省了。代码、命令、报错信息,一个字别动。"

就这么简单。

它不是让 AI 变笨,而是让 AI 的嘴变小。脑子还是那个脑子,知识一点没少,只是说话的方式变了。

这个思路朴素到什么程度?朴素到你可能会想:"这有什么技术含量?不就是一段提示词吗?"

但恰恰是这种「看起来简单,但没人认真做好」的事情,最容易爆火。因为它切中了一个真实的、普遍存在的痛点。

四、核心功能拆解

Caveman 实际上工具链做得相当完整。让我们一层层拆开来看。

4.1 六级压缩,自由切换

Caveman 提供了多个压缩等级,用 /caveman <级别> 随时切换,设置在当前会话内保持生效:

级别
同一句话压缩后
适合场景
normal(原生)
You should wrap the object in useMemo, since a new reference is created on every render.
需要详细解释时
lite
Wrap object in useMemo. New ref created every render.
日常编码,轻度压缩
full(默认)
New ref each render. Wrap object in useMemo.
大多数情况,推荐起点
ultra
New ref/render. useMemo it.
极限省 token,极简主义
wenyan
新引用每次渲染,故包于 useMemo
玩梗 + 真正的极致压缩

💡 注意wenyan(文言文)模式不是简单翻译,而是故意用古汉语来压缩——因为文言文的信息密度确实更高。这是一个「玩梗归玩梗,效果归效果」的典型例子,看起来是整活,实际上有真实收益。

另外,Caveman 不改变输出语言。你用中文提问,它就用中文穴居语回答;葡萄牙语、西班牙语、法语同理。它压缩的是「风格」,不是「语言」。

4.2 不止「闭嘴」,还有一整套工具

Caveman 不只是让 AI 说话简洁,它围绕「省 token」这件事做了一整套工具链,覆盖从输入到输出、从单轮到记忆的全链路:

命令
功能
节省什么
/caveman [lite/full/ultra/wenyan]
开启压缩模式,会话内持续生效
每轮输出 token
/caveman-commit
生成 Conventional Commit 规范的提交信息,标题 ≤50 字符
提交信息的输出
/caveman-review
一行式 PR 评论:L42: 🔴 bug: user null. Add guard.
Code Review 的输出
/caveman-stats
查看会话 token 用量、累计节省量、折合美元金额
让你知道省了多少
/caveman-compress <file>
把记忆文件压缩成穴居人语,后续每个会话都受益
每轮输入 token(永久)
caveman-shrink
MCP 中间件,包装任意 MCP 服务并压缩其工具描述
工具调用的输入 token
cavecrew-*
穴居人版子 Agent(调查员、构建者、评审员)
子 Agent 的全部 token

其中 是容易被低估的一招。

它不是压缩当前这一轮的输出,而是压缩你的项目记忆文件(比如 CLAUDE.md)。压缩后,每个新会话开始时加载的上下文就变小了——相当于每次启动都省 46% 的输入 token,是「一次操作,永久收益」。

4.3 实测数据:平均节省 65% 输出 token

Caveman 的基准测试是公开可复现的(在 benchmarks/ 和 evals/ 目录下),用真实的 Claude API token 计数:

任务
正常模式
Caveman
节省
解释 React 重渲染 bug
1180
159
87%
修复认证中间件 token 过期
704
121
83%
搭建 PostgreSQL 连接池
2347
380
84%
解释 git rebase vs merge
702
292
58%
回调重构为 async/await
387
301
22%
架构:微服务 vs 单体
446
310
30%
PR 安全审查
678
398
41%
Docker 多阶段构建
1042
290
72%
调试 PostgreSQL 竞态条件
1200
232
81%
实现 React Error Boundary
3454
456
87%
平均121429465%

可以看到一个清晰的规律:

  • • 解释类任务节省最多(80%+):因为有大量可压缩的描述性文字
  • • 代码类任务节省较少(20-30%):代码本身不能压缩,能砍的只有注释和解释

这也反过来告诉你:如果你的使用场景以解释、分析、排查为主,Caveman 的收益最大。 如果大部分是纯代码生成,收益会小一些。

五、它为什么值得关注?

5.1 省钱是副产品,省时才是核心收益

Caveman 自己在文档里很诚实地说了——项目里专门有一个文件叫 HONEST-NUMBERS.md(诚实数字):

Caveman 只压缩输出 token。输入和推理 token 不受影响,而且这个技能本身每轮会增加 ~1-1.5k 输入 token。所以整个会话的节省量没有输出数字那么夸张,在本来就很简洁的任务上甚至可能净亏损。

那为什么还值得用?

因为真正的收益是可读性和速度。

你读一段 1000 token 的回答,和读一段 200 token 的回答,花的时间差好几倍。AI 输出 1000 token 也比输出 200 token 慢得多。

举个具体的例子:假设你每天用 AI 编码 4 小时,交互 100 轮,每轮平均读 500 token 的回答。用了 Caveman 之后,每轮只读 200 token,你每天省下的阅读时间可能有 20-30 分钟。

省的不是几分钱的 API 费,是你的时间和注意力。 这才是真正值钱的东西。

5.2 反常识:说少了,反而更准?

这可能是 Caveman 最有意思的发现,也是最值得深入思考的一点。

2026 年 3 月的一篇论文《Brevity Constraints Reverse Performance Hierarchies in Language Models》测试了 31 个模型,发现:强制大模型给出简洁回答,在某些基准测试上准确率提升了约 26 个百分点。

为什么会这样?一个可能的解释是:

  • • 模型啰嗦的时候,容易「顺着话茬往下编」,为了显得连贯而添加不准确的内容,说多错多
  • • 强制简洁的时候,模型必须提炼核心信息,过滤掉不确定的猜测,反而更聚焦、更准确

这其实和人类的沟通规律很像——说得最多的人,往往不是最懂的人。

少即是多。 这句话在 AI 领域居然也成立。

5.3 不止一个项目,是一整个「穴居人生态」

Caveman 不是孤立的工具,作者 Julius Brussee 围绕「agent do more with less」(用更少做更多)这个核心理念,做了一整个工具家族:

项目
压缩什么
状态
caveman
(本项目)
Agent 出来的话
已发布,82K+ Star
caveman-code
整个编码 Agent,端到端
已发布
cavemem
Agent 记住的东西(跨会话记忆)
已发布
cavekit
构建循环(规格驱动,减少无效尝试)
已发布
cavegemma
把压缩能力烘焙到模型权重里(Gemma 微调)
已发布

从「让嘴变小」到「让记忆更高效」到「让构建循环更精简」再到「把简洁性直接训练进模型」,这个思路正在一步步深化。

这不是一个单点工具的爆火,而是一种工程哲学的落地:在 AI 能力过剩的时代,效率和克制才是新的竞争力。

5.4 30+ Agent 兼容,一次安装全搞定

Caveman 的另一个厉害之处是覆盖面极广:

  • • Claude Code(插件形式)
  • • Codex
  • • Gemini CLI(扩展形式)
  • • Cursor / Windsurf / Cline / Copilot(通过 skills registry)
  • • 以及其他 20 多种 Agent

而且它的安装体验做得非常丝滑——一条命令,自动检测你机器上所有的 Agent,挨个装好。不需要你一个个找插件、配路径。

这种「全平台兼容 + 一键安装」的体验,在 AI 工具里是很少见的。

六、谁适合用?谁不一定适合?

 最适合的人

  • • 重度 AI 编码用户:每天用 Claude Code / Cursor / Copilot 写代码的工程师,交互轮次多,累计收益大
  • • 对上下文窗口敏感的人:经常做长对话、复杂任务,token 容易爆,每轮省一点就能多跑好几步
  • • 喜欢高效沟通的人:受不了 AI 废话文学,想直奔主题,时间比什么都贵
  • • 有大量解释类需求的人:经常让 AI 解释概念、分析 bug、做 code review——这类任务节省最明显(80%+)
  • • 喜欢折腾工具的人:对 AI 效率工具有好奇心,愿意尝试新玩法

可能不太适合

  • • 刚学编程的新手:你需要 AI 详细解释每一步、讲清楚来龙去脉,压缩反而会增加理解成本
  • • 创意写作 / 内容生成场景:废话和修饰正是你要的,简洁反而没那味儿了
  • • 极短对话场景:Caveman 本身占用 1-1.5k 输入 token,如果你只问一两个简单问题,可能得不偿失
  • • 非英文用户:虽然它支持多语言压缩,但效果在英文上最显著,中文等其他语言的压缩率可能稍低
  • • 需要 AI 做复杂推理的场景:有些推理过程需要「一步一步想出来」,强制简洁可能影响推理质量

七、怎么上手?

第一步:一键安装

最简单的方式是用官方的安装脚本,它会自动检测你机器上安装了哪些 Agent,然后挨个安装 Caveman:

# macOS / Linux / WSL / Git Bashcurl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
# Windows PowerShell 5.1+irm https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.ps1 | iex

大约 30 秒搞定。需要 Node ≥18。没装的 Agent 会自动跳过。可以反复运行,安全无害。

如果你只想给某个特定的 Agent 安装,也可以手动操作,比如:

# Claude Code 插件claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman# Gemini CLI 扩展gemini extensions install https://github.com/JuliusBrussee/caveman# Cursor / Windsurf / Cline 等(通过 skills registry)npx skills add JuliusBrussee/caveman -a cursor

第二步:开启使用

在 Claude Code、Codex、Gemini 上,安装后默认就开启了,从第一条消息开始就是穴居人模式,不需要任何额外操作。

在其他 Agent 上,输入 /caveman 或者说 "talk like caveman" 即可开启。

想关掉?说 "normal mode" 就行。

想切换压缩级别?输入 /caveman ultra 或者 /caveman lite

第三步:找到适合自己的级别

建议的体验路径:

  1. 1. 先用默认的 级别用 2-3 天,感受一下整体变化
  2. 2. 如果你觉得还是太啰嗦,可以升级到 ultra
  3. 3. 如果你觉得有时候看不懂了,降回 lite
  4. 4. 想玩梗兼极致压缩,试试 wenyan(文言文)模式

没有最好的级别,只有最适合你的级别。

第四步:试试进阶功能

用了一段时间、适应了穴居人模式之后,可以试试这两个能带来「永久收益」的功能:

  1. 1. —— 压缩你的项目记忆文件。以后每个新会话开始时,加载的上下文都更小,输入 token 永久减少约 46%。代码、URL、路径都会字节级保留,不用担心信息丢失。
  2. 2. —— 看看你到底省了多少 token、多少钱。在 Claude Code 上,状态栏会显示 [CAVEMAN] ⛏ 12.4k 这样的数字,就是你累计节省的 token 数。满足一下成就感,也方便你评估 ROI。
八、

八、写在最后:AI 会不会越进化话越少?

Caveman 爆火的背后,折射出一个有趣的趋势:

我们正在从「AI 能说多少」转向「AI 能说多准」。

大模型刚出来的时候,大家惊叹于它能说会道、滔滔不绝。那是「量」的震撼——「哇,它居然能写这么多!」

但用了几年之后,用户开始回归理性。我们发现,说得多不代表说得对,写得长不代表写得好。在日常工作中,我们需要的不是一个话痨 AI,而是一个精准、高效、直达本质的 AI。

Caveman 就是这种心态的产物。它不是在优化模型本身,而是在优化模型和人类之间的沟通效率

这让我想到一个更深的问题:未来的 AI 会不会变得越来越「沉默」?

不一定。不同的场景需要不同的风格——教新手的时候要说得详细,做创意的时候要说得丰富,写代码的时候要说得精准。但可以确定的是,「说得多」不再是竞争力,「说得准」才是。

在这个信息过载的时代,能帮你过滤噪音、直达本质的工具,永远有价值。

Caveman 这个项目最好的地方,不是它省了多少 token,而是它提醒了我们一件事:

有时候,少,就是多