"当然可以!我很乐意帮你解决这个问题。你遇到的这个问题很可能是因为……"
等它真正说到点子上,已经过了 200 个 token。
代码解释也是一样。明明一句话能说清楚的事,非要铺垫背景、展开分析、总结结论,绕一大圈。
你不是一个人。
这是所有大模型的通病——训练数据里的人类就是这么说话的,模型学了个十成十。
但问题是,你用 AI 是为了干活,不是为了听它讲脱口秀。每一个多余的字,都是在烧你的钱、占你的上下文窗口、耗你的时间。
有没有办法让 AI 少说废话,只说干货?
有。它叫 Caveman(穴居人)。
二、Caveman 到底是什么?
一句话:Caveman 是一个给 AI 编码 Agent 用的「闭嘴插件」。
装上之后,你的 Claude Code、Cursor、Copilot、Gemini 等 30 多种 Agent,都会从「话痨模式」切换到「穴居人模式」——只说关键词,不说废话。
来感受一下对比:
useMemo. |
同一个问题,同样的答案,字数减少了 72%。
技术信息一点没少,但所有的客套话、过渡语、铺垫句全被砍掉了。
Caveman 的口号非常精准:
why use many token when few do trick(少数 token 能搞定的事,为啥要用那么多?)
截至 2026 年 7 月,这个项目已经拿到了 82.5K Star,Fork 4.6K,是近期 AI 工具圈最火的项目之一。
三、用一个类比讲懂它的思路
把 AI 想象成一个话痨的顾问。
你问他一个问题,他先要跟你寒暄,再讲行业背景,然后分析三种可能性,最后才给结论。整个过程 10 分钟,但结论其实只有 30 秒。
Caveman 做的事,就像你提前跟这个顾问约定:
"以后回答我,只说结论和关键依据。铺垫、客套、过渡句,全都省了。代码、命令、报错信息,一个字别动。"
就这么简单。
它不是让 AI 变笨,而是让 AI 的嘴变小。脑子还是那个脑子,知识一点没少,只是说话的方式变了。
这个思路朴素到什么程度?朴素到你可能会想:"这有什么技术含量?不就是一段提示词吗?"
但恰恰是这种「看起来简单,但没人认真做好」的事情,最容易爆火。因为它切中了一个真实的、普遍存在的痛点。
四、核心功能拆解
Caveman 实际上工具链做得相当完整。让我们一层层拆开来看。
4.1 六级压缩,自由切换
Caveman 提供了多个压缩等级,用 /caveman <级别> 随时切换,设置在当前会话内保持生效:
useMemo, since a new reference is created on every render. | ||
useMemo. New ref created every render. | ||
| full(默认) | useMemo. | |
useMemo it. | ||
useMemo |
💡 注意:
wenyan(文言文)模式不是简单翻译,而是故意用古汉语来压缩——因为文言文的信息密度确实更高。这是一个「玩梗归玩梗,效果归效果」的典型例子,看起来是整活,实际上有真实收益。
另外,Caveman 不改变输出语言。你用中文提问,它就用中文穴居语回答;葡萄牙语、西班牙语、法语同理。它压缩的是「风格」,不是「语言」。
4.2 不止「闭嘴」,还有一整套工具
Caveman 不只是让 AI 说话简洁,它围绕「省 token」这件事做了一整套工具链,覆盖从输入到输出、从单轮到记忆的全链路:
/caveman [lite/full/ultra/wenyan] | ||
/caveman-commit | ||
/caveman-review | L42: 🔴 bug: user null. Add guard. | |
/caveman-stats | ||
/caveman-compress <file> | ||
caveman-shrink | ||
cavecrew-* |
其中 是容易被低估的一招。
它不是压缩当前这一轮的输出,而是压缩你的项目记忆文件(比如 CLAUDE.md)。压缩后,每个新会话开始时加载的上下文就变小了——相当于每次启动都省 46% 的输入 token,是「一次操作,永久收益」。
4.3 实测数据:平均节省 65% 输出 token
Caveman 的基准测试是公开可复现的(在 benchmarks/ 和 evals/ 目录下),用真实的 Claude API token 计数:
| 87% | |||
| 83% | |||
| 84% | |||
| 87% | |||
| 平均 | 1214 | 294 | 65% |
可以看到一个清晰的规律:
• 解释类任务节省最多(80%+):因为有大量可压缩的描述性文字 • 代码类任务节省较少(20-30%):代码本身不能压缩,能砍的只有注释和解释
这也反过来告诉你:如果你的使用场景以解释、分析、排查为主,Caveman 的收益最大。 如果大部分是纯代码生成,收益会小一些。
五、它为什么值得关注?
5.1 省钱是副产品,省时才是核心收益
Caveman 自己在文档里很诚实地说了——项目里专门有一个文件叫 HONEST-NUMBERS.md(诚实数字):
Caveman 只压缩输出 token。输入和推理 token 不受影响,而且这个技能本身每轮会增加 ~1-1.5k 输入 token。所以整个会话的节省量没有输出数字那么夸张,在本来就很简洁的任务上甚至可能净亏损。
那为什么还值得用?
因为真正的收益是可读性和速度。
你读一段 1000 token 的回答,和读一段 200 token 的回答,花的时间差好几倍。AI 输出 1000 token 也比输出 200 token 慢得多。
举个具体的例子:假设你每天用 AI 编码 4 小时,交互 100 轮,每轮平均读 500 token 的回答。用了 Caveman 之后,每轮只读 200 token,你每天省下的阅读时间可能有 20-30 分钟。
省的不是几分钱的 API 费,是你的时间和注意力。 这才是真正值钱的东西。
5.2 反常识:说少了,反而更准?
这可能是 Caveman 最有意思的发现,也是最值得深入思考的一点。
2026 年 3 月的一篇论文《Brevity Constraints Reverse Performance Hierarchies in Language Models》测试了 31 个模型,发现:强制大模型给出简洁回答,在某些基准测试上准确率提升了约 26 个百分点。
为什么会这样?一个可能的解释是:
• 模型啰嗦的时候,容易「顺着话茬往下编」,为了显得连贯而添加不准确的内容,说多错多 • 强制简洁的时候,模型必须提炼核心信息,过滤掉不确定的猜测,反而更聚焦、更准确
这其实和人类的沟通规律很像——说得最多的人,往往不是最懂的人。
少即是多。 这句话在 AI 领域居然也成立。
5.3 不止一个项目,是一整个「穴居人生态」
Caveman 不是孤立的工具,作者 Julius Brussee 围绕「agent do more with less」(用更少做更多)这个核心理念,做了一整个工具家族:
| caveman | ||
| caveman-code | ||
| cavemem | ||
| cavekit | ||
| cavegemma |
从「让嘴变小」到「让记忆更高效」到「让构建循环更精简」再到「把简洁性直接训练进模型」,这个思路正在一步步深化。
这不是一个单点工具的爆火,而是一种工程哲学的落地:在 AI 能力过剩的时代,效率和克制才是新的竞争力。
5.4 30+ Agent 兼容,一次安装全搞定
Caveman 的另一个厉害之处是覆盖面极广:
• Claude Code(插件形式) • Codex • Gemini CLI(扩展形式) • Cursor / Windsurf / Cline / Copilot(通过 skills registry) • 以及其他 20 多种 Agent
而且它的安装体验做得非常丝滑——一条命令,自动检测你机器上所有的 Agent,挨个装好。不需要你一个个找插件、配路径。
这种「全平台兼容 + 一键安装」的体验,在 AI 工具里是很少见的。
六、谁适合用?谁不一定适合?
最适合的人
• 重度 AI 编码用户:每天用 Claude Code / Cursor / Copilot 写代码的工程师,交互轮次多,累计收益大 • 对上下文窗口敏感的人:经常做长对话、复杂任务,token 容易爆,每轮省一点就能多跑好几步 • 喜欢高效沟通的人:受不了 AI 废话文学,想直奔主题,时间比什么都贵 • 有大量解释类需求的人:经常让 AI 解释概念、分析 bug、做 code review——这类任务节省最明显(80%+) • 喜欢折腾工具的人:对 AI 效率工具有好奇心,愿意尝试新玩法
可能不太适合
• 刚学编程的新手:你需要 AI 详细解释每一步、讲清楚来龙去脉,压缩反而会增加理解成本 • 创意写作 / 内容生成场景:废话和修饰正是你要的,简洁反而没那味儿了 • 极短对话场景:Caveman 本身占用 1-1.5k 输入 token,如果你只问一两个简单问题,可能得不偿失 • 非英文用户:虽然它支持多语言压缩,但效果在英文上最显著,中文等其他语言的压缩率可能稍低 • 需要 AI 做复杂推理的场景:有些推理过程需要「一步一步想出来」,强制简洁可能影响推理质量
七、怎么上手?
第一步:一键安装
最简单的方式是用官方的安装脚本,它会自动检测你机器上安装了哪些 Agent,然后挨个安装 Caveman:
# macOS / Linux / WSL / Git Bashcurl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash# Windows PowerShell 5.1+irm https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.ps1 | iex大约 30 秒搞定。需要 Node ≥18。没装的 Agent 会自动跳过。可以反复运行,安全无害。
如果你只想给某个特定的 Agent 安装,也可以手动操作,比如:
# Claude Code 插件claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman# Gemini CLI 扩展gemini extensions install https://github.com/JuliusBrussee/caveman# Cursor / Windsurf / Cline 等(通过 skills registry)npx skills add JuliusBrussee/caveman -a cursor第二步:开启使用
在 Claude Code、Codex、Gemini 上,安装后默认就开启了,从第一条消息开始就是穴居人模式,不需要任何额外操作。
在其他 Agent 上,输入 /caveman 或者说 "talk like caveman" 即可开启。
想关掉?说 "normal mode" 就行。
想切换压缩级别?输入 /caveman ultra 或者 /caveman lite。
第三步:找到适合自己的级别
建议的体验路径:
1. 先用默认的 级别用 2-3 天,感受一下整体变化 2. 如果你觉得还是太啰嗦,可以升级到 ultra3. 如果你觉得有时候看不懂了,降回 lite4. 想玩梗兼极致压缩,试试 wenyan(文言文)模式
没有最好的级别,只有最适合你的级别。
第四步:试试进阶功能
用了一段时间、适应了穴居人模式之后,可以试试这两个能带来「永久收益」的功能:
1. —— 压缩你的项目记忆文件。以后每个新会话开始时,加载的上下文都更小,输入 token 永久减少约 46%。代码、URL、路径都会字节级保留,不用担心信息丢失。 2. —— 看看你到底省了多少 token、多少钱。在 Claude Code 上,状态栏会显示 [CAVEMAN] ⛏ 12.4k这样的数字,就是你累计节省的 token 数。满足一下成就感,也方便你评估 ROI。
八、写在最后:AI 会不会越进化话越少?
Caveman 爆火的背后,折射出一个有趣的趋势:
我们正在从「AI 能说多少」转向「AI 能说多准」。
大模型刚出来的时候,大家惊叹于它能说会道、滔滔不绝。那是「量」的震撼——「哇,它居然能写这么多!」
但用了几年之后,用户开始回归理性。我们发现,说得多不代表说得对,写得长不代表写得好。在日常工作中,我们需要的不是一个话痨 AI,而是一个精准、高效、直达本质的 AI。
Caveman 就是这种心态的产物。它不是在优化模型本身,而是在优化模型和人类之间的沟通效率。
这让我想到一个更深的问题:未来的 AI 会不会变得越来越「沉默」?
不一定。不同的场景需要不同的风格——教新手的时候要说得详细,做创意的时候要说得丰富,写代码的时候要说得精准。但可以确定的是,「说得多」不再是竞争力,「说得准」才是。
在这个信息过载的时代,能帮你过滤噪音、直达本质的工具,永远有价值。
Caveman 这个项目最好的地方,不是它省了多少 token,而是它提醒了我们一件事:
有时候,少,就是多
夜雨聆风