Agent 推理了半天,最后给你回一堆“I'd be happy to...”、“Let me take a look and suggest...”、“The reason is likely because...”,中间全是废话连篇的礼貌措辞,真正有用的代码建议就那么一行。
明明一句话能说清楚的事,AI 非要跟你客套半天。
这不是你的问题,这是 AI 的“礼貌病”。而今天要聊的这个开源项目,直接用一个粗暴但极其有效的方式把它治了——让 AI 学会“说话简洁”。
它不是让 AI 变笨,而是让 AI 闭嘴
项目名叫 Caveman,直译过来就是“原始人”。它的核心理念非常直白:
“为什么用很多 Token 就能做的事,要用一堆废话来说?”
它的作用不是限制 AI 的推理能力,不是让它“变笨”,而是压缩它的输出。安装这个技能后,Agent 会在回答中剔除所有客套话、过渡语、冗余解释,只保留核心的技术要点、代码片段、错误信息。
最直观的效果就是:同样的回答,输出 Token 平均减少 65%。
而且技术准确性完全不缩水——代码、命令、报错信息一字不差,只是没了那些“I recommend”、“Let me explain”之类的废话。
一句话告诉你它解决了什么
看两个对比,你就知道这项目有多实用:
正常 Agent 回答(69 Token):
The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle. When you pass an inline object as a prop, React's shallow comparison sees it as a different object every time, which triggers a re-render. I'd recommend using useMemo to memoize the object.
Caveman 模式回答(19 Token):
New object ref each render. Inline object prop = new ref = re-render. Wrap in
useMemo.
同样的技术结论,一样的修复方案,字数直接缩到三分之一。
另一个场景:
正常 Agent:
Sure! I'd be happy to help you with that. The issue you're experiencing is most likely caused by your authentication middleware not properly validating the token expiry. Let me take a look and suggest a fix.
Caveman:
Bug in auth middleware. Token expiry check use
<not<=. Fix:
看,一句话直接定位问题,连“Let me take a look”这种过渡都省了。这就是 Caveman 的核心价值——它不是让 AI 不思考,而是让 AI 的输出更直接。
基准测试:不是吹的,是实打实的数据
该项目通过了基于 Claude API 的实际测试,涵盖 10 个真实编程问题,数据如下:
| 平均 | 1214 | 294 | 65% |
平均每个回答省掉 920 个输出 Token。如果你每天都在用 AI 编程,这笔账很好算。
一行命令,支持 30+ 个 Agent
安装方式极其简单,一条命令自动检测你机器上已有的 Agent 并逐一安装:
macOS / Linux / WSL:
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
Windows PowerShell:
irm https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.ps1 | iex
需要 Node.js 版本 ≥ 18。安装脚本会自动跳过你没有的 Agent,完全安全可重复运行。
目前已兼容 Claude Code、Codex、Gemini、Cursor、Windsurf、Cline、Copilot 等 30 余个主流 Agent。
安装完成后,在对话中直接输入 /caveman 开启压缩模式。如果要关闭,说一句“normal mode”即可。Claude Code、Codex 和 Gemini 在首次运行时就会默认启用,无需手动触发。
六个等级,从“正常模式”到“文言文”
Caveman 提供了 6 种输出风格,你可以随时用 /caveman 切换:
- normal agent
:正常模式,AI 废话频出——你懂的 - lite
:轻度压缩,比如“Wrap object in useMemo. New ref created every render.” - full(默认)
:中度压缩,“New ref each render. Wrap object in useMemo.” - ultra
:极度压缩,“New ref/render. useMemo it.” - wenyan
:文言文模式,利用古汉语的高信息密度进一步压缩
有意思的是,Caveman 还保留了对多语言的支持。你用葡萄牙语提问,它就用葡萄牙语的“原始人风格”回答,只压缩语气,不翻译语言。只有 wenyan 模式是特例——因为文言文天然的 Token 效率最高。
还有更多实用指令
除了基础的 /caveman,项目还提供了几个专为开发者设计的功能指令:
/caveman-commit:帮你生成 Conventional Commit 格式的提交信息,主题行不超过 50 字,只说明“为什么修改”,不啰嗦“做了什么”。
/caveman-review:做代码审查时,输出一行式的 PR 评论,比如 L42: 🔴 bug: user null. Add guard.,一眼就能看清问题。
/caveman-stats:实时查看当前会话的 Token 节省情况、累计节省量、折合美元金额。在 Claude Code 中,状态栏会直接显示 [CAVEMAN] ⛏ 12.4k 这样的提示。
/caveman-compress:这是最有价值的长期功能——它会将你的记忆文件(比如 CLAUDE.md)压缩成 Caveman 风格。一旦压缩,每个会话启动时该文件都会节约 46% 左右的输入 Token。实测数据如下:
这不是一次性的 Token 节省,而是每个 session 都在省。
一个你可能没注意到的点
Caveman 项目明确说明了一点:它只压缩输出 Token。 输入 Token 和推理 Token 是不变的,而且技能本身每次对话会增加约 1-1.5k 的输入 Token。
所以整体 Session 的节省比纯输出节省要小。在本身就已经很简洁的工作流中,甚至可能出现“净负收益”。
项目的真正价值在于可读性和速度提升。Token 节省是 Bonus,不是目标。
另外,一个有趣的研究发现来自 2026 年 3 月的论文《Brevity Constraints Reverse Performance Hierarchies in Language Models》:在 31 个模型上的测试中,约束大型模型给出简短回答,反而让一些基准测试的准确率提升了约 26 个百分点。
有时候,说少点,反而说对了。
隐私与生态
Caveman 完全离线运行。安装后零网络调用——技能本身就是一条 Prompt,Hook 是本地脚本,统计数据读取的是你本地已有的日志。没有任何遥测、分析、账户体系。
如果你想进一步深入,项目还提供了完整的“Caveman 生态体系”——一个由五个开源仓库组成的工作流优化工具集,包括压缩 Agent 记忆、优化构建循环等组件。不过那是另一个故事了。
立刻试试
Caveman 目前是 MIT 开源协议,安装了就可以一直用。一个指令下去,你的 AI 编程助手每轮回复都能省掉一半以上的废话字节。
如果是你,你愿意把它加到你的开发环境里吗?
夜雨聆风