现在的 AI 编程助手越来越强,Claude Code、Codex、Cursor、Copilot 等工具已经能阅读整个项目、修改多个文件、自动调试、执行命令,还能顺手写测试。
但问题也很明显:AI 太喜欢解释了。比如让它修一个 React 性能问题,它先给你铺垫一大段背景。
如果 Token 免费也就无所谓了,但现在的 Token 越来越贵,钱包没点实力还真不够随便烧。海外模型不便宜,国内最新的 Kimi3、GLM5.3、Qwen3.8 如果不买套餐直接跑 API,也是不敢让它跑一整天。
普通 AI 会输出:
The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle. When you pass an inline object as a prop, React's shallow comparison sees it as a different object every time, which triggers a re-render. I'd recommend using useMemo to memoize the object.
上面这段是 69 个 token。
但你真正需要的信息量,其实只有 19 个 token:
New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.
同一个答案,同一个解法,少了 73% 的字。
现在 AI 的表达习惯是能铺垫就铺垫,能解释背景就解释背景,就是不肯直接给答案。一问一答场景里还行,但多轮循环、来回几十轮的任务里,这些废话叠加起来,就是真金白银的 Token 消耗。

今天就介绍一个让 AI 少说废话的 开源项目——caveman。
caveman 是一个给 Claude Code 用的 skill,同时兼容 Codex、Gemini、Cursor、Windsurf、Cline、Copilot 等 30+ 工具。它的目标很直接:用更少的 Token 完成同样的工作。
caveman 只影响输出 token,不影响推理质量。
caveman 让 AI 说得更短,但 AI 的思考过程(thinking tokens)不受影响。
效果因任务类型而异:
- 解释类任务(87%)、实现类任务(84%)效果最明显。
- 架构讨论(30%)、代码重构(22%)效果相对小,因为这类任务里实质性内容本来就多、废话比例低。

90k+ Star 证明了使用的人很多:

开源地址: https://github.com/JuliusBrussee/caveman
安装
一条命令,自动检测你装了哪些 AI 工具,全部配好。基础环境要求 Node.js 18+。
macOS / Linux / WSL:
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
Windows(PowerShell 5.1+):
irm https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.ps1 | iex
装好之后,在对话里输入 /caveman,或者说 "talk like caveman" 就激活了。
Claude Code 和 Codex 通过 hook 机制每次会话自动激活,不需要手动触发。Gemini CLI 同样内置了自动激活。
Cursor、Windsurf、Cline、Copilot 这类工具装好后会写入始终生效的规则文件,也不需要每次输入命令。
其他工具需要在会话开始时手动输入 /caveman。
具体每个工具的激活方式,在仓库的 INSTALL.md 里有完整说明。
安装完成后,所有你用的 Agent 会同时配置好。代码、命令、报错原样保留,砍掉的只是“我来看看”“很可能是因为”“我建议你”这类填充语言。
看下效果。以下是用 Claude API 真实跑出来的 token 数据,10 个常见任务:

平均节省 65%,最高的任务节省 87%。节省最多的,往往是那些 AI 最容易过度解释的任务,比如“解释 X 原理”“实现 Y 组件”。AI 在这类任务上会大量铺垫背景,而 caveman 模式把这些全部砍掉,只留下操作步骤。
强度可以切换
/caveman lite # 轻量:去掉客套话,保留完整解释
/caveman full # 默认:标准原始人模式,片段式表达
/caveman ultra # 极端:电报风格,只说最关键的
/caveman wenyan # 文言文模式:古汉语,token 更短
用 /caveman 查当前是哪个级别,用 normal mode 或者 /caveman off 切回正常模式。
几个额外好用的命令
/caveman-commit
生成规范的 Conventional Commit 提交信息。主题行不超过 50 字符,只说“为什么”,不说“做了什么”。
/caveman-review
PR 代码审查,每条评论一行。格式是 L42: 🔴 bug: user null. Add guard.——行号、严重程度、问题、修法,全在一行里。
/caveman-compress <file>
把你的 CLAUDE.md、项目笔记这类记忆文件用 caveman 风格压缩。代码和路径完全保留,只压缩自然语言描述。
真实数据显示平均节省 46% 的 token,而且每次会话开始时都会节省,一次压缩长期受益。
/caveman-stats
显示当前会话节省了多少 token,以及折合多少钱。
Claude Code 状态栏会显示 [CAVEMAN] ⛏ 12.4k 这样的计数器实时更新。
为什么简短不等于不准确
一个有意思的研究结果:2026 年 3 月发表的论文《Brevity Constraints Reverse Performance Hierarchies in Language Models》发现,给大模型加上简洁约束,在特定基准测试上准确率反而提升了 26 个百分点。
caveman 自己的评测也显示:技术准确率 100% 没有下降,速度提升约 3 倍——因为输出 token 少了,生成自然更快。
AI 回答里的那些 “I'd be happy to help”“The reason you're experiencing this is likely because”“需要注意的是”“这是一个关键点”“特别强调”“这里非常重要”,不只是浪费 token,有时候反而是精准表达的噪音。砍掉它们,剩下的是更干净的信息,还能少烧点 Token、省点钱。
如果你也在折腾 AI 编程提效工具,欢迎到 云栈社区 分享你的实测数据。