当所有人都在给AI疯狂堆功能的时候,有人反其道而行,把工具砍到只剩四个,system prompt压到不足1000 tokens。
结果呢?
Databricks拿自家几百万行代码库实测,同一个模型换上这层"薄壳",任务成本直降一半以上,性能持平甚至更优。
这场发生在2026年coding agent赛道的实验,给出了一个极其反直觉的结果。
主角叫Pi,一个GitHub星标超过8万的开源项目,官网写着一句极度嚣张的slogan:"There are many agent harnesses, but this one is yours."
先搞懂一个词:什么叫"harness"
你用过Claude Code、Cursor、Codex这些工具吧?
它们背后的大模型其实都差不多,使用体验上的"聪明"或"笨",往往取决于包在模型外面的那层壳,业内叫它harness(挽具)。
打个比方:模型是发动机,harness就是整辆车的底盘、仪表盘和变速箱。
同一台发动机装进不同的车里,油耗、操控、百公里加速,全都不一样。
Harness负责把你的指令和代码仓库的上下文塞进prompt,执行模型给出的工具调用,再把结果喂回去,如此循环。
它还会附带权限管理、子代理、计划模式、MCP插件市场等一大堆"开箱即用"的功能。
问题就出在这儿,每一个"开箱即用"的功能,都在悄悄烧你的钱。
Databricks的铁证:同一模型,换个壳,账单翻倍
2026年7月8日,Databricks发了一篇硬核论文,标题很朴素:《在Databricks多百万行代码库上基准测试Coding Agents》。
作者阵容豪华,包括联合创始人Matei Zaharia。

▲ Databricks博文:不用公开基准(怕数据泄漏),直接拿自家真实工程任务测
他们绕开SWE-Bench这类可能已被模型"背过"的公开基准,直接采用工程师日常处理的任务,横跨Python、Go、TypeScript、Scala等十多种语言,在Bazel/Protobuf等内部架构上实打实地测。
核心发现如下:
- 同模型同thinking effort,Claude Code/Codex与Pi对比,任务成本差异超过2倍,质量持平。
- Pi每轮大约少送3倍上下文
,工作集更紧凑,用更少轮次完成任务。 端到端成本还取决于token消耗和运行轮次,Sonnet 5单价更便宜,但因为读更多、跑更久,反而比Opus更贵且完成率更低。
用人话翻译:你以为在选模型,其实在选壳。
壳的"隐形税"可能比模型差价还大

▲ 第三方排行站HarnessRank:Pi以约76%通过率、$0.35/任务成本登顶
独立排行站HarnessRank随后在"固定模型、固定基准、只换harness"的条件下给出了更直观的画面:Pi约76%通过率,uncached tokens约35K,单任务成本约$0.35,排在它后面的几个重型选手,token消耗和成本都显著更高。
"少"凭什么能赢?一个反常识的工程哲学
Pi的创造者Mario Zechner是个有趣的人。
他曾是Claude Code的长期用户,但越用越觉得,"它像一艘太空船,80%的功能我永远用不到,剩下20%的功能还在不断改版打断我的工作流。"

▲ Mario的个人博客手记:标题直译就是"我从构建一个固执己见的极简coding agent中学到了什么"
于是他拆出了Pi,设计哲学极端到令人发指:
- 默认只有4个工具
:read、write、edit、bash。没了。 - System prompt与工具定义合计低于约1000 tokens
,同期Claude Code的system prompt可以膨胀到万级tokens。 - 不内置MCP、不内置子代理、不内置权限弹窗、不内置计划模式、不内置todo、不内置后台bash。
他在博客里写了一个标题叫"What we didn't build"(我们没做什么),把这份"不做清单"当成产品宣言。
Pi用扩展系统补足能力,你需要什么功能,用pi install装上就好,或者直接让Pi自己写一个扩展再/reload。
复杂度只在赚回成本时才被引入


▲ 官方展示扩展SDK:用TypeScript注册自定义工具,订阅生命周期事件
社区里Thomas Schranz用三行字概括了Pi的核心竞争力:fewer tools, smaller system prompt, less context spam,更少工具、更短提示词、更少上下文垃圾。

▲ "Less is more",这条引用转发概括了Pi的极简设计
Shopify的魔法时刻:极简如何长出"过夜研究循环"
如果Databricks的故事是"省钱",那Shopify的故事就是"省钱的同时还能整大活"。
Shopify工程师David Cortés有一个痛点:CI流水线因为视觉回归测试反复失败,每次等待约半小时。
他受到Karpathy Autoresearch理念的启发,让agent在可度量指标上无限循环试错。
他打开Pi,敲了一句:"Pi, create an extension for Autoresearch…"

▲ Shopify Engineering博文:David与CEO Tobi Lütke联手把Autoresearch从个人实验推成公司级武器
Pi读了自己的扩展文档后,在大约半小时内搭出了一个完整的自治优化循环:设定指标 → 测baseline → 每轮提出假设并实验 → 快了就保留、崩了就丢弃 → 永不停止。
结果?
Polaris构建从约19.1秒起步,提速约65%。
Shopify CEO Tobi Lütke亲自在上面改了32个commit,把Liquid模板引擎跑出解析+渲染快约53%、对象分配少约61%的结果,然后推动开源为pi-autoresearch。

▲ 开源仓库已获7300+星标:pi install npm:pi-autoresearch一行命令即装
公司内部#autoresearch-wins频道接连出现成果:单元测试快约300倍、React组件挂载快约20%、pnpm构建提速……那些"没人愿意排进sprint的苦力优化",被扔给agent跑了一整夜。
三十分钟长出专用工作流,展现了"极简即优势"最锋利的一面。
争议从未停止
当然,也有人不买账
开发者Alec Zakhary在主帖下丢出一句冷箭:"多数agent框架先帮你省一周,然后收一整年的利息。
抽象一多,每一层都是排查故障时的新坑。
我宁愿要一个五分钟读完的小循环"

▲ "框架先帮你省一周,然后收一年利息",这句话被大量转发
中文社区也有冷静声音:把Pi当作"开箱即更聪明的Claude Code"一定会失望。
它的官方定位就是minimal terminal coding harness,能力要靠extension/skill自己补。
插件堆太多还会拖慢路由、扩大信任面,极简的代价是你必须自己提供结构。
还有一个让安全从业者皱眉的事实:Pi默认不弹权限确认,YOLO模式全开。
Mario认为权限弹窗多数只是安全剧场,生产隔离应交给容器和断网环境。
他选择把风险直接写进文档,拒绝为虚假安全感增加负担。
这个判断仍有争议
但至少,它在工程上是诚实的
一场正在发生的范式翻转


▲ Pi官方主帖:以Databricks与Shopify案例解释极简设计的成本与性能优势
把视野拉远,Pi的故事其实是行业变革的一个切片:当模型能力趋近,包住模型的那层"壳"开始主导你的账单、你的可控性、乃至你的工程文化。
过去三年,开发者的进化路径是:ChatGPT复制粘贴 → IDE补全 → Cursor编辑器 → 终端coding agent。
一旦进入agent阶段,"常驻上下文税"就变成了一阶成本。
每个子代理复制一份大工具表,每个MCP把极少使用的schema每轮塞进窗口,每次计划模式插入隐藏指令,演示时像"更智能",账单上像"固定月租"。
Pi的回答是:把税率降到接近零,再允许你按需加回来。
Databricks的结论提醒人们:某一harness无法保证永远更便宜,模型选择也只是拼图的一块。
他们为此投资了Omnigent元系统,在模型和harness之间自由切换。
行业的关注点已经落到可替换的壳与路由上。
而Pi,这个四件工具、不足千token的极简造物,恰好站在了这个转折的风口上。
有人在Hacker News上的总结可能是最好的注脚:
2026年的护城河将落在harness。优秀的harness会用尽可能少的工具满足模型。
夜雨聆风