ARTICLE · 1122050
这个AI编程工具只有4个功能,却跑分碾压Claude Code和Codex——Pi 1.0到底做对了什么
昨天,一个AI编程工具登顶Hacker News第一,1200+点赞。
它叫Pi,10月1日发布1.0正式版。
如果你第一次听说这个名字,很正常——它没有Cursor的花哨界面,没有Claude Code的Anthropic光环,没有Copilot的微软背书。它的界面就是个终端窗口,黑底白字,朴素得像个上世纪90年代的产物。
但它做到了一件所有竞品都没做到的事:用4个基础工具,在Composio基准测试中跑赢了Claude Code和Codex。
| Pi | 20/30 |
同样的模型(DeepSeek V4 Flash),同样的任务集,同样的MCP工具。功能最少的,赢了。
这反直觉吗?我觉得是。但读完Pi 1.0的全部资料后,我觉得这不是反直觉,是我们被功能列表洗脑太久了。

一个"系统提示词税"的故事
先说一个大多数人忽略的数字。
当你打开Cursor、Claude Code或Codex开始写代码之前,AI模型要先"读完"一大坨系统指令——告诉它怎么用工具、怎么遵守规则、怎么调用几百个功能。
这个"开课前必读材料"有多长?
- Codex CLI
:约25,450个Token - Claude Code
:约12,000-15,000个Token(估算) - Pi
:约600个Token
差了40倍。
这不是一个无关紧要的差异。每一个塞进上下文窗口的Token,都在跟你的实际代码抢空间。模型每回复一次,这些Token都会被重新处理一遍。对于本地模型或大项目来说,这就是真金白银的API费用和等待时间。
Pi的作者Mario Zechner(对,libGDX的那个Mario)把这叫做"系统提示词税"。他的逻辑很简单:功能越多,提示词越长,模型越容易被淹没在指令里,反而忘了你的代码在说什么。
所以在Pi的世界里,AI只有4个工具:
read:读文件 write:写文件 edit:改文件 bash:跑命令
没了。没有子Agent,没有计划模式,没有任务清单,没有权限弹窗。
你可能会想:就这?
对,就这。然后它跑分第一了。

那个说"死也不接MCP"的人,改主意了
Pi 1.0最大的戏剧性在于:它接了MCP。
如果你关注AI编程工具圈,应该记得Mario去年专门写过一篇文章叫《你可能根本不需要MCP》。他的论点是:MCP的工具描述每加一个就要吃掉550-1400个Token的上下文,接10个MCP服务器,光工具说明就能吃掉你一半上下文窗口。他举了Perplexity的例子——3个MCP服务器干掉了143K/200K的上下文。
所以Pi整整一年没接MCP。社区里有人骂他固执,有人说Pi要被时代淘汰了。
然后1.0版本,MCP来了。
但等等——这不是"打脸"。准确说,是换了一种姿势接MCP。
Pi 1.0的新功能叫Codemode。它的核心思路是:不再把MCP工具的描述一股脑塞给AI模型,而是给AI一个JavaScript沙箱。AI在沙箱里写代码来调用工具,像用SDK一样组合工具调用,在JavaScript层过滤结果,只有最终的精简结果才进入模型的上下文。
举个例子:Pi连接了Linear的MCP服务器和一个情感分类器,要分析167个GitHub Issue里哪些用户最沮丧。传统做法是167个Issue的工具返回全塞进上下文。Codemode的做法是:AI写一段JS代码并行处理167个Issue,分类器过滤出目标用户,最终只把"这5个人最沮丧,原因是XXX"这样一行结论返回给模型。
上下文消耗从几万Token变成了几百个。
MCP还是那个MCP,但接口从"给你40个工具说明书"变成了"给你一个可编程环境"。
这个架构转变,可能是今年AI编程工具领域最重要的技术决策之一。其他工具迟早会跟进。

虚拟模型:让Claude规划、GPT干活、Jev当裁判
Pi 1.0还有一个让我眼前一亮的新功能:虚拟模型。
简单说,你可以把多个AI模型组合成一个"虚拟模型"来用。Pi官方演示了一个案例:
- Claude Opus
负责工作规划(它逻辑最强) - Jev
(一个分类模型)判断当前是规划阶段还是实施阶段 当Jev判断进入实施阶段,自动切换给GPT 6 Luna执行代码编写
这意味着什么?你不再被"选哪个模型"这个问题困住。不同模型有不同强项——Claude擅长理解复杂逻辑,GPT擅长快速生成代码,Gemini擅长长上下文。虚拟模型让你在一次对话中把每个阶段交给最擅长的模型。
更妙的是,这个虚拟模型机制本身就是Pi的一个扩展——Pi自己给自己写了这个功能。你在Pi里说一句"帮我建一个虚拟模型路由",它就自己写好了。
在HN的评论区,有人把这种做法类比为"AI团队管理":你不需要一个全能的超级员工,你需要的是一个知道什么时候找谁干活的包工头。

踩坑时刻:极简不等于"开箱即用"
说了这么多好的,该泼点冷水了。
Pi的极简主义是有代价的。
第一,没有开箱即用的权限管控。默认情况下,Pi不会弹窗问"你确定要删除这个文件吗?"。在你的个人电脑上这很爽——AI说了算,效率高。但在公司环境里?你的安全团队会把你当安全漏洞处理。Pi的官方建议是"用容器隔离"或者"自己写扩展加权限门"。
翻译一下:企业用户请自备干粮。
第二,学习曲线。Pi是一个纯终端工具。没有GUI,没有拖拽,没有可视化diff。你得习惯在命令行里工作,得知道什么是tmux,得理解上下文窗口的运作方式。对于从Cursor或Copilot转过来的用户,第一天的体验大概是"我到底在用什么"。
第三,生态成熟度。Cursor有庞大的插件市场,Copilot有整个GitHub生态。Pi的"扩展"需要你自己写TypeScript代码。虽然官方提供了50多个示例扩展,但距离"开箱即用"还差得远。
我的判断:Pi目前最适合两类人——(1)已经在终端里如鱼得水的老程序员,(2)想把AI Agent嵌入自己产品的开发者。如果你是"打开就能用"的需求,Cursor和Copilot仍然是更稳的选择。

Pi Durable:一个可能被低估的"sleeper release"
同一天,Pi还发布了另一个东西:Pi Durable。
媒体几乎没报道它,但它可能是Pi 1.0里最有长远价值的部分。
Pi Durable是一个用来构建长时间运行Agent的框架。核心能力就一个:崩溃恢复。
传统的AI Agent对话,进程一挂,所有状态全丢。Pi Durable的每一步操作都会自动存检查点。进程挂了?新进程从最后一个检查点继续。工具调用中断了?标记为"安全可重试"的工具自动重跑,不安全的(比如部署、支付)直接告诉AI"这步被中断了"。
整套代码只有15,000行TypeScript,支持内存、SQLite、JSONL三种存储后端,甚至能跑在Cloudflare Durable Objects上。
想想现在的AI Agent痛点:demo很炫,生产环境一碰就碎。Pi Durable解决的就是这个"demo到生产"的鸿沟。
虽然还是实验性质,API可能还会变,但方向是对的。
结论:你应该装Pi吗?
先说结论,再解释:
- 如果你日常用Cursor或Claude Code写得舒服
:不用换。Pi不会让你在现有工作流上获得显著提升 - 如果你在折腾本地模型
:强烈推荐试试。600Token的系统提示词对本地模型来说是巨大的性能优势,尤其在大模型(Dense架构)上,Pi比Codex快2倍以上 - 如果你在开发自己的AI Agent产品
:Pi的SDK/RPC模式值得深入研究。OpenClaw就是用Pi的SDK构建的 - 如果你是架构控、喜欢搞懂底层原理
:Pi可能是目前最值得精读的Agent开源项目
我的立场:Pi不会取代Cursor或Claude Code成为主流开发工具。但它做了一件更重要的事——它证明了"做减法"在AI工具领域不是一句口号,而是可以量化的工程优势。当所有人都在往工具里塞功能的时候,Pi用4个工具跑出了最好的成绩。
这不是极简主义的胜利。这是对"功能越多=越好"这个假设的一记响亮耳光。
安装一行命令:
curl -fsSL https://pi.dev/install.sh | shMIT开源,完全免费。
说句真心话:2026年的AI编程工具赛道,不缺功能堆砌的新品,缺的是敢于说"不"的产品。Pi就是那个说"不"的家伙。你可以不用它,但你应该知道它的存在。
💬 你觉得AI编程工具应该"功能越多越好"还是"越精简越好"?评论区聊聊你的选择。