乐于分享
好东西不私藏

每个人都可以用Pi Agent搭建自己的OpenClaw

每个人都可以用Pi Agent搭建自己的OpenClaw

事情要从之前Claude给中国打标签开始。

俗话说得好,当你发现房间里有一只蟑螂的时候,实际上可能存在很多蟑螂。当Claude给你打标签的时候,你不能确定它是不是还会上传你的数据,或者记录你的信息,作恶不会只有一次。

所以我开始试用其他的Agent,比如Qoder、Zcoder、Opencode、Workbuddy等等。

直到我在X上看到了Pi Agent的推荐。

吸引我的还有作者Mario Zechner的一句话:

“I hate every coding agent, so I built my own.”

「我讨厌每一个AI编程助手,所以我自己写了一个。」

Mario Zechner,是libGDX,全世界最知名的开源游戏引擎框架之一的创建者。一个写了十几年基础软件的人,被AI编程工具惹毛了,决定不跟任何人商量,自己从头写一个。开源迄今,Pi Agent获得了4万多的Star。

说实话我一开始是半信半疑的。GitHub上Star多的项目多了去了,不一定是真的好用,可能是营销好,可能是时机对,可能是作者本身有名气。

但我尝试下载并用了两周,发现这个项目,有点不一样。

一个连权限弹窗都没有的Agent

你在用Claude Code或者Cursor的时候,有没有一种感觉,这些工具很强大但也很复杂。它们预设了太多东西:你应该怎么管理任务、你应该用什么计划模式、你应该在什么情况下用什么工具、你的权限应该怎么配置……好像Agent比你更懂你应该怎么工作。

这种「保姆式」设计的问题在于:它预设了一个「标准用户」,而你可能不是那个标准用户。

Mario Zechner就是受够了这一点。

所以他设计的Pi Agent,核心哲学只有六个字:极致极简,无限扩展

有多极简?

Pi Agent默认只提供四个工具:read(读文件)、write(写文件)、edit(精确编辑)、bash(执行命令)。

它的系统提示词,不到1000个token。这是什么概念?Claude Code的系统提示词可能有几万个token,塞满了各种行为准则、角色设定、安全规则。而Pi Agent的系统提示词短到几乎可以忽略不计,它基本上就是告诉模型:「你是Pi,你能用这四个工具,你去干活吧。」

没有MCP,没有子代理,没有计划模式,没有待办清单。

连权限弹窗都没有。

我第一次用的时候甚至有点不适应,我输入了一个命令,它就直接执行了。没有「Are you sure?」,没有「这个操作可能修改文件,你确认吗?」。什么都没问。

这种感觉怎么说呢……像是你本来住在一个到处是护栏和警示牌的游乐园,突然被丢进了一片荒地。没有人告诉你该往哪走,也没有人拦着你往哪走。

自由,但自由得让人有点心慌。

「什么都没有」背后的逻辑

在用了两周之后,我开始理解Mario Zechner的用心了。

市面上大多数AI编程助手的设计思路是这样的:产品经理和研究团队坐在会议室里,预设好「典型用户」的「典型需求」,然后把所有可能用到的功能全部塞进去,再层层加安全护栏。

最终交付给你的,是一个功能齐全、但行为已经被高度预设好的工具。它很好,但它是「他们觉得你应该用的那个样子」。

而Pi Agent的思路截然相反:我什么都不预设。你需要什么,你自己加。

它有两层扩展机制。

第一层叫Extensions,用TypeScript写。你可以自定义工具、自定义命令、自定义UI组件。而且因为Pi Agent的事件系统是开放的,每次消息开始、消息结束、工具执行前后、一个回合开始和结束,你都可以插入自己的逻辑。你可以在工具执行之前检查一下命令是否危险,是的话直接拦截。你可以在Agent输出完成之后自动触发一个你写好的后续流程。

本质上,你不是在「配置」Pi Agent,而是在「编辑」它。

第二层叫Skills,用Markdown写。你创建一个Markdown文件,描述清楚这个技能要干什么、怎么触发、什么步骤。Agent读了这个文件就知道怎么做了。零代码。

更有意思的是,这些Extensions和Skills可以打包成npm包发布。pi install npm:@某人/某工具包,一键安装。

我回想这个设计的时候,脑子里冒出来的第一个念头是:这不会就是一个操作系统内核吧,官方只提供最核心的引擎,所有的应用都交给第三方去做。

你想让Agent帮你读邮件?有人已经写好了一个Extension。你想让Agent帮你管理Notion笔记?也许也有。你想让Agent在你睡觉的时候自动跑回归测试?写一个定时触发的Extension也不难。

这个意义上来说,Claude Code是一个产品,Pi是一个平台,或者说,一个潜在的平台。

这让我想起维基百科和传统百科全书的区别。大英百科全书耗费数百年、雇佣数千名专家,才编出了几十万词条。维基百科只提供了一个编辑机制,让全世界的人自己来写,十年就超过了它。

产品是编纂好的百科全书,平台是那套谁都能来写的编辑机制。

平台思维,藏在一个细节里

说一个我使用过程中非常喜欢的功能,你能从里面看出Pi Aent的思路是怎么落到细节上的。

Pi Agent的对话历史不是一条直线,它是一个树。

什么意思呢?你每次跟Agent对话,每一条消息就像一个节点。当你回退到某个历史节点,说一句「不对,换一种方案试试」,原来的对话分支还在,新的分支从这里生长出去。

用/tree命令可以可视化地看到整棵对话树。

这个设计解决了一个非技术开发者(比如我)长期以来很头疼的场景。

比如你在开发一个新功能,Agent帮你写了方案A。写完了之后你发现不太对,想退回去试试方案B。在大多数工具里,你只能手动删掉方案A的代码,然后重新描述需求;或者直接让Agent动手改,它会覆盖掉之前的分支。对话历史也变成了一团乱麻,前面的决策依据和后面的修改混在一起,你分不清哪个版本是基于哪个前提的。特别是,非技术开发者的你,也看不懂它的思考过程。

在Pi Agent里,你可以直接回到分叉点,切一个新分支,方案B开始重新生长。方案A的代码和对话还完整地保留着。你甚至可以A、B两个方案同时进行,最后比较哪一个更好。

这非常契合我自己交叉比较的工作方法,对话和思考过程都可以保留和分析

一个产品的设计者,会想「用户在这里需要一个确认弹窗」;一个平台的设计者,会想「我得让用户自己决定怎么用」。Mario Zechner属于后者。这个设计不需要什么技术上的惊天创新,但它需要对「开发者到底怎么思考问题」有极深的理解。

用着用着,几个意料之外的好处

用了一周,有几个体验在我意料之外。

第一,模型变聪明了。

这是最反直觉的一点。同一个模型在Pi Agent里的表现,居然比在Claude Code里更好。

有一个公开的基准测试Terminal-Bench 2.0能够佐证这一点。Pi Agent + Claude Opus 4.5的成绩,超过了Claude Code + 同一个模型。

我搜索和研究的结论是:系统提示词越少,模型的「注意力」就越多可以用在理解你的问题和你的代码上。你给模型塞一本员工手册,它就得花一部分脑力去遵守这本手册。你把手册扔掉,它所有脑力都用来帮你解决问题。

换句话说,很多Agent的臃肿设计,不是在增强模型,而是在削弱模型。模型本身其实已经非常平衡,增加的提示词不一定起到了Harness(缰绳)的作用,反而有可能是在增加噪音。所以,充分发挥模型的能力,有时候比规训更重要。当然,这是对像我这样的普通用户而言。

第二,启动快到离谱,上下文消耗很慢。

Pi Agent装完之后,是一个不到100MB的npm全局包。在终端里敲pi,几乎是瞬间就进去了。没有加载画面,没有初始化进度条,没有「正在连接服务器」。就像打开系统应用一样快。因为系统提示词足够短,加上它支持自动压缩旧对话(把早期对话总结成摘要,释放token空间),同样的模型在Pi Agent里能支撑的对话轮次显著更多。我尝试在一个会话里连续工作一两个小时,累计几百轮交互,Agent还能准确记住我半小时前说过的一个细节。

这些都不是我一开始冲着它去的理由。但用着用着你会发现,一个东西因为「少」而带来的好处,可能会比「多」带来的好处持久。

真正的分野:你要长期,还是短期

说了这么多好处,也要说说坏处。Pi Agent不是没有代价的。

它装好之后,就是一个空空荡荡的终端窗口。没有向导,没有提示,没有推荐配置。你得自己去研究扩展怎么装、Skills怎么配、API Key怎么设。它默认没有图形界面(Github上可以搜到Web UI包,但需要你自己部署)。对于习惯了「打开就能用」的人,这一步可能会劝退不少人。

换句话说,Pi Agent在向你索要一笔前期投入,你得花时间理解它、配置它,甚至编程改造它,它才会真正顺手。

而Claude Code呢?装好就能用。打开就有功能,点一下就有权限提示,什么都不用学。它的前期投入几乎是零。

但这也是真正的分野所在。

Claude Code卖给你的是短期投入的轻松,Pi Agent卖给你的是长期收益的可能。

你选Claude Code,意味着你接受别人替你定义好的产品边界,它好用,但它会长成Anthropic的产品经理希望它长成的样子,不会长成你希望它长成的样子。你省下了今天的一个小时,却可能在未来每一次「它做不到我想做的事」时反复妥协。

你选Pi Agent,意味着你愿意先付一笔学费。换来的是,这个工具的每一个角落都向你敞开。你想要一个代码审查专家,就只给它审查相关的提示词和工具;你想要一个自动化运维助手,就给它接上服务器管理相关的权限和脚本;你想要一个个人写作编辑,就给它配置好文章审校的流程和标准。你今天写下的那个Extension,三年后还在为你工作。

短期看,产品永远比平台讨喜,开箱即用,所见即所得。

长期看,平台永远比产品值钱,因为它会跟着你一起复利增长。

这就像租房和买房。租房,今天就能拎包入住,但房子永远是别人的,租金永远在涨。买房,要凑首付、要还贷款、要自己装修,累得半死,但十年后这房子是你的,而且它会一点点长成你想要的样子。

OpenClaw就是最好的证明

如果你觉得「在Pi Agent上搭一个产品」这件事听起来太远,那我给你看一个现成的例子,OpenClaw。

OpenClaw不是一个Agent内核,它是一个完整的、风靡全球的产品。但它不是从零写的。它就是一群人,在Pi Agent这个平台引擎的基础上,包了一层完整的界面、多平台支持(Telegram、Discord、Web都能用)和一个配置向导,做出来的。

装完跑一个初始化脚本,五分钟就能用。

如果你只想要一个开箱即用的体验,OpenClaw是比Pi Agent本身更好的入口。

但我想说的是另一层:

OpenClaw证明了一件事,Pi Agent真的可以作为一个平台,被人拿来造产品。

Mario Zechner造了引擎,OpenClaw的团队造了整车。而这件事最美妙的地方在于,OpenClaw只是无数种可能里的一种。

你完全可以用同样的方式,造一个属于你自己的「OpenClaw」。

不一定要造给别人用。也许你就是想要一个专门帮你审稿的Agent,一个只懂你那套分析逻辑的Agent,一个能接上你公司内部系统的Agent。在Pi这个平台上,这些都只是「编辑」和「扩展」的事,而不是「重新发明轮子」的事。

你不需要成为Mario Zechner那样的人,才能搭建你自己的OpenClaw。

你需要的,只是长期地去研究和扩展Pi,并愿意为长期收益,先付一笔短期的学费。

我正在考虑支付这笔学费,你呢?

还有许多问题

说到底,这两周用下来,Pi Agent让我最兴奋的不是它现在是什么,而是它潜藏的那个未来。

一个工具不再由少数公司在产品会议室里定义、而是由每个使用者自己动手搭建的未来;一个极简内核加上开放生态、让创新从底层涌现的未来。

比如,每个公司、每个团队是不是都能用Pi Agent来搭建自己的Agent平台?Pi Agent的自定义特性和开源特性,特别符合中国公司什么都要自己干的特性。

比如,如果我持续用Pi Agent,那么,我最想长期获取收益,并且可以坚持的方向是什么?是不是也能拥有我自己的Agent产品?

比如,是不是从现在开始使用Pi Agent来搭建,能更好地保护自己的数据和信息,能从长期累积中获取Context的收益?

……

我想到了很多问题,但我现在没有答案,包括Pi Agent是不是就是最适合的那一个,现在也不好说。我会继续探索和更新我的思考和答案,欢迎关注我的后续更新。

不管怎么样,感谢Mario Zechner用一句「我讨厌每一个Coding Agent」开始了这一切。这件事最美妙的地方在于,

他不仅自己造了一个,还把引擎开源了出来,让每个想自己造的人,都不需要从头开始。

这可能,才是开源精神最好的样子。

也是为什么我说,每个人都可以用Pi Agent,搭建自己的OpenClaw。