乐于分享
好东西不私藏

把聊天框变成 AI 助手:OpenClaw 到底是什么,为什么极客都在聊

把聊天框变成 AI 助手:OpenClaw 到底是什么,为什么极客都在聊

你手机里躺着七八个聊天软件,也躺着三四个 AI 应用。前者装着你的人际关系,后者装着你的生产力,两边老死不相往来。有个开源项目想干件很轴的事:在你自己的机器上开一座桥,让你在原来的聊天框里,直接把活派出去。它叫 OpenClaw。

一图速览

  • 一句话定义:OpenClaw 是自托管的 AI Agent 网关(Gateway),把聊天软件连到 AI 编码智能体
  • 自托管:网关跑在你自己的机器或服务器上,你是房东,不是租客
  • 多信道:官方文档列出 Discord、Slack、Telegram、Signal、WhatsApp、Microsoft Teams、iMessage、Matrix、Google Chat、Zalo 等
  • 不只是聊天:带工具、Skills、Cron、Webhooks,能收发图片音频文档,能真去"做事"
  • 组织形态:OpenClaw 基金会以非营利方式运作,MIT 许可,社区驱动
  • 生态很热:据公开资料,微软、Red Hat、腾讯、Atlassian 等 30+ 组织参与共建
  • 上手成本:Node 环境加一个 API Key,官方口径约 5 分钟
  • 下篇预告:三条命令装完整套,实测踩坑记录

一、先说人话:OpenClaw 到底是个什么东西

如果你只想记一句话,记这句:OpenClaw 是一个你自己跑起来的"总机",它坐在聊天软件和 AI 智能体中间,负责传话和干活。

拆开看有三个关键词。

第一个是网关(Gateway)。它不是一个 App,不是一个网页,而是一个常驻进程。你把它启动起来之后,它就在后台待命,一头连着你的各种聊天软件,一头连着 AI 智能体。所有消息进来出去,都从它这里过。这个角色特别像老式单位里的总机话务员:外线打进来,它判断该转到哪个分机;分机要往外打,它帮你接出去。

第二个是自托管(self-hosted)。这是 OpenClaw 最有辨识度的一点。你不是去某个网站注册账号、把数据交给别人保管,而是在自己的笔记本、自己的家庭服务器、或者自己租的一台云主机上,把这个网关跑起来。官方文档里给出的控制面板地址默认是 http://127.0.0.1:18789/——注意开头那个 127.0.0.1,它是本机回环地址,意思是这套东西默认只对你自己开放。

第三个是AI Agent(智能体)。注意这里说的不是"大模型",而是"智能体"。大模型负责思考和生成,智能体则是在模型外面套了一层执行壳:它能调用工具、能读写文件、能跑定时任务、能接收 Webhook 回调。OpenClaw 官方定位里连接的是"AI 编码智能体",也就是那类真能动手操作的助手,而不是只会回你两句漂亮话的对话框。

一个更接地气的类比

把你家想象成一栋房子。以前你要用 AI,得跑到街对面那家便利店(大厂云端助手),把要处理的东西拎过去,办完再拎回来。东西路上会不会被看、被记、被拿去做别的用途,你说了不算。

OpenClaw 的做法是:在你家客厅装一部内线电话总机。你在微信、Telegram、Slack 任何一个熟悉的窗口里说一句话,总机接到,转给住在你家的那个"AI 管家"去执行。数据路径的起点和终点都在你的地盘里,中间要不要出门、出到哪、出多少,是你配置出来的,不是默认就送出去的。

这就是"自托管"三个字最实在的价值:不是它比云端更快更强,而是边界在你手上。

二、它凭什么不是"又一个聊天机器人"

过去三年,"聊天机器人"这四个字基本被玩坏了。绝大多数所谓的机器人,本质是把你的话转发给模型,再把模型的回答转发回来——一个搬运工,两头不沾手。

OpenClaw 拉开差距的地方,在于它把"执行能力"做成了一等公民。

差别在于"它能不能动手"

官方文档里列出的能力清单,大致可以归为四类:

能力类别 具体表现 意味着什么
多模态收发 收发图片、音频、文档 你可以直接甩一张截图过去说"照这个改"
工具与技能 工具调用、Skills 技能体系 它能操作外部系统,而不只是描述怎么操作
定时与触发 Cron 定时任务、Webhooks 不用你开口,它也能到点自己干活
多端协同 移动节点配对 iOS/Android,用到 Canvas、相机、语音 手机不只是遥控器,还能当输入设备

看懂第三行没有?Cron 和 Webhooks 的存在,把这套系统从"被动应答"改成了"主动执行"。 一个每天早上八点自动跑一遍的任务,一个代码仓库有提交就触发的回调,这些都不需要你在聊天框里敲字。你只是在配置一个员工的排班表。

"真能干活"到底能干到什么程度

这里我必须先划一条线:具体你的 Agent 能干什么,取决于你给它接了什么工具、配了什么权限,而不是 OpenClaw 本身内置了多少功能。网关只负责把路铺好,路上跑什么车是你决定的。

所以正确的理解方式是:OpenClaw 提供的是能力底座——会话管理、上下文管理、记忆、多 Agent 路由、模型配置与故障切换(failover)、本地模型服务。你在这个底座上,通过 Skills 和工具,去定义你的助手到底会做什么。

这也是为什么它在开发者群体里传得快:对一个会写脚本的人来说,这套东西给的不是"一个成品",而是"一个可以无限装配的骨架"。

三、自托管 vs 大厂助手:差在哪,各适合谁

这是最容易吵起来的话题,我尽量客观摆事实。

维度 自托管网关(OpenClaw 路线) 大厂云端助手
数据落点 在你自己的机器/服务器 在服务商侧
起步门槛 需要装环境、配 Key、懂点命令行 下载即用
定制自由度 高,插件、Skills、路由都能改 受产品形态限制
维护成本 你自己负责升级、备份、排障 服务商负责
断网/离线 可搭配本地模型服务 通常强依赖网络
成本结构 机器成本 + 模型 API 成本 订阅费
适合谁 想要控制权的开发者、团队 想要省事的普通用户

我的判断是:这两条路不是替代关系,是分层关系。

大厂助手解决的是"最大公约数需求"——写文案、查资料、翻译、总结。这些需求高频、标准、不涉及敏感边界,交出去很划算。

自托管解决的是"个性化 + 边界敏感"的那一层——你的代码仓库、你的私有文档、你团队内部的流程。这类需求的共性是:做得好不好,取决于它对你具体环境的了解程度;而让它了解,就要把东西给它看。 这时候网关跑在哪里,就不是技术偏好问题,而是决策前提问题。

别神化"自托管"三个字

必须泼盆冷水:自托管不等于绝对安全。你把网关跑在自己机器上,只是把"信任服务商"换成了"信任自己的运维水平"。端口有没有暴露到公网、密钥存在哪、装的插件干净不干净、谁能通过聊天软件给你的 Agent 发指令——每一条都是新的责任。

OpenClaw 官方文档在安全侧提供了几样工具:访问组(access groups)、信道 QA、独立身份与会话隔离、可审计的架构。 这些是给你用的护栏,不是自动生效的保险。护栏摆在那儿,你不装,等于没有。

四、它能接哪些聊天软件,以及一个必须说清的事

官方文档给出的渠道清单包括:Discord、Google Chat、iMessage、Matrix、Microsoft Teams、Signal、Slack、Telegram、WhatsApp、Zalo 等,同时还有 WebChat 网页聊天和移动节点。

这里有个中文读者一定会问的问题,我直说:微信不在官方列出的渠道清单里。 本文标题说"把聊天框变成 AI 助手",说的是这套范式——在你已经在用的即时通讯窗口里驱动 AI,而不是特指某一个 App。国内用户如果想体验,最顺手的入口通常是 Telegram(配置最简单)或者官方自带的 WebChat。

为什么"接进聊天软件"这件事本身有价值

有人会说:我打开一个网页跟 AI 聊,跟在聊天软件里跟 AI 聊,有什么区别?

区别有三层。

第一层是习惯路径。 你一天要看几十次微信、Slack。一个住在你已有习惯里的助手,和一个需要你专门打开一个标签页的助手,使用频次会差出一个量级。工具的价值 = 能力 × 使用频次,后面这个乘数经常被低估。

第二层是上下文现场。 工作讨论、需求变更、临时决定,本来就发生在聊天窗口里。助手在场,意味着它拿到的是原始现场,而不是你二次转述的摘要。

第三层是多端天然打通。 聊天软件本身已经解决了手机、电脑、平板的同步问题。你的助手接进去,等于白嫖了这套多端基础设施。

五、谁适合现在就折腾,谁建议再等等

我把人群粗暴分成四类,对号入座:

  1. 建议现在就上手的:日常写代码、有自己的服务器或常开电脑、命令行不发怵、有明确的重复性任务想自动化。你的收益最快兑现。
  2. 值得试一试的:技术团队负责人。多 Agent 路由和会话隔离这两个特性,在团队场景下的价值比个人场景大得多——这个我下下篇会专门拆。
  3. 可以观望的:纯内容创作者、不写代码但想提效的人。你的需求大概率被现成产品覆盖得更好,自托管的维护成本对你不划算。
  4. 暂时别碰的:完全没有服务器概念、看到命令行就头大的朋友。不是能力问题,是投入产出比问题。等生态里出现足够傻瓜的一键包再说。

一个提醒

网上会有人告诉你"用它一个月省了多少钱、多赚了多少"。这类说法请一律打折看待——效率工具的收益高度依赖你的具体工作流,不构成任何收益承诺。 我个人建议的评估方式是:先列出你每周重复三次以上的机械任务,看看其中有几件是能被自动化的。如果一件都数不出来,那这套东西对你就是玩具,不是工具。

六、为什么一群大厂都在往里投人

一个开源项目值不值得学,看代码只能看一半,另一半要看谁在往里投真金白银。

据公开资料,OpenClaw 生态目前的参与方相当密集:微软在 Build 上发布的企业级常驻 Agent「Scout」基于 OpenClaw 开源技术,并向上游回馈贡献;微软与 Windows 团队还在长期合作做原生 Windows 伴侣应用。密歇根大学成为最大捐赠方并成立了「智能体计算研究所」。Red Hat 投入专属团队做企业开源与供应链安全。腾讯投入了安全、稳定性与 ClawHub 方向的全职维护者,并建立了漏洞同步专线。Atlassian 等公司在推进部署、可审计性、身份边界与密钥处理。Vercel、Cloudflare、Convex、GitHub 提供基础设施支持。基金会与 30+ 组织保持日常共建。

这份名单说明了两件事。

一是它踩中了一个真实的产业空位。 每家公司都在做 Agent,但"Agent 怎么安全地接入企业既有的沟通工具"这个环节,之前一直是各做各的、重复造轮子。一个中立的、非营利基金会托管的、MIT 许可的网关层,正好是大家都愿意共用的公共设施。

二是它的重心正在从"好玩"转向"能扛"。 你看这些投入的方向——供应链安全、可审计、身份边界、密钥处理、稳定性——全是工程化和治理的活儿,不是新功能。这通常是一个项目从极客玩具走向生产可用的标志。

写在最后

我这几年看开源项目,有个粗暴的筛子:这东西解决的,是一个"发明出来的问题",还是一个"本来就在那儿的问题"?

"我的 AI 助手和我的聊天软件是两个世界""我想用 AI 处理点私事但不想把东西传出去""我想让助手到点自己干活而不是等我开口"——这三个问题,在 OpenClaw 出现之前就存在,而且每一个都真实存在于很多人的日常里。

它不一定是最终答案。但它把问题摆在了正确的位置上:不是再造一个更聪明的对话框,而是给已经存在的对话框,接上一个能干活的后端。

下一篇,我会把它真装一遍,三条命令、五分钟、连带踩过的坑,一条一条给你摆出来。

今日金句

决定一个 AI 助手价值的,从来不是它有多聪明,而是它离你的日常有多近、边界在谁手里。

今日互动

如果让你给自己配一个"住在聊天框里的 AI 助手",你更看重哪一点:数据完全在自己机器上,还是开箱即用零维护?这两件事目前很难兼得,你会怎么选,为什么?评论区聊聊。

往期回顾

  • Agent 安全六类攻击拆解:从提示注入到权限越界
  • 多 Agent 编排怎么玩:调度、协作与失败兜底
  • Agent 记忆设计:短期 / 长期 / 情节记忆,怎么存才不"越用越笨"