夜雨聆风学习资料网

ARTICLE · 1038613

把 AI 装上手脚:OpenClaw 这套系统,到底在解决一个什么问题?

把 AI 装上手脚:OpenClaw 这套系统,到底在解决一个什么问题?

把 AI 装上手脚:OpenClaw 这套系统,到底在解决一个什么问题?

你有没有过这种时刻?

跟 ChatGPT 聊得很爽,让它写一段文案、回一封邮件、改一段代码,顺滑得不行。但你想让它真的帮你把这封邮件发出去——它停了。

"抱歉,我是 AI,无法直接操作你的邮件客户端。"

这句话,几乎是过去两年所有聊天式 AI 的天花板。它能想、能写、能说,但它不能动手

那有没有一种系统,是把 AI 和"动手能力"绑在一起的?

有。这就是今天要聊的 OpenClaw

本文想用大白话讲清楚一件事:这套系统到底是什么、怎么搭起来的、解决了什么问题、普通人怎么用上。架构部分我会画图,但不会堆术语;案例部分会点名场景,但不会编故事。


一、先说它解决的核心问题

在所有 AI Agent 产品里,OpenClaw 走了一条很反常识的路

它不生产智力,它给智力装手脚。

什么意思?

现在的 ChatGPT、文心一言、Claude,本质是"大脑"。它们聪明、能写、能想。
但要让大脑真的把事办了——打开浏览器点开网页、读 PDF 后填表、定时发推送、跨应用搬运文件——这些动作,传统 AI 做不了。
OpenClaw 就是那一层"把大脑接到手上的胶水"

它的核心设计哲学只有三句话:

1.一个进程搞定一切——不需要 Docker、不需要 Kubernetes、一个二进制 + 一份配置就能跑。
2.数据留在本地——你的对话、记忆、文件,全部在你自己的硬盘上,模型只"记住"被写入磁盘的内容。
3.渠道/模型/工具都能换——飞书、微信、Telegram、Claude、GPT、Gemini 都能接,但底层规则不变。

这三句话,决定了它的整个架构形态。


二、它长什么样?五层递进结构

我把它拆成五层(用工程师朋友的话说就是"五层递进、每层独立、可扩展可排障"):

每一层职责独立,可换可升级。 这就是它能在一两年内演化出几十个插件、几百种能力的关键。

三、每一层在解决什么具体问题?

① 接入层:怎么跟它说话

这是最"卷"的一层,也是普通人最有感的一层。

多渠道支持是这一层的核心——同一个 Gateway,可以同时接:
聊天工具:飞书、微信、Telegram、Discord、Slack、WhatsApp、iMessage、Signal、Teams、Matrix、QQ 机器人……(官方公开列表 20+ 个)
原生 App:iOS / Android / macOS / iPad / Linux 桌面伴侣
Web 端:Control UI(v2026.8.1 重做,对话 + 文件 + 审批 + 仪表板一站集成)
为什么这件事重要?

因为它意味着:你不必为了用 AI 切换工作流。你在飞书群里跟它说话,它就在飞书里回你;你在手机上点开 App,它就在手机上给你推结果。AI 不再是一个独立的 App,它长在你已有的工作流里

② 调度层:一个 Gateway 管所有事

整个系统的"唯一控制平面"叫 Gateway,默认跑在 ws://127.0.0.1:18789

它干七件事:

职责
干啥的
WebSocket 服务
所有客户端的实时通信入口
HTTP 服务
Web 界面、第三方 Webhook
会话管理
谁在哪个群里、聊到哪了、要不要压缩
鉴权授权
谁有权连进来
渠道生命周期
渠道挂了重连、新渠道自动注册
事件广播
流式输出、实时进度推送
审批队列
需要人工点头的命令先排队
关键设计: 路由器根据 渠道 + 账号 + 对端 把消息分发给不同的 Agent。

意思是你可以在同一个 Gateway 里跑多个 Agent:

Discord 的 #code 频道 → 编程 Agent
家里的 WhatsApp → 生活助理 Agent
飞书的工作群 → 工作 Agent
安全边界要注意: OpenClaw 的默认假设是"一个 Gateway = 一个可信操作者",不做共享 Gateway 的敌对多租户隔离。如果要给公司多部门共享,得每个部门跑一个独立实例。

③ 认知层:它怎么想、怎么记

这是 OpenClaw 最具原创性的一层。

一次完整的思考循环(Agent Loop)是这样的:
接收消息
拼装上下文(系统身份 + 你的指令 + 记忆 + 相关技能 + 对话历史)
调模型推理
决定要不要动手(调工具)
流式回复
把结果存进 Session
记忆系统是它的灵魂,分三层:
Dreaming 是什么? 这个名字很有意思——它在后台跑三个阶段:
阶段
干啥的
写入长期记忆?
Light(浅睡)
把最近的短期记忆排序、去重,暂存候选
REM(快速眼动)
反思主题和反复出现的想法
Deep(深睡)
给候选打分,过阈值的才入长期记忆

只有 Deep 阶段才会真正写进 MEMORY.md。整套机制强调可解释、可审查——你不希望 AI 半夜偷偷往你的长期记忆里塞东西。

④ 执行层:它能干什么

这一层是 AI 真正"动手"的部分。OpenClaw 把执行能力分成五组:

工具组
能干啥
文件系统
读写编辑文件、结构化补丁
运行时
执行 shell、管理后台进程
浏览器 & 画布
控制专用浏览器、在节点上画 UI
消息
跨渠道发消息、管会话
自动化
定时任务、网关控制
安全性是关键。这层有五种权限模式:
模式
策略
适用场景
deny
完全禁止执行命令
不想让 AI 动主机
allowlist
只跑白名单里的命令
已知安全的命令集
ask
白名单外每条都要人工批
严谨场景
auto
自动审 → 不行再人工
编码会话常用
full
不拦
完全信任的环境
默认是 deny——OpenClaw 的设计哲学是"能力越大、门槛越高",不会让你一键解锁所有执行权限。

⑤ 扩展层:能力边界怎么扩展

OpenClaw 最让我佩服的设计是 Skills 系统

一个 Skill 就是一个 SKILL.md 文件——YAML 头声明"什么时候用我、需要什么环境",正文用自然语言 + 结构化描述说明"怎么用我、参数是什么"。

这意味着: 任何人都可以把自己的领域知识包成一个 Skill,分享给别人用。OpenClaw 官方维护了一个叫 ClawHub 的公共注册表,类比 npm / pip / 苹果 App Store,搜索、安装、版本管理、星级评价都有。
这才是 Agent 生态真正该有的样子——不是每个团队从零造轮子,而是有个公共池子把经验沉淀下来。

四、1.0 到 2.0:到底变了什么?

OpenClaw 经历了一次大的架构重构。官方把这次重构叫"从个人工具到协作平台"。

拿掉的:
旧版的"配置墙"——以前装 OpenClaw 要先有 API Key、要做一堆命令行配置;现在大部分配置挪到安装后、用对话自然完成。
旧版捆绑的 OpenProse 插件——拆出来用更标准的方式实现。
"本地执行 = 只能在 Gateway 机器上跑"——现在任务可以分发到 Worker Node(已配对的手机 / 平板 / 云端)。
加进来的(四个架构级能力):
1.Active Memory + Dreaming —— 记忆从"被动存文件"变"主动整合"。
2.Shared Cloud Sessions —— 团队成员可以加入同一个任务,保留上下文继续干。
3.安全治理层 —— 第三方插件安装前要展示能力、有审计命令、有凭证遮罩。
4.Self-learning + Skill Workshop —— Agent 可以从完成的对话里"自学",把方法沉淀成新 Skill。
5.这个重构有多大? 官方公布的规模是上万级 PR、上百位贡献者。创始人的原话大意是:原本只是想简化安装流程、重做浏览器,最后发现为了"让一个非技术用户更快用上一只能用的龙虾",必须同时重构会话、记忆、权限、密钥、云端执行、多 Agent 协作和团队共享。
6.架构稳定性 = 功能快速迭代的前提。这一点被这次重构完整验证了。

五、它能干啥用?三个场景

🧑‍💻 场景 1:个人生产力(从"对话"到"执行")

最典型的场景是跨应用、多步骤的重复操作——你不再需要在聊天窗口、浏览器、笔记软件之间来回切。

具体能干啥?

自动处理邮件、定时完成任务
充当交易助理,扫描财报日历、按预设策略筛信号、实时推送
充当"AI 编辑部"——总编、记者、编辑、校对、排版、发布,每个角色都是一个 Agent,输入主题自动跑完全流程

🏢 场景 2:组织工作流(把 AI 嵌入已有的 IM)

这是最被低估的一个场景。

当 OpenClaw 进入企业,AI 的角色从"独立 App"变成"嵌在飞书/企微里的同事"。几个公开报道的方向:

公文分发:有地方政府用 OpenClaw 接企业微信/飞书,过去联系 200 多家企业要数天,现在一份文件从一级集团到三级集团压缩到十几分钟
金融投研:从"被动响应"升级到"主动执行"——预设目标后,自主跑完"信息抓取→数据整理→初步分析→结果反馈"闭环。有量化基金经理形容它是"24 小时带了个资深基助在身边"。
12345 政务热线:自动识别工单的诉求类型、事发区域、紧急程度,标准化分类标引。

🚀 场景 3:一 人公司(OPC,One Person Company)

这是最有产品颠覆性的场景。

核心逻辑: OpenClaw 把"雇佣"从人力市场转移到了配置界面。你不招员工,你配 Agent。

各地政府已出台专项政策支持这条路线,公开报道里能看到几个有代表性的方向:

制造业智能工厂:有 3 人团队聚焦设备维护,靠 OpenClaw 跑通了端到端业务并拿到订单。
跨境营销物料:有团队基于 OpenClaw 的能力,一分钟内产出十几张专业级营销海报
网文出海独立站:有创业者两天内独立搭出一个独立站。
这件事的产品意义在于: AI Agent 不再是"老板的工具",而是"老板的员工"。

六、普通人怎么用上?(国内手机端路径)

国内用户上手 OpenClaw 主要有两条路径。

路径 A:云端托管(零部署)

百度 App × OpenClaw:在百度 App 搜"OpenClaw",一键部署到云端、配置模型和联网能力,免服务器、免 API Key、免命令行
阿里云 JVS Claw:已上架苹果 App Store 和国内安卓应用商店,iOS 12+ 可用,新用户有 7 天免费调用量。
百度红手指 Operator:安卓端,结合自研移动 Agent 能力,可跨 App 完成打车、外卖订餐等操作。

路径 B:自托管 + 手机客户端

方案
适合谁
关键点
官方原生 App
愿意自己跑 Gateway
iOS / Android 都有,App 只是个 WebSocket 客户端,通过局域网/Tailscale/SSH 隧道连接
Android 本地部署(社区版 openclaw-termux-zh)
极客、想一台手机搞定
安卓 10+,无需电脑,但强烈建议用闲置备用机——OpenClaw 拥有系统级读写权限
ClawApp(手机浏览器/PWA/APK)
想轻量体验
需要一台电脑跑代理服务(端口 3210),支持图片、语音、多 Agent 选择
ClawConnect 扫码配对
国内环境友好
装插件后终端出二维码,手机扫码即配,无需配飞书/钉钉机器人

国内网络两个坑

1.依赖下载:社区版务必配置国内镜像(pnpm config set registry https://registry.npmmirror.com/),不然装到一半会卡。
2.联网搜索:OpenClaw 默认搜索在国内不好使,装一个 Multi Search Engine Skill 就解决,免费稳定。

七、最后讲讲它最反常识的设计选择

通篇看完,你会发现 OpenClaw 几乎每一个架构决策都在"反规模"

单进程 Gateway → 放弃了水平扩展,换来了部署的极简性
本地优先 → 放弃了云端协同的便利,换来了数据主权的完整性
分层解耦 → 放弃了端到端优化的空间,换来了每一层可独立演进的能力

这些选择在云原生时代显得很"老派",但它换来的东西是:

一个普通用户能在 10 分钟内跑起来
你的数据从第一天起就在你自己的硬盘上
任何一个层出问题都能定位、能替换
AI Agent 这件事,比的不是谁的功能更多,而是谁能跑得久。

一个能在你手机上跑、在你硬盘上存、按你的规则跑两年的系统,比一个需要付费订阅、数据上云、随时被关停的服务,长期价值高得多


写在最后

如果你也在折腾 AI Agent,你会发现 2026 年这个赛道已经分化成两条路:

1.大而全的 SaaS——功能多、开箱即用、但数据和执行权都在云上
2.本地优先 + 生态开放——上手门槛高一点、但你的数据和执行权永远在你手上

OpenClaw 选了第二条。走不走这条路,取决于你想要的是"方便用",还是"长期拥有"。


关于作者: 小飞哥,AI 架构师 + 独立开发者,专注普通人的 AI 工具实践。公众号同步更新,会写一些不编数据、有真实踩坑的过程记录。

📮 想看更多这样的拆解 + 一起实战?

加我微信 ysf99918,备注"OpenClaw",拉你进交流群一起玩。

相关学习资料