ARTICLE · 1132932
AI Agent终于能自己上网了:BrowserOS+OpenCode 45个平台随便操作
一、AI Agent 最大的短板
2026 年了,AI Agent 已经能做很多事。
它能读代码、写文案、分析数据、生成图片。你给它一个任务,它思考几秒,输出一段完美的回答。
但你让它做一件最简单的事——打开浏览器,登录知乎,搜索"AI Agent",把前 10 篇文章的标题抄下来——它就卡住了。
传统方案要么太重(Selenium/Puppeteer 需要写一堆脚本),要么太碎(每个平台单独对接 API),要么太假(模拟点击扛不过验证码)。
AI Agent 有大脑,没有手。
它能思考,但不能操作。能分析,但不能执行。能生成内容,但不能发布。
这个问题困扰了我很久,直到我遇到了 BrowserOS。

三层架构
● ● ●
二、BrowserOS 是什么
一句话:它给 AI Agent 装了一双真正的手。
BrowserOS 不是又一个浏览器自动化工具。它是一个完整的浏览器操作系统,专门为 AI Agent 设计:
┌──────────────────────────────────────────────┐ │ BrowserOS 架构 │ ├──────────────────────────────────────────────┤ │ │ │ ┌──────────────┐ ┌──────────────────┐ │ │ │ 17 个 MCP │ │ 45 个 SaaS │ │ │ │ 浏览器工具 │ │ 连接器 │ │ │ │ │ │ │ │ │ │ • 导航 │ │ • Twitter/X │ │ │ │ • 点击 │ │ • Reddit │ │ │ │ • 填表 │ │ • 知乎 │ │ │ │ • 截图 │ │ • B站 │ │ │ │ • 提取文本 │ │ • 小红书 │ │ │ │ • 执行 JS │ │ • 微博 │ │ │ │ • 管理标签 │ │ • YouTube │ │ │ │ • 网络请求 │ │ • LinkedIn │ │ │ │ ... │ │ • ... │ │ │ └──────┬───────┘ └────────┬─────────┘ │ │ │ │ │ │ └──────────┬───────────┘ │ │ ▼ │ │ ┌────────────────┐ │ │ │ Chrome 扩展 │ │ │ │ (真实浏览器) │ │ │ └────────────────┘ │ │ │ └──────────────────────────────────────────────┘
三层设计,各司其职:
第一层:17 个 MCP 浏览器工具。 这是"手"的基本动作——打开网页、点击按钮、填写表单、截图、提取文本、执行 JavaScript。任何浏览器操作都能拆解成这 17 个基本动作的组合。
第二层:45 个 SaaS 连接器。 这是"手"的高级技能——已经为你封装好了 Twitter、Reddit、知乎、B站、小红书、微博、YouTube、LinkedIn 等 45 个平台的高频操作。不需要自己写 CSS 选择器,不需要研究每个平台的 API,直接调用。
第三层:Chrome 扩展。 这是"手"的物理基础——所有操作都通过你真实的 Chrome 浏览器执行,使用你的登录态,你的 Cookie,你的身份。不需要单独登录,不需要过验证码。
关键区别:BrowserOS 操作的是你自己的浏览器,用你自己的身份。 这不是模拟,是真实的操作。
● ● ●
三、跟 OpenCode 集成:0 行代码修改
我用的是 OpenCode 作为 AI Agent 运行时。集成 BrowserOS 之前,我做了最坏的打算:改源码、写适配层、处理兼容性。
结果:0 行代码修改。
BrowserOS 原生支持 OpenCode,体现在三个层级:
第一层:catalog.rs(工具注册)
BrowserOS 的 Rust 源码中,catalog.rs 负责注册所有 MCP 工具。OpenCode 的工具格式已经内置在里面了。不需要手动注册,不需要写适配器。
第二层:client-configs.ts(客户端配置)
BrowserOS 的 TypeScript 配置中,client-configs.ts 已经预置了 OpenCode 的连接参数。包括 MCP 端点 URL、工具命名规范、消息格式。
第三层:harness.rs(运行时框架)
BrowserOS 的测试框架 harness.rs 已经包含 OpenCode 的测试用例。你可以直接跑集成测试,验证连接是否正常。
三层都已就绪,你要做的只是配置 MCP 连接。

集成对比
● ● ●
四、5 分钟接入指南
Step 1:安装 BrowserOS
# 下载 BrowserOS.app # 拖到 /Applications/ # 启动 open /Applications/BrowserOS.app
启动后,BrowserOS 会自动开启三个端口:
| 端口 | 用途 |
|---|---|
| 9100 | CDP(Chrome DevTools Protocol) |
| 9000 | Proxy(代理服务) |
| 9200 | MCP Server(MCP 协议端点) |
Step 2:配置 OpenCode MCP
在 ~/.config/opencode/opencode.json 中添加 BrowserOS MCP 服务:
{
"mcp": {
"browseros": {
"type": "remote",
"url": "http://127.0.0.1:9200/mcp",
"enabled": true
}
}
}
就这一段配置。没有一行代码。
Step 3:验证连接
重启 OpenCode,检查 MCP 工具是否加载:
# 检查 BrowserOS 进程 ps aux | grep BrowserOS # 检查端口 lsof -i :9200 # 检查 MCP 工具数量 # OpenCode 启动日志会显示加载了多少个 MCP 工具
如果看到 17 个浏览器工具 + 45 个 SaaS 连接器,接入成功。
● ● ●
五、实测:让 Agent 操作 45 个平台
接入完成后,Agent 现在能做什么?
场景 1:社交媒体监控
"帮我看看 Twitter 上今天关于 AI Agent 的热门讨论,总结前 5 条"
Agent 的操作链路:
- 1.调用
browser_navigate→ 打开 twitter.com - 2.调用
browser_snapshot→ 获取页面结构 - 3.调用
browser_find→ 搜索 "AI Agent" - 4.调用
browser_snapshot→ 获取搜索结果 - 5.调用
browser_click→ 逐条点开热门推文 - 6.调用
browser_evaluate→ 提取文本内容 - 7.汇总分析 → 输出总结
全程不需要你写一行代码。 Agent 自己决定调用哪些工具、按什么顺序执行。
场景 2:内容发布
"把我写的这篇文章发到知乎"
Agent 的操作链路:
- 1.调用
browser_navigate→ 打开 zhihu.com - 2.调用
browser_snapshot→ 检查是否已登录 - 3.调用
browser_click→ 点击"写文章" - 4.调用
browser_fill_form→ 填入标题和正文 - 5.调用
browser_click→ 点击"发布"
用的是你自己的 Chrome 登录态。 不需要单独配置 API Key,不需要过验证码。
场景 3:数据采集
"从小红书上抓取最近 20 条关于'平价护肤品'的笔记,整理成表格"
Agent 的操作链路:
- 1.调用
browser_navigate→ 打开 xiaohongshu.com - 2.调用
browser_find→ 搜索"平价护肤品" - 3.调用
browser_evaluate→ 滚动加载更多 - 4.循环调用
browser_snapshot+browser_evaluate→ 逐条提取标题、点赞数、评论数 - 5.整理成 Markdown 表格 → 输出
45 个平台,每个都已经预置了高频操作的封装。你不需要研究每个平台的 DOM 结构,Agent 直接就能用。

核心数据
● ● ●
六、跟传统方案的对比
| 维度 | Selenium/Puppeteer | 平台 API | BrowserOS |
|---|---|---|---|
| 学习成本 | 高(需要写脚本) | 中(需要读文档) | 低(自然语言驱动) |
| 登录态 | 需要单独管理 | 需要 API Key | 使用 Chrome 登录态 |
| 验证码 | 需要额外处理 | 不涉及 | 不涉及(真实浏览器) |
| 平台覆盖 | 任意网站 | 特定平台 | 45 个预置 + 任意网站 |
| Agent 集成 | 需要适配层 | 需要适配层 | 原生 MCP 协议 |
| 代码量 | 大 | 中 | 0(OpenCode 原生) |
BrowserOS 的核心优势:不是更快,而是更自然。
Agent 不需要知道"怎么操作浏览器",它只需要知道"我要做什么"。BrowserOS 负责把意图翻译成浏览器操作。
● ● ●
七、AGPL 许可证:不用慌
看到 BrowserOS 是 AGPL 协议,很多人第一反应是"会不会传染我的代码"。
答案是:不会。
AGPL §13(网络使用条款)的触发条件是:你修改了 AGPL 代码并通过网络提供服务。
我们的使用方式是:
- ●不修改 BrowserOS 源码(0 行修改)
- ●不通过网络对外提供服务(本地 MCP 连接)
- ●只作为 MCP 客户端调用(消费者角色)
因此 AGPL §13 不触发。你的项目代码不受影响。

MCP调用流程
● ● ●
八、技术细节:MCP 协议
BrowserOS 跟 OpenCode 之间通过 MCP(Model Context Protocol)通信。MCP 是 Anthropic 提出的标准协议,专门用于 AI Agent 与外部工具的通信。
┌──────────┐ MCP 协议 ┌──────────┐
│ OpenCode │ ←────────────→ │ BrowserOS │
│ (Agent) │ JSON-RPC │ (Server) │
│ │ over HTTP │ │
│ 调用工具 │ ←────────────→ │ 执行操作 │
│ 接收结果 │ │ 返回数据 │
└──────────┘ └──────────┘
│ │
│ 127.0.0.1:9200/mcp │
│ (本地连接,无网络暴露) │
└─────────────────────────────┘
MCP 的好处:
- ●标准化:任何支持 MCP 的 Agent 都能接入,不限于 OpenCode
- ●解耦:Agent 不需要知道浏览器操作的具体实现
- ●安全:本地连接,不暴露到公网
- ●可扩展:BrowserOS 新增工具,Agent 自动可用
● ● ●
九、这套东西能用来做什么
个人效率
- ●自动监控 45 个平台上的关键词提及
- ●自动采集竞品动态、价格变化
- ●自动发布内容到多平台(一鱼多吃)
- ●自动回复社区消息(SLA 内响应)
团队协作
- ●运营日报自动生成(从各平台拉取数据汇总)
- ●客户反馈自动采集和分类
- ●舆情监控和预警
- ●多平台内容矩阵管理
产品开发
- ●E2E 测试自动化(真实浏览器,不是无头模拟)
- ●用户行为模拟(验证新功能在不同平台的表现)
- ●数据验证(跨平台数据一致性检查)
限制不在工具,而在你的想象力。
● ● ●
十、最后
AI Agent 发展到今天,"大脑"已经够强了——GPT-5.5、Claude 4.6、GLM 5.2,推理能力都不差。
差的一直是"手"。
Agent 能告诉你"应该去知乎搜索 AI Agent 的讨论",但它自己做不到。能分析,但不能执行。能建议,但不能落地。
BrowserOS + OpenCode 补上了这一环。Agent 终于可以自己打开浏览器、自己登录、自己搜索、自己操作。
不是"帮你写脚本去操作",而是它自己就会操作。
这是质变。
关注公众号回复「BrowserOS」获取完整接入配置和 45 个平台连接器清单。