乐于分享
好东西不私藏

一个开源工具,让AI Agent可以自主操作任何网站

一个开源工具,让AI Agent可以自主操作任何网站

现在我刷知乎的方式变了,我只要掏出手机,跟本地的 AI Agent 说了一句:「帮我看看今天知乎热帖。」

十秒后,结果回来了。

不是搜索引擎抓取的摘要,是我自己账号登录后的知乎热榜,完整的标题、热度、摘要,一个不少。

然后我又说:「帮我搜一下生财有术里关于 AI 编程的实操贴。」

Agent 打开我已登录的浏览器,导航到生财有术,搜索,提取结果。

全程我没碰过电脑。

这事怎么做到的

一个叫 OpenCLI 的开源项目。GitHub 上搜 jackwener/opencli 就能找到。

它的思路很直接:给你本地的 Chrome 装一个扩展,再装一个命令行工具。你的 AI Agent(Claude Code、Cursor 都行)通过命令行和你的浏览器通信,直接操作你已登录的任何网站。

你登录了知乎,它就能读知乎。你登录了小红书,它就能刷小红书。你登录了 Twitter,它就能发推。因为它用的是你自己的浏览器,你的登录态、你的 Cookie,全都在。

这和之前那些「浏览器自动化」工具不一样。你不用配什么账号密码、API Key,你的浏览器本身就是凭证。

未来的软件的主要用户是 AI Agent

我一直有个判断:未来的软件,主要用户不是人,是 AI Agent。

人负责跟 Agent 对话,Agent 负责操作软件。

你想想看,你打开一个 App,目的通常是获取信息或完成某个操作。查个快递、看个帖子、搜个资料、下一个单。这些事 Agent 都能做,而且比人做得快。

但问题是,现在绝大多数软件只有图形界面,没有给 Agent 用的接口。Agent 想操作一个网站,要么靠屏幕识别(慢且不准),要么靠逆向工程(容易崩)。

OpenCLI 做的事,就是给这些网站补上「Agent 可用」的接口。不用等网站官方适配,社区自己动手。装个扩展,写个适配器,任何网站就变成 Agent 可以操作的了。

我自己的使用体验

我现在的日常是这样的:

电脑开着,Chrome 登着各种网站。我在外面用手机跟本地的 AI 对话,让它帮我浏览、搜索、提取信息。

通勤路上刷知乎热榜。午休时让 Agent 帮我总结一篇长文。躺在床上让它帮我搜生财有术的实操帖。

信息消费这件事,从「人盯着屏幕看」变成了「Agent 帮你看了,你只看结果」。

说实话,刚开始用的时候我没太当回事。但用下来之后,我发现自己打开浏览器的频率确实降低了。以前一天可能打开几十次,现在很多场景直接让 Agent 处理就行。

怎么上手

如果你也想试试,三步:

  1. 1. 装个 Chrome 扩展(Chrome Web Store 搜 OpenCLI)
  2. 2. 终端运行一条命令npm install -g @jackwener/opencli
  3. 3. 在你的 AI Agent 里安装对应的 skill(npx skills add jackwener/opencli

装完跑一下 opencli doctor 检查连接状态,没问题就可以用了。