Datawhale干货
作者:李秀奇,Datawhale成员
先说一个很实际的问题。
有些信息,你想让 Agent 帮你搜到、抓下来,但是会遇到:页面要登录才能看完整内容,数据不滚动到底就不加载,很多信息就是要在专用的网站,联网搜索解决不了问题。
这就是"控制浏览器"要解决的问题。今天我们用一篇文章,带大家上手用 AI 控制浏览器。
一、让AI控制浏览器帮你干活原理
让一条指令驱动浏览器,听起来方案很多,Selenium、Playwright、CDP、MCP、视觉点击,名词一大堆。但按指令从哪个位置进入浏览器来分,真实的路只有三条。
第一条是进程外调试协议,也就是 CDP 这一类。浏览器开一个供程序连接的调试端口,外部程序连上它就能指挥浏览器。Playwright、Selenium 这些框架走的都是这条路,它们是封装,不是另一条路。这条路能力最全,但网站能察觉你在用程序控制,容易拦你。
第二条是浏览器内扩展。控制代码作为扩展跑在浏览器内部,直接操作页面,再通过一个本地服务把能力开放给外面的 Agent。它最大的优势是登录状态和你本人操作时一模一样,因为它就在你日常用的那个浏览器里,网站分不出是你在操作还是 AI 在操作。
第三条是操作系统层,在电脑桌面上模拟鼠标键盘,或者截屏给模型看。网站察觉不到程序控制的痕迹,因为确实没有走任何协议通道。代价是每走一步都要截屏加识别,比前两条慢得多;窗口大小、缩放比例、页面遮挡,任何一样变了,原来记好的点击位置就失效。
这三条路怎么选,核心就看一件事,要不要用你那个已经登录的浏览器。要,就走扩展这条路,登录状态都是现成的;不要,就另起一个干净的浏览器,登录状态自己维护。我们上手用的 Kimi WebBridge 走的就是扩展这条路:你电脑里跑一个后台服务,浏览器里装一个扩展,模型就能拿到一组现成的动作,打开页面、读内容、填表、点击、截图,直接用。

一般大家让 Agent 帮忙控制浏览器会使用 Browse Use 以及 Kimi Web Bridge,但也还有其他的。
但在我的实际体验中,Browse Use 对比 Kimi Web Bridge 来说没有那么好用,原因如下:
1. 每次连接都需要点击同意:Browse Use 每次连接都需要你去点击同意,如果你不同意的话它没法连接。每次都需要我点击,所以我感觉它很麻烦。
2. 没有分组概念:Browse Use 没有分组的概念,每次打开一个 tab 页就是一个独立的 tab 页;但是 Kimi Web Bridge 是有分组概念的,它可以按照任务组别,一组一组地把网页分隔开。
开始之前,你要准备两样东西,一是在 Chrome 里装好 Kimi WebBridge 扩展,二是一个能调用它的 AI 工具,Kimi Code、Claude Code 这类命令行工具都可以。准备好之后,把下面的提示词原样发给它就行。
二、上手教程
控制浏览器说到底就三种能力:把页面读出来,把操作写进去,以及在真实网站上把它们综合用起来。下面三个任务,每个练一种。演示时我们用的模型是 GPT-5.6-sol,但它只是执行者,主角是流程本身。
任务一:练读取能力
要测的是让浏览器把页面内容变成规整的数据,包括翻页这种连续操作。目标站是 Books to Scrape,一个专为抓取练习设计的图书站。
你就这么跟它说:
用 Kimi WebBridge 完成以下任务,session 名用 demo-books。目标:打开 https://books.toscrape.com/,提取当前页全部图书的标题、价格、评分,然后翻到第二页再次提取。验证标准:- 第一页返回 20 条,首项是 "A Light in the Attic"。- 第二页返回 20 条,首项是 "In Her Wake"。- 两页数据不能重复。输出:两页的 JSON 数组,并给出条数和首项书名。
提示词里的 session 是给这次浏览器会话起的名字,不同任务用不同名字,就能互不干扰地同时跑。模型收到后先打开首页,再在页面里跑了一段脚本,20 本书一次拿全;然后翻到第二页,再拿 20 本。注意提示词里验证标准的写法:翻页成不成功,不看翻页指令回来说了什么,看第二页的第一本书是不是 In Her Wake。指令的返回值只说明指令执行了,数据才能证明页面真的变了。

Books to Scrape 图书列表页

翻页后的第二页
任务二:练写入与验证能力
要测的是把操作写进页面:填表、点击,并且验证操作的结果。目标站是 The Internet 的登录页,这是一个专门用来练习的网站,测试账号公开写在页面上。
你就这么跟它说:
用 Kimi WebBridge 完成以下任务,session 名用 demo-login。目标:在 https://the-internet.herokuapp.com/login 完成一次真实登录,用户名 tomsmith,密码 SuperSecretPassword!。步骤建议:1. navigate 到登录页。2. 先 snapshot,找到用户名输入框、密码输入框、登录按钮的引用。3. fill 用户名,fill 密码,click 登录按钮。4. 等待 2 秒后再次 snapshot,检查跳转结果。验证标准(必须全部满足):- 第二次 snapshot 的 url 包含 /secure。- 页面文本里出现 "You logged into a secure area!"。- 页面里能找到 Logout 链接。click 返回 success 不算登录成功。
模型先读了一遍页面结构,拿到用户名框、密码框、登录按钮三个控件的位置,填了两次输入框,点了一次登录按钮。这个任务最关键的一课在提示词的最后一行:点按钮返回"成功",只说明按钮被点了,不说明登录真的成功了。所以验证标准写成三个条件的组合,网址跳转、成功提示、退出链接,少一条都不算完成。你写提示词时给模型定好验证标准,模型就会自己复查;不给,它就可能把"点了按钮"当成交差。

登录成功后的 Secure Area
任务三:练真实站点的综合能力
要测的是把读取能力用到真实网站上,同时处理两个网站、两个会话,并且应对页面结构和你预想不一样的情况。目标是 GitHub Trending 和 Hacker News,各取前 10 条,合成一份技术日报。
你就这么跟它说:
用 Kimi WebBridge 完成以下任务,GitHub 用 session demo-github,Hacker News 用 session demo-hn。目标:分别打开 GitHub Trending 和 Hacker News,各提取前 10 条。GitHub Trending:https://github.com/trending- 用 evaluate 从 article.Box-row 提取仓库名、链接、简介、语言、当日新增星标。- 字段为空时先检查选择器是否匹配当前页面,不要把"选择器没匹配到"当成"数据不存在"。Hacker News:https://news.ycombinator.com/- 用 evaluate 从 tr.athing 提取排名、标题、链接、来源、分数、时间。验证标准:- 两个站点各返回 10 条,每条有非空标题和链接。输出:一份 Markdown 文档,分两节列出结果,给出采集时间。
提示词里 article.Box-row、tr.athing 这些符号,是数据在页面上所在位置的代号,不用你懂,照抄就行。就算不写,模型自己打开页面也能把它们找出来,下面就是实例。
Hacker News 这边任务执行很顺利。GitHub 这边,第一次提取仓库简介时,拿回来 10 条空字符串。因为提示词里写了"字段为空先检查选择器",模型没有报告"这些仓库没有简介",而是把页面的真实结构导出来检查,发现简介放在一个代号叫 p.col-9 的位置,修正后全部取回。真实网站的结构随时和你的预期不同,那一句提示词就是留给模型的自查指令。

Hacker News 首页前 10 条

GitHub Trending 前 10 个仓库
到这里,读、写、综合三种能力都过了一遍。你也看出来了,控制浏览器的核心不是代码,是提示词:目标说清楚,验证标准写明白,并且保留一句排错指引。
三、不挑模型,也能复现本次任务
学会了上面的流程,自然有个问题:能不能换国产的模型?我们把三条提示词原样发给了三个国产模型:豆包 doubao-seed-evolving、阶跃 Step Explore、Kimi K3。
先说结果。三个模型全部通过,主要操作步骤和演示时一致。你学会的这套方法不绑定模型,换谁来执行都一样。
过程里的差异也值得一提。豆包和 Kimi K3 踩了同一个坑:把脚本拼进本地命令时引号冲突,报了语法错误,两个模型都判断是本地拼接问题,换写法后自己修好了。

阶跃 Step Explore 全程无告警,还主动提醒我们,Hacker News 的分数会随时间变化,如果验证标准里写死具体数值,分数一变,明明任务跑成功了也会被判定失败。

Kimi K3 有一次执行的命令好像写错了,导致出现了红色的警告,不过它后面调整后就修正了。

总结一下
这篇文章带大家走完了控制浏览器的一条完整路径。
选路时,指令进入浏览器只有三条路,走哪条就看一件事,要不要用你那个已经登录的浏览器。我们的选择是扩展这条路上的 Kimi WebBridge。
方法上,控制浏览器不靠写代码,靠提示词。目标说清楚,验证标准写明白,排错指引留一句。
上手就是三个任务,分别练读取、写入与验证、真实站点综合,每条提示词都可以原样复制去跑。
边界也要清楚,这套流程不绑定模型,GPT-5.6-sol 演示的三个任务,豆包、阶跃 Step Explore、Kimi K3 都能复现,差异只在各模型拼脚本的习惯,与浏览器操作无关。
工具决定能不能做,方法决定换谁都能做。Kimi WebBridge 在 Chrome 应用商店搜索安装即可。
夜雨聆风