夜雨聆风学习资料网

ARTICLE · 1114332

11万星的开源工具,让AI替你点鼠标

11万星的开源工具,让AI替你点鼠标

先说个我自己的场景。上个月我帮朋友代运营几个账号,最烦的不是写文案,是每天把同样的内容,在五六个平台各发一遍。复制、粘贴、改标题、传图、点发布,一套流程十几分钟,一周下来一两个小时全耗在这上面,还容易漏。

我一开始想的是"有没有现成工具能自动发"。找了一圈发现,办公套件里那些"宏"和"脚本录制",只能把你手动点过的步骤原样重放一遍——换个网站结构就失灵,改个按钮位置就报错。真正能用大白话下指令、让 AI 自己看着网页随机应变的工具,主流软件没给。

今天这篇,就讲一个解决这个问题的开源项目,以及它到底能帮你省多少事。

为什么现成的软件解决不了

市面上的"网页自动化"分两种:

第一种,录制回放。像 Excel 的宏、部分 RPA 工具,原理是你手动操作一遍,它记下坐标和步骤,下次照着重放。问题是网页不是静态的——登录弹窗、验证码、列表加载顺序、按钮文案,任何一处变了,录制好的脚本就废了。换一个网站,得重新录一遍。

第二种,写脚本。用 Selenium、Playwright 这类工具,你得懂 Python,得一行行写"点这个按钮、填那个框"。这对天天跟表格打交道、不会写代码的人来说,门槛太高了。

为什么没有一个大厂把这事做成"说人话就行"的产品?原因很简单:每个网站的页面结构都不一样,无法统一。做一个能适配所有网页的通用 Agent,技术难度和成本都极高,主流办公套件宁可内置"会议纪要""智能表格"这种结构固定的场景,也不愿碰"通用网页操作"这块硬骨头。

于是这个需求,被一个开源项目接住了。

主角:browser-use

browser-use 是一个 Python 库,让你用自然语言驱动真实的浏览器。它目前在 GitHub 上有 11 万多个 star(截至 2026 年 9 月,多个来源在 11.2 万到 11.6 万之间),MIT 协议开源,381 位贡献者,最新版本 0.13.10,维护非常活跃。

它的核心思路,是把"AI 看网页"这件难事给解决了。普通网页的 HTML 有几万甚至几十万个字符,直接丢给大模型又贵又容易错。browser-use 干的一件事,是把网页里可交互的元素(按钮、输入框、链接)和可见文字提取出来,压缩成模型好理解的干净结构,再让模型决定下一步"点哪里、填什么",它负责执行。这样来回循环,直到任务完成。

一句话:你下指令,它自己看、自己点、自己纠错。

三个方案怎么选

我把能"让 AI 操作电脑/网页"的路线,按门槛和收费给你摆清楚:

▲ 星标数截至 2026 年 9 月,多来源交叉核实

怎么选,看你的身份:

  • 会一点 Python、想要省心的网页自动化
     → 选 browser-use,网页操作这块它是对口的主力(在第三方网页 Agent 基准评测里拿过第一)。
  • 想要一个"全能助手"、连本地文件和代码一起管
     → 选 Open Interpreter(约 6.6 万 star,开源),但它偏开发者向,本地执行代码有安全风险,得看着点。
  • 只想偶尔用、不折腾环境
     → 直接用带 computer use 功能的旗舰模型订阅,但按量算下来单任务不便宜。

对大多数想"把重复网页活交给机器人"的职场人,browser-use 是对口的起点。

上手步骤(照着抄)

前提:电脑装好 Python 3.11+,会开命令行。

第一步,装库。

pip install browser-use playwright install chromium

第二步,写一个最小脚本。新建一个 demo.py,内容如下:

import asyncio from browser_use import Agent from langchain_openai import ChatOpenAI    async def main():         agent = Agent(               task="打开 example.com 登录页,用账号 test、密码 123456 登录,然后告诉我登录后的欢迎语",               llm=ChatOpenAI(model="gpt-4o"),           )           result = await agent.run()           print(result)  asyncio.run(main())

第三步,跑起来。它会自动打开浏览器,自己定位输入框、点登录、抓取结果。

三个提醒,务必记牢:

  1. 别用主账号
    。它就像你请了个陌生人在你电脑上点鼠标,登录什么、点了什么你得盯。建议用单独浏览器配置,圈定它能碰到的账号范围。
  2. API Key 自己配
    。库本身免费,但调模型要花钱。每一步都会把页面状态发给模型,多步任务 token 消耗不小,选便宜的模型能省不少。
  3. 重要操作先在测试页面试
    。别一上来就让它帮你发正式邮件、操作真实业务系统,先在无所谓的页面跑通再说。

它能替你干的活

结合职场高频场景,列几个实在的:

  • 多平台重复发布
    :把一篇文章发到多个平台,写个任务让它逐个登录、粘贴、发布。
  • 批量填表
    :每天要填的日报、周报、报销单,把固定字段做成模板任务。
  • 定时抓数据
    :每天抓一遍竞品价格、榜单排名,汇总成表格。

这些活有个共同点:规则明确、重复性高、不怕它偶尔出错重来。反过来,涉及真金白银的付款、对外发正式内容,别交给它,盯紧。

一句话收尾

不用被"AI Agent"这个词吓住。browser-use 这类工具,本质就是把"我知道该点哪里,但懒得天天点"的重复活,交给一个能看屏幕、能试错、能自己纠错的机器人。

如果你每周有超过半小时耗在重复的网页操作上,今晚就花 10 分钟把环境装好,挑一件最烦的重复活让它跑一遍——跑通那一刻的感受,比看十篇测评都直接。

(完)

相关学习资料