夜雨聆风学习资料网

ARTICLE · 1123536

让本地 AI 自己操作电脑

让本地 AI 自己操作电脑

前面聊的本地 AI,大多是"你问它答"或者"帮你写点东西"。今天往前迈一大步——让 AI 自己动手操作你的电脑:移动鼠标、点按钮、填表格、跨着好几个软件把一套流程跑完。 而且,全程能在本机跑、不上云。

这类工具叫 computer-use agent(电脑操作智能体),今年很火。它跟只会在浏览器里点点的工具不一样——它能操作你电脑上几乎任何软件。今天挑两个能接本机模型的代表实测聊聊:bytedance/UI-TARS-desktop 和 bytebot-ai/bytebot。

先打预防针:这篇偏"重",甜点是 16G 显存以上;8G 也能尝,但要用小模型、可靠性打折,文末给了 fallback。

它能拿来干嘛

价值全在"把你平时手动点一堆步骤的活,交给 AI 自动跑"。实际场景:

  • 重复的软件操作自动化:批量填表、录数据、把一个个文件按规则改名归档;
  • 跨程序的多步流程:比如"打开网页 → 下载报表 → 填进 Excel → 存到指定文件夹"这种一串动作,让它一口气跑完;
  • 处理文档 / 表格:读 PDF、整理数据、在办公软件里操作;
  • 需要登录才能干的活:它能在你登录的网站 / 系统里点点点,完成你平时手动做的事。

一句话:凡是"重复、多步、纯体力"的电脑操作,都可以试着丢给它。 这也是它跟"聊天 AI"最本质的区别——它是真去动手,不是给你出主意。

两条技术路线,先搞懂区别

这类工具分两个思路,理解了你才知道该选哪个:

① 截图视觉派——像人一样"看着屏幕"操作(UI-TARS 代表)。 它的核心是只看屏幕截图:不去解析网页 HTML、不依赖软件的无障碍接口,就是把屏幕当图片看,然后生成"往哪点、敲什么键"的动作,跟人用电脑一模一样。好处是通用——不管什么软件、什么界面它都能试着操作。UI-TARS 由字节和清华的研究者做,是首个在这个方向上能对标闭源方案(Claude Computer Use、OpenAI Operator)的开源 GUI agent。

② "给 AI 一台自己的电脑"派(Bytebot 代表)。 它把一个完整的 Linux 桌面装进容器,交给 AI 当它专属的电脑:AI 在这台"虚拟电脑"里开浏览器、用办公软件、下载整理文件、登录网站、跑多步流程。好处是天然隔离——它折腾的是容器里那台机器,不会直接动你的真实桌面,安全性反而更好。

怎么在本地跑

UI-TARS Desktop(bytedance/UI-TARS-desktop,Apache 2.0,约 2.95 万 star):它的模型可以用 vLLM 或 Ollama 在本地起,桌面 App 连你本机的 OpenAI 兼容端点就行。模型有 2B / 7B / 72B 几档,官方建议本地 FP16 推理用 16G+ 显存(跑 7B)。大致流程:

# 用 vLLM 起一个本地 UI-TARS 服务(7B 为例)pip install vllmhuggingface-cli download ByteDance-Seed/UI-TARS-1.5-7Bpython -m vllm.entrypoints.openai.api_server \  --model ByteDance-Seed/UI-TARS-1.5-7B --trust-remote-code --port 8000# 然后在 UI-TARS Desktop 设置里填 http://localhost:8000/v1

Bytebot(bytebot-ai/bytebot,Apache 2.0):用 Docker 起,自带一个 LiteLLM 代理,在配置里把模型指到你本机的 Ollama 即可:

git clone https://github.com/bytebot-ai/bytebot.git# 在 packages/bytebot-llm-proxy/litellm-config.yaml 里加本地模型:#   - model_name: local-llama#     litellm_params:#       model: ollama/llama3:70b#       api_base: http://host.docker.internal:11434docker-compose -f docker/docker-compose.proxy.yml up -d

(注意容器里访问宿主机的 Ollama 要用 host.docker.internal:11434。)

普通电脑扛得住吗

这篇得诚实——computer-use 靠的是视觉模型,比纯文本重不少:

  • 16G+ 显存:能舒服跑 UI-TARS 7B 这类,可靠性和速度都对得起;
  • 8G 显存:可以试 UI-TARS 的 2B 小模型(量化后能塞进去),或让 Bytebot 接一个小视觉模型——能动,但会更容易点错、更慢,拿来练手、跑简单任务可以;
  • 没好显卡 / 想先看看:先拿它跑最简单的单步任务感受一下,或者干脆当"了解方向"——这类工具还在快速进化,不急着上生产。

经验:模型越强、这活干得越稳。本地小模型能跑通简单流程,但复杂多步任务翻车率明显更高,别一上来就让它干要紧的事。

诚实说:安全这条必须重视

把电脑的操作权交给 AI,是真有风险的,这几条务必记牢:

  • 它还很实验性,必须盯着。 会点错位置、会卡住、会理解偏。别让它全自动去干重要 / 不可逆的事(删文件、发消息、动钱),跑的时候人得在旁边看着、随时能停。
  • 全桌面控制权 = 它能碰你所有登录的账号。 这也是我更推荐 Bytebot 那种容器隔离方案的原因——让它在一台"沙箱电脑"里折腾,别直接放它操作你装着一堆账号的真实桌面。
  • 千万别把它的界面暴露到公网。 谁能访问那个界面,谁就能控制这台机器和里面登录的账号——一定加好认证、只在局域网内用、别用弱密码。
  • 本地小模型可靠性不如顶级云模型。 这是现实,追求稳的复杂任务它还达不到,期待值放平。

谁适合,怎么上手

  • 每天有大量重复电脑操作的人(录入、整理、批量点选):这是把体力活自动化的新路子,值得试;
  • 爱折腾、有 16G+ 显卡的技术爱好者:直接上 UI-TARS Desktop 本地跑,体验"AI 自己用电脑"的震撼;
  • 在意安全 / 想隔离的:选 Bytebot 的容器方案,让 AI 在沙箱里干活;
  • 8G 卡或纯好奇的:用 2B 小模型尝个鲜、跑简单任务,或先当了解方向。

上手路径:挑一条路线(要通用选 UI-TARS 截图派、要隔离选 Bytebot 容器派)→ 用 vLLM / Ollama 在本地起模型 → 把 agent 连到本机端点 → 先让它干一个最简单的单步任务(比如"打开某网页截个图")→ 确认能稳定操作,再逐步交给它更长的流程,全程盯着。

#computer-use #UI-TARS #Bytebot #桌面agent #普通电脑跑AI

相关学习资料