夜雨聆风学习资料网

ARTICLE · 1055743

Cua:给 AI agent 一台真能用的电脑

Cua:给 AI agent 一台真能用的电脑

Cua:给 AI agent 一台真能用的电脑

在 GitHub 的海洋里,每天都有让人眼前一亮的新项目诞生。

trycua/cua

AI 会写代码、会聊天,但让它真的去点开一个软件、填一张表、在图形界面里把任务做完,依然是个难题。Cua 要解决的就是这件事,它 README 的第一句话写得很直接:Give AI agents computers they can use。项目把五个部件放在同一个仓库里——桌面自动化驱动、隔离云桌面、本地 macOS 虚拟机、专用的决策小模型,以及用来评估 computer-use agent 的基准工具。

和只提供单一 SDK 的项目不同,Cua 更像一套完整的"让 agent 用电脑"的基础设施:你可以自带 agent 和模型,用它提供那台电脑和操作工具。README 里还提出了一个叫 Computer-Use 2.0 的概念,指的是 agent 在同一个任务里,能在代码、API 和图形界面之间来回切换,而不是死守一种交互方式。

几个核心部件值得分开看。

Cua Driver 负责操作能力。它给 agent 提供工具,用来检查并操控 macOS、Windows、Linux 上的原生桌面应用和浏览器,接入方式有 CLI、MCP 或带类型的 SDK 三种。有一个细节比较实用:在应用和平台支持的前提下,后台投递可以让 agent 干活时不移动你的鼠标指针、也不抢走窗口焦点。README 给出的第一个小目标,是让 agent 在计算器里算出 6 × 7,并自己确认界面显示的确实是 42。如果你在用 Claude Code、Codex、Cursor 或 OpenClaw,README 里有对应的接入指引。

Cua Fleets 负责环境。它在 run.cua.ai 上提供隔离的云桌面,一个 Fleet 会维持沙箱容量池,你的代码从池子里认领一台桌面,然后通过 Sandbox SDK 在里面执行命令、截图、与桌面应用交互。本地沙箱和云上的 Fleet 共用同一套 Sandbox SDK,但凭证、镜像、操作方式和运行时要求都不一样,README 专门提示要对照 runtime support 参考来选择环境。

Lume 负责本地虚拟化。它基于苹果的 Virtualization.Framework,在 Apple Silicon 上创建和管理本地 macOS 与 Linux 虚拟机。对应的第一个上手示例是:拉一个原版 macOS Tahoe 虚拟机、启动它、再通过 SSH 连上去。

Cua Bench 负责评估。你可以构建 computer-use 任务、评测 agent 的表现,并把执行轨迹导出用于训练。它的入门门槛设得很低:先跑一个模拟任务,这个过程不需要虚拟机、不需要 Docker、也不需要模型 API key。

CUA-S1 则是模型这一层。它是 Cua 自己的一组小型专用 System 1 模型,README 特意说明 System 1 只是个工程比喻,指那些快速、边界明确的判断,比如某个字段该填哪一个值、某个界面元素要不要动它,并不是对模型架构的严格分类,也不替代通用 agent 的规划推理。第一个研究方向的落点是表单:直接从结构化的界面元素和文档取值上打分做决策,而不是逐 token 生成回答;执行动作由应用代码编排,可选的 Cua Driver 集成负责在明确的动作边界内落地。仓库里包含 Python 模型代码、合成数据生成、训练和评估,属于早期的纯源码研究发布,模型权重单独放在 Hugging Face 上,源码是 MIT 许可。

安装方面,README 按部件分别给出了入口。Cua Driver 在 macOS 和 Linux 下执行:

bash

/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"

Windows 用 PowerShell:

powershell

irm https://cua.ai/driver/install.ps1 | iex

Lume 的安装脚本同样是一行:

bash

/bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"

Cua Bench 走 uv,需要提前准备好 Python 3.12 或 3.13,并装好 uv:

bash

uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium

云桌面则不需要本地安装,直接在 run.cua.ai 上开通 Fleet 即可。

从适用场景看,这类项目对做 computer-use 研究的团队最直接:需要一个可重复的环境来测 agent 的操作成功率,或者要把轨迹导出来当训练数据。做 agent 产品的开发者也能用上 Cua Driver 那一层,尤其是想让 agent 操作已经登录好的桌面软件、又不希望它一直抢占用户鼠标和焦点的场景。需要在 Mac 上跑本地虚拟机做隔离测试的人,Lume 本身就是个能独立使用的工具。

需要留意的是,Cua 不是装完就能对话的产品,而是若干个可以独立使用的部件组合,混着用时要注意各自的运行时要求并不相同——比如云上的 Fleet 和本地沙箱,凭证与镜像就不通用。Cua Bench 明确要求 Python 3.12 或 3.13;Lume 依赖 Apple Silicon 和苹果的虚拟化框架;CUA-S1 属于研究性质的早期发布,权重需要另行从 Hugging Face 获取。许可证上主体是 MIT,但第三方组件各有自己的许可,特别是可选的 cua-agent[omni] 会引入 AGPL-3.0 的 ultralytics,商用前值得先看清楚。

总的来说,Cua 把 computer-use agent 落地时散落在各处的几个环节——操作、环境、虚拟化、决策模型、评估——收进了同一个仓库,而且每个部件都能单独拿出来用。对于想让 AI 真正去"用"一台电脑的开发者来说,它提供的是一块相当完整的拼图。

拆解AI,遇见下一个十年。

相关学习资料