乐于分享
好东西不私藏

OSWorld:让AI真正动手操作电脑

OSWorld:让AI真正动手操作电脑

📌 核心价值:OSWorld 是第一个在真实桌面系统里考核 AI 智能体"动手操作电脑"能力的开源基准——369 个真实任务、134 个执行式评估函数,给出可复现的通过率。

你的 AI 助手到底会不会用电脑?不是看它会不会聊天,而是看它能不能打开浏览器订营地、用 LibreOffice 做PPT、在终端敲命令、再把结果邮件发出去。OSWorld 把这道题标准化了。


OSWorld(xlang-ai/OSWorld,NeurIPS 2024)是一个可扩展的真实计算机环境基准,专门用来评测多模态智能体在开放式电脑任务上的能力。它不是在模拟器里比划,而是把智能体放进真实的 Ubuntu / Windows / macOS 虚拟机,让它像人一样操作鼠标、键盘和各类原生应用。

核心定位:它是目前"电脑操作智能体(Computer-Use Agent)"领域事实上的标尺——Anthropic Computer Use、OpenAI Operator、Google Mariner 等消费级产品的能力,几乎都要拿 OSWorld 的成绩说话。

OSWorld 基于真实环境,提供任务初始化、执行式评估(execution-based evaluation)和交互式学习三大能力,覆盖任意原生应用,而不局限于某个网站或某个软件。它一共构建了369 个真实电脑任务(另有 43 个 Windows 专属任务用于分析),每个任务都来自真实使用场景,并配有可复现的初始化配置与自定义评估脚本。


✨ 核心功能一览

OSWorld 的任务横跨六大领域,从办公到多应用协作一应俱全:

  • 真实可执行环境:在 VMware / VirtualBox / Docker / AWS 等真实虚拟机里运行,支持并行评估(AWS 并行可把评估压进 1 小时)
  • 统一动作空间:基于 PyAutoGUI 的通用动作原语(点击、输入、拖拽、快捷键、滚动),智能体可生成任意复杂行为
  • 多模态观测:完整桌面截图(最高 1920×1080)+ 无障碍树(A11y)+ 终端输出,匹配不同智能体的输入偏好
  • 执行式评估:134 个程序化评估函数,检查文件修改、配置变更、树结构,验证"是否真做完了"而非"猜对了动作"
  • 跨平台:Ubuntu / Windows / macOS 全覆盖,支持无头(headless)运行

🛠️ 快速上手:5 分钟跑通示例

安装与准备

# 1. 克隆仓库git clone https://github.com/xlang-ai/OSWorld.gitcd OSWorld# 2. 创建虚拟环境并安装依赖python -m venv venvsource venv/bin/activate        # Windows: venv\Scripts\activatepip install -e .# 3. 准备虚拟机镜像(VMware / VirtualBox / Docker 任选)#    默认凭据:用户名 user,密码 password

一键快速启动

# 用 VMware 启动一个评估环境python quickstart.py --provider_name vmware \    --path_to_vm "path/to/your/osworld.vmx"# 成功标志:终端打印"环境设置完成",监控界面 http://localhost:8080 可访问

自定义任务配置(真实 JSON 结构)

每个任务都是一个标准化描述文件,智能体读完就能开工:

{  "id": "multi_apps_123",  "instruction": "打开 Chrome 访问 example.com,把首页标题复制到 LibreOffice 新建文档并保存为 title.odt",  "config": [    {"type": "launch", "parameters": {"command": "google-chrome"}},    {"type": "launch", "parameters": {"command": "libreoffice --writer"}}  ],  "evaluation": {    "func": "check_file_exist",    "expected": {"path": "~/Documents/title.odt"}  }}

注意:8 个 Google Drive 相关任务因网络依赖可能需要手动配置,可用 361 个任务子集评估,结果与官方榜单一致。


📊 与竞品对比

和其它数字智能体基准相比,OSWorld 的最大差异是"整台桌面"而非"单个网站":

  • WebArena / VisualWebArena:只在自托管 Web 应用里测,不碰原生桌面程序;OSWorld 把浏览器只是当成六大任务域之一
  • Mind2Web:基于真实网站但只比对动作序列,不做端到端状态校验;OSWorld 用执行式评估验证真实结果
  • AgentBench:多环境但桌面覆盖浅;OSWorld 在真实 OS 上做到 134 个细粒度评估函数

💡 适用场景

场景 1:评测你的 Computer-Use 智能体

功能说明:把自研或第三方智能体(如 UI-TARS、Claude、Gemini、Qwen-VL)接入 OSWorld,跑 369 个任务拿到可复现成功率。输入要求:智能体需实现step(observation) -> action 接口,能消费截图 / 无障碍树。输出效果show_result.py 汇总成功率,manual_examine.py 人工核查,给出客观榜单成绩。适用场景:高校实验室、AI 公司研发部门、Agent 产品上线前的横向对比。


场景 2:用真实数据看"AI 离人还有多远"

功能说明:OSWorld 公布的任务总数、平台分布、评估函数数量一目了然。输入要求:无,直接看官方公开数据。输出效果:直观看到 benchmark 规模与覆盖度。适用场景:写技术报告、做竞品调研、向团队证明"电脑操作智能体仍有巨大提升空间"。


场景 3:按应用域拆解能力短板

功能说明:按应用域和操作类型展示任务指令分布,定位智能体最弱的一环。输入要求:无,直接看官方公开数据。输出效果:发现"跨应用工作流"类任务成功率显著低于单应用任务。适用场景:制定下一阶段研发重点、向投资人讲清楚技术差距。


用户群体总结

  • • ✅AI 研究员 / 实验室:需要标准化、可复现的电脑操作评测环境
  • • ✅Agent 产品团队:上线前用统一标尺横向对比自研模型
  • • ✅技术决策者:用真实数据判断 Computer-Use 方案的成熟度
  • • ❌不适合:只想"一键让 AI 帮我干活"的普通用户(它是评测环境,不是开箱即用的桌面助手)

💰 定价方案

OSWorld 本身完全开源,Apache-2.0 协议,免费自托管,代码与任务集全部公开。

  • 本地部署:VMware / VirtualBox / Docker 免费,仅需自备虚拟机镜像与算力
  • 云端并行:AWS / Modal / Daytona 等按用量计费,官方已支持把评估压进 1 小时
  • OSWorld-Verified(2025-07 升级版):修复 300+ 社区问题、强化评估鲁棒性,当前主流榜单均以此版本为准

开源协议:Apache-2.0

💡 新用户福利:直接 clone 仓库即可免费跑通 quickstart,无需注册、无需 API Key。


🎯 总结

OSWorld 把"AI 会不会用电脑"这件事,从玄学变成了可量化的工程指标。它用 369 个真实任务、134 个执行式评估函数,逼着每一个 Computer-Use 智能体在真实桌面里现原形——这也是为什么 Anthropic、OpenAI、Google 的电脑操作产品都拿它当成绩榜。

推荐指数: ⭐⭐⭐⭐⭐(满分5星,电脑操作智能体评测的事实标准)

适合人群: AI 研究员、Agent 产品团队、技术决策者

立即体验:OSWorld GitHub | 官方基准站

数据截至 2026-08-23,最新信息请以官网为准。