📌 核心价值:OSWorld 是第一个在真实桌面系统里考核 AI 智能体"动手操作电脑"能力的开源基准——369 个真实任务、134 个执行式评估函数,给出可复现的通过率。
你的 AI 助手到底会不会用电脑?不是看它会不会聊天,而是看它能不能打开浏览器订营地、用 LibreOffice 做PPT、在终端敲命令、再把结果邮件发出去。OSWorld 把这道题标准化了。

OSWorld(xlang-ai/OSWorld,NeurIPS 2024)是一个可扩展的真实计算机环境基准,专门用来评测多模态智能体在开放式电脑任务上的能力。它不是在模拟器里比划,而是把智能体放进真实的 Ubuntu / Windows / macOS 虚拟机,让它像人一样操作鼠标、键盘和各类原生应用。
核心定位:它是目前"电脑操作智能体(Computer-Use Agent)"领域事实上的标尺——Anthropic Computer Use、OpenAI Operator、Google Mariner 等消费级产品的能力,几乎都要拿 OSWorld 的成绩说话。
OSWorld 基于真实环境,提供任务初始化、执行式评估(execution-based evaluation)和交互式学习三大能力,覆盖任意原生应用,而不局限于某个网站或某个软件。它一共构建了369 个真实电脑任务(另有 43 个 Windows 专属任务用于分析),每个任务都来自真实使用场景,并配有可复现的初始化配置与自定义评估脚本。
✨ 核心功能一览
OSWorld 的任务横跨六大领域,从办公到多应用协作一应俱全:

•真实可执行环境:在 VMware / VirtualBox / Docker / AWS 等真实虚拟机里运行,支持并行评估(AWS 并行可把评估压进 1 小时) •统一动作空间:基于 PyAutoGUI 的通用动作原语(点击、输入、拖拽、快捷键、滚动),智能体可生成任意复杂行为 •多模态观测:完整桌面截图(最高 1920×1080)+ 无障碍树(A11y)+ 终端输出,匹配不同智能体的输入偏好 •执行式评估:134 个程序化评估函数,检查文件修改、配置变更、树结构,验证"是否真做完了"而非"猜对了动作" •跨平台:Ubuntu / Windows / macOS 全覆盖,支持无头(headless)运行
🛠️ 快速上手:5 分钟跑通示例
安装与准备
# 1. 克隆仓库git clone https://github.com/xlang-ai/OSWorld.gitcd OSWorld# 2. 创建虚拟环境并安装依赖python -m venv venvsource venv/bin/activate # Windows: venv\Scripts\activatepip install -e .# 3. 准备虚拟机镜像(VMware / VirtualBox / Docker 任选)# 默认凭据:用户名 user,密码 password一键快速启动
# 用 VMware 启动一个评估环境python quickstart.py --provider_name vmware \ --path_to_vm "path/to/your/osworld.vmx"# 成功标志:终端打印"环境设置完成",监控界面 http://localhost:8080 可访问自定义任务配置(真实 JSON 结构)
每个任务都是一个标准化描述文件,智能体读完就能开工:
{ "id": "multi_apps_123", "instruction": "打开 Chrome 访问 example.com,把首页标题复制到 LibreOffice 新建文档并保存为 title.odt", "config": [ {"type": "launch", "parameters": {"command": "google-chrome"}}, {"type": "launch", "parameters": {"command": "libreoffice --writer"}} ], "evaluation": { "func": "check_file_exist", "expected": {"path": "~/Documents/title.odt"} }}注意:8 个 Google Drive 相关任务因网络依赖可能需要手动配置,可用 361 个任务子集评估,结果与官方榜单一致。
📊 与竞品对比
和其它数字智能体基准相比,OSWorld 的最大差异是"整台桌面"而非"单个网站":

•WebArena / VisualWebArena:只在自托管 Web 应用里测,不碰原生桌面程序;OSWorld 把浏览器只是当成六大任务域之一 •Mind2Web:基于真实网站但只比对动作序列,不做端到端状态校验;OSWorld 用执行式评估验证真实结果 •AgentBench:多环境但桌面覆盖浅;OSWorld 在真实 OS 上做到 134 个细粒度评估函数
💡 适用场景
场景 1:评测你的 Computer-Use 智能体

功能说明:把自研或第三方智能体(如 UI-TARS、Claude、Gemini、Qwen-VL)接入 OSWorld,跑 369 个任务拿到可复现成功率。输入要求:智能体需实现step(observation) -> action 接口,能消费截图 / 无障碍树。输出效果:show_result.py 汇总成功率,manual_examine.py 人工核查,给出客观榜单成绩。适用场景:高校实验室、AI 公司研发部门、Agent 产品上线前的横向对比。
场景 2:用真实数据看"AI 离人还有多远"

功能说明:OSWorld 公布的任务总数、平台分布、评估函数数量一目了然。输入要求:无,直接看官方公开数据。输出效果:直观看到 benchmark 规模与覆盖度。适用场景:写技术报告、做竞品调研、向团队证明"电脑操作智能体仍有巨大提升空间"。
场景 3:按应用域拆解能力短板

功能说明:按应用域和操作类型展示任务指令分布,定位智能体最弱的一环。输入要求:无,直接看官方公开数据。输出效果:发现"跨应用工作流"类任务成功率显著低于单应用任务。适用场景:制定下一阶段研发重点、向投资人讲清楚技术差距。
用户群体总结
• ✅AI 研究员 / 实验室:需要标准化、可复现的电脑操作评测环境 • ✅Agent 产品团队:上线前用统一标尺横向对比自研模型 • ✅技术决策者:用真实数据判断 Computer-Use 方案的成熟度 • ❌不适合:只想"一键让 AI 帮我干活"的普通用户(它是评测环境,不是开箱即用的桌面助手)
💰 定价方案
OSWorld 本身完全开源,Apache-2.0 协议,免费自托管,代码与任务集全部公开。
•本地部署:VMware / VirtualBox / Docker 免费,仅需自备虚拟机镜像与算力 •云端并行:AWS / Modal / Daytona 等按用量计费,官方已支持把评估压进 1 小时 •OSWorld-Verified(2025-07 升级版):修复 300+ 社区问题、强化评估鲁棒性,当前主流榜单均以此版本为准
开源协议:Apache-2.0
💡 新用户福利:直接 clone 仓库即可免费跑通 quickstart,无需注册、无需 API Key。
🎯 总结
OSWorld 把"AI 会不会用电脑"这件事,从玄学变成了可量化的工程指标。它用 369 个真实任务、134 个执行式评估函数,逼着每一个 Computer-Use 智能体在真实桌面里现原形——这也是为什么 Anthropic、OpenAI、Google 的电脑操作产品都拿它当成绩榜。
推荐指数: ⭐⭐⭐⭐⭐(满分5星,电脑操作智能体评测的事实标准)
适合人群: AI 研究员、Agent 产品团队、技术决策者
立即体验:OSWorld GitHub | 官方基准站
数据截至 2026-08-23,最新信息请以官网为准。
夜雨聆风