前两天,豆包电脑版悄悄上了个新功能,叫「虚拟桌面」——让豆包看到你的电脑屏幕,像人一样用鼠标键盘操控电脑。这能力业内有个专门的名字:CUA,Computer-Use Agent,计算机使用智能体。



为什么单独拎出来说?因为有了 CUA,几乎所有"人能操作的软件",AI 现在也能操作了,不需要额外接口。
举个最直接的例子:微信。Agent 没法直接调用微信的接口,但有了 computer use,AI 能直接"看"到微信里的内容,还能替你点鼠标、敲键盘发消息。
其实 OpenAI 和 Anthropic 很早就把 computer use 做进了自家产品。用过 Codex 和 Claude Code 的应该不陌生。按业内常引用的数据,Claude 在桌面操作基准 OSWorld(专门测 AI 能不能像人一样操作电脑的权威榜单,丢一堆真实桌面任务看完成率)上能跑到 72.5% 左右。

国内为什么缺席?差的是"模型底座"
很长一段时间,国内没一家头部 agent 跟上——大模型卷得这么凶,偏偏这块缺席,挺奇怪。
原因在于:computer use 不是接个工具就行,它依赖一种"原生 CUA 大模型"。
什么意思?现在很多多模态模型确实有视觉能力,能截屏识别内容,但它们并不知道具体该怎么操作电脑。真正的 CUA 要"看得懂界面上的按钮、菜单、输入框是干嘛的",还能输出"点哪个坐标、输入什么字"这种具体动作——这块需要专门训练。
打个比方,人都有眼睛,可不是人人都会用电脑;有人会用 Windows 但对 macOS 的操作逻辑就很懵;有人精通 PR,有人玩转达芬奇——这是对某种界面或者说是软件的"操作经验"。
大模型也一样,看得见屏幕,未必懂那些按钮、菜单是干嘛的,操作起来磕磕绊绊甚至乱点。所以"有眼睛"不等于"会用电脑"。
OpenAI 和 Anthropic 早就开始训练自家 AI 认识并使用操作界面了,所以能在 Codex 和 Claude Code 里直接用上。国内此前缺的不是产品,缺的就是这个"模型底座"。
豆包这次,大概率用的是 UI-TARS
字节 Seed 团队从 2025 年 1 月开始,和清华一起开源了一个叫UI-TARS的 GUI 智能体模型。字节官方当时就写明,UI-TARS 的目标之一是"让豆包这样的平台能替用户完成更复杂的任务";后来媒体也扒出,去年底跟中兴合作发布的豆包手机助手,底层用的正是 UI-TARS 的闭源版。


所以豆包电脑版这个「虚拟桌面」,虽然字节没公开具体用了哪个模型,但大概率出自同一条技术脉络。
差不多同一时间,阿里也放出了自家原生 CUA 大模型 Qwen-CUA,在 OSWorld-Verified 上跑到了 86.2 分(更大的 Qwen-CUA-Max 是 87.6)。到 2026 年 8 月这个节点,国内已经有两家能拿出手的原生 CUA 大模型了。
不止是技术能力
CUA 的逻辑是"不靠接口、直接操作界面",等于绕开了某些超级 App 自己修的墙——你不用打开首页、不用看推荐流,不用看广告,AI 直接帮你操作、下单。超级 App 花十年建起来的"入口"和"流量闭环",第一次被人从底层绕过去了。所以 CUA 不只是个技术能力,它是在重写软件和用户之间的关系。这才是这件事真正值得追下去的地方。
夜雨聆风