以前想让 AI 帮你订个咖啡、改个航班,只有两条路:这个 App 开了接口,AI 去调 API;没接口,这事就做不了。
8 月 20 日,阿里把第三条路跑通了:让模型直接看屏幕,像人一样点。
这个模型叫 Qwen-UI-Agent,一个 GUI 智能体基座。它不看代码接口,就看屏幕上有什么、按钮在哪,然后自己点。移动端、电脑端、网页、深度搜索,四类环境一起覆盖。
Agent 的三种形态,本质差在哪
我先把这事说透。Agent 操作一个软件,理论上只有三种走法。
第一种,调 API。前提是软件开了接口,Agent 最省事,但绝大多数存量 App 没这待遇。
第二种,重造流程。把旧软件推倒,做成 Agent 原生。这条路最彻底,也最贵,等于劝所有人换个新系统。
第三种,看屏幕。软件一行不改,Agent 像人一样盯着界面点。这条路的代价,是它得先「看懂」屏幕。
Qwen-UI-Agent 选的是第三条。它的破法很实在:搭了 100 多台真手机、150 多款 App 的真机环境,让模型在真实屏幕上训练,而不是只在截图仿真里转。

分数很亮,但要看清楚口径
官方给的分数确实漂亮:移动端 MobileWorld 82.1%,真机基准 MobileWorld-Real 92.2%,日常安卓任务 AndroidDaily 97.5%,电脑端 OSWorld-Verified 79.5%,浏览器任务 WebArena 73.6% 排第一。
但这里有个细节值得盯一下:通用基准 MobileWorld 只有 82.1%,阿里自建的真机基准 MobileWorld-Real 反而到了 92.2%。
自建的基准分数比公开基准还高,通常是任务难度和口径不一样,不是模型凭空更强。所以 92.2% 这个数,别拿去跟别人的 MobileWorld 直接比。能确认的是:它在「看屏幕操作」这条路上,做到了目前公开可比里的第一梯队,这个判断站得住。

图源:Qwen-UI-Agent 官方项目主页
真正让我觉得方向对的是两个动作设计。一是它不只会点,电脑任务里近一半动作走的是命令行 CLI,还支持一次输出多个动作。二是它的安全机制不是事后擦屁股:遇到支付、删数据、授权这类敏感操作,会在关键步骤主动停下问你。
这两点,才是 GUI Agent 从「能点」到「敢用」的分水岭。

图源:Qwen-UI-Agent 官方项目主页(tongyi-mai.github.io)
该把注意力放在哪
我的判断:这条路该跟,而且优先级比想象的高。
原因很简单,市面上 99% 的软件没有接口,却有界面。 GUI Agent 是唯一不需要软件配合、就能覆盖长尾场景的路线。阿里的聪明在于,它不赌某个 App 接不接它,它赌的是「看懂屏幕」这个通用能力本身。
给做产品的读者一句实在话:如果你手上有大量「没接口、靠人肉点」的存量业务,GUI Agent 是最现实的切入点。选型时别看总分,看两件事:一是敏感操作会不会主动停下来,二是长任务(几十步以上)会不会断。
看屏幕不是退而求其次,是绕开 API 死角。 这就是 C03 形态选型里,最容易被低估的一步棋。
本文是 AI Product Lab · 第 03 章「形态选型」 的一个案例。十六章全图与已发期数:见公众号菜单「Product Lab」。
事实核对自千问大模型官方公众号与 IT之家 8 月 20 日报道,benchmark 口径见IT之家[1]。
引用链接
[1] IT之家: https://www.toutiao.com/article/7676050621006660111/
夜雨聆风