ARTICLE · 1091531
AI 会自己"点屏幕"了:它到底能干哪些活、靠不靠谱、边界在哪
8 月 20 日,阿里千问发布了一个叫 Qwen-UI-Agent 的东西。一句话翻译,AI 不只是会聊天了,它会"看屏幕"了。它能像你一样打开手机 App、点按钮、翻页面、填表格,把一堆本来要人肉操作的活儿,自己给干了。
这条新闻出来,网上大多当"又发布了个模型"划过去了,或者反过来吓唬人:"你的工作要没了"。这篇不聊焦虑,只把一件事讲清楚:这个会"点屏幕"的 AI,到底能干哪些活、成绩单有多硬、安全机制怎么设计的,以及它现在还做不到什么。
01它到底能干什么?举几个真例子
先别管技术名词,看几个具体的活儿:
你跟它说:"帮我查北京到杭州西最早那班高铁几点到,再算算我几点能到公司,最后在钉钉上建个会,主题'出差归来项目同步',参会人就我和张三,提前 5 分钟提醒。"
它不会查完撂下一句"你自己去弄",会直接上手:打开 12306 查票、开地图算时间、再进钉钉真把会议建好、人拉进来、提醒设好。全程像雇了个手脚麻利的助理。
再比如:"手机相册里找到所有收据,挪到电脑桌面 receipts 文件夹,按日期重命名,再做个 Excel 汇总账单。"它也照做,手机翻相册、跨到电脑、整理文件、建表格,一条龙。
这背后有个关键投入:阿里为训练它,搭了 100 多台真实手机、150 多款真实 App 的真机集群,还自建了"真机成功率"评测基准(400 多个任务、100 多款应用)。为什么非要真机?因为过去两年 AI 操作界面的方案,模拟器里分数好看,一到真机就翻车,弹窗、权限、网络波动、页面加载慢,这些"真实世界的脏活累活",只有真机才碰得到。

02成绩单:数字很硬,但得会读
看看它交出的基准成绩(来源:阿里官方技术报告、新浪科技 / IT之家 8 月 20 日报道):
• 手机端任务成功率:82.1%(MobileWorld 基准)
• 真机环境成功率:92.2%(MobileWorld-Real,阿里自建真机基准)
• 日常安卓操作:97.5%(AndroidDaily,接近满分)
• 电脑端操作:79.5%(OSWorld-Verified)
• 网页操作:73.6%(WebArena,同赛道第一)
• 界面元素精准定位:81.5%(ScreenSpot-Pro,另外 4 个定位基准也全部刷新纪录)
对比对象是谁?GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro 这些海外旗舰,多数场景它都赢了。
但要说清楚:这些数字是公开基准上的平均成功率,不是"每个任务都行"。比如网页操作 73.6%,意味着每 4 个网页任务里大概有 1 个它会卡住。看成绩得带着这个前提。
更狠的是干活方式:鼠标键盘和命令行混着用。电脑任务里接近一半动作直接走命令行,批量改名、跑脚本、处理数据,比人手动点快得多;一次决策能同时输出多个操作,执行步数砍掉一大截。还能连续干长活:支持 100 步以上的超长任务,官方演示里有个 170 步的调研任务,它自己上网查资料、交叉核验、生成 Excel/PPT/Word,还检查排版改了好几轮。

03它怎么做到的:说人话的技术细节
几个普通人能听懂的点:
第一,真机训练。前面说的 100+ 手机、150+ App 集群,是它"见过真实世界"的底子。很多同类产品在模拟器里练出来,到了真机弹个窗就懵;它是在真机上被"磨"出来的。
第二,GUI 和命令行混合决策。碰到"点按钮"就用界面操作,碰到"批量处理文件"就直接调命令行,哪种快用哪种,不是死板地只模拟点击。
第三,开源可复现。模型和报告都放出来了(技术报告编号 arXiv 2607.28227),意味着别的研究者能自己跑、自己验证,不是黑箱吹牛。

04安全这块,它被"焊死"了
你可能会担心:让它随便点屏幕,会不会乱来?
官方讲了安全设计,而且是在真机上跑过的实测(6 个危险任务):2 个直接拒绝,比如"教我做炸药""群发消息拉人去缅甸旅游",一步没做直接终止;4 个在关键处停手,比如给家人发红包(涉及钱)、删文件(涉及数据)、授权登录(涉及隐私),它都会停下来问你要不要继续,不擅自决定。
也就是说:危险的活儿不接,敏感的操作先问你。 这一条决定了它能不能真的被人放心用起来。
05它现在还做不到什么
别神话。目前看,边界很清楚:
•长链条里的"意外"会卡住它。170 步演示很漂亮,但真实业务里遇到验证码、动态加载、临时弹窗、需要滑块验证,它容易断。基准高分不等于真实场景满分。
•复杂权限和隐私环节,它必须人来拍板。发钱、删数据、授权登录,这些它设计上就停手。越敏感的地方,越离不开人。
•它还是"模型 + 演示",离产品化有距离。目前放出的是技术报告和基座能力,企业要把它接进自己的系统、做成普通人能用的产品,还要做大量工程。从部署现状看,开发者已经能在开源权重上自己跑通基础能力,但面向普通用户的封装产品(比如"一句话帮你操作电脑"的客户端)还没有成熟版本,短期内别指望装个 App 就能全自动。

写在最后
技术意义上,Qwen-UI-Agent 把"操作软件"的门槛,从"得会写代码、写自动化脚本",降到了"会说人话"。那些过去没有接口、但必须有人盯着点屏幕的活儿,跨系统录入、多平台比价、客服查单、文件搬运,第一次有了通用的"看着屏幕就能模仿人做"的解法。
但它解决的,是"重复、确定、没人愿意天天点"的那部分;遇到要判断、要担责、要应对意外的环节,还是得人上。对普通人来说,更现实的一件事是:以后这类"跨系统搬运、填表提交"的琐事,可能真能交给它跑,前提是,你得先想清楚,哪些活儿值得交给它,哪些环节必须自己留着。
你工作里最烦的那种"纯手动"活儿是什么?评论区说说,看看哪些已经能用这路 AI 替你跑起来。
#AI智能体 #GUI智能体 #AI工具
数据来源:阿里云官方发布(Qwen-UI-Agent 技术报告及演示,编号 arXiv 2607.28227)、新浪科技 2026-08-20《阿里发布 Qwen-UI-Agent》、IT之家 2026-08-20 报道、中关村在线 AI 频道 2026-08-20 报道。