夜雨聆风学习资料网

ARTICLE · 1085041

千问一次放出三款手机智能体:跨App办事端到端成功率90%,一句话出图只要3秒

千问一次放出三款手机智能体:跨App办事端到端成功率90%,一句话出图只要3秒

Qwen Intelligence 在 9月23日发布,一次推出三款智能体,官方都标了 SOTA。三款各管一段:一款负责规划,一款负责把事做完,一款负责出成品。这个切法对应的是移动端智能体最容易露馅的三个环节——想不明白、做不到位、交不出东西。

Mobile Planner Agent 管规划和拆解,把复杂任务拆成可执行的步骤再编排调度,在 MobilePA-Bench、MobilePA-Bench Business 和 Memory 三项评测上都拿了第一。Mobile-Use Agent 管执行,路线是 API 优先、GUI 兜底——能用接口就直接调接口,调不动再退回模拟点击操作屏幕。它的成绩单是 MobileWorld 82.1、MobileWorld-Real 92.2、AndroidDaily 97.2,端到端成功率 90%。Mobile Creative Agent 管产出,一句话生成可用图片耗时约 3 秒,官方称比同类领先产品快约两倍。

这些数字全部来自千问自己,发布里没有第三方复现。但这次他们把尺子也交了出去:MobilePA-Bench、MobileWorld、MobileWorld-Real、MobileWorld-Safety 四套基准同时开放,覆盖规划、跨应用执行、真机性能和安全性。MobilePA-Bench 是交互式、带状态、工具驱动的基准,含 1705 个评测任务、212 个真实工具和 13 个功能领域,任务在可持久化环境中执行,验证 API 调用是否准确可恢复。MobileWorld 有横跨 20 个应用的 201 个任务,重点测长链路执行和跨应用工作流,要求智能体主动澄清模糊需求,并结合 GUI 操作与外部 MCP 工具调用。

开放基准这件事比分数本身更有分量。过去厂商自评成绩,外界要么全信要么全不信,现在别家实验室可以直接跑同一套题去核。这也意味着千问把自己放到了一个会被复查的位置上,尤其 Safety 那一套是明确给外部挑错用的。

定价分两档。标准版连续包月原价 98 元,八折后 78 元,每月含 2000 点基础积分、10GB 云端存储、可发布 10 个网页。积分制意味着重度使用要另算,跨 App 的长链路任务是消耗大户,真要用起来建议先跑几天看看自己的积分流速。

使用场景上,官方列了一句出图、自主决策、开发轻应用、长时程任务交付。落到实处,最容易被感知的是两类:一类是跨 App 的琐事,比如从聊天记录里提取地址再下单、把几个应用里的信息汇总成一张表,这类活人做起来烦但规则清晰,正是智能体擅长的;另一类是即时出图,3 秒这个量级让它从"提交任务等结果"变成了"边想边看"。

判断值不值 78 元有个简单办法:数一数每周有多少件需要在手机上跨三四个应用才能办完的事。超过十件,把它们压缩成一句话大概率是划算的;如果主要是聊天和查资料,现成的免费助手已经够用。至于 90% 的端到端成功率,要按"十次里有一次会卡住"来理解——卡住时通常是某个应用的界面结构变了,需要人工接管那一步。

相关学习资料