ARTICLE · 1079352
手机AI如何替我操作App?——从荣耀YOYO接入阿里千问说起
以前我们使用手机,基本都是这样的:
打开淘宝,搜索商品。
打开地图,查路线。
打开微信,找人聊天。
打开外卖App,点餐。
每一个App,都需要我们自己找到、自己操作。
但现在,手机正在出现一种新的使用方式:
你不一定需要知道“应该打开哪个App”,甚至不一定需要自己一步一步点击。
你只需要告诉AI:
“帮我订明天北京到上海的高铁,二等座,尽量早点到。”
AI开始理解你的需求,然后自己寻找能够完成任务的能力。
这背后发生了什么?
最近荣耀YOYO与阿里千问的相关能力,让这个问题变得非常值得了解。
因为这已经不只是“手机里多了一个AI聊天机器人”。
而是一个更大的变化:
AI正在从“告诉你怎么做”,变成“帮你把事情做完”。
一、以前的AI:告诉你怎么做
假设你问AI:
“明天北京到上海怎么坐高铁?”
传统AI可能告诉你:
可以通过12306查询北京到上海的高铁车次,选择日期和座位,然后完成购票。
答案没有问题。
但最后还是要你自己操作。
你需要:
打开App → 搜索 → 选择日期 → 选择车次 → 选择乘客 → 付款。
AI只是提供了信息。
而Agent的目标,是进一步完成任务。
你告诉它:
“帮我订明天北京到上海的高铁,二等座,尽量早点到。”
它需要自己完成一系列工作:
理解需求 → 查询车次 → 筛选符合条件的车次 → 找到对应能力 → 执行操作 → 返回结果 → 在涉及敏感操作时请求确认。
这就是 AI Agent(智能体) 和普通聊天AI之间一个很重要的区别。
二、手机Agent到底多了什么?

可以把一个手机Agent简单理解成三个部分:
① 入口
你通过YOYO这样的系统入口告诉AI:
“帮我做一件事情。”
② 大脑
背后的大模型负责理解你的语言。
比如:
“明天北京到上海,二等座,尽量早点到。”
模型需要提取出:
• 出发地:北京 • 目的地:上海 • 日期:明天 • 座位:二等座 • 偏好:尽量早
然后判断:
完成这个任务,需要调用哪些能力?
③ 能力和执行
这才是最关键的地方。
AI本身并不能凭空订票。
它需要调用外部能力。
这些能力可能来自:
• MCP工具 • API • 系统能力 • App提供的接口 • DeepLink • GUI操作 • 蓝牙设备控制 • 智能家居 • 其他专门的设备或服务
所以真正的Agent并不是:
大模型 + 一个聊天框
而更接近:
大模型 + 工具 + 执行环境 + 权限控制
三、这里最重要的一个概念:MCP
如果你最近关注AI Agent,应该经常看到一个词:
MCP。
它全称是:
Model Context Protocol
可以简单理解成:
让AI以一种统一的方式发现和调用外部工具的协议。
以前,每个AI平台接工具,可能都有自己的一套方式。
有的叫Plugin。
有的提供Function Calling。
有的自己设计接口。
MCP试图解决的是:
能不能让AI和外部工具之间,有一种相对统一的“沟通方式”?
四、MCP到底怎么工作的?

还是拿刚才的例子:
“帮我查明天北京到上海的高铁。”
假设有一个铁路查询服务提供了一个MCP Server。
它向AI告诉:
我这里有一个工具,叫
search_train。
AI首先可以获取工具列表。
例如:
{ "tools": [ { "name": "search_train", "description": "查询两个城市之间的火车票", "inputSchema": { "type": "object", "properties": { "from": { "type": "string", "description": "出发城市" }, "to": { "type": "string", "description": "到达城市" }, "date": { "type": "string", "description": "出发日期,格式 YYYY-MM-DD" } }, "required": ["from", "to", "date"] } } ]}这一步可以简单理解为:
“你有什么能力?”
工具告诉AI:
我能查火车票。
而且还告诉AI:
使用我需要哪些参数。
五、然后AI决定调用哪个工具
用户说:
“帮我查明天北京到上海的高铁。”
AI理解之后,就可以调用:
{ "name": "search_train", "arguments": { "from": "北京", "to": "上海", "date": "2026-09-25" }}这一步相当于:
“我决定使用你的查票能力,而且这些是我要传给你的参数。”
然后MCP Server再去调用真正的业务系统。
例如:
铁路查询服务 → 查询数据库/API → 得到车次 → 返回结构化结果。
可能返回:
{ "trains": [ { "trainNumber": "G101", "departure": "07:00", "arrival": "11:36", "secondClassAvailable":true }, { "trainNumber": "G103", "departure": "07:30", "arrival": "12:05", "secondClassAvailable":true } ]}AI拿到结果之后,再继续思考。
例如:
“用户要求尽量早点到,那么G101更符合要求。”
如果下一步是购买,就可能继续调用其他工具。
六、所以MCP并不是“AI直接控制App”
这里很容易产生一个误解。
MCP ≠ AI直接点击App。
MCP更像是:
AI和外部工具之间的一种标准化沟通方式。
例如:
用户 ↓YOYO ↓大模型 ↓Agent ↓发现工具 ↓MCP ↓MCP Server ↓业务服务 / API / 数据 ↓返回结构化结果 ↓Agent继续执行而且一个MCP Server也不一定属于某个手机App。
它完全可以是一个独立的服务。
所以更准确的理解是:
App可以提供能力,但MCP本身并不等于App API。
七、那DeepLink又是什么?
还有一个经常和Agent联系在一起的东西:
DeepLink。
它和MCP解决的问题不一样。
DeepLink更像是:
告诉手机“打开某个App里的某个功能”。
比如一个App支持:
someapp://train/search?from=北京&to=上海&date=2026-09-25AI就可以通过这个链接直接进入对应页面。
以前可能需要:
打开App→ 找到火车票→ 点击查询→ 输入北京→ 输入上海→ 选择日期
现在可以直接进入指定功能。
所以可以把它简单理解成:
它们可以配合使用,但不是简单的“谁失败了就一定换下一个”。
八、那GUI Agent又是什么?
如果一个App没有提供足够的结构化工具怎么办?
还有一种办法:
直接操作界面。
这就是GUI Agent。
例如AI看到手机屏幕:
┌─────────────────────┐│ 12306 ││ ││ 北京 上海 ││ ││ 2026-09-25 ││ ││ 查询 │└─────────────────────┘它可以识别:
• 输入框在哪里 • 查询按钮在哪里 • 列表在哪里 • 哪个车次符合条件
然后执行:
点击 → 输入 → 滑动 → 选择 → 返回。
这和人操作手机的方式就非常接近了。
所以:
MCP更像“调用能力”,GUI更像“操作界面”。
九、为什么GUI Agent很重要?
因为现实世界的App太复杂了。
不可能所有App都提前为每一种AI任务提供标准化接口。
如果AI只能调用API:
没有API的App怎么办?
如果AI只能依赖MCP:
没有MCP能力怎么办?
GUI Agent提供了另一条路径:
只要人能够通过界面完成,AI理论上也可以学习如何操作这个界面。
当然,这种方式对视觉理解、操作准确率、安全权限等要求都更高。
因此未来手机Agent很可能不是单纯依赖某一种方式。
而是根据任务选择不同的执行能力。
十、Skills又是什么?
还有一个容易和MCP混在一起的概念:
Skills。
它可以简单理解成:
把某一类任务或能力封装起来,让Agent知道“这件事情应该怎么做”。
比如一个旅行Skill,可以包含:
查询交通 → 查询酒店 → 比较时间 → 整理行程
而MCP更偏向:
“我这里有一个可以查询酒店的工具。”
所以两者并不是简单的替代关系。
可以粗略理解:
Skill更偏向“能力/任务怎么组织”,MCP更偏向“工具怎么被发现和调用”。
具体实现方式会根据不同平台而不同。
十一、手机Agent不只是“操作App”
这里还有一个很容易被忽略的地方。
荣耀公开的开发能力,并不只有GUI任务自动执行。
还包括一些其他类型的能力,例如:
也就是说:
手机Agent并不只是“帮你点App”。
它正在逐渐连接:
手机系统 + App + 外部服务 + 智能设备
这时候,手机本身就越来越像一个AI的控制中心。
十二、真正完整的流程是什么?

把前面的东西全部放在一起,就比较清楚了。
假设你说:
“晚上7点提醒我出门,提前帮我看看路况。”
AI可能会这样处理:
第一步:理解需求
用户真正想完成的是:
晚上7点出门,并提前获得路况信息。
第二步:拆解任务
Agent可能把任务拆成:
设置提醒+查询路线+获取实时路况第三步:寻找能力
它需要寻找:
系统提醒能力地图/路线能力实时交通信息能力第四步:调用工具
如果某个能力通过MCP提供:
tools/list ↓发现工具 ↓tools/call ↓MCP Server ↓业务服务 ↓返回结果如果需要打开App:
DeepLink ↓打开指定功能如果只能通过界面操作:
GUI Agent ↓识别界面 ↓点击 / 输入 / 滑动第五步:继续判断
假设地图返回:
当前路线预计需要45分钟。
Agent可以继续判断:
用户7点出门,现在应该提前多久提醒?
然后设置对应的提醒。
第六步:涉及敏感操作时请求确认
比如:
“要不要现在购买这张车票?”
AI可以把最后的决定交给用户。
这点非常重要。
Agent的目标不是替用户无限制地做决定,而是在授权范围内执行任务。
十三、这其实改变了我们使用手机的方式
过去的手机:
人 → App
我们想做一件事,先想:
“我应该打开哪个App?”
以后可能越来越接近:
人 → AI Agent → 能力
你甚至不需要知道:
“这个功能到底属于哪个App?”
你只需要说:
“帮我完成这件事。”
Agent自己去寻找合适的能力。
比如:
“帮我订明天的高铁。”
“把这几张照片整理成一个视频。”
“晚上7点提醒我出门,提前看看路况。”
“把客厅的灯打开。”
“帮我把这份资料总结一下,然后整理成邮件。”
这些事情背后可能涉及完全不同的App、系统能力和设备。
但对用户来说:
它们都可以变成一句话。
十四、所以手机AI真正的变化是什么?
以前我们讨论手机AI,经常关注:
模型参数多大?
跑分多少?
能不能生成图片?
能不能写文章?
这些当然仍然重要。
但Agent时代,多了一个非常关键的问题:
AI有没有“手”?
所谓“手”,不是一只真正的手。
而是:
AI有没有能够调用现实世界能力的接口。
MCP让AI更容易发现和调用工具。
API让AI可以访问具体服务。
DeepLink让AI可以进入App的特定功能。
GUI Agent让AI可以操作界面。
系统工具让AI可以调用手机自身能力。
蓝牙、智能家居、机器人等能力,则让AI进一步走出手机屏幕。
于是:
大模型 ↓理解 ↓Agent规划 ↓寻找能力 ↓调用工具 ↓执行任务 ↓获取结果 ↓继续规划 ↓完成任务这才是现在手机AI真正值得关注的地方。
最后
我们以前把手机理解成:
一个装满App的设备。
而Agent正在尝试把它变成:
一个可以被AI调度的能力集合。
你不需要记住哪个App在哪里,也不一定需要知道背后用了API、MCP还是GUI。
你只需要告诉它:
“我想完成什么。”
至于应该调用什么工具、打开什么服务、执行哪些步骤,越来越多的事情,可以交给Agent去完成。
当然,这条路还远没有走完。
准确性、权限、安全、隐私、跨App协作,以及不同平台之间的标准,都还需要继续解决。
但一个很明显的变化已经发生了:
手机正在从“我们操作App”,慢慢变成“AI帮我们使用手机”。