夜雨聆风学习资料网

ARTICLE · 1079352

手机AI如何替我操作App?——从荣耀YOYO接入阿里千问说起

手机AI如何替我操作App?——从荣耀YOYO接入阿里千问说起

以前我们使用手机,基本都是这样的:

打开淘宝,搜索商品。

打开地图,查路线。

打开微信,找人聊天。

打开外卖App,点餐。

每一个App,都需要我们自己找到、自己操作。

但现在,手机正在出现一种新的使用方式:

你不一定需要知道“应该打开哪个App”,甚至不一定需要自己一步一步点击。

你只需要告诉AI:

“帮我订明天北京到上海的高铁,二等座,尽量早点到。”

AI开始理解你的需求,然后自己寻找能够完成任务的能力。

这背后发生了什么?

最近荣耀YOYO与阿里千问的相关能力,让这个问题变得非常值得了解。

因为这已经不只是“手机里多了一个AI聊天机器人”。

而是一个更大的变化:

AI正在从“告诉你怎么做”,变成“帮你把事情做完”。


一、以前的AI:告诉你怎么做

假设你问AI:

“明天北京到上海怎么坐高铁?”

传统AI可能告诉你:

可以通过12306查询北京到上海的高铁车次,选择日期和座位,然后完成购票。

答案没有问题。

但最后还是要你自己操作。

你需要:

打开App → 搜索 → 选择日期 → 选择车次 → 选择乘客 → 付款。

AI只是提供了信息。

而Agent的目标,是进一步完成任务。

你告诉它:

“帮我订明天北京到上海的高铁,二等座,尽量早点到。”

它需要自己完成一系列工作:

理解需求 → 查询车次 → 筛选符合条件的车次 → 找到对应能力 → 执行操作 → 返回结果 → 在涉及敏感操作时请求确认。

这就是 AI Agent(智能体) 和普通聊天AI之间一个很重要的区别。


二、手机Agent到底多了什么?

可以把一个手机Agent简单理解成三个部分:

① 入口

你通过YOYO这样的系统入口告诉AI:

“帮我做一件事情。”


② 大脑

背后的大模型负责理解你的语言。

比如:

“明天北京到上海,二等座,尽量早点到。”

模型需要提取出:

  • • 出发地:北京
  • • 目的地:上海
  • • 日期:明天
  • • 座位:二等座
  • • 偏好:尽量早

然后判断:

完成这个任务,需要调用哪些能力?


③ 能力和执行

这才是最关键的地方。

AI本身并不能凭空订票。

它需要调用外部能力。

这些能力可能来自:

  • • MCP工具
  • • API
  • • 系统能力
  • • App提供的接口
  • • DeepLink
  • • GUI操作
  • • 蓝牙设备控制
  • • 智能家居
  • • 其他专门的设备或服务

所以真正的Agent并不是:

大模型 + 一个聊天框

而更接近:

大模型 + 工具 + 执行环境 + 权限控制


三、这里最重要的一个概念:MCP

如果你最近关注AI Agent,应该经常看到一个词:

MCP。

它全称是:

Model Context Protocol

可以简单理解成:

让AI以一种统一的方式发现和调用外部工具的协议。

以前,每个AI平台接工具,可能都有自己的一套方式。

有的叫Plugin。

有的提供Function Calling。

有的自己设计接口。

MCP试图解决的是:

能不能让AI和外部工具之间,有一种相对统一的“沟通方式”?


四、MCP到底怎么工作的?

还是拿刚才的例子:

“帮我查明天北京到上海的高铁。”

假设有一个铁路查询服务提供了一个MCP Server。

它向AI告诉:

我这里有一个工具,叫 search_train。

AI首先可以获取工具列表。

例如:

{  "tools": [    {      "name": "search_train",      "description": "查询两个城市之间的火车票",      "inputSchema": {        "type": "object",        "properties": {          "from": {            "type": "string",            "description": "出发城市"          },          "to": {            "type": "string",            "description": "到达城市"          },          "date": {            "type": "string",            "description": "出发日期,格式 YYYY-MM-DD"          }        },        "required": ["from", "to", "date"]      }    }  ]}

这一步可以简单理解为:

“你有什么能力?”

工具告诉AI:

我能查火车票。

而且还告诉AI:

使用我需要哪些参数。


五、然后AI决定调用哪个工具

用户说:

“帮我查明天北京到上海的高铁。”

AI理解之后,就可以调用:

{  "name": "search_train",  "arguments": {    "from": "北京",    "to": "上海",    "date": "2026-09-25"  }}

这一步相当于:

“我决定使用你的查票能力,而且这些是我要传给你的参数。”

然后MCP Server再去调用真正的业务系统。

例如:

铁路查询服务 → 查询数据库/API → 得到车次 → 返回结构化结果。

可能返回:

{  "trains": [    {      "trainNumber": "G101",      "departure": "07:00",      "arrival": "11:36",      "secondClassAvailable":true    },    {      "trainNumber": "G103",      "departure": "07:30",      "arrival": "12:05",      "secondClassAvailable":true    }  ]}

AI拿到结果之后,再继续思考。

例如:

“用户要求尽量早点到,那么G101更符合要求。”

如果下一步是购买,就可能继续调用其他工具。


六、所以MCP并不是“AI直接控制App”

这里很容易产生一个误解。

MCP ≠ AI直接点击App。

MCP更像是:

AI和外部工具之间的一种标准化沟通方式。

例如:

用户 ↓YOYO ↓大模型 ↓Agent ↓发现工具 ↓MCP ↓MCP Server ↓业务服务 / API / 数据 ↓返回结构化结果 ↓Agent继续执行

而且一个MCP Server也不一定属于某个手机App。

它完全可以是一个独立的服务。

所以更准确的理解是:

App可以提供能力,但MCP本身并不等于App API。


七、那DeepLink又是什么?

还有一个经常和Agent联系在一起的东西:

DeepLink。

它和MCP解决的问题不一样。

DeepLink更像是:

告诉手机“打开某个App里的某个功能”。

比如一个App支持:

someapp://train/search?from=北京&to=上海&date=2026-09-25

AI就可以通过这个链接直接进入对应页面。

以前可能需要:

打开App→ 找到火车票→ 点击查询→ 输入北京→ 输入上海→ 选择日期

现在可以直接进入指定功能。

所以可以把它简单理解成:

技术
更像什么
MCP
AI调用工具
API
程序调用服务
DeepLink
直接进入App某个功能
GUI Agent
AI像人一样操作界面

它们可以配合使用,但不是简单的“谁失败了就一定换下一个”。


八、那GUI Agent又是什么?

如果一个App没有提供足够的结构化工具怎么办?

还有一种办法:

直接操作界面。

这就是GUI Agent。

例如AI看到手机屏幕:

┌─────────────────────┐│     12306           ││                     ││ 北京      上海       ││                     ││     2026-09-25      ││                     ││      查询           │└─────────────────────┘

它可以识别:

  • • 输入框在哪里
  • • 查询按钮在哪里
  • • 列表在哪里
  • • 哪个车次符合条件

然后执行:

点击 → 输入 → 滑动 → 选择 → 返回。

这和人操作手机的方式就非常接近了。

所以:

MCP更像“调用能力”,GUI更像“操作界面”。


九、为什么GUI Agent很重要?

因为现实世界的App太复杂了。

不可能所有App都提前为每一种AI任务提供标准化接口。

如果AI只能调用API:

没有API的App怎么办?

如果AI只能依赖MCP:

没有MCP能力怎么办?

GUI Agent提供了另一条路径:

只要人能够通过界面完成,AI理论上也可以学习如何操作这个界面。

当然,这种方式对视觉理解、操作准确率、安全权限等要求都更高。

因此未来手机Agent很可能不是单纯依赖某一种方式。

而是根据任务选择不同的执行能力。


十、Skills又是什么?

还有一个容易和MCP混在一起的概念:

Skills。

它可以简单理解成:

把某一类任务或能力封装起来,让Agent知道“这件事情应该怎么做”。

比如一个旅行Skill,可以包含:

查询交通 → 查询酒店 → 比较时间 → 整理行程

而MCP更偏向:

“我这里有一个可以查询酒店的工具。”

所以两者并不是简单的替代关系。

可以粗略理解:

Skill更偏向“能力/任务怎么组织”,MCP更偏向“工具怎么被发现和调用”。

具体实现方式会根据不同平台而不同。


十一、手机Agent不只是“操作App”

这里还有一个很容易被忽略的地方。

荣耀公开的开发能力,并不只有GUI任务自动执行。

还包括一些其他类型的能力,例如:

能力
可以做什么
App / GUI操作
打开App、执行界面操作、完成任务
系统用机能力
调用手机系统相关能力
蓝牙控制
控制部分蓝牙设备
智能家居控制
查询、控制智能家居设备
其他设备控制
例如机器人云台等设备

也就是说:

手机Agent并不只是“帮你点App”。

它正在逐渐连接:

手机系统 + App + 外部服务 + 智能设备

这时候,手机本身就越来越像一个AI的控制中心。


十二、真正完整的流程是什么?

把前面的东西全部放在一起,就比较清楚了。

假设你说:

“晚上7点提醒我出门,提前帮我看看路况。”

AI可能会这样处理:

第一步:理解需求

用户真正想完成的是:

晚上7点出门,并提前获得路况信息。


第二步:拆解任务

Agent可能把任务拆成:

设置提醒+查询路线+获取实时路况

第三步:寻找能力

它需要寻找:

系统提醒能力地图/路线能力实时交通信息能力

第四步:调用工具

如果某个能力通过MCP提供:

tools/list      ↓发现工具      ↓tools/call      ↓MCP Server      ↓业务服务      ↓返回结果

如果需要打开App:

DeepLink      ↓打开指定功能

如果只能通过界面操作:

GUI Agent      ↓识别界面      ↓点击 / 输入 / 滑动

第五步:继续判断

假设地图返回:

当前路线预计需要45分钟。

Agent可以继续判断:

用户7点出门,现在应该提前多久提醒?

然后设置对应的提醒。


第六步:涉及敏感操作时请求确认

比如:

“要不要现在购买这张车票?”

AI可以把最后的决定交给用户。

这点非常重要。

Agent的目标不是替用户无限制地做决定,而是在授权范围内执行任务。


十三、这其实改变了我们使用手机的方式

过去的手机:

人 → App

我们想做一件事,先想:

“我应该打开哪个App?”

以后可能越来越接近:

人 → AI Agent → 能力

你甚至不需要知道:

“这个功能到底属于哪个App?”

你只需要说:

“帮我完成这件事。”

Agent自己去寻找合适的能力。

比如:

“帮我订明天的高铁。”

“把这几张照片整理成一个视频。”

“晚上7点提醒我出门,提前看看路况。”

“把客厅的灯打开。”

“帮我把这份资料总结一下,然后整理成邮件。”

这些事情背后可能涉及完全不同的App、系统能力和设备。

但对用户来说:

它们都可以变成一句话。


十四、所以手机AI真正的变化是什么?

以前我们讨论手机AI,经常关注:

模型参数多大?

跑分多少?

能不能生成图片?

能不能写文章?

这些当然仍然重要。

但Agent时代,多了一个非常关键的问题:

AI有没有“手”?

所谓“手”,不是一只真正的手。

而是:

AI有没有能够调用现实世界能力的接口。

MCP让AI更容易发现和调用工具。

API让AI可以访问具体服务。

DeepLink让AI可以进入App的特定功能。

GUI Agent让AI可以操作界面。

系统工具让AI可以调用手机自身能力。

蓝牙、智能家居、机器人等能力,则让AI进一步走出手机屏幕。

于是:

大模型   ↓理解   ↓Agent规划   ↓寻找能力   ↓调用工具   ↓执行任务   ↓获取结果   ↓继续规划   ↓完成任务

这才是现在手机AI真正值得关注的地方。


最后

我们以前把手机理解成:

一个装满App的设备。

而Agent正在尝试把它变成:

一个可以被AI调度的能力集合。

你不需要记住哪个App在哪里,也不一定需要知道背后用了API、MCP还是GUI。

你只需要告诉它:

“我想完成什么。”

至于应该调用什么工具、打开什么服务、执行哪些步骤,越来越多的事情,可以交给Agent去完成。

当然,这条路还远没有走完。

准确性、权限、安全、隐私、跨App协作,以及不同平台之间的标准,都还需要继续解决。

但一个很明显的变化已经发生了:

手机正在从“我们操作App”,慢慢变成“AI帮我们使用手机”。

相关学习资料