夜雨聆风学习资料网

ARTICLE · 1089753

AI不想再做一个App了:阿里开始争夺电脑和手机的系统入口

AI不想再做一个App了:阿里开始争夺电脑和手机的系统入口

AI不想再做一个App了:阿里开始争夺电脑和手机的系统入口

今天如果你要安排一次上海出差,大概需要做这些事:

先打开微信,确认客户时间。

再打开日历,看自己的档期。

打开携程或者飞猪,搜索航班。

打开地图,看看机场到客户公司的距离。

再找酒店、安排交通、设置提醒。

如果涉及报销,回来以后可能还要重新找订单、下载发票、填写报销单。

我们已经习惯了这种使用计算机和手机的方式:

想做一件事,先找到对应的软件;一件复杂的事,就在几个App之间来回切换。

但过去一年,越来越多科技公司正在试图把这个过程改掉。

未来,你可能只需要告诉手机:

下周三我要去上海见客户,帮我安排当天往返,避开早高峰到虹桥的航班,把行程加进日历。

接下来,AI自己理解目的、拆解任务、检查日历、搜索航班、调用地图、比较方案,再把结果交给你确认。

真正变化的,不只是AI越来越聪明。

而是:

用户和软件之间,正在多出一个新的中间层。

这个中间层不只是回答问题。

它开始理解用户意图、规划任务、选择工具、调用App、API、Skill,甚至其他Agent,最后真正执行。

过去,AI公司想把自己做成一个App。

现在,它们开始试图站到所有App前面。

而刚刚结束的2026云栖大会,又给这个趋势增加了一个非常典型的样本。


阿里这次真正值得看的,不是又做了一台AI电脑

2026云栖大会上,阿里发布了多项AI产品。

其中有两个产品,最好放在一起看:

Qwen Book和Qwen Intelligence。

Qwen Book被阿里定义为一台 Agentic Computer,智能体电脑。

它将Qwen模型、Qwen Desktop OS、应用和云端服务整合在一套体系中,并提出了一个值得注意的概念:

OS as Harness。

这里的“Harness”可以理解成Agent的运行和调度环境。

操作系统不再只是负责管理文件、进程和软件,而开始为Agent提供上下文、工具、软件控制和硬件控制能力。

这和我们过去理解的“AI PC”有一点区别。

传统AI PC更像:

电脑 + AI功能。

比如帮你总结文档、生成图片、修改文字。

而Qwen Book试图让AI更进一步:

从功能变成任务执行者。

比如用户正在制作PPT,可以直接告诉AI:

把这一页换成云端文件里的最新数据。

真正要完成这件事,AI不能只“生成一句答案”。

它需要知道用户正在做什么,找到对应文件,定位数据,调用工具,修改内容,再把结果交给用户确认。

以前是:

人找到软件 → 操作功能。

现在开始变成:

人表达需求 → Agent寻找工具 → 软件执行。

看起来只少了几个点击。

背后改变的却是用户和软件之间的控制关系。


相比Qwen Book,Qwen Intelligence可能更值得观察

Qwen Book毕竟还是一台阿里自己的设备。

Qwen Intelligence代表的是另一种路线。

因为阿里并不拥有像iOS、Android或HarmonyOS这样的主流手机操作系统。

它选择的不是先造一部手机,而是:

把Agent能力做成基础设施,提供给手机厂商。

Qwen Intelligence第一阶段包含三个Agent:

Mobile Planner Agent负责任务规划、拆解、工具编排和动态调整;

Mobile-Use Agent负责真正执行跨App操作;

Mobile Creative Agent负责移动端图像生成和编辑。

其中最值得注意的是Mobile-Use Agent的执行方式:

API-first,GUI-fallback。

也就是:

有结构化API和工具接口时,优先直接调用;

没有接口时,再像人一样通过图形界面操作App。

这实际上已经非常接近一种完整的“Agent调度层”。

假设用户说:

帮我安排周一去上海出差。

Planner负责理解:

需要订机票、酒店、规划交通、创建日历。

然后再让不同工具或执行Agent完成这些子任务。

所以阿里的路径和Apple、Google、华为并不完全一样。

Apple、Google、华为本身拥有操作系统,可以直接在OS内部构建Agent能力。

阿里的选择更像:

没有自己的主流手机OS,那就尝试成为其他终端背后的Agent基础设施。

过去模型公司争的是:

谁的模型更强?

现在,一个新的问题正在出现:

谁能真正进入终端系统,成为用户和软件之间的任务调度者?


如果只有阿里一家这样做,这可能只是一场产品实验

但问题是,阿里并不是孤例。

过去一年,把Google、Apple、Microsoft,以及国内华为、荣耀、vivo等公司的动作放在一起,会发现它们虽然产品名字、技术架构和商业模式不同,却都在解决类似的问题:

怎样让用户不用先决定“我要打开哪个App”,而是直接告诉设备“我要完成什么”?

然后由系统或者Agent判断:

需要什么信息;

调用哪些能力;

分几步执行;

最后交付什么结果。

这已经很难再理解成某一家公司的产品升级。

更像是整个计算机产业都在尝试增加一个新的软件层。


Google甚至直接说:Android正在从“操作系统”变成“智能系统”

Google对这个方向的表达非常直接。

2026年5月,Google在介绍Gemini Intelligence时写道:

Android正在从Operating System向Intelligence System转变。

过去Operating System主要解决的是:

软件和硬件怎么运行。

而所谓Intelligence System开始增加一个新的问题:

用户想完成什么,系统能不能主动帮助完成?

Google目前正在分阶段上线Gemini Intelligence的多步骤任务自动化。

早期Beta允许部分Pixel和Samsung设备上的用户,让Gemini完成叫车、点餐等任务。

Gemini会在一个受限制的虚拟窗口中运行需要的App,用户可以继续使用手机,并随时查看、接管或停止执行。

到了2026年夏季,这套任务自动化已经从最初少数App扩展到40多个常用应用,覆盖购物、餐厅预约、旅行体验、活动票务等场景。

当然,这并不意味着所有Android手机现在都已经进入“全自动Agent时代”。

这些功能仍然在分设备、分地区、分应用逐步开放。

但它暴露出的方向已经很清楚。

过去叫车的入口是:

Uber、Lyft或者其他叫车App。

如果Agent进一步成熟,未来入口可能变成:

“Gemini,帮我叫辆车回家。”

用户首先选择的不再一定是一个服务App。

而是一个代表自己寻找服务的Agent。

这就是入口关系开始变化的地方。


Apple走得更底层:不是让AI学会点App,而是让App主动变成AI可以调用的能力

Apple的路线又不完全一样。

它并不只依赖AI“看屏幕、点按钮”。

Apple一直在推进的一个关键框架叫:

App Intents。

过去一个App像一栋封闭的房子。

用户必须先进去,再找到里面的功能。

打开音乐App,才能播放音乐。

打开任务App,才能新建待办。

打开修图App,才能编辑照片。

App Intents试图做的是:

让App主动把自己的动作和内容描述给系统。

例如:

一个音乐App可以告诉系统:

“我能播放这首歌。”

一个任务App可以告诉系统:

“我能创建一个任务。”

一个内容App可以告诉系统:

“这些是我能够提供给Siri理解的数据和动作。”

Apple已经把App Intents称为Apple Intelligence中的一个重要基础。

而在WWDC 2026的开发者交流中,Apple进一步明确提到:

新的 system orchestrator——系统级编排能力,可以从多个不同App提供的App Intents中采取行动。

这里需要注意:

System Orchestrator目前更适合理解为Apple Intelligence和Siri体系里的系统级编排能力,而不是Apple单独推出了一个叫“System Orchestrator”的产品。

但它透露出的系统设计思路非常重要。

可以把过去的软件世界理解成:

每个App都是一家独立餐厅。

用户自己决定去哪家、点什么菜。

现在Apple正在让这些“餐厅”把自己的能力菜单交给系统。

未来,一个请求可能同时使用:

A应用里的内容,

B应用里的动作,

再加上系统自己的能力。

于是AI不需要每一次都重新学习:

“这个按钮在哪里?”

而是可以直接知道:

“这个App提供什么能力?”

也就是说:

App开始从“给人操作的界面”,同时变成“给Agent调用的能力”。


国内手机厂商,也已经开始改造操作系统底层

这场变化在中国尤其明显。

华为:从“人找服务”走向“意图即服务”

HarmonyOS 7已经明确提出:

Agent亲和系统架构

和

鸿蒙智能体框架2.0。

华为官方给出的定义是:

在用户意图,与应用、Skill、第三方智能体之间建立统一的接入和执行机制。

小艺在这个结构里也不再只是语音助手。

它可以结合系统上下文理解用户意图、规划任务,再调用应用、系统能力或者其他智能体执行。

目前华为披露,小艺可以调用2100多项系统能力,并连接500多个伙伴精选Skills和2000多个鸿蒙智能体。

更重要的是,鸿蒙智能体框架已经支持通过 A2A(Agent to Agent)等方式连接不同智能体。

这意味着未来的终端里,可能不只是:

一个AI调用很多App。

还可能进一步演变成:

一个系统级个人Agent,调度多个专业Agent协同完成任务。


荣耀:YOYO正在成为系统里的任务执行者

荣耀MagicOS 10里的YOYO,同样在向这个方向推进。

荣耀已经明确提出:

“YOYO帮你做。”

并表示YOYO可以借助MCP组合不同工具,根据用户需求完成操作。

比如旅行规划、购物、生活服务,本质上都在试图从:

用户打开几个App分别操作

变成:

用户说一句需求,由YOYO组织后面的工具和服务。

荣耀的意义在于:

越来越多终端厂商正在把“Agent能力”放到系统级入口,而不是只做一个独立AI App。


vivo:把6000多个系统技能变成Agent的工具箱

vivo的例子则非常适合理解这套技术结构。

vivo推出的 BlueLM Harness,目标之一就是把手机系统里的大量原子能力转换成Agent可以调用的工具。

vivo公开的信息显示,这套体系可以把6000多项原子技能转化为Agent工具,并支持超过万种任务。

与此同时,vivo还推出了 蓝河AgentOS技术预览版,进一步把Agent执行环境推进到操作系统底层。

换句话说:

一部手机原来已经拥有大量能力:

相机、文件、地图、联系人、通知、系统设置、第三方服务……

过去这些主要都是:

给人操作的能力。

现在正在发生的变化是:

把这些能力重新包装成AI可以发现、理解和调用的工具。

于是系统结构逐渐变成:

模型理解需求
→ Agent规划任务
→ Harness寻找工具
→ OS和App执行。

这已经不是单纯给手机增加一个聊天机器人。

而是在尝试重新定义:

操作系统究竟应该为谁提供接口。

过去主要为人和App提供接口。

未来还要为Agent提供接口。


PC也在发生同样的事情:Microsoft开始给Agent准备独立的工作空间

这场变化并不只存在于手机。

Microsoft已经在Windows 11中实验 Agent Workspace和 Copilot Actions。

值得注意的是,这些目前仍然属于实验性、预览阶段的Agentic Features,并且默认关闭,需要用户主动开启。

但微软设计的架构非常值得看。

Agent可以拥有:

独立Agent Account;

独立Agent Workspace;

甚至拥有类似自己的桌面。

这样做的原因很现实。

一旦AI开始真正操作:

文件、软件、邮件和系统,

就必须重新定义:

它可以访问什么;

可以修改什么;

什么时候必须询问用户;

出错以后谁负责。

所以微软把Agent与真实用户账户隔离开来。

这说明Agent进入操作系统以后,新的问题已经不再只是:

“AI够不够聪明?”

而开始变成:

“我们应该给AI多大的执行权?”


实现这个“新中间层”,现在其实有两条主要技术路线

如果只看产品名字,很容易觉得大家只是在各自做AI助手。

但往技术底层再看一步,会发现目前大致存在两种实现思路。

第一种:把软件能力结构化地交给Agent

Apple的App Intents、华为的Skill、vivo的Harness,以及各种API、MCP工具,都属于这一方向。

它的逻辑是:

软件主动告诉Agent:我有什么能力,你应该怎么调用。

优势很明显:

执行速度快、结果更稳定、权限更容易控制。

如果Agent要“创建日历事件”,直接调用一个明确的接口,通常比让AI自己寻找“新建日程”按钮可靠得多。


第二种:让Agent像人一样使用电脑

另一条路线,是 Computer Use。

OpenAI早在Computer-Using Agent中,就让模型通过视觉理解图形界面,操作按钮、菜单和输入框,不依赖网站或操作系统提供专门API。

Anthropic的Computer Use也是类似思路:

Claude通过屏幕截图理解界面,再移动鼠标、点击和输入,像人一样使用软件。

这条路线最大的优势是:

不用等每一家软件公司都主动为Agent改造接口。

只要人能操作,理论上Agent就有机会操作。

但它的缺点也很明显:

更慢;

更耗算力;

界面一变就可能失效;

可靠性通常也比结构化接口更难保证。

所以未来更可能出现的,并不是二选一。

而是一种混合路线:

API / Intent / Skill优先,GUI操作兜底。

阿里Qwen Intelligence已经明确采用这种思路:

API-first,GUI-fallback。

这可能才是未来系统级Agent最现实的技术结构。


把这些产品放在一起,会发现大家正在增加同一个软件层

把品牌词全部拿掉,会发现它们最终都在尝试形成类似的结构:

用户
↓
表达意图
↓
Agent理解需求
↓
任务规划
↓
选择和编排工具
↓
App / API / Skill / Agent
↓
系统执行
↓
结果

我们暂且可以把这一层叫作:

“意图—执行层”

或者更容易理解:

Agent任务调度层。

它的位置就在:

用户和传统软件之间。

这可能才是过去一年AI产品变化中最值得长期追踪的一条线。


真正变化的,是我们使用计算机的基本逻辑

过去三十多年,无论PC还是智能手机,大部分软件交互其实遵循同一种逻辑:

用户
↓
找到软件
↓
打开软件
↓
找到功能
↓
操作功能
↓
得到结果

也就是说:

人必须知道“怎么做”。

想订酒店,就要知道打开哪个旅行App。

想报销,就要知道发票在哪里、公司的报销系统在哪里。

想整理会议,就要知道文档、邮箱、日历分别怎么操作。

Agent真正想改变的是:

用户
↓
告诉AI“我要什么”
↓
AI决定“怎么做”
↓
调用不同软件和服务
↓
得到结果

用户只需要越来越清楚:

我要什么。

而不需要理解每个数字工具:

具体怎么操作。

这听起来像一次交互方式升级。

但如果它真的大规模成立,最终改变的会是互联网里非常重要的一样东西:

入口权。


App不会消失,但“App作为入口”的价值可能下降

现在当然远远不能说:

App时代结束了。

很多场景天然仍然需要用户直接进入App。

游戏、内容消费、社交、创作,以及大量具有强交互体验的产品,都不会突然退到后台。

更准确的变化是:

部分App可能逐渐从纯粹的用户入口,转变成同时面向用户和Agent提供能力的服务节点。

过去一个App同时拥有两种身份:

服务提供者 + 用户入口。

以后,它可能增加第三种角色:

Agent工具。

比如过去用户订酒店:

打开携程。

未来可能直接告诉个人Agent:

下周去杭州,帮我找一家西湖附近、四星以上、1000元以内、有健身房的酒店。

Agent再去查询不同平台、地图和支付服务。

这时候真正发生变化的,不是携程、飞猪突然不存在了。

而是:

过去由用户直接做出的“我先打开谁”,开始有一部分交给Agent参与决定。

过去是:

用户选择App。

未来越来越可能出现:

Agent参与选择服务。

这就是新的分发权。


企业未来不仅要让“人”看懂,还要让Agent能够发现和调用

一旦越来越多任务通过Agent进行,一个新的商业问题马上出现:

为什么Agent要选择你的产品和服务?

例如,一个AI替用户寻找酒店,它可能考虑:

价格;

距离;

评分;

退款政策;

用户历史偏好;

服务可信度;

接口稳定性;

是否可以直接完成交易。

过去一家酒店最关心的可能是:

我怎么在携程或者搜索引擎上排得更靠前?

以后可能还需要考虑:

我怎么让Agent更容易发现、理解、比较并调用我的服务?

如果这种分发方式继续扩大,市场很可能出现一类类似SEO的新工作。

暂且可以把它叫作:

Agent Optimization。

它目前并不是一个已经形成统一定义和成熟标准的行业。

但背后的需求已经很容易理解:

过去企业要把网页做得对搜索引擎友好。

未来还可能需要把自己的:

商品、库存、价格、服务、接口、评价、交易规则

组织成机器能够稳定理解和调用的结构。

企业不仅需要:

human-readable。

也开始需要:

agent-readable、agent-callable。

这会是AI与商业系统真正连接以后非常值得观察的一层基础设施。


一场“默认Agent”入口战正在形成

为什么科技巨头都想做这一层?

因为如果Agent真的成为用户与软件之间的中间层,它会拥有三种极其重要的能力。

第一是:

理解用户意图。

过去Google知道你搜索什么。

淘宝知道你购买什么。

微信知道你和谁交流。

而个人Agent可能进一步知道:

你接下来想做什么。

“上海天气怎么样?”

和

“我下周要去上海见客户,把出差全部安排好。”

完全不是一个信息维度。

后者包含的是:

意图。


第二是:

服务分发。

如果用户先问Agent:

去哪吃饭、住什么酒店、买什么商品、使用什么软件,

Agent实际上就拥有了类似搜索引擎、App Store和超级App曾经拥有的一部分分发权。

以前是:

搜索引擎决定搜索结果如何排序。

未来可能增加一种情况:

Agent决定先调用哪个服务。


第三是:

交易执行。

如果Agent进一步能够直接完成:

搜索
→ 比较
→ 选择
→ 预订
→ 支付

那么今天互联网里原本很长的交易漏斗,会被明显压缩。

也正因为如此,拥有不同资源的公司,都在争夺“默认Agent”的位置。

OS厂商有设备和权限。

手机厂商有硬件和用户入口。

模型公司有推理和Agent能力。

超级互联网平台则拥有大量真实服务。

这也是为什么阿里值得被放在这篇文章的开头。

它手里同时拥有:

Qwen + 阿里云 + 淘宝天猫 + 支付宝 + 高德 + 飞猪。

也就是说:

阿里不只有一个负责思考的“大脑”。

还拥有大量这个大脑未来可能调用的现实服务。


但系统级Agent现在还有三道真正难跨过去的门

趋势已经出现。

但距离“以后所有手机都交给AI操作”,显然还有很长一段距离。

第一,Agent凭什么替我做决定?

如果AI推荐三个酒店:

为什么是这三个?

因为真的最适合我?

还是因为平台佣金更高?

还是因为Agent背后的公司拥有自己的商业利益?

这会成为一个非常重要的问题:

Agent中立性。

如果Agent成为新的流量分配者,那么推荐规则、商业排序和广告机制迟早都会成为问题。

今天搜索引擎经历过的很多争议,未来很可能会在Agent时代以新的形式重新出现。


第二,Agent能力越强,需要的权限越大

真正有用的个人Agent可能需要访问:

邮件、日历、文件、联系人、位置、购物记录、支付信息。

所以:

Agent入口战争,同时也是权限入口战争。

这也是Google和Microsoft现在强调隔离环境、用户控制、执行透明度的重要原因。

用户未来真正选择一个长期个人Agent时,选择的可能不仅是:

谁更聪明?

还有:

我愿意把多少数字生活交给谁?


第三,会回答错和会执行错,是两个完全不同的风险等级

聊天机器人说错一句话:

最多让用户觉得不好用。

但Agent如果:

订错机票;

给客户发错文件;

删除错数据;

下错订单;

支付错误;

带来的就是现实损失。

所以Agent时代真正值得看的技术指标,不应该只有模型Benchmark。

还包括:

Task Success Rate——任务成功率。

以及:

Error Cost——错误成本。

一个聊天模型95%的成功率,和一个每天替你执行20项真实任务的Agent达到95%成功率,完全不是一个概念。

后者意味着:

平均一天就可能出现一次错误。

显然还远远不够。


真正变化的,不是AI越来越像人,而是计算机的控制关系开始改变

过去几十年,人一直在学习如何适应计算机。

我们学会:

什么叫桌面;

什么叫文件夹;

什么叫App;

什么叫浏览器;

什么叫菜单;

什么叫复制粘贴;

什么叫快捷键。

很多所谓的“数字技能”,本质上都是:

人在学习机器设计好的交互规则。

而Agent带来的另一种可能是:

让机器开始学习人真正想做什么。

过去:

人学习怎么操作计算机。

未来越来越可能变成:

计算机学习怎么替人操作计算机。

所以,如果孤立地看Qwen Book,它只是一台新的AI电脑。

Qwen Intelligence未来能够进入多少手机,也仍然需要市场验证。

Google的Gemini Intelligence还在逐步开放。

Microsoft的Agent Workspace仍然处于实验阶段。

Apple、华为、vivo和荣耀的Agent能力也都处在持续建设生态和扩大服务覆盖的过程中。

但把这些动作同时放在一张图里,趋势就比任何单一产品更清楚:

AI正在从“软件里的一个功能”,向“软件之前的一层调度者”移动。

它最终争夺的可能不是桌面上的另一个App图标。

而是成为那个:

理解需求、规划任务、寻找工具、调用服务并把结果交付给用户的角色。

过去互联网入口最重要的问题是:

用户打开谁?

Agent时代正在增加一个更重要的问题:

用户先告诉谁?

谁拿到用户的“第一句话”,谁就有机会成为下一代计算平台最重要的入口之一。


写在最后:

从PC到移动互联网,软件入口经历了:

桌面程序 → 浏览器 → App → 超级App。

现在,一种新的入口正在形成。

它未必拥有一个固定图标。

甚至未必要求用户主动“打开”。

它更像一个长期存在于设备和云端之间的任务总管:

理解人的意图,调用不同的软件、数据、Skill、Agent和现实服务,最后把结果交给用户。

因此,接下来真正值得持续观察的,已经不只是哪个大模型参数更大。

而是三个更加具体的问题:

谁最终会成为默认Agent?

哪些App和服务,会成为Agent最容易发现和调用的能力?

当Agent获得部分服务分发权以后,今天互联网里的流量、广告、交易和平台关系,会如何重新排列?

如果这个新的“意图—执行层”真正建立起来,那么AI产业改变的就不仅是:

软件里多了一个AI功能。

而是:

人与整个数字世界之间,开始出现一个新的控制层。

相关学习资料