ARTICLE · 1089753
AI不想再做一个App了:阿里开始争夺电脑和手机的系统入口
AI不想再做一个App了:阿里开始争夺电脑和手机的系统入口
今天如果你要安排一次上海出差,大概需要做这些事:
先打开微信,确认客户时间。
再打开日历,看自己的档期。
打开携程或者飞猪,搜索航班。
打开地图,看看机场到客户公司的距离。
再找酒店、安排交通、设置提醒。
如果涉及报销,回来以后可能还要重新找订单、下载发票、填写报销单。
我们已经习惯了这种使用计算机和手机的方式:
想做一件事,先找到对应的软件;一件复杂的事,就在几个App之间来回切换。
但过去一年,越来越多科技公司正在试图把这个过程改掉。
未来,你可能只需要告诉手机:
下周三我要去上海见客户,帮我安排当天往返,避开早高峰到虹桥的航班,把行程加进日历。
接下来,AI自己理解目的、拆解任务、检查日历、搜索航班、调用地图、比较方案,再把结果交给你确认。
真正变化的,不只是AI越来越聪明。
而是:
用户和软件之间,正在多出一个新的中间层。
这个中间层不只是回答问题。
它开始理解用户意图、规划任务、选择工具、调用App、API、Skill,甚至其他Agent,最后真正执行。
过去,AI公司想把自己做成一个App。
现在,它们开始试图站到所有App前面。
而刚刚结束的2026云栖大会,又给这个趋势增加了一个非常典型的样本。
阿里这次真正值得看的,不是又做了一台AI电脑
2026云栖大会上,阿里发布了多项AI产品。
其中有两个产品,最好放在一起看:
Qwen Book和Qwen Intelligence。
Qwen Book被阿里定义为一台 Agentic Computer,智能体电脑。
它将Qwen模型、Qwen Desktop OS、应用和云端服务整合在一套体系中,并提出了一个值得注意的概念:
OS as Harness。
这里的“Harness”可以理解成Agent的运行和调度环境。
操作系统不再只是负责管理文件、进程和软件,而开始为Agent提供上下文、工具、软件控制和硬件控制能力。
这和我们过去理解的“AI PC”有一点区别。
传统AI PC更像:
电脑 + AI功能。
比如帮你总结文档、生成图片、修改文字。
而Qwen Book试图让AI更进一步:
从功能变成任务执行者。
比如用户正在制作PPT,可以直接告诉AI:
把这一页换成云端文件里的最新数据。
真正要完成这件事,AI不能只“生成一句答案”。
它需要知道用户正在做什么,找到对应文件,定位数据,调用工具,修改内容,再把结果交给用户确认。
以前是:
人找到软件 → 操作功能。
现在开始变成:
人表达需求 → Agent寻找工具 → 软件执行。
看起来只少了几个点击。
背后改变的却是用户和软件之间的控制关系。
相比Qwen Book,Qwen Intelligence可能更值得观察
Qwen Book毕竟还是一台阿里自己的设备。
Qwen Intelligence代表的是另一种路线。
因为阿里并不拥有像iOS、Android或HarmonyOS这样的主流手机操作系统。
它选择的不是先造一部手机,而是:
把Agent能力做成基础设施,提供给手机厂商。
Qwen Intelligence第一阶段包含三个Agent:
Mobile Planner Agent负责任务规划、拆解、工具编排和动态调整;
Mobile-Use Agent负责真正执行跨App操作;
Mobile Creative Agent负责移动端图像生成和编辑。
其中最值得注意的是Mobile-Use Agent的执行方式:
API-first,GUI-fallback。
也就是:
有结构化API和工具接口时,优先直接调用;
没有接口时,再像人一样通过图形界面操作App。
这实际上已经非常接近一种完整的“Agent调度层”。
假设用户说:
帮我安排周一去上海出差。
Planner负责理解:
需要订机票、酒店、规划交通、创建日历。
然后再让不同工具或执行Agent完成这些子任务。
所以阿里的路径和Apple、Google、华为并不完全一样。
Apple、Google、华为本身拥有操作系统,可以直接在OS内部构建Agent能力。
阿里的选择更像:
没有自己的主流手机OS,那就尝试成为其他终端背后的Agent基础设施。
过去模型公司争的是:
谁的模型更强?
现在,一个新的问题正在出现:
谁能真正进入终端系统,成为用户和软件之间的任务调度者?
如果只有阿里一家这样做,这可能只是一场产品实验
但问题是,阿里并不是孤例。
过去一年,把Google、Apple、Microsoft,以及国内华为、荣耀、vivo等公司的动作放在一起,会发现它们虽然产品名字、技术架构和商业模式不同,却都在解决类似的问题:
怎样让用户不用先决定“我要打开哪个App”,而是直接告诉设备“我要完成什么”?
然后由系统或者Agent判断:
需要什么信息;
调用哪些能力;
分几步执行;
最后交付什么结果。
这已经很难再理解成某一家公司的产品升级。
更像是整个计算机产业都在尝试增加一个新的软件层。
Google甚至直接说:Android正在从“操作系统”变成“智能系统”
Google对这个方向的表达非常直接。
2026年5月,Google在介绍Gemini Intelligence时写道:
Android正在从Operating System向Intelligence System转变。
过去Operating System主要解决的是:
软件和硬件怎么运行。
而所谓Intelligence System开始增加一个新的问题:
用户想完成什么,系统能不能主动帮助完成?
Google目前正在分阶段上线Gemini Intelligence的多步骤任务自动化。
早期Beta允许部分Pixel和Samsung设备上的用户,让Gemini完成叫车、点餐等任务。
Gemini会在一个受限制的虚拟窗口中运行需要的App,用户可以继续使用手机,并随时查看、接管或停止执行。
到了2026年夏季,这套任务自动化已经从最初少数App扩展到40多个常用应用,覆盖购物、餐厅预约、旅行体验、活动票务等场景。
当然,这并不意味着所有Android手机现在都已经进入“全自动Agent时代”。
这些功能仍然在分设备、分地区、分应用逐步开放。
但它暴露出的方向已经很清楚。
过去叫车的入口是:
Uber、Lyft或者其他叫车App。
如果Agent进一步成熟,未来入口可能变成:
“Gemini,帮我叫辆车回家。”
用户首先选择的不再一定是一个服务App。
而是一个代表自己寻找服务的Agent。
这就是入口关系开始变化的地方。
Apple走得更底层:不是让AI学会点App,而是让App主动变成AI可以调用的能力
Apple的路线又不完全一样。
它并不只依赖AI“看屏幕、点按钮”。
Apple一直在推进的一个关键框架叫:
App Intents。
过去一个App像一栋封闭的房子。
用户必须先进去,再找到里面的功能。
打开音乐App,才能播放音乐。
打开任务App,才能新建待办。
打开修图App,才能编辑照片。
App Intents试图做的是:
让App主动把自己的动作和内容描述给系统。
例如:
一个音乐App可以告诉系统:
“我能播放这首歌。”
一个任务App可以告诉系统:
“我能创建一个任务。”
一个内容App可以告诉系统:
“这些是我能够提供给Siri理解的数据和动作。”
Apple已经把App Intents称为Apple Intelligence中的一个重要基础。
而在WWDC 2026的开发者交流中,Apple进一步明确提到:
新的 system orchestrator——系统级编排能力,可以从多个不同App提供的App Intents中采取行动。
这里需要注意:
System Orchestrator目前更适合理解为Apple Intelligence和Siri体系里的系统级编排能力,而不是Apple单独推出了一个叫“System Orchestrator”的产品。
但它透露出的系统设计思路非常重要。
可以把过去的软件世界理解成:
每个App都是一家独立餐厅。
用户自己决定去哪家、点什么菜。
现在Apple正在让这些“餐厅”把自己的能力菜单交给系统。
未来,一个请求可能同时使用:
A应用里的内容,
B应用里的动作,
再加上系统自己的能力。
于是AI不需要每一次都重新学习:
“这个按钮在哪里?”
而是可以直接知道:
“这个App提供什么能力?”
也就是说:
App开始从“给人操作的界面”,同时变成“给Agent调用的能力”。
国内手机厂商,也已经开始改造操作系统底层
这场变化在中国尤其明显。
华为:从“人找服务”走向“意图即服务”
HarmonyOS 7已经明确提出:
Agent亲和系统架构
和
鸿蒙智能体框架2.0。
华为官方给出的定义是:
在用户意图,与应用、Skill、第三方智能体之间建立统一的接入和执行机制。
小艺在这个结构里也不再只是语音助手。
它可以结合系统上下文理解用户意图、规划任务,再调用应用、系统能力或者其他智能体执行。
目前华为披露,小艺可以调用2100多项系统能力,并连接500多个伙伴精选Skills和2000多个鸿蒙智能体。
更重要的是,鸿蒙智能体框架已经支持通过 A2A(Agent to Agent)等方式连接不同智能体。
这意味着未来的终端里,可能不只是:
一个AI调用很多App。
还可能进一步演变成:
一个系统级个人Agent,调度多个专业Agent协同完成任务。
荣耀:YOYO正在成为系统里的任务执行者
荣耀MagicOS 10里的YOYO,同样在向这个方向推进。
荣耀已经明确提出:
“YOYO帮你做。”
并表示YOYO可以借助MCP组合不同工具,根据用户需求完成操作。
比如旅行规划、购物、生活服务,本质上都在试图从:
用户打开几个App分别操作
变成:
用户说一句需求,由YOYO组织后面的工具和服务。
荣耀的意义在于:
越来越多终端厂商正在把“Agent能力”放到系统级入口,而不是只做一个独立AI App。
vivo:把6000多个系统技能变成Agent的工具箱
vivo的例子则非常适合理解这套技术结构。
vivo推出的 BlueLM Harness,目标之一就是把手机系统里的大量原子能力转换成Agent可以调用的工具。
vivo公开的信息显示,这套体系可以把6000多项原子技能转化为Agent工具,并支持超过万种任务。
与此同时,vivo还推出了 蓝河AgentOS技术预览版,进一步把Agent执行环境推进到操作系统底层。
换句话说:
一部手机原来已经拥有大量能力:
相机、文件、地图、联系人、通知、系统设置、第三方服务……
过去这些主要都是:
给人操作的能力。
现在正在发生的变化是:
把这些能力重新包装成AI可以发现、理解和调用的工具。
于是系统结构逐渐变成:
模型理解需求
→ Agent规划任务
→ Harness寻找工具
→ OS和App执行。
这已经不是单纯给手机增加一个聊天机器人。
而是在尝试重新定义:
操作系统究竟应该为谁提供接口。
过去主要为人和App提供接口。
未来还要为Agent提供接口。
PC也在发生同样的事情:Microsoft开始给Agent准备独立的工作空间
这场变化并不只存在于手机。
Microsoft已经在Windows 11中实验 Agent Workspace和 Copilot Actions。
值得注意的是,这些目前仍然属于实验性、预览阶段的Agentic Features,并且默认关闭,需要用户主动开启。
但微软设计的架构非常值得看。
Agent可以拥有:
独立Agent Account;
独立Agent Workspace;
甚至拥有类似自己的桌面。
这样做的原因很现实。
一旦AI开始真正操作:
文件、软件、邮件和系统,
就必须重新定义:
它可以访问什么;
可以修改什么;
什么时候必须询问用户;
出错以后谁负责。
所以微软把Agent与真实用户账户隔离开来。
这说明Agent进入操作系统以后,新的问题已经不再只是:
“AI够不够聪明?”
而开始变成:
“我们应该给AI多大的执行权?”
实现这个“新中间层”,现在其实有两条主要技术路线
如果只看产品名字,很容易觉得大家只是在各自做AI助手。
但往技术底层再看一步,会发现目前大致存在两种实现思路。
第一种:把软件能力结构化地交给Agent
Apple的App Intents、华为的Skill、vivo的Harness,以及各种API、MCP工具,都属于这一方向。
它的逻辑是:
软件主动告诉Agent:我有什么能力,你应该怎么调用。
优势很明显:
执行速度快、结果更稳定、权限更容易控制。
如果Agent要“创建日历事件”,直接调用一个明确的接口,通常比让AI自己寻找“新建日程”按钮可靠得多。
第二种:让Agent像人一样使用电脑
另一条路线,是 Computer Use。
OpenAI早在Computer-Using Agent中,就让模型通过视觉理解图形界面,操作按钮、菜单和输入框,不依赖网站或操作系统提供专门API。
Anthropic的Computer Use也是类似思路:
Claude通过屏幕截图理解界面,再移动鼠标、点击和输入,像人一样使用软件。
这条路线最大的优势是:
不用等每一家软件公司都主动为Agent改造接口。
只要人能操作,理论上Agent就有机会操作。
但它的缺点也很明显:
更慢;
更耗算力;
界面一变就可能失效;
可靠性通常也比结构化接口更难保证。
所以未来更可能出现的,并不是二选一。
而是一种混合路线:
API / Intent / Skill优先,GUI操作兜底。
阿里Qwen Intelligence已经明确采用这种思路:
API-first,GUI-fallback。
这可能才是未来系统级Agent最现实的技术结构。
把这些产品放在一起,会发现大家正在增加同一个软件层
把品牌词全部拿掉,会发现它们最终都在尝试形成类似的结构:
用户
↓
表达意图
↓
Agent理解需求
↓
任务规划
↓
选择和编排工具
↓
App / API / Skill / Agent
↓
系统执行
↓
结果
我们暂且可以把这一层叫作:
“意图—执行层”
或者更容易理解:
Agent任务调度层。
它的位置就在:
用户和传统软件之间。
这可能才是过去一年AI产品变化中最值得长期追踪的一条线。
真正变化的,是我们使用计算机的基本逻辑
过去三十多年,无论PC还是智能手机,大部分软件交互其实遵循同一种逻辑:
用户
↓
找到软件
↓
打开软件
↓
找到功能
↓
操作功能
↓
得到结果
也就是说:
人必须知道“怎么做”。
想订酒店,就要知道打开哪个旅行App。
想报销,就要知道发票在哪里、公司的报销系统在哪里。
想整理会议,就要知道文档、邮箱、日历分别怎么操作。
Agent真正想改变的是:
用户
↓
告诉AI“我要什么”
↓
AI决定“怎么做”
↓
调用不同软件和服务
↓
得到结果
用户只需要越来越清楚:
我要什么。
而不需要理解每个数字工具:
具体怎么操作。
这听起来像一次交互方式升级。
但如果它真的大规模成立,最终改变的会是互联网里非常重要的一样东西:
入口权。
App不会消失,但“App作为入口”的价值可能下降
现在当然远远不能说:
App时代结束了。
很多场景天然仍然需要用户直接进入App。
游戏、内容消费、社交、创作,以及大量具有强交互体验的产品,都不会突然退到后台。
更准确的变化是:
部分App可能逐渐从纯粹的用户入口,转变成同时面向用户和Agent提供能力的服务节点。
过去一个App同时拥有两种身份:
服务提供者 + 用户入口。
以后,它可能增加第三种角色:
Agent工具。
比如过去用户订酒店:
打开携程。
未来可能直接告诉个人Agent:
下周去杭州,帮我找一家西湖附近、四星以上、1000元以内、有健身房的酒店。
Agent再去查询不同平台、地图和支付服务。
这时候真正发生变化的,不是携程、飞猪突然不存在了。
而是:
过去由用户直接做出的“我先打开谁”,开始有一部分交给Agent参与决定。
过去是:
用户选择App。
未来越来越可能出现:
Agent参与选择服务。
这就是新的分发权。
企业未来不仅要让“人”看懂,还要让Agent能够发现和调用
一旦越来越多任务通过Agent进行,一个新的商业问题马上出现:
为什么Agent要选择你的产品和服务?
例如,一个AI替用户寻找酒店,它可能考虑:
价格;
距离;
评分;
退款政策;
用户历史偏好;
服务可信度;
接口稳定性;
是否可以直接完成交易。
过去一家酒店最关心的可能是:
我怎么在携程或者搜索引擎上排得更靠前?
以后可能还需要考虑:
我怎么让Agent更容易发现、理解、比较并调用我的服务?
如果这种分发方式继续扩大,市场很可能出现一类类似SEO的新工作。
暂且可以把它叫作:
Agent Optimization。
它目前并不是一个已经形成统一定义和成熟标准的行业。
但背后的需求已经很容易理解:
过去企业要把网页做得对搜索引擎友好。
未来还可能需要把自己的:
商品、库存、价格、服务、接口、评价、交易规则
组织成机器能够稳定理解和调用的结构。
企业不仅需要:
human-readable。
也开始需要:
agent-readable、agent-callable。
这会是AI与商业系统真正连接以后非常值得观察的一层基础设施。
一场“默认Agent”入口战正在形成
为什么科技巨头都想做这一层?
因为如果Agent真的成为用户与软件之间的中间层,它会拥有三种极其重要的能力。
第一是:
理解用户意图。
过去Google知道你搜索什么。
淘宝知道你购买什么。
微信知道你和谁交流。
而个人Agent可能进一步知道:
你接下来想做什么。
“上海天气怎么样?”
和
“我下周要去上海见客户,把出差全部安排好。”
完全不是一个信息维度。
后者包含的是:
意图。
第二是:
服务分发。
如果用户先问Agent:
去哪吃饭、住什么酒店、买什么商品、使用什么软件,
Agent实际上就拥有了类似搜索引擎、App Store和超级App曾经拥有的一部分分发权。
以前是:
搜索引擎决定搜索结果如何排序。
未来可能增加一种情况:
Agent决定先调用哪个服务。
第三是:
交易执行。
如果Agent进一步能够直接完成:
搜索
→ 比较
→ 选择
→ 预订
→ 支付
那么今天互联网里原本很长的交易漏斗,会被明显压缩。
也正因为如此,拥有不同资源的公司,都在争夺“默认Agent”的位置。
OS厂商有设备和权限。
手机厂商有硬件和用户入口。
模型公司有推理和Agent能力。
超级互联网平台则拥有大量真实服务。
这也是为什么阿里值得被放在这篇文章的开头。
它手里同时拥有:
Qwen + 阿里云 + 淘宝天猫 + 支付宝 + 高德 + 飞猪。
也就是说:
阿里不只有一个负责思考的“大脑”。
还拥有大量这个大脑未来可能调用的现实服务。
但系统级Agent现在还有三道真正难跨过去的门
趋势已经出现。
但距离“以后所有手机都交给AI操作”,显然还有很长一段距离。
第一,Agent凭什么替我做决定?
如果AI推荐三个酒店:
为什么是这三个?
因为真的最适合我?
还是因为平台佣金更高?
还是因为Agent背后的公司拥有自己的商业利益?
这会成为一个非常重要的问题:
Agent中立性。
如果Agent成为新的流量分配者,那么推荐规则、商业排序和广告机制迟早都会成为问题。
今天搜索引擎经历过的很多争议,未来很可能会在Agent时代以新的形式重新出现。
第二,Agent能力越强,需要的权限越大
真正有用的个人Agent可能需要访问:
邮件、日历、文件、联系人、位置、购物记录、支付信息。
所以:
Agent入口战争,同时也是权限入口战争。
这也是Google和Microsoft现在强调隔离环境、用户控制、执行透明度的重要原因。
用户未来真正选择一个长期个人Agent时,选择的可能不仅是:
谁更聪明?
还有:
我愿意把多少数字生活交给谁?
第三,会回答错和会执行错,是两个完全不同的风险等级
聊天机器人说错一句话:
最多让用户觉得不好用。
但Agent如果:
订错机票;
给客户发错文件;
删除错数据;
下错订单;
支付错误;
带来的就是现实损失。
所以Agent时代真正值得看的技术指标,不应该只有模型Benchmark。
还包括:
Task Success Rate——任务成功率。
以及:
Error Cost——错误成本。
一个聊天模型95%的成功率,和一个每天替你执行20项真实任务的Agent达到95%成功率,完全不是一个概念。
后者意味着:
平均一天就可能出现一次错误。
显然还远远不够。
真正变化的,不是AI越来越像人,而是计算机的控制关系开始改变
过去几十年,人一直在学习如何适应计算机。
我们学会:
什么叫桌面;
什么叫文件夹;
什么叫App;
什么叫浏览器;
什么叫菜单;
什么叫复制粘贴;
什么叫快捷键。
很多所谓的“数字技能”,本质上都是:
人在学习机器设计好的交互规则。
而Agent带来的另一种可能是:
让机器开始学习人真正想做什么。
过去:
人学习怎么操作计算机。
未来越来越可能变成:
计算机学习怎么替人操作计算机。
所以,如果孤立地看Qwen Book,它只是一台新的AI电脑。
Qwen Intelligence未来能够进入多少手机,也仍然需要市场验证。
Google的Gemini Intelligence还在逐步开放。
Microsoft的Agent Workspace仍然处于实验阶段。
Apple、华为、vivo和荣耀的Agent能力也都处在持续建设生态和扩大服务覆盖的过程中。
但把这些动作同时放在一张图里,趋势就比任何单一产品更清楚:
AI正在从“软件里的一个功能”,向“软件之前的一层调度者”移动。
它最终争夺的可能不是桌面上的另一个App图标。
而是成为那个:
理解需求、规划任务、寻找工具、调用服务并把结果交付给用户的角色。
过去互联网入口最重要的问题是:
用户打开谁?
Agent时代正在增加一个更重要的问题:
用户先告诉谁?
谁拿到用户的“第一句话”,谁就有机会成为下一代计算平台最重要的入口之一。
写在最后:
从PC到移动互联网,软件入口经历了:
桌面程序 → 浏览器 → App → 超级App。
现在,一种新的入口正在形成。
它未必拥有一个固定图标。
甚至未必要求用户主动“打开”。
它更像一个长期存在于设备和云端之间的任务总管:
理解人的意图,调用不同的软件、数据、Skill、Agent和现实服务,最后把结果交给用户。
因此,接下来真正值得持续观察的,已经不只是哪个大模型参数更大。
而是三个更加具体的问题:
谁最终会成为默认Agent?
哪些App和服务,会成为Agent最容易发现和调用的能力?
当Agent获得部分服务分发权以后,今天互联网里的流量、广告、交易和平台关系,会如何重新排列?
如果这个新的“意图—执行层”真正建立起来,那么AI产业改变的就不仅是:
软件里多了一个AI功能。
而是: