2026年7月17日,努比亚在上海世界人工智能大会(WAIC)上发布了NaviX Ultra,和字节跳动联合开发,内置豆包手机助手。努比亚管它叫"全球首款量产AI智能体手机"。
同一个月,三星Galaxy S26系列已经卖了四个月,主打"agentic AI"。Apple在6月WWDC上发布了Apple Intelligence 2.0和重建的Siri。高通CEO Cristiano Amon在Computex上宣布2026年是"AI Agent之年"。华为、小米、OPPO、vivo四家的端侧大模型全部通过了国家备案。
所有玩家都在讲同一个故事:手机不再是APP的容器,而是智能体的载体。
这不是营销噱头。这背后是一个正在发生的结构性转变:智能手机的交互范式从"人找APP"变成"意图找结果"。APP作为人机交互的基本单位,正在被智能体消解。
80个APP的困局
先看一组数据。
2025年,智能手机用户平均安装80个APP。每天实际使用的,9个。每月打开过的,30个。也就是说,超过62%的已安装APP在任何一个月里都没被碰过。
更尴尬的是用户留存。一个APP在安装后的前3天会流失77%的日活用户。到第30天,留存率跌到5.7%。绝大多数APP的命运是:下载、打开一次、再也不碰、某天清理手机时删掉。
全球APP下载量在2025年同比下降了2.7%,降到1069亿次,这已经是连续第五年下滑。80%的用户说自己下载APP是因为"被要求"而不是"想要"。72%的人对此感到烦躁。45%的人只在真的需要时才会安装新APP。
APP经济没有崩塌(2025年全球应用内消费达到1558亿美元,同比增长21.6%),但它的增长引擎已经从"更多人装更多APP"变成了"已有用户在头部APP里花更多钱"。电商类APP安装量2025年下降了10%,但打开次数反而增长了5%。用户在收缩自己的APP版图,把注意力集中到少数几个。
Gartner预测,到2027年,AI助手将导致移动APP使用量下降25%。
为什么?因为APP模型的底层逻辑有一个根本性缺陷:它是以"工具"为中心的,不是以"意图"为中心的。
Photo by Rami Al-zayat on Unsplash
APP模型的逻辑缺陷
想订一张从北京到上海的机票。在APP模型下,需要这么做:打开携程或者飞猪,搜索航班,选时间,选座位,填乘客信息,付款。如果要比价,还要打开另一个APP重复这个流程。如果要同时订酒店,打开第三个APP。如果要把行程同步给同事,打开微信。如果要记录在日历里,打开日历。
一个"出差"的意图,被切碎成了5个APP的7个步骤。每一步都需要用户主动发起、手动操作、在不同界面之间切换。
APP模型的设计哲学是:每个APP解决一个领域的问题,用户自己负责把这些解决方案串起来。这在2008年APP Store刚诞生的时候是合理的,因为那时候手机的计算能力和AI水平都不足以理解用户的复杂意图。只能把任务切碎,每块交给一个专门的工具。
但这个模型有三个结构性问题:
第一,意图碎片化。用户的真实需求是完整的("帮我安排出差"),但被强制分解到多个APP里。每次跨APP切换都是一次认知负荷。职场人平均每天在不同数字工具之间切换消耗44小时/年的生产力。
第二,数据孤岛。每个APP只知道自己那一块。携程知道航班偏好,但不知道日历上有冲突。微信知道同事名单,但不知道出差目的地。没有任何一个APP拥有用户的全局上下文。
第三,被动响应。APP不会主动做任何事。不打开,它就是一个图标。所有的触发、判断、行动都依赖人类主动发起。
智能体模型恰好针对这三个缺陷给出了解法。
两条路线:手机+AI vs AI+手机
目前行业做"AI手机"有两条截然不同的路线。区别很重要。
手机+AI(AI as feature)。把AI当功能加进现有手机里。拍照更好看了,语音助手更聪明了,搜索更智能了。本质上还是APP模型,只是每个APP变得更强了。三星Galaxy S26和Apple Intelligence 2.0目前主要走的是这条路。Siri更会聊天了,能跨APP串联一些动作,但基本框架还是"用户打开APP,AI辅助操作"。
AI+手机(AI as OS)。让AI成为操作系统级的存在,APP退化为AI调用的后端服务。用户不需要知道"哪个APP能做这件事",只需要说出意图,智能体自己决定调用哪些服务、按什么顺序、怎么组合。努比亚NaviX Ultra和小米的"龙虾"(Miclaw)在尝试这条路。小米给龙虾开了超过50项系统级权限,让它能主动拆解任务、跨设备协同。
Google在Android上推的AppFunctions也是"AI as OS"的思路:让APP把自己的功能和数据通过API暴露给Gemini,Gemini作为统一入口理解用户意图,直接调用APP的能力而不需要用户打开APP界面。
这两条路线之间的差别,不是程度差别,是范式差别。
"手机+AI"不改变商业模式:APP Store还在,开发者还是做APP,用户还是下载APP。AI只是让每个APP更好用。
"AI+手机"改变一切:APP不再是用户交互的单位。用户交互的单位变成了"意图"。智能体接收意图,编排服务,交付结果。APP变成了API,界面变成了可选项。
Photo by Franck V. on Unsplash
芯片层的军备竞赛
智能体要在手机上跑起来,硬件得跟上。这正在催生芯片层面的一场军备竞赛。
高通Snapdragon 8 Elite Gen 5(2026年旗舰机标配):NPU速度比上一代快37%,每秒处理220个token,是上一代的三倍多。这意味着一个7B参数的端侧大模型可以在手机上实时运行,不需要联网。高通专门为这颗芯片打造了"Personal Scribe"功能,让AI持续学习用户行为,主动提供个性化建议。
Apple的方案是端云混合:7B参数模型跑在设备上处理日常任务,复杂请求通过"Private Cloud Compute"加密传到云端,苹果自己都无法解密。用户还可以选择外部大模型(ChatGPT、Claude、Gemini)作为Siri的"深度思考"后端。
中国厂商的芯片方案则走了更务实的路线。目前行业共识是端侧AI手机需要16GB以上内存和45 TOPS以上NPU算力。华为围绕自研昇腾芯片搭建国产算力底座,小米、OPPO、vivo更多依赖高通和联发科。但不管用谁家芯片,所有厂商都在做同一件事:把大模型推理能力从云端搬到手掌心。
为什么端侧这么重要?三个原因:延迟(云端往返几百毫秒,端侧几十毫秒),隐私(数据不出设备),可用性(没网也能用)。对智能体来说,延迟和可用性是生死线。一个响应慢半秒的助手,用户不会信任它去做决策。
中国的AI手机格局
中国市场的特殊之处在于:手机厂商比硅谷更激进地在推"AI as OS"路线。
截至2026年7月15日,华为小艺、OPPO AndesGPT、vivo蓝心、小米澎湃AI等7款手机端侧生成式AI服务已完成国家备案。这意味着端侧AI在中国进入了标准化商业运营阶段,不再是实验室概念。
各家的差异化路线开始分化:
小米走的是"系统级智能体"路线。龙虾(Miclaw)不是一个APP,是嵌入澎湃OS底层的系统级agent,拥有50多项系统权限,能主动拆解复杂任务、跨设备协同。小米把AI战略锚定在"人车家全生态"上,手机是中枢,但智能体的能力延伸到汽车和智能家居。小米集团总裁卢伟冰说未来三年投600亿在AI上。
OPPO走的是"记忆+隐私"路线。推"AIOS"战略,核心卖点是小布助手的长期记忆能力和隐私保护架构。和支付宝合作实现智能体跨端互联,小布可以调用支付宝近200项生活服务。这条路线的逻辑是:智能体的价值取决于它对用户的了解程度,记忆就是壁垒。
vivo走的是"影像+AI"路线。把摄像头定义为AI感知物理世界的"眼睛",在博鳌论坛上提出手机将从Smart Phone演进为Agent Phone。即将发布的X300 Ultra会搭载有场景识别能力的"影像Agent"。vivo的逻辑是:视觉是智能体获取环境信息的最重要通道。
华为走的是"全栈自主"路线。从昇腾芯片到鸿蒙OS到小艺助手,全链路自研。Mate 80系列预计2026年11月发布,预装鸿蒙OS 6智能体框架。华为的优势是芯片到操作系统的垂直整合能力,在端侧AI的优化深度上有天然优势。
努比亚和字节跳动的组合则代表了第三种可能:手机硬件商和AI内容平台的深度绑定。豆包不是一个手机助手,它背后是字节整个内容和服务生态。NaviX Ultra的智能体不只是能帮你打电话发短信,它能理解你在抖音上看了什么、在头条上搜了什么、在番茄小说上读了什么,然后基于这些全局上下文做决策。
APP会消失吗
不会。但APP的角色会从"前台"退到"后台"。
类比一下:今天的网站并没有因为有了搜索引擎而消失。搜索引擎改变的是用户发现和到达网站的方式。以前靠记住网址或者点收藏夹,后来靠搜索。网站的内容和功能还在,但"入口"变了。
智能体对APP做的事情类似。APP的功能(订机票、发消息、查天气)不会消失,但用户到达这些功能的路径变了。从"打开APP → 在APP里操作"变成"说出意图 → 智能体调用APP的API完成"。
这对不同类型的APP影响完全不同:
工具类APP(天气、计算器、翻译、日历):最先被消解。这些APP的功能简单、标准化、不需要复杂界面。智能体完全可以在后台调用它们的能力,用户不再需要单独打开。事实上很多这类功能已经被语音助手接管了,智能体只是做得更彻底。
服务类APP(出行、外卖、电商):界面层被压缩,API层更重要。用户不再需要打开美团比价然后打开饿了么再比一遍。智能体帮你比完直接下单。这些APP的竞争力从"界面体验"转向"服务质量和价格"。谁的API响应快、价格低、服务好,智能体就会推荐谁。
内容类APP(社交、短视频、游戏):受影响最小。这些APP的核心价值是内容体验本身,不是功能执行。刷抖音的乐趣在于"刷"这个行为,不在于"获取短视频"这个功能。社交媒体的价值在于互动本身。智能体可以帮你筛选和推荐,但很难完全"代替你刷"。
所以更准确的说法是:APP不会消失,但"打开APP"这个动作会大量减少。Google把这个趋势叫"intent-centric"(以意图为中心),Android的AppFunctions就是让APP把自己变成智能体可以调用的服务节点。
商业模式的重构
如果智能体成为用户和服务之间的中间层,APP经济的商业模式会发生根本变化。
目前APP经济的核心模式是:APP Store收30%佣金,开发者通过下载量、广告、内购变现。整个链条的假设是"用户在APP里花时间"。广告模式需要用户看到广告,订阅模式需要用户持续打开,内购模式需要用户在界面里操作。
当智能体代替用户做了大量操作,这些假设就动摇了。
如果用户不打开APP,广告展示给谁看?如果智能体帮用户比价后直接选了最便宜的,品牌溢价怎么维持?如果用户通过语音指令完成购物,APP Store的30%佣金还收得到吗?
Apple已经在警惕这个趋势。AI应用在App Store的营收2025年增长了4倍,苹果从生成式AI应用中抽成约9亿美元,2026年预计突破10亿。苹果的策略很清楚:如果智能体要调用任何服务,最好通过Siri来调,而Siri是苹果的。
Google的策略不同:让Gemini成为Android上的统一智能体入口,APP通过AppFunctions把能力暴露给Gemini。Google不靠APP Store佣金赚钱(Play Store的抽成远低于Apple),它靠的是广告。如果Gemini成为所有交互的入口,广告的投放位置就从APP内转移到了智能体对话流里。
中国市场更复杂。微信小程序本来就已经消解了一大批APP的存在意义(不用下载,用完即走),智能体进一步加速了这个过程。OPPO小布和支付宝打通近200项服务,本质上就是"智能体直接调用服务API,跳过APP"。
新的商业模式可能长这样:智能体根据用户意图选择最优服务提供方,服务方按成交付费(类似搜索引擎的竞价排名,但标的从"点击"变成了"结果")。掌握智能体入口的平台(手机OS、超级APP、云端大模型服务商),成为新的流量分发者。
真正的问题不是技术
智能体手机面临的最大障碍不是芯片算力不够、大模型不够聪明这些技术问题。这些问题按照当前的迭代速度,一两年内都能解决。
真正的障碍是生态利益冲突。
现在的GUI Agent(智能体通过模拟点击操作APP界面)路径,本质上是在APP不合作的情况下硬着头皮做。智能体"看"屏幕上的按钮,模拟人类点击。这种方式在复杂界面下准确率不够,而且APP更新一次界面,智能体就可能失灵。
理想方案是APP主动开放API给智能体调用(Google AppFunctions的思路)。但APP开发者凭什么配合?把用户交互权让给智能体,等于把流量入口拱手让人。广告展示没了,品牌露出没了,用户数据也拿不到了。
这和当年PC互联网到移动互联网的转型很像。2010年前后,很多网站不愿意做APP,觉得"凭什么在别人的平台上寄人篱下"。最后的结果是:不做APP的死了,做了的活了。不是网站主动选择,是用户用脚投票。
智能体时代的逻辑一样:当用户习惯了说一句话就完成任务,他们不会再忍受在5个APP之间来回切换。不开放API的APP会发现自己的打开率在下降。用户不是"不需要你的服务了",是"不需要你的界面了"。
终局:内容不再是给人看的
把这个逻辑再往前推一步,会看到一个更根本的变化。
今天的APP在做什么?整理内容给人看。美团把餐厅信息整理成卡片,让人用眼睛扫、用手指滑。淘宝把商品信息整理成详情页,配上图片、视频、好评,让人做购买决策。携程把航班信息整理成列表,按价格、时间、航空公司排序,让人选。
所有APP的UI设计、信息架构、视觉层次,都是为了同一个目的:帮助人类的大脑高效处理信息。排版是为了人的阅读习惯,颜色是为了人的注意力引导,交互是为了人的操作效率。
当智能体代替人去完成这些任务,"消费者"从人变成了agent。agent不需要好看的UI,不需要图片轮播,不需要视觉层次。它需要的是结构化数据、清晰的语义标签、可靠的API接口。
这意味着整个内容和服务的呈现逻辑要翻转。今天是"整理内容给人看",未来是"整理内容给智能体看"。
餐厅不需要在美团上放精修图片和煽情文案了,它需要把菜品信息、价格、过敏原、出餐时间结构化,让智能体能精确匹配用户需求。电商商家不需要拍15张详情页长图了,它需要把商品参数、真实评价、退换政策以机器可读的格式暴露出来。航空公司不需要把航班信息排成漂亮的列表了,它需要提供实时、准确、语义清晰的API。
谁先做好"对智能体友好"的内容和服务结构,谁就先拿到智能体时代的流量。这和2010年移动互联网起来时"谁先做好移动端适配谁先拿流量"是同一个逻辑。
更深一层:当人不再直接"看"内容,品牌和营销的逻辑也要变。今天品牌花大钱做视觉设计、投信息流广告、做KOL种草,核心都是影响人的认知和情绪。当购买决策被智能体接管,影响智能体的决策因子是什么?是价格、质量、匹配度、历史口碑这些硬指标。感性营销让位于理性参数。品牌力不是消失了,但它的作用点从"影响人的感知"变成了"影响智能体的权重"。
这是一个比"APP变成API"更深的变化。不只是人机交互的入口变了,是整个商业内容的生产逻辑、消费逻辑、分发逻辑都要重写。
我们怎么看这件事
从做AI商业语义处理十年的经验看,"手机+AI"和"AI+手机"的区别,本质上就是"流程工具"和"结果交付"的区别。
APP是流程工具。它给你一个界面,帮你一步一步完成某个任务。你得知道自己要什么,知道该打开哪个APP,知道怎么操作。
智能体是结果交付。你说出意图,它理解你的上下文,编排后端服务,交付结果。你不需要知道背后调用了哪些APP、哪些API、走了什么流程。
跃盟一直在做的事情,就是让AI理解具体商业场景的具体语义,然后在那个语义上直接交付结果。手机只是AI交付结果的终端之一。当手机从"APP容器"进化为"智能体载体",手机上的AI商业化逻辑,和我们在企业侧做的事情,底层是同一套。
不管是企业内部的工作流agent,还是手机上的个人助理agent,核心挑战都一样:怎么从用户的一句话里抽取准确的意图,怎么在多个服务之间做最优编排,怎么保证结果靠谱。这些能力不在某个APP里,在APP背后那个理解语义的AI层里。
努比亚和豆包的组合,只是这个趋势的第一个显性信号。真正的变化不在于哪款手机卖得好,而在于整个产业对"用户和服务之间的交互单位"的重新定义。
从打开APP到说出意图,从点击按钮到交付结果。人机交互的计量单位变了。这件事一旦发生,回不去。
王冉,跃盟科技创始人。连接稀缺人类岗位与AI专家智能体。
本文仅代表个人观点,不构成投资建议。文中数据来自Gartner、Sensor Tower、Appfigures、Qualcomm、Apple、Samsung及各公司官方公告。
夜雨聆风