夜雨聆风学习资料网

ARTICLE · 1047093

AI入口新战场:手机和汽车,豆包入局

AI入口新战场:手机和汽车,豆包入局

✦ 约 6800 字阅读约 15 分钟

2026年9月的第三周,可能是中国AI产品史上密度最高的72小时。

9月14日,豆包手机助手消费者版发布,两天后努比亚NaviX Ultra开售,5999元起,官方称之为"全球首款AI智能体手机"。

9月17日,豆包与火山引擎联合发布豆包座舱助手,首款搭载车型荣威家越07,9月21日开启预售,上汽奥迪相关车型年内亮相。

一部手机,一辆车,两大离用户最近的终端,同一个助手

如果你只把这当成两条普通的发布会新闻,就错过了这盘棋真正的杀招。手机和汽车,恰恰是个人Context最完整的两个容器——你的相册、短信、录音、订单在这里,你的位置、习惯、家人也在这里。

过去两年,AI融入进了所有软件,却始终没有真正融入你的生活。而这两场发布,加上一份此前被大多数人忽略的协议,可能正在补上AI落地的最后一公里——也可能,正在拉开AI时代"入口级战争"的序幕。

01被全网封杀,豆包的退路

要看懂豆包手机助手这次的产品力,得先回到去年12月那场著名的翻车。

2025年12月,豆包手机助手以技术预览版随努比亚M153工程机限量发售,3499元,上线秒空,二手市场一度炒到3.6万元。它做的事很惊艳:一句"帮我比价下单",AI就在微信、美团、淘宝之间自主跳转,读屏幕、认按钮、模拟点击,全程替你操作。

但技术上的惊艳,很快撞上了现实的南墙。多位用户反馈,用AI操作微信时账号因"登录环境异常"被迫下线,淘宝、银行类App相继触发风控。短短几天,国民级应用集体把豆包拉黑,最初演示的惊艳操作能力无奈被迫下线。

问题的核心从来不在技术,而在控制权力:当Agent替用户操作第三方App时,谁有权决定这件事能不能做?App方认为自己被绕过了——GUI操作不需要任何App配合,等于绕开了平台的分发规则和商业底线。于是它们选择了最简单的方式:封禁。

九个月后的9月14日,豆包手机助手消费者版回来了。这次最引人注目的不是更聪明的模型,而是一份看似不起眼的文件——屏幕自动化操作声明协议(SAEP),同步启动为期30天的公示,至10月15日结束。

这份协议的规则,一句话就能说清楚:第三方应用自己决定,允不允许AI助手做自动化操作。细节如下:

  • 分类分级,不再一刀切
    ——开发者可以整体拒绝,也可以只限制具体动作:内容修改、最终发布、删除、签到抽奖、权益领取,各设各的边界;
  • 表态即可,随时生效
    ——接入协议声明或回复官方邮件,两种方式效力相同,拒绝声明则立即列入不可操作清单;
  • 公示期内,默认不操作
    ——公示期间只动系统应用、字节系应用和明确同意的第三方,其余一律不碰。

有学者把它称为"AI时代的Robots协议"。1994年,荷兰工程师Martijn Koster被失控的爬虫拖垮了服务器,由此提出Robots协议:网站用一个文件声明哪些内容允许抓取。三十年后,SAEP处理的是同一类问题——当自动化程序要进入别人的地盘,边界由被进入方声明,规则公开透明,拒绝即生效

有意思的是另一组细节:M153的老用户发现新版不能随便操作第三方App了,集体"炸锅"。有人吐槽"习惯了用AI打车点外卖,已经不习惯手动了"——这种被戏称为"Agent综合症"的依赖,恰恰证明了一件事:一旦用户尝过"动嘴不动手"的滋味,就再也回不去了

原来产品力的最高境界,是让用户不自觉地产生依赖。

02手机助手:推到指尖,读懂conetxt,立规矩

回到产品本身。相比去年那场"炫技式"的技术预览,消费者版的豆包手机助手做了三个不动声色、但分量极重的动作。

▍动作一:把入口推到指尖

专属AI键+指纹鉴权,锁屏状态下不用解锁,按住AI键说一句话,就能直接执行任务。同时优化了远场、内噪、嘈杂环境下的语音唤醒,加入屏幕问答——不用截图、不用切应用,它能直接理解当前屏幕和摄像头里的内容。

举个官方演示的例子:拿手机对着家里的装修环境说一句"按照这个风格,帮我找一个一米二以内、1000元以下的柜子"。过去你要拍照、打开淘宝、输入筛选条件、自己挨个比对;现在,AI同时理解眼前的风格和你的预算。

这个变化看起来小,产品逻辑却很清晰:AI不再只是手机里的一个App,而开始变成一个随时可以调用的系统入口。

▍动作二:读懂你的Context

消费者版本为本地数据提供了搜索工具——在用户授权的前提下,可以检索相册、短信、便签。你问"港澳通行证什么时候到期",它自己去翻相册里的证件照和短信通知。办公场景接入飞书妙计,问"昨天用户访谈里提了什么建议",它结合录音和本地搜索直接给你答案。

这个方向的印证者,是苹果。今年6月苹果新一代Siri AI,把Personal Context(个人情境)、Onscreen Awareness(屏幕感知)和跨App Actions(跨应用操作)放在了核心位置。中美两家头部玩家,押注的是同一件事。

为什么Context这么重要?因为AI产品和过去的软件有一个根本区别:互联网产品的路径是提前设计好的,用户按流程走;AI面对的却是一句话、一张图,需求天然开放。谁了解更多用户Context,谁就更容易理解真实意图。而手机,恰好是个人Context最完整的设备。

▍动作三:给生态立规矩

智能体进入App,路只有两条。一条是许可制:App方为智能体专门开发接口,在许可范围内调用。今年6月微信与华为、荣耀、小米等厂商合作的A2A能力就是这一路——执行者是微信自己,开放什么、和谁合作,微信说了算。Google安卓的App Functions同理。可控,但门槛高,注定只发生在头部App与大厂之间。

另一条是声明制,SAEP走的这条路:智能体一方公开规则,App方只需表态,AI按声明执行。它瞄准的正是许可制够不着的大量中腰部App——没有资源为AI开发接口,也不在任何谈判名单上。

互联网时代争夺的是用户注意力,AI时代开始争夺用户意图。

03豆包上车:从听懂一句话,到读懂一车人

如果说手机助手解决的是"一个人和一个屏幕如何互动",那么9月17日的豆包座舱助手,要解决的是一道难度翻倍的题:一辆车、多个人、多个屏幕如何互动

先看架构。豆包座舱助手参与到汽车"感知—决策—执行"的完整链路:能感知数百种车辆信号,联动车控、导航、辅助驾驶、娱乐等数千个整车原子能力。以荣威家越07为例,上汽就向豆包开放了超过2000项SOA服务接口。

更关键的是,这套系统没有写规则,判断全部由模型完成

《晚点LatePost》的实测给出了具象答案。测试者在一辆测试车里让豆包找拍照好看的地方,随后改成找文艺街区,又接着问在哪停车和吃饭,最后启动导航——整个过程没有一条完整的指令。目的地是在几个人的否定、补充和改变主意中逐渐形成的。几次插话之后,AI仍然记得目的地、被否定过的选项,以及还有哪件事没有处理完。

例如你说"感觉这个风一直对着我脸吹",它降低风量、关上车窗、把主驾出风口调成避人吹——这需要它同时知道车上有这个功能、此刻是什么状态、你过去怎么选。你说"午睡一会,1点叫我",它调座椅、关遮光帘、降风量、放轻音乐、开按摩,到点叫醒你并提醒下午的日程。你说"想带孩子出去玩,开车一小时以内,能推婴儿车,人别太多,吃饭停车方便一点",它综合车程、预算、偏好做规划,直接指挥导航。

从"精确下达功能指令"到"持续完成开放任务",这是车载交互六十年来第一次真正范式转换。

但座舱助手的真正产品力,藏在三个容易被忽略的设计里。

▍第一,权限的"红绿灯"设计

荣威与火山引擎把整车操作划成三区:彩区(无关安全,如空调、灯光,AI直接调)、灰区(涉及车辆状态,受底层规则限制)、黑区(刹车、转向等核心驾驶控制,永远不向座舱大模型开放)。官方演示中副驾以快迟到为由要求开快一点,豆包先重新规划了更快的路线,当需求涉及提高巡航速度时,它转而向主驾确认,获得允许才执行。能力越大,边界越清晰——这是AI产品最稀缺的克制。

▍第二,"越用越懂你"的身份记忆

车里不比手机,手机面对一个人,车里有主驾、副驾、后排。豆包结合声源位置、座位和车内摄像头识别身份,把习惯绑定到人。测试者告诉它"以后开空调不要让风吹脸",另一名乘客说"我说'有点闷'时,希望打开左后车窗"——几分钟后,同一个人再说"有点闷",它按刚才形成的偏好开了对应的车窗。你甚至可以直接用自然语言教它规矩,不必进菜单配置。

▍第三,一个会"长身体"的豆包屏

车载豆包屏让豆包成为车上的常驻形象,配合对话展现表情动画,还能转向、摆动、摇头。四音区识别,谁在说话、说给谁听,任一音区唤醒后全车自由交流,无需重复唤醒。虽然豆包屏形式上和NOMI有些雷同,但用户对豆包IP的心智粘性不容小觑。

还有一个数据值得所有产品人琢磨:今年4月,火山引擎披露汽车端豆包大模型的日常调用中,车控占53%,导航占29%。单一动作——比如"导航回家"——点一下屏幕就行,本质上不需要大模型。只有面对复杂意图,需要完成多项任务时(上车、调空调、导航、回应家人),大模型的价值才显现。这个数据等于宣告:车载AI的真实战场,不是让车机更博学,而是让汽车适应人的表达、习惯和不断变化的需求。

顺带说一句商业模式。火山引擎与车企有两种合作:一种是AI座舱套件,车企自选能力、保留品牌和用户关系,上汽奥迪E7X的奥迪助手、特斯拉中国接入豆包的车机语音都属于这种;另一种是完整豆包座舱助手,字节与车企联合定义、联合设计,火山引擎需要为此投入百人规模团队。这套逻辑像极了AWS和Shopify——供应商提供通用能力,客户提供真实可靠应用场景,联合在通用能力上做产品创新。一个缺技术,一个缺场景,正好一拍即合。

04产品初心:靠近用户需求

把手机和汽车两场发布放在一起看,你会发现豆包的打法高度一致——不是把AI做得更强,而是让AI体验离用户更近

端侧AI过去缺的,从来不只是更强的模型,而是一套真正能理解用户、调用设备、进入生态的产品形态。

拆开来看,这套产品哲学有三个层次:

交互层:从"人适应机器"到"机器适应人"。过去十五年,我们把上千个功能从实体按键赶进触摸菜单,让用户学习层级、记忆路径、精确表达。而无论是手机上"按住AI键直接说",还是车里的"目的地在几个人的改变主意中逐渐形成",产品都在做同一件事:把复杂留给产品,把简单留给用户。

数据层:Context不是窥探,是授权。豆包手机助手让用户自主设置可搜索的范围,座舱助手的记忆绑定在具体身份上、可以随时用自然语言改写。这里有一条必须守住的红线:记忆应该是习惯的沉淀,而不是数据的囤积。信任是入口的前提,而不是成本项。

生态层:不绕开冲突,回到谈判桌。从"封或不封"的二元对抗,到"全局禁用、特定页面禁用、限制发布、限制删除"的多档开关——SAEP真正改变的是博弈的结构:把事后发生的技术冲突,转化为事前共识、可持续调整的规则协商。

而再往深一层问:为什么字节不造车、不亲自做手机,却执意做一个跨终端的助手?

因为助手是具有"连续性+全局性"特性。你在一个终端上养成的习惯、积累的记忆、建立的信任,会跟着你走到下一个终端。手机里选好的目的地,交给汽车接着处理——手车互联打通的那一刻,助手第一次有机会承接一段跨越设备的完整任务。入口的价值,不在于占据某个设备,而在于占据用户与数字世界之间那条不间断的关系。

05入口级效应,成就AI时代商业霸主

现在可以回答那个更大的问题了:为什么一部手机和一辆车,值得一家巨头重金投入、且"不考虑利润"?

因为入口,是每一代技术周期里最值钱的东西。谁掌握入口级应用,谁才可能成为AI时代的商业霸主。

时代
入口形态
赢家拿走的东西
PC时代
浏览器 / 搜索框
信息分发的控制权(微软、谷歌)
移动时代
超级App(如微信)
用户时间的分配权(微信、淘宝)
AI时代
助手接住的第一句话
用户意图的独家代理权

每一次入口更迭,本质上都是一次分发权的转移。移动互联网时代用户在不同App间切换完成任务;AI时代,头部厂商试图通过一个对话入口整合所有服务,本质上是在构建新一代操作系统。流量分发逻辑将从App中心化,转向任务中心化。

因为,入口即分发权。这个转移一旦发生,杀伤力比前两次更大,原因有三个。

第一,入口级效应天然赢家通吃。用户不会养五个助手。谁先让用户形成依赖,谁就掌握生态主导权——而"依赖"这东西,M153用户已经替豆包验证过了:习惯了动嘴,就不想再动手了。

第二,釜底抽薪,动的是超级App的商业根基。如果Agent直接理解需求、筛选服务、完成交易,超级App就会从"入口"退化为"后台供应商"。有分析师提过一个尖锐的问题:AI手机能打开瑞幸,但它会不会把楼下的独立咖啡馆和瑞幸一起推荐给用户?控制了服务推荐权,就控制了下一代流量命脉。这不是技术问题,是整条价值链的重分配——也正因此,超级App的抵抗注定激烈。

第三,它有最强的数据飞轮。用户越多→交互数据越多→模型越懂你→体验越好→用户更多。豆包目前3.82亿月活、同比增长172.1%、断层式行业第一,累计注册用户近10亿——这个飞轮一旦在端侧场景转起来,云端App的先发优势会被快速稀释。

值得玩味的是,豆包的入口级野心有一个其他玩家没有的支点:它同时握着云、端、车三个入口。云端App养习惯,手机助手占指尖,座舱助手占通勤,办公场景还有飞书和豆包。每一个入口都在为同一个身份、同一份记忆、同一个信任关系蓄水。

06竞争格局:四张牌桌,三条路线

这场战争当然不是豆包一个人的牌局。把镜头拉远,至少有四张牌桌同时开打。

牌桌
主要玩家
关键筹码
手机端
华为小艺(2100+系统能力、95%跨App准确率)、荣耀YOYO(3000+场景、L3认证)、小米超级小爱(人车家)、苹果Siri
系统权限
云端助手
豆包3.82亿、千问1.67亿(+5792.9%)、DeepSeek1.30亿、腾讯元宝、百度DuMate
用户规模
汽车座舱
华为鸿蒙座舱、理想MindGPT、特斯拉、豆包座舱(荣威/奥迪)
整车原子能力
办公/PC
Anthropic Computer Use、GPT-6 Astra、豆包工作、千问办公、WorkBuddy
生产力场景

四张牌桌之上,其实是三条路线的路线之争

  • 系统级路线
    (华为、荣耀、苹果)——OS是主场,权限是王牌,但被锁死在自家硬件里;
  • 许可制路线
    (微信A2A、Google App Functions)——生态是王牌,但进度受制于每一个谈判对手;
  • 声明制路线
    (SAEP)——门槛最低、覆盖面最广,但公信力需要时间验证:Robots协议成为共识,前提是主流玩家都愿意遵守。

一个判断是:三条路线终将分层共存,系统层给权限,生态层定规则,模型层做理解。没有任何一家能通吃三层,所以逻辑上未来的格局大概率不是"一个超级助手",而是"几大助手体系+一层公共协议"。

写在最后

AI助手都在争夺下一个入口,到底谁能赢?大概是看四件事。

信任是门票。豆包已经为权限争议付过学费,也因此成为最早把边界设计(彩灰黑区、分类分级声明)做进产品的玩家。但要清醒意识到,当AI开始替用户决策、授权支付,一次安全事故就足以摧毁全部信任积累。信任的建立以年计,崩塌以天计。

生态协同是护城河。"2026年不再比哪家模型参数更大,而是看谁能把技术、产品、商业拧成一股绳。" 单一功能的优势无法构筑护城河,唯有跑通"数据—体验—转化—反馈"的正循环。

跨端连续性是胜负手。这恰恰是豆包最独特的一张牌——3.82亿月活积攒的熟悉感,正被系统性地导入手机和汽车。手机里养成的习惯跟人上车,车里的记忆跟人回家。对手们有的占系统、有的占生态,只有豆包在把三个入口串成一条用户关系

商业化耐心是隐藏门槛。别忘了豆包App今年上半年单日营收不到百万,与流量规模严重不符——入口之战是十年之战,前期拼的全是战略定力。好在字节从不缺这个。

当然,超级App不会甘心退居后台,封禁与协议的拉锯将持续多年;监管这只手只会越来越清晰——备案只是入场券,智能体操作的法律责任归属(法学界已有"效果归于用户"的共识)和算法推荐的公平性,都是悬而未决的议题;而最朴素的一条是,当前各品牌AI功能的实际打开率并不高,存量市场里,用户没有第二次耐心。

方向已定!入口之争再大,最后都要回归底线,进行深度灵魂拷问——AI到底是在代表用户,还是在代表它背后的平台和商业利益。

因为,对我们每个普通人来说,真正关心的问题只有一个:当AI替你说了第一句话,它说的,到底是不是你想说的?

数据来源:硅基观察PRO/晚点LatePost/澎湃新闻/字节官媒等

相关学习资料