ARTICLE · 1039006
从手机到汽车,豆包正在做一件比超级App更大的事
9 月 14 日,豆包手机助手消费者版正式发布。
9 月 16 日,首款搭载消费者版豆包手机助手的努比亚 NaviX Ultra 开售。
仅仅一天之后,9 月 17 日,火山引擎又正式发布了 豆包座舱助手。
三天。
手机。
汽车。
两个完全不同的终端。
表面看,是字节连续发布了两个 AI 产品。
但如果把它们放在一起看,会发现一件更有意思的事情:
豆包正在试图从“一个 AI App”,变成存在于不同设备之间的智能层。

这件事,可能比再做一个“超级 App”大得多。
因为超级 App 想做的是:
让你什么事情都在我的 App 里完成。
而 Agent 想做的是:
你甚至不需要关心自己正在使用哪个 App、哪台设备。
你只需要告诉 AI:
“我要做什么。”
剩下的事情,由它自己去完成。
这可能才是豆包最近一连串动作真正值得关注的地方。
01|短短三天,豆包从手机走进了汽车

先来看时间线。
9 月 14 日
豆包正式发布手机助手消费者版。
这次并不是简单升级豆包 App,而是和手机厂商在系统层面合作。
豆包开始获得过去普通 App 很难拥有的能力:
理解当前屏幕 搜索本地照片、短信、便签等信息 保存和调用个人记忆 调用日历、电话、闹钟等系统工具 执行多步骤手机任务 在允许范围内操作第三方 App
例如,你不需要截图再发给豆包。
打开相机对着房间直接说:
“按照这个装修风格,帮我找一个一米二以内、1000 元以下的柜子。”
助手可以结合当前画面继续完成搜索。
这已经和传统 AI App 有明显区别。
传统 AI 是:
你把信息拿给它。
而系统级 Agent 开始变成:
它理解你当前正在做什么。
9 月 16 日
首款搭载消费者版豆包手机助手的努比亚 NaviX Ultra 正式开售。
但更重要的问题也马上暴露了出来:
AI 会操作手机,不代表手机里的每个 App 都愿意让 AI 操作。
豆包为此推出了一套叫 SAEP 的屏幕自动化操作声明协议。
第三方 App 可以自己决定:
允许不允许 AI 在自己的应用里执行自动化操作。
如果明确拒绝,豆包就不会继续操作。
这件事非常关键。
因为它第一次把 AI 手机真正的矛盾暴露出来了:
技术已经会点按钮了,但生态未必愿意交出按钮。

9 月 17 日
豆包又进入了另一个设备。
汽车。
火山引擎正式发布 豆包座舱助手。
它的定位也不是:
“在车机里装一个豆包聊天框。”
而是希望让 Agent 参与汽车完整的:
感知 → 决策 → 执行
链路。
按照公开信息,它可以感知数百种车辆信号,同时调用车控、导航、辅助驾驶、娱乐等数千个整车原子能力,再根据一个任务自动拆解并执行。
这就完全不是“车载 ChatGPT”了。
02|传统车机听懂一句话,Agent 想理解一件事
过去的汽车语音助手,其实已经很好用了。
你可以说:
“打开空调。”
“车窗降下来。”
“导航回家。”
“播放周杰伦。”
这些本质上都是:
一句指令 → 一个功能。
后来大模型进入汽车以后,汽车开始更会“听懂人话”。
例如你不再需要说:
“空调调到 23 度。”
而可以说:
“有点冷。”
AI 理解意思以后,再调整温度。
但它最终完成的依然是一件事。
豆包座舱助手真正想往前走的是:
一句话对应一整套任务。
例如:
“孩子准备在后排睡觉了。”
一个真正的汽车 Agent 应该理解:
这可能意味着:
后排温度需要调整 音乐音量应该降低 阅读灯可以关闭 座椅可能需要调整 娱乐内容应该暂停或者降低声音
过去,这些是五六个不同按钮。
未来,可能只是一个意图。
用户描述目标,AI 自己组合能力。
这就是 Agent 和传统语音助手最大的区别。
03|有意思的是:汽车可能比手机更适合 Agent
这件事乍一听有点反常。
毕竟我们每天使用时间最长的智能设备还是手机。
为什么汽车反而可能更适合 Agent?
原因很简单:
权限。
手机里可能有几十甚至上百个 App。
微信属于腾讯。
淘宝属于阿里。
美团属于美团。
小红书属于小红书。
豆包想替你:
发消息、
订餐、
购物、
打车、
发内容,
就意味着必须不断进入别人的地盘。
模型能不能看懂按钮是一回事。
有没有权替你按下那个按钮,是另一回事。
这也是为什么豆包手机助手这一次专门推出 SAEP 协议,把是否允许自动化操作的权力交给第三方应用。
汽车就不一样了。
空调是谁的?
车企的。
座椅是谁的?
车企的。
车窗、灯光、导航、音响、驾驶模式……
大量能力本来就在一套完整的汽车系统里。
只要汽车厂商愿意开放接口,
Agent 不需要一家一家去找第三方 App 谈判。
04|更重要的是,汽车天生就是一台“有眼睛、有耳朵、有手脚”的计算机
手机 Agent 很重要。
但从 AI 的视角来看,汽车其实是一种非常特殊的设备。
因为汽车天然拥有大量传感器:
摄像头 麦克风 GPS 温度传感器 座椅状态 车门状态 车辆状态 驾驶环境信息
这些相当于 AI 的:
眼睛和耳朵。
同时汽车又拥有:
空调 车窗 座椅 灯光 音响 导航 娱乐系统
这些又相当于 AI 的:
手和脚。
过去汽车其实什么都不缺。
缺的是一个能够理解人的目标,然后把这些零散能力组织起来的“大脑”。
Agent 恰好想补上这一层。
所以豆包进入汽车真正值得关注的,并不是:
“豆包现在也能在车里聊天了。”
而是:
AI第一次开始大规模接触一台真正能够改变现实环境的机器。
05|其实豆包早就在汽车里了,这一次不同的是“身份”
这里还有一个容易被忽略的细节。
豆包并不是 9 月 17 日才第一次进入汽车。
火山引擎今年 4 月公开的数据已经显示:
搭载豆包大模型的智能汽车超过 700 万辆,覆盖超过 50 个汽车品牌、145 个车型。
也就是说:
豆包早就在很多汽车背后提供模型能力。
但以前更多像:
汽车系统背后的 AI 大脑。
这一次“豆包座舱助手”的变化是:
它开始从后台模型走到前台,成为一个完整的 Agent 产品。
官方公布的首款搭载车型是上汽荣威家越 07,目前即将开启预售;上汽奥迪相关车型也计划年内亮相。
这两种模式差别非常大。
一种是:
汽车调用豆包。
另一种是:
豆包开始调度汽车。
这才是值得关注的变化。
06|手机和汽车之间,也开始出现一条“连续的任务链”

豆包座舱助手还有一个很有意思的能力:
手车互联。
按照公开介绍,用户可以直接在豆包 App 中:
查询车况 远程控车 把聊天中的行程推送到车机
例如你在家里和豆包聊天:
“周末想带孩子出去玩,找一个两小时车程以内、不太晒、附近还能吃饭的地方。”
AI 帮你把目的地和路线讨论好。
过去的流程可能是:
找完地点 → 复制地址 → 打开地图 → 收藏 → 上车 → 再打开车机导航 → 重新搜索。
如果未来上下文真的能够连续,
流程可能变成:
你在手机上做完决定,坐进车里以后任务直接继续。
设备切换了。
但任务没有重新开始。
这件事表面上只是“手机和车机互联”。
但它背后的意义其实很大:
未来真正持续存在的,可能不是 App,而是 Agent 的上下文。
07|这就是为什么,我觉得豆包做的已经不只是“超级 App”
过去十几年,中国互联网一直在做超级 App。
微信、支付宝、美团、淘宝……
所谓超级 App,本质是:
尽可能把更多服务装进同一个 App。
支付。
打车。
购物。
外卖。
小程序。
内容。
用户最好不要离开。
但是 Agent 的逻辑恰恰不同。
Agent 并不一定需要把所有服务都变成自己的。
它真正想占据的位置是:
用户和所有服务之间。
以前:
用户 ↓ 打开手机 ↓ 找到 App ↓ 找到功能 ↓ 执行操作
未来:
用户 ↓ 告诉 Agent 目标 ↓ Agent 自己寻找能力 ↓ 调用 App / 系统 / 设备 ↓ 完成任务
这就是一个非常大的变化。
08|超级 App 想拥有所有服务,Agent 想拥有“调度权”
这可能是理解豆包最近这些动作最关键的一点。
豆包不需要自己做:
地图。
汽车。
外卖。
酒店。
音乐。
购物。
它真正需要的是:
当用户产生一个目标时,豆包成为第一个知道这个目标的人。
然后它决定:
应该调用谁。
用什么工具。
在哪台设备完成。
如果这个位置成立,
Agent 实际获得的是一种非常重要的东西:
调度权。
过去互联网最重要的是:
流量入口。
谁掌握用户打开 App 的第一步,谁就拥有巨大的商业价值。
Agent 时代的入口可能变成:
谁最先知道用户“想干什么”。
这可能比传统 App 入口更靠前。
09|但手机恰恰说明:这条路不会那么顺利
如果只看豆包连续进入手机和汽车,很容易得出一个特别宏大的结论:
“AI OS 要来了。”
但现实显然没那么简单。
豆包手机已经遇到了第一个非常现实的问题:
第三方应用权限。
豆包手机助手公开回应显示,目前主要支持系统应用、中兴应用、字节系应用以及部分已经接入的第三方应用;其他应用的 GUI 自动化能力仍取决于后续协议和开发者授权。
所以 Agent 面临的瓶颈已经不完全是模型能力。
而是:
权限 安全 数据 商业利益 平台规则 用户授权
AI 越能执行任务,
这些问题反而越重要。
这也是为什么汽车值得特别关注。
它可能是 Agent 最早真正拥有完整执行能力的场景之一。
10|未来真正重要的,可能不是“你用哪个设备”
现在回头看豆包这一周的动作:
9 月 14 日:手机助手消费者版
↓
9 月 16 日:Agent 手机正式进入市场
↓
9 月 17 日:豆包座舱助手发布
把它们串起来以后,会出现一种完全不同的理解。
豆包可能并不只是在寻找:
“下一个超级 App。”
它真正想做的,也许更接近:
一个能够跟着用户在不同设备之间移动的 AI Agent。
今天它在手机上。
你出门以后,它到了汽车里。
以后如果它再进入:
电脑、
耳机、
眼镜、
电视、
智能家居、
机器人……
那么真正统一这些设备的就不再是:
某一个操作系统。
甚至也不是某一个 App。
而是:
同一个 AI。

11|设备可能越来越像 Agent 的“身体”
这可能也是未来几年 AI 硬件真正值得看的方向。
手机拥有:
屏幕、摄像头、App。
汽车拥有:
传感器、车控、导航。
眼镜拥有:
第一视角。
耳机拥有:
听觉和语音。
机器人拥有:
现实世界里的手脚。
每一个设备,其实都可以看成 AI 的一种“身体”。
Agent 在不同设备上获得不同能力。
所以未来真正的问题可能不是:
“豆包要不要做手机?”
而是:
豆包要成为多少种设备共同使用的大脑?
如果这个逻辑成立,
那么 AI 公司和硬件厂商之间的关系也会发生变化。
硬件提供:
感知与执行。
Agent 提供:
理解与决策。
写在最后
过去十几年,互联网公司都想做一件事:
让用户留在自己的 App 里。
于是我们有了超级 App。
但 Agent 时代出现了另一种可能。
未来用户甚至不需要知道:
自己正在调用哪个 App。
也不需要知道:
这个任务最后是在手机、汽车还是云端完成。
用户只需要说:
“我想做什么。”
AI 去决定:
用哪个服务。
调用哪个设备。
执行哪些步骤。
最终把结果交回来。
所以从手机到汽车,豆包这一周真正值得关注的,并不是:
“它又多了一个入口。”
恰恰相反。
它正在尝试让:
“入口”这件事本身变得没那么重要。
超级 App 的目标,是把尽可能多的服务装进一个入口。
而 Agent 更进一步:
它想成为所有入口之前的那个入口。
手机只是第一站。
汽车也不会是最后一站。
如果未来真的出现一个能理解你的长期需求、记住上下文,并且可以在手机、汽车、电脑、眼镜和家庭设备之间不断接力的 AI,
那么到那个时候,
我们可能不会再问:
“你平时最常用哪个 App?”
而会开始问一个今天听起来还有点奇怪的问题: