夜雨聆风学习资料网

ARTICLE · 1039006

从手机到汽车,豆包正在做一件比超级App更大的事

从手机到汽车,豆包正在做一件比超级App更大的事

9 月 14 日,豆包手机助手消费者版正式发布。

9 月 16 日,首款搭载消费者版豆包手机助手的努比亚 NaviX Ultra 开售。

仅仅一天之后,9 月 17 日,火山引擎又正式发布了 豆包座舱助手

三天。

手机。

汽车。

两个完全不同的终端。

表面看,是字节连续发布了两个 AI 产品。

但如果把它们放在一起看,会发现一件更有意思的事情:

豆包正在试图从“一个 AI App”,变成存在于不同设备之间的智能层。

这件事,可能比再做一个“超级 App”大得多。

因为超级 App 想做的是:

让你什么事情都在我的 App 里完成。

而 Agent 想做的是:

你甚至不需要关心自己正在使用哪个 App、哪台设备。

你只需要告诉 AI:

“我要做什么。”

剩下的事情,由它自己去完成。

这可能才是豆包最近一连串动作真正值得关注的地方。


01|短短三天,豆包从手机走进了汽车

先来看时间线。

9 月 14 日

豆包正式发布手机助手消费者版

这次并不是简单升级豆包 App,而是和手机厂商在系统层面合作。

豆包开始获得过去普通 App 很难拥有的能力:

  • 理解当前屏幕
  • 搜索本地照片、短信、便签等信息
  • 保存和调用个人记忆
  • 调用日历、电话、闹钟等系统工具
  • 执行多步骤手机任务
  • 在允许范围内操作第三方 App

例如,你不需要截图再发给豆包。

打开相机对着房间直接说:

“按照这个装修风格,帮我找一个一米二以内、1000 元以下的柜子。”

助手可以结合当前画面继续完成搜索。

这已经和传统 AI App 有明显区别。

传统 AI 是:

你把信息拿给它。

而系统级 Agent 开始变成:

它理解你当前正在做什么。


9 月 16 日

首款搭载消费者版豆包手机助手的努比亚 NaviX Ultra 正式开售。

但更重要的问题也马上暴露了出来:

AI 会操作手机,不代表手机里的每个 App 都愿意让 AI 操作。

豆包为此推出了一套叫 SAEP 的屏幕自动化操作声明协议。

第三方 App 可以自己决定:

允许不允许 AI 在自己的应用里执行自动化操作。

如果明确拒绝,豆包就不会继续操作。

这件事非常关键。

因为它第一次把 AI 手机真正的矛盾暴露出来了:

技术已经会点按钮了,但生态未必愿意交出按钮。


9 月 17 日

豆包又进入了另一个设备。

汽车。

火山引擎正式发布 豆包座舱助手

它的定位也不是:

“在车机里装一个豆包聊天框。”

而是希望让 Agent 参与汽车完整的:

感知 → 决策 → 执行

链路。

按照公开信息,它可以感知数百种车辆信号,同时调用车控、导航、辅助驾驶、娱乐等数千个整车原子能力,再根据一个任务自动拆解并执行。

这就完全不是“车载 ChatGPT”了。


02|传统车机听懂一句话,Agent 想理解一件事

过去的汽车语音助手,其实已经很好用了。

你可以说:

“打开空调。”

“车窗降下来。”

“导航回家。”

“播放周杰伦。”

这些本质上都是:

一句指令 → 一个功能。

后来大模型进入汽车以后,汽车开始更会“听懂人话”。

例如你不再需要说:

“空调调到 23 度。”

而可以说:

“有点冷。”

AI 理解意思以后,再调整温度。

但它最终完成的依然是一件事。

豆包座舱助手真正想往前走的是:

一句话对应一整套任务。

例如:

“孩子准备在后排睡觉了。”

一个真正的汽车 Agent 应该理解:

这可能意味着:

  • 后排温度需要调整
  • 音乐音量应该降低
  • 阅读灯可以关闭
  • 座椅可能需要调整
  • 娱乐内容应该暂停或者降低声音

过去,这些是五六个不同按钮。

未来,可能只是一个意图。

用户描述目标,AI 自己组合能力。

这就是 Agent 和传统语音助手最大的区别。


03|有意思的是:汽车可能比手机更适合 Agent

这件事乍一听有点反常。

毕竟我们每天使用时间最长的智能设备还是手机。

为什么汽车反而可能更适合 Agent?

原因很简单:

权限。

手机里可能有几十甚至上百个 App。

微信属于腾讯。

淘宝属于阿里。

美团属于美团。

小红书属于小红书。

豆包想替你:

发消息、

订餐、

购物、

打车、

发内容,

就意味着必须不断进入别人的地盘。

模型能不能看懂按钮是一回事。

有没有权替你按下那个按钮,是另一回事。

这也是为什么豆包手机助手这一次专门推出 SAEP 协议,把是否允许自动化操作的权力交给第三方应用。

汽车就不一样了。

空调是谁的?

车企的。

座椅是谁的?

车企的。

车窗、灯光、导航、音响、驾驶模式……

大量能力本来就在一套完整的汽车系统里。

只要汽车厂商愿意开放接口,

Agent 不需要一家一家去找第三方 App 谈判。


04|更重要的是,汽车天生就是一台“有眼睛、有耳朵、有手脚”的计算机

手机 Agent 很重要。

但从 AI 的视角来看,汽车其实是一种非常特殊的设备。

因为汽车天然拥有大量传感器:

  • 摄像头
  • 麦克风
  • GPS
  • 温度传感器
  • 座椅状态
  • 车门状态
  • 车辆状态
  • 驾驶环境信息

这些相当于 AI 的:

眼睛和耳朵。

同时汽车又拥有:

  • 空调
  • 车窗
  • 座椅
  • 灯光
  • 音响
  • 导航
  • 娱乐系统

这些又相当于 AI 的:

手和脚。

过去汽车其实什么都不缺。

缺的是一个能够理解人的目标,然后把这些零散能力组织起来的“大脑”。

Agent 恰好想补上这一层。

所以豆包进入汽车真正值得关注的,并不是:

“豆包现在也能在车里聊天了。”

而是:

AI第一次开始大规模接触一台真正能够改变现实环境的机器。


05|其实豆包早就在汽车里了,这一次不同的是“身份”

这里还有一个容易被忽略的细节。

豆包并不是 9 月 17 日才第一次进入汽车。

火山引擎今年 4 月公开的数据已经显示:

搭载豆包大模型的智能汽车超过 700 万辆,覆盖超过 50 个汽车品牌、145 个车型。

也就是说:

豆包早就在很多汽车背后提供模型能力。

但以前更多像:

汽车系统背后的 AI 大脑。

这一次“豆包座舱助手”的变化是:

它开始从后台模型走到前台,成为一个完整的 Agent 产品。

官方公布的首款搭载车型是上汽荣威家越 07,目前即将开启预售;上汽奥迪相关车型也计划年内亮相。

这两种模式差别非常大。

一种是:

汽车调用豆包。

另一种是:

豆包开始调度汽车。

这才是值得关注的变化。


06|手机和汽车之间,也开始出现一条“连续的任务链”

豆包座舱助手还有一个很有意思的能力:

手车互联。

按照公开介绍,用户可以直接在豆包 App 中:

  • 查询车况
  • 远程控车
  • 把聊天中的行程推送到车机

例如你在家里和豆包聊天:

“周末想带孩子出去玩,找一个两小时车程以内、不太晒、附近还能吃饭的地方。”

AI 帮你把目的地和路线讨论好。

过去的流程可能是:

找完地点 → 复制地址 → 打开地图 → 收藏 → 上车 → 再打开车机导航 → 重新搜索。

如果未来上下文真的能够连续,

流程可能变成:

你在手机上做完决定,坐进车里以后任务直接继续。

设备切换了。

但任务没有重新开始。

这件事表面上只是“手机和车机互联”。

但它背后的意义其实很大:

未来真正持续存在的,可能不是 App,而是 Agent 的上下文。


07|这就是为什么,我觉得豆包做的已经不只是“超级 App”

过去十几年,中国互联网一直在做超级 App。

微信、支付宝、美团、淘宝……

所谓超级 App,本质是:

尽可能把更多服务装进同一个 App。

支付。

打车。

购物。

外卖。

小程序。

内容。

用户最好不要离开。

但是 Agent 的逻辑恰恰不同。

Agent 并不一定需要把所有服务都变成自己的。

它真正想占据的位置是:

用户和所有服务之间。

以前:

用户 ↓ 打开手机 ↓ 找到 App ↓ 找到功能 ↓ 执行操作

未来:

用户 ↓ 告诉 Agent 目标 ↓ Agent 自己寻找能力 ↓ 调用 App / 系统 / 设备 ↓ 完成任务

这就是一个非常大的变化。


08|超级 App 想拥有所有服务,Agent 想拥有“调度权”

这可能是理解豆包最近这些动作最关键的一点。

豆包不需要自己做:

地图。

汽车。

外卖。

酒店。

音乐。

购物。

它真正需要的是:

当用户产生一个目标时,豆包成为第一个知道这个目标的人。

然后它决定:

应该调用谁。

用什么工具。

在哪台设备完成。

如果这个位置成立,

Agent 实际获得的是一种非常重要的东西:

调度权。

过去互联网最重要的是:

流量入口。

谁掌握用户打开 App 的第一步,谁就拥有巨大的商业价值。

Agent 时代的入口可能变成:

谁最先知道用户“想干什么”。

这可能比传统 App 入口更靠前。


09|但手机恰恰说明:这条路不会那么顺利

如果只看豆包连续进入手机和汽车,很容易得出一个特别宏大的结论:

“AI OS 要来了。”

但现实显然没那么简单。

豆包手机已经遇到了第一个非常现实的问题:

第三方应用权限。

豆包手机助手公开回应显示,目前主要支持系统应用、中兴应用、字节系应用以及部分已经接入的第三方应用;其他应用的 GUI 自动化能力仍取决于后续协议和开发者授权。

所以 Agent 面临的瓶颈已经不完全是模型能力。

而是:

  • 权限
  • 安全
  • 数据
  • 商业利益
  • 平台规则
  • 用户授权

AI 越能执行任务,

这些问题反而越重要。

这也是为什么汽车值得特别关注。

它可能是 Agent 最早真正拥有完整执行能力的场景之一。


10|未来真正重要的,可能不是“你用哪个设备”

现在回头看豆包这一周的动作:

9 月 14 日:手机助手消费者版

9 月 16 日:Agent 手机正式进入市场

9 月 17 日:豆包座舱助手发布

把它们串起来以后,会出现一种完全不同的理解。

豆包可能并不只是在寻找:

“下一个超级 App。”

它真正想做的,也许更接近:

一个能够跟着用户在不同设备之间移动的 AI Agent。

今天它在手机上。

你出门以后,它到了汽车里。

以后如果它再进入:

电脑、

耳机、

眼镜、

电视、

智能家居、

机器人……

那么真正统一这些设备的就不再是:

某一个操作系统。

甚至也不是某一个 App。

而是:

同一个 AI。


11|设备可能越来越像 Agent 的“身体”

这可能也是未来几年 AI 硬件真正值得看的方向。

手机拥有:

屏幕、摄像头、App。

汽车拥有:

传感器、车控、导航。

眼镜拥有:

第一视角。

耳机拥有:

听觉和语音。

机器人拥有:

现实世界里的手脚。

每一个设备,其实都可以看成 AI 的一种“身体”。

Agent 在不同设备上获得不同能力。

所以未来真正的问题可能不是:

“豆包要不要做手机?”

而是:

豆包要成为多少种设备共同使用的大脑?

如果这个逻辑成立,

那么 AI 公司和硬件厂商之间的关系也会发生变化。

硬件提供:

感知与执行。

Agent 提供:

理解与决策。


写在最后

过去十几年,互联网公司都想做一件事:

让用户留在自己的 App 里。

于是我们有了超级 App。

但 Agent 时代出现了另一种可能。

未来用户甚至不需要知道:

自己正在调用哪个 App。

也不需要知道:

这个任务最后是在手机、汽车还是云端完成。

用户只需要说:

“我想做什么。”

AI 去决定:

用哪个服务。

调用哪个设备。

执行哪些步骤。

最终把结果交回来。

所以从手机到汽车,豆包这一周真正值得关注的,并不是:

“它又多了一个入口。”

恰恰相反。

它正在尝试让:

“入口”这件事本身变得没那么重要。

超级 App 的目标,是把尽可能多的服务装进一个入口。

而 Agent 更进一步:

它想成为所有入口之前的那个入口。

手机只是第一站。

汽车也不会是最后一站。

如果未来真的出现一个能理解你的长期需求、记住上下文,并且可以在手机、汽车、电脑、眼镜和家庭设备之间不断接力的 AI,

那么到那个时候,

我们可能不会再问:

“你平时最常用哪个 App?”

而会开始问一个今天听起来还有点奇怪的问题:

“你平时用哪个 AI?”

相关学习资料