未来十年,AI助手可能是整个科技行业最大的机会。
它不是又一个ChatGPT,也不是一个新的APP。
它更可能成为继PC、搜索、智能手机之后,下一代数字世界的超级入口。
过去二十年,互联网最大的生意,是让你打开那个APP。未来,可能连APP都不需要打开了。
你只需要告诉AI你想做什么,它替你搜索、比较、决策、下单;再往后,它开始看到你看到的、听到你听到的,甚至进入现实世界替你行动。
所以AI助手真正争夺的,不只是流量。
而是你做决策的第一触点。
做了十年智能硬件,来聊聊AI入口的长期判断,我认为AI助手未来的演进,大体会经历四个关键阶段:
从对话框,到进入数字世界;
从进入数字世界,到获得现实感知;
再从感知现实,到真正进入现实世界行动。
AI助手的终局,不是变得越来越聪明,而是一步一步获得进入现实世界的能力。
如果这条路径成立,那么未来十年最大的机会,可能就藏在这四次跃迁里。
第一阶段:对话框时代
这一阶段,你拥有的是一个知识与思考助手。
你问它问题,它回答;你给它材料,它帮你分析;你提出目标,它帮你制定方案。但它仍然需要你把问题和信息带给它。
我们现在就在第一阶段。
ChatGPT、Claude、Gemini、豆包,以及各种Agent,本质上都在做同一件事:
让AI拥有越来越强的理解、推理和生成能力。
从Chatbot到Agent,再到Computer Use,AI正在从“回答问题”变成“完成任务”。
但它最大的瓶颈恰恰不是智力,而是:信息带宽。
AI可以分析一份文件,但文件需要你给它;可以理解一张图片,但图片需要你上传;可以分析一次会议,但会议内容仍然需要被输入。
于是出现了一个很奇怪的现象:
AI越来越聪明,人却越来越像信息搬运工。
你负责把现实世界整理成AI能够理解的信息,AI负责处理。

所以第一阶段真正的天花板不是模型还不够聪明,而是:AI不知道你没有告诉它的世界。
下一阶段,它必须自己进入数字世界。
#02
第二级跃迁:AI接管数字世界
这一阶段,你拥有的是一个数字执行助手。
你不再需要告诉它去哪个App、点哪里,只需要告诉它想完成什么。它自己搜索、比较、调用服务,最终把事情完成。
第二阶段解决的,不再是“AI会不会思考”,而是:
AI能不能替你做事。
比如你说:“帮我安排下周去上海的出差。”
成熟的AI应该自己完成机票、酒店、地图、日历、打车甚至报销,而不是把一堆链接丢给你。

要做到这一点,目前大致有三种技术路径。
第一种:API + Agent。
AI通过API或者标准协议直接调用电商、地图、酒店、办公软件等服务,再由Agent把多个服务组合起来,完成一个完整任务。
比如一次出差,可以同时调用航班、酒店、地图、日历等服务。
它的优势是效率高、稳定性好、成本相对低。
但问题也很明显:它高度依赖服务方开放接口。
第二种:Computer Use。
如果一个服务没有开放API怎么办?
AI直接像人一样操作手机、网页和电脑:
打开App → 搜索 → 比较 → 填写 → 点击 → 完成。
它解决的是:没有接口的时候,AI依然可以进入数字世界。
覆盖范围更广,但效率、稳定性和成本通常不如直接调用API。
第三种:AI OS。
再往上走,就不只是AI调用几个App,而是AI本身成为操作系统层面的入口。
它统一管理用户的账号、数据、权限、App和设备。
你不再需要知道:“这件事应该去哪个App完成?”
你只需要告诉AI:“我要完成什么。”
这三种路径并不是互相排斥的。
API + Agent提供最高效的服务调用,Computer Use补足没有接口的场景,而AI OS试图从系统层统一这些能力。
但真正困难的地方,并不只是技术。
而是商业。
因为AI一旦成为数字世界的执行入口,就会直接碰到互联网平台最核心的利益:
流量、用户、交易和入口。
淘宝希望你打开淘宝,美团希望你打开美团,携程希望你打开携程。
而AI希望你只需要说:“帮我买一件最合适的耳机。”
然后由AI自己决定去哪买。
所以平台不是没有能力开放API,而是会考虑:
开放多少?谁掌握用户关系?谁获得交易分成?AI会不会绕过自己的入口?
这会形成一场长期博弈:
AI公司希望获得更多调用权; 手机厂商希望控制系统入口; 互联网平台希望保住用户关系; 服务商希望保住自己的流量和交易。
因此,第二阶段真正的拐点,不是AI手机卖了多少台,而是:
AI能不能跨越不同生态,稳定完成一件完整的事情。
而更重要的是:
这些生态最终愿不愿意让AI替用户完成这件事情。
如果这场博弈长期无法打通,AI就可能需要自己建立新的入口。
这也为第三阶段的新型AI终端留下了机会。
第三级跃迁:AI进入现实世界
这一阶段,你拥有的是一个个人认知助手。
它知道你正在看什么、听什么、经历什么,也逐渐理解你的知识背景、兴趣和长期目标。你不必每次告诉它发生了什么,它开始主动理解你的上下文。

第二阶段解决的是:AI进入数字世界。
第三阶段则进一步解决:
AI能不能进入你的现实世界。
它开始持续知道你在哪里、看到了什么、听到了什么,以及正在发生什么。
这时候,AI才真正从“数字助手”变成“个人认知助手”。
你看到一个陌生的人,它可以告诉你对方是谁;
你看到一个新闻,它知道你过去关注过什么,并告诉你这件事与你有什么关系;
你进入一个陌生场景,它可以即时补充你缺失的背景知识;
你准备做一件事情,它甚至可以提前发现风险并提醒你。
AI第一次开始理解“你正在经历什么”。
而这些能力需要新的硬件载体,未来可能出现的形态:

但真正重要的不是“最后是哪一种硬件赢了”。
而是:
有没有一种设备,能够足够自然地成为AI的感知器官。
甚至未来可能出现我们今天还无法准确命名的形态。
这一阶段有机会成为AI助手真正的爆点,突破现有手机等硬件的限制,但现在距离真正的成熟,还差几个关键条件。
第一,功耗与续航。
如果设备持续采集视觉、声音和环境信息,就意味着持续产生计算需求。
端侧算力越强,功耗和成本越高;更多计算放到云端,又会带来通信延迟和持续的推理成本。
第二,AI推理成本。
真正的个人认知助手不是偶尔调用一次模型,而可能需要实时理解大量信息。
如果每分钟都产生大量多模态推理请求,今天的模型成本还很难支撑真正意义上的全天候使用。
所以未来需要:更强的芯片 + 更低的功耗 + 更便宜的推理成本。
这其实和当年智能手机的发展很像,智能手机不是突然凭空出现的。它背后同时依赖芯片、触摸屏、移动网络、电池等技术逐渐成熟。
第三阶段也一样:不是某一个产品突然发明出来,而是多个基础条件同时跨过临界点。
第三,隐私和社会接受度。
手机拍照是主动行为。但如果一个设备一直在看、一直在听,周围的人是否愿意接受?这可能决定它最终能不能进入大众生活。
解决这些问题,还需要一个“杀手级应用”来形成真正的“iPhone 时刻”。
最有机会出现的几个方向包括:
个人记忆——AI记住你经历过的信息,需要时主动调用。
实时视觉助手——看到环境、物体、文件和人物,并即时解释。
主动式信息服务——不是你问它,而是它根据上下文主动告诉你需要知道的事情。
工作场景辅助——会议、出行、现场作业等场景中,AI持续理解环境并提供帮助。
如果其中一个场景真正跑通,再加上硬件成本、功耗和AI推理成本同时下降,第三阶段可能出现一次类似iPhone的产业拐点。
而且这一次,可能不是“某一副眼镜”成为入口。
而是:
一种新的随身AI终端成为入口。
它先获得用户,再逐渐建立自己的AI OS、服务接口和开发者生态。
这反过来也可能绕开第二阶段最大的商业困局:
如果互联网平台不愿意把入口交给AI,那么新的AI终端可能自己成为入口。
到那时,AI就不只是进入数字世界。
它开始真正进入你的生活。
#04
第四级跃迁:AI成为主动在场伙伴
这一阶段,你拥有的已经不只是助手,而是一个主动行动伙伴。
它持续与你连接,理解你的状态和环境,在需要的时候主动介入,并调用数字服务或者物理设备替你完成事情。
第三阶段解决的是:AI知道你正在经历什么。
第四阶段解决的是:知道以后,它能不能主动做什么。
这时候AI与人的关系会发生变化。
以前:你问,它回答。
第三阶段:它看到你正在经历什么,主动提供帮助。
第四阶段:它判断你可能需要什么,并主动行动。
这种行动未必意味着家里一定出现一个人形机器人。
更现实的方向可能是:多设备协同。
AI可以同时调用手机、耳机、眼镜、汽车、家庭设备、机器人等不同终端。
它的“身体”不一定属于某一台设备,而可能存在于整个环境中。
甚至可以想象一个更理想的形态:一个真正的AI“小精灵”。
你出门,它跟着你;你工作,它来到桌边;你回家,它进入家庭环境;你准备睡觉,它回到床边。

它不是你主动打开的一个App。
而是一个持续在场的智能系统。
当然,这距离今天还很远。它需要更强的模型、更低的推理成本、更可靠的多设备协同,以及足够高的安全性和社会信任。
因此第四阶段不会像某一款手机发布一样突然出现。它更可能从一个个主动服务开始,逐渐形成:
感知 → 理解 → 判断 → 调用 → 行动 → 反馈
最终,AI助手才真正从一个软件变成一个持续与你共处的智能体。
#05
未来十年,如何入局?
四个阶段真正有价值的地方,不是预测哪一年一定发生什么。而是帮助我们判断:自己应该站在哪里。
1.如果你是投资者:
不要只看今天谁的模型参数最强。更值得关注的是:谁在解决下一阶段的关键瓶颈。
短期看第二阶段:AI OS、Agent基础设施、服务调用协议、跨App执行、AI与互联网生态的连接能力 中期看第三阶段:AI随身硬件、低功耗AI芯片、多模态推理、AI OS与新终端生态 长期看第四阶段:多设备协同、个人智能体、现实世界执行能力
越靠近下一阶段的核心瓶颈,越值得长期观察。
2.如果你是互联网从业者:
最需要警惕的是:你的App是不是正在从“入口”变成“能力”。
如果用户未来只需要告诉AI自己想做什么,那么用户是否还需要记住你的App?
所以互联网公司的核心竞争力,可能逐渐从“争夺用户”变成“争夺AI调用”。
真正重要的不是“用户每天打开多少次App”,而是:AI愿不愿意调用你的服务。
这会重新定义互联网平台的价值。
3.如果你是产品经理:
不要只问:“怎么给产品加一个AI功能?”
应该开始问:“AI下一步还缺什么能力?”
第一阶段需要的是更强的模型。 第二阶段需要数字执行能力。 第三阶段需要感知能力。 第四阶段需要自主行动能力。
未来真正稀缺的产品经理,不只是会设计AI交互,而是能理解:AI能力每向前一步,会重新改变什么产品形态。
4.如果你是硬件从业者:
不要只考虑:“怎么把AI装进我的硬件?”
更应该问:“我的硬件能不能成为AI的一个器官?”它能不能看?能不能听?能不能感知?能不能持续在线?能不能执行?
如果只是给传统硬件加一个聊天功能,它很可能只是一次功能升级。
但如果它成为AI获得现实世界能力的一部分,它可能进入一个完全不同的价值空间。
5.如果你是技术人员:
未来最值得关注的,不只是模型本身。
而是模型与现实世界之间的接口:端侧推理、低功耗芯片、多模态理解、实时Agent、Computer Use、AI OS、设备协同、机器人控制。
因为AI真正进入现实世界之后,最大的技术问题会从“模型能不能回答?”变成:“模型能不能实时、低成本、可靠地理解并行动?”
6.如果你只是普通用户:
其实不需要预测哪家公司最终赢。
只需要观察一个信号:什么时候AI开始让你觉得“不用它反而麻烦”。
当你开始习惯让AI替你搜索、比较、安排、记忆、提醒;
当你开始习惯它一直知道你正在经历什么;
当你开始习惯它主动帮你完成事情。
那一刻,AI时代真正的入口就已经形成了。
#06
真正值得关注的,是入口本身正在改变
过去二十年,互联网的入口一直是一个东西:你主动打开的东西。
浏览器、搜索框、手机桌面、App,而AI助手正在把这个逻辑反过来。
第一阶段,它帮你思考。 第二阶段,它开始替你操作数字世界。 第三阶段,它开始理解你正在经历的现实世界。 第四阶段,它开始主动行动。
所以AI助手最终争夺的,并不只是一个新的App入口。
而是:谁能够成为人与数字世界、现实世界之间的第一触点。
如果这条路径最终成立,那么未来十年真正重要的变化,也许不是又诞生了多少AI产品。
而是:人第一次不再需要主动寻找信息、打开应用、调用工具。
你只需要表达意图。
剩下的世界,开始主动向你靠近。
长期关注AI硬件与下一代入口演进,欢迎行业朋友交流。
—— 穿越噪音,锚定长期价值

夜雨聆风