乐于分享
好东西不私藏

AI手机,老登大战小登,技术含量很高

AI手机,老登大战小登,技术含量很高

你有多久没换手机了?

有些人,迫不及待。有些人,也不想换了。
现实,就是这么分裂。
下面展开说说。
手机的发展,可以分为三个阶段。
第一阶段,是功能机时代。它解决的是通信问题,打电话、发短信,人与人之间,第一次建立起即时通信网。漫长的等待,变成了即时联通。这也是信息革命的起点。你要融入高效的人际关系网,就需要手机。
第二阶段,是伴随移动互联网爆发的。手机大屏取代了软键盘,App成了显学。由于手机号可标识,GPS可定位,用户就能够被系统画像。于是,这个阶段的手机不仅连接了人与信息,更连接了人与服务。
此时的手机虽然被叫做“智能机”,本质上是“能”而不“智”。它多功能,多媒体,可以基于用户画像推送信息与服务,但无法主动发现需求,也无法被动完成任务。所以手机的第二阶段,更准确的称谓应该是“移动互联网手机”,或者,“低智能机”。。。
但由于融合了众多数字服务功能,手机成了数字社会的钥匙。你必须有手机,才能获得更便捷的生活。在国内尤甚。
第三阶段,就是现在,移动互联网和AI时代的交棒期。
这两年,国内手机企业一直在卷拍照和折叠屏,在镜头和屏幕上卷到极致。但大屏和拍照,终归只是锦上添花。2022年以来大模型高歌猛进,创新乏力的手机行业又活跃起来。
AI手机,尽管外观大差不差,但AI手机的内核以及用户交互模式,会发生非常大的变化。
先看苹果。
苹果是这轮大模型爆发的后进生。。。难得,在库克即将卸任CEO的WWDC 2026全球开发者大会上,苹果AI搞了近年最大的升级。
这次苹果手机iOS 最核心的变化,是从“被动访问的设备”升级为“主动执行任务”。而iPhone变化的牛鼻子,是Siri
Siri有一段鲜为人知的历史。
它源自2003 年的某大型 AI 认知助手项目(背景不宜展开,有兴趣自己查),由斯坦福国际研究院 SRI 负责研发,投入上亿美元,目标打造能自主完成复杂任务的智能代理。CALO 项目结束后,三位核心研究员创业了Siri Inc。
2010 年,Siri Inc 开发的Siri App上架苹果商店,主打生活事务代理。Siri App 上线仅 2 个月,乔布斯亲自找到创始团队,最终苹果以约 2 亿美元全资收购 Siri Inc,24 人团队全部并入苹果总部。Siri App下架,开始重构适配 iPhone。
2011 年 10 月 4 日,库克发布 iPhone 4S,首次搭载 Siri。第二天,乔布斯离世。。。
虽然Siri出场很惊艳,定位为全球第一款深度预装在主流智能手机、面向普通消费者大规模落地的语音助手,重新定义手机交互方式,开启消费级语音 AI 赛道。。。但很快,就拉垮了。。。
由于高度依赖预设意图、规则和有限服务接口,无上下文记忆,Siri多轮对话失效,复杂提问、模糊需求大概率答非所问。尤其在大模型浪潮下,ChatGPT谈恋爱、豆包讲段子, AI 助手全面爆发,Siri成了不受待见的“老登”。。。
今年的大会,库克卸任CEO前最后一次,就是让Siri再度焕发光彩——Siri从“语音助手”升级为跨应用、跨设备的“系统级AI智能Agent”
苹果新一代 Siri AI,是跨应用的智能代理中枢,能够结合对用户个人情境的理解、对屏幕内容的感知能力、对各种应用程序的操作功能,以及庞大的全球知识库,以对话的形式来履行职责,真正发挥数字/虚拟个人助理的作用。
具体来说,Siri可根据聊天记录查找地址、规划路线、自动撰写邮件,实现多步骤任务的端到端串联等等。
所以,Siri要重生苹果手机的AI入口。
手机从“操作工具”到“任务执行”。用户不再需要复杂的操作路径(解锁-找App-找到人/服务-发信息/要求-完成交互),而是直接通过自然语言向全新的Siri AI下达指令,由AI自主调用系统功能和App来完成。
不过啊,这种自然语言驱动的交互模式,已经yy很多年了,但真正落地,挺难的。手机存储、端侧算力、功耗和隐私机制等等,需要有个精巧的平衡。
这次升级Siri,Apple Intelligence 专门设计了一个三层架构。我学习了各种资料,概述如下:
底层是模型层:由苹果自研基础模型(Apple Foundation Models) 与谷歌支持。这是一个五层模型的架构,略复杂。
设备端 2 款纯自研模型:AFM Core(3B ),支持打开 App、基础语音唤醒、简单文字改写、本地照片检索等简单场景;AFM Core Advanced(50B),支持识别屏幕内容、相册复杂图文检索、本地 PDF 总结等等。
苹果私有云端2款模型:AFM Cloud(70B),支持邮件 / 备忘录长文总结、日程规划、本地文件批量处理等等;AFM Cloud Image是图像生成专用自研模型。
最复杂的任务,会使用AFM Cloud Pro模型,同时利用谷歌 Gemini能力。苹果自研语义路由器(轻量本地判别模型)会分层分流。如果是多步骤生活规划、长文档深度分析、代码生成、复杂跨 App 联动等任务,模型会在剥离手机用户 ID、姓名、证件等敏感信息后,以匿名语义向量传入云端,调用模型处理。
综上,五模型配套,构成了智能手机的“大脑”。
中层是上下文引擎:即 Personal Context。这是Siri实现“懂你”的关键。它可以理解用户的个人信息,包括相册、信息、邮件、日历等,并能够理解当前屏幕上的内容(Onscreen Awareness)。
Personal Context更偏向于为模型提供个人信息、屏幕内容和语义索引等上下文支持,负责找对用户个人信息、屏幕内容,整理成素材喂给底层大模型;大模型拿到素材才看懂你的专属场景、给出个性化回答,二者是前置预处理和核心推理的前后流水线关系。
顶层是执行层:即 Siri通过App Intents(各家 App 提前给 Siri 登记好的「功能办事清单 + 标准化调用协议」)完成最终的执行。这一层负责将用户的意图转化为具体操作,调用系统功能或第三方App来完成实际任务。
在iOS 27系统中,苹果将推出全新的Siri扩展应用程序编程接口——这一接口能让Siri与包括谷歌Gemini、ChatGPT等其他企业的人工智能服务实现对接。符合苹果的规则前提下,你中意哪家的模型,就可以用哪家。不过,在第三方对iOS27 Beta版 AI 扩展API 实测中,系统底层框架已预埋 ChatGPT/Claude/Gemini 切换入口,但服务器开关暂未全开。
AI时代,苹果从封闭生态向 AI 平台模式转向。这和苹果啥事都要自己来的调性不一样。主要是苹果自研 AI 的进度太慢了,加上各国对 AI 的监管和反垄断,要想进入当地市场,就只能选择开放平台了。
无论是多复杂的系统架构设计,还是多开放的平台模型,用户都不关心。用户关注的核心还是使用体验,包括隐私数据安全。
所以,实际使用中,Siri AI在多步骤、跨应用任务中的可靠性,才是最核心的考验。错误的自动操作将严重损害用户信任, Siri AI就又凉了。。。
新版 Siri AI要在三季度才能在海外规模上线。目前iOS27 开发者 Beta 版本海外评测显示,Siri 终于追上主流 AI 入门水平,但不算颠覆性领先。
要论颠覆性,还得看小登。。。
OpenAI首席财务官之前吹风,已经亲身体验了OpenAI的AI硬件设备,公司计划在2026年年底前正式发布,最早可能在2027年2月开始出货。OpenAI硬件的最终目标,是重构、重构、重构!
根据各种信息拼图,OpenAI更中意“无APP”硬件。这种设计体现了其Agentic OS的核心理念:用户界面(UI)完全由AI实时生成,彻底抛弃传统的App图标与应用商店。
据说,OpenAI为它的第二代设备设定了1500万至2000万台的出货目标。而谷歌Pixel手机,去年的出货量为1400万台。
国内AI手机,是豆包抢跑。
行业调研消息,6月至7月,豆包手机发布二代“概率较大”。还有预测称,豆包手机二代预计在6月下旬发布,并被称为“首部AI原生手机”。
消息称,豆包手机已完成与抖音生活服务深度打通,实现了团购、支付、订单、核销全闭环。用户无需跳转至抖音App,即可在豆包内一键完成从浏览、购买到核销的完整流程。
豆包AI助手,从“提供建议”进化到了“直接完成交易”。不过,如果只是抖音生态,这“首部AI原生手机”就有点打折诶。。。
说回iOS27 开发者 Beta 版本。国内测试显示,iOS系统 App 联动极强,第三方App 依赖开发者适配,目前 Beta 阶段适配量很少,微信、外卖、社交软件跨 App 操作经常失灵。
看来围绕AI Agent,优秀的用户体验需要重构生态。
不过,说起重构生态,我想起了微信Agent,微信A2A。。。腾讯AI的广度和深度
未来,是AI手机需要一个统一入口?还是一个超级Agent定义了一部AI手机?
继续观察。