夜雨聆风学习资料网

ARTICLE · 1027350

AI眼镜系列06|问一句答一句的时代结束,眼镜里的AI开始替你干活

AI眼镜系列06|问一句答一句的时代结束,眼镜里的AI开始替你干活

前五讲,硬件的账算完了。光机、芯片、躯壳、组装,每一环都拆过。

这一讲讲软件层最关键的变化。2026年,行业给它起了个名字,智能体入镜。

先厘清一个区别。过去的语音助手,你问一句它答一句,查天气、设闹钟、翻译一句话,本质是被动工具。智能体多了三样东西:自己感知现场、自己拆解任务、自己调用工具把活干完。你看着一张海报说"记一下",它认出时间地点,写进日历,顺带约上同行的人。这才叫干活。

2026年这波密集落地有迹可循。5月谷歌I/O大会,三星两款Android XR眼镜首次亮相;7月WAIC世界人工智能大会,李未可、千问、Rokid扎堆发布智能体眼镜;9月柏林IFA展,AI眼镜直接成为全场焦点,Rokid把智能体开发平台推向全球。高通把2026年定义为智能体之年。

为什么是2026年。三个条件同时成熟:多模态模型看懂摄像头画面的成本降到可接受区间;端侧10亿到30亿参数小模型能接住唤醒词和轻任务,响应压到0.2秒;AR1这一代芯片把整机功耗控制在1瓦上下,全天佩戴才成立。往前推两年,任何一条都不具备。

到底是营销,还是拐点。拆四件事:眼镜为什么被选中、美国双雄怎么打、中国牌桌怎么玩、真实使用数据说了什么。

一、为什么是眼镜,又为什么最难

扎克伯格2026年6月讲过一段逻辑,值得听。

他说现在AI产品最大的瓶颈是个性化不足。评测机构Vellum的结论更直白:多数AI助手用了六个月,也不会比第一天更了解你。原因简单,你的大部分生活信息,根本不在和AI的聊天记录里。要实现他说的个人超级智能,AI必须持续获得真实生活场景,而眼镜是当前唯一能提供这种持续视角的设备形态。

手机把人从周围世界里拉走,眼镜待在世界里面。第一视角、免手持、全天在场,三个特征叠在一起,眼镜成了智能体连接现实的最近入口。扎克伯格的判断是,五年后所有眼镜都会是智能的。他还透露Meta内部已经在规划2028年的眼镜产品线,硬件周期长没关系,AI可以靠软件更新持续变强,用户买到手后,模型每升级一次,眼镜就好用一次。

学术研究先行验证了这件事。2026年一篇论文VisionClaw,研究者在Meta Ray-Ban眼镜上跑常驻智能体,联动Gemini Live和OpenClaw执行真实任务。实验室12人对照,任务完成速度快13%到37%,感知难度低7%到46%。更有价值的是真实部署:4个人连续戴了13.8天,累计555次交互、25.8小时,沉淀出六类用法,信息检索占30%,购物19%,内容保存16%,沟通14%,记忆召回12%,设备控制9%。

真实例子很具体。有人路过旧金山码头,看着人群问"这队在排什么",系统结合定位认出是渡轮队伍,顺手指路到附近市场。有人电饭煲盖子卡住,拍一下让AI识别型号排查故障。看一眼酒店须知说"存一下",WiFi密码、早餐时间、设施信息自动结构化存档。

载体最优,难度也最高。

上一讲讲过物理天花板,眼镜端侧只能塞10亿到30亿参数模型。开发者社区的总结很准确:端侧Agent单轮能用,长流程容易跑偏、失忆、工具调用失败。眼镜屏幕要么没有,要么只有一小块,输入几乎全靠语音和摄像头,嘈杂环境、方言、弱网都是坎。智能体要在眼镜上立住,得同时解决感知、续航、交互、生态四件事。

行业现在跑通的是分层架构。端侧小模型常驻,负责唤醒、语音转写、画面初筛、隐私敏感判断,这些任务要求快、要求离线可用;复杂理解、任务规划、工具调用交给云端大模型;专业问题再往下接知识库和插件,查铁路规定、查航班、点外卖、控智能家居,每一类对应一个接口。以Rokid平台上的出行助手为例,用户拍一个充电宝问能不能登机,系统先识图读出容量和电压,计算器换算额定能量,再检索民航规定知识库,最后才生成回答,大模型不被允许凭空给结论。这套端侧感知、云端推理、插件干活的链路,已经成为眼镜智能体的标准骨架。

于是,打法分化成了两套。

二、美国双雄:Meta垂直一体,谷歌联盟开放

Meta这边,先栽过跟头。

2025年4月发布的Llama 4,扎克伯格自己定性"没有跑在需要的轨道上"。独立基准测试Artificial Analysis上,Llama 4 Maverick只拿18分,开发者社区差评一片。之后是一轮激进重建:2025年6月,Meta以143亿美元收购Scale AI四成九股份,把28岁的创始人Alexandr Wang挖来当首席AI官;6月30日成立超级智能实验室MSL;不到一年,2026年4月交付第一个模型Muse Spark,基准分52,接近Claude Opus 4.6的53分和GPT-5.4的57分。

Muse Spark和Llama有两个根本区别:闭源,专为Meta自有产品打造。5月起推送到Ray-Ban Meta和Oakley Meta眼镜,6月23日发售的Meta Glasses成为第一款从第一天就搭载它的设备,299美元起,26种款式组合。

能力上有两个看点。一是多子智能体并行,规划一次家庭旅行,一个写行程,一个对比目的地,一个找亲子项目,同时开工。二是多模态视觉,摄像头扫过机场零食架,能按蛋白质含量排序推荐;扫商品直接做比价。实时翻译新增14种语言,包括普通话、日语、印地语、韩语。扎克伯格还在自家格斗馆架摄像头,让AI实时看他训练、回合间隙自动给教练式反馈,他把这称为个人化应用的样板。

谷歌和三星走另一条路,开放系统联盟。

底座是Android XR,谷歌2024年底发布的XR专用操作系统,AI核心是Gemini。2026年5月I/O大会,三星联合Gentle Monster和Warby Parker两款镜框首次公开;7月22日伦敦Unpacked正式发布Galaxy Glasses,AR1芯片、无屏、1200万像素摄像头、单电9小时、充电盒再补7次满电,秋季在韩国和美国先行上市。

定位很克制,手机伴侣。大部分计算放在配对手机上,安卓和iPhone都能连。Gemini负责的全是免手操作:语音导航到店、看菜单和路牌直接翻译、长消息摘要朗读、会议白板拍下来自动整理进三星笔记、日程靠嘴添加。隐私被摆到台前,摄像头工作时LED点亮,摘下眼镜或遮住光线自动关机。系统层面,XREAL等厂商也已宣布Android XR硬件计划,谷歌要的是当年安卓那套联盟打法。

商业节奏也在配合。依视路陆逊梯卡财报口径,Ray-Ban Meta系列2025年销量超三倍增长、全年超700万副,双方已经在商讨把年产能翻倍到2000万台甚至更多。Muse Spark上线后,眼镜第一次和Instagram、Facebook、WhatsApp、Messenger共享同一个模型底座,购物、社交、地图推荐直接在对话里完成,这是Meta独有的闭环。

两家路线分野清晰。Meta垂直一体,自研模型、自有社交图谱、自有硬件渠道,赌的是个人数据闭环。谷歌输出系统和模型,联合三星、眼镜品牌和更多硬件厂,赌的是生态规模。XREAL宣布Android XR硬件计划后,中小眼镜厂不必再自研系统,这和当年安卓收割功能机的路径如出一辙。共同点只有一个:都把摄像头加语音当成眼镜智能体的主入口。

中国厂商没有硬拼通用大模型,选了第三条路。

三、中国牌桌:模型借船,生态自建

国内分工已经标准化:眼镜负责第一视角采集和实时感知,智能体平台负责理解、规划、执行。硬件厂不自建大模型的居多,接入各家模型,把力气花在操作系统和场景生态上。

Rokid走得最远。2026年6月Open Day大会,发布YodaOS,官方口径是全球首款智能眼镜原生AI操作系统,硬件能力、AI底层设施、开发工具全栈开放。9月1日AIUI Studio上线,IFA期间推向全球:开发者在浏览器里用自然语言说话就能创建眼镜智能体,说一句"帮我做个天气查询智能体",平台直接生成代码和完整项目,内置硬件模拟器,没有实体眼镜也能调试,一键打包发布。

数据可以看生态温度。Rokid全球注册开发者超过3.5万人,智能体商店上线6个月,上架智能体超过500个,支付打通了支付宝和微信。9月2日腾讯WorkBuddy生态发布会上,Rokid入选首批9款联名硬件。

阿里千问打平台牌。WAIC 2026上千问眼镜正式升级为智能体眼镜,深度集成自研千问大模型和Qoder智能体编程平台,Qoder同步上线眼镜专属版,主打语音驱动的编程协作,同时开放第三方技能和智能体调用端口。

腾讯靠WorkBuddy切办公。最典型的产品是李未可X-AI记忆眼镜,7月17日WAIC发布,整机26克,磁吸摄像头模组约10克可物理拆卸,10小时以上持续录音、30天待机,核心场景是把线下碎片化对话自动转成结构化办公任务。9月1日魅族MYVU官宣接入同一生态。对话到纪要、待办、日程、数据报表,这条办公链路是国内最集中的落点。

科大讯飞5月推出GlassClaw,内置专属智能体,主打信息采集、全网检索、方案生成、邮件分发的全流程闭环。千问眼镜在博鳌论坛之外还进了两会报道现场,外媒记者用同款装备做实时翻译。雷鸟在IFA摆出三款产品分场景卡位,iO无摄像头主打听写翻译日常通勤,X3 Pro带摄像头主打实景识别,GT Max走267英寸虚拟大屏的沉浸影音。IFA展上还有新场景,大众旗下CUPRA把Meta AI眼镜和电动车联动,戴上眼镜看向车辆,镜片自动弹出车型参数和功能说明,车与穿戴的生态开始接通。

值得注意的是定价权变化。智能体眼镜不再只卖硬件,千问、腾讯、讯飞都在按场景打包订阅能力,办公纪要、企业知识库检索、行业插件走企业账户付费。硬件一锤子买卖之外,软件续费的模型第一次在眼镜品类出现。

平台热,设备能不能留住人,得看真实使用。

先理清智能体和上一讲端侧模型的关系。端侧模型是发动机,决定眼镜本地能跑多快、多省电;智能体是司机,决定看见什么、先做哪步、调用哪个工具、要不要上云。发动机不升级,司机再好也跑不动;司机不到位,再强的芯片也只会一问一答。2026年之前行业主要在拼发动机,2026年开始拼司机。

四、555次交互和三句冷水

先看积极信号。

VisionClaw那555次真实交互里,纯三秒微查询和多轮深度研究同时存在,三分之一的交互调用了两个以上数据源,只有2%没得到智能体响应。分布在全天各时段,下午占44%,单次使用中位数16分钟。这说明眼镜智能体已经能支撑连续任务,并非玩具。

国内场景也在跑通。博鳌论坛记者戴千问眼镜采访,一上午高强度使用剩八成电,拍照、翻译、提词、身份识别离线在线混合完成。铁路民航规定查询、周边搜索、食物营养识别这类知识库加插件的组合,在Rokid平台上已有标准方案。行业出货数据在配合:IDC统计2026年一季度无显示眼镜出货同比增167%,带显示眼镜增86%;Counterpoint口径,2025年下半年光波导AR眼镜出货同比增超600%。

冷水同样要记三句。

第一句,杀手级应用还没出现。翻译、导航、提词、拍摄,四件套撑起了所有发布会演示,但每天用和试一次是两回事。Rokid自己在IFA也承认,眼镜卖出去只是开始,留存取决于翻译是否及时、导航是否少走弯路、拍摄导出是否省心。500个智能体对比手机应用商店数百万应用,冷启动刚开头,开发者能不能赚到钱没有答案。

第二句,能力边界真实存在。端侧模型长流程不可靠、会失忆、会调错工具,重活仍在云端,弱网和地铁里立刻打回原形。多模态识别有误判,权威信息必须靠知识库兜底,开发者文档里明确要求,检索不到就明说,禁止编造。

第三句,隐私是悬在品类头上的刀。Meta眼镜的常驻摄像头在海外争议不断,三星开发布会要专门强调LED指示灯和摘下即停。李未可干脆把摄像头做成可磁吸拆卸,用物理模块划隐私边界。欧洲用户更早追问数据何时上传、由谁处理、能否删除。社会接受度的推进速度,可能比技术慢得多。

还有一个结构性问题。智能体越强,对持续采集的依赖越深,耗电、发热、存储、合规成本全部上升,和40克躯壳、300毫安时电池形成长期拉扯。软件的野心,最终仍要回到硬件的物理账上。

行业对节奏也有共识口径。高通朱晓冬称2026年是智能体之年,更多产业链判断把2027年叫准备之年,苹果N50入场、操作系统格局定型,2028年才可能迎来属于眼镜的iPhone时刻。智能体生态恰好需要这两年攒开发者、攒场景、攒留存,时间窗口对得上。

结语:终局之前

2026年这一幕,像2009年的手机。硬件范式确立,操作系统开战,应用生态萌芽,所有人都在等自己的iPhone时刻。

美国赌通用个人智能,Meta用闭源数据闭环,谷歌用开放联盟,两条路都已压上重注。中国赌场景生态,办公、翻译、编程、出行、车载五条线,先把垂直任务逐个做穿。谁对谁错没有定论,可以确定的是,眼镜的竞争主轴已经从参数表转向留存率,从谁更轻转向谁更有用。

最后一讲,给整个系列收个网。七讲走完,从90万台的冷启动到700万副的爆发,从0.13英寸的屏到镜腿里的智能体,这个品类到底走到哪一步了,渗透率、价格曲线、玩家座次怎么排,2027和2028的iPhone时刻会不会来,普通人和产业里的人各自又该怎么看。

第七讲,终局与座次,下一篇见。

本文仅为产业与市场分析,不构成任何投资建议。文中产品、模型、开发者与出货数据来自谷歌、三星、Meta、Rokid等公司官方发布、IDC与Counterpoint统计、WAIC与IFA公开信息、学术论文及媒体报道,不同机构口径存在差异。

相关学习资料

返回首页浏览学习资料