科大讯飞的AI眼镜在2026世界人工智能大会(WAIC)上拿下了"镇馆之宝",这台机器把重量压到了40克,能做实时的122种语言翻译,还加了唇动识别做多模态降噪。它叫AI眼镜,但不是那种只塞个蓝牙耳机进镜腿的产品,而是双目单色显示加多模态交互,靠GlassClaw这套AI助理把看到的内容接进来处理。WAIC的特稿在8月16日把这台机器拎出来说,理由是它把"翻译"从掏手机、开App,变成了抬眼就翻。对经常跨语言开会、出差的人来说,这个场景是硬的,不是炫技,因为翻译是真实高频痛点,不是为演示而演示的功能。一个做翻译起家的公司把眼镜当载体,逻辑顺,因为它手里的语音识别和多语种能力正好是眼镜最缺的那块,比起从零做硬件的纯眼镜厂,讯飞在听懂这件事上有积累。所以这台眼镜不是硬蹭AI终端热点,而是把自己老本行往新形态上搬,方向选得稳。当然眼镜生意最终拼的还是佩戴和续航,翻译再强,戴不住也白搭,这点后面还会说到。

技术上看,它有几个点值得记。整机40克,在双目单色多模态眼镜里属于很轻的量级,戴久了压鼻梁的问题能缓一点,这是佩戴门槛的关键。122种语言实时翻译,靠的是镜头捕捉对方说话、模型做识别和生成,延迟控制在对话能接住的范围。唇动识别降噪是它比较特别的一处:嘈杂环境里,它不只听声音,还读嘴唇动作,锁定正在说话的人,做到"看谁就翻谁",而不是把旁边人的话也搅进来,这在展会、车厢、街边这些噪声场景里很实用。双目单色显示不追求彩色大屏,而是把翻译字幕、提示这类轻量信息投到眼前,重量和功耗都更可控,也避免了彩色屏带来的晕和重。唇动识别这个细节值得多说一句,它解决的是真实环境里的可用性,而不是演示里的完美安静。展会、车厢、街边这些地方噪声复杂,只靠麦克风很容易把旁人话搅进来,读嘴唇等于多给模型一个信号源,翻译准了,体验才立得住。这类细节比参数表上的语种数更能决定你用不用得惯,也更能区分玩具和工具。

GlassClaw让它不止于翻译。它接到眼镜看到的内容之后,能做理解、检索、整理,自动生成会议纪要,等于把"看一眼"变成"处理完"。传统翻译机是你说完我翻完,它是你看着对方、它一边翻一边把重点记下来,会后给你一份整理稿。这个差异背后是AI载体在变:手机要掏出来、要低头,眼镜是抬眼就在,和世界的交互更顺,也更不打断对话。当然前提是你愿意一直戴着它、接受镜腿上有算力和摄像头,以及周围人知道你在被记录。对商务人群,省下的不是一次翻译,而是一整天里反复掏手机的动作,和会后花时间整理笔记的工夫。眼镜做助理的好处是看见即处理,你看着合同、看着展品、看着路牌,它就能接着帮你查、帮你记,不用先掏手机拍照再问。这对经常开会、参展、出差的人是实打实的效率,不是玩具级别的炫。当然前提是你接受镜腿上有算力和摄像头,以及周围人知道你在被记录,隐私这块得自己权衡,方便和暴露是一体两面。

把讯飞这台眼镜放回行业看,正是"百镜大战"打得火热的阶段。大众网8月16日的报道里,国内智能眼镜已经分出五个阵营:华为、小米、魅族这类消费电子厂;阿里、字节这类互联网厂;理想这类跨行业厂;雷朋、暴龙这类传统眼镜厂;还有Rokid、雷鸟、影目这类专做眼镜的初创。产品也分四类,从纯音频到轻量AR到全功能旗舰到行业定制。IDC的预测是2026年中国智能眼镜出货同比涨77.7%。盘子在大,但重量、续航、性能这三件事的"不可能三角"还没人真正解开,谁先破,谁才敢说自己的眼镜能天天戴。讯飞用40克和双目单色走了取巧的一步,牺牲彩色大屏换佩戴,是务实的选择,但也意味着它暂时不碰沉浸AR,先把翻译这块刚需站稳,这比什么都想做要清醒。行业热闹归热闹,最后留下来的一定是那款你愿意天天戴的,不是参数最漂亮的,消费者用脚投票的方式很简单,就是摘不摘。

我的判断:实时翻译是智能眼镜里很站得住的刚需之一,讯飞拿它当切入点是选对了场景,40克的重量也说明厂商在认真对付佩戴门槛。但能不能从展会走到日常,要看两件事,一是续航扛不扛得住一整天的会议,二是显示和算力在真实环境下稳不稳,展厅里亮和地铁里亮是两码事。对普通读者,我的建议是,如果你真有高频跨语言场景,这台值得等真机上手评测;如果只是想赶个新鲜,先别急,等"不可能三角"被实实在在破掉再下手。眼镜这东西,戴着舒服比参数好看重要得多,参数再漂亮,戴两小时就摘,也算没赢。我的判断是,实时翻译这个切口选得准,它比通用AR更早能兑现价值,因为需求硬、场景清。但眼镜要过的是日常那一关,通勤、会议、出差连着戴一整天,续航和重量才是终审。讯飞这代值得等真机上手,别被展台效果带节奏,等真实用户的佩戴时长出来,再判断它算不算过关,参数好看不等于真能戴住。
数码是个圈 / 小圈
夜雨聆风