Bloomberg的Mark Gurman这周扔了个大爆料。OpenAI的第一款硬件产品细节出来了。
不是芯片,不是服务器,不是API定价方案。是一个冰球大小的智能音箱。甜甜圈造型,没有屏幕,Jony Ive亲手设计,定价300到400美元。预计2027年发布。
OpenAI——这个过去两年靠卖API赚钱的纯软件公司——要进你家客厅了。
我第一反应是:又一个做硬件翻车的软件公司?但仔细看了Gurman爆料的细节之后,我改主意了。这不是"科技公司跟风做硬件"的故事,而是一个关于"AI下一步往哪走"的信号。
下面三个问题,是我这两天一直在琢磨的。
软件公司做硬件,成功的先例真的不多。微软Surface亏了好几年才站稳,Google Pixel从来没真正威胁过iPhone,Meta的Quest烧了几百亿还在找盈利模式。
但OpenAI的情况不太一样。
不一样在哪?在于它不是在做"另一个手机"或"另一个智能音箱"。它是在定义一个全新品类——"AI原生硬件"。
什么意思?Echo是"智能音箱+语音助手",核心还是音箱,AI只是附加功能。HomePod是"好音质+苹果生态",AI也不是主角。但据Gurman描述,OpenAI这个设备没有屏幕、只有声音交互,整个产品的核心就是AI对话本身。
换句话说,它不是在音箱里加AI,而是在AI外面套了个壳。
这个区别很重要。因为如果核心是AI,那硬件的形态就可以完全自由——不需要屏幕(因为AI能听懂你说什么),不需要按键(因为AI能理解你的意图),不需要复杂交互界面(因为AI会主动回应)。
Jony Ive是谁?iPhone、iPad、MacBook的设计师。他的设计哲学就四个字:少即是多。一个没有屏幕、没有按钮、只有声音的设备,反而可能是最符合他理念的设计表达。
但我也有个担心。极简意味着完全依赖AI理解你。手机偶尔卡一下,你还能点别的按钮。但一个没有屏幕、没有按钮的设备,如果AI偶尔犯傻——比如你问它"帮我看看这个方案靠不靠谱",它理解成了"帮我放首歌"——你完全没有其他操作方式可以纠正它。这跟手机的"偶尔卡一下没关系"是完全不同的体验容忍度。
这是最核心的问题。智能音箱这个品类已经存在十年了,大部分人的使用场景是什么?放音乐、设闹钟、问天气。就这三件事。
如果OpenAI的设备也只能干这三件事,300美元就是智商税。
但GPT的智力和Alexa、Siri不是一个量级。Alexa能帮你开关灯,GPT能帮你分析方案。这个差距决定了它可能打开一个全新的使用场景。
我试着想了几个我自己的需求:
"今天开了个会,三个方案A、B、C,你帮我分析一下哪个更靠谱。"——这个需求,对着手机说不太方便(你得一直举着手机),但对着桌上一个设备说就很自然。
"我最近在看一辆车,你帮我查查这个型号的口碑和常见问题。"——不用打开手机搜索,随口就能问。
"刚才那个想法不错,帮我记下来,跟上周聊的那个方案对比一下。"——这需要一个能持续记住上下文的AI设备,而不是每次对话都从零开始的语音助手。
这些场景的共同特点是什么?都是"随手问、随口聊"的需求。不需要看屏幕,但需要AI有足够的理解和记忆能力。
Alexa做不到,因为它的智力不够。Siri做不到,因为它被限制在苹果的生态里。GPT可以做到,前提是它真的能像Gurman描述的那样"更接近人类交流的互动"。
我的判断是:无屏幕AI设备的杀手级场景不是"智能家居控制",而是"随时可以问的AI顾问"。前者是工具,后者是伙伴。300美元买一个AI顾问放家里,这个逻辑成不成立,取决于GPT能不能在硬件上提供跟网页版一样好的对话体验。如果体验打折扣——比如延迟高、断句差、上下文记不住——那它就只是一个贵了的Echo。
先看定价逻辑。
Amazon Echo:50到200美元,走的是"便宜到你可以每个房间放一个"的路线。Apple HomePod:299美元,走的是"音质好但贵"的路线。Sonos:200到500美元,走的是"发烧友多房间音频系统"的路线。
OpenAI定300到400美元,比Echo贵,跟HomePod持平,比Sonos入门款贵一点。
这个定价说明两件事。
第一,OpenAI不是来拼性价比的。如果想拼性价比,定价应该在100美元以下,跟Echo正面打。300到400美元意味着它认为自己提供的价值——GPT级别的AI对话——远超现有智能音箱。
第二,它暗示了定位不是"智能家居中控"而是"AI伙伴"。智能家居中控卖300美元太贵了,普通用户不会花3000块买个开关灯的语音助手。但如果你卖的不是工具,是一个能在家里跟你聊天、帮你思考、听你吐槽的AI——你会不会花这个钱?
OpenAI的赌注是:会。
大部分报道都在关注"冰球大小""甜甜圈造型""Jony Ive设计"这些外观信息,但有一个细节被忽略了:据Gurman的爆料,这个设备不只是有麦克风,还配备了摄像头系统和传感器。
这意味着什么?
意味着它不是单纯的"智能音箱"。它是一个可以"看"的设备。它可以识别你桌上放着什么文件,可以观察你的手势,可以感知环境变化。
如果只有麦克风,它的上限就是一个"能听懂话的音箱"。但加上摄像头和传感器,它的上限是一个"能感知环境的AI助手"。
这个差别,可能决定了它到底是一个"更好的Echo"还是一个"全新的品类"。
当然,摄像头也带来了隐私问题。一个带摄像头的AI设备放在家里,Always-on,始终在"看"——这件事能不能被消费者接受,是个大问号。Echo和HomePod没有摄像头,不是做不到,是刻意避开了这个雷区。OpenAI选择带上摄像头,要么是它认为AI需要视觉才能真正有用,要么是它低估了消费者的隐私敏感度。
我倾向于前者。因为如果OpenAI只是想做一个智能音箱,它不需要摄像头。它加了摄像头,说明它想做的东西远超"音箱"这个品类。
OpenAI做硬件这件事,短期看是冒险——软件公司做硬件成功率低,第一款产品大概率不完美。但长期看,这是一个必然的方向。
原因很简单:AI的终极形态不是"你打开APP去用它",而是"它一直在你身边"。手机是"你需要时才拿起来的设备",而一个放在桌上、始终在线的AI设备是"始终在那里的存在"。这两种交互方式的差距,比大多数人想象的要大。
最后说一句:这周AI行业新闻很多——OpenAI免费了、DeepSeek涨价了、字节认输了——但我认为,十年后回头看,可能就是"OpenAI决定做硬件"这件事影响最大。
因为模型升级是渐进的,参数从2万亿到5万亿到10万亿,每年都在涨。但"AI从屏幕里走出来进入物理世界"这件事,是跨越式的。
一个冰球大小的设备,可能就是AI走出屏幕的第一步。
夜雨聆风