↑阅读之前记得关注+星标,每天第一时间接收更新
你跟AI对话的时候,有没有遇到过这种尴尬?
你说了一大段,它开始生成回复。生成到一半,你突然想起来忘了补充关键信息。这时候怎么办?
等它说完?那回复是基于不完整信息的。
强行打断?大多数AI会无视你的插话,继续把话说完。
之前测过,豆包在语音通话上已经变得极大人性化,流畅度也更好了。
这种体验像极了用对讲机——你说完我才能说,中间没有真正意义上的「对话」。
最近我发现了一个能解决这个问题的新模型:MiniCPM-o 4.5。

全双工到底是什么
说实话,我第一次听到「全双工」这个词也有点懵。
简单说,我们常用的AI对话叫「半双工」。就像对讲机,同一时间只能有一个人说话。你说的时候它在听,它说的时候你在听,来回切换。
全双工呢?就像打电话。双方可以同时说话,可以打断对方,可以插嘴。真正的实时对话。
MiniCPM-o 4.5 是全球第一个能做到这点的开源多模态大模型。不是概念验证,是真正能用的产品。
它的核心能力很简单:你在它说话的时候插嘴,它能听见,能停下,能基于你的新指令重新组织回复。
那种感觉就像——一个一直聋耳朵的AI,突然能听见了。

你重点要看一下迷你CPM-O-4.5-Instruct的能力位置。
它能做什么
我整理了几个最实用的场景:
语音对话中的实时打断
你对着麦克风说:「帮我分析一下这个季度的销售数据——」
说到一半改主意了:「算了,先看上个月的。」
它能听懂,会停下,会给你上个月的分析。
这个体验太自然了。自然到让你意识到,之前的AI交互有多反人类。
视频理解中的实时反馈
打开摄像头,让它看你桌上的东西。你拿起一本书问它是什么,它刚要回答,你把书翻开了。
「等等,你看内页。」
它真的能「看」到内页,然后告诉你这是哪本书、作者是谁、大致内容。
传统的视频理解模型是按帧处理的。你上传一段视频,它分析完告诉你结果。MiniCPM-o 4.5 是流式的,它在「看」的同时就在「想」和「说」。
连续打断也不乱
连续打断它三次,第一次改问题,第二次改语气要求,第三次换话题。
据说它每次都能准确识别新意图,不会混乱不会卡顿。
这种「跟得上」的感觉,是之前任何AI都给不了的。
为什么它能做到
讲真,技术层面的东西我不想写太深。
简单说,MiniCPM-o 4.5 的核心创新叫 Omni-Flow。它给视觉、语音、文字创建了一个共享的「时间轴」,把这些信息流对齐到毫秒级的时间片里。
传统的多模态模型,是先把语音转成文字,再跟图像一起送进大模型。这个过程有延迟,而且一旦开始生成回复,就很难中途改变。
Omni-Flow 是流式的。模型每秒都在刷新自己对「当下」的理解。每个时间片里,它都在同时做三件事:感知新的输入、思考上下文、生成回复。
这就像一个真正的人在对话时的状态——边听边想边说,而不是听完再想再说。
另外,它的语音生成用了 TAIL 方案,让语音流能紧跟实时文本,而不是等整段文字生成完再一次性转成语音。
这些技术堆在一起,才有了「能打断」的体验。
本地部署的可能性
老实讲,最让我惊喜的不是技术多牛。
而是这个模型居然能在本地跑起来。
参数规模 9B,INT4 量化后只需要 12GB 显存。RTX 5070 就能流畅运行全双工模式。
有个叫 Comni 的桌面软件,把环境配置、模型下载、服务启动都包进去了,基本上是一键运行。
启动后,手机连上同一个局域网,就能跟电脑上的模型进行全双工视频通话。
这意味着什么?
你的数据不需要上传云端。在没有网络的环境下,它也能工作。你可以基于它做二次开发,做自己的产品。
开源的不仅是模型权重,还有完整的前后端代码。GitHub 上能找到 Demo 项目的全部实现。

现在的窗口期
好了,说重点。
MiniCPM-o 4.5 目前的 API 服务是免费开放的。端点是 https://api.modelbest.cn/minicpmo45/v1,支持全模态全双工实时交互。
在线体验也不需要注册,打开网页就能用。
我不知道这个免费窗口期会持续多久。按照行业惯例,这种级别的模型,最终都会转向付费或者限流。
所以如果你对这个「能打断的AI」感兴趣,我的建议是:趁现在还能免费玩,去试试。
体验地址我放在文末了。
(测试视频,亲自体验)
它能用在哪
这东西到底能用在哪?我想了几个靠谱的方向,未来具备极大的消费市场。:
主动式伴侣。做饭时看着你切菜,提醒你「这块切太大了」;修东西时实时指导你「螺丝先拧松半圈」。
无障碍辅助。对于视障人士,它可以成为一双「眼睛」,主动播报周围环境的关键信息——「前面有台阶」「左边来了一辆车」。
智能座舱。持续监控路况和驾驶员状态,不是等你问了才回答,而是主动提醒「前面有车位」「你刚才好像走神了」。
具身智能。给机器人装上这个模型,它就能持续感知动态环境并自主决策,而不是按预设程序一步一步执行。
这些场景的共同点是:AI 从被动响应变成了主动参与。不是工具,是助手。
写在最后
了解完 MiniCPM-o 4.5,我最大的感受是:AI 交互的范式,好像真的在变了。
我们习惯了「输入-等待-输出」的节奏,甚至以为这就是AI的常态。但全双工体验告诉我,真正自然的交互不是这样的。我现在和电脑的交互都是通过秘塔回响直接进行语音输入转文字的,在电脑端哦。TRAE和秘塔回响同时上线语音功能:AI工具正在从打字时代进入说话时代。
插个题外话,秘塔回响并不是直接将你所说的话转换成文字,而是会将其润色为更书面的语言。大家也可以充分体验一下,效果不错。
人跟人说话的时候,不会等对方说完一句完整的话才回应。我们会插嘴、会抢话、会边说边想。这种实时性,才是对话的本质。
MiniCPM-o 4.5 把这种感觉带给了AI。
而且它开源、可本地部署、目前免费体验。这三点加在一起,让这项技术不再是实验室里的demo,而是真正可以用的产品。
建议你去试试。说到底,我说得再多,也不如你自己打断它一次来得直观。
体验入口:
◆在线体验:https://minicpmo45.modelbest.cn/
◆API 文档:https://api.modelbest.cn/minicpmo45/docs
◆GitHub:https://github.com/OpenBMB/MiniCPM-o-Demo
你期待能打断的AI吗? 12G显存本地部署,你觉得这个门槛高吗?如果AI能主动提醒你,你最想用在什么场景?
W∞ 智能进化 · 智能驱动 · 无限可能
我把麻烦事研究透,你只管拿去用。我蹚坑,你受益,有用就关注,常看就星标。
AI时代的新工具和野路子,第一时间同步你。
关于作者:Wayen,世界500强企业教练+AI职场提效专家。专注研究AI提效、人才赋能、管理提升,信奉"把重复的事交给AI,把思考的事留给自己"。
夜雨聆风