乐于分享
好东西不私藏

这个能「打断」的AI现在免费开放:MiniCPM-o 4.5 上手体验

这个能「打断」的AI现在免费开放:MiniCPM-o 4.5 上手体验

↑阅读之前记得关注+星标,每天第一时间接收更新

你跟AI对话的时候,有没有遇到过这种尴尬?

你说了一大段,它开始生成回复。生成到一半,你突然想起来忘了补充关键信息。这时候怎么办?

等它说完?那回复是基于不完整信息的。

强行打断?大多数AI会无视你的插话,继续把话说完。

之前测过,豆包在语音通话上已经变得极大人性化,流畅度也更好了。

和豆包聊了40分钟,我发现AI终于"像个人"了

这种体验像极了用对讲机——你说完我才能说,中间没有真正意义上的「对话」。

最近我发现了一个能解决这个问题的新模型:MiniCPM-o 4.5。

全双工到底是什么

说实话,我第一次听到「全双工」这个词也有点懵。

简单说,我们常用的AI对话叫「半双工」。就像对讲机,同一时间只能有一个人说话。你说的时候它在听,它说的时候你在听,来回切换。

全双工呢?就像打电话。双方可以同时说话,可以打断对方,可以插嘴。真正的实时对话。

MiniCPM-o 4.5 是全球第一个能做到这点的开源多模态大模型。不是概念验证,是真正能用的产品。

它的核心能力很简单:你在它说话的时候插嘴,它能听见,能停下,能基于你的新指令重新组织回复。

那种感觉就像——一个一直聋耳朵的AI,突然能听见了。

你重点要看一下迷你CPM-O-4.5-Instruct的能力位置。

它能做什么

我整理了几个最实用的场景:

语音对话中的实时打断

你对着麦克风说:「帮我分析一下这个季度的销售数据——」

说到一半改主意了:「算了,先看上个月的。」

它能听懂,会停下,会给你上个月的分析。

这个体验太自然了。自然到让你意识到,之前的AI交互有多反人类。

视频理解中的实时反馈

打开摄像头,让它看你桌上的东西。你拿起一本书问它是什么,它刚要回答,你把书翻开了。

「等等,你看内页。」

它真的能「看」到内页,然后告诉你这是哪本书、作者是谁、大致内容。

传统的视频理解模型是按帧处理的。你上传一段视频,它分析完告诉你结果。MiniCPM-o 4.5 是流式的,它在「看」的同时就在「想」和「说」。

连续打断也不乱

连续打断它三次,第一次改问题,第二次改语气要求,第三次换话题。

据说它每次都能准确识别新意图,不会混乱不会卡顿。

这种「跟得上」的感觉,是之前任何AI都给不了的。

为什么它能做到

讲真,技术层面的东西我不想写太深。

简单说,MiniCPM-o 4.5 的核心创新叫 Omni-Flow。它给视觉、语音、文字创建了一个共享的「时间轴」,把这些信息流对齐到毫秒级的时间片里。

传统的多模态模型,是先把语音转成文字,再跟图像一起送进大模型。这个过程有延迟,而且一旦开始生成回复,就很难中途改变。

Omni-Flow 是流式的。模型每秒都在刷新自己对「当下」的理解。每个时间片里,它都在同时做三件事:感知新的输入、思考上下文、生成回复。

这就像一个真正的人在对话时的状态——边听边想边说,而不是听完再想再说。

另外,它的语音生成用了 TAIL 方案,让语音流能紧跟实时文本,而不是等整段文字生成完再一次性转成语音。

这些技术堆在一起,才有了「能打断」的体验。

本地部署的可能性

老实讲,最让我惊喜的不是技术多牛。

而是这个模型居然能在本地跑起来。

参数规模 9B,INT4 量化后只需要 12GB 显存。RTX 5070 就能流畅运行全双工模式。

有个叫 Comni 的桌面软件,把环境配置、模型下载、服务启动都包进去了,基本上是一键运行。

启动后,手机连上同一个局域网,就能跟电脑上的模型进行全双工视频通话。

这意味着什么?

你的数据不需要上传云端。在没有网络的环境下,它也能工作。你可以基于它做二次开发,做自己的产品。

开源的不仅是模型权重,还有完整的前后端代码。GitHub 上能找到 Demo 项目的全部实现。

现在的窗口期

好了,说重点。

MiniCPM-o 4.5 目前的 API 服务是免费开放的。端点是 https://api.modelbest.cn/minicpmo45/v1,支持全模态全双工实时交互。

在线体验也不需要注册,打开网页就能用。

我不知道这个免费窗口期会持续多久。按照行业惯例,这种级别的模型,最终都会转向付费或者限流。

所以如果你对这个「能打断的AI」感兴趣,我的建议是:趁现在还能免费玩,去试试

体验地址我放在文末了。

已关注
关注
重播 分享

(测试视频,亲自体验)

它能用在哪

这东西到底能用在哪?我想了几个靠谱的方向,未来具备极大的消费市场。:

主动式伴侣。做饭时看着你切菜,提醒你「这块切太大了」;修东西时实时指导你「螺丝先拧松半圈」。

无障碍辅助。对于视障人士,它可以成为一双「眼睛」,主动播报周围环境的关键信息——「前面有台阶」「左边来了一辆车」。

智能座舱。持续监控路况和驾驶员状态,不是等你问了才回答,而是主动提醒「前面有车位」「你刚才好像走神了」。

具身智能。给机器人装上这个模型,它就能持续感知动态环境并自主决策,而不是按预设程序一步一步执行。

这些场景的共同点是:AI 从被动响应变成了主动参与。不是工具,是助手。

写在最后

了解完 MiniCPM-o 4.5,我最大的感受是:AI 交互的范式,好像真的在变了。

我们习惯了「输入-等待-输出」的节奏,甚至以为这就是AI的常态。但全双工体验告诉我,真正自然的交互不是这样的。我现在和电脑的交互都是通过秘塔回响直接进行语音输入转文字的,在电脑端哦。TRAE和秘塔回响同时上线语音功能:AI工具正在从打字时代进入说话时代

插个题外话,秘塔回响并不是直接将你所说的话转换成文字,而是会将其润色为更书面的语言。大家也可以充分体验一下,效果不错。

人跟人说话的时候,不会等对方说完一句完整的话才回应。我们会插嘴、会抢话、会边说边想。这种实时性,才是对话的本质。

MiniCPM-o 4.5 把这种感觉带给了AI。

而且它开源、可本地部署、目前免费体验。这三点加在一起,让这项技术不再是实验室里的demo,而是真正可以用的产品。

建议你去试试。说到底,我说得再多,也不如你自己打断它一次来得直观。

体验入口:

在线体验:https://minicpmo45.modelbest.cn/

API 文档:https://api.modelbest.cn/minicpmo45/docs

GitHub:https://github.com/OpenBMB/MiniCPM-o-Demo

你期待能打断的AI吗? 12G显存本地部署,你觉得这个门槛高吗?如果AI能主动提醒你,你最想用在什么场景?

W∞ 智能进化 · 智能驱动 · 无限可能

我把麻烦事研究透,你只管拿去用。我蹚坑,你受益,有用就关注,常看就星标。

AI时代的新工具和野路子,第一时间同步你。

关于作者:Wayen,世界500强企业教练+AI职场提效专家。专注研究AI提效、人才赋能、管理提升,信奉"把重复的事交给AI,把思考的事留给自己"。