乐于分享
好东西不私藏

从一张聊天图片到一段实时视频:国民 App 的多模态入口争夺战

从一张聊天图片到一段实时视频:国民 App 的多模态入口争夺战

哈喽,这里是白白,

🉑在聊天工具🔍搜索:白白 AI 之旅

每日分享 AI 副业实操与前沿资讯。

内含多个日常工具小程序、AI 工具,无广告免费使用。

AI 产品过去习惯把用户带进一个独立聊天框。

现在,方向正在改变:AI 开始出现在用户原本就要完成的动作里。

微信把“小微”放进聊天图片,豆包把 SeedRealtime 放进视频通话。一个处理静态图片任务,一个连续理解音视频流,共同指向多模态 AI 的下一阶段。

01 微信:打开一张图片,下一步直接交给 AI

部分灰测用户在单聊或群聊中打开图片后,会在底部看到「AI 处理」入口。

灰测截图显示,功能被分成美化图片、提取信息、修改图片和更多操作。具体能力包括人像美化、滤镜与换背景、风格转换、提取文字、图片总结、翻译、生成文档、消除杂物、打码和提升清晰度等。

用户不必先保存图片,再跳到修图、OCR 或翻译应用。AI 被放在图片浏览之后,直接承接下一步任务。

这项功能仍处于小范围灰测,没有公开申请入口。不同测试批次、系统和版本看到的菜单也可能不同,因此准确说法是“微信正在灰测”,而不是“微信已经全面上线 AI 修图”。

02 豆包:从看一帧,升级为连续看、听、说

豆包的视频通话已经接入原生音视频全双工模型 SeedRealtime。

传统方案常把语音、画面和文本拆开处理,交互更像对讲机:用户说完,系统再理解、再回答。遇到停顿、插话或背景噪声时,轮次判断容易变得生硬。

SeedRealtime 把音频、视频和文本放在统一架构里处理。它可以持续观察场景变化,结合声音与上下文判断该接话、继续听,还是暂时保持沉默。

这不意味着 AI 已经能在所有复杂环境中完美理解多人对话,但产品目标已经从“回答一个问题”转向“参与一段连续互动”。

豆包官方称该能力已在 App 全量上线。用户更新到最新版后,可从对话框内的「打电话」进入视频通话,实际可用情况仍以客户端显示为准。

03 两个入口,两种产品路线

微信的优势,是高频场景已经存在。用户本来就会打开聊天图片、看公众号、发朋友圈,AI 只需在正确位置接住下一步动作。

豆包的优势,是把相机、麦克风和模型连接成持续会话,让 AI 可以围绕真实环境进行更自然的交流。

可以把两条路线概括为:

静态任务入口:图片 → 小微 → 修图、提取、翻译、整理。

连续场景入口:音视频流 → SeedRealtime → 看、听、说与实时回应。

前者让 AI 更像操作层,后者让 AI 更像感知层。

04 便利之外,数据边界必须看清

微信“小微”会处理用户主动输入的文字、语音、图片和文档,并形成可管理的对话记录。部分去标识化数据可能用于模型评估、测试或训练,用户可以在设置中关闭模型改进选项。

豆包只在用户主动开启视频通话或屏幕共享后处理相应画面,不是一直在后台观看。相机和麦克风权限可以撤回,视频与声音是否用于模型改进也有独立开关。

涉及人脸、证件、公司文件、家庭环境或第三方画面时,仍应先判断是否适合提交,并取得相关人的授权。

05 AI 的入口之争,正在变成“下一步之争”

独立聊天框不会消失,但大众用户未必愿意为了每个小任务重新描述上下文。

更自然的产品方式,是在用户已经打开图片、正在拍摄、正在通话时,让 AI 理解当前对象,并直接完成下一步。

当 AI 从一个需要主动寻找的工具,变成高频操作中的默认能力,多模态才真正开始进入日常生活。