乐于分享
好东西不私藏

微软开始给 Office 换上自研 AI:省下的钱会到用户手里吗?

微软开始给 Office 换上自研 AI:省下的钱会到用户手里吗?

在 OneDrive 里改一张图片,或者给航空公司客服打电话,用户看见的界面可能没有任何变化,后台回答问题的 AI 却已经换了。

微软正在把一部分原本交给外部通用模型的任务,交给自己训练的图像和语音模型。它们已经进入 Bing、PowerPoint、OneDrive 和 Dynamics 365 客服系统。变化最值得关注的地方,不是微软又多了两个模型名字,而是 AI 产品开始像云计算一样按任务算成本:简单而高频的工作用专项模型,困难任务再调用昂贵的前沿模型。

对用户来说,这可能带来更快的响应和更稳定的功能;但厂商少花的 GPU 成本,并不会自动变成更低的订阅费。

同一个入口,后台不再只有一个模型

可以把通用模型理解成一位知识面很广的全科医生,什么问题都能先看;专项模型则像影像科或急诊分诊,任务更窄,却能围绕固定流程反复优化。微软给这批自研模型用了 MAI 这个名字。

微软在 7 月 23 日的官方发布中推出 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 的公开预览版。前者偏向高质量图像生成和编辑,后者面向低延迟、高频语音交互。与此同时,已经上线的 MAI-Image-2.5 被设为 Bing Image Creator 的默认端到端模型,并进入 PowerPoint 和 OneDrive 的图片编辑流程。

这意味着用户以后看到的“Copilot”或“AI 编辑”只是入口。入口背后可以根据任务切换不同模型,产品方也不必把每一次请求都交给能力最广、价格最高的方案。

客服电话,是这条路线最具体的样本

微软给出的完整场景来自 Dynamics 365 Contact Center。这是一套让企业搭建呼叫中心语音代理的平台,客户名单包括 T-Mobile 和 EasyJet。微软称,MAI-Voice-2-Flash 现在已经为这套平台提供语音能力,并让 GPU 成本最多下降 89%。

客服系统每天处理大量重复而紧迫的对话。它要及时说出自然语音、接住上下文并快速回应,却不一定需要一款能写论文、做复杂推理的通用模型。把模型专门训练在低延迟语音任务上,计算资源就更容易花在真正影响通话体验的环节。

Microsoft Learn 的产品文档也把 MAI-Voice-2-Flash 定位在实时语音代理、交互式语音应答和客服交互。文档同时提醒,面向外部开发者的这项能力仍处于公开预览阶段,没有服务等级协议,也不建议直接用于生产负载。微软自家产品已经部署,不等于所有企业接入后都能得到同样成熟度。

图像模型的生产数据指向同一逻辑。微软称,PowerPoint 图片编辑改用 MAI-Image-2.5 后,GPU 成本相较 GPT-Image-2 最多下降 84%;OneDrive 上线后的保存率提高 26%,较慢请求的一项延迟指标约下降 25%;客服语音场景的 GPU 成本最多下降 89%。这些都是微软披露的内部指标,还不是独立测评结果。

数据整理自微软官方披露,均为厂商生产指标

这组数字说明微软为什么愿意替换模型,却不能单独证明用户得到的图片更好、客服更懂人,或者企业账单会按同样幅度下降。保存率、延迟和 GPU 成本衡量的是不同环节,不能简单相加。

微软真正要拿回的是调度权

IT Pro 对微软 CEO Satya Nadella 策略的报道把这套做法概括为:为每个任务选择合适模型,同时优化上下文、技能、工具和代理执行框架。高难度工作仍会调用昂贵的前沿模型,窄而稳定的任务则转给更便宜的自研方案。

这种调度权有两层价值。第一层是成本。微软同时拥有模型、云计算和 Office 等产品入口,可以直接看到一次图片编辑或一通客服电话的质量与资源消耗,再据此训练和替换模型。第二层是供应关系。自研模型覆盖更多任务后,微软对 OpenAI、Anthropic 等外部实验室的依赖会下降,谈判空间也会增大。

最强的反方也在这里:专项模型在一个窄任务中胜出,不代表它的通用能力超过前沿模型。微软公布的生产数据来自自己的产品、基础设施和评价标准,外部团队尚未独立复现。将“更省算力”直接写成“更好用”,会跨过证据边界。

用户该盯住三件事

模型藏到后台后,用户需要的不是更长的型号清单,而是可感知的结果。

先看价格。若厂商持续披露成本下降,订阅费、调用价格或可用额度是否随之改善,才决定效率红利落在谁手里。

再看透明度。图片质量突然变化、客服语音出错或企业合规要求不同的时候,用户能否知道后台用了哪类模型、数据经过哪里、出了问题由谁负责。

最后看选择权。企业是否能固定模型、切回其他供应商,个人用户能否拒绝某些处理方式,会决定“自动选择最合适模型”究竟是便利,还是平台单方面控制。

微软这次发布释放的信号很清楚:AI 产品的下一轮竞争会从“默认接入最强模型”,转向“把每项任务交给成本和效果最合适的模型”。厂商已经开始拿到节省,用户能否拿到更低价格、更好体验和更清楚的选择,才是这条路线接下来需要验证的结果。