
今天微软悄悄放出的新动作。
MAI-Realtime,一个真正能同时听和说的全双工语音模型,已经出现在微软MAI Playground的隐藏入口里。支持英语、中文、日语、韩语等17种语言,目前有Victoria和Grant两个声音,自然度明显超过现有的Copilot语音模式,还能中途切换语言,并支持工具调用。
这是微软自研MAI系列的首个端到端实时语音模型。此前微软语音能力高度依赖OpenAI,这次明显是想把主动权拿回来。目前还在合作伙伴内测阶段,正式发布时间未定,但已经足够让语音赛道紧张起来。
模型发布与更新
继阿里巴巴推出Qwen3.8-Max后,API现已可用,开源权重计划下周发布。
英伟达同步开放了Nemotron VoiceChat 11B模型权重。这是首个支持实时工具调用的开源全双工语音模型,采用混合Mamba/Transformer架构,端到端语音理解与生成,延迟压到约450毫秒,适合做可打断的实时语音代理。
DeepSeek也更新了V4 Flash正式版,代理能力和推测解码进一步强化。MiniMax则把H3视频模型权重上传到了Hugging Face,但许可证明确排除了美国、欧盟、英国和韩国。
全球其他热闻
英国光子芯片初创公司OLIX一天内完成3.12亿美元B轮融资,估值直接飙到33亿美元(半年内翻了三倍多)。Arm、Hudson River Trading以及Netflix联合创始人Reed Hastings都参与了,英国主权AI基金也进场。公司主打光学互联专用推理芯片,目标2027年下半年交付首款产品,正面挑战现有HBM架构。
CrowdStrike最新威胁报告显示,AI赋能的攻击活动同比上涨89%。同时,一项新基准把AI代理放入模拟公司环境测试合规性,结果表现最好的代理也只在36.2%的试验中真正遵守规则。
国内重点
中国信息通信研究院最新测算:2025年中国人工智能产业规模已经超过1.2万亿元,同比增长40%。截至2026年6月,AI企业数量突破6600家,全球占比约15%,已形成从基础底座到行业应用的完整体系。
Genspark(景鲲团队)发布了GenOffice——号称全球首个全功能开源AI办公套件,支持文档、表格、PPT、PDF,免费无广告,内置Super Agent。官方称由一名工程师用一周时间、约1万美元Token完成Alpha版,代码已开源至GitHub。
社媒小道消息
X上TestingCatalog账号率先曝光微软MAI-Realtime的隐藏入口和演示细节,讨论热度迅速拉高,焦点集中在“微软这次能不能真正做出能打断、能同时聊的语音体验”。
国内社媒则一边关注Qwen3.8-Max下周开源可能带来的冲击,一边围观GenOffice这种“一周出产品”的开发效率,认为AI原生软件的迭代节奏正在加速。
OpenAI内部Astra模型在数学问题上的突破余温还在,但今天真正占话题中心的,已经是实时语音和开源模型的双重推进。
今天的AI圈,语音在抢入口,开源在抢生态,算力在抢效率。
以上。
关注鲲图智能,每天给你扒最新的全球AI大事件。全球前沿的图片(image2等)、视频(ltx、grok等)、文本(gpt5.6等)模型以及业务搭配方案私聊联系我。

夜雨聆风