
1、阿里发布 Qwen-Audio-3.0-Realtime,实时语音交互继续提速
阿里正式发布 Qwen-Audio-3.0-Realtime,这是一款面向实时语音交互场景升级的模型,重点不只是“能听懂”,而是把情绪表达、环境适应和工具调用一起做进语音链路。
支持高表现力与共情对话,可按语境调整语气情感并支持音色克隆 内置多模态双工控制,支持声纹级背景过滤,嘈杂环境下也能流畅交流 具备动态工具调用能力,实时语音助手开始向可执行 Agent 靠近
2、Grok 4.5 正式开放,编程与 Agent 能力继续上探
马斯克宣布 Grok 4.5 正式面向所有用户开放,这款与 Cursor 合作训练的模型明显冲着编程、Agent 和知识工作场景去,主打更快、更便宜、更长上下文。
拥有 1.5 万亿参数,官方称性能大致对标 Claude Opus 4.7 在编程、智能体与知识工作任务上较前代明显增强 复杂 3D 场景能力仍有限,但 3D 网页生成和深度研究表现已较突出
3、阿里发布 OvisOCR2,端到端文档解析模型登顶榜单
阿里 ATH-MaaS 团队发布 OvisOCR2,把文档页面直接转成自然阅读顺序的 Markdown,方向很明确:不再只是 OCR,而是朝“可直接接入知识工作流”的文档解析底座推进。
基于 Qwen3.5-0.8B 后训练,可解析文本、公式、表格和视觉区域 在 OmniDocBench v1.6 上拿到 96.58 分,官方称首次登顶该榜单 采用 Apache 2.0 许可证,已在 Hugging Face 开源
4、月之暗面发布 Kimi K3,2.8 万亿参数模型将于 7 月 27 日开源
月之暗面正式推出 Kimi K3,这是一款原生支持视觉理解、拥有 100 万上下文窗口的超大模型,重点瞄准长程编程、知识工作和前沿推理任务。
总参数达 2.8 万亿,在 896 个专家中实际激活 16 个 已上线 Kimi、Kimi Work、Kimi Code 与 API,默认思考强度为 max 官方称整体仍落后于 Claude Fable 5 和 GPT 5.6 Sol,但稳定超过其他被测模型
5、Claude Code 为 /code-review 增加 effort 分级,代码审查开始分层
Anthropic 为 Claude Code 的 /code-review 加入多个 effort 级别,不同等级采用不同审查策略,说明 AI 代码审查正从“单一模式”转向“按成本和召回率精细分层”。
低 effort 级别主打低 token 成本下的快速扫描 高 effort 级别引入 subagent 和全新上下文,提升问题召回 极限级别会生成审查 Agent 集群独立复现发现,Anthropic 内部已用于所有 PR
6、OpenClaw 发布 v2026.7.1,控制界面与多端体验一起重构
OpenClaw 正式推送 v2026.7.1,这次升级不只是补模型支持,而是把 Control UI、新手引导、移动端功能和底层状态管理一起重做,继续朝稳定的长期运行平台推进。
新增 GPT-5.6、Tencent Hy3、Claude Sonnet 5 等多模型兼容支持 iOS、Android 与 macOS 应用加入离线缓存、语音笔记和工作区终端 Gateway 新增崩溃循环自动阻断与 Agent 审计日志,通道稳定性也同步提升
7、Thinking Machines 发布 Inkling,多模态开放权重模型继续上探
Thinking Machines Lab 发布开放权重多模态模型 Inkling,支持文本、图像和音频统一处理,并可通过 Tinker 平台直接微调,继续强化开放模型在多模态推理上的竞争力。
总参数 975B、激活参数 41B,支持最高 1M 上下文窗口 已开放完整权重,提供原始版与适配 NVIDIA Blackwell 的 NVFP4 版本 在 VoiceBench、MMAU 和 AudioMC 等基准上位列开源模型前列
8、xAI 开源 Grok Build CLI,默认零保留开始主打隐私
xAI 宣布开源 Grok Build CLI,并同步把数据保留策略进一步收紧,默认关闭数据保留、删除历史编码数据,把“本地优先、零保留”作为新的隐私卖点。
正式开源 CLI 工具,并重置所有用户使用限制 默认无数据保留,历史编码数据已被删除 xAI 将其定义为 AI 编码工具在隐私策略上的新标准
9、阶跃发布 Step Edge 端侧多模态家族,本地 Agent 再向前一步
阶跃发布 Step Edge 系列端侧多模态模型,采用“1+N”架构,把文本视觉基础模型和音频、GUI、图像生成专项模型打包,明显瞄准手机与车载等端侧场景。
基础模型在 GUI 定位、工具调用、App 代理等端侧关键基准上拿到同体量第一 音频模型在 MMSU、MMAR 等基准上超过 MiniCPM-o-4.5 和 Gemma-4-12B 图像生成模型在 W8A16 量化下,文生图约 3 秒、图像编辑约 4.5 秒
10、LibTV 上线 Agent 对话式创作,一句话开始生成完整视频
LibTV 正式上线 Agent 对话式创作,把视频制作从“拖节点、调参数”进一步变成自然语言驱动,普通用户也开始能直接用一句话搭起完整视频工作流。
首页新增对话框,可直接描述视频需求或上传参考素材 内置 Skill 商店,提供广告、短剧、动画等多种模板 Agent 可自动生成故事方案、角色锚点、场景和完整工作流,并支持后续对话微调
声明:本内容由AI生成,可能包含不准确或推测性信息,请读者自行甄别并谨慎参考。
欢迎点赞收藏


夜雨聆风