乐于分享
好东西不私藏

2026年7月17日AI日报 | AI工具链持续升级,实战能力成新焦点

2026年7月17日AI日报 | AI工具链持续升级,实战能力成新焦点
AI日报
2026.7.17日资讯速递

1、阿里发布 Qwen-Audio-3.0-Realtime,实时语音交互继续提速

阿里正式发布 Qwen-Audio-3.0-Realtime,这是一款面向实时语音交互场景升级的模型,重点不只是“能听懂”,而是把情绪表达、环境适应和工具调用一起做进语音链路。

  • 支持高表现力与共情对话,可按语境调整语气情感并支持音色克隆
  • 内置多模态双工控制,支持声纹级背景过滤,嘈杂环境下也能流畅交流
  • 具备动态工具调用能力,实时语音助手开始向可执行 Agent 靠近

2、Grok 4.5 正式开放,编程与 Agent 能力继续上探

马斯克宣布 Grok 4.5 正式面向所有用户开放,这款与 Cursor 合作训练的模型明显冲着编程、Agent 和知识工作场景去,主打更快、更便宜、更长上下文。

  • 拥有 1.5 万亿参数,官方称性能大致对标 Claude Opus 4.7
  • 在编程、智能体与知识工作任务上较前代明显增强
  • 复杂 3D 场景能力仍有限,但 3D 网页生成和深度研究表现已较突出

3、阿里发布 OvisOCR2,端到端文档解析模型登顶榜单

阿里 ATH-MaaS 团队发布 OvisOCR2,把文档页面直接转成自然阅读顺序的 Markdown,方向很明确:不再只是 OCR,而是朝“可直接接入知识工作流”的文档解析底座推进。

  • 基于 Qwen3.5-0.8B 后训练,可解析文本、公式、表格和视觉区域
  • 在 OmniDocBench v1.6 上拿到 96.58 分,官方称首次登顶该榜单
  • 采用 Apache 2.0 许可证,已在 Hugging Face 开源

4、月之暗面发布 Kimi K3,2.8 万亿参数模型将于 7 月 27 日开源

月之暗面正式推出 Kimi K3,这是一款原生支持视觉理解、拥有 100 万上下文窗口的超大模型,重点瞄准长程编程、知识工作和前沿推理任务。

  • 总参数达 2.8 万亿,在 896 个专家中实际激活 16 个
  • 已上线 Kimi、Kimi Work、Kimi Code 与 API,默认思考强度为 max
  • 官方称整体仍落后于 Claude Fable 5 和 GPT 5.6 Sol,但稳定超过其他被测模型

5、Claude Code 为 /code-review 增加 effort 分级,代码审查开始分层

Anthropic 为 Claude Code 的 /code-review 加入多个 effort 级别,不同等级采用不同审查策略,说明 AI 代码审查正从“单一模式”转向“按成本和召回率精细分层”。

  • 低 effort 级别主打低 token 成本下的快速扫描
  • 高 effort 级别引入 subagent 和全新上下文,提升问题召回
  • 极限级别会生成审查 Agent 集群独立复现发现,Anthropic 内部已用于所有 PR

6、OpenClaw 发布 v2026.7.1,控制界面与多端体验一起重构

OpenClaw 正式推送 v2026.7.1,这次升级不只是补模型支持,而是把 Control UI、新手引导、移动端功能和底层状态管理一起重做,继续朝稳定的长期运行平台推进。

  • 新增 GPT-5.6、Tencent Hy3、Claude Sonnet 5 等多模型兼容支持
  • iOS、Android 与 macOS 应用加入离线缓存、语音笔记和工作区终端
  • Gateway 新增崩溃循环自动阻断与 Agent 审计日志,通道稳定性也同步提升

7、Thinking Machines 发布 Inkling,多模态开放权重模型继续上探

Thinking Machines Lab 发布开放权重多模态模型 Inkling,支持文本、图像和音频统一处理,并可通过 Tinker 平台直接微调,继续强化开放模型在多模态推理上的竞争力。

  • 总参数 975B、激活参数 41B,支持最高 1M 上下文窗口
  • 已开放完整权重,提供原始版与适配 NVIDIA Blackwell 的 NVFP4 版本
  • 在 VoiceBench、MMAU 和 AudioMC 等基准上位列开源模型前列

8、xAI 开源 Grok Build CLI,默认零保留开始主打隐私

xAI 宣布开源 Grok Build CLI,并同步把数据保留策略进一步收紧,默认关闭数据保留、删除历史编码数据,把“本地优先、零保留”作为新的隐私卖点。

  • 正式开源 CLI 工具,并重置所有用户使用限制
  • 默认无数据保留,历史编码数据已被删除
  • xAI 将其定义为 AI 编码工具在隐私策略上的新标准

9、阶跃发布 Step Edge 端侧多模态家族,本地 Agent 再向前一步

阶跃发布 Step Edge 系列端侧多模态模型,采用“1+N”架构,把文本视觉基础模型和音频、GUI、图像生成专项模型打包,明显瞄准手机与车载等端侧场景。

  • 基础模型在 GUI 定位、工具调用、App 代理等端侧关键基准上拿到同体量第一
  • 音频模型在 MMSU、MMAR 等基准上超过 MiniCPM-o-4.5 和 Gemma-4-12B
  • 图像生成模型在 W8A16 量化下,文生图约 3 秒、图像编辑约 4.5 秒

10、LibTV 上线 Agent 对话式创作,一句话开始生成完整视频

LibTV 正式上线 Agent 对话式创作,把视频制作从“拖节点、调参数”进一步变成自然语言驱动,普通用户也开始能直接用一句话搭起完整视频工作流。

  • 首页新增对话框,可直接描述视频需求或上传参考素材
  • 内置 Skill 商店,提供广告、短剧、动画等多种模板
  • Agent 可自动生成故事方案、角色锚点、场景和完整工作流,并支持后续对话微调

声明:本内容由AI生成,可能包含不准确或推测性信息,请读者自行甄别并谨慎参考。

欢迎点赞收藏

持续关注每日AI前沿动态
立即扫码 -
更多资讯,
点击下方卡片关注赛凡智云协作平台
▲ 赛凡云盒,一款超好用的企业私有云盘