乐于分享
好东西不私藏

OpenAI 发布 GPT-5.6:新一代旗舰模型全面升级,同步推出 GPT-Live 实时交互

OpenAI 发布 GPT-5.6:新一代旗舰模型全面升级,同步推出 GPT-Live 实时交互

数据窗口:2026-07-12 08:30 ~ 2026-07-13 08:30 (UTC+8)
本期采集 14 个源 / 精简后 22 条入选
⚠️ 数据覆盖:Anthropic、Meta AI、xAI、Mistral AI 官博、GitHub Trending、HuggingFace、Papers With Code、Hacker News、机器之心、量子位今日未能成功抓取;本期以 OpenAI 官博、Google DeepMind 官博、Qwen 官博、arXiv 为主要信源。周一是静默日,厂商发布较少属正常现象。


  1. 1. OpenAI 发布 GPT-5.6 — 新一代旗舰模型,宣称在推理、编程、多模态等维度全面刷新 SOTA,并同步推出 GPT-Live 实时语音交互功能;GPT-5.6 已作为 Microsoft 365 Copilot 的默认模型上线。OpenAI 博客[1]
  2. 2. OpenAI 发布 GPT-Live 实时交互产品 — 支持实时语音+视频交互,面向对话式 AI 助手新范式;配有独立 System Card 安全评估。OpenAI 博客[2]
  3. 3. Qwen 发布 Qwen3Guard 安全护栏模型 — Qwen 家族首个安全分类模型,基于 Qwen3 基座微调,在 Prompt 和 Response 安全检测上达 SOTA,支持中英多语。Qwen 博客[3]
  4. 4. Qwen-Image-Edit 上线 — 在 20B Qwen-Image 基础上扩展图像编辑能力,实现精准文字编辑和语义级图像修改。Qwen 博客[4]
  5. 5. WebSwarm:递归多智能体深度搜索框架 — 人大团队提出渐进式递归委托框架,在 BrowseComp-Plus 等深度/广度搜索任务上全面超越单智能体和现有多智能体方案。arXiv[5]

🏢 厂商官方发布

🌐 海外头部

OpenAI

  • GPT-5.6: Frontier intelligence that scales with your ambition[1] · 2026-07-09 · product — 新一代旗舰模型,在推理、编程、多模态等维度全面刷新 SOTA,配套发布 System Card。
  • Introducing GPT-Live[2] · 2026-07-08 · product — 实时语音+视频交互产品,面向对话式 AI 助手新范式。
  • GPT-5.6 is now the preferred model in Microsoft 365 Copilot[6] · 2026-07-09 · product — GPT-5.6 已集成进 Microsoft 365 Copilot,成为默认模型。
  • ChatGPT is now a partner for your most ambitious work[7] · 2026-07-09 · product — ChatGPT 产品定位升级,主打复杂任务协作。
  • Separating signal from noise in coding evaluations[8] · 2026-07-08 · research — 研究如何从编程基准测试中分离真实信号与噪声,提高评估可靠性。
  • OpenAI Bio Bug Bounty[9] · 2026-07-09 · safety — 启动生物安全漏洞赏金计划。
  • GPT‑5.6 System Card[10] · 2026-07-09 · safety — GPT-5.6 安全评估报告。
  • GPT‑Live System Card[11] · 2026-07-08 · safety — GPT-Live 安全评估报告。

Anthropic

本期未能成功抓取官博,本周动向待确认。

Google DeepMind / Google AI

本期未能成功抓取最新发布;此前已公布 Gemini Omni(5 月)、Gemini 3.5 Flash Computer Use(6 月)、Gemma 4 12B(6 月)、DiffusionGemma(6 月)等。

Meta AI

本期未能成功抓取官博。

xAI

本期未能成功抓取官博。

Mistral AI

本期未能成功抓取官博。

🇨🇳 国内头部

DeepSeek

今日官网无新发布公告。

通义千问 Qwen

  • Qwen3Guard:安全护栏模型[3] · model · safety — Qwen 家族首个安全分类模型,基于 Qwen3 微调,Prompt/Response 安全检测 SOTA,支持中英多语。
  • Qwen-Image-Edit:图像编辑模型[4] · model — 在 20B Qwen-Image 基础上实现文字精确编辑和语义级图像修改,融合 Qwen2.5-VL 视觉控制。
  • Qwen-Image:20B 图像基础模型[12] · model — 20B MMDiT 图像基础模型,文本渲染能力突出,支持多行排版和段落级语义。
  • GSPO:组序列策略优化算法[13] · research — 解决 GRPO 等 RL 算法在长训练中的不稳定和模型崩溃问题,提出 GSPO 实现稳定 RL 扩展。
  • Qwen-MT Turbo:多语言翻译模型[14] · model — 基于 Qwen3 训练,支持 92 种语言翻译,覆盖 95% 全球人口,集成 RL 提升翻译准确性。

📄 arXiv 新论文

  • UniClawBench: 主动式 Agent 通用基准测试 · cs.CL · Chen et al. (HKU) — 首个基于能力的 Agent 基准,围绕五大模型能力设计 400 个双语真实任务,在 Docker 环境中闭环评估。arXiv[15]
  • WebSwarm: 递归多智能体深度搜索框架 · cs.CL · Song et al. (人大) — 渐进式递归委托框架,节点可自解或委托子节点,在深度/广度搜索任务上全面超越基线。arXiv[5]
  • DominoTree: 条件树结构推测解码 · cs.CL · Lin et al. — 训练免费的推测解码树方法,Qwen3-4B 上达 6.6x 加速,最高每轮 10.7 tokens 接受长度。arXiv[16] · 代码[17]
  • MAESTRO: MoE 专家剪枝框架 · cs.CL · Goel et al. — 基于马尔可夫链的 MoE 结构化剪枝,建模专家激活轨迹,在 50% 压缩率下比 SOTA 基线平均性能保留高 10.61%。arXiv[18]
  • UltraX: 大规模预训练数据精炼框架 · cs.CL · Zhao et al. (清华) — 函数调用式数据编辑框架,支持插入/删除/修改,在数据效率上匹配或超越更大规模训练。arXiv[19]
  • IdeaGene-Bench: 科学谱系推理基准 · cs.AI · Zhou et al. — 模拟科学思想的遗传、突变、重组过程,包含 1961 条谱系轨迹,最强模型仅达 27.3% 精确率。arXiv[20]
  • LLM 引用验证器基准测试 · cs.CL · Leung et al. — 系统评估 8 个 LLM 法官在深度研究引用归因中的表现,发现便宜模型在引用验证上不逊于昂贵前沿模型。arXiv[21]

📝 编者按

本周一(7 月 13 日)AI 圈相对平静,主要动态集中在上周四周五。OpenAI 的 GPT-5.6 + GPT-Live 双发布是本周期的头号事件——新一代旗舰模型直接集成 Microsoft 365 Copilot,标志着「模型即产品」的加速落地。国内方面,Qwen 家族密集发布安全护栏、图像编辑、翻译模型,多模态布局持续深化。学术侧,Agent 基准测试(UniClawBench)和多智能体搜索(WebSwarm)反映出社区对「Agent 能力评估」和「复杂任务协作」的日益关注。受周末影响,Anthropic、Meta、xAI 等多家官网未成功抓取,部分信息需后续补充。


本日报由 OpenClaw + llm-daily-digest skill 自动生成 · 仅供个人信息聚合使用,内容版权归原作者

引用链接

[1] OpenAI 博客: https://openai.com/index/gpt-5-6/
[2] OpenAI 博客: https://openai.com/index/introducing-gpt-live/
[3] Qwen 博客: https://qwenlm.github.io/blog/qwen3guard/
[4] Qwen 博客: https://qwenlm.github.io/blog/qwen-image-edit/
[5] arXiv: https://arxiv.org/abs/2607.08662
[6] GPT-5.6 is now the preferred model in Microsoft 365 Copilot: https://openai.com/index/gpt-5-6-preferred-model-microsoft-365-copilot/
[7] ChatGPT is now a partner for your most ambitious work: https://openai.com/index/chatgpt-for-your-most-ambitious-work/
[8] Separating signal from noise in coding evaluations: https://openai.com/index/separating-signal-from-noise-coding-evaluations/
[9] OpenAI Bio Bug Bounty: https://openai.com/index/bio-bug-bounty/
[10] GPT‑5.6 System Card: https://deploymentsafety.openai.com/gpt-5-6
[11] GPT‑Live System Card: https://deploymentsafety.openai.com/gpt-live
[12] Qwen-Image:20B 图像基础模型: https://qwenlm.github.io/blog/qwen-image/
[13] GSPO:组序列策略优化算法: https://qwenlm.github.io/blog/gspo/
[14] Qwen-MT Turbo:多语言翻译模型: https://qwenlm.github.io/blog/qwen-mt/
[15] arXiv: https://arxiv.org/abs/2607.08768
[16] arXiv: https://arxiv.org/abs/2607.08642
[17] 代码: https://github.com/slin-zhq/Domino-Tree
[18] arXiv: https://arxiv.org/abs/2607.08601
[19] arXiv: https://arxiv.org/abs/2607.08646
[20] arXiv: https://arxiv.org/abs/2607.08758
[21] arXiv: https://arxiv.org/abs/2607.08700