乐于分享
好东西不私藏

每日AI新闻简报|2026年7月30日

每日AI新闻简报|2026年7月30日
观变AI 新闻日报
2026-07-30

今日 7 条|国内 1 条|模型与智能体研究 3 条|科研与商业化 2 条|治理 1 条|约 7 分钟

今日关键词:Kimi K3 技术报告 · GPT-5.6 效率工程 · ARC-AGI-3 · 智能体上下文管理 · 科研免费计划 · Microsoft AI 商业化

今日导语:月之暗面补充公开 Kimi K3 的完整模型结构、量化与部署资料。海外方面,OpenAI 披露 GPT-5.6 的推理效率工程,并发布 ARC-AGI-3 评测框架复盘及面向科研人员的免费使用计划;Meta 与卡内基梅隆大学提出由智能体自主触发的上下文管理方法。微软公布第四财季云与 AI 业务数据,欧盟 AI Omnibus 已正式生效。

01
国内模型技术  · CHINA MODEL TECHNOLOGY
★技术报告月之暗面
Kimi K3 完整技术资料公开,采用 2.8T MoE 与原生 MXFP4 量化
月之暗面在 Kimi K3 官方仓库和技术报告中补充模型结构、评测与部署资料。K3 为 2.8T 总参数的混合专家模型,每个 token 激活约 104B 参数,包含 896 个专家并选择其中 16 个;模型支持文本、图像和约 100 万 token 上下文。训练从监督微调阶段开始采用 MXFP4 权重、MXFP8 激活的量化感知方案,官方提供 vLLM、SGLang 与 TokenSpeed 部署路径,并要求多轮工具调用保留完整 reasoning_content。模型权重按 Kimi K3 License 发布。
来源:Moonshot AI 官方代码仓库与技术报告 · 2026-07-28
02
模型效率与评测  · MODEL EFFICIENCY & EVALUATION
★推理效率OpenAI
OpenAI 披露 GPT-5.6 推理栈优化:端到端服务成本下降 20%
OpenAI 公开 GPT-5.6 的模型、推理和智能体执行框架优化。公司表示,GPT-5.6 Sol 参与分析生产流量、调整负载均衡和重写生产内核,相关内核与系统优化使端到端服务成本下降 20%;模型还参与设计和训练推测解码使用的草稿模型,使 token 生成效率提高超过 15%。Codex 与 ChatGPT Work 使用的 Rust 执行框架通过延迟发现工具、限制工具输出、保持上下文追加顺序和稳定工具排列,提高提示缓存命中率并减少重复计算。
来源:OpenAI 官方工程博客 · 2026-07-29
★评测框架OpenAI
OpenAI:保留推理与上下文压缩使 ARC-AGI-3 得分升至 38.3%
OpenAI 复盘 GPT-5.6 Sol 在 ARC-AGI-3 二维游戏评测中的表现。官方通用评测框架会在每次动作后丢弃私有推理,并用滚动窗口截断较早操作;OpenAI 改用 Responses API 保留跨工具调用的推理,并在上下文过长时执行压缩。公司称,GPT-5.6 Sol 在公开任务集上的 RHAE 得分由官方框架下的 13.3% 升至 38.3%,输出 token 减少约 6 倍;OpenAI 估算同一指标下的人类测试者平均得分为 48%。
来源:OpenAI 官方研究文章 · 2026-07-29
智能体记忆Meta × CMU
Meta 与 CMU 提出 ACM,让智能体自主决定何时压缩上下文
卡内基梅隆大学研究人员在 Meta 顾问参与下提出 Agentic Context Management。该方法为智能体提供 manage_context 与 query_memory 两类工具,由智能体根据推理状态决定何时压缩工作上下文;原始消息转存至外部空间,可按标识符重新检索。论文报告,经过上下文管理后训练的 Qwen3.5-9B 在 BrowseComp-Plus 上的 Pass@1 从 63.5% 提升至 72.7%,平均峰值上下文由 59K 降至 54K token;代码、数据和模型检查点已公开。
来源:论文 / 代码仓库 · 2026-07-26
03
科研开放与商业化  · SCIENCE ACCESS & COMMERCIALIZATION
★科研计划OpenAI
OpenAI 计划向 10 万名科研人员免费开放前沿模型与工具
OpenAI 启动 ChatGPT for Academic Researchers,初期在部分高校向 1 万名科学、数学和工程研究人员开放,计划到 2027 年扩展至 10 万人。参与者可免费使用包括 GPT-5.6 Sol Pro 在内的模型,以及 ChatGPT、ChatGPT Work、Codex、深度研究、更高用量和更大上下文;每名获批研究人员可邀请最多四名同校合作者。公司称该计划属于其 2027 年前超过 2.5 亿美元的外部科研支持承诺。
来源:OpenAI 官方 · 2026-07-29
★财报数据Microsoft
Microsoft 365 Copilot 付费席位超 3000 万,Azure 全年收入首次破千亿美元
微软公布 2026 财年第四季度业绩:季度营收 900 亿美元,同比增长 18%;Microsoft Cloud 营收 593 亿美元,同比增长 27%;Azure 及其他云服务收入增长 43%。公司表示,Azure 全年收入首次超过 1000 亿美元,Microsoft 365 Copilot 付费席位超过 3000 万。微软同时披露,本季度对 Anthropic 的投资产生 32 亿美元收益,2026 财年对 OpenAI 投资带来的净收益为 49.63 亿美元。
来源:Microsoft 投资者关系 · 2026-07-29
04
政策与治理  · POLICY & GOVERNANCE
★AI 法规欧盟
欧盟 AI Omnibus 生效,高风险系统适用时间延后
欧盟 AI Omnibus 于 7 月 27 日生效。新规则将《AI 法案》附件 III 所列高风险系统的适用时间调整至 2027 年 12 月 2 日,将嵌入机械、玩具和电梯等实体产品的高风险系统调整至 2028 年 8 月 2 日;部分中小企业便利措施扩展至小型中等市值企业,并增加欧盟层级监管沙箱。规则同时禁止生成未经同意的露骨亲密内容或儿童性虐待材料的“脱衣”应用,并扩大 AI Office 对部分通用模型及大型平台内 AI 系统的监管权限。
来源:欧盟委员会官方 · 2026-07-27

每日观点

今天多条技术材料指向同一个工程变量:模型能力越来越依赖执行框架如何保存、压缩和调度上下文。OpenAI 在 ARC-AGI-3 中仅调整推理保留与压缩机制,就把同一模型的得分提高近两倍;Meta 与 CMU 则把“何时压缩”直接训练成智能体动作,Kimi K3 的接口也要求完整回传推理历史。与此同时,推理内核、负载均衡和提示缓存正在把能力转化为可运营成本,微软公布的 Copilot 席位和 Azure 收入则提供了商业侧的规模数据。模型、执行框架与云基础设施已不再是三条独立产品线,而是在同一成本—能力曲线上共同决定实际效果。

相关学习资料