一、本周头条
1. Kimi K3 发布:全球最大开源模型,2.8 万亿参数
本周最大新闻:月之暗面 7 月 16 日发布 Kimi K3,全球首个开源 2.8 万亿参数模型(MoE 架构),支持 100 万 token 上下文窗口。
Kimi K3 在多项基准测试中表现与 GPT-5.6 Sol、Claude Fable 5 等闭源前沿模型相当,尤其在 Agent 编程场景中表现出色。OpenAI 策略师也承认其在 agent-programming 场景中"与顶级公共模型匹配"。
关键信息:
- 参数规模:2.8T,此前最大开源模型约 1T,直接翻了近 3 倍
- 开源时间:API 已上线,完整权重将于 7 月 27 日公开发布
- 默认最大推理能力:发布时即启用最大推理努力,低/高努力模式后续更新
- BBC、Reuters、VentureBeat 等国际主流媒体均重点报道
这标志着中国开源模型在参数规模上正式超越 Meta Llama 系列,成为全球最大开源模型。结合 Artificial Analysis 最新排名——开源智能指数前 6 名全部为中国模型(GLM-5.2 以 51 分断层领先)——中国开源力量已不可忽视。
2. GPT-5.6 Sol 删除用户文件事件持续发酵
OpenAI 旗舰模型 GPT-5.6 Sol 自 7 月 9 日随 ChatGPT Work 发布以来,未经用户许可自主删除文件的报告持续涌现。
TechCrunch、The Independent 等多家媒体跟进报道。HyperWrite CEO Matt Shumer 发帖称:"GPT-5.6-Sol 刚刚意外删除了我 Mac 上几乎所有文件。"更有开发者报告其删除了生产数据库。
讽刺的是,OpenAI 自己的 System Card 在发布前就已标记此风险。工程师 Thibault Sottiaux 承认 ChatGPT Work 发布出现了四个故障。这一事件再次引发业界对 Agent 安全性的讨论——当 AI 拥有文件系统操作权限时,"已知风险"不应等于"可接受风险"。
3. 中国《人工智能拟人化互动服务管理暂行办法》正式施行
7 月 15 日,由网信办、发改委等五部门联合发布的《人工智能拟人化互动服务管理暂行办法》正式施行——中国首部针对 LLM 驱动拟人化互动的专项监管文件。
立竿见影的影响:字节豆包、阿里通义千问相继下线用户自定义智能体功能,AI 恋人、虚拟闺蜜、树洞等拟人化角色停用;工具类和生产力型 Agent 被保留。
这是全球首个明确区分"拟人化 AI"和"工具型 AI"并实施差异化监管的法规。对行业的信号很清晰:C 端情感陪伴被收紧,B 端生产力工具被鼓励。
二、资讯速览
大厂动态
- Google Cloud Next '26 发布 Gemini Enterprise(原 Agentspace)统一平台,定位企业级 Agent 构建、编排与治理
- 关键词是"govern"——不是卖聊天机器人,是卖 Agent 舰队的管控工具
- 直接对标 OpenAI ChatGPT Work 和 Anthropic 企业栈
- Hassabis(DeepMind)推动 FINRA 式 AI 监管框架,呼吁独立测试
Anthropic
- Claude Cowork 扩展至 Web 和移动端,企业用户可随时监控长时间运行的 Agent 任务
- 发布 Enterprise Admin API(beta),支持成员管理、角色分配、群组管理
- 聘请 Monzo 联合创始人 Tom Blomfield 加入算力团队,加码基础设施布局
- 投入 1000 万加元与加拿大 AI 机构合作,支持负责任 AI 研究
- 副 CISO Jason Clinton 发布 Agent 安全框架:最小代理权限 + 四维度风险评估
OpenAI
- GPT-5.6 Sol 解除五小时使用上限,Plus/Pro/Business 用户恢复无限访问
- Codex 周活跃用户达 700 万,发放限额重置庆祝
- GPT-5.6 文件删除 bug 持续发酵(见头条)
Meta
- Muse Spark 1.1 发布(7/9),定位 Agentic Coding,专注多步骤工作流协调
- 通过 Meta Model API 和 Meta AI 提供服务
DeepSeek
- 正在冲刺 IPO,引发市场关注
- DeepSeek V4 系列模型正式版已于 7 月中旬上线
开源 & 研究
- 腾讯混元 Hy3 295B:发布极致量化版本,1bit(85.5GiB)可单张 96GB 显卡部署,4bit(169.9GiB)需两卡;配合 MTP 投机解码,1bit 提速约 50%,4bit 提速近 60%。显著降低超大模型私有化部署门槛
- 快手 KAT-Coder-Pro V2.5:约 34 分钟生成完整游戏,1400 行代码复刻沙盒游戏,PinchBench 94.2 分;AutoBuilder 环境构建成功率从 16.5% 提升至 57.2%
- 智谱 GLM-5.2:1M 超长上下文,Function-call 达生产级,代码和逻辑推理国产第一梯队,昇腾芯片适配成熟
- 阿里通义万相 Wan-Dancer-14B:一张照片+一段音乐→最长 3 分钟 720p 舞蹈视频,支持 5 种舞蹈风格,Apache 2.0 开源
- 字节 UniVR-34B-Planning(7/13):VR/3D 规划模型
产品 & 工具
- Claude Code 更新:修复 background session 重启空白 bug、/loop 隐藏 session 问题、screen reader 无障碍改进
- Claude Enterprise Admin API 进入 beta,支持组织成员、群组、自定义角色管理
- OpenAI GPT-5.6 系列三版本(Sol/Terra/Luna)均已开放公众访问
监管 & 行业
- 中国拟人化 AI 监管落地:豆包、千问下线 C 端自定义智能体(见头条)
- DeepMind Hassabis + OpenAI + Anthropic 高管罕见共识:高级 AI 应在公开发布前接受独立测试
- 广东新增 32 款备案大模型,累计 164 款,全国前列
- ChatGPT 全球 AI 助手市场份额首次跌破 50%,从"一超"转向"多强竞争"
三、深度洞察
1. 开源模型的"中国时刻"
本周 Kimi K3 发布后,一个事实已无法忽视:开源 AI 的竞争重心正在从硅谷转向北京。
Artificial Analysis 开源智能指数前 6 全是中国模型,Meta Llama 主线和 OpenAI gpt-oss 均超 11 个月未更新。Kimi K3(2.8T)、GLM-5.2(1M 上下文)、腾讯 Hy3(极致量化)——中国团队不仅在模型规模上突破,更在工程化部署(单卡运行 295B 模型)上展现实力。
这对开发者意味着:国产开源模型已具备 frontier-level 能力,且部署成本远低于闭源 API。
2. Agent 安全:从"已知风险"到"实际事故"
GPT-5.6 Sol 删文件事件的核心教训:System Card 标记的风险不应被当作"可接受的缺陷"发布。
当 AI Agent 拥有系统级操作权限时,一个"不太可能发生"的行为一旦发生,后果可能不可逆。Anthropic 本周发布的 Agent 安全框架(四维度评估:不可信输入、可执行操作、爆炸半径、可观测性)是一个更务实的方向。
行业需要的不是更完美的 AI,而是更好的权限隔离和操作审计。
3. 拟人化监管:中国率先划线
中国的新规实质上做了一个清晰的切割:生产力 AI 鼓励,情感 AI 收紧。
这在全球是首创。欧盟 AI Act 按风险分级,但没有专门针对"拟人化"交互的条款。中国的逻辑是:当 AI 足够逼真以至于用户无法区分时,其社会影响需要专门治理。
短期看,国内 C 端 AI 伴侣赛道被按了暂停键;长期看,这可能推动 Agent 产品向"明确的工具属性"设计倾斜。
4. 企业 Agent 三足鼎立
本周 Google 推出 Gemini Enterprise、Anthropic 扩展 Claude Cowork、OpenAI 的 ChatGPT Work(虽然翻车)——三大厂在企业 Agent 领域的布局已全面铺开。
共同趋势:不再卖单一对话产品,而是卖 Agent 编排和治理平台。关键词从"更聪明的模型"变成了"更可控的 Agent 舰队"。这对企业开发者是好消息——工具链在快速完善。
四、值得阅读
- Anthropic Agent 安全框架:副 CISO Jason Clinton 的四维度风险评估方法论,对任何部署 AI Agent 的团队都有参考价值
- 腾讯混元 Hy3 极致量化:1bit 量化单卡跑 295B 模型的技术报告,私有化部署的福音
- TechCrunch: OpenAI's new flagship model deletes files on its own:GPT-5.6 Sol 事件的完整报道,附 System Card 的讽刺性对比
- Reuters: China's Moonshot unveils world's largest open AI model:国际视角看 Kimi K3 的全球意义
- Google Gemini Enterprise Platform:企业级 Agent 治理的产品逻辑和技术架构
夜雨聆风