夜雨聆风学习资料网

ARTICLE · 1089707

上周AI大事:瘫坐在椅子上仿佛看到核爆

上周AI大事:瘫坐在椅子上仿佛看到核爆

9 月 21 日到 27 日这一周,AI 行业的消息密度明显高于往常。

最密集的一天是 9 月 22 日:Anthropic 与 OpenAI 前后脚发布新模型,间隔不到一小时;同一天,小米把新一代开源大模型放上 GitHub;蚂蚁集团的设计图像模型也在这几天开放权重。

此后几天,数学、理论物理、图像生成、语音合成、世界模型、人形机器人,每个方向都有进展落地。以下按时间与领域梳理这一周的 10 件大事。

一、Anthropic 发布 Claude Opus 5.5,成本降 40%

当地时间 9 月 22 日,Anthropic 发布新一代模型 Claude Opus 5.5。官方称,该模型在大多数任务上的表现与其最强模型 Fable 5.1 相当,而典型工作负载的成本比上一代 Opus 5 降低 40%,输出速度提升超过 30%。

定价上,Opus 5.5 为每百万输入 Token 4 美元、输出 20 美元,较 Opus 5 下调 20%。官方测试中,Opus 5.5 在 9 项里有 7 项领先,编程测试得分最高,但在业务流程与科研 Agent 测试上仍落后于 OpenAI 的 GPT-6 Astra。

安全方面,Anthropic 表示 Opus 5.5 配备了此前仅用于最强系统的防护措施,发布前接受了 Frontier Design、METR 等外部机构的安全测试,测试环境中突破边界的尝试次数比 Opus 5 和 Claude Mythos 5.1 减少 85%。模型同时加入了满足欧盟《人工智能法案》要求的水印措施。

在长程任务上,官方给出的案例是 9.5 小时完成一次复杂代码改写,成本比前代低 51%。Anthropic 同时表示,未来几周还将推出 Claude Sonnet 5.5 与 Haiku 5.5。

📌 这是 Anthropic CEO 呼吁"放慢前沿 AI 开发节奏"之后,公司发布的首款新模型。

二、OpenAI 上线 GPT-6 Sol 与 GPT-6 Luna,价格腰斩

同一天,OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna 两款模型。两者均继承了旗舰模型 GPT-6 Astra 的技术进展,并针对缓存和推理效率做了优化,API 价格较 GPT-5.6 的促销价下调 50%,且为长期定价,并非限时折扣。

两款模型定位不同:Sol 面向复杂专业工作、编码与智能体任务;Luna 主打速度与高频低成本使用。Luna 定价为每百万输入 Token 0.10 美元、输出 0.50 美元,官方称在较高推理强度下可达到 GPT-5.6 Sol 的水平,而成本约为其百分之一。

两款模型已上线 ChatGPT Work、Codex 与 API,免费版和 Go 用户可在桌面端体验 Luna。OpenAI 表示,改进后的提示词缓存功能使调用已缓存提示词的成本最多可比未缓存时低 90%。

可靠性方面,官方数据显示 GPT-6 Sol 的事实错误比上一代减少约一半,在"欺骗性代码测试"中的欺骗率由 10.4% 降至 1.3%。

此次发布距离 GPT-6 Astra 上线不到三周,意味着旗舰模型的能力正在向更低成本的层级下沉。

三、小米开源 MiMo-V2.6 系列,登顶开源模型榜首

9 月 22 日,小米发布并开源新一代 MiMo-V2.6 系列大模型,包括旗舰模型 MiMo-V2.6-Pro 与高效推理模型 MiMo-V2.6-Flash,两款均原生支持文本、图片、视频、音频全模态输入。

在全球测评平台 Artificial Analysis 的综合智能指数中,MiMo-V2.6-Pro 取得 46 分,超过 Kimi K3、Qwen3.8 Max,位列开源模型第一、国产模型第一。官方称,它是目前全球开源模型阵容中唯一的全模态 Pro 级模型。

价格维持上一代水平:Flash 为每百万 Token 输入 1 元、输出 2 元,Pro 为输入 3 元、输出 6 元,并提供 99% 的缓存折扣。官方称,在同等智能水平下,其价格仅为海外模型的 1/20 至 1/60,单位任务成本约 0.13 美元。

技术路线上,小米强调这是一次"规模化扩展强化学习"的实验:MiMo-V2.6 的 RL 后训练耗时约 6 天,Flash 训练成本约 85 万美元、Pro 约 262 万美元,两个版本合计超过 347 万美元,累计约 75 万条轨迹。公司同时开源了模型权重、技术报告,以及 MiMo-V2.6-Distill-Qwen-9B 与配套 RL 训练资源。

在长程软件工程能力评测中,Flash 版本得分从 48.8 提升至 65.68,Pro 版本从 58.4 提升至 72.57。

四、GPT-6 Astra 完成哥德巴赫猜想弱形式证明

9 月中旬,匿名账号 Captain Sude 在社交平台与 GitHub 公开一项成果:借助 OpenAI 的 GPT-6 Astra,完成"刘维尔版哥德巴赫猜想"的证明,并附上完整的 Lean 4 形式化验证代码。

需要明确的是,这并非经典哥德巴赫猜想。原版猜想要求任一大于 2 的偶数都可写成两个素数之和(即"1+1"),至今未被证明。此次证明的命题是:任意大于 2 的偶数,都可以表示为两个刘维尔函数值均为 -1 的正整数之和。由于素数在刘维尔函数下取值必为 -1,该命题是原猜想的必要条件,但允许加数为合数。

与既有结果相比,这一证明去掉了两个限制。2024 年,杜伦大学数学家 Alexander Mangerel 曾证明该命题对"足够大的偶数"成立,但依赖广义黎曼猜想。Astra 的证明不再依赖该猜想,且覆盖所有大于 2 的偶数。

验证方面,项目方同步提交了 Lean 4 完整形式化代码,无"sorry"缺口、无自定义公理,第三方可独立复核;有研究者重新编译验证,并对 249 个偶数做了数值测试。

证明思路也引起讨论:Astra 并未采用暴力穷举,而是通过"结构转化",把加法组合问题中的阻碍转化为乘法体系下的矛盾关系,以反证法完成推导。

⚠️ 该结果仍需数学界独立评审。从"允许合数"到"必须是素数",中间仍隔着经典哥德巴赫猜想这道天堑。

五、Claude 把理论物理的八圈纪录推到九圈

当地时间 9 月 25 日,Anthropic 宣布,Claude 在几乎无人工干预的情况下连续运行数天,算出了平面 N=4 超杨-米尔斯理论中六粒子散射振幅的九圈结果,把该难题的世界纪录从八圈推进到九圈。

此前的八圈纪录由 SLAC 国家加速器实验室物理学家 Lance Dixon 及合作者在 2023 年创下,此后两年无人推进。这一次,Dixon 本人用两周时间逐项验证,确认结果正确。

过程方面,Anthropic 两名物理学家在 Claude Science 系统中使用 Fable 5.1,只留下一句任务描述后让模型无人值守推演,每 4 至 6 小时汇报一次进度。Claude 用两种独立方法算出同一结果:一路用 Python 和 SymPy 直接自举,另一路把物理问题转化为超大整数方程组求解,先通过对跖对偶把 185 万个未知数压缩到 7.6 万个,再逐轮排除至唯一解。

成本上,直接自举一路纯 Python 运行约 100 美元,相当于 96 个 CPU 跑一周;按普通用户价格计算,两条路径合计约几千美元。最终单个切面的结果超过 300 亿项,而八圈时这一数字为 16.7 亿。

值得一提的背景是,中国科学院理论物理研究所何颂团队同样推进到九圈,他们借助模型辅助校验部分约束条件,并于 9 月 17 日将二圈到九圈的核心骨架数据公开在学术平台 Zenodo 上,比 Anthropic 官宣早了 8 天,整体框架由人类搭建。

 配图:AI 技术生态 —— 语言、图像、语音、机器人、科学计算、视频

六、阿里开源 Qwen-Image-2.1:7B,可跑在消费级显卡上

阿里 Qwen 团队开源了图像模型 Qwen-Image-2.1,将文生图与图像编辑统一在同一个模型中,视觉生成部分约 70 亿参数,由 32 层单流 DiT 构成。

这一版本有四项主要更新:轻量架构在图像质量与算力成本之间取得平衡,官方称消费级显卡(如 RTX 3090 级别)即可运行;原生支持透明通道,可直接生成或编辑 RGBA 图像,也能从照片中提取主体;编辑时最多可接入 10 张参考图,用于人像合成、虚拟试穿、室内设计等场景;同时改进了文字排版、人像光影与细节质感。

在推理效率上,团队采用了混合粒度注意力架构,并复用 KV Cache,把输入图像和编辑指令作为静态上下文缓存,以降低多图编辑时的延迟和显存占用。

模型权重已在 Hugging Face、GitHub 与 ModelScope 上线,并提供了在线 Demo。需要留意的是授权协议:Qwen-Image-2.1 目前遵循研究类许可证,学术研究与非商业用途免费开放,若要嵌入商业产品或用于企业生产环境,需单独向 Qwen 团队申请商业许可。

七、蚂蚁集团开源 Ming-Image-0.1-Design,专攻"文字密集"设计

同样是图像方向,蚂蚁集团 inclusionAI 实验室开源了 Ming-Image-0.1-Design 与 Ming-Image-0.1-Design-Layer 两个 6B 参数模型,采用 MIT 许可,允许商业使用。

这对模型的目标不是摄影级图像,而是 UI 界面、信息图、海报这类"文字必须清晰可读"的设计工作。Ming-Image-0.1-Design 直接生成含文字的完整版式,并支持输出透明背景的 RGBA 图像;Layer 版本则反过来,能把一张扁平化的设计图拆解成指定数量的可编辑透明图层——即从"一张 PNG"变成"一份可继续修改的设计文件"。

在 Artificial Analysis 的 UI/UX Design 文生图榜单开源权重视图中,Ming-Image-0.1-Design 以 Elo 1082 位列第一。官方还随发布提供了两个 Agent Skill:一个用于引导界面生成,另一个可以把扁平的幻灯片图片转成文字、形状、颜色均可编辑的原生 PowerPoint 文件。

部署门槛需要提前评估:官方验证的最小配置为单张 80GB 显存 GPU,推荐输出分辨率 2048×2048,采样步数 12 步。社区量化版本在发布后数小时内即已出现。

八、PixVerse 发布实时世界模型 R2

9 月 23 日,爱诗科技发布实时世界模型 PixVerse R2,为其今年 1 月推出的 R1 的升级版本。

与"输入提示词、生成一段固定视频"的传统方式不同,实时世界模型输出的是一个持续运行、可实时探索的世界:模型仍在生成时就能接收新输入,并改变后续走向;世界不会在操作之间重置,而是保留并延续状态。

R2 的核心变化在于输入的持续性。提示词、动作或音频提示不只是改变当前画面,而是更新世界的运行状态——较早的一次操作,在同一次会话的后续阶段依然成立。

技术上,R2 基于自研的 Omni Causal AR(全模态因果自回归)与 Real-Time Acceleration(实时加速)两层架构,Scaling 发生在模型、数据、任务、控制信号和时间尺度五个维度。工程侧的 Error Bank 机制针对模型运行中的错误状态反复训练,官方称长期画面漂移由此下降约 35.8%。

应用层面,爱诗科技与创作者合作推出了《零印法师》《畸变回声》等 AI 互动影游样板间,采用"预置视频分支 + 实时 AI 生成"的混合交互模式,支持选项、文字、语音与 QTE 输入。其数字人分支模型还可用于电商直播、智能陪伴等场景。

九、Google 发布 Gemini 3.8 Flash TTS,语音也能"设计"

9 月 23 日,Google DeepMind 推出两款文本转语音模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,官方称这是其目前表现力最强的音频生成模型。

与从固定预设音色中挑选不同,新模型支持用自然语言"设计"声音:描述角色的身份、口音与性格,模型生成对应音色,覆盖超过 100 种语言和方言;同时提供 2000 多种可直接使用的声音库。Flash TTS 面向角色设计与深度创作,Flash-Lite TTS 面向高并发、低成本的批量配音。

两款模型还支持逐行导演式控制——用文字写舞台提示、调整节奏与情绪、指定方言切换,甚至加入笑声等非语言反应,并原生支持双人对话场景的自然轮替。语音复刻只需约 30 秒的音频样本,但需提供声音所有者的口头授权录音。

评测方面,Gemini 3.8 Flash TTS 在 Hume AI 的语音设计基准中获得 71.4 分,位列第一,口音建模同样领先;两款模型在 Hume AI 整体质量指数中分列第一、第二。

安全层面,所有生成音频均嵌入 SynthID 不可感知水印,并附带 C2PA 凭证。

十、人形机器人"自己学会"踢足球:140 年模拟,几周跑完

9 月 22 日,Skild AI 公布一项物理自对弈(self-play)后训练成果:其机器人基础模型 S1 在 NVIDIA Isaac Sim 中通过与自己对抗,学会了踢足球,策略随后直接迁移到真机上场比赛。

训练只设定了一个目标:进球。没有为盘带、护球、抢断、射门或摔倒后爬起单独设计奖励,这些动作因为有助于取胜而自行涌现。在模拟的前几个月,它几乎不会走路;到"大学年龄"时,已经能摔倒后自己站起来。累计超过 140 个模拟年后,策略被装进真机,与人类和其他机器人对抗。

借助现代 GPU 集群并行运行数千个模拟环境,相当于 140 年的实时经验被压缩到几周内完成。

值得注意的是,S1 的通用性并不限于足球。它可以在无需微调、不更新参数的情况下,依据一段视频示范完成最长约 10 分钟的操作任务。Skild AI 成立于 2023 年,2026 年 1 月完成 14 亿美元 C 轮融资,估值超过 140 亿美元,软银与英伟达参与投资;其机器人已在 60 多家客户企业中运行。

一周观察

把这一周的十条消息放在一起,能看到三条比较清晰的线索:

一、竞争重心从"谁更强"转向"谁更便宜"。 Anthropic 把成本压低 40%,OpenAI 把价格砍半,小米用"价格不变、智能提升"刷新性价比。头部厂商正把接近前沿的能力,向下沉到更多真实任务里。

二、开源阵营的位置在往上走。 MiMo-V2.6-Pro 登顶开源榜首,Qwen-Image-2.1 与 Ming-Image-0.1-Design 都选择了开放权重。值得注意的是,图像方向上"原生透明通道"正在成为新的默认能力。

三、AI for Science 从演示走向可验证成果。一边是 Lean 4 形式化验证的数学证明,一边是经过纪录创造者本人复核的物理计算。共同点是:结果可以被逐行检查——这也是它们能被学界认真对待的原因。

至于成本,这一周反复出现的一个数字值得记住:一次过去需要顶尖团队数年积累的计算,现在的算力账单可能只有几百到几千美元。

本周总结:瘫坐在椅子上仿佛看到原子弹爆炸。

#AI周报 #人工智能 #大模型 #ClaudeOpus5.5 #GPT6 #开源大模型 #具身智能 #世界模型 #AIforScience #GeminiTTS #人形机器人

相关学习资料