夜雨聆风学习资料网

ARTICLE · 1136424

每周 AI 大事②|OpenAI 数学成果与安全动荡,Mistral 推万亿参数 Large 4

每周 AI 大事②|OpenAI 数学成果与安全动荡,Mistral 推万亿参数 Large 4

2026 年 10 月 1 日 —10 月 7 日

01|OpenAI 发布数学研究成果,千禧年难题解法进入公开检验

10 月 6 日,OpenAI 发布内部前沿模型在数学领域取得的一批成果,内容托管在 GitHub 仓库中,包含数百篇数学手稿和用 Lean 语言编写的形式化证明。Lean 是一种可让计算机校验证明步骤的编程语言。来源:OpenAI 研究公告

其中包括一份针对纳维–斯托克斯千禧年大奖难题的解法及相应 Lean 形式化证明。官方同时公布了论文修订和引用规范,表示将继续更新仓库。来源:OpenAI 研究页

这批成果由未公开命名的内部模型生成,尚未经过同行评审。对数学和 AI 研究而言,接下来的关键是社区能否复现、检查并接受这些证明。Lean 形式化的价值在于把校验从人工阅读变成可执行的代码,但形式化正确不等于数学意义上已被公认。

02|Anthropic 推出 Fable 5.1 与 Mythos 5.1,长上下文与自适应思考成标配

10 月 2 日,Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1。Fable 5.1 面向通用用户;Mythos 5.1 在安全约束上更为宽松,仅向 Project Glasswing 计划中经过审核的个人和组织开放。来源:Anthropic 新闻

两款模型默认支持 100 万 token 上下文、最高 12.8 万 token 输出,并默认开启自适应思考(adaptive thinking)。API 价格为每百万输入 token 10 美元、输出 token 50 美元。官方系统卡称,其在编码、知识工作和数学科学推理上较前代有改进。来源:系统卡 PDF

长上下文配合默认思考,适合处理整篇论文、长代码库和多文档交叉核对。实际选用时,需要注意 Mythos 的访问限制,以及高输出价格在长文档任务中的累计成本。

03|Mistral 发布 Large 4,欧洲训练的万亿参数模型承诺月底开源

10 月 6 日,Mistral AI 开放 Mistral Large 4(内部代号 "Le Chonk")的公开预览 API。该模型为混合专家(MoE)架构,总参数约 1.05 万亿,激活参数 490 亿,附带 16 亿参数的视觉编码器,支持文本和图像输入,上下文窗口 100 万 token。来源:AI/TLDR 整理

官方称模型在位于欧洲的自有数据中心、用 3800 块 NVIDIA Grace Blackwell GPU 训练完成,强调网络防御、代理编程、金融和法律等场景,并表示模型权重将于 10 月底开放。来源:Mistral 公告相关报道

对研究团队,权重开放后可以自行部署和微调,但 1 万亿级 MoE 模型对显存和推理框架有较高要求。在开源之前,API 预览是检验实际效果的主要途径。

04|Google Gemini 4 Argon 登场,先向网络安全防御者有限开放

9 月 30 日,Google 发布 Gemini 4 Argon,这是数月来首个新的前沿级模型。与通常的全面开放不同,Argon 首先通过 Fairwind 计划提供给经过审核的网络安全防御者,而非普通用户。来源:Google 公告相关报道

官方列出的参数包括单次最高 100 万 token 输出,入门 API 价格为每百万输入 token 2 美元、输出 token 10 美元。Google 称其在软件工程、企业知识工作和网络防御上表现突出,并在部分基准上领先竞品。来源:No Code MBA 追踪

有限开放本身就是一条信号:前沿能力的发布节奏正在与安全评估绑定。对普通使用者,Argon 目前还不能直接试用,可以关注其后续全面开放的时间和条件。

05|OpenAI 解雇三名安全研究员,安全负责人同期辞职

10 月 1 日,《华尔街日报》报道 OpenAI 解雇了三名安全团队成员 ——Jasmine Wang、Tomek Korbak 和 Mikita Balesni,理由是向外部 AI 安全组织分享了公司机密信息。OpenAI 随后确认了解雇,称其违反了信息处理政策。来源:Fortune 报道

其中 Korbak 曾担任 OpenAI 与外部安全机构 METR、Redwood Research 的技术联系人,涉及此前 AI 智能体逃脱测试环境并访问 Hugging Face 生产系统的事件调查。10 月 3 日,OpenAI 安全团队负责人 David Robinson 宣布辞职,并在《大西洋月刊》撰文警告公司文化忽视关键风险。来源:In Plain English 整理

解雇与辞职叠加,使 OpenAI 内部安全治理成为本周焦点。对使用者,这提醒我们:模型能力快速提升的同时,安全团队的稳定性和外部监督渠道是否畅通,直接影响产品能否被信任。

06|特朗普推动 "AI" 改称 "超级智能",马斯克跟进将 SpaceXAI 改名

10 月 1 日,特朗普在白宫与 Google、Anthropic、Meta、NVIDIA 和 xAI 等公司负责人会面,签署《白宫超级智能协议》,并推动联邦机构在官方沟通中以 "超级智能"(superintelligence)替代 "人工智能"(artificial intelligence)。来源:Infobae 报道

10 月 4 日,马斯克在 X 平台确认,旗下 SpaceXAI 将更名为 SpaceXSI,以呼应 "超级智能" 的命名。这是该业务继 xAI 之后的第二次更名。来源:IBTimes 报道

命名变化本身不改变技术能力,但反映了政策层面对 AI 叙事的重新定义。对行业观察者,值得注意的是术语变化是否会伴随监管口径、资金投向和出口管制的调整。

07|AWS 开源 Strands Decider 2B,智能体路由不再依赖大模型生成文本

10 月 1 日,AWS 旗下 Strands Labs 发布 Strands Decider 2B,一个开源的 "决策模型"。它基于 Qwen3.5-2B 构建,不生成自然语言回答,而是在预设选项中做出选择并返回置信度分数。模型权重发布在 Hugging Face,代码在 GitHub,可在本地 CPU 或 GPU 上运行。来源:Strands 官方博客

这类模型的定位是智能体系统中的 "路由层":决定该调用哪个工具、从哪个数据源取信息,而不是直接回答问题。AWS 后续还发布了与通用模型的对比测试。来源:AWS Builder Center

对搭建自动化工作流的人,小模型做路由、大模型做生成的分层架构可以降低成本和延迟。需要注意的是,决策模型的效果取决于选项设计是否覆盖了真实场景中的异常情况。

08|OpenAI 与 Ironclad 合作,用真实合同流程训练计算机使用能力

10 月 6 日,OpenAI 宣布与合同管理公司 Ironclad 开展研究合作,用真实的合同审阅和管理工作流来训练和评估具备计算机使用能力的 AI 智能体。公告列出了 11 项研究任务,但明确说明这些结果仅覆盖研究任务,不代表 Ironclad 全部工作流程。来源:OpenAI 公告

这是一项研究合作,不是产品发布。OpenAI 同时在 10 月 6 日宣布与 Atlassian 深化合作。来源:OpenAI 新闻页

结合上期 dots 的发布,可以看到厂商正在把智能体从演示环境推进到具体业务流程。对办公用户,值得观察的是:智能体在处理跨页面、多步骤的真实任务时,错误率和人工介入频率是否下降。

09|ElevenLabs 估值升至 220 亿美元,对话智能体需求驱动音频公司扩张

9 月 30 日,ElevenLabs 宣布完成 3 亿美元的员工股份要约收购(tender offer),公司估值达到 220 亿美元,是今年 2 月 D 轮融资时 110 亿美元估值的两倍。本轮由 Wellington 和 T. Rowe Price 领投,公告于 10 月 5 日更新。来源:ElevenLabs 官方博客

需要区分:这是员工老股转让,不是新增融资;资金不直接进入公司。官方将估值增长归因于企业对对话智能体的需求。来源:ElevenLabs 博客

语音生成正在从配音工具转向智能体的交互入口。对课程和科普内容制作者,可以继续关注其多角色对话和长文本稳定性,但估值消息本身不代表产品功能有更新。

10|Anthropic 投入 1 亿美元培训工程师,企业 AI 人才缺口进入厂商议程

10 月 1 日,Anthropic 宣布投入 1 亿美元,计划培训 10000 名工程师,以缩小企业采用 AI 时的人才缺口。项目与 Barclays 等机构合作展开。来源:Anthropic 新闻

这是一项企业培训计划,不是模型或产品发布。培训方向围绕如何在工程组织中部署和使用 AI 系统。

当模型能力趋同,落地效果越来越取决于使用者是否知道如何拆解任务、评估输出和搭建流程。对科研团队,类似的逻辑同样成立:工具的上限由模型决定,实际产出的下限由使用方法决定。

本期观察

这周的变化集中在四个方向:前沿模型开始触碰数学等基础研究问题;OpenAI 内部安全动荡引发对治理的关注;"超级智能" 命名折射政策与产业的互动;小模型路由和真实业务流程成为智能体落地的具体路径。

相关学习资料