夜雨聆风学习资料网

ARTICLE · 1102648

AI 资讯 TOP10|9/30:OpenAI 发布 GPT-6.1 Sol,主打智能体编码与跨应用工作流

AI 资讯 TOP10|9/30:OpenAI 发布 GPT-6.1 Sol,主打智能体编码与跨应用工作流

【摘要】今日 10 条 AI 热点完整收录:OpenAI 发布 GPT-6.1 Sol 与 Dots 智能体、Anthropic 签 845 亿美元算力协议、机器人长时程自主作业落地、Codex 接入开源模型。

01 OpenAI 发布 GPT-6.1 Sol,主打智能体编码与跨应用工作流

分类:模型发布/更新 | 时间:09-30 07:13

OpenAI 正式发布新模型 GPT-6.1 Sol,官方称其在编码、computer use(电脑操作)与跨应用工作流三类任务中表现突出,并针对复杂重构、深度代码库调查和长时间运行的智能体场景做了专门优化。定价方面,Sol 低于此前的 GPT-6 Astra,缓存输入还可享受较标准输入约 95% 的价格折扣。

更值得注意的是时间线:GPT-6 Sol 上线仅 7 天便被 Sol 接替,在 Artificial Analysis 智能指数上比 GPT-6 Sol 高 4 分、距离旗舰 GPT-6 Astra 仅差 1 分。模型迭代周期被压缩到以周计,同时价格继续下探,「更强且更便宜」正成为常态;对企业与开发者而言,选型窗口变短、评测与迁移成本反而上升,把回归测试和评测集做成常态化工程能力的团队会更从容。

02 Dyna Robotics 发布 Dyna-2.1 与半人形机器人 Taku,独立完成一小时洗衣房任务

分类:模型发布/更新 | 时间:09-30 05:36

Dyna Robotics 发布 Dyna-2.1,称其为首个实现可靠超长时程全身自主的 Physical Agent(具身智能体),并搭配全新半人形硬件 Taku。团队公开了一段一小时无剪辑视频:机器人独自在酒店式洗衣房作业,装载并启动洗衣机、叠好毛巾上架,当别处需要处理时能中断当前动作转去处理,而不是原地冻结。

关键在架构:Dyna-2.1 依靠一个并行运行的视觉语言模型持续监视房间状态,让负责操作的模型保持手部连续作业,从而把「长时间不掉线」和「随时可打断」两件事同时做到。这比单次演示动作更能说明具身智能的工程成熟度——机器人开始进入真实商业场景的长时段值班,而非只在实验室里完成一次性任务。

03 OpenAI DevDay 2026 一揽子更新:Dots 智能体、500 美元订阅与 Codex 云环境

分类:产品发布/更新 | 时间:09-30 05:47

OpenAI 在 DevDay 2026 集中发布多项更新:个人 Agent 产品 Dots 面向 ChatGPT Pro、Business Premium 与 Enterprise 用户开放,支持与 4000 多个应用协作;订阅体系新增 500 美元档,同时把 200 美元 Pro 的额度倍数从 20x 下调到 10x,500 美元档为 25x。开发者侧同步推出 Codex 云环境,仓库、依赖、脚本与设置预先就位,合上电脑后智能体继续运行,可通过手机或另一台设备跟进任务;Codex 还上线 Ultrafast 模式,代码生成最高提速 8x。

这一轮发布的重点不是单个功能,而是把「智能体」从对话框推进到应用分发层:Dots 试图成为连接数千应用的入口,Codex 云环境则把开发工作流从本地机器搬到云端。配套的订阅层级调整说明推理成本已经高到需要重新定价,而 Ultrafast 与云环境共同指向同一个方向——让智能体长时间、跨设备地替你干活。

04 Codex 支持企业团队原生使用 GLM-5.3 Flash、Kimi K3 等开放模型

分类:产品发布/更新 | 时间:09-30 04:59

企业团队现在可以在 Codex 中原生调用 GLM-5.3 Flash、Kimi K3 等开放权重模型,相关消费可直接计入其 OpenAI commit 额度。这意味着 Codex 不再只绑定自家模型,而是把第三方开放模型纳入了同一套开发工作流与结算体系。

对企业的实际意义在于成本与合规弹性:轻量任务可路由到更便宜的开放模型,敏感或需私有化部署的场景也有更多选择,同时不必脱离既有工作流另建一套工具链。头部厂商把竞争对手的模型纳入自家平台,也侧面说明开放权重模型在编码等高频任务上,已具备被主流工具链接纳的工程成熟度。

05 Anthropic 与 SpaceX 签署最高 845 亿美元算力协议,可提前 90 天通知解除

分类:行业动态 | 时间:09-30 09:41

Anthropic 与 SpaceX 签署了一份算力协议,合同金额上限最高达 845 亿美元,用于租用 SpaceX 数据中心内的英伟达 GPU。条款中包含一项灵活安排:Anthropic 可提前 90 天通知后解除合同。

这单交易的规模已接近甚至超过部分超大规模云厂商的年度资本开支量级,说明头部模型公司的算力锁定正从「按需租用」转向「长期包场」。而 90 天可解约条款是少见的设计——在算力供给仍然紧张、但需求侧不确定性同样很高的当下,买方开始为「万一模型路线或需求变化」预留退路,这一点比签约金额本身更值得关注。

06 OpenAI 洽谈以约 1.4 万亿美元估值融资至少 300 亿美元

分类:行业动态 | 时间:09-30 03:52

OpenAI 正与投资者洽谈在 IPO 前融资至少 300 亿美元,估值约 1.4 万亿美元。其 run-rate 收入自 7 月以来增长 70%,8 月达到 400 亿美元;公司今年 3 月曾以 8520 亿美元估值融资 1220 亿美元。本轮被定位为 IPO 前的过桥轮,CEO Sam Altman 已排除 2026 年上市。

估值在半年内从 8520 亿美元抬到 1.4 万亿美元,支撑点是收入增速而非利润,这也解释了为何融资节奏如此密集:训练与推理的资本开支必须靠持续输血。Altman 明确排除 2026 年上市,意味着这轮私募融资要在上市前继续承担算力投入,同时也把「何时具备上市条件」的悬念留给了市场。

07 Bain 报告:AI 行业需在 2031 年前实现 6 万亿美元年收入才能支撑数据中心投入

分类:行业动态 | 时间:09-30 03:21

Bain & Company 最新报告测算,AI 行业需要在 2031 年前实现约 6 万亿美元的年收入,才能支撑届时预计达 1.5 万亿美元的年度基础设施支出。

这份测算把当前最热的两件事放在了同一张资产负债表上:一边是数据中心与算力的巨额投入,另一边是尚未被验证的收入规模。6 万亿美元年收入是什么概念,可对照全球主要科技公司的现有收入体量——缺口不小。它并不必然意味着泡沫,但提示了行业面临的真实约束:算力投资能否持续,最终取决于应用侧能否把能力转化为可计费的规模收入。

08 DCSD:解耦信用方向与幅度的自蒸馏方法,11 项基准超越 GRPO 与 OPSD

分类:论文研究 | 时间:09-28 08:00

针对教师监督下「步级信用方向」与「信用幅度」相互耦合的问题,研究者提出解耦信用自蒸馏(DCSD):用 belief-margin probing 确定信用方向,用边际信息增益量化信用幅度,从而实现从步到 token 的细粒度信用分配。该方法在 11 项基准上超过了 GRPO 与 OPSD。

大模型强化学习里的老问题是「信用分配」——最终答案对了,究竟该奖励哪一步、奖励多少。把方向与幅度分开估计,等于把「做对了没有」和「做对了多少」两个问题解耦,训练信号因此更干净。它能在多项基准上超过 GRPO 这类主流方法,说明推理链上的细粒度监督仍有可观优化空间,对做后训练与对齐的团队有直接参考价值。

09 OpenRouter 系列教程:Agent 工具调用测试、回归测试与 golden 评测集

分类:技巧与观点 | 时间:09-30 08:00

OpenRouter 连续发布三篇面向 AI Agent 的工程教程。第一篇讲如何测试工具调用准确性,把失败拆成「工具选择错误」与「参数错误」两类分别定位;第二篇讲提示词、模型、工具定义或检索设置变更后如何做回归测试,方法是重跑锁定用例集并对照书面行为契约检查;第三篇讲如何从生产流量构建 golden 评测集,给出五步流程(抽样生产流量、去重聚类、添加预期输出、首轮评估修正 rubric、提交 Git 并接入 CI),建议从 20 至 50 条复审样本起步,再扩展到 100 至 1,000 条的完整回归集。

三篇教程指向同一个判断:Agent 的可靠性不能靠感觉,而要像传统软件一样建测试。最值得借鉴的是「用真实生产流量而非合成数据」这一条——合成数据会掩盖真实分布和失败模式;而 golden 集一旦进了 Git 并接入 CI,模型和提示词的每次改动就都有了可回滚的验收标准。

10 livenerf 开源:用预注册基准长期检测 Claude Opus 5.5 发布后是否被削弱

分类:技巧与观点 | 时间:09-30 08:22

开发者开源了 livenerf 项目——一个 append-only(只增不改)的基准测试集,目标是对 Claude Opus 5.5 在 2026-09-22 发布之后的性能做长期追踪,检验其是否随时间出现漂移或削弱。

这类工具回应的是用户长期以来的疑虑:同一个模型,为什么感觉过一阵子就「变笨」了。过去这只能靠主观体感争论,而预注册基准加上只增不改的记录方式,把问题变成了可复现、可追溯的测量——一旦基准结果出现下滑,社区能立刻拿到证据。对模型提供方而言,这也构成一种温和的外部监督。

相关学习资料