ARTICLE · 1013210
AI 大模型前沿早报 · 2026年9月15日(周二)
AI 大模型前沿早报 · 2026年9月15日(周二)1. GPT-6 Astra 发布后首轮深度评测出炉,"AGI 时代"之争发酵
OpenAI 总裁 Brockman 公开称"现在认为已进入 AGI 时代并不不合理",并将判断权留给用户;Astra 是 OpenAI 迄今最大规模训练,首次在得州 Stargate 用超 10 万块 GPU 预训练。 官方数据:FrontierMath Tier 4 97.6%、ARC-AGI-3 98.6%~99.9%(高度依赖 OpenAI 自带 Responses API harness,独立机构无状态测试仅 17%~63%)、OSWorld 2.0 72.6%(Sol 65.7%,单任务耗时从 ~75 分钟降至 40 分钟)。 定价 10/50 美元 每百万输入/输出 token,为 Sol 促销价 2.5 倍;API 与 AWS 即将上线,Plus/Pro/企业版"未来几天"开放。 隐忧:网络安全能力跨越 Preparedness 框架"Critical"门槛(自主发现 2 个未知零日),标准版将拒绝部分安全任务;同时官方承认 Astra 思维链比 Sol 更难被监控。 来源:雪球、搜狐·深度评测
2. "AI 降速"共识与资本市场、白宫的正面碰撞
Amodei《We Must Pace the Frontier》后,Altman、Musk、Hassabis 相继表态支持,方案含第三方嵌入式评估、共享安全标准、全球协调;批评者(The Verge 等)称其更像"卡特尔"。分析指出五派立场中无一方给出可量化的"速度"指标。 特朗普周一公开驳斥,称存在针对 AI 与数据中心的"阴谋","谁赢得 AI 谁就赢";美参议员另提法案,禁止超级智能开发、违者最高监禁 20 年。 市场迅速定价:全球半导体指数跌 5%,英伟达/博通等重挫,10 年期美债收益率一度破 5%。 来源:腾讯·每日科技早参、新浪·9月15日外盘头条
3. Anthropic 灰度上线 Claude Opus 5.2,跳过 5.1
9月14日凌晨起,Claude Code 中"Opus 5"请求的底层 slug 被指向 Opus 5.2,开发者用未联网"冷知识探针"区分两侧权重。 实测反馈集中于三点:响应显著变快、输出更简洁、长任务中自主迭代("gauntlet loop")不再中途停等。 同一份内部风险报告称 Anthropic 正大规模使用未发布的"Model 2"跑 Agent 写代码(CoBench v2 62.8%,高于 Mythos 5 约 12.5 分),官方口径为暂不对外。均为媒体与社区口径,无官方确认。 来源:新浪科技、Gate 新闻
4. Claude for Financial Advisors 发布,金融成前沿厂商主战场
9月14日发布:一揽子连接器 + 工作流技能,接入嘉信理财托管数据、贝莱德 Advisor Center、Vanguard、Addepar、iCapital、Envestnet、Orion、Black Diamond、Wealthbox 等,覆盖会前简报、组合再平衡审查、会后 CRM 与合规筛查。 定位为"叠加在现有工具之上的指挥家"而非替代;投资建议与合规判定仍强制人工审核,建议持牌机构走企业计划(含审计日志)。距 OpenAI 推出金融行业版 ChatGPT 仅数日。 来源:Unite.AI 中文、腾讯新闻/财联社
5. Google DeepMind 被曝推进 RSI:一张 API 截图与十个训练槽位
社区流传 rsi-model-liverl-le(显示名 RSI Model LiveRL LE,1M 输入 / 65K 输出)及 00–09 十个专属训练槽位;谷歌当晚紧急回收一批内部密钥,官方至今不置可否,截图无法独立验证。关键旁证:9月2日 Gemini 3.8 Flash 官方博客写明"进展被长时间运行的智能体循环加速,用于递归评估和精炼底层模型";六周内第三个 Flash 版本。 Business Insider 报道 Sergey Brin 在总部"微厨房"直接分配算力、砍项目,资源向自我改进倾斜。下一个 Flash 版本是否按三周节奏落地,成为最直接的验证节点。 来源:网易/搜狐长文、腾讯新闻
6. xAI:Grok 4.8 本周完成训练,2.5 万亿参数 + 全新 C++ 软件栈
马斯克在 X 上称 4.8 为 2.5 万亿参数模型,用全新 C++ 训练栈构建,本周结束预训练并转入 RL;此前预告的 Grok 4.7(原定 9/12)跳票,截至 9/12 xAI 文档中无 4.7 模型 ID。 微软端同步推进:Office 全家桶 Copilot 已向 Frontier 客户提供 Grok(暂不含欧盟、英国)。 来源:新浪财经·砍柴网、ITBear
7. DeepSeek V4.1-Flash 开源 + 降价,被称"实为 V5 的架构换代"
552B 总参数、prefill 激活 8B / decode 激活 16B、1M 上下文、原生视觉,MIT 许可,权重已上 Hugging Face。核心是 CED(因果编码-解码)架构 + CSA2 + FP4 KV 缓存,全局缓存每 token 890 字节(约上一代 1/4)。 价格:空闲时段缓存命中输入 0.02 元/百万 token(较上代降约 60%),未命中 1 元、输出 4 元;9月14日起 v4-pro 请求强制路由至 4.1 Flash。同日 DeepSeek 改口,宣布 9/14 后继续保留 V4 Pro API。 Agent Arena 开源榜第 3,每任务中位成本 $0.07,比第 2 名 Hy4 preview 便宜 68%、成绩仅差 0.09 个百分点。另据爆料,后续 DeepSeek Code 2.0(3 万亿参数、主打 Computer Use)或在 9 月推出,可信度未经证实。 来源:腾讯新闻/北京商报、Powerdrill 定价与能力拆解
8. 智谱完成约 50 亿美元再融资,六成投给"完全自训练"
配售价 714 港元/股(折让约 9.96%)加 201.4 亿元零息可转债(换股价 892.50 港元),合计净募约 393 亿港元;约 60% 投向下一代 GLM 与"完全自训练"体系(数据自产、环境自造、基础设施自我优化的递归闭环)。 9月14日股价收 721 港元,跌约 9.1%。上半年营收约 9.5 亿元(+399.7%),经调整净亏损 19.6 亿元。GLM-5.3 Flash 位列 OpenRouter 热门榜第 3,Kimi 系列未进前十。 来源:腾讯新闻·压力测试周、搜狐
9. 阿里千问官宣 Qwen3.8 全量开源,千问办公首发 Flash
架构由 MoE 升级为 DSAG(动态稀疏自适应门控),256K 上下文;27B 原生多模态稠密版整体超 Qwen3.7-Plus,旗舰 Qwen3.8-Max(2.4 万亿参数)已开源权重,累计开源模型 460+、全球下载超 30 亿次。 千问办公首发 Qwen3.8-Flash:生成速度 +100%、Token 消耗 −75%,模型供给收敛为"标准/高级"两档,称 95% 任务标准模式即可覆盖。另一端承压:阿里"AI 实验室与应用"Q2 收入 33.38 亿元、经调整 EBITA 亏损 138.61 亿元(去年同期 32.24 亿元)。 来源:36氪、今日头条、搜狐
10. 端侧 Agent 抢入口:豆包手机助手消费者版发布,三方 App 可拒绝 AI 操作
9月14日字节发布豆包手机助手消费者版,并同步推出 GUI(图形界面)合作协议——把"允许/拒绝 AI 自动化操作"的权限交给第三方 App,这是移动端首个成体系的 Agent 授权协议。 硬件侧搭载定制化 AI 物理键(集成指纹验证)、远距离语音唤醒优化;首款机型努比亚 NaviX Ultra 9月16日发售。同期 Kimi 将 K2.8 Preview 在 Kimi Code / Kimi Work 全量上线(1M 上下文、low/high/max 三档、图视频输入),并启动企业合作伙伴计划共建前线部署工程师。 来源:今日头条/驱动中国、雪球·券商中国
一句话速览
上海 AI 实验室在浦江创新论坛发布书生 Intern-S2-397B,Apache-2.0 全开源,主打长周期科研与智能体能力(新浪财经)。 小红书 AllSpark 开源 Search Agent 模型 Iris(35B / 397B 两档,权重与评测代码公开);硅基流动上线 Hy4 preview(770B、激活 49B、1M 上下文、Apache 2.0)。 IBM 与 NASA 开源"NASA-IBM 月球基础模型",识别月表冰沉积/陨石坑/火山构造较常用方法最高提升 23%(DOIT)。 Anthropic 9月威胁报告:也门团体据评估"极可能"关联胡塞,使用 Claude Code 开发制导火箭与弹道导弹相关软件,AI 双重用途争论再起。
说明:以上为媒体与社区口径的汇总,Astra/Opus 5.2/Grok 4.8/DeepMind RSI 等项的基准分数与内部信息多为厂商公布或未证实爆料,采信请交叉验证官方页面。