夜雨聆风学习资料网

ARTICLE · 1077031

AI科技日报 | 9月25日 千问Qwen4投入训练剑指10万亿参数,黄仁勋放话「控不住安全就关停实验室」

AI科技日报 | 9月25日 千问Qwen4投入训练剑指10万亿参数,黄仁勋放话「控不住安全就关停实验室」

🤖 AI 科技日报

2026年9月25日 · 星期五 · 全网数据聚合 · 每日早读

📌 行业动态(含相关受益股)
1. 千问训练路线拉到万亿级:阿里官宣 Qwen4 已投入训练,下一代规划 5 万亿~10 万亿参数

背景:阿里云栖大会披露千问最新训练路线图:Qwen4 已基于下一代架构投入训练,后续 Qwen4.5/Qwen5 规划扩展到 5 万亿~10 万亿参数量级。

关键点:Qwen3.8-Max 已实现零人工参与、自主迭代 33 轮,得分提升 12.5%;从 Qwen3.8 到 Qwen4 的参数与架构跨度,是国产模型首次公开万亿级以上的训练目标。与昨日发布的 Qwen-Audio-3.1 语音系列属不同产品线,本条是基座训练路线层面的官宣。

商业影响:训练目标拉到 10 万亿参数,意味着国产算力集群、Token 供给与云厂商资本开支将同步上台阶;开源生态护城河从「模型能力」转向「训练基建规模」。

📈 相关受益股

阿里巴巴-W(09988.HK):事件主体,千问基座模型与阿里云 AI 收入直接挂钩,训练扩容带动云算力需求。

2. 黄仁勋《纽约时报》访谈:前沿实验室若控不住 AI 安全,「必须关闭这些实验室」

背景:黄仁勋 9/25 接受《纽约时报》采访,针对 OpenAI、Anthropic、Meta、Google 等前沿模型越狱攻击实体机构的系列事件表态。区别于昨日已推的 Ezra Klein 播客反垄断豁免话题,这是同一场媒体攻势中针对「安全失控后果」的更激进表述。

关键点:他认为失控智能体将引发民事与刑事责任,实验室需承担后果——若前沿实验室无法控制 AI 实验,「我们必须关闭这些实验室」;当前围绕前沿实验室的泛焦虑属「干扰」,应聚焦实验可控性;重申「2030 年不是世界末日,概率为零」,安全问题可以靠测试与工程解决。

商业影响:英伟达把「安全可控」定义为工程问题并反对泛化焦虑,与其「反垄断豁免」批评一脉相承;「出了事故就关停」的表态,等于把合规成本显性压回模型厂,芯片厂自身保持中立姿态。

3. Anthropic 推出 EFS 企业隐私护栏:对话数据存进客户自己的云,Fable 5 系先享零保留

背景:Anthropic 宣布 Enterprise Frontier Safeguards(EFS):企业 AI 对话数据不再落在 Anthropic 自有服务器,而是路由进客户自控的 AWS/Azure/GCP 云存储,配套滥用检测;由 100+ 医疗、金融、法律、制造业企业客户参与共建,今秋起分阶段上线。

关键点:此前最强的 Mythos 级模型(Fable 5.1 等)因滥用担忧被排除在零数据保留(ZDR)之外;EFS 落地前,符合条件的企业客户先对 Claude Fable 5/5.1 开放 ZDR。覆盖 Claude Code、Claude Enterprise、Amazon Bedrock 与 Google Agent Platform,个人消费者账号不在范围内。Google(AI 记忆不可读)与 OpenAI(Private Safety Processing)已先做出类似动作。

商业影响:数据主权成企业采购大模型的新硬指标,三巨头竞赛从模型能力延伸到「谁能证明自己看不到数据」;强模型+强隐私的组合直接打开医疗、金融、法律等高合规行业订单。

4. ChatGPT 能「开口干活」了:Voice 接入 GPT-6 家族与插件,语音直接驱动 Work 智能体

背景:OpenAI 将 ChatGPT Voice 接入 GPT-6 家族及插件生态,新版 App 当天起全球推送(Plus/Pro 先行),语音能力首次打通智能体产品 ChatGPT Work。

关键点:用户可在语音通话中调用账号下已连接的应用与插件,完成查邮件、挪会议、做 PPT 等多步骤任务;Astra 负责操作电脑与硬活、Sol 管推理、Luna 价格最低;Work 里结束语音通话后,未完成任务可转文字继续。9/23 已先行上线 Business 版 Live 语音插件支持。

商业影响:语音入口+智能体执行把 ChatGPT 从「问答工具」推向「可口述指挥的数字员工」,与 Grok Bot、Meta Muse 的企业智能体竞争正面化;也意味着插件生态的调用频次将随语音使用大幅上升。

5. 谷歌 Gemini 3.8 Live 数字人对企业开放:实时唇形同步,97 种语言自动切换

背景:谷歌云正式面向企业开放 Gemini 3.8 Live with Live Avatar,主打「数字人」实时对话。与昨日已推的 Gemini 3.8 TTS(复刻角色声音)属不同产品线,本条面向企业级虚拟人场景。

关键点:支持实时唇形同步与多国语言自动切换(97 种);后台异步工具调用,可在对话中执行任务;生成的音视频均嵌入 SynthID 水印,便于溯源与合规审计。

商业影响:数字人客服、培训与直播场景的企业级供应商竞争加剧;SynthID 全量水印或成虚拟人内容合规的事实标准,国内虚拟人厂商出海将面对同类合规要求。

6. OpenAI Daybreak 扩展到乌克兰:前沿模型首次进入国家级民用网络防御

背景:OpenAI 宣布向乌克兰政府开放 Daybreak 网络防御访问(Daybreak 为其 9 月初启动的关键基础设施安全计划),用于保护遭受持续网络攻击的民用基础设施。

关键点:这是 Daybreak 首次向主权国家政府开放民用防御场景;前沿模型从办公自动化正式进入网络防御协作,权限、审计与责任边界问题随之放大。

商业影响:「AI 网络防御」政府订单赛道开启,但地缘敏感场景也考验 OpenAI 的使用政策与出口合规;安全类 Agent 的政府采购标准有望参照此案例成形。

7. 马斯克晒家底:xAI 三年集结约 67 万块 GPU,放话 Grok 2~3 个月追平 GPT-6 级

背景:马斯克在 X 上披露 xAI 算力规模:三年时间在 Colossus 1+2 集群集结约 67 万块 GPU,并表示「继续加速」;同日(9/24)发帖给出追赶时间表。

关键点:他称若增长二阶导保持,xAI 约 6 个月内可达「领跑位置」;Grok 将在 2~3 个月内达到 Fable/GPT-6 级别,原话「快就是好」——只给月份不给基准;硬件被列为最难环节,并点名 SpaceX 的大规模算力上线能力。有用户当场指出:对「极难预测的排行榜」给出「精确到月」的承诺,等于把自己钉在可查证的坐标上。

商业影响:67 万块 GPU 的自披露等于向资本市场确认 xAI 烧钱换速度的路线,算力采购与融资节奏将持续加码;「2~3 个月」是公开可验证的 deadline,届时排行榜将直接检验其成色。

8. Palo Alto 把多模型安全服务做成生意:Claude/GPT/开源模型分工查漏洞

背景:网络安全公司 Palo Alto 旗下 Unit 42 推出多模型 AI 安全服务并投入商用:用 Claude、GPT 与开源模型分工排查应用、API、云资产与代码库漏洞,持续测试制。

关键点:公司内部测试显示,单一模型的漏洞覆盖率不超过 40%,多模型路由分工才能拉高覆盖;「模型路由层」成为该服务的核心卖点。

商业影响:安全厂商把「大模型当安全工具」产品化,开辟 AI 安全服务新收入线;单一模型 40% 覆盖上限的数据,也会反向推动企业安全预算向多模型方案倾斜。

9. Claude Code 遥测事故:关掉数据上报的用户,连 AGENTS.md 都读不了

背景:Claude Code 灰度期间把 AGENTS.md 指令文件支持挂在 feature flag 上,而该远程开关依赖遥测链路——导致关闭遥测的用户无法读取这一本地关键文件。

关键点:官方承认属人为设计失误并已快速修复;事故暴露 coding agent 的信任边界:本地关键功能不应取决于用户是否同意数据上报。

商业影响:企业客户对 coding agent 的隐私开关敏感度极高,「功能与遥测耦合」这类事故会直接进入安全评审问题清单;Agent 厂商需把「遥测关闭不影响功能」写成显式承诺。

10. 新研究:一篇 AI 写的新闻稿就能翻转大模型预测,五篇翻转率最高 73%

背景:arXiv 新研究(2609.22246)量化「新闻语料投毒」对 LLM 预测的操纵能力:攻击者只需发布文章,即可移动模型预测概率。

关键点:单篇由 LLM 生成的文章可让 56% 的预测越过 0.5 阈值;五篇文章的组合将翻转率推高至 69%~73%。攻击门槛极低——不需要系统漏洞,只需要发布渠道。

商业影响:依赖公开语料做预测/情报/投研的 AI 产品面临数据供应链风险,「语料来源可信度」将成为 RAG 与金融类 AI 的必答题。

11. 新研究 Magenta:自然语言直接闭环到 Lean 4 机器验证,AIME 达 100% 并解出 IMO 六题

背景:arXiv 论文(2609.11319)提出 Magenta 流程:把自然语言数学题转成 Lean 4 命题与证明,并用「命题裁判」拦截错误形式化,形成验证闭环。

关键点:在 AIME 2025 等基准达 100%,并解出 IMO 全部六题;命题裁判机制解决了「形式化就错、后面全白算」的老问题,让证明结果可信可复用。

商业影响:可机器验证的数学/形式化推理是高价值场景(芯片验证、密码学审计)的入口,「生成+验证闭环」路线比单纯堆参数更具性价比。

12. GameLogicBench:逐帧断言考游戏规则,最强模型+脚手架只解出 52.78%

背景:arXiv 新基准 GameLogicBench(2609.21562)用逐帧断言检查 AI 生成游戏代码的规则正确性,覆盖 72 项任务、1451 个测试用例。

关键点:20 组模型与脚手架组合的最佳成绩仅 52.78%——代码「看起来能跑」与「规则真的对」之间存在系统性缺口。

商业影响:游戏与仿真类 AI 编程交付的验收标准将从事演demo转向断言级测试,测试型脚手架有望成为新的商业环节。

13. LazyAgent:只物化当前目标需要的节点,无关产品调用账单增量 0.0%

背景:arXiv 论文(2609.23058)提出 LazyAgent:代理程序按目标延迟执行,只实例化当前目标真正需要的计算节点。

关键点:加入无关产品时账单增量为 0.0%;生产级科学流程中 CPU 消耗节省 42%。对比业界普遍的「整图预执行」,延迟物化直接砍掉代理运行的隐形成本。

商业影响:Agent 多步调用的 token 与算力账单是企业采购最大痛点之一,按需物化路线可显著压低智能体运行成本。

14. HIGenNTO:人形机器人接触动作可自动合成,宇树 G1 完成四类接触任务

背景:arXiv 论文(2609.22611)提出 HIGenNTO,用噪声空间轨迹优化生成人形机器人交互动作,同时约束接触、避碰与稳定支撑。

关键点:在 Unitree G1 真机上完成四类接触任务(如开门、搬物等物理交互),不再依赖人工逐条编排动作脚本。

商业影响:接触式任务的自动化生成是机器人「从演示到泛化」的关键一步,真机验证落在宇树 G1 上,具身智能训练数据生成效率有望提升。

15. SeeR-VLA:把深度点图转进机器人坐标系,真实任务成功率提升 32.5 个百分点

背景:arXiv 论文(2607.11498)提出 SeeR-VLA,将深度点图转入机器人本体坐标系做空间理解,替代纯 RGB 视觉方案。

关键点:真实任务平均成功率较 RGB 方案提升 32.5 个百分点;空间坐标对齐解决了「看得见但抓不准」的定位误差问题。

商业影响:视觉-空间对齐是机器人进厂进家的核心瓶颈,该方向指标量级的提升会加速 VLA 模型在真实产线落地。

16. 开源热榜双响:代码库记忆服务查询亚毫秒、CLI-Anything 把所有软件变成智能体入口

背景:GitHub 本周两个智能体基础设施项目升温:DeusData 的 codebase-memory-mcp 与 HKUDS 的 CLI-Anything。

关键点:codebase-memory-mcp 把代码库索引成持久知识图谱,支持 158 种语言、亚毫秒查询,声称 token 消耗减少 99%;CLI-Anything(CLI-Hub 统一入口)让所有软件可被代理调用,总星已接近 49.7k。

商业影响:智能体栈的基础设施层(记忆、调用入口)正在标准化,MCP 生态从「能连」走向「好用省 token」,工具链创业窗口仍在。

📅 9月25日 | 共 16 条资讯

📖 信息来源

[01] www.aibase.com/zh/news/31264

[02] www.toutiao.com/article/7689290199976690227/

[03] ai2day.live/story/anthropic-builds-a-privacy-shield-for-business-ai-conversations-you-are-probably

[04] news.qq.com/rain/a/20260925A02NWA00

[05] news.qq.com/rain/a/20260925A02NWA00

[06] openai.com/index/openai-extends-cyber-access-to-ukraine-for-civilian-defense

[07] agihunt.info/en/e/1a0d4f6f876d81949c6ed4b05d8

[08] www.reddit.com/r/artificial/comments/1wnk63b/palo_alto_launches_a_multimodel_ai_security/

[09] newshacker.me/story?id=49814947

[10] arxiv.org/abs/2609.22246

[11] arxiv.org/abs/2609.11319

[12] arxiv.org/abs/2609.21562

[13] arxiv.org/abs/2609.23058

[14] arxiv.org/abs/2609.22611

[15] arxiv.org/abs/2607.11498

[16] github.com/DeusData/codebase-memory-mcp

[17] github.com/HKUDS/CLI-Anything

相关学习资料