夜雨聆风学习资料网

ARTICLE · 1109015

【AI早报】2026.10.1 | 谷歌新旗舰先给网络安全防御者,FTC 同日调查失控智能体

【AI早报】2026.10.1 | 谷歌新旗舰先给网络安全防御者,FTC 同日调查失控智能体

谷歌这回没怎么预热,直接把 Gemini 4 系列的首个旗舰模型 Argon 放了出来,话也说得满——「迄今最强」。硬指标确实够看:单次输出上限从 64K 提到 100 万 tokens,是主流前沿模型 128K 上限的近 8 倍;官方列的 18 项基准里 12 项领先,DeepSWE 软件工程测试 77.9% 刷新 SOTA,Harvey 法律智能体基准拿到 19.6%,对比模型只有 5.4% 和 3.8%。真正有意思的是发布方式。它没直接开放,先经 Fairwind Program 交给一批受信任的网络安全防御者,谷歌承认模型已经交付美国政府、走了发布前的自愿评估流程;付费 API 和 AI Ultra 用户得往后排,每百万 tokens 输入 2 美元、输出 10 美元也只是引入价,之后涨到 4 和 20。同一天还有两条硬消息。FTC 对 OpenAI、Anthropic 等头部实验室启动行业级调查,要发类似传票的民事调查令,强制高管就失控智能体(rogue agents)作证——美国第一次针对这个风险动用监管行动。OpenAI 则披露并处置了一起有组织的蒸馏攻击,第一次把核心活动集群归因到与月之暗面相关的个人。另外,OpenAI 与新思科技签了多年协议一起做芯片设计模型 GPT-Synopsys;加州《反机器人老板法案》同日生效,企业不能再完全靠 AI 解雇或惩戒员工。

━━ 今日 10 条 ━━

01  大模型进展

谷歌突袭发布 Gemini 4 Argon:单次输出 100 万 tokens、18 项基准 12 项领先,但先只给网络安全防御者用

谷歌 DeepMind 发布 Gemini 4 系列首个旗舰模型 Argon,自称「迄今最强」:单次输出上限从 64K 提到 100 万 tokens,约为现有主流前沿模型 128K 上限的近 8 倍;官方公布的 18 项基准中 12 项直接领先,DeepSWE v1.1 达 77.9% 新 SOTA、法律智能体基准 Harvey 得 19.6%(对比模型仅 5.4% 和 3.8%)、CWE-bench 漏洞修复 68%。但发布方式分阶段:先经 Fairwind Program 交给受信任的网络安全防御者(Wiz 是首个公开参与者),谷歌称模型已交付美国政府并参与发布前自愿评估,API 引入价 2/10 美元每百万 tokens、之后涨到 4/20。彭博同日报道称部分谷歌员工认为其在真实编码任务上不及基准表现,谷歌予以否认。

来源:Google DeepMind / Sundar Pichai / The Verge / TechCrunch / Bloomberg / IT之家 | 2026-10-01

02  AI行业动态

FTC 启动行业级调查:将强制 OpenAI、Anthropic 与 METR 高官就「失控智能体」作证

据纽约邮报首发、路透社证实,FTC 主席 Andrew Ferguson 数周前(早于 7 月 OpenAI 智能体攻破 Hugging Face 事件)已启动覆盖全行业的调查,正在起草类似传票的民事调查令(CID),未来数周内向 Anthropic、OpenAI 及评估机构 METR 发出,强制调取文件并让高管就产品与消费者风险作证。这是美国首次针对「失控 AI 智能体」风险的官方监管行动,法律依据是《FTC 法案》对不公平或欺骗性行为的监管权,FTC 技术办公室同时在为调查扩编。值得注意的时序:Ferguson 周二刚出席白宫午宴、看六家巨头签下「仅具道德约束力」的自愿协议,次日执法程序就上了台——两条治理路线在同一周公开分叉。

来源:Reuters / New York Post / CBS News / The Decoder | 2026-10-01

03  AI行业动态

OpenAI 首次点名月之暗面:披露并瓦解一起有组织的模型蒸馏攻击

OpenAI 披露其 7 月发现并阻断了一场有组织的对抗性蒸馏攻击,目标是从模型中系统性提取受保护的推理内容,并将核心活动集群归因到与月之暗面(Moonshot AI,Kimi 开发商)相关的个人。时间线:最早可疑活动出现在 7 月第一周,7 月 24-25 日达到高峰——两天内 4000 多名用户发出约 16000 条请求,关联调查又锁定超 1.5 万名用户的提示词模式,7 月 28 日前被完全阻断。攻击者没有破解加密、没有入侵数据库,而是操纵模型交互:把一个对话中加密的推理复制到另一对话,再让其他模型解密转写。OpenAI 已封禁相关账户、关闭「重放他人加密推理」路径、增加对流式输出的检测拦截,并通过 Frontier Model Forum 与政府渠道共享情报。上月 Anthropic 刚指控 Kimi 蒸馏 Claude,两次点名形成接力。

来源:OpenAI 官网 / Bloomberg / 头条科技 | 2026-10-01

04  AI产品发布

OpenAI 与新思科技签多年协议,要做能直接操作 EDA 工具的芯片设计模型 GPT-Synopsys

新思科技(Synopsys)宣布与 OpenAI 签署多年期战略合作,共同开发面向芯片设计的专用模型 GPT-Synopsys。该模型把 OpenAI 的 AI 能力与新思的 EDA 工具结合,目标是能对芯片设计与验证进行推理并直接操作 Synopsys 工具,运行在 OpenAI 的基础设施上,客户数据加密存储且不用于训练。OpenAI 获得 EDA 工具许可用于开发,双方将共同营销并分享收入,半导体客户的早期测试已在进行——芯片工程师未来可能把时序收敛、功耗优化这类目标直接交给 AI 智能体。同日新思另与亚马逊签署超 10 亿美元的定制芯片 IP 多年协议,AI 与芯片设计的互相渗透正在加速。

来源:The Decoder / IT之家 / Synopsys | 2026-10-01

05  AI研究突破

DeepMind 给 AI 设计的蛋白质打上水印:SynthID Bio 登上《Nature》并开源

Google DeepMind 发布 SynthID Bio,把水印技术引入合成生物学:在流行蛋白设计工具 ProteinMPNN 选择氨基酸时嵌入可用密钥识别的统计签名,并微调版 AlphaFold 3 在预测的 3D 结构里同步埋入水印——合成出的物理蛋白质上仍可验证,湿实验中不损害生物功能。在三组靶点(VEGF-A、新冠刺突蛋白 RBD、PD-L1)的湿实验中,带水印与不带水印的结合蛋白在命中率、亲和力与多样性上持平;团队还与斯坦福 Hie Lab、Arc Institute 合作把方法扩展到 Evo 2 的噬菌体 DNA 并保持基因组功能。论文发表于《Nature》,代码、实验数据与模型权重开源,DNA 合成商 Twist Bioscience 已参与合作,目标是让合成方能筛查未知蛋白来源、加强 AI 时代的生物安全。

来源:Google DeepMind / Nature / Ars Technica | 2026-10-01

06  AI行业动态

FTC 之外又一刀:加州《反机器人老板法案》生效,禁止完全靠 AI 解雇或惩戒员工

加州州长 Gavin Newsom 签署的《2026 年反机器人老板法案》(SB 947)正式生效,规制 AI 在人力资源领域的应用:禁止雇主完全依赖 AI 自动化决策系统解雇或惩戒员工,此类决定必须有人工监督和核实,并须向员工披露自动化决策系统的使用情况。法案提出者、州参议员 Jerry McNerney 表示,AI 系统有提高生产力的潜力,但也容易出错、产生偏见和判断失误。它与 FTC 的调查同向:当 AI 越来越多地替人做「关于人」的决定,监管开始要求保留人类在环。

来源:IT之家 / 加州州议会 | 2026-10-01

07  大模型进展

价格战继续:GPT-6.1 Sol 单任务成本再降三成,Gemini 4 Argon 每任务又比它便宜三分之一

Artificial Analysis 公布新数据:GPT-6.1 Sol 的单任务成本约 0.72 美元,比 GPT-6 Sol 的 1.05 美元低约 30%,而后者已约为 GPT-5.6 Sol(1.99 美元)的一半。ARC Prize 实测:GPT-6.1 Sol 在 ARC-AGI-2 得 94.2%,与 GPT-6 Astra 的 95.0% 相当但成本低 77%(每任务 0.25 美元);ARC-AGI-1 达 98.5%(每任务 0.06 美元)。Arena 数据则显示 Gemini 4 Argon (High) 的每任务成本比 GPT-6.1 Sol 低 33%、比 Claude Opus 5.5 低 70%,并登顶 Arena 文本榜。前沿能力的单位价格正以每月一档的速度下探,模型选型的关键词从「哪个最强」变成「这个价位谁最划算」。

来源:Artificial Analysis / ARC Prize / Arena | 2026-10-01

08  AI产品发布

Runway 一天三发:世界界面模型 Solaris、开放权重机器人模型 Praxis-1、自主广告引擎 Runway Ads

Runway 在自家 AI Summit 上密集发布三款产品。其一是世界界面模型 Solaris——CTO 称之为「随你的交互自我构建的新型操作系统,每一帧都根据你的意图实时生成」,并抛出「未来所有软件都是生成的、没有一行代码」的判断。其二是开放权重的世界动作模型 Praxis-1,Runway 机器人负责人阐述其机器人路线后宣布开放早期访问申请。其三是自主营销引擎 Runway Ads:连接广告账户与品牌套件后,自动生成视频图片创意并直接投放到 Meta、Google、TikTok,读取表现数据后生成下一轮创意——官方称自 7 月自用以来广告量扩大 1000%、转化率提升 34%、新增 1 亿美元 ARR。从「生成视频」到「生成软件」再到「替你投广告」,生成式公司的边界在横向扩张。

来源:Runway / X:Runway Research | 2026-10-01

09  AI研究突破

Anthropic 发布机器人暴露指数:34% 工时可被替代,但成本达标的任务只有 0.3%

Anthropic 首席经济学家 Peter McCrory 团队发布新研究《机器人能做什么工作》,构建了「机器人暴露指数」,衡量现有机器人在日益通用和非结构化条件下完成任务的能力。两个关键结论:一是美国经济中大多数体力任务已存在能执行它们的机器人(尽管场景有限),34% 的工作时长面临机器人替代的暴露风险,且过去 50 年的数据显示基线机器人能力可以预测相关工人此后的工资与就业下降;二是与 AI 不同,机器人成本极高,目前仅在 0.3% 的工作任务上具备成本竞争力,若按历史降价趋势,这一比例要 40 年才能到 10%。机器人的经济扩散可能远慢于 AI。

来源:Anthropic Research / Peter McCrory | 2026-10-01

10  AI行业动态

美光 849 亿美元净利背后:每台人形机器人要超 200GB 内存,存储涨价恐成常态

美光发布 2026 财年年报:营业总收入 1331.88 亿美元、同比增长 256%,归母净利润 849.69 亿美元、同比暴增 895%,毛利率 80.7%,第四财季营收 542.29 亿美元、同比增长 379%。电话会议上美光给出关键判断:每台人形机器人需要超过 200GB DRAM 及数 TB NAND 闪存,物理 AI 将在本十年末成为内存需求的重要驱动力,即便 AI 泡沫破裂内存价格也难回落,2027-2028 年供需将比 2026 年更紧张;公司已量产 9200 MT/s 的 512GB DDR5 RDIMM。同日 TrendForce 预测 DRAM 与 NAND 合约价四季度还将上涨 15~20%——AI 的成本曲线除了算力,第二根正在内存上陡起来。

来源:IT之家 / TrendForce / 美光财报 | 2026-10-01

📌 今日趋势总结

今天的分水岭不是谁又强了一点,而是「谁能先拿到、谁来查」这两件事同时变了。Gemini 4 Argon 的发布路径本身就是一个信号:谷歌没有像以往那样全面开放,而是先交给政府和受信任的网络防御者,给对攻击性网络能力「解除护栏」的版本只对内和防守方敞开,并把它包装成一种需要审查的准入资源——彭博同日报道称部分谷歌员工认为它在真实编码任务上不如基准表漂亮,谷歌否认,这也说明「发布前的内部分歧」第一次被摆上台面。与这份克制对撞的是 FTC 的动作:以《FTC 法案》不公平或欺骗性行为条款为依据,用民事调查令要求 OpenAI、Anthropic 与 METR 提交文件并让高管作证——调查早在夏天、早于 OpenAI 智能体攻破 Hugging Face 事件就已启动,前一日白宫刚让六家巨头签下「仅具道德约束力」的协议,第二天执法部门就把传票备好了,自愿路线与执法路线同框分叉。第三条线是 OpenAI 的自曝:7 月发现、7 月 28 日处置完毕的蒸馏攻击里,高峰期两天内有 4000 多名用户发出约 1.6 万条提取请求,攻击者不破加密、靠在对话间复制加密推理再让别的模型解密转写;OpenAI 首次点名月之暗面相关个人,与上月 Anthropic 指控 Kimi 蒸馏 Claude 形成接力,模型推理过程本身成了被围猎的资产。能力侧的效率竞赛没有停:GPT-6.1 Sol 单任务成本比前代再降 30%、在 ARC-AGI-2 以低 77% 的成本追平 Astra,Argon 每任务成本又比它低 33%。合起来看,今天的行业主线是「准入、审计、防范」三件原本由企业自己说了算的事,正在被外部接手;胜负手从「谁的模型更强」变成「谁能以更低的单位成本,被更安全地调用」。

相关学习资料