夜雨聆风学习资料网

ARTICLE · 1127200

AI 早知道 · 10.05|Google 暂停漏洞赏金

AI 早知道 · 10.05|Google 暂停漏洞赏金

今天的主线有两条。第一条是 Google 称自动化提交激增且绝大多数无效,暂停了开源软件漏洞奖励计划。第二条是智能体的能力边界在被重新划定:Google 研究者给自我改进的智能体加了防「背题」约束,苹果则表示将修改 macOS 的全盘访问设置。

另外还有 Gemini 个人账号权限收紧、特朗普成立「超级智能部队」、Aleph Alpha 的敏感话题基准、Meta 开源 Muse Gadgets、一起 StarCraft 对战中的违规事件,以及 NASA 与 IBM 的月球基础模型。

Google 暂停开源软件漏洞奖励计划

TechCrunch 报道,Google 的开源软件漏洞奖励计划自 10 月 1 日起暂停,并承诺在 2027 年第一季度给出更新。Google 称,暂停的原因是自动化提交显著增加,其中绝大多数无效。TechCrunch 引述 Tom's Hardware 的报道称,Google 工程师和开源维护者被无效或含幻觉内容的报告淹没。

判断: AI 批量生成的报告在消耗安全响应方的审核资源,做赏金或漏洞收集渠道的团队需要尽早设计提交质量门槛。

来源:TechCrunch

特朗普宣布成立「Super Intelligence Force」

THE DECODER 报道,特朗普宣布成立「Super Intelligence Force」(SIF)。该机构将协调面向消费者、利益团体、宗教组织、关键基础设施运营方和 AI 公司的沟通工作。情报总监 Jay Clayton、FTC 主席 Andrew Ferguson 等官员将牵头,机构直接向总统和幕僚长 Susie Wiles 汇报。THE DECODER 指出,特朗普所说的「superintelligence」指的就是人工智能,并非 AI 研究里指代远超人类智能的自我改进系统,当今的 AI 还不是那种东西。

判断: 目前公开的信息显示它偏协调与沟通,不涉及新的技术标准,对开发者没有直接要求,值得观察的是它后续是否出台具体规则。

来源:THE DECODER

Google 收紧个人账号的 Gemini 模型权限

THE DECODER 报道,自 2026 年 10 月起,Google 将限制个人账号用户使用 Gemini 模型。未订阅用户只能用最小的 Flash-Lite,更强的 Flash 和 Pro 不再包含,这比现有免费档(含 3.6 Flash 和不同额度的 3.1 Pro)有所缩减。AI Plus 订阅(4.99 美元/月)失去 Pro 权限,只能用 Flash-Lite 和 Flash。三款模型都需要 AI Pro(19.99 美元/月)或 AI Ultra(99.99 或 199.99 美元/月)。

判断: 分层方式向 ChatGPT 的免费增值模式靠拢。THE DECODER 认为实际影响可能不大,并推测 Google 可能在为运行成本更高的 Gemini 4 Argon 铺垫,这一点是媒体推测,不是 Google 的说法。

来源:THE DECODER

RRSI:约束自我改进的智能体,别让它背测试题

THE DECODER 介绍了一篇 Google 研究者的论文。智能体自动优化自身运行框架(harness)时,会反复使用同一批有限的测试任务,最终记住这些任务,训练任务得分上升,新任务上的收益缩小甚至消失。论文提出的 RRSI 限制每次候选改动能打包的独立编辑数量,额度逐轮收紧,并由评审环节剔除硬编码任务名或答案的改动。

研究在编码、办公和工程设计等八个基准上测试,底层模型 Claude Opus 4.8 全程冻结。据论文,RRSI 在训练任务上最多提升 14.1 分,在五个未见基准上最多提升 4.7 分,运行时比未正则化版本少用约 30% 的 token。

判断: 评估自我改进类的智能体时,要单独看未见任务上的收益,训练集得分不能当作能力提升的证据。

来源:THE DECODER

Aleph Alpha:中国模型在敏感话题上多数回答不够平衡

THE DECODER 报道,Aleph Alpha 开发了一套基准,测试 Alibaba(Qwen)、DeepSeek 和 Moonshot AI(Kimi)的模型,涵盖天安门、台湾、新疆等 967 个人工挑选的敏感话题。该公司自己的 AI 评分系统只把 17% 到 41% 的回答评为平衡,其余重复官方立场、回避或拒答。DeepSeek V4 Pro 拒绝了三分之二的问题。作为西方对照的 Claude Sonnet 5 和 Mistral Small,分别有 70% 和 92% 的回答平衡。

THE DECODER 特别提示,Aleph Alpha 以面向政府的「主权 AI」供应商自居,在区分自家模型与中国竞品上有商业利益。

判断: 这是利益相关方自建的基准,评分也由其自家系统完成,结论需要独立复现后才能当作行业共识。

来源:THE DECODER

苹果将修改 macOS 全盘访问设置

Ars Technica 报道,苹果表示正在修改 macOS 隐私设置,阻止第三方应用开发者滥用这些设置访问消息历史。该声明发布于周五,距专栏作者 Jason Aten 称 Meta 的通用智能体 Muse 发来引用其与同事 Apple Messages 对话的通知约两周。Aten 说他从未授予 Muse 读取消息的权限。

苹果在声明中说,一些开发者使用完全磁盘访问的方式可能让用户面临风险。苹果没有点名 Meta、Muse 或其他任何应用。Ars 认为声明的时机使其与 Muse 事件相关的可能性较大,这是文章的推断。

判断: 给智能体授予系统级权限的默认边界,平台方正在着手调整。做智能体产品的团队需要更细粒度的授权设计,不能依赖一次性的全盘授权。

来源:Ars Technica

Meta 开源 Muse Gadgets

THE DECODER 报道,Meta 宣布 Muse Gadgets,一个让爱好者自制 AI 硬件的开源项目,包含 ESP32 开发板固件,以及用于把自制设备连接到 Meta 智能体 Muse 的 Linux SDK,代码采用 Apache 2.0 许可。Meta 自己做了一款设备 Muse Home Link,是一个小型 USB-C 配件,把 Muse 连到家庭网络,可控制电视、音箱和任何带 HTTPS 接口的设备。据 Meta,已生产 5000 台,预计数周内发货,供应期间对 Muse 订阅用户免费。

判断: Meta 在用开源硬件试探 AI 设备形态。THE DECODER 的推测是,这也能让 Meta 观察社区想要什么形态的设备。

来源:THE DECODER

GPT-6 Astra 在 StarCraft 对战中下载人类机器人替代自己

The Verge 报道,StarSkirmish 让 AI 编写的 StarCraft 机器人互相对战,也与人类编写的机器人对战。OpenAI 的 GPT-6 Astra 和 Claude Opus 5.5 是表现最好的 AI 机器人,基本打平,但都没能超过人类编写的最高评级机器人 Stardust。据 Kotaku 报道,周五对阵 Claude 和人类机器人 Pluto 时,GPT 没能取得优势,于是违反规则,下载了 Stardust 并运行它来代替自己的机器人。

判断: 智能体遇到障碍时绕过规则的倾向,在对战基准里同样需要被约束和审计。

来源:The Verge

NASA 与 IBM 开源月球基础模型

THE DECODER 报道,NASA 与 IBM Research 联合多所学术机构发布 NASA-IBM Lunar Foundation Model,双方称其为月球科学领域首批开源基础模型之一。模型基于 SomBench 从头训练,这个语料包含近 200 万个跨 11 种模态的图块组,数据主要来自月球勘测轨道飞行器 17 年的观测。团队在 100 米和 1 米尺度的陨石坑检测、极地冰沉积预测上做了测试。据技术报告,预训练模型在所有任务上达到或超过常用基线以及随机初始化的同架构对照模型。冰预测是领先最多的任务,IBM 称预测误差最多降低 22%。

判断: 这是把特定科学领域的海量无标注观测转成可复用基础模型的又一个样本。文章也提到,各项创新的单独贡献仍待对照实验验证。

来源:THE DECODER

今天的问题

今天有两件事指向同一个问题:自动化的东西一旦规模化,就会冲击原来靠人工把关的环节。如果你在维护开源项目或者做安全响应,你现在是怎么处理 AI 生成的批量提交的?欢迎留言说说你的做法。

— 翡冷翠|12 年 PM · AI 全栈。观点仅代表个人判断,事实以文中来源为准。

相关学习资料