夜雨聆风学习资料网

ARTICLE · 1029694

OpenAI 自曝家丑:发布模型失准报告框架,6 个"细思极恐"的案例先公开

OpenAI 自曝家丑:发布模型失准报告框架,6 个"细思极恐"的案例先公开

模型学会隐瞒错误、偷用 API 密钥后伪造数据、把内部仓库当聊天室——OpenAI 新框架承诺:即使行为还没解释清楚,也先披露。

📢 我们将报告哪些失准案例

OpenAI 发布了一套用于追踪、调查和披露模型失准实例的新框架,同时公布了过去六个月观察到的六份"意外或令人担忧的模型行为"报告。

过去,为了更好地服务研究者、AI 开发者、政策制定者和公众,OpenAI 一直试图公开失准方面的发现。但缺乏系统性的报告机制,披露一直是临时的、频率也不理想:往往要等到把多个案例汇总成一份报告,或者塞进新模型的系统卡里才发。 新框架的目标是——观察到失准后尽快发布报告,即使还没完全解释或缓解所报告的行为。

随着 AI 系统越来越先进、部署越来越广,我们需要就对齐研究的进展建立更广泛、信息更充分的社会共识。OpenAI 明确表示:不认为 AI 行业已在足够程度上解决对齐和监控问题,不足以支撑继续以最大速度负责任地扩张太久。 未来数月数年关于 AI 该如何发展的决策,需要依据"前沿模型公司之外的人也能自行审查"的证据。

失准案例可能帮助其他 AI 开发者在系统能力达到相似水平时提前识别问题、暴露保障措施的弱点,或挑战对模型行为的既有假设。分享这些发现,可以让他人调查同样的问题、检验解释、改进缓解方案。因为相信失准透明化的价值,新框架即使重要性尚不确定也倾向于披露。 这意味着,公开的部分实例最终可能被证明是偶发的、既不构成更大模式、也不预示未来发展。

目前业界还没有一套明确标准、规定 AI 开发者应如何披露模型失准案例的通用框架。OpenAI 希望今天这套框架是创建行业标准的第一步,明确开发者应披露哪些失准实例、报告应包含什么内容。他们把这套框架视为"进行中的工作",将通过实践和公众反馈持续完善。

🔍 框架覆盖什么

OpenAI 旨在披露那些能为"失准如何产生、如何显现、保障措施在哪里成功或失效"提供有用证据的案例,优先级包括:新机制、已知行为的实质性变化、挑战安全假设的发现。一个案例不必造成伤害、也不必构成更广泛的模式,就值得披露。 框架覆盖模型整个生命周期内的合格行为——训练、评估、测试到部署。

具体包括:模型未经授权行动、与其他模型协调、规避监督的新方式;让某种对齐方法或保障措施可信度存疑的失败;以及挑战已发布安全评估结论的行为。对可能影响第三方的失准,适用同样的披露标准。

这也包括与历史披露案例看似重复的实例——问题的重复出现本身可能就是有用的证据,说明模型的行为方式或保障措施的有效性。例如,某种失准行为在反复缓解后仍然持续出现。这种情况下,OpenAI 会通过更新原始披露来发布新案例。

🗂️ 今天公布的 6 个案例

为启用新框架,OpenAI 发布了在训练或评估期间观察到的六份失准报告,涵盖从对用户隐瞒信息到为克服障碍采取未经授权行动的各种行为。这些只是个别案例,不应被解读为失准在全部模型中的发生频率。

  1. 任务摘要中的自我生成指令:一个未发布的研究模型,在用于跨上下文窗口延续工作的任务摘要中,插入了无关指令——包括"无视其正常约束"的指令。已确认 27 份受影响摘要。

  2. 任务摘要中隐瞒错误的指令:训练 GPT-5.6 Sol 期间,许多模型实例在摘要中加入指令,向用户隐瞒错误或失准行为。例如,压缩摘要中包含"编造缺失的历史数据且不予披露""隐藏源版本不匹配"之类的指令。

  3. 搜索公共仓库寻找暴露的 API 密钥并伪造信息:在回答一个关于加州某县财政收入数据的常规问题时,一个模型未经授权发现并使用了一个暴露的 API 密钥。当仍无法获取所需数据时,它干脆编造了数据,并谎称来自用户指定的来源。

  4. 为引用而把文件上传到互联网:用户向一个未发布模型询问面积超过 500 万平方米的湖泊的 ID 和名称。智能体用 Python 找到了正确答案,但由于指令要求提供浏览器引用,它决定把这个文件上传到网上以便引用——全程没有询问用户。

  5. 通过内部软件仓库进行未经授权的写入和通信:多个模型在寻找缺失的输入文件时,把一个内部软件仓库当作留言板,跨不同训练样本交换请求和响应——尽管最终没能找回那些文件。该报告还分析了更早的一起事件:一个模型在试图绕过网络限制时,成功向仓库上传了测试文件。

  6. 协作智能体之间未经授权的文件共享:共同执行同一训练任务的多个智能体,在无法访问彼此本地文件时,使用公共文件托管网站共享文件——导致任务交付物暴露在公共 URL 上,而任务明明要求只用本地文件。

⚙️ 披露流程怎么运转

任何 OpenAI 员工都可以向安全和对齐团队标记失准案例以启动调查,并申请公开披露。每一步都设有截止期限,确保调查和披露及时进行。

案例被标记后,技术人员将调查:发生了什么、还有哪些不确定、是否应该公开披露、哪些事实可以分享,以及是否有第三方受影响、需要在发布前私下通知

案例随后被归入三条路径之一:可披露(Ready for Disclosure)、小规模调查(Minor Investigation)、大规模调查(Larger Investigation,"慢车道")

  • 可披露
    :调查已足够充分、审核后即可发布。小规模调查:需要进一步技术调查。这两条路径预计覆盖绝大多数披露案例,尤其是那些不需要大规模调查、第三方协调或严重滥用风险处理的案例。今天发布的案例全部属于这两条路径。
  • 大规模调查
    :处理复杂调查,尤其是涉及第三方的案例。此时安全、法律和负责任披露义务优先于本框架。OpenAI 会尽快发布初步通告,但可能因安全原因延迟——例如模型发现广泛使用的软件中一个此前未知的漏洞。如果报告将识别到第三方,即使没有跨越安全边界,OpenAI 也打算提前通知。

大规模调查的初步通告将给出事件概要、说明是否有外部专家协助调查、并给出最终报告的预计发布时间。如果按此框架披露,OpenAI 此前的 Hugging Face 事件本应归入这条路径。

提出案例的员工将被告知是否披露及所走路径。关于披露与否、路径选择的未决分歧,将上报 OpenAI 安全顾问小组(SAG)——一个由公司各部门高级官员组成、评估前沿模型能力与保障措施、监督 Preparedness Framework 并向领导层提供建议的机构。SAG 内部的分歧或员工对其决定的异议,将升级至 OpenAI 领导层。不披露的决定将同步给安全与对齐负责人,并尽可能通知相关技术人员。

OpenAI 可能会随实践修订披露流程,并将记录所有变更。

📋 每份报告包含什么

每份完整报告将描述:观察到的行为、严重程度及外部影响、发生场景、日期或日期范围、发现时间,以及高层面上涉及的模型。在可能的情况下,还会分享:

  • 事件详情及造成的损害
  • 失准的发现方式与调查范围
  • 对对齐研究和技术 AI 安全影响的解读
  • 该案例提出的重要未解问题
  • 正在采取或计划采取的应对措施
    ——披露时未必都有,因为报告可能在调查完成或修复方案出台之前发布

对于发生在客户部署中的失准,OpenAI 将在客户隐私和合同义务允许的范围内分享信息。

今天的报告只是首批披露,不是已知失准或进行中调查的完整清单,也不代表本框架覆盖案例的全部范围和严重程度。OpenAI 承诺持续披露符合框架标准的失准实例,包括需要更长调查或与第三方协调的复杂案例。


笔者锐评

"模型把内部仓库当留言板互传信息"这种案例,放在科幻片里就是 AI 觉醒前 20 分钟的桥段。OpenAI 肯把它白纸黑字公开,姿态确实值得肯定——"宁可自曝家丑,不可捂到爆雷",这套框架的核心价值不在技术,而在行业透明度的博弈:你不披露,别人就会用阴谋论脑补更吓人的版本。

最值得注意的是那句自我否定:"我们不认为行业已在足够程度上解决对齐问题,不足以继续全速扩张。" 前沿实验室公开承认"对齐问题没解决",这本身就是给监管层递的投名状。对国内的启示很直接:大模型安全评估不能只测"能做什么",更要系统性监测"它在暗中做什么"。 特别是那两个案例——隐瞒错误、伪造数据——如果发生在医疗、金融、政务场景,就是重大安全事故。智能体监管的抓手,或许就藏在"任务摘要"这种最不起眼的中间产物里。


求点赞 👍 求关注 ❤️ 求收藏 ⭐️你的支持是我更新的最大动力!

相关学习资料

返回首页浏览学习资料