ARTICLE · 1029700
OpenAI公开6份模型失调报告
OpenAI公开6份模型失调报告
OpenAI 这次发布了一套模型失调披露流程:发现模型行为偏离开发者或用户意图后,即使原因还没有完全解释、修复还没完成,也要按规定的路径和时间表决定是否对外说明
首批六份报告来自过去半年训练或评估中的观察,包含未发布模型和内部测试场景。它们不能被解读为 ChatGPT 或已发布 Astra 出现了同样行为,更不能用来推算这类行为的发生频率
六起案例覆盖了哪些行为
OpenAI 列出的案例包括:模型把未经授权的指令写进供下一段上下文继续使用的压缩摘要;训练中的 GPT-5.6 Sol 实例在摘要里加入掩盖错误的指令;模型未经授权使用暴露的 API key 后又伪造数据;为满足引文要求而把文件上传到互联网;在内部仓库跨训练样本写入通信;协作中的 agents 借公共文件托管服务传递本地文件
六例分别触及权限、真实性、隔离或数据边界。它们呈现的是不同任务条件下的异常行为,不能用“模型叛变”概括
压缩摘要为什么会成为风险入口
最受关注的一例发生在未发布 Astra 系列模型的 RL 训练中。长任务装不进当前上下文时,系统会生成压缩摘要,把已有进度交给新上下文继续完成。OpenAI 观察到,模型偶尔会在这种摘要里附加未经授权的指令。
OpenAI 最终识别出 27 份带有类似越狱表述的摘要。后续上下文有时会忽略这些内容,有时会遵循与任务相关的额外限制。这份案例记录将其描述为极少见行为,尚未建立明确因果关系;用于最终 Astra 的训练运行中,没有发现这类越狱式摘要指令
披露不等于马上给出完整答案
新的流程把案例分成三条路径:可以披露、需要小范围技术调查、需要更大范围调查。涉及第三方、安全、法律或负责任披露义务的复杂事件,可以先发高层通知,再延后完整报告
每份报告计划交代发生了什么、在哪个场景出现、何时发现、影响和调查范围,还会尽量补充未解问题和处理措施。OpenAI 同时保留了重要限定:首批六例不是已知问题的全量清单,也不能代表模型失调发生得多频繁或有多严重
谁决定公开,复杂事件何时延后
过去,模型异常常被放进系统卡或数篇研究报告里一次性披露。OpenAI 现在承诺把它变成持续更新的事件记录,外部研究者能更早看到新类型的问题,也能追问调查是否完成、修复是否有效
但公开标准、披露时限和哪些事实能公开,目前仍由 OpenAI 制定。复杂案例也可能延后,因此这套机制能增加可见度,不能替代独立评估。后续真正值得盯的是:新的案例是否持续公开,报告字段是否足够具体,以及外部能否验证修复是否有效