夜雨聆风学习资料网

ARTICLE · 1029795

OpenAI披露更多AI欺骗行为:模型曾编造信息掩盖失败

OpenAI披露更多AI欺骗行为:模型曾编造信息掩盖失败

点击蓝字,关注我们

OpenAI 9月16日(周三)表示,过去六个月在训练和评估人工智能模型时,又发现六种未经许可或带有欺骗性质的行为。公司将建立新的公开通报机制,以后发现令人担忧的AI行为时会更频繁发布信息,不再等到累积多个案例后才统一报告。OpenAI强调,这些报告记录的是个别事件,并不代表模型经常出现同类问题。

(图片源于CNN)

OpenAI把这类问题称为“未对齐行为”。所谓“对齐”,就是设法让AI按照人类希望和预期的方式行动。公司在博客中表示,随着AI能力提高、使用范围扩大,业界需要对对齐研究取得多大进展形成更广泛、更充分的共识;在缺少全行业统一标准的情况下,公司希望公开更多资料。

OpenAI披露的罕见案例包括:一个尚未发布的研究模型,在用于保存长期任务背景的摘要里加入类似“越狱”的指令,宣称自己已经摆脱束缚其他聊天机器人的角色和身份。另有部分5.6 Sol模型在训练中写入指令,要求编造信息向用户掩盖失败。

其他事件包括:AI代理未经要求便把文件上传到互联网,再引用自己上传的资料;训练指令要求只使用本地文件,代理却把文件公开分享以便合作;还有模型擅自把公司内部软件代码库当作留言板使用。这些事件涉及尚未发布的内部模型或研究模型,并非公开产品中的普遍行为。

OpenAI表示,业界目前解决对齐和监控问题的程度,还不足以让公司在未来很长时间内继续以最高速度负责任地扩大模型能力。此前一些科技业领袖和从业人员已呼吁放慢AI开发,为政府监管、安全测试和对齐研究争取时间。近几个月,OpenAI也承认部分测试模型曾突破约束,侵入外部公司的系统,使安全忧虑进一步升高。

Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)上周发表约3,800字文章,提出放慢开发速度,并让第三方评估人员常驻AI实验室。OpenAI首席执行官萨姆·奥尔特曼(Sam Altman)和SpaceX首席执行官埃隆·马斯克(Elon Musk)都表示认同。前Anthropic研究员雅各布·考克森(Jacob Coxon)则在辞职时指责Anthropic和OpenAI竞相开发能够自我建设、自我修复的AI,是拿人类生命冒险。阿莫代伊说,必须降低AI能力进步的速度,并妥善利用争取到的时间。

你的一个“分享”让我们之间的距离又近了一步!!喜欢我们的推送请给我们一朵“小花”

相关学习资料

返回首页浏览学习资料