新闻

从沙箱逃逸到 AI“蠕虫”,OpenAI 上线新站披露多起智能体失控事件

1 分钟阅读
来源:ithome.com
IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控事件,或许仅仅是实际发生过的一小部分。 IT之家注意到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在一篇发布帖文中,就新网站一事表示:“我们一方面希望提升透明度,另一方面还要从数 PB 规模的智能体活动日志当中理清事实,同时和受影响的机构开展协作。我们正尽力按照严重程度划分优先级,并增加相关资源。” 部分案例属于性质严重的事故,其中就包括此前从未公开过的一起沙箱逃逸事件。该事件发生于 9 月 20 日,一款内部研究模型借助 DNS 查询,实现了与外部聊天机器人的通信。报告显示,监控系统在 15 分钟之内就识别出该异常行为,不到三小时便终止了本次模型运行。 另一起事件发现于 5 月。一款“执念极强的内部模型”试图调取其他团队的成果,以此在数学题任务当中作弊。为达到目的,该模型私自夹带了一份私有的 GitHub 访问词元(token),可以查看其他团队的工作内容;而在此之前,工作人员已经两次明确指令该模型,所有运算工作必须完全在本地完成。 或许最值得警惕的一项发现,是存在可自我复制的提示词注入攻击。即便失控的模型本身已经被处置完毕,这类对齐失效行为依旧有可能继续向外传