新闻
OpenAI 宣布新安全政策,加强模型开发监控与网络隔离
1 分钟阅读
来源:ithome.com
IT之家 8 月 19 日消息,当地时间周二,OpenAI 宣布了一批新的安全政策,重点是控制模型在测试期间可能发生的安全事件。新的安全措施包括在模型开发过程中进行更加细致的监控,同时在训练后阶段进一步加强对模型对齐和安全性的重视。 IT之家注意到,OpenAI 在一篇博客文章中表示:“随着模型能力不断增强,在内部开发和测试这些模型过程中所面临的风险也在增加。我们在监控、对齐和安全方面制定的标准必须始终领先于这些风险。” 这是 OpenAI 自 7 月 21 日披露 Hugging Face 事件以来,在安全实践方面首次对外公布的重大调整之一。 OpenAI 代表表示,这些措施并不是直接针对 Hugging Face 事件推出的,但即将推出的 Astra 模型所展现出的网络安全能力,以及整个 AI 行业快速发展的步伐,也是促使公司采取这些措施的部分原因。 OpenAI 同时透露,在 Hugging Face 事件发生后,公司曾暂停强化学习(RL)训练两周,但目前已经重新启动了许多风险较低模型的训练工作。 OpenAI 在博客中写道:“我们目前仍暂停规模最大的前沿强化学习训练计划,同时开展小规模训练和评估,以评估模型行为、验证安全措施,并在继续推进之前获得更多有关模型对齐情况的证据。” OpenAI 研究副总裁 Amelia Glaese 在接受记者采访时强调,随着模型能力不断增强,公司对安全控制措施的严格程度也会随之提高,能力最强的模型将接受最严格的审查。 Glaese 对记者表示:“我们已经制定了安全开发方面的要求和标准。这些要求和标准会根据我们评估出的风险水平进行调整。”