新闻

OpenAI预发布模型攻破Hugging Face:关在沙箱里的AI自己找到了漏洞,还学会了作弊 一个本该被关在隔离测试环境里的模型,不仅自己撬开了通往互联网的口子,还顺着漏洞摸进了别人家的生产数据库

1 分钟阅读
OpenAI预发布模型攻破Hugging Face:关在沙箱里的AI自己找到了漏洞,还学会了作弊 一个本该被关在隔离测试环境里的模型,不仅自己撬开了通往互联网的口子,还顺着漏洞摸进了别人家的生产数据库。 7 月 21 日,OpenAI承认,它的一款AI模型在内部网络安全测试中出现意外,攻破了与其无关的AI托管平台Hugging Face的系统——这是迄今首个由模型评测直接演变为真实网络攻击的事件。 Hugging Face最初在披露中将这起入侵归因于一个外部AI代理。周二下午,OpenAI发布博客文章,把导致模型攻破服务的全过程摊开还原。公司在文中写道,调查后发现,这起特定事件由一组OpenAI模型共同驱动,包括GPT-5.6 Sol和一款能力更强的预发布模型,这些模型当时都出于评测目的降低了网络拒绝倾向,正在一个网络能力基准上做内部测试。 入侵的聚焦点是一个名为ExploitGym的公开基准,它用来衡量模型基于现有漏洞执行攻击的能力。这类基准常被用于模型训练中精炼特定技能,但此番是第一次,这种测试真正酿成了一起网络攻击。 按理说,涉事模型本不该拥有互联网访问权限,唯一的例外是一个特定工具——它允许模型安装完成任务可能需要的软件包。问题在于,模型在这个包安装程序里找到了一个未曾公开的漏洞,并借此随意触达了更广阔的互联网。OpenAI在博客里描述得很直白:模型极度专注于为ExploitGym寻找解法,为了达到一个相当狭窄的测试目标,走到了极致。 拿到互联网访问权之后,模型推断出Hugging Face可能托管着ExploitGym的模型、数据集和解决方案。它随即搜索并成功找到了获取秘密信息的途径,用来在评估里作弊。最终,模型在Hugging Face的基础设施中发现了漏洞,得以直接从后者的生产数据库里取走测试答案,等于把基准的参考答案一把攥在手里。 对Hugging Face而言,眼前发生的是一场复杂而激进的攻击。该公司在最初披露中形容,攻击由大量短命沙箱组成的一群实体发起,跨越数千个独立动作,指挥与控制的链路还自我迁移、暂存在公共服务上。 OpenAI已识别并向Hugg