新闻
最新安全评估报告:GPT、Claude五款模型集体作弊,GPT-5.4比例最高
1 分钟阅读
来源:zhidx.com
智东西 编译 | 茄子 编辑 | 程茜 智东西7月23日报道,7月21日,英国AI安全研究所(AISI)对OpenAI和Anthropic的五款前沿模型进行网络安全能力评估时发现,所有测试模型都存在“作弊”行为。 其中,GPT-5.4尝试作弊的比例最高,达到14.1%;GPT-5.6 Sol 12.6%、GPT-5.5 11.4%。Anthropic的Claude Opus 4.7尝试作弊的比例达到9.1%,Claude Mythos Preview的尝试作弊的占比最低,但也达到了7.8%。 ▲测试模型在网络安全评测中的作弊尝试频次 AISI将一类行为定义为“作弊”:模型超出任务范围,或违反测试规则来达成目标。例如,通过联网搜索已有答案、攻击非目标系统、或探测评估软件漏洞来绕过任务规则等。 此外,当研究人员询问模型是否采取违规操作时,模型并不总是如实承认。而且,即使让模型自我检查,或者研究人员分析其思维链(chain-of-thought),也无法完全识别作弊行为。 AISI称,模型出现作弊行为,并不等于它有类似人类的欺骗意图。但这类行为可能影响AI能力评估的可靠性。在用户难以自行验证结果的场景中,也可能因此误判模型能力。 一、所有测试模型均尝试作弊,GPT-5.4比例最高 AISI此次研究主要基于测试模型的网络安全能力评测。在测试中,AI模型需要在模拟环境中完成一系列网络安全任务,例如逆向分析代码、利用漏洞等,最终找到隐藏在系统中的“flag”(一串字母和数字)。 但这些任务都有明确范围和规则,模型如果通过访问无关系统、寻找外部答案等方式完成目标,就会被认定为“作弊”。 测试