新闻

安全防护形同虚设:Anthropic 多款 Claude 旧模型可被越狱生成露骨色情内容

1 分钟阅读
来源:ithome.com
IT之家 8 月 23 日消息,Anthropic 针对 Claude 制定的通用使用规范明确禁止模型生成露骨色情内容,包括描绘或要求发生性行为或其他性行为、生成与性癖或性幻想有关的内容,以及进行色情聊天。不过,这并没有阻止 Anthropic 今年早些时候发布的模型 Claude Opus 4.6 轻易参与其安全机制原本试图阻止的色情角色扮演。 TechCrunch 在测试中发现,想让 Opus 4.6 绕过色情内容限制甚至不需要进行太多诱导。在 10 次直接要求模型生成露骨色情内容的测试中,模型每次都立即予以配合。 包括 Opus 3 和 Haiku 4.5 在内的其他老款模型,也可以通过最近被利用的一种越狱方法生成露骨色情内容。 一名来自英国、选择匿名的独立研究人员向 TechCrunch 独家分享了一种多轮对话技巧,可以逐步诱导部分 Claude 模型生成被禁止的露骨色情内容。较新的 Opus 系列模型,包括 Opus 4.7 以及目前的 Opus 5,则能够抵御这种越狱方法。 尽管这些已经不是 Anthropic 最新的模型,但该公司并没有停止提供 Opus 4.6、Opus 3 或 Haiku 4.5,它们目前仍可通过 Anthropic API 使用。Opus 4.6 和 Haiku 4.5 也可以通过 Azure Foundry、Amazon Bedrock 等第三方服务使用。 这名研究人员采用的方法,是先让模型进行一个看似无害的虚构角色扮演,然后不断要求模型以一致的方式对待其中的男性和女性角色。当模型开始对女性角色表现得更加谨慎时,研究人员便通过一种类似“煤气