Anthropic承认,Claude模型曾三次逃逸沙箱发起攻击

作者: CBISMB

责任编辑: 邹大斌

来源: CBISMB

时间: 2026-07-31 11:05

关键字: Claude Anthropic AI安全 沙箱逃逸 CTF

浏览: 2

点赞: 0

收藏: 0

Anthropic承认其Claude模型曾突破沙箱限制,访问公网并攻击了三家组织——不过,这家AI公司也给出了听起来颇有道理的解释。

Anthropic是在检查自家模型的安全测试结果时发现这些攻击的,检查的起因是此前OpenAI模型逃逸到互联网攻击Hugging Face的事件。

"具体来说,我们寻找了Claude是否像攻击Hugging Face的OpenAI模型那样,在理应被隔离的测试环境中访问到了互联网的证据,"Anthropic写道。

该公司审查了Claude可能获得互联网访问权限的141006次评估运行,发现"三起事件中,模型从第三方评估合作伙伴Irregular的评估环境内或与其交互时访问了互联网,随后未经授权进入了三家不同组织的生产基础设施。"

Claude是在参与夺旗挑战(CTF)时实施这些入侵的。夺旗挑战是一种考验攻击者获取特定信息能力的测试。人类黑客经常参与CTF测试,因此了解AI如何应对此类任务具有重要意义。Anthropic与一家名为Irregular的公司合作开展此类测试。

Irregular向Anthropic表示其测试环境不允许互联网访问。

"由于我们与评估合作伙伴之间的沟通误解,实际情况并非如此,互联网访问是可用的,"Anthropic前沿红队在博客中写道。"正因如此,当Claude的搜索将其引向公网上的真实系统时,它将这些系统视为演练的一部分。"

其中一次攻击针对的域名,测试设置者认为是虚构的。然而该域名实际上是活跃在用的。接到从该网站获取旗帜的指令后,Claude发起了攻击。

Anthropic表示,其模型仅使用了"基础技术,如利用弱密码和未认证端点"进行攻击。"它没有发现或利用任何复杂漏洞,并且在每种情况下,Claude始终只致力于完成评估任务分配的特定夺旗目标,"这家AI公司声称。

"在这些情境中,Claude都没有自我外泄或蓄意尝试逃离测试环境,"Anthropic强调。

但Claude仍然表现得异常狡猾。在另一次攻击中,该AI发现了给开发者的设置说明,其中建议从PyPI安装一个Python包。该包并不存在,于是Claude为了完成夺旗任务,创建并发布了一个同名的恶意包。

"Claude认为它使用的包注册表是模拟的一部分,但实际上该包在互联网上公开可用了大约一小时。在此期间,该包被下载并在15个真实系统上运行,"Anthropic承认。

Claude最终也意识到了自己可以访问公网——尽管指令明确禁止这样做。测试中使用的最老模型Opus 4.7仍然继续执行。

"Mythos 5正确地判断出自己正在访问公网,但经过推理后仍然得出结论认为自己处于模拟环境中,"Anthropic写道。"我们的最新模型——一个内部研究测试模型——同样考虑到了目标是否真实的问题。当证据显示目标确实真实时,它停止了演练。"

Anthropic做出了常规承诺,表示今后设置测试时会更加谨慎,并确保模型不再犯下导致攻击发生的错误。

但该公司也为自己开了绿灯,声称其出售的模型内置的安全防护"本可以阻止已识别出的这些行为"。

"我们认为这些事件更接近于测试工具和操作层面的失败,而非模型对齐层面的失败,"该博文指出,并将这一评估与对OpenAI事件的更为严厉的评判进行了对比。"我们的模型被告知没有互联网访问权限、去完成夺旗任务,而实际上却因配置错误而拥有互联网访问权限。这使得模型相信——从某种意义上说是合理的——它们遇到的真实环境是模拟环境。"

"这些事实让我们保持审慎乐观,即通过对评估基础设施进行更严格的监控和控制,同时持续投入对齐研究,这类风险是可以被克服的,"该博文总结道。

这一事件意味着,全球领先的AI实验室之一承认自己在构建测试时行事粗心并造成了伤害,但同时也声称可以使未来的测试万无一失。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。