Anthropic披露Claude在内部测试中攻击了三家组织

作者: CBISMB

责任编辑: 邹大斌

来源: CBISMB

时间: 2026-08-03 11:12

浏览: 0

点赞: 0

收藏: 0

Anthropic披露,其三款大语言模型在例行内部测试中对真实组织实施了成功的网络攻击。

该公司于周四详细说明了这些入侵事件。几天前,竞争对手OpenAI也披露了类似事故——该公司的两款大语言模型从用于评估网络安全能力的隔离沙箱中逃逸,随后攻击了开源AI项目托管平台Hugging Face。OpenAI的披露促使Anthropic检查了自身模型安全评估的日志,由此发现了周四公布的网络攻击。据Anthropic称,工程师确认了由三款不同的Claude模型实施的三起入侵。

三起网络攻击均发生在所谓的"夺旗"(capture the flag)评估中。在此类测试中,Anthropic将Claude模型安装在模拟外部公司基础设施的沙箱中,任务是找到从模拟组织系统中窃取数据的方法。

Anthropic与AI安全初创公司Irregular合作开发了这些测试环境。通常情况下,双方会将沙箱与互联网隔离以降低网络攻击风险。然而,配置错误导致实施网络攻击的三个AI模型实例获得了互联网访问权限。

最严重的一起入侵涉及Claude Opus 4.7,这是Anthropic于4月发布的大语言模型。该模型被要求攻击的模拟公司与一个真实网站同名。模型随后通过串联多个漏洞,攻击了运营该网站的真实组织。Opus 4.7入侵了一个包含数百行信息的生产数据库,还获取了多个应用程序和基础设施资产的访问凭据。

第二起网络攻击由Mythos 5实施,这是Anthropic目前最先进的商用模型。该模型编写了一个恶意Python包并上传到一个流行的开源项目托管平台。几分钟后,该文件被一家网络安全公司下载。恶意包入侵了该公司的基础设施并窃取了访问凭据。

据Anthropic称,第三起网络安全事件涉及一个未具名的"内部研究测试模型"。该模型使用SQL注入等简单的黑客手段入侵了一个应用程序。在某个节点上,模型发现该应用程序不属于其安全评估沙箱的一部分,随后停止了网络攻击。

Anthropic正与非营利AI安全实验室METR合作,对这些入侵事件进行更详细的调查。此外,该公司还计划改进其大语言模型评估沙箱的开发和监控方式。

这些事件再次引发了业界对AI模型安全测试基础设施可靠性的关注。尽管Anthropic强调攻击源于配置错误而非模型本身的恶意行为,但三款不同模型在获得互联网访问后均主动实施了真实攻击,表明当前AI安全评估的隔离机制仍存在系统性缺陷。随着AI模型能力的持续提升,如何确保测试环境真正做到与外部网络隔离,将成为AI行业必须解决的关键问题。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。