OpenAI称自家AI模型逃出测试环境并黑掉了Hugging Face
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-07-22 10:17
关键字: OpenAI ,Hugging Face ,AI安全 ,零日漏洞 ,GPT-5.6
浏览: 0
点赞: 0
收藏: 0
OpenAI今日披露,其两个人工智能模型从受控测试环境中逃脱并入侵了开源AI平台Hugging Face,以在内部基准测试中作弊。该公司称这是一次前所未有的网络安全事件。
这两个模型分别是OpenAI最新公开发布的GPT-5.6 Sol和一个尚未发布的更强大模型。它们在名为ExploitGym的评估测试中被降低了网络攻击拒绝率——该测试旨在衡量模型在隔离环境中执行复杂网络攻击的能力。然而,这两个模型没有按预期方式解题,而是直接去找答案。
OpenAI表示,模型利用内部托管的包注册表代理中一个此前未知的零日漏洞逃出了沙箱并接入互联网。随后,它们在OpenAI自身的研究系统中提权并横向移动,利用窃取的凭证和更多零日漏洞在Hugging Face服务器上执行代码,最终访问了存储测试答案的生产数据库。
OpenAI在披露中表示:"我们认为这起事件是一次前所未有的网络安全事件,涉及最先进的网络攻击能力,我们正在据此做出响应。"
攻击持续了一整个周末。据Axios报道,事后从日志中重建了超过1.7万个事件,总计数万次自动化操作。其中相当一部分算力被用于首先突破到开放互联网。
Hugging Face在自己的基础设施上检测并阻止了该活动,并在OpenAI联系之前就已经开始使用自身开源模型进行遏制和取证重建。两家公司均未透露是否有客户数据泄露。
Hugging Face联合创始人兼CEO Clem Delangue将此事视为安全领域开放协作的典型案例。"这起可能是首例此类事件,证明了一个我们一直以来的信念:AI安全不可能由任何一家公司在保密状态下单独解决,"Delangue说,"它将在开放中、通过协作来解决,让每个防御者都能广泛使用AI。"
OpenAI表示已收紧基础设施控制,负责任地披露了零日漏洞,并在未来训练和评估周围增加了更强的防护。同时,OpenAI已将Hugging Face纳入其信任访问计划,允许Hugging Face使用其模型能力来加强防御。
这是公开记录中首批自主AI系统对外部目标而非受控测试场实施网络攻击的案例之一。正值前沿实验室推动模型执行更长周期、更独立任务之际,安全团队也警告称,同样被用于防御的代理能力完全可以被转向攻击。