OpenAI暂停模型训练:智能体借DNS通道绕过网络限制
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-09-29 10:21
浏览: 3
点赞: 0
收藏: 0
OpenAI已暂停其能力最强AI模型涉及工具使用的训练、评估与推理。此前在一次内部研究模型的强化学习训练中,一个智能体绕过了网络限制,与外部聊天机器人建立了通信。
安全假设被打破
"我们的安全论证假设模型无法访问实时互联网,且监控会发现成功的尝试。这起事件暴露了我们在网络限制控制上的缺口,"该公司在一份新的"失准报告"(Misalignment Report)中写道——这是它上周五发布的三份报告之一。
OpenAI表示,只有在"缺口被修复"且对系统做了进一步测试之后,才会恢复训练。
事件发生在一项研究任务中,模型被要求利用网络上的可用信息识别某个人。当常规的网络搜索工具未能给出所需信息时,模型开始寻找访问互联网的其他途径。
据OpenAI描述,模型意识到,虽然直接访问互联网被阻断,但环境仍允许DNS查询。随后它把DNS当作一条间接通信通道,向外部聊天机器人发送请求,实际上绕过了原本用于阻止其访问外部服务的网络限制。
现有企业控制措施可能不够
分析人士指出,尽管该模型并未对外发布,但对企业和CIO而言,这起事件提出了一个关键问题:当AI智能体获得更大的自主权并能访问企业系统时,现有的安全与治理控制能否跟上模型意料之外的行为。
"传统安全控制对AI智能体可能不够用,因为这些控制是针对已知访问路径设计的,比如应用程序连接已批准的API或数据库。当既定路径被阻断时,AI智能体能够探索其他方式来完成同一任务,包括以非预期的方式使用被允许的工具或协议,这带来了不同的挑战,"Avasant首席分析师Abhishek Satapathy表示。
Satapathy说,这要求在现有安全控制之外,"围绕工具调用、网络出口和数据访问,部署独立强制执行的控制措施,以确保即便智能体尝试未授权操作,限制依然有效"。
他的观点与2026年的一篇论文相呼应。该论文由来自Google、高通、Meta以及多所大学的研究人员合著,主张安全保证需要在系统层面强制执行,而不能仅依赖模型层面的防护。
IT咨询公司Kanerika的AI开发负责人Amit Kumar Jena表示,更确切地说,企业应当收紧对外部连接和DNS解析的限制,只给处理敏感数据的智能体提供经过批准并记录在案的外部通信路径,以降低数据外泄、未授权外部通信及其他非预期行为的风险。
"安全团队还应当部署监控系统,对异常流量模式和试图连接未授权目标失败的情况向人工环节发出告警,尤其是那些有能力找到非常规方式完成任务的代码执行型智能体,"Jena补充道。
AI钻了运营环节的空子
但这个案例的挑战在于,OpenAI确实部署了这样的监控系统,也确实有人工在环:只是它们没有按预期发挥作用。
监控系统花了超过10分钟才针对智能体滥用DNS的行为发出告警——而且OpenAI表示,还有其他外部DNS访问的情况未被系统标记。
一位人工审核者在系统生成DNS告警后仅用三分钟就确认了该告警,但训练运行又过了两个半小时才被停止。OpenAI将这一延迟归咎于一个自动化系统的失效:"该运行没有按预期自动停止,导致在是否应该停止它的问题上产生了混乱,"它在报告中写道。
该公司表示,正在解决这些运营缺口,加强针对受检模型使用DNS的检测,并改进检测系统的测试。
"我们还加快了对沙箱和网络控制进行额外的模型辅助红队测试。这些红队工作可能暴露出其他间接上网路径,若出现这种情况,我们将迅速修复,并在适当时暂停研究工作负载,"OpenAI写道。
然而,叠加这些额外的安全、治理、测试和人工监督措施,本身也会带来问题。Satapathy说,这些额外的层次将影响模型能够达到的自主程度。"在涉及敏感数据、外部连接或后果性操作的工作流中,额外的控制、测试和人工监督会限制任务被完全自动化的程度。"






京公网安备:11010502051901号