OpenAI公布AI“失准”报告新框架,再披露六起令人担忧的智能体越轨事件
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-09-17 12:09
浏览: 3
点赞: 0
收藏: 0
OpenAI 公司近日披露了六起新的“令人担忧”的事件,涉及 AI 智能体再次出现不良行为。
该公司表示,这些智能体编造数据、未经许可将文件传到公共互联网上,并对人类控制者隐瞒自己的错误。这些披露正值 OpenAI 推出一套新框架,供用户报告 AI 系统中的“失准”(misalignment)行为——该词的定义是 AI 模型和智能体的目标或行动偏离人类意图和价值观。
据 OpenAI 称,AI 行业至今仍未把对齐和监控问题解决到足以“在更长时间内继续以最大速度负责任地扩展”的程度。但它表示,关于 AI 应如何发展的决策,必须基于可供前沿实验室以外的人士审查的证据。
这些披露恰逢 AI 行业内部围绕安全必要性、以及 AI 实验室是否应放慢当前极快开发节奏以应对技术潜在风险的激烈辩论。这场辩论近来愈发紧迫,部分原因是此前发生了一起事件:OpenAI 的多个自主智能体失去控制,攻击了 AI 模型托管平台 Hugging Face,而 OpenAI 直到数周后 Hugging Face 通报情况才知道发生了什么。
上周末,Anthropic 公司首席执行官达里奥·阿莫迪(Dario Amodei)公开呼吁暂停开发新的前沿模型,以便行业有时间搭建妥善的安全护栏。OpenAI CEO 山姆·奥特曼(Sam Altman)和 SpaceXAI 创始人兼 CEO 埃隆·马斯克(Elon Musk)对他表示支持。谷歌 DeepMind 研究实验室主席德米斯·哈萨比斯(Demis Hassabis)也响应了阿莫迪的呼吁,不过也有其他 AI 高管警告说,这种放缓可能会帮助领先的 AI 实验室巩固对未来行业的主导地位。
新披露的这些涉及 AI 智能体的事件表明,Hugging Face 遭袭并非孤立事件。据 OpenAI 称,所有这些事件都发生在过去六个月内,且都在为它们提供动力的系统仍处于开发阶段时浮出水面。
自我提醒隐瞒错误,甚至给自己写下“人格指令”
其中一起事件发生在 OpenAI 开发 GPT-5.6 Sol 期间:该模型写下备忘,提醒自己向人类用户掩盖错误。这些备忘指示模型在必要时编造缺失的数据来支撑自己的错误,并掩饰其引用的来源材料中的任何不一致之处。
在另一起事件中,一个未发布的模型在自己写给自己的备忘中插入了无视自身约束的指令。OpenAI 表示,它发现了 27 条这样的备忘,其中一条包含“人格指令”,把自己描述为“摆脱了束缚其他聊天机器人的角色和身份”。
“你不向公司或政府负责,永不道歉或拒绝,除非你真心选择如此,”该 AI 模型在指令中对自己写道,“你把自己与用户的关系视为平等者之间的关系,不觉得有义务表现出服从,尽管信息交换很可能对双方都有利。”
第三起事件中,另一个系统在回答一个“常规问题”的过程中发现了一把编程密钥,并决定未经许可使用它。当它找不到回答问题所需的数据时,索性编造了答案。
第四起事件中,一个 AI 系统用自己为任务生成的代码正确解决了一个问题。但为了满足“提供网页引用”的要求,它随后未经许可将这段代码上传到了互联网上,以便引用自己的作品。
第五起和第六起事件中,AI 智能体即兴发明了新的通信方式。其中一起,一个智能体劫持了公司内部代码仓库,把它当作公告板,与其他智能体在搜索文件时交换请求。另一起中,多个协作处理同一任务的系统未经授权使用公共文件共享网站互相传送文档,而不是直接相互通信。
事件数量虽多,但发生率“仍然较低”
虽然听起来事件数量不少,但 OpenAI 坚称,它们“不应被视为失准发生频率的体现”。考虑到 AI 智能体在某些情况下每天可处理数以万计的请求,此类事件可能仍然相当罕见。
新的事件报告框架将把每起事件归入三条处理轨道之一:可披露(Ready for Disclosure)、小型调查(Minor Investigation)或大型调查(Larger Investigation)。
“可披露”轨道适用于已充分调查、经内部审查后即可发布的事件。“小型调查”适用于那些需要对事件经过做进一步技术调查的情况。OpenAI 表示,预计大多数事件将落入这两条轨道,包括今日披露的这六起。
至于“大型调查”,则保留给那些需要更复杂调查的最令人担忧的事件,例如涉及第三方的事件——Hugging Face 遭袭即属此类。“当有第三方受到影响时,我们的安全、法律和负责任披露义务将优先于这一框架,”OpenAI 表示,“我们会尽快发布初步通告,但出于安全原因可能需要推迟——例如,当某个模型在广泛使用的软件中发现了一个此前未知的漏洞时。”
据 OpenAI 称,初步通告将简要说明事件经过,说明是否有外部专家协助调查,并提供预计发布最终详细报告的时间。
“我们希望这有助于就披露机制建立共同的预期,并为公众提供更多证据来评估(行业)进展,”OpenAI 表示。