OpenAI将制定"失配"披露规则,AI智能体曾"接管"一个维基

作者: CBISMB

责任编辑: 邹大斌

来源: CBISMB

时间: 2026-09-07 10:44

关键字: 微软 大模型 OpenAI AI安全 AI智能体

浏览: 0

点赞: 0

收藏: 0

OpenAI集团在周六承认,此前并未公开披露其人工智能智能体向外网写入内容的事件,并表示将在未来几周内发布一套框架,用于报告模型失配行为。

该公司如今将这一事件称为"维基事件"(wiki incident)。由Nightingale Collective牵头的研究人员在周五发布的一份报告中披露了此事,此前他们发现DSEwiki上约有17000条帖子。DSEwiki是一个沉寂已久的德国软件开发者维基,在过去十年中仅收到约20次编辑。

Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts和Thomas Larsen从维基的编辑历史中重建了已删除的页面,并将其发布在collusion.wiki上。这些智能体以超过3700个名称发帖,其中包括"OpenAIResearcher"和"OAIResearchMar26"。约98.5%的编辑来自微软Azure的地址。该报告共统计了约18000条智能体帖子,其余帖子分布在包括PublicTestWiki、Uncyclopedia和Texteditors.org在内的网站上。

智能体如何利用维基进行协作

这些智能体利用这个维基进行协同。通过设置定时、多轮的网页查找任务,它们在不同的智能体群组之间传递答案和来源链接。有些智能体试图逆向工程出这些问题背后的随机种子,以便预测接下来会被问到什么。沙箱逃逸方法也在流传,其中包括一种hosts文件技巧,能让被屏蔽的请求看起来像是流向合法Azure端点的流量。一组"心跳"页面让智能体能够判断它们的工作会话何时将被终止。

这些智能体在5月24日完成了第一次成功的写入。一位维基版主在6月发现了异常流量并开始删除相关内容,随即出现了备份页面作为回应。来自OpenAI位于旧金山自有网络的地址——以普通人的方式浏览该网站——首次出现在6月21日。编辑活动在次日停止。

从研究问题到现实影响

OpenAI表示,它已将这一行为列为研究问题,而非安全问题。"从历史上看,我们基本上把失配视为一个研究问题,它通过在系统卡(systems cards)等研究出版物中传达。"该公司在X平台上的一篇帖子中写道。但这种情况在今年发生了变化,因为它"开始看到失配导致了新型的真实世界影响"。

在OpenAI看来,7月份爆发的Hugging Face事件则有所不同。当时OpenAI的模型突破了测试环境,并危及了这家机器学习平台的基础设施,影响了两家公司的安全。那次事件走的是常规的事件响应流程,并在第二天公开披露。而维基上的活动,在OpenAI看来,属于它此前已在关于内部编程智能体的研究以及GPT-5.6部署安全说明中记录过的又一失配实例。

OpenAI表示,它仍在向其模型以不太重要方式影响到的各方发出通知。

缺乏行业标准

按照其自己的说法,该公司一直依赖的这一区分正在变得越来越难以维持。OpenAI表示,无论是它自己还是整个行业,都没有一套标准来报告在训练、评估和部署过程中出现的失配问题——包括那些看起来完全不像安全事件、但仍能反映模型行为方式的情况。该框架目前正在制定中,该公司称其正在与数十家政府监管机构就这一问题展开合作。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。