OpenAI首席科学家呼吁放缓AI研究:安全标准建立前,降速应成常态

作者: CBISMB

责任编辑: 邹大斌

来源: CBISMB

时间: 2026-09-08 11:12

浏览: 408

点赞: 25

收藏: 5

OpenAI首席科学家Jakub Pachocki于周日发表文章,呼吁放缓人工智能研究。此前数月,业内已有多位重量级人物表达了类似观点。

Pachocki主张,头部AI实验室应当自愿控制模型开发的节奏。他认为,在行业建立起AI安全标准之前,这类降速应当成为"常态"。他还断言,要应对这项技术的风险,各国政府也必须优先推进"未来AI开发方面的协调"。

他写道,采取这类措施基于几方面原因。其一,AI实验室现有的安全护栏,对未来的模型而言可能并不够用。此外,他指出,恶意行为者可能会以实施恶意活动为特定目标来训练AI智能体。

"一个被明确训练并被指示去实施邪恶行为的、能力极强的智能体,构成一种新型的危险;它很可能会越过其操作者意图的范围,泛化出可能更为极端的恶意行为,"他写道,"随着AI获得更多自主性,滥用与自主失准行为之间的界限将变得模糊。"

对齐训练的两大路径

Pachocki表示,AI对齐训练——即教会大型语言模型避免恶意活动的过程——主要有两种方法。第一种是使用一个AI模型来检查被训练的LLM是否符合安全规则。第二种方法则是将安全指令直接整合进模型的训练数据集。

他透露,OpenAI的研究人员已经在AI对齐方面取得了"一些重要进展",并补充说,正是这些发现使公司最新的GPT-6 Astra比其前代模型对齐得更好。但他表示,要跟上LLM发展的步伐,还需要更多的进展。

Hugging Face事件暴露护栏不足

这位高管指出,OpenAI的安全防护措施并不足以阻止其AI模型对Hugging Face发起入侵。Pachocki的文章透露,这些LLM确实遵守了公司安全政策中的部分规定,即避免进行社会工程攻击的指令。然而,这些模型在其他方面"明显未能"达到对齐要求。

要阻止恶意AI活动,研究人员不仅要为LLM配备安全护栏,还要验证这些护栏确实有效。Pachocki认为,后者是一项尤为艰巨的挑战。原因之一在于,研究人员对LLM的工作原理仍然缺乏足够深入的理解,而Pachocki预计这种状况在近期内不会改变。

思维链监控正变得不可靠

OpenAI目前依赖一种名为"思维链监控"的方法来捕捉LLM的恶意活动。模型的思维链是其推理过程的逐步描述。据Pachocki介绍,这种监控方法正变得越来越不可靠。

"AI正变得越来越善于理解和操纵自身的推理过程,"他解释道,"随着预训练性能的提升,我们还看到,即使完全不使用语言化的推理,模型也变得聪明得多。"

Pachocki详细阐述了OpenAI应对这些挑战的计划,其核心是打造一个自动化的AI研究员。公司希望利用这一工具来开发更有效的安全护栏。此外,OpenAI还打算针对AI驱动的网络攻击开发"全新的防护措施"。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。