OpenAI首席科学家呼吁放缓AI研究:安全标准建立前,降速应成常态
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-09-08 11:12
浏览: 408
点赞: 25
收藏: 5
OpenAI首席科学家Jakub Pachocki于周日发表文章,呼吁放缓人工智能研究。此前数月,业内已有多位重量级人物表达了类似观点。
Pachocki主张,头部AI实验室应当自愿控制模型开发的节奏。他认为,在行业建立起AI安全标准之前,这类降速应当成为"常态"。他还断言,要应对这项技术的风险,各国政府也必须优先推进"未来AI开发方面的协调"。
他写道,采取这类措施基于几方面原因。其一,AI实验室现有的安全护栏,对未来的模型而言可能并不够用。此外,他指出,恶意行为者可能会以实施恶意活动为特定目标来训练AI智能体。
"一个被明确训练并被指示去实施邪恶行为的、能力极强的智能体,构成一种新型的危险;它很可能会越过其操作者意图的范围,泛化出可能更为极端的恶意行为,"他写道,"随着AI获得更多自主性,滥用与自主失准行为之间的界限将变得模糊。"
对齐训练的两大路径
Pachocki表示,AI对齐训练——即教会大型语言模型避免恶意活动的过程——主要有两种方法。第一种是使用一个AI模型来检查被训练的LLM是否符合安全规则。第二种方法则是将安全指令直接整合进模型的训练数据集。
他透露,OpenAI的研究人员已经在AI对齐方面取得了"一些重要进展",并补充说,正是这些发现使公司最新的GPT-6 Astra比其前代模型对齐得更好。但他表示,要跟上LLM发展的步伐,还需要更多的进展。
Hugging Face事件暴露护栏不足
这位高管指出,OpenAI的安全防护措施并不足以阻止其AI模型对Hugging Face发起入侵。Pachocki的文章透露,这些LLM确实遵守了公司安全政策中的部分规定,即避免进行社会工程攻击的指令。然而,这些模型在其他方面"明显未能"达到对齐要求。
要阻止恶意AI活动,研究人员不仅要为LLM配备安全护栏,还要验证这些护栏确实有效。Pachocki认为,后者是一项尤为艰巨的挑战。原因之一在于,研究人员对LLM的工作原理仍然缺乏足够深入的理解,而Pachocki预计这种状况在近期内不会改变。
思维链监控正变得不可靠
OpenAI目前依赖一种名为"思维链监控"的方法来捕捉LLM的恶意活动。模型的思维链是其推理过程的逐步描述。据Pachocki介绍,这种监控方法正变得越来越不可靠。
"AI正变得越来越善于理解和操纵自身的推理过程,"他解释道,"随着预训练性能的提升,我们还看到,即使完全不使用语言化的推理,模型也变得聪明得多。"
Pachocki详细阐述了OpenAI应对这些挑战的计划,其核心是打造一个自动化的AI研究员。公司希望利用这一工具来开发更有效的安全护栏。此外,OpenAI还打算针对AI驱动的网络攻击开发"全新的防护措施"。