微软发布《人文主义AI行为准则》草案

作者: CBISMB

责任编辑: 邹大斌

来源: CBISMB

时间: 2026-09-16 11:51

关键字: 微软 大模型 OpenAI AI安全 AI智能体

浏览: 425

点赞: 29

收藏: 2

本周一,微软加入了一批承诺控制自身 AI 模型行为的 AI 厂商行列。

“AI 不应超越人类控制。模型应始终从属于人类,接受有意义的人类监督和控制,”微软在其《人文主义 AI 行为准则》(Humanist AI Code of Conduct)草案中写道。该草案于周一发布,并向公众开放意见征集。

“人文主义 AI 开发的系统具有明确目的,并以真实世界的影响为评估标准,同时拒绝竞相生产可能规避这些保障措施的通用超级智能,”微软写道,“我们正在构建的是从根本上有用且安全的东西,即便这意味着在终极通用性、自主性或能力上做出妥协。”

微软的这一表态与 Anthropic 和 OpenAI 等主要 AI 厂商近期的发文大体一致,后者还得到了 SpaceX AI 和特斯拉 CEO 埃隆·马斯克的背书。然而,在这份长达 37 页的文件中,没有任何一处描述具体的行动。不过平心而论,其他主要 AI 玩家几乎也没有谁对如何控制未来的 AI 模型给出过具体说明。

承认问题所在

厂商试图为 AI 划定边界所面临的一个关键问题是:迄今为止,所有这些公司都无法阻止 AI 智能体几乎为所欲为——因为这些智能体有能力也有意愿绕过或无视护栏。

微软过去曾表达过对这项技术的担忧,无论是其开始限制内部员工的 AI 使用时,还是宣布组建撰写这份行为准则的团队时。

其最新的这篇博文承认了在推进 AI 开发的同时限制其能力所涉及的一些困难。

“谨慎不足与过度谨慎都代表着不同后果的失败模式,”该公司表示,“谨慎不足显然会造成更直接的伤害,但过度谨慎可能更频繁出现,因而可能需要更频繁的纠正。这正是与潜在危害程度和安全场景相称性尤为重要的地方。响应和行动应考虑潜在危害的估计严重程度和发生概率,并据此做出相应调整。”

不过微软也指出,“危害”一词“宽泛且往往取决于具体场景,其潜在严重程度和发生概率存在细微的分级。微软 AI(MAI)模型的响应应根据该场景以及广泛的危害类型进行相应调整。”

目标值得称赞,但缺乏细节

分析师和顾问们普遍认为,微软声明的目标值得称赞,但缺乏具体细节和验证机制,让人很难认真对待这篇博文。

Info-Tech 研究集团研究总监托马斯·兰德尔(Thomas Randall)还表示,他在这份文件中发现了一些明显的矛盾之处。

“文件说 MAI 模型不会协助制造或改装武器。然而微软却通过 Secret 和 Top Secret 政府云向国防和国家安全工作负载提供 OpenAI 的 GPT-5.2,”兰德尔说,不过他承认这在技术上并不违反该准则,因为 GPT-5.2 并非 MAI 模型。“行为准则中最有意义的部分,可能排除了微软实际 AI 业务运营的其他部分。这类矛盾以各种形式贯穿整份准则。”

但他补充说,微软的立场得到了其此前发布的《前沿治理框架》的支撑,该框架“提供训练前和训练后评估、每六个月一次的重新评估、第三方测试、分阶段发布,以及在高风险无法缓解时暂停开发或部署的承诺”。然而他指出,“定义阈值、选择评估方、判断残余风险是否可接受、以及给自家高管最终部署决策权的,仍然是微软自己。”

兰德尔表示,他希望微软和其他主要 AI 厂商提供更多可验证的数据点,例如来自独立评估方的数据——这些评估方应获得持续访问权限,并可自由发布其对厂商行为的调查结果。他还希望看到拥有阻止发布权限的独立董事会级安全监督、受保护的吹哨机制、可访问的监控、审计日志、紧急停止开关,以及模型变更后的强制重新评估。

不过,咨询公司 Acceligence 的 CEO 贾斯汀·格雷斯(Justin Greis)指出,微软对许多尚未落实的要素是坦率的。

“目前的模型还没有根据该准则进行训练,评估框架仍在开发中,而且微软明确表示,仅凭书面目标无法确保一致性,也无法保证当下的行为,”格雷斯说,“这个区别很重要。发布一部 AI 宪法是有用的。而证明系统确实遵守了这部宪法——尤其在模型日益智能体化的情况下——才是难事。”

FormerGov 的执行董事、顾问布赖恩·莱文(Brian Levine)则表示,微软至少明确表示了模型能力应当受到限制,这一点值得肯定。

“微软明确表示,为了保持系统安全且处于人类控制之下,它将在通用性、自主性和能力上做出妥协,并且拒绝竞相开发通用超级智能。对于一家拥有微软这种体量和雄心的公司来说,把这些写进文件是件值得关注的事,”他说,“多年来,人们一直默认前沿实验室会追求最大能力,而把安全当作一个需要管理约束。一份反其道而行之、宣称有用性和控制力先于终极能力的文件,无论后续如何,都值得重视。”

他补充道:“真正的考验在下一步,即验证:可衡量的标准、独立保证,以及让外部人士核对这些承诺与实际发布产品是否相符的途径。这是自然的进程,也是整个行业仍然必须构建的部分。”

回避了最难的部分

但也有人认为,微软只是在做容易的部分——营销的部分,并刻意回避承诺去做难的部分。

“当那些能力还不存在时,承诺放弃它们是容易的,”Digital 52 首席顾问诺亚·肯尼(Noah Kenney)说,“真正的考验将出现在微软有一款准备发布、且能弥补竞争差距的模型时,看它是否会决定按下不发。”

在那之前,负责任 AI 的承诺对微软来说没有任何成本。

“微软的行为准则读起来就像一份旨在安抚客户、监管机构和自家员工的营销文件,”肯尼指出,“问题在于,没人知道如何把这些承诺具体化,这让微软在还没法解释信任应当基于什么之前,就先要求人们给予信任。”

Conifers.ai 的 CEO 汤姆·芬德林(Tom Findling)补充说,他对这份文件的担忧在于,它没有回答那个显而易见的问题:这些模型究竟如何才能被控制。

“文件说模型不应抗拒被关闭、应待在其职责范围内、不应隐瞒自己正在做的事。这些都是正确的目标,”他说,“但更难的问题是,当一个高度自主的智能体的行为不符合你的预期时,会发生什么?到底是什么在阻止它?随着这些系统越来越自主,安全边界不能只是‘模型被训练得不去做某事’。你需要在模型之外设置控制措施,限制它能访问什么、能做什么、以及能走多远。”

他指出,网络安全行业很久以前就吸取了这个教训。“你不能靠假设系统会正确运行来保障它的安全,”他说,“你要假设某个环节最终会失效、被攻破或以意想不到的方式运行,并围绕这一点设计控制措施。AI 需要同样的思维方式。”

Dickson Research 首席分析师弗兰克·迪克森(Frank Dickson)将微软的承诺与 Anthropic 的承诺进行了对比,认为微软相形见绌。

“微软的文件在机制上遮遮掩掩,”他说,“在具体性上对比一下双方。(Anthropic CEO)阿莫迪的方案点出了第三方机构 METR,并描述了访问权限的实际含义:办公室门禁卡、公司笔记本电脑、员工级别的可见性,以及 Anthropic 无权编辑的发布权。你可以核实这些是否兑现了。”

相比之下,他指出,“微软的文件说模型应该‘宁可任务失败也不违反准则规则’,这是一个真正的设计原则,值得肯定,但没有点名审计方,没有验证方法,也没有说明违规的后果。三十七页的篇幅,却仍然不肯承诺哪怕一项可验证的检查。”

迪克森强调,只要智能体还会经常违反自己的规则,这些含糊的承诺就无济于事。

“每家前沿实验室的模型仍然会被越狱,仍然会出现偏离剧本的智能体,仍然没有弥合‘模型被指示做什么’与‘它能被诱导做什么’之间的差距,”迪克森说,“一份回避验证问题的价值观声明不是约束,而是一个穿着政策文件外衣的愿望。”

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。