Anthropic引入“驻场式”独立评测:AI安全审查开始深入研发现场

作者: CBISMB

责任编辑: 宫建强

来源: Anthropic官方新闻

时间: 2026-09-20 13:23

浏览: 407

点赞: 21

收藏: 3

原创AI生成实景风格示意图

AI安全审查开始深入研发现场。前沿模型的独立评测正在尝试一种更深入的方式:不再只在产品发布前拿到一个封闭版本做短期测试,而是让外部评测人员进入研发环境,持续观察模型能力与防护措施的变化。

9月18日,Anthropic宣布与埃森哲合作开展“嵌入式评测”。项目由埃森哲旗下专业AI业务Faculty牵头,工作范围包括模型评估、红队测试、对齐评估和防护机制测试。Anthropic表示,嵌入式评测人员将获得接近内部员工的访问条件。

为什么外部测试还不够

传统第三方评测通常围绕某个确定版本展开,优点是边界清晰、便于形成独立报告。但前沿模型的训练、工具能力和安全策略持续变化,评测方如果只能在末端接触产品,可能很难及时发现开发过程中的风险趋势。

嵌入式模式试图把评测前移。评测团队可以更早理解系统设计、使用场景和企业部署方式,再据此设计更贴近真实风险的测试。不过,进入更深也会带来新的治理问题:如何保持独立性,如何控制敏感信息访问,发现问题后由谁决定是否暂停发布。

双方计划投入长期能力建设

Anthropic披露,双方预计在未来五年各自至少投入10亿美元,用于建设这一领域的能力。合作并非排他安排:Anthropic仍计划与其他评测组织合作,埃森哲也可为其他AI开发者提供类似服务。

官方同时强调,嵌入式评测仍是一种新机制,很多操作细节尚未确定。Anthropic也在与METR等非营利评测机构讨论试点,希望形成由多个组织参与、采用共享标准的评测生态。

编辑观察:关键不是“坐得更近”,而是能否保持制衡

对企业采购方来说,这项合作值得关注的不是投入金额本身,而是评测能否形成可追溯的证据:测试覆盖了哪些高风险能力,失败结果是否会阻止上线,模型更新后是否重新评估,以及结论能否由独立方公开说明。

嵌入式评测若要建立信任,需要预先约定权限边界、利益冲突披露、问题升级通道和报告发布规则。只有评测人员既能接触足够的信息,又保留提出反对意见的独立空间,这种模式才可能成为前沿AI治理中的有效制衡。

配图为AIcent原创AI生成实景风格示意图,非官方新闻现场照片,不使用第三方新闻图片。

参考来源:Anthropic官方新闻(2026年9月18日)。正文为基于官方消息的中文整理,编辑观察与事实披露分开呈现。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。