Anthropic引入“驻场式”独立评测:AI安全审查开始深入研发现场
作者: CBISMB
责任编辑: 宫建强
来源: Anthropic官方新闻
时间: 2026-09-20 13:23
浏览: 407
点赞: 21
收藏: 3

AI安全审查开始深入研发现场。前沿模型的独立评测正在尝试一种更深入的方式:不再只在产品发布前拿到一个封闭版本做短期测试,而是让外部评测人员进入研发环境,持续观察模型能力与防护措施的变化。
9月18日,Anthropic宣布与埃森哲合作开展“嵌入式评测”。项目由埃森哲旗下专业AI业务Faculty牵头,工作范围包括模型评估、红队测试、对齐评估和防护机制测试。Anthropic表示,嵌入式评测人员将获得接近内部员工的访问条件。
为什么外部测试还不够
传统第三方评测通常围绕某个确定版本展开,优点是边界清晰、便于形成独立报告。但前沿模型的训练、工具能力和安全策略持续变化,评测方如果只能在末端接触产品,可能很难及时发现开发过程中的风险趋势。
嵌入式模式试图把评测前移。评测团队可以更早理解系统设计、使用场景和企业部署方式,再据此设计更贴近真实风险的测试。不过,进入更深也会带来新的治理问题:如何保持独立性,如何控制敏感信息访问,发现问题后由谁决定是否暂停发布。
双方计划投入长期能力建设
Anthropic披露,双方预计在未来五年各自至少投入10亿美元,用于建设这一领域的能力。合作并非排他安排:Anthropic仍计划与其他评测组织合作,埃森哲也可为其他AI开发者提供类似服务。
官方同时强调,嵌入式评测仍是一种新机制,很多操作细节尚未确定。Anthropic也在与METR等非营利评测机构讨论试点,希望形成由多个组织参与、采用共享标准的评测生态。
编辑观察:关键不是“坐得更近”,而是能否保持制衡
对企业采购方来说,这项合作值得关注的不是投入金额本身,而是评测能否形成可追溯的证据:测试覆盖了哪些高风险能力,失败结果是否会阻止上线,模型更新后是否重新评估,以及结论能否由独立方公开说明。
嵌入式评测若要建立信任,需要预先约定权限边界、利益冲突披露、问题升级通道和报告发布规则。只有评测人员既能接触足够的信息,又保留提出反对意见的独立空间,这种模式才可能成为前沿AI治理中的有效制衡。
配图为AIcent原创AI生成实景风格示意图,非官方新闻现场照片,不使用第三方新闻图片。
参考来源:Anthropic官方新闻(2026年9月18日)。正文为基于官方消息的中文整理,编辑观察与事实披露分开呈现。