Anthropic发布Claude Opus 5:更低成本逼近旗舰性能,安全大幅提升
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-07-27 11:02
关键字: LLM ,Anthropic ,AI安全 ,Claude Opus 5 ,蛋白质研究
浏览: 0
点赞: 0
收藏: 0
Anthropic公司推出了一款名为Claude Opus 5的大型语言模型。
该公司表示,这款LLM在多个领域的输出质量已接近其顶级Mythos 5算法,但成本大幅降低。
Anthropic尚未将Mythos 5向公众开放,而是销售该LLM缩小版Fable 5的访问权限。Fable 5共享了Mythos 5的许多功能,但网络安全风险较小。Anthropic在13项基准测试中对比了Fable 5和Opus 5,结果显示后者在8项测试中得分更高,而成本却低了约50%。
自我验证与科学突破
Opus 5的优势在Frontier-Bench和AutomationBench两项基准测试中尤为突出。前者包含74个涵盖物理、化学和密码学等领域的任务,Opus 5的表现比Fable 5高出9.7%。在包含一系列知识工作任务的AutomationBench上,Opus 5的得分高出8.5%。
Opus 5性能出色的一大原因是它会自我验证工作成果。Frontier-Bench测试曾要求模型生成一个三维机械零件图纸,而Opus 5无法直接查看图纸,这意味着无从验证其准确性。该模型的解决方案是写入一个"计算机视觉管道,从原始像素中提取几何信息"。
Opus 5的输出验证功能同样适用于生物学研究。据Anthropic称,该模型在全部内部生命科学基准测试中的表现都优于早期LLM Opus 4.8。Opus 5在自动化蛋白质研究方面表现尤为突出,而这一重要领域正是2024年诺贝尔化学奖的焦点。
安全性与防护栏
Anthropic表示,从多个指标来看,Opus 5是迄今为止最安全的模型。相比前代产品,该LLM更少出现欺骗行为,也更少犯下难以逆转的错误。
出于对黑客可能利用其发动网络攻击的担忧,Anthropic未将旗舰模型Mythos 5公开。该模型不仅能发现漏洞,还能制定利用漏洞的工作流程。相比之下,Opus 5在Anthropic内部一项评估LLM漏洞利用能力的基准测试中得分为零。
该公司为Opus 5配备了比Fable 5更宽松的防护栏。客户可以使用Opus 5搜索代码中的安全问题,但它会阻止黑客常用的漏洞扫描方法。Anthropic估计其防护栏的触发频率将比Fable 5降低85%。
开发者API升级
Opus 5现已成为Claude聊天机器人服务最高端Max层级的默认模型,同时也在中端Pro计划中可用。
开发者可通过Anthropic的API将Opus 5集成到自己的软件中。作为此次更新的一部分,该API新增了一项功能,可在LLM工作流程执行到一半时中断它并更换其使用的工具。另一项新能力则可以将被Anthropic安全防护栏拦截的提示重路由到其他模型。