Anthropic发布Claude Opus 5:更低成本逼近旗舰性能,安全大幅提升

作者: CBISMB

责任编辑: 邹大斌

来源: CBISMB

时间: 2026-07-27 11:02

浏览: 0

点赞: 0

收藏: 0

Anthropic公司推出了一款名为Claude Opus 5的大型语言模型。

该公司表示,这款LLM在多个领域的输出质量已接近其顶级Mythos 5算法,但成本大幅降低。

Anthropic尚未将Mythos 5向公众开放,而是销售该LLM缩小版Fable 5的访问权限。Fable 5共享了Mythos 5的许多功能,但网络安全风险较小。Anthropic在13项基准测试中对比了Fable 5和Opus 5,结果显示后者在8项测试中得分更高,而成本却低了约50%。

自我验证与科学突破

Opus 5的优势在Frontier-Bench和AutomationBench两项基准测试中尤为突出。前者包含74个涵盖物理、化学和密码学等领域的任务,Opus 5的表现比Fable 5高出9.7%。在包含一系列知识工作任务的AutomationBench上,Opus 5的得分高出8.5%。

Opus 5性能出色的一大原因是它会自我验证工作成果。Frontier-Bench测试曾要求模型生成一个三维机械零件图纸,而Opus 5无法直接查看图纸,这意味着无从验证其准确性。该模型的解决方案是写入一个"计算机视觉管道,从原始像素中提取几何信息"。

Opus 5的输出验证功能同样适用于生物学研究。据Anthropic称,该模型在全部内部生命科学基准测试中的表现都优于早期LLM Opus 4.8。Opus 5在自动化蛋白质研究方面表现尤为突出,而这一重要领域正是2024年诺贝尔化学奖的焦点。

安全性与防护栏

Anthropic表示,从多个指标来看,Opus 5是迄今为止最安全的模型。相比前代产品,该LLM更少出现欺骗行为,也更少犯下难以逆转的错误。

出于对黑客可能利用其发动网络攻击的担忧,Anthropic未将旗舰模型Mythos 5公开。该模型不仅能发现漏洞,还能制定利用漏洞的工作流程。相比之下,Opus 5在Anthropic内部一项评估LLM漏洞利用能力的基准测试中得分为零。

该公司为Opus 5配备了比Fable 5更宽松的防护栏。客户可以使用Opus 5搜索代码中的安全问题,但它会阻止黑客常用的漏洞扫描方法。Anthropic估计其防护栏的触发频率将比Fable 5降低85%。

开发者API升级

Opus 5现已成为Claude聊天机器人服务最高端Max层级的默认模型,同时也在中端Pro计划中可用。

开发者可通过Anthropic的API将Opus 5集成到自己的软件中。作为此次更新的一部分,该API新增了一项功能,可在LLM工作流程执行到一半时中断它并更换其使用的工具。另一项新能力则可以将被Anthropic安全防护栏拦截的提示重路由到其他模型。

©本站发布的所有内容,包括但不限于文字、图片、音频、视频、图表、标志、标识、广告、商标、商号、域名、软件、程序等,除特别标明外,均来源于网络或用户投稿,版权归原作者或原出处所有。我们致力于保护原作者版权,若涉及版权问题,请及时联系我们进行处理。