Anthropic发布Claude Opus 5.5并降价20%,OpenAI以GPT-6模型应战
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-09-23 21:09
关键字: OpenAI ,Anthropic ,Claude Opus 5.5 ,GPT-6 ,大模型定价
浏览: 408
点赞: 27
收藏: 4
尽管外界对AI失控的担忧甚嚣尘上,两家大型AI模型厂商并没有放慢脚步:Anthropic今日发布Claude Opus 5.5并降价20%,几分钟后,OpenAI推出两款新的GPT-6模型Sol和Luna,价格只有前代的一半。
Opus 5.5:更便宜,也更快
Opus 5.5的输入价格为每百万Token 4美元,输出为20美元。Anthropic称,在典型工作负载下这比Opus 5便宜40%。缓存读取的降幅最大,下降了60%,至20美分。一种更快的服务模式需要额外付费,输入为每百万Token 8美元,输出为40美元。
OpenAI则把两款新模型的价格砍到同名GPT-5.6版本的一半:Sol降至每百万输入Token 2美元、输出10美元;Luna还要低一个数量级,分别为10美分和50美分。
Anthropic表示,Opus 5.5在大多数工作上可与Fable 5.1匹敌。输出生成速度比7月底发布的Opus 5快30%以上。在智能体编码测试Terminal-Bench 4.0上,新模型得分66.4%,Fable 5.1为55.8%;在AutomationBench上,新模型报告的任务完成率为40%,Opus 5为26.9%。
公布数据中差距最大的是科学研究领域:在Terminal-Bench-Science 0.1中,Opus 5得分29%,新模型为58.7%。在以Elo计分的知识工作测试GDPval-AA v2.1上,Opus 5.5为1846分,Opus 5为1708分。带工具运行的"人类最后的考试"(Humanity's Last Exam)得分为67.7%。一位测试者不到一天就完成了一次68万行的代码迁移——Anthropic称这项工作交给工程团队需要数周。
客户反馈与安全表现
在随发布一起公布的测试说明中,Box公司AI产品副总裁Yashodha Bhavnani表示,新模型的回答冗长度降低了40%,且没有损失准确度。GitHub首席产品官Mario Rodriguez称,在VS Code中,该模型"用不到一半的步骤解决了比Opus 5更多的终端任务"。Anthropic表示,该模型会把最重要的信息放在前面。公告中引用的其它客户则提到重试更少、返工更少。
在安全方面,Anthropic称Opus 5.5在其用于对齐测试的自动化行为审计中,是迄今表现最强的版本;试图绕过遏制边界的尝试相比Opus 5下降了85%。对提示注入的抵抗力提升到在Gray Swan基准上可与Fable 5.1匹敌的水平。
针对网络安全工作的限制沿袭自Fable 5.1,此类任务大多被路由到更早的Opus 4.8模型。被判定为高风险的生物学工作同样被隔离开来,更广泛的使用需通过验证计划,该计划目前新增了一条生命科学通道。Frontier Design和METR都在发布前对该模型进行了测试。
OpenAI:Sol与Luna压低成本曲线
OpenAI的两款发布瞄准的是成本曲线更低的位置。Sol和Luna基于与9月3日开始推送的GPT-6 Astra大致相同的训练方法构建,随后针对成本做了调优。Luna是两者中更便宜的一个,面向摘要、信息提取这类大批量例行任务;Sol则承接重复性的编码和智能体工作。面向法律研究的配置Astra for Law已于9月17日推出。
OpenAI报告称,Sol在AutomationBench上完成了33.2%的任务,每个任务27美分;在DeepSWE v1.1软件工程测试上为68.8%,与更早的Claude Fable 5仅差1.1个百分点。Luna在同一测试上达到66.6%。据该公司称,Sol的错误率约为其前代的一半;Luna在更高的推理强度设置下可匹敌GPT-5.6 Sol,成本约为百分之一。OpenAI的对比均是针对Fable 5.1和Opus 5进行的,因此两次发布都没有提供彼此之间的直接对比。
该公司将缓存输入Token的读取价格下调了90%。它表示命中率有所改善,编码智能体现在可以在不破坏缓存的情况下调整推理强度和可用工具集。据该公司称,两款模型的回答都更简短,术语更少、低价值细节也更少。
Opus 5.5已在Claude开发者平台以claude-opus-5-5的名称提供,并通过Amazon Web Services、Google Cloud和Microsoft Azure提供。Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周内推出。
OpenAI的两款模型已以gpt-6-sol和gpt-6-luna面向开发者上线,并在ChatGPT Work和Codex中面向Plus、Pro、Business、Enterprise和Edu订阅用户提供。免费用户和Go用户可在桌面应用中用到Luna,两款模型都尚未进入ChatGPT的主聊天界面。






京公网安备:11010502051901号