
Anthropic正式发布Claude Sonnet 5.5,这是其Claude 5.5系列的第二款模型,重点提升了编码、知识工作及计算机使用能力。目前,该模型已在Anthropic平台以及亚马逊AWS、谷歌云和微软Azure全面上线,开发者可通过claude-sonnet-5-5标识调用。
性能跃升与成本优化
据媒体报道,Sonnet 5.5的输出速度较Sonnet 5提升30%以上,单项任务成本最高降低30%。尽管代币定价与前代保持一致——每百万输入代币2美元,输出代币10美元,缓存读取0.20美元——但由于处理同等任务所需代币更少,整体运行负载成本显著下降。相比之下,高端模型Opus 5.5的输入和输出代币价格分别为每百万4美元和20美元。
Sonnet 5.5被定位为日常任务、代码修复及文档、幻灯片、电子表格创建的低成本方案,旨在取代部分Claude Opus 5.5的应用场景。Anthropic同时透露,面向高并发及成本敏感应用的Claude Haiku 5.5将在未来几周内推出。
基准测试表现
在评估代理式编码能力的Terminal-Bench 4.0测试中,Sonnet 5.5得分70.6%,远超Sonnet 5的10.3%,甚至略高于Opus 5.5的66.4%。在中度努力设置下,Sonnet 5.5不仅刷新了Sonnet 5的最佳成绩,且每项任务成本不足其十分之一。
在知识工作方面,Sonnet 5.5大幅缩小了与旗舰模型的差距。GDPval-AA v2.1测试显示,Sonnet 5.5得分为1,844分,紧追Opus 5.5的1,846分,远高于Sonnet 5的1,449分。计算机使用基准OSWorld 2.1中,Sonnet 5.5得分80.1%,虽略低于Opus 5.5的81.8%,但大幅领先于Sonnet 5的57%。在带工具辅助的“人类终极考试”中,Sonnet 5.5得分为64.5%,与Opus 5.5的67.7%相差无几。
Anthropic强调,基准测试仅反映部分能力,在处理需持续判断力的复杂开放式任务时,Opus 5.5仍具优势。此外,Sonnet 5.5引入了类似Opus 5.5的安全防护机制,针对高风险网络安全请求会自动回退至Sonnet 5,同时不影响用户进行常规软件开发。