Anthropic正式发布Claude Sonnet 5.5。在Artificial Analysis智能指数中,该模型得分为56分,仅落后于Opus 5.5 (max) 2分,位居第二。尽管性能大幅提升,但其单次任务输出的Token数量创下新高,导致实际使用成本显著增加。

性能跃升与高昂的Token消耗

在“最大努力”(max effort)模式下,Claude Sonnet 5.5的智能指数得分较前代Sonnet 5提升了18分。然而,为实现这一性能,模型每个任务平均消耗约19.3万个输出Token,这是目前测得的最高值。这一数字比Opus 5.5 (max) 或Sonnet 5 (max) 高出约60%,更是GPT-6 Astra (max) 的约7倍。

Anthropic维持了与Sonnet 5一致的定价策略:每百万缓存输入、输入和输出Token的价格分别为0.2美元、2美元和10美元。但由于Sonnet 5.5单次任务输出的Token量更大,其每次任务的平均成本约为7.60美元,较Sonnet 5高出约50%。

基准测试表现

在代理式终端使用和知识工作领域,Sonnet 5.5已达到顶尖水平:

  • Terminal-Bench 4.0:得分为64%,与Opus 5.5和GPT-6 Astra持平,较Sonnet 5 (max) 提升50个百分点。
  • 其他基准:在AA-Briefcase、GDPval-AA和AutomationBench-AA中,Sonnet 5.5的表现与Opus 5.5相当,但消耗了显著更多的Token。
  • 科学推理:在Terminal-Bench-Science榜单中得分为53%,紧随GPT-6 Astra和Opus 5.5之后。

值得注意的是,作为较小规模的模型系列,Sonnet 5.5在事实知识和科学推理方面仍落后于Opus 5.5。在AA-Omniscience测试中,其事实准确性得分为54%(Opus为66%),但在幻觉率控制上更优(47% vs 59%)。在“人类最后考试”和SciCode基准中,它也落后Opus约6个百分点。

性价比分析

在当前定价下,Claude Sonnet 5.5处于“智能vs单次任务成本”帕累托前沿之外。在高努力级别下,其性能略逊于Opus 5.5;而在低努力级别下,GPT-6 Astra或Sol配置能以更低成本提供等效性能。相比之下,其高努力设置最具竞争力,在智能指数上仅微弱落后于GPT-6 Sol,且单次任务成本基本持平。

其他技术细节

  • 上下文窗口:支持100万Token,兼容图像和文本输入,与Sonnet 5保持一致。
  • 努力等级:包含低、中、高、极高、最大五个等级。评估中启用了默认回退机制,约0.1%的任务(主要集中在Terminal-Bench 4.0)回退至Sonnet 5。
  • 版本修复:早期预发布版本存在一个影响结构化输出质量的缺陷,已在公开发布版中修复。Anthropic预计修复后性能变化极小或略有提升。

更多详细对比数据可访问:Artificial Analysis模型页面