Anthropic正式推出Claude Opus 5.5,这是其全新Claude 5.5系列的首款模型。该公司表示,新模型在大多数任务中的性能与Claude Fable 5.1大致相当,但运行成本显著降低。

这款模型于9月22日(周二)亮相。官方数据显示,与7月发布的Opus 5相比,Opus 5.5在处理典型负载时的成本降低了约40%。Anthropic透露,Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周内陆续上线。

值得注意的是,这是Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)呼吁AI行业“放缓前沿发展”并强调安全优先以来,公司推出的首款新模型。

编码与知识工作能力领先

Anthropic指出,Opus 5.5在代理式编码、计算机操作及知识工作等领域表现优异。在涵盖44种职业真实场景的GDPval-AA v2.1测试中,Opus 5.5得分1,846分,高于Fable 5.1的1,735分和Opus 5的1,708分。

在Terminal-Bench 4.0测试中,Opus 5.5取得66.4%的成绩,优于本月早些时候发布的OpenAI GPT-6 Astra(57.9%)。不过,Astra在Terminal-Bench-Science 0.1等特定测试中仍保持领先,得分为64.6%,高于Opus 5.5的58.7%。

Anthropic警告称,在此能力层级上,基准测试分数的微小差距已不再是可靠的参考指标。公司强调,Opus 5.5与Fable 5.1在实际应用中的体验差异比分数显示的更小。此外,相较于常被批评写作清晰度不足的Opus 5,新模型的表达更为清晰。

强化安全措施与评估

鉴于阿莫迪此前提出的“放缓”主张,安全性成为此次发布的重点。Anthropic表示,包括METR和Frontier Design在内的外部机构在发布前对模型进行了测试,Opus 5.5在自动化行为审计中取得了该公司所有模型中的最高分。

这一策略与此前不同。此前报道指出,Anthropic曾故意将网络安全任务排除在Opus 5的训练之外。如今,Anthropic表示Opus 5.5在生物安全和网络安全方面的能力与Claude Mythos 5.1相当,并配备了与Fable 5.1类似的安全措施。大多数网络安全任务将被路由至Opus 4.8处理,而经过审核的组织可通过新的生命科学验证计划申请更广泛的生物领域访问权限。

Anthropic也承认测试存在局限性,观察到Opus 5.5经常怀疑自己正处于评估中,这增加了评估其实际行为的难度。OpenAI也报告了GPT-Astra存在类似行为。

定价与使用权益

Claude Opus 5.5现已在Anthropic平台、亚马逊云科技(AWS)、谷歌云和微软Azure上可用。开发人员可通过API以claude-opus-5-5身份调用该模型。

API定价如下:

  • 输入令牌:$4/百万
  • 输出令牌:$20/百万
  • 缓存读取令牌:$0.20/百万

Anthropic介绍,相比Opus 5,新模型的输入和输出令牌价格降低了20%,缓存读取价格降低了60%。相比之下,GPT-6 Astra的输入令牌价格为每百万10美元,输出令牌为每百万50美元。

此外,Anthropic还将Pro、Max和Team订阅用户的使用时长限制提升至五小时。