
Anthropic正式发布最新AI模型Claude Opus 5.5。此次升级距上一代Opus版本约两个月,延续了该公司既有的更新节奏。
模型定位与安全评估
目前,Anthropic旗下Claude品牌主要包含三款模型:轻量低价的Haiku、中等规模的Sonnet,以及规模最大、价格最高的Opus。此外,还有代表最高产品层级、能力更强但成本更高的Fable/Mythos系列。此次发布将Opus系列从5.0升级至5.5版本。
Anthropic表示,Opus 5.5是其呼吁“放缓前沿发展步伐”以来推出的首款模型。与以往一样,该模型在发布前接受了包括METR和Frontier Design在内的外部机构评估,并在最全面的对齐测试中取得了迄今最高分数。
性能飞跃:编程与复杂任务处理
官方数据显示,Opus 5.5相比Opus 5实现了重大飞跃。早期测试反馈显示,其在处理高复杂度工作时性能显著提升:
- 代码迁移效率:一位测试者在不到一天内完成了68万行代码的迁移,而该工作原本需工程团队耗时数周。
- 软件优化能力:在优化Web应用页面加载时间的测试中,Opus 5.5在40次尝试中成功39次;相比之下,Opus 5仅带来微小改进且改变了应用行为。
- 创意构建:在根据单提示词构建游戏的测试中,Opus 5.5在图形效果和精细度上的评分高于其他所有模型。
在编程领域,Opus 5.5尤其擅长全代码库迁移和审计等长篇复杂任务。测试显示,审计并修复一个20万行代码库,Opus 5.5耗时不到3小时,而Opus 5耗时超20小时且Token消耗量为前者的2.5倍。
在内部测试中,要求Opus 5.5与Fable 5.1将负载均衡软件HAProxy从C语言转换为Rust语言。两者重写版本均通过了几乎所有回归测试,但Opus 5.5耗时9.5小时(Fable 5.1为12小时),且成本低51%。
在与竞品的对比中,Opus 5.5展现出极高的性价比:在FrontierCode默认级别下,它以约20%的任务成本击败GPT-6 Astra;在Terminal Bench 4.0上达到与Astra相当水平,成本仅为后者的40%;在CursorBench上,以约三分之一的成本比GPT-5.6 Sol高出11分。
成本降低与服务升级
得益于计算资源需求的减少,Opus 5.5的定价大幅下调。测试显示,在典型负载下,其默认设置成本比Opus 5低40%。具体价格为:输入Token每百万4美元,输出Token每百万20美元,较Opus 5降低20%;缓存读取价格为每百万Token 0.20美元,降幅达60%。此外,输出速度提升30%以上。
除降价外,Anthropic还提高了Pro、Max和Team计划用户的五小时使用限制,并为订阅用户提供速率限制重置功能,允许用户保存并在任意时刻使用。
目前,Opus 5.5已正式上线。Anthropic表示,Sonnet 5.5和Haiku 5.5模型将在“未来几周内”推出,预计将带来类似的性能、效率及安全性提升。