
Anthropic正式推出Claude Opus 5.5模型。该模型在多数任务上的表现可与Claude Fable 5.1相媲美,运行成本较Opus 5降低40%。目前,Opus 5.5已在Anthropic平台及Amazon Web Services、Google Cloud、Microsoft Azure上线。
性能与效率提升
Anthropic指出,Opus 5.5在处理代码库迁移、审计等长篇复杂任务时表现突出。早期测试显示,一名用户利用该模型在不到一天内完成68万行代码的迁移;另一名用户在3小时内审计并修复20万行代码库,而Opus 5耗时超20小时且消耗令牌量为前者的2.5倍。在软件优化任务中,Opus 5.5在40次尝试中成功39次减少页面加载时间,优于Opus 5。
在基准测试方面,Opus 5.5在代理编码、知识工作和计算机使用评估中领先。其在Terminal-Bench、FrontierCode和CursorBench上的表现均优于Fable 5.1和Opus 5,并在GDPval-AA知识工作评估中位居榜首。不过,OpenAI的GPT-6 Astra在科学研究基准测试中保持领先,并在业务工作流评估中以微弱优势胜出。
成本效益方面,Opus 5.5在Terminal-Bench上以约五分之一的成本与GPT-6 Astra持平,在FrontierCode上以约五分之一的成本超越Astra。在CursorBench上,它以约三分之一的成本超越GPT-5.6 Sol。
定价与安全机制
Opus 5.5的输入令牌价格为每百万个4美元,输出令牌为每百万个20美元,低于Opus 5的5美元和25美元;缓存读取价格从每百万个0.50美元降至0.20美元。此外,该模型生成速度比Opus 5快30%以上。
安全层面,Opus 5.5内置动作筛选分类器、可审计开源沙箱及代码审查功能。相比Opus 5和Claude Mythos 5.1,其试图规避限制的情况减少85%,且在编码、工具使用等方面具备更强的抗提示注入能力。鉴于其在网络安全和生物学方面的能力,大多数网络安全任务将被路由至Opus 4.8,经验证的组织可申请访问生物学研究权限。模型还包含“保留思维”保护机制,防止API用户大规模提取推理过程。
其他动态
Anthropic同时提高了Pro、Max、Team及企业版用户的五小时使用时长限制,并引入速率限制重置功能,但未披露具体新限额。公司承认,构建能可靠捕捉所有失败的评估体系仍是未解难题。
Claude Sonnet 5.5和Haiku 5.5预计将在未来几周内推出。Opus 5.5的发布时间与OpenAI的GPT-6 Sol和Luna相同。尽管价格更高,Opus 5.5在部分基准测试中性能略高于GPT-6 Sol:在FrontierCode上,Opus 5.5得分为51.4%(每项任务2.25美元),Sol为48.4%(1.37美元);在AutomationBench上,Opus 5.5得分为34.4%(0.86美元),Sol为33.2%(0.27美元)。