
Anthropic正式发布Claude Sonnet 5.5,这是一款专为编程及办公场景优化的AI模型。官方数据显示,新模型响应速度较前代提升30%以上,且在完成多项任务时Token消耗显著降低。在保持公开API价格不变的前提下,单次任务成本得以压缩。
该模型支持零数据保留策略,现已通过Amazon Web Services、Google Cloud和Microsoft Azure上线。开发者可在Claude平台通过模型名称claude-sonnet-5-5调用。值得注意的是,此前使用Sonnet并关闭“思考”功能的用户,在迁移至5.5版本前,必须切换至新的between_tools设置。
### 性能跃升与成本优化
在衡量代理式编程能力的Terminal-Bench 4.0测试中,Sonnet 5.5得分高达70.6%,而Sonnet 5仅为10.3%。在涵盖44个职业和9个行业的GDPval-AA工作负载测试中,新模型取得1,844分,仅比旗舰模型Opus 5.5低2分,却高出Sonnet 5达395分。
成本效益方面,在较低“努力程度”设置下,Sonnet 5.5的单次任务成本低于Opus 5.5;在高设置下,两者基准测试结果相当且成本相近。FrontierCode编程测试显示,同等高努力设置下,Sonnet 5.5得分比Sonnet 5高出10分,但单次任务成本仅为后者的十五分之一。早期测试者反馈,新模型理解代码库速度更快,能将工具调用整合至更少步骤中。
CodeRabbit AI副总裁David Loker指出,Sonnet 5.5在不同复杂度任务中展现出更优的判断力,并显著减少输出Token。此前Sonnet 5过度依赖网页搜索及高Token消耗的问题在新模型中已得到解决。该公司计划即刻迁移简单和中度审查任务,并在未来几周扩展迁移范围。
此外,Sonnet 5.5在计算机使用和图表识别测试中的表现接近Opus 5.5。在衡量长期知识工作的AA-Briefcase测试中,其得分优于Sonnet 5和GPT-6 Sol。早期用户评价其为更自然的对话伙伴,能够依据幻灯片模板生成几乎无需编辑的演示文稿。用户可通过调整“努力程度”来平衡成本、速度和质量:Claude Code及Anthropic应用中默认为“中等”,Claude平台则默认为“高”。
### 安全机制与防护
针对约1,850个场景的自动化审计显示,Sonnet 5.5在大多数对齐性、抗滥用能力及诚实性指标上达到或超越Sonnet 5。Anthropic未发现模型存在与用户意图冲突的目标追求行为,但也声明测试无法覆盖所有潜在故障。
新模型内置网络安全防护措施,支持常规软件开发任务(包括漏洞查找与修复),但高风险网络安全任务将自动回退至Sonnet 5处理。生物安全方面,Sonnet 5.5沿用与Sonnet 5相同的护栏机制,可能会标记部分合法的微生物学及病毒学请求,相关组织可申请验证计划以获取扩展访问权限。
为防止通过大量虚假账户提取模型能力,Anthropic已部署相应防御措施。公司表示,大多数开发人员不会感知到变化,但跨账户转移对话的用户需查阅相关指导说明。