摘要:Anthropic发布Claude Sonnet 5.5,速度提升超30%,任务成本降30%,编程测试超越Opus 5.5,价格仅为其一半,首次搭载网络回退安全功能。

当地时间9月28日,Anthropic正式发布Claude 5.5家族第二款模型Sonnet 5.5,距旗舰Opus 5.5亮相仅一周。官方数据显示,新模型速度提升超30%,单项任务成本最高降低30%,API价格仅为Opus 5.5的一半。

在智能体编程测试Terminal-Bench 4.0中,Sonnet 5.5得分70.6%,大幅超越上一代的10.3%,甚至高于Opus 5.5的66.4%。第三方面板Artificial Analysis智能指数中,Sonnet 5.5获56分,仅比Opus 5.5低2分。

编程能力跳级式提升

编程是本次升级最突出的维度。除Terminal-Bench 4.0外,在真实编辑器场景测试CursorBench 4.0中,Sonnet 5.5取得55.5%的成绩,较Sonnet 5的34.1%提升超过20个百分点,与Opus 5.5的57.8%仅差2.3个百分点。

实际开发中效率提升更明显。Base44对118次真实应用构建进行了对比测试,Sonnet 5.5每个项目平均仅需3.6次迭代,而Opus 5需要7.7次。Slack首席工程师Curtis Allen表示,新模型在Slack离线评测中几乎全面胜出,步骤更少且输出Token减少约14%。

价格减半,按任务算更便宜

Sonnet 5.5的API定价与Sonnet 5持平:输入每百万Token 2美元,输出10美元,缓存读取0.2美元。相较Opus 5.5的4美元和20美元,价格恰好减半。

真正的变化在用量。由于推理更精简、工具调用更少,完成任务所需Token大幅下降。Anthropic内部测试显示,单项任务综合成本最高可比Sonnet 5降低30%。在FrontierCode高强度编程测试的高算力档位下,单任务成本仅为上一代的十五分之一。

安全防护向旗舰看齐

Sonnet 5.5是首个搭载网络回退功能的Sonnet级模型,其网络安全防护能力已与Opus 5看齐。当分类器识别到高风险请求时,模型会自动回退至Sonnet 5处理,日常开发和多数生命科学工作不受影响。

新模型还首次在Sonnet系列中引入蒸馏攻击拦截分类器,可直接阻止试图提取模型内部推理链的请求。Anthropic在约1850个场景的自动化行为审计中确认,Sonnet 5.5在多数对齐指标上持平或优于Sonnet 5。