北京时间7月25日凌晨,Anthropic发布了Claude Opus 5。距离上一代Opus 4.8发布仅58天,距旗舰模型Fable 5发布仅45天。这家公司正在用远超行业平均的速度,重构自己的产品矩阵。
一、性能逼近Fable 5,价格直接砍半
Opus 5定价为每百万输入Token 5美元、每百万输出Token 25美元,与Opus 4.8持平,但仅为Fable 5价格的一半。Anthropic官方将其定位为"日常使用的高性能模型",在部分能力上接近旗舰级Fable 5。
但实际测试数据比"接近"二字更有说服力:
Frontier-Bench v0.1编程评测:Opus 5得分43.3%,超过Fable 5的33.7%,相比Opus 4.8的18.7%翻了一倍多。
GDPval-AA知识工作评测:Opus 5拿下1861分,超过Fable 5的1747分和GPT-5.6的1736分。
CursorBench 3.2:最高努力模式下,Opus 5与Fable 5峰值得分仅差0.5%,但单任务成本只有后者一半。
OSWorld 2.0电脑操作测试:Opus 5以略高于Fable 5三分之一的成本,就超过了Fable 5的最佳成绩。
Anthropic官方博客直言,Opus 5在Frontier-Bench和GDPval-AA等评测中已登顶新SOTA(最先进水平)。
二、ARC-AGI-3刷新纪录:得分是第二名三倍
Opus 5最引人注目的突破在ARC-AGI-3基准测试上。这项测试衡量模型解决全新未知问题的"流体智力",而非依赖训练数据的"晶体智力"。
非营利组织ARC Prize披露,Opus 5在ARC-AGI-3中取得30.2%的成绩,远超此前GPT-5.6 Sol(Max)创造的7.8%纪录。Anthropic官方称,Opus 5的得分是第二名模型的三倍。
ARC Prize还观察到,Opus 5展现出此前未出现的新颖行为,能够解决此前未被攻克的复杂环境。这一突破被媒体评论为"在更接近AGI推理能力的测试中出现了明显突破"。
在其他评测中,Opus 5同样表现突出:
Zapier AutomationBench:端到端完成商业自动化流程,相同成本下通过率约为第二名模型的1.5倍。
HLE跨学科难题:允许使用工具后,Opus 5达到64.7%,反超Fable 5的63.9%,成本也更低。
三、科研能力跃升,安全限制更少
Opus 5在科学研究领域同样实现了显著提升。在Anthropic内部生命科学评测中,Opus 5在所有维度上都优于Opus 4.8:
有机化学任务(根据光谱数据推断分子结构):比Opus 4.8高出10.2个百分点
蛋白质序列功能预测:高出7.7个百分点
安全方面,Opus 5的安全限制相比Fable 5更少,预计安全分类器触发次数减少约85%。不过它仍会阻止基于二进制文件的漏洞扫描、渗透测试及漏洞利用代码生成等高风险操作。
四、产品定位:日常高频使用的默认模型
Opus 5已成为Claude Max的默认模型,也是Claude Pro中能力最强的模型。
Anthropic的产品策略正在从单一排行榜竞争转向场景化分工:Fable 5保留给"最雄心勃勃的工作",Mythos 5专注网络安全和高风险科研,Opus 5则面向日常编程、知识工作和企业智能体。
有开发者评价:"Opus 5像是GPT-5.6和Fable 5之间的一个奇怪但有用的中间态。它有Fable的品味,又有GPT-5.6的彻底和较真。代码不如Fable写得漂亮,但更可能是对的。"
五、结语
Opus 5在某些评测中击败了Fable 5,价格只有后者一半,还在ARC-AGI-3上刷新了纪录。但Anthropic官方始终强调Opus 5只是"接近"Fable 5的能力——这不是话术,而是产品线的重新排位。
当中国模型以低价追赶、企业客户重新计算AI投入产出比时,Anthropic用Opus 5给出了自己的答案:把接近旗舰级的能力下沉到日常任务,用一半的价格覆盖更大的市场。58天发一款新模型的速度,既是内卷的产物,也是在为下一阶段的竞争铺路。



