摘要:7月25日Anthropic发布Claude Opus 5,定价与Opus 4.8持平(5/25美元),性能对标Fable 5,价格仅一半。Frontier-Bench编程评测碾压Fable 5(43.3% vs 33.7%),ARC-AGI 3达30.2%为第二名三倍,OSWorld 2.0以三分之一成本反超。大模型“越贵越强”的定价范式被打破。
7月25日凌晨,Anthropic正式发布Claude Opus 5。官方定位是“深思熟虑且主动”的模型,定价与Opus 4.8持平——输入5美元/百万Token、输出25美元/百万Token。而性能对标的是自家旗舰Fable 5,价格却只有后者一半。
这不是简单的“次旗舰追旗舰”,而是在多项核心评测中直接反超。

编程:碾压级领先
Frontier-Bench v0.1是目前最直接映射企业开发团队实际工作的基准测试之一。Opus 5拿到43.3%,Fable 5是33.7%。近10个百分点的差距,在编程评测里属于碾压级别。Opus 4.8在这个测试上是21.1%,Opus 5直接翻了一倍多。
CursorBench 3.2上,Opus 5在最高推理强度下达到Fable 5峰值成绩的94.5%,单次任务成本只有一半。Cognition(Devin背后公司)CEO Scott Wu确认:“Claude Opus 5在调试和根因分析方面以一半成本达到了接近Fable级别的性能。”

自主搜索:Opus 5 90.8% vs Fable 5 87.4%
计算机使用(OSWorld 2.0) :Opus 5在约三分之一成本下就超过了Fable 5的最佳成绩。
核心特性 | Opus 5 | Opus 4.8 | 提升幅度 |
默认思考模式 | 自适应(Adaptive) | 需要手动开启 | 架构升级 |
推理 Token 消耗 | 约 1/7 | 基准 | 效率 7x↑ |
Frontier-Bench 编程 | 超越所有对手 | 基准 | ≥2x↑ |
视觉输出能力 | 交互式 3D | 基础图表 | 质的飞跃 |
对话中改工具 | 支持(Beta) | 不支持 | 新能力 |
企业业务流程自动化(AutomationBench) :Opus 5拿到26%,Fable 5只有17.4%。在相同单任务成本下,Opus 5通过率约为第二名的1.5倍。
ARC-AGI 3(流体智能测试) :这是 François Chollet 设计的基准,考察模型在完全陌生环境中靠试错自己摸索的能力。发布前公开最强成绩是GPT-5.6 Sol的7.8%,Opus 4.8只有1.5%。Opus 5拿到30.2%,是第二名的3倍。
Humanity's Last Exam:开启工具后Opus 5拿到64.7%,Fable 5是63.9%。

在Artificial Analysis综合9项测试的智能指数上,Opus 5以61分居首,领先Fable 5的60分、GPT-5.6 Sol的59分。
定位:不是旗舰替代品,是旗舰的“平替”
Opus 5已成为Claude Max的默认模型,也是Claude Pro用户可调用的最强模型。能力更高的Fable 5主要面向API与企业客户。
这是一次清晰的产品分层:个人订阅用户用Opus 5获得接近旗舰的性能,企业客户为Fable 5的额外能力支付溢价。

这波有多猛?
性能上:编程碾压、搜索领先、计算机使用以三分之一成本反超、流体智能是第二名三倍——Opus 5在多个维度证明了自己不是“便宜版Fable”,而是“在某些场景比Fable更强的模型”。
定价上:Fable 5输入10美元/输出50美元,Opus 5直接砍半。同等性能、一半价格——这打破了大模型“越贵越强”的定价范式。
维度 | 评分 | 一句话解读 |
功能完整性 | ⭐⭐⭐⭐☆ | 编程 + Agent + 视觉三条腿都硬,研究支持偏窄 |
易用性 | ⭐⭐⭐⭐⭐ | 升级零成本,Prompt 反而更短,Effort 档位直观 |
性价比 | ⭐⭐⭐⭐⭐ | 半价追平 Fable 5,低档位就能打,Batch 再省一半 |
创新性 | ⭐⭐⭐⭐☆ | 自适应思考 + 视觉代码生成形成壁垒,非原创赛道 |
稳定性 | ⭐⭐⭐⭐☆ | 首日偶发乱码和首编错误,整体可控但需观察 |
推荐度 | ⭐⭐⭐⭐⭐ | 开发者闭眼入,企业可以等两周稳定性报告 |
综合评分:8.7 / 10
战略上:Anthropic用Opus 5把高端模型的竞争从“谁更强”拉到了“谁更值”。当一款半价模型在编程上碾压旗舰、在流体智能上是第二名的三倍,整个行业的定价逻辑都要重新算。
网友说得直接:“如果跟Fable 5差不多,那为什么还要花2倍的价格用Fable 5?”


