性能最强的模型,正在面临一个比参数更棘手的问题:当开源对手以十分之一的价格追平性能,用户还愿意为“三倍成本”买单吗?
性能登顶,成本同样“登顶”
2026年6月,Anthropic正式发布Claude Fable 5。这是其Mythos级模型的公众版本,底层模型据称达到5万亿至10万亿参数量。
性能数据确实亮眼。在编码能力评测中,FrontierCode Diamond任务拿下29.3%,是第二名(GPT-5.5为5.7%)的两倍多;在真实项目的“代码可被接受合并”这项硬指标上大幅领先。Anthropic还展示了典型案例:在一个5000万行Ruby代码库中,Fable 5在一天内完成全库迁移,原本需一整个团队耗时两个月。
但代价同样显著。官方定价为输入每百万token 10美元、输出50美元,是此前Opus 4.8价格的两倍,输入比GPT-5.5贵一倍,输出贵三分之二。
更严峻的是单任务完成成本。分析师Wojciech Gryc对比发现,Fable 5完成单个任务的推理成本,是OpenAI和开源模型的三倍左右。实测中,多个用户反馈“5个小时的额度,半小时就烧完了”;企业级多步Agent任务单次可能消耗450美元以上。
开源模型正在以十分之一价格追平性能
几乎同一周,两个中国开源模型追平了Fable 5的能力。月之暗面7月16日发布的Kimi K3、阿里7月19日发布的Qwen 3.8,性能相当,但推理成本仅为Fable 5的几分之一。开源中国报道指出,Fable 5的加权平均单任务成本约2.75美元,而开源模型仅需0.04至0.06美元。
三倍价差意味着什么?Gryc的判断很直接:基准测试正在饱和,用户感知到的差异远小于成本差异。在一个价格战激烈的市场上,用户是否愿意为“稍微好一点”付三倍价钱,存疑。
Anthropic正在用B端壁垒抵御成本压力
不过,Anthropic的商业化逻辑有其独特性。不同于OpenAI主要依赖个人订阅(消费订阅占收入约65%),Anthropic逾75%收入来自企业API调用。编程场景贡献超65%的ARR,Claude Code已占GitHub每日提交量7%以上。
企业客户的粘性更强。Anthropic净美元留存率高达500%——去年一季度ARR仅20亿美元,今年一季度飙至300亿美元,其中120亿美元来自老客户复购。
推理效率的提升也在缓解成本压力。9个月内,Anthropic每兆瓦算力产生的ARR从1600万美元增至6000万美元,推理效率提升近3倍,综合毛利率从2024年的-94%升至60%。
最大隐患:没有基础设施,只有模型
真正致命的风险不在成本本身,而在商业模式的结构性缺陷。
Gryc将AI公司分成三档:租数据中心的(Anthropic在此列)、自建数据中心的(Meta、阿里)、自建加自发电的(SpaceX)。没基础设施的公司只有两条路:做到最好,或做到最便宜。Fable 5选了“最好”,但成本是别人的三倍。
更真实的压力在每月算力账单。Anthropic每月向SpaceX支付12.5亿美元租用Colossus 1数据中心,年度算力支出接近150亿美元。即使按470亿美元ARR估算,近三分之一营收持续流向上游算力商。而合约主动权完全掌握在SpaceX手中。
这解释了Anthropic为何在账面资金充裕时仍火速冲刺IPO——不是技术成熟,是算力账单到期了。
结论
当Kimi K3和Qwen 3.8在性能上逼近、成本只及零头,Fable 5三倍的推理成本还能撑多久?Anthropic在B端编程场景已建立较强粘性,企业客户愿意为效率付费的逻辑暂时成立。但如果开源模型持续拉近性能差距,这场“强者溢价”的游戏,迟早要被市场重新定价。



