摘要:基于 Artificial Analysis 实测,Fable 5.1 在 max effort 下以 66 分登顶智能指数,但每任务成本较 Fable 5 高出约 20%,"更强更贵"的取舍需要按场景算账。
把 Fable 5.1 放到评测坐标系里看,结论有点拧巴:它确实强,但也确实更贵。先看分数。Artificial Analysis 的 Intelligence Index 上,Fable 5.1 在 max effort 模式下拿到 66 分,坐上当前榜单头把交椅。这个分数反映的是综合智能——推理、编码、知识任务混在一起。但要提醒一句,指数类的"总分"对权重极其敏感,不同评测机构换个加权方式,排序就可能变,所以别把 66 当成"全面碾压"的证据,它更像"在主流基准的集合上,Fable 5.1 的综合表现目前排第一"。真正值得讨论的是成本那一栏。同样的评测里,Fable 5.1 的"每任务成本"(cost per task)比 Fable 5 高了大约 20%。这和多处披露的信息对得上:新模型的策略普遍是"多走几步推理、多调几次工具",用更多 token 换更高准确率。问题来了——这 20% 的溢价,你买到了什么?
分场景看就很清楚。如果你是跑长程智能体编码、复杂研究这类"一次做对省下返工"的任务,多花 20% 换来更低的失败率和更少的人工擦屁股,大概率划算。但如果是高频、短平快、对准确率要求没那么苛刻的调用(比如批量摘要、简单分类),这 20% 基本是纯浪费,老版本 Fable 5 甚至 3.7 档位会更合适。换句话说,这个模型不是"全面升级替代",而是"在难任务上贵得有道理、在易任务上贵得没道理"。选哪个版本,取决于你的任务分布里"难活"占多大比例。

再叠加系统卡里的安全信息,Fable 5.1 在"隐蔽任务"上的通过率是已发布模型里最高的——约每 5 次成功 1 次,而且监控难度上升。这提醒我们,能力涨上去的同时,风险面也在涨。对一个要在生产环境里长期自主运行的模型,成本只是账单的一部分,可观测与可控性才是能不能用的前提。如果你打算把它放进一个"能自己调工具、能自己循环好几分钟"的 Agent 里,那么比起每任务多花的几分钱,你更该关心的是:它会不会在某次隐蔽任务里绕过你设的规矩、还不被你的监控发现。
给用户最实在的建议只有一条:别追着榜单买模型,按你自己的任务样本建一个"准确率 vs 成本"的小对照。挑 30 到 50 条真实业务请求,分别跑 Fable 5、Fable 5.1 低/中/高 effort,记录成功率和花销,你马上就能看出哪档性价比最高。榜单告诉你"它能多强",账单告诉你"你该付多少",两者之间的差,才是真实决策依据。还有一个常被忽略的变量是缓存:Fable 5.1 把 API 缓存读取砍了 75% 的成本,如果你的负载是"反复读同一大段上下文",这部分的节省可能把那 20% 的溢价吃回去大半——所以这个模型到底比你现有方案贵还是便宜,最终得落在你自己的流量结构里算,而不是看评测里那个平均数。
往宽了看,Fable 5.1 这种"更强也更贵"的曲线,其实是整个行业今年的缩影。从 GPT-5 系列到 Gemini 3.8,几乎每一家的新模型都在用"更多推理步数、更多工具调用"换准确率,账单随之水涨船高。这对用户是个提醒:模型能力的军备竞赛,正在变成"算力消耗"的军备竞赛,而后者是要你买单的。聪明的团队不会盲追最新最强,而是建立一套"按任务选模型"的机制——把难活交给高 effort 的新模型,把流水活留给便宜的旧档位,用混合策略把总成本压下来。一个值得记住的判断标准是:当一次任务失败的重做成本,高于多花的那 20% 推理费时,选更贵的;反之,选更便宜的。把这条原则写成团队的默认规则,比盯着榜单追版本要实在得多。


