摘要:GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3 同周发布,智能指数差约7分但价格差达百倍,选型要看场景而非排名。
9月第一周,四大实验室几乎在同一窗口甩出新模型,把"哪个最聪明"这个老问题,替换成了"你的工作流该测哪一个"。Anthropic 的 Claude Fable 5.1(9/1)、谷歌 Gemini 3.8 Flash(9/2)、Meta Muse Spark 1.3(9/2)、OpenAI GPT-6 Astra(9/3),在72小时内密集落地,被多家评测称为"AI 史上最竞争的一刻"。

第三方数据给了清晰画像。Artificial Analysis 把 Fable 5.1 的智能指数定在66,是迄今测得的最高分;Astra 是61,和 GPT-5.6 Sol 持平;Gemini 3.8 Flash 59,Muse Spark 1.3 约62。差距只有7分左右,但价格横跨百倍:Fable 5.1 和 Astra 都是10/50美元每百万token,Gemini 3.8 Flash 仅0.75/3.75,且到2027年1月才翻倍。能力上,Astra 霸榜数学(FrontierMath Tier 4 97.6%、ARC-AGI-3 99.9%)和网安(ExploitBench 100%);Fable 5.1 领跑智能体编码(Terminal-Bench 55.8%、Coding Agent Index 70.4),靠缓存读取降价75%把长任务成本压下来;Gemini 在长上下文多模态上便宜得离谱;Muse Spark 1.3 赌长程可靠性,DeepSWE 拿到75.4%最高分。
我的判断:对构建者,这周最有价值的不是排名,而是一张"先测什么"的清单。把同一模型放进同一套固定 Harness,跑六类任务(陌生仓库理解、跨文件小功能、失败测试修复、前端视觉、并行研究、中断恢复),保留成功率、验证通过率、单位任务成本、人工接管时间四项指标。如果某个模型的优势只出现在某种提示词或某个 demo 里,就不能外推到生产。2026年的选型,比的不再是"谁分高",而是"在你的真实负载上,谁更便宜、更稳、更可控"。








