摘要:对比GPT-6 Sol、Claude Opus 5.5与Grok 4.7三款旗舰模型定价与基准表现。厂商自报分数与第三方跑分存在系统性差距,选型应看单任务成本。
选模型先看榜单,还是先看账单?2026年9月,GPT-6 Sol、Claude Opus 5.5与Grok 4.7三款旗舰先后进入用户视野。把它们放在一起比较,能看清当前大模型厂商的三条路线。
先说定价。Claude Opus 5.5输入4美元、输出20美元每百万token,较上代Opus 5下降20%,缓存读取0.20美元每百万token,降幅达60%。GPT-6 Sol定价为输入2美元、输出10美元每百万token,较GPT-5.6促销价下降50%,同系列的Luna更便宜。Grok 4.7维持4.6代价格,输入2美元、输出6美元每百万token。三家之中,Grok输出单价最低,Opus最高。

再看基准表现,这里需要分清楚“谁测的”。Opus 5.5在官方Terminal-Bench 4.0上得分66.4%,而第三方机构Artificial Analysis独立跑分为59.6%。GPT-6 Sol官方未公布Terminal-Bench 4.0成绩,但在AutomationBench的xhigh档表现超过Claude Opus 5的max档,而单任务成本仅为后者的9%。Grok 4.7的差异最明显:同一基准上,其自报38.0%,Terminal-Bench官方榜记录37.58%,Artificial Analysis标准化重测只有25.8%。差距来自测试框架与评测设置不同。
单任务成本是把“分数”换算成“钱”的关键指标。Terminal-Bench 4.0官方榜记录,Grok 4.7每解出一个任务约花费29.70美元,高于GPT-6 Astra high档的17.02美元。原因在用量:Grok 4.7最高档单任务输出token约8.1万,为Astra的两倍以上。分数高不一定省钱,消耗大可能抵消性能优势。
三条路线因此清晰:Anthropic向内砍成本,靠降价与缓存优惠留住重度用户;OpenAI向下摊价格,用更低单价换取规模使用;xAI向上冲性能,以高消耗换取高分。方向不同,适用人群也不同。
评测这类产品,须有方法论自觉。厂商自报分数与第三方独立分数之间存在系统性差距,框架不同、设置不同,结果即可相差十余分。把榜单最高分当作选型依据,往往失真。更务实的做法是:在自己的真实任务上跑单任务成本与稳定性,而非追逐公开基准的峰值。
对多数团队,建议按任务性质选型。预算敏感、任务量大,GPT-6 Sol与Grok 4.7的低输出单价有吸引力;追求稳定与可控,Opus 5.5的降价与缓存机制更友好。若任务依赖特定基准能力,应做小样本实测再定。
部分数据为厂商自报,引用时以官方发布页为准。


