7月21日,谷歌DeepMind一口气发布三款新模型。其中Gemini 3.6 Flash被官方定位为“干活模型”(workhorse),主打“更快、更便宜、更高效”。
Token省了、价格降了、部分基准测试分数也涨了——但开发者社区的反应却出人意料地冷淡,甚至被用户戏称为谷歌“史上最差”AI模型。

一、数字上确实有进步
先看官方宣传的几个亮点。
Token效率提升明显。 根据Artificial Analysis Index的数据,3.6 Flash比3.5 Flash减少了约17%的输出Token使用量。在DeepSWE这类软件工程基准测试中,Token节省幅度甚至达到65%。多步工作流的推理步骤和工具调用也更少。
价格略有下调。 输入保持每百万Token 1.5美元不变,输出从3.5 Flash的9美元降至7.5美元。上下文缓存读取仅0.15美元/百万Token。
部分基准测试有提升。 官方公布的几个核心数据:
基准测试 | 3.5 Flash | 3.6 Flash |
DeepSWE | 37% | 49% |
MLE-Bench | 49.7% | 63.9% |
OSWorld-Verified | 78.4% | 83.0% |
GDPval-AA v2 | 1349 | 1421 |
知识截止日期也从2025年1月更新到了2026年3月。
单看这些数字,确实像一次合格的小幅升级。

二、问题出在哪?智能没涨
但核心矛盾在于——智能没跟上。
Artificial Analysis的智能指数显示,3.6 Flash得分50,和3.5 Flash完全持平。这意味着模型底层理解能力没有提升,本质上只优化了推理链路。
更尴尬的是排名。Arena.ai前端代码竞技场中,3.6 Flash以1537分排第12位。Artificial Analysis最新智能指数排行榜上,谷歌已经没有任何一款模型进入前十。Kimi K3、Claude、GPT等模型占据了头部位置。
一个主打“更聪明”的升级,结果智能水平和上一代一模一样——这在开发者看来,本质上是一次“降本”而非“提质”。
三、开发者为什么不买账?
第一,实际体验与宣传存在落差。 早期实测显示,3.6 Flash在前端界面生成与空间推理方面表现不佳-。有开发者直言“前端能力糟糕、空间推理也很差”。多位开发者连夜测试后发现,3.6 Flash在生成带有超过3个层级嵌套的React/Vue组件时,标签闭合错误率高达42%。有用户在Google AI开发者论坛上表示:“他们似乎只是降低了3.5 Flash的精度来换取速度和Token效率,然后把它命名为3.6 Flash”。
第二,降价幅度不足以弥补能力短板。 输出价格从9美元降到7.5美元,降幅约17%。但有用户算了一笔账:3.6 Flash每Token的使用成本比GPT-5.6 Sol Medium还高,智能程度却更低。Flash系列的核心卖点一直是性价比,当性价比优势被削弱,用户自然用脚投票。

第三,旗舰跳票让市场失去耐心。 Gemini 3.5 Pro从5月I/O大会预告“一个月内发布”,到7月仍未露面。谷歌一边说Pro“正在与合作伙伴测试”,一边说“已启动Gemini 4最大规模预训练”。主力旗舰迟迟不来,迭代的Flash又没有实质提升——用户的不满情绪被进一步放大。
有开发者评论说:“谷歌就像龟兔赛跑里的兔子,领先一段时间后就开始睡觉”。也有人直言,Gemini团队需要引入“真正关心交付前沿模型的人”。
四、尴尬的定位:既要又要
3.6 Flash陷入了一个尴尬的境地。
如果只追求效率和成本,3.5 Flash-Lite更便宜、更快(每秒350 Token,输入0.3美元/百万Token,输出2.5美元/百万Token)。如果追求能力,Kimi K3、Claude Fable 5、GPT-5.6 Sol在各自领域都更强-。
3.6 Flash夹在中间——比Lite贵,比旗舰弱。既没有在性价比上做到极致,也没有在能力上实现突破。
谷歌说“行业重心正从卷参数转向卷效率”——这没错。但效率优化不能以牺牲能力为代价。当模型完成同样任务“更快更便宜”但“质量没变”,用户为什么不直接用上一代更便宜的版本?
3.6 Flash用数据证明了优化Token效率是可行的,但也暴露了一个更根本的问题:当效率提升的代价是能力停滞,用户不会为“没变聪明”的升级买单。
