7月21日,Google DeepMind正式发布Gemini 3.6 Flash,一款面向开发者与企业的快速、低成本推理模型。

官方数据显示,该模型在七个基准测试中准确率较前代3.5 Flash平均提升5%,速度提升20%,每百万输入Token成本降至0.35美元。

但真正引爆网络反应的,不是数据,而是实测表现。

一、发布即翻车:把“母亲”变成“母狗”,把“生日”算成“忌日”

社交媒体上的首批测试截图让谷歌处境尴尬。

用户多次提问Gemini 3.6 Flash,指出回答中的逻辑谬误和答案前后不一,遭实测者调侃“戳中了AI的痛点”。

更触目惊心的一则测试显示:当用户将一张母亲节贺卡照片输入模型,请求写一段母亲节祝福时,Gemini 3.6 Flash输出的文字片段中将“母亲”一词翻译成了“母狗”。另一例测试中,一个简单的生日计算问题——“从2024年5月17日到2026年7月17日,我的年龄是多少?”——模型给出“2年0个月21天”后,紧接着自己补上了一句:“这意味着现在是2026年7月19日,可能你的生日已经过了。”

“省下了token,却没保住智商” ——这句评论迅速成为网友调侃Gemini 3.6 Flash的最热句式。

用户的不满集中指向模型的推理能力与响应质量。有评论认为,新模型在追求更低成本与更快响应速度的同时,牺牲了基础的语言准确性。

二、基准测试漂亮,真实场景翻车:AI行业的“纸上谈兵”之困

讽刺的是,基准测试数据显示出截然相反的画面:Gemini 3.6 Flash在数学、编程和视觉理解等任务上均取得了显著进步。与上一代Gemini 3.5 Flash相比,新模型在七个综合测试中准确率平均提高了5%,尤其是在数学和编程性能上持续优化,并具备多语言输入与图像生成能力。

这种“基准满分、实测翻车”的现象,正在成为AI行业的新常态。

TechCrunch的分析指出,Gemini 3.6 Flash的问题不是“表现差”,而是“表现不稳定”。在复杂的推理任务中,尤其是需要多步思考或多轮对话的场景下,模型经常给出表面合理、细节荒谬的响应。一个无法可靠处理母亲节贺卡内容和基础日期计算的模型,即便在数学基准上提升5%,也难以让开发者放心将其接入生产环境。

三、“代币经济学”的逻辑:速度与成本优先,精度让位

Gemini 3.6 Flash的定价策略明显瞄准开发者市场——0.35美元/百万输入Token,1.05美元/百万输出Token。

谷歌的逻辑很清晰:降低调用成本,让开发者可以更自由地在AI Agent、RAG(检索增强生成)、大规模批处理等场景中调用模型。但Gemini 3.6 Flash的教训表明,单纯压低成本而牺牲精度的策略,可能让模型沦为连基本事实都无法保证的“降智工具”。

当一个工具连“母亲”和“母狗”都分不清、连生日计算都能自相矛盾时,其经济性带来的技术优势已经在本源上被削弱了。

有网友通过API调用的“降价增量”算法得出结论:Gemini 3.6 Flash实际上每单位可交付的智力成本更高——价格降了但智商降得更多。

四、行业启示:精度与成本的平衡,依然是硬骨头

Gemini 3.6 Flash的“翻车”不是孤例。它揭示了一个更普遍的问题:在大模型领域,单纯靠“小模型”压成本,往往意味着“降智”的风险。

当企业用更小的模型替代大模型时,节省的不只是Token成本,有时也把答案的可靠性一起省掉了。

尽管谷歌在发布时也提供了更强的Gemini 3.6 Pro版本作为精度优先选项,但“轻量=愚蠢”的印象一旦形成,对Flash这个子品牌本身就是一个潜在的长期伤害。

也许,AI行业在追求“更便宜、更快”的同时,还需要回答一个更基本的问题:一个省了钱却丢了智商的模型,真的省了吗?