摘要:谷歌 9 月 2 日推出 Gemini 3.8 Flash 与专属安全变体 3.8 Flash Cyber,常规版同级定价、能力逼近高价旗舰,安全版仅通过 Fairwind 计划向防御者开放。
谷歌这次的节奏很"谷歌"——这是六周里的第三个 Flash 版本,而价格一分没涨。先看常规款 Gemini 3.8 Flash。规格和 3.7 Flash 基本一致:100 万 token 上下文、6.5 万 token 最大输出、多模态输入、文本输出,定价保持每百万输入 0.75 美元、输出 3.75 美元。变化不在参数,而在"行为":官方直白地说,3.8 Flash "工作更卖力了"——遇到复杂任务会多走几步推理、多调几次工具,代价是 token 消耗会往上走。在 HLE-Verified 上拿到 54.9%,在长程软件工程基准 DeepSWE v1.1 上,据说以零头成本超过了不少更大的旗舰模型;金融、法律这类专业 Agent 基准也有提升。这套"用 token 换准确率"的取舍,谷歌自己写进了开发者指南:当计算效率是硬约束时,建议你留在 3.7 Flash。这种"新模型未必适合所有负载"的坦诚,在厂商发布会上其实不多见,也算一种成熟。

真正值得一提的是 3.8 Flash Cyber。它是个被刻意收窄使用范围的网络安全变体,只通过新开的 Fairwind 计划向"受信任的防御者"发放——政府网安机构、关键基础设施运营商、软件维护者。能力上,它在 CyberGym 这个漏洞发现基准上达到前沿水平,内部覆盖 20 种语言的测试里漏洞发现成功率超过 70%;在 CWE-Bench 补丁基准上 pass@1 为 47.2%,紧贴某前沿模型 47.8% 的水平,但成本显著更低。Chrome 安全团队用它的补丁正确率是对照"大得多的商业模型"的 2.6 倍。谷歌明确说,训练时把重心放在"修补"而非"攻击利用"上。
这里有个值得玩味的治理细节:3.8 Flash 公开可用,但带着防 CBRN 和防网络攻击的护栏;3.8 Flash Cyber 反而"护栏更松",因为它只给经过背调的防御者。也就是说,限制模型能力的不是技术,而是"谁能拿到"。Fairwind 目前据称已有 650 多家伙伴,它本质上是一种"分级能力释放"——先把能力交给防御者,让他们在攻击者动手前把系统补好。这种"防御者优先"的发布节奏,大概率会成为安全敏感模型的行业标配。把视线拉开看,这其实和 Anthropic 的 Mythos 可信访问计划、OpenAI 的 Daybreak Blue 防御计划是同一套思路:前沿能力不再"出厂即全量",而是按信任等级逐步解锁。
对工程团队来说,3.8 Flash 现在就能在 Gemini API、AI Studio、Android Studio、Antigravity 和 Gemini Enterprise 上直接路由生产流量;只是迁移时要留意一个破坏性变更——3.8 Flash 不支持 MINIMAL 思考档位,设了会直接报错。这条看似很小的兼容性改动,足以让一批沿用旧参数的调用在升级当天集体挂掉,建议上线前先在预发环境跑一遍参数校验。
对正打算迁移的团队,一个务实的建议是把它当成"同价升级、但默认档位要重选"来处理:先在小流量上对比 3.7 和 3.8 在你们真实任务上的准确率与 token 消耗,再决定哪些链路值得切到 3.8、哪些留在 3.7 省钱。这种"按负载选版本"的精细化运营,会越来越多地取代"全站统一用一个最新模型"的粗放做法。放到价格-性能的维度上,3.8 Flash 的出现也在挤压中间档付费模型的生存空间——当一个便宜的 Flash 就能逼近高价旗舰在长程任务上的表现,那些靠"略强一点"收溢价的产品,得拿出更硬的差异才站得住。谷歌这步"高频小幅、价格不动"的节奏,本身就是一种对用户友好的市场策略,逼着对手也得在性价比上表态。







