摘要:谷歌发布 Gemini 3.8 Live 与 Extended Thinking 双语音模型,支持推理中持续语音播报、不中断调用工具;Extended Thinking 以 82.6 分登顶语音到语音质量指数,主打更低价格,音频带 SynthID 水印。

9 月 16 日凌晨,Google DeepMind 发布了两款语音优先模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。它们最大的不同在于:不再"先想完再开口"。Extended Thinking 会在推理、等待外部工具返回结果的同时,用"让我查一下……"这类口头提示持续播报进度,并继续对话,同时执行工具调用与 API 请求而不打断会话。这在体验上看似只是更自然了,实际上是把语音从"不能等待"的闲聊场景,推进到了"必须等待"的任务场景——订票、排障、写代码。

07_谷歌Gemini语音边想边说.jpg

榜单上,Extended Thinking 以 82.6 分登顶 Artificial Analysis 的语音到语音质量指数(Speech to Speech Quality Index),微弱领先 OpenAI 的 GPT-Live-1 Astra(81.5%)和 SpaceX AI 的 Grok Voice Think Fast 2.0(81.3%);在智能体任务 τ-Voice 上得 68.6%,Sierra 的银行场景 τ-Voice-banking 得 35.1%。轻量版 3.8 Live 在 Big Bench Audio 上得 97.7%,Speech Agent Arena 用户偏好榜第二,支持 97 种语言并在对话中自动切换。可用范围上,开发者可通过 Gemini API 与 Google AI Studio 调用;消费端进入 Search Live、Gemini App、Google Docs / Gmail / Keep;企业侧在 Gemini Enterprise 私测,Salesforce、Genspark、Lumeris 为首批合作方。谷歌明确主打"比同类前沿语音模型更低的价格",所有音频输出带 SynthID 水印。

需要泼盆冷水的地方也在:官方模型卡显示两个音频模型基于 Gemini 3 Pro,知识截止 2025 年 1 月,仍可能出现幻觉与超时;τ-Voice-banking 只有 35.1%,说明金融等强监管场景远未解决。对开发者而言,Gemini 3.8 Live 最实用的价值是"可投入生产的语音智能体基础模块"——尤其在客服、车载、导购这类按分钟计费的业务里,单位经济性可能一个季度内被重算。SynthID 水印则给"这段语音是不是 AI 合成的"提供了一层可追溯凭证,在深伪风险高企的当下,这点会被企业采购方越来越看重。

把 Gemini 3.8 Live 和上周的 GPT-Live-1 Astra、Grok Voice 放一起看,语音模型的竞争已经悄悄换了个维度:比的不是"谁发音更自然",而是"谁能边想边说、边调用工具还不冷场"。这背后是语音智能体从"问答通道"升级为"任务入口"的产业判断。谷歌敢于主打"更低价格",也说明它想用性价比把语音能力铺进 Search Live 和 Workspace 的亿级用户里,用规模换生态。对国内做语音 Agent 的团队来说,这一仗的参照系已经不是"语音识别率",而是"语音任务完成率"——这才是真正难啃、也真正值钱的部分。