摘要:Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款近实时语音对话模型,主打低延迟、强连贯、可打断的自然对话,面向语音智能体。

实时语音赛道今天又多了一个重量级选手。Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时语音对话模型,主打低延迟、强连贯的自然对话,还支持用户随时打断。这意味着比拼的不只是"能不能说",而是"像不像真人在聊"——停顿、接话、被打断后自然续上,这些才是语音交互的体验命门。

和上个月发布的 Gemini 3.8 Flash(文本/多模态底座)不同,Live 系列是原生为语音交互设计的,面向的是客服、陪伴、车载语音、实时翻译这类"张嘴就说"的场景。Extended Thinking 版本则在实时对话里保留了推理能力,遇到复杂任务能边想边答,而不是甩出一段机械的背诵。

08-Google-Gemini-3.8-Live实时语音.jpg

我的看法:实时语音正在成为继文本之后的第二个主战场,而且商业化路径更短——客服机器人、智能音箱、车载助手都是现成的付费场景。谷歌的优势在于全家桶:Gemini 进得了手机(Android)、进得了车(Android Auto)、进得了智能家居(前面提到的 Home MCP)。当语音模型、Agent 和硬件入口被同一家打通,构筑的护城河比单点模型更深。

但要清醒,语音模型的坑在延迟和成本。低延迟意味着要在端侧或近实时推理上砸资源,连贯性又依赖长上下文和状态管理,这些都会推高每次调用的开销。对做客服和陪伴的团队,Gemini 3.8 Live 是个强底座选项,但落地前得把"每通对话的成本"和"用户容忍的延迟上限"算清楚。底座变多、变强是好事,真正的竞争会落在"谁把语音 Agent 跑得又便宜又像人"上。