摘要:OpenAI 在 API 中发布全双工语音模型 GPT-Live-1,可同时听和说,前端语音层定价每分钟 0.05 美元。
OpenAI 在 API 里悄悄上线了 GPT-Live-1,一个能"同时听和说"的全双工语音模型。过去做语音助手,通常是先语音转文字、模型想完、再文字转语音,一环扣一环,停顿感明显;GPT-Live-1 把这套链路压成单模型全双工,讲话中途可以打断、可以插话,更像真人通话。它还能把推理和工具调用委派给后端的 GPT-6 Astra 等模型,自己只负责"嘴巴和耳朵",前端语音层定价为每分钟 0.05 美元。
为什么全双工是个质变?因为人类对话的本质就是重叠和打断。老式"半双工"语音系统要等你说完才回应,一旦你想插一句"不对,我是说……",它要么听不见要么重来,体验很脆。全双工让模型能在你说话时就处理、在合适时机接话,延迟和违和感都降下来。对客服、陪练、实时翻译这类场景,这直接决定了用户愿不愿意"真的当它在对话"。和此前的 Advanced Voice 相比,GPT-Live-1 把"听说"做成单模型原生能力,而不是转写加生成的拼接,自然度和打断恢复都更顺。

架构上值得注意:GPT-Live-1 把"语音交互"和"深度推理"解耦——前端轻量模型管实时听说,重活交给后端大模型。这种分层思路,和本期另一篇讲 Agents API 的调子一致:OpenAI 正在把"不同能力放不同模型、用编排串起来"做成标准打法。开发者不必为语音和推理各接一套、再自己拼,成本结构也更清晰。
当然,0.05 美元/分钟听起来不贵,但语音是"挂机即计费"的高频场景。一个 7×24 的语音客服跑一个月,账单得认真算。对创业团队,建议先用真实对话量测一轮:看它在长对话里的稳定性、打断恢复、以及和后端模型来回的延迟叠加是否还能接受。语音 Agent 的终局不是"能对话",而是"让人愿意一直聊下去",这中间的工程细节,比 demo 里的流畅演示残酷得多。
把 GPT-Live-1 放进更大的图里看,它补齐的是"入口层"。文本入口有 ChatGPT,图像入口有 Images,现在语音入口有了 Live——多模态不再只是"能生成什么",而是"能怎么自然地交互"。当语音变得又便宜又顺,一大批原本不会打字或不愿打字的场景会被激活,语音 Agent 的真正战场,可能不在客服,而在所有"手腾不出来、但脑子在转"的瞬间。







