7月29日,OpenAI在X平台发布公告,正式推出两款新一代转录模型——GPT-Live-Transcribe与GPT-Transcribe,均通过API开放调用。新模型不再只是把声音转成文字的“搬运工”,而是学着去听懂一句话背后的上下文——口音、术语、数字,乃至背景里那阵喧闹的人声,都不再轻易让它犯晕。
一、两款模型,各司其职
OpenAI此次采用了分场景定价的策略,两款模型分别对应不同的使用需求。
GPT-Live-Transcribe专为低延迟实时转录而设计,适用于麦克风、通话等实时音频流场景。它的定位像一位贴着说话人同步落笔的速记员,每分钟收费0.017美元,约合0.12元人民币。
GPT-Transcribe则针对已完成音频文件的异步转录和批量工作负载进行了优化。它更适合事后成批消化录音的活儿,价格压到了每分钟0.0045美元,约合0.03元人民币。
实时转录模型的定价约为批量转录模型的3.8倍,反映了实时推理相比批量处理更高的计算成本。
二、性能碾压:错误率砍半,上下文理解大幅提升
真正拉开代差的,是它们在准确率上的表现。
在Common Voice覆盖的22种语言中,GPT-Transcribe把转录错误率压到了19.27%,而Whisper(whisper-1)还停在40.37%——差距超过一倍。
放到真实世界音频录制基准的九种语言上,差距更加明显:GPT-Transcribe实现了8.98%的转录错误率,而Whisper为15.21%。GPT-Live-Transcribe同样优于2026年5月推出的gpt-realtime-whisper。
新模型对语境的消化能力同样值得关注。在Context Aware ASR基准上,GPT-Transcribe的语义准确率从没有自由形式上下文时的41.6%,一路爬升到接入上下文后的45.2%。它开始明白,同一个词在不同对话里可能意味着完全不同的东西。
GPT-Live-Transcribe在相同基准上,语义准确率从38.5%提高到了44.6%。
两款模型在抗噪能力上也表现出色。OpenAI甚至展示了在乐器演奏过程中进行实时语音转录的演示,证明了其强大的噪声抑制能力。模型支持多种语言,并能处理医学、法律、工程等行业的专业术语。
三、定价策略:用低价抢占开发者市场
OpenAI这两款新模型的定价,放在整个语音转录市场中相当有竞争力。
GPT-Transcribe的批量转录定价为每分钟0.0045美元(约每小时0.27美元),与Deepgram Nova-2的每分钟0.0043美元几乎持平。GPT-Live-Transcribe的实时转录定价为每分钟0.017美元(约每小时1.02美元)。
对于现有Whisper用户,OpenAI提供了明确的迁移路径。开发者可以通过单一API同时获得批量和实时转录能力,相比拼接多个供应商的方案,集成复杂度大幅降低。微软作为OpenAI最大投资者和主要云合作伙伴,Azure将成为新模型的首选部署路径。
四、战略意义:OpenAI从文本和图像延伸至语音赛道
此次发布标志着OpenAI正从文本和图像生成领域,进一步扩展至语音转录这个竞争激烈的市场。谷歌Cloud Speech-to-Text、亚马逊Transcribe和Deepgram都是这个赛道上的老玩家。
OpenAI的优势在于其已有的开发者基础——数百万开发者已在文本和图像生成中使用OpenAI的API,语音转录能力的加入创造了一个自然的交叉销售机会。企业采用AI语音助手的速度正在加快,AI驱动的呼叫中心、医疗转录和会议摘要工具正在推动市场增长。
当机器能听清带噪环境下的专业术语,语音交互那扇一直半掩的门,似乎又被推开了一道缝。Whisper自2022年树立的转录基准,正在被OpenAI自己的新一代模型全面超越。



