7月30日,马斯克旗下xAI正式推出新一代语音模型Grok Voice Think Fast 2.0。这是该公司迄今能力最强的语音到语音(speech-to-speech)模型,不再依赖传统的“语音识别—大语言模型—语音合成”多阶段流程,而是在理解用户语音后直接生成回应,从而大幅降低延迟。
马斯克连发两条推文,第一条宣布“Grok Voice现在在智能体性能方面排名第一”,第二条直接喊话网友“试试新的Grok Voice”。
在衡量智能体性能的Tau Voice基准测试中,Grok Voice Think Fast 2.0以56.5% 的得分排名全球第一,击败了OpenAI、Google、阿里千问等厂商的语音模型。作为对比,GPT-Realtime-2.1 High得分为45.7%。
在Artificial Analysis语音到语音综合评测中,该模型获得82.9% 的质量指数,高于上一代的75.7%,同时超过GPT-Realtime-2.1 High的79.1%和Gemini 3.1 Flash High的69.5%。
速度是Grok Voice Think Fast 2.0最直观的升级。平均首音频响应时间仅0.70秒,是榜单前五名中唯一低于1秒的模型。相比前代的1.25秒,提升了约44% 。
推理效率同步大幅优化。据钛媒体报道,新模型推理Token消耗仅为1.0版本的40%,相当于减少了60%。模型能够在用户说话过程中同步进行推理,边交流边完成复杂任务,并更快调用外部工具。
在覆盖24种语言、数千条短语的测试中,Grok Voice Think Fast 2.0相比Deepgram Nova 3和ElevenLabs Scribe v2等专业语音转文字模型,准确率提升约1.5至2倍;在噪声环境和电话压缩场景下,优势进一步扩大。
相较于前代,转录准确率也有约1.4倍的提升。
Grok Voice Think Fast 2.0定价为每分钟音频0.08美元(约合每小时4.80美元)。相比前代的0.05美元/分钟有所上涨,但比GPT-Realtime-2.1 High的10.75美元/小时便宜约2.2倍。
该模型已在星链客服场景中完成了真实环境A/B测试。xAI披露的数据显示,使用Grok Voice Think Fast 2.0后,销售转化率和客服自动解决率均实现了显著提升。这不仅是基准测试的成绩,更是真实高并发环境下的可衡量商业影响。
对于开发者而言,最重要的信息是:8月5日,默认模型名称grok-voice-latest将自动升级至Grok Voice Think Fast 2.0。xAI表示,开发者无需修改现有提示词即可迁移。如需继续使用1.0版本,需在截止日期前进行配置。
AI公司Helionova AI的CEO Nick White在X上分享实测体验,称已在旗下产品Tradecraft上完成了全栈语音实时升级,“绝对是一次飞跃式的进步”。在实测中,模型几乎没有明显停顿,能够根据对话内容持续推进情节,并实时作出反馈。
另一位开发者将Think Fast 2.0集成进终端工具GrokTerm,连续发出“切换赛博朋克风格”“切回原主题”等多条指令,模型均快速响应并完成操作,全程对答如流。
xAI软件工程师Parker Conrad表示:“语音领域仍然充满摩擦,Think Fast 2.0向着‘开箱即用’的目标迈进了一大步——这本就是语音模型应有的样子。”

