马斯克旗下 xAI 于 7 月 29 日正式发布新一代语音到语音模型 Grok Voice Think Fast 2.0。这场升级的目标很明确——让语音 Agent 在真实业务场景中真正靠得住。SpaceXAI 软件工程师 Parker Conrad 直言:“模型的智能水平、准确性和能力几乎让人感觉不真实。语音领域仍然充满摩擦,Think Fast 2.0 向着‘开箱即用’的目标迈进了一大步——这本就是语音模型应有的样子。”

可靠性,是语音 Agent 从“能听能说”走向“能干活”的关键分水岭。过去语音模型常因响应滞后、转录偏差、工具调用迟缓而让实际应用频频碰壁。Grok Voice Think Fast 2.0 在这几个维度上都交出了实打实的成绩。

语音智能体性能登顶,可靠性有了硬指标

在权威评测机构 Artificial Analysis 的 Tau Voice 基准测试中,Grok Voice Think Fast 2.0 以 56.5% 的得分排名第一,击败 OpenAI、Google、阿里千问等厂商的语音模型。AA Speech-to-Speech Quality Index 综合得分达 82.9%,较前代 75.7% 提升 7.2 个百分点。其中,Big Bench Audio 语音推理测试得分 97.2%,Full Duplex Bench 多人实时语音交互测试得分 95.1%,相比前代 77.8% 提升显著。这些数字意味着模型在理解复杂语音指令、处理多人对话场景时更加稳定可靠——不是“偶尔能用”,而是“持续可用”。

0.7 秒响应,把等待感从对话里彻底拿掉

语音 Agent 最怕的从来不是答错,而是让用户等。平均首次语音响应时间从 1.25 秒压缩至 0.70 秒,是目前排行榜前五中唯一低于 1 秒的模型。这一速度明显快于 GPT-Realtime-2 High 的 1.14 秒和 Gemini 3.1 Flash 的 2.98 秒。在真实客服、销售场景中,半秒的差距就是“对话感”与“机器感”的分界线。

嘈杂环境转录准确率提升 10 倍,抗干扰能力大幅增强

xAI 在覆盖数千条短语、24 种语言的内部评估中显示,Grok Voice Think Fast 2.0 的转录表现较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5 至 2 倍,较 1.0 版提升 1.4 倍。在存在明显背景噪声和电话压缩的场景中,xAI 称其与专用语音转文字模型的差距可扩大至约 10 倍。这意味着即使在嘈杂的客服中心、户外或移动通话环境中,模型依然能准确理解用户意图,不会因环境干扰而“断片”。

工具调用在首句说完前完成,Agent 不再“卡壳”

Grok Voice Think Fast 2.0 支持语音并行推理,推理标记使用量中位数较前代下降至 0.4 次,工具调用通常能在智能体完成首句回复前执行。模型可在说话时同步完成推理,无需以额外延迟换取推理能力。同时,强化学习优化了对话策略——更短回答、单次处理一个问题、减少无效信息输出。这让语音 Agent 在执行多步骤任务时不再“说一套、做一套”,而是边说边做、动作跟得上对话。

已在 Starlink 电话服务中跑通,真业务验证可靠性

Grok Voice 已在 Starlink 电话服务中进行 A/B 测试,并带来了销售转化率和客服响应效率的实质提升。多位开发者实测后给出正面反馈——AI 公司 Helionova AI 的 CEO Nick White 称“绝对是一次飞跃式的进步”,并在实测中让模型扮演愤怒投诉客户,与客服进行多轮实时电话对话,整个过程模型几乎没有明显停顿。另有开发者将模型集成进终端工具,连续发出多个切换指令,模型均快速响应并完成操作。

定价方面,该模型每分钟音频费用为 0.08 美元,约为 GPT-Realtime-2.1 High 的 45%。2026 年 8 月 5 日,grok-voice-latest 别名将自动从 1.0 切换至 2.0。

当语音 Agent 开始真正进入客服、销售、办公等实际场景,低延迟、高准确率、多工具协同的语音模型正成为下一阶段智能交互的基础。Grok Voice Think Fast 2.0 用 0.7 秒的响应、56.5% 的智能体榜首成绩和嘈杂环境下 10 倍的抗干扰能力,把“语音 Agent 能不能干活”这个问题,从“试试看”推进到了“放心用”。