7月20日,阿里通义千问正式发布语音合成大模型Qwen-Audio-3.0-TTS。新模型在细粒度标签控制、自由风格指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现了系统性提升,让合成语音从“能说话”走向“会表达”。

双版本策略:一个要快,一个要精

本次发布包含两个版本,面向不同场景。

Flash版本主打实时交互,首包延迟约300ms。这个速度意味着智能助手、实时翻译等场景下,用户几乎感受不到等待延迟,对话体验接近真人。

Plus版本聚焦高质量生成,在自然度与音色还原度上更优。面向有声读物、课件配音、影视配音等专业创作场景,音频输出从24kHz提升至48kHz,相当于从电话音质跃升到录音棚规格,单次语音合成最长可达3分钟。

四大核心突破:AI声音从“念稿”到“表演”

第一,多语种与方言覆盖大幅扩展。 Plus版本覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语和菲律宾语。在CV3-Eval多语种基准测试中,Qwen-Audio-3.0-TTS家族在16种语言的“词/字错误率”评测里拿下10项SOTA(最先进水平),韩语和马来语领先幅度最大;在“说话人相似度”评测中,Plus版本包揽全部16种语言的第一名。

中文方言方面,研究团队专门设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言,避免了“带普通话腔”的方言问题。

第二,自由风格自然语言指令。 用户无需专业标注,直接用“温柔客服语气”“带货主播风格”“足球解说员”等自然语言描述,模型即可精准生成对应语音。上一代版本已支持这一能力,新模型在此基础上进一步提升了指令遵循的精度。

第三,细粒度标签控制,精确到“哪个字后面该倒吸一口气”。 用户可直接在文本里嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等结构化标记,把控制精度从整段情绪细化到具体字词后的语气细节。这对叙事、游戏配音、有声书等需要精确控制情感表达的场景尤为关键。

第四,复杂声学鲁棒性。 传统语音克隆往往要求参考音频在安静环境下录制。Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,即便参考音频存在高噪声、高混响,也能自动过滤干扰、只保留音色。

全球权威榜单登顶,商业化落地已启动

发布当日,在全球第三方权威榜单Artificial Analysis的Speech Arena中,Qwen-Audio-3.0-TTS-Plus斩获冠军,Elo评分达1237,综合表现超越Gemini3.1 TTS、ElevenLabs v3等主流模型。其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。

配套的开箱即用精品音色库将陆续上架指令风格音色、20种方言音色、细粒度控制音色以及14+小语种音色。即日起,两款模型已在阿里云百炼平台全面开放调用。

从“能说话”到“会表达”,Qwen-Audio-3.0-TTS让AI第一次学会了在合适的地方叹气、在恰当的时候轻笑。技术指标只是起点,真正改变体验的,是那些藏在[gasp]和[giggles]标签里的细节。