大模型厂商在语音赛道的军备赛,又多了一名重量级选手。7月20日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS,把“说话”这件事的控制权,从繁琐的参数配置交还到了一句自然语言指令手里。

双版本策略:一个要快,一个要精

本次发布包含两个版本,面向不同场景。

Flash版本主打实时交互,首包延迟约300ms。这个速度意味着智能助手、实时翻译等场景下,用户几乎感受不到等待延迟,对话体验接近真人。

Plus版本聚焦高质量生成,在自然度与音色还原度上更优。音频输出从24kHz提升至48kHz,相当于从电话音质跃升到录音棚规格,单次语音合成最长可达3分钟。

四大核心突破:AI声音从“念稿”到“表演”

第一,自然语言直接指挥,告别参数调教。 Qwen-Audio-3.0-TTS最鲜明的标签是Free-style自然语言指令控制。用户无需专业标注,直接用“温柔客服语气”“带货主播风格”“足球解说员”等日常语言描述,模型即可精准生成对应语音。过去要让AI念出某种语气或风格,往往得在后台调一堆工程参数;如今门槛被大幅削平。

第二,细粒度标签控制,精确到“哪个字后面该倒吸一口气”。 新模型在上一代freestyle基础上实现关键跃迁。用户可直接在文本里嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)这类结构化标记,把控制精度从整段情绪细化到具体字词后的语气细节。这对叙事、游戏配音、有声书等需要精确控制情感表达的场景尤为关键。

第三,多语种与方言覆盖大幅扩展。 Plus版本覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语和菲律宾语。根据CV3-Eval多语种基准测试,在16种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在10种语言中拿下SOTA(最先进水平),韩语和马来语领先幅度最大。在“说话人相似度”评测中,Plus版本包揽全部16种语言的第一名。

中文方言方面,研究团队专门设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言,有效避免了“带普通话腔”的方言问题。

第四,复杂声学鲁棒性。 传统语音克隆往往要求参考音频在安静环境下录制。Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,即便参考音频存在高噪声、高混响,也能自动过滤干扰、只保留音色。

全球权威榜单登顶,商业化落地已启动

发布当日,在全球第三方权威榜单Artificial Analysis的Speech Arena中,Qwen-Audio-3.0-TTS-Plus斩获冠军,Elo评分达1237,综合表现超越Gemini3.1 TTS、ElevenLabs v3等主流模型。其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。

配套的开箱即用精品音色库将陆续上架指令风格音色、20种方言音色、细粒度控制音色以及14+小语种音色。即日起,两款模型已在阿里云百炼平台全面开放调用,开发者可接入体验。

从“能说话”到“会表达”,Qwen-Audio-3.0-TTS让AI第一次学会了在合适的地方叹气、在恰当的时候轻笑。技术指标只是起点,真正改变体验的,是那些藏在[gasp]和[giggles]标签里的细节。