7月31日,阿里巴巴正式发布新一代语音识别大模型Qwen-Audio-3.0-ASR-Flash。与通用语音识别不同,这次的新模型专门解决了一个实际问题:医疗、法律、工业这些领域里,AI总是听错专业术语——医生说的药品名、工程师报的参数、律师念的法条,模型往往一头雾水。

通用语音识别早已不是难题,但听懂专业词汇,才是ASR模型走向行业落地的“最后一公里”。Qwen-Audio-3.0-ASR-Flash要攻克的,正是这个被长期忽视的痛点。

三大核心升级,让AI真正听懂“行话”

第一,长音频上下文记忆。在会议、访谈、课程、直播等长音频场景中,专业术语和英文词汇不能只靠当前几秒的语音准确判断——同一个发音可能对应十几个同音词。新模型新增Context能力:转写当前语音片段时,可参考近期已识别的上下文,延续同一话题中的关键词与语义线索,减少同音词误判。哪怕一场长达数小时的会议录音,同一位发言人的名字、同一个技术概念,也不会因为跨了多个语音片段就被忘记或认错。

第二,行业词识别“不用教” 。传统方案依赖人工维护词表,费时费力。研究团队持续从医疗、IT编程、股票、社会名人等领域挖掘专业词汇,建成了覆盖多行业的高质量词库,将行业词识别内化为模型自身能力。在最新的行业词汇内部评测中,新模型在各行业的专业词“听中率”均有显著提升:医疗场景突破95.36%,工业场景93.24%,IT编程91.87%。

第三,热词定制化“不误触发” 。各行各业的长尾词——人名、品牌名、产品名、行业黑话——频率低、更新快,不可能全部预装进模型。传统方案长期面临一个矛盾:热词加得越多,误触发越多,识别结果反而被带偏。新模型采用声学证据与上下文智能判断的方式,而非简单替换。在传入热词的条件下,热词定制化准确率在所有测试集均达到90%以上,多数场景突破99%。

一步到位:语音识别自带润色能力

Qwen-Audio-3.0-ASR-Flash还具备语音润色能力:口语中的“那个”“嗯”等填充词被直接去除;说话时的自我修正只保留最终意图;散乱的口述自动整理为结构化表达。更重要的是,这些润色由ASR模型在识别环节一步完成,无需再调用下游文本大模型,链路更短、延迟更低、使用成本也更低。

全球第一的实力

此前,Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中获得广泛验证。该系列曾在全球权威AI评测平台Artificial Analysis上,以1.7%的错字率拿下全球第一。

同步推出的Qwen-Audio-3.0-ASR-Streaming面向实时场景,理论出字延迟300毫秒,中文工业场景错字率7.80%,领跑行业。新模型一套覆盖30余种语言,七语种平均语义错误率17.09%,优于Azure、Gemini等竞品。

即日起,Qwen-Audio-3.0-ASR-Flash已通过阿里云百炼平台开放调用,提供实时语音、离线文件转写、长音频识别三个版本。当AI能听懂医生的“口头禅”,能理解工程师的“行话”,语音识别才真正从“能听”走向“能用”——这正是垂直场景里AI落地的关键一步。