摘要:科大讯飞推出 Spark-Audio-1.0-Preview 语音基座模型,整套训练跑在国产算力上,支持99种语言+202种方言,能听懂语气情绪与环境音,面向会议客服场景。

语音赛道今天有个被低估的国产突破。科大讯飞推出全新语音大模型 Spark-Audio-1.0-Preview,关键不在于"又多了一个语音模型",而在于整套训练跑在国产算力上——这在中美算力博弈的背景下,本身就是一张牌。模型支持99种语言加202种方言,不只能把语音转成文字,还能听懂语气情绪、环境背景音,区分不同说话人。

传统语音工具的天花板很清楚:转写准确率再高,也只是一堆冷冰冰的文字,丢掉了"谁在说、什么情绪、什么场合"这些真正影响理解的信息。Spark-Audio-1.0 的卖点恰恰是把声学、语言、情感和说话人这些维度一起建模,让机器从"听清字"进阶到"听懂意思"。面向的场景也很务实:会议(谁说了什么、情绪如何)、客服(用户是愤怒还是犹豫)、多语种直播(实时跨语言转写)。这些恰恰是语音技术最能直接变现、也最考验真实鲁棒性的地方。

我的判断:讯飞这次选的路线很聪明——不在通用文本大模型上和头部硬刚,而是在自己深耕二十多年的语音阵地,用"全国产算力+多语种+情感理解"做差异化。202种方言这个数字是真功夫,背后是长期积累的汉语方言语料和场景数据,不是靠堆参数能速成。在信创和自主可控的大背景下,一个完全不依赖海外算力的语音基座,对政府、金融、医疗这些敏感行业,吸引力是实打实的。

当然,语音大模型的终局竞争不只是识别率,而是和Agent、会议的深度集成能力。讯飞能不能把 Spark-Audio 变成工作流里"听得懂人话"的那一层,决定了它从技术亮点走到商业闭环的距离。但至少今天,国产语音模型在自主可控这件事上,先赢了一局。