7月29日,AI语音公司Fish Audio在成立一周年之际,正式推出新一代生产级语音大模型S2.1Pro。这款模型专为实时对话场景打造,而非传统“念稿式”的文本转语音(TTS)系统。

同期,Fish Audio宣布完成5200万美元种子轮融资。

90毫秒首帧延迟:让AI“接话”像真人一样自然

实时对话的核心指标是延迟。S2.1Pro实现了约90毫秒的首帧音频播放延迟。作为对比,上一代S2-Pro的延迟约为100毫秒。

90毫秒意味着什么?人类对话中,200-300毫秒的停顿是“正常思考”,超过500毫秒才会感到“卡顿”。90毫秒已经低于人类感知阈值——AI接话的速度已经快到让你感觉不到它在“思考”。

83种语言+统一架构:一个模型,说遍全球

S2.1Pro覆盖83种语言,采用统一语音识别架构。无论输入哪种语言,模型自动检测并生成对应语音,且在不同语言之间切换时保持相同的音色身份。

对比上一代S2-Pro支持80多种语言,S2.1Pro在语言覆盖和生成质量、延迟、吞吐量上均实现了全面升级。

括号标签:突破预设情绪菜单的“文本内控制”

这是S2.1Pro最具突破性的设计。传统语音模型通过预设情绪菜单控制情感(如选择“开心”“悲伤”),而S2.1Pro允许用户直接在输入文本中嵌入自由格式的括号标签——[whispers sweetly](温柔耳语)、[laughing nervously](紧张笑声)、[gasp](倒吸一口气)。

模型通过学习海量数据集,建立了自然语言描述与声学变化之间的隐式映射——你不受预设标签列表的限制,几乎可以使用任何描述性表达。

常见标签包括:[whisper](耳语)、[laugh](笑声)、[emphasis](强调)、[sigh](叹息)、[gasp](抽气)、[pause](停顿)、[angry](愤怒)、[excited](兴奋)、[sad](悲伤)、[surprised](惊讶)。标签可以放在文本的任意位置,在特定词句上精准施加情绪控制。

S2.1Pro支持逐词级别的情绪、语调和速度控制。

多说话人对话+5秒声音克隆:配音不再需要一屋子演员

S2.1Pro原生支持多说话人对话生成——同一段文本中,不同角色的台词可以自动匹配不同的音色。

声音克隆能力同样大幅提升。仅需5秒音频样本即可完成人声克隆,或使用10至30秒短参考样本完成高质量克隆,精准复刻目标语调与说话风格,无需额外微调。

生成速度约为Cartesia的2倍,制作成本约为ElevenLabs的六分之一。

Fish Audio还做出了一个颇为激进的承诺:如果企业在采用其语音AI服务后成本降低不足50%,将提供一年免费服务。

商业化:付费API+一个月免费试用

S2.1Pro已通过Fish Audio API正式上线。提供两个版本:

s2.1-pro:生产级版本,定价15美元/百万UTF-8字节

s2.1-pro-free:同一模型,免费用于测试、原型开发和小规模业务

为庆祝成立一周年,Fish Audio向所有用户提供S2.1Pro一个月的免费访问权限。

目前已有HeyGen、LiveKit、Retell、Sanas、OpenArt等多家公司在生产环境中采用Fish Audio的模型。

结语

S2.1Pro的技术指标和产品设计指向一个清晰的判断:语音AI正在从“脚本式合成” 加速演进为“实时对话交互” 。当延迟压到90毫秒、情绪控制精确到逐词级别、声音克隆缩减到5秒,语音交互的下一个分水岭可能已经到来。

Fish Audio没有在追逐“更大的模型”,而是在重新定义“更自然的对话”。