7月20日,字节跳动Seed团队正式发布音频创作模型Seed Audio 1.0。这是继Seedance(视频生成)、Seedream(图像生成)之后,Seed家族在音频赛道上的又一块拼图。
如果说传统TTS是让机器“会说”,Seed Audio 1.0要做的是让机器“会创作”——一次生成一段完整的、可服务于叙事的音频作品。
一、从“拼素材”到“一次成型”:音频制作的范式转移
影视级音频内容的生产,长期以来遵循一套固定流程:TTS生成人声、素材库找背景音乐、音效库找环境声和拟音,再拖进剪辑软件逐轨拼接、混音。一套流程下来,少则几十分钟,多则数小时。
Seed Audio 1.0的解法截然不同。它不是简单拼接素材,而是在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端生成服务于叙事的“完整声音作品”。
用一句话概括:把“TTS → 找音乐 → 找音效 → Premiere混音”四步走,压缩成“写一段提示词 → 生成”两步。
声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到“听见”即“看见”。
二、三大核心能力:精度、稳定与多语种
据官方介绍,Seed Audio 1.0具备三大核心能力:
精准的时空编排。 支持以100毫秒的精度按时间线控制对白、音效的入场时机。这意味着在视频配音、广告制作中,创作者可以精确控制“什么时候说话、什么时候环境声起、什么时候背景音乐进”,而不是让AI随机发挥。
稳定的音色演绎。 支持零样本生成与长音频延展。在保持角色音色一致性的同时,能自然呈现愤怒、喜悦、恐惧、平静等不同情绪。甚至允许同一音色演绎多个角色,大幅减少后期修音工作。
地道的多语种支持。 覆盖包括中文、英语、日语在内的20余种语言。确保声音在不同语种下都能符合本土的表达节奏与重音习惯。
三、不只是TTS:一次生成完整声音场景
Seed Audio 1.0最核心的差异化,在于它并非“把文字读出来”的传统TTS。它理解整个场景。
输入一段提示词,比如“一位老人站在海边,缓慢讲述自己的童年,远处传来海浪,背景播放轻柔钢琴”,模型直接输出包含人声对白、环境音、背景音乐的完整音频。在ComfyUI等平台上,它甚至支持通过单一提示词生成语音、音乐、音效以及多说话人对话。
它还支持参考音频(Reference Audio)。创作者可以上传一段说话人的声音、一段背景音乐或一段环境音,模型学习参考素材的风格后再进行新的生成。
评测数据显示,该模型在九大类常见创作场景中的音频可用率已超过90% ,多语言生成的自然度MOS评分普遍达到4分以上(优秀水平)。
四、与Seed Music的区别:两个不同的战场
很多人容易混淆Seed Music与Seed Audio。
Seed Music聚焦AI作曲、歌曲生成、风格迁移、歌声转换和音乐编辑。Seed Audio更关注语音、音效、环境声和全场景声音生成。可以理解为:Seed Music更偏向音乐创作,Seed Audio更偏向完整的AI音频内容生成。
两者不是替代关系,而是并行的两条线。
五、补全豆包全模态创作的最后一块拼图
Seed Audio 1.0的发布,标志着豆包已全面覆盖文字、图像、视频及音频四大内容模态,形成端到端的AI创作闭环。
随着该音频模型的正式上线,结合同步发布的图文与视频生成工具,内容创作者得以在一个统一平台上完成全流程智能生产。从Seedance到Seedream再到Seed Audio,字节跳动正在把“多模态创作”从一个口号,变成一套可实际使用的工具链。
目前,Seed Audio 1.0已在火山方舟体验中心上线,向创作者开放测试。团队计划未来进一步融合视频参考等多模态输入,并探索可控翻译技术,持续优化长音频与分轨生成能力。
