8月5日,字节跳动Seed团队正式推出原生音视频全双工大模型 SeedRealtime,并宣布该模型已在豆包App全量上线。用户将豆包更新至最新版本后,在对话框内选择“打电话”进入视频通话界面,即可直接体验。在业界,这算是率先把音视频全双工技术推到了规模化落地的位置。

告别“听—转写—想—说”的流水线

用过传统AI视频通话的人都有个痛点:对话节奏总是“卡拍”——要么话没说完它急着抢答,要么说完了还要愣一两秒才反应过来。

传统级联系统通常是“听—转写—想—说”逐段拼接的,语音识别(ASR)、视觉模型、文本生成、语音合成(TTS)分属不同模块,还要依赖外部的语音活动检测(VAD)判断轮次。这种流水线作业不仅延迟高,还容易在传递中丢失信息,本质上仍接近一问一答的半双工交互。

SeedRealtime最核心的差别在架构——它采用统一的端到端架构,把音频、视频和文本原生融合在一起,不再依赖外部模块进行轮次判断。模型一手接住画面和声音,一手直接生成回应,在连续的多模态信息流中同步完成感知、理解、决策与表达。它不是先听完、再看完、最后作答,而是让感知、理解、决策与表达同步进行。

长着眼睛、耳朵和嘴巴的“分寸感”

SeedRealtime实现了三项核心突破:

音视频联合理解:原生支持声音、画面与时序信息的深度融合。模型能结合场景消解同音词歧义——用户说“这个怎么弄”时,它能结合画面、手势和视线判断“这个”具体指向什么;也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。

主动的交互能力:具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。在官方展示的案例中,模型能在多人聚会中识别不同人物身份并持续对应发言者,在博物馆里持续观察镜头画面、识别到指定文物后主动提醒,甚至在你操作咖啡机时根据画面变化实时纠错。

流畅的交互节奏:能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应。同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发。在机场等嘈杂场景中,它能区分你和旁人的对话,不会因为背景噪声或无关聊天被误触发。

对话节奏问题减少了一半

端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半。模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;单次对话能够完整、顺畅交流的概率也有明显提升。

一条新的技术路线

对全模态智能助手而言,SeedRealtime给出了一条新路线——不再依赖把多个单模态模型用管道串起来,而是让一个模型同时长着眼睛、耳朵和嘴巴。

字节Seed团队表示,未来将继续优化端到端时延、主动感知与决策能力、多人复杂场景理解以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。

当AI能一边看着你操作、一边听着你说话、一边给出实时反馈,对话不再“卡拍”时,全模态自然交互才真正从实验室走进了每个人的手机。SeedRealtime已经在豆包里等着你了。