Back

全双工语音模型精读⑨:字节 Seeduplex 与 SeedRealtime——RL 话轮决策到音视频原生全双工

全双工语音模型系列精读第 9 篇。本文基于字节 Seed 官方页面与火山引擎 API 文档,梳理字节语音全双工两步走:纯语音的 Seeduplex(2026.4)与音视频原生的 SeedRealtime(2026.8)。配套总览见《全双工语音大模型全景调研》。

一、字节的两步走

字节在全双工上是"先纯语音规模化落地,再音视频原生"的节奏:

  1. Seeduplex(2026.4):原生全双工纯语音大模型,豆包 App 全量上线,官方称率先实现规模化落地;
  2. SeedRealtime(2026.8.5):单端到端模型统一音频/视频/文本的音视频原生全双工。

二、Seeduplex:用强化学习学"什么时候该停"

来源:Seed 官方页(seed.bytedance.com/seeduplex)+火山引擎 API 文档。

技术思路

  • 官方定位"原生全双工语音大模型",不依赖外部 VAD 硬切;
  • 路线:海量语音数据预训练 + 强化学习做话轮决策(turn-taking),语音语义联合建模实现抗干扰、动态判停;
  • 这是把"话轮智能"显式当作一个 RL 优化目标——和 Moshi 的双流自然涌现、Freeze-Omni 的 chunk 状态分类都不同。

官方一手数据

指标 提升
判停延迟 降低约 250ms
复杂场景 AI 抢话比例 减少 40%
打断响应延迟 缩短约 300ms
强声学干扰下误回复/误打断率 降低一半
判停 MOS +8%
对话流畅度 MOS +12%

人人对比(官方如实披露)

  • 判停表现比半双工方案显著提升,打断响应稳定性略优于人人对话平均水平
  • 但整体流畅度与真人对话仍有差距——官方没有回避这一点。

落地

  • 豆包 App 全量上线;API 侧为豆包实时语音模型 3.0,WebSocket 接入,支持 function calling。

三、SeedRealtime:音视频原生全双工,无外置 VAD

来源:Seed 官网(seed.bytedance.com/en/SeedRealtime)。

核心设计

  • 单端到端模型统一音频、视频、文本三模态;
  • 无外置 VAD:turn-taking(话轮切换)内化为模型的实时决策,而非外部声学开关;
  • 分块(chunked)音视频输入 + 流式生成;传输底座为火山引擎 MMT(QUIC + MoQ),建联在数百毫秒级。

视觉带来的三个新能力

  1. 视觉消歧同音词:画面上下文帮助 resolve 语音歧义(比如"这个东西"指什么);
  2. 多人场景"认人 + 辨声 + 理解":区分不同说话人及其注意力指向;
  3. 画面事件触发主动开口与工具调用:模型不必等用户发问,看到关键事件可主动提示(proactive)并调用工具。

官方人评

  • 音视频对话的节奏问题(该说不说、不该说抢话)较级联模型减少约一半

四、在全双工版图里的位置

  • Seeduplex 是"话轮决策用 RL 显式优化"的代表:把抢话率、误打断率、判停延迟直接作为优化与评测指标,代表竞争焦点从"延迟数字"转向"社交节奏";
  • SeedRealtimeGemini Live、Gander 同属"音视频原生全双工"第一梯队,且都强调视觉在环 + 主动交互;三者差异:
    • SeedRealtime:闭源、豆包/火山引擎规模化落地,MMT 传输底座;
    • Gemini Live:闭源云 API、Flash 轻量、Google 搜索;
    • Gander:开源、小脑-大脑 Agent 编排、可复现;
  • 字节路线的特点是产品化与数据闭环最强(豆包亿级用户反传话轮决策),工程上用 RL 而非纯架构手段解决"何时说话"。

局限:两者均闭源(API/产品形式),无开源权重;SeedRealtime 的具体模型规模、延迟数值官方未完整公开,评测以官方人评口径为主。

参考来源

  1. 字节 Seeduplex 官方页:https://seed.bytedance.com/seeduplex
  2. 火山引擎实时语音 API 文档:https://docs.volcengine.com/docs/6561/2549778
  3. 字节 SeedRealtime 官方页:https://seed.bytedance.com/en/SeedRealtime

评论