全双工语音模型系列精读第 9 篇。本文基于字节 Seed 官方页面与火山引擎 API 文档,梳理字节语音全双工两步走:纯语音的 Seeduplex(2026.4)与音视频原生的 SeedRealtime(2026.8)。配套总览见《全双工语音大模型全景调研》。
一、字节的两步走
字节在全双工上是"先纯语音规模化落地,再音视频原生"的节奏:
- Seeduplex(2026.4):原生全双工纯语音大模型,豆包 App 全量上线,官方称率先实现规模化落地;
- SeedRealtime(2026.8.5):单端到端模型统一音频/视频/文本的音视频原生全双工。
二、Seeduplex:用强化学习学"什么时候该停"
来源:Seed 官方页(seed.bytedance.com/seeduplex)+火山引擎 API 文档。
技术思路
- 官方定位"原生全双工语音大模型",不依赖外部 VAD 硬切;
- 路线:海量语音数据预训练 + 强化学习做话轮决策(turn-taking),语音语义联合建模实现抗干扰、动态判停;
- 这是把"话轮智能"显式当作一个 RL 优化目标——和 Moshi 的双流自然涌现、Freeze-Omni 的 chunk 状态分类都不同。
官方一手数据
| 指标 | 提升 |
|---|---|
| 判停延迟 | 降低约 250ms |
| 复杂场景 AI 抢话比例 | 减少 40% |
| 打断响应延迟 | 缩短约 300ms |
| 强声学干扰下误回复/误打断率 | 降低一半 |
| 判停 MOS | +8% |
| 对话流畅度 MOS | +12% |
人人对比(官方如实披露)
- 判停表现比半双工方案显著提升,打断响应稳定性略优于人人对话平均水平;
- 但整体流畅度与真人对话仍有差距——官方没有回避这一点。
落地
- 豆包 App 全量上线;API 侧为豆包实时语音模型 3.0,WebSocket 接入,支持 function calling。
三、SeedRealtime:音视频原生全双工,无外置 VAD
来源:Seed 官网(seed.bytedance.com/en/SeedRealtime)。
核心设计
- 单端到端模型统一音频、视频、文本三模态;
- 无外置 VAD:turn-taking(话轮切换)内化为模型的实时决策,而非外部声学开关;
- 分块(chunked)音视频输入 + 流式生成;传输底座为火山引擎 MMT(QUIC + MoQ),建联在数百毫秒级。
视觉带来的三个新能力
- 视觉消歧同音词:画面上下文帮助 resolve 语音歧义(比如"这个东西"指什么);
- 多人场景"认人 + 辨声 + 理解":区分不同说话人及其注意力指向;
- 画面事件触发主动开口与工具调用:模型不必等用户发问,看到关键事件可主动提示(proactive)并调用工具。
官方人评
- 音视频对话的节奏问题(该说不说、不该说抢话)较级联模型减少约一半。
四、在全双工版图里的位置
- Seeduplex 是"话轮决策用 RL 显式优化"的代表:把抢话率、误打断率、判停延迟直接作为优化与评测指标,代表竞争焦点从"延迟数字"转向"社交节奏";
- SeedRealtime 与 Gemini Live、Gander 同属"音视频原生全双工"第一梯队,且都强调视觉在环 + 主动交互;三者差异:
- SeedRealtime:闭源、豆包/火山引擎规模化落地,MMT 传输底座;
- Gemini Live:闭源云 API、Flash 轻量、Google 搜索;
- Gander:开源、小脑-大脑 Agent 编排、可复现;
- 字节路线的特点是产品化与数据闭环最强(豆包亿级用户反传话轮决策),工程上用 RL 而非纯架构手段解决"何时说话"。
局限:两者均闭源(API/产品形式),无开源权重;SeedRealtime 的具体模型规模、延迟数值官方未完整公开,评测以官方人评口径为主。
参考来源
- 字节 Seeduplex 官方页:https://seed.bytedance.com/seeduplex
- 火山引擎实时语音 API 文档:https://docs.volcengine.com/docs/6561/2549778
- 字节 SeedRealtime 官方页:https://seed.bytedance.com/en/SeedRealtime