Back

SeedRealtime 深度调研:字节原生音视频全双工大模型,与 GPT-Live / Gemini Live 的三条路线之争

2026 年 8 月 5 日,字节跳动 Seed 团队发布原生音视频全双工大模型 SeedRealtime,并在豆包 App 全量上线——官方称这是"业界音视频全双工技术的首次规模化落地"。它的定位不是"会说话的 Chatbot",而是"边看、边听、边说":模型持续看着摄像头画面、听着环境音,自己决定什么时候该开口、什么时候该闭嘴,还能在你没问的时候主动提醒。

这篇调研基于 Seed 官网与官方技术博客的一手资料,结合工程侧(火山引擎 MMT 传输系统)与行业时间线(Seeduplex → GPT-Live → Gemini 3.1 Flash Live)做深度拆解,并把它放进 UMM 系列的脉络里看:如果说之前 UMM 讨论的是"理解与生成在静态内容上的统一",SeedRealtime 回答的是"统一在连续实时流上怎么做"。


一、它是什么:一句话与一组事实

SeedRealtime = 原生音视频全双工大模型(native audio-visual full-duplex LLM):用单一端到端模型统一音频、视频、文本三种模态,在连续的音视频流上实时运行,感知、理解、决策、表达在同一个模型里并行完成。

项目 事实
发布时间 2026 年 8 月 5 日
发布方 字节跳动 Seed 团队
落地产品 豆包 App 全量上线(对话框选"打电话"进入视频通话)
架构 端到端音视频统一建模,单模型完成感知/理解/决策/表达
双工形态 原生全双工,无外置 VAD,轮次判断内化进模型
工程形态 音视频分块输入(chunked)+ 流式生成 + 量化 + 推理优化
传输底座 火山引擎多模态传输系统 MMT(QUIC + MoQ,建联从秒级压到数百毫秒)
核心效果(官方人评) 相比级联模型,对话节奏问题减少一半;打断、迟滞、误触发显著减少;单轮对话顺畅完整率明显提升

需要注意:截至本文写作,官方没有发布论文/技术报告,披露的是产品页 + 技术博客,所以架构细节(tokenizer 结构、参数量、训练数据)未知——本文能确认的是其设计原则、能力形态和工程配套,涉及推测处会明确标注。


二、它要解决的问题:实时音视频交互的两道坎

官方博客把问题定义得很清楚。实时音视频交互长期卡在两种残缺形态之间:

形态一:级联系统(ASR → VLM/LLM → TTS)

  • 语音先转文字、文字喂给大模型、回复再转语音;视觉要经过 VLM 变成文本描述才能参与;
  • 三个模块串联:延迟层层叠加、信息逐级损耗——视觉信息被压成文字时丢掉了空间细节,语音里的语气、停顿在转写时丢失;
  • 每个模块各自的错误向下累积。

形态二:端到端模型但仍是"半双工"

  • 很多端到端语音模型确实流畅,但轮次判断(turn-taking)依赖外置 VAD(语音活动检测):VAD 说"你停了",模型才开始答;
  • 这本质上还是"一问一答的对讲机":不能插话、不会犹豫等待、分不清"用户在思考的停顿"和"用户说完了",更分不清"用户在跟我说"和"背景里别人在聊天"。

SeedRealtime 声称同时跨过两道坎:端到端(消灭级联损耗)+ 原生全双工(把"什么时候说话"变成模型自己的实时决策,而非外部规则)。

博客点出的两个深层难点值得展开:

  1. 对话节奏的模态不对称:语音天然带停顿,停顿可以暗示"该接话了";但视频永远在线、持续变化,没有"视频停顿"这种信号。模型必须一边持续理解画面,一边克制住不因背景噪声/画面变化而频繁插话——持续判断"该看哪个对象、该听谁的声音、此刻该不该回应"。
  2. 音视频联合建模与时序对齐:用户说"这个怎么弄"时,"这个"的指代要靠当前画面 + 手势 + 视线 + 历史动作共同确定;遇到同音词("反攻/返工")或含糊语音,要用视觉场景消歧。声音、画面、时序必须在同一个模型里对齐——视觉信息不需要先转成文字,而是与语音在同一表征空间里联合参与每一次实时判断。

这正是它相对纯语音全双工模型(GPT-Live、Seeduplex、Gemini Live 语音档)的代际差异点:视觉是实时决策的一等公民,不是事后补充的上下文


三、三大核心能力拆解

3.1 音视频联合理解:所见、所闻、所说融为一体

  • 场景消歧:用画面消解同音词和模糊语音;用语音锚定画面中的指代。
  • 多人场景的"认人 + 辨声 + 理解"三合一:多人重叠对话流中,模型同时完成人脸识别(谁是谁)、声纹区分(哪句话是谁说的)、内容理解,全程把"声音—身份"绑定,并在合适时机插话。
    • 官方案例:四位朋友聚餐,用户逐一介绍"浅头发的七七、戴眼镜的 Julia",模型当场对上名字和脸,之后整场对话都能追踪每个人的发言,并综合"有人想拍海景、有人怕热、有人海鲜过敏"给出兼顾所有人的旅行方案。
  • 跨语言场景:川菜馆里外籍食客看中文菜单,模型直接从画面认菜、用英语推荐、顺带讲"鱼香肉丝里为什么没有鱼""皮蛋怎么做的";服务员随口说"很下饭",模型结合画面里的菜理解并翻译——眼前有什么就能答什么,不依赖先拍图再提问。

3.2 主动交互:不等你问,持续观察、适时介入

这是与传统语音助手最根本的体验差异——模型有持续环境感知 + 自主开口权,检测到画面状态变化(关键目标出现、操作出错)可以主动提醒,并能在回应中编织工具调用:

  • 博物馆导览(河北博物院):用户说"看到错金银铜虎噬鹿屏风座就提醒我",镜头移动中模型持续观看,扫到文物时主动开口;随后结合视觉细节讲解四龙四凤铜方案座、长信宫灯及铸造、错金银、焊接工艺。
  • 设备操作纠错(意式咖啡机):看到用户把整颗咖啡豆直接倒进粉碗,立刻指出"要先磨成细粉";萃取后根据油脂(crema)颜色和杯中液量,主动建议"下次萃取时间缩短 2~3 秒"。
  • 高信息密度研读(读 ResNet 论文):结合网络结构图讲 skip connection 如何缓解梯度消失;用户说"翻到训练参数部分提醒我",模型盯着快速翻过的页面,准确定位"3.4 Implementation"并自行停下,念出学习率、momentum、weight decay。
  • 儿童陪伴:妈妈让模型教女儿认动物英文,背景里爸爸一直在打电话,模型不被带偏,始终跟随小女孩手指的方向实时纠正发音、造句。

主动交互的技术含义是:模型的输出不再只由"用户说完话"触发,画面事件本身也是触发源。这要求模型持续维护"用户目标是什么、当前画面发生了什么、我承诺过要留意什么"的状态——是 agentic 的实时版。

3.3 自然对话节奏:turn-taking 内化,抗干扰

  • 轮次判断不再交给外置 VAD 规则,而是模型基于多模态信息持续决策:该插话时不犹豫(backchannel、接话),该沉默时不打断(用户思考停顿、旁人闲聊)。
  • 抗干扰:区分旁人对话、背景噪声与"对我说话"。
    • 官方案例:北京大兴机场嘈杂环境,同伴闲聊提到"老李的航班"模型不被误触发;用户真正询问时,即使航班信息已滚出屏幕,模型仍能调用之前看到并存住的登机牌信息回答到达时间,再联网查行李转盘;走着走着看到网约车指示牌,自然插话指引上车点。
    • 家庭场景:妈妈让模型陪女儿学英语,背景爸爸打电话的声音被持续过滤,不误触发、不跑题。

官方人评数据:相比级联模型,音视频对话节奏问题减少一半——"话没说完被抢断""话音落了反应迟滞""被背景杂音闲聊误触发"三类尴尬显著减少,单轮对话顺畅完整率明显提升。


四、技术实现:官方披露的四个关键词

官方没有给架构图细节,但技术博客明确了四个工程原则:

  1. 端到端统一建模:感知、理解、决策、响应生成在一个模型内完成,消灭 ASR/VLM/TTS 多阶段级联的信息损失与误差累积。
  2. 原生全双工:持续建模对话状态与时机(conversational state and timing),"听"和"说"可以同时进行,模型自己决定说/停/等。
  3. 流式架构:连续音视频分块输入(chunked audio-visual input)+ 流式生成输出(streaming generation),把端到端延迟压到交互可接受范围。
  4. 推理工程:高效量化 + 推理优化提升 serving 效率(支撑豆包全量上线的成本前提)。

传输底座(容易被忽略但很关键):8 月 20 日字节技术团队披露,豆包视频通话的底层完成了从传统 RTC 到火山引擎多模态传输系统 MMT 的代际跃迁:

  • 传统 RTC 下媒体通道与信令通道分离,建联要多轮协商(媒体通道、模型会话、状态同步各自为政),进入可用状态要数秒;
  • MMT 用统一多模态会话架构:客户端基于 QUIC(连接复用、多路复用,一次建联承载音视频/信令/模型状态),传输层基于 MoQ(Media over QUIC) 统一会话控制;
  • 效果:建联耗时从秒级压缩到数百毫秒,点开视频通话几乎"秒接通"。

一句话:SeedRealtime 决定"AI 能做什么",MMT 决定"用户能不能真正感受到"——模型侧的低延迟与传输侧的秒接通是配套的。

可合理推测但未经官方证实的部分:视觉侧大概率是高频抽帧/视频 token 的连续输入(而非每隔几秒拍一张图),因为"翻页监测""目标出现即提醒"这类能力要求帧级连续感知;语音侧应是流式 audio tokenizer 直接进模型(与 Seed-TTS / RealtimeVoice 同源技术积累);turn-taking 作为模型自身输出的一类 token/决策(类似 GPT-4o 以来 full-duplex 路线把 VAD 内化的做法)。这些等论文披露再验证。


五、行业坐标:2026 全双工之战的三条路线

把 SeedRealtime 放进 2026 年的竞争时间线:

时间 玩家 事件 模态 双工
2026.03 Google Gemini Live 部署全双工语音架构 语音 + 视觉(摄像头/屏幕共享) 全双工
2026.04 字节 Seeduplex 原生全双工语音模型,豆包语音通话上线 语音 全双工
2026.07.09 OpenAI GPT-Live 发布(GPT-Live-1 / mini),ChatGPT 语音模式升级 语音(视觉"即将推出") 全双工
2026.07 Google Gemini 3.1 Flash Live 语音 + 视觉 全双工
2026.07 Anthropic Claude 语音模式(Opus/Sonnet) 语音 半双工,不支持中文
2026.08.05 字节 SeedRealtime 发布,豆包全量上线 音频+视频+文本原生统一 原生全双工

三条技术路线的分化非常清晰:

路线 A:前台轻交互 + 后台重思考(GPT-Live)

  • 语音前台负责保持对话连续,复杂推理/搜索/Agent 任务委派给后台 GPT-5.5,用户可手动调智能等级(即时/中等/高);
  • 优势:多步任务、深度思考最强;短板:中文语音自然度一般(评测称"外国人说中文"),文本生成与语音输出偶发不同步导致"卡壳",视觉输入截至 7 月仍未上线。

路线 B:音视频原生统一(Gemini Live / SeedRealtime)

  • Gemini Live 的杀手锏一直是视觉:直接调摄像头/屏幕共享,"展示而非口述"(设备故障识别、界面引导、读物理文档);
  • SeedRealtime 把这条路线推到"视频流持续在线 + 主动交互":不止"你问的时候看一眼",而是"一直在看、该说就说"。中文口语节奏、抗干扰、动态判停是豆包系的传统强项(第三方车载实测:Seeduplex 抢话比例较半双工降约 40%,误回复/误打断率减半,延迟 80ms 级别)。

路线 C:纯语音全双工(Seeduplex、Moshi 路线)

  • 不处理视频流,把语音对话的自然度做到极致。SeedRealtime 可以看作字节从 Seeduplex(音频全双工)向"音视频全双工"的升维。

开源学术脉络(SeedRealtime 未开源,但同范式有迹可循):

  • Moshi(Kyutai,2024):首个开源全双工语音对话模型,Inner Monologue 机制预测 turn-taking;
  • Freeze-Omni(腾讯/西工大/南大,VITA 系列,arXiv:2411.00774):冻结 LLM 接入语音输入输出,解决语音对齐导致的灾难性遗忘,语音问答准确率超 Moshi/GLM-4-Voice;
  • VITA 系列:开源多模态全双工方向的主要推动者;
  • OpenOmni(NeurIPS 2025):渐进式多模态对齐,7B 模型 OmniBench 超 VITA,非自回归语音 <1s 延迟;
  • MiniCPM-o 4.5(面壁):10B 以下"边看边听主动说"的全双工全模态模型;
  • Wan Streamer(阿里,v0.1):单端到端 Transformer 输出同步音视频的数字人,双 GPU 流水线(context 处理器 + flow-matching performer)把模型侧响应压到约 200ms、总交互约 550ms——证明"实时全双工音视频该用单模型而非堆流水线"。

SeedRealtime 的位置:工业界第一个把"音视频原生全双工"做到亿级产品全量上线的模型。开源同行验证了路线可行,字节用工程能力把它变成了默认体验。


六、放进 UMM 脉络:从"静态统一"到"流式统一"

这个系列前几篇讨论的 UMM(Janus-Pro、BAGEL、SenseNova U1/U1.5、GAS、VGAU-Diag),统一的是静态内容上的理解与生成:给一张图/一段文字,输出一张图/一段文字。SeedRealtime 代表的是统一模型的另一个轴——时间轴上的统一

  1. 输入从"样本"变成"流":不是"给一段视频做理解",而是无终点的音视频流持续输入,模型在每个时刻都要决定"看什么、听谁、说不说"。
  2. 输出从"响应"变成"行为决策":输出不只是答案文本/语音,还包括沉默、等待、插话、主动提醒、调用工具——turn-taking 本身就是模型要学习的生成目标。这与 UMM07 后训练篇里"把交互行为纳入奖励/策略"的逻辑一致,只是信号全部实时化。
  3. VGAU-Diag 的诊断在这里有了新注脚:那篇论文说"UMM 的瓶颈在视觉理解侧,连正确的视觉辅助都用不好"。SeedRealtime 的三大能力里,视觉持续理解(认人、辨指代、监测目标出现、读 crema 颜色)恰恰是主菜——它押注的正是"视觉理解必须实时、连续、与听觉对齐",而非生成侧。官方人评里"节奏问题减半"主要来自理解-决策链路(知道该不该说),而非语音合成质量。
  4. GAS 的"训练时生成、推理时丢弃"思想的远亲:实时系统对推理成本极度敏感(豆包全量上线),SeedRealtime 选择把所有能力压进单一端到端模型 + 量化 + 流式,而不是级联一堆模块——与 GAS"推理路径越短越好"的取向一致,只是它不能丢弃生成分支(语音就是产品本体)。

官方展望里的四个方向也值得追踪:① 更低延迟与更自然 timing(不只是更快,而是时机更好);② 更主动的感知决策("该说时说"升级为"该做时做");③ 复杂多人场景的鲁棒性(谁在说、谁在看、该回应谁);④ 从"会对话"到"会行动"——工具调用连接真实世界,实时多模态理解变成查、订、办的具体动作。第四条意味着 SeedRealtime 的终局是实时多模态 Agent 的交互底座,不是聊天机器人。


七、判断与待验证清单

几个明确判断:

  1. 全双工的竞争已经从"语音"升维到"音视频"。GPT-Live 还在补视觉课,Gemini Live 有视觉但主动交互弱,SeedRealtime 是第一个把"持续视觉在线 + 自主开口 + turn-taking 内化"打包上线的——时间窗口优势真实存在,但 OpenAI/Google 的跟进速度会很快。
  2. "主动交互"是比"全双工"更大的产品变量。全双工解决"别抢话/别迟钝",主动交互改变的是人机关系:从"我问你答"到"你看着我办事"。博物馆提醒、咖啡机纠错、论文翻页监测这些场景,本质是视觉 agent 的实时化,这与本系列运动调研里"教练 Copilot 实时纠错"是同一个技术母体。
  3. 工程闭环是字节的真实壁垒:模型(SeedRealtime)+ 传输(MMT/QUIC/MoQ 秒接通)+ 产品(豆包全量)+ 成本(量化/流式 serving)四件套同时到位,才谈得上"规模化落地"。单点模型能力可以被追,整套交付体系追起来慢。
  4. 评测体系会成为新战场。官方只给了"节奏问题减半"的人评结论,学术界还没有公认的音视频全双工 benchmark(turn-taking 自然度、误触发率、主动交互有用率、多人指代准确率怎么量化?)。谁定义评测,谁定义这一代交互的好坏。

待论文/技术报告披露后验证的问题:

  • 视觉 token 的采样率与编码方式(抽帧频率、是否连续视频 tokenizer);
  • turn-taking 的建模形式(专用 token?并行头?训练数据怎么造"该不该说话"的标签);
  • 主动交互的训练信号(如何奖励"该开口时开口"同时惩罚"话痨"——这是典型的 RL 稀疏奖励问题);
  • 参数量、延迟数字(端到端从用户说完到模型发声的具体毫秒数)、量化方案;
  • 多人场景下"认人+辨声"的绑定机制是端到端涌现还是显式模块。

参考链接

评论