Back

全双工语音模型精读⑪:流式视频理解 VLM 全景——从音频全双工到'边看边想边开口'

本文基于开源文献地图仓库 Awesome-VLM-Streaming-Video(京东探索研究院维护)做一次领域全景梳理。它汇集了 2024–2026 年"流式/在线视频理解"方向的上百篇 VLM 论文与开源代码,并按技术主题分类——这恰好是「全双工语音模型精读」系列的横向延伸:从"听"到"边看边想边开口"。

〇、一句话看懂这个系列和这次的关系

前 10 篇都在讲"实时全双工语音/音视频交互模型":Moshi、Qwen-Omni、GPT-Live、Gemini Live、SeedRealtime、Qwen3.8-Omni……它们的共性是把"边说边听"做到原生。

但全双工的下一站是**"看着视频还能自主决定何时开口"——这就是流式视频理解(Streaming Video Understanding)要解决的问题。它不只读懂单帧,而是要在无限长、实时到达的视频流上持续感知、记忆、推理,并在合适的时机主动**介入。于是核心难点从"怎么说得快"转移到四件事:

  1. 主动交互:模型自己判断"现在该不该说话/该安静";
  2. 长时记忆:无限流式视频里,"看过的东西"怎么不丢;
  3. 实时推理:如何低延迟、恒定显存地持续处理;
  4. 边看边想:在观看的同时输出推理(Streaming CoT)。

下面按这四条主线展开。


一、主线 1:主动交互(Proactive Interaction)——"何时开口"是灵魂

这是整个领域 AI 味最浓、也最难的一环。仓库把它拆成 6 条技术路线:

1.1 辅助回应头(Auxiliary Response Head)

训练一个额外的二分类头,在解码早期隐藏状态上判断"该回应/继续等"。

  • StreamBridge(Apple,2025.05):<ACT> token + 二值分数头,把离线模型改造成主动助手;
  • ViSpeak(2025.03):<seg> token 的信息头,做流式视觉指令反馈;
  • StreamMind(2025.03):Cognition Gate 网络,用 LLM 浅层做 </response>/</silence> 二分类;
  • Dispider(2025.01):解耦"感知-决策-反应",<TODO> token 的 BCE 分类头 + <ANS>历史标记 + <SILENT>过滤。

1.2 生成式 token 触发(Generative Token-based Trigger)

不额外设分类头,而是让模型自己的词表里出现"沉默/回应"的特殊 token。

  • VideoLLM-online(2024.06):流式 EOS token 预测,开山之作;
  • AURA(2026.04):统一 <|silent|> token,静默观察 + 实时QA + 主动QA + 多回应QA;
  • STRIDE(2026.03):激活 token 去噪(0/1/[M]);
  • Streamo(2025.12):三态响应 token </Silence>/</Standby>/</Response>。

1.3 强化学习优化(RL-optimized)

用 RL/GRPO 直接优化"何时回应"。

  • StreamPro(2026.05):CB-Stream 损失 + GRPO 回合级/轨迹级奖励;
  • Thinking in Streaming Video(2026.03):流式 RLVR(格式+时机+准确率三奖励);
  • MMDuet2(2025.12):多轮 RL,文本型"NO REPLY"决策。

1.4 免训练 / 特征触发(Training-free / Feature-based)

不训练,靠相似度/图结构/解码验证来触发。

  • Foresight(2026.10):双胞胎冻结 Qwen3-VL-8B 共用 KV-cache,规划"何时思考、检查什么、采样多少 FPS";
  • LiveStarPro(2026.06):推理时期流式验证解码(SVeD)决定回应/沉默;
  • Response-G1(2026.05):查询引导的场景图检索触发。

1.5 混合触发框架(Hybrid Trigger)

  • StreamingClaw(2026.03):免训练 Reminder 节点 + 场景专属触发 token 结合。

1.6 学习回应时机(Learned Response Timing)

把"何时回应"交给 Agent 式控制,证据不足就先推迟。

  • R3-Streaming(2026.05):Readiness Head 发 <Routine>,等证据积累够再回应;
  • EgoSpeak(2025.02):独立音视频三分类器(背景/自己/他人)+ 预期预测。

小结:主动交互从"加头"→"训练token"→"RL优化"→"免训练启发式"再进到"边想边开口"。这与全双工系列里"话轮决策"一脉相承,只是从语音信号扩展到了视觉证据。


二、主线 2:长时记忆管理(Long-term Memory)——"别忘了我看过什么"

无限流式视频下,上下文必然超窗。仓库把记忆方案分成 9 类:

子方向 核心思路 代表工作
层级多级记忆 短/中/长期分级,最主流 FluxMem、HERMES、StreamChat(艾宾浩斯遗忘曲线)、VideoLLaMB(记忆桥)、FreshMem(脑启发频域)
滑窗 / 驱逐 定长滑窗,淘汰旧帧 SimpleStream、Proact-VL(逆向RoPE驱逐)、AURA(双滑窗)
Token压缩 / 剪枝 压缩视觉token TimeChat-Online(80%冗余)、VideoScan(单载体token/帧)、CausalMem
KV-Cache压缩/检索/复用 缓存切分+按需检索 MuKV、CoRDS、DSCache、StreamKV、StreamingVLM(MIT,恒定显存)
检索增强记忆 按需召回历史 SelectStream、OASIS、WeaveTime、PEARL
语义/文本抽象 视频转成文本记忆 Thinking in Streaming Video、FOLIO、StreamMeCo
事件中心结构化记忆 以"事件"为记忆单元 EventMemAgent、StreamForest(事件树)、ObjectStream(潜在物体锚点)
空间/3D记忆 点云+语义记忆 OnlineSI
参数化/快权重记忆 测试时训练(TTT)快权重 StreamTTT、video-SALMONN S

小结:记忆从"简单滑窗"演进到"多级+事件中心+检索增强+TTT参数化"。这与 Qwen3.8-Omni 的 1M 上下文、Gated DeltaNet 循环思路同源——只是视频流还要做空间的冗余消除。


三、主线 3:实时推理(Real-time Inference)——"快、且显存恒定"

子方向 思路 代表工作
编码-解码并行 边编码新帧边解码,TTFT 趋近 0 Think-as-You-See(并行双KV-cache)、Speak While Watching(解耦位置编码)、Think While Watching(线程化流水线)
选择性模型调用 平时轻量、必要时才调重型VLM StreamScout(证据级联)、LION-FS(快慢双路)、ColorTrigger(灰度引导)
视觉 Token 削减 减少进入 LLM 的视觉token CodecSight(视频编解码信号)、QueryStream、STC
KV-Cache 优化 有界缓存/复用/硬件协同 StreamingVLM(MIT)、V-Rex(软硬件协同加速器)、Don't Pause!(AsynKV)

小结:实时推理的共性目标就是 "近零首token延迟 + 恒定显存"。这和全双工系列追求的低首包/低延迟本质一致。


四、主线 4:边看边想(Streaming with Thinking)

这是 2026 年最热的新方向:把 o1 式思维链与流式视频理解融合。

  • Think-as-You-See(2026.03):因果流式注意力掩码 + 解码跨模态位置编码 + 并行双KV-cache;
  • Thinking in Streaming Video(2026.03):Watch-Think-Speak 范式 + 推理压缩流式记忆 + 流式RLVR;
  • Video Streaming Thinking(VST)(2026.03):视频流式思考范式 + VKG 合成 CoT 数据 + 两阶段 VST-SFT/RL;
  • StreamingCoT(2025.10):首个流式视频 CoT 数据集。

小结:这是"全双工"与"慢思考(reasoning)"的结合——模型要决定想多久、什么时候想、想完再开口。


五、可复用的完整系统(与系列衔接最紧)

仓库的 Technical Report 板块收录了可直接部署的流式交互系统,绝大多数是你本系列已经精读过的模型:

  • Qwen3-Omni / Qwen3.5 / Qwen3.8-Omni(阿里):开源引擎 Qwen-Live-Harness,全双工 + Agent 化交付;
  • Seed1.8 / Seed2.0(字节):豆包实时视频通话背后的原生音视频全双工 LLM;
  • MOSS-VL(复旦):cross-attention 全双工流式交互;
  • MiniCPM-o 4.5(面壁):端侧全双工主动多模态;
  • Gemini 3.8 Live / 3.1 Flash Live(Google):并行推理流式 Agent;
  • Realtime-Venus / JoyAI-VL-Interaction(京东自家):全双工、异步委托。

六、评测基准与训练数据(对研究与选型最有用的部分)

  • 综合 Benchmarks:StreamingBench、OVO-Bench(后向/实时/前向)、RTV-Bench、SVBench(多轮)、ProactiveVideoQA、StreamingEval、SPOT-Bench(Timeliness-F1)、OST-Bench(在线时空)、OVIBench(中断)、OmniPro(主动流式)。
  • 垂类 Benchmarks:NBA_Streaming(篮球解说)、HomeSafe-Bench(家居安全)、Artic/DeViBench(退化视频)、StreamEQA(具身)、StreamGaze(视线)。
  • 训练数据集:StreamingCoT(首个流式CoT)、ROMA(实时全模态)、LiveStar(实时叙述+时序定位)、LiveCC(流式转写)、CogStream(59K层级QA对)、VideoChat3(617K通用数据)。

七、关于这个"领域地图"仓库的几点客观提醒

  1. 价值:是目前更新最快、分类最系统的流式视频理解文献索引之一,能直观看出技术演进脉络;
  2. 注意去重:部分工作(StreamOV、AURA、LiveStar 等)会重复出现在多个分类下;
  3. 质量参差:收录偏"广而全",不少 2026 年预印本未经严格评审,参考需甄别;
  4. 与你的系列关系:它是对"全双工"从语音向视觉/视频流式的一次系统性扩展,故归纳为本系列第 11 篇,作为横向总览补充。

八、一句话总结

全双工的终极形态,是"盯着无限视频流、记住关键事件、把握时机主动开口、边看边想"。 本系列前 10 篇回答了"怎么把实时对话做对",这篇回答了"怎么把能力从语音扩展到真实世界视频流"。

下一站(可能的精读候选):Think-as-You-See(编码-解码并行流式CoT)、StreamingVLM(MIT 恒定显存实时视频)、或 HERMES(KV-cache 当分级记忆)。如果你感兴趣,我可以挑其中一篇做下轮精读。

评论