Back

流式视频理解 VLM 精读:领域地图——从全双工语音到'边看边想边开口'

本文是「流式视频理解 VLM 精读」系列的开篇(总览/索引篇)。系列素材来自开源文献地图 Awesome-VLM-Streaming-Video(京东探索研究院维护),它汇集了 2024–2026 年"流式/在线视频理解"方向的上百篇 VLM 论文与开源代码,并按技术主题分类。

这个系列在回答什么问题?

上一代的视频理解模型(如 VideoLLaMA、VideoChat)都是离线的:给一段完整视频,吐一个总结或答案。但现实世界的视频是无限流动的——摄像头在转播、监控在录制、直播在推流、眼镜在拍第一视角。要真正"陪伴"用户,模型必须做到:

  • 边看边答:视频还在播,模型已经能回答问题;
  • 主动开口:不等用户问,检测到关键事件就主动提醒;
  • 一直记得:看了几小时甚至 12 小时,前面的内容还记得住;
  • 足够快:响应延迟要接近实时,否则体验全毁。

这就是流式视频理解(Streaming Video Understanding)——本系列要拆解的技术领域。

五大技术支柱(系列目录)

我按仓库的技术分类,把整个领域拆成 5 条主线 + 1 条支撑,正是后续各篇的主题:

order 主题 一句话 覆盖子方向
0(本篇) 领域地图 全景梳理与技术演进脉络 系列导览
1 主动交互:模型何时开口 解决"该不该说话、何时说" 辅助回应头 / 生成式触发token / RL优化 / 免训练 / 混合 / 学习时机
2 长时记忆:无限流怎么记住 突破上下文长度限制 层级记忆 / 滑窗驱逐 / token压缩 / KV-cache / 检索增强 / 语义抽象 / 事件中心 / 3D记忆 / 参数化记忆
3 实时推理:怎么才够快 逼近零首token延迟、恒定显存 编码解码并行 / 选择性模型调用 / 视觉token削减 / KV-cache优化
4 边看边想:Streaming + CoT 边观看边推理 流式思维链、Watch-Think-Speak 范式
5 评测与数据 怎么衡量"懂不懂流式视频" 30+ benchmark + 训练数据集

技术演进脉络(读这个系列前先建立骨架)

流式视频理解不是突然出现的,它大致经过了三个递进阶段:

阶段一:把模型改造成"会打断自己"(2024–2025 初)

核心矛盾:主流 VideoLLM 只在视频"放完"后输出,无法边看边答。

  • 里程碑:VideoLLM-online(2024.06)引入流式 EOS token 预测——模型学会在恰当位置输出结束符,从而自然"开口"。这是生成式触发的开山之作。
  • 同期的 Dispider、StreamMind 用辅助分类头(在解码的 hidden state 上加一个"该回应/继续沉默"的小网络)判断开口时机。
  • 这一阶段关键词:何时开口。技术路线从"加头"到"训练触发token",再到后来用 RL/GRPO 直接优化开口行为(StreamPro、MMDuet2)。

阶段二:解决"无限流怎么记住"(2024 末–2025)

核心矛盾:视频无限,KV-cache 和注意力窗口却是有限的,老内容会忘、会爆显存。

  • 里程碑:StreamingVLM(MIT,2025.10)用有界 KV-cache 驱逐实现恒定显存;HERMES 把 KV-cache 当层级记忆并用遗忘曲线组织。
  • 思路百花齐放:层级多级记忆(短/中/长期)、token 压缩剪枝(TimeChat-Online 发现 80% 视觉token冗余)、检索增强(按需回忆历史)、事件中心记忆(以"事件"为记忆单元)、甚至TTT 参数化记忆(StreamTTT)。
  • 这一阶段关键词:长时记忆。

阶段三:实时 + 推理(2025 中–2026)

核心矛盾:不仅要对、要记得,还要快,并且在回答前还能"想一想"。

  • 实时侧:编码-解码并行(Think-as-You-See、Speak While Watching)做到近零 TTFT;选择性模型调用(StreamScout 证据级联)平时用轻量模型、必要时才调重型 VLM。
  • 推理侧:Streaming + CoT(Thinking in Streaming Video)实现"边看边想边开口",用 RL 控制想多久。
  • 这一阶段关键词:实时 + 推理,也开始强调全模态(音视频入手,Seed、Qwen-Omni 全双工)。

与「全双工语音模型精读」的关系

本系列是那套系列从"音频全双工"向"视频流式"的延伸:

  • 全双工系列 order 0 总览 + 1–10 精读讲"听"——语音全双工模型(Moshi、GLM-4-Voice、Qwen-Omni、Gemini Live、SeedRealtime 等)如何实现实时对话。
  • 本系列讲"看 + 听"——把同样的"主动、实时、长记忆"需求搬到视频流上,且更强调视觉与时空理解。

二者在主动交互、KV-cache 优化、推理加速上高度同源,可相互印证。已出现在全双工系列的 Seed、Qwen-Omni、MOSS-VL、Gemini Live 在本系列所依托的仓库里同样是被反复引用的标杆系统。

阅读建议

  • 先读本篇,建立"三阶段演进"骨架,后续每篇都是对某一支柱的展开;
  • order 1–4 按兴趣取读,每篇相对独立,都配了大量论文/代码索引可查原文;
  • order 5 提供评测视角,适合想做实验对比的人。

标杆系统 / 里程碑工作资源索引

工作 Paper Code Demo
Realtime-Venus 2609.13814 inclusionAI/Realtime-Venus realtime-venus.github.io
Qwen3.8-Omni-Flash 2609.25611 QwenLM/Qwen-Live-Harness qwen.ai/blog
Omni Interaction Agent 2609.08977 Omni-Interaction-Agent demo
Gemini 3.8 Live 官方文档 — blog.google
MOSS-VL 2608.15045 OpenMOSS/MOSS-VL openmoss.ai/MOSS-VL
SeedRealtime 官方页 — —
JoyAI-VL-Interaction 2606.14777 jd-opensource/JoyAI-VL-Interaction 项目页
MiniCPM-o 4.5 2604.27393 OpenBMB/MiniCPM-o-Demo demo
Qwen3-Omni 2604.15804 QwenLM/Qwen3-Omni HF Space
Interaction Models(Thinking Machines) 官方博客 — —
VideoLLM-online 2406.11816 showlab/videollm-online —
Dispider 2501.03218 Mark12Ding/Dispider —
StreamMind 2503.06220 xinding-sys/StreamMind —
StreamPro 2605.16381 — —
MMDuet2 2512.06810 yellow-binary-tree/MMDuet2 —
StreamingVLM(MIT-HAN) 2510.09608 mit-han-lab/streaming-vlm —
HERMES 2601.14724 haowei-freesky/HERMES —
TimeChat-Online 2504.17343 yaolinli/TimeChat-Online —
StreamScout 2609.00291 — —

开源交互工程可参考 NVIDIA-AI-IOT/live-vlm-webui(摄像头实时对话)与 火山引擎实时音视频文档。完整文献地图见 Awesome-VLM-Streaming-Video。

下一站

下一篇进入核心难点之一:主动交互——VLM 到底应该什么时候开口,凭什么决定?从辅助头到 RL 优化,技术选择经历了怎样的权衡?

评论