本文是「流式视频理解 VLM 精读」系列的开篇(总览/索引篇)。系列素材来自开源文献地图 Awesome-VLM-Streaming-Video(京东探索研究院维护),它汇集了 2024–2026 年"流式/在线视频理解"方向的上百篇 VLM 论文与开源代码,并按技术主题分类。
这个系列在回答什么问题?
上一代的视频理解模型(如 VideoLLaMA、VideoChat)都是离线的:给一段完整视频,吐一个总结或答案。但现实世界的视频是无限流动的——摄像头在转播、监控在录制、直播在推流、眼镜在拍第一视角。要真正"陪伴"用户,模型必须做到:
- 边看边答:视频还在播,模型已经能回答问题;
- 主动开口:不等用户问,检测到关键事件就主动提醒;
- 一直记得:看了几小时甚至 12 小时,前面的内容还记得住;
- 足够快:响应延迟要接近实时,否则体验全毁。
这就是流式视频理解(Streaming Video Understanding)——本系列要拆解的技术领域。
五大技术支柱(系列目录)
我按仓库的技术分类,把整个领域拆成 5 条主线 + 1 条支撑,正是后续各篇的主题:
| order | 主题 | 一句话 | 覆盖子方向 |
|---|---|---|---|
| 0(本篇) | 领域地图 | 全景梳理与技术演进脉络 | 系列导览 |
| 1 | 主动交互:模型何时开口 | 解决"该不该说话、何时说" | 辅助回应头 / 生成式触发token / RL优化 / 免训练 / 混合 / 学习时机 |
| 2 | 长时记忆:无限流怎么记住 | 突破上下文长度限制 | 层级记忆 / 滑窗驱逐 / token压缩 / KV-cache / 检索增强 / 语义抽象 / 事件中心 / 3D记忆 / 参数化记忆 |
| 3 | 实时推理:怎么才够快 | 逼近零首token延迟、恒定显存 | 编码解码并行 / 选择性模型调用 / 视觉token削减 / KV-cache优化 |
| 4 | 边看边想:Streaming + CoT | 边观看边推理 | 流式思维链、Watch-Think-Speak 范式 |
| 5 | 评测与数据 | 怎么衡量"懂不懂流式视频" | 30+ benchmark + 训练数据集 |
技术演进脉络(读这个系列前先建立骨架)
流式视频理解不是突然出现的,它大致经过了三个递进阶段:
阶段一:把模型改造成"会打断自己"(2024–2025 初)
核心矛盾:主流 VideoLLM 只在视频"放完"后输出,无法边看边答。
- 里程碑:VideoLLM-online(2024.06)引入流式 EOS token 预测——模型学会在恰当位置输出结束符,从而自然"开口"。这是生成式触发的开山之作。
- 同期的 Dispider、StreamMind 用辅助分类头(在解码的 hidden state 上加一个"该回应/继续沉默"的小网络)判断开口时机。
- 这一阶段关键词:何时开口。技术路线从"加头"到"训练触发token",再到后来用 RL/GRPO 直接优化开口行为(StreamPro、MMDuet2)。
阶段二:解决"无限流怎么记住"(2024 末–2025)
核心矛盾:视频无限,KV-cache 和注意力窗口却是有限的,老内容会忘、会爆显存。
- 里程碑:StreamingVLM(MIT,2025.10)用有界 KV-cache 驱逐实现恒定显存;HERMES 把 KV-cache 当层级记忆并用遗忘曲线组织。
- 思路百花齐放:层级多级记忆(短/中/长期)、token 压缩剪枝(TimeChat-Online 发现 80% 视觉token冗余)、检索增强(按需回忆历史)、事件中心记忆(以"事件"为记忆单元)、甚至TTT 参数化记忆(StreamTTT)。
- 这一阶段关键词:长时记忆。
阶段三:实时 + 推理(2025 中–2026)
核心矛盾:不仅要对、要记得,还要快,并且在回答前还能"想一想"。
- 实时侧:编码-解码并行(Think-as-You-See、Speak While Watching)做到近零 TTFT;选择性模型调用(StreamScout 证据级联)平时用轻量模型、必要时才调重型 VLM。
- 推理侧:Streaming + CoT(Thinking in Streaming Video)实现"边看边想边开口",用 RL 控制想多久。
- 这一阶段关键词:实时 + 推理,也开始强调全模态(音视频入手,Seed、Qwen-Omni 全双工)。
与「全双工语音模型精读」的关系
本系列是那套系列从"音频全双工"向"视频流式"的延伸:
- 全双工系列 order 0 总览 + 1–10 精读讲"听"——语音全双工模型(Moshi、GLM-4-Voice、Qwen-Omni、Gemini Live、SeedRealtime 等)如何实现实时对话。
- 本系列讲"看 + 听"——把同样的"主动、实时、长记忆"需求搬到视频流上,且更强调视觉与时空理解。
二者在主动交互、KV-cache 优化、推理加速上高度同源,可相互印证。已出现在全双工系列的 Seed、Qwen-Omni、MOSS-VL、Gemini Live 在本系列所依托的仓库里同样是被反复引用的标杆系统。
阅读建议
- 先读本篇,建立"三阶段演进"骨架,后续每篇都是对某一支柱的展开;
- order 1–4 按兴趣取读,每篇相对独立,都配了大量论文/代码索引可查原文;
- order 5 提供评测视角,适合想做实验对比的人。
标杆系统 / 里程碑工作资源索引
| 工作 | Paper | Code | Demo |
|---|---|---|---|
| Realtime-Venus | 2609.13814 | inclusionAI/Realtime-Venus | realtime-venus.github.io |
| Qwen3.8-Omni-Flash | 2609.25611 | QwenLM/Qwen-Live-Harness | qwen.ai/blog |
| Omni Interaction Agent | 2609.08977 | Omni-Interaction-Agent | demo |
| Gemini 3.8 Live | 官方文档 | — | blog.google |
| MOSS-VL | 2608.15045 | OpenMOSS/MOSS-VL | openmoss.ai/MOSS-VL |
| SeedRealtime | 官方页 | — | — |
| JoyAI-VL-Interaction | 2606.14777 | jd-opensource/JoyAI-VL-Interaction | 项目页 |
| MiniCPM-o 4.5 | 2604.27393 | OpenBMB/MiniCPM-o-Demo | demo |
| Qwen3-Omni | 2604.15804 | QwenLM/Qwen3-Omni | HF Space |
| Interaction Models(Thinking Machines) | 官方博客 | — | — |
| VideoLLM-online | 2406.11816 | showlab/videollm-online | — |
| Dispider | 2501.03218 | Mark12Ding/Dispider | — |
| StreamMind | 2503.06220 | xinding-sys/StreamMind | — |
| StreamPro | 2605.16381 | — | — |
| MMDuet2 | 2512.06810 | yellow-binary-tree/MMDuet2 | — |
| StreamingVLM(MIT-HAN) | 2510.09608 | mit-han-lab/streaming-vlm | — |
| HERMES | 2601.14724 | haowei-freesky/HERMES | — |
| TimeChat-Online | 2504.17343 | yaolinli/TimeChat-Online | — |
| StreamScout | 2609.00291 | — | — |
开源交互工程可参考 NVIDIA-AI-IOT/live-vlm-webui(摄像头实时对话)与 火山引擎实时音视频文档。完整文献地图见 Awesome-VLM-Streaming-Video。
下一站
下一篇进入核心难点之一:主动交互——VLM 到底应该什么时候开口,凭什么决定?从辅助头到 RL 优化,技术选择经历了怎样的权衡?