本文基于开源文献地图仓库 Awesome-VLM-Streaming-Video(京东探索研究院维护)做一次领域全景梳理。它汇集了 2024–2026 年"流式/在线视频理解"方向的上百篇 VLM 论文与开源代码,并按技术主题分类——这恰好是「全双工语音模型精读」系列的横向延伸:从"听"到"边看边想边开口"。
〇、一句话看懂这个系列和这次的关系
前 10 篇都在讲"实时全双工语音/音视频交互模型":Moshi、Qwen-Omni、GPT-Live、Gemini Live、SeedRealtime、Qwen3.8-Omni……它们的共性是把"边说边听"做到原生。
但全双工的下一站是**"看着视频还能自主决定何时开口"——这就是流式视频理解(Streaming Video Understanding)要解决的问题。它不只读懂单帧,而是要在无限长、实时到达的视频流上持续感知、记忆、推理,并在合适的时机主动**介入。于是核心难点从"怎么说得快"转移到四件事:
- 主动交互:模型自己判断"现在该不该说话/该安静";
- 长时记忆:无限流式视频里,"看过的东西"怎么不丢;
- 实时推理:如何低延迟、恒定显存地持续处理;
- 边看边想:在观看的同时输出推理(Streaming CoT)。
下面按这四条主线展开。
一、主线 1:主动交互(Proactive Interaction)——"何时开口"是灵魂
这是整个领域 AI 味最浓、也最难的一环。仓库把它拆成 6 条技术路线:
1.1 辅助回应头(Auxiliary Response Head)
训练一个额外的二分类头,在解码早期隐藏状态上判断"该回应/继续等"。
- StreamBridge(Apple,2025.05):
<ACT>token + 二值分数头,把离线模型改造成主动助手; - ViSpeak(2025.03):
<seg>token 的信息头,做流式视觉指令反馈; - StreamMind(2025.03):Cognition Gate 网络,用 LLM 浅层做
</response>/</silence>二分类; - Dispider(2025.01):解耦"感知-决策-反应",
<TODO>token 的 BCE 分类头 +<ANS>历史标记 +<SILENT>过滤。
1.2 生成式 token 触发(Generative Token-based Trigger)
不额外设分类头,而是让模型自己的词表里出现"沉默/回应"的特殊 token。
- VideoLLM-online(2024.06):流式 EOS token 预测,开山之作;
- AURA(2026.04):统一
<|silent|>token,静默观察 + 实时QA + 主动QA + 多回应QA; - STRIDE(2026.03):激活 token 去噪(0/1/[M]);
- Streamo(2025.12):三态响应 token
</Silence>/</Standby>/</Response>。
1.3 强化学习优化(RL-optimized)
用 RL/GRPO 直接优化"何时回应"。
- StreamPro(2026.05):CB-Stream 损失 + GRPO 回合级/轨迹级奖励;
- Thinking in Streaming Video(2026.03):流式 RLVR(格式+时机+准确率三奖励);
- MMDuet2(2025.12):多轮 RL,文本型"NO REPLY"决策。
1.4 免训练 / 特征触发(Training-free / Feature-based)
不训练,靠相似度/图结构/解码验证来触发。
- Foresight(2026.10):双胞胎冻结 Qwen3-VL-8B 共用 KV-cache,规划"何时思考、检查什么、采样多少 FPS";
- LiveStarPro(2026.06):推理时期流式验证解码(SVeD)决定回应/沉默;
- Response-G1(2026.05):查询引导的场景图检索触发。
1.5 混合触发框架(Hybrid Trigger)
- StreamingClaw(2026.03):免训练 Reminder 节点 + 场景专属触发 token 结合。
1.6 学习回应时机(Learned Response Timing)
把"何时回应"交给 Agent 式控制,证据不足就先推迟。
- R3-Streaming(2026.05):Readiness Head 发
<Routine>,等证据积累够再回应; - EgoSpeak(2025.02):独立音视频三分类器(背景/自己/他人)+ 预期预测。
小结:主动交互从"加头"→"训练token"→"RL优化"→"免训练启发式"再进到"边想边开口"。这与全双工系列里"话轮决策"一脉相承,只是从语音信号扩展到了视觉证据。
二、主线 2:长时记忆管理(Long-term Memory)——"别忘了我看过什么"
无限流式视频下,上下文必然超窗。仓库把记忆方案分成 9 类:
| 子方向 | 核心思路 | 代表工作 |
|---|---|---|
| 层级多级记忆 | 短/中/长期分级,最主流 | FluxMem、HERMES、StreamChat(艾宾浩斯遗忘曲线)、VideoLLaMB(记忆桥)、FreshMem(脑启发频域) |
| 滑窗 / 驱逐 | 定长滑窗,淘汰旧帧 | SimpleStream、Proact-VL(逆向RoPE驱逐)、AURA(双滑窗) |
| Token压缩 / 剪枝 | 压缩视觉token | TimeChat-Online(80%冗余)、VideoScan(单载体token/帧)、CausalMem |
| KV-Cache压缩/检索/复用 | 缓存切分+按需检索 | MuKV、CoRDS、DSCache、StreamKV、StreamingVLM(MIT,恒定显存) |
| 检索增强记忆 | 按需召回历史 | SelectStream、OASIS、WeaveTime、PEARL |
| 语义/文本抽象 | 视频转成文本记忆 | Thinking in Streaming Video、FOLIO、StreamMeCo |
| 事件中心结构化记忆 | 以"事件"为记忆单元 | EventMemAgent、StreamForest(事件树)、ObjectStream(潜在物体锚点) |
| 空间/3D记忆 | 点云+语义记忆 | OnlineSI |
| 参数化/快权重记忆 | 测试时训练(TTT)快权重 | StreamTTT、video-SALMONN S |
小结:记忆从"简单滑窗"演进到"多级+事件中心+检索增强+TTT参数化"。这与 Qwen3.8-Omni 的 1M 上下文、Gated DeltaNet 循环思路同源——只是视频流还要做空间的冗余消除。
三、主线 3:实时推理(Real-time Inference)——"快、且显存恒定"
| 子方向 | 思路 | 代表工作 |
|---|---|---|
| 编码-解码并行 | 边编码新帧边解码,TTFT 趋近 0 | Think-as-You-See(并行双KV-cache)、Speak While Watching(解耦位置编码)、Think While Watching(线程化流水线) |
| 选择性模型调用 | 平时轻量、必要时才调重型VLM | StreamScout(证据级联)、LION-FS(快慢双路)、ColorTrigger(灰度引导) |
| 视觉 Token 削减 | 减少进入 LLM 的视觉token | CodecSight(视频编解码信号)、QueryStream、STC |
| KV-Cache 优化 | 有界缓存/复用/硬件协同 | StreamingVLM(MIT)、V-Rex(软硬件协同加速器)、Don't Pause!(AsynKV) |
小结:实时推理的共性目标就是 "近零首token延迟 + 恒定显存"。这和全双工系列追求的低首包/低延迟本质一致。
四、主线 4:边看边想(Streaming with Thinking)
这是 2026 年最热的新方向:把 o1 式思维链与流式视频理解融合。
- Think-as-You-See(2026.03):因果流式注意力掩码 + 解码跨模态位置编码 + 并行双KV-cache;
- Thinking in Streaming Video(2026.03):Watch-Think-Speak 范式 + 推理压缩流式记忆 + 流式RLVR;
- Video Streaming Thinking(VST)(2026.03):视频流式思考范式 + VKG 合成 CoT 数据 + 两阶段 VST-SFT/RL;
- StreamingCoT(2025.10):首个流式视频 CoT 数据集。
小结:这是"全双工"与"慢思考(reasoning)"的结合——模型要决定想多久、什么时候想、想完再开口。
五、可复用的完整系统(与系列衔接最紧)
仓库的 Technical Report 板块收录了可直接部署的流式交互系统,绝大多数是你本系列已经精读过的模型:
- Qwen3-Omni / Qwen3.5 / Qwen3.8-Omni(阿里):开源引擎
Qwen-Live-Harness,全双工 + Agent 化交付; - Seed1.8 / Seed2.0(字节):豆包实时视频通话背后的原生音视频全双工 LLM;
- MOSS-VL(复旦):cross-attention 全双工流式交互;
- MiniCPM-o 4.5(面壁):端侧全双工主动多模态;
- Gemini 3.8 Live / 3.1 Flash Live(Google):并行推理流式 Agent;
- Realtime-Venus / JoyAI-VL-Interaction(京东自家):全双工、异步委托。
六、评测基准与训练数据(对研究与选型最有用的部分)
- 综合 Benchmarks:StreamingBench、OVO-Bench(后向/实时/前向)、RTV-Bench、SVBench(多轮)、ProactiveVideoQA、StreamingEval、SPOT-Bench(Timeliness-F1)、OST-Bench(在线时空)、OVIBench(中断)、OmniPro(主动流式)。
- 垂类 Benchmarks:NBA_Streaming(篮球解说)、HomeSafe-Bench(家居安全)、Artic/DeViBench(退化视频)、StreamEQA(具身)、StreamGaze(视线)。
- 训练数据集:StreamingCoT(首个流式CoT)、ROMA(实时全模态)、LiveStar(实时叙述+时序定位)、LiveCC(流式转写)、CogStream(59K层级QA对)、VideoChat3(617K通用数据)。
七、关于这个"领域地图"仓库的几点客观提醒
- 价值:是目前更新最快、分类最系统的流式视频理解文献索引之一,能直观看出技术演进脉络;
- 注意去重:部分工作(StreamOV、AURA、LiveStar 等)会重复出现在多个分类下;
- 质量参差:收录偏"广而全",不少 2026 年预印本未经严格评审,参考需甄别;
- 与你的系列关系:它是对"全双工"从语音向视觉/视频流式的一次系统性扩展,故归纳为本系列第 11 篇,作为横向总览补充。
八、一句话总结
全双工的终极形态,是"盯着无限视频流、记住关键事件、把握时机主动开口、边看边想"。 本系列前 10 篇回答了"怎么把实时对话做对",这篇回答了"怎么把能力从语音扩展到真实世界视频流"。
下一站(可能的精读候选):Think-as-You-See(编码-解码并行流式CoT)、StreamingVLM(MIT 恒定显存实时视频)、或 HERMES(KV-cache 当分级记忆)。如果你感兴趣,我可以挑其中一篇做下轮精读。