这是「流式视频理解 VLM 精读」系列第 3 篇。前两篇解决"要不要说、还记得吗",这篇解决一个更现实的问题:就算你又主动又记得住,如果不够快,体验直接归零。视频是实时的,模型响应也要接近实时。
实时推理的两大硬指标
流式视频模型的"快"不是玄学,业界普遍盯着两个数:
- Time-to-First-Token(TTFT):从"看到画面"到"说出第一个字"的延迟。流式场景希望它趋近于零。
- 显存占用 / Context 增长:视频无限流,显存必须是恒定或近恒定的,否则跑几分钟就 OOM。
本仓库把实时推理的手段分成 4 条路线:编码-解码并行、选择性模型调用、视觉 token 削减、KV-cache 优化。
路线一:编码-解码并行(Encoding-Decoding Parallelism)
思路:传统流程是"先等新帧编码完,再解码输出",串行导致延迟叠加。这路线的核心是让"编码新帧"和"解码当前回答"同时进行,从而把等待时间藏起来。
- Think-as-You-See(EIT-NLP,2026.03):并行双 KV-cache + 归并-生成-拆分循环——一个缓存收新视频、一个缓存在解码,通过 decoupled 跨模态 RoPE 做到近零 TTFT。
- Speak While Watching(EIT-NLP,2026.01):解耦位置编码(重叠/组解耦/间隔隔离三种策略),让"感知"和"生成"真正并行。
- Think While Watching(2026.03):线程化 Watch-Think 流水线 + 异步 segment 预取 + 自适应 attention 后端。
优点:原理直击 TTFT,提升最直接。 缺点:并行导致 KV-cache 和位置编码管理复杂度剧增;需要精心设计内存布局和调度。
路线二:选择性模型调用(Selective Model Invocation)
思路:不是每帧都要跑大模型。用一个轻量机制判断"现在值不值得动用重型 VLM",只在必要时调用,平时用低成本通道。
- StreamScout(2026.09):证据级联——先"最近一瞥",再"均匀回看",再"查询显著检索"三级,用自蒸馏 + GRPO 学到"该停还是该升级到更深处理"。
- LION-FS(2025.03):快慢双路——快速通道高频采样粗看,慢速通道对重点片段细看;router 决定走哪条。
- ColorTrigger(2026.03):灰度引导——先用低成本灰度做窗口相似度分析,再用二次规划分配 RGB 激活预算,把昂贵 RGB 计算省下来。
- Event-VStream(2026.01):边界感知事件池化,事件触发的稀疏解码 + 滞回节奏控制。
- StreamMind(2025.03):基于状态空间模型(SSM)的单 token 感知 + 事件门控的稀疏 LLM 调用。
- 还有 STRIDE、Open-ended Hierarchical、Efficient Agentic Framework(TB-GRPO 快慢模型路由)等。
优点:大量请求只需低成本通道,省算力、省显存。 缺点:门控判断本身要准,漏判关键事件代价高;两套模型的协同是难点。
路线三:视觉 Token 削减(Visual Token Reduction)
思路:视频进 LLM 前,先在"视觉层"把 token 变少——反正有大量时空冗余。
- TimeChat-Online(2025.04):80% 视觉 token 冗余——Differential Token Drop 只留变化大、信息多的 token。
- CodecSight(2026.04):直接利用视频编解码器信号(如运动向量)做 patch 剪枝 + I 帧锚定 KV 刷新 + RoPE 位置修正——从压缩码流里白捡信息。
- VideoScan(2025.03):每帧一个语义载体 token,prefill 后即丢弃视觉 token。
- VideoLLM-MoD(2024.08):Mixture-of-Depths——堆叠多层只挑部分层算视觉 token,用 LayerExpert 跳过冗余计算。
- FluxMem(2026.03):TAS/SDC token 压缩 + Otsu 自适应阈值。
- QueryStream(2026.02):查询感知的差分剪枝 + 相关性触发主动响应。
- 还有 StreamingAssistant(checkerboard 并行空间剪枝)、STC(层级压缩)、savemem、CausalMem 等。
优点:见效快、与 KV 优化叠加效果显著、无需改推理宏架构。 缺点:缩减策略可能误删关键小目标/快速运动细节,需要好的信息量判别。
路线四:KV-Cache 优化(KV-Cache Optimization)
思路:这条与第 2 篇"长时记忆"的 KV-cache 路线高度重叠——同一个动作既省显存又加速:缓存小了,decode 就更快,且能复用。
- StreamingVLM(MIT,2025.10):有界驱逐保证恒定显存、跨窗口不重复预计算——实时视频理解工程的标配起点。
- V-Rex(2025.12):软硬件协同设计——为 KV 检索做定制加速器,把"预测-检索"流水化并和 LLM 计算重叠。
- Don't Pause! / SPOT-Bench(2026.04):AsynKV 长短时 KV 记忆,并把算力调度到"死时间"做流式适应。
- AURA(2026.04):浮动的视频/QA 滑窗 + 批量截断复用前缀 KV,降 TTFT。
- HERMES(2026.01):KV-cache 即记忆,为即时应答做缓存复用 + 固定预算内层级压缩。
- 还有 StreamTTT、LiveStarPro、CoRDS、DSCache、StreamKV、StreamingTOM、LiveVLM、ReKV、StreamingVLM 等(很多与记忆篇重复,因为是一体两面)。
优点:直击"显存+速度"双瓶颈;增量收益大。 缺点:存取与位置编码策略复杂;与检索结合时检索不准会拖慢/拖错。
四条路线怎么搭?(实时系统设计)
| 路线 | 降什么 | 实现成本 | 见效 | 典型组合角色 |
|---|---|---|---|---|
| 编码解码并行 | TTFT | 高 | 强 | 主心智(近零TTFT的根基) |
| 选择性调用 | 平均算力 | 中 | 强(请求量大时) | 省力守门员(平时轻量、重点升级) |
| 视觉token削减 | 输入token | 低-中 | 中 | 前置减负(先瘦身再推理) |
| KV-cache优化 | 显存+decode | 中-高 | 强 | 底座(一切的基础预算) |
推荐组合:KV-cache 优化做底座(保证恒定显存)+ token 削减做前置减负 + 编码解码并行做主链路 + 选择性调用做整体省力。四个叠加,一个实时流式系统基本成型。
待办 / 观察
- 免成本信号是趋势:CodecSight 用编解码信号、ColorTrigger 用灰度,说明"占便宜的轻量特征"比"加算力"更受欢迎。
- 实时与记忆深度耦合(KV-cache 一鱼两吃)——设计时不要分开想。
- 软硬件协同(V-Rex)是端侧落地的方向,值得关注国产端 AI 芯片的配合。
资源索引(Paper / Code / Demo)
下一篇进入最有"智能感"的方向:边看边想(Streaming + CoT)——让模型一边看视频一边推理,还要学会"想多久才开口"。