Back

流式视频理解 VLM 精读③:实时推理——怎么才够快?

这是「流式视频理解 VLM 精读」系列第 3 篇。前两篇解决"要不要说、还记得吗",这篇解决一个更现实的问题:就算你又主动又记得住,如果不够快,体验直接归零。视频是实时的,模型响应也要接近实时。

实时推理的两大硬指标

流式视频模型的"快"不是玄学,业界普遍盯着两个数:

  1. Time-to-First-Token(TTFT):从"看到画面"到"说出第一个字"的延迟。流式场景希望它趋近于零。
  2. 显存占用 / Context 增长:视频无限流,显存必须是恒定或近恒定的,否则跑几分钟就 OOM。

本仓库把实时推理的手段分成 4 条路线:编码-解码并行、选择性模型调用、视觉 token 削减、KV-cache 优化。

路线一:编码-解码并行(Encoding-Decoding Parallelism)

思路:传统流程是"先等新帧编码完,再解码输出",串行导致延迟叠加。这路线的核心是让"编码新帧"和"解码当前回答"同时进行,从而把等待时间藏起来。

  • Think-as-You-See(EIT-NLP,2026.03):并行双 KV-cache + 归并-生成-拆分循环——一个缓存收新视频、一个缓存在解码,通过 decoupled 跨模态 RoPE 做到近零 TTFT。
  • Speak While Watching(EIT-NLP,2026.01):解耦位置编码(重叠/组解耦/间隔隔离三种策略),让"感知"和"生成"真正并行。
  • Think While Watching(2026.03):线程化 Watch-Think 流水线 + 异步 segment 预取 + 自适应 attention 后端。

优点:原理直击 TTFT,提升最直接。 缺点:并行导致 KV-cache 和位置编码管理复杂度剧增;需要精心设计内存布局和调度。

路线二:选择性模型调用(Selective Model Invocation)

思路:不是每帧都要跑大模型。用一个轻量机制判断"现在值不值得动用重型 VLM",只在必要时调用,平时用低成本通道。

  • StreamScout(2026.09):证据级联——先"最近一瞥",再"均匀回看",再"查询显著检索"三级,用自蒸馏 + GRPO 学到"该停还是该升级到更深处理"。
  • LION-FS(2025.03):快慢双路——快速通道高频采样粗看,慢速通道对重点片段细看;router 决定走哪条。
  • ColorTrigger(2026.03):灰度引导——先用低成本灰度做窗口相似度分析,再用二次规划分配 RGB 激活预算,把昂贵 RGB 计算省下来。
  • Event-VStream(2026.01):边界感知事件池化,事件触发的稀疏解码 + 滞回节奏控制。
  • StreamMind(2025.03):基于状态空间模型(SSM)的单 token 感知 + 事件门控的稀疏 LLM 调用。
  • 还有 STRIDE、Open-ended Hierarchical、Efficient Agentic Framework(TB-GRPO 快慢模型路由)等。

优点:大量请求只需低成本通道,省算力、省显存。 缺点:门控判断本身要准,漏判关键事件代价高;两套模型的协同是难点。

路线三:视觉 Token 削减(Visual Token Reduction)

思路:视频进 LLM 前,先在"视觉层"把 token 变少——反正有大量时空冗余。

  • TimeChat-Online(2025.04):80% 视觉 token 冗余——Differential Token Drop 只留变化大、信息多的 token。
  • CodecSight(2026.04):直接利用视频编解码器信号(如运动向量)做 patch 剪枝 + I 帧锚定 KV 刷新 + RoPE 位置修正——从压缩码流里白捡信息。
  • VideoScan(2025.03):每帧一个语义载体 token,prefill 后即丢弃视觉 token。
  • VideoLLM-MoD(2024.08):Mixture-of-Depths——堆叠多层只挑部分层算视觉 token,用 LayerExpert 跳过冗余计算。
  • FluxMem(2026.03):TAS/SDC token 压缩 + Otsu 自适应阈值。
  • QueryStream(2026.02):查询感知的差分剪枝 + 相关性触发主动响应。
  • 还有 StreamingAssistant(checkerboard 并行空间剪枝)、STC(层级压缩)、savemem、CausalMem 等。

优点:见效快、与 KV 优化叠加效果显著、无需改推理宏架构。 缺点:缩减策略可能误删关键小目标/快速运动细节,需要好的信息量判别。

路线四:KV-Cache 优化(KV-Cache Optimization)

思路:这条与第 2 篇"长时记忆"的 KV-cache 路线高度重叠——同一个动作既省显存又加速:缓存小了,decode 就更快,且能复用。

  • StreamingVLM(MIT,2025.10):有界驱逐保证恒定显存、跨窗口不重复预计算——实时视频理解工程的标配起点。
  • V-Rex(2025.12):软硬件协同设计——为 KV 检索做定制加速器,把"预测-检索"流水化并和 LLM 计算重叠。
  • Don't Pause! / SPOT-Bench(2026.04):AsynKV 长短时 KV 记忆,并把算力调度到"死时间"做流式适应。
  • AURA(2026.04):浮动的视频/QA 滑窗 + 批量截断复用前缀 KV,降 TTFT。
  • HERMES(2026.01):KV-cache 即记忆,为即时应答做缓存复用 + 固定预算内层级压缩。
  • 还有 StreamTTT、LiveStarPro、CoRDS、DSCache、StreamKV、StreamingTOM、LiveVLM、ReKV、StreamingVLM 等(很多与记忆篇重复,因为是一体两面)。

优点:直击"显存+速度"双瓶颈;增量收益大。 缺点:存取与位置编码策略复杂;与检索结合时检索不准会拖慢/拖错。

四条路线怎么搭?(实时系统设计)

路线 降什么 实现成本 见效 典型组合角色
编码解码并行 TTFT 高 强 主心智(近零TTFT的根基)
选择性调用 平均算力 中 强(请求量大时) 省力守门员(平时轻量、重点升级)
视觉token削减 输入token 低-中 中 前置减负(先瘦身再推理)
KV-cache优化 显存+decode 中-高 强 底座(一切的基础预算)

推荐组合:KV-cache 优化做底座(保证恒定显存)+ token 削减做前置减负 + 编码解码并行做主链路 + 选择性调用做整体省力。四个叠加,一个实时流式系统基本成型。

待办 / 观察

  • 免成本信号是趋势:CodecSight 用编解码信号、ColorTrigger 用灰度,说明"占便宜的轻量特征"比"加算力"更受欢迎。
  • 实时与记忆深度耦合(KV-cache 一鱼两吃)——设计时不要分开想。
  • 软硬件协同(V-Rex)是端侧落地的方向,值得关注国产端 AI 芯片的配合。

资源索引(Paper / Code / Demo)

工作 Paper Code Demo
Think-as-You-See 2603.02872 EIT-NLP/StreamingLLM —
Speak While Watching 2601.06843 EIT-NLP/Speak-While-Watching —
Think While Watching 2603.11896 wl666hhh/Think_While_Watching —
StreamScout 2609.00291 — —
LION-FS 2503.03663 JiuTian-VL/LION-FS —
ColorTrigger 2603.22466 lvgd/ColorTrigger —
Event-VStream 2601.15655 — —
StreamMind 2503.06220 xinding-sys/StreamMind —
STRIDE 2603.27593 interlive-team/STRIDE —
Open-ended Hierarchical 2509.12145 — —
Agentic Control(TB-GRPO) 2605.17921 — —
TimeChat-Online 2504.17343 yaolinli/TimeChat-Online —
CodecSight 2604.06036 — —
VideoScan 2503.09387 LyliAgave/VideoScan —
VideoLLM-MoD 2408.16730 — —
FluxMem 2603.02096 YiwengXie/FluxMem —
QueryStream openreview 738HjJEbml — —
StreamingAssistant 2512.12560 — —
STC 2512.00891 lern-to-write/STC —
savemem 2605.07897 wuhang03/savemem —
CausalMem 2606.25658 hktk07/CausalMem —
StreamingVLM(MIT-HAN) 2510.09608 mit-han-lab/streaming-vlm —
V-Rex 2512.12284 — —
SPOT-Bench(Don't Pause!) 2604.24317 dibschat/SPOT-Bench —
AURA 2604.04184 aurateam2026/AURA —
HERMES 2601.14724 haowei-freesky/HERMES —
StreamTTT 2608.13416 — —
LiveStarPro 2606.17798 sotayang/LiveStar —
CoRDS 2605.14310 ailarmhz/CoRDS —
DSCache 2605.01858 pangzhan27/DSCache —
StreamKV 2511.07278 sou1p0wer/StreamKV —
StreamingTOM 2510.18269 YIGE24/StreamingTOM —
LiveVLM 2505.15269 — —
ReKV 2503.00540 Becomebright/ReKV —

下一篇进入最有"智能感"的方向:边看边想(Streaming + CoT)——让模型一边看视频一边推理,还要学会"想多久才开口"。

评论