Back

流式视频理解 VLM 精读④:边看边想(Streaming + CoT)——模型看视频时能「想一想」吗?

这是「流式视频理解 VLM 精读」系列第 4 篇。前三篇分别讲了"开口、记忆、速度",这篇是一个既有"智能"又有"品味"的新方向:让模型一边看视频一边输出推理(Chain-of-Thought),并且学会把握"想多久才算够"。

为什么"边看边想"这么难?

单看"看视频后再推理",其实一直能做(离线视频 QA + CoT 早已成熟)。难的是**"边看边想"**这个动词组合里的"边":

  1. 时序因果:推理必须只基于当前及过去看到的内容,不能偷看未来帧——这比离线推理苛刻。
  2. 同时发生:观看和推理在同一时间轴上推进,模型要"边接收新帧边产推理链",这对注意力和 KV-cache 都是硬约束。
  3. 想多久是个决策:不是所有问题都需要长思考——想太久就错过实时性,想太短又答不准。"该不该想、想多久"本身成了要学习的策略。

本仓库这个方向篇幅不大但很精炼,核心是几篇把"流式 + CoT"成套立起来的工作。

立范式:Watch-Think-Speak

  • Thinking in Streaming Video / ThinkStream(2026.03):明确提出 Watch-Think-Speak 三段范式,并配套两大设计:

    • Reasoning-Compressed Streaming Memory(RCSM):短时用视觉滑窗,长期则用推理 token 当语义锚点——把"想过的内容"当作压缩记忆,一举两得。
    • 流式 RLVR:奖励同时覆盖格式(正确使用 <silent>/<response> 动作token)、时机(是否该想/想多久)、准确性三个方面。
    • 还有工程细节:Eager Prefill + CUDA Graph decode-and-prune,让推理时不卡帧。
  • Video Streaming Thinking / VST(2026.03):并行提出的同样范式,核心是:

    • 短时视觉滑窗 + 长时流式思考文本记忆(FIFO 驱逐);
    • 用 VKG(Video Knowledge Graph) 做流式 CoT 数据的自动合成;
    • 两阶段训练:VST-SFT(先学会想)+ VST-RL(再学会想得又快又对)。

让"看"和"想"真正并行

  • Think-as-You-See(EIT-NLP,2026.03):不只是推理,更强调因果流式注意力掩码 + 解耦跨模态位置编码 + 并行双 KV-cache,让"看新帧"和"推理旧帧"并行,实现近零 TTFT 的 CoT——它是"边看边想"在工程实现上的代表作。

  • Think While Watching(2026.03):段级别的流式因果掩码与位置编码 + 三阶段 CoT 训练 + 并发 Watch-Think 流水线。

数据关:流式 CoT 数据集

思维链需要标注,流式又加重了标注难度。本方向配套推出了专门数据集:

  • StreamingCoT(2025.10):第一个专门用于流式 VideoQA 的多模态 CoT 数据集——做层级视频密集标注、动态构造问答对、生成多模态推理链,是训练"会边看边想"模型的基石。

动态要不要用(可路由推理)

  • Efficient Streaming Video Understanding Framework with Agentic Control(2026.05):自适应思考——用 SFT + TB-GRPO 训练一个 router,把查询路由到"直接作答"或"慢速深度推理"。不是所有问题都值得想,学会了"选择性思考"。

这个方向的关键洞见(我的提炼)

  1. "想"必须变成记忆:ThinkStream 的 RCSM、VST 的流式思考文本记忆,都在做同一件事——把推理链本身当成一种记忆形态。这很聪明:反正要想,想出来的内容顺便就压缩成了长期语义记忆。
  2. "想多久"是策略问题,靠 RL 解决:ThinkStream 的 RLVR 和 Agentic Framework 的 router,本质都在回答"何时想、想多深"。这是 o1/o3 式"推理时计算权衡"在流式视频领域的投影。
  3. 工程上是推理加速的延伸:Think-as-You-See、ThinkStream 都重度依赖并行 KV-cache、CUDA Graph——和上一篇实时推理密不可分。想得快,才能想得起。

一张表总结

工作 范式/贡献 记忆机制 思考决策 训练
ThinkStream Watch-Think-Speak 推理token锚点(RCSM) 流式RLVR(格式+时机+准确) RLVR
VST 视频流式思考 流式思考文本记忆 两阶段SFT+RL VST-SFT/RL
Think-as-You-See 近零TTFT CoT 并行双KV-cache 因果流式掩码 训练+工程
Think While Watching 并发watch-think 段级因果掩码 三阶段CoT SFT
Agentic Framework 选择性思考 — TB-GRPO router RL

待办 / 观察

  • "边看边想"是把 o 系列"深思才开口"的心智带进实时视频理解的关键一步,会和主动交互(order 1)深度合流——"先想一下再决定开口"。
  • 通用流式 CoT 数据仍是稀缺资源,StreamingCoT 这类工作对下游是关键基建。
  • 未来看点:多智能体协同思考(一个看、一个想、一个说)、与具身 Agent 的融合。

资源索引(Paper / Code / Demo)

工作 Paper Code Demo
ThinkStream(Thinking in Streaming Video) 2603.12938 johncaged/ThinkStream —
VST(Video Streaming Thinking) 2603.12262 1ranGuan/VST —
Think-as-You-See 2603.02872 EIT-NLP/StreamingLLM —
Think While Watching 2603.11896 wl666hhh/Think_While_Watching —
StreamingCoT 2510.25332 Fleeting-hyh/StreamingCoT —
Agentic Control 2605.17921 — —

下一篇是系列的收尾篇:评测基准与训练数据——这一堆技术到底怎么衡量好坏?从 30+ 个 benchmark 里帮你看懂门道。

评论