这是「流式视频理解 VLM 精读」系列第 4 篇。前三篇分别讲了"开口、记忆、速度",这篇是一个既有"智能"又有"品味"的新方向:让模型一边看视频一边输出推理(Chain-of-Thought),并且学会把握"想多久才算够"。
为什么"边看边想"这么难?
单看"看视频后再推理",其实一直能做(离线视频 QA + CoT 早已成熟)。难的是**"边看边想"**这个动词组合里的"边":
- 时序因果:推理必须只基于当前及过去看到的内容,不能偷看未来帧——这比离线推理苛刻。
- 同时发生:观看和推理在同一时间轴上推进,模型要"边接收新帧边产推理链",这对注意力和 KV-cache 都是硬约束。
- 想多久是个决策:不是所有问题都需要长思考——想太久就错过实时性,想太短又答不准。"该不该想、想多久"本身成了要学习的策略。
本仓库这个方向篇幅不大但很精炼,核心是几篇把"流式 + CoT"成套立起来的工作。
立范式:Watch-Think-Speak
-
Thinking in Streaming Video / ThinkStream(2026.03):明确提出 Watch-Think-Speak 三段范式,并配套两大设计:
- Reasoning-Compressed Streaming Memory(RCSM):短时用视觉滑窗,长期则用推理 token 当语义锚点——把"想过的内容"当作压缩记忆,一举两得。
- 流式 RLVR:奖励同时覆盖格式(正确使用
<silent>/<response>动作token)、时机(是否该想/想多久)、准确性三个方面。 - 还有工程细节:Eager Prefill + CUDA Graph decode-and-prune,让推理时不卡帧。
-
Video Streaming Thinking / VST(2026.03):并行提出的同样范式,核心是:
- 短时视觉滑窗 + 长时流式思考文本记忆(FIFO 驱逐);
- 用 VKG(Video Knowledge Graph) 做流式 CoT 数据的自动合成;
- 两阶段训练:VST-SFT(先学会想)+ VST-RL(再学会想得又快又对)。
让"看"和"想"真正并行
-
Think-as-You-See(EIT-NLP,2026.03):不只是推理,更强调因果流式注意力掩码 + 解耦跨模态位置编码 + 并行双 KV-cache,让"看新帧"和"推理旧帧"并行,实现近零 TTFT 的 CoT——它是"边看边想"在工程实现上的代表作。
-
Think While Watching(2026.03):段级别的流式因果掩码与位置编码 + 三阶段 CoT 训练 + 并发 Watch-Think 流水线。
数据关:流式 CoT 数据集
思维链需要标注,流式又加重了标注难度。本方向配套推出了专门数据集:
- StreamingCoT(2025.10):第一个专门用于流式 VideoQA 的多模态 CoT 数据集——做层级视频密集标注、动态构造问答对、生成多模态推理链,是训练"会边看边想"模型的基石。
动态要不要用(可路由推理)
- Efficient Streaming Video Understanding Framework with Agentic Control(2026.05):自适应思考——用 SFT + TB-GRPO 训练一个 router,把查询路由到"直接作答"或"慢速深度推理"。不是所有问题都值得想,学会了"选择性思考"。
这个方向的关键洞见(我的提炼)
- "想"必须变成记忆:ThinkStream 的 RCSM、VST 的流式思考文本记忆,都在做同一件事——把推理链本身当成一种记忆形态。这很聪明:反正要想,想出来的内容顺便就压缩成了长期语义记忆。
- "想多久"是策略问题,靠 RL 解决:ThinkStream 的 RLVR 和 Agentic Framework 的 router,本质都在回答"何时想、想多深"。这是 o1/o3 式"推理时计算权衡"在流式视频领域的投影。
- 工程上是推理加速的延伸:Think-as-You-See、ThinkStream 都重度依赖并行 KV-cache、CUDA Graph——和上一篇实时推理密不可分。想得快,才能想得起。
一张表总结
| 工作 | 范式/贡献 | 记忆机制 | 思考决策 | 训练 |
|---|---|---|---|---|
| ThinkStream | Watch-Think-Speak | 推理token锚点(RCSM) | 流式RLVR(格式+时机+准确) | RLVR |
| VST | 视频流式思考 | 流式思考文本记忆 | 两阶段SFT+RL | VST-SFT/RL |
| Think-as-You-See | 近零TTFT CoT | 并行双KV-cache | 因果流式掩码 | 训练+工程 |
| Think While Watching | 并发watch-think | 段级因果掩码 | 三阶段CoT | SFT |
| Agentic Framework | 选择性思考 | — | TB-GRPO router | RL |
待办 / 观察
- "边看边想"是把 o 系列"深思才开口"的心智带进实时视频理解的关键一步,会和主动交互(order 1)深度合流——"先想一下再决定开口"。
- 通用流式 CoT 数据仍是稀缺资源,StreamingCoT 这类工作对下游是关键基建。
- 未来看点:多智能体协同思考(一个看、一个想、一个说)、与具身 Agent 的融合。
资源索引(Paper / Code / Demo)
| 工作 | Paper | Code | Demo |
|---|---|---|---|
| ThinkStream(Thinking in Streaming Video) | 2603.12938 | johncaged/ThinkStream | — |
| VST(Video Streaming Thinking) | 2603.12262 | 1ranGuan/VST | — |
| Think-as-You-See | 2603.02872 | EIT-NLP/StreamingLLM | — |
| Think While Watching | 2603.11896 | wl666hhh/Think_While_Watching | — |
| StreamingCoT | 2510.25332 | Fleeting-hyh/StreamingCoT | — |
| Agentic Control | 2605.17921 | — | — |
下一篇是系列的收尾篇:评测基准与训练数据——这一堆技术到底怎么衡量好坏?从 30+ 个 benchmark 里帮你看懂门道。