全双工语音模型精读⑪:流式视频理解 VLM 全景——从音频全双工到'边看边想边开口'
> 本文基于开源文献地图仓库 Awesome-VLM-Streaming-Videohttps://github.com/ydyhello/Awesome-VLM-Streaming-Video(京东探索研究院维护)做一次领域全景梳理。它汇集了 2024–2026 年"流式/在线视频理解"方
> 本文基于开源文献地图仓库 Awesome-VLM-Streaming-Videohttps://github.com/ydyhello/Awesome-VLM-Streaming-Video(京东探索研究院维护)做一次领域全景梳理。它汇集了 2024–2026 年"流式/在线视频理解"方
> 本文是「流式视频理解 VLM 精读」系列的开篇(总览/索引篇)。系列素材来自开源文献地图 Awesome-VLM-Streaming-Videohttps://github.com/ydyhello/Awesome-VLM-Streaming-Video(京东探索研究院维护),它汇集了
> 这是「流式视频理解 VLM 精读」系列第 1 篇。上一篇是领域地图,这篇扎进最核心也最微妙的问题:流式视频模型凭什么决定自己"该不该开口、什么时候开口"? 一个看似简单、实则很难的问题 人陪你看球赛,进球时会喊"进了!",但不会每分钟都喊。这份"何时说话"的直觉,对 VLM 而
> 这是「流式视频理解 VLM 精读」系列第 2 篇。上一篇讲"何时开口",这篇讲"开口时还记得什么"——视频是无限流,但模型的注意力窗口和显存是有限的,怎么做到"几个小时后还记得之前发生的事"? 记忆问题的本质 看过几小时球赛,人记得"上半场有个越位没吹"。但 VLM 做不到直接
> 这是「流式视频理解 VLM 精读」系列第 3 篇。前两篇解决"要不要说、还记得吗",这篇解决一个更现实的问题:就算你又主动又记得住,如果不够快,体验直接归零。视频是实时的,模型响应也要接近实时。 实时推理的两大硬指标 流式视频模型的"快"不是玄学,业界普遍盯着两个数: 1.
> 这是「流式视频理解 VLM 精读」系列第 4 篇。前三篇分别讲了"开口、记忆、速度",这篇是一个既有"智能"又有"品味"的新方向:让模型一边看视频一边输出推理(Chain-of-Thought),并且学会把握"想多久才算够"。 为什么"边看边想"这么难? 单看"看视频后再推理"
> 这是「流式视频理解 VLM 精读」系列的收尾篇。前四篇讲了"开口、记忆、速度、思考"四项技术,但这一切的前提是——我们要能正确衡量"模型到底懂不懂流式视频"。这篇把本领域 30+ 个 benchmark 与训练数据集盘一遍,帮你看懂门道。 为什么要专门的"流式"评测? 普通视频