全部标签

#KV-Cache

共 2 篇文章

·技术, 多模态
1 分钟0

流式视频理解 VLM 精读②:长时记忆——无限视频流怎么记住?

> 这是「流式视频理解 VLM 精读」系列第 2 篇。上一篇讲"何时开口",这篇讲"开口时还记得什么"——视频是无限流,但模型的注意力窗口和显存是有限的,怎么做到"几个小时后还记得之前发生的事"? 记忆问题的本质 看过几小时球赛,人记得"上半场有个越位没吹"。但 VLM 做不到直接

·技术, 多模态
1 分钟0

流式视频理解 VLM 精读③:实时推理——怎么才够快?

> 这是「流式视频理解 VLM 精读」系列第 3 篇。前两篇解决"要不要说、还记得吗",这篇解决一个更现实的问题:就算你又主动又记得住,如果不够快,体验直接归零。视频是实时的,模型响应也要接近实时。 实时推理的两大硬指标 流式视频模型的"快"不是玄学,业界普遍盯着两个数: 1.