视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8)
当 Video-MME 榜单顶尖模型逼近 90%,我们却在 2026 年的新基准上看到最强模型不足 50 分。视频理解的"应试教育"时代正在结束,真正的智能考验才刚刚开始。
一、为什么要重新审视视频理解评测?
2024 年以来,多模态大模型(MLLM)在视频理解上的进步堪称神速。以 Video-MME 为代表的主流榜单上,Gemini 2.5 Pro 的准确率已经冲到 84.8%,开源 72B 模型也普遍站上 70+。表面看,"AI 看懂视频"似乎已经接近解决。
但 2025 年下半年到 2026 年,一系列"打脸式"研究接踵而至:
- 苹果团队(2025.05) 分析 7 个主流视频 QA 基准发现,NextQA 中 34.79% 的问题纯语言模型就能答,37.63% 属于语义型,真正考察时序理解的只有 8.75%。
- 谢赛宁、李飞飞、LeCun(2025.11) 证明 VideoMMMU、EgoSchema、VideoMME、LongVideoBench 等基准"更依赖语言理解而非视觉",仅用帧字幕就能超过随机水平 20% 以上。
- Video-MME-v2(2026.4) 用三层能力体系加非线性评分重新测试,最强商业模型 Gemini-3-Pro 仅得 49.4 分,开源最佳 Qwen 为 39.1,而人类专家是 90.7。
- VideoGAIA(2026.8) 把视频理解重新定义为"多轮工具调用智能体任务",20 个顶尖模型无一突破 60%。
这意味着,过去两年我们看到的很多"高分",很大程度上是 benchmark 设计偏简单、模型靠语言先验和数据污染"刷"出来的。视频理解领域正在经历一场从"应试"到"能力"的范式转换。
这篇文章系统梳理 2024 年到 2026 年 8 月视频理解领域的主流 benchmark、头部模型格局和关键技术趋势,既看分数,也看分数背后的真实能力。
二、Benchmark 全景图
视频理解评测并非单一维度,按考察方向可以分为五大类。
2.1 综合视频理解
这是最常被引用、也是模型卡上最常出现的"通用尺子"。
| Benchmark | 提出方/时间 | 规模与特点 | 现状 |
|---|---|---|---|
| Video-MME v1 | 南大等,2024 | 2700 视频/9000 题;11 秒–1 小时;6 大领域 30 子领域;全人工标注 | CVPR 2025 影响力第一,引用 1100+;2026 年已趋饱和,顶尖模型约 90% |
| MVBench | 中科院/上海 AI Lab/港大,CVPR 2024 | 4000 视频、20 项时序任务 | 经典时序感知基准,多选题自动转换 |
| MMBench-Video | OpenCompass | 26 种细粒度能力、GPT-4 自动评估 | 覆盖 12 类认知能力,强调"非平凡推理" |
| EgoSchema | 2024 | 5000 题,约 180 秒第一人称视频 | 长视频 egocentric 问答 |
| Video-MMMU | 南洋理工/CMU,2025.2 | 全球首个"视频教学"基准,感知→理解→运用三阶段,引入"知识增益 Δknowledge" | Gemini 3 Pro 达 87.6% |
| Video-MME-v2 | 南大傅朝友团队,2026.4 | 三层能力(信息检索聚合→时序理解→复杂推理)+ 非线性评分;3300+ 人工时 | 2026 年新标杆,Gemini-3-Pro 49.4、Qwen 最佳 39.1、人类 90.7 |
Video-MME-v2 是理解 2026 年格局的关键。它的核心改变有两点:一是"能力一致性考察",从多个角度提问确保模型真的会,而不是零散答对几题;二是"首错阶段机制",在递进式推理链中早期答错就不能靠后面的题拿分。这直接把模型分数从 80+ 打回 40–50,暴露了真实差距。
2.2 长视频理解
长视频是当前竞争最激烈的方向,因为它直接考验上下文长度、时序记忆和信息聚合能力。
| Benchmark | 平均时长 | 特点 |
|---|---|---|
| LongVideoBench | 约 473 秒(最长数小时) | 6678 题,检索与推理混合 |
| MLVU | 多源长视频 | 9 项任务,M-Avg 综合分常用;2026 CVPR Symphony 达 81.0 |
| LVBench | 平均 4101 秒(约 68 分钟) | 智谱+清华,1549 视频,专为极端长视频设计 |
| InfiniBench(EMNLP 2025) | 平均 53 分钟、超 1000 小时 | 影视剧长视频;连 GPT-4o 在 grounding 技能上也只有 47.1% |
| MovieChat-1K | 约 564 秒 | 电影长视频 |
| Video Panels(CVPR 2026) | 长视频 | 波恩大学提出,无需训练,把多帧拼成图像以换取时间分辨率 |
| Video-MTR(ICML 2026) | 长视频 | 多轮推理迭代选关键片段 + 门控双层奖励,端到端训练 |
一个值得注意的趋势是,2026 年的长视频 benchmark 已经从"能不能看完"进化到"看完后能不能做复杂推理和 grounding"。InfiniBench 的结果说明,即使是最强模型,在小时级视频中精准定位事件、理解叙事逻辑仍然非常困难。
2.3 时序理解与时序定位
这类任务考察模型对时间维度的真实理解——不是"视频里有什么",而是"什么时候发生的、按什么顺序、持续多久"。
| Benchmark | 考察内容 |
|---|---|
| TempCompass | 时序顺序、频率、时长等 |
| Charades-STA / ActivityNet-Captions / QVHighlights | 经典时序定位三件套;2026 CVPR 的 GroundVTS 用问题引导的视觉 token 采样在这三项取得领先 |
| V-STaR | 2025 新出的长视频时序定位,Qwen2.5-VL-7B mIoU 仅 11.48,Video-XL-Pro-3B 达 25.07 |
| TimeScope | 时序定位 |
| EgoTempo(Google,CVPR 2025) | 第一人称视频的细粒度时序理解,答案无法从单帧或常识得出 |
| Know-Show(2025.12) | 时空联合 grounding 与推理统一框架 |
| VEBench(CVPR 2026 Findings) | 视频评测新基准 |
时序定位是视频领域公认的硬骨头。它要求模型输出精确的时间戳,而不是模糊的自然语言描述,对模型的时序分辨率和视觉 grounding 能力要求极高。V-STaR 上 7B 开源模型仅 11.48 mIoU 的数据,说明这个方向远未解决。
2.4 视频推理与知识获取
这是 2025–2026 年增长最快的方向,核心是让模型不只是"看到",而是"想清楚"。
| Benchmark | 时间 | 特点 |
|---|---|---|
| VideoReasonBench | 2024 | 回忆、推断、预测三层复杂视频推理 |
| MMR-V | 2025 | 长距离多帧推理,需在非相邻帧挖掘证据 |
| VCR-Bench / MINERVA | 2025 | 不只评估最终答案,还评估推理过程正确性 |
| Video-MMMU | 2025.2 | 视频知识获取与应用,三阶段认知评估 |
| SciVideoBench | 2025.10 | 首个科学视频推理基准,获 ICCV 2025 Best Benchmark Paper |
| CHAI(CMU/哈佛,CVPR 2026 Highlight) | 2026.5 | 电影镜头语言理解,覆盖 5 大维度 200+ 视觉基元(dolly zoom、rack focus、Dutch angle 等);Qwen3-VL-8B 经后训练反超 Gemini-3.1-Pro 和 GPT-5 |
| VideoGAIA(港中文/蚂蚁/清华/同济/港科大) | 2026.8 | 首个 agentic 视频理解基准,多轮工具调用(网络搜索、网页访问、视频细看,最多 40 步 ReAct 循环);20 个顶尖模型无一过 60% |
| EgoMemReason | 2026.8 | 长时程第一人称记忆推理(实体记忆、事件记忆、行为记忆);17 个系统中最强 Gemini-3-Flash 仅 39.6% |
VideoGAIA 和 EgoMemReason 是 2026 年 8 月最新的两个"照妖镜"。VideoGAIA 的核心洞察是:真实场景中人类看视频不是被动答题,而是边看边查资料、边搜索边推理。当模型必须像智能体一样交替使用视觉感知和外部工具时,所有模型的表现都大幅下滑。EgoMemReason 则揭示了三类记忆的瓶颈各不相同——实体记忆受限于细粒度视觉 grounding,事件记忆受限于长程时序连贯性,行为记忆受限于稀疏重复证据的抽象能力,不能靠简单堆帧数或加字幕解决。
2.5 全模态、自我中心、空间智能与垂类
| Benchmark | 特点 |
|---|---|
| WorldSense(ICLR 2026) | 音视频强耦合——去掉任一模态必然答错;Gemini 2.5 Pro 65.1% 第一 |
| EgoExoBench(NeurIPS 2025) | 第一/第三人称跨视角推理,7300+ QA |
| VSI-Bench(谢赛宁/李飞飞/LeCun,2025.11) | "空间超感知":流式事件认知、隐式 3D、预测性世界建模;模型近乎零分 |
| HRVideoBench | 高分辨率视频理解 |
| StreamingBench | 流式视频理解 |
| MT-Video-Bench(2025.10) | 多轮视频对话 |
WorldSense 值得特别关注。它第一次把"模态必要性"做成硬约束——每道题都满足去掉音频或视频就必然答错,而不是像很多旧基准那样音视频弱相关、看一个模态就能答。这才是真正的全模态理解。
三、头部模型排名
数据截至 2026 年 8 月 27 日,来自官方模型卡、论文、OpenCompass/HyperAI 榜单和权威媒体报道。需要注意的是,同一模型在不同帧数、有无字幕、是否开启 thinking、是否用推理时增强(ITG)等配置下分数差异可达 5–15 分,横向比较需核对口径。
3.1 闭源商业模型
| 模型 | 厂商 | 发布时间 | 视频能力关键数据 | 定位 |
|---|---|---|---|---|
| Gemini 3 Pro / 3.1 Pro | 2025.11.18(3 Pro) | Video-MMMU 87.6%、MMMU-Pro 81%、ScreenSpot-Pro 72.7%;1M token 上下文;原生音视频 | 综合视频第一,长视频与全模态领先两档 | |
| Gemini 3 Flash | 2025.12.17 | EgoMemReason 39.6%(该榜第一);性价比极高 | 速度与成本优选 | |
| GPT-5 / 5.1 / 5.5 | OpenAI | GPT-5 2025;5.5 2026 | VideoSeek(GPT-5) VideoMME 81.2、LongVideoBench 73.5;VideoGAIA 53.14(第四);InfiniBench grounding 第一 | 复杂推理与 grounding 强 |
| Claude Opus 4 / 4.5 | Anthropic | 2026 | 视频非主打,CodeSOTA Video-MME 约 64.7 | 通用推理强,视频弱于 Google/OpenAI |
| Seed2.0-Pro | 字节跳动 | 2026 | VideoGAIA 58.30%(第一) | agentic 视频理解最强 |
Google 在视频理解上的优势主要来自三个方面:原生支持超长上下文(百万级 token)、原生音视频联合训练(而非后期拼接)、以及从 Gemini 1.5 开始积累的长视频工程经验。但在 2026 年 8 月的 VideoGAIA 上,字节 Seed2.0-Pro 凭借更强的智能体能力反超,说明赛道正在从"谁看得长"转向"谁能用得好"。
3.2 开源模型(2026 年最新格局)
| 模型 | 厂商 | 发布 | 关键成绩 | 特点 |
|---|---|---|---|---|
| Qwen3.5 / Qwen3-VL / Qwen3.7-Plus | 阿里 | Qwen3-VL 2025;Qwen3.5 2026.2.16;3.7 2026 | Qwen3-VL(ITG-32) VideoMME 79.9/MLVU 77.2/LVB 63.6;Qwen3.5 MLVU 开源最佳,支持 2 小时视频/1M token;3.7-Plus VideoGAIA 56.09(第二) | 开源综合最强,视觉与代码原生融合,生态最好 |
| InternVL3.5(1B–241B-A28B) | 上海 AI Lab | 2026.1.31 | InternVL3.5-8B(ITG-32) VideoMME 78.4/MLVU 74.1/LVB 65.7;241B 旗舰多模态/推理/文本/agent 多项开源 SOTA;推理 +16%、速度 4× | 开源双雄之一,尺寸全覆盖,级联 RL |
| GLM-4.5V | 智谱 | 2026.8.11 | 106B 总参/12B 激活 MoE;41 项视觉多模态榜单同规模 SOTA;支持图像/视频/文档/GUI/定位 | 2026 年 8 月最新开源旗舰,视觉推理强 |
| MiniCPM-V 4.5(8B) | 面壁智能 | 2025.8.27 | Video-MME 70.4、MLVU 76.5、LongVideoBench 66.0;单图越级超 Gemini 2.5 Pro/GPT-4o | 端侧 SOTA,首创高刷视频理解 |
| Qwen3-Omni-30B-A3B | 阿里 | 2025 | Video-MME 70.5、MLVU 75.2、LongVideoBench 66.9 | 全模态(音视频)开源 MoE |
| Video-XL-Pro(3B) | 2025.5 | MLVU/TempCompass 第一;V-STaR 25.07 mIoU(超 Qwen2.5-VL-7B);8192 帧输入近 99% 准确率 | 3B 逆袭 7B,长视频与时序定位 | |
| Symphony | CVPR 2026 | VideoMME 78.1/MLVU 81.0/LVB 77.1 | MLVU 与 LongVideoBench 新高 | |
| Eagle2.5-8B(ITG-32) | CVPR 2026 | VideoMME 80.0/MLVU 76.5/LVB 66.8 | 8B 级第一梯队 | |
| SVAgent(Qwen3-VL-8B) | CVPR 2026 | VideoMME 78.0/MLVU 65.6/LVB 61.0 | 小模型 agent | |
| Kimi-K3 | 月之暗面 | 2026 | VideoGAIA 54.61(第三) | 多轮视频对话强 |
| InternVideo2.5 / VideoChat-A1 | 上海 AI Lab | AAAI 2026 | VideoChat-A1 VideoMME 76.8/MLVU 76.2/LVB 65.4 | 视频专用架构 |
开源阵营在 2026 年形成了清晰的三强格局:
- 阿里 Qwen3.5 是最均衡的选择,2 小时视频原生输入、视觉代码融合、中文生态和部署成熟度都是最佳,适合绝大多数应用场景。
- 上海 AI Lab InternVL3.5 的优势在于尺寸覆盖最全(1B 到 241B),推理性能和部署效率经过专门优化,241B 旗舰在多个基准上追平 GPT-5。
- 智谱 GLM-4.5V 是 2026 年 8 月最新发布的搅局者,106B/12B 激活的 MoE 架构在同规模开源模型中拿下 41 项 SOTA,并且同步开源了桌面助手应用(截屏录屏 + GUI 操作),把视觉理解直接接入编程工作流。
小模型方向,面壁 MiniCPM-V 4.5 依然是端侧标杆,8B 参数在视频理解上越级打 72B;CVPR 2026 上 Eagle2.5-8B、InternVL3.5-8B 等 8B 级方案也集体冲到 VideoMME 78–80 分,说明视频能力正在快速向端侧下沉。
3.3 2026 年专项冠军
| 方向 | 冠军模型 | 关键数据 |
|---|---|---|
| 综合视频理解(闭源) | Gemini 3 Pro | Video-MMMU 87.6% |
| 综合视频理解(开源) | Qwen3.5 / InternVL3.5-241B | 多项开源 SOTA |
| Agentic 视频理解 | Seed2.0-Pro | VideoGAIA 58.30%(2026.8 最新) |
| 长视频推理新基准 | Gemini-3-Pro | Video-MME-v2 49.4(人类 90.7) |
| 长时程自我中心记忆 | Gemini-3-Flash | EgoMemReason 39.6% |
| 全模态音视频 | Gemini 2.5/3 Pro | WorldSense 65.1% |
| 电影镜头语言 | Qwen3-VL-8B + CHAI 后训练 | 反超 Gemini-3.1-Pro/GPT-5(CVPR 2026 Highlight) |
| 端侧/小模型 | MiniCPM-V 4.5(8B) | 同级 SOTA,高刷视频首创 |
| 长视频时序定位 | Video-XL-Pro-3B | V-STaR 25.07 mIoU |
| MLVU | Symphony(CVPR 2026) | 81.0 |
| LongVideoBench | Symphony(CVPR 2026) | 77.1 |
| 视觉推理开源(100B 级) | GLM-4.5V(2026.8.11) | 41 项榜单同规模 SOTA |
四、2024→2026 的关键演进趋势
4.1 模型能力:代际跃迁明显
回顾这 18 个月,视频理解模型经历了三代跃迁:
- 2024 年:GPT-4o 和 Gemini 1.5 Pro 以 75% 左右领跑,开源 LLaVA-OneVision、Qwen2-VL 还在 50–60 分区间,闭源优势明显。
- 2025 年:Gemini 2.5 Pro 在 Video-MME 冲到 84.8%,Qwen2.5-VL-72B 和 InternVL3 逼近闭源;MiniCPM-V 4.5 证明 8B 小模型可以越级打 72B,端侧赛道被激活。
- 2026 年:Gemini 3 Pro 在 Video-MMMU 达 87.6%;Qwen3.5 支持 2 小时视频原生输入;InternVL3.5-241B 和 GLM-4.5V(106B MoE) 等开源旗舰追平 GPT-5;CVPR 2026 上 8B 级模型 VideoMME 普遍达到 78–80 分。
闭源与开源的差距在短视频和标准榜上已缩小到 90% 左右,但在长视频(>30 分钟)、复杂时空推理、全模态耦合、agentic 工具使用上,差距仍然显著。
4.2 评测范式:四个转向
2026 年视频理解评测正在经历根本性的范式转换:
- 单轮问答 → 多轮工具调用:VideoGAIA、MT-Video-Bench 把视频理解重新定义为智能体任务,模型必须边看边查边推理。
- 只看答案 → 推理过程加时空 grounding 双重评估:VCR-Bench、MINERVA、Know-Show、CHAI 要求模型不仅答对,还要给出可验证的推理链和视觉证据。
- 短片段 → 小时级长视频加长时记忆:LVBench、InfiniBench、EgoMemReason 把视频长度推到极限,Qwen3.5 和 Gemini 3 直接支持 1–2 小时原生输入。
- 视觉单模态 → 音视频强耦合:WorldSense、Qwen3-Omni、Gemini 原生多模态要求模型真正同时利用音频和视觉信息。
4.3 工程与架构热点
- 动态 token 采样与分辨率自适应:小米 Q-Frame(ICCV 2025)和 GroundVTS(CVPR 2026)都走"免训练、即插即用"路线,根据问题相关性动态选帧和调整分辨率,避免均匀采样的浪费和信息丢失。
- 视觉 token 压缩:Video-XL-Pro 用自监督压缩支持 8192 帧输入;InternVL3.5 引入 ViR 分辨率路由器加 DvD 解耦部署,推理速度提升 4 倍。
- 推理时增强(inference-time scaling):CVPR 2026 榜单上大量出现 ITG-32 配置(inference-time guidance,32 帧),视频领域开始复制 LLM 的 test-time compute 路线,通过多帧采样和推理时搜索提升表现。
- 原生多模态与 MoE:Qwen3.5(397B/17B 激活)、GLM-4.5V(106B/12B 激活)、Gemini 3(稀疏 MoE)都转向原生多模态训练,不再用独立视觉编码器拼接,同时用 MoE 控制激活成本。
- Thinking 模式的双面性:Video-MME-v2 论文发现,开启 thinking 后 Qwen3.5 在有字幕时提升 5.8 分,但 KimiVL 反而整体下降 3.3 分,在 Level 3 复杂推理上退化达 4 分。这说明很多"推理增强"仍在依赖文本锚点,而不是从视觉和音频中稳定抽取证据——一旦文本线索不足,thinking 反而引入噪声。
- 视频 agent 与具身智能:GLM-4.5V 同步开源桌面助手,Qwen3.5 可自主操作手机和电脑,VideoGAIA 把视频理解变成 agentic 任务,视频模型正从"被动答题器"向"主动执行者"演进。
五、选型建议
基于以上分析,针对不同场景给出 2026 年 8 月的选型参考:
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 追求最强效果、预算充足 | Gemini 3 Pro(长视频/全模态)、GPT-5.5(复杂推理)、Seed2.0-Pro(agentic 视频) | 各有所长,闭源第一梯队 |
| 开源可部署、综合均衡 | Qwen3.5(首选)、InternVL3.5、GLM-4.5V | 中文生态好、长视频强、社区活跃 |
| 端侧/成本敏感 | MiniCPM-V 4.5(8B)、InternVL3.5-8B、Eagle2.5-8B | 单卡可跑,视频能力越级 |
| 超长视频(小时级) | Qwen3.5(2 小时原生)、Gemini 3 Pro(1M token)、Video-XL-Pro(8192 帧) | 上下文长度与记忆机制各有优势 |
| 音视频联合理解 | Gemini 3 Pro、Qwen3-Omni | 原生音视频训练 |
| 中文/国内合规 | Qwen3.5、GLM-4.5V、Seed2.0-Pro、MiniCPM-V | 国产模型,中文友好,API 稳定 |
| 视频 agent / GUI 操作 | GLM-4.5V、Qwen3.5、Seed2.0-Pro | 已具备工具调用和屏幕操作能力 |
| 时序定位 | Video-XL-Pro、GroundVTS(CVPR 2026) | 在 V-STaR/Charades-STA 上领先 |
六、结语
视频理解领域正在经历一场"祛魅"。2024 年我们惊叹于模型能看懂短视频,2025 年我们以为长视频也被攻克,到了 2026 年,更严格的 benchmark 告诉我们:经典单选题上的 90 分,很大程度上是题目太简单、模型靠语言先验和数据污染"背"出来的。当评测转向 agentic 多轮工具调用、长时程记忆、音视频强耦合、时空 grounding 和推理过程验证时,最强模型也只有 40–60 分,距离人类的 90 分还有巨大鸿沟。
但这恰恰是领域成熟的标志。一个健康的研究方向,不是所有模型都在饱和的榜单上刷 90 分,而是不断有更难、更贴近真实智能的基准出现,指明下一步该往哪里走。从 Video-MME v1 到 v2、从单轮问答到 VideoGAIA、从视觉单模态到 WorldSense,我们能清晰地看到这个方向正在从"感知视频"走向"理解视频"再到"使用视频"。
对于从业者来说,2026 年的务实建议是:不要被单一榜单分数迷惑,根据真实任务选择对应方向的 benchmark 评估;闭源模型在能力上仍有优势,但开源三强(Qwen3.5、InternVL3.5、GLM-4.5V)已经能覆盖绝大多数场景;如果要做视频 agent,重点关注模型的工具调用和长时记忆能力,而不只是 Video-MME 分数。
视频理解的下半场,才刚刚开始。
参考来源:Video-MME/v2、MVBench、LongVideoBench、MLVU、LVBench、InfiniBench、Video-MMMU、VideoGAIA、EgoMemReason、WorldSense、CHAI、Know-Show、GroundVTS、Symphony 等论文与官方榜单;Google、阿里、上海 AI Lab、智谱、面壁、字节等官方模型卡与发布稿;OpenCompass、HyperAI SOTA、CodeSOTA 等公开排行榜;CVPR/ICML/ICLR/NeurIPS 2025–2026 录用论文;央视网、证券时报、机器之心、量子位、澎湃新闻等权威媒体报道。数据截至 2026 年 8 月 27 日。