Back

视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8)

视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8)

当 Video-MME 榜单顶尖模型逼近 90%,我们却在 2026 年的新基准上看到最强模型不足 50 分。视频理解的"应试教育"时代正在结束,真正的智能考验才刚刚开始。

一、为什么要重新审视视频理解评测?

2024 年以来,多模态大模型(MLLM)在视频理解上的进步堪称神速。以 Video-MME 为代表的主流榜单上,Gemini 2.5 Pro 的准确率已经冲到 84.8%,开源 72B 模型也普遍站上 70+。表面看,"AI 看懂视频"似乎已经接近解决。

但 2025 年下半年到 2026 年,一系列"打脸式"研究接踵而至:

  • 苹果团队(2025.05) 分析 7 个主流视频 QA 基准发现,NextQA 中 34.79% 的问题纯语言模型就能答,37.63% 属于语义型,真正考察时序理解的只有 8.75%
  • 谢赛宁、李飞飞、LeCun(2025.11) 证明 VideoMMMU、EgoSchema、VideoMME、LongVideoBench 等基准"更依赖语言理解而非视觉",仅用帧字幕就能超过随机水平 20% 以上。
  • Video-MME-v2(2026.4) 用三层能力体系加非线性评分重新测试,最强商业模型 Gemini-3-Pro 仅得 49.4 分,开源最佳 Qwen 为 39.1,而人类专家是 90.7。
  • VideoGAIA(2026.8) 把视频理解重新定义为"多轮工具调用智能体任务",20 个顶尖模型无一突破 60%。

这意味着,过去两年我们看到的很多"高分",很大程度上是 benchmark 设计偏简单、模型靠语言先验和数据污染"刷"出来的。视频理解领域正在经历一场从"应试"到"能力"的范式转换。

这篇文章系统梳理 2024 年到 2026 年 8 月视频理解领域的主流 benchmark、头部模型格局和关键技术趋势,既看分数,也看分数背后的真实能力。


二、Benchmark 全景图

视频理解评测并非单一维度,按考察方向可以分为五大类。

2.1 综合视频理解

这是最常被引用、也是模型卡上最常出现的"通用尺子"。

Benchmark 提出方/时间 规模与特点 现状
Video-MME v1 南大等,2024 2700 视频/9000 题;11 秒–1 小时;6 大领域 30 子领域;全人工标注 CVPR 2025 影响力第一,引用 1100+;2026 年已趋饱和,顶尖模型约 90%
MVBench 中科院/上海 AI Lab/港大,CVPR 2024 4000 视频、20 项时序任务 经典时序感知基准,多选题自动转换
MMBench-Video OpenCompass 26 种细粒度能力、GPT-4 自动评估 覆盖 12 类认知能力,强调"非平凡推理"
EgoSchema 2024 5000 题,约 180 秒第一人称视频 长视频 egocentric 问答
Video-MMMU 南洋理工/CMU,2025.2 全球首个"视频教学"基准,感知→理解→运用三阶段,引入"知识增益 Δknowledge" Gemini 3 Pro 达 87.6%
Video-MME-v2 南大傅朝友团队,2026.4 三层能力(信息检索聚合→时序理解→复杂推理)+ 非线性评分;3300+ 人工时 2026 年新标杆,Gemini-3-Pro 49.4、Qwen 最佳 39.1、人类 90.7

Video-MME-v2 是理解 2026 年格局的关键。它的核心改变有两点:一是"能力一致性考察",从多个角度提问确保模型真的会,而不是零散答对几题;二是"首错阶段机制",在递进式推理链中早期答错就不能靠后面的题拿分。这直接把模型分数从 80+ 打回 40–50,暴露了真实差距。

2.2 长视频理解

长视频是当前竞争最激烈的方向,因为它直接考验上下文长度、时序记忆和信息聚合能力。

Benchmark 平均时长 特点
LongVideoBench 约 473 秒(最长数小时) 6678 题,检索与推理混合
MLVU 多源长视频 9 项任务,M-Avg 综合分常用;2026 CVPR Symphony 达 81.0
LVBench 平均 4101 秒(约 68 分钟) 智谱+清华,1549 视频,专为极端长视频设计
InfiniBench(EMNLP 2025) 平均 53 分钟、超 1000 小时 影视剧长视频;连 GPT-4o 在 grounding 技能上也只有 47.1%
MovieChat-1K 约 564 秒 电影长视频
Video Panels(CVPR 2026) 长视频 波恩大学提出,无需训练,把多帧拼成图像以换取时间分辨率
Video-MTR(ICML 2026) 长视频 多轮推理迭代选关键片段 + 门控双层奖励,端到端训练

一个值得注意的趋势是,2026 年的长视频 benchmark 已经从"能不能看完"进化到"看完后能不能做复杂推理和 grounding"。InfiniBench 的结果说明,即使是最强模型,在小时级视频中精准定位事件、理解叙事逻辑仍然非常困难。

2.3 时序理解与时序定位

这类任务考察模型对时间维度的真实理解——不是"视频里有什么",而是"什么时候发生的、按什么顺序、持续多久"。

Benchmark 考察内容
TempCompass 时序顺序、频率、时长等
Charades-STA / ActivityNet-Captions / QVHighlights 经典时序定位三件套;2026 CVPR 的 GroundVTS 用问题引导的视觉 token 采样在这三项取得领先
V-STaR 2025 新出的长视频时序定位,Qwen2.5-VL-7B mIoU 仅 11.48,Video-XL-Pro-3B 达 25.07
TimeScope 时序定位
EgoTempo(Google,CVPR 2025) 第一人称视频的细粒度时序理解,答案无法从单帧或常识得出
Know-Show(2025.12) 时空联合 grounding 与推理统一框架
VEBench(CVPR 2026 Findings) 视频评测新基准

时序定位是视频领域公认的硬骨头。它要求模型输出精确的时间戳,而不是模糊的自然语言描述,对模型的时序分辨率和视觉 grounding 能力要求极高。V-STaR 上 7B 开源模型仅 11.48 mIoU 的数据,说明这个方向远未解决。

2.4 视频推理与知识获取

这是 2025–2026 年增长最快的方向,核心是让模型不只是"看到",而是"想清楚"。

Benchmark 时间 特点
VideoReasonBench 2024 回忆、推断、预测三层复杂视频推理
MMR-V 2025 长距离多帧推理,需在非相邻帧挖掘证据
VCR-Bench / MINERVA 2025 不只评估最终答案,还评估推理过程正确性
Video-MMMU 2025.2 视频知识获取与应用,三阶段认知评估
SciVideoBench 2025.10 首个科学视频推理基准,获 ICCV 2025 Best Benchmark Paper
CHAI(CMU/哈佛,CVPR 2026 Highlight 2026.5 电影镜头语言理解,覆盖 5 大维度 200+ 视觉基元(dolly zoom、rack focus、Dutch angle 等);Qwen3-VL-8B 经后训练反超 Gemini-3.1-Pro 和 GPT-5
VideoGAIA(港中文/蚂蚁/清华/同济/港科大) 2026.8 首个 agentic 视频理解基准,多轮工具调用(网络搜索、网页访问、视频细看,最多 40 步 ReAct 循环);20 个顶尖模型无一过 60%
EgoMemReason 2026.8 长时程第一人称记忆推理(实体记忆、事件记忆、行为记忆);17 个系统中最强 Gemini-3-Flash 仅 39.6%

VideoGAIA 和 EgoMemReason 是 2026 年 8 月最新的两个"照妖镜"。VideoGAIA 的核心洞察是:真实场景中人类看视频不是被动答题,而是边看边查资料、边搜索边推理。当模型必须像智能体一样交替使用视觉感知和外部工具时,所有模型的表现都大幅下滑。EgoMemReason 则揭示了三类记忆的瓶颈各不相同——实体记忆受限于细粒度视觉 grounding,事件记忆受限于长程时序连贯性,行为记忆受限于稀疏重复证据的抽象能力,不能靠简单堆帧数或加字幕解决。

2.5 全模态、自我中心、空间智能与垂类

Benchmark 特点
WorldSense(ICLR 2026) 音视频强耦合——去掉任一模态必然答错;Gemini 2.5 Pro 65.1% 第一
EgoExoBench(NeurIPS 2025) 第一/第三人称跨视角推理,7300+ QA
VSI-Bench(谢赛宁/李飞飞/LeCun,2025.11) "空间超感知":流式事件认知、隐式 3D、预测性世界建模;模型近乎零分
HRVideoBench 高分辨率视频理解
StreamingBench 流式视频理解
MT-Video-Bench(2025.10) 多轮视频对话

WorldSense 值得特别关注。它第一次把"模态必要性"做成硬约束——每道题都满足去掉音频或视频就必然答错,而不是像很多旧基准那样音视频弱相关、看一个模态就能答。这才是真正的全模态理解。


三、头部模型排名

数据截至 2026 年 8 月 27 日,来自官方模型卡、论文、OpenCompass/HyperAI 榜单和权威媒体报道。需要注意的是,同一模型在不同帧数、有无字幕、是否开启 thinking、是否用推理时增强(ITG)等配置下分数差异可达 5–15 分,横向比较需核对口径。

3.1 闭源商业模型

模型 厂商 发布时间 视频能力关键数据 定位
Gemini 3 Pro / 3.1 Pro Google 2025.11.18(3 Pro) Video-MMMU 87.6%、MMMU-Pro 81%、ScreenSpot-Pro 72.7%;1M token 上下文;原生音视频 综合视频第一,长视频与全模态领先两档
Gemini 3 Flash Google 2025.12.17 EgoMemReason 39.6%(该榜第一);性价比极高 速度与成本优选
GPT-5 / 5.1 / 5.5 OpenAI GPT-5 2025;5.5 2026 VideoSeek(GPT-5) VideoMME 81.2、LongVideoBench 73.5;VideoGAIA 53.14(第四);InfiniBench grounding 第一 复杂推理与 grounding 强
Claude Opus 4 / 4.5 Anthropic 2026 视频非主打,CodeSOTA Video-MME 约 64.7 通用推理强,视频弱于 Google/OpenAI
Seed2.0-Pro 字节跳动 2026 VideoGAIA 58.30%(第一) agentic 视频理解最强

Google 在视频理解上的优势主要来自三个方面:原生支持超长上下文(百万级 token)、原生音视频联合训练(而非后期拼接)、以及从 Gemini 1.5 开始积累的长视频工程经验。但在 2026 年 8 月的 VideoGAIA 上,字节 Seed2.0-Pro 凭借更强的智能体能力反超,说明赛道正在从"谁看得长"转向"谁能用得好"。

3.2 开源模型(2026 年最新格局)

模型 厂商 发布 关键成绩 特点
Qwen3.5 / Qwen3-VL / Qwen3.7-Plus 阿里 Qwen3-VL 2025;Qwen3.5 2026.2.16;3.7 2026 Qwen3-VL(ITG-32) VideoMME 79.9/MLVU 77.2/LVB 63.6;Qwen3.5 MLVU 开源最佳,支持 2 小时视频/1M token;3.7-Plus VideoGAIA 56.09(第二) 开源综合最强,视觉与代码原生融合,生态最好
InternVL3.5(1B–241B-A28B) 上海 AI Lab 2026.1.31 InternVL3.5-8B(ITG-32) VideoMME 78.4/MLVU 74.1/LVB 65.7;241B 旗舰多模态/推理/文本/agent 多项开源 SOTA;推理 +16%、速度 4× 开源双雄之一,尺寸全覆盖,级联 RL
GLM-4.5V 智谱 2026.8.11 106B 总参/12B 激活 MoE;41 项视觉多模态榜单同规模 SOTA;支持图像/视频/文档/GUI/定位 2026 年 8 月最新开源旗舰,视觉推理强
MiniCPM-V 4.5(8B) 面壁智能 2025.8.27 Video-MME 70.4、MLVU 76.5、LongVideoBench 66.0;单图越级超 Gemini 2.5 Pro/GPT-4o 端侧 SOTA,首创高刷视频理解
Qwen3-Omni-30B-A3B 阿里 2025 Video-MME 70.5、MLVU 75.2、LongVideoBench 66.9 全模态(音视频)开源 MoE
Video-XL-Pro(3B) 2025.5 MLVU/TempCompass 第一;V-STaR 25.07 mIoU(超 Qwen2.5-VL-7B);8192 帧输入近 99% 准确率 3B 逆袭 7B,长视频与时序定位
Symphony CVPR 2026 VideoMME 78.1/MLVU 81.0/LVB 77.1 MLVU 与 LongVideoBench 新高
Eagle2.5-8B(ITG-32) CVPR 2026 VideoMME 80.0/MLVU 76.5/LVB 66.8 8B 级第一梯队
SVAgent(Qwen3-VL-8B) CVPR 2026 VideoMME 78.0/MLVU 65.6/LVB 61.0 小模型 agent
Kimi-K3 月之暗面 2026 VideoGAIA 54.61(第三) 多轮视频对话强
InternVideo2.5 / VideoChat-A1 上海 AI Lab AAAI 2026 VideoChat-A1 VideoMME 76.8/MLVU 76.2/LVB 65.4 视频专用架构

开源阵营在 2026 年形成了清晰的三强格局:

  1. 阿里 Qwen3.5 是最均衡的选择,2 小时视频原生输入、视觉代码融合、中文生态和部署成熟度都是最佳,适合绝大多数应用场景。
  2. 上海 AI Lab InternVL3.5 的优势在于尺寸覆盖最全(1B 到 241B),推理性能和部署效率经过专门优化,241B 旗舰在多个基准上追平 GPT-5。
  3. 智谱 GLM-4.5V 是 2026 年 8 月最新发布的搅局者,106B/12B 激活的 MoE 架构在同规模开源模型中拿下 41 项 SOTA,并且同步开源了桌面助手应用(截屏录屏 + GUI 操作),把视觉理解直接接入编程工作流。

小模型方向,面壁 MiniCPM-V 4.5 依然是端侧标杆,8B 参数在视频理解上越级打 72B;CVPR 2026 上 Eagle2.5-8B、InternVL3.5-8B 等 8B 级方案也集体冲到 VideoMME 78–80 分,说明视频能力正在快速向端侧下沉。

3.3 2026 年专项冠军

方向 冠军模型 关键数据
综合视频理解(闭源) Gemini 3 Pro Video-MMMU 87.6%
综合视频理解(开源) Qwen3.5 / InternVL3.5-241B 多项开源 SOTA
Agentic 视频理解 Seed2.0-Pro VideoGAIA 58.30%(2026.8 最新)
长视频推理新基准 Gemini-3-Pro Video-MME-v2 49.4(人类 90.7)
长时程自我中心记忆 Gemini-3-Flash EgoMemReason 39.6%
全模态音视频 Gemini 2.5/3 Pro WorldSense 65.1%
电影镜头语言 Qwen3-VL-8B + CHAI 后训练 反超 Gemini-3.1-Pro/GPT-5(CVPR 2026 Highlight)
端侧/小模型 MiniCPM-V 4.5(8B) 同级 SOTA,高刷视频首创
长视频时序定位 Video-XL-Pro-3B V-STaR 25.07 mIoU
MLVU Symphony(CVPR 2026) 81.0
LongVideoBench Symphony(CVPR 2026) 77.1
视觉推理开源(100B 级) GLM-4.5V(2026.8.11) 41 项榜单同规模 SOTA

四、2024→2026 的关键演进趋势

4.1 模型能力:代际跃迁明显

回顾这 18 个月,视频理解模型经历了三代跃迁:

  • 2024 年:GPT-4o 和 Gemini 1.5 Pro 以 75% 左右领跑,开源 LLaVA-OneVision、Qwen2-VL 还在 50–60 分区间,闭源优势明显。
  • 2025 年:Gemini 2.5 Pro 在 Video-MME 冲到 84.8%,Qwen2.5-VL-72B 和 InternVL3 逼近闭源;MiniCPM-V 4.5 证明 8B 小模型可以越级打 72B,端侧赛道被激活。
  • 2026 年:Gemini 3 Pro 在 Video-MMMU 达 87.6%;Qwen3.5 支持 2 小时视频原生输入;InternVL3.5-241B 和 GLM-4.5V(106B MoE) 等开源旗舰追平 GPT-5;CVPR 2026 上 8B 级模型 VideoMME 普遍达到 78–80 分。

闭源与开源的差距在短视频和标准榜上已缩小到 90% 左右,但在长视频(>30 分钟)、复杂时空推理、全模态耦合、agentic 工具使用上,差距仍然显著。

4.2 评测范式:四个转向

2026 年视频理解评测正在经历根本性的范式转换:

  1. 单轮问答 → 多轮工具调用:VideoGAIA、MT-Video-Bench 把视频理解重新定义为智能体任务,模型必须边看边查边推理。
  2. 只看答案 → 推理过程加时空 grounding 双重评估:VCR-Bench、MINERVA、Know-Show、CHAI 要求模型不仅答对,还要给出可验证的推理链和视觉证据。
  3. 短片段 → 小时级长视频加长时记忆:LVBench、InfiniBench、EgoMemReason 把视频长度推到极限,Qwen3.5 和 Gemini 3 直接支持 1–2 小时原生输入。
  4. 视觉单模态 → 音视频强耦合:WorldSense、Qwen3-Omni、Gemini 原生多模态要求模型真正同时利用音频和视觉信息。

4.3 工程与架构热点

  • 动态 token 采样与分辨率自适应:小米 Q-Frame(ICCV 2025)和 GroundVTS(CVPR 2026)都走"免训练、即插即用"路线,根据问题相关性动态选帧和调整分辨率,避免均匀采样的浪费和信息丢失。
  • 视觉 token 压缩:Video-XL-Pro 用自监督压缩支持 8192 帧输入;InternVL3.5 引入 ViR 分辨率路由器加 DvD 解耦部署,推理速度提升 4 倍。
  • 推理时增强(inference-time scaling):CVPR 2026 榜单上大量出现 ITG-32 配置(inference-time guidance,32 帧),视频领域开始复制 LLM 的 test-time compute 路线,通过多帧采样和推理时搜索提升表现。
  • 原生多模态与 MoE:Qwen3.5(397B/17B 激活)、GLM-4.5V(106B/12B 激活)、Gemini 3(稀疏 MoE)都转向原生多模态训练,不再用独立视觉编码器拼接,同时用 MoE 控制激活成本。
  • Thinking 模式的双面性:Video-MME-v2 论文发现,开启 thinking 后 Qwen3.5 在有字幕时提升 5.8 分,但 KimiVL 反而整体下降 3.3 分,在 Level 3 复杂推理上退化达 4 分。这说明很多"推理增强"仍在依赖文本锚点,而不是从视觉和音频中稳定抽取证据——一旦文本线索不足,thinking 反而引入噪声。
  • 视频 agent 与具身智能:GLM-4.5V 同步开源桌面助手,Qwen3.5 可自主操作手机和电脑,VideoGAIA 把视频理解变成 agentic 任务,视频模型正从"被动答题器"向"主动执行者"演进。

五、选型建议

基于以上分析,针对不同场景给出 2026 年 8 月的选型参考:

场景 推荐模型 理由
追求最强效果、预算充足 Gemini 3 Pro(长视频/全模态)、GPT-5.5(复杂推理)、Seed2.0-Pro(agentic 视频) 各有所长,闭源第一梯队
开源可部署、综合均衡 Qwen3.5(首选)、InternVL3.5、GLM-4.5V 中文生态好、长视频强、社区活跃
端侧/成本敏感 MiniCPM-V 4.5(8B)、InternVL3.5-8B、Eagle2.5-8B 单卡可跑,视频能力越级
超长视频(小时级) Qwen3.5(2 小时原生)、Gemini 3 Pro(1M token)、Video-XL-Pro(8192 帧) 上下文长度与记忆机制各有优势
音视频联合理解 Gemini 3 Pro、Qwen3-Omni 原生音视频训练
中文/国内合规 Qwen3.5、GLM-4.5V、Seed2.0-Pro、MiniCPM-V 国产模型,中文友好,API 稳定
视频 agent / GUI 操作 GLM-4.5V、Qwen3.5、Seed2.0-Pro 已具备工具调用和屏幕操作能力
时序定位 Video-XL-Pro、GroundVTS(CVPR 2026) 在 V-STaR/Charades-STA 上领先

六、结语

视频理解领域正在经历一场"祛魅"。2024 年我们惊叹于模型能看懂短视频,2025 年我们以为长视频也被攻克,到了 2026 年,更严格的 benchmark 告诉我们:经典单选题上的 90 分,很大程度上是题目太简单、模型靠语言先验和数据污染"背"出来的。当评测转向 agentic 多轮工具调用、长时程记忆、音视频强耦合、时空 grounding 和推理过程验证时,最强模型也只有 40–60 分,距离人类的 90 分还有巨大鸿沟。

但这恰恰是领域成熟的标志。一个健康的研究方向,不是所有模型都在饱和的榜单上刷 90 分,而是不断有更难、更贴近真实智能的基准出现,指明下一步该往哪里走。从 Video-MME v1 到 v2、从单轮问答到 VideoGAIA、从视觉单模态到 WorldSense,我们能清晰地看到这个方向正在从"感知视频"走向"理解视频"再到"使用视频"。

对于从业者来说,2026 年的务实建议是:不要被单一榜单分数迷惑,根据真实任务选择对应方向的 benchmark 评估;闭源模型在能力上仍有优势,但开源三强(Qwen3.5、InternVL3.5、GLM-4.5V)已经能覆盖绝大多数场景;如果要做视频 agent,重点关注模型的工具调用和长时记忆能力,而不只是 Video-MME 分数。

视频理解的下半场,才刚刚开始。


参考来源:Video-MME/v2、MVBench、LongVideoBench、MLVU、LVBench、InfiniBench、Video-MMMU、VideoGAIA、EgoMemReason、WorldSense、CHAI、Know-Show、GroundVTS、Symphony 等论文与官方榜单;Google、阿里、上海 AI Lab、智谱、面壁、字节等官方模型卡与发布稿;OpenCompass、HyperAI SOTA、CodeSOTA 等公开排行榜;CVPR/ICML/ICLR/NeurIPS 2025–2026 录用论文;央视网、证券时报、机器之心、量子位、澎湃新闻等权威媒体报道。数据截至 2026 年 8 月 27 日。

评论