视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8)
视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8) > 当 Video-MME 榜单顶尖模型逼近 90%,我们却在 2026 年的新基准上看到最强模型不足 50 分。视频理解的"应试教育"时代正在结束,真正的智能考验才刚刚开始。 一、为什么要重新审视
半甜不要腻 · 记录学习、算法与 AI 前沿
这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。
视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8) > 当 Video-MME 榜单顶尖模型逼近 90%,我们却在 2026 年的新基准上看到最强模型不足 50 分。视频理解的"应试教育"时代正在结束,真正的智能考验才刚刚开始。 一、为什么要重新审视
一、引子:一个提前放出的"Qwen4 架构预览版" 2026 年 8 月 26 日晚,阿里通义千问团队发布并开源了 Qwen3.8-Flash-Next——一个多模态 MoE 模型。它的定位很特别:它不是 Qwen4 本身,而是 Qwen4 所使用架构的早期预览<sup>1
为什么我们明明知道该仔细看合同条款,却还是会被"限时优惠"的红色倒计时催着下单?为什么一个措辞流畅、语气自信的 AI 回答,会让我们下意识觉得它更可信?这些现象背后,站着认知心理学中影响最深远的理论之一——双重加工理论(Dual-Process Theory)。 一、核心主张:大脑里
> 每年三月,国家自然科学基金(NSFC)的集中接收都会牵动无数科研人员的神经。但很多人对它的认知停留在"写本子、交材料、等结果",对评审怎么打分、经费怎么管、结题怎么验收,尤其是面向外籍学者的外国学者研究基金项目(RFIS),往往一知半解。这篇文章把国自然从申请到结项的完整流程梳理清楚,并
一、引言:一个被"相关"遮蔽的"机制"问题 生成式人工智能(GAI)正在快速嵌入公共生活,但一个悖论挥之不去:使用率越高,信任度反而越低。IBM 对 12 个国家 20589 名消费者的调查显示,2023—2024 年企业级 AI 使用率从 52% 升至 69%,消费者信任度却从 6
> 生成式人工智能正以前所未有的速度渗透到信息生产、决策辅助与日常交互中,但一个悖论也同步浮现:使用率在上升,信任度却在下滑。IBM 2026 年覆盖 12 个国家、20589 名受访者的调查显示,AI 使用率从 52% 升至 69%,而用户对 AI 生成内容的信任度却从 63% 降至 59
> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什
> 本系列将 UMM(Unified Multimodal Model,理解与生成统一模型)学习路径中涉及的每一篇论文,逐一读取原文、提炼核心思想、标注关键贡献。第一篇聚焦 2017-2023 年间七篇奠基性工作,它们不是统一模型本身,却共同构成了今天所有统一模型的知识底座。 !UMM论文解读系
> 2024 年 5 月到 9 月,四个团队几乎同时交出了"统一理解与生成"的答卷。Meta 的 Chameleon 走 early-fusion 全离散路线,智源的 Emu3 证明纯 next-token prediction 就能统一图文视频,Meta 的 Transfusion 把 AR 和扩
> 如果说 2024 年夏天的四篇论文回答了"统一是否可行",那么 2025 至 2026 年的三篇代表作——DeepSeek Janus-Pro、字节 BAGEL、商汤 SenseNova U1——回答的是"统一能否匹敌甚至超越专用模型"。三条路线分别选择了解耦编码、MoT 双塔、去 VE/VAE
> Chain-of-Thought 让 LLM 能用文字"想一遍再答",但人类在解决空间、几何、导航等问题时,不只在脑中推理——我们会画辅助线、做标记、在纸上打草稿。Visual Chain-of-Thought(VCoT)研究的就是:能不能让多模态模型也用视觉信息做推理中间产物,而不仅限于文字?
> 统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模态
> 前五篇我们逐一拆解了 UMM 的知识底座、早期探索、主流范式、视觉思维链,以及向视频与世界模型的延伸。终章不再解读某一篇论文,而是退到第一性原理,把"理解生成统一、全模态(Omni)、世界模型、具身智能"这四个高频词串成一条技术进化线,并追问:当通用能力栈成型之后,AGI 的终局之战究竟在哪里。
> 当 AI 连你上周说过的话都记不住时,再强的推理能力也只是一次性的聪明。记忆,正在成为大模型架构设计的第一性维度。 引言 2026年8月,清华大学联合新加坡国立大学、博世人工智能研究院发布综述论文《Memory for Large Language Models》,首次从模型底层架构与
理解与生成统一(Unified Multimodal Model, UMM)是 2024-2026 年多模态 AI 领域最活跃的研究方向之一。从 Meta 的 Chameleon 到字节的 BAGEL、商汤的 SenseNova U1,技术迭代以月为单位。本文给出一条从基础到前沿的完整学习路径,涵盖