UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化
> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什
> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什
> 本系列将 UMM(Unified Multimodal Model,理解与生成统一模型)学习路径中涉及的每一篇论文,逐一读取原文、提炼核心思想、标注关键贡献。第一篇聚焦 2017-2023 年间七篇奠基性工作,它们不是统一模型本身,却共同构成了今天所有统一模型的知识底座。 !UMM论文解读系
> 2024 年 5 月到 9 月,四个团队几乎同时交出了"统一理解与生成"的答卷。Meta 的 Chameleon 走 early-fusion 全离散路线,智源的 Emu3 证明纯 next-token prediction 就能统一图文视频,Meta 的 Transfusion 把 AR 和扩
> 如果说 2024 年夏天的四篇论文回答了"统一是否可行",那么 2025 至 2026 年的三篇代表作——DeepSeek Janus-Pro、字节 BAGEL、商汤 SenseNova U1——回答的是"统一能否匹敌甚至超越专用模型"。三条路线分别选择了解耦编码、MoT 双塔、去 VE/VAE
> Chain-of-Thought 让 LLM 能用文字"想一遍再答",但人类在解决空间、几何、导航等问题时,不只在脑中推理——我们会画辅助线、做标记、在纸上打草稿。Visual Chain-of-Thought(VCoT)研究的就是:能不能让多模态模型也用视觉信息做推理中间产物,而不仅限于文字?
> 统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模态
> 前五篇我们逐一拆解了 UMM 的知识底座、早期探索、主流范式、视觉思维链,以及向视频与世界模型的延伸。终章不再解读某一篇论文,而是退到第一性原理,把"理解生成统一、全模态(Omni)、世界模型、具身智能"这四个高频词串成一条技术进化线,并追问:当通用能力栈成型之后,AGI 的终局之战究竟在哪里。
> 论文:Video Generation Models are General-Purpose Vision Learners > arXiv:2607.09024 | 2026年7月10日 > 会议:ECCV 2026 > 项目主页:https://genception.github.io/ >
> 论文:SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture > arXiv:2605.12500 | 2026年5月12日 > 项目主页:https://github.
> 论文:Vision as Unified Multimodal Generation > arXiv:2607.06560 | 2026年7月7日 > 项目主页:https://github.com/OpenSenseNova/SenseNova-Vision --- 一句话总结 S
> 对比论文: > - Vision Banana: Image Generators are Generalist Vision Learners arXiv: 2604.20329, 2026年4月 > - SenseNova-Vision: Vision as Unified Multim