Back

理解与生成统一模型(UMM)学习路径:从拼接架构到原生统一,从入门到前沿探索

理解与生成统一(Unified Multimodal Model, UMM)是 2024-2026 年多模态 AI 领域最活跃的研究方向之一。从 Meta 的 Chameleon 到字节的 BAGEL、商汤的 SenseNova U1,技术迭代以月为单位。本文给出一条从基础到前沿的完整学习路径,涵盖必读论文、核心概念、代码实践和研究方向。

一、为什么需要统一模型

传统多模态架构是"拼接式"的:

图像 → 视觉编码器(CLIP/SigLIP)→ Adapter/投影层 → LLM → 文本输出
                                            ↗
                            (生成任务再外挂一个扩散模型)

这带来三个问题:

  1. 信息损耗:图像被 VE 编码为语言友好的特征,像素级细节在"翻译"过程中丢失
  2. 能力割裂:理解用一套参数,生成用另一套参数,两者无法互相增强
  3. 规模低效:需要更大参数才能弥补信息转译的损耗,SenseNova U1 指出拼接架构约需 10 倍数据量

统一模型的目标:用单一架构、单一参数集同时完成视觉理解、推理和生成,让"看懂"和"画出"在同一个大脑中发生。

当前技术路线分为三大类:

路线 核心思路 代表模型
纯自回归(全离散 token) 图像/文本全部离散化,统一 Next-Token Prediction Chameleon、Emu3、Janus-Pro
AR + 扩散混合 文本用 AR,图像用 Diffusion,共享 Transformer 骨干 Transfusion、Show-o、BAGEL
原生统一 去除 VE/VAE,重构统一表征空间 SenseNova U1/U1.5

二、学习路径总图

第一阶段:基础奠基(2-4周)
  Transformer → VLM(LLaVA)→ Diffusion(SD)→ VQ-VAE

第二阶段:早期探索(2-3周)
  Chameleon → Emu3 → Transfusion → Show-o

第三阶段:主流精读(4-6周)
  Janus-Pro → BAGEL → SenseNova U1/U1.5

第四阶段:技术专题(4-6周)
  Tokenization → MoT/MoE → 训练范式 → 推理加速

第五阶段:前沿方向(持续)
  VCoT → 视频统一 → 世界模型 → 记忆 → 全模态

第六阶段:动手实践(持续)
  跑模型 → 微调 → 复现实验 → 读源码

第七阶段:研究社区(持续)
  综述 → 顶会 → GitHub → 学术交流

三、第一阶段:基础奠基

3.1 Transformer 与注意力机制

统一模型的骨干网络仍然是 Transformer。需要掌握:

  • Self-Attention 的 Q/K/V 计算和复杂度 O(n²)
  • Causal Attention(生成)vs Bidirectional Attention(理解)的区别——这是统一模型必须解决的架构矛盾之一
  • KV Cache 机制及其显存瓶颈
  • MoE(Mixture of Experts)的路由原理,为后续理解 MoT 打基础

推荐阅读Attention Is All You Need(Vaswani et al., 2017)

3.2 视觉语言模型(VLM)

理解"拼接式"架构是理解统一模型的前提:

  • LLaVA 系列:视觉编码器 + MLP 投影 + LLM,最典型的拼接架构
  • CLIP/SigLIP:对比学习训练的视觉编码器如何产出语义特征
  • Qwen-VL / InternVL:现代 VLM 的动态分辨率、视频理解等扩展

核心问题:VE 编码的特征是为"图文匹配"优化的,不是为"像素重建"优化的——这意味着同一个视觉编码器天然不适合同时做理解和生成。

推荐论文

  • Visual Instruction Tuning(LLaVA, NeurIPS 2023)
  • Learning Transferable Visual Models From Natural Language Supervision(CLIP, ICML 2021)

3.3 扩散模型

统一模型中生成能力的技术基础:

  • DDPM 的前向加噪和反向去噪过程
  • Stable Diffusion 的 VAE + U-Net + Text Encoder 三件套
  • DiT(Diffusion Transformer):用 Transformer 替代 U-Net,是统一模型的关键前置
  • Flow Matching:新一代生成范式,BAGEL、MiniMax H3 等均采用

推荐论文

  • Denoising Diffusion Probabilistic Models(DDPM, NeurIPS 2020)
  • Scalable Diffusion Models with Transformers(DiT, ICCV 2023)

3.4 视觉 Tokenization

这是统一模型最核心的"地基"——如何把图像变成模型能处理的 token:

  • VQ-VAE / VQGAN:离散视觉 token 的基础,码本学习和码本坍塌问题
  • FSQ(Finite Scalar Quantization):更简单稳定的量化方案
  • KL-regularized VAE:Stable Diffusion 使用的连续 latent space
  • 关键张力:理解需要语义紧凑的表示,生成需要像素精细的表示——两者对 tokenization 的需求矛盾

推荐论文

  • Neural Discrete Representation Learning(VQ-VAE, NeurIPS 2017)
  • Taming Transformers for High-Resolution Image Synthesis(VQGAN, CVPR 2021)

四、第二阶段:早期统一模型(2024年——范式萌芽)

4.1 Chameleon(Meta, 2024.05)

地位:早期混合模态模型的开创者。

核心思路:将图像 tokenize 为 8×8 的离散 token,与文本 token 一起输入同一个 Transformer,early fusion(输入端就混合模态)。

学习要点

  • 全离散 token 方案为什么简单但图像质量有限
  • 图像 token 与文本 token 的 interleaved 训练方式
  • 7B 和 34B 两个规格的能力差异

论文Chameleon: Mixed-Modal Early-Fusion Foundation Models(Meta, 2024)

4.2 Emu3(智源研究院, 2024.12)

地位:首个证明纯 Next-Token Prediction 可以统一文本、图像、视频的工作,后登 Nature 正刊。

核心思路:不依赖扩散模型,所有模态都 tokenize 为离散 token,用单一 AR loss 训练。

学习要点

  • 纯 AR 生成图像的质量瓶颈和效率问题
  • 视频 token 的时空压缩策略
  • Emu3.5 升级到 Next-State Prediction 的动机——从"预测下一个 token"到"预测下一个状态",获得可泛化的世界建模能力

论文Emu3: Next-Token Prediction is All You Need(arXiv:2409.18870)

4.3 Transfusion(Meta, 2024.08)

地位:AR + Diffusion 混合路线的奠基之作。

核心思路:在同一个 Transformer 中,文本 token 用 AR loss(预测下一个 token),图像 patch 用 Diffusion loss(去噪训练),两种 loss 在不同数据上计算但共享模型参数。

学习要点

  • 两种 loss 如何在同一批次中混合训练
  • 为什么"串行结构"(文本走 AR、图像走 Diffusion)比"全 AR"更实用
  • 这个思路如何影响了后续的 BAGEL 等模型

论文Transfusion: Compress Anything into One Transformer with Next Token Prediction and Diffusion(Meta, 2024)

4.4 Show-o / Show-o2(南洋理工, 2024.08 / 2025)

地位:单一 Transformer 同时做离散理解和连续生成。

核心思路:文本和图像理解走离散 AR 路径,图像生成走连续 Diffusion 路径,两路在 Transformer 内部并行。

学习要点

  • Show-o2 引入 3D Causal VAE 扩展到视频生成
  • Flow Head 设计实现统一视频生成
  • 号称"唯一同时实现文本理解、图像生成、视频生成的统一架构"

论文Show-o: One Single Transformer to Unify Multimodal Understanding and Generation(NeurIPS 2024)


五、第三阶段:主流模型精读(2025-2026)

这三个模型代表了当前三条技术路线的最高水平,建议逐一精读论文并跑通开源代码。

5.1 Janus-Pro(DeepSeek, 2025.01)

核心创新:解耦视觉编码。

传统做法用同一个视觉编码器处理理解和生成任务,但两者需求不同:理解要语义紧凑,生成要像素精细。Janus-Pro 的解法是:

输入图像
  ├── SigLIP-L 编码器 → 连续特征 → 用于理解任务
  └── VQ tokenizer → 离散 token → 用于生成任务
       │
       ↓
  单一 Transformer 骨干处理两种编码

关键数据

  • 1.5B 和 7B 两个规格
  • GenEval 文生图 80%,超越 DALL-E 3(67%)和 SD3-Medium(74%)
  • 训练效率惊人:128 张 A100 训练 1 周
  • MIT 协议开源

精读要点

  1. 解耦编码如何避免"角色冲突"
  2. 输入侧两个编码器,输出侧如何统一处理
  3. 为什么 DeepSeek 选择"解耦"而非"原生统一"

论文Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling(arXiv:2501.17811) 代码:github.com/deepseek-ai/Janus

5.2 BAGEL(字节跳动 Seed, 2025.05)

核心创新:MoT(Mixture-of-Transformers)+ 双编码器。

BAGEL 不是 MoE(按领域路由专家),而是 MoT(按任务类型路由专家):

输入
  ├── VAE 编码器 → 像素级特征(生成用)
  └── ViT 编码器 → 语义级特征(理解用)
       │
       ↓
  共享自注意力层(GEN 专家 + UND 专家双塔)
       │
       ↓
  理解输出 / 生成输出

关键能力

  • GEN 专家和 UND 专家共享自注意力,但有独立的 FFN
  • 在数万亿 text/image/video/web 交织 token 上预训练
  • 支持未来帧预测、多视图合成、3D 世界导航——这些能力是预训练中涌现
  • CoT 思维链:生成前先"思考",BAGEL+CoT 在 MMMU 上达 55.3%
  • GenEval 文生图 88 分,超越 Qwen2.5-VL、InternVL-2.5

精读要点

  1. MoT 和 MoE 的路由差异
  2. 共享自注意力如何让理解和生成能力互相增强
  3. VAE + ViT 双编码器如何协同(而非 Janus-Pro 那样解耦后各管各的)
  4. 视频/世界模型能力为何能在预训练中涌现
  5. Next Token Group Prediction 训练范式

论文Emerging Properties in Unified Multimodal Pretraining(arXiv:2505.14683) 代码:github.com/bytedance-seed/BAGEL(Apache 2.0)

5.3 SenseNova U1/U1.5(商汤, 2026.04/08)

核心创新:NEO-unify 原生统一架构——彻底去除 VE 和 VAE。

这是最激进的技术路线。U1 不做"解耦"也不做"双塔",而是直接重新设计统一表征空间:

传统拼接:图像 → VE → "翻译成文字" → LLM 理解 → "翻译成设计指令" → 生成模型 → 图像
                ↑ 信息在多次转译中丢失 ↑

NEO-unify:图像/文本 → 统一表征空间 → 每一层计算中融合 → 理解/生成输出
                ↑ 没有转译,没有中间环节 ↑

关键数据

  • 仅需 3.9 亿图像文本示例(约业界同等性能模型 1/10 数据量)
  • 8B-MoT 轻量规格(实际总参数约 18B),性能媲美 Qwen-Image 2.0 Pro、Seedream 4.5 等大型闭源模型
  • 业内首个实现连续性图文创作输出(单次调用生成图文交错内容)
  • Apache 2.0 开源

U1.5 的升级(2026.08)

  • 原生 4K 图像生成
  • Bounding Box / 视觉 Marker / 多参考图精准编辑
  • MOPD(多专家在线策略蒸馏):训练时多专家,交付时单体模型
  • Qwen-Image-Bench 从 47.14 提升到 55.20

精读要点

  1. 没有 VE 和 VAE,图像如何编码输入和解码输出?(patch encoding/decoding layers)
  2. "语言和视觉在每一层计算中融合"的具体实现
  3. 为什么数据效率能提升 10 倍
  4. MOPD 蒸馏的技术细节——多专家如何无损融合为单模型
  5. U1.5 重新设计生成头如何解决网格伪影

代码:github.com/OpenSenseNova/SenseNova-U1(Apache 2.0)

5.4 横向对比

精读三个模型后,用这张表检验理解:

维度 Janus-Pro BAGEL SenseNova U1
视觉输入 SigLIP + VQ 解耦 VAE + ViT 双塔 无 VE,patch encoding
视觉输出 VQ decoder Diffusion + AR 混合 patch decoding
参数共享 共享 Transformer MoT 共享注意力 完全共享
视频能力 帧预测/世界导航
图像编辑 基础 智能编辑 核心强项(bbox/marker)
参数量 1.5B/7B 7B 激活/14B 总 8B-MoT(~18B 总)
开源协议 MIT Apache 2.0 Apache 2.0
架构哲学 解耦避免冲突 混合取长补短 原生统一消除转译

六、第四阶段:技术专题精读

6.1 视觉 Tokenization 深入

统一模型的"地基",决定了模型能力上限:

  • 离散 vs 连续:离散 token(VQ)适合 AR 建模,连续 latent 适合 Diffusion,如何选择?
  • 语义导向 vs 重建导向:CLIP 特征语义强但细节差,VAE 特征像素好但语义弱
  • MBAQ(LatentUM):为理解而量化,每个视觉 token 分解为 8 个子 token,多码本量化
  • SigLIP-VQ(LLaDA2.0-Uni):用语义导向的离散 token 增强理解

6.2 MoT 与混合架构

  • MoT 的路由机制:何时走理解专家、何时走生成专家
  • 共享层设计:共享自注意力 vs 共享 FFN 的取舍
  • 训练稳定性:多 loss 混合时的梯度冲突问题

6.3 训练范式

  • 数据配比:纯文本、图文对、图文交错、视频数据的比例如何确定
  • 多阶段训练:预训练 → 持续预训练 → SFT → RL,每个阶段的目标差异
  • MOPD 蒸馏:训练时多专家独立优化(文字、美学、编辑),交付时在线策略蒸馏为单体
  • flow-GRPO:统一模型中的强化学习,用于视觉一致性和生成质量

6.4 推理加速

  • MTP / 投机解码:DeepSeek V4 Flash 的多 token 预测
  • 少步扩散蒸馏:8-step LoRA、一致性模型
  • KV Cache 在统一模型中的特殊性:理解和生成的缓存策略不同
  • Sprint 加速(LLaDA2.0-Uni):KV cache 复用 + adaptive unmasking

七、第五阶段:前沿研究方向

7.1 视觉思维链(Visual Chain-of-Thought)

核心问题:当前 VLM 用纯文字推理空间问题,但语言是空间信息的间接媒介。如何让模型"画图辅助思考"?

四条技术路线

方法 中间产物 代表
连续视觉 Token ~20 个 latent 向量 CoVT(北大+伯克利,arXiv:2511.19418)
RGB 图像生成 分割图/深度图 Gen-VCoT(arXiv:2606.16783)
外部画板 线/框/箭头标注 Visual Sketchpad(NeurIPS 2024)
模型自生成 统一模型内部生成 LatentUM(上海交大,2026.04)

统一模型的独特机会:U1/BAGEL 这类模型能自己生成视觉中间产物,不需要调用 SAM/Marigold 等外部模型。LatentUM 已经验证:双分支架构中,生成分支产出的视觉 token 可以直接被理解分支读取,迷宫导航达 97% 准确率。

关键发现(Gen-VCoT):视觉中间产物不是万能的——空间/深度推理提升 25%-50%,但简单事实查询反而下降(CLEVR 上文字 CoT 91.2% vs 视觉 62.5%)。自适应路由是必要的。

推荐阅读

  • Chain-of-Visual-Thought(CoVT, arXiv:2511.19418)
  • Gen-VCoT(arXiv:2606.16783)
  • Visual Sketchpad(NeurIPS 2024, arXiv:2406.09403)
  • Visual-Aware CoT(arXiv:2512.19686)
  • LatentUM(上海交大,2026.04)

7.2 视频统一理解与生成

统一模型从图像扩展到视频的技术挑战:

  • Emu3:纯 AR 视频 token 生成,Nature 论文验证可行
  • BAGEL:未来帧预测、3D 世界导航(预训练涌现)
  • Show-o2:3D Causal VAE 时空融合
  • UniVideo(快手可灵):MLLM + MMDiT 双流统一视频生成/编辑/理解
  • Vega:AR 预测关键帧 + Diffusion 渲染高分辨率帧
  • Gen4U(Google DeepMind):扩散模型本身即编码器,"生成即理解"

核心矛盾:统一模型的视频生成质量目前远不及专用视频模型(Sora/可灵/Veo)。统一的价值在世界理解而非视频质量。

7.3 世界模型

统一模型最有野心的方向——从"理解图像"到"理解世界如何运行":

  • BAGEL 的世界导航、3D 操作、序列推理
  • LatentUM 的"当前状态 + 动作 → 预测下一状态"
  • Emu3.5 的 Next-State Prediction
  • Genie 2/3(Google DeepMind)的可交互世界环境
  • CoT-VLA(CVPR 2025):预测未来帧指导机器人动作

7.4 全模态统一

从图像扩展到视频、音频、3D、动作:

  • MiniMax H3(2026.08):文本+图像+视频+音频统一生成,2K/15s/立体声
  • NVIDIA Nemotron 3 Nano Omni:全模态理解
  • Qwen3.5-Omni / WITA-Omni:全模态理解+生成
  • 未来方向:触觉、3D 点云、机器人动作信号的统一

7.5 统一模型的记忆与持续学习

  • 模型如何记住跨会话信息?
  • Titans 的测试时训练(TTT)能否用于统一模型的在线更新?
  • 外置记忆(Mem0/Zep)与模型内生表征如何协同?
  • 遗忘机制:统一模型如何"忘掉"过时视觉信息?

八、第六阶段:动手实践

8.1 环境搭建

# Janus-Pro 7B(消费级 24GB 显卡可跑)
git clone https://github.com/deepseek-ai/Janus
cd Janus && pip install -e .

# BAGEL(需要较大显存)
git clone https://github.com/bytedance-seed/BAGEL

# SenseNova U1.5(bf16 约 36GB,建议 A100/H100)
git clone https://github.com/OpenSenseNova/SenseNova-U1

8.2 必做实验

实验 1:体验"一个模型两种能力"

用同一模型分别做:

  • 图像理解:上传一张图问问题
  • 图像生成:文字描述生成图
  • 图文交错:先生成图,再让模型基于自己的生成结果回答问题

实验 2:多轮编辑

用 U1.5 的 bbox 编辑能力:

  1. 生成一张图
  2. 框选局部区域要求修改
  3. 观察非编辑区域是否保持

实验 3:VCoT 最小验证

在 BLINK 相对深度子集上对比:

  1. U1 baseline(只有原图)
  2. U1 + Marigold 深度图(外挂方案)
  3. U1 自己生成深度示意图后回答

如果配置 3 显著优于 1,自生成 VCoT 就值得继续投入。

实验 4:LoRA 微调

用特定风格数据微调统一模型,观察微调是否同时影响理解和生成能力。

8.3 源码阅读建议

  1. BAGEL 的 MoT 路由:理解/生成专家如何切换,共享注意力如何实现
  2. Janus-Pro 的双编码器输入:两种视觉特征如何拼接进同一个序列
  3. vLLM 对统一模型的推理支持:混合 AR + Diffusion 的调度

九、第七阶段:研究社区与资源

9.1 必读综述

  1. Unified Models for Image Understanding and Generation(HuggingFace Blog, 2025.09)——四类架构分类法
  2. A Survey on Unified Multimodal Generation and Understanding——学术综述
  3. Memory for Large Language Models(清华/NUS, 2026.08)——记忆三维框架

9.2 重点关注团队

团队 代表作 研究特色
字节跳动 Seed BAGEL MoT 架构、世界模型
DeepSeek Janus-Pro 解耦编码、训练效率
商汤 SenseNova U1 原生统一、NEO-unify
Meta FAIR Chameleon/Transfusion 基础架构探索
智源研究院 Emu3/Emu3.5 纯 AR 统一、Nature 级工作
Google DeepMind Gen4U/Vision Banana 扩散即理解
上海交大 LatentUM 自生成视觉推理链
南洋理工 Show-o AR+Diffusion 并行
快手可灵 UniVideo 视频统一生成/理解

9.3 顶会与期刊

  • CVPR / ICCV / ECCV:视觉生成和理解主力会场
  • NeurIPS / ICML / ICLR:架构创新和理论
  • ACL / EMNLP:语言侧的多模态融合
  • Nature / Nature Machine Intelligence:Emu3 等里程碑式工作

9.4 关键 GitHub 仓库

  • deepseek-ai/Janus
  • bytedance-seed/BAGEL
  • OpenSenseNova/SenseNova-U1
  • HKUDS/Visual-Sketchpad
  • xinyu3luc/LatentUM(关注开源进展)

十、学习建议

10.1 三个核心问题

每学一个模型,反复问自己:

  1. 它解决了什么问题?——之前的模型哪里不好?痛点是真实的还是臆想的?
  2. 它的方案有什么代价?——BAGEL 的双塔有计算开销,U1 去 VAE 后训练更难,没有免费午餐
  3. 如果我来设计会怎么做?——先自己想方案,再看论文,对比差异

10.2 避免的误区

  • 不要只看博客不看论文:二手解读容易丢失关键技术细节
  • 不要只看架构图不看公式:loss 设计、tokenization 方式才是核心
  • 不要追新忘旧:Chameleon 和 Transfusion 是后续所有工作的基础
  • 不要只做不思考:跑通模型不等于理解模型,要能说清每个设计选择的原因

10.3 时间投入参考

  • 第一、二阶段(基础 + 早期):4-7 周
  • 第三阶段(精读三个模型):4-6 周,每个模型至少 1 周
  • 第四阶段(技术专题):4-6 周,选 1-2 个方向深入
  • 第五阶段以后:持续跟进,建议每月读 2-3 篇新论文

统一理解与生成是一个还在快速演进的方向。Chameleon 到 BAGEL 只有一年,BAGEL 到 U1 只有半年,技术迭代极快。打好基础,精读三个代表模型,然后选一个前沿方向深入——这是最高效的路径。


参考链接

基础论文

早期统一模型

主流模型

VCoT 相关

视频与世界模型

开源代码

评论