理解与生成统一(Unified Multimodal Model, UMM)是 2024-2026 年多模态 AI 领域最活跃的研究方向之一。从 Meta 的 Chameleon 到字节的 BAGEL、商汤的 SenseNova U1,技术迭代以月为单位。本文给出一条从基础到前沿的完整学习路径,涵盖必读论文、核心概念、代码实践和研究方向。
一、为什么需要统一模型
传统多模态架构是"拼接式"的:
图像 → 视觉编码器(CLIP/SigLIP)→ Adapter/投影层 → LLM → 文本输出
↗
(生成任务再外挂一个扩散模型)
这带来三个问题:
- 信息损耗:图像被 VE 编码为语言友好的特征,像素级细节在"翻译"过程中丢失
- 能力割裂:理解用一套参数,生成用另一套参数,两者无法互相增强
- 规模低效:需要更大参数才能弥补信息转译的损耗,SenseNova U1 指出拼接架构约需 10 倍数据量
统一模型的目标:用单一架构、单一参数集同时完成视觉理解、推理和生成,让"看懂"和"画出"在同一个大脑中发生。
当前技术路线分为三大类:
| 路线 | 核心思路 | 代表模型 |
|---|---|---|
| 纯自回归(全离散 token) | 图像/文本全部离散化,统一 Next-Token Prediction | Chameleon、Emu3、Janus-Pro |
| AR + 扩散混合 | 文本用 AR,图像用 Diffusion,共享 Transformer 骨干 | Transfusion、Show-o、BAGEL |
| 原生统一 | 去除 VE/VAE,重构统一表征空间 | SenseNova U1/U1.5 |
二、学习路径总图
第一阶段:基础奠基(2-4周)
Transformer → VLM(LLaVA)→ Diffusion(SD)→ VQ-VAE
第二阶段:早期探索(2-3周)
Chameleon → Emu3 → Transfusion → Show-o
第三阶段:主流精读(4-6周)
Janus-Pro → BAGEL → SenseNova U1/U1.5
第四阶段:技术专题(4-6周)
Tokenization → MoT/MoE → 训练范式 → 推理加速
第五阶段:前沿方向(持续)
VCoT → 视频统一 → 世界模型 → 记忆 → 全模态
第六阶段:动手实践(持续)
跑模型 → 微调 → 复现实验 → 读源码
第七阶段:研究社区(持续)
综述 → 顶会 → GitHub → 学术交流
三、第一阶段:基础奠基
3.1 Transformer 与注意力机制
统一模型的骨干网络仍然是 Transformer。需要掌握:
- Self-Attention 的 Q/K/V 计算和复杂度 O(n²)
- Causal Attention(生成)vs Bidirectional Attention(理解)的区别——这是统一模型必须解决的架构矛盾之一
- KV Cache 机制及其显存瓶颈
- MoE(Mixture of Experts)的路由原理,为后续理解 MoT 打基础
推荐阅读:Attention Is All You Need(Vaswani et al., 2017)
3.2 视觉语言模型(VLM)
理解"拼接式"架构是理解统一模型的前提:
- LLaVA 系列:视觉编码器 + MLP 投影 + LLM,最典型的拼接架构
- CLIP/SigLIP:对比学习训练的视觉编码器如何产出语义特征
- Qwen-VL / InternVL:现代 VLM 的动态分辨率、视频理解等扩展
核心问题:VE 编码的特征是为"图文匹配"优化的,不是为"像素重建"优化的——这意味着同一个视觉编码器天然不适合同时做理解和生成。
推荐论文:
- Visual Instruction Tuning(LLaVA, NeurIPS 2023)
- Learning Transferable Visual Models From Natural Language Supervision(CLIP, ICML 2021)
3.3 扩散模型
统一模型中生成能力的技术基础:
- DDPM 的前向加噪和反向去噪过程
- Stable Diffusion 的 VAE + U-Net + Text Encoder 三件套
- DiT(Diffusion Transformer):用 Transformer 替代 U-Net,是统一模型的关键前置
- Flow Matching:新一代生成范式,BAGEL、MiniMax H3 等均采用
推荐论文:
- Denoising Diffusion Probabilistic Models(DDPM, NeurIPS 2020)
- Scalable Diffusion Models with Transformers(DiT, ICCV 2023)
3.4 视觉 Tokenization
这是统一模型最核心的"地基"——如何把图像变成模型能处理的 token:
- VQ-VAE / VQGAN:离散视觉 token 的基础,码本学习和码本坍塌问题
- FSQ(Finite Scalar Quantization):更简单稳定的量化方案
- KL-regularized VAE:Stable Diffusion 使用的连续 latent space
- 关键张力:理解需要语义紧凑的表示,生成需要像素精细的表示——两者对 tokenization 的需求矛盾
推荐论文:
- Neural Discrete Representation Learning(VQ-VAE, NeurIPS 2017)
- Taming Transformers for High-Resolution Image Synthesis(VQGAN, CVPR 2021)
四、第二阶段:早期统一模型(2024年——范式萌芽)
4.1 Chameleon(Meta, 2024.05)
地位:早期混合模态模型的开创者。
核心思路:将图像 tokenize 为 8×8 的离散 token,与文本 token 一起输入同一个 Transformer,early fusion(输入端就混合模态)。
学习要点:
- 全离散 token 方案为什么简单但图像质量有限
- 图像 token 与文本 token 的 interleaved 训练方式
- 7B 和 34B 两个规格的能力差异
论文:Chameleon: Mixed-Modal Early-Fusion Foundation Models(Meta, 2024)
4.2 Emu3(智源研究院, 2024.12)
地位:首个证明纯 Next-Token Prediction 可以统一文本、图像、视频的工作,后登 Nature 正刊。
核心思路:不依赖扩散模型,所有模态都 tokenize 为离散 token,用单一 AR loss 训练。
学习要点:
- 纯 AR 生成图像的质量瓶颈和效率问题
- 视频 token 的时空压缩策略
- Emu3.5 升级到 Next-State Prediction 的动机——从"预测下一个 token"到"预测下一个状态",获得可泛化的世界建模能力
论文:Emu3: Next-Token Prediction is All You Need(arXiv:2409.18870)
4.3 Transfusion(Meta, 2024.08)
地位:AR + Diffusion 混合路线的奠基之作。
核心思路:在同一个 Transformer 中,文本 token 用 AR loss(预测下一个 token),图像 patch 用 Diffusion loss(去噪训练),两种 loss 在不同数据上计算但共享模型参数。
学习要点:
- 两种 loss 如何在同一批次中混合训练
- 为什么"串行结构"(文本走 AR、图像走 Diffusion)比"全 AR"更实用
- 这个思路如何影响了后续的 BAGEL 等模型
论文:Transfusion: Compress Anything into One Transformer with Next Token Prediction and Diffusion(Meta, 2024)
4.4 Show-o / Show-o2(南洋理工, 2024.08 / 2025)
地位:单一 Transformer 同时做离散理解和连续生成。
核心思路:文本和图像理解走离散 AR 路径,图像生成走连续 Diffusion 路径,两路在 Transformer 内部并行。
学习要点:
- Show-o2 引入 3D Causal VAE 扩展到视频生成
- Flow Head 设计实现统一视频生成
- 号称"唯一同时实现文本理解、图像生成、视频生成的统一架构"
论文:Show-o: One Single Transformer to Unify Multimodal Understanding and Generation(NeurIPS 2024)
五、第三阶段:主流模型精读(2025-2026)
这三个模型代表了当前三条技术路线的最高水平,建议逐一精读论文并跑通开源代码。
5.1 Janus-Pro(DeepSeek, 2025.01)
核心创新:解耦视觉编码。
传统做法用同一个视觉编码器处理理解和生成任务,但两者需求不同:理解要语义紧凑,生成要像素精细。Janus-Pro 的解法是:
输入图像
├── SigLIP-L 编码器 → 连续特征 → 用于理解任务
└── VQ tokenizer → 离散 token → 用于生成任务
│
↓
单一 Transformer 骨干处理两种编码
关键数据:
- 1.5B 和 7B 两个规格
- GenEval 文生图 80%,超越 DALL-E 3(67%)和 SD3-Medium(74%)
- 训练效率惊人:128 张 A100 训练 1 周
- MIT 协议开源
精读要点:
- 解耦编码如何避免"角色冲突"
- 输入侧两个编码器,输出侧如何统一处理
- 为什么 DeepSeek 选择"解耦"而非"原生统一"
论文:Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling(arXiv:2501.17811) 代码:github.com/deepseek-ai/Janus
5.2 BAGEL(字节跳动 Seed, 2025.05)
核心创新:MoT(Mixture-of-Transformers)+ 双编码器。
BAGEL 不是 MoE(按领域路由专家),而是 MoT(按任务类型路由专家):
输入
├── VAE 编码器 → 像素级特征(生成用)
└── ViT 编码器 → 语义级特征(理解用)
│
↓
共享自注意力层(GEN 专家 + UND 专家双塔)
│
↓
理解输出 / 生成输出
关键能力:
- GEN 专家和 UND 专家共享自注意力,但有独立的 FFN
- 在数万亿 text/image/video/web 交织 token 上预训练
- 支持未来帧预测、多视图合成、3D 世界导航——这些能力是预训练中涌现的
- CoT 思维链:生成前先"思考",BAGEL+CoT 在 MMMU 上达 55.3%
- GenEval 文生图 88 分,超越 Qwen2.5-VL、InternVL-2.5
精读要点:
- MoT 和 MoE 的路由差异
- 共享自注意力如何让理解和生成能力互相增强
- VAE + ViT 双编码器如何协同(而非 Janus-Pro 那样解耦后各管各的)
- 视频/世界模型能力为何能在预训练中涌现
- Next Token Group Prediction 训练范式
论文:Emerging Properties in Unified Multimodal Pretraining(arXiv:2505.14683) 代码:github.com/bytedance-seed/BAGEL(Apache 2.0)
5.3 SenseNova U1/U1.5(商汤, 2026.04/08)
核心创新:NEO-unify 原生统一架构——彻底去除 VE 和 VAE。
这是最激进的技术路线。U1 不做"解耦"也不做"双塔",而是直接重新设计统一表征空间:
传统拼接:图像 → VE → "翻译成文字" → LLM 理解 → "翻译成设计指令" → 生成模型 → 图像
↑ 信息在多次转译中丢失 ↑
NEO-unify:图像/文本 → 统一表征空间 → 每一层计算中融合 → 理解/生成输出
↑ 没有转译,没有中间环节 ↑
关键数据:
- 仅需 3.9 亿图像文本示例(约业界同等性能模型 1/10 数据量)
- 8B-MoT 轻量规格(实际总参数约 18B),性能媲美 Qwen-Image 2.0 Pro、Seedream 4.5 等大型闭源模型
- 业内首个实现连续性图文创作输出(单次调用生成图文交错内容)
- Apache 2.0 开源
U1.5 的升级(2026.08):
- 原生 4K 图像生成
- Bounding Box / 视觉 Marker / 多参考图精准编辑
- MOPD(多专家在线策略蒸馏):训练时多专家,交付时单体模型
- Qwen-Image-Bench 从 47.14 提升到 55.20
精读要点:
- 没有 VE 和 VAE,图像如何编码输入和解码输出?(patch encoding/decoding layers)
- "语言和视觉在每一层计算中融合"的具体实现
- 为什么数据效率能提升 10 倍
- MOPD 蒸馏的技术细节——多专家如何无损融合为单模型
- U1.5 重新设计生成头如何解决网格伪影
代码:github.com/OpenSenseNova/SenseNova-U1(Apache 2.0)
5.4 横向对比
精读三个模型后,用这张表检验理解:
| 维度 | Janus-Pro | BAGEL | SenseNova U1 |
|---|---|---|---|
| 视觉输入 | SigLIP + VQ 解耦 | VAE + ViT 双塔 | 无 VE,patch encoding |
| 视觉输出 | VQ decoder | Diffusion + AR 混合 | patch decoding |
| 参数共享 | 共享 Transformer | MoT 共享注意力 | 完全共享 |
| 视频能力 | 无 | 帧预测/世界导航 | 无 |
| 图像编辑 | 基础 | 智能编辑 | 核心强项(bbox/marker) |
| 参数量 | 1.5B/7B | 7B 激活/14B 总 | 8B-MoT(~18B 总) |
| 开源协议 | MIT | Apache 2.0 | Apache 2.0 |
| 架构哲学 | 解耦避免冲突 | 混合取长补短 | 原生统一消除转译 |
六、第四阶段:技术专题精读
6.1 视觉 Tokenization 深入
统一模型的"地基",决定了模型能力上限:
- 离散 vs 连续:离散 token(VQ)适合 AR 建模,连续 latent 适合 Diffusion,如何选择?
- 语义导向 vs 重建导向:CLIP 特征语义强但细节差,VAE 特征像素好但语义弱
- MBAQ(LatentUM):为理解而量化,每个视觉 token 分解为 8 个子 token,多码本量化
- SigLIP-VQ(LLaDA2.0-Uni):用语义导向的离散 token 增强理解
6.2 MoT 与混合架构
- MoT 的路由机制:何时走理解专家、何时走生成专家
- 共享层设计:共享自注意力 vs 共享 FFN 的取舍
- 训练稳定性:多 loss 混合时的梯度冲突问题
6.3 训练范式
- 数据配比:纯文本、图文对、图文交错、视频数据的比例如何确定
- 多阶段训练:预训练 → 持续预训练 → SFT → RL,每个阶段的目标差异
- MOPD 蒸馏:训练时多专家独立优化(文字、美学、编辑),交付时在线策略蒸馏为单体
- flow-GRPO:统一模型中的强化学习,用于视觉一致性和生成质量
6.4 推理加速
- MTP / 投机解码:DeepSeek V4 Flash 的多 token 预测
- 少步扩散蒸馏:8-step LoRA、一致性模型
- KV Cache 在统一模型中的特殊性:理解和生成的缓存策略不同
- Sprint 加速(LLaDA2.0-Uni):KV cache 复用 + adaptive unmasking
七、第五阶段:前沿研究方向
7.1 视觉思维链(Visual Chain-of-Thought)
核心问题:当前 VLM 用纯文字推理空间问题,但语言是空间信息的间接媒介。如何让模型"画图辅助思考"?
四条技术路线:
| 方法 | 中间产物 | 代表 |
|---|---|---|
| 连续视觉 Token | ~20 个 latent 向量 | CoVT(北大+伯克利,arXiv:2511.19418) |
| RGB 图像生成 | 分割图/深度图 | Gen-VCoT(arXiv:2606.16783) |
| 外部画板 | 线/框/箭头标注 | Visual Sketchpad(NeurIPS 2024) |
| 模型自生成 | 统一模型内部生成 | LatentUM(上海交大,2026.04) |
统一模型的独特机会:U1/BAGEL 这类模型能自己生成视觉中间产物,不需要调用 SAM/Marigold 等外部模型。LatentUM 已经验证:双分支架构中,生成分支产出的视觉 token 可以直接被理解分支读取,迷宫导航达 97% 准确率。
关键发现(Gen-VCoT):视觉中间产物不是万能的——空间/深度推理提升 25%-50%,但简单事实查询反而下降(CLEVR 上文字 CoT 91.2% vs 视觉 62.5%)。自适应路由是必要的。
推荐阅读:
- Chain-of-Visual-Thought(CoVT, arXiv:2511.19418)
- Gen-VCoT(arXiv:2606.16783)
- Visual Sketchpad(NeurIPS 2024, arXiv:2406.09403)
- Visual-Aware CoT(arXiv:2512.19686)
- LatentUM(上海交大,2026.04)
7.2 视频统一理解与生成
统一模型从图像扩展到视频的技术挑战:
- Emu3:纯 AR 视频 token 生成,Nature 论文验证可行
- BAGEL:未来帧预测、3D 世界导航(预训练涌现)
- Show-o2:3D Causal VAE 时空融合
- UniVideo(快手可灵):MLLM + MMDiT 双流统一视频生成/编辑/理解
- Vega:AR 预测关键帧 + Diffusion 渲染高分辨率帧
- Gen4U(Google DeepMind):扩散模型本身即编码器,"生成即理解"
核心矛盾:统一模型的视频生成质量目前远不及专用视频模型(Sora/可灵/Veo)。统一的价值在世界理解而非视频质量。
7.3 世界模型
统一模型最有野心的方向——从"理解图像"到"理解世界如何运行":
- BAGEL 的世界导航、3D 操作、序列推理
- LatentUM 的"当前状态 + 动作 → 预测下一状态"
- Emu3.5 的 Next-State Prediction
- Genie 2/3(Google DeepMind)的可交互世界环境
- CoT-VLA(CVPR 2025):预测未来帧指导机器人动作
7.4 全模态统一
从图像扩展到视频、音频、3D、动作:
- MiniMax H3(2026.08):文本+图像+视频+音频统一生成,2K/15s/立体声
- NVIDIA Nemotron 3 Nano Omni:全模态理解
- Qwen3.5-Omni / WITA-Omni:全模态理解+生成
- 未来方向:触觉、3D 点云、机器人动作信号的统一
7.5 统一模型的记忆与持续学习
- 模型如何记住跨会话信息?
- Titans 的测试时训练(TTT)能否用于统一模型的在线更新?
- 外置记忆(Mem0/Zep)与模型内生表征如何协同?
- 遗忘机制:统一模型如何"忘掉"过时视觉信息?
八、第六阶段:动手实践
8.1 环境搭建
# Janus-Pro 7B(消费级 24GB 显卡可跑)
git clone https://github.com/deepseek-ai/Janus
cd Janus && pip install -e .
# BAGEL(需要较大显存)
git clone https://github.com/bytedance-seed/BAGEL
# SenseNova U1.5(bf16 约 36GB,建议 A100/H100)
git clone https://github.com/OpenSenseNova/SenseNova-U1
8.2 必做实验
实验 1:体验"一个模型两种能力"
用同一模型分别做:
- 图像理解:上传一张图问问题
- 图像生成:文字描述生成图
- 图文交错:先生成图,再让模型基于自己的生成结果回答问题
实验 2:多轮编辑
用 U1.5 的 bbox 编辑能力:
- 生成一张图
- 框选局部区域要求修改
- 观察非编辑区域是否保持
实验 3:VCoT 最小验证
在 BLINK 相对深度子集上对比:
- U1 baseline(只有原图)
- U1 + Marigold 深度图(外挂方案)
- U1 自己生成深度示意图后回答
如果配置 3 显著优于 1,自生成 VCoT 就值得继续投入。
实验 4:LoRA 微调
用特定风格数据微调统一模型,观察微调是否同时影响理解和生成能力。
8.3 源码阅读建议
- BAGEL 的 MoT 路由:理解/生成专家如何切换,共享注意力如何实现
- Janus-Pro 的双编码器输入:两种视觉特征如何拼接进同一个序列
- vLLM 对统一模型的推理支持:混合 AR + Diffusion 的调度
九、第七阶段:研究社区与资源
9.1 必读综述
- Unified Models for Image Understanding and Generation(HuggingFace Blog, 2025.09)——四类架构分类法
- A Survey on Unified Multimodal Generation and Understanding——学术综述
- Memory for Large Language Models(清华/NUS, 2026.08)——记忆三维框架
9.2 重点关注团队
| 团队 | 代表作 | 研究特色 |
|---|---|---|
| 字节跳动 Seed | BAGEL | MoT 架构、世界模型 |
| DeepSeek | Janus-Pro | 解耦编码、训练效率 |
| 商汤 | SenseNova U1 | 原生统一、NEO-unify |
| Meta FAIR | Chameleon/Transfusion | 基础架构探索 |
| 智源研究院 | Emu3/Emu3.5 | 纯 AR 统一、Nature 级工作 |
| Google DeepMind | Gen4U/Vision Banana | 扩散即理解 |
| 上海交大 | LatentUM | 自生成视觉推理链 |
| 南洋理工 | Show-o | AR+Diffusion 并行 |
| 快手可灵 | UniVideo | 视频统一生成/理解 |
9.3 顶会与期刊
- CVPR / ICCV / ECCV:视觉生成和理解主力会场
- NeurIPS / ICML / ICLR:架构创新和理论
- ACL / EMNLP:语言侧的多模态融合
- Nature / Nature Machine Intelligence:Emu3 等里程碑式工作
9.4 关键 GitHub 仓库
deepseek-ai/Janusbytedance-seed/BAGELOpenSenseNova/SenseNova-U1HKUDS/Visual-Sketchpadxinyu3luc/LatentUM(关注开源进展)
十、学习建议
10.1 三个核心问题
每学一个模型,反复问自己:
- 它解决了什么问题?——之前的模型哪里不好?痛点是真实的还是臆想的?
- 它的方案有什么代价?——BAGEL 的双塔有计算开销,U1 去 VAE 后训练更难,没有免费午餐
- 如果我来设计会怎么做?——先自己想方案,再看论文,对比差异
10.2 避免的误区
- 不要只看博客不看论文:二手解读容易丢失关键技术细节
- 不要只看架构图不看公式:loss 设计、tokenization 方式才是核心
- 不要追新忘旧:Chameleon 和 Transfusion 是后续所有工作的基础
- 不要只做不思考:跑通模型不等于理解模型,要能说清每个设计选择的原因
10.3 时间投入参考
- 第一、二阶段(基础 + 早期):4-7 周
- 第三阶段(精读三个模型):4-6 周,每个模型至少 1 周
- 第四阶段(技术专题):4-6 周,选 1-2 个方向深入
- 第五阶段以后:持续跟进,建议每月读 2-3 篇新论文
统一理解与生成是一个还在快速演进的方向。Chameleon 到 BAGEL 只有一年,BAGEL 到 U1 只有半年,技术迭代极快。打好基础,精读三个代表模型,然后选一个前沿方向深入——这是最高效的路径。
参考链接
基础论文
- Attention Is All You Need: https://arxiv.org/abs/1706.03762
- CLIP: https://arxiv.org/abs/2103.00020
- LLaVA: https://arxiv.org/abs/2304.08485
- DDPM: https://arxiv.org/abs/2006.11239
- DiT: https://arxiv.org/abs/2212.09748
- VQ-VAE: https://arxiv.org/abs/1711.00937
- VQGAN: https://arxiv.org/abs/2012.09841
早期统一模型
- Chameleon (Meta): https://arxiv.org/abs/2405.09818
- Emu3 (智源): https://arxiv.org/abs/2409.18870
- Transfusion (Meta): https://arxiv.org/abs/2408.11039
- Show-o (NTU, NeurIPS 2024): https://arxiv.org/abs/2408.12539
主流模型
- Janus-Pro (DeepSeek): https://arxiv.org/abs/2501.17811
- BAGEL (字节 Seed): https://arxiv.org/abs/2505.14683
- SenseNova U1 (商汤): https://github.com/OpenSenseNova/SenseNova-U1
- SenseNova U1.5 官方介绍: https://www.sensetime.com/cn/news/sense-nova-u1-5-lite-preview
VCoT 相关
- CoVT (北大+伯克利): https://arxiv.org/abs/2511.19418
- Gen-VCoT: https://arxiv.org/abs/2606.16783
- Visual Sketchpad (NeurIPS 2024): https://arxiv.org/abs/2406.09403
- Visual-Aware CoT: https://arxiv.org/abs/2512.19686
- CoT-VLA (CVPR 2025): https://arxiv.org/abs/2503.04855
视频与世界模型
- UniVideo (快手可灵): https://arxiv.org/abs/2510.01845
- Emu3.5 Next-State Prediction: https://arxiv.org/abs/2506.11213
开源代码
- Janus: https://github.com/deepseek-ai/Janus
- BAGEL: https://github.com/bytedance-seed/BAGEL
- SenseNova-U1: https://github.com/OpenSenseNova/SenseNova-U1
- Visual Sketchpad: https://github.com/HKUDS/Visual-Sketchpad