统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 则把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模态世界模型。两篇论文代表了 UMM 向时空维度扩展的两条路径:工程化的双流拼接 vs 第一性原理的原生统一。

系列导航
- 01 基础奠基篇:Transformer、CLIP、LLaVA、DDPM、DiT、VQ-VAE、VQGAN
- 02 早期统一模型篇:Chameleon、Emu3、Transfusion、Show-o
- 03 主流模型篇:Janus-Pro、BAGEL、SenseNova U1
- 04 VCoT 篇:CoVT、Gen-VCoT、Visual Sketchpad、Visual-Aware CoT、CoT-VLA
- 05 视频与世界模型篇(本文):UniVideo、Emu3.5
为什么视频统一更难
把理解和生成从图像扩展到视频,难度不是线性增加,而是阶跃式增加:
- 时序维度:图像只需要空间一致性,视频还需要时序一致性——物体不能帧帧变形,运动要符合物理规律。
- 计算量爆炸:一段 5 秒的 24fps 视频包含 120 帧,token 数量是单张图像的上百倍。
- 理解和生成的耦合更紧:视频编辑需要理解动作语义、跟踪物体、保持身份,这些都要求理解和生成深度协同。
- 训练数据稀缺:高质量的视频-文本-编辑三元组数据远比图像数据少。
UniVideo 和 Emu3.5 用截然不同的策略应对这些挑战。
1. UniVideo:MLLM + MMDiT 双流统一视频框架(2025.10)
论文:UniVideo: Unified Understanding, Generation, and Editing for Videos 作者:Cong Wei, Quande Liu, Zixuan Ye 等(滑铁卢大学 / 快手可灵团队 / 港科大) 链接:https://arxiv.org/abs/2510.08377 项目主页:https://congwei1230.github.io/UniVideo/
核心思路
UniVideo 的策略是"双流设计":不追求一个模型从底层统一一切,而是让两个擅长不同任务的模型协同工作——MLLM 负责理解指令,MMDiT 负责视觉生成。这和 Transfusion 在图像领域的"AR + Diffusion 共存"思路一脉相承,但扩展到了视频。
架构设计
输入:文本 + 图像/视频(多模态指令)
│
▼
┌─────────────────────┐
│ MLLM(理解流) │ ← 解析指令、理解视觉内容、生成文本响应
│ 提取最后一层隐状态 │
└─────────┬───────────┘
│ 可训练连接器
▼
┌─────────────────────┐
│ MMDiT(生成流) │ ← 两个分支:
│ 分支A:MLLM 语义特征 │ 高层语义指导
│ 分支B:VAE 视觉特征 │ 细粒度像素重建
└─────────┬───────────┘
│
▼
输出:生成/编辑后的视频
1.1 MLLM:指令理解中枢
MLLM 接收文本、图像和视频输入,负责:
- 解析复杂的多模态指令("把视频里的狗换成猫,保持背景不变")。
- 理解参考图像/视频的内容和风格。
- 生成文本响应(对于理解类任务)。
- 提取最后一层 Transformer 的隐状态,这些隐状态编码了丰富的多模态语义信息。
关键设计:MLLM 保持原有的文本生成能力不变。它不是被"改造"成视频模型,而是作为一个成熟的理解模块被复用。这降低了训练难度,也保证了语言能力不退化。
1.2 可训练连接器
MLLM 的隐状态通过一个可训练的连接器对齐到 MMDiT 的输入空间。这个连接器是轻量级的(相比整个模型),负责把"理解空间"的表征翻译成"生成空间"能使用的条件信号。
1.3 MMDiT:双流视觉生成
MMDiT(Multimodal Diffusion Transformer)是视频生成的核心。它内部有两个分支:
- 理解流分支:接收来自 MLLM 的高层语义特征,确保生成内容符合指令意图。
- 生成流分支:接收来自 VAE 的细粒度视觉编码(当前帧的 latent),保留纹理、颜色、运动细节。
两个分支在 MMDiT 的 Transformer 层中通过注意力机制交互——语义分支指导"画什么",视觉分支保证"怎么画"。这种设计对于视频编辑尤其重要:需要同时保持语义正确(换成猫)和视觉一致(背景、光照、运动连贯)。
1.4 统一任务范式
UniVideo 用一套统一的多模态指令格式覆盖所有视频任务:
- 文本/图像到视频生成(T2V / I2V):根据文本描述或参考图像生成视频。
- 上下文视频生成(In-context Video Generation):给定视频片段,续写后续内容。
- 上下文视频编辑(In-context Video Editing):根据指令修改已有视频。
- 视觉提示生成(Visual-prompt-based Generation):手绘草图、标注线等作为提示,MLLM 理解视觉提示后指导生成。
每个视觉输入被分配一个 ID 标签,模型通过标签区分哪个是参考图、哪个是待编辑视频、哪个是风格参考。三维位置编码区分条件信息和目标视频信息,不需要额外的任务标识。
训练策略
UniVideo 的训练分三个阶段:
- 阶段一:建立 MLLM-MMDiT 通信机制。训练连接器,让 MLLM 的语义特征能有效指导 MMDiT 生成。
- 阶段二:提升生成质量。在大规模视频生成数据上训练,提升视觉质量和时序一致性。
- 阶段三:多任务统一训练。联合训练生成、编辑、理解任务,让模型学会区分任务类型并自适应处理。
关键能力与结果
UniVideo 在多个维度展示了统一设计的优势:
-
SOTA 性能:在 T2V、I2V、上下文生成、上下文编辑等任务上匹配或超越专用 SOTA 基线。
-
任务组合泛化:支持在单条指令中组合多个能力。例如"把视频中的物体替换成参考图中的物体,同时把风格转换成油画风格"——编辑 + 风格迁移一次完成,不需要为这种组合专门训练。
-
自由形式视频编辑的零样本迁移:即使没有在自由形式视频编辑数据上训练,UniVideo 也能把大规模图像编辑中学到的编辑能力迁移到视频上。例如"改变视频中的环境"、"替换视频中的材质"——这些未见过的指令也能处理。
-
视觉提示理解:MLLM 能理解手绘标注和草图,把用户的视觉创意转化为生成指导。这在专业视频制作中很有价值。
设计哲学与局限
UniVideo 代表了"工程化统一"的路线:
- 优势:复用成熟的 MLLM(理解能力有保障)和 MMDiT(生成质量有保障),训练风险低,每个模块可以独立升级。
- 代价:架构上仍然是"两个模型 + 一个连接器",不是原生统一。MLLM 和 MMDiT 之间的信息通过连接器传递,存在表征鸿沟。推理时需要同时跑两个大模型,计算开销大。
对比 BAGEL 的"一个 Transformer 内部 MoT 双塔"和 SenseNova U1 的"原生统一",UniVideo 的双流更像是在视频领域重走了 Transfusion 的路——先把两个成熟模块拼起来验证可行性,后续可能走向更深层融合。
2. Emu3.5:从下一 Token 到下一状态的世界模型(2025.10)
论文:Emu3.5: Native Multimodal Models are World Learners 作者:Yufeng Cui, Honghao Chen, Haoge Deng 等(智源 BAAI) 链接:https://arxiv.org/abs/2510.26583 项目主页:https://emu.world/ 代码:https://github.com/baaivision/Emu3.5
核心思路
Emu3 证明了"next-token prediction is all you need",但纯自回归图像生成有一个致命短板:速度慢。Emu3.5 在两个维度上做了升维:
- 目标升维:从"下一 token 预测"(Next-Token Prediction, NTP)升维到"下一状态预测"(Next-State Prediction, NSP)。"状态"可以是一个词、一个图像片段,甚至一段视频的下一帧。
- 效率革命:提出 DiDA(Discrete Diffusion Adaptation,离散扩散适配),把逐 token 自回归解码转换成双向并行预测,单图推理速度提升约 20 倍。
智源研究院院长王仲远称其为"第三个 Scaling 范式"——前两个分别是语言预训练 Scaling 和后训练/推理 Scaling,Emu3.5 证明多模态领域同样存在 Scaling Law。
2.1 Next-State Prediction:统一的训练目标
NSP 是 NTP 的自然推广。在 Emu3 中,模型预测序列中的下一个离散 token;在 Emu3.5 中,模型预测的是"下一个多模态状态":
- 如果当前状态是文本的中间位置,下一个状态是下一个词 token。
- 如果当前状态是一段叙事中的配图位置,下一个状态是一整张图像(或图像片段)。
- 如果当前状态是视频的一帧,下一个状态是视频的下一帧。
- 如果当前状态是一个机器人操作步骤,下一个状态可以是操作后的视觉结果。
NSP 的关键洞察是:世界本来就是以"状态序列"的方式运行的。视频是连续帧的状态序列,图文交错的文档是文字和图像交替的状态序列,机器人操作是观察-动作循环的状态序列。用统一的 NSP 目标训练,模型天然就能学习这些不同形式的状态转换规律。
2.2 训练数据:790 年的互联网视频
Emu3.5 的预训练数据量达到了新的量级:
- 总数据量:超过 10 万亿 token。
- 主要来源:互联网视频的连续帧和转录文本,累计时长约 790 年。
- 对比:Emu3 的视频数据约 15 年时长,Emu3.5 实现了两个数量级的跨越。
- 数据还包括图文交错网页、图像-文本对等。
为什么视频如此重要?因为视频包含了世界运行的动态记录:物体怎么运动、人怎么操作工具、场景怎么随时间变化、因果关系如何展开。790 年的视频本质上是在让模型"观察"世界 790 年,从中内化物理常识和时空因果。
2.3 模型规模与架构
- 参数:34B(从 Emu3 的 8B 扩大到 34B)。
- 架构:纯 decoder-only Transformer,原生支持交错的视觉-语言输入输出。
- 视觉 tokenizer:在 Emu3 基础上改进,支持更高分辨率和更好的重建质量。
- 后训练:大规模强化学习(RL),增强多模态推理和生成能力。这是首次在自回归多模态架构下落地大规模 RL,为多模态 Scaling 提供了关键支撑。
2.4 DiDA:解决自回归生成的速度瓶颈
Emu3 最大的工程问题是:逐 token 生成一张图需要预测上千个 token,速度远不如扩散模型的并行去噪。DiDA(Discrete Diffusion Adaptation)是 Emu3.5 的核心工程创新:
核心思想:保留自回归预训练的模型权重,但在推理/微调时引入离散扩散机制,把顺序解码改成双向并行预测。
具体来说:
-
预训练阶段:模型用标准 NTP/NSP 目标训练,学会逐 token 预测。这一步保留了自回归训练的所有优势——简单、稳定、Scaling Law 明确。
-
DiDA 适配阶段:在预训练模型上微调,引入离散扩散的噪声调度:
- 给图像 token 序列随机 mask 掉一部分(类似 BERT 的 masked modeling,但有噪声调度)。
- 训练模型根据未 mask 的 token 双向预测被 mask 的 token。
- 这和 Show-o 的离散扩散思路类似,但 DiDA 的贡献在于证明了可以在已有的自回归预训练模型上"适配"出这种能力,不需要从头训练。
-
推理阶段:
- 文本部分仍然用自回归(逐 token 生成,因为语言需要顺序性)。
- 图像/视频部分用离散扩散并行解码(多步去噪,每步同时预测所有位置)。
- 单图推理速度提升约 20 倍,质量不降级。
DiDA 的意义在于它同时享受了两个世界的好处:训练时用自回归(简单、可扩展),推理时用扩散(快速、并行)。这是对 Emu3"纯自回归"路线的工程补强,也是对 Transfusion"训练时就混合两种 loss"路线的另一种回答。
2.5 关键能力
Emu3.5 展示了四大类原生多模态能力:
长程视觉-语言生成
模型能生成连贯的多页图文交错内容,例如:
- 分步骤视觉教程("如何用粘土雕刻火星探险者"——每一步都有配图)。
- 长篇视觉故事("粘土宇航员在外星森林坠毁,遇到皮卡丘,一起探索发光蘑菇森林")。
- 角色、风格在多页内容中保持一致。
任意到图像生成(X2I)
- 文本到图像、图像到图像、图像+文本到图像、多图参考到图像。
- 在图像生成和编辑任务上达到与 Gemini 2.5 Flash Image(Nano Banana)相当的性能。
- 在交错生成任务(interleaved generation)上优于 Nano Banana。
复杂文本图像生成
- 精准渲染密集文字(海报、文档、信息图)。
- 支持复杂排版和图文混排。
世界建模能力
这是 Emu3.5 最具想象力的能力:
- 世界探索(World Exploration):给定一个场景(客厅、教室、埃菲尔铁塔、天坛),生成连贯的第一人称视角探索视频。模型能保持长程空间一致性——左转后看到的物体和之前看到的物体在空间上是自洽的。
- 开放世界具身操作(Open-world Embodied Manipulation):理解物理世界任务并生成操作步骤的视觉演示——叠衣服、清理台面、超市拣货。每一步都有对应的视觉结果,展示了模型对物理因果的理解。
2.6 为什么称"第三个 Scaling 范式"
王仲远的论断基于三个依据:
-
架构可扩展:Emu3.5 用纯自回归设计实现多模态大一统,能大规模复用现有计算基础设施(Transformer 训练和推理栈非常成熟)。
-
RL 可扩展:首次在多模态自回归架构下落地大规模强化学习。RL 基础设施(GRPO、RLHF 等)在文本领域已经成熟,现在可以直接迁移到多模态。
-
性能可扩展:从 Emu3(8B)到 Emu3.5(34B),从 15 年视频到 790 年视频,性能实现了显著跃升,且已经达到产品级水准。这证明了多模态 NSP 目标存在 Scaling Law——更多参数 + 更多数据 = 更好性能。
两篇论文的对比
| 维度 | UniVideo | Emu3.5 |
|---|---|---|
| 团队 | 快手可灵 / 滑铁卢 | 智源 BAAI |
| 统一策略 | 双流拼接(MLLM + MMDiT) | 原生统一(单 Transformer + NSP) |
| 视觉表征 | VAE 连续 latent | 离散 token(DiDA 推理时双向) |
| 参数规模 | 未公开 | 34B |
| 训练数据 | 视频+图像编辑数据 | 10 万亿 token,790 年视频 |
| 生成方式 | 连续扩散(MMDiT) | 自回归预训练 + DiDA 离散扩散推理 |
| 核心能力 | 视频理解/生成/编辑 | 世界模型(探索+具身+交错生成) |
| 视频编辑 | 强项(双流设计天然支持) | 支持但非核心卖点 |
| 世界建模 | 未重点探索 | 核心卖点 |
| 开源 | 是 | 是(代码+权重) |
两条路线的哲学差异
UniVideo 问的是:"如何用现有组件最快做出一个能用的统一视频模型?"——答案是双流拼接,MLLM 管理解、MMDiT 管生成,连接器桥接。
Emu3.5 问的是:"统一多模态模型的本质是什么?"——答案是下一状态预测。世界以状态序列运行,模型只需学会预测下一状态,理解、生成、视频、具身就都是同一个问题的不同表现。
两条路线没有绝对的对错。UniVideo 的工程化路线能更快落地到产品(快手可灵本身就是商业产品),Emu3.5 的原生统一路线则有更远的想象空间(世界模型、具身智能)。两者很可能在未来汇合——当 MLLM 和 MMDiT 的参数可以更深度共享时,双流就演变成了原生统一。
从五篇系列看 UMM 的过去、现在与未来
过去:七篇奠基论文构建了词汇表
Transformer 提供骨干,CLIP/LLaVA 定义了理解范式,DDPM/DiT 定义了生成范式,VQ-VAE/VQGAN 解决了视觉离散化。没有这些,UMM 无从谈起。
现在:四条路线收敛到三个共识
Chameleon/Emu3/Transfusion/Show-o 探索了四条早期路线,Janus-Pro/BAGEL/U1 把它们推到产品级。三个共识已经形成:
- 一个 Transformer 统一多模态是可行的。
- MoT(共享注意力 + 分离 FFN)是当前最优架构模式之一。
- 交错图文数据是能力涌现的关键燃料。
VCoT 五篇论文则展示了统一模型"边看边想"的新能力维度——视觉中间产物不只是"画出来看",更是模型推理的载体。
未来:视频与世界模型是下一个前沿
UniVideo 和 Emu3.5 指向同一个方向:统一模型正在从"图像-文本"走向"视频-动作-世界状态"。
- 当模型能预测下一帧、下一状态,它就具备了世界模型的核心能力。
- 当世界模型能理解指令并生成动作,它就成了具身智能的大脑。
- VCoT 和 NSP 的结合——模型先"想象"一系列未来状态,再据此规划行动——很可能是具身智能的关键技术路径。
BAGEL 的世界导航、CoT-VLA 的子目标预测、Emu3.5 的世界探索,这些看似独立的研究正在汇聚成一条清晰的技术线:统一多模态模型 → 视觉思维链 → 世界模型 → 具身智能。
这条线能走多远,取决于三个问题的答案:
- 视频 Scaling Law 是否成立? Emu3.5 的初步证据是肯定的,但还需要更多验证。
- 统一架构能否同时承载实时视频理解和高保真生成? UniVideo 的双流是一种方案,但可能不是终局。
- 世界模型的"世界"有多大? 是限于特定场景(厨房、客厅),还是能泛化到开放世界?
这些问题的答案,将定义 UMM 下一个阶段的研究议程。
全系列参考链接汇总
基础奠基
- Attention Is All You Need: https://arxiv.org/abs/1706.03762
- CLIP: https://arxiv.org/abs/2103.00020
- LLaVA: https://arxiv.org/abs/2304.08485
- DDPM: https://arxiv.org/abs/2006.11239
- DiT: https://arxiv.org/abs/2212.09748
- VQ-VAE: https://arxiv.org/abs/1711.00937
- VQGAN: https://arxiv.org/abs/2012.09841
早期统一模型
- Chameleon: https://arxiv.org/abs/2405.09818
- Emu3: https://arxiv.org/abs/2409.18869
- Transfusion: https://arxiv.org/abs/2408.11039
- Show-o: https://arxiv.org/abs/2408.12528
主流模型
- Janus-Pro: https://arxiv.org/abs/2501.17811
- BAGEL: https://arxiv.org/abs/2505.14683
- SenseNova U1: https://arxiv.org/abs/2605.12500
VCoT
- Visual Sketchpad: https://arxiv.org/abs/2406.09403
- CoVT: https://arxiv.org/abs/2511.19418
- Gen-VCoT: https://arxiv.org/abs/2606.16783
- Visual-Aware CoT: https://arxiv.org/abs/2512.19686
- CoT-VLA: https://arxiv.org/abs/2503.22020
视频与世界模型
- UniVideo: https://arxiv.org/abs/2510.08377
- Emu3.5: https://arxiv.org/abs/2510.26583