Back

UMM论文解读05-视频与世界模型篇:UniVideo的双流统一与Emu3.5的下一状态预测

统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 则把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模态世界模型。两篇论文代表了 UMM 向时空维度扩展的两条路径:工程化的双流拼接 vs 第一性原理的原生统一。

UMM论文解读系列-视频与世界模型篇

系列导航

  • 01 基础奠基篇:Transformer、CLIP、LLaVA、DDPM、DiT、VQ-VAE、VQGAN
  • 02 早期统一模型篇:Chameleon、Emu3、Transfusion、Show-o
  • 03 主流模型篇:Janus-Pro、BAGEL、SenseNova U1
  • 04 VCoT 篇:CoVT、Gen-VCoT、Visual Sketchpad、Visual-Aware CoT、CoT-VLA
  • 05 视频与世界模型篇(本文):UniVideo、Emu3.5

为什么视频统一更难

把理解和生成从图像扩展到视频,难度不是线性增加,而是阶跃式增加:

  1. 时序维度:图像只需要空间一致性,视频还需要时序一致性——物体不能帧帧变形,运动要符合物理规律。
  2. 计算量爆炸:一段 5 秒的 24fps 视频包含 120 帧,token 数量是单张图像的上百倍。
  3. 理解和生成的耦合更紧:视频编辑需要理解动作语义、跟踪物体、保持身份,这些都要求理解和生成深度协同。
  4. 训练数据稀缺:高质量的视频-文本-编辑三元组数据远比图像数据少。

UniVideo 和 Emu3.5 用截然不同的策略应对这些挑战。


1. UniVideo:MLLM + MMDiT 双流统一视频框架(2025.10)

论文UniVideo: Unified Understanding, Generation, and Editing for Videos 作者:Cong Wei, Quande Liu, Zixuan Ye 等(滑铁卢大学 / 快手可灵团队 / 港科大) 链接https://arxiv.org/abs/2510.08377 项目主页https://congwei1230.github.io/UniVideo/

核心思路

UniVideo 的策略是"双流设计":不追求一个模型从底层统一一切,而是让两个擅长不同任务的模型协同工作——MLLM 负责理解指令,MMDiT 负责视觉生成。这和 Transfusion 在图像领域的"AR + Diffusion 共存"思路一脉相承,但扩展到了视频。

架构设计

输入:文本 + 图像/视频(多模态指令)
         │
         ▼
┌─────────────────────┐
│   MLLM(理解流)      │  ← 解析指令、理解视觉内容、生成文本响应
│   提取最后一层隐状态   │
└─────────┬───────────┘
          │ 可训练连接器
          ▼
┌─────────────────────┐
│   MMDiT(生成流)     │  ← 两个分支:
│   分支A:MLLM 语义特征 │     高层语义指导
│   分支B:VAE 视觉特征  │     细粒度像素重建
└─────────┬───────────┘
          │
          ▼
输出:生成/编辑后的视频

1.1 MLLM:指令理解中枢

MLLM 接收文本、图像和视频输入,负责:

  • 解析复杂的多模态指令("把视频里的狗换成猫,保持背景不变")。
  • 理解参考图像/视频的内容和风格。
  • 生成文本响应(对于理解类任务)。
  • 提取最后一层 Transformer 的隐状态,这些隐状态编码了丰富的多模态语义信息。

关键设计:MLLM 保持原有的文本生成能力不变。它不是被"改造"成视频模型,而是作为一个成熟的理解模块被复用。这降低了训练难度,也保证了语言能力不退化。

1.2 可训练连接器

MLLM 的隐状态通过一个可训练的连接器对齐到 MMDiT 的输入空间。这个连接器是轻量级的(相比整个模型),负责把"理解空间"的表征翻译成"生成空间"能使用的条件信号。

1.3 MMDiT:双流视觉生成

MMDiT(Multimodal Diffusion Transformer)是视频生成的核心。它内部有两个分支:

  • 理解流分支:接收来自 MLLM 的高层语义特征,确保生成内容符合指令意图。
  • 生成流分支:接收来自 VAE 的细粒度视觉编码(当前帧的 latent),保留纹理、颜色、运动细节。

两个分支在 MMDiT 的 Transformer 层中通过注意力机制交互——语义分支指导"画什么",视觉分支保证"怎么画"。这种设计对于视频编辑尤其重要:需要同时保持语义正确(换成猫)和视觉一致(背景、光照、运动连贯)。

1.4 统一任务范式

UniVideo 用一套统一的多模态指令格式覆盖所有视频任务:

  • 文本/图像到视频生成(T2V / I2V):根据文本描述或参考图像生成视频。
  • 上下文视频生成(In-context Video Generation):给定视频片段,续写后续内容。
  • 上下文视频编辑(In-context Video Editing):根据指令修改已有视频。
  • 视觉提示生成(Visual-prompt-based Generation):手绘草图、标注线等作为提示,MLLM 理解视觉提示后指导生成。

每个视觉输入被分配一个 ID 标签,模型通过标签区分哪个是参考图、哪个是待编辑视频、哪个是风格参考。三维位置编码区分条件信息和目标视频信息,不需要额外的任务标识。

训练策略

UniVideo 的训练分三个阶段:

  1. 阶段一:建立 MLLM-MMDiT 通信机制。训练连接器,让 MLLM 的语义特征能有效指导 MMDiT 生成。
  2. 阶段二:提升生成质量。在大规模视频生成数据上训练,提升视觉质量和时序一致性。
  3. 阶段三:多任务统一训练。联合训练生成、编辑、理解任务,让模型学会区分任务类型并自适应处理。

关键能力与结果

UniVideo 在多个维度展示了统一设计的优势:

  1. SOTA 性能:在 T2V、I2V、上下文生成、上下文编辑等任务上匹配或超越专用 SOTA 基线。

  2. 任务组合泛化:支持在单条指令中组合多个能力。例如"把视频中的物体替换成参考图中的物体,同时把风格转换成油画风格"——编辑 + 风格迁移一次完成,不需要为这种组合专门训练。

  3. 自由形式视频编辑的零样本迁移:即使没有在自由形式视频编辑数据上训练,UniVideo 也能把大规模图像编辑中学到的编辑能力迁移到视频上。例如"改变视频中的环境"、"替换视频中的材质"——这些未见过的指令也能处理。

  4. 视觉提示理解:MLLM 能理解手绘标注和草图,把用户的视觉创意转化为生成指导。这在专业视频制作中很有价值。

设计哲学与局限

UniVideo 代表了"工程化统一"的路线:

  • 优势:复用成熟的 MLLM(理解能力有保障)和 MMDiT(生成质量有保障),训练风险低,每个模块可以独立升级。
  • 代价:架构上仍然是"两个模型 + 一个连接器",不是原生统一。MLLM 和 MMDiT 之间的信息通过连接器传递,存在表征鸿沟。推理时需要同时跑两个大模型,计算开销大。

对比 BAGEL 的"一个 Transformer 内部 MoT 双塔"和 SenseNova U1 的"原生统一",UniVideo 的双流更像是在视频领域重走了 Transfusion 的路——先把两个成熟模块拼起来验证可行性,后续可能走向更深层融合。


2. Emu3.5:从下一 Token 到下一状态的世界模型(2025.10)

论文Emu3.5: Native Multimodal Models are World Learners 作者:Yufeng Cui, Honghao Chen, Haoge Deng 等(智源 BAAI) 链接https://arxiv.org/abs/2510.26583 项目主页https://emu.world/ 代码https://github.com/baaivision/Emu3.5

核心思路

Emu3 证明了"next-token prediction is all you need",但纯自回归图像生成有一个致命短板:速度慢。Emu3.5 在两个维度上做了升维:

  1. 目标升维:从"下一 token 预测"(Next-Token Prediction, NTP)升维到"下一状态预测"(Next-State Prediction, NSP)。"状态"可以是一个词、一个图像片段,甚至一段视频的下一帧。
  2. 效率革命:提出 DiDA(Discrete Diffusion Adaptation,离散扩散适配),把逐 token 自回归解码转换成双向并行预测,单图推理速度提升约 20 倍。

智源研究院院长王仲远称其为"第三个 Scaling 范式"——前两个分别是语言预训练 Scaling 和后训练/推理 Scaling,Emu3.5 证明多模态领域同样存在 Scaling Law。

2.1 Next-State Prediction:统一的训练目标

NSP 是 NTP 的自然推广。在 Emu3 中,模型预测序列中的下一个离散 token;在 Emu3.5 中,模型预测的是"下一个多模态状态":

  • 如果当前状态是文本的中间位置,下一个状态是下一个词 token。
  • 如果当前状态是一段叙事中的配图位置,下一个状态是一整张图像(或图像片段)。
  • 如果当前状态是视频的一帧,下一个状态是视频的下一帧。
  • 如果当前状态是一个机器人操作步骤,下一个状态可以是操作后的视觉结果。

NSP 的关键洞察是:世界本来就是以"状态序列"的方式运行的。视频是连续帧的状态序列,图文交错的文档是文字和图像交替的状态序列,机器人操作是观察-动作循环的状态序列。用统一的 NSP 目标训练,模型天然就能学习这些不同形式的状态转换规律。

2.2 训练数据:790 年的互联网视频

Emu3.5 的预训练数据量达到了新的量级:

  • 总数据量:超过 10 万亿 token。
  • 主要来源:互联网视频的连续帧和转录文本,累计时长约 790 年。
  • 对比:Emu3 的视频数据约 15 年时长,Emu3.5 实现了两个数量级的跨越。
  • 数据还包括图文交错网页、图像-文本对等。

为什么视频如此重要?因为视频包含了世界运行的动态记录:物体怎么运动、人怎么操作工具、场景怎么随时间变化、因果关系如何展开。790 年的视频本质上是在让模型"观察"世界 790 年,从中内化物理常识和时空因果。

2.3 模型规模与架构

  • 参数:34B(从 Emu3 的 8B 扩大到 34B)。
  • 架构:纯 decoder-only Transformer,原生支持交错的视觉-语言输入输出。
  • 视觉 tokenizer:在 Emu3 基础上改进,支持更高分辨率和更好的重建质量。
  • 后训练:大规模强化学习(RL),增强多模态推理和生成能力。这是首次在自回归多模态架构下落地大规模 RL,为多模态 Scaling 提供了关键支撑。

2.4 DiDA:解决自回归生成的速度瓶颈

Emu3 最大的工程问题是:逐 token 生成一张图需要预测上千个 token,速度远不如扩散模型的并行去噪。DiDA(Discrete Diffusion Adaptation)是 Emu3.5 的核心工程创新:

核心思想:保留自回归预训练的模型权重,但在推理/微调时引入离散扩散机制,把顺序解码改成双向并行预测。

具体来说:

  1. 预训练阶段:模型用标准 NTP/NSP 目标训练,学会逐 token 预测。这一步保留了自回归训练的所有优势——简单、稳定、Scaling Law 明确。

  2. DiDA 适配阶段:在预训练模型上微调,引入离散扩散的噪声调度:

    • 给图像 token 序列随机 mask 掉一部分(类似 BERT 的 masked modeling,但有噪声调度)。
    • 训练模型根据未 mask 的 token 双向预测被 mask 的 token。
    • 这和 Show-o 的离散扩散思路类似,但 DiDA 的贡献在于证明了可以在已有的自回归预训练模型上"适配"出这种能力,不需要从头训练。
  3. 推理阶段

    • 文本部分仍然用自回归(逐 token 生成,因为语言需要顺序性)。
    • 图像/视频部分用离散扩散并行解码(多步去噪,每步同时预测所有位置)。
    • 单图推理速度提升约 20 倍,质量不降级。

DiDA 的意义在于它同时享受了两个世界的好处:训练时用自回归(简单、可扩展),推理时用扩散(快速、并行)。这是对 Emu3"纯自回归"路线的工程补强,也是对 Transfusion"训练时就混合两种 loss"路线的另一种回答。

2.5 关键能力

Emu3.5 展示了四大类原生多模态能力:

长程视觉-语言生成

模型能生成连贯的多页图文交错内容,例如:

  • 分步骤视觉教程("如何用粘土雕刻火星探险者"——每一步都有配图)。
  • 长篇视觉故事("粘土宇航员在外星森林坠毁,遇到皮卡丘,一起探索发光蘑菇森林")。
  • 角色、风格在多页内容中保持一致。

任意到图像生成(X2I)

  • 文本到图像、图像到图像、图像+文本到图像、多图参考到图像。
  • 在图像生成和编辑任务上达到与 Gemini 2.5 Flash Image(Nano Banana)相当的性能。
  • 在交错生成任务(interleaved generation)上优于 Nano Banana。

复杂文本图像生成

  • 精准渲染密集文字(海报、文档、信息图)。
  • 支持复杂排版和图文混排。

世界建模能力

这是 Emu3.5 最具想象力的能力:

  • 世界探索(World Exploration):给定一个场景(客厅、教室、埃菲尔铁塔、天坛),生成连贯的第一人称视角探索视频。模型能保持长程空间一致性——左转后看到的物体和之前看到的物体在空间上是自洽的。
  • 开放世界具身操作(Open-world Embodied Manipulation):理解物理世界任务并生成操作步骤的视觉演示——叠衣服、清理台面、超市拣货。每一步都有对应的视觉结果,展示了模型对物理因果的理解。

2.6 为什么称"第三个 Scaling 范式"

王仲远的论断基于三个依据:

  1. 架构可扩展:Emu3.5 用纯自回归设计实现多模态大一统,能大规模复用现有计算基础设施(Transformer 训练和推理栈非常成熟)。

  2. RL 可扩展:首次在多模态自回归架构下落地大规模强化学习。RL 基础设施(GRPO、RLHF 等)在文本领域已经成熟,现在可以直接迁移到多模态。

  3. 性能可扩展:从 Emu3(8B)到 Emu3.5(34B),从 15 年视频到 790 年视频,性能实现了显著跃升,且已经达到产品级水准。这证明了多模态 NSP 目标存在 Scaling Law——更多参数 + 更多数据 = 更好性能。


两篇论文的对比

维度 UniVideo Emu3.5
团队 快手可灵 / 滑铁卢 智源 BAAI
统一策略 双流拼接(MLLM + MMDiT) 原生统一(单 Transformer + NSP)
视觉表征 VAE 连续 latent 离散 token(DiDA 推理时双向)
参数规模 未公开 34B
训练数据 视频+图像编辑数据 10 万亿 token,790 年视频
生成方式 连续扩散(MMDiT) 自回归预训练 + DiDA 离散扩散推理
核心能力 视频理解/生成/编辑 世界模型(探索+具身+交错生成)
视频编辑 强项(双流设计天然支持) 支持但非核心卖点
世界建模 未重点探索 核心卖点
开源 是(代码+权重)

两条路线的哲学差异

UniVideo 问的是:"如何用现有组件最快做出一个能用的统一视频模型?"——答案是双流拼接,MLLM 管理解、MMDiT 管生成,连接器桥接。

Emu3.5 问的是:"统一多模态模型的本质是什么?"——答案是下一状态预测。世界以状态序列运行,模型只需学会预测下一状态,理解、生成、视频、具身就都是同一个问题的不同表现。

两条路线没有绝对的对错。UniVideo 的工程化路线能更快落地到产品(快手可灵本身就是商业产品),Emu3.5 的原生统一路线则有更远的想象空间(世界模型、具身智能)。两者很可能在未来汇合——当 MLLM 和 MMDiT 的参数可以更深度共享时,双流就演变成了原生统一。


从五篇系列看 UMM 的过去、现在与未来

过去:七篇奠基论文构建了词汇表

Transformer 提供骨干,CLIP/LLaVA 定义了理解范式,DDPM/DiT 定义了生成范式,VQ-VAE/VQGAN 解决了视觉离散化。没有这些,UMM 无从谈起。

现在:四条路线收敛到三个共识

Chameleon/Emu3/Transfusion/Show-o 探索了四条早期路线,Janus-Pro/BAGEL/U1 把它们推到产品级。三个共识已经形成:

  1. 一个 Transformer 统一多模态是可行的
  2. MoT(共享注意力 + 分离 FFN)是当前最优架构模式之一
  3. 交错图文数据是能力涌现的关键燃料

VCoT 五篇论文则展示了统一模型"边看边想"的新能力维度——视觉中间产物不只是"画出来看",更是模型推理的载体。

未来:视频与世界模型是下一个前沿

UniVideo 和 Emu3.5 指向同一个方向:统一模型正在从"图像-文本"走向"视频-动作-世界状态"

  • 当模型能预测下一帧、下一状态,它就具备了世界模型的核心能力。
  • 当世界模型能理解指令并生成动作,它就成了具身智能的大脑。
  • VCoT 和 NSP 的结合——模型先"想象"一系列未来状态,再据此规划行动——很可能是具身智能的关键技术路径。

BAGEL 的世界导航、CoT-VLA 的子目标预测、Emu3.5 的世界探索,这些看似独立的研究正在汇聚成一条清晰的技术线:统一多模态模型 → 视觉思维链 → 世界模型 → 具身智能

这条线能走多远,取决于三个问题的答案:

  1. 视频 Scaling Law 是否成立? Emu3.5 的初步证据是肯定的,但还需要更多验证。
  2. 统一架构能否同时承载实时视频理解和高保真生成? UniVideo 的双流是一种方案,但可能不是终局。
  3. 世界模型的"世界"有多大? 是限于特定场景(厨房、客厅),还是能泛化到开放世界?

这些问题的答案,将定义 UMM 下一个阶段的研究议程。


全系列参考链接汇总

基础奠基

早期统一模型

主流模型

VCoT

视频与世界模型

评论