Back

Causal vs Streaming DiT:视频生成与交互的两大技术路线深度对比

当 AI 视频生成从"离线创作"走向"实时交互",两条技术路线正在激烈碰撞:严格因果的 Causal 方案 vs 缓冲区机制的 Streaming DiT 方案。本文深度解析两者的架构差异、训练范式与适用场景。


一、为什么需要流式视频生成?

传统视频扩散模型(如 CogVideoX、OpenSORA)采用双向注意力架构,存在三个致命瓶颈:

  1. 生成慢 — 128帧视频需要219秒,必须等全部内容生成完毕才能观看
  2. 无法交互 — 生成过程中无法修改提示词,改了就从头开始
  3. 计算爆炸 — 计算成本随帧数平方级增长,256帧耗时是128帧的4倍

流式视频生成的目标:像人说话一样"边想边说",每生成一帧就立刻输出,同时支持中途修改指令。


二、两条技术路线

2.1 Causal Video Generation(因果视频生成)

核心思想:当前帧只能看到过去的帧,不能"偷看"未来。

时间维度:自回归(逐帧/逐块生成)
空间维度:扩散去噪(每帧内部迭代优化)

代表工作

工作 团队 时间 核心贡献
CausVid MIT + Adobe 2024 首个非对称蒸馏因果模型,50步→4步
Causal-rCM 清华 + 英伟达 2026.06 一致性模型+因果蒸馏,50步→1-2步
Causal Forcing++ 清华 2026.06 帧级自回归+1-2步生成
One-Forcing 清华 + UCLA 2026.06 一步生成,VBench 84.63分
SAD 武大 + 腾讯 2026.03 对抗自蒸馏,ICLR 2026

2.2 Streaming DiT(流式扩散变换器)

核心思想:基于 DiT 架构,通过移动缓冲区实现流式生成。

时间维度:分块处理(chunk-wise),带移动缓冲区
空间维度:DiT 自注意力 + 窗口注意力

代表工作

工作 团队 时间 核心贡献
StreamDiT Meta + UC Berkeley 2025 4B参数,移动缓冲区+分块蒸馏

三、架构差异对比

维度 Causal 方案 Streaming DiT 方案
基础架构 因果扩散变换器(Causal DiT) adaLN DiT + 窗口注意力
时间建模 严格因果注意力(只看过去) 移动缓冲区 + 分块注意力
空间建模 扩散去噪(多步迭代) 扩散去噪(多步迭代)
训练范式 蒸馏双向模型 → 因果学生模型 flow matching + 移动缓冲区混合训练
推理步数 1-4步(蒸馏后) 多步(可蒸馏减少)
生成粒度 帧级 或 块级(3-16帧/块) 块级(chunk-wise)
KV缓存 缓存过去帧的KV,避免重复计算 缓冲区帧的KV缓存

四、训练方法深度对比

4.1 Causal 方案的训练路线

双向扩散模型(教师,50步)
    ↓ 蒸馏
因果自回归模型(学生,多步)
    ↓ 进一步蒸馏
少步因果模型(1-2步)

三种训练模式

模式 方法 问题
Teacher Forcing 用真实历史帧训练 训练/推理不一致(曝光偏差)
Self Forcing 用自己生成的历史帧训练 误差累积,质量下降
Causal CD(清华) 老师演示相邻时间点的"一小步" 目前最优方案

关键创新

  • CausVid 的非对称 DMD 蒸馏:用双向教师模型指导因果学生模型,50步→4步,在单张 H100 上实现 1.3秒初始延迟和 9.4FPS 流式生成
  • Causal-rCM 的一致性蒸馏:结合一致性模型(Consistency Model)与因果约束,实现 1-2步生成,VBench-T2V 得分 84.63
  • One-Forcing 的 ODE 轨迹初始化:用 ODE 轨迹而非一致性蒸馏初始化,一步生成就超越大量多步方案

4.2 Streaming DiT 的训练路线

Flow Matching 基础训练
    + 移动缓冲区
    + 混合分块策略
    ↓
多步蒸馏(每个分块独立蒸馏)
    ↓
NFE = 缓冲区分块数

关键设计

  • 移动缓冲区:训练时加入 progressive denoising,模拟推理时的流式场景
  • 混合分块策略:不同 partitioning scheme 提升内容一致性和视觉质量
  • 多变时间嵌入:varying time embedding + window attention,支持灵活的分块大小

五、性能对比

指标 CausVid Causal-rCM One-Forcing Streaming DiT
初始延迟 1.3秒 <1秒 <1秒 取决于分块大小
生成速度 9.4 FPS 实时 实时 实时
推理步数 4步 1-2步 1步 可蒸馏
VBench 分数 84.27 84.63 84.63 待公布
基础模型 Wan2.1-1.3B Wan2.1-1.3B Wan2.1-1.3B 自研 4B
硬件 单张 H100 单张 H100 单张 H100 未明确

One-Forcing 的一步生成表现

  • 超越 CausVid(4步,81.18分)
  • 超越 LTX-Video(20步,80.00分)
  • 超越 Pyramid Flow(20步,81.72分)
  • 接近 Wan2.1 教师模型(50步,84.26分),仅差 0.5分

六、核心差异总结

差异点 Causal 方案 Streaming DiT 方案
哲学 "边想边说" — 严格因果,只看过去 "边看边说" — 缓冲区机制,可看上下文
时间约束 严格单向(因果掩码) 软约束(缓冲区窗口)
蒸馏目标 双向→因果→少步 flow matching→分块蒸馏
误差控制 KV缓存 + 参考帧锚定 缓冲区重叠 + 混合训练
交互能力 强(可随时修改提示词) 中(缓冲区限制)
适用场景 实时交互、游戏、直播 流媒体播放、长视频生成

七、技术路线演进

2024: CausVid(MIT+Adobe)
    ↓ 非对称DMD蒸馏,50步→4步,开启流式生成时代
    
2025: StreamDiT(Meta+Berkeley)
    ↓ 移动缓冲区+分块蒸馏,DiT架构的流式化
    
2026: Causal-rCM / Causal Forcing++ / One-Forcing(清华)
    ↓ 一致性蒸馏+因果约束,50步→1-2步,逼近实时极限
    
未来: 一步生成 + 物理一致性 + 世界模型
    ↓ 从"生成视频"到"模拟世界"

八、选择建议

场景 推荐方案 原因
实时交互/游戏 Causal(1-2步) 严格因果,可随时修改输入
直播/实时视频 Causal(帧级) 最低延迟,帧级响应
长视频流式生成 Streaming DiT 缓冲区机制更适合长序列
高质量离线生成 双向扩散 质量最高,无因果约束
数字人/口型同步 Causal + 音频条件 TalkingMachines 已验证

九、关键论文索引

论文 团队 链接
CausVid MIT + Adobe arXiv:2412.07772
StreamDiT Meta + UC Berkeley arXiv:2506.01348
Causal-rCM 清华 + 英伟达 arXiv:2606.25473
Causal Forcing++ 清华 arXiv:2605.15141
One-Forcing 清华 + UCLA arXiv:2606.03251
SAD 武大 + 腾讯 arXiv:2511.01419(ICLR 2026)
TalkingMachines Character AI 音频驱动视频会话

十、写在最后

2026年上半年,清华团队在因果视频生成方向取得了显著突破,基本实现了"一步生成高质量视频"的目标。从 CausVid 的4步到 One-Forcing 的1步,只用了不到两年时间。

核心洞察

  1. 蒸馏是关键 — 没有蒸馏,因果模型无法在少步下保持质量
  2. 因果约束是双刃剑 — 保证了交互性,但增加了训练难度
  3. 缓冲区是折中 — Streaming DiT 用缓冲区换取了更灵活的生成策略
  4. 一步生成已接近极限 — One-Forcing 与50步教师模型仅差0.5分

视频生成正在从"离线创作工具"演变为"实时交互媒介",这两条技术路线的融合可能会催生下一代视频生成架构。

评论