当 AI 视频生成从"离线创作"走向"实时交互",两条技术路线正在激烈碰撞:严格因果的 Causal 方案 vs 缓冲区机制的 Streaming DiT 方案。本文深度解析两者的架构差异、训练范式与适用场景。
一、为什么需要流式视频生成?
传统视频扩散模型(如 CogVideoX、OpenSORA)采用双向注意力架构,存在三个致命瓶颈:
- 生成慢 — 128帧视频需要219秒,必须等全部内容生成完毕才能观看
- 无法交互 — 生成过程中无法修改提示词,改了就从头开始
- 计算爆炸 — 计算成本随帧数平方级增长,256帧耗时是128帧的4倍
流式视频生成的目标:像人说话一样"边想边说",每生成一帧就立刻输出,同时支持中途修改指令。
二、两条技术路线
2.1 Causal Video Generation(因果视频生成)
核心思想:当前帧只能看到过去的帧,不能"偷看"未来。
时间维度:自回归(逐帧/逐块生成)
空间维度:扩散去噪(每帧内部迭代优化)
代表工作:
| 工作 | 团队 | 时间 | 核心贡献 |
|---|---|---|---|
| CausVid | MIT + Adobe | 2024 | 首个非对称蒸馏因果模型,50步→4步 |
| Causal-rCM | 清华 + 英伟达 | 2026.06 | 一致性模型+因果蒸馏,50步→1-2步 |
| Causal Forcing++ | 清华 | 2026.06 | 帧级自回归+1-2步生成 |
| One-Forcing | 清华 + UCLA | 2026.06 | 一步生成,VBench 84.63分 |
| SAD | 武大 + 腾讯 | 2026.03 | 对抗自蒸馏,ICLR 2026 |
2.2 Streaming DiT(流式扩散变换器)
核心思想:基于 DiT 架构,通过移动缓冲区实现流式生成。
时间维度:分块处理(chunk-wise),带移动缓冲区
空间维度:DiT 自注意力 + 窗口注意力
代表工作:
| 工作 | 团队 | 时间 | 核心贡献 |
|---|---|---|---|
| StreamDiT | Meta + UC Berkeley | 2025 | 4B参数,移动缓冲区+分块蒸馏 |
三、架构差异对比
| 维度 | Causal 方案 | Streaming DiT 方案 |
|---|---|---|
| 基础架构 | 因果扩散变换器(Causal DiT) | adaLN DiT + 窗口注意力 |
| 时间建模 | 严格因果注意力(只看过去) | 移动缓冲区 + 分块注意力 |
| 空间建模 | 扩散去噪(多步迭代) | 扩散去噪(多步迭代) |
| 训练范式 | 蒸馏双向模型 → 因果学生模型 | flow matching + 移动缓冲区混合训练 |
| 推理步数 | 1-4步(蒸馏后) | 多步(可蒸馏减少) |
| 生成粒度 | 帧级 或 块级(3-16帧/块) | 块级(chunk-wise) |
| KV缓存 | 缓存过去帧的KV,避免重复计算 | 缓冲区帧的KV缓存 |
四、训练方法深度对比
4.1 Causal 方案的训练路线
双向扩散模型(教师,50步)
↓ 蒸馏
因果自回归模型(学生,多步)
↓ 进一步蒸馏
少步因果模型(1-2步)
三种训练模式:
| 模式 | 方法 | 问题 |
|---|---|---|
| Teacher Forcing | 用真实历史帧训练 | 训练/推理不一致(曝光偏差) |
| Self Forcing | 用自己生成的历史帧训练 | 误差累积,质量下降 |
| Causal CD(清华) | 老师演示相邻时间点的"一小步" | 目前最优方案 |
关键创新:
- CausVid 的非对称 DMD 蒸馏:用双向教师模型指导因果学生模型,50步→4步,在单张 H100 上实现 1.3秒初始延迟和 9.4FPS 流式生成
- Causal-rCM 的一致性蒸馏:结合一致性模型(Consistency Model)与因果约束,实现 1-2步生成,VBench-T2V 得分 84.63
- One-Forcing 的 ODE 轨迹初始化:用 ODE 轨迹而非一致性蒸馏初始化,一步生成就超越大量多步方案
4.2 Streaming DiT 的训练路线
Flow Matching 基础训练
+ 移动缓冲区
+ 混合分块策略
↓
多步蒸馏(每个分块独立蒸馏)
↓
NFE = 缓冲区分块数
关键设计:
- 移动缓冲区:训练时加入 progressive denoising,模拟推理时的流式场景
- 混合分块策略:不同 partitioning scheme 提升内容一致性和视觉质量
- 多变时间嵌入:varying time embedding + window attention,支持灵活的分块大小
五、性能对比
| 指标 | CausVid | Causal-rCM | One-Forcing | Streaming DiT |
|---|---|---|---|---|
| 初始延迟 | 1.3秒 | <1秒 | <1秒 | 取决于分块大小 |
| 生成速度 | 9.4 FPS | 实时 | 实时 | 实时 |
| 推理步数 | 4步 | 1-2步 | 1步 | 可蒸馏 |
| VBench 分数 | 84.27 | 84.63 | 84.63 | 待公布 |
| 基础模型 | Wan2.1-1.3B | Wan2.1-1.3B | Wan2.1-1.3B | 自研 4B |
| 硬件 | 单张 H100 | 单张 H100 | 单张 H100 | 未明确 |
One-Forcing 的一步生成表现:
- 超越 CausVid(4步,81.18分)
- 超越 LTX-Video(20步,80.00分)
- 超越 Pyramid Flow(20步,81.72分)
- 接近 Wan2.1 教师模型(50步,84.26分),仅差 0.5分
六、核心差异总结
| 差异点 | Causal 方案 | Streaming DiT 方案 |
|---|---|---|
| 哲学 | "边想边说" — 严格因果,只看过去 | "边看边说" — 缓冲区机制,可看上下文 |
| 时间约束 | 严格单向(因果掩码) | 软约束(缓冲区窗口) |
| 蒸馏目标 | 双向→因果→少步 | flow matching→分块蒸馏 |
| 误差控制 | KV缓存 + 参考帧锚定 | 缓冲区重叠 + 混合训练 |
| 交互能力 | 强(可随时修改提示词) | 中(缓冲区限制) |
| 适用场景 | 实时交互、游戏、直播 | 流媒体播放、长视频生成 |
七、技术路线演进
2024: CausVid(MIT+Adobe)
↓ 非对称DMD蒸馏,50步→4步,开启流式生成时代
2025: StreamDiT(Meta+Berkeley)
↓ 移动缓冲区+分块蒸馏,DiT架构的流式化
2026: Causal-rCM / Causal Forcing++ / One-Forcing(清华)
↓ 一致性蒸馏+因果约束,50步→1-2步,逼近实时极限
未来: 一步生成 + 物理一致性 + 世界模型
↓ 从"生成视频"到"模拟世界"
八、选择建议
| 场景 | 推荐方案 | 原因 |
|---|---|---|
| 实时交互/游戏 | Causal(1-2步) | 严格因果,可随时修改输入 |
| 直播/实时视频 | Causal(帧级) | 最低延迟,帧级响应 |
| 长视频流式生成 | Streaming DiT | 缓冲区机制更适合长序列 |
| 高质量离线生成 | 双向扩散 | 质量最高,无因果约束 |
| 数字人/口型同步 | Causal + 音频条件 | TalkingMachines 已验证 |
九、关键论文索引
| 论文 | 团队 | 链接 |
|---|---|---|
| CausVid | MIT + Adobe | arXiv:2412.07772 |
| StreamDiT | Meta + UC Berkeley | arXiv:2506.01348 |
| Causal-rCM | 清华 + 英伟达 | arXiv:2606.25473 |
| Causal Forcing++ | 清华 | arXiv:2605.15141 |
| One-Forcing | 清华 + UCLA | arXiv:2606.03251 |
| SAD | 武大 + 腾讯 | arXiv:2511.01419(ICLR 2026) |
| TalkingMachines | Character AI | 音频驱动视频会话 |
十、写在最后
2026年上半年,清华团队在因果视频生成方向取得了显著突破,基本实现了"一步生成高质量视频"的目标。从 CausVid 的4步到 One-Forcing 的1步,只用了不到两年时间。
核心洞察:
- 蒸馏是关键 — 没有蒸馏,因果模型无法在少步下保持质量
- 因果约束是双刃剑 — 保证了交互性,但增加了训练难度
- 缓冲区是折中 — Streaming DiT 用缓冲区换取了更灵活的生成策略
- 一步生成已接近极限 — One-Forcing 与50步教师模型仅差0.5分
视频生成正在从"离线创作工具"演变为"实时交互媒介",这两条技术路线的融合可能会催生下一代视频生成架构。