All Tags

#UniVideo

1 篇文章

·多模态, 论文解读
1 分钟0

UMM论文解读05-视频与世界模型篇:UniVideo的双流统一与Emu3.5的下一状态预测

> 统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 则把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模