全部标签

#论文解读

11 篇文章

·多模态, 论文解读
1 分钟0

UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化

> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什

·多模态, 论文解读
1 分钟0

UMM论文解读01-基础奠基篇:从Transformer到VQGAN,七篇论文构建统一多模态的知识底座

> 本系列将 UMM(Unified Multimodal Model,理解与生成统一模型)学习路径中涉及的每一篇论文,逐一读取原文、提炼核心思想、标注关键贡献。第一篇聚焦 2017-2023 年间七篇奠基性工作,它们不是统一模型本身,却共同构成了今天所有统一模型的知识底座。 !UMM论文解读系

·多模态, 论文解读
1 分钟0

UMM论文解读03-主流模型篇:Janus-Pro、BAGEL、SenseNova U1的三种统一范式

> 如果说 2024 年夏天的四篇论文回答了"统一是否可行",那么 2025 至 2026 年的三篇代表作——DeepSeek Janus-Pro、字节 BAGEL、商汤 SenseNova U1——回答的是"统一能否匹敌甚至超越专用模型"。三条路线分别选择了解耦编码、MoT 双塔、去 VE/VAE

·多模态, 论文解读
1 分钟0

UMM论文解读04-VCoT篇:从Visual Sketchpad到CoT-VLA,视觉如何成为思维的载体

> Chain-of-Thought 让 LLM 能用文字"想一遍再答",但人类在解决空间、几何、导航等问题时,不只在脑中推理——我们会画辅助线、做标记、在纸上打草稿。Visual Chain-of-Thought(VCoT)研究的就是:能不能让多模态模型也用视觉信息做推理中间产物,而不仅限于文字?

·多模态, 论文解读
1 分钟0

UMM论文解读05-视频与世界模型篇:UniVideo双流统一、Emu3.5下一状态预测与Lance多任务协同

> 统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模态

·多模态, 论文解读
1 分钟0

UMM论文解读06-终章:从统一表征到AGI终局之战

> 前五篇我们逐一拆解了 UMM 的知识底座、早期探索、主流范式、视觉思维链,以及向视频与世界模型的延伸。终章不再解读某一篇论文,而是退到第一性原理,把"理解生成统一、全模态(Omni)、世界模型、具身智能"这四个高频词串成一条技术进化线,并追问:当通用能力栈成型之后,AGI 的终局之战究竟在哪里。