·多模态, 论文解读
1 分钟0
UMM论文解读03-主流模型篇:Janus-Pro、BAGEL、SenseNova U1的三种统一范式
> 如果说 2024 年夏天的四篇论文回答了"统一是否可行",那么 2025 至 2026 年的三篇代表作——DeepSeek Janus-Pro、字节 BAGEL、商汤 SenseNova U1——回答的是"统一能否匹敌甚至超越专用模型"。三条路线分别选择了解耦编码、MoT 双塔、去 VE/VAE
> 如果说 2024 年夏天的四篇论文回答了"统一是否可行",那么 2025 至 2026 年的三篇代表作——DeepSeek Janus-Pro、字节 BAGEL、商汤 SenseNova U1——回答的是"统一能否匹敌甚至超越专用模型"。三条路线分别选择了解耦编码、MoT 双塔、去 VE/VAE
理解与生成统一(Unified Multimodal Model, UMM)是 2024-2026 年多模态 AI 领域最活跃的研究方向之一。从 Meta 的 Chameleon 到字节的 BAGEL、商汤的 SenseNova U1,技术迭代以月为单位。本文给出一条从基础到前沿的完整学习路径,涵盖
引言 2026年4月,商汤科技发布并开源了 SenseNova U1 系列原生理解生成统一模型,首次完整展示了基于自研 NEO-unify 架构的原生统一多模态路线。四个月后的8月21日,商汤正式开源 SenseNova U1.5 Lite,从"验证架构是否可行"迈向"真实创作场景好用"。
项目概览 | 维度 | SenseNova-U1 | SenseNova-Vision | |---|---|---| | 全称 | Unifying Multimodal Understanding and Generation | Vision as Unified Multimodal