UMM 论文解读⑧:理解与生成的「协同真相」——南洋理工×商汤控变量实验揭示统一多模态模型是共赢还是内耗
「统一」本身不保证 1+1>2。什么时候共赢,什么时候内耗,这篇论文用三个层面的控变量实验给出了答案。
统一多模态模型(UMM,Unified Multimodal Model)把「视觉理解」和「视觉生成」塞进同一个模型,让文本和图片可以在同一序列里交错消费与产出。这是当下最有想象力的方向之一——但一个关键问题始终悬而未决:
理解与生成这两件事,在同一个模型里到底是互相促进、互抢资源,还是仅仅共存不互相打扰?
已有 UMM 论文大多只证明「两个能力都能跑起来」,却很少回答「联合训练到底改变了什么」。https://arxiv.org/pdf/2609.01607 这篇由 南洋理工大学 S-Lab(张子威 Ziwei Liu 团队)+ 商汤研究院(林达华 Dahua Lin) 合作的技术报告,第一次用原生多模态、像素进像素出的控变量设置,把这个问题从三个层面系统性拆开:
- 表征层(Representation):架构怎么决定了协同还是内耗?
- 任务层(Task):共享知识的任务能否双向迁移?
- 系统层(System):端到端统一 vs 分阶段拼装,谁更强?
结论非常清醒:理解与生成确实能互相提供有用信号,但这不自动变成收益——收益是「条件性」的,取决于架构、任务知识重叠度和优化方式。
一、为什么需要「控变量 + 原生设置」
1.1 问题的历史难点
要回答「理解和生成互相影响吗」,最大障碍是干扰因素太多。以往研究里,理解与生成的差异往往被这些原因污染:
- 用了预训练视觉主干(如 CLIP、SigLIP)或预训练图像编解码器(VAE);
- 加了专用模块 / 辅助损失 / 任务专属公式;
- 训练数据、基座语言模型不一致。
于是「到底是谁带来增益/损害」根本分不清。
1.2 原生设置的干净解法
这篇论文采用结构原生(structurally native)+ 像素进、像素出(pixel-in, pixel-out):
- 图片以原始 patch 进入,不带任何预训练视觉编码器;
- 图片直接由模型生成,没有 image tokenizer 或 VAE;
- 从同一个预训练语言模型出发(Qwen3-1.7B),只改架构路由和参数共享策略。
这样,视觉特征的变化只能来自「理解/生成联合训练」,而不是外部视觉先验。这是全文能得出可信结论的基础。
1.3 采用的建模配方
图片与文本的建模采用当前最成熟且强力的混合方案:
- 文本:自回归(causal)建模;
- 图片:每个生成图内部的视觉 token 用 flow matching 做双向去噪建模。
图片先经两层卷积(patch size 32)变成 patch token 进入 LLM decoder 层;文图序列整体因果注意力,同一图片内 token 双向互看;用 MRoPE-I 编码多模态位置、保留图片 2D 结构与预训练 LLM 的位置先验。
二、表征层:架构决定「共赢」还是「内耗」
作者先比较了两种路由设置(Figure 2a-b)。
2.1 Dense Sharing:理解受益,生成受损
最直接的设计——所有 token(文本、干净的理解视觉 token、加噪的生成视觉 token)都走同一套 LLM 层,最大限度共享参数。
训练三个配对变体:仅理解(UND)、仅生成(GEN)、理解+生成(UND+GEN)。
结果(Table 1 第 1-2 行):
| 训练 | General | OCR | V-Centric & SI | GenEval2 | DPG | HPSv3 | Aesthetic |
|---|---|---|---|---|---|---|---|
| 仅理解 | 67.82 | 71.96 | 60.72 | 51.16 | 79.11 | 7.05 | 5.12 |
| 理解+生成 | 68.69 | 72.12 | 61.77 | 51.03 | 78.12 | 5.92 | 4.94 |
联合训练让理解全面小幅提升(尤其视觉中心 + 空间智能类),但生成绩效明显降低——不对称。
为什么?作者用逐层探针(冻结主干上用 ImageNet 分类、ADE20K 分割、NYU-Depth 深度估计)和 PCA 特征可视化发现:生成监督确实加强了用于理解的视觉表征(早期与中层语义、几何信息提升最明显),一致呼应"生成训练能学到通用视觉表征"的观察。
但 Dense 设置下,预训练 LLM 是极强的「语义锚」,让理解主导了共享特征空间;生成沦为有用的辅助约束(正则),自己的真实能力却在共享参数竞争中被削弱。
诊断:不是生成没贡献,而是当两个目标被迫走同一条计算路径时,强者通吃、弱者沦为陪跑。
2.2 Modality-Decoupled MOT:生成受益,理解受损
第二种设置按 MOT(混合模态 Transformer) 的 token 路由原则解耦:
- 预训练分支只处理文本;
- 从头训练的平行分支处理所有视觉 token(理解 UND-V + 生成 GEN-V);
- 两条分支对交错序列保持全局注意力。
结果(Table 1 第 3-4 行):
| 训练 | General | OCR | V-Centric & SI | GenEval2 | DPG | HPSv3 | Aesthetic |
|---|---|---|---|---|---|---|---|
| 仅理解 | 64.20 | 66.84 | 59.54 | 57.55 | 82.06 | 7.72 | 5.37 |
| 理解+生成 | 61.58 | 62.11 | 57.49 | 63.47 | 83.09 | 7.97 | 5.48 |
正好反过来:联合训练让生成显著提升,但理解全面下降。在这个设置里,生成主导了共享视觉计算,理解只作为辅助监督。
而且,解耦后的「仅理解」模型比 Dense 的「仅理解」明显更差(尤其 General 和 OCR)——说明依赖强图文对齐的任务,用共享参数处理文图 token 比分离到不同分支更有效。
作者用层间线性 CKA 测量(语言分支文本特征 vs 视觉分支生成图像特征,COCO 5000 对)发现:联合训练比仅生成训练产生持续更高的 文-图 CKA。也就是说,理解监督通过让生成的视觉表征与语言语义更好对齐来帮助生成。
诊断:这里又反过来了——把视觉完全搬到独立分支后,是理解在「陪跑」,生成在主导。每次都是「一个目标成为另一个的辅助项」,只是谁主导不同。
2.3 Task-Decoupled MOT:第三种设计,破局
两种失败的相反方向,催生了第三个设计(Figure 2c)——任务解耦 MOT:
- 文本 + 干净图片 token(理解 / 作为上下文)→ 走预训练 LLM 分支;
- 加噪图片 token(生成)→ 走生成专用视觉分支。
理解保留对预训练语言语义的直访;生成获得为生成目标专门化的参数。两条分支通过两种方式软对齐:
- 它们注意力到相同的文本特征,共享语义上下文;
- 编辑 / 交错样本里,理解分支的上下文图通过每层共享注意力作为生成分支的条件。
为加强连接,训练混合里额外分配 20% 的图像重建任务(以图像编辑形式):目标图取自文生图数据,对应上下文图随机遮掉 50% 视觉 token。
【Finding 1】结果(Table 1 第 5 行):任务解耦 MOT 同时拿到最好的理解(68.69/72.09/62.38)与最好的生成(63.96/82.31/7.90/5.50),避免了前两种的相反取舍。
表征层结论:干扰不是「统一」的宿命。当两个目标的视觉计算彼此冲突时,就专门化计算;但保留语义交互通路——这样两个能力都能进步,谁也不吞了谁。作者不认为这是唯一解,还提示 MoE 之类的条件路由同样可能达成「专门化 + 共享」的平衡。
三、任务层:共享知识让理解生成双向共赢
拿到了不冲突的模型后,作者问:当理解和生成依赖同样的领域知识与技能时,一个方向的监督能提升另一个方向吗? 三个案例研究。
方法学细节:三个案例都让训练混合的 50% 是通用数据(移除目标领域相关部分),另 50% 是对应的任务理解+生成数据——既保通用能力,又防止重叠辅助数据污染任务级比较。
3.1 Case I:几何题求解 + 几何图形生成
几何题要识图、找关系;画图/编辑几何图要构建满足同一结构的视觉内容——两方向部分共享领域知识。
- 理解侧:965K 几何题 + 通用数学推理数据;
- 生成侧:MATHCANVAS-IMAGEN(文生图)+ MATHCANVAS-EDIT(几何图编辑);
- 关键对照:把同样的生成数据改写成「理解格式」(文生图对 → 图像描述任务,编辑对 → 描述转换任务),构成 Textual-Desc 基线——控制数据源,只改变「通过文本预测」而非「通过图像生成」来学习。
结果(Table 2):
| 训练 | Geometry3K | PGPS9K | MathVerse | MathVista |
|---|---|---|---|---|
| 仅理解 | 59.90 | 72.40 | 60.13 | 71.80 |
| 理解+文本描述 | 63.56 | 73.90 | 59.11 | 73.60 |
| 理解+生成 | 65.39 | 73.40 | 63.15 | 74.30 |
加生成目标在全部四个基准上都提升理解,收益还外溢到通用数学推理。而把同样数据改成文本描述,增益更小且更不稳定——证明增益不只是「多喂了几何数据」,而是「学会生成/编辑图」本身是比「写描述」更有效的辅助监督方式。
3.2 Case II:SVG 理解与生成
SVG 天然双向:同一个图标既能看作渲染图,也能看作可执行向量程序。用 UniSVG 的 359K 图-码对构造理解与生成数据。
结果(Table 3):
| 训练 | 图→SVG 码 | SVG 码→图 |
|---|---|---|
| 单方向 | 80.64 | 80.21 |
| 联合训练 | 81.70 | 86.52 |
双向都提升。作者用两个诊断验证假设——联合训练加强了「从 SVG 码直接脑内成像」的能力:
- 盲 VQA:只给 SVG 程序(不给渲染图),问程序隐含的视觉样貌,答案无法靠表面读 tag/属性获得,必须脑内执行路径渲染、几何变换、分组、分层等操作;
- 只看第一步生成后的干净图:验证模型多快从码形成全局视觉规划。
两者都证明 UND+GEN 更强——联合训练增强了一个内化的、视觉化的 SVG 执行模拟器。
3.3 Case III:3D 空间智能
扩展到更普适的 3D 空间智能(对具身智能、交互世界建模很关键)。虽然理解与生成任务不是精确的输入输出互逆,但共享「感知与理解 3D 空间」的底层能力。
- 理解侧:单图/多图/视频的 3D VQA(空间关系、视角推理、深度、相机运动);
- 生成侧 四个任务:
- Ego-motion Transition(自运动迁移):据源帧 + 自运动描述预测目标帧(SpatialEdit-500K + 自建 1.6M Scannet/Scannet++ 样本);
- Multi-view Reconstruction(多视角重建):给定物体若干视角推测另一视角(Objaverse 248K 样本,前后左右视角随机取 2 当 context、1 当 target);
- View Sequence Completion 视角序列补全(5 帧序列给首尾各 2 帧预测中帧,Scannet/Scannet++/ARKitScenes 880K 样本);
- Layout-to-image 布局生图:用结构表征(每物体大小 + 相对相机的 3D 位置)或自然语言描述 3D 结构生成图(Omni3D 332K 样本)。
理解结果(Table 4):联合训练在 9 个基准里提升 8 个,平均 57.15 → 59.01。生成结果(Table 5):Spatial-Edit 两个误差都降(VE 0.4062→0.3766,FE 0.6564→0.6297),VSC 三个指标全提升(PSNR 16.76→19.15,SSIM 0.6365→0.6674,LPIPS 0.3828→0.3078)。
【Finding 2】:共享底层知识/能力,让理解和生成任务互相加强。 作者点出一个自然的延伸——世界建模 + 策略/动作学习:理解当前状态、预测未来观测、生成动作,都依赖同一个物理世界模型。
四、系统层:端到端统一 > 拼装流水线
最后一个层面:那些必须同时用到理解与生成的复杂任务,是不是非统一模型不可?还是可以拆成「理解模型 + 生成模型」的智能体流水线?
选 推理密集型图像编辑(reasoning-intensive image editing):给源图和隐含编辑请求,系统要①理解源图、②推理出具体编辑意图、③生成目标图。
4.1 受控对比设置
从同一个 task-decoupled MOT 检查点初始化,把同一批推理编辑样本转成三种训练格式:
- 端到端:源图+隐含指令 → 推理出显式编辑指令 → 生成目标图;
- 理解/规划(planner):源图+隐含指令 → 只输出显式编辑指令;
- 生成/执行(executor):源图+隐含指令+显式编辑指令 → 生成目标图。
推理时,智能体流水线 = planner + executor 组合;端到端 = 格式 (1) 单模型全流程。
4.2 结果(RISEBench + KRIS-Bench)
| 系统 | RISE Temporal | RISE Causal | RISE Spatial | RISE Logical | RISE Overall | KRIS Factual | KRIS Conceptual | KRIS Procedural | KRIS Overall |
|---|---|---|---|---|---|---|---|---|---|
| Planner→Executor | 18.82 | 22.22 | 14.00 | 11.76 | 16.66 | 61.40 | 71.17 | 64.58 | 66.48 |
| 端到端 UMM | 22.35 | 27.77 | 16.00 | 9.41 | 18.88 | 64.73 | 72.32 | 66.16 | 68.33 |
【Finding 3】:端到端 UMM 在两个基准上整体都胜过 planner–executor 流水线(尤其 Temporal +9.36、Causal +11.11 这类强因果推理维度)。在匹配的基座模型和任务数据下证明:当理解、推理、生成必须紧密交互时,把完整过程学在一个统一模型里,比拼装两个能力更有效。
未来方向:把更广的智能体生成过程(多模态搜索+生成、迭代视觉精修)内化为 UMM 的原生能力,让更复杂的任务在统一模型里端到端学会、端到端完成。
五、我的判断
- 这篇的价值在于「诊断框架」,而非某张 SOTA 表格。它第一次把「统一到底带来什么」拆成表征/任务/系统三层,每层都给了一个可操作的结论:表征层要按任务专门化计算但保留语义交互;任务层要挑共享知识的任务做联合学习;系统层要端到端整学紧密交互的任务。这比堆分数对做模型的团队更有指导性。
- 「像素进像素出」的控变量设计是全文可信度的根基。去掉预训练视觉编码器和 VAE,才敢说观测到的变化来自联合训练本身。配合从同一 LLM 初始化的三套路由对照,逻辑闭环很干净。
- 最有含金量的实验是几何那个 Textual-Desc 对照。它直接反驳了"增益不过是多喂了数据"这种廉价解释——同样的数据,走「生成」就比走「文本描述」更有效,证明生成这一目标本身携带了理解学不到的结构化监督。
- 和 SenseNova-U1 / Janus 等的关系:这篇与商汤 SenseNova-U1 同源,用的正是其数据(理解+生成流),算是对 SenseNova-U1 那类统一范式的科学化复盘——不止是做了个模型,而是回答「为什么这么拆」。和 Emu3、Chameleon 等早期路线相比,它也解释了为什么简单粗暴的 Dense 全共享会有内耗。
- 落地洞察:做统一模型的团队常常纠结「要不要共享参数」。这篇的答案是辩证的——看两个目标的视觉计算是否冲突。冲突就专门化,不冲突就共享;再配合「共享任务知识」的数据设计和「端到端整学紧密任务」的系统决策。一句话:统一不是目的,协同才是——而协同需要架构、数据、系统三层同时给对条件。
一手来源
- 论文:Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System(arXiv:2609.01607v1,2026-09-01)
- 团队:南洋理工大学 S-Lab(Penghao Wu、Haiwen Diao、Weichen Fan、Ziwei Liu)× 商汤研究院(Lewei Lu、Dahua Lin)
- 项目:UMM 论文解读系列(本系列第 08 篇,order 9)