Back

UMM论文解读08-理解与生成的协同真相-南洋理工商汤控变量实验揭示统一多模态模型是共赢还是内耗

UMM 论文解读⑧:理解与生成的「协同真相」——南洋理工×商汤控变量实验揭示统一多模态模型是共赢还是内耗

「统一」本身不保证 1+1>2。什么时候共赢,什么时候内耗,这篇论文用三个层面的控变量实验给出了答案。

统一多模态模型(UMM,Unified Multimodal Model)把「视觉理解」和「视觉生成」塞进同一个模型,让文本和图片可以在同一序列里交错消费与产出。这是当下最有想象力的方向之一——但一个关键问题始终悬而未决:

理解与生成这两件事,在同一个模型里到底是互相促进、互抢资源,还是仅仅共存不互相打扰?

已有 UMM 论文大多只证明「两个能力都能跑起来」,却很少回答「联合训练到底改变了什么」。https://arxiv.org/pdf/2609.01607 这篇由 南洋理工大学 S-Lab(张子威 Ziwei Liu 团队)+ 商汤研究院(林达华 Dahua Lin) 合作的技术报告,第一次用原生多模态、像素进像素出的控变量设置,把这个问题从三个层面系统性拆开:

  • 表征层(Representation):架构怎么决定了协同还是内耗?
  • 任务层(Task):共享知识的任务能否双向迁移?
  • 系统层(System):端到端统一 vs 分阶段拼装,谁更强?

结论非常清醒:理解与生成确实能互相提供有用信号,但这不自动变成收益——收益是「条件性」的,取决于架构、任务知识重叠度和优化方式。


一、为什么需要「控变量 + 原生设置」

1.1 问题的历史难点

要回答「理解和生成互相影响吗」,最大障碍是干扰因素太多。以往研究里,理解与生成的差异往往被这些原因污染:

  • 用了预训练视觉主干(如 CLIP、SigLIP)或预训练图像编解码器(VAE)
  • 加了专用模块 / 辅助损失 / 任务专属公式
  • 训练数据、基座语言模型不一致。

于是「到底是谁带来增益/损害」根本分不清。

1.2 原生设置的干净解法

这篇论文采用结构原生(structurally native)+ 像素进、像素出(pixel-in, pixel-out)

  • 图片以原始 patch 进入,不带任何预训练视觉编码器
  • 图片直接由模型生成,没有 image tokenizer 或 VAE
  • 同一个预训练语言模型出发(Qwen3-1.7B),只改架构路由和参数共享策略。

这样,视觉特征的变化只能来自「理解/生成联合训练」,而不是外部视觉先验。这是全文能得出可信结论的基础。

1.3 采用的建模配方

图片与文本的建模采用当前最成熟且强力的混合方案:

  • 文本:自回归(causal)建模;
  • 图片:每个生成图内部的视觉 token 用 flow matching 做双向去噪建模。

图片先经两层卷积(patch size 32)变成 patch token 进入 LLM decoder 层;文图序列整体因果注意力,同一图片内 token 双向互看;用 MRoPE-I 编码多模态位置、保留图片 2D 结构与预训练 LLM 的位置先验。


二、表征层:架构决定「共赢」还是「内耗」

作者先比较了两种路由设置(Figure 2a-b)。

2.1 Dense Sharing:理解受益,生成受损

最直接的设计——所有 token(文本、干净的理解视觉 token、加噪的生成视觉 token)都走同一套 LLM 层,最大限度共享参数。

训练三个配对变体:仅理解(UND)、仅生成(GEN)、理解+生成(UND+GEN)。

结果(Table 1 第 1-2 行)

训练 General OCR V-Centric & SI GenEval2 DPG HPSv3 Aesthetic
仅理解 67.82 71.96 60.72 51.16 79.11 7.05 5.12
理解+生成 68.69 72.12 61.77 51.03 78.12 5.92 4.94

联合训练让理解全面小幅提升(尤其视觉中心 + 空间智能类),但生成绩效明显降低——不对称。

为什么?作者用逐层探针(冻结主干上用 ImageNet 分类、ADE20K 分割、NYU-Depth 深度估计)和 PCA 特征可视化发现:生成监督确实加强了用于理解的视觉表征(早期与中层语义、几何信息提升最明显),一致呼应"生成训练能学到通用视觉表征"的观察。

但 Dense 设置下,预训练 LLM 是极强的「语义锚」,让理解主导了共享特征空间;生成沦为有用的辅助约束(正则),自己的真实能力却在共享参数竞争中被削弱。

诊断:不是生成没贡献,而是当两个目标被迫走同一条计算路径时,强者通吃、弱者沦为陪跑。

2.2 Modality-Decoupled MOT:生成受益,理解受损

第二种设置按 MOT(混合模态 Transformer) 的 token 路由原则解耦:

  • 预训练分支只处理文本
  • 从头训练的平行分支处理所有视觉 token(理解 UND-V + 生成 GEN-V);
  • 两条分支对交错序列保持全局注意力。

结果(Table 1 第 3-4 行)

训练 General OCR V-Centric & SI GenEval2 DPG HPSv3 Aesthetic
仅理解 64.20 66.84 59.54 57.55 82.06 7.72 5.37
理解+生成 61.58 62.11 57.49 63.47 83.09 7.97 5.48

正好反过来:联合训练让生成显著提升,但理解全面下降。在这个设置里,生成主导了共享视觉计算,理解只作为辅助监督。

而且,解耦后的「仅理解」模型比 Dense 的「仅理解」明显更差(尤其 General 和 OCR)——说明依赖强图文对齐的任务,用共享参数处理文图 token 比分离到不同分支更有效

作者用层间线性 CKA 测量(语言分支文本特征 vs 视觉分支生成图像特征,COCO 5000 对)发现:联合训练比仅生成训练产生持续更高的 文-图 CKA。也就是说,理解监督通过让生成的视觉表征与语言语义更好对齐来帮助生成。

诊断:这里又反过来了——把视觉完全搬到独立分支后,是理解在「陪跑」,生成在主导。每次都是「一个目标成为另一个的辅助项」,只是谁主导不同。

2.3 Task-Decoupled MOT:第三种设计,破局

两种失败的相反方向,催生了第三个设计(Figure 2c)——任务解耦 MOT

  • 文本 + 干净图片 token(理解 / 作为上下文)→ 走预训练 LLM 分支;
  • 加噪图片 token(生成)→ 走生成专用视觉分支。

理解保留对预训练语言语义的直访;生成获得为生成目标专门化的参数。两条分支通过两种方式软对齐:

  1. 它们注意力到相同的文本特征,共享语义上下文;
  2. 编辑 / 交错样本里,理解分支的上下文图通过每层共享注意力作为生成分支的条件

为加强连接,训练混合里额外分配 20% 的图像重建任务(以图像编辑形式):目标图取自文生图数据,对应上下文图随机遮掉 50% 视觉 token。

【Finding 1】结果(Table 1 第 5 行):任务解耦 MOT 同时拿到最好的理解(68.69/72.09/62.38)与最好的生成(63.96/82.31/7.90/5.50),避免了前两种的相反取舍

表征层结论:干扰不是「统一」的宿命。当两个目标的视觉计算彼此冲突时,就专门化计算;但保留语义交互通路——这样两个能力都能进步,谁也不吞了谁。作者不认为这是唯一解,还提示 MoE 之类的条件路由同样可能达成「专门化 + 共享」的平衡。


三、任务层:共享知识让理解生成双向共赢

拿到了不冲突的模型后,作者问:当理解和生成依赖同样的领域知识与技能时,一个方向的监督能提升另一个方向吗? 三个案例研究。

方法学细节:三个案例都让训练混合的 50% 是通用数据(移除目标领域相关部分),另 50% 是对应的任务理解+生成数据——既保通用能力,又防止重叠辅助数据污染任务级比较。

3.1 Case I:几何题求解 + 几何图形生成

几何题要识图、找关系;画图/编辑几何图要构建满足同一结构的视觉内容——两方向部分共享领域知识

  • 理解侧:965K 几何题 + 通用数学推理数据;
  • 生成侧:MATHCANVAS-IMAGEN(文生图)+ MATHCANVAS-EDIT(几何图编辑);
  • 关键对照:把同样的生成数据改写成「理解格式」(文生图对 → 图像描述任务,编辑对 → 描述转换任务),构成 Textual-Desc 基线——控制数据源,只改变「通过文本预测」而非「通过图像生成」来学习。

结果(Table 2)

训练 Geometry3K PGPS9K MathVerse MathVista
仅理解 59.90 72.40 60.13 71.80
理解+文本描述 63.56 73.90 59.11 73.60
理解+生成 65.39 73.40 63.15 74.30

加生成目标在全部四个基准上都提升理解,收益还外溢到通用数学推理。而把同样数据改成文本描述,增益更小且更不稳定——证明增益不只是「多喂了几何数据」,而是「学会生成/编辑图」本身是比「写描述」更有效的辅助监督方式。

3.2 Case II:SVG 理解与生成

SVG 天然双向:同一个图标既能看作渲染图,也能看作可执行向量程序。用 UniSVG 的 359K 图-码对构造理解与生成数据。

结果(Table 3)

训练 图→SVG 码 SVG 码→图
单方向 80.64 80.21
联合训练 81.70 86.52

双向都提升。作者用两个诊断验证假设——联合训练加强了「从 SVG 码直接脑内成像」的能力:

  1. 盲 VQA:只给 SVG 程序(不给渲染图),问程序隐含的视觉样貌,答案无法靠表面读 tag/属性获得,必须脑内执行路径渲染、几何变换、分组、分层等操作;
  2. 只看第一步生成后的干净图:验证模型多快从码形成全局视觉规划。

两者都证明 UND+GEN 更强——联合训练增强了一个内化的、视觉化的 SVG 执行模拟器

3.3 Case III:3D 空间智能

扩展到更普适的 3D 空间智能(对具身智能、交互世界建模很关键)。虽然理解与生成任务不是精确的输入输出互逆,但共享「感知与理解 3D 空间」的底层能力

  • 理解侧:单图/多图/视频的 3D VQA(空间关系、视角推理、深度、相机运动);
  • 生成侧 四个任务:
    • Ego-motion Transition(自运动迁移):据源帧 + 自运动描述预测目标帧(SpatialEdit-500K + 自建 1.6M Scannet/Scannet++ 样本);
    • Multi-view Reconstruction(多视角重建):给定物体若干视角推测另一视角(Objaverse 248K 样本,前后左右视角随机取 2 当 context、1 当 target);
    • View Sequence Completion 视角序列补全(5 帧序列给首尾各 2 帧预测中帧,Scannet/Scannet++/ARKitScenes 880K 样本);
    • Layout-to-image 布局生图:用结构表征(每物体大小 + 相对相机的 3D 位置)或自然语言描述 3D 结构生成图(Omni3D 332K 样本)。

理解结果(Table 4):联合训练在 9 个基准里提升 8 个,平均 57.15 → 59.01。生成结果(Table 5):Spatial-Edit 两个误差都降(VE 0.4062→0.3766,FE 0.6564→0.6297),VSC 三个指标全提升(PSNR 16.76→19.15,SSIM 0.6365→0.6674,LPIPS 0.3828→0.3078)。

【Finding 2】共享底层知识/能力,让理解和生成任务互相加强。 作者点出一个自然的延伸——世界建模 + 策略/动作学习:理解当前状态、预测未来观测、生成动作,都依赖同一个物理世界模型。


四、系统层:端到端统一 > 拼装流水线

最后一个层面:那些必须同时用到理解与生成的复杂任务,是不是非统一模型不可?还是可以拆成「理解模型 + 生成模型」的智能体流水线?

推理密集型图像编辑(reasoning-intensive image editing):给源图和隐含编辑请求,系统要①理解源图、②推理出具体编辑意图、③生成目标图。

4.1 受控对比设置

同一个 task-decoupled MOT 检查点初始化,把同一批推理编辑样本转成三种训练格式:

  1. 端到端:源图+隐含指令 → 推理出显式编辑指令 → 生成目标图;
  2. 理解/规划(planner):源图+隐含指令 → 只输出显式编辑指令;
  3. 生成/执行(executor):源图+隐含指令+显式编辑指令 → 生成目标图。

推理时,智能体流水线 = planner + executor 组合;端到端 = 格式 (1) 单模型全流程。

4.2 结果(RISEBench + KRIS-Bench)

系统 RISE Temporal RISE Causal RISE Spatial RISE Logical RISE Overall KRIS Factual KRIS Conceptual KRIS Procedural KRIS Overall
Planner→Executor 18.82 22.22 14.00 11.76 16.66 61.40 71.17 64.58 66.48
端到端 UMM 22.35 27.77 16.00 9.41 18.88 64.73 72.32 66.16 68.33

【Finding 3】:端到端 UMM 在两个基准上整体都胜过 planner–executor 流水线(尤其 Temporal +9.36、Causal +11.11 这类强因果推理维度)。在匹配的基座模型和任务数据下证明:当理解、推理、生成必须紧密交互时,把完整过程学在一个统一模型里,比拼装两个能力更有效。

未来方向:把更广的智能体生成过程(多模态搜索+生成、迭代视觉精修)内化为 UMM 的原生能力,让更复杂的任务在统一模型里端到端学会、端到端完成。


五、我的判断

  • 这篇的价值在于「诊断框架」,而非某张 SOTA 表格。它第一次把「统一到底带来什么」拆成表征/任务/系统三层,每层都给了一个可操作的结论:表征层要按任务专门化计算但保留语义交互;任务层要挑共享知识的任务做联合学习;系统层要端到端整学紧密交互的任务。这比堆分数对做模型的团队更有指导性。
  • 「像素进像素出」的控变量设计是全文可信度的根基。去掉预训练视觉编码器和 VAE,才敢说观测到的变化来自联合训练本身。配合从同一 LLM 初始化的三套路由对照,逻辑闭环很干净。
  • 最有含金量的实验是几何那个 Textual-Desc 对照。它直接反驳了"增益不过是多喂了数据"这种廉价解释——同样的数据,走「生成」就比走「文本描述」更有效,证明生成这一目标本身携带了理解学不到的结构化监督
  • 和 SenseNova-U1 / Janus 等的关系:这篇与商汤 SenseNova-U1 同源,用的正是其数据(理解+生成流),算是对 SenseNova-U1 那类统一范式的科学化复盘——不止是做了个模型,而是回答「为什么这么拆」。和 Emu3、Chameleon 等早期路线相比,它也解释了为什么简单粗暴的 Dense 全共享会有内耗。
  • 落地洞察:做统一模型的团队常常纠结「要不要共享参数」。这篇的答案是辩证的——看两个目标的视觉计算是否冲突。冲突就专门化,不冲突就共享;再配合「共享任务知识」的数据设计和「端到端整学紧密任务」的系统决策。一句话:统一不是目的,协同才是——而协同需要架构、数据、系统三层同时给对条件。

一手来源

  • 论文:Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System(arXiv:2609.01607v1,2026-09-01)
  • 团队:南洋理工大学 S-Lab(Penghao Wu、Haiwen Diao、Weichen Fan、Ziwei Liu)× 商汤研究院(Lewei Lu、Dahua Lin)
  • 项目:UMM 论文解读系列(本系列第 08 篇,order 9)

评论