前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什么",真正把潜力变成能力的,是预训练之后的那一阶段——后训练(Post-training)。2025 年中之后,一个清晰的共识浮现:统一模型的理解能力和生成能力之间存在不对称——它"看得出图哪里不对,却画不出对的图",而填补这个 gap 最有效的方式,不是继续堆预训练,而是用强化学习和自监督把模型内部的理解能力,转化为生成的监督信号。这一篇,我们系统拆解 UMM 后训练的四条技术路线,以及它们共同指向的那个结论:统一模型最独特的优势,是可以当自己的老师。

系列导航
- 01 基础奠基篇:Transformer、CLIP、LLaVA、DDPM、DiT、VQ-VAE、VQGAN
- 02 早期统一模型篇:Chameleon、Emu3、Transfusion、Show-o
- 03 主流模型篇:Janus-Pro、BAGEL、SenseNova U1
- 04 VCoT 篇:CoVT、Gen-VCoT、Visual Sketchpad、Visual-Aware CoT、CoT-VLA、LatentUM
- 05 视频与世界模型篇:UniVideo、Emu3.5、Lance
- 06 终章:从统一表征到 AGI 终局之战
- 07 后训练篇(本文):从 GRPO 联合强化到自奖励闭环
一、为什么后训练突然成了 UMM 的焦点
1.1 一个反直觉的不对称
2025 年中,多个团队在不同 UMM 上观察到同一个现象:
模型能准确判断"这张图和 prompt 是否对齐",却无法根据同一个 prompt 生成对齐的图。
以 BAGEL 为例(AlphaGRPO 的 pilot study):让它判断一张生成图"有没有错误"(Verification),它倾向于说"没问题",连明显的阴影、属性绑定错误都漏判;但只要换个说法——"假设这张图有错,找出错误"(Reflection)——它立刻能挑出问题。理解能力是存在的,只是被**确认偏误(confirmation bias)**压住了:模型一旦生成了内容,就倾向于为自己的产出辩护。
这说明:**理解能力在预训练阶段已经学会,只是没有被有效地"调用"来约束生成。**后训练要做的,就是打通这条从理解到生成的反馈通道。
1.2 后训练 vs 预训练:分工的转变
| 阶段 | 解决什么 | 数据 | 算力 | 代表方法 |
|---|---|---|---|---|
| 预训练 | 学会世界知识、表征、基元(primitives) | 万亿级图文/交错数据 | 千卡-万卡 | Next-token prediction、flow matching |
| 后训练 | 对齐人类意图、激发推理、把理解转化为生成约束 | 千-十万级 prompt/偏好对 | 8-128 卡 | SFT、DPO、GRPO、自奖励 |
预训练是"通识教育",后训练是"临床实习"。R1 在 LLM 上证明了一件事:基元在预训练里已经沉睡,纯 RL 可以把它唤醒,不需要冷启动 SFT。UMM 后训练的多条路线,本质上都在多模态生成上复现这个命题,只是对"谁来当裁判、用什么当奖励"给出了不同答案。
1.3 统一模型的后训练,为什么拼接模型做不到
这是理解整篇的关键。一个拼接架构(CLIP ViT 编码器 + LLM + 独立 DiT 生成器)也能做生成侧 RL(DanceGRPO/Flow-GRPO 就是这么干的),但它做不到自奖励——因为它的理解模块和生成模块是两套独立网络,理解模块的梯度无法直接回传给生成模块。
而原生 UMM(BAGEL、Janus、Show-o)的理解分支和生成分支共享主干注意力,这意味着:
- 理解分支"看图打分"的计算图,可以和生成分支"画这张图"的计算图连起来;
- 模型可以用自己的理解能力,当自己生成结果的裁判,形成闭环;
- 这是拼接架构在物理上无法实现的结构性优势。
记住这一点,后面所有路线的差异都围绕一个问题展开:这个"内部裁判"怎么用,才既有效又稳定。
二、先修:GRPO 为什么是后训练的默认算法
在进入四条路线前,必须先讲清 GRPO(Group Relative Policy Optimization),因为它是这一波 UMM 后训练的共同底座。
2.1 从 PPO 到 GRPO:去掉价值网络
PPO 是 RLHF 的经典算法,但它需要一个额外的 critic(价值网络)来估计每个 token 的基线,这个网络和策略网络一样大,显存翻倍。GRPO 的核心改动极简:
不用 critic,而是对同一个问题采样一组(group,通常 8-16 个)回答,用这组回答的奖励均值/标准差作为基线。
问题 q ──► 采样 G 个回答 {y_1,...,y_G}
│
▼
每个回答得奖励 r_i
│
▼
组内归一化优势 Â_i = (r_i - μ_r) / σ_r
│
▼
PPO-clip 目标,按 token 加权求和
这就是 DeepSeekMath/R1 用的算法。省掉 critic、实现简单、训练稳定,是它迅速成为 LLM/MLLM/生成模型 RL 默认选择的原因。
2.2 GRPO 从离散文本到连续图像
GRPO 最初为离散 token 设计。2025 年两篇工作把它拓展到连续视觉生成,奠定了 UMM 生成侧 RL 的基础:
- DanceGRPO(Xue et al., arXiv:2505.07818,2025.05):第一个把 GRPO 适配到视觉生成的统一框架,覆盖 T2I/T2V/I2V、四个基座(SD/HunyuanVideo/FLUX/SkyReel-I2V)、五种奖励。它把整个去噪/采样轨迹视为多步决策,每步计算策略梯度。
- Flow-GRPO(Liu et al., 2025a):把 GRPO 用于 flow matching 模型。
但这里有个技术障碍:flow matching 默认用确定性 ODE 采样(欧拉积分),没有噪声就没法做 group 探索。Flow-GRPO 的解法是用 Euler-Maruyama 离散化把 ODE 转成 SDE:
z_{t-Δt} = μ_θ(z_t) + σ_t·√(Δt)·ε, ε ~ N(0,I)
▲
└─ 注入高斯噪声,让策略变成高斯分布
于是策略可解析写成 π_θ(z_{t-Δt}|z_t) = N(μ_θ, σ_t²Δt·I),概率比就是两个高斯的密度比,而且 KL 散度可以闭式计算(速度场的加权 L2 距离):
D_KL(π_θ || π_ref) = w_t · ‖v_θ(z_t) - v_ref(z_t)‖²
这个闭式 KL 是后续所有 AR-Diffusion UMM 的 RL 工作(包括 AlphaGRPO)的技术基石。它让在连续生成轨迹上做 GRPO,和在离散 token 上一样干净。
📌 如果你对 flow matching 本身还不熟悉,参见 01 篇"从扩散到 Flow Matching"专题。
三、四条后训练路线总览
2025-2026 年的 UMM 后训练工作,可以按"奖励从哪来"清晰地分成四条路线:
奖励信号来源
│
┌────────────────┼────────────────┐
│ │ │
外部可验证奖励 模型自身理解 自博弈/自蒸馏
(强裁判) (自奖励闭环) (多角色)
│ │ │
AlphaGRPO SRUM UniCorn
CoRL SpectraReward Ask-Solve-Generate
(联合RL) UniRL
│ │ │
└────────────────┼────────────────┘
│
SFT 数据驱动
(高质量推理轨迹蒸馏)
│
IRG
| 路线 | 核心思想 | 外部依赖 | 代表论文 |
|---|---|---|---|
| A. GRPO 联合强化 | 用 GRPO 同时优化理解+生成,外部可验证奖励 | 需 prompt 数据+外部裁判 | CoRL、AlphaGRPO、Unified-GRPO |
| B. 自奖励闭环 | 模型自身理解分支当生成的裁判,无需外部奖励模型 | 几乎无外部依赖 | SRUM、SpectraReward、UniRL |
| C. 自博弈/自蒸馏 | 把单模型拆成多角色,自己出题-答题-评估 | 无外部监督 | UniCorn、Ask-Solve-Generate |
| D. SFT 交错推理 | 用高质量"思考-画图-反思-重画"轨迹做监督微调 | 需大规模蒸馏数据 | IRG |
下面逐一拆解。
四、路线 A:GRPO 联合强化
4.1 CoRL / ULM-R1:第一个吃螃蟹的(2025.05,NeurIPS 2025)
- 论文:Co-Reinforcement Learning for Unified Multimodal Understanding and Generation(arXiv:2505.17534)
- 机构:上海交大、NTU;作者 Jingjing Jiang、Hanwang Zhang、Chao Ma 等
- 代码:github.com/mm-vl/ULM-R1
核心贡献:首次系统证明 GRPO 可以在统一模型上同时提升理解和生成,而且两者能互相放大。
CoRL 分两阶段:
- Unified RL 阶段:把理解任务(如 VQA)和生成任务(T2I)混在同一个 GRPO 训练里,共享一个策略网络。关键发现是:联合训练比单独训练任一任务都好——理解能力强了,生成的语义对齐跟着好;生成训练又反过来增强细粒度视觉感知。
- Refined RL 阶段:针对具体任务做特化强化。
结果:三个 T2I 数据集平均 +7%,九个理解 benchmark 平均 +23%。理解侧的巨大增益是这篇论文最引人注目的数字——它说明生成侧的 RL 训练不仅不损害理解,反而通过共享主干反向强化了它。
局限:CoRL 针对的是纯 AR 的 ULM(图像离散成 token),没有覆盖 AR-Diffusion 混合架构;奖励设计偏任务特定,对开放域真实世界生成的泛化性验证不足。它是"RL for UMM"这条线的起点,但把接力棒交给了后续在 AR-Diffusion 上的工作。
4.2 AlphaGRPO:AR-Diffusion 上的无冷启动自反思(2026.05)
- 论文:AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward(arXiv:2605.12495)
- 机构:港大、字节 Seed;作者 Runhui Huang、Jie Wu、Hengshuang Zhao 等
- 项目页:huangrh99.github.io/AlphaGRPO
这是本文重点解读的论文,它把 CoRL 的命题推进到原生 AR-Diffusion UMM(BAGEL),并在两个方向上做出突破:统一轨迹的联合优化和可验证奖励设计。
(1)统一轨迹:先想后画,一次优化
AlphaGRPO 把一次多模态生成建模为混合轨迹:
τ = (y, z_1 → z_0)
│ │
│ └─ flow matching 连续视觉生成轨迹
└─ 自回归离散文本推理 token(因果前提)
文本推理 y 是图像 z 的因果前提。这个建模统一了两类任务:
- Reasoning T2I:y 是画前的空间布局规划、世界知识提取("画一只猫坐在红色沙发上"→先规划猫的位置、沙发的颜色、光照方向)。
- Self-Reflective Refinement:y 是对上一版错误的诊断和修正策略("阴影方向反了,应该来自左上方"→重画)。
两者语义不同,但优化目标一致:最大化最终图像的奖励。GRPO 采样 G 条轨迹,奖励只由最终图像决定,但共享的优势 Â_i 会同时回传给 AR 策略和 Flow 策略:
J(θ) = E[ (1/G) Σ_i ( λ·J_AR^(i) + J_Flow^(i) ) ]
│
λ=0.2 平衡文本推理和视觉生成两条路径
文本推理本身不收奖励(奖励只在图像上),但它通过因果前提影响图像质量,梯度经 Â_i 回传,逼模型学会"写出能导致好图的推理"——和 R1 "思维链不收奖励、最终答案收奖励"完全同构。
(2)两个 pilot 发现,决定了整个设计
AlphaGRPO 在讲方法前先做了两个探针实验,这是全文最有洞察力的部分:
发现一:Verification 失败,Reflection 生效。 让 BAGEL 判断"图有没有错",它漏判明显错误;改成"假设有错,找出来",它立刻能诊断问题。破法是在 prompt 层面强制"假设有错",把理解从辩护模式切到审查模式。这直接决定了 Self-Reflective Refinement 的任务设计。
发现二:整体打分无判别力,提问式打分有效。 同 prompt 生成一张错图、一张对图,让 Qwen3-VL-30B 打 0-10 分(VIEScore),两张都给 0.848;改问"树是否部分遮挡了长椅?"并取 Yes token 的概率,错图 0.592、对图 0.914,判别力极强。这直接催生了 DVReward。
(3)DVReward:把"打分"变成"答题"
这是 AlphaGRPO 的第二个核心贡献。整体标量奖励是个"黑盒",MLLM 倾向给中庸分;而具体的、可视觉接地的二值问题能精确激活判别力。DVReward 的流程:
用户 prompt q
│ Decomposer (LLM, Qwen3-235B)
▼
原子可验证问题
├─ Q_sem:10 维语义(实体存在、属性、空间关系…)
└─ Q_qua:8 维质量(几何完整、纹理保真…)
│ 强制物理视觉接地:
│ "咖啡热吗?" → "杯口有蒸汽吗?"
▼
生成图像 z
│ Verifier (MLLM, Qwen3-VL-30B-A3B)
▼
逐题回答,取 P_Yes/(P_Yes+P_No) 作连续置信度
│
▼
r(z) = √( v̄_sem · v̄_qua ) (几何平均,任一维度为零则总分接近零)
三个关键设计:强制物理视觉接地(抽象形容词转可观测证据,思想源自 Davidsonian Scene Graph)、用 token logits 而非二值(保留不确定性,梯度更平滑)、语义与质量几何平均(防止偏科)。
消融实验里,DVReward 全面击败 PickScore、HPSv3、UnifiedReward、VIEScore——后三者在某些子集上甚至比 baseline 还差。原因论文点得很准:SFT 偏好模型把 MLLM 窄化到特定域,损失通用判别力;整体打分标定差、判别力弱。DVReward 不微调裁判,只把问题拆到裁判本来就能可靠回答的粒度。
(4)False-Positive Rectification:堵住自反思的漏洞
自反思任务有个特有陷阱:GRPO 的 group advantage 是相对的,如果一组 refinement 大部分都变差了,一个"稍微没那么差"的退化结果仍可能拿到正 advantage——模型被鼓励做"无效但相对不差"的修改。FPR 的解法很直接:任何不比初始图强的轨迹,强制奖励设为组内最低分,保证它一定是负 advantage。消融显示它把 TIIF-Long 从 77.8 拉到 79.5。
(5)结果与意义
- TIIF-Bench 整体 75.2 → 79.1(+3.9),加推理时自反思到 83.9(+8.7),超 BAGEL 5.8%;
- GenEval 84.0 → 88.2(加自反思);512 训练直接泛化到 1024(GenEval 89.5),无需高分辨率微调;
- 从未在编辑数据上训练,GEdit-Bench 从 6.52 提到 7.08(+0.52),超过 OmniGen2、Step1X-Edit,接近 GPT-4o。
最后一条尤其重要:它说明 AlphaGRPO 学到的不是"怎么改图"的任务技能,而是底层的"语义对齐+错误诊断+修正"能力,能跨任务泛化。
方法论定位:AlphaGRPO 是 R1 在多模态生成上的直接对应物——无冷启动、纯 RL、激发沉睡的推理基元。它的代价是依赖一个 30B 的外部 MLLM 当裁判,这把它和路线 B 的自奖励方法区分开。
4.3 Unified-GRPO:把 UMM 当自编码器(2025.09,百度+北大)
- 论文:Unified Multimodal Model as Auto-Encoder(arXiv:2509.09666,v5 更新至 2026.03)
思路非常巧妙:不引入外部裁判,而是用重建质量当奖励。
原图 I
│ encoder(理解分支)
▼
长 caption c(700k 长上下文图文对训练,强制提取细粒度语义)
│ decoder(生成分支)
▼
重建图 Î
│
▼
奖励 = I 与 Î 的语义一致性
两阶段:
- Generation for Understanding:训练 encoder 生成"信息量大到能让 decoder 重建"的 caption,倒逼视觉感知变强;
- Understanding for Generation:训练 decoder 从这些 caption 忠实重建,逼它利用每一个细节。
和 AlphaGRPO 对比:两者都让理解↔生成互相强化,但 Unified-GRPO 用自监督重建奖励(不需要外部裁判),AlphaGRPO 用外部 MLLM 问答奖励。前者更省、更自洽,后者对开放域 prompt 更灵活。重建范式的局限是奖励信号依赖"原图",对纯文本到图像的开放生成不太直接。
五、路线 B:自奖励闭环(Self-Rewarding)
路线 A 的共同痛点是依赖一个更大的外部奖励模型(AlphaGRPO 用 30B Qwen3-VL)。路线 B 反问:UMM 自己的理解分支不就是现成的裁判吗?
5.1 SRUM:理解模块当老师,生成模块当学生(2025.10,ECCV 2026)
- 论文:SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models(arXiv:2510.12784)
- 机构:港大、上海 AI Lab 等;作者 Weiyang Jin、Yuwei Niu、Xihui Liu 等
- 网页:waynejin0918.github.io/srum_web
这是 AlphaGRPO 最直接的对照组。SRUM 的核心洞察:
UMM 的理解能力常常强于生成能力。既然理解分支能判断对齐,为什么不直接用它给生成分支打分?
┌─────────────────────────────┐
│ 共享主干的 UMM │
│ │
prompt ──► │ 理解分支 ◄──┐ 生成分支 │
│ (裁判) │ (学生) │
│ │ │ ▲ │
│ └─奖励──┴─────┘ │
│ 回传梯度 │
└─────────────────────────────┘
无需外部 reward model
无需额外人类标注
为了提供全面反馈,SRUM 设计了 global-local 双尺度奖励:
- Global reward:整体视觉语义和布局是否对齐;
- Local reward:对象级细粒度保真(颜色、材质、数量、空间关系)。
双尺度是必要的:只看全局会漏掉"猫的项圈颜色错了"这种细节,只看局部会丢失整体构图。
结果:T2I-CompBench 82.18 → 88.37,T2I-ReasonBench 43.82 → 46.75,且可直接应用于不同架构的 UMM。
SRUM vs AlphaGRPO:这是路线 B 和路线 A 的经典取舍——
| 维度 | SRUM(自奖励) | AlphaGRPO(外部裁判) |
|---|---|---|
| 奖励来源 | 模型自身理解分支 | 外部 30B MLLM |
| 外部依赖 | 无 | 需大模型推理 |
| 成本 | 低 | 较高(异步调用缓解) |
| 奖励判别力 | 受限于自身理解上限 | 更强(裁判更大) |
| 自包含性 | 完全闭环 | 依赖外部 |
| 风险 | 自我评估的盲区 | 裁判偏差传递 |
一个值得注意的趋势:后续的 SpectraReward(见 5.2)发现"更大的裁判不一定更好",Self-SpectraReward 甚至能匹敌更大的外部裁判——这暗示随着 UMM 自身理解能力变强,自奖励路线的天花板会持续抬高。
5.2 SpectraReward:零样本奖励与自奖励特例(2026.07)
- 论文:Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for T2I Generation(arXiv:2607.11886)
这篇工作提出了一个极其简洁的零样本奖励:不微调 MLLM,直接做一次 image-conditioned teacher-forced forward,用**"图像条件下 prompt 的平均对数似然"**当奖励。一次 forward pass 就够,比 DVReward 的多题问答便宜得多。
更重要的是它对 UMM 的特例 Self-SpectraReward:
用策略模型自己的理解分支,给自己生成分支的产出打分,形成完全闭环——不需要外部奖励模型,也不需要外部知识。
在覆盖两个扩散模型、三个 RL 算法、九个 4B-235B 奖励 MLLM 的大规模实验里,两个结论很有价值:
- 更大的奖励 MLLM 不一定更好(reward-policy 对齐效应:和策略同源、规模相当的裁判,往往比大得多的异源裁判更有效);
- Self-SpectraReward 能匹敌甚至超过更大的外部奖励模型。
这为自奖励路线提供了强有力的实证支撑:闭环自奖励不是"退而求其次",在 reward-policy 对齐良好时可能是更优选择。
5.3 UniRL:零外部图像数据的自举(2025.09)
- 论文:UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning(OpenReview,Show-o/Janus 团队,Weijia Mao、Mike Zheng Shou)
SRUM 和 SpectraReward 解决"谁来打分",UniRL 进一步解决"训练数据从哪来":
模型自己生成图像,生成结果用于理解训练,理解结果再监督生成——全程不依赖任何外部图像数据。
prompt ──► 生成图像 I(生成分支)
│
▼
理解 I(理解分支:caption/VQA)
│
▼
理解结果反过来监督生成质量
│
▼
迭代自举,SFT + GRPO 结合
它探索了 SFT 和 GRPO 的组合,避免 PPO(需价值网络)和 DPO(需人工偏好对)的额外依赖。卖点是"零外部图像数据的自举",代价是自生成数据的质量上限受模型自身约束,早期可能陷入"自我强化的平庸"。
六、路线 C:自博弈与多角色自蒸馏
路线 B 是"自己当自己的裁判",路线 C 更进一步:把一个模型拆成多个角色,让它们自己出题、答题、评估、生成,通过自博弈产生训练信号。
6.1 UniCorn:Proposer-Solver-Judge 三角色(ACL 2025)
- 论文:UniCorn(Wei-Jie Xu 等,ACL 2025)
把单个 UMM partition 成三个协作角色:
┌──────────┐ 出视觉题/生成请求 ┌──────────┐
│ Proposer │ ──────────────────► │ Solver │
│ (出题者) │ │ (答题者) │
└──────────┘ └────┬─────┘
▲ │ 答题+评估
│ ▼
│ 认知模式重构 ┌──────────┐
└──────────────────────── │ Judge │
蒸馏成显式生成信号 │ (评判者) │
└──────────┘
通过 self-play 生成高质量交互,再用"认知模式重构(cognitive pattern reconstruction)"把潜在的理解能力蒸馏成显式的生成信号。论文还提出 UniCycle,一个循环一致性 benchmark,用来衡量多模态连贯性。
6.2 Ask, Solve, Generate:加了难度信号的自演化(2026)
- 论文:Ask, Solve, Generate: Self-Evolving UMM via Self-Consistency Rewards
同样是三角色(Proposer 出题、Solver 答题评估、Generator 合成图像),但它解决了一个自博弈的关键稳定性问题:
当样本级一致性信号不可靠时(模型对所有答案都模棱两可),怎么训练?
它引入 Solver Token Entropy(STE):用 token 级预测不确定性作为连续难度信号。即使整道题的一致性判断不可靠,token 级熵仍能告诉系统"这个样本有多难/多不确定",从而稳定学习。生成侧还设计了多尺度内部评估方案,结合 QA 保真度打分和循环一致性 caption。
路线 C 的共同特点:完全无需人工标注、偏好标签或外部裁判模型,靠角色分工和一致性信号自演化;代价是训练动态更复杂,容易出现"角色坍塌"(三个角色退化成同一个)或"自说自话"(一致性高但和人类判断脱节)。STE 这类稳定性技巧因此至关重要。
七、路线 D:SFT 交错推理(数据驱动)
7.1 IRG:思考-画图-反思-重画(2025.09)
- 论文:Interleaving Reasoning for Better Text-to-Image Generation(arXiv:2509.06945)
- 机构:小红书、ECNU、CUHK;作者 Wenxuan Huang、Shuang Chen、Zheyong Xie 等
- 代码:github.com/Osilly/Interleaving-Reasoning-Generation
前面三条路线都以 RL 为主,IRG 走的是监督微调路线,但目标一致——让模型"先想后画、反思后重画"。
prompt
│
▼
文本思考(布局/知识规划)─────► 生成初版图
▲ │
│ ▼
└── 文本反思(诊断细节/美学)◄─ 观察初版图
│
▼
生成精修图
IRG 构建了 IRGL-300K 数据集,用六种分解学习模式覆盖"学思考"和"学完整思考-图像轨迹"两个子目标,两阶段训练:先建立稳健的思考与反思能力,再高效微调。推理时还设计了专用的 CFG 条件来优化重画步骤。
IRG vs AlphaGRPO:两者都做"思考-生成-反思-重画",但路线根本不同——
| 维度 | IRG(SFT) | AlphaGRPO(RL) |
|---|---|---|
| 训练信号 | 300K 高质量蒸馏轨迹 | 奖励信号(DVReward) |
| 是否冷启动 | 是(依赖强教师合成数据) | 否(纯 RL 唤醒基元) |
| 增益来源 | 教师蒸馏 | 自身潜力激发 |
| 数据成本 | 高(300K 轨迹) | 低(19.5K prompt) |
| 上限 | 受教师质量约束 | 可能超越教师 |
AlphaGRPO 在论文里明确把 IRG 这类方法归为"依赖专有模型合成数据的冷启动范式"作为对比,强调自己"增益不来自更强教师的蒸馏"。但要注意:SFT 和 RL 不是对立的——实际生产中往往是 SFT 冷启动打底 + RL 强化跃升的组合(R1-Zero 到 R1 的演进就是如此)。IRG 提供了高质量的"交错推理"行为先验,完全可以作为 RL 前的初始化。
八、奖励模型:后训练的"裁判席"演进
后训练的质量天花板由奖励决定。除了上述嵌入在各路线里的奖励设计,还有一批工作专门打磨"裁判"本身,理解它们才能看清奖励的演进逻辑。
8.1 奖励模型的三代演进
| 代际 | 方法 | 代表 | 特点 | 问题 |
|---|---|---|---|---|
| 第一代 | CLIP 偏好奖励 | PickScore、HPS | 微调 CLIP 编码器学人类偏好 | 判别力有限,维度单一 |
| 第二代 | MLLM 偏好奖励 | UnifiedReward、HPSv3 | 在大规模偏好数据上 SFT MLLM | 窄化通用判别力,域迁移差 |
| 第三代 | 生成式/可验证奖励 | VIEScore、DVReward、SpectraReward | 直接用 MLLM 原生能力打分/答题 | 整体打分不稳定 → 分解问答 |
8.2 UnifiedReward:统一奖励底座(2025.03)
- 论文:Unified Reward Model for Multimodal Understanding and Generation(arXiv:2503.05236,复旦+上海 AI Lab)
- 网页:codegoat24.github.io/UnifiedReward
第一个同时覆盖图像/视频、理解/生成的统一奖励模型,236K 偏好数据,支持 pairwise ranking 和 pointwise scoring。它的核心论点是"联合学习产生协同":更好的图像理解能提升生成评估,更好的图像评估又能通过帧分析提升视频评估。
但它恰恰是 AlphaGRPO 消融里击败的对象——在 TIIF-Long 和 GenEval 上,用 UnifiedReward 当奖励反而降低了 BAGEL 的性能。这揭示了第二代奖励模型的根本矛盾:SFT 偏好对齐提升了特定域的精度,却牺牲了开放域的通用判别力。
8.3 从"打分"到"答题"的范式转移
DVReward 的 pilot study 是这个转移的关键证据。把它和 DSG 连起来看:
- DSG(Davidsonian Scene Graph,arXiv:2310.18235):最早提出把 T2I 评估拆成原子问题,用 Davidsonian 语义学保证问题可判定,是 DVReward 的思想前驱。
- VIEScore(2024):让 MLLM 直接打 0-10 分并解释,可解释但标定差、判别力弱。
- DVReward(2026):把 DSG 的分解思想 + token logits 置信度 + 语义/质量几何平均结合,给出 RL 可用的稳定奖励。
这条线的核心洞察一句话:好的奖励不是"更强的评分模型",而是"把任务拆到模型能可靠回答的粒度"。
九、工程稳定性:被忽视但致命的一环
把 GRPO 用在 AR-Diffusion 混合架构上,会遇到纯文本或纯扩散都没有的稳定性问题。一批工作专门解决这些工程难题,它们是上述方法能跑起来的前提。
9.1 MAR-GRPO:混合架构的 RL 坍塌问题(2026.04)
- 论文:MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation(arXiv:2604.06966)
关键发现:在 masked autoregressive(MAR)这类 AR-diffusion 混合模型上,diffusion head 会引入噪声梯度,导致训练不稳定和早期性能饱和甚至坍塌。解法是 multi-trajectory expectation(MTE):通过平均多条轨迹来估计更稳定的优化方向,而不是依赖单条轨迹的噪声梯度。
9.2 S-GRPO:稀疏奖励下的专家轨迹注入(2026)
- 论文:S-GRPO: Unified Post-Training for Large Vision-Language Models(arXiv:2604.16557)
纯 RL 在稀疏奖励的视觉任务上经常"整组全错",零梯度。S-GRPO 融合模仿学习:当 binary verifier 检测到一组轨迹全部失败时,动态注入验证过的 ground-truth 轨迹(Conditional Ground-truth Injection, CGI),给它确定性最大奖励,保证组内始终有正信号,同时避免纯 SFT 的灾难性遗忘。
9.3 JAGG:扩散 GRPO 的算力瓶颈(2026.07)
- 论文:JAGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models(arXiv:2607.17572)
DanceGRPO/Flow-GRPO 在每个去噪步都算一次 policy gradient,计算量巨大。JAGG 用 Jacobian 聚合的 group gradient 显著降低训练成本,是把扩散 RL 从实验室推向规模化的关键工程优化。
9.4 时序-组双维锚定(2025.12,USTC)
- 论文:Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment(arXiv:2512.12387)
指出现有 flow matching GRPO 的两个错配:把稀疏终端奖励均摊到所有时间步(早期结构形成和后期细节微调重要性不同)、纯相对奖励方差大。从时间维和组维两个维度做价值锚定,改善时序信用分配。
这些工作提醒我们:后训练不是"调个 GRPO 就行",混合架构的梯度噪声、稀疏奖励、算力开销、信用分配都是实打实的工程障碍。读论文时如果只看方法框图、忽略这些稳定性技巧,复现时会踩坑。
十、横向对比与选型
把所有路线放在一张表里对比:
| 论文 | 路线 | 奖励来源 | 外部数据/模型 | 架构 | 核心结果 |
|---|---|---|---|---|---|
| CoRL/ULM-R1 | A 联合RL | 规则+任务奖励 | 需 prompt | 纯 AR ULM | 理解 +23%,生成 +7% |
| AlphaGRPO | A 联合RL | 外部 MLLM 可验证问答 | 19.5K prompt + 30B 裁判 | BAGEL (AR-Diff) | TIIF +8.7,GEdit +0.52(零编辑训练) |
| Unified-GRPO | A 联合RL | 图像重建质量 | 700K caption 对 | AR-Diffusion | 理解↔生成互增强 |
| SRUM | B 自奖励 | 自身理解分支(global+local) | 无 | 各类 UMM | CompBench +6.2 |
| SpectraReward | B 自奖励 | MLLM log-likelihood | 无(Self 特例) | 扩散/UMM | 闭环自奖励,大裁判非必需 |
| UniRL | B 自奖励 | 自身生成-理解循环 | 无外部图 | Show-o/Janus | 零数据自举 |
| UniCorn | C 自博弈 | 三角色一致性 | 无 | UMM | 自监督精炼 |
| Ask-Solve-Generate | C 自博弈 | 自一致性 + STE 难度信号 | 无 | UMM | token 熵稳定训练 |
| IRG | D SFT | 蒸馏轨迹 | 300K 轨迹 | 统一模型 | 多轮交错反思出图 |
| UnifiedReward | 奖励模型 | SFT 偏好 | 236K 偏好 | 奖励模型 | 统一奖励底座 |
| DanceGRPO | 生成侧RL | 美学/对齐奖励 | — | 扩散/flow | 纯生成对齐基线 |
| MAR-GRPO | 稳定性 | — | — | AR-Diffusion | 解决混合架构 RL 坍塌 |
怎么选:三个决策维度
-
有没有一个强于策略模型的开源裁判?
- 有 → 路线 A(AlphaGRPO/DVReward),奖励质量高;
- 没有或想自包含 → 路线 B(SRUM/SpectraReward)。
-
能不能拿到高质量推理轨迹数据?
- 能(有强教师或可合成) → 路线 D(IRG)SFT 打底,再叠 RL;
- 不能 → 路线 B/C 的自监督自举。
-
是开放域生成还是特定任务?
- 开放域、重泛化 → DVReward 式可验证问答,避免窄域偏好模型;
- 特定任务(文字渲染、医学影像)→ 规则奖励 + 专用 verifier(如 Lance 的 PaddleOCR)。
最可能的生产配方:SFT 冷启动(IRG 式交错推理轨迹)→ 自奖励 RL(SRUM/SpectraReward 闭环)→ 关键任务用外部可验证奖励(DVReward/规则奖励)兜底。这正是 LLM 后训练从 R1-Zero 到 R1 的演进逻辑在多模态的重演。
十一、和系列其他篇章的呼应
这篇后训练不是孤立的,它和前六篇有明确的榫卯关系:
| 系列位置 | 后训练的呼应 |
|---|---|
| 01 篇 Flow Matching 专题 | AlphaGRPO/Flow-GRPO 在 flow 上做 RL 的技术基础(SDE 化、闭式 KL) |
| 02 篇 Show-o / Show-o2 | CoRL 在纯 AR ULM 上做 RL,Show-o2 的 Flow Head 是后续 AR-Diffusion RL 的对象 |
| 03 篇 BAGEL | AlphaGRPO 的 backbone 正是 BAGEL,验证了 MoT 原生统一架构适合端到端 RL |
| 04 篇 VA-CoT 的 flow-GRPO | VA-CoT 用 GRPO 做生成侧视觉一致性,AlphaGRPO 把它扩展成文本+图像联合 RL;LatentUM 的自反馈闭环与 SRUM 自奖励是同一思想的不同实现 |
| 05 篇 Lance 的 GRPO 阶段 | Lance 第四阶段用 GRPO + PaddleOCR 奖励专攻文字渲染,是"规则奖励+RL"的特化案例 |
| 06 篇终章的递归自我改进 | 自奖励/自博弈路线正是"递归自我改进"在当下最具体的落地形式 |
最关键的一点:06 篇把"递归自我改进"列为 AGI 终局的核心能力之一。而本篇的自奖励、自博弈路线,正是这个抽象命题在 2025-2026 年最实在的技术注脚——一个能当自己老师、从自己产出中学习的统一模型,已经不再是设想,而是有 CoRL/SRAM/UniRL/AlphaGRPO 多条独立验证的工程现实。 当然,它离真正的递归自我改进还有距离(见下一节局限),但方向已经明确。
十二、开放问题与局限
不能只讲成功,这一代后训练方法的边界要认清:
-
自奖励的"天花板"与"自欺"问题。 自奖励闭环的奖励质量受限于模型自身理解能力——如果模型有系统性盲区(比如数不对超过 7 个的物体),它当裁判也会系统性误判,导致"自我强化的错误"。Self-SpectraReward 发现大裁判非必需,但这不等于自奖励永远够用;在模型自身能力薄弱的维度,外部强裁判仍不可替代。
-
自反思可能"过度修正"。 AlphaGRPO 的 FPR 解决了"改了没变好却得正奖励"的问题,但没报告"反思后把本来对的图改错"的比例。强制"假设有错"的反思模式有降低召回的风险,实际部署需要监控过度修正率。
-
外部裁判的成本与偏差。 AlphaGRPO 用 30B MoE 当裁判,异步调用缓解了延迟但算力成本仍高;且裁判的偏见(审美偏好、文化偏见)会通过奖励传递给策略模型。
-
视频/高分辨率生成的 RL 还很初级。 当前绝大多数方法在 512 图像上验证。视频的时序一致性、运动合理性、长程信用分配,以及 4K 级高分辨率的奖励设计,都比图像难一个量级。DanceGRPO 虽覆盖 T2V,但离"视频 UMM 的自反思"还差很远。
-
奖励分解的完备性。 DVReward 的 10+8 维问题表是否覆盖真实世界的全部失败模式?复杂物理常识、因果关系、美学风格这些"难以问成 Yes/No"的维度,仍是原子问答的盲区。
-
"无冷启动"的边界。 AlphaGRPO 声称无冷启动,但它的 backbone BAGEL 已在大规模交错数据上预训练,基元确实存在。换一个弱 backbone,纯 RL 是否还能唤醒推理,尚未充分验证。R1 的经验是纯 RL 在强基座上有效、弱基座上需要 SFT 冷启动,多模态大概率同理。
-
评估的鲁棒性。 多个工作用 GEdit-Bench(GPT-4 评分)评估,但 GPT-4 评分本身有偏差和版本漂移;跨论文横向比较时,不同基准、不同分辨率、不同评测模型使得数字不能直接划等号。
十三、结语:后训练是统一模型价值的兑现
回到 06 篇的那个智能闭环——感知、预测、行动。前六篇讲的是如何用统一架构把这三个齿轮"焊"在一个模型里;后训练讲的则是如何让这三个齿轮真正转起来、互相驱动、越转越快。
2025-2026 年这一波工作给出的核心结论有三条:
-
GRPO 是 UMM 后训练的通用货币。 从离散文本到连续 flow,从纯 AR 到 AR-Diffusion,从 CoRL 到 AlphaGRPO,GRPO 及其变体证明了同一套算法能统一优化理解和生成。
-
理解可以反过来监督生成,这是 UMM 独有的结构性优势。 拼接模型做不到自奖励,因为它的理解和生成是两张皮;原生统一模型共享主干,让"自己当自己的老师"成为可能。SRUM、SpectraReward、UniRL 把这个优势兑现成了无需外部裁判的闭环。
-
奖励设计的重心从"更强的裁判"转向"更聪明的提问"。 DVReward 的 pilot 实验是分水岭——当 MLLM 打分为零时,提问却判别力十足。未来的奖励工程,更多是"如何把模糊的人类意图拆成模型能可靠验证的原子问题",而不是一味堆更大的奖励模型。
当然,自奖励的自欺风险、视频生成的 RL、过度修正的可靠性,都还是开放问题。但方向已经清晰:预训练赋予模型潜力,后训练把潜力兑现成能力,而统一模型最强大的后训练武器,就是它自己的理解力。 从这个角度看,后训练不是 UMM 故事的收尾,而是"递归自我改进"这场更长程赛跑的发令枪。
参考链接
路线 A:GRPO 联合强化
- CoRL / ULM-R1: Co-Reinforcement Learning for Unified Multimodal Understanding and Generation — https://arxiv.org/abs/2505.17534 (NeurIPS 2025)
- AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward — https://arxiv.org/abs/2605.12495
- Unified-GRPO: Unified Multimodal Model as Auto-Encoder — https://arxiv.org/abs/2509.09666
路线 B:自奖励闭环
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models — https://arxiv.org/abs/2510.12784 (ECCV 2026)
- SpectraReward / Self-SpectraReward: Read It Back — https://arxiv.org/abs/2607.11886
- UniRL: Self-Improving Unified Multimodal Models via SFT and RL — https://openreview.net/forum?id=5K9XW9gQ5r
路线 C:自博弈/自蒸馏
- UniCorn: Self-Improvement via Unified Cognitive Distillation — ACL 2025
- Ask, Solve, Generate: Self-Evolving UMM via Self-Consistency Rewards
路线 D:SFT 交错推理
- IRG: Interleaving Reasoning for Better Text-to-Image Generation — https://arxiv.org/abs/2509.06945
奖励模型
- UnifiedReward: Unified Reward Model for Multimodal Understanding and Generation — https://arxiv.org/abs/2503.05236
- DSG: Davidsonian Scene Graph — https://arxiv.org/abs/2310.18235
- VIEScore — https://arxiv.org/abs/2403.18447
GRPO 基础与工程稳定性
- DanceGRPO: Unleashing GRPO on Visual Generation — https://arxiv.org/abs/2505.07818
- MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation — https://arxiv.org/abs/2604.06966
- S-GRPO: Unified Post-Training for Large Vision-Language Models — https://arxiv.org/abs/2604.16557
- JAGG: Jacobian-Aggregated Group Gradient — https://arxiv.org/abs/2607.17572
- Anchoring Values in Temporal and Group Dimensions — https://arxiv.org/abs/2512.12387
理解侧 R1 式 RL(同属多模态后训练)
- VLM-R1 — https://arxiv.org/abs/2504.07615
- Vision-R1 — https://arxiv.org/abs/2503.18013