2026-08-26·多模态, 论文解读1 分钟0UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什#UMM#后训练#强化学习#GRPO#自奖励#DPO#自博弈#论文解读