本篇是 UMM 系列的第八篇延伸(前七篇见 08-24 学习路径、08-25 论文解读 01~06、08-26 论文解读 07 后训练篇)。2026 年 8 月下旬,统一多模态领域密集出现四个值得记录的动态:Google 把视频 any-to-any 的统一模型推到 GA 生产版本;阿里用 6B/3B 的小模型证明"训练工程"可以把紧凑统一模型推到开源第一;南京大学、清华、复旦与通义实验室的诊断框架首次用 Oracle 协议回答了"生成到底能不能帮理解"这个争论已久的问题;字节的 GAS 则给出了一个几乎零代价的答案——让生成能力只在训练时存在。
四个动态分别对应 UMM 的四个层面:产品化里程碑(Gemini)、训练工程范式(Swift-Image)、能力边界诊断(VGAU-Diag)、架构与监督设计(GAS)。放在一起看,它们勾勒出 2026 下半年统一模型的清晰走向。
一、总览:四条新闻,四个层面
| 动态 | 时间 | 机构 | 层面 | 一句话结论 |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash GA | 8/27 GA | Google DeepMind | 产品化 | 统一模型第一次在视频域有了"可规划、可交付"的生产级版本 |
| Swift-Image 6B/3B | 8/20 arXiv | 阿里巴巴 | 训练工程 | 6B 参数 + 243K GPU 小时做到开源第一,3B 蒸馏几乎零掉点 |
| VGAU-Diag | 8/25 v2(初版 5 月) | 南大/清华/通义/复旦 | 诊断评估 | UMM 的瓶颈在视觉理解侧,不在视觉生成侧 |
| GAS | 8/12 arXiv | 字节跳动 | 架构与监督 | 生成作为训练期辅助监督,推理时整条生成分支丢弃,零开销 |
这四件事看似分散,实则回答的是同一个核心问题的四个侧面——统一模型(同时具备理解与生成)到底该怎么建、怎么训、怎么评、怎么用:
- Gemini 回答"统一模型产品化后长什么样";
- Swift-Image 回答"有限算力下统一模型怎么训到最强";
- VGAU-Diag 回答"生成能力对理解的增益到底存不存在、卡在哪";
- GAS 回答"如果增益有限或代价太大,能不能只要训练时的好处、不要推理时的成本"。
下面逐一展开。
二、Gemini Omni 1.1 Flash GA:视频统一模型从"碰运气"到"可规划"
2.1 它是什么
Gemini Omni 是 Google DeepMind 于 2026 年 5 月发布的原生多模态模型家族,定位是"create anything from any input — starting with video":图像、音频、视频、文本任意组合作为输入,输出视频,并且支持通过对话进行多轮视频编辑——每一条指令都建立在上一条的结果之上,角色保持一致、物理规律保持成立、场景记得之前发生过什么。
8 月 27 日,家族第一个模型 Gemini Omni Flash 从预览版正式 GA(gemini-omni-1.1-flash),预览端点 gemini-omni-flash-preview 随后退役。它不是一次画质的代际飞跃,而是一次控制力的代际升级:核心生成质量基本不变,开发者拿到的是一组"可编程的杠杆"。
2.2 五大控制能力
GA 版本的关键更新可以归纳为五项:
- Scene Extension(场景扩展):在已有视频基础上无缝续接。此前模型只能参考最后 1 秒,1.1 可以分析最长 10 秒的前置上下文,每次续接 10 秒,累计可把视频延长到 40 秒。这解决的是长叙事的连贯性问题——人物、场景、动作风格不会在续接处"失忆"。
- Keyframe Interpolation(首尾帧插值):给定起始帧和结束帧,模型补全中间的连续视频。适合运镜、环绕、变焦、转场和无缝循环,把"提示词碰运气"变成"端点约束下的插值"。
- 3 秒参考视频:构建场景时最多可上传参考视频(官方文档给出的参考时长为 3 秒级别),帮助模型理解视觉语境,保证角色外观和行为逻辑的一致性;图像、音频参考同样支持(音频初期仅支持语音参考)。
- 360p 草稿模式:低分辨率快速出草稿,速度比 720p 最高快 60%、成本约为三分之一,用于分镜迭代、构图验证。
- 4K 超分成品:草稿确认后可直接输出 1080p 或 4K 成片,无需外接超分工具。
2.3 定价:按 token 计费,360p 草稿是成本杠杆
Google 没有按"秒"直接定价,而是视频输出按 token 计费(720p 每秒约 5,792 个输出 token,视频输出单价 $17.50 / 1M tokens),折算成分辨率阶梯:
| 分辨率 | 每秒价格 | 10 秒成本 |
|---|---|---|
| 360p | $0.03 | $0.30 |
| 720p | $0.10 | $1.00 |
| 1080p | $0.15 | $1.50 |
| 4K | $0.30 | $3.00 |
输入(文本/图像/视频/音频)9.00 / 1M tokens,无免费额度。官方推荐工作流是"360p 草稿反复迭代 → 确认后只对成片做 1080p/4K",把迭代成本压到最低。
2.4 为什么这是统一模型的里程碑
技术上有三点值得记录:
- 多轮有状态会话(stateful session IDs):API 支持多轮、有状态的编辑会话。这意味着 Agent 可以把视频生成纳入规划循环——360p 出草稿 → 视觉模型逐镜评估 → 不满意就扩展/插值修复连续性 → 只有达标的镜头才超分到 4K。视频生成从"一次性抽奖"变成了"可组合的编辑组件"。
- 理解与生成共用 Gemini 的世界知识:官方强调 Omni 不只是"看起来真实",而是会推理"接下来应该发生什么"——重力、动能、流体动力学的直觉理解,加上历史、科学、文化知识。这正是统一架构相对纯视频生成模型(Sora、Kling 路线)的核心差异点:生成建立在理解之上。
- 生态接入:Adobe Firefly、Figma Weave、Runway、GMI Cloud 已集成;Google Flow、Gemini App、YouTube Shorts 面向消费者开放,AI Studio 与 Agent Platform API 面向开发者。
定位上也要清醒:追求电影感和艺术风格,Sora 仍被认为是第一梯队;Omni 1.1 Flash 的强项是控制、迭代、对话式编辑和知识 grounding,而且它只是 Flash 档——Pro/Ultra 档尚未发布。
三、Swift-Image:6B 做到开源第一,"分治后蒸馏"的第二次独立验证
3.1 论文概况
- 论文:Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models(arXiv:2608.20334,8/20 提交,8/21 v2)
- 机构:阿里巴巴,23 位作者,11 位共同一作(Taihang Hu、Zhao Wang、Zuan Gao 等),通讯作者 Mengting Chen
- 定位:一套权重同时支持文生图(T2I)、单图编辑、多图编辑;6B 单流 DiT,总训练成本约 243K GPU 小时;在评测的开源模型中综合性能第一,压缩后的 3B 版本几乎零掉点。
论文的姿态很克制:它不声称任何单个组件是新发明,而是回答一个工程问题——"在受限算力预算下,一个紧凑的视觉生成器靠系统性的训练工程能推到多远?"
3.2 架构:Qwen3-VL 做语义条件,FLUX.2 AE 做像素通道
- 条件编码器:共享的 Qwen3-VL-8B 接收系统提示、参考图和用户指令;取其三个均匀间隔隐层的表示拼接后经 MLP 映射进扩散隐空间。值得注意的是 VLM 的图像输出 token 不送入 DiT(消融显示只增序列长度、无质量增益)。
- 像素通道:输入图与加噪目标图由 FLUX.2 AE 编码后线性投影,保留像素级参考信息。
- 渲染器:6B 并行单流 DiT(parallel single-stream),Attention 与 SwiGLU MLP 并行计算(算子融合,推理效率约 +10%)、block-shared timestep modulation(把参数预算让给注意力和 FFN)、4D-RoPE [T,H,W,L]、多图沿 T 轴偏移 10 防止空间坐标坍缩(减少多图编辑的 copy-paste 伪影)、图内文字用字符级 tokenization。
- 两个工程教训值得记下:① VLM 的理解 benchmark 分数高 ≠ 生成条件好(Qwen3.5-4B 收敛慢于 Qwen3-VL-8B);② 自编码器不能只看早期收敛——内部 PAE 学得快但重建误差封死质量天花板,FLUX.2 AE 的重建-收敛权衡最好。
3.3 训练流水线:渐进训练 → 并行专家 RL → 多教师在线蒸馏
整条 pipeline 是这篇论文最值得借鉴的部分:
第一阶段:Progressive Training(渐进式预训练 + SFT) 沿三条轴做 coarse-to-fine 课程:分辨率、任务复杂度、数据质量。核心原则是"先提分辨率,再引入异构编辑目标",避免空间尺度与任务分布同时切换导致不稳定:
- 基础预训练 500K 步:低分辨率 T2I 起步(256→512px),建立广泛语义覆盖后才混入编辑数据;
- 持续预训练(CT)200K 步:512→1024px,数据分布转向更高质量来源,VLM 层级语义标签 + 类目重采样保长尾;
- SFT 10K 步:1024px 人工验证高质量子集,按评测结果对弱项做数据增强。
- 一个细节:预训练用 Logit-Normal 时间步采样(强调中噪声态和全局结构),SFT 切换到 Uniform 采样(监督覆盖整条轨迹,强化精细纹理)。
第二阶段:Parallel Expert RL(并行专家强化学习) 混合任务 RL 的两个老问题——异构目标梯度互相干扰(跷跷板效应)、group-rollout 样本效率低导致欠优化任务训不动、长程扩散 RL 容易模式坍缩——他们的解法是不强行用一个策略吃下所有任务:
- 多维奖励系统:T2I 评图文对齐/类目感知美学/画质/风格;编辑评指令遵循/参考一致性/画质;外加 ArcFace 人脸身份奖励、PP-OCRv6 文字渲染奖励;
- Guidance-enhanced rollout:采样时开 CFG 拿到高质量候选,策略更新时不开 CFG(省算力,同时把引导采样能力隐式转移给无引导策略);
- 任务感知奖励路由:用 Diffusion-NFT 并行训练多个任务一致的专家策略——一个 T2I 专家、一个通用编辑专家、若干针对联合训练中欠优化子领域的领域编辑专家。
第三阶段:Multi-Teacher On-Policy Distillation(多教师在线策略蒸馏,OPD) 专家的能力分散在各自 checkpoint 里。从混合任务策略初始化一个共享学生,每条在线采样的样本由其领域匹配的专家教师蒸馏,通才的均衡与专才的强度合并进一个模型。这一步之后还复用了两次:6B→3B 的剪枝恢复蒸馏、少步采样的任务专项巩固。
Prompt Enhancer(PE,渲染前推理):一个独立模块把用户短/复杂请求翻译成渲染器对齐的显式视觉规格(refined_prompt);简单请求直接改写,知识密集/布局敏感请求先输出推理 trace。PE 用 SFT 学会"按复杂度自适应推理",再用冻结渲染器给出的图像级反馈做 GRPO(渲染出来不对就惩罚),不需要在线搜索。PE 在 3B/6B 上都稳定涨点,知识密集、组合式、布局敏感任务涨幅最大。
部署压缩:结构化剪枝(注意力头 32→24,存活参数直接继承)后重走 CT+SFT 课程恢复,配合 6B 教师的速度预测 KD,再经跨容量 OPD 得到 3B;少步蒸馏用 DMD/CDM 路线把 50 步压到 8 步(动态反向模拟、学生自采样轨迹、对抗头挂在冻结教师晚层)。反直觉的结论:少步蒸馏版本的综合编辑性能反而更强——蒸馏起到了额外的正则化/整合作用。
3.4 与 SenseNova U1.5 MOPD 的关系:两家独立发现"分治后蒸馏"
这是本篇最想强调的一点。在 08-22 的 SenseNova U1.5 深度解析 中,商汤的正式版采用了 MOPD(Multi-Expert Online Policy Distillation,多专家在线策略蒸馏):先在图像域训练多个专家(生成专家、编辑专家等),再通过在线策略蒸馏把多专家能力无损融合到单体 8B 模型;后训练阶段同样用任务导向 RL 聚焦指令遵循。
Swift-Image 的做法在范式上同构:
| 环节 | SenseNova U1.5(商汤) | Swift-Image(阿里) |
|---|---|---|
| 异构能力处理 | 多专家分别训练 | Parallel Expert RL(Diffusion-NFT 并行专家) |
| 能力合并 | MOPD 在线策略蒸馏 | Multi-Teacher OPD 在线策略蒸馏 |
| 蒸馏时机 | 专家 on-policy 采样 → 学生 | 专家 on-policy 样本按领域路由给对应教师 |
| RL 定位 | 任务导向 RL(指令遵循) | 多维奖励 RL + CFG 非对称 rollout |
| 额外用途 | 为视频/3D 专家融合预留范式 | OPD 复用于 6B→3B 压缩与少步蒸馏 |
两家机构、两条模型线,在没有互相引用的情况下(Swift-Image 的 OPD 引用的是 DiffusionOPD、DanceOPD 等扩散侧工作流),收敛到了同一个后训练范式:"分治"(把互相冲突的目标拆给并行专家)+ "后蒸馏"(用 on-policy 蒸馏把专家合并回单体)。
为什么这个范式会成为共识?逻辑链在 UMM07 后训练篇里已经埋好:统一模型的异构目标(生成 vs 编辑、美学 vs 一致性 vs 文字渲染)在联合 RL 中存在梯度干扰,混合任务训练下部分任务永远到不了自己的性能天花板;而单纯蒸馏离线教师又有 off-policy 的分布错配。并行专家 RL 消除干扰、on-policy 蒸馏消除分布错配,两者组合恰好补上了两个洞。Swift-Image 论文里那句 "specializing conflicting objectives before consolidation"(先专门化冲突目标,再合并)可以作为这个范式的注脚。
另一个值得注意的趋同:Prompt Enhancer 与 U1.5"去 VE-VAE、原生统一"之外的思路互补——Swift-Image 选择把"高层意图理解/推理"与"像素渲染"显式解耦成两个模块(PE + DiT),PE 内部化推理而不调用外部工具。这与 UMM 系列里讨论过的 Gen-Searcher/Unify-Agent 等"渲染前推理"路线是同一方向的轻量实现。
四、VGAU-Diag:生成能不能帮理解?Oracle 协议给出迄今最干净的答案
4.1 论文概况
- 论文:When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?(arXiv:2608.22174,v1 5 月,v2 8/25)
- 机构:南京大学、清华大学、通义实验室(TongYi Lab)、复旦大学
- 代码开源:github.com/zyb1029/VGAU-Diag
它要裁决的是 UMM 领域争论最久的问题之一:视觉生成能不能作为中间推理过程来提升视觉理解? 已有评测证据混杂——VCoT(视觉思维链,交错图文推理)、GtA(先生成辅助图再回答)、VR(直接输出视觉答案)三种范式都有人报涨点,也都有人复现不出来。
4.2 框架设计:三个"解耦"
作者指出现有评测的三个混淆因素,并逐一解耦:
- 按难度分层:不做混合难度的多选打分(多选题上 UMM 接近随机猜,结果不稳定),而是用可验证的视觉规划任务——迷宫、推箱子、路径、连连看、华容道、停车,六类各 100 题,按最优解长度分 easy/medium/hard,要求模型生成完整可执行解,用求解器做任务级判定(区分最优解准确率与可行解准确率)。
- 三种范式统一评测:Self-GtA(先生成网格/坐标增强图再文本推理)、Self-VCoT(逐步预测动作并生成下一视觉状态反馈循环)、Self-VR(直接生成编码答案的视觉输出)在同一设置下对比。
- Oracle-Assisted Reference Protocols(关键创新):用外部构造的"正确视觉辅助"替换模型自己生成的辅助,从而把"生成得好不好"与"理解得好不好"拆开:
- Text-CoT:纯文本推理基线;
- Oracle-VCoT:逐步视觉状态用外部正确状态替换;
- Oracle-GtA:辅助图用外部正确增强替换;
- Oracle-Aug-VCoT:每步正确状态再叠加结构增强线索。
- 给闭源 VLM 用 Oracle,估出"理解力足够强时这套辅助的上限";给 UMM 用 Oracle,自生成与 Oracle 的差距就是生成侧的锅,Oracle 仍然差就是理解侧的锅。
4.3 四个核心发现
发现一:生成辅助只在简单样本上可靠。 难度分层后看得很清楚:easy 题上视觉生成带来可观测涨点(视觉状态简单、规划 horizon 短时,UMM 能利用自生成辅助);medium/hard 上涨点大幅波动并经常消失——当前 UMM 无法把视觉生成稳定转化为长 horizon 复杂任务的理解增益。
发现二:主瓶颈在视觉理解侧,不在视觉生成侧。 这是对 U1 类模型 RL 设计最直接的一条。Oracle 设置下,闭源 VLM(如 Qwen3.6-Plus 推理模式)从同样的辅助中获得巨大收益(Oracle-GtA 在多类 easy/medium 题上冲到 90~100),证明辅助本身是有效的;而开源 UMM 即便喂给它忠实的 Oracle 辅助,成绩仍接近零——它们连"用好正确视觉辅助"的理解能力都不具备。换句话说,把钱花在让 UMM 生成更精美的中间图,收益有限;理解力不跟上,正确的图也读不懂。
发现三:三阶段过渡(three-stage transition)。 生成辅助的收益不是随生成质量单调递增的,而是:
- 任务无关噪声 → 干扰(生成的图与任务无关,纯添乱);
- 看似合理实则错误 → 误导(plausible but incorrect,比噪声更糟,因为模型会信);
- 高保真且任务对齐 → 有效辅助。 用 LPIPS 作为代理指标可以区分这三个阶段。这解释了为什么各家评测结论互相矛盾——不同模型停在不同阶段。
发现四:有效生成应瞄准理解瓶颈,而不是堆推理步数。 论文还揪出了此前 VCoT 评测的一个漏洞:optimal-step prior leakage(最优步数先验泄漏)——评测环境把"最优解多少步"泄漏给了模型,Self-VCoT 的不稳定涨点很大程度来自这个泄漏,而不是视觉链本身。修正泄漏后,瞄准决策关键视觉状态的 targeted GtA 比逐步生成视觉状态的 VCoT 更可靠。结论:好的视觉生成是"在理解卡住的那个决策点上生成关键辅助",而不是"多生成几个中间视觉状态"。
4.4 对 U1 训练中 RL 设计的直接指导
结合 UMM07 后训练篇的框架,VGAU-Diag 的诊断可以翻译成几条可执行的 RL 设计原则:
- RL 奖励的大头应押在视觉理解侧(感知、空间关系、 grounding),而非生成画质侧——Oracle 实验说明理解力是约束瓶颈,生成质量在 easy 题以上已不是短板。
- 生成辅助类任务的奖励设计要"瓶颈靶向":奖励"在关键决策状态生成有用辅助"(targeted GtA),而不是奖励"生成更多视觉中间步骤"(VCoT 式堆步数)。后者的涨点可能只是先验泄漏。
- 课程从 easy 开始是有道理的:三阶段过渡意味着生成辅助在能力不足时是负收益(误导 > 噪声),RL 课程应先让模型在简单视觉状态上达到"能用辅助"的阶段,再拉难度,否则模型学到的是依赖错误线索。
- 评测必须做难度分层 + Oracle 对照:混合难度的单一总分会同时掩盖 easy 的真实涨点和 hard 的失败;自家 UMM 报 VCoT 涨点时,先检查有没有步数先验泄漏。
- 与 GAS(下一节)合看:既然瓶颈在理解侧共享视觉通路的表征质量,那么"用生成任务做训练期监督来打磨理解表征"就有了明确的动机——这正是 GAS 的切入点。
五、GAS:生成只做训练期辅助监督,推理时整支丢弃,零开销
5.1 论文概况
- 论文:Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction(arXiv:2608.12209,8/12)
- 机构:字节跳动(Zhongbin Guo、Jiahao Xie、Dongling Xiao、Qianle Wang、Ruiqi Lu、Xiaomin He、Wanxuan Sun、Cheng Yang)
- 一句话:不做统一模型,而是把"生成"当成训练时的辅助损失来增强纯理解模型;训练完把生成分支整个扔掉,推理成本、延迟、显存与基线严格一致。
5.2 出发点:为什么直接做 UMM 反而可能掉理解
论文把现有路线的矛盾讲得很直白:
- MLLM 的训练目标是文本 next-token prediction,模型被训练去"谈论图像"而不是"从图像中学习"——语言表达不了精确空间关系、像素边界、物理交互,视觉信息在 LLM 深层推理中逐层衰减;
- UMM 联合训练理解与生成,但两个问题无解:① 推理时保留生成侧参数,延迟和显存成本阻碍部署;② 生成目标为合成质量优化,而非为理解增益优化,简单联合训练下理解性能经常持平甚至倒退。
5.3 三个核心设计
(1)NEP(Next Embedding Prediction):在理解模型自己的表征空间里做"生成" 不用离散 VQ tokenizer,也不用扩散 latent——这两者的目标空间与理解分支消费的连续嵌入空间是脱节的。GAS 的生成目标直接定义为 z_tgt = Projector(ViT(I_tgt)),即目标图像经过同一个 ViT + 同一个投影器后的连续嵌入序列;生成分支自回归预测这些嵌入,损失用 L2 归一化后的余弦距离。目标投影器用 EMA 稳定权重,防止联合训练中投影器漂移导致监督坍缩。这样"生成"不需要像素解码器,监督信号直接落在理解通路使用的表征流形上。同期工作 UniHetero 也发现"在 LLM 输入嵌入上做自回归"是极强的视觉学习器,GAS 的差异在于把它用于指令条件的跨图预测并挂在可丢弃的非对称 MoT 分支上。
(2)Decoupled MoT:共享下层、分叉上层 在中间层 l_split 处分叉:
- 理解分支:继续走完上层,只受文本交叉熵 L_und 监督;
- 生成分支:N_gen 层独立 Transformer(参数从理解骨干对应层复制初始化)+ 一个 vision-head,只受 NEP 损失 L_gen 监督。
协同机制是非对称梯度流:生成损失的梯度可以回传到共享的下层 trunk 和视觉投影器,强迫下层产出富含精细视觉细节的中间表征 H(l_split)——而这正是理解分支上层的输入,视觉增强被"无缝继承";理解分支上层虽然被屏蔽了生成梯度,但持续吃到更强的输入,被迫在 L_und 下适应这些特征(表现为注意力头更精准地锚定问题相关区域)。总损失 L = L_und + λ·L_gen。推理时 Θ_gen 和 vision-head 全部丢弃,只有理解分支前向。
需要澄清一个成本表述:零开销指的是推理时零额外成本(延迟/显存与基线严格相同);训练时并非免费——GAS 约多耗 11.6% 的 GPU 小时。这是一个非常划算的交换比。
(3)生成任务构造:要"深度认知接地"的生成,不要"画一只猫" 论文最有洞察力的一点:通用 T2I("生成一只猫")只要求名词-概念的浅层对齐,对复杂视觉推理几乎没有训练信号;当生成行为本身必须先完成精细空间定位、组合场景分析或多步逻辑推导时,生成目标就成了一个 forcing function,逼着网络长出纯文本监督给不了的感知能力。
他们构造了 5 大类 15 个子任务、约 1000 万样本的自动合成流水线(无需人工标注):
| 任务类 | 要求的底层能力 |
|---|---|
| Grounding(定位) | 解析复杂指代表达 → 预测绝对空间坐标,练精细空间推理 |
| Segmentation(分割) | 按复杂指令理解语义边界与物理范围,练实例级判别 |
| Image Editing(编辑) | 风格迁移/物体移除前先理解布局与物体依赖,练组合理解 |
| Visual CoT(视觉思维链) | 主动生成中间视觉证据(高亮关键区域)锚定多步推导,"用图像思考" |
| T2I(文生图) | 密集结构提示 + 世界知识的精选合成,建立基础跨模态对齐 |
5.4 实验结论
- 在 2B 和 4B 两个骨干上,GAS 都提升了综合多模态理解分,**最可靠的涨点在感知(perception)和空间理解(spatial comprehension)**类 benchmark;
- 消融证实:与理解潜在相关性越强的生成任务涨点越大(grounding/segmentation 类 > 通用 T2I),多类任务组合在感知型和推理型 benchmark 上互补;
- 表征级分析:生成监督提升了共享通路的视觉信息保持(visual retention)和空间精度,文本-only 推理能力也有轻微提升;
- 直接把 NEP 损失加在共享骨干上(不解耦)会损伤理解——验证了解耦架构的必要性,也呼应了 UMM 领域"理解与生成目标存在优化冲突"的反复观察(如 CVPR MMF5M 2026 那篇 DPO 诊断:多任务 DPO 中生成与理解的 token 量级失衡是主导干扰机制)。
5.5 GAS 与 VGAU-Diag 的闭环
这两篇放在一起读特别有意思,它们恰好从"评测"和"训练"两端收敛:
- VGAU-Diag 说:瓶颈在理解侧——UMM 连正确的视觉辅助都用不好,别急着堆生成画质;
- GAS 说:那就对了——生成的价值不在推理时产出图像,而在训练时打磨理解侧的共享视觉表征;把生成梯度通过解耦架构注入共享下层,把理解上层保护起来,推理时生成分支去死。
VGAU-Diag 的发现三(任务无关生成是噪声、貌似合理的错误生成是误导)也为 GAS 的任务构造原则提供了独立佐证:GAS 只选"深度认知接地"的生成任务、并发现通用 T2I 涨点最小,本质上就是在训练数据层面避开"噪声/误导"区间,让生成监督始终落在三阶段过渡的"有效辅助"区间。
六、四个动态的合读:2026 下半年 UMM 的五条走向
走向一:统一模型的竞争焦点从"能不能生成"转向"能不能控制"。 Gemini Omni 1.1 的更新清单里没有一项是画质——场景扩展的 10 秒上下文、首尾帧插值、360p 草稿、4K 超分、有状态会话,全是控制与生产流程杠杆。视频生成的产品化门槛已经不是"生成一条好看的片",而是"能不能被 Agent 规划循环反复调用、评估、修正"。
走向二:"分治后蒸馏"(并行专家 RL + on-policy 蒸馏合并)正在成为异构多任务后训练的默认范式。 商汤 MOPD(U1.5)、阿里 Swift-Image(Multi-Teacher OPD)独立同构;扩散侧的 DiffusionOPD、DanceOPD 是共同的方法源头。逻辑闭环:联合 RL 有梯度干扰 → 专家分治消除干扰;离线教师有分布错配 → on-policy 采样消除错配。Swift-Image 还证明了这套范式的两个额外用途:跨容量蒸馏(6B→3B 近零掉点)和少步蒸馏(8 步反而更强)。
走向三:紧凑模型的胜负手是训练工程,不是参数量。 Swift-Image 6B + 243K GPU 小时做到开源综合第一、3B 近零掉点;论文反复强调"没有一个组件是新的,价值在于组织方式"——渐进课程的三轴顺序(先分辨率后任务)、Logit-Normal→Uniform 时间步切换、CFG 非对称 rollout、block-shared modulation 省参数给注意力、剪枝后重走课程而非短恢复。这些都是可以直接搬进自家训练手册的工程细节。
走向四:"生成帮理解"从信仰问题变成了可诊断、可设计的工程问题。 VGAU-Diag 给了诊断协议(难度分层 + Oracle + 求解器验证),结论是瓶颈在理解侧、收益存在三阶段过渡、VCoT 涨点要防先验泄漏;GAS 给了架构答案(NEP + 解耦 MoT + 认知接地任务,推理零开销,训练 +11.6%)。对做 U1 这类统一模型的团队,直接含义是:RL 预算优先押视觉理解与共享表征;生成辅助要靶向决策瓶颈而非堆步数;评测先过 Oracle 这一关。
走向五:理解与生成的"统一"正在分化出三种工程形态。
- 全统一(Gemini Omni、SenseNova U1/U1.5、BAGEL 路线):一套权重理解+生成,产品形态是对话式创作,吃世界知识 grounding 的红利;
- 训练统一、推理分离(GAS 路线):生成只作为训练期监督存在,推理时是纯理解模型,适合理解能力优先、部署成本敏感的场景;
- 模块化解耦(Swift-Image 的 PE + DiT):推理/规划与渲染分成两个模块,各自优化,渲染器内部再做生成-编辑统一。
这三种形态不是竞争替代,而是按"产品到底需不需要在推理时生成"来分流。VGAU-Diag 的诊断提醒大家:在推理时生成之前,先确认你的模型读得懂自己生成的东西。
参考链接
- Google 官方博客:Introducing Gemini Omni — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/
- Gemini Omni 1.1 Flash 定价解析(Apidog)— https://apidog.com/blog/gemini-omni-1-1-flash-pricing/
- Swift-Image 论文(arXiv:2608.20334)— https://arxiv.org/abs/2608.20334
- VGAU-Diag 论文(arXiv:2608.22174)— https://arxiv.org/abs/2608.22174 ;代码 https://github.com/zyb1029/VGAU-Diag
- GAS 论文(arXiv:2608.12209)— https://arxiv.org/abs/2608.12209
- 本系列前文:SenseNova U1.5 深度解析(MOPD)、UMM 学习路径、UMM 论文解读 07·后训练篇