Back

UMM 四大前沿动态深度调研:Gemini Omni 1.1 Flash GA、Swift-Image、VGAU-Diag 与 GAS

本篇是 UMM 系列的第八篇延伸(前七篇见 08-24 学习路径、08-25 论文解读 01~06、08-26 论文解读 07 后训练篇)。2026 年 8 月下旬,统一多模态领域密集出现四个值得记录的动态:Google 把视频 any-to-any 的统一模型推到 GA 生产版本;阿里用 6B/3B 的小模型证明"训练工程"可以把紧凑统一模型推到开源第一;南京大学、清华、复旦与通义实验室的诊断框架首次用 Oracle 协议回答了"生成到底能不能帮理解"这个争论已久的问题;字节的 GAS 则给出了一个几乎零代价的答案——让生成能力只在训练时存在。

四个动态分别对应 UMM 的四个层面:产品化里程碑(Gemini)、训练工程范式(Swift-Image)、能力边界诊断(VGAU-Diag)、架构与监督设计(GAS)。放在一起看,它们勾勒出 2026 下半年统一模型的清晰走向。


一、总览:四条新闻,四个层面

动态 时间 机构 层面 一句话结论
Gemini Omni 1.1 Flash GA 8/27 GA Google DeepMind 产品化 统一模型第一次在视频域有了"可规划、可交付"的生产级版本
Swift-Image 6B/3B 8/20 arXiv 阿里巴巴 训练工程 6B 参数 + 243K GPU 小时做到开源第一,3B 蒸馏几乎零掉点
VGAU-Diag 8/25 v2(初版 5 月) 南大/清华/通义/复旦 诊断评估 UMM 的瓶颈在视觉理解侧,不在视觉生成侧
GAS 8/12 arXiv 字节跳动 架构与监督 生成作为训练期辅助监督,推理时整条生成分支丢弃,零开销

这四件事看似分散,实则回答的是同一个核心问题的四个侧面——统一模型(同时具备理解与生成)到底该怎么建、怎么训、怎么评、怎么用

  • Gemini 回答"统一模型产品化后长什么样";
  • Swift-Image 回答"有限算力下统一模型怎么训到最强";
  • VGAU-Diag 回答"生成能力对理解的增益到底存不存在、卡在哪";
  • GAS 回答"如果增益有限或代价太大,能不能只要训练时的好处、不要推理时的成本"。

下面逐一展开。


二、Gemini Omni 1.1 Flash GA:视频统一模型从"碰运气"到"可规划"

2.1 它是什么

Gemini Omni 是 Google DeepMind 于 2026 年 5 月发布的原生多模态模型家族,定位是"create anything from any input — starting with video":图像、音频、视频、文本任意组合作为输入,输出视频,并且支持通过对话进行多轮视频编辑——每一条指令都建立在上一条的结果之上,角色保持一致、物理规律保持成立、场景记得之前发生过什么。

8 月 27 日,家族第一个模型 Gemini Omni Flash 从预览版正式 GA(gemini-omni-1.1-flash),预览端点 gemini-omni-flash-preview 随后退役。它不是一次画质的代际飞跃,而是一次控制力的代际升级:核心生成质量基本不变,开发者拿到的是一组"可编程的杠杆"。

2.2 五大控制能力

GA 版本的关键更新可以归纳为五项:

  1. Scene Extension(场景扩展):在已有视频基础上无缝续接。此前模型只能参考最后 1 秒,1.1 可以分析最长 10 秒的前置上下文,每次续接 10 秒,累计可把视频延长到 40 秒。这解决的是长叙事的连贯性问题——人物、场景、动作风格不会在续接处"失忆"。
  2. Keyframe Interpolation(首尾帧插值):给定起始帧和结束帧,模型补全中间的连续视频。适合运镜、环绕、变焦、转场和无缝循环,把"提示词碰运气"变成"端点约束下的插值"。
  3. 3 秒参考视频:构建场景时最多可上传参考视频(官方文档给出的参考时长为 3 秒级别),帮助模型理解视觉语境,保证角色外观和行为逻辑的一致性;图像、音频参考同样支持(音频初期仅支持语音参考)。
  4. 360p 草稿模式:低分辨率快速出草稿,速度比 720p 最高快 60%、成本约为三分之一,用于分镜迭代、构图验证。
  5. 4K 超分成品:草稿确认后可直接输出 1080p 或 4K 成片,无需外接超分工具。

2.3 定价:按 token 计费,360p 草稿是成本杠杆

Google 没有按"秒"直接定价,而是视频输出按 token 计费(720p 每秒约 5,792 个输出 token,视频输出单价 $17.50 / 1M tokens),折算成分辨率阶梯:

分辨率 每秒价格 10 秒成本
360p $0.03 $0.30
720p $0.10 $1.00
1080p $0.15 $1.50
4K $0.30 $3.00

输入(文本/图像/视频/音频)1.50/1Mtokens,文本输出1.50 / 1M tokens,文本输出 9.00 / 1M tokens,无免费额度。官方推荐工作流是"360p 草稿反复迭代 → 确认后只对成片做 1080p/4K",把迭代成本压到最低。

2.4 为什么这是统一模型的里程碑

技术上有三点值得记录:

  • 多轮有状态会话(stateful session IDs):API 支持多轮、有状态的编辑会话。这意味着 Agent 可以把视频生成纳入规划循环——360p 出草稿 → 视觉模型逐镜评估 → 不满意就扩展/插值修复连续性 → 只有达标的镜头才超分到 4K。视频生成从"一次性抽奖"变成了"可组合的编辑组件"。
  • 理解与生成共用 Gemini 的世界知识:官方强调 Omni 不只是"看起来真实",而是会推理"接下来应该发生什么"——重力、动能、流体动力学的直觉理解,加上历史、科学、文化知识。这正是统一架构相对纯视频生成模型(Sora、Kling 路线)的核心差异点:生成建立在理解之上
  • 生态接入:Adobe Firefly、Figma Weave、Runway、GMI Cloud 已集成;Google Flow、Gemini App、YouTube Shorts 面向消费者开放,AI Studio 与 Agent Platform API 面向开发者。

定位上也要清醒:追求电影感和艺术风格,Sora 仍被认为是第一梯队;Omni 1.1 Flash 的强项是控制、迭代、对话式编辑和知识 grounding,而且它只是 Flash 档——Pro/Ultra 档尚未发布。


三、Swift-Image:6B 做到开源第一,"分治后蒸馏"的第二次独立验证

3.1 论文概况

  • 论文:Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models(arXiv:2608.20334,8/20 提交,8/21 v2)
  • 机构:阿里巴巴,23 位作者,11 位共同一作(Taihang Hu、Zhao Wang、Zuan Gao 等),通讯作者 Mengting Chen
  • 定位:一套权重同时支持文生图(T2I)、单图编辑、多图编辑;6B 单流 DiT,总训练成本约 243K GPU 小时;在评测的开源模型中综合性能第一,压缩后的 3B 版本几乎零掉点

论文的姿态很克制:它不声称任何单个组件是新发明,而是回答一个工程问题——"在受限算力预算下,一个紧凑的视觉生成器靠系统性的训练工程能推到多远?"

3.2 架构:Qwen3-VL 做语义条件,FLUX.2 AE 做像素通道

  • 条件编码器:共享的 Qwen3-VL-8B 接收系统提示、参考图和用户指令;取其三个均匀间隔隐层的表示拼接后经 MLP 映射进扩散隐空间。值得注意的是 VLM 的图像输出 token 送入 DiT(消融显示只增序列长度、无质量增益)。
  • 像素通道:输入图与加噪目标图由 FLUX.2 AE 编码后线性投影,保留像素级参考信息。
  • 渲染器:6B 并行单流 DiT(parallel single-stream),Attention 与 SwiGLU MLP 并行计算(算子融合,推理效率约 +10%)、block-shared timestep modulation(把参数预算让给注意力和 FFN)、4D-RoPE [T,H,W,L]、多图沿 T 轴偏移 10 防止空间坐标坍缩(减少多图编辑的 copy-paste 伪影)、图内文字用字符级 tokenization。
  • 两个工程教训值得记下:① VLM 的理解 benchmark 分数高 ≠ 生成条件好(Qwen3.5-4B 收敛慢于 Qwen3-VL-8B);② 自编码器不能只看早期收敛——内部 PAE 学得快但重建误差封死质量天花板,FLUX.2 AE 的重建-收敛权衡最好。

3.3 训练流水线:渐进训练 → 并行专家 RL → 多教师在线蒸馏

整条 pipeline 是这篇论文最值得借鉴的部分:

第一阶段:Progressive Training(渐进式预训练 + SFT) 沿三条轴做 coarse-to-fine 课程:分辨率、任务复杂度、数据质量。核心原则是"先提分辨率,再引入异构编辑目标",避免空间尺度与任务分布同时切换导致不稳定:

  • 基础预训练 500K 步:低分辨率 T2I 起步(256→512px),建立广泛语义覆盖后才混入编辑数据;
  • 持续预训练(CT)200K 步:512→1024px,数据分布转向更高质量来源,VLM 层级语义标签 + 类目重采样保长尾;
  • SFT 10K 步:1024px 人工验证高质量子集,按评测结果对弱项做数据增强。
  • 一个细节:预训练用 Logit-Normal 时间步采样(强调中噪声态和全局结构),SFT 切换到 Uniform 采样(监督覆盖整条轨迹,强化精细纹理)。

第二阶段:Parallel Expert RL(并行专家强化学习) 混合任务 RL 的两个老问题——异构目标梯度互相干扰(跷跷板效应)、group-rollout 样本效率低导致欠优化任务训不动、长程扩散 RL 容易模式坍缩——他们的解法是不强行用一个策略吃下所有任务

  • 多维奖励系统:T2I 评图文对齐/类目感知美学/画质/风格;编辑评指令遵循/参考一致性/画质;外加 ArcFace 人脸身份奖励、PP-OCRv6 文字渲染奖励;
  • Guidance-enhanced rollout:采样时开 CFG 拿到高质量候选,策略更新时不开 CFG(省算力,同时把引导采样能力隐式转移给无引导策略);
  • 任务感知奖励路由:用 Diffusion-NFT 并行训练多个任务一致的专家策略——一个 T2I 专家、一个通用编辑专家、若干针对联合训练中欠优化子领域的领域编辑专家。

第三阶段:Multi-Teacher On-Policy Distillation(多教师在线策略蒸馏,OPD) 专家的能力分散在各自 checkpoint 里。从混合任务策略初始化一个共享学生,每条在线采样的样本由其领域匹配的专家教师蒸馏,通才的均衡与专才的强度合并进一个模型。这一步之后还复用了两次:6B→3B 的剪枝恢复蒸馏、少步采样的任务专项巩固。

Prompt Enhancer(PE,渲染前推理):一个独立模块把用户短/复杂请求翻译成渲染器对齐的显式视觉规格(refined_prompt);简单请求直接改写,知识密集/布局敏感请求先输出推理 trace。PE 用 SFT 学会"按复杂度自适应推理",再用冻结渲染器给出的图像级反馈做 GRPO(渲染出来不对就惩罚),不需要在线搜索。PE 在 3B/6B 上都稳定涨点,知识密集、组合式、布局敏感任务涨幅最大。

部署压缩:结构化剪枝(注意力头 32→24,存活参数直接继承)后重走 CT+SFT 课程恢复,配合 6B 教师的速度预测 KD,再经跨容量 OPD 得到 3B;少步蒸馏用 DMD/CDM 路线把 50 步压到 8 步(动态反向模拟、学生自采样轨迹、对抗头挂在冻结教师晚层)。反直觉的结论:少步蒸馏版本的综合编辑性能反而更强——蒸馏起到了额外的正则化/整合作用。

3.4 与 SenseNova U1.5 MOPD 的关系:两家独立发现"分治后蒸馏"

这是本篇最想强调的一点。在 08-22 的 SenseNova U1.5 深度解析 中,商汤的正式版采用了 MOPD(Multi-Expert Online Policy Distillation,多专家在线策略蒸馏):先在图像域训练多个专家(生成专家、编辑专家等),再通过在线策略蒸馏把多专家能力无损融合到单体 8B 模型;后训练阶段同样用任务导向 RL 聚焦指令遵循。

Swift-Image 的做法在范式上同构

环节 SenseNova U1.5(商汤) Swift-Image(阿里)
异构能力处理 多专家分别训练 Parallel Expert RL(Diffusion-NFT 并行专家)
能力合并 MOPD 在线策略蒸馏 Multi-Teacher OPD 在线策略蒸馏
蒸馏时机 专家 on-policy 采样 → 学生 专家 on-policy 样本按领域路由给对应教师
RL 定位 任务导向 RL(指令遵循) 多维奖励 RL + CFG 非对称 rollout
额外用途 为视频/3D 专家融合预留范式 OPD 复用于 6B→3B 压缩与少步蒸馏

两家机构、两条模型线,在没有互相引用的情况下(Swift-Image 的 OPD 引用的是 DiffusionOPD、DanceOPD 等扩散侧工作流),收敛到了同一个后训练范式:"分治"(把互相冲突的目标拆给并行专家)+ "后蒸馏"(用 on-policy 蒸馏把专家合并回单体)

为什么这个范式会成为共识?逻辑链在 UMM07 后训练篇里已经埋好:统一模型的异构目标(生成 vs 编辑、美学 vs 一致性 vs 文字渲染)在联合 RL 中存在梯度干扰,混合任务训练下部分任务永远到不了自己的性能天花板;而单纯蒸馏离线教师又有 off-policy 的分布错配。并行专家 RL 消除干扰、on-policy 蒸馏消除分布错配,两者组合恰好补上了两个洞。Swift-Image 论文里那句 "specializing conflicting objectives before consolidation"(先专门化冲突目标,再合并)可以作为这个范式的注脚。

另一个值得注意的趋同:Prompt Enhancer 与 U1.5"去 VE-VAE、原生统一"之外的思路互补——Swift-Image 选择把"高层意图理解/推理"与"像素渲染"显式解耦成两个模块(PE + DiT),PE 内部化推理而不调用外部工具。这与 UMM 系列里讨论过的 Gen-Searcher/Unify-Agent 等"渲染前推理"路线是同一方向的轻量实现。


四、VGAU-Diag:生成能不能帮理解?Oracle 协议给出迄今最干净的答案

4.1 论文概况

  • 论文:When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?(arXiv:2608.22174,v1 5 月,v2 8/25)
  • 机构:南京大学、清华大学、通义实验室(TongYi Lab)、复旦大学
  • 代码开源:github.com/zyb1029/VGAU-Diag

它要裁决的是 UMM 领域争论最久的问题之一:视觉生成能不能作为中间推理过程来提升视觉理解? 已有评测证据混杂——VCoT(视觉思维链,交错图文推理)、GtA(先生成辅助图再回答)、VR(直接输出视觉答案)三种范式都有人报涨点,也都有人复现不出来。

4.2 框架设计:三个"解耦"

作者指出现有评测的三个混淆因素,并逐一解耦:

  1. 按难度分层:不做混合难度的多选打分(多选题上 UMM 接近随机猜,结果不稳定),而是用可验证的视觉规划任务——迷宫、推箱子、路径、连连看、华容道、停车,六类各 100 题,按最优解长度分 easy/medium/hard,要求模型生成完整可执行解,用求解器做任务级判定(区分最优解准确率与可行解准确率)。
  2. 三种范式统一评测:Self-GtA(先生成网格/坐标增强图再文本推理)、Self-VCoT(逐步预测动作并生成下一视觉状态反馈循环)、Self-VR(直接生成编码答案的视觉输出)在同一设置下对比。
  3. Oracle-Assisted Reference Protocols(关键创新):用外部构造的"正确视觉辅助"替换模型自己生成的辅助,从而把"生成得好不好"与"理解得好不好"拆开:
    • Text-CoT:纯文本推理基线;
    • Oracle-VCoT:逐步视觉状态用外部正确状态替换;
    • Oracle-GtA:辅助图用外部正确增强替换;
    • Oracle-Aug-VCoT:每步正确状态再叠加结构增强线索。
    • 给闭源 VLM 用 Oracle,估出"理解力足够强时这套辅助的上限";给 UMM 用 Oracle,自生成与 Oracle 的差距就是生成侧的锅,Oracle 仍然差就是理解侧的锅。

4.3 四个核心发现

发现一:生成辅助只在简单样本上可靠。 难度分层后看得很清楚:easy 题上视觉生成带来可观测涨点(视觉状态简单、规划 horizon 短时,UMM 能利用自生成辅助);medium/hard 上涨点大幅波动并经常消失——当前 UMM 无法把视觉生成稳定转化为长 horizon 复杂任务的理解增益。

发现二:主瓶颈在视觉理解侧,不在视觉生成侧。 这是对 U1 类模型 RL 设计最直接的一条。Oracle 设置下,闭源 VLM(如 Qwen3.6-Plus 推理模式)从同样的辅助中获得巨大收益(Oracle-GtA 在多类 easy/medium 题上冲到 90~100),证明辅助本身是有效的;而开源 UMM 即便喂给它忠实的 Oracle 辅助,成绩仍接近零——它们连"用好正确视觉辅助"的理解能力都不具备。换句话说,把钱花在让 UMM 生成更精美的中间图,收益有限;理解力不跟上,正确的图也读不懂。

发现三:三阶段过渡(three-stage transition)。 生成辅助的收益不是随生成质量单调递增的,而是:

  1. 任务无关噪声 → 干扰(生成的图与任务无关,纯添乱);
  2. 看似合理实则错误 → 误导(plausible but incorrect,比噪声更糟,因为模型会信);
  3. 高保真且任务对齐 → 有效辅助。 用 LPIPS 作为代理指标可以区分这三个阶段。这解释了为什么各家评测结论互相矛盾——不同模型停在不同阶段。

发现四:有效生成应瞄准理解瓶颈,而不是堆推理步数。 论文还揪出了此前 VCoT 评测的一个漏洞:optimal-step prior leakage(最优步数先验泄漏)——评测环境把"最优解多少步"泄漏给了模型,Self-VCoT 的不稳定涨点很大程度来自这个泄漏,而不是视觉链本身。修正泄漏后,瞄准决策关键视觉状态的 targeted GtA 比逐步生成视觉状态的 VCoT 更可靠。结论:好的视觉生成是"在理解卡住的那个决策点上生成关键辅助",而不是"多生成几个中间视觉状态"。

4.4 对 U1 训练中 RL 设计的直接指导

结合 UMM07 后训练篇的框架,VGAU-Diag 的诊断可以翻译成几条可执行的 RL 设计原则:

  1. RL 奖励的大头应押在视觉理解侧(感知、空间关系、 grounding),而非生成画质侧——Oracle 实验说明理解力是约束瓶颈,生成质量在 easy 题以上已不是短板。
  2. 生成辅助类任务的奖励设计要"瓶颈靶向":奖励"在关键决策状态生成有用辅助"(targeted GtA),而不是奖励"生成更多视觉中间步骤"(VCoT 式堆步数)。后者的涨点可能只是先验泄漏。
  3. 课程从 easy 开始是有道理的:三阶段过渡意味着生成辅助在能力不足时是负收益(误导 > 噪声),RL 课程应先让模型在简单视觉状态上达到"能用辅助"的阶段,再拉难度,否则模型学到的是依赖错误线索。
  4. 评测必须做难度分层 + Oracle 对照:混合难度的单一总分会同时掩盖 easy 的真实涨点和 hard 的失败;自家 UMM 报 VCoT 涨点时,先检查有没有步数先验泄漏。
  5. 与 GAS(下一节)合看:既然瓶颈在理解侧共享视觉通路的表征质量,那么"用生成任务做训练期监督来打磨理解表征"就有了明确的动机——这正是 GAS 的切入点。

五、GAS:生成只做训练期辅助监督,推理时整支丢弃,零开销

5.1 论文概况

  • 论文:Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction(arXiv:2608.12209,8/12)
  • 机构:字节跳动(Zhongbin Guo、Jiahao Xie、Dongling Xiao、Qianle Wang、Ruiqi Lu、Xiaomin He、Wanxuan Sun、Cheng Yang)
  • 一句话:不做统一模型,而是把"生成"当成训练时的辅助损失来增强纯理解模型;训练完把生成分支整个扔掉,推理成本、延迟、显存与基线严格一致。

5.2 出发点:为什么直接做 UMM 反而可能掉理解

论文把现有路线的矛盾讲得很直白:

  • MLLM 的训练目标是文本 next-token prediction,模型被训练去"谈论图像"而不是"从图像中学习"——语言表达不了精确空间关系、像素边界、物理交互,视觉信息在 LLM 深层推理中逐层衰减;
  • UMM 联合训练理解与生成,但两个问题无解:① 推理时保留生成侧参数,延迟和显存成本阻碍部署;② 生成目标为合成质量优化,而非为理解增益优化,简单联合训练下理解性能经常持平甚至倒退

5.3 三个核心设计

(1)NEP(Next Embedding Prediction):在理解模型自己的表征空间里做"生成" 不用离散 VQ tokenizer,也不用扩散 latent——这两者的目标空间与理解分支消费的连续嵌入空间是脱节的。GAS 的生成目标直接定义为 z_tgt = Projector(ViT(I_tgt)),即目标图像经过同一个 ViT + 同一个投影器后的连续嵌入序列;生成分支自回归预测这些嵌入,损失用 L2 归一化后的余弦距离。目标投影器用 EMA 稳定权重,防止联合训练中投影器漂移导致监督坍缩。这样"生成"不需要像素解码器,监督信号直接落在理解通路使用的表征流形上。同期工作 UniHetero 也发现"在 LLM 输入嵌入上做自回归"是极强的视觉学习器,GAS 的差异在于把它用于指令条件的跨图预测并挂在可丢弃的非对称 MoT 分支上。

(2)Decoupled MoT:共享下层、分叉上层 在中间层 l_split 处分叉:

  • 理解分支:继续走完上层,只受文本交叉熵 L_und 监督;
  • 生成分支:N_gen 层独立 Transformer(参数从理解骨干对应层复制初始化)+ 一个 vision-head,只受 NEP 损失 L_gen 监督。

协同机制是非对称梯度流:生成损失的梯度可以回传到共享的下层 trunk 和视觉投影器,强迫下层产出富含精细视觉细节的中间表征 H(l_split)——而这正是理解分支上层的输入,视觉增强被"无缝继承";理解分支上层虽然被屏蔽了生成梯度,但持续吃到更强的输入,被迫在 L_und 下适应这些特征(表现为注意力头更精准地锚定问题相关区域)。总损失 L = L_und + λ·L_gen。推理时 Θ_gen 和 vision-head 全部丢弃,只有理解分支前向。

需要澄清一个成本表述:零开销指的是推理时零额外成本(延迟/显存与基线严格相同);训练时并非免费——GAS 约多耗 11.6% 的 GPU 小时。这是一个非常划算的交换比。

(3)生成任务构造:要"深度认知接地"的生成,不要"画一只猫" 论文最有洞察力的一点:通用 T2I("生成一只猫")只要求名词-概念的浅层对齐,对复杂视觉推理几乎没有训练信号;当生成行为本身必须先完成精细空间定位、组合场景分析或多步逻辑推导时,生成目标就成了一个 forcing function,逼着网络长出纯文本监督给不了的感知能力。

他们构造了 5 大类 15 个子任务、约 1000 万样本的自动合成流水线(无需人工标注):

任务类 要求的底层能力
Grounding(定位) 解析复杂指代表达 → 预测绝对空间坐标,练精细空间推理
Segmentation(分割) 按复杂指令理解语义边界与物理范围,练实例级判别
Image Editing(编辑) 风格迁移/物体移除前先理解布局与物体依赖,练组合理解
Visual CoT(视觉思维链) 主动生成中间视觉证据(高亮关键区域)锚定多步推导,"用图像思考"
T2I(文生图) 密集结构提示 + 世界知识的精选合成,建立基础跨模态对齐

5.4 实验结论

  • 在 2B 和 4B 两个骨干上,GAS 都提升了综合多模态理解分,**最可靠的涨点在感知(perception)和空间理解(spatial comprehension)**类 benchmark;
  • 消融证实:与理解潜在相关性越强的生成任务涨点越大(grounding/segmentation 类 > 通用 T2I),多类任务组合在感知型和推理型 benchmark 上互补;
  • 表征级分析:生成监督提升了共享通路的视觉信息保持(visual retention)和空间精度,文本-only 推理能力也有轻微提升;
  • 直接把 NEP 损失加在共享骨干上(不解耦)会损伤理解——验证了解耦架构的必要性,也呼应了 UMM 领域"理解与生成目标存在优化冲突"的反复观察(如 CVPR MMF5M 2026 那篇 DPO 诊断:多任务 DPO 中生成与理解的 token 量级失衡是主导干扰机制)。

5.5 GAS 与 VGAU-Diag 的闭环

这两篇放在一起读特别有意思,它们恰好从"评测"和"训练"两端收敛:

  • VGAU-Diag 说:瓶颈在理解侧——UMM 连正确的视觉辅助都用不好,别急着堆生成画质;
  • GAS 说:那就对了——生成的价值不在推理时产出图像,而在训练时打磨理解侧的共享视觉表征;把生成梯度通过解耦架构注入共享下层,把理解上层保护起来,推理时生成分支去死。

VGAU-Diag 的发现三(任务无关生成是噪声、貌似合理的错误生成是误导)也为 GAS 的任务构造原则提供了独立佐证:GAS 只选"深度认知接地"的生成任务、并发现通用 T2I 涨点最小,本质上就是在训练数据层面避开"噪声/误导"区间,让生成监督始终落在三阶段过渡的"有效辅助"区间。


六、四个动态的合读:2026 下半年 UMM 的五条走向

走向一:统一模型的竞争焦点从"能不能生成"转向"能不能控制"。 Gemini Omni 1.1 的更新清单里没有一项是画质——场景扩展的 10 秒上下文、首尾帧插值、360p 草稿、4K 超分、有状态会话,全是控制与生产流程杠杆。视频生成的产品化门槛已经不是"生成一条好看的片",而是"能不能被 Agent 规划循环反复调用、评估、修正"。

走向二:"分治后蒸馏"(并行专家 RL + on-policy 蒸馏合并)正在成为异构多任务后训练的默认范式。 商汤 MOPD(U1.5)、阿里 Swift-Image(Multi-Teacher OPD)独立同构;扩散侧的 DiffusionOPD、DanceOPD 是共同的方法源头。逻辑闭环:联合 RL 有梯度干扰 → 专家分治消除干扰;离线教师有分布错配 → on-policy 采样消除错配。Swift-Image 还证明了这套范式的两个额外用途:跨容量蒸馏(6B→3B 近零掉点)和少步蒸馏(8 步反而更强)。

走向三:紧凑模型的胜负手是训练工程,不是参数量。 Swift-Image 6B + 243K GPU 小时做到开源综合第一、3B 近零掉点;论文反复强调"没有一个组件是新的,价值在于组织方式"——渐进课程的三轴顺序(先分辨率后任务)、Logit-Normal→Uniform 时间步切换、CFG 非对称 rollout、block-shared modulation 省参数给注意力、剪枝后重走课程而非短恢复。这些都是可以直接搬进自家训练手册的工程细节。

走向四:"生成帮理解"从信仰问题变成了可诊断、可设计的工程问题。 VGAU-Diag 给了诊断协议(难度分层 + Oracle + 求解器验证),结论是瓶颈在理解侧、收益存在三阶段过渡、VCoT 涨点要防先验泄漏;GAS 给了架构答案(NEP + 解耦 MoT + 认知接地任务,推理零开销,训练 +11.6%)。对做 U1 这类统一模型的团队,直接含义是:RL 预算优先押视觉理解与共享表征;生成辅助要靶向决策瓶颈而非堆步数;评测先过 Oracle 这一关。

走向五:理解与生成的"统一"正在分化出三种工程形态。

  • 全统一(Gemini Omni、SenseNova U1/U1.5、BAGEL 路线):一套权重理解+生成,产品形态是对话式创作,吃世界知识 grounding 的红利;
  • 训练统一、推理分离(GAS 路线):生成只作为训练期监督存在,推理时是纯理解模型,适合理解能力优先、部署成本敏感的场景;
  • 模块化解耦(Swift-Image 的 PE + DiT):推理/规划与渲染分成两个模块,各自优化,渲染器内部再做生成-编辑统一。

这三种形态不是竞争替代,而是按"产品到底需不需要在推理时生成"来分流。VGAU-Diag 的诊断提醒大家:在推理时生成之前,先确认你的模型读得懂自己生成的东西。


参考链接

评论