·多模态, 论文解读
1 分钟0
UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化
> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什
> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什
DeepSeek V4 Flash 深度解析:后训练驱动的 Agent 能力跃升与极致性价比 2026年7月31日,DeepSeek 正式上线了 V4-Flash 正式版 API。这次升级没有改动模型架构,纯粹靠后训练(Post-Training)就把 Agent 能力拉高了一大截,多项基准测