·多模态, 论文解读
1 分钟0
UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化
> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什
> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什
DeepSeek 技术报告发展脉络综述:从 V1 到 V4 的三年进阶之路 摘要:从 2023 年底到 2026 年,DeepSeek(深度求索)用三年时间完成了从无人问津到全球瞩目的蜕变。本文系统梳理 DeepSeek 发布的五份核心技术报告(V1、V2、V3、R1、V4),解读其技
论文解析 | SAO:单轨迹异步优化在智能体强化学习中的应用 论文标题:Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning 作者:Zhenyu Hou, Yujiang Li