系列归档
2 个系列 · 19 篇文章,按目录顺序阅读;单篇文章见 时间归档
系列全双工语音模型精读10 篇
- 总览全双工语音大模型全景调研(2026年9月):13 个维度看懂 Moshi、GPT-Live、Gemini Live、SeedRealtime、Gander 们的技术路线
- 1全双工语音模型精读①:Moshi——第一个实时全双工语音大模型,双流建模与 Inner Monologue
- 2全双工语音模型精读②:Freeze-Omni——冻结 LLM、8 张卡 6 万条数据做出全双工语音对话
- 3全双工语音模型精读③:GLM-4-Voice-9B——175bps 单码本、12.5Hz、INT4 可本地跑的中文语音助手
- 4全双工语音模型精读④:Qwen3-Omni——Thinker-Talker MoE,音频首包 234ms 的开源全模态旗舰
- 5全双工语音模型精读⑤:Gander 论文精读——腾讯混元的全双工语音智能体,如何把"实时对话"和"长任务干活"缝进一个模型
- 6全双工语音模型精读⑥:Qwen3.5-Omni Realtime——Hybrid-MoE、ARIA 文音对齐与语义打断的全模态旗舰
- 7全双工语音模型精读⑦:OpenAI gpt-realtime 与 GPT-Live——从端到端 S2S API 到全双工前台/后台委派
- 8全双工语音模型精读⑧:Google Gemini Live API——原生多模态全双工、视觉在环与主动开口
- 9全双工语音模型精读⑨:字节 Seeduplex 与 SeedRealtime——RL 话轮决策到音视频原生全双工
系列UMM(理解与生成统一模型)9 篇
- 总览理解与生成统一模型(UMM)学习路径:从拼接架构到原生统一,从入门到前沿探索
- 1UMM论文解读01-基础奠基篇:从Transformer到VQGAN,七篇论文构建统一多模态的知识底座
- 2UMM论文解读02-早期统一模型篇:Chameleon、Emu3、Transfusion、Show-o的四条技术路线
- 3UMM论文解读03-主流模型篇:Janus-Pro、BAGEL、SenseNova U1的三种统一范式
- 4UMM论文解读04-VCoT篇:从Visual Sketchpad到CoT-VLA,视觉如何成为思维的载体
- 5UMM论文解读05-视频与世界模型篇:UniVideo双流统一、Emu3.5下一状态预测与Lance多任务协同
- 6UMM论文解读06-终章:从统一表征到AGI终局之战
- 7UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化
- 8UMM 四大前沿动态深度调研:Gemini Omni 1.1 Flash GA、Swift-Image、VGAU-Diag 与 GAS