全双工语音模型精读①:Moshi——第一个实时全双工语音大模型,双流建模与 Inner Monologue
> 全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。 一、为什么它是"鼻祖" 在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流
半甜不要腻 · 记录学习、算法与 AI 前沿
这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。
> 全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。 一、为什么它是"鼻祖" 在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流
> 全双工语音模型系列精读第 2 篇。本文基于 Freeze-Omni 论文 arXiv:2411.00774v5 与官方项目页,梳理其"冻结骨干"路线。配套总览见《全双工语音大模型全景调研》。 一、它要解决的痛点:语音数据太少,微调会"变傻" GPT-4o 展示端到端语音交互后,2024
> 全双工语音模型系列精读第 3 篇。本文基于 GLM-4-Voice 技术报告 arXiv:2412.02612 与官方开源仓库,梳理其端侧中文实时语音方案。配套总览见《全双工语音大模型全景调研》。 一、定位:要"像人"、要实时、还要能本地跑 GLM-4-Voice(智谱 AI,Zeng
> 全双工语音模型系列精读第 4 篇。本文基于 Qwen3-Omni 技术报告 arXiv:2509.17765 与官方开源仓库,梳理其 Thinker-Talker MoE 架构。配套总览见《全双工语音大模型全景调研》;下一代 Qwen3.5-Omni 见该文第五节。 一、定位:首个"全模
> 全双工语音模型系列精读第 5 篇。本文逐节解读《Omni Interaction Agent Technical Report》(Gander,arXiv:2609.08977v2,2026 年 9 月 9 日)。该研究由腾讯混元语音团队(Hunyuan Speech Team, Tence
> 全双工语音模型系列精读第 6 篇。本文基于 Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30)与阿里云百炼 Realtime API 文档。配套总览见《全双工语音大模型全景调研》;上一代 Qw
> 全双工语音模型系列精读第 7 篇。本文基于 OpenAI 官方博客与官方帮助文档,梳理 OpenAI 语音线两代产品:gpt-realtime(2025-08-28 GA)与 GPT-Live(2026-07-08)。配套总览见《全双工语音大模型全景调研》。 一、OpenAI 语音线的两
> 全双工语音模型系列精读第 8 篇。本文基于 Google 官方 Gemini API 文档(Live API)梳理其原生多模态全双工方案。配套总览见《全双工语音大模型全景调研》。 一、定位:把"视觉在环"做成 Live API 标配 Gemini Live API 是 Google 面
> 全双工语音模型系列精读第 9 篇。本文基于字节 Seed 官方页面与火山引擎 API 文档,梳理字节语音全双工两步走:纯语音的 Seeduplex(2026.4)与音视频原生的 SeedRealtime(2026.8)。配套总览见《全双工语音大模型全景调研》。 一、字节的两步走 字节在
> 本文所有大厂模型数据均来自其官方博客、官方技术文档或 arXiv 论文,文末附一手来源链接。第三方实测数据单独标注。截至 2026 年 9 月 10 日。 一、先统一概念:全双工不是 0/1 开关 "全双工"(Full-duplex)来自通信领域:双方可以同时收发信号。对照三档: -
2026 年 7 月 31 日,字节的 Seedance 2.5 和 MiniMax 的 海螺 H3 同一天发布。这不是巧合,而是 AI 视频生产链刚好在这一天补齐了最后两块拼图:Seedance 2.5 是一台虚拟摄影机,擅长长镜头叙事和前期拍摄;H3 是一间后期机房
2026 年 9 月 3 日(美东),OpenAI 发布下一代旗舰模型 GPT-6 Astra(API 模型 ID `gpt-6-astra`)。这是 OpenAI 自 Sora 以来受关注度最高的一次发布——发布约 9 小时内相关内容浏览量 3600 万、点赞 16.4 万(Latent
> 2026 年 9 月 1 日,李飞飞联合创办的 World Labs 发布新一代世界模型 Atlas——官方称之为"全球首个多模态世界模型(omni world model)"。它从零预训练,原生处理文本、图像、视频、相机位姿与 3D 深度图,在同一个模型里完成世界生成、空间重建、时
> 2026 年 8 月 5 日,字节跳动 Seed 团队发布原生音视频全双工大模型 SeedRealtime,并在豆包 App 全量上线——官方称这是"业界音视频全双工技术的首次规模化落地"。它的定位不是"会说话的 Chatbot",而是"边看、边听、边说":模型持续看着摄像头画面、听着环
> 本篇是 UMM 系列的第八篇延伸(前七篇见 08-24 学习路径、08-25 论文解读 01~06、08-26 论文解读 07 后训练篇)。2026 年 8 月下旬,统一多模态领域密集出现四个值得记录的动态:Google 把视频 any-to-any 的统一模型推到 GA 生产版本;阿里用 6B