全双工语音模型精读①:Moshi——第一个实时全双工语音大模型,双流建模与 Inner Monologue
> 全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。 一、为什么它是"鼻祖" 在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流
> 全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。 一、为什么它是"鼻祖" 在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流
> 全双工语音模型系列精读第 2 篇。本文基于 Freeze-Omni 论文 arXiv:2411.00774v5 与官方项目页,梳理其"冻结骨干"路线。配套总览见《全双工语音大模型全景调研》。 一、它要解决的痛点:语音数据太少,微调会"变傻" GPT-4o 展示端到端语音交互后,2024
> 全双工语音模型系列精读第 3 篇。本文基于 GLM-4-Voice 技术报告 arXiv:2412.02612 与官方开源仓库,梳理其端侧中文实时语音方案。配套总览见《全双工语音大模型全景调研》。 一、定位:要"像人"、要实时、还要能本地跑 GLM-4-Voice(智谱 AI,Zeng
> 全双工语音模型系列精读第 4 篇。本文基于 Qwen3-Omni 技术报告 arXiv:2509.17765 与官方开源仓库,梳理其 Thinker-Talker MoE 架构。配套总览见《全双工语音大模型全景调研》;下一代 Qwen3.5-Omni 见该文第五节。 一、定位:首个"全模
> 全双工语音模型系列精读第 5 篇。本文逐节解读《Omni Interaction Agent Technical Report》(Gander,arXiv:2609.08977v2,2026 年 9 月 9 日)。该研究由腾讯混元语音团队(Hunyuan Speech Team, Tence
> 全双工语音模型系列精读第 6 篇。本文基于 Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30)与阿里云百炼 Realtime API 文档。配套总览见《全双工语音大模型全景调研》;上一代 Qw
> 全双工语音模型系列精读第 7 篇。本文基于 OpenAI 官方博客与官方帮助文档,梳理 OpenAI 语音线两代产品:gpt-realtime(2025-08-28 GA)与 GPT-Live(2026-07-08)。配套总览见《全双工语音大模型全景调研》。 一、OpenAI 语音线的两
> 全双工语音模型系列精读第 8 篇。本文基于 Google 官方 Gemini API 文档(Live API)梳理其原生多模态全双工方案。配套总览见《全双工语音大模型全景调研》。 一、定位:把"视觉在环"做成 Live API 标配 Gemini Live API 是 Google 面
> 全双工语音模型系列精读第 9 篇。本文基于字节 Seed 官方页面与火山引擎 API 文档,梳理字节语音全双工两步走:纯语音的 Seeduplex(2026.4)与音视频原生的 SeedRealtime(2026.8)。配套总览见《全双工语音大模型全景调研》。 一、字节的两步走 字节在