全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。
一、为什么它是"鼻祖"
在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流水线:VAD 检测你说完没有 → ASR 转文字 → 文本 LLM 想答案 → TTS 读出来。Moshi 论文(法国开源实验室 Kyutai,Défossez 等,2024-09-17 提交)把这套方案的三个病根讲得很透:
- 延迟累积:四个组件串联,全局延迟通常数秒;而真人对话的平均响应间隔只有约 230ms(Stivers 等跨 10 种语言的研究);
- 文本信息瓶颈:语义都压成文字,情绪、口音、笑声、背景声等"非语言但改变含义"的信息全部丢失;
- 话轮切分假设:系统假设对话是"一段段单人语音",但真实对话里重叠语音占 10%~20% 的说话时间,还有打断、插话、附和("OK""I see")。
Moshi 的答案是把语音对话直接建模为 speech-to-speech 生成,并做出第一个理论延迟 160ms、实测约 200ms 的实时全双工语音大模型——比真人 230ms 的平均响应还快。这也是"双流原生派"的开山之作。
二、整体架构:Helium + Mimi + 多流 RQ-Transformer
Moshi 由三块组成:
| 组件 | 角色 | 关键规格 |
|---|---|---|
| Helium | 文本语言模型骨干 | 7B 参数,在 2.1T token 公开英文语料上预训练 |
| Mimi | 神经音频 codec | 24kHz 音频,RVQ 残差量化,约 1.1kbps 超低码率 |
| Audio LM(RQ-Transformer) | 在 Helium 之上的较小 Transformer | 层级化、流式地预测音频 token |
核心做法:从一个文本 LM 骨干(Helium)出发,把语音表示为神经 codec 的残差量化(RVQ)token,再挂一个更小的音频 Transformer 来吃/吐音频 token。这样既直接在音频域理解和生成(不丢情绪、非语音声),又复用了文本大模型的知识和推理能力。
三、两个关键设计
1. 多流建模(Multi-stream):取消"话轮"概念
这是全双工的根本。Moshi 把"用户的语音流"和"模型自己的语音流"分成两条并行的自回归 token 流联合建模:
- 模型始终在听、始终在生成声音(说话或静默);
- 因为没有显式的"用户话轮/AI 话轮"开关,训练时可以直接用含任意动态的自然对话——重叠、打断、插话都能学;
- 论文称之为第一个 multi-stream audio language model:输入音频流和输出音频流在两个自回归流里被联合处理。
对比级联方案靠 VAD 判断"话轮边界",Moshi 让话轮动态从双流联合预测中自然涌现。
2. Inner Monologue(内心独白):文本 token 当音频 token 的前缀
这是 Moshi 最被后世借鉴的设计。
- 前人(AudioLM 等)发现"从语义 token 到声学 token 的由粗到细生成"对语音可懂度至关重要;Moshi 把这条层级再往前推一步:在每个时间步,先预测与音频时间对齐的文本 token,作为语义/声学 token 的前缀。
- 也就是模型"先在心里把要说的话写成文字,再念出来"——像内心独白。
- 三个收益:
- 语言质量大幅提升:生成语音的事实性、长度、连贯性都显著变好(纯音频 LM 很难生成可懂的长语音);
- 白送流式 ASR:用户音频流对应的文本前缀就是实时转写;
- 白送流式 TTS:给定文本、强制文本与音频之间加延迟,就能从同一个模型导出流式语音合成。
与 Spectron/SpeechGPT 的"Chain-of-Modality"(先把整句答案全写成文本再开口,无法实时)不同,Inner Monologue 是逐帧分解文本→语义→声学 token,不增加 Transformer 输出序列长度,因此兼容流式;与 PSLM 的"文本语音并行"也不同,Moshi 用文本做前缀来引导音频。
四、Mimi codec 与层级流式生成
- Mimi:基于 Transformer bottleneck 的流式神经 codec,因果设计支持流式;用 RVQ 把音频压成离散 token。Moshi 不直接用自监督语义 token + 声学 token 两套,而是把语义信息蒸馏进声学 token 的第一层(split RVQ),配合纯对抗训练等技巧,在无文本条件下也能生成可懂语音。
- RQ-Transformer:受 RQ-Transformer / MegaByte 启发,用一个嵌套的小 Transformer 在单个时间步内建模多层 RVQ token;并在不同层 token 之间引入延迟(delay)做并行预测,减少自回归步数。这套层级建模能在实时生成的同时处理数分钟上下文(论文实验到 5 分钟)。
- 量化率:Mimi 工作在约 12.5 token/秒 的帧率(后续全双工模型普遍沿用这一量级)。
五、训练与评测
- 训练阶段:Helium 文本预训练 → Moshi 音频预训练 → Moshi 后训练 → 指令微调 → TTS 训练;数据含文本、音频、speech-text instruct 三类,并做了严格的去重、语言识别、质量过滤。
- 评测维度(论文做得相当全面):文本语言建模、音频 tokenization(语义/声学 token 质量)、生成建模消融、音频语言建模、口语问答(Spoken QA)、生成对话的质量与统计、流式 ASR/TTS、以及压缩量化对音质的影响。
- 结论:Moshi 在当时的 speech-text 模型中,语音建模和口语问答达到 SOTA,同时保持流式兼容、可建模数分钟上下文。
- 安全:论文还专门做了毒性分析、训练数据回吐(regurgitation)分析、系统声音一致性,以及音频水印(信号水印 + 生成式水印探索)——在 2024 年就考虑了合成语音标识问题。
六、局限与历史地位
局限:
- 仅英语为主(Helium 是英文骨干,Mimi 也围绕英语),多语言能力弱;
- 没有视觉,纯语音;
- 智能上限受 7B 骨干规模限制,无工具调用/Agent 能力;
- 全双工"节奏"能力(何时插话/附和)在这一代主要靠双流建模自然获得,尚未做专门的话轮决策优化。
历史地位:
- 它第一次证明"单模型、双流、speech-to-speech、200ms 级延迟"的全双工对话可行,定义了此后两年的技术范式;
- **Inner Monologue(文本前缀引导音频)**被 Qwen3-Omni、GLM-4-Voice、Gander 等以"Thinker-Talker / 流式思考"的形式继承;
- 多流双流建模被 GPT-Live 官方明确称为"采用类似 Moshi 的全双工架构";
- 完全开源(代码 + 权重 + 在线 demo moshi.chat),是学术界和工业界做全双工研究的教科书级样板。
参考来源
- Moshi 论文:https://arxiv.org/abs/2410.00037 (HTML 全文:https://arxiv.org/html/2410.00037v2 )
- 开源代码:https://github.com/kyutai-labs/moshi
- 在线 Demo:https://moshi.chat/