全双工语音模型系列精读第 3 篇。本文基于 GLM-4-Voice 技术报告 arXiv:2412.02612 与官方开源仓库,梳理其端侧中文实时语音方案。配套总览见《全双工语音大模型全景调研》。
一、定位:要"像人"、要实时、还要能本地跑
GLM-4-Voice(智谱 AI,Zeng、Du、唐杰等,2024-12-03)是一个端到端、拟人化的中文/英文实时语音对话模型。它的目标很明确:不只是能语音问答,还要能根据用户指令实时改变情绪、语调、语速、方言(东北话、重庆话、北京话等),并且开源、可量化到 INT4 在消费级硬件上本地运行——这让它成为本地中文语音助手最常见的选择。
二、三大组件
| 组件 | 实现 | 关键指标 |
|---|---|---|
| 语音 Tokenizer | 在 ASR 模型编码器里插入向量量化(VQ)bottleneck | 超低码率 175bps、单码本、12.5Hz 帧率 |
| 语音 Decoder | 基于 CosyVoice 的 Flow Matching 流式解码器 | 最少 10 个语音 token 即可开合成 |
| 语言模型 | 从文本模型 GLM-4-9B 续训语音模态 | 语音预训练规模达 1 万亿 token |
1. 超低码率单码本 tokenizer
- 不同于多数方案用多码本 RVQ,GLM-4-Voice 从 ASR 模型出发,在编码器中加 VQ bottleneck,得到单码本、12.5 帧/秒、仅 175bps 的离散语音 token。
- 单码本 + 低帧率意味着序列更短、自回归步数更少,对实时和端侧都友好。
2. Flow Matching 流式解码,10 个 token 就开口
- Decoder 用 CosyVoice 的 Flow Matching 方案把离散 token 还原成波形;
- 最少收到 10 个语音 token 就开始合成,配合流式,首包延迟很低;
- 这也是它"边想边说"的物理基础。
3. 从 GLM-4-9B 续训,1 万亿 token
- 为高效地把文本知识迁移到语音模态,论文用一个 text-to-token 模型,从已有文本预训练语料合成语音-文本交错数据;
- 在 GLM-4-9B 基础上,用三类数据继续预训练:无监督语音数据 + 语音-文本交错数据 + 有监督语音-文本数据,规模扩到 1 万亿 token;
- 结果在语音语言建模和口语问答上都做到 SOTA;之后再用高质量对话语音数据微调,对话能力和音质进一步提升。
三、流式思考架构:文本参照、边想边说
- GLM-4-Voice 采用流式交替输出文本和语音的方式:语音以文本为参照来保证语言质量,最低输出约 20 个 token 即可出声;
- 这与 Moshi 的 Inner Monologue、Qwen 的 Thinker-Talker 是同一思想家族——先有文本/语义骨架,再据此流式生成语音,避免纯音频自回归容易出现的语义漂移;
- 因为情绪、语调、语速、方言都被建模进可控条件,用户可以直接用语音指令控制说话风格。
四、部署:INT4 量化可跑
- 模型权重在 GitHub(THUDM/GLM-4-Voice)和 HuggingFace(THUDM/glm-4-voice-9b)开放;
- 官方提供 INT4 量化启动方式,量化后显存需求大幅下降(约 12GB 量级),可在单张消费级显卡甚至本地设备运行;
- 数据扩展方法另见论文 arXiv:2411.17607。
五、在全双工版图里的位置与局限
定位:GLM-4-Voice 属于"流式端到端 + 快速打断"这一档——它通过低帧率 tokenizer、10 token 开合成、流式文音交错把延迟压到很低,交互体验接近实时;但它并非 Moshi/GPT-Live 那种"双流原生联合建模"(用户流和 AI 流在同一序列里并行自回归)。
优势:
- 中文场景成熟、方言/情感/语速可控性强;
- 开源 + INT4 端侧可跑,是隐私敏感、离线、低成本部署的首选之一。
局限:
- 纯语音,无视觉;
- 工具调用/Agent 能力较弱(9B 骨干、定位端侧);
- 双工"话轮智能"(复杂重叠、多人、附和区分)不是这一代的重点。
智谱后续在云端推出了 GLM-Realtime(Flash/Air,含视频通道)补齐实时多模态和工具链,形成"端侧 GLM-4-Voice + 云端 GLM-Realtime"的产品布局。
参考来源
- GLM-4-Voice 技术报告:https://arxiv.org/abs/2412.02612
- 官方仓库:https://github.com/THUDM/GLM-4-Voice
- 模型权重:https://huggingface.co/THUDM/glm-4-voice-9b
- 数据扩展方法:https://arxiv.org/abs/2411.17607