Back

全双工语音模型精读③:GLM-4-Voice-9B——175bps 单码本、12.5Hz、INT4 可本地跑的中文语音助手

全双工语音模型系列精读第 3 篇。本文基于 GLM-4-Voice 技术报告 arXiv:2412.02612 与官方开源仓库,梳理其端侧中文实时语音方案。配套总览见《全双工语音大模型全景调研》。

一、定位:要"像人"、要实时、还要能本地跑

GLM-4-Voice(智谱 AI,Zeng、Du、唐杰等,2024-12-03)是一个端到端、拟人化的中文/英文实时语音对话模型。它的目标很明确:不只是能语音问答,还要能根据用户指令实时改变情绪、语调、语速、方言(东北话、重庆话、北京话等),并且开源、可量化到 INT4 在消费级硬件上本地运行——这让它成为本地中文语音助手最常见的选择。

二、三大组件

组件 实现 关键指标
语音 Tokenizer 在 ASR 模型编码器里插入向量量化(VQ)bottleneck 超低码率 175bps、单码本、12.5Hz 帧率
语音 Decoder 基于 CosyVoice 的 Flow Matching 流式解码器 最少 10 个语音 token 即可开合成
语言模型 从文本模型 GLM-4-9B 续训语音模态 语音预训练规模达 1 万亿 token

1. 超低码率单码本 tokenizer

  • 不同于多数方案用多码本 RVQ,GLM-4-Voice 从 ASR 模型出发,在编码器中加 VQ bottleneck,得到单码本、12.5 帧/秒、仅 175bps 的离散语音 token。
  • 单码本 + 低帧率意味着序列更短、自回归步数更少,对实时和端侧都友好。

2. Flow Matching 流式解码,10 个 token 就开口

  • Decoder 用 CosyVoice 的 Flow Matching 方案把离散 token 还原成波形;
  • 最少收到 10 个语音 token 就开始合成,配合流式,首包延迟很低;
  • 这也是它"边想边说"的物理基础。

3. 从 GLM-4-9B 续训,1 万亿 token

  • 为高效地把文本知识迁移到语音模态,论文用一个 text-to-token 模型,从已有文本预训练语料合成语音-文本交错数据
  • 在 GLM-4-9B 基础上,用三类数据继续预训练:无监督语音数据 + 语音-文本交错数据 + 有监督语音-文本数据,规模扩到 1 万亿 token
  • 结果在语音语言建模和口语问答上都做到 SOTA;之后再用高质量对话语音数据微调,对话能力和音质进一步提升。

三、流式思考架构:文本参照、边想边说

  • GLM-4-Voice 采用流式交替输出文本和语音的方式:语音以文本为参照来保证语言质量,最低输出约 20 个 token 即可出声
  • 这与 Moshi 的 Inner Monologue、Qwen 的 Thinker-Talker 是同一思想家族——先有文本/语义骨架,再据此流式生成语音,避免纯音频自回归容易出现的语义漂移;
  • 因为情绪、语调、语速、方言都被建模进可控条件,用户可以直接用语音指令控制说话风格。

四、部署:INT4 量化可跑

  • 模型权重在 GitHub(THUDM/GLM-4-Voice)和 HuggingFace(THUDM/glm-4-voice-9b)开放;
  • 官方提供 INT4 量化启动方式,量化后显存需求大幅下降(约 12GB 量级),可在单张消费级显卡甚至本地设备运行;
  • 数据扩展方法另见论文 arXiv:2411.17607。

五、在全双工版图里的位置与局限

定位:GLM-4-Voice 属于"流式端到端 + 快速打断"这一档——它通过低帧率 tokenizer、10 token 开合成、流式文音交错把延迟压到很低,交互体验接近实时;但它并非 Moshi/GPT-Live 那种"双流原生联合建模"(用户流和 AI 流在同一序列里并行自回归)。

优势

  • 中文场景成熟、方言/情感/语速可控性强;
  • 开源 + INT4 端侧可跑,是隐私敏感、离线、低成本部署的首选之一。

局限

  • 纯语音,无视觉
  • 工具调用/Agent 能力较弱(9B 骨干、定位端侧);
  • 双工"话轮智能"(复杂重叠、多人、附和区分)不是这一代的重点。

智谱后续在云端推出了 GLM-Realtime(Flash/Air,含视频通道)补齐实时多模态和工具链,形成"端侧 GLM-4-Voice + 云端 GLM-Realtime"的产品布局。

参考来源

  1. GLM-4-Voice 技术报告:https://arxiv.org/abs/2412.02612
  2. 官方仓库:https://github.com/THUDM/GLM-4-Voice
  3. 模型权重:https://huggingface.co/THUDM/glm-4-voice-9b
  4. 数据扩展方法:https://arxiv.org/abs/2411.17607

评论