全双工语音模型系列精读第 6 篇。本文基于 Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30)与阿里云百炼 Realtime API 文档。配套总览见《全双工语音大模型全景调研》;上一代 Qwen3-Omni 见精读④,Gander 见精读⑤。
一、定位:从"全能理解"走向"原生全模态 AGI"
Qwen3.5-Omni 是阿里千问 2026 年 3 月 30 日发布的最新一代**全模态(omni-modal)**大模型,原生支持文本、图像、音频、音视频的理解,以及文本和自然语音的流式输出。它在 1 亿小时以上音视频数据上做原生多模态预训练,Thinker 与 Talker 均升级为 Hybrid-Attention MoE。
需要区分两种交付形态:
- Offline API(离线):
Qwen3.5-Omni-Plus / Flash / Light三个 Instruct 尺寸,主打长音视频理解、音视频字幕、Audio-Visual Vibe Coding; - Realtime API(实时):
qwen3.5-omni-plus-realtime与qwen3.5-omni-flash-realtime,主打低延迟全双工语音/视频对话;另有专门的实时语音翻译模型qwen3.5-livetranslate-flash-realtime。本篇聚焦 Realtime。
二、Realtime 五大能力(官方原文)
官方博客把实时交互能力归纳为五点:
- 语义打断(Semantic Interruption):基于 Omni 自研原生话轮意图识别,能区分"用户真的在插话下指令"与"附和声(嗯/对)、无意义背景噪声",后者不触发打断。用户可随时中途打断、改需求、切话题。这是"全双工"从"能打断"走向"懂节奏"的关键。
- 原生 WebSearch + 复杂 FunctionCall:模型自主决定是否联网搜索回答实时问题,支持复杂函数调用、多工具并行。
- 端到端语音控制:像人一样"听话地"调节自己的音量、语速、情感——直接说"小点声""说快点""兴奋一点"即可,而非外挂参数。
- 声音克隆(Voice Cloning):上传一段声音即可定制 AI 助手音色;也可改系统提示词设定对话风格/身份。Flash Realtime 单次复刻会话最长 120 分钟。
- ARIA(Adaptive Rate Interleave Alignment,自适应速率交错对齐):本篇最核心的语音生成新技术。
三、ARIA:解决"文本 token 和语音 token 速率不匹配"
流式语音交互里有个顽疾:文本 token 和语音 token 的编码效率不一致,直接对齐会导致漏读、误读、数字发音含糊。
- 上一代 Qwen3-Omni 的 Talker 用双轨自回归(Dual-Track)、文-音 token 比率固定 1:1;
- Qwen3.5-Omni 改为 **Interleave(交错)**组织,用 ARIA 动态对齐文本单元与语音单元再交错输入 Talker;
- 效果:在保住实时性的同时,显著提升语音合成的自然度和鲁棒性。
这与 Gander 的观察一致——Gander 也发现"强迫语言骨干按语音高帧率自回归会侵蚀语言能力",两者都选择把语义规划和声学实现解耦,但 Qwen 是在 Talker 输入端做速率对齐,Gander 是用独立轻量语音解码器。
四、架构:Thinker-Talker 的三项升级
- Thinker:通过 Vision Encoder 与 **AuT(音频编码器)**接收视觉/音频信号;音视频用 TMRoPE 时间对齐编码;负责全模态处理与文本输出。
- Talker:接收多模态输入与 Thinker 文本,做上下文语音生成;语音表征沿用 RVQ(残差矢量量化),替代计算繁重的 DiT;chunk-wise 流式输入 + 流式 Talker 支持实时交互。
- 三项关键变化(对比 Qwen3-Omni):
- 骨干 MoE → Hybrid-Attention MoE(Thinker、Talker 都是);
- Talker 双轨自回归 → 交错(Interleave);
- 文-音 token 比率固定 1:1 → ARIA 动态对齐。
五、关键规格(官方)
| 项目 | 规格 |
|---|---|
| 上下文 | 256K(上代 32K) |
| 音频输入 | 超过 10 小时 |
| 音视频输入 | 超过 400 秒 720P(1 FPS) |
| 语音识别 | 113 种语言/方言(离线口径;Realtime Flash 60+ 输入语言) |
| 语音生成 | 36 种语言/方言(Realtime Flash 30+ 输出语言) |
| 中文方言识别 | 39 种(粤语、上海话、四川话、闽南语等) |
| 实时音频格式 | 输入 PCM 16kHz / 输出 PCM 24kHz,单声道 16bit |
| 默认音色 | Tina |
| 接入协议 | AOQ / WebRTC / WebSocket 三种 |
六、官方评测(Qwen3.5-Omni-Plus)
官方称 Plus 在 215 个音频/音视频理解、推理、交互子任务上取得 SOTA,整体超越 Gemini-3.1 Pro(音频理解/推理/识别/翻译/对话),音视频理解达 Gemini-3.1 Pro 水平,视觉与文本能力与同尺寸 Qwen3.5 模型持平。
- 音视频:DailyOmni 84.6(Gemini-3.1 Pro 82.7)、AVUT 85.0(85.6)、VideoMME(含音频) 83.7(89.0)、WorldSense 62.8(65.5);OmniGAIA 智能体工具调用 57.2(Gemini 68.9,Flash 仅 33.9)。
- 音频对话:VoiceBench 93.1(Gemini 88.9)、MMAU 82.2。
- ASR(WER/CER 越低越好):LibriSpeech-clean 1.11、other 2.23;中文 Wenetspeech-net 4.30、meeting 5.84;Kespeech 3.46。
- 语音合成稳定性(WER 越低越好):多语言平均 2.06,优于 ElevenLabs 12.62、Gemini-2.5-Pro 2.72、GPT-Audio 2.65、Minimax 2.16。
- 声音克隆:相似度 0.79(ElevenLabs 0.65、Minimax 0.76),稳定性 WER 1.87。
- 涌现能力:官方特别强调 Audio-Visual Vibe Coding——模型能"看着画面、听着语音指令"直接写代码、生成 App/网页/游戏。
七、和同路线/同梯队模型的边界
- vs Qwen3-Omni(精读④):32K→256K、MoE→Hybrid-MoE、双轨→ARIA 交错、11 外语→113 语言,并新增语义打断、WebSearch、端到端语音控制、声音克隆四项 Realtime 能力。
- vs Gander(精读⑤):Qwen3.5-Omni Realtime 是单模型内集成 WebSearch/FunctionCall,强在全模态感知 + 语音自然度 + 开箱工具;Gander 是"小脑 + 免训练后端大脑"的异步长任务编排架构(后台跑几分钟任务、前台随时插话改需求)。前者重"感知与对话全能",后者重"长任务智能体协作"。
- vs GPT-Live / Gemini Live:同属"原生全双工 + 函数调用"第一梯队,Qwen 的差异化在 113 种语言/39 种中文方言、声音克隆、端到端语音控制,以及 Qwen 一贯的开放生态(Offline 权重/Demo 开放,Realtime 走百炼 API)。
八、接入
- WebSocket:服务端集成、快速原型;
- WebRTC:浏览器原生音视频通话,内置回声消除/降噪;
- AOQ:移动端原生,内置 AEC/降噪;
- 实时模型
qwen3.5-omni-plus-realtime(旗舰)/qwen3.5-omni-flash-realtime(低延迟轻量)。具体定价、限流以阿里云百炼控制台为准(官方博客未列实时模型单价)。
参考来源
- Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30):https://qwen.ai/blog?id=qwen3.5-omni
- 阿里云百炼 Realtime API 文档:https://www.alibabacloud.com/help/en/model-studio/realtime
- 阿里云百炼 Qwen-Omni 离线 API:https://www.alibabacloud.com/help/en/model-studio/qwen-omni