Back

全双工语音模型精读⑥:Qwen3.5-Omni Realtime——Hybrid-MoE、ARIA 文音对齐与语义打断的全模态旗舰

全双工语音模型系列精读第 6 篇。本文基于 Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30)与阿里云百炼 Realtime API 文档。配套总览见《全双工语音大模型全景调研》;上一代 Qwen3-Omni 见精读④,Gander 见精读⑤。

一、定位:从"全能理解"走向"原生全模态 AGI"

Qwen3.5-Omni 是阿里千问 2026 年 3 月 30 日发布的最新一代**全模态(omni-modal)**大模型,原生支持文本、图像、音频、音视频的理解,以及文本和自然语音的流式输出。它在 1 亿小时以上音视频数据上做原生多模态预训练,Thinker 与 Talker 均升级为 Hybrid-Attention MoE

需要区分两种交付形态:

  • Offline API(离线)Qwen3.5-Omni-Plus / Flash / Light 三个 Instruct 尺寸,主打长音视频理解、音视频字幕、Audio-Visual Vibe Coding;
  • Realtime API(实时)qwen3.5-omni-plus-realtimeqwen3.5-omni-flash-realtime,主打低延迟全双工语音/视频对话;另有专门的实时语音翻译模型 qwen3.5-livetranslate-flash-realtime。本篇聚焦 Realtime。

二、Realtime 五大能力(官方原文)

官方博客把实时交互能力归纳为五点:

  1. 语义打断(Semantic Interruption):基于 Omni 自研原生话轮意图识别,能区分"用户真的在插话下指令"与"附和声(嗯/对)、无意义背景噪声",后者触发打断。用户可随时中途打断、改需求、切话题。这是"全双工"从"能打断"走向"懂节奏"的关键。
  2. 原生 WebSearch + 复杂 FunctionCall:模型自主决定是否联网搜索回答实时问题,支持复杂函数调用、多工具并行。
  3. 端到端语音控制:像人一样"听话地"调节自己的音量、语速、情感——直接说"小点声""说快点""兴奋一点"即可,而非外挂参数。
  4. 声音克隆(Voice Cloning):上传一段声音即可定制 AI 助手音色;也可改系统提示词设定对话风格/身份。Flash Realtime 单次复刻会话最长 120 分钟。
  5. ARIA(Adaptive Rate Interleave Alignment,自适应速率交错对齐):本篇最核心的语音生成新技术。

三、ARIA:解决"文本 token 和语音 token 速率不匹配"

流式语音交互里有个顽疾:文本 token 和语音 token 的编码效率不一致,直接对齐会导致漏读、误读、数字发音含糊

  • 上一代 Qwen3-Omni 的 Talker 用双轨自回归(Dual-Track)、文-音 token 比率固定 1:1
  • Qwen3.5-Omni 改为 **Interleave(交错)**组织,用 ARIA 动态对齐文本单元与语音单元再交错输入 Talker;
  • 效果:在保住实时性的同时,显著提升语音合成的自然度和鲁棒性。

这与 Gander 的观察一致——Gander 也发现"强迫语言骨干按语音高帧率自回归会侵蚀语言能力",两者都选择把语义规划和声学实现解耦,但 Qwen 是在 Talker 输入端做速率对齐,Gander 是用独立轻量语音解码器。

四、架构:Thinker-Talker 的三项升级

  • Thinker:通过 Vision Encoder 与 **AuT(音频编码器)**接收视觉/音频信号;音视频用 TMRoPE 时间对齐编码;负责全模态处理与文本输出。
  • Talker:接收多模态输入与 Thinker 文本,做上下文语音生成;语音表征沿用 RVQ(残差矢量量化),替代计算繁重的 DiT;chunk-wise 流式输入 + 流式 Talker 支持实时交互。
  • 三项关键变化(对比 Qwen3-Omni)
    • 骨干 MoE → Hybrid-Attention MoE(Thinker、Talker 都是);
    • Talker 双轨自回归 → 交错(Interleave)
    • 文-音 token 比率固定 1:1 → ARIA 动态对齐

五、关键规格(官方)

项目 规格
上下文 256K(上代 32K)
音频输入 超过 10 小时
音视频输入 超过 400 秒 720P(1 FPS)
语音识别 113 种语言/方言(离线口径;Realtime Flash 60+ 输入语言)
语音生成 36 种语言/方言(Realtime Flash 30+ 输出语言)
中文方言识别 39 种(粤语、上海话、四川话、闽南语等)
实时音频格式 输入 PCM 16kHz / 输出 PCM 24kHz,单声道 16bit
默认音色 Tina
接入协议 AOQ / WebRTC / WebSocket 三种

六、官方评测(Qwen3.5-Omni-Plus)

官方称 Plus 在 215 个音频/音视频理解、推理、交互子任务上取得 SOTA,整体超越 Gemini-3.1 Pro(音频理解/推理/识别/翻译/对话),音视频理解达 Gemini-3.1 Pro 水平,视觉与文本能力与同尺寸 Qwen3.5 模型持平。

  • 音视频:DailyOmni 84.6(Gemini-3.1 Pro 82.7)、AVUT 85.0(85.6)、VideoMME(含音频) 83.7(89.0)、WorldSense 62.8(65.5);OmniGAIA 智能体工具调用 57.2(Gemini 68.9,Flash 仅 33.9)。
  • 音频对话:VoiceBench 93.1(Gemini 88.9)、MMAU 82.2。
  • ASR(WER/CER 越低越好):LibriSpeech-clean 1.11、other 2.23;中文 Wenetspeech-net 4.30、meeting 5.84;Kespeech 3.46。
  • 语音合成稳定性(WER 越低越好):多语言平均 2.06,优于 ElevenLabs 12.62、Gemini-2.5-Pro 2.72、GPT-Audio 2.65、Minimax 2.16。
  • 声音克隆:相似度 0.79(ElevenLabs 0.65、Minimax 0.76),稳定性 WER 1.87。
  • 涌现能力:官方特别强调 Audio-Visual Vibe Coding——模型能"看着画面、听着语音指令"直接写代码、生成 App/网页/游戏。

七、和同路线/同梯队模型的边界

  • vs Qwen3-Omni(精读④):32K→256K、MoE→Hybrid-MoE、双轨→ARIA 交错、11 外语→113 语言,并新增语义打断、WebSearch、端到端语音控制、声音克隆四项 Realtime 能力。
  • vs Gander(精读⑤):Qwen3.5-Omni Realtime 是单模型内集成 WebSearch/FunctionCall,强在全模态感知 + 语音自然度 + 开箱工具;Gander 是"小脑 + 免训练后端大脑"的异步长任务编排架构(后台跑几分钟任务、前台随时插话改需求)。前者重"感知与对话全能",后者重"长任务智能体协作"。
  • vs GPT-Live / Gemini Live:同属"原生全双工 + 函数调用"第一梯队,Qwen 的差异化在 113 种语言/39 种中文方言、声音克隆、端到端语音控制,以及 Qwen 一贯的开放生态(Offline 权重/Demo 开放,Realtime 走百炼 API)。

八、接入

  • WebSocket:服务端集成、快速原型;
  • WebRTC:浏览器原生音视频通话,内置回声消除/降噪;
  • AOQ:移动端原生,内置 AEC/降噪;
  • 实时模型 qwen3.5-omni-plus-realtime(旗舰)/ qwen3.5-omni-flash-realtime(低延迟轻量)。具体定价、限流以阿里云百炼控制台为准(官方博客未列实时模型单价)。

参考来源

  1. Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30):https://qwen.ai/blog?id=qwen3.5-omni
  2. 阿里云百炼 Realtime API 文档:https://www.alibabacloud.com/help/en/model-studio/realtime
  3. 阿里云百炼 Qwen-Omni 离线 API:https://www.alibabacloud.com/help/en/model-studio/qwen-omni

评论