全双工语音模型精读⑩:Qwen3.8-Omni——Thinker-Talker 长程 Agent、1M 上下文与流式实时全双工
「全双工」到这里,追问的不再是"能不能实时对话",而是"能不能一边说话、一边计划、一边调工具、一边把几小时的长视频干完"。
这是「全双工语音模型精读」系列的第 10 篇。前面我们沿着 Moshi 的双流、Freeze-Omni 的冻结权重、GLM-4-Voice 的码本、Qwen3-Omni 的 Thinker-Talker、SeedRealtime 的话轮决策一路读来。现在聚焦 Qwen 自己最新的 Qwen3.8-Omni-Flash(技术报告 arXiv:2609.25611,2026-09-22,上线 2026-09-18)。
这一代的关键不是某个音频指标又涨了几个点,而是 Qwen 正式把全双工语音模型从"理解 + 呼应交互"推进到"长程 Agent 生产力"。核心命题只有一句:Omni Senses. Agentic Delivery.(既要有全模态感知,也要能把活儿干了送达结果。)
一、一句话定位
- 原生多模态 MoE 模型,能处理文本 / 图像 / 音频 / 空间音频 / 音视频;
- 支持 1M token 上下文;
- 可作主 Agent,也可作专门的 sub-agent;
- 面向视频剪辑、长短剧译配、Music-to-MV、电影解说、视频笔记、技能创建等音视频生产力工作流。
相对 Qwen3.5-Omni-Plus,在 29 项音视频理解/推理/Agent 评测上平均分提升超 25%;每小时的音频输入 API 成本估算下降超 98%、音视频下降超 93%。
二、架构:Thinker-Talker,还是那套,但变了
沿用 Qwen-Omni 家族的 Thinker-Talker 分工——Thinker 理解并出文本/工具调用,Talker 出流式语音。但两边的内部都有实质升级。
2.1 Thinker:混合稀疏 MoE + 循环 + 稀疏检索
语言主干(来自 Qwen3.8-Next) 要能在 1M token 上做长程推理,光靠 attention 是不行的,Qwen 用了三件套:
- 稀疏 MoE——扩大参数量,同时控制每个 token 的 FFN 计算;
- Gated DeltaNet (GDN)——把前文压缩进固定大小的循环状态(recurrent 式),线性处理长序列;
- Qwen Sparse Attention (QSA)——层级化稀疏:轻量 indexer 给压缩后的 micro-block 打分、挑选相关块,core attention 只作用于被选块内的原始 token。
最终主干 = 循环压缩 + 选择性 token 检索的组合。预训练原生上下文就是 256K token,后训练再扩到 1M。
我的理解:这是"既要能看全,又不能全看"的工程妥协——面对几小时长视频,全 attention 浪费在无关帧上,QSA 让模型主动挑要精确看的部分。
三套感知编码器(升级点)
| 编码器 | 处理内容 | 关键点 |
|---|---|---|
| Vision encoder | 图像 + 动态采样视频帧 | 沿用 Qwen3.8-Next |
| AuT(通用音频) | 声学 + 语言内容 | 4 个 Conv2D 下采样 16× + 时序自注意力;输出 6.25Hz(约每 160ms 一个 token) |
| Spatial AuT(全新) | 多通道空间音频 | 先转 FOA(一阶 Ambisonics),处理复数 STFT(保留实部+虚部),捕捉声源方向/距离/运动 |
- AuT 用专门 Qwen ASR 模型的转写做监督预训练,覆盖 20+ 语言(中:英:其他 ≈ 3.5:3.5:3);
- 音视频表示都带显式时间戳,让 Thinker 能在跨模态长序列里对齐音画事件;
- Spatial AuT 的位置 ID 参照"视频帧里不同空间位置的 patch"来排——同一时间片共享时间索引、保留不同空间位置索引,从而在同一时刻区分多个空间声源。
2.2 Talker:RVVQ + MTP + ARIA,48kHz 高保真
- RVQ token + Multi-Token Prediction (MTP):建模残差码本,精细控制声学细节;
- 专门 system prompt 指定目标音色,ARIA 做流式、并在部分文本前缀上就能衔接说话;
- causal Code2Wav 解码器加了 upsampling 通路,波形从 24kHz 提到 48kHz,高频保真明显提升;
- 五阶段训练:数据流水线预训练 → CPT(复杂对话上下文 / 跨语言混合)→ 语言专家 + **MOPD(多教师在策略蒸馏)**缓解单语口音 → 说话人微调 → RL(Thinker 对齐人类偏好、Talker 用 GSPO 优化)。
三、训练:多教师蒸馏 + 两阶段强化
3.1 预训练(四阶段,全程 256K)
| 阶段 | 内容 |
|---|---|
| S1 编码器对齐 | 冻结 LLM,单独训三个编码器 adapter(vision / AuT / Spatial AuT) |
| S2 General | 全参数解冻,约 2.5 万亿 token:文本 1.1T + 音频 0.7T + 图 0.35T + 视频 0.15T + 音视频 0.15T |
| S3 QSA Warmup | 冻结主干,用 dense attention 分布监督训练 QSA indexer |
| S4 QSA | 启用稀疏注意力,联合优化主干 + indexer |
语言:文本 201 种、语音输出 36 种(29 语言 + 7 种中国方言:四川/北京/天津/南京/陕西/粤/闽南)。
3.2 后训练
- 多教师蒸馏:先训若干领域专家(通用指令、推理、编程、Agent、视觉、音频),各自产轨迹,再蒸馏进单个学生。比直接用异构数据微调更好——监督更一致、跨模态/跨域干扰更小。
- 统一 RL:跨文本/视觉/音频/混合模态强化,专门解决音频条件查询难、长对话里的语言误切换、人设漂移、指令遵循退化。长程 Agent 任务按执行结果/任务产出给奖励,而不是模型自报完成——这是重要的防 reward hacking 设计。
四、为"音视频 Agent"打造的产品矩阵
这是报告最特别、最有结构感的部分,全都在回答"音视频怎么真的变成 Agent 的干活动手能力"。
4.1 信息抽象 + 按需访问(解决"视频又贵又长")
- Omni-Caption:视频 → 详细字幕;
- Omni-Video2Note:视频 → 结构化文字摘要;
- Omni-Memory:Agent 对音视频内容懒加载;
- Omni-Skill-Creator:把视频教程 / SOP → 可被 Agent 调用的可执行技能。
4.2 长视频理解:从"全量静态喂入"到"按需取证"
以前的静态做法:不管视频多长,一次性把所有帧+音频喂进一次调用。Qwen3.8-Omni 改成原生 Agentic:根据 query 规划,coarse-to-fine 迭代调用工具检索相关音视频片段,必要时再并行委派多个 sub-agent 分开做音/画分析。
- 会议纪要:原生支持最长 1 小时音视频输入,端到端做说话人分割、转写、身份对齐,用视觉信息消解音频里的指代/实体歧义;还能延伸去发邮件、建任务、动手写代码——"从听懂一场会,到去干活"。
4.3 内容创作
- Music-to-MV:理解歌词/结构/音乐元素 → 时间对齐歌词、全局 caption、局部音乐事件 → 写叙事脚本、设计分镜 → 审查成片质量;
- 短剧译配:自主规划本地化流程,支持说话人感知识别、对话翻译、角色一致的声音克隆配音、混音、质检;
- 长电影解说(2-3 小时):分析叙事结构/转折点/人物弧光,用全局上下文指导解说生成,编排解说+原片对白+画面+BGM。
4.4 研究/学习/自动化
- Omni-Deep Research:视频内容 + 外部检索交叉验证 → 可交互 HTML 报告,结论能链回视频具体时刻;
- Video-to-Note:自动选信息量大的帧、调整裁剪区域,重建教学流程;
- Skill Creator:从演示提取 SOP,把工具用法/决策标准/关键洞察变成可复用技能。
4.5 Omni-Autoresearch(最惊艳的实验)
让模型在 12 小时内自主改进 Qwen2.5-Omni-3B 的四川话识别:自选 WenetSpeech-Chuan 评测集、定基线、直接听音频诊断错误、构造训练数据。四轮实验造了 3,413 条样本,把 CER 从 25.79% 压到 15.30%(相对降低约 40.7%)。
这一条特别值得记——已经不只是"给模型看视频",而是"模型自己听音频→诊断→采矿→训练→迭代",全模态模型开始反过来做模型研发本身。
五、关键评测数字
文本(证明"加了多模态不掉文本")
SWE-bench Pro 63.3、CoWorkBench 75.3、IFBench 81.5、GPQA 91.0、LiveCodeBench v6 92.6——与纯文本 Qwen3.8-Flash 互有胜负、基本持平。
音频(提升最大的领域)
- 多说话人 ASR 是最大亮点:AliMeeting Test 的 DER|cpWER 从 88.1|89.6 骤降到 3.4|17.2;AISHELL-4 / MagicData-RAMC / MLC-SLM 也拿到两项最低;
- LongAudioSpan Accuracy 74.4→82.7;
- 隐患:FLEURS-ASR 错误率 9.3(高于前代 7.2 & Gemini 7.9)、VoiceBench/WildSpeech 仍落后。
音视频
OmniVideoBench 53.8→63.4、Video-MME-v2 47.9→65.0、LVOmniBench 53.2→63.3;StreamingBench 57.1→80.8;OmniCap-IF CSR|ISR 72.1|14.1→80.6|28.2;但纯视频推理三项仍输 Gemini 3.8 Flash。
全模态 Agent(提升最大)
| 基准 | 3.8-Omni | 3.5-Omni | 提升 |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | +36.5 |
| AgenticVBench | 36.8 | 14.5 | +22.3 |
| OmniGAIA | 74.0 | 57.2 | +16.8 |
| UniClawBench | 69.6 | 67.1 | +2.5 |
Agent式取证 vs 静态直读(最有说服力的一个对比)
在 LVOmniBench 上,用 Qwen Code 做 agentic 取证:从比 Gemini 低 7.4 分反超为高 2.9 分(63.3→73.6);同时 token 从每查询 145,736 降到 79,117(省约 45.7%)。准确率和 token 效率双赢。
实时 API 效率(Qwen3.8-Omni-Flash-Realtime)
- Text TPS:81~85;
- 首音频延迟(TTFC):纯音频约 0.98
1.03 秒,音视频约 1.211.35 秒; - 生成 RTF≈0.153,约 6.5 倍实时。
语音克隆/定制
零样本克隆内容稳定性(WER/CER)与音色相似度多数领先 SeedAudio、MiniMax-Speech-2.8;自然度 arena 胜率 72.7%(逼近 Gemini 3.1 TTS Flash 的 74.2%,明显高于 ElevenLabs V3 的 23.1%)。
六、开源生态:Qwen-MM-Plugins 与 Qwen-Live-Harness
- Qwen-MM-Plugins(github.com/QwenLM/Qwen-MM-Plugins):轻量插件框架,让现有 Agent harness 能接入音视频能力(含 Omni-Chatcut 等开箱即用模块)。
- Qwen-Live-Harness(github.com/QwenLM/Qwen-Live-Harness):实时多模态 Agent 框架,四大能力:
- 异步工具 + sub-agent 委派:任务提交立即返回,后台执行,结果异步进上下文;打断语音不取消后台任务;
- 主动交互:可对音/视频/时间设条件,感知监控独立实时会话运行,事件转语音通知(带冷却抑制);
- 持久记忆:对话记录 + 工作记忆 + 用户画像,词法/embedding 检索跨会话保留;
- 异步工具与实时语音编排:把"实时聊天"和"后台长任务"无缝衔接。
七、我的判断
- 这是全双工系列里"范式转向"的一篇。前面各家的争夺点是"实时对话更像人"(延迟、话轮、自然度),Qwen3.8-Omni 把目标搬到"音视频能不能进 Agent 主循环"——理解变成按需取证、响应变成异步委派、记忆跨会话持久。竞争维度变了。
- 最扎实的两块工程:①MoE+GDN+QSA 的混合长序列主干(循环压缩 + 稀疏检索),真正支撑了 1M 上下文;②"按需取证"实现准确率和 token 双赢(LVOmniBench 反超 Gemini + token 省 45.7%)——这是 agentic 路线价值的最硬证据。
- 要清醒:纯视频推理仍输 Gemini 3.8 Flash;通用 ASR/翻译(FLEURS / WenetSpeech Net / VoiceBench)没全面领先;多说话人 ASR 尽管数字惊艳,报告口径需独立复现。
- 对系列的意义:作为连载收尾篇很合适——前 9 篇都在回答"全双工到底是什么技术",这一篇回答"全双工这个能力最终要拿来干嘛"。结合 Qwen 自家 Qwen3-Omni(精读④)和 Qwen3.5-Omni(精读⑥)两代演进,Qwen3.8-Omni 把 Thinker-Talker 家族推到了 Agent 化终点。
一手来源
- 论文:Qwen3.8-Omni: Towards Native Omni-Modal Agents(arXiv:2609.25611v1,2026-09-22)
- 报告团队:Qwen Team(通义千问)
- 开源框架:Qwen-MM-Plugins、Qwen-Live-Harness
- 本系列第 10 篇,order 10(前篇:全双工精读9-SeeDuplex/SeedRealtime)