一、引子:一个提前放出的"Qwen4 架构预览版"
2026 年 8 月 26 日晚,阿里通义千问团队发布并开源了 Qwen3.8-Flash-Next——一个多模态 MoE 模型。它的定位很特别:它不是 Qwen4 本身,而是 Qwen4 所使用架构的早期预览[1]。
这个套路千问团队已经用过一次:Qwen3.5 系列全面采用的 Gated DeltaNet + Gated Attention 混合架构,最早就是在 Qwen3-Next 上提前放出的,随后贯穿了 Qwen3.5、Qwen3.6、Qwen3.7、Qwen3.8 四代模型。这次他们再次把架构变化提前开源,让社区在完整 Qwen4 家族面世之前就能检验、适配和复现[1]。
数字本身就足够吸引眼球:
- 125B 主模型参数 + 额外 51B N-gram Embedding 参数;
- 每 token 仅激活 6B 参数;
- 原生 262,144(256K) tokens 上下文,通过 YaRN 可扩展到 1M;
- 训练成本约为 Qwen3.7-Plus 的 1/9,编码和办公任务却更强[1][5]。
但比数字更值得关注的是它回答的一个行业问题:当大家都在做"Flash"类低成本模型时,下一代的效率红利从哪里来? Qwen 给出的答案不是简单地把旗舰做小,而是沿注意力、残差连接、嵌入层、优化器四个方向系统性重写架构。本文逐一拆解。
二、一张表看懂 Qwen3.8-Flash-Next
| 维度 | 规格 / 数据 |
|---|---|
| 发布方 | 阿里通义千问(Qwen Team),2026-08-26 开源 |
| 定位 | Qwen4 架构的早期技术预览(对标此前 Qwen3-Next 的角色) |
| 主模型参数 | 125B(MoE) |
| 激活参数 | 6B / token |
| N-gram Embedding | 额外 51B(确定性查表,不占每 token 矩阵乘预算) |
| 上下文 | 原生 256K,YaRN 扩展至 1M |
| 注意力架构 | GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合,4 层中 3 层 GDN、1 层全局注意力 |
| 残差 | Gated Residual(GR),4 条并行分支,动态门控,支持 FP8 存储 |
| 嵌入 | N-gram Embedding,可卸载至 Host Memory,异步预取 |
| 优化器 | Muon 为主 + AdamW 为辅,重新拟合 Scaling Law |
| 多模态 | 是(文本/图像输入) |
| 开源 | 权重开放(Hugging Face / ModelScope) |
| 生产版 API | QwenCloud 上以 qwen3.8-flash 提供 |
| API 定价 | 输入 0.16 美元、输出 0.47 美元 / 百万 tokens(API 即将开放) |
| QSA 加速 | 1M tokens 下 Prefill 最高 7.6×、Decode 4.9×;90% 前缀缓存命中时 Prefill 吞吐为 Qwen3.7-Plus 的 8.6× |
数据来源:Qwen 官方博客与技术报告、NVIDIA 开发者博客、IT之家、新浪科技等[1][2][3][5]。
注意一个命名细节:开源权重叫 Qwen3.8-Flash-Next,云上生产版叫 Qwen3.8-Flash(默认 1M 上下文并内置官方工具)。本文讨论的架构主体是 Next 版本[1]。
三、注意力革新:GDN"记住",QSA"找到"
3.1 为什么需要混合注意力
标准全注意力(Full Attention)能直接访问所有历史 token,但随着上下文变长,计算量和 KV Cache 的访存成本都会急剧上升——这是长上下文服务昂贵的根源。Qwen3.8-Flash-Next 延续 Qwen3.5 引入的混合架构:
每 4 层中,**3 层用 Gated DeltaNet(GDN)**把历史信息持续压缩进一个固定大小的状态;剩下 1 层用全局 Attention 在完整上下文上做精确检索[1]。
一句话概括分工:GDN 高效地"记住",QSA 精确地"检索"[1]。
GDN 是对 Mamba2 delta rule 的改进(线性注意力/递归序列模型一脉),它的状态大小固定、不随序列长度增长,擅长持续吸收局部和近期信息;但纯线性模型在"从很长的历史里精确捞出某个细节"上不如全局注意力,因此保留一层全局注意力专门负责精确检索。
3.2 QSA:把稀疏注意力的索引开销也压下去
全局注意力层进一步引入了 Qwen Sparse Attention(QSA)。稀疏注意力的思路是"只关注重要上下文",但已有方案(如 DeepSeek V3.2 的 DSA)仍依赖 token 级索引器来识别重要位置——当上下文变长,索引器自身的计算也变得不可忽略[1]。
QSA 做了两层压缩:
- 轻量级索引器先把序列聚合成 micro-block(微块);
- 在块级别估计上下文重要性,再选出最相关的区域做 Attention[1]。
这样不仅降低了 Attention 本身的计算,也压低了"找出重要上下文"所需的索引开销。与跨层共享索引的方案(如 IndexCache)不同,QSA 在每一层内独立做序列压缩,减少了对跨层注意力相似性的依赖,这在 GDN 和 Attention 层交错排列的混合架构里尤其合适[1]。
3.3 性能数据
官方给出的成绩相当激进[1][2]:
- 1M tokens 下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别取得最高 7.6× 和 4.9× 加速;
- 在模拟线上高缓存复用场景(90% 前缀缓存命中率)、1M 上下文长度下,Qwen3.8-Flash-Next 的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6×。
NVIDIA 在 GB300 NVL72 上的实测显示,该模型可实现每 GPU 超过 16K tokens/s、每用户超过 200 tokens/s 的吞吐,适合高并发、低延迟的智能体编码场景;SGLang、vLLM、TokenSpeed 等推理引擎都提供了部署配方[2]。
四、门控残差(GR):给信息流开四条"车道"
4.1 要解决的问题
传统 Transformer 里,所有层都在同一条残差流(residual stream)上反复读写。网络越深,早期特征越容易和后续信息不断混合,重要信号被逐层稀释[1]。
4.2 做法:Hyper-Connection + GatedNorm 的结合
**Gated Residual(GR)**可以看作两个想法的组合:
- 遵循 Hyper-Connections 的思路,把残差流从 1 条拓宽成 4 条并行分支;
- 在残差"读"操作上引入类似 GatedNorm 的逐元素动态门控[1]。
模型根据当前内容,动态决定:从每条分支读多少、向每条分支写回多少。这相当于把单通道扩展成多车道——有的分支负责局部信息传递,有的则把早期信息直接保留到深层。官方的经验分析发现,其中一条分支会自然涌现为连接第一个注意力层到中后层的长距离通路[1]。
4.3 两个工程红利
- 更省、更稳:当读写操作足够有表达力后,Hyper-Connection 里额外的"分支混合"不再带来明显收益,可以直接去掉,从而减少访存开销和不稳定来源;门控还有效抑制了激活异常值(activation outliers),提升训练稳定性。
- 支持 FP8:残差状态可以用 FP8 存储,进一步降低访存开销[1]。
这是一个典型的"架构—系统协同设计":一个结构改动同时改善了信号流动、训练稳定性和量化存储。
五、N-gram Embedding:用几乎零计算扩容 51B
5.1 灵感与原理
标准 Embedding 只根据单个 token 查表。N-gram Embedding 则用当前 token 加上前面若干 token 组成的局部上下文来查表,为常见短语和局部模式提供额外表示。它的灵感来自 Gemma 3n 的 Per-Layer Embedding 和 DeepSeek Engram 等工作[1]。
最关键的优势是:它能在几乎不增加每 token 计算量的情况下,加入大量参数。
5.2 51B 参数为什么"不贵"
Qwen3.8-Flash-Next 额外引入了 51B N-gram Embedding 参数。因为查表位置可以提前确定,这些参数可以存放在 **Host Memory(主机内存)中,并通过异步预取(asynchronous prefetch)**与模型计算重叠,不需要长期占用 GPU 显存[1]。
最终模型只在网络靠前的位置使用单层 N-gram Embedding,相当于以很低的边际成本加了一个大规模的**"局部模式记忆库"。官方特别强调:这 51B 是确定性寻址(deterministically addressed)**的,不计入每 token 的矩阵乘法预算——这也是"125B 总参、6B 激活"之外,理解其真实计算量的关键[1]。
六、优化器:Muon 登场,Scaling Law 重拟合
架构之外,Qwen3.8-Flash-Next 的第四块拼图是优化器。它采用 Muon Optimizer,并围绕大规模训练中的三个关键问题做了改进[1]:
- 正交化精度;
- Muon 与 AdamW 的参数分工;
- 融合参数矩阵的拆分。
具体分工很能说明工程细节:
- 真正作为二维线性映射的参数——Attention、GDN、MoE Experts 的主权重——用 Muon;
- Embeddings、MoE Router、GR 中的低秩参数——继续用 AdamW;
- 对实现中融合在一起的 QKV、SwiGLU、GDN 投影,先按它们各自代表的独立线性变换拆分,再分别做正交化[1]。
针对新架构和优化器,团队重新拟合了 Scaling Law,发现模型能稳定使用更大的学习率和 batch size,提升了收敛效率和大规模并行训练吞吐。还有一个反常识结论:常用的 Batch Size Warmup 不再必要——从小 batch 逐步增到目标 batch 并不会改善最终结果,反而需要多 18.8% 的优化器步数,因此最终配方直接从目标 batch size 起步[1]。
七、其他架构设计与训练稳定性
其余组件沿用 Qwen3-Next 确立、经 Qwen3.5–3.8 系列打磨的设计[1]:
- 超稀疏 MoE(Ultra-sparse MoE):在固定激活专家数的前提下增大总专家池,配合全局负载均衡,持续降低训练损失;每 token 路由到少量专家 + 1 个共享专家。
- Multi-Token Prediction(MTP):多步训练,保持训练与推理一致,提升投机解码(speculative decoding)在真实场景的接受率,同时增强主干性能;其全注意力层也替换为 QSA。
- 训练稳定性:保留零中心化 RMSNorm(对 norm 权重施加 weight decay)、注意力输出门控、归一化的 MoE router 初始化等设计,让小规模消融更可靠、大规模训练更平稳。
八、性能评测:6B 激活打出什么水平
8.1 语言与编码/Agent 能力
官方对比了 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 和 Claude Opus 4.6(Max)。在仅 6B 激活参数下,Qwen3.8-Flash-Next 在多项编码和 Agent 基准上领先[1]:
| 基准(节选) | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1(智能体编码) | 58.7 | 42.2 | 16.5 | 54.4 | — |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | — | 77.5 |
| CoWorkBench(长程办公) | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench(职业任务) | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified(真实工具使用,Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | — |
| LiveCodeBench v6(竞赛编程) | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
| GPQA Diamond(科学推理) | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
几个亮点很突出:DeepSWE 从上一代的 16.5/46.2 级别跃升到 58.7;CoWorkBench(长程办公)73.9 远超 Claude Opus 4.6 的 68.2;JobBench 55.7 几乎是 Qwen3.7-Plus 27.6 的两倍。但也要看到短板:NL2Repo-Bench(仓库级代码生成)48.1 落后于 DeepSeek-V4-Flash 的 54.2;HLE(高难度综合推理)35.9 不及 Claude Opus 4.6 的 40.0[1]。
8.2 多模态能力
在视觉语言基准上同样有竞争力[1]:
| 基准(节选) | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| AndroidWorld(手机使用) | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0(电脑使用,Partial) | 52.3 | 48.0 | 21.5 | — |
| Vision2Web(视觉网页开发) | 64.0 | 62.9 | 42.1 | — |
| LVBench(长视频理解) | 76.6 | 72.4 | 76.2 | 63.0 |
| MathVision(视觉数学,With CI) | 95.7 | 94.6 | 88.7 | 65.5 |
视觉能力直接服务于 Agent 场景:操作手机/电脑、复刻应用、根据视觉稿做网页开发、理解长视频,这些都是"编码 + 智能体 + 多模态"融合的任务类型。
8.3 Base 模型与诚实的对比
Base 模型对比中,6B 激活的 Qwen3.8-Flash-Next-Base 在 14 个基准中的 8 个取得最优(MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM、MMMLU),在 MMLU、MATH、MultiPL-E 等项目上接近 397B 参数的 Qwen3.7-Plus-Base[1]。
需要保留审慎:上述多为官方自测,测试框架、harness(Claude Code / mini-SWE-agent)、温度、上下文长度、超时设置各不相同;CoWorkBench、RecreationBench 还是千问自研基准,最终仍需第三方独立复现。把它理解为"在特定设置下具备很强的编码与 Agent 能力",比"全面超越某旗舰"更准确。
九、FlashQLA:把 GDN 跑快的开源内核
架构要落地,离不开高性能内核。Qwen 团队同步开源了 FlashQLA——一个基于 TileLang 的高性能线性注意力内核库,专门优化 GDN(Gated DeltaNet)的 Chunked Prefill 前后向传播[3]。
- 性能:在 NVIDIA Hopper 和 Blackwell 上,相比 FLA Triton 内核,前向加速 2–3×、后向加速约 2×,在预训练和端侧 Agent 推理场景收益尤为明显。
- 三大特性:
- 基于门控指数衰减特性的卡内序列并行(intra-card context parallelism),在 TP、长序列、小头数设置下自动开启,提升 GPU SM 利用率;
- 硬件友好的代数重构,在不损失数值精度的前提下降低 Tensor Core / CUDA Core / SFU 开销;
- 用 TileLang 构建关键融合内核并手工实现 warpgroup 特化,重叠数据搬运、Tensor Core 计算和 CUDA Core 计算。
- 支持硬件:SM90 / SM100 / SM103 / SM120 / SM121(覆盖 Hopper 到 Blackwell,含 GB10/DGX Spark),CUDA 12.8+、PyTorch 2.8+;最新版还作为
flash-linear-attention的 GDN 后端,通过标准 FLA API 即插即用[3]。
换句话说,Qwen3.8-Flash-Next 不只是开放权重,连把线性注意力跑快的关键内核也一并开源了,这对社区复现和二次部署很实在。
十、如何使用:API、编码工具与部署
10.1 QwenCloud API
生产版在 QwenCloud 上以 qwen3.8-flash 提供,兼容 OpenAI Chat Completions / Responses API,也提供 Anthropic 兼容接口;定价为输入 0.16 美元、输出 0.47 美元 / 百万 tokens(API 发文时标注"即将开放")[1]。调用时支持思考模式与推理强度:
completion = client.chat.completions.create(
model="qwen3.8-flash",
messages=messages,
extra_body={"enable_thinking": True},
reasoning_effort="xhigh", # xhigh / medium / low
stream=True,
)
10.2 编码助手与 Agent 框架
得益于多协议兼容,它可以直接接入多种工具[1]:
- Claude Code:通过 Anthropic 兼容协议,设置
ANTHROPIC_MODEL=qwen3.8-flash即可; - Codex:通过 OpenAI Responses 协议,配置 model catalog(1M 上下文、支持并行工具调用、文本+图像输入);
- Qoder CLI / Qwen Code / OpenClaw:官方与社区工具链均有集成;
- QwenWork:阿里旗舰 AI 生产力平台,已用它驱动新的"Standard"模式,主打办公自动化。
10.3 开源权重与本地化
权重以开放形式发布在 Hugging Face 和 ModelScope(Qwen/Qwen3.8-Flash-Next)。NVIDIA 提供了用 NeMo AutoModel 微调、NeMo RL 做强化学习的指南,SGLang/vLLM/TokenSpeed 也有部署配方[2]。对需要私有化部署、数据不出域的团队,这是比 API 更重要的选项。
十一、意义与冷思考
11.1 三个值得记住的判断
- Flash 的竞争进入"架构层"。从 GLM-5.3-Flash 的稀疏+线性混合注意力,到 Qwen3.8-Flash-Next 的 GDN+QSA、门控残差和 N-gram Embedding,低成本模型的效率红利正从"蒸馏/缩放"转向"注意力机制 + 连接结构 + 记忆参数 + 优化器"的系统级重构。
- 线性注意力需要配套的"检索"和"内核"才能打。GDN 解决"记住",QSA 解决"精确检索",FlashQLA 解决"跑得快"——三者缺一,混合架构就很难在真实长上下文服务中成立。
- 架构提前开源是一种生态策略。Qwen3-Next 的设计随后贯穿四代产品,Qwen3.8-Flash-Next 作为 Qwen4 预览同样在为下一代铺路:让内核、框架、推理引擎和开发者提前适配,比闭门发布更有生态杠杆。
11.2 仍需观察的问题
- API 尚未正式开放、定价可能调整:发文时 0.16/0.47 美元仍是"coming soon"状态,真实线上性价比需等正式计费后验证。
- 自测数据占比高:CoWorkBench、RecreationBench 等为自研基准,编码基准依赖特定 harness 与 256K 上下文/6 小时等设置,第三方复现尚不充分。
- N-gram Embedding 的泛化与边界:51B 查表参数对常见短语和局部模式帮助大,但在强逻辑、长程依赖、罕见代码库场景中的贡献仍需更多消融。
- 与同期 Flash 模型的正面对位:它和 GLM-5.3-Flash、DeepSeek-V4-Flash 定位高度重合,谁能在真实生产负载(长时 Agent、多模态办公、高并发)中更稳更省,还需要时间和独立压测来回答。
十二、结语
Qwen3.8-Flash-Next 的价值不在于"又一个便宜的大模型",而在于它把下一代架构的四个关键变量——注意力怎么算、残差怎么流、容量从哪来、模型怎么训——同时摆上了台面,并以 6B 激活、1/9 训练成本的真实结果证明它们能组合出极强的性价比。GDN 与 QSA 的"记忆—检索"分工、四分支门控残差、可卸载到主机内存的 N-gram 记忆库、Muon 优化器的工程化,再加上开源的 FlashQLA 内核,构成了一套完整的"低成本前沿模型"方法论。
它是通往 Qwen4 的第一块路标。至于这条路最终能走到哪,我们等 Qwen4 完整家族面世,以及社区把它跑在真实负载上之后,自会有答案。
参考资料
[1] Qwen Team:《Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency》官方博客. 2026-08-26. https://qwen.ai/blog?id=qwen3.8-flash-next
[2] NVIDIA Developer Blog:《Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding》. 2026-08-26. https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
[3] QwenLM/FlashQLA GitHub 仓库. https://github.com/QwenLM/FlashQLA
[4] QwenLM/Qwen3.8-Flash-Next 技术报告(tech_report.pdf). https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
[5] IT之家:《阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9》. 2026-08-26. https://www.ithome.com/0/994/735.htm
[6] ModelScope 模型卡:Qwen/Qwen3.8-Flash-Next. https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
[7] Hugging Face 模型卡:Qwen/Qwen3.8-Flash-Next. https://huggingface.co/Qwen/Qwen3.8-Flash-Next