On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability —— Qwen Team

arxiv.orgOn the Design of Qwen3.8-Next Architecture: Evaluation,…We describe the architecture and ablations of Qwen3.8-Flash-Next, a sparse mixture-of-experts model with 125B parameters, 6B activated per token, and additional 51B parameters of n-gram embedding…

Qwen3.8-Next 架构设计报告

Qwen 团队用 Qwen3.8-Flash-Next(125B 总参 / 6B 激活 / 另有 51B 放在主机内存里的 n-gram 嵌入表)说明,如何把损失与下游指标、训练与推理成本、超参最优点与训练稳定性当作一个耦合问题联合求解。结果是用上一代旗舰 Qwen3.7-Plus(397B-A17B)约 1/3 的激活参数、1/3 的训练 token、约 1/9 的训练 FLOPs,在 14 个预训练基准中 8 项领先、其余落后不超过 2.6 分。

方法论主线:三轴联合评估

论文最有价值的部分不在于某个单点模块,在贯穿始终的评估框架。每个候选改动都沿三条轴检验:

  1. 效果:训练损失 + 下游基准(二者经常不一致)
  2. 成本:分别核算训练、prefill、decode 三个阶段
  3. 优化影响:对最优超参的偏移与对稳定性的影响

反复出现的核心观察:损失与下游准确率并不总是同向,且分歧双向都有:

  • n-gram 词表越大损失单调下降,但下游指标饱和
  • 残差读写权重改为数据依赖,损失只降 0.002,基准却涨约 2 分
  • 有些分歧”迟到”:稀疏残差读(只读 gate 最高的两条分支)预训练几乎无损,后训练后明显退化;全注意力层去掉 RoPE(NoPE)预训练无差别,后训练后”无限生成”率显著升高

这直接导出论文的工程结论:只看预训练 loss 会做错决策,必须并行看基准,并在可能时看后训练结果。

四个架构组件

\1. GDN 混合注意力(3:1)

  • 每 4 层中 3 层为 Gated DeltaNet(线性注意力,固定大小的循环状态,用衰减门 α 和写入门 β 做”定向擦写”而非无界累加),1 层全局注意力保留精确的 token 级检索。
  • 相比原版 GDN,输出门由 SiLU 改为 sigmoid(有界),实验一致更优;全模型统一用零中心 RMSNorm。
  • 25B-A3B 消融:GDN 混合在 9 项基准中 8 项胜全注意力、7 项胜 SWA(窗口 128)混合,平均 53.8 vs 49.9 / 51.2。
  • 工程:自研 TileLang 内核库 FlashQLA,相对 FLA Triton 前向提速 2–3×、反向约 2×(已开源)。

\2. Qwen Sparse Attention(QSA)

  • 在 CPT(256K 上下文)阶段把全注意力层替换为 QSA。思路沿 DeepSeek DSA 的”轻量 indexer 选 top-k”路线,但关键改进是 indexer 在微块(micro-block,r=4)粒度上打分:key 先平均池化压缩再加位置编码,indexer 复杂度从 O(n²) 降为 O(n²/r)。
  • 与跨层共享索引(IndexShare)的思路对比:在 GDN 混合架构里相邻注意力层隔着 3 层 GDN,层间相似性低,跨层共享效果差;层内压缩不依赖跨层相似性,更适配混合架构。
  • indexer 仅用 4 个 query 头(MQA),token 预算 K=2048;训练分两阶段:先用 KL 蒸馏全注意力分布(max-pool 到块级)预热 indexer,再联合稀疏训练约 200B token。稀疏训练损失与全注意力差异在 10⁻⁴ 量级。
  • 效果:短上下文基准 8 项中 7 项持平或更好(均值 75.9→76.8);长上下文反而更强——RULER 512K–1M 从 90.1→93.0,MRCR 512K 从 30.7→40.5、1M 从 20.7→26.4。
  • 效率:1M 上下文下注意力模块 kernel 级提速 prefill 7.6×、decode 4.9×。MTP 模块复用 top-k 索引,接受长度无变化。

\3. Gated Residual(GR)

这是论文最原创、也最值得细读的部分。

  • 问题:Pre-norm 残差流是单一向量,早层写入的特征要与后续所有写入竞争。
  • 路线:残差流拓宽为 n_r=4 条分支(沿 AltUp / Hyper-Connections 路线),再决定读写机制的表达力花在哪。
  • 消融得到的五条结论:sigmoid 门优于 tanh(loss 和稳定性都更好,与 mHC 一致) 读写数据依赖:loss 增益很小但基准增益大 读的粒度比写的粒度重要:读改为逐分支逐通道(elementwise)有收益,写保持每分支一个标量即可 从所有分支预测门控优于只用最后一条或先池化;每分支单独 RMSNorm 更好 分支间混合算子 H_res 几乎没用——读写足够表达后加它无显著收益
  • 最终设计:GR = 团队此前提出的 GatedNorm(RMSNorm 后接低秩瓶颈 sigmoid 自门控)应用到拓宽残差流上。读:各分支分别 RMSNorm → 从全部分支预测逐元素门 → 门控后平均;写:每分支一个数据依赖标量 s_i = 2σ(·)。它同时取代了 block 的 pre-norm,无需特殊初始化。
  • 对比同族方法:HC/mHC 把容量花在 H_res(mHC 还要约束为双随机矩阵),VWN 拆分 embedding;GR 把容量花在读上并彻底去掉 H_res,省掉每个 block 对整个残差状态的一次完整读取(这是拓宽残差流的主要推理成本),也移除一个需要额外约束的不稳定源。
  • 与 Attention Residual(Kimi)对比:28 层模型上,Full AttnRes 与 GR 持平(1.762),Block AttnRes 差 0.008–0.011;48 层上 GR 1.707 优于 Block AttnRes 1.711。GatedNorm 在所有设置上都降 loss。
  • 可解释性分析(因为无 H_res,每条分支就是纯累加器,可精确分解每个 block 的输入来源):训练后恰好一条分支承载长程路径(典型跨越 10.9 层,几乎只在第 0 层被写入),其余三条保持局部(跨 1.2–3.5 层)。第 0 层 GDN → 第 15 层注意力的贡献份额从 0.020 升到 0.138。长程路径的读者主要是 softmax 注意力层,说明全局注意力是整合 GDN 压缩掉的历史信息的枢纽。整体上 GR 强化相邻路径(+0.96)和长程路径(+0.91)、削弱中程路径(−3.21),总跨层信息量近似不变,只是重分配。
  • 推理效率:稀疏读(只读 2 条分支)因后训练退化被否决;残差状态存 FP8(门控使值域收窄,几乎无损,字节数减半);读写各融合为单一 kernel。

\4. N-gram 嵌入层

  • 单层,放在第 2 层(可与第 1 层计算重叠做主机内存预取),多头哈希查表,门控注入残差流;51B 参数完全离加速器。
  • 放置:浅层略优,但多层分配同一预算无一致收益,单层足够;放置选择与注意力类型无关。
  • 固定总参预算下(削减专家数换 n-gram):loss 在 10× 词表处最低,但下游无改善 → n-gram 与 MoE 专家扮演不同角色,不宜互换。
  • 额外增参数(20×–200× 基础词表):loss 单调下降,下游整体涨但很快饱和;中文基准(C-Eval/CMMLU)随词表持续提升
  • 试过 token 归一化压缩词表、非均匀 n 阶分配、按频率分区等,均无一致收益。

优化:Muon 及其工程细节

  • Muon 用于”真正作为线性映射”的 2D 权重(q/k/v/o、GDN 输入输出投影、专家 fc1/fc2、n-gram 层的 k/v 投影);embedding、输出头、MoE router、GR 的低秩投影用 AdamW。router 上 Muon 会加剧早期波动(推测:各输出维度对应独立专家分数,无共享线性结构可正交化);GR 低秩投影形状过于细长。
  • 拆分融合参数:Megatron 里 qkv、SwiGLU fc1、GDN 输入投影是拼接矩阵,直接正交化会混合无关子块的奇异方向且缩放系数用错形状。按头拆分 qkv/GDN 投影提升 loss 和基准;fc1 拆 gate/up 基准略升。
  • NS 迭代 8 步(Polar Express 系数),更精确、压力测试下梯度尖峰更少。
  • 系统层面:自研 Canzona 框架按估算的 NS FLOPs(与形状有关而非参数量)重划 DP 分区,TP 下用 All-to-All 重建完整矩阵;拆分后每层上百个小矩阵导致 kernel 启动开销主导,用 CUDA graph 捕获整个 step。

超参缩放律:更大的 batch 和 lr,取消 batch warmup

  • 新架构 + Muon 更稳,重拟合缩放律后预测更大 batch、更大 lr、lr 随模型规模衰减更慢
  • Batch 验证(10.8B-A0.89B,4T token):从旧配方 12.6M 增至预测 25.2M,loss 降 7.2×10⁻³;再增到 37.7M 仅差 4.3×10⁻⁴。曲线在预测值以下陡升、以上平坦。
  • Batch-size warmup 不再必要:ramp 到目标 batch 的两种变体均略差于恒定 batch(差 2.5–3.5×10⁻⁴),且多耗 18.8% 优化步。机制:早期小 batch 噪声大导致 loss 更高;到达目标后短暂的”步数优势”在 lr 衰减后被抹平。
  • LR 验证(156B-A7B,419B token):预测最优附近 ±√2 lr、+25% batch 四个设置 loss 差异在 7×10⁻⁴ 内(平坦盆底),旧配方高 7.8×10⁻³;下游平均 60.55 vs 旧配方 56.41。所有运行 warmup 后都未触发梯度裁剪。

稳定性压力测试

  • 设计:28 层 25B-A3B,恒定 lr 在最优值的 2×/4×(模拟大规模长时间处于峰值 lr),标准为”新配方至少不差于已成功放大的 Qwen3.5+AdamW”。
  • 结果:4× lr 下 AdamW 每 1 万步 183 次 loss 尖峰、213 次触发裁剪;两个 Muon 配置从未触发裁剪,Muon+GR 零尖峰
  • 单变量隔离 gate:AdamW、3× lr、仅开关 GatedNorm——尖峰率 32.0→3.2/万步,裁剪触发 256→20。lr 阶梯实验显示:无门控时激活离群值随 lr 近似线性增长而尖峰率增长更快;开门控后最高 lr 的离群值低于无门控最低 lr。解释:高 lr 训练需要某种重缩放机制,无显式门时网络靠”长出激活离群值”来实现(脆弱),乘性门直接提供这一重缩放。
  • 生产配置验证(前 276B token):GR 降 loss 0.026,完整配方再降 0.032;Muon 单独运行的梯度范数中位数约 2 倍、p99.9 约 4.2 倍于门控运行,且是唯一触发裁剪的。正式训练全程无一次 loss 尖峰,未使用 qk-clip / SwiGLU-clip 等显式裁剪手段。

最终结果(Base 模型,14 项基准)

Qwen3.8-Flash-Next-Base(125B-A6B + 51B n-gram)vs Qwen3.7-Plus-Base(397B-A17B):8 胜 6 负,明显领先于 MMLU-Pro(73.2 vs 70.9)、SuperGPQA(51.4 vs 48.4)、MGSM(89.3 vs 85.4)、SWEBench-Pretrain(51.0 vs 49.2);落后最多的是 MultiPL-E(79.1 vs 81.7)和 MATH(72.8 vs 74.4)。全面超越 Qwen3.8-27B-Base 稠密模型。