阿里 8 月 26 日晚放出的 Qwen3.8-Flash-Next,最扎眼的不是跑分,是那个激活参数——1250 亿总参数,外加 510 亿的 N-gram 嵌入表和 40 亿的多 token 预测模块,但每个 token 真正参与计算的只有 60 亿。48 层网络,MoE 层塞了 512 个专家,top-10 路由。
这个稀疏度已经很极端了。对照一下就知道:DeepSeek V4 Pro 是 1.6T 总参激活 49B,稀疏比大约 1:33;Qwen3.8-Flash-Next 是 1:21,但绝对激活量只有前者的八分之一。
官方自己给的定位很清楚,这是 Qwen4 架构的早期预览版。四个方向做了系统性改造:注意力换成 GDN 加 QSA 的混合结构,兼顾长文效率和检索精度;残差改成门控,控制跨层读写;那张 510 亿的 N-gram 嵌入表专门用来扩容量,而且可以异步卸载到主机内存,不占显存;优化器也动了。
Base 版在 14 个基准里 8 个拿第一,包括 MMLU-Pro、SuperGPQA、BBH 和 GSM8K。编码这块进步最大,SWE-bench Pro 62.5,SWE-bench Multilingual 81.0。训练成本只有 Qwen3.7-Plus 的九分之一左右。
价格是另一个杀手。国内每百万 token 输入 1 元、输出 3 元;QwenCloud 的海外定价是 0.16 美元和 0.47 美元。权重已经上了 Hugging Face 和 ModelScope,同步给了 FP8 量化版,Flash-Next 默认 1M 上下文并内置官方工具。
值得多看一眼的是那张 N-gram 嵌入表。它不参与主干计算,可以丢到内存里按需取,等于用便宜的内存换了昂贵的显存——这个思路要是站得住,小显存卡跑大模型的空间会比现在大不少。通义千问这次算是把”稀疏”这条路走到了一个新的位置。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






阿里连夜开源 Qwen3.8-Flash-Next:1250 亿参数只激活 60 亿,跑分八项第一