阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6B
创始人
2026-08-26 22:31:54

IT之家 8 月 26 日消息,阿里通义千问团队今晚正式发布了 Qwen3.8-Flash,这是一款基于下一代 Qwen4 架构的多模态 MoE(混合专家)模型。

该模型主模型参数量为 125B(约 1250 亿),额外配备 51B 的 N-gram Embedding 参数,每 token 仅激活 6B 参数。Qwen3.8-Flash 被定位为 Qwen4 架构的技术预览版,旨在让开发者社区提前适配新架构。

架构四大升级

Qwen3.8-Flash 围绕四个方向进行了系统升级。

在 Attention 方面,采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN 负责高效压缩历史信息,QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。

在 Residual 方面,引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,大幅降低访存开销。

在 Embedding 方面,引入 51B 参数的 N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。

在 Optimization 方面,采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。

性能与成本

相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。

可用性与定价

Qwen3.8-Flash 即将上线千问 AI 平台,对外提供 API 服务,定价为每百万 Tokens 输入 1 元、输出 3 元。模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文并内置官方工具。

相关内容

热门资讯

关注|面临四大瓶颈,谁能在柔性... 来源:阳光高考信息平台 从柔性存算芯片到超薄弹性介电材料,从“能感知”到“能思考”,柔性电子正在经历...
反常识的爆款:一亿注册、千万D... 一个月前,《无畏契约:源能行动》(业内及玩家习惯称之为“手瓦”)抛出一枚重磅数据:用户注册量正式突破...
手瓦一周年复盘:曾担心生不逢时... 一个月前,《无畏契约:源能行动》发了条公告:注册用户破亿了。往前推几个月,今年5月他们还公布过一个数...
重庆电力上线调控核心业务AI智... 8月25日,国网重庆江津供电公司调控中心调度班班长刘嫣然,在研发投运的“调控核心业务智能查询与辅助管...
苹果最强Mac杀到!全新Mac... 快科技8月25日消息,今日,苹果全新Mac Studio发布,可选M5 Max与全新M5 Ultra...