8月26日晚,阿里发布并同步开源千问最新模型Qwen3.8-Flash。
得益于架构和训练的全面革新,Qwen3.8-Flash训练成本较Qwen3.7-Plus下降近90%,推理成本同样大幅下降,每百万Tokens输入仅1元,输出3元,价格最低至DeepSeek-V4-Flash的1/3。
值得一提的是,Qwen3.8-Flash是一个多模态混合专家(MoE)模型,其出色的模型能力得益于其革新的模型架构和训练方案。模型采用与此前所有千问大模型完全不同的全新架构,如在注意力方面,引入独特的QSA(Qwen Sparse Attention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上;在模型优化方面,模型结构和训练优化协同进行,收敛效率和训练吞吐大幅提升。
据了解,Next新架构将是全新一代千问大模型Qwen4的雏形,Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源,交由全球AI开源社区检验。
数据显示,截至目前,Qwen3.8系列已开源发布2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,Qwen模型全球下载量突破30亿次,衍生模型数超30万个,全尺寸、全模态的全面开源正在全球掀起新一轮中国大模型浪潮。