阿里巴巴发布Qwen3.8-Flash-Next
The Decoder··作者 Matthias Bastian
关键信息
一个值得注意的架构变化是 510 亿参数的 N-gram embedding 层,它把常见词组存成类似“短语词典”的形式,并且可以放在系统内存而不是 GPU 显存中。该模型原生支持 262144 token 的上下文窗口,并可通过 YaRN 扩展到 100 万 token。
资讯摘要
阿里巴巴 Qwen 团队推出了 Qwen3.8-Flash-Next,这是一款多模态 MoE 模型,并被明确定位为 Qwen4 架构的预览版。公司表示,这个模型的目标是在大幅降低成本的同时,尽量接近旗舰级能力。它总参数量为 1250 亿,但每个 token 只激活 60 亿参数,因此推理时只需要使用一小部分参数。该模型的一项主要架构创新是 510 亿参数的 N-gram embedding 层,它会把常见词组以类似“短语词典”的形式存储,而且可以放在普通系统内存中,而不必全部占用 GPU 显存。Qwen 认为,这种设计能以相对较低的额外成本换来更好的效率。
模型原生支持 262144 token 的上下文窗口,并且可以借助 YaRN 扩展到 100 万 token。阿里巴巴已经把技术报告放到 GitHub,上线权重也可以在 Hugging Face 和 ModelScope 上获取。生产版则通过 QwenCloud 以 Qwen3.8-Flash 的形式提供,定价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元,API 也即将开放。Qwen 还称,Flash-Next 以大约九分之一的训练成本,取得了比 Qwen3.7-Plus 更好的结果,尤其在编程和办公任务上提升明显。阿里巴巴公布的基准测试显示,它在大多数测试项目中都领先于 DeepSeek-V4-Flash 和 Anthropic 的 Claude Opus 4.6,包括面向真实软件项目自动找错和修复的 DeepSWE 与 SWE-bench Pro 等智能体编程基准。

来源与参考
收录于 2026-08-27