Qwen3.8-Flash-Next 发布
Simon Willison··作者 Simon Willison
关键信息
该模型被描述为总量 125B tokens、但仅有 6B active,这也是其效率提升的核心技术点。Willison 的实测还表明,它可以通过 Unsloth 的量化 GGUF 文件进行本地使用,包括 UD-IQ1_S 和 UD-Q2_K_XL 等版本。
资讯摘要
Simon Willison 在 Qwen 发布 Qwen3.8-Flash-Next 后对这款模型进行了介绍。Qwen 将它描述为一款开源权重的多模态 Mixture of Experts 模型,同时也是 Qwen4 架构的早期预览。文章特别强调了它的规模:模型总量达到 125B tokens,但推理时只激活 6B,这种稀疏激活是其性能提升的关键原因。也就是说,它并不需要在每个 token 上都动用全部参数,而是只调用其中一小部分专家,从而提高计算效率。
Willison 说自己正在 DGX Spark 上使用 Unsloth 提供的量化 GGUF 版本测试该模型。本地测试中,他先尝试了 72.5GB 的 UD-IQ1_S 版本,也试了 78.9GB 的 UD-Q2_K_XL 版本,并展示了这些版本生成的示例结果。虽然这篇帖子并不是严格的基准测试分析,但它说明该模型已经可以在量化、本地化的工作流中实际使用。整体来看,Qwen3.8-Flash-Next 既是一个值得关注的多模态开源模型,也是 Qwen 下一代架构方向的明确预告。

资讯正文
<strong><a href="https://qwen.ai/blog?id=qwen3.8-flash-next">Qwen3.8-Flash-Next</a></strong>
来自 Qwen 的另一款开放权重模型。这款模型是“一个多模态 MoE 模型,同时也作为 Qwen4 所采用架构的早期预览”。
它相当大:共有 125B tokens,但只有 6B 是激活的,这意味着它能获得显著的性能提升。
我一直在 DGX Spark 上使用<a href="https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF">这些 Unsloth 量化模型</a>进行试用。我还在继续探索这个模型——到目前为止,我试过 72.5GB 的 UD-IQ1_S 版本(生成了<a href="https://tools.simonwillison.net/markdown-svg-renderer#url=https%3A%2F%2Fgist.github.com%2Fsimonw%2Ff9c69ebdab90d8a45b8de4742cc7b840">这些鹈鹕</a>),以及 78.9GB 的 UD-Q2_K_XL(生成了<a href="https://tools.simonwillison.net/markdown-svg-renderer#url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F6ba7cbfc1a9336986703b41f7fccd73a">这些</a>)。
到目前为止,我最喜欢的是这个来自 UD-Q2_K_XL 的 xhigh reasoning effort 结果:
来源与参考
收录于 2026-08-28