Qwen 3.8 27B 追平前沿模型基准分数

Simon Willison··作者 Simon Willison

关键信息

文中引用的基准是 Artificial Analysis Intelligence Index,它包含 GDPval-AA v2、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 等多项测试。Artificial Analysis 还指出,Qwen3.8 27B 在评测中生成了 1.6 亿个 token,远高于 4300 万的中位数,这说明它的输出异常冗长。

资讯摘要

Simon Willison 报道称,Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得了 52 分。这个分数与 GPT-5.6 Luna 的最高分持平。它也只比 GLM-5.2(max)和 DeepSeek V4 Pro 0813(max)低 1 分。Willison 特别强调了这一对比的震撼之处,因为 GLM 模型标注为 7530 亿参数,而 DeepSeek 模型则达到 1.7 万亿参数。

至于 Luna,虽然参数规模未知,但他推测应该也远大于 27B。文章还提到,他在前一天已经把 Qwen 3.8 27B 形容为“真正令人惊叹的模型”。这条消息通过 Hacker News 传播,讨论焦点主要集中在这个基准结果本身。Artificial Analysis 页面补充说,该模型在评测过程中生成了 1.6 亿个 token,这为结果提供了更多上下文。

资讯正文

Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上得分 52

这和 GPT-5.6 Luna(max)是同样的分数,也只比 GLM-5.2(max)和 DeepSeek V4 Pro 0813(max)低 1 分——其中那个 GLM 是 753B,而那个 DeepSeek 是 1.7T 参数;Luna 的规模未知,但大概远远大于 27B。

Qwen 3.8 27B 是一个真正令人震惊的模型。

经由 Hacker News

标签:ai、generative-ai、llms、qwen、ai-in-china、artificial-analysis

来源与参考

  1. 原始链接
  2. Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index

收录于 2026-08-19