Kimi K3前端编程领先,硬数学落后

The Decoder··作者 Matthias Bastian

关键信息

文中提到,Code Arena: Frontend 基准是按人类偏好评分来排序模型的,而 Kimi K3 也是第一个登顶该榜单的中国模型。报道还指出,Kimi K3 是月之暗面的旗舰模型,参数规模为 2.8 万亿,支持 100 万 token 上下文和多模态能力,这也解释了它为何受到编程和智能体工作流场景的关注。

资讯摘要

月之暗面的 Kimi K3 因为一组明显分化的基准成绩而受到西方 AI 社区关注。在 Code Arena: Frontend 基准中,Kimi K3 以 1,679 分夺冠,并且以较大优势超过了 Claude Fable 5、GPT-5.6 Sol 以及其他所有被测试的模型。报道指出,这是第一次有中国模型拿下该基准的第一名。这个结果让 Kimi K3 在前端代码生成和面向用户的开发任务上显得非常突出。

但在高难度数学上,情况就完全不同了。文章援引 Epoch AI 的数据称,Kimi K3 在 FrontierMath Tier 4 上的准确率只有约 39%,而这一级别是该基准里最困难的专家级数学任务。相比之下,报道提到一些 OpenAI 和 Anthropic 模型在某些情况下在同一层级上接近 90%。综合来看,这两项基准说明 Kimi K3 可能在特定编码任务上非常强,但在最难的推理型数学问题上仍明显落后于最强的西方模型。

Kimi K3前端编程领先,硬数学落后

资讯正文

月之暗面(Moonshot)的 Kimi K3 在前端代码方面优于 Fable 5,但在复杂数学上远远落后

Moonshot 的 AI 模型 Kimi K3 正在西方 AI 社区引起广泛关注。最大的问题是,它究竟能在多大程度上接近最顶尖的西方模型。两项新的数据给出了一个复杂的图景。在 Code Arena: Frontend 基准测试中,模型根据人类偏好评分进行排名,Kimi K3 得分为 1,679,领先 Claude Fable 5(1,631)、GPT-5.6 Sol(1,618)以及所有其他受测模型,优势明显。这是中国模型首次在这一基准测试中夺得榜首。

在高难数学方面,情况则大不相同。根据 Epoch AI 的数据,Kimi K3 在 FrontierMath Tier 4 上的准确率只有约 39%,而这一基准测试收录的是最难的专家级数学题目。在某些情况下,OpenAI 和 Anthropic 的模型在该项上的得分接近 90%。

来源与参考

  1. 原始链接
  2. Moonshot's Kimi K3 outperforms Fable 5 in frontend code but lags far behind in complex math

收录于 2026-07-20