PerceptionBench 揭示 AI 模型视觉感知仍然薄弱
The Decoder··作者 Jonathan Kemper
关键信息
PerceptionBench 将视觉感知拆分为十个原子技能领域,包括视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉。月之暗面表示,公开的 3000 个任务中有 60% 来自真实标注的模型错误,其余 40% 则通过增强图像重新表述。
资讯摘要
月之暗面的 Kimi 团队发布了 PerceptionBench,用来衡量多模态模型在推理开始之前到底能否真正“看懂”图像。该基准的目标是把视觉感知与逻辑推理和外部知识分离开,因此所有题目都只需看图即可作答。公司表示,现有基准往往只能覆盖感知错误的一小部分;他们分析了 42 个开源基准后发现,这些基准在错误类型上的重叠很少,说明没有单一测试或少量测试能够完整刻画视觉感知。研究团队没有预先设定分类,而是从真实模型错误出发,逐步追溯到最早出错的环节,最终整理出十个技能领域。這十个领域包括视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉。
Moonshot AI 公开了 3000 道任务题,这些题目来自超过 1.7 万道经过验证的问题池,其中 60% 源自已标注的模型错误,40% 则通过增强图像重新改写。题目表面上看很简单,比如判断时钟上符号的位置、数出红框里的花朵,或者区分两个外形接近的笔筒,但结果显示前沿模型依然表现不佳。报道称,没有任何前沿模型在该测试中的准确率超过 60%,而 GPT-5.6 Sol 只是以很小优势领先。作者认为,很多通常被归咎为“推理错误”的现象,其实是在模型读取图像的感知阶段就已经出错了。相关数据集和评测代码已经发布在 GitHub 的 MoonshotAI/PerceptionBench 仓库中。

资讯正文
新基准测试证实,AI 模型在视觉感知方面仍然表现不佳
Moonshot AI 推出了 PerceptionBench,用于在不依赖逻辑推理和外部知识的情况下,评估多模态模型的视觉感知能力。测试基于现实世界中的错误来衡量基本视觉能力。包括 GPT-5.6 Sol、Kimi K3 和 Claude Fable 5 在内的所有领先模型,都在评估中暴露出明显弱点。
作者得出的结论是,许多所谓的逻辑错误其实源于有缺陷的视觉感知。这也印证了此前研究的发现:即便是最好的模型,在基本视觉任务上也会失败。
Moonshot AI 的 PerceptionBench 测试多模态 AI 模型究竟能在多大程度上真正“看见”图像,而不是进行逻辑推理。没有任何前沿模型的准确率能达到 60%,GPT-5.6 Sol 仅以微弱优势领先。许多看似推理出错的问题,其实在图像读取阶段就已经出错了。
这家中国 AI 助手 Kimi 背后的团队推出了 PerceptionBench,这是一个将多模态语言模型的视觉感知单独剥离出来进行测试的基准。与标准测试方法不同,PerceptionBench 将视觉拆分为十项原子级子技能,而不是把感知、知识和推理混在同一个任务里。每一道题都只需看图即可作答,不需要推理,也不需要外部知识。
基于真实错误构建的类别,而非理论
作者解释说,他们的方法之所以这样设计,是因为现有基准各自只能捕捉感知错误中的很小一部分。对他们分析的 42 个开源基准来看,其错误分布重叠很少,因此每一个基准都只覆盖了视觉弱点中的不同子集。没有任何单一测试,或少量测试的组合,能够全面覆盖视觉感知。
作者没有事先定义类别,而是从模型真实错误出发建立分类体系,并将每一种错误追溯到现有基准中最早失败的步骤。最终形成了十个“技能域”:Visual Relation、Counting、Attributes、Depth & 3D、Localization、Comparison、Fine-grained Recognition、Context Integration、OCR 和 Hallucination。
Moonshot AI 从一个超过 17,000 道已验证问题的内部题库中发布了 3,000 道任务。其中 60% 源自有归因的模型错误,另外 40% 则通过增强图像重新表述而来。这些任务表面看起来并不难:比如判断钟面上某个符号的位置,数出红色方框里的花朵数量,或者比较两个铅笔筒中,哪一个呈现灰粉配色,另一个则是带卡通图案的纯粉色。
没有任何模型能突破 60%
许多“推理错误”其实是感知失败
作者认为,许多多模态模型的失败通常被归咎为“推理错误”,但实际上发生在感知层面。当模型搞砸一个多步骤任务时,第一步——正确读取图像——往往就已经出错了。
PerceptionBench 将这些问题拆分成仅涉及感知的子问题,从而能够定位到底是哪一项具体视觉能力出了问题。该数据集和评估代码已在 GitHub 上以 MoonshotAI/PerceptionBench 的形式公开。
一个广为人知、却几乎没有取得进展的问题
Moonshot AI 打造了开源模型 Kimi K3,它在通用基准测试上已经将与 Claude Fable 5 和 GPT-5.6 Sol 的差距缩小到只剩几个百分点。不过,K3 在进攻性网络安全和复杂数学等专门领域仍然明显落后。至于视觉感知,K3 现在的表现已经与其西方竞争对手不相上下。
同一研究团队此前已经发布了 WorldVQA,这是一个将目标识别与推理分离开的基准。在该基准上,表现最好的模型 Gemini 3 Pro 也只有 47.4%,未能达到 50%;而且所有模型都系统性地高估了自己的置信度。
另一项由中国机构开展、Moonshot AI 参与的研究使用 BabyVision 基准表明,前沿模型在与幼儿发展相关的基础视觉任务上表现失败,例如描线或数隐藏的积木。Gemini 3 Pro 在这些任务上的得分为 49.7%,而人类达到 94.1%。研究人员将这种差距归因于一种“语言化瓶颈”:视觉信息在转化为语言的过程中丧失了保真度。
来源与参考
收录于 2026-08-16