Paper Note · Multimodal Evaluation

PerceptionBench 深读:它测到的是原子视觉,还是困难样本的失误尾部?

PerceptionBench 最有价值的地方,不是宣布“最强模型看图也只有 60 分”,而是把真实失败轨迹拆成可定位的视觉能力剖面。它是一张很好的困难失误地图,但还不是一把经过独立标定的“通用视觉智商尺”。

3,000 个公开问题 10 类视觉能力 16 个发布方评测模型 失败驱动归纳

核心判断

Kimi 团队从 42 个既有基准的前沿模型错误出发,定位推理轨迹中最早出现的错误,再把其中 10 类感知错误做成 3,000 道短答案题。这个方向正确地把“最后答错了”改写为“最先在哪里看错了”,因而比单一总分更能指导数据和训练。

诊断强

从失败反推能力

不是先拍脑袋列任务,而是先观察当前模型怎么失败,再归纳关系、计数、定位、OCR、幻觉等能力。

外推弱

困难尾部不是自然分布

两轮前沿模型筛选会剔除“全部稳定做对”的题;低于 60% 至少部分来自困难样本挖掘,不能翻译成日常看图准确率。

待复现

数据开放,榜单未闭环

公开了题库、基础推理脚本和裁判提示词,但没有逐模型输出、裁判记录、完整配置和构造流水线。

一句话结论

把 PerceptionBench 当成能力级回归测试与错误探针很合适;把 59.7 对 58.5 当作稳定的模型名次,或把 60% 当作模型视觉的自然上限,都超出了现有证据。

它真正想解决什么问题

传统多模态问答把看图、知识调用、数学计算、空间模拟和语言输出揉进一个最终答案。模型答错时,研究者很难知道是“没看见”“看错了”,还是“看对了但不会推”。PerceptionBench 的关键动作是把完整推理轨迹交给分析模型,执行最早错误归因:只要第一处错误是视觉事实读取错误,后面即使还出现推理错误,也优先归入感知类别;只有视觉事实都正确时,才归到推理或知识错误。

这使它回答的不是“模型能否完成某个任务”,而是“当前模型最先在哪类视觉操作上失真”。这一转向很重要:下游推理无法可靠补回一个根本没被读取、被数错或被幻觉出来的视觉事实。

更准确的定位

它不是第一个证明多模态模型存在基础视觉缺口的基准,也不是第一个使用“atomic visual skills”概念的工作。它更具体的新增价值,是把跨基准真实失败、最早错误归因、人工原子化重写组合成一条较完整的诊断流水线。

方法链路:从 42 个基准到 3,000 道题

  1. 收集失败在 42 个公开视觉基准上运行前沿多模态模型,保留错误回答与完整轨迹。
  2. 标最早错误由更强分析模型读取问题、图像、参考答案和轨迹,生成开放词表错误标签。
  3. 聚类归纳语言模型合并标签,得到 5 个错误大类、22 个错误类型,其中保留 10 类感知错误。
  4. 第一次筛难四个前沿模型组成筛选集合;所有模型在所有重复运行中都答对的样本被移除。
  5. 人工原子化十余名专业标注者把复杂失败拆成短子问题,并为补充图像编写新问题。
  6. 近重复检查使用图像描述子排除与大规模网页图像库高度相似的图像,阈值为余弦相似度 0.95。
  7. 二次筛选验证再次做前沿模型筛难、能力一致性检测、视觉可回答性检查与独立人工复核。
  8. 平衡发布从超过 17,000 道内部题池发布 3,000 道,兼顾十类能力与难度层级。

公开集里到底有什么

公开数据可直接核对为 3,000 行:1,800 道由既有基准失败拆解而来,1,200 道是新编问题。前 1,800 道保留来源基准和原始索引;按来源与索引去重后,对应约 1,413 个原始条目,说明一个复杂失败经常被拆成多个子问题。每题包含问题、短参考答案、能力标签、来源信息以及 1–8 张图像。

能力题数它试图隔离的视觉操作
视觉关系330读取物体之间直接可见的方向、邻接、遮挡或拓扑关系。
视觉计数330在指定范围和约束下统计实例、部件或图形元素。
视觉属性330识别颜色、形状、材质、朝向和局部状态等属性。
深度与 3D330判断深度、视角、可见面和三维结构。
视觉定位330在图像、棋盘、界面或坐标结构中找到目标位置。
视觉比较279跨对象或区域比较数量、位置、尺寸与图案。
细粒度识别290区分外观接近的对象、部件、符号或状态。
上下文整合255整合多区域、多图或局部与全局信息。
OCR255读取自然图像、图表、界面和数学图形中的文字或数字。
感知相关幻觉271拒绝报告不存在的对象、线路、数量、文字或关系。

“原子能力”成立到什么程度

这里的“原子”更像一个操作性定义:标注者尽量让每题只需要一种主要视觉能力,并用最早错误规则强制给出一个主标签。它不是对人类视觉系统的本体论分解,也没有证明十类能力彼此独立。

标签仍有交叠

“某列有多少棋子”同时涉及定位与计数;“哪组图案含相同数量的三角形”同时涉及计数与比较;“上下文整合”本身就是组合能力。单标签记录的是首要归因,不是题目只包含一种计算。

部分题仍需推断

隐藏方块的最少数量要求推断不可见结构;把夜景图旋转到文字可读方向涉及心理旋转;路线追踪、缺块匹配和多图整合也超出“看一眼即可抄写事实”。

因此,发布帖所说的“无需推理、只要看”应理解为尽量降低领域知识与长链条推理,而不是所有题都不存在空间模拟、比较、约束满足或短程推断。论文自己的错误体系也承认空间推理与深度感知之间需要人为消歧,这说明边界是标注协议,而非天然分界。

“自下而上”也不是完全无先验

最终分类受 42 个源基准、当代模型的失败分布、未具名分析模型、四模型筛选集合、语言模型聚类、人工重写与能力平衡共同影响。更准确的说法是失败驱动的混合式分类法:证据来自底层失败,但类别仍经过模型和人工设计。

榜单告诉了我们什么

发布方在统一裁判下评测 16 个模型。GPT-5.6-Sol 为 59.7%,Kimi K3 为 58.5%,随后是 Claude-Fable-5 的 57.2%、Gemini-3.1-Pro 的 56.2%、GPT-5.5 的 55.8% 和 Seed-2.1-Pro 的 55.0%。最低为 GLM-4.6V 的 32.5%。

GPT-5.6-Sol
59.7
Kimi K3
58.5
Claude-Fable-5
57.2
Gemini-3.1-Pro
56.2
GPT-5.5
55.8
Seed-2.1-Pro
55.0

第一条有效结论:总分相近,能力结构可以不同

GPT-5.5 与 Gemini-3.1-Pro 总分只差 0.4,但前者定位高 13.1 分,后者 OCR 高 7.8 分、细粒度识别高 7.6 分。GPT-5.6-Sol 总分最高,定位达到 76.7,却在幻觉类只有 26.9;Gemini-3.5-Flash 总分 52.0,幻觉类反而最高,为 50.6。对训练与产品而言,十维能力向量比一个总分更有用。

第二条有效结论:平均稳定不等于逐题稳定

论文对三个模型各运行四次。总分标准差很小,但同一道题的成功状态经常改变。根据论文的 pass@4 与 pass4 重排,可以把题目分成“从未做对”“间歇做对”“四次全对”三类:

模型四次均分从未做对间歇做对四次全对
GPT-5.6-Sol59.7%27.1%26.0%46.9%
Gemini-3.5-Flash52.0%29.8%37.6%32.6%
Kimi K358.5%26.1%31.2%42.7%

这支持“能力尚未稳健获取”的判断,却不能把所有波动都归因于视觉。采样温度、长思维链、输出格式、图像预处理和裁判随机性都可能造成同样现象。要定位原因,需要公开逐题多次输出并做误差分解。

第三条需要收紧:低于 60% 不是自然视觉上限

构造流程会两次使用前沿模型筛选,并排除筛选集合能够稳定答对的题。被评测的 16 个模型与筛选集合不重叠,这降低了直接针对榜单模型选题的风险,但仍然明确改变了题目难度分布。因此,“没有模型超过 60%”能证明前沿模型仍有大量被精心挖出的视觉失败;它不能证明模型在普通图片上只能正确感知六成内容。

独立复算:几组数字该如何读

≈36 题

第一与第二

1.2 个百分点乘以 3,000 题,对应约 36 道题的差距。

31.2%

K3 间歇区

至少一次做对、但没有四次全对的题目占比。

39.1%

幻觉类零答案

271 道幻觉题中,106 道参考答案恰好是“0”。

0.84

公开与私有相关

只在 10 个能力均值上计算的 Pearson 相关。

1.2 分不足以单独支撑稳定排名

在把每题近似视为独立伯努利试验的简化条件下,59.7% 的 95% Wilson 参考区间约为 57.93%–61.44%,58.5% 约为 56.73%–60.25%,两者明显重叠。这个区间不是自然任务分布上的置信区间,因为题目经过分层与困难挖掘;它只说明 1.2 分的量级并不大。真正比较同一批题上的两个模型,应基于逐题配对结果做 McNemar 检验或配对自举,而这些输出尚未公开。

299/300 的裁判一致率很好,但样本仍小

自动裁判在随机抽取的 300 个预测中与人工判断一致 299 次。对应的 Wilson 95% 区间约为 98.14%–99.94%。这是积极证据,但论文没有披露抽样是否跨模型与能力分层、人工标注者数量、分歧解决规则,也没有说明唯一一例分歧的方向。榜首差约 36 题,裁判误差若对模型或答案格式不均匀,仍可能影响近距离排名。

r = 0.84 只验证了十个能力点

论文用公开子集与超过 17,000 题的内部池比较十类能力准确率,得到 Pearson r = 0.84。因为样本点只有十个,Fisher 变换下的 95% 参考区间约为 0.45–0.96,范围很宽;更重要的是,这张图验证的是能力级难度结构,不是逐模型排名保持。论文从中进一步推断“相对模型表现”得以保留,证据仍不充分。

“幻觉”成绩也混入了回答策略

公开数据中,271 道幻觉题至少有 106 道答案恰为“0”;若把“0 cats”“0 lamps”等形式也计入,以 0 开头的答案有 118 道,占 43.5%。这类题确实测视觉假阳性,但也会受模型是否愿意回答“没有”、选项偏置、校准和强制作答策略影响。论文把 GPT-5.6-Sol 的低幻觉分归因于“更积极的回答承诺”,目前只是合理假说,尚无校准实验或干预实验支持。

开放性与复现:已经公开了什么,还缺什么

已经开放

  • 3,000 道问题、参考答案、图像、能力标签和样本来源;
  • 一个通用的兼容接口推理脚本;
  • GPT-oss-120B 自动裁判提示词与解析代码;
  • 论文、能力计数、16 模型总分与能力分、三模型四次运行摘要。

尚未开放

  • 16 个模型的逐题预测、裁判判定和错误日志;
  • 精确模型版本、端点、图像缩放、随机种子与每模型完整请求参数;
  • “max / xhigh / high”推理预算在请求中的实现;
  • 分析模型与四模型筛选集合的身份、构造提示词、采样与验证脚本;
  • 超过 17,000 题的内部池、难度标签与完整人工审核记录。

公开脚本可以复跑题库,但不能从零复刻论文榜单。它没有编码论文描述的各模型推理预算,也没有实现 Claude-Fable-5 遇到安全拒绝时切换到 Claude-Opus-4.8 的规则;而论文报告该回退覆盖 1.1% 的答案。裁判温度为 0.3,推理或裁判失败会落为错误答案,却没有单独报告失败率。对近距离排名而言,这些都是实质配置。

数据说明里还有两个值得修正文档的细节

来源集合未完全对齐

公开数据的 1,800 道来源题覆盖 42 个具名来源,其中包含 22 道 VibeEval;论文附录列出的 42 个发现基准不含 VibeEval,却包含 RealWorldQA,并明确说 RealWorldQA 只用于失败分析、不贡献公开样本。发现集合与发布样本来源集合可以不同,但当前论文与数据卡没有解释这次替换。

许可证口径需要逐样本理解

数据卡把整个数据集标为 CC BY-NC 4.0;论文则称新编问题和自有标注采用 Apache-2.0,来源题继续受原基准的 Apache、MIT、Creative Commons、非商业、禁止演绎或未明确许可等不同条款约束。实际再分发或商用时,单一数据集标签不足以覆盖全部样本来源。

测量效度:四个仍未闭环的问题

发布方报告

42 个基准的错误分布平均加权 Jaccard 仅 0.20。这说明所选基准暴露的错误构成较分散,但没有做集合覆盖或消融,因而不能推出“必须聚合全部 42 个”或“十类已经覆盖视觉空间”。

缺失基线

没有人类准确率、耗时和歧义率。题目被人工验证为可回答,不等于人类接近满分。早期 BLINK 在 3,807 道视觉题上报告人类 95.70%、GPT-4V 51.26%,而 PerceptionBench 自己缺少同域的人类与专用视觉模型标尺。

分析判断

近重复检查不能证明训练集无污染。论文仅举例说明对 LAION、Common Crawl 等库做图像描述子比对,未给出完整库版本和文本问题查重;它更无法覆盖闭源模型的私有训练数据。现在题目与答案已公开,未来模型的后训练污染风险会持续上升。

尚无复现

当前结果仍是发布方自评快照。公开仓库尚无实质 issue 或外部复现报告。K3 在官方模型说明中曾把它称为内部基准;公开发布后,最好由独立团队用锁定版本和同一预处理重新跑榜。

还需注意已有前作。2025 年的 Atomic Visual Skills Dataset 已在基础二维欧氏几何中系统定义不可再分的视觉技能;当前 PerceptionBench 论文参考文献未包含该工作。PerceptionBench 的优势在于覆盖更广、来源更贴近真实失败,AVSD 的优势则是定义更窄、更接近受控技能分解。两者说明“原子视觉”的价值已经形成研究脉络,创新点应放在具体归纳与构造方法,而不是词语本身。

真正值得带走的研究与工程启发

一、把总分换成“能力 × 稳定性”矩阵

部署侧不应只看整体准确率。更实用的报告至少同时展示十类能力分、从未做对/间歇做对/稳定做对三类占比,以及模型在缺失内容题上的假阳性率。前两项回答“会不会”,稳定性回答“靠不靠谱”,幻觉校准回答“看不见时敢不敢乱说”。

二、让“原子性”接受干预,而不只接受标签

单标签无法证明题目只依赖一种能力。可以给每题增加“所需操作”多标签,并做两类干预:其一,只改变目标视觉事实而保持问题文字与其他图像因素不变,检验答案是否按预期翻转;其二,把正确视觉事实直接提供给模型,观察最终错误是否消失。如果视觉事实被纠正后仍答错,瓶颈就不应只归为感知。这比仅由分析模型阅读轨迹更接近因果归因。

三、把诊断剖面转成阶段化训练,而不是刷公开答案

相关研究已经表明,把视觉感知、视觉推理和文本推理分阶段训练,可能比混合训练更有效。PerceptionBench 可以为课程采样提供能力权重,但训练题应来自独立生成或私有轮换池,公开 3,000 题只做评测。每个版本还应保留未参与模型选择的盲测集,避免“能力修复”退化成“基准记忆”。

四、下一版应把榜单变成可审计实验

最终 insight

PerceptionBench 的真正研究对象不是“视觉能力有十分之几”,而是测量仪器如何从失败中长出来。它把任务选择、错误归因和题目重写连成了一个闭环;下一步的关键不是再加更多题,而是分别校准这三段的选择偏差、标签因果性和评分可复现性。

术语速查

最早错误归因沿模型推理轨迹寻找第一处可识别错误,并以它决定主类别,避免后续连锁错误覆盖根因。
困难样本挖掘用强模型筛掉稳定做对的题,保留更能区分系统的失败尾部;它提高诊断密度,也改变了总体难度分布。
pass@4 / pass4四次运行中至少一次做对/四次全部做对。两者之差代表同一道题在多次采样间的间歇成功比例。
加权 Jaccard比较两个基准错误类型分布的重叠度;低值表示错误构成不同,但不自动等价于能力空间覆盖充分。
LLM 裁判让另一个模型根据参考答案判断自由文本回答是否正确。它降低人工成本,但需要审核格式偏差、随机性和模型偏置。
评测污染公开题目或答案进入后续训练、调参或模型选择流程,导致分数不再代表对未见问题的泛化。

证据边界与资料索引

原始 X 内容、官方博客、论文、公开数据与评测代码可以相互核对;模型成绩、内部题池和训练未接触声明仍属于发布方报告,并非独立复现。发布时点很新,尚未发现实质性的外部复跑、公开争议或完整作者回复串,因此本文对榜单只做方法与统计审计,不把名次当成已被第三方确认的事实。

统计复算均基于论文表格与公开 3,000 行数据;Wilson 区间和 Fisher 相关区间仅用来判断数量级,不替代配对实验、自然总体抽样或独立复现。许可证讨论是材料口径审计,不构成法律意见。