从失败反推能力
不是先拍脑袋列任务,而是先观察当前模型怎么失败,再归纳关系、计数、定位、OCR、幻觉等能力。
PerceptionBench 最有价值的地方,不是宣布“最强模型看图也只有 60 分”,而是把真实失败轨迹拆成可定位的视觉能力剖面。它是一张很好的困难失误地图,但还不是一把经过独立标定的“通用视觉智商尺”。
Kimi 团队从 42 个既有基准的前沿模型错误出发,定位推理轨迹中最早出现的错误,再把其中 10 类感知错误做成 3,000 道短答案题。这个方向正确地把“最后答错了”改写为“最先在哪里看错了”,因而比单一总分更能指导数据和训练。
不是先拍脑袋列任务,而是先观察当前模型怎么失败,再归纳关系、计数、定位、OCR、幻觉等能力。
两轮前沿模型筛选会剔除“全部稳定做对”的题;低于 60% 至少部分来自困难样本挖掘,不能翻译成日常看图准确率。
公开了题库、基础推理脚本和裁判提示词,但没有逐模型输出、裁判记录、完整配置和构造流水线。
把 PerceptionBench 当成能力级回归测试与错误探针很合适;把 59.7 对 58.5 当作稳定的模型名次,或把 60% 当作模型视觉的自然上限,都超出了现有证据。
传统多模态问答把看图、知识调用、数学计算、空间模拟和语言输出揉进一个最终答案。模型答错时,研究者很难知道是“没看见”“看错了”,还是“看对了但不会推”。PerceptionBench 的关键动作是把完整推理轨迹交给分析模型,执行最早错误归因:只要第一处错误是视觉事实读取错误,后面即使还出现推理错误,也优先归入感知类别;只有视觉事实都正确时,才归到推理或知识错误。
这使它回答的不是“模型能否完成某个任务”,而是“当前模型最先在哪类视觉操作上失真”。这一转向很重要:下游推理无法可靠补回一个根本没被读取、被数错或被幻觉出来的视觉事实。
它不是第一个证明多模态模型存在基础视觉缺口的基准,也不是第一个使用“atomic visual skills”概念的工作。它更具体的新增价值,是把跨基准真实失败、最早错误归因、人工原子化重写组合成一条较完整的诊断流水线。
公开数据可直接核对为 3,000 行:1,800 道由既有基准失败拆解而来,1,200 道是新编问题。前 1,800 道保留来源基准和原始索引;按来源与索引去重后,对应约 1,413 个原始条目,说明一个复杂失败经常被拆成多个子问题。每题包含问题、短参考答案、能力标签、来源信息以及 1–8 张图像。
| 能力 | 题数 | 它试图隔离的视觉操作 |
|---|---|---|
| 视觉关系 | 330 | 读取物体之间直接可见的方向、邻接、遮挡或拓扑关系。 |
| 视觉计数 | 330 | 在指定范围和约束下统计实例、部件或图形元素。 |
| 视觉属性 | 330 | 识别颜色、形状、材质、朝向和局部状态等属性。 |
| 深度与 3D | 330 | 判断深度、视角、可见面和三维结构。 |
| 视觉定位 | 330 | 在图像、棋盘、界面或坐标结构中找到目标位置。 |
| 视觉比较 | 279 | 跨对象或区域比较数量、位置、尺寸与图案。 |
| 细粒度识别 | 290 | 区分外观接近的对象、部件、符号或状态。 |
| 上下文整合 | 255 | 整合多区域、多图或局部与全局信息。 |
| OCR | 255 | 读取自然图像、图表、界面和数学图形中的文字或数字。 |
| 感知相关幻觉 | 271 | 拒绝报告不存在的对象、线路、数量、文字或关系。 |
这里的“原子”更像一个操作性定义:标注者尽量让每题只需要一种主要视觉能力,并用最早错误规则强制给出一个主标签。它不是对人类视觉系统的本体论分解,也没有证明十类能力彼此独立。
“某列有多少棋子”同时涉及定位与计数;“哪组图案含相同数量的三角形”同时涉及计数与比较;“上下文整合”本身就是组合能力。单标签记录的是首要归因,不是题目只包含一种计算。
隐藏方块的最少数量要求推断不可见结构;把夜景图旋转到文字可读方向涉及心理旋转;路线追踪、缺块匹配和多图整合也超出“看一眼即可抄写事实”。
因此,发布帖所说的“无需推理、只要看”应理解为尽量降低领域知识与长链条推理,而不是所有题都不存在空间模拟、比较、约束满足或短程推断。论文自己的错误体系也承认空间推理与深度感知之间需要人为消歧,这说明边界是标注协议,而非天然分界。
最终分类受 42 个源基准、当代模型的失败分布、未具名分析模型、四模型筛选集合、语言模型聚类、人工重写与能力平衡共同影响。更准确的说法是失败驱动的混合式分类法:证据来自底层失败,但类别仍经过模型和人工设计。
发布方在统一裁判下评测 16 个模型。GPT-5.6-Sol 为 59.7%,Kimi K3 为 58.5%,随后是 Claude-Fable-5 的 57.2%、Gemini-3.1-Pro 的 56.2%、GPT-5.5 的 55.8% 和 Seed-2.1-Pro 的 55.0%。最低为 GLM-4.6V 的 32.5%。
GPT-5.5 与 Gemini-3.1-Pro 总分只差 0.4,但前者定位高 13.1 分,后者 OCR 高 7.8 分、细粒度识别高 7.6 分。GPT-5.6-Sol 总分最高,定位达到 76.7,却在幻觉类只有 26.9;Gemini-3.5-Flash 总分 52.0,幻觉类反而最高,为 50.6。对训练与产品而言,十维能力向量比一个总分更有用。
论文对三个模型各运行四次。总分标准差很小,但同一道题的成功状态经常改变。根据论文的 pass@4 与 pass4 重排,可以把题目分成“从未做对”“间歇做对”“四次全对”三类:
| 模型 | 四次均分 | 从未做对 | 间歇做对 | 四次全对 |
|---|---|---|---|---|
| GPT-5.6-Sol | 59.7% | 27.1% | 26.0% | 46.9% |
| Gemini-3.5-Flash | 52.0% | 29.8% | 37.6% | 32.6% |
| Kimi K3 | 58.5% | 26.1% | 31.2% | 42.7% |
这支持“能力尚未稳健获取”的判断,却不能把所有波动都归因于视觉。采样温度、长思维链、输出格式、图像预处理和裁判随机性都可能造成同样现象。要定位原因,需要公开逐题多次输出并做误差分解。
构造流程会两次使用前沿模型筛选,并排除筛选集合能够稳定答对的题。被评测的 16 个模型与筛选集合不重叠,这降低了直接针对榜单模型选题的风险,但仍然明确改变了题目难度分布。因此,“没有模型超过 60%”能证明前沿模型仍有大量被精心挖出的视觉失败;它不能证明模型在普通图片上只能正确感知六成内容。
1.2 个百分点乘以 3,000 题,对应约 36 道题的差距。
至少一次做对、但没有四次全对的题目占比。
271 道幻觉题中,106 道参考答案恰好是“0”。
只在 10 个能力均值上计算的 Pearson 相关。
在把每题近似视为独立伯努利试验的简化条件下,59.7% 的 95% Wilson 参考区间约为 57.93%–61.44%,58.5% 约为 56.73%–60.25%,两者明显重叠。这个区间不是自然任务分布上的置信区间,因为题目经过分层与困难挖掘;它只说明 1.2 分的量级并不大。真正比较同一批题上的两个模型,应基于逐题配对结果做 McNemar 检验或配对自举,而这些输出尚未公开。
自动裁判在随机抽取的 300 个预测中与人工判断一致 299 次。对应的 Wilson 95% 区间约为 98.14%–99.94%。这是积极证据,但论文没有披露抽样是否跨模型与能力分层、人工标注者数量、分歧解决规则,也没有说明唯一一例分歧的方向。榜首差约 36 题,裁判误差若对模型或答案格式不均匀,仍可能影响近距离排名。
论文用公开子集与超过 17,000 题的内部池比较十类能力准确率,得到 Pearson r = 0.84。因为样本点只有十个,Fisher 变换下的 95% 参考区间约为 0.45–0.96,范围很宽;更重要的是,这张图验证的是能力级难度结构,不是逐模型排名保持。论文从中进一步推断“相对模型表现”得以保留,证据仍不充分。
公开数据中,271 道幻觉题至少有 106 道答案恰为“0”;若把“0 cats”“0 lamps”等形式也计入,以 0 开头的答案有 118 道,占 43.5%。这类题确实测视觉假阳性,但也会受模型是否愿意回答“没有”、选项偏置、校准和强制作答策略影响。论文把 GPT-5.6-Sol 的低幻觉分归因于“更积极的回答承诺”,目前只是合理假说,尚无校准实验或干预实验支持。
公开脚本可以复跑题库,但不能从零复刻论文榜单。它没有编码论文描述的各模型推理预算,也没有实现 Claude-Fable-5 遇到安全拒绝时切换到 Claude-Opus-4.8 的规则;而论文报告该回退覆盖 1.1% 的答案。裁判温度为 0.3,推理或裁判失败会落为错误答案,却没有单独报告失败率。对近距离排名而言,这些都是实质配置。
公开数据的 1,800 道来源题覆盖 42 个具名来源,其中包含 22 道 VibeEval;论文附录列出的 42 个发现基准不含 VibeEval,却包含 RealWorldQA,并明确说 RealWorldQA 只用于失败分析、不贡献公开样本。发现集合与发布样本来源集合可以不同,但当前论文与数据卡没有解释这次替换。
数据卡把整个数据集标为 CC BY-NC 4.0;论文则称新编问题和自有标注采用 Apache-2.0,来源题继续受原基准的 Apache、MIT、Creative Commons、非商业、禁止演绎或未明确许可等不同条款约束。实际再分发或商用时,单一数据集标签不足以覆盖全部样本来源。
42 个基准的错误分布平均加权 Jaccard 仅 0.20。这说明所选基准暴露的错误构成较分散,但没有做集合覆盖或消融,因而不能推出“必须聚合全部 42 个”或“十类已经覆盖视觉空间”。
没有人类准确率、耗时和歧义率。题目被人工验证为可回答,不等于人类接近满分。早期 BLINK 在 3,807 道视觉题上报告人类 95.70%、GPT-4V 51.26%,而 PerceptionBench 自己缺少同域的人类与专用视觉模型标尺。
近重复检查不能证明训练集无污染。论文仅举例说明对 LAION、Common Crawl 等库做图像描述子比对,未给出完整库版本和文本问题查重;它更无法覆盖闭源模型的私有训练数据。现在题目与答案已公开,未来模型的后训练污染风险会持续上升。
当前结果仍是发布方自评快照。公开仓库尚无实质 issue 或外部复现报告。K3 在官方模型说明中曾把它称为内部基准;公开发布后,最好由独立团队用锁定版本和同一预处理重新跑榜。
还需注意已有前作。2025 年的 Atomic Visual Skills Dataset 已在基础二维欧氏几何中系统定义不可再分的视觉技能;当前 PerceptionBench 论文参考文献未包含该工作。PerceptionBench 的优势在于覆盖更广、来源更贴近真实失败,AVSD 的优势则是定义更窄、更接近受控技能分解。两者说明“原子视觉”的价值已经形成研究脉络,创新点应放在具体归纳与构造方法,而不是词语本身。
部署侧不应只看整体准确率。更实用的报告至少同时展示十类能力分、从未做对/间歇做对/稳定做对三类占比,以及模型在缺失内容题上的假阳性率。前两项回答“会不会”,稳定性回答“靠不靠谱”,幻觉校准回答“看不见时敢不敢乱说”。
单标签无法证明题目只依赖一种能力。可以给每题增加“所需操作”多标签,并做两类干预:其一,只改变目标视觉事实而保持问题文字与其他图像因素不变,检验答案是否按预期翻转;其二,把正确视觉事实直接提供给模型,观察最终错误是否消失。如果视觉事实被纠正后仍答错,瓶颈就不应只归为感知。这比仅由分析模型阅读轨迹更接近因果归因。
相关研究已经表明,把视觉感知、视觉推理和文本推理分阶段训练,可能比混合训练更有效。PerceptionBench 可以为课程采样提供能力权重,但训练题应来自独立生成或私有轮换池,公开 3,000 题只做评测。每个版本还应保留未参与模型选择的盲测集,避免“能力修复”退化成“基准记忆”。
PerceptionBench 的真正研究对象不是“视觉能力有十分之几”,而是测量仪器如何从失败中长出来。它把任务选择、错误归因和题目重写连成了一个闭环;下一步的关键不是再加更多题,而是分别校准这三段的选择偏差、标签因果性和评分可复现性。
原始 X 内容、官方博客、论文、公开数据与评测代码可以相互核对;模型成绩、内部题池和训练未接触声明仍属于发布方报告,并非独立复现。发布时点很新,尚未发现实质性的外部复跑、公开争议或完整作者回复串,因此本文对榜单只做方法与统计审计,不把名次当成已被第三方确认的事实。
统计复算均基于论文表格与公开 3,000 行数据;Wilson 区间和 Fisher 相关区间仅用来判断数量级,不替代配对实验、自然总体抽样或独立复现。许可证讨论是材料口径审计,不构成法律意见。