评估大模型能力时,绝大多数人首先会去看基准测试排行榜。一个模型在各类榜单上拿到高分,给人的第一印象就是“视觉能力强”。但当你真的把它接入一个简单的识别任务——比如从一堆零件中挑出特定形状、判断一张照片里是否有遮挡物体,或者核对文档中某个图标是否存在——却可能发现它频频出错。这种“高分低能”的现象并非个例,而是当前多模态大模型的一个结构性特征。理解背后的原因,比单纯看分数更重要。

基准测试“考”的是什么,又漏掉了什么
现有的主流视觉基准测试,比如常见的VQA、COCO Captioning等,其题目设计有一个共同特点:问题与图像内容高度相关,且通常为正面的、直接的提问。例如,“图片里有一只猫吗?”如果确实有猫,模型回答“是”,就能得分。这种设计当然能反映模型的基本理解能力,但存在一个关键盲区——它很少测试模型在“被误导”、“信息不完整”或“需要拒绝回答”时的表现。
现实世界的任务却恰恰相反。用户不会每次都问一个标准而明确的问题。实际输入可能包含错误的隐含假设、来自不同角度的局部图像,或者需要模型判断“信息不足,无法回答”。近期的研究已经揭示,当测试问题从正面变为负面或误导性时,许多排行榜上的高分模型准确率会断崖式下跌。例如,模型能识别出图片中是一只猫,但当被问及“这只猫的红色部分是什么”时,它却可能顺着误导性提问给出了错误答案。这说明模型在基准中的高正确率,并不等价于它真正理解了视觉内容,很多时候只是它擅长回答“标准答案式”的提问。
推理越深,视觉反而越“模糊”
另一个容易被忽视的机制是,大模型在开展复杂推理时,其视觉注意力反而可能下降。当模型接收图像后,视觉信息会被压缩成一系列视觉token,但在后续的推理过程中,模型会投入更多注意力到语言逻辑和问题本身,而对视觉证据的“关注度”在不知不觉中减弱。有研究通过注意力分析发现,模型在生成最终答案时,对视觉token的注意力权重远低于对文本提示的注意力——它看到了,但在推理时“选择性失明”了。
这会导致一个反直觉的结果:面对一个需要精细视觉感知的简单任务,尝试用更复杂的推理链去解决,反而可能因丢弃了视觉细节而犯错。模型在回答“这张图中两个物体哪个更大”时,如果先进行长篇大论的逻辑分析,反而比直接回答更容易出错,因为推理过程干扰了它对原始视觉尺寸的感知。

上线前,用“小样本测试”找出真实短板
既然基准测试无法完全反映真实表现,产品经理在采购或集成模型前,就应该设计一套针对性更强的验证方法。与其依赖卖方提供的榜单,不如自己动手做一次小样本测试。
第一步,构建“负面测试集”。从你的真实业务场景中,收集一批常见的“坏样本”。比如,给模型看一张没有问题的图片,却问一个“有误导性”的问题;或者提供一张信息不全的模糊图片,观察模型是否知道回答“不确定”。不要只测试它答对的情况,更要测试它该如何拒绝。
第二步,关注“细粒度感知”任务。挑选那些人类一眼就能看出,但需要精准定位的任务,例如“图中左上角第三个物品是什么颜色”、“这张表格里有没有斜体字”、“两个相似的图标有哪些细微差异”。这些任务不需要复杂的知识,纯粹考验视觉编码的精度,却是模型最容易出错的地方。
第三步,做“注意力干扰”测试。在图片中增加与主任务无关的视觉干扰物,比如背景中多了一张海报,或者文字旁边有一个显眼的装饰。观察模型是否会被这些无关信息“带偏”。如果模型把海报上的文字当成了主要内容的答案,就说明它的视觉注意力管理存在明显问题。
最后,不要只看“准确率”,更要看“错误模式”。如果模型在简单任务上出错,要分析它是因为没看到,还是因为看到了但推理错了。前者可能是视觉编码的问题,后者可能是训练数据偏差或注意力分配问题。这两种错误,对应的修复方向完全不同。
排行榜上的分数是模型能力的上限,但日常使用体验取决于它的下限。真正的评估,不是看模型在标准试卷上能考多少分,而是看它在你最棘手、最不完美的真实输入面前,能不能保持稳定和可靠。