复杂推理并不天然提升视觉判断。对多模态模型而言,图像先被编码为视觉 token,随后与用户问题、上下文文本共同进入生成过程。当任务要求长链条分析时,模型的计算重心往往逐步转向语言逻辑:它更关注“问题暗示了什么”“此前推导出了什么”,而不是持续核对画面中的原始证据。

这种现象可理解为一种证据衰减。视觉 token 承载的是位置、形状、遮挡、颜色和细微差异等信息,但这些信息在后续多轮推演中未必会被反复调用。推理文本一旦形成了看似连贯的中间判断,模型就可能沿着语言上的合理性继续生成,即使该判断与图像细节并不一致。于是,它并非完全“没看见”,而是在回答时让语言先验压过了视觉证据。
误导性提问会放大这一问题。比如图中本没有某种颜色或物体,问题却预设其存在;模型若优先顺从提问框架,就容易围绕错误前提补全答案。复杂推理会让这种补全显得更有条理,却不会让它更接近事实。对“哪个更大”“某个图标是否存在”这类依赖局部细节的任务,冗长分析反而可能把注意力从关键区域带走。
因此,视觉任务不能只看最终答案是否流畅,还应检查模型能否拒绝错误前提、能否承认信息不足,以及在加入无关背景后是否仍能锁定目标。若简单感知题在长推理后更易出错,问题通常不在知识储备,而在视觉证据没有被稳定保留到决策阶段。
参与讨论
暂无评论,快来发表你的观点吧!