实测小任务比榜单更能暴露模型下限

我现在看模型榜单,心态已经很平了。分数当然有用,它至少告诉我们模型在标准题里能做到什么程度;但真要决定能不能接进产品,我更信几个看起来“很小”的任务:图标在不在、角落里的物品是什么颜色、照片里有没有遮挡、信息不全时它会不会老实说不知道。

这些题不炫,也不需要长篇推理,却特别容易把模型的下限翻出来。因为现实输入从来不是标准试卷:画面可能模糊,提问可能带着错误前提,背景里还塞着一堆干扰信息。模型如果只是顺着问题猜,很容易把“没有”答成“有”,把不确定说得斩钉截铁。那种感觉,真的比答错一道难题更让人不安。

小任务最怕“自信地错”

我会故意准备一些反着问的样本。明明图里没有目标物,却问它目标物的细节;画面只露出局部,却让它判断完整情况。这里看的不是它能不能猜中,而是它有没有停下来确认:证据够不够?问题里的前提对不对?

另一个我很在意的点,是别用复杂推理掩盖感知问题。像比较两个物体大小、核对表格里是否有斜体字,本质上靠的是看清楚,不是把答案写得多漂亮。模型一旦开始绕着语言逻辑长篇分析,反而可能离原始画面越来越远,最后给出一套听着合理、实际上看错了的解释。

所以,小样本实测时我不只记准确率,还会记错法:它是没看见,还是被问题带偏;是被背景干扰,还是明明信息不足却硬答。榜单展示的是高光时刻,小任务测到的却是日常可靠性。真正要上线的模型,不必每次都惊艳,但至少不能在最基础的地方突然掉链子。

参与讨论

0 条评论

延伸阅读