什么是视觉模型概念漂移

一条产线跑了大半年的视觉检测模型,某天误报突然变多。算法没动,代码没改,模型文件还是那一个。这种时候大家常说的“模型老化”,背后往往藏着一个更准确的说法:概念漂移。

简单讲,概念漂移指的不是图像变了,而是“什么算对”这件事变了。模型学到的其实是一组从画面特征到判定结论的映射关系,而这套关系的另一端——业务标准——是活的。现场对可接受缺陷的范围做了调整,新增了某种外观形态,或者复核团队换了人,同一张图在人眼里的结论可能就和训练时不一样了。模型输出没退步,统计上的误报却上去了。

有意思的是,它和另一类变化很容易混淆。相机支架松动、窗外直射光进来、镜头脏了、来了一批新材质的物料——这些改变的是模型看到的输入,属于数据层面的偏移;而标注口径、判定边界、升级人工确认的门槛发生变化,改变的是标签本身的含义。两者都会让误报率抬头,但责任落点完全不同:前者该找现场和设备,后者该回去修订标注规范和复核机制。

怎么察觉它已经发生了

判断的抓手不在总体准确率,而在一致性。把上线时的标注样本、误报上升前的近期复核样本、争议样本这三组放在一起,让熟悉业务标准的人在看不到模型预测的情况下重新盲判。如果同一批图在不同复核人员之间频繁给出不同结论,那说明规则本身已经不能让人得到相近答案了——这时候急着重训,等于把业务歧义固化成模型噪声。

弱光、反光、遮挡、目标不完整的画面尤其值得留意,人本身在这些边界上就判不稳,分歧会被放大。

值得聊的一个问题

概念漂移的麻烦在于它通常是渐进的。等总体指标明显变差,偏差可能已经积累很久了。所以只盯一个误报率往往不够——它会被业务量、抽检比例、类别占比这些东西一起搅动。同时看关键类别的误报、漏报、复核覆盖和样本特征变化,才更容易在早期发现不对劲。

那么问题来了:一套需要人工复核作为参照的系统,究竟该把标准锁死到什么程度?锁太紧,现场的合理调整没法体现;放太松,模型就永远在追一个移动的靶子。这条线画在哪里,恐怕没有通用答案,得看业务能承担多少代价。

参与讨论

0 条评论

延伸阅读