模型上线后最让人头疼的,不是某一次分数不够漂亮,而是它悄悄开始“变味”:漏掉该拦的问题,或者把正常内容错判成异常。做 AI 质检时,我会先把指标和业务后果绑在一起看,而不是见到一个分数下降就紧张兮兮地改模型。
召回率、精确率和 F1 是最常用的三把尺子。召回率关注“该发现的有没有漏掉”,适合漏报代价高的场景;精确率关注“报出来的到底准不准”,适合误报会增加人工负担、影响用户体验的场景;F1 则适合需要在两者之间找平衡的时候。它们没有谁天然更重要,关键是先问清楚:一次漏判和一次误判,哪个更伤业务?
我比较推荐先留一套覆盖常见场景的“金标准”样本集,用它持续观察模型的正常表现。阈值不该被理解成某个神奇数字,而应当是“模型出现异常时,我们愿意多早介入”的边界。边界太松,问题积累很久才被发现;设得太紧,又可能被正常波动反复触发告警,最后大家干脆不看了。
更稳妥的做法,是先看金标准集上的稳定区间,再结合业务优先级定规则。比如投诉风险高的误判场景,可以把监控放得更敏感;影响较小、能够人工补救的问题,则不必让每一点波动都变成紧急事件。别把所有类别混成一个总分看,商品新款涌入、特定口音识别变差这类问题,常常藏在细分场景里。
当召回、精确率或 F1 同时变差,我不会第一反应就怪模型。数据分布变化、标签标准不一致、样本覆盖不足,甚至线上评估环境不同,都可能让指标失真。尤其是新出现的错误样本,最好尽快进入复核和后续训练流程;否则今天只是一个小波动,过些日子就可能变成一堆难收拾的漏报和误报。
真正好用的阈值,不是让告警越多越显得严谨,而是能把团队注意力准确拉到最该处理的问题上。先明确业务最怕什么,再用金标准样本持续校准,这套方法比追着单一分数跑,靠谱得多。
参与讨论
暂无评论,快来发表你的观点吧!