多模态AI质检与传统视觉质检的分野,不在“能不能看清缺陷”,而在“能不能说清原因”。传统视觉质检的终点是判定:这张图合格还是不合格,缺陷属于划痕、裂纹还是脏污。多模态AI质检的起点则是对齐,把图像与工艺记录、设备状态、物料批次放在一起理解,最终输出一个可核对的原因方向。两种能力对应两套完全不同的数据准备逻辑,评估时若只比较模型效果,很容易把项目带偏。

传统视觉项目的标注相对封闭,画框、选类别、勾轮廓,标签集合在项目启动时基本定死,模型学会的是在像素层面判断“像不像某类缺陷”,产线要的也主要是拦截不良品。多模态系统则要同时理解图像和文本,标注从分类变成陈述,需要回答的是“为什么算缺陷”“严重程度是否超出该工序的放行标准”“当时的机台和工艺窗口是什么”“历史上类似形态更常指向哪类原因”。这些内容没法靠画框完成,必须由懂工艺的人写成可核对的描述和关联。标签集合也从封闭变成开放,新机台、新配方、新缺陷随时出现,原来的类别表覆盖不住。
差异同样体现在“对错”的定义上。传统项目里框偏一点、类别偶发争议,通常不影响过杀与漏检的主指标;原因分析则不然,定位对了但归因错了,会把质量改进带去错误方向,归因听起来合理却缺少工艺上下文,复核人员也无法拍板。因此,多模态质检的数据准备工作量往往大于模型切换本身,且必须把质量、工艺、设备的人拉进标注,而不是把图交给外包团队就算完成。
落地前有三件事需要先立住。异常样本库不能只是NG图片文件夹,入库时至少要能回答缺陷形态与严重程度、拍摄工位与光照条件、对应的物料和工艺窗口、是明确不良还是临界品或历史误报,没有这些字段,模型只能停留在外观层。根因关联规则要把缺陷形态、可能原因、需要核对的工艺项写成可维护的映射,缺陷容忍标准也要写进规则,规则的价值不在于显得完整,而在于可改、可追、可反对。人工复核流程则决定系统会不会越用越偏,新缺陷出现时必须有人接手定性,复核看三层:定位是否成立、原因是否落在已有规则内、案例要不要回流样本库或触发规则更新。
如果现在手里只有框好的缺陷图,距离多模态原因分析还差一层业务数据工程。先把异常样本库、根因关联规则和人工复核流程立住,再评估模型能力,质检项目才不容易停在演示很漂亮、上线却解释不清的地方。门槛不在概念新不新,而在这些准备工作有没有人认领、有没有字段、有没有闭环。
参与讨论
暂无评论,快来发表你的观点吧!