合同治理中的“准确率”不能只看模型是否把文字读出来。对扫描合同而言,模型可能正确识别了正文,却漏掉签章、页码或自动续约条款;也可能字段抽取无误,却把已到期合同误判为执行中。评估必须围绕实际治理任务拆开进行,而不是用一个笼统分数替代全部质量判断。

合同治理至少应区分四类结果:合同类型分类、合同状态识别、关键条款抽取,以及扫描件完整性检查。每类任务都应建立人工核对后的标准答案,并明确“判对”的口径。例如,付款周期需要核对数值与条件是否完整;自动续约不能只识别出关键词,还要确认续约期限、通知要求等相关表述没有被遗漏。
对字段抽取,可同时观察准确率、精确率和召回率:模型给出的字段有多少正确,实际应识别的信息有多少被找出。对于违约责任、自动续约等高风险条款,漏检通常比误报更危险;对于合同编号、日期等结构较稳定字段,则更应关注抽取值是否与原件一致。
测试集不能只选清晰、格式统一的合同。应按合同类型、扫描质量、是否缺页、印章是否完整、版式复杂程度分层抽样,分别记录模型表现。这样才能发现模型是在采购合同上稳定,还是仅在清晰的销售合同上表现较好;是在正文识别准确,还是遇到模糊页面、骑缝章或缺失章节便失效。
合同状态识别还要重点核验时间条件与上下文。执行中、已到期、续签待办并非单纯的文本分类结果,模型若忽略终止条款、续签约定或补充协议,状态判断即使表面合理,也可能影响后续提醒和风险处置。
评估结果应进入“分类标注—脱敏—权限设定—质量校验”的完整链路。涉及银行卡号、身份证号、统一社会信用代码等敏感信息时,应单独统计漏识别情况;一旦敏感字段未被发现,后续共享与检索就可能突破权限边界。对于低置信度、缺页、模糊或印章不完整的合同,不宜直接进入自动化处理,而应转入人工复核。
最终可用性取决于错误是否可控、可追溯。模型输出应保留对应页码、原文片段和复核状态,使法务或业务人员能够回到合同原件确认。多模态模型提升的是处理速度,合同治理的准确性则来自清晰的字段标准、分层评估样本与明确的人机责任边界。
参与讨论
暂无评论,快来发表你的观点吧!