AI生产环境的数据资产清单,不应只是“有哪些表、放在哪里”的技术目录,而应成为模型可用数据的责任边界图。清单的核心作用,是让团队能追溯模型依据了什么数据、这些数据代表什么业务事实、出现异常时由谁处置。范围应从AI实际服务的业务场景出发,优先覆盖模型训练、检索、推理和自动执行环节会接触的核心数据,而不是一开始盘点全公司资产。
每项数据资产至少应写清来源系统、业务归属和基本状态。来源系统回答数据从哪里产生,避免把测试样例当作生产事实;业务归属明确数据反映的是库存、客户、订单还是其他业务对象,也明确谁最理解其业务含义;基本状态则说明数据是否可用、是否持续更新,以及是否存在明显缺失或异常。对来自多个系统的同类数据,还要特别标识它们之间是否存在重复、映射或口径冲突。
清单中最容易被低估的是字段层信息。凡是会影响模型判断、生成内容或后续动作的字段,都应注明业务定义、计算口径和使用限制。例如,同样名为“客户等级”的字段,可能对应完全不同的划分规则;同样是日期,也可能分别表示下单、发货或其他业务时间。字段名称相同不等于含义相同,未确认口径的数据不应直接进入模型链路。
生产清单还必须记录AI对每项资产的访问范围:可读取哪些内容、是否允许写入、哪些字段与当前任务无关而应隔离。权限设计的重点是最小授权,尤其要区分“提供建议”的模型与“能够修改业务数据”的模型,二者的数据风险并不相同。
质量信息不必追求一次性写出完美评分,但应标明核心字段可能出现的空值、异常、更新延迟及其波动情况。稳定但存在缺陷的数据,往往比突然变化且无人察觉的数据更容易管理。最后,每项资产都应落实更新频率、维护方式和具体责任人;没有责任归属的数据,即使今天可用,也很难成为可靠的生产资产。
参与讨论
暂无评论,快来发表你的观点吧!