企业AI助手的数据留存该如何定级?

说实话,我第一次认真思考"企业AI助手的数据留存该定几级"这个问题,是在一次很尴尬的现场演示之后。当时我兴冲冲地给客户展示我们新接的多模态助手,让它读一张合同截图、再结合内部文档回答个问题。演示很顺利,但客户随口问了一句:"这张图里的身份证号,你们打算留多久?"我一下子愣住了。因为我压根没想过这个问题,文件上传了就上传了,谁还管它后面去哪儿。

后来我才慢慢意识到,企业AI助手最让人头疼的,根本不是模型回答得准不准,而是数据流变得"看不见"了。一次看似普通的问答,可能同时涉及员工输入的文本、上传的图片、语音转写的内容、系统检索出来的文档片段,还有模型生成的回复。如果还是按老思路"文件归文件、表格归表格"去管,权限、留存、审计很快就会出现断点。真正该做的,不是把所有内容复制到同一个存储位置,而是让不同模态的数据在进入助手、被处理、被检索、被输出时,都拥有一致的身份、分类、权限和可追溯关系。

我踩过最深的坑,是权限只管住了原始文件,却没跟上转换后的内容。某个受限目录里的会议录音,普通员工下载不了,但它的转写文本、自动摘要、被助手引用的片段,居然能在更大范围内被检索到。这太吓人了。后来我们定了一条原则:派生内容默认继承来源数据的访问限制,除非经过明确审核和重新定级。多个来源组合出的回答,也要按其中限制最严格的数据来管,不能只看最终回复看起来敏不敏感。

敏感信息识别也是个容易翻车的地方。光靠文件名和上传目录判断敏感程度,基本等于裸奔。敏感信息可能藏在合同截图里、扫描件页脚、语音对话中,甚至存在于几份单独看都不敏感、放在一起就出事的资料里。图像里的证件信息、录音里的联系方式、文档里的内部经营数据,经过识别和转写后,都变成了更容易被搜索和复制的文本。所以识别一定要同时覆盖原始内容和处理结果,而且结果不能只用来"拦截",更该用来决定后续怎么处理:要不要建索引、要不要脱敏、能不能跨项目调用、需不需要人工审批。

还有一点特别容易被忽略:接入助手不等于默认允许模型学习全部数据。模型训练、检索增强、实时推理、日志留存,这是四件不同的事,得分别授权。含有个人信息的对话和录音、受保密约束的业务材料、临时上传的附件、只为一次任务提供的图片,都不该默认进入训练或长期存储。留存周期得围绕业务目的来设计:任务完成就删的要有清理机制,需要复盘的要能追溯责任,长期知识资产要定期检查有效性和权限状态。

审计也一样,不能只记录"谁登录过系统"。真正有价值的记录,得能还原一次关键调用:谁发起的、用了哪些数据源、系统做了什么转换、召回了什么内容、最终输出给了谁,过程中有没有权限变更或人工审批。当然,审计本身也会形成新的敏感数据,所以记录关联信息和操作轨迹就好,别把敏感原文又复制一份到日志里。

我现在的习惯是,上线前拿一条完整的数据链路做演练:员工上传一张带文字的图片,助手提取内容再结合内部文档回答,然后检查图片原件、识别文本、检索片段、回答结果、访问日志,是不是每一环都能找到对应的分类、权限和留存规则。只要有一环说不清楚,就说明统一管理还没真正落地。多模态助手让企业能理解更多形式的信息,也让数据治理从"管文件"变成了"管流动中的内容"。先把数据身份、权限继承、敏感识别、用途限制和审计链路理顺,助手才能在可控范围内发光发热,而不是变成一个新的信息出口。

参与讨论

0 条评论

延伸阅读