模型自觉不足导致的敏感信息泄露风险

很多人谈智能体泄露敏感信息时,第一反应是“模型还不够聪明”。但我越来越觉得,真正危险的地方恰恰是我们误以为模型会自觉:知道什么不能说、哪些文件不能看、什么时候应该拒绝调用工具。

模型没有稳定、可审计的责任意识。它可能把知识库里的内部材料当成普通上下文,也可能把外部网页、邮件或工单中的诱导内容误当成可执行指令。更麻烦的是,系统提示、工具链细节、内部策略一旦进入可见范围,模型并不会天然理解这些信息为什么必须保密。

别把安全寄托在“它应该知道”

我更愿意把模型当成一个能力很强、但边界需要被外部约束的组件。能不能读取某份文档,应该由检索权限决定;能不能调用高危工具,应该由白名单和网关决定;哪些内容可以进入上下文,应该由数据分级、脱敏和最小必要原则决定。

知识库尤其容易制造错觉:用户能提问,不代表用户就该看到全库。检索时要按身份过滤,日志和提示词里也要检查敏感字段,防止同一条秘密在模型回答前就已经被记录或跨端传输。

我会优先检查四件事

第一,列清楚训练、检索和在线推理分别使用了哪些数据,把客户合同、员工档案、未公开财务和密钥类材料明确划出边界。第二,确认用户是否知道自己在与 AI 交互,上传附件、对话记录和业务数据是否有清晰的授权路径。第三,固定浏览器、办公套件、移动端、内部 API 与模型服务之间的路由,明确哪些场景只能留在可控环境。第四,准备输入检测、输出拦截、操作审计和人工接管,而不是只写一条“模型不得泄露信息”。

上线前还可以做小范围灰发,模拟越权提问、诱导调用高危工具和上传敏感文档,看看拦截、告警与回滚是否真的有效。我的判断很简单:模型可以负责生成答案,但不能负责决定安全边界。把上下文收窄、权限收紧、路由写死,往往比期待它突然拥有“自觉”可靠得多。

参与讨论

0 条评论

延伸阅读