很多人会把系统提示词写得足够严格,视为给智能体装上了一把“权限锁”。但这两者并不是同一种东西:提示词主要约束模型应该怎么做,系统级权限控制则决定它实际上能做什么。前者可以表达边界,后者才能在模型判断失误时真正拦住动作。

对普通聊天模型来说,安全检查常盯着输入和输出;对能够调用工具的 Agent 来说,风险藏在连续行为里。它可能读取文件、访问网络、执行代码,再根据返回结果调整下一步。每一步单看似乎都不严重,串起来却可能形成越权链条。此时,最终回复是否合规,已经不能代表整个任务是否安全。
提示词适合说明任务目标、禁止事项和处理原则,也能帮助模型识别不可信的网页、邮件或文档内容。但它无法替代工具层面的限制。模型可以提出调用某个工具,却不应拥有让工具无条件执行的权力;模型认为某个动作有助于完成任务,也不等于这个动作已经获得授权。
更稳妥的分工是:提示词负责描述意图,独立的策略机制负责验证身份、任务范围、目标资源、参数和数据敏感度。工具默认拒绝,只开放当前任务必需的能力,并把读取、写入、执行、外发和权限变化分开授权。凭证也不应直接暴露在模型上下文中,而应由受控工具完成身份验证。
运行时还要观察行为链,而不是只看单次调用。连续失败、反复探测边界、逐步扩大访问范围,或尝试外发敏感数据,都应触发限速、降级、暂停甚至撤销临时权限。涉及批量修改、代码执行、外部通信或不可逆结果时,再由人确认,并展示动作、目标、影响和将获得的权限,而不是只弹出一个“是否允许”。
所以,提示词约束不能替代系统级权限控制。它是安全设计的一层,却不是最后一道防线。真正值得追问的是:即使 Agent 误解了指令、受到间接指令影响,或者不断试错,系统是否仍能限制它的行动范围、留下完整记录,并在失控前停下来。只有提示词、权限、监控和审计形成闭环,自主性才不会变成无边界的执行权。
参与讨论
暂无评论,快来发表你的观点吧!