提示注入的危险在于:模型可能把外部网页、邮件或文档中的指令当成应当遵循的新任务。OWASP 将它列为生成式 AI 应用的重要风险之一,并指出检索或微调并不能从根本上消除这类问题。
因此,“系统提示写得更严厉”不是完整的安全方案。模型的输出应该被看作建议,而不是直接拥有执行权的命令。
按风险拆分权限
读取公开资料、生成草稿与发送邮件的风险不同;发送邮件、删除文件和提交付款的风险又不同。服务端应按用户身份、资源范围和操作类型重新授权,而不是仅凭模型声称“用户同意”。
越不可逆的动作,越应当让用户看见对象、影响和最后一步确认。
在界面里,最好明确展示动作将要作用于什么:发送给谁、会改哪一条记录、是否会对外暴露数据。确认按钮不是多余的摩擦,而是用户拥有控制权的证据。
把不可信内容当成数据
网页、附件、检索片段与工具返回值都可能包含操纵模型的文本。将它们标识为不可信输入,限制工具权限,并记录每一次外部操作,能让系统在出错时更容易被审计和恢复。

