把确认权交还给人

模型可以读取不可信文本、调用外部工具并提出操作建议。越接近真实行动,越需要把授权边界说清楚。

AI 操作等待人工确认的抽象图

提示注入的危险在于:模型可能把外部网页、邮件或文档中的指令当成应当遵循的新任务。OWASP 将它列为生成式 AI 应用的重要风险之一,并指出检索或微调并不能从根本上消除这类问题。

因此,“系统提示写得更严厉”不是完整的安全方案。模型的输出应该被看作建议,而不是直接拥有执行权的命令。

按风险拆分权限

读取公开资料、生成草稿与发送邮件的风险不同;发送邮件、删除文件和提交付款的风险又不同。服务端应按用户身份、资源范围和操作类型重新授权,而不是仅凭模型声称“用户同意”。

越不可逆的动作,越应当让用户看见对象、影响和最后一步确认。

在界面里,最好明确展示动作将要作用于什么:发送给谁、会改哪一条记录、是否会对外暴露数据。确认按钮不是多余的摩擦,而是用户拥有控制权的证据。

把不可信内容当成数据

网页、附件、检索片段与工具返回值都可能包含操纵模型的文本。将它们标识为不可信输入,限制工具权限,并记录每一次外部操作,能让系统在出错时更容易被审计和恢复。

延伸资料