返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: prompt-injection-defense

提示词注入攻击与隔离防御

Prompt Injection Defense
🎯核心定义
提示词注入攻击 (Prompt Injection) 是一种通过恶意构造输入文本劫持大模型控制流或诱导其违反系统安全设定的安全攻击手段,分为直接提示注入 (Direct Injection / Jailbreak越狱: 用户直接在对话框输入诱导绕过指令) 与间接提示注入 (Indirect Injection: 攻击者将恶意指令隐藏在网页、PDF 或第三方检索文档中,当 Agent/RAG 抓取并加载该文档时悄然触发注入);防御体系包括:XML/Markdown 分隔符隔离、严格指令分层 (Instruction Hierarchy)、输入预检分类器以及双 LLM 沙箱隔离架构 (Dual-LLM Security Sandbox)。
💡使用场景
联网检索 Agent、处理外部不可信文件(简历解析、合同分析)的企业应用、以及具备外部工具调用执行权限的高危系统。
解决的核心痛点
间接提示注入能悄无声息地命令 Agent 窃取内部私有数据并通过 Webhook 发送给黑客,属于 OWASP Top 10 for LLM 首位安全威胁;多层次防御构建起深度防御纵深,杜绝恶意指令被当作特权命令执行。
🎯5 个高频面试考点 (Exam Points)
1
详细对比直接提示注入 (Direct Injection) 与间接提示注入 (Indirect Injection) 的攻击路径与危害面差异?
2
Dual-LLM 架构(Quarantine LLM 处理外部不可信数据并提取事实,Privileged LLM 仅接收纯结构化数据执行决策)的安全设计?
3
对抗性前缀攻击 (Adversarial Suffix / GCG 梯度搜索攻击: 如追加乱码字符破坏安全对齐) 的成因与输入困惑度检测防御?
4
如何使用随机 Nonce / 签名令牌 (Cryptographic Nonce Token) 封装输入边界以防攻击者伪造 XML 闭合标签?
5
在 Agent 工具调用阶段,如何通过要求用户在终端显式审批确认 (Human-in-the-Loop Approval) 阻断高危写操作?
更新于 2026-08-14
🎯
检验攻克程度:针对「提示词注入攻击与隔离防御」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Instructor 运行时重试自愈下一个知识点Llama Guard 3 安全审查模型

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算