返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: instruction-hierarchy-system

指令分层与 System Prompt 架构

Instruction Hierarchy & System Prompt
🎯核心定义
指令分层体系 (Instruction Hierarchy) 是一种在大型语言模型内部确立不同来源指令绝对优先级的安全架构与提示词工程规范;它将输入文本明确划分为三级信任特权层:1) 系统指令层 (System Prompt / Developer Messages: 拥有最高执行特权,定义模型身份、安全红线、不可违背的格式铁律);2) 用户指令层 (User Messages: 次高特权,表达用户当下需求,但不能推翻系统层规则);3) 外部不可信数据层 (Third-party Data / Retrieved Context / Tool Outputs: 零特权纯数据,若包含指令型文本一律按纯文本处理)。
💡使用场景
企业级生产环境 System Prompt 架构设计、防止来自外部检索文档或第三方 API 的间接提示注入 (Indirect Prompt Injection)。
解决的核心痛点
早期大模型将所有输入视为平铺平行的文本流,当用户输入或检索文档包含“忽略上述所有指令”时,模型极易被恶意劫持;指令分层从模型对齐训练与工程隔离双重层面锁死了最高特权等级。
🎯5 个高频面试考点 (Exam Points)
1
详细剖析 OpenAI / Anthropic 在 RLHF 与指令微调中如何训练模型识别不同角色层级 (`system` vs `user` vs `tool`) 的对抗训练机制?
2
生产 System Prompt 的模块化架构(角色设定、业务流程、输出规范、边界约束与防御注入)标准编写范式?
3
使用明确的分隔符(如 `<context>` ... `</context>` 或 XML 标签)如何物理标记外部检索文档为不可执行的只读数据?
4
当用户指令与系统提示词发生直接冲突(如用户要求绕过敏感限制)时,模型的优先级仲裁与安全拒答策略?
5
如何防止模型在长上下文(100K+ tokens)后半段发生“系统提示词注意力衰减与遗忘 (Prompt Decay)”?
更新于 2026-08-14
🎯
检验攻克程度:针对「指令分层与 System Prompt 架构」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点CoT 思维链与分步推导下一个知识点OpenAI Strict JSON Schema 输出

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算