返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: model-risks

模型风险治理

Model Risk Governance
🎯核心定义
模型风险治理针对生成式模型的三类输出风险: ① 越狱(Jailbreak)与提示注入(Prompt Injection)——越狱用精心构造的 prompt(角色扮演、虚构场景、多语言变体)绕过安全对齐,提示注入把恶意指令混入用户或外部内容中操纵模型执行未授权动作(OWASP LLM Top 10 连续排第一),防护在输入侧(规则/分类器/相似检索/指令分隔)与输出侧(约束格式、二次校验)双侧进行;② 输出滥用检测——对模型输出做内容审核:有害内容分类器、PII 二次扫描、代码与链接白名单、敏感操作二次确认;③ 红队测试——上线前用对抗性 prompt 集(越狱模板库、多语言与编码变体、工具调用诱导)系统性寻找漏洞,量化攻击成功率并按严重度出报告;④ 审计与可追溯——记录“谁、何时、用哪个模型版本、生成了什么输出”,保留输入输出日志与版本号,支撑事后追责与监管举证。
💡使用场景
任何对外提供 LLM 能力的生产系统,尤其是带工具调用/Agent 的高危场景;面试常问越狱与提示注入的区别、防御放在哪一层最有效、红队怎么设计、可追溯日志要留哪些字段。
解决的核心痛点
未治理的模型会“评估通过但行为失控”——安全测试全绿,却能被一句话越狱、被网页内容注入、输出看似正常实则泄漏隐私或产生违规内容;系统性治理把“碰运气”变成“可复现的防线”: 输入输出双侧检测让注入需要同时绕过两层防线,红队在上线前就发现并修补攻击面,完整审计日志让任何争议输出都能回溯到具体模型版本与调用链路,满足合规审计要求。
🎯5 个高频面试考点 (Exam Points)
1
越狱(Jailbreak)和提示注入(Prompt Injection)的区别?各有什么典型攻击方式?
2
OWASP LLM Top 10 排名第一的风险是什么?为什么它排在应用层漏洞之上?
3
输出滥用检测怎么做?有害内容分类器、PII 二次扫描、链接/代码白名单各自解决什么?
4
红队测试如何设计?覆盖哪些攻击类别,成功率如何量化与追踪修复?
5
审计与可追溯如何落地?日志需要记录哪些字段才能支撑事后追责与监管举证?
📖 关联深度指南:📄 security-and-privacy
更新于 2026-08-12
🎯
检验攻克程度:针对「模型风险治理」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点安全与隐私下一个知识点Agent 运行时(跨模块)

🔗 更多 AI 基础设施 知识点卡片

激活显存估算弹性伸缩与成本优化检查点与故障恢复集群调度 Ray/K8s