🎯核心定义
模型风险治理针对生成式模型的三类输出风险: ① 越狱(Jailbreak)与提示注入(Prompt Injection)——越狱用精心构造的 prompt(角色扮演、虚构场景、多语言变体)绕过安全对齐,提示注入把恶意指令混入用户或外部内容中操纵模型执行未授权动作(OWASP LLM Top 10 连续排第一),防护在输入侧(规则/分类器/相似检索/指令分隔)与输出侧(约束格式、二次校验)双侧进行;② 输出滥用检测——对模型输出做内容审核:有害内容分类器、PII 二次扫描、代码与链接白名单、敏感操作二次确认;③ 红队测试——上线前用对抗性 prompt 集(越狱模板库、多语言与编码变体、工具调用诱导)系统性寻找漏洞,量化攻击成功率并按严重度出报告;④ 审计与可追溯——记录“谁、何时、用哪个模型版本、生成了什么输出”,保留输入输出日志与版本号,支撑事后追责与监管举证。
💡使用场景
任何对外提供 LLM 能力的生产系统,尤其是带工具调用/Agent 的高危场景;面试常问越狱与提示注入的区别、防御放在哪一层最有效、红队怎么设计、可追溯日志要留哪些字段。
⚡解决的核心痛点
未治理的模型会“评估通过但行为失控”——安全测试全绿,却能被一句话越狱、被网页内容注入、输出看似正常实则泄漏隐私或产生违规内容;系统性治理把“碰运气”变成“可复现的防线”: 输入输出双侧检测让注入需要同时绕过两层防线,红队在上线前就发现并修补攻击面,完整审计日志让任何争议输出都能回溯到具体模型版本与调用链路,满足合规审计要求。