返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: llama-guard-moderation

Llama Guard 3 安全审查模型

Llama Guard 3 Safety Moderation
🎯核心定义
Llama Guard 3(Meta 官方推出的开源大模型安全审核卫士模型,基于 Llama-3.1-8B/1B 微调)是一个专门用于评估对话安全合规性的轻量级审判模型;它支持对用户输入 (Input Prompt) 与模型输出 (Model Output) 进行双向双阶段实时审查;模型严格遵循标准化的危害分类体系 (Harm Taxonomy,涵盖 S1 暴恐暴力、S2 性相关、S3 违禁物品、S4 自残自杀、S5 仇恨言论、S6 提示注入越狱、S7 代码漏洞利用等 13+ 类风险标签),输入文本后以确定性格式输出 `safe` 或 `unsafe \n S1,S6`。
💡使用场景
企业级大模型网关的前置输入审核防火墙与后置生成内容合规拦截、多租户 SaaS 平台的敏感内容合规风控。
解决的核心痛点
依赖通用大模型自身做安全拒答容易被花样繁多的越狱提示绕过,且通用模型自我反思延迟巨大;Llama Guard 3 作为专属小模型以极低延迟拦截有害输入,同时允许开发者自定义增删敏感分类与定制政策。
🎯5 个高频面试考点 (Exam Points)
1
详细梳理 Llama Guard 3 的 Harm Taxonomy 核心分类体系(S1 至 S13 类安全危害标准)?
2
如何通过修改系统提示词中的危害策略定义 (Safety Policy Customization),使 Llama Guard 支持企业自定义私有违规分类?
3
输入审核 (Input Moderation) 与输出审核 (Output Moderation) 的 Prompt 结构与角色标记差异?
4
在流式响应 (Streaming Output) 场景下,如何结合滑动窗口对实时 Token 流进行分块安全审核以避免延迟阻断?
5
Llama Guard 3 1B 轻量化边缘版 vs 8B 版在分类准确率 (F1-score) 与端到端推理延迟上的实测基准?
更新于 2026-08-14
🎯
检验攻克程度:针对「Llama Guard 3 安全审查模型」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点提示词注入攻击与隔离防御下一个知识点NeMo Guardrails 可编程护栏

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算