🎯Core Definition
Llama Guard 3 (Meta's open-source safety moderation model fine-tuned on Llama-3.1-8B/1B) is a specialized discriminator for real-time conversational compliance auditing; it performs bidirectional two-stage evaluation across both User Input Prompts and Model Outputs against a standardized Harm Taxonomy (spanning S1 Violence, S2 Sexual, S3 Weapons, S4 Self-harm, S5 Hate Speech, S6 Prompt Injection, S7 Cyberattacks across 13+ risk categories), producing deterministic outputs: `safe` or `unsafe \n S1,S6`.