M5-104M5: NLP & Large Language ModelsHallucination & AI SafetyEasy
Mastery:
Hallucination & AI Safety: 解释幻觉的成因与分类。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 成因:训练目标(似然而非真值)、知识缺失、上下文误导、解码随机性;分'事实性'与'忠实性'两类。
📌 Key Takeaways
- •成因:MLE 目标不优化真值、知识有截止/缺失、上下文误导、采样随机
- •分类:事实性(与客观事实不符)vs 忠实性(与给定源不符)
- •另有'编造引用'、'过度自信'等具体形态
📐 Mathematical Derivations
数学机理:<strong>成因(多层)</strong>。(1) <strong>训练目标层面</strong>——语言模型用<strong>最大似然(MLE)</strong> 训练,目标是'预测下一个 token'(拟合数据分布),<strong>不是'说真话'</strong>;故模型学的是'什么样的文本看起来像真的'(流畅、合理),而非'什么是真的'。这是幻觉的<strong>根本成因</strong>。(2) <strong>知识层面</strong>——(a) <strong>知识截止</strong>(训练数据有时间边界);(b) <strong>知识缺失</strong>(长尾知识、专业领域);(c) <strong>知识冲突</strong>(训练数据内部矛盾);(d) <strong>知识错误</strong>(训练数据本身有错)。(3) <strong>上下文层面</strong>——(a) <strong>上下文误导</strong>(prompt 中隐含错误前提,模型顺着答);(b) <strong>忽略上下文</strong>(RAG 场景中不用检索到的证据);(c) <strong>上下文冲突</strong>(多文档矛盾)。(4) <strong>解码层面</strong>——采样(温度、top-p)引入随机性;且模型<strong>校准差</strong>(对错误答案也可能很自信)。(5) <strong>对齐层面</strong>——RLHF 若奖励'看起来有帮助',会鼓励模型'编造答案而非说不知道'(<strong>谄媚/讨好</strong>)。<strong>分类</strong>——(a) <strong>事实性幻觉(factuality)</strong>——输出与<strong>客观事实</strong>不符(如编造不存在的论文);(b) <strong>忠实性幻觉(faithfulness / groundedness)</strong>——输出与<strong>给定的源</strong>(文档、上下文)不符(RAG 场景:检索到了正确内容但模型没按它说);两者需<strong>分别评估</strong>(一个模型可能事实性好但忠实性差,或反之)。<strong>具体形态</strong>——(i) <strong>编造引用</strong>(伪造论文/链接/法条);(ii) <strong>数字错误</strong>(算错、记错数据);(iii) <strong>过度自信</strong>(错也说得肯定);(iv) <strong>前后矛盾</strong>(多轮中自相矛盾);(v) <strong>时间错误</strong>(把过时信息当最新)。<strong>为什么难以根除</strong>——因为'流畅的生成'与'准确的生成'在训练目标上并不完全一致;且模型无法'知道自己不知道'(缺乏可靠的自我知识边界)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'MLE 不优化真值'是根本成因</strong>——这解释了为什么'更大的模型仍有幻觉'(规模提升流畅性与知识覆盖,但不改变目标函数)。理解这一点能避免'靠加大模型解决幻觉'的误解。② <strong>'事实性 vs 忠实性'的区分很关键</strong>——RAG 主要解决<strong>忠实性</strong>(提供证据)与部分事实性(提供最新知识);评估需分别度量(RAG 的'忠实度'指标)。③ <strong>'编造引用'是最危险的形态</strong>——因为它'看起来可核查'(有引用格式)但实际是伪造的;故需 (a) 强制引用可点击/可验证、(b) 引用检查(回答中的事实是否有真实来源支持)。④ <strong>'校准差'是幻觉的放大器</strong>——模型对错误答案也自信,使用户难以辨别;故<strong>不确定性量化</strong>(见后续题)是重要补充。⑤ <strong>与'RLHF 谄媚'的关系</strong>——若奖励模型偏好'有用的回答'(即使编造),会鼓励幻觉;故偏好数据需包含'承认不知道'的正例。⑥ <strong>面试要点</strong>——被问'幻觉为什么发生',应给出'<strong>根本成因(MLE 不优化真值)+ 知识/上下文/解码/对齐多层因素</strong>'与'<strong>事实性 vs 忠实性的区分</strong>',并指出'编造引用'与'校准差'两个具体形态;能说明'RAG 主要解决忠实性'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为加大模型规模就能解决幻觉
- ✕把事实性与忠实性混为一谈
🎯 Interviewer Follow-ups
- ?为什么 MLE 训练会导致幻觉?
- ?忠实性与事实性有何区别?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.