M5-106M5: NLP & Large Language ModelsHallucination & AI SafetyMedium
Mastery:
Hallucination & AI Safety: 解释不确定性量化与校准在幻觉检测中的作用。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 让模型输出置信度并使其'校准'(置信度≈正确率);用语义熵、自一致性、logit 熵检测高幻觉风险的回答。
📌 Key Takeaways
- •校准:置信度应等于实际正确率(ECE 衡量偏差)
- •LLM 常'过度自信'(校准差)→ 需校准训练/后处理
- •幻觉检测:用语义熵/自一致性/logit 熵识别高风险回答
📐 Mathematical Derivations
数学机理:<strong>校准(calibration)</strong>——一个模型是<strong>校准的</strong>,若其输出的置信度 c 对应'实际正确率 ≈ c'(即 P(correct | conf=c)≈c)。<strong>ECE(Expected Calibration Error)</strong> 度量偏差:把预测按置信度分桶,计算各桶内'平均置信度与准确率之差的加权平均'。<strong>LLM 的校准问题</strong>——LLM 通常<strong>过度自信</strong>(对错误答案也给高置信度);原因:(a) <strong>MLE 训练</strong>不优化校准(只优化似然);(b) <strong>RLHF 可能加剧</strong>(奖励'自信有帮助的回答');(c) <strong>softmax 的尖锐性</strong>(logits 尺度大 → 概率趋近 0/1)。<strong>校准方法</strong>——(a) <strong>温度缩放(temperature scaling)</strong>——在 logits 上除以温度 T(T>1 使分布更平缓),用验证集拟合 T;这是最简单有效的方法;(b) <strong>Platt scaling / isotonic regression</strong>(后处理映射);(c) <strong>校准训练</strong>(训练时加校准损失);(d) <strong>RLHF 中惩罚过度自信</strong>。<strong>幻觉检测</strong>——利用'不确定性信号'识别高风险回答:(1) <strong>logit 熵 / 序列概率</strong>——低概率(高困惑)的回答更可能有幻觉(但不可靠,因为流畅的幻觉概率也高);(2) <strong>语义熵(semantic entropy,Kuhn 等 2023)</strong>——对同一问题<strong>多次采样</strong>,把<strong>语义等价</strong>的回答聚为一类(用 NLI 判断等价),计算'语义类别分布'的熵:若多次采样给出<strong>语义不同</strong>的答案(高语义熵),说明模型'不确定'(可能幻觉);若语义一致(低熵),则更可信。<strong>关键</strong>——它用<strong>语义</strong>而非<strong>token</strong> 层面的多样性(因为措辞不同但语义相同应视为一致)。(3) <strong>自一致性(self-consistency)</strong>——多次采样的答案是否一致(不一致 = 高不确定);(4) <strong>P(True)</strong>(模型自评'我的答案对吗?'的概率);(5) <strong>隐藏状态探针</strong>(用模型的内部表征训练一个'是否幻觉'的分类器)。<strong>应用</strong>——(a) <strong>拒答/澄清</strong>——高不确定时让模型说'我不确定'或请求澄清;(b) <strong>人工复核</strong>——高风险的输出转人工;(c) <strong>重采样</strong>——高不确定时重新生成;(d) <strong>RAG 触发</strong>——不确定时检索。<strong>评估</strong>——(a) <strong>ECE / Brier score</strong>(校准质量);(b) <strong>AUROC</strong>(不确定性信号区分'对/错'的能力);(c) <strong>拒答的取舍</strong>(覆盖率 vs 精度)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'LLM 过度自信'是普遍问题</strong>——故'让模型说置信度'本身不够(置信度不可靠);必须先<strong>校准</strong>(如温度缩放)再用。② <strong>'语义熵优于 token 熵'是关键洞察</strong>——因为同一答案可有多种措辞(token 层面多样但语义一致);故应按<strong>语义</strong>聚类后计算熵。这使不确定性估计更可靠。③ <strong>'不确定 ≠ 错误'</strong>——高不确定只是'风险信号',不代表一定错;故应用是'触发额外处理(检索/复核)'而非'直接拒答'。④ <strong>'拒答的取舍'</strong>——拒答能减少错误但损害覆盖率(用户不满);故需按场景设阈值(医疗/法律宜保守,闲聊宜宽松)。⑤ <strong>与'校准 vs 判别'的区别</strong>——校准(置信度是否反映正确率)与判别(能否区分对错)是两个不同的问题;一个模型可以'校准好但判别弱'(都输出 0.7)。⑥ <strong>面试要点</strong>——被问'如何检测幻觉',应给出'<strong>校准(温度缩放/ECE)+ 不确定性信号(语义熵/自一致性/P(True))+ 应用(拒答/复核/重采样/RAG 触发)</strong>',并强调'<strong>语义熵优于 token 熵</strong>'与'<strong>LLM 默认过度自信需先校准</strong>';这是幻觉检测类问题的深度回答。
⚠️ Common Interview Pitfalls
- ✕直接相信模型自报的置信度(未校准)
- ✕用 token 级熵估计不确定性(应语义聚类)
🎯 Interviewer Follow-ups
- ?什么是语义熵(semantic entropy)?
- ?为什么'自信'不等于'正确'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.