M5-110M5: NLP & Large Language ModelsHallucination & AI SafetyHard
Mastery:
Hallucination & AI Safety: 解释幻觉检测的方法(检索一致性 / 自一致性 / 不确定性)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 三类:外部证据核查(检索/工具验证)、内部一致性(多次采样/多模型)、不确定性(语义熵/P(True))。
📌 Key Takeaways
- •外部证据:检索验证事实、NLI 判断蕴含、工具核验计算
- •内部一致性:多次采样是否一致、多模型是否一致
- •不确定性:语义熵、P(True)、隐藏状态探针
📐 Mathematical Derivations
数学机理:<strong>三类检测方法</strong>。<strong>(1) 外部证据核查(external evidence)</strong>——(a) <strong>检索验证</strong>——对回答中的事实性陈述,检索证据并判断是否支持(用 NLI 模型或 LLM 判断'证据是否蕴含陈述');(b) <strong>工具核验</strong>——对可计算/可查询的部分(算术、数据库查询)用工具验证;(c) <strong>引用检查</strong>——回答中的引用是否真实存在且支持该陈述。<strong>优点</strong>——最可靠(有客观依据);<strong>缺点</strong>——只适用'可核查的陈述'(主观内容无法验证)、成本高(每次都要检索/计算)。<strong>(2) 内部一致性(self-consistency)</strong>——(a) <strong>多次采样</strong>——对同一问题采样 N 次,若答案语义不一致(高语义熵)则可能有幻觉;(b) <strong>多模型交叉</strong>——用不同模型回答同一问题,若不一致则存疑;(c) <strong>改写不变性</strong>——用不同措辞提问,答案是否稳定。<strong>优点</strong>——无需外部资源、适用性广;<strong>缺点</strong>——<strong>无法检测'一致的错误'</strong>(若模型系统性地持有某个错误信念,多次采样都会给出同样的错误答案 → 被误判为'可信')。这是自一致性的根本局限。<strong>(3) 不确定性量化</strong>——(a) <strong>语义熵</strong>(见前题);(b) <strong>P(True)</strong>——让模型评估'我的答案正确的概率';(c) <strong>logit/序列概率</strong>(低概率 → 高风险);(d) <strong>隐藏状态探针</strong>(用内部表征训练'是否幻觉'的分类器)。<strong>优点</strong>——快速、无需外部资源;<strong>缺点</strong>——校准差(需先校准)、信号噪声大。<strong>组合与选择</strong>——(a) <strong>有外部证据的场景</strong>(RAG、数据库)→ 优先用<strong>证据核查</strong>(最可靠);(b) <strong>无外部证据的场景</strong>(开放问答)→ 用<strong>自一致性 + 不确定性</strong>(较弱);(c) <strong>关键应用</strong> → 三者组合 + 人工复核。<strong>应用</strong>——(a) <strong>拒答</strong>(高不确定则说不知道);(b) <strong>重采样</strong>(不一致则重新生成);(c) <strong>触发检索</strong>(不确定时去查);(d) <strong>人工复核</strong>(高风险转人工)。<strong>评估</strong>——(a) <strong>AUROC</strong>(检测器区分'幻觉/非幻觉'的能力);(b) <strong>覆盖率 vs 精度</strong>(拒答多少 vs 拒对的准确率)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'自一致性无法检测一致的错误'是核心局限</strong>——若模型系统性地错(如对某事实持有错误信念),多次采样都会一致地错;故自一致性只能检测'随机性幻觉'(模型不确定时的编造),不能检测'系统性错误'。② <strong>'外部证据核查最可靠但适用面窄'</strong>——它要求'陈述可核查'(事实、计算);对'观点、创意、主观评价'无能为力。故需按内容类型选择方法。③ <strong>'P(True) 需校准'</strong>——模型自评的置信度默认不可靠(过度自信);故需先校准(温度缩放)再使用。④ <strong>'隐藏状态探针'的前景</strong>——用模型内部表征训练检测器(不需生成多次,成本低);但需为每个模型单独训练、且泛化性待验证。⑤ <strong>'检测 → 行动'的闭环</strong>——检测本身无价值,关键是<strong>触发相应行动</strong>(拒答/重采样/检索/复核);故系统设计应包含'检测-行动'的完整闭环。⑥ <strong>面试要点</strong>——被问'如何检测幻觉',应给出'<strong>三类方法(外部证据核查 / 内部一致性 / 不确定性)+ 各自适用场景与局限</strong>',并强调'<strong>自一致性无法检测系统性错误</strong>'与'<strong>外部证据最可靠但适用面窄</strong>';能设计'检测-行动'闭环是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用自一致性检测系统性错误(会一致地错)
- ✕对主观内容用外部证据核查(无法核查)
🎯 Interviewer Follow-ups
- ?三类方法各适合什么场景?
- ?为什么'自一致性'不能检测'一致性的错误'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.