M5-105M5: NLP & Large Language ModelsHallucination & AI SafetyEasy
Mastery:
Hallucination & AI Safety: 列举缓解幻觉的主要手段。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 检索增强(RAG)、工具调用、约束(要求引用/允许不知道)、解码策略、训练(RLHF/偏好数据)、以及后验校验。
📌 Key Takeaways
- •检索增强:提供证据(治忠实性 + 部分事实性)
- •工具调用:把计算/查询交给外部(消除算术/事实错误)
- •约束与训练:要求引用、允许'不知道'、偏好数据含'承认不知道'
📐 Mathematical Derivations
数学机理:<strong>六类缓解手段</strong>。<strong>(1) 检索增强(RAG)</strong>——把相关文档放入上下文,让模型'基于证据回答';治<strong>忠实性幻觉</strong>(有据可依)与部分事实性(提供最新知识)。<strong>前提</strong>——(a) 检索质量(召回正确文档)、(b) 模型真的使用证据(需 prompt 强调)、(c) 允许'资料中没有则说不知道'。<strong>(2) 工具调用</strong>——把'精确计算'(计算器)、'事实查询'(搜索/数据库)、'结构化操作'交给外部工具;从根本上消除'算术错误'与'记忆错误'(因为不再依赖参数中的知识)。这是<strong>最可靠</strong>的手段(对外部可验证的部分)。<strong>(3) 约束与 prompt 设计</strong>——(a) <strong>要求引用</strong>('每句话都要引用来源')——使幻觉可核查;(b) <strong>允许'不知道'</strong>('若资料中没有,请回答不知道')——<strong>这是最有效也最被忽视的手段</strong>;因为模型'编造'常源于'被要求必须回答';(c) <strong>要求给出置信度</strong>;(d) <strong>要求先列证据再结论</strong>(chain-of-thought with evidence)。<strong>(4) 解码策略</strong>——(a) <strong>降低温度</strong>(减少随机性,但可能降低多样性);(b) <strong>对比解码</strong>(contrastive decoding:对比'专家模型'与'业余模型'的分布,放大前者偏好的 token);(c) <strong>doLa</strong>(对比不同层的分布);(d) <strong>自一致性</strong>(多次采样 + 投票,过滤偶发幻觉)。<strong>(5) 训练层面</strong>——(a) <strong>偏好数据含'承认不知道'的正例</strong>(教模型'诚实');(b) <strong>RLHF/DPO 中惩罚幻觉</strong>(用忠实度作为奖励维度);(c) <strong>专门的幻觉数据集微调</strong>(如教模型'什么时候该说不知道');(d) <strong>校准训练</strong>(让置信度反映正确率)。<strong>(6) 事后校验(verification)</strong>——(a) <strong>事实核查</strong>(用检索/工具验证回答中的事实);(b) <strong>一致性检查</strong>(多次生成是否一致);(c) <strong>引用检查</strong>(引用是否真实存在且支持该陈述);(d) <strong>自我批评</strong>(让模型检查自己的回答——但效果有限,见自反思题);(e) <strong>外部验证器</strong>(专门的 NLI 模型判断'证据是否蕴含回答')。<strong>组合使用</strong>——实践中常'RAG + 工具 + 允许不知道 + 引用 + 事后校验'组合;单一手段难以覆盖所有幻觉类型。<strong>评估</strong>——用忠实度指标(RAGAS 的 faithfulness)、事实性基准(TruthfulQA、FActScore)、以及'拒答的合理性'(是否在不知道时拒答)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'允许说不知道'是性价比最高的手段</strong>——它的成本是'修改 prompt'(几乎为零),但能显著减少'无依据的编造';前提是<strong>评估要包含'不知道'的测试</strong>(否则模型学会'乱答'反而分数高)。② <strong>'工具调用最可靠'</strong>——对可验证的部分(算术、查询、结构化操作),工具从根本上消除错误;故'能调工具就调工具'。③ <strong>'RAG 治忠实性、工具治精确性、训练治倾向性'</strong>——三类手段针对不同幻觉来源;故需<strong>组合</strong>。④ <strong>'引用'的双面性</strong>——要求引用能 (a) 让幻觉可核查、(b) 提升用户信任;但若模型<strong>编造引用</strong>则更危险(看起来可信);故需<strong>引用校验</strong>(检查引用是否存在且支持)。⑤ <strong>'事后校验'的成本</strong>——用检索/工具验证每个事实很贵;故常用'抽样校验'或'关键事实校验'。⑥ <strong>面试要点</strong>——被问'怎么减少幻觉',应给出'<strong>六类手段(RAG/工具/约束/解码/训练/校验)+ 组合使用</strong>',并强调'<strong>允许说不知道是性价比最高的</strong>'与'<strong>工具最可靠</strong>';能指出'引用需校验(防编造)'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕prompt 隐含'必须回答'(鼓励编造)
- ✕要求引用但不校验引用真实性
🎯 Interviewer Follow-ups
- ?为什么'允许说不知道'很重要?
- ?事后校验(verification)怎么做?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.