返回 大语言模型 思维导图
中文·English
大语言模型ID: needle-lost-middle

长上下文评测 Needle/Lost-in-Middle

Long-Context Eval Needle/Lost-in-Middle
🎯核心定义
两种长上下文能力评测方法。(1) Needle-in-a-Haystack(大海捞针):在长篇无关文本(干草堆)中随机位置插入一句"针"(需记忆的事实),提问并统计精确召回率 Acc=命中的针测试数\text{Acc} = \tfrac{\text{命中的针}}{\text{测试数}},按针的位置与上下文长度画出召回热力图;(2) Lost-in-the-Middle(Liu et al., 2023):信息位置实验发现模型对开头和结尾内容的利用远好于中间——长文档中间区出现"凹陷",形成 U 形记忆曲线,需用多文档检索任务(KV retrieval)度量。
💡使用场景
模型发布前的长上下文声明验证(128K/1M 上下文真实能力);RAG 系统评估"证据在文档不同位置时能否召回";上下文窗口设计(把关键信息放首尾、检索结果排序);面试常问"为什么模型中间信息容易丢"。
解决的核心痛点
广告式上下文长度不等同于有效利用长度;Needle 测试能暴露"能塞进去但读不到"的假长上下文,Lost-in-the-Middle 揭示注意力在长程上的位置偏差,指导训练(位置插值、随机文档顺序)与推理(关键信息前置、分段标记)两侧的缓解。
🎯5 个高频面试考点 (Exam Points)
1
Needle-in-a-Haystack 实验怎么设计?结果热力图横轴纵轴分别是什么,理想模型是什么形状?
2
Lost-in-the-Middle 的 U 形凹陷是什么?为什么中间信息最容易被忽略?
3
缓解 Lost-in-the-Middle 的训练侧方法有哪些(位置编码、文档顺序、注意力偏置)?
4
推理侧如何组织长上下文:检索结果排序、关键信息放哪里、分段标记的作用?
5
Needle 测试满分是否代表长上下文能力完全可用?它的盲区是什么?
📖 关联深度指南:📄 llm-foundations-and-sota
更新于 2026-08-12
🎯
检验攻克程度:针对「长上下文评测 Needle/Lost-in-Middle」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点幻觉缓解下一个知识点Agent 与工具调用

🔗 更多 大语言模型 知识点卡片

对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA评测基准 MMLU/GSM8K