TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
长上下文评测 Needle/Lost-in-Middle
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
needle-lost-middle
长上下文评测 Needle/Lost-in-Middle
Long-Context Eval Needle/Lost-in-Middle
🎯
核心定义
两种长上下文能力评测方法。(1) Needle-in-a-Haystack(大海捞针):在长篇无关文本(干草堆)中随机位置插入一句"针"(需记忆的事实),提问并统计精确召回率
Acc
=
命中的针
测试数
\text{Acc} = \tfrac{\text{命中的针}}{\text{测试数}}
Acc
=
测试数
命中的针
,按针的位置与上下文长度画出召回热力图;(2) Lost-in-the-Middle(Liu et al., 2023):信息位置实验发现模型对开头和结尾内容的利用远好于中间——长文档中间区出现"凹陷",形成 U 形记忆曲线,需用多文档检索任务(KV retrieval)度量。
💡
使用场景
模型发布前的长上下文声明验证(128K/1M 上下文真实能力);RAG 系统评估"证据在文档不同位置时能否召回";上下文窗口设计(把关键信息放首尾、检索结果排序);面试常问"为什么模型中间信息容易丢"。
⚡
解决的核心痛点
广告式上下文长度不等同于有效利用长度;Needle 测试能暴露"能塞进去但读不到"的假长上下文,Lost-in-the-Middle 揭示注意力在长程上的位置偏差,指导训练(位置插值、随机文档顺序)与推理(关键信息前置、分段标记)两侧的缓解。
🎯
5 个高频面试考点 (Exam Points)
1
Needle-in-a-Haystack 实验怎么设计?结果热力图横轴纵轴分别是什么,理想模型是什么形状?
2
Lost-in-the-Middle 的 U 形凹陷是什么?为什么中间信息最容易被忽略?
3
缓解 Lost-in-the-Middle 的训练侧方法有哪些(位置编码、文档顺序、注意力偏置)?
4
推理侧如何组织长上下文:检索结果排序、关键信息放哪里、分段标记的作用?
5
Needle 测试满分是否代表长上下文能力完全可用?它的盲区是什么?
📖 关联深度指南:
📄 llm-foundations-and-sota →
更新于 2026-08-12
🎯
检验攻克程度:针对「长上下文评测 Needle/Lost-in-Middle」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
幻觉缓解
下一个知识点 →
Agent 与工具调用
🔗 更多 大语言模型 知识点卡片
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA
评测基准 MMLU/GSM8K