返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: contextual-compression

上下文压缩与提取式重排

Contextual Compression
🎯核心定义
上下文压缩与提取式重排 (Contextual Compression & Extractive Summarization) 是一种在后检索 (Post-Retrieval) 阶段对已召回的候选切块进行二次信息蒸馏的技术;它利用轻量抽取模型(如 LLMLingua / LongLLMLingua)或小参数大模型,结合用户查询意图对命中段落进行逐字逐句的注意力敏感度评分,动态剔除段落中与 Query 无关的冗余填充词、修饰语及背景废话,仅提取出包含核心事实依据的精简文本片段并重新组装注入生成大模型。
💡使用场景
上下文窗口紧张、Token 调用费用敏感、或面对超长切块(2048+ tokens)需要提纯核心事实依据的 RAG 场景。
解决的核心痛点
传统切块必须整块灌入 Prompt,其中 70%+ 的字符通常是无关上下文噪音,极易诱发 LLM 的“迷失在中间 (Lost in the Middle)”注意力衰减效应并导致 API 费用暴增;上下文压缩在减少 50%~80% Token 消耗的同时,大幅降低幻觉率并提升回答准确性。
🎯5 个高频面试考点 (Exam Points)
1
详细剖析 LLMLingua 基于小模型困惑度 (Perplexity / Conditional Perplexity) 衡量 Token 关键信息量的压缩算法机制?
2
LongLLMLingua 如何通过对长文档切块进行 Query-aware 动态预算分配(Dynamic Budget Allocation)解决“迷失在中间”问题?
3
句子级抽取式压缩 (Sentence-level Extractor) vs Token 级硬截断压缩 (Token-level Pruning) 在语义连贯性上的对比?
4
压缩后文本可能出现语法破碎或代词断裂,现代 LLM 对不完整语法的鲁棒性容忍度与准确率评估?
5
在端到端 RAG 延迟链条中,引入 LLMLingua 压缩所需的推理耗时 vs 减少下游生成 LLM TTFT/TPOT 的净收益权衡?
📖 关联深度指南:📄 naive-and-advanced-rag
更新于 2026-08-14
🎯
检验攻克程度:针对「上下文压缩与提取式重排」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点RankGPT 大模型列表重排下一个知识点Self-RAG 自省式反思检索

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算