返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: sentence-window-chunking

Sentence-Window 句窗口切分

Sentence-Window Chunking
🎯核心定义
句窗口检索 (Sentence-Window Retrieval / Small-to-Big Sentence Window) 是一种将“检索单元”与“生成上下文单元”进行解耦分离的高级分块架构;在文档切分与索引阶段,文档被切分为独立的单句(或 2-3 句极小切片)并分别生成 Embedding 向量存入向量库;但在向量库的元数据中记录该单句在其所在文档中的前后窗口(例如向前 3 句、向后 3 句的完整上下文);检索命中单句后,系统自动动态向外扩展加载完整窗口文本注入 LLM。
💡使用场景
问答粒度极度精准、事实依据高度局域化但在生成回答时需要完整段落上下文支撑的专业领域知识库。
解决的核心痛点
传统大切块(如 1024 Token)会导致 Embedding 向量被整段无关背景信息平均稀释,无法精准匹配细粒度短 Query;单句检索保证了极高的向量相似度命中精度,而动态窗口扩展则消除了单句缺乏上下文无法完整回答的弊端。
🎯5 个高频面试考点 (Exam Points)
1
详细剖析 Sentence-Window 如何从数学上解决向量嵌入“信息稀释 (Information Dilution)”与“上下文缺失”的根本矛盾?
2
如果检索命中了同一段落中相邻的 3 个句子,如何执行窗口合并 (Window Merging / Deduplication) 以防止上下文重复注入?
3
窗口大小参数 `window_size` (前 kk 句与后 kk 句) 对 LLM 上下文窗口容量消耗与答案完整度的权衡?
4
Sentence-Window 相比传统带有 overlap 的段落分块在向量索引数量(条数膨胀)与存储开销上的成本量化?
5
在生产部署时,如何通过将窗口文本存储在 Redis / 关系数据库中以减轻向量数据库只负责存单句的架构负担?
📖 关联深度指南:📄 naive-and-advanced-rag
更新于 2026-08-14
🎯
检验攻克程度:针对「Sentence-Window 句窗口切分」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点递归字符切块 (Recursive Splitter)下一个知识点Parent-Child 父子切块策略

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算