1详细剖析 Sentence-Window 如何从数学上解决向量嵌入“信息稀释 (Information Dilution)”与“上下文缺失”的根本矛盾?
2如果检索命中了同一段落中相邻的 3 个句子,如何执行窗口合并 (Window Merging / Deduplication) 以防止上下文重复注入?
3窗口大小参数 `window_size` (前
k 句与后
k 句) 对 LLM 上下文窗口容量消耗与答案完整度的权衡?
4Sentence-Window 相比传统带有 overlap 的段落分块在向量索引数量(条数膨胀)与存储开销上的成本量化?
5在生产部署时,如何通过将窗口文本存储在 Redis / 关系数据库中以减轻向量数据库只负责存单句的架构负担?