1详细描述计算相邻句子语义距离曲线并基于百分位数阈值 (Percentile Threshold / Standard Deviation) 确定断点的算法流程?
2为了防止单个长句子本身波动引起误切,如何采用滑动缓冲区 (Sliding Buffer of 2-3 sentences) 进行平滑距离计算?
3分析 Semantic Chunking 在文档入库处理时所产生的额外 Embedding API 调用次数与耗时成本?
4当遇到极端超长单主题段落时,如何结合 `max_chunk_size` 兜底机制避免单个切块超出 LLM 上下文限制?
5与基于规则的递归切分 (Recursive Splitter) 相比,在生产基准测试中 Semantic Chunking 带来的检索 Recall 提升幅度与性价比权衡?