返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: semantic-chunking

Semantic 语义断崖自适应切分

Semantic Chunking
🎯核心定义
语义切分 (Semantic Chunking) 是一种完全基于内容语义相关度而非固定字符/Token 数的自适应动态文档分块算法;算法首先将文档按句子分割,并对每个句子(或滑动句子组)计算 Embedding 向量,随后计算相邻句子向量之间的余弦距离或相似度差异曲线;通过设定绝对阈值或自适应统计分位数(如第 95 百分位距离突变点 / 局部极值断崖),在语义发生剧烈转移的断崖处设立切分点,将语义高度内聚的连续句子自然打包为一个动态切块。
💡使用场景
缺乏明显格式排版标记的长篇叙述文、会议纪要对话、口述转录文本 (Transcription) 以及主题频繁交替的长文本分块。
解决的核心痛点
传统的固定字符数切分强行在段落中硬切,极易将属于同一个逻辑主题的上下文割裂开,或将两段风马牛不相及的话强行拼进一个切块;语义切分保证了每个切块内部的主题高度内聚,极大提升向量检索的余弦相似度区分度。
🎯5 个高频面试考点 (Exam Points)
1
详细描述计算相邻句子语义距离曲线并基于百分位数阈值 (Percentile Threshold / Standard Deviation) 确定断点的算法流程?
2
为了防止单个长句子本身波动引起误切,如何采用滑动缓冲区 (Sliding Buffer of 2-3 sentences) 进行平滑距离计算?
3
分析 Semantic Chunking 在文档入库处理时所产生的额外 Embedding API 调用次数与耗时成本?
4
当遇到极端超长单主题段落时,如何结合 `max_chunk_size` 兜底机制避免单个切块超出 LLM 上下文限制?
5
与基于规则的递归切分 (Recursive Splitter) 相比,在生产基准测试中 Semantic Chunking 带来的检索 Recall 提升幅度与性价比权衡?
📖 关联深度指南:📄 naive-and-advanced-rag
更新于 2026-08-14
🎯
检验攻克程度:针对「Semantic 语义断崖自适应切分」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Parent-Child 父子切块策略下一个知识点查询重写与多跳子查询解构

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算