1推导 BM25 得分公式中参数
k1(词频饱和曲线)与参数
b(文档长度惩罚)的物理含义与数学极限制约?
2为什么在短文本或者极长文档检索中,需要针对性微调
k1 和
b 的取值?
3中文分词(如 Jieba, IK-Analyzer, Pku-Segmenter)的分词质量对 BM25 倒排索引建立与检索命中率的影响?
4对比 BM25 与神经稀疏检索 (Neural Sparse Retrieval, 如 SPLADE / BGE-M3 Sparse) 在词汇扩展与泛化能力上的演进?
5在大规模并发场景下,如何基于 WAND (Weak AND) 算法实现 BM25 Top-K 检索的高速剪枝跳跃?