交叉编码器重排与晚期交互 ColBERT 深度相关性优化 (Cross-Encoder Re-ranking & ColBERT Late-Interaction Deep Relevance Optimization) 是 RAG 检索管线在多路召回后、将 Top 50~100 候选精准提炼为 Top 3~5 极高相关度核心证据的决胜阶段;1) 双塔 (Bi-Encoder / Dense Embedding) 召回虽然快,但 Query 与 Document 在向量化时完全独立、无法产生底层 Token 间的交叉注意力交互 (Cross-Attention),导致粗粒度匹配;2) Cross-Encoder (如 BGE-Reranker, Cohere Rerank): 将 Query 与 Document 拼接为单个序列 `[CLS] Query [SEP] Doc [SEP]` 送入深度 Transformer,所有 Token 之间进行全量 Self-Attention 深度交叉建模,输出单标量精准相关度得分,精度极高但计算重,适合对前 50 个候选做重排;3) ColBERT (晚期交互架构): 独立计算 Token 级别的多向量表征,在检索阶段通过 MaxSim 算子
S(q,d)=∑imaxj(Eq(i)⋅Ed(j)) 实现亚毫秒级低延迟的细粒度 Token 级交互。