返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: colbert-late-interaction

ColBERT 迟交互多向量重排

ColBERT Late Interaction
🎯核心定义
ColBERT(Contextualized Late Interaction over BERT)是一种巧妙融合了 Bi-Encoder 高检索速度与 Cross-Encoder 高表现精度的“迟交互 (Late Interaction)”多向量检索/重排序架构;它对 Query 和 Document 中的每一个 Token 分别生成独立的上下文多向量表征 (Multi-Vector),保留细粒度 Token 级特征;在检索交互阶段,它无需将两者拼接送入深度 Transformer,而是直接通过轻量级的 MaxSim 算子 S(Q,D)=iQmaxjD(E(qi)E(dj))S(Q, D) = \sum_{i \in |Q|} \max_{j \in |D|} (E(q_i) \cdot E(d_j)) 计算每个 Query Token 与最匹配 Document Token 的最大余弦相似度并求和。
💡使用场景
毫秒级极速精准重排序、多向量端到端检索(如 RAGatouille、Plaイド 引擎)以及视觉多模态多切片检索(ColPali)。
解决的核心痛点
传统 Cross-Encoder 计算复杂度 O(NL2)O(N \cdot L^2) 延迟达数百毫秒,无法用于大规模实时重排;Bi-Encoder 压缩为单向量丢失了词汇级精准匹配;ColBERT 将重排序计算降维为矩阵点积 MaxSim,耗时仅需数毫秒且精度与 Cross-Encoder 极其接近。
🎯5 个高频面试考点 (Exam Points)
1
推导 ColBERT MaxSim 算子公式,并详细剖析其为何既能捕捉软关键词匹配又能捕捉深度上下文语义?
2
ColBERTv2 如何通过残差压缩 (Residual Compression) 与聚类量化将多向量索引的存储占用缩小 6x~10x?
3
对比 ColBERT (迟交互)、Bi-Encoder (独立双塔) 与 Cross-Encoder (全交互) 在延时、显存占用与 NDCG 上的三维权衡?
4
PLAID 引擎如何通过三阶段剪枝算法(质心剪枝、词袋剪枝、精确 MaxSim)实现万级候选的毫秒级检索?
5
ColPali 如何将 ColBERT 迟交互架构扩展至 Vision LLM (PaliGemma) 实现基于 PDF 页面截图的原生图像多向量检索?
📖 关联深度指南:📄 naive-and-advanced-rag
更新于 2026-08-14
🎯
检验攻克程度:针对「ColBERT 迟交互多向量重排」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Cohere Rerank 工业重排下一个知识点RankGPT 大模型列表重排

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算