返回 多模态 思维导图
中文·English
👁️ 多模态ID: colpali

ColPali Late-Interaction 视觉检索

ColPali Visual Retrieval
🎯核心定义
ColPali 把 PDF 页面直接送入 VLM (PaliGemma) 输出 Patch 级向量, 查询文本经 LLM 编码为 token 级向量, 用 ColBERT 式 Late-Interaction MaxSim 打分: sim(q,d)=imaxjqi,dj\text{sim}(q, d) = \sum_i \max_j \langle q_i, d_j \rangle 其中 qiq_i 为查询第 ii 个 token 向量, djd_j 为文档第 jj 个图像 Patch 向量——每个查询 token 取与所有 Patch 的最大余弦相似度再求和。查询与文档向量先独立计算、在检索时才交互 (Late-Interaction), 文档向量可离线预计算。
💡使用场景
文档/PDF 视觉问答与检索 (如论文检索), 面试常问"为什么能免 OCR"。
解决的核心痛点
传统管线先 OCR 提取文本再检索, 丢失版式、图表与公式信息且级联误差大; ColPali 直接对页面图像做检索, 免去 OCR 与版面解析, 在文档检索基准上相对"OCR + 文本检索"管线 F1 提升 7–40% (最高 +20 个点), 且索引更快、存储更省。
🎯5 个高频面试考点 (Exam Points)
1
写出 ColPali/ColBERT 的 Late-Interaction MaxSim 打分公式并解释各项含义?
2
ColPali 与传统 "OCR + 文本检索" 管线的区别与优势 (含指标提升)?
3
为什么 ColPali 用 VLM 的 Patch 级向量而非 CLIP 的全局图像向量?
4
Late-Interaction 与双塔全局向量检索的精度/延迟权衡?
5
ColPali 的文档向量如何离线预计算? 在线检索与重排流程如何设计?
📖 关联深度指南:📄 naive-and-advanced-rag
更新于 2026-08-12
🎯
检验攻克程度:针对「ColPali Late-Interaction 视觉检索」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点多模态 RAG (跨模块)下一个知识点VLA 具身大模型 (跨模块)

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用