返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: offline-document-ingestion-pipeline

离线文档解析与向量快照流水线

Offline Ingestion & Vector Snapshot
🎯核心定义
离线文档解析与向量快照流水线 (Offline Document Ingestion & Vector Snapshot Pipeline) 是企业级大模型 RAG 知识库系统处理海量多源非结构化文档(PDF、DOCX、PPTX、HTML、扫描件)的生产级数据工程底座;流水线包含标准 5 步批处理架构:1) 布局感知解析与 OCR (Layout-aware Parsing & OCR: 识别段落、层级标题、表格 Markdown 化、图片提取);2) 语义分块 (Chunking: 兼顾上下文完整性的滑动句窗、Parent-Child 父子分块与 Markdown 标题树感知切分);3) 批量向量化 (Batch Embedding: 基于 Ray/Spark 分布式调用 GPU 集群并发计算稠密向量);4) 向量索引构建与版本快照 (Index Building: 离线构建 HNSW/IVF 索引并生成带版本号的持久化 Snapshot);5) 蓝绿零停机热切换 (Blue-Green Hot Swap: 新版本向量库就绪后,通过网关原子化切换流量路由)。
💡使用场景
企业知识库定期全量同步、百万级研报/财报/技术文档 RAG 索引构建与版本回溯管理。
解决的核心痛点
传统单机脚本解析速度极慢(解析 10 万篇 PDF 需数天)、直接在线一边插入一边更新导致向量索引碎片化严重且检索延迟剧烈抖动;离线流水线实现了高吞吐分布式批处理与索引蓝绿零停机热切。
🎯5 个高频面试考点 (Exam Points)
1
复杂版式 PDF(跨页表格、双栏排版、嵌套图表)的结构化解析与表格 HTML/Markdown 转换最佳实践?
2
基于 Ray / Spark 的分布式 Embedding 计算流水线:如何通过动态批处理 (Dynamic Batching) 与 GPU 流水线最大化 Tensor Core 利用率?
3
Parent-Child (父子分块) 索引策略:为什么在检索时用小粒度子 Chunk 算向量相似度,而在上下文喂给 LLM 时换用大粒度父 Chunk?
4
向量索引的双版本快照 (Blue-Green Snapshot) 构建与元数据版本管理:如何实现百万级文档索引的秒级原子切换与回滚?
5
文档增量更新与失效处理:当源文档被修改或删除时,如何通过文档 Hash 指纹与元数据过滤实现增量修剪?
📖 关联深度指南:📄 llm-rag-agent-system-design
更新于 2026-08-14
🎯
检验攻克程度:针对「离线文档解析与向量快照流水线」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点风控影子模式与策略灰度下一个知识点在线多路并行检索网关

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝