返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: data-pipeline-streaming

数据管线与流处理

Data Pipelines & Streaming
🎯核心定义
数据管线与流处理。Kafka 作消息总线(分区内有序、追加写 + 页缓存 + 零拷贝, 吞吐高; 消费语义 at-least-once / exactly-once), Flink 作有状态流引擎(事件时间窗口、水位线、状态后端与 checkpoint 保证精确一次), 产出秒级实时特征供在线推理, 并汇入特征存储 (Feature Store) 与离线特征对齐。批流一体: Lambda 架构(批 + 流两套链路, 双份维护与一致性问题) vs Kappa 架构(只建一条流链路, 批处理视作流的历史回放)。数据平台分层: ODS(原样接入) → DWD(清洗/标准化/脱敏) → DWS(宽表/聚合指标服务), 湖仓一体 (Iceberg/Hudi/Delta) 统一批流存储。水位线 W=maxseen(tevent)εW = \max_{\text{seen}}(t_{\text{event}}) - \varepsilon 控制乱序/迟到数据处理, 其中 ε\varepsilon 为最大允许乱序时延。
💡使用场景
推荐/风控/广告等在线 ML 系统需要秒级特征; 数据平台分层与数仓建模是系统设计常考; 面试常问 Kafka 吞吐原理与消息语义、Flink 如何 exactly-once、Lambda vs Kappa 取舍、ODS/DWD/DWS 各层职责。
解决的核心痛点
对比离线日级批处理: 端到端延迟从天级降到秒级(实时链路端到端约 1s 内), 让在线模型吃到最新用户行为; Kappa 以流回放统一批流, 消除 Lambda 双链路的口径不一致与双倍维护成本; 分层使指标口径统一、血缘清晰、合规可控(DWD 层统一脱敏, DWS 层统一指标)。
🎯5 个高频面试考点 (Exam Points)
1
Kafka 为什么吞吐高? 分区、顺序写与零拷贝的机制; at-least-once 与 exactly-once 怎么实现?
2
Flink 如何保证精确一次? checkpoint/barrier 与两阶段提交的原理是什么?
3
Lambda 与 Kappa 架构的取舍? 为什么 Kappa 越来越流行?
4
ODS/DWD/DWS 各层职责与数据流转? 脱敏与指标口径统一在哪一层完成?
5
实时特征与离线特征如何统一, 保证训练-服务特征一致?
📖 关联深度指南:📄 high-concurrency-ai-system
更新于 2026-08-12
🎯
检验攻克程度:针对「数据管线与流处理」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点训练数据加载与 IO下一个知识点GPU 硬件与 HBM

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复