训练数据加载与 IO 优化。WebDataset 把海量样本按序打包成 tar 分片 (shard) 文件流式读取, 用顺序 IO 替代百万级小文件随机读; 格式选择: TFRecord(定长记录 + 索引, TensorFlow 生态)、Parquet(列式, 特征存储与数据分析)、Arrow(列式内存格式, 跨语言零拷贝)。IO 与计算重叠: 数据管线(读取 → 解码 → 增强 → 组 batch)与 GPU 前反向并行, 用预取 (prefetch) 隐藏 IO 延迟, 如 `tf.data.Dataset.prefetch(1)` 或 PyTorch DataLoader 多 worker + `prefetch_factor`; 理想重叠下总耗时
Ttotal≈max(Tio,Tcompute), 而不是两者之和。