模型权重与检查点存储。Safetensors 把张量数据与其布局元数据分离: 一个 JSON 头部描述每个张量的名称、形状、类型与字节偏移, 其后紧跟原始张量字节, 可 mmap 零拷贝加载; 而 PyTorch 默认的 `torch.save` 是 pickle 序列化, 反序列化会执行对象 `__reduce__` 携带的任意代码, 存在远程代码执行 (RCE) 风险。检查点格式: 单文件简单但保存/恢复粒度粗, 大模型常用分片 (sharded checkpoint, 每 rank/层组一个分片 + index.json 索引) 并行读写。模型仓库 (Model Registry, 如 Hugging Face Hub 式): 模型卡片 (Model Card) 记录用途、限制、数据与训练信息, 版本不可变, 支持回滚与灰度。权重体积与加载时间估算: FP16 权重
S=2×Nparams 字节, 加载时间
T=S/B (
B 为 IO 带宽), 如 70B 模型
S≈140GB, 12GB/s 的 PCIe 需约 12 秒。