M6-064M6: Multimodal & Generative ModelsLatent Diffusion & DiT ArchitectureHard
Mastery:

Latent Diffusion & DiT Architecture: 解释分辨率外推与训练分辨率的关系。

📐 Mathematical Definition
train at 512⇒poor at 1024;fix: multi-res training, position interpolation\text{train at }512\Rightarrow\text{poor at }1024;\qquad \text{fix}:\ \text{multi-res training},\ \text{position interpolation}
⚡ Executive Summary
Core Concept: 在固定分辨率训练的模型对'训练分辨率之外的尺寸'表现差(构图崩坏);需多分辨率训练或专门的插值/调整。

📌 Key Takeaways

  • •
    固定分辨率训练 → 其他尺寸的构图崩坏(重复物体、比例失真)
  • •
    成因:位置编码/卷积核的感受野与'空间频率'不匹配
  • •
    对策:多分辨率训练、位置插值、分辨率微调

📐 Mathematical Derivations

数学机理:<strong>分辨率外推问题</strong>——在固定分辨率(如 512²)训练的扩散模型,直接生成<strong>训练分辨率之外</strong>的尺寸(如 1024² 或 256²)时表现显著变差:(a) <strong>构图崩坏</strong>——出现<strong>重复的物体</strong>(如同一只狗被画成两只)、比例失真、结构混乱;(b) <strong>细节异常</strong>——纹理拉伸/压缩、物体过小/过大。<strong>成因</strong>——(1) <strong>位置编码/感受野的'空间频率'不匹配</strong>——模型在训练时学到的'特征尺度'与分辨率绑定(如'物体占多少 patch');分辨率变化后,同样的'空间频率'对应不同的物理尺寸(512² 下的'大物体'在 1024² 下变成'中等物体'),模型无法适应;(2) <strong>卷积核/注意力的感受野</strong>——U-Net 的卷积核在'像素数'上定义;分辨率变化后'有效感受野'(占图像的比例)变化;(3) <strong>数据分布</strong>——训练时只见 512²,故 1024² 的'图像统计'是分布外;(4) <strong>位置编码</strong>(若用绝对位置)——超出训练范围(见 M4 的长度外推题,与文本的'长度外推'同源)。<strong>对策</strong>——(1) <strong>多分辨率训练</strong>——训练时<strong>随机采样多种分辨率</strong>(如 256/384/512/768),使模型学会'尺度无关'的表示;这是最有效的方法(SDXL 用多尺度训练)。(2) <strong>分辨率微调</strong>——在目标分辨率上做少量微调(如 SD 的'高分辨率微调'阶段);这是'先低分辨率预训练、再高分辨率微调'的流水线。(3) <strong>位置编码插值</strong>——若用位置编码,按目标分辨率<strong>插值</strong>(类似 RoPE 的位置插值);(4) <strong>渐进式上采样</strong>——先生成低分辨率再超分(而非直接高分辨率生成);(5) <strong>专门的高分辨率架构</strong>(如 SDXL 的双文本编码器 + 多尺度训练)。<strong>与'长上下文外推'的同源性</strong>——扩散的分辨率外推与 LLM 的长度外推<strong>同源</strong>(都是'训练范围之外的分布外');故对策也类似(多尺度训练、位置插值、微调)。<strong>实践建议</strong>——(a) <strong>训练时用多种分辨率</strong>(避免固定单一分辨率);(b) <strong>推理分辨率尽量落在训练范围内</strong>;(c) 若必须超出,做<strong>少量微调</strong>或<strong>渐进上采样</strong>;(d) 报告'模型支持的分辨率范围'(而非宣称任意分辨率)。<strong>度量</strong>——(a) <strong>不同分辨率下的 FID/CLIP-score</strong>;(b) <strong>构图正确性</strong>(人工或专门的'物体重复检测');(c) <strong>与训练分辨率的距离</strong>。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'分辨率外推与长度外推同源'</strong>——都是'训练范围外的分布外';面试中能指出这一同源性是深度理解的标志。② <strong>'多分辨率训练是最有效的对策'</strong>——它使模型学到'尺度无关'的表示;代价是训练成本(不同分辨率的计算量不同)。③ <strong>'重复物体'是典型症状</strong>——它源于'模型在局部'以为该画一个新物体''(因为感受野的'尺度'变了);这是判断'分辨率外推失败'的直观指标。④ <strong>'渐进上采样'的实用价值</strong>——生成 512 再超分到 2048,比直接生成 2048 更稳且更便宜;这是'级联生成'的思路。⑤ <strong>'与 LDM 潜空间的交互'</strong>——潜空间的分辨率 = 像素分辨率/8;故'高分辨率'在潜空间也是'更大的序列'(计算 ∝ 平方);这使'高分辨率生成'的成本更高。⑥ <strong>面试要点</strong>——被问'模型支持任意分辨率吗',应给出'<strong>固定分辨率训练 → 外推差(重复物体、构图崩坏)+ 成因(空间频率/感受野不匹配)+ 对策(多分辨率训练/微调/插值/渐进上采样)</strong>'与'<strong>与长度外推同源</strong>';能指出'重复物体是典型症状'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用固定分辨率训练的模型直接生成任意尺寸
  • ✕
    宣称'支持任意分辨率'而不做多分辨率训练
🎯 Interviewer Follow-ups
  • ?
    为什么会出现'重复物体'?
  • ?
    多分辨率训练怎么做?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-063: Latent Diffusion & DiT Architecture: 解释 CFG 在 DiT 中的实现与成本。📋Back to BankNext →M6-065: Latent Diffusion & DiT Architecture: 解释 DiT 的 patchify 与潜空间序列长度。