M6-084M6: Multimodal & Generative ModelsControllable Generation & Image EditingHard
Mastery:
Controllable Generation & Image Editing: 解释定制化生成(DreamBooth / Textual Inversion / LoRA)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: DreamBooth 用少量图微调整个模型绑定新标识符;Textual Inversion 只学新 token 嵌入;LoRA 学低秩增量。
📌 Key Takeaways
- •DreamBooth:少量图微调全模型 + 绑定稀有 token(保真最好、易过拟合)
- •Textual Inversion:只学一个新 token 的嵌入(最轻、表达力弱)
- •LoRA:学低秩增量(平衡:轻量且表达力好)
📐 Mathematical Derivations
数学机理:<strong>三种定制化方法</strong>。(1) <strong>Textual Inversion(TI,Gal 等 2022)</strong>——<strong>只学习一个新 token 的嵌入</strong> v*(在文本编码器的词嵌入空间);用 3~5 张参考图训练,使'v* 能代表该概念';生成时在 prompt 中用 v* 即可。<strong>特点</strong>——(a) <strong>最轻量</strong>(只学一个向量);(b) <strong>可组合</strong>(v* 可与其他词组合);(c) <strong>表达力有限</strong>(一个向量难编码复杂概念);(d) <strong>不改变模型</strong>(可插拔)。(2) <strong>DreamBooth(Ruiz 等 2022)</strong>——<strong>微调整个扩散模型</strong>;关键是<strong>绑定一个稀有 token</strong>(如 <code>[V]</code>,先用 rare-token 搜索找到在词表中出现很少的 token):prompt 写成'a [V] dog',让 <code>[V]</code> 学会代表'这只特定的狗'。<strong>特点</strong>——(a) <strong>保真度最好</strong>(微调全模型);(b) <strong>风险:过拟合</strong>(少量图 + 全模型微调 → 容易'只会画这一张图的姿态');(c) <strong>风险:语言漂移</strong>(模型可能遗忘其他概念)。(3) <strong>LoRA(Low-Rank Adaptation)</strong>——学<strong>低秩增量</strong>(W+BA);<strong>特点</strong>——(a) <strong>平衡</strong>(参数量少但表达力好);(b) <strong>不易过拟合</strong>(低秩约束起正则作用);(c) <strong>可插拔</strong>(可加载/卸载/组合);(d) <strong>存储小</strong>(几 MB);(e) <strong>成为当前主流</strong>。<strong>关键技巧(DreamBooth 的'先验保持损失')</strong>——为缓解过拟合与语言漂移,DreamBooth 引入 <strong>prior preservation loss</strong>:在训练时<strong>同时</strong>让模型生成'类别的通用样本'(如'a dog')并保持其能力;这防止模型把'狗'这个类别的概念也'改掉'。<strong>对比</strong>——(a) <strong>参数量</strong>:TI(1 个向量)< LoRA(低秩矩阵)< DreamBooth(全模型);(b) <strong>保真度</strong>:DreamBooth ≈ LoRA > TI;(c) <strong>灵活性/可组合</strong>:TI ≈ LoRA > DreamBooth;(d) <strong>过拟合风险</strong>:DreamBooth > LoRA > TI;(e) <strong>训练成本</strong>:DreamBooth > LoRA > TI。<strong>选择依据</strong>——(a) <strong>只要一个简单概念(风格/色调)</strong> → TI;(b) <strong>需要高保真(特定人物/物体)</strong> → LoRA(首选)或 DreamBooth;(c) <strong>需要多概念组合</strong> → LoRA(可叠加);(d) <strong>资源受限</strong> → LoRA/TI。<strong>其他方法</strong>——(a) <strong>Custom Diffusion</strong>(只微调交叉注意力的 K/V);(b) <strong>Textual Inversion + LoRA 组合</strong>;(c) <strong>IP-Adapter</strong>(免训练,用参考图);(d) <strong>T2I-Adapter</strong>。<strong>评估</strong>——(a) <strong>主体保真度</strong>(与参考图的相似度);(b) <strong>提示遵循</strong>(能否按新 prompt 生成该主体);(c) <strong>多样性</strong>(不同姿态/场景);(d) <strong>语言保持</strong>(其他概念是否退化)。<strong>实践建议</strong>——(a) <strong>首选 LoRA</strong>(平衡最优);(b) <strong>数据 5~20 张</strong>(多视角、多背景);(c) <strong>用先验保持损失</strong>(防漂移);(d) <strong>控制训练步数</strong>(防过拟合)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'LoRA 成为主流'</strong>——因为它平衡了保真度、参数量、过拟合风险与可插拔性;面试中能给出三者对比是深度理解的标志。② <strong>'稀有 token 的作用'</strong>——避免与已有词汇冲突(若用常见词,模型会把该词的含义'改掉');这是 DreamBooth 的关键技巧。③ <strong>'先验保持损失'解决语言漂移</strong>——它让模型在学新概念的同时'记住'类别概念;这是 DreamBooth 的重要贡献。④ <strong>'过拟合是定制化的核心风险'</strong>——少量图 + 全模型微调易过拟合(只会复制参考图的姿态);故用 (a) 低秩(LoRA)、(b) 先验保持、(c) 早停。⑤ <strong>'可插拔性'的实用价值</strong>——LoRA/TI 可加载/卸载/组合(多概念叠加);DreamBooth 不能(每次都要换模型)。⑥ <strong>面试要点</strong>——被问'怎么定制生成',应给出'<strong>DreamBooth(全模型 + 稀有 token + 先验保持)/ TI(只学 token 嵌入)/ LoRA(低秩增量)</strong>'与'<strong>保真度/参数量/过拟合/可插拔的对比</strong>';能指出'稀有 token 与先验保持'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕DreamBooth 用常见词做标识符(会改掉该词含义)
- ✕不做先验保持(语言漂移)
🎯 Interviewer Follow-ups
- ?DreamBooth 为什么要用稀有 token?
- ?三种方法的保真度与灵活性对比?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.