M6-091M6: Multimodal & Generative ModelsGenerative Evaluation (FID / CLIP-Score)Hard
Mastery:
Generative Evaluation (FID / CLIP-Score): 解释生成评估的统计显著性问题。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 生成评估的指标有方差(样本、种子、prompt);需报告置信区间、多种子、配对比较,避免'单点结论'。
📌 Key Takeaways
- •指标有方差:样本量、随机种子、prompt 选择都影响结果
- •需报告置信区间(bootstrap)与多种子结果
- •配对比较(同 prompt 比两个模型)降低方差
📐 Mathematical Derivations
数学机理:<strong>方差的来源</strong>——(1) <strong>样本量</strong>——FID/CLIP-score 都是在<strong>有限样本</strong>上估计的;样本少则估计方差大(且 FID 有偏,见 FID 题)。(2) <strong>随机种子</strong>——扩散采样有随机性(起始噪声);不同种子给出不同结果(见采样随机性题)。(3) <strong>prompt 选择</strong>——评估用的 prompt 集合不同 → 结果不同('prompt 敏感')。(4) <strong>CFG s / 步数 / 采样器</strong>——超参差异导致结果不同。(5) <strong>预处理</strong>——分辨率/插值/归一化差异(Clean-FID 正是为解决这一点)。<strong>后果</strong>——(a) <strong>'模型 A 比 B 好 2 分'可能是噪声</strong>;(b) <strong>'最好的单次结果'会高估</strong>(选择偏差);(c) <strong>不可复现</strong>(换种子/换 prompt 结果变)。<strong>应对</strong>——(1) <strong>报告置信区间</strong>——(a) <strong>bootstrap</strong>——对样本重采样多次(如 1000 次),每次算指标,取 2.5%/97.5% 分位数作为 95% CI;(b) <strong>FID 的 CI</strong>——有专门的方法(因为 FID 是有偏估计);(c) <strong>CLIP-score 的 CI</strong>——可直接用样本均值的标准误。(2) <strong>多种子</strong>——对同一配置用多个随机种子(如 5~10 个)运行,报告<strong>均值 ± 标准差</strong>;避免'运气好'的结论。(3) <strong>多 prompt</strong>——用固定的、有代表性的 prompt 集合(并报告);或对多个 prompt 集合取平均。(4) <strong>配对比较</strong>——若要比较两个模型,<strong>让它们面对同一批 prompt + 同一批种子</strong>,比较'逐 prompt 的胜负'(配对设计<strong>消除 prompt 难度带来的方差</strong>,统计效力更高);(5) <strong>显著性检验</strong>——(a) <strong>bootstrap 的 CI 是否重叠</strong>(粗略);(b) <strong>配对 t 检验 / Wilcoxon</strong>;(c) <strong>Bradley-Terry 的置信区间</strong>(成对比较);(6) <strong>固定评估协议</strong>——(a) 固定的 prompt 集、(b) 固定的采样器/步数/s、(c) 固定的样本量、(d) 固定的预处理(Clean-FID);并在论文中<strong>完整报告</strong>(否则不可比)。<strong>实践建议</strong>——(a) <strong>永远报告样本量、种子数、prompt 集、超参</strong>;(b) <strong>报告 CI 或标准差</strong>;(c) <strong>关键结论用配对比较 + 显著性检验</strong>;(d) <strong>不要报告'最好结果'</strong>(报告均值);(e) <strong>用统一的评估工具</strong>(如 torch-fidelity、Clean-FID)避免实现差异。<strong>注意</strong>——(a) <strong>'统计显著 ≠ 实际有意义'</strong>——0.5 分的提升可能显著但无价值;(b) <strong>'人类评估的显著性'</strong>——成对比较需足够样本(用 BT 模型估 CI)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'生成评估的方差更大'</strong>——因为涉及样本、种子、prompt、超参多源随机性;故需更严格的统计纪律。② <strong>'bootstrap 是估计 CI 的通用工具</strong>——它不需要分布假设,适用于 FID/CLIP-score 等任意指标;面试中能提到是深度理解的标志。③ <strong>'配对比较降低方差'</strong>——同 prompt 比较消除'prompt 难度'的方差,统计效力更高(与 M5 的评估显著性问题同源)。④ <strong>'不要报告最好结果'</strong>——选择偏差会高估;应报告均值 ± 标准差。⑤ <strong>'统一评估协议'是可比性的前提</strong>——样本量/预处理/超参的差异使结果不可比(Clean-FID 的出现正是为此)。⑥ <strong>面试要点</strong>——被问'生成评估怎么保证可信',应给出'<strong>多源方差(样本/种子/prompt/超参)+ CI(bootstrap)+ 多种子 + 配对比较 + 固定协议</strong>'与'<strong>不要报告最好结果</strong>';能指出'配对比较降低方差'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用单次/单种子的结果下结论
- ✕报告最好的 prompt 集合的结果(选择偏差)
🎯 Interviewer Follow-ups
- ?为什么生成评估的方差更大?
- ?如何用 bootstrap 估计 FID 的置信区间?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.