M6-097M6: Multimodal & Generative ModelsVideo, 3D & Audio Generative ModelsHard
Mastery:

Video, 3D & Audio Generative Models: 解释全模态模型的评估难点。

📐 Mathematical Definition
eval: per-modality+cross-modal+robustness;challenge: no unified metric\text{eval}:\ \text{per-modality}+\text{cross-modal}+\text{robustness};\qquad \text{challenge}:\ \text{no unified metric}
⚡ Executive Summary
Core Concept: 需覆盖多模态理解与生成、跨模态任务与模态缺失;且各模态指标不可直接比较、评估成本高。

📌 Key Takeaways

  • •
    需分别评各模态(文本/图像/音频/视频)的指标,且不可直接比较
  • •
    需评跨模态任务(语音问答、图文视频推理)
  • •
    需评模态缺失/部分输入的鲁棒性;评估成本高

📐 Mathematical Derivations

数学机理:<strong>评估的三个层次</strong>。(1) <strong>单模态指标</strong>——(a) 文本:困惑度、任务准确率;(b) 图像:FID、CLIP-score;(c) 音频:WER(ASR)、MOS(TTS);(d) 视频:FVD、时间一致性。<strong>问题</strong>——这些指标<strong>量纲与含义不同</strong>,<strong>无法直接比较或平均</strong>('FID 5'与'WER 3%'谁更好?);故需<strong>分别报告</strong>(而非合并为单一分数)。(2) <strong>跨模态任务</strong>——(a) <strong>语音问答</strong>(听问题、用文本答);(b) <strong>图文视频推理</strong>(结合多种模态推理);(c) <strong>跨模态检索</strong>(文本↔图像↔音频);(d) <strong>多模态对话</strong>(混合输入的多轮交互);(e) <strong>模态转换</strong>(语音→文本→图像)。<strong>特点</strong>——跨模态任务更接近'全模态模型'的价值主张;但<strong>基准稀缺</strong>(大多数基准只覆盖 1~2 种模态)。(3) <strong>鲁棒性与模态缺失</strong>——(a) <strong>模态缺失</strong>(只给部分模态,模型是否仍能工作);(b) <strong>模态冲突</strong>(不同模态信息矛盾时的处理);(c) <strong>噪声模态</strong>(含噪音频、低质图像);(d) <strong>模态比例变化</strong>(不同模态的 token 数变化)。<strong>评估成本</strong>——(a) <strong>计算成本</strong>(多模态推理比单模态贵);(b) <strong>数据成本</strong>(多模态标注贵);(c) <strong>人工成本</strong>(多模态质量需人工评估,如视频的时序合理性)。<strong>其他难点</strong>——(a) <strong>生成与理解的权衡</strong>——统一模型可能在'理解'上强、'生成'上弱(或反之);需分别评估;(b) <strong>模态间的'能力干扰'</strong>——加入某模态可能损害另一模态的能力(需检测);(c) <strong>评估的'模态覆盖不均'</strong>——多数基准集中在文本+图像,音频/视频覆盖少;(d) <strong>污染风险</strong>(多模态数据的网络来源易含基准内容)。<strong>评估实践</strong>——(a) <strong>分层报告</strong>(单模态 / 跨模态 / 鲁棒性,各自独立);(b) <strong>不合并为单一分数</strong>(除非有明确的加权依据);(c) <strong>包含模态缺失测试</strong>;(d) <strong>人工评估</strong>(多模态质量);(e) <strong>成本报告</strong>(延迟/显存);(f) <strong>与'专用模型'对比</strong>(统一模型是否'样样不如专用'?——这是关键的'性价比'问题)。<strong>关键问题</strong>——'统一模型 vs 专用模型'的取舍:(a) <strong>统一</strong>——一个模型处理所有模态(部署简单、可跨模态迁移);(b) <strong>专用</strong>——每个模态用最好的专用模型(性能可能更好);评估应回答'统一的代价有多大'。<strong>度量</strong>——(a) 各模态指标;(b) 跨模态任务指标;(c) 模态缺失的鲁棒性;(d) 成本;(e) 与专用模型的差距。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'各模态指标不可比较'是评估的核心难题</strong>——故需<strong>分别报告</strong>而非合并;面试中能指出这一点是深度理解的标志。② <strong>'跨模态基准稀缺'是当前瓶颈</strong>——大多数基准只覆盖 1~2 种模态;故'全模态'的能力难以充分评估。③ <strong>'模态缺失鲁棒性'是关键测试</strong>——真实场景常缺模态(如只有音频);故需专门测试。④ <strong>'统一 vs 专用的性价比'是核心问题</strong>——统一模型的性能可能不如专用,但部署更简单;评估应量化这一代价。⑤ <strong>'模态干扰'需检测</strong>——加入新模态可能损害原能力(如加音频后文本能力下降);故需回归测试。⑥ <strong>面试要点</strong>——被问'全模态模型怎么评估',应给出'<strong>三层(单模态/跨模态/鲁棒性)+ 不可合并为单一分数 + 模态缺失测试 + 与专用模型对比</strong>';能指出'统一 vs 专用的性价比'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    把不同模态的指标合并为单一分数
  • ✕
    不做模态缺失与干扰测试
🎯 Interviewer Follow-ups
  • ?
    为什么'各模态指标不可直接比较'?
  • ?
    如何评'模态缺失'的鲁棒性?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-096: Video, 3D & Audio Generative Models: 解释统一多模态 token 化的挑战。📋Back to BankNext →M7-001: Sparse Retrieval (BM25 / TF-IDF): 写出 BM25 公式,并解释 k1、b 的作用。