M6-096M6: Multimodal & Generative ModelsVideo, 3D & Audio Generative ModelsHard
Mastery:

Video, 3D & Audio Generative Models: 解释统一多模态 token 化的挑战。

📐 Mathematical Definition
unified: all modalities→{tokens};challenges: quantization loss, imbalance, length\text{unified}:\ \text{all modalities}\to\{\text{tokens}\};\qquad \text{challenges}:\ \text{quantization loss},\ \text{imbalance},\ \text{length}
⚡ Executive Summary
Core Concept: 把文本/图像/音频/视频统一为同一套 token(离散或连续);挑战是'离散化损失'、'模态失衡'与'序列长度爆炸'。

📌 Key Takeaways

  • •
    离散 token(VQ):可统一自回归建模,但有量化损失
  • •
    连续嵌入:保留信息但难以用 softmax 建模(需扩散/流)
  • •
    挑战:模态失衡(文本 token 少、图像 token 多)、序列长度爆炸

📐 Mathematical Derivations

数学机理:<strong>统一 token 化的三条路线</strong>。(1) <strong>离散 token(VQ 系)</strong>——把所有模态量化到<strong>共享或各自</strong>的码本(如文本用 BPE、图像/音频用 VQ-VAE、FSQ);<strong>优点</strong>——(a) <strong>统一的自回归框架</strong>(同一个 Transformer 用'下一个 token 预测'处理所有模态);(b) 可复用 LLM 的技术(KV cache、采样、RLHF);(c) 天然支持'任意模态混合'与'生成'。<strong>挑战</strong>——(a) <strong>量化损失</strong>(连续→离散有信息损失,尤其图像/音频的高频细节);(b) <strong>码本坍缩</strong>(部分码字未使用);(c) <strong>模态失衡</strong>(见下)。(2) <strong>连续嵌入</strong>——各模态用连续表示(文本 embedding、图像 patch 特征、音频 mel);<strong>优点</strong>——保留信息(无量化损失);<strong>缺点</strong>——难以用 softmax 建模(需扩散/流等连续生成模型);故'理解'容易(VLM)但'统一生成'难。(3) <strong>混合</strong>——理解用连续(VLM)、生成用离散(自回归)或扩散(连续潜空间);<strong>实践</strong>——多模态 LLM 用连续(理解),图像生成用扩散(连续潜空间);统一生成(如 Chameleon、Emu3)用离散。<strong>三大挑战</strong>——(1) <strong>离散化损失</strong>——VQ 的码本有限,故 (a) 图像细节损失(重建质量下降);(b) 音频的'音质'损失;(c) 需更大码本/多级量化(RQ-VAE)缓解。(2) <strong>模态失衡(modality imbalance)</strong>——不同模态的'token 密度'差异极大:(a) 一段 10 秒音频可能 750 token(75 token/秒);(b) 一张 512² 图像约 1024 token(若用 32×32 的 VQ 网格);(c) 一段 5 秒视频可能数千 token;(d) 而一句话只有 20 token。<strong>后果</strong>——(i) <strong>训练损失被'高密度模态'主导</strong>(因为损失按 token 平均);(ii) <strong>模态间的'学习速度'失衡</strong>(模型可能'偏科');(iii) <strong>采样时的模态控制难</strong>(生成图像时会'占用'大量 token)。<strong>缓解</strong>——(a) <strong>模态平衡的采样</strong>(按模态加权);(b) <strong>损失加权</strong>(对低密度模态加权);(c) <strong>降低高密度模态的 token 数</strong>(压缩)。(3) <strong>序列长度爆炸</strong>——统一序列包含所有模态的 token;故 (a) <strong>上下文很快耗尽</strong>(一张图 + 一段音频就占数千 token);(b) <strong>注意力成本 ∝ 长度平方</strong>;(c) <strong>训练效率低</strong>。<strong>缓解</strong>——(a) <strong>压缩</strong>(降低各模态的 token 数);(b) <strong>分块/流式</strong>(按模态分块处理);(c) <strong>稀疏/高效注意力</strong>。<strong>其他挑战</strong>——(a) <strong>模态间的'语义对齐'</strong>(不同模态的 token 需在语义上可比);(b) <strong>生成质量</strong>(离散 token 的图像生成质量目前不如扩散);(c) <strong>训练稳定性</strong>(多模态混合训练的损失尖峰)。<strong>代表</strong>——(a) <strong>Chameleon</strong>(Meta,VQ token 统一文本与图像);(b) <strong>Emu3</strong>(全 token 化);(c) <strong>GPT-4o</strong>(原生多模态,架构未公开);(d) <strong>Gemini</strong>(原生多模态)。<strong>评估</strong>——(a) <strong>各模态的生成质量</strong>(文本困惑度、图像 FID、音频 MOS);(b) <strong>跨模态任务</strong>(如图文问答、语音对话);(c) <strong>统一性</strong>(能否处理任意模态组合)。<strong>实践建议</strong>——(a) <strong>理解任务</strong> → 连续(VLM);(b) <strong>统一生成</strong> → 离散(VQ/FSQ)+ 模态平衡;(c) <strong>图像生成质量优先</strong> → 扩散(连续潜空间);(d) 混合架构(理解用连续、生成用扩散)是当前的实用路线。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'离散化损失 vs 统一性'是核心权衡</strong>——离散可统一自回归但损失信息;连续保信息但难统一生成;面试中能指出这一权衡是深度理解的标志。② <strong>'模态失衡'是统一训练的核心难题</strong>——因为损失按 token 平均,高密度模态(图像/音频/视频)会主导训练;需采样/损失加权。③ <strong>'序列长度爆炸'是工程约束</strong>——统一序列很快耗尽上下文;故需压缩与分块。④ <strong>'离散图像生成质量仍不如扩散'</strong>——这是当前统一模型的短板(故有混合架构)。⑤ <strong>'与 VLM 的分工'</strong>——VLM(连续)擅长理解;统一生成(离散)擅长'任意模态生成';两者定位不同。⑥ <strong>面试要点</strong>——被问'统一多模态 token 化的挑战',应给出'<strong>三条路线(离散/连续/混合)+ 三大挑战(离散化损失/模态失衡/序列长度)+ 缓解手段</strong>'与'<strong>理解用连续、生成用离散或扩散</strong>';能指出'模态失衡源于损失按 token 平均'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    忽略模态失衡(高密度模态主导训练)
  • ✕
    以为离散 token 的图像生成质量已媲美扩散
🎯 Interviewer Follow-ups
  • ?
    为什么'模态失衡'是问题?
  • ?
    如何解决'序列长度爆炸'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-095: Video, 3D & Audio Generative Models: 解释语音识别与 TTS 的基本流程。📋Back to BankNext →M6-097: Video, 3D & Audio Generative Models: 解释全模态模型的评估难点。