M6-095M6: Multimodal & Generative ModelsVideo, 3D & Audio Generative ModelsMedium
Mastery:

Video, 3D & Audio Generative Models: 解释语音识别与 TTS 的基本流程。

📐 Mathematical Definition
ASR: audio→mel→enc→text;TTS: text→acoustic→vocoder→wave\text{ASR}:\ \text{audio}\to\text{mel}\to\text{enc}\to\text{text};\qquad \text{TTS}:\ \text{text}\to\text{acoustic}\to\text{vocoder}\to\text{wave}
⚡ Executive Summary
Core Concept: ASR:音频 → 特征(mel)→ 编码器 → 解码文本(CTC/注意力/RNN-T);TTS:文本 → 声学模型 → 声码器 → 波形。

📌 Key Takeaways

  • •
    ASR:音频 → mel 频谱 → 编码器 → 解码文本(CTC/注意力/RNN-T)
  • •
    TTS:文本 → 声学特征(mel)→ 声码器 → 波形
  • •
    现代趋势:端到端(Whisper 式 ASR;VITS 式 TTS)与零样本语音克隆

📐 Mathematical Derivations

数学机理:<strong>ASR(自动语音识别)流程</strong>——(1) <strong>特征提取</strong>——音频(16kHz 波形)→ <strong>mel 频谱图</strong>(如 80 维、每 10ms 一帧);(2) <strong>编码器</strong>——用 Transformer/Conformer 编码为高层表示;(3) <strong>解码</strong>——输出文本;主流方法:(a) <strong>CTC(Connectionist Temporal Classification)</strong>——解决'音频帧数与文本长度不匹配'的问题:引入 <strong>blank 符号</strong>,把'每帧输出'映射为'对齐的文本'(允许重复与 blank),用'所有可能对齐路径的概率之和'作为损失(前向后向算法计算);<strong>优点</strong>——无需对齐标注、可并行;<strong>缺点</strong>——<strong>条件独立假设</strong>(各帧输出独立),无法建模语言依赖(故常配语言模型)。(b) <strong>注意力解码(seq2seq)</strong>——编码器-解码器 + 交叉注意力,直接生成文本(无独立假设);<strong>缺点</strong>——需更多数据、可能'不单调对齐'(注意力跳跃)。(c) <strong>RNN-T(Transducer)</strong>——结合 CTC 与注意力的优点(单调对齐 + 语言建模);流式友好。(d) <strong>混合/联合</strong>(CTC + 注意力联合训练)。(4) <strong>现代端到端</strong>——<strong>Whisper</strong>(编码器-解码器 + 大规模弱监督数据)——直接输出文本,支持多语言/翻译/时间戳。<strong>TTS(文本到语音)流程</strong>——(1) <strong>文本前端</strong>——文本归一化(数字/缩写展开)、<strong>音素转换</strong>(G2P)、韵律预测(停顿/重音);(2) <strong>声学模型</strong>——文本 → <strong>声学特征</strong>(通常是 mel 频谱);(a) <strong>自回归</strong>(Tacotron 系)——逐步生成 mel;(b) <strong>非自回归</strong>(FastSpeech 系)——并行生成(快但需时长预测);(c) <strong>扩散/流匹配</strong>(如 Grad-TTS、Matcha-TTS)——生成更自然的 mel;(3) <strong>声码器(vocoder)</strong>——mel 频谱 → <strong>波形</strong>;(a) <strong>传统</strong>(Griffin-Lim,质量差);(b) <strong>神经声码器</strong>(WaveNet、HiFi-GAN、BigVGAN)——质量高;(c) 现代端到端(VITS)把声学模型与声码器合并(一次生成波形)。(4) <strong>现代趋势</strong>——(a) <strong>零样本语音克隆</strong>(如 VALL-E、CosyVoice、F5-TTS)——用几秒参考音频克隆音色(用'音频 token 化 + 语言模型'或'流匹配 + 说话人嵌入');(b) <strong>LLM 式 TTS</strong>(把音频 token 化后用自回归建模);(c) <strong>多语言/情感/风格控制</strong>。<strong>与'统一多模态'的关系</strong>——ASR/TTS 的'音频 token 化'是'全模态模型'的基础(见统一多模态 token 化题)。<strong>评估</strong>——ASR:(a) <strong>WER(词错误率)</strong>、(b) <strong>CER(字错误率)</strong>;TTS:(a) <strong>MOS(主观平均意见分)</strong>、(b) <strong>自然度/相似度(speaker similarity)</strong>、(c) <strong>WER(可懂度,用 ASR 回测)</strong>、(d) <strong>RTF(实时因子,速度)</strong>。<strong>实践建议</strong>——(a) <strong>ASR</strong> → Whisper 系(端到端、多语言);(b) <strong>TTS</strong> → 非自回归 + 神经声码器(快且好),或零样本克隆模型(音色可控);(c) <strong>流式场景</strong> → RNN-T 或流式注意力。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'CTC 的 blank 与对齐'是核心机制</strong>——它解决了'帧数与文本长度不匹配';面试中能解释 blank 的作用是深度理解的标志。② <strong>'CTC 的条件独立假设'是它的局限</strong>——故需配语言模型或改用注意力/RNN-T。③ <strong>'声码器决定音质'</strong>——早期 TTS 的瓶颈在声码器(Griffin-Lim 质量差);神经声码器(HiFi-GAN)解决了它。④ <strong>'零样本语音克隆是当前热点'</strong>——用几秒音频克隆音色(VALL-E/CosyVoice);这带来'声音伪造'的安全风险(需水印/检测)。⑤ <strong>'音频 token 化连接 TTS 与 LLM'</strong>——把音频编码为离散 token 后可用自回归建模(与文本同构);这是'全模态模型'的路径。⑥ <strong>面试要点</strong>——被问'ASR/TTS 的流程',应给出'<strong>ASR(mel → 编码器 → CTC/注意力/RNN-T → 文本)+ TTS(文本 → 声学模型 → 声码器 → 波形)</strong>'与'<strong>CTC 的 blank 机制 + 神经声码器 + 零样本克隆</strong>';能指出'CTC 的条件独立假设'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为 CTC 能建模语言依赖(需配语言模型)
  • ✕
    忽略声码器对音质的决定性作用
🎯 Interviewer Follow-ups
  • ?
    CTC 解决什么问题?
  • ?
    声码器的作用是什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-094: Video, 3D & Audio Generative Models: 解释 NeRF 与 3D Gaussian Splatting 的差异。📋Back to BankNext →M6-096: Video, 3D & Audio Generative Models: 解释统一多模态 token 化的挑战。