返回 多模态 思维导图
中文·English
👁️ 多模态ID: tts

语音合成 TTS

TTS
🎯核心定义
TTS(语音合成)从文本生成语音。管线演进:拼接/参数合成(HMM、声码器如 Griffin-Lim 相位恢复)→ 两阶段神经 TTS(Tacotron 2 声学模型 + WaveGlow/HiFi-GAN 声码器)→ 端到端(VITS、Vall-E、CosyVoice)。端到端代表 VITS 的核心机制:
📌核心概述
变分推理(VAE 框架): 文本经编码器与随机时长预测器得对齐 AA 与潜在语音表示 zz——zz 由 normalizing flow 对文本隐状态做可逆变换得到:z=fθ(h,A)z = f_\theta(h, A)。训练目标是声学似然的变分下界:
📌核心概述
L=logpθ(xz)KL(qϕ(zx)pθ(zh,A))\mathcal{L} = \log p_\theta(x | z) - \mathrm{KL}(q_\phi(z | x) \Vert p_\theta(z | h, A))
📌核心概述
其中 pθ(xz)p_\theta(x|z) 由 HiFi-GAN 解码器直接生成波形;KL 项让 flow 先验 pθ(zh,A)p_\theta(z|h,A)(可逆变换、对数似然精确可算)贴近后验 qϕ(zx)q_\phi(z|x),flow 的灵活性使 KL 不退化、先验能建模复杂分布。
📌核心概述
对齐: 训练用单调对齐搜索(MAS)在隐空间隐式学习文本-语音对齐,无需外部强制对齐器。
📌核心概述
对抗训练: 多周期判别器(multi-period discriminator)对生成波形做 GAN 判别,显著提升自然度与高频细节。
📌核心概述
后续方向:Vall-E 用音频 codec token 做零样本语音克隆,GPT-4o 用原生音频 token 端到端“说话”。
💡使用场景
语音助手、有声书/配音、短视频配音、实时对话语音;面试常问 VITS 的变分下界与 flow 的作用。
解决的核心痛点
两阶段管线中间梅尔谱表示丢失细节、误差逐级累积、还需独立声码器;VITS 单阶段端到端 + flow 先验 + GAN 判别,直接从文本回归波形,自然度接近真人、推理更快,并摆脱外部对齐器与声码器。
🎯5 个高频面试考点 (Exam Points)
1
TTS 管线演进:拼接 → 两阶段 → 端到端,各自瓶颈是什么?
2
VITS 为什么用变分推理?写出训练目标 ELBO 并解释每一项?
3
normalizing flow 在 VITS 中扮演什么角色?为什么不用普通高斯先验?
4
单调对齐搜索(MAS)解决什么问题?为什么不需要外部对齐器?
5
VITS 与两阶段 TTS 的对比?GAN 判别器贡献了什么?
📖 关联深度指南:📄 audio-and-speech-models
更新于 2026-08-12
🎯
检验攻克程度:针对「语音合成 TTS」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点语音识别 ASR下一个知识点语音大模型

🔗 更多 多模态 知识点卡片

音频表示Classifier-Free Guidance (CFG)CLIP 应用CLIP 双塔架构