🎯核心定义
TTS(语音合成)从文本生成语音。管线演进:拼接/参数合成(HMM、声码器如 Griffin-Lim 相位恢复)→ 两阶段神经 TTS(Tacotron 2 声学模型 + WaveGlow/HiFi-GAN 声码器)→ 端到端(VITS、Vall-E、CosyVoice)。端到端代表 VITS 的核心机制:
📌核心概述
变分推理(VAE 框架): 文本经编码器与随机时长预测器得对齐
A 与潜在语音表示
z——
z 由 normalizing flow 对文本隐状态做可逆变换得到:
z=fθ(h,A)。训练目标是声学似然的
变分下界:
📌核心概述
L=logpθ(x∣z)−KL(qϕ(z∣x)∥pθ(z∣h,A)) 📌核心概述
其中
pθ(x∣z) 由 HiFi-GAN 解码器直接生成波形;KL 项让 flow 先验
pθ(z∣h,A)(可逆变换、对数似然精确可算)贴近后验
qϕ(z∣x),flow 的灵活性使 KL 不退化、先验能建模复杂分布。
📌核心概述
对齐: 训练用单调对齐搜索(MAS)在隐空间隐式学习文本-语音对齐,无需外部强制对齐器。
📌核心概述
对抗训练: 多周期判别器(multi-period discriminator)对生成波形做 GAN 判别,显著提升自然度与高频细节。
📌核心概述
后续方向:Vall-E 用音频 codec token 做零样本语音克隆,GPT-4o 用原生音频 token 端到端“说话”。
💡使用场景
语音助手、有声书/配音、短视频配音、实时对话语音;面试常问 VITS 的变分下界与 flow 的作用。
⚡解决的核心痛点
两阶段管线中间梅尔谱表示丢失细节、误差逐级累积、还需独立声码器;VITS 单阶段端到端 + flow 先验 + GAN 判别,直接从文本回归波形,自然度接近真人、推理更快,并摆脱外部对齐器与声码器。