返回 多模态 思维导图
中文·English
👁️ 多模态ID: rvq-codebook

RVQ 码本

RVQ Codebooks & Tokens
🎯核心定义
RVQ(Residual Vector Quantization,残差向量量化)用 KK 个级联码本逐级量化残差,是神经音频编解码器(SoundStream / EnCodec / DAC)与语音 LLM(Vall-E、CosyVoice)的核心量化器。第 kk 级量化的是前一级量化后剩下的残差:
📌核心概述
rk=xj=1k1qj(x),qk(x)=argmineCkrke22r_k = x - \sum_{j=1}^{k-1} q_j(x), \quad q_k(x) = \operatorname{argmin}_{e \in \mathcal{C}_k} \Vert r_k - e \Vert_2^2
📌核心概述
重建为各级量化结果之和:
📌核心概述
x^=k=1Kqk(x)\hat{x} = \sum_{k=1}^{K} q_k(x)
📌核心概述
第 1 级码本捕获信号主体(能量/低频),后续级逐级捕获残差细节(高频/声学细节);典型配置 K=8K = 8(EnCodec,DAC 可达 32)、每级码本 1024 个向量。码本端到端训练:总损失 = 重建损失 + commitment loss βxq(x)2\beta \Vert x - q(x) \Vert^2(把编码器输出拉向码本)+ 可选 GAN 判别与感知损失;码本用直通梯度或 EMA 更新。
📌核心概述
Semantic + Acoustic 双 token(语音 LLM / Vall-E 风格):量化层按信息分工——语义 token(semantic)对应内容信息(音素/字词,HuBERT 内容特征或早期码本,帧率较低约 50 Hz,可与文本对齐);声学 token(acoustic)对应音色、说话人、情感与韵律,由后几级 RVQ 码本(如 codebook 5-8)的残差提供高频细节。语音 LLM 常“先语义后声学”两级建模:自回归预测 semantic token、非自回归(或条件)预测 acoustic token,兼顾内容正确性与音质。
💡使用场景
音频 token 化(语音 LLM 输入)、TTS 条件生成与语音克隆、低码率音频传输;面试常问 RVQ 公式与双 token 分工。
解决的核心痛点
单级 VQ 码本容量有限、量化误差大、重建音质差;RVQ 用残差级联把码率摊到 KK 级码本上,以约 1/100 码率(256 kbps → 数 kbps)保持可懂度与音色,并天然产出语义/声学分离的 token 结构供 LLM 分层消费。
🎯5 个高频面试考点 (Exam Points)
1
写出 RVQ 残差量化公式:第 k 级量化的是什么?重建公式是什么?
2
RVQ 与单级 VQ 的区别?为什么级联 K 级能兼顾码率与音质?
3
RVQ 码本如何训练?commitment loss 与 EMA 码本更新?
4
Semantic token 与 Acoustic token 分别编码什么?各自来自哪些层级?
5
语音 LLM 为什么先预测 semantic 再预测 acoustic?各用什么解码方式?
📖 关联深度指南:📄 audio-and-speech-models
更新于 2026-08-12
🎯
检验攻克程度:针对「RVQ 码本」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点语音大模型下一个知识点JEPA 联合嵌入预测

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用