返回 多模态 思维导图
中文·English
👁️ 多模态ID: audio-representation

音频表示

Audio Representation
🎯核心定义
音频表示是从原始波形到模型可处理特征的三种层次,决定了输入维度与信息保留:
📌核心概述
1. 波形(waveform): 16kHz 单声道 16-bit PCM 即每秒 16000 个标量、码率 256 kbps;信息最全但序列过长,直接建模昂贵;
📌核心概述
2. 梅尔谱(mel-spectrogram): STFT(窗 25ms、帧移 10ms)→ 梅尔滤波器组(通常 80 个 bin)→ 对数幅值,得每秒约 100 帧 × 80 维特征;保留听感主信息、去掉相位,是 Whisper 的输入;缺点是非离散、与文本模态不对齐、合成时需声码器恢复相位;
📌核心概述
3. 离散音频 token: 神经音频编解码器(EnCodec / SoundStream / DAC)把波形经编码器 + RVQ 残差量化压成离散 token:帧率约 50-75 Hz、每帧 KK 个级联码本 token,码率仅数 kbps——相对原始 256 kbps 压缩约 1/50 到 1/100(如 EnCodec 24kHz 音频 @ 6-24 kbps)。
📌核心概述
梅尔谱与 token 的取舍:谱是连续高维特征、信息密集但无法进离散符号空间;token 把音频与文本统一到同一离散空间,是语音 LLM / 端到端 TTS 的基础。
💡使用场景
ASR/TTS 特征输入(梅尔谱)、语音 LLM 与语音克隆(音频 token)、音频生成;面试常考三种表示的维度/码率数字。
解决的核心痛点
波形序列过长、谱特征非离散,导致音频难以与文本模态统一建模;神经编解码器把每秒 16000 个采样压成每秒几百个 token,码率降两个数量级(256 kbps → 数 kbps),同时保留语义与说话人信息,让 LLM 与扩散模型能直接消费音频。
🎯5 个高频面试考点 (Exam Points)
1
梅尔谱如何计算?80 bins、25ms 窗、10ms 帧移这些数字的意义?
2
波形 / 梅尔谱 / 离散 token 三种表示的优缺点对比?
3
神经音频编解码器如何把波形变成离散 token?典型码率与压缩比?
4
为什么语音 LLM 用离散音频 token 而不是直接回归梅尔谱?
5
RVQ 为什么能把码率压到约 1/100 而重建质量仍可接受?
📖 关联深度指南:📄 audio-and-speech-models
更新于 2026-08-12
🎯
检验攻克程度:针对「音频表示」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点视频渐进训练下一个知识点语音识别 ASR

🔗 更多 多模态 知识点卡片

Classifier-Free Guidance (CFG)CLIP 应用CLIP 双塔架构ColPali Late-Interaction 视觉检索