🎯核心定义
音频表示是从原始波形到模型可处理特征的三种层次,决定了输入维度与信息保留:
📌核心概述
1. 波形(waveform): 16kHz 单声道 16-bit PCM 即每秒 16000 个标量、码率 256 kbps;信息最全但序列过长,直接建模昂贵;
📌核心概述
2. 梅尔谱(mel-spectrogram): STFT(窗 25ms、帧移 10ms)→ 梅尔滤波器组(通常 80 个 bin)→ 对数幅值,得每秒约 100 帧 × 80 维特征;保留听感主信息、去掉相位,是 Whisper 的输入;缺点是非离散、与文本模态不对齐、合成时需声码器恢复相位;
📌核心概述
3.
离散音频 token: 神经音频编解码器(EnCodec / SoundStream / DAC)把波形经编码器 + RVQ 残差量化压成离散 token:帧率约 50-75 Hz、每帧
K 个级联码本 token,码率仅数 kbps——相对原始 256 kbps 压缩约
1/50 到 1/100(如 EnCodec 24kHz 音频 @ 6-24 kbps)。
📌核心概述
梅尔谱与 token 的取舍:谱是连续高维特征、信息密集但无法进离散符号空间;token 把音频与文本统一到同一离散空间,是语音 LLM / 端到端 TTS 的基础。
💡使用场景
ASR/TTS 特征输入(梅尔谱)、语音 LLM 与语音克隆(音频 token)、音频生成;面试常考三种表示的维度/码率数字。
⚡解决的核心痛点
波形序列过长、谱特征非离散,导致音频难以与文本模态统一建模;神经编解码器把每秒 16000 个采样压成每秒几百个 token,码率降两个数量级(256 kbps → 数 kbps),同时保留语义与说话人信息,让 LLM 与扩散模型能直接消费音频。