📌核心概述
Semantic + Acoustic 双 token(语音 LLM / Vall-E 风格):量化层按信息分工——语义 token(semantic)对应内容信息(音素/字词,HuBERT 内容特征或早期码本,帧率较低约 50 Hz,可与文本对齐);声学 token(acoustic)对应音色、说话人、情感与韵律,由后几级 RVQ 码本(如 codebook 5-8)的残差提供高频细节。语音 LLM 常“先语义后声学”两级建模:自回归预测 semantic token、非自回归(或条件)预测 acoustic token,兼顾内容正确性与音质。