🎯核心定义
语音-音频 LLM 让大语言模型直接“听”音频(音频进、甚至音频出),核心问题是音频如何融合进 LLM,主流两种方式:
📌核心概述
1. 编码器 + 投影(encoder-projector, Qwen-Audio 路线): 音频过大规模编码器(Whisper 式 mel 谱编码器,约 150M 参数)得连续特征,再经 Q-Former 或卷积降采样压成少量 token(如每 2 秒音频约 1 个 token),与文本 token 拼接进 LLM。Qwen-Audio 用任务 tag(transcribe/audioqa 等)区分输入模态与任务;Qwen2-Audio 在此基础上用多任务架构 + 位置编码对齐音频与文本 token。优点:直接复用现成 LLM、训练轻;缺点:连续特征与文本离散 token 存在表征鸿沟。
📌核心概述
2. 原生离散 token 统一(native any-to-any, GPT-4o 路线): 音频同样经 codec(RVQ)变成离散 token,与文本 token 在同一个 Transformer 主干内交替建模——统一 embedding + 全注意力/交叉注意力,支持 token 级流式输入输出,端到端延迟大幅下降;Chameleon 对图像做同样处理。缺点:音频 token 密度高(每秒 25-50 个 vs 文本 2-5 个),需降采样/压缩,且离散化损失部分声学细节。
📌核心概述
训练配方(两路线通用):阶段 1 冻结 LLM、只对齐音频编码器 → 阶段 2 全量微调 → 阶段 3 语音指令/对话数据 SFT(必要时偏好对齐),防止灾难性遗忘并保住文本能力。
💡使用场景
实时语音助手(GPT-4o voice、Gemini Live)、音频理解/音频问答、音乐理解、语音翻译、语音克隆;面试常问 Qwen-Audio 与 GPT-4o 的融合差异。
⚡解决的核心痛点
传统 STT→LLM→TTS 串接管线误差逐级传播、端到端延迟高、无法感知音色/情感/音乐等声学细节;原生音频 token 让 LLM 与音频共享同一符号空间,实现听-想-说闭环与低延迟流式交互。