返回 多模态 思维导图
中文·English
👁️ 多模态ID: speech-audio-llm

语音大模型

Speech-Audio LLM
🎯核心定义
语音-音频 LLM 让大语言模型直接“听”音频(音频进、甚至音频出),核心问题是音频如何融合进 LLM,主流两种方式:
📌核心概述
1. 编码器 + 投影(encoder-projector, Qwen-Audio 路线): 音频过大规模编码器(Whisper 式 mel 谱编码器,约 150M 参数)得连续特征,再经 Q-Former 或卷积降采样压成少量 token(如每 2 秒音频约 1 个 token),与文本 token 拼接进 LLM。Qwen-Audio 用任务 tag(transcribe/audioqa 等)区分输入模态与任务;Qwen2-Audio 在此基础上用多任务架构 + 位置编码对齐音频与文本 token。优点:直接复用现成 LLM、训练轻;缺点:连续特征与文本离散 token 存在表征鸿沟。
📌核心概述
2. 原生离散 token 统一(native any-to-any, GPT-4o 路线): 音频同样经 codec(RVQ)变成离散 token,与文本 token 在同一个 Transformer 主干内交替建模——统一 embedding + 全注意力/交叉注意力,支持 token 级流式输入输出,端到端延迟大幅下降;Chameleon 对图像做同样处理。缺点:音频 token 密度高(每秒 25-50 个 vs 文本 2-5 个),需降采样/压缩,且离散化损失部分声学细节。
📌核心概述
训练配方(两路线通用):阶段 1 冻结 LLM、只对齐音频编码器 → 阶段 2 全量微调 → 阶段 3 语音指令/对话数据 SFT(必要时偏好对齐),防止灾难性遗忘并保住文本能力。
💡使用场景
实时语音助手(GPT-4o voice、Gemini Live)、音频理解/音频问答、音乐理解、语音翻译、语音克隆;面试常问 Qwen-Audio 与 GPT-4o 的融合差异。
解决的核心痛点
传统 STT→LLM→TTS 串接管线误差逐级传播、端到端延迟高、无法感知音色/情感/音乐等声学细节;原生音频 token 让 LLM 与音频共享同一符号空间,实现听-想-说闭环与低延迟流式交互。
🎯5 个高频面试考点 (Exam Points)
1
语音接入 LLM 的两种主流方式?各自优点与代价?
2
Qwen-Audio 架构细节:编码器 + Q-Former 如何把音频压缩成 token?
3
GPT-4o 原生音频 token 方案为什么延迟低?与级联 STT/TTS 相比?
4
音频 token 密度远高于文本,如何解决?
5
语音 LLM 分阶段训练:为什么阶段 1 冻结 LLM 只对齐音频编码器?
📖 关联深度指南:📄 audio-and-speech-models
更新于 2026-08-12
🎯
检验攻克程度:针对「语音大模型」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点语音合成 TTS下一个知识点RVQ 码本

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用