返回 多模态 思维导图
中文·English
👁️ 多模态ID: asr

语音识别 ASR

ASR (Whisper)
🎯核心定义
ASR(自动语音识别)把音频序列 x=(x1,,xT)x = (x_1, \dots, x_T)(约每秒 100 帧)映射为文本 y=(y1,,yL)y = (y_1, \dots, y_L),核心难题是长度不对齐(TLT \gg L)与对齐学习,两条主流路线:
📌核心概述
CTC(Connectionist Temporal Classification): 引入 blank 符号,对删除 blank、合并重复后得到 yy 的所有单调对齐路径求边际概率:
📌核心概述
P(yx)=πB1(y)t=1Tp(πtx)P(y|x) = \sum_{\pi \in \mathcal{B}^{-1}(y)} \prod_{t=1}^{T} p(\pi_t | x)
📌核心概述
假设对齐单调、无需逐帧标注,解码用前缀 beam search;缺点是帧间输出条件独立,难以建模语言长程依赖,但天然适合流式。
📌核心概述
注意力编码器-解码器(LAS / Whisper): 解码器生成第 ll 个字符时对编码器输出做注意力,隐式学习软对齐并自带语言模型先验:
📌核心概述
P(yly<l,x)=softmax(QlKdk)P(y_l | y_{<l}, x) = \operatorname{softmax}\left(\frac{Q_l K^\top}{\sqrt{d_k}}\right)
📌核心概述
效果更好但自回归解码慢、对齐无显式约束;混合方案共享编码器同时算 CTC 与注意力损失(如 ESPnet joint CTC/attention),兼得两者。
📌核心概述
Whisper 弱监督: 用 68 万小时多语言音视频配字幕数据弱监督训练(无需人工逐句转写),统一多任务输出格式——token 序列以任务指令开头(language 标签、task=transcribe/translate、时间戳),直接自回归生成文本,对多口音、噪声、远场录音鲁棒。
💡使用场景
会议/字幕转写、语音助手输入、音频→文本 RAG 管道;面试常问 CTC 与注意力解码的对比与 Whisper 数据策略。
解决的核心痛点
传统 HMM-GMM 需要专家手工特征、词典与强制对齐;CTC 用动态规划免去逐帧对齐标注,注意力解码免去单调性假设与外部语言模型,Whisper 用弱监督把标注成本降两个数量级并换来跨语言鲁棒性,成为事实标准。
🎯5 个高频面试考点 (Exam Points)
1
CTC 损失怎么算?blank 的作用?如何解决长度不对齐?
2
CTC 与注意力解码器(attention decoder)各有什么优缺点?
3
Whisper 的多任务训练格式是什么?弱监督数据从哪来?
4
68 万小时数据带来哪些能力?Whisper 的局限是什么?
5
为什么说 CTC 适合流式、注意力适合离线?依据是什么?
📖 关联深度指南:📄 audio-and-speech-models
更新于 2026-08-12
🎯
检验攻克程度:针对「语音识别 ASR」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点音频表示下一个知识点语音合成 TTS

🔗 更多 多模态 知识点卡片

Classifier-Free Guidance (CFG)CLIP 应用CLIP 双塔架构ColPali Late-Interaction 视觉检索