🎯核心定义
ASR(自动语音识别)把音频序列
x=(x1,…,xT)(约每秒 100 帧)映射为文本
y=(y1,…,yL),核心难题是长度不对齐(
T≫L)与对齐学习,两条主流路线:
📌核心概述
CTC(Connectionist Temporal Classification): 引入 blank 符号,对删除 blank、合并重复后得到
y 的所有单调对齐路径求边际概率:
📌核心概述
P(y∣x)=∑π∈B−1(y)∏t=1Tp(πt∣x) 📌核心概述
假设对齐单调、无需逐帧标注,解码用前缀 beam search;缺点是帧间输出条件独立,难以建模语言长程依赖,但天然适合流式。
📌核心概述
注意力编码器-解码器(LAS / Whisper): 解码器生成第
l 个字符时对编码器输出做注意力,隐式学习软对齐并自带语言模型先验:
📌核心概述
P(yl∣y<l,x)=softmax(dkQlK⊤) 📌核心概述
效果更好但自回归解码慢、对齐无显式约束;混合方案共享编码器同时算 CTC 与注意力损失(如 ESPnet joint CTC/attention),兼得两者。
📌核心概述
Whisper 弱监督: 用 68 万小时多语言音视频配字幕数据弱监督训练(无需人工逐句转写),统一多任务输出格式——token 序列以任务指令开头(language 标签、task=transcribe/translate、时间戳),直接自回归生成文本,对多口音、噪声、远场录音鲁棒。
💡使用场景
会议/字幕转写、语音助手输入、音频→文本 RAG 管道;面试常问 CTC 与注意力解码的对比与 Whisper 数据策略。
⚡解决的核心痛点
传统 HMM-GMM 需要专家手工特征、词典与强制对齐;CTC 用动态规划免去逐帧对齐标注,注意力解码免去单调性假设与外部语言模型,Whisper 用弱监督把标注成本降两个数量级并换来跨语言鲁棒性,成为事实标准。