M4-045M4: Sequences & TransformersAttention Variants (MHA / MQA / GQA)Hard
Mastery:
Attention Variants (MHA / MQA / GQA): 解释 softmax 之外的注意力替代(sigmoid attention、归一化变体)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用 sigmoid 逐元素门控替代 softmax 的行归一化,去掉'必须分配满权重'的约束,缓解 sink 与熵崩塌。
📌 Key Takeaways
- •sigmoid:逐元素独立门控,无行归一化
- •好处:无需'垃圾桶'(可全部接近 0)、天然稀疏
- •代价:失去 softmax 的竞争性(注意力不再互相抑制)
📐 Mathematical Derivations
数学机理:<strong>softmax 注意力的约束</strong>——softmax 强制 Σ_j α_ij=1,即每个 query 必须把全部注意力质量分配出去。这带来两个问题:(a) <strong>sink</strong>(没有相关位置时也要找地方倾倒,见 attention sink 题);(b) <strong>竞争性过强</strong>(提高某位置权重必然压低其他位置,即使它们都相关)。<strong>sigmoid attention(Ramapuram 等 2024;以及 gpt-oss 等的实践)</strong> 用<strong>逐元素 sigmoid</strong> 替代 softmax:α_ij=σ(q_i·k_j/√d),<strong>不做行归一化</strong>。<strong>好处</strong>:(a) <strong>无'垃圾桶'需求</strong>——所有 α 都可以接近 0(表示'什么都不关注'),无需借用 sink;(b) <strong>无竞争性</strong>——多个相关位置的权重可同时接近 1(softmax 下它们会互相压低);(c) <strong>天然稀疏</strong>——sigmoid 在负输入下输出趋 0,故不相关位置自动被抑制;(d) <strong>数值稳定</strong>——无需减最大值(sigmoid 本身有界)。<strong>代价与对策</strong>:(a) 失去归一化后,输出的<strong>尺度</strong>不再被约束(softmax 的输出是凸组合、有界;sigmoid 输出可能累加很大),故需要<strong>额外的归一化或缩放</strong>(如对输出做归一化、或调整 1/√d 缩放);(b) 失去竞争性可能使注意力'不够聚焦'(softmax 的指数放大提供了强选择性),故实践需配合 QK-Norm、温度等调节。<strong>其他变体</strong>:(a) <strong>softmax1</strong>(gpt-oss 的'attention sink logit')——在 softmax 分母中<strong>加 1</strong>,使'不关注任何位置'成为合法选项(等价于引入一个恒为 1 的虚拟 sink);(b) <strong>ReLU/平方注意力</strong>(如 cosFormer 的重加权);(c) <strong>线性注意力的核函数</strong>(见线性注意力题)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'必须归一化'的重新审视</strong>——softmax 的归一化原本是为了'让权重成为概率分布',但注意力<strong>不需要</strong>概率语义(它只是加权求和);故去掉归一化是合理的,代价是输出尺度需另行控制。这是'破除默认假设'的典型创新。② <strong>softmax1 的优雅性</strong>——只在分母加 1 就实现了'可选择的 sink',几乎零开销,且能显著缓解 sink 现象(gpt-oss 报告);是'最小改动解决结构性问题'的典范。③ <strong>与稀疏性的关系</strong>——sigmoid 的天然稀疏对 KV 压缩有利(可跳过接近 0 的位置),但需硬件友好的实现。④ <strong>训练稳定性</strong>——sigmoid attention 因无指数放大,梯度更温和,但也可能'学习信号弱'(缺乏 softmax 的强选择性);实践中常与 QK-Norm 联用。⑤ <strong>理论分析</strong>——softmax 注意力的'竞争性'在某些任务(如需要排他选择的检索)是优势;故 sigmoid 并非全面更优,而是'在 sink 与竞争性之间重新权衡'。⑥ <strong>面试要点</strong>——被问'softmax 是不是必须的',应指出'<strong>softmax 的行归一化带来 sink 与过度竞争两个副作用</strong>',并给出 sigmoid attention 与 softmax1(分母加 1)两种替代及其取舍;这是'敢于质疑默认设计'的高分回答。
⚠️ Common Interview Pitfalls
- ✕以为注意力权重必须是概率分布
- ✕忽略去掉归一化后输出尺度需另行控制
🎯 Interviewer Follow-ups
- ?为什么去掉行归一化能缓解 sink?
- ?sigmoid attention 的数值范围与缩放如何设计?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.