返回 深度学习 思维导图
中文·English
🧠 深度学习ID: gru

GRU

🎯核心定义
GRU(Gated Recurrent Unit)是 LSTM 的简化变体, 只有两个门。更新门 zt=σ(Wz[ht1,xt]+bz)z_t = \sigma(W_z[h_{t-1}, x_t] + b_z) 决定保留多少历史、写入多少新信息; 重置门 rt=σ(Wr[ht1,xt]+br)r_t = \sigma(W_r[h_{t-1}, x_t] + b_r) 决定多大程度丢弃历史; 候选隐藏态 h~t=tanh(Wh[rtht1,xt]+bh)\tilde{h}_t = \tanh(W_h[r_t \odot h_{t-1}, x_t] + b_h); 输出 ht=(1zt)ht1+zth~th_t = (1 - z_t) \odot h_{t-1} + z_t \odot \tilde{h}_t(\odot 逐元素乘)。相比 LSTM: 无独立细胞状态, 遗忘门与输入门合并为更新门, 权重从 4 组减到 3 组(参数约少 25%)。更新门 zt0z_t \approx 0htht1h_t \approx h_{t-1}, 与 LSTM 的 ft1f_t \approx 1 一样提供加性直通路径保持长程记忆; 重置门 rt0r_t \approx 0 时忽略历史、仅由当前输入生成候选, 用于捕捉短期依赖。
💡使用场景
参数敏感/数据量小/实时推理场景的首选循环单元(语音、时序、轻量序列模型); 面试高频对比题: GRU vs LSTM 的公式差异、参数量、表达能力与训练效率。
解决的核心痛点
LSTM 的 4 个门控部件在多数任务上冗余, GRU 用 3 组权重实现几乎相当的长期记忆能力——参数量减少约 25%、单步计算更少, 在小数据与移动端场景训练更快、更不易过拟合; 代价是没有独立细胞状态, 信息存储粒度略粗(历史与输出耦合在同一 hth_t 中)。
🎯5 个高频面试考点 (Exam Points)
1
默写 GRU 更新门 ztz_t、重置门 rtr_t、候选 h~t\tilde{h}_t 与输出 ht=(1zt)ht1+zth~th_t = (1 - z_t)h_{t-1} + z_t\tilde{h}_t 的公式, 并解释每个门的职责。
2
GRU vs LSTM 的结构差异: 为什么 GRU 参数量约少 25%(3 组 vs 4 组权重)? 没有细胞状态对记忆粒度有什么影响?
3
更新门 zt0z_t \approx 0 时 GRU 发生了什么(htht1h_t \approx h_{t-1} 的加性直通)? 这与 LSTM 遗忘门 ft1f_t \approx 1 的机制有何对应?
4
重置门的作用: rt0r_t \approx 0 时候选 h~t\tilde{h}_t 只依赖当前输入, 这为什么有利于捕捉短期依赖和丢弃无用历史?
5
何时选 GRU 而非 LSTM: 数据量、参数量预算、推理延迟等角度; 两者在常见任务上的精度差距为何通常很小?
📖 关联深度指南:📄 rnn-lstm-and-mamba-ssm
更新于 2026-08-12
🎯
检验攻克程度:针对「GRU」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点LSTM 门控下一个知识点SSM 与 Mamba

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化