返回 大语言模型 思维导图
中文·English
大语言模型ID: lora

LoRA/QLoRA 低秩适配

LoRA / QLoRA Low-Rank Adaptation
🎯核心定义
LoRA (Low-Rank Adaptation, 低秩适配) 是一种参数高效微调方法:冻结预训练权重 WW,只训练低秩增量 ΔW=BA\Delta W = BA,其中 ARd×rA \in \mathbb{R}^{d \times r}BRr×dB \in \mathbb{R}^{r \times d},秩 rdr \ll d。训练时前向计算 h=Wx+BAxh = Wx + BAx,推理时可合并回 W=W+BAW' = W + BA 零额外开销。
💡使用场景
在消费级显存上微调大模型(7B-70B)、多任务多适配器部署(共享底座 + 热插拔 LoRA)、快速迭代实验;QLoRA 进一步把底座量化到 4-bit,单卡即可微调 65B。
解决的核心痛点
全量微调 70B 需要约 4×80GB A100;LoRA 只训练约 0.1% 参数,优化器状态与梯度显存降一个数量级,且多个适配器可在同一底座上热插拔,部署成本大幅下降。
🎯5 个高频面试考点 (Exam Points)
1
LoRA 为什么有效?低秩假设的依据是什么?
2
LoRA 的秩 r 如何选择?r 太大/太小的影响?
3
LoRA 在推理时如何合并权重?多个 LoRA 如何部署?
4
QLoRA 的原理:4-bit 量化 + 分页优化器 + 双重量化分别解决什么?
5
LoRA 和全量微调 (Full FT) 的效果差异?什么时候必须全量?
更新于 2026-08-11
🎯
检验攻克程度:针对「LoRA/QLoRA 低秩适配」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点指令微调 SFT下一个知识点软提示 P-Tuning/Adapter

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA