TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
LoRA/QLoRA 低秩适配
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
lora
LoRA/QLoRA 低秩适配
LoRA / QLoRA Low-Rank Adaptation
🎯
核心定义
LoRA (Low-Rank Adaptation, 低秩适配) 是一种参数高效微调方法:冻结预训练权重
W
W
W
,只训练低秩增量
Δ
W
=
B
A
\Delta W = BA
Δ
W
=
B
A
,其中
A
∈
R
d
×
r
A \in \mathbb{R}^{d \times r}
A
∈
R
d
×
r
、
B
∈
R
r
×
d
B \in \mathbb{R}^{r \times d}
B
∈
R
r
×
d
,秩
r
≪
d
r \ll d
r
≪
d
。训练时前向计算
h
=
W
x
+
B
A
x
h = Wx + BAx
h
=
W
x
+
B
A
x
,推理时可合并回
W
′
=
W
+
B
A
W' = W + BA
W
′
=
W
+
B
A
零额外开销。
💡
使用场景
在消费级显存上微调大模型(7B-70B)、多任务多适配器部署(共享底座 + 热插拔 LoRA)、快速迭代实验;QLoRA 进一步把底座量化到 4-bit,单卡即可微调 65B。
⚡
解决的核心痛点
全量微调 70B 需要约 4×80GB A100;LoRA 只训练约 0.1% 参数,优化器状态与梯度显存降一个数量级,且多个适配器可在同一底座上热插拔,部署成本大幅下降。
🎯
5 个高频面试考点 (Exam Points)
1
LoRA 为什么有效?低秩假设的依据是什么?
2
LoRA 的秩 r 如何选择?r 太大/太小的影响?
3
LoRA 在推理时如何合并权重?多个 LoRA 如何部署?
4
QLoRA 的原理:4-bit 量化 + 分页优化器 + 双重量化分别解决什么?
5
LoRA 和全量微调 (Full FT) 的效果差异?什么时候必须全量?
📖 关联深度指南:
📄 parameter-efficient-fine-tuning →
更新于 2026-08-11
🎯
检验攻克程度:针对「LoRA/QLoRA 低秩适配」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
指令微调 SFT
下一个知识点 →
软提示 P-Tuning/Adapter
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA