返回 大语言模型 思维导图
中文·English
大语言模型ID: low-bit

低比特 INT8/INT4

Low-Bit INT8/INT4
🎯核心定义
低比特量化把权重/激活降到 8-bit 或 4-bit 整数。权重存储从 FP16 的 2 字节降到 INT8 的 1 字节、INT4 的 0.5 字节——权重 INT4 化使显存占用直接省 75% (FP16 70B 需 140GB,INT4 仅约 35GB)。每张量用 scale ss 与 zero-point zz 对齐表示范围: xq=round(x/s)+zx_q = \text{round}(x/s) + z;4-bit 常用分组量化 (group-wise, 如每 128 个权重一组共享一个 scale),缓解小尺度通道被大范围吞没的问题。
💡使用场景
显存受限部署 (消费级显卡、边缘设备跑 7B-70B)、推理带宽优化 (低比特加载省显存带宽)、KV cache 量化,以及训练完成后一次性转换的离线服务链路。
解决的核心痛点
模型越大显存与带宽越贵;INT4 省 75% 权重显存且不增加服务延迟,配合校准集与分组量化把精度损失控制在可接受范围——校准集的选择与校准算法是精度关键,分布失配是低比特下最主要的精度杀手。
🎯5 个高频面试考点 (Exam Points)
1
INT8/INT4 相比 FP16 的显存与带宽收益各是多少?
2
为什么说 INT4 省 75% 显存?计算过程是什么?
3
分组量化 (group-wise) 是什么?为什么低比特下更有效?
4
校准集如何选择?为什么它是精度关键?
5
低比特下常见的精度损失来源有哪些?如何缓解?
更新于 2026-08-12
🎯
检验攻克程度:针对「低比特 INT8/INT4」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点量化 PTQ/QAT下一个知识点激活异常值处理与 FP8

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA