1深入剖析为什么全参数微调 (Full Fine-Tuning) 比 LoRA 微调更容易发生严重的灾难性遗忘?
2经验重放 (Experience Rehearsal) 的最佳配比策略:通用数据比例(如 10% 通用问答 + 90% 领域数据)对领域任务指标与通用 MMLU 指标的帕累托前沿权衡?
3SLERP (球面线性插值) 相比简单线性权重加权平均在融合大模型权重时的几何优势?
4KL 散度正则化约束 (KL-Penalty: 在损失函数中增加
L+λDKL(πθ∥πbase)) 在防止策略过度偏移中的数学机理?
5如何建立微调后的自动化防退化评估流水线(自动化运行 MMLU, GSM8k, HumanEval 等通用基准)作为上线发布前置门禁?