SFT、PEFT、LoRA 与模型微调
旧专题 进阶 重要度 5/5 知识骨架 理解阶段

从 SFT 到 LoRA 的微调决策

从要改变的模型行为出发,比较监督微调、全量更新、LoRA 与量化微调的适用条件。

发布于 2026-08-31

本文目录

    Fine-tuning workflow。预训练模型经过目标任务数据继续训练并迁移到下游任务。

    图:预训练模型经过目标任务数据继续训练并迁移到下游任务。 来源:Fine-tuning workflow,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

    问题边界

    微调适合稳定改变输出格式、领域表达或任务行为。需要实时知识、权限数据或可追溯事实时,应优先考虑检索和工具。

    知识全貌

    SFT 定义训练数据和目标;全量微调更新全部参数;LoRA 训练低秩增量;QLoRA 进一步以量化基座降低训练显存。

    核心机制

    模型在教师强制下学习目标 token。LoRA 将权重增量写成两个低秩矩阵的乘积,冻结基座,仅优化增量参数。

    公式或数据流

    W' = W + (alpha / r) BA,其中 W 冻结,A 与 B 可训练,秩 r 控制适配容量。

    方法比较

    全量微调容量高但训练和版本成本大;LoRA 便于多任务切换;QLoRA 用额外量化与计算开销换显存。选择应由行为变化、预算和部署方式决定。

    工程约束

    必须固定 Chat Template、EOS、最大长度、Loss Mask、数据版本和评测集。合并 Adapter 前后都要回归,量化训练与实际推理量化不可混为同一件事。

    故障模式

    常见问题是答案模板污染、少量重复数据过拟合、训练集泄漏到评测、基础能力退化,以及训练模板和推理模板不一致。

    高频问题

    参考资料

    Projection into a lower-dimensional space。低维投影帮助比较全量更新与低秩参数更新的自由度。

    图:低维投影帮助比较全量更新与低秩参数更新的自由度。 来源:Projection into a lower-dimensional space,作者 D2L.ai authors,许可 CC BY-SA 4.0。

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签