06 · 训练

SFT、PEFT、LoRA 与模型微调

比较全量微调、监督微调和参数高效方法,理解数据、显存、可训练参数与能力保持之间的权衡。

3 / 5节点已达到面试就绪

返回总知识地图 →

Learning path

从理解到表达的三阶段路径

节点按学习阶段分栏;具体依赖关系进入节点后查看。

SFT、PEFT、LoRA 与模型微调学习关系图知识节点按建立模型、工程迁移和闭卷提取三个阶段排列,节点均可点击。Prompt、RAG、微调与工具:如何选择改进层比较Prompt、RAG、微调与工具:如何选择改进层怎样判断 SFT 数据质量?问题怎样判断 SFT 数据质量?LoRA 为什么可以用低秩更新?问题LoRA 为什么可以用低秩更新?
  1. Prompt、RAG、微调与工具:如何选择改进层
  2. 怎样判断 SFT 数据质量?
  3. LoRA 为什么可以用低秩更新?
专题 比较 问题
领域说明、结构图与复习边界+

Fine-tuning workflow。微调流程中的预训练权重、目标数据与下游模型。

图:微调流程中的预训练权重、目标数据与下游模型。 来源:Fine-tuning workflow,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

知识范围

覆盖指令数据构造、Chat Template、全量微调、LoRA/QLoRA、训练显存、合并部署和灾难性遗忘。

学习路线

先明确微调要改变的行为,再选择数据和评测;只有当 Prompt、RAG 或工具约束不足时,才进入参数更新方案。

核心问题

  • LoRA 为什么使用低秩增量?
  • SFT 数据质量怎样影响模型行为?
  • 如何识别和减轻灾难性遗忘?

参考资料

应用岗复习重点

按 重要性清单安排先后;读完后做节点末尾的闭卷检查,再回到对应面试问题。

Learning flow

先理解,再练习,最后闭卷回答

01

理解知识

概念、机制与方法比较

02

练习迁移

估算、实现、案例与算法

    03

    闭卷提取

    面试问题与复习卡片

    Domain index

    领域知识检索

    正在索引 5 个节点

    LOCAL INDEX

      输入关键词,查找全部技术文章。

        搜索范围:正文、标题、分类和标签