06 · 训练
SFT、PEFT、LoRA 与模型微调
比较全量微调、监督微调和参数高效方法,理解数据、显存、可训练参数与能力保持之间的权衡。
3 / 5节点已达到面试就绪
返回总知识地图 →Learning path
从理解到表达的三阶段路径
节点按学习阶段分栏;具体依赖关系进入节点后查看。
专题 比较 问题
领域说明、结构图与复习边界+
图:微调流程中的预训练权重、目标数据与下游模型。 来源:Fine-tuning workflow,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。
知识范围
覆盖指令数据构造、Chat Template、全量微调、LoRA/QLoRA、训练显存、合并部署和灾难性遗忘。
学习路线
先明确微调要改变的行为,再选择数据和评测;只有当 Prompt、RAG 或工具约束不足时,才进入参数更新方案。
核心问题
- LoRA 为什么使用低秩增量?
- SFT 数据质量怎样影响模型行为?
- 如何识别和减轻灾难性遗忘?
参考资料
应用岗复习重点
- Prompt、RAG、微调与工具:如何选择改进层:按知识缺失、行为不符、计算错误和外部状态四类故障选方案,并给出对照实验、成本边界和面试答法。
按 重要性清单安排先后;读完后做节点末尾的闭卷检查,再回到对应面试问题。
Learning flow
先理解,再练习,最后闭卷回答
01
理解知识
概念、机制与方法比较
02
练习迁移
估算、实现、案例与算法
03
闭卷提取
面试问题与复习卡片
Domain index
领域知识检索
正在索引 5 个节点
LOCAL INDEX