07 · 训练

RLHF、DPO 与模型对齐

从偏好数据、奖励模型、策略优化到 DPO,解释模型行为怎样被偏好信号约束。

0 / 4节点已达到面试就绪

返回总知识地图 →

Learning path

从理解到表达的三阶段路径

节点按学习阶段分栏;具体依赖关系进入节点后查看。

专题 问题
领域说明、结构图与复习边界+

OpenRLHF system architecture。OpenRLHF 官方架构展示 Actor、Reward、Reference 与训练后端之间的关系。

图:OpenRLHF 官方架构展示 Actor、Reward、Reference 与训练后端之间的关系。 来源:OpenRLHF system architecture,作者 OpenRLHF contributors,许可 Apache-2.0。

知识范围

覆盖偏好数据、奖励模型、PPO 式 RLHF、KL 约束、DPO 和奖励黑客。重点是数据与目标函数怎样共同决定可观察行为。

学习路线

先区分 SFT 与偏好优化,再理解 RLHF 各阶段的输入输出,最后比较 DPO 的简化假设与适用条件。

核心问题

  • RLHF 流程中每个模型负责什么?
  • DPO 为什么不需要显式训练奖励模型?
  • 奖励黑客怎样被发现和限制?

参考资料

Learning flow

先理解,再练习,最后闭卷回答

01

理解知识

概念、机制与方法比较

02

练习迁移

估算、实现、案例与算法

    03

    闭卷提取

    面试问题与复习卡片

    Domain index

    领域知识检索

    正在索引 4 个节点

    LOCAL INDEX

      输入关键词,查找全部技术文章。

        搜索范围:正文、标题、分类和标签