RLHF、DPO 与模型对齐
面试问题 高级 重要度 3/5 知识骨架 提取阶段

RLHF 的完整训练流程是什么?

逐步说明 SFT、偏好采集、奖励模型和策略优化的输入输出及风险。

发布于 2026-08-31 · 更新于 2026-09-07

当前显示参考答案
本文目录

    OpenRLHF system architecture。RLHF 训练中 Actor、Reference、Reward、Critic 与推理引擎的系统关系。

    图:RLHF 训练中 Actor、Reference、Reward、Critic 与推理引擎的系统关系。 来源:OpenRLHF system architecture,作者 OpenRLHF contributors,许可 Apache-2.0。

    考察意图

    确认候选人能区分各阶段的模型、数据和优化目标。

    60–90 秒口述答案

    典型 RLHF 先用高质量示范做 SFT,得到可遵循指令的初始策略;再对同一 Prompt 采样多个回答,由人类排序,训练奖励模型预测偏好;最后用该奖励为信号优化策略,同时用相对参考策略的 KL 约束防止偏离过大。训练中通常还有价值估计和优势计算。RLHF 的效果受偏好覆盖、奖励模型泛化和策略优化稳定性共同限制,奖励变高不等于真实质量必然提高。

    深入解释

    奖励模型把回答映射到标量,成对排序损失让 chosen 得分高于 rejected。策略随后会主动寻找奖励模型的高分区域。

    工程权衡

    需要维护多个模型和在线采样,显存、吞吐与稳定性成本较高;偏好数据和回归评测是主要质量约束。

    完整复习答案

    从训练目标开始

    区分 SFT、偏好收集、奖励模型、rollout、优势估计与 PPO 更新;说明 Actor、Reference、Reward、Critic 的输入输出。

    用一个样本看懂更新方向

    系统瓶颈常在生成而非反向传播;需要版本锁定 tokenizer/template,并监控 KL、reward、长度和真实胜率。

    一条样本从 prompt 进入 Actor 生成 response;Reward 给标量分,Reference 提供 KL 基准,Critic 估计 value;GAE 得到 advantage 后 PPO 更新 Actor。调试时必须把 rollout 版本与训练版本对应,否则旧样本会造成难以解释的 off-policy 偏差。

    这个估算给出量级。代入项目参数时需要写明忽略项,并保持单位一致。

    怎样判断训练有效

    围绕“RLHF 的完整训练流程是什么”,对照实验固定初始模型、数据、模板、训练 token 数和解码设置。目标能力、通用能力、安全、拒答与长度分布分别报告,避免让平均分掩盖回退。

    追问参考

    离线 loss 下降但线上胜率下降,应按什么顺序定位?

    对“RLHF 的完整训练流程是什么”而言,loss 下降但胜率下降时,先核对模板/tokenizer/评测,再查训练验证分布、长度偏差和过拟合,最后检查裁判漂移;不要立刻继续加 epoch。

    怎样检验收益来自算法,而非数据清洗或答案长度?

    回到“RLHF 的完整训练流程是什么”,需要区分:检验算法贡献需要同数据、同初始化、同 token 预算的对照,并报告多个 seed 或置信区间;再做数据与算法的交叉消融。

    怎样判断方案已经达到上线条件?

    “RLHF 的完整训练流程是什么”进入发布方案前,发布门应同时覆盖目标能力、通用能力、安全、拒答、格式与长度,任何单项平均分不能替代高风险切片。

    常见错误回答

    把 RLHF 说成“人工实时修改模型答案”,或忽略参考模型和 KL 约束。

    连续追问

    • 奖励模型如何训练?
    • PPO 中策略、参考、价值和奖励模型各自做什么?
    • 为什么需要 KL 约束?

    项目结合

    若没有 RLHF 实践,应明确经验边界,并用偏好数据处理或离线 DPO 实验说明相关能力。

    来源与关联知识

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签