博主头像

人类反馈强化学习(RLHF)详解

外来客 • 2026-08-19 11:14:17

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Reinforcement Learning with Human Feedback (RLHF), Clearly Explained!!!)

🧠 核心观点

  • 强化学习人类反馈(RLHF)是训练大型语言模型(LLM)使其符合人类期望的关键技术,主要用于解决模型在监督微调后容易过拟合、泛化能力不足的问题。
  • RLHF 的核心逻辑是通过低成本获取人类偏好数据,训练一个奖励模型,再利用该模型指导原始模型生成更礼貌、更有帮助的响应,从而避免构建超大规模且昂贵的监督微调数据集。
  • 整个训练流程分为三个阶段:预训练(Pre-training)、监督微调(Supervised Fine-tuning, SFT)和强化学习人类反馈(RLHF)。

📊 关键事实与论据

  • 预训练阶段
  • 使用海量文本数据(如维基百科)训练模型预测下一个 Token。
  • 此阶段仅让模型具备语言预测能力,但未对齐人类使用习惯,模型对特定提示可能生成无意义内容(如 "blah, blah, blah")。
  • 监督微调阶段
  • 使用人工编写的“提示-响应”配对数据进行训练。
  • 由于人工标注成本高且耗时,数据集规模相对较小,导致模型容易过拟合,即对训练集中的特定提示响应良好,但对新提示泛化能力差。
  • RLHF 数据获取策略
  • 针对同一提示,让模型生成多个不同响应(利用 Softmax 概率采样而非仅选最高值 Token)。
  • 让人类标注员对响应进行两两比较并选择偏好项,而非直接撰写最佳响应。
  • 偏好标注比撰写完整响应速度更快、成本更低,从而能构建比 SFT 更大的数据集。
  • 奖励模型训练机制
  • 复制经过 SFT 的模型,移除解嵌入层(un-embedding layer),替换为单一输出层,用于计算奖励分数。
  • 训练目标:对偏好响应输出正奖励,对非偏好响应输出负奖励。
  • 损失函数设计:利用 Sigmoid 函数和 Log 函数组合,通过梯度下降最小化损失,使模型自动学习区分优劣响应的奖励值,无需预先定义理想奖励数值。
  • 该损失函数参考了 OpenAI 2022 年关于训练语言模型遵循人类指令的研究。
  • 最终模型优化
  • 使用新提示(未包含在 SFT 数据集中)让原始模型生成响应。
  • 将提示和响应输入奖励模型计算奖励分数。
  • 利用奖励分数通过强化学习算法更新原始模型参数,使其生成能获得高奖励(即更礼貌、有帮助)的响应。

🎯 结论

  • RLHF 成功解决了 LLM 对齐过程中的过拟合问题,使模型能够泛化到未见过的提示,生成符合人类期望的礼貌且有帮助的回答。
  • 该方法通过“偏好比较”替代“完整响应撰写”,显著降低了获取高质量对齐数据的成本,使得构建大规模偏好数据集成为可能。
  • 最终训练出的模型不仅具备语言预测能力,还实现了与人类使用意图的对齐,能够针对新提示生成高质量响应,而非仅复述训练数据中的特定模式。

0 条评论

发表评论

请先 登录 后参与讨论。