论文 · 资源记录

Training Language Models to Follow Instructions with Human Feedback

以监督示范、偏好比较、奖励模型和强化学习使语言模型更贴近标注者意图。

作者:Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe年份:2022出版信息:Advances in Neural Information Processing Systems 35元数据:完整链接核验于 2026-07-14

为什么重要

用于核对指令适配和人类反馈训练流程,并保留数据分布、标注者和残余错误边界。

阅读前提

教材中的引用位置

  1. A12 · 第 2 章 指令微调、偏好优化与上下文学习

    支持的主张:InstructGPT 论文用于核对监督指令微调、偏好数据、奖励模型与 PPO 阶段的真实数据流和评价;《Deep Learning》用于核对监督损失、序列建模、优化和过拟合基础。本章据此把 instruction tuning 与偏好强化学习分成不同阶段,也不把标注者偏好得分等同于事实正确性或安全性。

  2. A12 · 第 6 章 系统评估、故障模式与智能体综合复习

    支持的主张:ReAct 论文用于核对推理文本与工具动作交错的代理轨迹,RAG 论文用于核对检索器—生成器的联合建模,CLIP 论文用于核对图文对比预训练,InstructGPT 论文用于核对指令与偏好训练流程,规模律论文用于核对语言模型损失的经验缩放。本章分别引用这些接口,不把单篇实验扩张为自主性、事实性、多模态理解或安全性的统一保证。

  3. A13 · 第 5 章 对齐目标、反馈与奖励建模

    支持的主张:InstructGPT 论文用于核对监督示范、偏好比较、奖励模型和 PPO 微调的实际训练链及其评测边界;NIST AI RMF 1.0 用于核对风险治理中的测量、管理、透明度与持续监测要求。本章据此把“优化标注者偏好”与“系统风险已经受控”分开:前者是训练目标,后者需要部署期证据和治理流程。

官方入口