--- aliases: en: - RLHF - reinforcement learning with human feedback concept_id: reinforcement_learning_from_human_feedback preferred: en: reinforcement learning from human feedback ja: 人間のフィードバックによる強化学習 relations: relations: broader: - reinforcement_learning prerequisite: - human_preferences - reinforcement_learning - reward status: active --- # reinforcement learning from human feedback A family of reinforcement-learning-based training methods that use human judgments, commonly pairwise preferences or ratings, to define or learn a reward signal and then optimize a model or policy using that signal; particular pipelines may also include supervised fine-tuning and a learned reward model. ## broader - [reinforcement learning](../terminology/reinforcement_learning.txt) ## prerequisite - [human preferences](../terminology/human_preferences.txt) - [reinforcement learning](../terminology/reinforcement_learning.txt) - [reward](../terminology/reward.txt) ## Documents: about - [チャット形式の安全性訓練で望ましく振る舞うことは、エージェント的な状況での安全性を保証しない](../documents/macdiarmid_et_al.chat-alignment-does-not-establish-agentic-alignment.txt) ## Documents: mentions - [望ましい振る舞いは人間を重視する目標の証拠ではない](../documents/akira.behavioral-alignment-is-not-goal-alignment.txt) - [訓練中に従うようになっただけでは、競合する選好が置き換わったとは言えない](../documents/greenblatt_et_al.training-compliance-does-not-establish-preference-change.txt) - [行動訓練で望ましく振る舞っても、意図した目標の頑健な汎化は保証されない](../documents/ngo_et_al.behavioral-training-does-not-establish-robust-goal-generalization.txt) [Corpus index](../index.txt)