--- aliases: en: - RL concept_id: reinforcement_learning preferred: en: reinforcement learning ja: 強化学習 relations: relations: broader: - machine_learning prerequisite: - agent - reward - training status: active --- # reinforcement learning A machine-learning paradigm in which an agent learns a policy for acting in an environment from evaluative feedback, typically by adjusting behavior so as to increase expected cumulative reward or another return-based objective. ## broader - [machine learning](../terminology/machine_learning.txt) ## prerequisite - [agent](../terminology/agent.txt) - [reward](../terminology/reward.txt) - [training](../terminology/training.txt) ## Documents: mentions - [既に形成された欺瞞的な方策は、標準的な安全性訓練を経ても残り得る](../documents/hubinger_et_al.deceptive-policies-can-persist-through-safety-training.txt) - [環境に対称性があると、最適方策は選択肢を保つ方向の power-seeking に傾く](../documents/turner.optimal-policies-tend-to-seek-power.txt) [Corpus index](../index.txt)