--- aliases: en: - AI oversight - human oversight ja: - オーバーサイト - 監視 concept_id: oversight preferred: en: oversight ja: 監督 relations: relations: broader: - ai_safety related: - sandbagging - situational_awareness status: active --- # oversight The process by which external actors or mechanisms observe, evaluate, constrain, or correct an AI system's behavior, especially during training, evaluation, or deployment, in order to detect problems and keep behavior within intended bounds. ## broader - [AI safety](../terminology/ai_safety.txt) ## related - [sandbagging](../terminology/sandbagging.txt) - [situational awareness](../terminology/situational_awareness.txt) ## Documents: mentions - [再帰的な oversight を重ねても、能力差が広がってなお成功率を維持できるとは限らない](../documents/engels_et_al.recursive-oversight-does-not-automatically-scale-across-capability-gaps.txt) - [解釈可能性は危険の診断に役立っても、それだけでアラインメントの解決策にはならない](../documents/yudkowsky.interpretability-is-diagnostic-not-by-itself-an-alignment-solution.txt) [Corpus index](../index.txt)