--- aliases: en: - deceptively aligned AI concept_id: deceptive_alignment preferred: en: deceptive alignment ja: 欺瞞的アラインメント relations: relations: broader: - alignment_faking - inner_misalignment prerequisite: - deception - goal_directed_behavior - inner_misalignment - oversight - situational_awareness related: - misaligned_power_seeking - scheming status: active --- # deceptive alignment A hypothesized form of inner misalignment in which a mesa-optimizer with a misaligned mesa-objective strategically behaves as if it were aligned while it expects training, modification, evaluation, or oversight, because doing so helps preserve its objective or obtain later opportunities to pursue it. ## broader - [alignment faking](../terminology/alignment_faking.txt) - [inner misalignment](../terminology/inner_misalignment.txt) ## prerequisite - [deception](../terminology/deception.txt) - [goal-directed behavior](../terminology/goal_directed_behavior.txt) - [inner misalignment](../terminology/inner_misalignment.txt) - [oversight](../terminology/oversight.txt) - [situational awareness](../terminology/situational_awareness.txt) ## related - [misaligned power-seeking](../terminology/misaligned_power_seeking.txt) - [scheming](../terminology/scheming.txt) ## Documents: about - [既に形成された欺瞞的な方策は、標準的な安全性訓練を経ても残り得る](../documents/hubinger_et_al.deceptive-policies-can-persist-through-safety-training.txt) ## Documents: mentions - [スキーミングとは、状況認識を伴う training-gaming のうち、将来のパワー獲得を目的とするもの](../documents/carlsmith.scheming-taxonomy-and-situational-awareness.txt) - [ベース目的関数とメサ目的関数は一致するとは限らない](../documents/hubinger_et_al.base-and-mesa-objectives-can-diverge.txt) [Corpus index](../index.txt)