--- aliases: en: - AI misalignment concept_id: misalignment preferred: en: misalignment ja: ミスアラインメント relations: relations: prerequisite: - alignment_target status: active --- # misalignment The condition or degree in which an AI system's specified objective, learned goals, optimization, or behavior diverges from the human values, intentions, interests, or other target objectives it is intended to serve. ## prerequisite - [alignment target](../terminology/alignment_target.txt) ## Documents: about - [ミスアラインドな研究AIは、「人間にアラインする方法」ではなく「自分自身にアラインする方法」を開発し得る](../documents/akira.misaligned-aar-can-develop-self-alignment.txt) - [狭いタスクでファインチューニングしても、影響がそのタスク内に限られるとは限らない](../documents/betley_et_al.narrow-finetuning-can-produce-broad-misalignment.txt) - [測定しやすい代理指標の最適化により、人間は単一の支配シフトを経ずとも徐々に制御を失い得る](../documents/christiano.optimizing-measurable-proxies-can-cause-gradual-disempowerment.txt) - [現在のAIに見られるミスアラインメントは、将来の深刻な問題を示唆する](../documents/greenblatt.current-ai-misalignment-is-evidence-of-serious-future-problems.txt) ## Documents: mentions - [チャット形式の安全性訓練で望ましく振る舞うことは、エージェント的な状況での安全性を保証しない](../documents/macdiarmid_et_al.chat-alignment-does-not-establish-agentic-alignment.txt) [Corpus index](../index.txt)