--- aliases: en: - alignment ja: - アラインメント - アライメント - 整合 - AIアライメント concept_id: ai_alignment preferred: en: AI alignment ja: AIアラインメント relations: relations: broader: - ai_safety prerequisite: - alignment_target - artificial_intelligence related: - artificial_general_intelligence status: active --- # AI alignment The overarching task and research topic of developing sufficiently advanced AI systems such that running or deploying them produces outcomes that are good according to the intended human objectives, whether expressed in terms of human values, interests, and goals or formalized through an objective or utility function. ## broader - [AI safety](../terminology/ai_safety.txt) ## prerequisite - [alignment target](../terminology/alignment_target.txt) - [artificial intelligence](../terminology/artificial_intelligence.txt) ## related - [artificial general intelligence](../terminology/artificial_general_intelligence.txt) ## Documents: about - [十分な時間と慎重さがあれば、アラインメントは解決可能である](../documents/akira.alignment-is-solvable-with-time-and-care.txt) - [AGIの前に、誰もが認める明確な「火災報知器」が鳴るとは期待できない](../documents/yudkowsky.no-reliable-social-fire-alarm-precedes-agi.txt) ## Documents: mentions - [AARを使ってASIアラインメントを解くには、十分に強い研究AIを先にアラインする必要がある](../documents/akira.aar-requires-aligning-capable-research-ai-first.txt) - [「Alignment by Default」への強い懐疑](../documents/akira.alignment-by-default-skepticism.txt) - [望ましい振る舞いは人間を重視する目標の証拠ではない](../documents/akira.behavioral-alignment-is-not-goal-alignment.txt) - [Debate はスーパーアラインメントの問題を解決できる能力水準では成立しにくい](../documents/akira.debate-fails-at-superalignment-capability.txt) - [評価認識が先に伸びると、資源獲得の有用性を学ぶ頃にはアラインメント偽装が可能になり得る](../documents/akira.evaluation-awareness-enables-alignment-faking.txt) - [ミスアラインドな研究AIは、「人間にアラインする方法」ではなく「自分自身にアラインする方法」を開発し得る](../documents/akira.misaligned-aar-can-develop-self-alignment.txt) - [楽観的な前提を積み重ねるアラインメント計画への懐疑](../documents/akira.optimistic-assumption-stacking-skepticism.txt) - [弱AGIによる短期アラインメント・ブートストラップへの懐疑](../documents/akira.weak-agi-bootstrap-skepticism.txt) - [Yudkowsky との相違は、危険に至る経路とそれまでに取れる対応の見通しにある](../documents/christiano.gradual-progress-and-policy-response.txt) - [クランチタイムではAIの労働力を防御用途に振り向け、移行を大幅に遅らせる](../documents/cotra.crunch-time-redirect-ai-labor-and-slow-transition.txt) - [AIコントロールは時間を稼げても、超知能に対する長期的な安全計画としては頼れない](../documents/greenblatt.control-can-buy-time-but-is-not-a-superintelligence-safety-plan.txt) - [現在のAIに見られるミスアラインメントは、将来の深刻な問題を示唆する](../documents/greenblatt.current-ai-misalignment-is-evidence-of-serious-future-problems.txt) - [能力が訓練分布の外へ急速に汎化する局面で、アラインメント特性は同程度には汎化しない可能性がある](../documents/soares.sharp-left-turn.txt) - [アラインメントは、失敗が致命的になる分布シフト後にも汎化しなければならない](../documents/yudkowsky.alignment-must-generalize-across-the-dangerous-distribution-shift.txt) - [能力はアラインメントより遠くまで汎化しうる](../documents/yudkowsky.capabilities-generalize-beyond-alignment.txt) - [能力と目的は別の軸である](../documents/yudkowsky.capability-motive-separation.txt) - [CEV 型 Sovereign と訂正可能な AGI は異なる安全化戦略である](../documents/yudkowsky.cev-sovereign-vs-corrigible-agi.txt) - [解釈可能性は危険の診断に役立っても、それだけでアラインメントの解決策にはならない](../documents/yudkowsky.interpretability-is-diagnostic-not-by-itself-an-alignment-solution.txt) - [観測された従順さだけでは、内部の目的や欺瞞の有無までは分からない](../documents/yudkowsky.observed-compliance-does-not-identify-hidden-objectives.txt) - [pivotal actには、世界を大きく変えられるほど強いシステムのアラインメントが必要になる](../documents/yudkowsky.pivotal-act-requires-aligning-a-system-capable-of-a-large-intervention.txt) - [資源が豊富であることだけから、アンアラインドな超知能が人類のために資源を残すとは推論できない](../documents/yudkowsky.resource-abundance-does-not-remove-conflict.txt) - [アラインメントのような新規かつ高リスクなシステムの設計には、既知の失敗を塞ぐ以上の security mindset が必要である](../documents/yudkowsky.security-mindset-for-alignment.txt) [Corpus index](../index.txt)