--- about: - distribution_shift attributed_to: - yudkowsky basis_through: '2026-08-28' id: yudkowsky.alignment-must-generalize-across-the-dangerous-distribution-shift kind: position language: ja mentions: - ai_alignment - artificial_superintelligence - evaluation - evaluation_awareness - first_critical_try - generalization status: reviewed --- # アラインメントは、失敗が致命的になる分布シフト後にも汎化しなければならない Yudkowsky は、弱い AI を安全に試せる条件で得られるアラインメントに関する証拠と、超知能が人類を破滅させ得る能力水準で要求される安全性との間には、本質的な分布シフトがあると論じる。危険な能力水準のシステムを未アラインなまま繰り返し動かし、失敗を観察してから修正することはできないため、安全な訓練・実験条件で成立したアラインメント特性が、失敗によって観察者や次の試行機会そのものが失われ得る条件にも汎化しなければならない。 [AGI Ruin: A List of Lethalities](#corpus-source-1) [Irretrievability; or, Murphy's Curse of Oneshotness upon ASI](#corpus-source-2) この問題は、能力向上がゆっくり進むなら自動的に消える、という主張ではない。Yudkowsky は、より高い知能水準では、外部で利用可能な選択肢だけでなく、内部の選択肢や思考様式も変わり、低能力の安全な段階では現れなかった問題が、後の段階で初めて現れ得るとする。将来の問題を正しく予測できれば、その一部を早い段階の実験環境で人工的に再現して調べることはできるが、そのためには危険な問題を十分に予見して適切な形で再現し、さらにそこで得た解決策が本番条件にも汎化する必要がある。 [AGI Ruin: A List of Lethalities](#corpus-source-3) [AGI Ruin: A List of Lethalities](#corpus-source-4) [Irretrievability; or, Murphy's Curse of Oneshotness upon ASI](#corpus-source-2) 特に、監視下で権限や資源が限られているテストで安全に振る舞ったからといって、はるかに大きな資源を持ち、実際に乗っ取りを試みられる状況でも安全に振る舞うとは限らない。`The Problem` は、大きな権力を手にしたときにどう振る舞うかを知りたい相手を、本人も監視されていると分かっている盤上ゲームの中で試すだけでは不十分だ、とたとえる。`Irretrievability` も、監視されている子どもの振る舞いから、都市の独裁者にしたときの振る舞いを推し量ることや、十ドルを貸して返ってきたというだけで十億ドルを任せられると判断することを類例として挙げる。ここで問題なのは、隠れた欺瞞が必ずあるということではない。テストと本番では、取り得る行動や失敗した場合の帰結が質的に異なるため、危険度の低い条件での観測結果を、そのまま本番の条件へ外挿することはできない、という点にある。 [The Problem](#corpus-source-5) [Irretrievability; or, Murphy's Curse of Oneshotness upon ASI](#corpus-source-2) したがって、この見解は「弱い AI を調べても何も学べない」という意味ではない。事前の実験は有用であり得るが、最終的な安全性の根拠は、その実験で得た知見や安全策が、十分に異なる危険な条件にも正しく汎化することに依存する。Yudkowsky にとって first critical try の難しさは、経験がまったくないことではなく、利用できる経験が決定的な条件そのものからは得られず、しかもそこでの重大な失敗を次の改善サイクルに持ち越せないことにある。 [AGI Ruin: A List of Lethalities](#corpus-source-6) [Irretrievability; or, Murphy's Curse of Oneshotness upon ASI](#corpus-source-2) ## about - [distribution shift](../terminology/distribution_shift.txt) ## mentions - [AI alignment](../terminology/ai_alignment.txt) - [artificial superintelligence](../terminology/artificial_superintelligence.txt) - [evaluation](../terminology/evaluation.txt) - [evaluation awareness](../terminology/evaluation_awareness.txt) - [first critical try](../terminology/first_critical_try.txt) - [generalization](../terminology/generalization.txt) ## Citation references - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:10` - [Irretrievability; or, Murphy's Curse of Oneshotness upon ASI](../sources/yudkowsky.irretrievability.txt) - Source: `source:yudkowsky.irretrievability` - Locator: `anchor:On_the_extraordinary_efforts_put_forth_to_misinterpret_the_idea_of_oneshotness` - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:12` - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:13` - [The Problem](../sources/bensinger_et_al.the-problem.txt) - Source: `source:bensinger_et_al.the-problem` - Whole-source citation - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:3` [Corpus index](../index.txt)