--- about: - ai_governance - recursive_self_improvement attributed_to: - christiano basis_through: '2026-08-24' id: christiano.gradual-progress-and-policy-response kind: position language: ja mentions: - ai_alignment - ai_existential_risk - alignment_problem - automated_alignment - first_critical_try - pivotal_act - takeoff_speed status: reviewed --- # Yudkowsky との相違は、危険に至る経路とそれまでに取れる対応の見通しにある Christiano は、Yudkowsky と同じく、アラインメントは最初の危険な試行(first critical try)で成功する必要があるという点には同意する一方、それ以前の実験や失敗からアラインメントについてほとんど学べないという見方には同意していない。アラインメント失敗を扱うトイモデル、まだ満たせていない解釈可能性の基準、未解決の理論的問題などを通じて、試行錯誤から多くのフィードバックを得て、通常の研究開発で使われる方法を取り入れられると考えている。ただし、アラインメントを解決しなくても有用な AI を作れるため、現実から解決を迫られるとは限らず、未解決のまま AGI 開発が先行し得る。その意味で、制度上の問題は依然として非常に難しいとも述べている。 [Where I agree and disagree with Eliezer](#corpus-source-1) AI による自己改善についても、Christiano は、AI システムが人間と同様に研究開発を行う中で、その能力を徐々に高めていく形が最もありそうだと見ており、「自己改善できる AI」に達することを単一の決定的な閾値とは考えていない。特に、AI がアラインメント研究を含む他分野に超人的な貢献をするより前に、再帰的自己改善だけが極端に加速するという見方には否定的である。AI は能力研究だけでなくアラインメント研究も加速し得るため、自己改善によって能力だけが急激に伸び、短期間で破局的な危険水準に入るという議論は成り立たないと考えている。 [Where I agree and disagree with Eliezer](#corpus-source-1) 政策面ではまず、リスクを大きく減らすために単一の pivotal act が必要だという発想自体に否定的である。アラインされた AI は、アラインメント研究の加速や未アライン AI がもたらす危険の説得力ある実証など、複数の経路を通じて危険な期間を短縮できるため、特定の一つの行為が決定的である必要はないと考えている。 [Where I agree and disagree with Eliezer](#corpus-source-1) さらに、Yudkowsky が論じる pivotal act の多くが、AI 開発者が圧倒的な強制力を得て政策を実施する構想であることにも批判的で、そうした経路より従来型の政策形成を通じた働きかけを有望に見ている。そのような政策変更が歴史的に見れば異例の成功であること自体は認めつつ、その実現確率は Yudkowsky が置く総合的な生存確率よりもなお大幅に高いと述べている。また、AI 開発者が密かに世界を掌握しようとする場合に政府が強く効果的に対応する可能性も、Yudkowsky は過小評価しているとする。 [Where I agree and disagree with Eliezer](#corpus-source-1) これらの相違は、Christiano が AI リスク自体を低く見ているためではない。Christiano 自身も、強力な AI が人類から不可逆的に支配権を奪う可能性を相当高く見ており、明確な「火災報知器」に相当する警告がないまま、AI が無視できない人類存亡リスクをもたらす水準に達し得ると考えている。相違の中心は、危険な水準に至るまでに実験からどこまで学べるか、自己改善がどのように進むか、AI が危険になる前からアラインメント研究をどこまで加速できるか、そして従来型の政策的働きかけがどこまで通用するかという見通しにある。 [Where I agree and disagree with Eliezer](#corpus-source-2) [Where I agree and disagree with Eliezer](#corpus-source-1) ## about - [AI governance](../terminology/ai_governance.txt) - [recursive self-improvement](../terminology/recursive_self_improvement.txt) ## mentions - [AI alignment](../terminology/ai_alignment.txt) - [AI existential risk](../terminology/ai_existential_risk.txt) - [alignment problem](../terminology/alignment_problem.txt) - [automated alignment](../terminology/automated_alignment.txt) - [first critical try](../terminology/first_critical_try.txt) - [pivotal act](../terminology/pivotal_act.txt) - [takeoff speed](../terminology/takeoff_speed.txt) ## Citation references - [Where I agree and disagree with Eliezer](../sources/christiano.where-i-agree-and-disagree-with-eliezer.txt) - Source: `source:christiano.where-i-agree-and-disagree-with-eliezer` - Locator: `anchor:Disagreements` - [Where I agree and disagree with Eliezer](../sources/christiano.where-i-agree-and-disagree-with-eliezer.txt) - Source: `source:christiano.where-i-agree-and-disagree-with-eliezer` - Locator: `anchor:Agreements` [Corpus index](../index.txt)