--- about: - ai_control - artificial_superintelligence attributed_to: - greenblatt basis_through: '2026-08-27' id: greenblatt.control-can-buy-time-but-is-not-a-superintelligence-safety-plan kind: position language: ja mentions: - ai_alignment - ai_r_and_d_automation - loss_of_control - reward_hacking - scheming - specification_gaming - takeover_seeking status: reviewed --- # AIコントロールは時間を稼げても、超知能に対する長期的な安全計画としては頼れない Redwood Research の Chief Scientist(主任科学者)である Greenblatt は、幅広い領域で人間を大きく上回る AI がスキーミングしている可能性を考える場合でも、AIコントロールには一定の価値があり得ると考えている。ただし、その主な役割は、そのような AI から有用なものを引き出すことよりも、乗っ取りを含む極端に悪い結果を当面防ぐことにある。特に、スキーミングしている超人的 AI から安全研究のような検証が難しいものを引き出すことには懐疑的であり、仕様ゲーミングや報酬ハッキングの問題は、スキーミングがなくても残るとする。 [Jankily controlling superintelligence](#corpus-source-1) そのため Greenblatt の基本方針は、十分に安全な引き継ぎが済む前に、一般的な能力が人間を大きく上回る AI に依存しないことである。能力が急速に伸びる状況では、まず一般能力が人間程度でありながら安全関連のタスクを高速に自動化できる、十分にアラインされた AI へ安全研究を引き継ぐことを主要な計画とし、それ以前にそのような超人的 AI を訓練するのは避けるべきだと述べている。超人的 AI が先に作られてしまった場合にコントロールを使うことはあり得るが、それは望ましい通常の運用形態ではなく、補助的・暫定的なリスク低減策として位置づけられる。 [Jankily controlling superintelligence](#corpus-source-1) それでも、コントロールによって直ちに制御を失う事態を防げれば、その猶予には意味がある。Greenblatt は、より弱く監督しやすい AI から仕事を引き出すこと、危険を示す証拠を増やして社会的対応を促すこと、その対応が実際に進むのを待つこと、あるいは後発で、より責任ある開発主体が AI を使って安全研究を進めることに、その猶予を使えると考えている。したがってコントロールの価値は、最終的な安全性を保証することではなく、他の安全策や社会的対応を実行するために必要な猶予を確保する点にある。 [Jankily controlling superintelligence](#corpus-source-1) しかし、その猶予が長く続くとは見ていない。AI による AI 研究開発の完全自動化後は、能力向上、稼働する AI の数や速度の増大、利用範囲の拡大によってコントロールが難しくなると見積もっている。数値は低信頼の推測だと明記したうえで、有効なコントロールがほとんど望めなくなる確率を、完全自動化から6か月以内で約40%、1年以内で約65%と置き、より速い進歩を想定する見方では1年以内を約80%とする評価にも共感を示している。また、強力な AI への意図的な対応による進歩の減速を仮定しない場合、2年以内で約75%、3.5年以内で約85%と見積もっている。 [Jankily controlling superintelligence](#corpus-source-2) このため Greenblatt は、超知能へのコントロールをリスク低減に役立ち得る手段とは見ているものの、長期間頼れる安全計画とは見なしていない。うまくいっても数か月程度しか猶予を得られない可能性があり、その期間中もリスクは高いままである。コントロール全体の価値の大部分がこの超知能段階から生じるとも考えていない。 [Jankily controlling superintelligence](#corpus-source-3) ## about - [AI control](../terminology/ai_control.txt) - [artificial superintelligence](../terminology/artificial_superintelligence.txt) ## mentions - [AI alignment](../terminology/ai_alignment.txt) - [AI R&D automation](../terminology/ai_r_and_d_automation.txt) - [loss of control](../terminology/loss_of_control.txt) - [reward hacking](../terminology/reward_hacking.txt) - [scheming](../terminology/scheming.txt) - [specification gaming](../terminology/specification_gaming.txt) - [takeover-seeking](../terminology/takeover_seeking.txt) ## Citation references - [Jankily controlling superintelligence](../sources/greenblatt.jankily-controlling-superintelligence.txt) - Source: `source:greenblatt.jankily-controlling-superintelligence` - Locator: `anchor:limited-hopes-for-controlling-superintelligence` - [Jankily controlling superintelligence](../sources/greenblatt.jankily-controlling-superintelligence.txt) - Source: `source:greenblatt.jankily-controlling-superintelligence` - Locator: `anchor:how-much-time-can-control-buy` - [Jankily controlling superintelligence](../sources/greenblatt.jankily-controlling-superintelligence.txt) - Source: `source:greenblatt.jankily-controlling-superintelligence` - Locator: `anchor:conclusion` [Corpus index](../index.txt)