--- about: - first_critical_try attributed_to: - yudkowsky basis_through: '2026-08-24' id: yudkowsky.first-critical-try kind: position language: ja mentions: - ai_existential_risk - alignment_problem - artificial_general_intelligence - capability_threshold - catastrophic_risk - misaligned_agi status: reviewed --- # アラインメントは最初の危険な試行で成功する必要がある Yudkowsky は、AGI アラインメントの実務上の難しさの中心を、AGI を危険な能力水準で初めて運用する first critical try で破局的失敗を避ける必要があることに置いている。より弱いシステムでは失敗を観察して設計を更新できても、初めて人類規模の不可逆な損害を与え得る水準で alignment が破綻すれば、その失敗を通常の科学や工学のように次の試行への feedback として利用することができない。 [AGI Ruin: A List of Lethalities](#corpus-source-1) 同時に Yudkowsky は、超知能の alignment が原理的に不可能だとは主張していない。十分な時間と無制限の再試行があれば解決できると予想しており、問題は通常の科学が前提とする「失敗して学び、再試行する」過程を、失敗自体が終局的になり得る能力水準では使えないことだと説明している。したがって first critical try は論理的不可能性についてではなく、最も重要な能力領域で通常の engineering feedback loop を利用できないという制約を指している。 [Will superintelligent AI end the world?](#corpus-source-2) ## about - [first critical try](../terminology/first_critical_try.txt) ## mentions - [AI existential risk](../terminology/ai_existential_risk.txt) - [alignment problem](../terminology/alignment_problem.txt) - [artificial general intelligence](../terminology/artificial_general_intelligence.txt) - [capability threshold](../terminology/capability_threshold.txt) - [catastrophic risk](../terminology/catastrophic_risk.txt) - [misaligned AGI](../terminology/misaligned_agi.txt) ## Citation references - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:3` - [Will superintelligent AI end the world?](../sources/yudkowsky.ted-superintelligent-ai.txt) - Source: `source:yudkowsky.ted-superintelligent-ai` - Locator: `time:00:03:34-00:04:12` [Corpus index](../index.txt)