--- about: - capability_generalization attributed_to: - yudkowsky basis_through: '2026-08-24' id: yudkowsky.capabilities-generalize-beyond-alignment kind: position language: ja mentions: - ai_alignment - distribution_shift - generalization - human_values - inner_alignment - optimization status: reviewed --- # 能力はアラインメントより遠くまで汎化しうる Yudkowsky は、能力とアラインメント特性が同じ仕方で汎化すると期待すべきではないと考える。Shah との対話では、cross-domain success に有用な思考パターンは、AI が直面するさまざまな問題に共通する構造として存在し、多様な課題で成功するよう訓練するほど繰り返し選択される一方、人間が AI に追求させたい特定の価値が、問題そのものに同じように埋め込まれているわけではなく、単純な境界を持つとも限らない、と説明している。この非対称性のため、広い問題解決能力を獲得させる圧力が、問題解決を方向づける価値や目標まで同じ強さで形作るとは期待できないとしている。 [Shah and Yudkowsky on alignment failures](#corpus-source-1) `AGI Ruin` では別の角度から、世界についての誤った予測には現実からの訂正圧がある一方、内部の効用や目標には、それに対応する一意の ground truth が同じようには存在せず、訓練範囲では整合して見える複数の内部解が分布外で分岐し得ると論じている。 [AGI Ruin: A List of Lethalities](#corpus-source-2) さらに、一般知能には多様な課題へ共通して働く比較的単純な中核構造があり得る一方、アラインメント側にも同様に単純で外部最適化が発見しやすい中核があるとは限らない、と論じる。したがって、ここで主張されているのは、能力が汎化するからといってアラインメント特性も同程度に汎化すると推論することはできない、という非対称性についてであり、能力が汎化すれば必ず特定の悪い目標が生じる、という決定論的な主張ではない。 [AGI Ruin: A List of Lethalities](#corpus-source-3) ## about - [capability generalization](../terminology/capability_generalization.txt) ## mentions - [AI alignment](../terminology/ai_alignment.txt) - [distribution shift](../terminology/distribution_shift.txt) - [generalization](../terminology/generalization.txt) - [human values](../terminology/human_values.txt) - [inner alignment](../terminology/inner_alignment.txt) - [optimization](../terminology/optimization.txt) ## Citation references - [Shah and Yudkowsky on alignment failures](../sources/yudkowsky.shah-alignment-failures.txt) - Source: `source:yudkowsky.shah-alignment-failures` - Locator: `item:21.1` - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:21` - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:22` [Corpus index](../index.txt)