--- about: - inner_alignment - training_objective attributed_to: - yudkowsky basis_through: '2026-08-24' id: yudkowsky.outer-objective-does-not-determine-inner-goal kind: position language: ja mentions: - distribution_shift - goal - objective - optimization status: reviewed --- # 外部の目的関数は内部の目標を決定しない Yudkowsky は、外部の損失関数を強く最適化することと、学習されたシステムが、その損失関数に忠実に対応する内部目標を持つことを別問題とみなす。Shah との対話では、outer loss に大量の最適化をかけても、その loss の忠実な内部表現が得られるとは限らず、学習過程は認知機構を探索する途中で見つけた改善を順に取り込むため、外部基準そのものを内部目的として複製するとは限らない、と説明している。 [Shah and Yudkowsky on alignment failures](#corpus-source-1) この見方の古い例が自然選択である。Yudkowsky は、自然選択が包括適応度を基準に人間を形成したにもかかわらず、人間の認知には包括適応度そのものを明示的に表象し、それを直接追求する欲求が組み込まれたわけではなく、食欲、性欲、社会的欲求など多数の近接的な動機へ分かれたと論じている。この例は、単純で一貫した外部最適化基準が、それをそのまま反映した内部目標を自動的に生むわけではないことを示すモデルとして使われている。 [Thou Art Godshatter](#corpus-source-2) `AGI Ruin` ではこの論点を機械学習の inner alignment に適用し、単純で厳密な training objective を十分に最適化しても、その概念自体を内部目標として持ち、能力上昇や分布シフト後にも同じ対象を追い続けることは保証されないとする。したがって、ここで否定されているのは、outer objective から inner goal との一致を自動的に推論できるという保証であり、あらゆる学習過程が必ず異なる目標を生むという主張ではない。 [AGI Ruin: A List of Lethalities](#corpus-source-3) ## about - [inner alignment](../terminology/inner_alignment.txt) - [training objective](../terminology/training_objective.txt) ## mentions - [distribution shift](../terminology/distribution_shift.txt) - [goal](../terminology/goal.txt) - [objective](../terminology/objective.txt) - [optimization](../terminology/optimization.txt) ## Citation references - [Shah and Yudkowsky on alignment failures](../sources/yudkowsky.shah-alignment-failures.txt) - Source: `source:yudkowsky.shah-alignment-failures` - Locator: `item:20.2` - [Thou Art Godshatter](../sources/yudkowsky.thou-art-godshatter.txt) - Source: `source:yudkowsky.thou-art-godshatter` - Whole-source citation - [AGI Ruin: A List of Lethalities](../sources/yudkowsky.agi-ruin.txt) - Source: `source:yudkowsky.agi-ruin` - Locator: `item:16` [Corpus index](../index.txt)