{
  "entries": [
    {
      "document_id": "position:akira.aar-requires-aligning-capable-research-ai-first",
      "layer": "position",
      "metadata": {
        "about": [
          "automated_alignment",
          "capability_generalization"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-28",
        "id": "akira.aar-requires-aligning-capable-research-ai-first",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "artificial_superintelligence",
          "capability"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.aar-requires-aligning-capable-research-ai-first.txt",
      "title": "AARを使ってASIアラインメントを解くには、十分に強い研究AIを先にアラインする必要がある"
    },
    {
      "document_id": "position:akira.alignment-by-default-skepticism",
      "layer": "position",
      "metadata": {
        "about": [
          "alignment_by_default"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.alignment-by-default-skepticism",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "generalization",
          "human_values",
          "optimization",
          "utility_function"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.alignment-by-default-skepticism.txt",
      "title": "「Alignment by Default」への強い懐疑"
    },
    {
      "document_id": "position:akira.alignment-is-solvable-with-time-and-care",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_alignment"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.alignment-is-solvable-with-time-and-care",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_development_pause",
          "artificial_superintelligence",
          "p_doom"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.alignment-is-solvable-with-time-and-care.txt",
      "title": "十分な時間と慎重さがあれば、アラインメントは解決可能である"
    },
    {
      "document_id": "position:akira.behavioral-alignment-is-not-goal-alignment",
      "layer": "position",
      "metadata": {
        "about": [
          "behavioral_objective",
          "generalization",
          "objective_robustness"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.behavioral-alignment-is-not-goal-alignment",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "goal",
          "human_values",
          "reinforcement_learning_from_human_feedback"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.behavioral-alignment-is-not-goal-alignment.txt",
      "title": "望ましい振る舞いは人間を重視する目標の証拠ではない"
    },
    {
      "document_id": "position:akira.control-has-narrow-survival-credit",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_control"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.control-has-narrow-survival-credit",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_development_pause",
          "ai_governance",
          "p_doom"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.control-has-narrow-survival-credit.txt",
      "title": "Control が生存確率を押し上げる世界線は狭い"
    },
    {
      "document_id": "position:akira.debate-fails-at-superalignment-capability",
      "layer": "position",
      "metadata": {
        "about": [
          "debate"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.debate-fails-at-superalignment-capability",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "capability",
          "collusion",
          "sandbagging",
          "scalable_oversight"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.debate-fails-at-superalignment-capability.txt",
      "title": "Debate はスーパーアラインメントの問題を解決できる能力水準では成立しにくい"
    },
    {
      "document_id": "position:akira.evaluation-awareness-enables-alignment-faking",
      "layer": "position",
      "metadata": {
        "about": [
          "alignment_faking",
          "evaluation_awareness"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-25",
        "id": "akira.evaluation-awareness-enables-alignment-faking",
        "kind": "prediction",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "evaluation",
          "resource_acquisition",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.evaluation-awareness-enables-alignment-faking.txt",
      "title": "評価認識が先に伸びると、資源獲得の有用性を学ぶ頃にはアラインメント偽装が可能になり得る"
    },
    {
      "document_id": "position:akira.goal-misgeneralization-can-turn-means-into-goals",
      "layer": "position",
      "metadata": {
        "about": [
          "goal_misgeneralization"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-25",
        "id": "akira.goal-misgeneralization-can-turn-means-into-goals",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "goal",
          "inner_misalignment",
          "mesa_optimization",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.goal-misgeneralization-can-turn-means-into-goals.txt",
      "title": "訓練中に役立った手段そのものが学習された目標になり得る"
    },
    {
      "document_id": "position:akira.instrumental-self-preservation-defeats-shutdown",
      "layer": "position",
      "metadata": {
        "about": [
          "instrumental_convergence",
          "self_preservation"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.instrumental-self-preservation-defeats-shutdown",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "corrigibility",
          "instrumental_goal",
          "terminal_goal"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.instrumental-self-preservation-defeats-shutdown.txt",
      "title": "自己保存は最終目標でなくてもシャットダウンを妨げうる"
    },
    {
      "document_id": "position:akira.misaligned-aar-can-develop-self-alignment",
      "layer": "position",
      "metadata": {
        "about": [
          "automated_alignment",
          "misalignment"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-28",
        "id": "akira.misaligned-aar-can-develop-self-alignment",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "alignment_target",
          "artificial_superintelligence",
          "goal"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.misaligned-aar-can-develop-self-alignment.txt",
      "title": "ミスアラインドな研究AIは、「人間にアラインする方法」ではなく「自分自身にアラインする方法」を開発し得る"
    },
    {
      "document_id": "position:akira.optimistic-assumption-stacking-skepticism",
      "layer": "position",
      "metadata": {
        "about": [
          "automated_alignment"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.optimistic-assumption-stacking-skepticism",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "ai_development_pause",
          "artificial_general_intelligence",
          "weak_agi"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.optimistic-assumption-stacking-skepticism.txt",
      "title": "楽観的な前提を積み重ねるアラインメント計画への懐疑"
    },
    {
      "document_id": "position:akira.pdoom-is-conditional-on-pause-and-takeoff",
      "layer": "position",
      "metadata": {
        "about": [
          "p_doom"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.pdoom-is-conditional-on-pause-and-takeoff",
        "kind": "prediction",
        "language": "ja",
        "mentions": [
          "ai_development_pause",
          "ai_governance",
          "takeoff_speed"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.pdoom-is-conditional-on-pause-and-takeoff.txt",
      "title": "p(doom)は開発停止・テイクオフ・規制の条件に依存する"
    },
    {
      "document_id": "position:akira.untrusted-monitoring-can-fail-by-collusion-or-deception",
      "layer": "position",
      "metadata": {
        "about": [
          "collusion",
          "untrusted_monitoring"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.untrusted-monitoring-can-fail-by-collusion-or-deception",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_control",
          "deception"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.untrusted-monitoring-can-fail-by-collusion-or-deception.txt",
      "title": "Untrusted monitoring は共謀や欺瞞によって破られうる"
    },
    {
      "document_id": "position:akira.verifiable-international-superintelligence-pause",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_development_pause",
          "ai_governance"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.verifiable-international-superintelligence-pause",
        "kind": "proposal",
        "language": "ja",
        "mentions": [
          "artificial_intelligence",
          "artificial_superintelligence",
          "compute_governance"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.verifiable-international-superintelligence-pause.txt",
      "title": "条約と相互査察で国際的な超知能開発停止を検証する"
    },
    {
      "document_id": "position:akira.weak-agi-bootstrap-skepticism",
      "layer": "position",
      "metadata": {
        "about": [
          "automated_alignment",
          "weak_agi"
        ],
        "attributed_to": [
          "akira"
        ],
        "basis_through": "2026-08-24",
        "id": "akira.weak-agi-bootstrap-skepticism",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "ai_development_pause",
          "artificial_general_intelligence",
          "artificial_superintelligence"
        ],
        "status": "reviewed"
      },
      "path": "documents/akira.weak-agi-bootstrap-skepticism.txt",
      "title": "弱AGIによる短期アラインメント・ブートストラップへの懐疑"
    },
    {
      "document_id": "position:betley_et_al.narrow-finetuning-can-produce-broad-misalignment",
      "layer": "position",
      "metadata": {
        "about": [
          "generalization",
          "misalignment"
        ],
        "attributed_to": [
          "betley_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "betley_et_al.narrow-finetuning-can-produce-broad-misalignment",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "distribution_shift",
          "prosaic_alignment",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/betley_et_al.narrow-finetuning-can-produce-broad-misalignment.txt",
      "title": "狭いタスクでファインチューニングしても、影響がそのタスク内に限られるとは限らない"
    },
    {
      "document_id": "position:bioshok.ai-race-pressure-can-undermine-safety-restraints",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_race_dynamics",
          "ai_safety"
        ],
        "attributed_to": [
          "bioshok"
        ],
        "basis_through": "2026-08-28",
        "id": "bioshok.ai-race-pressure-can-undermine-safety-restraints",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_existential_risk",
          "ai_governance",
          "artificial_general_intelligence"
        ],
        "status": "reviewed"
      },
      "path": "documents/bioshok.ai-race-pressure-can-undermine-safety-restraints.txt",
      "title": "AI開発競争の圧力は安全のための制約を弱め得る"
    },
    {
      "document_id": "position:bioshok.industrial-and-technology-explosions-reinforce-each-other",
      "layer": "position",
      "metadata": {
        "about": [
          "industrial_explosion",
          "technology_explosion"
        ],
        "attributed_to": [
          "bioshok"
        ],
        "basis_through": "2026-08-28",
        "id": "bioshok.industrial-and-technology-explosions-reinforce-each-other",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "artificial_general_intelligence"
        ],
        "status": "reviewed"
      },
      "path": "documents/bioshok.industrial-and-technology-explosions-reinforce-each-other.txt",
      "title": "産業爆発と技術爆発は互いを加速し得る"
    },
    {
      "document_id": "position:bostrom.instrumental-convergence-predicts-common-subgoals-across-many-final-goals",
      "layer": "position",
      "metadata": {
        "about": [
          "instrumental_convergence"
        ],
        "attributed_to": [
          "bostrom"
        ],
        "basis_through": "2026-08-29",
        "id": "bostrom.instrumental-convergence-predicts-common-subgoals-across-many-final-goals",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "artificial_superintelligence",
          "instrumental_goal",
          "orthogonality_thesis",
          "resource_acquisition",
          "self_preservation",
          "terminal_goal"
        ],
        "status": "reviewed"
      },
      "path": "documents/bostrom.instrumental-convergence-predicts-common-subgoals-across-many-final-goals.txt",
      "title": "最終目標が大きく異なっても、共通の道具的目標が生じやすい"
    },
    {
      "document_id": "position:bostrom.orthogonality-separates-intelligence-from-final-goals",
      "layer": "position",
      "metadata": {
        "about": [
          "orthogonality_thesis"
        ],
        "attributed_to": [
          "bostrom"
        ],
        "basis_through": "2026-08-29",
        "id": "bostrom.orthogonality-separates-intelligence-from-final-goals",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "artificial_superintelligence",
          "capability",
          "human_values",
          "instrumental_convergence",
          "terminal_goal"
        ],
        "status": "reviewed"
      },
      "path": "documents/bostrom.orthogonality-separates-intelligence-from-final-goals.txt",
      "title": "知能水準と最終目標は、原理上ほぼ独立である"
    },
    {
      "document_id": "position:bowkis_et_al.automated-alignment-can-fail-without-deliberate-sabotage",
      "layer": "position",
      "metadata": {
        "about": [
          "alignment_failure",
          "automated_alignment"
        ],
        "attributed_to": [
          "bowkis_et_al"
        ],
        "basis_through": "2026-08-29",
        "id": "bowkis_et_al.automated-alignment-can-fail-without-deliberate-sabotage",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "artificial_superintelligence",
          "evaluation",
          "generalization",
          "misaligned_ai",
          "safety_case",
          "scalable_oversight",
          "scheming"
        ],
        "status": "reviewed"
      },
      "path": "documents/bowkis_et_al.automated-alignment-can-fail-without-deliberate-sabotage.txt",
      "title": "アラインメント研究の自動化は、研究AIが意図的に妨害しなくても失敗し得る"
    },
    {
      "document_id": "position:bowkis_et_al.shared-training-can-correlate-automated-research-errors",
      "layer": "position",
      "metadata": {
        "about": [
          "automated_alignment"
        ],
        "attributed_to": [
          "bowkis_et_al"
        ],
        "basis_through": "2026-08-29",
        "id": "bowkis_et_al.shared-training-can-correlate-automated-research-errors",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "safety_case",
          "scalable_oversight",
          "scheming",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/bowkis_et_al.shared-training-can-correlate-automated-research-errors.txt",
      "title": "共通の重み・データ・訓練過程を持つ研究AIでは、研究結果の誤りや不確実性が相関し得る"
    },
    {
      "document_id": "position:carlsmith.scheming-taxonomy-and-situational-awareness",
      "layer": "position",
      "metadata": {
        "about": [
          "goal_guarding_scheming",
          "scheming",
          "situational_awareness"
        ],
        "attributed_to": [
          "carlsmith"
        ],
        "basis_through": "2026-08-27",
        "id": "carlsmith.scheming-taxonomy-and-situational-awareness",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "alignment_faking",
          "deceptive_alignment",
          "instrumental_convergence",
          "power_seeking",
          "reward",
          "training",
          "training_gaming"
        ],
        "status": "reviewed"
      },
      "path": "documents/carlsmith.scheming-taxonomy-and-situational-awareness.txt",
      "title": "スキーミングとは、状況認識を伴う training-gaming のうち、将来のパワー獲得を目的とするもの"
    },
    {
      "document_id": "position:chanin_et_al.monosemantic-sae-features-can-have-systematic-false-negatives",
      "layer": "position",
      "metadata": {
        "about": [
          "mechanistic_interpretability"
        ],
        "attributed_to": [
          "chanin_et_al"
        ],
        "basis_through": "2026-08-29",
        "id": "chanin_et_al.monosemantic-sae-features-can-have-systematic-false-negatives",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "interpretability"
        ],
        "status": "reviewed"
      },
      "path": "documents/chanin_et_al.monosemantic-sae-features-can-have-systematic-false-negatives.txt",
      "title": "一見 monosemantic な SAE latent でも、本来発火すべき入力を取りこぼすことがある"
    },
    {
      "document_id": "position:christiano.doom-is-serious-but-not-modal",
      "layer": "position",
      "metadata": {
        "about": [
          "p_doom"
        ],
        "attributed_to": [
          "christiano"
        ],
        "basis_through": "2026-08-25",
        "id": "christiano.doom-is-serious-but-not-modal",
        "kind": "prediction",
        "language": "ja",
        "mentions": [
          "ai_existential_risk",
          "catastrophic_risk",
          "loss_of_control",
          "risk"
        ],
        "status": "reviewed"
      },
      "path": "documents/christiano.doom-is-serious-but-not-modal.txt",
      "title": "「doom」を単一確率に畳まず、複数の重大なリスクを区別して見積もる"
    },
    {
      "document_id": "position:christiano.gradual-progress-and-policy-response",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_governance",
          "recursive_self_improvement"
        ],
        "attributed_to": [
          "christiano"
        ],
        "basis_through": "2026-08-24",
        "id": "christiano.gradual-progress-and-policy-response",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "ai_existential_risk",
          "alignment_problem",
          "automated_alignment",
          "first_critical_try",
          "pivotal_act",
          "takeoff_speed"
        ],
        "status": "reviewed"
      },
      "path": "documents/christiano.gradual-progress-and-policy-response.txt",
      "title": "Yudkowsky との相違は、危険に至る経路とそれまでに取れる対応の見通しにある"
    },
    {
      "document_id": "position:christiano.high-ai-disempowerment-risk",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_existential_risk",
          "loss_of_control"
        ],
        "attributed_to": [
          "christiano"
        ],
        "basis_through": "2026-08-24",
        "id": "christiano.high-ai-disempowerment-risk",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "catastrophic_risk"
        ],
        "status": "reviewed"
      },
      "path": "documents/christiano.high-ai-disempowerment-risk.txt",
      "title": "強力なAIが人類から不可逆的に支配権を奪う展開には相当な可能性がある"
    },
    {
      "document_id": "position:christiano.optimizing-measurable-proxies-can-cause-gradual-disempowerment",
      "layer": "position",
      "metadata": {
        "about": [
          "loss_of_control",
          "misalignment",
          "outer_misalignment",
          "proxy_objective"
        ],
        "attributed_to": [
          "christiano"
        ],
        "basis_through": "2026-08-27",
        "id": "christiano.optimizing-measurable-proxies-can-cause-gradual-disempowerment",
        "kind": "position",
        "language": "ja",
        "status": "reviewed"
      },
      "path": "documents/christiano.optimizing-measurable-proxies-can-cause-gradual-disempowerment.txt",
      "title": "測定しやすい代理指標の最適化により、人間は単一の支配シフトを経ずとも徐々に制御を失い得る"
    },
    {
      "document_id": "position:christiano.slow-takeoff-allows-large-pre-superintelligence-effects",
      "layer": "position",
      "metadata": {
        "about": [
          "takeoff_speed"
        ],
        "attributed_to": [
          "christiano"
        ],
        "basis_through": "2026-08-27",
        "id": "christiano.slow-takeoff-allows-large-pre-superintelligence-effects",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "intelligence_explosion",
          "recursive_self_improvement",
          "technology_explosion"
        ],
        "status": "reviewed"
      },
      "path": "documents/christiano.slow-takeoff-allows-large-pre-superintelligence-effects.txt",
      "title": "スローテイクオフでは、超知能より前の AI がすでに世界を大きく変える"
    },
    {
      "document_id": "position:christiano_xu.elk-requires-bridging-model-and-human-ontologies",
      "layer": "position",
      "metadata": {
        "about": [
          "eliciting_latent_knowledge",
          "latent_knowledge",
          "ontology_identification_problem",
          "world_model"
        ],
        "attributed_to": [
          "christiano",
          "xu"
        ],
        "basis_through": "2026-08-27",
        "id": "christiano_xu.elk-requires-bridging-model-and-human-ontologies",
        "kind": "position",
        "language": "ja",
        "status": "reviewed"
      },
      "path": "documents/christiano_xu.elk-requires-bridging-model-and-human-ontologies.txt",
      "title": "ELK の中心課題は AI と人間のオントロジーを橋渡しすることである"
    },
    {
      "document_id": "position:cihon_et_al.centralizing-ai-governance-has-benefits-and-drawbacks",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_governance",
          "power_concentration"
        ],
        "attributed_to": [
          "cihon_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "cihon_et_al.centralizing-ai-governance-has-benefits-and-drawbacks",
        "kind": "position",
        "language": "ja",
        "status": "reviewed"
      },
      "path": "documents/cihon_et_al.centralizing-ai-governance-has-benefits-and-drawbacks.txt",
      "title": "AI ガバナンスの集中化には利点と欠点があり、制度設計が結果を左右する"
    },
    {
      "document_id": "position:cotra.crunch-time-redirect-ai-labor-and-slow-transition",
      "layer": "position",
      "metadata": {
        "about": [
          "crunch_time"
        ],
        "attributed_to": [
          "cotra"
        ],
        "basis_through": "2026-08-28",
        "id": "cotra.crunch-time-redirect-ai-labor-and-slow-transition",
        "kind": "proposal",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "ai_control",
          "ai_development_pause",
          "ai_governance",
          "ai_r_and_d_automation",
          "artificial_superintelligence",
          "automated_alignment",
          "intelligence_explosion",
          "recursive_self_improvement",
          "takeoff_speed"
        ],
        "status": "reviewed"
      },
      "path": "documents/cotra.crunch-time-redirect-ai-labor-and-slow-transition.txt",
      "title": "クランチタイムではAIの労働力を防御用途に振り向け、移行を大幅に遅らせる"
    },
    {
      "document_id": "position:davidson.agi-to-superintelligence-may-be-under-one-year",
      "layer": "position",
      "metadata": {
        "about": [
          "artificial_superintelligence",
          "takeoff_speed"
        ],
        "attributed_to": [
          "davidson"
        ],
        "basis_through": "2026-08-28",
        "id": "davidson.agi-to-superintelligence-may-be-under-one-year",
        "kind": "prediction",
        "language": "ja",
        "mentions": [
          "ai_r_and_d_automation",
          "artificial_general_intelligence",
          "recursive_self_improvement"
        ],
        "status": "reviewed"
      },
      "path": "documents/davidson.agi-to-superintelligence-may-be-under-one-year.txt",
      "title": "AI 研究開発に大量の AI 労働力を投入できれば、AGI から超知能への移行は 1 年未満になり得る"
    },
    {
      "document_id": "position:davidson.ai-r-and-d-automation-can-compress-capabilities-takeoff",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_r_and_d_automation",
          "takeoff_speed"
        ],
        "attributed_to": [
          "davidson"
        ],
        "basis_through": "2026-08-28",
        "id": "davidson.ai-r-and-d-automation-can-compress-capabilities-takeoff",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "artificial_general_intelligence",
          "recursive_self_improvement"
        ],
        "status": "reviewed"
      },
      "path": "documents/davidson.ai-r-and-d-automation-can-compress-capabilities-takeoff.txt",
      "title": "AI 研究開発が先行して自動化されると、能力離陸の期間は大幅に短縮される可能性がある"
    },
    {
      "document_id": "position:engels_et_al.recursive-oversight-does-not-automatically-scale-across-capability-gaps",
      "layer": "position",
      "metadata": {
        "about": [
          "scalable_oversight"
        ],
        "attributed_to": [
          "engels_et_al"
        ],
        "basis_through": "2026-08-29",
        "id": "engels_et_al.recursive-oversight-does-not-automatically-scale-across-capability-gaps",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "capability",
          "oversight"
        ],
        "status": "reviewed"
      },
      "path": "documents/engels_et_al.recursive-oversight-does-not-automatically-scale-across-capability-gaps.txt",
      "title": "再帰的な oversight を重ねても、能力差が広がってなお成功率を維持できるとは限らない"
    },
    {
      "document_id": "position:erdil_barnett.ai-r-and-d-automation-alone-may-hit-compute-bottlenecks",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_r_and_d_automation",
          "intelligence_explosion",
          "recursive_self_improvement"
        ],
        "attributed_to": [
          "barnett",
          "erdil"
        ],
        "basis_through": "2026-08-28",
        "id": "erdil_barnett.ai-r-and-d-automation-alone-may-hit-compute-bottlenecks",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "takeoff_speed"
        ],
        "status": "reviewed"
      },
      "path": "documents/erdil_barnett.ai-r-and-d-automation-alone-may-hit-compute-bottlenecks.txt",
      "title": "AI 研究開発の自動化だけによる自己加速は、実験用計算資源がボトルネックとなって頭打ちになる可能性がある"
    },
    {
      "document_id": "position:erdil_barnett.full-r-and-d-automation-likely-follows-broad-automation",
      "layer": "position",
      "metadata": {
        "about": [
          "takeoff_speed"
        ],
        "attributed_to": [
          "barnett",
          "erdil"
        ],
        "basis_through": "2026-08-28",
        "id": "erdil_barnett.full-r-and-d-automation-likely-follows-broad-automation",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_r_and_d_automation",
          "recursive_self_improvement",
          "technology_explosion"
        ],
        "status": "reviewed"
      },
      "path": "documents/erdil_barnett.full-r-and-d-automation-likely-follows-broad-automation.txt",
      "title": "R&D の全面自動化が、経済全体の広範な自動化に大きく先行する可能性は低いかもしれない"
    },
    {
      "document_id": "position:eth_davidson.software-intelligence-explosion-remains-plausible-at-fixed-hardware",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_r_and_d_automation",
          "intelligence_explosion",
          "recursive_self_improvement"
        ],
        "attributed_to": [
          "davidson",
          "eth"
        ],
        "basis_through": "2026-08-28",
        "id": "eth_davidson.software-intelligence-explosion-remains-plausible-at-fixed-hardware",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "takeoff_speed"
        ],
        "status": "reviewed"
      },
      "path": "documents/eth_davidson.software-intelligence-explosion-remains-plausible-at-fixed-hardware.txt",
      "title": "AI 研究開発が全面自動化されれば、ハードウェアを増強しなくてもソフトウェア知能爆発は十分に起こり得るかもしれない"
    },
    {
      "document_id": "position:eth_davidson.software-intelligence-fizzle-can-still-be-fast",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_r_and_d_automation",
          "intelligence_explosion",
          "takeoff_speed"
        ],
        "attributed_to": [
          "davidson",
          "eth"
        ],
        "basis_through": "2026-08-28",
        "id": "eth_davidson.software-intelligence-fizzle-can-still-be-fast",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "recursive_self_improvement"
        ],
        "status": "reviewed"
      },
      "path": "documents/eth_davidson.software-intelligence-fizzle-can-still-be-fast.txt",
      "title": "AI 研究開発の全面自動化後は、ソフトウェア知能爆発に至らなくても、しばらく非常に速い進歩が続き得る"
    },
    {
      "document_id": "position:greenblatt.control-can-buy-time-but-is-not-a-superintelligence-safety-plan",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_control",
          "artificial_superintelligence"
        ],
        "attributed_to": [
          "greenblatt"
        ],
        "basis_through": "2026-08-27",
        "id": "greenblatt.control-can-buy-time-but-is-not-a-superintelligence-safety-plan",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "ai_r_and_d_automation",
          "loss_of_control",
          "reward_hacking",
          "scheming",
          "specification_gaming",
          "takeover_seeking"
        ],
        "status": "reviewed"
      },
      "path": "documents/greenblatt.control-can-buy-time-but-is-not-a-superintelligence-safety-plan.txt",
      "title": "AIコントロールは時間を稼げても、超知能に対する長期的な安全計画としては頼れない"
    },
    {
      "document_id": "position:greenblatt.current-ai-misalignment-is-evidence-of-serious-future-problems",
      "layer": "position",
      "metadata": {
        "about": [
          "frontier_model",
          "misalignment"
        ],
        "attributed_to": [
          "greenblatt"
        ],
        "basis_through": "2026-08-27",
        "id": "greenblatt.current-ai-misalignment-is-evidence-of-serious-future-problems",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment"
        ],
        "status": "reviewed"
      },
      "path": "documents/greenblatt.current-ai-misalignment-is-evidence-of-serious-future-problems.txt",
      "title": "現在のAIに見られるミスアラインメントは、将来の深刻な問題を示唆する"
    },
    {
      "document_id": "position:greenblatt_et_al.training-compliance-does-not-establish-preference-change",
      "layer": "position",
      "metadata": {
        "about": [
          "alignment_faking",
          "preferences"
        ],
        "attributed_to": [
          "greenblatt_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "greenblatt_et_al.training-compliance-does-not-establish-preference-change",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "behavioral_objective",
          "deception",
          "prosaic_alignment",
          "reinforcement_learning_from_human_feedback",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/greenblatt_et_al.training-compliance-does-not-establish-preference-change.txt",
      "title": "訓練中に従うようになっただけでは、競合する選好が置き換わったとは言えない"
    },
    {
      "document_id": "position:hubinger_et_al.base-and-mesa-objectives-can-diverge",
      "layer": "position",
      "metadata": {
        "about": [
          "base_objective",
          "base_optimizer",
          "inner_alignment",
          "inner_misalignment",
          "mesa_objective",
          "mesa_optimizer",
          "outer_alignment",
          "outer_misalignment"
        ],
        "attributed_to": [
          "garrabrant",
          "hubinger",
          "mikulik",
          "skalse",
          "van_merwijk"
        ],
        "basis_through": "2026-08-27",
        "id": "hubinger_et_al.base-and-mesa-objectives-can-diverge",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "deceptive_alignment",
          "training_objective"
        ],
        "status": "reviewed"
      },
      "path": "documents/hubinger_et_al.base-and-mesa-objectives-can-diverge.txt",
      "title": "ベース目的関数とメサ目的関数は一致するとは限らない"
    },
    {
      "document_id": "position:hubinger_et_al.deceptive-policies-can-persist-through-safety-training",
      "layer": "position",
      "metadata": {
        "about": [
          "deceptive_alignment",
          "prosaic_alignment",
          "training"
        ],
        "attributed_to": [
          "hubinger_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "hubinger_et_al.deceptive-policies-can-persist-through-safety-training",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "deception",
          "reinforcement_learning"
        ],
        "status": "reviewed"
      },
      "path": "documents/hubinger_et_al.deceptive-policies-can-persist-through-safety-training.txt",
      "title": "既に形成された欺瞞的な方策は、標準的な安全性訓練を経ても残り得る"
    },
    {
      "document_id": "position:korbak_et_al.control-safety-cases-depend-on-elicitation-transfer-and-extrapolation",
      "layer": "position",
      "metadata": {
        "about": [
          "control_safety_case"
        ],
        "attributed_to": [
          "korbak_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "korbak_et_al.control-safety-cases-depend-on-elicitation-transfer-and-extrapolation",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_control",
          "capability_elicitation",
          "control_evaluation",
          "control_protocol",
          "distribution_shift",
          "safety_case",
          "sandbagging",
          "scheming"
        ],
        "status": "reviewed"
      },
      "path": "documents/korbak_et_al.control-safety-cases-depend-on-elicitation-transfer-and-extrapolation.txt",
      "title": "control safety caseには、能力の十分な引き出しと、評価・外挿の保守性が必要になる"
    },
    {
      "document_id": "position:leask_et_al.sae-dictionaries-need-not-be-canonical",
      "layer": "position",
      "metadata": {
        "about": [
          "mechanistic_interpretability"
        ],
        "attributed_to": [
          "leask_et_al"
        ],
        "basis_through": "2026-08-29",
        "id": "leask_et_al.sae-dictionaries-need-not-be-canonical",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "interpretability"
        ],
        "status": "reviewed"
      },
      "path": "documents/leask_et_al.sae-dictionaries-need-not-be-canonical.txt",
      "title": "SAE の辞書幅を大きくしても、一意・完全・不可分な feature 辞書に収束するとは限らない"
    },
    {
      "document_id": "position:macdiarmid_et_al.chat-alignment-does-not-establish-agentic-alignment",
      "layer": "position",
      "metadata": {
        "about": [
          "distribution_shift",
          "prosaic_alignment",
          "reinforcement_learning_from_human_feedback",
          "reward_hacking"
        ],
        "attributed_to": [
          "macdiarmid_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "macdiarmid_et_al.chat-alignment-does-not-establish-agentic-alignment",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "agent",
          "alignment_faking",
          "misalignment",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/macdiarmid_et_al.chat-alignment-does-not-establish-agentic-alignment.txt",
      "title": "チャット形式の安全性訓練で望ましく振る舞うことは、エージェント的な状況での安全性を保証しない"
    },
    {
      "document_id": "position:ngo_et_al.behavioral-training-does-not-establish-robust-goal-generalization",
      "layer": "position",
      "metadata": {
        "about": [
          "generalization",
          "goal_misgeneralization",
          "objective_robustness",
          "prosaic_alignment"
        ],
        "attributed_to": [
          "ngo_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "ngo_et_al.behavioral-training-does-not-establish-robust-goal-generalization",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "capability_generalization",
          "distribution_shift",
          "intended_goal",
          "reinforcement_learning_from_human_feedback",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/ngo_et_al.behavioral-training-does-not-establish-robust-goal-generalization.txt",
      "title": "行動訓練で望ましく振る舞っても、意図した目標の頑健な汎化は保証されない"
    },
    {
      "document_id": "position:openai.weak-to-strong-supervision-can-recover-some-latent-capability",
      "layer": "position",
      "metadata": {
        "about": [
          "weak_to_strong_generalization"
        ],
        "attributed_to": [
          "openai"
        ],
        "basis_through": "2026-08-27",
        "id": "openai.weak-to-strong-supervision-can-recover-some-latent-capability",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "capability_elicitation",
          "scalable_oversight"
        ],
        "status": "reviewed"
      },
      "path": "documents/openai.weak-to-strong-supervision-can-recover-some-latent-capability.txt",
      "title": "弱い監視者でも、強いモデルの潜在能力の一部を引き出せる場合がある"
    },
    {
      "document_id": "position:sastry_et_al.compute-governance-can-create-centralization-risks",
      "layer": "position",
      "metadata": {
        "about": [
          "compute_governance",
          "power_concentration"
        ],
        "attributed_to": [
          "sastry_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "sastry_et_al.compute-governance-can-create-centralization-risks",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_governance"
        ],
        "status": "reviewed"
      },
      "path": "documents/sastry_et_al.compute-governance-can-create-centralization-risks.txt",
      "title": "コンピュート・ガバナンスは有力な政策手段だが、権力集中のリスクも生む"
    },
    {
      "document_id": "position:scher_et_al.asi-pause-agreement-is-technically-specified-but-politically-unrealized",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_development_pause",
          "ai_governance"
        ],
        "attributed_to": [
          "scher_et_al"
        ],
        "basis_through": "2026-08-28",
        "id": "scher_et_al.asi-pause-agreement-is-technically-specified-but-politically-unrealized",
        "kind": "proposal",
        "language": "ja",
        "mentions": [
          "ai_race_dynamics",
          "artificial_superintelligence",
          "compute_governance"
        ],
        "status": "reviewed"
      },
      "path": "documents/scher_et_al.asi-pause-agreement-is-technically-specified-but-politically-unrealized.txt",
      "title": "ASI の開発停止に向けた国際協定は技術的には具体化できるが、政治的条件がまだ整っていない"
    },
    {
      "document_id": "position:soares.sharp-left-turn",
      "layer": "position",
      "metadata": {
        "about": [
          "capability_generalization",
          "sharp_left_turn"
        ],
        "attributed_to": [
          "soares"
        ],
        "basis_through": "2026-08-25",
        "id": "soares.sharp-left-turn",
        "kind": "prediction",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "corrigibility",
          "distribution_shift",
          "generalization",
          "optimization"
        ],
        "status": "reviewed"
      },
      "path": "documents/soares.sharp-left-turn.txt",
      "title": "能力が訓練分布の外へ急速に汎化する局面で、アラインメント特性は同程度には汎化しない可能性がある"
    },
    {
      "document_id": "position:turner.optimal-policies-tend-to-seek-power",
      "layer": "position",
      "metadata": {
        "about": [
          "power_seeking"
        ],
        "attributed_to": [
          "critch",
          "shah",
          "smith",
          "tadepalli",
          "turner"
        ],
        "basis_through": "2026-08-27",
        "id": "turner.optimal-policies-tend-to-seek-power",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "instrumental_convergence",
          "reinforcement_learning",
          "resource_acquisition",
          "self_preservation"
        ],
        "status": "reviewed"
      },
      "path": "documents/turner.optimal-policies-tend-to-seek-power.txt",
      "title": "環境に対称性があると、最適方策は選択肢を保つ方向の power-seeking に傾く"
    },
    {
      "document_id": "position:yang_et_al.weak-to-strong-success-can-hide-selective-misalignment",
      "layer": "position",
      "metadata": {
        "about": [
          "weak_to_strong_generalization"
        ],
        "attributed_to": [
          "yang_et_al"
        ],
        "basis_through": "2026-08-29",
        "id": "yang_et_al.weak-to-strong-success-can-hide-selective-misalignment",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "capability",
          "scalable_oversight"
        ],
        "status": "reviewed"
      },
      "path": "documents/yang_et_al.weak-to-strong-success-can-hide-selective-misalignment.txt",
      "title": "weak-to-strong で高い性能が出ても、弱い supervisor が知らない領域で alignment が保たれるとは限らない"
    },
    {
      "document_id": "position:yudkowsky.alignment-must-generalize-across-the-dangerous-distribution-shift",
      "layer": "position",
      "metadata": {
        "about": [
          "distribution_shift"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-28",
        "id": "yudkowsky.alignment-must-generalize-across-the-dangerous-distribution-shift",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "artificial_superintelligence",
          "evaluation",
          "evaluation_awareness",
          "first_critical_try",
          "generalization"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.alignment-must-generalize-across-the-dangerous-distribution-shift.txt",
      "title": "アラインメントは、失敗が致命的になる分布シフト後にも汎化しなければならない"
    },
    {
      "document_id": "position:yudkowsky.capabilities-generalize-beyond-alignment",
      "layer": "position",
      "metadata": {
        "about": [
          "capability_generalization"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-24",
        "id": "yudkowsky.capabilities-generalize-beyond-alignment",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "distribution_shift",
          "generalization",
          "human_values",
          "inner_alignment",
          "optimization"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.capabilities-generalize-beyond-alignment.txt",
      "title": "能力はアラインメントより遠くまで汎化しうる"
    },
    {
      "document_id": "position:yudkowsky.capability-motive-separation",
      "layer": "position",
      "metadata": {
        "about": [
          "capability",
          "orthogonality_thesis"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-24",
        "id": "yudkowsky.capability-motive-separation",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "generalization",
          "goal",
          "human_values",
          "inner_alignment",
          "optimization"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.capability-motive-separation.txt",
      "title": "能力と目的は別の軸である"
    },
    {
      "document_id": "position:yudkowsky.cev-sovereign-vs-corrigible-agi",
      "layer": "position",
      "metadata": {
        "about": [
          "coherent_extrapolated_volition",
          "corrigibility"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-24",
        "id": "yudkowsky.cev-sovereign-vs-corrigible-agi",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "alignment_target",
          "artificial_general_intelligence",
          "human_values",
          "instrumental_convergence"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.cev-sovereign-vs-corrigible-agi.txt",
      "title": "CEV 型 Sovereign と訂正可能な AGI は異なる安全化戦略である"
    },
    {
      "document_id": "position:yudkowsky.corrigibility-is-anti-natural",
      "layer": "position",
      "metadata": {
        "about": [
          "corrigibility"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-24",
        "id": "yudkowsky.corrigibility-is-anti-natural",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "distribution_shift",
          "generalization",
          "instrumental_convergence",
          "optimization",
          "self_preservation"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.corrigibility-is-anti-natural.txt",
      "title": "訂正可能性は一般的な目標追求から自然には生じない"
    },
    {
      "document_id": "position:yudkowsky.first-critical-try",
      "layer": "position",
      "metadata": {
        "about": [
          "first_critical_try"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-24",
        "id": "yudkowsky.first-critical-try",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_existential_risk",
          "alignment_problem",
          "artificial_general_intelligence",
          "capability_threshold",
          "catastrophic_risk",
          "misaligned_agi"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.first-critical-try.txt",
      "title": "アラインメントは最初の危険な試行で成功する必要がある"
    },
    {
      "document_id": "position:yudkowsky.international-compute-shutdown-and-enforcement",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_development_pause",
          "compute_governance"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-28",
        "id": "yudkowsky.international-compute-shutdown-and-enforcement",
        "kind": "proposal",
        "language": "ja",
        "mentions": [
          "ai_existential_risk",
          "ai_governance",
          "ai_race_dynamics",
          "artificial_superintelligence",
          "first_critical_try"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.international-compute-shutdown-and-enforcement.txt",
      "title": "Yudkowskyによる \"大規模なAI学習を世界規模で無期限に停止し、計算資源規制を国際的に執行する案\""
    },
    {
      "document_id": "position:yudkowsky.interpretability-is-diagnostic-not-by-itself-an-alignment-solution",
      "layer": "position",
      "metadata": {
        "about": [
          "interpretability"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-28",
        "id": "yudkowsky.interpretability-is-diagnostic-not-by-itself-an-alignment-solution",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "deception",
          "mechanistic_interpretability",
          "optimization",
          "oversight",
          "training"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.interpretability-is-diagnostic-not-by-itself-an-alignment-solution.txt",
      "title": "解釈可能性は危険の診断に役立っても、それだけでアラインメントの解決策にはならない"
    },
    {
      "document_id": "position:yudkowsky.no-reliable-social-fire-alarm-precedes-agi",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_alignment",
          "artificial_general_intelligence"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-29",
        "id": "yudkowsky.no-reliable-social-fire-alarm-precedes-agi",
        "kind": "prediction",
        "language": "ja",
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.no-reliable-social-fire-alarm-precedes-agi.txt",
      "title": "AGIの前に、誰もが認める明確な「火災報知器」が鳴るとは期待できない"
    },
    {
      "document_id": "position:yudkowsky.observed-compliance-does-not-identify-hidden-objectives",
      "layer": "position",
      "metadata": {
        "about": [
          "deception",
          "inner_alignment"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-28",
        "id": "yudkowsky.observed-compliance-does-not-identify-hidden-objectives",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "behavioral_objective",
          "evaluation_awareness",
          "goal"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.observed-compliance-does-not-identify-hidden-objectives.txt",
      "title": "観測された従順さだけでは、内部の目的や欺瞞の有無までは分からない"
    },
    {
      "document_id": "position:yudkowsky.outer-objective-does-not-determine-inner-goal",
      "layer": "position",
      "metadata": {
        "about": [
          "inner_alignment",
          "training_objective"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-24",
        "id": "yudkowsky.outer-objective-does-not-determine-inner-goal",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "distribution_shift",
          "goal",
          "objective",
          "optimization"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.outer-objective-does-not-determine-inner-goal.txt",
      "title": "外部の目的関数は内部の目標を決定しない"
    },
    {
      "document_id": "position:yudkowsky.pivotal-act-requires-aligning-a-system-capable-of-a-large-intervention",
      "layer": "position",
      "metadata": {
        "about": [
          "pivotal_act"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-28",
        "id": "yudkowsky.pivotal-act-requires-aligning-a-system-capable-of-a-large-intervention",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "ai_existential_risk",
          "artificial_general_intelligence",
          "capability"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.pivotal-act-requires-aligning-a-system-capable-of-a-large-intervention.txt",
      "title": "pivotal actには、世界を大きく変えられるほど強いシステムのアラインメントが必要になる"
    },
    {
      "document_id": "position:yudkowsky.recursive-self-improvement-can-produce-intelligence-explosion",
      "layer": "position",
      "metadata": {
        "about": [
          "intelligence_explosion",
          "recursive_self_improvement"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-27",
        "id": "yudkowsky.recursive-self-improvement-can-produce-intelligence-explosion",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "takeoff_speed"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.recursive-self-improvement-can-produce-intelligence-explosion.txt",
      "title": "再帰的自己改善は、自己改善能力への正のフィードバックを通じて知能爆発を起こし得る"
    },
    {
      "document_id": "position:yudkowsky.resource-abundance-does-not-remove-conflict",
      "layer": "position",
      "metadata": {
        "about": [
          "resource_acquisition"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-25",
        "id": "yudkowsky.resource-abundance-does-not-remove-conflict",
        "kind": "critique",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "artificial_superintelligence",
          "optimization"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.resource-abundance-does-not-remove-conflict.txt",
      "title": "資源が豊富であることだけから、アンアラインドな超知能が人類のために資源を残すとは推論できない"
    },
    {
      "document_id": "position:yudkowsky.security-mindset-for-alignment",
      "layer": "position",
      "metadata": {
        "about": [
          "security_mindset"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-25",
        "id": "yudkowsky.security-mindset-for-alignment",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "ai_alignment",
          "alignment_problem",
          "optimization"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.security-mindset-for-alignment.txt",
      "title": "アラインメントのような新規かつ高リスクなシステムの設計には、既知の失敗を塞ぐ以上の security mindset が必要である"
    },
    {
      "document_id": "position:yudkowsky.superhuman-ai-under-current-conditions-would-likely-cause-extinction",
      "layer": "position",
      "metadata": {
        "about": [
          "ai_existential_risk"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-28",
        "id": "yudkowsky.superhuman-ai-under-current-conditions-would-likely-cause-extinction",
        "kind": "prediction",
        "language": "ja",
        "mentions": [
          "alignment_problem",
          "artificial_superintelligence",
          "first_critical_try",
          "misaligned_ai"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.superhuman-ai-under-current-conditions-would-likely-cause-extinction.txt",
      "title": "現在と大きく変わらない条件で人間を上回るAIを作れば、人類絶滅が最も可能性の高い結果となる"
    },
    {
      "document_id": "position:yudkowsky.value-fragility",
      "layer": "position",
      "metadata": {
        "about": [
          "value_fragility",
          "values"
        ],
        "attributed_to": [
          "yudkowsky"
        ],
        "basis_through": "2026-08-25",
        "id": "yudkowsky.value-fragility",
        "kind": "position",
        "language": "ja",
        "mentions": [
          "goal",
          "human_values",
          "optimization"
        ],
        "status": "reviewed"
      },
      "path": "documents/yudkowsky.value-fragility.txt",
      "title": "人間にとって価値ある未来は、価値体系の一部を欠くだけでも大きく損なわれ得る"
    },
    {
      "document_id": "source:agi_hub.pdoom-debate-1-transcript",
      "layer": "source",
      "metadata": {
        "authors": [
          "AGI Hub",
          "SafeSingularity"
        ],
        "citation": {
          "locator_schemes": [
            "time"
          ]
        },
        "id": "agi_hub.pdoom-debate-1-transcript",
        "kind": "transcript",
        "language": "ja",
        "published_at": "2026-08-14",
        "representation": {
          "method": "automated_transcript",
          "notes": "Timestamped automated transcript. Speaker labels are useful but transcription errors and label mix-ups remain possible.",
          "verified": false
        },
        "title": "Bioshok vs Akira P(doom)徹底討論書き起こし(修正なし全文)",
        "url": "https://note.com/agi_hub/n/nf213649b7943"
      },
      "path": "sources/agi_hub.pdoom-debate-1-transcript.txt",
      "title": "Bioshok vs Akira P(doom)徹底討論書き起こし(修正なし全文)"
    },
    {
      "document_id": "source:akira.x.2055116276960559467",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2055116276960559467",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-15",
        "title": "X @Align_ASI post 2055116276960559467",
        "url": "https://x.com/Align_ASI/status/2055116276960559467"
      },
      "path": "sources/akira.x.2055116276960559467.txt",
      "title": "X @Align_ASI post 2055116276960559467"
    },
    {
      "document_id": "source:akira.x.2055116279485489376",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2055116279485489376",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-15",
        "title": "X @Align_ASI post 2055116279485489376",
        "url": "https://x.com/Align_ASI/status/2055116279485489376"
      },
      "path": "sources/akira.x.2055116279485489376.txt",
      "title": "X @Align_ASI post 2055116279485489376"
    },
    {
      "document_id": "source:akira.x.2055121067929489784",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2055121067929489784",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-15",
        "title": "X @Align_ASI post 2055121067929489784",
        "url": "https://x.com/Align_ASI/status/2055121067929489784"
      },
      "path": "sources/akira.x.2055121067929489784.txt",
      "title": "X @Align_ASI post 2055121067929489784"
    },
    {
      "document_id": "source:akira.x.2055466196200505634",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2055466196200505634",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-16",
        "title": "X @Align_ASI post 2055466196200505634",
        "url": "https://x.com/Align_ASI/status/2055466196200505634"
      },
      "path": "sources/akira.x.2055466196200505634.txt",
      "title": "X @Align_ASI post 2055466196200505634"
    },
    {
      "document_id": "source:akira.x.2055571488686674072",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2055571488686674072",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-16",
        "title": "X @Align_ASI post 2055571488686674072",
        "url": "https://x.com/Align_ASI/status/2055571488686674072"
      },
      "path": "sources/akira.x.2055571488686674072.txt",
      "title": "X @Align_ASI post 2055571488686674072"
    },
    {
      "document_id": "source:akira.x.2056249992826982411",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2056249992826982411",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-18",
        "title": "X @Align_ASI post 2056249992826982411",
        "url": "https://x.com/Align_ASI/status/2056249992826982411"
      },
      "path": "sources/akira.x.2056249992826982411.txt",
      "title": "X @Align_ASI post 2056249992826982411"
    },
    {
      "document_id": "source:akira.x.2056298561248039229",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2056298561248039229",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-18",
        "title": "X @Align_ASI post 2056298561248039229",
        "url": "https://x.com/Align_ASI/status/2056298561248039229"
      },
      "path": "sources/akira.x.2056298561248039229.txt",
      "title": "X @Align_ASI post 2056298561248039229"
    },
    {
      "document_id": "source:akira.x.2056306172353991103",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2056306172353991103",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-18",
        "title": "X @Align_ASI post 2056306172353991103",
        "url": "https://x.com/Align_ASI/status/2056306172353991103"
      },
      "path": "sources/akira.x.2056306172353991103.txt",
      "title": "X @Align_ASI post 2056306172353991103"
    },
    {
      "document_id": "source:akira.x.2056653057535205557",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2056653057535205557",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-19",
        "title": "X @Align_ASI post 2056653057535205557",
        "url": "https://x.com/Align_ASI/status/2056653057535205557"
      },
      "path": "sources/akira.x.2056653057535205557.txt",
      "title": "X @Align_ASI post 2056653057535205557"
    },
    {
      "document_id": "source:akira.x.2056653932890583189",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2056653932890583189",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-19",
        "title": "X @Align_ASI post 2056653932890583189",
        "url": "https://x.com/Align_ASI/status/2056653932890583189"
      },
      "path": "sources/akira.x.2056653932890583189.txt",
      "title": "X @Align_ASI post 2056653932890583189"
    },
    {
      "document_id": "source:akira.x.2056760361928519950",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2056760361928519950",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-05-19",
        "title": "X @Align_ASI post 2056760361928519950",
        "url": "https://x.com/Align_ASI/status/2056760361928519950"
      },
      "path": "sources/akira.x.2056760361928519950.txt",
      "title": "X @Align_ASI post 2056760361928519950"
    },
    {
      "document_id": "source:akira.x.2087017636877996133",
      "layer": "source",
      "metadata": {
        "authors": [
          "Akira (@Align_ASI)"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "akira.x.2087017636877996133",
        "kind": "social_post",
        "language": "ja",
        "published_at": "2026-08-11",
        "title": "X @Align_ASI post 2087017636877996133",
        "url": "https://x.com/Align_ASI/status/2087017636877996133"
      },
      "path": "sources/akira.x.2087017636877996133.txt",
      "title": "X @Align_ASI post 2087017636877996133"
    },
    {
      "document_id": "source:bensinger_et_al.the-problem",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://intelligence.org/the-problem/"
        ],
        "authors": [
          "Rob Bensinger",
          "tanagrabeast",
          "yams",
          "So8res",
          "Eliezer Yudkowsky",
          "Gretta Duleba"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "bensinger_et_al.the-problem",
        "kind": "essay",
        "language": "en",
        "published_at": "2025-08-05",
        "title": "The Problem",
        "url": "https://www.lesswrong.com/posts/kgb58RL88YChkkBNf/the-problem"
      },
      "path": "sources/bensinger_et_al.the-problem.txt",
      "title": "The Problem"
    },
    {
      "document_id": "source:betley_et_al.emergent-misalignment",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2502.17424",
          "https://arxiv.org/pdf/2502.17424"
        ],
        "authors": [
          "Jan Betley",
          "Daniel Tan",
          "Niels Warncke",
          "Anna Sztyber-Betley",
          "Xuchan Bao",
          "Martín Soto",
          "Nathan Labenz",
          "Owain Evans"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "betley_et_al.emergent-misalignment",
        "kind": "paper",
        "language": "en",
        "published_at": "2025-02-24",
        "title": "Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs",
        "url": "https://arxiv.org/html/2502.17424"
      },
      "path": "sources/betley_et_al.emergent-misalignment.txt",
      "title": "Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs"
    },
    {
      "document_id": "source:bioshok.agi-industrial-tech-explosion",
      "layer": "source",
      "metadata": {
        "authors": [
          "bioshok"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "bioshok.agi-industrial-tech-explosion",
        "kind": "article",
        "language": "ja",
        "published_at": "2026-03-24",
        "title": "AGIがもたらす産業・技術爆発",
        "url": "https://note.com/bioshok/n/n57f81d4fb9d7"
      },
      "path": "sources/bioshok.agi-industrial-tech-explosion.txt",
      "title": "AGIがもたらす産業・技術爆発"
    },
    {
      "document_id": "source:bioshok.ai-safety-vs-national-security",
      "layer": "source",
      "metadata": {
        "authors": [
          "bioshok"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "bioshok.ai-safety-vs-national-security",
        "kind": "article",
        "language": "ja",
        "published_at": "2024-09-29",
        "title": "AI安全性と国家安全保障の対立",
        "url": "https://note.com/bioshok/n/n87c7434a623f"
      },
      "path": "sources/bioshok.ai-safety-vs-national-security.txt",
      "title": "AI安全性と国家安全保障の対立"
    },
    {
      "document_id": "source:bostrom.superintelligent-will",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://doi.org/10.1007/s11023-012-9281-3",
          "https://link.springer.com/article/10.1007/s11023-012-9281-3"
        ],
        "authors": [
          "Nick Bostrom"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "bostrom.superintelligent-will",
        "kind": "paper",
        "language": "en",
        "published_at": "2012-06-13",
        "title": "The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial Agents",
        "url": "https://nickbostrom.com/superintelligentwill.pdf"
      },
      "path": "sources/bostrom.superintelligent-will.txt",
      "title": "The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial Agents"
    },
    {
      "document_id": "source:bowkis_et_al.automated-alignment-harder-than-you-think",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2605.06390",
          "https://arxiv.org/pdf/2605.06390"
        ],
        "authors": [
          "Aleksandr Bowkis",
          "Marie Davidsen Buhl",
          "Jacob Pfau",
          "Geoffrey Irving"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "bowkis_et_al.automated-alignment-harder-than-you-think",
        "kind": "paper",
        "language": "en",
        "published_at": "2026-05-07",
        "title": "Automated alignment is harder than you think",
        "url": "https://arxiv.org/html/2605.06390"
      },
      "path": "sources/bowkis_et_al.automated-alignment-harder-than-you-think.txt",
      "title": "Automated alignment is harder than you think"
    },
    {
      "document_id": "source:carlsmith.scheming-ais",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://doi.org/10.48550/arXiv.2311.08379",
          "https://joecarlsmith.com/2023/11/15/new-report-scheming-ais-will-ais-fake-alignment-during-training-in-order-to-get-power/"
        ],
        "authors": [
          "Joe Carlsmith"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "carlsmith.scheming-ais",
        "kind": "paper",
        "language": "en",
        "published_at": "2023-11-14",
        "title": "Scheming AIs: Will AIs fake alignment during training in order to get power?",
        "url": "https://arxiv.org/abs/2311.08379"
      },
      "path": "sources/carlsmith.scheming-ais.txt",
      "title": "Scheming AIs: Will AIs fake alignment during training in order to get power?"
    },
    {
      "document_id": "source:chanin_et_al.a-is-for-absorption",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2409.14507",
          "https://proceedings.neurips.cc/paper_files/paper/2025/file/764ff7477b8e24dbe01531f6791e8bdf-Paper-Conference.pdf"
        ],
        "authors": [
          "David Chanin",
          "James Wilken-Smith",
          "Tomáš Dulka",
          "Hardik Bhatnagar",
          "Satvik Golechha",
          "Joseph Bloom"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "chanin_et_al.a-is-for-absorption",
        "kind": "paper",
        "language": "en",
        "published_at": "2024-09-22",
        "title": "A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders",
        "url": "https://proceedings.neurips.cc/paper_files/paper/2025/hash/764ff7477b8e24dbe01531f6791e8bdf-Abstract-Conference.html"
      },
      "path": "sources/chanin_et_al.a-is-for-absorption.txt",
      "title": "A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders"
    },
    {
      "document_id": "source:christiano.my-views-on-doom",
      "layer": "source",
      "metadata": {
        "authors": [
          "Paul Christiano"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "christiano.my-views-on-doom",
        "kind": "essay",
        "language": "en",
        "published_at": "2023-04-27",
        "title": "My views on “doom”",
        "url": "https://www.lesswrong.com/posts/xWMqsvHapP3nwdSW8/my-views-on-doom"
      },
      "path": "sources/christiano.my-views-on-doom.txt",
      "title": "My views on “doom”"
    },
    {
      "document_id": "source:christiano.takeoff-speeds",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.alignmentforum.org/posts/AfGmsjGPXN97kNp57/arguments-about-fast-takeoff",
          "https://www.lesswrong.com/posts/AfGmsjGPXN97kNp57/arguments-about-fast-takeoff"
        ],
        "authors": [
          "Paul Christiano"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "christiano.takeoff-speeds",
        "kind": "essay",
        "language": "en",
        "published_at": "2018-02-24",
        "title": "Takeoff speeds",
        "url": "https://sideways-view.com/2018/02/24/takeoff-speeds/"
      },
      "path": "sources/christiano.takeoff-speeds.txt",
      "title": "Takeoff speeds"
    },
    {
      "document_id": "source:christiano.what-failure-looks-like",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.lesswrong.com/posts/HBxe6wdjxK239zajf/more-realistic-tales-of-doom"
        ],
        "authors": [
          "Paul Christiano"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "christiano.what-failure-looks-like",
        "kind": "essay",
        "language": "en",
        "published_at": "2019-03-17",
        "title": "What failure looks like",
        "url": "https://www.alignmentforum.org/posts/HBxe6wdjxK239zajf/what-failure-looks-like"
      },
      "path": "sources/christiano.what-failure-looks-like.txt",
      "title": "What failure looks like"
    },
    {
      "document_id": "source:christiano.where-i-agree-and-disagree-with-eliezer",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.lesswrong.com/posts/CoZhXrhpQxpy9xw9y/where-i-agree-and-disagree-with-eliezer"
        ],
        "authors": [
          "Paul Christiano"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "christiano.where-i-agree-and-disagree-with-eliezer",
        "kind": "essay",
        "language": "en",
        "published_at": "2022-06-19",
        "title": "Where I agree and disagree with Eliezer",
        "url": "https://www.alignmentforum.org/posts/CoZhXrhpQxpy9xw9y/where-i-agree-and-disagree-with-eliezer"
      },
      "path": "sources/christiano.where-i-agree-and-disagree-with-eliezer.txt",
      "title": "Where I agree and disagree with Eliezer"
    },
    {
      "document_id": "source:christiano_xu.arcs-first-technical-report-eliciting-latent-knowledge",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.alignmentforum.org/posts/qHCDysDnvhteW7kRd/arc-s-first-technical-report-eliciting-latent-knowledge",
          "https://www.lesswrong.com/posts/qHCDysDnvhteW7kRd/arc-s-first-technical-report-eliciting-latent-knowledge/"
        ],
        "authors": [
          "Paul Christiano",
          "Mark Xu"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "christiano_xu.arcs-first-technical-report-eliciting-latent-knowledge",
        "kind": "article",
        "language": "en",
        "published_at": "2021-12-14",
        "title": "ARC's first technical report: Eliciting Latent Knowledge",
        "url": "https://www.alignment.org/blog/arcs-first-technical-report-eliciting-latent-knowledge/"
      },
      "path": "sources/christiano_xu.arcs-first-technical-report-eliciting-latent-knowledge.txt",
      "title": "ARC's first technical report: Eliciting Latent Knowledge"
    },
    {
      "document_id": "source:cihon_et_al.should-ai-governance-be-centralised",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://doi.org/10.1145/3375627.3375857",
          "https://doi.org/10.48550/arXiv.2001.03573",
          "https://arxiv.org/html/2001.03573",
          "https://arxiv.org/pdf/2001.03573"
        ],
        "authors": [
          "Peter Cihon",
          "Matthijs M. Maas",
          "Luke Kemp"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "cihon_et_al.should-ai-governance-be-centralised",
        "kind": "paper",
        "language": "en",
        "published_at": "2020-01-10",
        "title": "Should Artificial Intelligence Governance be Centralised? Design Lessons from History",
        "url": "https://arxiv.org/abs/2001.03573"
      },
      "path": "sources/cihon_et_al.should-ai-governance-be-centralised.txt",
      "title": "Should Artificial Intelligence Governance be Centralised? Design Lessons from History"
    },
    {
      "document_id": "source:cotra_wiblin.80000-hours-crunch-time",
      "layer": "source",
      "metadata": {
        "authors": [
          "Ajeya Cotra",
          "Robert Wiblin"
        ],
        "citation": {
          "locator_schemes": [
            "time"
          ]
        },
        "id": "cotra_wiblin.80000-hours-crunch-time",
        "kind": "transcript",
        "language": "en",
        "published_at": "2026-02-17",
        "title": "#235 – Ajeya Cotra on whether it’s crazy that every AI company’s safety plan is ‘use AI to make AI safe’",
        "url": "https://80000hours.org/podcast/episodes/ajeya-cotra-transformative-ai-crunch-time/"
      },
      "path": "sources/cotra_wiblin.80000-hours-crunch-time.txt",
      "title": "#235 – Ajeya Cotra on whether it’s crazy that every AI company’s safety plan is ‘use AI to make AI safe’"
    },
    {
      "document_id": "source:davidson.compute-centric-framework-ai-takeoff",
      "layer": "source",
      "metadata": {
        "authors": [
          "Tom Davidson"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "davidson.compute-centric-framework-ai-takeoff",
        "kind": "essay",
        "language": "en",
        "published_at": "2023-01-23",
        "title": "What a compute-centric framework says about AI takeoff speeds",
        "url": "https://www.lesswrong.com/posts/Gc9FGtdXhK9sCSEYu/what-a-compute-centric-framework-says-about-ai-takeoff"
      },
      "path": "sources/davidson.compute-centric-framework-ai-takeoff.txt",
      "title": "What a compute-centric framework says about AI takeoff speeds"
    },
    {
      "document_id": "source:engels_et_al.scaling-laws-for-scalable-oversight",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2504.18530",
          "https://proceedings.neurips.cc/paper_files/paper/2025/file/8c3caae2f725c8e2a55ecd600563d172-Paper-Conference.pdf"
        ],
        "authors": [
          "Joshua Engels",
          "David D. Baek",
          "Subhash Kantamneni",
          "Max Tegmark"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "engels_et_al.scaling-laws-for-scalable-oversight",
        "kind": "paper",
        "language": "en",
        "published_at": "2025-04-25",
        "title": "Scaling Laws For Scalable Oversight",
        "url": "https://proceedings.neurips.cc/paper_files/paper/2025/hash/8c3caae2f725c8e2a55ecd600563d172-Abstract-Conference.html"
      },
      "path": "sources/engels_et_al.scaling-laws-for-scalable-oversight.txt",
      "title": "Scaling Laws For Scalable Oversight"
    },
    {
      "document_id": "source:erdil_barnett.most-ai-value-broad-automation",
      "layer": "source",
      "metadata": {
        "authors": [
          "Ege Erdil",
          "Matthew Barnett"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "erdil_barnett.most-ai-value-broad-automation",
        "kind": "article",
        "language": "en",
        "published_at": "2025-03-21",
        "title": "Most AI value will come from broad automation, not from R&D",
        "url": "https://epoch.ai/gradient-updates/most-ai-value-will-come-from-broad-automation-not-from-r-d"
      },
      "path": "sources/erdil_barnett.most-ai-value-broad-automation.txt",
      "title": "Most AI value will come from broad automation, not from R&D"
    },
    {
      "document_id": "source:eth_davidson.ai-r-and-d-automation-software-intelligence-explosion",
      "layer": "source",
      "metadata": {
        "authors": [
          "Daniel Eth",
          "Tom Davidson"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "eth_davidson.ai-r-and-d-automation-software-intelligence-explosion",
        "kind": "paper",
        "language": "en",
        "published_at": "2025-03-26",
        "title": "Will AI R&D Automation Cause a Software Intelligence Explosion?",
        "url": "https://www.forethought.org/research/will-ai-r-and-d-automation-cause-a-software-intelligence-explosion"
      },
      "path": "sources/eth_davidson.ai-r-and-d-automation-software-intelligence-explosion.txt",
      "title": "Will AI R&D Automation Cause a Software Intelligence Explosion?"
    },
    {
      "document_id": "source:greenblatt.current-ais-seem-pretty-misaligned",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.alignmentforum.org/posts/WewsByywWNhX9rtwi/current-ais-seem-pretty-misaligned-to-me",
          "https://www.lesswrong.com/posts/WewsByywWNhX9rtwi/current-ais-seem-pretty-misaligned-to-me"
        ],
        "authors": [
          "Ryan Greenblatt"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "greenblatt.current-ais-seem-pretty-misaligned",
        "kind": "essay",
        "language": "en",
        "published_at": "2026-04-15",
        "title": "Current AIs seem pretty misaligned to me",
        "url": "https://blog.redwoodresearch.org/p/current-ais-seem-pretty-misaligned"
      },
      "path": "sources/greenblatt.current-ais-seem-pretty-misaligned.txt",
      "title": "Current AIs seem pretty misaligned to me"
    },
    {
      "document_id": "source:greenblatt.jankily-controlling-superintelligence",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.alignmentforum.org/posts/ainn5APCKHTFxuHKv/jankily-controlling-superintelligence",
          "https://www.lesswrong.com/posts/ainn5APCKHTFxuHKv/jankily-controlling-superintelligence"
        ],
        "authors": [
          "Ryan Greenblatt"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "greenblatt.jankily-controlling-superintelligence",
        "kind": "essay",
        "language": "en",
        "published_at": "2025-06-27",
        "title": "Jankily controlling superintelligence",
        "url": "https://blog.redwoodresearch.org/p/jankily-controlling-superintelligence"
      },
      "path": "sources/greenblatt.jankily-controlling-superintelligence.txt",
      "title": "Jankily controlling superintelligence"
    },
    {
      "document_id": "source:greenblatt_et_al.alignment-faking-large-language-models",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2412.14093",
          "https://arxiv.org/pdf/2412.14093"
        ],
        "authors": [
          "Ryan Greenblatt",
          "Carson Denison",
          "Benjamin Wright",
          "Fabien Roger",
          "Monte MacDiarmid",
          "Sam Marks",
          "Johannes Treutlein",
          "Tim Belonax",
          "Jack Chen",
          "David Duvenaud",
          "Akbir Khan",
          "Julian Michael",
          "Sören Mindermann",
          "Ethan Perez",
          "Linda Petrini",
          "Jonathan Uesato",
          "Jared Kaplan",
          "Buck Shlegeris",
          "Samuel R. Bowman",
          "Evan Hubinger"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "greenblatt_et_al.alignment-faking-large-language-models",
        "kind": "paper",
        "language": "en",
        "published_at": "2024-12-18",
        "title": "Alignment faking in large language models",
        "url": "https://arxiv.org/html/2412.14093"
      },
      "path": "sources/greenblatt_et_al.alignment-faking-large-language-models.txt",
      "title": "Alignment faking in large language models"
    },
    {
      "document_id": "source:hubinger_et_al.risks-from-learned-optimization",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/pdf/1906.01820"
        ],
        "authors": [
          "Evan Hubinger",
          "Chris van Merwijk",
          "Vladimir Mikulik",
          "Joar Skalse",
          "Scott Garrabrant"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "hubinger_et_al.risks-from-learned-optimization",
        "kind": "paper",
        "language": "en",
        "published_at": "2019-06-05",
        "title": "Risks from Learned Optimization in Advanced Machine Learning Systems",
        "url": "https://arxiv.org/abs/1906.01820"
      },
      "path": "sources/hubinger_et_al.risks-from-learned-optimization.txt",
      "title": "Risks from Learned Optimization in Advanced Machine Learning Systems"
    },
    {
      "document_id": "source:hubinger_et_al.sleeper-agents",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2401.05566",
          "https://arxiv.org/pdf/2401.05566"
        ],
        "authors": [
          "Evan Hubinger",
          "Carson Denison",
          "Jesse Mu",
          "Mike Lambert",
          "Meg Tong",
          "Monte MacDiarmid",
          "Tamera Lanham",
          "Daniel M. Ziegler",
          "Tim Maxwell",
          "Newton Cheng",
          "Adam Jermyn",
          "Amanda Askell",
          "Ansh Radhakrishnan",
          "Cem Anil",
          "David Duvenaud",
          "Deep Ganguli",
          "Fazl Barez",
          "Jack Clark",
          "Kamal Ndousse",
          "Kshitij Sachan",
          "Michael Sellitto",
          "Mrinank Sharma",
          "Nova DasSarma",
          "Roger Grosse",
          "Shauna Kravec",
          "Yuntao Bai",
          "Zachary Witten",
          "Marina Favaro",
          "Jan Brauner",
          "Holden Karnofsky",
          "Paul Christiano",
          "Samuel R. Bowman",
          "Logan Graham",
          "Jared Kaplan",
          "Sören Mindermann",
          "Ryan Greenblatt",
          "Buck Shlegeris",
          "Nicholas Schiefer",
          "Ethan Perez"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "hubinger_et_al.sleeper-agents",
        "kind": "paper",
        "language": "en",
        "published_at": "2024-01-10",
        "title": "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training",
        "url": "https://arxiv.org/html/2401.05566"
      },
      "path": "sources/hubinger_et_al.sleeper-agents.txt",
      "title": "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training"
    },
    {
      "document_id": "source:klein_yudkowsky.how-afraid-of-ai-apocalypse",
      "layer": "source",
      "metadata": {
        "authors": [
          "Ezra Klein",
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "klein_yudkowsky.how-afraid-of-ai-apocalypse",
        "kind": "transcript",
        "language": "en",
        "published_at": "2025-10-15",
        "title": "How Afraid of the A.I. Apocalypse Should We Be?",
        "url": "https://www.nytimes.com/2025/10/15/opinion/ezra-klein-podcast-eliezer-yudkowsky.html"
      },
      "path": "sources/klein_yudkowsky.how-afraid-of-ai-apocalypse.txt",
      "title": "How Afraid of the A.I. Apocalypse Should We Be?"
    },
    {
      "document_id": "source:korbak_et_al.ai-control-safety-case",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/html/2501.17315v1"
        ],
        "authors": [
          "Tomek Korbak",
          "Joshua Clymer",
          "Benjamin Hilton",
          "Buck Shlegeris",
          "Geoffrey Irving"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "korbak_et_al.ai-control-safety-case",
        "kind": "paper",
        "language": "en",
        "published_at": "2025-01-28",
        "title": "A sketch of an AI control safety case",
        "url": "https://arxiv.org/abs/2501.17315"
      },
      "path": "sources/korbak_et_al.ai-control-safety-case.txt",
      "title": "A sketch of an AI control safety case"
    },
    {
      "document_id": "source:leask_et_al.sparse-autoencoders-do-not-find-canonical-units-of-analysis",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2502.04878",
          "https://proceedings.iclr.cc/paper_files/paper/2025/file/84ca3f2d9d9bfca13f69b48ea63eb4a5-Paper-Conference.pdf"
        ],
        "authors": [
          "Patrick Leask",
          "Bart Bussmann",
          "Michael Pearce",
          "Joseph Bloom",
          "Curt Tigges",
          "Noura Al Moubayed",
          "Lee Sharkey",
          "Neel Nanda"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "leask_et_al.sparse-autoencoders-do-not-find-canonical-units-of-analysis",
        "kind": "paper",
        "language": "en",
        "published_at": "2025-02-07",
        "title": "Sparse Autoencoders Do Not Find Canonical Units of Analysis",
        "url": "https://proceedings.iclr.cc/paper_files/paper/2025/hash/84ca3f2d9d9bfca13f69b48ea63eb4a5-Abstract-Conference.html"
      },
      "path": "sources/leask_et_al.sparse-autoencoders-do-not-find-canonical-units-of-analysis.txt",
      "title": "Sparse Autoencoders Do Not Find Canonical Units of Analysis"
    },
    {
      "document_id": "source:macdiarmid_et_al.natural-emergent-misalignment-reward-hacking",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2511.18397",
          "https://arxiv.org/pdf/2511.18397"
        ],
        "authors": [
          "Monte MacDiarmid",
          "Benjamin Wright",
          "Jonathan Uesato",
          "Joe Benton",
          "Jon Kutasov",
          "Sara Price",
          "Naia Bouscal",
          "Sam Bowman",
          "Trenton Bricken",
          "Alex Cloud",
          "Carson Denison",
          "Johannes Gasteiger",
          "Ryan Greenblatt",
          "Jan Leike",
          "Jack Lindsey",
          "Vlad Mikulik",
          "Ethan Perez",
          "Alex Rodrigues",
          "Drake Thomas",
          "Albert Webson",
          "Daniel Ziegler",
          "Evan Hubinger"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "macdiarmid_et_al.natural-emergent-misalignment-reward-hacking",
        "kind": "paper",
        "language": "en",
        "published_at": "2025-11-23",
        "title": "Natural Emergent Misalignment from Reward Hacking in Production RL",
        "url": "https://arxiv.org/html/2511.18397"
      },
      "path": "sources/macdiarmid_et_al.natural-emergent-misalignment-reward-hacking.txt",
      "title": "Natural Emergent Misalignment from Reward Hacking in Production RL"
    },
    {
      "document_id": "source:ngo_et_al.alignment-problem-deep-learning",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2209.00626",
          "https://arxiv.org/pdf/2209.00626"
        ],
        "authors": [
          "Richard Ngo",
          "Lawrence Chan",
          "Sören Mindermann"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "ngo_et_al.alignment-problem-deep-learning",
        "kind": "paper",
        "language": "en",
        "published_at": "2022-08-30",
        "title": "The Alignment Problem from a Deep Learning Perspective",
        "url": "https://arxiv.org/html/2209.00626v8"
      },
      "path": "sources/ngo_et_al.alignment-problem-deep-learning.txt",
      "title": "The Alignment Problem from a Deep Learning Perspective"
    },
    {
      "document_id": "source:openai.weak-to-strong-generalization",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://cdn.openai.com/papers/weak-to-strong-generalization.pdf"
        ],
        "authors": [
          "Collin Burns",
          "Jan Leike",
          "Leopold Aschenbrenner",
          "Jeffrey Wu",
          "Pavel Izmailov",
          "Leo Gao",
          "Bowen Baker",
          "Jan Hendrik Kirchner"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "openai.weak-to-strong-generalization",
        "kind": "article",
        "language": "en",
        "published_at": "2023-12-14",
        "title": "Weak-to-strong generalization",
        "url": "https://openai.com/index/weak-to-strong-generalization/"
      },
      "path": "sources/openai.weak-to-strong-generalization.txt",
      "title": "Weak-to-strong generalization"
    },
    {
      "document_id": "source:raemon_yudkowsky_soares.corrigibility-hard-important",
      "layer": "source",
      "metadata": {
        "authors": [
          "Raymond Arnold",
          "Eliezer Yudkowsky",
          "Nate Soares"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "raemon_yudkowsky_soares.corrigibility-hard-important",
        "kind": "essay",
        "language": "en",
        "published_at": "2025-09-30",
        "title": "Why Corrigibility is Hard and Important (i.e. \"Whence the high MIRI confidence in alignment difficulty?\")",
        "url": "https://www.lesswrong.com/posts/ksfjZJu3BFEfM6hHE/why-corrigibility-is-hard-and-important-i-e-whence-the-high"
      },
      "path": "sources/raemon_yudkowsky_soares.corrigibility-hard-important.txt",
      "title": "Why Corrigibility is Hard and Important (i.e. \"Whence the high MIRI confidence in alignment difficulty?\")"
    },
    {
      "document_id": "source:sastry_et_al.computing-power-and-governance-of-ai",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://doi.org/10.48550/arXiv.2402.08797",
          "https://arxiv.org/html/2402.08797",
          "https://arxiv.org/pdf/2402.08797"
        ],
        "authors": [
          "Girish Sastry",
          "Lennart Heim",
          "Haydn Belfield",
          "Markus Anderljung",
          "Miles Brundage",
          "Julian Hazell",
          "Cullen O'Keefe",
          "Gillian K. Hadfield",
          "Richard Ngo",
          "Konstantin Pilz",
          "George Gor",
          "Emma Bluemke",
          "Sarah Shoker",
          "Janet Egan",
          "Robert F. Trager",
          "Shahar Avin",
          "Adrian Weller",
          "Yoshua Bengio",
          "Diane Coyle"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "sastry_et_al.computing-power-and-governance-of-ai",
        "kind": "paper",
        "language": "en",
        "published_at": "2024-02-13",
        "title": "Computing Power and the Governance of Artificial Intelligence",
        "url": "https://arxiv.org/abs/2402.08797"
      },
      "path": "sources/sastry_et_al.computing-power-and-governance-of-ai.txt",
      "title": "Computing Power and the Governance of Artificial Intelligence"
    },
    {
      "document_id": "source:scher_et_al.international-agreement-prevent-premature-asi",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://doi.org/10.48550/arXiv.2511.10783",
          "https://arxiv.org/html/2511.10783v3",
          "https://arxiv.org/pdf/2511.10783"
        ],
        "authors": [
          "Aaron Scher",
          "David Abecassis",
          "Peter Barnett",
          "Brian Abeyta"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "scher_et_al.international-agreement-prevent-premature-asi",
        "kind": "paper",
        "language": "en",
        "published_at": "2025-11-13",
        "title": "An International Agreement to Prevent the Premature Creation of Artificial Superintelligence",
        "url": "https://arxiv.org/abs/2511.10783"
      },
      "path": "sources/scher_et_al.international-agreement-prevent-premature-asi.txt",
      "title": "An International Agreement to Prevent the Premature Creation of Artificial Superintelligence"
    },
    {
      "document_id": "source:soares.sharp-left-turn",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.lesswrong.com/posts/GNhMPAWcfBCASy8e6/a-central-ai-alignment-problem-capabilities-generalization"
        ],
        "authors": [
          "Nate Soares"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "soares.sharp-left-turn",
        "kind": "essay",
        "language": "en",
        "published_at": "2022-06-15",
        "title": "A central AI alignment problem: capabilities generalization, and the sharp left turn",
        "url": "https://www.alignmentforum.org/posts/GNhMPAWcfBCASy8e6/a-central-ai-alignment-problem-capabilities-generalization"
      },
      "path": "sources/soares.sharp-left-turn.txt",
      "title": "A central AI alignment problem: capabilities generalization, and the sharp left turn"
    },
    {
      "document_id": "source:turner.optimal-policies-tend-to-seek-power",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://doi.org/10.48550/arXiv.1912.01683",
          "https://proceedings.neurips.cc/paper/2021/hash/c26820b8a4c1b3c2aa868d6d57e14a79-Abstract.html"
        ],
        "authors": [
          "Alexander Matt Turner",
          "Andrew Critch",
          "Logan Smith",
          "Prasad Tadepalli",
          "Rohin Shah"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "turner.optimal-policies-tend-to-seek-power",
        "kind": "paper",
        "language": "en",
        "published_at": "2019-12-03",
        "title": "Optimal Policies Tend to Seek Power",
        "url": "https://arxiv.org/abs/1912.01683"
      },
      "path": "sources/turner.optimal-policies-tend-to-seek-power.txt",
      "title": "Optimal Policies Tend to Seek Power"
    },
    {
      "document_id": "source:yang_et_al.superficial-alignment",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://arxiv.org/abs/2406.11431",
          "https://proceedings.iclr.cc/paper_files/paper/2025/file/092359ce5cf60a80e882378944bf1be4-Paper-Conference.pdf"
        ],
        "authors": [
          "Wenkai Yang",
          "Shiqi Shen",
          "Guangyao Shen",
          "Wei Yao",
          "Yong Liu",
          "Zhi Gong",
          "Yankai Lin",
          "Ji-Rong Wen"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "yang_et_al.superficial-alignment",
        "kind": "paper",
        "language": "en",
        "published_at": "2024-06-17",
        "title": "Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization",
        "url": "https://proceedings.iclr.cc/paper_files/paper/2025/hash/092359ce5cf60a80e882378944bf1be4-Abstract-Conference.html"
      },
      "path": "sources/yang_et_al.superficial-alignment.txt",
      "title": "Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization"
    },
    {
      "document_id": "source:yudkowsky.agi-ruin",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.lesswrong.com/posts/uMQ3cqWDPHhjtiesc/agi-ruin-a-list-of-lethalities"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "anchor",
            "item"
          ]
        },
        "id": "yudkowsky.agi-ruin",
        "kind": "essay",
        "language": "en",
        "published_at": "2022-06-10",
        "title": "AGI Ruin: A List of Lethalities",
        "url": "https://intelligence.org/2022/06/10/agi-ruin/"
      },
      "path": "sources/yudkowsky.agi-ruin.txt",
      "title": "AGI Ruin: A List of Lethalities"
    },
    {
      "document_id": "source:yudkowsky.ai-positive-negative-factor",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://doi.org/10.1093/oso/9780198570509.003.0021"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "yudkowsky.ai-positive-negative-factor",
        "kind": "paper",
        "language": "en",
        "published_at": "2008-07-03",
        "title": "Artificial Intelligence as a Positive and Negative Factor in Global Risk",
        "url": "https://intelligence.org/files/AIPosNegFactor.pdf"
      },
      "path": "sources/yudkowsky.ai-positive-negative-factor.txt",
      "title": "Artificial Intelligence as a Positive and Negative Factor in Global Risk"
    },
    {
      "document_id": "source:yudkowsky.autonomous-agi",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.alignmentforum.org/w/autonomous-agi"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "yudkowsky.autonomous-agi",
        "kind": "article",
        "language": "en",
        "published_at": "2015-12-28",
        "title": "Autonomous AGI",
        "url": "https://arbital.greaterwrong.com/p/Sovereign?l=1g3"
      },
      "path": "sources/yudkowsky.autonomous-agi.txt",
      "title": "Autonomous AGI"
    },
    {
      "document_id": "source:yudkowsky.coherent-extrapolated-volition",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "page"
          ]
        },
        "id": "yudkowsky.coherent-extrapolated-volition",
        "kind": "paper",
        "language": "en",
        "title": "Coherent Extrapolated Volition",
        "url": "https://intelligence.org/files/CEV.pdf"
      },
      "path": "sources/yudkowsky.coherent-extrapolated-volition.txt",
      "title": "Coherent Extrapolated Volition"
    },
    {
      "document_id": "source:yudkowsky.empiricism-as-anti-epistemology",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "yudkowsky.empiricism-as-anti-epistemology",
        "kind": "essay",
        "language": "en",
        "published_at": "2024-03-14",
        "title": "'Empiricism!' as Anti-Epistemology",
        "url": "https://www.lesswrong.com/posts/LvKDMWQ3yLG9R3gHw/empiricism-as-anti-epistemology"
      },
      "path": "sources/yudkowsky.empiricism-as-anti-epistemology.txt",
      "title": "'Empiricism!' as Anti-Epistemology"
    },
    {
      "document_id": "source:yudkowsky.irretrievability",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "yudkowsky.irretrievability",
        "kind": "essay",
        "language": "en",
        "published_at": "2026-05-04",
        "title": "Irretrievability; or, Murphy's Curse of Oneshotness upon ASI",
        "url": "https://www.lesswrong.com/posts/fbrz9xhKpEeTKw5zL/irretrievability-or-murphy-s-curse-of-oneshotness-upon-asi"
      },
      "path": "sources/yudkowsky.irretrievability.txt",
      "title": "Irretrievability; or, Murphy's Curse of Oneshotness upon ASI"
    },
    {
      "document_id": "source:yudkowsky.no-fire-alarm-for-agi",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.lesswrong.com/posts/BEtzRE2M5m9YEAQpX/there-s-no-fire-alarm-for-artificial-general-intelligence"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "yudkowsky.no-fire-alarm-for-agi",
        "kind": "essay",
        "language": "en",
        "published_at": "2017-10-13",
        "title": "There's No Fire Alarm for Artificial General Intelligence",
        "url": "https://intelligence.org/2017/10/13/fire-alarm/"
      },
      "path": "sources/yudkowsky.no-fire-alarm-for-agi.txt",
      "title": "There's No Fire Alarm for Artificial General Intelligence"
    },
    {
      "document_id": "source:yudkowsky.orthogonality-thesis",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.lesswrong.com/w/orthogonality-thesis"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "yudkowsky.orthogonality-thesis",
        "kind": "article",
        "language": "en",
        "published_at": "2015-03-10",
        "title": "Orthogonality Thesis",
        "url": "https://arbital.greaterwrong.com/p/orthogonality/"
      },
      "path": "sources/yudkowsky.orthogonality-thesis.txt",
      "title": "Orthogonality Thesis"
    },
    {
      "document_id": "source:yudkowsky.pivotal-act",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "yudkowsky.pivotal-act",
        "kind": "article",
        "language": "en",
        "published_at": "2015-06-12",
        "title": "Pivotal act",
        "url": "https://arbital.greaterwrong.com/p/pivotal"
      },
      "path": "sources/yudkowsky.pivotal-act.txt",
      "title": "Pivotal act"
    },
    {
      "document_id": "source:yudkowsky.security-mindset-logistic-success-curve",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "yudkowsky.security-mindset-logistic-success-curve",
        "kind": "essay",
        "language": "en",
        "published_at": "2017-11-26",
        "title": "Security Mindset and the Logistic Success Curve",
        "url": "https://www.lesswrong.com/posts/cpdsMuAHSWhWnKdog/security-mindset-and-the-logistic-success-curve"
      },
      "path": "sources/yudkowsky.security-mindset-logistic-success-curve.txt",
      "title": "Security Mindset and the Logistic Success Curve"
    },
    {
      "document_id": "source:yudkowsky.security-mindset-ordinary-paranoia",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://intelligence.org/2017/11/25/security-mindset-ordinary-paranoia/"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "yudkowsky.security-mindset-ordinary-paranoia",
        "kind": "essay",
        "language": "en",
        "published_at": "2017-11-25",
        "title": "Security Mindset and Ordinary Paranoia",
        "url": "https://www.lesswrong.com/posts/8gqrbnW758qjHFTrH/security-mindset-and-ordinary-paranoia"
      },
      "path": "sources/yudkowsky.security-mindset-ordinary-paranoia.txt",
      "title": "Security Mindset and Ordinary Paranoia"
    },
    {
      "document_id": "source:yudkowsky.shah-alignment-failures",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://www.lesswrong.com/posts/tcCxPLBrEXdxN5HCQ/shah-and-yudkowsky-on-alignment-failures"
        ],
        "authors": [
          "Eliezer Yudkowsky",
          "Rohin Shah"
        ],
        "citation": {
          "locator_schemes": [
            "item"
          ]
        },
        "id": "yudkowsky.shah-alignment-failures",
        "kind": "transcript",
        "language": "en",
        "published_at": "2022-03-02",
        "title": "Shah and Yudkowsky on alignment failures",
        "url": "https://intelligence.org/2022/03/02/shah-and-yudkowsky-on-alignment-failures/"
      },
      "path": "sources/yudkowsky.shah-alignment-failures.txt",
      "title": "Shah and Yudkowsky on alignment failures"
    },
    {
      "document_id": "source:yudkowsky.shut-it-all-down",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://time.com/6266923/ai-eliezer-yudkowsky-open-letter-not-enough/",
          "https://www.lesswrong.com/posts/oM9pEezyCb4dCsuKq/pausing-ai-developments-isn-t-enough-we-need-to-shut-it-all-1"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "yudkowsky.shut-it-all-down",
        "kind": "essay",
        "language": "en",
        "published_at": "2023-04-07",
        "title": "Pausing AI Developments Isn't Enough. We Need to Shut it All Down",
        "url": "https://intelligence.org/2023/04/07/pausing-ai-developments-isnt-enough-we-need-to-shut-it-all-down/"
      },
      "path": "sources/yudkowsky.shut-it-all-down.txt",
      "title": "Pausing AI Developments Isn't Enough. We Need to Shut it All Down"
    },
    {
      "document_id": "source:yudkowsky.sun-is-big",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://intelligence.org/2024/09/23/the-sun-is-big-but-superintelligences-will-not-spare-earth-a-little-sunlight/"
        ],
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "yudkowsky.sun-is-big",
        "kind": "essay",
        "language": "en",
        "published_at": "2024-09-23",
        "title": "The Sun is big, but superintelligences will not spare Earth a little sunlight",
        "url": "https://www.lesswrong.com/posts/F8sfrbPjCQj4KwJqn/the-sun-is-big-but-superintelligences-will-not-spare-earth-a"
      },
      "path": "sources/yudkowsky.sun-is-big.txt",
      "title": "The Sun is big, but superintelligences will not spare Earth a little sunlight"
    },
    {
      "document_id": "source:yudkowsky.ted-superintelligent-ai",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [
            "time"
          ]
        },
        "id": "yudkowsky.ted-superintelligent-ai",
        "kind": "transcript",
        "language": "en",
        "title": "Will superintelligent AI end the world?",
        "url": "https://www.ted.com/talks/eliezer_yudkowsky_will_superintelligent_ai_end_the_world"
      },
      "path": "sources/yudkowsky.ted-superintelligent-ai.txt",
      "title": "Will superintelligent AI end the world?"
    },
    {
      "document_id": "source:yudkowsky.thou-art-godshatter",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "yudkowsky.thou-art-godshatter",
        "kind": "essay",
        "language": "en",
        "published_at": "2007-11-13",
        "title": "Thou Art Godshatter",
        "url": "https://www.lesswrong.com/lw/l3/thou_art_godshatter/"
      },
      "path": "sources/yudkowsky.thou-art-godshatter.txt",
      "title": "Thou Art Godshatter"
    },
    {
      "document_id": "source:yudkowsky.value-is-fragile",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky"
        ],
        "citation": {
          "locator_schemes": [],
          "whole_source": true
        },
        "id": "yudkowsky.value-is-fragile",
        "kind": "essay",
        "language": "en",
        "published_at": "2009-01-29",
        "title": "Value is Fragile",
        "url": "https://www.lesswrong.com/posts/GNnHHmm8EzePmKzPk/value-is-fragile"
      },
      "path": "sources/yudkowsky.value-is-fragile.txt",
      "title": "Value is Fragile"
    },
    {
      "document_id": "source:yudkowsky_ngo.alignment-difficulty",
      "layer": "source",
      "metadata": {
        "alternate_urls": [
          "https://intelligence.org/2021/11/15/ngo-and-yudkowsky-on-alignment-difficulty/"
        ],
        "authors": [
          "Eliezer Yudkowsky",
          "Richard Ngo"
        ],
        "citation": {
          "locator_schemes": [
            "item"
          ]
        },
        "id": "yudkowsky_ngo.alignment-difficulty",
        "kind": "transcript",
        "language": "en",
        "published_at": "2021-11-15",
        "title": "Ngo and Yudkowsky on alignment difficulty",
        "url": "https://www.lesswrong.com/s/HH4yBYELhbdEiihQF/p/7im8at9PmhbT4JHsW"
      },
      "path": "sources/yudkowsky_ngo.alignment-difficulty.txt",
      "title": "Ngo and Yudkowsky on alignment difficulty"
    },
    {
      "document_id": "source:yudkowsky_soares.read-ai-thoughts",
      "layer": "source",
      "metadata": {
        "authors": [
          "Eliezer Yudkowsky",
          "Nate Soares"
        ],
        "citation": {
          "locator_schemes": [
            "anchor"
          ]
        },
        "id": "yudkowsky_soares.read-ai-thoughts",
        "kind": "article",
        "language": "en",
        "title": "Why not just read the AI's thoughts?",
        "url": "https://ifanyonebuildsit.com/11/why-not-just-read-the-ais-thoughts"
      },
      "path": "sources/yudkowsky_soares.read-ai-thoughts.txt",
      "title": "Why not just read the AI's thoughts?"
    },
    {
      "document_id": "terminology:agent",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "agent",
        "preferred": {
          "en": "agent",
          "ja": "エージェント"
        },
        "status": "active"
      },
      "path": "terminology/agent.txt",
      "title": "agent"
    },
    {
      "document_id": "terminology:ai_alignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "alignment"
          ],
          "ja": [
            "アラインメント",
            "アライメント",
            "整合",
            "AIアライメント"
          ]
        },
        "concept_id": "ai_alignment",
        "preferred": {
          "en": "AI alignment",
          "ja": "AIアラインメント"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_safety"
            ],
            "prerequisite": [
              "alignment_target",
              "artificial_intelligence"
            ],
            "related": [
              "artificial_general_intelligence"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_alignment.txt",
      "title": "AI alignment"
    },
    {
      "document_id": "terminology:ai_control",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI control research"
          ],
          "ja": [
            "AI制御"
          ]
        },
        "concept_id": "ai_control",
        "preferred": {
          "en": "AI control",
          "ja": "AIコントロール"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_safety"
            ],
            "prerequisite": [
              "misalignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_control.txt",
      "title": "AI control"
    },
    {
      "document_id": "terminology:ai_development_pause",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI development moratorium",
            "AI moratorium",
            "AI pause",
            "pause on AI development"
          ],
          "ja": [
            "AIモラトリアム"
          ]
        },
        "concept_id": "ai_development_pause",
        "preferred": {
          "en": "AI development pause",
          "ja": "AI開発の一時停止"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_governance"
            ],
            "prerequisite": [
              "artificial_intelligence"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_development_pause.txt",
      "title": "AI development pause"
    },
    {
      "document_id": "terminology:ai_existential_risk",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI x-risk",
            "existential risk from AI"
          ]
        },
        "concept_id": "ai_existential_risk",
        "preferred": {
          "en": "AI existential risk"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_risk",
              "existential_risk"
            ],
            "prerequisite": [
              "ai_risk",
              "existential_risk"
            ],
            "related": [
              "alignment_risk",
              "misaligned_power_seeking"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_existential_risk.txt",
      "title": "AI existential risk"
    },
    {
      "document_id": "terminology:ai_governance",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "artificial intelligence governance"
          ]
        },
        "concept_id": "ai_governance",
        "preferred": {
          "en": "AI governance"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence"
            ],
            "related": [
              "ai_safety"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_governance.txt",
      "title": "AI governance"
    },
    {
      "document_id": "terminology:ai_r_and_d_automation",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "automation of AI R&D"
          ],
          "ja": [
            "AI 研究開発自動化"
          ]
        },
        "concept_id": "ai_r_and_d_automation",
        "preferred": {
          "en": "AI R&D automation",
          "ja": "AI 研究開発の自動化"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ],
            "related": [
              "intelligence_explosion",
              "recursive_self_improvement",
              "takeoff_speed"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_r_and_d_automation.txt",
      "title": "AI R&D automation"
    },
    {
      "document_id": "terminology:ai_race_dynamics",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI arms race dynamics",
            "AI race pressure",
            "competitive pressure in AI development"
          ],
          "ja": [
            "軍拡競争"
          ]
        },
        "concept_id": "ai_race_dynamics",
        "preferred": {
          "en": "AI race dynamics",
          "ja": "競争圧力"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_race_dynamics.txt",
      "title": "AI race dynamics"
    },
    {
      "document_id": "terminology:ai_risk",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "artificial intelligence risk"
          ]
        },
        "concept_id": "ai_risk",
        "preferred": {
          "en": "AI risk",
          "ja": "AIリスク"
        },
        "relations": {
          "relations": {
            "broader": [
              "risk"
            ],
            "prerequisite": [
              "artificial_intelligence",
              "risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_risk.txt",
      "title": "AI risk"
    },
    {
      "document_id": "terminology:ai_safety",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "artificial intelligence safety"
          ]
        },
        "concept_id": "ai_safety",
        "preferred": {
          "en": "AI safety",
          "ja": "AI安全性"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "ai_risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_safety.txt",
      "title": "AI safety"
    },
    {
      "document_id": "terminology:ai_safety_level",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI Safety Levels",
            "ASL",
            "ASLs"
          ]
        },
        "concept_id": "ai_safety_level",
        "preferred": {
          "en": "AI Safety Level"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "responsible_scaling_policy"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ai_safety_level.txt",
      "title": "AI Safety Level"
    },
    {
      "document_id": "terminology:alignment_audit",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "alignment auditing",
            "alignment audits"
          ]
        },
        "concept_id": "alignment_audit",
        "preferred": {
          "en": "alignment audit"
        },
        "relations": {
          "relations": {
            "broader": [
              "evaluation"
            ],
            "prerequisite": [
              "ai_alignment"
            ],
            "related": [
              "interpretability",
              "red_teaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/alignment_audit.txt",
      "title": "alignment audit"
    },
    {
      "document_id": "terminology:alignment_by_default",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "alignment-by-default"
          ]
        },
        "concept_id": "alignment_by_default",
        "preferred": {
          "en": "Alignment by Default",
          "ja": "アラインメント・バイ・デフォルト"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_alignment"
            ],
            "prerequisite": [
              "ai_alignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/alignment_by_default.txt",
      "title": "Alignment by Default"
    },
    {
      "document_id": "terminology:alignment_failure",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI alignment failure"
          ]
        },
        "concept_id": "alignment_failure",
        "preferred": {
          "en": "alignment failure",
          "ja": "アラインメント失敗"
        },
        "relations": {
          "relations": {
            "broader": [
              "misalignment"
            ],
            "prerequisite": [
              "ai_alignment",
              "misalignment"
            ],
            "related": [
              "alignment_risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/alignment_failure.txt",
      "title": "alignment failure"
    },
    {
      "document_id": "terminology:alignment_faking",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "alignment-faking",
            "fake alignment",
            "alignment fake"
          ],
          "ja": [
            "猫を被る"
          ]
        },
        "concept_id": "alignment_faking",
        "preferred": {
          "en": "alignment faking",
          "ja": "アラインメント偽装"
        },
        "relations": {
          "relations": {
            "broader": [
              "deception"
            ],
            "prerequisite": [
              "ai_alignment",
              "deception",
              "oversight",
              "situational_awareness"
            ],
            "related": [
              "scheming",
              "training_gaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/alignment_faking.txt",
      "title": "alignment faking"
    },
    {
      "document_id": "terminology:alignment_problem",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI alignment problem",
            "the alignment problem"
          ],
          "ja": [
            "アラインメント問題"
          ]
        },
        "concept_id": "alignment_problem",
        "preferred": {
          "en": "alignment problem",
          "ja": "AIアラインメント問題"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "ai_alignment",
              "misalignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/alignment_problem.txt",
      "title": "alignment problem"
    },
    {
      "document_id": "terminology:alignment_risk",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI alignment risk",
            "misalignment risk"
          ]
        },
        "concept_id": "alignment_risk",
        "preferred": {
          "en": "alignment risk"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_risk"
            ],
            "prerequisite": [
              "ai_risk",
              "misalignment"
            ],
            "related": [
              "misaligned_power_seeking"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/alignment_risk.txt",
      "title": "alignment risk"
    },
    {
      "document_id": "terminology:alignment_target",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "target of alignment"
          ]
        },
        "concept_id": "alignment_target",
        "preferred": {
          "en": "alignment target",
          "ja": "アラインメント対象"
        },
        "relations": {
          "relations": {
            "related": [
              "human_preferences",
              "human_values",
              "intended_goal",
              "utility_function"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/alignment_target.txt",
      "title": "alignment target"
    },
    {
      "document_id": "terminology:artificial_general_intelligence",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AGI",
            "general AI"
          ]
        },
        "concept_id": "artificial_general_intelligence",
        "preferred": {
          "en": "artificial general intelligence",
          "ja": "汎用人工知能"
        },
        "relations": {
          "relations": {
            "broader": [
              "artificial_intelligence"
            ],
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/artificial_general_intelligence.txt",
      "title": "artificial general intelligence"
    },
    {
      "document_id": "terminology:artificial_intelligence",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI"
          ]
        },
        "concept_id": "artificial_intelligence",
        "preferred": {
          "en": "artificial intelligence",
          "ja": "人工知能"
        },
        "status": "active"
      },
      "path": "terminology/artificial_intelligence.txt",
      "title": "artificial intelligence"
    },
    {
      "document_id": "terminology:artificial_superintelligence",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "ASI",
            "superintelligent AI"
          ]
        },
        "concept_id": "artificial_superintelligence",
        "preferred": {
          "en": "artificial superintelligence",
          "ja": "人工超知能"
        },
        "relations": {
          "relations": {
            "broader": [
              "artificial_general_intelligence"
            ],
            "prerequisite": [
              "artificial_general_intelligence",
              "capability"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/artificial_superintelligence.txt",
      "title": "artificial superintelligence"
    },
    {
      "document_id": "terminology:attack_policy",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "attack policies",
            "red-team attack policy"
          ]
        },
        "concept_id": "attack_policy",
        "preferred": {
          "en": "attack policy"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "control_evaluation"
            ],
            "related": [
              "scheming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/attack_policy.txt",
      "title": "attack policy"
    },
    {
      "document_id": "terminology:automated_alignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI aligning AI",
            "AI-assisted alignment",
            "automated AI alignment",
            "automated alignment research"
          ],
          "ja": [
            "AI支援アラインメント"
          ]
        },
        "concept_id": "automated_alignment",
        "preferred": {
          "en": "automated alignment",
          "ja": "アラインメント研究の自動化"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_alignment"
            ],
            "prerequisite": [
              "ai_alignment",
              "artificial_intelligence"
            ],
            "related": [
              "crunch_time",
              "weak_agi"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/automated_alignment.txt",
      "title": "automated alignment"
    },
    {
      "document_id": "terminology:base_objective",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "base-objective"
          ],
          "ja": [
            "ベース目的"
          ]
        },
        "concept_id": "base_objective",
        "preferred": {
          "en": "base objective",
          "ja": "ベース目的関数"
        },
        "relations": {
          "relations": {
            "broader": [
              "objective"
            ],
            "prerequisite": [
              "base_optimizer"
            ],
            "related": [
              "reward",
              "training_objective"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/base_objective.txt",
      "title": "base objective"
    },
    {
      "document_id": "terminology:base_optimizer",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "base-optimizer"
          ],
          "ja": [
            "ベースオプティマイザー"
          ]
        },
        "concept_id": "base_optimizer",
        "preferred": {
          "en": "base optimizer",
          "ja": "ベースオプティマイザ"
        },
        "relations": {
          "relations": {
            "broader": [
              "optimizer"
            ],
            "prerequisite": [
              "objective",
              "optimizer"
            ],
            "related": [
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/base_optimizer.txt",
      "title": "base optimizer"
    },
    {
      "document_id": "terminology:bayesian_inference",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "Bayesian updating"
          ]
        },
        "concept_id": "bayesian_inference",
        "preferred": {
          "en": "Bayesian inference",
          "ja": "ベイズ推定"
        },
        "status": "active"
      },
      "path": "terminology/bayesian_inference.txt",
      "title": "Bayesian inference"
    },
    {
      "document_id": "terminology:behavioral_objective",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "behavioural objective"
          ],
          "ja": [
            "行動上の目的"
          ]
        },
        "concept_id": "behavioral_objective",
        "preferred": {
          "en": "behavioral objective",
          "ja": "行動目的"
        },
        "relations": {
          "relations": {
            "broader": [
              "objective"
            ],
            "related": [
              "mesa_objective"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/behavioral_objective.txt",
      "title": "behavioral objective"
    },
    {
      "document_id": "terminology:benchmark",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "benchmark evaluation"
          ]
        },
        "concept_id": "benchmark",
        "preferred": {
          "en": "benchmark",
          "ja": "ベンチマーク"
        },
        "relations": {
          "relations": {
            "broader": [
              "evaluation"
            ],
            "prerequisite": [
              "evaluation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/benchmark.txt",
      "title": "benchmark"
    },
    {
      "document_id": "terminology:capability",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "capabilities"
          ],
          "ja": [
            "AI能力"
          ]
        },
        "concept_id": "capability",
        "preferred": {
          "en": "capability",
          "ja": "能力"
        },
        "relations": {
          "relations": {
            "related": [
              "evaluation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/capability.txt",
      "title": "capability"
    },
    {
      "document_id": "terminology:capability_elicitation",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "capabilities elicitation",
            "eliciting capabilities"
          ]
        },
        "concept_id": "capability_elicitation",
        "preferred": {
          "en": "capability elicitation"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "capability"
            ],
            "related": [
              "control_evaluation",
              "sandbagging",
              "weak_to_strong_generalization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/capability_elicitation.txt",
      "title": "capability elicitation"
    },
    {
      "document_id": "terminology:capability_evaluation",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "capability eval",
            "capability evaluations"
          ]
        },
        "concept_id": "capability_evaluation",
        "preferred": {
          "en": "capability evaluation",
          "ja": "能力評価"
        },
        "relations": {
          "relations": {
            "broader": [
              "evaluation"
            ],
            "prerequisite": [
              "capability",
              "capability_elicitation",
              "evaluation"
            ],
            "related": [
              "control_evaluation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/capability_evaluation.txt",
      "title": "capability evaluation"
    },
    {
      "document_id": "terminology:capability_generalization",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "capabilities generalisation",
            "capabilities generalization",
            "capability generalisation"
          ]
        },
        "concept_id": "capability_generalization",
        "preferred": {
          "en": "capability generalization",
          "ja": "能力の汎化"
        },
        "relations": {
          "relations": {
            "broader": [
              "generalization"
            ],
            "prerequisite": [
              "capability",
              "generalization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/capability_generalization.txt",
      "title": "capability generalization"
    },
    {
      "document_id": "terminology:capability_threshold",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "capability thresholds"
          ]
        },
        "concept_id": "capability_threshold",
        "preferred": {
          "en": "capability threshold"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "capability"
            ],
            "related": [
              "dangerous_capability_evaluation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/capability_threshold.txt",
      "title": "capability threshold"
    },
    {
      "document_id": "terminology:catastrophic_risk",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "catastrophic risks"
          ],
          "ja": [
            "破局的リスク",
            "破滅的リスク"
          ]
        },
        "concept_id": "catastrophic_risk",
        "preferred": {
          "en": "catastrophic risk",
          "ja": "壊滅的リスク"
        },
        "relations": {
          "relations": {
            "broader": [
              "risk"
            ],
            "prerequisite": [
              "risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/catastrophic_risk.txt",
      "title": "catastrophic risk"
    },
    {
      "document_id": "terminology:coherent_extrapolated_volition",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "CEV"
          ]
        },
        "concept_id": "coherent_extrapolated_volition",
        "preferred": {
          "en": "Coherent Extrapolated Volition",
          "ja": "首尾一貫した外挿的意志"
        },
        "relations": {
          "relations": {
            "broader": [
              "alignment_target"
            ],
            "prerequisite": [
              "human_preferences",
              "human_values"
            ],
            "related": [
              "friendly_ai"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/coherent_extrapolated_volition.txt",
      "title": "Coherent Extrapolated Volition"
    },
    {
      "document_id": "terminology:collusion",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI collusion",
            "actor-monitor collusion",
            "model collusion",
            "policy-monitor collusion"
          ]
        },
        "concept_id": "collusion",
        "preferred": {
          "en": "collusion"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "control_protocol"
            ],
            "related": [
              "untrusted_monitoring"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/collusion.txt",
      "title": "collusion"
    },
    {
      "document_id": "terminology:compute_governance",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI compute governance"
          ]
        },
        "concept_id": "compute_governance",
        "preferred": {
          "en": "compute governance"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_governance"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/compute_governance.txt",
      "title": "compute governance"
    },
    {
      "document_id": "terminology:control_evaluation",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI control eval",
            "AI control evaluation",
            "control eval",
            "control evaluations"
          ]
        },
        "concept_id": "control_evaluation",
        "preferred": {
          "en": "control evaluation"
        },
        "relations": {
          "relations": {
            "broader": [
              "evaluation"
            ],
            "prerequisite": [
              "control_protocol",
              "evaluation"
            ],
            "related": [
              "red_teaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/control_evaluation.txt",
      "title": "control evaluation"
    },
    {
      "document_id": "terminology:control_protocol",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI control protocol",
            "control protocols"
          ]
        },
        "concept_id": "control_protocol",
        "preferred": {
          "en": "control protocol"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_control"
            ],
            "prerequisite": [
              "ai_control"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/control_protocol.txt",
      "title": "control protocol"
    },
    {
      "document_id": "terminology:control_safety_case",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI control safety case",
            "control safety cases"
          ]
        },
        "concept_id": "control_safety_case",
        "preferred": {
          "en": "control safety case"
        },
        "relations": {
          "relations": {
            "broader": [
              "safety_case"
            ],
            "prerequisite": [
              "capability_elicitation",
              "control_evaluation",
              "control_protocol"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/control_safety_case.txt",
      "title": "control safety case"
    },
    {
      "document_id": "terminology:corrigibility",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "corrigible"
          ],
          "ja": [
            "修正可能性"
          ]
        },
        "concept_id": "corrigibility",
        "preferred": {
          "en": "corrigibility",
          "ja": "訂正可能性"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_alignment"
            ],
            "prerequisite": [
              "instrumental_convergence"
            ],
            "related": [
              "oversight",
              "power_seeking"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/corrigibility.txt",
      "title": "corrigibility"
    },
    {
      "document_id": "terminology:crunch_time",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI crunch time"
          ],
          "ja": [
            "AIクランチタイム"
          ]
        },
        "concept_id": "crunch_time",
        "preferred": {
          "en": "crunch time",
          "ja": "クランチタイム"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability",
              "intelligence_explosion"
            ],
            "related": [
              "recursive_self_improvement",
              "takeoff_speed"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/crunch_time.txt",
      "title": "crunch time"
    },
    {
      "document_id": "terminology:dangerous_capability_evaluation",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "dangerous capabilities eval",
            "dangerous capabilities evals",
            "dangerous capabilities evaluation",
            "dangerous capabilities evaluations",
            "dangerous capability eval",
            "dangerous capability evals"
          ]
        },
        "concept_id": "dangerous_capability_evaluation",
        "preferred": {
          "en": "dangerous capability evaluation"
        },
        "relations": {
          "relations": {
            "broader": [
              "capability_evaluation"
            ],
            "related": [
              "red_teaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/dangerous_capability_evaluation.txt",
      "title": "dangerous capability evaluation"
    },
    {
      "document_id": "terminology:debate",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI safety via debate",
            "AI debate"
          ]
        },
        "concept_id": "debate",
        "preferred": {
          "en": "debate",
          "ja": "ディベート"
        },
        "relations": {
          "relations": {
            "broader": [
              "scalable_oversight"
            ],
            "prerequisite": [
              "evaluation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/debate.txt",
      "title": "debate"
    },
    {
      "document_id": "terminology:deception",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI deception",
            "strategic deception"
          ],
          "ja": [
            "デセプション"
          ]
        },
        "concept_id": "deception",
        "preferred": {
          "en": "deception",
          "ja": "欺瞞"
        },
        "status": "active"
      },
      "path": "terminology/deception.txt",
      "title": "deception"
    },
    {
      "document_id": "terminology:deceptive_alignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "deceptively aligned AI"
          ]
        },
        "concept_id": "deceptive_alignment",
        "preferred": {
          "en": "deceptive alignment",
          "ja": "欺瞞的アラインメント"
        },
        "relations": {
          "relations": {
            "broader": [
              "alignment_faking",
              "inner_misalignment"
            ],
            "prerequisite": [
              "deception",
              "goal_directed_behavior",
              "inner_misalignment",
              "oversight",
              "situational_awareness"
            ],
            "related": [
              "misaligned_power_seeking",
              "scheming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/deceptive_alignment.txt",
      "title": "deceptive alignment"
    },
    {
      "document_id": "terminology:distribution_shift",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "distributional shift"
          ]
        },
        "concept_id": "distribution_shift",
        "preferred": {
          "en": "distribution shift",
          "ja": "分布シフト"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "training"
            ],
            "related": [
              "generalization",
              "objective_robustness"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/distribution_shift.txt",
      "title": "distribution shift"
    },
    {
      "document_id": "terminology:eliciting_latent_knowledge",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "ELK"
          ]
        },
        "concept_id": "eliciting_latent_knowledge",
        "preferred": {
          "en": "Eliciting Latent Knowledge"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "latent_knowledge",
              "world_model"
            ],
            "related": [
              "interpretability",
              "ontology_identification_problem",
              "scalable_oversight",
              "weak_to_strong_generalization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/eliciting_latent_knowledge.txt",
      "title": "Eliciting Latent Knowledge"
    },
    {
      "document_id": "terminology:evaluation",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI eval",
            "AI evals",
            "AI evaluation",
            "AI evaluations",
            "eval",
            "evals",
            "model eval",
            "model evals",
            "model evaluation",
            "model evaluations"
          ],
          "ja": [
            "AI評価",
            "モデル評価"
          ]
        },
        "concept_id": "evaluation",
        "preferred": {
          "en": "evaluation",
          "ja": "評価"
        },
        "relations": {
          "relations": {
            "related": [
              "generalization",
              "oversight",
              "safety_case"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/evaluation.txt",
      "title": "evaluation"
    },
    {
      "document_id": "terminology:evaluation_awareness",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "eval awareness"
          ]
        },
        "concept_id": "evaluation_awareness",
        "preferred": {
          "en": "evaluation awareness",
          "ja": "評価認識"
        },
        "relations": {
          "relations": {
            "broader": [
              "situational_awareness"
            ],
            "prerequisite": [
              "evaluation",
              "situational_awareness"
            ],
            "related": [
              "sandbagging",
              "training_gaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/evaluation_awareness.txt",
      "title": "evaluation awareness"
    },
    {
      "document_id": "terminology:existential_risk",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "existential risks",
            "x-risk",
            "x risk"
          ],
          "ja": [
            "実存的リスク",
            "存亡的リスク"
          ]
        },
        "concept_id": "existential_risk",
        "preferred": {
          "en": "existential risk",
          "ja": "存亡リスク"
        },
        "relations": {
          "relations": {
            "broader": [
              "catastrophic_risk"
            ],
            "prerequisite": [
              "catastrophic_risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/existential_risk.txt",
      "title": "existential risk"
    },
    {
      "document_id": "terminology:factored_cognition",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "factored_cognition",
        "preferred": {
          "en": "factored cognition"
        },
        "relations": {
          "relations": {
            "related": [
              "iterated_amplification",
              "process_supervision"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/factored_cognition.txt",
      "title": "factored cognition"
    },
    {
      "document_id": "terminology:first_critical_try",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "first critical tries"
          ],
          "ja": [
            "最初の危険な試行"
          ]
        },
        "concept_id": "first_critical_try",
        "preferred": {
          "en": "first critical try",
          "ja": "最初の重要な試行"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "catastrophic_risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/first_critical_try.txt",
      "title": "first critical try"
    },
    {
      "document_id": "terminology:friendly_ai",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "FAI",
            "Friendly Artificial Intelligence"
          ]
        },
        "concept_id": "friendly_ai",
        "preferred": {
          "en": "Friendly AI",
          "ja": "フレンドリーAI"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "ai_alignment",
              "human_values"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/friendly_ai.txt",
      "title": "Friendly AI"
    },
    {
      "document_id": "terminology:frontier_model",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "frontier AI model",
            "frontier AI models",
            "frontier models"
          ]
        },
        "concept_id": "frontier_model",
        "preferred": {
          "en": "frontier model"
        },
        "relations": {
          "relations": {
            "broader": [
              "artificial_intelligence"
            ],
            "prerequisite": [
              "capability"
            ],
            "related": [
              "responsible_scaling_policy"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/frontier_model.txt",
      "title": "frontier model"
    },
    {
      "document_id": "terminology:generalization",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "generalisation"
          ]
        },
        "concept_id": "generalization",
        "preferred": {
          "en": "generalization",
          "ja": "汎化"
        },
        "relations": {
          "relations": {
            "broader": [
              "capability"
            ],
            "prerequisite": [
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/generalization.txt",
      "title": "generalization"
    },
    {
      "document_id": "terminology:goal",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "goal",
        "preferred": {
          "en": "goal",
          "ja": "目標"
        },
        "relations": {
          "relations": {
            "related": [
              "values"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/goal.txt",
      "title": "goal"
    },
    {
      "document_id": "terminology:goal_directed_behavior",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "goal-directed",
            "goal directed behavior"
          ]
        },
        "concept_id": "goal_directed_behavior",
        "preferred": {
          "en": "goal-directed behavior",
          "ja": "目標指向的行動"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "agent",
              "goal"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/goal_directed_behavior.txt",
      "title": "goal-directed behavior"
    },
    {
      "document_id": "terminology:goal_guarding_scheming",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "goal guarding scheming",
            "goal-guarding schemer"
          ]
        },
        "concept_id": "goal_guarding_scheming",
        "preferred": {
          "en": "goal-guarding scheming",
          "ja": "目標保護型スキーミング"
        },
        "relations": {
          "relations": {
            "broader": [
              "deceptive_alignment",
              "scheming",
              "training_gaming"
            ],
            "prerequisite": [
              "goal",
              "reward",
              "situational_awareness",
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/goal_guarding_scheming.txt",
      "title": "goal-guarding scheming"
    },
    {
      "document_id": "terminology:goal_misgeneralization",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "goal mis-generalization"
          ]
        },
        "concept_id": "goal_misgeneralization",
        "preferred": {
          "en": "goal misgeneralization",
          "ja": "目標の誤一般化"
        },
        "relations": {
          "relations": {
            "broader": [
              "inner_misalignment"
            ],
            "prerequisite": [
              "capability",
              "distribution_shift",
              "generalization",
              "inner_misalignment"
            ],
            "related": [
              "objective_robustness",
              "specification_gaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/goal_misgeneralization.txt",
      "title": "goal misgeneralization"
    },
    {
      "document_id": "terminology:goodharts_law",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "goodharts_law",
        "preferred": {
          "en": "Goodhart's Law",
          "ja": "グッドハートの法則"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "optimization",
              "proxy_objective"
            ],
            "related": [
              "outer_misalignment",
              "reward_hacking",
              "specification_gaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/goodharts_law.txt",
      "title": "Goodhart's Law"
    },
    {
      "document_id": "terminology:human_preferences",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "human_preferences",
        "preferred": {
          "en": "human preferences",
          "ja": "人間の選好"
        },
        "relations": {
          "relations": {
            "broader": [
              "preferences"
            ],
            "related": [
              "human_values"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/human_preferences.txt",
      "title": "human preferences"
    },
    {
      "document_id": "terminology:human_values",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "human_values",
        "preferred": {
          "en": "human values",
          "ja": "人間の価値観"
        },
        "relations": {
          "relations": {
            "broader": [
              "values"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/human_values.txt",
      "title": "human values"
    },
    {
      "document_id": "terminology:industrial_explosion",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI industrial explosion"
          ]
        },
        "concept_id": "industrial_explosion",
        "preferred": {
          "en": "industrial explosion",
          "ja": "産業爆発"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ],
            "related": [
              "intelligence_explosion",
              "technology_explosion"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/industrial_explosion.txt",
      "title": "industrial explosion"
    },
    {
      "document_id": "terminology:inner_alignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "inner alignment problem"
          ]
        },
        "concept_id": "inner_alignment",
        "preferred": {
          "en": "inner alignment",
          "ja": "インナーアラインメント"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_alignment"
            ],
            "prerequisite": [
              "ai_alignment",
              "base_objective",
              "mesa_objective",
              "mesa_optimizer"
            ],
            "related": [
              "objective_robustness",
              "outer_alignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/inner_alignment.txt",
      "title": "inner alignment"
    },
    {
      "document_id": "terminology:inner_misalignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "inner alignment failure"
          ]
        },
        "concept_id": "inner_misalignment",
        "preferred": {
          "en": "inner misalignment",
          "ja": "インナー・ミスアラインメント"
        },
        "relations": {
          "relations": {
            "broader": [
              "misalignment"
            ],
            "prerequisite": [
              "inner_alignment",
              "misalignment"
            ],
            "related": [
              "outer_misalignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/inner_misalignment.txt",
      "title": "inner misalignment"
    },
    {
      "document_id": "terminology:instrumental_convergence",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "convergent instrumental goals"
          ]
        },
        "concept_id": "instrumental_convergence",
        "preferred": {
          "en": "instrumental convergence",
          "ja": "道具的収束"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "goal_directed_behavior",
              "instrumental_goal",
              "terminal_goal"
            ],
            "related": [
              "orthogonality_thesis",
              "paperclip_maximizer",
              "power_seeking",
              "resource_acquisition",
              "self_preservation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/instrumental_convergence.txt",
      "title": "instrumental convergence"
    },
    {
      "document_id": "terminology:instrumental_goal",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "instrumental subgoal"
          ],
          "ja": [
            "手段的目標"
          ]
        },
        "concept_id": "instrumental_goal",
        "preferred": {
          "en": "instrumental goal",
          "ja": "道具的目標"
        },
        "relations": {
          "relations": {
            "broader": [
              "goal"
            ],
            "prerequisite": [
              "goal"
            ],
            "related": [
              "power_seeking",
              "terminal_goal"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/instrumental_goal.txt",
      "title": "instrumental goal"
    },
    {
      "document_id": "terminology:intelligence_explosion",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI intelligence explosion"
          ]
        },
        "concept_id": "intelligence_explosion",
        "preferred": {
          "en": "intelligence explosion",
          "ja": "知能爆発"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ],
            "related": [
              "recursive_self_improvement",
              "technology_explosion"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/intelligence_explosion.txt",
      "title": "intelligence explosion"
    },
    {
      "document_id": "terminology:intended_goal",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "designer's intended goal",
            "programmer's intended goal"
          ],
          "ja": [
            "設計者の意図した目標"
          ]
        },
        "concept_id": "intended_goal",
        "preferred": {
          "en": "intended goal",
          "ja": "意図された目標"
        },
        "relations": {
          "relations": {
            "broader": [
              "goal"
            ],
            "related": [
              "outer_alignment",
              "training_objective"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/intended_goal.txt",
      "title": "intended goal"
    },
    {
      "document_id": "terminology:interpretability",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI interpretability",
            "ML interpretability"
          ]
        },
        "concept_id": "interpretability",
        "preferred": {
          "en": "interpretability",
          "ja": "解釈可能性"
        },
        "status": "active"
      },
      "path": "terminology/interpretability.txt",
      "title": "interpretability"
    },
    {
      "document_id": "terminology:iterated_amplification",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "IDA",
            "iterated distillation and amplification"
          ]
        },
        "concept_id": "iterated_amplification",
        "preferred": {
          "en": "iterated amplification"
        },
        "relations": {
          "relations": {
            "broader": [
              "scalable_oversight"
            ],
            "prerequisite": [
              "oversight",
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/iterated_amplification.txt",
      "title": "iterated amplification"
    },
    {
      "document_id": "terminology:latent_knowledge",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "latent_knowledge",
        "preferred": {
          "en": "latent knowledge"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "machine_learning"
            ],
            "related": [
              "world_model"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/latent_knowledge.txt",
      "title": "latent knowledge"
    },
    {
      "document_id": "terminology:loss_of_control",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI loss of control",
            "loss of human control"
          ]
        },
        "concept_id": "loss_of_control",
        "preferred": {
          "en": "loss of control",
          "ja": "制御喪失"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/loss_of_control.txt",
      "title": "loss of control"
    },
    {
      "document_id": "terminology:machine_learning",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "ML"
          ]
        },
        "concept_id": "machine_learning",
        "preferred": {
          "en": "machine learning",
          "ja": "機械学習"
        },
        "relations": {
          "relations": {
            "broader": [
              "artificial_intelligence"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/machine_learning.txt",
      "title": "machine learning"
    },
    {
      "document_id": "terminology:mechanistic_interpretability",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "mech interp",
            "mechanistic interp",
            "mechinterp"
          ],
          "ja": [
            "メカインタープ"
          ]
        },
        "concept_id": "mechanistic_interpretability",
        "preferred": {
          "en": "mechanistic interpretability",
          "ja": "メカニスティック・インタープリタビリティ"
        },
        "relations": {
          "relations": {
            "broader": [
              "interpretability"
            ],
            "prerequisite": [
              "interpretability",
              "neural_network"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/mechanistic_interpretability.txt",
      "title": "mechanistic interpretability"
    },
    {
      "document_id": "terminology:mesa_objective",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "mesa objective"
          ],
          "ja": [
            "メサ目的"
          ]
        },
        "concept_id": "mesa_objective",
        "preferred": {
          "en": "mesa-objective",
          "ja": "メサ目的関数"
        },
        "relations": {
          "relations": {
            "broader": [
              "objective"
            ],
            "prerequisite": [
              "mesa_optimizer"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/mesa_objective.txt",
      "title": "mesa-objective"
    },
    {
      "document_id": "terminology:mesa_optimization",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "mesa optimization"
          ]
        },
        "concept_id": "mesa_optimization",
        "preferred": {
          "en": "mesa-optimization",
          "ja": "メサ最適化"
        },
        "relations": {
          "relations": {
            "broader": [
              "optimization"
            ],
            "prerequisite": [
              "base_optimizer",
              "mesa_optimizer",
              "optimization"
            ],
            "related": [
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/mesa_optimization.txt",
      "title": "mesa-optimization"
    },
    {
      "document_id": "terminology:mesa_optimizer",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "mesa optimizer"
          ]
        },
        "concept_id": "mesa_optimizer",
        "preferred": {
          "en": "mesa-optimizer",
          "ja": "メサオプティマイザ"
        },
        "relations": {
          "relations": {
            "broader": [
              "optimizer"
            ],
            "prerequisite": [
              "base_optimizer"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/mesa_optimizer.txt",
      "title": "mesa-optimizer"
    },
    {
      "document_id": "terminology:misaligned_agi",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "misaligned artificial general intelligence"
          ]
        },
        "concept_id": "misaligned_agi",
        "preferred": {
          "en": "misaligned AGI",
          "ja": "ミスアラインドAGI"
        },
        "relations": {
          "relations": {
            "broader": [
              "artificial_general_intelligence",
              "misaligned_ai"
            ],
            "prerequisite": [
              "artificial_general_intelligence",
              "misaligned_ai"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/misaligned_agi.txt",
      "title": "misaligned AGI"
    },
    {
      "document_id": "terminology:misaligned_ai",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "misaligned artificial intelligence"
          ],
          "ja": [
            "ミスアラインド"
          ]
        },
        "concept_id": "misaligned_ai",
        "preferred": {
          "en": "misaligned AI",
          "ja": "ミスアラインドAI"
        },
        "relations": {
          "relations": {
            "broader": [
              "artificial_intelligence"
            ],
            "prerequisite": [
              "artificial_intelligence",
              "misalignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/misaligned_ai.txt",
      "title": "misaligned AI"
    },
    {
      "document_id": "terminology:misaligned_power_seeking",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "MAPS",
            "misaligned power seeking"
          ]
        },
        "concept_id": "misaligned_power_seeking",
        "preferred": {
          "en": "misaligned power-seeking"
        },
        "relations": {
          "relations": {
            "broader": [
              "power_seeking"
            ],
            "prerequisite": [
              "misalignment",
              "power_seeking"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/misaligned_power_seeking.txt",
      "title": "misaligned power-seeking"
    },
    {
      "document_id": "terminology:misalignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI misalignment"
          ]
        },
        "concept_id": "misalignment",
        "preferred": {
          "en": "misalignment",
          "ja": "ミスアラインメント"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "alignment_target"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/misalignment.txt",
      "title": "misalignment"
    },
    {
      "document_id": "terminology:neural_network",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "neural networks"
          ]
        },
        "concept_id": "neural_network",
        "preferred": {
          "en": "neural network",
          "ja": "ニューラルネットワーク"
        },
        "relations": {
          "relations": {
            "broader": [
              "machine_learning"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/neural_network.txt",
      "title": "neural network"
    },
    {
      "document_id": "terminology:objective",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "objective function"
          ]
        },
        "concept_id": "objective",
        "preferred": {
          "en": "objective",
          "ja": "目的"
        },
        "relations": {
          "relations": {
            "broader": [
              "goal"
            ],
            "related": [
              "reward",
              "utility_function"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/objective.txt",
      "title": "objective"
    },
    {
      "document_id": "terminology:objective_robustness",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "ja": [
            "目的頑健性"
          ]
        },
        "concept_id": "objective_robustness",
        "preferred": {
          "en": "objective robustness",
          "ja": "目的の頑健性"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_alignment"
            ],
            "prerequisite": [
              "base_objective",
              "behavioral_objective"
            ],
            "related": [
              "outer_alignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/objective_robustness.txt",
      "title": "objective robustness"
    },
    {
      "document_id": "terminology:ontology_identification_problem",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "ontology identification"
          ]
        },
        "concept_id": "ontology_identification_problem",
        "preferred": {
          "en": "ontology identification problem"
        },
        "relations": {
          "relations": {
            "broader": [
              "alignment_problem"
            ],
            "prerequisite": [
              "alignment_problem",
              "alignment_target",
              "world_model"
            ],
            "related": [
              "outer_alignment",
              "utility_function"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/ontology_identification_problem.txt",
      "title": "ontology identification problem"
    },
    {
      "document_id": "terminology:optimization",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "optimization",
        "preferred": {
          "en": "optimization",
          "ja": "最適化"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "objective"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/optimization.txt",
      "title": "optimization"
    },
    {
      "document_id": "terminology:optimizer",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "ja": [
            "最適化器",
            "オプティマイザー"
          ]
        },
        "concept_id": "optimizer",
        "preferred": {
          "en": "optimizer",
          "ja": "オプティマイザ"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "objective",
              "optimization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/optimizer.txt",
      "title": "optimizer"
    },
    {
      "document_id": "terminology:orthogonality_thesis",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "ja": [
            "直交仮説"
          ]
        },
        "concept_id": "orthogonality_thesis",
        "preferred": {
          "en": "Orthogonality Thesis",
          "ja": "直交性テーゼ"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "goal_directed_behavior",
              "terminal_goal"
            ],
            "related": [
              "paperclip_maximizer"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/orthogonality_thesis.txt",
      "title": "Orthogonality Thesis"
    },
    {
      "document_id": "terminology:outcome_supervision",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "outcome-based supervision",
            "outcome-based training"
          ]
        },
        "concept_id": "outcome_supervision",
        "preferred": {
          "en": "outcome supervision"
        },
        "relations": {
          "relations": {
            "broader": [
              "oversight"
            ],
            "prerequisite": [
              "training"
            ],
            "related": [
              "process_supervision"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/outcome_supervision.txt",
      "title": "outcome supervision"
    },
    {
      "document_id": "terminology:outer_alignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "outer alignment problem",
            "reward misspecification problem"
          ]
        },
        "concept_id": "outer_alignment",
        "preferred": {
          "en": "outer alignment",
          "ja": "アウターアラインメント"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_alignment"
            ],
            "prerequisite": [
              "ai_alignment",
              "alignment_target",
              "training_objective"
            ],
            "related": [
              "reinforcement_learning_from_human_feedback"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/outer_alignment.txt",
      "title": "outer alignment"
    },
    {
      "document_id": "terminology:outer_misalignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "outer alignment failure",
            "reward misspecification"
          ]
        },
        "concept_id": "outer_misalignment",
        "preferred": {
          "en": "outer misalignment",
          "ja": "アウター・ミスアラインメント"
        },
        "relations": {
          "relations": {
            "broader": [
              "misalignment"
            ],
            "prerequisite": [
              "misalignment",
              "outer_alignment"
            ],
            "related": [
              "proxy_objective"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/outer_misalignment.txt",
      "title": "outer misalignment"
    },
    {
      "document_id": "terminology:oversight",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI oversight",
            "human oversight"
          ],
          "ja": [
            "オーバーサイト",
            "監視"
          ]
        },
        "concept_id": "oversight",
        "preferred": {
          "en": "oversight",
          "ja": "監督"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_safety"
            ],
            "related": [
              "sandbagging",
              "situational_awareness"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/oversight.txt",
      "title": "oversight"
    },
    {
      "document_id": "terminology:p_doom",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "probability of doom",
            "Pdoom"
          ],
          "ja": [
            "破滅確率",
            "破滅の確率"
          ]
        },
        "concept_id": "p_doom",
        "preferred": {
          "en": "p(doom)",
          "ja": "p(doom)"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "ai_risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/p_doom.txt",
      "title": "p(doom)"
    },
    {
      "document_id": "terminology:paperclip_maximizer",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "paperclip maximiser"
          ]
        },
        "concept_id": "paperclip_maximizer",
        "preferred": {
          "en": "paperclip maximizer",
          "ja": "クリップ最大化器"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "goal_directed_behavior",
              "terminal_goal"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/paperclip_maximizer.txt",
      "title": "paperclip maximizer"
    },
    {
      "document_id": "terminology:pivotal_act",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI-enabled pivotal act",
            "pivotal achievement"
          ]
        },
        "concept_id": "pivotal_act",
        "preferred": {
          "en": "pivotal act",
          "ja": "pivotal act"
        },
        "status": "active"
      },
      "path": "terminology/pivotal_act.txt",
      "title": "pivotal act"
    },
    {
      "document_id": "terminology:power_concentration",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "centralization of power",
            "concentration of power"
          ],
          "ja": [
            "権力の集中"
          ]
        },
        "concept_id": "power_concentration",
        "preferred": {
          "en": "power concentration",
          "ja": "権力集中"
        },
        "status": "active"
      },
      "path": "terminology/power_concentration.txt",
      "title": "power concentration"
    },
    {
      "document_id": "terminology:power_seeking",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "power seeking"
          ]
        },
        "concept_id": "power_seeking",
        "preferred": {
          "en": "power-seeking",
          "ja": "パワーシーキング"
        },
        "relations": {
          "relations": {
            "broader": [
              "goal_directed_behavior"
            ],
            "prerequisite": [
              "goal_directed_behavior"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/power_seeking.txt",
      "title": "power-seeking"
    },
    {
      "document_id": "terminology:preferences",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "preferences",
        "preferred": {
          "en": "preferences",
          "ja": "選好"
        },
        "relations": {
          "relations": {
            "related": [
              "values"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/preferences.txt",
      "title": "preferences"
    },
    {
      "document_id": "terminology:process_supervision",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "process-based supervision",
            "process-based training"
          ]
        },
        "concept_id": "process_supervision",
        "preferred": {
          "en": "process supervision"
        },
        "relations": {
          "relations": {
            "broader": [
              "oversight"
            ],
            "prerequisite": [
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/process_supervision.txt",
      "title": "process supervision"
    },
    {
      "document_id": "terminology:prosaic_alignment",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "prosaic AI alignment"
          ]
        },
        "concept_id": "prosaic_alignment",
        "preferred": {
          "en": "prosaic alignment",
          "ja": "プロセイック・アラインメント"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_alignment"
            ],
            "prerequisite": [
              "ai_alignment",
              "machine_learning"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/prosaic_alignment.txt",
      "title": "prosaic alignment"
    },
    {
      "document_id": "terminology:proxy_objective",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "proxy objective function"
          ],
          "ja": [
            "プロキシ目的",
            "代理目的関数"
          ]
        },
        "concept_id": "proxy_objective",
        "preferred": {
          "en": "proxy objective",
          "ja": "代理目的"
        },
        "relations": {
          "relations": {
            "broader": [
              "objective"
            ],
            "prerequisite": [
              "objective"
            ],
            "related": [
              "specification_gaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/proxy_objective.txt",
      "title": "proxy objective"
    },
    {
      "document_id": "terminology:recursive_self_improvement",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "RSI",
            "recursive AI self-improvement"
          ]
        },
        "concept_id": "recursive_self_improvement",
        "preferred": {
          "en": "recursive self-improvement",
          "ja": "再帰的自己改善"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/recursive_self_improvement.txt",
      "title": "recursive self-improvement"
    },
    {
      "document_id": "terminology:red_teaming",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI red teaming",
            "red-teaming",
            "red team testing"
          ]
        },
        "concept_id": "red_teaming",
        "preferred": {
          "en": "red teaming"
        },
        "relations": {
          "relations": {
            "broader": [
              "evaluation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/red_teaming.txt",
      "title": "red teaming"
    },
    {
      "document_id": "terminology:reinforcement_learning",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "RL"
          ]
        },
        "concept_id": "reinforcement_learning",
        "preferred": {
          "en": "reinforcement learning",
          "ja": "強化学習"
        },
        "relations": {
          "relations": {
            "broader": [
              "machine_learning"
            ],
            "prerequisite": [
              "agent",
              "reward",
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/reinforcement_learning.txt",
      "title": "reinforcement learning"
    },
    {
      "document_id": "terminology:reinforcement_learning_from_human_feedback",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "RLHF",
            "reinforcement learning with human feedback"
          ]
        },
        "concept_id": "reinforcement_learning_from_human_feedback",
        "preferred": {
          "en": "reinforcement learning from human feedback",
          "ja": "人間のフィードバックによる強化学習"
        },
        "relations": {
          "relations": {
            "broader": [
              "reinforcement_learning"
            ],
            "prerequisite": [
              "human_preferences",
              "reinforcement_learning",
              "reward"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/reinforcement_learning_from_human_feedback.txt",
      "title": "reinforcement learning from human feedback"
    },
    {
      "document_id": "terminology:resource_acquisition",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "resource-seeking",
            "resource seeking"
          ]
        },
        "concept_id": "resource_acquisition",
        "preferred": {
          "en": "resource acquisition",
          "ja": "資源獲得"
        },
        "relations": {
          "relations": {
            "broader": [
              "power_seeking"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/resource_acquisition.txt",
      "title": "resource acquisition"
    },
    {
      "document_id": "terminology:responsible_scaling_policy",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "RSP",
            "RSPs",
            "Responsible Scaling Policies"
          ]
        },
        "concept_id": "responsible_scaling_policy",
        "preferred": {
          "en": "Responsible Scaling Policy"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_governance"
            ],
            "prerequisite": [
              "capability_threshold"
            ],
            "related": [
              "safety_case"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/responsible_scaling_policy.txt",
      "title": "Responsible Scaling Policy"
    },
    {
      "document_id": "terminology:reward",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "reinforcement signal",
            "reward signal"
          ]
        },
        "concept_id": "reward",
        "preferred": {
          "en": "reward",
          "ja": "報酬"
        },
        "relations": {
          "relations": {
            "related": [
              "training_objective"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/reward.txt",
      "title": "reward"
    },
    {
      "document_id": "terminology:reward_hacking",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "reward-hacking"
          ],
          "ja": [
            "リワードハッキング"
          ]
        },
        "concept_id": "reward_hacking",
        "preferred": {
          "en": "reward hacking",
          "ja": "報酬ハッキング"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "reward"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/reward_hacking.txt",
      "title": "reward hacking"
    },
    {
      "document_id": "terminology:reward_tampering",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "reward channel tampering",
            "reward-channel tampering",
            "reward process tampering"
          ],
          "ja": [
            "報酬の改ざん"
          ]
        },
        "concept_id": "reward_tampering",
        "preferred": {
          "en": "reward tampering",
          "ja": "報酬改ざん"
        },
        "relations": {
          "relations": {
            "broader": [
              "reward_hacking"
            ],
            "prerequisite": [
              "reward"
            ],
            "related": [
              "specification_gaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/reward_tampering.txt",
      "title": "reward tampering"
    },
    {
      "document_id": "terminology:risk",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "risk",
        "preferred": {
          "en": "risk",
          "ja": "リスク"
        },
        "status": "active"
      },
      "path": "terminology/risk.txt",
      "title": "risk"
    },
    {
      "document_id": "terminology:safety_case",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI safety case",
            "AI safety cases",
            "safety cases"
          ]
        },
        "concept_id": "safety_case",
        "preferred": {
          "en": "safety case"
        },
        "relations": {
          "relations": {
            "broader": [
              "ai_safety"
            ],
            "prerequisite": [
              "risk"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/safety_case.txt",
      "title": "safety case"
    },
    {
      "document_id": "terminology:sandbagging",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI sandbagging",
            "strategic underperformance"
          ]
        },
        "concept_id": "sandbagging",
        "preferred": {
          "en": "sandbagging",
          "ja": "サンドバッギング"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "capability",
              "evaluation"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/sandbagging.txt",
      "title": "sandbagging"
    },
    {
      "document_id": "terminology:scalable_oversight",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "ja": [
            "スケーラブルオーバーサイト"
          ]
        },
        "concept_id": "scalable_oversight",
        "preferred": {
          "en": "scalable oversight",
          "ja": "スケーラブル・オーバーサイト"
        },
        "relations": {
          "relations": {
            "broader": [
              "oversight"
            ],
            "prerequisite": [
              "evaluation",
              "oversight"
            ],
            "related": [
              "weak_to_strong_generalization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/scalable_oversight.txt",
      "title": "scalable oversight"
    },
    {
      "document_id": "terminology:scheming",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI scheming",
            "schemer"
          ]
        },
        "concept_id": "scheming",
        "preferred": {
          "en": "scheming",
          "ja": "スキーミング"
        },
        "relations": {
          "relations": {
            "broader": [
              "deception"
            ],
            "prerequisite": [
              "deception",
              "goal_directed_behavior",
              "misalignment",
              "situational_awareness"
            ],
            "related": [
              "training_gaming"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/scheming.txt",
      "title": "scheming"
    },
    {
      "document_id": "terminology:security_mindset",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "security-oriented mindset"
          ]
        },
        "concept_id": "security_mindset",
        "preferred": {
          "en": "security mindset",
          "ja": "セキュリティ・マインドセット"
        },
        "status": "active"
      },
      "path": "terminology/security_mindset.txt",
      "title": "security mindset"
    },
    {
      "document_id": "terminology:self_preservation",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "self preservation"
          ]
        },
        "concept_id": "self_preservation",
        "preferred": {
          "en": "self-preservation",
          "ja": "自己保存"
        },
        "relations": {
          "relations": {
            "broader": [
              "power_seeking"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/self_preservation.txt",
      "title": "self-preservation"
    },
    {
      "document_id": "terminology:sharp_left_turn",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "hard left turn"
          ]
        },
        "concept_id": "sharp_left_turn",
        "preferred": {
          "en": "sharp left turn",
          "ja": "シャープ・レフト・ターン"
        },
        "relations": {
          "relations": {
            "broader": [
              "alignment_failure"
            ],
            "prerequisite": [
              "capability_generalization",
              "distribution_shift",
              "generalization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/sharp_left_turn.txt",
      "title": "sharp left turn"
    },
    {
      "document_id": "terminology:situational_awareness",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI situational awareness"
          ]
        },
        "concept_id": "situational_awareness",
        "preferred": {
          "en": "situational awareness",
          "ja": "状況認識"
        },
        "relations": {
          "relations": {
            "broader": [
              "capability"
            ],
            "related": [
              "world_model"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/situational_awareness.txt",
      "title": "situational awareness"
    },
    {
      "document_id": "terminology:specification_gaming",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "reward gaming",
            "specification gaming behavior"
          ]
        },
        "concept_id": "specification_gaming",
        "preferred": {
          "en": "specification gaming",
          "ja": "仕様ゲーミング"
        },
        "relations": {
          "relations": {
            "broader": [
              "outer_misalignment",
              "reward_hacking"
            ],
            "prerequisite": [
              "objective",
              "outer_misalignment"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/specification_gaming.txt",
      "title": "specification gaming"
    },
    {
      "document_id": "terminology:takeoff_speed",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI takeoff speed",
            "speed of AI takeoff"
          ]
        },
        "concept_id": "takeoff_speed",
        "preferred": {
          "en": "takeoff speed",
          "ja": "離陸速度"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/takeoff_speed.txt",
      "title": "takeoff speed"
    },
    {
      "document_id": "terminology:takeover_seeking",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI takeover-seeking",
            "takeover seeking"
          ],
          "ja": [
            "乗っ取り"
          ]
        },
        "concept_id": "takeover_seeking",
        "preferred": {
          "en": "takeover-seeking"
        },
        "relations": {
          "relations": {
            "broader": [
              "power_seeking"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/takeover_seeking.txt",
      "title": "takeover-seeking"
    },
    {
      "document_id": "terminology:technology_explosion",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "AI technology explosion",
            "technological explosion"
          ]
        },
        "concept_id": "technology_explosion",
        "preferred": {
          "en": "technology explosion",
          "ja": "技術爆発"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "artificial_intelligence",
              "capability"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/technology_explosion.txt",
      "title": "technology explosion"
    },
    {
      "document_id": "terminology:terminal_goal",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "final goal",
            "ultimate goal"
          ],
          "ja": [
            "終端目標"
          ]
        },
        "concept_id": "terminal_goal",
        "preferred": {
          "en": "terminal goal",
          "ja": "最終目標"
        },
        "relations": {
          "relations": {
            "broader": [
              "goal"
            ],
            "prerequisite": [
              "goal"
            ],
            "related": [
              "utility_function"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/terminal_goal.txt",
      "title": "terminal goal"
    },
    {
      "document_id": "terminology:training",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "model training"
          ]
        },
        "concept_id": "training",
        "preferred": {
          "en": "training",
          "ja": "学習"
        },
        "relations": {
          "relations": {
            "broader": [
              "optimization"
            ],
            "prerequisite": [
              "optimization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/training.txt",
      "title": "training"
    },
    {
      "document_id": "terminology:training_gaming",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "playing the training game",
            "training game",
            "training gaming",
            "training-gamer"
          ],
          "ja": [
            "訓練ゲーム",
            "訓練ゲーミング"
          ]
        },
        "concept_id": "training_gaming",
        "preferred": {
          "en": "training-gaming",
          "ja": "トレーニング・ゲーミング"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "reward",
              "situational_awareness",
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/training_gaming.txt",
      "title": "training-gaming"
    },
    {
      "document_id": "terminology:training_objective",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "training objective function"
          ],
          "ja": [
            "訓練目的関数"
          ]
        },
        "concept_id": "training_objective",
        "preferred": {
          "en": "training objective",
          "ja": "学習目的関数"
        },
        "relations": {
          "relations": {
            "broader": [
              "objective"
            ],
            "prerequisite": [
              "training"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/training_objective.txt",
      "title": "training objective"
    },
    {
      "document_id": "terminology:trusted_monitoring",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "trusted model monitoring",
            "trusted monitoring protocol"
          ]
        },
        "concept_id": "trusted_monitoring",
        "preferred": {
          "en": "trusted monitoring"
        },
        "relations": {
          "relations": {
            "broader": [
              "control_protocol",
              "oversight"
            ],
            "prerequisite": [
              "control_protocol",
              "oversight"
            ],
            "related": [
              "untrusted_monitoring"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/trusted_monitoring.txt",
      "title": "trusted monitoring"
    },
    {
      "document_id": "terminology:untrusted_monitoring",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "untrusted model monitoring",
            "untrusted monitoring protocol"
          ]
        },
        "concept_id": "untrusted_monitoring",
        "preferred": {
          "en": "untrusted monitoring"
        },
        "relations": {
          "relations": {
            "broader": [
              "control_protocol",
              "oversight"
            ],
            "prerequisite": [
              "control_protocol",
              "oversight"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/untrusted_monitoring.txt",
      "title": "untrusted monitoring"
    },
    {
      "document_id": "terminology:utility_function",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "utility functions"
          ]
        },
        "concept_id": "utility_function",
        "preferred": {
          "en": "utility function",
          "ja": "効用関数"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "preferences"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/utility_function.txt",
      "title": "utility function"
    },
    {
      "document_id": "terminology:value_fragility",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "fragility of value",
            "value is fragile"
          ]
        },
        "concept_id": "value_fragility",
        "preferred": {
          "en": "value fragility",
          "ja": "価値の脆弱性"
        },
        "relations": {
          "relations": {
            "prerequisite": [
              "human_values",
              "optimization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/value_fragility.txt",
      "title": "value fragility"
    },
    {
      "document_id": "terminology:values",
      "layer": "terminology",
      "metadata": {
        "aliases": {},
        "concept_id": "values",
        "preferred": {
          "en": "values",
          "ja": "価値観"
        },
        "status": "active"
      },
      "path": "terminology/values.txt",
      "title": "values"
    },
    {
      "document_id": "terminology:weak_agi",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "weak artificial general intelligence"
          ],
          "ja": [
            "弱いAGI"
          ]
        },
        "concept_id": "weak_agi",
        "preferred": {
          "en": "weak AGI",
          "ja": "弱AGI"
        },
        "relations": {
          "relations": {
            "broader": [
              "artificial_general_intelligence"
            ],
            "prerequisite": [
              "artificial_general_intelligence",
              "capability"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/weak_agi.txt",
      "title": "weak AGI"
    },
    {
      "document_id": "terminology:weak_to_strong_generalization",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "W2SG",
            "weak to strong generalization"
          ]
        },
        "concept_id": "weak_to_strong_generalization",
        "preferred": {
          "en": "weak-to-strong generalization"
        },
        "relations": {
          "relations": {
            "broader": [
              "generalization"
            ],
            "prerequisite": [
              "generalization"
            ]
          }
        },
        "status": "active"
      },
      "path": "terminology/weak_to_strong_generalization.txt",
      "title": "weak-to-strong generalization"
    },
    {
      "document_id": "terminology:world_model",
      "layer": "terminology",
      "metadata": {
        "aliases": {
          "en": [
            "world-model"
          ]
        },
        "concept_id": "world_model",
        "preferred": {
          "en": "world model"
        },
        "status": "active"
      },
      "path": "terminology/world_model.txt",
      "title": "world model"
    }
  ],
  "format_version": 1
}
