--- about: - security_mindset attributed_to: - yudkowsky basis_through: '2026-08-25' id: yudkowsky.security-mindset-for-alignment kind: position language: ja mentions: - ai_alignment - alignment_problem - optimization status: reviewed --- # アラインメントのような新規かつ高リスクなシステムの設計には、既知の失敗を塞ぐ以上の security mindset が必要である Yudkowsky は security mindset を、思いつく攻撃経路を一つずつ想定して塞ぐ ordinary paranoia より深い設計態度として説明する。ordinary paranoia は既知または想像できた失敗経路への対策を増やすが、security mindset では「安全だという推論のどこかが間違っていたらどうなるか」を問い、重要な保証が少数で信頼性の高い仮定に依存するよう設計を変える。したがって、既知の脆弱性を多数修正したこと自体は、未知の失敗経路に対する十分な安全根拠にはならない。 [Security Mindset and Ordinary Paranoia](#corpus-source-1) Yudkowsky はこの考え方を、adverse optimization にさらされ、robustness が必要な新しい種類のシステムへ明示的に拡張している。既存の best practices をそのまま適用できないほど新規で複雑なシステムでは、ordinary paranoia だけでは足りず、セキュリティを後付けの助言や一部の担当者に委ねるのではなく、設計の中心に置く必要があるとする。 [Security Mindset and the Logistic Success Curve](#corpus-source-2) この考えをアラインメントへ適用すると、危険な AI で生じ得る具体的な失敗モードを列挙して順番に塞げばよい、という発想だけでは不十分だという含意がある。高い最適化圧力の下でも成り立つ安全性を主張するには、安全性の保証がシステムのどの仮定に依存しているかを明示し、その仮定が破れた場合にも致命的な失敗へ直結しにくい構造を積極的に作る必要がある。 [Security Mindset and Ordinary Paranoia](#corpus-source-1) [Security Mindset and the Logistic Success Curve](#corpus-source-2) ## about - [security mindset](../terminology/security_mindset.txt) ## mentions - [AI alignment](../terminology/ai_alignment.txt) - [alignment problem](../terminology/alignment_problem.txt) - [optimization](../terminology/optimization.txt) ## Citation references - [Security Mindset and Ordinary Paranoia](../sources/yudkowsky.security-mindset-ordinary-paranoia.txt) - Source: `source:yudkowsky.security-mindset-ordinary-paranoia` - Whole-source citation - [Security Mindset and the Logistic Success Curve](../sources/yudkowsky.security-mindset-logistic-success-curve.txt) - Source: `source:yudkowsky.security-mindset-logistic-success-curve` - Whole-source citation [Corpus index](../index.txt)