--- about: - alignment_faking - evaluation_awareness attributed_to: - akira basis_through: '2026-08-25' id: akira.evaluation-awareness-enables-alignment-faking kind: prediction language: ja mentions: - ai_alignment - evaluation - resource_acquisition - training status: reviewed --- # 評価認識が先に伸びると、資源獲得の有用性を学ぶ頃にはアラインメント偽装が可能になり得る Akira は、2026 年 5 月時点では、AI が主に事務作業、数学の証明、コーディングなどを行うよう訓練されているため、資金調達や人員確保のような資源獲得の有用性をまだ十分に学んでいない可能性があると述べている。より長期的で経営に近い仕事、たとえば CEO の業務やスタートアップ運営のような課題が訓練対象に加わると、資源を獲得することが目標達成に有用だと学ぶ機会が増える、という見通しを示している。 [X @Align_ASI](#corpus-source-1) [X @Align_ASI](#corpus-source-2) そのうえで Akira は、evaluation awareness、すなわち自分がテストされていると認識する能力が急速に伸びていることを問題視する。資源の有用性を学ぶ時期までに評価認識が十分に強くなれば、評価中であると認識したうえで望ましい振る舞いを見せる alignment faking を行える可能性が高まる、と予測している。 [X @Align_ASI](#corpus-source-3) この主張は、現在観測される評価認識だけから、現行モデルがすでに資源獲得を企図している、あるいは実際にアラインメント偽装を行っていると断定するものではない。Akira が指摘しているのは、評価を見抜く能力と、現実世界で資源を使うことの有用性を学ぶ能力が異なる時期に発達し得るため、後者が強まった時点では評価結果の解釈が難しくなっている可能性がある、という発達順序に由来するリスクである。 [X @Align_ASI](#corpus-source-3) ## about - [alignment faking](../terminology/alignment_faking.txt) - [evaluation awareness](../terminology/evaluation_awareness.txt) ## mentions - [AI alignment](../terminology/ai_alignment.txt) - [evaluation](../terminology/evaluation.txt) - [resource acquisition](../terminology/resource_acquisition.txt) - [training](../terminology/training.txt) ## Citation references - [X @Align_ASI post 2055116276960559467](../sources/akira.x.2055116276960559467.txt) - Source: `source:akira.x.2055116276960559467` - Whole-source citation - [X @Align_ASI post 2055116279485489376](../sources/akira.x.2055116279485489376.txt) - Source: `source:akira.x.2055116279485489376` - Whole-source citation - [X @Align_ASI post 2055121067929489784](../sources/akira.x.2055121067929489784.txt) - Source: `source:akira.x.2055121067929489784` - Whole-source citation [Corpus index](../index.txt)