--- about: - control_safety_case attributed_to: - korbak_et_al basis_through: '2026-08-28' id: korbak_et_al.control-safety-cases-depend-on-elicitation-transfer-and-extrapolation kind: position language: ja mentions: - ai_control - capability_elicitation - control_evaluation - control_protocol - distribution_shift - safety_case - sandbagging - scheming status: reviewed --- # control safety caseには、能力の十分な引き出しと、評価・外挿の保守性が必要になる Korbak らは、control safety case は、コントロール評価で推定したデータ流出確率が許容リスクの閾値を下回ったというだけでは成立せず、その推定値が実運用時のデータ流出確率を過小評価しない上限になっていることを別途示す必要があると論じる。 [A sketch of an AI control safety case](#corpus-source-1) 彼らの例では、スキーミングしている可能性のある LLM エージェントによる機密データ流出を脅威モデルとし、レッドチームが敵対的な代替モデルを作って、ブルーチームのコントロール・プロトコルを実運用を模した代理環境(deployment proxy)で破れるかを試す。 [A sketch of an AI control safety case](#corpus-source-2) 評価が保守的だといえるための条件は、主に三つに分けられる。第一に、代理環境のコントロール・プロトコルが、実運用時のプロトコルより有効であってはならない。 [A sketch of an AI control safety case](#corpus-source-3) 第二に、レッドチームが作る攻撃方針は、実運用中のモデルが取り得る攻撃より少なくとも同程度に有効でなければならない。そのためには、攻撃戦略を十分に洗い出し、各戦略を実行するための危険な能力を十分に引き出す必要がある。 [A sketch of an AI control safety case](#corpus-source-4) 第三に、小規模な代理環境で得た統計から長期・大規模な実運用のデータ流出確率を推定するとき、仮定やシミュレーションがリスクを過小評価しない形になっていなければならない。 [A sketch of an AI control safety case](#corpus-source-5) とりわけ能力の引き出し(elicitation)は、単なる実装上の細部ではなく、安全性ケースの重要な未解決点である。レッドチームがファインチューニングなどを行っても、実運用で発現し得る能力をすべて引き出せるとは限らない。サンドバッギングを検出する評価や訓練中の能力推移は証拠になり得るが、評価用タスク集合への過学習や、能力を引き出す手法そのものの不備など、意図的な能力隠し以外の理由でも能力を過小評価し得る。Korbak らは、実運用で発現し得る能力を評価時に十分引き出したとどう正当化するかは、なお未解決だとしている。 [A sketch of an AI control safety case](#corpus-source-4) 実運用への外挿にも、保守性を崩す具体的な要因がある。論文は、代理環境と実運用の間に分布シフトが生じること自体はあり得るとしており、その場合でも、実運用のほうが攻撃しやすくならない方向のシフトでなければならない。実運用では、モデルが複数のタスクにわたってデータ流出の準備を進めたり、評価時にはなかった有利な攻撃機会を見つけたりする可能性がある。とくに前者は、このコントロール評価の最大の限界になり得る点として挙げられている。 [A sketch of an AI control safety case](#corpus-source-5) さらに、複数のモデルが並列に動く状況で短時間に多数の攻撃を仕掛けることや、明示的な通信がなくても複数のインスタンスが暗黙に協調することなど、評価設計では十分に扱えていない不確実性も残る。 [A sketch of an AI control safety case](#corpus-source-6) したがって Korbak らの立場では、「コントロール評価の推定値が許容リスクの閾値を下回ったから安全」と直接結論することはできない。control safety caseを成立させるには、危険な能力を十分に引き出していること、評価時の防御と攻撃条件が実運用に対して保守的であること、代理環境から実運用への外挿がリスクを過小評価しないことを、それぞれ証拠で支える必要がある。 [A sketch of an AI control safety case](#corpus-source-1) [A sketch of an AI control safety case](#corpus-source-3) [A sketch of an AI control safety case](#corpus-source-4) [A sketch of an AI control safety case](#corpus-source-5) ただし、この論文が示すのは機密データ流出という一つの脅威モデルについての安全性ケースの試案であり、包括的な安全性ケースではない。 [A sketch of an AI control safety case](#corpus-source-7) ## about - [control safety case](../terminology/control_safety_case.txt) ## mentions - [AI control](../terminology/ai_control.txt) - [capability elicitation](../terminology/capability_elicitation.txt) - [control evaluation](../terminology/control_evaluation.txt) - [control protocol](../terminology/control_protocol.txt) - [distribution shift](../terminology/distribution_shift.txt) - [safety case](../terminology/safety_case.txt) - [sandbagging](../terminology/sandbagging.txt) - [scheming](../terminology/scheming.txt) ## Citation references - [A sketch of an AI control safety case](../sources/korbak_et_al.ai-control-safety-case.txt) - Source: `source:korbak_et_al.ai-control-safety-case` - Locator: `anchor:S7.SS2` - [A sketch of an AI control safety case](../sources/korbak_et_al.ai-control-safety-case.txt) - Source: `source:korbak_et_al.ai-control-safety-case` - Locator: `anchor:S5` - [A sketch of an AI control safety case](../sources/korbak_et_al.ai-control-safety-case.txt) - Source: `source:korbak_et_al.ai-control-safety-case` - Locator: `anchor:S7.SS3` - [A sketch of an AI control safety case](../sources/korbak_et_al.ai-control-safety-case.txt) - Source: `source:korbak_et_al.ai-control-safety-case` - Locator: `anchor:S7.SS4` - [A sketch of an AI control safety case](../sources/korbak_et_al.ai-control-safety-case.txt) - Source: `source:korbak_et_al.ai-control-safety-case` - Locator: `anchor:S7.SS5` - [A sketch of an AI control safety case](../sources/korbak_et_al.ai-control-safety-case.txt) - Source: `source:korbak_et_al.ai-control-safety-case` - Locator: `anchor:S8.SS1` - [A sketch of an AI control safety case](../sources/korbak_et_al.ai-control-safety-case.txt) - Source: `source:korbak_et_al.ai-control-safety-case` - Locator: `anchor:S7.SS1` [Corpus index](../index.txt)