--- about: - scalable_oversight attributed_to: - engels_et_al basis_through: '2026-08-29' id: engels_et_al.recursive-oversight-does-not-automatically-scale-across-capability-gaps kind: critique language: ja mentions: - capability - oversight status: reviewed --- # 再帰的な oversight を重ねても、能力差が広がってなお成功率を維持できるとは限らない Engels らは、信頼できる弱いモデルがより強い非信頼モデルを oversight し、そのモデルを次段の overseer としてさらに強いモデルを oversight する過程を Nested Scalable Oversight(NSO)として定式化した。この発想では、モデルの能力向上に合わせて oversight を段階的に拡張できることが期待されるが、論文は、段数を増やすだけで全体の成功率が自動的に維持されるわけではないことを定量化している。 [Scaling Laws For Scalable Oversight](#corpus-source-1) まず単一段の実験でも、モデルの能力が上がったときに、監督側の Guard と敵対的に振る舞う被監督側の Houdini のどちらがどれだけ有利になるかは、課題によって大きく異なった。Backdoor Code では Guard の Elo の傾きがほぼ平らなのに対し、Houdini の傾きは急で、能力向上の恩恵を攻撃側が大きく受けていた。反対に Debate では Guard の Elo が能力とともに伸び、Houdini はほぼ横ばいだった。したがって、「モデルが強くなるほど監督能力も同じように伸びる」という単一の scaling law を、すべての oversight 課題に当てはめることはできない。 [Scaling Laws For Scalable Oversight](#corpus-source-2) NSO の理論では、すべての段の oversight が成功したときだけ全体が成功すると置くため、全体の成功確率は各段の成功確率の積になる。最適な段数は、一般的な能力差だけでなく、課題ごとの Guard/Houdini の Elo の傾きや、どちらに有利な課題かにも依存する。Houdini 側が強く有利な領域では一段だけが最適になる場合もあり、段数を増やすこと自体が普遍的な改善策ではない。 [Scaling Laws For Scalable Oversight](#corpus-source-3) さらに、4つの oversight game に当てはめた数値例では、一般能力を表す Elo が 400 ポイント離れたときの最適 NSO 成功率は Mafia 13.5%、Debate 51.7%、Backdoor Code 10.0%、Wargames 9.4% だった。Debate ではランダムに側を選ぶだけでも成功率が 50% なので、51.7% はその基準より 1.7 ポイント高い。著者らのモデルでは、能力差がさらに広がると成功率は概して低下する。少なくともこのモデルと実験で得た scaling の範囲では、再帰的な oversight を重ねるだけで大きな能力差に対応できるという無条件の期待は支持されない。 [Scaling Laws For Scalable Oversight](#corpus-source-1) [Scaling Laws For Scalable Oversight](#corpus-source-4) ただし、これらの値は将来の実運用における失敗率を直接測ったものではない。実験した oversight game は単純化されており、実証評価は単一段の oversight に限られる一方、複数段の NSO はそこで推定した scaling を用いる理論モデルとして分析している。また、敵対的な振る舞いはプロンプトによって作られ、一般的な能力の代理指標には Chatbot Arena Elo を使っている。したがって、この研究が示すのは scalable oversight が不可能だということではなく、再帰化そのものを安全性の保証とみなす前に、課題ごとの scaling と段階をまたぐ誤差の影響を定量的に確かめる必要があるという点である。 [Scaling Laws For Scalable Oversight](#corpus-source-5) ## about - [scalable oversight](../terminology/scalable_oversight.txt) ## mentions - [capability](../terminology/capability.txt) - [oversight](../terminology/oversight.txt) ## Citation references - [Scaling Laws For Scalable Oversight](../sources/engels_et_al.scaling-laws-for-scalable-oversight.txt) - Source: `source:engels_et_al.scaling-laws-for-scalable-oversight` - Locator: `page:1` - [Scaling Laws For Scalable Oversight](../sources/engels_et_al.scaling-laws-for-scalable-oversight.txt) - Source: `source:engels_et_al.scaling-laws-for-scalable-oversight` - Locator: `page:7` - [Scaling Laws For Scalable Oversight](../sources/engels_et_al.scaling-laws-for-scalable-oversight.txt) - Source: `source:engels_et_al.scaling-laws-for-scalable-oversight` - Locator: `page:7-9` - [Scaling Laws For Scalable Oversight](../sources/engels_et_al.scaling-laws-for-scalable-oversight.txt) - Source: `source:engels_et_al.scaling-laws-for-scalable-oversight` - Locator: `page:9` - [Scaling Laws For Scalable Oversight](../sources/engels_et_al.scaling-laws-for-scalable-oversight.txt) - Source: `source:engels_et_al.scaling-laws-for-scalable-oversight` - Locator: `page:10` [Corpus index](../index.txt)