--- about: - weak_to_strong_generalization attributed_to: - openai basis_through: '2026-08-27' id: openai.weak-to-strong-supervision-can-recover-some-latent-capability kind: position language: ja mentions: - capability_elicitation - scalable_oversight status: reviewed --- # 弱い監視者でも、強いモデルの潜在能力の一部を引き出せる場合がある OpenAI の weak-to-strong generalization 研究は、弱い監督によって強いモデルを一般に制御できることを示したものではなく、人間が超人的 AI を監督する問題の一部を現在のモデルで検討するための限定的な実験である。小さいモデルが生成した不完全なラベルで、より大きい事前学習済みモデルを訓練し、強いモデルが弱い監督者の誤りをそのまま模倣するのではなく、すでに持つ潜在能力を使って監督者を上回れるかを調べる。この設定は、将来、人間が自分より強い AI を監督する状況の一側面を模したものとして位置づけられている。 [Weak-to-strong generalization](#corpus-source-1) 実験では、強いモデルを弱い監督に単純に従わせるのではなく、必要に応じて監督者と異なる答えを高い確信度で出せるようにする手法を使うと、複数の設定で weak-to-strong generalization が改善した。NLP タスクでは、GPT-2 レベルのモデルで GPT-4 を監督すると、性能は概ね GPT-3 と GPT-3.5 の間に達し、弱い監督だけでも GPT-4 の潜在能力のかなりの部分を引き出せたと OpenAI は報告している。これは、弱いラベルが強いモデルの到達可能な性能をそのまま上限にするとは限らず、潜在能力の一部を引き出せる場合があることを示す概念実証である。 [Weak-to-strong generalization](#corpus-source-2) 一方で、OpenAI 自身もこの結果には重要な限界があると明記している。同じ手法は ChatGPT の選好データでは機能せず、追加の工夫がなければ、RLHF のような単純な人間監督は超人的モデルに対して十分にはスケールしない可能性が示唆された。また、現在の「弱いモデルが強いモデルを監督する」実験と、将来の「人間が超人的モデルを監督する」状況には重要な違いがある。将来のモデルの方が弱い人間の誤りを模倣しやすいなら、weak-to-strong generalization はむしろ難しくなり得るとされる。 [Weak-to-strong generalization](#corpus-source-2) [Weak-to-strong generalization](#corpus-source-3) したがって、ここから支持されるのは、「限定された weak-to-strong の設定では、弱い監督でも強いモデルの潜在能力の一部を引き出せ、弱い監督から得られる性能を改善する手法もある」という狭い主張である。 [Weak-to-strong generalization](#corpus-source-2) 弱い監督だけで超人的システムを確実にアラインできることや、スケーラブル・オーバーサイトの問題が解決したことまで示すものではない。 [Weak-to-strong generalization](#corpus-source-3) ## about - [weak-to-strong generalization](../terminology/weak_to_strong_generalization.txt) ## mentions - [capability elicitation](../terminology/capability_elicitation.txt) - [scalable oversight](../terminology/scalable_oversight.txt) ## Citation references - [Weak-to-strong generalization](../sources/openai.weak-to-strong-generalization.txt) - Source: `source:openai.weak-to-strong-generalization` - Locator: `anchor:Our_setup` - [Weak-to-strong generalization](../sources/openai.weak-to-strong-generalization.txt) - Source: `source:openai.weak-to-strong-generalization` - Locator: `anchor:Our_results` - [Weak-to-strong generalization](../sources/openai.weak-to-strong-generalization.txt) - Source: `source:openai.weak-to-strong-generalization` - Locator: `anchor:Research_opportunities` [Corpus index](../index.txt)