---
about:
- mechanistic_interpretability
attributed_to:
- chanin_et_al
basis_through: '2026-08-29'
id: chanin_et_al.monosemantic-sae-features-can-have-systematic-false-negatives
kind: critique
language: ja
mentions:
- interpretability
status: reviewed
---
# 一見 monosemantic な SAE latent でも、本来発火すべき入力を取りこぼすことがある
Chanin らは、Sparse Autoencoder(SAE)の latent が、最大活性例だけを見ると一つの人間が解釈可能な概念に対応しているように見えても、その概念に該当する入力すべてで安定して発火するとは限らないことを示している。彼らが feature absorption(特徴吸収)と呼ぶ現象では、より一般的な feature を表す方向成分が、より具体的な子 feature の latent に取り込まれる。その結果、一般的な feature の latent は多くの正例で発火する一方、特定の正例を偽陰性として取りこぼす。
[A is for Absorption](#corpus-source-1)
具体例では、Gemma Scope のある SAE に「S で始まる語」を表すように見える latent があり、先頭文字分類で F1 0.81 を得ていた。しかし、この latent は `_short` では発火しなかった。代わりに `short` に特化した別の latent が発火し、その latent を ablation(無効化)すると予測が大きく損なわれたことから、`short` の先頭文字の予測に大きく因果的に寄与していることが確認された。つまり、見かけ上 monosemantic な「starts with S」latent の不発は、モデルがその feature を使っていないからではなく、同じ方向の寄与が別の具体的な latent に吸収されていたためだった。
[A is for Absorption](#corpus-source-2)
論文は、この現象を先頭文字分類の個別例にとどめず、feature absorption を検出する指標を作り、Gemma Scope を中心とする数百の公開 SAE と、自前で学習した Qwen2 0.5B・Llama 3.2 1B の SAE を調べている。著者らは、テストしたすべての LLM SAE で absorption を観測したと報告し、辞書幅や疎性の調整は程度を変え得るものの、問題を一般に解消する方法にはならなかったとしている。
[A is for Absorption](#corpus-source-3)
[A is for Absorption](#corpus-source-4)
したがって、「一見 monosemantic な SAE latent を見つけたなら、その latent は本来発火すべき場面で安定して発火する」とは推論できない。最大活性例や precision(適合率)だけでは取りこぼしを見落としやすく、recall(再現率)を確認しなければ、その latent が概念を捉える範囲を過大評価する可能性がある。これは、SAE latent を重大な判断に使う分類器として扱う場合や、少数の latent だけで回路を記述しようとする場合に特に問題になる。
[A is for Absorption](#corpus-source-5)
ただし、実験の中心は英単語の先頭文字 feature である。また、著者らの absorption 指標は ablation 効果を用いて因果的な関与を確かめるため、最終層付近にはそのまま適用しにくい。さらに、計算上の制約から、非 JumpReLU の SAE は少数しか学習・評価していない。したがって、この研究は「すべての SAE latent が不安定である」ことを示すのではなく、monosemantic に見えることだけでは高い recall や安定した発火を保証できないという反例を示している。
[A is for Absorption](#corpus-source-5)
## about
- [mechanistic interpretability](../terminology/mechanistic_interpretability.txt)
## mentions
- [interpretability](../terminology/interpretability.txt)
## Citation references
- [A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders](../sources/chanin_et_al.a-is-for-absorption.txt)
- Source: `source:chanin_et_al.a-is-for-absorption`
- Locator: `page:1-2`
- [A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders](../sources/chanin_et_al.a-is-for-absorption.txt)
- Source: `source:chanin_et_al.a-is-for-absorption`
- Locator: `page:5-6`
- [A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders](../sources/chanin_et_al.a-is-for-absorption.txt)
- Source: `source:chanin_et_al.a-is-for-absorption`
- Locator: `page:2`
- [A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders](../sources/chanin_et_al.a-is-for-absorption.txt)
- Source: `source:chanin_et_al.a-is-for-absorption`
- Locator: `page:4-5`
- [A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders](../sources/chanin_et_al.a-is-for-absorption.txt)
- Source: `source:chanin_et_al.a-is-for-absorption`
- Locator: `page:9`
[Corpus index](../index.txt)