--- aliases: en: - mech interp - mechanistic interp - mechinterp ja: - メカインタープ concept_id: mechanistic_interpretability preferred: en: mechanistic interpretability ja: メカニスティック・インタープリタビリティ relations: relations: broader: - interpretability prerequisite: - interpretability - neural_network status: active --- # mechanistic interpretability A subfield of interpretability that seeks to explain model behavior by analyzing internal mechanisms such as weights, activations, features, and circuits, especially in neural networks. ## broader - [interpretability](../terminology/interpretability.txt) ## prerequisite - [interpretability](../terminology/interpretability.txt) - [neural network](../terminology/neural_network.txt) ## Documents: about - [一見 monosemantic な SAE latent でも、本来発火すべき入力を取りこぼすことがある](../documents/chanin_et_al.monosemantic-sae-features-can-have-systematic-false-negatives.txt) - [SAE の辞書幅を大きくしても、一意・完全・不可分な feature 辞書に収束するとは限らない](../documents/leask_et_al.sae-dictionaries-need-not-be-canonical.txt) ## Documents: mentions - [解釈可能性は危険の診断に役立っても、それだけでアラインメントの解決策にはならない](../documents/yudkowsky.interpretability-is-diagnostic-not-by-itself-an-alignment-solution.txt) [Corpus index](../index.txt)