--- aliases: en: - untrusted model monitoring - untrusted monitoring protocol concept_id: untrusted_monitoring preferred: en: untrusted monitoring relations: relations: broader: - control_protocol - oversight prerequisite: - control_protocol - oversight status: active --- # untrusted monitoring An AI-control protocol in which a model that might itself intentionally subvert the safety process is used to monitor another untrusted model's outputs or actions for suspicious or dangerous behavior, gaining monitoring capability at the cost of needing defenses against failures such as collusion. ## broader - [control protocol](../terminology/control_protocol.txt) - [oversight](../terminology/oversight.txt) ## prerequisite - [control protocol](../terminology/control_protocol.txt) - [oversight](../terminology/oversight.txt) ## Documents: about - [Untrusted monitoring は共謀や欺瞞によって破られうる](../documents/akira.untrusted-monitoring-can-fail-by-collusion-or-deception.txt) [Corpus index](../index.txt)