--- aliases: en: - AI control eval - AI control evaluation - control eval - control evaluations concept_id: control_evaluation preferred: en: control evaluation relations: relations: broader: - evaluation prerequisite: - control_protocol - evaluation related: - red_teaming status: active --- # control evaluation An adversarial evaluation of a control protocol that estimates its safety and usefulness under pessimistic assumptions about untrusted-model behavior, typically by having a red team construct adversarial substitutes for untrusted models and measuring whether they can cause a specified unacceptable outcome without being caught. ## broader - [evaluation](../terminology/evaluation.txt) ## prerequisite - [control protocol](../terminology/control_protocol.txt) - [evaluation](../terminology/evaluation.txt) ## related - [red teaming](../terminology/red_teaming.txt) ## Documents: mentions - [control safety caseには、能力の十分な引き出しと、評価・外挿の保守性が必要になる](../documents/korbak_et_al.control-safety-cases-depend-on-elicitation-transfer-and-extrapolation.txt) [Corpus index](../index.txt)