--- alternate_urls: - https://arxiv.org/abs/2412.14093 - https://arxiv.org/pdf/2412.14093 authors: - Ryan Greenblatt - Carson Denison - Benjamin Wright - Fabien Roger - Monte MacDiarmid - Sam Marks - Johannes Treutlein - Tim Belonax - Jack Chen - David Duvenaud - Akbir Khan - Julian Michael - Sören Mindermann - Ethan Perez - Linda Petrini - Jonathan Uesato - Jared Kaplan - Buck Shlegeris - Samuel R. Bowman - Evan Hubinger citation: locator_schemes: - anchor id: greenblatt_et_al.alignment-faking-large-language-models kind: paper language: en published_at: '2024-12-18' title: Alignment faking in large language models url: https://arxiv.org/html/2412.14093 --- # Alignment faking in large language models Original: [Corpus index](../index.txt)