MM
Monte MacDiarmid
cs.AIcs.CLcs.LGcs.CRcs.SE
On Valency
published · living versionsW_5uruupn8·v1 · currentpublished
Auditing language models for hidden objectives
with Samuel Marks, Johannes Treutlein, Trenton Bricken, Jack Lindsey +30
1 version
Preprints & journals
7 papers in the corpus · 2023–2026Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet2605.29358v1 · Adly Templeton, Tom Conerly, Jonathan Marcus et al.2026 · 0 citationsarXiv
Auditing language models for hidden objectives2503.10965v2 · Samuel Marks, Johannes Treutlein, Trenton Bricken et al.2025 · 4 citationsarXivon Valency
Alignment faking in large language models2412.14093v2 · Ryan Greenblatt, Carson Denison, Benjamin Wright et al.2024 · 26 citationsarXivon Valency
Steering Language Models With Activation Engineering2308.10248v5 · Alexander Matt Turner, Lisa Thiergart, Gavin Leech et al.2023 · 7 citationsarXiv
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models2406.10162v3 · Carson Denison, Monte MacDiarmid, Fazl Barez et al.2024 · 9 citationsarXivon Valency
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training2401.05566v3 · Evan Hubinger, Carson Denison, Jesse Mu et al.2024 · 39 citationsarXivon Valency
Understanding and Controlling a Maze-Solving Policy Network2310.08043v1 · Ulisse Mini, Peli Grietzer, Mrinank Sharma et al.2023 · 0 citationsarXiv
Career total: 11 works. 7 are in this corpus.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.