BS

Buck Shlegeris

cs.AIcs.LGcs.CLcs.CRcs.CYcs.SEstat.MLcs.NEmath.PR

On Valency

published · living versions
W_uutna755·v1 · currentpublished
Alignment faking in large language models
with Ryan Greenblatt, Carson Denison, Benjamin Wright, Fabien Roger +15
1 version

Preprints & journals

23 papers in the corpus · 2018–2026
AI Security Priorities: A Field-Wide Agenda2607.26069v1 · Gil Gekker, Rachel Steratore, Everett Smith et al.2026 · 0 citationsarXiv
Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols2409.07985v2 · Charlie Griffin, Louis Thomson, Buck Shlegeris et al.2024 · 1 citationarXiv
Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases2604.16286v2 · Eric Gan, Aryan Bhatt, Buck Shlegeris et al.2026 · 0 citationsarXiv
Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety2507.11473v2 · Tomek Korbak, Mikita Balesni, Elizabeth Barnes et al.2025 · 2 citationsarXiv
The Singapore Consensus on Global AI Safety Research Priorities2506.20702v2 · Yoshua Bengio, Tegan Maharaj, Luke Ong et al.2025 · 5 citationsarXiv
Ctrl-Z: Controlling AI Agents via Resampling2504.10374v1 · Aryan Bhatt, Cody Rushing, Adam Kaufman et al.2025 · 0 citationsarXiv
How to evaluate control measures for LLM agents? A trajectory from today to superintelligence2504.05259v1 · Tomek Korbak, Mikita Balesni, Buck Shlegeris et al.2025 · 0 citationsarXiv
Subversion Strategy Eval: Can language models statelessly strategize to subvert control protocols?2412.12480v4 · Alex Mallen, Charlie Griffin, Misha Wagner et al.2024 · 0 citationsarXiv
Polysemanticity and Capacity in Neural Networks2210.01892v4 · Adam Scherlis, Kshitij Sachan, Adam S. Jermyn et al.2022 · 5 citationsarXiv
A sketch of an AI control safety case2501.17315v1 · Tomek Korbak, Joshua Clymer, Benjamin Hilton et al.2025 · 0 citationsarXiv
Alignment faking in large language models2412.14093v2 · Ryan Greenblatt, Carson Denison, Benjamin Wright et al.2024 · 26 citationsarXivon Valency
Adaptive Deployment of Untrusted LLMs Reduces Distributed Threats2411.17693v1 · Jiaxin Wen, Vivek Hebbar, Caleb Larson et al.2024 · 1 citationarXiv
Towards evaluations-based safety cases for AI scheming2411.03336v2 · Mikita Balesni, Marius Hobbhahn, David Lindner et al.2024 · 2 citationsarXiv
Sabotage Evaluations for Frontier Models2410.21514v1 · Joe Benton, Misha Wagner, Eric Christiansen et al.2024 · 2 citationsarXiv
AI Control: Improving Safety Despite Intentional Subversion2312.06942v5 · Ryan Greenblatt, Buck Shlegeris, Kshitij Sachan et al.2023 · 3 citationsarXiv
Language models are better than humans at next-token prediction2212.11281v2 · Buck Shlegeris, Fabien Roger, Lawrence Chan et al.2022 · 5 citationsarXiv
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models2406.10162v3 · Carson Denison, Monte MacDiarmid, Fazl Barez et al.2024 · 9 citationsarXivon Valency
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training2401.05566v3 · Evan Hubinger, Carson Denison, Jesse Mu et al.2024 · 39 citationsarXivon Valency
Generalized Wick Decompositions2310.06686v1 · Chris MacLeod, Evgenia Nitishinskaya, Buck Shlegeris2023 · 0 citationsarXiv
Benchmarks for Detecting Measurement Tampering2308.15605v5 · Fabien Roger, Ryan Greenblatt, Max Nadeau et al.2023 · 0 citationsarXiv
Adversarial Training for High-Stakes Reliability2205.01663v5 · Daniel M. Ziegler, Seraphina Nix, Lawrence Chan et al.2022 · 9 citationsarXiv
Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small2211.00593v1 · Kevin Wang, Alexandre Variengien, Arthur Conmy et al.2022 · 53 citationsarXiv
Supervising strong learners by amplifying weak experts1810.08575v1 · Paul Christiano, Buck Shlegeris, Dario Amodei2018 · 26 citationsarXiv
Career total: 25 works. 23 are in this corpus.

Profile built from the corpus for this byline.

Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.