JL

Jeffrey Ladish

cs.AIcs.CLcs.CRcs.CYcs.LGcs.HC

On Valency

published · living versions
W_34tet3c7·v1 · currentpublished
Constitutional AI: Harmlessness from AI Feedback
with Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell +46
1 version

Preprints & journals

10 papers in the corpus · 2022–2026
Language Models Can Autonomously Hack and Self-Replicate2605.06760v1 · Alena Air, Reworr, Nikolaj Kotov et al.2026 · 0 citationsarXiv
Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs2509.14260v2 · Jeremy Schlatter, Benjamin Weinstein-Raun, Jeffrey Ladish2025 · 0 citationsarXiv
Demonstrating specification gaming in reasoning models2502.13295v3 · Alexander Bondarenko, Denis Volk, Dmitrii Volkov et al.2025 · 4 citationsarXiv
The Singapore Consensus on Global AI Safety Research Priorities2506.20702v2 · Yoshua Bengio, Tegan Maharaj, Luke Ong et al.2025 · 5 citationsarXiv
Open Problems in Technical AI Governance2407.14981v2 · Anka Reuel, Ben Bucknall, Stephen Casper et al.2024 · 7 citationsTransactions on Machine Learning Research, 2025
Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits2406.02619v2 · Andis Draguns, Andrew Gritsevskiy, Sumeet Ramesh Motwani et al.2024 · 1 citation38th Conference on Neural Information Processing Systems (NeurIPS 2024)
BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B2311.00117v3 · Pranav Gade, Simon Lermen, Charlie Rogers-Smith et al.2023 · 1 citationarXiv
LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B2310.20624v2 · Simon Lermen, Charlie Rogers-Smith, Jeffrey Ladish2023 · 11 citationsarXiv
Constitutional AI: Harmlessness from AI Feedback2212.08073v1 · Yuntao Bai, Saurav Kadavath, Sandipan Kundu et al.2022 · 322 citationsarXivon Valency
Measuring Progress on Scalable Oversight for Large Language Models2211.03540v2 · Samuel R. Bowman, Jeeyoon Hyun, Ethan Perez et al.2022 · 34 citationsarXiv
Career total: 11 works. 10 are in this corpus.

Profile built from the corpus for this byline.

Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.