JM
Julian Michael
cs.CLcs.AIcs.LGcs.CYcs.CRcs.HCcs.LOstat.ML
On Valency
published · living versionsW_uutna755·v1 · currentpublished
Alignment faking in large language models
with Ryan Greenblatt, Carson Denison, Benjamin Wright, Fabien Roger +15
1 version
Preprints & journals
34 papers in the corpus · 2016–2026Muse Spark Safety & Preparedness Report2606.12429v1 · Cristina Menghini, Peter Ney, Hamza Kwisaba et al.2026 · 0 citationsarXiv
LLM Novice Uplift on Dual-Use, In Silico Biology Tasks2602.23329v2 · Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus et al.2026 · 1 citationarXiv
Inverse Scaling in Test-Time Compute2507.14417v2 · Aryo Pradipta Gema, Alexander Hagele, Runjin Chen et al.2025 · 0 citationsTransactions on Machine Learning Research (TMLR); 12/2025; https://openreview.net/forum?id=NXgyHW1c7M
Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety2507.11473v2 · Tomek Korbak, Mikita Balesni, Elizabeth Barnes et al.2025 · 2 citationsarXiv
AI Debate Aids Assessment of Controversial Claims2506.02175v2 · Salman Rahman, Sheriff Issaka, Ashima Suvarna et al.2025 · 0 citationsarXiv
Search-Time Data Contamination2508.13180v1 · Ziwen Han, Meher Mankikar, Julian Michael et al.2025 · 4 citationsarXiv
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning2506.22777v2 · Miles Turpin, Andy Arditi, Marvin Li et al.2025 · 0 citationsarXiv
The Singapore Consensus on Global AI Safety Research Priorities2506.20702v2 · Yoshua Bengio, Tegan Maharaj, Luke Ong et al.2025 · 5 citationsarXiv
Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought2403.05518v3 · James Chua, Edward Rees, Hunar Batra et al.2024 · 0 citationsarXiv
FORTRESS: Frontier Risk Evaluation for National Security and Public Safety2506.14922v2 · Christina Q. Knight, Kaustubh Deshpande, Ved Sirdeshmukh et al.2025 · 0 citationsarXiv
Why Do Some Language Models Fake Alignment While Others Don't?2506.18032v1 · Abhay Sheshadri, John Hughes, Julian Michael et al.2025 · 2 citationsarXiv
A Red Teaming Roadmap Towards System-Level Safety2506.05376v2 · Zifan Wang, Christina Q. Knight, Jeremy Kritz et al.2025 · 1 citationarXiv
International AI Safety Report2501.17805v1 · Yoshua Bengio, Soren Mindermann, Daniel Privitera et al.2025 · 15 citationsarXiv
Alignment faking in large language models2412.14093v2 · Ryan Greenblatt, Carson Denison, Benjamin Wright et al.2024 · 26 citationsarXivon Valency
Rapid Response: Mitigating LLM Jailbreaks with a Few Examples2411.07494v1 · Alwin Peng, Julian Michael, Henry Sleight et al.2024 · 0 citationsarXiv
Training Language Models to Win Debates with Self-Play Improves Judge Accuracy2409.16636v1 · Samuel Arnesen, David Rein, Julian Michael2024 · 0 citationsarXiv
Analyzing the Role of Semantic Representations in the Era of Large Language Models2405.01502v1 · Zhijing Jin, Yuen Chen, Fernando Gonzalez et al.2024 · 5 citationsarXiv
Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting2305.04388v2 · Miles Turpin, Julian Michael, Ethan Perez et al.2023 · 196 citationsarXiv
The Case for Scalable, Data-Driven Theory: A Paradigm for Scientific Progress in NLP2312.00349v1 · Julian Michael2023 · 0 citationsarXiv
GPQA: A Graduate-Level Google-Proof Q&A Benchmark2311.12022v1 · David Rein, Betty Li Hou, Asa Cooper Stickland et al.2023 · 27 citationsarXiv
Debate Helps Supervise Unreliable Experts2311.08702v1 · Julian Michael, Salsabila Mahdi, David Rein et al.2023 · 7 citationsarXiv
We're Afraid Language Models Aren't Modeling Ambiguity2304.14399v2 · Alisa Liu, Zhaofeng Wu, Julian Michael et al.2023 · 40 citationsarXiv
kNN-Prompt: Nearest Neighbor Zero-Shot Inference2205.13792v2 · Weijia Shi, Julian Michael, Suchin Gururangan et al.2022 · 3 citationsarXiv
What Do NLP Researchers Believe? Results of the NLP Community Metasurvey2208.12852v1 · Julian Michael, Ari Holtzman, Alicia Parrish et al.2022 · 26 citationsarXiv
Asking It All: Generating Contextualized Questions for any Semantic Role2109.04832v1 · Valentina Pyatkin, Paul Roit, Julian Michael et al.2021 · 23 citationsarXiv
Prompting Contrastive Explanations for Commonsense Reasoning Tasks2106.06823v1 · Bhargavi Paranjape, Julian Michael, Marjan Ghazvininejad et al.2021 · 53 citationsarXiv
Asking without Telling: Exploring Latent Ontologies in Contextual Representations2004.14513v2 · Julian Michael, Jan A. Botha, Ian Tenney2020 · 34 citationsarXiv
AmbigQA: Answering Ambiguous Open-domain Questions2004.10645v2 · Sewon Min, Julian Michael, Hannaneh Hajishirzi et al.2020 · 195 citationsarXiv
Controlled Crowdsourcing for High-Quality QA-SRL Annotation1911.03243v2 · Paul Roit, Ayal Klein, Daniela Stepanov et al.2019 · 47 citationsarXiv
SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems1905.00537v3 · Alex Wang, Yada Pruksachatkun, Nikita Nangia et al.2019 · 1,346 citationsarXiv
GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding1804.07461v3 · Alex Wang, Amanpreet Singh, Julian Michael et al.2018 · 5,683 citationsarXiv
Large-Scale QA-SRL Parsing1805.05377v1 · Nicholas FitzGerald, Julian Michael, Luheng He et al.2018 · 90 citationsarXiv
Crowdsourcing Question-Answer Meaning Representations1711.05885v1 · Julian Michael, Gabriel Stanovsky, Luheng He et al.2017 · 75 citationsarXiv
Proving Infinitary Formulas1608.01626v1 · Amelia Harrison, Vladimir Lifschitz, Julian Michael2016 · 0 citationsarXiv
Career total: 56 works. 34 are in this corpus.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.