FR
Fabien Roger
cs.LGcs.AIcs.CLcs.CRstat.ML
On Valency
published · living versionsW_sgh3nvvu·v1 · currentpublished
Reasoning Models Don't Always Say What They Think
with Yanda Chen, Joe Benton, Ansh Radhakrishnan, Jonathan Uesato +10
1 version
Preprints & journals
21 papers in the corpus · 2022–2026Red-Teaming Auto Mode: Improving Blocking Classifiers Against Malign Coding Agents2609.19587v2 · Alex Remedios, Simon Storf, Fabien Roger et al.2026 · 0 citationsarXiv
Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets2607.08173v2 · Jack Hopkins, Dipika Khullar, Fabien Roger2026 · 0 citationsarXiv
(Mis)generalization of Helpful-only Fine-tuning2606.04413v1 · Mohammad Omar Khursheed, Baram Sosis, Fabien Roger2026 · 0 citationsarXiv
Narrow Secret Loyalty Dodges Black-Box Audits2605.06846v3 · Alfie Lamerton, Fabien Roger2026 · 0 citationsarXiv
SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors2605.16626v2 · Elle Najt, Colin Toft, Tyler Tracy et al.2026 · 0 citationsarXiv
How Useful Is Cross-Domain Generalization for Training LLM Monitors?2605.12265v1 · Sam Martin, Fabien Roger2026 · 0 citationsarXiv
Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation2602.20400v1 · Callum Canavan, Aditya Shrivastava, Allison Qi et al.2026 · 0 citationsarXiv
Excess Description Length of Learning Generalizable Predictors2601.04728v1 · Elizabeth Donoway, Hailey Joren, Fabien Roger et al.2026 · 0 citationsarXiv
Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety2507.11473v2 · Tomek Korbak, Mikita Balesni, Elizabeth Barnes et al.2025 · 2 citationsarXiv
Inoculation Prompting: Instructing LLMs to misbehave at train-time improves test-time alignment2510.05024v3 · Nevan Wichers, Aram Ebtekar, Ariana Azarbal et al.2025 · 0 citationsarXiv
Why Do Some Language Models Fake Alignment While Others Don't?2506.18032v1 · Abhay Sheshadri, John Hughes, Julian Michael et al.2025 · 2 citationsarXiv
Reasoning Models Don't Always Say What They Think2505.05410v1 · Yanda Chen, Joe Benton, Ansh Radhakrishnan et al.2025 · 9 citationsarXivon Valency
Auditing language models for hidden objectives2503.10965v2 · Samuel Marks, Johannes Treutlein, Trenton Bricken et al.2025 · 4 citationsarXivon Valency
Do Unlearning Methods Remove Information from Language Model Weights?2410.08827v3 · Aghyad Deeb, Fabien Roger2024 · 0 citationsarXiv
Alignment faking in large language models2412.14093v2 · Ryan Greenblatt, Carson Denison, Benjamin Wright et al.2024 · 26 citationsarXivon Valency
AI Control: Improving Safety Despite Intentional Subversion2312.06942v5 · Ryan Greenblatt, Buck Shlegeris, Kshitij Sachan et al.2023 · 3 citationsarXiv
Language models are better than humans at next-token prediction2212.11281v2 · Buck Shlegeris, Fabien Roger, Lawrence Chan et al.2022 · 5 citationsarXiv
Stress-Testing Capability Elicitation With Password-Locked Models2405.19550v1 · Ryan Greenblatt, Fabien Roger, Dmitrii Krasheninnikov et al.2024 · 0 citationsarXiv
Preventing Language Models From Hiding Their Reasoning2310.18512v2 · Fabien Roger, Ryan Greenblatt2023 · 2 citationsarXiv
Benchmarks for Detecting Measurement Tampering2308.15605v5 · Fabien Roger, Ryan Greenblatt, Max Nadeau et al.2023 · 0 citationsarXiv
Large Language Models Sometimes Generate Purely Negatively-Reinforced Text2306.07567v2 · Fabien Roger2023 · 0 citationsarXiv
Career total: 26 works. 21 are in this corpus.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.