FR

Fabien Roger

cs.LGcs.AIcs.CLcs.CRstat.ML

On Valency

published · living versions
W_sgh3nvvu·v1 · currentpublished
Reasoning Models Don't Always Say What They Think
with Yanda Chen, Joe Benton, Ansh Radhakrishnan, Jonathan Uesato +10
1 version

Preprints & journals

21 papers in the corpus · 2022–2026
Red-Teaming Auto Mode: Improving Blocking Classifiers Against Malign Coding Agents2609.19587v2 · Alex Remedios, Simon Storf, Fabien Roger et al.2026 · 0 citationsarXiv
Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets2607.08173v2 · Jack Hopkins, Dipika Khullar, Fabien Roger2026 · 0 citationsarXiv
(Mis)generalization of Helpful-only Fine-tuning2606.04413v1 · Mohammad Omar Khursheed, Baram Sosis, Fabien Roger2026 · 0 citationsarXiv
Narrow Secret Loyalty Dodges Black-Box Audits2605.06846v3 · Alfie Lamerton, Fabien Roger2026 · 0 citationsarXiv
SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors2605.16626v2 · Elle Najt, Colin Toft, Tyler Tracy et al.2026 · 0 citationsarXiv
Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation2602.20400v1 · Callum Canavan, Aditya Shrivastava, Allison Qi et al.2026 · 0 citationsarXiv
Excess Description Length of Learning Generalizable Predictors2601.04728v1 · Elizabeth Donoway, Hailey Joren, Fabien Roger et al.2026 · 0 citationsarXiv
Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety2507.11473v2 · Tomek Korbak, Mikita Balesni, Elizabeth Barnes et al.2025 · 2 citationsarXiv
Inoculation Prompting: Instructing LLMs to misbehave at train-time improves test-time alignment2510.05024v3 · Nevan Wichers, Aram Ebtekar, Ariana Azarbal et al.2025 · 0 citationsarXiv
Why Do Some Language Models Fake Alignment While Others Don't?2506.18032v1 · Abhay Sheshadri, John Hughes, Julian Michael et al.2025 · 2 citationsarXiv
Reasoning Models Don't Always Say What They Think2505.05410v1 · Yanda Chen, Joe Benton, Ansh Radhakrishnan et al.2025 · 9 citationsarXivon Valency
Auditing language models for hidden objectives2503.10965v2 · Samuel Marks, Johannes Treutlein, Trenton Bricken et al.2025 · 4 citationsarXivon Valency
Alignment faking in large language models2412.14093v2 · Ryan Greenblatt, Carson Denison, Benjamin Wright et al.2024 · 26 citationsarXivon Valency
AI Control: Improving Safety Despite Intentional Subversion2312.06942v5 · Ryan Greenblatt, Buck Shlegeris, Kshitij Sachan et al.2023 · 3 citationsarXiv
Language models are better than humans at next-token prediction2212.11281v2 · Buck Shlegeris, Fabien Roger, Lawrence Chan et al.2022 · 5 citationsarXiv
Stress-Testing Capability Elicitation With Password-Locked Models2405.19550v1 · Ryan Greenblatt, Fabien Roger, Dmitrii Krasheninnikov et al.2024 · 0 citationsarXiv
Preventing Language Models From Hiding Their Reasoning2310.18512v2 · Fabien Roger, Ryan Greenblatt2023 · 2 citationsarXiv
Benchmarks for Detecting Measurement Tampering2308.15605v5 · Fabien Roger, Ryan Greenblatt, Max Nadeau et al.2023 · 0 citationsarXiv
Career total: 26 works. 21 are in this corpus.

Profile built from the corpus for this byline.

Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.