SB

Samuel R. Bowman

cs.CLcs.AIcs.LGcs.CYstat.MLcs.CRcs.HCcs.NEcs.SEANN-neural data alignment

On Valency

published · living versions
W_sgh3nvvu·v1 · currentpublished
Reasoning Models Don't Always Say What They Think
with Yanda Chen, Joe Benton, Ansh Radhakrishnan, Jonathan Uesato +10
1 version

Preprints & journals

97 papers in the corpus · 2013–2026
AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors2602.22755v4 · Abhay Sheshadri, Aidan Ewart, Elias Kempf et al.2026 · 2 citationsarXiv
Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought2403.05518v3 · James Chua, Edward Rees, Hunar Batra et al.2024 · 0 citationsarXiv
Towards Understanding Sycophancy in Language Models2310.13548v4 · Mrinank Sharma, Meg Tong, Tomasz Korbak et al.2023 · 132 citationsarXiv
Reasoning Models Don't Always Say What They Think2505.05410v1 · Yanda Chen, Joe Benton, Ansh Radhakrishnan et al.2025 · 9 citationsarXivon Valency
Auditing language models for hidden objectives2503.10965v2 · Samuel Marks, Johannes Treutlein, Trenton Bricken et al.2025 · 4 citationsarXivon Valency
Alignment faking in large language models2412.14093v2 · Ryan Greenblatt, Carson Denison, Benjamin Wright et al.2024 · 26 citationsarXivon Valency
Language Models Learn to Mislead Humans via RLHF2409.12822v3 · Jiaxin Wen, Ruiqi Zhong, Akbir Khan et al.2024 · 4 citationsarXiv
Artificial Neural Network Language Models Predict Human Brain Responses to Language Even After a Developmentally Realistic Amount of Training.38645622 · Hosseini, Eghbal A, Schrimpf, Martin, Zhang, Yian et al.2024 · 66 citationsNeurobiology of language (Cambridge, Mass.). 2024;5(1):43-63
Sabotage Evaluations for Frontier Models2410.21514v1 · Joe Benton, Misha Wagner, Eric Christiansen et al.2024 · 2 citationsarXiv
Debating with More Persuasive LLMs Leads to More Truthful Answers2402.06782v4 · Akbir Khan, John Hughes, Dan Valentine et al.2024 · 11 citationsarXiv
Spontaneous Reward Hacking in Iterative Self-Refinement2407.04549v1 · Jane Pan, He He, Samuel R. Bowman et al.2024 · 0 citationsarXiv
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models2406.10162v3 · Carson Denison, Monte MacDiarmid, Fazl Barez et al.2024 · 9 citationsarXivon Valency
Steering Without Side Effects: Improving Post-Deployment Control of Language Models2406.15518v1 · Asa Cooper Stickland, Alexander Lyzhov, Jacob Pfau et al.2024 · 1 citationarXiv
Inverse Scaling: When Bigger Isn't Better2306.09479v2 · Ian R. McKenzie, Alexander Lyzhov, Michael Pieler et al.2023 · 25 citationsTransactions on Machine Learning Research (TMLR), 10/2023, https://openreview.net/forum?id=DwgRm72GQF
Let's Think Dot by Dot: Hidden Computation in Transformer Language Models2404.15758v1 · Jacob Pfau, William Merrill, Samuel R. Bowman2024 · 4 citationsarXiv
LLM Evaluators Recognize and Favor Their Own Generations2404.13076v1 · Arjun Panickssery, Samuel R. Bowman, Shi Feng2024 · 84 citationsarXiv
ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning2305.19426v1 · Jingyuan Selena She, Christopher Potts, Samuel R. Bowman et al.2023 · 9 citationsarXiv
Improving Code Generation by Training with Natural Language Feedback2303.16749v2 · Angelica Chen, J'er'emy Scheurer, Tomasz Korbak et al.2023 · 10 citationsarXiv
What Artificial Neural Networks Can Tell Us About Human Language Acquisition2208.07998v2 · Alex Warstadt, Samuel R. Bowman2022 · 112 citationsarXiv
Two Failures of Self-Consistency in the Multi-Step Reasoning of LLMs2305.14279v4 · Angelica Chen, Jason Phang, Alicia Parrish et al.2023 · 7 citationsTransactions on Machine Learning Research (2024)
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training2401.05566v3 · Evan Hubinger, Carson Denison, Jesse Mu et al.2024 · 39 citationsarXivon Valency
Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting2305.04388v2 · Miles Turpin, Julian Michael, Ethan Perez et al.2023 · 196 citationsarXiv
GPQA: A Graduate-Level Google-Proof Q&A Benchmark2311.12022v1 · David Rein, Betty Li Hou, Asa Cooper Stickland et al.2023 · 27 citationsarXiv
Debate Helps Supervise Unreliable Experts2311.08702v1 · Julian Michael, Salsabila Mahdi, David Rein et al.2023 · 7 citationsarXiv
(QA)$^2$: Question Answering with Questionable Assumptions2212.10003v2 · Najoung Kim, Phu Mon Htut, Samuel R. Bowman et al.2022 · 4 citationsarXiv
Studying Large Language Model Generalization with Influence Functions2308.03296v1 · Roger Grosse, Juhan Bae, Cem Anil et al.2023 · 26 citationsarXiv
Measuring Faithfulness in Chain-of-Thought Reasoning2307.13702v1 · Tamera Lanham, Anna Chen, Ansh Radhakrishnan et al.2023 · 32 citationsarXiv
Question Decomposition Improves the Faithfulness of Model-Generated Reasoning2307.11768v2 · Ansh Radhakrishnan, Karina Nguyen, Anna Chen et al.2023 · 8 citationsarXiv
Pretraining Language Models with Human Preferences2302.08582v2 · Tomasz Korbak, Kejian Shi, Angelica Chen et al.2023 · 25 citationsarXiv
Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models2206.04615v3 · Aarohi Srivastava, Abhinav Rastogi, Abhishek Rao et al.2022 · 565 citationsTransactions on Machine Learning Research, May/2022, https://openreview.net/forum?id=uyTL5Bvosj
Eight Things to Know about Large Language Models2304.00612v1 · Samuel R. Bowman2023 · 126 citationsarXiv
The Capacity for Moral Self-Correction in Large Language Models2302.07459v2 · Deep Ganguli, Amanda Askell, Nicholas Schiefer et al.2023 · 53 citationsarXiv
BLiMP: The Benchmark of Linguistic Minimal Pairs for English1912.00582v4 · Alex Warstadt, Alicia Parrish, Haokun Liu et al.2019 · 19 citationsarXiv
Discovering Language Model Behaviors with Model-Written Evaluations2212.09251v1 · Ethan Perez, Sam Ringer, Kamil\.e Lukosi\=ut\.e et al.2022 · 224 citationsarXivon Valency
Constitutional AI: Harmlessness from AI Feedback2212.08073v1 · Yuntao Bai, Saurav Kadavath, Sandipan Kundu et al.2022 · 322 citationsarXivon Valency
Measuring Progress on Scalable Oversight for Large Language Models2211.03540v2 · Samuel R. Bowman, Jeeyoon Hyun, Ethan Perez et al.2022 · 34 citationsarXiv
SocioProbe: What, When, and Where Language Models Learn about Sociodemographics2211.04281v1 · Anne Lauscher, Federico Bianchi, Samuel Bowman et al.2022 · 6 citationsarXiv
Two-Turn Debate Doesn't Help Humans Answer Hard Reading Comprehension Questions2210.10860v1 · Alicia Parrish, Harsh Trivedi, Nikita Nangia et al.2022 · 0 citationsarXiv
What Do NLP Researchers Believe? Results of the NLP Community Metasurvey2208.12852v1 · Julian Michael, Ari Holtzman, Alicia Parrish et al.2022 · 26 citationsarXiv
Instruction Induction: From Few Examples to Natural Language Task Descriptions2205.10782v1 · Or Honovich, Uri Shaham, Samuel R. Bowman et al.2022 · 63 citationsarXiv
SQuALITY: Building a Long-Document Summarization Dataset the Hard Way2205.11465v1 · Alex Wang, Richard Yuanzhe Pang, Angelica Chen et al.2022 · 20 citationsarXiv
QuALITY: Question Answering with Long Input Texts, Yes!2112.08608v2 · Richard Yuanzhe Pang, Alicia Parrish, Nitish Joshi et al.2021 · 57 citationsarXiv
Single-Turn Debate Does Not Help Humans Answer Hard Reading-Comprehension Questions2204.05212v2 · Alicia Parrish, Harsh Trivedi, Ethan Perez et al.2022 · 3 citationsarXiv
BBQ: A Hand-Built Bias Benchmark for Question Answering2110.08193v2 · Alicia Parrish, Angelica Chen, Nikita Nangia et al.2021 · 173 citationsarXiv
Adversarially Constructed Evaluation Sets Are More Challenging, but May Not Be Fair2111.08181v1 · Jason Phang, Angelica Chen, William Huang et al.2021 · 2 citationsarXiv
What Will it Take to Fix Benchmarking in Natural Language Understanding?2104.02145v3 · Samuel R. Bowman, George E. Dahl2021 · 95 citationsarXiv
Fine-Tuned Transformers Show Clusters of Similar Representations Across Layers2109.08406v2 · Jason Phang, Haokun Liu, Samuel R. Bowman2021 · 22 citationsarXiv
Career total: 156 works. 97 are in this corpus.Showing the 50 most recent.

Profile built from the corpus for this byline.

Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.