KN
Karina Nguyen
cs.AIcs.CLcs.LGcs.CVstat.MLcs.CYcs.SDcs.SE
On Valency
published · living versionsW_63ueycek·v1 · currentpublished
Discovering Language Model Behaviors with Model-Written Evaluations
with Ethan Perez, Sam Ringer, Kamilė Lukošiūtė, Edwin Chen +58
1 version
Preprints & journals
12 papers in the corpus · 2022–2026AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence2605.21739v2 · Kate M. Lubrano, Faisal Sayed, Ankita Rathod et al.2026 · 0 citationsarXiv
PitchBench: Measuring Pitch Hearing in Audio-Language Models2605.26176v1 · Milan Liessens Dujardin, Song-Ze Yu, Craver Corbyn Thomas-Smith et al.2026 · 0 citationsarXiv
PostTrainBench: Can LLM Agents Automate LLM Post-Training?2603.08640v2 · Ben Rank, Hardik Bhatnagar, Ameya Prabhu et al.2026 · 0 citationsarXiv
FAIR-Ensemble: When Fairness Naturally Emerges From Deep Ensembling2303.00586v2 · Wei-Yin Ko, Daniel D'souza, Karina Nguyen et al.2023 · 0 citationsarXiv
Evaluating and Mitigating Discrimination in Language Model Decisions2312.03689v1 · Alex Tamkin, Amanda Askell, Liane Lovitt et al.2023 · 10 citationsarXiv
Specific versus General Principles for Constitutional AI2310.13798v1 · Sandipan Kundu, Yuntao Bai, Saurav Kadavath et al.2023 · 7 citationsarXiv
Studying Large Language Model Generalization with Influence Functions2308.03296v1 · Roger Grosse, Juhan Bae, Cem Anil et al.2023 · 26 citationsarXiv
Measuring Faithfulness in Chain-of-Thought Reasoning2307.13702v1 · Tamera Lanham, Anna Chen, Ansh Radhakrishnan et al.2023 · 32 citationsarXiv
Question Decomposition Improves the Faithfulness of Model-Generated Reasoning2307.11768v2 · Ansh Radhakrishnan, Karina Nguyen, Anna Chen et al.2023 · 8 citationsarXiv
Vision Transformers for Mobile Applications: A Short Survey2305.19365v1 · Nahid Alam, Steven Kolawole, Simardeep Sethi et al.2023 · 3 citationsarXiv
The Capacity for Moral Self-Correction in Large Language Models2302.07459v2 · Deep Ganguli, Amanda Askell, Nicholas Schiefer et al.2023 · 53 citationsarXiv
Discovering Language Model Behaviors with Model-Written Evaluations2212.09251v1 · Ethan Perez, Sam Ringer, Kamil\.e Lukosi\=ut\.e et al.2022 · 224 citationsarXivon Valency
Career total: 14 works. 12 are in this corpus.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.