AG

Amelia Glaese

cs.CLcs.AIcs.LGcs.CYcs.CRcs.CV

On Valency

published · living versions
W_6cysh3yv·v1 · currentpublished
PaperBench: Evaluating AI's Ability to Replicate AI Research
with Giulio Starace, Oliver Jaffe, Dane Sherburn, James Aung +8
1 version

Preprints & journals

15 papers in the corpus · 2021–2025
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks2510.04374v1 · Tejal Patwardhan, Rachel Dias, Elizabeth Proehl et al.2025 · 7 citationsarXiv
Stress Testing Deliberative Alignment for Anti-Scheming Training2509.15541v1 · Bronson Schoen, Evgenia Nitishinskaya, Mikita Balesni et al.2025 · 2 citationsarXiv
Gemini: A Family of Highly Capable Multimodal Models2312.11805v5 · Gemini Team Google: Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac et al.2023 · 838 citationsarXiv
BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents2504.12516v1 · Jason Wei, Zhiqing Sun, Spencer Papay et al.2025 · 2 citationsarXiv
Trading Inference-Time Compute for Adversarial Robustness2501.18841v1 · Wojciech Zaremba, Evgenia Nitishinskaya, Boaz Barak et al.2025 · 0 citationsarXivon Valency
Deliberative Alignment: Reasoning Enables Safer Language Models2412.16339v2 · Melody Y. Guan, Manas Joglekar, Eric Wallace et al.2024 · 34 citationsarXivon Valency
Measuring short-form factuality in large language models2411.04368v1 · Jason Wei, Nguyen Karina, Hyung Won Chung et al.2024 · 13 citationsarXiv
Fine-tuning language models to find agreement among humans with diverse preferences2211.15006v1 · Michiel A. Bakker, Martin J. Chadwick, Hannah R. Sheahan et al.2022 · 123 citationsarXiv
Characteristics of Harmful Text: Towards Rigorous Benchmarking of Language Models2206.08325v2 · Maribeth Rauh, John Mellor, Jonathan Uesato et al.2022 · 14 citationsarXiv
Improving alignment of dialogue agents via targeted human judgements2209.14375v1 · Amelia Glaese, Nat McAleese, Maja Trebacz et al.2022 · 132 citationsarXiv
Learning how to Interact with a Complex Interface using Hierarchical Reinforcement Learning2204.10374v1 · Gheorghe Comanici, Amelia Glaese, Anita Gergely et al.2022 · 0 citationsarXiv
Red Teaming Language Models with Language Models2202.03286v1 · Ethan Perez, Saffron Huang, Francis Song et al.2022 · 347 citationsarXiv
Scaling Language Models: Methods, Analysis & Insights from Training Gopher2112.11446v2 · Jack W. Rae, Sebastian Borgeaud, Trevor Cai et al.2021 · 245 citationsarXiv
Challenges in Detoxifying Language Models2109.07445v1 · Johannes Welbl, Amelia Glaese, Jonathan Uesato et al.2021 · 102 citationsarXiv
AndroidEnv: A Reinforcement Learning Platform for Android2105.13231v1 · Daniel Toyama, Philippe Hamel, Anita Gergely et al.2021 · 8 citationsarXiv
Career total: 22 works. 15 are in this corpus.

Profile built from the corpus for this byline.

Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.