SJ
Saachi Jain
cs.LGcs.AIcs.CLcs.CVcs.CYstat.MLcs.DScs.SDeess.AS
On Valency
published · living versionsW_jsb5733n·v1 · currentpublished
Deliberative Alignment: Reasoning Enables Safer Language Models
with Melody Y. Guan, Manas Joglekar, Eric Wallace, Boaz Barak +10
1 version
Preprints & journals
17 papers in the corpus · 2018–2026OpenAI GPT-5 System Card2601.03267v2 · Aaditya Singh, Adam Fry, Adam Perelman et al.2025 · 18 citationsarXiv
Jointly Embedding Protein Structures and Sequences through Residue Level Alignment.41049045 · Birnbaum, Foster, Jain, Saachi, Madry, Aleksander et al.2025 · 6 citationsPRX life. 2024;2(4)
From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training2508.09224v1 · Yuan Yuan, Tina Sriskandarajah, Anna-Luisa Brakman et al.2025 · 5 citationsarXiv
Deliberative Alignment: Reasoning Enables Safer Language Models2412.16339v2 · Melody Y. Guan, Manas Joglekar, Eric Wallace et al.2024 · 34 citationsarXivon Valency
GPT-4o System Card2410.21276v1 · OpenAI: Aaron Hurst, Adam Lerer, Adam P. Goucher et al.2024 · 165 citationsarXiv
Data Debiasing with Datamodels (D3M): Improving Subgroup Robustness via Data Selection2406.16846v1 · Saachi Jain, Kimia Hamidieh, Kristian Georgiev et al.2024 · 1 citationarXiv
Dataset Interfaces: Diagnosing Model Failures Using Controllable Counterfactual Generation2302.07865v2 · Joshua Vendrow, Saachi Jain, Logan Engstrom et al.2023 · 10 citationsarXiv
Distilling Model Failures as Directions in Latent Space2206.14754v2 · Saachi Jain, Hannah Lawrence, Ankur Moitra et al.2022 · 11 citationsarXiv
Combining Diverse Feature Priors2110.08220v2 · Saachi Jain, Dimitris Tsipras, Aleksander Madry2021 · 0 citationsarXiv
A Data-Based Perspective on Transfer Learning2207.05739v1 · Saachi Jain, Hadi Salman, Alaa Khaddaj et al.2022 · 18 citationsarXiv
When does Bias Transfer in Transfer Learning?2207.02842v1 · Hadi Salman, Saachi Jain, Andrew Ilyas et al.2022 · 13 citationsarXiv
Missingness Bias in Model Debugging2204.08945v2 · Saachi Jain, Hadi Salman, Eric Wong et al.2022 · 6 citationsarXiv
Certified Patch Robustness via Smoothed Vision Transformers2110.07719v1 · Hadi Salman, Saachi Jain, Eric Wong et al.2021 · 41 citationsarXiv
A Mechanism for Producing Aligned Latent Spaces with Autoencoders2106.15456v1 · Saachi Jain, Adityanarayanan Radhakrishnan, Caroline Uhler2021 · 0 citationsarXiv
Spectral Lower Bounds on the I/O Complexity of Computation Graphs1909.09791v2 · Saachi Jain, Matei Zaharia2019 · 6 citationsarXiv
MASA: Motif-Aware State Assignment in Noisy Time Series Data1809.01819v2 · Saachi Jain, David Hallac, Rok Sosic et al.2018 · 7 citationsarXiv
Learning to Speak and Act in a Fantasy Text Adventure Game1903.03094v1 · Jack Urbanek, Angela Fan, Siddharth Karamcheti et al.2019 · 163 citationsarXiv
Career total: 23 works. 17 are in this corpus.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.