AM

Aleksander Madry

cs.LGstat.MLcs.CVcs.DScs.NEcs.CRcs.AIcs.CYcs.CLcs.RO

On Valency

published · living versions
W_fvh7g6bt·v1 · currentpublished
Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation
with Bowen Baker, Joost Huizinga, Leo Gao, Zehao Dou +4
1 version

Preprints & journals

86 papers in the corpus · 2009–2026
Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale2606.30801v1 · Alessandro Morosini, Sarah H. Cen, Andrew Ilyas et al.2026 · 0 citationsarXiv
DataMIL: Selecting Data for Robot Imitation Learning with Datamodels2505.09603v2 · Shivin Dass, Alaa Khaddaj, Logan Engstrom et al.2025 · 0 citationsarXiv
OpenAI GPT-5 System Card2601.03267v2 · Aaditya Singh, Adam Fry, Adam Perelman et al.2025 · 18 citationsarXiv
OpenAI o1 System Card2412.16720v2 · OpenAI: Aaron Jaech, Adam Kalai, Adam Lerer et al.2024 · 44 citationsarXiv
AI Supply Chains: An Emerging Ecosystem of AI Actors, Products, and Services2504.20185v1 · Aspen Hopkins, Sarah H. Cen, Andrew Ilyas et al.2025 · 2 citationsProc. AAAI/ACM Conf. AI Ethics Soc. (AIES), 8(2), 1266-1277 (2025)
Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety2507.11473v2 · Tomek Korbak, Mikita Balesni, Elizabeth Barnes et al.2025 · 2 citationsarXiv
Jointly Embedding Protein Structures and Sequences through Residue Level Alignment.41049045 · Birnbaum, Foster, Jain, Saachi, Madry, Aleksander et al.2025 · 6 citationsPRX life. 2024;2(4)
Large-Scale, Longitudinal Study of Large Language Models During the 2024 US Election Season2509.18446v1 · Sarah H. Cen, Andrew Ilyas, Hedi Driss et al.2025 · 1 citationarXiv
Small-to-Large Generalization: Data Influences Models Consistently Across Scale2505.16260v1 · Alaa Khaddaj, Logan Engstrom, Aleksander Madry2025 · 0 citationsICLR 2025
MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering2410.07095v6 · Jun Shern Chan, Neil Chowdhury, Oliver Jaffe et al.2024 · 9 citationsarXiv
Do Large Language Model Benchmarks Test Reliability?2502.03461v1 · Joshua Vendrow, Edward Vendrow, Sara Beery et al.2025 · 0 citationsarXiv
Ask Your Distribution Shift if Pre-Training is Right for You2403.00194v2 · Benjamin Cohen-Wang, Joshua Vendrow, Aleksander Madry2024 · 1 citationarXiv
Attribute-to-Delete: Machine Unlearning via Datamodel Matching2410.23232v2 · Kristian Georgiev, Roy Rinberg, Sung Min Park et al.2024 · 0 citationsarXiv
GPT-4o System Card2410.21276v1 · OpenAI: Aaron Hurst, Adam Lerer, Adam P. Goucher et al.2024 · 165 citationsarXiv
ContextCite: Attributing Model Generation to Context2409.00729v2 · Benjamin Cohen-Wang, Harshay Shah, Kristian Georgiev et al.2024 · 15 citationsarXiv
Data Debiasing with Datamodels (D3M): Improving Subgroup Robustness via Data Selection2406.16846v1 · Saachi Jain, Kimia Hamidieh, Kristian Georgiev et al.2024 · 1 citationarXiv
Measuring Strategization in Recommendation: Users Adapt Their Behavior to Shape Future Content2405.05596v1 · Sarah H. Cen, Andrew Ilyas, Jennifer Allen et al.2024 · 7 citationsarXiv
Decomposing and Editing Predictions by Modeling Model Computation2404.11534v1 · Harshay Shah, Andrew Ilyas, Aleksander Madry2024 · 2 citationsarXiv
DsDm: Model-Aware Dataset Selection with Datamodels2401.12926v1 · Logan Engstrom, Axel Feldmann, Aleksander Madry2024 · 1 citationarXiv
User Strategization and Trustworthy Algorithms2312.17666v1 · Sarah H. Cen, Andrew Ilyas, Aleksander Madry2023 · 1 citationarXiv
The Journey, Not the Destination: How Data Guides Diffusion Models2312.06205v1 · Kristian Georgiev, Joshua Vendrow, Hadi Salman et al.2023 · 1 citationarXiv
Model metamers reveal divergent invariances between biological and artificial neural networks.37845543 · Feather, Jenelle, Leclerc, Guillaume, Mądry, Aleksander et al.2023 · 55 citationsNature neuroscience. 2023;26(11):2017-2034
Rethinking Backdoor Attacks2307.10163v1 · Alaa Khaddaj, Guillaume Leclerc, Aleksandar Makelov et al.2023 · 3 citationsarXiv
FFCV: Accelerating Training by Removing Data Bottlenecks2306.12517v1 · Guillaume Leclerc, Andrew Ilyas, Logan Engstrom et al.2023 · 33 citationsarXiv
Dataset Interfaces: Diagnosing Model Failures Using Controllable Counterfactual Generation2302.07865v2 · Joshua Vendrow, Saachi Jain, Logan Engstrom et al.2023 · 10 citationsarXiv
A User-Driven Framework for Regulating and Auditing Social Media2304.10525v1 · Sarah H. Cen, Aleksander Madry, Devavrat Shah2023 · 0 citationsarXiv
Dataset Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses.35333711 · Goldblum, Micah, Tsipras, Dimitris, Xie, Chulin et al.2023 · 350 citationsIEEE transactions on pattern analysis and machine intelligence. 2023;45(2):1563-1580
TRAK: Attributing Model Behavior at Scale2303.14186v2 · Sung Min Park, Kristian Georgiev, Andrew Ilyas et al.2023 · 9 citationsarXiv
Raising the Cost of Malicious AI-Powered Image Editing2302.06588v1 · Hadi Salman, Alaa Khaddaj, Guillaume Leclerc et al.2023 · 15 citationsarXiv
Distilling Model Failures as Directions in Latent Space2206.14754v2 · Saachi Jain, Hannah Lawrence, Ankur Moitra et al.2022 · 11 citationsarXiv
ModelDiff: A Framework for Comparing Learning Algorithms2211.12491v1 · Harshay Shah, Sung Min Park, Andrew Ilyas et al.2022 · 5 citationsarXiv
Combining Diverse Feature Priors2110.08220v2 · Saachi Jain, Dimitris Tsipras, Aleksander Madry2021 · 0 citationsarXiv
A Data-Based Perspective on Transfer Learning2207.05739v1 · Saachi Jain, Hadi Salman, Alaa Khaddaj et al.2022 · 18 citationsarXiv
When does Bias Transfer in Transfer Learning?2207.02842v1 · Hadi Salman, Saachi Jain, Andrew Ilyas et al.2022 · 13 citationsarXiv
Missingness Bias in Model Debugging2204.08945v2 · Saachi Jain, Hadi Salman, Eric Wong et al.2022 · 6 citationsarXiv
Datamodels: Predicting Predictions from Training Data2202.00622v1 · Andrew Ilyas, Sung Min Park, Logan Engstrom et al.2022 · 17 citationsarXiv
On Distinctive Properties of Universal Perturbations2112.15329v1 · Sung Min Park, Kuo-An Wei, Kai Xiao et al.2021 · 0 citationsarXiv
Editing a classifier by rewriting its prediction rules2112.01008v1 · Shibani Santurkar, Dimitris Tsipras, Mahalaxmi Elango et al.2021 · 4 citationsarXiv
Faster Sparse Minimum Cost Flow by Electrical Flow Localization2111.10368v1 · Kyriakos Axiotis, Aleksander Madry, Adrian Vladu2021 · 15 citationsarXiv
Certified Patch Robustness via Smoothed Vision Transformers2110.07719v1 · Hadi Salman, Saachi Jain, Eric Wong et al.2021 · 41 citationsarXiv
3DB: A Framework for Debugging Computer Vision Models2106.03805v1 · Guillaume Leclerc, Hadi Salman, Andrew Ilyas et al.2021 · 14 citationsarXiv
Leveraging Sparse Linear Layers for Debuggable Deep Networks2105.04857v1 · Eric Wong, Shibani Santurkar, Aleksander Madry2021 · 3 citationsarXiv
Dataset Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses2012.10544v4 · Micah Goldblum, Dimitris Tsipras, Chulin Xie et al.2020 · 350 citationsarXiv
Unadversarial Examples: Designing Objects for Robust Vision2012.12235v1 · Hadi Salman, Andrew Ilyas, Logan Engstrom et al.2020 · 25 citationsarXiv
Do Adversarially Robust ImageNet Models Transfer Better?2007.08489v2 · Hadi Salman, Andrew Ilyas, Logan Engstrom et al.2020 · 110 citationsarXiv
On Adaptive Attacks to Adversarial Example Defenses2002.08347v2 · Florian Tramer, Nicholas Carlini, Wieland Brendel et al.2020 · 137 citationsarXiv
Identifying Statistical Bias in Dataset Replication2005.09619v2 · Logan Engstrom, Andrew Ilyas, Shibani Santurkar et al.2020 · 7 citationsarXiv
BREEDS: Benchmarks for Subpopulation Shift2008.04859v1 · Shibani Santurkar, Dimitris Tsipras, Aleksander Madry2020 · 17 citationsarXiv
Career total: 141 works. 86 are in this corpus.Showing the 50 most recent.

Profile built from the corpus for this byline.

Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.