MR
Marc'Aurelio Ranzato
cs.LGcs.CLcs.CVcs.AIstat.MLcs.NEBraincomputational modelscs.IRdevelopment
On Valency
published · living versionsW_3p4mg6bx·v1 · currentpublished
Sequence Level Training with Recurrent Neural Networks
with Sumit Chopra, Michael Auli, Wojciech Zaremba
1 version
Preprints & journals
56 papers in the corpus · 2010–2026Context Training with Active Information Seeking2605.13050v2 · Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng et al.2026 · 0 citationsarXiv
Decoupled DiLoCo for Resilient Distributed Pre-training2604.21428v1 · Arthur Douillard, Keith Rush, Yani Donchev et al.2026 · 0 citationsarXiv
Defending the foundation model view of infant development.40410093 · Cusack, Rhodri, O'Doherty, Cliona, Charvet, Christine J et al.2025 · 0 citationsTrends in cognitive sciences. 2025;29(7):589-590
Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch2501.18512v1 · Arthur Douillard, Yanislav Donchev, Keith Rush et al.2025 · 0 citationsarXiv
DiLoCo: Distributed Low-Communication Training of Language Models2311.08105v3 · Arthur Douillard, Qixuan Feng, Andrei A. Rusu et al.2023 · 8 citationsarXiv
Asynchronous Local-SGD Training for Language Modeling2401.09135v2 · Bo Liu, Rachita Chhaparia, Arthur Douillard et al.2024 · 0 citationsarXiv
Helpless infants are learning a foundation model.38839537 · Cusack, Rhodri, Ranzato, Marc'Aurelio, Charvet, Christine J2024 · 32 citationsTrends in cognitive sciences. 2024;28(8):726-738
DiPaCo: Distributed Path Composition2403.10616v1 · Arthur Douillard, Qixuan Feng, Andrei A. Rusu et al.2024 · 0 citationsarXiv
Towards Robust and Efficient Continual Language Learning2307.05741v1 · Adam Fisch, Amal Rannen-Triki, Razvan Pascanu et al.2023 · 1 citationarXiv
NEVIS'22: A Stream of 100 Tasks Sampled from 30 Years of Computer Vision Research2211.11747v2 · Jorg Bornschein, Alexandre Galashov, Ross Hemsley et al.2022 · 3 citationsarXiv
Towards Compute-Optimal Transfer Learning2304.13164v1 · Massimo Caccia, Alexandre Galashov, Arthur Douillard et al.2023 · 2 citationsarXiv
Transformation-Based Models of Video Sequences1701.08435v3 · Joost van Amersfoort, Anitha Kannan, Marc'Aurelio Ranzato et al.2017 · 61 citationsarXiv
Multi-step Planning for Automated Hyperparameter Optimization with OptFormer2210.04971v2 · Lucio M. Dery, Abram L. Friesen, Nando De Freitas et al.2022 · 0 citationsarXiv
Towards Learning Universal Hyperparameter Optimizers with Transformers2205.13320v2 · Yutian Chen, Xingyou Song, Chansoo Lee et al.2022 · 23 citationsarXiv
Gradient Episodic Memory for Continual Learning1706.08840v6 · David Lopez-Paz, Marc'Aurelio Ranzato2017 · 493 citationsarXiv
On Anytime Learning at Macroscale2106.09563v5 · Lucas Caccia, Jing Xu, Myle Ott et al.2021 · 0 citationsarXiv
The FLORES-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation2106.03193v1 · Naman Goyal, Cynthia Gao, Vishrav Chaudhary et al.2021 · 279 citationsarXiv
Efficient Continual Learning with Modular Networks and Task-Driven Priors2012.12631v2 · Tom Veniat, Ludovic Denoyer, Marc'Aurelio Ranzato2020 · 32 citationsarXiv
Residual Energy-Based Models for Text2004.10188v2 · Anton Bakhtin, Yuntian Deng, Sam Gross et al.2020 · 26 citationsJournal of Machine Learning Research 21 (2020) 1-41
Few-shot Sequence Learning with Transformers2012.09543v1 · Lajanugen Logeswaran, Ann Lee, Myle Ott et al.2020 · 4 citationsarXiv
Revisiting Self-Training for Neural Sequence Generation1909.13788v3 · Junxian He, Jiatao Gu, Jiajun Shen et al.2019 · 191 citationsarXiv
On The Evaluation of Machine Translation Systems Trained With Back-Translation1908.05204v2 · Sergey Edunov, Myle Ott, Marc'Aurelio Ranzato et al.2019 · 89 citationsarXiv
The Source-Target Domain Mismatch Problem in Machine Translation1909.13151v2 · Jiajun Shen, Peng-Jen Chen, Matt Le et al.2019 · 6 citationsarXiv
Multi-scale Transformer Language Models2005.00581v1 · Sandeep Subramanian, Ronan Collobert, Marc'Aurelio Ranzato et al.2020 · 3 citationsarXiv
Large Memory Layers with Product Keys1907.05242v2 · Guillaume Lample, Alexandre Sablayrolles, Marc'Aurelio Ranzato et al.2019 · 70 citationsarXiv
Real or Fake? Learning to Discriminate Machine from Human Generated Text1906.03351v2 · Anton Bakhtin, Sam Gross, Myle Ott et al.2019 · 32 citationsarXiv
Facebook AI's WAT19 Myanmar-English Translation Task Submission1910.06848v1 · Peng-Jen Chen, Jiajun Shen, Matt Le et al.2019 · 29 citationsarXiv
Multiple-Attribute Text Style Transfer1811.00552v2 · Sandeep Subramanian, Guillaume Lample, Eric Michael Smith et al.2018 · 53 citationsarXiv
The FLoRes Evaluation Datasets for Low-Resource Machine Translation: Nepali-English and Sinhala-English1902.01382v3 · Francisco Guzm'an, Peng-Jen Chen, Myle Ott et al.2019 · 221 citationsarXiv
On Tiny Episodic Memories in Continual Learning1902.10486v4 · Arslan Chaudhry, Marcus Rohrbach, Mohamed Elhoseiny et al.2019 · 316 citationsarXiv
Mixture Models for Diverse Machine Translation: Tricks of the Trade1902.07816v2 · Tianxiao Shen, Myle Ott, Michael Auli et al.2019 · 59 citationsarXiv
Task-Driven Modular Networks for Zero-Shot Compositional Learning1905.05908v1 · Senthil Purushwalkam, Maximilian Nickel, Abhinav Gupta et al.2019 · 157 citationsarXiv
Efficient Lifelong Learning with A-GEM1812.00420v2 · Arslan Chaudhry, Marc'Aurelio Ranzato, Marcus Rohrbach et al.2018 · 661 citationsarXiv
Lightweight Adaptive Mixture of Neural and N-gram Language Models1804.07705v2 · Anton Bakhtin, Arthur Szlam, Marc'Aurelio Ranzato et al.2018 · 8 citationsarXiv
Classical Structured Prediction Losses for Sequence to Sequence Learning1711.04956v5 · Sergey Edunov, Myle Ott, Michael Auli et al.2017 · 163 citationsarXiv
Phrase-Based & Neural Unsupervised Machine Translation1804.07755v2 · Guillaume Lample, Myle Ott, Alexis Conneau et al.2018 · 679 citationsarXiv
Analyzing Uncertainty in Neural Machine Translation1803.00047v4 · Myle Ott, Michael Auli, David Grangier et al.2018 · 54 citationsarXiv
Unsupervised Machine Translation Using Monolingual Corpora Only1711.00043v2 · Guillaume Lample, Alexis Conneau, Ludovic Denoyer et al.2017 · 196 citationsarXiv
Word Translation Without Parallel Data1710.04087v3 · Alexis Conneau, Guillaume Lample, Marc'Aurelio Ranzato et al.2017 · 885 citationsarXiv
Fader Networks: Manipulating Images by Sliding Attributes1706.00409v2 · Guillaume Lample, Neil Zeghidour, Nicolas Usunier et al.2017 · 277 citationsarXiv
Hard Mixtures of Experts for Large Scale Weakly Supervised Vision1704.06363v1 · Sam Gross, Marc'Aurelio Ranzato, Arthur Szlam2017 · 84 citationsarXiv
Building high-level features using large scale unsupervised learning1112.6209v5 · Quoc V. Le, Marc'Aurelio Ranzato, Rajat Monga et al.2011 · 2,019 citationsarXiv
Training Language Models Using Target-Propagation1702.04770v1 · Sam Wiseman, Sumit Chopra, Marc'Aurelio Ranzato et al.2017 · 8 citationsarXiv
Learning through Dialogue Interactions by Asking Questions1612.04936v4 · Jiwei Li, Alexander H. Miller, Sumit Chopra et al.2016 · 82 citationsarXiv
Dialogue Learning With Human-In-The-Loop1611.09823v3 · Jiwei Li, Alexander H. Miller, Sumit Chopra et al.2016 · 46 citationsarXiv
Convolutional networks and learning invariant to homogeneous multiplicative scalings1506.08230v4 · Mark Tygert, Arthur Szlam, Soumith Chintala et al.2015 · 4 citationsAppl. Comput. Harmon. Anal., 42 (1): 154-166, 2017
Sequence Level Training with Recurrent Neural Networks1511.06732v7 · Marc'Aurelio Ranzato, Sumit Chopra, Michael Auli et al.2015 · 1,365 citationsarXivon Valency
Video (language) modeling: a baseline for generative models of natural videos1412.6604v5 · MarcAurelio Ranzato, Arthur Szlam, Joan Bruna et al.2014 · 296 citationsarXiv
Ensemble of Generative and Discriminative Techniques for Sentiment Analysis of Movie Reviews1412.5335v7 · Gr'egoire Mesnil, Tomas Mikolov, Marc'Aurelio Ranzato et al.2014 · 102 citationsarXiv
Predicting Parameters in Deep Learning1306.0543v2 · Misha Denil, Babak Shakibi, Laurent Dinh et al.2013 · 697 citationsarXiv
Career total: 102 works. 56 are in this corpus.Showing the 50 most recent.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.