MJ
Martin Jaggi
cs.LGstat.MLmath.OCcs.CLcs.AIcs.DCcs.CVcs.IRcs.CRcs.DS
On Valency
published · living versionsW_u7fa5rax·v1 · currentpublished
MLSys: The New Frontier of Machine Learning Systems
with Alexander Ratner, Dan Alistarh, Gustavo Alonso, David G. Andersen +64
1 version
Preprints & journals
157 papers in the corpus · 2009–2026Unified Convergence Theory of Stochastic and Variance-Reduced Cubic Newton Methods2302.11962v6 · El Mahdi Chayti, Nikita Doikov, Martin Jaggi2023 · 2 citationsTransactions on Machine Learning Research (2024)
A New First-Order Meta-Learning Algorithm with Convergence Guarantees2409.03682v2 · El Mahdi Chayti, Martin Jaggi2024 · 2 citationsTransactions on Machine Learning Research (2026)
Training DNNs with Hybrid Block Floating Point1804.01526v4 · Mario Drumond, Tao Lin, Martin Jaggi et al.2018 · 26 citationsarXiv
Convex Optimization without Projection Steps1108.1170v6 · Martin Jaggi2011 · 25 citationsarXiv
A Split-Client Approach to Second-Order Optimization2510.15714v3 · El Mahdi Chayti, Martin Jaggi2025 · 0 citationsarXiv
Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining2511.21613v2 · Dongyang Fan, Diba Hashemi, Sai Praneeth Karimireddy et al.2025 · 0 citationsarXiv
An Engineering Journey Training Large Language Models at Scale on Alps: The Apertus Experience2604.12973v2 · Jonathan Coles, Stefano Schuppli, Lukas Drescher et al.2026 · 0 citationsarXiv
Mitigating Unintended Memorization with LoRA in Federated Learning for LLMs2502.05087v3 · Thierry Bossy, Julien Vignoud, Tahseen Rabbani et al.2025 · 0 citationsPublished in Transactions on Machine Learning Research (02/2026)
Enhancing Multilingual LLM Pretraining with Model-Based Data Selection2502.10361v2 · Bettina Messmer, Vinko Sabolcec, Martin Jaggi2025 · 1 citationarXiv
Weight Decay may matter more than muP for Learning Rate Transfer in Practice2510.19093v2 · Atli Kosson, Jeremy Welborn, Yang Liu et al.2025 · 0 citationsarXiv
Leveraging the true depth of LLMs2502.02790v3 · Ram'on Calvo Gonz'alez, Daniele Paliotta, Matteo Pagliardini et al.2025 · 0 citationsarXiv
Stochastic Optimization with Random Search2510.15610v2 · El Mahdi Chayti, Taha El Bakkali El Kadi, Omar Saadi et al.2025 · 0 citationsarXiv
URLs Help, Topics Guide: Understanding Metadata Utility in LLM Training2505.16570v2 · Dongyang Fan, Vinko Sabolcec, Martin Jaggi2025 · 0 citationsarXiv
Towards Fully FP8 GEMM LLM Training at Scale2505.20524v2 · Alejandro Hern'andez-Cano, Dhia Garbaya, Imanol Schlag et al.2025 · 2 citationsarXiv
Stochastic Difference-of-Convex Optimization with Momentum2510.17503v1 · El Mahdi Chayti, Martin Jaggi2025 · 0 citationsarXiv
Benchmarking Optimizers for Large Language Model Pretraining2509.01440v1 · Andrei Semenov, Matteo Pagliardini, Martin Jaggi2025 · 0 citationsarXiv
TiMoE: Time-Aware Mixture of Language Experts2508.08827v1 · Robin Faro, Dongyang Fan, Tamar Alphaidze et al.2025 · 0 citationsarXiv
Can Performant LLMs Be Ethical? Quantifying the Impact of Web Crawling Opt-Outs2504.06219v2 · Dongyang Fan, Vinko Sabolcec, Matin Ansaripour et al.2025 · 1 citationarXiv
Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains2402.04161v2 · Ashok Vardhan Makkuva, Marco Bondaschi, Adway Girish et al.2024 · 1 citationarXiv
Improving Stochastic Cubic Newton with Momentum2410.19644v2 · El Mahdi Chayti, Nikita Doikov, Martin Jaggi2024 · 0 citationsarXiv
FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language2506.20920v1 · Guilherme Penedo, Hynek Kydl'icek, Vinko Sabolcec et al.2025 · 0 citationsarXiv
Gradient-Normalized Smoothness for Optimization with Approximate Hessians2506.13710v1 · Andrei Semenov, Martin Jaggi, Nikita Doikov2025 · 0 citationsarXiv
Intrinsic User-Centric Interpretability through Global Mixture of Experts2402.02933v4 · Vinitra Swamy, Syrielle Montariol, Julian Blackwell et al.2024 · 1 citationarXiv
GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining2505.20380v1 · Simin Fan, Maria Ios Glarou, Martin Jaggi2025 · 0 citationsarXiv
NeuralGrok: Accelerate Grokking by Neural Gradient Transformation2504.17243v2 · Xinyu Zhou, Simin Fan, Martin Jaggi et al.2025 · 0 citationsarXiv
Using Machine Learning for move sequence visualization and generation in climbing2503.00458v1 · Thomas Rimbot, Martin Jaggi, Luis Barba2025 · 1 citationarXiv
Effective Interplay between Sparsity and Quantization: From Theory to Practice2405.20935v2 · Simla Burcu Harma, Ayan Chakraborty, Elizaveta Kostenok et al.2024 · 2 citationsarXiv
Analyzing & Reducing the Need for Learning Rate Warmup in GPT Training2410.23922v1 · Atli Kosson, Bettina Messmer, Martin Jaggi2024 · 2 citationsarXiv
QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs2404.00456v2 · Saleh Ashkboos, Amirkeivan Mohtashami, Maximilian L. Croci et al.2024 · 49 citationsarXiv
Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations2405.18392v3 · Alexander Hagele, Elie Bakouch, Atli Kosson et al.2024 · 2 citationsarXiv
MyThisYourThat for interpretable identification of systematic bias in federated learning for biomedical images.39242810 · Naumova, Klavdiia, Devos, Arnout, Karimireddy, Sai Praneeth et al.2024 · 5 citationsNPJ digital medicine. 2024;7(1):238
CoTFormer: A Chain-of-Thought Driven Architecture with Budget-Adaptive Computation Cost at Inference2310.10845v2 · Amirkeivan Mohtashami, Matteo Pagliardini, Martin Jaggi2023 · 0 citationsarXiv
Personalized Collaborative Fine-Tuning for On-Device Large Language Models2404.09753v2 · Nicolas Wagner, Dongyang Fan, Martin Jaggi2024 · 1 citationCOLM 2024
Rotational Equilibrium: How Weight Decay Balances Learning Across Neural Networks2305.17212v4 · Atli Kosson, Bettina Messmer, Martin Jaggi2023 · 2 citationsarXiv
Accuracy Booster: Enabling 4-bit Fixed-point Arithmetic for DNN Training2211.10737v4 · Simla Burcu Harma, Ayan Chakraborty, Nicholas Sperry et al.2022 · 1 citationarXiv
Deep Grokking: Would Deep Neural Networks Generalize Better?2405.19454v1 · Simin Fan, Razvan Pascanu, Martin Jaggi2024 · 2 citationsarXiv
The Privacy Power of Correlated Noise in Decentralized Learning2405.01031v2 · Youssef Allouah, Anastasia Koloskova, Aymane El Firdoussi et al.2024 · 0 citationsarXiv
DenseFormer: Enhancing Information Flow in Transformers via Depth Weighted Averaging2402.02622v2 · Matteo Pagliardini, Amirkeivan Mohtashami, Francois Fleuret et al.2024 · 0 citationsarXiv
Towards an empirical understanding of MoE design choices2402.13089v1 · Dongyang Fan, Bettina Messmer, Martin Jaggi2024 · 1 citationarXiv
On Convergence of Incremental Gradient for Non-Convex Smooth Functions2305.19259v4 · Anastasia Koloskova, Nikita Doikov, Sebastian U. Stich et al.2023 · 0 citationsarXiv
Spectral Preconditioning for Gradient Methods on Graded Non-convex Functions2402.04843v1 · Nikita Doikov, Sebastian U. Stich, Martin Jaggi2024 · 0 citationsarXiv
LASER: Linear Compression in Wireless Distributed Optimization2310.13033v2 · Ashok Vardhan Makkuva, Marco Bondaschi, Thijs Vogels et al.2023 · 0 citationsarXiv
DoGE: Domain Reweighting with Generalization Estimation2310.15393v2 · Simin Fan, Matteo Pagliardini, Martin Jaggi2023 · 2 citationsarXiv
Ghost Noise for Regularizing Deep Neural Networks2305.17205v2 · Atli Kosson, Dongyang Fan, Martin Jaggi2023 · 2 citationsAAAI 2024
Provably Personalized and Robust Federated Learning2306.08393v2 · Mariel Werner, Lie He, Michael Jordan et al.2023 · 1 citationarXiv
MEDITRON-70B: Scaling Medical Pretraining for Large Language Models2311.16079v1 · Zeming Chen, Alejandro Hern'andez Cano, Angelika Romanou et al.2023 · 122 citationsarXiv
Byzantine-Robust Learning on Heterogeneous Datasets via Bucketing2006.09365v6 · Sai Praneeth Karimireddy, Lie He, Martin Jaggi2020 · 13 citationsarXiv
Landmark Attention: Random-Access Infinite Context Length for Transformers2305.16300v2 · Amirkeivan Mohtashami, Martin Jaggi2023 · 4 citationsarXiv
Controllable Topic-Focused Abstractive Summarization2311.06724v1 · Seyed Ali Bahrainian, Martin Jaggi, Carsten Eickhoff2023 · 0 citationsarXiv
MultiModN- Multimodal, Multi-Task, Interpretable Modular Networks2309.14118v2 · Vinitra Swamy, Malika Satayeva, Jibril Frej et al.2023 · 4 citationsarXiv
Career total: 247 works. 157 are in this corpus.Showing the 50 most recent.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.