BC
Bryan Catanzaro
cs.LGcs.CLcs.AIcs.CVeess.AScs.SDcs.IRcs.GRstat.MLcs.MM
On Valency
published · living versionsW_u7fa5rax·v1 · currentpublished
MLSys: The New Frontier of Machine Learning Systems
with Alexander Ratner, Dan Alistarh, Gustavo Alonso, David G. Andersen +64
1 version
Preprints & journals
151 papers in the corpus · 2009–2026SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales2607.20548v1 · Mikail Khona, Aditya Vavre, Boxiang Wang et al.2026 · 0 citationsarXiv
Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning2505.20161v2 · Jaehun Jung, Seungju Han, Ximing Lu et al.2025 · 1 citationarXiv
Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos2607.16107v1 · Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar et al.2026 · 0 citationsarXiv
Unified Audio Intelligence Without Regressing on Text Intelligence2607.05196v2 · Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim et al.2026 · 0 citationsarXiv
RADIO1D: Elastic Representations for Condensed Vision Modeling2607.03624v1 · Greg Heinrich, Mike Ranzinger, Collin McCarthy et al.2026 · 0 citationsarXiv
FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data2507.10540v3 · Tao Feng, Haozhen Zhang, Zijie Lei et al.2025 · 0 citationsTMLR 2026
Nemotron-Labs-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context2606.26493v2 · Fitsum Reda, John Kamalu, Roger Waleffe et al.2026 · 0 citationsarXiv
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music2604.10905v1 · Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar et al.2026 · 0 citationsarXiv
Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models2512.13607v2 · Boxin Wang, Chankyu Lee, Nayeon Lee et al.2025 · 0 citationsarXiv
Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning2504.13941v3 · Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov et al.2025 · 0 citationsarXiv
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning2505.07365v2 · Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang et al.2025 · 0 citationsarXiv
Pretraining Large Language Models with NVFP42509.25149v2 · NVIDIA, Felix Abecassis, Anjulie Agrusa et al.2025 · 0 citationsarXiv
RLP: Reinforcement as a Pretraining Objective2510.01265v2 · Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye et al.2025 · 0 citationsarXiv
On Data Engineering for Scaling LLM Terminal Capabilities2602.21193v1 · Renjie Pi, Grace Lam, Mohammad Shoeybi et al.2026 · 0 citationsarXiv
PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models2602.06053v1 · Rajarshi Roy, Jonathan Raiman, Sang-gil Lee et al.2026 · 4 citationsarXiv
C-RADIOv4 (Tech Report)2601.17237v1 · Mike Ranzinger, Greg Heinrich, Collin McCarthy et al.2026 · 0 citationsarXiv
Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning2512.20848v1 · NVIDIA: Aaron Blakeman, Aaron Grattafiori, Aarti Basant et al.2025 · 0 citationsarXiv
NVIDIA Nemotron 3: Efficient and Open Intelligence2512.20856v1 · NVIDIA: Aaron Blakeman, Aaron Grattafiori, Aarti Basant et al.2025 · 1 citationarXiv
Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs2511.16664v1 · Ali Taghibakhshi, Sharath Turuvekere Sreenivas, Saurav Muralidharan et al.2025 · 0 citationsarXiv
Music Flamingo: Scaling Music Understanding in Audio Language Models2511.10289v1 · Sreyan Ghosh, Arushi Goel, Lasha Koroshinadze et al.2025 · 0 citationsarXiv
NVIDIA Nemotron Nano V2 VL2511.03929v2 · NVIDIA: Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki et al.2025 · 0 citationsarXiv
Minitron-SSM: Efficient Hybrid Language Model Compression through Group-Aware SSM Pruning2504.11409v2 · Ali Taghibakhshi, Sharath Turuvekere Sreenivas, Saurav Muralidharan et al.2025 · 0 citationsarXiv
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning2510.12000v1 · Jinchuan Tian, Sang-gil Lee, Zhifeng Kong et al.2025 · 0 citationsarXiv
Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data2510.03264v1 · Syeda Nahida Akter, Shrimai Prabhumoye, Eric Nyberg et al.2025 · 0 citationsarXiv
Llama-Nemotron: Efficient Reasoning Models2505.00949v5 · Akhiad Bercovich, Itay Levy, Izik Golan et al.2025 · 1 citationarXiv
Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models2504.03624v4 · NVIDIA: Aaron Blakeman, Aarti Basant, Abhinav Khattar et al.2025 · 0 citationsarXiv
NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model2508.14444v4 · NVIDIA: Aarti Basant, Abhijit Khairnar, Abhijit Paithankar et al.2025 · 0 citationsarXiv
Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset2508.15096v1 · Rabeeh Karimi Mahabadi, Sanjeev Satheesh, Shrimai Prabhumoye et al.2025 · 0 citationsarXiv
Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding2508.11818v1 · Zhifeng Kong, Arushi Goel, Joao Felipe Santos et al.2025 · 0 citationsarXiv
A2SB: Audio-to-Audio Schrodinger Bridges2501.11311v2 · Zhifeng Kong, Kevin J Shih, Weili Nie et al.2025 · 0 citationsarXiv
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models2507.08128v2 · Arushi Goel, Sreyan Ghosh, Jaehyeon Kim et al.2025 · 2 citationsarXiv
FeatSharp: Your Vision Model Features, Sharper2502.16025v2 · Mike Ranzinger, Greg Heinrich, Pavlo Molchanov et al.2025 · 0 citationsarXiv
ETTA: Elucidating the Design Space of Text-to-Audio Models2412.19351v2 · Sang-gil Lee, Zhifeng Kong, Arushi Goel et al.2024 · 0 citationsarXiv
Upcycling Large Language Models into Mixture of Experts2410.07524v2 · Ethan He, Abhinav Khattar, Ryan Prenger et al.2024 · 1 citationarXiv
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy2506.13284v1 · Zihan Liu, Zhuolin Yang, Yang Chen et al.2025 · 0 citationsarXiv
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning2505.16400v3 · Yang Chen, Zhuolin Yang, Zihan Liu et al.2025 · 0 citationsarXiv
Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset2412.02595v2 · Dan Su, Kezhi Kong, Ying Lin et al.2024 · 1 citationarXiv
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning2505.00024v2 · Shaokun Zhang, Yi Dong, Jieyu Zhang et al.2025 · 1 citationarXiv
MIND: Math Informed syNthetic Dialogues for Pretraining LLMs2410.12881v2 · Syeda Nahida Akter, Shrimai Prabhumoye, John Kamalu et al.2024 · 0 citationsarXiv
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models2504.15271v1 · Guo Chen, Zhiqi Li, Shihao Wang et al.2025 · 7 citationsarXiv
Retro-Search: Exploring Untaken Paths for Deeper and Efficient Reasoning2504.04383v2 · Ximing Lu, Seungju Han, David Acuna et al.2025 · 0 citationsarXiv
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization2412.21037v2 · Chia-Yu Hung, Navonil Majumder, Zhifeng Kong et al.2024 · 0 citationsarXiv
From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models2504.06214v1 · Chejian Xu, Wei Ping, Peng Xu et al.2025 · 0 citationsarXiv
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data2410.02056v2 · Sreyan Ghosh, Sonal Kumar, Zhifeng Kong et al.2024 · 0 citationsarXiv
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities2503.03983v1 · Sreyan Ghosh, Zhifeng Kong, Sonal Kumar et al.2025 · 0 citationsarXiv
Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders2408.15998v2 · Min Shi, Fuxiao Liu, Shihao Wang et al.2024 · 1 citationarXiv
UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation2503.00733v1 · Alexander H. Liu, Sang-gil Lee, Chao-Han Huck Yang et al.2025 · 0 citationsarXiv
NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models2405.17428v3 · Chankyu Lee, Rajarshi Roy, Mengyao Xu et al.2024 · 10 citationsarXiv
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs2411.02571v2 · Sheng-Chieh Lin, Chankyu Lee, Mohammad Shoeybi et al.2024 · 1 citationarXiv
ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities2407.14482v3 · Peng Xu, Wei Ping, Xianchao Wu et al.2024 · 0 citationsarXiv
Career total: 239 works. 151 are in this corpus.Showing the 50 most recent.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.