SV
Shivaram Venkataraman
cs.DCcs.LGcs.AIcs.DBstat.MLcs.CLcs.ARcs.ITcs.OScs.PF
On Valency
published · living versionsW_djneug2e·v1 · currentpublished
MLlib: Machine Learning in Apache Spark
with Xiangrui Meng, Joseph Bradley, Burak Yavuz, Evan Sparks +11
1 version
Preprints & journals
60 papers in the corpus · 2012–2026TeDiServe: High SLO Attainment Serving for Diffusion Language Models2606.29094v2 · Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham et al.2026 · 0 citationsarXiv
Towards Full Pipeline FP8 Reinforcement Learning for LLMs2609.22870v1 · Fanchao Chen, Ziheng Jiang, Ziyun Wei et al.2026 · 0 citationsarXiv
Diamond Agent: Agentic Control of Federated HPC Resources as a Service2609.06181v1 · Haotian Xie, Junlin Chen, Mingkai Zheng et al.2026 · 0 citationsarXiv
When Web Agents Finish but Still Fail: Reproducible Triggers and Trace Diagnostics for Parallel Web Exploration2606.20724v2 · Aagam Sogani, Botao Rui, Swetha Vaidyanathan et al.2026 · 0 citationsarXiv
When More Cores Hurts: The Vector Database Scaling Paradox in HPC2606.08950v1 · Seth Ockerman, Song Young Oh, Amal Gueroudji et al.2026 · 0 citationsarXiv
Breaking Locality Accelerates Block Gauss-Seidel1701.03863v2 · Stephen Tu, Shivaram Venkataraman, Ashia C. Wilson et al.2017 · 10 citationsarXiv
Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs2510.18245v3 · Song Bian, Tao Yu, Shivaram Venkataraman et al.2025 · 0 citationsICLR 2026
PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents2605.07039v1 · Minghao Yan, Bo Peng, Benjamin Coleman et al.2026 · 0 citationsarXiv
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters2604.03591v3 · Rutwik Jain, Yiwei Jiang, Matthew D. Sinclair et al.2026 · 3 citationsarXiv
Wattchmen: Watching the Wattchers -- High Fidelity, Flexible GPU Energy Modeling2603.26435v1 · Brandon Tran, Matthias Maiterth, Woong Shin et al.2026 · 1 citationarXiv
What Limits Agentic Systems Efficiency?2510.16276v1 · Song Bian, Minghao Yan, Anand Jayarajan et al.2025 · 0 citationsarXiv
Exploring Distributed Vector Databases Performance on HPC Platforms: A Study with Qdrant2509.12384v2 · Seth Ockerman, Amal Gueroudji, Song Young Oh et al.2025 · 8 citationsarXiv
PGT-I: Scaling Spatiotemporal GNNs with Memory-Efficient Distributed Training2507.11683v3 · Seth Ockerman, Amal Gueroudji, Tanwi Mallick et al.2025 · 1 citationarXiv
From FASTER to F2: Evolving Concurrent Key-Value Store Designs for Large Skewed Workloads2305.01516v3 · Konstantinos Kanellis, Badrish Chandramouli, Ted Hart et al.2023 · 3 citationsarXiv
Scaling Inference-Efficient Language Models2501.18107v2 · Song Bian, Minghao Yan, Shivaram Venkataraman2025 · 0 citationsarXiv
Quake: Adaptive Indexing for Vector Search2506.03437v2 · Jason Mohoney, Devesh Sarda, Mengze Tang et al.2025 · 0 citationsarXiv
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models2502.02406v3 · Tzu-Tao Chang, Shivaram Venkataraman2025 · 0 citationsarXiv
From Good to Great: Improving Memory Tiering Performance Through Parameter Tuning2504.18714v1 · Konstantinos Kanellis, Sujay Yadalam, Fanchao Chen et al.2025 · 0 citationsarXiv
Eva: Cost-Efficient Cloud-Based Cluster Scheduling2503.07437v1 · Tzu-Tao Chang, Shivaram Venkataraman2025 · 2 citationsarXiv
TUNA: Tuning Unstable and Noisy Cloud Applications2503.01801v2 · Johannes Freischuetz, Konstantinos Kanellis, Brian Kroth et al.2025 · 11 citationsarXiv
Armada: Memory-Efficient Distributed Training of Large-Scale Graph Neural Networks2502.17846v1 · Roger Waleffe, Devesh Sarda, Jason Mohoney et al.2025 · 0 citationsarXiv
Decoding Speculative Decoding2402.01528v4 · Minghao Yan, Saurabh Agarwal, Shivaram Venkataraman2024 · 0 citationsarXiv
GraphSnapShot: Caching Local Structure for Fast Graph Learning2406.17918v4 · Dong Liu, Roger Waleffe, Meng Jiang et al.2024 · 2 citationsarXiv
SYMPHONY: Improving Memory Management for LLM Inference Workloads2412.16434v1 · Saurabh Agarwal, Anyong Mao, Aditya Akella et al.2024 · 0 citationsarXiv
Incremental IVF Index Maintenance for Streaming Vector Search2411.00970v1 · Jason Mohoney, Anil Pacaci, Shihabur Rahman Chowdhury et al.2024 · 0 citationsarXiv
PAL: A Variability-Aware Policy for Scheduling ML Workloads in GPU Clusters2408.11919v2 · Rutwik Jain, Brandon Tran, Keting Chen et al.2024 · 10 citationsarXiv
CHAI: Clustered Head Attention for Efficient LLM Inference2403.08058v2 · Saurabh Agarwal, Bilge Acun, Basil Hosmer et al.2024 · 2 citationsarXiv
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices2310.19991v2 · Minghao Yan, Hongyi Wang, Shivaram Venkataraman2023 · 2 citationsarXiv
Blox: A Modular Toolkit for Deep Learning Schedulers2312.12621v1 · Saurabh Agarwal, Amar Phanishayee, Shivaram Venkataraman2023 · 10 citationsarXiv
BagPipe: Accelerating Deep Recommendation Model Training2202.12429v4 · Saurabh Agarwal, Chengpo Yan, Ziyi Zhang et al.2022 · 19 citationsarXiv
Mirage: Towards Low-interruption Services on Batch GPU Clusters with Reinforcement Learning2306.14086v1 · Qiyang Ding, Pengfei Zheng, Shreyas Kudari et al.2023 · 5 citationsarXiv
Does compressing activations help model parallel training?2301.02654v1 · Song Bian, Dacheng Li, Hongyi Wang et al.2023 · 1 citationarXiv
Not All GPUs Are Created Equal: Characterizing Variability in Large-Scale, Accelerator-Rich Systems2208.11035v3 · Prasoon Sinha, Akhil Guliani, Rutwik Jain et al.2022 · 32 citationsarXiv
MariusGNN: Resource-Efficient Out-of-Core Training of Graph Neural Networks2202.02365v2 · Roger Waleffe, Jason Mohoney, Theodoros Rekatsinas et al.2022 · 42 citationsarXiv
Shockwave: Fair and Efficient Cluster Scheduling for Dynamic Adaptation in Machine Learning2210.00093v1 · Pengfei Zheng, Rui Pan, Tarannum Khan et al.2022 · 4 citationsarXiv
LlamaTune: Sample-Efficient DBMS Configuration Tuning2203.05128v2 · Konstantinos Kanellis, Cong Ding, Brian Kroth et al.2022 · 2 citationsarXiv
Doing More by Doing Less: How Structured Partial Backpropagation Improves Deep Learning Clusters2111.10672v1 · Adarsh Kumar, Kausik Subramanian, Shivaram Venkataraman et al.2021 · 0 citationsarXiv
KAISA: An Adaptive Second-Order Optimizer Framework for Deep Neural Networks2107.01739v2 · J. Gregory Pauloski, Qi Huang, Lei Huang et al.2021 · 14 citationsarXiv
On the Utility of Gradient Compression in Distributed Training Systems2103.00543v3 · Saurabh Agarwal, Hongyi Wang, Shivaram Venkataraman et al.2021 · 18 citationsarXiv
Marius: Learning Massive Graph Embeddings on a Single Machine2101.08358v2 · Jason Mohoney, Roger Waleffe, Yiheng Xu et al.2021 · 12 citationsarXiv
AutoFreeze: Automatically Freezing Model Blocks to Accelerate Fine-tuning2102.01386v2 · Yuhan Liu, Saurabh Agarwal, Shivaram Venkataraman2021 · 16 citationsarXiv
Accelerating Deep Learning Inference via Learned Caches2101.07344v1 · Arjun Balasubramanian, Adarsh Kumar, Yuhan Liu et al.2021 · 7 citationsarXiv
Accordion: Adaptive Gradient Communication via Critical Learning Regime Identification2010.16248v1 · Saurabh Agarwal, Hongyi Wang, Kangwook Lee et al.2020 · 13 citationsarXiv
Move Fast and Meet Deadlines: Fine-grained Real-time Stream Processing with Cameo2010.03035v1 · Le Xu, Shivaram Venkataraman, Indranil Gupta et al.2020 · 1 citationarXiv
Accelerating Deep Learning Inference via Freezing2002.02645v1 · Adarsh Kumar, Arjun Balasubramanian, Shivaram Venkataraman et al.2020 · 3 citationsarXiv
MLSys: The New Frontier of Machine Learning Systems1904.03257v3 · Alexander Ratner, Dan Alistarh, Gustavo Alonso et al.2019 · 20 citationsarXivon Valency
Archipelago: A Scalable Low-Latency Serverless Platform1911.09849v1 · Arjun Singhvi, Kevin Houck, Arjun Balasubramanian et al.2019 · 18 citationsarXiv
Themis: Fair and Efficient GPU Cluster Scheduling1907.01484v2 · Kshiteej Mahajan, Arjun Balasubramanian, Arjun Singhvi et al.2019 · 22 citationsarXiv
Blink: Fast and Generic Collectives for Distributed ML1910.04940v1 · Guanhua Wang, Shivaram Venkataraman, Amar Phanishayee et al.2019 · 20 citationsarXiv
Parity Models: A General Framework for Coding-Based Resilience in ML Inference1905.00863v2 · Jack Kosaian, K.V. Rashmi, Shivaram Venkataraman2019 · 11 citationsarXiv
Career total: 142 works. 60 are in this corpus.Showing the 50 most recent.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.