GP
Gennady Pekhimenko
cs.LGcs.DCcs.ARcs.AIcs.PFstat.MLcs.PLcs.SEcs.CLcs.CV
On Valency
published · living versionsW_u7fa5rax·v1 · currentpublished
MLSys: The New Frontier of Machine Learning Systems
with Alexander Ratner, Dan Alistarh, Gustavo Alonso, David G. Andersen +64
1 version
Preprints & journals
60 papers in the corpus · 2015–2026DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures2511.15503v5 · Peiming Yang, Sankeerth Durvasula, Ivan Fernandez et al.2025 · 0 citationsarXiv
ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management2607.20764v1 · Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko et al.2026 · 0 citationsarXiv
Robust Reasoning Benchmark2604.08571v3 · Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko et al.2026 · 0 citationsarXiv
SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents2605.30314v1 · Grant Hamblin, Kevin Song, Zhanda Zhu et al.2026 · 0 citationsarXiv
SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs2601.20273v2 · Jiacheng Yang, Jun Wu, Yaoyao Ding et al.2026 · 1 citationarXiv
DPQuant: Efficient and Differentially-Private Model Training via Dynamic Quantization Scheduling2509.03472v2 · Yubo Gao, Renbo Tu, Gennady Pekhimenko et al.2025 · 0 citationsarXiv
BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting2603.26777v1 · Renbo Tu, Ali SaraerToosi, Nicholas S. Conroy et al.2026 · 0 citationsarXiv
Hexcute: A Compiler Framework for Automating Layout Synthesis in GPU Programs2504.16214v3 · Xiao Zhang, Yaoyao Ding, Bolin Sun et al.2025 · 0 citationsarXiv
What Limits Agentic Systems Efficiency?2510.16276v1 · Song Bian, Minghao Yan, Anand Jayarajan et al.2025 · 0 citationsarXiv
Tilus: A Tile-Level GPGPU Programming Language for Low-Precision Computation2504.12984v3 · Yaoyao Ding, Bohan Hou, Xiao Zhang et al.2025 · 0 citationsarXiv
HybridTier: an Adaptive and Lightweight CXL-Memory Tiering System2312.04789v2 · Kevin Song, Jiacheng Yang, Zixuan Wang et al.2023 · 14 citationsarXiv
PyGim: An Efficient Graph Neural Network Library for Real Processing-In-Memory Architectures2402.16731v7 · Christina Giannoula, Peiming Yang, Ivan Fernandez et al.2024 · 18 citationsarXiv
Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization2503.19050v1 · Zhanda Zhu, Christina Giannoula, Muralidhar Andoorveedu et al.2025 · 8 citationsarXiv
Tally: Non-Intrusive Performance Isolation for Concurrent Deep Learning Workloads2410.07381v3 · Wei Zhao, Anand Jayarajan, Gennady Pekhimenko2024 · 5 citationsarXiv
APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts2406.13161v1 · Honghua Dong, Qidong Su, Yubo Gao et al.2024 · 1 citationarXiv
Guaranteed Approximation Bounds for Mixed-Precision Neural Operators2307.15034v3 · Renbo Tu, Colin White, Jean Kossaifi et al.2023 · 4 citationsarXiv
Proteus: Preserving Model Confidentiality during Graph Optimizations2404.12512v1 · Yubo Gao, Maryam Haghifam, Christina Giannoula et al.2024 · 0 citationsarXiv
Minuet: Accelerating 3D Sparse Convolutions on GPUs2401.06145v1 · Jiacheng Yang, Christina Giannoula, Jun Wu et al.2023 · 2 citationsarXiv
TorchProbe: Fuzzing Dynamic Deep Learning Compilers2310.20078v1 · Qidong Su, Chuqin Geng, Gennady Pekhimenko et al.2023 · 1 citationarXiv
The Synergy of Speculative Decoding and Batching in Serving Large Language Models2310.18813v1 · Qidong Su, Christina Giannoula, Gennady Pekhimenko2023 · 1 citationarXiv
MedPerf: Open Benchmarking Platform for Medical Artificial Intelligence using Federated Evaluation2110.01406v3 · Alexandros Karargyris, Renato Umeton, Micah J. Sheller et al.2021 · 175 citationsarXiv
Hidet: Task-Mapping Programming Paradigm for Deep Learning Tensor Programs2210.09603v2 · Yaoyao Ding, Cody Hao Yu, Bojian Zheng et al.2022 · 26 citationsASPLOS 2023: Proceedings of the 28th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2, January 2023, Pages 370-384
TiLT: A Time-Centric Approach for Stream Query Optimization and Parallelization2301.12030v1 · Anand Jayarajan, Wei Zhao, Yudi Sun et al.2023 · 6 citationsProceedings of the 28th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2, 2023
Tempo: Accelerating Transformer-Based Model Training through Memory Footprint Reduction2210.10246v2 · Muralidhar Andoorveedu, Zhanda Zhu, Bojian Zheng et al.2022 · 1 citationarXiv
Optimizing Data Collection in Deep Reinforcement Learning2207.07736v1 · James Gleeson, Daniel Snider, Yvonne Yang et al.2022 · 0 citationsarXiv
TensorDash: Exploiting Sparsity to Accelerate Deep Neural Network Training and Inference2009.00748v1 · Mostafa Mahmoud, Isak Edo, Ali Hadi Zadeh et al.2020 · 80 citationsarXiv
Moshpit SGD: Communication-Efficient Decentralized Training on Heterogeneous Unreliable Devices2103.03239v4 · Max Ryabinin, Eduard Gorbunov, Vsevolod Plokhotnyuk et al.2021 · 9 citationsarXiv
Distributed Deep Learning in Open Collaborations2106.10207v2 · Michael Diskin, Alexey Bukhtiyarov, Max Ryabinin et al.2021 · 4 citationsarXiv
A Runtime-Based Computational Performance Predictor for Deep Neural Network Training2102.00527v2 · Geoffrey X. Yu, Yubo Gao, Pavel Golikov et al.2021 · 4 citationsarXiv
Horizontally Fused Training Array: An Effective Hardware Utilization Squeezer for Training Novel Deep Learning Models2102.02344v3 · Shang Wang, Peiming Yang, Yuxuan Zheng et al.2021 · 8 citationsarXiv
IOS: Inter-Operator Scheduler for CNN Acceleration2011.01302v2 · Yaoyao Ding, Ligeng Zhu, Zhihao Jia et al.2020 · 5 citationsarXiv
RL-Scope: Cross-Stack Profiling for Deep Reinforcement Learning Workloads2102.04285v2 · James Gleeson, Srivatsan Krishnan, Moshe Gabel et al.2021 · 5 citationsarXiv
FPRaker: A Processing Element For Accelerating Neural Network Training2010.08065v1 · Omar Mohamed Awad, Mostafa Mahmoud, Isak Edo et al.2020 · 13 citationsarXiv
Multi-node Bert-pretraining: Cost-efficient Approach2008.00177v1 · Jiahuang Lin, Xin Li, Gennady Pekhimenko2020 · 7 citationsarXiv
Automatic Horizontal Fusion for GPU Kernels2007.01277v1 · Ao Li, Bojian Zheng, Gennady Pekhimenko et al.2020 · 49 citationsarXiv
Daydream: Accurately Estimating the Efficacy of Optimizations for DNN Training2006.03318v1 · Hongyu Zhu, Amar Phanishayee, Gennady Pekhimenko2020 · 14 citationsarXiv
MLPerf Inference Benchmark1911.02549v2 · Vijay Janapa Reddi, Christine Cheng, David Kanter et al.2019 · 38 citationsarXiv
BPPSA: Scaling Back-propagation by Parallel Scan Algorithm1907.10134v3 · Shang Wang, Yifan Bai, Gennady Pekhimenko2019 · 1 citationProceedings of Machine Learning and Systems 2020 (2020) 451-469
MLPerf Training Benchmark1910.01500v3 · Peter Mattson, Christine Cheng, Cody Coleman et al.2019 · 170 citationsarXiv
MLSys: The New Frontier of Machine Learning Systems1904.03257v3 · Alexander Ratner, Dan Alistarh, Gustavo Alonso et al.2019 · 20 citationsarXivon Valency
Echo: Compiler-based GPU Memory Footprint Reduction for LSTM RNN Training1805.08899v5 · Bojian Zheng, Abhishek Tiwari, Nandita Vijaykumar et al.2018 · 38 citationsarXiv
Priority-based Parameter Propagation for Distributed DNN Training1905.03960v1 · Anand Jayarajan, Jinliang Wei, Garth Gibson et al.2019 · 41 citationsarXiv
StreamBox-HBM: Stream Analytics on High Bandwidth Hybrid Memory1901.01328v2 · Hongyu Miao, Myeongjae Jeon, Gennady Pekhimenko et al.2019 · 16 citationsarXiv
Optimal Seed Solver: Optimizing Seed Selection in Read Mapping1506.08235v1 · Hongyi Xin, Richard Zhu, Sunny Nahar et al.2015 · 43 citationsBioinformatics, Jun 1;32(11):1632-42, 2016on Valency
Exploiting Row-Level Temporal Locality in DRAM to Reduce the Memory Access Latency1805.03969v1 · Hasan Hassan, Gennady Pekhimenko, Nandita Vijaykumar et al.2018 · 2 citationsarXiv
RowClone: Accelerating Data Movement and Initialization Using DRAM1805.03502v1 · Vivek Seshadri, Yoongu Kim, Chris Fallin et al.2018 · 12 citationsarXiv
Adaptive-Latency DRAM: Reducing DRAM Latency by Exploiting Timing Margins1805.03047v1 · Donghyuk Lee, Yoongu Kim, Gennady Pekhimenko et al.2018 · 1 citationarXiv
Flexible-Latency DRAM: Understanding and Exploiting Latency Variation in Modern DRAM Chips1805.03154v1 · Kevin K. Chang, Abhijith Kashyap, Hasan Hassan et al.2018 · 0 citationsarXiv
SoftMC: Practical DRAM Characterization Using an FPGA-Based Infrastructure1805.03195v1 · Hasan Hassan, Nandita Vijaykumar, Samira Khan et al.2018 · 1 citationarXiv
Decoupling GPU Programming Models from Resource Management for Enhanced Programming Ease, Portability, and Performance1805.02498v1 · Nandita Vijaykumar, Kevin Hsieh, Gennady Pekhimenko et al.2018 · 0 citationsarXiv
Career total: 138 works. 60 are in this corpus.Showing the 50 most recent.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.