LK
Lukasz Kaiser
cs.LGcs.CLstat.MLcs.AIcs.LOcs.CVcs.NEcs.CYcs.DCcs.DM
On Valency
published · living versionsW_qeugbgvj·v1 · currentpublished
Attention Is All You Need
with Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit +3
1 version
Preprints & journals
39 papers in the corpus · 2008–2025OpenAI o1 System Card2412.16720v2 · OpenAI: Aaron Jaech, Adam Kalai, Adam Lerer et al.2024 · 44 citationsarXiv
Competitive Programming with Large Reasoning Models2502.06807v2 · OpenAI: Ahmed El-Kishky, Alexander Wei, Andre Saraiva et al.2025 · 6 citationsarXivon Valency
GPT-4o System Card2410.21276v1 · OpenAI: Aaron Hurst, Adam Lerer, Adam P. Goucher et al.2024 · 165 citationsarXiv
Model-Based Reinforcement Learning for Atari1903.00374v5 · Lukasz Kaiser, Mohammad Babaeizadeh, Piotr Milos et al.2019 · 479 citationsarXiv
tsGT: Stochastic Time Series Modeling With Transformer2403.05713v3 · \Lukasz Kuci'nski, Witold Drzewakowski, Mateusz Olko et al.2024 · 0 citationsarXiv
Attention Is All You Need1706.03762v7 · Ashish Vaswani, Noam Shazeer, Niki Parmar et al.2017 · 26,892 citationsarXivon Valency
Rethinking Attention with Performers2009.14794v4 · Krzysztof Choromanski, Valerii Likhosherstov, David Dohan et al.2020 · 116 citationsarXiv
Hierarchical Transformers Are More Efficient Language Models2110.13711v2 · Piotr Nawrot, Szymon Tworkowski, Micha\l Tyrolski et al.2021 · 33 citationsarXiv
Sparse is Enough in Scaling Transformers2111.12763v1 · Sebastian Jaszczur, Aakanksha Chowdhery, Afroz Mohiuddin et al.2021 · 3 citationsarXiv
Evaluating Large Language Models Trained on Code2107.03374v2 · Mark Chen, Jerry Tworek, Heewoo Jun et al.2021 · 1,468 citationsarXivon Valency
Q-Value Weighted Regression: Reinforcement Learning with Limited Data2102.06782v1 · Piotr Kozakowski, \Lukasz Kaiser, Henryk Michalewski et al.2021 · 2 citationsarXiv
Transforming machine translation: a deep learning system reaches news translation quality comparable to human professionals.32873773 · Popel, Martin, Tomkova, Marketa, Tomek, Jakub et al.2020 · 308 citationsNature communications. 2020;11(1):4381
Area Attention1810.10126v7 · Yang Li, Lukasz Kaiser, Samy Bengio et al.2018 · 0 citationsICML 2019
Reformer: The Efficient Transformer2001.04451v2 · Nikita Kitaev, \Lukasz Kaiser, Anselm Levskaya2020 · 310 citationsarXiv
Parallel Scheduled Sampling1906.04331v2 · Daniel Duckworth, Arvind Neelakantan, Ben Goodrich et al.2019 · 12 citationsarXiv
Sample Efficient Text Summarization Using a Single Pre-Trained Transformer1905.08836v1 · Urvashi Khandelwal, Kevin Clark, Dan Jurafsky et al.2019 · 62 citationsarXiv
Universal Transformers1807.03819v3 · Mostafa Dehghani, Stephan Gouws, Oriol Vinyals et al.2018 · 382 citationsarXiv
Image Transformer1802.05751v3 · Niki Parmar, Ashish Vaswani, Jakob Uszkoreit et al.2018 · 227 citationsarXiv
Fast Decoding in Sequence Models using Discrete Latent Variables1803.03382v6 · \Lukasz Kaiser, Aurko Roy, Ashish Vaswani et al.2018 · 169 citationsarXiv
Tensor2Tensor for Neural Machine Translation1803.07416v1 · Ashish Vaswani, Samy Bengio, Eugene Brevdo et al.2018 · 14 citationsarXiv
Generating Wikipedia by Summarizing Long Sequences1801.10198v1 · Peter J. Liu, Mohammad Saleh, Etienne Pot et al.2018 · 74 citationsarXiv
Discrete Autoencoders for Sequence Models1801.09797v1 · \Lukasz Kaiser, Samy Bengio2018 · 34 citationsarXiv
Unsupervised Cipher Cracking Using Discrete GANs1801.04883v1 · Aidan N. Gomez, Sicong Huang, Ivan Zhang et al.2018 · 24 citationsarXiv
Depthwise Separable Convolutions for Neural Machine Translation1706.03059v2 · Lukasz Kaiser, Aidan N. Gomez, Francois Chollet2017 · 242 citationsarXiv
One Model To Learn Them All1706.05137v1 · Lukasz Kaiser, Aidan N. Gomez, Noam Shazeer et al.2017 · 255 citationsarXiv
Learning to Remember Rare Events1703.03129v1 · \Lukasz Kaiser, Ofir Nachum, Aurko Roy et al.2017 · 269 citationsarXiv
Can Active Memory Replace Attention?1610.08613v2 · \Lukasz Kaiser, Samy Bengio2016 · 16 citationsarXiv
Regularizing Neural Networks by Penalizing Confident Output Distributions1701.06548v1 · Gabriel Pereyra, George Tucker, Jan Chorowski et al.2017 · 639 citationsarXiv
Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation1609.08144v2 · Yonghui Wu, Mike Schuster, Zhifeng Chen et al.2016 · 5,573 citationsarXivon Valency
TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems1603.04467v2 · Mart'in Abadi, Ashish Agarwal, Paul Barham et al.2016 · 9,713 citationsarXivon Valency
Neural GPUs Learn Algorithms1511.08228v3 · \Lukasz Kaiser, Ilya Sutskever2015 · 225 citationsarXiv
Multi-task Sequence to Sequence Learning1511.06114v4 · Minh-Thang Luong, Quoc V. Le, Ilya Sutskever et al.2015 · 65 citationsarXiv
Adding Gradient Noise Improves Learning for Very Deep Networks1511.06807v1 · Arvind Neelakantan, Luke Vilnis, Quoc V. Le et al.2015 · 258 citationsarXiv
Degrees of Lookahead in Regular Infinite Games1209.0800v3 · Michael Holtmann, Lukasz Kaiser, Wolfgang Thomas2012 · 27 citationsLogical Methods in Computer Science, Volume 8, Issue 3 (September 27, 2012) lmcs:922
Model Checking the Quantitative mu-Calculus on Linear Hybrid Systems1209.1738v2 · Diana Fischer (RWTH Aachen), Lukasz Kaiser2012 · 4 citationsLogical Methods in Computer Science, Volume 8, Issue 3 (September 20, 2012) lmcs:760
Grammar as a Foreign Language1412.7449v3 · Oriol Vinyals, Lukasz Kaiser, Terry Koo et al.2014 · 399 citationsarXiv
Directed Width Measures and Monotonicity of Directed Graph Searching1408.4745v1 · \Lukasz Kaiser, Stephan Kreutzer, Roman Rabinovich et al.2014 · 4 citationsarXiv
Cardinality and counting quantifiers on omega-automatic structures0802.2866v1 · Lukasz Kaiser, Sasha Rubin, Vince B'ar'any2008 · 5 citationsDans Proceedings of the 25th Annual Symposium on the Theoretical Aspects of Computer Science - STACS 2008, Bordeaux : France (2008)
Model Checking Games for the Quantitative mu-Calculus0802.2871v1 · Diana Fischer, Erich Gradel, Lukasz Kaiser2008 · 7 citationsDans Proceedings of the 25th Annual Symposium on the Theoretical Aspects of Computer Science - STACS 2008, Bordeaux : France (2008)
Career total: 97 works. 39 are in this corpus.
Profile built from the corpus for this byline.
Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.