TD

Trevor Darrell

cs.CVcs.LGcs.AIcs.CLcs.ROstat.MLcs.NEcs.MMcs.CYAlgorithms

On Valency

published · living versions
W_kmjwgbm3·v1 · currentpublished
Caffe: Convolutional Architecture for Fast Feature Embedding
with Yangqing Jia, Evan Shelhamer, Jeff Donahue, Sergey Karayev +3
1 version

Preprints & journals

332 papers in the corpus · 2007–2026
Reconstruction Alignment Improves Unified Multimodal Models2509.07295v4 · Ji Xie, Trevor Darrell, Luke Zettlemoyer et al.2025 · 0 citationsarXiv
Can Language Models Learn to Listen?2308.10897v2 · Evonne Ng, Sanjay Subramanian, Dan Klein et al.2023 · 22 citationsarXiv
Latent Implicit Visual Reasoning2512.21218v2 · Kelvin Li, Chuyi Shang, Leonid Karlinsky et al.2025 · 0 citationsarXiv
Are Large Reasoning Models Interruptible?2510.11713v4 · Tsung-Han Wu, Mihran Miroyan, David M. Chan et al.2025 · 0 citationsarXiv
It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models2601.00090v2 · Anne Harrington, A. Sophia Koepke, Shyamgopal Karthik et al.2025 · 0 citationsarXiv
Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models2510.03721v2 · Leander Girrbach, Stephan Alaniz, Genevieve Smith et al.2025 · 0 citationsarXiv
Search Arena: Analyzing Search-Augmented LLMs2506.05334v2 · Mihran Miroyan, Tsung-Han Wu, Logan King et al.2025 · 1 citationarXiv
Fast Image-based Neural Relighting with Translucency-Reflection Modeling2306.09322v2 · Shizhan Zhu, Shunsuke Saito, Aljaz Bozic et al.2023 · 4 citationsarXiv
Visually Prompted Benchmarks Are Surprisingly Fragile2512.17875v2 · Haiwen Feng, Long Lian, Lisa Dunlap et al.2025 · 0 citationsarXiv
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents2512.17221v3 · Brandon Huang, Hang Hua, Zhuoran Yu et al.2025 · 0 citationsarXiv
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos2512.10927v1 · Yulu Gan, Ligeng Zhu, Dandan Shan et al.2025 · 0 citationsarXiv
Pillar-0: A New Frontier for Radiology Foundation Models2511.17803v1 · Kumar Krishna Agrawal, Longchao Liu, Long Lian et al.2025 · 1 citationarXiv
REOrdering Patches Improves Vision Models2505.23751v3 · Declan Kutscher, David M. Chan, Yutong Bai et al.2025 · 0 citationsarXiv
Constantly Improving Image Models Need Constantly Improving Benchmarks2510.15021v1 · Jiaxin Ge, Grace Luo, Heekyung Lee et al.2025 · 0 citationsarXiv
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs2503.11790v3 · Nasim Borazjanizadeh, Roei Herzig, Eduard Oks et al.2025 · 0 citationsarXiv
The Sound of Simulation: Learning Multimodal Sim-to-Real Robot Policies with Generative Audio2507.02864v2 · Renhao Wang, Haoran Geng, Tingle Li et al.2025 · 0 citationsarXiv
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint2505.23759v2 · Heekyung Lee, Jiaxin Ge, Tsung-Han Wu et al.2025 · 0 citationsarXiv
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems2406.12172v3 · Nasim Borazjanizadeh, Roei Herzig, Trevor Darrell et al.2024 · 1 citationarXiv
Do What? Teaching Vision-Language-Action Models to Reject the Impossible2508.16292v1 · Wen-Han Hsieh, Elvis Hsieh, Dantong Niu et al.2025 · 0 citationsarXiv
Learning Adaptive Parallel Reasoning with Language Models2504.15466v2 · Jiayi Pan, Xiuyu Li, Long Lian et al.2025 · 0 citationsarXiv
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions2409.12962v2 · Tsung-Han Wu, Joseph E. Gonzalez, Trevor Darrell et al.2024 · 1 citationarXiv
Scaling Vision Pre-Training to 4K Resolution2503.19903v2 · Baifeng Shi, Boyi Li, Han Cai et al.2025 · 3 citationsarXiv
Activation Reward Models for Few-Shot Model Alignment2507.01368v1 · Tianning Chai, Chancharik Mitra, Brandon Huang et al.2025 · 0 citationsarXiv
Enough Coin Flips Can Make LLMs Act Bayesian2503.04722v2 · Ritwik Gupta, Rodolfo Corona, Jiaxin Ge et al.2025 · 2 citationsarXiv
Whole-Body Conditioned Egocentric Video Prediction2506.21552v1 · Yutong Bai, Danny Tran, Amir Bar et al.2025 · 1 citationarXiv
AutoPresent: Designing Structured Visuals from Scratch2501.00912v2 · Jiaxin Ge, Zora Zhiruo Wang, Xuhui Zhou et al.2025 · 8 citationsarXiv
Hidden in plain sight: VLMs overlook their visual representations2506.08008v1 · Stephanie Fu, Tyler Bonnen, Devin Guillory et al.2025 · 1 citationarXiv
Dual-Process Image Generation2506.01955v1 · Grace Luo, Jonathan Granskog, Aleksander Holynski et al.2025 · 2 citationsarXiv
Pre-training Auto-regressive Robotic Models with 4D Representations2502.13142v2 · Dantong Niu, Yuvan Sharma, Haoru Xue et al.2025 · 0 citationsarXiv
Pose Priors from Language Models2405.03689v2 · Sanjay Subramanian, Evonne Ng, Lea Muller et al.2024 · 1 citationarXiv
Open X-Embodiment: Robotic Learning Datasets and RT-X Models2310.08864v9 · Abby O'Neill, Abdul Rehman, Abhinav Gupta et al.2023 · 104 citationsarXiv
MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion2410.03825v2 · Junyi Zhang, Charles Herrmann, Junhwa Hur et al.2024 · 3 citationsarXiv
Vision-Language Models Create Cross-Modal Task Representations2410.22330v2 · Grace Luo, Trevor Darrell, Amir Bar2024 · 0 citationsarXiv
LISAT: Language-Instructed Segmentation Assistant for Satellite Imagery2505.02829v1 · Jerome Quenum, Wen-Han Hsieh, Tsung-Han Wu et al.2025 · 1 citationarXiv
Describe Anything: Detailed Localized Image and Video Captioning2504.16072v1 · Long Lian, Yifan Ding, Yunhao Ge et al.2025 · 14 citationsarXiv
VibeCheck: Discover and Quantify Qualitative Differences in Large Language Models2410.12851v7 · Lisa Dunlap, Krishna Mandal, Trevor Darrell et al.2024 · 0 citationsarXiv
St4RTrack: Simultaneous 4D Reconstruction and Tracking in the World2504.13152v1 · Haiwen Feng, Junyi Zhang, Qianqian Wang et al.2025 · 14 citationsarXiv
Navigation World Models2412.03572v2 · Amir Bar, Gaoyue Zhou, Danny Tran et al.2024 · 0 citationsarXiv
Rethinking Patch Dependence for Masked Autoencoders2401.14391v2 · Letian Fu, Long Lian, Renhao Wang et al.2024 · 3 citationsarXiv
VisionArena: 230K Real World User-VLM Conversations with Preference Labels2412.08687v3 · Christopher Chou, Lisa Dunlap, Koki Mashita et al.2024 · 2 citationsarXiv
Wolf: Dense Video Captioning with a World Summarization Framework2407.18908v2 · Boyi Li, Ligeng Zhu, Ran Tian et al.2024 · 1 citationarXiv
A Coefficient Makes SVRG Effective2311.05589v2 · Yida Yin, Zhiqiu Xu, Zhiyuan Li et al.2023 · 0 citationsarXiv
In-Context Learning Enables Robot Action Prediction in LLMs2410.12782v2 · Yida Yin, Zekai Wang, Yuvan Sharma et al.2024 · 4 citationsarXiv
Revealing and Reducing Gender Biases in Vision and Language Assistants (VLAs)2410.19314v2 · Leander Girrbach, Stephan Alaniz, Yiran Huang et al.2024 · 0 citationsarXiv
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark2407.13766v4 · Tsung-Han Wu, Giscard Biamby, Jerome Quenum et al.2024 · 1 citationarXiv
Video Action Differencing2503.07860v1 · James Burgess, Xiaohan Wang, Yuhui Zhang et al.2025 · 0 citationsarXiv
Neural Network Diffusion2402.13144v3 · Kai Wang, Dongwen Tang, Boya Zeng et al.2024 · 2 citationsarXiv
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning2406.15334v3 · Brandon Huang, Chancharik Mitra, Assaf Arbelle et al.2024 · 6 citationsarXiv
Career total: 826 works. 332 are in this corpus.Showing the 50 most recent.

Profile built from the corpus for this byline.

Author records are still filling in while the Hub is in alpha. If this is your page, you'll be able to claim it soon. Spot a mistake? Tell us.