CV
Education
- 2022–present: Ph.D. student in Computer Science, University of California, Los Angeles, advised by Prof. Quanquan Gu
- 2022–2024: M.S. in Computer Science, University of California, Los Angeles
- 2018–2022: B.Sc. in Pure and Applied Mathematics, Tsinghua University
Research Experience
- 2022–2024: Graduate Student Researcher
- UCLA Artificial General Intelligence Lab, Los Angeles, CA, USA
- Summer 2024: Research Intern
- Microsoft Research Asia – Vancouver lab, Redmond, WA, USA
- Summer 2026: Research Intern
- ByteDance, San Jose, CA, USA
Honors and Awards
- 2019–2022: Tsinghua Xuetang Talents Program Scholarship
- 2024: ICLR 2024 Outstanding Reviewer; NeurIPS 2024 Top Reviewer
- 2025: Amazon Fellow
- 2026: ICML 2026 Gold Reviewer
Teaching
- Fall 2026: Teaching Assistant for CS 260 Machine Learning Algorithms, UCLA
- Spring 2026: Teaching Assistant for CS 130 Software Engineering, UCLA, instructor Prof. Tobias Dürschmid
Publications
* means equal contribution.
- Kaixuan Ji*, Qiwei Di*, Heyang Zhao, Qingyue Zhao, Quanquan Gu. On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization. ICML 2026 DEMO Workshop.
- Kaixuan Ji, Qingyue Zhao, Heyang Zhao, Qiwei Di, Quanquan Gu. Near-Optimal Regret for KL-Regularized Multi-Armed Bandits. ICML 2026.
- Shiyuan Zhang*, Qiwei Di*, Xuheng Li*, Quanquan Gu. Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence. ICML 2026.
- Yue Yu, Qiwei Di, Quanquan Gu, Dongruo Zhou. On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference. ICML 2026.
- Qiwei Di*, Kaixuan Ji*, Xuheng Li*, Heyang Zhao, Quanquan Gu. Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling. ICLR 2026.
- Runjia Li, Qiwei Di, Quanquan Gu. Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers. ICLR 2025.
- Qiwei Di, Jiafan He, Quanquan Gu. Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback. ICML 2025.
- Binshuai Wang, Qiwei Di, Ming Yin, Mengdi Wang, Quanquan Gu, Peng Wei. Relative-Translation Invariant Wasserstein Distance. TMLR.
- Yue Wu, Tao Jin*, Qiwei Di*, Hao Lou, Farzad Farnoud, Quanquan Gu. Borda Regret Minimization for Generalized Linear Dueling Bandits. ICML 2024.
- Qiwei Di, Heyang Zhao, Jiafan He, Quanquan Gu. Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning. ICLR 2024.
- Qiwei Di*, Tao Jin*, Yue Wu, Heyang Zhao, Farzad Farnoud, Quanquan Gu. Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits. ICLR 2024.
- Qiwei Di, Jiafan He, Dongruo Zhou, Quanquan Gu. Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path. ICML 2023.
Selected Courses
- Fall 2022: Machine Learning Algorithms (A+), CS260, UCLA
- Spring 2023: Machine Learning: Optimization (A+), CS269, UCLA
- Fall 2023: Automated Reasoning, Theory and Application (A), CS264A, UCLA
- Fall 2023: Communication Complexity (A), CS2855CC, UCLA
- Fall 2023: Dynamical Systems (A), MATH238A, UCLA
- Fall 2025: Stochastic Calculus (A), MATH275D, UCLA