CV

Download PDF

Education

Research Experience

Honors and Awards

Teaching

Publications

* means equal contribution.

  1. Kaixuan Ji*, Qiwei Di*, Heyang Zhao, Qingyue Zhao, Quanquan Gu. On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization. ICML 2026 DEMO Workshop.
  2. Kaixuan Ji, Qingyue Zhao, Heyang Zhao, Qiwei Di, Quanquan Gu. Near-Optimal Regret for KL-Regularized Multi-Armed Bandits. ICML 2026.
  3. Shiyuan Zhang*, Qiwei Di*, Xuheng Li*, Quanquan Gu. Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence. ICML 2026.
  4. Yue Yu, Qiwei Di, Quanquan Gu, Dongruo Zhou. On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference. ICML 2026.
  5. Qiwei Di*, Kaixuan Ji*, Xuheng Li*, Heyang Zhao, Quanquan Gu. Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling. ICLR 2026.
  6. Runjia Li, Qiwei Di, Quanquan Gu. Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers. ICLR 2025.
  7. Qiwei Di, Jiafan He, Quanquan Gu. Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback. ICML 2025.
  8. Binshuai Wang, Qiwei Di, Ming Yin, Mengdi Wang, Quanquan Gu, Peng Wei. Relative-Translation Invariant Wasserstein Distance. TMLR.
  9. Yue Wu, Tao Jin*, Qiwei Di*, Hao Lou, Farzad Farnoud, Quanquan Gu. Borda Regret Minimization for Generalized Linear Dueling Bandits. ICML 2024.
  10. Qiwei Di, Heyang Zhao, Jiafan He, Quanquan Gu. Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning. ICLR 2024.
  11. Qiwei Di*, Tao Jin*, Yue Wu, Heyang Zhao, Farzad Farnoud, Quanquan Gu. Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits. ICLR 2024.
  12. Qiwei Di, Jiafan He, Dongruo Zhou, Quanquan Gu. Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path. ICML 2023.

Selected Courses