Zihan Dong
  • Home
  • Research
  • Teaching
  • USTC Version

Research interests

  • Mid- and post-training for coding agents.
  • Statistical Foundations of Large Language Models.

Selected Papers

  • Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals.
    Zihan Dong, Zhixian Zhang, Yang Zhou, Can Jin, Ruijia Wu, and Linjun Zhang.

    ICML 2026.

  • Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising.
    Tianci Liu, Zihan Dong, Linjun Zhang, Haoyu Wang, Jing Gao, Emre Kiciman, Ranveer Chandra, and Wei-Ting Chen.

    ECCV 2026.

  • Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training.
    Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tuo Zhao, and Haoyu Wang.

    ICML 2026.

  • Conformal Path Reasoning: Trustworthy Knowledge Graph Question Answering via Path-Level Calibration.
    Shuhang Lin, Chuhao Zhou, Xiao Lin, Zihan Dong, Kuan Lu, Zhencan Peng, Jie Yin, and Dimitris N. Metaxas.

    ICML 2026.

  • AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play.
    Ran Xu, Yuchen Zhuang, Zihan Dong, Ruiyu Wang, Yue Yu, Joyce C. Ho, Linjun Zhang, Haoyu Wang, Wenqi Shi, and Carl Yang.

    NeurIPS 2025 Spotlight.

Selected Preprints

  • Labels or Preferences? Budget-Constrained Learning with Human Judgments over AI-Generated Outputs.
    Zihan Dong, Ruijia Wu, and Linjun Zhang.

    Submitted to Journal of the Royal Statistical Society, Series B, 2026.

  • Contrastive Network Representation Learning.
    Zihan Dong, Xin Zhou, Ryumei Nakada, Lexin Li, and Linjun Zhang.

    Submitted to JASA Theory and Methods, 2025.

  • AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration.
    Jiaqi Liu, Shi Qiu, Mairui Li, Bingzhou Li, Haonian Ji, Siwei Han, Xinyu Ye, Peng Xia, Zihan Dong, Meng Chen, Congyu Zhang, Letian Zhang, Guiming Chen, Haoqin Tu, Xinyu Yang, Lu Feng, Xujiang Zhao, Haifeng Chen, Jiawei Zhou, Xiao Wang, Weitong Zhang, Hongtu Zhu, Yun Li, Jieru Mei, Hongliang Fei, Jiaheng Zhang, Linjie Li, Linjun Zhang, Yuyin Zhou, Sheng Wang, Caiming Xiong, James Zou, Zeyu Zheng, Cihang Xie, Mingyu Ding, and Huaxiu Yao.

    Submitted to NeurIPS 2026.

  • RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation.
    Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, and Haoyu Wang.

    Submitted to COLM 2026.

  • Evidence Over Plans: Online Trajectory Verification for Skill Distillation.
    Yang Zhou, Zihan Dong, Zhenting Wang, Can Jin, Shiyu Zhao, Bangwei Guo, Difei Gu, Linjun Zhang, Mu Zhou, and Dimitris N. Metaxas.

    Submitted to NeurIPS 2026.

  • RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains.
    Haoxiang Jiang, Zihan Dong, Tianci Liu, Wanying Wang, Ran Xu, Tony Yu, Linjun Zhang, and Haoyu Wang.

    Submitted to EMNLP 2026.