Publications

* indicates equal contribution; † indicates corresponding author; § indicates project lead.

Preprints

  1. ArXiv
    Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
    [ Link Code Website ]
    Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, and Xiong-Hui Chen§ .
    In ArXiv. 2026.
  2. ArXiv
    Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System
    [ Link Code Website ]
    Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Zhibo Yang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Haoyang Li, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, and Xiong-Hui Chen§ .
    In ArXiv. 2026.
  3. ArXiv
    Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
    [ Link Website ]
    Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, and Chenfei Wu.
    In ArXiv. 2026.
  4. ArXiv
    Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
    [ Link ]
    Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou, Jiazhao Zhang, Haoqi Yuan, Gengze Zhou, Hang Yin, Ye Wang, Yiyang Huang, Zixing Lei, Wujian Peng, Delin Chen, Yingming Zheng, Jingyang Fan, Xianwei Zhuang, Xin Zhou, Haoyang Li, Anzhe Chen, Tong Zhang, Xuejing Liu, Yuchong Sun, Ruizhe Chen, Zhaohai Li, Chenxu Lv, Zhibo Yang, Tao Yu, and Xiong-Hui Chen .
    In ArXiv. 2026.
  5. ArXiv
    Qwen-Image-2.0 Technical Report
    [ Link ]
    Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang, Yi Wang, Yilei Chen, Ying Ba, Yixian Xu, Yujia Wu, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, An Yang, Chen Cheng, Chenxu Lv, Dayiheng Liu, Fan Zhou, Hantian Xiong, Hongzhu Shi, Hu Wei, Huihong Zhao, Ivy Liu, Jianwei Zhang, Jiawei Zhang, Kai Chen, Kang He, Levon Xue, Lin Qu, Linhan Tang, Luwen Feng, Minggang Wu, Minmin Sun, Na Ni, Rui Men, Shuai Bai, Sishou Zheng, Tao Lan, Tianqi Zhang, Tingkun Wen, Wei Wang, Weixu Qiao, Weiyi Lu, Wenmeng Zhou, Xiaodong Deng, Xiaoxiao Xu, Xinlei Fang, Xiong-Hui Chen, Yanan Wang, Yang Fan, Yichang Zhang, Yixuan Xu, Yu Wu, Zhiyuan Ma, and Zhizhi Cai.
    In ArXiv. 2026.
  6. ArXiv
    Off-Policy Value-Based Reinforcement Learning for Large Language Models
    [ Link ]
    Peng-Yuan Wang, Ziniu Li, Tian Xu, Bohan Yang, Tian-Shuo Liu, ChenYang Wang, Xiong-Hui Chen, Yi-Chen Li, Tianyun Yang, Congliang Chen, and Yang Yu.
    In ArXiv. 2026.
  7. ArXiv
    HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
    [ Link ]
    Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, and Junyang Lin.
    In ArXiv. 2026.
  1. ArXiv
    Qwen3-VL Technical Report
    [ Link ]
    Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xiong-Hui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, and Ke Zhu.
    In ArXiv. 2025.
  2. ArXiv
    Soft Adaptive Policy Optimization
    [ Link ]
    Chang Gao, Chujie Zheng, Xiong-Hui Chen, Kai Dang, Shixuan Liu, Bowen Yu, An Yang, Shuai Bai, Jingren Zhou, and Junyang Lin.
    In ArXiv. 2025.
  3. ArXiv
    StepFun-Prover Preview: Let’s Think and Verify Step by Step
    [ Link ]
    Shijie Shang, Ruosi Wan, Yue Peng, Yutong Wu, Xiong-Hui Chen, Jie Yan, and Xiangyu Zhang.
    In ArXiv. 2025.
  4. ArXiv
    Generalist Reward Models: Found Inside Large Language Models
    [ Link ]
    Yi-Chen Li, Tian Xu, Yang Yu, Xuqin Zhang, Xiong-Hui Chen, Zhongxiang Ling, Ningjing Chao, Lei Yuan, and Zhi-Hua Zhou.
    In ArXiv. 2025.
  5. ArXiv
    Group Sequence Policy Optimization
    [ Link ]
    Chujie Zheng, Shixuan Liu, Mingze Li, Xiong-Hui Chen, Bowen Yu, Chang Gao, Kai Dang, Yuqiong Liu, Rui Men, An Yang, Jingren Zhou, and Junyang Lin.
    In ArXiv. 2025.
  6. ArXiv
    NeoRL-2: Near Real-World Benchmarks for Offline Reinforcement Learning with Extended Realistic Scenarios
    [ Link ]
    Songyi Gao, Zuolin Tu, Rong-Jun Qin, Yi-Hao Sun, Xiong-Hui Chen, and Yang Yu.
    In ArXiv. 2025.

              Manuscripts

              1. ML
                Learning de-biased environment models for delivery incentive policy optimization on food delivery platforms
                [ Link ]
                Yu-Ren Liu, Xiong-Hui Chen, Siyuan Xiao, Xinyu Yang, Xintong Qi, Linjun Zhou, Yang Yu, and Fangsheng Huang.
                In Machine Learning. 2025.
              2. FCS
                Offline model-based reinforcement learning with causal structured world models
                [ Link ]
                Zhengmao Zhu, Honglong Tian, Xiong-Hui Chen, Kun Zhang, and Yang Yu.
                In Frontiers of Computer Science. 2025.
              3. SCIS
                A Survey on Model-based Reinforcement Learning
                [ Link ]
                Fan-Ming Luo, Tian Xu, Hang Lai, Xiong-Hui Chen, Weinan Zhang, and Yang Yu.
                In Science China Information Sciences. 2024.
              4. TPAMI
                Offline Model-Based Adaptable Policy Learning for Decision-Making in Out-of-Support Regions
                [ Link Code Appendix ]
                Xiong-Hui Chen, Fan-Ming Luo, Yang Yu, Qingyang Li, Zhiwei Qin, Wenjie Shang, and Jieping Ye.
                In IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023.

              Papers

              2026
              1. NeurIPS
                Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
                [ Link ]
                Shenzhi Wang, Le Yu, Chang Gao, Chujie Zheng, Shixuan Liu, Rui Lu, Kai Dang, Xiong-Hui Chen, Jianxin Yang, Zhenru Zhang, Yuqiong Liu, An Yang, Andrew Zhao, Yang Yue, Shiji Song, Bowen Yu, Gao Huang, and Junyang Lin.
                In Advances in Neural Information Processing Systems 38. 2026.
              2025
              1. ICLR
                AFlow: Automating Agentic Workflow Generation (Oral)
                [ Link Code ]
                Jiayi Zhang, Jinyu Xiang, Zhaoyang Yu, Fengwei Teng, Xiong-Hui Chen, Jiaqi Chen, Mingchen Zhuge, Xin Cheng, Sirui Hong, Jinlin Wang, Bingnan Zheng, Bang Liu, Yuyu Luo, and Chenglin Wu.
                In The 13th International Conference on Learning Representations. 2025.
              2024
              1. NeurIPS
                KALM: Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
                [ Link Website Zhihu ]
                Jing-Cheng Pang, Si-Hang Yang, Kaiyuan Li, Jiaji Zhang, Xiong-Hui Chen, Nan Tang, and Yang Yu.
                In Advances in Neural Information Processing Systems 37. 2024.
              2. NeurIPS
                Policy Learning from Tutorial Books via Understanding, Rehearsing and Introspecting (Oral)
                [ Link Website Zhihu ]
                Xiong-Hui Chen, Ziyan Wang, Yali Du, Shengyi Jiang, Meng Fang, Yang Yu, and Jun Wang.
                In Advances in Neural Information Processing Systems 37. 2024.
              3. ICML
                Deep Demonstration Tracing: Learning Generalizable Imitator Policy for Runtime Imitation from a Single Demonstration
                [ Link Code Website ]
                Xiong-Hui Chen, Junyin Ye, Hang Zhao, Yi-Chen Li, Xu-Hui Liu, Haoran Shi, Yu-Yan Xu, Zhihao Ye, Si-Hang Yang, Anqi Huang, Kai Xu, Zongzhang Zhang, and Yang Yu.
                In The 41st International Conference on Machine Learning. 2024.
              4. ICML
                Policy-conditioned Environment Models are More Generalizable
                [ Link Code Website ]
                Ruifeng Chen, Xiong-Hui Chen, Yi-Hao Sun, Siyuan Xiao, Minhui Li, and Yang Yu.
                In The 41st International Conference on Machine Learning. 2024.
              5. ICLR
                Policy Rehearsing: Training Generalizable Policies for Reinforcement Learning
                [ Link ]
                Chengxing Jia, Chenxiao Gao, Hao Yin, Fuxiang Zhang, Xiong-Hui Chen, Tian Xu, Lei Yuan, Zongzhang Zhang, Yang Yu, and Zhi-Hua Zhou.
                In The 12th International Conference on Learning Representations. 2024.
              6. ICLR
                Language Model Self-improvement by Reinforcement Learning Contemplation
                [ Link ]
                Jing-Cheng Pang, Pengyuan Wang, Kaiyuan Li, Xiong-Hui Chen, Jiacheng Xu, Zongzhang Zhang, and Yang Yu.
                In The 12th International Conference on Learning Representations. 2024.
              2023
              1. NeurIPS
                Adversarial Counterfactual Environment Model Learning (Spotlight)
                [ Link Code ]
                Xiong-Hui Chen, Yang Yu, Zheng-Mao Zhu, Zhihua Yu, Zhenjun Chen, Chenghe Wang, Yinan Wu, Hongqiu Wu, Rong-Jun Qin, Ruijin Ding, and Fangsheng Huang.
                In Advances in Neural Information Processing Systems 36. 2023.
              2. NeurIPS
                Natural Language Instruction-following with Task-related Language Development and Translation
                [ Link Code ]
                Jing-Cheng Pang, Xinyu Yang, Si-Hang Yang, Xiong-Hui Chen, and Yang Yu.
                In Advances in Neural Information Processing Systems 36. 2023.
              3. IROS
                Object-Oriented Option Framework for Robotics Manipulation in Clutter
                [ Link Code ]
                Pang Jing-Cheng, Young Stalin, Xiong-Hui Chen, Xinyu Yang, Yang Yu, Mas Ma, Ziqi Guo, Howard Yang, and Bill Huang.
                In 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems. 2023.
              4. ICDE
                Sim2Rec: A Simulator-based Decision-making Approach to Optimize Real-world Long-term User Engagement in Sequential Recommender Systems
                [ Link Code ]
                Xiong-Hui Chen, Bowei He, Yang Yu, Qingyang Li, Zhiwei (Tony) Qin, Wenjie Shang, Jieping Ye, and Chen Ma.
                In Proceedings of the 39th IEEE International Conference on Data Engineering. 2023.
              2022
              1. NeurIPS
                NeoRL: A Near Real-world Benchmark for Offline Reinforcement Learning
                [ Link Code Zhihu ]
                Rong-Jun Qin, Xingyuan Zhang, Songyi Gao, Xiong-Hui Chen, Zewen Li, Weinan Zhang, and Yang Yu.
                In Advances in Neural Information Processing Systems 35 Datasets and Benchmarks Track. 2022.
              2. KDD
                A Simulator-based Decision-Making Approach to Sequential Recommender Systems with Application in Ride-hailing Platform
                [ Link Code ]
                Xiong-Hui Chen, Yang Yu, Qingyang Li, Bowei He, Zhiwei (Tony) Qin, Wenjie Shang, and Jieping Ye.
                In the 25th ACM SIGKDD Conference on Knowledge Discovery and Data Mining Workshop on Decision Intelligence and Analytics for Online Marketplaces. 2022.
              2021
              1. NeurIPS
                Cross-modal Domain Adaptation for Cost-Efficient Visual Reinforcement Learning
                [ Link Code ]
                Xiong-Hui Chen, Shengyi Jiang, Feng Xu, Zongzhang Zhang, and Yang Yu.
                In Advances in Neural Information Processing Systems 34. 2021.
              2. NeurIPS
                Offline Model-based Adaptable Policy Learning
                [ Link Code ]
                Xiong-Hui Chen, Yang Yu, Qingyang Li, Fan-Ming Luo, Zhiwei (Tony) Qin, Wenjie Shang, and Jieping Ye.
                In Advances in Neural Information Processing Systems 34. 2021.
              2020
              1. DAI
                Efficient Exploration by Novelty-Pursuit
                [ Link Code ]
                Ziniu Li, and Xiong-Hui Chen .
                In Proceedings of the 2nd International Conference on Distributed Artificial Intelligence. 2020.
              2019
              1. AAMAS
                Reinforcement Learning with Derivative-Free Exploration
                [ Link Code ]
                Xiong-Hui Chen, and Yang Yu.
                In Proceedings of the 18th International Conference on Autonomous Agents and MultiAgent Systems. 2019.