publications

* denotes equal contribution and joint lead authorship.

2026

  1. WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations
    Xiaojie Xu*, Zhengyuan Lin*, Runyi Li, Yihao Liu, Kaipeng Zhang, and Yongtao Ge
    arXiv preprint arXiv:2608.15659, 2026
  2. AlayaWorld: Long-Horizon and Playable Video World Generation
    AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Mingliang Zhai, and others
    arXiv preprint arXiv:2608.13492, 2026
  3. Sekai2: From World Exploration to Interactive World Modeling
    Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, and Yongtao Ge
    arXiv preprint arXiv:2608.09449, 2026
  4. worldmark.jpg
    WorldMark: A Unified Benchmark Suite for Interactive Video World Models
    Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Yongtao Ge, and Kaipeng Zhang
    arXiv preprint arXiv:2604.21686, 2026
  5. WorldSculpt: Generating Compositional Worlds from Grounded Videos
    Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, and Zhixiang Wang
    arXiv preprint arXiv:2609.05416, 2026

2025

  1. Generative Video Matting
    Yongtao Ge, Kangyang Xie, Guangkai Xu, Li Ke, Mingyu Liu, Longtao Huang, Hui Xue, Hao Chen, and Chunhua Shen
    In ACM SIGGRAPH Conference Papers, 2025
  2. pomato_teaser.png
    POMATO: Marrying Pointmap Matching with Temporal Motions for Dynamic 3D Reconstruction
    Songyan Zhang*, Yongtao Ge*, Jinyuan Tian*, Guangkai Xu, Chen Lv, Hao Chen, and Chunhua Shen
    In Proc. of the IEEE International Conf. on Computer Vision, 2025
  3. humanwild.gif
    3D Human Reconstruction in the Wild with Synthetic Data Using Generative Models
    Yongtao Ge, Wenjia Wang, Yongfan Chen, Hao Chen, and Chunhua Shen
    In IEEE Trans. on Pattern Analysis and Machine Intelligence (TPAMI), 2025
  4. genpercept_pipeline.png
    What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?
    Guangkai Xu, Yongtao Ge, Mingyu Liu, Chengxiang Fan, Kangyang Xie, Zhiyue Zhao, Hao Chen, and Chunhua Shen
    In Proc. of the IEEE International Conf. on Learning Representations, 2025

2024

  1. geobench_logo.png
    GeoBench: Benchmarking and Analyzing Monocular Geometry Estimation Models
    Yongtao Ge, Guangkai Xu, Zhiyue Zhao, Zheng Huang, Libo Sun, Yanlong Sun, Hao Chen, and Chunhua Shen
    arXiv preprint arXiv:2406.12671, 2024

2023

  1. zolly.png
    Zolly: Zoom Focal Length Correctly for Perspective-Distorted Human Mesh Reconstruction
    Wenjia Wang, Yongtao Ge, Haiyi Mei, Zhongang Cai, Qingping Sun, Yanjun Wang, Chunhua Shen, Lei Yang, and Komura Taku
    In Proc. of the IEEE International Conf. on Computer Vision (ICCV Oral), 2023
  2. point_teaching_arch.jpg
    Point-Teaching: Weakly Semi-Supervised Object Detection with Point Annotations
    Yongtao Ge*, Qiang Zhou*, Xinlong Wang, Chunhua Shen, Zhibin Wang, and Hao Li
    In AAAI Conference on Artificial Intelligence (AAAI), 2023

2022

  1. poseur_arch.jpg
    Poseur: Direct Human Pose Regression with Transformers
    Weian Mao*, Yongtao Ge*, Chunhua Shen, Zhi Tian, Xinlong Wang, Zhibin Wang, and Anton van den Hengel
    In Proc. of the European Conf. on Computer Vision (ECCV), 2022