Jiawei He

Researcher and PhD Advisor

Beijing Academy of Artificial Intelligence (BAAI) · Co-founder, XYZ Embodied AI

I am Jiawei He, a researcher/PhD Advisor at the Beijing Academy of Artificial Intelligence (BAAI). I also co-founded a company called XYZ Embodied AI in Beijing, which provides embodied AI solutions, including generalizable algorithms and an AI platform. Before that, I received my PhD degree in June 2024 from the Institute of Automation, Chinese Academy of Sciences, under the advisement of Prof. Zhaoxiang Zhang.

I lead XYZ-ASR (Algorithm & System Research), a research center jointly established by BAAI and XYZ Embodied AI. We recruit research interns and PhD students through the center.

From 2020 to 2022, I was a research intern at TuSimple, mentored by Zehao Huang and Naiyan Wang, focusing on Multiple Object Tracking and 3D Object Detection. Previously, I earned my BS degree from Xi'an Jiaotong University in 2019. During my undergraduate years, I joined the X-Plan project and was a research intern at the Institute of Artificial Intelligence and Robotics (IAIR) in XJTU from 2017 to 2018.

2027 级博士招生名额已满。 All PhD positions for the 2027 intake have been filled.

XYZ-ASR is hiring on-site and remote research interns and full-time researchers and engineers in embodied AI, VLM/VLA, and 3D perception. Graduate and senior undergraduate students are welcome to apply for internships by email.

Research Interests

My research focuses on embodied AI, spatial intelligence, vision-language-action models, world models, and 3D perception. I also work on multiple object tracking, 3D reconstruction, learning-based combinatorial optimization, and image and video understanding and generation.

News

Publications

Google Scholar

2026

  1. DA-Nav: direction-aware vision-language navigation overview

    DA-Nav: Direction-Aware City-Scale Vision-Language Navigation.

    Ye Yuan*, Kehan Chen*, Xinqiang Yu*, Wentao Xu, Heng Wang, et al., Jiawei He†, Zhulin An†.

    IEEE Robotics and Automation Letters (RA-L), 2026.

  2. AdaOcc: adaptive 3D occupancy prediction across robots, sensors, and embodied tasks

    AdaOcc: Adaptive 3D Occupancy Prediction for Embodied Tasks.

    Jinglong Wang*, Yunjie Wang*, Zhiyang Zhang*, Jiawei He†, Ye Yuan, Bo Qiu†, Jing Zhang†.

    NeurIPS 2026.

  3. JEPA-WAM: joint-embedding world modeling for vision-language-action policies

    JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling.

    Yihan Lin*, Jiawei He*, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi†, Jing Zhang†.

    arXiv preprint, 2026.

  4. RoboTracer: metric-grounded spatial traces and reasoning for robotic manipulation

    Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics.

    Enshen Zhou*, Yibo Li*, Jingkun An*, Jiayuan Zhang*, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang.

    ECCV 2026.

  5. UniPart: language-grounded 3D part segmentation overview

    UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction.

    Xinqiang Yu*, Zekun Qi*, Jiawei He, Wenyao Zhang, Xuchuan Chen, Guocai Yao, Li Yi, Zhaoxiang Zhang, He Wang.

    ECCV 2026.

  6. P3DTrack: learning pseudo 3D representations for multiple object tracking

    Learning Pseudo 3D Representation for Ego-centric 2D Multiple Object Tracking.

    Jiawei He, Lue Fan, Zhaoxiang Zhang.

    International Journal of Computer Vision, 2026.

  7. OmniSpatial: spatial reasoning benchmark overview

    OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models.

    Mengdi Jia*, Zekun Qi*, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi.

    ICLR 2026.

  8. FloorPlan-VLN: floor plans and concise instructions guide vision-language navigation

    FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation.

    Kehan Chen, Yan Huang†, Dong An, Jiawei He, Yifei Su, Jing Liu, Nianfeng Liu, Liang Wang†.

    arXiv preprint, 2026.

2025

  1. SoFar: language-grounded orientation and object manipulation

    SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation.

    Zekun Qi*, Wenyao Zhang*, Yufei Ding*, Runpei Dong, XinQiang Yu, Jingwen Li, Lingyun Xu, Baoyu Li, Xialin He, Guofan Fan, Jiazhao Zhang, Jiawei He, Jiayuan Gu, Xin Jin, Kaisheng Ma, Zhizheng Zhang, He Wang, Li Yi.

    NeurIPS 2025 Spotlight.

  2. DreamVLA: vision-language-action model overview

    DreamVLA: Dream Comprehensive World Knowledge for Vision-Language-Action Model.

    Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, XinQiang Yu, Jiazhao Zhang, Runpei Dong, Jiawei He, He Wang, Zhizheng Zhang, Li Yi, Wenjun Zeng, Xin Jin.

    NeurIPS 2025.

  3. DexVLG: dexterous vision-language-grasp model teaser

    DexVLG: Dexterous Vision-Language-Grasp Model at Scale.

    Jiawei He*, Danshi Li*, Xinqiang Yu*, Zekun Qi, Wenyao Zhang, Jiayi Chen, Zhaoxiang Zhang, Zhizheng Zhang, Li Yi, He Wang.

    ICCV 2025 Highlight.

  4. Hybrid-grained feature aggregation: coarse-to-fine language guidance for monocular depth estimation

    Hybrid-grained Feature Aggregation with Coarse-to-fine Language Guidance for Self-supervised Monocular Depth Estimation.

    Wenyao Zhang, Hongsi Liu, Bohan Li, Jiawei He, Zekun Qi, Yunnan Wang, Shengyang Zhao, Xinqiang Yu, Wenjun Zeng, Xin Jin.

    ICCV 2025.

  5. BEV World Model: online trajectory evaluation for end-to-end driving

    End-to-End Driving with Online Trajectory Evaluation via BEV World Model.

    Yingyan Li, Yuqi Wang, Yang Liu, Jiawei He, Lue Fan, Zhaoxiang Zhang.

    ICCV 2025.

  6. Latent World Model: enhancing end-to-end autonomous driving

    Enhancing End-to-End Autonomous Driving with Latent World Model.

    Yingyan Li, Lue Fan, Jiawei He, Yuqi Wang, Yuntao Chen, Zhaoxiang Zhang, Tieniu Tan.

    ICLR 2025.

2024 and earlier

  1. DrivingDojo: interactive driving world model dataset

    DrivingDojo Dataset: Advancing Interactive and Knowledge-Enriched Driving World Model.

    Yuqi Wang*, Ke Cheng*, Jiawei He*, Qitai Wang*, Hengchen Dai, Yuntao Chen, Fei Xia, Zhaoxiang Zhang.

    NeurIPS 2024 Datasets & Benchmarks.

  2. OneTrack: training pipeline for end-to-end 3D detection and tracking

    OneTrack: Demystifying the Conflict Between Detection and Tracking in End-to-End 3D Trackers.

    Qitai Wang, Jiawei He, Yuntao Chen, Zhaoxiang Zhang.

    ECCV 2024.

  3. Learnable Graph Matching: data association framework

    Learnable Graph Matching: A Practical Paradigm for Data Association.

    Jiawei He, Zehao Huang, Naiyan Wang, Zhaoxiang Zhang.

    IEEE TPAMI, 2024.

  4. Drive-WM: multiview visual forecasting and planning

    Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving.

    Yuqi Wang*, Jiawei He*, Lue Fan*, Hongxin Li*, Yuntao Chen, Zhaoxiang Zhang.

    CVPR 2024.

  5. BA2Det: weakly supervised 3D object detection with multi-stage generalization

    Weakly Supervised 3D Object Detection with Multi-Stage Generalization.

    Jiawei He, Yuqi Wang, Yuntao Chen, Zhaoxiang Zhang.

    TPAMI (major revision).

  6. BA-Det: object-centric global optimization for 3D video detection

    3D Video Object Detection with Learnable Object-Centric Global Optimization.

    Jiawei He, Yuntao Chen, Naiyan Wang, Zhaoxiang Zhang.

    CVPR 2023.

  7. DCD: densely constrained depth estimation for monocular 3D object detection

    Densely Constrained Depth Estimator for Monocular 3D Object Detection.

    Yingyan Li, Yuntao Chen, Jiawei He, Zhaoxiang Zhang.

    ECCV 2022.

  8. GMTracker: learnable graph matching for multiple object tracking

    Learnable Graph Matching: Incorporating Graph Partitioning with Deep Feature Learning for Multiple Object Tracking.

    Jiawei He, Zehao Huang, Naiyan Wang, Zhaoxiang Zhang.

    CVPR 2021.

* Equal contribution. † Corresponding author.

Presentations

Professional Services

Contact

Beijing XYZ Embodied AI Co., Ltd.
Block A, Dinghao DH3 Building, Haidian District, Beijing, China

北京星源智机器人科技有限公司
北京市海淀区鼎好 DH3 大厦 A 座

Email: [email protected] · [email protected]