XYZ-ASR

XYZ Embodied AI — Algorithm & System Research

Beijing Academy of Artificial Intelligence (BAAI) · XYZ Embodied AI · Beijing, China

We study algorithms and systems for embodied intelligence, with a focus on spatial intelligence, vision-language-action models, world models, 3D perception, and robot learning.

我们研究具身智能中的算法与系统问题,关注空间智能、视觉语言动作模型、世界模型、三维感知与机器人学习。

AdaOcc semantic 3D scene prediction
3D Perception
RoboTracer spatial trajectory prediction in a tabletop scene
Spatial Reasoning
Drive-WM predicted future driving view
World Models
DexVLG real-world dexterous manipulation of a bottle
Robot Manipulation

About

XYZ-ASR is led by Jiawei He, a researcher and PhD Advisor at BAAI and a co-founder of XYZ Embodied AI. The group connects academic research with validation on real robotic systems.

团队面向具身智能的核心科学问题开展研究,并重视方法在真实机器人系统中的验证。

Research Interests

Selected Publications

Google Scholar

2026

  1. DA-Nav: direction-aware vision-language navigation overview

    DA-Nav: Direction-Aware City-Scale Vision-Language Navigation.

    Ye Yuan*, Kehan Chen*, Xinqiang Yu*, Wentao Xu, Heng Wang, et al., Jiawei He†, Zhulin An†.

    IEEE Robotics and Automation Letters (RA-L), 2026.

  2. AdaOcc: adaptive 3D occupancy prediction across robots, sensors, and embodied tasks

    AdaOcc: Adaptive 3D Occupancy Prediction for Embodied Tasks.

    Jinglong Wang*, Yunjie Wang*, Zhiyang Zhang*, Jiawei He†, Ye Yuan, Bo Qiu†, Jing Zhang†.

    NeurIPS 2026.

  3. JEPA-WAM: joint-embedding world modeling for vision-language-action policies

    JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling.

    Yihan Lin*, Jiawei He*, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi†, Jing Zhang†.

    arXiv preprint, 2026.

  4. RoboTracer: metric-grounded spatial traces and reasoning for robotic manipulation

    Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics.

    Enshen Zhou*, Yibo Li*, Jingkun An*, Jiayuan Zhang*, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang.

    ECCV 2026.

  5. UniPart: language-grounded 3D part segmentation overview

    UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction.

    Xinqiang Yu*, Zekun Qi*, Jiawei He, Wenyao Zhang, Xuchuan Chen, Guocai Yao, Li Yi, Zhaoxiang Zhang, He Wang.

    ECCV 2026.

  6. P3DTrack: learning pseudo 3D representations for multiple object tracking

    Learning Pseudo 3D Representation for Ego-centric 2D Multiple Object Tracking.

    Jiawei He, Lue Fan, Zhaoxiang Zhang.

    International Journal of Computer Vision, 2026.

  7. OmniSpatial: spatial reasoning benchmark overview

    OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models.

    Mengdi Jia*, Zekun Qi*, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi.

    ICLR 2026.

  8. FloorPlan-VLN: floor plans and concise instructions guide vision-language navigation

    FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation.

    Kehan Chen, Yan Huang†, Dong An, Jiawei He, Yifei Su, Jing Liu, Nianfeng Liu, Liang Wang†.

    arXiv preprint, 2026.

2025

  1. SoFar: language-grounded orientation and object manipulation

    SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation.

    Zekun Qi*, Wenyao Zhang*, Yufei Ding*, Runpei Dong, Xinqiang Yu, et al., Jiawei He, et al.

    NeurIPS 2025 Spotlight.

  2. DreamVLA: vision-language-action model overview

    DreamVLA: Dream Comprehensive World Knowledge for Vision-Language-Action Model.

    Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, Xinqiang Yu, Jiazhao Zhang, Runpei Dong, Jiawei He, et al.

    NeurIPS 2025.

  3. DexVLG: dexterous vision-language-grasp model teaser

    DexVLG: Dexterous Vision-Language-Grasp Model at Scale.

    Jiawei He*, Danshi Li*, Xinqiang Yu*, Zekun Qi, Wenyao Zhang, Jiayi Chen, Zhaoxiang Zhang, Zhizheng Zhang, Li Yi, He Wang.

    ICCV 2025 Highlight.

  4. BEV World Model: online trajectory evaluation for end-to-end driving

    End-to-End Driving with Online Trajectory Evaluation via BEV World Model.

    Yingyan Li, Yuqi Wang, Yang Liu, Jiawei He, Lue Fan, Zhaoxiang Zhang.

    ICCV 2025.

2024 and earlier

  1. DrivingDojo: interactive driving world model dataset

    DrivingDojo Dataset: Advancing Interactive and Knowledge-Enriched Driving World Model.

    Yuqi Wang*, Ke Cheng*, Jiawei He*, Qitai Wang*, Hengchen Dai, Yuntao Chen, Fei Xia, Zhaoxiang Zhang.

    NeurIPS 2024 Datasets & Benchmarks.

  2. Learnable Graph Matching: data association framework

    Learnable Graph Matching: A Practical Paradigm for Data Association.

    Jiawei He, Zehao Huang, Naiyan Wang, Zhaoxiang Zhang.

    IEEE TPAMI, 2024.

  3. Drive-WM: multiview visual forecasting and planning

    Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving.

    Yuqi Wang*, Jiawei He*, Lue Fan*, Hongxin Li*, Yuntao Chen, Zhaoxiang Zhang.

    CVPR 2024.

  4. BA-Det: object-centric global optimization for 3D video detection

    3D Video Object Detection with Learnable Object-Centric Global Optimization.

    Jiawei He, Yuntao Chen, Naiyan Wang, Zhaoxiang Zhang.

    CVPR 2023.

* Equal contribution. † Corresponding author. The full and current publication list is available on Google Scholar.

News

Contact

All PhD positions for the 2027 intake have been filled.

We welcome applications from research interns, researchers, and engineers interested in embodied AI, VLM/VLA, world models, and 3D perception.

Email: [email protected]

Beijing Academy of Artificial Intelligence / XYZ Embodied AI, Beijing, China