GGPT

GGPT: Geometry-Grounded Point Transformer

Yutong Chen, Yiming Wang, Xucong Zhang, Sergey Prokudin, and Siyu Tang.

CVPR 2026.

Project page | arXiv | Code

scaffold3d

Scaffold3D: SfM-Conditioned Pointmap Prediction for Multi-view 3D Reconstruction

Frano Rajic, Yutong Chen, Haofei Xu, Zador Pataki, Marc Pollefeys, and Siyu Tang.

NeurIPS 2026.

to come

mvdvrk

MV-dVRK: A Multi-Viewpoint Benchmark for Spatial Surgical Perception

Guido Caccianiga, Sergey Prokudin, Yutong Chen, Bernard Javot, Rachael L'Orsa, Omer Burak Aladag, Yarden Sharon, Jens Rolinger, Ivan Capobianco, Anton Deguet, Siyu Tang, and Katherine J. Kuchenbecker.

Arxiv 2026.

arXiv

splatformer

SplatFormer: Point Transformer for Robust 3D Gaussian Splatting

Yutong Chen, Yiming Wang, Xucong Zhang, Sergey Prokudin, and Siyu Tang.

ICLR 2025 Spotlight.

Project page | arXiv | Code

egom2p

EgoM2P: Egocentric Multimodal Multitask Pretraining

Gen Li, Yutong Chen, Yiqian Wu, Kaifeng Zhao, Marc Pollefeys, and Siyu Tang.

ICCV 2025.

Project page | arXiv | Code

Dyco

Within the Dynamic Context: Inertia-aware 3D Human Modeling with Pose Sequence

Yutong Chen*, Yifan Zhan*, Zhihang Zhong, Wei Wang, Xiao Sun, Yu Qiao, Yinqiang Zheng (* indicates equal contribution)

ECCV 2024.

Project page | arXiv | Code

XCross

Improving continuous sign language recognition with cross-lingual signs

Fangyun Wei, Yutong Chen

ICCV 2023.

arXiv

TwoStream

Two-stream network for sign language recognition and translation

Yutong Chen*, Ronglai Zuo*, Fangyun Wei*, Yu Wu, Shujie Liu, Brian Mak

NeurIPS 2022 Spotlight.

arXiv | code

SLT

A simple multi-modality transfer learning baseline for sign language translation

Yutong Chen, Fangyun Wei, Xiao Sun, Zhirong Wu, Stephen Lin

CVPR 2022.

arXiv | code

ObjCen

Learning to manipulate individual objects in an image

Yanchao Yang*, Yutong Chen*, Stefano Soatto

CVPR 2020.

arXiv | code