cs.CV 2201.03546

Language-driven Semantic Segmentation

LSeg achieves 52.3% mIoU in zero-shot segmentation on PASCAL-5i, outperforming existing methods.

Boyi Li, Kilian Q. Weinberger, Serge Belongie et al.

2022-01-11 38
cs.CV 2201.00487

Language as Queries for Referring Video Object Segmentation

ReferFormer uses Transformer with language as queries, achieving 55.6 J&F on Ref-Youtube-VOS, surpassing previous SOTA by 8.4 points, enabling end-to-end video object segmentation and tracking.

Jiannan Wu, Yi Jiang, Peize Sun et al.

2022-01-03 52
cs.CV 2112.09251

The Wanderings of Odysseus in 3D Scenes

GAMMA generates realistic motions for diverse 3D bodies using body surface markers, enhancing motion control and scene interaction.

Yan Zhang, Siyu Tang

2021-12-17 1