cs.CV 2311.04400

LRM: Large Reconstruction Model for Single Image to 3D

This paper introduces LRM, a transformer-based large-scale single-image 3D reconstruction model trained on ~1 million objects, capable of generating high-fidelity models in under 5 seconds.

Yicong Hong, Kai Zhang, Jiuxiang Gu et al.

2023-11-08 980 citations 27
cs.CV 2311.03054

AnyText: Multilingual Visual Text Generation And Editing

AnyText employs diffusion models with OCR-guided multi-modal embeddings to achieve high-fidelity multilingual visual text generation and editing, outperforming baselines on 3M image-text pairs.

Yuxiang Tuo, Wangmeng Xiang, Jun-Yan He et al.

2023-11-06 49
cs.CV 2310.11797

Panoptic Out-of-Distribution Segmentation

Proposed PoDS architecture improves POD-Q scores on Cityscapes-OOD and BDD100K-OOD datasets.

Rohit Mohan, Kiran Kumaraswamy, Juana Valeria Hurtado et al.

2023-10-18 36