cs.CV 2410.23775

In-Context LoRA for Diffusion Transformers

IC-LoRA activates DiT in-context generation with 20–100 image sets, producing high-fidelity multi-image outputs without architectural changes.

Lianghua Huang, Wei Wang, Zhi-Fan Wu et al.

2024-10-31 27
cs.CV 2410.16512

TIPS: Text-Image Pretraining with Spatial awareness

TIPS combines spatial awareness via synthetic captions and self-supervised masked modeling, boosting dense image understanding.

Kevis-Kokitsi Maninis, Kaifeng Chen, Soham Ghosh et al.

2024-10-22 25