TaskCLIP: Extend Large Vision-Language Model for Task Oriented Object Detection
TaskCLIP leverages large vision-language models with a transformer aligner to improve task-oriented object detection by 3.5%, requiring only one RTX4090.
Hanning Chen, Wenjun Huang, Yang Ni et al.