Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model
Ctrl-Adapter框架高效适配扩展ControlNet,提升COCO和DAVIS 2017性能。
Han Lin, Jaemin Cho, Abhay Zala 等
Ctrl-Adapter框架高效适配扩展ControlNet,提升COCO和DAVIS 2017性能。
Han Lin, Jaemin Cho, Abhay Zala 等
SparseOcc利用稀疏潜在表示实现语义占用预测,FLOPs降低74.9%,mIoU提升1.3%。
Pin Tang, Zhongdao Wang, Guoqing Wang 等
本研究通过任务探针分析大规模视觉基础模型的3D感知能力,发现其在深度、法线和多视图一致性方面存在显著局限。
Mohamed El Banani, Amit Raj, Kevis-Kokitsi Maninis 等
RealmDreamer通过深度扩散和图像修复实现文本引导的高质量3D场景生成。
Jaidev Shriram, Alex Trevithick, Lingjie Liu 等
InternLM-XComposer2-4KHD突破4K分辨率,支持336像素至4K多分辨率,提升视觉理解能力。
Xiaoyi Dong, Pan Zhang, Yuhang Zang 等
Ferret-UI通过多模态大语言模型提升移动UI理解,超越GPT-4V。
Keen You, Haotian Zhang, Eldon Schoop 等
提出VAR模型,通过逐尺度预测实现高效图像生成,FID降至1.73,速度提升20倍。
Keyu Tian, Yi Jiang, Zehuan Yuan 等
提出基于神经隐式表示的未知关节物体数字孪生重建方法,能处理多关节、多样形状,精度优于现有技术。
Yijia Weng, Bowen Wen, Jonathan Tremblay 等
提出一种基于对比学习的风格描述符提取方法,提升风格检索准确率。
Gowthami Somepalli, Anubhav Gupta, Kamal Gupta 等
提出VQAScore,用VQA模型评估文本与图像的对齐,超越CLIPScore,达成多项基准SOTA。
Zhiqiu Lin, Deepak Pathak, Baiqi Li 等
提出EvLight,通过多尺度融合与SNR引导实现低光图像增强,提升性能超越帧法。
Guoqiang Liang, Kanghao Chen, Hangyu Li 等
采用深度数据与深度度量学习实现牛只个体识别,无需特殊标记。
Asheesh Sharma, Lucy Randewich, William Andrew 等
ECLIPSE采用视觉提示调优,冻结基础模型参数,仅微调提示嵌入,实现高效持续泛panoptic分割,显著减少参数并优于现有方法。
Beomyoung Kim, Joonsang Yu, Sung Ju Hwang
MagicLens利用自监督学习,从36.7M网页三元组中支持开放指令的图像检索,超越SOTA。
Kai Zhang, Yi Luan, Hexiang Hu 等
提出了一种不一致引导的细节正则化方法,提升了Mask引导的抠图精度,超越了现有技术。
Weihao Jiang, Zhaozhi Xie, Yuxiang Lu 等
ObjectDrop利用反事实数据微调扩展,实现高逼真度的物体移除与插入,显著优于现有方法。
Daniel Winter, Matan Cohen, Shlomi Fruchter 等
Mini-Gemini通过高分辨率视觉编码和高质量数据,提升VLM性能,达成多模态理解与生成的突破。
Yanwei Li, Yuechen Zhang, Chengyao Wang 等
提出基于场景赋能的两阶段模型,结合扩散机制实现语言引导的人体动作生成,显著优于基线。
Zan Wang, Yixin Chen, Baoxiong Jia 等
提出GoodSAM框架,结合DAR与MKA实现无标注全景语义分割,提升3.75% mIoU。
Weiming Zhang, Yexin Liu, Xu Zheng 等
提出PruMerge,通过自适应筛选和合并视觉Token,平均压缩14倍,保持性能。
Yuzhang Shang, Mu Cai, Bingxin Xu 等