WeDetect: Fast Open-Vocabulary Object Detection as Retrieval

TL;DR

WeDetect通过检索实现快速开放词汇目标检测,在15个基准上达到SOTA性能,推理效率极高。

cs.CV 🔴 高级 2025-12-13 27 次浏览
Shenghao Fu Yukun Su Fengyun Rao Jing Lyu Xiaohua Xie Wei-Shi Zheng
开放词汇检测 目标检索 实时推理 深度学习 视觉语言模型

核心发现

方法论

WeDetect采用双塔架构,无需跨模态融合层,将目标检测转化为检索问题。通过CLIP预训练、ConvNeXt主干网络和高质量数据集,显著提升开放词汇检测性能。

关键结果

  • WeDetect-Tiny在LVIS minival上达到37.4 AP,比YOLO-World-L高2.0 AP,推理速度达62.5 fps。
  • WeDetect-Large在LVIS上达到55.0 AP,超过T-Rex2 3.6 AP,同时推理速度提高3倍。
  • WeDetect-Uni在对象检索任务中比CLIP高37.2 F1分数,展示细粒度感知优势。

研究意义

该研究解决了开放词汇目标检测效率低的问题,统一了检测、提案生成、对象检索和复杂表达理解,推动了视觉语言领域的应用和发展。

技术贡献

提出了无需融合层的双塔架构,显著提高推理效率;开发了高质量数据引擎,生成15M图像和330M标注框;设计了基于LLM的对象分类器,优化复杂表达理解。

新颖性

首次将开放词汇目标检测完全转化为检索问题,提出了统一框架WeDetect系列,涵盖检测、提案生成和复杂表达理解。

局限性

  • 对小目标的检测性能在某些场景下仍有提升空间。
  • 依赖大规模预训练模型,计算资源需求较高。
  • 数据引擎生成的标注质量可能受限于模型能力。

未来方向

未来可探索更高效的模型架构,优化小目标检测性能;扩展数据引擎以支持更多语义层次;研究跨领域应用的泛化能力。

AI 总览摘要

开放词汇目标检测旨在通过文本提示识别任意类别,但现有方法效率低下且难以推广。

WeDetect提出了一种基于检索的统一框架,采用双塔架构,无需跨模态融合层。通过CLIP预训练和ConvNeXt主干网络,结合高质量数据集,显著提升检测性能和推理效率。WeDetect系列包括WeDetect基础模型、WeDetect-Uni通用提案生成器和WeDetect-Ref复杂表达理解模型。

实验表明,WeDetect在LVIS、COCO等15个基准上达到SOTA性能,同时推理速度远超现有方法。其统一框架为开放词汇检测、对象检索和复杂表达理解提供了高效解决方案,推动了视觉语言领域的发展。

深度分析

研究背景

开放词汇目标检测近年来受到广泛关注,其目标是通过文本提示识别任意类别。传统方法依赖深度跨模态融合层,尽管精度较高,但推理效率低下,限制了实际应用。

核心问题

现有方法在处理大规模类别时推理速度过慢,例如Grounding-DINO在LVIS上需要31次前向传递,导致每张图像推理耗时数秒。此外,融合层使得视觉特征无法跨查询共享,进一步限制了效率。

核心创新

WeDetect提出了无需融合层的双塔架构,将目标检测转化为检索问题。通过CLIP预训练、ConvNeXt主干网络和数据引擎生成的高质量数据集,显著提升了开放词汇检测性能和效率。

方法详解

  • �� 双塔架构:语言编码器采用XLM-RoBERTa,视觉编码器基于ConvNeXt,分类通过图像网格特征与类文本嵌入的点积实现。
  • �� 数据引擎:采集15M图像,生成330M标注框,采用SAM和Qwen2.5-VL生成多层次标签。
  • �� WeDetect-Uni:冻结检测器,仅训练通用对象性提示,实现高召回率提案生成。
  • �� WeDetect-Ref:基于LLM的分类器,处理复杂表达,单次前向传递完成分类。

实验设计

实验使用LVIS、COCO、ODinW等基准,评估开放词汇检测性能。对比基线包括YOLO-World-L、Grounding-DINO等。还进行了对象检索任务和复杂表达理解测试。

结果分析

WeDetect在LVIS上达到55.0 AP,推理速度比Grounding-DINO快3倍;对象检索任务中F1分数比CLIP高37.2;复杂表达理解平均准确率达93.2。

应用场景

可用于实时目标检测、图像内容审核、关键词检索等场景,尤其适用于大规模类别和复杂表达的处理。

局限与展望

对小目标的检测性能仍有提升空间;依赖大规模预训练模型,计算资源需求较高;标注质量可能受限于数据引擎能力。

通俗解读 非专业人士也能看懂

想象你在一个图书馆寻找特定书籍。传统方法需要逐一检查每本书的内容,而WeDetect像一个智能检索系统,直接根据关键词找到相关书籍。这种方法不仅快,还能处理复杂的查询,比如“封面是蓝色的书”。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要找到地图上的所有宝藏。传统方法是逐一搜索每个角落,而WeDetect像一个超级助手,输入“金色宝藏”就能快速标出所有位置!是不是很酷?

术语表

开放词汇检测 (Open-Vocabulary Detection)

通过文本提示检测任意类别的目标。

WeDetect用于识别大规模类别。

双塔架构 (Dual-Tower Architecture)

语言编码器和视觉编码器独立工作,特征在共享嵌入空间中匹配。

WeDetect采用双塔架构实现高效推理。

CLIP

一种视觉语言模型,通过对比学习实现图像-文本对齐。

WeDetect基于CLIP预训练。

对象检索 (Object Retrieval)

根据用户指定类别快速检索包含目标的图像。

WeDetect-Uni支持对象检索任务。

复杂表达理解 (Referring Expression Comprehension)

根据复杂语言描述定位目标。

WeDetect-Ref处理复杂表达任务。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升小目标检测性能?
  • 2 如何优化数据引擎生成的标注质量?
  • 3 跨领域泛化能力仍需深入研究。

应用场景

近期应用

实时目标检测

适用于监控、无人驾驶等场景,快速识别多类别目标。

图像内容审核

用于社交媒体平台,自动检测违规内容。

远期愿景

智能视觉语言系统

未来可应用于机器人和增强现实,支持复杂任务。

原文摘要

Open-vocabulary object detection aims to detect arbitrary classes via text prompts. Methods without cross-modal fusion layers (non-fusion) offer faster inference by treating recognition as a retrieval problem, \ie, matching regions to text queries in a shared embedding space. In this work, we fully explore this retrieval philosophy and demonstrate its unique advantages in efficiency and versatility through a model family named WeDetect: (1) State-of-the-art performance. WeDetect is a real-time detector with a dual-tower architecture. We show that, with well-curated data and full training, the non-fusion WeDetect surpasses other fusion models and establishes a strong open-vocabulary foundation. (2) Fast backtrack of historical data. WeDetect-Uni is a universal proposal generator based on WeDetect. We freeze the entire detector and only finetune an objectness prompt to retrieve generic object proposals across categories. Importantly, the proposal embeddings are class-specific and enable a new application, object retrieval, supporting retrieval objects in historical data. (3) Integration with LMMs for referring expression comprehension (REC). We further propose WeDetect-Ref, an LMM-based object classifier to handle complex referring expressions, which retrieves target objects from the proposal list extracted by WeDetect-Uni. It discards next-token prediction and classifies objects in a single forward pass. Together, the WeDetect family unifies detection, proposal generation, object retrieval, and REC under a coherent retrieval framework, achieving state-of-the-art performance across 15 benchmarks with high inference efficiency.

cs.CV