核心发现
方法论
WeDetect采用双塔架构,无需跨模态融合层,将目标检测转化为检索问题。通过CLIP预训练、ConvNeXt主干网络和高质量数据集,显著提升开放词汇检测性能。
关键结果
- WeDetect-Tiny在LVIS minival上达到37.4 AP,比YOLO-World-L高2.0 AP,推理速度达62.5 fps。
- WeDetect-Large在LVIS上达到55.0 AP,超过T-Rex2 3.6 AP,同时推理速度提高3倍。
- WeDetect-Uni在对象检索任务中比CLIP高37.2 F1分数,展示细粒度感知优势。
研究意义
该研究解决了开放词汇目标检测效率低的问题,统一了检测、提案生成、对象检索和复杂表达理解,推动了视觉语言领域的应用和发展。
技术贡献
提出了无需融合层的双塔架构,显著提高推理效率;开发了高质量数据引擎,生成15M图像和330M标注框;设计了基于LLM的对象分类器,优化复杂表达理解。
新颖性
首次将开放词汇目标检测完全转化为检索问题,提出了统一框架WeDetect系列,涵盖检测、提案生成和复杂表达理解。
局限性
- 对小目标的检测性能在某些场景下仍有提升空间。
- 依赖大规模预训练模型,计算资源需求较高。
- 数据引擎生成的标注质量可能受限于模型能力。
未来方向
未来可探索更高效的模型架构,优化小目标检测性能;扩展数据引擎以支持更多语义层次;研究跨领域应用的泛化能力。
AI 总览摘要
开放词汇目标检测旨在通过文本提示识别任意类别,但现有方法效率低下且难以推广。
WeDetect提出了一种基于检索的统一框架,采用双塔架构,无需跨模态融合层。通过CLIP预训练和ConvNeXt主干网络,结合高质量数据集,显著提升检测性能和推理效率。WeDetect系列包括WeDetect基础模型、WeDetect-Uni通用提案生成器和WeDetect-Ref复杂表达理解模型。
实验表明,WeDetect在LVIS、COCO等15个基准上达到SOTA性能,同时推理速度远超现有方法。其统一框架为开放词汇检测、对象检索和复杂表达理解提供了高效解决方案,推动了视觉语言领域的发展。
深度分析
研究背景
开放词汇目标检测近年来受到广泛关注,其目标是通过文本提示识别任意类别。传统方法依赖深度跨模态融合层,尽管精度较高,但推理效率低下,限制了实际应用。
核心问题
现有方法在处理大规模类别时推理速度过慢,例如Grounding-DINO在LVIS上需要31次前向传递,导致每张图像推理耗时数秒。此外,融合层使得视觉特征无法跨查询共享,进一步限制了效率。
核心创新
WeDetect提出了无需融合层的双塔架构,将目标检测转化为检索问题。通过CLIP预训练、ConvNeXt主干网络和数据引擎生成的高质量数据集,显著提升了开放词汇检测性能和效率。
方法详解
- �� 双塔架构:语言编码器采用XLM-RoBERTa,视觉编码器基于ConvNeXt,分类通过图像网格特征与类文本嵌入的点积实现。
- �� 数据引擎:采集15M图像,生成330M标注框,采用SAM和Qwen2.5-VL生成多层次标签。
- �� WeDetect-Uni:冻结检测器,仅训练通用对象性提示,实现高召回率提案生成。
- �� WeDetect-Ref:基于LLM的分类器,处理复杂表达,单次前向传递完成分类。
实验设计
实验使用LVIS、COCO、ODinW等基准,评估开放词汇检测性能。对比基线包括YOLO-World-L、Grounding-DINO等。还进行了对象检索任务和复杂表达理解测试。
结果分析
WeDetect在LVIS上达到55.0 AP,推理速度比Grounding-DINO快3倍;对象检索任务中F1分数比CLIP高37.2;复杂表达理解平均准确率达93.2。
应用场景
可用于实时目标检测、图像内容审核、关键词检索等场景,尤其适用于大规模类别和复杂表达的处理。
局限与展望
对小目标的检测性能仍有提升空间;依赖大规模预训练模型,计算资源需求较高;标注质量可能受限于数据引擎能力。
通俗解读 非专业人士也能看懂
想象你在一个图书馆寻找特定书籍。传统方法需要逐一检查每本书的内容,而WeDetect像一个智能检索系统,直接根据关键词找到相关书籍。这种方法不仅快,还能处理复杂的查询,比如“封面是蓝色的书”。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,需要找到地图上的所有宝藏。传统方法是逐一搜索每个角落,而WeDetect像一个超级助手,输入“金色宝藏”就能快速标出所有位置!是不是很酷?
术语表
开放词汇检测 (Open-Vocabulary Detection)
通过文本提示检测任意类别的目标。
WeDetect用于识别大规模类别。
双塔架构 (Dual-Tower Architecture)
语言编码器和视觉编码器独立工作,特征在共享嵌入空间中匹配。
WeDetect采用双塔架构实现高效推理。
CLIP
一种视觉语言模型,通过对比学习实现图像-文本对齐。
WeDetect基于CLIP预训练。
对象检索 (Object Retrieval)
根据用户指定类别快速检索包含目标的图像。
WeDetect-Uni支持对象检索任务。
复杂表达理解 (Referring Expression Comprehension)
根据复杂语言描述定位目标。
WeDetect-Ref处理复杂表达任务。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升小目标检测性能?
- 2 如何优化数据引擎生成的标注质量?
- 3 跨领域泛化能力仍需深入研究。
应用场景
近期应用
实时目标检测
适用于监控、无人驾驶等场景,快速识别多类别目标。
图像内容审核
用于社交媒体平台,自动检测违规内容。
远期愿景
智能视觉语言系统
未来可应用于机器人和增强现实,支持复杂任务。
原文摘要
Open-vocabulary object detection aims to detect arbitrary classes via text prompts. Methods without cross-modal fusion layers (non-fusion) offer faster inference by treating recognition as a retrieval problem, \ie, matching regions to text queries in a shared embedding space. In this work, we fully explore this retrieval philosophy and demonstrate its unique advantages in efficiency and versatility through a model family named WeDetect: (1) State-of-the-art performance. WeDetect is a real-time detector with a dual-tower architecture. We show that, with well-curated data and full training, the non-fusion WeDetect surpasses other fusion models and establishes a strong open-vocabulary foundation. (2) Fast backtrack of historical data. WeDetect-Uni is a universal proposal generator based on WeDetect. We freeze the entire detector and only finetune an objectness prompt to retrieve generic object proposals across categories. Importantly, the proposal embeddings are class-specific and enable a new application, object retrieval, supporting retrieval objects in historical data. (3) Integration with LMMs for referring expression comprehension (REC). We further propose WeDetect-Ref, an LMM-based object classifier to handle complex referring expressions, which retrieves target objects from the proposal list extracted by WeDetect-Uni. It discards next-token prediction and classifies objects in a single forward pass. Together, the WeDetect family unifies detection, proposal generation, object retrieval, and REC under a coherent retrieval framework, achieving state-of-the-art performance across 15 benchmarks with high inference efficiency.