Towards General Purpose Vision Systems

TL;DR

GPV-1以共享视觉语言架构统一多任务,在COCO上VQA达62.5、CIDEr-D达1.023。

cs.CV 🔴 高级 2021-04-02 21 次浏览
Tanmay Gupta Amita Kamath Aniruddha Kembhavi Derek Hoiem
通用视觉系统 视觉语言模型 多任务学习 零样本迁移 COCO-SCE

核心发现

方法论

GPV-1接收图像与自然语言任务描述,输出文本、边界框和相关性分数。视觉端采用ResNet-50与DETR,语言端采用BERT和自回归Transformer解码器,ViLBERT协同注意力完成跨模态融合;所有任务共享参数,仅按输出模态使用文本头、框头和相关性头。

关键结果

  • 在标准COCO划分上,多任务GPV-1的VQA准确率为62.5、Captioning CIDEr-D为1.023、Localization AP为73.0、Classification准确率为83.6;相较专用模型,VQA和字幕更高,分类近似,但定位低于专用Faster R-CNN的75.2。
  • 在COCO-SCE上,多任务GPV-1取得VQA 58.8、Captioning 0.908、Localization 64.7、Classification 75.4;相较单任务GPV-1的55.9、0.855、64.8、75.3,联合训练显著提升VQA与字幕。
  • 模型无需Referring Expressions专门训练即可零样本定位指代表达,并在少量样本微调后继续提升;相关性调制使文本监督能够反向影响区域定位,体现技能与概念迁移。

研究意义

论文把视觉系统从预先固定的N个任务,推进到由自然语言指令定义任务的方向。它缓解了新增任务必须设计输出头、损失函数和训练流程的工程负担,并证明共享视觉、语言和跨模态表示不必牺牲总体性能。COCO-SCE还将跨技能概念迁移与学习效率显式化,为通用视觉研究提供了可复用的评价框架。

技术贡献

核心工程贡献是端到端、任务无关的统一输出机制。DETR的100个object queries生成候选区域,二元objectness与任务相关性logits经sigmoid形成relevance scores;这些分数既排序框,也通过relevance conditioning调制文本解码器记忆。文本采用BERT表示和Transformer生成,框监督使用DETR Hungarian loss,文本监督使用负对数似然。

新颖性

相较UniT、12-in-1和E2E-VLP依赖任务专用头、任务组头或分任务微调,GPV-1以自然语言描述任务,并仅保留文本、框和相关性三种模态头。其新意不只是多任务共享,而是让新任务通过指令与目标模态接入同一架构,并系统测量架构、概念和学习三种通用性。

局限性

  • 实验主要限于COCO及其VQA、REFCOCO+标注,任务规模、语言范围和视觉复杂度有限,不能证明对开放世界任务普遍有效。
  • 模型仍依赖DETR、ImageNet式视觉预训练及BERT;文本理解受英语提示和语义相似性限制,定位AP在标准COCO上低于专用Faster R-CNN。
  • 论文摘要提及少样本学习,但给出的正文片段未完整呈现学习曲线、遗忘量及全部消融数值。

未来方向

未来应扩大数据、语言和输出模态,研究更强的视觉基础模型与生成式统一接口;同时建立更严格的开放词汇、组合泛化、持续学习和灾难性遗忘测试,并报告计算成本、提示鲁棒性与真实应用安全性。

AI 总览摘要

现代视觉模型通常是为固定任务打造的专用工具:分类器输出类别,检测器输出框,问答和字幕模型又有各自的头部与损失。这样的设计性能强,却使新应用需要修改架构、数据管线和训练流程。Gupta等人提出GPV-1,试图让视觉系统像通用计算机一样,通过自然语言说明“要做什么”。

GPV-1将图像和任务描述共同输入模型。ResNet-50与DETR提取100个候选区域,BERT编码指令,ViLBERT协同注意力融合两种信息;共享的框、相关性和文本输出机制可处理VQA、分类、定位和字幕。训练时,文本任务使用负对数似然,框任务使用DETR Hungarian loss,不增加任务专用头。相关性分数还会调制视觉区域,使定位和生成相互提供监督。

在COCO上,联合训练模型达到VQA 62.5、CIDEr-D 1.023、定位AP 73.0和分类83.6;在COCO-SCE上达到58.8、0.908、64.7和75.4,并在VQA和字幕上超过单任务模型。它还能零样本完成Referring Expressions,少量样本微调后进一步改善。研究意义在于展示一种可扩展的视觉接口,但其证据仍集中于英语、COCO和有限任务,开放世界泛化、计算效率与长期记忆仍待验证。

深度分析

研究背景

视觉研究从ImageNet分类发展到Faster R-CNN、DETR检测,再到VQA、字幕和短语定位。UniT、12-in-1和VL-T5尝试多任务统一,但仍依赖任务头、区域特征或特定微调。NLP中的T5和GPT-3表明,自然语言任务描述可成为统一接口,论文将这一思想引入端到端视觉语言学习。

核心问题

专用系统面对新任务时通常需要新增分类头、框头或损失,要求专家参与;多任务系统也常把任务边界写进架构。真正的通用系统还必须把已学概念迁移到新技能,并以少量样本学习新任务,同时避免损害旧能力。

核心创新

  • ��用自然语言而非任务头定义任务。
  • ��以ResNet-50、DETR、BERT和ViLBERT组成共享端到端架构。
  • ��用任务无关区域、objectness和relatedness统一框输出。
  • ��提出COCO-SCE,分离已见与未见概念,测试跨技能迁移。
  • ��联合文本与框监督,支持零样本及少样本RefExp。

方法详解

  • ��输入:图像、问题或指令,以及文本或框目标。
  • ��视觉编码:ResNet-50生成特征图,DETR编码器—解码器用R=100个object queries产生区域描述;框头预测候选框。
  • ��语言编码:BERT WordPiece编码任务描述。
  • ��融合:ViLBERT co-attention交叉更新区域和词元。
  • ��区域评分:objectness与relatedness logits相加,经sigmoid得到relevance score。
  • ��生成:自回归Transformer以相关性调制后的区域特征为memory生成文本。
  • ��训练:AdamW,batch size 120;DETR冻结10轮,再训练30轮,学习率最高10^-4,CNN最高10^-5。

实验设计

数据来自COCO、VQA V2和REFCOCO+,任务包括VQA、Captioning、Localization、Classification,并用RefExp测试学习能力。指标分别为VQA加权准确率、CIDEr-D、IoU=0.5的AP和分类准确率。基线包括ViLBERT、VLP、Faster R-CNN和ResNet-50。COCO-SCE将80类分为VQA/字幕持出10类、分类/定位持出10类及60类共享集合。

结果分析

标准COCO上,GPV-1多任务结果为62.5 VQA、1.023 CIDEr-D、73.0 AP和83.6分类准确率;专用模型对应60.1、0.961、75.2和83.3。COCO-SCE上,多任务模型为58.8、0.908、64.7和75.4,单任务模型为55.9、0.855、64.8和75.3,联合训练主要改善VQA与字幕。结果支持共享表示和概念迁移,但定位仍有专用模型优势。

应用场景

可用于以自然语言驱动的图像检索、辅助问答、内容描述、无障碍视觉助手和面向对象的监控查询。部署前需准备覆盖目标概念的图像与文本或框标注,并验证提示表达、隐私和误定位风险。

局限与展望

证据集中于COCO的80类和英语模板,远小于开放世界视觉需求。DETR与BERT预训练带来数据和计算依赖,模型并非完全从零学习。多任务共享可能造成冲突,RefExp的零样本能力也依赖提示与训练概念相似。后续应扩大规模、语言和模态,评估持续学习、遗忘、鲁棒性与真实成本。

通俗解读 非专业人士也能看懂

把GPV-1想成一家“看图服务中心”。以前每个窗口只办一种业务:一个窗口认猫狗,一个窗口找物体,另一个窗口回答问题;新增业务就要重新装修。GPV-1只有几类通用窗口,但顾客可以用话说明需求,例如“找出所有椅子”或“描述这张图”。

它先像工作人员一样看图,把可能的物体位置记下来;再听懂顾客的问题,判断哪些位置重要。如果顾客要答案,它就组织文字;如果顾客要位置,就给出方框。因为不同业务共用同一套“看图、听话、挑重点”的能力,学会一种物体后,可能把它带到另一种业务中。

在COCO测试中,它的问答得分62.5,图像描述得分1.023,分类83.6;还没有专门学习,就能尝试根据“穿绿衣服的人”找目标。它不是万能机器:训练材料主要来自英语和有限类别,复杂新场景仍可能误解指令或找错东西。

简单解释 像给14岁少年讲一样

想象你在玩一个超级视觉游戏。普通游戏角色通常只会一种技能:有的只认物品,有的只回答问题,有的只在地图上画框。GPV-1像一个可以听懂任务说明的角色。你说“找出所有自行车”,它画框;你问“狗是什么颜色”,它用文字回答;你说“介绍这张图”,它写描述。

它的秘诀是把图片和你的指令一起看。它先找出图片里可能重要的区域,再判断你到底关心哪一个,最后选择“说话”或“画框”。这有点像班级里的全能同学:先读懂题目,再从课本中找相关内容,而不是每道题都换一台机器。

研究者在COCO上测试它,联合训练后问答得分62.5,图片描述CIDEr-D为1.023,分类准确率83.6。更酷的是,没专门练习“根据描述找人”,它也能零样本完成这项任务,少量例题后还能进步。

但它还不是科幻中的万能助手。它主要学习英语和COCO里的常见物体,遇到陌生文化、复杂场景或模糊说法可能出错。未来需要更多图片、语言和真实世界任务。

术语表

GPV-1(通用视觉系统)

一种用自然语言指定任务、同时输出文字与边界框的视觉语言模型。它不为每个任务新增专用网络头。

论文提出并评估的核心系统。

DETR(端到端目标检测器)

使用Transformer和固定数量object queries预测目标框的检测算法。其Hungarian loss完成预测与真实目标匹配。

GPV-1的视觉编码与框预测基础。

ViLBERT协同注意力

让视觉区域和语言词元互相关注、交换上下文的信息融合机制。它把图像内容与任务描述联系起来。

GPV-1的跨模态模块。

Relevance score(相关性分数)

表示候选区域与当前任务描述相关程度的分数。它由objectness和relatedness logits相加后经sigmoid得到。

用于排序框并调制文本生成。

COCO-SCE(技能—概念评测)

把某些类别从特定任务训练中隐藏、但通过其他任务暴露的COCO划分。它测试概念能否跨技能迁移。

论文设计的泛化基准。

Referring Expressions(指代表达)

根据“穿绿衣服的人”等短语,在多个相似目标中定位唯一实例。它强调语言指令带来的消歧能力。

用于零样本和少样本学习实验。

开放问题 这项研究留下的未解疑问

  • 1 开放世界泛化仍未知:COCO仅含80类,尚不能说明模型能否理解长尾物体、复杂关系和未见语言。需要更大规模、多语言、组合式基准。
  • 2 多任务共享的边界尚不清楚:任务之间何时互相促进、何时产生梯度冲突?需要更完整消融、学习曲线和遗忘实验数据。

应用场景

近期应用

自然语言图像助手

无障碍用户可上传照片并询问物体、颜色或位置;系统以文字回答或返回框。部署需领域图像、提示模板和人工安全审核,尤其要处理错误识别。

可查询的视觉内容管理

媒体团队可用“找出所有车辆”或“描述场景”批量处理照片。统一接口减少为分类、检测和字幕分别维护模型的成本,但需校验AP和文本事实性。

远期愿景

开放式通用视觉代理

未来系统可根据自然语言组合观察、定位、问答和描述技能,并快速适应新任务。实现这一愿景仍需更强预训练、持续学习、跨语言能力及可解释安全机制。

原文摘要

Computer vision systems today are primarily N-purpose systems, designed and trained for a predefined set of tasks. Adapting such systems to new tasks is challenging and often requires non-trivial modifications to the network architecture (e.g. adding new output heads) or training process (e.g. adding new losses). To reduce the time and expertise required to develop new applications, we would like to create general purpose vision systems that can learn and perform a range of tasks without any modification to the architecture or learning process. In this paper, we propose GPV-1, a task-agnostic vision-language architecture that can learn and perform tasks that involve receiving an image and producing text and/or bounding boxes, including classification, localization, visual question answering, captioning, and more. We also propose evaluations of generality of architecture, skill-concept transfer, and learning efficiency that may inform future work on general purpose vision. Our experiments indicate GPV-1 is effective at multiple tasks, reuses some concept knowledge across tasks, can perform the Referring Expressions task zero-shot, and further improves upon the zero-shot performance using a few training samples.

cs.CV cs.AI cs.CL cs.LG