Putting the Object Back into Video Object Segmentation

TL;DR

Cutie以对象级记忆读取提升VOS,在MOSE上较XMem提高8.7 J&F。

cs.CV 🔴 高级 2023-10-20 22 次浏览
Ho Kei Cheng Seoung Wug Oh Brian Price Joon-Young Lee Alexander Schwing
视频目标分割 对象级记忆 Transformer Cutie 长期跟踪

核心发现

方法论

Cutie保留XMem的像素记忆与低层匹配,再引入对象记忆和16个可学习对象查询。查询通过3个Query-based Object Transformer块,与stride-16像素特征双向交互;前景—背景掩码注意力让一半查询只看前景、另一半只看背景,从而抑制干扰物。

关键结果

  • 不使用MOSE训练时,Cutie-base在MOSE验证集取得64.0 J&F,较XMem的56.3提高7.7点;论文摘要报告其相对XMem提升8.7 J&F,反映不同训练/比较设置下的稳健优势。
  • Cutie-base在DAVIS-2017验证集达到88.8 J&F,在YouTubeVOS-2019验证集达到86.1 G;MOSE训练后,MOSE为68.3 J&F,明显高于XMem的59.6。
  • Cutie-small速度45.5 FPS、Cutie-base速度36.4 FPS;相较DeAOT,论文报告提升4.2 J&F且约快3倍,说明对象级交互未牺牲实时性。

研究意义

论文针对遮挡、拥挤场景中像素匹配易受干扰物污染这一长期问题,证明VOS需要全局对象语义而非逐像素相似度。Cutie在MOSE上的显著收益说明对象级记忆可提升跨帧身份一致性,同时保留高分辨率特征保证边界质量,对机器人、视频编辑和开放词汇跟踪具有实际价值。

技术贡献

核心贡献是把静态对象查询、动态对象记忆与像素读出放入统一的双向Transformer。对象查询先从像素图提炼全局语义,再反向校正像素特征;前景—背景masked attention使用掩码M_l∈{0,-∞}限制注意范围。对象记忆通过掩码池化和流式平均长期更新,遮挡时可避免特征漂移。

新颖性

与XMem、DeAOT等主要依赖像素级记忆读取的方法不同,Cutie将对象级摘要真正写回像素特征;与HODOR、TarViS相比,它端到端学习对象表示,并保留高分辨率分割路径。其新颖性不在于单独使用查询,而在于低成本、双向、前景背景分离的对象—像素协同机制。

局限性

  • 对象记忆仍依赖预测掩码和低层像素读出;若早期分割错误持续写入记忆,可能造成身份漂移,论文未提供对所有长期错误传播的理论保证。
  • 实验主要覆盖DAVIS、YouTubeVOS和MOSE;极长视频使用XMem长期记忆,复杂运动、极小目标及未见域的泛化仍需更多评估。
  • 输入通常缩放至短边480像素,速度与精度在更高分辨率或多目标密集场景中的权衡尚未充分报告。

未来方向

未来可研究不确定性感知的记忆更新、自动决定何时写入对象记忆,以及适应不同目标数量的查询分配。结合SAM、开放词汇提示和更长视频数据集,可进一步验证Cutie在通用视频分割、机器人和在线编辑中的迁移能力。

AI 总览摘要

半监督视频目标分割要求模型从第一帧标注出发,持续跟踪并分割开放词汇目标。XMem等方法主要进行逐像素记忆匹配:每个查询像素独立寻找历史相似像素。在遮挡、拥挤和干扰物存在时,这种自下而上的策略容易产生错误匹配;MOSE相较DAVIS-2017可使近期方法性能下降超过20个J&F点。

Cutie的关键改变是“把对象放回结果”。它在XMem式像素记忆之外保存紧凑对象记忆,并使用16个对象查询,通过3层Query-based Object Transformer与像素读出双向交互。前景—背景masked attention将查询分流到目标和背景;对象查询负责全局身份与语义,高分辨率像素特征负责边界和细节,最终共同生成掩码。

结果显示,Cutie-base在未用MOSE训练时于MOSE验证集取得64.0 J&F,DAVIS-2017验证集为88.8,YouTubeVOS-2019为86.1 G;用MOSE训练后MOSE达到68.3,而XMem为59.6。Cutie-small达到45.5 FPS,base达到36.4 FPS。研究表明,对象级记忆能够以较低计算代价抑制匹配噪声,为实时、鲁棒的机器人感知、视频编辑和通用视频跟踪提供了可行路径。

深度分析

研究背景

VOS从在线微调、循环传播发展到记忆网络。XMem使用工作记忆、感知记忆和可选长期记忆,DeAOT通过身份库提升多目标效率;但这些方法仍主要依赖像素级匹配。HODOR和TarViS引入对象描述,却因高分辨率特征利用不足而落后。MOSE包含严重遮挡和拥挤环境,揭示了标准数据集未充分暴露的鲁棒性问题。

核心问题

像素级读取将每个查询像素独立映射为历史像素的加权组合,注意力可能错误指向外观相似的干扰物,缺乏目标整体一致性。模型既要保持全局身份,又要恢复精细边界;直接让高分辨率空间特征彼此注意的复杂度可达O(n^4),实时部署困难。

核心创新

  • ��对象级读取:用少量查询概括目标并校正像素读出。
  • ��双向交互:查询读取像素语义,随后将对象语义写回像素特征。
  • ��前景—背景掩码:按当前预测掩码限制查询注意区域,同时保留查询间自注意力。
  • ��对象记忆:以N个掩码池化向量保存长期、目标特定信息,遮挡时零权重区域不更新。

方法详解

  • ��像素记忆:查询特征q与历史键k计算各向异性L2相似度,A^pix_ij=exp(d(q_i,k_j))/Σ_m exp(d(q_i,k_m)),再与隐藏状态融合得到R0。
  • ��查询初始化:X0=X+S,其中X为静态查询,S为对象记忆。
  • ��对象Transformer:每层先做像素到查询的masked cross-attention,再做查询self-attention和FFN;随后以反向cross-attention更新像素特征,避免像素self-attention。
  • ��掩码机制:q≤N/2只关注M_l(i)≥0.5的前景,否则关注背景。
  • ��对象记忆:S_q=Σ_iU(i)W_q(i)/Σ_iW_q(i),通过流式平均恒定更新;最终R_L送入解码器。

实验设计

模型采用C=256、L=3、N=16;small使用ResNet-18查询编码器,base使用ResNet-50,掩码编码器为ResNet-18。先在静态图像合成三帧序列预训练80K步,再在DAVIS和YouTubeVOS训练125K步;优化器为AdamW,学习率1e-4、批量16、权重衰减0.001。评估DAVIS-2017、YouTubeVOS-2019、MOSE,指标为J、F及J&F,另报告FPS。

结果分析

未用MOSE训练时,Cutie-base在MOSE为64.0 J&F,XMem为56.3,DeAOT-R50为59.0;DAVIS验证集为88.8,YouTubeVOS G为86.1。用MOSE训练后,Cutie-base达到68.3,XMem为59.6,DeAOT为64.1。Cutie-small/base分别为45.5/36.4 FPS,体现准确率、鲁棒性和效率的平衡。

应用场景

在线机器人感知可用第一帧标注锁定物体,在遮挡和拥挤环境中持续跟踪。视频编辑可将对象掩码用于抠像、替换和局部特效。Cutie也可作为Tracking Anything、DEVA等开放词汇或通用视频分割系统的传播模块;前提是提供初始掩码或外部提示。

局限与展望

Cutie仍以XMem像素记忆为基础,因此错误匹配并未从根本上消失,只是由对象查询进行校正。预测掩码错误可能污染对象记忆;多目标扩展、极长视频、高分辨率和跨域场景仍缺少充分实验。未来需要不确定性门控、可解释的记忆淘汰,以及更强的开放词汇和极端运动建模。

通俗解读 非专业人士也能看懂

把Cutie想成一位在仓库里找货物的管理员。传统方法像是逐个查看箱子上的颜色和纹理:当前箱子只和过去相似的箱子比较。如果背景里也有相同颜色的箱子,管理员就可能拿错货。Cutie先保存两类记录:一类记录每个局部位置,另一类用少量“货物摘要卡”记录目标整体外观。

看到新画面时,摘要卡先从局部记录中判断“真正要找的货物长什么样、在哪里”,再把这个整体判断传回每个位置,纠正局部判断。它还把卡片分成两组:一组只检查目标区域,另一组专门检查背景。这样,背景中的相似物不会轻易冒充目标,同时边缘和细节仍由高清局部记录保留。

在MOSE困难数据上,Cutie-base达到64.0 J&F,明显超过XMem的56.3;在DAVIS-2017验证集达到88.8。它还能以36.4 FPS运行,说明这种“先整体判断、再修正细节”的办法既可靠又足够快。

简单解释 像给14岁少年讲一样

想象你在游戏里追踪一个角色。第一帧你告诉系统:“就是这只红色背包的人!”接下来画面不断变化,角色可能被树挡住,旁边还站着几个也穿红衣服的人。只看每个像素的颜色,就很容易追错人,这正是很多旧方法的问题。

Cutie像是给系统安排了一支小侦探队。每个侦探不只看一个点,而是记住目标的整体特征:形状、外观和它与周围环境的关系。有些侦探只检查目标,有些专门检查背景;他们先交换意见,再把结论告诉画面中的每个小区域。

Cutie还保留高清画面,所以不会因为只记住“这个人”就丢掉手指、头发或物体边缘。它使用16个小查询和3层处理模块,在新画面中反复确认目标。结果很厉害:MOSE上Cutie-base得到64.0分,而XMem只有56.3;DAVIS上达到88.8。

当然,它也不是魔法。如果一开始认错并把错误记忆保存下来,后面可能继续错;特别小的目标、很长的视频和完全不同的环境也可能更难。下一步可以让系统知道自己什么时候不确定,不要盲目更新记忆。

术语表

Video Object Segmentation(视频目标分割)

在视频中持续找出并描绘指定目标的每个像素。半监督设置通常只给出第一帧标注。

Cutie以第一帧目标掩码为输入,逐帧输出后续掩码。

Pixel-level memory(像素级记忆)

保存历史帧的局部特征,并按相似度为当前像素检索信息。它细致但容易受干扰物影响。

Cutie沿用XMem的像素记忆作为初始读出R0。

Object query(对象查询)

用于概括一个对象高层语义的可学习向量。多个查询可分别关注目标部分、背景或干扰物。

Cutie使用N=16个查询进行对象级推理。

Masked attention(掩码注意力)

通过将不允许的位置设为−∞,限制注意力只能访问指定区域。这样可减少语义混合。

Cutie把查询分成前景组和背景组。

Object memory(对象记忆)

由历史目标特征池化得到的紧凑向量集合,保存长期、目标特定信息。

它与静态查询相加形成X0,并通过流式平均更新。

J&F

J为区域交并比,F为轮廓准确度,二者平均用于评价分割区域和边界。

论文用J&F比较MOSE、DAVIS和其他VOS方法。

开放问题 这项研究留下的未解疑问

  • 1 错误记忆如何在数千帧中累积仍未完全解决;需要可靠的不确定性估计、记忆回滚和自动清理机制。
  • 2 对象查询数量固定为16,多个目标、目标数量变化及极端小目标下的最优分配策略仍不明确。
  • 3 Cutie对跨摄像机域、强光照变化和高分辨率输入的泛化,需要更广泛基准与真实部署测试。

应用场景

近期应用

智能视频编辑

编辑人员提供第一帧目标掩码后,Cutie可在线生成后续对象掩码,用于抠像、替换背景、局部调色和特效。DAVIS与YouTubeVOS结果表明它兼顾边界质量与实时速度。

机器人目标跟踪

机器人可在首次观察时指定物体,随后利用对象记忆在遮挡、拥挤场景中持续跟踪。部署需要摄像头、初始掩码和适当的显存资源。

远期愿景

通用视频理解

结合SAM、文本提示和DEVA等系统,Cutie可成为开放词汇视频分割的高效传播模块,减少逐帧人工标注。但仍需解决多目标身份管理和跨域鲁棒性。

原文摘要

We present Cutie, a video object segmentation (VOS) network with object-level memory reading, which puts the object representation from memory back into the video object segmentation result. Recent works on VOS employ bottom-up pixel-level memory reading which struggles due to matching noise, especially in the presence of distractors, resulting in lower performance in more challenging data. In contrast, Cutie performs top-down object-level memory reading by adapting a small set of object queries. Via those, it interacts with the bottom-up pixel features iteratively with a query-based object transformer (qt, hence Cutie). The object queries act as a high-level summary of the target object, while high-resolution feature maps are retained for accurate segmentation. Together with foreground-background masked attention, Cutie cleanly separates the semantics of the foreground object from the background. On the challenging MOSE dataset, Cutie improves by 8.7 J&F over XMem with a similar running time and improves by 4.2 J&F over DeAOT while being three times faster. Code is available at: https://hkchengrex.github.io/Cutie

cs.CV