Unlocking Compositional Generalization in Continual Few-Shot Learning

TL;DR

提出COMPOSE框架,通过训练保持对象几何,推理实现组合匹配,显著提升持续少样本学习中的新概念泛化。

cs.LG 🔴 高级 2026-05-12 44 次浏览
Phu-Quy Nguyen-Lam Phu-Hoa Pham Dao Sy Duy Minh Chi-Nguyen Tran Huynh Trung Kiet Long Tran-Thanh
持续学习 少样本学习 对象中心表示 自监督ViT 组合泛化

核心发现

方法论

该方法利用自监督Vision Transformer(ViT)中的块级语义几何,采用双阶段策略:训练阶段优化整体类别识别,保持对象级几何;推理阶段动态组合保持的槽(slot)匹配新场景。训练中,槽表示完全面向类别身份,避免过度拟合训练模式;推理中,槽被动态组合以匹配新概念。通过冻结骨干网络,防止表示漂移,轻量优化保持新概念迁移能力。核心算法包括基于自监督ViT的块级几何、槽注意力机制、跨相关性正则,结合双阶段训练和无梯度推理,解决组合陷阱。

关键结果

  • 在CGQA(合成场景)和COBJ(自然场景)数据集上,COMPOSE在未见概念泛化(noc)指标分别达到94.14%和89.71%,超越所有对比方法,表现出极强的泛化能力。
  • 在标准持续学习任务(MiniImageNet、CIFAR100、CUB200)中,COMPOSE实现几乎无遗忘,平均性能提升5%以上,验证了其保持表示稳定性和迁移能力。
  • 消除部分匹配训练带来的表征过度专用问题,验证了阶段分离策略在提升新概念识别和持续学习中的有效性。

研究意义

该研究突破了对象中心表示在持续少样本学习中的瓶颈,提出通过几何保持与阶段分离实现泛化与遗忘抑制的双重目标。解决了传统方法在新概念泛化和表示漂移上的根本难题,为未来多任务、多场景持续学习提供了新范式,推动对象级理解在实际应用中的落地。

技术贡献

技术创新包括:1)基于自监督ViT块级几何的槽表示,显著提升槽纯度;2)阶段分离训练与推理,避免过拟合训练模式;3)引入跨相关性正则,防止槽崩溃,增强表示多样性。不同于传统全局特征或端到端匹配,强调几何保持和无梯度推理,提供理论保证和工程实现新可能。

新颖性

首次系统性将自监督ViT的块级几何作为对象槽的基础,提出训练保持几何、推理动态组合的双阶段策略,突破了现有持续学习中场景整体表示的限制,显著提升未见概念的泛化能力。

局限性

  • 模型依赖自监督ViT的块级几何结构,若骨干网络质量不足或几何不清晰,表现会受限。
  • 推理阶段为无梯度优化,可能在极端复杂场景中匹配精度下降。
  • 训练过程中引入多项正则和阶段分离,增加训练复杂度和调参难度。

未来方向

未来可探索多模态融合,增强几何表达的丰富性;优化推理匹配策略,提高极端场景下的鲁棒性;结合元学习机制,进一步提升少样本和泛化能力。

AI 总览摘要

在现实世界中,视觉识别面临不断学习新概念、保持旧知识的挑战。传统模型多以全局特征为基础,难以应对新颖场景,导致泛化能力不足。本文提出COMPOSE框架,通过严格阶段分离实现对象级表示的持续少样本学习。训练阶段,利用自监督ViT的块级几何,优化类别识别,保持对象几何结构;推理阶段,动态组合预训练槽以匹配新场景。该方法避免了部分匹配训练带来的表征过度专用问题,显著提升未见概念的泛化能力。实验证明,在CGQA和COBJ等数据集上,COMPOSE分别达到了94.14%和89.71%的未见概念准确率,超越所有对比方法。在标准持续学习任务中,也表现出极低的遗忘率和优异的迁移能力。该研究为对象中心表示在持续学习中的应用提供了新思路,推动多任务、多场景下的泛化与稳健性。未来,结合多模态信息和元学习机制,有望进一步突破模型的适应极限,推动智能系统的持续学习能力迈向新高度。

深度分析

研究背景

视觉识别技术经过深度学习的发展,从全局特征到对象级表示不断演进。早期方法如ResNet和VGG依赖全局特征,受限于场景复杂性。近年来,目标检测和实例分割引入对象级结构,但在持续学习中仍面临遗忘和泛化难题。Slot Attention等对象分割机制在静态场景表现良好,但在持续学习中表现有限,主要因场景整体表示的固有限制。自监督ViT的出现,为块级几何提供了基础,使得对象槽的纯度成为可能。尽管如此,如何在持续学习中保持几何结构、避免过拟合训练模式,仍是研究难点。

核心问题

核心问题在于:1)现有对象槽方法在训练中容易过度拟合训练场景的局部特征,导致泛化能力下降;2)训练时采用部分匹配目标,造成槽表示的过度专用,难以迁移到新概念。传统方法多采用端到端优化,忽视阶段性目标分离,导致场景整体表示的漂移和槽崩溃。解决这一问题,需在保持几何结构的基础上,设计阶段分离的训练与推理策略,确保槽的纯度和泛化能力。

核心创新

本研究的创新点包括:1)利用自监督ViT的块级几何,作为槽表示的基础,确保槽的对象纯度;2)引入阶段分离策略,训练时优化类别识别,推理时动态组合槽匹配新场景,避免过度拟合;3)采用跨相关性正则,防止槽崩溃,提升表示多样性。这些创新区别于传统端到端匹配或全局特征方法,强调几何保持和无梯度推理,为持续少样本学习提供新思路。

方法详解

  • �� 训练阶段:
  • 输入图像通过自监督ViT提取块级特征Fn。
  • 利用冻结的槽注意力模块计算每个槽的注意力权重αkn。
  • 通过注意力加权平均得到槽表示˜ϕk,保持几何纯度。
  • 训练可调节的路由器(MLP)为每个槽赋予重要性权重ωk。
  • 共享投影头W2将槽表示映射到单位向量,优化目标为类别交叉熵和跨相关性正则。
  • �� 推理阶段:
  • 固定骨干和槽注意力,提取场景块特征。
  • 计算相对槽特征(减去平均值)以消除背景偏差。
  • 利用双向Chamfer距离,将槽动态匹配到新场景中的对象。
  • 最终融合整体识别分数与部分匹配分数,完成场景识别。

实验设计

采用CGQA(合成场景)和COBJ(自然场景)两个数据集,分别评估未见概念泛化能力。对比多种方法,包括端到端训练模型、预训练模型和其他持续学习方法。关键指标为noc(未见概念准确率),COMPOSE在两个数据集上均优于对比方法,达到94.14%和89.71%。此外,在MiniImageNet、CIFAR100等常规持续学习任务中,表现出极低的遗忘率和迁移能力。实验还包括不同骨干网络(如DINOv2 ViT-B/14、iBOT ViT-B/16)和正则项的消融分析,验证阶段分离策略的有效性。

结果分析

COMPOSE在CGQA数据集未见概念指标达94.14%,显著优于其他方法,验证其泛化能力。在CIFAR100和MiniImageNet上,平均性能提升超过5%,几乎无遗忘。消融实验显示,阶段分离和几何保持是性能提升的关键因素。整体结果表明,该方法在保持表征稳定性和提升新概念识别方面具有明显优势,为持续学习提供了新范式。

应用场景

该技术适用于机器人视觉、自动驾驶和智能监控等场景,尤其在需要持续学习新类别、少样本识别的应用中表现出色。依赖自监督ViT和槽机制,能在有限标注条件下实现高效泛化。未来还可结合多模态信息,增强场景理解能力,推动智能系统的自主学习和适应。

局限与展望

模型依赖自监督ViT的几何结构,若骨干网络性能不足或场景复杂,表现受限。推理阶段为无梯度匹配,可能在极端复杂场景中出现匹配误差。训练阶段引入多项正则和阶段分离,增加调参难度和计算成本。未来需优化几何表达的鲁棒性和推理效率,提升模型适应极端场景的能力。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,每天都要组装不同的产品。以前,你需要记住每个产品的全部细节,但这样一来,每次遇到新产品时都要重新学习,效率很低。现在,你学会了只关注产品的基本部分,比如螺丝、板子、按钮,然后根据这些部分组合出不同的产品。这样,无论新产品长什么样,只要它由这些基本部分组成,你都能快速识别和组装。这就像这篇论文中的方法,模型学会了只关注对象的基本几何结构,然后在遇到新场景时,通过组合这些“零件”来识别新概念。这样既节省了学习时间,又能应对各种新场景,就像工厂里的工人一样灵活高效。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,每次拼不同的图片。以前,你只记住每个拼图块的完整样子,但这样很难拼出新图片。现在,你学会了只关注每个拼图块的基本形状和颜色,然后根据这些拼块的关系拼出新图片。就像你用积木搭房子,只要知道每块积木的形状和怎么拼在一起,就能搭出各种不同的房子。这篇论文的模型也是一样,它学会了只关注场景中的“零件”,比如物体的边缘、颜色,然后在遇到新场景时,通过组合这些“零件”识别新物体。这样既能快速学习新东西,又不会忘记以前学过的,变得更聪明、更灵活。

原文摘要

Object-centric representations promise a key property for few-shot learning: Rather than treating a scene as a single unit, a model can decompose it into individual object-level parts that can be matched and compared across different concepts. In practice, this potential is rarely realized. Continual learners either collapse scenes into global embeddings, or train with part-level matching objectives that tie representations too closely to seen patterns, leaving them unable to generalize to truly novel concepts. In this paper, we identify this fundamental structural conflict and pioneer a new paradigm that strictly decouples representation learning from compositional inference. Leveraging the inherent patch-level semantic geometry of self-supervised Vision Transformers (ViTs), our framework employs a dual-phase strategy. During training, slot representations are optimized entirely toward holistic class identity, preserving highly generalizable, object-level geometries. At inference, preserved slots are dynamically composed to match novel scenes. We demonstrate that this paradigm offers dual structural benefits: The frozen backbone naturally prevents representation drift, while our lightweight, holistic optimization preserves the features' capacity for novel-concept transfer. Extensive experiments validate this approach, achieving state-of-the-art unseen-concept generalization and minimal forgetting across standard continual learning benchmarks.

cs.LG cs.CV