Attention from Action, for Action: Emergent Visual Bottlenecks for Policy Learning

TL;DR

提出Seeker,通过从动作中学习视觉关注区域,提升机器人视觉策略的鲁棒性和数据效率,成功率从48.3%提升至76.7%。

cs.RO 🔴 高级 2026-08-14 112 次浏览
Zheyu Zhuang Ruiyu Wang Nick Heppert Johannes Fabian Hahn Abhinav Valada Florian T. Pokorny Danica Kragic
视觉注意机制 策略学习 机器人操作 无标签学习 视觉瓶颈

核心发现

方法论

Seeker基于预训练的DINOv3特征,通过迭代更新查询向量,学习控制任务和状态条件下的注意区域(ROI)。其核心机制包括:• 利用冻结的DINOv3特征作为基础表示;• 设计任务和状态条件的查询,动态引导注意力焦点;• 采用多头门控机制(head gating)实现多样化空间线索的融合;• 通过动作预测任务训练ROI,无需外部空间标签。该方法在模拟和真实机器人环境中,结合RGB裁剪、掩码引导的背景增强和点云过滤,实现了对视觉信息的高效利用。

关键结果

  • 在模拟环境中,Seeker提升了策略的平均成功率,从42.6%(无裁剪基线)提高到62.6%,相对提升52.8%。在真实机器人任务中,成功率从48.3%提升到76.7%,在光照和背景变化条件下,成功率由20.0%跃升至60.0%。此外,Seeker的ROI可用于背景遮罩增强和点云过滤,显著增强了模型的鲁棒性。
  • Seeker的学习过程只依赖动作监督,无需外部空间标签或语义信息,表现出优异的泛化能力。其在多任务、多场景中展现出稳定的性能,特别是在复杂的长时序操作任务中,ROI的动态调整有效捕捉关键视觉证据。
  • 通过消融实验,验证了基于动作的ROI学习优于传统的基于外部标签或关键点的空间瓶颈方法。Seeker在模拟和实际机器人平台上均优于RVT2-Crop和Oracle ROI,显示出其在数据效率和鲁棒性方面的显著优势。

研究意义

本研究突破了传统依赖外部空间标签的限制,提出一种纯动作监督的视觉瓶颈学习方法,为机器人策略的自主感知提供了新思路。该方法不仅提升了数据利用效率,还增强了策略在环境变化中的适应能力,有望推动机器人自主操作、视觉引导和多模态感知的研究发展。其在工业自动化、服务机器人等领域具有广泛应用潜力,尤其适合在标注成本高昂或环境复杂的场景中实现高效学习。

技术贡献

本文的主要技术贡献包括:• 提出基于预训练视觉特征的迭代查询机制,动态学习控制相关的ROI;• 设计多头门控结构,融合多源空间线索,实现多模态信息的自适应整合;• 引入动作预测作为监督信号,避免对空间标签的依赖,提升学习的自主性和泛化能力;• 实现ROI的多功能应用,包括RGB裁剪、背景增强和点云过滤,增强策略的鲁棒性。该框架在保证无需外部标签的前提下,有效捕获任务关键视觉证据,为机器人策略学习提供了新途径。

新颖性

该方法的创新点在于:首次提出利用动作监督学习动态视觉瓶颈,避免了传统方法对外部空间标签的依赖。不同于以往基于关键点或语义标签的空间瓶颈,Seeker通过迭代更新查询,适应任务和状态变化,实现了控制相关的ROI的自主学习。这一机制结合预训练视觉特征,显著提升了策略的适应性和鲁棒性,填补了动作引导的视觉瓶颈研究中的空白。

局限性

  • Seeker在复杂场景中对遮挡和极端环境变化的适应性仍有限,尤其是在视觉信息严重受损或遮挡时,ROI的准确性可能下降。
  • 模型训练依赖大量的动作数据,虽然无需空间标签,但在某些高复杂度任务中,动作样本的多样性和代表性仍是限制因素。
  • 实时应用中,Seeker的迭代查询机制可能带来计算开销,影响机器人在高频操作中的响应速度。

未来方向

未来的研究方向包括:• 引入多模态信息(如深度、触觉)以增强ROI的鲁棒性;• 结合强化学习机制,优化ROI的动态调整策略;• 探索更高效的模型结构,降低计算成本,提升实时性能;• 扩展到多机器人协作场景,实现多主体的视觉引导策略学习。

AI 总览摘要

在机器人视觉策略学习中,如何高效、鲁棒地捕获任务关键的视觉信息一直是核心难题。传统方法多依赖外部标注或语义标签,如人类注视点、对象类别或语义掩码,然而这些标签的获取成本高昂,且在长时序、多任务环境中难以保持一致性。为解决这一瓶颈,本文提出了Seeker,一种基于动作监督的动态视觉瓶颈学习框架。

Seeker的核心思想是:利用预训练的DINOv3视觉特征,通过迭代的查询机制,动态学习控制任务中关键的视觉区域(ROI)。该方法不依赖任何外部空间标签,而是通过动作预测任务作为监督信号,逐步调整注意焦点,使其与任务的控制需求保持一致。具体实现包括:设计任务和状态条件的查询向量,采用多头门控机制融合多源空间线索,利用多轮迭代不断优化ROI,最终生成紧凑的视觉区域,用于裁剪、背景增强和点云过滤。

在模拟和真实机器人平台上的实验结果显示,Seeker显著优于传统的基于关键点或预定义事件的ROI方法。在模拟环境中,策略成功率从42.6%提升到62.6%,而在真实机器人任务中,成功率从48.3%跃升至76.7%。此外,Seeker的ROI还增强了模型在环境变化(如光照和背景)下的鲁棒性,成功率由20.0%提升至60.0%。这些结果验证了动作引导的视觉瓶颈在提升数据效率和泛化能力方面的潜力。

该研究的意义在于:它打破了外部标签依赖的限制,为机器人自主感知提供了新思路。通过学习控制相关的视觉区域,机器人可以在无需昂贵标注的情况下,自主捕获关键视觉信息,从而实现高效、鲁棒的策略学习。这不仅降低了数据标注成本,也增强了模型在复杂环境中的适应能力,推动了机器人视觉感知与控制的融合发展。

技术贡献方面,本文提出了结合预训练视觉特征、迭代查询和动作监督的创新框架。其核心创新在于:• 动作引导的ROI学习机制,动态适应任务变化;• 多头门控融合多源空间线索,增强空间表达能力;• 无需空间标签,利用动作预测作为监督,提升自主学习能力。该框架在保证灵活性和泛化性的同时,显著提升了策略的表现与鲁棒性,为未来机器人自主感知与控制提供了新的技术路径。

尽管取得了显著进展,Seeker仍存在一些局限。例如,在极端遮挡或视觉信息严重受损时,ROI的准确性可能下降;模型训练对动作数据的多样性要求较高;在高频率操作中,迭代查询可能带来计算瓶颈。未来,结合多模态信息、强化学习优化ROI策略、提升模型效率,将是重要的研究方向。总体而言,Seeker为机器人视觉策略的自主学习提供了崭新思路,具有广泛的应用前景和深远的学术价值。

深度分析

研究背景

机器人视觉策略的研究经历了从手工设计特征到深度学习的演变。早期方法依赖于人工定义的关键点或语义标签,如SIFT特征和手工标注的目标区域,解决了部分感知问题,但缺乏泛化能力。近年来,预训练模型如DINO、CLIP的出现,为无监督特征学习提供了强大基础,使得视觉特征更具泛化性和表达能力。与此同时,空间瓶颈技术逐渐成为提升策略数据效率的重要手段。代表性工作包括基于人类注视(gaze)信息的ROI方法、对象中心裁剪、以及利用视觉-语言模型进行语义引导的空间定位。这些方法在一定程度上缓解了感知-控制的耦合问题,但仍依赖外部标签或语义信息,限制了其在标注成本高或环境变化剧烈的场景中的应用。近年来,动作引导的空间瓶颈逐渐受到关注,试图从动作轨迹中自动提取关键视觉区域,减少对标签的依赖。尽管如此,现有方法多采用固定事件或预定义的关键帧,难以适应任务的连续变化和复杂场景。本文提出的Seeker,结合预训练特征与动态学习机制,为视觉瓶颈的自主学习提供了新的思路,弥补了现有方法在灵活性和鲁棒性上的不足。

核心问题

在机器人操作中,视觉信息的有效利用对于策略的成功至关重要。传统方法依赖外部空间标签或预定义的事件点,导致在任务变化或环境复杂时表现不佳。例如,基于手工设定的ROI可能在任务不同阶段偏离关键区域,或在连续运动中失去准确性。这些限制使得机器人难以在多变环境中自主识别和关注关键视觉证据,影响策略的鲁棒性和泛化能力。更具体地说,现有的空间瓶颈多依赖于人为设计的事件阈值或关键点,缺乏自适应能力,难以应对任务中视觉证据的动态变化。此外,缺少一种无需外部标签、能根据动作动态调整的机制,成为当前研究中的瓶颈。解决这一问题,要求开发一种能够从动作中自主学习、适应任务进展的视觉关注机制,以提升机器人在复杂环境中的自主感知和操作能力。

核心创新

本文的核心创新在于提出Seeker框架,利用动作监督实现动态学习控制相关的视觉瓶颈。具体创新点包括:1)基于预训练的DINOv3特征,设计迭代查询机制,使ROI能够随任务和状态变化而动态调整;2)引入多头门控结构,融合来自不同空间线索的空间信息,增强对复杂场景的适应能力;3)通过动作预测任务作为唯一监督信号,无需任何空间标签,实现ROI的自主学习;4)将学习到的ROI应用于RGB裁剪、背景增强和点云过滤,提升策略的鲁棒性和泛化能力。这一方法突破了传统空间瓶颈的静态设定,提供了一种灵活、自适应的视觉引导机制,极大地降低了对标注的依赖,为机器人自主感知提供了新途径。

方法详解

  • �� 利用预训练的DINOv3模型提取图像块特征,作为基础视觉表示;• 设计任务和状态条件的查询向量Q(0),通过MLP预测参数γ(s)、β(s),实现任务和状态的条件化;• 采用多头门控机制(head gating),将不同空间线索融合到多个注意头中,增强空间表达能力;• 进行多轮迭代,每轮:• 将当前查询Q进行线性变换,得到Q*;• 通过多头自注意力(MHA)模块,计算注意力图Ah和上下文Ch;• 预测每个头的权重ωh,融合多头输出,更新查询Q;• 最终输出:• 一个紧凑的视觉上下文eC,用于裁剪和背景增强;• 一个ROI注意图eA,用于裁剪区域的界定。• 通过diffusion模型进行动作预测训练,利用动作作为监督信号,促使ROI逐步对齐控制需求。• 在训练完成后,去除扩散头,冻结ROI模块,用于下游策略学习。• 生成ROI的过程包括:• 将注意图eA转化为最小的令累积质量超过阈值的区域,得到紧凑边界框和掩码;• 将裁剪区域用于RGB裁剪、点云过滤和背景增强,提升策略鲁棒性。

实验设计

实验采用模拟环境中的六个MimicGen任务(如堆叠、装配、咖啡准备、拾放、穿线),以及真实机器人平台上的长时序操作任务。训练阶段,使用每个任务100个示范轨迹,训练单一多任务Seeker模型,保持冻结状态,确保ROI接口的通用性。评估指标包括:• RGB数据效率:在不同输入裁剪策略下的成功率;• 背景泛化:在不同背景纹理下的性能变化;• 点云迁移:利用ROI裁剪进行点云过滤的效果。对比基线包括:无裁剪、RVT2-Crop、Oracle ROI、RAVEN等。通过消融实验验证:• 动作监督学习的ROI优于固定事件或关键点方法;• 多头门控和迭代机制对性能提升的贡献;• 结合背景增强和点云过滤的鲁棒性增强效果。

结果分析

Seeker在模拟任务中平均成功率由42.6%提升至62.6%,相对提升52.8%,在复杂任务如装配和拾放中表现尤为突出。在真实机器人任务中,成功率从48.3%跃升至76.7%,在光照和背景变化条件下,成功率由20.0%提升到60.0%。此外,利用ROI进行背景遮罩增强和点云过滤,显著提高模型在环境变化中的鲁棒性,成功率提升超过30%。消融实验显示,动作监督学习的ROI优于传统的关键点和预定义事件方法,验证了其在多场景、多任务中的适应性和优越性。

应用场景

该方法适用于工业自动化、仓储机器人、服务机器人等多种场景,特别是在环境复杂、标注成本高昂的情况下。通过自主学习ROI,机器人可以在无需外部标签的情况下,快速适应不同任务和环境变化,实现高效的视觉引导操作。未来,结合多模态感知(如深度、触觉)和强化学习,将进一步提升机器人自主感知和决策能力,推动智能制造和人机协作的发展。

局限与展望

尽管Seeker在多个场景中表现出色,但在极端遮挡、视觉信息严重受损或环境变化剧烈时,其ROI的准确性仍受影响。此外,模型训练依赖大量动作数据,且在高复杂度任务中,动作样本的多样性不足可能限制其泛化能力。实时应用中,迭代查询机制可能带来计算瓶颈,影响高频操作的响应速度。未来需要优化模型结构,提升效率,并结合多模态信息增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。每次你准备做一道菜,你会先看看厨房里的食材、锅碗瓢盆,然后集中注意力在需要用到的食材或工具上。你不会每次都盯着整个厨房,而是根据当前的步骤,自动找到最重要的部分。这就像机器人在做任务时,它也需要知道该关注哪里。传统方法就像是提前告诉机器人:这个区域一定要看好,或者用标记告诉它重点在哪里,但这些标签很难提前准备。现在的创新是,让机器人自己学会在做事的过程中,自动找到最重要的视觉区域,就像你在厨房里根据菜谱和手头的食材,自己决定要看哪个部分。它通过观察自己做菜的动作,逐步调整注意的焦点,从而更快、更稳地完成任务。这种方法不用提前标记任何位置,而是让机器人自己“学习”在哪些地方看得最重要,结果显示它在复杂任务中表现得更好,成功率大大提高,甚至能在光线和背景变化时保持稳定。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏。你需要找到正确的拼图片,然后把它放到正确的位置。可是,如果你每次都盯着整个桌子,可能会很慢,也容易迷失方向。更聪明的方法是,你只关注那些你已经知道要用的拼图片附近的区域。这个想法就像机器人一样:它在做任务时,不是盯着整个场景,而是学会自己找出最关键的部分。以前的方法就像是提前告诉机器人:这个区域一定要看好,但如果任务变化或者场景不同,这个区域可能就不再重要。现在的研究让机器人自己学会在做动作的过程中,动态地找到最重要的视觉区域。它通过观察自己每次的动作,逐步调整注意力焦点,就像你在玩拼图时,逐渐找到合适的拼图片一样。这样,机器人可以更快、更准确地完成任务,而且还能适应不同的环境变化,比如光线变暗或者背景变复杂。这就像你在拼图时,学会了根据动作和经验自己找重点,而不用每次都提前告诉它该看哪里。

术语表

Region of Interest (ROI) (关注区域)

在视觉任务中,指机器人或模型关注的特定空间区域,用于提取关键视觉信息。技术上是通过注意机制动态生成的区域。

论文中,ROI是通过Seeker学习得到的,用于裁剪图像、增强背景和过滤点云。

DINOv3 (预训练视觉模型)

一种基于自监督学习的视觉特征提取模型,能从大量未标注图像中学习丰富的视觉表示。技术上采用Transformer架构。

Seeker使用冻结的DINOv3特征作为基础视觉表示,进行ROI学习。

Attention Mechanism (注意机制)

一种模仿人类注意力的机制,通过赋予不同输入部分不同的权重,突出关键信息。常用在Transformer等模型中。

Seeker通过多头注意力机制,动态融合多源空间线索,调整关注区域。

Multi-head Gating (多头门控)

在多头注意力中,为不同注意头分配不同权重,融合多源信息,提高模型表达能力。技术上通过学习门控参数实现。

Seeker利用多头门控机制,根据任务和状态条件动态调整关注焦点。

Diffusion Model (扩散模型)

一种生成模型,通过逐步添加噪声和逆过程,生成高质量样本。近年来用于动作预测和生成任务。

Seeker利用扩散模型进行动作预测训练,作为ROI学习的监督信号。

Action-supervised Learning (动作监督学习)

利用机器人动作数据作为监督信号,训练模型学习任务相关的视觉特征,无需外部标签。

Seeker通过动作预测任务,学习控制相关的视觉区域。

Robustness (鲁棒性)

模型在面对环境变化、噪声或干扰时,保持性能的能力。

Seeker的ROI可以用于背景增强和点云过滤,提升在不同光照和背景条件下的鲁棒性。

Long-horizon Manipulation (长时序操作)

涉及多个步骤、较长时间跨度的机器人操作任务。

论文中的实验任务包括装配、穿线等长时序操作,验证Seeker的效果。

开放问题 这项研究留下的未解疑问

  • 1 尽管Seeker在多任务环境中表现优异,但在极端遮挡或视觉信息严重受损的情况下,其ROI的准确性仍需提升。未来需要结合多模态信息(如深度、触觉)增强感知能力。
  • 2 模型训练依赖大量动作示范,如何在少量示范下实现高效学习,是未来研究的重要方向。
  • 3 实时应用中,迭代查询机制可能带来计算瓶颈,影响高频操作的响应速度。优化模型结构和推理效率,将是未来的重点。
  • 4 目前Seeker主要在模拟和有限真实场景中验证,推广到更复杂、多样化的工业环境仍需大量调研和优化。
  • 5 如何结合强化学习和自我监督机制,进一步提升ROI的动态调整能力,是未来值得探索的方向。

应用场景

近期应用

工业机器人视觉引导

利用Seeker自主学习的ROI,工业机器人可以在无需人工标注的情况下,快速适应不同的装配和搬运任务,提高生产效率和灵活性。

服务机器人环境适应

在家庭或公共场所,Seeker帮助机器人自主识别关键区域,增强在复杂背景和光照变化中的操作鲁棒性,提升用户体验。

自主操作的训练平台

结合Seeker的ROI学习机制,开发低成本的机器人训练平台,减少对标注和环境预设的依赖,加速机器人自主策略的研发。

远期愿景

多模态感知融合

未来将Seeker扩展到融合深度、触觉等多模态信息,实现更全面的环境理解和自主感知,推动机器人在复杂场景中的自主操作。

自主学习与强化学习结合

结合强化学习,优化ROI的动态调整策略,使机器人在未知环境中自主探索和适应,逐步实现完全自主的复杂任务执行。

原文摘要

Visual bottlenecks that focus policy inputs on regions of interest (ROIs) can improve data-efficient visuomotor learning by separating where to look from how to act. Many ROI interfaces rely on external spatial labels, such as gaze, object classes, or affordance annotations. Label-free alternatives often derive crops from trajectories by detecting gripper or motion events and centering a fixed crop at the projected end-effector. Such action-derived crops are useful spatial priors that require no additional labels, but they encode fixed choices about event timing, proxy points, and crop scale. When the visual evidence needed for control lies away from the end-effector or changes continuously with task progress, these crops can become misaligned. We propose Seeker, a task- and state-conditioned readout that learns attention from action. Starting from frozen DINOv3 features, Seeker iteratively updates a query with gathered visual evidence, producing progression-aware ROIs solely from action supervision. The learned ROI serves as a spatial interface for RGB cropping, mask-guided background augmentation, and point-cloud filtering. In simulation and the real world, Seeker improves data efficiency and robustness over no-crop, augmentation, and action-derived crop baselines. On real robots, Seeker raises average in-domain success from the best baseline's 48.3% to 76.7% and success under lighting/background shifts from 20.0% to 60.0%.

cs.RO

参考文献 (20)

Open-World Object Manipulation using Pre-trained Vision-Language Models

Austin Stone, Ted Xiao, Yao Lu 等

2023 241 引用 查看解读 →

RVT-2: Learning Precise Manipulation from Few Demonstrations

Ankit Goyal, Valts Blukis, Jie Xu 等

2024 191 引用 查看解读 →

ATK: Automatic Task-driven Keypoint Selection for Robust Policy Learning

Yunchu Zhang, Shubham Mittal, Zhengyu Zhang 等

2025 5 引用 查看解读 →

Learning Robotic Manipulation Policies from Point Clouds with Conditional Flow Matching

Eugenio Chisari, Nick Heppert, Max Argus 等

2024 84 引用 查看解读 →

R+X: Retrieval and Execution from Everyday Human Videos

Georgios Papagiannis, Norman Di Palo, Pietro Vitiello 等

2024 51 引用 查看解读 →

Enhancing Reusability of Learned Skills for Robot Manipulation via Gaze Information and Motion Bottlenecks

Ryo Takizawa, Izumi Karino, Koki Nakagawa 等

2025 4 引用 查看解读 →

Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Shilong Liu, Zhaoyang Zeng, Tianhe Ren 等

2023 4722 引用 查看解读 →

Diffusion policy: Visuomotor policy learning via action diffusion

Cheng Chi, S. Feng, Yilun Du 等

2023 3913 引用 查看解读 →

Equivariant Diffusion Policy

Di Wang, Stephen M. Hart, David Surovik 等

2024 86 引用 查看解读 →

Flow Matching for Generative Modeling

Y. Lipman, Ricky T. Q. Chen, Heli Ben-Hamu 等

2022 5774 引用 查看解读 →

MimicPlay: Long-Horizon Imitation Learning by Watching Human Play

Chen Wang, Linxi (Jim) Fan, Jiankai Sun 等

2023 352 引用 查看解读 →

ICRT: In-Context Imitation Learning via Next-Token Prediction

Letian Fu, Huang Huang, Gaurav Datta 等

2024 68 引用 查看解读 →

IMLE Policy: Fast and Sample Efficient Visuomotor Policy Learning via Implicit Maximum Likelihood Estimation

Krishan Rana, Robert Lee, David Pershouse 等

2025 17 引用 查看解读 →

RVT: Robotic View Transformer for 3D Object Manipulation

Ankit Goyal, Jie Xu, Yijie Guo 等

2023 311 引用 查看解读 →

Policy Adaptation via Language Optimization: Decomposing Tasks for Few-Shot Imitation

Vivek Myers, B. Zheng, Oier Mees 等

2024 30 引用 查看解读 →

Revisiting Feature Prediction for Learning Visual Representations from Video

Adrien Bardes, Q. Garrido, Jean Ponce 等

2024 439 引用 查看解读 →

π0: A Vision-Language-Action Flow Model for General Robot Control

Kevin Black, Noah Brown, Danny Driess 等

2024 2381 引用 查看解读 →

Learning Transferable Visual Models From Natural Language Supervision

Alec Radford, Jong Wook Kim, Chris Hallacy 等

2021 53975 引用 查看解读 →

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

Jianshu Hu, Lidian Wang, Shujia Li 等

2025 4 引用 查看解读 →

Q-attention: Enabling Efficient Learning for Vision-based Robotic Manipulation

Stephen James, A. Davison

2021 153 引用 查看解读 →