CuriousBot: Interactive Mobile Exploration via Actionable 3D Relational Object Graph

TL;DR

CuriousBot用可行动三维关系图实现移动交互探索,平均成功率82%,显著优于二维VLM基线。

cs.RO 🔴 高级 2025-01-23 23 次浏览
Yixuan Wang Leonor Fermoselle Tarik Kelestemur Jiuguang Wang Yunzhu Li
移动机器人 主动交互 三维场景图 视觉基础模型 移动操作

核心发现

方法论

CuriousBot将RTAB-Map v0.21.4、YOLO-World、Segment Anything(SAM)和GPT-4o组成闭环系统。RGB-D与里程计先生成相机位姿,再以3D点云构建对象节点;通过同标签与IoU关联跨帧实例,阈值为0.15。图边编码behind、of、inside、on、under等关系,LLM依据深度优先序列化图规划open、flip、lift、push、sit和collect技能。

关键结果

  • 在翻箱、开抽屉、检查物体下方、推箱子、掀布五项任务中各重复10次,整体成功率为82%,平均Object Recovery为81.6%,Graph Editing Distance为1.28。
  • CuriousBot平均成功率82%,明显超过LLaVA 22%、Gemini 32%、GPT-4o 32%和启发式策略12%;平均GED也低于基线的2.86–3.62。
  • 分任务看,系统在检查下方、掀布、翻箱上的成功率分别为90%、90%、80%;50次试验中47次感知成功、44次决策成功、41次动作成功。

研究意义

论文把机器人探索从“移动相机寻找信息”推进到“主动改变环境以获得信息”。这解决了柜内、家具下方和障碍物后方空间长期不可见的问题,也展示了移动导航、语义理解和操作控制的统一可能性。对家庭服务机器人而言,结构化图表示比让VLM记忆连续图像更稳定;对学术界而言,工作连接了主动感知、移动操作和场景图推理。

技术贡献

核心贡献是可行动3D关系图G=(V,E):节点同时保存标签、点云、法向和遮挡属性,边保存方向化空间关系。体素图把空间标记为unexplored、free、unknown、outside,并利用深度测试推断遮挡。交互动作还能反向更新关系,例如open/flip推断inside、lift推断under、push推断behind,使规划器获得动作条件化的场景状态。

新颖性

相较RoboEXP的桌面场景,CuriousBot面向更大移动空间、更复杂关系和混合导航—操作动作;相较ConceptGraph与SceneGPT,它不仅理解语义和空间关系,还显式建模遮挡及动作后果。作者主张这是同时具备interactive、mobile、exploratory三种属性的系统之一。

局限性

  • 系统依赖预设技能和场景假设,例如只翻开口箱、只掀布、主要推大型物体;动作泛化到未知机构和柔性物体仍有限。
  • 50次试验中有3次感知、3次决策和3次动作失败;原因包括SLAM误差、开放词汇检测错误、错误技能、松握和意外干涉。

未来方向

未来可扩展技能库与可学习控制器,减少启发式动作;引入更鲁棒的长期记忆、动态关系更新和不确定性规划;在真实家庭、更多房间尺度和未见物体上评估,并用更强LLM替换GPT-4o。

AI 总览摘要

家庭环境中的机器人常能看到物体,却未必能发现被遮挡的物体。传统探索多依赖主动感知,即寻找更好的相机位置;RoboEXP虽加入交互,却主要局限于桌面。CuriousBot提出一种面向移动机器人的主动交互框架,让机器人推椅子、打开柜门、掀布或翻箱子,以直接改变环境并揭示隐藏空间。

系统由RTAB-Map SLAM、Graph Constructor、GPT-4o Task Planner和Low-Level Skills组成。YOLO-World与SAM从RGB-D数据提取对象,跨帧以3D IoU关联;关系图记录behind、of、inside、on、under,并用体素标签区分未探索、自由、遮挡未知和外部空间。LLM读取深度优先序列化图,选择open、flip、lift、push、sit或collect,执行后再更新图。

在3m×4m房间、12类物体和6种布局中,五项任务各测试10次。CuriousBot平均成功率82%,Object Recovery为81.6%,GED为1.28,超过LLaVA、Gemini、GPT-4o和启发式策略的22%、32%、32%和12%成功率。其局限是依赖有限技能、SLAM和检测质量;但研究证明,显式、可行动的三维关系表示能把“看不见”转化为“可以操作后看见”。

深度分析

研究背景

机器人探索服务于搜救、目标搜索和移动操作。主动感知方法通常优化相机位姿和未知区域,却难以处理柜内、桌下或障碍物后方的遮挡。RoboEXP引入交互式图构建,但聚焦桌面;ConceptGraph和SceneGPT更重视语义场景理解,缺少动作改变环境的机制。CuriousBot因此将三维场景图、遮挡推理与移动操作结合。

核心问题

目标是构建G=(V,E),尽量减少未知空间、发现更多对象并正确建立关系。难点包括更大的导航区域、复杂遮挡、异构物体和更大的动作空间。机器人不仅要判断“哪里未知”,还要决定“推、拉、掀、翻或坐下”哪种动作能有效揭示未知区域。

核心创新

  • ��可行动关系图:节点含语义和几何信息,边编码五类关系。
  • ��动作驱动建边:open/flip、lift、push分别帮助推断inside、under、behind。
  • ��遮挡体素图:四类体素显式表示观察状态,并给对象添加obstruction属性。
  • ��移动操作闭环:图序列化给GPT-4o规划,技能执行后更新图,避免重复探索。

方法详解

  • ��感知:RTAB-Map v0.21.4根据RGB-D和里程计估计位姿。
  • ��建图:YOLO-World检测、SAM分割并生成3D点云;同标签对象以IoU关联,低于0.15则新建节点。
  • ��关系:用3D包围盒建立on等几何边,用动作结果建立inside、under和behind等交互边。
  • ��遮挡:射线深度测试把体素标为unexplored、free、unknown或outside。
  • ��规划执行:深度优先序列化图,GPT-4o输出技能名和目标ID;Spot执行open、flip、lift、push、sit、collect,随后更新图。

实验设计

平台为Boston Dynamics Spot、Spot API v4.0.0和前置RealSense 455;计算机配备RTX A6000、AMD CPU及128GB内存,建图约3Hz。环境为3m×4m房间,含12类物体和6种布局。五项任务各重复10次,并与LLaVA、Gemini、GPT-4o及“打开所有把手”启发式策略比较,指标为Success、Object Recovery和GED。

结果分析

平均结果为:CuriousBot成功率82%、OR 81.6%、GED 1.28;LLaVA为22%、26%、3.62,Gemini为32%、34%、3.42,GPT-4o为32%、36%、3.32,启发式为12%、14.4%、2.86。系统在检查下方和掀布上达90%,翻箱80%,推箱70%。失败主要来自感知、决策和动作三个层级。

应用场景

可用于家庭服务机器人寻找柜内物品、检查家具下方、整理房间和取物,也适合仓储盘点与灾害环境搜索。部署需要RGB-D、定位、可操作物体、技能库及安全边界;系统的图状态可帮助机器人在遮挡环境中进行可解释规划。

局限与展望

实验规模仍小,场景为受控3m×4m房间,物体类别为12类,尚未证明在真实家庭长期运行中的鲁棒性。技能依赖启发式和特定假设,开放柜门、推物体或抓取失败会传播到后续规划。图质量受RTAB-Map和YOLO-World影响;未来需要学习型技能、更强不确定性建模、动态环境处理和大规模跨家庭评测。

通俗解读 非专业人士也能看懂

把CuriousBot想成一个整理仓库的聪明助手。普通助手只会站在原地或换个角度看货架;如果箱子挡住了后面的东西,它可能永远不知道那里有什么。CuriousBot会先画一张地图,把每件东西的位置、形状和相互遮挡关系记下来。

接着,它像仓库管理员一样决定下一步:打不开的柜门就找把手,挡住视线的椅子就推开,盖住物品的布就掀起,开口箱子就翻一翻。每次动作后,它都会重新检查地图,把已经看过的地方标记清楚,也不再重复做同一件事。

测试中,它在五种寻找任务里平均82%完成成功,而只看照片的几个助手只有22%到32%。这说明机器人有时不能只“看得更仔细”,还必须“动手改变现场”。

简单解释 像给14岁少年讲一样

想象你在房间里玩寻宝游戏,但宝物可能藏在柜子里、桌子下面、箱子后面。只拿手机拍照当然不够,因为照片看不到遮住的地方。CuriousBot就像一个会行动的队友:它会记住柜子、椅子、箱子和布的位置,还会猜哪里可能藏着东西。

它先用摄像头和深度信息画地图,再让一个语言模型像队长一样安排任务:打开柜门、推开椅子、掀开布、翻箱子,或者坐下看看桌底。每次完成动作,地图都会更新,告诉它哪些地方已经检查过。

研究人员让它在不同房间布局中执行五类任务,每类做10次。它平均82%成功,明显超过直接看图的LLaVA、Gemini和GPT-4o。最厉害的地方不是“看懂照片”,而是知道什么时候应该动手。

当然,它还不是万能机器人。它会受定位、识别、抓握和碰撞影响,也只会有限几种动作。未来如果学会更多动作并能处理真实家庭里的混乱环境,它就可能成为真正会帮忙找东西的家用机器人!

术语表

Actionable 3D Relational Object Graph(可行动三维关系对象图)

一种以对象为节点、关系为边的三维环境表示。它同时保存语义、几何、遮挡和动作相关信息。

CuriousBot用它连接感知、规划和执行。

Active Interaction(主动交互)

机器人通过推、拉、打开或掀起物体来改变环境并获得新信息。它不同于只移动相机的主动感知。

论文用其探索隐藏空间。

Voxel Map(体素地图)

把三维空间划分为小立方体并标注状态的地图。论文使用unexplored、free、unknown、outside四类标签。

它用于判断遮挡和障碍属性。

Graph Editing Distance(图编辑距离)

衡量预测图变成目标图所需增删改操作数量的指标。数值越低表示对象关系图越准确。

CuriousBot平均GED为1.28。

YOLO-World

支持开放词汇目标检测的视觉模型,可按文本类别寻找对象。论文用其生成对象候选框。

结果随后由SAM分割。

Segment Anything(SAM)

通用图像分割模型,能够根据提示提取对象区域。论文将其掩码与深度结合生成3D点云。

它参与Graph Constructor。

开放问题 这项研究留下的未解疑问

  • 1 未知环境中的关系推断仍依赖启发式规则;机器人能否从失败和动作结果中自主学习新关系,尚未解决。
  • 2 实验规模和布局有限,尚不清楚图表示在多人、动态家具、反光表面及长期任务中的稳定性。
  • 3 GPT-4o规划虽优于二维基线,但其决策可靠性、不确定性校准和实时成本仍需系统研究。

应用场景

近期应用

家庭柜内取物

家庭服务机器人可用RGB-D扫描房间,识别柜门、把手与遮挡区域,再执行开门和取物。前提是具备安全抓取、碰撞检测和相应技能;预期减少盲目搜索并提高物品找回率。

仓储与室内盘点

仓储机器人可推开遮挡箱体、检查货架下方并更新对象关系图。需要稳定定位、可控推力和结构化货架环境,适合发现被遮挡库存及生成可解释盘点记录。

远期愿景

自主家庭探索助手

未来机器人可持续维护跨房间三维关系记忆,主动寻找物品、整理空间并适应家具变化。关键障碍是开放世界技能学习、安全决策和动态多人环境中的可靠性。

原文摘要

Mobile exploration is a longstanding challenge in robotics, yet current methods primarily focus on active perception instead of active interaction, limiting the robot's ability to interact with and fully explore its environment. Existing robotic exploration approaches via active interaction are often restricted to tabletop scenes, neglecting the unique challenges posed by mobile exploration, such as large exploration spaces, complex action spaces, and diverse object relations. In this work, we introduce a 3D relational object graph that encodes diverse object relations and enables exploration through active interaction. We develop a system based on this representation and evaluate it across diverse scenes. Our qualitative and quantitative results demonstrate the system's effectiveness and generalization across object instances, relations, and scenes, outperforming methods solely relying on vision-language models (VLMs).

cs.RO cs.CV cs.LG