Learning to Localize Reference Trajectories in Image-Space for Visual Navigation

TL;DR

LoTIS通过图像空间定位参考轨迹,实现机器人平台无关的视觉导航,成功率达94-98%。

cs.RO 🔴 高级 2026-02-21 48 次浏览
Finn Lukas Busch Matti Vahs Quantao Yang Jesús Gerardo Ortega Peimbert Yixi Cai Jana Tumova Olov Andersson
视觉导航 机器人学 深度学习 图像空间定位 跨平台泛化

核心发现

方法论

LoTIS采用基于DINOv3的特征提取,结合跨轨迹训练策略,利用Transformer架构实现轨迹点在图像空间的定位。模型输入参考轨迹和当前视图,输出轨迹点的二维坐标、可见性和距离,解耦感知与动作。训练中通过不同轨迹、不同相机参数的样本增强鲁棒性,支持零样本迁移。该方法无需相机标定或机器人特定训练,便于多平台集成。

关键结果

  • 在模拟和真实环境中,LoTIS在前向导航任务中的成功率达94-98%,比最先进方法高出20-50个百分点。对逆向导航和复杂场景表现尤为优越,逆向任务成功率提升超过5倍。模型在Jetson Orin AGX硬件上以22Hz实时运行,验证其实用性。多样环境测试显示其对视角、相机参数变化具有强鲁棒性,显著优于基线方法。
  • 在跨轨迹训练下,模型能有效应对不同相机参数和视角偏差,成功实现从手机视频到多机器人平台的迁移。实验还表明,结合局部路径规划器,模型能在复杂环境中实现高成功率,尤其在背向导航中表现优异,突破了传统方法的局限。
  • 通过大量模拟和实地数据,验证了模型在多样环境中的泛化能力。训练数据涵盖500个不同场景、25000条轨迹,模型在不同平台(无人机、四足机器人)上均表现出色,证明其跨平台适应性和实用潜力。

研究意义

该研究突破了视觉导航中对机器人平台依赖的限制,实现了基于图像空间的通用轨迹定位。无需标定或特定训练,极大简化了多平台部署流程,为自主导航、应急响应等应用提供了新思路。其鲁棒性和实时性满足工业级需求,推动机器人自主性迈向更高水平。未来,结合自主决策和环境感知,将进一步拓展其应用范围。

技术贡献

提出一种基于Transformer的图像空间轨迹定位模型,结合跨轨迹训练策略,有效增强模型对视角、相机参数变化的鲁棒性。创新性在于模型解耦感知与动作,支持多平台泛用,且无需相机标定。模型架构采用离线轨迹编码与在线查询融合,保证实时性能。此方法在多环境、多机器人平台上均验证成功,显著优于现有端到端策略。

新颖性

首次提出在无需相机标定和机器人特定训练的条件下,通过图像空间坐标实现跨平台通用导航。区别于传统端到端策略,LoTIS专注于轨迹点的空间定位,支持逆向和复杂路径导航。其跨轨迹训练策略和Transformer架构,为视觉导航提供新范式,突破了现有方法对视角和相机参数的敏感性。

局限性

  • 模型在极端遮挡或动态环境中仍可能失效,因其主要依赖静态特征匹配。
  • 对高动态场景的适应性有限,未来需结合动态环境感知增强鲁棒性。
  • 在极大视角偏差或光照变化下,定位精度可能下降,需进一步优化特征表达和训练策略。

未来方向

未来将结合自主路径规划与环境感知,提升复杂环境中的导航能力。探索多模态信息融合(如深度、激光)以增强鲁棒性,扩展到多机器人协作场景。此外,将优化模型结构以降低计算成本,实现更广泛的硬件部署。

AI 总览摘要

视觉导航作为机器人自主控制的核心技术,近年来取得了显著发展,但仍面临平台依赖、视角变化和环境复杂性等挑战。传统方法多依赖端到端学习,需大量标注数据,且难以实现跨平台泛化。本文提出LoTIS,一种基于图像空间轨迹定位的模型,利用Transformer架构,结合跨轨迹训练策略,实现无需相机标定、机器人特定训练的通用导航能力。

LoTIS通过离线编码参考轨迹,在线匹配当前视图中的轨迹点,输出二维空间坐标、可见性和距离信息,为传统局部路径规划提供直观、鲁棒的输入。模型在模拟和真实环境中均表现优异,成功率达94-98%,在逆向导航和复杂场景中突破传统限制,成功实现多平台、多视角的泛用导航。

该方法的核心创新在于解耦感知与动作,利用Transformer实现全轨迹联合匹配,增强模型对视角和相机参数变化的适应性。实验验证了其在多样环境中的强泛化能力,且在硬件上实现实时运行,展现出极高的实用价值。未来,将结合自主路径规划和多模态感知,推动机器人自主导航迈向更高水平。

深度分析

研究背景

视觉导航作为机器人自主控制的重要方向,经历了从基于特征匹配的视觉伺服到深度学习端到端策略的演变。早期方法如视觉伺服(Visual Servoing)依赖精确的特征提取和标定,易受遮挡和环境变化影响。近年来,深度学习推动了基于目标图像和路径的导航策略,如GNM、ViNT等,显著提升了复杂环境中的表现。然而,这些方法多依赖于平台特定的动作空间和相机参数,难以实现跨平台泛化。此外,端到端策略在逆向路径和视角偏差方面表现不足,限制了其实际应用范围。

核心问题

现有视觉导航方法普遍面临平台依赖、视角变化敏感和逆向导航困难的问题。端到端策略需要大量标注数据,且在不同机器人和相机参数下性能下降明显。尤其是在复杂环境和逆向路径中,表现不稳定。如何设计一种平台无关、鲁棒性强、能应对视角和相机参数变化的导航方案,成为亟待解决的核心难题。这不仅关系到自主机器人在未知环境中的适应能力,也影响其在实际应用中的推广。

核心创新

本研究的核心创新包括:1)提出基于图像空间的轨迹点定位表示,将轨迹点的二维坐标、可见性和距离作为导航接口,支持多平台集成;2)引入跨轨迹训练策略,通过不同轨迹、不同相机参数的样本增强模型鲁棒性;3)设计Transformer架构,联合编码全轨迹信息,实现全局匹配,避免单点子目标的敏感性。该方法突破了传统端到端策略对平台和视角的依赖,提供了更为通用的导航解决方案。

方法详解

  • �� 利用预训练的DINOv3提取参考轨迹和当前视图的特征。• 轨迹编码器(ET)离线处理完整轨迹,融合空间和时间信息。• 查询编码器(Eq)实时处理当前视图特征,结合轨迹特征进行匹配。• 采用交叉注意力机制(Cross-Attn)融合轨迹和视图信息,找到对应关系。• 使用递归Transformer(预测头)逐步回归轨迹点的二维坐标、可见性和距离,确保空间一致性。• 训练中采用跨轨迹采样,增强模型对视角和相机参数变化的适应性。• 损失函数结合L1距离、二元交叉熵和归一化距离,优化模型性能。

实验设计

在模拟和真实环境中,采用多场景、多平台数据集(如HM3D、CODa),评估模型在正向、逆向和任意点导航任务中的表现。对比多种基线方法,指标包括成功率(SR)和路径加权成功率(SPL)。通过不同相机参数偏差和视角变化测试模型鲁棒性。参数调优在GPU上进行,确保模型在实时硬件(Jetson Orin AGX)上运行流畅。实验还包括逆向导航和复杂路径的性能分析,验证模型的泛化能力。

结果分析

实验结果显示,LoTIS在正向导航任务中成功率达94-98%,远超对比方法(如ViNT、PlaceNav等,成功率在20-50%之间)。逆向导航成功率提升超过5倍,支持复杂场景和背向路径。模型在不同相机参数偏差下仍保持高性能,验证其鲁棒性。结合局部路径规划器,导航成功率进一步提升,适应多样环境。硬件测试表明,模型以22Hz速度实现实时控制,满足工业应用需求。

应用场景

该技术适用于自主机器人、无人机、自动驾驶等场景,尤其在环境未知或动态变化条件下。无需繁琐标定,便于快速部署到不同平台,提升自主导航效率。未来可结合环境感知和路径规划,应用于应急救援、工业巡检、农业自动化等领域,推动机器人自主性普及。

局限与展望

模型在极端遮挡或动态环境中表现仍有限,需结合动态感知增强鲁棒性。对极端光照或视角偏差的适应性有待提升,可能影响定位精度。此外,模型在超大规模场景中的计算成本较高,未来需优化架构以降低能耗和延迟。虽然支持多平台,但在某些特殊机器人上仍需微调,未来将探索更广泛的泛化策略。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器和操作流程。每个机器都需要按照特定的路线走,但每台机器的大小、形状和工作方式都不同。以前,我们需要给每台机器单独设计路线和标定参数,才能确保它们正确工作。这就像给每个机器人都画一条专属的地图,非常麻烦。

现在,假设我们有一种神奇的导航助手,它只看一段视频或图片,就能知道每个机器在工厂中的位置和路线,无论机器是大是小、在哪个角落。这个助手不用提前知道机器的具体参数,只要看一眼,就能告诉你下一步怎么走。这就像用手机拍一段视频,助手就能告诉你怎么走到目标地点,无需复杂的设置。

这个助手背后的技术,就是论文中的LoTIS。它用一种聪明的方式,把路线变成一串图片,然后在任何视角都能找到路线中的点。这样,不管你用什么机器人、从哪个角度看,都能找到正确的路径。它的好处是简单、快速,还能应对各种环境变化,就像工厂里的导航助手一样,帮你轻松搞定复杂的任务。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,你的角色需要沿着一条隐藏的路线走,但你不知道路线的具体位置。以前,你得记住每个转弯和地点,或者用特殊的地图才能找到路。现在,有一种神奇的工具,只要你拍一段视频,它就能告诉你该往哪个方向走,即使你从不同的角度看,也能找到正确的路。

这就像你用手机拍一张照片,然后这个工具告诉你照片中的哪个地方是目标地点,帮你导航。它不用知道你用的手机型号,也不用提前设置什么,只要看一眼,就能帮你找到路径。这种技术可以让机器人也学会用类似的方法,无论它是飞在空中还是走在地面,都能找到正确的路线,特别厉害!

原文摘要

We present LoTIS, a model for visual navigation that provides robot-agnostic image-space guidance by localizing a reference RGB trajectory in the robot's current view, without requiring camera calibration, poses, or robot-specific training. Instead of predicting actions tied to specific robots, we predict the image-space coordinates of the reference trajectory as they would appear in the robot's current view. This creates robot-agnostic visual guidance that easily integrates with local planning. Consequently, our model's predictions provide guidance zero-shot across diverse embodiments. By decoupling perception from action and learning to localize trajectory points rather than imitate behavioral priors, we enable a cross-trajectory training strategy for robustness to viewpoint and camera changes. We outperform state-of-the-art methods by 20-50 percentage points in success rate on conventional forward navigation, achieving 94-98% success rate across diverse sim and real environments. Furthermore, we achieve over 5x improvements on challenging tasks where baselines fail, such as backward traversal. The system is straightforward to use: we show how even a video from a phone camera directly enables different robots to navigate to any point on the trajectory. Videos, demo, and code are available at https://finnbusch.com/lotis.

cs.RO