Robostral Navigate

TL;DR

Robostral Navigate为单目RGB视觉模型,达77.4%成功率,突破多传感器限制。

cs.RO 🔴 高级 2026-07-23 43 次浏览
Abdelaziz Bounhar Abhijeet Somani Aditi Kabra Adrian Valente Adrien Petralia Adrien Sade Alan Jeffares Albert Jiang Aleksandr Timashov Alexandre Cahill Alexandre Gavaudan Alexandre Laval Alexandre Sablayrolles Amelie Heliou Amos You Andre Jonasson Andrew Bai Andrew Ehrenberg Andrew Zhao Angele Lenglemetz Anmol Agarwal Antonia Calvi Arata Suzuki Arjun Majumdar Arthur Fournier Artjom Joosen Avinash Sooriyarachchi Aylin Guliz Akkus Aysenur Karaduman Baptiste Bout Baptiste Roziere Baudouin De Monicault Benjamin Holzschuh Benjamin Lefaudeux Benjamin Tibi Bernhard Stadlbauer Blazej Osinski Camille Le Scao Chaoran Yu Charlotte Cronjager Chen-Yo Sun Chris Bamford Christian Wallenwein Christophe Renaudin Clemence Lanfranchi Corentin Barreau Corentin Sautier Cristiana-Diana Diaconu Cyprien Courtot Daniel Marczak Darius Dabert Diego de Las Casas Dominik Nuss Dylan Rubini Dzmitry Soupel Elizaveta Demyanenko Elliot Chane-Sane Emilien Fugier Emmanuel Gottlob Erik Aas Etienne Goffinet Etienne Millon Eujeong Choi Fabian Paischer Fabian Schlager Faruk Ahmed Federico Baldassarre Filip Szatkowski Florian Wiesner Gabrielle Berrada Gaetan Ecrepont Gaetan Lepage Gaspard Blanchet Gaspard Donada-Vidal Gauthier Delerce Gauthier Guinet Genevieve Hayes Georgii Novikov Giada Pistilli Gianluca Galletti Guillaume Breton Guillaume Kunsch Guillaume Lample Guillaume Martin Guillaume Raille Gunjan Dhanuka Gunshi Gupta Han Zhou Harshil Shah Hasan Furkan Vural Hedi Hadiji Hope McGovern Hugo Cisneros Hugo Thimonier Indraneel Mukherjee Ivan Cuevas Salazar Jacques Sun Jan Ludziejewski Jason Rute Jean Quentin Jean-Hadrien Chabran Jean-Malo Delignon Jie Zhang Joachim Studnia Joep Barmentlo Johannes Brandstetter John Harvill Jonas Amar Jonas Schweizer Josephine Delas Josselin Somerville Julien Denize Julien Tauran Kartik Khandelwal Khyathi Raghavi Chandu Kilian Tep Kush Jain Larissa Laich Laura Calem Laurence Aitchison Laurent Callot Laurent Fainsin Leo Cotteleer Leonard Blier Lingxiao Zhao Louis Martin Louis Serrano Lucile Saulnier Ludovic Ho Fuh Luis Montero Maarten Buyl Manon Chossegros Marcin Mozejko Margaret Jennings Markus Hennerbichler Martin Alexandre Mathieu Poiree Mathieu Schmitt Mathilde Guillaumin Matthieu Andre Matthieu Dinot Matthieu Futeral Maurits Bleeker Mauro Comi Max Mynter Maxim Berman Maxime Darrin Maxime Louis Maximilian Augustin Maximilian Muller Melina Jingting Laimon Mert Unsal Mia Chiquier Michael Pilcer Michal Pietruszka Michal Zajac Mikhail Biriuchinskii Minh-Quang Pham Minwoo Kang Morgane Riviere Namit Katariya Nathan Grinsztajn Nathan Simpson Neeraj Aggarwal Neha Gupta Ola Mysiak Oliver Leicht Olivier Bousquet Olivier Duchenne Parag Jain Patricia Wang Patrick Blies Patrick von Platen Paul Jacob Paul Wambergue Paula Kurylowicz Pavan Kumar Reddy Pavel Kuksa Philippe Pinel Philomene Chagniot Pierre Stock Pierre-Andre Savalle Piotr Milos Prateek Gupta Pravesh Agrawal Quentin Desreumaux Quentin Torroba Quercus Hernandez Ram Ramrakhya Randall Isenhour Ranjit Parva Raul Perez Pelaez Reinhard Sonnleitner Remi Delacourt Richard Kurle Rishi Shah Rob Romijnders Rohin Arora Romain Sauvestre Roman Soletskyi Rosalie Millner Rupert Menneer Sagar Vaze Samuel Barry Samuel Belkadi Samuel Humeau Sanchit Gandhi Sandeep Subramanian Sarthak Mittal Saskia Adaime Sean Cha Sebastian Kaltenbach Shashwat Dalal Shashwat Verma Sherif Waly Shrimai Prabhumoye Siddhant Waghjale Siddharth Gandhi Simon Lepage Simon Sorg Soham Ghosh Sophie Marbach Srijan Mishra Stanislas Lange Steve Hong Sumukh Aithal Szymon Antoniak Tarun Kumar Vangani Teven Le Scao Theo Cachet Thibaut Lavril Thomas Chabal Thomas Coste Thomas Defard Thomas Foubert Thomas Robert Thomas Wang Tianyu Zhang Tim Lawson Timothee Lacroix Tobias Kronlachner Tom Bewley Tom Edwards Tomas Hodan Tuhin Das Tyler Wang Ulrick BLE Umar Jamil Umberto Tomasini Valentin Mace Van Phung Vedant Nanda Victor Jouault Victor Letzelter Victor Paltz Victor Poucheret Vincent Maladiere Vincent Pfister Virgile Richard Vladislav Bataev Wassim Bouaziz Wen Ding Li William Havard William Marshall Xinghui Li Xingran Guo Xinyu Yang Yann Dreze Yassine El Ouahidi Yassir Bendou Yihan Wang Yimu Pan Yves Martin des Taillades Zaccharie Ramzi Zhenlin Xu Zsofia Csakany
机器人导航 视觉语言模型 深度学习 模拟训练 跨平台泛化

核心发现

方法论

该方法基于8B参数的视觉-语言模型(VLM),结合点指示和偏移回退机制,利用模拟数据生成2.4百万轨迹,采用prefix-caching训练技术,减少22倍训练令牌。模型输入仅为单目RGB图像,输出目标点的图像坐标和朝向,避免依赖特定机器人几何。训练后通过CISPO强化学习优化探索与恢复能力。模型在R2R-CE和RxR-CE两个基准上均刷新了单目系统的性能纪录,成功实现跨机器人平台部署。

关键结果

  • 在R2R-CE验证集上,成功率达77.4%,超越单目最优方法(Qwen-RobotNav-4B,66.9%)10.5个百分点,且优于多传感器系统(Qwen-RobotNav-8B,72.1%)5.3个百分点,显示单目视觉在复杂环境中的强大潜力。
  • 在RxR-CE中,成功率达75.1%,路径效率优于深度辅助模型,误差仅3.47米,验证了模型在多语境、多场景下的泛化能力。
  • 采用prefix-caching技术显著缩短训练时间,从数月缩减至数日,同时强化学习进一步提升探索和恢复能力,整体性能稳步提升。

研究意义

该研究突破了机器人导航对多传感器的依赖,展示了单目RGB视觉模型在复杂环境中的应用潜力,为通用机器人系统的规模化部署提供了新思路。通过模拟大规模数据训练和高效的训练策略,极大降低了硬件成本与环境适应难度,推动机器人自主导航技术向更广泛的实际应用迈进。

技术贡献

提出基于8B参数的视觉-语言模型结合点指示和偏移回退的导航策略,创新性地采用prefix-caching技术极大提升训练效率,结合树状注意力掩码避免依赖历史动作,融合强化学习优化探索能力。模型实现跨机器人平台泛化,减少对传感器的依赖,为机器人自主导航提供了新范式。

新颖性

首次实现仅用单目RGB图像进行复杂导航任务,超越依赖深度或多摄像头系统的性能,提出点指示结合偏移回退的多模态融合策略,创新性地采用prefix-caching和树状注意力机制,显著提升训练效率和泛化能力。

局限性

  • 模型在极端光照变化或动态场景中的表现仍有限,依赖模拟数据的多样性,实际环境中可能出现适应性不足的问题。
  • 训练成本虽大幅降低,但高性能模型仍需大量GPU资源,限制了边缘设备的部署。
  • 对复杂多变任务的长远规划和多模态融合仍有提升空间,未来需结合多模态信息增强鲁棒性。

未来方向

未来将结合多模态感知(如声音、触觉)拓展导航能力,优化模型在动态环境中的适应性,探索更高效的在线学习策略,推动机器人自主导航的普适化和智能化。

AI 总览摘要

机器人自主导航作为智能机器人核心能力之一,面临传感器依赖重、环境适应差、训练成本高等挑战。传统方法多依赖深度传感器、多摄像头或预建地图,限制了硬件成本和部署场景。本文提出的Robostral Navigate,利用单目RGB视觉输入,结合大规模模拟数据训练,突破了传感器依赖的瓶颈。模型通过点指示和偏移回退机制,输出目标点的图像坐标和朝向,避免依赖特定几何参数,实现跨平台泛化。创新性采用prefix-caching技术,极大缩短训练时间,从数月到数日,同时结合树状注意力掩码,避免模型依赖历史动作信息,提升预测的视觉基础性。模型在两个国际导航基准R2R-CE和RxR-CE上表现优异,成功率分别达到77.4%和75.1%,超越多传感器系统,验证了单目视觉的潜力。强化学习的引入进一步增强了模型的探索和恢复能力,使其在复杂环境中表现更稳健。这项工作不仅推动了机器人自主导航的技术边界,也为未来通用机器人系统的规模化部署提供了新思路。未来,结合多模态信息和在线学习,将使机器人导航更加智能与鲁棒。

深度分析

研究背景

机器人导航技术经历了从基于地图的路径规划到感知驱动的自主导航演变。早期方法依赖激光雷达和预建地图(如SLAM技术),实现精确定位,但成本高、环境适应性差。近年来,深度学习推动的视觉导航模型(如VLN、VLN-CE)逐渐兴起,利用图像和自然语言实现场景理解与路径规划。代表性工作包括Zhang等的深度感知导航和Xue等的多模态融合方法。这些方法虽取得一定突破,但仍依赖多传感器或环境标定,限制了部署范围。随着机器人硬件多样化,单目视觉成为最普遍的传感器,如何在保持性能的同时降低硬件依赖,成为研究热点。

核心问题

现有视觉导航系统普遍依赖深度信息、多摄像头或预建地图,导致硬件成本高、环境适应性差。单目视觉虽成本低,但受限于深度估计不准确、场景尺度变化大,难以实现鲁棒导航。如何在只用单一RGB图像的情况下,保持高成功率和路径效率,成为核心难题。此外,训练数据的获取成本高,模型泛化能力不足,也限制了实际应用。解决这些问题,需突破传统依赖多传感器的局限,设计通用、高效、易部署的导航策略。

核心创新

本研究的创新点包括:1)提出仅用单目RGB图像的端到端导航模型,避免依赖深度和多摄像头,极大降低硬件成本;2)引入点指示机制,将目标位置转化为图像空间的点,增强模型跨场景和平台的泛化能力;3)采用prefix-caching训练策略,显著缩短训练时间,提升效率;4)结合树状注意力掩码,避免模型依赖历史动作信息,增强预测的视觉基础性;5)利用模拟大规模数据训练,结合强化学习优化探索和恢复能力,整体性能优于多传感器系统。

方法详解

  • �� 输入:自然语言指令和连续的单目RGB图像序列。
  • �� 视觉编码:用视觉编码器提取图像特征,转化为视觉标记。
  • �� 指令融合:将指令和视觉标记拼接,作为VLM的输入。
  • �� 目标点预测:模型在当前视野中推断目标点的图像坐标(u,v)和朝向变化(Δθ),避免依赖具体几何参数。
  • �� 偏移回退:当目标不在视野时,模型预测相对平移(Δx, Δy)和旋转(Δθ)以确保连续导航。
  • �� 训练优化:采用prefix-caching技术,将完整轨迹打包成单一序列,减少重复编码。
  • �� 树状注意力:限制模型只关注必要的前序信息,避免过拟合历史动作。
  • �� 强化学习:在模拟环境中在线优化探索和恢复能力,提升整体成功率。

实验设计

模型在模拟环境中生成2.4百万轨迹,涵盖350k场景,确保多样性和泛化能力。在R2R-CE和RxR-CE两个基准上进行评估,比较单目RGB与多传感器系统的性能差异。关键指标包括成功率(SR)、路径效率(SPL)和导航误差。超参数方面,模型训练采用Adam优化器,学习率调节,训练时间由数月缩短到数日。对比不同训练策略(如无prefix-caching、无强化学习)验证效率和性能提升。

结果分析

在R2R-CE验证集,成功率达77.4%,比最优单目模型(66.9%)提升10.5个百分点,超越多传感器系统(72.1%)5.3个百分点。RxR-CE中,成功率75.1%,路径误差仅3.47米,优于深度模型。训练时间由数月缩短至数日,强化学习显著提升探索和恢复能力,模型在复杂环境中表现出强大鲁棒性。

应用场景

该模型适用于仓储、配送、巡检等多场景机器人,依赖少、部署快。只需单目RGB摄像头,无需环境标定,极大降低硬件成本。可在未知环境中自主导航,提升效率和安全性。未来结合多模态信息,将拓展到动态环境和多任务场景,推动工业和服务机器人普及。

局限与展望

模型在极端光照或动态场景下表现仍有限,模拟训练数据的多样性不足可能影响实际应用。高性能模型对GPU资源需求大,限制边缘设备部署。长远规划和多模态融合仍需优化,未来需加强环境适应性和自主学习能力。

通俗解读 非专业人士也能看懂

想象你在一个大厨房里做菜,所有的厨具和食材都在不同的地方。你只用一只眼睛(单目相机)观察厨房,看到的只是一些菜品和厨具的图片,没有深度信息。你需要根据指示找到某个食材,比如“找红色的番茄”,但只看图片很难知道它在多远。于是,你学会了用图片中的位置点指示目标,遇到看不见的目标时,就用转身或走动的方式去寻找。这个过程就像用眼睛在厨房里“点菜”,不依赖特殊的传感器,只用普通的相机,就能找到目标。通过模拟大量厨房场景训练,你变得越来越聪明,能在不同厨房里自如操作,不用每次都重新调试设备。这就像你用一只眼睛在厨房里找到所有食材一样简单。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的寻宝游戏,但你只有一只眼睛看着房间里的东西,没有用到特殊的雷达或多角度摄像头。你需要找到一个藏起来的玩具,指示会告诉你它在房间的哪个角落,但你看不到整个房间,只能看到一部分。于是,你学会了用手指指向图片上的目标位置,或者转身去看其他角落。每次你成功找到目标,都会记住这个位置,下次就能更快找到。这个游戏就像机器人用一只普通相机在房间里找东西,不依赖复杂的设备,只靠聪明的学习和指示,就能完成任务。通过大量模拟训练,你变得像个专业的寻宝高手,不管房间多大、多复杂,都能找到目标。

原文摘要

Deploying navigation systems at scale requires a recipe that minimizes sensor assumptions, generalizes across robot embodiments, and trains efficiently. Yet, today's best systems depend on depth sensors, multi-camera rigs, or pre-built maps, limiting the hardware they support and increasing deployment cost. We introduce Robostral Navigate, an 8B vision-language model built around this scalability objective. The model consumes only a stream of monocular RGB images - the most ubiquitous sensor across robotic platforms and predicts waypoints by pointing to the next target location in the current camera view. Operating purely in image space, rather than robot-specific coordinates, makes the policy naturally robust to changes in camera intrinsics and scene scale, enabling deployment across wheeled, legged, and aerial robots without recalibration. We generate 2.4 million trajectories across 350k simulated scenes to reduce the reliance on real-world data collection and scale easily. We further introduce a prefix-caching training recipe that packs entire episodes into single training sequences, reducing training tokens by 22x and cutting training time from months to days. A tree-based attention mask prevents conditioning on previous ground-truth actions, encouraging visually grounded action prediction, and reinforcement learning is used to further improve exploration and recovery capabilities. On the Room-to-Room and Room-Across-Room in Continuous Environments (R2R-CE and RxR-CE) benchmarks, Robostral Navigate sets a new state of the art. On R2R-CE, it achieves a 77.4% success rate, surpassing the best monocular method by 10.5 points and the strongest depth- or multi-camera system by 5.3 points despite using only a single RGB camera. On RxR-CE, it reaches 75.1% success rate, outperforming all monocular baselines.

cs.RO cs.AI