LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

TL;DR

LocalNav通过蒸馏前沿VLM和强化学习,实现嵌入式设备上的目标导航,推理延迟减少82.8%。

cs.RO 🔴 高级 2026-06-26 27 次浏览
Nicolas Baumann Liam Boyle Pu Deng Edoardo Ghignone Boyang Sun Marc Pollefeys Luca Benini Michele Magno
视觉语言模型 目标导航 强化学习 嵌入式系统 模型蒸馏

核心发现

方法论

该研究提出LocalNav框架,通过蒸馏大规模云端VLM(如Claude Sonnet 4.6)的推理能力到轻量级Qwen3.5-4B模型,并结合E-RLVR优化生成长度,适配嵌入式GPU设备。

关键结果

  • 结果1:Claude Sonnet 4.6在HM3D OVON基准上达到39.7%成功率(SR),而Qwen3.5-4B蒸馏模型达34.5%,性能差距缩小至5.2%。
  • 结果2:E-RLVR方法将生成长度减少72.1%,推理延迟降低71.8%,结合量化后总延迟减少82.8%。
  • 结果3:通过500条蒸馏轨迹微调Qwen3.5-4B,显著提升其导航能力,避免大规模数据需求。

研究意义

该研究解决了VLM在嵌入式设备上部署的延迟和资源瓶颈问题,为资源受限的移动机器人提供了高效的目标导航解决方案,推动了机器人领域的边缘计算发展。

技术贡献

提出了E-RLVR结合Token生成正则化的训练策略,显著优化了嵌入式设备上的推理效率;通过场景图(SG)和Qwen3.5-4B模型实现模块化高层决策,降低对云端计算的依赖。

新颖性

首次将大规模VLM的空间-语义推理能力蒸馏到嵌入式设备,结合E-RLVR和量化技术实现高效部署,填补了本地化目标导航的技术空白。

局限性

  • 局限1:模型性能仍低于云端VLM,尤其在复杂场景下表现差距更明显。
  • 局限2:E-RLVR需要模拟环境支持,实际部署中可能受限。
  • 局限3:量化可能导致部分推理精度损失。

未来方向

未来可探索更高效的蒸馏方法、适配多任务场景的模型优化,以及在真实机器人上的长期性能验证。

AI 总览摘要

视觉语言模型(VLM)在机器人领域展现了强大的开放词汇任务能力,但其高计算需求限制了本地部署。LocalNav通过蒸馏大规模云端模型的推理能力到轻量级Qwen3.5-4B,并结合强化学习优化生成长度,成功实现了嵌入式设备上的目标导航。

该方法在Claude Sonnet 4.6的场景图(SG)架构基础上,利用500条蒸馏轨迹微调Qwen3.5-4B,成功率达到34.5%,接近云端模型的39.7%。此外,E-RLVR训练策略结合Token生成正则化,将推理延迟减少71.8%,结合量化后总延迟降低82.8%。

这一研究为资源受限的机器人提供了高效的目标导航解决方案,同时展示了边缘计算在机器人领域的潜力。然而,模型性能仍有提升空间,未来可探索更高效的蒸馏和优化技术以进一步缩小与云端模型的差距。

深度分析

研究背景

视觉语言模型(VLM)近年来在开放词汇任务中表现出色,尤其在目标导航(ObjectNav)领域。然而,这些模型通常需要高性能计算资源,难以在嵌入式设备上本地运行,限制了其在移动机器人中的应用。

核心问题

现有VLM在目标导航中的应用依赖云端计算,导致高延迟和网络依赖。如何在嵌入式设备上实现高效的本地推理是一个关键挑战。

核心创新

LocalNav的核心创新包括:

1. 提出基于场景图的模块化架构,分离高层语义推理与低层导航控制。

2. 通过蒸馏将云端VLM的推理能力迁移到Qwen3.5-4B。

3. 引入E-RLVR训练策略,结合Token生成正则化优化推理效率。

方法详解

  • �� 使用Claude Sonnet 4.6生成500条蒸馏轨迹,微调Qwen3.5-4B。
  • �� 采用场景图(SG)表示环境,结合文本和图像提示进行高层决策。
  • �� 引入E-RLVR优化生成长度,结合量化技术减少推理延迟。

实验设计

实验在HM3D OVON基准上进行,评估了Claude Sonnet 4.6和Qwen3.5-4B的性能。通过蒸馏和E-RLVR优化,Qwen3.5-4B在成功率和推理效率上表现出显著提升。

结果分析

Claude Sonnet 4.6在HM3D OVON基准上达到39.7%成功率,而Qwen3.5-4B通过蒸馏和优化达到34.5%。E-RLVR将生成长度减少72.1%,推理延迟降低71.8%。

应用场景

该方法适用于资源受限的移动机器人目标导航任务,如家庭服务机器人和仓储机器人。

局限与展望

模型在复杂场景中的性能仍低于云端VLM,且E-RLVR对模拟环境的依赖可能限制其实际应用。

通俗解读 非专业人士也能看懂

可以将LocalNav比作一个“智能导盲犬”。导盲犬需要理解主人的指令(语言),观察周围环境(视觉),并找到目标(导航)。LocalNav通过学习云端模型的能力,像导盲犬一样在本地设备上高效运行,帮助机器人完成复杂的导航任务。

简单解释 像给14岁少年讲一样

想象你在玩一个寻宝游戏,你需要找到一个隐藏的宝藏。LocalNav就像你的游戏助手,它能看懂地图(视觉),听懂你的指令(语言),并帮你规划路线(导航)。它特别聪明,因为它从“云端导师”那里学到了很多技巧,现在可以在你的小设备上帮你完成任务!

术语表

视觉语言模型 (VLM)

结合视觉和语言的深度学习模型,能理解图像和文本的语义。

用于目标导航中的环境感知和语义推理。

目标导航 (ObjectNav)

机器人根据指令找到特定目标物体的任务。

论文的主要任务场景。

场景图 (SG)

用图结构表示环境中物体及其关系的模型。

用于高层语义推理的核心组件。

蒸馏 (Distillation)

将大模型的能力迁移到小模型的技术。

用于将云端VLM的能力迁移到Qwen3.5-4B。

E-RLVR

结合奖励机制优化生成长度的强化学习方法。

用于优化模型推理效率。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步缩小本地模型与云端模型的性能差距?
  • 2 如何在真实机器人中验证E-RLVR的长期效果?

应用场景

近期应用

家庭服务机器人

帮助机器人在家中找到特定物品,如“微波炉下的抽屉”。

仓储机器人

优化仓库中机器人寻找和搬运物品的效率。

远期愿景

完全自主导航机器人

实现无需云端支持的复杂任务导航,如灾难救援和探索任务。

原文摘要

Vision Language Models (VLMs) have emerged in the robotic domain as a powerful tool that enables environmental perception with language context, serving as a catalyst for open-vocabulary tasks like ObjectNav. Yet, their computational footprint typically confines them to cloud execution, hindering low-latency inference with local deployment on resource-constrained robots. To address this challenge, we present a distillation strategy that transfers complex spatial-semantic reasoning from large frontier models into a lightweight, 4B-parameter local VLM for edge execution on embedded GPU devices (e.g., Jetson Orin). We first establish a State of the Art (SotA), Scene Graph (SG)-based pipeline using Claude Sonnet 4.6, achieving a 39.7% Success Rate (SR) on the HM3D OVON benchmark. We then demonstrate that fine-tuning Qwen3.5-4B on just 500 frontier reasoning traces effectively enables navigation capabilities, yielding a SR of 34.5%, narrowing the gap to the performance of large cloud models. Finally, we introduce E-RLVR with Token Generation (TG) regularization to compress output sequence lengths for physical deployment while grounding the agent in its task. This downstream optimization reduces TG overhead by 72.1% and latency by 71.8%. Combined with quantization, this joint strategy yields a cumulative 82.8% reduction in overall inference latency without significantly sacrificing performance, presenting a viable paradigm for local, low-latency VLM execution on mobile robots.

cs.RO