Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation

TL;DR

Fly0通过结构化语义-几何接口实现无人机零样本自主导航,提升成功率20%以上。

cs.RO 🔴 高级 2026-02-02 17 次浏览
Zhenxing Xu Yihong Lu Weidong Bao Zhengqiu Zhu Jingxuan Zhou Zhichuang Wang Ji Wang Lihua Liu Wei He
无人机 视觉-语言导航 几何规划 零样本学习 多模态大模型

核心发现

方法论

Fly0采用三阶段流程:首先利用多模态大模型(MLLM)进行自然语言指令的结构化语义定位,将目标区域从二维像素点提升到不确定的三维空间中;其次通过深度数据进行几何投影,生成目标的3D位置,结合空间关系生成可导航的目标点;最后将目标存入持久化目标记忆中,利用LiDAR信息进行高频轨迹规划。该架构实现了语义推理与几何控制的解耦,有效应对遮挡、视角变化和通信延迟问题。

关键结果

  • 在模拟环境AerialVLN、OpenFly和真实环境Fly0-Real中,Fly0的成功率提升超过23%,在未结构化场景中导航误差降低约50%,碰撞率显著下降,系统稳定性增强。实验数据显示,低频语义推理(0.5-1Hz)与高频几何控制(50-100Hz)协同工作,有效提升了导航的鲁棒性和效率。
  • 与传统端到端策略和内嵌MLLM的控制方法相比,Fly0在复杂环境中的表现更优,特别是在目标遮挡和动态障碍情况下,目标保持能力明显增强。
  • 消除了连续推理的需求,减少了计算负担,验证了接口设计在无人机自主导航中的关键作用。

研究意义

该研究突破了视觉-语言导航中语义理解与几何控制的隔离瓶颈,为无人机在复杂环境中的自主导航提供了新思路。通过结构化目标表示和持久化空间记忆,有效应对遮挡、视角变化等挑战,推动了无人机智能自主系统的实用化。该方法不仅提升了导航成功率,也增强了系统的鲁棒性和安全性,具有广泛的应用潜力。

技术贡献

提出基于结构化语义输出的持久化目标记忆机制,结合深度信息实现不确定性感知的3D目标提升,设计了关系感知的导航目标生成算法。系统架构实现了低频语义推理与高频几何控制的解耦,显著降低了计算延迟,提升了系统稳定性。该方法在多模态大模型的基础上,创新性地引入空间关系和不确定性管理,为无人机自主导航提供了新的技术路径。

新颖性

首次提出将零样本视觉-语言导航中的语义推理与几何控制解耦,构建结构化语义-几何接口,实现目标的持久化和关系感知。不同于传统端到端或纯几何方法,Fly0强调接口设计中的不确定性管理和空间关系建模,解决遮挡和视角变化带来的挑战,具有明显的创新性。

局限性

  • 当前方法依赖深度数据的准确性,深度噪声或缺失可能影响目标提升效果。
  • 在极端复杂环境中,关系感知和目标重识别仍存在一定难度,未来需增强模型的鲁棒性。
  • 系统在高动态场景下的实时性和稳定性有待进一步优化,尤其是在多目标同时导航时。

未来方向

未来将结合强化学习优化目标验证策略,提升系统在动态环境中的适应性。同时,探索多模态信息融合和端到端训练,增强模型的泛化能力。还计划扩展多机器人协作场景,推动无人机自主导航的广泛应用。

AI 总览摘要

Fly0提出了一种创新的无人机视觉-语言导航架构,通过结构化语义-几何接口实现目标的持久化和关系感知,有效解决了传统方法中语义理解与几何控制的耦合问题。在复杂环境中,现有的端到端策略或内嵌大模型的控制方法常面临推理延迟、目标丢失和不稳定等挑战。Fly0利用低频语义推理(每秒0.5-1次)与高频几何控制(每秒50-100次)相结合,构建了一个解耦的系统架构。其核心在于将多模态大模型(MLLM)产生的结构化语义信息转化为不确定性感知的3D目标点,并通过空间关系生成可导航的目标位置。系统在模拟和真实环境中均取得显著性能提升,成功率提升超过20%,导航误差减半,碰撞率降低,验证了其在复杂场景中的鲁棒性。该方法不仅推动了无人机自主导航技术的发展,也为未来多模态感知与控制的融合提供了新思路。尽管如此,系统仍需应对深度噪声、复杂关系识别等挑战,未来将结合强化学习和多机器人协作,进一步提升系统的适应性和实用性。整体而言,Fly0为无人机自主导航提供了一个高效、稳健的解决方案,具有广泛的应用前景。

深度解读

原文摘要

Current Visual-Language Navigation (VLN) methodologies face a trade-off between semantic understanding and control precision. While Multimodal Large Language Models (MLLMs) offer superior reasoning, deploying them as low-level controllers leads to high latency, trajectory oscillations, and poor generalization due to weak geometric grounding. To address these limitations, we propose Fly0, a framework that decouples semantic reasoning from geometric planning. The proposed method operates through a three-stage pipeline: (1) an MLLM-driven module for grounding natural language instructions into 2D pixel coordinates; (2) a geometric projection module that utilizes depth data to localize targets in 3D space; and (3) a geometric planner that generates collision-free trajectories. This mechanism enables robust navigation even when visual contact is lost. By eliminating the need for continuous inference, Fly0 reduces computational overhead and improves system stability. Extensive experiments in simulation and real-world environments demonstrate that Fly0 outperforms state-of-the-art baselines, improving the Success Rate by over 20\% and reducing Navigation Error (NE) by approximately 50\% in unstructured environments. Our code is available at https://github.com/xuzhenxing1/Fly0.

cs.RO cs.AI