RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

TL;DR

RecoverFly为无人机视觉-语言导航引入基于故障感知的强化学习后训练框架,提升成功率3.12-8.37个百分点。

cs.CV 🔴 高级 2026-08-10 20 次浏览
Boxiong Wang Hui Kang Geng Sun Jiahui Li Chao Yu Daxin Tian
无人机 强化学习 视觉导航 故障修正 场景适应

核心发现

方法论

RecoverFly采用基于token级的PPO算法,结合语法约束的自回归动作生成,利用动态故障重放机制强化修正学习。引入两阶段长尾场景课程和参考策略KL正则化,平衡场景适应与策略稳定。具体包括:• 保留预训练文本动作接口,优化autoreg动作;• 设计故障重放池,重访未解决的失败案例;• 两阶段场景课程调节样本分布;• 引入参考策略KL正则化限制策略偏离。该框架在TravelUAV基准上实现了在未见环境中成功率提升3.12-8.37个百分点。

关键结果

  • RecoverFly在TravelUAV测试集上,成功率在全场景提升了约6.25个百分点(从47.96%到56.33%),在困难场景中提升10.08个百分点(49.30%到59.72%),显著优于AerialVLA。NE指标下降19.23米,表明导航误差明显减少。在未见地图和目标对象场景中也表现优异,成功率提升5.39个百分点,验证了其强泛化能力。

研究意义

该研究突破了无人机端到端视觉-语言导航中强化学习样本利用不足和场景偏差问题,提出的故障感知后训练框架显著提升了模型的鲁棒性和泛化能力。为未来自主无人机在复杂环境中的自主导航提供了理论基础和技术路径,有望推动无人机在搜索、救援、监测等领域的应用普及。

技术贡献

技术创新包括:• 提出基于token级的PPO优化机制,适应语法约束的自动回归动作空间;• 设计动态故障重放机制,有效利用稀疏的失败样本;• 引入两阶段场景课程,平衡长尾场景的训练分布;• 采用参考策略KL正则化,限制策略偏离,确保策略稳定。整体框架融合强化学习、样本重放与场景调节,显著优于传统行为克隆和单一RL方法。

新颖性

本研究首次系统性结合故障感知重放、场景长尾调节与策略正则化,提出适用于自动驾驶式无人机端到端视觉-语言导航的后训练强化学习框架。区别于现有仅依赖行为克隆或单一RL的方案,RecoverFly实现了对复杂场景中稀疏反馈的高效利用和模型的稳健升级,具有开创性。

局限性

  • 当前方法依赖预训练模型的基础能力,面对极端环境或传感器噪声时仍可能失效;
  • 重放机制在极端长尾场景中可能面临样本偏差问题,影响泛化;
  • 训练成本较高,尤其在大规模场景中需要大量计算资源,未来需优化效率。

未来方向

未来将探索多模态融合增强模型的环境理解能力,结合自主探索策略提升未知场景适应性,并考虑引入元学习机制以进一步提升模型的快速适应能力。还将研究更高效的样本利用策略,降低训练成本,推动实际部署应用。

AI 总览摘要

无人机视觉-语言导航(UAV-VLN)在复杂环境中实现自主飞行,面临多重挑战,包括样本利用率低、场景偏差大和策略漂移。传统行为克隆方法依赖专家示范,缺乏有效的修正机制,易受误差累积影响。强化学习(RL)提供了潜在解决方案,但在实际应用中受限于样本效率和稀疏反馈问题。为此,Wang等提出RecoverFly,一种结合故障感知重放、场景长尾调节和策略正则化的后训练RL框架,旨在提升端到端UAV-VLA策略的鲁棒性和泛化能力。

RecoverFly采用基于token的PPO算法,优化符合语法约束的自动回归动作生成,确保动作的可执行性。其核心在于:• 引入动态故障重放池,重访未解决的失败案例,强化修正学习;• 设计两阶段长尾场景课程,平衡训练样本分布,增强稀有场景适应;• 采用参考策略KL正则化,限制策略偏离,保持已有能力。实验证明,RecoverFly在TravelUAV基准上显著优于现有方法,成功率提升3.12-8.37个百分点,导航误差明显降低,验证了其有效性和强泛化能力。

该研究为无人机自主导航提供了新的技术路径,特别是在复杂、多变的环境中实现更稳健的自主飞行。未来,将结合多模态感知和自主探索,进一步提升模型的环境理解和适应能力,推动无人机在搜索、救援、监测等实际场景中的应用落地。虽然取得了显著进展,但在极端环境和大规模场景中仍存在样本效率和计算成本的挑战,未来研究将聚焦于优化训练流程和模型结构,以实现更高效的部署。

深度分析

研究背景

无人机视觉-语言导航(UAV-VLN)作为智能自主系统的重要研究方向,经历了从传统基于规则的路径规划到深度学习端到端模型的演变。早期方法依赖于手工设计的感知和规划模块,存在系统复杂、适应性差的问题。近年来,端到端深度模型如AerialVLA(Xu et al. 2026)通过结合视觉和语言信息,简化了系统架构,但主要依赖行为克隆,缺乏有效的故障修正机制。强化学习(RL)在提升策略鲁棒性方面展现潜力,但在无人机复杂环境中的应用仍受样本效率低、场景偏差大和策略漂移等限制。现有研究多关注中短期任务,少有系统性解决稀疏反馈和长尾场景的适应问题。本论文在此基础上提出RecoverFly,旨在突破这些瓶颈,推动无人机自主导航技术的实用化。

核心问题

无人机端到端视觉-语言导航面临多重挑战。首先,复杂环境中的局部误差易于累积,导致偏离轨迹甚至任务失败。行为克隆策略在训练时依赖专家示范,测试时在误差状态下表现不佳。其次,场景数据高度不平衡,稀有但关键的场景难以充分学习,导致模型泛化能力不足。再次,稀疏的成功/失败反馈限制了强化学习的样本利用效率,难以实现有效的策略修正。最后,策略在优化过程中可能发生偏移,损失先前学到的能力。解决这些问题,成为无人机自主导航的核心难点。

核心创新

本研究的创新点包括:1)引入基于token的PPO算法,适应语法约束的自动回归动作空间,确保动作生成的可控性和可解释性;2)设计动态故障重放机制,系统性重访未解决的失败案例,有效利用稀疏的负反馈信息;3)提出两阶段长尾场景调节策略,通过调整样本分布,增强模型对稀有场景的适应能力;4)采用参考策略KL正则化,限制策略偏离,保持已有能力。整体框架融合强化学习、样本重放和场景调节,显著提升了无人机导航的鲁棒性和泛化能力。

方法详解

  • �� 预训练模型基础:采用OpenVLA-7B作为基础,结合LoRA适配器增强模型能力;• token级PPO优化:在动作生成中引入逐个token的概率优化,确保动作符合语法约束;• 事件感知奖励:结合距离进展和事件(成功、碰撞、卡住等)稀疏奖励,利用GAE实现延迟信用分配;• 动态故障重放:建立故障池,存储未解决的失败实例,重访并更新模型;• 场景长尾调节:分两个阶段进行样本调节,第一阶段按频率采样,第二阶段均匀采样,平衡场景分布;• 参考策略正则:在两个阶段中引入KL正则,限制策略偏离,保持能力稳定;• 联合优化:通过多目标损失函数同时优化策略、价值和正则项,实现稳健学习。

实验设计

在TravelUAV数据集上进行评估,包含训练集7922条轨迹,测试集包括Seen、Unseen Map和Unseen Object三类。指标涵盖导航误差(NE)、成功率(SR)、目标进入率(OSR)和路径长度加权成功率(SPL)。对比基线包括行为克隆模型、TravelUAV、NavFoM等。采用8块A100 GPU,训练时间约21小时。通过不同场景难度和场景偏差验证模型的泛化能力,特别关注长尾场景和稀疏反馈的利用效果。

结果分析

RecoverFly在TravelUAV测试集上,成功率提升3.12-8.37个百分点(如在全场景中由47.96%提升至56.33%),在困难场景中提升10.08个百分点(49.30%到59.72%),导航误差减少19.23米。未见环境中,成功率提升5.39个百分点,NE降低19.23米,验证其在长距离和未见场景中的优越表现。 ablation分析显示,故障重放和场景调节对性能提升贡献显著,验证了各组件的有效性。

应用场景

该方法适用于无人机自主导航、搜索与救援、环境监测等场景,尤其在复杂、多变环境中表现出强鲁棒性。部署前需结合具体任务定制场景调节策略,模型可在有限样本基础上快速适应新环境,提升自主能力。

局限与展望

当前模型依赖预训练基础能力,极端环境或传感器噪声可能影响性能。重放机制在极端长尾场景中可能存在样本偏差,训练成本较高,未来需优化效率和泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器和任务。有些任务很常见,比如装配简单的零件,而有些任务很少见,比如修理特殊的设备。你需要学会如何应对各种任务,但只用一套固定的操作方法,遇到少见任务时就可能出错。现在,工厂引入了一种新方法,就像给你装上了一个智能助手,它可以在你犯错时提醒你,甚至帮你重新尝试那些难以完成的任务。这个助手还会记住哪些任务你还没搞定,反复帮你练习,直到你能顺利完成。它还会根据任务的难度调整训练计划,让你在面对少见但重要的任务时也能应对自如。这样一来,你在工厂里的工作变得更稳妥、更高效,也更能应付各种突发情况。这就像RecoverFly在无人机导航中的作用,帮助它在复杂环境中学会修正错误,变得更聪明、更可靠。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你要控制一架无人机飞过城市,找到特定的目标,比如一只藏在树丛中的鸟。刚开始,你只学会了基本的飞行操作,但有时候会迷路或者撞到东西。科学家们发现,单靠模仿专家的操作不够好,因为无人机在遇到新情况时容易出错。于是,他们设计了一个聪明的系统,就像给无人机装了一个会学习的机器人助手。这个助手会在无人机失败后,记住它出错的地方,然后反复帮它练习,直到它学会怎么修正错误。它还会根据不同的场景调整训练,比如让无人机多练习那些少见但重要的任务。这个系统还能让无人机在面对新环境时变得更聪明、更稳健。就像你在游戏中不断练习,遇到难关时也能找到办法过关一样。最终,无人机变得更可靠,能在复杂的城市中自主找到目标,完成任务。这个技术让无人机变得更像一个聪明的助手,能自己学习、修正错误,变得更厉害。

原文摘要

Unmanned aerial vehicle vision-language navigation (UAV-VLN) requires agents to translate visual observations and language instructions into reliable flight actions in complex environments. Although recent end-to-end UAV vision-language-action (UAV-VLA) policies reduce reliance on separately designed perception, planning, and control modules, their behavior-cloning objectives provide limited corrective supervision for interactive closed-loop execution. Reinforcement learning (RL) offers a promising solution, while its effectiveness is constrained by inefficient use of samples, long-tailed scene distributions, and policy distribution shift during optimization. To this end, we propose RecoverFly, a failure-aware RL post-training framework for end-to-end UAV-VLA policies. Specifically, RecoverFly adapts token-level RL for stable optimization of grammar-constrained autoregressive UAV actions, revisits unresolved failure cases to strengthen corrective learning and sample utilization, and combines a two-stage long-tail scene curriculum with reference-policy regularization to improve scene adaptation while preserving acquired capabilities. Experiments on the TravelUAV benchmark demonstrate that RecoverFly achieves the best performance on the seen, unseen-map, and unseen-object splits. Moreover, compared to the AerialVLA initialization, RecoverFly improves success rate by 3.12 to 8.37 percentage points under a total rollout budget of about 30\% of the training-set size, validating its effectiveness, robustness, and generalization capabilities.

cs.CV cs.AI