Development and Testing for Perception Based Autonomous Landing of a Long-Range QuadPlane

TL;DR

基于YOLO、TensorRT与Isaac ROS VIO的QuadPlane着陆框架,实测单帧32.7 ms、30 FPS以上。

cs.RO 🟡 进阶级 2025-12-10 24 次浏览
Ashik E Rasul Humaira Tasnim Ji Yu Kim Young Hyun Lim Scott Schmitz Bruce W. Jo Hyung-Jin Yoon
QuadPlane 自主着陆 YOLO 视觉惯性里程计 边缘AI

核心发现

方法论

研究将2.4 m翼展、约4.56 kg的Voluntex Ranger 2400固定翼机改造成QuadPlane,集成ArduPilot/Pixhawk、Arducam IMX519 RGB相机、Intel RealSense D435i RGB-D相机、FPV相机和Jetson Orin Nano Super。感知模型采用YOLO,经PyTorch导出ONNX,再转换为TensorRT FP16;位姿估计采用NVIDIA Isaac ROS Visual SLAM,并以nvblox生成体素地图。训练环境由CARLA UE4升级至UE5。

关键结果

  • 在120张未参与训练、覆盖多种户外条件的helipad图像上,预处理、FP16 GPU推理和后处理耗时分别为8.5、19.1和5.1 ms,总计32.7 ms/帧,理论运行速度超过30 FPS;论文未报告检测精度、召回率或与基线模型的定量比较。
  • Prototype I在未搭载Jetson和感知模块时完成初步飞行:升至15 m,定高盘旋30 s后着陆;滚转和俯仰相对期望值的角度误差以平方根形式评估,稳定保持在1.5°以内。
  • Prototype II完成硬件集成,但完整载荷下的全包线飞行、空中D435i数据质量、GPS拒止自主下降和闭环着陆尚未完成。因此,当前证据主要证明了平台稳定性基线和推理可行性,而非完整自主着陆性能。

研究意义

论文针对长航程混合垂直起降飞机从仿真走向现实部署的关键断层。相比小型多旋翼,QuadPlane惯量更大、悬停时推力矢量能力更弱、响应更慢,感知延迟和位姿误差会被放大。作者把视觉检测、RGB-D VIO、边缘计算和结构改装放入同一受载荷与体积约束的平台,为城市监测、GPS拒止巡检等任务提供了可复现的工程基础,也明确展示了实际系统验证仍需跨越的环节。

技术贡献

技术贡献是端到端系统协同而非单一新算法:采用CARLA UE5增强光照、阴影和几何真实性;用TensorRT FP16压缩YOLO推理负担;让Isaac ROS Visual SLAM与nvblox和检测器共享Jetson资源;通过FDM打印、碳纤维梁和1.5 mm加强板完成传感器及旋翼臂集成。该组合把算法延迟、机体结构、供电和姿态控制作为统一部署问题处理。

新颖性

作者将工作定位为首个面向非结构化、GPS拒止环境的、机载DNN着陆感知QuadPlane软硬件一体化框架。其新颖性主要在于把UE5训练迭代、大型2.4 m平台、RGB/RGB-D/VIO和单块Jetson Orin Nano Super结合起来。相较既有标记着陆、小型多旋翼或纯仿真研究,本文更强调真实载荷、体积和实时性约束,但尚未以完整自主着陆数据证明优势。

局限性

  • 完整飞行测试尚未完成:稳定盘旋结果来自未搭载边缘AI和感知模块的Prototype I,不能直接证明Prototype II在额外载荷下仍具相同控制品质。
  • 论文只给出120张图像上的时间分解,没有报告YOLO版本、训练规模、检测mAP、误检漏检、VIO漂移或自主着陆成功率,因而难以与SOTA进行严格复现和比较。
  • D435i仅完成地面功能验证;快速下降、振动、光照变化、地面效应和遮挡下的数据完整性仍未知。

未来方向

作者计划对Prototype II开展全飞行包线和空气动力学数值分析,验证新增载荷对响应和稳定性的影响;随后测试飞行中的D435i、Isaac ROS VIO和nvblox,最终执行GPS拒止条件下的helipad检测、位姿估计和受控下降。后续还需公开精度指标、失败案例、功耗及闭环控制参数。

AI 总览摘要

长航程QuadPlane兼具固定翼续航和多旋翼垂直起降能力,但在无GPS、城市杂乱环境中降落尤其困难:着陆区不规则,飞机惯量大、推力调节弱,任何感知延迟或位姿误差都可能导致偏离。既有研究多停留在仿真、小型多旋翼或依赖人工标记的场景。

本研究把Voluntex Ranger 2400改造成2.4 m翼展QuadPlane,搭载Pixhawk/ArduPilot、Arducam IMX519、Intel RealSense D435i、FPV相机和NVIDIA Jetson Orin Nano Super。作者将CARLA训练环境从UE4升级为UE5,并采用YOLO检测器;模型经ONNX和TensorRT FP16优化,同时运行Isaac ROS Visual SLAM与nvblox,以获得6自由度位姿和体素地图。结构上使用碳纤维梁、加强板和FDM打印部件承载新增设备。

在120张未见helipad图像上,系统预处理、GPU推理、后处理耗时分别为8.5、19.1、5.1 ms,总延迟32.7 ms,超过30 FPS。未搭载完整感知载荷的Prototype I升至15 m并定高30 s,滚转和俯仰误差小于1.5°。然而,完整自主着陆、VIO飞行验证和检测精度尚未报告。因此,论文的主要价值是建立了现实约束下的可部署基础,而不是已经完成性能闭环证明。

深度分析

研究背景

自主垂直着陆同时受感知、状态估计、控制、风扰动和地面效应影响。早期系统使用视觉标记与Kalman滤波;Falanga等展示了移动平台上的深度视觉降落,后续研究探索无标记视觉制导和RGB-D安全着陆。CARLA、AirSim和GUAM推动了仿真验证,但多数工作针对小型多旋翼,或依赖UE4、外部计算和结构化着陆区。

核心问题

目标是在GPS拒止、非结构化场地中,让大惯量QuadPlane实时发现着陆区、估计自身6-DoF位姿并安全下降。瓶颈包括Jetson的内存和延迟预算、检测器与VIO的资源竞争、固定翼机身空间不足、旋翼臂载荷和低速控制响应,以及仿真到现实的光照、纹理和天气差异。

核心创新

  • �� 将CARLA UE4迭代训练流程迁移至UE5,利用更真实的全局光照、阴影和场景几何缩小域差异。
  • �� 把2.4 m翼展、4.56 kg固定翼平台改造成可携带多传感器和边缘GPU的QuadPlane。
  • �� 采用YOLO、ONNX、TensorRT FP16组成实时检测链路,并与Isaac ROS Visual SLAM、nvblox共享Jetson资源。
  • �� 用碳纤维梁、加强板和FDM部件解决旋翼臂、相机及计算模块的结构和布局问题。

方法详解

  • �� 平台输入:Voluntex Ranger 2400、6S LiPo、四台D4215电机、12英寸5.5英寸螺距螺旋桨;每台约2 kg推力,总推力约8 kg。
  • �� 训练输入:CARLA UE5中的多天气、光照和背景场景;通过YOLO迭代再训练提升helipad检测泛化。
  • �� 推理链路:PyTorch模型经Ultralytics导出ONNX,再生成TensorRT FP16引擎;输出着陆垫位置和置信信息。
  • �� 状态估计:D435i同步RGB-D与IMU输入Isaac ROS Visual SLAM,输出GNSS无关的6-DoF位姿;nvblox增量构建体素地图。
  • �� 工程验证:先以不带AI模块的Prototype I验证盘旋,再以Prototype II承载完整感知系统。

实验设计

实验分为软件和飞行两部分。软件测试使用120张未见helipad图像,覆盖多种户外条件,统计预处理、FP16 GPU推理和后处理时间。论文没有提供公开精度基线、YOLO具体版本、数据集规模或消融表。飞行测试采用Prototype I,在15 m高度盘旋30 s后着陆,并测量滚转、俯仰误差。Prototype II已完成集成,但完整飞行和GPS拒止自主着陆属于后续工作。

结果分析

最明确的结果是实时性:8.5+19.1+5.1=32.7 ms/帧,满足超过30 FPS的目标。平台稳定性初测显示15 m定高30 s,滚转和俯仰误差不超过1.5°。但这些结果不能等同于自主着陆成功率;检测mAP、召回率、VIO漂移、端到端控制误差和不同天气下表现均未报告。因而贡献更偏向系统可行性与工程集成。

应用场景

直接应用包括长距离航空监测、城市基础设施巡检、无GPS区域测绘和灾害现场补给。实际使用需要预先验证着陆区、充足光照、可用视觉纹理、Jetson供电和ArduPilot控制参数。RGB检测提供目标定位,RGB-D与VIO在GNSS失效时提供相对位姿和空间地图,适合通信受限、需要机载决策的任务。

局限与展望

当前研究尚未完成完整闭环自主降落。Prototype I不含Jetson、D435i和相机,Prototype II的新增重量对重心、振动、功耗、控制响应和翼面载荷的影响仍未量化。120张图像只能证明时间预算,不能充分证明跨天气、遮挡、反光和陌生场地的泛化。未来需报告检测精度、VIO漂移、功耗、失败模式和成功率,并进行空气动力学分析及全系统GPS拒止飞行。

通俗解读 非专业人士也能看懂

可以把这架飞机想成一辆既能在公路上长途行驶、又能原地起降的送货车。固定翼部分像省油的车轮,适合飞很远;四个旋翼像四个升降机,让它不用跑道也能起飞和降落。真正困难的是,它必须在陌生院子里找到能停下来的地方,而且不能依赖手机地图。

研究人员给它装了几双“眼睛”:一台普通相机快速寻找着陆垫,一台能测距离的相机判断地面远近,还有一台给人远程观察的相机。小型电脑Jetson像车上的即时指挥员,把相机画面转换成“着陆垫在左边、飞机需要向右修正”的信息。YOLO负责找目标,另一套程序结合画面和运动传感器估计飞机的位置。

为了让车身不被新设备压坏,研究人员用碳纤维加固机翼,并用3D打印制作安装件。测试中,电脑每张图像约32.7毫秒处理完,速度超过每秒30张;基础飞机飞到15米并保持30秒,姿态误差小于1.5度。不过,完整设备还没有完成真正的自主降落测试,所以它更像一辆已经通过发动机和导航测试、正在准备道路考试的智能飞机。

简单解释 像给14岁少年讲一样

想象一架飞机要去很远的地方巡逻,但回家时没有GPS,也没有跑道。它必须像游戏里的角色一样,自己看地图、找安全平台,还要慢慢停准。普通固定翼飞机飞得远,却不能原地停;普通无人机能原地起降,却不一定能长途飞行。QuadPlane把两种能力合在一起,但也因此更重、更慢、更难控制。

这篇论文给飞机装上了“眼睛”和“脑子”。Arducam相机负责快速看地面,RealSense相机还能估计距离,FPV相机让操作者观察。Jetson Orin Nano Super是一台小电脑,运行YOLO来找着陆垫,再用相机和运动传感器判断自己在哪里。它还会一点点做出周围环境的立体地图,就像游戏角色边走边画地图。

研究者先在CARLA UE5虚拟世界里训练,让天气、灯光和背景更丰富,再把模型压缩到飞机电脑能承受的程度。结果是每张图片约32.7毫秒处理完,超过每秒30张。没装完整电脑和相机的原型机飞到15米,保持30秒,左右和前后倾斜误差小于1.5度。

但别急着说它已经能完全自动降落!完整原型机还需要真正飞行测试,看看相机在震动、阴影、强光和快速下降时是否可靠。这项工作更像是把一辆未来智能车造出来并完成基础测试,下一关才是让它独立完成任务。

术语表

YOLO(You Only Look Once,单阶段目标检测)

一种直接从整幅图像预测目标位置和类别的实时检测算法。它通常以一次前向计算换取较高速度。

论文用YOLO检测helipad,并部署在Jetson上。

TensorRT FP16(半精度推理)

TensorRT是NVIDIA的深度学习推理优化工具;FP16用16位浮点数减少计算和内存开销。适当使用时可提高边缘设备吞吐率。

模型经ONNX转换为TensorRT FP16引擎。

VIO(Visual-Inertial Odometry,视觉惯性里程计)

融合相机和IMU数据,连续估计设备运动与位姿的方法。它不必依赖GNSS,但会受到纹理不足和长期漂移影响。

Isaac ROS Visual SLAM使用D435i RGB-D和IMU进行6-DoF估计。

nvblox

GPU加速的增量式三维建图系统,可将深度观测转换为体素或距离场地图。它支持机器人实时感知障碍物和空间结构。

论文将VIO输出与nvblox结合进行3D环境建图。

CARLA UE5

基于Unreal Engine 5的自动驾驶仿真环境,可生成带有天气、光照和几何变化的视觉数据。更真实的渲染有助于缩小仿真到现实差距。

作者把原有CARLA UE4训练流程升级到UE5。

开放问题 这项研究留下的未解疑问

  • 1 完整载荷是否改变QuadPlane的气动稳定性、控制延迟和能耗?需要Prototype II的全包线飞行、空气动力学模型与对照实验。
  • 2 YOLO和VIO在强反光、低纹理、阴影、振动及快速下降时的联合失败概率是多少?论文尚未报告精度、漂移和成功率。
  • 3 单个Jetson同时运行检测、VIO和建图时的持续温度、功耗及资源抢占如何影响闭环控制?

应用场景

近期应用

长距离航空监测

监测机构可利用固定翼巡航效率执行森林、管线或城市设施巡检,并在目标区域垂直降落。部署前需完成载荷平衡、光照测试、ArduPilot调参和安全备降设计。

GPS拒止区域巡检

在隧道口、密集城区或灾害现场,RGB检测器寻找可用着陆区,D435i、Isaac ROS Visual SLAM和nvblox辅助定位。前提是环境具有足够视觉纹理且机载供电满足持续推理。

远期愿景

自主空中作业网络

成熟后,QuadPlane可在多个临时站点自主起降、补给和换电,服务应急通信、物流和环境监测。关键障碍是复杂天气、动态障碍物、法规认证和端到端安全证明。

原文摘要

QuadPlanes combine the range efficiency of fixed-wing aircraft with the maneuverability of multi-rotor platforms for long-range autonomous missions. In GPS-denied or cluttered urban environments, perception-based landing is vital for reliable operation. Unlike structured landing zones, real-world sites are unstructured and highly variable, requiring strong generalization capabilities from the perception system. Deep neural networks (DNNs) provide a scalable solution for learning landing site features across diverse visual and environmental conditions. While perception-driven landing has been shown in simulation, real-world deployment introduces significant challenges. Payload and volume constraints limit high-performance edge AI devices like the NVIDIA Jetson Orin Nano, which are crucial for real-time detection and control. Accurate pose estimation during descent is necessary, especially in the absence of GPS, and relies on dependable visual-inertial odometry. Achieving this with limited edge AI resources requires careful optimization of the entire deployment framework. The flight characteristics of large QuadPlanes further complicate the problem. These aircraft exhibit high inertia, reduced thrust vectoring, and slow response times further complicate stable landing maneuvers. This work presents a lightweight QuadPlane system for efficient vision-based autonomous landing and visual-inertial odometry, specifically developed for long-range QuadPlane operations such as aerial monitoring. It describes the hardware platform, sensor configuration, and embedded computing architecture designed to meet demanding real-time, physical constraints. This establishes a foundation for deploying autonomous landing in dynamic, unstructured, GPS-denied environments.

cs.RO cs.CV