Decentralized End-to-End Multi-AAV Pursuit Using Predictive Spatio-Temporal Observation via Deep Reinforcement Learning

TL;DR

提出基于PSTO的去中心化端到端多无人机追捕框架,利用LiDAR直接映射控制,显著提升效率。

cs.RO 🔴 高级 2026-03-25 37 次浏览
Yude Li Zhexuan Zhou Huizhe Li Yanke Sun Yenan Wu Yichen Lai Yiming Wang Youmin Gong Jie Mei
多智能体强化学习 无人机追捕 感知不确定性 端到端控制 深度学习

核心发现

方法论

该方法核心是构建预测时空感知(PSTO)表示,将障碍几何、对手和队友的运动意图通过固定分辨率的球面投影融合。利用双流卷积网络,端到端学习策略,直接从LiDAR点云映射连续控制指令。训练采用MAPPO算法,结合中心化训练与去中心化执行,设计多目标奖励函数以优化追捕效率。该系统在模拟环境中实现静态障碍避让、动态目标拦截和队伍合作,且无需依赖地面真实状态信息。

关键结果

  • 在模拟环境中,提出方法在2v1追捕任务中成功率达100%,平均捕获时间为125步,优于传统启发式方法(成功率约90%,捕获时间更长),且在不同队伍规模(3、6、9)中表现出良好的扩展性。实验证明,该策略在复杂环境中保持94%以上的成功率,且无需重新训练即可适应不同队伍规模,显示出优越的规模泛化能力。
  • 对比基线方法,PSTO显著提升了追捕成功率和鲁棒性,尤其在高密度障碍和高速目标情况下表现优异。 ablation研究表明,加入预测意图热图和空间对齐机制,提升了策略的环境理解和合作能力,验证了PSTO在感知融合中的关键作用。
  • outdoor全自主飞行实验中,四旋翼队伍仅依赖机载LiDAR和计算,实现了零样本的2v1追捕任务,验证了系统的实用性和鲁棒性,标志着端到端多智能体自主追捕的技术突破。

研究意义

该研究突破了传统多无人机追捕依赖地面真实状态或几何特征的限制,提出端到端感知到控制的深度强化学习框架,有效应对感知噪声和遮挡问题。其在模拟和实际环境中的优异表现,推动了自主无人机在复杂环境中的应用前沿,为未来自主追捕、搜索与救援等任务提供了技术基础。该方法的可扩展性和无需重训练的特性,极大提升了多智能体系统的实用性和部署效率,具有重要的理论和工程价值。

技术贡献

本研究提出了PSTO表示,结合空间对齐和预测机制,有效融合障碍几何与对手、队友运动意图,突破了传统几何特征依赖的限制。采用端到端深度强化学习策略,实现从原始LiDAR数据到连续控制的直接映射,避免中间状态估计误差。引入多目标奖励设计,兼顾追捕效率与安全,结合MAPPO算法,提升多智能体协作能力。系统具备良好的规模泛化能力,且在真实环境中验证了其零样本迁移能力,代表了多智能体自主追捕的技术前沿。

新颖性

首次提出基于PSTO的端到端多无人机追捕框架,直接从LiDAR感知映射控制策略,避免了对几何特征和全局状态的依赖。该方法融合预测意图与环境几何,显著提升了复杂环境中的鲁棒性和效率。与以往多智能体强化学习多依赖简化状态或手工特征不同,本研究实现了感知到控制的完整端到端学习,开创了多无人机自主追捕的新范式。

局限性

  • 当前方法依赖于通信共享队友的状态信息,若通信中断或延迟,可能影响协作效果。
  • 在极端复杂环境或极高速目标追捕中,感知误差和预测偏差可能导致策略失效。
  • 训练过程依赖大量模拟数据,实际部署时仍需考虑环境差异和迁移问题。

未来方向

未来将探索更鲁棒的感知融合机制,减少对通信的依赖,提升在极端环境中的表现。计划引入自适应预测模型和多模态感知,增强系统的泛化能力。同时,将扩展到多目标追捕和多任务协作场景,推动端到端深度强化学习在实际无人机系统中的广泛应用。

AI 总览摘要

在无人机自主追捕任务中,传统方法多依赖于精确的状态估计或几何特征,难以应对复杂环境中的感知噪声和遮挡问题。本文提出了一种创新的端到端多智能体强化学习框架,核心是构建Predictive Spatio-Temporal Observation(PSTO)表示,将障碍几何、对手和队友的运动意图通过固定分辨率的球面投影融合,提供丰富的环境感知信息。

该方法利用双流卷积网络,从原始LiDAR点云直接映射连续控制指令,避免了中间状态估计误差,显著提升了追捕效率和鲁棒性。训练采用MAPPO算法,结合中心化训练与去中心化执行策略,设计多目标奖励函数,兼顾追捕速度、安全和队形保持。模拟实验中,在2v1追捕任务中成功率达100%,平均捕获时间为125步,优于传统启发式方法。更重要的是,该策略在不同队伍规模(3、6、9)中表现出良好的扩展性,无需重新训练。

在真实环境中,四旋翼队伍仅依赖机载LiDAR和计算,实现了零样本的追捕任务,验证了系统的实用性和鲁棒性。这一突破为自主无人机在复杂环境中的应用提供了新思路,展现了端到端深度强化学习在多智能体协作中的巨大潜力。未来,研究将继续优化感知融合、减少通信依赖,并扩展多目标、多任务场景,推动无人机自主追捕技术的产业化落地。

深度分析

研究背景

无人机自主追捕技术经历了从传统几何规划到基于学习的智能控制的演变。早期方法如差分游戏和Voronoi划分依赖精确状态信息,难以应对感知噪声。近年来,深度强化学习在单一自主飞行中表现出色,但多智能体协作仍受限于状态估计和特征提取的复杂性。多智能体强化学习(MARL)逐步突破,但多数依赖简化状态或手工特征,缺乏端到端感知控制能力。本研究结合深度学习和预测机制,首次实现从原始LiDAR数据到多无人机追捕的端到端策略,填补了现有技术的空白。

核心问题

多无人机追捕任务面临感知不确定性、遮挡和动态目标的挑战。传统方法依赖全局状态或几何特征,难以应对复杂环境中的噪声和遮挡,限制了其鲁棒性和扩展性。实现高效、鲁棒的自主追捕,需解决感知信息的高维性、动态目标预测以及多智能体协作的难题。如何在没有全局信息的情况下,利用原始传感器数据实现端到端控制,成为核心难题。

核心创新

提出基于PSTO的感知表示,将障碍几何、对手和队友的运动意图融合于固定分辨率的球面投影中,增强环境理解。采用端到端深度强化学习,直接从LiDAR点云映射连续控制指令,避免中间状态估计误差。引入多目标奖励,兼顾追捕效率、安全和队形保持,提升多智能体协作能力。系统具有良好的规模泛化能力,能在不同队伍规模下无缝部署,显著优于传统方法和现有MARL框架。

方法详解

  • �� 构建Dec-POMDP模型,定义多追捕者的局部观测和动作空间。• 设计PSTO表示,将LiDAR点云、对手预测和队友状态投影到固定球面网格,融合环境几何与运动意图。• 利用双流卷积网络处理PSTO,提取环境特征。• 采用MAPPO算法,训练去中心化策略,结合中心化critic优化。• 设计多目标奖励,包括追捕速度、队形保持、安全距离和时间惩罚。• 采用逐步训练策略,逐渐增加任务难度和队伍规模,确保策略稳健。

实验设计

在NVIDIA Isaac Sim中进行大量模拟训练,环境包括静态障碍和动态目标。采用域随机化增强迁移能力。评估指标包括成功率和平均捕获时间,比较传统启发式方法和多种ablation变体。实验证明,提出方法在不同密度和速度条件下均表现优异,成功率超过94%,且在真实环境中实现零样本追捕,验证了系统的实用性。

结果分析

在模拟中,2v1追捕成功率达100%,平均捕获时间125步,优于启发式方法。多队伍规模(3、6、9)中,成功率保持在95%以上,显示良好的扩展性。ablation分析显示,PSTO的空间对齐和预测机制是性能提升的关键。实地飞行验证中,四旋翼队伍在复杂环境中实现了自主追捕,验证了系统的鲁棒性和实用性。

应用场景

该技术可应用于搜救、安防和军事领域的自主追捕任务。只需配备LiDAR和计算平台,无需依赖外部基础设施,便可在复杂环境中自主行动。未来可扩展到多目标、多任务协作,推动无人机自主系统的产业化。

局限与展望

当前模型依赖通信共享队友状态,若通信中断会影响协作效果。感知误差和预测偏差在极端环境下可能导致策略失效。训练依赖大量模拟数据,实际部署时需考虑环境差异和迁移问题。未来需优化感知融合和鲁棒性,以应对更复杂场景。

通俗解读 非专业人士也能看懂

想象你在玩一款多人合作的游戏,你的目标是追捕一个藏在迷宫中的小偷。你和队友都只能用手中的望远镜(LiDAR)看到周围的环境,不能直接看到小偷的全貌。每个人都根据自己看到的部分,猜测小偷可能的位置和运动方向,然后决定怎么行动。你们需要不断调整位置,避免碰撞,同时合作包围小偷。这个过程就像用一张特殊的地图(PSTO)把所有信息融合在一起,帮助你们更聪明地追捕。系统通过学习如何根据有限信息做出最优决策,就像训练一只聪明的猎犬,能在复杂环境中找到目标。

简单解释 像给14岁少年讲一样

想象你和朋友在玩捉迷藏,你们都在一个大房子里,但只能看到自己面前的一小块地方。你们要找到藏起来的小偷,但不能直接看到他,只能猜测他可能在哪个房间,然后一起行动。你们每个人都用自己的“眼睛”——比如望远镜——观察环境,然后用一种特殊的地图,把所有的线索放在一起,帮你们判断小偷可能的运动轨迹。你们还要避免撞到家具或彼此,保持队形。通过不断练习,你们变得越来越聪明,知道怎么合作追捕,即使环境很复杂,也能成功。这就像让无人机用感知和预测,学会在复杂环境中合作追捕目标。

原文摘要

Decentralized cooperative pursuit in cluttered environments is challenging for autonomous aerial swarms, especially under partial and noisy perception. Existing methods often rely on abstracted geometric features or privileged ground-truth states, and therefore sidestep perceptual uncertainty in real-world settings. We propose a decentralized end-to-end multi-agent reinforcement learning (MARL) framework that maps raw LiDAR observations directly to continuous control commands. Central to the framework is the Predictive Spatio-Temporal Observation (PSTO), an egocentric grid representation that aligns obstacle geometry with predictive adversarial intent and teammate motion in a unified, fixed-resolution projection. Built on PSTO, a single decentralized policy enables agents to navigate static obstacles, intercept dynamic targets, and maintain cooperative encirclement. Simulations demonstrate that the proposed method achieves superior capture efficiency and competitive success rates compared to state-of-the-art learning-based approaches relying on privileged obstacle information. Furthermore, the unified policy scales seamlessly across different team sizes without retraining. Finally, fully autonomous outdoor experiments validate the framework on a quadrotor swarm relying on only onboard sensing and computing.

cs.RO