核心发现
方法论
本文设计了基于Unreal Engine 5和Cosys-AirSim的仿真平台,构建了涵盖五个真实场景的120个任务,涉及报告、巡逻、检测和操控四类任务。每个任务由自然语言指令引导,模型需自主规划路径、调整视角、执行任务。采用闭环评估框架,结合模型的egocentric观察和动作历史,评估其任务完成度。模型输入包括连续三帧RGB图像和动作历史,输出结构化响应,包括目标定位、推理、动作指令和完成标志。模型不进行任务特定微调,纯零样本测试。评估指标包括成功率、任务进展、最优成功率、碰撞率和步骤效率。对比22个开源和闭源MLLM,发现最大模型成功率不足35%,远低于人类84.4%的水平,显示多步长时任务仍极具挑战。模型规模越大,表现越优,验证了规模扩展带来的能力提升。分析指出,任务级能力需协调空间感知、多步规划和动态推理,超越单一感知能力。
关键结果
- 最强模型Gemini 3.1 Pro成功完成任务比例为34.8%,显著优于其他模型,且任务进展达73.3%。模型成功率远低于人类84.4%,显示当前模型在复杂长时任务中仍有巨大差距。
- 模型规模与性能正相关,Gemini 3.1 Pro较其前身Flash Lite提升显著,GPT-5.4模型在任务完成度和成功率方面也表现优异,验证了规模扩展的有效性。
- 模型在不同任务类型(报告、巡逻、操控、检测)中的表现差异明显,尤其在操控和报告任务中成功率最低,反映出多能力融合的难度。
研究意义
该研究首次系统评估了通用大模型在无人机长时任务中的零样本能力,揭示了模型在多步骤、多能力协调方面的不足。推动了AI在自主无人系统中的应用前沿,强调规模扩展虽能提升能力,但也带来可靠性和安全性风险,为未来自主AI系统的设计提供重要参考。
技术贡献
提出基于深度仿真平台的任务级评估框架,结合自然语言指令、闭环控制和多任务指标,突破了传统路径导航的局限。通过分析模型规模与性能关系,验证了大规模通用模型的潜力。引入多能力协调的任务理解机制,为自主AI的长时任务执行提供新思路。
新颖性
首次在无人机仿真环境中,系统性评估了未微调的多模态大模型在多任务、多场景下的零样本长时任务能力,强调模型规模对任务级能力的促进作用,填补了现有无人机自主评估的空白。
局限性
- 模型在复杂场景中的鲁棒性不足,容易因感知误差或规划失误偏离目标,导致任务失败。
- 评估仅在仿真环境中进行,实际应用中可能面临传感器噪声、环境变化等挑战。
- 模型对长距离、多目标任务的规划能力仍有限,未来需结合强化学习或微调优化。
未来方向
未来将结合强化学习和任务微调,提升模型在真实环境中的鲁棒性和效率。探索多模态感知融合与多目标任务规划,推动自主无人机在复杂场景中的应用。同时,研究模型的安全性和可靠性,确保其在实际部署中的稳定性。
AI 总览摘要
本研究提出了MissionBench,一套面向无人机长时任务的任务级评估基准,利用高仿真环境模拟120个多任务场景,涵盖报告、巡逻、操控和检测四类任务。该平台基于Unreal Engine 5和Cosys-AirSim,支持连续4自由度控制,强调自然语言指令引导下的自主规划与执行。通过闭环评估框架,模型需在无微调条件下,理解任务、规划路径、调整视角、完成目标。实验涵盖22个不同的多模态大模型,结果显示最大成功率不足35%,远低于人类84.4%的表现,凸显无人机长时自主任务的巨大挑战。模型规模越大,表现越优,验证了规模扩展带来的能力提升。分析指出,任务级能力超越单一感知,需多能力协同,包括多步规划、动态推理和环境适应。这一发现推动了自主AI在无人系统中的应用,但同时也提示规模化带来的可靠性和安全风险。未来工作将结合强化学习和微调技术,提升模型在真实场景中的表现,推动自主无人机的智能化发展。
深度分析
研究背景
无人机自主导航与任务执行近年来成为AI研究热点,早期工作如Visual SLAM、路径规划算法(如A*、RRT)解决了静态环境中的路径问题。随后,深度学习模型如深度强化学习(DQN、PPO)被引入提升自主决策能力。多模态大模型(MLLM)结合视觉和语言能力,推动无人机在复杂场景中的理解与交互。现有基准多集中于路径跟踪或目标搜索,缺乏对长时、多任务场景的系统评估。随着模型规模扩大,表现逐步提升,但在空间推理、多目标协调等方面仍存在瓶颈。
核心问题
核心问题在于,现有模型难以在无人机长时任务中实现自主规划、视角调整和多任务协调,尤其在未微调的情况下。长距离、多目标、多能力融合的复杂性使得模型在实际应用中表现不稳定,亟需系统化的任务级评估框架以量化模型能力和不足。
核心创新
本研究创新在于:1)提出基于深度仿真的任务级评估平台,支持连续4自由度控制和多任务指标;2)设计闭环评估框架,结合自然语言指令和模型推理能力;3)系统性分析模型规模与性能关系,验证大模型在无人机长时任务中的潜力。这些创新突破了传统路径导航的限制,推动了自主无人系统的智能化发展。
方法详解
- �� 构建高仿真环境:利用Unreal Engine 5和Cosys-AirSim模拟五个真实场景,确保环境多样性和复杂性。
- �� 任务设计:每个任务由自然语言指令引导,涵盖报告、巡逻、操控和检测,目标对象在环境中预置。
- �� 模型输入:连续三帧egocentric RGB图像和动作历史,输出结构化响应,包括目标定位、推理、动作指令和完成标志。
- �� 控制机制:模型选择8个方向性动作(前、后、左右、上下、转向),每次动作可调节距离或角度,支持连续控制。
- �� 评估指标:成功率、任务进展、最优成功率、碰撞率和步骤效率,全面衡量模型性能。
- �� 实验流程:在不同模型(开源和闭源)上进行三次重复,统计平均表现,分析模型规模与性能关系。
实验设计
采用五个高仿真环境,设计120个任务,分为训练集和测试集。模型无微调,使用API接口进行推理。评估指标包括成功率(SR)、任务进展(MP)、最优成功率(OSR)、碰撞率(CR)和步骤效率(Eff)。对比不同规模模型(如Gemini、GPT-5.4、Qwen系列)表现,分析模型规模对能力的影响。还进行了模型微调和不同任务类型的性能分析,验证模型在复杂场景中的表现差异。
结果分析
最大模型Gemini 3.1 Pro成功率为34.8%,明显优于其他模型,且模型规模越大,性能越好。模型在报告和操控任务中的成功率最低,反映多能力融合难度。模型表现远低于人类(成功率84.4%),但规模扩展带来显著提升,验证了大模型在无人机长时任务中的潜力。模型在不同环境和任务类型中的表现差异,揭示了多能力协调的关键挑战。
应用场景
该平台可用于开发自主无人机系统,提升其在搜索、巡逻、检测等复杂任务中的能力。适合军事、安防、环境监测等行业,依赖高仿真训练和评估,减少实际部署风险。未来,结合强化学习和微调,将实现更鲁棒的自主操作。
局限与展望
模型在复杂环境中仍易受感知误差影响,表现不稳定。仿真环境与真实场景存在差异,实际应用中可能遇到环境变化和传感器噪声。此外,长距离、多目标任务的规划能力有限,未来需结合强化学习和微调优化模型性能。
通俗解读 非专业人士也能看懂
想象你在操控一台无人机,就像在玩一款复杂的无人机模拟游戏。你只知道指令,比如“去那边看看”,但没有提前告诉它具体怎么飞。它需要自己决定怎么飞、转向、观察,甚至在途中调整视角,找到目标后再报告。这个过程就像你在玩“寻宝”游戏,游戏里你要自己探索、判断、行动,直到找到宝藏。研究中,科学家用虚拟环境模拟这些任务,让无人机自己学习如何完成复杂的任务,而不用提前告诉它每一步怎么做。结果显示,模型越大、越复杂,表现越好,但仍远远不及人类的水平,就像你玩游戏时,高手比新手强很多。这项工作帮助我们理解,未来的无人机可以更智能、更自主,能在复杂环境中完成各种任务。
简单解释 像给14岁少年讲一样
想象你在操控一架无人机,就像在玩一款超级复杂的飞行游戏。你给它一句话,比如“拍下那辆车的牌照”,但你没有告诉它具体怎么飞、怎么转、怎么观察。它必须自己决定飞多远、转多快、看哪个方向,甚至在飞行中不断调整视角,找到目标后再告诉你结果。这就像你在找丢失的宠物,只有一句提示,你得自己探索、判断、行动,直到找到它。科学家用虚拟的环境模拟这些任务,让无人机自己学习怎么在复杂场景中飞行、观察和报告。结果发现,模型越大、越聪明,表现越接近人类,但还差得远,就像高手和新手的差距。这个研究让我们知道,未来的无人机可以变得更聪明、更自主,能在复杂环境中完成各种任务,就像你在游戏中变成了真正的飞行员一样。
术语表
Multimodal Large Language Model (多模态大模型)
结合视觉和语言能力的深度学习模型,能理解和生成多种模态信息,支持复杂任务执行。
在论文中,MLLM用于无人机自主规划、感知和报告。
闭环评估 (Closed-loop evaluation)
在任务执行过程中,模型根据实时反馈调整行为,确保任务目标的达成。
本文采用闭环框架评估模型在无人机长时任务中的表现。
成功率 (Success Rate, SR)
模型完成任务的比例,反映其整体能力。
用以衡量模型在不同任务中的表现优劣。
任务进展 (Mission Progress, MP)
连续衡量模型向任务目标推进的程度,数值越大越好。
评估模型在任务中的实际操作效率。
最优成功率 (Oracle Success Rate, OSR)
模型在任何时刻接近目标的成功概率,不考虑最终完成。
用以区分导航能力和感知报告能力的瓶颈。
开放问题 这项研究留下的未解疑问
- 1 当前模型在复杂多目标、多环境场景中的鲁棒性仍不足,如何提升模型的环境适应性和抗干扰能力是未来关键。
- 2 仿真环境与真实场景存在差异,如何将仿真中学到的能力迁移到实际无人机中,仍需深入研究。
- 3 多模态融合和长时任务规划的有效机制尚未完全建立,未来需结合强化学习和微调技术优化模型表现。
应用场景
近期应用
自主巡逻与监控
利用大模型实现无人机在城市或边境的自主巡逻,减少人力成本,提高反应速度。需要高质量仿真训练和环境感知能力。
灾害应急响应
在自然灾害中,快速部署自主无人机进行搜救和现场评估,依赖模型的长时自主规划和多目标协调能力。
远期愿景
智能自主无人系统
未来无人机将实现全自主长时任务执行,无需人为干预,广泛应用于环境保护、军事侦察等领域,推动无人系统智能化。
原文摘要
Multimodal Large Language Models (MLLMs) are emerging as core reasoning modules for embodied agents, yet it remains unclear how well general-purpose models can solve long-horizon embodied tasks from a single high-level instruction. We introduce MissionBench, a benchmark for mission-level evaluation of MLLMs in aerial 3D environments. It comprises 120 missions across five simulated 3D environments and four task families. Agents must autonomously plan, navigate, and report outcomes using only egocentric observations and its action history, without aerial-specific fine-tuning. Across 22 open- and closed-source MLLMs, the strongest model succeeds on fewer than 35% of missions compared to 84.4% human performance, highlighting the difficulty of multi-step embodied tasks. Despite large variations between model families, we observe gains from scaling, indicating that larger general-purpose models possess stronger zero-shot embodied capabilities. Our analysis shows that mission-level competence requires coordinating multiple capabilities beyond spatial perception, including multi-step planning and adaptive reasoning. This motivates closed-loop evaluation and highlights both the promise and risk of scaling-driven improvements for embodied AI.