Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching

TL;DR

提出DroneCATS-Agent,基于多模态大语言模型实现无人机自主控制,涵盖命令、追踪、搜索,验证模型在四项核心能力中的表现。

cs.RO 🔴 高级 2026-09-01 70 次浏览
Jaewoo Park Minyoung Lee Sukmin Seo Moonbin Yim Hyunwook Yoon Dohoon Ryu Daehee Kim Myungseo Song Jihyuk Byun Seunggyu Chang Taeho Kil Jiseob Kim Bado Lee Geewook Kim
多模态大模型 无人机控制 视觉-语言-行动 自主代理 基准测试

核心发现

方法论

本文设计了DroneCATS-Agent架构,将多模态大语言模型(MLLM)作为可插拔组件,定义四个核心动作(前进、旋转、思考、完成声明),无需微调或函数调用。通过高层目标指令驱动模型自主决策,结合几何控制器将模型输出转化为飞行指令。评估涵盖approaching、tracking、search和multi-drone commanding四个任务场景,利用DroneCATS基准进行系统性测试,分析模型在不同规模(2B参数)下的表现差异。

关键结果

  • 小模型(2B参数)在approaching任务中成功率达65%,优于部分前沿模型(成功率约50%),但在声明终止时存在提前或未声明的问题。多无人机控制中,小模型表现出盲目复制单一坐标的缺陷,导致任务失败。模型空间感知保持良好,但行动协议执行不足,核心瓶颈在于持续遵守声明协议和正确终止动作的输出。

研究意义

该研究揭示了多模态大模型在自主视觉-行动任务中的潜力与局限,特别是在无人机多目标、多视角控制中的应用。强调模型在空间感知方面的优势与行动协议执行的不足,为未来智能自主系统的设计提供关键参考,推动边缘计算下高效、可靠的自主代理发展。

技术贡献

提出无需微调的高层指令驱动架构DroneCATS-Agent,定义了四个关键动作接口,结合几何控制实现端到端自主控制。创新在于将模型作为决策核心,强调声明协议的持续执行与正确终止,首次系统性评估不同规模模型在多任务、多无人机场景中的表现,提供了模型协议遵循与导航能力的深入分析。

新颖性

首次提出基于大语言模型的端到端无人机自主控制架构,强调模型在视觉感知与行动协议中的角色差异,突破传统系统依赖微调或专用控制器的限制,建立了无需微调的高层决策框架,推动多模态模型在实际自主任务中的应用边界。

局限性

  • 模型在声明终止时表现出明显不足,偏早或偏迟,影响任务成功率,原因在于缺乏持续协议维护能力。
  • 当前系统未充分解决模型在多视角、多目标环境中的盲目复制问题,导致多无人机协调困难。
  • 模型规模限制(2B参数)虽降低计算成本,但在复杂场景中表现仍有限,未来需优化协议执行与推理效率。

未来方向

未来将聚焦于提升模型协议的持续性和鲁棒性,增强多目标、多视角环境中的自主决策能力,探索端到端微调与强化学习结合的方法,优化模型在边缘设备上的推理速度与准确性,推动自主无人机系统的实用化。

AI 总览摘要

本研究提出了DroneCATS-Agent架构,利用多模态大语言模型(MLLM)实现无人机自主控制,涵盖命令执行、目标追踪、搜索和多机编队指挥。传统无人机控制系统多依赖微调或专用控制器,限制了模型的灵活性与泛化能力。本文创新在于将MLLM作为核心决策模块,通过高层指令定义四个基本动作(前进、旋转、思考、声明完成),无需微调或函数调用,极大简化了系统设计。

在技术实现上,模型输出的动作以JSON格式声明,几何控制器将像素点和深度信息转化为飞行轨迹,结合飞控系统实现闭环控制。模型在视觉空间感知方面表现优异,但在行动协议的持续执行和终止声明方面存在明显短板。通过在不同规模(2B参数)模型上的系统性评估,发现小模型在导航能力上优于部分前沿模型,但在任务终止和多机协调中表现不足。

实验结果显示,模型在approaching任务中成功率达65%,在多无人机场景中表现出盲目复制坐标的缺陷,揭示了协议遵循的重要性。该工作不仅推动了多模态模型在自主控制中的应用边界,也为未来边缘计算下高效、可靠的自主代理提供了理论基础。未来将致力于增强模型协议的持续性和鲁棒性,优化多目标、多视角环境中的自主决策能力,推动无人机自主系统的实用化与普及。

深度分析

研究背景

近年来,多模态大语言模型(MLLM)在图像和视频理解方面取得突破(如Liu et al., 2023a; Bai et al., 2023),推动其在机器人自主控制中的应用。早期系统如TypeFly、PIVOT、SPF等,主要依赖外部检测器或点指示,逐步实现无人机的视觉导航能力。然而,这些方法多依赖微调或专用控制器,缺乏端到端的自主决策能力。随着模型规模的扩大和能力提升,研究开始关注模型在复杂场景中的自主性,但仍面临协议执行、终止判断和多目标协调等难题。现有基准多偏重单一任务或有限场景,缺乏统一的闭环评估体系。

核心问题

核心问题在于如何让多模态大模型在无人机自主控制中实现端到端的决策,特别是在多目标、多视角、多无人机环境下保持协议的一致性和执行力。现有系统多依赖外部模块或微调,难以实现灵活泛化。模型在空间感知方面表现良好,但在行动协议的持续遵守和正确终止方面存在明显缺陷,导致任务成功率不足,特别是在多机协作中表现出盲目复制和协调困难。这限制了模型在实际复杂场景中的应用潜力。

核心创新

本研究的创新点在于提出DroneCATS-Agent架构,将模型作为决策核心,定义四个高层动作(前进、旋转、思考、声明完成),无需微调或函数调用,全部在自然语言指令中声明。引入声明协议的持续执行机制,使模型自主判断任务完成与否。系统性评估不同规模模型(2B参数)在多任务、多无人机场景中的表现,首次系统分析模型在协议遵循和空间感知中的差异,突破了传统微调依赖的限制,为自主控制提供了新思路。

方法详解

  • �� 构建DroneCATS-Agent架构,将模型作为决策模块,定义四个动作接口(go、rotate、think、finished)在指令中声明。
  • �� 设计几何控制器,将模型输出的像素点和深度信息转化为飞行轨迹,结合飞控系统实现闭环控制。
  • �� 采用高层指令驱动模型自主决策,模型输出JSON格式动作,无需微调。
  • �� 通过verifier机制评估模型声明的任务完成性,确保自主性。
  • �� 设计四类任务(approaching、tracking、search、multi-drone commanding),在两个地图上进行系统测试。
  • �� 评估模型在不同规模(2B参数)下的表现差异,分析协议遵循与导航能力的关系。

实验设计

采用两个不同场景(住宅区和校园)中的多任务数据集,测试九个不同规模模型(从2B到更大参数量)在80余次单机和20次多机任务中的表现。指标包括成功率、提前或延迟声明比例、协议遵循程度等。还进行了三次方差分析和失败类型分类,验证模型在空间感知与协议执行上的差异。对比微调模型与prompt驱动模型的表现差异,分析模型在多视角、多目标环境中的适应性。

结果分析

小模型(2B参数)在approaching任务中成功率达65%,优于部分前沿模型(成功率约50%),但在声明终止时存在提前或未声明的问题。多无人机控制中,小模型表现出盲目复制坐标的缺陷,导致任务失败。模型空间感知保持良好,但行动协议执行不足,核心瓶颈在于持续遵守声明协议和正确终止动作的输出。模型规模越大,协议遵循越差,反映出模型在持续协议维护上的挑战。

应用场景

该架构适用于自主无人机巡检、搜索救援、环境监测等场景,依赖自然语言指令与视觉感知,减少微调需求,提升系统泛化能力。未来可结合强化学习优化协议执行,增强多机协作效率,推动自主无人机在复杂环境中的应用普及。

局限与展望

模型在声明终止时表现出明显不足,偏早或偏迟,影响任务成功率,原因在于缺乏持续协议维护能力。多视角、多目标环境中存在盲目复制问题,限制多机协调效果。模型规模限制(2B参数)虽降低计算成本,但在复杂场景中表现仍有限,未来需优化协议执行与推理效率。

通俗解读 非专业人士也能看懂

想象你在操控一台智能机器人,它可以看见四周的环境,听懂你的指令,还能自己决定什么时候完成任务。比如,你让它去找一辆白色的车,它会用眼睛(摄像头)观察,然后决定怎么走,什么时候转身,什么时候说“我到了”。但它不是每次都能正确判断自己是否完成了任务,有时候会提前说“我到了”,有时候又会错过目标。这就像你让朋友帮你买东西,他能看到你要的东西,但有时候会提前离开或忘记告诉你任务完成了。这个研究就是在教机器人如何更聪明地自己判断何时完成任务,尤其是在它要控制多个机器人同时行动时。研究发现,小的模型(参数只有2亿)在导航方面还算可靠,但在判断任务结束时容易出错。未来的目标是让机器人不仅能看得准,还能更好地知道自己什么时候真正完成了任务,做到像人一样聪明、可靠。

简单解释 像给14岁少年讲一样

想象你在玩一款超级智能的游戏机器人,它能用眼睛看东西,还能听懂你的指令。比如,你让它去找一辆白色的车,它会用摄像头观察,然后自己决定怎么走、什么时候转身,甚至什么时候说“我找到了”。但这个机器人有个问题,它有时候会太快说“我到了”,其实还没找到目标;有时候又会错过目标。这个研究就像在教这个机器人变得更聪明,能自己判断什么时候任务完成得差不多了,而不是一直等着你告诉它。研究还发现,小模型(参数只有2亿)在导航方面还算不错,但在判断自己是否完成任务时还不够聪明。未来希望这个机器人能像人一样,既能看得准,又能知道自己什么时候真正完成了任务,这样它就可以帮你做更多事情啦!

原文摘要

Multimodal Large Language Models (MLLMs) are strong perceivers of images and video. We ask how far that reach extends into acting: dropping an MLLM directly into a drone's control loop, with its entire action space declared solely in the prompt. Recent systems approach this setting but increasingly narrow the model's decision-making. We widen it back. We introduce DroneCATS-Agent, an architecture where the MLLM is a swappable component, and DroneCATS, a benchmark treating the model as the independent variable. Beyond merely flying toward a pixel, our agent entrusts the model to yaw and search, deliberate when unsure, and self-declare arrival---all without fine-tuning or function-calling schemas. Evaluating frontier and open models across four core capabilities---approaching a visible target, tracking a moving one, searching outside the initial view, and commanding a multi-drone fleet---reveals that even the simplest embodied settings are far from solved. Crucially, to identify what breaks first at the edge, our roster scales down to 2B parameters. The findings expose a stark paradox: it is not the flying that fails. Small open models often navigate into the success radius more reliably than frontier models, yet lose the episode by declaring arrival prematurely or not at all. Multi-drone commanding amplifies this divide, with small models failing by blindly copying a single coordinate across distinct views. Viewed as vision-language-action agents, the models' spatial perception holds up, but their action protocol does not. What separates a deployable edge model from a frontier model is not navigation, but the discipline to sustain a declared protocol and emit the correct terminating action. The open problem is closing this gap at onboard compute costs---yielding a fast model that plans persistently and knows exactly when it is done---and DroneCATS is built to measure that distance.

cs.RO cs.AI