FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks

TL;DR

FlexVLN以LLM规划器和指令跟随器协同,实现跨REVERIE、SOON、CVDN-target的零微调泛化。

cs.CV 🔴 高级 2025-03-18 22 次浏览
Siqi Zhang Yanyuan Qiao Qunbo Wang Longteng Guo Zhihua Wei Jing Liu
视觉语言导航 大语言模型 跨数据集泛化 分层规划 具身智能

核心发现

方法论

FlexVLN采用分层架构:LLM Planner依据指令、历史和视觉描述生成细粒度引导;Instruction Follower执行低层动作;Object Locator在终点寻找目标物体。InternVL与Faster R-CNN完成感知,Qwen2-VL验证引导可行性,BEVBert、GridMM、ScaleVLN组成集成跟随器,冲突时由GPT-4o-mini裁决。

关键结果

  • 论文在REVERIE、SOON和CVDN-target上进行域外测试,并报告FlexVLN大幅超过既有方法,达到接近目标数据集专门训练模型的表现;但所给正文未提供表格中的具体数值,不能可靠补充百分比或分数。
  • 与直接让NavGPT、DiscussGPT或MapGPT逐步选择邻居节点不同,FlexVLN让LLM指定语义目的地,再由专门模型执行,因此缓解同方向节点难区分和绕障偏航问题。
  • 系统仅在一段引导执行完毕后再次调用LLM,而非每个时间步调用;三模型动作一致时直接执行,冲突时才请求GPT-4o-mini,从而兼顾执行精度与调用效率。

研究意义

该研究把VLN的“理解不同指令”和“稳定移动执行”拆开处理,回应了传统模型必须按数据集单独训练的长期痛点。其价值不仅在于提高REVERIE、SOON、CVDN-target之间的迁移能力,也展示了通用LLM与领域导航模型互补的工程范式,为家庭机器人、服务机器人在训练后面对新任务提供了可行路线。

技术贡献

核心贡献包括五步闭环:环境感知、LLM规划、MLLM可行性验证、集成执行和目标定位。论文将OOD指令约束为R2R风格动作短语,并用反馈驱动重新规划;将BEVBert、GridMM、ScaleVLN的共识作为默认动作,将LLM保留给冲突决策。相比纯LLM逐步选节点或单一监督模型,该设计同时降低幻觉、路径偏离和LLM调用频率。

新颖性

论文声称首次在无需目标域额外训练或微调的前提下,系统性处理不同VLN任务的指令类型泛化。其根本创新不是让LLM替代导航模型,而是让LLM负责跨域语义规划,让已训练的Instruction Follower负责可靠执行,并通过Qwen2-VL验证和多模型仲裁形成安全闭环。

局限性

  • 实验正文摘录没有给出具体性能表、调用次数、延迟或成本,因此无法判断不同模块的定量贡献。
  • 系统依赖InternVL、Qwen2-VL、GPT-4o-mini、Faster R-CNN及三个导航模型,推理链较长;感知错误、错误规划和LLM幻觉仍可能触发反复重规划。
  • 评测集中于离散模拟器和高层指令,真实机器人中的连续控制、动态障碍和开放世界物体交互尚未验证。

未来方向

后续可报告完整消融、延迟与token成本,并研究小型本地模型替代云端LLM。还应扩展到连续环境、动态人机共存场景、多语言指令和真实机器人,通过不确定性估计、可学习验证器及长期记忆减少错误规划与循环探索。

AI 总览摘要

视觉语言导航希望让机器人听懂人话、看懂环境并抵达目标。R2R强调逐步路线,RxR强调长篇多语言指令,CVDN采用对话,REVERIE与SOON则要求寻找远处物体。现有监督模型通常依赖目标数据集微调;纯LLM方法虽有泛化能力,却常需逐步决策、成本高,还可能分不清同一朝向的不同节点或在绕障时偏离路线。

FlexVLN提出分层协作方案。InternVL把四个90度视角整理成场景描述,Faster R-CNN识别3米内物体;LLM Planner结合原指令、导航历史和当前位置,生成限定于R2R动作空间的细粒度引导。Qwen2-VL检查引导是否可行,不可行便反馈并重新规划。可行后,BEVBert、GridMM、ScaleVLN执行低层动作;三者一致便直接行动,冲突时由GPT-4o-mini选择。到达后,Object Locator寻找目标。

在REVERIE、SOON和CVDN-target的域外测试中,论文报告FlexVLN显著超过此前方法,并接近在目标域专门训练的模型;但提供文本未列出具体分数。其主要意义是把LLM的跨域推理与监督模型的动作可靠性结合起来,并减少逐步LLM调用。局限包括多模型推理成本、对视觉描述质量的依赖,以及缺少真实机器人和动态环境验证。

深度分析

研究背景

VLN从R2R的逐步指令发展到RxR多语言、CVDN对话、REVERIE和SOON目标物体导航。BEVBert、GridMM、ScaleVLN等监督方法提升了域内性能,但通常需要按数据集训练。NavGPT、DiscussGPT和MapGPT利用LLM增强泛化,却存在低层动作不稳定、调用昂贵和空间辨识不足的问题。

核心问题

给定指令I、当前位置、四向视觉观察和历史,智能体需在图G={V,E}中移动并找到目标。难点是不同数据集的语言粒度和任务目标差异大;LLM缺少精确节点与可通行性知识,监督模型又难理解域外高层指令,因此需要同时解决语义迁移、路径执行和幻觉控制。

核心创新

  • �� 分层规划:LLM只生成下一语义目的地和细粒度引导,不直接逐步选节点。
  • �� 可行性验证:Qwen2-VL依据目标方向视觉检查“穿过关闭的门”等错误。
  • �� 集成执行:BEVBert、GridMM、ScaleVLN共识执行,冲突时由GPT-4o-mini裁决。
  • �� 闭环反馈:执行轨迹回写历史,直到Planner输出“Finished!”。

方法详解

  • �� 感知:每节点采集0°、90°、180°、270°四个90°视角;InternVL生成场景和位置描述,Faster R-CNN结合深度识别3米内物体。
  • �� 规划:输入指令I、历史H和观察Ot,LLM在“go forward、turn left/right、go into”等动作空间中输出引导。
  • �� 验证:Qwen2-VL检查引导方向与画面是否可行;失败则携带原因回到规划。
  • �� 执行:三个模型逐步预测动作;一致则执行,冲突则由GPT-4o-mini从六类方向短语中选择。
  • �� 收尾:完成引导后更新历史,Planner判断是否到达;Object Locator负责最终物体定位。

实验设计

论文以REVERIE、SOON、CVDN-target作为域外数据集,强调不使用目标域额外训练或微调,并与此前VLN及LLM方法比较。方法组件使用InternVL、Faster R-CNN、Qwen2-VL、BEVBert、GridMM、ScaleVLN和GPT-4o-mini。所给全文摘录未展示具体指标、基线表、消融数字或硬件配置,因此只能确认定性结论,不能补写数值。

结果分析

作者报告FlexVLN在三个域外基准上显著超过既有方法,并接近目标数据集专门训练模型。机制层面,它减少了LLM调用频率,避免直接节点选择造成的朝向歧义,并利用Instruction Follower保持绕障时的路径稳定性。由于实验表缺失,具体SR、RGS或SPL提升幅度无法从提供文本核验。

应用场景

家庭助理可接受“去一楼休息室并打开台灯”这类高层命令,再由Planner拆解、Follower执行。酒店、医院和仓储机器人也可复用已有细粒度导航模型处理新任务。部署前提是可获得多视角视觉、环境拓扑、目标检测和可调用的视觉语言模型。

局限与展望

FlexVLN仍依赖多个大型模型,通信延迟和API成本可能限制实时部署。错误场景包括视觉描述幻觉、不可见障碍、目标物体不存在及反复重规划。当前验证主要在离散VLN模拟器完成,未覆盖连续控制、动态行人、触碰交互和真实传感器噪声。未来应加入成本感知调度、置信度校准、小模型蒸馏和真实机器人评测。

通俗解读 非专业人士也能看懂

把FlexVLN想成一家大型餐厅。顾客用不同说法点菜:有人给出完整步骤,有人只说“去后厨拿一份汤”,还有人通过对话说明。普通厨师只熟悉一种菜单格式,换餐厅就容易出错;纯粹让经理每一步指挥,也会很慢,而且可能把不存在的通道当成真实通道。

FlexVLN让经理负责理解顾客真正想要什么,并把任务改写成厨房熟悉的短指令,例如“向前走、左转、进入房间”。一名检查员先看现场照片,确认这条指令不会要求穿墙或走进关着的门。确认后,三位熟练员工共同执行;若三人意见一致,就立即行动,若意见不同,再请经理裁决。

这样,经理不用每走一步都发号施令,员工也不必理解所有复杂表达。它的优点是既能听懂新说法,又能稳定完成熟悉动作。不过,如果照片看错、经理判断错,或者员工和经理都依赖网络,系统仍会变慢或走错。

简单解释 像给14岁少年讲一样

想象你在一个陌生商场玩寻宝游戏。朋友可能说:“去一楼休息区,找到一盏灯。”这不是“前进三步、左转一次”那种详细攻略。只会执行固定攻略的机器人会懵;只让聊天机器人每一步决定走哪个路口,又可能把两个看起来一样的路口搞混。

FlexVLN像一个小队:LLM Planner是会读懂任务的队长,先把大目标拆成“去楼梯、上楼、进入休息区”这样的短指令;Instruction Follower是熟悉商场路线的队员,负责真正移动。InternVL帮助描述周围环境,Qwen2-VL检查队长有没有说出不可能的路线,比如穿过关闭的门。

执行时还有三名队员一起判断方向:BEVBert、GridMM和ScaleVLN。三人都说左转,就左转;如果意见不一致,就问GPT-4o-mini。走完一段路后,队长再看新情况并安排下一段,而不是每一步都插手。

这就像把“聪明的计划”和“稳定的操作”分工合作。论文在REVERIE、SOON、CVDN-target上报告了很强的跨任务表现,但没有在提供的文字中给出具体分数。未来还要看看它能否在真实、拥挤、会移动的环境里可靠工作。

术语表

Vision-and-Language Navigation(视觉语言导航)

机器人根据自然语言和视觉观察移动到目标地点并完成任务。它同时要求语言理解、环境感知和动作执行。

论文研究的核心任务,覆盖R2R、REVERIE、SOON等数据集。

LLM Planner(大语言模型规划器)

利用语言模型推理任务目标、历史和环境,并生成下一阶段计划。它擅长跨域理解,但可能产生幻觉。

FlexVLN中负责把域外高层指令改写为细粒度引导。

Instruction Follower(指令跟随器)

根据细粒度语言指令预测导航动作的专门模型。它执行能力强,但通常受训练数据风格限制。

由BEVBert、GridMM和ScaleVLN集成构成。

OOD instruction(域外指令)

与训练数据中的语言形式或任务类型不同的新指令。它会导致专门模型性能下降。

REVERIE、SOON和CVDN-target被用来评估此类泛化。

MLLM verification(多模态大模型验证)

同时理解图像和文字,以判断计划是否符合当前视觉环境。其作用是拦截不可执行或不合理指令。

Qwen2-VL在规划后检查可行性。

Object Locator(目标定位器)

在导航停止后,从当前位置观察中识别指令指定的物体。它区别于只负责移动的导航模块。

FlexVLN的第五步,用于REVERIE和SOON等目标物体任务。

开放问题 这项研究留下的未解疑问

  • 1 论文文本未给出完整实验表,因此各模块对SR、SPL、RGS和调用成本的独立贡献仍不清楚,需要公开可复现实验。
  • 2 系统如何在动态行人、遮挡、视觉噪声和连续控制下保持规划稳定,现有离散模拟器结果无法回答。
  • 3 多模型和云端LLM的延迟、费用及隐私影响尚未量化,仍需研究本地小模型和自适应调用策略。

应用场景

近期应用

家庭服务机器人

用户可用自然语言提出“去厨房拿杯子”之类高层任务。FlexVLN负责拆解路线,现有导航模型负责执行;前提是室内地图、视觉输入和目标物体检测可用。

酒店与医院配送

机器人可把房间、楼层和物体目标结合起来,在面对不同部门的表达方式时减少重新训练。需要稳定的拓扑地图、电梯或楼梯建模,以及安全的可行性验证。

远期愿景

通用具身任务接口

未来可把LLM作为跨任务语义接口,把导航、取物、交互等能力连接起来。主要障碍是实时性、真实世界安全、长期记忆和对未见物体的可靠推理。

原文摘要

The aspiration of the Vision-and-Language Navigation (VLN) task has long been to develop an embodied agent with robust adaptability, capable of seamlessly transferring its navigation capabilities across various tasks. Despite remarkable advancements in recent years, most methods necessitate dataset-specific training, thereby lacking the capability to generalize across diverse datasets encompassing distinct types of instructions. Large language models (LLMs) have demonstrated exceptional reasoning and generalization abilities, exhibiting immense potential in robot action planning. In this paper, we propose FlexVLN, an innovative hierarchical approach to VLN that integrates the fundamental navigation ability of a supervised-learning-based Instruction Follower with the robust generalization ability of the LLM Planner, enabling effective generalization across diverse VLN datasets. Moreover, a verification mechanism and a multi-model integration mechanism are proposed to mitigate potential hallucinations by the LLM Planner and enhance execution accuracy of the Instruction Follower. We take REVERIE, SOON, and CVDN-target as out-of-domain datasets for assessing generalization ability. The generalization performance of FlexVLN surpasses that of all the previous methods to a large extent.

cs.CV cs.RO