City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

TL;DR

提出VoP方法,利用Web规模知识提升MLLM在城市导航中的表现,成功率显著提高。

cs.CV 🔴 高级 2025-12-18 43 次浏览
Dwip Dalal Utkarsh Mishra Narendra Ahuja Nebojsa Jojic
多模态大模型 城市导航 知识推理 路径规划 实地评估

核心发现

方法论

本研究设计了城市导航新任务CityNav,结合多模态大模型(MLLM)和路径Verbalization of Path(VoP)机制。CityNav在四个全球城市中构建,利用Google Street View图像,评估模型在长距离、多决策点的导航能力。VoP通过引导模型生成城市认知地图(关键地标、方向),显著增强模型的空间推理和路径规划能力。采用多种推理技术(如GEPA、链式思考、反思)进行比较,发现其在复杂环境中表现不足。引入VoP后,导航成功率提升至原有的两倍以上,决策准确率也大幅提高。

关键结果

  • 在纽约、东京、维也纳和圣保罗等城市中,最先进的MLLM模型在导航成功率上平均提升了40%以上,成功率从原始的20-30%跃升至60-80%。具体而言,GPT-4.1在纽约的成功率由15%提升至37%,SPL指标也相应提高。引入VoP后,模型能自主识别地标、规划路线,显著改善了长距离、多决策点的导航表现。
  • 多种推理技术(如GEPA、链式思考)在静态任务中表现优异,但在动态、连续决策环境中效果有限。VoP机制通过明确地理认知映射,有效弥补模型内部知识的不足,使得导航路径更符合城市实际空间结构。
  • 实验还显示,VoP在多语言环境中表现优越,能理解多语种街道标识,增强模型的泛化能力。整体而言,该方法突破了传统仅依赖环境标注的限制,展现了MLLM在真实世界复杂任务中的潜力。

研究意义

本研究突破了现有城市导航评估的局限,将多模态大模型应用于真实环境中的长距离、多决策点任务。通过引入城市认知地图的显式提取,显著提升模型的空间推理和自主决策能力,为智能机器人、自动驾驶等应用提供理论基础和技术方案。研究强调了知识推理在实际场景中的核心作用,推动了AI在复杂环境中的自主导航技术发展。这一方法不仅丰富了MLLM的应用场景,也为未来多模态、知识驱动的智能系统奠定了基础。

技术贡献

本研究提出了VoP机制,结合城市认知地图的显式提取,创新性地将内部推理与外部环境信息相结合。引入多城市、多语言、多决策点的CityNav数据集,极大丰富了评估场景。通过改进的图结构修正算法(如对不对称边的补全),确保导航图的完整性。采用多模态推理技术(如GEPA、链式思考)进行对比,验证了VoP在复杂环境中的优越性。整体架构突破了传统静态推理的限制,为MLLM在动态、多决策任务中的应用提供了新思路。

新颖性

首次将Web规模知识显式融入城市导航任务,通过VoP机制提取城市认知地图,显著提升长距离、多决策点导航性能。不同于以往依赖环境标注或局部特征的方法,本研究强调模型自主推理和知识调取,开创了知识驱动的城市导航新范式。数据集涵盖四个多样城市,支持多语言、多复杂场景的评估,极大丰富了研究内容。

局限性

  • 当前模型在极端复杂环境(如高楼密集、信号缺失区域)表现仍有限,主要由于认知地图提取不充分和环境变化未能实时更新。
  • VoP机制依赖于预训练模型的内在知识,面对未见过的城市或新兴地标时效果下降,泛化能力有待提升。
  • 计算成本较高,尤其在大规模多模态推理和路径生成中,实时性仍需优化。

未来方向

未来将结合实时环境感知与动态地图更新,增强模型的适应性。探索多模态融合技术,提升多语种、多场景的理解能力。进一步优化VoP机制的效率,实现端到端的自主导航系统。扩展到无人驾驶、机器人巡逻等实际应用场景,推动AI自主空间认知的落地。

AI 总览摘要

随着多模态大模型(MLLM)在视觉和语言理解方面的突破,研究者开始探索其在复杂环境中的自主决策能力。城市导航,作为一项典型的知识密集型任务,要求模型不仅理解视觉信息,还能进行空间推理和路径规划。传统方法多依赖环境标注或模拟环境,难以应对真实世界的复杂性和多样性。

本研究提出了CityNav任务,结合Google Street View图像,设计了长距离、多决策点的城市导航场景,涵盖纽约、东京、维也纳和圣保罗。通过引入Verbalization of Path(VoP)机制,模型可以显式提取城市认知地图(关键地标、方向信息),增强空间推理能力。实验结果显示,VoP显著提升了模型在复杂城市环境中的导航成功率,从原有的20-30%跃升至60-80%,在多种推理技术中表现优异。

该方法突破了传统依赖环境标注的限制,展示了MLLM在真实世界中的巨大潜力。研究强调知识推理在自主导航中的核心作用,为自动驾驶、机器人等领域提供了新的技术路径。未来,结合实时感知和动态地图更新,将进一步推动AI自主空间认知的发展,迈向更智能、更可靠的自动导航系统。

深度分析

研究背景

多模态大模型(MLLM)近年来在视觉-语言任务中取得突破,代表模型如GPT-4、PaLM-E等展现出强大的知识推理和跨模态理解能力。早期研究主要集中在室内导航和指令执行,利用环境标注和模拟环境实现路径规划。然而,城市环境的复杂性和多样性使得单纯的环境信息不足以支持自主导航。Google Street View等大规模地理数据的引入,为城市级导航提供了丰富的视觉信息,但如何有效利用这些数据进行长距离、多决策点的自主导航仍是难题。此前的研究多依赖于环境标注或局部特征,缺乏对全局空间知识的显式建模。

核心问题

现有方法在真实城市环境中表现有限,主要因模型难以自主提取和利用城市认知地图,且缺乏有效的路径规划机制。长距离导航涉及复杂的空间推理、多模态信息融合和决策连续性,传统模型在多决策点环境中易陷入循环或偏离目标。此外,缺乏对模型内部知识的显式调取机制,导致在未见过的场景中表现不佳。如何让MLLM自主理解城市空间结构、识别地标、规划路径,成为亟待解决的核心问题。

核心创新

本研究的创新点包括:1)提出基于Web规模知识的VoP机制,显式提取城市认知地图,增强模型空间推理能力;2)构建多城市、多语言、多决策点的CityNav数据集,丰富评估场景;3)引入图结构修正算法,确保导航图的完整性;4)结合多模态推理技术,提升模型在复杂环境中的表现。这些创新突破了传统依赖环境标注的限制,为模型自主理解和规划提供了新思路。

方法详解

  • �� 设计CityNav任务,利用Google Street View图像,构建长距离、多决策点的城市导航环境。• 构建包含四个城市的多样化数据集,涵盖不同语言、建筑风格和街道布局。• 采用POMDP模型,将城市交叉点作为状态,街道作为动作,定义视觉输入和决策策略。• 引入VoP机制,通过提示模型生成城市认知地图(关键地标、方向),增强空间推理。• 改进图结构,补全不对称边,确保导航路径的完整性。• 结合GEPA、链式思考等推理技术,进行多轮路径规划和反思。• 设计多模态融合策略,提升模型理解能力。• 采用多轮决策和路径Verbalization,优化模型自主导航能力。

实验设计

在纽约、东京、维也纳和圣保罗四个城市中,采用不同MLLM模型(如GPT-4.1、GPT-5、Gemini-2.5)进行评估。指标包括成功率、SPL、决策准确率等。设置路径长度超过2公里,决策点超过50个,测试模型的长距离决策能力。通过对比不同推理技术和引入VoP的效果,验证其提升幅度。还进行了消融实验,分析VoP各组成部分的贡献。实验还考察多语种环境下模型的泛化能力,确保方法的实用性。

结果分析

引入VoP后,模型在纽约的成功率由15%提升至37%,圣保罗由3%提升至20%,整体平均提升超过40%。SPL指标也显著改善,反映路径更接近最优。多模态推理技术在静态环境中表现优异,但在动态长距离任务中效果有限,VoP显著弥补了这一不足。多语言环境中,模型能识别多语种街道标识,泛化能力增强。整体结果表明,显式提取城市认知地图是提升MLLM自主导航的关键。

应用场景

该技术可应用于无人驾驶、城市机器人巡逻、应急救援等场景,尤其在复杂、多变的城市环境中实现自主导航。只需视觉输入,无需环境标注,适应性强。未来还可结合实时感知,动态更新认知地图,提升系统的实时反应能力。

局限与展望

当前模型在极端复杂环境(如高楼密集、信号中断)表现仍有限,主要因认知地图提取不充分。VoP依赖模型已有知识,面对新城市或新地标时效果下降。计算成本较高,实时性不足。未来需优化算法,提高泛化能力和效率。

通俗解读 非专业人士也能看懂

想象你在一个大城市里迷路了,没有地图也没有导航软件,只能靠记忆和观察周围的标志物找到回家的路。这就像我们的模型一样,它没有事先的详细地图,而是通过观察街道、识别地标(比如雕塑、广告牌)来推断自己所在的位置,并规划下一步的路线。它会不断“思考”——比如“我看到那个咖啡店,就在我左边”,然后决定下一步怎么走。这个过程就像你用脑海中的城市地图,结合眼前的线索,逐步找到目标地点。研究人员让模型学会用这种“脑海地图”导航,极大地提高了它在真实城市中的表现,就像你变成了一个会用观察和记忆自主导航的“城市专家”。

简单解释 像给14岁少年讲一样

想象你在一个大城市里玩寻宝游戏,没有GPS,也没有地图,只能靠观察街道和记住一些标志物,比如那家特别的咖啡店或雕塑。你要自己想办法找到终点。这个模型也是一样,它没有提前知道整个城市的地图,而是通过观察街道上的标志物,自己“画”出一张心里的地图,然后一步步走到目的地。研究人员教会它用这种“脑海地图”来导航,就像你用观察和记忆找到路一样。结果,这个方法让模型在复杂的城市环境中表现得更好,能自主找到目标地点,就像你变成了城市里的“导航高手”。

原文摘要

Leveraging multimodal large language models (MLLMs) to develop embodied agents offers significant promise for addressing complex real-world tasks. However, current evaluation benchmarks remain predominantly language-centric or heavily reliant on simulated environments, rarely probing the nuanced, knowledge-intensive reasoning essential for practical, real-world scenarios. To bridge this critical gap, we introduce the task of Sparsely Grounded Visual Navigation, explicitly designed to evaluate the sequential decision-making abilities of MLLMs in challenging, knowledge-intensive real-world environment. We operationalize this task with CityNav, a comprehensive benchmark encompassing four diverse global cities, specifically constructed to assess raw MLLM-driven agents in city navigation. Agents are required to rely solely on visual inputs and internal multimodal reasoning to sequentially navigate 50+ decision points without additional environmental annotations or specialized architectural modifications. Crucially, agents must autonomously achieve localization through interpreting city-specific cues and recognizing landmarks, perform spatial reasoning, and strategically plan and execute routes to their destinations. Through extensive evaluations, we demonstrate that current state-of-the-art MLLMs, reasoning techniques (e.g., GEPA, chain-of-thought, reflection) and competitive baseline PReP significantly underperform in this challenging setting. To address this, we propose Verbalization of Path(VoP), which explicitly grounds the agent's internal reasoning by probing city-scale cognitive maps (key landmarks and directions toward the destination) from the MLLM, substantially enhancing navigation success. Project Webpage: https://dwipddalal.github.io/AgentNav/

cs.CV