Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search

TL;DR

提出“360°想象”框架,利用概率空间生成空间先验,显著提升人形视觉搜索效率。

cs.CV 🔴 高级 2026-05-10 34 次浏览
Jingdong Zhang Yizhou Wang Zhengzhong Tu Xin Li Wenping Wang Xiaohang Zhan
视觉搜索 空间推理 深度学习 多模态模型 自主探索

核心发现

方法论

该方法引入“想象者”模型,作为空间先验的概率预测器,单步推断观察与未观察区域的语义布局。通过采样多重假设,为行动者提供空间分布,降低对长轨迹链式推理的依赖。训练采用自动伪标签生成,超越传统多步链式推理的标注成本,生成超过196万样本。架构上,Imaginator负责空间预测,Actor依据空间分布执行动作,二者解耦提升效率。实验中,模型在H*Bench等数据集上显著优于单一模型,成功率提升超过30%。

关键结果

  • 在H*Bench测试中,Qwen3-VL 235B模型结合Imaginator后,HOS成功率由23.62%提升至65.04%,HPS由21.44%提升至38.25%,表现优于纯Actor模型。
  • 在多种开源和商业模型上验证,结合空间先验的架构普遍提升性能,尤其在复杂环境中表现更稳健。
  • 消除了对长轨迹链式推理的依赖,利用单步空间预测实现大规模数据自动生成,训练样本达196万,极大降低成本。

研究意义

该研究突破了传统多轮链式推理的瓶颈,提出空间先验的显式建模,有效缓解环境不确定性,推动自主机器人在复杂场景中的应用。其低成本大规模数据生成能力,为未来多模态自主探索提供新思路,具有重要理论和实践价值。

技术贡献

创新点在于引入“Imaginator”模型,作为空间先验的概率生成器,解耦推理与行动,突破单一模型的局限。通过单步预测空间布局,结合采样策略,提升了空间理解的鲁棒性。训练采用自动伪标签,极大扩展数据规模,降低成本。架构兼容多种模型,验证广泛适用性,推动多模态自主探索技术发展。

新颖性

本研究首次将空间想象作为显式的概率预测,突破传统依赖长轨迹链式推理的限制,实现空间推理与行动的解耦,显著提升复杂环境中的搜索效率。这一创新为自主机器人提供了全新的空间理解范式,区别于以往仅依赖隐式推理的方案。

局限性

  • 模型对极端遮挡或动态环境的适应性仍有限,空间先验假设在复杂场景中可能失效。
  • 采样策略虽提升鲁棒性,但在极端不确定性下仍存在误导风险,需进一步优化采样与决策机制。
  • 训练依赖大量伪标签,虽然成本低,但在某些特定场景下可能引入偏差,影响泛化能力。

未来方向

未来将探索多模态融合提升空间推理的准确性,结合强化学习优化搜索策略,并扩展到动态环境和多目标场景,推动自主系统的鲁棒性与智能水平。

AI 总览摘要

在复杂的360°环境中实现高效自主搜索一直是机器人领域的核心挑战。传统方法依赖多轮链式推理,导致数据标注成本高昂且推理效率低下。本文提出“360°想象”框架,通过引入“Imaginator”模型,显式生成空间先验,解耦推理与行动。Imaginator利用单步预测,结合采样多重假设,为行动者提供丰富的空间信息,有效缓解环境不确定性。训练过程中,采用自动伪标签生成技术,扩展了超过196万样本,极大降低了数据成本。实验证明,该方法在H*Bench等公开数据集上表现优异,成功率提升超过30%,在复杂环境中展现出更强的鲁棒性。这一创新不仅突破了传统多轮推理的瓶颈,也为自主机器人在未知环境中的探索提供了新思路。未来,结合多模态信息和强化学习,有望进一步提升系统的智能水平和适应能力。该研究为自主探索技术的发展提供了理论基础和实践路径,具有广泛的应用前景。

深度分析

研究背景

近年来,机器人自主探索逐渐成为研究热点,早期依赖视觉显著性和场景上下文(如Oliva等,2003)实现目标定位。随着多模态大模型(如Wu和Xie,2024)崛起,静态图像理解取得突破,但在动态、三维空间中的主动探索仍受限。人形视觉搜索(HVS)旨模仿人类主动转头、调整视角的行为,解决遮挡和环境复杂性带来的挑战。早期工作如Yu等(2025)提出基于链式推理的连续决策模型,但面临推理成本高、数据标注难题。近年来,空间推理、场景外推、语义布局等技术不断发展,但多依赖像素级重建或隐空间,难以实现高效、可解释的空间理解。

核心问题

核心问题在于如何高效、准确地在高维复杂环境中进行空间推理,尤其是在有限视野下推断未观察区域的布局。传统方法依赖长轨迹链式推理,成本高且易累积误差,难以应对环境的动态变化和遮挡。缺乏显式空间先验模型,导致探索不够主动或误导性强,限制了自主系统在真实场景中的应用。解决这一问题需要引入高效的空间推断机制,降低数据成本,同时提升环境理解的鲁棒性。

核心创新

本研究的创新主要在于引入“Imaginator”模型,将空间想象作为概率生成任务,显式预测观察与未观察区域的语义布局,突破传统隐式推理的局限。通过单步采样多重假设,提供丰富的空间先验信息,增强行动者的决策能力。架构上,推理与行动解耦,降低对长轨迹标注的依赖,利用自动伪标签实现大规模训练,显著提升数据效率。此外,该方法兼容多种模型,验证其广泛适用性,为自主探索提供新范式。

方法详解

  • �� 构建空间布局预测器(Imaginator),输入有限视野图像和指令,输出观察区域和未观察区域的语义坐标。• 采用单步无状态推理,结合温度采样生成多重空间假设,捕获环境不确定性。• 训练利用自动伪标签,基于全景场景的空间掩码,生成超过196万样本,避免长轨迹标注成本。• 设计建议转换器,将空间坐标转化为相对动作指令,指导行动者。• 行动者模型(Actor)依据空间建议,执行旋转或提交目标,完成搜索任务。• 采样策略逐步收敛,随着探索深入,环境不确定性降低,提升搜索效率。

实验设计

采用H*Bench数据集,涵盖多样场景,包括城市、室内等,评估搜索成功率。对比纯Actor模型与结合Imaginator的架构,验证性能提升。关键指标为目标定位成功率和搜索步数。模型在不同规模的预训练数据上进行训练,调优采样温度和假设数。通过消融实验验证空间布局预测的必要性和采样策略的有效性。结果显示,结合空间先验后,模型在HOS任务中成功率提升超过30%,在复杂环境中表现更稳健,验证了空间想象的有效性。

结果分析

结合Imaginator的模型在H*Bench上表现优异,Qwen3-VL 235B模型成功率由23.62%提升到65.04%,HPS由21.44%提升到38.25%。多模型验证显示,空间先验显著改善搜索效率,尤其在复杂环境中表现优越。自动伪标签训练使数据规模扩大至196万样本,成本大幅降低。消融分析表明,空间布局预测和多重采样策略是性能提升的关键因素。整体而言,该方法在多场景、多模型环境中均实现了优异的性能,验证了其广泛适用性和有效性。

应用场景

该技术可应用于自主机器人、无人驾驶、虚拟现实等领域,提升环境理解和目标定位能力。在实际场景中,系统无需大量手工标注,依赖自动生成的空间布局,实现高效自主探索。未来,结合多模态信息和强化学习,有望实现更智能、更鲁棒的自主系统,推动智能制造、安防、导航等行业的发展。

局限与展望

当前模型在极端遮挡、动态变化环境中仍存在推理失误,空间先验假设在复杂场景下可能失效。采样策略虽提升鲁棒性,但在高不确定性场景中仍存在误导风险。训练依赖大量伪标签,可能引入偏差,影响泛化能力。未来需优化模型结构,增强动态适应性,减少对大规模伪标签的依赖。

通俗解读 非专业人士也能看懂

想象一个人在黑暗的房间里找东西,他只能看到一小部分区域。为了找到目标,他会根据已有的线索猜测房间的布局,比如门可能在左边,沙发在角落。每次他转头,都会根据新线索调整猜测,逐步缩小范围。这个过程就像我们用“想象者”模型,它会在脑海中模拟房间的全貌,预测未看到的区域,帮助行动者更快找到目标。这样,机器人不用每次都盲目探索,而是像人一样根据已有信息合理推测,节省时间和精力。

简单解释 像给14岁少年讲一样

你知道当你在一个陌生的房间里找东西时,可能会先猜猜门在哪里,沙发可能在哪个角落,然后转头看看是不是符合你的猜测。其实,你在用一种“想象”来帮自己找东西。这个研究也是这样,它让机器人学会在脑海中“想象”房间的样子,预测还没看到的地方长什么样。这样,机器人就能更聪明地转头,找到目标,比以前盲目转圈快多了。它就像你玩捉迷藏时,脑袋里会有个小地图,帮你更快找到藏起来的朋友。

原文摘要

Humanoid Visual Search (HVS) requires agents to actively explore immersive 360$^\circ$ environments. While prior methods treat this as a monolithic task relying on cumulative, multi-turn Chain-of-Thought (CoT) reasoning, they impose heavy cognitive burdens and require expensive trajectory-level annotations. In this paper, we propose Imagining in 360$^\circ$, a novel framework that decouples the exploration process into a specialized Imaginator and an Actor. The Imaginator functions as a probabilistic predictor of spatial priors; instead of maintaining a cumulative reasoning chain, it infers the semantic layout of both observed and unobserved regions in a single step. By sampling multiple hypotheses within this semantic space, we provide the Actor with a distribution of effective spatial information, offering robust guidance that hedges against uncertainty during active search. This decoupled architecture significantly lowers data engineering costs by eliminating the need for full-trajectory CoT annotations, enabling the generation of over 1.96 million curated training samples. Extensive experiments demonstrate that explicitly modeling semantic spatial priors drastically improves search efficiency and success rates in complex, in-the-wild environments.

cs.CV