HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

TL;DR

HyperEyes通过并行多模态搜索提升效率,准确率提高9.9%,工具调用减少5.3倍。

cs.LG 🔴 高级 2026-05-08 36 次浏览
Guankai Li Jiabin Chen Yi Xu Xichen Zhang Yuan Lu
多模态 强化学习 并行搜索 效率优化 视觉定位

核心发现

方法论

HyperEyes采用双粒度效率感知强化学习框架,结合TRACE和On-Policy Distillation。TRACE在宏观层面通过动态收紧的参考轨迹抑制冗余工具调用,而微观层面通过外部教师模型提供密集的令牌级别纠正信号。

关键结果

  • HyperEyes-30B在IMEB基准上准确率提升9.9%,工具调用轮次减少5.3倍,显著优于现有开源代理。
  • 在六个基准上,HyperEyes在准确性和效率上均表现出色,Pareto支配现有模型。
  • 通过消融实验验证了TRACE和OPD的有效性,展示了其在多实体场景中的优势。

研究意义

该研究通过引入并行多模态搜索代理,解决了传统顺序工具调用导致的冗余问题,显著提升了搜索效率和准确性。这一方法在多实体视觉搜索中具有重要的应用潜力,推动了多模态搜索代理的发展。

技术贡献

HyperEyes在技术上通过统一的视觉定位和检索操作空间,实现了文本和视觉模态的并行搜索,提出了双粒度效率感知强化学习框架,显著优化了工具使用效率。

新颖性

HyperEyes首次将并行搜索引入多模态代理,结合TRACE和OPD框架,突破了传统顺序搜索的限制,提供了新的效率优化途径。

局限性

  • 在复杂场景中,模型可能仍面临工具调用的冗余问题,尤其是在初始定位不准确时。
  • 模型的训练和推理成本较高,可能限制其在资源有限环境中的应用。

未来方向

未来工作可探索在更大规模数据集上的应用,优化模型的计算效率,并在更多实际场景中验证其性能。

AI 总览摘要

现有多模态搜索代理通常通过顺序调用工具来处理目标实体,这导致了冗余的交互回合。HyperEyes通过并行多模态搜索代理,结合视觉定位和检索为单一原子操作,实现了多实体的并行搜索,并将推理效率作为首要训练目标。

HyperEyes采用双阶段训练策略,首先通过并行适应的数据合成管道进行冷启动监督,然后通过双粒度效率感知强化学习框架优化搜索效率。在宏观层面,TRACE通过动态收紧的参考轨迹抑制冗余工具调用,而在微观层面,On-Policy Distillation通过外部教师模型提供密集的令牌级别纠正信号。

在六个基准上,HyperEyes-30B在准确性上超越了最强的开源多模态搜索代理,准确率提高9.9%,工具调用轮次减少5.3倍,展示了其在多实体视觉搜索中的显著优势。IMEB基准的引入使得搜索能力和效率的联合评估成为可能,推动了多模态搜索代理的发展。未来工作将探索在更大规模数据集上的应用,并在更多实际场景中验证其性能。

深度分析

研究背景

多模态搜索代理在处理复杂的多跳推理任务时,通常依赖于顺序的工具调用,这导致了冗余的交互回合。现有的基准主要评估准确性,忽略了推理成本和并行搜索能力。HyperEyes通过并行多模态搜索代理,解决了这一问题。

核心问题

传统多模态搜索代理在处理可分解查询时,因顺序调用工具而导致冗余交互回合。如何在保证准确性的同时提高搜索效率,是一个亟待解决的问题。

核心创新

HyperEyes通过并行多模态搜索代理,将视觉定位和检索融合为单一原子操作,实现了多实体的并行搜索。采用双粒度效率感知强化学习框架,优化了工具使用效率。

方法详解

  • �� 采用并行适应的数据合成管道进行冷启动监督。
  • �� 在宏观层面,TRACE通过动态收紧的参考轨迹抑制冗余工具调用。
  • �� 在微观层面,On-Policy Distillation通过外部教师模型提供密集的令牌级别纠正信号。

实验设计

实验在六个基准上进行,使用IMEB基准评估搜索能力和效率。HyperEyes-30B在准确性和工具调用轮次上均表现出色,展示了其在多实体场景中的优势。

结果分析

HyperEyes-30B在IMEB基准上准确率提高9.9%,工具调用轮次减少5.3倍。消融实验验证了TRACE和OPD的有效性,展示了其在多实体场景中的优势。

应用场景

HyperEyes在多实体视觉搜索中具有重要的应用潜力,尤其是在需要高效并行搜索的场景中,如图像识别和信息检索。

局限与展望

模型在复杂场景中可能仍面临工具调用的冗余问题,尤其是在初始定位不准确时。训练和推理成本较高,可能限制其在资源有限环境中的应用。

通俗解读 非专业人士也能看懂

想象一个图书馆,传统的多模态搜索代理就像一个图书管理员,每次只能处理一个请求,导致效率低下。而HyperEyes就像一个超级图书管理员,可以同时处理多个请求,大大提高了效率。它通过并行搜索,快速找到所需的信息,就像在一个大房间里同时找到多个书籍。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个游戏,你需要同时找到好几个宝藏。传统的方法是一个一个找,超级慢!但HyperEyes就像是一个超级助手,可以同时找到所有宝藏,超酷吧?这就是并行搜索的力量!

术语表

HyperEyes

一种并行多模态搜索代理,结合视觉定位和检索为单一原子操作。

用于提高多实体搜索效率。

TRACE

工具使用参考自适应成本效率的轨迹级奖励。

用于抑制冗余工具调用。

On-Policy Distillation

一种通过外部教师模型提供密集令牌级别纠正信号的方法。

用于纠正失败的推理步骤。

IMEB

一种人类策划的基准,用于联合评估搜索能力和效率。

用于评估多模态搜索代理的性能。

并行搜索

同时处理多个查询的能力。

用于提高搜索效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的场景中进一步提高搜索效率?现有方法在初始定位不准确时仍存在挑战。
  • 2 如何降低模型的训练和推理成本,以便在资源有限的环境中应用?

应用场景

近期应用

图像识别

在需要快速识别多个目标的场景中,HyperEyes可以显著提高效率。

远期愿景

信息检索

在大规模数据集上应用,优化模型的计算效率,推动多模态搜索代理的发展。

原文摘要

Existing multimodal search agents process target entities sequentially, issuing one tool call per entity and accumulating redundant interaction rounds whenever a query decomposes into independent sub-retrievals. We argue that effective multimodal agents should search wider rather than longer: dispatching multiple grounded queries concurrently within a round. To this end, we present HyperEyes, a parallel multimodal search agent that fuses visual grounding and retrieval into a single atomic action, enabling concurrent search across multiple entities while treating inference efficiency as a first-class training objective. HyperEyes is trained in two stages. For cold-start supervision, we develop a Parallel-Amenable Data Synthesis Pipeline covering visual multi-entity and textual multi-constraint queries, curating efficiency-oriented trajectories via Progressive Rejection Sampling. Building on this, our central contribution, a Dual-Grained Efficiency-Aware Reinforcement Learning framework, operates at two levels. At the macro level, we propose TRACE (Tool-use Reference-Adaptive Cost Efficiency), a trajectory-level reward whose reference is monotonically tightened during training to suppress superfluous tool calls without restricting genuine multi-hop search. At the micro level, we adapt On-Policy Distillation to inject dense token-level corrective signals from an external teacher on failed rollouts, mitigating the credit-assignment deficiency of sparse outcome rewards. Since existing benchmarks evaluate accuracy as the sole metric, omitting inference cost, we introduce IMEB, a human-curated benchmark of 300 instances that jointly evaluates search capability and efficiency. Across six benchmarks, HyperEyes-30B surpasses the strongest comparable open-source agent by 9.9% in accuracy with 5.3x fewer tool-call rounds on average.

cs.LG cs.AI