核心发现
方法论
HyperEyes采用双粒度效率感知强化学习框架,结合TRACE和On-Policy Distillation。TRACE在宏观层面通过动态收紧的参考轨迹抑制冗余工具调用,而微观层面通过外部教师模型提供密集的令牌级别纠正信号。
关键结果
- HyperEyes-30B在IMEB基准上准确率提升9.9%,工具调用轮次减少5.3倍,显著优于现有开源代理。
- 在六个基准上,HyperEyes在准确性和效率上均表现出色,Pareto支配现有模型。
- 通过消融实验验证了TRACE和OPD的有效性,展示了其在多实体场景中的优势。
研究意义
该研究通过引入并行多模态搜索代理,解决了传统顺序工具调用导致的冗余问题,显著提升了搜索效率和准确性。这一方法在多实体视觉搜索中具有重要的应用潜力,推动了多模态搜索代理的发展。
技术贡献
HyperEyes在技术上通过统一的视觉定位和检索操作空间,实现了文本和视觉模态的并行搜索,提出了双粒度效率感知强化学习框架,显著优化了工具使用效率。
新颖性
HyperEyes首次将并行搜索引入多模态代理,结合TRACE和OPD框架,突破了传统顺序搜索的限制,提供了新的效率优化途径。
局限性
- 在复杂场景中,模型可能仍面临工具调用的冗余问题,尤其是在初始定位不准确时。
- 模型的训练和推理成本较高,可能限制其在资源有限环境中的应用。
未来方向
未来工作可探索在更大规模数据集上的应用,优化模型的计算效率,并在更多实际场景中验证其性能。
AI 总览摘要
现有多模态搜索代理通常通过顺序调用工具来处理目标实体,这导致了冗余的交互回合。HyperEyes通过并行多模态搜索代理,结合视觉定位和检索为单一原子操作,实现了多实体的并行搜索,并将推理效率作为首要训练目标。
HyperEyes采用双阶段训练策略,首先通过并行适应的数据合成管道进行冷启动监督,然后通过双粒度效率感知强化学习框架优化搜索效率。在宏观层面,TRACE通过动态收紧的参考轨迹抑制冗余工具调用,而在微观层面,On-Policy Distillation通过外部教师模型提供密集的令牌级别纠正信号。
在六个基准上,HyperEyes-30B在准确性上超越了最强的开源多模态搜索代理,准确率提高9.9%,工具调用轮次减少5.3倍,展示了其在多实体视觉搜索中的显著优势。IMEB基准的引入使得搜索能力和效率的联合评估成为可能,推动了多模态搜索代理的发展。未来工作将探索在更大规模数据集上的应用,并在更多实际场景中验证其性能。
深度分析
研究背景
多模态搜索代理在处理复杂的多跳推理任务时,通常依赖于顺序的工具调用,这导致了冗余的交互回合。现有的基准主要评估准确性,忽略了推理成本和并行搜索能力。HyperEyes通过并行多模态搜索代理,解决了这一问题。
核心问题
传统多模态搜索代理在处理可分解查询时,因顺序调用工具而导致冗余交互回合。如何在保证准确性的同时提高搜索效率,是一个亟待解决的问题。
核心创新
HyperEyes通过并行多模态搜索代理,将视觉定位和检索融合为单一原子操作,实现了多实体的并行搜索。采用双粒度效率感知强化学习框架,优化了工具使用效率。
方法详解
- �� 采用并行适应的数据合成管道进行冷启动监督。
- �� 在宏观层面,TRACE通过动态收紧的参考轨迹抑制冗余工具调用。
- �� 在微观层面,On-Policy Distillation通过外部教师模型提供密集的令牌级别纠正信号。
实验设计
实验在六个基准上进行,使用IMEB基准评估搜索能力和效率。HyperEyes-30B在准确性和工具调用轮次上均表现出色,展示了其在多实体场景中的优势。
结果分析
HyperEyes-30B在IMEB基准上准确率提高9.9%,工具调用轮次减少5.3倍。消融实验验证了TRACE和OPD的有效性,展示了其在多实体场景中的优势。
应用场景
HyperEyes在多实体视觉搜索中具有重要的应用潜力,尤其是在需要高效并行搜索的场景中,如图像识别和信息检索。
局限与展望
模型在复杂场景中可能仍面临工具调用的冗余问题,尤其是在初始定位不准确时。训练和推理成本较高,可能限制其在资源有限环境中的应用。
通俗解读 非专业人士也能看懂
想象一个图书馆,传统的多模态搜索代理就像一个图书管理员,每次只能处理一个请求,导致效率低下。而HyperEyes就像一个超级图书管理员,可以同时处理多个请求,大大提高了效率。它通过并行搜索,快速找到所需的信息,就像在一个大房间里同时找到多个书籍。
简单解释 像给14岁少年讲一样
嘿,小伙伴!想象一下你在玩一个游戏,你需要同时找到好几个宝藏。传统的方法是一个一个找,超级慢!但HyperEyes就像是一个超级助手,可以同时找到所有宝藏,超酷吧?这就是并行搜索的力量!
术语表
HyperEyes
一种并行多模态搜索代理,结合视觉定位和检索为单一原子操作。
用于提高多实体搜索效率。
TRACE
工具使用参考自适应成本效率的轨迹级奖励。
用于抑制冗余工具调用。
On-Policy Distillation
一种通过外部教师模型提供密集令牌级别纠正信号的方法。
用于纠正失败的推理步骤。
IMEB
一种人类策划的基准,用于联合评估搜索能力和效率。
用于评估多模态搜索代理的性能。
并行搜索
同时处理多个查询的能力。
用于提高搜索效率。
开放问题 这项研究留下的未解疑问
- 1 如何在更复杂的场景中进一步提高搜索效率?现有方法在初始定位不准确时仍存在挑战。
- 2 如何降低模型的训练和推理成本,以便在资源有限的环境中应用?
应用场景
近期应用
图像识别
在需要快速识别多个目标的场景中,HyperEyes可以显著提高效率。
远期愿景
信息检索
在大规模数据集上应用,优化模型的计算效率,推动多模态搜索代理的发展。
原文摘要
Existing multimodal search agents process target entities sequentially, issuing one tool call per entity and accumulating redundant interaction rounds whenever a query decomposes into independent sub-retrievals. We argue that effective multimodal agents should search wider rather than longer: dispatching multiple grounded queries concurrently within a round. To this end, we present HyperEyes, a parallel multimodal search agent that fuses visual grounding and retrieval into a single atomic action, enabling concurrent search across multiple entities while treating inference efficiency as a first-class training objective. HyperEyes is trained in two stages. For cold-start supervision, we develop a Parallel-Amenable Data Synthesis Pipeline covering visual multi-entity and textual multi-constraint queries, curating efficiency-oriented trajectories via Progressive Rejection Sampling. Building on this, our central contribution, a Dual-Grained Efficiency-Aware Reinforcement Learning framework, operates at two levels. At the macro level, we propose TRACE (Tool-use Reference-Adaptive Cost Efficiency), a trajectory-level reward whose reference is monotonically tightened during training to suppress superfluous tool calls without restricting genuine multi-hop search. At the micro level, we adapt On-Policy Distillation to inject dense token-level corrective signals from an external teacher on failed rollouts, mitigating the credit-assignment deficiency of sparse outcome rewards. Since existing benchmarks evaluate accuracy as the sole metric, omitting inference cost, we introduce IMEB, a human-curated benchmark of 300 instances that jointly evaluates search capability and efficiency. Across six benchmarks, HyperEyes-30B surpasses the strongest comparable open-source agent by 9.9% in accuracy with 5.3x fewer tool-call rounds on average.