SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

TL;DR

SimpleSearch-VL通过FAR优化采样效率,结合证据验证提升可靠性,保持轻量工具接口,显著提升多模态搜索性能。

cs.CV 🔴 高级 2026-06-30 31 次浏览
Ming Dai Zhihong Lu Jinjie Gu Jiedong Zhuang Yefeng Liu Wankou Yang Jian Wang Chunhua Shen
多模态搜索 强化学习 证据验证 效率优化 深度学习

核心发现

方法论

该方法核心在于通过Factorized Adaptive Rollout (FAR)实现采样的信号感知分配,结合链式推理中的证据验证机制,确保检索信息的相关性与支持性。FAR在采样过程中动态扩展提示组,利用奖励信号指导硬样本优先采样,避免尾部延迟。证据验证采用图像反向搜索返回缩略图、标题和URL,模型可自主比对验证匹配性。网页自总结机制内嵌于模型,无需外部依赖,提升系统实用性。训练仅用5K轨迹和2KRL数据,显著提升Qwen3-VL在8B和30B模型上的性能,分别提升15.8和16.0点,表现优于大部分开源多模态搜索模型。

关键结果

  • 在六个多模态搜索基准上,SimpleSearch-VL-8B和30B分别提升平均点数15.8和16.0,超越多项竞争对手,表现出强大的数据效率和鲁棒性。
  • 在网页检索、视觉问答等任务中,模型展现出优异的相关性验证能力,尤其在证据匹配和推理链验证方面优于传统方法。
  • 通过有限的监督轨迹和RL数据,模型实现了高效学习,验证了FAR在动态采样和尾部延迟缓解中的有效性。

研究意义

该研究突破了多模态搜索中的效率与可靠性瓶颈,提出的FAR机制实现信号感知的动态采样,有助于缩短训练时间、降低成本,同时保证检索证据的真实性与相关性。模型无需复杂工具链和外部依赖,增强了系统的实用性,为未来多模态智能搜索提供了新范式。其在多个公开基准上的优异表现,彰显了其在知识检索、视觉推理和人机交互中的潜力,推动多模态AI向更高效、更可靠的方向发展。

技术贡献

本文提出的FAR机制创新性地结合了信号感知与采样策略,突破了传统固定采样的局限,实现了动态、硬样本优先采样。证据验证机制通过图像反向搜索的可检验性,增强了模型的可信度。网页自总结设计简化了工具链,减少了外部依赖,提升了系统的可扩展性。训练过程中,模型仅用少量监督轨迹和RL数据,验证了数据的高效利用。整体框架在保证性能的同时,大幅降低了训练成本,具有良好的工程应用前景。

新颖性

该工作首次将信号感知的动态采样策略(FAR)引入多模态深度搜索中,有效缓解尾部延迟问题。结合证据验证的链式推理机制,确保检索信息的真实性,突破了现有多模态搜索多依赖外部工具和复杂流程的局限。其网页自总结功能创新性地将总结过程内嵌于模型内部,简化了系统架构。这些创新共同推动多模态搜索走向更高效、可靠和实用的方向。

局限性

  • 模型在极端复杂或多源信息冲突场景下,验证机制可能仍面临挑战,证据匹配的准确性有限。
  • 训练依赖少量监督轨迹,泛化到更大规模或更复杂任务时,可能需要更多标注和调优。
  • 在极端长尾样本或罕见场景中,尾部延迟虽被缓解,但仍存在一定性能瓶颈。

未来方向

未来将探索多模态证据验证的多层次、多源融合机制,提升推理的鲁棒性。计划引入更大规模的自监督和无监督数据,扩展模型的知识覆盖范围。此外,将结合更复杂的工具链和多任务学习,推动多模态搜索在实际应用中的广泛部署。

AI 总览摘要

SimpleSearch-VL引入了一种高效、可靠且实用的多模态深度搜索框架,核心在于通过Factorized Adaptive Rollout(FAR)机制优化采样效率。传统多模态搜索面临尾部延迟长、信息相关性难以保证、系统复杂度高等难题。本文创新性地将信号感知的动态采样策略与链式推理中的证据验证相结合,显著提升了模型在多任务环境中的表现。

FAR机制通过在采样过程中动态扩展提示组,优先采样难样本,避免尾部延迟,同时利用冗余样本确保训练稳定性。证据验证采用图像反向搜索返回的缩略图、标题和URL,模型可自主比对验证匹配性,增强推理的可信度。网页自总结机制内嵌于模型,无需外部工具,简化系统架构,提升实用性。

在仅用5K监督轨迹和2KRL数据的条件下,SimpleSearch-VL在六个公开基准上均取得了优异成绩,8B和30B模型分别提升15.8和16.0点,表现优于大部分开源模型。其在视觉问答、网页检索等任务中展现出强大能力,验证了其在知识检索和视觉推理中的潜力。整体而言,该框架为多模态搜索提供了新思路,兼顾效率、可靠性和实用性,推动行业技术革新。

深度分析

研究背景

多模态搜索技术经历了从静态检索到主动证据采集的演变。早期工作如RAG(Lewis et al., 2020)主要依赖固定检索机制,后续引入多轮交互和工具调用(Wu et al., 2025; Geng et al., 2025),提升了复杂任务的处理能力。近年来,强调证据验证和推理链(Zhou et al., 2025; Shao et al., 2024)成为研究热点。尽管如此,效率瓶颈、证据可信性和系统复杂性仍未得到根本解决,限制了大规模实际应用。

核心问题

多模态搜索面临尾部延迟、证据相关性不足和系统复杂等关键瓶颈。尾部延迟导致训练和推理效率低下,证据验证不足影响模型可信度,而复杂的工具链限制了系统的实用性。如何在保证性能的同时简化系统架构,提升效率和验证能力,成为亟待解决的问题。

核心创新

提出FAR机制,通过信号感知动态分配采样预算,优先处理难样本,缓解尾部延迟。引入图像反向搜索的可检验性证据验证,确保检索信息的真实性。网页自总结机制内嵌于模型,简化工具链,提升系统实用性。这些创新结合,显著提升多模态搜索的效率和可靠性,推动其向工业应用迈进。

方法详解

  • �� 采样策略:利用FAR在提示组扩展和采样深度上动态调整,优先采样难样本,避免尾部延迟。• 证据验证:图像反向搜索返回缩略图、标题和URL,模型自主比对验证匹配性,确保证据支持。• 网页自总结:在网页访问后,模型生成目标导向的简洁摘要,无需外部工具。• 训练流程:结合少量监督轨迹和RL数据,采用奖励信号指导采样和验证,优化模型性能。• 采样过滤:根据答案正确性动态过滤尾部样本,确保训练效率。• 策略优化:采用RLOO估计器,结合剪切目标,提升策略学习效果。

实验设计

在六个公开基准(如MMSearch、FVQA)上进行评估,比较不同模型和方法。使用8B和30B规模模型,训练仅需数天,验证了FAR在尾部延迟缓解和样本效率上的优势。通过 ablation 实验,验证了FAR的动态采样和证据验证机制对性能提升的贡献。指标包括准确率、平均点数和响应时间,显示出显著优越性。

结果分析

SimpleSearch-VL-8B和30B在六个基准上分别提升15.8和16.0点,超越多项开源模型。证据验证机制有效提升了推理的可信度,模型在网页检索和视觉问答中表现优异。FAR机制显著降低了尾部延迟,提升了训练和推理效率。整体结果表明,该方法在多模态知识检索中具有广泛应用潜力。

应用场景

该模型可广泛应用于智能问答、知识图谱构建、内容审核等场景,尤其适合需要实时、可信信息检索的行业。系统无需复杂工具链,易于集成到现有平台,具有良好的扩展性和实用性。未来,结合更大规模数据和多源信息,将推动多模态AI在实际场景中的深度应用。

局限与展望

尽管在多个任务中表现优异,但在极端复杂或多源信息冲突场景下,验证机制仍存在不足。训练依赖少量监督轨迹,泛化能力有限。尾部延迟虽被缓解,但在极端长尾样本中仍有性能瓶颈。未来需增强模型的鲁棒性和扩展性,提升在更复杂环境中的表现。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭。每次准备食材、调味、烹饪都需要找到正确的材料和步骤。传统方法就像用一个大篮子装所有食材,等到全部准备好再一起用,效率低且容易遗漏。SimpleSearch-VL则像是用一个智能助手,能根据需要动态挑选食材,验证它们是否新鲜、合适,还能自己总结菜谱,告诉你下一步该做什么。它会优先处理难搞的食材,确保每一步都靠谱,最后做出美味佳肴。这种方式节省时间,又保证每个环节都可靠,适合快节奏的厨房工作。

简单解释 像给14岁少年讲一样

想象你在学校里要找关于某个话题的资料。以前你可能会翻很多书、上网查资料,花费很多时间。而现在,有个聪明的朋友可以帮你。他不仅会帮你找资料,还会告诉你哪些资料是真的、哪些是假的。这个朋友还会自己总结信息,告诉你重点在哪里。它会优先帮你解决难题,确保你得到的答案可靠。这样一来,你就能更快、更准地完成作业,还能学到更多有用的知识。这就是SimpleSearch-VL的工作原理——它像个聪明的助手,帮你高效、可靠地找到你需要的答案。

原文摘要

We present SimpleSearch-VL, an efficient, reliable, and practical framework for multimodal agentic search. Its core idea is to improve the agent's own search-and-verification process rather than scaling data, tools, or auxiliary model components. For efficiency, Factorized Adaptive Rollout (FAR) improves sampling efficiency by forming more informative training groups while using redundant samples to mitigate long-tail latency and expose hard samples. For reliability, SimpleSearch-VL performs evidence-verified reasoning, explicitly using chain-of-thought verification to assess the relevance of retrieved visual and textual cues to the original context. For practicality, SimpleSearch-VL keeps a lightweight tool interface and performs webpage self-summary within the agent, requiring no additional external dependencies. With only 5K supervised tool-interleaved trajectories and 2K RL data, SimpleSearch-VL improves Qwen3-VL agentic baselines by 15.8 and 16.0 average points for the 8B and 30B-A3B variants, respectively. The SimpleSearch-VL-30B-A3B model further achieves performance competitive with agentic Gemini-3-Pro.

cs.CV