AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

TL;DR

AdaTurn通过预算感知的测试时刻调节显著提升低预算下的视觉推理性能。

cs.CV 🔴 高级 2026-07-16 42 次浏览
Susan Liang Chao Huang Filippos Bellos Jing Bi Jason J Corso Chenliang Xu
多模态视觉推理 强化学习 测试时调节 主动感知 预算管理

核心发现

方法论

AdaTurn采用条件化策略,将最大回合数作为输入条件,结合FA-DAPO强化学习策略,将超预算事件转化为可训练的最终决策步骤。模型在训练中随机采样不同预算,利用负责任的边界学习,提升低预算场景表现。引入负载均衡调度器,确保多引擎环境下的训练效率。核心算法基于改进的DAPO,优化边界行为的学习,增强模型在有限资源下的决策能力。

关键结果

  • 在4回合预算下,VisualProbe-Medium从36.7%提升至47.6%,提升显著,且在更大预算下保持优异性能,迁移到多种骨干网络和多模态基准测试中表现优越。
  • 在VisualProbe-Hard和MME-RealWorld等多个基准上,AdaTurn均优于现有最优方法Mini-o3,低预算性能提升超过10%。
  • 引入负载均衡调度器后,训练和推理的吞吐量提升1.34倍,有效缓解多样化预算带来的系统瓶颈。

研究意义

该研究解决了视觉主动推理中部署时预算不固定导致的性能退化问题,显著改善低预算场景下的推理准确率,为多模态系统的实际应用提供了可行方案。模型在保持高预算性能的同时,增强了在资源受限环境中的适应能力,推动主动视觉感知技术向实际部署迈进。

技术贡献

提出条件化策略结合FA-DAPO强化学习,有效将超预算事件转化为训练目标,增强模型边界行为学习能力。引入动态预算采样和负载均衡调度器,提升训练效率和系统鲁棒性。该方法突破了传统预算盲训练的局限,实现多尺度、多场景的泛化能力,推动多轮主动视觉推理的研究发展。

新颖性

首次将预算作为显式条件引入主动视觉推理模型,提出边界行为的训练机制,解决了现有方法在预算边界的不足。不同于以往仅关注长短期推理能力,AdaTurn强调在有限资源下的决策优化,具有较强创新性。

局限性

  • 模型在极端预算限制(如1-2回合)下仍可能出现信息不足导致的误判,未来需结合更高效的工具调用策略。
  • 系统复杂度较高,训练和推理中引入动态调度器增加了实现难度。
  • 当前实验主要在特定基准上验证,泛化到更复杂场景仍需进一步探索。

未来方向

未来将结合更高效的工具调用策略,提升极端预算场景的表现。探索多模态信息融合与动态预算调节的联合优化,增强模型的适应性和鲁棒性。同时,推动模型在实际应用中的部署与优化,解决系统复杂度和计算成本问题。

AI 总览摘要

AdaTurn是一种面向主动视觉推理的预算感知框架,旨在解决部署环境中资源限制带来的性能瓶颈。传统方法在训练时未考虑预算变化,导致在有限预算下模型容易提前截断或无法充分利用剩余资源。AdaTurn通过条件化策略,将最大回合数作为输入条件,训练模型在不同预算下的边界行为,显著提升低预算场景的推理准确率。核心创新在于引入FA-DAPO强化学习策略,将超预算事件转化为可训练的决策目标,使模型学会在资源有限时合理压缩推理过程,避免灾难性截断。系统还配备了动态采样和负载均衡调度器,有效提升训练和推理效率。实验结果显示,在4回合预算下,AdaTurn在VisualProbe-Medium上从36.7%提升至47.6%,在多个基准测试中均优于现有最优方法,验证了其在低预算环境中的优越性能。该方法不仅增强了模型的资源适应性,也为多模态视觉推理的实际部署提供了理论基础和技术方案。未来,研究将结合更高效的工具调用策略和多场景泛化能力,推动主动视觉系统的实用化发展。

深度分析

研究背景

多模态视觉推理经历了从单一图像理解到多轮交互的演变。早期模型如LLaVA采用低分辨率输入,忽略细节信息,限制了细粒度任务的表现。近年来,诸如LLaVA-UHD、Qwen2.5-VL等通过动态切片和强大视觉骨干提升编码能力,但仍主要在单次推理中完成任务。主动感知方法如SEAL、DC2、Chain-of-Focus等通过多轮交互,显著改善高分辨率和复杂场景的推理能力。与此同时,基于强化学习的多轮工具调用模型如DeepEyes、Mini-o3等逐步兴起,强调交互深度和工具利用效率。尽管如此,实际部署中资源限制未被充分考虑,导致模型在有限预算下表现不佳,存在灾难性截断问题,亟需引入预算感知机制以提升实际应用的鲁棒性。

核心问题

当前多轮视觉推理模型多在训练时忽略部署环境中的预算变化,导致模型在实际场景中出现性能退化。具体表现为,模型在预算不足时过度请求工具,导致提前截断,无法提供有效答案;在预算充裕时,又未能充分利用剩余资源进行验证。这种预算盲目性限制了模型的实用性。解决方案需要模型在训练时明确预算条件,学习在不同资源限制下的最优行为,特别是在预算边界的决策能力,避免灾难性截断,提升低预算场景的表现。

核心创新

本研究提出将最大回合数作为模型输入条件,实现预算感知的主动推理。引入FA-DAPO强化学习策略,将超预算事件转化为训练目标,教会模型在资源有限时合理压缩推理过程。系统还设计了动态采样和负载均衡调度机制,确保多引擎环境下的训练效率。相比传统方法仅在训练时忽略预算或在推理中硬性限制,AdaTurn在边界行为上实现了显著改进,增强模型在不同预算场景下的适应性和鲁棒性。这一创新突破了预算盲训练的局限,为多轮主动视觉推理提供了新的思路。

方法详解

  • �� 将最大回合数Tmax作为模型输入条件,模型在每轮决策中考虑预算信息。• 采用FA-DAPO强化学习策略,将超预算的工具调用转为边界决策训练目标。• 在训练中随机采样不同预算,增强模型在多尺度场景下的适应能力。• 引入负载均衡调度器,动态分配多引擎资源,提升训练和推理效率。• 设计边界行为的训练机制,使模型在预算边界学会合理压缩推理或提前回答。• 结合动态预算采样和边界训练,确保模型在不同预算下的表现均衡。• 训练过程中利用奖励函数结合准确率和格式一致性,优化模型决策。• 在推理时,根据实际预算条件调整模型行为,确保性能最大化。

实验设计

采用VisualProbe、V* Bench、HR-Bench和MME-RealWorld等多模态推理基准,评估AdaTurn在不同预算下的性能。对比基线Mini-o3和DeepEyes,验证低预算场景的提升。实验中随机采样Tmax,模拟实际部署环境。指标包括准确率、推理速度和系统吞吐量。通过消融实验验证FA-DAPO的边界训练效果,分析负载调度对训练效率的影响。多场景迁移测试表明模型具有良好的泛化能力。超参数调优确保模型在不同预算下的最优表现,验证其资源适应性。

结果分析

在4回合预算下,AdaTurn在VisualProbe-Medium上达47.6%,比之前最优提升10%以上。在更大预算下,性能保持或超越对比模型,验证了边界训练的有效性。引入调度器后,训练和推理速度提升1.34倍。模型在多模态基准上表现优异,验证其广泛适用性。低预算性能提升尤其明显,解决了灾难性截断问题,增强了实际部署的鲁棒性。

应用场景

该方法适用于需要多轮交互的视觉问答、场景理解等应用,特别是在边缘设备或实时系统中资源有限的场景。模型可根据实际资源动态调整推理深度,提升效率和准确率。未来可结合自动预算调节机制,实现自适应资源管理,推动智能监控、机器人等行业的技术落地。

局限与展望

模型在极端预算(如1-2回合)下仍可能因信息不足导致误判。系统复杂度较高,训练和调度机制增加实现难度。当前实验主要在特定基准测试中验证,泛化到更复杂、多样化场景仍需进一步研究。未来需优化工具调用策略和模型压缩技术,以降低部署成本。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂每天都要完成不同的任务。有时候任务很简单,只需要用少量的工具和时间就能完成;有时候任务很复杂,需要用很多工具、花费很多时间。以前工厂的工人总是按照固定的流程工作,不管任务难易,都用一样的时间和工具。这样一来,遇到简单任务时,工人可能会用太多时间,浪费资源;遇到复杂任务时,又可能因为时间不够而提前放弃,导致任务没完成。AdaTurn就像是给工厂的工人装上了智能助手,告诉他们根据任务的难度和剩余时间,合理安排工具和时间。它学会在资源有限时,快速做出最合理的决定,既不浪费,也不提前放弃。这样,无论任务多复杂或多简单,工厂都能高效完成,资源得到最优利用。

简单解释 像给14岁少年讲一样

你可以把AdaTurn想象成一个聪明的学生在做作业。有时候作业很简单,只需要几步就能完成;有时候很难,要花很多时间查资料、写答案。以前这个学生总是按照固定的时间和步骤做,不管作业难不难。有时候,他会花太多时间在简单题上,浪费时间;有时候,时间不够,没能完成难题。AdaTurn就像给这个学生装了个智能助手,告诉他根据剩余时间和作业难度,合理安排做题策略。它学会在时间有限时,快速总结已知信息,做出最合理的答案,而不是一直追求完美。这样,无论作业难易,学生都能高效完成,得到好成绩。

术语表

Budget-Aware Active Visual Agent (预算感知主动视觉代理)

一种能根据资源限制调整行为的多轮视觉推理模型,结合强化学习优化边界决策。

论文中提出的核心系统架构。

Forced-Answer DAPO (FA-DAPO)

一种强化学习策略,将超预算事件转化为模型训练中的边界决策目标,增强模型在预算边界的表现。

模型训练和边界行为学习的关键技术。

rollout budget (回合预算)

在多轮交互中允许的最大操作次数,用于控制推理深度和系统资源消耗。

模型输入条件之一,影响模型行为。

load-balanced scheduler (负载均衡调度器)

一种动态调度机制,合理分配多引擎资源,提升训练和推理效率。

系统优化的重要组成部分。

catastrophic truncation (灾难性截断)

模型在预算不足时提前终止,导致无法完成有效推理或回答的现象。

本文关注的主要问题之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端预算(如1-2回合)下保持模型性能,仍是未解难题。模型在信息不足时的决策机制需要进一步优化。未来研究应结合更高效的工具调用和信息压缩策略,以应对更复杂的实际场景。

应用场景

近期应用

智能问答系统

在有限时间内提供准确答案,特别适用于边缘设备或实时应用。模型根据资源动态调整推理深度,提升效率和准确性。

机器人视觉导航

机器人在复杂环境中有限的交互轮次内,快速理解场景并做出决策,增强自主能力。

远期愿景

自适应智能系统

未来系统能根据环境变化自动调节推理深度,实现资源最优利用,推动智能监控、自动驾驶等行业发展。

原文摘要

Active visual agents solve fine-grained image tasks by interleaving reasoning with image-grounding actions across multiple turns. However, deployment-time rollout budgets are rarely fixed: some requests permit long rollouts, while others require the agent to act under a tight turn limit. Existing methods train the policy as if the rollout budget were hidden, so when the available budget is smaller than the trajectory the agent prefers, the interaction is often truncated before any valid answer is produced; we term this failure \emph{catastrophic truncation}. To overcome this challenge, we present AdaTurn, a budget-aware framework that conditions the agent on the allowed number of turns and explicitly trains the boundary behavior induced by the budget. Our key component, Forced-Answer DAPO (FA-DAPO), converts the over-budget event from a masked or penalized failure into a trainable final-decision step, teaching the model to synthesize partial evidence when further tool use is no longer possible. We further randomize rollout budgets during both training and inference and introduce a load-balanced scheduler that makes such operations practical. AdaTurn substantially improves low-budget accuracy, for example raising VisualProbe-Medium from 36.7% to 47.6% at four turns, while preserving strong scaling at larger budgets and transferring effectively to multiple backbones and general multimodal benchmarks.

cs.CV