TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

TL;DR

TACO通过DAPR和OGAR优化工具调用,提升视觉问答准确率。

cs.MA 🔴 高级 2026-06-29 58 次浏览
Mingkuan Feng Jinyang Wu Hao Gu Fangrui Lv Ruihan Jin Chuyuan Zhang Zhengqi Wen Jianhua Tao
多模态 强化学习 视觉问答 工具调用 自监督学习

核心发现

方法论

TACO采用GRPO变体,通过DAPR和OGAR两种优势通道优化工具调用。DAPR通过插入探针令牌比较工具前后的预测结果,OGAR则根据调用结果分配最终答案的优势。

关键结果

  • 在HR-Bench-8K上,TACO的准确率达到81.6%,比PyVision高出4.4个百分点。
  • 在V*数据集上,TACO实现了89.6%的准确率,显著优于其他模型。
  • 消融实验显示,去掉DAPR或OGAR都会导致性能下降。

研究意义

TACO在多模态视觉问答中显著提高了工具调用的准确性,避免了不必要的工具调用,解决了现有方法中工具调用过多的问题。

技术贡献

TACO通过自监督的DAPR和无参数的OGAR实现了对工具调用的精确奖励分配,避免了外部评判模型的依赖。

新颖性

TACO首次将自监督的探针奖励和结果导向的优势路由结合,提供了一种无需外部评判的工具调用优化方法。

局限性

  • TACO在处理极端复杂的视觉任务时可能表现不佳,因为这些任务需要更复杂的工具调用策略。
  • 模型对初始策略的依赖较强,可能需要大量的SFT数据。

未来方向

未来工作可以探索TACO在更大规模数据集上的表现,以及结合其他自监督学习方法的可能性。

AI 总览摘要

TACO通过优化视觉问答中的工具调用,显著提升了模型的准确性和效率。现有多模态模型在处理复杂视觉任务时,常常过度依赖工具调用,导致效率低下。TACO通过DAPR和OGAR两种机制,精确评估每次工具调用的贡献,避免了不必要的调用。

在实验中,TACO在多个基准测试中表现优异,尤其是在HR-Bench-8K和V*数据集上,达到了领先的准确率。这表明TACO不仅能有效提升工具调用的准确性,还能减少不必要的计算开销。

尽管TACO在许多方面表现出色,但在处理极端复杂的视觉任务时仍有改进空间。未来的研究可以探索如何进一步优化工具调用策略,以及在更大规模数据集上的应用潜力。

深度分析

研究背景

近年来,多模态模型在视觉问答领域取得了显著进展。这些模型通过代码操作图像,进行细粒度的视觉推理。然而,现有方法在工具调用上存在过度依赖的问题,导致效率低下。

核心问题

现有多模态模型在处理复杂视觉任务时,常常过度依赖工具调用,导致效率低下。这是因为缺乏精确的奖励机制来评估每次工具调用的贡献。

核心创新

TACO通过DAPR和OGAR两种机制,精确评估每次工具调用的贡献。DAPR通过插入探针令牌比较工具前后的预测结果,而OGAR则根据调用结果分配最终答案的优势。

方法详解

  • �� DAPR通过插入探针令牌,比较工具调用前后的预测结果。
  • �� OGAR根据调用结果,将最终答案的优势分配给相关的代码段。
  • �� 采用两阶段的SFT和RL训练策略。

实验设计

实验在多个数据集上进行,包括HR-Bench-8K和V*。使用的基准包括准确率和工具调用次数。消融实验验证了DAPR和OGAR的有效性。

结果分析

TACO在HR-Bench-8K上达到81.6%的准确率,比其他模型高出4.4个百分点。在V*数据集上,TACO实现了89.6%的准确率。

应用场景

TACO可用于需要精确视觉推理的场景,如自动驾驶和医疗影像分析。其自监督的奖励机制使其在资源有限的环境中也能高效运行。

局限与展望

TACO在处理极端复杂的视觉任务时可能表现不佳,因为这些任务需要更复杂的工具调用策略。未来工作可以探索如何进一步优化工具调用策略。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。你有很多工具,比如刀、锅和搅拌机。TACO就像一个聪明的厨师,知道什么时候用哪个工具最合适。比如,你需要切菜时,它会用刀,而不是搅拌机。这样不仅节省时间,还能保证菜肴的质量。TACO通过自我监督的方式,学习什么时候该用哪个工具,从而提高效率。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要用不同的工具来解决谜题。TACO就像一个聪明的助手,告诉你什么时候用哪个工具最合适。比如,你需要打开一个锁,它会告诉你用钥匙,而不是用锤子。这样你就能更快地通关游戏!TACO通过学习,知道什么时候用哪个工具最有效率。

术语表

TACO (工具增强信用优化)

一种用于优化多模态模型工具调用的机制,通过DAPR和OGAR实现。

TACO用于提升视觉问答的准确性。

DAPR (差分答案探针奖励)

一种自监督的奖励机制,通过比较工具调用前后的预测结果来评估工具调用的贡献。

DAPR用于评估工具调用的有效性。

OGAR (结果导向优势路由)

一种无参数的机制,根据工具调用的结果分配最终答案的优势。

OGAR用于避免不必要的工具调用。

GRPO (群体相对策略优化)

一种用于训练多模态模型的强化学习算法。

GRPO用于优化TACO的训练过程。

自监督学习

一种机器学习方法,模型通过自身生成的标签进行训练。

DAPR利用自监督学习来评估工具调用。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂的视觉任务中优化工具调用策略?
  • 2 TACO在大规模数据集上的表现如何?
  • 3 如何结合其他自监督学习方法提升TACO的性能?

应用场景

近期应用

自动驾驶

TACO可用于自动驾驶中的视觉识别,提高识别准确率,减少计算开销。

远期愿景

医疗影像分析

TACO可用于医疗影像分析,提高诊断准确率,减少误诊率。

原文摘要

Agentic multimodal models perform diverse operations on an image via code and reason over the returned view, an effective paradigm for fine-grained visual question answering. However, code operations can be useful, redundant, or misleading. Outcome-only rewards cannot precisely distinguish these cases, and existing process rewards either fail to attribute final correctness to individual tool calls, or require an external judge model. To address this, we introduce Tool-Augmented Credit Optimization (TACO), a GRPO variant for code-tool agents built on two coupled advantage channels. The first, Differential Answer-Probe Reward (DAPR), is a self-supervised, judge-free tool-contribution advantage that credits each tool call by its own effect on answering correctly. Probe tokens inserted into the model's reasoning elicit its predictions with and without the tool, and the difference in outcome reward is taken as the call's value: positive for a useful call, negative for a misleading one, and zero for one that changes nothing. This reuses the existing answer checker with no auxiliary judge, and, being a difference rather than an absolute probe score, is naturally robust to probe-hacking. The second is the outcome advantage from the final answer, distributed by Outcome-Gated Advantage Routing (OGAR): a parameter-free rule that, conditioned on the call's outcome, delivers this credit only to the responsible segments, suppressing wasted tool calls without any cost term. We train TACO through a two-stage SFT+RL pipeline. Extensive experiments across perception, reasoning, and general multimodal benchmarks show that it yields consistent accuracy gains and learns to invoke its tools only when they help.

cs.MA