The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

TL;DR

Tool Decathlon基准测试32应用,涵盖真实环境和长时任务,模型成功率仅38.6%。

cs.CL 🔴 高级 2025-10-30 47 次浏览
Junlong Li Wenshuo Zhao Jian Zhao Weihao Zeng Haoze Wu Xiaochen Wang Rui Ge Yuxuan Cao Yuzhen Huang Wei Liu Junteng Liu Zhaochen Su Yiyang Guo Fan Zhou Lueyang Zhang Juan Michelini Xingyao Wang Xiang Yue Shuyan Zhou Graham Neubig Junxian He
多应用场景 长时任务 环境真实 多工具调用 评估基准

核心发现

方法论

本研究设计了Tool Decathlon(Toolathlon)基准,涵盖32个软件应用和604个工具,模拟真实复杂环境。任务基于真实软件环境状态,采用环境初始化脚本,结合多轮交互,验证模型在长时、多应用场景中的表现。评估采用执行后环境状态比对,确保结果可靠。模型调用平均20次工具,最大成功率38.6%。

关键结果

  • 最优模型Claude-4.5-Sonnet成功率为38.6%,平均调用工具20.2次,显示模型在长时、多任务环境中表现不足。
  • 开源模型DeepSeek-V3.2-Exp成功率为20.1%,远低于商业模型,反映出长时任务的挑战。
  • 模型在多应用、多步骤交互中表现出对环境状态变化的适应不足,长上下文理解和工具调用错误是主要瓶颈。

研究意义

该基准突破了以往单一或简化任务的限制,逼真模拟多应用、多工具环境,推动长时、多任务语言智能体的发展。它揭示现有模型在复杂环境中的不足,为未来提升模型的泛化能力和鲁棒性提供了明确方向,具有重要的理论和实践意义。

技术贡献

提出基于真实软件环境的任务设计,结合环境初始化与执行验证,创新性地引入多应用、多工具、多轮交互评估框架。实现了环境状态的真实还原,增强了模型评估的可信度。引入多工具调用和长上下文管理机制,提升模型在复杂场景中的适应能力。

新颖性

首次系统性建立涵盖多行业、多应用、多工具的长时任务基准,强调环境状态的真实性和任务复杂性。区别于以往偏重功能模拟或简化环境的工作,Toolathlon强调环境真实还原和执行验证,推动长时任务智能体研究迈向实用化。

局限性

  • 当前模型在极端复杂环境和多应用协同中仍表现不足,特别是在长上下文理解和错误追踪方面。
  • 环境状态初始化依赖真实软件环境,部署成本较高,难以规模化应用。
  • 模型训练和推理的计算成本较大,未来需优化效率。

未来方向

未来将引入更大规模、多样化的任务集,提升模型在多行业、多应用场景下的泛化能力。探索更高效的环境模拟与状态管理技术,增强模型的长时记忆和错误修正能力。同时,推动开源工具和数据的共享,促进社区合作。

AI 总览摘要

随着人工智能技术的快速发展,基于语言模型的智能体在自动化任务中的应用逐渐扩大。然而,现有评测多局限于狭窄场景或简化任务,难以衡量模型在真实复杂环境中的表现。Tool Decathlon(Toolathlon)应运而生,旨在填补这一空白。该基准涵盖32个行业应用和604个工具,模拟真实软件环境,设计了108个多轮、多应用的长时任务,充分反映实际工作场景的复杂性。

通过引入真实环境状态初始化和严格的执行验证机制,Toolathlon确保评估的可靠性与可复现性。实验结果显示,最优模型Claude-4.5-Sonnet的成功率仅为38.6%,平均调用工具20.2次,远低于理想水平。这揭示了当前模型在长时、多任务、多应用环境中的显著不足,特别是在环境理解和错误追踪方面。

该基准的推出,为未来开发更具泛化能力和鲁棒性的语言智能体提供了宝贵的参考。它不仅推动模型在复杂环境中的适应性提升,也为工业界提供了衡量工具,助力智能自动化的落地。未来,Toolathlon将持续扩展任务规模,优化环境模拟技术,促进学术界与产业界的深度合作,推动智能体技术迈向更高水平。

深度分析

研究背景

近年来,基于大规模预训练模型的语言智能体在自动化和交互任务中展现出巨大潜力。早期工作如GPT系列、BERT等推动了自然语言理解的突破,但在多应用、多步骤长时任务中的表现仍有限。现有基准如MCPMark、GAIA2等,虽涵盖多应用,但多偏重于单一任务或环境简化,难以反映实际复杂场景。随着工业需求的增长,迫切需要更真实、多样化的评估体系,以衡量模型在真实环境中的能力。

核心问题

当前模型在多应用、多轮交互、长上下文理解方面存在明显短板。许多基准未能模拟真实软件环境的复杂性,导致模型在实际场景中表现不佳。尤其是在环境状态的初始化、多工具调用的准确性以及错误追踪方面,缺乏系统性评估。这限制了模型的实际应用推广,也阻碍了技术的进一步突破。

核心创新

本研究提出Toolathlon基准,创新点包括:

  • �� 真实软件环境还原:采用真实应用的环境状态初始化,提升场景真实性。
  • �� 多应用、多工具、多轮交互:设计复杂任务,模拟实际工作流程。
  • �� 执行验证机制:通过环境状态比对确保任务完成的可靠性。
  • �� 高效评估框架:支持并行、多环境隔离,提升评测效率。
  • �� 任务多样性:涵盖教育、金融、企业管理等多个行业,拓展模型适应范围。

方法详解

  • �� 任务设计:从真实场景采集任务,确保多样性与复杂性。
  • �� 环境初始化:利用脚本和真实软件,设置复杂环境状态。
  • �� 工具集成:引入32个MCP服务器,支持多行业应用。
  • �� 交互流程:模型需多轮推理与工具调用,完成任务。
  • �� 评估机制:通过环境状态比对,确保结果的准确性。
  • �� 评测效率:采用容器隔离与并行执行,快速反馈模型性能。

实验设计

采用真实软件环境和模拟任务,评估Claude-4.5-Sonnet、DeepSeek-V3.2-Exp等模型。指标包括成功率、调用次数等。实验设置包括环境初始化、任务复杂度控制、模型参数调优。通过多轮试验,分析模型在不同任务中的表现差异,验证环境真实性与评估可靠性。

结果分析

最优模型成功率38.6%,调用平均20.2次,明显低于理想状态。开源模型成功率20.1%,显示长时、多应用场景挑战巨大。模型在多轮交互中对环境变化适应不足,长上下文理解和错误追踪成为瓶颈。结果表明,提升模型的环境理解和工具调用鲁棒性,是未来研究重点。

应用场景

该基准适用于开发面向工业应用的智能自动化工具,如企业流程自动化、客户服务机器人、智能助理等。模型需在复杂、多应用环境中表现出强鲁棒性和长时记忆能力,推动自动化水平提升,降低人力成本。

局限与展望

环境模拟成本高,难以大规模部署;模型在极端复杂场景中表现仍不足,特别是在多工具协同和错误修正方面。未来需优化环境搭建和模型效率,增强泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里有许多不同的机器和工序。每个机器都需要特定的操作,有时你需要用不同的工具来完成任务。比如,你要修理一台机器,可能需要先找到正确的工具,然后检查机器状态,最后用工具修理。这个过程很复杂,因为每个步骤都要正确,环境也可能随时变化。现在,假设你有一个智能助手,它可以帮你找到工具、检查机器、甚至自己修理。这个助手要学会理解工厂的复杂环境,合理安排每一步,确保任务完成。Toolathlon就像这个工厂的模拟环境,测试这个助手能不能在真实复杂的工厂里工作得很好。

简单解释 像给14岁少年讲一样

想象你在学校里,有个超级聪明的朋友,他可以帮你安排一天的计划。可是,这个朋友不只是帮你写作业,还能帮你安排课表、找资料、发邮件给老师,还要在不同的电脑和应用之间切换。这个朋友得理解你说的话,知道你要做什么,然后用不同的工具帮你完成任务。有时候,他还会遇到问题,比如电脑出错或者找不到资料,但他会自己想办法解决。这个朋友就像一个超级智能的机器人,能在复杂的环境中帮你搞定各种任务。Toolathlon测试的,就是这样一个能在真实、复杂环境中工作的小助手,看它能不能像你理想中的那样聪明、可靠。

术语表

Model Context Protocol(模型上下文协议)

一种标准,用于连接语言模型与各种应用,确保信息传递和环境同步。

论文中描述的工具连接和环境状态管理机制。

环境状态初始化(Environment State Initialization)

在任务开始前设置环境的初始状态,确保模拟真实场景。

用于模拟复杂环境的真实起点。

执行验证(Execution Verification)

通过比对环境状态确认任务是否成功完成,确保评估的准确性。

模型输出的结果通过环境状态验证。

多轮交互(Multi-turn Interaction)

模型与环境或用户多次交互,逐步完成复杂任务。

评估模型在长时、多步骤任务中的能力。

工具调用(Tool Calling)

模型识别需要的工具并调用以完成任务的过程。

模型在评估中的关键操作。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂环境中的鲁棒性和长时记忆能力,仍需探索更高效的环境模拟和错误追踪机制。当前模型在多工具协同和环境适应方面存在明显不足,未来需结合强化学习和持续学习技术进行突破。

应用场景

近期应用

企业自动化流程

利用模型实现跨应用的自动化操作,如财务、客户管理等,提升效率和准确性。

智能助理开发

开发能在多场景中协作的智能助手,支持长时任务和多工具调用,改善用户体验。

远期愿景

全面自动化工业系统

实现工厂、交通、医疗等行业的全自动化,减少人力成本,提升安全性和效率。

原文摘要

Real-world language agents must handle complex, multi-step workflows across diverse Apps. For instance, an agent may manage emails by coordinating with calendars and file systems, or monitor a production database to detect anomalies and generate reports following an operating manual. However, existing language agent benchmarks often focus on narrow domains or simplified tasks that lack the diversity, realism, and long-horizon complexity required to evaluate agents' real-world performance. To address this gap, we introduce the Tool Decathlon (dubbed as Toolathlon), a benchmark for language agents offering diverse Apps and tools, realistic environment setup, and reliable execution-based evaluation. Toolathlon spans 32 software applications and 604 tools, ranging from everyday platforms such as Google Calendar and Notion to professional ones like WooCommerce, Kubernetes, and BigQuery. Most of the tools are based on a high-quality set of Model Context Protocol (MCP) servers that we may have revised or implemented ourselves. Unlike prior works, which primarily ensure functional realism but offer limited environment state diversity, we provide realistic initial environment states from real software, such as Canvas courses with dozens of students or real financial spreadsheets. This benchmark includes 108 manually sourced or crafted tasks in total, requiring interacting with multiple Apps over around 20 turns on average to complete. Each task is strictly verifiable through dedicated evaluation scripts. Comprehensive evaluation of SOTA models highlights their significant shortcomings: the best-performing model, Claude-4.5-Sonnet, achieves only a 38.6% success rate with 20.2 tool calling turns on average, while the top open-weights model DeepSeek-V3.2-Exp reaches 20.1%. We expect Toolathlon to drive the development of more capable language agents for real-world, long-horizon task execution.

cs.CL cs.AI