ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents

TL;DR

ShortcutsBench提供大规模基准测试,评估API代理在复杂任务中的能力。

cs.SE 🔴 高级 2024-06-28 36 次浏览
Haiyang Shen Yue Li Desong Meng Dongqi Cai Sheng Qi Li Zhang Mengwei Xu Yun Ma
API 大语言模型 自动化 基准测试 复杂任务

核心发现

方法论

ShortcutsBench通过整合Apple的真实API、用户查询和人工注释的高质量动作序列,提供了一个全面的评估框架。该基准测试涵盖了API选择、参数填充和请求系统或用户输入的能力。

关键结果

  • 在API选择上,现有的API代理在处理复杂查询时表现出显著的局限性,准确率低于预期。
  • 参数填充任务中,尤其是从查询中提取必要参数,表现出较大的挑战。
  • 在请求必要输入的意识方面,代理缺乏足够的敏感性,导致任务完成率低。

研究意义

该研究为API代理在处理复杂查询中的不足提供了新的视角,揭示了现有方法在真实世界应用中的局限性。通过ShortcutsBench,研究者可以更好地理解和改进API代理的性能。

技术贡献

ShortcutsBench是首个大规模真实API基准,提供了丰富的API和任务类型,支持对API代理的全面评估。它还引入了参数填充和请求输入的评估,填补了现有基准的空白。

新颖性

ShortcutsBench首次结合真实API和用户需求,提供了一个全面的评估框架,超越了以往仅关注API选择的基准。

局限性

  • 现有API代理在处理多步骤任务时表现不佳,尤其是在参数填充和请求输入方面。
  • 基准测试主要基于Apple的API,可能限制了其在其他平台上的适用性。

未来方向

未来研究可以扩展到更多平台的API,探索更智能的参数填充方法,并提高代理请求输入的能力。

AI 总览摘要

近年来,随着大语言模型(LLM)与应用程序接口(API)的结合,API代理在学术界和工业界引起了广泛关注。然而,这些代理在处理多维度难度、不同任务类型和真实世界需求方面的能力仍不明确。ShortcutsBench通过整合Apple的真实API、用户查询和人工注释的高质量动作序列,提供了一个全面的评估框架。实验结果表明,现有API代理在处理复杂查询时存在显著局限,尤其是在API选择、参数填充和请求必要输入方面。该研究为API代理在真实世界应用中的不足提供了新的视角,并为未来研究指明了方向。

ShortcutsBench的设计基于从Apple Shortcuts中提取的数据,提供了丰富的API和任务类型,支持对API代理的全面评估。通过对10个领先的开源和闭源LLM的广泛评估,研究揭示了现有API代理在处理复杂查询中的不足,尤其是在参数填充和请求输入方面。研究结果表明,开源LLM在简单任务上已与闭源LLM相当,但在复杂任务上仍有差距。

未来研究可以扩展到更多平台的API,探索更智能的参数填充方法,并提高代理请求输入的能力。ShortcutsBench的开放源码和数据集为研究人员提供了丰富的资源,推动了API代理在真实世界应用中的发展。

深度分析

研究背景

近年来,随着大语言模型(LLM)的发展,API代理在学术界和工业界引起了广泛关注。通过将LLM与API结合,代理可以访问实时信息,减少幻觉,并计划和完成需要多步骤操作的复杂任务。然而,现有基准测试在评估代理处理复杂任务的能力方面存在不足。

核心问题

现有API代理在处理多维度难度、不同任务类型和真实世界需求方面的能力仍不明确。尤其是在API选择、参数填充和请求必要输入方面,代理的表现存在显著局限。

核心创新

ShortcutsBench通过整合Apple的真实API、用户查询和人工注释的高质量动作序列,提供了一个全面的评估框架。它首次结合真实API和用户需求,超越了以往仅关注API选择的基准。

方法详解

  • �� 收集Apple Shortcuts中的API和用户查询
  • �� 提供人工注释的高质量动作序列
  • �� 评估API选择、参数填充和请求输入的能力
  • �� 使用5个开源和5个闭源LLM进行广泛评估

实验设计

实验设计包括对10个领先的开源和闭源LLM的广泛评估,涵盖API选择、参数填充和请求输入的能力。使用的基准包括MetaTool和ToolBench等。

结果分析

实验结果表明,现有API代理在处理复杂查询时存在显著局限,尤其是在API选择、参数填充和请求输入方面。开源LLM在简单任务上已与闭源LLM相当,但在复杂任务上仍有差距。

应用场景

ShortcutsBench为API代理的评估提供了一个全面的框架,可用于改进代理在处理复杂任务中的性能。它为研究人员提供了丰富的资源,推动了API代理在真实世界应用中的发展。

局限与展望

现有API代理在处理多步骤任务时表现不佳,尤其是在参数填充和请求输入方面。基准测试主要基于Apple的API,可能限制了其在其他平台上的适用性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。API代理就像是厨房里的厨师助手,它可以帮你查找食谱、准备食材和烹饪步骤。ShortcutsBench就像是一个大型食谱书,里面有各种复杂的菜谱,帮助评估这些助手在处理复杂任务时的表现。然而,现有的助手在处理多步骤菜谱时表现不佳,尤其是在选择正确的食材和步骤时。ShortcutsBench通过提供丰富的菜谱和详细的步骤,帮助我们更好地理解和改进这些助手的表现。

简单解释 像给14岁少年讲一样

想象一下你在玩一个复杂的游戏,你有一个助手可以帮助你完成任务。这个助手可以帮你查找信息、选择工具和完成任务。ShortcutsBench就像是一个游戏指南,里面有各种复杂的任务,帮助评估这些助手在处理复杂任务时的表现。然而,现有的助手在处理多步骤任务时表现不佳,尤其是在选择正确的工具和步骤时。ShortcutsBench通过提供丰富的任务和详细的步骤,帮助我们更好地理解和改进这些助手的表现。

术语表

API (应用程序接口)

API是应用程序之间进行通信的接口,允许不同的软件系统相互交互。

在本文中,API用于评估代理在处理复杂任务时的能力。

LLM (大语言模型)

LLM是通过大量文本数据训练的模型,能够生成和理解自然语言。

在本文中,LLM与API结合用于创建智能代理。

ShortcutsBench

ShortcutsBench是一个大规模基准测试,用于评估API代理在复杂任务中的能力。

本文提出了ShortcutsBench作为评估框架。

参数填充

参数填充是指在API调用中填入必要的参数以完成任务。

本文评估了代理在参数填充任务中的表现。

请求输入

请求输入是指代理在任务中需要额外信息时,向系统或用户请求这些信息。

本文评估了代理在请求输入方面的能力。

开放问题 这项研究留下的未解疑问

  • 1 现有API代理在处理多步骤任务时表现不佳,尤其是在参数填充和请求输入方面。
  • 2 基准测试主要基于Apple的API,可能限制了其在其他平台上的适用性。

应用场景

近期应用

API代理评估

ShortcutsBench可用于评估和改进API代理在处理复杂任务中的性能。

远期愿景

跨平台应用

未来可以扩展到更多平台的API,探索更智能的参数填充方法。

原文摘要

Recent advancements in integrating large language models (LLMs) with application programming interfaces (APIs) have gained significant interest in both academia and industry. Recent work demonstrates that these API-based agents exhibit relatively strong autonomy and planning capabilities. However, their ability to handle multi-dimensional difficulty levels, diverse task types, and real-world demands remains unknown. In this paper, we introduce \textsc{ShortcutsBench}, a large-scale benchmark for the comprehensive evaluation of API-based agents in solving real-world complex tasks. \textsc{ShortcutsBench} includes a wealth of real APIs from Apple Inc., refined user queries, human-annotated high-quality action sequences, detailed parameter filling values, and parameters requesting necessary input from the system or user. We revealed how existing benchmarks~/~datasets struggle to accommodate the advanced reasoning capabilities of existing more intelligent LLMs. Moreover, our extensive evaluation of agents built with $5$ leading open-source (size $\geq$ 57B) and $5$ closed-source LLMs (e.g. Gemini-1.5-Pro and GPT-4o-mini) with varying intelligence level reveals significant limitations of existing API-based agents in the whole process of handling complex queries related to API selection, parameter filling, and requesting necessary input from the system and the user. These findings highlight the great challenges that API-based agents face in effectively fulfilling real and complex user queries. All datasets, code, experimental logs, and results are available at \url{https://github.com/EachSheep/ShortcutsBench}.

cs.SE cs.AI