UserBench: An Interactive Gym Environment for User-Centric Agents

TL;DR

UserBench评估用户互动能力,发现模型仅20%完全对齐用户意图。

cs.AI 🔴 高级 2025-07-30 1 次浏览
Cheng Qian Zuxin Liu Akshara Prabhakar Zhiwei Liu Jianguo Zhang Haolin Chen Heng Ji Weiran Yao Shelby Heinecke Silvio Savarese Caiming Xiong Huan Wang
用户交互 多轮对话 偏好揭示 工具使用 语言模型

核心发现

方法论

UserBench基于Gymnasium框架,模拟用户在旅行规划中的偏好揭示。环境提供模块化接口,支持工具增强的搜索,要求代理在不完整和间接信息下做出决策。

关键结果

  • 结果1:模型仅20%的时间完全对齐用户意图,揭示偏好不足30%。
  • 结果2:在单选设置下,模型得分平均下降40%。
  • 结果3:偏好揭示率低,尤其是通过主动查询揭示的偏好。

研究意义

UserBench填补了现有评估环境中用户互动能力的空白,强调了构建真正合作伙伴型代理的挑战。它为未来的研究提供了一个可扩展的测试平台,推动了用户中心代理的发展。

技术贡献

UserBench提供了一个系统化评估代理用户交互能力的环境,强调偏好揭示和工具使用的结合,挑战现有模型在不确定和动态用户需求下的表现。

新颖性

UserBench首次系统化地评估了代理在多轮对话中对用户偏好的揭示能力,与现有的工具使用评估形成鲜明对比。

局限性

  • 局限1:模型在偏好揭示上的表现不佳,尤其是在主动查询时。
  • 局限2:环境模拟的用户偏好可能不完全反映真实世界的复杂性。

未来方向

未来研究可集中于提高模型的用户偏好揭示能力,探索更复杂的用户模拟和多样化的交互场景。

AI 总览摘要

UserBench是一个新颖的用户中心评估环境,旨在测试大语言模型在多轮对话中的用户互动能力。现有模型在工具使用上表现出色,但在理解和适应用户需求方面仍有很大差距。

UserBench通过模拟用户在旅行规划中的偏好揭示,提供了一个模块化和可扩展的测试平台。实验结果表明,模型在单选设置下的得分平均下降40%,仅20%的时间完全对齐用户意图。

这一研究强调了构建真正合作伙伴型代理的挑战,推动了用户中心代理的发展。未来的研究方向包括提高模型的用户偏好揭示能力和探索更复杂的用户模拟。

深度分析

研究背景

近年来,大语言模型在推理和工具使用方面取得了显著进展。然而,它们在与用户的主动合作,尤其是在目标模糊、演变或间接表达时的能力仍未得到充分探索。

核心问题

现有评估环境往往忽略了用户在交互中的角色,导致模型在任务执行上表现出色,但在满足真实用户需求方面表现不佳。

核心创新

UserBench通过模拟用户在旅行规划中的偏好揭示,提供了一个系统化评估代理用户交互能力的环境。它强调了偏好揭示和工具使用的结合,挑战现有模型在不确定和动态用户需求下的表现。

方法详解

  • �� UserBench基于Gymnasium框架,模拟用户在旅行规划中的偏好揭示。
  • �� 提供模块化接口,支持工具增强的搜索。
  • �� 要求代理在不完整和间接信息下做出决策。

实验设计

实验设计包括对多个领先的开源和闭源模型的评估,采用单选和多选设置,测试模型在偏好揭示和工具使用上的表现。

结果分析

实验结果表明,模型在单选设置下的得分平均下降40%,仅20%的时间完全对齐用户意图,偏好揭示率低,尤其是通过主动查询揭示的偏好。

应用场景

UserBench为未来的研究提供了一个可扩展的测试平台,推动了用户中心代理的发展。

局限与展望

模型在偏好揭示上的表现不佳,尤其是在主动查询时,环境模拟的用户偏好可能不完全反映真实世界的复杂性。

通俗解读 非专业人士也能看懂

想象你在计划一次旅行,但你并不确定自己想要什么。UserBench就像一个聪明的助手,它会通过与你的对话,逐渐了解你的偏好,比如你喜欢直飞航班还是更便宜的选项。这个助手需要在你没有明确表达需求时,猜测你的真实意图,并帮助你做出最佳选择。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你是一个旅行计划师,客户告诉你他们想去哪里,但没有告诉你具体偏好。你需要通过提问来了解他们的喜好,比如他们喜欢什么样的酒店或餐厅。UserBench就是帮助AI在这种情况下更好地理解和帮助用户的工具!

术语表

Gymnasium框架

一种用于构建和评估强化学习环境的标准框架。

UserBench基于Gymnasium框架构建。

偏好揭示

通过交互逐渐了解用户的真实需求和偏好。

UserBench要求代理通过多轮对话揭示用户偏好。

工具增强搜索

使用外部工具来增强信息检索和决策能力。

UserBench支持工具增强的搜索功能。

多轮对话

在多次交互中逐渐揭示信息和达成目标的对话形式。

UserBench模拟用户在多轮对话中的偏好揭示。

用户中心代理

能够理解和适应用户需求的智能代理。

UserBench旨在评估用户中心代理的能力。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在偏好揭示上的表现?
  • 2 如何模拟更复杂的用户交互场景?

应用场景

近期应用

旅行规划助手

帮助用户在不确定需求的情况下进行旅行计划,通过多轮对话逐渐了解用户偏好。

远期愿景

智能客服系统

在各种服务场景中应用,帮助企业更好地理解和满足客户需求。

原文摘要

Large Language Models (LLMs)-based agents have made impressive progress in reasoning and tool use, enabling them to solve complex tasks. However, their ability to proactively collaborate with users, especially when goals are vague, evolving, or indirectly expressed, remains underexplored. To address this gap, we introduce UserBench, a user-centric benchmark designed to evaluate agents in multi-turn, preference-driven interactions. UserBench features simulated users who start with underspecified goals and reveal preferences incrementally, requiring agents to proactively clarify intent and make grounded decisions with tools. Our evaluation of leading open- and closed-source LLMs reveals a significant disconnect between task completion and user alignment. For instance, models provide answers that fully align with all user intents only 20% of the time on average, and even the most advanced models uncover fewer than 30% of all user preferences through active interaction. These results highlight the challenges of building agents that are not just capable task executors, but true collaborative partners. UserBench offers an interactive environment to measure and advance this critical capability.

cs.AI cs.CL cs.LG