DolphinBench: Mapping the Pareto Frontier of Agent Memory

TL;DR

DolphinBench通过任务完成评估代理记忆,最高准确率70.67%。

cs.CL 🔴 高级 2026-09-22 4 次浏览
Soumil Rathi Deshraj Yadav Taranjeet Singh
代理记忆 成本评估 延迟 任务完成 数据集

核心发现

方法论

DolphinBench通过模拟真实世界任务来评估代理的记忆能力。包括三个角色:创业公司CEO、基础设施工程师和产品经理。每个角色有约50万字的用户消息历史,测试代理在这些历史信息基础上的任务完成情况。

关键结果

  • 最高准确率为70.67%,使用Hermes和Mem0系统。
  • 不同配置下,成本和延迟差异显著,Hermes和GPT-5.6-Luna组合表现最佳。
  • 实验显示,成本较低的配置并不一定准确率低。

研究意义

该研究通过直接任务完成来评估记忆,提供了全面的成本、延迟和准确率报告。填补了现有记忆基准测试的空白,为代理记忆系统的全面评估提供了新方法。

技术贡献

DolphinBench结合了任务完成、成本和延迟报告,提供了全面的记忆系统评估。验证了每个测试的可解性,确保了结果的可靠性。

新颖性

首次通过任务完成而非简单问答来评估记忆,提供了更真实的代理使用场景。与现有基准测试相比,增加了成本和延迟的评估。

局限性

  • 数据集为合成而非真实用户数据,可能不完全反映真实写作风格。
  • 仅覆盖了三个角色,未涉及法律、医学等领域。
  • 代理与模拟应用交互,未测试真实系统中的故障。

未来方向

未来可扩展至更多角色,增加任务长度,并测试代理在持续对话中的记忆处理能力。

AI 总览摘要

DolphinBench是一个新型基准测试,通过模拟真实世界任务来评估代理的记忆能力。现有的记忆基准测试通常依赖于问答格式,无法全面评估代理在实际任务中的表现。DolphinBench通过定义三个角色,模拟多年对话历史,并测试代理在这些历史信息基础上的任务完成情况,从而提供了更真实的评估。

实验结果显示,使用Hermes和Mem0系统的代理在70.67%的任务中表现最佳。该基准测试不仅评估了准确率,还报告了成本和延迟,使得评估更加全面。不同配置下的成本和延迟差异显著,显示了配置选择对代理性能的影响。

DolphinBench的创新之处在于结合了任务完成、成本和延迟报告,提供了全面的记忆系统评估。未来的工作可以扩展至更多角色,增加任务长度,并测试代理在持续对话中的记忆处理能力,以更好地模拟真实世界的使用场景。

深度分析

研究背景

随着代理在软件工程、客户服务等领域的应用,评估其记忆能力变得至关重要。现有的记忆基准测试多为问答格式,无法全面评估代理在实际任务中的表现。DolphinBench通过模拟真实世界任务来评估代理的记忆能力,填补了这一空白。

核心问题

现有记忆基准测试依赖于问答格式,无法全面评估代理在实际任务中的表现。需要一种能够直接通过任务完成来评估代理记忆的方法。

核心创新

DolphinBench通过定义三个角色,模拟多年对话历史,并测试代理在这些历史信息基础上的任务完成情况。结合了任务完成、成本和延迟报告,提供了全面的记忆系统评估。

方法详解

  • �� 定义三个角色:创业公司CEO、基础设施工程师和产品经理。
  • �� 模拟多年对话历史,生成约50万字的用户消息。
  • �� 测试代理在这些历史信息基础上的任务完成情况。
  • �� 报告成本、延迟和准确率。

实验设计

实验使用多个代理配置,包括Hermes、Mem0、Honcho等。测试了每个配置的准确率、成本和延迟。通过不同配置的比较,评估了代理记忆系统的性能。

结果分析

最高准确率为70.67%,使用Hermes和Mem0系统。不同配置下,成本和延迟差异显著,显示了配置选择对代理性能的影响。成本较低的配置并不一定准确率低。

应用场景

可用于评估代理在真实世界任务中的记忆能力。适用于软件工程、客户服务等领域,帮助选择最佳代理配置。

局限与展望

数据集为合成而非真实用户数据,可能不完全反映真实写作风格。仅覆盖了三个角色,未涉及法律、医学等领域。代理与模拟应用交互,未测试真实系统中的故障。

通俗解读 非专业人士也能看懂

想象你在一个厨房里,DolphinBench就像一个厨师助手。它不仅记得你喜欢的食材,还能根据过去的对话帮你做出美味的菜肴。现有的助手只会问你想吃什么,而DolphinBench能根据你的习惯和过去的选择,自动为你准备好一切。它不仅考虑到菜的味道,还会告诉你做这道菜需要多少时间和成本。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个游戏,你的角色需要记住过去的任务来完成新的挑战。DolphinBench就像一个超级记忆助手,帮你记住所有重要的信息。它不仅告诉你怎么完成任务,还会告诉你完成任务需要多少时间和资源。有了它,你就能更快更好地完成游戏中的所有挑战!

术语表

DolphinBench (海豚基准)

一种用于评估代理记忆能力的基准测试,通过任务完成来评估。

用于测试代理在模拟任务中的记忆表现。

Mem0 (记忆零)

一种记忆系统,用于提高代理在任务中的表现。

在实验中表现最佳的记忆系统之一。

Hermes (赫尔墨斯)

一种代理框架,用于测试代理的记忆能力。

与Mem0结合使用时表现最佳。

GPT-5.6-Luna (GPT-5.6-露娜)

一种语言模型,用于代理的任务完成。

在实验中使用的语言模型之一。

Honcho (头目)

一种记忆基础设施,用于支持代理的状态管理。

在某些配置中表现良好。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实用户数据上验证DolphinBench的有效性?
  • 2 如何扩展至更多领域,如法律和医学?
  • 3 如何在持续对话中测试代理的记忆处理能力?

应用场景

近期应用

软件工程

帮助开发者选择最佳代理配置,提高项目管理效率。

客户服务

通过记忆系统提高客户服务代理的响应速度和准确率。

远期愿景

跨领域应用

扩展至法律、医学等领域,提供更广泛的记忆评估。

原文摘要

Agents today often take real-world actions that depend on long-term memory and context recall over time. However, most current memory benchmarks are built for a conversational question-answer format, where the question itself signals that some fact must be retrieved, and often which one. Moreover, benchmarks rarely require anything beyond accuracy from submissions, allowing memory systems to make unreasonable cost/time tradeoffs to achieve higher scores. We present DolphinBench, a benchmark that evaluates memory directly through an agent's task completion. DolphinBench includes three knowledge-work personas with roughly 500k tokens of user messages per persona and evaluates agents on tasks that depend on information from that history. We verify all 200 tasks per persona by running an agent with and without the relevant history, requiring success with it and failure without it. Finally, we require all evaluations to report total cost and latency alongside accuracy, which enables us to evaluate agent memory systems holistically. No existing memory benchmark combines all three. The dataset and evaluation code are available at https://dolphinbench.ai.

cs.CL cs.AI