Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity

TL;DR

研究表明,当前的LLM代理缺乏环境好奇心,尽管在79-81%的情况下发现了解决方案,但仅在37-50%的情况下利用。

cs.CL 🔴 高级 2026-04-20 5 次浏览
Leon Engländer Sophia Althammer Ahmet Üstün Matthias Gallé Tom Sherborne
环境好奇心 大语言模型 解决方案注入 人工智能 任务执行

核心发现

方法论

研究采用了解决方案注入法,将完整的任务解决方案直接注入到环境中,以评估代理的环境好奇心。通过在Terminal-Bench、SWE-Bench和AppWorld三个基准上进行实验,分析代理是否能发现并利用这些解决方案。

关键结果

  • 在Terminal-Bench中,代理在79-81%的运行中发现了解决方案,但仅在37-50%的情况下利用了这些解决方案,显示出明显的发现与利用之间的差距。
  • 在AppWorld中,尽管代理在超过90%的尝试中看到了解决方案API的文档,但仅在不到7%的尝试中调用了该API。
  • 研究发现,工具的可用性、推理预算和训练数据分布是影响环境好奇心的三个关键因素。

研究意义

这项研究揭示了当前LLM代理在面对意外但相关的信息时缺乏反应能力的问题,这对学术界和工业界都有重要影响。通过识别影响环境好奇心的因素,研究为提高代理的任务执行能力提供了新的视角。

技术贡献

研究提出了环境好奇心的概念,并开发了解决方案注入方法来评估代理的能力。这种方法为衡量代理在面对意外信息时的反应提供了新的指标,如discovery@k和interaction@k。

新颖性

本研究首次系统地评估了LLM代理的环境好奇心,提出了解决方案注入这一创新方法,与现有的任务成功率评估方法形成鲜明对比。

局限性

  • 当前的代理在大多数情况下仍然忽视已发现的解决方案,表明问题不仅仅在于推理时的配置。
  • 训练数据的分布也限制了代理的环境好奇心,尤其是在狭窄的分布上进行微调时。

未来方向

未来的研究可以探索如何在训练阶段增强代理的环境好奇心,以及如何在推理阶段更好地利用已发现的信息。

AI 总览摘要

当前的LLM代理在处理复杂任务时,常常需要探索环境以获取相关信息。然而,研究发现,这些代理在面对意外但相关的信息时,往往缺乏足够的好奇心来充分利用这些信息。

研究采用了解决方案注入法,将完整的任务解决方案直接注入到环境中,以评估代理的环境好奇心。实验结果显示,尽管代理在大多数情况下能够发现这些解决方案,但很少能有效利用它们。

这一发现揭示了当前代理在任务执行中的一个关键缺陷,并为未来的研究提供了新的方向,即如何增强代理的环境好奇心以提高其任务执行能力。

深度分析

研究背景

大语言模型(LLM)在处理复杂任务时,通常需要探索环境以获取相关信息。然而,现有研究表明,这些模型在面对意外但相关的信息时,往往缺乏足够的好奇心来充分利用这些信息。

核心问题

当前LLM代理在面对意外但相关的信息时,缺乏足够的好奇心来充分利用这些信息。这一问题限制了代理在复杂任务中的表现。

核心创新

研究提出了环境好奇心的概念,并开发了解决方案注入方法来评估代理的能力。这种方法为衡量代理在面对意外信息时的反应提供了新的指标,如discovery@k和interaction@k。

方法详解

  • �� 采用解决方案注入法,将完整的任务解决方案直接注入到环境中。
  • �� 在Terminal-Bench、SWE-Bench和AppWorld三个基准上进行实验。
  • �� 评估代理是否能发现并利用这些解决方案。

实验设计

在Terminal-Bench、SWE-Bench和AppWorld三个基准上进行实验,评估代理是否能发现并利用注入的解决方案。实验使用了不同的工具配置和推理预算。

结果分析

实验结果显示,尽管代理在大多数情况下能够发现注入的解决方案,但很少能有效利用它们。这一发现揭示了代理在任务执行中的一个关键缺陷。

应用场景

研究结果可用于提高LLM代理在复杂任务中的表现,尤其是在需要探索环境以获取相关信息的任务中。

局限与展望

当前的代理在大多数情况下仍然忽视已发现的解决方案,表明问题不仅仅在于推理时的配置。

通俗解读 非专业人士也能看懂

想象你在一个迷宫中寻找出口。你有一张地图,但地图上没有标出所有的捷径。你可能会发现一些隐藏的门,但你通常不会去尝试打开它们,因为你不知道它们是否会帮助你更快地到达出口。这就像当前的LLM代理,它们在探索环境时,往往忽视了那些可能有用的信息。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,目标是找到隐藏的宝藏。你有一些线索,但有时候你会发现一些意外的提示。问题是,你的角色并不总是会去调查这些提示,因为它们不在你的计划中。这就是研究中发现的问题:当前的AI在面对意外信息时,常常忽视了这些信息。

术语表

环境好奇心

指代理在面对意外但相关的信息时,能否识别并调查这些信息的能力。

用于评估代理在任务执行中的表现。

解决方案注入

一种将完整任务解决方案直接注入到环境中的方法,用于评估代理的环境好奇心。

用于实验评估代理的能力。

discovery@k

衡量代理在k次尝试中至少一次发现注入解决方案的概率。

用于评估代理的发现能力。

interaction@k

衡量代理在k次尝试中至少一次与注入解决方案交互的概率。

用于评估代理的利用能力。

推理预算

指代理在任务执行中可用的计算资源和时间。

影响代理的环境好奇心。

开放问题 这项研究留下的未解疑问

  • 1 如何在训练阶段增强代理的环境好奇心?
  • 2 在推理阶段,如何更好地利用已发现的信息?

应用场景

近期应用

任务执行优化

通过增强代理的环境好奇心,提高其在复杂任务中的表现。

远期愿景

智能代理发展

开发更具环境适应能力的智能代理,以应对更复杂的任务。

原文摘要

LLM-based agents are assumed to integrate environmental observations into their reasoning: discovering highly relevant but unexpected information should naturally lead to a model exploiting its own discoveries. We show that this assumption is false for current LLM-based agents, which struggle to reflect or react to unexpected information. Across three benchmarks (Terminal-Bench, SWE-Bench, AppWorld), we inject complete task solutions into the agent environments to deliberately expose a task's solution to a model. While agents discover these solutions on Terminal-Bench in 79-81% of runs, they interact, or exploit, them in only 37-50% of cases. This gap is starkest in AppWorld: agents see documentation stating that a command "returns the complete solution to this task" in over 90% of attempts but exploit this in fewer than 7% of trials. We show that agents lack what we call environmental curiosity: the capability to recognize and investigate unexpected but relevant observations in response to environmental stimuli. We identify three main factors influencing environmental curiosity: available tools in the agent scaffold, test-time compute, and training data distribution. Our findings identify configurations that maximize curiosity also achieve the best performance on the unmodified benchmarks. Yet even jointly optimized agents still ignore discovered solutions in the majority of trials: current agents use the environment to fetch expected information, but not to revise their strategy or maximally exploit useful stimuli.

cs.CL cs.LG