RAFFLES: Reasoning-based Attribution of Faults for LLM Systems

TL;DR

RAFFLES通过迭代推理检测LLM系统故障,在Who&When数据集上准确率提升50%。

cs.AI 🔴 高级 2025-09-08 32 次浏览
Chenyang Zhu Spencer Hong Jingyu Wu Kushal Chawla Charlotte Tang Youbing Yin Nathan Wolfe Erin Babinsky Daben Liu
LLM 故障检测 推理 自动化 多组件系统

核心发现

方法论

RAFFLES是一种离线评估架构,结合了迭代推理。其核心是一个中央Judge和多个专用Evaluator。Judge负责系统性识别故障,而Evaluator评估候选故障的质量和Judge的推理理由。通过这种多组件流水线,RAFFLES能够更精准地定位故障。

关键结果

  • RAFFLES在Who&When数据集上,手工生成数据集的准确率从18.20%提升至27.59%,算法生成数据集从38.10%提升至51.59%。
  • 在ReasonEval数据集上,RAFFLES的准确率超过80%,显著优于基线方法。
  • 通过结构化推理,RAFFLES在多种模型家族中表现出色,尤其在复杂的长轨迹中。

研究意义

RAFFLES显著提升了自动化故障检测的能力,减少了人工审查的工作量。这一研究为自主系统的评估提供了新的思路,能够更好地理解复杂系统中的故障来源和形成时间,填补了当前评估策略的空白。

技术贡献

RAFFLES引入了结构化推理的Judge-Evaluator架构,提供了新的理论保证和工程可能性。与现有方法相比,RAFFLES在检测复杂系统故障方面表现出色,尤其是在长轨迹和多组件系统中。

新颖性

RAFFLES首次结合迭代推理和多组件评估框架,能够在复杂的LLM系统中准确定位故障。这种方法在故障检测领域开创了新的方向,与现有的单次评估方法有根本区别。

局限性

  • RAFFLES在处理极长的轨迹时可能会遇到性能瓶颈,尤其是在计算资源有限的情况下。
  • 对于某些特定的故障类型,RAFFLES可能需要进一步优化以提高检测精度。

未来方向

未来的研究可以探索RAFFLES在其他类型的多组件系统中的应用,并优化其在极端条件下的性能。此外,结合实时评估技术可能进一步提升其实用性。

AI 总览摘要

随着大型语言模型(LLM)系统的复杂性增加,识别这些系统何时何地出现故障变得极为困难。现有的评估方法通常依赖简单的指标和人工审查,难以应对多组件系统的复杂性。RAFFLES通过引入迭代推理和多组件评估框架,提供了一种新的解决方案。

RAFFLES的核心是一个中央Judge和多个专用Evaluator。Judge负责识别系统中的故障,而Evaluator则评估候选故障的质量和Judge的推理理由。这种结构化的推理过程使得RAFFLES能够在复杂的长轨迹中准确定位故障。

实验结果显示,RAFFLES在Who&When和ReasonEval数据集上的表现显著优于基线方法,尤其是在复杂的多组件系统中。通过减少人工审查的工作量,RAFFLES为自动化故障检测提供了新的可能性。然而,在处理极长轨迹时,RAFFLES仍面临性能挑战,未来的研究将致力于优化其在极端条件下的表现。

深度分析

研究背景

随着LLM系统的不断发展,评估其性能和故障检测变得愈发重要。传统方法通常依赖于简单的指标和人工审查,难以应对复杂的多组件系统。近年来,诸如ReAct、Toolformer等语言条件代理架构的出现,使得系统能够在长时间范围内进行计划、推理和行动,但也引入了新的故障模式。

核心问题

现有的评估策略主要集中在孤立的指标上,难以检测长轨迹中的故障。这导致了人工调试成为唯一的方法,耗时且成本高昂。在多组件系统中,一个微小的错误可能迅速扩散,导致一系列意外行为。因此,自动化故障归因成为评估社区的一个新兴焦点。

核心创新

RAFFLES通过引入结构化推理的Judge-Evaluator架构,能够在复杂的LLM系统中准确定位故障。与现有的单次评估方法不同,RAFFLES结合了迭代推理和多组件评估框架,能够更好地理解复杂系统中的故障来源和形成时间。

方法详解

  • �� RAFFLES使用中央Judge识别故障,并通过多个Evaluator评估候选故障的质量。
  • �� Judge提供结构化推理理由,Evaluator评估其合理性并给出置信度评分。
  • �� 通过迭代推理,Judge不断调整其评估策略,直至确定决定性故障。

实验设计

实验在Who&When和ReasonEval数据集上进行,使用多种模型进行评估。RAFFLES在这些数据集上的表现显著优于基线方法,尤其是在复杂的长轨迹中。实验设计包括多种基线方法的比较,以及不同模型家族的性能评估。

结果分析

RAFFLES在Who&When数据集上,手工生成数据集的准确率从18.20%提升至27.59%,算法生成数据集从38.10%提升至51.59%。在ReasonEval数据集上,RAFFLES的准确率超过80%,显著优于基线方法。

应用场景

RAFFLES可用于复杂的多组件系统中的故障检测,减少人工审查的工作量。其在长轨迹中的优异表现使其适用于需要高精度故障检测的场景,如自动驾驶、智能客服等。

局限与展望

RAFFLES在处理极长轨迹时可能会遇到性能瓶颈,尤其是在计算资源有限的情况下。此外,对于某些特定的故障类型,RAFFLES可能需要进一步优化以提高检测精度。

通俗解读 非专业人士也能看懂

想象你在一个复杂的工厂工作,工厂里有许多机器和工人一起工作。每个工人都有自己的任务,但如果一个工人犯了错误,可能会影响整个生产线。RAFFLES就像一个聪明的经理,能够快速找出哪个工人在什么时候犯了错误,并告诉他们如何改正。这样,工厂就能更高效地运行,不需要花费太多时间去找出问题所在。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的电子游戏,游戏里有很多角色,每个角色都有自己的任务。有时候,一个角色可能会犯错,导致整个游戏进程出问题。RAFFLES就像一个超级聪明的游戏助手,它能帮你找出哪个角色在哪一步出了问题,并告诉你如何修正。这样,你就能更快地通关,不用一直卡在某个地方!

术语表

RAFFLES (推理故障归因框架)

RAFFLES是一种用于LLM系统故障检测的离线评估架构,结合了迭代推理和多组件评估。

用于识别和评估复杂系统中的故障。

Judge (评判者)

RAFFLES中的中央组件,负责识别系统故障并提供推理理由。

在RAFFLES框架中用于初步识别故障。

Evaluator (评估者)

RAFFLES中的组件,负责评估Judge识别的候选故障的质量。

用于评估故障的合理性和置信度。

Who&When数据集

一个用于多代理系统故障归因的基准数据集,包含代理日志和故障对。

用于测试RAFFLES在多组件系统中的性能。

ReasonEval数据集

一个用于数学推理错误诊断的基准数据集,包含推理链的步骤级注释。

用于验证RAFFLES在复杂推理链中的有效性。

开放问题 这项研究留下的未解疑问

  • 1 如何在极长轨迹中提高RAFFLES的性能?当前方法在计算资源有限时表现不佳。
  • 2 RAFFLES在处理特定故障类型时的精度如何提升?需要进一步优化。

应用场景

近期应用

自动驾驶故障检测

RAFFLES可用于检测自动驾驶系统中的故障,减少人工干预,提高安全性。

远期愿景

智能客服系统优化

通过RAFFLES,智能客服系统可以更快地识别和修正错误,提升用户体验。

原文摘要

The advent of complex, interconnected long-horizon LLM systems has made it incredibly tricky to identify where and when these systems break down. Evaluation capabilities that currently exist today are limited in that they often focus on simple metrics, end-to-end outcomes, and are dependent on the perspectives of humans. In order to match the increasing complexity of these many component systems, evaluation frameworks must also be able to reason, probe, iterate, and understand the nuanced logic passing through these systems. In this paper, we present RAFFLES, an offline evaluation architecture that incorporates iterative reasoning. Specifically, RAFFLES operates as an iterative, multi-component pipeline, using a central Judge to systematically identify faults and a set of specialized Evaluators to assess the quality of the candidate faults as well as rationales of the Judge. We evaluated RAFFLES with several benchmarks - the Who&When dataset to identify step-level faults in multi-agent systems and the ReasonEval datasets to diagnose step-level mathematical reasoning errors. RAFFLES outperforms strong baselines, achieving an accuracy of over 20% and 50% on the Who&When Hand-Crafted and Algorithmically-Generated datasets, and over 80% on the ReasonEval datasets. These results demonstrate a key step towards introducing automated fault detection for autonomous systems over labor-intensive manual review.

cs.AI cs.CL