Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

TL;DR

提出轨迹级评估框架,结合微服务故障传播路径,分析3500诊断轨迹,提升根因分析准确率。

cs.SE 🔴 高级 2026-08-22 88 次浏览
Qisheng Lu Aoyang Fang Junjielong Xu Jin'ao Shang Songhan Zhang Yifan Yang Xiaochuan Yan Pinjia He
微服务 根因分析 大语言模型 轨迹分析 AIOps

核心发现

方法论

本文构建基于手工验证的服务级故障传播路径,结合多轮诊断轨迹,采用归一化策略对异构代理行为进行对比分析。通过定义路径重建、证据利用和意图分类等指标,系统评估诊断过程中的行为偏差。利用六种不同框架在公共微服务基准上进行3500轨迹的实证分析,揭示诊断成功与失败的关键差异。引入两阶段防御架构DiagGuard,结合证据调查与验证机制,有效提升根因定位准确率,从43.5%提升至52.5%。

关键结果

  • 在微服务故障传播路径重建中,正确定位的轨迹中节点F1平均达0.75,边F1达0.68,深度越深,重建难度越大。诊断成功的轨迹保持在故障影响面,主动利用检索到的证据,查询范围逐步扩大;失败轨迹则偏离路径,遗漏关键证据或误解证据含义。引入DiagGuard后,Acc@1提升约9个百分点,验证其在不同模型和拓扑上的泛化能力。
  • 在不同模型和基准上,轨迹级指标揭示了传统终局准确率的局限性,显示路径重建能力是提升诊断质量的关键。实验证明,路径重建难度与路径深度正相关,且证据利用的深度与成功率显著相关。

研究意义

该研究突破了以终局正确率为唯一评价指标的局限,强调诊断过程的轨迹分析能揭示潜在的行为偏差与系统性缺陷,为微服务根因分析提供更细粒度的诊断依据。其提出的路径重建和证据利用机制,为未来自动化运维中的故障溯源提供了理论基础和技术方案,有助于提升系统的可靠性与可维护性。

技术贡献

本文创新性地提出轨迹级诊断框架,将故障传播路径作为过程级验证依据,结合多轮查询与证据分析,设计了路径重建指标和意图分类方法。引入两阶段防御架构DiagGuard,有效结合证据调查与验证,显著改善根因定位准确率。实证验证显示,该方法在不同模型和拓扑上具有良好的泛化能力,推动了微服务自动化根因分析的研究前沿。

新颖性

首次系统性将路径重建作为诊断过程的核心指标,结合轨迹分析揭示诊断中的行为偏差。不同于传统仅关注终局标签的方法,本文强调诊断路径的完整性和证据利用的深度,提出两阶段防御机制,为自动化根因分析提供新思路。这在微服务故障溯源领域具有开创性意义。

局限性

  • 当前路径重建依赖手工标注的故障传播路径,存在标注成本高和适应性不足的问题。模型在深层路径和复杂拓扑中仍面临重建困难,部分证据误解或遗漏难以完全避免。实验环境偏向静态场景,动态系统中的适应性和实时性仍需验证。未来需探索自动路径标注和多模态融合技术,以提升鲁棒性。

未来方向

未来将结合自动路径推断和动态故障模型,提升路径重建的自动化水平。计划引入强化学习优化查询策略,增强路径探索能力。同时,结合实际工业场景,验证方法在大规模分布式系统中的适应性和实时性,推动工业级故障溯源工具的落地应用。还将探索多模态数据融合,丰富证据源,提升诊断的全面性和准确性。

AI 总览摘要

在微服务架构中,故障传播路径的复杂性使得单纯依赖最终诊断结果难以满足实际运维需求。传统方法多关注终局正确率,忽视诊断过程中的行为偏差与证据利用。本文提出轨迹级评估框架,将诊断过程拆解为多轮查询、证据采集与路径重建,结合手工验证的故障传播路径,系统分析3500条诊断轨迹,揭示成功与失败的关键差异。

研究发现,成功的诊断保持在故障影响面,主动利用检索证据,逐步深入;失败则偏离路径,遗漏关键证据或误解证据含义。基于此,设计了两阶段防御架构DiagGuard,结合证据调查与验证机制,有效提升根因定位准确率,从43.5%提升至52.5%。

该方法不仅丰富了微服务故障诊断的理论体系,也为工业实践提供了可行的工具。通过路径重建和行为分析,诊断过程的透明度和可解释性大大增强,为未来自动化运维提供坚实基础。未来工作将聚焦自动路径推断、多模态融合及工业场景验证,推动微服务故障溯源技术的持续发展。

深度分析

研究背景

微服务架构已成为大规模云应用的主流,故障传播路径复杂多变,传统根因分析多依赖静态指标或局部信息,难以全面追溯故障源。早期方法如统计相关、因果推断和图模型虽有一定效果,但缺乏对故障传播路径的深度理解。近年来,基于大语言模型(LLM)和智能代理的研究逐渐兴起,试图通过多轮交互和工具调用实现更动态的故障诊断。然而,这些方法多停留在终局标签的评估,缺乏对诊断过程的行为分析和路径重建能力,限制了其在实际运维中的应用潜力。

核心问题

现有微服务根因分析方法普遍关注最终诊断的准确率,忽视了诊断过程中的行为路径和证据利用情况。实际运维中,工程师不仅关心哪个服务出问题,更关注故障是如何传播的,以及诊断过程是否充分利用了所有可用信息。缺乏路径级的评估导致诊断结果的可解释性不足,难以识别诊断中的行为偏差和潜在缺陷。这限制了自动化工具的信任度和实用性,也影响故障排查的效率。

核心创新

本文创新性提出轨迹级诊断框架,将故障传播路径作为过程验证的核心依据,结合多轮查询和证据分析,系统评估诊断行为的质量。引入路径重建指标(Node F1、Edge F1)和意图分类,细粒度分析诊断轨迹中的行为偏差。设计两阶段防御架构DiagGuard,融合证据调查(Grounder)和验证(Verifier),显著提升根因定位准确率。该方法突破了传统终局指标的局限,为微服务故障诊断提供了全新的行为分析视角。

方法详解

  • �� 构建手工验证的服务级故障传播路径,作为过程级基准。• 收集3500条诊断轨迹,归一化多框架、多模型、多工具调用行为。• 定义路径重建指标(Node F1、Edge F1)评估路径完整性。• 设计多轮查询策略,分析行为偏差(如路径偏离、证据遗漏)。• 利用意图分类(SQL标签)理解诊断行为动机。• 归纳失败模式(协议遗漏、语义误读、推理不足),指导防御架构设计。• 构建DiagGuard,结合路径调查和验证机制,提升诊断性能。

实验设计

采用RCABench和AIOps 2025两个微服务故障基准,比较六个不同框架在不同模型上的表现。指标包括Acc@1、路径重建F1、证据利用深度等。通过多轮交互和路径验证,分析成功与失败的行为差异。设置对照实验验证DiagGuard的有效性,评估其在不同拓扑和模型上的泛化能力。参数调优包括查询轮次、证据阈值和意图分类准确率,确保实验的公平性和可靠性。

结果分析

路径重建指标显示,正确定位的路径节点F1达0.75,边F1达0.68,深度越深,重建难度越大。成功轨迹保持在故障影响面,主动利用检索到的关键证据,查询范围逐步扩大;失败轨迹偏离路径,遗漏或误解证据。引入DiagGuard后,Acc@1从43.5%提升至52.5%,验证其在不同模型和拓扑上的有效性。路径重建能力的提升显著改善了诊断的可解释性和可信度。

应用场景

该方法适用于云原生微服务平台的自动故障排查,帮助运维工程师快速定位故障源,提升故障响应速度。可集成到现有的监控和告警系统中,结合路径重建和证据分析,实现端到端的故障溯源。长远来看,推动自动化运维的智能化发展,减少人工干预,提高系统整体可靠性。

局限与展望

当前路径重建依赖手工标注,成本较高,且在复杂深层路径中表现仍有限。模型对动态变化的系统适应性不足,部分证据可能被误解或遗漏。实验环境偏向静态场景,实际工业系统中的实时性和鲁棒性尚待验证。未来需开发自动路径推断和多模态融合技术,以增强系统的适应能力和实用性。

通俗解读 非专业人士也能看懂

想象一个工厂里有许多不同的机器,每台机器都可能出故障。有时候,某个机器出问题会影响到其他机器,导致整个生产线出错。工程师们需要找出哪个机器最先出问题,以及故障是怎么传播的。传统方法就像只看最后哪个机器出错了,但不知道故障是怎么传过去的。本文提出一种像追踪故障“足迹”的方法,通过多次询问和收集证据,逐步还原故障的传播路径。这样,不仅能找到源头,还能理解故障是如何扩散的。研究还发现,成功的追踪会一直沿着故障的“轨迹”走,利用所有可用的线索,而失败的追踪则会偏离路径,遗漏关键证据。通过这种方式,运维人员可以更有信心地解决问题,系统也能变得更可靠。

简单解释 像给14岁少年讲一样

想象你在学校里玩捉迷藏,你要找到藏得最好的朋友。你可以问其他同学,看看他们有没有看到你的朋友,或者观察一些线索,比如脚印或掉的东西。你不断收集线索,逐步缩小范围,最后找到朋友藏在哪里。这个过程就像研究中的故障追踪:工程师要找出哪个机器出了问题,以及故障是怎么传开的。以前的方法只是看到哪个机器出错了,但不知道故障是怎么到那里的。现在的研究用一种“追踪线索”的方法,反复问问题、收集证据,逐步还原故障的“足迹”。成功的追踪会一直沿着故障的路径走,利用所有线索;失败的追踪则会遗漏重要线索,偏离路径。这样,工程师就能更快、更准确地解决问题,让系统变得更稳定。

原文摘要

Existing evaluations of automated root cause analysis (RCA) for microservices assess diagnostic performance mainly by endpoint correctness: whether a method localizes the responsible service. This criterion enables comparison but does not reveal the evidentiary basis of a diagnosis or the fault-propagation route connecting the source to observed symptoms, both of which an on-call site reliability engineer needs to judge whether action is warranted. We therefore treat RCA as an observable diagnostic process. Our trajectory-level framework evaluates agent executions against manually curated service-level fault-propagation paths. Applied to a public microservice RCA benchmark, it analyzes 3,500 diagnostic trajectories, characterizing where agents investigate and how they use retrieved telemetry. We find a disconnect between answer correctness and diagnostic quality: an agent may localize the fault source yet fail to reconstruct its propagation. Successful investigations stay on the fault-impact surface, act on retrieved evidence, and broaden their query repertoire as the search deepens. Failures arise when decisive evidence is omitted, retrieved evidence is misinterpreted, or unsupported inference substitutes for missing evidence. We operationalize this taxonomy as DiagGuard, a two-stage defense-in-depth architecture in which grounding surveys available observations before localization and verification audits the diagnosis against them. In an independent setting with a different model, benchmark, and service topology, DiagGuard raises Acc@1 from 43.5% to 52.5%. These results show that trajectory-level evaluation exposes limitations hidden by final-answer metrics and provides actionable guidance for improving automated RCA.

cs.SE