核心发现
方法论
该研究采用严格控制的误差注入策略,通过在成功轨迹中插入特定错误,利用大规模自动化流程生成带有金标准标签的失败轨迹。涵盖15个代理框架、26个基准任务,跨越文本、图像、视频三大模态。利用多阶段流程,包括源轨迹采集、故障分类、误差注入、滚动回放和人工验证,确保标签的高质量和多样性。核心算法包括Decisive Error定义、错误类型分类和基于温启动的误差注入机制,有效避免漂移问题,保证标签的精确性。
关键结果
- 在26个基准任务中,构建了12326条失败轨迹,涵盖多模态、多任务、多代理场景,显著扩展了现有失败归因基准的规模和多样性。
- 不同模型在归因任务中的表现差异明显,GPT-5.4在文本模态下达到73.9%的步骤定位准确率,Qwen3.5-122B在代理识别上表现最佳,但整体错误分类F1值仍在22%左右,显示出当前模型在细粒度归因方面仍有较大提升空间。
- 多模态和长轨迹(超过12K tokens)对模型归因能力提出了更高的挑战,尤其在视频模态中,步骤定位准确率下降至50%,验证了复杂场景下的难点。
研究意义
该研究为自动化失败归因提供了大规模、跨模态的标注基准,突破了传统文本限制,推动多模态智能系统的故障理解与改进。通过精确的误差注入和高质量标签,促进模型在实际应用中的故障检测与修正能力,为自主学习和自我改进奠定基础,有望推动智能代理的可靠性和安全性提升。
技术贡献
创新点在于提出基于误差注入的自动化标注流程,结合Decisive Error定义和温启动机制,有效避免漂移问题,提升标签的精度。构建跨模态、多任务的失败轨迹库,为未来多模态失败归因提供了坚实基础。引入多层次的误差类型分类体系,丰富了故障理解的粒度,为模型提供更细粒度的反馈信号。
新颖性
本研究首次实现大规模、多模态、多任务的自动失败归因基准,突破了以往仅限文本的局限。提出的误差注入与温启动结合策略,显著改善了标签的真实性和一致性。与现有方法相比,具有更高的标注质量和更广泛的应用场景,为未来多模态智能系统的故障诊断提供了新思路。
局限性
- 当前方法依赖于人工定义的故障类型和误差模型,可能无法覆盖所有实际场景中的故障类型,存在一定的偏差。
- 在极长轨迹(超过12K tokens)和复杂视频模态中,归因准确率仍有明显下降,说明模型在处理大规模、多模态信息时仍面临挑战。
- 误差注入的控制机制虽然避免了漂移,但在某些复杂交互场景下可能无法模拟真实故障,限制了标签的真实性。
未来方向
未来将探索更自动化的故障类型发现方法,结合强化学习和自我反思机制提升归因能力。同时,扩展多模态模型的理解深度,优化长序列处理策略,推动故障归因在实际复杂场景中的应用落地。还将结合人类专家反馈,持续完善故障分类体系,增强模型的可解释性和鲁棒性。
AI 总览摘要
随着人工智能代理系统在多模态环境中的广泛应用,准确识别和归因其失败成为提升系统可靠性的重要环节。传统方法多依赖人工标注,成本高且难以扩展,限制了故障检测的效率与精度。本文提出了Who&When Pro,一种基于误差注入的自动化失败归因基准,突破了以往仅限文本的局限,涵盖了丰富的多模态场景。通过在成功轨迹中精确插入误差,利用温启动机制确保标签的真实性与一致性,构建了12326条高质量失败轨迹,涵盖26个基准任务、15个代理框架、3种模态。该基准不仅规模庞大,还支持跨模态、多任务、多代理的复杂场景,为未来模型的故障理解提供了坚实基础。实验结果显示,当前最优模型在文本模态下达到73.9%的步骤定位准确率,但在多模态和长轨迹中仍面临挑战,提示未来需在长序列处理和多模态融合方面持续突破。该研究的意义在于推动自动化故障归因技术的发展,为智能系统的自主学习和自我修正提供关键支撑,有望在自动驾驶、智能制造、医疗等领域实现更高的安全性与可靠性。未来工作将聚焦于更全面的故障类型识别、更高效的多模态融合算法,以及在实际复杂场景中的应用验证,推动智能代理系统的持续演进。
深度分析
研究背景
近年来,随着大规模预训练模型(如GPT系列、BERT)在自然语言处理中的突破,智能代理逐渐向多模态、多任务方向发展。代表性工作包括ReAct(Yao et al., 2022)、Toolformer(Schick & Schütze, 2023)等,推动了模型在推理、规划、工具调用等方面的能力提升。然而,随着模型能力的增强,失败的隐蔽性也在增加,传统的人工检测和有限的基准难以满足实际需求。现有失败归因研究多集中于文本任务(如WHO&WHEN(Zhang et al., 2025c)),缺乏跨模态、长序列和大规模自动化标注的支持,限制了其推广应用。
核心问题
自动失败归因旨在识别系统在哪个步骤、由哪个代理引发了失败,及其原因。现有方法多依赖人工标注或有限的自动化流程,难以应对多模态、多任务环境中的复杂场景。尤其在视频和图像任务中,缺乏高质量、规模化的标注,导致模型在实际应用中难以准确诊断故障。如何在保证标签真实性的同时实现大规模自动化,是当前的核心难题。
核心创新
本研究的创新点包括:1)提出基于误差注入的自动化标注流程,确保标签的金标准性质;2)引入Decisive Error定义,有效定位导致任务失败的关键步骤;3)采用温启动机制,避免漂移问题,提升标签一致性;4)构建跨模态、多任务的失败轨迹库,丰富故障类型和场景,支持多样化应用。此方法突破了传统人工标注的瓶颈,为大规模、多模态失败归因提供了可行路径。
方法详解
- �� 采集源轨迹:从15个代理框架和26个基准任务中收集成功轨迹,涵盖文本、图像、视频模态。
- �� 失败分类:人工分析失败轨迹,建立多模态故障类型体系,包括感知、推理、规划、验证、协调等。
- �� 误差注入:在成功轨迹中选择特定步骤,利用条件生成模型(如GPT-4)生成误差行为,插入轨迹中。
- �� 温启动回放:从注入点开始,重放轨迹,确保环境状态和上下文一致,避免漂移。
- �� 失败验证:筛选出因误差导致的失败轨迹,确保标签的真实性。
- �� 人工验证:由三名专家对部分样本进行确认,确保标注质量。
实验设计
采用26个基准任务、15个代理框架,构建12326条多模态失败轨迹。评估模型包括GPT-5.4、Qwen3.5-122B等,指标涵盖步骤定位准确率、错误分类F1、联合准确率。通过对比不同归因协议(全轨迹、逐步、二分法),验证全轨迹归因的优越性。还进行了长序列和多模态场景的性能分析,揭示模型在复杂环境中的不足。
结果分析
模型在文本模态下达到了73.9%的步骤定位准确率,但在视频模态中下降至50%,显示多模态和长序列对归因能力的挑战。不同模型在不同任务中的表现差异明显,GPT-5.4在步骤识别方面表现最佳,Qwen3.5-122B在代理识别上优异。多模态融合提供了更丰富的故障线索,但也带来了更高的复杂性。整体来看,模型在细粒度归因方面仍有提升空间。
应用场景
该基准可用于训练和评估未来多模态智能系统的故障检测能力,特别适合自动驾驶、机器人、智能制造等场景。通过自动化生成高质量标签,减少人工成本,加速系统的迭代优化。未来,结合强化学习和自我反思机制,有望实现自主故障诊断和修正,提升系统的安全性和可靠性。
局限与展望
目前方法依赖于预定义的故障类型和误差模型,难以覆盖所有实际场景中的故障类型。长序列和复杂视频模态下,归因准确率仍有明显下降,表明模型在处理大规模、多模态信息时仍面临挑战。此外,误差注入的模拟可能无法完全反映真实故障场景,限制了标签的真实性和泛化能力。
通俗解读 非专业人士也能看懂
想象你在一家工厂工作,工厂里有很多不同的机器,每个机器负责不同的任务。有时候,机器会出错,比如误操作或零件损坏。工厂的管理者希望知道是哪台机器出了问题、在哪个环节出错、以及为什么出错。传统的方法是工人逐个检查机器,但费时费力。现在,有一种智能助手可以模拟故障,故意让某台机器出错,然后观察它的反应,帮助找到问题的根源。这就像在工厂里故意让某个环节出错,看看哪个环节最容易出错,帮助工厂更快修复。这个研究就是用类似的方法,让AI系统自己模拟出错,然后自动找到出错的原因和位置,从而提升系统的可靠性。
简单解释 像给14岁少年讲一样
想象你在学校里,有很多不同的老师和学生。有时候,考试会出错,原因可能是题目不清楚、学生没理解,或者老师讲错了。老师们想知道,哪个老师出了错、在哪个题目上出了问题、为什么会出错。以前,老师们要自己检查每个题目,花费很多时间。现在,有个聪明的机器人,可以模拟出错的情况,告诉老师们哪里出了问题。它会在题目中故意设置一些错误,然后观察学生的反应,帮助老师找到真正的问题所在。这个研究也是这样:用电脑模拟出错,然后自动找出错的原因和位置,帮助让系统变得更聪明、更可靠。
原文摘要
Automated failure attribution uses LLMs to identify where and why agentic systems fail. As agents become more capable, their failures become subtler, making automated attribution increasingly important. We introduce Who&When Pro, a large-scale benchmark for automated failure attribution in agentic systems. Using a strictly controlled pipeline that injects a failure only after exactly replaying a successful prefix, we construct 12,326 failed trajectories with golden labels across 3 modalities and 26 benchmarks covering various scenarios. Beyond benchmarking, we conduct extensive experiments and analyses, revealing systematic patterns in how models attribute failures across modalities, protocols, and model families, and providing empirical guidance for future automated failure attribution systems.