SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

TL;DR

SkillTV-Bench评估长轨迹任务中的判决准确性,提升14.8个百分点。

cs.AI 🔴 高级 2026-08-06 42 次浏览
Zhi Han Chenxi Zeng Liuhaichen Yang Zihan Guo Ming Zhou Yang Li
多域评估 轨迹验证 技能增强 自动演化 大规模基准

核心发现

方法论

本研究提出SkillTV-Bench,通过收集50个任务的681个真实轨迹,结合任务时间技能和可检视的环境工件,支持多域、多技能的轨迹验证。引入SkillTV-Evolve,利用外部JudgeSkill指导判决策略的规划与证据采集,并通过自动演化循环不断优化JudgeSkill。评估采用多模型对比,包括GPT-5.2、Claude Sonnet 4.6等,结合指标如平衡准确率、成功率提升,验证了方法的有效性。

关键结果

  • 在SkillTV-Bench上,Refined JudgeSkill将判决准确率提升14.8个百分点(从56.8%到58.6%),显著优于未优化模型。多轮次滚动选择中,成功轨迹比例由22.9%提升至45.5%,体现验证策略在轨迹筛选中的优势。
  • 在不同领域中,JudgeSkill的优化带来最大提升的为媒体内容(36.7个百分点)和制造业(23.1个百分点),显示其广泛适用性。模型在复杂多技能场景中表现出更强的判别能力,尤其在识别潜在失败轨迹方面显著优于传统方法。
  • 自动演化机制通过反复误判案例分析,逐步完善JudgeSkill,验证了基于基准的持续学习潜力。整体结果表明,结合技能知识的验证策略能有效提升长轨迹任务的判决可靠性。

研究意义

本研究填补了长轨迹任务中基于技能知识的轨迹验证缺失,推动了智能系统在复杂环境中的可靠性评估。通过引入可重用的JudgeSkill和自动演化机制,显著改善了判决的准确性和鲁棒性,为未来自主系统的可信性提供技术基础。这不仅对AI评估体系具有深远影响,也为工业应用中的自动监控与质量控制提供了新思路,有助于实现更智能、更安全的自动化流程。

技术贡献

提出SkillTV-Bench作为多域、多技能轨迹验证基准,涵盖丰富的环境和任务场景。引入SkillTV-Evolve,通过自动化演化优化JudgeSkill,有效提升判决性能。结合多模型评估,验证了技能知识在长轨迹验证中的关键作用。创新点在于将任务时间技能融入判决流程,利用外部知识指导证据采集与决策,突破传统静态评价的局限,为长轨迹任务的自动验证提供了新范式。

新颖性

首次系统性引入任务时间技能到轨迹验证中,结合外部JudgeSkill实现可持续演化。不同于以往仅关注最终输出或静态轨迹的方法,本研究强调动态证据采集与技能知识的融合,提出了基于基准的自动优化机制,显著提升验证的准确性和适应性。这在长轨迹任务评估领域具有开创性意义。

局限性

  • 当前方法依赖于丰富的任务时间技能和可检视的环境工件,可能在技能不足或环境不可访问的场景中表现有限。
  • 自动演化过程虽有效,但计算成本较高,需大量误判案例进行优化,限制了实时应用的可能性。
  • 模型在极端复杂或新颖任务中的泛化能力仍需验证,未来需扩展多样化场景以增强鲁棒性。

未来方向

未来将探索多模态证据融合与更高效的JudgeSkill演化机制,提升在极端复杂环境中的适应性。还计划结合强化学习策略,自动发现潜在技能缺陷,进一步提升验证的自动化水平。此外,将扩展到多智能体协作场景,推动长轨迹任务中的可信评估体系发展。

AI 总览摘要

随着大规模语言模型(LLM)在长轨迹任务中的应用日益广泛,传统的响应质量评估已难以满足复杂任务的需求。现有评判机制多依赖于最终输出或静态轨迹,缺乏对任务执行全过程的动态验证能力。为解决这一问题,本文提出SkillTV-Bench,作为一个涵盖11个领域、50个任务、681个真实轨迹的多域轨迹验证基准。该基准结合任务时间技能和可检视的环境工件,支持多技能、多场景的证据采集与验证,为评判模型提供了更全面的评估平台。

在此基础上,作者引入SkillTV-Evolve,通过外部JudgeSkill实现验证知识的可重用和持续演化。该机制利用误判案例不断优化JudgeSkill,指导判决策略的规划和证据采集,从而显著提升判决准确率。实验结果显示,经过演化的JudgeSkill在多模型评比中,将判决准确率提升14.8个百分点,成功筛选出更可靠的轨迹,成功率由22.9%提升至45.5%。

这一创新不仅增强了长轨迹任务中的模型可信性,也为未来自动化验证体系提供了技术支撑。该方法在多领域表现出良好的适应性,尤其在内容媒体和制造业中效果显著。未来,作者计划结合多模态证据和强化学习,进一步提升验证效率和泛化能力,推动自动化系统在复杂环境中的应用发展。整体而言,SkillTV-Bench与SkillTV-Evolve共同构建了长轨迹任务验证的新范式,为智能系统的可信性提供了强有力的技术基础。

深度分析

研究背景

近年来,LLM在长远任务中的应用逐步展开,推动了多领域智能系统的发展。早期研究如Yao et al. (2023)和Schick et al. (2023)主要关注响应生成,逐步转向对完整任务轨迹的评估。现有的评判体系如JudgeBench (Tan et al., 2025)和AgentRewardBench (Lù et al., 2025)多关注静态响应或单一环节,缺乏对任务全过程的动态验证能力。随着任务复杂性的增加,单纯依赖最终输出已无法满足实际需求,特别是在涉及多技能、多环境交互的场景中,验证的难度显著提升。近年来,研究逐渐引入环境交互、技能利用等因素,试图构建更全面的评估体系,但仍存在验证不充分、缺乏可持续优化机制的问题。

核心问题

当前长轨迹任务的验证主要面临两个核心问题:一是缺乏对任务全过程的动态验证能力,二是缺少对任务时间技能的有效利用。传统方法多依赖静态响应或最终产物,难以识别潜在的过程性失败,导致判决偏差。尤其在技能增强的系统中,任务时间技能蕴含关键的操作流程和约束,若未能有效利用,容易漏掉关键的失败点。这些问题限制了自动化系统在复杂环境中的可信性和鲁棒性,亟需引入具有技能感知的动态验证机制。

核心创新

本研究的创新点在于提出SkillTV-Bench,结合任务时间技能与环境工件,支持多域、多技能的轨迹验证。引入SkillTV-Evolve,通过自动演化机制不断优化JudgeSkill,实现验证知识的持续学习。核心创新包括:1)将任务时间技能融入验证流程,增强模型对过程性失败的识别能力;2)设计可重用的JudgeSkill,作为外部知识库指导证据采集与判断;3)采用自动化演化策略,通过误判案例不断修正验证策略。这些创新突破了传统静态评估的局限,为长轨迹任务的自动验证提供了新思路。

方法详解

  • �� 数据采集:从SkillsBench提取85个任务的1247个试验,筛选出50个任务的681个轨迹,确保多样性和代表性。• 轨迹规范化:采用规则将原始事件流转化为结构化的逐步表示,便于判决分析。• 构建JudgeCase:结合任务指令、轨迹、任务时间技能和环境工件,形成自包含的验证单元。• 设计JudgeSkill:定义操作性检验计划,包括检查内容、证据位置和支持标准。• 自动演化:利用误判案例,反复优化JudgeSkill,提升判决准确性。• 评估指标:采用平衡准确率、成功率等,比较不同模型和演化版本的性能。• 多模型对比:使用GPT-5.2、Claude Sonnet 4.6等,验证验证策略的有效性。

实验设计

实验在多域、多技能场景中进行,评估JudgeSkill的判决准确性和轨迹筛选效果。采用离线验证和滚动选择两种策略,比较未优化和演化后模型的性能。指标包括平衡准确率、成功率和误判率,验证模型在识别成功与失败轨迹中的表现。通过多轮次滚动实验,分析验证策略在不同轨迹池中的适应性和鲁棒性。结果显示,经过JudgeSkill演化的模型在多场景中均优于基线,验证了方法的普适性和有效性。

结果分析

在评估集上,Refined JudgeSkill将判决平衡准确率从56.8%提升至58.6%,成功筛选成功轨迹比例由22.9%提升至45.5%。在不同领域中,最大提升出现在媒体内容(36.7个百分点)和制造业(23.1个百分点)。多轮次滚动实验表明,随着滚动次数增加,成功筛选率持续提升,验证策略在复杂环境中的适应性增强。这些结果充分证明了自动演化JudgeSkill在提升轨迹验证准确性和筛选效率方面的潜力。

应用场景

该验证机制可广泛应用于自动驾驶、机器人操作、智能制造等领域,提升系统的安全性和可靠性。通过结合任务时间技能,系统能更准确识别潜在失败,提前预警,减少人为干预需求。未来还可结合强化学习,实现自主技能修正和验证策略优化,推动自主系统在复杂环境中的自主决策与监控。

局限与展望

当前方法依赖丰富的任务时间技能和环境工件,可能在技能不足或环境不可访问时表现有限。自动演化过程计算成本较高,难以实时应用。模型在极端复杂或新颖任务中的泛化能力仍需验证,未来需扩展多样化场景以增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,任务是做一道复杂的菜。你需要按照步骤操作,比如切菜、调味、煮饭,每一步都很重要。有时候你会用工具,比如刀、锅,还要遵守一些规则,比如火不能太大。整个做菜的过程就像一场长长的任务,不能只看最后的成品,要确保每一步都正确。系统就像一个聪明的厨师助手,它不仅看成品,还会检查每个步骤是否按照规程操作,确保菜做得好吃又安全。这个研究就是在教这个“厨师助手”如何更好地检查每个步骤,确保每道菜都完美无缺。

简单解释 像给14岁少年讲一样

假设你在玩一款很复杂的游戏,游戏里有很多任务要完成,比如建房子、打怪、收集物品。每个任务都需要你按顺序做很多事情,不能只看最后的奖励。这个研究就像是在教一个超级聪明的朋友,不仅帮你打怪,还能在你玩的时候检查你是不是每一步都做对了。它会用一些特别的规则,告诉你在哪些地方可能出错,帮你提前发现问题。通过不断练习和改正,这个朋友变得越来越厉害,能更快帮你找到错误,让你玩得更顺利。这就像是让游戏变得更公平、更有趣的秘密武器!

原文摘要

LLM agents increasingly execute long-horizon tasks through tool use and environment interaction, shifting evaluation from final-response scoring to verification of complete executions. For skill-augmented agents, verification additionally requires the procedural knowledge encoded in task-time skills, because this knowledge indicates what evidence to inspect and which failures are task-critical. However, existing judge benchmarks often expose final responses or static trajectories, and rarely combine task-time skills with directly inspectable artifacts and environments. We therefore introduce SkillTV-Bench, a 681-case benchmark of real agent trajectories from 50 tasks across eleven domains, designed to evaluate skill-aware trajectory verification for both LLM-as-a-Judge and Agent-as-a-Judge methods. Additionally, we propose SkillTV-Evolve, which externalizes verification knowledge as a reusable JudgeSkill that guides an agent judge to plan targeted inspections and issue evidence-grounded verdicts. On a disjoint development pool, an automated evolution loop further refines the JudgeSkill using misjudged cases. On SkillTV-Bench, the refined skill increases the same agent judge's accuracy by 14.8 percentage points. In offline rollout-pool selection, it increases selected-trajectory success from 22.9% with one rollout to 45.5% with ten rollouts. The code and data are available at https://github.com/HanZhi306/SkillTV-Bench

cs.AI