SkillEval: Decomposing Agent Skill Quality into Interpretable Signals

TL;DR

SkillEval通过线性方向投影评估技能文档的四个可解释维度,关联下游任务表现。

cs.AI 🔴 高级 2026-08-07 45 次浏览
Jiahui Han Qinuo Li Ziheng Peng Haotian Wu Haoze Liu Danfeng Shan Guanchu Wang Huiqi Deng Ninghao Liu
AI评估 技能评价 模型解释 自然语言处理 可解释性

核心发现

方法论

SkillEval基于模型内部隐藏状态空间,利用正负技能对比学习每个质量属性的线性方向。通过固定方向投影技能表示,获得可解释的评分指标。该方法结合偏差校正,减少文档长度和格式等非语义特征影响,确保指标反映目标属性。实验中,利用518个技能样本,训练出六个维度的方向,验证其在未见技能上的区分能力和与下游任务的相关性。该框架实现了技能质量的细粒度、可解释评估,为技能改进提供诊断依据。

关键结果

  • 在518个验证技能中,正技能平均得分显著高于负技能(如A2维度0.98对0.96,差异显著),表明方向学习成功。不同维度的得分与实际下游任务的提升(Pearson r=0.779)高度相关,验证了指标的实用性。通过偏差校正,减少了文档长度对评分的影响,确保指标的语义一致性。技能修订后,相关维度得分提升,平均任务成功率提高29.5个百分点,验证了指标的指导作用。
  • 在多任务场景中,技能的下游效用表现出明显的任务依赖性,部分技能在某些任务中效果优异,但在其他任务中表现平平,强调了技能多场景适用性评估的重要性。
  • 指标的跨模型一致性良好,Qwen和Llama系列模型的评分相关系数均超过0.91,表明指标具有较强的鲁棒性。

研究意义

该研究突破了传统基于任务结果的技能评价局限,提出基于模型内部表征的可解释指标,兼顾技能的通用性和任务适应性。为自动化技能诊断、优化提供了量化工具,有助于构建高质量技能生态系统,推动自主系统的可靠性和可解释性提升。该方法填补了内在质量评估的空白,具有广泛的应用潜力,尤其在大规模技能库管理和自动修正方面具有重要意义。

技术贡献

技术上,SkillEval引入线性方向学习机制,利用对比学习构建每个质量维度的可解释向量,结合偏差校正,确保指标的语义纯净。该方法无需模型微调,只依赖固定方向进行快速评分,显著提高了效率和可解释性。与现有的任务驱动评估不同,SkillEval实现了文档级别的内在质量量化,兼具可追溯性和可调试性,为模型内部表征的利用提供新思路。其在多模型、多任务环境中的鲁棒性验证,展示了方法的广泛适用性。

新颖性

本研究首次系统性地将模型内部隐藏状态空间的线性方向用于多维技能质量评估,突破了传统的任务结果导向方法。通过对比学习和偏差校正,获得具有可解释性的多维指标,兼顾通用性和任务相关性。这一框架不同于单一指标或黑箱判别,提供了细粒度、可追溯的技能质量分析工具,推动了模型内在表征在评估中的应用创新。

局限性

  • 当前方法依赖预定义的正负技能对,可能受训练样本选择偏差影响,影响指标的泛化能力。
  • 指标的线性假设可能无法捕捉某些复杂的语义关系,限制了评估的表达能力。
  • 在极端或噪声较多的技能文档中,评分的稳定性和准确性仍需验证,未来需引入非线性或多模态信息融合技术。

未来方向

未来将探索多模态数据融合,提升指标的表达能力;同时,结合主动学习优化正负样本构建策略,以增强指标的泛化性。还计划将该框架应用于动态技能库的持续评估与自动修正,推动技能生态系统的智能化管理。进一步研究偏差校正机制,提升在不同模型和任务场景中的适应性,为大规模自动化技能评估提供更全面的解决方案。

AI 总览摘要

SkillEval提出了一种基于模型内部隐藏状态空间的可解释技能质量评估框架。传统技能评估多依赖于下游任务表现,受任务适应性限制,难以全面反映技能的内在质量。本文创新性地学习每个质量属性的线性方向,通过对比正负技能对,固定方向投影技能表示,获得具有可解释性和可追溯性的多维评分指标。实验中,利用518个技能样本,验证了指标在未见技能上的区分能力和与下游任务的高度相关性(Pearson r=0.779),显示出良好的实用性。偏差校正机制确保评分不受文档长度和格式的干扰,提升指标的语义纯粹性。通过对技能的诊断和修订,显著提升了技能的整体质量和任务成功率,平均提升29.5个百分点。这一方法不仅为技能的自动化评估提供了新工具,也推动了模型内在表征在实际应用中的深度利用。未来,结合多模态信息和主动学习,将进一步完善指标的表达能力和泛化能力,助力大规模技能生态的健康发展。

深度分析

研究背景

随着自主系统和智能代理的快速发展,技能文档作为知识存储和复用的重要载体,逐渐成为研究焦点。早期工作如Liang等(2026a)提出技能包的构建与管理,随后多项研究关注任务驱动的技能评估(Li et al., 2026b; Han et al., 2026),但其局限在于依赖实际任务执行,成本高且受环境影响。近年来,intrinsic评估方法逐渐兴起,试图从文档内容和模型内部表征出发,评估技能的内在质量(Zhong et al., 2026; Hong et al., 2026)。这些方法旨在实现高效、可解释的技能质量量化,减少对任务环境的依赖,为大规模技能库的自动管理提供可能。

核心问题

现有技能评价多依赖于下游任务表现,难以全面反映技能的内在属性,且受任务场景限制,难以实现跨任务的普适性。此外,缺乏可解释的指标,难以指导技能改进。文档长度、格式等非语义特征对评估结果的干扰,也影响指标的可靠性。如何在模型内部空间中学习具有语义解释的多维指标,成为亟待解决的问题。这限制了技能评估的效率和可操作性,阻碍了技能生态系统的健康发展。

核心创新

本研究提出SkillEval框架,创新点包括:1)利用模型内部隐藏状态空间,通过对比学习构建每个质量属性的线性方向,提供可解释的多维指标;2)引入偏差校正机制,减少文档非语义特征对评分的影响,确保指标反映目标属性;3)实现无需微调模型,仅通过固定方向投影快速评估技能质量。该方法结合多维度分析,细粒度刻画技能的适用性、内容质量、执行指导和鲁棒性,为技能评估提供了全新思路。

方法详解

  • �� 采集正负技能对,构建目标属性差异明显的样本。• 使用预训练模型(Qwen3.5-9B)提取隐藏状态,选择不同池化策略(描述、正文、最后一词)获得技能表示。• 计算表示差异,学习每个属性的线性方向,结合偏差校正,去除非语义偏差。• 固定方向后,将新技能表示投影到方向上,得到属性得分。• 标准化得分,确保不同技能间的可比性。• 通过偏差校正,减少文档长度和格式的影响,提升指标的语义纯粹性。• 在518技能样本上验证指标的区分能力和与下游任务的相关性,确保指标的实用性。

实验设计

采用公开技能数据集,构建正负对进行训练和验证。利用Qwen3.5-9B模型提取隐藏状态,学习六个维度的线性方向。在518个技能样本上验证指标效果,评估其在未见技能上的区分能力和与任务成功率的相关性。通过偏差校正,确保指标不受文档长度影响。还进行了模型鲁棒性测试,验证不同模型架构下指标的一致性。最后,将指标应用于技能修订,验证其在提升技能质量和任务成功率中的指导作用。

结果分析

指标在518技能验证集中,正技能平均得分高于负技能(如A2维度0.98对0.96),差异显著。不同维度的得分与实际下游任务提升(Pearson r=0.779)高度相关,验证指标的实用性。偏差校正后,评分与文档长度关系微弱,确保语义纯粹。技能修订后,任务成功率平均提升29.5个百分点,验证指标的指导效果。模型鲁棒性测试显示,不同模型架构下指标相关性超过0.91,表明方法具有良好的泛化能力。

应用场景

该方法适用于大规模技能库的自动评估与优化,支持技能的快速诊断和针对性修订。可广泛应用于智能助理、自动化流程、企业知识管理等场景,提升技能的质量控制效率。未来结合主动学习和多模态信息,推动技能生态系统的智能化管理,实现持续优化和自动修正。

局限与展望

当前方法依赖正负技能对的构建,可能受样本偏差影响,影响泛化能力。线性方向假设在某些复杂语义关系中可能不足,限制了评估表达能力。对于极端或噪声较多的技能文档,评分稳定性仍需验证,未来需引入非线性模型或多模态融合技术以增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,每个菜谱就像一份技能文档。传统的评价方法可能只看菜做得好不好(比如味道是否好),但这不能告诉你菜谱哪里可以改进。SkillEval就像一个聪明的厨师助手,它会分析菜谱的不同方面,比如用料是否合理、步骤是否清晰、是否适合不同的厨房设备、以及菜的抗变异能力。它通过观察很多菜谱的例子,学会了每个方面的“好”与“不好”的线性指标。这样,无论你给它什么菜谱,它都能告诉你在哪些方面可以改进,帮助你写出更好的菜谱。这个方法让评价变得透明、可解释,也能指导你不断优化菜谱,做出更受欢迎的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校里写作文,老师要你写得更棒。以前老师只看最后的分数,觉得作文好就给高分,不好就低分。这虽然简单,但不能告诉你具体哪里写得不好。SkillEval就像一个聪明的朋友,它会帮你分析作文的不同部分,比如开头是否吸引人、内容是否丰富、结尾是否有力、语法是否正确。它通过学习很多优秀和不好的作文,找到每个部分的“好”与“不好”的线性指标。每次你写完作文,它就能告诉你在哪些方面可以改进,比如“开头可以更吸引人”或“结尾需要更有力”。这样,你就可以有针对性地修改,写出更棒的作文。这个工具让评价变得更具体、更公平,也能帮你不断变得更厉害!

原文摘要

Agent skills provide reusable procedural knowledge that helps agents solve specialized tasks. As their use expands, evaluating skill quality becomes increasingly important. Existing evaluations often measure skill quality by testing whether a skill improves performance on specific downstream tasks. However, a reusable skill may apply to multiple task scenarios. Downstream evaluation mainly reflects the compatibility between a skill and the evaluated task, provides only a partial view of skill quality, and does not identify which aspect of the skill should be improved. We find that general properties of the \texttt{SKILL.md} document play an important role in skill quality. To evaluate these properties, we propose \textbf{SkillEval}, an interpretable framework for document-level skill evaluation. SkillEval evaluates each property using a fixed and inspectable scoring direction, producing interpretable scores. It further measures and reduces the influence of unrelated document features, such as length and formatting, so that each score captures its intended semantic property more specifically. Specifically, SkillEval learns an interpretable direction for each quality property from controlled positive--negative skill pairs in the hidden representation space of the model, and scores a new skill by projecting its representation onto these fixed directions. We use SkillEval to evaluate skills in controlled quality tests and show that SkillEval reliably distinguishes skills of different quality. In addition, SkillEval scores closely reflect downstream task performance, providing an early indication of whether a skill is likely to help an agent complete a task. We further explore SkillEval for diagnosing weaknesses in skill documents and guiding targeted revisions. The revised skills improve the targeted properties and achieve higher pass rates on downstream tasks.

cs.AI