SciVisAgentSkills: Design and Evaluation of Agent Skills for Scientific Data Analysis and Visualization

TL;DR

SciVisAgentSkills通过增强编码代理技能提高科学数据分析和可视化效率。

cs.AI 🔴 高级 2026-06-04 3 次浏览
Kuangshi Ai Haichao Miao Kaiyuan Tang Shusen Liu Chaoli Wang
科学数据分析 可视化 代理技能 长时间工作流 工具集成

核心发现

方法论

SciVisAgentSkills通过编码环境假设、工具使用模式和领域启发来增强编码代理,适用于ParaView、napari、VMD和TTK等科学工具。使用SciVisAgentBench评估这些技能,发现它们提高了任务得分,并且在不同代理和工具设置中表现出不同的token效率。

关键结果

  • 在SciVisAgentBench中,使用技能的代理在任务得分上表现更好,Claude Code在拓扑可视化任务中提高了约60%。
  • 技能的引入使得输出质量提高,但在某些情况下也引入了新的执行路径,导致完成率下降。
  • 在某些任务中,token使用量减少,尤其是在Claude Code中表现明显。

研究意义

该研究强调了结构化程序知识在实现可靠的长时间SciVis工作流中的重要性,并表明技能应与加载和应用它们的执行框架一起研究。这为科学数据分析和可视化的代理技能生态系统的扩展提供了基础。

技术贡献

SciVisAgentSkills通过提供可重用的代理技能层,增强了基础模型的通用能力,管理上下文和工具执行,并注入任务和领域特定的专业知识。它们在多个工具和任务类型中提高了性能,展示了程序指导在复杂科学环境中的价值。

新颖性

这是首次将可重用的代理技能应用于核心SciVis工作流,并在多种工具和任务类型中验证其有效性。与现有工作相比,它提供了更广泛的工具适用性和任务覆盖。

局限性

  • 在基础模型已经有效处理工具的情况下,技能带来的提升可能有限,例如在VMD的分子可视化中。
  • 技能与代理框架的交互是模型依赖的,token使用量的变化在不同模型中表现不同。
  • 技能的效益在任务套件间变化较大,特别是在复杂的多步骤任务中。

未来方向

未来工作应研究技能与代理框架的联合设计,以支持更复杂的长时间工作流,并开发新的技能以适应更多的科学工具和任务类型。

AI 总览摘要

科学数据分析和可视化是跨学科研究的重要工具,但现有解决方案在处理复杂数据时常常力不从心。SciVisAgentSkills通过增强编码代理的技能,提供了一种新的解决方案。这些技能通过编码环境假设、工具使用模式和领域启发来增强代理能力,适用于ParaView、napari、VMD和TTK等科学工具。实验结果表明,使用这些技能的代理在任务得分上表现更好,尤其是在复杂的多步骤任务中。尽管技能引入了新的执行路径,可能导致完成率下降,但总体上提高了输出质量。该研究强调了结构化程序知识在实现可靠的长时间SciVis工作流中的重要性,并呼吁社区合作扩展科学数据分析和可视化的代理技能生态系统。未来工作应研究技能与代理框架的联合设计,以支持更复杂的长时间工作流,并开发新的技能以适应更多的科学工具和任务类型。

深度分析

研究背景

科学数据分析和可视化是理解复杂科学数据的重要工具。随着数据复杂性的增加,传统的可视化方法难以满足需求。近年来,代理可视化系统通过将自然语言请求转化为具体的可视化操作,展示了长时间工作流的可行性。然而,这些系统通常针对特定工具或应用,缺乏通用性。

核心问题

现有的编码代理在处理科学数据分析和可视化任务时,常常缺乏工具特定的专业知识。这导致了在执行复杂任务时效率低下,尤其是在需要长时间、多步骤工作流的情况下。

核心创新

SciVisAgentSkills通过提供可重用的代理技能层,增强了基础模型的通用能力。这些技能编码了环境假设、工具使用模式和领域启发,适用于多个科学工具,提供了更广泛的任务覆盖。

方法详解

  • �� 编码环境假设,减少冗余探索
  • �� 提供工具使用模式,指导代理行为
  • �� 包含代表性代码片段,减少试错
  • �� 结合经验观察,优化输出生成

实验设计

使用SciVisAgentBench评估技能的有效性。该基准包括108个专家设计的多步骤任务,涵盖不同领域、数据类型和可视化操作。通过比较有无技能的代理表现,评估技能对任务得分和token使用量的影响。

结果分析

使用技能的代理在任务得分上表现更好,尤其是在复杂的多步骤任务中。Claude Code在拓扑可视化任务中提高了约60%。尽管技能引入了新的执行路径,可能导致完成率下降,但总体上提高了输出质量。

应用场景

SciVisAgentSkills可用于科学数据分析和可视化的多个领域,包括物理学、生物学、气候科学和材料科学。它们提供了更可靠的长时间工作流,改善了跨学科研究的效率。

局限与展望

技能的效益在任务套件间变化较大,特别是在复杂的多步骤任务中。技能与代理框架的交互是模型依赖的,token使用量的变化在不同模型中表现不同。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。现有的编码代理就像一个新手厨师,虽然知道如何切菜,但不熟悉具体的烹饪步骤。而SciVisAgentSkills则像一本详细的食谱,告诉厨师如何使用不同的工具和材料来完成一道复杂的菜肴。通过提供明确的步骤和技巧,这些技能帮助厨师更有效地完成任务。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏。你需要完成多个任务才能赢得比赛。现有的编码代理就像一个新手玩家,虽然知道基本操作,但不熟悉游戏规则。而SciVisAgentSkills就像一个攻略,告诉玩家如何使用不同的道具和技能来完成任务。通过提供明确的步骤和技巧,这些技能帮助玩家更有效地完成任务。

术语表

SciVisAgentSkills (科学可视化代理技能)

一组可重用的代理技能,用于增强编码代理的科学数据分析和可视化能力。

在论文中用于提高代理在科学工具中的表现。

Codex (编码代理)

一种编码代理,能够执行命令、检查文件、编写代码,并迭代优化输出。

在论文中用于评估代理技能的有效性。

Claude Code (编码代理)

一种编码代理,能够执行命令、检查文件、编写代码,并迭代优化输出。

在论文中用于评估代理技能的有效性。

SciVisAgentBench (基准测试)

一个用于评估科学数据分析和可视化代理的基准测试,包含108个专家设计的多步骤任务。

在论文中用于评估代理技能的有效性。

ParaView (科学工具)

一种用于大数据可视化的终端用户工具。

在论文中作为评估代理技能的工具之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在更多的科学工具中应用代理技能,以支持更复杂的任务和工作流。
  • 2 如何优化技能与代理框架的交互,以提高token使用效率。

应用场景

近期应用

科学数据分析

通过增强编码代理的技能,提高科学数据分析的效率和准确性。适用于物理学、生物学等领域。

远期愿景

跨学科研究

通过扩展代理技能生态系统,支持更复杂的跨学科研究,提高科学发现的效率。

原文摘要

Recent advances in agentic visualization have enabled the translation of natural language into executable scientific visualization (SciVis) workflows. While general-purpose coding agents show strong capabilities, they often lack the tool-specific expertise required for SciVis tasks. In this work, we present SciVisAgentSkills, a collection of reusable agent skills that augment coding agents for scientific data analysis and visualization by encoding environment assumptions, tool usage patterns, and domain heuristics across scientific tools such as ParaView, napari, VMD, and TTK. We evaluate these skills on Codex and Claude Code using SciVisAgentBench, a benchmark of 108 expert-designed multi-step tasks. Results show that agent skills improve mean task scores across the evaluated suites, with token-efficiency benefits that depend on the agent harness and tool setting. These findings highlight the importance of structured procedural knowledge for enabling reliable, long-horizon SciVis workflows, while also showing that skills should be studied alongside the execution harness that loads and applies them. The skills are available at https://github.com/KuangshiAi/SciVisAgentSkills.

cs.AI cs.HC