DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

TL;DR

引入DSAgentBench,评估AI代理在真实计算环境中自动化端到端数据科学流程的能力,成功率仅56.7%。

cs.AI 🔴 高级 2026-08-11 42 次浏览
Mizanur Rahman Mohammed Saidul Islam Ridwan Mahbub Md Tahmid Rahman Laskar Shafiq Joty Enamul Hoque Prince
人工智能 数据科学 自动化 基准测试 系统交互

核心发现

方法论

本研究构建了DSAgentBench,结合275个覆盖数据采集、探索、建模、可视化和验证的复杂任务,利用真实操作系统环境(Ubuntu)进行评估。任务设计基于专家分析和LLM协作,确保符合实际数据科学流程。采用确定性评估器验证分析正确性、可视化和模型性能,超越代码正确性。实验涵盖15个模型,包括闭源(如Claude-4.6-Sonnet)和开源模型,评估其在多工具、多步骤任务中的表现。环境支持多模态观察(截图、UI树)和GUI操作,模拟真实场景。结果显示,Claude-4.6-Sonnet成功率为56.7%,而开源模型普遍低于1%,揭示当前AI系统在工具协调、系统理解和长流程推理方面的巨大差距。

关键结果

  • Claude-4.6-Sonnet在275个任务中成功完成56.7%,显著优于开源模型(均低于1%),反映其在工具调度和多步骤推理上的优势,但仍未达理想水平。
  • 多模型在多工具、多阶段任务中表现差异明显,尤其在系统操作和中间状态理解方面存在严重不足,揭示现有模型在真实环境中的局限。
  • 实验还显示,模型在工具调用、操作系统理解和跨应用协调方面频繁失败,强调未来需要更深层次的系统理解和自主决策能力。

研究意义

本研究首次系统性评估AI代理在真实操作系统环境中执行完整数据科学流程的能力,填补了现有基准仅关注代码正确性或单阶段任务的空白。结果揭示了当前技术在多工具协调、长流程推理和环境理解方面的巨大差距,为未来自主数据科学代理的研发提供了明确方向。该基准推动了AI系统向更接近人类数据科学家的自主化迈进,有望在工业界实现自动化决策、数据分析和模型部署的变革,具有深远的学术和应用价值。

技术贡献

本研究提出了结合真实操作系统环境的端到端数据科学任务基准,创新性地引入275个多阶段、多工具任务,采用确定性评估机制,超越传统静态代码测试。环境支持多模态观察(截图、UI树)和GUI操作,模拟真实场景。通过对15个模型的系统评估,揭示模型在工具调度、系统理解和长流程推理上的不足,推动了多模态、多工具自主系统的研究发展。该框架为未来开发可验证、可解释的自主数据科学代理奠定基础。

新颖性

这是首个在真实操作系统环境中评估端到端数据科学流程自动化的基准,突破了以往仅关注代码正确性或单阶段任务的限制。引入275个多阶段、多工具任务,结合系统交互和确定性评估,全面反映实际数据科学工作流程。相比现有基准,强调工具协调和环境理解,推动AI代理向自主化、可验证方向发展,具有重要创新意义。

局限性

  • 模型在复杂环境中的工具调度和多步骤推理能力仍不足,特别是在系统理解和中间状态管理方面表现欠佳,限制其实际应用。
  • 评估主要集中在任务成功率,未充分考虑模型的效率、鲁棒性和可解释性,未来需结合多维指标进行综合评价。
  • 环境配置依赖特定平台(Ubuntu),未来需扩展到多操作系统和多硬件环境,以提升通用性。

未来方向

未来将探索更深层次的系统理解与自主决策能力,结合强化学习和元学习提升模型的长流程推理能力。同时,计划引入更多样化的任务和环境,增强模型的泛化能力。还将优化环境交互机制,提升模型在复杂场景中的鲁棒性和效率,推动自主数据科学代理向工业应用迈进。

AI 总览摘要

在当今数据驱动的时代,自动化数据科学流程成为提升效率和决策质量的关键。传统方法多依赖静态代码和单一任务评估,难以反映实际工作中的复杂性。为此,本文提出了DSAgentBench,一个专为评估AI代理在真实计算环境中执行完整数据科学流程设计的基准。该基准涵盖275个多阶段、多工具任务,模拟从数据采集、探索、建模到验证的全流程,结合真实操作系统环境(Ubuntu)和多模态观察,确保评估的真实性和实用性。

通过系统性实验,研究发现即使最先进的模型(如Claude-4.6-Sonnet)成功率也仅达56.7%,而开源模型普遍低于1%,显示出当前AI在工具协调、系统理解和长流程推理方面的巨大差距。这一结果突显了实现真正自主、可靠的数据科学代理的挑战,也为未来研究提供了明确的方向。

该研究的创新在于结合真实环境、端到端任务设计和确定性评估机制,为推动AI系统向工业级自主化迈进奠定了基础。未来,研究将聚焦于增强模型的系统理解能力、扩展任务多样性及提升鲁棒性,推动自动化数据分析的广泛应用。整体而言,DSAgentBench为AI自主化在数据科学中的落地提供了重要平台,具有深远的学术和产业价值。

深度分析

研究背景

数据科学作为信息时代的核心技术,经历了从手工编码到自动化工具的演变。早期工作如HumanEval主要关注代码正确性,近年来出现了多种专注于数据处理、建模和可视化的基准(如DS-1000、MLAgentBench),但大多局限于静态环境或单阶段任务。随着大模型的发展,研究者开始尝试用AI辅助数据分析,生成代码或管理任务上下文(如GPT-4、Claude系列),但仍未能实现全流程自主操作。行业报告指出,现有系统在多工具协调、环境理解和长流程推理方面存在明显短板,限制了AI在实际数据科学工作中的应用潜力。此背景促使我们开发了面向真实环境的端到端基准,旨在推动AI向自主化、可验证方向发展。

核心问题

核心问题在于现有AI模型难以在真实操作系统中自主执行完整的数据科学流程。具体表现为工具调用不精准、环境理解不足、长流程推理失败频繁,导致任务成功率低。数据科学工作涉及多工具协作(如Jupyter、VS Code、数据库),需要连续的分析推理和中间状态管理。现有基准多局限于代码静态测试,缺乏对环境交互和多阶段流程的评估。解决这一问题对于实现自动化决策、降低人力成本、提升数据分析效率具有重要意义。

核心创新

本研究的主要创新包括:1)构建结合真实操作系统的端到端任务基准,模拟实际数据科学流程;2)设计275个多阶段、多工具任务,涵盖数据采集、探索、建模、验证等环节;3)引入确定性评估机制,验证分析正确性和模型性能,超越代码正确性;4)支持多模态观察(截图、UI树)和GUI操作,模拟真实场景。这些创新突破了以往静态、单阶段评估的局限,为AI自主执行复杂数据科学任务提供了新平台。

方法详解

  • �� 构建环境:在Ubuntu操作系统中预装Python及常用数据科学库(如pandas、scikit-learn),支持多模态观察(截图、UI树)和GUI操作。
  • �� 任务设计:基于专家分析和LLM协作,定义275个任务,覆盖数据采集、探索、特征工程、建模、验证等关键环节,确保符合实际工作流程。
  • �� 任务配置:每个任务包括系统初始化状态(数据集、文件结构、工具安装),自然语言指令,以及Python评估脚本。
  • �� 交互流程:代理通过感知(截图/UI树)和操作(鼠标、键盘)实现任务执行,支持多工具协调,最大15步,自动记录轨迹。
  • �� 评估机制:采用确定性评估器验证输出的分析正确性、可视化效果和模型性能,确保任务成功。

实验设计

实验选用多种模型,包括OpenAI的GPT-4o、GPT-5系列、Claude-4.6-Sonnet以及开源模型(UI-TARS、GUI-OWL等),在275个任务中进行评估。指标包括任务成功率、工具调用准确性和多步骤推理能力。模型参数和提示策略经过优化,确保公平比较。还设计了消融实验,分析不同观察输入(截图vs.截图+UI树)对性能的影响。通过大量重复试验,统计模型在不同任务复杂度和工具组合下的表现差异,验证基准的鲁棒性。

结果分析

Claude-4.6-Sonnet在275个任务中成功完成56.7%,显著优于开源模型(普遍低于1%),显示其在工具调度和长流程推理上的优势。多模型在多工具、多阶段任务中的表现差异明显,尤其在系统理解和中间状态管理方面存在严重不足。模型在工具调用、环境理解和跨应用协调方面频繁失败,突显了当前模型在复杂环境中的局限。实验还揭示,模型在处理多模态信息和连续推理方面仍需改进,未来需结合强化学习和系统理解能力提升性能。

应用场景

该基准适用于研发自主数据科学代理、自动化分析平台和智能决策系统。工业界可借助此平台优化数据处理流程,减少人工干预,提高效率。教育领域也可用作教学工具,帮助学生理解数据科学的复杂流程。未来,结合此基准的研究有望实现全自动化的数据分析、模型部署和持续优化,推动行业数字化转型。

局限与展望

当前模型在多工具协调和系统理解方面仍表现不足,难以应对复杂、多阶段任务。环境配置依赖特定平台(Ubuntu),扩展性有限。模型在处理多模态信息时表现不稳定,缺乏鲁棒性。此外,评估指标主要关注成功率,未充分考虑效率和可解释性。未来需增强模型的环境适应性、推理深度和多模态融合能力,以实现更广泛的工业应用。

通俗解读 非专业人士也能看懂

想象你在一家大型厨房,准备做一道复杂的菜。这道菜需要你先买材料(数据采集),然后尝试不同的调料(探索分析),接着切菜、炒菜(建模),最后摆盘(可视化)并品尝(验证)。每一步都需要用不同的厨具(工具),你还要不断检查味道(中间输出)和调整步骤。这整个过程很复杂,不能只关注最后的成品,还要在每个环节都掌握好。现在,AI代理就像一个聪明的厨师助手,它要学会在厨房里自主操作所有厨具,理解每个步骤,确保每道菜都能做得好。这项研究就像是在教这个助手如何在真实厨房中完成完整的菜谱,挑战它的工具调度、环境理解和长流程推理能力。最终目标是让它像专业厨师一样,自己动手、独立完成复杂的菜肴,而不是只会做一两道简单菜。

原文摘要

Real-world data science involves long-horizon workflows that span data wrangling, exploration, modeling, visualization, and validation, and require coordinated use of tools such as notebooks, IDEs, terminals, browsers, and databases within real operating environments. Yet existing benchmarks lack real-computer interaction and do not evaluate whether agents can execute complete end-to-end data-science workflows in realistic computing environments, failing to capture the multi-stage, multi-tool nature of data-science practice. We introduce DSAgentBench, the first benchmark to evaluate whether agents can automate full data-science workflows inside real computer environments. DSAgentBench contains 275 diverse tasks covering the entire data-science life-cycle, reflecting the complexity and tool coordination required in practice. Each task requires grounding decisions in intermediate outputs and coordinated tool use, and includes a deterministic evaluator that verifies analytical correctness, visual outputs, and model performance rather than code-only execution. Our extensive experiments with 15 closed- and open-source models show that even the strongest agent, Claude-4.6-Sonnet, achieves only 56.70% task success, while all open-source agents remain below 1%, frequently failing at tool orchestration, OS grounding, and multi-step reasoning. These results reveal a substantial capability gap between current agentic systems and real data-science workflows, positioning DSAgentBench as a foundation for developing grounded, verifiable, autonomous data-science agents. We release DSAgentBench at https://github.com/vis-nlp/DSAgentBench.

cs.AI cs.CL