FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents

TL;DR

FT-Dojo通过FT-Agent实现自动化LLM微调,在13个任务中表现优异。

cs.AI 🔴 高级 2026-03-02 34 次浏览
Qizheng Li Yifei Zhang Xiao Yang Xu Yang Zhuo Wang Weiqing Liu Jiang Bian
自动化 微调 大语言模型 智能体 机器学习

核心发现

方法论

FT-Dojo是一个交互式基准环境,专注于自动化LLM微调。FT-Agent框架通过结构化迭代计划、快速失败验证和多层次反馈分析来优化数据和训练策略。其设计使得数据构建和微调配置成为主要优化目标。

关键结果

  • FT-Agent在13个任务中表现优异,10个任务中取得最佳成绩,尤其在AIME 2025任务中实现了11.11%的准确率,而其他基线为0%。
  • 在化学分子编辑任务中,FT-Agent达到了54.44%的准确率,超过了OpenHands的40.00%。
  • 在表格QA可视化任务中,FT-Agent的Pass@1为29.33%,优于OpenHands的24.00%。

研究意义

FT-Dojo和FT-Agent的引入为自动化LLM微调提供了新的基准和工具,显著减少了人工干预的需求。这一研究为特定领域的模型适应性提供了新的视角,推动了自动化机器学习的发展。

技术贡献

FT-Dojo标准化了任务接口、数据存储库和反馈协议,FT-Agent引入了结构化迭代和快速失败验证机制,显著提高了微调效率和效果。与现有方法相比,FT-Agent在处理复杂任务时表现出色。

新颖性

FT-Dojo是首个专注于LLM微调的交互式基准环境,FT-Agent通过自动化迭代优化实现了在多个任务上的突破性表现。

局限性

  • FT-Agent在因果诊断和长远规划上仍有不足,可能导致资源浪费。
  • 在某些任务中,FT-Agent的表现仍低于手动微调。
  • 对复杂反馈信号的理解有限。

未来方向

未来研究可探索FT-Agent在更多领域的应用,并改进其因果诊断能力和长远规划能力,以进一步提升自动化微调的效率和效果。

AI 总览摘要

FT-Dojo是一个新兴的交互式基准环境,旨在通过FT-Agent实现大语言模型(LLM)的自动化微调。当前的微调过程通常需要大量的人力投入,FT-Dojo通过标准化任务接口和反馈协议,简化了这一过程。

FT-Agent是一个专为微调设计的智能体框架,利用结构化迭代计划、快速失败验证和多层次反馈分析来优化数据和训练策略。实验结果显示,FT-Agent在13个任务中表现优异,尤其在AIME 2025任务中取得了突破性进展。

尽管FT-Agent在多个任务中表现出色,但在因果诊断和长远规划方面仍存在局限。未来的研究将致力于提高FT-Agent的诊断能力和规划能力,以进一步推动自动化微调的应用和发展。

深度分析

研究背景

近年来,大语言模型(LLM)在多个领域取得了显著进展。然而,将这些模型应用于特定领域仍需进行复杂的微调过程,这通常需要大量的人力和专业知识。现有的微调方法多依赖于手动数据整理和训练配置,效率低下且难以扩展。

核心问题

当前的LLM微调过程复杂且耗时,涉及数据整理、训练配置和模型行为诊断。如何自动化这一过程以提高效率和效果,成为研究的核心问题。

核心创新

FT-Dojo通过标准化任务接口和反馈协议,简化了微调过程。FT-Agent引入了结构化迭代计划和快速失败验证机制,显著提高了微调效率。与传统方法相比,FT-Agent能够更好地处理复杂任务。

方法详解

  • �� FT-Dojo标准化了任务接口和反馈协议,简化了微调过程。

  • �� FT-Agent利用结构化迭代计划优化数据和训练策略。

  • �� 快速失败验证机制提高了微调效率,减少了资源浪费。

  • �� 多层次反馈分析帮助智能体更好地理解和优化模型行为。

实验设计

实验在FT-Dojo的13个任务上进行,涵盖数学、化学、金融等领域。每个实验在单个GPU上运行,限制在12小时内完成。使用Qwen2.5-7B-Instruct作为基础模型,限制训练样本不超过2000个。

结果分析

FT-Agent在10个任务中取得最佳成绩,尤其在AIME 2025任务中实现了11.11%的准确率,而其他基线为0%。在化学分子编辑任务中,FT-Agent达到了54.44%的准确率,超过了OpenHands的40.00%。

应用场景

FT-Dojo和FT-Agent可用于自动化特定领域的模型微调,减少人工干预,提升效率。其在数学、化学和金融领域的应用显示出广阔的前景。

局限与展望

尽管FT-Agent在多个任务中表现出色,但在因果诊断和长远规划方面仍存在局限。未来研究将致力于提高FT-Agent的诊断能力和规划能力。

通俗解读 非专业人士也能看懂

想象你在厨房准备一顿大餐。你需要选择食材、设定烹饪时间,并根据味道反馈调整调料。FT-Dojo就像一个智能厨房助手,帮助你自动选择食材和调整烹饪参数。FT-Agent则是一个经验丰富的厨师,它能快速识别问题并调整策略,确保每道菜都达到最佳口味。通过这种方式,FT-Dojo和FT-Agent大大简化了复杂的烹饪过程,就像它们简化了LLM的微调过程一样。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏,需要不断调整策略才能赢。FT-Dojo就像一个超级智能的游戏助手,帮助你自动选择最佳策略。FT-Agent是游戏中的高手,它能快速识别问题并调整策略,确保你在游戏中取得最佳成绩。通过这种方式,FT-Dojo和FT-Agent让复杂的游戏变得简单,就像它们简化了LLM的微调过程一样。

术语表

FT-Dojo (微调道场)

一个用于自动化LLM微调的交互式基准环境,标准化了任务接口和反馈协议。

FT-Dojo用于评估智能体在LLM微调中的表现。

FT-Agent (微调智能体)

一个专为微调设计的智能体框架,利用结构化迭代计划和快速失败验证机制。

FT-Agent在FT-Dojo中用于优化数据和训练策略。

LLM (大语言模型)

一种能够生成和理解自然语言的大规模神经网络模型。

LLM在多个领域中被用于自然语言处理任务。

CoT (思维链)

一种用于解释和增强模型推理能力的技术,通过提供中间推理步骤提高模型性能。

在AIME 2025任务中,CoT被用于生成训练数据。

OpenHands (开放之手)

一种通用的代码执行和自动化系统,适用于多种任务。

OpenHands在FT-Dojo中作为基线进行比较。

开放问题 这项研究留下的未解疑问

  • 1 如何提高FT-Agent在因果诊断和长远规划中的表现?
  • 2 如何在更多领域中应用FT-Dojo和FT-Agent?
  • 3 如何进一步减少自动化微调过程中的资源浪费?

应用场景

近期应用

特定领域微调

FT-Dojo和FT-Agent可用于自动化特定领域的模型微调,减少人工干预,提升效率。

远期愿景

全面自动化微调

通过改进FT-Agent的诊断能力和规划能力,实现更广泛的自动化微调应用。

原文摘要

Fine-tuning large language models for vertical domains remains labor-intensive, requiring practitioners to curate data, configure training, and iteratively diagnose model behavior. Despite growing interest in autonomous machine learning and language agents, end-to-end LLM fine-tuning has not been systematically studied as an interactive agent task. We introduce FT-Dojo, an interactive benchmark environment for autonomous LLM fine-tuning, comprising 13 tasks across 5 domains. Rather than a new collection of static datasets, FT-Dojo standardizes a task interface, shared raw-data repository, sandboxed execution environment, structured feedback protocol, and held-out evaluation procedure. We further develop FT-Agent, a fine-tuning-oriented autonomous framework that uses structured iteration planning, fail-fast validation, and multi-level feedback analysis to refine data and training strategies. Experiments show that FT-Agent provides a strong initial baseline, achieving the best performance on 10 out of 13 tasks, with additional controlled comparisons against frontier agents, open-source planning backbones, and multi-run statistics supporting the main findings. Case studies show that agents can recover from failures through cumulative learning, while still exposing limitations in causal diagnosis and long-horizon planning. The implementation is available at https://github.com/microsoft/rd-agent.

cs.AI cs.LG