Klear-AgentForge: Forging Agentic Intelligence through Posttraining Scaling

TL;DR

提出Klear-Qwen3-AgentForge,基于Qwen3-8B模型,结合SFT和多轮RL,达成多任务代理能力。

cs.AI 🔴 高级 2025-11-08 38 次浏览
Qi Wang Hongzhi Zhang Jia Fu Kai Fu Yahui Liu Tinghai Zhang Chenxi Sun Gangwei Jiang Jingyi Tang Xingguang Ji Yang Yue Jingyuan Zhang Fuzheng Zhang Kun Gai Guorui Zhou
大型语言模型 强化学习 多任务学习 工具使用 编码能力

核心发现

方法论

本文设计了结合合成数据的监督微调(SFT)和多轮强化学习(RL)框架,以提升模型的多任务代理能力。采用多域环境构建,结合工具调用和编码任务,利用GRPO(Generalized Reinforcement Policy Optimization)目标优化策略,解决奖励稀疏问题。模型在工具使用和编码基准上实现了SOTA性能,验证了多阶段训练的有效性。

关键结果

  • Klear-Qwen3-AgentForge-8B在工具调用和编码任务中分别达到了71.5和56.7的性能分数,优于同规模模型和部分大模型(如GPT-4.1); 在BFCL v3、τ-bench和SWE-bench等多任务评测中表现优异,显示出强大的多任务适应性和泛化能力。
  • 通过模型规模和数据扩展实验,验证了模型性能随参数和训练数据的增长而显著提升,尤其在多轮推理和环境交互任务中表现出更强的稳定性和准确性。
  • 引入细粒度奖励机制和异步架构,有效缓解奖励稀疏和训练效率瓶颈,提升训练稳定性和可扩展性。

研究意义

该研究突破了开源社区在多任务、多轮交互代理模型训练中的瓶颈,提供了完整的开源训练流程,推动了智能系统在工具交互和编码自动化领域的应用。模型在多任务环境中表现出优异的泛化能力,具有广泛的工业和科研价值,为未来自主智能体的研发奠定基础。

技术贡献

提出结合合成数据的SFT与多轮RL训练体系,创新性地设计奖励机制以缓解稀疏奖励问题。采用异步架构提升训练效率,结合模型合并策略实现多任务模型的融合。引入细粒度奖励和环境模拟,增强模型的环境交互能力,显著优于传统单轮训练或纯RL方法。

新颖性

首次系统性结合合成数据驱动的SFT与多轮强化学习,构建完整的多任务代理训练流程。提出多任务模型合并策略,有效整合不同任务的知识,提升模型泛化和适应能力。实现了在开源条件下,模型性能超越同规模大模型的突破性进展。

局限性

  • 模型训练依赖大量高质量合成数据,数据生成成本较高,且在极端复杂任务中仍存在泛化不足的问题。
  • 多任务合并策略在任务间存在潜在干扰,可能影响某些特定任务的性能。
  • 当前训练架构对硬件资源要求较高,限制了更大规模模型的快速部署。

未来方向

未来将探索更高效的数据合成与筛选机制,优化多任务融合策略,提升模型在更复杂环境中的表现。同时,结合更丰富的环境模拟和自我监督技术,推动自主学习能力的提升,向更通用的智能代理迈进。

AI 总览摘要

随着大型语言模型(LLMs)在自然语言处理中的崛起,如何赋予其多任务、多轮交互的代理能力成为研究热点。传统模型多局限于单轮预测,难以应对复杂环境中的连续决策。本文提出Klear-Qwen3-AgentForge,基于开源Qwen3-8B模型,通过结合合成数据的监督微调(SFT)和多轮强化学习(RL),实现了多任务、多环境的高效代理能力。

在方法上,作者设计了多域环境,支持工具调用和编码任务,利用GRPO目标优化策略,有效缓解奖励稀疏问题。模型在工具使用和编码任务中分别取得71.5和56.7的性能分数,超越同规模模型,接近甚至优于部分大模型(如GPT-4.1)。通过模型扩展和数据规模的实验,验证了性能随参数和数据增长的显著提升。

此外,创新性引入细粒度奖励机制和异步训练架构,大幅提升训练效率和稳定性。模型在多个基准测试中表现出优异的泛化能力,展现了在开源条件下实现高性能多任务代理的可能性。这一工作不仅推动了多任务、多轮交互模型的研究,也为工业界的智能自动化提供了强有力的技术基础。

未来,作者计划优化合成数据生成流程,增强模型在极端复杂任务中的表现,并探索更智能的环境模拟与自我监督技术,朝着更通用、更自主的智能体方向发展。

深度分析

研究背景

近年来,LLMs在自然语言理解和生成中取得突破,但多任务、多轮交互能力仍受限。早期工作如GPT系列、T5、BERT等主要关注单轮预测,难以应对复杂环境中的连续决策。近年来,研究者开始探索多轮推理和工具调用,如ReAct、Toolformer等,旨在增强模型的交互能力。尽管如此,奖励稀疏、训练效率低、环境模拟不足等问题依然存在,限制了模型在实际应用中的表现。开源社区对高效、多任务、多轮智能体的需求日益增长,推动了多阶段训练体系的研发。

核心问题

核心问题在于如何系统性地训练具备多任务、多轮交互能力的模型。传统方法多依赖单一训练策略,难以兼顾不同任务的特性,且奖励稀疏导致学习效率低。如何设计统一的训练流程,结合合成数据和环境模拟,提升模型的泛化和适应能力,是当前亟待解决的难题。此外,模型在多任务融合、环境交互的稳定性和效率方面仍存在瓶颈。

核心创新

本文的创新点包括:1)提出结合合成数据的监督微调(SFT)策略,丰富模型的基础知识;2)设计多轮强化学习(RL)框架,解决奖励稀疏问题,增强环境交互能力;3)采用异步架构提升训练效率,减少GPU空闲时间;4)引入模型合并策略,实现多任务模型的有效融合。这些创新共同推动了多任务、多轮智能体的研发,突破了以往单一任务或单轮训练的限制。

方法详解

  • �� 构建多域环境,支持工具调用和编码任务,定义行动空间包括生成和调用工具。
  • �� 利用合成数据和真实数据,采用多轮提示生成轨迹,筛选高质量样本。
  • �� 通过SFT对模型进行基础微调,增强任务相关能力。
  • �� 设计多轮RL训练,采用GRPO目标,结合细粒度奖励机制,缓解奖励稀疏。
  • �� 实现异步架构,分离采样和训练过程,提高效率。
  • �� 采用模型合并策略,将不同任务的模型参数融合,提升多任务性能。

实验设计

在BFCL v3、τ-bench和SWE-bench等多个基准上评估模型性能,比较不同规模和训练策略的效果。使用参数扩展、数据扩充和奖励机制调优,进行消融实验验证各组件贡献。指标包括任务成功率、平均交互轮次和模型泛化能力。通过与GPT-4.1等大模型的对比,验证模型在多任务环境中的优越性。

结果分析

模型在工具调用任务中达到了71.5的性能分数,编码任务56.7,均优于同规模模型。在BFCL v3多轮API调用、τ-bench和SWE-bench任务中表现出色,显示出良好的泛化和适应能力。参数和数据扩展显著提升性能,验证了训练策略的有效性。引入奖励机制和异步架构后,训练稳定性和效率大幅改善。

应用场景

模型可应用于自动化编码、智能助手、环境交互和工具调用等场景,适合工业自动化、软件开发和智能客服等行业。其多任务能力和环境适应性,为实现自主智能体提供技术基础。未来可结合实际环境,部署在机器人、自动驾驶和智能制造中,推动行业智能升级。

局限与展望

模型训练依赖大量高质量合成数据,数据生成成本较高,且在极端复杂任务中仍存在泛化不足。多任务融合可能引入任务干扰,影响某些任务性能。硬件资源需求大,限制了更大模型的快速训练和部署。未来需优化数据效率和模型鲁棒性。

通俗解读 非专业人士也能看懂

想象一个厨房里有许多厨师(模型),他们需要准备不同的菜肴(任务)。每个厨师不仅要知道怎么做菜,还要会用各种工具,比如刀、锅、调料等。有的菜需要多次尝试和调整,厨师要不断试错,学会用不同的工具,最终做出美味的菜肴。这个研究就像教厨师们如何更聪明、更快地用工具,做出各种菜。通过反复练习和奖励机制,厨师们变得越来越厉害,能应对不同的菜谱和厨房环境。这就像让AI学会多任务、多轮交互,变得更智能、更灵活。

简单解释 像给14岁少年讲一样

想象你在学校里学做菜,你不仅要知道怎么做一道菜,还要学会用不同的厨具,比如刀、锅、调料瓶。有时候,你需要试几次才能做得好,还要学会用不同的工具帮忙,比如让机器人帮你切菜或者倒汤。这个研究就像是在教AI怎么像你一样,学会用各种工具,做出不同的菜。它通过不断练习和奖励,让AI变得更聪明,能应对很多不同的任务,比如写代码、用工具,甚至解决问题。这样,未来的AI就能像一个多才多艺的厨师,帮你完成各种复杂的事情!

原文摘要

Despite the proliferation of powerful agentic models, the lack of critical post-training details hinders the development of strong counterparts in the open-source community. In this study, we present a comprehensive and fully open-source pipeline for training a high-performance agentic model for interacting with external tools and environments, named Klear-Qwen3-AgentForge, starting from the Qwen3-8B base model. We design effective supervised fine-tuning (SFT) with synthetic data followed by multi-turn reinforcement learning (RL) to unlock the potential for multiple diverse agentic tasks. We perform exclusive experiments on various agentic benchmarks in both tool use and coding domains. Klear-Qwen3-AgentForge-8B achieves state-of-the-art performance among LLMs of similar size and remains competitive with significantly larger models.

cs.AI