Klear-AgentForge: Forging Agentic Intelligence through Posttraining Scaling
提出Klear-Qwen3-AgentForge,基于Qwen3-8B模型,结合SFT和多轮RL,达成多任务代理能力。
核心发现
方法论
本文设计了结合合成数据的监督微调(SFT)和多轮强化学习(RL)框架,以提升模型的多任务代理能力。采用多域环境构建,结合工具调用和编码任务,利用GRPO(Generalized Reinforcement Policy Optimization)目标优化策略,解决奖励稀疏问题。模型在工具使用和编码基准上实现了SOTA性能,验证了多阶段训练的有效性。
关键结果
- Klear-Qwen3-AgentForge-8B在工具调用和编码任务中分别达到了71.5和56.7的性能分数,优于同规模模型和部分大模型(如GPT-4.1); 在BFCL v3、τ-bench和SWE-bench等多任务评测中表现优异,显示出强大的多任务适应性和泛化能力。
- 通过模型规模和数据扩展实验,验证了模型性能随参数和训练数据的增长而显著提升,尤其在多轮推理和环境交互任务中表现出更强的稳定性和准确性。
- 引入细粒度奖励机制和异步架构,有效缓解奖励稀疏和训练效率瓶颈,提升训练稳定性和可扩展性。
研究意义
该研究突破了开源社区在多任务、多轮交互代理模型训练中的瓶颈,提供了完整的开源训练流程,推动了智能系统在工具交互和编码自动化领域的应用。模型在多任务环境中表现出优异的泛化能力,具有广泛的工业和科研价值,为未来自主智能体的研发奠定基础。
技术贡献
提出结合合成数据的SFT与多轮RL训练体系,创新性地设计奖励机制以缓解稀疏奖励问题。采用异步架构提升训练效率,结合模型合并策略实现多任务模型的融合。引入细粒度奖励和环境模拟,增强模型的环境交互能力,显著优于传统单轮训练或纯RL方法。
新颖性
首次系统性结合合成数据驱动的SFT与多轮强化学习,构建完整的多任务代理训练流程。提出多任务模型合并策略,有效整合不同任务的知识,提升模型泛化和适应能力。实现了在开源条件下,模型性能超越同规模大模型的突破性进展。
局限性
- 模型训练依赖大量高质量合成数据,数据生成成本较高,且在极端复杂任务中仍存在泛化不足的问题。
- 多任务合并策略在任务间存在潜在干扰,可能影响某些特定任务的性能。
- 当前训练架构对硬件资源要求较高,限制了更大规模模型的快速部署。
未来方向
未来将探索更高效的数据合成与筛选机制,优化多任务融合策略,提升模型在更复杂环境中的表现。同时,结合更丰富的环境模拟和自我监督技术,推动自主学习能力的提升,向更通用的智能代理迈进。
AI 总览摘要
随着大型语言模型(LLMs)在自然语言处理中的崛起,如何赋予其多任务、多轮交互的代理能力成为研究热点。传统模型多局限于单轮预测,难以应对复杂环境中的连续决策。本文提出Klear-Qwen3-AgentForge,基于开源Qwen3-8B模型,通过结合合成数据的监督微调(SFT)和多轮强化学习(RL),实现了多任务、多环境的高效代理能力。
在方法上,作者设计了多域环境,支持工具调用和编码任务,利用GRPO目标优化策略,有效缓解奖励稀疏问题。模型在工具使用和编码任务中分别取得71.5和56.7的性能分数,超越同规模模型,接近甚至优于部分大模型(如GPT-4.1)。通过模型扩展和数据规模的实验,验证了性能随参数和数据增长的显著提升。
此外,创新性引入细粒度奖励机制和异步训练架构,大幅提升训练效率和稳定性。模型在多个基准测试中表现出优异的泛化能力,展现了在开源条件下实现高性能多任务代理的可能性。这一工作不仅推动了多任务、多轮交互模型的研究,也为工业界的智能自动化提供了强有力的技术基础。
未来,作者计划优化合成数据生成流程,增强模型在极端复杂任务中的表现,并探索更智能的环境模拟与自我监督技术,朝着更通用、更自主的智能体方向发展。
深度分析
研究背景
近年来,LLMs在自然语言理解和生成中取得突破,但多任务、多轮交互能力仍受限。早期工作如GPT系列、T5、BERT等主要关注单轮预测,难以应对复杂环境中的连续决策。近年来,研究者开始探索多轮推理和工具调用,如ReAct、Toolformer等,旨在增强模型的交互能力。尽管如此,奖励稀疏、训练效率低、环境模拟不足等问题依然存在,限制了模型在实际应用中的表现。开源社区对高效、多任务、多轮智能体的需求日益增长,推动了多阶段训练体系的研发。
核心问题
核心问题在于如何系统性地训练具备多任务、多轮交互能力的模型。传统方法多依赖单一训练策略,难以兼顾不同任务的特性,且奖励稀疏导致学习效率低。如何设计统一的训练流程,结合合成数据和环境模拟,提升模型的泛化和适应能力,是当前亟待解决的难题。此外,模型在多任务融合、环境交互的稳定性和效率方面仍存在瓶颈。
核心创新
本文的创新点包括:1)提出结合合成数据的监督微调(SFT)策略,丰富模型的基础知识;2)设计多轮强化学习(RL)框架,解决奖励稀疏问题,增强环境交互能力;3)采用异步架构提升训练效率,减少GPU空闲时间;4)引入模型合并策略,实现多任务模型的有效融合。这些创新共同推动了多任务、多轮智能体的研发,突破了以往单一任务或单轮训练的限制。
方法详解
- �� 构建多域环境,支持工具调用和编码任务,定义行动空间包括生成和调用工具。
- �� 利用合成数据和真实数据,采用多轮提示生成轨迹,筛选高质量样本。
- �� 通过SFT对模型进行基础微调,增强任务相关能力。
- �� 设计多轮RL训练,采用GRPO目标,结合细粒度奖励机制,缓解奖励稀疏。
- �� 实现异步架构,分离采样和训练过程,提高效率。
- �� 采用模型合并策略,将不同任务的模型参数融合,提升多任务性能。
实验设计
在BFCL v3、τ-bench和SWE-bench等多个基准上评估模型性能,比较不同规模和训练策略的效果。使用参数扩展、数据扩充和奖励机制调优,进行消融实验验证各组件贡献。指标包括任务成功率、平均交互轮次和模型泛化能力。通过与GPT-4.1等大模型的对比,验证模型在多任务环境中的优越性。
结果分析
模型在工具调用任务中达到了71.5的性能分数,编码任务56.7,均优于同规模模型。在BFCL v3多轮API调用、τ-bench和SWE-bench任务中表现出色,显示出良好的泛化和适应能力。参数和数据扩展显著提升性能,验证了训练策略的有效性。引入奖励机制和异步架构后,训练稳定性和效率大幅改善。
应用场景
模型可应用于自动化编码、智能助手、环境交互和工具调用等场景,适合工业自动化、软件开发和智能客服等行业。其多任务能力和环境适应性,为实现自主智能体提供技术基础。未来可结合实际环境,部署在机器人、自动驾驶和智能制造中,推动行业智能升级。
局限与展望
模型训练依赖大量高质量合成数据,数据生成成本较高,且在极端复杂任务中仍存在泛化不足。多任务融合可能引入任务干扰,影响某些任务性能。硬件资源需求大,限制了更大模型的快速训练和部署。未来需优化数据效率和模型鲁棒性。
通俗解读 非专业人士也能看懂
想象一个厨房里有许多厨师(模型),他们需要准备不同的菜肴(任务)。每个厨师不仅要知道怎么做菜,还要会用各种工具,比如刀、锅、调料等。有的菜需要多次尝试和调整,厨师要不断试错,学会用不同的工具,最终做出美味的菜肴。这个研究就像教厨师们如何更聪明、更快地用工具,做出各种菜。通过反复练习和奖励机制,厨师们变得越来越厉害,能应对不同的菜谱和厨房环境。这就像让AI学会多任务、多轮交互,变得更智能、更灵活。
简单解释 像给14岁少年讲一样
想象你在学校里学做菜,你不仅要知道怎么做一道菜,还要学会用不同的厨具,比如刀、锅、调料瓶。有时候,你需要试几次才能做得好,还要学会用不同的工具帮忙,比如让机器人帮你切菜或者倒汤。这个研究就像是在教AI怎么像你一样,学会用各种工具,做出不同的菜。它通过不断练习和奖励,让AI变得更聪明,能应对很多不同的任务,比如写代码、用工具,甚至解决问题。这样,未来的AI就能像一个多才多艺的厨师,帮你完成各种复杂的事情!
原文摘要
Despite the proliferation of powerful agentic models, the lack of critical post-training details hinders the development of strong counterparts in the open-source community. In this study, we present a comprehensive and fully open-source pipeline for training a high-performance agentic model for interacting with external tools and environments, named Klear-Qwen3-AgentForge, starting from the Qwen3-8B base model. We design effective supervised fine-tuning (SFT) with synthetic data followed by multi-turn reinforcement learning (RL) to unlock the potential for multiple diverse agentic tasks. We perform exclusive experiments on various agentic benchmarks in both tool use and coding domains. Klear-Qwen3-AgentForge-8B achieves state-of-the-art performance among LLMs of similar size and remains competitive with significantly larger models.