核心发现
方法论
研究采用高保真环境Corecraft,结合群体相对策略优化(GRPO)和自适应剪裁技术,训练GLM 4.6模型。Corecraft模拟了一个复杂的客户支持企业环境,包含2500多个实体和23种工具,旨在评估AI代理在多步骤、领域特定任务中的表现。
关键结果
- GLM 4.6在Corecraft环境中训练一轮后,任务通过率从25.37%提高到36.76%。
- 在BFCL Parallel、Tau2-Bench Retail和Tool Decathlon等分布外基准上分别提高了4.5%、7.4%和6.8%。
- 通过多步骤工作流执行、约束处理和响应质量等方面的改进,展示了模型的学习能力。
研究意义
研究表明,高质量、多样性和现实主义的环境是实现AI代理通用化能力的关键。通过在复杂的企业模拟环境中训练,模型不仅在特定任务上表现优异,还能在分布外任务中展现出色的迁移能力。
技术贡献
该研究在高保真环境中应用GRPO和自适应剪裁技术,展示了在复杂企业环境中训练AI代理的可行性。通过详细的评分标准,提供了可靠的奖励信号,增强了模型的学习效果。
新颖性
首次在企业级高保真环境中训练AI代理,展示了其在分布外任务中的迁移能力。与以往简化模拟环境不同,Corecraft提供了更真实的企业工作流。
局限性
- 模型在某些任务中仍表现出搜索策略不佳的问题,未能有效利用工具。
- 在处理不完整结果时,模型未能识别分页信号。
- 模型在工具探索上存在局限,未能充分利用所有可用工具。
未来方向
未来研究可探索在更多领域应用高保真环境训练AI代理,并进一步优化模型在复杂任务中的表现。
AI 总览摘要
在AI代理的训练中,传统的简化模拟环境往往无法捕捉真实世界的复杂性,导致模型在实际应用中表现不佳。为解决这一问题,研究团队开发了Corecraft,一个高保真企业模拟环境,模拟了一个复杂的客户支持组织。通过在该环境中训练GLM 4.6模型,研究展示了模型在多步骤任务中的显著提升,并在分布外基准上实现了良好的迁移效果。
Corecraft环境的设计基于三个核心原则:任务中心设计、专家撰写的评估标准和真实的企业工作流。这些设计使得环境不仅适合训练,还能有效评估模型的通用化能力。通过使用群体相对策略优化(GRPO)和自适应剪裁技术,模型在训练后表现出色,任务通过率显著提高。
尽管研究取得了显著进展,但模型在工具使用和结果处理上仍存在一定局限。未来的研究将继续优化模型的学习策略,并探索在更多领域应用高保真环境的可能性。
深度分析
研究背景
近年来,AI代理在强化学习中的应用取得了显著进展。然而,许多现有的训练环境过于简化,无法反映真实世界的复杂性。这导致模型在实际应用中表现不佳,难以实现通用化能力。
核心问题
现有的AI代理训练环境往往过于简化,无法捕捉真实企业工作流的复杂性。这导致模型在实际应用中表现不佳,难以适应分布外任务。
核心创新
Corecraft环境的创新在于其高保真模拟,提供了一个复杂的企业环境,包含2500多个实体和23种工具。通过专家撰写的评估标准,环境能够有效评估模型在多步骤任务中的表现。
方法详解
- �� 使用Corecraft环境进行训练
- �� 采用GRPO和自适应剪裁技术进行优化
- �� 通过专家撰写的评估标准提供奖励信号
- �� 在训练后进行分布外基准测试
实验设计
实验使用了Corecraft环境中的1000个训练任务和150个评估任务。模型在训练后进行了分布外基准测试,包括BFCL Parallel、Tau2-Bench Retail和Tool Decathlon。
结果分析
GLM 4.6在Corecraft环境中训练一轮后,任务通过率从25.37%提高到36.76%。在分布外基准上,模型在BFCL Parallel、Tau2-Bench Retail和Tool Decathlon上分别提高了4.5%、7.4%和6.8%。
应用场景
该研究的成果可应用于需要复杂任务处理的企业环境,如客户支持、订单管理和数据分析。通过在高保真环境中训练,模型能够更好地适应实际应用场景。
局限与展望
尽管模型在训练后表现出色,但在工具使用和结果处理上仍存在一定局限。未来研究需继续优化模型的学习策略,并探索更多领域的应用。
通俗解读 非专业人士也能看懂
想象你在一个复杂的公司工作,比如一个在线电脑零件零售商。你的任务是帮助客户解决问题,比如订单查询或产品兼容性检查。Corecraft就像一个虚拟的公司,它模拟了所有这些复杂的工作流程。通过在这个虚拟公司中训练AI代理,我们可以让它们学习如何处理这些复杂的任务。就像在厨房里学做饭,AI代理需要学习如何使用不同的工具和材料来完成一道菜。在Corecraft中,AI代理学习如何使用不同的工具来解决客户的问题,并在训练后在其他类似的任务中表现出色。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的模拟游戏,这个游戏模拟了一个电脑零件商店。你需要帮助顾客解决各种问题,比如查找订单或检查产品兼容性。Corecraft就是这样一个虚拟世界,它帮助AI代理学习如何在这种复杂的环境中工作。通过在这个虚拟世界中训练,AI代理可以学会如何处理复杂的任务,就像在游戏中升级一样。训练后的AI代理不仅在这个虚拟世界中表现出色,还能在其他类似的任务中展现出色的能力。
术语表
Corecraft
一个高保真企业模拟环境,用于训练和评估AI代理在复杂任务中的表现。
用于模拟客户支持组织的复杂工作流。
GRPO
群体相对策略优化,一种用于优化AI代理训练的强化学习算法。
用于在Corecraft环境中训练GLM 4.6模型。
自适应剪裁
一种防止训练过程中熵崩溃的技术,增强模型的稳定性。
与GRPO结合使用以优化训练过程。
高保真环境
模拟真实企业工作流的复杂环境,提供多样性和挑战性任务。
用于训练AI代理以提高其通用化能力。
任务通过率
衡量模型在特定任务中表现的指标,要求满足所有评分标准。
用于评估GLM 4.6在Corecraft环境中的表现。
开放问题 这项研究留下的未解疑问
- 1 如何在更多领域应用高保真环境训练AI代理,以提高其通用化能力。
- 2 如何优化模型在复杂任务中的工具使用策略。
- 3 如何进一步提高模型在分布外任务中的迁移能力。
应用场景
近期应用
客户支持
在复杂的客户支持环境中应用AI代理,帮助解决多步骤问题,提高效率。
远期愿景
企业自动化
通过在高保真环境中训练AI代理,实现企业流程的全面自动化,提升生产力。
原文摘要
We show that training AI agents on high-fidelity reinforcement learning environments produces capabilities that generalize beyond the training distribution. We introduce CoreCraft, the first environment in EnterpriseBench, Surge AI's suite of agentic RL environments. CoreCraft is a fully operational enterprise simulation of a customer support organization, comprising over 2,500 entities across 14 entity types with 23 unique tools, designed to measure whether AI agents can perform the multi-step, domain-specific work that real jobs demand. Frontier models such as GPT-5.2 and Claude Opus 4.6 solve fewer than 30% of tasks when all expert-authored rubric criteria must be satisfied. Using this environment, we train GLM 4.6 with Group Relative Policy Optimization (GRPO) and adaptive clipping. After a single epoch of training, the model improves from 25.37% to 36.76% task pass rate on held-out evaluation tasks. More importantly, these gains transfer to out-of-distribution benchmarks: +4.5% on BFCL Parallel, +7.4% on Tau2-Bench Retail, and +6.8% on Tool Decathlon (Pass@1). We believe three environment properties are consistent with the observed transfer: task-centric world building that optimizes for diverse, challenging tasks; expert-authored rubrics enabling reliable reward computation; and enterprise workflows that reflect realistic professional patterns. Our results suggest that environment quality, diversity, and realism are key factors enabling generalizable agent capabilities.