EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments

TL;DR

使用Corecraft高保真环境训练AI代理,GLM 4.6模型任务通过率从25.37%提升至36.76%。

cs.AI 🔴 高级 2026-02-18 33 次浏览
Sushant Mehta Logan Ritchie Suhaas Garre Ian Niebres Nick Heiner Edwin Chen
强化学习 高保真环境 通用化 企业模拟 AI代理

核心发现

方法论

研究采用高保真环境Corecraft,结合群体相对策略优化(GRPO)和自适应剪裁技术,训练GLM 4.6模型。Corecraft模拟了一个复杂的客户支持企业环境,包含2500多个实体和23种工具,旨在评估AI代理在多步骤、领域特定任务中的表现。

关键结果

  • GLM 4.6在Corecraft环境中训练一轮后,任务通过率从25.37%提高到36.76%。
  • 在BFCL Parallel、Tau2-Bench Retail和Tool Decathlon等分布外基准上分别提高了4.5%、7.4%和6.8%。
  • 通过多步骤工作流执行、约束处理和响应质量等方面的改进,展示了模型的学习能力。

研究意义

研究表明,高质量、多样性和现实主义的环境是实现AI代理通用化能力的关键。通过在复杂的企业模拟环境中训练,模型不仅在特定任务上表现优异,还能在分布外任务中展现出色的迁移能力。

技术贡献

该研究在高保真环境中应用GRPO和自适应剪裁技术,展示了在复杂企业环境中训练AI代理的可行性。通过详细的评分标准,提供了可靠的奖励信号,增强了模型的学习效果。

新颖性

首次在企业级高保真环境中训练AI代理,展示了其在分布外任务中的迁移能力。与以往简化模拟环境不同,Corecraft提供了更真实的企业工作流。

局限性

  • 模型在某些任务中仍表现出搜索策略不佳的问题,未能有效利用工具。
  • 在处理不完整结果时,模型未能识别分页信号。
  • 模型在工具探索上存在局限,未能充分利用所有可用工具。

未来方向

未来研究可探索在更多领域应用高保真环境训练AI代理,并进一步优化模型在复杂任务中的表现。

AI 总览摘要

在AI代理的训练中,传统的简化模拟环境往往无法捕捉真实世界的复杂性,导致模型在实际应用中表现不佳。为解决这一问题,研究团队开发了Corecraft,一个高保真企业模拟环境,模拟了一个复杂的客户支持组织。通过在该环境中训练GLM 4.6模型,研究展示了模型在多步骤任务中的显著提升,并在分布外基准上实现了良好的迁移效果。

Corecraft环境的设计基于三个核心原则:任务中心设计、专家撰写的评估标准和真实的企业工作流。这些设计使得环境不仅适合训练,还能有效评估模型的通用化能力。通过使用群体相对策略优化(GRPO)和自适应剪裁技术,模型在训练后表现出色,任务通过率显著提高。

尽管研究取得了显著进展,但模型在工具使用和结果处理上仍存在一定局限。未来的研究将继续优化模型的学习策略,并探索在更多领域应用高保真环境的可能性。

深度分析

研究背景

近年来,AI代理在强化学习中的应用取得了显著进展。然而,许多现有的训练环境过于简化,无法反映真实世界的复杂性。这导致模型在实际应用中表现不佳,难以实现通用化能力。

核心问题

现有的AI代理训练环境往往过于简化,无法捕捉真实企业工作流的复杂性。这导致模型在实际应用中表现不佳,难以适应分布外任务。

核心创新

Corecraft环境的创新在于其高保真模拟,提供了一个复杂的企业环境,包含2500多个实体和23种工具。通过专家撰写的评估标准,环境能够有效评估模型在多步骤任务中的表现。

方法详解

  • �� 使用Corecraft环境进行训练
  • �� 采用GRPO和自适应剪裁技术进行优化
  • �� 通过专家撰写的评估标准提供奖励信号
  • �� 在训练后进行分布外基准测试

实验设计

实验使用了Corecraft环境中的1000个训练任务和150个评估任务。模型在训练后进行了分布外基准测试,包括BFCL Parallel、Tau2-Bench Retail和Tool Decathlon。

结果分析

GLM 4.6在Corecraft环境中训练一轮后,任务通过率从25.37%提高到36.76%。在分布外基准上,模型在BFCL Parallel、Tau2-Bench Retail和Tool Decathlon上分别提高了4.5%、7.4%和6.8%。

应用场景

该研究的成果可应用于需要复杂任务处理的企业环境,如客户支持、订单管理和数据分析。通过在高保真环境中训练,模型能够更好地适应实际应用场景。

局限与展望

尽管模型在训练后表现出色,但在工具使用和结果处理上仍存在一定局限。未来研究需继续优化模型的学习策略,并探索更多领域的应用。

通俗解读 非专业人士也能看懂

想象你在一个复杂的公司工作,比如一个在线电脑零件零售商。你的任务是帮助客户解决问题,比如订单查询或产品兼容性检查。Corecraft就像一个虚拟的公司,它模拟了所有这些复杂的工作流程。通过在这个虚拟公司中训练AI代理,我们可以让它们学习如何处理这些复杂的任务。就像在厨房里学做饭,AI代理需要学习如何使用不同的工具和材料来完成一道菜。在Corecraft中,AI代理学习如何使用不同的工具来解决客户的问题,并在训练后在其他类似的任务中表现出色。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的模拟游戏,这个游戏模拟了一个电脑零件商店。你需要帮助顾客解决各种问题,比如查找订单或检查产品兼容性。Corecraft就是这样一个虚拟世界,它帮助AI代理学习如何在这种复杂的环境中工作。通过在这个虚拟世界中训练,AI代理可以学会如何处理复杂的任务,就像在游戏中升级一样。训练后的AI代理不仅在这个虚拟世界中表现出色,还能在其他类似的任务中展现出色的能力。

术语表

Corecraft

一个高保真企业模拟环境,用于训练和评估AI代理在复杂任务中的表现。

用于模拟客户支持组织的复杂工作流。

GRPO

群体相对策略优化,一种用于优化AI代理训练的强化学习算法。

用于在Corecraft环境中训练GLM 4.6模型。

自适应剪裁

一种防止训练过程中熵崩溃的技术,增强模型的稳定性。

与GRPO结合使用以优化训练过程。

高保真环境

模拟真实企业工作流的复杂环境,提供多样性和挑战性任务。

用于训练AI代理以提高其通用化能力。

任务通过率

衡量模型在特定任务中表现的指标,要求满足所有评分标准。

用于评估GLM 4.6在Corecraft环境中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在更多领域应用高保真环境训练AI代理,以提高其通用化能力。
  • 2 如何优化模型在复杂任务中的工具使用策略。
  • 3 如何进一步提高模型在分布外任务中的迁移能力。

应用场景

近期应用

客户支持

在复杂的客户支持环境中应用AI代理,帮助解决多步骤问题,提高效率。

远期愿景

企业自动化

通过在高保真环境中训练AI代理,实现企业流程的全面自动化,提升生产力。

原文摘要

We show that training AI agents on high-fidelity reinforcement learning environments produces capabilities that generalize beyond the training distribution. We introduce CoreCraft, the first environment in EnterpriseBench, Surge AI's suite of agentic RL environments. CoreCraft is a fully operational enterprise simulation of a customer support organization, comprising over 2,500 entities across 14 entity types with 23 unique tools, designed to measure whether AI agents can perform the multi-step, domain-specific work that real jobs demand. Frontier models such as GPT-5.2 and Claude Opus 4.6 solve fewer than 30% of tasks when all expert-authored rubric criteria must be satisfied. Using this environment, we train GLM 4.6 with Group Relative Policy Optimization (GRPO) and adaptive clipping. After a single epoch of training, the model improves from 25.37% to 36.76% task pass rate on held-out evaluation tasks. More importantly, these gains transfer to out-of-distribution benchmarks: +4.5% on BFCL Parallel, +7.4% on Tau2-Bench Retail, and +6.8% on Tool Decathlon (Pass@1). We believe three environment properties are consistent with the observed transfer: task-centric world building that optimizes for diverse, challenging tasks; expert-authored rubrics enabling reliable reward computation; and enterprise workflows that reflect realistic professional patterns. Our results suggest that environment quality, diversity, and realism are key factors enabling generalizable agent capabilities.

cs.AI cs.LG