APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training

TL;DR

提出APTBench,基于真实任务轨迹评估基础大模型的代理潜能,涵盖软件工程与深度研究场景。

cs.AI 🔴 高级 2025-10-28 45 次浏览
Jiarui Qin Yunjia Xi Junjie Huang Renting Rui Di Yin Weiwen Liu Yong Yu Weinan Zhang Xing Sun
大模型 预训练评估 代理能力 任务轨迹 多任务学习

核心发现

方法论

APTBench通过采集真实场景中的成功轨迹,将复杂多轮任务转化为多项选择或文本补全题,重点评估模型的规划、行动和领域特定原子能力。采用正确答案提取、负样本生成和人工验证,构建软件工程与深度研究两个子场景的基准。该方法利用长序列、多轮交互,结合具体任务设计,兼顾模型的长上下文处理能力与代理能力。实验中,基于不同规模模型(如Qwen3系列、Llama、DeepSeek)验证了该基准的相关性,发现模型规模达到一定阈值后,代理能力显著提升,体现出“突变”现象。

关键结果

  • 在Qwen3-1.7B模型上,APTBench得分平均为24.27,随着模型规模扩大至Qwen3-30B,得分提升至41.60,显示出模型代理能力的规模依赖性。
  • 在软件工程场景中,模型的规划准确率(ACC)从17.84%提升至49.93%,行动的精确匹配率(EM)从25.19%到29.15%,验证了基准的有效性。
  • 在深度研究任务中,模型表现出明显的“突变”点,30B以上模型在任务完成度和推理能力上显著优于小模型,说明代理能力的出现具有规模门槛。

研究意义

该研究突破了传统静态技能评估的局限,提出面向预训练阶段的代理潜能评估框架,为模型的自主任务执行能力提供早期预测指标。此方法低成本、易扩展,有助于引导模型在预训练中强化代理能力,推动大模型在自动化、软件开发、科研等领域的应用落地,解决现有评估指标与实际应用脱节的问题。

技术贡献

创新点在于将真实轨迹转化为多任务评估题,结合负样本生成和人工验证,构建长序列、多轮交互的代理能力评估体系。提出基于轨迹的任务设计框架,兼容多场景扩展,显著提升预训练模型的代理潜能预测能力。该方法还结合模型规模分析,揭示代理能力的“突变”现象,为模型规模与能力关系提供理论基础。

新颖性

首次提出面向预训练阶段的代理潜能评估基准APTBench,突破传统静态技能测试的限制,强调多轮交互和长上下文处理,结合真实任务轨迹,具有较强的前瞻性和实用价值。

局限性

  • 目前主要针对软件工程和深度研究场景,其他领域的适用性尚需验证。
  • 依赖人工验证轨迹成功性,存在一定的主观偏差。
  • 模型规模依赖明显,较小模型表现有限,未来需优化低资源场景下的评估效果。

未来方向

未来将扩展更多场景如自动化客服、智能助理等,丰富轨迹数据,提升多任务、多轮交互的评估能力。同时,结合强化学习等技术,优化模型在预训练中的代理能力培养路径,推动模型自主性与泛化能力的提升。

AI 总览摘要

随着大规模预训练模型(LLMs)在自动化任务中的应用不断深入,如何在预训练阶段评估模型的代理潜能成为关键问题。传统评估指标多关注静态知识或单一技能,难以反映模型在多轮交互、动态决策中的实际表现。本文提出APTBench,一种基于真实任务轨迹的评估框架,旨在量化基础模型的规划、行动和原子能力。

APTBench通过采集软件工程和深度研究两个场景中的成功轨迹,将复杂多轮任务转化为多项选择题和文本补全题,结合负样本生成和人工验证,构建了长序列、多轮交互的能力评估体系。实验结果显示,模型规模达到30B以上时,代理能力出现“突变”,表现出显著提升,验证了模型规模与代理能力的关系。这一发现为模型的规模设计和预训练策略提供了理论依据。

该方法具有低成本、易扩展的优势,可广泛应用于多场景、多任务的能力评估,为未来自主任务执行模型的训练提供早期指标。未来,APTBench将继续扩展应用范围,结合强化学习等技术,推动模型自主性和泛化能力的提升,助力大模型在自动化、科研、软件开发等领域的落地。

深度分析

研究背景

近年来,LLMs在自然语言理解、生成等任务中取得突破,代表性工作如GPT系列、BERT、T5等推动了预训练模型的发展。传统评估指标如GLUE、SuperGLUE、MMLU主要关注静态知识和单一技能,难以反映模型在多轮交互、动态环境中的表现。随着大模型在自动化任务中的应用需求增加,研究者开始关注模型的代理能力,包括规划、决策和执行能力。现有代理评估多依赖后训练微调或专门的任务环境,成本高且难以在预训练阶段进行。如何在模型预训练早期有效预测其未来的代理能力,成为亟待解决的问题。

核心问题

当前的评估体系无法反映模型在实际自主任务中的表现,主要因缺乏面向多轮交互、长上下文的早期指标。静态技能测试不能捕捉模型的规划、行动和反馈能力,导致模型在实际应用中表现差异巨大。此外,现有代理评估多依赖后训练微调,成本高昂且难以在预训练阶段进行指导。缺乏有效的预训练中能力预测工具,限制了模型能力的早期优化和模型设计的科学性。

核心创新

提出APTBench,创新点在于:

  • �� 轨迹驱动的任务转化:采集真实场景中的成功轨迹,将复杂多轮任务转化为多项选择和文本补全题,适配基础模型。
  • �� 长序列、多轮交互设计:利用长上下文,评估模型的规划、行动和原子能力,突破静态单轮测试的限制。
  • �� 负样本生成与人工验证:确保题目难度和答案的合理性,提高评估的准确性。
  • �� 跨场景扩展能力:以软件工程和深度研究为例,未来可扩展至更多应用场景。
  • �� 规模依赖分析:揭示模型规模与代理能力的“突变”现象,为模型设计提供理论支持。

方法详解

  • �� 任务与轨迹采集:选择真实场景(如软件工程、深度研究),收集成功轨迹,确保轨迹的多轮交互和任务完成。
  • �� 任务转化:提取轨迹中的规划、行动、原子能力内容,设计对应的多项选择题和文本补全题。
  • �� 负样本生成:利用模型生成干扰选项,确保题目难度,提升评估的区分度。
  • �� 人工验证:确保题目和答案的正确性,避免偏差。
  • �� 长序列处理:设计支持超过16K tokens的输入,验证模型的长上下文理解能力。
  • �� 规模分析:在不同模型规模上测试,观察代理能力的“突变”现象。

实验设计

在Qwen3系列(1.7B、4B、8B、30B)、Llama、DeepSeek等模型上进行评估,比较其在APTBench中的表现。指标包括规划准确率(ACC)、行动精确匹配(EM)和测试补全(ROUGE、EM)。实验设计涵盖不同模型规模、不同任务场景(软件工程、深度研究),并进行消融分析验证方法的有效性。通过与传统静态指标(如MMLU、GSM8K)对比,验证APTBench对模型代理能力的预测能力。

结果分析

模型规模达到30B后,APTBench得分出现“突变”,平均提升超过15点,验证规模与能力的关系。软件工程任务中,规划准确率从17.84%提升至49.93%,行动EM从25.19%到29.15%。深度研究场景中,模型表现出更强的推理和长序列处理能力,30B以上模型在任务完成度和推理准确性方面显著优于小模型。这些结果表明APTBench能有效捕捉模型的代理潜能,且规模是关键因素。

应用场景

该基准可用于模型预训练阶段的能力筛选与优化,帮助设计更具自主性的模型架构。未来可结合强化学习技术,提升模型在复杂环境中的自主决策能力,广泛应用于自动化软件开发、科研辅助、智能助理等场景。其低成本、易扩展的特性,使得大规模预训练数据的生成与评估成为可能,推动行业自动化水平提升。

局限与展望

目前主要针对软件工程和深度研究场景,其他领域的适用性尚未验证。轨迹采集依赖人工验证,存在偏差。模型规模依赖明显,小模型表现有限,未来需优化低资源场景下的评估效果。

通俗解读 非专业人士也能看懂

想象你在一家大型厨房里做菜。每次做菜都需要按照食谱准备食材、调味、烹饪,厨师(模型)需要记住每一步,合理安排流程,还要根据厨师的经验调整步骤。传统的厨房评估只看厨师是否能记住食谱,但实际上,厨房里最重要的是厨师能根据不同情况灵活应变,合理安排每个步骤,最终做出美味的菜肴。APTBench就像是用真实厨房操作的录像,评估厨师在复杂多轮操作中的表现,帮助厨师变得更聪明、更灵活。

简单解释 像给14岁少年讲一样

想象你在学校参加一个烹饪比赛。平时你只会记住菜谱,但比赛时你需要根据现场情况调整,比如多加点盐或者换个调料。这个比赛考验你的计划和行动能力,而不是只记住菜谱。APTBench就像是用真实的厨房录像,看看你能不能在比赛中灵活应对各种变化。它会把复杂的烹饪过程变成一系列简单的问题,比如下一步该做什么,或者怎么解决厨房里的突发问题。通过这个方法,评委可以知道你是不是一个真正会做菜的高手,不仅仅是记忆力强,更重要的是会应变和操作。

术语表

Agentic Potential (代理潜能)

指模型在多轮交互中表现出的规划、行动和反馈能力,衡量其自主完成复杂任务的潜力。

论文中用以描述模型在真实场景中自主执行任务的能力指标。

Trajectory (轨迹)

在任务执行中,模型或人类的连续操作和反馈过程,用于反映任务的完整执行路径。

用于构建APTBench中的任务题目,采集成功轨迹作为评估基础。

Long Context (长上下文)

模型处理的超长输入序列,超过常规模型的最大长度(如16K tokens),考察模型的长序列理解能力。

APTBench设计支持超过16K tokens的输入,评估模型的长序列处理能力。

Negative Sample (负样本)

通过扰动正确答案生成的干扰项,用于测试模型的辨别能力和鲁棒性。

在题目生成中用以确保题目的难度和区分度。

Scale Emergence (规模突变)

模型规模达到一定阈值后,代理能力出现显著提升的现象。

实验中发现30B模型后,代理能力有突变式增长。

开放问题 这项研究留下的未解疑问

  • 1 如何在预训练中系统性增强模型的多轮交互能力,尤其是在低资源环境下的表现?
  • 2 现有轨迹采集方法是否能全面覆盖不同任务场景的复杂交互?
  • 3 如何进一步降低人工验证成本,提升自动化评估的准确性?

应用场景

近期应用

模型预训练能力筛选

在预训练阶段使用APTBench评估模型的代理潜能,指导模型架构和数据策略优化,提升后续微调效果。

多任务能力调研

通过不同场景的轨迹采集,分析模型在多任务、多轮交互中的表现差异,为模型设计提供数据支持。

远期愿景

自主任务执行系统

结合APTBench的评估结果,开发具有自主规划和执行能力的通用智能系统,应用于自动化科研、软件开发等。

原文摘要

With the rapid development of LLM-based agents, there is a growing trend to incorporate agent-specific data into the pre-training stage of LLMs, aiming to better align LLMs with real-world autonomous task execution. However, current pre-training benchmarks primarily focus on isolated and static skills, e.g., common knowledge or mathematical/code reasoning, and fail to reflect model's agentic capabilities. On the other hand, agent benchmarks are typically designed for post-trained models, requiring multi-turn task execution abilities that base models struggle to support. Thus, there is a compelling need for a benchmark that can evaluate agentic potentials during pre-training and guide the model training more effectively. To address this gap, we propose APTBench, a framework that converts real-world agent tasks and successful trajectories into multiple-choice or text completion questions tailored for base models. It focuses on core agentic abilities, e.g., planning and action, and covers key agent scenarios, software engineering and deep research. Compared to existing general-purpose benchmarks, APTBench offers a more predictive signal of a model's downstream performance as an agent, while remaining significantly more lightweight and cost-effective than full-scale, end-to-end agent evaluations after post-training.

cs.AI