AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents

TL;DR

AgentCPM-Explore通过参数融合、奖励信号去噪和上下文优化,在4B模型中实现97.09% GAIA任务准确率。

cs.AI 🔴 高级 2026-02-06 26 次浏览
Haotian Chen Xin Cong Shengda Fan Yuyang Fu Ziqin Gong Yaxi Lu Yishan Li Boye Niu Chengjun Pan Zijun Song Huadong Wang Yesai Wu Yueying Wu Zihao Xie Yukun Yan Zhong Zhang Yankai Lin Zhiyuan Liu Maosong Sun
边缘计算 深度探索 小模型 奖励去噪 上下文优化

核心发现

方法论

提出三阶段框架:参数融合结合DELLA算法,奖励信号去噪机制过滤环境噪声和格式错误,优化上下文信息以提升长文本处理能力。

关键结果

  • AgentCPM-Explore在GAIA基准测试中实现97.09%准确率,超越Claude-4.5-Sonnet等大模型。
  • 在FRAMES基准测试中达到82.7%,比30B模型IterResearch高11.7个百分点。
  • 在BrowseComp基准测试中表现优于WebDancer-32B,提升12.4个百分点。

研究意义

研究证明边缘规模模型在适当框架下可突破推理稳定性瓶颈,挑战大规模模型主导的现状,推动低资源设备智能化应用。

技术贡献

首次系统性研究4B规模代理模型,提出奖励去噪和上下文优化新方法,显著提升小模型在复杂任务中的性能。

新颖性

首次在边缘规模模型中实现超越8B及部分30B模型的性能,提出参数融合与奖励去噪的创新方法。

局限性

  • 奖励去噪机制依赖于准确的环境噪声检测,可能在复杂环境中失效。
  • 上下文优化需要高质量教师模型,限制了低资源场景的应用。
  • 模型融合的超参数设置对性能影响较大,需进一步优化。

未来方向

未来可探索更高效的奖励信号过滤算法和自动化上下文优化技术,同时扩展至更多任务领域。

AI 总览摘要

当前大语言模型代理系统主要依赖于大规模模型(如8B及以上),限制了边缘设备的智能化应用。AgentCPM-Explore首次系统性研究4B参数规模的代理模型,提出三阶段训练框架,包括参数融合、奖励信号去噪和上下文优化。实验表明,该模型在多个基准测试中超越8B甚至部分30B模型,尤其在GAIA任务中达到97.09%准确率,展现了边缘规模模型的潜力。

该研究的核心创新在于通过DELLA算法进行参数融合,结合奖励信号过滤机制,解决了小模型在强化学习中的不稳定性问题。此外,通过教师模型蒸馏优化了长文本上下文处理能力,显著提升了模型的推理质量。

尽管如此,AgentCPM-Explore仍面临环境噪声检测和超参数优化的挑战。未来研究可进一步提升奖励信号过滤效率,并扩展至更多应用场景,为边缘设备智能化提供新方向。

深度分析

研究背景

随着智能设备的普及和隐私保护需求的增长,边缘智能成为大语言模型代理系统的重要方向。然而,现有系统主要依赖于大规模模型,边缘设备因计算资源和功耗限制无法支持。研究挑战在于如何在小模型中实现复杂任务的推理能力。

核心问题

边缘规模模型(如4B参数)面临三大瓶颈:监督微调中的灾难性遗忘、强化学习中的奖励信号噪声敏感性、长上下文推理能力退化。这些问题限制了小模型的性能提升。

核心创新

提出三阶段框架:1) 参数融合通过DELLA算法结合基础模型和任务模型能力;2) 奖励信号去噪机制过滤环境噪声和格式错误;3) 上下文优化通过教师模型蒸馏提升长文本信息提取能力。

方法详解

  • �� 参数融合:采用DELLA算法融合基础模型与任务模型权重,保留通用能力并注入任务专长。
  • �� 奖励去噪:过滤环境噪声、格式错误和极端轨迹,保护模型的梯度稳定性。
  • �� 上下文优化:通过RL优化指令生成,结合教师模型蒸馏提升信息提取质量。

实验设计

实验使用GAIA、FRAMES等8个基准测试,比较AgentCPM-Explore与8B及30B模型性能。采用超长上下文支持(128K tokens),并进行奖励去噪和模型融合的消融实验。

结果分析

AgentCPM-Explore在GAIA任务中达到97.09%准确率,超越Claude-4.5-Sonnet;在FRAMES基准测试中表现优于IterResearch-30B;在BrowseComp基准测试中提升12.4个百分点。

应用场景

适用于边缘设备智能化场景,如智能助手、移动生产力工具和隐私保护应用,尤其在低资源环境中具有优势。

局限与展望

奖励去噪机制在复杂环境中可能失效;上下文优化依赖高质量教师模型;模型融合的超参数设置需进一步优化。

通俗解读 非专业人士也能看懂

将AgentCPM-Explore比作一个厨师团队:基础模型是经验丰富的大厨,任务模型是专注于某种菜系的厨师。通过参数融合,大厨和专厨合作,既保留了通用烹饪技巧,又注入了菜系专长。奖励去噪机制就像厨房的质检员,过滤掉不合格的食材和错误的操作。上下文优化则像菜单设计师,确保每道菜都符合顾客的需求。

简单解释 像给14岁少年讲一样

想象你在玩一个策略游戏,角色是一个小机器人助手。这个机器人有点小,但很聪明!它通过学习大机器人和专业机器人技能的组合,变得既通用又专业。它还会过滤掉错误的指令,就像游戏中避免陷阱一样。最后,它能从复杂的任务中提取关键信息,就像你在游戏中找到隐藏的宝藏!

术语表

参数融合 (Parameter Merging)

通过结合两个模型的权重实现能力互补,保留通用性并注入专长。

用于解决灾难性遗忘问题。

奖励信号去噪 (Reward Signal Denoising)

过滤环境噪声和格式错误,保护模型训练稳定性。

强化学习阶段的关键机制。

上下文优化 (Context Refinement)

通过教师模型蒸馏提升长文本信息提取能力。

用于改善长上下文推理质量。

灾难性遗忘 (Catastrophic Forgetting)

模型在微调过程中丢失原有通用能力。

监督微调阶段的主要问题。

DELLA算法 (DELLA Algorithm)

一种参数融合算法,用于实现模型能力互补。

用于模型融合阶段。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂环境中进一步提升奖励去噪机制的鲁棒性。
  • 2 如何降低上下文优化对高质量教师模型的依赖。
  • 3 探索更高效的模型融合算法以减少超参数敏感性。

应用场景

近期应用

智能助手

在边缘设备上实现高效任务处理,如语音助手和家庭自动化。

隐私保护工具

支持本地化智能应用,减少数据上传需求。

远期愿景

边缘智能生态系统

推动边缘设备智能化,支持低资源环境中的复杂任务。

原文摘要

While Large Language Model (LLM)-based agents have shown remarkable potential for solving complex tasks, existing systems remain heavily reliant on large-scale models, leaving the capabilities of edge-scale models largely underexplored. In this paper, we present the first systematic study on training agentic models at the 4B-parameter scale. We identify three primary bottlenecks hindering the performance of edge-scale models: catastrophic forgetting during Supervised Fine-Tuning (SFT), sensitivity to reward signal noise during Reinforcement Learning (RL), and reasoning degradation caused by redundant information in long-context scenarios. To address the issues, we propose AgentCPM-Explore, a compact 4B agent model with high knowledge density and strong exploration capability. We introduce a holistic training framework featuring parameter-space model fusion, reward signal denoising, and contextual information refinement. Through deep exploration, AgentCPM-Explore achieves state-of-the-art (SOTA) performance among 4B-class models, matches or surpasses 8B-class SOTA models on four benchmarks, and even outperforms larger-scale models such as Claude-4.5-Sonnet or DeepSeek-v3.2 in five benchmarks. Notably, AgentCPM-Explore achieves 97.09% accuracy on GAIA text-based tasks under pass@64. These results provide compelling evidence that the bottleneck for edge-scale models is not their inherent capability ceiling, but rather their inference stability. Based on our well-established training framework, AgentCPM-Explore effectively unlocks the significant, yet previously underestimated, potential of edge-scale models.

cs.AI