AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents
AgentCPM-Explore通过参数融合、奖励信号去噪和上下文优化,在4B模型中实现97.09% GAIA任务准确率。
核心发现
方法论
提出三阶段框架:参数融合结合DELLA算法,奖励信号去噪机制过滤环境噪声和格式错误,优化上下文信息以提升长文本处理能力。
关键结果
- AgentCPM-Explore在GAIA基准测试中实现97.09%准确率,超越Claude-4.5-Sonnet等大模型。
- 在FRAMES基准测试中达到82.7%,比30B模型IterResearch高11.7个百分点。
- 在BrowseComp基准测试中表现优于WebDancer-32B,提升12.4个百分点。
研究意义
研究证明边缘规模模型在适当框架下可突破推理稳定性瓶颈,挑战大规模模型主导的现状,推动低资源设备智能化应用。
技术贡献
首次系统性研究4B规模代理模型,提出奖励去噪和上下文优化新方法,显著提升小模型在复杂任务中的性能。
新颖性
首次在边缘规模模型中实现超越8B及部分30B模型的性能,提出参数融合与奖励去噪的创新方法。
局限性
- 奖励去噪机制依赖于准确的环境噪声检测,可能在复杂环境中失效。
- 上下文优化需要高质量教师模型,限制了低资源场景的应用。
- 模型融合的超参数设置对性能影响较大,需进一步优化。
未来方向
未来可探索更高效的奖励信号过滤算法和自动化上下文优化技术,同时扩展至更多任务领域。
AI 总览摘要
当前大语言模型代理系统主要依赖于大规模模型(如8B及以上),限制了边缘设备的智能化应用。AgentCPM-Explore首次系统性研究4B参数规模的代理模型,提出三阶段训练框架,包括参数融合、奖励信号去噪和上下文优化。实验表明,该模型在多个基准测试中超越8B甚至部分30B模型,尤其在GAIA任务中达到97.09%准确率,展现了边缘规模模型的潜力。
该研究的核心创新在于通过DELLA算法进行参数融合,结合奖励信号过滤机制,解决了小模型在强化学习中的不稳定性问题。此外,通过教师模型蒸馏优化了长文本上下文处理能力,显著提升了模型的推理质量。
尽管如此,AgentCPM-Explore仍面临环境噪声检测和超参数优化的挑战。未来研究可进一步提升奖励信号过滤效率,并扩展至更多应用场景,为边缘设备智能化提供新方向。
深度分析
研究背景
随着智能设备的普及和隐私保护需求的增长,边缘智能成为大语言模型代理系统的重要方向。然而,现有系统主要依赖于大规模模型,边缘设备因计算资源和功耗限制无法支持。研究挑战在于如何在小模型中实现复杂任务的推理能力。
核心问题
边缘规模模型(如4B参数)面临三大瓶颈:监督微调中的灾难性遗忘、强化学习中的奖励信号噪声敏感性、长上下文推理能力退化。这些问题限制了小模型的性能提升。
核心创新
提出三阶段框架:1) 参数融合通过DELLA算法结合基础模型和任务模型能力;2) 奖励信号去噪机制过滤环境噪声和格式错误;3) 上下文优化通过教师模型蒸馏提升长文本信息提取能力。
方法详解
- �� 参数融合:采用DELLA算法融合基础模型与任务模型权重,保留通用能力并注入任务专长。
- �� 奖励去噪:过滤环境噪声、格式错误和极端轨迹,保护模型的梯度稳定性。
- �� 上下文优化:通过RL优化指令生成,结合教师模型蒸馏提升信息提取质量。
实验设计
实验使用GAIA、FRAMES等8个基准测试,比较AgentCPM-Explore与8B及30B模型性能。采用超长上下文支持(128K tokens),并进行奖励去噪和模型融合的消融实验。
结果分析
AgentCPM-Explore在GAIA任务中达到97.09%准确率,超越Claude-4.5-Sonnet;在FRAMES基准测试中表现优于IterResearch-30B;在BrowseComp基准测试中提升12.4个百分点。
应用场景
适用于边缘设备智能化场景,如智能助手、移动生产力工具和隐私保护应用,尤其在低资源环境中具有优势。
局限与展望
奖励去噪机制在复杂环境中可能失效;上下文优化依赖高质量教师模型;模型融合的超参数设置需进一步优化。
通俗解读 非专业人士也能看懂
将AgentCPM-Explore比作一个厨师团队:基础模型是经验丰富的大厨,任务模型是专注于某种菜系的厨师。通过参数融合,大厨和专厨合作,既保留了通用烹饪技巧,又注入了菜系专长。奖励去噪机制就像厨房的质检员,过滤掉不合格的食材和错误的操作。上下文优化则像菜单设计师,确保每道菜都符合顾客的需求。
简单解释 像给14岁少年讲一样
想象你在玩一个策略游戏,角色是一个小机器人助手。这个机器人有点小,但很聪明!它通过学习大机器人和专业机器人技能的组合,变得既通用又专业。它还会过滤掉错误的指令,就像游戏中避免陷阱一样。最后,它能从复杂的任务中提取关键信息,就像你在游戏中找到隐藏的宝藏!
术语表
参数融合 (Parameter Merging)
通过结合两个模型的权重实现能力互补,保留通用性并注入专长。
用于解决灾难性遗忘问题。
奖励信号去噪 (Reward Signal Denoising)
过滤环境噪声和格式错误,保护模型训练稳定性。
强化学习阶段的关键机制。
上下文优化 (Context Refinement)
通过教师模型蒸馏提升长文本信息提取能力。
用于改善长上下文推理质量。
灾难性遗忘 (Catastrophic Forgetting)
模型在微调过程中丢失原有通用能力。
监督微调阶段的主要问题。
DELLA算法 (DELLA Algorithm)
一种参数融合算法,用于实现模型能力互补。
用于模型融合阶段。
开放问题 这项研究留下的未解疑问
- 1 如何在复杂环境中进一步提升奖励去噪机制的鲁棒性。
- 2 如何降低上下文优化对高质量教师模型的依赖。
- 3 探索更高效的模型融合算法以减少超参数敏感性。
应用场景
近期应用
智能助手
在边缘设备上实现高效任务处理,如语音助手和家庭自动化。
隐私保护工具
支持本地化智能应用,减少数据上传需求。
远期愿景
边缘智能生态系统
推动边缘设备智能化,支持低资源环境中的复杂任务。
原文摘要
While Large Language Model (LLM)-based agents have shown remarkable potential for solving complex tasks, existing systems remain heavily reliant on large-scale models, leaving the capabilities of edge-scale models largely underexplored. In this paper, we present the first systematic study on training agentic models at the 4B-parameter scale. We identify three primary bottlenecks hindering the performance of edge-scale models: catastrophic forgetting during Supervised Fine-Tuning (SFT), sensitivity to reward signal noise during Reinforcement Learning (RL), and reasoning degradation caused by redundant information in long-context scenarios. To address the issues, we propose AgentCPM-Explore, a compact 4B agent model with high knowledge density and strong exploration capability. We introduce a holistic training framework featuring parameter-space model fusion, reward signal denoising, and contextual information refinement. Through deep exploration, AgentCPM-Explore achieves state-of-the-art (SOTA) performance among 4B-class models, matches or surpasses 8B-class SOTA models on four benchmarks, and even outperforms larger-scale models such as Claude-4.5-Sonnet or DeepSeek-v3.2 in five benchmarks. Notably, AgentCPM-Explore achieves 97.09% accuracy on GAIA text-based tasks under pass@64. These results provide compelling evidence that the bottleneck for edge-scale models is not their inherent capability ceiling, but rather their inference stability. Based on our well-established training framework, AgentCPM-Explore effectively unlocks the significant, yet previously underestimated, potential of edge-scale models.