核心发现
方法论
该方法通过引入First-Thought Prefix增强教师模型轨迹质量,并采用自我一致性行动生成提升测试时鲁棒性。利用多轮轨迹采样与过滤,结合检索与代码工具,训练参数范围为0.5B至7B的小模型,模仿大模型的代理行为。核心算法包括基于ReAct和CodeAct的轨迹生成机制,结合LoRA微调实现高效训练,验证在八个推理任务中表现优越。
关键结果
- 在八个推理任务中,最小0.5B模型通过Agent Distillation达到了与1.5B、3B、7B大模型微调CoT的性能持平甚至超越,平均提升达10%以上。特别是在外域任务中,性能提升尤为明显,表现出良好的泛化能力。实验数据显示,结合检索和代码工具的小模型在HotpotQA、MuSiQue等数据集上均优于传统CoT蒸馏方法,验证了代理行为迁移的有效性。
- 引入First-Thought Prefix和自我一致性行动生成后,小模型在数学和事实推理任务中的准确率分别提升了8-12个百分点,显著优于基线方法。
- 实验还表明,模型规模越小,Agent Distillation的优势越明显,尤其在处理新颖或复杂任务时表现出更强的适应性和鲁棒性。
研究意义
该研究突破了模型压缩与推理能力迁移的瓶颈,提出的Agent Distillation实现了在极小模型中复制大模型的代理行为,为实际应用中低成本高效智能系统提供了新途径。其结合工具的策略极大增强了模型的知识利用和推理能力,推动了自主智能体的研究发展,具有广泛的理论和工业价值。
技术贡献
创新点在于引入First-Thought Prefix提升教师轨迹质量,结合自我一致性行动生成增强测试鲁棒性,突破了静态推理轨迹的局限。提出基于轨迹的代理行为迁移框架,结合检索与代码工具,显著提升小模型的推理和操作能力。采用LoRA微调实现高效训练,验证在多个推理任务中的优越表现,推动了模型行为迁移和工具融合的研究前沿。
新颖性
首次系统性将大规模LLM代理行为迁移到参数极小的小模型中,结合检索和代码工具,突破了传统静态推理蒸馏的限制。提出First-Thought Prefix和自我一致性行动生成机制,增强模型的行为一致性和鲁棒性,显著优于现有的CoT蒸馏方法,展现出极强的创新性。
局限性
- 当前方法依赖于高质量的轨迹采样,可能在极端复杂任务中表现不足。模型在生成代码时仍存在格式错误和执行失败的问题,限制了工具的有效性。训练过程中对大模型的依赖较重,未来需探索更高效的知识迁移和鲁棒性增强策略。
未来方向
未来将探索多模态工具融合、强化学习优化行为策略,以及在更大规模和多样化任务中的迁移能力。同时,提升模型的自主学习和环境适应能力,推动自主智能体的实际应用落地。
AI 总览摘要
随着大规模语言模型(LLMs)在复杂推理任务中的卓越表现,模型的计算成本成为限制其广泛应用的瓶颈。传统的知识蒸馏方法通过模仿大模型的链式推理(CoT)轨迹,提升小模型性能,但在涉及稀有知识或精确计算时仍存在“幻觉”问题。本文提出的Agent Distillation框架,突破静态推理的局限,将大模型的代理行为——包括推理、检索和代码操作——迁移到参数更小的模型中。核心创新在于引入First-Thought Prefix,确保教师模型轨迹质量;以及自我一致性行动生成机制,增强测试时鲁棒性。实验在八个推理任务中验证了该方法的有效性,小模型(0.5B至3B参数)在性能上与更大模型(1.5B至7B)微调CoT后不相上下,甚至超越。结果显示,结合检索与代码工具的小模型在事实和数学推理中表现出更强的泛化能力,显著优于传统静态蒸馏方法。这一突破为低成本高效的智能系统提供了新路径,推动自主智能体的研究与应用。未来,研究将关注多模态工具融合、强化学习优化,以及在更复杂环境中的自主适应能力,期待实现更智能、更自主的AI系统。
深度分析
研究背景
近年来,随着Transformer架构的普及,LLMs在自然语言理解和推理方面取得突破。链式推理(CoT)技术通过引导模型逐步推导,显著提升数学与事实推理能力。代表性模型如GPT-3、PaLM等在大规模预训练后表现优异,但推理成本高昂,难以部署。知识蒸馏技术通过模仿大模型的推理轨迹,试图在保持性能的同时降低模型规模。近年来,结合外部工具(如检索、代码执行)的方法逐渐兴起,增强模型的知识利用和操作能力。然而,静态轨迹蒸馏在泛化和鲁棒性方面仍有限,特别是在面对新颖任务或复杂环境时。
核心问题
核心问题在于如何将大模型的代理行为——包括推理、检索和代码操作——迁移到参数极小的小模型中。传统蒸馏方法多依赖静态推理轨迹,难以应对任务中的知识更新和操作复杂性。此外,小模型在生成代码和执行任务时易出错,影响整体性能。如何设计一种高效、鲁棒的迁移框架,既能保持大模型的行为特征,又能适应多样化任务,成为亟待解决的难题。
核心创新
本研究提出Agent Distillation,结合两个创新机制:一是First-Thought Prefix,确保教师模型轨迹的高质量和合理性,避免偏离正确推理路径;二是自我一致性行动生成,通过多轨迹采样与过滤,提升模型在推理和操作中的鲁棒性。这些创新突破了静态轨迹的局限,使小模型能主动采取行动,利用检索和代码工具,增强推理和操作能力。采用LoRA微调策略,提升训练效率,验证在多个推理任务中的优越表现,推动了代理行为迁移的理论与实践发展。
方法详解
- �� 轨迹生成:教师模型在输入基础上,结合First-Thought Prefix,生成高质量推理轨迹。• 行动采样:采用多轮采样(N次)策略,结合高温采样,生成多种候选行动。• 过滤与选择:利用轻量级代码解释器筛除格式错误或执行失败的行动,采用多数投票机制选出最优行动。• 微调训练:基于LoRA技术,将轨迹中的推理与行动行为迁移到小模型,强化其操作能力。• 工具融合:结合检索(RAG)和代码执行,提升模型的知识利用和任务完成效率。• 训练流程:采集大模型轨迹,筛选优质样本,微调小模型,反复验证性能。
实验设计
在八个推理任务(HotpotQA、MuSiQue、GSM-Hard、AIME等)中,采用不同模型规模(0.5B、1.5B、3B、7B)进行训练。对比静态CoT蒸馏和Agent Distillation,评估在内外域任务中的表现。指标包括准确率、泛化能力和鲁棒性。采用LoRA微调,训练时间为2轮,使用GPU集群。引入First-Thought Prefix和自我一致性行动生成两项技术,进行消融验证。实验还结合检索增强,验证知识利用效果。
结果分析
实验显示,最小0.5B模型经过Agent Distillation后,在八个任务中的平均性能提升超过10%,在外域任务中表现尤为突出。结合检索和代码工具的模型在HotpotQA、MuSiQue上超越传统CoT蒸馏模型,尤其在复杂推理和新知识场景中表现优异。引入First-Thought Prefix和自我一致性行动生成后,模型在数学推理中的准确率提升8-12个百分点,验证了方法的有效性。整体而言,小模型通过代理行为迁移实现了与大模型相媲美甚至超越的性能。
应用场景
该方法适用于构建低成本、高效率的智能问答、自动推理和操作系统,特别适合资源有限的设备和场景。结合检索与代码工具,能在金融、医疗、教育等行业实现自主知识获取与决策。未来可扩展到多模态环境,推动自主智能体在实际场景中的应用落地。
局限与展望
当前方法依赖大量高质量轨迹样本,采样成本较高。模型在生成代码时仍存在格式和执行错误,影响工具的有效性。对大模型的依赖较重,未来需优化轨迹采样效率和鲁棒性,探索更自主的学习机制。
通俗解读 非专业人士也能看懂
想象你在厨房做菜,传统方法就像是只记住菜谱,按照步骤一一操作,容易出错或不灵活。而这项研究就像是教厨师不仅记住菜谱,还能根据情况自主选择用什么工具(比如用刀、锅、调料),并能自己试错、调整。大厨(大模型)教小厨(小模型)如何灵活操作,不仅会做菜,还会用工具、检索信息,甚至写代码帮忙。这样,小厨就能在不同菜谱和厨房环境中表现得更好,做出更复杂的菜肴。研究中用的方法就像是给小厨配备了“思考+行动+观察”的能力,让它能自主应对各种厨房挑战,变得更聪明、更灵活。
简单解释 像给14岁少年讲一样
想象你在学校里学做手工艺品,老师(大模型)教你怎么一步步做,但有时候你会忘记步骤或做错。这项研究就像是让你不仅记住老师教的方法,还能自己动手试一试,用工具、查资料、改正错误。老师会教你怎么用不同的工具,还会告诉你怎么自己试错,找到最好的办法。这样,你就能做出漂亮的作品,不管遇到什么新材料或新挑战,都能自己解决。这就像让小朋友变成了聪明的小工匠,既会学,还会用工具自己动手,变得更厉害。
原文摘要
Large language models (LLMs) excel at complex reasoning tasks but remain computationally expensive, limiting their practical deployment. To address this, recent works have focused on distilling reasoning capabilities into smaller language models (sLMs) using chain-of-thought (CoT) traces from teacher LLMs. However, this approach struggles in scenarios requiring rare factual knowledge or precise computation, where sLMs often hallucinate due to limited capability. In this work, we propose Agent Distillation, a framework for transferring not only reasoning capability but full task-solving behavior from LLM-based agents into sLMs with retrieval and code tools. We improve agent distillation along two complementary axes: (1) we introduce a prompting method called first-thought prefix to enhance the quality of teacher-generated trajectories; and (2) we propose a self-consistent action generation for improving test-time robustness of small agents. We evaluate our method on eight reasoning tasks across factual and mathematical domains, covering both in-domain and out-of-domain generalization. Our results show that sLMs as small as 0.5B, 1.5B, 3B parameters can achieve performance competitive with next-tier larger 1.5B, 3B, 7B models fine-tuned using CoT distillation, demonstrating the potential of agent distillation for building practical, tool-using small agents. Our code is available at https://github.com/Nardien/agent-distillation.