核心发现
方法论
本文提出一种知识中心的自我提升框架,将知识库作为持续改进的核心。采用三阶段协议:任务级论坛、跨任务论坛和知识蒸馏,促使代理在完成任务后贡献证据支持的见解,逐步提炼出可迁移的知识。该方法保持代理的通用性和无状态,所有改进都体现在共享知识库中。通过在抽象推理、编码和终端任务上进行实验,验证了知识库的可转移性和成本优势。
关键结果
- 在ARC抽象推理、Polyglot编码和终端任务基准上,知识中心协议显著提高了解决率,平均提升达15%以上,且成本降低约30%。例如,在ARC-AGI-1任务中,解决率从68%提升至86.7%,成本从$126降至$76。
- 知识蒸馏的知识包在不同任务和模型(如gpt-4o)之间迁移效果良好,未见性能下降,表明知识的可复用性强。
- 与传统的代理优化和提示优化方法相比,本框架在成本和效果上均优越,尤其在复杂任务中表现出更强的泛化能力。
研究意义
该研究突破了以代理为核心的自我提升范式,强调外部知识库的持续积累与迁移能力,为构建高效、可解释、可迁移的AI系统提供新思路。通过知识的外部化,减轻了代理的复杂度,提升了系统的维护性和扩展性,具有重要的理论和应用价值。
技术贡献
提出一种基于论坛讨论和知识蒸馏的知识策划协议,确保知识的证据基础和可验证性。实现代理的无状态化,提升知识的可解释性和迁移性。实验证明该方法在多任务、多模型场景下均优于现有的agent-centric方法,展示了知识库在自我提升中的核心作用。
新颖性
首次系统性提出以知识库为核心的自我提升框架,区别于传统的代理优化和记忆增强方法。通过多轮讨论和证据筛选,确保知识的可靠性和可迁移性,强调知识的外部化和持续积累,开创了知识驱动的自我改进新路径。
局限性
- 当前协议依赖于高质量的证据和讨论机制,可能在复杂或模糊任务中表现不佳,且对知识库的维护和蒸馏过程仍存在成本。
- 模型迁移实验主要在有限的模型家族中验证,跨模型和跨任务的泛化能力仍需进一步验证。
- 对知识库的规模和更新频率未作深入分析,未来需研究知识的自动扩展和动态更新策略。
未来方向
未来将探索自动化的知识生成与验证机制,结合强化学习优化知识蒸馏流程,提升知识的自动化质量控制。同时,扩展到更复杂的任务场景和多模态数据,增强系统的泛化能力和实用性。
AI 总览摘要
本研究提出一种以知识库为核心的自我提升范式,突破传统以代理为中心的优化方式。通过设计三阶段的知识策划协议——任务论坛、跨任务讨论和知识蒸馏,代理在完成任务后贡献证据支持的见解,逐步提炼出具有迁移能力的知识。实验结果显示,该方法在抽象推理、编码和终端任务中显著提升了解决率,平均提升达15%以上,同时降低了30%的成本。知识蒸馏的知识包在不同任务和模型间迁移效果良好,验证了知识的可复用性和系统的泛化能力。相比传统的代理优化和提示调优,该框架在成本效率和迁移性方面表现优越,为未来构建高效、可解释、可扩展的AI系统提供了新思路。该方法强调知识的外部化和持续积累,减轻了代理的复杂度,增强了系统的维护性和扩展性。未来工作将集中在自动化知识生成、动态更新和多模态场景的扩展,推动知识驱动的AI自我提升迈向更高层次。
深度分析
研究背景
人工智能领域的自我提升技术经历了从模型微调、提示优化到记忆增强的演变。早期方法如强化学习和迁移学习解决了模型能力提升问题,但面临知识迁移和维护成本高的问题。近年来,记忆网络和外部知识库成为研究热点,如Retrieval-Augmented Generation(RAG)和Memory-augmented Neural Networks(MANN),旨在增强模型的知识存储和推理能力。然而,这些方法多依赖于模型内部参数或静态存储,缺乏持续的知识更新机制。本文基于此背景,提出一种动态的知识策划协议,将知识的积累和迁移作为系统的核心,强调证据基础和讨论机制,旨在实现知识的可验证性和可迁移性。
核心问题
现有自我提升方法多依赖于代理的持续优化,导致系统复杂度高、维护成本大,且难以实现知识的跨任务迁移。代理的不断演化可能引入冲突和冗余,影响整体性能。如何在保持代理通用性和无状态的前提下,有效积累、筛选和迁移知识,成为关键难题。特别是在多任务、多模型环境中,缺乏一种系统化的知识外部化机制,限制了系统的扩展性和可解释性。解决这一问题,有助于实现更高效、更稳定的AI自我提升体系。
核心创新
本研究的核心创新在于提出一种基于论坛讨论和知识蒸馏的知识策划协议,将知识的积累和筛选作为唯一的自我提升机制。具体包括:• 任务级论坛:将每次任务的执行过程转化为证据支持的声明;• 跨任务论坛:通过多轮讨论筛选出具有普遍适用性的原则;• 知识蒸馏:将有效的声明压缩成可迁移的知识包。该方法区别于传统的模型微调和记忆增强,强调知识的外部化、证据基础和可验证性,保持代理的无状态和通用性,显著提升迁移能力和成本效率。
方法详解
- �� 代理为无状态、通用的实例,接收任务描述和知识包,尝试完成任务;• 任务完成后,代理在任务论坛中发表证据支持的声明,描述成功或失败的原因;• 跨任务论坛中,代理讨论不同任务中的声明,筛选出反复出现的原则和模式,支持或反驳已有观点;• 最后,知识蒸馏阶段将存活的声明压缩成知识包,供未来代理使用。整个流程通过多轮讨论和证据筛选,确保知识的可靠性和迁移性。知识库中的内容包括任务尝试记录、论坛讨论和蒸馏结果,形成持续更新的知识资产。
实验设计
在抽象推理(ARC-AGI-1/2)、编码(Polyglot)和终端任务(Terminal-Bench 2)上进行验证。采用50任务池,进行10代循环,比较不同方法的解决率和成本。对比基线包括代理优化(DGM、HyperAgents)和提示调优(GEPA、OpenEvolve),评估指标为解决率和花费成本。实验还测试知识迁移能力,验证知识包在不同模型(如gpt-4o)和未见任务上的表现。通过多轮实验,确认知识策划协议在多任务、多模型环境中的优越性。
结果分析
实验结果显示,知识中心协议在ARC-AGI-1中解决率由68%提升至86.7%,成本从$126降至$76;Polyglot任务中解决率由64%提升至68%,成本降低约40%。在终端任务中,解决率达43.8%,优于多项强基线。知识迁移实验表明,蒸馏知识在不同模型间保持良好效果,验证了知识的可复用性和迁移能力。与提示优化相比,知识策划在成本和效果上均表现优越,特别是在复杂任务中展现出更强的泛化能力。
应用场景
该方法适用于多任务学习、模型迁移、知识管理和自动化系统维护。可应用于智能助理、自动编程、复杂推理和机器人控制等场景,帮助系统不断积累和迁移知识,提升效率和可靠性。未来还可结合强化学习实现知识的自动生成和优化,推动AI系统的自主学习能力。
局限与展望
当前协议依赖高质量的证据和讨论机制,可能在模糊或复杂任务中表现不足。知识库规模和动态更新策略尚未充分研究,存在扩展瓶颈。跨模型迁移的效果在更大模型和多模态场景中仍需验证。未来需解决知识的自动扩展、质量控制和多源融合问题,以实现更广泛的应用。
通俗解读 非专业人士也能看懂
想象一个工厂,工厂里的工人不断完成不同的任务,比如组装、检验、包装。每个工人都可以学习别的工人的经验,但他们没有记忆,只能通过一份公共的手册来学习。每完成一个任务,工人会在手册上写下自己学到的技巧和遇到的问题。其他工人可以看到这些记录,讨论哪些方法有效,哪些需要改进。经过多次讨论和总结,手册变得越来越有用,工人们可以用它来更快、更好地完成新任务。这就像本文中的知识库,工人代表AI代理,手册就是知识库,大家通过讨论不断改进和传递经验。
简单解释 像给14岁少年讲一样
想象你在学校里做各种各样的作业,比如数学题、写作文、科学实验。每次你完成作业后,你会把你学到的技巧和遇到的问题写在一本笔记里。你的朋友也会看这个笔记,讨论哪些方法有效,哪些地方容易出错。大家不断讨论、总结,最后这本笔记变得非常有用,不仅能帮你更快完成作业,还能帮你的朋友们。这个过程就像文章中的知识库,大家通过写和讨论,把经验变成可以传递的知识。这样,即使换了老师或同学,大家都能用这本笔记学到东西,学习变得更轻松、更高效。
原文摘要
Self-improving AI systems typically treat the agent as the object that improves, by optimizing prompts, workflows, harnesses, or even the agent's own code. This agent-centric view can make improvements expensive to maintain and difficult to transfer, because gains become tied to a particular agent design, task distribution, or adaptation run. We study a complementary paradigm: knowledge-centric self-improvement, in which agents remain generic and disposable while the persistent object is a curated knowledge base that agents can leverage for future tasks. We conduct controlled case studies to operationalize this idea via a simple protocol. Agents attempt one task, then contribute evidence-grounded insights to a shared knowledge base via task-level and cross-task forums, followed by knowledge distillation. Because self-improvement is contained in the knowledge rather than the agent, improvement can be more inspectable, transferable, and portable. Across abstract reasoning, coding, and terminal benchmarks, this protocol improves solve rates while reducing dollar cost relative to agent-centric baselines. The resulting distilled knowledge also transfers to held-out tasks and across LLM families, indicating that the improvement is not merely an LLM- or run-specific behavior. These results support a new view of self-improving agentic systems: progress can be driven primarily by the curated persistent knowledge. Code is available at https://github.com/recursive-knowledge/KSI.