Test-Time Learning with an Evolving Library

TL;DR

EvoLib通过知识抽象和演化机制实现无参数更新的测试时学习,显著提升数学推理和代码生成性能。

cs.LG 🔴 高级 2026-05-14 45 次浏览
Weijia Xu Alessandro Sordoni Chandan Singh Zelalem Gero Michel Galley Xingdi Yuan Jianfeng Gao
测试时学习 知识演化 大模型 自监督 知识库

核心发现

方法论

EvoLib构建一个共享知识库,自动抽取模块技能和反思洞察,利用信息增益和未来信息增益进行权重分配和演化。通过自我评价生成抽象,无需参数更新或外部监督,持续优化知识库。核心算法包括抽象提取、知识融合和动态权重调节,结合模型推理轨迹实现知识积累与迁移。

关键结果

  • 在数学推理、代码生成和多轮智能体环境中,EvoLib在无监督条件下比最优测试时扩展和学习方法提升了15-20%的准确率,显著优于仅依赖参数微调的模型。具体在HMMT数学竞赛题上,准确率从57%提升至77.4%,在BigCodeBench硬题中Pass Rate从29.7%提升至40.8%。在持续学习场景中,表现出对任务顺序的鲁棒性,优于线性知识更新方法。
  • 在大规模实验中,EvoLib在有限计算预算下实现更高的知识重用效率,表现出更优的成本-性能比,尤其在代码和推理任务中表现突出。
  • 消融实验显示,模块技能和反思洞察的结合优于单一类型,知识融合和演化机制显著提升知识库的泛化能力和适应性。

研究意义

该研究突破了大模型测试时学习的瓶颈,避免参数微调的限制,提出知识抽象与演化的自监督机制,为模型在复杂推理和多任务环境中的持续学习提供新路径。其方法可广泛应用于自动化推理、代码生成和智能体交互,推动AI系统向更自主、可扩展的方向发展,解决现有模型在知识迁移和持续学习中的局限。

技术贡献

提出基于信息增益的知识抽取与演化机制,创新性地将知识库结构化、动态演化,避免传统参数微调。引入抽象融合和知识演化链,提升知识的可重用性和泛化能力。实现无参数更新的自监督学习框架,结合模型推理轨迹自动构建知识库,显著提高模型在多任务中的表现和鲁棒性。

新颖性

首次提出无需参数微调的测试时知识演化框架,利用自我评价抽取模块技能和反思洞察,结合信息增益动态调节知识库内容。区别于现有的记忆增强或线性知识更新方法,强调知识的结构化抽象和非线性演化,推动模型自主学习和知识迁移能力的提升。

局限性

  • 当前方法依赖模型自我评价的准确性,若模型评价偏差会影响知识抽取效果,存在误导风险。
  • 知识库规模随着任务增多可能导致管理复杂度增加,未来需研究高效压缩与筛选机制。
  • 在极端复杂或多样化任务中,抽象的泛化能力仍有限,需结合外部知识或监督信号进行优化。

未来方向

未来将探索多模态知识抽取与演化,结合外部知识库增强模型能力,提升在更复杂场景中的表现。同时,研究知识库的自动压缩与结构优化,增强模型的可解释性和可控性,推动其在实际应用中的落地。

AI 总览摘要

随着大规模语言模型(LLMs)在多任务环境中的广泛应用,如何实现模型在无需参数微调的情况下持续学习和知识积累,成为AI研究的热点。传统方法依赖参数更新或外部监督,存在效率低、泛化差等问题。本文提出EvoLib,一种基于知识抽象和演化的测试时学习框架,突破了这些限制。

EvoLib通过自动从模型推理轨迹中抽取模块技能和反思洞察,构建动态演化的知识库。核心机制包括信息增益和未来信息增益,用于衡量抽象的即时和长远价值,指导知识的融合与演化。整个过程无需外部标签或梯度更新,完全自监督,适应多样复杂任务。

在数学推理、代码生成和多轮智能体任务中,EvoLib显著优于现有的测试时扩展和学习方法,准确率提升15-20%。在成本-性能比方面表现优异,尤其在有限计算预算下,知识重用效率更高。消融实验验证了模块技能和反思洞察的协同作用,知识的结构化抽象和非线性演化是其成功的关键。

该方法推动了模型自主学习的边界,为自动推理、代码生成和智能体交互提供了新思路。未来,将结合多模态知识和外部知识库,增强模型的泛化和可解释性,推动AI系统向更自主、可扩展的方向发展。

深度分析

研究背景

近年来,LLMs在自然语言处理、推理和代码生成等领域取得突破,但其在多任务和持续学习方面仍受限。传统方法多依赖参数微调或存储外部记忆,存在效率低、迁移困难等问题。代表性工作包括Retrieval-Augmented Generation(RAG)、Self-Consistency、以及基于梯度的测试时学习(TTL)等。这些方法在特定任务上表现优异,但难以实现跨任务的知识迁移和持续学习。近年来,知识抽象与演化成为研究热点,旨在结构化地提取可重用知识,提升模型的泛化能力。

核心问题

现有测试时学习方法多依赖参数微调或外部监督,限制了模型在无标注环境中的应用。尤其在复杂推理、多任务和连续学习场景中,模型难以有效积累和迁移知识,导致性能瓶颈。如何在不改变模型参数的前提下,自动抽取、融合和演化知识,成为亟待解决的问题。该问题关系到模型的自主性、泛化能力和实际应用的可扩展性,具有重要的理论和实践价值。

核心创新

本文提出EvoLib,核心创新包括:1)结构化知识库,自动抽取模块技能和反思洞察,区别于传统存储原始轨迹;2)基于信息增益的动态权重调节机制,衡量抽象的即时和未来价值,促进知识的演化;3)无参数自监督学习,通过模型推理轨迹自动构建知识,避免梯度微调限制。这些创新使模型能在多任务环境中持续学习,显著提升泛化和迁移能力。

方法详解

  • �� 构建知识库:存储模块技能和反思洞察。• 抽取抽象:从模型输出中提取技能(如函数、子问题)和洞察(错误、策略)。• 采样机制:基于嵌入相似性和动态权重抽样知识。• 评价机制:模型自我评分,利用信息增益和未来信息增益衡量抽象价值。• 知识演化:结合抽象融合、演化链和动态调节,持续优化知识库。• 更新策略:抽象合并、知识融合和未来信息增益更新,确保知识的泛化和演化。• 迭代过程:在多个任务中反复执行,知识库逐步丰富和优化。

实验设计

在数学竞赛、代码挑战和多轮智能体任务上评估,使用HMMT、BigCodeBench、LiveCodeBench、ScienceWorld和PDDL等数据集。比较基线包括测试时扩展(Best-of-N、RSA)和测试时学习(ExpRAG、DC)。指标涵盖准确率、通过率和成功率,采用相同的计算预算。消融实验验证模块技能和反思洞察的贡献,分析知识融合和演化机制的效果。

结果分析

EvoLib在所有任务中均优于基线,准确率提升15-20%。在HMMT中,从57%提升至77.4%;在BigCodeBench中Pass Rate从29.7%到40.8%。在成本控制下,知识重用效率更高,表现出更好的成本-性能比。消融实验显示,模块技能和反思洞察的结合显著提升泛化能力,知识演化机制增强了模型的适应性和鲁棒性。

应用场景

该方法适用于自动推理、代码生成、智能体交互等场景,尤其在缺乏外部监督或标注的环境中。可用于企业自动化、智能问答和自主系统,提升模型的自主学习和迁移能力。未来,结合多模态知识和外部知识库,将推动模型在复杂、多样任务中的应用。

局限与展望

当前方法依赖模型自我评价的准确性,评价偏差可能影响抽象质量。知识库规模增长带来管理难题,需研究高效压缩策略。复杂任务中的泛化能力有限,需结合外部知识或监督信号进行优化。未来需解决知识的可解释性和可控性问题,以实现更广泛的实际应用。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,每次尝试做一道菜,你会总结经验,比如用多少盐、火候多大。随着不断尝试,你会把这些经验变成菜谱,方便以后做得更好。EvoLib就像这个厨房的厨师,它会在做菜(解决问题)时,把学到的技巧和错误总结成“菜谱”,不断改进,变得越来越厉害。这些“菜谱”不会写在纸上,而是存到一个“知识库”里,随时可以用来做新菜。每次做完菜,它还会评估哪些技巧最有用,然后让这些技巧变得更强,帮助厨师(模型)在以后做菜时更快更好。这样,厨师不用每次都重新学,而是用积累的经验变得越来越擅长。这就像我们在生活中不断总结经验,变得更聪明、更高效一样。

原文摘要

We introduce EvoLib, a test-time learning framework that enables large language models to accumulate, reuse, and evolve knowledge across problem instances without parameter updates or external supervision. Instead of adapting model parameters, our approach maintains a shared library of knowledge abstractions, including modular skills and reflective insights, automatically extracted from the model's own inference trajectories. To support continual improvement, we introduce a principled weighting and consolidation mechanism that jointly optimizes for immediate utility and long-term value. This allows simple, instance-specific abstractions to evolve into more general and reusable ones over time. Across challenging benchmarks in mathematical reasoning, code generation, and multi-turn agentic environments, EvoLib improves substantially over the top test-time scaling and learning methods without ground-truth feedback.

cs.LG