核心发现
方法论
CORE是一种非参数学习算法,通过对比成功和失败的推理轨迹生成自然语言洞见。这些洞见帮助模型在未来问题中更有效地应用策略和约束。
关键结果
- CORE在四个推理任务中表现优于GRPO、GEPA等基线方法,使用更少的模型运行,平均准确率提升超过50%。
- 在固定模型运行预算下,CORE在大多数任务数据条件下表现最优。
- CORE所生成的洞见是可解释的自然语言学习工件,减少了不透明参数更新带来的风险。
研究意义
CORE通过提取成功和失败推理轨迹之间的对比,提供了一种比权重更新、提示优化或直接重用存储推理轨迹更高效和可解释的模型自我改进途径。
技术贡献
CORE与现有方法的根本区别在于它存储透明的自然语言洞见,而不是权重更新或单个模型运行。它提供了一种新的工程可能性,允许模型在冻结状态下进行自我改进。
新颖性
CORE首次将对比反思用于语言模型的自我改进,区别于现有的基于奖励的学习方法,通过自然语言洞见实现更高效的学习。
局限性
- CORE在某些任务上仍然需要大量的初始样本来估计基线准确率。
- 在没有相似成功案例的情况下,CORE可能无法生成有用的洞见。
未来方向
未来工作可以探索CORE在更多任务上的应用,以及如何进一步提高其洞见生成的质量和效率。
AI 总览摘要
CORE算法通过对比反思实现语言模型的快速推理改进。现有的参数和非参数方法通常需要大量样本和模型运行,而CORE通过生成自然语言洞见减少了这些需求。
CORE在四个推理任务中表现优于基线方法,使用更少的模型运行实现了更高的准确率。它通过对比成功和失败的推理轨迹生成洞见,并在未来问题中有效应用。
CORE的洞见是可解释的自然语言学习工件,减少了不透明参数更新带来的风险。这表明CORE提供了一种比现有方法更高效和可解释的模型自我改进途径。
深度分析
研究背景
语言模型通常需要大量数据和计算资源来从可验证的奖励中学习。现有方法如GRPO和GEPA在效率上存在不足,而CORE通过对比反思提供了一种更高效的学习途径。
核心问题
现有的推理任务学习方法需要大量样本和模型运行,成本高昂且难以实现。CORE旨在通过对比反思减少这些需求。
核心创新
CORE通过对比成功和失败的推理轨迹生成自然语言洞见。这些洞见帮助模型在未来问题中更有效地应用策略和约束,区别于现有方法。
方法详解
- �� CORE构建两个外部记忆库:洞见记忆和模型运行记忆。
- �� 每次训练失败后,CORE通过对比成功和失败的模型运行生成洞见。
- �� 洞见根据语义相似性和效用估计进行检索。
实验设计
在四个推理任务中评估CORE,包括Tower of Hanoi、MathGAP等。使用不同数量的训练样本和固定模型运行预算进行比较。
结果分析
CORE在所有任务中表现优于基线方法,使用更少的模型运行实现了更高的准确率。平均准确率提升超过50%。
应用场景
CORE可用于需要快速推理改进的任务,如逻辑、规划和问题解决。它减少了模型运行需求,适用于资源有限的场景。
局限与展望
CORE在某些任务上仍然需要大量的初始样本来估计基线准确率。在没有相似成功案例的情况下,可能无法生成有用的洞见。
通俗解读 非专业人士也能看懂
想象一个学校老师在教学生解决问题。老师会让学生回顾他们之前的成功和失败案例,找出哪些策略有效,哪些不行。CORE就像这个老师,通过对比成功和失败的推理轨迹,帮助模型更好地学习和改进。
简单解释 像给14岁少年讲一样
CORE就像一个游戏攻略,帮助你在游戏中快速找到通关方法。它通过对比你之前的成功和失败,生成一些有用的提示,让你在下次遇到类似问题时更快解决。是不是很酷?
术语表
对比反思 (Contrastive Reflection)
一种通过对比成功和失败案例生成洞见的学习方法。
CORE使用对比反思生成自然语言洞见。
洞见记忆 (Insight Memory)
存储模型生成的自然语言洞见的外部记忆库。
CORE使用洞见记忆来检索和应用洞见。
模型运行记忆 (Rollout Memory)
存储模型过去运行的外部记忆库。
CORE使用模型运行记忆来对比成功和失败案例。
效用估计 (Utility Estimates)
用于评估洞见在解决问题中的有效性的指标。
CORE根据效用估计检索洞见。
非参数学习 (Non-parametric Learning)
一种不更新模型权重而通过其他方式改进模型的方法。
CORE是一种非参数学习算法。
开放问题 这项研究留下的未解疑问
- 1 如何在没有相似成功案例的情况下生成有效洞见?
- 2 CORE在大规模任务上的表现如何?
应用场景
近期应用
教育领域
CORE可用于教育领域,帮助学生快速提高解决问题的能力。
远期愿景
智能助手
CORE可以用于开发更智能的助手,帮助用户在复杂任务中快速找到解决方案。
原文摘要
Language models can use verifiable rewards to improve at a wide variety of reasoning tasks. However, both parametric (e.g. RLVR) and non-parametric (e.g. prompt optimization) approaches to doing so typically require hundreds of training samples and thousands of model rollouts, making them expensive in the best case and intractable in the worst. To address this challenge, we introduce Contrastive Reflection (CORE), a non-parametric learning algorithm that compares past reasoning traces to generate insights: short natural-language descriptions of reasoning strategies and constraints that capture differences between successful and unsuccessful problem attempts. Across four reasoning tasks, we demonstrate that CORE enables more rapid improvement than both parametric (GRPO) and non-parametric (GEPA, episodic RAG, and MemRL) methods, while using fewer rollouts. Under fixed rollout budgets with as few as five training samples, CORE achieves the strongest performance in most task-data regimes. Finally, we highlight how CORE is substantially more context-efficient than non-parametric baselines, requiring fewer prompt tokens while storing learned knowledge as compact, interpretable natural-language insights. Our results therefore suggest that distilling contrasts between successful and unsuccessful reasoning traces into abstract and useful insights can provide a more efficient and interpretable route to model self-improvement than weight updates, prompt optimization, or direct reuse of stored reasoning traces.