核心发现
方法论
本文提出SciConsolidate框架,通过对比成功与失败案例,诱导跨任务程序,并通过开发验证门选择这些程序。使用失败信息和无答案查询合成扩展整合数据,强模型将抽象转化为可执行代码监督。
关键结果
- 在SciCode上,Qwen3.6-27B通过运行时程序注入提高了3.85/6.26分,但Qwen3.5-9B几乎没有整体主问题增益,显示抽象-执行差距。
- 经过程序指导具体化后,9B学生在无程序部署下比无程序SFT控制提高3.89/6.25分,比原始9B模型提高5.62/11.25分。
- 这些结果确立了科学计算的经验到能力路径,为扩展自我改进科学助手提供了实用起点。
研究意义
该研究为科学计算领域提供了一种将经验转化为能力的路径,解决了大语言模型在科学计算任务中无法持久提升的问题。通过程序知识的合成与具体化,模型能够在没有外部程序的情况下提升性能,为自我改进的科学助手的扩展提供了实用起点。
技术贡献
技术贡献包括提出了一种新的经验整合框架SciConsolidate,解决了抽象-执行差距问题,并通过程序指导的监督学习提升了模型能力。与现有方法相比,该框架提供了新的理论保证和工程可能性。
新颖性
该研究首次提出将科学计算经验转化为可重复使用的程序知识,并通过程序指导的监督学习提升模型能力。与相关工作相比,创新在于解决了抽象-执行差距问题。
局限性
- 对于较弱的目标模型,抽象程序可能无法直接执行,显示出能力依赖的抽象-执行差距。
- 程序知识的效用在不同任务类型和失败家族之间变化。
- 多轮自我改进的路径尚未在本研究中评估。
未来方向
未来工作可包括多轮自我改进路径的评估,进一步探索程序知识在不同任务类型中的效用,以及开发更强的模型以缩小抽象-执行差距。
AI 总览摘要
大语言模型在科学计算任务中取得了显著进展,但其在解决一个问题后获得的可执行反馈很少能成为后续问题的持久能力。本文研究了科学计算经验整合,即将经过验证的运行时经验转化为可转移的程序知识和持久的模型改进。我们提出了SciConsolidate框架,通过对比成功与失败案例,诱导跨任务程序,并通过开发验证门选择这些程序。使用失败信息和无答案查询合成扩展整合数据,强模型将抽象转化为可执行代码监督。实验结果显示,在SciCode上,Qwen3.6-27B通过运行时程序注入提高了3.85/6.26分,但Qwen3.5-9B几乎没有整体主问题增益,显示抽象-执行差距。经过程序指导具体化后,9B学生在无程序部署下比无程序SFT控制提高3.89/6.25分,比原始9B模型提高5.62/11.25分。这些结果确立了科学计算的经验到能力路径,为扩展自我改进科学助手提供了实用起点。
深度分析
研究背景
近年来,大语言模型在科学计算领域取得了显著进展,尤其是在将科学规范转化为可执行的数值、分析和模拟程序方面。然而,当前的评估强调模型是否能解决每个问题,而不是执行证据是否减少了后续问题的相关失败。因此,科学计算需要一种机制,将经过验证的执行证据抽象化,验证其转移,并将其作为持久能力返回给模型。
核心问题
科学计算经验整合面临两个挑战:轨迹衍生的工件可能编码源特定的修复,而不是跨任务的计算机制;较弱的目标模型可能无法操作一个有效的抽象程序,导致抽象-执行差距。
核心创新
我们提出了SciConsolidate框架,通过对比成功与失败案例,诱导跨任务程序,并通过开发验证门选择这些程序。使用失败信息和无答案查询合成扩展整合数据,强模型将抽象转化为可执行代码监督。
方法详解
- �� 对比成功与失败案例,诱导跨任务程序
- �� 通过开发验证门选择程序
- �� 使用失败信息和无答案查询合成扩展整合数据
- �� 强模型将抽象转化为可执行代码监督
实验设计
我们在SciCode上评估了该路径。运行时程序注入提高了Qwen3.6-27B的3.85子步骤点和6.26主问题点,但对Qwen3.5-9B几乎没有整体主问题增益。经过程序指导具体化和SFT,9B学生在无程序部署下比无程序SFT控制提高3.89/6.25分,比原始9B模型提高5.62/11.25分。
结果分析
实验结果显示,Qwen3.6-27B通过运行时程序注入提高了3.85/6.26分,但Qwen3.5-9B几乎没有整体主问题增益,显示抽象-执行差距。经过程序指导具体化后,9B学生在无程序部署下比无程序SFT控制提高3.89/6.25分,比原始9B模型提高5.62/11.25分。
应用场景
该研究为科学计算领域提供了一种将经验转化为能力的路径,解决了大语言模型在科学计算任务中无法持久提升的问题。通过程序知识的合成与具体化,模型能够在没有外部程序的情况下提升性能,为自我改进的科学助手的扩展提供了实用起点。
局限与展望
对于较弱的目标模型,抽象程序可能无法直接执行,显示出能力依赖的抽象-执行差距。程序知识的效用在不同任务类型和失败家族之间变化。多轮自我改进的路径尚未在本研究中评估。
通俗解读 非专业人士也能看懂
想象一个厨房,厨师在做饭时遇到问题,比如食材不匹配或烹饪步骤错误。通过观察成功的菜肴和失败的尝试,厨师可以总结出一些通用的烹饪技巧,比如如何正确切割食材或调整火候。这些技巧就像程序知识,可以帮助厨师在未来的烹饪中避免类似的错误。本文研究的就是如何将这些经验转化为模型的能力,让模型在科学计算任务中表现得更好。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,每次过关后,你都会学到一些新的技巧,比如如何打败敌人或解决谜题。这些技巧帮助你在后续关卡中更快通关。本文研究的就是如何让大语言模型在解决科学计算问题时,像你一样积累经验,变得更强。通过观察成功和失败的案例,模型可以总结出一些通用的解决方案,帮助它在未来的任务中表现得更好。
术语表
SciConsolidate (科学整合)
一种框架,用于将科学计算经验转化为可重复使用的程序知识。
本文提出的核心方法,用于解决抽象-执行差距问题。
Abstraction-Execution Gap (抽象-执行差距)
模型在操作抽象程序时遇到的能力依赖问题。
本文研究的主要挑战之一,影响模型的执行能力。
Procedural Knowledge (程序知识)
基于执行证据的可重复使用的解决方案。
通过对比成功与失败案例诱导的知识,用于提升模型能力。
SFT (监督微调)
一种训练方法,通过监督学习提升模型性能。
用于训练学生模型,提升其在无程序部署下的表现。
Qwen3.6-27B (Qwen3.6-27B模型)
一种强模型,用于具体化抽象程序。
在实验中用于程序指导的监督学习。
开放问题 这项研究留下的未解疑问
- 1 如何在不同任务类型中有效应用程序知识?
- 2 如何缩小较弱模型的抽象-执行差距?
- 3 多轮自我改进路径的评估如何进行?
应用场景
近期应用
科学计算任务优化
通过程序知识提升模型在科学计算任务中的表现,减少错误率。
模型能力提升
无需外部程序,模型在科学计算任务中表现更好。
远期愿景
自我改进科学助手
通过多轮自我改进路径,模型能够不断提升自身能力,成为更强大的科学助手。
原文摘要
Large language models increasingly solve scientific-computing tasks, but executable feedback from one problem rarely becomes durable capability on subsequent problems. We study scientific-computing experience consolidation: converting verified runtime experience into transferable procedural knowledge and persistent model improvement. This setting presents two challenges: trajectory-derived artifacts may encode source-specific repairs rather than cross-task computational mechanisms; and a weaker target model may be unable to operationalize an otherwise valid abstract procedure - an abstraction-execution gap. We introduce SciConsolidate, which contrasts verified successes and failures to induce cross-task procedures, selects them through a development-validation gate, and uses failure-informed, answer-free query synthesis to expand the consolidation data without requiring pre-existing reference answers. Because the target model may not directly execute these abstractions, a stronger model concretizes them into executable code supervision for standard, procedure-free SFT; a matched no-procedure teacher branch isolates the value of procedural guidance. On SciCode, runtime procedure injection improves Qwen3.6-27B by +3.85/+6.26 sub-step/main-problem points, but yields almost no aggregate main-problem gain for Qwen3.5-9B, providing operational evidence of the abstraction-execution gap. After procedure-guided concretization, the 9B student improves under procedure-free deployment by +3.89/+6.25 points over the no-procedure SFT control and by +5.62/+11.25 over the original 9B model. These results establish an experience-to-capability pathway for scientific computing and provide a practical starting point for scaling self-improving scientific assistance.