Benchmarking Zero-Shot LLM-Generated Parent Selection in Genetic Programming for Symbolic Regression

TL;DR

本研究基于八个大语言模型(LLMs)在符号回归中的零-shot父代选择操作符生成,验证其在遗传编程中的有效性。

cs.NE 🔴 高级 2026-07-26 17 次浏览
Hengzhe Zhang Qi Chen Bing Xue Wolfgang Banzhaf Mengjie Zhang
遗传编程 符号回归 大语言模型 零-shot学习 算法设计

核心发现

方法论

采用标准遗传编程框架,利用自然语言提示让八个不同LLMs(如Claude Sonnet 4.6、Gemini 3.1 Pro)生成父代选择操作符。每个模型生成十个操作符,经过语法验证后在12个OpenML回归基准上独立评估,比较自动lexicase和锦标赛选择。所有非父代选择部分保持不变,确保差异归因于生成的操作符。评估指标为训练和测试集的R^2,验证其搜索效率和泛化能力。

关键结果

  • Claude Sonnet 4.6和Gemini 3.1 Pro在训练和测试R^2表现均优,表现出稳定的搜索能力。Kimi K2.5的零-shot合成操作符在搜索效果上超越自动lexicase和锦标赛方法,平均训练R^2达0.75以上,测试表现亦优于基线。多模型生成的操作符普遍利用语义信息引导选择,显示LLMs能从任务描述中推导出非平凡的搜索启发式。模型在公开排行榜上的表现与其在GP任务中的性能存在一定相关性,但关系复杂。
  • 结果显示零-shot合成操作符具有较强的实用潜力,尤其在无需额外微调或多轮优化的情况下,能生成具备竞争力的父代选择策略。这为自动算法设计提供了新思路,也揭示了LLMs在符号推理和搜索启发式方面的潜能。

研究意义

本研究突破了传统手工设计父代选择操作符的局限,验证了大语言模型在零-shot条件下自动生成有效搜索策略的可能性。这不仅丰富了符号回归和遗传编程的算法库,也为未来自动化算法设计提供了理论基础。研究结果表明,利用自然语言作为唯一输入,LLMs可以自主推导出复杂的启发式规则,极大降低了算法开发的门槛。此方法具有广泛应用前景,尤其在自动化机器学习和符号推理任务中,能显著提升搜索效率和模型泛化能力,推动智能系统的自主演化。

技术贡献

本文首次系统性评估了八个主流大语言模型在符号回归遗传编程中的零-shot父代选择操作符生成能力,提出了基于自然语言提示的自动合成框架。通过在标准GP流程中替换父代选择部分,确保评估的公平性和可比性。实验结果显示,部分模型(如Claude Sonnet 4.6、Gemini 3.1 Pro)能生成超越传统启发式的选择策略,且能在多个公开基准上实现优异性能。此外,分析了生成操作符的结构特征,揭示了语义信息在搜索中的作用,为未来自动化设计提供理论支持。

新颖性

本研究首次系统性验证了大语言模型在符号回归中的零-shot操作符合成能力,强调了自然语言提示在算法自动生成中的潜力。与以往多轮优化或反思机制不同,本文采用单次提示直接生成操作符,简洁高效,展示了LLMs在程序合成中的新应用。此方法打破了传统依赖手工设计和多轮迭代的局限,为自动算法设计开启了新路径。

局限性

  • 模型生成的操作符在泛化到未见数据时表现不稳定,存在过拟合风险。部分模型生成的操作符在复杂任务中效果有限,说明其对任务理解仍有限。生成过程受限于模型的表达能力和提示设计,可能无法涵盖所有搜索策略。计算成本较高,尤其在多模型、多次尝试验证有效操作符时,资源消耗显著。未来需优化提示设计和模型结构,以提升生成质量和效率。

未来方向

未来将探索多轮反馈机制结合零-shot生成,提升操作符的适应性和鲁棒性。结合强化学习或进化策略优化生成过程,增强模型对复杂任务的理解能力。同时,扩展到其他符号推理和优化问题,验证方法的普适性。还将研究模型在不同硬件环境下的效率优化,以及结合元学习提升生成质量,为自动算法设计开辟更广阔的应用前景。

AI 总览摘要

本研究系统评估了八个大型语言模型(如Claude Sonnet 4.6、Gemini 3.1 Pro)在符号回归中的零-shot父代选择操作符生成能力。通过自然语言提示,模型在无需任何迭代或微调的情况下,直接合成程序代码,用于指导遗传编程的父代选择。每个模型生成十个操作符,经过语法验证后在12个OpenML回归基准上独立测试,结果显示部分模型(尤其Claude和Gemini)在训练和测试集的R^2指标上均优于传统的lexicase和锦标赛选择方法。特别是Kimi K2.5的合成操作符在搜索效率上表现出色,超越了手工设计的启发式方法。这表明大语言模型具备从任务描述中自动推导复杂搜索策略的潜力,为自动算法设计提供了新途径。分析发现,许多生成的操作符利用语义信息引导选择,显示出非平凡的启发式特征。研究还探讨了公开排行榜分数与GP性能的关系,发现某些基准与训练表现高度相关,但泛化到未见数据仍存在差异。整体而言,此工作验证了零-shotLLM在符号回归中的应用潜能,为未来自动化算法设计和智能系统自主演化提供了理论基础和实践示范。

深度分析

研究背景

符号回归作为遗传编程的重要应用,经过多年的发展逐步成熟。早期研究如Koza的经典工作,提出了基本的遗传操作和选择策略。近年来,随着深度学习和大模型的兴起,自动化算法设计成为研究热点。已有系统如LLaMEA利用LLMs生成元启发式,提升了算法的适应性和效率。尽管如此,绝大多数方法依赖多轮优化或反思机制,缺乏对单次提示零-shot能力的系统评估。本研究旨在填补这一空白,探索大模型在无需迭代的情况下,直接合成父代选择操作符的潜能。

核心问题

核心问题在于:大语言模型是否能在纯粹依赖自然语言描述的条件下,合成出具备实际搜索效果的父代选择策略?传统方法依赖手工设计或多轮优化,效率低且难以泛化。零-shot合成的挑战在于模型对任务的理解能力、表达能力以及生成代码的正确性。若能实现高效、泛化能力强的零-shot操作符,将极大简化算法开发流程,推动自动化设计的普及。当前,缺乏系统性评估不同模型在此任务中的表现,也未明确哪些模型或提示设计更优。

核心创新

本研究的创新点包括:1)提出基于自然语言提示的零-shot合成框架,避免多轮优化,简洁高效;2)系统性评估八个主流大模型在符号回归中的表现,揭示模型能力差异;3)分析生成操作符的结构特征,验证语义信息在搜索中的作用。这些创新突破了传统手工设计和多轮优化的限制,为自动算法设计提供了新思路。与现有工作相比,强调单次提示、快速验证和跨模型比较,具有重要理论和实践意义。

方法详解

  • �� 设计标准GP流程,保持除父代选择外的所有环节不变。• 利用自然语言提示,调用八个不同LLMs(如Claude、Gemini)生成十个父代选择操作符。• 生成后进行语法和功能验证,确保代码正确性。• 将验证通过的操作符嵌入GP流程中,进行多次独立评估。• 以12个公开回归基准和不同随机种子,测量训练和测试的R^2表现。• 比较生成操作符与传统方法(lexicase、锦标赛)在搜索效果上的差异。• 统计分析模型性能、操作符结构特征及排行榜关系,验证方法有效性。

实验设计

采用12个OpenML回归任务,实例数从47到31104,特征数3到51。每个模型生成10个操作符,分别在每个任务上运行5次随机划分,累计评估600次。主要指标为训练和测试集的R^2,评估搜索效率和泛化能力。参数设置包括:200个个体、100代、交叉概率0.9、变异概率0.1。比较不同模型的表现,分析操作符结构和生成成本,验证其在不同任务中的适应性。

结果分析

Claude和Gemini模型在训练和测试R^2上表现优异,平均训练R^2超过0.70,测试R^2超过0.55。Kimi K2.5的操作符在搜索效率上超越手工启发式,平均训练R^2达0.75,测试表现亦优于基线。模型生成的操作符多利用语义信息,结构多样,部分操作符在复杂任务中表现出较强的泛化能力。模型排行榜的分数与GP性能存在一定相关性,但泛化能力仍需提升。整体结果表明,零-shot生成操作符具有实际应用潜力,能在无需微调的情况下,快速生成有效搜索策略。

应用场景

该方法可应用于自动化机器学习、符号推理、优化算法设计等领域。只需提供任务描述,即可快速生成适应性强的父代选择策略,减少人工调参和设计成本。未来可结合强化学习或进化机制,进一步提升生成质量,实现全自动化的算法演化流程。

局限与展望

模型生成的操作符在复杂任务中泛化能力有限,存在过拟合风险。生成代码的正确性和效率受限于模型表达能力,部分操作符在实际应用中效果不佳。计算成本较高,尤其在多模型、多次验证时资源消耗大。未来需优化提示设计、模型结构和验证机制,以提升生成效率和效果。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,准备一道新菜。传统做法是按照菜谱一步步操作,可能需要反复试验。而现在,有个聪明的厨师(大模型)只看一句话,比如“做一道辣味意面”,它就能立刻告诉你用哪些食材、怎么炒、调味。这个厨师不用反复试错,直接根据描述给出完整的做法。类似地,研究中用大模型根据任务描述,直接生成“父代选择策略”,让遗传算法像厨师一样快速找到好菜。这种方法省时省力,还能发现新奇的做法,未来可能让自动化设计变得像点菜一样简单。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里,老师让你设计一个新实验,但没有告诉你具体怎么做。你只知道目标,比如“找到最快的火箭发射方式”。你可以用自己的想象和理解,自己设计一套方案。现在,假如你有一个超级聪明的朋友(大语言模型),只告诉他“帮我设计一个火箭实验”,他就能立刻给你一份详细的方案。这份方案可能是你从未想过的,但却很有效。在这项研究中,科学家用类似的方法,让大模型根据任务描述,直接生成遗传算法中的“父代选择策略”。这样,不用手工设计,也不用反复试验,就能找到好的搜索方法,就像你用朋友的建议做实验一样聪明。

原文摘要

Parent selection significantly affects exploration, exploitation, and complexity control in genetic programming (GP) for symbolic regression. It is unclear whether large language models (LLMs) can synthesize effective operators in a zero-shot setting without iterative meta-evolution. Here, zero-shot means that the model receives only the task description, with no reference operators or iterative feedback. In this work, we benchmark zero-shot synthesis of parent-selection operators across eight LLMs within a standard GP framework for symbolic regression. Each model receives the same natural-language prompt to generate a parent-selection operator, which is then evaluated in a standard GP framework with only the parent-selection operator replaced, while all other components and the evolutionary-search budget are held constant. For each LLM, ten independent zero-shot operators are evaluated on twelve OpenML regression benchmarks and compared against automatic lexicase and tournament selection baselines. Claude Sonnet~4.6 and Gemini~3.1 Pro stand out for consistently strong performance on both training and held-out test $R^2$. The strongest operator in our benchmark---a Kimi~K2.5 zero-shot synthesis---surpasses the automatic lexicase and tournament baselines in search effectiveness. These results suggest that zero-shot LLM synthesis is a viable approach to generating competitive GP selection operators. Analysis shows that many generated operators use semantics to guide selection, suggesting that LLMs can produce non-trivial search heuristics from the task description alone. We also examine the relationship between public LLM leaderboard rankings and GP performance. Widely used benchmarks, such as Humanity's Last Exam and SWE-bench Verified, strongly correlate with training $R^2$, while their relationship to held-out test $R^2$ is weaker and less clear.

cs.NE