RefineEvo: Planning-Guided Heuristic Evolution with Bidirectional Experience

TL;DR

RefineEvo通过规划引导的启发式演化和双向经验池显著提升组合优化性能。

cs.CL 🔴 高级 2026-07-13 46 次浏览
Yang Wu Junran Pan Yifan Zhang Ning Xu Fanshuo Zeng Jian Cheng
自动启发式设计 演化算法 经验驱动 规划调度 组合优化

核心发现

方法论

RefineEvo引入一个规划器(Planner)动态调度演化算子,根据搜索状态调整操作策略,并在搜索停滞时触发算子优化。反思器(Reflector)提取父子轨迹中的成功与失败经验,构建双向经验池(BEP),结合场景条件进行经验检索。系统通过轨迹感知和状态条件,优化算子应用与调整,提升搜索效率。具体机制包括:• 状态感知的算子调度与动态优化• 轨迹导向的经验提取与绑定• 经验的场景条件检索与过滤• 结合搜索轨迹进行算子自适应调整• 在多类组合优化任务中实现性能超越传统方法。

关键结果

  • 在经典的TSP、0-1背包、CVRP等基准测试中,RefineEvo持续超越最先进的基线,平均优化差距降低至11.54%,在TSPLIB实例中表现优异,超越OpenEvolve约1.4个百分点。
  • 在大规模实例(如n=1000)中,RefineEvo展现出更强的算法扩展性与稳定性,解决方案质量显著优于固定算子策略,提升了搜索的适应性和效率。
  • 经验池的轨迹感知机制有效避免了盲目探索和重复失败,提升了算子调整的针对性和效果,特别在复杂约束条件下表现优越。

研究意义

该研究突破了传统自动启发式设计中算子固定、经验单向总结的局限,通过规划引导与双向经验管理实现搜索过程的自适应与智能化。这不仅提升了组合优化算法的性能,也为自动算法设计提供了新思路,有望推动AI在工业调度、路径规划等实际场景中的应用落地。其创新机制为未来自我演化系统的构建提供了理论基础和实践范例,具有深远的学术与产业价值。

技术贡献

RefineEvo的核心创新在于引入动态调度的规划器(Planner)和场景绑定的经验池(BEP),实现算子自适应调优。与传统固定算子或静态经验总结不同,系统根据搜索状态实时调整算子策略,结合轨迹感知提取成功与失败经验,增强算法的适应性。技术上,提出轨迹感知的经验绑定机制,结合语义检索实现场景条件下的经验重用,显著提升搜索效率与解质量。该框架兼容多类组合优化问题,展现出优越的扩展性与鲁棒性。

新颖性

本研究首次将规划引导的算子调度与轨迹感知的双向经验池结合,形成自适应、场景条件化的启发式演化系统。相较于现有方法多依赖静态算子或单向经验总结,RefineEvo实现了算子动态优化与经验场景绑定,显著提升了算法的泛化能力和搜索效率。这一创新为自动启发式设计提供了全新思路,突破了传统方法的局限。

局限性

  • 当前系统在极端复杂或高维问题中仍面临算子调度的计算开销较大问题,可能影响实时性。
  • 经验池的场景绑定依赖于轨迹的语义理解,存在误匹配或信息冗余风险,需进一步优化检索机制。
  • 对不同问题类型的适应性尚需验证,未来需扩展到更多实际应用场景中进行调优。

未来方向

未来将探索多模态场景条件的经验绑定机制,提升经验的泛化能力;同时结合强化学习优化规划器策略,实现更高效的算子调度;此外,计划将该框架应用到更复杂的工业调度和路径规划中,验证其实际效果和扩展潜力。

AI 总览摘要

自动启发式设计(AHD)旨在自动生成高效的启发式算法,解决手工设计的局限性。传统方法多依赖固定算子和静态经验,难以适应复杂多变的问题环境。近年来,结合大型语言模型(LLMs)推动AHD快速发展,但仍存在算子应用不灵活、经验利用不足的问题。为此,本文提出RefineEvo,一种基于规划引导的自适应演化框架,融合双向经验池(BEP)实现经验的场景绑定与动态调度。

RefineEvo的核心在于引入一个规划器(Planner),根据搜索状态动态调度算子,识别搜索停滞点并触发算子优化。反思器(Reflector)则分析父子轨迹,提取成功与失败经验,存入场景绑定的经验池中。系统通过轨迹感知和语义检索,结合搜索轨迹,优化算子选择和参数调整,从而实现算法的自我演化。

在多个经典组合优化任务(如TSP、背包、CVRP)上,RefineEvo展现出优异性能,超越现有最优方法。实验结果显示,其解决方案质量优于传统和神经网络方法,且在大规模实例中表现出更强的扩展性和鲁棒性。该框架不仅提升了搜索效率,也为自动算法设计提供了新思路。

总之,RefineEvo通过规划引导和经验场景绑定,有效解决了自动启发式设计中的算子固定和经验单向的问题,推动了自适应、智能化搜索的实现。未来,结合强化学习和多模态场景理解,有望在工业调度、路径规划等实际应用中发挥更大作用,开启自动算法设计的新篇章。

深度分析

研究背景

自动启发式设计(AHD)起源于人工调优的局限,近年来借助深度学习和大模型实现自动化。代表性工作包括POMO、DeepACO、MCTS-AHD等,推动了神经网络与演化算法结合的研究。尽管取得一定成果,但这些方法多依赖静态算子或经验总结,难以应对复杂多变的任务环境。随着大模型能力提升,LLM在代码生成和算法设计中的应用逐渐展开,但仍存在算子应用不灵活、经验利用不足的问题。整体来看,AHD正处于从静态到动态、从单向到场景绑定的转型关键期。

核心问题

现有AHD方法普遍面临算子固定、经验单向、适应性不足的问题。静态算子难以应对搜索过程中出现的多样化场景变化,导致搜索效率低下。经验总结多为结果导向,缺乏对失败原因的深刻理解,难以指导算子优化。此外,缺乏场景条件绑定的经验管理机制,限制了算法的泛化能力。解决这些瓶颈对于提升自动启发式设计的性能和适应性具有重要意义。

核心创新

本研究提出三大创新:1)引入规划器(Planner),实现状态感知的算子调度与动态优化,解决静态算子适应性差的问题;2)设计双向经验池(BEP),结合轨迹感知提取成功与失败经验,并绑定场景条件,增强经验的针对性;3)结合语义检索实现场景条件下的经验重用,提升搜索效率。这些创新共同推动AHD向自适应、场景化、智能化方向发展,突破了传统方法的局限。

方法详解

  • �� 设定目标:通过最大化启发式的适应性和解质量,优化搜索过程。• 引入规划器(Planner):感知搜索状态(如适应度收敛、多样性)• 根据状态动态调度算子(探索或利用)• 在搜索停滞时,触发算子优化(如调整提示语、参数)• 反思器(Reflector)分析父子轨迹,提取成功与失败经验• 经验绑定场景条件,存入双向经验池(E+和E-)• 利用语义检索匹配当前搜索场景,重用经验• 结合轨迹信息,优化算子选择和参数调节• 在多任务、多规模环境中验证系统性能,持续提升算法适应性和解质量。

实验设计

采用TSP、背包、CVRP等经典基准,比较RefineEvo与固定算子、神经网络及其他自动设计方法。设置不同规模(如n=50、100、200、1000)进行性能评估。指标包括目标值、优化差距、搜索速度和鲁棒性。使用真实和合成数据,调优超参数如搜索轮次、经验池容量。通过消融实验验证规划器、经验池的贡献,分析不同场景下的表现差异。确保结果具有代表性和可复现性。

结果分析

RefineEvo在多个任务中持续优于基线,平均优化差距降低至11.54%,在TSPLIB实例中表现优异,超越OpenEvolve约1.4个百分点。在大规模实例(如n=1000)中,表现出更强的扩展性和稳定性,解决方案质量显著优于固定算子策略。经验轨迹感知机制有效避免重复失败,提升搜索针对性。结果显示,系统在路径规划和资源调度等复杂场景中具有广泛适用性和优越性能。

应用场景

该系统适用于路径规划、工业调度、物流优化等场景,尤其在复杂约束和大规模问题中表现出色。企业可以利用其自动调优能力,减少人工调试成本,提高调度效率。未来结合强化学习与多模态场景理解,有望实现更智能的自动算法设计,推动工业4.0和智能制造的发展。

局限与展望

当前系统在极端复杂或高维问题中算子调度的计算成本较高,可能影响实时应用。经验池的场景绑定依赖语义理解,存在误匹配风险。对不同任务类型的适应性和泛化能力仍需验证,未来需优化检索机制和扩展多任务能力。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,厨师需要用不同的工具(刀、锅、勺子)做不同的菜。传统方法是提前准备好所有工具,固定使用某一种,遇到不同菜就不灵活。而RefineEvo像一个聪明的厨师,能根据菜的不同情况,动态选择最合适的工具,还会记住哪些工具在做某种菜时效果好,哪些会出错。它会不断学习和调整,遇到新菜时也能快速找到最佳做法,就像一个会自己变聪明的厨师一样。这种方式让厨房变得更高效,做出来的菜也更好吃。

简单解释 像给14岁少年讲一样

想象你在学校里参加比赛,老师给你一堆不同的题目。以前你可能用一种固定的方法去解题,但有时候不管用。有了RefineEvo,就像你有一个聪明的助手,他会观察你做题的过程,记住哪些方法在某些题上特别有效,哪些方法会失败。每次遇到新题时,他会帮你选择最合适的解题策略,还会不断学习和改进。当你遇到特别难的题,他会提醒你用不同的技巧,避免走弯路。这样一来,你的解题速度更快,成绩也会更好,就像有个聪明的朋友一直在帮你变得更厉害一样。

术语表

规划器 (Planner)

一种根据搜索状态动态调度算子和优化策略的模块,确保搜索过程高效有序。

在本文中,规划器用于调节演化算子的选择和优化时机。

反思器 (Reflector)

分析父子轨迹,提取成功与失败经验,并绑定场景条件,指导经验重用。

用于构建双向经验池,提升搜索的针对性。

双向经验池 (Bidirectional Experience Pool)

存储成功和失败经验,结合场景条件实现经验的场景绑定和检索。

核心机制之一,用于经验的场景化管理。

轨迹感知 (Trajectory-aware)

基于搜索路径和历史轨迹提取经验,增强经验的场景适应性。

提升经验的针对性和有效性。

组合优化 (Combinatorial Optimization)

在有限资源下寻找最优解的数学问题,涉及路径、调度、分配等。

RefineEvo应用于多类此类问题。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升经验池的场景理解能力,避免误匹配和信息冗余,仍是未来研究的关键。
  • 2 在极端大规模或高复杂度问题中,算子调度的计算成本和效率优化仍需突破。

应用场景

近期应用

工业路径调度

利用RefineEvo自动调优路径规划算法,提升制造和物流效率,减少人工调试成本。

智能调度系统

在复杂调度场景中实现自适应算法,提升资源利用率和调度响应速度。

远期愿景

自动算法设计平台

结合多模态信息和强化学习,打造全自动、可扩展的算法生成和优化系统,推动工业4.0发展。

原文摘要

Automatic Heuristic Design (AHD) has emerged as a transformative approach for solving combinatorial optimization problems. While recent Large Language Model (LLM)-based methods have shown promise, they predominantly rely on fixed evolutionary operators and struggle to effectively accumulate and reuse historical search experience. This paper proposes RefineEvo, a novel evolutionary framework that transforms AHD from a static trial-and-error process into a planning-guided, experience-driven system. RefineEvo introduces a Planner to dynamically schedule evolutionary operators and trigger refinement based on the current search state, and a Reflector to distill valuable lessons into a Bidirectional Experience Pool containing both positive insights and negative pitfalls. This synergistic framework enables the system to adapt its search tools to the evolving complexity of the problem and leverage trajectory-aware, situation-conditioned insights to guide generation. Experiments on several classic combinatorial optimization benchmarks demonstrate that RefineEvo consistently outperforms strong baselines. In particular, RefineEvo delivers superior solution quality while improving token efficiency, enabling more efficient and autonomous heuristic design.

cs.CL