LLM4AD: A Platform for Algorithm Design with Large Language Model

TL;DR

LLM4AD以EoH等搜索方法统一算法生成,在9项任务和8种LLM上验证可扩展性。

cs.AI 🟡 进阶级 2024-12-23 18 次浏览
Fei Liu Rui Zhang Zhuoliang Xie Rui Sun Kai Li Qinglong Hu Ping Guo Xi Lin Xialiang Tong Mingxuan Yuan Zhenkun Wang Zhichao Lu Qingfu Zhang
大语言模型 自动算法设计 进化搜索 优化 科学发现

核心发现

方法论

LLM4AD是模块化Python平台,由Search Methods、LLM Interface和Task Evaluation Interface组成。它以迭代种群搜索为主线,让LLM生成候选算法,再在任务实例上评估适应度并保留精英。平台集成Sampling、Tabu Search、Simulated Annealing、EoH、FunSearch、(1+1)-EPS,以及多目标的MEoH、NSGA-II和MOEA/D;支持远程API、本地模型、并行采样和安全沙箱。

关键结果

  • 在GPT-4o-Mini、2000次函数评估、3次独立运行的设置下,EoH、FunSearch和(1+1)-EPS在多数ACRO、BACT、CVRP、OBP、OSC、SET、TSP、VRPTW任务上优于随机采样;图3显示,搜索机制比单纯重复生成更稳定。
  • 平台测试了Llama-3.1-8B、Yi-34b-Chat、GLM-3-Turbo、Claude-3-Haiku、Doubao-pro-4k、GPT-3.5-Turbo、GPT-4o-Mini和Qwen-Turbo。GPT-4o-Mini的HumanEval为87.2、MMLU为82.0,但论文指出代码能力高并不必然带来更优算法设计表现。
  • 不同任务难度差异明显:Mountain Car中方法差距较小,而OSC、SET、TSP和VRPTW差距显著。EoH与FunSearch依靠多样性控制通常更稳健;贪婪的(1+1)-EPS在不同任务间波动更大。

研究意义

论文解决了LLM辅助算法设计缺少统一工具、流程和基准的长期问题。研究者不必同时重写提示、模型调用、搜索循环、代码执行和日志系统,即可在优化、机器学习与科学发现任务上进行可复现实验。对学术界而言,统一的2000次评估、50秒超时和3次独立运行设置有助于公平比较;对工业界而言,平台把LLM从一次性代码生成器转变为可监控、可迭代的算法搜索组件。

技术贡献

核心贡献不是提出单一新算法,而是把算法设计抽象成“生成—评估—选择”的可插拔系统。Evaluation接口统一了目标函数、超时、Numba加速和安全执行;Sampler接口兼容HTTPS API、transformers与vLLM本地部署;搜索层封装种群、岛模型、遗传式演化和邻域搜索。Profiler同时支持基础日志、TensorBoard与Weights & Biases,形成从提示到结果分析的工程闭环。

新颖性

相较于EoH、FunSearch或ReEvo等单项研究,LLM4AD的创新在于平台化与标准化:它同时容纳多类搜索器、模型和任务,并提供GUI、教程、示例及安全沙箱。论文重点推进的是研究基础设施和可比性,而非新的理论收敛保证。

局限性

  • 实验只覆盖9项任务,且每次最多2000次函数评估;图表主要展示趋势而非统一汇总表,因此难以判断跨任务的总体优势。
  • LLM输出具有随机性,性能依赖提示模板、模型版本、API延迟和评估预算;论文未系统报告成本、token消耗或统计显著性。
  • GUI当前一次只支持单一方法和单一LLM配置,批量实验仍需脚本完成。

未来方向

作者计划扩展至160项以上任务,并增强GUI的批量实验能力。后续可加入成本感知搜索、跨任务迁移、自动提示优化、更多本地模型和严格统计检验,同时研究生成算法的可解释性、形式验证与跨实例泛化。

AI 总览摘要

算法设计长期依赖专家经验:研究者需要提出启发式规则、编写代码、调参并反复测试。近年LLM能够生成启发式、优化器和科学公式,但既有工作往往各自实现,使用不同提示、语言和评估流程,结果难以复现或公平比较。LLM4AD正是针对这一基础设施缺口提出的统一Python平台。

平台由搜索方法、LLM接口和任务评估接口组成。LLM生成候选算法,搜索器通过采样、邻域搜索或进化机制反复改进,评估沙箱则在任务实例上计算适应度,并限制运行时间、处理非法代码和保护除法。系统集成EoH、FunSearch、(1+1)-EPS、MEoH、NSGA-II与MOEA/D,支持远程和本地LLM、并行采样、TensorBoard、W&B及GUI。任务覆盖CVRP、TSP、OBP、Acrobot、Mountain Car、Bacterial Growth、Admissible Sets和Nonlinear Oscillators等,现有20余项并计划扩展至160余项。

基准实验采用8种LLM、9项任务、2000次函数评估、50秒单次超时和3次独立运行。以GPT-4o-Mini为例,EoH、FunSearch和(1+1)-EPS在多数任务上超过随机采样;EoH与FunSearch通常因多样性控制更稳健,而(1+1)-EPS受贪婪机制影响更大。结果也提醒我们,HumanEval或MMLU更高不代表算法设计一定更好。LLM4AD的价值因此不只是自动生成代码,而是建立可扩展、可比较和更安全的LLM算法研究环境。

深度分析

研究背景

LLM辅助算法设计已从代码生成扩展到启发式搜索、数学发现和科学方程发现。代表性工作包括EoH、FunSearch、(1+1)-EPS、MEoH、ReEvo和LLM-SR,但它们通常拥有不同的提示模板、评估脚本和模型接口。研究者因此难以复现实验,也无法判断提升来自搜索方法、LLM还是任务实现。LLM4AD试图提供共同底座。

核心问题

核心问题是如何让LLM稳定地产生可执行且高质量的算法,而不是偶然生成一段代码。随机采样缺少反馈利用;单一搜索策略难以适配组合优化、强化学习和科学发现;生成代码还可能死循环、超时或破坏实验流程。平台必须同时解决搜索、调用、评估、安全和比较标准化问题。

核心创新

  • ��统一框架:将Search Methods、LLM Interface和Evaluation Interface解耦,支持用户替换任一模块。
  • ��搜索集合:集成Sampling、Tabu Search、Simulated Annealing、EoH、FunSearch、(1+1)-EPS及NSGA-II、MOEA/D。
  • ��任务生态:覆盖优化、机器学习和科学发现,提供20余项任务并规划160余项。
  • ��安全与可用性:加入超时、保护除法、可选Numba加速、Profiler、GUI和文档,降低实验门槛。

方法详解

  • ��初始化:用户选择LLM、搜索器、任务模板和评估预算;模板包含导入、函数签名、文档字符串及示例实现。
  • ��生成:Sampler通过OpenAI格式HTTPS接口或本地transformers/vLLM调用LLM,并支持并行采样。
  • ��搜索:候选算法组成种群;EoH采用遗传式演化,FunSearch采用岛模型,(1+1)-EPS保留改进个体;多目标场景可用MEoH、NSGA-II或MOEA/D。
  • ��评估:每个候选在任务实例上执行,得到目标分数;沙箱执行超时控制、非法代码防护和可选加速。
  • ��反馈:Profiler记录日志、收敛曲线和最优算法,搜索器根据适应度选择精英并继续迭代。

实验设计

实验选取ACRO、CAR、CVRP、OBP、TSP、VRPTW、BACT、SET和OSC九项任务,覆盖机器学习、组合优化和科学发现。比较随机采样、EoH、FunSearch与(1+1)-EPS,并使用8种LLM。统一设置为2000次函数评估;EoH种群规模为10,FunSearch使用10个岛、每次提示4个样本;每次评估最多50秒,所有实验运行3次。

结果分析

GPT-4o-Mini结果显示,EoH、FunSearch和(1+1)-EPS在多数任务上优于Random Sampling。Mountain Car的算法差距较小,OSC、SET、TSP和VRPTW则差距明显,说明任务复杂度不同。EoH和FunSearch的多样性控制带来较稳定的收敛;(1+1)-EPS的贪婪更新使其性能更依赖任务。8种LLM之间也存在任务相关差异,没有单一模型在所有任务上显著领先。

应用场景

研究者可用它自动生成CVRP、TSP、OBP等启发式,也可设计Acrobot、Cart Pole等控制策略,或搜索Bacterial Growth、ODE和Feynman符号回归任务的程序。工业团队可将内部目标函数封装为Evaluation子类,再提供安全模板,让LLM搜索排程、路由或代理策略。使用前需明确评价指标、输入输出接口和安全边界。

局限与展望

平台的可比性仍受提示、随机种子、模型服务和预算影响;2000次评估可能不足以覆盖复杂搜索空间。论文没有报告每个任务的完整数值表、调用成本、token消耗或统计显著性,也没有理论保证生成算法一定收敛。未来应扩展160余项任务,支持GUI批量实验,并加入成本约束、迁移学习、程序验证、可解释性和跨实例泛化测试。

通俗解读 非专业人士也能看懂

把LLM4AD想成一个会设计菜谱的智能厨房。过去,厨师要自己想配方、买材料、做菜、评分,再决定是否重来;不同厨师还使用不同评分标准,所以很难知道谁真的更好。LLM4AD把厨房、评委和记录员统一起来。

LLM负责提出新菜谱,也就是新的算法。搜索方法像不同的改菜策略:随机采样是不断试新菜,EoH和FunSearch像保留好菜、混合优点并继续改良的厨师,(1+1)-EPS则像只保留比上一道更好的版本。评估沙箱是安全厨房:每道菜只能做规定时间,不能无限等待,也不能破坏炉具。

平台还提供许多“食材和比赛”:路线规划、装箱、机器人控制、细菌生长和科学公式。研究者可以换模型、换改良策略、换评分标准,却仍使用同一套记录方式。实验表明,单纯让模型反复想法通常不如让模型和搜索策略合作;但最强的写代码模型也不一定总能做出最好的算法。

简单解释 像给14岁少年讲一样

想象你在玩一款“发明游戏策略”的游戏。你可以让AI写出一种打法,比如怎样更快装箱、怎样规划送货路线,或者怎样让小车爬上山。但AI第一次写出的办法可能很笨,甚至会卡死。LLM4AD就像一个专门的训练场:AI不断提出新打法,系统自动试玩、打分,再留下表现好的打法。

这里有不同的训练教练。Random Sampling只是不断抽签尝试;EoH和FunSearch会把好点子保存下来,再组合和修改;(1+1)-EPS则像只接受“比当前纪录更好”的新策略。系统还有安全裁判,如果某个程序跑太久、出错或无限循环,就停止它。

研究者用它测试了8种AI模型和9个任务,包括Acrobot、Mountain Car、CVRP、TSP、OBP、BACT、SET和OSC。总预算是2000次评估,每次最多50秒,并重复3次。结果显示,带搜索教练的方法大多数时候比随机尝试更好,但不同任务喜欢不同模型和策略。

最酷的地方是,这个平台像一个共享实验室。大家可以用同样的规则比较方法,也能加入自己的任务、模型和搜索器。不过它还不是魔法:实验次数有限,模型会随机犯错,调用成本也可能很高。未来它或许能帮助工程师、科学家甚至学生发现更聪明的解决方案!

术语表

Large Language Model(大语言模型)

能够根据文本提示生成代码、解释或方案的模型。论文用它提出候选算法,而不是直接把一次输出当作最终答案。

LLM Interface统一调用GPT、Claude、Llama、Qwen等远程或本地模型。

Algorithm Design(算法设计)

为特定问题构造解决步骤、规则或程序。其质量由目标函数、运行效率和约束满足情况共同决定。

平台将算法设计表示为可执行程序的生成与评估过程。

EoH

Evolution of Heuristics,一种让LLM生成并进化启发式算法的方法。它通过种群和精英保留维持候选多样性。

基准中EoH在多数任务上优于随机采样。

FunSearch

结合程序搜索与LLM生成的算法,采用岛模型维护多个搜索群体。不同岛屿可探索不同程序方向。

平台将其作为单目标搜索方法,并设置10个岛和每次提示4个样本。

Evaluation Sandbox(评估沙箱)

隔离且可配置的代码执行环境。它通过超时、错误处理和安全机制防止候选程序干扰搜索流程。

每个算法最多评估50秒,并支持保护除法和可选Numba加速。

Function Evaluation(函数评估)

运行候选算法并计算其目标分数的一次操作。评估次数是搜索预算的重要组成部分。

主要基准统一使用最多2000次函数评估。

开放问题 这项研究留下的未解疑问

  • 1 尚不清楚如何预测某个LLM在特定算法任务上的可靠性;HumanEval和MMLU与实际设计表现并不一致,需要任务感知的模型选择指标。
  • 2 平台尚未充分量化API费用、token消耗与性能收益的关系。未来需要成本—质量—时间三维基准。
  • 3 生成算法能否迁移到未见实例和真实工业数据仍缺乏证据,需要跨任务、跨分布和长期部署评估。

应用场景

近期应用

自动生成物流启发式

物流研究者可将CVRP、TSP、OBP或VRPTW的目标函数封装进Evaluation接口,再用EoH或FunSearch生成路线和装箱规则。通过50秒超时与统一实例评估,可快速筛选比人工基线更有潜力的候选方案。

科学程序搜索

科学计算团队可利用BACT、OSC、ODE和SRSD-Feynman任务验证符号表达式或动力学程序。研究者需提供清晰的输入输出类型、文档字符串和安全执行边界,平台负责生成、运行、记录和比较。

远期愿景

领域专用算法实验室

企业可把内部排程、仓储或控制问题接入平台,使LLM成为持续搜索算法的自动化研究员。若结合成本约束、历史实验和迁移学习,系统可能形成面向业务的算法资产库。

可验证的科学发现系统

未来平台可将程序搜索、形式验证、物理约束和实验数据结合,自动提出可解释的科学模型。主要障碍包括生成结果的可信性、跨实验泛化、计算成本和责任审计。

原文摘要

We introduce LLM4AD, a unified Python platform for algorithm design (AD) with large language models (LLMs). LLM4AD is a generic framework with modularized blocks for search methods, algorithm design tasks, and LLM interface. The platform integrates numerous key methods and supports a wide range of algorithm design tasks across various domains including optimization, machine learning, and scientific discovery. We have also designed a unified evaluation sandbox to ensure a secure and robust assessment of algorithms. Additionally, we have compiled a comprehensive suite of support resources, including tutorials, examples, a user manual, online resources, and a dedicated graphical user interface (GUI) to enhance the usage of LLM4AD. We believe this platform will serve as a valuable tool for fostering future development in the merging research direction of LLM-assisted algorithm design.

cs.AI