LLM4AD: A Platform for Algorithm Design with Large Language Model
LLM4AD以EoH等搜索方法统一算法生成,在9项任务和8种LLM上验证可扩展性。
核心发现
方法论
LLM4AD是模块化Python平台,由Search Methods、LLM Interface和Task Evaluation Interface组成。它以迭代种群搜索为主线,让LLM生成候选算法,再在任务实例上评估适应度并保留精英。平台集成Sampling、Tabu Search、Simulated Annealing、EoH、FunSearch、(1+1)-EPS,以及多目标的MEoH、NSGA-II和MOEA/D;支持远程API、本地模型、并行采样和安全沙箱。
关键结果
- 在GPT-4o-Mini、2000次函数评估、3次独立运行的设置下,EoH、FunSearch和(1+1)-EPS在多数ACRO、BACT、CVRP、OBP、OSC、SET、TSP、VRPTW任务上优于随机采样;图3显示,搜索机制比单纯重复生成更稳定。
- 平台测试了Llama-3.1-8B、Yi-34b-Chat、GLM-3-Turbo、Claude-3-Haiku、Doubao-pro-4k、GPT-3.5-Turbo、GPT-4o-Mini和Qwen-Turbo。GPT-4o-Mini的HumanEval为87.2、MMLU为82.0,但论文指出代码能力高并不必然带来更优算法设计表现。
- 不同任务难度差异明显:Mountain Car中方法差距较小,而OSC、SET、TSP和VRPTW差距显著。EoH与FunSearch依靠多样性控制通常更稳健;贪婪的(1+1)-EPS在不同任务间波动更大。
研究意义
论文解决了LLM辅助算法设计缺少统一工具、流程和基准的长期问题。研究者不必同时重写提示、模型调用、搜索循环、代码执行和日志系统,即可在优化、机器学习与科学发现任务上进行可复现实验。对学术界而言,统一的2000次评估、50秒超时和3次独立运行设置有助于公平比较;对工业界而言,平台把LLM从一次性代码生成器转变为可监控、可迭代的算法搜索组件。
技术贡献
核心贡献不是提出单一新算法,而是把算法设计抽象成“生成—评估—选择”的可插拔系统。Evaluation接口统一了目标函数、超时、Numba加速和安全执行;Sampler接口兼容HTTPS API、transformers与vLLM本地部署;搜索层封装种群、岛模型、遗传式演化和邻域搜索。Profiler同时支持基础日志、TensorBoard与Weights & Biases,形成从提示到结果分析的工程闭环。
新颖性
相较于EoH、FunSearch或ReEvo等单项研究,LLM4AD的创新在于平台化与标准化:它同时容纳多类搜索器、模型和任务,并提供GUI、教程、示例及安全沙箱。论文重点推进的是研究基础设施和可比性,而非新的理论收敛保证。
局限性
- 实验只覆盖9项任务,且每次最多2000次函数评估;图表主要展示趋势而非统一汇总表,因此难以判断跨任务的总体优势。
- LLM输出具有随机性,性能依赖提示模板、模型版本、API延迟和评估预算;论文未系统报告成本、token消耗或统计显著性。
- GUI当前一次只支持单一方法和单一LLM配置,批量实验仍需脚本完成。
未来方向
作者计划扩展至160项以上任务,并增强GUI的批量实验能力。后续可加入成本感知搜索、跨任务迁移、自动提示优化、更多本地模型和严格统计检验,同时研究生成算法的可解释性、形式验证与跨实例泛化。
AI 总览摘要
算法设计长期依赖专家经验:研究者需要提出启发式规则、编写代码、调参并反复测试。近年LLM能够生成启发式、优化器和科学公式,但既有工作往往各自实现,使用不同提示、语言和评估流程,结果难以复现或公平比较。LLM4AD正是针对这一基础设施缺口提出的统一Python平台。
平台由搜索方法、LLM接口和任务评估接口组成。LLM生成候选算法,搜索器通过采样、邻域搜索或进化机制反复改进,评估沙箱则在任务实例上计算适应度,并限制运行时间、处理非法代码和保护除法。系统集成EoH、FunSearch、(1+1)-EPS、MEoH、NSGA-II与MOEA/D,支持远程和本地LLM、并行采样、TensorBoard、W&B及GUI。任务覆盖CVRP、TSP、OBP、Acrobot、Mountain Car、Bacterial Growth、Admissible Sets和Nonlinear Oscillators等,现有20余项并计划扩展至160余项。
基准实验采用8种LLM、9项任务、2000次函数评估、50秒单次超时和3次独立运行。以GPT-4o-Mini为例,EoH、FunSearch和(1+1)-EPS在多数任务上超过随机采样;EoH与FunSearch通常因多样性控制更稳健,而(1+1)-EPS受贪婪机制影响更大。结果也提醒我们,HumanEval或MMLU更高不代表算法设计一定更好。LLM4AD的价值因此不只是自动生成代码,而是建立可扩展、可比较和更安全的LLM算法研究环境。
深度分析
研究背景
LLM辅助算法设计已从代码生成扩展到启发式搜索、数学发现和科学方程发现。代表性工作包括EoH、FunSearch、(1+1)-EPS、MEoH、ReEvo和LLM-SR,但它们通常拥有不同的提示模板、评估脚本和模型接口。研究者因此难以复现实验,也无法判断提升来自搜索方法、LLM还是任务实现。LLM4AD试图提供共同底座。
核心问题
核心问题是如何让LLM稳定地产生可执行且高质量的算法,而不是偶然生成一段代码。随机采样缺少反馈利用;单一搜索策略难以适配组合优化、强化学习和科学发现;生成代码还可能死循环、超时或破坏实验流程。平台必须同时解决搜索、调用、评估、安全和比较标准化问题。
核心创新
- ��统一框架:将Search Methods、LLM Interface和Evaluation Interface解耦,支持用户替换任一模块。
- ��搜索集合:集成Sampling、Tabu Search、Simulated Annealing、EoH、FunSearch、(1+1)-EPS及NSGA-II、MOEA/D。
- ��任务生态:覆盖优化、机器学习和科学发现,提供20余项任务并规划160余项。
- ��安全与可用性:加入超时、保护除法、可选Numba加速、Profiler、GUI和文档,降低实验门槛。
方法详解
- ��初始化:用户选择LLM、搜索器、任务模板和评估预算;模板包含导入、函数签名、文档字符串及示例实现。
- ��生成:Sampler通过OpenAI格式HTTPS接口或本地transformers/vLLM调用LLM,并支持并行采样。
- ��搜索:候选算法组成种群;EoH采用遗传式演化,FunSearch采用岛模型,(1+1)-EPS保留改进个体;多目标场景可用MEoH、NSGA-II或MOEA/D。
- ��评估:每个候选在任务实例上执行,得到目标分数;沙箱执行超时控制、非法代码防护和可选加速。
- ��反馈:Profiler记录日志、收敛曲线和最优算法,搜索器根据适应度选择精英并继续迭代。
实验设计
实验选取ACRO、CAR、CVRP、OBP、TSP、VRPTW、BACT、SET和OSC九项任务,覆盖机器学习、组合优化和科学发现。比较随机采样、EoH、FunSearch与(1+1)-EPS,并使用8种LLM。统一设置为2000次函数评估;EoH种群规模为10,FunSearch使用10个岛、每次提示4个样本;每次评估最多50秒,所有实验运行3次。
结果分析
GPT-4o-Mini结果显示,EoH、FunSearch和(1+1)-EPS在多数任务上优于Random Sampling。Mountain Car的算法差距较小,OSC、SET、TSP和VRPTW则差距明显,说明任务复杂度不同。EoH和FunSearch的多样性控制带来较稳定的收敛;(1+1)-EPS的贪婪更新使其性能更依赖任务。8种LLM之间也存在任务相关差异,没有单一模型在所有任务上显著领先。
应用场景
研究者可用它自动生成CVRP、TSP、OBP等启发式,也可设计Acrobot、Cart Pole等控制策略,或搜索Bacterial Growth、ODE和Feynman符号回归任务的程序。工业团队可将内部目标函数封装为Evaluation子类,再提供安全模板,让LLM搜索排程、路由或代理策略。使用前需明确评价指标、输入输出接口和安全边界。
局限与展望
平台的可比性仍受提示、随机种子、模型服务和预算影响;2000次评估可能不足以覆盖复杂搜索空间。论文没有报告每个任务的完整数值表、调用成本、token消耗或统计显著性,也没有理论保证生成算法一定收敛。未来应扩展160余项任务,支持GUI批量实验,并加入成本约束、迁移学习、程序验证、可解释性和跨实例泛化测试。
通俗解读 非专业人士也能看懂
把LLM4AD想成一个会设计菜谱的智能厨房。过去,厨师要自己想配方、买材料、做菜、评分,再决定是否重来;不同厨师还使用不同评分标准,所以很难知道谁真的更好。LLM4AD把厨房、评委和记录员统一起来。
LLM负责提出新菜谱,也就是新的算法。搜索方法像不同的改菜策略:随机采样是不断试新菜,EoH和FunSearch像保留好菜、混合优点并继续改良的厨师,(1+1)-EPS则像只保留比上一道更好的版本。评估沙箱是安全厨房:每道菜只能做规定时间,不能无限等待,也不能破坏炉具。
平台还提供许多“食材和比赛”:路线规划、装箱、机器人控制、细菌生长和科学公式。研究者可以换模型、换改良策略、换评分标准,却仍使用同一套记录方式。实验表明,单纯让模型反复想法通常不如让模型和搜索策略合作;但最强的写代码模型也不一定总能做出最好的算法。
简单解释 像给14岁少年讲一样
想象你在玩一款“发明游戏策略”的游戏。你可以让AI写出一种打法,比如怎样更快装箱、怎样规划送货路线,或者怎样让小车爬上山。但AI第一次写出的办法可能很笨,甚至会卡死。LLM4AD就像一个专门的训练场:AI不断提出新打法,系统自动试玩、打分,再留下表现好的打法。
这里有不同的训练教练。Random Sampling只是不断抽签尝试;EoH和FunSearch会把好点子保存下来,再组合和修改;(1+1)-EPS则像只接受“比当前纪录更好”的新策略。系统还有安全裁判,如果某个程序跑太久、出错或无限循环,就停止它。
研究者用它测试了8种AI模型和9个任务,包括Acrobot、Mountain Car、CVRP、TSP、OBP、BACT、SET和OSC。总预算是2000次评估,每次最多50秒,并重复3次。结果显示,带搜索教练的方法大多数时候比随机尝试更好,但不同任务喜欢不同模型和策略。
最酷的地方是,这个平台像一个共享实验室。大家可以用同样的规则比较方法,也能加入自己的任务、模型和搜索器。不过它还不是魔法:实验次数有限,模型会随机犯错,调用成本也可能很高。未来它或许能帮助工程师、科学家甚至学生发现更聪明的解决方案!
术语表
Large Language Model(大语言模型)
能够根据文本提示生成代码、解释或方案的模型。论文用它提出候选算法,而不是直接把一次输出当作最终答案。
LLM Interface统一调用GPT、Claude、Llama、Qwen等远程或本地模型。
Algorithm Design(算法设计)
为特定问题构造解决步骤、规则或程序。其质量由目标函数、运行效率和约束满足情况共同决定。
平台将算法设计表示为可执行程序的生成与评估过程。
EoH
Evolution of Heuristics,一种让LLM生成并进化启发式算法的方法。它通过种群和精英保留维持候选多样性。
基准中EoH在多数任务上优于随机采样。
FunSearch
结合程序搜索与LLM生成的算法,采用岛模型维护多个搜索群体。不同岛屿可探索不同程序方向。
平台将其作为单目标搜索方法,并设置10个岛和每次提示4个样本。
Evaluation Sandbox(评估沙箱)
隔离且可配置的代码执行环境。它通过超时、错误处理和安全机制防止候选程序干扰搜索流程。
每个算法最多评估50秒,并支持保护除法和可选Numba加速。
Function Evaluation(函数评估)
运行候选算法并计算其目标分数的一次操作。评估次数是搜索预算的重要组成部分。
主要基准统一使用最多2000次函数评估。
开放问题 这项研究留下的未解疑问
- 1 尚不清楚如何预测某个LLM在特定算法任务上的可靠性;HumanEval和MMLU与实际设计表现并不一致,需要任务感知的模型选择指标。
- 2 平台尚未充分量化API费用、token消耗与性能收益的关系。未来需要成本—质量—时间三维基准。
- 3 生成算法能否迁移到未见实例和真实工业数据仍缺乏证据,需要跨任务、跨分布和长期部署评估。
应用场景
近期应用
自动生成物流启发式
物流研究者可将CVRP、TSP、OBP或VRPTW的目标函数封装进Evaluation接口,再用EoH或FunSearch生成路线和装箱规则。通过50秒超时与统一实例评估,可快速筛选比人工基线更有潜力的候选方案。
科学程序搜索
科学计算团队可利用BACT、OSC、ODE和SRSD-Feynman任务验证符号表达式或动力学程序。研究者需提供清晰的输入输出类型、文档字符串和安全执行边界,平台负责生成、运行、记录和比较。
远期愿景
领域专用算法实验室
企业可把内部排程、仓储或控制问题接入平台,使LLM成为持续搜索算法的自动化研究员。若结合成本约束、历史实验和迁移学习,系统可能形成面向业务的算法资产库。
可验证的科学发现系统
未来平台可将程序搜索、形式验证、物理约束和实验数据结合,自动提出可解释的科学模型。主要障碍包括生成结果的可信性、跨实验泛化、计算成本和责任审计。
原文摘要
We introduce LLM4AD, a unified Python platform for algorithm design (AD) with large language models (LLMs). LLM4AD is a generic framework with modularized blocks for search methods, algorithm design tasks, and LLM interface. The platform integrates numerous key methods and supports a wide range of algorithm design tasks across various domains including optimization, machine learning, and scientific discovery. We have also designed a unified evaluation sandbox to ensure a secure and robust assessment of algorithms. Additionally, we have compiled a comprehensive suite of support resources, including tutorials, examples, a user manual, online resources, and a dedicated graphical user interface (GUI) to enhance the usage of LLM4AD. We believe this platform will serve as a valuable tool for fostering future development in the merging research direction of LLM-assisted algorithm design.