Towards Learning Universal Hyperparameter Optimizers with Transformers
提出OptFormer,基于Transformer的通用超参数优化器,能模仿7种算法,利用大规模真实数据提升预测与优化性能。
核心发现
方法论
本文引入OptFormer,采用T5编码器-解码器架构,将超参数调优任务序列化为文本序列,利用大规模真实调优数据训练模型。模型同时学习策略和目标函数预测,支持多任务、多空间泛化。通过模仿多种算法(如随机搜索、演化算法、贝叶斯优化)实现多策略模仿,结合不确定性估计提升预测准确性。训练目标为最大化条件对数似然,使用序列化文本作为输入,预测超参数建议和目标值。模型还结合采集函数(如EI)进行策略增强,实现在线优化。
关键结果
- OptFormer能同时模仿至少7种不同HPO算法(如随机搜索、演化策略、贝叶斯UCB),在多个公开和私有数据集上表现优异,超越高斯过程(GP)在预测对数似然和校准误差方面的性能,提升了优化效率。
- 在Google的真实调优数据库(约75万研究,平均300试验)上,OptFormer的目标函数预测具有更高的对数似然(2.12比GP的0.83)和更低的校准误差(1.11%比5.34%),显示出更强的泛化能力和不确定性估计能力。
- 结合采集函数(如EI)后,OptFormer在多个基准任务中表现出与传统贝叶斯优化相当甚至更优的调优效果,尤其在复杂搜索空间和多任务场景中展现出优势。
研究意义
该研究突破了传统贝叶斯优化在多空间、多策略场景下的局限,提出基于Transformer的通用HPO模型,为自动机器学习(AutoML)提供了强大工具。利用大规模真实调优数据,模型实现策略和目标函数的联合学习,极大提升了调优效率和泛化能力,推动HPO向更智能、更通用方向发展。这不仅丰富了元学习和迁移学习的理论体系,也为工业界自动调参、模型优化提供了新途径,具有深远的应用前景。
技术贡献
本文首次提出基于Transformer的端到端HPO框架,支持多任务、多空间、多算法的联合学习。模型通过序列化调优轨迹,将超参数调优问题转化为序列建模任务,突破传统贝叶斯优化对空间固定的限制。引入不确定性估计机制,结合采集函数实现策略增强,显著提升预测准确性和优化效率。模型在大规模真实数据上训练,展现出比高斯过程更强的泛化能力和校准性能,为未来Transformer在自动调参中的应用奠定基础。
新颖性
这是首个将Transformer应用于黑箱优化任务的研究,突破了传统方法对搜索空间和策略的限制,实现多策略模仿和联合学习。通过序列化文本输入,模型能处理不同维度、不同类型的超参数,显著扩展了AutoML的能力范围。模型结合不确定性估计和采集函数,创新性地实现策略增强和在线优化,开启了Transformer在HPO领域的全新应用路径。
局限性
- 模型对极端复杂或噪声较大的目标函数表现仍有限,特别是在超参数空间极大或数据不足时,泛化能力受限。
- 训练依赖大量真实调优数据,数据获取成本高,且模型在未见过的搜索空间或算法下的迁移能力仍需验证。
- 推理时的计算成本较传统贝叶斯优化高,尤其在高维空间中,序列解码和采集函数计算可能成为瓶颈。
未来方向
未来将探索模型在更高维度、更复杂空间中的扩展能力,结合强化学习优化策略,提升在线调优效率。同时,研究如何减少对大规模调优数据的依赖,增强模型的迁移和适应能力,推动Transformer在自动调参的广泛应用。
AI 总览摘要
超参数调优一直是机器学习模型性能提升的关键环节,传统方法如贝叶斯优化(GP)在固定空间表现优异,但面对多任务、多空间场景时存在局限。本文提出OptFormer,一种基于Transformer的通用HPO框架,能够从大规模真实调优数据中学习多策略、多空间的调优行为。通过将调优轨迹序列化为文本输入,模型实现了策略和目标函数的联合预测,支持多算法模仿和不确定性估计,显著提升了调优效率和泛化能力。在多个公开和私有数据集上的实验表明,OptFormer不仅能模仿7种不同算法,还在预测准确性和校准方面优于高斯过程。结合采集函数(如EI),其调优效果与传统贝叶斯优化相当甚至更优,特别适用于复杂、多任务场景。这一创新为AutoML和工业自动调参提供了强大工具,推动HPO向更智能、更通用的方向发展。未来,模型将在更高维度、更复杂空间中扩展,结合强化学习实现更高效的在线调优,开启Transformer在自动调参领域的崭新篇章。
深度分析
研究背景
随着自动机器学习(AutoML)兴起,超参数优化(HPO)成为提升模型性能的核心技术。早期方法如随机搜索和网格搜索简单易用,但效率低下。贝叶斯优化(如GP-UCB)引入概率模型,提高效率,但受限于固定空间和单一策略。近年来,迁移学习和多任务方法(如多任务贝叶斯优化)尝试突破空间限制,但仍面临泛化不足的问题。Transformer架构在自然语言和序列建模中表现卓越,为HPO带来新机遇。本文结合大规模真实调优数据,提出支持多策略、多空间的Transformer模型,推动HPO向更智能、更通用方向发展。
核心问题
现有HPO方法多局限于固定搜索空间和单一策略,难以应对多任务、多空间的实际场景。传统贝叶斯优化在大规模数据和多策略模仿方面表现不足,且模型泛化能力有限。如何利用大规模真实调优数据,构建支持多算法、多空间的通用模型,成为亟待解决的问题。此外,模型还需在保证预测准确的同时,提供可靠的不确定性估计,以支持策略增强和在线优化。
核心创新
提出基于Transformer的通用HPO框架,支持多策略模仿和联合学习。通过序列化调优轨迹,将不同空间和算法的调优过程转化为文本序列,突破空间固定限制。引入不确定性估计机制,结合采集函数实现策略增强,提升优化效率。模型在大规模真实调优数据上训练,展现出比传统GP更好的泛化和校准能力。创新性地将Transformer应用于黑箱优化,开启了多任务、多空间HPO的新路径。
方法详解
- �� 将调优轨迹和元信息序列化为文本,使用SentencePiece进行编码。• 采用T5 Transformer编码器-解码器架构,输入为序列化文本,输出为超参数建议和目标值。• 通过最大化条件对数似然训练模型,学习策略和目标函数的联合分布。• 利用模型预测的不确定性,结合采集函数(如EI)进行策略增强。• 训练过程中,模型同时模仿多种算法(随机、演化、贝叶斯),实现多策略泛化。• 推理时,解码超参数和目标值,支持在线策略调整。• 结合贝叶斯优化原理,提升调优效率和预测校准。
实验设计
- �� 使用Google Vizier数据库(75万研究,平均300试验)作为真实数据集,训练模型。• 在公开HPO-B(1.9K任务)和BBOB(24类合成函数)基准上验证。• 比较模型模仿多算法的能力、预测不确定性和调优性能。• 采用normalized performance指标,评估不同算法和模型的调优效果。• 进行消融实验,验证模型不同组件(如采集函数、策略模仿)的贡献。
结果分析
- �� OptFormer成功模仿至少7种HPO算法,调优轨迹与真实算法高度一致。• 在预测目标函数方面,模型在对数似然和校准误差方面优于高斯过程(GP),显著提升预测质量。• 结合采集函数后,调优效果与贝叶斯优化相当,甚至在复杂空间表现更优。• 在真实大规模调优数据上训练,模型展现出良好的泛化能力和适应性。
应用场景
- �� 可用于工业界自动调参,提升模型训练效率,减少人工调试成本。• 支持多任务、多空间的调优场景,适应复杂工业环境。• 未来可结合强化学习,实现更高效的在线调优策略,推动AutoML的智能化发展。
局限与展望
- �� 依赖大量真实调优数据,数据获取成本高。• 在极端复杂或高维空间中表现仍有限,泛化能力需提升。• 推理过程计算成本较高,特别在高维空间中存在瓶颈。
通俗解读 非专业人士也能看懂
想象你在厨房里做菜,调味料的用量和烹饪时间就像超参数。每次尝试不同的调料比例,厨师会总结出哪些搭配最好。传统方法就像用固定菜谱,只能在有限范围内调整。而这个新方法像是用一个聪明的机器人厨师,它通过学习大量厨房的经验,能理解各种不同菜谱的规律,甚至可以自己提出新的调味方案。它不仅学会了模仿不同厨师的做法,还能预测哪种调料组合最合适,帮你做出更美味的菜肴。这就像让机器人变成了厨房里的超级厨师助手,能不断学习、改进,变得越来越厉害。
简单解释 像给14岁少年讲一样
想象你在学校里参加一个科学比赛,要调节各种参数(比如温度、时间、材料)来做出最好吃的蛋糕。以前你只能试几次,慢慢找出好吃的配方。现在,有个聪明的机器人,它看过很多人做蛋糕的经验,学会了不同的调配方法。这个机器人可以帮你预测用什么材料、用多长时间最合适,还能模仿不同厨师的做法。你只需要告诉它一些信息,它就能提出建议,帮你快速做出最棒的蛋糕。这个机器人就像你的超级助手,让你变得更快、更厉害!
原文摘要
Meta-learning hyperparameter optimization (HPO) algorithms from prior experiments is a promising approach to improve optimization efficiency over objective functions from a similar distribution. However, existing methods are restricted to learning from experiments sharing the same set of hyperparameters. In this paper, we introduce the OptFormer, the first text-based Transformer HPO framework that provides a universal end-to-end interface for jointly learning policy and function prediction when trained on vast tuning data from the wild, such as Google's Vizier database, one of the world's largest HPO datasets. Our extensive experiments demonstrate that the OptFormer can simultaneously imitate at least 7 different HPO algorithms, which can be further improved via its function uncertainty estimates. Compared to a Gaussian Process, the OptFormer also learns a robust prior distribution for hyperparameter response functions, and can thereby provide more accurate and better calibrated predictions. This work paves the path to future extensions for training a Transformer-based model as a general HPO optimizer.