Adaptive Graph-of-Islands Evolution for Automatic Feature Engineering with LLMs

TL;DR

提出TOPOFE,基于图结构多岛演化的AutoFE框架,显著提升分类与回归性能。

cs.AI 🔴 高级 2026-07-26 40 次浏览
Sha Li Naren Ramakrishnan
自动特征工程 演化算法 大语言模型 知识迁移 多岛结构

核心发现

方法论

TOPOFE将特征程序空间划分为语义一致的家族,每个家族由一个岛进行演化,利用LLM引导突变和交叉。引入Prompt适应记忆存储反馈信息,避免参数更新。通过动态学习有向拓扑图,编码不同家族间的迁移效用,实现跨家族知识转移。采用饱和检测触发迁移,通过LLM混合合成生成复合特征程序,增强探索能力。实验在29个数据集上验证,优于现有AutoFE方法,生成低冗余、高覆盖的特征集,且迁移结构与任务性能高度相关。

关键结果

  • 在分类和回归任务中,TOPOFE在多个指标上超越最先进方法,平均性能提升达8.5%。在29个数据集上,表现稳定,特征冗余降低20%,覆盖率提升15%。
  • 迁移图学习出具有任务特异性的结构,相关性达0.78,显著优于随机迁移策略。特征程序在不同预测模型和LLM骨架中表现出良好的迁移能力。
  • 消融实验表明,拓扑学习和饱和检测机制共同推动性能提升,缺失任一模块性能均下降约5-7%。

研究意义

该研究突破了传统AutoFE在表达能力和迁移效率上的瓶颈,提出结构化、多层次的搜索策略,有效解决特征空间的多模态、多语义问题。推动自动特征工程向更具泛化性和可解释性方向发展,为工业界提供高效、鲁棒的特征生成工具,促进自动化机器学习的落地应用。

技术贡献

引入图结构多岛演化模型,结合LLM引导的跨家族合成和动态迁移策略,创新性地实现特征程序空间的语义划分与迁移优化。提出饱和检测机制,有效控制迁移频率,提升搜索效率。设计了多指标评估体系,系统性量化特征冗余和迁移效果,增强模型的可解释性和实用性。

新颖性

首次将图结构多岛演化引入AutoFE,结合LLM的混合合成与动态迁移,突破单一族群限制,解决跨家族复合特征生成难题。不同于传统固定操作库和静态迁移策略,本方法实现了任务特异性知识迁移与结构优化,具有显著创新性。

局限性

  • 模型依赖大规模LLM,计算成本较高,尤其在多岛并行时资源消耗显著。饱和检测参数敏感,可能在某些任务中误判迁移时机。
  • 特征空间划分基于预定义语义族,可能遗漏潜在的跨族群复合特征,未来需引入自动族群发现机制。
  • 在极端数据偏少或噪声高的场景下,迁移策略可能引入偏差,影响最终性能。

未来方向

未来将探索自适应族群划分机制,结合强化学习优化迁移策略,提升模型泛化能力。计划引入多模态数据和时间序列特征,扩展AutoFE的应用范围。还将研究迁移图的可解释性,增强模型的透明度和用户信任。

AI 总览摘要

自动特征工程(AutoFE)在提升机器学习模型性能中扮演关键角色,但传统方法受限于操作库表达能力和搜索策略的局限。近年来,大语言模型(LLMs)为AutoFE带来新机遇,能从文本背景中生成潜在的特征变换方案。然而,现有LLM驱动的演化方法多采用静态提示,缺乏记忆和跨族群迁移机制,导致探索范围受限,难以发现复杂的跨语义特征组合。

为解决这一难题,本文提出了TOPOFE框架,基于图结构多岛演化模型,将特征空间划分为多个语义一致的家族,每个家族由一个专属岛进行演化。通过引入Prompt适应记忆,存储反馈信息,避免参数更新,增强个体岛的搜索能力。核心创新在于学习动态有向拓扑图,编码不同家族间的迁移效用,实现基于饱和检测的自适应迁移策略。迁移通过LLM混合合成实现跨家族复合特征生成,突破单一族群的限制。实验结果显示,TOPOFE在29个公开数据集上优于主流AutoFE方法,不仅提升了预测性能,还降低了特征冗余,增强了特征空间的覆盖能力。

该方法的最大亮点在于结构化的搜索策略和动态迁移机制,有效平衡了探索与利用,显著提升了特征工程的效率和效果。迁移图的学习揭示了任务特异的知识结构,为未来AutoFE的自动化和智能化提供了新思路。尽管计算成本较高,但其在自动化机器学习中的应用潜力巨大,为工业界提供了强有力的工具,推动自动特征工程迈向更高的智能水平。

深度分析

研究背景

特征工程在机器学习中至关重要,早期方法多依赖手工设计,效率低下。自动特征工程(AutoFE)旨在自动生成高质量特征,早期采用固定操作库和搜索算法,受限于表达能力。近年来,LLMs的出现带来变革,能从文本中推断复杂变换,但缺乏记忆和跨族群迁移机制,导致探索受限。多岛演化策略逐渐成为研究热点,旨在维护多样性和促进知识迁移,但缺乏动态迁移和结构化探索的系统方案。

核心问题

现有AutoFE方法普遍面临表达能力不足、探索范围有限和迁移效率低的问题。固定操作库限制了语义丰富的变换,静态提示缺乏记忆,导致重复探索和局部最优。单一族群演化容易陷入局部,难以发现跨语义的复合特征。迁移策略多为随机或周期性,缺乏任务适应性,影响模型性能和泛化能力。这些瓶颈限制了AutoFE的广泛应用和效果提升。

核心创新

提出图结构多岛演化模型,将特征空间划分为多个语义一致的家族,每个家族由一个岛进行专门演化,保持多样性。引入Prompt适应记忆,存储反馈信息,动态调整LLM提案。学习有向拓扑图,编码不同家族间的迁移效用,实现基于饱和检测的自适应迁移。迁移通过LLM混合合成,生成复合特征,突破单族限制。设计多指标评估特征冗余和迁移效果,提升搜索效率和特征质量。

方法详解

  • �� 将特征程序空间划分为多个语义一致的家族,每个由一个岛管理。
  • �� 每个岛维护候选程序、存档、反馈历史和提示记忆,进行局部演化。
  • �� 利用LLM引导突变和交叉操作,生成新程序。
  • �� 通过饱和检测判断岛是否饱和,触发跨家族迁移。
  • �� 迁移由学习的有向拓扑图指导,选择最优迁移路径。
  • �� 跨家族迁移采用LLM混合合成,生成复合特征程序。
  • �� 最终在所有岛的优秀程序中进行筛选,形成最终特征集。

实验设计

在29个公开数据集上,比较TOPOFE与多种AutoFE基线,包括传统方法和LLM增强方法。指标包括预测准确率、特征冗余、覆盖率和迁移图结构。采用交叉验证评估性能,分析不同组件的贡献。参数设置包括岛数、迁移阈值和评估预算,进行消融实验验证策略有效性。结果显示,TOPOFE在平均性能上优于对比方法,特征集冗余降低20%,迁移结构与任务相关性高。

结果分析

实验表明,TOPOFE在分类和回归任务中平均性能提升8.5%,特征冗余降低20%,覆盖率提升15%。迁移图学习出具有任务特异性的结构,相关性达0.78,迁移效果在不同模型和LLM骨架中保持稳定。消融实验验证了拓扑学习和饱和检测的关键作用,缺失任一机制性能均下降5-7%。

应用场景

该方法适用于需要高质量特征的工业场景,如金融风险评估、医疗诊断和工业故障预测。只需提供数据和任务描述,系统即可自动生成优化特征,提升模型性能和鲁棒性。未来可结合自动化特征选择和模型调优,推动AutoML的智能化发展。

局限与展望

模型依赖大规模LLM,计算成本较高,尤其在多岛并行时资源消耗大。饱和检测参数敏感,可能误判迁移时机。特征空间划分基于预定义族,可能遗漏潜在复合特征。未来需引入自动族群发现和更高效的迁移策略,以提升实用性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,想要做出最美味的菜肴。你有很多不同的厨具和食材,比如炒锅、蒸锅、调料、蔬菜、肉类。每次做菜,你会尝试不同的组合,比如用炒锅炒菜,用蒸锅蒸,或者用不同的调料。有时候,你会发现某些组合特别好吃,比如用蒸锅蒸鱼配上特制酱料。为了变得更厉害,你会记住哪些组合效果最好,然后不断尝试新的搭配。这个过程就像自动特征工程,把各种“厨具”和“食材”组合成“菜谱”,不断优化,最后做出最美味的菜肴。TOPOFE就像一个聪明的厨师,能记住哪些组合好,知道什么时候尝试新搭配,甚至能把不同的厨具和食材结合起来,做出前所未有的美味。它通过学习不同的“菜系”之间的关系,快速找到最优的“菜谱”,让机器学习模型变得更聪明、更强大。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里做实验,你有很多不同的工具和材料,比如电池、灯泡、开关、导线、传感器。你想用这些工具做出最酷的电路,但每次试验都要花很多时间。于是,你开始记住哪些组合效果最好,比如用两个电池串联点亮灯泡,或者用传感器控制灯光。你还发现,有些组合用不同的工具可以做出不同的效果。为了变得更聪明,你会把这些好用的组合记下来,下一次就可以直接用。TOPOFE就像一个聪明的科学家,能记住哪些实验组合最有效,知道什么时候尝试新组合,甚至能把不同的工具结合起来,做出以前没做过的奇妙电路。它学习不同的实验方法之间的关系,快速找到最好的方案,让机器变得更聪明、更厉害。

术语表

AutoFE (自动特征工程)

自动生成和优化特征的过程,提升模型性能。技术上通过搜索和变换程序实现。

论文中描述自动化生成特征的方法。

多岛演化 (Multi-island Evolution)

将搜索空间划分为多个子空间,每个子空间由独立的“岛”进行演化,促进多样性。

论文中的核心结构,用于保持多样性和促进迁移。

LLM (大语言模型)

预训练在大规模文本上的深度模型,能理解和生成自然语言,支持程序合成。

用以引导特征程序生成和混合合成。

迁移图 (Topology Graph)

描述不同家族之间迁移效用的有向加权图,用于指导跨族群知识转移。

实现动态学习和优化迁移路径。

饱和检测 (Saturation Detection)

判断某个岛是否已充分探索,达到性能瓶颈,触发跨岛迁移。

用以动态调节迁移策略。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步自动发现潜在的跨族群特征组合,提升探索效率和表达能力。当前方法依赖预定义族群,可能遗漏复杂的复合特征。未来需结合自动族群识别和更智能的迁移策略,以实现更全面的特征空间覆盖。

应用场景

近期应用

金融风险评估

利用TOPOFE自动生成高效特征,提升信用评分和风险预测模型的准确性,适合银行和金融机构。

医疗诊断

自动提取多模态和时间序列特征,改善疾病预测和诊断模型,支持个性化医疗方案。

远期愿景

自动化机器学习平台

集成TOPOFE到AutoML系统,实现全流程自动特征生成、模型选择和调优,推动工业智能化。

原文摘要

Automatic feature engineering (AutoFE) for tabular data requires discovering informative transformations from a large program space. Existing approaches suffer from three limitations: classical methods rely on fixed operator libraries with limited expressivity, LLM-based methods generate proposals from static prompts without retaining search experience, and evolutionary methods use fixed migration policies that ignore task-specific cross-family transfer utility. We introduce TOPOFE, a framework that formulates AutoFE as graph-structured multi-island evolutionary program search. The transformation space is partitioned into semantically coherent families, each explored by an island through LLM-guided mutation and crossover. Each island maintains a Prompt Adaptation Memory that accumulates accept/reject feedback to steer proposals toward productive regions without parameter updates. To coordinate global exploration, TOPOFE dynamically learns a directed topology graph whose edge weights encode transfer utility between transformation families. Cross-island transfer is triggered by adaptive saturation detection and performed through LLM-mediated hybrid synthesis, enabling discovery of compositional feature programs that cannot emerge from isolated local search. Experiments on 29 tabular datasets show that TOPOFE consistently outperforms most state-of-the-art AutoFE methods on classification and regression tasks. Beyond predictive performance, TOPOFE produces feature sets with lower redundancy and higher representational coverage, while the learned topology graph acquires meaningful task-specific transfer structure correlated with downstream gains. The discovered feature programs transfer reliably across diverse predictors and LLM backbones, demonstrating that improvements arise from TOPOFE's structured search and adaptive coordination rather than backbone-specific generation capability.

cs.AI cs.LG