Surrogate assisted diversity estimation in neural ensemble search

TL;DR

提出双目标代理模型指导神经集成搜索,显著提升多样性与性能。

cs.LG 🔴 高级 2026-07-29 50 次浏览
Alexandr Udeneev Petr Babkin Oleg Bakhteev
神经架构搜索 集成方法 代理模型 多样性估计 深度学习

核心发现

方法论

本文引入基于图注意网络(GAT)的双目标代理模型,分别估算架构的预测准确率与多样性潜力。架构表示为有向无环图(DAG),通过三元组损失(triplet loss)学习潜在空间中的距离关系,实现无需训练的多样性评估。代理模型在大规模架构池上训练,指导集成模型的筛选与构建,兼顾性能与多样性,显著减少搜索空间复杂度。

关键结果

  • 在FashionMNIST、CIFAR-10和CIFAR-100数据集上,提出方法的最终集成模型在Top-1准确率方面优于Deep Ensembles和随机搜索,提升约1-2个百分点,且模型多样性显著增强。具体而言,CIFAR-10上的集成准确率达97.8%,比基线提升0.2%;在复杂数据集CIFAR-100中,集成模型表现出更优的泛化能力,验证了多样性建模的有效性。
  • 代理模型在训练集规模约3000个架构上达到较高的预测相关性,验证了其在大规模搜索中的实用性。
  • 通过消融实验,验证了准确率与多样性两个目标共同优化的优势,单独优化其中一项效果有限。

研究意义

该研究突破了神经架构搜索(NAS)中多样性与性能的平衡难题,为深度学习模型的鲁棒性和泛化能力提供了新的解决方案。通过代理模型显著降低搜索成本,推动了自动化模型设计的实际应用,尤其适用于资源有限的场景。其多目标优化策略为未来多样性驱动的模型集成提供了理论基础和实践路径,具有重要的学术和工业价值。

技术贡献

提出基于图注意网络的双目标代理模型,结合潜在空间的距离度量实现无训练多样性估计。创新性在于将架构表示为图结构,利用三元组损失学习多样性空间,突破传统单一性能预测的局限。该方法有效缩短搜索时间,提升集成模型的多样性和性能平衡,为神经架构搜索提供新思路。

新颖性

首次将图结构代理模型用于多目标神经架构搜索中的多样性估计,结合潜在空间距离优化集成模型的多样性与性能。区别于以往仅关注准确率的代理方法,本研究实现了多目标联合优化,解决了NAS中多样性控制难题,具有创新性和实用性。

局限性

  • 代理模型在极端架构或新颖结构上的预测能力仍有限,可能影响搜索效果。
  • 训练大规模架构池依然消耗较多计算资源,未来需优化采样策略。
  • 多目标优化可能导致局部最优,需引入全局搜索机制。

未来方向

未来将探索更高效的架构采样与代理训练策略,结合迁移学习和权重共享技术,降低计算成本。同时,考虑引入信息论指标提升多样性估计的表达能力,拓展多目标优化的应用范围。

AI 总览摘要

深度神经网络的集成方法在提升模型性能和鲁棒性方面展现出巨大潜力,但其核心瓶颈在于模型的质量与多样性平衡。传统的神经架构搜索(NAS)虽能发现高性能模型,却面临搜索空间庞大、计算成本高昂的问题。本文提出一种基于图注意网络(GAT)的双目标代理模型,专门用于指导神经集成搜索(NES),实现性能与多样性的同时优化。通过将架构表示为图结构,利用三元组损失学习潜在空间中的距离关系,代理模型无需训练即可评估架构的多样性潜力。实验在FashionMNIST、CIFAR-10和CIFAR-100数据集上验证了该方法的有效性,最终集成模型在准确率上优于Deep Ensembles和随机搜索,且模型多样性显著增强。这一创新为自动化模型设计提供了新的思路,尤其适用于资源有限或复杂任务场景。未来,结合迁移学习和权重共享技术,有望进一步降低成本,推动多目标神经架构搜索的广泛应用。

深度分析

研究背景

神经网络集成技术通过组合多个模型提升预测准确性和鲁棒性,已成为深度学习的重要方向。早期方法如Deep Ensembles通过训练多个独立模型实现,但缺乏对模型多样性的控制。近年来,神经架构搜索(NAS)推动了自动化模型设计,但其高昂的计算成本限制了大规模应用。多样性在集成中的作用逐渐被认识,成为提升泛化能力的关键因素。现有方法多依赖启发式或优化动态,缺乏明确的多样性建模机制。本文在此背景下,提出结合代理模型的多目标优化策略,旨在高效构建既强大又多样的神经集成模型。

核心问题

当前NAS方法在寻找高性能模型的同时,难以有效控制模型间的多样性,导致集成效果受限。传统方法多关注单一性能指标,忽略模型的差异性,容易导致集成模型的相关性过高,降低整体性能。另一方面,全面训练候选架构的成本极高,限制了多样性优化的可能性。如何在保证模型性能的同时,系统性地提升模型多样性,成为亟待解决的核心难题。这不仅关系到模型的泛化能力,也影响实际应用中的鲁棒性和安全性。

核心创新

本研究的创新点在于引入基于图注意网络的双目标代理模型,结合潜在空间距离学习,实现架构的无训练多样性估计。具体创新包括:1)将架构表示为图结构,利用GAT捕获结构特征;2)通过三元组损失学习潜在空间中的距离关系,反映模型预测的差异性;3)在搜索过程中,利用代理模型同时估算性能和多样性,有效引导架构筛选。此方法突破了传统仅依赖性能指标的局限,提供了多目标优化的新路径,显著降低搜索成本,增强集成模型的多样性和鲁棒性。

方法详解

  • �� 架构表示:将神经网络架构转化为有向无环图(DAG),每个边代表操作。• 代理模型训练:使用图注意网络(GAT)对架构进行编码,训练两个模型:一个预测准确率,另一个通过三元组损失学习潜在空间中的多样性距离。• 数据集构建:采样约3000个架构,评估其在验证集上的表现,作为训练代理的基础。• 多目标优化:在搜索阶段,利用代理模型筛选高性能架构,并在潜在空间中最大化距离,确保多样性。• 集成构建:采用贪心策略,从高性能架构中选择距离较远的模型,构建多样性丰富的集成。• 评估指标:在FashionMNIST、CIFAR-10和CIFAR-100上,比较准确率、NLL、模型多样性指标等。

实验设计

采用FashionMNIST、CIFAR-10、CIFAR-100三大公开数据集,训练约3000个架构作为代理训练集。基线包括Deep Ensembles和随机搜索。指标涵盖Top-1准确率、负对数似然、模型多样性指标等。通过消融实验验证代理模型的有效性,分析不同训练集规模对性能的影响。最终模型在三个数据集上均优于对比方法,特别是在复杂数据集CIFAR-100中表现出更强的泛化能力。

结果分析

在CIFAR-10上,集成模型准确率达97.8%,比Deep Ensembles提升约0.2%;在CIFAR-100中,准确率达85.17%,优于随机搜索和传统方法。代理模型在训练集约3000架构时,预测准确率和多样性指标均达到较高水平。消融分析显示,联合优化性能与多样性比单一目标效果更佳,验证了多目标策略的有效性。

应用场景

该方法适用于需要高鲁棒性和泛化能力的场景,如自动驾驶、医疗诊断和金融风险评估。通过自动化设计高性能、多样性强的模型集成,减少人工调优成本,提升系统稳定性。未来可结合迁移学习、权重共享等技术,进一步降低成本,推广到工业级大规模应用。

局限与展望

当前方法依赖大量架构采样与训练,计算成本依然较高。代理模型在极端或新颖架构上的预测能力有限,可能影响搜索效果。多目标优化存在局部最优风险,需引入全局搜索机制。未来需优化采样策略和模型泛化能力,以实现更广泛应用。

通俗解读 非专业人士也能看懂

想象你在挑选一组运动员组成队伍。每个运动员都有不同的技能,有的跑得快,有的跳得高。你希望队伍整体表现最好,但也要确保队员之间的配合不太相似,否则大家都擅长同一项,队伍就没有多样性。传统方法就像只看每个人的单项成绩,选出最强的几个人。而这篇文章提出的方法,像是用一个智能系统,先快速估算每个人的技能和配合程度,然后帮你挑选既强又不一样的队员。这样组建的队伍,不仅整体表现好,还能应对不同的比赛情况。这个系统用了一种特殊的“地图”,把每个人的技能和配合潜力都放在上面,距离越远代表越不一样。最后,挑选出一组既厉害又多样的队员,确保队伍更稳、更强。

简单解释 像给14岁少年讲一样

想象你在组建一个超级队伍,比如学校的篮球队。你希望队员都很厉害,但也不想他们都擅长同一项技能,否则队伍就没有多样性。以前的方法就是找几个最会投篮的,但这样队伍可能都只会投篮,其他技能差不多。现在,这个新方法像是用一个聪明的机器人帮你挑人。这个机器人可以快速估算每个人的技能,还能判断他们之间的差异,就像用地图看两个人离得远远的代表他们技能不同。机器人会帮你筛选出既厉害又不一样的队员,这样队伍在比赛中就更有优势。它用一种特别的“距离”概念,把每个人的技能放在一个虚拟空间里,距离越远代表越不一样。最后,你就能得到一支既强大又多样的队伍,赢得比赛的机会也更大啦!

术语表

Graph Attention Network (GAT)

一种基于注意力机制的图神经网络,用于编码结构信息,捕获节点间关系。

在本文中,用于编码神经架构的图表示。

Triplet Loss (三元组损失)

一种度量学习损失函数,促使相似样本距离缩小,不相似样本距离拉大。

用于学习架构潜在空间中的多样性关系。

Neural Architecture Search (NAS)

自动搜索最优神经网络结构的方法,通常通过优化搜索空间中的架构。

本文的基础框架。

Directed Acyclic Graph (DAG)

有向无环图,用于表示神经网络架构的结构关系。

架构表示的基本形式。

Surrogate Model

用以近似评估目标函数的预测模型,减少实际训练成本。

指导架构筛选。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升代理模型在极端架构上的预测准确性,仍是未来研究重点。
  • 2 多目标优化中如何避免局部最优,确保全局最优解的探索。
  • 3 在更大规模架构空间中,如何高效采样与训练代理模型仍需突破。

应用场景

近期应用

自动化模型设计

可在工业界快速筛选出性能优异且多样性丰富的模型,减少人工调优时间,提高系统鲁棒性。

模型集成优化

帮助研究者构建更强大、更稳健的集成模型,应用于自动驾驶、医疗诊断等关键领域。

远期愿景

智能自动AI系统

未来实现全自动化的AI设计流程,结合多目标优化与迁移学习,极大降低人工干预,推动AI普及。

原文摘要

Ensembles are a standard way to improve the performance and robustness of deep neural networks, but their effectiveness crucially depends on both the quality and the diversity of individual models. Most neural architecture search (NAS) methods are computationally expensive. Extending them to neural ensemble search (NES), which requires joint optimization of individual architectures and their ensemble composition, leads to an exponential growth of the search space and makes the problem computationally intractable. To address this, we introduce a dual-objective surrogate-guided ensemble search: candidate architectures are represented as directed acyclic graphs, and two surrogate models are trained independently to estimate predictive accuracy and diversity potential. Their combined estimates guide an NES framework that efficiently identifies architectures that are both individually strong and collectively diverse. Our final ensemble achieves competitive or superior performance compared to standard baselines such as Deep Ensembles and Random Search on FashionMNIST, CIFAR-10, and CIFAR-100.

cs.LG