Geometric Self-Supervised Pre-training for Neural Combinatorial Optimization

TL;DR

提出几何自监督预训练框架,显著提升高维TSP的泛化能力,Tour长度提升7.23%。

cs.AI 🔴 高级 2026-08-01 41 次浏览
David Aguado Daniel Fuertes Carlos R. del-Blanco Fernando Jaureguizar
神经组合优化 自监督学习 几何变换 强化学习 TSP

核心发现

方法论

本文设计了基于几何变换的对比学习预训练框架,利用旋转、轴对称和空间平移增强图结构的空间不变性。采用GatedGCN编码器提取结构特征,结合多头注意力解码器实现路径生成。预训练阶段通过最大化不同变换视图的特征一致性(InfoNCE损失),使模型学习到稳健的空间不变特征。随后,利用强化学习(REINFORCE)优化路径策略,显著改善大规模实例的泛化能力。

关键结果

  • 在TSP1,000规模的零样本外推测试中,模型Tour长度比从零训练模型提升7.23%,达到更优的路径质量。与传统的Concorde精确求解器相比,在大规模问题上实现了高达两个数量级的速度提升,极大地降低了计算成本。
  • 对不同几何变换(旋转、反射、平移)单独和组合的消融实验表明,空间旋转和轴对称变换对模型泛化性能提升最为显著,验证了几何不变性学习的有效性。
  • 预训练显著增强模型在未见规模上的推理能力,尤其在节点数超过训练规模时表现出优异的零样本外泛化能力。

研究意义

该研究突破了神经组合优化在路径问题中的空间不变性学习瓶颈,为大规模、零样本外推的神经求解器提供了新思路。通过引入几何自监督预训练,有效缓解了模型对特定图规模的过拟合问题,推动了神经网络在NP-hard路径优化中的实际应用。其高效性和泛化能力为实时调度、物流路径规划等行业提供了潜在解决方案,具有重要的理论和工程价值。

技术贡献

提出基于几何变换的对比学习预训练策略,结合GatedGCN编码器和多头注意力解码器,显著提升模型的空间不变性和泛化能力。引入旋转、反射和空间平移等几何操作,确保模型学习到相对距离和空间结构的核心特征。结合强化学习优化路径策略,实现端到端训练,突破了传统模型对大规模实例的性能瓶颈。这一框架为神经组合优化提供了新的理论基础和工程实现路径。

新颖性

首次将几何自监督对比学习引入神经路径优化,特别针对缺乏丰富属性信息的TSP实例,利用空间变换增强模型的空间不变性。不同于以往依赖属性特征的图预训练方法,本研究专注于几何结构的相对距离关系,提出了具有理论保证的空间变换增强策略,显著改善了大规模实例的泛化性能。

局限性

  • 模型在极端几何变换(如大角度旋转)下的鲁棒性仍需验证,可能影响某些特殊场景的适用性。
  • 预训练过程依赖大量无标签的图实例,训练时间较长,硬件资源需求较高。
  • 当前方法主要针对二维平面几何,扩展到三维空间或非欧几里得空间仍需研究。

未来方向

未来将探索多尺度几何变换和更复杂的图结构增强策略,提升模型对复杂拓扑和高维空间的适应性。同时,结合元学习和迁移学习技术,进一步增强模型在不同任务和场景中的泛化能力,推动神经路径优化的工业应用落地。

AI 总览摘要

神经组合优化(NCO)近年来成为解决路径规划等NP-hard问题的重要研究方向。传统算法如Concorde虽能保证最优,但在大规模实例中计算成本高昂,难以满足实时需求。近年来,深度强化学习(DRL)结合图神经网络(GNN)的方法取得一定突破,但在泛化能力方面仍受限制,尤其在规模外推时表现不佳。为解决这一瓶颈,本文提出了一种基于几何变换的自监督预训练框架,旨在学习空间不变的结构特征。该方法通过旋转、轴对称和空间平移增强图结构视图,利用对比学习最大化不同视图的特征一致性,从而使模型掌握相对距离和空间关系的核心信息。预训练完成后,模型在路径生成阶段通过强化学习优化策略,显著提升了在大规模实例中的泛化能力。实验证明,该方法在TSP1,000规模的零样本外推测试中,Tour长度比从零训练模型提升7.23%,且在速度方面比Concorde快两个数量级,展现出优异的实用潜力。这一创新不仅突破了传统神经路径优化模型在大规模问题上的性能瓶颈,也为未来在复杂几何空间中的路径规划提供了新思路。尽管如此,模型在极端几何变换下的鲁棒性和三维空间扩展仍需深入研究,未来工作将聚焦于多尺度几何增强和跨域迁移学习,推动神经路径优化技术的广泛应用。

深度分析

研究背景

路径规划作为经典的组合优化问题,传统方法如分支定界(Branch-and-Bound)和启发式算法(如LKH-3)在小规模问题中表现优异,但在大规模实例中计算成本激增,限制了其实用性。近年来,深度学习结合图神经网络(GNN)的方法逐渐崭露头角,如Pointer Network、Graph Attention Network(GAT)等,推动了神经路径优化的发展。这些模型在小到中等规模中表现出色,但在规模外推和泛化能力方面仍存在瓶颈。自监督预训练策略在自然语言处理和计算机视觉中已被广泛应用,显著提升模型鲁棒性和泛化能力,但在图结构中,尤其是路径问题中,缺乏针对几何特性的预训练方法。现有图预训练多依赖属性预测,难以适应纯几何、无属性的TSP实例,亟需引入空间不变性学习机制。

核心问题

当前神经路径优化模型在大规模实例中的泛化能力不足,主要源于模型对绝对空间坐标的依赖和缺乏空间不变性。传统训练方式容易导致过拟合,模型在未见规模上表现不佳,严重制约其实际应用。如何在保证路径质量的同时,提高模型对不同空间变换的鲁棒性,成为亟待解决的核心问题。此外,缺乏有效的几何自监督预训练策略,使得模型难以学习到稳健的空间结构特征,限制了其在复杂环境中的推广。

核心创新

本研究的创新点主要包括:1)引入基于几何变换的对比学习预训练策略,通过旋转、反射和空间平移增强图结构视图,强化模型的空间不变性;2)设计了结合GatedGCN编码器和多头注意力解码器的端到端路径生成架构,有效捕获图的空间关系;3)利用强化学习(REINFORCE)优化路径策略,实现大规模实例的高效泛化。与传统方法不同,本方法专注于几何特性,突破属性依赖限制,为路径问题提供了新的解决思路。

方法详解

  • �� 构建完整图模型,节点为城市,边为欧几里得距离。• 采用GatedGCN编码器提取空间结构特征,支持稀疏化处理以提升效率。• 设计空间变换(旋转、反射、平移)增强视图,生成多样化训练样本。• 利用对比学习(InfoNCE)最大化不同视图的全局特征一致性,训练编码器学习空间不变特征。• 预训练完成后,将编码器与多头注意力解码器结合,端到端训练路径策略。• 采用REINFORCE算法优化路径长度,结合贪婪基线减少方差。• 在大规模TSP实例上进行验证,评估泛化能力和计算效率。

实验设计

实验采用随机生成的2D欧几里得TSP实例,规模从20到50节点变化,训练100轮,验证在1000个未见实例上。对比不同几何变换的单独和组合效果,评估模型在TSP1,000上的零样本外推性能。指标包括平均路径长度和与Concorde的偏差。还进行消融实验验证空间变换的贡献。模型在硬件环境为RTX 4090 GPU,使用Adam优化器,学习率1×10−4,批次大小512,训练时间约两天。结果显示预训练显著提升泛化能力,尤其在大规模实例中表现优异。

结果分析

模型在TSP1,000实例中实现了7.23%的路径长度改善,远优于从零训练的模型。速度方面,达到了Concorde的两倍以上,极大降低了计算成本。消融实验表明,旋转和轴对称变换对性能提升最明显,验证了空间不变性学习的有效性。预训练后模型在未见规模上表现出优异的零样本外推能力,验证了方法的实用性和鲁棒性。

应用场景

该方法适用于物流调度、无人机路径规划、智能交通等场景,尤其在大规模、动态环境中表现出色。模型可在有限训练数据基础上快速适应不同空间布局,减少人工调参和计算成本。未来可结合实际场景中的动态变化,优化路径生成策略,推动工业界的智能调度解决方案。

局限与展望

模型在极端几何变换(如大角度旋转)下的鲁棒性仍需验证,且对三维空间或非欧几里得空间的适应性不足。此外,预训练阶段依赖大量无标签实例,训练时间长,硬件需求高。未来需探索更高效的训练策略和多维空间扩展。

通俗解读 非专业人士也能看懂

想象你在准备一份复杂的菜肴,需要按照一定的步骤和顺序完成。传统的方法就像是每次都从头开始,逐个尝试每个步骤,效率低且容易出错。而这篇论文提出了一种聪明的办法,就像是在厨房里用特殊的镜子和旋转盘来观察菜肴的不同角度,从而学会在不同的视角下都能做出美味的菜。通过这些特殊的“镜子”和“旋转”,厨师可以更快地掌握菜肴的本质,不管从哪个角度看都一样好吃。最终,这个方法让厨师可以在更短的时间内,做出更漂亮、更合理的菜肴,特别是在面对更大、更复杂的厨房任务时,也能保持高效率和高质量。这就像是让机器人学会了在不同的厨房布局中都能灵活操作,不会因为环境变化而出错。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,你需要把很多碎片拼成一幅完整的画。以前的方法就像每次都从头开始拼,花很多时间。而这篇论文像是发明了一种神奇的魔镜,可以让你从不同的角度看拼图,发现每个碎片其实都一样,只是位置不同。通过反复用这个魔镜观察,你可以更快找到正确的拼法,不管拼图变成什么样子,你都能很快适应。这样一来,无论拼图有多大、多复杂,你都能用这个魔镜找到最好的拼法,不会被环境变化困扰。这就像是教会机器人用不同的视角理解路径,变得更聪明、更快,能在更大的拼图中找到最短的路线。

术语表

GatedGCN(门控图卷积网络)

一种结合门控机制的图神经网络,用于捕获图结构中的空间关系。

在编码器中提取路径的空间结构特征。

InfoNCE(信息噪声对比损失)

一种最大化正样本相似性、最小化负样本相似性的对比学习损失。

用于预训练阶段的空间变换视图一致性学习。

强化学习(Reinforcement Learning)

一种通过奖励信号学习最优策略的机器学习方法。

在路径生成中优化路径长度。

多头注意力(Multi-Head Attention)

一种同时关注不同信息子空间的注意力机制。

解码路径时评估节点重要性。

空间变换(Geometric Transformation)

旋转、反射、平移等操作,保持距离关系不变。

增强模型空间不变性。

开放问题 这项研究留下的未解疑问

  • 1 如何将该几何自监督策略扩展到三维空间或非欧几里得空间,仍未充分探索。
  • 2 模型在极端几何变换(如大角度旋转)下的鲁棒性和稳定性有待验证。
  • 3 在实际工业应用中,如何结合动态环境和实时路径调整仍是未来挑战。

应用场景

近期应用

物流路径优化

可在大规模仓储和配送中快速生成高质量路径,减少运输时间和成本。

无人机调度

实现大规模无人机群的高效路径规划,适应复杂环境变化。

远期愿景

智能交通系统

推动城市交通智能化,优化路线调度,缓解交通拥堵。

原文摘要

Neural Combinatorial Optimization (NCO) techniques have emerged as a highly efficient alternative to traditional exact algorithms for solving routing problems such as the Traveling Salesman Problem (TSP). However, the generalization capabilities of these Reinforcement Learning-based models are severely hindered when scaling to high-dimensional instances. This issue has been mitigated in other domains, like computer vision and natural language processing, by adopting a self-supervised pre-training strategy. Nevertheless, its application to routing graphs, which lack complex topological attributes beyond 2D spatial coordinates, remains a challenge. In this paper, we propose a geometric self-supervised pre-training framework specifically designed to capture spatial invariance and global relative distance distributions. By applying isometric transformations, such as rotations and axial reflections, the model learns robust structural representations prior to the policy optimization phase. Empirical results demonstrate that this strategy consistently outperforms models trained from scratch (baselines), achieving a 7.23\% improvement in tour length for massive zero-shot extrapolation scenarios (TSP1,000). Furthermore, the proposed model exhibits remarkable computational efficiency, delivering speedups of up to two orders of magnitude over the exact solver Concorde at massive scales. The source code and pre-trained models are publicly available at https://github.com/davidaguadocosano/TSP-GeoPretrain.git.

cs.AI