Hard Constraints, Smooth Gradients: Learning Feasible Inventory Policies via Differentiable Projection

TL;DR

通过可微投影学习可行库存策略,平均最优差距低于1%。

cs.AI 🔴 高级 2026-08-03 5 次浏览
Patrick Helm Jan-Niklas Doerr Joren Gijsbrechts Stefan Minner
深度强化学习 可微优化 库存管理 约束优化 多层级计划

核心发现

方法论

该研究提出了一种将可微凸优化模块嵌入策略中的方法。具体来说,神经网络生成连续动作目标,二次规划将其投影到放松的可行集合上,随后通过双重信息整数映射恢复整数性,同时保持可行性。该策略在可微模拟器上进行端到端训练,使用路径梯度处理硬约束。

关键结果

  • 在小规模实例中,该方法的平均最优差距低于1%。在较大网络中,相较于最先进的层级库存策略,性能提升高达9.75%,并且至少比滚动视野多阶段随机程序高出7.7%。
  • 在ASML的工业案例研究中,该方法将平均成本降低了3.22%,尤其在高需求波动的紧密容量系统中表现出色。
  • 消融研究表明,忽略投影敏感性会导致训练发散,而用简单的整数映射替代双重信息整数映射会增加成本。

研究意义

该研究展示了深度强化学习在具有相互依赖硬约束的序列决策问题中的经济效益,尤其在规划难度最大、需求波动大的情况下表现突出。这一方法为传统库存策略难以应对的复杂约束问题提供了新的解决方案。

技术贡献

技术贡献包括提出了一种结合可微决策规则、凸投影和双重信息整数映射的策略架构,提供了新的理论保证,确保整个可行动作空间可达,并在不进行逐状态整数规划的情况下实现端到端梯度传播。

新颖性

该方法首次将可微投影与深度强化学习结合,实现了在复杂约束条件下的可行策略学习。与现有方法相比,它在处理相互依赖的硬约束方面具有显著创新。

局限性

  • 该方法在高维度设置下的计算成本可能较高,尤其在复杂网络中。
  • 需要可微模拟器进行端到端训练,这在某些应用中可能不易实现。

未来方向

未来研究可以探索在更大规模的实例中应用该方法,并研究如何在没有可微模拟器的情况下进行训练。此外,进一步优化计算效率也是一个重要方向。

AI 总览摘要

在许多操作问题中,约束的序列决策过程具有大的组合动作空间和相互依赖的可行性约束。混合整数线性规划(MILPs)虽然灵活处理这些约束,但在随机环境中扩展性差。深度强化学习(DRL)提供了可扩展的决策规则,但现有方法要么惩罚约束而非执行,要么依赖于在约束交互时失效的可行性机制。

本文通过在策略中嵌入可微凸优化模块来弥合这一差距:神经网络提出连续动作目标,二次规划将其投影到放松的可行集合上,而双重信息整数映射在保持可行性的同时恢复整数性。给定可微模拟器,策略通过采样轨迹使用路径梯度进行端到端训练,同时以类似于MILPs的灵活性处理硬约束。

我们将该方法应用于多层级生产-库存计划,考虑共享资源和材料约束。我们的策略在小规模实例中达到平均最优差距低于1%。在更大的网络中,相较于最先进的层级库存策略,性能提升高达9.75%,并且至少比滚动视野多阶段随机程序高出7.7%。在ASML的工业案例研究中,该方法将平均成本降低了3.22%。这些节省在规划最困难的地方最大:在高需求波动的紧密容量系统中。更广泛地说,我们的工作表明,DRL可以在具有相互依赖硬约束的序列决策问题中提供经济上显著的节省,这在实践中广泛存在。

深度分析

研究背景

多层级库存计划问题是运筹学中一个经典的研究领域,涉及如何在多个层级的供应链中协调库存和生产决策。传统方法如混合整数线性规划(MILP)在处理复杂约束时表现良好,但在处理不确定性和大规模问题时扩展性差。近年来,深度强化学习(DRL)因其在不确定环境下的决策能力而受到关注,但在处理复杂约束时仍面临挑战。

核心问题

本文研究的核心问题是如何在具有相互依赖硬约束的序列决策问题中学习可行的库存策略。传统方法在处理这些复杂约束时效率低下,而现有的DRL方法要么无法严格执行约束,要么在约束交互时失效。

核心创新

本文的核心创新在于将可微凸优化模块嵌入到DRL策略中,实现了在复杂约束条件下的可行策略学习。具体来说,神经网络生成连续动作目标,二次规划将其投影到放松的可行集合上,随后通过双重信息整数映射恢复整数性。这种方法在处理相互依赖的硬约束方面具有显著优势。

方法详解

  • �� 神经网络生成连续动作目标。
  • �� 二次规划将目标投影到放松的可行集合上。
  • �� 双重信息整数映射恢复整数性。
  • �� 使用路径梯度在可微模拟器上进行端到端训练。

实验设计

实验设计包括在多层级生产-库存计划问题中验证该方法。使用的基准包括最先进的层级库存策略和滚动视野多阶段随机程序。实验衡量了不同方法在小规模和大规模实例中的性能,特别关注在高需求波动和紧密容量系统中的表现。

结果分析

实验结果显示,该方法在小规模实例中达到平均最优差距低于1%。在更大的网络中,相较于最先进的层级库存策略,性能提升高达9.75%,并且至少比滚动视野多阶段随机程序高出7.7%。在ASML的工业案例研究中,该方法将平均成本降低了3.22%。

应用场景

该方法可直接应用于多层级生产-库存计划,特别是在高需求波动和紧密容量系统中。其对工业界的影响在于能够在复杂约束条件下实现更高效的库存管理。

局限与展望

尽管该方法在处理复杂约束时表现出色,但其计算成本在高维度设置下可能较高。此外,方法依赖于可微模拟器,这在某些应用中可能不易实现。未来研究可以探索如何在没有可微模拟器的情况下进行训练,以及进一步优化计算效率。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有很多食材,但每种食材的数量有限。你需要在有限的时间内做出几道菜,每道菜需要不同的食材。你需要决定每道菜用多少食材,同时确保不超过总量。这就像本文中的问题:在有限资源下做出最佳决策。传统方法就像一本食谱,告诉你怎么做,但在面对不确定性时可能不够灵活。本文的方法就像一个聪明的助手,能根据当前情况给出最佳建议,确保每道菜都能顺利完成。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你需要在有限的时间内完成多个任务,每个任务需要不同的资源,比如金币和能量。你必须聪明地分配这些资源,确保每个任务都能完成。传统的方法就像一本攻略,告诉你怎么做,但在面对突发情况时可能不够灵活。本文的方法就像一个超级智能的游戏助手,能根据游戏进展给你最佳建议,确保你能在规定时间内完成所有任务,并取得高分!

术语表

深度强化学习 (Deep Reinforcement Learning)

一种使用深度神经网络优化不确定环境下的序列决策的方法。

用于优化多层级库存计划中的决策。

混合整数线性规划 (Mixed-Integer Linear Programming)

一种用于解决具有整数和连续变量的线性约束优化问题的方法。

传统方法用于处理复杂约束。

可微优化 (Differentiable Optimization)

一种允许梯度传播的优化方法,使得优化过程可以通过自动微分进行。

用于在策略中嵌入可微凸优化模块。

二次规划 (Quadratic Programming)

一种优化方法,目标函数为二次函数且约束为线性。

用于将连续动作目标投影到放松的可行集合上。

双重信息整数映射 (Dual-Informed Integer Mapping)

一种利用投影的对偶变量优先化项目的映射方法。

用于恢复整数性并保持可行性。

开放问题 这项研究留下的未解疑问

  • 1 如何在没有可微模拟器的情况下进行训练?现有方法依赖可微模拟器进行端到端训练,但在某些应用中可能不易实现。

应用场景

近期应用

多层级库存管理

该方法可用于优化多层级供应链中的库存和生产决策,特别是在高需求波动和紧密容量系统中。

远期愿景

复杂约束优化

该方法可扩展到其他复杂约束优化问题,如交通管理和能源分配,提供更高效的解决方案。

原文摘要

Many operational problems are constrained sequential decision processes with large, combinatorial action spaces and interdependent feasibility constraints. Mixed-integer linear programs (MILPs) handle such constraints flexibly but scale poorly in stochastic environments. Deep reinforcement learning (DRL) promises scalable decision rules, but existing methods either penalize constraints rather than enforce them, or rely on feasibility mechanisms that break down once constraints interact. We bridge this gap by embedding a differentiable convex optimization module inside the policy: a neural network proposes continuous action targets, a quadratic program projects them onto the relaxed feasible set, and a dual-informed integer mapping restores integrality while preserving feasibility. Given a differentiable simulator, the policy trains end to end from sampled trajectories using pathwise gradients, while handling hard constraints with similar flexibility to MILPs. We show that our feasibility enforcement has bounded error relative to an exact integer projection and ensures the entire feasible action space is reachable. We apply the method to multi-echelon production-inventory planning under shared resource and material constraints. Our policy attains an average optimality gap below 1% on small instances. It further outperforms state-of-the-art echelon base-stock policies by up to 9.75% and a rolling-horizon multi-stage stochastic program by at least 7.7% in larger networks. On an industry-scale case study from ASML, it reduces average cost by up to 3.22% relative to the best-known benchmark policy. The savings are largest where planning is hardest: in tightly capacitated systems with high demand variability. More broadly, our work shows that DRL can deliver economically significant savings in sequential decision problems with interdependent hard constraints, which are widespread in practice.

cs.AI cs.LG