A Closer Look at Invalid Action Masking in Policy Gradient Algorithms
This paper proves that invalid action masking corresponds to valid policy gradients, scaling efficiently in large action spaces, outperforming penalty methods.
Shengyi Huang, Santiago Ontañón