Look Before You Leap: Bridging Model-Free and Model-Based Reinforcement Learning for Planned-Ahead Vision-and-Language Navigation
RPA combines model-free and model-based RL, reaching 25.3% test success on R2R versus 23.1% for model-free RL.
Xin Wang, Wenhan Xiong, Hongmin Wang et al.