Reinforcement Learning from Rich Feedback with Distributional DAgger
Proposes DistIL, a distributional imitation learning algorithm with monotonic improvement guarantees, leveraging rich feedback for complex reasoning tasks.
Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad