Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning
Uses offline reinforcement learning to harness non-expert data to enhance imitation learning policies, combining different expert and non-expert datasets to improve policy robustness. By stitching trajectories from non-expert data, RISE policies succeed from much wider distributions and are robust to disturbances.