PPO โ€” LunarLander-v2

PPO implemented from scratch in PyTorch for Deep RL Course Unit 8 Part I.

  • Environment: LunarLander-v2
  • Evaluation episodes: 20
  • Mean reward: -81.283691
  • Standard deviation: 20.565509
  • Mean minus standard deviation: -101.849199
  • Training timesteps: 2,000,000
Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading

Evaluation results