PPO LunarLander-v3

PPO agent trained from scratch with PyTorch.

Environment

LunarLander-v3

Training

  • Algorithm: PPO
  • Timesteps: 50,000
  • Learning rate: 2.5e-4
  • Gamma: 0.99
  • GAE lambda: 0.95

Evaluation

10 evaluation episodes.

  • Mean reward: -144.62
  • Standard deviation: 65.41
  • Mean minus standard deviation: -210.04
Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading

Evaluation results