PPO LunarLander-v3
PPO agent trained from scratch with PyTorch.
Environment
LunarLander-v3
Training
- Algorithm: PPO
- Timesteps: 50,000
- Learning rate: 2.5e-4
- Gamma: 0.99
- GAE lambda: 0.95
Evaluation
10 evaluation episodes.
- Mean reward: -144.62
- Standard deviation: 65.41
- Mean minus standard deviation: -210.04
Evaluation results
- Mean reward on LunarLander-v3self-reported-144.620
- Standard deviation on LunarLander-v3self-reported65.410