PPO โ LunarLander-v2
PPO implemented from scratch in PyTorch for Deep RL Course Unit 8 Part I.
- Environment:
LunarLander-v2
- Evaluation episodes:
20
- Mean reward:
-81.283691
- Standard deviation:
20.565509
- Mean minus standard deviation:
-101.849199
- Training timesteps:
2,000,000