Reinforcement Learning
ml-agents
TensorBoard
ONNX
SnowballTarget
deep-reinforcement-learning
ML-Agents-SnowballTarget
Instructions to use herurg/ppo-SnowballTarget with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- ml-agents
How to use herurg/ppo-SnowballTarget with ml-agents:
mlagents-load-from-hf --repo-id="herurg/ppo-SnowballTarget" --local-dir="./download: string[]s"
- Notebooks
- Google Colab
- Kaggle
| { | |
| "name": "root", | |
| "gauges": { | |
| "SnowballTarget.Policy.Entropy.mean": { | |
| "value": 0.9301773309707642, | |
| "min": 0.9301773309707642, | |
| "max": 2.8548381328582764, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Entropy.sum": { | |
| "value": 8901.796875, | |
| "min": 8901.796875, | |
| "max": 29236.3984375, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Step.mean": { | |
| "value": 199984.0, | |
| "min": 9952.0, | |
| "max": 199984.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Step.sum": { | |
| "value": 199984.0, | |
| "min": 9952.0, | |
| "max": 199984.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.mean": { | |
| "value": 13.029752731323242, | |
| "min": 0.4599590003490448, | |
| "max": 13.029752731323242, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.sum": { | |
| "value": 2540.8017578125, | |
| "min": 89.23204803466797, | |
| "max": 2655.13330078125, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.mean": { | |
| "value": 199.0, | |
| "min": 199.0, | |
| "max": 199.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.sum": { | |
| "value": 8756.0, | |
| "min": 8756.0, | |
| "max": 10945.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.mean": { | |
| "value": 0.06632330234695509, | |
| "min": 0.05825561663942947, | |
| "max": 0.0732825357873819, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.sum": { | |
| "value": 0.26529320938782036, | |
| "min": 0.23302246655771788, | |
| "max": 0.36558282253855734, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.mean": { | |
| "value": 0.18379654399320192, | |
| "min": 0.1082863658461172, | |
| "max": 0.2770290133999843, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.sum": { | |
| "value": 0.7351861759728077, | |
| "min": 0.4331454633844688, | |
| "max": 1.3851450669999217, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.mean": { | |
| "value": 8.082097306000005e-06, | |
| "min": 8.082097306000005e-06, | |
| "max": 0.000291882002706, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.sum": { | |
| "value": 3.232838922400002e-05, | |
| "min": 3.232838922400002e-05, | |
| "max": 0.00138516003828, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.mean": { | |
| "value": 0.10269400000000001, | |
| "min": 0.10269400000000001, | |
| "max": 0.19729400000000002, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.sum": { | |
| "value": 0.41077600000000003, | |
| "min": 0.41077600000000003, | |
| "max": 0.96172, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Beta.mean": { | |
| "value": 0.0001444306000000001, | |
| "min": 0.0001444306000000001, | |
| "max": 0.0048649706, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Beta.sum": { | |
| "value": 0.0005777224000000004, | |
| "min": 0.0005777224000000004, | |
| "max": 0.023089828, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.mean": { | |
| "value": 25.227272727272727, | |
| "min": 3.3181818181818183, | |
| "max": 25.963636363636365, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.sum": { | |
| "value": 1110.0, | |
| "min": 146.0, | |
| "max": 1428.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.mean": { | |
| "value": 25.227272727272727, | |
| "min": 3.3181818181818183, | |
| "max": 25.963636363636365, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.sum": { | |
| "value": 1110.0, | |
| "min": 146.0, | |
| "max": 1428.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.IsTraining.mean": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.IsTraining.sum": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 20 | |
| } | |
| }, | |
| "metadata": { | |
| "timer_format_version": "0.1.0", | |
| "start_time_seconds": "1787484777", | |
| "python_version": "3.10.12 | packaged by conda-forge | (main, Jun 23 2023, 22:40:32) [GCC 12.3.0]", | |
| "command_line_arguments": "/content/mlagents310/bin/mlagents-learn /content/ml-agents/config/ppo/SnowballTarget.yaml --env=/content/ml-agents/training-envs-executables/linux/SnowballTarget/SnowballTarget --run-id=SnowballTarget1 --results-dir=/content/drive/MyDrive/HF_DeepRL_Unit5/SnowballTarget/results --no-graphics", | |
| "mlagents_version": "1.1.0", | |
| "mlagents_envs_version": "1.1.0", | |
| "communication_protocol_version": "1.5.0", | |
| "pytorch_version": "2.1.1+cpu", | |
| "numpy_version": "1.23.5", | |
| "end_time_seconds": "1787485462" | |
| }, | |
| "total": 685.2451881649995, | |
| "count": 1, | |
| "self": 1.1227142569987336, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.03725851600029273, | |
| "count": 1, | |
| "self": 0.03725851600029273 | |
| }, | |
| "TrainerController.start_learning": { | |
| "total": 684.0852153920005, | |
| "count": 1, | |
| "self": 0.800374903870761, | |
| "children": { | |
| "TrainerController._reset_env": { | |
| "total": 1.5195302889987943, | |
| "count": 1, | |
| "self": 1.5195302889987943 | |
| }, | |
| "TrainerController.advance": { | |
| "total": 681.5624041181309, | |
| "count": 18205, | |
| "self": 0.37987620601415983, | |
| "children": { | |
| "env_step": { | |
| "total": 681.1825279121167, | |
| "count": 18205, | |
| "self": 567.0195842240901, | |
| "children": { | |
| "SubprocessEnvManager._take_step": { | |
| "total": 113.72894640095001, | |
| "count": 18205, | |
| "self": 2.0427400068765564, | |
| "children": { | |
| "TorchPolicy.evaluate": { | |
| "total": 111.68620639407345, | |
| "count": 18205, | |
| "self": 111.68620639407345 | |
| } | |
| } | |
| }, | |
| "workers": { | |
| "total": 0.433997287076636, | |
| "count": 18205, | |
| "self": 0.0, | |
| "children": { | |
| "worker_root": { | |
| "total": 679.3559382000276, | |
| "count": 18205, | |
| "is_parallel": true, | |
| "self": 258.53809170599743, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.0, | |
| "count": 0, | |
| "is_parallel": true, | |
| "self": 0.0, | |
| "children": { | |
| "steps_from_proto": { | |
| "total": 0.003471994001301937, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0011892059992533177, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.002282788002048619, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.002282788002048619 | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 0.05059065000023111, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0008530070008418988, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 0.00046413600102823693, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.00046413600102823693 | |
| }, | |
| "communicator.exchange": { | |
| "total": 0.045732892998785246, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.045732892998785246 | |
| }, | |
| "steps_from_proto": { | |
| "total": 0.0035406139995757258, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0008110050002869684, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.0027296089992887573, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.0027296089992887573 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 420.81784649403016, | |
| "count": 18204, | |
| "is_parallel": true, | |
| "self": 17.734258205033257, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 8.532736267008659, | |
| "count": 18204, | |
| "is_parallel": true, | |
| "self": 8.532736267008659 | |
| }, | |
| "communicator.exchange": { | |
| "total": 330.49337325894885, | |
| "count": 18204, | |
| "is_parallel": true, | |
| "self": 330.49337325894885 | |
| }, | |
| "steps_from_proto": { | |
| "total": 64.0574787630394, | |
| "count": 18204, | |
| "is_parallel": true, | |
| "self": 11.5002919646613, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 52.5571867983781, | |
| "count": 182040, | |
| "is_parallel": true, | |
| "self": 52.5571867983781 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_threads": { | |
| "total": 0.00023700099882262293, | |
| "count": 1, | |
| "self": 0.00023700099882262293, | |
| "children": { | |
| "thread_root": { | |
| "total": 0.0, | |
| "count": 0, | |
| "is_parallel": true, | |
| "self": 0.0, | |
| "children": { | |
| "trainer_advance": { | |
| "total": 677.0200500372193, | |
| "count": 543432, | |
| "is_parallel": true, | |
| "self": 12.164619660397875, | |
| "children": { | |
| "process_trajectory": { | |
| "total": 382.31853930981924, | |
| "count": 543432, | |
| "is_parallel": true, | |
| "self": 381.2012408298215, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 1.1172984799977712, | |
| "count": 4, | |
| "is_parallel": true, | |
| "self": 1.1172984799977712 | |
| } | |
| } | |
| }, | |
| "_update_policy": { | |
| "total": 282.5368910670022, | |
| "count": 90, | |
| "is_parallel": true, | |
| "self": 72.79886204503055, | |
| "children": { | |
| "TorchPPOOptimizer.update": { | |
| "total": 209.73802902197167, | |
| "count": 4587, | |
| "is_parallel": true, | |
| "self": 209.73802902197167 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "TrainerController._save_models": { | |
| "total": 0.20266908000121475, | |
| "count": 1, | |
| "self": 0.012905108002087218, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.18976397199912753, | |
| "count": 1, | |
| "self": 0.18976397199912753 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } |