Reinforcement Learning
ml-agents
TensorBoard
ONNX
SnowballTarget
deep-reinforcement-learning
ML-Agents-SnowballTarget
Instructions to use VLat3/ppo-SnowballTarget with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- ml-agents
How to use VLat3/ppo-SnowballTarget with ml-agents:
mlagents-load-from-hf --repo-id="VLat3/ppo-SnowballTarget" --local-dir="./download: string[]s"
- Notebooks
- Google Colab
- Kaggle
| { | |
| "name": "root", | |
| "gauges": { | |
| "SnowballTarget.Policy.Entropy.mean": { | |
| "value": 0.8598994612693787, | |
| "min": 0.8551618456840515, | |
| "max": 2.8494315147399902, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Entropy.sum": { | |
| "value": 8172.484375, | |
| "min": 8172.484375, | |
| "max": 29086.99609375, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Step.mean": { | |
| "value": 199984.0, | |
| "min": 9952.0, | |
| "max": 199984.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Step.sum": { | |
| "value": 199984.0, | |
| "min": 9952.0, | |
| "max": 199984.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.mean": { | |
| "value": 12.915642738342285, | |
| "min": 0.4292309582233429, | |
| "max": 12.915642738342285, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.sum": { | |
| "value": 2518.55029296875, | |
| "min": 83.27080535888672, | |
| "max": 2606.231201171875, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.mean": { | |
| "value": 0.07054992502091016, | |
| "min": 0.05835223772994461, | |
| "max": 0.07712301022661897, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.sum": { | |
| "value": 0.28219970008364065, | |
| "min": 0.23340895091977845, | |
| "max": 0.37628742314957303, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.mean": { | |
| "value": 0.19764660883183574, | |
| "min": 0.1235815040212508, | |
| "max": 0.28072217667804045, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.sum": { | |
| "value": 0.790586435327343, | |
| "min": 0.4943260160850032, | |
| "max": 1.4036108833902021, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.mean": { | |
| "value": 8.082097306000005e-06, | |
| "min": 8.082097306000005e-06, | |
| "max": 0.000291882002706, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.sum": { | |
| "value": 3.232838922400002e-05, | |
| "min": 3.232838922400002e-05, | |
| "max": 0.00138516003828, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.mean": { | |
| "value": 0.10269400000000001, | |
| "min": 0.10269400000000001, | |
| "max": 0.19729400000000002, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.sum": { | |
| "value": 0.41077600000000003, | |
| "min": 0.41077600000000003, | |
| "max": 0.96172, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Beta.mean": { | |
| "value": 0.0001444306000000001, | |
| "min": 0.0001444306000000001, | |
| "max": 0.0048649706, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.Beta.sum": { | |
| "value": 0.0005777224000000004, | |
| "min": 0.0005777224000000004, | |
| "max": 0.023089828, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.mean": { | |
| "value": 199.0, | |
| "min": 199.0, | |
| "max": 199.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.sum": { | |
| "value": 8756.0, | |
| "min": 8756.0, | |
| "max": 10945.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.mean": { | |
| "value": 25.704545454545453, | |
| "min": 3.6818181818181817, | |
| "max": 25.704545454545453, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.sum": { | |
| "value": 1131.0, | |
| "min": 162.0, | |
| "max": 1395.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.mean": { | |
| "value": 25.704545454545453, | |
| "min": 3.6818181818181817, | |
| "max": 25.704545454545453, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.sum": { | |
| "value": 1131.0, | |
| "min": 162.0, | |
| "max": 1395.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.IsTraining.mean": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 20 | |
| }, | |
| "SnowballTarget.IsTraining.sum": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 20 | |
| } | |
| }, | |
| "metadata": { | |
| "timer_format_version": "0.1.0", | |
| "start_time_seconds": "1783025943", | |
| "python_version": "3.10.12 (main, Jul 5 2023, 18:54:27) [GCC 11.2.0]", | |
| "command_line_arguments": "/usr/local/bin/mlagents-learn ./config/ppo/SnowballTarget.yaml --env=./training-envs-executables/linux/SnowballTarget/SnowballTarget --run-id=SnowballTarget1 --no-graphics", | |
| "mlagents_version": "1.2.0.dev0", | |
| "mlagents_envs_version": "1.2.0.dev0", | |
| "communication_protocol_version": "1.5.0", | |
| "pytorch_version": "2.8.0+cu128", | |
| "numpy_version": "1.23.5", | |
| "end_time_seconds": "1783026379" | |
| }, | |
| "total": 436.168201081, | |
| "count": 1, | |
| "self": 0.4310023230000297, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.025865419999945516, | |
| "count": 1, | |
| "self": 0.025865419999945516 | |
| }, | |
| "TrainerController.start_learning": { | |
| "total": 435.71133333800003, | |
| "count": 1, | |
| "self": 0.3431382160272278, | |
| "children": { | |
| "TrainerController._reset_env": { | |
| "total": 3.0596087549999993, | |
| "count": 1, | |
| "self": 3.0596087549999993 | |
| }, | |
| "TrainerController.advance": { | |
| "total": 432.23480614597315, | |
| "count": 18192, | |
| "self": 0.3565427589742285, | |
| "children": { | |
| "env_step": { | |
| "total": 315.564686523021, | |
| "count": 18192, | |
| "self": 247.9506123770268, | |
| "children": { | |
| "SubprocessEnvManager._take_step": { | |
| "total": 67.4139402480032, | |
| "count": 18192, | |
| "self": 1.2138016069973219, | |
| "children": { | |
| "TorchPolicy.evaluate": { | |
| "total": 66.20013864100588, | |
| "count": 18192, | |
| "self": 66.20013864100588 | |
| } | |
| } | |
| }, | |
| "workers": { | |
| "total": 0.20013389799100878, | |
| "count": 18192, | |
| "self": 0.0, | |
| "children": { | |
| "worker_root": { | |
| "total": 433.47465337102244, | |
| "count": 18192, | |
| "is_parallel": true, | |
| "self": 215.32823447303508, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.0, | |
| "count": 0, | |
| "is_parallel": true, | |
| "self": 0.0, | |
| "children": { | |
| "steps_from_proto": { | |
| "total": 0.00471502799996415, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0033341020000534627, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.001380925999910687, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.001380925999910687 | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 0.08162919699998383, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0005724779998672602, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 0.00035242000012658536, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.00035242000012658536 | |
| }, | |
| "communicator.exchange": { | |
| "total": 0.07690643199998703, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.07690643199998703 | |
| }, | |
| "steps_from_proto": { | |
| "total": 0.0037978670000029524, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.00035247399955551373, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.0034453930004474387, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.0034453930004474387 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 218.14641889798736, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 10.131739752986732, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 5.39940634996924, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 5.39940634996924 | |
| }, | |
| "communicator.exchange": { | |
| "total": 166.69067302803091, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 166.69067302803091 | |
| }, | |
| "steps_from_proto": { | |
| "total": 35.92459976700047, | |
| "count": 18191, | |
| "is_parallel": true, | |
| "self": 6.54915915893821, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 29.375440608062263, | |
| "count": 181910, | |
| "is_parallel": true, | |
| "self": 29.375440608062263 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_advance": { | |
| "total": 116.31357686397791, | |
| "count": 18192, | |
| "self": 0.41432151591493493, | |
| "children": { | |
| "process_trajectory": { | |
| "total": 23.663777476062478, | |
| "count": 18192, | |
| "self": 23.289225295061897, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.3745521810005812, | |
| "count": 4, | |
| "self": 0.3745521810005812 | |
| } | |
| } | |
| }, | |
| "_update_policy": { | |
| "total": 92.2354778720005, | |
| "count": 90, | |
| "self": 37.75216583400265, | |
| "children": { | |
| "TorchPPOOptimizer.update": { | |
| "total": 54.48331203799785, | |
| "count": 4587, | |
| "self": 54.48331203799785 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_threads": { | |
| "total": 8.239999260695186e-07, | |
| "count": 1, | |
| "self": 8.239999260695186e-07 | |
| }, | |
| "TrainerController._save_models": { | |
| "total": 0.07377939699972558, | |
| "count": 1, | |
| "self": 0.0006521129994325747, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.073127284000293, | |
| "count": 1, | |
| "self": 0.073127284000293 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } |