Reinforcement Learning
ml-agents
TensorBoard
ONNX
SnowballTarget
deep-reinforcement-learning
ML-Agents-SnowballTarget
Instructions to use HMGeo/ppo-SnowballTarget with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- ml-agents
How to use HMGeo/ppo-SnowballTarget with ml-agents:
mlagents-load-from-hf --repo-id="HMGeo/ppo-SnowballTarget" --local-dir="./download: string[]s"
- Notebooks
- Google Colab
- Kaggle
| { | |
| "name": "root", | |
| "gauges": { | |
| "SnowballTarget.Policy.Entropy.mean": { | |
| "value": 2.3138859272003174, | |
| "min": 2.3138859272003174, | |
| "max": 2.8339903354644775, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.Entropy.sum": { | |
| "value": 23620.1484375, | |
| "min": 23620.1484375, | |
| "max": 28929.373046875, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Step.mean": { | |
| "value": 49936.0, | |
| "min": 9952.0, | |
| "max": 49936.0, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Step.sum": { | |
| "value": 49936.0, | |
| "min": 9952.0, | |
| "max": 49936.0, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.mean": { | |
| "value": 4.713239669799805, | |
| "min": 0.39039018750190735, | |
| "max": 4.713239669799805, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicValueEstimate.sum": { | |
| "value": 914.3684692382812, | |
| "min": 75.7356948852539, | |
| "max": 914.3684692382812, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.mean": { | |
| "value": 0.07101792926465245, | |
| "min": 0.06634338495205157, | |
| "max": 0.07218859588679419, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Losses.PolicyLoss.sum": { | |
| "value": 0.2840717170586098, | |
| "min": 0.2815638394498748, | |
| "max": 0.3454439147539875, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.mean": { | |
| "value": 0.2875146497698391, | |
| "min": 0.0989999590491803, | |
| "max": 0.2875146497698391, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Losses.ValueLoss.sum": { | |
| "value": 1.1500585990793564, | |
| "min": 0.3959998361967212, | |
| "max": 1.2863343296682135, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.mean": { | |
| "value": 2.9928090024000003e-05, | |
| "min": 2.9928090024000003e-05, | |
| "max": 0.00026752801082399996, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.LearningRate.sum": { | |
| "value": 0.00011971236009600001, | |
| "min": 0.00011971236009600001, | |
| "max": 0.0010701120432959998, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.mean": { | |
| "value": 0.10997600000000002, | |
| "min": 0.10997600000000002, | |
| "max": 0.18917599999999998, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.Epsilon.sum": { | |
| "value": 0.4399040000000001, | |
| "min": 0.4399040000000001, | |
| "max": 0.8468800000000001, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.Beta.mean": { | |
| "value": 0.0005078024, | |
| "min": 0.0005078024, | |
| "max": 0.0044598824, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.Beta.sum": { | |
| "value": 0.0020312096, | |
| "min": 0.0020312096, | |
| "max": 0.0178395296, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.mean": { | |
| "value": 199.0, | |
| "min": 199.0, | |
| "max": 199.0, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Environment.EpisodeLength.sum": { | |
| "value": 8756.0, | |
| "min": 8756.0, | |
| "max": 10945.0, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.mean": { | |
| "value": 12.227272727272727, | |
| "min": 2.6818181818181817, | |
| "max": 12.227272727272727, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Environment.CumulativeReward.sum": { | |
| "value": 538.0, | |
| "min": 118.0, | |
| "max": 581.0, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.mean": { | |
| "value": 12.227272727272727, | |
| "min": 2.6818181818181817, | |
| "max": 12.227272727272727, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.Policy.ExtrinsicReward.sum": { | |
| "value": 538.0, | |
| "min": 118.0, | |
| "max": 581.0, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.IsTraining.mean": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 5 | |
| }, | |
| "SnowballTarget.IsTraining.sum": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 5 | |
| } | |
| }, | |
| "metadata": { | |
| "timer_format_version": "0.1.0", | |
| "start_time_seconds": "1732676605", | |
| "python_version": "3.10.12 (main, Nov 6 2024, 20:22:13) [GCC 11.4.0]", | |
| "command_line_arguments": "/usr/local/bin/mlagents-learn ./config/ppo/SnowballTarget.yaml --env=./training-envs-executables/linux/SnowballTarget/SnowballTarget --run-id=SnowballTarget2 --no-graphics", | |
| "mlagents_version": "1.2.0.dev0", | |
| "mlagents_envs_version": "1.2.0.dev0", | |
| "communication_protocol_version": "1.5.0", | |
| "pytorch_version": "2.5.1+cu121", | |
| "numpy_version": "1.23.5", | |
| "end_time_seconds": "1732676722" | |
| }, | |
| "total": 117.60812945700002, | |
| "count": 1, | |
| "self": 0.43885327999998935, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.056552382999939255, | |
| "count": 1, | |
| "self": 0.056552382999939255 | |
| }, | |
| "TrainerController.start_learning": { | |
| "total": 117.11272379400009, | |
| "count": 1, | |
| "self": 0.09451536700225915, | |
| "children": { | |
| "TrainerController._reset_env": { | |
| "total": 1.972023967000041, | |
| "count": 1, | |
| "self": 1.972023967000041 | |
| }, | |
| "TrainerController.advance": { | |
| "total": 114.9539014639978, | |
| "count": 4592, | |
| "self": 0.09766422199970748, | |
| "children": { | |
| "env_step": { | |
| "total": 81.06583385199156, | |
| "count": 4592, | |
| "self": 61.74178481699175, | |
| "children": { | |
| "SubprocessEnvManager._take_step": { | |
| "total": 19.26620812799797, | |
| "count": 4592, | |
| "self": 0.3593554799941785, | |
| "children": { | |
| "TorchPolicy.evaluate": { | |
| "total": 18.90685264800379, | |
| "count": 4592, | |
| "self": 18.90685264800379 | |
| } | |
| } | |
| }, | |
| "workers": { | |
| "total": 0.05784090700183242, | |
| "count": 4592, | |
| "self": 0.0, | |
| "children": { | |
| "worker_root": { | |
| "total": 116.56226213999594, | |
| "count": 4592, | |
| "is_parallel": true, | |
| "self": 62.64528356899348, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.0, | |
| "count": 0, | |
| "is_parallel": true, | |
| "self": 0.0, | |
| "children": { | |
| "steps_from_proto": { | |
| "total": 0.0023152329999902577, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0007508009998673515, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.0015644320001229062, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.0015644320001229062 | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 0.04225745899998401, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0007446839999829535, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 0.00039866800000254443, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.00039866800000254443 | |
| }, | |
| "communicator.exchange": { | |
| "total": 0.03890115900003366, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.03890115900003366 | |
| }, | |
| "steps_from_proto": { | |
| "total": 0.002212947999964854, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0004724530001567473, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.0017404949998081065, | |
| "count": 10, | |
| "is_parallel": true, | |
| "self": 0.0017404949998081065 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 53.91697857100246, | |
| "count": 4591, | |
| "is_parallel": true, | |
| "self": 2.6096144709940745, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 1.429090691997203, | |
| "count": 4591, | |
| "is_parallel": true, | |
| "self": 1.429090691997203 | |
| }, | |
| "communicator.exchange": { | |
| "total": 41.033505354007616, | |
| "count": 4591, | |
| "is_parallel": true, | |
| "self": 41.033505354007616 | |
| }, | |
| "steps_from_proto": { | |
| "total": 8.844768054003566, | |
| "count": 4591, | |
| "is_parallel": true, | |
| "self": 1.6128092089958272, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 7.231958845007739, | |
| "count": 45910, | |
| "is_parallel": true, | |
| "self": 7.231958845007739 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_advance": { | |
| "total": 33.79040339000653, | |
| "count": 4592, | |
| "self": 0.11972088699519645, | |
| "children": { | |
| "process_trajectory": { | |
| "total": 8.159988817011254, | |
| "count": 4592, | |
| "self": 7.559814683011155, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.600174134000099, | |
| "count": 5, | |
| "self": 0.600174134000099 | |
| } | |
| } | |
| }, | |
| "_update_policy": { | |
| "total": 25.51069368600008, | |
| "count": 22, | |
| "self": 10.273556020000683, | |
| "children": { | |
| "TorchPPOOptimizer.update": { | |
| "total": 15.237137665999398, | |
| "count": 1119, | |
| "self": 15.237137665999398 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_threads": { | |
| "total": 9.780001164472196e-07, | |
| "count": 1, | |
| "self": 9.780001164472196e-07 | |
| }, | |
| "TrainerController._save_models": { | |
| "total": 0.09228201799987801, | |
| "count": 1, | |
| "self": 0.0008890579997569148, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.09139296000012109, | |
| "count": 1, | |
| "self": 0.09139296000012109 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } |