Reinforcement Learning
ml-agents
TensorBoard
ONNX
Pyramids
deep-reinforcement-learning
ML-Agents-Pyramids
Instructions to use bichi/pyramid with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- ml-agents
How to use bichi/pyramid with ml-agents:
mlagents-load-from-hf --repo-id="bichi/pyramid" --local-dir="./download: string[]s"
- Notebooks
- Google Colab
- Kaggle
| { | |
| "name": "root", | |
| "gauges": { | |
| "Pyramids.Policy.Entropy.mean": { | |
| "value": 0.14925365149974823, | |
| "min": 0.14144892990589142, | |
| "max": 1.4910982847213745, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.Entropy.sum": { | |
| "value": 4425.072265625, | |
| "min": 4157.466796875, | |
| "max": 45233.95703125, | |
| "count": 100 | |
| }, | |
| "Pyramids.Step.mean": { | |
| "value": 2999891.0, | |
| "min": 29952.0, | |
| "max": 2999891.0, | |
| "count": 100 | |
| }, | |
| "Pyramids.Step.sum": { | |
| "value": 2999891.0, | |
| "min": 29952.0, | |
| "max": 2999891.0, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.ExtrinsicValueEstimate.mean": { | |
| "value": 0.8065932393074036, | |
| "min": -0.14577075839042664, | |
| "max": 0.8065932393074036, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.ExtrinsicValueEstimate.sum": { | |
| "value": 241.17138671875, | |
| "min": -34.54766845703125, | |
| "max": 241.17138671875, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.RndValueEstimate.mean": { | |
| "value": 0.030329270288348198, | |
| "min": -0.017548909410834312, | |
| "max": 0.16947656869888306, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.RndValueEstimate.sum": { | |
| "value": 9.068451881408691, | |
| "min": -5.054085731506348, | |
| "max": 40.67437744140625, | |
| "count": 100 | |
| }, | |
| "Pyramids.Losses.PolicyLoss.mean": { | |
| "value": 0.07271419474065102, | |
| "min": 0.06364904063444278, | |
| "max": 0.07449865962691893, | |
| "count": 100 | |
| }, | |
| "Pyramids.Losses.PolicyLoss.sum": { | |
| "value": 1.0179987263691144, | |
| "min": 0.4819773814154872, | |
| "max": 1.0716408192238305, | |
| "count": 100 | |
| }, | |
| "Pyramids.Losses.ValueLoss.mean": { | |
| "value": 0.0149526191345926, | |
| "min": 8.334409968634264e-05, | |
| "max": 0.016406726160009082, | |
| "count": 100 | |
| }, | |
| "Pyramids.Losses.ValueLoss.sum": { | |
| "value": 0.2093366678842964, | |
| "min": 0.0009167850965497691, | |
| "max": 0.23509123352157663, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.LearningRate.mean": { | |
| "value": 1.5258852056904776e-06, | |
| "min": 1.5258852056904776e-06, | |
| "max": 0.00029838354339596195, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.LearningRate.sum": { | |
| "value": 2.1362392879666686e-05, | |
| "min": 2.1362392879666686e-05, | |
| "max": 0.0037596390467870334, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.Epsilon.mean": { | |
| "value": 0.10050859523809527, | |
| "min": 0.10050859523809527, | |
| "max": 0.19946118095238097, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.Epsilon.sum": { | |
| "value": 1.4071203333333338, | |
| "min": 1.3897045333333333, | |
| "max": 2.6625826333333342, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.Beta.mean": { | |
| "value": 6.080866428571434e-05, | |
| "min": 6.080866428571434e-05, | |
| "max": 0.009946171977142856, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.Beta.sum": { | |
| "value": 0.0008513213000000007, | |
| "min": 0.0008513213000000007, | |
| "max": 0.12533597537, | |
| "count": 100 | |
| }, | |
| "Pyramids.Losses.RNDLoss.mean": { | |
| "value": 0.004239528439939022, | |
| "min": 0.003976923879235983, | |
| "max": 0.2999093234539032, | |
| "count": 100 | |
| }, | |
| "Pyramids.Losses.RNDLoss.sum": { | |
| "value": 0.05935339629650116, | |
| "min": 0.055676937103271484, | |
| "max": 2.099365234375, | |
| "count": 100 | |
| }, | |
| "Pyramids.Environment.EpisodeLength.mean": { | |
| "value": 226.3111111111111, | |
| "min": 226.3111111111111, | |
| "max": 999.0, | |
| "count": 100 | |
| }, | |
| "Pyramids.Environment.EpisodeLength.sum": { | |
| "value": 30552.0, | |
| "min": 15984.0, | |
| "max": 32503.0, | |
| "count": 100 | |
| }, | |
| "Pyramids.Environment.CumulativeReward.mean": { | |
| "value": 1.773688875525086, | |
| "min": -1.0000000521540642, | |
| "max": 1.773688875525086, | |
| "count": 100 | |
| }, | |
| "Pyramids.Environment.CumulativeReward.sum": { | |
| "value": 239.4479981958866, | |
| "min": -32.000001668930054, | |
| "max": 239.4479981958866, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.ExtrinsicReward.mean": { | |
| "value": 1.773688875525086, | |
| "min": -1.0000000521540642, | |
| "max": 1.773688875525086, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.ExtrinsicReward.sum": { | |
| "value": 239.4479981958866, | |
| "min": -32.000001668930054, | |
| "max": 239.4479981958866, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.RndReward.mean": { | |
| "value": 0.010160676438142589, | |
| "min": 0.010160676438142589, | |
| "max": 5.95669911429286, | |
| "count": 100 | |
| }, | |
| "Pyramids.Policy.RndReward.sum": { | |
| "value": 1.3716913191492495, | |
| "min": 1.1725752901111264, | |
| "max": 95.30718582868576, | |
| "count": 100 | |
| }, | |
| "Pyramids.IsTraining.mean": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 100 | |
| }, | |
| "Pyramids.IsTraining.sum": { | |
| "value": 1.0, | |
| "min": 1.0, | |
| "max": 1.0, | |
| "count": 100 | |
| } | |
| }, | |
| "metadata": { | |
| "timer_format_version": "0.1.0", | |
| "start_time_seconds": "1785335933", | |
| "python_version": "3.10.12 (main, Jul 5 2023, 18:54:27) [GCC 11.2.0]", | |
| "command_line_arguments": "/usr/local/bin/mlagents-learn ./config/ppo/PyramidsRND.yaml --env=./training-envs-executables/linux/Pyramids/Pyramids --run-id=Pyramids Training --no-graphics", | |
| "mlagents_version": "1.2.0.dev0", | |
| "mlagents_envs_version": "1.2.0.dev0", | |
| "communication_protocol_version": "1.5.0", | |
| "pytorch_version": "2.8.0+cu128", | |
| "numpy_version": "1.23.5", | |
| "end_time_seconds": "1785347599" | |
| }, | |
| "total": 11665.913807131, | |
| "count": 1, | |
| "self": 1.140152948002651, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.046789825999894674, | |
| "count": 1, | |
| "self": 0.046789825999894674 | |
| }, | |
| "TrainerController.start_learning": { | |
| "total": 11664.726864356999, | |
| "count": 1, | |
| "self": 6.729025567990902, | |
| "children": { | |
| "TrainerController._reset_env": { | |
| "total": 3.8231225700001232, | |
| "count": 1, | |
| "self": 3.8231225700001232 | |
| }, | |
| "TrainerController.advance": { | |
| "total": 11654.056309875008, | |
| "count": 194235, | |
| "self": 7.294799953713664, | |
| "children": { | |
| "env_step": { | |
| "total": 8512.720195382602, | |
| "count": 194235, | |
| "self": 8034.20640201952, | |
| "children": { | |
| "SubprocessEnvManager._take_step": { | |
| "total": 474.1865924937547, | |
| "count": 194235, | |
| "self": 22.009940603504674, | |
| "children": { | |
| "TorchPolicy.evaluate": { | |
| "total": 452.17665189025, | |
| "count": 187552, | |
| "self": 452.17665189025 | |
| } | |
| } | |
| }, | |
| "workers": { | |
| "total": 4.327200869327498, | |
| "count": 194235, | |
| "self": 0.0, | |
| "children": { | |
| "worker_root": { | |
| "total": 11638.654888937708, | |
| "count": 194235, | |
| "is_parallel": true, | |
| "self": 4178.385195535957, | |
| "children": { | |
| "run_training.setup": { | |
| "total": 0.0, | |
| "count": 0, | |
| "is_parallel": true, | |
| "self": 0.0, | |
| "children": { | |
| "steps_from_proto": { | |
| "total": 0.0029098370000610885, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0007825570005479676, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.002127279999513121, | |
| "count": 8, | |
| "is_parallel": true, | |
| "self": 0.002127279999513121 | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 0.06657692099997803, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0006916660004208097, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 0.0007536299999628682, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.0007536299999628682 | |
| }, | |
| "communicator.exchange": { | |
| "total": 0.06307394499981456, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.06307394499981456 | |
| }, | |
| "steps_from_proto": { | |
| "total": 0.0020576799997797934, | |
| "count": 1, | |
| "is_parallel": true, | |
| "self": 0.000417030999869894, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 0.0016406489999098994, | |
| "count": 8, | |
| "is_parallel": true, | |
| "self": 0.0016406489999098994 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "UnityEnvironment.step": { | |
| "total": 7460.269693401751, | |
| "count": 194234, | |
| "is_parallel": true, | |
| "self": 144.33288412582624, | |
| "children": { | |
| "UnityEnvironment._generate_step_input": { | |
| "total": 97.28593266392, | |
| "count": 194234, | |
| "is_parallel": true, | |
| "self": 97.28593266392 | |
| }, | |
| "communicator.exchange": { | |
| "total": 6766.264943513277, | |
| "count": 194234, | |
| "is_parallel": true, | |
| "self": 6766.264943513277 | |
| }, | |
| "steps_from_proto": { | |
| "total": 452.3859330987275, | |
| "count": 194234, | |
| "is_parallel": true, | |
| "self": 90.38882167350584, | |
| "children": { | |
| "_process_rank_one_or_two_observation": { | |
| "total": 361.99711142522165, | |
| "count": 1553872, | |
| "is_parallel": true, | |
| "self": 361.99711142522165 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_advance": { | |
| "total": 3134.041314538692, | |
| "count": 194235, | |
| "self": 14.318560169263947, | |
| "children": { | |
| "process_trajectory": { | |
| "total": 460.892764426384, | |
| "count": 194235, | |
| "self": 460.1573795283848, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.7353848979992108, | |
| "count": 6, | |
| "self": 0.7353848979992108 | |
| } | |
| } | |
| }, | |
| "_update_policy": { | |
| "total": 2658.829989943044, | |
| "count": 1383, | |
| "self": 1037.7273986292462, | |
| "children": { | |
| "TorchPPOOptimizer.update": { | |
| "total": 1621.1025913137978, | |
| "count": 68418, | |
| "self": 1621.1025913137978 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| }, | |
| "trainer_threads": { | |
| "total": 1.2309992598602548e-06, | |
| "count": 1, | |
| "self": 1.2309992598602548e-06 | |
| }, | |
| "TrainerController._save_models": { | |
| "total": 0.1184051130003354, | |
| "count": 1, | |
| "self": 0.005820735999805038, | |
| "children": { | |
| "RLTrainer._checkpoint": { | |
| "total": 0.11258437700053037, | |
| "count": 1, | |
| "self": 0.11258437700053037 | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } | |
| } |