Reinforcement Learning
stable-baselines3
seals/Ant-v0
deep-reinforcement-learning
Eval Results (legacy)
Instructions to use HumanCompatibleAI/sac-seals-Ant-v0 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- stable-baselines3
How to use HumanCompatibleAI/sac-seals-Ant-v0 with stable-baselines3:
from huggingface_sb3 import load_from_hub checkpoint = load_from_hub( repo_id="HumanCompatibleAI/sac-seals-Ant-v0", filename="{MODEL FILENAME}.zip", ) - Notebooks
- Google Colab
- Kaggle
Initial commit
Browse files- README.md +12 -4
- args.yml +11 -5
- config.yml +5 -1
- replay.mp4 +2 -2
- results.json +1 -1
- sac-seals-Ant-v0.zip +2 -2
- sac-seals-Ant-v0/_stable_baselines3_version +1 -1
- sac-seals-Ant-v0/actor.optimizer.pth +1 -1
- sac-seals-Ant-v0/critic.optimizer.pth +1 -1
- sac-seals-Ant-v0/data +27 -25
- sac-seals-Ant-v0/ent_coef_optimizer.pth +2 -2
- sac-seals-Ant-v0/policy.pth +1 -1
- sac-seals-Ant-v0/pytorch_variables.pth +1 -1
- sac-seals-Ant-v0/system_info.txt +2 -2
- train_eval_metrics.zip +2 -2
README.md
CHANGED
|
@@ -10,7 +10,7 @@ model-index:
|
|
| 10 |
results:
|
| 11 |
- metrics:
|
| 12 |
- type: mean_reward
|
| 13 |
-
value:
|
| 14 |
name: mean_reward
|
| 15 |
task:
|
| 16 |
type: reinforcement-learning
|
|
@@ -37,15 +37,21 @@ SB3 Contrib: https://github.com/Stable-Baselines-Team/stable-baselines3-contrib
|
|
| 37 |
|
| 38 |
```
|
| 39 |
# Download model and save it into the logs/ folder
|
| 40 |
-
python -m
|
| 41 |
python enjoy.py --algo sac --env seals/Ant-v0 -f logs/
|
| 42 |
```
|
| 43 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 44 |
## Training (with the RL Zoo)
|
| 45 |
```
|
| 46 |
python train.py --algo sac --env seals/Ant-v0 -f logs/
|
| 47 |
# Upload the model and generate video (when possible)
|
| 48 |
-
python -m
|
| 49 |
```
|
| 50 |
|
| 51 |
## Hyperparameters
|
|
@@ -58,7 +64,9 @@ OrderedDict([('batch_size', 512),
|
|
| 58 |
('n_timesteps', 1000000.0),
|
| 59 |
('policy', 'MlpPolicy'),
|
| 60 |
('policy_kwargs',
|
| 61 |
-
'
|
|
|
|
|
|
|
| 62 |
('tau', 0.05),
|
| 63 |
('train_freq', 64),
|
| 64 |
('normalize', False)])
|
|
|
|
| 10 |
results:
|
| 11 |
- metrics:
|
| 12 |
- type: mean_reward
|
| 13 |
+
value: 1057.04 +/- 13.50
|
| 14 |
name: mean_reward
|
| 15 |
task:
|
| 16 |
type: reinforcement-learning
|
|
|
|
| 37 |
|
| 38 |
```
|
| 39 |
# Download model and save it into the logs/ folder
|
| 40 |
+
python -m rl_zoo3.load_from_hub --algo sac --env seals/Ant-v0 -orga HumanCompatibleAI -f logs/
|
| 41 |
python enjoy.py --algo sac --env seals/Ant-v0 -f logs/
|
| 42 |
```
|
| 43 |
|
| 44 |
+
If you installed the RL Zoo3 via pip (`pip install rl_zoo3`), from anywhere you can do:
|
| 45 |
+
```
|
| 46 |
+
python -m rl_zoo3.load_from_hub --algo sac --env seals/Ant-v0 -orga HumanCompatibleAI -f logs/
|
| 47 |
+
rl_zoo3 enjoy --algo sac --env seals/Ant-v0 -f logs/
|
| 48 |
+
```
|
| 49 |
+
|
| 50 |
## Training (with the RL Zoo)
|
| 51 |
```
|
| 52 |
python train.py --algo sac --env seals/Ant-v0 -f logs/
|
| 53 |
# Upload the model and generate video (when possible)
|
| 54 |
+
python -m rl_zoo3.push_to_hub --algo sac --env seals/Ant-v0 -f logs/ -orga HumanCompatibleAI
|
| 55 |
```
|
| 56 |
|
| 57 |
## Hyperparameters
|
|
|
|
| 64 |
('n_timesteps', 1000000.0),
|
| 65 |
('policy', 'MlpPolicy'),
|
| 66 |
('policy_kwargs',
|
| 67 |
+
{'log_std_init': -2.2692589009754176,
|
| 68 |
+
'net_arch': [256, 256],
|
| 69 |
+
'use_sde': False}),
|
| 70 |
('tau', 0.05),
|
| 71 |
('train_freq', 64),
|
| 72 |
('normalize', False)])
|
args.yml
CHANGED
|
@@ -1,6 +1,8 @@
|
|
| 1 |
!!python/object/apply:collections.OrderedDict
|
| 2 |
- - - algo
|
| 3 |
- sac
|
|
|
|
|
|
|
| 4 |
- - device
|
| 5 |
- cpu
|
| 6 |
- - env
|
|
@@ -16,7 +18,7 @@
|
|
| 16 |
- - hyperparams
|
| 17 |
- null
|
| 18 |
- - log_folder
|
| 19 |
-
-
|
| 20 |
- - log_interval
|
| 21 |
- -1
|
| 22 |
- - max_total_trials
|
|
@@ -41,6 +43,8 @@
|
|
| 41 |
- null
|
| 42 |
- - optimize_hyperparameters
|
| 43 |
- false
|
|
|
|
|
|
|
| 44 |
- - pruner
|
| 45 |
- median
|
| 46 |
- - sampler
|
|
@@ -50,13 +54,13 @@
|
|
| 50 |
- - save_replay_buffer
|
| 51 |
- false
|
| 52 |
- - seed
|
| 53 |
-
-
|
| 54 |
- - storage
|
| 55 |
- null
|
| 56 |
- - study_name
|
| 57 |
- null
|
| 58 |
- - tensorboard_log
|
| 59 |
-
- runs/seals/Ant-
|
| 60 |
- - track
|
| 61 |
- true
|
| 62 |
- - trained_agent
|
|
@@ -70,6 +74,8 @@
|
|
| 70 |
- - verbose
|
| 71 |
- 1
|
| 72 |
- - wandb_entity
|
| 73 |
-
-
|
| 74 |
- - wandb_project_name
|
| 75 |
-
- seals-experts-
|
|
|
|
|
|
|
|
|
| 1 |
!!python/object/apply:collections.OrderedDict
|
| 2 |
- - - algo
|
| 3 |
- sac
|
| 4 |
+
- - conf_file
|
| 5 |
+
- hyperparams/python/sac.py
|
| 6 |
- - device
|
| 7 |
- cpu
|
| 8 |
- - env
|
|
|
|
| 18 |
- - hyperparams
|
| 19 |
- null
|
| 20 |
- - log_folder
|
| 21 |
+
- logs
|
| 22 |
- - log_interval
|
| 23 |
- -1
|
| 24 |
- - max_total_trials
|
|
|
|
| 43 |
- null
|
| 44 |
- - optimize_hyperparameters
|
| 45 |
- false
|
| 46 |
+
- - progress
|
| 47 |
+
- false
|
| 48 |
- - pruner
|
| 49 |
- median
|
| 50 |
- - sampler
|
|
|
|
| 54 |
- - save_replay_buffer
|
| 55 |
- false
|
| 56 |
- - seed
|
| 57 |
+
- 3
|
| 58 |
- - storage
|
| 59 |
- null
|
| 60 |
- - study_name
|
| 61 |
- null
|
| 62 |
- - tensorboard_log
|
| 63 |
+
- runs/seals/Ant-v0__sac__3__1670517964
|
| 64 |
- - track
|
| 65 |
- true
|
| 66 |
- - trained_agent
|
|
|
|
| 74 |
- - verbose
|
| 75 |
- 1
|
| 76 |
- - wandb_entity
|
| 77 |
+
- ernestum
|
| 78 |
- - wandb_project_name
|
| 79 |
+
- seals-experts-normalized
|
| 80 |
+
- - yaml_file
|
| 81 |
+
- null
|
config.yml
CHANGED
|
@@ -14,7 +14,11 @@
|
|
| 14 |
- - policy
|
| 15 |
- MlpPolicy
|
| 16 |
- - policy_kwargs
|
| 17 |
-
-
|
|
|
|
|
|
|
|
|
|
|
|
|
| 18 |
- - tau
|
| 19 |
- 0.05
|
| 20 |
- - train_freq
|
|
|
|
| 14 |
- - policy
|
| 15 |
- MlpPolicy
|
| 16 |
- - policy_kwargs
|
| 17 |
+
- log_std_init: -2.2692589009754176
|
| 18 |
+
net_arch:
|
| 19 |
+
- 256
|
| 20 |
+
- 256
|
| 21 |
+
use_sde: false
|
| 22 |
- - tau
|
| 23 |
- 0.05
|
| 24 |
- - train_freq
|
replay.mp4
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:410b44314c99e7a0c3bd6952ac6b9ecdfe4b728020d0e1a204c31e167f018563
|
| 3 |
+
size 1636947
|
results.json
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
{"mean_reward":
|
|
|
|
| 1 |
+
{"mean_reward": 1057.0398467999999, "std_reward": 13.504828543859672, "is_deterministic": true, "n_eval_episodes": 10, "eval_datetime": "2022-12-31T18:52:47.584388"}
|
sac-seals-Ant-v0.zip
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0cdb352673a261a19b59bca8e9b194096d042fc73ad9796ade540a3017899e6b
|
| 3 |
+
size 4357324
|
sac-seals-Ant-v0/_stable_baselines3_version
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
1.6.
|
|
|
|
| 1 |
+
1.6.2
|
sac-seals-Ant-v0/actor.optimizer.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 798877
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:151784ad7d769cfc6d94ec26c18563b5de6b83bb46cd39699726e8c7bbbaea73
|
| 3 |
size 798877
|
sac-seals-Ant-v0/critic.optimizer.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1565689
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c5e081ddc965e945673aace2c9acde7edeab4e3a41cc544ddf6caa96f65bfdb6
|
| 3 |
size 1565689
|
sac-seals-Ant-v0/data
CHANGED
|
@@ -4,17 +4,17 @@
|
|
| 4 |
":serialized:": "gAWVMAAAAAAAAACMHnN0YWJsZV9iYXNlbGluZXMzLnNhYy5wb2xpY2llc5SMCVNBQ1BvbGljeZSTlC4=",
|
| 5 |
"__module__": "stable_baselines3.sac.policies",
|
| 6 |
"__doc__": "\n Policy class (with both actor and critic) for SAC.\n\n :param observation_space: Observation space\n :param action_space: Action space\n :param lr_schedule: Learning rate schedule (could be constant)\n :param net_arch: The specification of the policy and value networks.\n :param activation_fn: Activation function\n :param use_sde: Whether to use State Dependent Exploration or not\n :param log_std_init: Initial value for the log standard deviation\n :param sde_net_arch: Network architecture for extracting features\n when using gSDE. If None, the latent features from the policy will be used.\n Pass an empty list to use the states as features.\n :param use_expln: Use ``expln()`` function instead of ``exp()`` when using gSDE to ensure\n a positive standard deviation (cf paper). It allows to keep variance\n above zero and prevent it from growing too fast. In practice, ``exp()`` is usually enough.\n :param clip_mean: Clip the mean output when using gSDE to avoid numerical instability.\n :param features_extractor_class: Features extractor to use.\n :param features_extractor_kwargs: Keyword arguments\n to pass to the features extractor.\n :param normalize_images: Whether to normalize images or not,\n dividing by 255.0 (True by default)\n :param optimizer_class: The optimizer to use,\n ``th.optim.Adam`` by default\n :param optimizer_kwargs: Additional keyword arguments,\n excluding the learning rate, to pass to the optimizer\n :param n_critics: Number of critic networks to create.\n :param share_features_extractor: Whether to share or not the features extractor\n between the actor and the critic (this saves computation time)\n ",
|
| 7 |
-
"__init__": "<function SACPolicy.__init__ at
|
| 8 |
-
"_build": "<function SACPolicy._build at
|
| 9 |
-
"_get_constructor_parameters": "<function SACPolicy._get_constructor_parameters at
|
| 10 |
-
"reset_noise": "<function SACPolicy.reset_noise at
|
| 11 |
-
"make_actor": "<function SACPolicy.make_actor at
|
| 12 |
-
"make_critic": "<function SACPolicy.make_critic at
|
| 13 |
-
"forward": "<function SACPolicy.forward at
|
| 14 |
-
"_predict": "<function SACPolicy._predict at
|
| 15 |
-
"set_training_mode": "<function SACPolicy.set_training_mode at
|
| 16 |
"__abstractmethods__": "frozenset()",
|
| 17 |
-
"_abc_impl": "<_abc_data object at
|
| 18 |
},
|
| 19 |
"verbose": 1,
|
| 20 |
"policy_kwargs": {
|
|
@@ -40,7 +40,7 @@
|
|
| 40 |
},
|
| 41 |
"action_space": {
|
| 42 |
":type:": "<class 'gym.spaces.box.Box'>",
|
| 43 |
-
":serialized:": "gAWVJwwAAAAAAACMDmd5bS5zcGFjZXMuYm94lIwDQm94lJOUKYGUfZQojAVkdHlwZZSMBW51bXB5lGgFk5SMAmY0lImIh5RSlChLA4wBPJROTk5K/////0r/////SwB0lGKMBl9zaGFwZZRLCIWUjANsb3eUjBJudW1weS5jb3JlLm51bWVyaWOUjAtfZnJvbWJ1ZmZlcpSTlCiWIAAAAAAAAAAAAIC/AACAvwAAgL8AAIC/AACAvwAAgL8AAIC/AACAv5RoCksIhZSMAUOUdJRSlIwEaGlnaJRoEiiWIAAAAAAAAAAAAIA/AACAPwAAgD8AAIA/AACAPwAAgD8AAIA/AACAP5RoCksIhZRoFXSUUpSMDWJvdW5kZWRfYmVsb3eUaBIolggAAAAAAAAAAQEBAQEBAQGUaAeMAmIxlImIh5RSlChLA4wBfJROTk5K/////0r/////
|
| 44 |
"dtype": "float32",
|
| 45 |
"_shape": [
|
| 46 |
8
|
|
@@ -55,17 +55,17 @@
|
|
| 55 |
"num_timesteps": 1000000,
|
| 56 |
"_total_timesteps": 1000000,
|
| 57 |
"_num_timesteps_at_start": 0,
|
| 58 |
-
"seed":
|
| 59 |
"action_noise": null,
|
| 60 |
-
"start_time":
|
| 61 |
"learning_rate": {
|
| 62 |
":type:": "<class 'function'>",
|
| 63 |
-
":serialized:": "
|
| 64 |
},
|
| 65 |
-
"tensorboard_log": "runs/seals/Ant-
|
| 66 |
"lr_schedule": {
|
| 67 |
":type:": "<class 'function'>",
|
| 68 |
-
":serialized:": "
|
| 69 |
},
|
| 70 |
"_last_obs": null,
|
| 71 |
"_last_episode_starts": {
|
|
@@ -74,7 +74,7 @@
|
|
| 74 |
},
|
| 75 |
"_last_original_obs": {
|
| 76 |
":type:": "<class 'numpy.ndarray'>",
|
| 77 |
-
":serialized:": "gAWV/
|
| 78 |
},
|
| 79 |
"_episode_num": 1000,
|
| 80 |
"use_sde": false,
|
|
@@ -82,7 +82,7 @@
|
|
| 82 |
"_current_progress_remaining": 0.0,
|
| 83 |
"ep_info_buffer": {
|
| 84 |
":type:": "<class 'collections.deque'>",
|
| 85 |
-
":serialized:": "gAWVgRAAAAAAAACMC2NvbGxlY3Rpb25zlIwFZGVxdWWUk5QpS2SGlFKUKH2UKIwBcpSMFW51bXB5LmNvcmUubXVsdGlhcnJheZSMBnNjYWxhcpSTlIwFbnVtcHmUjAVkdHlwZZSTlIwCZjiUiYiHlFKUKEsDjAE8lE5OTkr/////Sv////
|
| 86 |
},
|
| 87 |
"ep_success_buffer": {
|
| 88 |
":type:": "<class 'collections.deque'>",
|
|
@@ -100,13 +100,13 @@
|
|
| 100 |
":type:": "<class 'abc.ABCMeta'>",
|
| 101 |
":serialized:": "gAWVNQAAAAAAAACMIHN0YWJsZV9iYXNlbGluZXMzLmNvbW1vbi5idWZmZXJzlIwMUmVwbGF5QnVmZmVylJOULg==",
|
| 102 |
"__module__": "stable_baselines3.common.buffers",
|
| 103 |
-
"__doc__": "\n Replay buffer used in off-policy algorithms like SAC/TD3.\n\n :param buffer_size: Max number of element in the buffer\n :param observation_space: Observation space\n :param action_space: Action space\n :param device:\n :param n_envs: Number of parallel environments\n :param optimize_memory_usage: Enable a memory efficient variant\n of the replay buffer which reduces by almost a factor two the memory used,\n at a cost of more complexity.\n See https://github.com/DLR-RM/stable-baselines3/issues/37#issuecomment-637501195\n and https://github.com/DLR-RM/stable-baselines3/pull/28#issuecomment-637559274\n Cannot be used in combination with handle_timeout_termination.\n :param handle_timeout_termination: Handle timeout termination (due to timelimit)\n separately and treat the task as infinite horizon task.\n https://github.com/DLR-RM/stable-baselines3/issues/284\n ",
|
| 104 |
-
"__init__": "<function ReplayBuffer.__init__ at
|
| 105 |
-
"add": "<function ReplayBuffer.add at
|
| 106 |
-
"sample": "<function ReplayBuffer.sample at
|
| 107 |
-
"_get_samples": "<function ReplayBuffer._get_samples at
|
| 108 |
"__abstractmethods__": "frozenset()",
|
| 109 |
-
"_abc_impl": "<_abc_data object at
|
| 110 |
},
|
| 111 |
"replay_buffer_kwargs": {},
|
| 112 |
"train_freq": {
|
|
@@ -116,5 +116,7 @@
|
|
| 116 |
"use_sde_at_warmup": false,
|
| 117 |
"target_entropy": -8.0,
|
| 118 |
"ent_coef": "auto",
|
| 119 |
-
"target_update_interval": 1
|
|
|
|
|
|
|
| 120 |
}
|
|
|
|
| 4 |
":serialized:": "gAWVMAAAAAAAAACMHnN0YWJsZV9iYXNlbGluZXMzLnNhYy5wb2xpY2llc5SMCVNBQ1BvbGljeZSTlC4=",
|
| 5 |
"__module__": "stable_baselines3.sac.policies",
|
| 6 |
"__doc__": "\n Policy class (with both actor and critic) for SAC.\n\n :param observation_space: Observation space\n :param action_space: Action space\n :param lr_schedule: Learning rate schedule (could be constant)\n :param net_arch: The specification of the policy and value networks.\n :param activation_fn: Activation function\n :param use_sde: Whether to use State Dependent Exploration or not\n :param log_std_init: Initial value for the log standard deviation\n :param sde_net_arch: Network architecture for extracting features\n when using gSDE. If None, the latent features from the policy will be used.\n Pass an empty list to use the states as features.\n :param use_expln: Use ``expln()`` function instead of ``exp()`` when using gSDE to ensure\n a positive standard deviation (cf paper). It allows to keep variance\n above zero and prevent it from growing too fast. In practice, ``exp()`` is usually enough.\n :param clip_mean: Clip the mean output when using gSDE to avoid numerical instability.\n :param features_extractor_class: Features extractor to use.\n :param features_extractor_kwargs: Keyword arguments\n to pass to the features extractor.\n :param normalize_images: Whether to normalize images or not,\n dividing by 255.0 (True by default)\n :param optimizer_class: The optimizer to use,\n ``th.optim.Adam`` by default\n :param optimizer_kwargs: Additional keyword arguments,\n excluding the learning rate, to pass to the optimizer\n :param n_critics: Number of critic networks to create.\n :param share_features_extractor: Whether to share or not the features extractor\n between the actor and the critic (this saves computation time)\n ",
|
| 7 |
+
"__init__": "<function SACPolicy.__init__ at 0x7f75a4406ee0>",
|
| 8 |
+
"_build": "<function SACPolicy._build at 0x7f75a4406f70>",
|
| 9 |
+
"_get_constructor_parameters": "<function SACPolicy._get_constructor_parameters at 0x7f75a438f040>",
|
| 10 |
+
"reset_noise": "<function SACPolicy.reset_noise at 0x7f75a438f0d0>",
|
| 11 |
+
"make_actor": "<function SACPolicy.make_actor at 0x7f75a438f160>",
|
| 12 |
+
"make_critic": "<function SACPolicy.make_critic at 0x7f75a438f1f0>",
|
| 13 |
+
"forward": "<function SACPolicy.forward at 0x7f75a438f280>",
|
| 14 |
+
"_predict": "<function SACPolicy._predict at 0x7f75a438f310>",
|
| 15 |
+
"set_training_mode": "<function SACPolicy.set_training_mode at 0x7f75a438f3a0>",
|
| 16 |
"__abstractmethods__": "frozenset()",
|
| 17 |
+
"_abc_impl": "<_abc_data object at 0x7f75a4404c90>"
|
| 18 |
},
|
| 19 |
"verbose": 1,
|
| 20 |
"policy_kwargs": {
|
|
|
|
| 40 |
},
|
| 41 |
"action_space": {
|
| 42 |
":type:": "<class 'gym.spaces.box.Box'>",
|
| 43 |
+
":serialized:": "gAWVJwwAAAAAAACMDmd5bS5zcGFjZXMuYm94lIwDQm94lJOUKYGUfZQojAVkdHlwZZSMBW51bXB5lGgFk5SMAmY0lImIh5RSlChLA4wBPJROTk5K/////0r/////SwB0lGKMBl9zaGFwZZRLCIWUjANsb3eUjBJudW1weS5jb3JlLm51bWVyaWOUjAtfZnJvbWJ1ZmZlcpSTlCiWIAAAAAAAAAAAAIC/AACAvwAAgL8AAIC/AACAvwAAgL8AAIC/AACAv5RoCksIhZSMAUOUdJRSlIwEaGlnaJRoEiiWIAAAAAAAAAAAAIA/AACAPwAAgD8AAIA/AACAPwAAgD8AAIA/AACAP5RoCksIhZRoFXSUUpSMDWJvdW5kZWRfYmVsb3eUaBIolggAAAAAAAAAAQEBAQEBAQGUaAeMAmIxlImIh5RSlChLA4wBfJROTk5K/////0r/////SwB0lGJLCIWUaBV0lFKUjA1ib3VuZGVkX2Fib3ZllGgSKJYIAAAAAAAAAAEBAQEBAQEBlGghSwiFlGgVdJRSlIwKX25wX3JhbmRvbZSMFG51bXB5LnJhbmRvbS5fcGlja2xllIwSX19yYW5kb21zdGF0ZV9jdG9ylJOUjAdNVDE5OTM3lIWUUpR9lCiMDWJpdF9nZW5lcmF0b3KUaDCMBXN0YXRllH2UKIwDa2V5lGgSKJbACQAAAAAAAAAAAICWR4dW2nD4c9/tiD9yYQ5UOve/7nXhzaP9+vAxRRXodL2vC07Qfea8Q7YKIAr6iJY63fvVCljH2w97/zNxhBcWHKA2zKTgZ5bu9v8YY5SoITEA1VoQPXW4FUlQoEin0WsSEEzTAvpEyz73ckUSH613mxt5/ErHc38ZhBxPJ3W6TwkrI1XsTCQcYP02bKbSWxpmmex3QluSxwW/36vVmlw7ODOYTtk/Uk4U0fA0akVQ9SCMK3c1Xu/BCghERTGKwlhve0FL21w4icEwDRl0WJvIwts9JzZpoZ0r9v/W/pfR4GqJP+tuDTbMZ8D78eCPldHUFW3orfAuzaCuQV27Tjd+GWUytFCMA1WtrFLbGaTtd9emacXMhDqqC0XqR6NYdB47IDs6TtiTep2osMPn4y7HUCah8WWxAJKTzvo5GM76PGLP23miUh+G9m6svcUKBmLglfYVeksj8aOeOZnn7FfzQ1B2OIEy1WVOmLGW6PH779zK/ybasJ3Vmo3frEcGh390M2fUnYGcZsV3BkZocLzHZN3k4IdP9e15NE3pgeIEh1f7/QNuMHFej1IqajFdWqBsODbsS31CazisIwVNUXkMEsYDaSQAs83RmDWZC1lHWYhE7ROz6vn+lCIaRRLbzUO+mXfPfrg+twBQJ+P90TQuxJRvnZkE043DvrDDqwng7EsD/mthfp6xnQ2NWDse/XGnohHAtoL0Ut8oDu3/+jLA4QUGQ2dfWLvRt1QDE2njs2JaAhsBPzwy8oza2P1cun9SpjT8YpgK5HRIj2YMGoH5+PPWfv/3pE4m6Lu5S3tpGJkBljZ6QyM9NSobvrWuFUek7XJ0h/P4nJqwiaP6KsRAw7U5deVAFGEu1NWesKqL5Vt8miGAMX4pk2vghojcNf9+9+Gf8fWD18pE/cz1otQEvjJ6auVzkAgNJ3gmeSXWC1VBVT4imQLt/cejUhPiNM8/mbiJ3Utgwt8wpqLaA8xrPxfftRaxkQSxh3qUXoL/To7HYO+WFi6/gZoew7VXhLmzGB2/hy6+Xe2emdVPNfInKWLG6vTN+xJybi3SMzvxVPULHYEz4yciJxRX9GM4gdQQbIl0UA39RU8o9J7otzJ8IpWJY71kwofBgxzdJhVg3UJES4cFKHogpPKLqv231DuvoMW0Frp+OSO9/f/RueALgbyfT4nmxHpfpkowsw/+667vhL5mc8ieM0N5W6RoyXYy96wqs1qwkhMaGqi+NMqVImue1lPiap/gbAN8KF4JKcYOdfq0swL8js5ix9mtP6apwY2vP3HjznmqJvLdwAmJoS0M1lUt86bZr5FDNov6NPLjvbZ43s6E4nthjAs9SnXt2zpG1DObUGkcAC60vKnxYu0rBEdPfFs1dEs3g+b5Urcne/PWW8j8B6zTXNy9NmisZQZTWUSFhJTBzmERMb3yMwYzrsTt679vkuy0tdQ2BQb3vr7iSQPYnGqnI/xkARj1tdQrNRUZaIxtP93zC08RZlL1WYvKTNW3sPL3bVCW/zIJNBUnmu7YYahDPEVeOA+M8YrXc9slu3RkRUg7bXnHcMFfuj2g0jxMgiEwvp0yISF4aa25TCWaY9dGAZhQZD+IZXvTz9Wk2ayDt4dVIt4ab72GMsyROJu5wxHM6VsKTnPFMnhwNiBgtmGZzDW3CAsuX9W0wcAKRL04oZj+z9k/BJVYsWPagmO8++yejQMlbTCcjeIDx++NcqiRv8wa/P0WIJZIKPJ7q/HhY/lid6EHBq+LzSCX0TFg+ujCfOhUovQRfHUO+fDN96ah3hkyk5m3wEWf2Gu7fAM75H7XIJzH92ubHP8Ls6MjwmxntptTNs/NLD+pdYLOFgHkmlMTeCcERp/MV9RDuWYZqmOGDPhOHK9Iw/8E7vJ80xBO068021RpCy+OgmFkjn2EAAVhxTrf9XKbmxbVjSKvpy87zehLeWM9VB5PVhdtG+jwI8ZZNpbH+Bi7Oe8QwhYEbktHgywd3xD6PmW1SAjix/GSvgDQ1VedqhQsC2t3lzuWrQTcQxY9rZ4a3P89DaGLcZFRi1BEywIsEuU7h0lPo2TfiLvzjiD1v8yYHRYwc/y08pDgpCXT5OUG5AfnIQ93I9LxzZnAkhWWKmI5elZKL4kEQAemuLwH+dBeDgJ/TlgXGquP7CJ5teLwDXTDKWO+PNW3vsN/MIFIeidhRItD2crkDGb47YQKu0BINGvY6wxfgoAjtjwVBhfBPZNq0IG9T9AcxhIpnlUsA9cezFu4yFgvRCGK1L5mp6snqou1YMrk4Qclrcak4uw4JNDJaoBlAb7FrC3ZNF8tHAItc8j/dGTGS3u3RCHDYdiIycz2EdguhwCqz/F9lToY+APSceGnXqGtwI5UE1cryWm373d/WOFG4VNAuhTXO22qBzgfM5SfaY8eyp8Zi9+3+Wh/5F5GGcQ2SimAhgq+JpgouRo9viEP1PGdElzPNnXh6PNuexia+2sTsaeDZ4fy79OxnQaK1JfWYqr+1Pz87O0TMwOg1FOFnCsTgJDxUNHSlS2JFhlP0S71oUQ3mAPo8K0pKLLHYnSiZ5xow9JcHE6trA3jFU0MeIJxrYLI29TAfz/ek1Q4yEVeptrzzQhpuOKFjDtw/kFvXUStQY3r96tLQ8SecKEflEBeWL71jIp43HSuJnpHJnwPlJvT5aBfVRRA1raMgN1LH8lLKbHt8f3cjvNgonP5r68dfaF/pefUjLUKkVaGDoGpLrFUYIuuCSZGWx/3S2DrSu/lW7UCUH5qYYB9eM1q6k+x7u9XQly0dugfE2TRc4lEGuh7Z8LbNsnm9ZNV4ooOLN8fV7B5KdzgDR4v3jsFYZ1bk7sG3nda5lwxSIM2lHujaPPWK2ue1fJ3cLG8SCeOPKnSZeOhu1b7yHghfyeea+JX3UG5kAihCsL4gX2/lZ4g4VDXTOc6NDFha92SmVFIpgcTfpXRjyZki9TrrNvPKfexbnqpbi6PG2SHWoe2DTUUrowOlhhDqIIswnn+YEviyijFNHNjrGUxkdWqeZeNdEMi2CQRawxp14E19CHV5/2VhFbYpvoqlPDfnBVcNSF0B3dzf0zNuVCd3ARBPJVcqJCorcV+VcOYzUa+Lqroeb4gVrkBnxkomXfMxYjzVDr+EMDPgL9q6Kbl9sY08lAVs1l2Twp5p7RFIK82vVZXRE9lwcWOdU9esRxTWKrygc+BYQYtIwZffRv/9FEWM5DuXKfM9J9AaY7T2McwQV8mrGZM9RYHA7ZV+rIufnyqbZea6n9Min8s0zL+xj1GLZq4SESxXJY0x+mZETcy1kctTRwsQ21u5F03NJjvbjpryJRoB4wCdTSUiYiHlFKUKEsDaAtOTk5K/////0r/////SwB0lGJNcAKFlGgVdJRSlIwDcG9zlE1wAnWMCWhhc19nYXVzc5RLAIwFZ2F1c3OURwAAAAAAAAAAdWJ1Yi4=",
|
| 44 |
"dtype": "float32",
|
| 45 |
"_shape": [
|
| 46 |
8
|
|
|
|
| 55 |
"num_timesteps": 1000000,
|
| 56 |
"_total_timesteps": 1000000,
|
| 57 |
"_num_timesteps_at_start": 0,
|
| 58 |
+
"seed": 10,
|
| 59 |
"action_noise": null,
|
| 60 |
+
"start_time": 1670518056928152816,
|
| 61 |
"learning_rate": {
|
| 62 |
":type:": "<class 'function'>",
|
| 63 |
+
":serialized:": "gAWVhQIAAAAAAACMF2Nsb3VkcGlja2xlLmNsb3VkcGlja2xllIwOX21ha2VfZnVuY3Rpb26Uk5QoaACMDV9idWlsdGluX3R5cGWUk5SMCENvZGVUeXBllIWUUpQoSwFLAEsASwFLAUsTQwSIAFMAlE6FlCmMAV+UhZSMUy9ob21lL21heGltaWxpYW4vdmVudi9saWIvcHl0aG9uMy44L3NpdGUtcGFja2FnZXMvc3RhYmxlX2Jhc2VsaW5lczMvY29tbW9uL3V0aWxzLnB5lIwEZnVuY5RLgEMCAAGUjAN2YWyUhZQpdJRSlH2UKIwLX19wYWNrYWdlX1+UjBhzdGFibGVfYmFzZWxpbmVzMy5jb21tb26UjAhfX25hbWVfX5SMHnN0YWJsZV9iYXNlbGluZXMzLmNvbW1vbi51dGlsc5SMCF9fZmlsZV9flGgMdU5OaACMEF9tYWtlX2VtcHR5X2NlbGyUk5QpUpSFlHSUUpSMHGNsb3VkcGlja2xlLmNsb3VkcGlja2xlX2Zhc3SUjBJfZnVuY3Rpb25fc2V0c3RhdGWUk5RoHn2UfZQoaBZoDYwMX19xdWFsbmFtZV9flIwZY29uc3RhbnRfZm4uPGxvY2Fscz4uZnVuY5SMD19fYW5ub3RhdGlvbnNfX5R9lIwOX19rd2RlZmF1bHRzX1+UTowMX19kZWZhdWx0c19flE6MCl9fbW9kdWxlX1+UaBeMB19fZG9jX1+UTowLX19jbG9zdXJlX1+UaACMCl9tYWtlX2NlbGyUk5RHP15VWdVF2e2FlFKUhZSMF19jbG91ZHBpY2tsZV9zdWJtb2R1bGVzlF2UjAtfX2dsb2JhbHNfX5R9lHWGlIZSMC4="
|
| 64 |
},
|
| 65 |
+
"tensorboard_log": "runs/seals/Ant-v0__sac__3__1670517964/seals-Ant-v0",
|
| 66 |
"lr_schedule": {
|
| 67 |
":type:": "<class 'function'>",
|
| 68 |
+
":serialized:": "gAWVhQIAAAAAAACMF2Nsb3VkcGlja2xlLmNsb3VkcGlja2xllIwOX21ha2VfZnVuY3Rpb26Uk5QoaACMDV9idWlsdGluX3R5cGWUk5SMCENvZGVUeXBllIWUUpQoSwFLAEsASwFLAUsTQwSIAFMAlE6FlCmMAV+UhZSMUy9ob21lL21heGltaWxpYW4vdmVudi9saWIvcHl0aG9uMy44L3NpdGUtcGFja2FnZXMvc3RhYmxlX2Jhc2VsaW5lczMvY29tbW9uL3V0aWxzLnB5lIwEZnVuY5RLgEMCAAGUjAN2YWyUhZQpdJRSlH2UKIwLX19wYWNrYWdlX1+UjBhzdGFibGVfYmFzZWxpbmVzMy5jb21tb26UjAhfX25hbWVfX5SMHnN0YWJsZV9iYXNlbGluZXMzLmNvbW1vbi51dGlsc5SMCF9fZmlsZV9flGgMdU5OaACMEF9tYWtlX2VtcHR5X2NlbGyUk5QpUpSFlHSUUpSMHGNsb3VkcGlja2xlLmNsb3VkcGlja2xlX2Zhc3SUjBJfZnVuY3Rpb25fc2V0c3RhdGWUk5RoHn2UfZQoaBZoDYwMX19xdWFsbmFtZV9flIwZY29uc3RhbnRfZm4uPGxvY2Fscz4uZnVuY5SMD19fYW5ub3RhdGlvbnNfX5R9lIwOX19rd2RlZmF1bHRzX1+UTowMX19kZWZhdWx0c19flE6MCl9fbW9kdWxlX1+UaBeMB19fZG9jX1+UTowLX19jbG9zdXJlX1+UaACMCl9tYWtlX2NlbGyUk5RHP15VWdVF2e2FlFKUhZSMF19jbG91ZHBpY2tsZV9zdWJtb2R1bGVzlF2UjAtfX2dsb2JhbHNfX5R9lHWGlIZSMC4="
|
| 69 |
},
|
| 70 |
"_last_obs": null,
|
| 71 |
"_last_episode_starts": {
|
|
|
|
| 74 |
},
|
| 75 |
"_last_original_obs": {
|
| 76 |
":type:": "<class 'numpy.ndarray'>",
|
| 77 |
+
":serialized:": "gAWV/QMAAAAAAACMEm51bXB5LmNvcmUubnVtZXJpY5SMC19mcm9tYnVmZmVylJOUKJaIAwAAAAAAAKxB8vZEJCFAqEQ12BduCcDAnQD89TniP8RvAmOg9u8/N48n1GUWp79b0qQoDdGPP/6t41O+4my/93RivYfE4D8gTWCKF3noP/pyCHtUxuA/Ffbj/SZT5L9qsHY2pcTgv6WUzYDkjfO/f29nNBfO4L8E4IR/ro3zP+YqGnCem6K/tTCGIjaAY79HLj5lMRepP1/zvisr87k/cNsQ5fUnlr9TYnE77yC0P0w7p0n19W6/iFmsdQxk4D/Na2OTQjYoP1aY0yblWfC/7LQXV7u1YT9V5d5ClZJKPxSmLII9cme/5Al/MtUnc78AAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAACUjAVudW1weZSMBWR0eXBllJOUjAJmOJSJiIeUUpQoSwOMATyUTk5OSv////9K/////0sAdJRiSwFLcYaUjAFDlHSUUpQu"
|
| 78 |
},
|
| 79 |
"_episode_num": 1000,
|
| 80 |
"use_sde": false,
|
|
|
|
| 82 |
"_current_progress_remaining": 0.0,
|
| 83 |
"ep_info_buffer": {
|
| 84 |
":type:": "<class 'collections.deque'>",
|
| 85 |
+
":serialized:": "gAWVgRAAAAAAAACMC2NvbGxlY3Rpb25zlIwFZGVxdWWUk5QpS2SGlFKUKH2UKIwBcpSMFW51bXB5LmNvcmUubXVsdGlhcnJheZSMBnNjYWxhcpSTlIwFbnVtcHmUjAVkdHlwZZSTlIwCZjiUiYiHlFKUKEsDjAE8lE5OTkr/////Sv////9LAHSUYkMIQuigS8gKkECUhpRSlIwBbJRN6AOMAXSUR0CmyJVEuxr0dX2UKGgGaAloD0MI7GtdaiSkj0CUhpRSlGgVTegDaBZHQKbNsjlgc951fZQoaAZoCWgPQwhMa9PYnu+PQJSGlFKUaBVN6ANoFkdAptMoRujynXV9lChoBmgJaA9DCN7H0RwZpY5AlIaUUpRoFU3oA2gWR0Cm2h+iSJTEdX2UKGgGaAloD0MIc/IiE3CcjUCUhpRSlGgVTegDaBZHQKbfh8ZUDMh1fZQoaAZoCWgPQwgVqwZhro2LQJSGlFKUaBVN6ANoFkdApuRUyFfzBnV9lChoBmgJaA9DCP34S4v6349AlIaUUpRoFU3oA2gWR0Cm6Uvva11GdX2UKGgGaAloD0MIogxVMTVjj0CUhpRSlGgVTegDaBZHQKbvvPZZjhF1fZQoaAZoCWgPQwjyBpj57rSNQJSGlFKUaBVN6ANoFkdApvUDwWnCO3V9lChoBmgJaA9DCDf+RGVDvo5AlIaUUpRoFU3oA2gWR0Cm+txVp9JCdX2UKGgGaAloD0MIqU4Hsr6ehkCUhpRSlGgVTegDaBZHQKcAQ9RJmNB1fZQoaAZoCWgPQwjnw7MECQqQQJSGlFKUaBVN6ANoFkdApwVbOmixmnV9lChoBmgJaA9DCKorn+XZn4xAlIaUUpRoFU3oA2gWR0CnCmnuAqd6dX2UKGgGaAloD0MIhbTGoHNzjECUhpRSlGgVTegDaBZHQKcPn8n/kvN1fZQoaAZoCWgPQwgzNQnekJCPQJSGlFKUaBVN6ANoFkdApxRyKxcE/3V9lChoBmgJaA9DCAfwFkjQdo5AlIaUUpRoFU3oA2gWR0CnGn9Oh0yQdX2UKGgGaAloD0MIB+5AnZL9j0CUhpRSlGgVTegDaBZHQKcff59mYjV1fZQoaAZoCWgPQwi7nX3loUKPQJSGlFKUaBVN6ANoFkdApyRcJF9a2XV9lChoBmgJaA9DCKpFRDFpDJBAlIaUUpRoFU3oA2gWR0CnKaQpON5udX2UKGgGaAloD0MIyNEcWXkbj0CUhpRSlGgVTegDaBZHQKcuhbUPQOZ1fZQoaAZoCWgPQwjtuOF386qNQJSGlFKUaBVN6ANoFkdApzNljPOY6XV9lChoBmgJaA9DCDNuaqA5iI9AlIaUUpRoFU3oA2gWR0CnOFYPoV2zdX2UKGgGaAloD0MIbazEPKtXjUCUhpRSlGgVTegDaBZHQKc9bye7L+x1fZQoaAZoCWgPQwirJLIP8qaOQJSGlFKUaBVN6ANoFkdAp0LCSLZSN3V9lChoBmgJaA9DCPpGdM96P49AlIaUUpRoFU3oA2gWR0CnSNEB0ZFYdX2UKGgGaAloD0MIiPVGrTB/jkCUhpRSlGgVTegDaBZHQKdd2ZVGTcJ1fZQoaAZoCWgPQwiuoGmJVSKOQJSGlFKUaBVN6ANoFkdAp2LaHfuTinV9lChoBmgJaA9DCIY8ghupDo9AlIaUUpRoFU3oA2gWR0CnaAcFpwjudX2UKGgGaAloD0MIADlhwgj/jkCUhpRSlGgVTegDaBZHQKdtHvNu+AV1fZQoaAZoCWgPQwgKLlbUAOyPQJSGlFKUaBVN6ANoFkdAp3JVGTcIq3V9lChoBmgJaA9DCOl+TkF+2o9AlIaUUpRoFU3oA2gWR0Cndxp04iosdX2UKGgGaAloD0MINiBCXHkej0CUhpRSlGgVTegDaBZHQKd72fbKzRh1fZQoaAZoCWgPQwidmzbjVLiPQJSGlFKUaBVN6ANoFkdAp4DnDrJKa3V9lChoBmgJaA9DCOdQhqpYiY9AlIaUUpRoFU3oA2gWR0CnhbTv7WNFdX2UKGgGaAloD0MIHY8ZqGx/j0CUhpRSlGgVTegDaBZHQKeKlThHbyp1fZQoaAZoCWgPQwhnKy/5Xz6NQJSGlFKUaBVN6ANoFkdAp4/xqTKT0XV9lChoBmgJaA9DCC13ZoIhS45AlIaUUpRoFU3oA2gWR0CnlL8CPp6hdX2UKGgGaAloD0MIoUliSXkijkCUhpRSlGgVTegDaBZHQKeanDSgGr11fZQoaAZoCWgPQwhLWvENxSCQQJSGlFKUaBVN6ANoFkdAp5+K6Ymb9nV9lChoBmgJaA9DCI82jlgLCI9AlIaUUpRoFU3oA2gWR0CnpSji4rjHdX2UKGgGaAloD0MI4KEo0EdXj0CUhpRSlGgVTegDaBZHQKeqBjzZpSJ1fZQoaAZoCWgPQwgzpfW3dHaQQJSGlFKUaBVN6ANoFkdAp67MF+uvEHV9lChoBmgJaA9DCOBMTBdSAJBAlIaUUpRoFU3oA2gWR0Cns7UfxMFmdX2UKGgGaAloD0MIqinJOlxmjkCUhpRSlGgVTegDaBZHQKe42bExZdR1fZQoaAZoCWgPQwheDrvvGOiOQJSGlFKUaBVN6ANoFkdAp7337+DODHV9lChoBmgJaA9DCNcWnpfqGJBAlIaUUpRoFU3oA2gWR0Cnwx1IAfdRdX2UKGgGaAloD0MIJO6x9CEbj0CUhpRSlGgVTegDaBZHQKfH02R7qpt1fZQoaAZoCWgPQwgKLlbUIK2OQJSGlFKUaBVN6ANoFkdAp8zHCuU2UHV9lChoBmgJaA9DCEPLun8MZY5AlIaUUpRoFU3oA2gWR0Cn0Zvddmg8dX2UKGgGaAloD0MIXHSy1HrTjkCUhpRSlGgVTegDaBZHQKfWbzS1E3N1fZQoaAZoCWgPQwjb4ET0686NQJSGlFKUaBVN6ANoFkdAp+3J7gKnenV9lChoBmgJaA9DCOFembeK4YtAlIaUUpRoFU3oA2gWR0Cn8o8kleF+dX2UKGgGaAloD0MIW+z2WaXvi0CUhpRSlGgVTegDaBZHQKf3RAbhm5F1fZQoaAZoCWgPQwi77UJzvQaPQJSGlFKUaBVN6ANoFkdAp/wGg3974XV9lChoBmgJaA9DCFJGXAD67otAlIaUUpRoFU3oA2gWR0CoAVTKLbYcdX2UKGgGaAloD0MI78aCwgClj0CUhpRSlGgVTegDaBZHQKgG1zOoo/l1fZQoaAZoCWgPQwjbwB2o86yPQJSGlFKUaBVN6ANoFkdAqAyuhdt2tHV9lChoBmgJaA9DCCYA/5SK5Y5AlIaUUpRoFU3oA2gWR0CoEY+rdWQwdX2UKGgGaAloD0MITUusjIY0jkCUhpRSlGgVTegDaBZHQKgWjWXC0nh1fZQoaAZoCWgPQwiYTYBhGdmOQJSGlFKUaBVN6ANoFkdAqBtaLl3hXXV9lChoBmgJaA9DCJbpl4i3I41AlIaUUpRoFU3oA2gWR0CoIb3Q2MsIdX2UKGgGaAloD0MI8parH3uxjUCUhpRSlGgVTegDaBZHQKgmzoK2KEZ1fZQoaAZoCWgPQwizJEBNrRWMQJSGlFKUaBVN6ANoFkdAqCut1r6+FnV9lChoBmgJaA9DCEHV6NWAG45AlIaUUpRoFU3oA2gWR0CoMKc6NlyzdX2UKGgGaAloD0MI+1qXGkEQkECUhpRSlGgVTegDaBZHQKg1mBas6q91fZQoaAZoCWgPQwh+OEiIUvyNQJSGlFKUaBVN6ANoFkdAqDqKE12q1nV9lChoBmgJaA9DCKDejJoPXo5AlIaUUpRoFU3oA2gWR0CoQCOUt7KJdX2UKGgGaAloD0MIiUShZd33j0CUhpRSlGgVTegDaBZHQKhFJeKKpDN1fZQoaAZoCWgPQwjp0yr6g9qPQJSGlFKUaBVN6ANoFkdAqEpkPnSv1XV9lChoBmgJaA9DCPvOL0owB41AlIaUUpRoFU3oA2gWR0CoT3WsaKk3dX2UKGgGaAloD0MItmeWBCjfjECUhpRSlGgVTegDaBZHQKhUhrC3w1B1fZQoaAZoCWgPQwjf/lw0ZF6PQJSGlFKUaBVN6ANoFkdAqFn0G/vfCXV9lChoBmgJaA9DCCbHndJhEIxAlIaUUpRoFU3oA2gWR0CoXvIHLRrrdX2UKGgGaAloD0MIRWKCGp6djkCUhpRSlGgVTegDaBZHQKhj5ps41gp1fZQoaAZoCWgPQwiZnxuaMh+NQJSGlFKUaBVN6ANoFkdAqGkZeu3c6HV9lChoBmgJaA9DCBhcc0d/iY9AlIaUUpRoFU3oA2gWR0CofnB7mdRSdX2UKGgGaAloD0MIuFuSAzbzjkCUhpRSlGgVTegDaBZHQKiDfyPuG9J1fZQoaAZoCWgPQwhSRfEqC02OQJSGlFKUaBVN6ANoFkdAqIikL2HtW3V9lChoBmgJaA9DCNXpQNaDKJBAlIaUUpRoFU3oA2gWR0CojbBDw6QvdX2UKGgGaAloD0MI9aEL6rvMjECUhpRSlGgVTegDaBZHQKiUGO4oZyd1fZQoaAZoCWgPQwjj+nd9xgOPQJSGlFKUaBVN6ANoFkdAqJo8nJDE33V9lChoBmgJaA9DCB7f3jWop49AlIaUUpRoFU3oA2gWR0ConxfBnBcidX2UKGgGaAloD0MIpu81BGcMkECUhpRSlGgVTegDaBZHQKikL3hXKbN1fZQoaAZoCWgPQwi/DpwzgouNQJSGlFKUaBVN6ANoFkdAqKkXNmlImXV9lChoBmgJaA9DCAvSjEVTBI9AlIaUUpRoFU3oA2gWR0CorjQblzU7dX2UKGgGaAloD0MI4C9mS5Y8jECUhpRSlGgVTegDaBZHQKizNCw8nu11fZQoaAZoCWgPQwhHdxA7s7iKQJSGlFKUaBVN6ANoFkdAqLhm1pj+aXV9lChoBmgJaA9DCB9LH7pAZI9AlIaUUpRoFU3oA2gWR0CovaFfiPyTdX2UKGgGaAloD0MIF4IclHBTj0CUhpRSlGgVTegDaBZHQKjCjl9Sde91fZQoaAZoCWgPQwhfl+E/fVmOQJSGlFKUaBVN6ANoFkdAqMeFloUSI3V9lChoBmgJaA9DCDRlpx9Uh4xAlIaUUpRoFU3oA2gWR0CozF73XZoPdX2UKGgGaAloD0MIwEAQIGPXjUCUhpRSlGgVTegDaBZHQKjRIW2w3YN1fZQoaAZoCWgPQwithO6SGAOOQJSGlFKUaBVN6ANoFkdAqNYIDHOryXV9lChoBmgJaA9DCJLsEWoGIZBAlIaUUpRoFU3oA2gWR0Co2xJYDDCQdX2UKGgGaAloD0MIH2lwWzsmj0CUhpRSlGgVTegDaBZHQKjgILNwBHV1fZQoaAZoCWgPQwiKPh9lROqOQJSGlFKUaBVN6ANoFkdAqOUWGmDUVnV9lChoBmgJaA9DCF/Rrdd0NY5AlIaUUpRoFU3oA2gWR0Co6eSr5qM4dX2UKGgGaAloD0MId4apLZXnj0CUhpRSlGgVTegDaBZHQKjunoqTbFl1fZQoaAZoCWgPQwiHGK951RGOQJSGlFKUaBVN6ANoFkdAqPNjoB7u2XV9lChoBmgJaA9DCH13K0sEMJBAlIaUUpRoFU3oA2gWR0Co+Bx6F/QTdWUu"
|
| 86 |
},
|
| 87 |
"ep_success_buffer": {
|
| 88 |
":type:": "<class 'collections.deque'>",
|
|
|
|
| 100 |
":type:": "<class 'abc.ABCMeta'>",
|
| 101 |
":serialized:": "gAWVNQAAAAAAAACMIHN0YWJsZV9iYXNlbGluZXMzLmNvbW1vbi5idWZmZXJzlIwMUmVwbGF5QnVmZmVylJOULg==",
|
| 102 |
"__module__": "stable_baselines3.common.buffers",
|
| 103 |
+
"__doc__": "\n Replay buffer used in off-policy algorithms like SAC/TD3.\n\n :param buffer_size: Max number of element in the buffer\n :param observation_space: Observation space\n :param action_space: Action space\n :param device: PyTorch device\n :param n_envs: Number of parallel environments\n :param optimize_memory_usage: Enable a memory efficient variant\n of the replay buffer which reduces by almost a factor two the memory used,\n at a cost of more complexity.\n See https://github.com/DLR-RM/stable-baselines3/issues/37#issuecomment-637501195\n and https://github.com/DLR-RM/stable-baselines3/pull/28#issuecomment-637559274\n Cannot be used in combination with handle_timeout_termination.\n :param handle_timeout_termination: Handle timeout termination (due to timelimit)\n separately and treat the task as infinite horizon task.\n https://github.com/DLR-RM/stable-baselines3/issues/284\n ",
|
| 104 |
+
"__init__": "<function ReplayBuffer.__init__ at 0x7f75a43db0d0>",
|
| 105 |
+
"add": "<function ReplayBuffer.add at 0x7f75a43db160>",
|
| 106 |
+
"sample": "<function ReplayBuffer.sample at 0x7f75a43db1f0>",
|
| 107 |
+
"_get_samples": "<function ReplayBuffer._get_samples at 0x7f75a43db280>",
|
| 108 |
"__abstractmethods__": "frozenset()",
|
| 109 |
+
"_abc_impl": "<_abc_data object at 0x7f75a445c2d0>"
|
| 110 |
},
|
| 111 |
"replay_buffer_kwargs": {},
|
| 112 |
"train_freq": {
|
|
|
|
| 116 |
"use_sde_at_warmup": false,
|
| 117 |
"target_entropy": -8.0,
|
| 118 |
"ent_coef": "auto",
|
| 119 |
+
"target_update_interval": 1,
|
| 120 |
+
"batch_norm_stats": [],
|
| 121 |
+
"batch_norm_stats_target": []
|
| 122 |
}
|
sac-seals-Ant-v0/ent_coef_optimizer.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:774e4bfe776561c063fbfa6fbaa9662fd890b9d9cd908e2270bebcb1b2348a97
|
| 3 |
+
size 1507
|
sac-seals-Ant-v0/policy.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1963333
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:52eba1f90054d6284686c68a50a8d542d806e19224a9ad5c1242a23f09cea943
|
| 3 |
size 1963333
|
sac-seals-Ant-v0/pytorch_variables.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 747
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0810fa47152071fd13b5351110ca08508664e6658de0ec9a90b93cc81d7fe15c
|
| 3 |
size 747
|
sac-seals-Ant-v0/system_info.txt
CHANGED
|
@@ -1,6 +1,6 @@
|
|
| 1 |
-
OS: Linux-5.4.0-
|
| 2 |
Python: 3.8.10
|
| 3 |
-
Stable-Baselines3: 1.6.
|
| 4 |
PyTorch: 1.11.0+cu102
|
| 5 |
GPU Enabled: False
|
| 6 |
Numpy: 1.22.3
|
|
|
|
| 1 |
+
OS: Linux-5.4.0-125-generic-x86_64-with-glibc2.29 #141-Ubuntu SMP Wed Aug 10 13:42:03 UTC 2022
|
| 2 |
Python: 3.8.10
|
| 3 |
+
Stable-Baselines3: 1.6.2
|
| 4 |
PyTorch: 1.11.0+cu102
|
| 5 |
GPU Enabled: False
|
| 6 |
Numpy: 1.22.3
|
train_eval_metrics.zip
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d094ae5105fa3a88ffcc2ea9da8b4155c755533310c3047fd4796c6cc2297332
|
| 3 |
+
size 33121
|