File size: 1,201 Bytes
732807b 173f930 732807b 173f930 732807b 173f930 eae6744 732807b 173f930 732807b 173f930 732807b 173f930 732807b 173f930 732807b 173f930 732807b 173f930 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 | seed: 42
device: cuda:0
num_steps_per_env: 24
max_iterations: 2000
empirical_normalization: {}
obs_groups:
actor:
- policy
- task_obs
critic:
- policy
- task_obs
clip_actions: null
check_for_nan: true
save_interval: 200
experiment_name: generic_experiment
run_name: ''
logger: tensorboard
neptune_project: isaaclab
wandb_project: isaaclab
resume: false
load_run: .*
load_checkpoint: model_.*.pt
class_name: OnPolicyRunner
actor:
class_name: MLPModel
hidden_dims:
- 256
- 128
- 64
activation: elu
obs_normalization: false
distribution_cfg:
class_name: GaussianDistribution
init_std: 1.0
std_type: scalar
critic:
class_name: MLPModel
hidden_dims:
- 256
- 128
- 64
activation: elu
obs_normalization: false
distribution_cfg: null
algorithm:
class_name: PPO
num_learning_epochs: 5
num_mini_batches: 4
learning_rate: 0.0001
schedule: adaptive
gamma: 0.98
lam: 0.95
entropy_coef: 0.006
desired_kl: 0.01
max_grad_norm: 1.0
optimizer: adam
value_loss_coef: 1.0
use_clipped_value_loss: true
clip_param: 0.2
normalize_advantage_per_mini_batch: false
share_cnn_encoders: false
rnd_cfg: null
symmetry_cfg: null
policy: {}
|