| seed: 42 |
| device: cuda:0 |
| num_steps_per_env: 24 |
| max_iterations: 2000 |
| empirical_normalization: {} |
| obs_groups: |
| actor: |
| - policy |
| - task_obs |
| critic: |
| - policy |
| - task_obs |
| clip_actions: null |
| check_for_nan: true |
| save_interval: 200 |
| experiment_name: generic_experiment |
| run_name: '' |
| logger: tensorboard |
| neptune_project: isaaclab |
| wandb_project: isaaclab |
| resume: false |
| load_run: .* |
| load_checkpoint: model_.*.pt |
| class_name: OnPolicyRunner |
| actor: |
| class_name: MLPModel |
| hidden_dims: |
| - 256 |
| - 128 |
| - 64 |
| activation: elu |
| obs_normalization: false |
| distribution_cfg: |
| class_name: GaussianDistribution |
| init_std: 1.0 |
| std_type: scalar |
| critic: |
| class_name: MLPModel |
| hidden_dims: |
| - 256 |
| - 128 |
| - 64 |
| activation: elu |
| obs_normalization: false |
| distribution_cfg: null |
| algorithm: |
| class_name: PPO |
| num_learning_epochs: 5 |
| num_mini_batches: 4 |
| learning_rate: 0.0001 |
| schedule: adaptive |
| gamma: 0.98 |
| lam: 0.95 |
| entropy_coef: 0.006 |
| desired_kl: 0.01 |
| max_grad_norm: 1.0 |
| optimizer: adam |
| value_loss_coef: 1.0 |
| use_clipped_value_loss: true |
| clip_param: 0.2 |
| normalize_advantage_per_mini_batch: false |
| share_cnn_encoders: false |
| rnd_cfg: null |
| symmetry_cfg: null |
| policy: {} |
|
|