seed: 42 device: cuda:0 num_steps_per_env: 32 max_iterations: 15000 empirical_normalization: {} obs_groups: actor: - policy - proprio - perception critic: - policy - proprio - perception clip_actions: null check_for_nan: true save_interval: 250 experiment_name: dexsuite_kuka_allegro run_name: '' logger: tensorboard neptune_project: isaaclab wandb_project: isaaclab resume: false load_run: .* load_checkpoint: model_.*.pt class_name: OnPolicyRunner actor: class_name: MLPModel hidden_dims: - 512 - 256 - 128 activation: elu obs_normalization: true distribution_cfg: class_name: GaussianDistribution init_std: 1.0 std_type: scalar critic: class_name: MLPModel hidden_dims: - 512 - 256 - 128 activation: elu obs_normalization: true distribution_cfg: null algorithm: class_name: PPO num_learning_epochs: 5 num_mini_batches: 4 learning_rate: 0.001 schedule: adaptive gamma: 0.99 lam: 0.95 entropy_coef: 0.005 desired_kl: 0.01 max_grad_norm: 1.0 optimizer: adam value_loss_coef: 1.0 use_clipped_value_loss: true clip_param: 0.2 normalize_advantage_per_mini_batch: false share_cnn_encoders: false rnd_cfg: null symmetry_cfg: null policy: {}