seed: 42 num_steps_per_env: 40 max_iterations: 7500 obs_groups: actor: !!python/tuple - policy critic: !!python/tuple - critic save_interval: 50 experiment_name: cyclops_finger_reorient run_name: slurm_29095053_resumed logger: wandb wandb_project: wuji_reorient_mjlab wandb_tags: !!python/tuple [] resume: true load_run: 2026-07-25_11-46-06_slurm_29033121 load_checkpoint: model_3150.pt clip_actions: null upload_model: true class_name: OnPolicyRunner actor: hidden_dims: !!python/tuple - 512 - 256 - 128 activation: elu obs_normalization: true cnn_cfg: null distribution_cfg: class_name: SoftplusGaussianDistribution init_std: 0.5 min_std: 0.2 rnn_type: null rnn_hidden_dim: 256 rnn_num_layers: 1 class_name: MLPModel critic: hidden_dims: !!python/tuple - 512 - 512 - 256 - 128 activation: elu obs_normalization: true cnn_cfg: null distribution_cfg: null rnn_type: null rnn_hidden_dim: 256 rnn_num_layers: 1 class_name: MLPModel algorithm: num_learning_epochs: 4 num_mini_batches: 32 learning_rate: 0.0001 schedule: fixed gamma: 0.99 lam: 0.95 entropy_coef: 0.001 desired_kl: 0.01 max_grad_norm: 1.0 value_loss_coef: 0.5 use_clipped_value_loss: false clip_param: 0.2 normalize_advantage_per_mini_batch: false optimizer: adam share_cnn_encoders: false class_name: PPO