seed: 42 run: name: libero_all_stage2_policy_h8_40ep_seed42_from_idm0125_s1v_s2v_noema root: checkpoints/stage2 timestamp: false model: name: SLIM vision_encoder: backbone_name: dinov2_vitb14 model_path: ${oc.env:DINOV2_MODEL_DIR} image_size: 224 freeze_backbone: false num_image_views: 2 vision_condition_mode: dense_patch image_augment: enabled: false ema: enabled: false momentum: 0.999 action_dim: 7 state_dim: 7 action_horizon: 8 use_language_condition: true language_encoder_path: ${oc.env:T5_MODEL_DIR} language_cache: ${oc.env:SLIM_LANGUAGE_CACHE,null} max_language_tokens: 32 language_embedding_dim: 512 inference_steps: 4 repeated_diffusion_steps: 4 decoder_hidden_dim: 1024 transformer: hidden_dim: 768 num_layers: 16 num_heads: 12 ffn_ratio: 4.0 dropout: 0.0 num_action_register_tokens: 4 num_future_tokens: 512 use_state_condition: true max_state_tokens: 1100 max_action_tokens: 16 policy_loss_weight: 1.0 idm_loss_weight: 0.0 fdm_loss_weight: 0.0 future_loss_type: norm_l1 data: sources: - root_dir: ${oc.env:LIBERO_DATA_ROOT} data_mix: libero_all video_keys: - observation.images.image - observation.images.wrist_image weight: 1.0 action_normalization: q01_q99 action_stats_dir: ${oc.env:SLIM_CACHE_DIR,.cache/slim}/action_stats/libero_all per_device_batch_size: 16 episode_shuffle: true eval_batch_size: 8 val_ratio: 0.0 eval_monitor_episode_ratio: 0.05 split_seed: 42 num_workers: 16 eval_num_workers: 8 prefetch_factor: 2 persistent_workers: true dataloader_timeout_s: 300 video_backend: torchvision_av training: stage: 2 objective: policy max_epochs: 40 max_train_steps: 100000 num_warmup_steps: 5000 save_interval: 5000 eval_interval: 100 logging_frequency: 10 gradient_clipping: 1.0 gradient_accumulation_steps: 1 learning_rate: base: 2.5e-05 action_model: 0.0001 vision_encoder: 1.0e-05 lr_scheduler_type: cosine_with_min_lr scheduler_specific_kwargs: min_lr: 1.0e-06 optimizer: betas: - 0.9 - 0.95 eps: 1.0e-08 weight_decay: 0.01 logging: trackers: - jsonl - wandb project: slim entity: null resume_skip_prefixes: - ema_vision_encoder. - _ema_fp32_