| seed: 42 |
| run: |
| name: libero_all_stage2_policy_h8_40ep_seed42_from_idm0125_s1v_s2v_noema |
| root: checkpoints/stage2 |
| timestamp: false |
| model: |
| name: SLIM |
| vision_encoder: |
| backbone_name: dinov2_vitb14 |
| model_path: ${oc.env:DINOV2_MODEL_DIR} |
| image_size: 224 |
| freeze_backbone: false |
| num_image_views: 2 |
| vision_condition_mode: dense_patch |
| image_augment: |
| enabled: false |
| ema: |
| enabled: false |
| momentum: 0.999 |
| action_dim: 7 |
| state_dim: 7 |
| action_horizon: 8 |
| use_language_condition: true |
| language_encoder_path: ${oc.env:T5_MODEL_DIR} |
| language_cache: ${oc.env:SLIM_LANGUAGE_CACHE,null} |
| max_language_tokens: 32 |
| language_embedding_dim: 512 |
| inference_steps: 4 |
| repeated_diffusion_steps: 4 |
| decoder_hidden_dim: 1024 |
| transformer: |
| hidden_dim: 768 |
| num_layers: 16 |
| num_heads: 12 |
| ffn_ratio: 4.0 |
| dropout: 0.0 |
| num_action_register_tokens: 4 |
| num_future_tokens: 512 |
| use_state_condition: true |
| max_state_tokens: 1100 |
| max_action_tokens: 16 |
| policy_loss_weight: 1.0 |
| idm_loss_weight: 0.0 |
| fdm_loss_weight: 0.0 |
| future_loss_type: norm_l1 |
| data: |
| sources: |
| - root_dir: ${oc.env:LIBERO_DATA_ROOT} |
| data_mix: libero_all |
| video_keys: |
| - observation.images.image |
| - observation.images.wrist_image |
| weight: 1.0 |
| action_normalization: q01_q99 |
| action_stats_dir: ${oc.env:SLIM_CACHE_DIR,.cache/slim}/action_stats/libero_all |
| per_device_batch_size: 16 |
| episode_shuffle: true |
| eval_batch_size: 8 |
| val_ratio: 0.0 |
| eval_monitor_episode_ratio: 0.05 |
| split_seed: 42 |
| num_workers: 16 |
| eval_num_workers: 8 |
| prefetch_factor: 2 |
| persistent_workers: true |
| dataloader_timeout_s: 300 |
| video_backend: torchvision_av |
| training: |
| stage: 2 |
| objective: policy |
| max_epochs: 40 |
| max_train_steps: 100000 |
| num_warmup_steps: 5000 |
| save_interval: 5000 |
| eval_interval: 100 |
| logging_frequency: 10 |
| gradient_clipping: 1.0 |
| gradient_accumulation_steps: 1 |
| learning_rate: |
| base: 2.5e-05 |
| action_model: 0.0001 |
| vision_encoder: 1.0e-05 |
| lr_scheduler_type: cosine_with_min_lr |
| scheduler_specific_kwargs: |
| min_lr: 1.0e-06 |
| optimizer: |
| betas: |
| - 0.9 |
| - 0.95 |
| eps: 1.0e-08 |
| weight_decay: 0.01 |
| logging: |
| trackers: |
| - jsonl |
| - wandb |
| project: slim |
| entity: null |
| resume_skip_prefixes: |
| - ema_vision_encoder. |
| - _ema_fp32_ |
|
|