File size: 2,332 Bytes
921b05e
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
seed: 42
run:
  name: libero_all_stage2_policy_h8_40ep_seed42_from_idm0125_s1v_s2v_noema
  root: checkpoints/stage2
  timestamp: false
model:
  name: SLIM
  vision_encoder:
    backbone_name: dinov2_vitb14
    model_path: ${oc.env:DINOV2_MODEL_DIR}
    image_size: 224
    freeze_backbone: false
    num_image_views: 2
    vision_condition_mode: dense_patch
    image_augment:
      enabled: false
  ema:
    enabled: false
    momentum: 0.999
  action_dim: 7
  state_dim: 7
  action_horizon: 8
  use_language_condition: true
  language_encoder_path: ${oc.env:T5_MODEL_DIR}
  language_cache: ${oc.env:SLIM_LANGUAGE_CACHE,null}
  max_language_tokens: 32
  language_embedding_dim: 512
  inference_steps: 4
  repeated_diffusion_steps: 4
  decoder_hidden_dim: 1024
  transformer:
    hidden_dim: 768
    num_layers: 16
    num_heads: 12
    ffn_ratio: 4.0
    dropout: 0.0
    num_action_register_tokens: 4
    num_future_tokens: 512
    use_state_condition: true
    max_state_tokens: 1100
    max_action_tokens: 16
    policy_loss_weight: 1.0
    idm_loss_weight: 0.0
    fdm_loss_weight: 0.0
    future_loss_type: norm_l1
data:
  sources:
  - root_dir: ${oc.env:LIBERO_DATA_ROOT}
    data_mix: libero_all
    video_keys:
    - observation.images.image
    - observation.images.wrist_image
    weight: 1.0
  action_normalization: q01_q99
  action_stats_dir: ${oc.env:SLIM_CACHE_DIR,.cache/slim}/action_stats/libero_all
  per_device_batch_size: 16
  episode_shuffle: true
  eval_batch_size: 8
  val_ratio: 0.0
  eval_monitor_episode_ratio: 0.05
  split_seed: 42
  num_workers: 16
  eval_num_workers: 8
  prefetch_factor: 2
  persistent_workers: true
  dataloader_timeout_s: 300
  video_backend: torchvision_av
training:
  stage: 2
  objective: policy
  max_epochs: 40
  max_train_steps: 100000
  num_warmup_steps: 5000
  save_interval: 5000
  eval_interval: 100
  logging_frequency: 10
  gradient_clipping: 1.0
  gradient_accumulation_steps: 1
  learning_rate:
    base: 2.5e-05
    action_model: 0.0001
    vision_encoder: 1.0e-05
  lr_scheduler_type: cosine_with_min_lr
  scheduler_specific_kwargs:
    min_lr: 1.0e-06
  optimizer:
    betas:
    - 0.9
    - 0.95
    eps: 1.0e-08
    weight_decay: 0.01
logging:
  trackers:
  - jsonl
  - wandb
  project: slim
  entity: null
resume_skip_prefixes:
- ema_vision_encoder.
- _ema_fp32_