File size: 2,332 Bytes
921b05e | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 | seed: 42
run:
name: libero_all_stage2_policy_h8_40ep_seed42_from_idm0125_s1v_s2v_noema
root: checkpoints/stage2
timestamp: false
model:
name: SLIM
vision_encoder:
backbone_name: dinov2_vitb14
model_path: ${oc.env:DINOV2_MODEL_DIR}
image_size: 224
freeze_backbone: false
num_image_views: 2
vision_condition_mode: dense_patch
image_augment:
enabled: false
ema:
enabled: false
momentum: 0.999
action_dim: 7
state_dim: 7
action_horizon: 8
use_language_condition: true
language_encoder_path: ${oc.env:T5_MODEL_DIR}
language_cache: ${oc.env:SLIM_LANGUAGE_CACHE,null}
max_language_tokens: 32
language_embedding_dim: 512
inference_steps: 4
repeated_diffusion_steps: 4
decoder_hidden_dim: 1024
transformer:
hidden_dim: 768
num_layers: 16
num_heads: 12
ffn_ratio: 4.0
dropout: 0.0
num_action_register_tokens: 4
num_future_tokens: 512
use_state_condition: true
max_state_tokens: 1100
max_action_tokens: 16
policy_loss_weight: 1.0
idm_loss_weight: 0.0
fdm_loss_weight: 0.0
future_loss_type: norm_l1
data:
sources:
- root_dir: ${oc.env:LIBERO_DATA_ROOT}
data_mix: libero_all
video_keys:
- observation.images.image
- observation.images.wrist_image
weight: 1.0
action_normalization: q01_q99
action_stats_dir: ${oc.env:SLIM_CACHE_DIR,.cache/slim}/action_stats/libero_all
per_device_batch_size: 16
episode_shuffle: true
eval_batch_size: 8
val_ratio: 0.0
eval_monitor_episode_ratio: 0.05
split_seed: 42
num_workers: 16
eval_num_workers: 8
prefetch_factor: 2
persistent_workers: true
dataloader_timeout_s: 300
video_backend: torchvision_av
training:
stage: 2
objective: policy
max_epochs: 40
max_train_steps: 100000
num_warmup_steps: 5000
save_interval: 5000
eval_interval: 100
logging_frequency: 10
gradient_clipping: 1.0
gradient_accumulation_steps: 1
learning_rate:
base: 2.5e-05
action_model: 0.0001
vision_encoder: 1.0e-05
lr_scheduler_type: cosine_with_min_lr
scheduler_specific_kwargs:
min_lr: 1.0e-06
optimizer:
betas:
- 0.9
- 0.95
eps: 1.0e-08
weight_decay: 0.01
logging:
trackers:
- jsonl
- wandb
project: slim
entity: null
resume_skip_prefixes:
- ema_vision_encoder.
- _ema_fp32_
|