Caesarrr commited on
Commit
52480ff
·
verified ·
1 Parent(s): 4d9820d

Upload folder using huggingface_hub

Browse files
Files changed (33) hide show
  1. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/_initialization/StarVLA_Qwen3VL-OFT-Bridge-RT-1/checkpoints/steps_5000_pytorch_model.pt +3 -0
  2. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/steps_5000_state/model.safetensors +3 -0
  3. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/steps_5000_state/optimizer.bin +3 -0
  4. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/steps_5000_state/random_states_0.pkl +3 -0
  5. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/config.full.yaml +226 -0
  6. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/config.yaml +105 -0
  7. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/dataset_statistics.json +127 -0
  8. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/dataset_statistics_eval.json +127 -0
  9. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1000.json +63 -0
  10. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1250.json +63 -0
  11. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1500.json +63 -0
  12. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1750.json +63 -0
  13. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2000.json +63 -0
  14. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2250.json +63 -0
  15. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_250.json +62 -0
  16. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2500.json +63 -0
  17. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2750.json +63 -0
  18. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3000.json +63 -0
  19. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3250.json +63 -0
  20. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3500.json +63 -0
  21. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3750.json +63 -0
  22. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4000.json +63 -0
  23. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4250.json +63 -0
  24. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4500.json +63 -0
  25. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4750.json +63 -0
  26. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_500.json +63 -0
  27. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_5000.json +63 -0
  28. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_750.json +63 -0
  29. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/.hydra/config.yaml +224 -0
  30. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/.hydra/hydra.yaml +341 -0
  31. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/.hydra/overrides.yaml +181 -0
  32. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/train_starvla_hydra.log +0 -0
  33. flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/summary.jsonl +10 -0
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/_initialization/StarVLA_Qwen3VL-OFT-Bridge-RT-1/checkpoints/steps_5000_pytorch_model.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:371cb744227687bb99bcad7f9ff2250cf06da75631359ad3eba4c6bc52570607
3
+ size 9785060316
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/steps_5000_state/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b2375e35dca20389af04508aba967acffda126a63d3daa8344629d271bdcac3d
3
+ size 9138230516
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/steps_5000_state/optimizer.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:77b93367d82234d95fa8248dbf453632fe18e358a479cdd234c459d22338a444
3
+ size 3754870987
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/steps_5000_state/random_states_0.pkl ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1534f5654cb4caf72c5fc3843a84809a4e22f60b4fe5d14f50ccfafdc9d6f3da
3
+ size 14821
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/config.full.yaml ADDED
@@ -0,0 +1,226 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ framework:
2
+ name: QwenOFT
3
+ qwenvl:
4
+ base_vlm: /workspace/latency-sensitive-bench/starVLA/playground/Pretrained_models/Qwen3-VL-4B-Instruct
5
+ attn_implementation: flash_attention_2
6
+ enable_gradient_checkpointing: true
7
+ action_model:
8
+ action_model_type: MLP
9
+ action_dim: 7
10
+ action_hidden_dim: 2560
11
+ future_action_window_size: 0
12
+ past_action_window_size: 0
13
+ loss_type: discrete_ce
14
+ state_dim: 7
15
+ action_horizon: 1
16
+ action_env_dim: 2
17
+ datasets:
18
+ vla_data:
19
+ dataset_py: lerobot_datasets
20
+ include_state: true
21
+ data_root_dir: /workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep
22
+ data_mix: flappy_train__bridge
23
+ eval_data_mix: flappy_train__bridge__val
24
+ custom_mixtures_path: null
25
+ action_type: discrete
26
+ sequential_step_sampling: false
27
+ eval_sequential_step_sampling: null
28
+ num_workers: 8
29
+ eval_num_workers: 8
30
+ prefetch_factor: 4
31
+ persistent_workers: true
32
+ pin_memory: true
33
+ shuffle: true
34
+ action_balance:
35
+ enabled: false
36
+ strategy: balanced_epoch
37
+ action_key: action_id
38
+ target_flap_fraction: 0.3
39
+ noop_id: 0
40
+ flap_id: 1
41
+ latency_curriculum:
42
+ enabled: false
43
+ strategy: exclusive
44
+ latencies: null
45
+ phase_steps: null
46
+ per_device_batch_size: 64
47
+ load_all_data_for_training: true
48
+ num_obs_frames: 1
49
+ image_mode: single
50
+ stitch_grid:
51
+ - 2
52
+ - 2
53
+ obs_image_size: null
54
+ video_backend: torchvision_av
55
+ dataset:
56
+ source_hf: ''
57
+ config_name: null
58
+ source_subdir: null
59
+ converted_name: flappy_train
60
+ single_source_hf: ''
61
+ mixed_source_hf: ''
62
+ single_converted_name: flappy_train
63
+ mixed_converted_name: flappy_mixed_latency_train
64
+ single_latency_filter: null
65
+ mixed_latency_filter: null
66
+ force_download: false
67
+ setup_force: false
68
+ skip_verification: false
69
+ verify_rows: 200
70
+ max_episodes: null
71
+ episodes_per_latency: null
72
+ latency_filter: null
73
+ debug_subset:
74
+ enabled: false
75
+ max_episodes: 5
76
+ suffix: debug
77
+ base_model:
78
+ repo_id: Qwen/Qwen3-VL-4B-Instruct
79
+ initialization:
80
+ checkpoint_local_dir: playground/Pretrained_models/Qwen3VL-OFT-Bridge-RT-1
81
+ checkpoint_hf_repo_id: StarVLA/Qwen3VL-OFT-Bridge-RT-1
82
+ checkpoint_filename: checkpoints/steps_5000_pytorch_model.pt
83
+ trainer:
84
+ max_train_steps: 5000
85
+ num_warmup_steps: 100
86
+ save_interval: 500
87
+ eval_interval: 100
88
+ eval_num_batches: 100
89
+ per_latency_eval_num_batches: null
90
+ eval_action_classification: true
91
+ eval_action_classification_interval: null
92
+ cc_f1_tolerance: 1
93
+ learning_rate:
94
+ base: 2.0e-05
95
+ qwen_vl_interface: 1.0e-05
96
+ action_model: 0.0001
97
+ lr_scheduler_type: cosine_with_min_lr
98
+ scheduler_specific_kwargs:
99
+ min_lr: 1.0e-06
100
+ freeze_modules: ''
101
+ freeze_vit: true
102
+ freeze_tied_embedding: true
103
+ freeze_llm_layers:
104
+ - 0
105
+ - 27
106
+ loss_scale:
107
+ vla: 1.0
108
+ vlm: 0.1
109
+ max_grad_norm: 1.0
110
+ weight_decay: 0.0
111
+ logging_frequency: 1
112
+ profile_timing:
113
+ enabled: false
114
+ log_interval: 10
115
+ gradient_clipping: 1.0
116
+ gradient_accumulation_steps: 2
117
+ distributed_backend: none
118
+ is_resume: false
119
+ pretrained_checkpoint: null
120
+ resume_step: 0
121
+ reload_modules: null
122
+ optimizer:
123
+ name: AdamW
124
+ betas:
125
+ - 0.9
126
+ - 0.95
127
+ eps: 1.0e-08
128
+ weight_decay: 1.0e-08
129
+ fused: true
130
+ save_format: pt
131
+ workspace_dir: WORKSPACE_DIR
132
+ run_root_dir: /workspace/latency-sensitive-bench/starVLA/results/Checkpoints
133
+ seed: 42
134
+ wandb_entity: saberrr-zju
135
+ wandb_project: starVLA_rl_games
136
+ auth:
137
+ env_file: null
138
+ hf_token_env: HF_TOKEN
139
+ wandb_api_key_env: WANDB_API_KEY
140
+ paths:
141
+ run_root_dir: results/Checkpoints
142
+ dataset_local_dir: data/flappy_fix_latency_2_200ep
143
+ dataset_cache_dir: null
144
+ base_model_dir: playground/Pretrained_models/Qwen3-VL-4B-Instruct
145
+ accelerate_config: starVLA/config/deepseeds/deepspeed_zero2.yaml
146
+ launch:
147
+ use_accelerate: true
148
+ gpus: null
149
+ num_processes: 1
150
+ dry_run: false
151
+ conda:
152
+ enabled: true
153
+ env_name: null
154
+ rl_games:
155
+ model_alias: openvla
156
+ env_eval:
157
+ image_size: 224
158
+ frameskip: 1
159
+ seed: 42
160
+ fixed_episode_seeds: true
161
+ latency_seed_stride: 0
162
+ task_seed_stride: 0
163
+ task_description: ''
164
+ enabled: true
165
+ distributed_mode: none
166
+ vectorized:
167
+ enabled: false
168
+ batch_size: 1
169
+ latency:
170
+ prompt_map_path: /workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep/flappy_train__bridge/latency_prompt_map.json
171
+ mode: single
172
+ values:
173
+ - 0
174
+ mid_train:
175
+ enabled: true
176
+ interval_steps: 250
177
+ latencies:
178
+ - 2
179
+ num_episodes: 5
180
+ max_steps_per_episode: 3600
181
+ post_train:
182
+ enabled: false
183
+ latencies:
184
+ - 0
185
+ - 1
186
+ - 2
187
+ - 3
188
+ - 4
189
+ num_episodes: 5
190
+ max_steps_per_episode: 3600
191
+ task: flappy
192
+ initialization_mode: bridge
193
+ action_carrier: bridge
194
+ model: openvla
195
+ env: flappy
196
+ init: bridge
197
+ bridge_base_model:
198
+ repo_id:
199
+ openvla: Qwen/Qwen3-VL-4B-Instruct
200
+ pi0: StarVLA/Qwen2.5-VL-3B-Instruct-Action
201
+ pi05: Qwen/Qwen3-VL-4B-Instruct
202
+ gr00t: Qwen/Qwen3-VL-4B-Instruct
203
+ local_dir:
204
+ openvla: playground/Pretrained_models/Qwen3-VL-4B-Instruct
205
+ pi0: playground/Pretrained_models/Qwen2.5-VL-3B-Instruct-Action
206
+ pi05: playground/Pretrained_models/Qwen3-VL-4B-Instruct
207
+ gr00t: playground/Pretrained_models/Qwen3-VL-4B-Instruct
208
+ mode: single
209
+ checkpoint:
210
+ load: none
211
+ hf_repo_id: null
212
+ save_best_model: false
213
+ save_pt_file: false
214
+ local:
215
+ keep_last_n: 1
216
+ sync:
217
+ enabled: false
218
+ repo_id: null
219
+ keep_last_n: 0
220
+ sync_every_n_checkpoints: 1
221
+ resume_policy: local_latest
222
+ run_id: flappy_fix_latency_2_200ep_last_8_layers_corrected_v2
223
+ output_dir: /workspace/latency-sensitive-bench/starVLA/results/Checkpoints/flappy_fix_latency_2_200ep_last_8_layers_corrected_v2
224
+ config_yaml: null
225
+ is_debug: false
226
+ version_id: '0.21'
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/config.yaml ADDED
@@ -0,0 +1,105 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ checkpoint:
2
+ local:
3
+ keep_last_n: 1
4
+ save_best_model: false
5
+ save_pt_file: false
6
+ sync:
7
+ enabled: false
8
+ keep_last_n: 0
9
+ repo_id: null
10
+ datasets:
11
+ vla_data:
12
+ data_mix: flappy_train__bridge
13
+ dataset_py: lerobot_datasets
14
+ eval_data_mix: flappy_train__bridge__val
15
+ eval_num_workers: 8
16
+ include_state: true
17
+ latency_curriculum:
18
+ enabled: false
19
+ obs_image_size: null
20
+ per_device_batch_size: 64
21
+ persistent_workers: true
22
+ pin_memory: true
23
+ prefetch_factor: 4
24
+ framework:
25
+ action_model:
26
+ action_dim: 7
27
+ action_env_dim: 2
28
+ action_hidden_dim: 2560
29
+ action_horizon: 1
30
+ action_model_type: MLP
31
+ loss_type: discrete_ce
32
+ state_dim: 7
33
+ name: QwenOFT
34
+ qwenvl:
35
+ attn_implementation: flash_attention_2
36
+ base_vlm: /workspace/latency-sensitive-bench/starVLA/playground/Pretrained_models/Qwen3-VL-4B-Instruct
37
+ enable_gradient_checkpointing: true
38
+ output_dir: /workspace/latency-sensitive-bench/starVLA/results/Checkpoints/flappy_fix_latency_2_200ep_last_8_layers_corrected_v2
39
+ rl_games:
40
+ env_eval:
41
+ distributed_mode: none
42
+ enabled: true
43
+ fixed_episode_seeds: true
44
+ frameskip: 1
45
+ image_size: 224
46
+ latency:
47
+ prompt_map_path: /workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep/flappy_train__bridge/latency_prompt_map.json
48
+ latency_seed_stride: 0
49
+ mid_train:
50
+ enabled: true
51
+ interval_steps: 250
52
+ latencies:
53
+ - 2
54
+ max_steps_per_episode: 3600
55
+ num_episodes: 5
56
+ seed: 42
57
+ task_description: ''
58
+ task_seed_stride: 0
59
+ vectorized:
60
+ enabled: false
61
+ model_alias: openvla
62
+ task: flappy
63
+ run_id: flappy_fix_latency_2_200ep_last_8_layers_corrected_v2
64
+ run_root_dir: /workspace/latency-sensitive-bench/starVLA/results/Checkpoints
65
+ seed: 42
66
+ trainer:
67
+ distributed_backend: none
68
+ eval_action_classification: true
69
+ eval_action_classification_interval: null
70
+ eval_interval: 100
71
+ eval_num_batches: 100
72
+ freeze_llm_layers:
73
+ - 0
74
+ - 27
75
+ freeze_modules: ''
76
+ freeze_tied_embedding: true
77
+ freeze_vit: true
78
+ gradient_accumulation_steps: 2
79
+ gradient_clipping: 1.0
80
+ is_resume: false
81
+ learning_rate:
82
+ action_model: 0.0001
83
+ base: 2.0e-05
84
+ qwen_vl_interface: 1.0e-05
85
+ logging_frequency: 1
86
+ lr_scheduler_type: cosine_with_min_lr
87
+ max_train_steps: 5000
88
+ num_warmup_steps: 100
89
+ optimizer:
90
+ betas:
91
+ - 0.9
92
+ - 0.95
93
+ eps: 1.0e-08
94
+ fused: true
95
+ weight_decay: 1.0e-08
96
+ per_latency_eval_num_batches: null
97
+ pretrained_checkpoint: null
98
+ profile_timing:
99
+ enabled: false
100
+ reload_modules: null
101
+ save_interval: 500
102
+ scheduler_specific_kwargs:
103
+ min_lr: 1.0e-06
104
+ wandb_entity: saberrr-zju
105
+ wandb_project: starVLA_rl_games
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/dataset_statistics.json ADDED
@@ -0,0 +1,127 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "new_embodiment": {
3
+ "action": {
4
+ "mean": [
5
+ 0.6028500199317932,
6
+ 0.3971499800682068,
7
+ 0.0,
8
+ 0.0,
9
+ 0.0,
10
+ 0.0,
11
+ 0.0
12
+ ],
13
+ "std": [
14
+ 0.4890792667865753,
15
+ 0.4890792667865753,
16
+ 0.0,
17
+ 0.0,
18
+ 0.0,
19
+ 0.0,
20
+ 0.0
21
+ ],
22
+ "max": [
23
+ 1.0,
24
+ 1.0,
25
+ 0.0,
26
+ 0.0,
27
+ 0.0,
28
+ 0.0,
29
+ 0.0
30
+ ],
31
+ "min": [
32
+ 0.0,
33
+ 0.0,
34
+ 0.0,
35
+ 0.0,
36
+ 0.0,
37
+ 0.0,
38
+ 0.0
39
+ ],
40
+ "q01": [
41
+ 0.0,
42
+ 0.0,
43
+ 0.0,
44
+ 0.0,
45
+ 0.0,
46
+ 0.0,
47
+ 0.0
48
+ ],
49
+ "q99": [
50
+ 1.0,
51
+ 1.0,
52
+ 0.0,
53
+ 0.0,
54
+ 0.0,
55
+ 0.0,
56
+ 0.0
57
+ ],
58
+ "mask": [
59
+ true,
60
+ true,
61
+ true,
62
+ true,
63
+ true,
64
+ true,
65
+ true
66
+ ]
67
+ },
68
+ "state": {
69
+ "mean": [
70
+ 0.0,
71
+ 0.0,
72
+ 0.0,
73
+ 0.0,
74
+ 0.0,
75
+ 0.0,
76
+ 0.0
77
+ ],
78
+ "std": [
79
+ 0.0,
80
+ 0.0,
81
+ 0.0,
82
+ 0.0,
83
+ 0.0,
84
+ 0.0,
85
+ 0.0
86
+ ],
87
+ "max": [
88
+ 0.0,
89
+ 0.0,
90
+ 0.0,
91
+ 0.0,
92
+ 0.0,
93
+ 0.0,
94
+ 0.0
95
+ ],
96
+ "min": [
97
+ 0.0,
98
+ 0.0,
99
+ 0.0,
100
+ 0.0,
101
+ 0.0,
102
+ 0.0,
103
+ 0.0
104
+ ],
105
+ "q01": [
106
+ 0.0,
107
+ 0.0,
108
+ 0.0,
109
+ 0.0,
110
+ 0.0,
111
+ 0.0,
112
+ 0.0
113
+ ],
114
+ "q99": [
115
+ 0.0,
116
+ 0.0,
117
+ 0.0,
118
+ 0.0,
119
+ 0.0,
120
+ 0.0,
121
+ 0.0
122
+ ]
123
+ },
124
+ "num_transitions": 330734,
125
+ "num_trajectories": 180
126
+ }
127
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/dataset_statistics_eval.json ADDED
@@ -0,0 +1,127 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "new_embodiment": {
3
+ "action": {
4
+ "mean": [
5
+ 0.7959861159324646,
6
+ 0.2040138840675354,
7
+ 0.0,
8
+ 0.0,
9
+ 0.0,
10
+ 0.0,
11
+ 0.0
12
+ ],
13
+ "std": [
14
+ 0.4030573070049286,
15
+ 0.4030573070049286,
16
+ 0.0,
17
+ 0.0,
18
+ 0.0,
19
+ 0.0,
20
+ 0.0
21
+ ],
22
+ "max": [
23
+ 1.0,
24
+ 1.0,
25
+ 0.0,
26
+ 0.0,
27
+ 0.0,
28
+ 0.0,
29
+ 0.0
30
+ ],
31
+ "min": [
32
+ 0.0,
33
+ 0.0,
34
+ 0.0,
35
+ 0.0,
36
+ 0.0,
37
+ 0.0,
38
+ 0.0
39
+ ],
40
+ "q01": [
41
+ 0.0,
42
+ 0.0,
43
+ 0.0,
44
+ 0.0,
45
+ 0.0,
46
+ 0.0,
47
+ 0.0
48
+ ],
49
+ "q99": [
50
+ 1.0,
51
+ 1.0,
52
+ 0.0,
53
+ 0.0,
54
+ 0.0,
55
+ 0.0,
56
+ 0.0
57
+ ],
58
+ "mask": [
59
+ true,
60
+ true,
61
+ true,
62
+ true,
63
+ true,
64
+ true,
65
+ true
66
+ ]
67
+ },
68
+ "state": {
69
+ "mean": [
70
+ 0.0,
71
+ 0.0,
72
+ 0.0,
73
+ 0.0,
74
+ 0.0,
75
+ 0.0,
76
+ 0.0
77
+ ],
78
+ "std": [
79
+ 0.0,
80
+ 0.0,
81
+ 0.0,
82
+ 0.0,
83
+ 0.0,
84
+ 0.0,
85
+ 0.0
86
+ ],
87
+ "max": [
88
+ 0.0,
89
+ 0.0,
90
+ 0.0,
91
+ 0.0,
92
+ 0.0,
93
+ 0.0,
94
+ 0.0
95
+ ],
96
+ "min": [
97
+ 0.0,
98
+ 0.0,
99
+ 0.0,
100
+ 0.0,
101
+ 0.0,
102
+ 0.0,
103
+ 0.0
104
+ ],
105
+ "q01": [
106
+ 0.0,
107
+ 0.0,
108
+ 0.0,
109
+ 0.0,
110
+ 0.0,
111
+ 0.0,
112
+ 0.0
113
+ ],
114
+ "q99": [
115
+ 0.0,
116
+ 0.0,
117
+ 0.0,
118
+ 0.0,
119
+ 0.0,
120
+ 0.0,
121
+ 0.0
122
+ ]
123
+ },
124
+ "num_transitions": 72000,
125
+ "num_trajectories": 20
126
+ }
127
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1000.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 3.1399999999999997,
7
+ "mean_length": 42.4,
8
+ "std_reward": 0.9308061022576063,
9
+ "std_length": 9.308061022576076,
10
+ "episode_rewards": [
11
+ 3.8999999999999986,
12
+ 2.0000000000000013,
13
+ 3.8999999999999986,
14
+ 3.8999999999999986,
15
+ 2.0000000000000013
16
+ ],
17
+ "episode_lengths": [
18
+ 50,
19
+ 31,
20
+ 50,
21
+ 50,
22
+ 31
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 193,
26
+ "1": 19
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 1000,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 3.1399999999999997,
55
+ "mean_length": 42.4,
56
+ "std_reward": 0.9308061022576063,
57
+ "std_length": 9.308061022576076,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 3.1399999999999997,
60
+ "macro_mean_length": 42.4,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1250.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 23.40000000000013,
7
+ "mean_length": 207.2,
8
+ "std_reward": 20.32486162314536,
9
+ "std_length": 164.06023284147807,
10
+ "episode_rewards": [
11
+ 8.399999999999986,
12
+ 50.40000000000037,
13
+ 3.8999999999999986,
14
+ 8.399999999999986,
15
+ 45.90000000000032
16
+ ],
17
+ "episode_lengths": [
18
+ 86,
19
+ 425,
20
+ 50,
21
+ 86,
22
+ 389
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 841,
26
+ "1": 195
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 1250,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 23.40000000000013,
55
+ "mean_length": 207.2,
56
+ "std_reward": 20.32486162314536,
57
+ "std_length": 164.06023284147807,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 23.40000000000013,
60
+ "macro_mean_length": 207.2,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1500.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 14.900000000000025,
7
+ "mean_length": 138.4,
8
+ "std_reward": 8.573214099741168,
9
+ "std_length": 69.04085746860333,
10
+ "episode_rewards": [
11
+ 26.90000000000011,
12
+ 12.899999999999974,
13
+ 3.8999999999999986,
14
+ 8.399999999999986,
15
+ 22.40000000000006
16
+ ],
17
+ "episode_lengths": [
18
+ 235,
19
+ 122,
20
+ 50,
21
+ 86,
22
+ 199
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 553,
26
+ "1": 139
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 1500,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 14.900000000000025,
55
+ "mean_length": 138.4,
56
+ "std_reward": 8.573214099741168,
57
+ "std_length": 69.04085746860333,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 14.900000000000025,
60
+ "macro_mean_length": 138.4,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_1750.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 16.64000000000008,
7
+ "mean_length": 152.2,
8
+ "std_reward": 17.710177864719626,
9
+ "std_length": 143.28209937043778,
10
+ "episode_rewards": [
11
+ 6.5999999999999925,
12
+ 18.400000000000016,
13
+ 3.8999999999999986,
14
+ 50.40000000000037,
15
+ 3.8999999999999986
16
+ ],
17
+ "episode_lengths": [
18
+ 68,
19
+ 168,
20
+ 50,
21
+ 425,
22
+ 50
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 607,
26
+ "1": 154
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 1750,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 16.64000000000008,
55
+ "mean_length": 152.2,
56
+ "std_reward": 17.710177864719626,
57
+ "std_length": 143.28209937043778,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 16.64000000000008,
60
+ "macro_mean_length": 152.2,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2000.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 20.600000000000115,
7
+ "mean_length": 184.6,
8
+ "std_reward": 19.205728312147027,
9
+ "std_length": 154.90590692417123,
10
+ "episode_rewards": [
11
+ 36.40000000000021,
12
+ 8.399999999999986,
13
+ 3.8999999999999986,
14
+ 3.8999999999999986,
15
+ 50.40000000000037
16
+ ],
17
+ "episode_lengths": [
18
+ 312,
19
+ 86,
20
+ 50,
21
+ 50,
22
+ 425
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 736,
26
+ "1": 187
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 2000,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 20.600000000000115,
55
+ "mean_length": 184.6,
56
+ "std_reward": 19.205728312147027,
57
+ "std_length": 154.90590692417123,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 20.600000000000115,
60
+ "macro_mean_length": 184.6,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2250.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 31.799999999999994,
7
+ "mean_length": 275.0,
8
+ "std_reward": 30.682894257224078,
9
+ "std_length": 247.40169764979382,
10
+ "episode_rewards": [
11
+ 17.90000000000001,
12
+ 82.8999999999996,
13
+ 3.8999999999999986,
14
+ 3.8999999999999986,
15
+ 50.40000000000037
16
+ ],
17
+ "episode_lengths": [
18
+ 163,
19
+ 687,
20
+ 50,
21
+ 50,
22
+ 425
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1091,
26
+ "1": 284
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 2250,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 31.799999999999994,
55
+ "mean_length": 275.0,
56
+ "std_reward": 30.682894257224078,
57
+ "std_length": 247.40169764979382,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 31.799999999999994,
60
+ "macro_mean_length": 275.0,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_250.json ADDED
@@ -0,0 +1,62 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 2.0000000000000013,
7
+ "mean_length": 31.0,
8
+ "std_reward": 0.0,
9
+ "std_length": 0.0,
10
+ "episode_rewards": [
11
+ 2.0000000000000013,
12
+ 2.0000000000000013,
13
+ 2.0000000000000013,
14
+ 2.0000000000000013,
15
+ 2.0000000000000013
16
+ ],
17
+ "episode_lengths": [
18
+ 31,
19
+ 31,
20
+ 31,
21
+ 31,
22
+ 31
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 155
26
+ },
27
+ "fixed_episode_seeds": true,
28
+ "eval_seed": 42,
29
+ "episode_seeds": [
30
+ 42,
31
+ 43,
32
+ 44,
33
+ 45,
34
+ 46
35
+ ],
36
+ "episode_indices": [
37
+ 0,
38
+ 1,
39
+ 2,
40
+ 3,
41
+ 4
42
+ ]
43
+ }
44
+ },
45
+ "aggregate": {
46
+ "stage": "mid_train",
47
+ "step": 250,
48
+ "task": "flappy",
49
+ "model_alias": "openvla",
50
+ "fixed_episode_seeds": true,
51
+ "eval_seed": 42,
52
+ "total_episodes": 5,
53
+ "mean_reward": 2.0000000000000013,
54
+ "mean_length": 31.0,
55
+ "std_reward": 0.0,
56
+ "std_length": 0.0,
57
+ "task_count": 1,
58
+ "macro_mean_reward": 2.0000000000000013,
59
+ "macro_mean_length": 31.0,
60
+ "distributed_eval": false
61
+ }
62
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2500.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 45.79999999999991,
7
+ "mean_length": 388.0,
8
+ "std_reward": 33.14423026712149,
9
+ "std_length": 267.54887403986584,
10
+ "episode_rewards": [
11
+ 22.40000000000006,
12
+ 101.89999999999874,
13
+ 3.8999999999999986,
14
+ 50.40000000000037,
15
+ 50.40000000000037
16
+ ],
17
+ "episode_lengths": [
18
+ 199,
19
+ 841,
20
+ 50,
21
+ 425,
22
+ 425
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1565,
26
+ "1": 375
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 2500,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 45.79999999999991,
55
+ "mean_length": 388.0,
56
+ "std_reward": 33.14423026712149,
57
+ "std_length": 267.54887403986584,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 45.79999999999991,
60
+ "macro_mean_length": 388.0,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_2750.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 36.49999999999981,
7
+ "mean_length": 313.0,
8
+ "std_reward": 34.30655913961595,
9
+ "std_length": 276.92959394040935,
10
+ "episode_rewards": [
11
+ 22.40000000000006,
12
+ 36.40000000000021,
13
+ 3.8999999999999986,
14
+ 17.90000000000001,
15
+ 101.89999999999874
16
+ ],
17
+ "episode_lengths": [
18
+ 199,
19
+ 312,
20
+ 50,
21
+ 163,
22
+ 841
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1241,
26
+ "1": 324
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 2750,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 36.49999999999981,
55
+ "mean_length": 313.0,
56
+ "std_reward": 34.30655913961595,
57
+ "std_length": 276.92959394040935,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 36.49999999999981,
60
+ "macro_mean_length": 313.0,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3000.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 8.119999999999997,
7
+ "mean_length": 81.4,
8
+ "std_reward": 4.977308509626468,
9
+ "std_length": 41.219412902175115,
10
+ "episode_rewards": [
11
+ 6.399999999999993,
12
+ 5.999999999999995,
13
+ 3.8999999999999986,
14
+ 17.90000000000001,
15
+ 6.399999999999993
16
+ ],
17
+ "episode_lengths": [
18
+ 66,
19
+ 62,
20
+ 50,
21
+ 163,
22
+ 66
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 348,
26
+ "1": 59
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 3000,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 8.119999999999997,
55
+ "mean_length": 81.4,
56
+ "std_reward": 4.977308509626468,
57
+ "std_length": 41.219412902175115,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 8.119999999999997,
60
+ "macro_mean_length": 81.4,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3250.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 55.09999999999926,
7
+ "mean_length": 463.0,
8
+ "std_reward": 51.20605432954091,
9
+ "std_length": 413.1425903970686,
10
+ "episode_rewards": [
11
+ 96.89999999999897,
12
+ 134.39999999999728,
13
+ 3.8999999999999986,
14
+ 17.90000000000001,
15
+ 22.40000000000006
16
+ ],
17
+ "episode_lengths": [
18
+ 800,
19
+ 1103,
20
+ 50,
21
+ 163,
22
+ 199
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1850,
26
+ "1": 465
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 3250,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 55.09999999999926,
55
+ "mean_length": 463.0,
56
+ "std_reward": 51.20605432954091,
57
+ "std_length": 413.1425903970686,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 55.09999999999926,
60
+ "macro_mean_length": 463.0,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3500.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 40.73999999999998,
7
+ "mean_length": 346.4,
8
+ "std_reward": 32.796682759083815,
9
+ "std_length": 265.3696290082948,
10
+ "episode_rewards": [
11
+ 6.5999999999999925,
12
+ 92.39999999999917,
13
+ 3.8999999999999986,
14
+ 50.40000000000037,
15
+ 50.40000000000037
16
+ ],
17
+ "episode_lengths": [
18
+ 68,
19
+ 764,
20
+ 50,
21
+ 425,
22
+ 425
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1367,
26
+ "1": 365
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 3500,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 40.73999999999998,
55
+ "mean_length": 346.4,
56
+ "std_reward": 32.796682759083815,
57
+ "std_length": 265.3696290082948,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 40.73999999999998,
60
+ "macro_mean_length": 346.4,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_3750.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 21.90000000000008,
7
+ "mean_length": 194.0,
8
+ "std_reward": 12.267844146385391,
9
+ "std_length": 99.29149006838401,
10
+ "episode_rewards": [
11
+ 26.90000000000011,
12
+ 40.90000000000026,
13
+ 3.8999999999999986,
14
+ 15.399999999999974,
15
+ 22.40000000000006
16
+ ],
17
+ "episode_lengths": [
18
+ 235,
19
+ 348,
20
+ 50,
21
+ 138,
22
+ 199
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 780,
26
+ "1": 190
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 3750,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 21.90000000000008,
55
+ "mean_length": 194.0,
56
+ "std_reward": 12.267844146385391,
57
+ "std_length": 99.29149006838401,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 21.90000000000008,
60
+ "macro_mean_length": 194.0,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4000.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 35.979999999999954,
7
+ "mean_length": 307.8,
8
+ "std_reward": 30.149056369975977,
9
+ "std_length": 244.03884936624334,
10
+ "episode_rewards": [
11
+ 22.40000000000006,
12
+ 87.89999999999937,
13
+ 3.8999999999999986,
14
+ 15.299999999999972,
15
+ 50.40000000000037
16
+ ],
17
+ "episode_lengths": [
18
+ 199,
19
+ 728,
20
+ 50,
21
+ 137,
22
+ 425
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1236,
26
+ "1": 303
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 4000,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 35.979999999999954,
55
+ "mean_length": 307.8,
56
+ "std_reward": 30.149056369975977,
57
+ "std_length": 244.03884936624334,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 35.979999999999954,
60
+ "macro_mean_length": 307.8,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4250.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 31.11999999999994,
7
+ "mean_length": 268.2,
8
+ "std_reward": 33.25449744019579,
9
+ "std_length": 269.435261240989,
10
+ "episode_rewards": [
11
+ 6.5999999999999925,
12
+ 87.89999999999937,
13
+ 3.8999999999999986,
14
+ 50.40000000000037,
15
+ 6.799999999999992
16
+ ],
17
+ "episode_lengths": [
18
+ 68,
19
+ 728,
20
+ 50,
21
+ 425,
22
+ 70
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1068,
26
+ "1": 273
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 4250,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 31.11999999999994,
55
+ "mean_length": 268.2,
56
+ "std_reward": 33.25449744019579,
57
+ "std_length": 269.435261240989,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 31.11999999999994,
60
+ "macro_mean_length": 268.2,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4500.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 45.799999999999315,
7
+ "mean_length": 388.0,
8
+ "std_reward": 58.619450696844915,
9
+ "std_length": 473.2098900065382,
10
+ "episode_rewards": [
11
+ 157.89999999999623,
12
+ 12.899999999999974,
13
+ 3.8999999999999986,
14
+ 3.8999999999999986,
15
+ 50.40000000000037
16
+ ],
17
+ "episode_lengths": [
18
+ 1293,
19
+ 122,
20
+ 50,
21
+ 50,
22
+ 425
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1553,
26
+ "1": 387
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 4500,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 45.799999999999315,
55
+ "mean_length": 388.0,
56
+ "std_reward": 58.619450696844915,
57
+ "std_length": 473.2098900065382,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 45.799999999999315,
60
+ "macro_mean_length": 388.0,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_4750.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 69.19999999999878,
7
+ "mean_length": 577.0,
8
+ "std_reward": 67.3198336302144,
9
+ "std_length": 543.3985645914056,
10
+ "episode_rewards": [
11
+ 36.40000000000021,
12
+ 185.89999999999498,
13
+ 3.8999999999999986,
14
+ 17.90000000000001,
15
+ 101.89999999999874
16
+ ],
17
+ "episode_lengths": [
18
+ 312,
19
+ 1519,
20
+ 50,
21
+ 163,
22
+ 841
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 2282,
26
+ "1": 603
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 4750,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 69.19999999999878,
55
+ "mean_length": 577.0,
56
+ "std_reward": 67.3198336302144,
57
+ "std_length": 543.3985645914056,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 69.19999999999878,
60
+ "macro_mean_length": 577.0,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_500.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 4.799999999999995,
7
+ "mean_length": 57.2,
8
+ "std_reward": 1.7999999999999952,
9
+ "std_length": 14.4,
10
+ "episode_rewards": [
11
+ 8.399999999999986,
12
+ 3.8999999999999986,
13
+ 3.8999999999999986,
14
+ 3.8999999999999986,
15
+ 3.8999999999999986
16
+ ],
17
+ "episode_lengths": [
18
+ 86,
19
+ 50,
20
+ 50,
21
+ 50,
22
+ 50
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 254,
26
+ "1": 32
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 500,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 4.799999999999995,
55
+ "mean_length": 57.2,
56
+ "std_reward": 1.7999999999999952,
57
+ "std_length": 14.4,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 4.799999999999995,
60
+ "macro_mean_length": 57.2,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_5000.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 35.979999999999954,
7
+ "mean_length": 307.8,
8
+ "std_reward": 30.149056369975977,
9
+ "std_length": 244.03884936624334,
10
+ "episode_rewards": [
11
+ 22.40000000000006,
12
+ 87.89999999999937,
13
+ 3.8999999999999986,
14
+ 15.299999999999972,
15
+ 50.40000000000037
16
+ ],
17
+ "episode_lengths": [
18
+ 199,
19
+ 728,
20
+ 50,
21
+ 137,
22
+ 425
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 1223,
26
+ "1": 316
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 5000,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 35.979999999999954,
55
+ "mean_length": 307.8,
56
+ "std_reward": 30.149056369975977,
57
+ "std_length": 244.03884936624334,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 35.979999999999954,
60
+ "macro_mean_length": 307.8,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/eval/mid_train/step_750.json ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "per_latency": {
3
+ "flappy/latency_2": {
4
+ "latency": 2,
5
+ "num_episodes": 5,
6
+ "mean_reward": 10.299999999999992,
7
+ "mean_length": 101.4,
8
+ "std_reward": 4.747630988187691,
9
+ "std_length": 38.30195817448502,
10
+ "episode_rewards": [
11
+ 8.399999999999986,
12
+ 8.399999999999986,
13
+ 3.8999999999999986,
14
+ 12.899999999999974,
15
+ 17.90000000000001
16
+ ],
17
+ "episode_lengths": [
18
+ 86,
19
+ 86,
20
+ 50,
21
+ 122,
22
+ 163
23
+ ],
24
+ "decoded_action_hist": {
25
+ "0": 418,
26
+ "1": 89
27
+ },
28
+ "fixed_episode_seeds": true,
29
+ "eval_seed": 42,
30
+ "episode_seeds": [
31
+ 42,
32
+ 43,
33
+ 44,
34
+ 45,
35
+ 46
36
+ ],
37
+ "episode_indices": [
38
+ 0,
39
+ 1,
40
+ 2,
41
+ 3,
42
+ 4
43
+ ]
44
+ }
45
+ },
46
+ "aggregate": {
47
+ "stage": "mid_train",
48
+ "step": 750,
49
+ "task": "flappy",
50
+ "model_alias": "openvla",
51
+ "fixed_episode_seeds": true,
52
+ "eval_seed": 42,
53
+ "total_episodes": 5,
54
+ "mean_reward": 10.299999999999992,
55
+ "mean_length": 101.4,
56
+ "std_reward": 4.747630988187691,
57
+ "std_length": 38.30195817448502,
58
+ "task_count": 1,
59
+ "macro_mean_reward": 10.299999999999992,
60
+ "macro_mean_length": 101.4,
61
+ "distributed_eval": false
62
+ }
63
+ }
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/.hydra/config.yaml ADDED
@@ -0,0 +1,224 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ framework:
2
+ qwenvl:
3
+ base_vlm: /workspace/latency-sensitive-bench/starVLA/playground/Pretrained_models/Qwen3-VL-4B-Instruct
4
+ attn_implementation: flash_attention_2
5
+ enable_gradient_checkpointing: true
6
+ action_model:
7
+ state_dim: 7
8
+ loss_type: discrete_ce
9
+ action_horizon: 1
10
+ future_action_window_size: 0
11
+ past_action_window_size: 0
12
+ action_dim: 7
13
+ action_env_dim: 2
14
+ name: QwenOFT
15
+ datasets:
16
+ vla_data:
17
+ dataset_py: lerobot_datasets
18
+ include_state: true
19
+ data_root_dir: /workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep
20
+ data_mix: flappy_train__bridge
21
+ eval_data_mix: flappy_train__bridge__val
22
+ custom_mixtures_path: null
23
+ action_type: discrete
24
+ sequential_step_sampling: false
25
+ eval_sequential_step_sampling: null
26
+ num_workers: 8
27
+ eval_num_workers: 8
28
+ prefetch_factor: 4
29
+ persistent_workers: true
30
+ pin_memory: true
31
+ shuffle: true
32
+ action_balance:
33
+ enabled: false
34
+ strategy: balanced_epoch
35
+ action_key: action_id
36
+ target_flap_fraction: 0.3
37
+ noop_id: 0
38
+ flap_id: 1
39
+ latency_curriculum:
40
+ enabled: false
41
+ strategy: exclusive
42
+ latencies: null
43
+ phase_steps: null
44
+ per_device_batch_size: 64
45
+ load_all_data_for_training: true
46
+ num_obs_frames: 1
47
+ image_mode: single
48
+ stitch_grid:
49
+ - 2
50
+ - 2
51
+ obs_image_size: null
52
+ video_backend: torchvision_av
53
+ dataset:
54
+ source_hf: ''
55
+ config_name: null
56
+ source_subdir: null
57
+ converted_name: flappy_train
58
+ single_source_hf: ''
59
+ mixed_source_hf: ''
60
+ single_converted_name: flappy_train
61
+ mixed_converted_name: flappy_mixed_latency_train
62
+ single_latency_filter: null
63
+ mixed_latency_filter: null
64
+ force_download: false
65
+ setup_force: false
66
+ skip_verification: false
67
+ verify_rows: 200
68
+ max_episodes: null
69
+ episodes_per_latency: null
70
+ latency_filter: null
71
+ debug_subset:
72
+ enabled: false
73
+ max_episodes: 5
74
+ suffix: debug
75
+ base_model:
76
+ repo_id: Qwen/Qwen3-VL-4B-Instruct
77
+ initialization:
78
+ checkpoint_local_dir: playground/Pretrained_models/Qwen3VL-OFT-Bridge-RT-1
79
+ checkpoint_hf_repo_id: StarVLA/Qwen3VL-OFT-Bridge-RT-1
80
+ checkpoint_filename: checkpoints/steps_5000_pytorch_model.pt
81
+ trainer:
82
+ max_train_steps: 5000
83
+ num_warmup_steps: 100
84
+ save_interval: 500
85
+ eval_interval: 100
86
+ eval_num_batches: 100
87
+ per_latency_eval_num_batches: null
88
+ eval_action_classification: true
89
+ eval_action_classification_interval: null
90
+ cc_f1_tolerance: 1
91
+ learning_rate:
92
+ base: 2.0e-05
93
+ qwen_vl_interface: 1.0e-05
94
+ action_model: 0.0001
95
+ lr_scheduler_type: cosine_with_min_lr
96
+ scheduler_specific_kwargs:
97
+ min_lr: 1.0e-06
98
+ freeze_modules: ''
99
+ freeze_vit: true
100
+ freeze_tied_embedding: true
101
+ freeze_llm_layers:
102
+ - 0
103
+ - 27
104
+ loss_scale:
105
+ vla: 1.0
106
+ vlm: 0.1
107
+ max_grad_norm: 1.0
108
+ weight_decay: 0.0
109
+ logging_frequency: 1
110
+ profile_timing:
111
+ enabled: false
112
+ log_interval: 10
113
+ gradient_clipping: 1.0
114
+ gradient_accumulation_steps: 2
115
+ distributed_backend: none
116
+ is_resume: false
117
+ pretrained_checkpoint: /workspace/latency-sensitive-bench/starVLA/results/Checkpoints/flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/_initialization/StarVLA_Qwen3VL-OFT-Bridge-RT-1/checkpoints/steps_5000_pytorch_model.pt
118
+ resume_step: 0
119
+ reload_modules: null
120
+ optimizer:
121
+ name: AdamW
122
+ betas:
123
+ - 0.9
124
+ - 0.95
125
+ eps: 1.0e-08
126
+ weight_decay: 1.0e-08
127
+ fused: true
128
+ save_format: pt
129
+ workspace_dir: WORKSPACE_DIR
130
+ run_root_dir: /workspace/latency-sensitive-bench/starVLA/results/Checkpoints
131
+ seed: 42
132
+ wandb_entity: saberrr-zju
133
+ wandb_project: starVLA_rl_games
134
+ auth:
135
+ env_file: null
136
+ hf_token_env: HF_TOKEN
137
+ wandb_api_key_env: WANDB_API_KEY
138
+ paths:
139
+ run_root_dir: results/Checkpoints
140
+ dataset_local_dir: data/flappy_fix_latency_2_200ep
141
+ dataset_cache_dir: null
142
+ base_model_dir: playground/Pretrained_models/Qwen3-VL-4B-Instruct
143
+ accelerate_config: starVLA/config/deepseeds/deepspeed_zero2.yaml
144
+ launch:
145
+ use_accelerate: true
146
+ gpus: null
147
+ num_processes: 1
148
+ dry_run: false
149
+ conda:
150
+ enabled: true
151
+ env_name: null
152
+ rl_games:
153
+ model_alias: openvla
154
+ env_eval:
155
+ image_size: 224
156
+ frameskip: 1
157
+ seed: 42
158
+ fixed_episode_seeds: true
159
+ latency_seed_stride: 0
160
+ task_seed_stride: 0
161
+ task_description: ''
162
+ enabled: true
163
+ distributed_mode: none
164
+ vectorized:
165
+ enabled: false
166
+ batch_size: 1
167
+ latency:
168
+ prompt_map_path: /workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep/flappy_train__bridge/latency_prompt_map.json
169
+ mode: single
170
+ values:
171
+ - 0
172
+ mid_train:
173
+ enabled: true
174
+ interval_steps: 250
175
+ latencies:
176
+ - 2
177
+ num_episodes: 5
178
+ max_steps_per_episode: 3600
179
+ post_train:
180
+ enabled: false
181
+ latencies:
182
+ - 0
183
+ - 1
184
+ - 2
185
+ - 3
186
+ - 4
187
+ num_episodes: 5
188
+ max_steps_per_episode: 3600
189
+ task: flappy
190
+ initialization_mode: bridge
191
+ action_carrier: bridge
192
+ model: openvla
193
+ env: flappy
194
+ init: bridge
195
+ bridge_base_model:
196
+ repo_id:
197
+ openvla: Qwen/Qwen3-VL-4B-Instruct
198
+ pi0: StarVLA/Qwen2.5-VL-3B-Instruct-Action
199
+ pi05: Qwen/Qwen3-VL-4B-Instruct
200
+ gr00t: Qwen/Qwen3-VL-4B-Instruct
201
+ local_dir:
202
+ openvla: playground/Pretrained_models/Qwen3-VL-4B-Instruct
203
+ pi0: playground/Pretrained_models/Qwen2.5-VL-3B-Instruct-Action
204
+ pi05: playground/Pretrained_models/Qwen3-VL-4B-Instruct
205
+ gr00t: playground/Pretrained_models/Qwen3-VL-4B-Instruct
206
+ mode: single
207
+ checkpoint:
208
+ load: none
209
+ hf_repo_id: null
210
+ save_best_model: false
211
+ save_pt_file: false
212
+ local:
213
+ keep_last_n: 1
214
+ sync:
215
+ enabled: false
216
+ repo_id: null
217
+ keep_last_n: 0
218
+ sync_every_n_checkpoints: 1
219
+ resume_policy: local_latest
220
+ run_id: flappy_fix_latency_2_200ep_last_8_layers_corrected_v2
221
+ output_dir: null
222
+ config_yaml: null
223
+ is_debug: false
224
+ version_id: 0.21
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/.hydra/hydra.yaml ADDED
@@ -0,0 +1,341 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ hydra:
2
+ run:
3
+ dir: ${run_root_dir}/${run_id}/hydra
4
+ sweep:
5
+ dir: multirun/${now:%Y-%m-%d}/${now:%H-%M-%S}
6
+ subdir: ${hydra.job.num}
7
+ launcher:
8
+ _target_: hydra._internal.core_plugins.basic_launcher.BasicLauncher
9
+ sweeper:
10
+ _target_: hydra._internal.core_plugins.basic_sweeper.BasicSweeper
11
+ max_batch_size: null
12
+ params: null
13
+ help:
14
+ app_name: ${hydra.job.name}
15
+ header: '${hydra.help.app_name} is powered by Hydra.
16
+
17
+ '
18
+ footer: 'Powered by Hydra (https://hydra.cc)
19
+
20
+ Use --hydra-help to view Hydra specific help
21
+
22
+ '
23
+ template: '${hydra.help.header}
24
+
25
+ == Configuration groups ==
26
+
27
+ Compose your configuration from those groups (group=option)
28
+
29
+
30
+ $APP_CONFIG_GROUPS
31
+
32
+
33
+ == Config ==
34
+
35
+ Override anything in the config (foo.bar=value)
36
+
37
+
38
+ $CONFIG
39
+
40
+
41
+ ${hydra.help.footer}
42
+
43
+ '
44
+ hydra_help:
45
+ template: 'Hydra (${hydra.runtime.version})
46
+
47
+ See https://hydra.cc for more info.
48
+
49
+
50
+ == Flags ==
51
+
52
+ $FLAGS_HELP
53
+
54
+
55
+ == Configuration groups ==
56
+
57
+ Compose your configuration from those groups (For example, append hydra/job_logging=disabled
58
+ to command line)
59
+
60
+
61
+ $HYDRA_CONFIG_GROUPS
62
+
63
+
64
+ Use ''--cfg hydra'' to Show the Hydra config.
65
+
66
+ '
67
+ hydra_help: ???
68
+ hydra_logging:
69
+ version: 1
70
+ formatters:
71
+ simple:
72
+ format: '[%(asctime)s][HYDRA] %(message)s'
73
+ handlers:
74
+ console:
75
+ class: logging.StreamHandler
76
+ formatter: simple
77
+ stream: ext://sys.stdout
78
+ root:
79
+ level: INFO
80
+ handlers:
81
+ - console
82
+ loggers:
83
+ logging_example:
84
+ level: DEBUG
85
+ disable_existing_loggers: false
86
+ job_logging:
87
+ version: 1
88
+ formatters:
89
+ simple:
90
+ format: '[%(asctime)s][%(name)s][%(levelname)s] - %(message)s'
91
+ handlers:
92
+ console:
93
+ class: logging.StreamHandler
94
+ formatter: simple
95
+ stream: ext://sys.stdout
96
+ file:
97
+ class: logging.FileHandler
98
+ formatter: simple
99
+ filename: ${hydra.runtime.output_dir}/${hydra.job.name}.log
100
+ root:
101
+ level: INFO
102
+ handlers:
103
+ - console
104
+ - file
105
+ disable_existing_loggers: false
106
+ env: {}
107
+ mode: RUN
108
+ searchpath: []
109
+ callbacks: {}
110
+ output_subdir: .hydra
111
+ overrides:
112
+ hydra:
113
+ - hydra.mode=RUN
114
+ task:
115
+ - model=openvla
116
+ - env=flappy
117
+ - init=bridge
118
+ - mode=single
119
+ - ++framework.qwenvl.base_vlm=playground/Pretrained_models/Qwen3-VL-4B-Instruct
120
+ - ++framework.qwenvl.attn_implementation=flash_attention_2
121
+ - ++framework.qwenvl.enable_gradient_checkpointing=true
122
+ - ++framework.action_model.state_dim=7
123
+ - ++framework.action_model.loss_type=discrete_ce
124
+ - ++framework.action_model.action_horizon=1
125
+ - ++framework.action_model.future_action_window_size=0
126
+ - ++framework.action_model.past_action_window_size=0
127
+ - ++framework.action_model.action_dim=7
128
+ - ++framework.action_model.action_env_dim=2
129
+ - ++framework.name=QwenOFT
130
+ - ++datasets.vla_data.dataset_py=lerobot_datasets
131
+ - ++datasets.vla_data.include_state=true
132
+ - ++datasets.vla_data.data_root_dir=playground/Datasets/rl_games
133
+ - ++datasets.vla_data.data_mix=flappy_train
134
+ - ++datasets.vla_data.eval_data_mix=null
135
+ - ++datasets.vla_data.custom_mixtures_path=null
136
+ - ++datasets.vla_data.action_type=discrete
137
+ - ++datasets.vla_data.sequential_step_sampling=false
138
+ - ++datasets.vla_data.eval_sequential_step_sampling=null
139
+ - ++datasets.vla_data.num_workers=8
140
+ - ++datasets.vla_data.eval_num_workers=8
141
+ - ++datasets.vla_data.prefetch_factor=4
142
+ - ++datasets.vla_data.persistent_workers=true
143
+ - ++datasets.vla_data.pin_memory=true
144
+ - ++datasets.vla_data.shuffle=true
145
+ - ++datasets.vla_data.action_balance.enabled=false
146
+ - ++datasets.vla_data.action_balance.strategy=balanced_epoch
147
+ - ++datasets.vla_data.action_balance.action_key=action_id
148
+ - ++datasets.vla_data.action_balance.target_flap_fraction=0.3
149
+ - ++datasets.vla_data.action_balance.noop_id=0
150
+ - ++datasets.vla_data.action_balance.flap_id=1
151
+ - ++datasets.vla_data.latency_curriculum.enabled=false
152
+ - ++datasets.vla_data.latency_curriculum.strategy=exclusive
153
+ - ++datasets.vla_data.latency_curriculum.latencies=null
154
+ - ++datasets.vla_data.latency_curriculum.phase_steps=null
155
+ - ++datasets.vla_data.per_device_batch_size=64
156
+ - ++datasets.vla_data.load_all_data_for_training=true
157
+ - ++datasets.vla_data.num_obs_frames=1
158
+ - ++datasets.vla_data.image_mode=single
159
+ - ++datasets.vla_data.stitch_grid=[2,2]
160
+ - ++datasets.vla_data.obs_image_size=null
161
+ - ++datasets.vla_data.video_backend=torchvision_av
162
+ - ++dataset.source_hf=
163
+ - ++dataset.config_name=null
164
+ - ++dataset.source_subdir=null
165
+ - ++dataset.converted_name=flappy_train
166
+ - ++dataset.single_source_hf=
167
+ - ++dataset.mixed_source_hf=
168
+ - ++dataset.single_converted_name=flappy_train
169
+ - ++dataset.mixed_converted_name=flappy_mixed_latency_train
170
+ - ++dataset.single_latency_filter=null
171
+ - ++dataset.mixed_latency_filter=null
172
+ - ++dataset.force_download=false
173
+ - ++dataset.setup_force=false
174
+ - ++dataset.skip_verification=false
175
+ - ++dataset.verify_rows=200
176
+ - ++dataset.max_episodes=null
177
+ - ++dataset.episodes_per_latency=null
178
+ - ++dataset.latency_filter=null
179
+ - ++dataset.debug_subset.enabled=false
180
+ - ++dataset.debug_subset.max_episodes=5
181
+ - ++dataset.debug_subset.suffix=debug
182
+ - ++base_model.repo_id=Qwen/Qwen3-VL-4B-Instruct
183
+ - ++initialization.checkpoint_local_dir=playground/Pretrained_models/Qwen3VL-OFT-Bridge-RT-1
184
+ - ++initialization.checkpoint_hf_repo_id=StarVLA/Qwen3VL-OFT-Bridge-RT-1
185
+ - ++initialization.checkpoint_filename=checkpoints/steps_5000_pytorch_model.pt
186
+ - ++trainer.max_train_steps=5000
187
+ - ++trainer.num_warmup_steps=100
188
+ - ++trainer.save_interval=500
189
+ - ++trainer.eval_interval=100
190
+ - ++trainer.eval_num_batches=100
191
+ - ++trainer.per_latency_eval_num_batches=null
192
+ - ++trainer.eval_action_classification=true
193
+ - ++trainer.eval_action_classification_interval=null
194
+ - ++trainer.cc_f1_tolerance=1
195
+ - ++trainer.learning_rate.base=2e-05
196
+ - ++trainer.learning_rate.qwen_vl_interface=1e-05
197
+ - ++trainer.learning_rate.action_model=0.0001
198
+ - ++trainer.lr_scheduler_type=cosine_with_min_lr
199
+ - ++trainer.scheduler_specific_kwargs.min_lr=1e-06
200
+ - ++trainer.freeze_modules=
201
+ - ++trainer.freeze_vit=true
202
+ - ++trainer.freeze_tied_embedding=true
203
+ - ++trainer.freeze_llm_layers=[0,27]
204
+ - ++trainer.loss_scale.vla=1.0
205
+ - ++trainer.loss_scale.vlm=0.1
206
+ - ++trainer.max_grad_norm=1.0
207
+ - ++trainer.weight_decay=0.0
208
+ - ++trainer.logging_frequency=1
209
+ - ++trainer.profile_timing.enabled=false
210
+ - ++trainer.profile_timing.log_interval=10
211
+ - ++trainer.gradient_clipping=1.0
212
+ - ++trainer.gradient_accumulation_steps=2
213
+ - ++trainer.distributed_backend=none
214
+ - ++trainer.is_resume=false
215
+ - ++trainer.pretrained_checkpoint=null
216
+ - ++trainer.resume_step=0
217
+ - ++trainer.reload_modules=null
218
+ - ++trainer.optimizer.name=AdamW
219
+ - ++trainer.optimizer.betas=[0.9,0.95]
220
+ - ++trainer.optimizer.eps=1e-08
221
+ - ++trainer.optimizer.weight_decay=1e-08
222
+ - ++trainer.optimizer.fused=true
223
+ - ++trainer.save_format=pt
224
+ - ++workspace_dir=WORKSPACE_DIR
225
+ - ++run_root_dir=results/Checkpoints
226
+ - ++seed=42
227
+ - ++wandb_entity=saberrr-zju
228
+ - ++wandb_project=starVLA_rl_games
229
+ - ++auth.env_file=null
230
+ - ++auth.hf_token_env=HF_TOKEN
231
+ - ++auth.wandb_api_key_env=WANDB_API_KEY
232
+ - ++paths.run_root_dir=results/Checkpoints
233
+ - ++paths.dataset_local_dir=data/flappy_fix_latency_2_200ep
234
+ - ++paths.dataset_cache_dir=null
235
+ - ++paths.base_model_dir=playground/Pretrained_models/Qwen3-VL-4B-Instruct
236
+ - ++paths.accelerate_config=starVLA/config/deepseeds/deepspeed_zero2.yaml
237
+ - ++rl_games.model_alias=openvla
238
+ - ++rl_games.env_eval.image_size=224
239
+ - ++rl_games.env_eval.frameskip=1
240
+ - ++rl_games.env_eval.seed=42
241
+ - ++rl_games.env_eval.fixed_episode_seeds=true
242
+ - ++rl_games.env_eval.latency_seed_stride=0
243
+ - ++rl_games.env_eval.task_seed_stride=0
244
+ - ++rl_games.env_eval.task_description=
245
+ - ++rl_games.env_eval.enabled=true
246
+ - ++rl_games.env_eval.distributed_mode=none
247
+ - ++rl_games.env_eval.vectorized.enabled=false
248
+ - ++rl_games.env_eval.vectorized.batch_size=1
249
+ - ++rl_games.env_eval.latency.prompt_map_path=null
250
+ - ++rl_games.env_eval.latency.mode=single
251
+ - ++rl_games.env_eval.latency.values=[0]
252
+ - ++rl_games.env_eval.mid_train.enabled=true
253
+ - ++rl_games.env_eval.mid_train.interval_steps=250
254
+ - ++rl_games.env_eval.mid_train.latencies=[2]
255
+ - ++rl_games.env_eval.mid_train.num_episodes=5
256
+ - ++rl_games.env_eval.mid_train.max_steps_per_episode=3600
257
+ - ++rl_games.env_eval.post_train.enabled=false
258
+ - ++rl_games.env_eval.post_train.latencies=[0,1,2,3,4]
259
+ - ++rl_games.env_eval.post_train.num_episodes=5
260
+ - ++rl_games.env_eval.post_train.max_steps_per_episode=3600
261
+ - ++rl_games.task=flappy
262
+ - ++rl_games.initialization_mode=bridge
263
+ - ++rl_games.action_carrier=bridge
264
+ - ++bridge_base_model.repo_id.openvla=Qwen/Qwen3-VL-4B-Instruct
265
+ - ++bridge_base_model.repo_id.pi0=StarVLA/Qwen2.5-VL-3B-Instruct-Action
266
+ - ++bridge_base_model.repo_id.pi05=Qwen/Qwen3-VL-4B-Instruct
267
+ - ++bridge_base_model.repo_id.gr00t=Qwen/Qwen3-VL-4B-Instruct
268
+ - ++bridge_base_model.local_dir.openvla=playground/Pretrained_models/Qwen3-VL-4B-Instruct
269
+ - ++bridge_base_model.local_dir.pi0=playground/Pretrained_models/Qwen2.5-VL-3B-Instruct-Action
270
+ - ++bridge_base_model.local_dir.pi05=playground/Pretrained_models/Qwen3-VL-4B-Instruct
271
+ - ++bridge_base_model.local_dir.gr00t=playground/Pretrained_models/Qwen3-VL-4B-Instruct
272
+ - ++checkpoint.load=none
273
+ - ++checkpoint.hf_repo_id=null
274
+ - ++checkpoint.save_best_model=false
275
+ - ++checkpoint.save_pt_file=false
276
+ - ++checkpoint.local.keep_last_n=1
277
+ - ++checkpoint.sync.enabled=false
278
+ - ++checkpoint.sync.repo_id=null
279
+ - ++checkpoint.sync.keep_last_n=0
280
+ - ++checkpoint.sync.sync_every_n_checkpoints=1
281
+ - ++checkpoint.sync.resume_policy=local_latest
282
+ - ++run_id=flappy_fix_latency_2_200ep_last_8_layers_corrected_v2
283
+ - ++output_dir=null
284
+ - ++config_yaml=null
285
+ - ++is_debug=false
286
+ - ++version_id=0.21
287
+ - ++run_root_dir=/workspace/latency-sensitive-bench/starVLA/results/Checkpoints
288
+ - ++trainer.is_resume=false
289
+ - ++trainer.pretrained_checkpoint=/workspace/latency-sensitive-bench/starVLA/results/Checkpoints/flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/_initialization/StarVLA_Qwen3VL-OFT-Bridge-RT-1/checkpoints/steps_5000_pytorch_model.pt
290
+ - ++trainer.resume_step=0
291
+ - ++datasets.vla_data.data_root_dir=/workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep
292
+ - ++datasets.vla_data.data_mix=flappy_train__bridge
293
+ - ++datasets.vla_data.eval_data_mix=flappy_train__bridge__val
294
+ - ++framework.qwenvl.base_vlm=/workspace/latency-sensitive-bench/starVLA/playground/Pretrained_models/Qwen3-VL-4B-Instruct
295
+ - ++rl_games.env_eval.latency.prompt_map_path=/workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep/flappy_train__bridge/latency_prompt_map.json
296
+ job:
297
+ name: train_starvla_hydra
298
+ chdir: false
299
+ override_dirname: ++auth.env_file=null,++auth.hf_token_env=HF_TOKEN,++auth.wandb_api_key_env=WANDB_API_KEY,++base_model.repo_id=Qwen/Qwen3-VL-4B-Instruct,++bridge_base_model.local_dir.gr00t=playground/Pretrained_models/Qwen3-VL-4B-Instruct,++bridge_base_model.local_dir.openvla=playground/Pretrained_models/Qwen3-VL-4B-Instruct,++bridge_base_model.local_dir.pi05=playground/Pretrained_models/Qwen3-VL-4B-Instruct,++bridge_base_model.local_dir.pi0=playground/Pretrained_models/Qwen2.5-VL-3B-Instruct-Action,++bridge_base_model.repo_id.gr00t=Qwen/Qwen3-VL-4B-Instruct,++bridge_base_model.repo_id.openvla=Qwen/Qwen3-VL-4B-Instruct,++bridge_base_model.repo_id.pi05=Qwen/Qwen3-VL-4B-Instruct,++bridge_base_model.repo_id.pi0=StarVLA/Qwen2.5-VL-3B-Instruct-Action,++checkpoint.hf_repo_id=null,++checkpoint.load=none,++checkpoint.local.keep_last_n=1,++checkpoint.save_best_model=false,++checkpoint.save_pt_file=false,++checkpoint.sync.enabled=false,++checkpoint.sync.keep_last_n=0,++checkpoint.sync.repo_id=null,++checkpoint.sync.resume_policy=local_latest,++checkpoint.sync.sync_every_n_checkpoints=1,++config_yaml=null,++dataset.config_name=null,++dataset.converted_name=flappy_train,++dataset.debug_subset.enabled=false,++dataset.debug_subset.max_episodes=5,++dataset.debug_subset.suffix=debug,++dataset.episodes_per_latency=null,++dataset.force_download=false,++dataset.latency_filter=null,++dataset.max_episodes=null,++dataset.mixed_converted_name=flappy_mixed_latency_train,++dataset.mixed_latency_filter=null,++dataset.mixed_source_hf=,++dataset.setup_force=false,++dataset.single_converted_name=flappy_train,++dataset.single_latency_filter=null,++dataset.single_source_hf=,++dataset.skip_verification=false,++dataset.source_hf=,++dataset.source_subdir=null,++dataset.verify_rows=200,++datasets.vla_data.action_balance.action_key=action_id,++datasets.vla_data.action_balance.enabled=false,++datasets.vla_data.action_balance.flap_id=1,++datasets.vla_data.action_balance.noop_id=0,++datasets.vla_data.action_balance.strategy=balanced_epoch,++datasets.vla_data.action_balance.target_flap_fraction=0.3,++datasets.vla_data.action_type=discrete,++datasets.vla_data.custom_mixtures_path=null,++datasets.vla_data.data_mix=flappy_train,++datasets.vla_data.data_mix=flappy_train__bridge,++datasets.vla_data.data_root_dir=/workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep,++datasets.vla_data.data_root_dir=playground/Datasets/rl_games,++datasets.vla_data.dataset_py=lerobot_datasets,++datasets.vla_data.eval_data_mix=flappy_train__bridge__val,++datasets.vla_data.eval_data_mix=null,++datasets.vla_data.eval_num_workers=8,++datasets.vla_data.eval_sequential_step_sampling=null,++datasets.vla_data.image_mode=single,++datasets.vla_data.include_state=true,++datasets.vla_data.latency_curriculum.enabled=false,++datasets.vla_data.latency_curriculum.latencies=null,++datasets.vla_data.latency_curriculum.phase_steps=null,++datasets.vla_data.latency_curriculum.strategy=exclusive,++datasets.vla_data.load_all_data_for_training=true,++datasets.vla_data.num_obs_frames=1,++datasets.vla_data.num_workers=8,++datasets.vla_data.obs_image_size=null,++datasets.vla_data.per_device_batch_size=64,++datasets.vla_data.persistent_workers=true,++datasets.vla_data.pin_memory=true,++datasets.vla_data.prefetch_factor=4,++datasets.vla_data.sequential_step_sampling=false,++datasets.vla_data.shuffle=true,++datasets.vla_data.stitch_grid=[2,2],++datasets.vla_data.video_backend=torchvision_av,++framework.action_model.action_dim=7,++framework.action_model.action_env_dim=2,++framework.action_model.action_horizon=1,++framework.action_model.future_action_window_size=0,++framework.action_model.loss_type=discrete_ce,++framework.action_model.past_action_window_size=0,++framework.action_model.state_dim=7,++framework.name=QwenOFT,++framework.qwenvl.attn_implementation=flash_attention_2,++framework.qwenvl.base_vlm=/workspace/latency-sensitive-bench/starVLA/playground/Pretrained_models/Qwen3-VL-4B-Instruct,++framework.qwenvl.base_vlm=playground/Pretrained_models/Qwen3-VL-4B-Instruct,++framework.qwenvl.enable_gradient_checkpointing=true,++initialization.checkpoint_filename=checkpoints/steps_5000_pytorch_model.pt,++initialization.checkpoint_hf_repo_id=StarVLA/Qwen3VL-OFT-Bridge-RT-1,++initialization.checkpoint_local_dir=playground/Pretrained_models/Qwen3VL-OFT-Bridge-RT-1,++is_debug=false,++output_dir=null,++paths.accelerate_config=starVLA/config/deepseeds/deepspeed_zero2.yaml,++paths.base_model_dir=playground/Pretrained_models/Qwen3-VL-4B-Instruct,++paths.dataset_cache_dir=null,++paths.dataset_local_dir=data/flappy_fix_latency_2_200ep,++paths.run_root_dir=results/Checkpoints,++rl_games.action_carrier=bridge,++rl_games.env_eval.distributed_mode=none,++rl_games.env_eval.enabled=true,++rl_games.env_eval.fixed_episode_seeds=true,++rl_games.env_eval.frameskip=1,++rl_games.env_eval.image_size=224,++rl_games.env_eval.latency.mode=single,++rl_games.env_eval.latency.prompt_map_path=/workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep/flappy_train__bridge/latency_prompt_map.json,++rl_games.env_eval.latency.prompt_map_path=null,++rl_games.env_eval.latency.values=[0],++rl_games.env_eval.latency_seed_stride=0,++rl_games.env_eval.mid_train.enabled=true,++rl_games.env_eval.mid_train.interval_steps=250,++rl_games.env_eval.mid_train.latencies=[2],++rl_games.env_eval.mid_train.max_steps_per_episode=3600,++rl_games.env_eval.mid_train.num_episodes=5,++rl_games.env_eval.post_train.enabled=false,++rl_games.env_eval.post_train.latencies=[0,1,2,3,4],++rl_games.env_eval.post_train.max_steps_per_episode=3600,++rl_games.env_eval.post_train.num_episodes=5,++rl_games.env_eval.seed=42,++rl_games.env_eval.task_description=,++rl_games.env_eval.task_seed_stride=0,++rl_games.env_eval.vectorized.batch_size=1,++rl_games.env_eval.vectorized.enabled=false,++rl_games.initialization_mode=bridge,++rl_games.model_alias=openvla,++rl_games.task=flappy,++run_id=flappy_fix_latency_2_200ep_last_8_layers_corrected_v2,++run_root_dir=/workspace/latency-sensitive-bench/starVLA/results/Checkpoints,++run_root_dir=results/Checkpoints,++seed=42,++trainer.cc_f1_tolerance=1,++trainer.distributed_backend=none,++trainer.eval_action_classification=true,++trainer.eval_action_classification_interval=null,++trainer.eval_interval=100,++trainer.eval_num_batches=100,++trainer.freeze_llm_layers=[0,27],++trainer.freeze_modules=,++trainer.freeze_tied_embedding=true,++trainer.freeze_vit=true,++trainer.gradient_accumulation_steps=2,++trainer.gradient_clipping=1.0,++trainer.is_resume=false,++trainer.is_resume=false,++trainer.learning_rate.action_model=0.0001,++trainer.learning_rate.base=2e-05,++trainer.learning_rate.qwen_vl_interface=1e-05,++trainer.logging_frequency=1,++trainer.loss_scale.vla=1.0,++trainer.loss_scale.vlm=0.1,++trainer.lr_scheduler_type=cosine_with_min_lr,++trainer.max_grad_norm=1.0,++trainer.max_train_steps=5000,++trainer.num_warmup_steps=100,++trainer.optimizer.betas=[0.9,0.95],++trainer.optimizer.eps=1e-08,++trainer.optimizer.fused=true,++trainer.optimizer.name=AdamW,++trainer.optimizer.weight_decay=1e-08,++trainer.per_latency_eval_num_batches=null,++trainer.pretrained_checkpoint=/workspace/latency-sensitive-bench/starVLA/results/Checkpoints/flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/_initialization/StarVLA_Qwen3VL-OFT-Bridge-RT-1/checkpoints/steps_5000_pytorch_model.pt,++trainer.pretrained_checkpoint=null,++trainer.profile_timing.enabled=false,++trainer.profile_timing.log_interval=10,++trainer.reload_modules=null,++trainer.resume_step=0,++trainer.resume_step=0,++trainer.save_format=pt,++trainer.save_interval=500,++trainer.scheduler_specific_kwargs.min_lr=1e-06,++trainer.weight_decay=0.0,++version_id=0.21,++wandb_entity=saberrr-zju,++wandb_project=starVLA_rl_games,++workspace_dir=WORKSPACE_DIR,env=flappy,init=bridge,mode=single,model=openvla
300
+ id: ???
301
+ num: ???
302
+ config_name: train
303
+ env_set: {}
304
+ env_copy: []
305
+ config:
306
+ override_dirname:
307
+ kv_sep: '='
308
+ item_sep: ','
309
+ exclude_keys: []
310
+ runtime:
311
+ version: 1.3.3
312
+ version_base: '1.1'
313
+ cwd: /workspace/latency-sensitive-bench/starVLA
314
+ config_sources:
315
+ - path: hydra.conf
316
+ schema: pkg
317
+ provider: hydra
318
+ - path: /workspace/latency-sensitive-bench/starVLA/examples/rl_games/config
319
+ schema: file
320
+ provider: main
321
+ - path: ''
322
+ schema: structured
323
+ provider: schema
324
+ output_dir: /workspace/latency-sensitive-bench/starVLA/results/Checkpoints/flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra
325
+ choices:
326
+ cross_task_setup: null
327
+ checkpoint: default
328
+ mode: single
329
+ init: bridge
330
+ env: flappy
331
+ model: openvla
332
+ hydra/env: default
333
+ hydra/callbacks: null
334
+ hydra/job_logging: default
335
+ hydra/hydra_logging: default
336
+ hydra/hydra_help: default
337
+ hydra/help: default
338
+ hydra/sweeper: basic
339
+ hydra/launcher: basic
340
+ hydra/output: default
341
+ verbose: false
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/.hydra/overrides.yaml ADDED
@@ -0,0 +1,181 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ - model=openvla
2
+ - env=flappy
3
+ - init=bridge
4
+ - mode=single
5
+ - ++framework.qwenvl.base_vlm=playground/Pretrained_models/Qwen3-VL-4B-Instruct
6
+ - ++framework.qwenvl.attn_implementation=flash_attention_2
7
+ - ++framework.qwenvl.enable_gradient_checkpointing=true
8
+ - ++framework.action_model.state_dim=7
9
+ - ++framework.action_model.loss_type=discrete_ce
10
+ - ++framework.action_model.action_horizon=1
11
+ - ++framework.action_model.future_action_window_size=0
12
+ - ++framework.action_model.past_action_window_size=0
13
+ - ++framework.action_model.action_dim=7
14
+ - ++framework.action_model.action_env_dim=2
15
+ - ++framework.name=QwenOFT
16
+ - ++datasets.vla_data.dataset_py=lerobot_datasets
17
+ - ++datasets.vla_data.include_state=true
18
+ - ++datasets.vla_data.data_root_dir=playground/Datasets/rl_games
19
+ - ++datasets.vla_data.data_mix=flappy_train
20
+ - ++datasets.vla_data.eval_data_mix=null
21
+ - ++datasets.vla_data.custom_mixtures_path=null
22
+ - ++datasets.vla_data.action_type=discrete
23
+ - ++datasets.vla_data.sequential_step_sampling=false
24
+ - ++datasets.vla_data.eval_sequential_step_sampling=null
25
+ - ++datasets.vla_data.num_workers=8
26
+ - ++datasets.vla_data.eval_num_workers=8
27
+ - ++datasets.vla_data.prefetch_factor=4
28
+ - ++datasets.vla_data.persistent_workers=true
29
+ - ++datasets.vla_data.pin_memory=true
30
+ - ++datasets.vla_data.shuffle=true
31
+ - ++datasets.vla_data.action_balance.enabled=false
32
+ - ++datasets.vla_data.action_balance.strategy=balanced_epoch
33
+ - ++datasets.vla_data.action_balance.action_key=action_id
34
+ - ++datasets.vla_data.action_balance.target_flap_fraction=0.3
35
+ - ++datasets.vla_data.action_balance.noop_id=0
36
+ - ++datasets.vla_data.action_balance.flap_id=1
37
+ - ++datasets.vla_data.latency_curriculum.enabled=false
38
+ - ++datasets.vla_data.latency_curriculum.strategy=exclusive
39
+ - ++datasets.vla_data.latency_curriculum.latencies=null
40
+ - ++datasets.vla_data.latency_curriculum.phase_steps=null
41
+ - ++datasets.vla_data.per_device_batch_size=64
42
+ - ++datasets.vla_data.load_all_data_for_training=true
43
+ - ++datasets.vla_data.num_obs_frames=1
44
+ - ++datasets.vla_data.image_mode=single
45
+ - ++datasets.vla_data.stitch_grid=[2,2]
46
+ - ++datasets.vla_data.obs_image_size=null
47
+ - ++datasets.vla_data.video_backend=torchvision_av
48
+ - ++dataset.source_hf=
49
+ - ++dataset.config_name=null
50
+ - ++dataset.source_subdir=null
51
+ - ++dataset.converted_name=flappy_train
52
+ - ++dataset.single_source_hf=
53
+ - ++dataset.mixed_source_hf=
54
+ - ++dataset.single_converted_name=flappy_train
55
+ - ++dataset.mixed_converted_name=flappy_mixed_latency_train
56
+ - ++dataset.single_latency_filter=null
57
+ - ++dataset.mixed_latency_filter=null
58
+ - ++dataset.force_download=false
59
+ - ++dataset.setup_force=false
60
+ - ++dataset.skip_verification=false
61
+ - ++dataset.verify_rows=200
62
+ - ++dataset.max_episodes=null
63
+ - ++dataset.episodes_per_latency=null
64
+ - ++dataset.latency_filter=null
65
+ - ++dataset.debug_subset.enabled=false
66
+ - ++dataset.debug_subset.max_episodes=5
67
+ - ++dataset.debug_subset.suffix=debug
68
+ - ++base_model.repo_id=Qwen/Qwen3-VL-4B-Instruct
69
+ - ++initialization.checkpoint_local_dir=playground/Pretrained_models/Qwen3VL-OFT-Bridge-RT-1
70
+ - ++initialization.checkpoint_hf_repo_id=StarVLA/Qwen3VL-OFT-Bridge-RT-1
71
+ - ++initialization.checkpoint_filename=checkpoints/steps_5000_pytorch_model.pt
72
+ - ++trainer.max_train_steps=5000
73
+ - ++trainer.num_warmup_steps=100
74
+ - ++trainer.save_interval=500
75
+ - ++trainer.eval_interval=100
76
+ - ++trainer.eval_num_batches=100
77
+ - ++trainer.per_latency_eval_num_batches=null
78
+ - ++trainer.eval_action_classification=true
79
+ - ++trainer.eval_action_classification_interval=null
80
+ - ++trainer.cc_f1_tolerance=1
81
+ - ++trainer.learning_rate.base=2e-05
82
+ - ++trainer.learning_rate.qwen_vl_interface=1e-05
83
+ - ++trainer.learning_rate.action_model=0.0001
84
+ - ++trainer.lr_scheduler_type=cosine_with_min_lr
85
+ - ++trainer.scheduler_specific_kwargs.min_lr=1e-06
86
+ - ++trainer.freeze_modules=
87
+ - ++trainer.freeze_vit=true
88
+ - ++trainer.freeze_tied_embedding=true
89
+ - ++trainer.freeze_llm_layers=[0,27]
90
+ - ++trainer.loss_scale.vla=1.0
91
+ - ++trainer.loss_scale.vlm=0.1
92
+ - ++trainer.max_grad_norm=1.0
93
+ - ++trainer.weight_decay=0.0
94
+ - ++trainer.logging_frequency=1
95
+ - ++trainer.profile_timing.enabled=false
96
+ - ++trainer.profile_timing.log_interval=10
97
+ - ++trainer.gradient_clipping=1.0
98
+ - ++trainer.gradient_accumulation_steps=2
99
+ - ++trainer.distributed_backend=none
100
+ - ++trainer.is_resume=false
101
+ - ++trainer.pretrained_checkpoint=null
102
+ - ++trainer.resume_step=0
103
+ - ++trainer.reload_modules=null
104
+ - ++trainer.optimizer.name=AdamW
105
+ - ++trainer.optimizer.betas=[0.9,0.95]
106
+ - ++trainer.optimizer.eps=1e-08
107
+ - ++trainer.optimizer.weight_decay=1e-08
108
+ - ++trainer.optimizer.fused=true
109
+ - ++trainer.save_format=pt
110
+ - ++workspace_dir=WORKSPACE_DIR
111
+ - ++run_root_dir=results/Checkpoints
112
+ - ++seed=42
113
+ - ++wandb_entity=saberrr-zju
114
+ - ++wandb_project=starVLA_rl_games
115
+ - ++auth.env_file=null
116
+ - ++auth.hf_token_env=HF_TOKEN
117
+ - ++auth.wandb_api_key_env=WANDB_API_KEY
118
+ - ++paths.run_root_dir=results/Checkpoints
119
+ - ++paths.dataset_local_dir=data/flappy_fix_latency_2_200ep
120
+ - ++paths.dataset_cache_dir=null
121
+ - ++paths.base_model_dir=playground/Pretrained_models/Qwen3-VL-4B-Instruct
122
+ - ++paths.accelerate_config=starVLA/config/deepseeds/deepspeed_zero2.yaml
123
+ - ++rl_games.model_alias=openvla
124
+ - ++rl_games.env_eval.image_size=224
125
+ - ++rl_games.env_eval.frameskip=1
126
+ - ++rl_games.env_eval.seed=42
127
+ - ++rl_games.env_eval.fixed_episode_seeds=true
128
+ - ++rl_games.env_eval.latency_seed_stride=0
129
+ - ++rl_games.env_eval.task_seed_stride=0
130
+ - ++rl_games.env_eval.task_description=
131
+ - ++rl_games.env_eval.enabled=true
132
+ - ++rl_games.env_eval.distributed_mode=none
133
+ - ++rl_games.env_eval.vectorized.enabled=false
134
+ - ++rl_games.env_eval.vectorized.batch_size=1
135
+ - ++rl_games.env_eval.latency.prompt_map_path=null
136
+ - ++rl_games.env_eval.latency.mode=single
137
+ - ++rl_games.env_eval.latency.values=[0]
138
+ - ++rl_games.env_eval.mid_train.enabled=true
139
+ - ++rl_games.env_eval.mid_train.interval_steps=250
140
+ - ++rl_games.env_eval.mid_train.latencies=[2]
141
+ - ++rl_games.env_eval.mid_train.num_episodes=5
142
+ - ++rl_games.env_eval.mid_train.max_steps_per_episode=3600
143
+ - ++rl_games.env_eval.post_train.enabled=false
144
+ - ++rl_games.env_eval.post_train.latencies=[0,1,2,3,4]
145
+ - ++rl_games.env_eval.post_train.num_episodes=5
146
+ - ++rl_games.env_eval.post_train.max_steps_per_episode=3600
147
+ - ++rl_games.task=flappy
148
+ - ++rl_games.initialization_mode=bridge
149
+ - ++rl_games.action_carrier=bridge
150
+ - ++bridge_base_model.repo_id.openvla=Qwen/Qwen3-VL-4B-Instruct
151
+ - ++bridge_base_model.repo_id.pi0=StarVLA/Qwen2.5-VL-3B-Instruct-Action
152
+ - ++bridge_base_model.repo_id.pi05=Qwen/Qwen3-VL-4B-Instruct
153
+ - ++bridge_base_model.repo_id.gr00t=Qwen/Qwen3-VL-4B-Instruct
154
+ - ++bridge_base_model.local_dir.openvla=playground/Pretrained_models/Qwen3-VL-4B-Instruct
155
+ - ++bridge_base_model.local_dir.pi0=playground/Pretrained_models/Qwen2.5-VL-3B-Instruct-Action
156
+ - ++bridge_base_model.local_dir.pi05=playground/Pretrained_models/Qwen3-VL-4B-Instruct
157
+ - ++bridge_base_model.local_dir.gr00t=playground/Pretrained_models/Qwen3-VL-4B-Instruct
158
+ - ++checkpoint.load=none
159
+ - ++checkpoint.hf_repo_id=null
160
+ - ++checkpoint.save_best_model=false
161
+ - ++checkpoint.save_pt_file=false
162
+ - ++checkpoint.local.keep_last_n=1
163
+ - ++checkpoint.sync.enabled=false
164
+ - ++checkpoint.sync.repo_id=null
165
+ - ++checkpoint.sync.keep_last_n=0
166
+ - ++checkpoint.sync.sync_every_n_checkpoints=1
167
+ - ++checkpoint.sync.resume_policy=local_latest
168
+ - ++run_id=flappy_fix_latency_2_200ep_last_8_layers_corrected_v2
169
+ - ++output_dir=null
170
+ - ++config_yaml=null
171
+ - ++is_debug=false
172
+ - ++version_id=0.21
173
+ - ++run_root_dir=/workspace/latency-sensitive-bench/starVLA/results/Checkpoints
174
+ - ++trainer.is_resume=false
175
+ - ++trainer.pretrained_checkpoint=/workspace/latency-sensitive-bench/starVLA/results/Checkpoints/flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/checkpoints/_initialization/StarVLA_Qwen3VL-OFT-Bridge-RT-1/checkpoints/steps_5000_pytorch_model.pt
176
+ - ++trainer.resume_step=0
177
+ - ++datasets.vla_data.data_root_dir=/workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep
178
+ - ++datasets.vla_data.data_mix=flappy_train__bridge
179
+ - ++datasets.vla_data.eval_data_mix=flappy_train__bridge__val
180
+ - ++framework.qwenvl.base_vlm=/workspace/latency-sensitive-bench/starVLA/playground/Pretrained_models/Qwen3-VL-4B-Instruct
181
+ - ++rl_games.env_eval.latency.prompt_map_path=/workspace/latency-sensitive-bench/starVLA/data/flappy_fix_latency_2_200ep/flappy_train__bridge/latency_prompt_map.json
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/hydra/train_starvla_hydra.log ADDED
The diff for this file is too large to render. See raw diff
 
flappy_fix_latency_2_200ep_last_8_layers_corrected_v2/summary.jsonl ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {"steps": 500}
2
+ {"steps": 1000}
3
+ {"steps": 1500}
4
+ {"steps": 2000}
5
+ {"steps": 2500}
6
+ {"steps": 3000}
7
+ {"steps": 3500}
8
+ {"steps": 4000}
9
+ {"steps": 4500}
10
+ {"steps": 5000}