jesbu1 commited on
Commit
b9b672d
·
verified ·
1 Parent(s): e315c31

Upload combined SO-101 FFT checkpoint

Browse files
Files changed (4) hide show
  1. config.json +71 -0
  2. config.yaml +185 -0
  3. metrics.json +64 -0
  4. model.safetensors +3 -0
config.json ADDED
@@ -0,0 +1,71 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "RBM"
4
+ ],
5
+ "dtype": "bfloat16",
6
+ "image_token_id": 151655,
7
+ "model_name": "unsloth/Qwen3-VL-4B-Instruct",
8
+ "model_type": "qwen3_vl",
9
+ "pad_token_id": 151654,
10
+ "text_config": {
11
+ "attention_bias": false,
12
+ "attention_dropout": 0.0,
13
+ "bos_token_id": 151643,
14
+ "dtype": "bfloat16",
15
+ "eos_token_id": 151645,
16
+ "head_dim": 128,
17
+ "hidden_act": "silu",
18
+ "hidden_size": 2560,
19
+ "initializer_range": 0.02,
20
+ "intermediate_size": 9728,
21
+ "max_position_embeddings": 262144,
22
+ "model_type": "qwen3_vl_text",
23
+ "num_attention_heads": 32,
24
+ "num_hidden_layers": 36,
25
+ "num_key_value_heads": 8,
26
+ "pad_token_id": null,
27
+ "rms_norm_eps": 1e-06,
28
+ "rope_parameters": {
29
+ "mrope_interleaved": true,
30
+ "mrope_section": [
31
+ 24,
32
+ 20,
33
+ 20
34
+ ],
35
+ "rope_theta": 5000000,
36
+ "rope_type": "default"
37
+ },
38
+ "tie_word_embeddings": true,
39
+ "use_cache": true,
40
+ "vocab_size": 151674
41
+ },
42
+ "tie_word_embeddings": true,
43
+ "transformers_version": "5.3.0",
44
+ "unsloth_fixed": true,
45
+ "unsloth_version": "2026.3.11",
46
+ "use_cache": false,
47
+ "video_token_id": 151656,
48
+ "vision_config": {
49
+ "deepstack_visual_indexes": [
50
+ 5,
51
+ 11,
52
+ 17
53
+ ],
54
+ "depth": 24,
55
+ "dtype": "bfloat16",
56
+ "hidden_act": "gelu_pytorch_tanh",
57
+ "hidden_size": 1024,
58
+ "in_channels": 3,
59
+ "initializer_range": 0.02,
60
+ "intermediate_size": 4096,
61
+ "model_type": "qwen3_vl",
62
+ "num_heads": 16,
63
+ "num_position_embeddings": 2304,
64
+ "out_hidden_size": 2560,
65
+ "patch_size": 16,
66
+ "spatial_merge_size": 2,
67
+ "temporal_patch_size": 2
68
+ },
69
+ "vision_end_token_id": 151653,
70
+ "vision_start_token_id": 151652
71
+ }
config.yaml ADDED
@@ -0,0 +1,185 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ custom_eval:
2
+ comparisons_per_task: 5
3
+ confusion_matrix:
4
+ - rbm-1m-ood
5
+ confusion_matrix_n_trajectories_per_source: 5
6
+ custom_eval_random_seed: 42
7
+ eval_types:
8
+ - reward_alignment
9
+ - policy_ranking
10
+ max_comparisons: null
11
+ num_examples_per_quality_pr: 5
12
+ num_partial_successes: 5
13
+ pad_frames: true
14
+ policy_ranking:
15
+ - villekuosmanen_armnetbench_robometer_v01_so101
16
+ policy_ranking_max_tasks: 100
17
+ quality_preference:
18
+ - rbm-1m-ood
19
+ reward_alignment:
20
+ - villekuosmanen_armnetbench_robometer_v01_so101
21
+ - ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101
22
+ reward_alignment_max_trajectories: 10
23
+ subsample_n_frames: null
24
+ use_frame_steps: true
25
+ data:
26
+ data_source_weights: null
27
+ dataloader_num_workers: 8
28
+ dataloader_persistent_workers: true
29
+ dataloader_pin_memory: true
30
+ dataset_preference_ratio: 0.7
31
+ dataset_success_cutoff_file: robometer/data/dataset_success_cutoff.txt
32
+ dataset_type: rbm
33
+ eval_datasets:
34
+ - villekuosmanen_armnetbench_robometer_v01_so101
35
+ - ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101
36
+ eval_subset_size: null
37
+ load_embeddings: false
38
+ max_frames: 8
39
+ max_frames_after_preprocessing: 64
40
+ max_success: 1.0
41
+ max_trajectories: -1
42
+ min_frames_per_trajectory: 5
43
+ min_success: 0.5
44
+ partial_success_threshold: 0.2
45
+ predict_last_frame_partial_progress: false
46
+ preference_strategy_ratio:
47
+ - 1.0
48
+ - 1.0
49
+ - 1.0
50
+ - 1.0
51
+ progress_discrete_bins: 10
52
+ progress_loss_type: discrete
53
+ progress_pred_type: absolute_first_frame
54
+ progress_strategy_ratio:
55
+ - 1.0
56
+ - 1.0
57
+ - 1.0
58
+ - 1.0
59
+ resized_height: null
60
+ resized_width: null
61
+ sample_type_ratio:
62
+ - 1.0
63
+ - 0.0
64
+ - 0.0
65
+ seed: 42
66
+ shuffle: true
67
+ shuffle_progress_frames: false
68
+ train_datasets:
69
+ - villekuosmanen_armnetbench_robometer_v01_so101
70
+ - ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101
71
+ traj_same_source_prob: 0.5
72
+ use_multi_image: true
73
+ use_per_frame_progress_token: true
74
+ debug: false
75
+ logging:
76
+ log_level: INFO
77
+ log_to: []
78
+ save_best:
79
+ greater_is_better:
80
+ - true
81
+ - true
82
+ - true
83
+ hub_private: false
84
+ hub_save_every: 1000
85
+ hub_token: null
86
+ keep_top_k: 5
87
+ metric_names:
88
+ - eval_rew_align/pearson_villekuosmanen_armnetbench_robometer_v01_so101
89
+ - eval_p_rank/kendall_last_villekuosmanen_armnetbench_robometer_v01_so101
90
+ - eval_rew_align/pearson_ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101
91
+ save_every: 1000
92
+ upload_to_hub: false
93
+ save_model: true
94
+ save_processor: true
95
+ wandb_entity: jesbu1
96
+ wandb_mode: null
97
+ wandb_notes: training Robometer
98
+ wandb_project: robometer
99
+ loss:
100
+ predict_last_frame_progress: false
101
+ progress_discrete_bins: 10
102
+ progress_loss_type: discrete
103
+ success_positive_weight: 1.0
104
+ mode: train
105
+ model:
106
+ average_temporal_patches: true
107
+ base_model_id: Qwen/Qwen3-VL-4B-Instruct
108
+ frame_pooling: mean
109
+ frame_pooling_attn_temperature: 1.0
110
+ model_type: default
111
+ peft_vision_encoder: false
112
+ progress_discrete_bins: 10
113
+ progress_loss_type: discrete
114
+ quantization: false
115
+ rewind: null
116
+ torch_dtype: bfloat16
117
+ train_language_model: true
118
+ train_preference_head: true
119
+ train_progress_head: true
120
+ train_success_head: true
121
+ train_vision_encoder: false
122
+ trust_remote_code: true
123
+ use_multi_image: true
124
+ use_peft: false
125
+ use_per_frame_progress_token: true
126
+ use_unsloth: true
127
+ peft:
128
+ bias: none
129
+ lora_alpha: 64
130
+ lora_dropout: 0.05
131
+ peft_vision_encoder: false
132
+ r: 32
133
+ target_modules:
134
+ - q_proj
135
+ - k_proj
136
+ - v_proj
137
+ - o_proj
138
+ - gate_proj
139
+ - up_proj
140
+ - down_proj
141
+ trainer_cls: rbm_heads
142
+ training:
143
+ beta: 0.1
144
+ bf16: true
145
+ custom_eval_steps: 250
146
+ dataloader_num_workers: 8
147
+ dataloader_persistent_workers: true
148
+ dataloader_pin_memory: true
149
+ ddp_bucket_cap_mb: 25
150
+ ddp_find_unused_parameters: false
151
+ do_eval: true
152
+ eval_steps: 250
153
+ evaluation_strategy: steps
154
+ exp_name: rbm_fft_both_so101_qwen3_4b_16bs_4gpu
155
+ fp16: false
156
+ gradient_accumulation_steps: 1
157
+ gradient_checkpointing: true
158
+ learning_rate: 2.0e-05
159
+ load_from_checkpoint: robometer/Robometer-4B
160
+ logging_steps: 1
161
+ lr_scheduler_type: cosine
162
+ max_grad_norm: 10.0
163
+ max_seq_length: 1024
164
+ max_steps: 1500
165
+ num_gpus: 2
166
+ num_train_epochs: -1
167
+ optim: adamw_8bit
168
+ output_dir: ./logs
169
+ overwrite_output_dir: true
170
+ per_device_eval_batch_size: 16
171
+ per_device_train_batch_size: 16
172
+ predict_pref_progress: true
173
+ prediction_loss_only: true
174
+ remove_unused_columns: false
175
+ resume_from_checkpoint: null
176
+ run_default_eval: false
177
+ save_steps: 200
178
+ save_strategy: 'no'
179
+ torch_compile: false
180
+ torch_compile_backend: inductor
181
+ vision_encoder_lr: 1.0e-05
182
+ vision_encoder_num_layers: 3
183
+ warmup_ratio: 0.1
184
+ warmup_steps: 0
185
+ weight_decay: 0.01
metrics.json ADDED
@@ -0,0 +1,64 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 750,
3
+ "metrics": {
4
+ "eval_rew_align/success_auprc_villekuosmanen_armnetbench_robometer_v01_so101": 0.6899881016045726,
5
+ "eval_rew_align/positive_success_acc_villekuosmanen_armnetbench_robometer_v01_so101": 0.775,
6
+ "eval_rew_align/negative_success_acc_villekuosmanen_armnetbench_robometer_v01_so101": 0.9880952380952381,
7
+ "eval_rew_align/loss_villekuosmanen_armnetbench_robometer_v01_so101": 1.5189456224441529,
8
+ "eval_rew_align/pearson_villekuosmanen_armnetbench_robometer_v01_so101": 0.7819677384703819,
9
+ "eval_p_rank/kendall_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.94,
10
+ "eval_p_rank/kendall_rewind_last_villekuosmanen_armnetbench_robometer_v01_so101": 1.0,
11
+ "eval_p_rank/avg_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.26076613664627074,
12
+ "eval_p_rank/min_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.2388161063194275,
13
+ "eval_p_rank/max_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.28271616697311397,
14
+ "eval_p_rank/avg_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.25212376415729526,
15
+ "eval_p_rank/min_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.147011947631836,
16
+ "eval_p_rank/max_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.3572355806827545,
17
+ "eval_p_rank/avg_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.5191158263012767,
18
+ "eval_p_rank/min_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.25460606813430786,
19
+ "eval_p_rank/max_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.6971883609890939,
20
+ "eval_p_rank/ranking_acc_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
21
+ "eval_p_rank/ranking_acc_all_pairs_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
22
+ "eval_p_rank/ranking_acc_failure_vs_successful_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.975,
23
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
24
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.96,
25
+ "eval_p_rank/kendall_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.94,
26
+ "eval_p_rank/kendall_rewind_avg_villekuosmanen_armnetbench_robometer_v01_so101": 1.0,
27
+ "eval_p_rank/avg_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.26076613664627074,
28
+ "eval_p_rank/min_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.2388161063194275,
29
+ "eval_p_rank/max_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.28271616697311397,
30
+ "eval_p_rank/avg_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.25212376415729526,
31
+ "eval_p_rank/min_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.147011947631836,
32
+ "eval_p_rank/max_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.3572355806827545,
33
+ "eval_p_rank/avg_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.5191158263012767,
34
+ "eval_p_rank/min_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.25460606813430786,
35
+ "eval_p_rank/max_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.6971883609890939,
36
+ "eval_p_rank/ranking_acc_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
37
+ "eval_p_rank/ranking_acc_all_pairs_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
38
+ "eval_p_rank/ranking_acc_failure_vs_successful_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.975,
39
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
40
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.96,
41
+ "eval_p_rank/kendall_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.94,
42
+ "eval_p_rank/kendall_rewind_sum_villekuosmanen_armnetbench_robometer_v01_so101": 1.0,
43
+ "eval_p_rank/avg_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.26076613664627074,
44
+ "eval_p_rank/min_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.2388161063194275,
45
+ "eval_p_rank/max_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.28271616697311397,
46
+ "eval_p_rank/avg_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.25212376415729526,
47
+ "eval_p_rank/min_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.147011947631836,
48
+ "eval_p_rank/max_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.3572355806827545,
49
+ "eval_p_rank/avg_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.5191158263012767,
50
+ "eval_p_rank/min_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.25460606813430786,
51
+ "eval_p_rank/max_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.6971883609890939,
52
+ "eval_p_rank/ranking_acc_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
53
+ "eval_p_rank/ranking_acc_all_pairs_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
54
+ "eval_p_rank/ranking_acc_failure_vs_successful_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.975,
55
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
56
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.96,
57
+ "eval_rew_align/success_auprc_ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101": 0.3786145132198085,
58
+ "eval_rew_align/positive_success_acc_ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101": 0.9,
59
+ "eval_rew_align/negative_success_acc_ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101": 0.9583333333333334,
60
+ "eval_rew_align/loss_ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101": 1.2838820934295654,
61
+ "eval_rew_align/pearson_ykorkmaz_molmoact2_so100_101_rbm_molmoact2_so100_101": 0.9019924825489823,
62
+ "time/custom_evaluations": 41.701750837266445
63
+ }
64
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d5e3cb513d526e4da34041619a5967dab1e94523375d5430b9c370717bbcc82a
3
+ size 8894099488