aliangdw commited on
Commit
dc59acc
·
verified ·
1 Parent(s): c393599

FFT finetune of Robometer-4B on Armnet benchmark

Browse files
Files changed (5) hide show
  1. README.md +20 -0
  2. config.json +71 -0
  3. config.yaml +188 -0
  4. metrics.json +112 -0
  5. model.safetensors +3 -0
README.md ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model: Qwen/Qwen3-VL-4B-Instruct
4
+ tags:
5
+ - robometer
6
+ - reward-model
7
+ - rbm
8
+ - armnet
9
+ library_name: transformers
10
+ ---
11
+
12
+ # Robometer-4B FFT finetuned on Armnet benchmark
13
+
14
+ Full fine-tune (FFT, no LoRA) of [Robometer-4B](https://huggingface.co/robometer/Robometer-4B) on the Armnet benchmark (so101 + bimanual_so101), using Qwen3-VL-4B backbone.
15
+
16
+ Trained for 1000 steps on 4x H200.
17
+
18
+ ## Armnet benchmark results (training-time custom eval)
19
+ - so101: reward-alignment Pearson 0.766, policy-ranking Kendall 0.973
20
+ - bimanual_so101: reward-alignment Pearson 0.873, policy-ranking Kendall 0.86
config.json ADDED
@@ -0,0 +1,71 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "RBM"
4
+ ],
5
+ "dtype": "bfloat16",
6
+ "image_token_id": 151655,
7
+ "model_name": "unsloth/Qwen3-VL-4B-Instruct",
8
+ "model_type": "qwen3_vl",
9
+ "pad_token_id": 151654,
10
+ "text_config": {
11
+ "attention_bias": false,
12
+ "attention_dropout": 0.0,
13
+ "bos_token_id": 151643,
14
+ "dtype": "bfloat16",
15
+ "eos_token_id": 151645,
16
+ "head_dim": 128,
17
+ "hidden_act": "silu",
18
+ "hidden_size": 2560,
19
+ "initializer_range": 0.02,
20
+ "intermediate_size": 9728,
21
+ "max_position_embeddings": 262144,
22
+ "model_type": "qwen3_vl_text",
23
+ "num_attention_heads": 32,
24
+ "num_hidden_layers": 36,
25
+ "num_key_value_heads": 8,
26
+ "pad_token_id": null,
27
+ "rms_norm_eps": 1e-06,
28
+ "rope_parameters": {
29
+ "mrope_interleaved": true,
30
+ "mrope_section": [
31
+ 24,
32
+ 20,
33
+ 20
34
+ ],
35
+ "rope_theta": 5000000,
36
+ "rope_type": "default"
37
+ },
38
+ "tie_word_embeddings": true,
39
+ "use_cache": true,
40
+ "vocab_size": 151674
41
+ },
42
+ "tie_word_embeddings": true,
43
+ "transformers_version": "5.3.0",
44
+ "unsloth_fixed": true,
45
+ "unsloth_version": "2026.3.11",
46
+ "use_cache": false,
47
+ "video_token_id": 151656,
48
+ "vision_config": {
49
+ "deepstack_visual_indexes": [
50
+ 5,
51
+ 11,
52
+ 17
53
+ ],
54
+ "depth": 24,
55
+ "dtype": "bfloat16",
56
+ "hidden_act": "gelu_pytorch_tanh",
57
+ "hidden_size": 1024,
58
+ "in_channels": 3,
59
+ "initializer_range": 0.02,
60
+ "intermediate_size": 4096,
61
+ "model_type": "qwen3_vl",
62
+ "num_heads": 16,
63
+ "num_position_embeddings": 2304,
64
+ "out_hidden_size": 2560,
65
+ "patch_size": 16,
66
+ "spatial_merge_size": 2,
67
+ "temporal_patch_size": 2
68
+ },
69
+ "vision_end_token_id": 151653,
70
+ "vision_start_token_id": 151652
71
+ }
config.yaml ADDED
@@ -0,0 +1,188 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ custom_eval:
2
+ comparisons_per_task: 5
3
+ confusion_matrix:
4
+ - rbm-1m-ood
5
+ confusion_matrix_n_trajectories_per_source: 5
6
+ custom_eval_random_seed: 42
7
+ eval_types:
8
+ - reward_alignment
9
+ - policy_ranking
10
+ max_comparisons: null
11
+ num_examples_per_quality_pr: 5
12
+ num_partial_successes: 5
13
+ pad_frames: true
14
+ policy_ranking:
15
+ - villekuosmanen_armnetbench_robometer_v01_so101
16
+ - villekuosmanen_armnetbench_robometer_v01_bimanual_so101
17
+ policy_ranking_max_tasks: 100
18
+ quality_preference:
19
+ - rbm-1m-ood
20
+ reward_alignment:
21
+ - villekuosmanen_armnetbench_robometer_v01_so101
22
+ - villekuosmanen_armnetbench_robometer_v01_bimanual_so101
23
+ reward_alignment_max_trajectories: 10
24
+ subsample_n_frames: null
25
+ use_frame_steps: true
26
+ data:
27
+ data_source_weights: null
28
+ dataloader_num_workers: 8
29
+ dataloader_persistent_workers: true
30
+ dataloader_pin_memory: true
31
+ dataset_preference_ratio: 0.7
32
+ dataset_success_cutoff_file: robometer/data/dataset_success_cutoff.txt
33
+ dataset_type: rbm
34
+ eval_datasets:
35
+ - villekuosmanen_armnetbench_robometer_v01_so101
36
+ - villekuosmanen_armnetbench_robometer_v01_bimanual_so101
37
+ eval_subset_size: null
38
+ load_embeddings: false
39
+ max_frames: 8
40
+ max_frames_after_preprocessing: 64
41
+ max_success: 1.0
42
+ max_trajectories: -1
43
+ min_frames_per_trajectory: 5
44
+ min_success: 0.5
45
+ partial_success_threshold: 0.2
46
+ predict_last_frame_partial_progress: false
47
+ preference_strategy_ratio:
48
+ - 1.0
49
+ - 1.0
50
+ - 1.0
51
+ - 1.0
52
+ progress_discrete_bins: 10
53
+ progress_loss_type: discrete
54
+ progress_pred_type: absolute_first_frame
55
+ progress_strategy_ratio:
56
+ - 1.0
57
+ - 1.0
58
+ - 1.0
59
+ - 1.0
60
+ resized_height: null
61
+ resized_width: null
62
+ sample_type_ratio:
63
+ - 1.0
64
+ - 0.0
65
+ - 0.0
66
+ seed: 42
67
+ shuffle: true
68
+ shuffle_progress_frames: false
69
+ train_datasets:
70
+ - villekuosmanen_armnetbench_robometer_v01_so101
71
+ - villekuosmanen_armnetbench_robometer_v01_bimanual_so101
72
+ traj_same_source_prob: 0.5
73
+ use_multi_image: true
74
+ use_per_frame_progress_token: true
75
+ debug: false
76
+ logging:
77
+ log_level: INFO
78
+ log_to: []
79
+ save_best:
80
+ greater_is_better:
81
+ - true
82
+ - true
83
+ - true
84
+ - true
85
+ hub_private: false
86
+ hub_save_every: 1000
87
+ hub_token: null
88
+ keep_top_k: 5
89
+ metric_names:
90
+ - eval_rew_align/pearson_villekuosmanen_armnetbench_robometer_v01_so101
91
+ - eval_p_rank/kendall_last_villekuosmanen_armnetbench_robometer_v01_so101
92
+ - eval_rew_align/pearson_villekuosmanen_armnetbench_robometer_v01_bimanual_so101
93
+ - eval_p_rank/kendall_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101
94
+ save_every: 1000
95
+ upload_to_hub: false
96
+ save_model: true
97
+ save_processor: true
98
+ wandb_entity: jesbu1
99
+ wandb_mode: null
100
+ wandb_notes: training Robometer
101
+ wandb_project: robometer
102
+ loss:
103
+ predict_last_frame_progress: false
104
+ progress_discrete_bins: 10
105
+ progress_loss_type: discrete
106
+ success_positive_weight: 1.0
107
+ mode: train
108
+ model:
109
+ average_temporal_patches: true
110
+ base_model_id: Qwen/Qwen3-VL-4B-Instruct
111
+ frame_pooling: mean
112
+ frame_pooling_attn_temperature: 1.0
113
+ model_type: default
114
+ peft_vision_encoder: false
115
+ progress_discrete_bins: 10
116
+ progress_loss_type: discrete
117
+ quantization: false
118
+ rewind: null
119
+ torch_dtype: bfloat16
120
+ train_language_model: true
121
+ train_preference_head: true
122
+ train_progress_head: true
123
+ train_success_head: true
124
+ train_vision_encoder: false
125
+ trust_remote_code: true
126
+ use_multi_image: true
127
+ use_peft: false
128
+ use_per_frame_progress_token: true
129
+ use_unsloth: true
130
+ peft:
131
+ bias: none
132
+ lora_alpha: 64
133
+ lora_dropout: 0.05
134
+ peft_vision_encoder: false
135
+ r: 32
136
+ target_modules:
137
+ - q_proj
138
+ - k_proj
139
+ - v_proj
140
+ - o_proj
141
+ - gate_proj
142
+ - up_proj
143
+ - down_proj
144
+ trainer_cls: rbm_heads
145
+ training:
146
+ beta: 0.1
147
+ bf16: true
148
+ custom_eval_steps: 250
149
+ dataloader_num_workers: 8
150
+ dataloader_persistent_workers: true
151
+ dataloader_pin_memory: true
152
+ ddp_bucket_cap_mb: 25
153
+ ddp_find_unused_parameters: false
154
+ do_eval: true
155
+ eval_steps: 250
156
+ evaluation_strategy: steps
157
+ exp_name: rbm_fft_armnet_qwen3_4b_16bs_4gpu
158
+ fp16: false
159
+ gradient_accumulation_steps: 1
160
+ gradient_checkpointing: true
161
+ learning_rate: 2.0e-05
162
+ load_from_checkpoint: robometer/Robometer-4B
163
+ logging_steps: 1
164
+ lr_scheduler_type: cosine
165
+ max_grad_norm: 10.0
166
+ max_seq_length: 1024
167
+ max_steps: 1000
168
+ num_gpus: 2
169
+ num_train_epochs: -1
170
+ optim: adamw_8bit
171
+ output_dir: ./logs
172
+ overwrite_output_dir: true
173
+ per_device_eval_batch_size: 16
174
+ per_device_train_batch_size: 16
175
+ predict_pref_progress: true
176
+ prediction_loss_only: true
177
+ remove_unused_columns: false
178
+ resume_from_checkpoint: null
179
+ run_default_eval: false
180
+ save_steps: 200
181
+ save_strategy: 'no'
182
+ torch_compile: false
183
+ torch_compile_backend: inductor
184
+ vision_encoder_lr: 1.0e-05
185
+ vision_encoder_num_layers: 3
186
+ warmup_ratio: 0.1
187
+ warmup_steps: 0
188
+ weight_decay: 0.01
metrics.json ADDED
@@ -0,0 +1,112 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 1000,
3
+ "metrics": {
4
+ "eval_rew_align/success_auprc_villekuosmanen_armnetbench_robometer_v01_so101": 0.692281313857899,
5
+ "eval_rew_align/positive_success_acc_villekuosmanen_armnetbench_robometer_v01_so101": 0.75,
6
+ "eval_rew_align/negative_success_acc_villekuosmanen_armnetbench_robometer_v01_so101": 0.9876984126984127,
7
+ "eval_rew_align/loss_villekuosmanen_armnetbench_robometer_v01_so101": 1.8137086153030395,
8
+ "eval_rew_align/pearson_villekuosmanen_armnetbench_robometer_v01_so101": 0.7661239143280704,
9
+ "eval_p_rank/kendall_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
10
+ "eval_p_rank/kendall_rewind_last_villekuosmanen_armnetbench_robometer_v01_so101": 1.0,
11
+ "eval_p_rank/avg_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.2603318393230438,
12
+ "eval_p_rank/min_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.2340403318405151,
13
+ "eval_p_rank/max_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.28662334680557255,
14
+ "eval_p_rank/avg_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.34317512847483156,
15
+ "eval_p_rank/min_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.22084063291549677,
16
+ "eval_p_rank/max_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.46550962403416635,
17
+ "eval_p_rank/avg_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.5989572279155254,
18
+ "eval_p_rank/min_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.4043008178472519,
19
+ "eval_p_rank/max_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.7333046674728394,
20
+ "eval_p_rank/ranking_acc_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
21
+ "eval_p_rank/ranking_acc_all_pairs_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
22
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.96,
23
+ "eval_p_rank/ranking_acc_failure_vs_successful_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.995,
24
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_last_villekuosmanen_armnetbench_robometer_v01_so101": 0.94,
25
+ "eval_p_rank/kendall_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
26
+ "eval_p_rank/kendall_rewind_avg_villekuosmanen_armnetbench_robometer_v01_so101": 1.0,
27
+ "eval_p_rank/avg_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.2603318393230438,
28
+ "eval_p_rank/min_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.2340403318405151,
29
+ "eval_p_rank/max_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.28662334680557255,
30
+ "eval_p_rank/avg_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.34317512847483156,
31
+ "eval_p_rank/min_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.22084063291549677,
32
+ "eval_p_rank/max_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.46550962403416635,
33
+ "eval_p_rank/avg_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.5989572279155254,
34
+ "eval_p_rank/min_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.4043008178472519,
35
+ "eval_p_rank/max_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.7333046674728394,
36
+ "eval_p_rank/ranking_acc_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
37
+ "eval_p_rank/ranking_acc_all_pairs_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
38
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.96,
39
+ "eval_p_rank/ranking_acc_failure_vs_successful_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.995,
40
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_avg_villekuosmanen_armnetbench_robometer_v01_so101": 0.94,
41
+ "eval_p_rank/kendall_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.9733333333333334,
42
+ "eval_p_rank/kendall_rewind_sum_villekuosmanen_armnetbench_robometer_v01_so101": 1.0,
43
+ "eval_p_rank/avg_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.2603318393230438,
44
+ "eval_p_rank/min_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.2340403318405151,
45
+ "eval_p_rank/max_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.28662334680557255,
46
+ "eval_p_rank/avg_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.34317512847483156,
47
+ "eval_p_rank/min_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.22084063291549677,
48
+ "eval_p_rank/max_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.46550962403416635,
49
+ "eval_p_rank/avg_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.5989572279155254,
50
+ "eval_p_rank/min_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.4043008178472519,
51
+ "eval_p_rank/max_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.7333046674728394,
52
+ "eval_p_rank/ranking_acc_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
53
+ "eval_p_rank/ranking_acc_all_pairs_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.98,
54
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.96,
55
+ "eval_p_rank/ranking_acc_failure_vs_successful_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.995,
56
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_sum_villekuosmanen_armnetbench_robometer_v01_so101": 0.94,
57
+ "eval_rew_align/success_auprc_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.5443845562271816,
58
+ "eval_rew_align/positive_success_acc_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.8,
59
+ "eval_rew_align/negative_success_acc_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.9837301587301587,
60
+ "eval_rew_align/loss_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.8786175727844239,
61
+ "eval_rew_align/pearson_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.873048229166392,
62
+ "eval_p_rank/kendall_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.8599999999999999,
63
+ "eval_p_rank/kendall_rewind_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
64
+ "eval_p_rank/avg_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.022240763902664218,
65
+ "eval_p_rank/min_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.004176568984985418,
66
+ "eval_p_rank/max_succ_subopt_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.04030495882034302,
67
+ "eval_p_rank/avg_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.48705225288867954,
68
+ "eval_p_rank/min_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.3980588108301163,
69
+ "eval_p_rank/max_subopt_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.5760456949472428,
70
+ "eval_p_rank/avg_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.5182861153036356,
71
+ "eval_p_rank/min_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.4383637696504593,
72
+ "eval_p_rank/max_succ_fail_diff_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.6127893760800363,
73
+ "eval_p_rank/ranking_acc_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.895,
74
+ "eval_p_rank/ranking_acc_all_pairs_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.895,
75
+ "eval_p_rank/ranking_acc_failure_vs_successful_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
76
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
77
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_last_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.58,
78
+ "eval_p_rank/kendall_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.8599999999999999,
79
+ "eval_p_rank/kendall_rewind_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
80
+ "eval_p_rank/avg_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.022240763902664218,
81
+ "eval_p_rank/min_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.004176568984985418,
82
+ "eval_p_rank/max_succ_subopt_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.04030495882034302,
83
+ "eval_p_rank/avg_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.48705225288867954,
84
+ "eval_p_rank/min_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.3980588108301163,
85
+ "eval_p_rank/max_subopt_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.5760456949472428,
86
+ "eval_p_rank/avg_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.5182861153036356,
87
+ "eval_p_rank/min_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.4383637696504593,
88
+ "eval_p_rank/max_succ_fail_diff_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.6127893760800363,
89
+ "eval_p_rank/ranking_acc_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.895,
90
+ "eval_p_rank/ranking_acc_all_pairs_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.895,
91
+ "eval_p_rank/ranking_acc_failure_vs_successful_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
92
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
93
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_avg_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.58,
94
+ "eval_p_rank/kendall_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.8599999999999999,
95
+ "eval_p_rank/kendall_rewind_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
96
+ "eval_p_rank/avg_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.022240763902664218,
97
+ "eval_p_rank/min_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.004176568984985418,
98
+ "eval_p_rank/max_succ_subopt_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.04030495882034302,
99
+ "eval_p_rank/avg_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.48705225288867954,
100
+ "eval_p_rank/min_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.3980588108301163,
101
+ "eval_p_rank/max_subopt_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.5760456949472428,
102
+ "eval_p_rank/avg_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.5182861153036356,
103
+ "eval_p_rank/min_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.4383637696504593,
104
+ "eval_p_rank/max_succ_fail_diff_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.6127893760800363,
105
+ "eval_p_rank/ranking_acc_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.895,
106
+ "eval_p_rank/ranking_acc_all_pairs_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.895,
107
+ "eval_p_rank/ranking_acc_failure_vs_successful_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
108
+ "eval_p_rank/ranking_acc_failure_vs_suboptimal_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 1.0,
109
+ "eval_p_rank/ranking_acc_suboptimal_vs_successful_sum_villekuosmanen_armnetbench_robometer_v01_bimanual_so101": 0.58,
110
+ "time/custom_evaluations": 33.157642278354615
111
+ }
112
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6715972de1faaf1d3bb1a4d0a1f42475f0e8ff00c84b381405f605d770dce3fb
3
+ size 8894099488