diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/resolved_config.yaml b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/resolved_config.yaml new file mode 100644 index 0000000000000000000000000000000000000000..21b9af428aadcb60902e3a3c7de7672c5ca9b7ab --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/resolved_config.yaml @@ -0,0 +1,28 @@ +experiment_name: fewshot_39tasks_5shot_from_baseline26_fullactionhead_seed0_5k +policy_type: baseline +base_model_path: ${HOME}/groot_robocasa/Atomic26_baseline/checkpoint-120000 +output_root: ${HOME}/groot_robocasa/robocasa_v2/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0 +dataset: + dataset_soup: fewshot_heldout_atomic39_human_5shot +training: + num_gpus: 1 + batch_size: 64 + seed: 42 + filter_key_seed: 0 + manifest_path: ${HOME}/clvla/benchmarks/robocasa_v2/my_scripts/Fewshot/manifests/fewshot_heldout_atomic39/shot5_seed0.json + save_total_limit: 4 +phases: +- name: train_5shot_seed0_fullactionhead_5k + max_steps: 5000 + save_steps: 0 + save_step_list: + - 1000 + - 3000 + - 5000 + save_final_model: false + trainable: + tune_llm: false + tune_visual: false + tune_projector: true + tune_diffusion_model: true +resolved_sweep: {} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/seed0_5k.yaml b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/seed0_5k.yaml new file mode 100644 index 0000000000000000000000000000000000000000..7dec189e22ad0a68635e7157878809efdb975a89 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/seed0_5k.yaml @@ -0,0 +1,27 @@ +experiment_name: fewshot_39tasks_5shot_from_baseline26_fullactionhead_seed0_5k +policy_type: baseline +base_model_path: ${HOME}/groot_robocasa/Atomic26_baseline/checkpoint-120000 +output_root: ${HOME}/groot_robocasa/robocasa_v2/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0 +dataset: + dataset_soup: fewshot_heldout_atomic39_human_5shot +training: + num_gpus: 1 + batch_size: 64 + seed: 42 + filter_key_seed: 0 + manifest_path: ${HOME}/clvla/benchmarks/robocasa_v2/my_scripts/Fewshot/manifests/fewshot_heldout_atomic39/shot5_seed0.json + save_total_limit: 4 +phases: +- name: train_5shot_seed0_fullactionhead_5k + max_steps: 5000 + save_steps: 0 + save_step_list: + - 1000 + - 3000 + - 5000 + save_final_model: false + trainable: + tune_llm: false + tune_visual: false + tune_projector: true + tune_diffusion_model: true diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b06ee3aaea89953051ee0fb13b0934a646c05634 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:61046d6d7e9c58345891562a0fe071dd9475ab479c8ad61ed6d04127525d516c +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f5cb91781cd23ce592e156076092143c18a8604b --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1710a8ef3e45be4a163c4f962d41466205343411de6f144fc6a83a28b8f503bf +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..e59959a3badb3e44084639ee594b80925a2929e8 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bbf47a3b7290c0b108a84d6a1be53d7485caf86c3052476f4f13b3b4f8067bef +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..cddb85352b4d053450624108786800cbad81d6cb --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e19ead5779e3f8f2f666b7793de3a03d118f57f1b16a97eeb87bd732d18b445 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/config.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..47d7b77e4255263f3803a4b6f94ca6831e459b70 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/config.json @@ -0,0 +1,64 @@ +{ + "action_dim": 32, + "action_head_cfg": { + "action_dim": 32, + "action_horizon": 16, + "add_pos_embed": true, + "backbone_embedding_dim": 2048, + "diffusion_model_cfg": { + "attention_head_dim": 48, + "cross_attention_dim": 2048, + "dropout": 0.2, + "final_dropout": true, + "interleave_self_attention": true, + "norm_type": "ada_norm", + "num_attention_heads": 32, + "num_layers": 16, + "output_dim": 1024, + "positional_embeddings": null + }, + "hidden_size": 1024, + "input_embedding_dim": 1536, + "max_action_dim": 32, + "max_state_dim": 64, + "model_dtype": "float32", + "noise_beta_alpha": 1.5, + "noise_beta_beta": 1.0, + "noise_s": 0.999, + "num_inference_timesteps": 4, + "num_target_vision_tokens": 32, + "num_timestep_buckets": 1000, + "tune_diffusion_model": true, + "tune_projector": true, + "use_vlln": true, + "vl_self_attention_cfg": { + "attention_head_dim": 64, + "dropout": 0.2, + "final_dropout": true, + "num_attention_heads": 32, + "num_layers": 4, + "positional_embeddings": null + } + }, + "action_horizon": 16, + "architectures": [ + "GR00T_N1_5" + ], + "attn_implementation": null, + "backbone_cfg": { + "eagle_path": "NVEagle/eagle_er-qwen3_1_7B-Siglip2_400M_stage1_5_128gpu_er_v7_1mlp_nops", + "load_bf16": false, + "project_to_dim": null, + "reproject_vision": false, + "select_layer": 12, + "tune_llm": false, + "tune_visual": true, + "use_flash_attention": true + }, + "compute_dtype": "bfloat16", + "hidden_size": 2048, + "model_dtype": "float32", + "model_type": "gr00t_n1_5", + "torch_dtype": "bfloat16", + "transformers_version": "4.51.3" +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..11e7573e87819713aa14336d6276457412786937 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e25f0b02d749bea2cca2fdfc5adf54ab4d1ebc771d7dee2a89d0784d30c57367 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a9b2bf998ecd9cd48acd9a4ce64df52bfd7125e7 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0bb2f052e8c73380d13c16d9797f5516bcfbe2b88b40b1b94885f5ac80b6e0e6 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..0a8d88210a849e66e284fd4cd4d247f2b03ee0ad --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2cfb9120e2de97798d6ff37a711f2ac1f7397b57a59789d33d9833d2d22d5cab +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..de4e41c4a6949df056e028b10a18e7f8cd7b7580 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42d8e6d8e53e6b837084d0cc18fdd63ca9e40bd44a65d38eb52695647a8e84e8 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/trainer_state.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4da60235b75b3d11b5eb6833ebf3b45ff6dee5e7 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/checkpoint-3000/trainer_state.json @@ -0,0 +1,2134 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.033557046979865, + "eval_steps": 500, + "global_step": 3000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.016778523489932886, + "grad_norm": 1.0388541221618652, + "learning_rate": 1.08e-06, + "loss": 0.2251, + "step": 10 + }, + { + "epoch": 0.03355704697986577, + "grad_norm": 2.1458616256713867, + "learning_rate": 2.28e-06, + "loss": 0.2286, + "step": 20 + }, + { + "epoch": 0.050335570469798654, + "grad_norm": 1.0232809782028198, + "learning_rate": 3.48e-06, + "loss": 0.1901, + "step": 30 + }, + { + "epoch": 0.06711409395973154, + "grad_norm": 0.6550730466842651, + "learning_rate": 4.68e-06, + "loss": 0.1701, + "step": 40 + }, + { + "epoch": 0.08389261744966443, + "grad_norm": 0.6718728542327881, + "learning_rate": 5.8800000000000005e-06, + "loss": 0.1338, + "step": 50 + }, + { + "epoch": 0.10067114093959731, + "grad_norm": 0.5689961910247803, + "learning_rate": 7.08e-06, + "loss": 0.1274, + "step": 60 + }, + { + "epoch": 0.1174496644295302, + "grad_norm": 0.4747137129306793, + "learning_rate": 8.28e-06, + "loss": 0.1026, + "step": 70 + }, + { + "epoch": 0.1342281879194631, + "grad_norm": 0.3482891023159027, + "learning_rate": 9.48e-06, + "loss": 0.0929, + "step": 80 + }, + { + "epoch": 0.15100671140939598, + "grad_norm": 0.3731693923473358, + "learning_rate": 1.068e-05, + "loss": 0.0835, + "step": 90 + }, + { + "epoch": 0.16778523489932887, + "grad_norm": 0.3104197680950165, + "learning_rate": 1.1880000000000001e-05, + "loss": 0.0756, + "step": 100 + }, + { + "epoch": 0.18456375838926176, + "grad_norm": 0.2531762421131134, + "learning_rate": 1.308e-05, + "loss": 0.0726, + "step": 110 + }, + { + "epoch": 0.20134228187919462, + "grad_norm": 0.29734447598457336, + "learning_rate": 1.428e-05, + "loss": 0.0666, + "step": 120 + }, + { + "epoch": 0.2181208053691275, + "grad_norm": 0.24068564176559448, + "learning_rate": 1.548e-05, + "loss": 0.0632, + "step": 130 + }, + { + "epoch": 0.2348993288590604, + "grad_norm": 0.3159964382648468, + "learning_rate": 1.6680000000000003e-05, + "loss": 0.0647, + "step": 140 + }, + { + "epoch": 0.2516778523489933, + "grad_norm": 0.23858052492141724, + "learning_rate": 1.7879999999999998e-05, + "loss": 0.065, + "step": 150 + }, + { + "epoch": 0.2684563758389262, + "grad_norm": 0.2374449223279953, + "learning_rate": 1.908e-05, + "loss": 0.0601, + "step": 160 + }, + { + "epoch": 0.28523489932885904, + "grad_norm": 0.20790916681289673, + "learning_rate": 2.0280000000000002e-05, + "loss": 0.0593, + "step": 170 + }, + { + "epoch": 0.30201342281879195, + "grad_norm": 0.1952684223651886, + "learning_rate": 2.148e-05, + "loss": 0.0527, + "step": 180 + }, + { + "epoch": 0.3187919463087248, + "grad_norm": 0.3542490601539612, + "learning_rate": 2.268e-05, + "loss": 0.0583, + "step": 190 + }, + { + "epoch": 0.33557046979865773, + "grad_norm": 0.28306496143341064, + "learning_rate": 2.3880000000000002e-05, + "loss": 0.057, + "step": 200 + }, + { + "epoch": 0.3523489932885906, + "grad_norm": 0.2882148325443268, + "learning_rate": 2.508e-05, + "loss": 0.0541, + "step": 210 + }, + { + "epoch": 0.3691275167785235, + "grad_norm": 0.19627629220485687, + "learning_rate": 2.628e-05, + "loss": 0.0552, + "step": 220 + }, + { + "epoch": 0.3859060402684564, + "grad_norm": 0.1990572214126587, + "learning_rate": 2.748e-05, + "loss": 0.0506, + "step": 230 + }, + { + "epoch": 0.40268456375838924, + "grad_norm": 0.24517984688282013, + "learning_rate": 2.868e-05, + "loss": 0.0528, + "step": 240 + }, + { + "epoch": 0.41946308724832215, + "grad_norm": 0.2502721846103668, + "learning_rate": 2.9880000000000002e-05, + "loss": 0.0494, + "step": 250 + }, + { + "epoch": 0.436241610738255, + "grad_norm": 0.18276523053646088, + "learning_rate": 2.9999734259635676e-05, + "loss": 0.0451, + "step": 260 + }, + { + "epoch": 0.45302013422818793, + "grad_norm": 0.2971280813217163, + "learning_rate": 2.9998815663057245e-05, + "loss": 0.0488, + "step": 270 + }, + { + "epoch": 0.4697986577181208, + "grad_norm": 0.20258396863937378, + "learning_rate": 2.999724096969228e-05, + "loss": 0.0454, + "step": 280 + }, + { + "epoch": 0.4865771812080537, + "grad_norm": 0.27414819598197937, + "learning_rate": 2.9995010248422984e-05, + "loss": 0.0436, + "step": 290 + }, + { + "epoch": 0.5033557046979866, + "grad_norm": 0.2332964837551117, + "learning_rate": 2.999212359682832e-05, + "loss": 0.0459, + "step": 300 + }, + { + "epoch": 0.5201342281879194, + "grad_norm": 0.23066847026348114, + "learning_rate": 2.9988581141179787e-05, + "loss": 0.0446, + "step": 310 + }, + { + "epoch": 0.5369127516778524, + "grad_norm": 0.21959786117076874, + "learning_rate": 2.998438303643587e-05, + "loss": 0.0401, + "step": 320 + }, + { + "epoch": 0.5536912751677853, + "grad_norm": 0.1958390325307846, + "learning_rate": 2.997952946623527e-05, + "loss": 0.0418, + "step": 330 + }, + { + "epoch": 0.5704697986577181, + "grad_norm": 0.23207500576972961, + "learning_rate": 2.9974020642888875e-05, + "loss": 0.0455, + "step": 340 + }, + { + "epoch": 0.587248322147651, + "grad_norm": 0.1922421157360077, + "learning_rate": 2.9967856807370458e-05, + "loss": 0.0413, + "step": 350 + }, + { + "epoch": 0.6040268456375839, + "grad_norm": 0.20857904851436615, + "learning_rate": 2.996103822930615e-05, + "loss": 0.0445, + "step": 360 + }, + { + "epoch": 0.6208053691275168, + "grad_norm": 0.20092910528182983, + "learning_rate": 2.9953565206962653e-05, + "loss": 0.0376, + "step": 370 + }, + { + "epoch": 0.6375838926174496, + "grad_norm": 0.17054688930511475, + "learning_rate": 2.9945438067234172e-05, + "loss": 0.039, + "step": 380 + }, + { + "epoch": 0.6543624161073825, + "grad_norm": 0.18088215589523315, + "learning_rate": 2.9936657165628124e-05, + "loss": 0.0385, + "step": 390 + }, + { + "epoch": 0.6711409395973155, + "grad_norm": 0.22038601338863373, + "learning_rate": 2.992722288624959e-05, + "loss": 0.0381, + "step": 400 + }, + { + "epoch": 0.6879194630872483, + "grad_norm": 0.16217142343521118, + "learning_rate": 2.9917135641784515e-05, + "loss": 0.0384, + "step": 410 + }, + { + "epoch": 0.7046979865771812, + "grad_norm": 0.1879982352256775, + "learning_rate": 2.9906395873481655e-05, + "loss": 0.0375, + "step": 420 + }, + { + "epoch": 0.7214765100671141, + "grad_norm": 0.1811523288488388, + "learning_rate": 2.989500405113326e-05, + "loss": 0.0391, + "step": 430 + }, + { + "epoch": 0.738255033557047, + "grad_norm": 0.15471374988555908, + "learning_rate": 2.9882960673054547e-05, + "loss": 0.0347, + "step": 440 + }, + { + "epoch": 0.7550335570469798, + "grad_norm": 0.20345190167427063, + "learning_rate": 2.9870266266061886e-05, + "loss": 0.034, + "step": 450 + }, + { + "epoch": 0.7718120805369127, + "grad_norm": 0.22297805547714233, + "learning_rate": 2.9856921385449766e-05, + "loss": 0.0364, + "step": 460 + }, + { + "epoch": 0.7885906040268457, + "grad_norm": 0.18335476517677307, + "learning_rate": 2.9842926614966502e-05, + "loss": 0.0355, + "step": 470 + }, + { + "epoch": 0.8053691275167785, + "grad_norm": 0.21670755743980408, + "learning_rate": 2.982828256678868e-05, + "loss": 0.0356, + "step": 480 + }, + { + "epoch": 0.8221476510067114, + "grad_norm": 0.22311744093894958, + "learning_rate": 2.9812989881494412e-05, + "loss": 0.0345, + "step": 490 + }, + { + "epoch": 0.8389261744966443, + "grad_norm": 0.1998075544834137, + "learning_rate": 2.9797049228035296e-05, + "loss": 0.0377, + "step": 500 + }, + { + "epoch": 0.8557046979865772, + "grad_norm": 0.19125983119010925, + "learning_rate": 2.978046130370715e-05, + "loss": 0.0334, + "step": 510 + }, + { + "epoch": 0.87248322147651, + "grad_norm": 0.2721741497516632, + "learning_rate": 2.9763226834119535e-05, + "loss": 0.0355, + "step": 520 + }, + { + "epoch": 0.889261744966443, + "grad_norm": 0.20220515131950378, + "learning_rate": 2.9745346573163963e-05, + "loss": 0.0345, + "step": 530 + }, + { + "epoch": 0.9060402684563759, + "grad_norm": 0.29605722427368164, + "learning_rate": 2.9726821302980987e-05, + "loss": 0.0338, + "step": 540 + }, + { + "epoch": 0.9228187919463087, + "grad_norm": 0.1908901482820511, + "learning_rate": 2.9707651833925935e-05, + "loss": 0.0306, + "step": 550 + }, + { + "epoch": 0.9395973154362416, + "grad_norm": 0.18491318821907043, + "learning_rate": 2.968783900453348e-05, + "loss": 0.034, + "step": 560 + }, + { + "epoch": 0.9563758389261745, + "grad_norm": 0.15446802973747253, + "learning_rate": 2.9667383681480968e-05, + "loss": 0.0365, + "step": 570 + }, + { + "epoch": 0.9731543624161074, + "grad_norm": 0.18752741813659668, + "learning_rate": 2.9646286759550493e-05, + "loss": 0.032, + "step": 580 + }, + { + "epoch": 0.9899328859060402, + "grad_norm": 0.4135258197784424, + "learning_rate": 2.9624549161589764e-05, + "loss": 0.031, + "step": 590 + }, + { + "epoch": 1.0067114093959733, + "grad_norm": 0.19306783378124237, + "learning_rate": 2.9602171838471745e-05, + "loss": 0.0314, + "step": 600 + }, + { + "epoch": 1.023489932885906, + "grad_norm": 0.1685028225183487, + "learning_rate": 2.957915576905303e-05, + "loss": 0.03, + "step": 610 + }, + { + "epoch": 1.0402684563758389, + "grad_norm": 0.15813031792640686, + "learning_rate": 2.9555501960131058e-05, + "loss": 0.0287, + "step": 620 + }, + { + "epoch": 1.0570469798657718, + "grad_norm": 0.16480985283851624, + "learning_rate": 2.9531211446400068e-05, + "loss": 0.0326, + "step": 630 + }, + { + "epoch": 1.0738255033557047, + "grad_norm": 0.16310042142868042, + "learning_rate": 2.9506285290405813e-05, + "loss": 0.0319, + "step": 640 + }, + { + "epoch": 1.0906040268456376, + "grad_norm": 0.28549784421920776, + "learning_rate": 2.948072458249911e-05, + "loss": 0.0308, + "step": 650 + }, + { + "epoch": 1.1073825503355705, + "grad_norm": 0.4056604206562042, + "learning_rate": 2.9454530440788125e-05, + "loss": 0.0298, + "step": 660 + }, + { + "epoch": 1.1241610738255035, + "grad_norm": 0.24711917340755463, + "learning_rate": 2.9427704011089474e-05, + "loss": 0.0287, + "step": 670 + }, + { + "epoch": 1.1409395973154361, + "grad_norm": 0.2376968264579773, + "learning_rate": 2.94002464668781e-05, + "loss": 0.0281, + "step": 680 + }, + { + "epoch": 1.157718120805369, + "grad_norm": 0.1800604611635208, + "learning_rate": 2.9372159009235936e-05, + "loss": 0.0269, + "step": 690 + }, + { + "epoch": 1.174496644295302, + "grad_norm": 0.15358570218086243, + "learning_rate": 2.9343442866799365e-05, + "loss": 0.0277, + "step": 700 + }, + { + "epoch": 1.191275167785235, + "grad_norm": 0.28675392270088196, + "learning_rate": 2.9314099295705495e-05, + "loss": 0.0297, + "step": 710 + }, + { + "epoch": 1.2080536912751678, + "grad_norm": 0.20398671925067902, + "learning_rate": 2.928412957953718e-05, + "loss": 0.0275, + "step": 720 + }, + { + "epoch": 1.2248322147651007, + "grad_norm": 0.2259288877248764, + "learning_rate": 2.925353502926689e-05, + "loss": 0.0296, + "step": 730 + }, + { + "epoch": 1.2416107382550337, + "grad_norm": 0.16415706276893616, + "learning_rate": 2.922231698319937e-05, + "loss": 0.0291, + "step": 740 + }, + { + "epoch": 1.2583892617449663, + "grad_norm": 0.19491496682167053, + "learning_rate": 2.9190476806913088e-05, + "loss": 0.0295, + "step": 750 + }, + { + "epoch": 1.2751677852348993, + "grad_norm": 0.18139910697937012, + "learning_rate": 2.9158015893200504e-05, + "loss": 0.0285, + "step": 760 + }, + { + "epoch": 1.2919463087248322, + "grad_norm": 0.18600593507289886, + "learning_rate": 2.9124935662007137e-05, + "loss": 0.0307, + "step": 770 + }, + { + "epoch": 1.308724832214765, + "grad_norm": 0.16569755971431732, + "learning_rate": 2.9091237560369467e-05, + "loss": 0.0289, + "step": 780 + }, + { + "epoch": 1.325503355704698, + "grad_norm": 0.1949482262134552, + "learning_rate": 2.905692306235163e-05, + "loss": 0.0283, + "step": 790 + }, + { + "epoch": 1.342281879194631, + "grad_norm": 0.2368042767047882, + "learning_rate": 2.9021993668980925e-05, + "loss": 0.0279, + "step": 800 + }, + { + "epoch": 1.3590604026845639, + "grad_norm": 0.21733024716377258, + "learning_rate": 2.8986450908182185e-05, + "loss": 0.0257, + "step": 810 + }, + { + "epoch": 1.3758389261744965, + "grad_norm": 0.16328634321689606, + "learning_rate": 2.8950296334710902e-05, + "loss": 0.0281, + "step": 820 + }, + { + "epoch": 1.3926174496644295, + "grad_norm": 0.20662836730480194, + "learning_rate": 2.8913531530085248e-05, + "loss": 0.0272, + "step": 830 + }, + { + "epoch": 1.4093959731543624, + "grad_norm": 0.17186735570430756, + "learning_rate": 2.887615810251687e-05, + "loss": 0.0286, + "step": 840 + }, + { + "epoch": 1.4261744966442953, + "grad_norm": 0.187661275267601, + "learning_rate": 2.8838177686840577e-05, + "loss": 0.0284, + "step": 850 + }, + { + "epoch": 1.4429530201342282, + "grad_norm": 0.18711018562316895, + "learning_rate": 2.8799591944442776e-05, + "loss": 0.0289, + "step": 860 + }, + { + "epoch": 1.4597315436241611, + "grad_norm": 0.2038484513759613, + "learning_rate": 2.8760402563188848e-05, + "loss": 0.0279, + "step": 870 + }, + { + "epoch": 1.476510067114094, + "grad_norm": 0.20940718054771423, + "learning_rate": 2.8720611257349285e-05, + "loss": 0.0269, + "step": 880 + }, + { + "epoch": 1.4932885906040267, + "grad_norm": 0.19567424058914185, + "learning_rate": 2.868021976752471e-05, + "loss": 0.027, + "step": 890 + }, + { + "epoch": 1.5100671140939599, + "grad_norm": 0.16011153161525726, + "learning_rate": 2.8639229860569738e-05, + "loss": 0.0293, + "step": 900 + }, + { + "epoch": 1.5268456375838926, + "grad_norm": 0.13916991651058197, + "learning_rate": 2.8597643329515688e-05, + "loss": 0.0253, + "step": 910 + }, + { + "epoch": 1.5436241610738255, + "grad_norm": 0.12822005152702332, + "learning_rate": 2.855546199349214e-05, + "loss": 0.025, + "step": 920 + }, + { + "epoch": 1.5604026845637584, + "grad_norm": 0.18722663819789886, + "learning_rate": 2.85126876976474e-05, + "loss": 0.0277, + "step": 930 + }, + { + "epoch": 1.5771812080536913, + "grad_norm": 0.1512211114168167, + "learning_rate": 2.8469322313067726e-05, + "loss": 0.0253, + "step": 940 + }, + { + "epoch": 1.5939597315436242, + "grad_norm": 0.20754490792751312, + "learning_rate": 2.8425367736695522e-05, + "loss": 0.0254, + "step": 950 + }, + { + "epoch": 1.610738255033557, + "grad_norm": 0.238246351480484, + "learning_rate": 2.838082589124636e-05, + "loss": 0.028, + "step": 960 + }, + { + "epoch": 1.62751677852349, + "grad_norm": 0.14989012479782104, + "learning_rate": 2.8335698725124843e-05, + "loss": 0.0261, + "step": 970 + }, + { + "epoch": 1.6442953020134228, + "grad_norm": 0.15159383416175842, + "learning_rate": 2.8289988212339422e-05, + "loss": 0.0232, + "step": 980 + }, + { + "epoch": 1.6610738255033557, + "grad_norm": 0.17884178459644318, + "learning_rate": 2.8243696352415997e-05, + "loss": 0.0303, + "step": 990 + }, + { + "epoch": 1.6778523489932886, + "grad_norm": 0.1455809772014618, + "learning_rate": 2.8196825170310495e-05, + "loss": 0.0239, + "step": 1000 + }, + { + "epoch": 1.6946308724832215, + "grad_norm": 0.15527848899364471, + "learning_rate": 2.8149376716320256e-05, + "loss": 0.0255, + "step": 1010 + }, + { + "epoch": 1.7114093959731544, + "grad_norm": 0.16052792966365814, + "learning_rate": 2.8101353065994373e-05, + "loss": 0.0276, + "step": 1020 + }, + { + "epoch": 1.7281879194630871, + "grad_norm": 0.12123282998800278, + "learning_rate": 2.8052756320042885e-05, + "loss": 0.025, + "step": 1030 + }, + { + "epoch": 1.7449664429530203, + "grad_norm": 0.16650134325027466, + "learning_rate": 2.8003588604244893e-05, + "loss": 0.0232, + "step": 1040 + }, + { + "epoch": 1.761744966442953, + "grad_norm": 0.14930953085422516, + "learning_rate": 2.7953852069355565e-05, + "loss": 0.0225, + "step": 1050 + }, + { + "epoch": 1.778523489932886, + "grad_norm": 0.21071627736091614, + "learning_rate": 2.790354889101206e-05, + "loss": 0.0212, + "step": 1060 + }, + { + "epoch": 1.7953020134228188, + "grad_norm": 0.1896669566631317, + "learning_rate": 2.7852681269638366e-05, + "loss": 0.0259, + "step": 1070 + }, + { + "epoch": 1.8120805369127517, + "grad_norm": 0.15259258449077606, + "learning_rate": 2.780125143034902e-05, + "loss": 0.0263, + "step": 1080 + }, + { + "epoch": 1.8288590604026846, + "grad_norm": 0.14170797169208527, + "learning_rate": 2.7749261622851812e-05, + "loss": 0.0228, + "step": 1090 + }, + { + "epoch": 1.8456375838926173, + "grad_norm": 0.14577420055866241, + "learning_rate": 2.7696714121349335e-05, + "loss": 0.0233, + "step": 1100 + }, + { + "epoch": 1.8624161073825505, + "grad_norm": 0.1250564157962799, + "learning_rate": 2.764361122443954e-05, + "loss": 0.0218, + "step": 1110 + }, + { + "epoch": 1.8791946308724832, + "grad_norm": 0.16452714800834656, + "learning_rate": 2.758995525501517e-05, + "loss": 0.023, + "step": 1120 + }, + { + "epoch": 1.895973154362416, + "grad_norm": 0.17396444082260132, + "learning_rate": 2.753574856016215e-05, + "loss": 0.0231, + "step": 1130 + }, + { + "epoch": 1.912751677852349, + "grad_norm": 0.15328766405582428, + "learning_rate": 2.7480993511056913e-05, + "loss": 0.024, + "step": 1140 + }, + { + "epoch": 1.929530201342282, + "grad_norm": 0.1501884162425995, + "learning_rate": 2.7425692502862684e-05, + "loss": 0.0211, + "step": 1150 + }, + { + "epoch": 1.9463087248322148, + "grad_norm": 0.1589355766773224, + "learning_rate": 2.7369847954624728e-05, + "loss": 0.0232, + "step": 1160 + }, + { + "epoch": 1.9630872483221475, + "grad_norm": 0.12628960609436035, + "learning_rate": 2.731346230916448e-05, + "loss": 0.0254, + "step": 1170 + }, + { + "epoch": 1.9798657718120807, + "grad_norm": 0.14850759506225586, + "learning_rate": 2.7256538032972746e-05, + "loss": 0.0231, + "step": 1180 + }, + { + "epoch": 1.9966442953020134, + "grad_norm": 0.12806259095668793, + "learning_rate": 2.7199077616101773e-05, + "loss": 0.0209, + "step": 1190 + }, + { + "epoch": 2.0134228187919465, + "grad_norm": 0.19582599401474, + "learning_rate": 2.714108357205634e-05, + "loss": 0.0238, + "step": 1200 + }, + { + "epoch": 2.030201342281879, + "grad_norm": 0.41255050897598267, + "learning_rate": 2.7082558437683803e-05, + "loss": 0.0218, + "step": 1210 + }, + { + "epoch": 2.046979865771812, + "grad_norm": 0.15883375704288483, + "learning_rate": 2.702350477306315e-05, + "loss": 0.0217, + "step": 1220 + }, + { + "epoch": 2.063758389261745, + "grad_norm": 0.21646834909915924, + "learning_rate": 2.6963925161392963e-05, + "loss": 0.0229, + "step": 1230 + }, + { + "epoch": 2.0805369127516777, + "grad_norm": 0.14378032088279724, + "learning_rate": 2.6903822208878476e-05, + "loss": 0.0225, + "step": 1240 + }, + { + "epoch": 2.097315436241611, + "grad_norm": 0.15373851358890533, + "learning_rate": 2.6843198544617535e-05, + "loss": 0.0241, + "step": 1250 + }, + { + "epoch": 2.1140939597315436, + "grad_norm": 0.1561702936887741, + "learning_rate": 2.6782056820485612e-05, + "loss": 0.0228, + "step": 1260 + }, + { + "epoch": 2.1308724832214767, + "grad_norm": 0.15469935536384583, + "learning_rate": 2.672039971101979e-05, + "loss": 0.021, + "step": 1270 + }, + { + "epoch": 2.1476510067114094, + "grad_norm": 0.11616158485412598, + "learning_rate": 2.665822991330178e-05, + "loss": 0.0244, + "step": 1280 + }, + { + "epoch": 2.164429530201342, + "grad_norm": 0.18575182557106018, + "learning_rate": 2.6595550146839934e-05, + "loss": 0.0233, + "step": 1290 + }, + { + "epoch": 2.1812080536912752, + "grad_norm": 0.1657201200723648, + "learning_rate": 2.6532363153450287e-05, + "loss": 0.0219, + "step": 1300 + }, + { + "epoch": 2.197986577181208, + "grad_norm": 0.17577281594276428, + "learning_rate": 2.6468671697136634e-05, + "loss": 0.0206, + "step": 1310 + }, + { + "epoch": 2.214765100671141, + "grad_norm": 0.16942515969276428, + "learning_rate": 2.640447856396961e-05, + "loss": 0.0202, + "step": 1320 + }, + { + "epoch": 2.2315436241610738, + "grad_norm": 0.12942443788051605, + "learning_rate": 2.6339786561964805e-05, + "loss": 0.0235, + "step": 1330 + }, + { + "epoch": 2.248322147651007, + "grad_norm": 0.10895993560552597, + "learning_rate": 2.6274598520959966e-05, + "loss": 0.0217, + "step": 1340 + }, + { + "epoch": 2.2651006711409396, + "grad_norm": 0.16702544689178467, + "learning_rate": 2.6208917292491185e-05, + "loss": 0.0229, + "step": 1350 + }, + { + "epoch": 2.2818791946308723, + "grad_norm": 0.14049775898456573, + "learning_rate": 2.6142745749668176e-05, + "loss": 0.0213, + "step": 1360 + }, + { + "epoch": 2.2986577181208054, + "grad_norm": 0.17712368071079254, + "learning_rate": 2.607608678704859e-05, + "loss": 0.0222, + "step": 1370 + }, + { + "epoch": 2.315436241610738, + "grad_norm": 0.17040906846523285, + "learning_rate": 2.600894332051139e-05, + "loss": 0.0191, + "step": 1380 + }, + { + "epoch": 2.3322147651006713, + "grad_norm": 0.1793813854455948, + "learning_rate": 2.594131828712932e-05, + "loss": 0.0226, + "step": 1390 + }, + { + "epoch": 2.348993288590604, + "grad_norm": 0.17199549078941345, + "learning_rate": 2.5873214645040414e-05, + "loss": 0.0205, + "step": 1400 + }, + { + "epoch": 2.365771812080537, + "grad_norm": 0.2560262680053711, + "learning_rate": 2.5804635373318604e-05, + "loss": 0.0194, + "step": 1410 + }, + { + "epoch": 2.38255033557047, + "grad_norm": 0.15049883723258972, + "learning_rate": 2.57355834718434e-05, + "loss": 0.0225, + "step": 1420 + }, + { + "epoch": 2.3993288590604025, + "grad_norm": 0.10687083005905151, + "learning_rate": 2.566606196116867e-05, + "loss": 0.0201, + "step": 1430 + }, + { + "epoch": 2.4161073825503356, + "grad_norm": 0.21092043817043304, + "learning_rate": 2.559607388239051e-05, + "loss": 0.0203, + "step": 1440 + }, + { + "epoch": 2.4328859060402683, + "grad_norm": 0.1304531693458557, + "learning_rate": 2.552562229701422e-05, + "loss": 0.0207, + "step": 1450 + }, + { + "epoch": 2.4496644295302015, + "grad_norm": 0.17584650218486786, + "learning_rate": 2.545471028682036e-05, + "loss": 0.0225, + "step": 1460 + }, + { + "epoch": 2.466442953020134, + "grad_norm": 0.28326791524887085, + "learning_rate": 2.538334095373e-05, + "loss": 0.0199, + "step": 1470 + }, + { + "epoch": 2.4832214765100673, + "grad_norm": 0.2687714695930481, + "learning_rate": 2.531151741966896e-05, + "loss": 0.021, + "step": 1480 + }, + { + "epoch": 2.5, + "grad_norm": 0.12673330307006836, + "learning_rate": 2.5239242826431302e-05, + "loss": 0.0212, + "step": 1490 + }, + { + "epoch": 2.5167785234899327, + "grad_norm": 0.14194728434085846, + "learning_rate": 2.5166520335541865e-05, + "loss": 0.0202, + "step": 1500 + }, + { + "epoch": 2.533557046979866, + "grad_norm": 0.2310604751110077, + "learning_rate": 2.5093353128117996e-05, + "loss": 0.0213, + "step": 1510 + }, + { + "epoch": 2.5503355704697985, + "grad_norm": 0.13804496824741364, + "learning_rate": 2.501974440473037e-05, + "loss": 0.0193, + "step": 1520 + }, + { + "epoch": 2.5671140939597317, + "grad_norm": 0.14828719198703766, + "learning_rate": 2.4945697385263015e-05, + "loss": 0.0222, + "step": 1530 + }, + { + "epoch": 2.5838926174496644, + "grad_norm": 0.1583152413368225, + "learning_rate": 2.487121530877243e-05, + "loss": 0.0218, + "step": 1540 + }, + { + "epoch": 2.600671140939597, + "grad_norm": 0.1458803117275238, + "learning_rate": 2.4796301433345943e-05, + "loss": 0.0226, + "step": 1550 + }, + { + "epoch": 2.61744966442953, + "grad_norm": 0.15886026620864868, + "learning_rate": 2.4720959035959148e-05, + "loss": 0.0226, + "step": 1560 + }, + { + "epoch": 2.6342281879194633, + "grad_norm": 0.15409216284751892, + "learning_rate": 2.464519141233257e-05, + "loss": 0.0206, + "step": 1570 + }, + { + "epoch": 2.651006711409396, + "grad_norm": 0.13891032338142395, + "learning_rate": 2.456900187678754e-05, + "loss": 0.0183, + "step": 1580 + }, + { + "epoch": 2.6677852348993287, + "grad_norm": 0.13419780135154724, + "learning_rate": 2.4492393762101147e-05, + "loss": 0.0221, + "step": 1590 + }, + { + "epoch": 2.684563758389262, + "grad_norm": 0.124265655875206, + "learning_rate": 2.4415370419360508e-05, + "loss": 0.0216, + "step": 1600 + }, + { + "epoch": 2.7013422818791946, + "grad_norm": 0.1302771270275116, + "learning_rate": 2.4337935217816157e-05, + "loss": 0.0201, + "step": 1610 + }, + { + "epoch": 2.7181208053691277, + "grad_norm": 0.16515520215034485, + "learning_rate": 2.4260091544734665e-05, + "loss": 0.019, + "step": 1620 + }, + { + "epoch": 2.7348993288590604, + "grad_norm": 0.13658763468265533, + "learning_rate": 2.4181842805250466e-05, + "loss": 0.0205, + "step": 1630 + }, + { + "epoch": 2.751677852348993, + "grad_norm": 0.11953597515821457, + "learning_rate": 2.4103192422216923e-05, + "loss": 0.0199, + "step": 1640 + }, + { + "epoch": 2.7684563758389262, + "grad_norm": 0.16735540330410004, + "learning_rate": 2.402414383605658e-05, + "loss": 0.0192, + "step": 1650 + }, + { + "epoch": 2.785234899328859, + "grad_norm": 0.14770597219467163, + "learning_rate": 2.3944700504610674e-05, + "loss": 0.0197, + "step": 1660 + }, + { + "epoch": 2.802013422818792, + "grad_norm": 0.14873377978801727, + "learning_rate": 2.3864865902987883e-05, + "loss": 0.0186, + "step": 1670 + }, + { + "epoch": 2.8187919463087248, + "grad_norm": 0.22620314359664917, + "learning_rate": 2.378464352341231e-05, + "loss": 0.0214, + "step": 1680 + }, + { + "epoch": 2.8355704697986575, + "grad_norm": 0.20077335834503174, + "learning_rate": 2.3704036875070728e-05, + "loss": 0.0233, + "step": 1690 + }, + { + "epoch": 2.8523489932885906, + "grad_norm": 0.18293912708759308, + "learning_rate": 2.362304948395906e-05, + "loss": 0.0244, + "step": 1700 + }, + { + "epoch": 2.8691275167785237, + "grad_norm": 0.17799849808216095, + "learning_rate": 2.3541684892728157e-05, + "loss": 0.0195, + "step": 1710 + }, + { + "epoch": 2.8859060402684564, + "grad_norm": 0.15650226175785065, + "learning_rate": 2.345994666052883e-05, + "loss": 0.0183, + "step": 1720 + }, + { + "epoch": 2.902684563758389, + "grad_norm": 0.14934243261814117, + "learning_rate": 2.337783836285614e-05, + "loss": 0.0212, + "step": 1730 + }, + { + "epoch": 2.9194630872483223, + "grad_norm": 0.19469675421714783, + "learning_rate": 2.3295363591393026e-05, + "loss": 0.0191, + "step": 1740 + }, + { + "epoch": 2.936241610738255, + "grad_norm": 0.20920106768608093, + "learning_rate": 2.3212525953853174e-05, + "loss": 0.0202, + "step": 1750 + }, + { + "epoch": 2.953020134228188, + "grad_norm": 0.1367284506559372, + "learning_rate": 2.3129329073823206e-05, + "loss": 0.0204, + "step": 1760 + }, + { + "epoch": 2.969798657718121, + "grad_norm": 0.15733259916305542, + "learning_rate": 2.3045776590604175e-05, + "loss": 0.0192, + "step": 1770 + }, + { + "epoch": 2.9865771812080535, + "grad_norm": 0.1706557273864746, + "learning_rate": 2.296187215905237e-05, + "loss": 0.0206, + "step": 1780 + }, + { + "epoch": 3.0033557046979866, + "grad_norm": 0.20850840210914612, + "learning_rate": 2.2877619449419437e-05, + "loss": 0.022, + "step": 1790 + }, + { + "epoch": 3.0201342281879193, + "grad_norm": 0.21721336245536804, + "learning_rate": 2.2793022147191843e-05, + "loss": 0.0201, + "step": 1800 + }, + { + "epoch": 3.0369127516778525, + "grad_norm": 0.16258729994297028, + "learning_rate": 2.2708083952929634e-05, + "loss": 0.0185, + "step": 1810 + }, + { + "epoch": 3.053691275167785, + "grad_norm": 0.18179331719875336, + "learning_rate": 2.2622808582104594e-05, + "loss": 0.0215, + "step": 1820 + }, + { + "epoch": 3.0704697986577183, + "grad_norm": 0.11735052615404129, + "learning_rate": 2.2537199764937703e-05, + "loss": 0.019, + "step": 1830 + }, + { + "epoch": 3.087248322147651, + "grad_norm": 0.15188120305538177, + "learning_rate": 2.245126124623595e-05, + "loss": 0.0196, + "step": 1840 + }, + { + "epoch": 3.1040268456375837, + "grad_norm": 0.14142458140850067, + "learning_rate": 2.2364996785228547e-05, + "loss": 0.0188, + "step": 1850 + }, + { + "epoch": 3.120805369127517, + "grad_norm": 0.15011872351169586, + "learning_rate": 2.227841015540248e-05, + "loss": 0.0211, + "step": 1860 + }, + { + "epoch": 3.1375838926174495, + "grad_norm": 0.13913294672966003, + "learning_rate": 2.2191505144337433e-05, + "loss": 0.0203, + "step": 1870 + }, + { + "epoch": 3.1543624161073827, + "grad_norm": 0.1547662764787674, + "learning_rate": 2.210428555354013e-05, + "loss": 0.0198, + "step": 1880 + }, + { + "epoch": 3.1711409395973154, + "grad_norm": 0.16952672600746155, + "learning_rate": 2.201675519827802e-05, + "loss": 0.0207, + "step": 1890 + }, + { + "epoch": 3.1879194630872485, + "grad_norm": 0.16245362162590027, + "learning_rate": 2.1928917907412403e-05, + "loss": 0.0191, + "step": 1900 + }, + { + "epoch": 3.204697986577181, + "grad_norm": 0.20379698276519775, + "learning_rate": 2.1840777523230937e-05, + "loss": 0.0201, + "step": 1910 + }, + { + "epoch": 3.221476510067114, + "grad_norm": 0.12898804247379303, + "learning_rate": 2.1752337901279552e-05, + "loss": 0.0189, + "step": 1920 + }, + { + "epoch": 3.238255033557047, + "grad_norm": 0.22864995896816254, + "learning_rate": 2.166360291019383e-05, + "loss": 0.0189, + "step": 1930 + }, + { + "epoch": 3.2550335570469797, + "grad_norm": 0.10070180147886276, + "learning_rate": 2.157457643152973e-05, + "loss": 0.0191, + "step": 1940 + }, + { + "epoch": 3.271812080536913, + "grad_norm": 0.12235262989997864, + "learning_rate": 2.148526235959385e-05, + "loss": 0.0189, + "step": 1950 + }, + { + "epoch": 3.2885906040268456, + "grad_norm": 0.17240414023399353, + "learning_rate": 2.1395664601273016e-05, + "loss": 0.0185, + "step": 1960 + }, + { + "epoch": 3.3053691275167787, + "grad_norm": 0.1916498988866806, + "learning_rate": 2.130578707586345e-05, + "loss": 0.0204, + "step": 1970 + }, + { + "epoch": 3.3221476510067114, + "grad_norm": 0.13949474692344666, + "learning_rate": 2.1215633714899264e-05, + "loss": 0.0194, + "step": 1980 + }, + { + "epoch": 3.3389261744966445, + "grad_norm": 0.148747980594635, + "learning_rate": 2.112520846198053e-05, + "loss": 0.0187, + "step": 1990 + }, + { + "epoch": 3.3557046979865772, + "grad_norm": 0.14247365295886993, + "learning_rate": 2.103451527260074e-05, + "loss": 0.0179, + "step": 2000 + }, + { + "epoch": 3.37248322147651, + "grad_norm": 0.1270933598279953, + "learning_rate": 2.094355811397381e-05, + "loss": 0.0193, + "step": 2010 + }, + { + "epoch": 3.389261744966443, + "grad_norm": 0.16048407554626465, + "learning_rate": 2.0852340964860522e-05, + "loss": 0.0228, + "step": 2020 + }, + { + "epoch": 3.4060402684563758, + "grad_norm": 0.19520506262779236, + "learning_rate": 2.076086781539447e-05, + "loss": 0.0183, + "step": 2030 + }, + { + "epoch": 3.422818791946309, + "grad_norm": 0.1389211118221283, + "learning_rate": 2.066914266690755e-05, + "loss": 0.0187, + "step": 2040 + }, + { + "epoch": 3.4395973154362416, + "grad_norm": 0.15584081411361694, + "learning_rate": 2.0577169531754906e-05, + "loss": 0.0187, + "step": 2050 + }, + { + "epoch": 3.4563758389261743, + "grad_norm": 0.1802147477865219, + "learning_rate": 2.048495243313942e-05, + "loss": 0.0197, + "step": 2060 + }, + { + "epoch": 3.4731543624161074, + "grad_norm": 0.12090757489204407, + "learning_rate": 2.039249540493572e-05, + "loss": 0.0194, + "step": 2070 + }, + { + "epoch": 3.48993288590604, + "grad_norm": 0.18710780143737793, + "learning_rate": 2.0299802491513755e-05, + "loss": 0.0175, + "step": 2080 + }, + { + "epoch": 3.5067114093959733, + "grad_norm": 0.10997475683689117, + "learning_rate": 2.0206877747561828e-05, + "loss": 0.0195, + "step": 2090 + }, + { + "epoch": 3.523489932885906, + "grad_norm": 0.13992996513843536, + "learning_rate": 2.011372523790927e-05, + "loss": 0.0202, + "step": 2100 + }, + { + "epoch": 3.540268456375839, + "grad_norm": 0.11927074193954468, + "learning_rate": 2.0020349037348643e-05, + "loss": 0.0178, + "step": 2110 + }, + { + "epoch": 3.557046979865772, + "grad_norm": 0.18657186627388, + "learning_rate": 1.9926753230457443e-05, + "loss": 0.0182, + "step": 2120 + }, + { + "epoch": 3.573825503355705, + "grad_norm": 0.12504293024539948, + "learning_rate": 1.983294191141948e-05, + "loss": 0.0198, + "step": 2130 + }, + { + "epoch": 3.5906040268456376, + "grad_norm": 0.1450442671775818, + "learning_rate": 1.973891918384575e-05, + "loss": 0.0172, + "step": 2140 + }, + { + "epoch": 3.6073825503355703, + "grad_norm": 0.14081084728240967, + "learning_rate": 1.9644689160594945e-05, + "loss": 0.018, + "step": 2150 + }, + { + "epoch": 3.6241610738255035, + "grad_norm": 0.09649883955717087, + "learning_rate": 1.9550255963593553e-05, + "loss": 0.0156, + "step": 2160 + }, + { + "epoch": 3.640939597315436, + "grad_norm": 0.1074327751994133, + "learning_rate": 1.9455623723655524e-05, + "loss": 0.0157, + "step": 2170 + }, + { + "epoch": 3.6577181208053693, + "grad_norm": 0.1782575249671936, + "learning_rate": 1.9360796580301606e-05, + "loss": 0.0168, + "step": 2180 + }, + { + "epoch": 3.674496644295302, + "grad_norm": 0.16483958065509796, + "learning_rate": 1.9265778681578245e-05, + "loss": 0.0172, + "step": 2190 + }, + { + "epoch": 3.6912751677852347, + "grad_norm": 0.14613379538059235, + "learning_rate": 1.9170574183876143e-05, + "loss": 0.0204, + "step": 2200 + }, + { + "epoch": 3.708053691275168, + "grad_norm": 0.2648290693759918, + "learning_rate": 1.9075187251748452e-05, + "loss": 0.0202, + "step": 2210 + }, + { + "epoch": 3.7248322147651005, + "grad_norm": 0.15106196701526642, + "learning_rate": 1.8979622057728596e-05, + "loss": 0.0187, + "step": 2220 + }, + { + "epoch": 3.7416107382550337, + "grad_norm": 0.11246120184659958, + "learning_rate": 1.8883882782147748e-05, + "loss": 0.0169, + "step": 2230 + }, + { + "epoch": 3.7583892617449663, + "grad_norm": 0.1419929713010788, + "learning_rate": 1.8787973612951967e-05, + "loss": 0.0172, + "step": 2240 + }, + { + "epoch": 3.7751677852348995, + "grad_norm": 0.12565530836582184, + "learning_rate": 1.8691898745519028e-05, + "loss": 0.0192, + "step": 2250 + }, + { + "epoch": 3.791946308724832, + "grad_norm": 0.13186733424663544, + "learning_rate": 1.8595662382474863e-05, + "loss": 0.0206, + "step": 2260 + }, + { + "epoch": 3.8087248322147653, + "grad_norm": 0.16787581145763397, + "learning_rate": 1.8499268733509766e-05, + "loss": 0.0181, + "step": 2270 + }, + { + "epoch": 3.825503355704698, + "grad_norm": 0.1428891271352768, + "learning_rate": 1.84027220151942e-05, + "loss": 0.016, + "step": 2280 + }, + { + "epoch": 3.8422818791946307, + "grad_norm": 0.16047702729701996, + "learning_rate": 1.83060264507944e-05, + "loss": 0.0169, + "step": 2290 + }, + { + "epoch": 3.859060402684564, + "grad_norm": 0.13212737441062927, + "learning_rate": 1.82091862700876e-05, + "loss": 0.0168, + "step": 2300 + }, + { + "epoch": 3.8758389261744965, + "grad_norm": 0.10623549669981003, + "learning_rate": 1.8112205709177023e-05, + "loss": 0.0185, + "step": 2310 + }, + { + "epoch": 3.8926174496644297, + "grad_norm": 0.19981749355793, + "learning_rate": 1.8015089010306585e-05, + "loss": 0.0155, + "step": 2320 + }, + { + "epoch": 3.9093959731543624, + "grad_norm": 0.18881696462631226, + "learning_rate": 1.7917840421675298e-05, + "loss": 0.0209, + "step": 2330 + }, + { + "epoch": 3.926174496644295, + "grad_norm": 0.10692999511957169, + "learning_rate": 1.7820464197251474e-05, + "loss": 0.0161, + "step": 2340 + }, + { + "epoch": 3.942953020134228, + "grad_norm": 0.21753492951393127, + "learning_rate": 1.7722964596586627e-05, + "loss": 0.0189, + "step": 2350 + }, + { + "epoch": 3.959731543624161, + "grad_norm": 0.18070799112319946, + "learning_rate": 1.7625345884629144e-05, + "loss": 0.0184, + "step": 2360 + }, + { + "epoch": 3.976510067114094, + "grad_norm": 0.15308111906051636, + "learning_rate": 1.7527612331537722e-05, + "loss": 0.0156, + "step": 2370 + }, + { + "epoch": 3.9932885906040267, + "grad_norm": 0.14668720960617065, + "learning_rate": 1.7429768212494593e-05, + "loss": 0.0178, + "step": 2380 + }, + { + "epoch": 4.010067114093959, + "grad_norm": 0.3539591431617737, + "learning_rate": 1.7331817807518497e-05, + "loss": 0.0185, + "step": 2390 + }, + { + "epoch": 4.026845637583893, + "grad_norm": 0.1322038173675537, + "learning_rate": 1.723376540127745e-05, + "loss": 0.0171, + "step": 2400 + }, + { + "epoch": 4.043624161073826, + "grad_norm": 0.11787392944097519, + "learning_rate": 1.7135615282901357e-05, + "loss": 0.0163, + "step": 2410 + }, + { + "epoch": 4.060402684563758, + "grad_norm": 0.1422634720802307, + "learning_rate": 1.7037371745794358e-05, + "loss": 0.0206, + "step": 2420 + }, + { + "epoch": 4.077181208053691, + "grad_norm": 0.1516404151916504, + "learning_rate": 1.6939039087447026e-05, + "loss": 0.0166, + "step": 2430 + }, + { + "epoch": 4.093959731543624, + "grad_norm": 0.14106018841266632, + "learning_rate": 1.6840621609248397e-05, + "loss": 0.0197, + "step": 2440 + }, + { + "epoch": 4.110738255033557, + "grad_norm": 0.12483642995357513, + "learning_rate": 1.6742123616297794e-05, + "loss": 0.0175, + "step": 2450 + }, + { + "epoch": 4.12751677852349, + "grad_norm": 0.16260197758674622, + "learning_rate": 1.664354941721651e-05, + "loss": 0.0166, + "step": 2460 + }, + { + "epoch": 4.144295302013423, + "grad_norm": 0.1442679613828659, + "learning_rate": 1.6544903323959355e-05, + "loss": 0.016, + "step": 2470 + }, + { + "epoch": 4.1610738255033555, + "grad_norm": 0.11389831453561783, + "learning_rate": 1.6446189651626023e-05, + "loss": 0.0183, + "step": 2480 + }, + { + "epoch": 4.177852348993288, + "grad_norm": 0.14809614419937134, + "learning_rate": 1.6347412718272316e-05, + "loss": 0.0205, + "step": 2490 + }, + { + "epoch": 4.194630872483222, + "grad_norm": 0.17286059260368347, + "learning_rate": 1.624857684472131e-05, + "loss": 0.0168, + "step": 2500 + }, + { + "epoch": 4.2114093959731544, + "grad_norm": 0.14666445553302765, + "learning_rate": 1.6149686354374283e-05, + "loss": 0.0177, + "step": 2510 + }, + { + "epoch": 4.228187919463087, + "grad_norm": 0.15864591300487518, + "learning_rate": 1.605074557302165e-05, + "loss": 0.0175, + "step": 2520 + }, + { + "epoch": 4.24496644295302, + "grad_norm": 0.177460715174675, + "learning_rate": 1.59517588286537e-05, + "loss": 0.0175, + "step": 2530 + }, + { + "epoch": 4.261744966442953, + "grad_norm": 0.14390940964221954, + "learning_rate": 1.5852730451271324e-05, + "loss": 0.0156, + "step": 2540 + }, + { + "epoch": 4.278523489932886, + "grad_norm": 0.15486080944538116, + "learning_rate": 1.5753664772696546e-05, + "loss": 0.0182, + "step": 2550 + }, + { + "epoch": 4.295302013422819, + "grad_norm": 0.15260493755340576, + "learning_rate": 1.565456612638307e-05, + "loss": 0.0182, + "step": 2560 + }, + { + "epoch": 4.3120805369127515, + "grad_norm": 0.12060414999723434, + "learning_rate": 1.5555438847226732e-05, + "loss": 0.0167, + "step": 2570 + }, + { + "epoch": 4.328859060402684, + "grad_norm": 0.1500580757856369, + "learning_rate": 1.545628727137584e-05, + "loss": 0.0164, + "step": 2580 + }, + { + "epoch": 4.345637583892618, + "grad_norm": 0.15014661848545074, + "learning_rate": 1.535711573604153e-05, + "loss": 0.0161, + "step": 2590 + }, + { + "epoch": 4.3624161073825505, + "grad_norm": 0.16664306819438934, + "learning_rate": 1.5257928579308032e-05, + "loss": 0.0189, + "step": 2600 + }, + { + "epoch": 4.379194630872483, + "grad_norm": 0.155680850148201, + "learning_rate": 1.5158730139942902e-05, + "loss": 0.019, + "step": 2610 + }, + { + "epoch": 4.395973154362416, + "grad_norm": 0.16779354214668274, + "learning_rate": 1.5059524757207239e-05, + "loss": 0.0179, + "step": 2620 + }, + { + "epoch": 4.412751677852349, + "grad_norm": 0.1292392611503601, + "learning_rate": 1.4960316770665866e-05, + "loss": 0.0157, + "step": 2630 + }, + { + "epoch": 4.429530201342282, + "grad_norm": 0.1438266485929489, + "learning_rate": 1.4861110519997495e-05, + "loss": 0.0177, + "step": 2640 + }, + { + "epoch": 4.446308724832215, + "grad_norm": 0.15133166313171387, + "learning_rate": 1.4761910344804913e-05, + "loss": 0.0162, + "step": 2650 + }, + { + "epoch": 4.4630872483221475, + "grad_norm": 0.1657615602016449, + "learning_rate": 1.466272058442516e-05, + "loss": 0.0165, + "step": 2660 + }, + { + "epoch": 4.47986577181208, + "grad_norm": 0.1509656012058258, + "learning_rate": 1.4563545577739676e-05, + "loss": 0.0177, + "step": 2670 + }, + { + "epoch": 4.496644295302014, + "grad_norm": 0.1461293250322342, + "learning_rate": 1.4464389662984543e-05, + "loss": 0.0164, + "step": 2680 + }, + { + "epoch": 4.5134228187919465, + "grad_norm": 0.18428373336791992, + "learning_rate": 1.4365257177560684e-05, + "loss": 0.017, + "step": 2690 + }, + { + "epoch": 4.530201342281879, + "grad_norm": 0.13298265635967255, + "learning_rate": 1.426615245784416e-05, + "loss": 0.0158, + "step": 2700 + }, + { + "epoch": 4.546979865771812, + "grad_norm": 0.10208632797002792, + "learning_rate": 1.4167079838996468e-05, + "loss": 0.016, + "step": 2710 + }, + { + "epoch": 4.563758389261745, + "grad_norm": 0.16623789072036743, + "learning_rate": 1.4068043654774897e-05, + "loss": 0.0156, + "step": 2720 + }, + { + "epoch": 4.580536912751678, + "grad_norm": 0.14804600179195404, + "learning_rate": 1.3969048237342992e-05, + "loss": 0.0177, + "step": 2730 + }, + { + "epoch": 4.597315436241611, + "grad_norm": 0.16890902817249298, + "learning_rate": 1.3870097917081011e-05, + "loss": 0.0147, + "step": 2740 + }, + { + "epoch": 4.614093959731544, + "grad_norm": 0.21568931639194489, + "learning_rate": 1.3771197022396508e-05, + "loss": 0.0155, + "step": 2750 + }, + { + "epoch": 4.630872483221476, + "grad_norm": 0.14996445178985596, + "learning_rate": 1.3672349879535015e-05, + "loss": 0.0147, + "step": 2760 + }, + { + "epoch": 4.64765100671141, + "grad_norm": 0.10208549350500107, + "learning_rate": 1.3573560812390781e-05, + "loss": 0.0166, + "step": 2770 + }, + { + "epoch": 4.6644295302013425, + "grad_norm": 0.11123307049274445, + "learning_rate": 1.3474834142317635e-05, + "loss": 0.0151, + "step": 2780 + }, + { + "epoch": 4.681208053691275, + "grad_norm": 0.11926154792308807, + "learning_rate": 1.3376174187939955e-05, + "loss": 0.0157, + "step": 2790 + }, + { + "epoch": 4.697986577181208, + "grad_norm": 0.12520945072174072, + "learning_rate": 1.3277585264963761e-05, + "loss": 0.0164, + "step": 2800 + }, + { + "epoch": 4.714765100671141, + "grad_norm": 0.15269853174686432, + "learning_rate": 1.3179071685987928e-05, + "loss": 0.0187, + "step": 2810 + }, + { + "epoch": 4.731543624161074, + "grad_norm": 0.11586833000183105, + "learning_rate": 1.308063776031554e-05, + "loss": 0.0153, + "step": 2820 + }, + { + "epoch": 4.748322147651007, + "grad_norm": 0.23391515016555786, + "learning_rate": 1.2982287793765389e-05, + "loss": 0.0158, + "step": 2830 + }, + { + "epoch": 4.76510067114094, + "grad_norm": 0.13222748041152954, + "learning_rate": 1.2884026088483616e-05, + "loss": 0.0145, + "step": 2840 + }, + { + "epoch": 4.781879194630872, + "grad_norm": 0.1492713987827301, + "learning_rate": 1.2785856942755543e-05, + "loss": 0.0168, + "step": 2850 + }, + { + "epoch": 4.798657718120805, + "grad_norm": 0.13140155375003815, + "learning_rate": 1.2687784650817616e-05, + "loss": 0.0172, + "step": 2860 + }, + { + "epoch": 4.815436241610739, + "grad_norm": 0.11021384596824646, + "learning_rate": 1.2589813502669603e-05, + "loss": 0.0172, + "step": 2870 + }, + { + "epoch": 4.832214765100671, + "grad_norm": 0.15835842490196228, + "learning_rate": 1.2491947783886907e-05, + "loss": 0.016, + "step": 2880 + }, + { + "epoch": 4.848993288590604, + "grad_norm": 0.13786916434764862, + "learning_rate": 1.2394191775433106e-05, + "loss": 0.0158, + "step": 2890 + }, + { + "epoch": 4.865771812080537, + "grad_norm": 0.1657201498746872, + "learning_rate": 1.2296549753472696e-05, + "loss": 0.0157, + "step": 2900 + }, + { + "epoch": 4.882550335570469, + "grad_norm": 0.18127189576625824, + "learning_rate": 1.2199025989184032e-05, + "loss": 0.0143, + "step": 2910 + }, + { + "epoch": 4.899328859060403, + "grad_norm": 0.14471322298049927, + "learning_rate": 1.21016247485725e-05, + "loss": 0.0171, + "step": 2920 + }, + { + "epoch": 4.916107382550336, + "grad_norm": 0.15776599943637848, + "learning_rate": 1.2004350292283897e-05, + "loss": 0.0175, + "step": 2930 + }, + { + "epoch": 4.932885906040268, + "grad_norm": 0.12908852100372314, + "learning_rate": 1.1907206875418068e-05, + "loss": 0.0171, + "step": 2940 + }, + { + "epoch": 4.949664429530201, + "grad_norm": 0.19710037112236023, + "learning_rate": 1.1810198747342769e-05, + "loss": 0.0162, + "step": 2950 + }, + { + "epoch": 4.966442953020135, + "grad_norm": 0.1662857085466385, + "learning_rate": 1.1713330151507786e-05, + "loss": 0.016, + "step": 2960 + }, + { + "epoch": 4.983221476510067, + "grad_norm": 0.1350361704826355, + "learning_rate": 1.161660532525931e-05, + "loss": 0.0156, + "step": 2970 + }, + { + "epoch": 5.0, + "grad_norm": 0.15521599352359772, + "learning_rate": 1.1520028499654584e-05, + "loss": 0.0134, + "step": 2980 + }, + { + "epoch": 5.016778523489933, + "grad_norm": 0.14748677611351013, + "learning_rate": 1.1423603899276833e-05, + "loss": 0.0143, + "step": 2990 + }, + { + "epoch": 5.033557046979865, + "grad_norm": 0.11525747179985046, + "learning_rate": 1.1327335742050442e-05, + "loss": 0.0158, + "step": 3000 + } + ], + "logging_steps": 10, + "max_steps": 5000, + "num_input_tokens_seen": 0, + "num_train_epochs": 9, + "save_steps": 5001, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 64, + "trial_name": null, + "trial_params": null +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/experiment_cfg/metadata.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/experiment_cfg/metadata.json new file mode 100644 index 0000000000000000000000000000000000000000..6f73f8489294c58acc82d1351a17e5e3ff316e18 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed0/default/train_5shot_seed0_fullactionhead_5k/experiment_cfg/metadata.json @@ -0,0 +1,431 @@ +{ + "new_embodiment": { + "statistics": { + "state": { + "base_position": { + "max": [ + 7.778976917266846, + 0.33403685688972473, + 0.7223060727119446 + ], + "min": [ + -4.821934223175049, + -6.785110950469971, + 0.6994727253913879 + ], + "mean": [ + 2.5886094736594543, + -2.1559664577316586, + 0.7003580854548973 + ], + "std": [ + 1.6717149343420803, + 1.3743695399555862, + 0.000940069542359506 + ], + "q01": [ + -0.7517815060249613, + -5.497849509089705, + 0.6999776914424374 + ], + "q99": [ + 6.060945690807028, + -0.5331499932493624, + 0.7028864260472257 + ] + }, + "base_rotation": { + "max": [ + 0.0, + 0.0, + 1.0, + 1.0 + ], + "min": [ + 0.0, + 0.0, + -1.0, + 0.0 + ], + "mean": [ + 0.0, + 0.0, + 0.24488939171811902, + 0.5968549204077488 + ], + "std": [ + 0.0, + 0.0, + 0.6659970734507764, + 0.37443298392262264 + ], + "q01": [ + 0.0, + 0.0, + -0.9999999999999999, + 4.149924358336069e-06 + ], + "q99": [ + 0.0, + 0.0, + 0.9999999999999999, + 0.9999999999999999 + ] + }, + "end_effector_position_relative": { + "max": [ + 0.8848381638526917, + 0.8569459915161133, + 1.053884744644165 + ], + "min": [ + -0.5828549861907959, + -0.8486236333847046, + -0.3446122705936432 + ], + "mean": [ + 0.25087486209693133, + -0.005738920462036393, + 0.43643948866361787 + ], + "std": [ + 0.15741544532518012, + 0.2547603106793105, + 0.2050434492495558 + ], + "q01": [ + -0.013990057288082561, + -0.4824599092623036, + 0.18825220353500022 + ], + "q99": [ + 0.5411989642841469, + 0.4754923657245658, + 0.6912323747882034 + ] + }, + "end_effector_rotation_relative": { + "max": [ + 0.9999949932098389, + 0.9997354745864868, + 0.9900747537612915, + 0.9735639095306396 + ], + "min": [ + -0.9999914169311523, + -0.9999884366989136, + -0.9975369572639465, + 6.754255821306288e-08 + ], + "mean": [ + -0.22290331318740714, + 0.04579037037503981, + -0.05804094906527823, + 0.12347219024917105 + ], + "std": [ + 0.8519267931761344, + 0.2949394732270141, + 0.30026078832556913, + 0.16333086331829588 + ], + "q01": [ + -0.9957959450418518, + -0.5678869493126506, + -0.5318135475761875, + 0.0014160465686576505 + ], + "q99": [ + 0.9900692296898317, + 0.6357358195673684, + 0.5009847868015971, + 0.4287044482210845 + ] + }, + "gripper_qpos": { + "max": [ + 0.05289580300450325, + 0.00937709677964449 + ], + "min": [ + -0.011669117026031017, + -0.06307756155729294 + ], + "mean": [ + 0.03203268930378034, + -0.032331639271968075 + ], + "std": [ + 0.011607049173153697, + 0.011306286745872529 + ], + "q01": [ + 0.006429109393656672, + -0.04056586943958638 + ], + "q99": [ + 0.040377860142451545, + -0.006593889698673258 + ] + } + }, + "action": { + "base_motion": { + "max": [ + 1.0, + 1.0, + 1.0, + 0.0 + ], + "min": [ + -1.0, + -1.0, + -1.0, + 0.0 + ], + "mean": [ + 0.006050336852760097, + 0.002728916466628117, + -0.0017236811393598838, + 0.0 + ], + "std": [ + 0.11032167711449951, + 0.09824140301615687, + 0.07825208047515658, + 0.0 + ], + "q01": [ + -0.154721262094005, + -0.18955302988697728, + -0.14454065867754942, + 0.0 + ], + "q99": [ + 0.24492955247744197, + 0.2496797822190429, + 0.11966742325336034, + 0.0 + ] + }, + "control_mode": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.9294448715752568 + ], + "std": [ + 0.36897903503358326 + ], + "q01": [ + -1.0 + ], + "q99": [ + -0.21627562513311385 + ] + }, + "end_effector_position": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + -0.00826780165926883, + 0.003161997359379232, + -0.08157453651841007 + ], + "std": [ + 0.4545430944464769, + 0.41040151434986594, + 0.4102644251536544 + ], + "q01": [ + -0.9653185255999107, + -0.9255635199318754, + -0.8208437313341718 + ], + "q99": [ + 0.7987781084592441, + 0.9260844232330088, + 0.8357421812622201 + ] + }, + "end_effector_rotation": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + 0.007367024641295137, + -0.02060756343728361, + -0.001884833075998489 + ], + "std": [ + 0.1116768956941076, + 0.13249042272165212, + 0.12338908364725322 + ], + "q01": [ + -0.26894658663246845, + -0.39865607740339326, + -0.34393735191302655 + ], + "q99": [ + 0.3191674780171587, + 0.31133630397431267, + 0.33968476423051097 + ] + }, + "gripper_close": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.3098994894722959 + ], + "std": [ + 0.9507718287498876 + ], + "q01": [ + -1.0 + ], + "q99": [ + 0.7545620899936146 + ] + } + } + }, + "modalities": { + "video": { + "robot0_eye_in_hand": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_left": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_right": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + } + }, + "state": { + "base_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "base_rotation": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "end_effector_position_relative": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation_relative": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "gripper_qpos": { + "absolute": true, + "rotation_type": null, + "shape": [ + 2 + ], + "continuous": true + } + }, + "action": { + "base_motion": { + "absolute": true, + "rotation_type": null, + "shape": [ + 4 + ], + "continuous": true + }, + "control_mode": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + }, + "end_effector_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation": { + "absolute": true, + "rotation_type": "axis_angle", + "shape": [ + 3 + ], + "continuous": true + }, + "gripper_close": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + } + } + }, + "embodiment_tag": "new_embodiment" + } +} \ No newline at end of file diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/resolved_config.yaml b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/resolved_config.yaml new file mode 100644 index 0000000000000000000000000000000000000000..af1b524a714cb17611800134efea109692a8f4cc --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/resolved_config.yaml @@ -0,0 +1,28 @@ +experiment_name: fewshot_39tasks_5shot_from_baseline26_fullactionhead_seed1_5k +policy_type: baseline +base_model_path: ${HOME}/groot_robocasa/Atomic26_baseline/checkpoint-120000 +output_root: ${HOME}/groot_robocasa/robocasa_v2/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1 +dataset: + dataset_soup: fewshot_heldout_atomic39_human_5shot +training: + num_gpus: 1 + batch_size: 64 + seed: 42 + filter_key_seed: 1 + manifest_path: ${HOME}/clvla/benchmarks/robocasa_v2/my_scripts/Fewshot/manifests/fewshot_heldout_atomic39/shot5_seed1.json + save_total_limit: 4 +phases: +- name: train_5shot_seed1_fullactionhead_5k + max_steps: 5000 + save_steps: 0 + save_step_list: + - 1000 + - 3000 + - 5000 + save_final_model: false + trainable: + tune_llm: false + tune_visual: false + tune_projector: true + tune_diffusion_model: true +resolved_sweep: {} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/seed1_5k.yaml b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/seed1_5k.yaml new file mode 100644 index 0000000000000000000000000000000000000000..7a1cab8916bb35644789c61f7d219ae2883e988e --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/seed1_5k.yaml @@ -0,0 +1,27 @@ +experiment_name: fewshot_39tasks_5shot_from_baseline26_fullactionhead_seed1_5k +policy_type: baseline +base_model_path: ${HOME}/groot_robocasa/Atomic26_baseline/checkpoint-120000 +output_root: ${HOME}/groot_robocasa/robocasa_v2/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1 +dataset: + dataset_soup: fewshot_heldout_atomic39_human_5shot +training: + num_gpus: 1 + batch_size: 64 + seed: 42 + filter_key_seed: 1 + manifest_path: ${HOME}/clvla/benchmarks/robocasa_v2/my_scripts/Fewshot/manifests/fewshot_heldout_atomic39/shot5_seed1.json + save_total_limit: 4 +phases: +- name: train_5shot_seed1_fullactionhead_5k + max_steps: 5000 + save_steps: 0 + save_step_list: + - 1000 + - 3000 + - 5000 + save_final_model: false + trainable: + tune_llm: false + tune_visual: false + tune_projector: true + tune_diffusion_model: true diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/config.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..47d7b77e4255263f3803a4b6f94ca6831e459b70 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/config.json @@ -0,0 +1,64 @@ +{ + "action_dim": 32, + "action_head_cfg": { + "action_dim": 32, + "action_horizon": 16, + "add_pos_embed": true, + "backbone_embedding_dim": 2048, + "diffusion_model_cfg": { + "attention_head_dim": 48, + "cross_attention_dim": 2048, + "dropout": 0.2, + "final_dropout": true, + "interleave_self_attention": true, + "norm_type": "ada_norm", + "num_attention_heads": 32, + "num_layers": 16, + "output_dim": 1024, + "positional_embeddings": null + }, + "hidden_size": 1024, + "input_embedding_dim": 1536, + "max_action_dim": 32, + "max_state_dim": 64, + "model_dtype": "float32", + "noise_beta_alpha": 1.5, + "noise_beta_beta": 1.0, + "noise_s": 0.999, + "num_inference_timesteps": 4, + "num_target_vision_tokens": 32, + "num_timestep_buckets": 1000, + "tune_diffusion_model": true, + "tune_projector": true, + "use_vlln": true, + "vl_self_attention_cfg": { + "attention_head_dim": 64, + "dropout": 0.2, + "final_dropout": true, + "num_attention_heads": 32, + "num_layers": 4, + "positional_embeddings": null + } + }, + "action_horizon": 16, + "architectures": [ + "GR00T_N1_5" + ], + "attn_implementation": null, + "backbone_cfg": { + "eagle_path": "NVEagle/eagle_er-qwen3_1_7B-Siglip2_400M_stage1_5_128gpu_er_v7_1mlp_nops", + "load_bf16": false, + "project_to_dim": null, + "reproject_vision": false, + "select_layer": 12, + "tune_llm": false, + "tune_visual": true, + "use_flash_attention": true + }, + "compute_dtype": "bfloat16", + "hidden_size": 2048, + "model_dtype": "float32", + "model_type": "gr00t_n1_5", + "torch_dtype": "bfloat16", + "transformers_version": "4.51.3" +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/experiment_cfg/metadata.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/experiment_cfg/metadata.json new file mode 100644 index 0000000000000000000000000000000000000000..27700cac5d292d4d42897b3c2e80bdc58e55c60e --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/experiment_cfg/metadata.json @@ -0,0 +1,431 @@ +{ + "new_embodiment": { + "statistics": { + "state": { + "base_position": { + "max": [ + 7.778976917266846, + 0.33403685688972473, + 0.7223060727119446 + ], + "min": [ + -4.821934223175049, + -6.785110950469971, + 0.6994727253913879 + ], + "mean": [ + 2.5719731235192254, + -2.1489371002267235, + 0.7003612741268546 + ], + "std": [ + 1.669945884010784, + 1.3739411381361726, + 0.0009413282367754987 + ], + "q01": [ + -0.7944286339399775, + -5.486611518471242, + 0.699977555971739 + ], + "q99": [ + 6.019886905263648, + -0.5229184210026855, + 0.702930326282967 + ] + }, + "base_rotation": { + "max": [ + 0.0, + 0.0, + 1.0, + 1.0 + ], + "min": [ + 0.0, + 0.0, + -1.0, + 0.0 + ], + "mean": [ + 0.0, + 0.0, + 0.248543484335273, + 0.5959317405459531 + ], + "std": [ + 0.0, + 0.0, + 0.6655550240074092, + 0.374283995143559 + ], + "q01": [ + 0.0, + 0.0, + -1.0000000000000002, + 4.503254968910557e-06 + ], + "q99": [ + 0.0, + 0.0, + 1.0000000000000002, + 1.0000000000000002 + ] + }, + "end_effector_position_relative": { + "max": [ + 0.8848381638526917, + 0.8569459915161133, + 1.053884744644165 + ], + "min": [ + -0.5828549861907959, + -0.8486236333847046, + -0.3446122705936432 + ], + "mean": [ + 0.2465490874130862, + -0.004711658908481467, + 0.43463835464312073 + ], + "std": [ + 0.15798784670671595, + 0.25624102400497073, + 0.20836028727974915 + ], + "q01": [ + -0.020752051134640608, + -0.4837933887347875, + 0.1802942952289915 + ], + "q99": [ + 0.5386784714844007, + 0.4801424212024721, + 0.695095732975766 + ] + }, + "end_effector_rotation_relative": { + "max": [ + 0.9999949932098389, + 0.9997354745864868, + 0.9900747537612915, + 0.9735639095306396 + ], + "min": [ + -0.9999914169311523, + -0.9999884366989136, + -0.9975369572639465, + 6.754255821306288e-08 + ], + "mean": [ + -0.22531859714056926, + 0.046973702821026614, + -0.0568176967878771, + 0.12364307042955697 + ], + "std": [ + 0.8502144333612052, + 0.29591250318147405, + 0.30218053156837016, + 0.1636031353412931 + ], + "q01": [ + -0.9959057387172566, + -0.5665384745573048, + -0.5329334620834977, + 0.0014372279999397553 + ], + "q99": [ + 0.9904107951565839, + 0.6359623612021396, + 0.5026076022439377, + 0.42955559234879914 + ] + }, + "gripper_qpos": { + "max": [ + 0.05289580300450325, + 0.00937709677964449 + ], + "min": [ + -0.011669117026031017, + -0.06307756155729294 + ], + "mean": [ + 0.03188757060429838, + -0.0321793333086053 + ], + "std": [ + 0.01171052313737148, + 0.011427336801203189 + ], + "q01": [ + 0.006462901319459925, + -0.040557140599419166 + ], + "q99": [ + 0.04037619335388386, + -0.006523947835993347 + ] + } + }, + "action": { + "base_motion": { + "max": [ + 1.0, + 1.0, + 1.0, + 0.0 + ], + "min": [ + -1.0, + -1.0, + -1.0, + 0.0 + ], + "mean": [ + 0.006639007355857881, + 0.0027330421795561874, + -0.0017774441970214892, + 0.0 + ], + "std": [ + 0.11841528114040736, + 0.1041359083946544, + 0.08346265521208351, + 0.0 + ], + "q01": [ + -0.17562359675270237, + -0.21706402321529558, + -0.16273392585723104, + 0.0 + ], + "q99": [ + 0.2572918701644887, + 0.27022325575787115, + 0.1369626751049278, + 0.0 + ] + }, + "control_mode": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.9205539608927732 + ], + "std": [ + 0.39063657242534666 + ], + "q01": [ + -1.0 + ], + "q99": [ + -0.17711863866562935 + ] + }, + "end_effector_position": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + -0.00924803964621179, + 0.004053841761390575, + -0.08385115578460103 + ], + "std": [ + 0.45413072518223824, + 0.40158612714634856, + 0.41068634292849304 + ], + "q01": [ + -0.9669817145875343, + -0.9241307799783718, + -0.8264079503068825 + ], + "q99": [ + 0.8021511975722166, + 0.9241346582748478, + 0.8348116781502298 + ] + }, + "end_effector_rotation": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + 0.007644157504353809, + -0.019962543093886335, + -0.002047110452602617 + ], + "std": [ + 0.11076012154791087, + 0.13176735140285795, + 0.12286528665895614 + ], + "q01": [ + -0.2659105439401192, + -0.3961694033813533, + -0.3434870832468936 + ], + "q99": [ + 0.3145786959266369, + 0.31309430361227547, + 0.34107754401942986 + ] + }, + "gripper_close": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.29870612267533575 + ], + "std": [ + 0.9543487555375691 + ], + "q01": [ + -1.0 + ], + "q99": [ + 0.7610674802484976 + ] + } + } + }, + "modalities": { + "video": { + "robot0_eye_in_hand": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_left": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_right": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + } + }, + "state": { + "base_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "base_rotation": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "end_effector_position_relative": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation_relative": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "gripper_qpos": { + "absolute": true, + "rotation_type": null, + "shape": [ + 2 + ], + "continuous": true + } + }, + "action": { + "base_motion": { + "absolute": true, + "rotation_type": null, + "shape": [ + 4 + ], + "continuous": true + }, + "control_mode": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + }, + "end_effector_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation": { + "absolute": true, + "rotation_type": "axis_angle", + "shape": [ + 3 + ], + "continuous": true + }, + "gripper_close": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + } + } + }, + "embodiment_tag": "new_embodiment" + } +} \ No newline at end of file diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d5e0e2eeb776b6d4bb042e0ba6405390c78eaa01 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3cad739162e0ee8414ba4511b7fcaa0c2ddb8fe047d46496aa03423aeaeee6e4 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0e9bf3b0d7508b7ca1d30a9276f203b5d1d0b720 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:33b7fd8ca7c5411df32b3e3aca2c478b6ba6fb382b541607e176c33f60b106a0 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model.safetensors.index.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model.safetensors.index.json new file mode 100644 index 0000000000000000000000000000000000000000..5ef5f247b61eb93e89601c7da8334fc087e19750 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/model.safetensors.index.json @@ -0,0 +1,906 @@ +{ + "metadata": { + "total_size": 7585939328 + }, + "weight_map": { + "action_head.action_decoder.layer1.W": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer1.b": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer2.W": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer2.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W1.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W1.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W2.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W2.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W3.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W3.b": "model-00002-of-00002.safetensors", + "action_head.future_tokens.weight": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_1.bias": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_1.weight": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_2.bias": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_2.weight": "model-00002-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_1.bias": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_1.weight": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_2.bias": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.position_embedding.weight": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer1.W": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer1.b": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer2.W": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer2.b": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vlln.bias": "model-00002-of-00002.safetensors", + "action_head.vlln.weight": "model-00002-of-00002.safetensors", + "backbone.eagle_model.language_model.lm_head.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.mlp1.0.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.mlp1.0.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.patch_embedding.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.patch_embedding.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.position_embedding.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.in_proj_bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.in_proj_weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.layernorm.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.probe": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.post_layernorm.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.post_layernorm.weight": "model-00001-of-00002.safetensors" + } +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..c024d982916986a23a0cf8819e819e8126fd07f9 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:79d26d43acc5ab7bea94836e04a88ec871c236de452bb39c79dfe60e17ed0674 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..cddb85352b4d053450624108786800cbad81d6cb --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e19ead5779e3f8f2f666b7793de3a03d118f57f1b16a97eeb87bd732d18b445 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/trainer_state.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5bd7049e1cb72e73723b20cd8df2951a6ce155a1 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-1000/trainer_state.json @@ -0,0 +1,734 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.675041876046901, + "eval_steps": 500, + "global_step": 1000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.01675041876046901, + "grad_norm": 1.3394557237625122, + "learning_rate": 1.08e-06, + "loss": 0.2322, + "step": 10 + }, + { + "epoch": 0.03350083752093802, + "grad_norm": 1.0503181219100952, + "learning_rate": 2.28e-06, + "loss": 0.2236, + "step": 20 + }, + { + "epoch": 0.05025125628140704, + "grad_norm": 0.8409915566444397, + "learning_rate": 3.48e-06, + "loss": 0.1834, + "step": 30 + }, + { + "epoch": 0.06700167504187604, + "grad_norm": 1.0835442543029785, + "learning_rate": 4.68e-06, + "loss": 0.1607, + "step": 40 + }, + { + "epoch": 0.08375209380234507, + "grad_norm": 0.6771818399429321, + "learning_rate": 5.8800000000000005e-06, + "loss": 0.1415, + "step": 50 + }, + { + "epoch": 0.10050251256281408, + "grad_norm": 0.690451443195343, + "learning_rate": 7.08e-06, + "loss": 0.137, + "step": 60 + }, + { + "epoch": 0.11725293132328309, + "grad_norm": 0.3838907480239868, + "learning_rate": 8.28e-06, + "loss": 0.1083, + "step": 70 + }, + { + "epoch": 0.13400335008375208, + "grad_norm": 0.3522876799106598, + "learning_rate": 9.48e-06, + "loss": 0.0972, + "step": 80 + }, + { + "epoch": 0.1507537688442211, + "grad_norm": 0.2768699526786804, + "learning_rate": 1.068e-05, + "loss": 0.0842, + "step": 90 + }, + { + "epoch": 0.16750418760469013, + "grad_norm": 0.27654263377189636, + "learning_rate": 1.1880000000000001e-05, + "loss": 0.0762, + "step": 100 + }, + { + "epoch": 0.18425460636515914, + "grad_norm": 0.33774033188819885, + "learning_rate": 1.308e-05, + "loss": 0.0713, + "step": 110 + }, + { + "epoch": 0.20100502512562815, + "grad_norm": 0.2147975116968155, + "learning_rate": 1.428e-05, + "loss": 0.0672, + "step": 120 + }, + { + "epoch": 0.21775544388609716, + "grad_norm": 0.25137603282928467, + "learning_rate": 1.548e-05, + "loss": 0.0625, + "step": 130 + }, + { + "epoch": 0.23450586264656617, + "grad_norm": 0.3030863404273987, + "learning_rate": 1.6680000000000003e-05, + "loss": 0.0694, + "step": 140 + }, + { + "epoch": 0.25125628140703515, + "grad_norm": 0.2430053949356079, + "learning_rate": 1.7879999999999998e-05, + "loss": 0.0638, + "step": 150 + }, + { + "epoch": 0.26800670016750416, + "grad_norm": 0.24571731686592102, + "learning_rate": 1.908e-05, + "loss": 0.0658, + "step": 160 + }, + { + "epoch": 0.2847571189279732, + "grad_norm": 0.27303019165992737, + "learning_rate": 2.0280000000000002e-05, + "loss": 0.0633, + "step": 170 + }, + { + "epoch": 0.3015075376884422, + "grad_norm": 0.23230038583278656, + "learning_rate": 2.148e-05, + "loss": 0.0564, + "step": 180 + }, + { + "epoch": 0.31825795644891125, + "grad_norm": 0.2652761936187744, + "learning_rate": 2.268e-05, + "loss": 0.0579, + "step": 190 + }, + { + "epoch": 0.33500837520938026, + "grad_norm": 0.3008716106414795, + "learning_rate": 2.3880000000000002e-05, + "loss": 0.0581, + "step": 200 + }, + { + "epoch": 0.35175879396984927, + "grad_norm": 0.25785622000694275, + "learning_rate": 2.508e-05, + "loss": 0.0614, + "step": 210 + }, + { + "epoch": 0.3685092127303183, + "grad_norm": 0.26564037799835205, + "learning_rate": 2.628e-05, + "loss": 0.0522, + "step": 220 + }, + { + "epoch": 0.3852596314907873, + "grad_norm": 0.2962818741798401, + "learning_rate": 2.748e-05, + "loss": 0.0521, + "step": 230 + }, + { + "epoch": 0.4020100502512563, + "grad_norm": 0.28678590059280396, + "learning_rate": 2.868e-05, + "loss": 0.0555, + "step": 240 + }, + { + "epoch": 0.4187604690117253, + "grad_norm": 0.29701972007751465, + "learning_rate": 2.9880000000000002e-05, + "loss": 0.0517, + "step": 250 + }, + { + "epoch": 0.4355108877721943, + "grad_norm": 0.2258671224117279, + "learning_rate": 2.9999734259635676e-05, + "loss": 0.0523, + "step": 260 + }, + { + "epoch": 0.45226130653266333, + "grad_norm": 0.2276943176984787, + "learning_rate": 2.9998815663057245e-05, + "loss": 0.0491, + "step": 270 + }, + { + "epoch": 0.46901172529313234, + "grad_norm": 0.367814838886261, + "learning_rate": 2.999724096969228e-05, + "loss": 0.0472, + "step": 280 + }, + { + "epoch": 0.48576214405360135, + "grad_norm": 0.19225119054317474, + "learning_rate": 2.9995010248422984e-05, + "loss": 0.0452, + "step": 290 + }, + { + "epoch": 0.5025125628140703, + "grad_norm": 0.3076336681842804, + "learning_rate": 2.999212359682832e-05, + "loss": 0.0478, + "step": 300 + }, + { + "epoch": 0.5192629815745393, + "grad_norm": 0.2448616325855255, + "learning_rate": 2.9988581141179787e-05, + "loss": 0.0471, + "step": 310 + }, + { + "epoch": 0.5360134003350083, + "grad_norm": 0.20978757739067078, + "learning_rate": 2.998438303643587e-05, + "loss": 0.0383, + "step": 320 + }, + { + "epoch": 0.5527638190954773, + "grad_norm": 0.24052295088768005, + "learning_rate": 2.997952946623527e-05, + "loss": 0.0435, + "step": 330 + }, + { + "epoch": 0.5695142378559463, + "grad_norm": 0.22263383865356445, + "learning_rate": 2.9974020642888875e-05, + "loss": 0.0467, + "step": 340 + }, + { + "epoch": 0.5862646566164154, + "grad_norm": 0.25700053572654724, + "learning_rate": 2.9967856807370458e-05, + "loss": 0.0448, + "step": 350 + }, + { + "epoch": 0.6030150753768844, + "grad_norm": 0.19276398420333862, + "learning_rate": 2.996103822930615e-05, + "loss": 0.0436, + "step": 360 + }, + { + "epoch": 0.6197654941373534, + "grad_norm": 0.19240586459636688, + "learning_rate": 2.9953565206962653e-05, + "loss": 0.0406, + "step": 370 + }, + { + "epoch": 0.6365159128978225, + "grad_norm": 0.23333503305912018, + "learning_rate": 2.9945438067234172e-05, + "loss": 0.0397, + "step": 380 + }, + { + "epoch": 0.6532663316582915, + "grad_norm": 0.26178690791130066, + "learning_rate": 2.9936657165628124e-05, + "loss": 0.0394, + "step": 390 + }, + { + "epoch": 0.6700167504187605, + "grad_norm": 0.16855783760547638, + "learning_rate": 2.992722288624959e-05, + "loss": 0.0385, + "step": 400 + }, + { + "epoch": 0.6867671691792295, + "grad_norm": 0.1688416302204132, + "learning_rate": 2.9917135641784515e-05, + "loss": 0.0422, + "step": 410 + }, + { + "epoch": 0.7035175879396985, + "grad_norm": 0.18370051681995392, + "learning_rate": 2.9906395873481655e-05, + "loss": 0.0371, + "step": 420 + }, + { + "epoch": 0.7202680067001676, + "grad_norm": 0.2349836379289627, + "learning_rate": 2.989500405113326e-05, + "loss": 0.0413, + "step": 430 + }, + { + "epoch": 0.7370184254606366, + "grad_norm": 0.20748260617256165, + "learning_rate": 2.9882960673054547e-05, + "loss": 0.0367, + "step": 440 + }, + { + "epoch": 0.7537688442211056, + "grad_norm": 0.1702982783317566, + "learning_rate": 2.9870266266061886e-05, + "loss": 0.0379, + "step": 450 + }, + { + "epoch": 0.7705192629815746, + "grad_norm": 0.26680412888526917, + "learning_rate": 2.9856921385449766e-05, + "loss": 0.0367, + "step": 460 + }, + { + "epoch": 0.7872696817420436, + "grad_norm": 0.21671664714813232, + "learning_rate": 2.9842926614966502e-05, + "loss": 0.0367, + "step": 470 + }, + { + "epoch": 0.8040201005025126, + "grad_norm": 0.20597104728221893, + "learning_rate": 2.982828256678868e-05, + "loss": 0.0377, + "step": 480 + }, + { + "epoch": 0.8207705192629816, + "grad_norm": 0.25721216201782227, + "learning_rate": 2.9812989881494412e-05, + "loss": 0.0376, + "step": 490 + }, + { + "epoch": 0.8375209380234506, + "grad_norm": 0.20260390639305115, + "learning_rate": 2.9797049228035296e-05, + "loss": 0.0353, + "step": 500 + }, + { + "epoch": 0.8542713567839196, + "grad_norm": 0.18940532207489014, + "learning_rate": 2.978046130370715e-05, + "loss": 0.0326, + "step": 510 + }, + { + "epoch": 0.8710217755443886, + "grad_norm": 0.14810627698898315, + "learning_rate": 2.9763226834119535e-05, + "loss": 0.0359, + "step": 520 + }, + { + "epoch": 0.8877721943048577, + "grad_norm": 0.21682192385196686, + "learning_rate": 2.9745346573163963e-05, + "loss": 0.0343, + "step": 530 + }, + { + "epoch": 0.9045226130653267, + "grad_norm": 0.2462719827890396, + "learning_rate": 2.9726821302980987e-05, + "loss": 0.0344, + "step": 540 + }, + { + "epoch": 0.9212730318257957, + "grad_norm": 0.20271016657352448, + "learning_rate": 2.9707651833925935e-05, + "loss": 0.0295, + "step": 550 + }, + { + "epoch": 0.9380234505862647, + "grad_norm": 0.18994300067424774, + "learning_rate": 2.968783900453348e-05, + "loss": 0.0331, + "step": 560 + }, + { + "epoch": 0.9547738693467337, + "grad_norm": 0.1817820817232132, + "learning_rate": 2.9667383681480968e-05, + "loss": 0.0344, + "step": 570 + }, + { + "epoch": 0.9715242881072027, + "grad_norm": 0.20372416079044342, + "learning_rate": 2.9646286759550493e-05, + "loss": 0.0333, + "step": 580 + }, + { + "epoch": 0.9882747068676717, + "grad_norm": 0.22303369641304016, + "learning_rate": 2.9624549161589764e-05, + "loss": 0.0316, + "step": 590 + }, + { + "epoch": 1.0050251256281406, + "grad_norm": 0.15984657406806946, + "learning_rate": 2.9602171838471745e-05, + "loss": 0.0325, + "step": 600 + }, + { + "epoch": 1.0217755443886096, + "grad_norm": 0.18722732365131378, + "learning_rate": 2.957915576905303e-05, + "loss": 0.0304, + "step": 610 + }, + { + "epoch": 1.0385259631490786, + "grad_norm": 0.18170492351055145, + "learning_rate": 2.9555501960131058e-05, + "loss": 0.0314, + "step": 620 + }, + { + "epoch": 1.0552763819095476, + "grad_norm": 0.19419005513191223, + "learning_rate": 2.9531211446400068e-05, + "loss": 0.0336, + "step": 630 + }, + { + "epoch": 1.0720268006700167, + "grad_norm": 0.21015776693820953, + "learning_rate": 2.9506285290405813e-05, + "loss": 0.0312, + "step": 640 + }, + { + "epoch": 1.0887772194304857, + "grad_norm": 0.13695307075977325, + "learning_rate": 2.948072458249911e-05, + "loss": 0.0341, + "step": 650 + }, + { + "epoch": 1.1055276381909547, + "grad_norm": 0.16071368753910065, + "learning_rate": 2.9454530440788125e-05, + "loss": 0.0295, + "step": 660 + }, + { + "epoch": 1.1222780569514237, + "grad_norm": 0.18829545378684998, + "learning_rate": 2.9427704011089474e-05, + "loss": 0.0303, + "step": 670 + }, + { + "epoch": 1.1390284757118927, + "grad_norm": 0.1615035980939865, + "learning_rate": 2.94002464668781e-05, + "loss": 0.0294, + "step": 680 + }, + { + "epoch": 1.1557788944723617, + "grad_norm": 0.1708756685256958, + "learning_rate": 2.9372159009235936e-05, + "loss": 0.0278, + "step": 690 + }, + { + "epoch": 1.1725293132328307, + "grad_norm": 0.1325443536043167, + "learning_rate": 2.9343442866799365e-05, + "loss": 0.0289, + "step": 700 + }, + { + "epoch": 1.1892797319932997, + "grad_norm": 0.18041647970676422, + "learning_rate": 2.9314099295705495e-05, + "loss": 0.0316, + "step": 710 + }, + { + "epoch": 1.2060301507537687, + "grad_norm": 0.15595586597919464, + "learning_rate": 2.928412957953718e-05, + "loss": 0.0294, + "step": 720 + }, + { + "epoch": 1.2227805695142377, + "grad_norm": 0.18720653653144836, + "learning_rate": 2.925353502926689e-05, + "loss": 0.0292, + "step": 730 + }, + { + "epoch": 1.2395309882747068, + "grad_norm": 0.1344250738620758, + "learning_rate": 2.922231698319937e-05, + "loss": 0.0299, + "step": 740 + }, + { + "epoch": 1.2562814070351758, + "grad_norm": 0.18409386277198792, + "learning_rate": 2.9190476806913088e-05, + "loss": 0.0305, + "step": 750 + }, + { + "epoch": 1.2730318257956448, + "grad_norm": 0.16554060578346252, + "learning_rate": 2.9158015893200504e-05, + "loss": 0.0292, + "step": 760 + }, + { + "epoch": 1.2897822445561138, + "grad_norm": 0.1602775752544403, + "learning_rate": 2.9124935662007137e-05, + "loss": 0.03, + "step": 770 + }, + { + "epoch": 1.3065326633165828, + "grad_norm": 0.1876162886619568, + "learning_rate": 2.9091237560369467e-05, + "loss": 0.0284, + "step": 780 + }, + { + "epoch": 1.3232830820770518, + "grad_norm": 0.24121980369091034, + "learning_rate": 2.905692306235163e-05, + "loss": 0.0282, + "step": 790 + }, + { + "epoch": 1.3400335008375208, + "grad_norm": 0.15151315927505493, + "learning_rate": 2.9021993668980925e-05, + "loss": 0.0288, + "step": 800 + }, + { + "epoch": 1.3567839195979898, + "grad_norm": 0.32094353437423706, + "learning_rate": 2.8986450908182185e-05, + "loss": 0.0265, + "step": 810 + }, + { + "epoch": 1.3735343383584588, + "grad_norm": 0.20612798631191254, + "learning_rate": 2.8950296334710902e-05, + "loss": 0.0281, + "step": 820 + }, + { + "epoch": 1.3902847571189278, + "grad_norm": 0.16587623953819275, + "learning_rate": 2.8913531530085248e-05, + "loss": 0.0272, + "step": 830 + }, + { + "epoch": 1.4070351758793969, + "grad_norm": 0.1658754050731659, + "learning_rate": 2.887615810251687e-05, + "loss": 0.0279, + "step": 840 + }, + { + "epoch": 1.4237855946398659, + "grad_norm": 0.155488982796669, + "learning_rate": 2.8838177686840577e-05, + "loss": 0.0266, + "step": 850 + }, + { + "epoch": 1.4405360134003349, + "grad_norm": 0.2229546457529068, + "learning_rate": 2.8799591944442776e-05, + "loss": 0.0292, + "step": 860 + }, + { + "epoch": 1.457286432160804, + "grad_norm": 0.36190536618232727, + "learning_rate": 2.8760402563188848e-05, + "loss": 0.0277, + "step": 870 + }, + { + "epoch": 1.474036850921273, + "grad_norm": 0.18090955913066864, + "learning_rate": 2.8720611257349285e-05, + "loss": 0.0297, + "step": 880 + }, + { + "epoch": 1.490787269681742, + "grad_norm": 0.17235404253005981, + "learning_rate": 2.868021976752471e-05, + "loss": 0.0265, + "step": 890 + }, + { + "epoch": 1.507537688442211, + "grad_norm": 0.1455887258052826, + "learning_rate": 2.8639229860569738e-05, + "loss": 0.0298, + "step": 900 + }, + { + "epoch": 1.52428810720268, + "grad_norm": 0.1774197816848755, + "learning_rate": 2.8597643329515688e-05, + "loss": 0.0263, + "step": 910 + }, + { + "epoch": 1.541038525963149, + "grad_norm": 0.15991894900798798, + "learning_rate": 2.855546199349214e-05, + "loss": 0.0259, + "step": 920 + }, + { + "epoch": 1.557788944723618, + "grad_norm": 0.30203819274902344, + "learning_rate": 2.85126876976474e-05, + "loss": 0.0276, + "step": 930 + }, + { + "epoch": 1.574539363484087, + "grad_norm": 0.13825957477092743, + "learning_rate": 2.8469322313067726e-05, + "loss": 0.0262, + "step": 940 + }, + { + "epoch": 1.591289782244556, + "grad_norm": 0.19100086390972137, + "learning_rate": 2.8425367736695522e-05, + "loss": 0.0257, + "step": 950 + }, + { + "epoch": 1.608040201005025, + "grad_norm": 0.16253994405269623, + "learning_rate": 2.838082589124636e-05, + "loss": 0.0282, + "step": 960 + }, + { + "epoch": 1.624790619765494, + "grad_norm": 0.21166931092739105, + "learning_rate": 2.8335698725124843e-05, + "loss": 0.0278, + "step": 970 + }, + { + "epoch": 1.641541038525963, + "grad_norm": 0.13361522555351257, + "learning_rate": 2.8289988212339422e-05, + "loss": 0.0254, + "step": 980 + }, + { + "epoch": 1.658291457286432, + "grad_norm": 0.20177683234214783, + "learning_rate": 2.8243696352415997e-05, + "loss": 0.0317, + "step": 990 + }, + { + "epoch": 1.675041876046901, + "grad_norm": 0.17741645872592926, + "learning_rate": 2.8196825170310495e-05, + "loss": 0.0254, + "step": 1000 + } + ], + "logging_steps": 10, + "max_steps": 5000, + "num_input_tokens_seen": 0, + "num_train_epochs": 9, + "save_steps": 5001, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 64, + "trial_name": null, + "trial_params": null +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/config.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..47d7b77e4255263f3803a4b6f94ca6831e459b70 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/config.json @@ -0,0 +1,64 @@ +{ + "action_dim": 32, + "action_head_cfg": { + "action_dim": 32, + "action_horizon": 16, + "add_pos_embed": true, + "backbone_embedding_dim": 2048, + "diffusion_model_cfg": { + "attention_head_dim": 48, + "cross_attention_dim": 2048, + "dropout": 0.2, + "final_dropout": true, + "interleave_self_attention": true, + "norm_type": "ada_norm", + "num_attention_heads": 32, + "num_layers": 16, + "output_dim": 1024, + "positional_embeddings": null + }, + "hidden_size": 1024, + "input_embedding_dim": 1536, + "max_action_dim": 32, + "max_state_dim": 64, + "model_dtype": "float32", + "noise_beta_alpha": 1.5, + "noise_beta_beta": 1.0, + "noise_s": 0.999, + "num_inference_timesteps": 4, + "num_target_vision_tokens": 32, + "num_timestep_buckets": 1000, + "tune_diffusion_model": true, + "tune_projector": true, + "use_vlln": true, + "vl_self_attention_cfg": { + "attention_head_dim": 64, + "dropout": 0.2, + "final_dropout": true, + "num_attention_heads": 32, + "num_layers": 4, + "positional_embeddings": null + } + }, + "action_horizon": 16, + "architectures": [ + "GR00T_N1_5" + ], + "attn_implementation": null, + "backbone_cfg": { + "eagle_path": "NVEagle/eagle_er-qwen3_1_7B-Siglip2_400M_stage1_5_128gpu_er_v7_1mlp_nops", + "load_bf16": false, + "project_to_dim": null, + "reproject_vision": false, + "select_layer": 12, + "tune_llm": false, + "tune_visual": true, + "use_flash_attention": true + }, + "compute_dtype": "bfloat16", + "hidden_size": 2048, + "model_dtype": "float32", + "model_type": "gr00t_n1_5", + "torch_dtype": "bfloat16", + "transformers_version": "4.51.3" +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/experiment_cfg/metadata.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/experiment_cfg/metadata.json new file mode 100644 index 0000000000000000000000000000000000000000..27700cac5d292d4d42897b3c2e80bdc58e55c60e --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/experiment_cfg/metadata.json @@ -0,0 +1,431 @@ +{ + "new_embodiment": { + "statistics": { + "state": { + "base_position": { + "max": [ + 7.778976917266846, + 0.33403685688972473, + 0.7223060727119446 + ], + "min": [ + -4.821934223175049, + -6.785110950469971, + 0.6994727253913879 + ], + "mean": [ + 2.5719731235192254, + -2.1489371002267235, + 0.7003612741268546 + ], + "std": [ + 1.669945884010784, + 1.3739411381361726, + 0.0009413282367754987 + ], + "q01": [ + -0.7944286339399775, + -5.486611518471242, + 0.699977555971739 + ], + "q99": [ + 6.019886905263648, + -0.5229184210026855, + 0.702930326282967 + ] + }, + "base_rotation": { + "max": [ + 0.0, + 0.0, + 1.0, + 1.0 + ], + "min": [ + 0.0, + 0.0, + -1.0, + 0.0 + ], + "mean": [ + 0.0, + 0.0, + 0.248543484335273, + 0.5959317405459531 + ], + "std": [ + 0.0, + 0.0, + 0.6655550240074092, + 0.374283995143559 + ], + "q01": [ + 0.0, + 0.0, + -1.0000000000000002, + 4.503254968910557e-06 + ], + "q99": [ + 0.0, + 0.0, + 1.0000000000000002, + 1.0000000000000002 + ] + }, + "end_effector_position_relative": { + "max": [ + 0.8848381638526917, + 0.8569459915161133, + 1.053884744644165 + ], + "min": [ + -0.5828549861907959, + -0.8486236333847046, + -0.3446122705936432 + ], + "mean": [ + 0.2465490874130862, + -0.004711658908481467, + 0.43463835464312073 + ], + "std": [ + 0.15798784670671595, + 0.25624102400497073, + 0.20836028727974915 + ], + "q01": [ + -0.020752051134640608, + -0.4837933887347875, + 0.1802942952289915 + ], + "q99": [ + 0.5386784714844007, + 0.4801424212024721, + 0.695095732975766 + ] + }, + "end_effector_rotation_relative": { + "max": [ + 0.9999949932098389, + 0.9997354745864868, + 0.9900747537612915, + 0.9735639095306396 + ], + "min": [ + -0.9999914169311523, + -0.9999884366989136, + -0.9975369572639465, + 6.754255821306288e-08 + ], + "mean": [ + -0.22531859714056926, + 0.046973702821026614, + -0.0568176967878771, + 0.12364307042955697 + ], + "std": [ + 0.8502144333612052, + 0.29591250318147405, + 0.30218053156837016, + 0.1636031353412931 + ], + "q01": [ + -0.9959057387172566, + -0.5665384745573048, + -0.5329334620834977, + 0.0014372279999397553 + ], + "q99": [ + 0.9904107951565839, + 0.6359623612021396, + 0.5026076022439377, + 0.42955559234879914 + ] + }, + "gripper_qpos": { + "max": [ + 0.05289580300450325, + 0.00937709677964449 + ], + "min": [ + -0.011669117026031017, + -0.06307756155729294 + ], + "mean": [ + 0.03188757060429838, + -0.0321793333086053 + ], + "std": [ + 0.01171052313737148, + 0.011427336801203189 + ], + "q01": [ + 0.006462901319459925, + -0.040557140599419166 + ], + "q99": [ + 0.04037619335388386, + -0.006523947835993347 + ] + } + }, + "action": { + "base_motion": { + "max": [ + 1.0, + 1.0, + 1.0, + 0.0 + ], + "min": [ + -1.0, + -1.0, + -1.0, + 0.0 + ], + "mean": [ + 0.006639007355857881, + 0.0027330421795561874, + -0.0017774441970214892, + 0.0 + ], + "std": [ + 0.11841528114040736, + 0.1041359083946544, + 0.08346265521208351, + 0.0 + ], + "q01": [ + -0.17562359675270237, + -0.21706402321529558, + -0.16273392585723104, + 0.0 + ], + "q99": [ + 0.2572918701644887, + 0.27022325575787115, + 0.1369626751049278, + 0.0 + ] + }, + "control_mode": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.9205539608927732 + ], + "std": [ + 0.39063657242534666 + ], + "q01": [ + -1.0 + ], + "q99": [ + -0.17711863866562935 + ] + }, + "end_effector_position": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + -0.00924803964621179, + 0.004053841761390575, + -0.08385115578460103 + ], + "std": [ + 0.45413072518223824, + 0.40158612714634856, + 0.41068634292849304 + ], + "q01": [ + -0.9669817145875343, + -0.9241307799783718, + -0.8264079503068825 + ], + "q99": [ + 0.8021511975722166, + 0.9241346582748478, + 0.8348116781502298 + ] + }, + "end_effector_rotation": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + 0.007644157504353809, + -0.019962543093886335, + -0.002047110452602617 + ], + "std": [ + 0.11076012154791087, + 0.13176735140285795, + 0.12286528665895614 + ], + "q01": [ + -0.2659105439401192, + -0.3961694033813533, + -0.3434870832468936 + ], + "q99": [ + 0.3145786959266369, + 0.31309430361227547, + 0.34107754401942986 + ] + }, + "gripper_close": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.29870612267533575 + ], + "std": [ + 0.9543487555375691 + ], + "q01": [ + -1.0 + ], + "q99": [ + 0.7610674802484976 + ] + } + } + }, + "modalities": { + "video": { + "robot0_eye_in_hand": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_left": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_right": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + } + }, + "state": { + "base_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "base_rotation": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "end_effector_position_relative": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation_relative": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "gripper_qpos": { + "absolute": true, + "rotation_type": null, + "shape": [ + 2 + ], + "continuous": true + } + }, + "action": { + "base_motion": { + "absolute": true, + "rotation_type": null, + "shape": [ + 4 + ], + "continuous": true + }, + "control_mode": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + }, + "end_effector_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation": { + "absolute": true, + "rotation_type": "axis_angle", + "shape": [ + 3 + ], + "continuous": true + }, + "gripper_close": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + } + } + }, + "embodiment_tag": "new_embodiment" + } +} \ No newline at end of file diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..706733a813efd5c0d04295e659be470462677472 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:198273fb376d0ef6bf0de2576f81b6e5621cfaa0811f0315876056eb703889b5 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f82dd438ca6ae3372df2c762b5fbe1706b913a35 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6d1fc016c68b2a0b15538d66fc764cd9d97818706db8fdc808bc880466fd1ab1 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model.safetensors.index.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model.safetensors.index.json new file mode 100644 index 0000000000000000000000000000000000000000..5ef5f247b61eb93e89601c7da8334fc087e19750 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/model.safetensors.index.json @@ -0,0 +1,906 @@ +{ + "metadata": { + "total_size": 7585939328 + }, + "weight_map": { + "action_head.action_decoder.layer1.W": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer1.b": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer2.W": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer2.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W1.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W1.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W2.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W2.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W3.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W3.b": "model-00002-of-00002.safetensors", + "action_head.future_tokens.weight": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_1.bias": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_1.weight": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_2.bias": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_2.weight": "model-00002-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_1.bias": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_1.weight": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_2.bias": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.position_embedding.weight": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer1.W": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer1.b": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer2.W": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer2.b": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vlln.bias": "model-00002-of-00002.safetensors", + "action_head.vlln.weight": "model-00002-of-00002.safetensors", + "backbone.eagle_model.language_model.lm_head.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.mlp1.0.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.mlp1.0.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.patch_embedding.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.patch_embedding.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.position_embedding.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.in_proj_bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.in_proj_weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.layernorm.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.probe": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.post_layernorm.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.post_layernorm.weight": "model-00001-of-00002.safetensors" + } +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..2f794ccb867814532d52224f3c3fa2912e97d5b0 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c92d34f806bd357292f6ef538c5846496ee7354432a4e1a4328334bd4b95bc43 +size 8550719959 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..7969d0c75ecf6a45378fd552390a1416459c488d --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:85cf750ef17be819e7281f7355fdb6fe24e17d7b2f3f773c8f182329ad9e5dc9 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..de4e41c4a6949df056e028b10a18e7f8cd7b7580 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42d8e6d8e53e6b837084d0cc18fdd63ca9e40bd44a65d38eb52695647a8e84e8 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/trainer_state.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..303f847338a6a930a54761db25662d4df1e5f750 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/checkpoint-3000/trainer_state.json @@ -0,0 +1,2134 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.025125628140704, + "eval_steps": 500, + "global_step": 3000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.01675041876046901, + "grad_norm": 1.3394557237625122, + "learning_rate": 1.08e-06, + "loss": 0.2322, + "step": 10 + }, + { + "epoch": 0.03350083752093802, + "grad_norm": 1.0503181219100952, + "learning_rate": 2.28e-06, + "loss": 0.2236, + "step": 20 + }, + { + "epoch": 0.05025125628140704, + "grad_norm": 0.8409915566444397, + "learning_rate": 3.48e-06, + "loss": 0.1834, + "step": 30 + }, + { + "epoch": 0.06700167504187604, + "grad_norm": 1.0835442543029785, + "learning_rate": 4.68e-06, + "loss": 0.1607, + "step": 40 + }, + { + "epoch": 0.08375209380234507, + "grad_norm": 0.6771818399429321, + "learning_rate": 5.8800000000000005e-06, + "loss": 0.1415, + "step": 50 + }, + { + "epoch": 0.10050251256281408, + "grad_norm": 0.690451443195343, + "learning_rate": 7.08e-06, + "loss": 0.137, + "step": 60 + }, + { + "epoch": 0.11725293132328309, + "grad_norm": 0.3838907480239868, + "learning_rate": 8.28e-06, + "loss": 0.1083, + "step": 70 + }, + { + "epoch": 0.13400335008375208, + "grad_norm": 0.3522876799106598, + "learning_rate": 9.48e-06, + "loss": 0.0972, + "step": 80 + }, + { + "epoch": 0.1507537688442211, + "grad_norm": 0.2768699526786804, + "learning_rate": 1.068e-05, + "loss": 0.0842, + "step": 90 + }, + { + "epoch": 0.16750418760469013, + "grad_norm": 0.27654263377189636, + "learning_rate": 1.1880000000000001e-05, + "loss": 0.0762, + "step": 100 + }, + { + "epoch": 0.18425460636515914, + "grad_norm": 0.33774033188819885, + "learning_rate": 1.308e-05, + "loss": 0.0713, + "step": 110 + }, + { + "epoch": 0.20100502512562815, + "grad_norm": 0.2147975116968155, + "learning_rate": 1.428e-05, + "loss": 0.0672, + "step": 120 + }, + { + "epoch": 0.21775544388609716, + "grad_norm": 0.25137603282928467, + "learning_rate": 1.548e-05, + "loss": 0.0625, + "step": 130 + }, + { + "epoch": 0.23450586264656617, + "grad_norm": 0.3030863404273987, + "learning_rate": 1.6680000000000003e-05, + "loss": 0.0694, + "step": 140 + }, + { + "epoch": 0.25125628140703515, + "grad_norm": 0.2430053949356079, + "learning_rate": 1.7879999999999998e-05, + "loss": 0.0638, + "step": 150 + }, + { + "epoch": 0.26800670016750416, + "grad_norm": 0.24571731686592102, + "learning_rate": 1.908e-05, + "loss": 0.0658, + "step": 160 + }, + { + "epoch": 0.2847571189279732, + "grad_norm": 0.27303019165992737, + "learning_rate": 2.0280000000000002e-05, + "loss": 0.0633, + "step": 170 + }, + { + "epoch": 0.3015075376884422, + "grad_norm": 0.23230038583278656, + "learning_rate": 2.148e-05, + "loss": 0.0564, + "step": 180 + }, + { + "epoch": 0.31825795644891125, + "grad_norm": 0.2652761936187744, + "learning_rate": 2.268e-05, + "loss": 0.0579, + "step": 190 + }, + { + "epoch": 0.33500837520938026, + "grad_norm": 0.3008716106414795, + "learning_rate": 2.3880000000000002e-05, + "loss": 0.0581, + "step": 200 + }, + { + "epoch": 0.35175879396984927, + "grad_norm": 0.25785622000694275, + "learning_rate": 2.508e-05, + "loss": 0.0614, + "step": 210 + }, + { + "epoch": 0.3685092127303183, + "grad_norm": 0.26564037799835205, + "learning_rate": 2.628e-05, + "loss": 0.0522, + "step": 220 + }, + { + "epoch": 0.3852596314907873, + "grad_norm": 0.2962818741798401, + "learning_rate": 2.748e-05, + "loss": 0.0521, + "step": 230 + }, + { + "epoch": 0.4020100502512563, + "grad_norm": 0.28678590059280396, + "learning_rate": 2.868e-05, + "loss": 0.0555, + "step": 240 + }, + { + "epoch": 0.4187604690117253, + "grad_norm": 0.29701972007751465, + "learning_rate": 2.9880000000000002e-05, + "loss": 0.0517, + "step": 250 + }, + { + "epoch": 0.4355108877721943, + "grad_norm": 0.2258671224117279, + "learning_rate": 2.9999734259635676e-05, + "loss": 0.0523, + "step": 260 + }, + { + "epoch": 0.45226130653266333, + "grad_norm": 0.2276943176984787, + "learning_rate": 2.9998815663057245e-05, + "loss": 0.0491, + "step": 270 + }, + { + "epoch": 0.46901172529313234, + "grad_norm": 0.367814838886261, + "learning_rate": 2.999724096969228e-05, + "loss": 0.0472, + "step": 280 + }, + { + "epoch": 0.48576214405360135, + "grad_norm": 0.19225119054317474, + "learning_rate": 2.9995010248422984e-05, + "loss": 0.0452, + "step": 290 + }, + { + "epoch": 0.5025125628140703, + "grad_norm": 0.3076336681842804, + "learning_rate": 2.999212359682832e-05, + "loss": 0.0478, + "step": 300 + }, + { + "epoch": 0.5192629815745393, + "grad_norm": 0.2448616325855255, + "learning_rate": 2.9988581141179787e-05, + "loss": 0.0471, + "step": 310 + }, + { + "epoch": 0.5360134003350083, + "grad_norm": 0.20978757739067078, + "learning_rate": 2.998438303643587e-05, + "loss": 0.0383, + "step": 320 + }, + { + "epoch": 0.5527638190954773, + "grad_norm": 0.24052295088768005, + "learning_rate": 2.997952946623527e-05, + "loss": 0.0435, + "step": 330 + }, + { + "epoch": 0.5695142378559463, + "grad_norm": 0.22263383865356445, + "learning_rate": 2.9974020642888875e-05, + "loss": 0.0467, + "step": 340 + }, + { + "epoch": 0.5862646566164154, + "grad_norm": 0.25700053572654724, + "learning_rate": 2.9967856807370458e-05, + "loss": 0.0448, + "step": 350 + }, + { + "epoch": 0.6030150753768844, + "grad_norm": 0.19276398420333862, + "learning_rate": 2.996103822930615e-05, + "loss": 0.0436, + "step": 360 + }, + { + "epoch": 0.6197654941373534, + "grad_norm": 0.19240586459636688, + "learning_rate": 2.9953565206962653e-05, + "loss": 0.0406, + "step": 370 + }, + { + "epoch": 0.6365159128978225, + "grad_norm": 0.23333503305912018, + "learning_rate": 2.9945438067234172e-05, + "loss": 0.0397, + "step": 380 + }, + { + "epoch": 0.6532663316582915, + "grad_norm": 0.26178690791130066, + "learning_rate": 2.9936657165628124e-05, + "loss": 0.0394, + "step": 390 + }, + { + "epoch": 0.6700167504187605, + "grad_norm": 0.16855783760547638, + "learning_rate": 2.992722288624959e-05, + "loss": 0.0385, + "step": 400 + }, + { + "epoch": 0.6867671691792295, + "grad_norm": 0.1688416302204132, + "learning_rate": 2.9917135641784515e-05, + "loss": 0.0422, + "step": 410 + }, + { + "epoch": 0.7035175879396985, + "grad_norm": 0.18370051681995392, + "learning_rate": 2.9906395873481655e-05, + "loss": 0.0371, + "step": 420 + }, + { + "epoch": 0.7202680067001676, + "grad_norm": 0.2349836379289627, + "learning_rate": 2.989500405113326e-05, + "loss": 0.0413, + "step": 430 + }, + { + "epoch": 0.7370184254606366, + "grad_norm": 0.20748260617256165, + "learning_rate": 2.9882960673054547e-05, + "loss": 0.0367, + "step": 440 + }, + { + "epoch": 0.7537688442211056, + "grad_norm": 0.1702982783317566, + "learning_rate": 2.9870266266061886e-05, + "loss": 0.0379, + "step": 450 + }, + { + "epoch": 0.7705192629815746, + "grad_norm": 0.26680412888526917, + "learning_rate": 2.9856921385449766e-05, + "loss": 0.0367, + "step": 460 + }, + { + "epoch": 0.7872696817420436, + "grad_norm": 0.21671664714813232, + "learning_rate": 2.9842926614966502e-05, + "loss": 0.0367, + "step": 470 + }, + { + "epoch": 0.8040201005025126, + "grad_norm": 0.20597104728221893, + "learning_rate": 2.982828256678868e-05, + "loss": 0.0377, + "step": 480 + }, + { + "epoch": 0.8207705192629816, + "grad_norm": 0.25721216201782227, + "learning_rate": 2.9812989881494412e-05, + "loss": 0.0376, + "step": 490 + }, + { + "epoch": 0.8375209380234506, + "grad_norm": 0.20260390639305115, + "learning_rate": 2.9797049228035296e-05, + "loss": 0.0353, + "step": 500 + }, + { + "epoch": 0.8542713567839196, + "grad_norm": 0.18940532207489014, + "learning_rate": 2.978046130370715e-05, + "loss": 0.0326, + "step": 510 + }, + { + "epoch": 0.8710217755443886, + "grad_norm": 0.14810627698898315, + "learning_rate": 2.9763226834119535e-05, + "loss": 0.0359, + "step": 520 + }, + { + "epoch": 0.8877721943048577, + "grad_norm": 0.21682192385196686, + "learning_rate": 2.9745346573163963e-05, + "loss": 0.0343, + "step": 530 + }, + { + "epoch": 0.9045226130653267, + "grad_norm": 0.2462719827890396, + "learning_rate": 2.9726821302980987e-05, + "loss": 0.0344, + "step": 540 + }, + { + "epoch": 0.9212730318257957, + "grad_norm": 0.20271016657352448, + "learning_rate": 2.9707651833925935e-05, + "loss": 0.0295, + "step": 550 + }, + { + "epoch": 0.9380234505862647, + "grad_norm": 0.18994300067424774, + "learning_rate": 2.968783900453348e-05, + "loss": 0.0331, + "step": 560 + }, + { + "epoch": 0.9547738693467337, + "grad_norm": 0.1817820817232132, + "learning_rate": 2.9667383681480968e-05, + "loss": 0.0344, + "step": 570 + }, + { + "epoch": 0.9715242881072027, + "grad_norm": 0.20372416079044342, + "learning_rate": 2.9646286759550493e-05, + "loss": 0.0333, + "step": 580 + }, + { + "epoch": 0.9882747068676717, + "grad_norm": 0.22303369641304016, + "learning_rate": 2.9624549161589764e-05, + "loss": 0.0316, + "step": 590 + }, + { + "epoch": 1.0050251256281406, + "grad_norm": 0.15984657406806946, + "learning_rate": 2.9602171838471745e-05, + "loss": 0.0325, + "step": 600 + }, + { + "epoch": 1.0217755443886096, + "grad_norm": 0.18722732365131378, + "learning_rate": 2.957915576905303e-05, + "loss": 0.0304, + "step": 610 + }, + { + "epoch": 1.0385259631490786, + "grad_norm": 0.18170492351055145, + "learning_rate": 2.9555501960131058e-05, + "loss": 0.0314, + "step": 620 + }, + { + "epoch": 1.0552763819095476, + "grad_norm": 0.19419005513191223, + "learning_rate": 2.9531211446400068e-05, + "loss": 0.0336, + "step": 630 + }, + { + "epoch": 1.0720268006700167, + "grad_norm": 0.21015776693820953, + "learning_rate": 2.9506285290405813e-05, + "loss": 0.0312, + "step": 640 + }, + { + "epoch": 1.0887772194304857, + "grad_norm": 0.13695307075977325, + "learning_rate": 2.948072458249911e-05, + "loss": 0.0341, + "step": 650 + }, + { + "epoch": 1.1055276381909547, + "grad_norm": 0.16071368753910065, + "learning_rate": 2.9454530440788125e-05, + "loss": 0.0295, + "step": 660 + }, + { + "epoch": 1.1222780569514237, + "grad_norm": 0.18829545378684998, + "learning_rate": 2.9427704011089474e-05, + "loss": 0.0303, + "step": 670 + }, + { + "epoch": 1.1390284757118927, + "grad_norm": 0.1615035980939865, + "learning_rate": 2.94002464668781e-05, + "loss": 0.0294, + "step": 680 + }, + { + "epoch": 1.1557788944723617, + "grad_norm": 0.1708756685256958, + "learning_rate": 2.9372159009235936e-05, + "loss": 0.0278, + "step": 690 + }, + { + "epoch": 1.1725293132328307, + "grad_norm": 0.1325443536043167, + "learning_rate": 2.9343442866799365e-05, + "loss": 0.0289, + "step": 700 + }, + { + "epoch": 1.1892797319932997, + "grad_norm": 0.18041647970676422, + "learning_rate": 2.9314099295705495e-05, + "loss": 0.0316, + "step": 710 + }, + { + "epoch": 1.2060301507537687, + "grad_norm": 0.15595586597919464, + "learning_rate": 2.928412957953718e-05, + "loss": 0.0294, + "step": 720 + }, + { + "epoch": 1.2227805695142377, + "grad_norm": 0.18720653653144836, + "learning_rate": 2.925353502926689e-05, + "loss": 0.0292, + "step": 730 + }, + { + "epoch": 1.2395309882747068, + "grad_norm": 0.1344250738620758, + "learning_rate": 2.922231698319937e-05, + "loss": 0.0299, + "step": 740 + }, + { + "epoch": 1.2562814070351758, + "grad_norm": 0.18409386277198792, + "learning_rate": 2.9190476806913088e-05, + "loss": 0.0305, + "step": 750 + }, + { + "epoch": 1.2730318257956448, + "grad_norm": 0.16554060578346252, + "learning_rate": 2.9158015893200504e-05, + "loss": 0.0292, + "step": 760 + }, + { + "epoch": 1.2897822445561138, + "grad_norm": 0.1602775752544403, + "learning_rate": 2.9124935662007137e-05, + "loss": 0.03, + "step": 770 + }, + { + "epoch": 1.3065326633165828, + "grad_norm": 0.1876162886619568, + "learning_rate": 2.9091237560369467e-05, + "loss": 0.0284, + "step": 780 + }, + { + "epoch": 1.3232830820770518, + "grad_norm": 0.24121980369091034, + "learning_rate": 2.905692306235163e-05, + "loss": 0.0282, + "step": 790 + }, + { + "epoch": 1.3400335008375208, + "grad_norm": 0.15151315927505493, + "learning_rate": 2.9021993668980925e-05, + "loss": 0.0288, + "step": 800 + }, + { + "epoch": 1.3567839195979898, + "grad_norm": 0.32094353437423706, + "learning_rate": 2.8986450908182185e-05, + "loss": 0.0265, + "step": 810 + }, + { + "epoch": 1.3735343383584588, + "grad_norm": 0.20612798631191254, + "learning_rate": 2.8950296334710902e-05, + "loss": 0.0281, + "step": 820 + }, + { + "epoch": 1.3902847571189278, + "grad_norm": 0.16587623953819275, + "learning_rate": 2.8913531530085248e-05, + "loss": 0.0272, + "step": 830 + }, + { + "epoch": 1.4070351758793969, + "grad_norm": 0.1658754050731659, + "learning_rate": 2.887615810251687e-05, + "loss": 0.0279, + "step": 840 + }, + { + "epoch": 1.4237855946398659, + "grad_norm": 0.155488982796669, + "learning_rate": 2.8838177686840577e-05, + "loss": 0.0266, + "step": 850 + }, + { + "epoch": 1.4405360134003349, + "grad_norm": 0.2229546457529068, + "learning_rate": 2.8799591944442776e-05, + "loss": 0.0292, + "step": 860 + }, + { + "epoch": 1.457286432160804, + "grad_norm": 0.36190536618232727, + "learning_rate": 2.8760402563188848e-05, + "loss": 0.0277, + "step": 870 + }, + { + "epoch": 1.474036850921273, + "grad_norm": 0.18090955913066864, + "learning_rate": 2.8720611257349285e-05, + "loss": 0.0297, + "step": 880 + }, + { + "epoch": 1.490787269681742, + "grad_norm": 0.17235404253005981, + "learning_rate": 2.868021976752471e-05, + "loss": 0.0265, + "step": 890 + }, + { + "epoch": 1.507537688442211, + "grad_norm": 0.1455887258052826, + "learning_rate": 2.8639229860569738e-05, + "loss": 0.0298, + "step": 900 + }, + { + "epoch": 1.52428810720268, + "grad_norm": 0.1774197816848755, + "learning_rate": 2.8597643329515688e-05, + "loss": 0.0263, + "step": 910 + }, + { + "epoch": 1.541038525963149, + "grad_norm": 0.15991894900798798, + "learning_rate": 2.855546199349214e-05, + "loss": 0.0259, + "step": 920 + }, + { + "epoch": 1.557788944723618, + "grad_norm": 0.30203819274902344, + "learning_rate": 2.85126876976474e-05, + "loss": 0.0276, + "step": 930 + }, + { + "epoch": 1.574539363484087, + "grad_norm": 0.13825957477092743, + "learning_rate": 2.8469322313067726e-05, + "loss": 0.0262, + "step": 940 + }, + { + "epoch": 1.591289782244556, + "grad_norm": 0.19100086390972137, + "learning_rate": 2.8425367736695522e-05, + "loss": 0.0257, + "step": 950 + }, + { + "epoch": 1.608040201005025, + "grad_norm": 0.16253994405269623, + "learning_rate": 2.838082589124636e-05, + "loss": 0.0282, + "step": 960 + }, + { + "epoch": 1.624790619765494, + "grad_norm": 0.21166931092739105, + "learning_rate": 2.8335698725124843e-05, + "loss": 0.0278, + "step": 970 + }, + { + "epoch": 1.641541038525963, + "grad_norm": 0.13361522555351257, + "learning_rate": 2.8289988212339422e-05, + "loss": 0.0254, + "step": 980 + }, + { + "epoch": 1.658291457286432, + "grad_norm": 0.20177683234214783, + "learning_rate": 2.8243696352415997e-05, + "loss": 0.0317, + "step": 990 + }, + { + "epoch": 1.675041876046901, + "grad_norm": 0.17741645872592926, + "learning_rate": 2.8196825170310495e-05, + "loss": 0.0254, + "step": 1000 + }, + { + "epoch": 1.69179229480737, + "grad_norm": 0.1586075723171234, + "learning_rate": 2.8149376716320256e-05, + "loss": 0.0264, + "step": 1010 + }, + { + "epoch": 1.708542713567839, + "grad_norm": 0.18498659133911133, + "learning_rate": 2.8101353065994373e-05, + "loss": 0.0289, + "step": 1020 + }, + { + "epoch": 1.725293132328308, + "grad_norm": 0.16134566068649292, + "learning_rate": 2.8052756320042885e-05, + "loss": 0.0262, + "step": 1030 + }, + { + "epoch": 1.742043551088777, + "grad_norm": 0.18623295426368713, + "learning_rate": 2.8003588604244893e-05, + "loss": 0.0242, + "step": 1040 + }, + { + "epoch": 1.758793969849246, + "grad_norm": 0.1394229531288147, + "learning_rate": 2.7953852069355565e-05, + "loss": 0.0236, + "step": 1050 + }, + { + "epoch": 1.775544388609715, + "grad_norm": 0.15025576949119568, + "learning_rate": 2.790354889101206e-05, + "loss": 0.0222, + "step": 1060 + }, + { + "epoch": 1.792294807370184, + "grad_norm": 0.13321664929389954, + "learning_rate": 2.7852681269638366e-05, + "loss": 0.0259, + "step": 1070 + }, + { + "epoch": 1.809045226130653, + "grad_norm": 0.16647320985794067, + "learning_rate": 2.780125143034902e-05, + "loss": 0.0268, + "step": 1080 + }, + { + "epoch": 1.8257956448911221, + "grad_norm": 0.21666789054870605, + "learning_rate": 2.7749261622851812e-05, + "loss": 0.0242, + "step": 1090 + }, + { + "epoch": 1.8425460636515911, + "grad_norm": 0.18027998507022858, + "learning_rate": 2.7696714121349335e-05, + "loss": 0.0253, + "step": 1100 + }, + { + "epoch": 1.8592964824120601, + "grad_norm": 0.17092131078243256, + "learning_rate": 2.764361122443954e-05, + "loss": 0.0236, + "step": 1110 + }, + { + "epoch": 1.8760469011725294, + "grad_norm": 0.1665954291820526, + "learning_rate": 2.758995525501517e-05, + "loss": 0.0226, + "step": 1120 + }, + { + "epoch": 1.8927973199329984, + "grad_norm": 0.1582082360982895, + "learning_rate": 2.753574856016215e-05, + "loss": 0.0257, + "step": 1130 + }, + { + "epoch": 1.9095477386934674, + "grad_norm": 0.18370600044727325, + "learning_rate": 2.7480993511056913e-05, + "loss": 0.0252, + "step": 1140 + }, + { + "epoch": 1.9262981574539364, + "grad_norm": 0.14998869597911835, + "learning_rate": 2.7425692502862684e-05, + "loss": 0.022, + "step": 1150 + }, + { + "epoch": 1.9430485762144054, + "grad_norm": 0.13657869398593903, + "learning_rate": 2.7369847954624728e-05, + "loss": 0.0248, + "step": 1160 + }, + { + "epoch": 1.9597989949748744, + "grad_norm": 0.15892188251018524, + "learning_rate": 2.731346230916448e-05, + "loss": 0.026, + "step": 1170 + }, + { + "epoch": 1.9765494137353434, + "grad_norm": 0.15034610033035278, + "learning_rate": 2.7256538032972746e-05, + "loss": 0.0232, + "step": 1180 + }, + { + "epoch": 1.9932998324958124, + "grad_norm": 0.1602204591035843, + "learning_rate": 2.7199077616101773e-05, + "loss": 0.0231, + "step": 1190 + }, + { + "epoch": 2.0100502512562812, + "grad_norm": 0.12914741039276123, + "learning_rate": 2.714108357205634e-05, + "loss": 0.0239, + "step": 1200 + }, + { + "epoch": 2.0268006700167502, + "grad_norm": 0.1998392939567566, + "learning_rate": 2.7082558437683803e-05, + "loss": 0.0224, + "step": 1210 + }, + { + "epoch": 2.0435510887772192, + "grad_norm": 0.18535244464874268, + "learning_rate": 2.702350477306315e-05, + "loss": 0.0233, + "step": 1220 + }, + { + "epoch": 2.0603015075376883, + "grad_norm": 0.14260677993297577, + "learning_rate": 2.6963925161392963e-05, + "loss": 0.0245, + "step": 1230 + }, + { + "epoch": 2.0770519262981573, + "grad_norm": 0.201503187417984, + "learning_rate": 2.6903822208878476e-05, + "loss": 0.0235, + "step": 1240 + }, + { + "epoch": 2.0938023450586263, + "grad_norm": 0.16170263290405273, + "learning_rate": 2.6843198544617535e-05, + "loss": 0.0242, + "step": 1250 + }, + { + "epoch": 2.1105527638190953, + "grad_norm": 0.14339309930801392, + "learning_rate": 2.6782056820485612e-05, + "loss": 0.0229, + "step": 1260 + }, + { + "epoch": 2.1273031825795643, + "grad_norm": 0.23185782134532928, + "learning_rate": 2.672039971101979e-05, + "loss": 0.0229, + "step": 1270 + }, + { + "epoch": 2.1440536013400333, + "grad_norm": 0.2018624097108841, + "learning_rate": 2.665822991330178e-05, + "loss": 0.0263, + "step": 1280 + }, + { + "epoch": 2.1608040201005023, + "grad_norm": 0.22470778226852417, + "learning_rate": 2.6595550146839934e-05, + "loss": 0.0244, + "step": 1290 + }, + { + "epoch": 2.1775544388609713, + "grad_norm": 0.1919565051794052, + "learning_rate": 2.6532363153450287e-05, + "loss": 0.023, + "step": 1300 + }, + { + "epoch": 2.1943048576214403, + "grad_norm": 0.16625232994556427, + "learning_rate": 2.6468671697136634e-05, + "loss": 0.022, + "step": 1310 + }, + { + "epoch": 2.2110552763819094, + "grad_norm": 0.16590924561023712, + "learning_rate": 2.640447856396961e-05, + "loss": 0.0211, + "step": 1320 + }, + { + "epoch": 2.2278056951423784, + "grad_norm": 0.1491633653640747, + "learning_rate": 2.6339786561964805e-05, + "loss": 0.0265, + "step": 1330 + }, + { + "epoch": 2.2445561139028474, + "grad_norm": 0.16424474120140076, + "learning_rate": 2.6274598520959966e-05, + "loss": 0.0235, + "step": 1340 + }, + { + "epoch": 2.2613065326633164, + "grad_norm": 0.18205176293849945, + "learning_rate": 2.6208917292491185e-05, + "loss": 0.0242, + "step": 1350 + }, + { + "epoch": 2.2780569514237854, + "grad_norm": 0.1608763039112091, + "learning_rate": 2.6142745749668176e-05, + "loss": 0.0225, + "step": 1360 + }, + { + "epoch": 2.2948073701842544, + "grad_norm": 0.1522231101989746, + "learning_rate": 2.607608678704859e-05, + "loss": 0.0229, + "step": 1370 + }, + { + "epoch": 2.3115577889447234, + "grad_norm": 0.16214381158351898, + "learning_rate": 2.600894332051139e-05, + "loss": 0.0201, + "step": 1380 + }, + { + "epoch": 2.3283082077051924, + "grad_norm": 0.1418379843235016, + "learning_rate": 2.594131828712932e-05, + "loss": 0.0232, + "step": 1390 + }, + { + "epoch": 2.3450586264656614, + "grad_norm": 0.1545649766921997, + "learning_rate": 2.5873214645040414e-05, + "loss": 0.0224, + "step": 1400 + }, + { + "epoch": 2.3618090452261304, + "grad_norm": 0.16949930787086487, + "learning_rate": 2.5804635373318604e-05, + "loss": 0.0209, + "step": 1410 + }, + { + "epoch": 2.3785594639865995, + "grad_norm": 0.1950673907995224, + "learning_rate": 2.57355834718434e-05, + "loss": 0.0235, + "step": 1420 + }, + { + "epoch": 2.3953098827470685, + "grad_norm": 0.15320082008838654, + "learning_rate": 2.566606196116867e-05, + "loss": 0.0209, + "step": 1430 + }, + { + "epoch": 2.4120603015075375, + "grad_norm": 0.14742597937583923, + "learning_rate": 2.559607388239051e-05, + "loss": 0.0206, + "step": 1440 + }, + { + "epoch": 2.4288107202680065, + "grad_norm": 0.15421146154403687, + "learning_rate": 2.552562229701422e-05, + "loss": 0.0228, + "step": 1450 + }, + { + "epoch": 2.4455611390284755, + "grad_norm": 0.16883830726146698, + "learning_rate": 2.545471028682036e-05, + "loss": 0.0252, + "step": 1460 + }, + { + "epoch": 2.4623115577889445, + "grad_norm": 0.143342524766922, + "learning_rate": 2.538334095373e-05, + "loss": 0.0207, + "step": 1470 + }, + { + "epoch": 2.4790619765494135, + "grad_norm": 0.17817887663841248, + "learning_rate": 2.531151741966896e-05, + "loss": 0.0212, + "step": 1480 + }, + { + "epoch": 2.4958123953098825, + "grad_norm": 0.1521480828523636, + "learning_rate": 2.5239242826431302e-05, + "loss": 0.0208, + "step": 1490 + }, + { + "epoch": 2.5125628140703515, + "grad_norm": 0.14518405497074127, + "learning_rate": 2.5166520335541865e-05, + "loss": 0.0204, + "step": 1500 + }, + { + "epoch": 2.5293132328308205, + "grad_norm": 0.11578862369060516, + "learning_rate": 2.5093353128117996e-05, + "loss": 0.0237, + "step": 1510 + }, + { + "epoch": 2.5460636515912896, + "grad_norm": 0.1930747777223587, + "learning_rate": 2.501974440473037e-05, + "loss": 0.0205, + "step": 1520 + }, + { + "epoch": 2.5628140703517586, + "grad_norm": 0.1401190161705017, + "learning_rate": 2.4945697385263015e-05, + "loss": 0.0217, + "step": 1530 + }, + { + "epoch": 2.5795644891122276, + "grad_norm": 0.1486596018075943, + "learning_rate": 2.487121530877243e-05, + "loss": 0.0242, + "step": 1540 + }, + { + "epoch": 2.5963149078726966, + "grad_norm": 0.16599705815315247, + "learning_rate": 2.4796301433345943e-05, + "loss": 0.0219, + "step": 1550 + }, + { + "epoch": 2.6130653266331656, + "grad_norm": 0.1955460160970688, + "learning_rate": 2.4720959035959148e-05, + "loss": 0.022, + "step": 1560 + }, + { + "epoch": 2.6298157453936346, + "grad_norm": 0.16018950939178467, + "learning_rate": 2.464519141233257e-05, + "loss": 0.0219, + "step": 1570 + }, + { + "epoch": 2.6465661641541036, + "grad_norm": 0.15230196714401245, + "learning_rate": 2.456900187678754e-05, + "loss": 0.0211, + "step": 1580 + }, + { + "epoch": 2.6633165829145726, + "grad_norm": 0.1539147049188614, + "learning_rate": 2.4492393762101147e-05, + "loss": 0.0224, + "step": 1590 + }, + { + "epoch": 2.6800670016750416, + "grad_norm": 0.2199530005455017, + "learning_rate": 2.4415370419360508e-05, + "loss": 0.0216, + "step": 1600 + }, + { + "epoch": 2.6968174204355106, + "grad_norm": 0.11828820407390594, + "learning_rate": 2.4337935217816157e-05, + "loss": 0.0191, + "step": 1610 + }, + { + "epoch": 2.7135678391959797, + "grad_norm": 0.11301644891500473, + "learning_rate": 2.4260091544734665e-05, + "loss": 0.0209, + "step": 1620 + }, + { + "epoch": 2.7303182579564487, + "grad_norm": 0.13908027112483978, + "learning_rate": 2.4181842805250466e-05, + "loss": 0.0219, + "step": 1630 + }, + { + "epoch": 2.7470686767169177, + "grad_norm": 0.14333346486091614, + "learning_rate": 2.4103192422216923e-05, + "loss": 0.0179, + "step": 1640 + }, + { + "epoch": 2.7638190954773867, + "grad_norm": 0.15043054521083832, + "learning_rate": 2.402414383605658e-05, + "loss": 0.0209, + "step": 1650 + }, + { + "epoch": 2.7805695142378557, + "grad_norm": 0.1858556866645813, + "learning_rate": 2.3944700504610674e-05, + "loss": 0.0185, + "step": 1660 + }, + { + "epoch": 2.7973199329983247, + "grad_norm": 0.13898970186710358, + "learning_rate": 2.3864865902987883e-05, + "loss": 0.0206, + "step": 1670 + }, + { + "epoch": 2.8140703517587937, + "grad_norm": 0.17943225800991058, + "learning_rate": 2.378464352341231e-05, + "loss": 0.0212, + "step": 1680 + }, + { + "epoch": 2.8308207705192627, + "grad_norm": 0.1789410412311554, + "learning_rate": 2.3704036875070728e-05, + "loss": 0.0234, + "step": 1690 + }, + { + "epoch": 2.8475711892797317, + "grad_norm": 0.16943080723285675, + "learning_rate": 2.362304948395906e-05, + "loss": 0.0238, + "step": 1700 + }, + { + "epoch": 2.8643216080402008, + "grad_norm": 0.182373046875, + "learning_rate": 2.3541684892728157e-05, + "loss": 0.022, + "step": 1710 + }, + { + "epoch": 2.8810720268006698, + "grad_norm": 0.1499493569135666, + "learning_rate": 2.345994666052883e-05, + "loss": 0.02, + "step": 1720 + }, + { + "epoch": 2.8978224455611388, + "grad_norm": 0.17924560606479645, + "learning_rate": 2.337783836285614e-05, + "loss": 0.0208, + "step": 1730 + }, + { + "epoch": 2.914572864321608, + "grad_norm": 0.17541290819644928, + "learning_rate": 2.3295363591393026e-05, + "loss": 0.0183, + "step": 1740 + }, + { + "epoch": 2.931323283082077, + "grad_norm": 0.14497047662734985, + "learning_rate": 2.3212525953853174e-05, + "loss": 0.0219, + "step": 1750 + }, + { + "epoch": 2.948073701842546, + "grad_norm": 0.1496923714876175, + "learning_rate": 2.3129329073823206e-05, + "loss": 0.0196, + "step": 1760 + }, + { + "epoch": 2.964824120603015, + "grad_norm": 0.18601380288600922, + "learning_rate": 2.3045776590604175e-05, + "loss": 0.0228, + "step": 1770 + }, + { + "epoch": 2.981574539363484, + "grad_norm": 0.16404607892036438, + "learning_rate": 2.296187215905237e-05, + "loss": 0.0201, + "step": 1780 + }, + { + "epoch": 2.998324958123953, + "grad_norm": 0.16068114340305328, + "learning_rate": 2.2877619449419437e-05, + "loss": 0.0222, + "step": 1790 + }, + { + "epoch": 3.0150753768844223, + "grad_norm": 0.22023139894008636, + "learning_rate": 2.2793022147191843e-05, + "loss": 0.0196, + "step": 1800 + }, + { + "epoch": 3.0318257956448913, + "grad_norm": 0.22863224148750305, + "learning_rate": 2.2708083952929634e-05, + "loss": 0.0175, + "step": 1810 + }, + { + "epoch": 3.0485762144053603, + "grad_norm": 0.1506689339876175, + "learning_rate": 2.2622808582104594e-05, + "loss": 0.0195, + "step": 1820 + }, + { + "epoch": 3.0653266331658293, + "grad_norm": 0.12392555922269821, + "learning_rate": 2.2537199764937703e-05, + "loss": 0.0203, + "step": 1830 + }, + { + "epoch": 3.0820770519262983, + "grad_norm": 0.13800229132175446, + "learning_rate": 2.245126124623595e-05, + "loss": 0.0209, + "step": 1840 + }, + { + "epoch": 3.0988274706867673, + "grad_norm": 0.12618660926818848, + "learning_rate": 2.2364996785228547e-05, + "loss": 0.0206, + "step": 1850 + }, + { + "epoch": 3.1155778894472363, + "grad_norm": 0.1612847000360489, + "learning_rate": 2.227841015540248e-05, + "loss": 0.0212, + "step": 1860 + }, + { + "epoch": 3.1323283082077054, + "grad_norm": 0.11662063002586365, + "learning_rate": 2.2191505144337433e-05, + "loss": 0.0208, + "step": 1870 + }, + { + "epoch": 3.1490787269681744, + "grad_norm": 0.14581643044948578, + "learning_rate": 2.210428555354013e-05, + "loss": 0.0202, + "step": 1880 + }, + { + "epoch": 3.1658291457286434, + "grad_norm": 0.16268415749073029, + "learning_rate": 2.201675519827802e-05, + "loss": 0.0205, + "step": 1890 + }, + { + "epoch": 3.1825795644891124, + "grad_norm": 0.1655290424823761, + "learning_rate": 2.1928917907412403e-05, + "loss": 0.0188, + "step": 1900 + }, + { + "epoch": 3.1993299832495814, + "grad_norm": 0.1120857372879982, + "learning_rate": 2.1840777523230937e-05, + "loss": 0.0202, + "step": 1910 + }, + { + "epoch": 3.2160804020100504, + "grad_norm": 0.12592901289463043, + "learning_rate": 2.1752337901279552e-05, + "loss": 0.0192, + "step": 1920 + }, + { + "epoch": 3.2328308207705194, + "grad_norm": 0.22475941479206085, + "learning_rate": 2.166360291019383e-05, + "loss": 0.0198, + "step": 1930 + }, + { + "epoch": 3.2495812395309884, + "grad_norm": 0.11940304934978485, + "learning_rate": 2.157457643152973e-05, + "loss": 0.019, + "step": 1940 + }, + { + "epoch": 3.2663316582914574, + "grad_norm": 0.14816822111606598, + "learning_rate": 2.148526235959385e-05, + "loss": 0.0186, + "step": 1950 + }, + { + "epoch": 3.2830820770519265, + "grad_norm": 0.1205066591501236, + "learning_rate": 2.1395664601273016e-05, + "loss": 0.02, + "step": 1960 + }, + { + "epoch": 3.2998324958123955, + "grad_norm": 0.13585013151168823, + "learning_rate": 2.130578707586345e-05, + "loss": 0.0194, + "step": 1970 + }, + { + "epoch": 3.3165829145728645, + "grad_norm": 0.13307107985019684, + "learning_rate": 2.1215633714899264e-05, + "loss": 0.0205, + "step": 1980 + }, + { + "epoch": 3.3333333333333335, + "grad_norm": 0.1215062215924263, + "learning_rate": 2.112520846198053e-05, + "loss": 0.0202, + "step": 1990 + }, + { + "epoch": 3.3500837520938025, + "grad_norm": 0.14667080342769623, + "learning_rate": 2.103451527260074e-05, + "loss": 0.0205, + "step": 2000 + }, + { + "epoch": 3.3668341708542715, + "grad_norm": 0.19008496403694153, + "learning_rate": 2.094355811397381e-05, + "loss": 0.0196, + "step": 2010 + }, + { + "epoch": 3.3835845896147405, + "grad_norm": 0.1476626843214035, + "learning_rate": 2.0852340964860522e-05, + "loss": 0.0227, + "step": 2020 + }, + { + "epoch": 3.4003350083752095, + "grad_norm": 0.17680875957012177, + "learning_rate": 2.076086781539447e-05, + "loss": 0.0193, + "step": 2030 + }, + { + "epoch": 3.4170854271356785, + "grad_norm": 0.1655515730381012, + "learning_rate": 2.066914266690755e-05, + "loss": 0.0191, + "step": 2040 + }, + { + "epoch": 3.4338358458961475, + "grad_norm": 0.18550711870193481, + "learning_rate": 2.0577169531754906e-05, + "loss": 0.0198, + "step": 2050 + }, + { + "epoch": 3.4505862646566166, + "grad_norm": 0.11140353232622147, + "learning_rate": 2.048495243313942e-05, + "loss": 0.0186, + "step": 2060 + }, + { + "epoch": 3.4673366834170856, + "grad_norm": 0.15830710530281067, + "learning_rate": 2.039249540493572e-05, + "loss": 0.0208, + "step": 2070 + }, + { + "epoch": 3.4840871021775546, + "grad_norm": 0.15438948571681976, + "learning_rate": 2.0299802491513755e-05, + "loss": 0.017, + "step": 2080 + }, + { + "epoch": 3.5008375209380236, + "grad_norm": 0.17817939817905426, + "learning_rate": 2.0206877747561828e-05, + "loss": 0.0203, + "step": 2090 + }, + { + "epoch": 3.5175879396984926, + "grad_norm": 0.1366434544324875, + "learning_rate": 2.011372523790927e-05, + "loss": 0.0212, + "step": 2100 + }, + { + "epoch": 3.5343383584589616, + "grad_norm": 0.13273486495018005, + "learning_rate": 2.0020349037348643e-05, + "loss": 0.016, + "step": 2110 + }, + { + "epoch": 3.5510887772194306, + "grad_norm": 0.15586011111736298, + "learning_rate": 1.9926753230457443e-05, + "loss": 0.0192, + "step": 2120 + }, + { + "epoch": 3.5678391959798996, + "grad_norm": 0.10179942101240158, + "learning_rate": 1.983294191141948e-05, + "loss": 0.0194, + "step": 2130 + }, + { + "epoch": 3.5845896147403686, + "grad_norm": 0.18417240679264069, + "learning_rate": 1.973891918384575e-05, + "loss": 0.0186, + "step": 2140 + }, + { + "epoch": 3.6013400335008376, + "grad_norm": 0.14377598464488983, + "learning_rate": 1.9644689160594945e-05, + "loss": 0.0181, + "step": 2150 + }, + { + "epoch": 3.6180904522613067, + "grad_norm": 0.18220196664333344, + "learning_rate": 1.9550255963593553e-05, + "loss": 0.018, + "step": 2160 + }, + { + "epoch": 3.6348408710217757, + "grad_norm": 0.22227473556995392, + "learning_rate": 1.9455623723655524e-05, + "loss": 0.018, + "step": 2170 + }, + { + "epoch": 3.6515912897822447, + "grad_norm": 0.10854306817054749, + "learning_rate": 1.9360796580301606e-05, + "loss": 0.0171, + "step": 2180 + }, + { + "epoch": 3.6683417085427137, + "grad_norm": 0.15350358188152313, + "learning_rate": 1.9265778681578245e-05, + "loss": 0.0187, + "step": 2190 + }, + { + "epoch": 3.6850921273031827, + "grad_norm": 0.1715448796749115, + "learning_rate": 1.9170574183876143e-05, + "loss": 0.0211, + "step": 2200 + }, + { + "epoch": 3.7018425460636517, + "grad_norm": 0.15281938016414642, + "learning_rate": 1.9075187251748452e-05, + "loss": 0.0205, + "step": 2210 + }, + { + "epoch": 3.7185929648241207, + "grad_norm": 0.1549525409936905, + "learning_rate": 1.8979622057728596e-05, + "loss": 0.0193, + "step": 2220 + }, + { + "epoch": 3.7353433835845897, + "grad_norm": 0.1523311883211136, + "learning_rate": 1.8883882782147748e-05, + "loss": 0.0184, + "step": 2230 + }, + { + "epoch": 3.7520938023450587, + "grad_norm": 0.18689101934432983, + "learning_rate": 1.8787973612951967e-05, + "loss": 0.0183, + "step": 2240 + }, + { + "epoch": 3.7688442211055277, + "grad_norm": 0.16317549347877502, + "learning_rate": 1.8691898745519028e-05, + "loss": 0.0189, + "step": 2250 + }, + { + "epoch": 3.7855946398659968, + "grad_norm": 0.12337777763605118, + "learning_rate": 1.8595662382474863e-05, + "loss": 0.0197, + "step": 2260 + }, + { + "epoch": 3.8023450586264658, + "grad_norm": 0.1409161388874054, + "learning_rate": 1.8499268733509766e-05, + "loss": 0.0181, + "step": 2270 + }, + { + "epoch": 3.819095477386935, + "grad_norm": 0.15133973956108093, + "learning_rate": 1.84027220151942e-05, + "loss": 0.0158, + "step": 2280 + }, + { + "epoch": 3.835845896147404, + "grad_norm": 0.13350911438465118, + "learning_rate": 1.83060264507944e-05, + "loss": 0.0184, + "step": 2290 + }, + { + "epoch": 3.852596314907873, + "grad_norm": 0.1512780487537384, + "learning_rate": 1.82091862700876e-05, + "loss": 0.0174, + "step": 2300 + }, + { + "epoch": 3.869346733668342, + "grad_norm": 0.14480029046535492, + "learning_rate": 1.8112205709177023e-05, + "loss": 0.0209, + "step": 2310 + }, + { + "epoch": 3.886097152428811, + "grad_norm": 0.11316472291946411, + "learning_rate": 1.8015089010306585e-05, + "loss": 0.0177, + "step": 2320 + }, + { + "epoch": 3.90284757118928, + "grad_norm": 0.18374566733837128, + "learning_rate": 1.7917840421675298e-05, + "loss": 0.0211, + "step": 2330 + }, + { + "epoch": 3.919597989949749, + "grad_norm": 0.14135697484016418, + "learning_rate": 1.7820464197251474e-05, + "loss": 0.0187, + "step": 2340 + }, + { + "epoch": 3.936348408710218, + "grad_norm": 0.13300488889217377, + "learning_rate": 1.7722964596586627e-05, + "loss": 0.0188, + "step": 2350 + }, + { + "epoch": 3.953098827470687, + "grad_norm": 0.17664390802383423, + "learning_rate": 1.7625345884629144e-05, + "loss": 0.0189, + "step": 2360 + }, + { + "epoch": 3.969849246231156, + "grad_norm": 0.11432985216379166, + "learning_rate": 1.7527612331537722e-05, + "loss": 0.0168, + "step": 2370 + }, + { + "epoch": 3.986599664991625, + "grad_norm": 0.16970939934253693, + "learning_rate": 1.7429768212494593e-05, + "loss": 0.0194, + "step": 2380 + }, + { + "epoch": 4.0033500837520934, + "grad_norm": 0.21405430138111115, + "learning_rate": 1.7331817807518497e-05, + "loss": 0.021, + "step": 2390 + }, + { + "epoch": 4.0201005025125625, + "grad_norm": 0.14571137726306915, + "learning_rate": 1.723376540127745e-05, + "loss": 0.0189, + "step": 2400 + }, + { + "epoch": 4.0368509212730315, + "grad_norm": 0.14875146746635437, + "learning_rate": 1.7135615282901357e-05, + "loss": 0.0166, + "step": 2410 + }, + { + "epoch": 4.0536013400335005, + "grad_norm": 0.1627630889415741, + "learning_rate": 1.7037371745794358e-05, + "loss": 0.0206, + "step": 2420 + }, + { + "epoch": 4.0703517587939695, + "grad_norm": 0.1687653660774231, + "learning_rate": 1.6939039087447026e-05, + "loss": 0.0188, + "step": 2430 + }, + { + "epoch": 4.0871021775544385, + "grad_norm": 0.13051913678646088, + "learning_rate": 1.6840621609248397e-05, + "loss": 0.0172, + "step": 2440 + }, + { + "epoch": 4.1038525963149075, + "grad_norm": 0.1474522203207016, + "learning_rate": 1.6742123616297794e-05, + "loss": 0.0181, + "step": 2450 + }, + { + "epoch": 4.1206030150753765, + "grad_norm": 0.11590561270713806, + "learning_rate": 1.664354941721651e-05, + "loss": 0.0161, + "step": 2460 + }, + { + "epoch": 4.1373534338358455, + "grad_norm": 0.12784413993358612, + "learning_rate": 1.6544903323959355e-05, + "loss": 0.0167, + "step": 2470 + }, + { + "epoch": 4.1541038525963145, + "grad_norm": 0.14732132852077484, + "learning_rate": 1.6446189651626023e-05, + "loss": 0.0186, + "step": 2480 + }, + { + "epoch": 4.1708542713567835, + "grad_norm": 0.15262089669704437, + "learning_rate": 1.6347412718272316e-05, + "loss": 0.0189, + "step": 2490 + }, + { + "epoch": 4.187604690117253, + "grad_norm": 0.12261030077934265, + "learning_rate": 1.624857684472131e-05, + "loss": 0.0166, + "step": 2500 + }, + { + "epoch": 4.204355108877722, + "grad_norm": 0.16570910811424255, + "learning_rate": 1.6149686354374283e-05, + "loss": 0.0175, + "step": 2510 + }, + { + "epoch": 4.221105527638191, + "grad_norm": 0.13071776926517487, + "learning_rate": 1.605074557302165e-05, + "loss": 0.017, + "step": 2520 + }, + { + "epoch": 4.23785594639866, + "grad_norm": 0.13835109770298004, + "learning_rate": 1.59517588286537e-05, + "loss": 0.0181, + "step": 2530 + }, + { + "epoch": 4.254606365159129, + "grad_norm": 0.13597555458545685, + "learning_rate": 1.5852730451271324e-05, + "loss": 0.0174, + "step": 2540 + }, + { + "epoch": 4.271356783919598, + "grad_norm": 0.11292872577905655, + "learning_rate": 1.5753664772696546e-05, + "loss": 0.0184, + "step": 2550 + }, + { + "epoch": 4.288107202680067, + "grad_norm": 0.18765822052955627, + "learning_rate": 1.565456612638307e-05, + "loss": 0.0192, + "step": 2560 + }, + { + "epoch": 4.304857621440536, + "grad_norm": 0.1113753542304039, + "learning_rate": 1.5555438847226732e-05, + "loss": 0.0155, + "step": 2570 + }, + { + "epoch": 4.321608040201005, + "grad_norm": 0.15917973220348358, + "learning_rate": 1.545628727137584e-05, + "loss": 0.0178, + "step": 2580 + }, + { + "epoch": 4.338358458961474, + "grad_norm": 0.1233622133731842, + "learning_rate": 1.535711573604153e-05, + "loss": 0.015, + "step": 2590 + }, + { + "epoch": 4.355108877721943, + "grad_norm": 0.12452328950166702, + "learning_rate": 1.5257928579308032e-05, + "loss": 0.0187, + "step": 2600 + }, + { + "epoch": 4.371859296482412, + "grad_norm": 0.13558247685432434, + "learning_rate": 1.5158730139942902e-05, + "loss": 0.0174, + "step": 2610 + }, + { + "epoch": 4.388609715242881, + "grad_norm": 0.15536141395568848, + "learning_rate": 1.5059524757207239e-05, + "loss": 0.0165, + "step": 2620 + }, + { + "epoch": 4.40536013400335, + "grad_norm": 0.1601993888616562, + "learning_rate": 1.4960316770665866e-05, + "loss": 0.0164, + "step": 2630 + }, + { + "epoch": 4.422110552763819, + "grad_norm": 0.13969165086746216, + "learning_rate": 1.4861110519997495e-05, + "loss": 0.0188, + "step": 2640 + }, + { + "epoch": 4.438860971524288, + "grad_norm": 0.11961787194013596, + "learning_rate": 1.4761910344804913e-05, + "loss": 0.016, + "step": 2650 + }, + { + "epoch": 4.455611390284757, + "grad_norm": 0.12037152051925659, + "learning_rate": 1.466272058442516e-05, + "loss": 0.0179, + "step": 2660 + }, + { + "epoch": 4.472361809045226, + "grad_norm": 0.15370553731918335, + "learning_rate": 1.4563545577739676e-05, + "loss": 0.0166, + "step": 2670 + }, + { + "epoch": 4.489112227805695, + "grad_norm": 0.11886673420667648, + "learning_rate": 1.4464389662984543e-05, + "loss": 0.0182, + "step": 2680 + }, + { + "epoch": 4.505862646566165, + "grad_norm": 0.13794168829917908, + "learning_rate": 1.4365257177560684e-05, + "loss": 0.0187, + "step": 2690 + }, + { + "epoch": 4.522613065326633, + "grad_norm": 0.16981415450572968, + "learning_rate": 1.426615245784416e-05, + "loss": 0.0161, + "step": 2700 + }, + { + "epoch": 4.539363484087103, + "grad_norm": 0.14231683313846588, + "learning_rate": 1.4167079838996468e-05, + "loss": 0.0164, + "step": 2710 + }, + { + "epoch": 4.556113902847571, + "grad_norm": 0.12874573469161987, + "learning_rate": 1.4068043654774897e-05, + "loss": 0.0165, + "step": 2720 + }, + { + "epoch": 4.572864321608041, + "grad_norm": 0.1743222177028656, + "learning_rate": 1.3969048237342992e-05, + "loss": 0.0179, + "step": 2730 + }, + { + "epoch": 4.589614740368509, + "grad_norm": 0.26698336005210876, + "learning_rate": 1.3870097917081011e-05, + "loss": 0.0169, + "step": 2740 + }, + { + "epoch": 4.606365159128979, + "grad_norm": 0.12284237146377563, + "learning_rate": 1.3771197022396508e-05, + "loss": 0.0146, + "step": 2750 + }, + { + "epoch": 4.623115577889447, + "grad_norm": 0.11153502017259598, + "learning_rate": 1.3672349879535015e-05, + "loss": 0.0153, + "step": 2760 + }, + { + "epoch": 4.639865996649917, + "grad_norm": 0.13498924672603607, + "learning_rate": 1.3573560812390781e-05, + "loss": 0.0185, + "step": 2770 + }, + { + "epoch": 4.656616415410385, + "grad_norm": 0.13696305453777313, + "learning_rate": 1.3474834142317635e-05, + "loss": 0.0149, + "step": 2780 + }, + { + "epoch": 4.673366834170855, + "grad_norm": 0.13542267680168152, + "learning_rate": 1.3376174187939955e-05, + "loss": 0.0147, + "step": 2790 + }, + { + "epoch": 4.690117252931323, + "grad_norm": 0.14426903426647186, + "learning_rate": 1.3277585264963761e-05, + "loss": 0.0176, + "step": 2800 + }, + { + "epoch": 4.706867671691793, + "grad_norm": 0.12668757140636444, + "learning_rate": 1.3179071685987928e-05, + "loss": 0.0179, + "step": 2810 + }, + { + "epoch": 4.723618090452261, + "grad_norm": 0.14874869585037231, + "learning_rate": 1.308063776031554e-05, + "loss": 0.0161, + "step": 2820 + }, + { + "epoch": 4.740368509212731, + "grad_norm": 0.1480618417263031, + "learning_rate": 1.2982287793765389e-05, + "loss": 0.0151, + "step": 2830 + }, + { + "epoch": 4.757118927973199, + "grad_norm": 0.1443120837211609, + "learning_rate": 1.2884026088483616e-05, + "loss": 0.0165, + "step": 2840 + }, + { + "epoch": 4.773869346733669, + "grad_norm": 0.16240982711315155, + "learning_rate": 1.2785856942755543e-05, + "loss": 0.0166, + "step": 2850 + }, + { + "epoch": 4.790619765494137, + "grad_norm": 0.1501774787902832, + "learning_rate": 1.2687784650817616e-05, + "loss": 0.0178, + "step": 2860 + }, + { + "epoch": 4.807370184254607, + "grad_norm": 0.12356068193912506, + "learning_rate": 1.2589813502669603e-05, + "loss": 0.019, + "step": 2870 + }, + { + "epoch": 4.824120603015075, + "grad_norm": 0.1650429666042328, + "learning_rate": 1.2491947783886907e-05, + "loss": 0.0172, + "step": 2880 + }, + { + "epoch": 4.840871021775545, + "grad_norm": 0.10088960081338882, + "learning_rate": 1.2394191775433106e-05, + "loss": 0.0159, + "step": 2890 + }, + { + "epoch": 4.857621440536013, + "grad_norm": 0.14617778360843658, + "learning_rate": 1.2296549753472696e-05, + "loss": 0.0169, + "step": 2900 + }, + { + "epoch": 4.874371859296483, + "grad_norm": 0.14807341992855072, + "learning_rate": 1.2199025989184032e-05, + "loss": 0.0155, + "step": 2910 + }, + { + "epoch": 4.891122278056951, + "grad_norm": 0.32588717341423035, + "learning_rate": 1.21016247485725e-05, + "loss": 0.0206, + "step": 2920 + }, + { + "epoch": 4.907872696817421, + "grad_norm": 0.12184573709964752, + "learning_rate": 1.2004350292283897e-05, + "loss": 0.0168, + "step": 2930 + }, + { + "epoch": 4.924623115577889, + "grad_norm": 0.20224563777446747, + "learning_rate": 1.1907206875418068e-05, + "loss": 0.0167, + "step": 2940 + }, + { + "epoch": 4.941373534338359, + "grad_norm": 0.1300506293773651, + "learning_rate": 1.1810198747342769e-05, + "loss": 0.0181, + "step": 2950 + }, + { + "epoch": 4.958123953098827, + "grad_norm": 0.15161874890327454, + "learning_rate": 1.1713330151507786e-05, + "loss": 0.0157, + "step": 2960 + }, + { + "epoch": 4.974874371859297, + "grad_norm": 0.14213404059410095, + "learning_rate": 1.161660532525931e-05, + "loss": 0.0167, + "step": 2970 + }, + { + "epoch": 4.991624790619765, + "grad_norm": 0.17077548801898956, + "learning_rate": 1.1520028499654584e-05, + "loss": 0.0162, + "step": 2980 + }, + { + "epoch": 5.008375209380235, + "grad_norm": 0.13322734832763672, + "learning_rate": 1.1423603899276833e-05, + "loss": 0.0144, + "step": 2990 + }, + { + "epoch": 5.025125628140704, + "grad_norm": 0.17589686810970306, + "learning_rate": 1.1327335742050442e-05, + "loss": 0.0163, + "step": 3000 + } + ], + "logging_steps": 10, + "max_steps": 5000, + "num_input_tokens_seen": 0, + "num_train_epochs": 9, + "save_steps": 5001, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 64, + "trial_name": null, + "trial_params": null +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/experiment_cfg/metadata.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/experiment_cfg/metadata.json new file mode 100644 index 0000000000000000000000000000000000000000..27700cac5d292d4d42897b3c2e80bdc58e55c60e --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed1/default/train_5shot_seed1_fullactionhead_5k/experiment_cfg/metadata.json @@ -0,0 +1,431 @@ +{ + "new_embodiment": { + "statistics": { + "state": { + "base_position": { + "max": [ + 7.778976917266846, + 0.33403685688972473, + 0.7223060727119446 + ], + "min": [ + -4.821934223175049, + -6.785110950469971, + 0.6994727253913879 + ], + "mean": [ + 2.5719731235192254, + -2.1489371002267235, + 0.7003612741268546 + ], + "std": [ + 1.669945884010784, + 1.3739411381361726, + 0.0009413282367754987 + ], + "q01": [ + -0.7944286339399775, + -5.486611518471242, + 0.699977555971739 + ], + "q99": [ + 6.019886905263648, + -0.5229184210026855, + 0.702930326282967 + ] + }, + "base_rotation": { + "max": [ + 0.0, + 0.0, + 1.0, + 1.0 + ], + "min": [ + 0.0, + 0.0, + -1.0, + 0.0 + ], + "mean": [ + 0.0, + 0.0, + 0.248543484335273, + 0.5959317405459531 + ], + "std": [ + 0.0, + 0.0, + 0.6655550240074092, + 0.374283995143559 + ], + "q01": [ + 0.0, + 0.0, + -1.0000000000000002, + 4.503254968910557e-06 + ], + "q99": [ + 0.0, + 0.0, + 1.0000000000000002, + 1.0000000000000002 + ] + }, + "end_effector_position_relative": { + "max": [ + 0.8848381638526917, + 0.8569459915161133, + 1.053884744644165 + ], + "min": [ + -0.5828549861907959, + -0.8486236333847046, + -0.3446122705936432 + ], + "mean": [ + 0.2465490874130862, + -0.004711658908481467, + 0.43463835464312073 + ], + "std": [ + 0.15798784670671595, + 0.25624102400497073, + 0.20836028727974915 + ], + "q01": [ + -0.020752051134640608, + -0.4837933887347875, + 0.1802942952289915 + ], + "q99": [ + 0.5386784714844007, + 0.4801424212024721, + 0.695095732975766 + ] + }, + "end_effector_rotation_relative": { + "max": [ + 0.9999949932098389, + 0.9997354745864868, + 0.9900747537612915, + 0.9735639095306396 + ], + "min": [ + -0.9999914169311523, + -0.9999884366989136, + -0.9975369572639465, + 6.754255821306288e-08 + ], + "mean": [ + -0.22531859714056926, + 0.046973702821026614, + -0.0568176967878771, + 0.12364307042955697 + ], + "std": [ + 0.8502144333612052, + 0.29591250318147405, + 0.30218053156837016, + 0.1636031353412931 + ], + "q01": [ + -0.9959057387172566, + -0.5665384745573048, + -0.5329334620834977, + 0.0014372279999397553 + ], + "q99": [ + 0.9904107951565839, + 0.6359623612021396, + 0.5026076022439377, + 0.42955559234879914 + ] + }, + "gripper_qpos": { + "max": [ + 0.05289580300450325, + 0.00937709677964449 + ], + "min": [ + -0.011669117026031017, + -0.06307756155729294 + ], + "mean": [ + 0.03188757060429838, + -0.0321793333086053 + ], + "std": [ + 0.01171052313737148, + 0.011427336801203189 + ], + "q01": [ + 0.006462901319459925, + -0.040557140599419166 + ], + "q99": [ + 0.04037619335388386, + -0.006523947835993347 + ] + } + }, + "action": { + "base_motion": { + "max": [ + 1.0, + 1.0, + 1.0, + 0.0 + ], + "min": [ + -1.0, + -1.0, + -1.0, + 0.0 + ], + "mean": [ + 0.006639007355857881, + 0.0027330421795561874, + -0.0017774441970214892, + 0.0 + ], + "std": [ + 0.11841528114040736, + 0.1041359083946544, + 0.08346265521208351, + 0.0 + ], + "q01": [ + -0.17562359675270237, + -0.21706402321529558, + -0.16273392585723104, + 0.0 + ], + "q99": [ + 0.2572918701644887, + 0.27022325575787115, + 0.1369626751049278, + 0.0 + ] + }, + "control_mode": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.9205539608927732 + ], + "std": [ + 0.39063657242534666 + ], + "q01": [ + -1.0 + ], + "q99": [ + -0.17711863866562935 + ] + }, + "end_effector_position": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + -0.00924803964621179, + 0.004053841761390575, + -0.08385115578460103 + ], + "std": [ + 0.45413072518223824, + 0.40158612714634856, + 0.41068634292849304 + ], + "q01": [ + -0.9669817145875343, + -0.9241307799783718, + -0.8264079503068825 + ], + "q99": [ + 0.8021511975722166, + 0.9241346582748478, + 0.8348116781502298 + ] + }, + "end_effector_rotation": { + "max": [ + 1.0, + 1.0, + 1.0 + ], + "min": [ + -1.0, + -1.0, + -1.0 + ], + "mean": [ + 0.007644157504353809, + -0.019962543093886335, + -0.002047110452602617 + ], + "std": [ + 0.11076012154791087, + 0.13176735140285795, + 0.12286528665895614 + ], + "q01": [ + -0.2659105439401192, + -0.3961694033813533, + -0.3434870832468936 + ], + "q99": [ + 0.3145786959266369, + 0.31309430361227547, + 0.34107754401942986 + ] + }, + "gripper_close": { + "max": [ + 1.0 + ], + "min": [ + -1.0 + ], + "mean": [ + -0.29870612267533575 + ], + "std": [ + 0.9543487555375691 + ], + "q01": [ + -1.0 + ], + "q99": [ + 0.7610674802484976 + ] + } + } + }, + "modalities": { + "video": { + "robot0_eye_in_hand": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_left": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + }, + "robot0_agentview_right": { + "resolution": [ + 256, + 256 + ], + "channels": 3, + "fps": 20.0 + } + }, + "state": { + "base_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "base_rotation": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "end_effector_position_relative": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation_relative": { + "absolute": true, + "rotation_type": "quaternion", + "shape": [ + 4 + ], + "continuous": true + }, + "gripper_qpos": { + "absolute": true, + "rotation_type": null, + "shape": [ + 2 + ], + "continuous": true + } + }, + "action": { + "base_motion": { + "absolute": true, + "rotation_type": null, + "shape": [ + 4 + ], + "continuous": true + }, + "control_mode": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + }, + "end_effector_position": { + "absolute": true, + "rotation_type": null, + "shape": [ + 3 + ], + "continuous": true + }, + "end_effector_rotation": { + "absolute": true, + "rotation_type": "axis_angle", + "shape": [ + 3 + ], + "continuous": true + }, + "gripper_close": { + "absolute": true, + "rotation_type": null, + "shape": [ + 1 + ], + "continuous": true + } + } + }, + "embodiment_tag": "new_embodiment" + } +} \ No newline at end of file diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/config.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/config.json new file mode 100644 index 0000000000000000000000000000000000000000..47d7b77e4255263f3803a4b6f94ca6831e459b70 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/config.json @@ -0,0 +1,64 @@ +{ + "action_dim": 32, + "action_head_cfg": { + "action_dim": 32, + "action_horizon": 16, + "add_pos_embed": true, + "backbone_embedding_dim": 2048, + "diffusion_model_cfg": { + "attention_head_dim": 48, + "cross_attention_dim": 2048, + "dropout": 0.2, + "final_dropout": true, + "interleave_self_attention": true, + "norm_type": "ada_norm", + "num_attention_heads": 32, + "num_layers": 16, + "output_dim": 1024, + "positional_embeddings": null + }, + "hidden_size": 1024, + "input_embedding_dim": 1536, + "max_action_dim": 32, + "max_state_dim": 64, + "model_dtype": "float32", + "noise_beta_alpha": 1.5, + "noise_beta_beta": 1.0, + "noise_s": 0.999, + "num_inference_timesteps": 4, + "num_target_vision_tokens": 32, + "num_timestep_buckets": 1000, + "tune_diffusion_model": true, + "tune_projector": true, + "use_vlln": true, + "vl_self_attention_cfg": { + "attention_head_dim": 64, + "dropout": 0.2, + "final_dropout": true, + "num_attention_heads": 32, + "num_layers": 4, + "positional_embeddings": null + } + }, + "action_horizon": 16, + "architectures": [ + "GR00T_N1_5" + ], + "attn_implementation": null, + "backbone_cfg": { + "eagle_path": "NVEagle/eagle_er-qwen3_1_7B-Siglip2_400M_stage1_5_128gpu_er_v7_1mlp_nops", + "load_bf16": false, + "project_to_dim": null, + "reproject_vision": false, + "select_layer": 12, + "tune_llm": false, + "tune_visual": true, + "use_flash_attention": true + }, + "compute_dtype": "bfloat16", + "hidden_size": 2048, + "model_dtype": "float32", + "model_type": "gr00t_n1_5", + "torch_dtype": "bfloat16", + "transformers_version": "4.51.3" +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b834db9bc88251b04230218b1d9c2ce4079b7699 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6609af3d3bd3bf14cadbe66a91687968c154549621c5df35b9966992f230416a +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..43937b9dd79ce741b4d88eccb00e0bee61808def --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:69171ad5963fab0bd3f27b20e600d60bafda65d5522e7dbf5c4619528f62628e +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model.safetensors.index.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model.safetensors.index.json new file mode 100644 index 0000000000000000000000000000000000000000..5ef5f247b61eb93e89601c7da8334fc087e19750 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/model.safetensors.index.json @@ -0,0 +1,906 @@ +{ + "metadata": { + "total_size": 7585939328 + }, + "weight_map": { + "action_head.action_decoder.layer1.W": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer1.b": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer2.W": "model-00002-of-00002.safetensors", + "action_head.action_decoder.layer2.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W1.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W1.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W2.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W2.b": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W3.W": "model-00002-of-00002.safetensors", + "action_head.action_encoder.W3.b": "model-00002-of-00002.safetensors", + "action_head.future_tokens.weight": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_1.bias": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_1.weight": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_2.bias": "model-00002-of-00002.safetensors", + "action_head.model.proj_out_2.weight": "model-00002-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_1.bias": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_1.weight": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_2.bias": "model-00001-of-00002.safetensors", + "action_head.model.timestep_encoder.timestep_embedder.linear_2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.0.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.1.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.10.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.11.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.12.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.12.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.13.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.14.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.norm1.linear.bias": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.15.norm1.linear.weight": "model-00002-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.2.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.3.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.4.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.5.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.6.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.7.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.8.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_k.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_k.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_out.0.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_out.0.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_q.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_q.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_v.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.attn1.to_v.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.0.proj.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.0.proj.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.2.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.ff.net.2.weight": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.norm1.linear.bias": "model-00001-of-00002.safetensors", + "action_head.model.transformer_blocks.9.norm1.linear.weight": "model-00001-of-00002.safetensors", + "action_head.position_embedding.weight": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer1.W": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer1.b": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer2.W": "model-00002-of-00002.safetensors", + "action_head.state_encoder.layer2.b": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.0.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.1.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.2.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_k.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_k.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_out.0.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_out.0.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_q.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_q.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_v.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.attn1.to_v.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.0.proj.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.0.proj.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.2.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.ff.net.2.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm1.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm1.weight": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm3.bias": "model-00002-of-00002.safetensors", + "action_head.vl_self_attention.transformer_blocks.3.norm3.weight": "model-00002-of-00002.safetensors", + "action_head.vlln.bias": "model-00002-of-00002.safetensors", + "action_head.vlln.weight": "model-00002-of-00002.safetensors", + "backbone.eagle_model.language_model.lm_head.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.language_model.model.norm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.mlp1.0.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.mlp1.0.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.patch_embedding.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.patch_embedding.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.embeddings.position_embedding.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.layer_norm2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.encoder.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.in_proj_bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.in_proj_weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.out_proj.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.attention.out_proj.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.layernorm.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.layernorm.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc1.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc1.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc2.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.mlp.fc2.weight": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.head.probe": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.post_layernorm.bias": "model-00001-of-00002.safetensors", + "backbone.eagle_model.vision_model.vision_model.post_layernorm.weight": "model-00001-of-00002.safetensors" + } +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..a51ac33d9d811ec399ae16cfc6fc02c91f20fc0e --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3e5ea787a79065bd33196ddfc4a157aadd4974fe449cec2f580e807e4a9a2600 +size 8550719959 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..a6309a815f0af96226d8a23de429f2deb60fd680 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e3b5547f9bceb2f4c2f2444aef8721d4c47e59d74bc07eb896351aab894daa96 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..cddb85352b4d053450624108786800cbad81d6cb --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e19ead5779e3f8f2f666b7793de3a03d118f57f1b16a97eeb87bd732d18b445 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3dc131ad0b2f6f09a4096306884ede3ade3e7050 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:47267e3f9c5a3cc4eff7aa426660c1ccc906d211cac5b9561adc60dc7b62d4d5 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..fa351abfbba4e5e926c6a71145a5a3b66f0fefb9 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:940b04c26d7de74a2e8db252b7ce90fac13dc3f4eb65005d3a43947ae267fcae +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..aa300cc2402e4cb5ebe635a81f0843d0baa46040 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:64f3ef76c50e1cd0a2c91e4863b114c43241cc2cd478c6560d32cdc2ca6b23b8 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..de4e41c4a6949df056e028b10a18e7f8cd7b7580 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42d8e6d8e53e6b837084d0cc18fdd63ca9e40bd44a65d38eb52695647a8e84e8 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/trainer_state.json b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c1adae4ed5f308fdbffc2e98b3bbe1f8bf0db6e0 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_FullactionHead_5k/seed2/default/train_5shot_seed2_fullactionhead_5k/checkpoint-3000/trainer_state.json @@ -0,0 +1,2134 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.128205128205128, + "eval_steps": 500, + "global_step": 3000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.017094017094017096, + "grad_norm": 1.2046294212341309, + "learning_rate": 1.08e-06, + "loss": 0.2224, + "step": 10 + }, + { + "epoch": 0.03418803418803419, + "grad_norm": 1.3672140836715698, + "learning_rate": 2.28e-06, + "loss": 0.2037, + "step": 20 + }, + { + "epoch": 0.05128205128205128, + "grad_norm": 1.2484416961669922, + "learning_rate": 3.48e-06, + "loss": 0.193, + "step": 30 + }, + { + "epoch": 0.06837606837606838, + "grad_norm": 0.7811980247497559, + "learning_rate": 4.68e-06, + "loss": 0.158, + "step": 40 + }, + { + "epoch": 0.08547008547008547, + "grad_norm": 1.1057628393173218, + "learning_rate": 5.8800000000000005e-06, + "loss": 0.1518, + "step": 50 + }, + { + "epoch": 0.10256410256410256, + "grad_norm": 0.6198669672012329, + "learning_rate": 7.08e-06, + "loss": 0.1235, + "step": 60 + }, + { + "epoch": 0.11965811965811966, + "grad_norm": 0.6399325728416443, + "learning_rate": 8.28e-06, + "loss": 0.1012, + "step": 70 + }, + { + "epoch": 0.13675213675213677, + "grad_norm": 0.34900981187820435, + "learning_rate": 9.48e-06, + "loss": 0.0894, + "step": 80 + }, + { + "epoch": 0.15384615384615385, + "grad_norm": 0.24374151229858398, + "learning_rate": 1.068e-05, + "loss": 0.0847, + "step": 90 + }, + { + "epoch": 0.17094017094017094, + "grad_norm": 0.3181402087211609, + "learning_rate": 1.1880000000000001e-05, + "loss": 0.076, + "step": 100 + }, + { + "epoch": 0.18803418803418803, + "grad_norm": 0.3558669984340668, + "learning_rate": 1.308e-05, + "loss": 0.0756, + "step": 110 + }, + { + "epoch": 0.20512820512820512, + "grad_norm": 0.25770920515060425, + "learning_rate": 1.428e-05, + "loss": 0.0678, + "step": 120 + }, + { + "epoch": 0.2222222222222222, + "grad_norm": 0.3094629645347595, + "learning_rate": 1.548e-05, + "loss": 0.0656, + "step": 130 + }, + { + "epoch": 0.23931623931623933, + "grad_norm": 0.31149178743362427, + "learning_rate": 1.6680000000000003e-05, + "loss": 0.0661, + "step": 140 + }, + { + "epoch": 0.2564102564102564, + "grad_norm": 0.28312113881111145, + "learning_rate": 1.7879999999999998e-05, + "loss": 0.0644, + "step": 150 + }, + { + "epoch": 0.27350427350427353, + "grad_norm": 0.32937219738960266, + "learning_rate": 1.908e-05, + "loss": 0.0634, + "step": 160 + }, + { + "epoch": 0.2905982905982906, + "grad_norm": 0.24805986881256104, + "learning_rate": 2.0280000000000002e-05, + "loss": 0.0604, + "step": 170 + }, + { + "epoch": 0.3076923076923077, + "grad_norm": 0.3144904673099518, + "learning_rate": 2.148e-05, + "loss": 0.0559, + "step": 180 + }, + { + "epoch": 0.3247863247863248, + "grad_norm": 0.22721275687217712, + "learning_rate": 2.268e-05, + "loss": 0.0559, + "step": 190 + }, + { + "epoch": 0.3418803418803419, + "grad_norm": 0.24481946229934692, + "learning_rate": 2.3880000000000002e-05, + "loss": 0.0563, + "step": 200 + }, + { + "epoch": 0.358974358974359, + "grad_norm": 0.29072335362434387, + "learning_rate": 2.508e-05, + "loss": 0.0543, + "step": 210 + }, + { + "epoch": 0.37606837606837606, + "grad_norm": 0.2773635983467102, + "learning_rate": 2.628e-05, + "loss": 0.0533, + "step": 220 + }, + { + "epoch": 0.39316239316239315, + "grad_norm": 0.28752514719963074, + "learning_rate": 2.748e-05, + "loss": 0.0531, + "step": 230 + }, + { + "epoch": 0.41025641025641024, + "grad_norm": 0.2401578277349472, + "learning_rate": 2.868e-05, + "loss": 0.0543, + "step": 240 + }, + { + "epoch": 0.42735042735042733, + "grad_norm": 0.22457115352153778, + "learning_rate": 2.9880000000000002e-05, + "loss": 0.0498, + "step": 250 + }, + { + "epoch": 0.4444444444444444, + "grad_norm": 0.22619064152240753, + "learning_rate": 2.9999734259635676e-05, + "loss": 0.0495, + "step": 260 + }, + { + "epoch": 0.46153846153846156, + "grad_norm": 0.23179255425930023, + "learning_rate": 2.9998815663057245e-05, + "loss": 0.0463, + "step": 270 + }, + { + "epoch": 0.47863247863247865, + "grad_norm": 0.23389773070812225, + "learning_rate": 2.999724096969228e-05, + "loss": 0.0476, + "step": 280 + }, + { + "epoch": 0.49572649572649574, + "grad_norm": 0.24128898978233337, + "learning_rate": 2.9995010248422984e-05, + "loss": 0.0437, + "step": 290 + }, + { + "epoch": 0.5128205128205128, + "grad_norm": 0.2507748007774353, + "learning_rate": 2.999212359682832e-05, + "loss": 0.0474, + "step": 300 + }, + { + "epoch": 0.5299145299145299, + "grad_norm": 0.21490685641765594, + "learning_rate": 2.9988581141179787e-05, + "loss": 0.0434, + "step": 310 + }, + { + "epoch": 0.5470085470085471, + "grad_norm": 0.22923023998737335, + "learning_rate": 2.998438303643587e-05, + "loss": 0.044, + "step": 320 + }, + { + "epoch": 0.5641025641025641, + "grad_norm": 0.22642545402050018, + "learning_rate": 2.997952946623527e-05, + "loss": 0.0429, + "step": 330 + }, + { + "epoch": 0.5811965811965812, + "grad_norm": 0.221108540892601, + "learning_rate": 2.9974020642888875e-05, + "loss": 0.0465, + "step": 340 + }, + { + "epoch": 0.5982905982905983, + "grad_norm": 0.19173994660377502, + "learning_rate": 2.9967856807370458e-05, + "loss": 0.0433, + "step": 350 + }, + { + "epoch": 0.6153846153846154, + "grad_norm": 0.2417234629392624, + "learning_rate": 2.996103822930615e-05, + "loss": 0.0418, + "step": 360 + }, + { + "epoch": 0.6324786324786325, + "grad_norm": 0.22277653217315674, + "learning_rate": 2.9953565206962653e-05, + "loss": 0.0388, + "step": 370 + }, + { + "epoch": 0.6495726495726496, + "grad_norm": 0.16107745468616486, + "learning_rate": 2.9945438067234172e-05, + "loss": 0.0382, + "step": 380 + }, + { + "epoch": 0.6666666666666666, + "grad_norm": 0.15353648364543915, + "learning_rate": 2.9936657165628124e-05, + "loss": 0.0406, + "step": 390 + }, + { + "epoch": 0.6837606837606838, + "grad_norm": 0.18034681677818298, + "learning_rate": 2.992722288624959e-05, + "loss": 0.0415, + "step": 400 + }, + { + "epoch": 0.7008547008547008, + "grad_norm": 0.23336061835289001, + "learning_rate": 2.9917135641784515e-05, + "loss": 0.0414, + "step": 410 + }, + { + "epoch": 0.717948717948718, + "grad_norm": 0.19218440353870392, + "learning_rate": 2.9906395873481655e-05, + "loss": 0.0392, + "step": 420 + }, + { + "epoch": 0.7350427350427351, + "grad_norm": 0.22765028476715088, + "learning_rate": 2.989500405113326e-05, + "loss": 0.0403, + "step": 430 + }, + { + "epoch": 0.7521367521367521, + "grad_norm": 0.20929336547851562, + "learning_rate": 2.9882960673054547e-05, + "loss": 0.0369, + "step": 440 + }, + { + "epoch": 0.7692307692307693, + "grad_norm": 0.17191247642040253, + "learning_rate": 2.9870266266061886e-05, + "loss": 0.0354, + "step": 450 + }, + { + "epoch": 0.7863247863247863, + "grad_norm": 0.2489067018032074, + "learning_rate": 2.9856921385449766e-05, + "loss": 0.0365, + "step": 460 + }, + { + "epoch": 0.8034188034188035, + "grad_norm": 0.25272417068481445, + "learning_rate": 2.9842926614966502e-05, + "loss": 0.0385, + "step": 470 + }, + { + "epoch": 0.8205128205128205, + "grad_norm": 0.19717201590538025, + "learning_rate": 2.982828256678868e-05, + "loss": 0.0339, + "step": 480 + }, + { + "epoch": 0.8376068376068376, + "grad_norm": 0.25095418095588684, + "learning_rate": 2.9812989881494412e-05, + "loss": 0.0352, + "step": 490 + }, + { + "epoch": 0.8547008547008547, + "grad_norm": 0.2102588564157486, + "learning_rate": 2.9797049228035296e-05, + "loss": 0.0369, + "step": 500 + }, + { + "epoch": 0.8717948717948718, + "grad_norm": 0.20112262666225433, + "learning_rate": 2.978046130370715e-05, + "loss": 0.0326, + "step": 510 + }, + { + "epoch": 0.8888888888888888, + "grad_norm": 0.19247573614120483, + "learning_rate": 2.9763226834119535e-05, + "loss": 0.0362, + "step": 520 + }, + { + "epoch": 0.905982905982906, + "grad_norm": 0.21424508094787598, + "learning_rate": 2.9745346573163963e-05, + "loss": 0.0359, + "step": 530 + }, + { + "epoch": 0.9230769230769231, + "grad_norm": 0.26557332277297974, + "learning_rate": 2.9726821302980987e-05, + "loss": 0.0345, + "step": 540 + }, + { + "epoch": 0.9401709401709402, + "grad_norm": 0.19497093558311462, + "learning_rate": 2.9707651833925935e-05, + "loss": 0.0298, + "step": 550 + }, + { + "epoch": 0.9572649572649573, + "grad_norm": 0.17632479965686798, + "learning_rate": 2.968783900453348e-05, + "loss": 0.0333, + "step": 560 + }, + { + "epoch": 0.9743589743589743, + "grad_norm": 0.2774340808391571, + "learning_rate": 2.9667383681480968e-05, + "loss": 0.0351, + "step": 570 + }, + { + "epoch": 0.9914529914529915, + "grad_norm": 0.17489512264728546, + "learning_rate": 2.9646286759550493e-05, + "loss": 0.0341, + "step": 580 + }, + { + "epoch": 1.0085470085470085, + "grad_norm": 0.18617698550224304, + "learning_rate": 2.9624549161589764e-05, + "loss": 0.031, + "step": 590 + }, + { + "epoch": 1.0256410256410255, + "grad_norm": 0.1862032115459442, + "learning_rate": 2.9602171838471745e-05, + "loss": 0.0327, + "step": 600 + }, + { + "epoch": 1.0427350427350428, + "grad_norm": 0.16319014132022858, + "learning_rate": 2.957915576905303e-05, + "loss": 0.0311, + "step": 610 + }, + { + "epoch": 1.0598290598290598, + "grad_norm": 0.18638090789318085, + "learning_rate": 2.9555501960131058e-05, + "loss": 0.0328, + "step": 620 + }, + { + "epoch": 1.0769230769230769, + "grad_norm": 0.159883052110672, + "learning_rate": 2.9531211446400068e-05, + "loss": 0.0319, + "step": 630 + }, + { + "epoch": 1.0940170940170941, + "grad_norm": 0.17638160288333893, + "learning_rate": 2.9506285290405813e-05, + "loss": 0.0324, + "step": 640 + }, + { + "epoch": 1.1111111111111112, + "grad_norm": 0.17149314284324646, + "learning_rate": 2.948072458249911e-05, + "loss": 0.033, + "step": 650 + }, + { + "epoch": 1.1282051282051282, + "grad_norm": 0.1854614019393921, + "learning_rate": 2.9454530440788125e-05, + "loss": 0.0321, + "step": 660 + }, + { + "epoch": 1.1452991452991452, + "grad_norm": 0.18628022074699402, + "learning_rate": 2.9427704011089474e-05, + "loss": 0.0308, + "step": 670 + }, + { + "epoch": 1.1623931623931625, + "grad_norm": 0.15781794488430023, + "learning_rate": 2.94002464668781e-05, + "loss": 0.0289, + "step": 680 + }, + { + "epoch": 1.1794871794871795, + "grad_norm": 0.18502387404441833, + "learning_rate": 2.9372159009235936e-05, + "loss": 0.0285, + "step": 690 + }, + { + "epoch": 1.1965811965811965, + "grad_norm": 0.13340029120445251, + "learning_rate": 2.9343442866799365e-05, + "loss": 0.03, + "step": 700 + }, + { + "epoch": 1.2136752136752136, + "grad_norm": 0.16018730401992798, + "learning_rate": 2.9314099295705495e-05, + "loss": 0.0283, + "step": 710 + }, + { + "epoch": 1.2307692307692308, + "grad_norm": 0.1523085981607437, + "learning_rate": 2.928412957953718e-05, + "loss": 0.0276, + "step": 720 + }, + { + "epoch": 1.2478632478632479, + "grad_norm": 0.1537986546754837, + "learning_rate": 2.925353502926689e-05, + "loss": 0.0291, + "step": 730 + }, + { + "epoch": 1.264957264957265, + "grad_norm": 0.1516842246055603, + "learning_rate": 2.922231698319937e-05, + "loss": 0.0315, + "step": 740 + }, + { + "epoch": 1.282051282051282, + "grad_norm": 0.1799113154411316, + "learning_rate": 2.9190476806913088e-05, + "loss": 0.03, + "step": 750 + }, + { + "epoch": 1.2991452991452992, + "grad_norm": 0.2539559304714203, + "learning_rate": 2.9158015893200504e-05, + "loss": 0.0288, + "step": 760 + }, + { + "epoch": 1.3162393162393162, + "grad_norm": 0.1597651243209839, + "learning_rate": 2.9124935662007137e-05, + "loss": 0.0303, + "step": 770 + }, + { + "epoch": 1.3333333333333333, + "grad_norm": 0.18849721550941467, + "learning_rate": 2.9091237560369467e-05, + "loss": 0.0295, + "step": 780 + }, + { + "epoch": 1.3504273504273505, + "grad_norm": 0.13707464933395386, + "learning_rate": 2.905692306235163e-05, + "loss": 0.0261, + "step": 790 + }, + { + "epoch": 1.3675213675213675, + "grad_norm": 0.1797618865966797, + "learning_rate": 2.9021993668980925e-05, + "loss": 0.0266, + "step": 800 + }, + { + "epoch": 1.3846153846153846, + "grad_norm": 0.18061158061027527, + "learning_rate": 2.8986450908182185e-05, + "loss": 0.0277, + "step": 810 + }, + { + "epoch": 1.4017094017094016, + "grad_norm": 0.14432664215564728, + "learning_rate": 2.8950296334710902e-05, + "loss": 0.0268, + "step": 820 + }, + { + "epoch": 1.4188034188034189, + "grad_norm": 0.19661664962768555, + "learning_rate": 2.8913531530085248e-05, + "loss": 0.0275, + "step": 830 + }, + { + "epoch": 1.435897435897436, + "grad_norm": 0.16374897956848145, + "learning_rate": 2.887615810251687e-05, + "loss": 0.0272, + "step": 840 + }, + { + "epoch": 1.452991452991453, + "grad_norm": 0.16281157732009888, + "learning_rate": 2.8838177686840577e-05, + "loss": 0.0283, + "step": 850 + }, + { + "epoch": 1.4700854700854702, + "grad_norm": 0.1767149716615677, + "learning_rate": 2.8799591944442776e-05, + "loss": 0.0291, + "step": 860 + }, + { + "epoch": 1.4871794871794872, + "grad_norm": 0.2484145313501358, + "learning_rate": 2.8760402563188848e-05, + "loss": 0.0284, + "step": 870 + }, + { + "epoch": 1.5042735042735043, + "grad_norm": 0.21058519184589386, + "learning_rate": 2.8720611257349285e-05, + "loss": 0.0304, + "step": 880 + }, + { + "epoch": 1.5213675213675213, + "grad_norm": 0.19965742528438568, + "learning_rate": 2.868021976752471e-05, + "loss": 0.028, + "step": 890 + }, + { + "epoch": 1.5384615384615383, + "grad_norm": 0.1859794408082962, + "learning_rate": 2.8639229860569738e-05, + "loss": 0.0292, + "step": 900 + }, + { + "epoch": 1.5555555555555556, + "grad_norm": 0.18770064413547516, + "learning_rate": 2.8597643329515688e-05, + "loss": 0.0264, + "step": 910 + }, + { + "epoch": 1.5726495726495726, + "grad_norm": 0.18467789888381958, + "learning_rate": 2.855546199349214e-05, + "loss": 0.0253, + "step": 920 + }, + { + "epoch": 1.5897435897435899, + "grad_norm": 0.1546042114496231, + "learning_rate": 2.85126876976474e-05, + "loss": 0.0282, + "step": 930 + }, + { + "epoch": 1.606837606837607, + "grad_norm": 0.17473237216472626, + "learning_rate": 2.8469322313067726e-05, + "loss": 0.0262, + "step": 940 + }, + { + "epoch": 1.623931623931624, + "grad_norm": 0.17649267613887787, + "learning_rate": 2.8425367736695522e-05, + "loss": 0.026, + "step": 950 + }, + { + "epoch": 1.641025641025641, + "grad_norm": 0.15947958827018738, + "learning_rate": 2.838082589124636e-05, + "loss": 0.0258, + "step": 960 + }, + { + "epoch": 1.658119658119658, + "grad_norm": 0.18516002595424652, + "learning_rate": 2.8335698725124843e-05, + "loss": 0.0277, + "step": 970 + }, + { + "epoch": 1.6752136752136753, + "grad_norm": 0.1311817169189453, + "learning_rate": 2.8289988212339422e-05, + "loss": 0.0253, + "step": 980 + }, + { + "epoch": 1.6923076923076923, + "grad_norm": 0.18864114582538605, + "learning_rate": 2.8243696352415997e-05, + "loss": 0.03, + "step": 990 + }, + { + "epoch": 1.7094017094017095, + "grad_norm": 0.1583152711391449, + "learning_rate": 2.8196825170310495e-05, + "loss": 0.024, + "step": 1000 + }, + { + "epoch": 1.7264957264957266, + "grad_norm": 0.19438093900680542, + "learning_rate": 2.8149376716320256e-05, + "loss": 0.025, + "step": 1010 + }, + { + "epoch": 1.7435897435897436, + "grad_norm": 0.17569419741630554, + "learning_rate": 2.8101353065994373e-05, + "loss": 0.0299, + "step": 1020 + }, + { + "epoch": 1.7606837606837606, + "grad_norm": 0.1977061629295349, + "learning_rate": 2.8052756320042885e-05, + "loss": 0.0235, + "step": 1030 + }, + { + "epoch": 1.7777777777777777, + "grad_norm": 0.14877791702747345, + "learning_rate": 2.8003588604244893e-05, + "loss": 0.0241, + "step": 1040 + }, + { + "epoch": 1.7948717948717947, + "grad_norm": 0.18093445897102356, + "learning_rate": 2.7953852069355565e-05, + "loss": 0.0215, + "step": 1050 + }, + { + "epoch": 1.811965811965812, + "grad_norm": 0.13836748898029327, + "learning_rate": 2.790354889101206e-05, + "loss": 0.0219, + "step": 1060 + }, + { + "epoch": 1.8290598290598292, + "grad_norm": 0.1955246478319168, + "learning_rate": 2.7852681269638366e-05, + "loss": 0.0262, + "step": 1070 + }, + { + "epoch": 1.8461538461538463, + "grad_norm": 0.13735222816467285, + "learning_rate": 2.780125143034902e-05, + "loss": 0.0234, + "step": 1080 + }, + { + "epoch": 1.8632478632478633, + "grad_norm": 0.20777004957199097, + "learning_rate": 2.7749261622851812e-05, + "loss": 0.0225, + "step": 1090 + }, + { + "epoch": 1.8803418803418803, + "grad_norm": 0.15912115573883057, + "learning_rate": 2.7696714121349335e-05, + "loss": 0.0235, + "step": 1100 + }, + { + "epoch": 1.8974358974358974, + "grad_norm": 0.14222097396850586, + "learning_rate": 2.764361122443954e-05, + "loss": 0.0217, + "step": 1110 + }, + { + "epoch": 1.9145299145299144, + "grad_norm": 0.12735839188098907, + "learning_rate": 2.758995525501517e-05, + "loss": 0.024, + "step": 1120 + }, + { + "epoch": 1.9316239316239316, + "grad_norm": 0.13369329273700714, + "learning_rate": 2.753574856016215e-05, + "loss": 0.0259, + "step": 1130 + }, + { + "epoch": 1.9487179487179487, + "grad_norm": 0.14417479932308197, + "learning_rate": 2.7480993511056913e-05, + "loss": 0.024, + "step": 1140 + }, + { + "epoch": 1.965811965811966, + "grad_norm": 0.13541226089000702, + "learning_rate": 2.7425692502862684e-05, + "loss": 0.021, + "step": 1150 + }, + { + "epoch": 1.982905982905983, + "grad_norm": 0.13426485657691956, + "learning_rate": 2.7369847954624728e-05, + "loss": 0.0249, + "step": 1160 + }, + { + "epoch": 2.0, + "grad_norm": 0.22447210550308228, + "learning_rate": 2.731346230916448e-05, + "loss": 0.0275, + "step": 1170 + }, + { + "epoch": 2.017094017094017, + "grad_norm": 0.1316627860069275, + "learning_rate": 2.7256538032972746e-05, + "loss": 0.0236, + "step": 1180 + }, + { + "epoch": 2.034188034188034, + "grad_norm": 0.1581067442893982, + "learning_rate": 2.7199077616101773e-05, + "loss": 0.0209, + "step": 1190 + }, + { + "epoch": 2.051282051282051, + "grad_norm": 0.1645020693540573, + "learning_rate": 2.714108357205634e-05, + "loss": 0.0254, + "step": 1200 + }, + { + "epoch": 2.0683760683760686, + "grad_norm": 0.15171298384666443, + "learning_rate": 2.7082558437683803e-05, + "loss": 0.0219, + "step": 1210 + }, + { + "epoch": 2.0854700854700856, + "grad_norm": 0.14786364138126373, + "learning_rate": 2.702350477306315e-05, + "loss": 0.0232, + "step": 1220 + }, + { + "epoch": 2.1025641025641026, + "grad_norm": 0.19275642931461334, + "learning_rate": 2.6963925161392963e-05, + "loss": 0.0261, + "step": 1230 + }, + { + "epoch": 2.1196581196581197, + "grad_norm": 0.21039193868637085, + "learning_rate": 2.6903822208878476e-05, + "loss": 0.0237, + "step": 1240 + }, + { + "epoch": 2.1367521367521367, + "grad_norm": 0.1635989099740982, + "learning_rate": 2.6843198544617535e-05, + "loss": 0.024, + "step": 1250 + }, + { + "epoch": 2.1538461538461537, + "grad_norm": 0.14116357266902924, + "learning_rate": 2.6782056820485612e-05, + "loss": 0.0233, + "step": 1260 + }, + { + "epoch": 2.1709401709401708, + "grad_norm": 0.1337611824274063, + "learning_rate": 2.672039971101979e-05, + "loss": 0.0223, + "step": 1270 + }, + { + "epoch": 2.1880341880341883, + "grad_norm": 0.12742610275745392, + "learning_rate": 2.665822991330178e-05, + "loss": 0.0233, + "step": 1280 + }, + { + "epoch": 2.2051282051282053, + "grad_norm": 0.16495631635189056, + "learning_rate": 2.6595550146839934e-05, + "loss": 0.0244, + "step": 1290 + }, + { + "epoch": 2.2222222222222223, + "grad_norm": 0.13133522868156433, + "learning_rate": 2.6532363153450287e-05, + "loss": 0.0236, + "step": 1300 + }, + { + "epoch": 2.2393162393162394, + "grad_norm": 0.11399739980697632, + "learning_rate": 2.6468671697136634e-05, + "loss": 0.0222, + "step": 1310 + }, + { + "epoch": 2.2564102564102564, + "grad_norm": 0.12264499813318253, + "learning_rate": 2.640447856396961e-05, + "loss": 0.0205, + "step": 1320 + }, + { + "epoch": 2.2735042735042734, + "grad_norm": 0.1786639243364334, + "learning_rate": 2.6339786561964805e-05, + "loss": 0.0251, + "step": 1330 + }, + { + "epoch": 2.2905982905982905, + "grad_norm": 0.15574303269386292, + "learning_rate": 2.6274598520959966e-05, + "loss": 0.0226, + "step": 1340 + }, + { + "epoch": 2.3076923076923075, + "grad_norm": 0.15068724751472473, + "learning_rate": 2.6208917292491185e-05, + "loss": 0.0219, + "step": 1350 + }, + { + "epoch": 2.324786324786325, + "grad_norm": 0.16358910501003265, + "learning_rate": 2.6142745749668176e-05, + "loss": 0.0225, + "step": 1360 + }, + { + "epoch": 2.341880341880342, + "grad_norm": 0.21654905378818512, + "learning_rate": 2.607608678704859e-05, + "loss": 0.0232, + "step": 1370 + }, + { + "epoch": 2.358974358974359, + "grad_norm": 0.22834260761737823, + "learning_rate": 2.600894332051139e-05, + "loss": 0.0215, + "step": 1380 + }, + { + "epoch": 2.376068376068376, + "grad_norm": 0.17436617612838745, + "learning_rate": 2.594131828712932e-05, + "loss": 0.0217, + "step": 1390 + }, + { + "epoch": 2.393162393162393, + "grad_norm": 0.13975125551223755, + "learning_rate": 2.5873214645040414e-05, + "loss": 0.02, + "step": 1400 + }, + { + "epoch": 2.41025641025641, + "grad_norm": 0.18962903320789337, + "learning_rate": 2.5804635373318604e-05, + "loss": 0.0216, + "step": 1410 + }, + { + "epoch": 2.427350427350427, + "grad_norm": 0.1517896205186844, + "learning_rate": 2.57355834718434e-05, + "loss": 0.0221, + "step": 1420 + }, + { + "epoch": 2.4444444444444446, + "grad_norm": 0.1567123383283615, + "learning_rate": 2.566606196116867e-05, + "loss": 0.0218, + "step": 1430 + }, + { + "epoch": 2.4615384615384617, + "grad_norm": 0.2237260341644287, + "learning_rate": 2.559607388239051e-05, + "loss": 0.0205, + "step": 1440 + }, + { + "epoch": 2.4786324786324787, + "grad_norm": 0.1526583880186081, + "learning_rate": 2.552562229701422e-05, + "loss": 0.0215, + "step": 1450 + }, + { + "epoch": 2.4957264957264957, + "grad_norm": 0.14554832875728607, + "learning_rate": 2.545471028682036e-05, + "loss": 0.0235, + "step": 1460 + }, + { + "epoch": 2.5128205128205128, + "grad_norm": 0.14237725734710693, + "learning_rate": 2.538334095373e-05, + "loss": 0.0209, + "step": 1470 + }, + { + "epoch": 2.52991452991453, + "grad_norm": 0.17106768488883972, + "learning_rate": 2.531151741966896e-05, + "loss": 0.0215, + "step": 1480 + }, + { + "epoch": 2.547008547008547, + "grad_norm": 0.12999463081359863, + "learning_rate": 2.5239242826431302e-05, + "loss": 0.0207, + "step": 1490 + }, + { + "epoch": 2.564102564102564, + "grad_norm": 0.23773175477981567, + "learning_rate": 2.5166520335541865e-05, + "loss": 0.0218, + "step": 1500 + }, + { + "epoch": 2.5811965811965814, + "grad_norm": 0.11908961087465286, + "learning_rate": 2.5093353128117996e-05, + "loss": 0.0223, + "step": 1510 + }, + { + "epoch": 2.5982905982905984, + "grad_norm": 0.25520920753479004, + "learning_rate": 2.501974440473037e-05, + "loss": 0.0198, + "step": 1520 + }, + { + "epoch": 2.6153846153846154, + "grad_norm": 0.21974427998065948, + "learning_rate": 2.4945697385263015e-05, + "loss": 0.0223, + "step": 1530 + }, + { + "epoch": 2.6324786324786325, + "grad_norm": 0.1549292355775833, + "learning_rate": 2.487121530877243e-05, + "loss": 0.0208, + "step": 1540 + }, + { + "epoch": 2.6495726495726495, + "grad_norm": 0.17997530102729797, + "learning_rate": 2.4796301433345943e-05, + "loss": 0.0207, + "step": 1550 + }, + { + "epoch": 2.6666666666666665, + "grad_norm": 0.15226222574710846, + "learning_rate": 2.4720959035959148e-05, + "loss": 0.0218, + "step": 1560 + }, + { + "epoch": 2.683760683760684, + "grad_norm": 0.2047930359840393, + "learning_rate": 2.464519141233257e-05, + "loss": 0.0215, + "step": 1570 + }, + { + "epoch": 2.700854700854701, + "grad_norm": 0.16199080646038055, + "learning_rate": 2.456900187678754e-05, + "loss": 0.0214, + "step": 1580 + }, + { + "epoch": 2.717948717948718, + "grad_norm": 0.11895282566547394, + "learning_rate": 2.4492393762101147e-05, + "loss": 0.0202, + "step": 1590 + }, + { + "epoch": 2.735042735042735, + "grad_norm": 0.15882159769535065, + "learning_rate": 2.4415370419360508e-05, + "loss": 0.022, + "step": 1600 + }, + { + "epoch": 2.752136752136752, + "grad_norm": 0.14013583958148956, + "learning_rate": 2.4337935217816157e-05, + "loss": 0.022, + "step": 1610 + }, + { + "epoch": 2.769230769230769, + "grad_norm": 0.20299099385738373, + "learning_rate": 2.4260091544734665e-05, + "loss": 0.0207, + "step": 1620 + }, + { + "epoch": 2.786324786324786, + "grad_norm": 0.21985934674739838, + "learning_rate": 2.4181842805250466e-05, + "loss": 0.0214, + "step": 1630 + }, + { + "epoch": 2.8034188034188032, + "grad_norm": 0.14461225271224976, + "learning_rate": 2.4103192422216923e-05, + "loss": 0.0195, + "step": 1640 + }, + { + "epoch": 2.8205128205128203, + "grad_norm": 0.10911990702152252, + "learning_rate": 2.402414383605658e-05, + "loss": 0.0204, + "step": 1650 + }, + { + "epoch": 2.8376068376068377, + "grad_norm": 0.13800372183322906, + "learning_rate": 2.3944700504610674e-05, + "loss": 0.0192, + "step": 1660 + }, + { + "epoch": 2.8547008547008548, + "grad_norm": 0.14190635085105896, + "learning_rate": 2.3864865902987883e-05, + "loss": 0.0204, + "step": 1670 + }, + { + "epoch": 2.871794871794872, + "grad_norm": 0.14053791761398315, + "learning_rate": 2.378464352341231e-05, + "loss": 0.0199, + "step": 1680 + }, + { + "epoch": 2.888888888888889, + "grad_norm": 0.1504385620355606, + "learning_rate": 2.3704036875070728e-05, + "loss": 0.0233, + "step": 1690 + }, + { + "epoch": 2.905982905982906, + "grad_norm": 0.18149782717227936, + "learning_rate": 2.362304948395906e-05, + "loss": 0.0235, + "step": 1700 + }, + { + "epoch": 2.9230769230769234, + "grad_norm": 0.17068181931972504, + "learning_rate": 2.3541684892728157e-05, + "loss": 0.0212, + "step": 1710 + }, + { + "epoch": 2.9401709401709404, + "grad_norm": 0.1624104231595993, + "learning_rate": 2.345994666052883e-05, + "loss": 0.0177, + "step": 1720 + }, + { + "epoch": 2.9572649572649574, + "grad_norm": 0.19329632818698883, + "learning_rate": 2.337783836285614e-05, + "loss": 0.0214, + "step": 1730 + }, + { + "epoch": 2.9743589743589745, + "grad_norm": 0.13297595083713531, + "learning_rate": 2.3295363591393026e-05, + "loss": 0.0184, + "step": 1740 + }, + { + "epoch": 2.9914529914529915, + "grad_norm": 0.12240353226661682, + "learning_rate": 2.3212525953853174e-05, + "loss": 0.0212, + "step": 1750 + }, + { + "epoch": 3.0085470085470085, + "grad_norm": 0.130058154463768, + "learning_rate": 2.3129329073823206e-05, + "loss": 0.0205, + "step": 1760 + }, + { + "epoch": 3.0256410256410255, + "grad_norm": 0.11880940198898315, + "learning_rate": 2.3045776590604175e-05, + "loss": 0.0193, + "step": 1770 + }, + { + "epoch": 3.0427350427350426, + "grad_norm": 0.12890465557575226, + "learning_rate": 2.296187215905237e-05, + "loss": 0.0212, + "step": 1780 + }, + { + "epoch": 3.0598290598290596, + "grad_norm": 0.1741575449705124, + "learning_rate": 2.2877619449419437e-05, + "loss": 0.0212, + "step": 1790 + }, + { + "epoch": 3.076923076923077, + "grad_norm": 0.1907522976398468, + "learning_rate": 2.2793022147191843e-05, + "loss": 0.0203, + "step": 1800 + }, + { + "epoch": 3.094017094017094, + "grad_norm": 0.17696961760520935, + "learning_rate": 2.2708083952929634e-05, + "loss": 0.0181, + "step": 1810 + }, + { + "epoch": 3.111111111111111, + "grad_norm": 0.1593712717294693, + "learning_rate": 2.2622808582104594e-05, + "loss": 0.0197, + "step": 1820 + }, + { + "epoch": 3.128205128205128, + "grad_norm": 0.12099262326955795, + "learning_rate": 2.2537199764937703e-05, + "loss": 0.0188, + "step": 1830 + }, + { + "epoch": 3.1452991452991452, + "grad_norm": 0.16116322576999664, + "learning_rate": 2.245126124623595e-05, + "loss": 0.0196, + "step": 1840 + }, + { + "epoch": 3.1623931623931623, + "grad_norm": 0.1666380614042282, + "learning_rate": 2.2364996785228547e-05, + "loss": 0.0203, + "step": 1850 + }, + { + "epoch": 3.1794871794871793, + "grad_norm": 0.13607926666736603, + "learning_rate": 2.227841015540248e-05, + "loss": 0.0212, + "step": 1860 + }, + { + "epoch": 3.1965811965811968, + "grad_norm": 0.1656973510980606, + "learning_rate": 2.2191505144337433e-05, + "loss": 0.0195, + "step": 1870 + }, + { + "epoch": 3.213675213675214, + "grad_norm": 0.13743546605110168, + "learning_rate": 2.210428555354013e-05, + "loss": 0.0213, + "step": 1880 + }, + { + "epoch": 3.230769230769231, + "grad_norm": 0.15309397876262665, + "learning_rate": 2.201675519827802e-05, + "loss": 0.0215, + "step": 1890 + }, + { + "epoch": 3.247863247863248, + "grad_norm": 0.13153575360774994, + "learning_rate": 2.1928917907412403e-05, + "loss": 0.0189, + "step": 1900 + }, + { + "epoch": 3.264957264957265, + "grad_norm": 0.16302916407585144, + "learning_rate": 2.1840777523230937e-05, + "loss": 0.0189, + "step": 1910 + }, + { + "epoch": 3.282051282051282, + "grad_norm": 0.12375231087207794, + "learning_rate": 2.1752337901279552e-05, + "loss": 0.021, + "step": 1920 + }, + { + "epoch": 3.299145299145299, + "grad_norm": 0.18395335972309113, + "learning_rate": 2.166360291019383e-05, + "loss": 0.0187, + "step": 1930 + }, + { + "epoch": 3.316239316239316, + "grad_norm": 0.12572312355041504, + "learning_rate": 2.157457643152973e-05, + "loss": 0.0203, + "step": 1940 + }, + { + "epoch": 3.3333333333333335, + "grad_norm": 0.12790457904338837, + "learning_rate": 2.148526235959385e-05, + "loss": 0.0177, + "step": 1950 + }, + { + "epoch": 3.3504273504273505, + "grad_norm": 0.19870531558990479, + "learning_rate": 2.1395664601273016e-05, + "loss": 0.0204, + "step": 1960 + }, + { + "epoch": 3.3675213675213675, + "grad_norm": 0.18182598054409027, + "learning_rate": 2.130578707586345e-05, + "loss": 0.023, + "step": 1970 + }, + { + "epoch": 3.3846153846153846, + "grad_norm": 0.13019001483917236, + "learning_rate": 2.1215633714899264e-05, + "loss": 0.021, + "step": 1980 + }, + { + "epoch": 3.4017094017094016, + "grad_norm": 0.12526895105838776, + "learning_rate": 2.112520846198053e-05, + "loss": 0.0201, + "step": 1990 + }, + { + "epoch": 3.4188034188034186, + "grad_norm": 0.1366206407546997, + "learning_rate": 2.103451527260074e-05, + "loss": 0.0186, + "step": 2000 + }, + { + "epoch": 3.435897435897436, + "grad_norm": 0.13825932145118713, + "learning_rate": 2.094355811397381e-05, + "loss": 0.0193, + "step": 2010 + }, + { + "epoch": 3.452991452991453, + "grad_norm": 0.10611677914857864, + "learning_rate": 2.0852340964860522e-05, + "loss": 0.0203, + "step": 2020 + }, + { + "epoch": 3.47008547008547, + "grad_norm": 0.15153281390666962, + "learning_rate": 2.076086781539447e-05, + "loss": 0.02, + "step": 2030 + }, + { + "epoch": 3.4871794871794872, + "grad_norm": 0.12375279515981674, + "learning_rate": 2.066914266690755e-05, + "loss": 0.0182, + "step": 2040 + }, + { + "epoch": 3.5042735042735043, + "grad_norm": 0.12043378502130508, + "learning_rate": 2.0577169531754906e-05, + "loss": 0.0197, + "step": 2050 + }, + { + "epoch": 3.5213675213675213, + "grad_norm": 0.12067852169275284, + "learning_rate": 2.048495243313942e-05, + "loss": 0.0195, + "step": 2060 + }, + { + "epoch": 3.5384615384615383, + "grad_norm": 0.16918447613716125, + "learning_rate": 2.039249540493572e-05, + "loss": 0.0201, + "step": 2070 + }, + { + "epoch": 3.5555555555555554, + "grad_norm": 0.1681264340877533, + "learning_rate": 2.0299802491513755e-05, + "loss": 0.0172, + "step": 2080 + }, + { + "epoch": 3.5726495726495724, + "grad_norm": 0.14336660504341125, + "learning_rate": 2.0206877747561828e-05, + "loss": 0.0216, + "step": 2090 + }, + { + "epoch": 3.58974358974359, + "grad_norm": 0.15480872988700867, + "learning_rate": 2.011372523790927e-05, + "loss": 0.02, + "step": 2100 + }, + { + "epoch": 3.606837606837607, + "grad_norm": 0.15778888761997223, + "learning_rate": 2.0020349037348643e-05, + "loss": 0.0178, + "step": 2110 + }, + { + "epoch": 3.623931623931624, + "grad_norm": 0.1326507329940796, + "learning_rate": 1.9926753230457443e-05, + "loss": 0.0193, + "step": 2120 + }, + { + "epoch": 3.641025641025641, + "grad_norm": 0.1321679651737213, + "learning_rate": 1.983294191141948e-05, + "loss": 0.0214, + "step": 2130 + }, + { + "epoch": 3.658119658119658, + "grad_norm": 0.12508369982242584, + "learning_rate": 1.973891918384575e-05, + "loss": 0.0167, + "step": 2140 + }, + { + "epoch": 3.6752136752136755, + "grad_norm": 0.17087364196777344, + "learning_rate": 1.9644689160594945e-05, + "loss": 0.0199, + "step": 2150 + }, + { + "epoch": 3.6923076923076925, + "grad_norm": 0.12470774352550507, + "learning_rate": 1.9550255963593553e-05, + "loss": 0.0174, + "step": 2160 + }, + { + "epoch": 3.7094017094017095, + "grad_norm": 0.12396084517240524, + "learning_rate": 1.9455623723655524e-05, + "loss": 0.015, + "step": 2170 + }, + { + "epoch": 3.7264957264957266, + "grad_norm": 0.11109942197799683, + "learning_rate": 1.9360796580301606e-05, + "loss": 0.0177, + "step": 2180 + }, + { + "epoch": 3.7435897435897436, + "grad_norm": 0.12820954620838165, + "learning_rate": 1.9265778681578245e-05, + "loss": 0.0172, + "step": 2190 + }, + { + "epoch": 3.7606837606837606, + "grad_norm": 0.16764280200004578, + "learning_rate": 1.9170574183876143e-05, + "loss": 0.0213, + "step": 2200 + }, + { + "epoch": 3.7777777777777777, + "grad_norm": 0.13727493584156036, + "learning_rate": 1.9075187251748452e-05, + "loss": 0.0202, + "step": 2210 + }, + { + "epoch": 3.7948717948717947, + "grad_norm": 0.1443384438753128, + "learning_rate": 1.8979622057728596e-05, + "loss": 0.0191, + "step": 2220 + }, + { + "epoch": 3.8119658119658117, + "grad_norm": 0.13722945749759674, + "learning_rate": 1.8883882782147748e-05, + "loss": 0.0189, + "step": 2230 + }, + { + "epoch": 3.8290598290598292, + "grad_norm": 0.15205898880958557, + "learning_rate": 1.8787973612951967e-05, + "loss": 0.0178, + "step": 2240 + }, + { + "epoch": 3.8461538461538463, + "grad_norm": 0.1548609435558319, + "learning_rate": 1.8691898745519028e-05, + "loss": 0.0194, + "step": 2250 + }, + { + "epoch": 3.8632478632478633, + "grad_norm": 0.1382390409708023, + "learning_rate": 1.8595662382474863e-05, + "loss": 0.0195, + "step": 2260 + }, + { + "epoch": 3.8803418803418803, + "grad_norm": 0.12302783131599426, + "learning_rate": 1.8499268733509766e-05, + "loss": 0.0187, + "step": 2270 + }, + { + "epoch": 3.8974358974358974, + "grad_norm": 0.1820244938135147, + "learning_rate": 1.84027220151942e-05, + "loss": 0.0165, + "step": 2280 + }, + { + "epoch": 3.9145299145299144, + "grad_norm": 0.1326133906841278, + "learning_rate": 1.83060264507944e-05, + "loss": 0.017, + "step": 2290 + }, + { + "epoch": 3.931623931623932, + "grad_norm": 0.12418877333402634, + "learning_rate": 1.82091862700876e-05, + "loss": 0.0173, + "step": 2300 + }, + { + "epoch": 3.948717948717949, + "grad_norm": 0.12344951182603836, + "learning_rate": 1.8112205709177023e-05, + "loss": 0.0204, + "step": 2310 + }, + { + "epoch": 3.965811965811966, + "grad_norm": 0.20541010797023773, + "learning_rate": 1.8015089010306585e-05, + "loss": 0.0169, + "step": 2320 + }, + { + "epoch": 3.982905982905983, + "grad_norm": 0.20820003747940063, + "learning_rate": 1.7917840421675298e-05, + "loss": 0.0222, + "step": 2330 + }, + { + "epoch": 4.0, + "grad_norm": 0.12587814033031464, + "learning_rate": 1.7820464197251474e-05, + "loss": 0.0168, + "step": 2340 + }, + { + "epoch": 4.017094017094017, + "grad_norm": 0.12032312154769897, + "learning_rate": 1.7722964596586627e-05, + "loss": 0.02, + "step": 2350 + }, + { + "epoch": 4.034188034188034, + "grad_norm": 0.16112498939037323, + "learning_rate": 1.7625345884629144e-05, + "loss": 0.0173, + "step": 2360 + }, + { + "epoch": 4.051282051282051, + "grad_norm": 0.11967416107654572, + "learning_rate": 1.7527612331537722e-05, + "loss": 0.0175, + "step": 2370 + }, + { + "epoch": 4.068376068376068, + "grad_norm": 0.12133967131376266, + "learning_rate": 1.7429768212494593e-05, + "loss": 0.0179, + "step": 2380 + }, + { + "epoch": 4.085470085470085, + "grad_norm": 0.16594752669334412, + "learning_rate": 1.7331817807518497e-05, + "loss": 0.0195, + "step": 2390 + }, + { + "epoch": 4.102564102564102, + "grad_norm": 0.15331916511058807, + "learning_rate": 1.723376540127745e-05, + "loss": 0.0156, + "step": 2400 + }, + { + "epoch": 4.119658119658119, + "grad_norm": 0.13228918612003326, + "learning_rate": 1.7135615282901357e-05, + "loss": 0.0169, + "step": 2410 + }, + { + "epoch": 4.136752136752137, + "grad_norm": 0.13137143850326538, + "learning_rate": 1.7037371745794358e-05, + "loss": 0.0221, + "step": 2420 + }, + { + "epoch": 4.153846153846154, + "grad_norm": 0.1315498948097229, + "learning_rate": 1.6939039087447026e-05, + "loss": 0.0186, + "step": 2430 + }, + { + "epoch": 4.170940170940171, + "grad_norm": 0.1358824223279953, + "learning_rate": 1.6840621609248397e-05, + "loss": 0.0182, + "step": 2440 + }, + { + "epoch": 4.188034188034188, + "grad_norm": 0.13738547265529633, + "learning_rate": 1.6742123616297794e-05, + "loss": 0.0167, + "step": 2450 + }, + { + "epoch": 4.205128205128205, + "grad_norm": 0.12346506863832474, + "learning_rate": 1.664354941721651e-05, + "loss": 0.0162, + "step": 2460 + }, + { + "epoch": 4.222222222222222, + "grad_norm": 0.13007137179374695, + "learning_rate": 1.6544903323959355e-05, + "loss": 0.0166, + "step": 2470 + }, + { + "epoch": 4.239316239316239, + "grad_norm": 0.13907431066036224, + "learning_rate": 1.6446189651626023e-05, + "loss": 0.0174, + "step": 2480 + }, + { + "epoch": 4.256410256410256, + "grad_norm": 0.12497235089540482, + "learning_rate": 1.6347412718272316e-05, + "loss": 0.0193, + "step": 2490 + }, + { + "epoch": 4.273504273504273, + "grad_norm": 0.13083861768245697, + "learning_rate": 1.624857684472131e-05, + "loss": 0.0168, + "step": 2500 + }, + { + "epoch": 4.2905982905982905, + "grad_norm": 0.13517604768276215, + "learning_rate": 1.6149686354374283e-05, + "loss": 0.0197, + "step": 2510 + }, + { + "epoch": 4.3076923076923075, + "grad_norm": 0.15625643730163574, + "learning_rate": 1.605074557302165e-05, + "loss": 0.0177, + "step": 2520 + }, + { + "epoch": 4.3247863247863245, + "grad_norm": 0.20975004136562347, + "learning_rate": 1.59517588286537e-05, + "loss": 0.0189, + "step": 2530 + }, + { + "epoch": 4.3418803418803416, + "grad_norm": 0.16902174055576324, + "learning_rate": 1.5852730451271324e-05, + "loss": 0.0164, + "step": 2540 + }, + { + "epoch": 4.358974358974359, + "grad_norm": 0.14469504356384277, + "learning_rate": 1.5753664772696546e-05, + "loss": 0.0186, + "step": 2550 + }, + { + "epoch": 4.3760683760683765, + "grad_norm": 0.14689213037490845, + "learning_rate": 1.565456612638307e-05, + "loss": 0.0203, + "step": 2560 + }, + { + "epoch": 4.3931623931623935, + "grad_norm": 0.13142313063144684, + "learning_rate": 1.5555438847226732e-05, + "loss": 0.0163, + "step": 2570 + }, + { + "epoch": 4.410256410256411, + "grad_norm": 0.15418632328510284, + "learning_rate": 1.545628727137584e-05, + "loss": 0.0178, + "step": 2580 + }, + { + "epoch": 4.427350427350428, + "grad_norm": 0.15956638753414154, + "learning_rate": 1.535711573604153e-05, + "loss": 0.0144, + "step": 2590 + }, + { + "epoch": 4.444444444444445, + "grad_norm": 0.1449543535709381, + "learning_rate": 1.5257928579308032e-05, + "loss": 0.0177, + "step": 2600 + }, + { + "epoch": 4.461538461538462, + "grad_norm": 0.1384369283914566, + "learning_rate": 1.5158730139942902e-05, + "loss": 0.0174, + "step": 2610 + }, + { + "epoch": 4.478632478632479, + "grad_norm": 0.13507409393787384, + "learning_rate": 1.5059524757207239e-05, + "loss": 0.0173, + "step": 2620 + }, + { + "epoch": 4.495726495726496, + "grad_norm": 0.14348851144313812, + "learning_rate": 1.4960316770665866e-05, + "loss": 0.017, + "step": 2630 + }, + { + "epoch": 4.512820512820513, + "grad_norm": 0.10914012789726257, + "learning_rate": 1.4861110519997495e-05, + "loss": 0.0178, + "step": 2640 + }, + { + "epoch": 4.52991452991453, + "grad_norm": 0.21071846783161163, + "learning_rate": 1.4761910344804913e-05, + "loss": 0.0168, + "step": 2650 + }, + { + "epoch": 4.547008547008547, + "grad_norm": 0.11937859654426575, + "learning_rate": 1.466272058442516e-05, + "loss": 0.0171, + "step": 2660 + }, + { + "epoch": 4.564102564102564, + "grad_norm": 0.09995169937610626, + "learning_rate": 1.4563545577739676e-05, + "loss": 0.0174, + "step": 2670 + }, + { + "epoch": 4.581196581196581, + "grad_norm": 0.1595757007598877, + "learning_rate": 1.4464389662984543e-05, + "loss": 0.0173, + "step": 2680 + }, + { + "epoch": 4.598290598290598, + "grad_norm": 0.13326671719551086, + "learning_rate": 1.4365257177560684e-05, + "loss": 0.0177, + "step": 2690 + }, + { + "epoch": 4.615384615384615, + "grad_norm": 0.1444454789161682, + "learning_rate": 1.426615245784416e-05, + "loss": 0.0166, + "step": 2700 + }, + { + "epoch": 4.632478632478632, + "grad_norm": 0.11446025967597961, + "learning_rate": 1.4167079838996468e-05, + "loss": 0.0151, + "step": 2710 + }, + { + "epoch": 4.64957264957265, + "grad_norm": 0.13881082832813263, + "learning_rate": 1.4068043654774897e-05, + "loss": 0.0155, + "step": 2720 + }, + { + "epoch": 4.666666666666667, + "grad_norm": 0.20510493218898773, + "learning_rate": 1.3969048237342992e-05, + "loss": 0.0185, + "step": 2730 + }, + { + "epoch": 4.683760683760684, + "grad_norm": 0.14961980283260345, + "learning_rate": 1.3870097917081011e-05, + "loss": 0.0166, + "step": 2740 + }, + { + "epoch": 4.700854700854701, + "grad_norm": 0.12033514678478241, + "learning_rate": 1.3771197022396508e-05, + "loss": 0.0146, + "step": 2750 + }, + { + "epoch": 4.717948717948718, + "grad_norm": 0.13812503218650818, + "learning_rate": 1.3672349879535015e-05, + "loss": 0.0172, + "step": 2760 + }, + { + "epoch": 4.735042735042735, + "grad_norm": 0.13671137392520905, + "learning_rate": 1.3573560812390781e-05, + "loss": 0.0177, + "step": 2770 + }, + { + "epoch": 4.752136752136752, + "grad_norm": 0.14928513765335083, + "learning_rate": 1.3474834142317635e-05, + "loss": 0.0142, + "step": 2780 + }, + { + "epoch": 4.769230769230769, + "grad_norm": 0.10949765145778656, + "learning_rate": 1.3376174187939955e-05, + "loss": 0.0161, + "step": 2790 + }, + { + "epoch": 4.786324786324786, + "grad_norm": 0.10777349025011063, + "learning_rate": 1.3277585264963761e-05, + "loss": 0.0168, + "step": 2800 + }, + { + "epoch": 4.803418803418803, + "grad_norm": 0.17750239372253418, + "learning_rate": 1.3179071685987928e-05, + "loss": 0.0182, + "step": 2810 + }, + { + "epoch": 4.82051282051282, + "grad_norm": 0.13401111960411072, + "learning_rate": 1.308063776031554e-05, + "loss": 0.0164, + "step": 2820 + }, + { + "epoch": 4.837606837606837, + "grad_norm": 0.1763419806957245, + "learning_rate": 1.2982287793765389e-05, + "loss": 0.0147, + "step": 2830 + }, + { + "epoch": 4.854700854700854, + "grad_norm": 0.13647712767124176, + "learning_rate": 1.2884026088483616e-05, + "loss": 0.0162, + "step": 2840 + }, + { + "epoch": 4.871794871794872, + "grad_norm": 0.1311454325914383, + "learning_rate": 1.2785856942755543e-05, + "loss": 0.0174, + "step": 2850 + }, + { + "epoch": 4.888888888888889, + "grad_norm": 0.12965312600135803, + "learning_rate": 1.2687784650817616e-05, + "loss": 0.0169, + "step": 2860 + }, + { + "epoch": 4.905982905982906, + "grad_norm": 0.14787934720516205, + "learning_rate": 1.2589813502669603e-05, + "loss": 0.0193, + "step": 2870 + }, + { + "epoch": 4.923076923076923, + "grad_norm": 0.1825832575559616, + "learning_rate": 1.2491947783886907e-05, + "loss": 0.0169, + "step": 2880 + }, + { + "epoch": 4.94017094017094, + "grad_norm": 0.1275591403245926, + "learning_rate": 1.2394191775433106e-05, + "loss": 0.017, + "step": 2890 + }, + { + "epoch": 4.957264957264957, + "grad_norm": 0.12773366272449493, + "learning_rate": 1.2296549753472696e-05, + "loss": 0.0176, + "step": 2900 + }, + { + "epoch": 4.9743589743589745, + "grad_norm": 0.15548300743103027, + "learning_rate": 1.2199025989184032e-05, + "loss": 0.0141, + "step": 2910 + }, + { + "epoch": 4.9914529914529915, + "grad_norm": 0.12168218195438385, + "learning_rate": 1.21016247485725e-05, + "loss": 0.0179, + "step": 2920 + }, + { + "epoch": 5.0085470085470085, + "grad_norm": 0.12161333858966827, + "learning_rate": 1.2004350292283897e-05, + "loss": 0.0171, + "step": 2930 + }, + { + "epoch": 5.0256410256410255, + "grad_norm": 0.2516013979911804, + "learning_rate": 1.1907206875418068e-05, + "loss": 0.0165, + "step": 2940 + }, + { + "epoch": 5.042735042735043, + "grad_norm": 0.16508907079696655, + "learning_rate": 1.1810198747342769e-05, + "loss": 0.0186, + "step": 2950 + }, + { + "epoch": 5.05982905982906, + "grad_norm": 0.09363128989934921, + "learning_rate": 1.1713330151507786e-05, + "loss": 0.0145, + "step": 2960 + }, + { + "epoch": 5.076923076923077, + "grad_norm": 0.1175096333026886, + "learning_rate": 1.161660532525931e-05, + "loss": 0.016, + "step": 2970 + }, + { + "epoch": 5.094017094017094, + "grad_norm": 0.18064428865909576, + "learning_rate": 1.1520028499654584e-05, + "loss": 0.0147, + "step": 2980 + }, + { + "epoch": 5.111111111111111, + "grad_norm": 0.12403568625450134, + "learning_rate": 1.1423603899276833e-05, + "loss": 0.0144, + "step": 2990 + }, + { + "epoch": 5.128205128205128, + "grad_norm": 0.2672509551048279, + "learning_rate": 1.1327335742050442e-05, + "loss": 0.016, + "step": 3000 + } + ], + "logging_steps": 10, + "max_steps": 5000, + "num_input_tokens_seen": 0, + "num_train_epochs": 9, + "save_steps": 5001, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 64, + "trial_name": null, + "trial_params": null +} diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4d7d8c2b55704776186a9207b3175b6c657758e2 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fc9945eca28b94cc6398098b3d2092b0e9731d322853d46197bf3dc7a37a961 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1d93236e4cee0aefeb72f31db126775dbbdfed27 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:31ed3ffe024dd151c65eb826083fb58083fbf503901ac040459c44795fb46581 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..a813454ca4a280691bc14cf0081f796f9a32d972 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e782ba28ffec111c690d45ea5de37d10ecd8f620fb09fe4c2cd13af5b48280cf +size 1611553483 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..7ab2651de11d93cbb7e9297d7dc82bdac5fe7b0a --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0361e2999e6ebf69b5475734034a7149e063bab21bdd95d90fc2dfbb338e183b +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..cddb85352b4d053450624108786800cbad81d6cb --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e19ead5779e3f8f2f666b7793de3a03d118f57f1b16a97eeb87bd732d18b445 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4d7d8c2b55704776186a9207b3175b6c657758e2 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fc9945eca28b94cc6398098b3d2092b0e9731d322853d46197bf3dc7a37a961 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..ad23f822179be016205e24642dd0a21e2f46bd10 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7f1dec183be61a7220ef7fbc977014048a32937727e79c4f53fe87e51f55c501 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..50a07874a062b718e61a6fced19da2cd90cfd79b --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6fab13009f758f13dd77c3e421b19cf2d786fe6cd5f53b4bb933b0fd2b590646 +size 1611553483 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..4292a0bb221a1ccecc95e7643a714422ce410fdc --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:95aba6d3c422dbe8f91558805ce751e5b729ef084ba799ab6c9b4c54fe1909b6 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..de4e41c4a6949df056e028b10a18e7f8cd7b7580 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed0/default/train_5shot_seed0_processingline_5k/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42d8e6d8e53e6b837084d0cc18fdd63ca9e40bd44a65d38eb52695647a8e84e8 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4d7d8c2b55704776186a9207b3175b6c657758e2 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fc9945eca28b94cc6398098b3d2092b0e9731d322853d46197bf3dc7a37a961 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..c5700f81b65ec64f598218188c112ab8f0c0a796 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ea0feb4370ead7ff6a1292f2b5b76b75b9bbf47d41217d0bb9153083155c519c +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..6f51d722f034ef9a3efa3b0f5c43211f0df9a741 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fe8dc32b58c9a7cca09ab98dc8a9496590c91fb253bd427730f5c777947767a5 +size 1611553483 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..c3bc0114e506cb9b7bd95e8569a03664b50c56c1 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:baf069f5fedea3ab3661db622f74100ee36e8720ca863c22f605ab72516e926a +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..cddb85352b4d053450624108786800cbad81d6cb --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e19ead5779e3f8f2f666b7793de3a03d118f57f1b16a97eeb87bd732d18b445 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4d7d8c2b55704776186a9207b3175b6c657758e2 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fc9945eca28b94cc6398098b3d2092b0e9731d322853d46197bf3dc7a37a961 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..17e6e20eea1ca5f20d127c1aabba433dcf0c4530 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:35690d0a7b35fc9bf9994933b5ddd35c3b2ec1277fc08c55c2d5997d4ca60647 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..82229aff5095243e41ef5096beafb9df7b538a01 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cccb383db7888edafa0c3dec43a9ac0c2ced854bafd5c06fbbf2a250221906ff +size 1611553483 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..476a1ba3489c2854c977d6e591eb72947d1b738e --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b563ac52d5d556cd1b95161c1c1ceefc4a5995cfd3578a5353e4cfe503037016 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..de4e41c4a6949df056e028b10a18e7f8cd7b7580 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed1/default/train_5shot_seed1_processingline_5k/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42d8e6d8e53e6b837084d0cc18fdd63ca9e40bd44a65d38eb52695647a8e84e8 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4d7d8c2b55704776186a9207b3175b6c657758e2 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fc9945eca28b94cc6398098b3d2092b0e9731d322853d46197bf3dc7a37a961 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1a255ec2934169841d7b491c663fe09b1a5d8431 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9f64d79fc19cd064e69f42794d11aad798e22e1d595155d41cf4a3c6f532b183 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..b9323e9937811c092d56ba36059494de234c2bcc --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a2e1dab197b74ba01df13da1df784cd2e1749fa73174e996755137c05b3a2b03 +size 1611553483 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..a0f789070535eecbdb1f27ae8fb8dd3481e11162 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:751cde7cc46354adab4f2955eed24efe2246f8098963c9a16d0191890b358db6 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..cddb85352b4d053450624108786800cbad81d6cb --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-1000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e19ead5779e3f8f2f666b7793de3a03d118f57f1b16a97eeb87bd732d18b445 +size 1465 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4d7d8c2b55704776186a9207b3175b6c657758e2 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9fc9945eca28b94cc6398098b3d2092b0e9731d322853d46197bf3dc7a37a961 +size 4999367032 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3b1ebf8749966ed46a543d00865f059dd35bc7af --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6914ee9b43e3b405e401a7da867162165936d13b585abe7e5ccde2e020e577f0 +size 2586705312 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/optimizer.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..c66adba49194e213fbd78dca3c6ad1e24530a016 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7ba9070ee51f235c622f059766b1362feb11f41cb1892540abd39a69f923256f +size 1611553483 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/rng_state.pth b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..b31a765d3f88382c24966eca6ea9ef1e468749bd --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a77424afdeb2eef2c3455112a627a61db42a05fbbe5a95409ea0d24fd5986784 +size 14645 diff --git a/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/scheduler.pt b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..de4e41c4a6949df056e028b10a18e7f8cd7b7580 --- /dev/null +++ b/FewShot/39tasks/5shot/FromBaseline26_Processingline_5k/seed2/default/train_5shot_seed2_processingline_5k/checkpoint-3000/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:42d8e6d8e53e6b837084d0cc18fdd63ca9e40bd44a65d38eb52695647a8e84e8 +size 1465