classicmaster commited on
Commit
c256ccf
·
verified ·
1 Parent(s): d49ac64

Upload folder using huggingface_hub

Browse files
checkpoint-step-400/adapter_config.json CHANGED
@@ -34,13 +34,13 @@
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
37
- "up_proj",
38
- "down_proj",
39
  "gate_proj",
40
- "q_proj",
41
  "k_proj",
 
 
42
  "o_proj",
43
- "v_proj"
 
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
 
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
 
 
37
  "gate_proj",
 
38
  "k_proj",
39
+ "v_proj",
40
+ "down_proj",
41
  "o_proj",
42
+ "up_proj",
43
+ "q_proj"
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
checkpoint-step-400/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:922b6d5903270b4140fe04520bf87d296e0f830c4926c135ea7c408bea27a85d
3
  size 239536272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3cc9b2482c9b9d897229fa4d79799dd0c56f5758f5dc3b876924b902d28a4155
3
  size 239536272
checkpoint-step-400/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c68746d085882a73d44f039e63800dc17292b2318427c454274fc423c6ab75f2
3
  size 122203333
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d986517448d7aecb6fa58d482e334cbe73e194802d364ff25fffe361592ac4ed
3
  size 122203333
checkpoint-step-400/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:232aaf53450a9a142256e42b5eeb426498e782a3d459e18ba17af0155f722be4
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bc7d2691dc1aea11c26d9c01835daff5aa07675dcf61d839b13fd431caad08da
3
  size 1465
checkpoint-step-400/trainer_state.json CHANGED
@@ -1,6 +1,6 @@
1
  {
2
  "best_global_step": 400,
3
- "best_metric": 0.9693769812583923,
4
  "best_model_checkpoint": "./outputs/checkpoint-400",
5
  "epoch": 0.7518796992481203,
6
  "eval_steps": 100,
@@ -18,90 +18,90 @@
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
- "grad_norm": 0.8309985995292664,
22
- "learning_rate": 9.907020872865275e-05,
23
- "loss": 0.775905990600586,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
- "eval_loss": 0.9841089248657227,
29
- "eval_runtime": 71.1499,
30
- "eval_samples_per_second": 6.648,
31
- "eval_steps_per_second": 1.673,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
- "grad_norm": 1.0482571125030518,
37
- "learning_rate": 9.81214421252372e-05,
38
- "loss": 0.7683392333984375,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
- "grad_norm": 0.8791717290878296,
44
- "learning_rate": 9.717267552182164e-05,
45
- "loss": 0.7416677856445313,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
- "eval_loss": 0.9950897097587585,
51
- "eval_runtime": 70.4425,
52
- "eval_samples_per_second": 6.715,
53
- "eval_steps_per_second": 1.689,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
- "grad_norm": 0.912263035774231,
59
- "learning_rate": 9.622390891840608e-05,
60
- "loss": 0.7662993621826172,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
- "grad_norm": 0.8556099534034729,
66
- "learning_rate": 9.527514231499052e-05,
67
- "loss": 0.720741195678711,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
- "eval_loss": 0.9841504693031311,
73
- "eval_runtime": 70.3252,
74
- "eval_samples_per_second": 6.726,
75
- "eval_steps_per_second": 1.692,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
- "grad_norm": 0.8402419686317444,
81
- "learning_rate": 9.432637571157496e-05,
82
- "loss": 0.7455893707275391,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
- "grad_norm": 0.8201877474784851,
88
- "learning_rate": 9.337760910815939e-05,
89
- "loss": 0.7341905975341797,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
- "eval_loss": 0.9693769812583923,
95
- "eval_runtime": 70.2206,
96
- "eval_samples_per_second": 6.736,
97
- "eval_steps_per_second": 1.695,
98
  "step": 400
99
  }
100
  ],
101
  "logging_steps": 50,
102
- "max_steps": 5320,
103
  "num_input_tokens_seen": 0,
104
- "num_train_epochs": 10,
105
  "save_steps": 100,
106
  "stateful_callbacks": {
107
  "TrainerControl": {
 
1
  {
2
  "best_global_step": 400,
3
+ "best_metric": 0.9676186442375183,
4
  "best_model_checkpoint": "./outputs/checkpoint-400",
5
  "epoch": 0.7518796992481203,
6
  "eval_steps": 100,
 
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
+ "grad_norm": 0.8308438062667847,
22
+ "learning_rate": 9.683053040103493e-05,
23
+ "loss": 0.7757094573974609,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
+ "eval_loss": 0.9840108752250671,
29
+ "eval_runtime": 81.3507,
30
+ "eval_samples_per_second": 5.814,
31
+ "eval_steps_per_second": 1.463,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
+ "grad_norm": 1.0474584102630615,
37
+ "learning_rate": 9.359637774902976e-05,
38
+ "loss": 0.7674188995361328,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
+ "grad_norm": 0.8780233860015869,
44
+ "learning_rate": 9.036222509702458e-05,
45
+ "loss": 0.7395731353759766,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
+ "eval_loss": 0.9940316081047058,
51
+ "eval_runtime": 80.2928,
52
+ "eval_samples_per_second": 5.891,
53
+ "eval_steps_per_second": 1.482,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
+ "grad_norm": 0.9176077246665955,
59
+ "learning_rate": 8.712807244501941e-05,
60
+ "loss": 0.7627955627441406,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
+ "grad_norm": 0.8625491857528687,
66
+ "learning_rate": 8.389391979301423e-05,
67
+ "loss": 0.7164928436279296,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
+ "eval_loss": 0.9823606014251709,
73
+ "eval_runtime": 80.8571,
74
+ "eval_samples_per_second": 5.85,
75
+ "eval_steps_per_second": 1.472,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
+ "grad_norm": 0.8384292125701904,
81
+ "learning_rate": 8.065976714100906e-05,
82
+ "loss": 0.73987548828125,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
+ "grad_norm": 0.8384448885917664,
88
+ "learning_rate": 7.742561448900388e-05,
89
+ "loss": 0.7277918243408203,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
+ "eval_loss": 0.9676186442375183,
95
+ "eval_runtime": 80.4443,
96
+ "eval_samples_per_second": 5.88,
97
+ "eval_steps_per_second": 1.479,
98
  "step": 400
99
  }
100
  ],
101
  "logging_steps": 50,
102
+ "max_steps": 1596,
103
  "num_input_tokens_seen": 0,
104
+ "num_train_epochs": 3,
105
  "save_steps": 100,
106
  "stateful_callbacks": {
107
  "TrainerControl": {
checkpoint-step-400/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bc05806d2c86681ef6c541c75942126f28b3a31aec0d903899ed9bf1ea303bac
3
  size 5713
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3c88f5ec73ab38f2f0a5bb321f3c58aaa6f716ae0e803b69ff493f9e0c43f221
3
  size 5713