classicmaster commited on
Commit
50a710a
·
verified ·
1 Parent(s): bfa7d1c

Upload folder using huggingface_hub

Browse files
checkpoint-step-600/adapter_config.json CHANGED
@@ -34,13 +34,13 @@
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
 
 
37
  "v_proj",
38
  "down_proj",
39
  "o_proj",
40
- "q_proj",
41
  "up_proj",
42
- "gate_proj",
43
- "k_proj"
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
 
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
37
+ "gate_proj",
38
+ "k_proj",
39
  "v_proj",
40
  "down_proj",
41
  "o_proj",
 
42
  "up_proj",
43
+ "q_proj"
 
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
checkpoint-step-600/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9c9869441fd2f7e8ac506b5f55faccfdfb3fa284dfb3c8a77a2daa2f7b5f8839
3
  size 239536272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d8c05f8f4e9464f596a1753b17069f3185cff0de8618547f58c63f971c68273b
3
  size 239536272
checkpoint-step-600/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f446e68afff686ef2e85f58d6d5c199f1a5a7091c68e86c830b68ac899d6886b
3
  size 122203333
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:91a1b845d789d575a9441834a795ae47881f3db8e349b6dc32d2f84b00829870
3
  size 122203333
checkpoint-step-600/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ae5898787f0eb25b365137197ce051b5cd7985234fa44acd1e59c2fb61991c21
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cc973964a1b589b59ccf953e4607975c8533120e360a6db02644fd326af78821
3
  size 1465
checkpoint-step-600/tokenizer_config.json CHANGED
@@ -5,7 +5,7 @@
5
  "clean_up_tokenization_spaces": false,
6
  "eos_token": "<|endoftext|>",
7
  "errors": "replace",
8
- "is_local": false,
9
  "model_max_length": 32768,
10
  "pad_token": "<|PAD_TOKEN|>",
11
  "padding_side": "right",
 
5
  "clean_up_tokenization_spaces": false,
6
  "eos_token": "<|endoftext|>",
7
  "errors": "replace",
8
+ "is_local": true,
9
  "model_max_length": 32768,
10
  "pad_token": "<|PAD_TOKEN|>",
11
  "padding_side": "right",
checkpoint-step-600/trainer_state.json CHANGED
@@ -1,7 +1,7 @@
1
  {
2
- "best_global_step": 600,
3
- "best_metric": 1.0402475595474243,
4
- "best_model_checkpoint": "./outputs/checkpoint-600",
5
  "epoch": 1.1278195488721805,
6
  "eval_steps": 100,
7
  "global_step": 600,
@@ -11,141 +11,141 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.09398496240601503,
14
- "grad_norm": 0.49556756019592285,
15
  "learning_rate": 9.8e-05,
16
- "loss": 1.8540109252929688,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
- "grad_norm": 0.4922962486743927,
22
- "learning_rate": 9.907020872865275e-05,
23
- "loss": 1.2944253540039063,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
- "eval_loss": 1.216850757598877,
29
- "eval_runtime": 83.4733,
30
- "eval_samples_per_second": 5.666,
31
- "eval_steps_per_second": 1.426,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
- "grad_norm": 0.5891006588935852,
37
- "learning_rate": 9.81214421252372e-05,
38
- "loss": 1.2092308807373047,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
- "grad_norm": 0.5563158392906189,
44
- "learning_rate": 9.717267552182164e-05,
45
- "loss": 1.1433011627197265,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
- "eval_loss": 1.1367270946502686,
51
- "eval_runtime": 82.9022,
52
- "eval_samples_per_second": 5.706,
53
- "eval_steps_per_second": 1.435,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
- "grad_norm": 0.5556582808494568,
59
- "learning_rate": 9.622390891840608e-05,
60
- "loss": 1.1522552490234375,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
- "grad_norm": 0.5758287906646729,
66
- "learning_rate": 9.527514231499052e-05,
67
- "loss": 1.0814830780029296,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
- "eval_loss": 1.1028286218643188,
73
- "eval_runtime": 82.616,
74
- "eval_samples_per_second": 5.725,
75
- "eval_steps_per_second": 1.44,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
- "grad_norm": 0.5769486427307129,
81
- "learning_rate": 9.432637571157496e-05,
82
- "loss": 1.124346466064453,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
- "grad_norm": 0.5422045588493347,
88
- "learning_rate": 9.337760910815939e-05,
89
- "loss": 1.0794380950927733,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
- "eval_loss": 1.072836995124817,
95
- "eval_runtime": 82.9563,
96
- "eval_samples_per_second": 5.702,
97
- "eval_steps_per_second": 1.434,
98
  "step": 400
99
  },
100
  {
101
  "epoch": 0.8458646616541353,
102
- "grad_norm": 0.5861876606941223,
103
- "learning_rate": 9.242884250474384e-05,
104
- "loss": 1.0750784301757812,
105
  "step": 450
106
  },
107
  {
108
  "epoch": 0.9398496240601504,
109
- "grad_norm": 0.5859329700469971,
110
- "learning_rate": 9.148007590132827e-05,
111
- "loss": 1.083390655517578,
112
  "step": 500
113
  },
114
  {
115
  "epoch": 0.9398496240601504,
116
- "eval_loss": 1.0487685203552246,
117
- "eval_runtime": 82.9841,
118
- "eval_samples_per_second": 5.7,
119
- "eval_steps_per_second": 1.434,
120
  "step": 500
121
  },
122
  {
123
  "epoch": 1.0338345864661653,
124
- "grad_norm": 0.787390410900116,
125
- "learning_rate": 9.053130929791271e-05,
126
- "loss": 1.0226116943359376,
127
  "step": 550
128
  },
129
  {
130
  "epoch": 1.1278195488721805,
131
- "grad_norm": 0.7412646412849426,
132
- "learning_rate": 8.958254269449717e-05,
133
- "loss": 0.9393210601806641,
134
  "step": 600
135
  },
136
  {
137
  "epoch": 1.1278195488721805,
138
- "eval_loss": 1.0402475595474243,
139
- "eval_runtime": 83.0546,
140
- "eval_samples_per_second": 5.695,
141
- "eval_steps_per_second": 1.433,
142
  "step": 600
143
  }
144
  ],
145
  "logging_steps": 50,
146
- "max_steps": 5320,
147
  "num_input_tokens_seen": 0,
148
- "num_train_epochs": 10,
149
  "save_steps": 100,
150
  "stateful_callbacks": {
151
  "TrainerControl": {
 
1
  {
2
+ "best_global_step": 400,
3
+ "best_metric": 0.9676186442375183,
4
+ "best_model_checkpoint": "./outputs/checkpoint-400",
5
  "epoch": 1.1278195488721805,
6
  "eval_steps": 100,
7
  "global_step": 600,
 
11
  "log_history": [
12
  {
13
  "epoch": 0.09398496240601503,
14
+ "grad_norm": 0.9101622104644775,
15
  "learning_rate": 9.8e-05,
16
+ "loss": 0.7848518371582032,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
+ "grad_norm": 0.8308438062667847,
22
+ "learning_rate": 9.683053040103493e-05,
23
+ "loss": 0.7757094573974609,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
+ "eval_loss": 0.9840108752250671,
29
+ "eval_runtime": 81.3507,
30
+ "eval_samples_per_second": 5.814,
31
+ "eval_steps_per_second": 1.463,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
+ "grad_norm": 1.0474584102630615,
37
+ "learning_rate": 9.359637774902976e-05,
38
+ "loss": 0.7674188995361328,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
+ "grad_norm": 0.8780233860015869,
44
+ "learning_rate": 9.036222509702458e-05,
45
+ "loss": 0.7395731353759766,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
+ "eval_loss": 0.9940316081047058,
51
+ "eval_runtime": 80.2928,
52
+ "eval_samples_per_second": 5.891,
53
+ "eval_steps_per_second": 1.482,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
+ "grad_norm": 0.9176077246665955,
59
+ "learning_rate": 8.712807244501941e-05,
60
+ "loss": 0.7627955627441406,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
+ "grad_norm": 0.8625491857528687,
66
+ "learning_rate": 8.389391979301423e-05,
67
+ "loss": 0.7164928436279296,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
+ "eval_loss": 0.9823606014251709,
73
+ "eval_runtime": 80.8571,
74
+ "eval_samples_per_second": 5.85,
75
+ "eval_steps_per_second": 1.472,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
+ "grad_norm": 0.8384292125701904,
81
+ "learning_rate": 8.065976714100906e-05,
82
+ "loss": 0.73987548828125,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
+ "grad_norm": 0.8384448885917664,
88
+ "learning_rate": 7.742561448900388e-05,
89
+ "loss": 0.7277918243408203,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
+ "eval_loss": 0.9676186442375183,
95
+ "eval_runtime": 80.4443,
96
+ "eval_samples_per_second": 5.88,
97
+ "eval_steps_per_second": 1.479,
98
  "step": 400
99
  },
100
  {
101
  "epoch": 0.8458646616541353,
102
+ "grad_norm": 0.866162121295929,
103
+ "learning_rate": 7.41914618369987e-05,
104
+ "loss": 0.7323916625976562,
105
  "step": 450
106
  },
107
  {
108
  "epoch": 0.9398496240601504,
109
+ "grad_norm": 0.8226180076599121,
110
+ "learning_rate": 7.095730918499353e-05,
111
+ "loss": 0.7260687255859375,
112
  "step": 500
113
  },
114
  {
115
  "epoch": 0.9398496240601504,
116
+ "eval_loss": 0.9678767919540405,
117
+ "eval_runtime": 80.5208,
118
+ "eval_samples_per_second": 5.874,
119
+ "eval_steps_per_second": 1.478,
120
  "step": 500
121
  },
122
  {
123
  "epoch": 1.0338345864661653,
124
+ "grad_norm": 1.0985685586929321,
125
+ "learning_rate": 6.772315653298837e-05,
126
+ "loss": 0.6786854553222657,
127
  "step": 550
128
  },
129
  {
130
  "epoch": 1.1278195488721805,
131
+ "grad_norm": 1.0968552827835083,
132
+ "learning_rate": 6.44890038809832e-05,
133
+ "loss": 0.580701789855957,
134
  "step": 600
135
  },
136
  {
137
  "epoch": 1.1278195488721805,
138
+ "eval_loss": 1.0256125926971436,
139
+ "eval_runtime": 80.6908,
140
+ "eval_samples_per_second": 5.862,
141
+ "eval_steps_per_second": 1.475,
142
  "step": 600
143
  }
144
  ],
145
  "logging_steps": 50,
146
+ "max_steps": 1596,
147
  "num_input_tokens_seen": 0,
148
+ "num_train_epochs": 3,
149
  "save_steps": 100,
150
  "stateful_callbacks": {
151
  "TrainerControl": {
checkpoint-step-600/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bc05806d2c86681ef6c541c75942126f28b3a31aec0d903899ed9bf1ea303bac
3
  size 5713
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3c88f5ec73ab38f2f0a5bb321f3c58aaa6f716ae0e803b69ff493f9e0c43f221
3
  size 5713