classicmaster commited on
Commit
bfa7d1c
·
verified ·
1 Parent(s): c256ccf

Upload folder using huggingface_hub

Browse files
checkpoint-step-500/adapter_config.json CHANGED
@@ -34,13 +34,13 @@
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
 
 
37
  "v_proj",
38
  "down_proj",
39
  "o_proj",
40
- "q_proj",
41
  "up_proj",
42
- "gate_proj",
43
- "k_proj"
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
 
34
  "rank_pattern": {},
35
  "revision": null,
36
  "target_modules": [
37
+ "gate_proj",
38
+ "k_proj",
39
  "v_proj",
40
  "down_proj",
41
  "o_proj",
 
42
  "up_proj",
43
+ "q_proj"
 
44
  ],
45
  "target_parameters": null,
46
  "task_type": "CAUSAL_LM",
checkpoint-step-500/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c863fc283ce45c9f631a699242fa10aedebe6e12b2d5b36c33198de2e5bd85a4
3
  size 239536272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a387be8c8d7260b40b7435544ff33549a9b554d949662c2dcd4a6e9454c3ac1a
3
  size 239536272
checkpoint-step-500/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:518a6b042e03bc5532d1f29e406467f275e01ce34e285daa710f09ee75d71e21
3
  size 122203333
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:62efc2e5e7c3fde724f3e0082f7b5bed74ea95019d8c6f3e9af7cfb5cd119967
3
  size 122203333
checkpoint-step-500/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d1459e426da085c489658844b6eaef146617542828cbc7b74d93aa3bb305e910
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:690ef27a29abb181e57e795f5ffd494219b89b6cc90e622e8445b188e53b77d6
3
  size 1465
checkpoint-step-500/tokenizer_config.json CHANGED
@@ -5,7 +5,7 @@
5
  "clean_up_tokenization_spaces": false,
6
  "eos_token": "<|endoftext|>",
7
  "errors": "replace",
8
- "is_local": false,
9
  "model_max_length": 32768,
10
  "pad_token": "<|PAD_TOKEN|>",
11
  "padding_side": "right",
 
5
  "clean_up_tokenization_spaces": false,
6
  "eos_token": "<|endoftext|>",
7
  "errors": "replace",
8
+ "is_local": true,
9
  "model_max_length": 32768,
10
  "pad_token": "<|PAD_TOKEN|>",
11
  "padding_side": "right",
checkpoint-step-500/trainer_state.json CHANGED
@@ -1,7 +1,7 @@
1
  {
2
- "best_global_step": 500,
3
- "best_metric": 1.0487685203552246,
4
- "best_model_checkpoint": "./outputs/checkpoint-500",
5
  "epoch": 0.9398496240601504,
6
  "eval_steps": 100,
7
  "global_step": 500,
@@ -11,119 +11,119 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.09398496240601503,
14
- "grad_norm": 0.49556756019592285,
15
  "learning_rate": 9.8e-05,
16
- "loss": 1.8540109252929688,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
- "grad_norm": 0.4922962486743927,
22
- "learning_rate": 9.907020872865275e-05,
23
- "loss": 1.2944253540039063,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
- "eval_loss": 1.216850757598877,
29
- "eval_runtime": 83.4733,
30
- "eval_samples_per_second": 5.666,
31
- "eval_steps_per_second": 1.426,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
- "grad_norm": 0.5891006588935852,
37
- "learning_rate": 9.81214421252372e-05,
38
- "loss": 1.2092308807373047,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
- "grad_norm": 0.5563158392906189,
44
- "learning_rate": 9.717267552182164e-05,
45
- "loss": 1.1433011627197265,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
- "eval_loss": 1.1367270946502686,
51
- "eval_runtime": 82.9022,
52
- "eval_samples_per_second": 5.706,
53
- "eval_steps_per_second": 1.435,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
- "grad_norm": 0.5556582808494568,
59
- "learning_rate": 9.622390891840608e-05,
60
- "loss": 1.1522552490234375,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
- "grad_norm": 0.5758287906646729,
66
- "learning_rate": 9.527514231499052e-05,
67
- "loss": 1.0814830780029296,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
- "eval_loss": 1.1028286218643188,
73
- "eval_runtime": 82.616,
74
- "eval_samples_per_second": 5.725,
75
- "eval_steps_per_second": 1.44,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
- "grad_norm": 0.5769486427307129,
81
- "learning_rate": 9.432637571157496e-05,
82
- "loss": 1.124346466064453,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
- "grad_norm": 0.5422045588493347,
88
- "learning_rate": 9.337760910815939e-05,
89
- "loss": 1.0794380950927733,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
- "eval_loss": 1.072836995124817,
95
- "eval_runtime": 82.9563,
96
- "eval_samples_per_second": 5.702,
97
- "eval_steps_per_second": 1.434,
98
  "step": 400
99
  },
100
  {
101
  "epoch": 0.8458646616541353,
102
- "grad_norm": 0.5861876606941223,
103
- "learning_rate": 9.242884250474384e-05,
104
- "loss": 1.0750784301757812,
105
  "step": 450
106
  },
107
  {
108
  "epoch": 0.9398496240601504,
109
- "grad_norm": 0.5859329700469971,
110
- "learning_rate": 9.148007590132827e-05,
111
- "loss": 1.083390655517578,
112
  "step": 500
113
  },
114
  {
115
  "epoch": 0.9398496240601504,
116
- "eval_loss": 1.0487685203552246,
117
- "eval_runtime": 82.9841,
118
- "eval_samples_per_second": 5.7,
119
- "eval_steps_per_second": 1.434,
120
  "step": 500
121
  }
122
  ],
123
  "logging_steps": 50,
124
- "max_steps": 5320,
125
  "num_input_tokens_seen": 0,
126
- "num_train_epochs": 10,
127
  "save_steps": 100,
128
  "stateful_callbacks": {
129
  "TrainerControl": {
 
1
  {
2
+ "best_global_step": 400,
3
+ "best_metric": 0.9676186442375183,
4
+ "best_model_checkpoint": "./outputs/checkpoint-400",
5
  "epoch": 0.9398496240601504,
6
  "eval_steps": 100,
7
  "global_step": 500,
 
11
  "log_history": [
12
  {
13
  "epoch": 0.09398496240601503,
14
+ "grad_norm": 0.9101622104644775,
15
  "learning_rate": 9.8e-05,
16
+ "loss": 0.7848518371582032,
17
  "step": 50
18
  },
19
  {
20
  "epoch": 0.18796992481203006,
21
+ "grad_norm": 0.8308438062667847,
22
+ "learning_rate": 9.683053040103493e-05,
23
+ "loss": 0.7757094573974609,
24
  "step": 100
25
  },
26
  {
27
  "epoch": 0.18796992481203006,
28
+ "eval_loss": 0.9840108752250671,
29
+ "eval_runtime": 81.3507,
30
+ "eval_samples_per_second": 5.814,
31
+ "eval_steps_per_second": 1.463,
32
  "step": 100
33
  },
34
  {
35
  "epoch": 0.2819548872180451,
36
+ "grad_norm": 1.0474584102630615,
37
+ "learning_rate": 9.359637774902976e-05,
38
+ "loss": 0.7674188995361328,
39
  "step": 150
40
  },
41
  {
42
  "epoch": 0.37593984962406013,
43
+ "grad_norm": 0.8780233860015869,
44
+ "learning_rate": 9.036222509702458e-05,
45
+ "loss": 0.7395731353759766,
46
  "step": 200
47
  },
48
  {
49
  "epoch": 0.37593984962406013,
50
+ "eval_loss": 0.9940316081047058,
51
+ "eval_runtime": 80.2928,
52
+ "eval_samples_per_second": 5.891,
53
+ "eval_steps_per_second": 1.482,
54
  "step": 200
55
  },
56
  {
57
  "epoch": 0.4699248120300752,
58
+ "grad_norm": 0.9176077246665955,
59
+ "learning_rate": 8.712807244501941e-05,
60
+ "loss": 0.7627955627441406,
61
  "step": 250
62
  },
63
  {
64
  "epoch": 0.5639097744360902,
65
+ "grad_norm": 0.8625491857528687,
66
+ "learning_rate": 8.389391979301423e-05,
67
+ "loss": 0.7164928436279296,
68
  "step": 300
69
  },
70
  {
71
  "epoch": 0.5639097744360902,
72
+ "eval_loss": 0.9823606014251709,
73
+ "eval_runtime": 80.8571,
74
+ "eval_samples_per_second": 5.85,
75
+ "eval_steps_per_second": 1.472,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.6578947368421053,
80
+ "grad_norm": 0.8384292125701904,
81
+ "learning_rate": 8.065976714100906e-05,
82
+ "loss": 0.73987548828125,
83
  "step": 350
84
  },
85
  {
86
  "epoch": 0.7518796992481203,
87
+ "grad_norm": 0.8384448885917664,
88
+ "learning_rate": 7.742561448900388e-05,
89
+ "loss": 0.7277918243408203,
90
  "step": 400
91
  },
92
  {
93
  "epoch": 0.7518796992481203,
94
+ "eval_loss": 0.9676186442375183,
95
+ "eval_runtime": 80.4443,
96
+ "eval_samples_per_second": 5.88,
97
+ "eval_steps_per_second": 1.479,
98
  "step": 400
99
  },
100
  {
101
  "epoch": 0.8458646616541353,
102
+ "grad_norm": 0.866162121295929,
103
+ "learning_rate": 7.41914618369987e-05,
104
+ "loss": 0.7323916625976562,
105
  "step": 450
106
  },
107
  {
108
  "epoch": 0.9398496240601504,
109
+ "grad_norm": 0.8226180076599121,
110
+ "learning_rate": 7.095730918499353e-05,
111
+ "loss": 0.7260687255859375,
112
  "step": 500
113
  },
114
  {
115
  "epoch": 0.9398496240601504,
116
+ "eval_loss": 0.9678767919540405,
117
+ "eval_runtime": 80.5208,
118
+ "eval_samples_per_second": 5.874,
119
+ "eval_steps_per_second": 1.478,
120
  "step": 500
121
  }
122
  ],
123
  "logging_steps": 50,
124
+ "max_steps": 1596,
125
  "num_input_tokens_seen": 0,
126
+ "num_train_epochs": 3,
127
  "save_steps": 100,
128
  "stateful_callbacks": {
129
  "TrainerControl": {
checkpoint-step-500/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bc05806d2c86681ef6c541c75942126f28b3a31aec0d903899ed9bf1ea303bac
3
  size 5713
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3c88f5ec73ab38f2f0a5bb321f3c58aaa6f716ae0e803b69ff493f9e0c43f221
3
  size 5713