whitedevil0089devil commited on
Commit
028a8f4
·
verified ·
1 Parent(s): 14463b6

Upload checkpoint-1200/trainer_state.json

Browse files
Files changed (1) hide show
  1. checkpoint-1200/trainer_state.json +298 -0
checkpoint-1200/trainer_state.json ADDED
@@ -0,0 +1,298 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1050,
3
+ "best_metric": 0.014976329170167446,
4
+ "best_model_checkpoint": "/content/drive/MyDrive/model/Roberta_Squad/roberta_qa_squad/checkpoint-1050",
5
+ "epoch": 1.124706985466479,
6
+ "eval_steps": 150,
7
+ "global_step": 1200,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0009376465072667605,
14
+ "grad_norm": 15.076981544494629,
15
+ "learning_rate": 0.0,
16
+ "loss": 1.4739,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.04688232536333802,
21
+ "grad_norm": 14.212701797485352,
22
+ "learning_rate": 3.598875351452672e-07,
23
+ "loss": 1.4366,
24
+ "step": 50
25
+ },
26
+ {
27
+ "epoch": 0.09376465072667604,
28
+ "grad_norm": 12.904585838317871,
29
+ "learning_rate": 7.347703842549205e-07,
30
+ "loss": 1.1476,
31
+ "step": 100
32
+ },
33
+ {
34
+ "epoch": 0.14064697609001406,
35
+ "grad_norm": 5.23610258102417,
36
+ "learning_rate": 1.1096532333645738e-06,
37
+ "loss": 0.6204,
38
+ "step": 150
39
+ },
40
+ {
41
+ "epoch": 0.14064697609001406,
42
+ "eval_accuracy": 0.9943728018757327,
43
+ "eval_f1": 0.9915671414895327,
44
+ "eval_loss": 0.2603488862514496,
45
+ "eval_runtime": 77.8283,
46
+ "eval_samples_per_second": 109.6,
47
+ "eval_steps_per_second": 3.431,
48
+ "step": 150
49
+ },
50
+ {
51
+ "epoch": 0.1875293014533521,
52
+ "grad_norm": 1.283129096031189,
53
+ "learning_rate": 1.484536082474227e-06,
54
+ "loss": 0.1789,
55
+ "step": 200
56
+ },
57
+ {
58
+ "epoch": 0.23441162681669012,
59
+ "grad_norm": 0.6366870403289795,
60
+ "learning_rate": 1.8594189315838805e-06,
61
+ "loss": 0.066,
62
+ "step": 250
63
+ },
64
+ {
65
+ "epoch": 0.2812939521800281,
66
+ "grad_norm": 0.34226417541503906,
67
+ "learning_rate": 2.2343017806935337e-06,
68
+ "loss": 0.0497,
69
+ "step": 300
70
+ },
71
+ {
72
+ "epoch": 0.2812939521800281,
73
+ "eval_accuracy": 0.9943728018757327,
74
+ "eval_f1": 0.9915671414895327,
75
+ "eval_loss": 0.04236311838030815,
76
+ "eval_runtime": 77.3474,
77
+ "eval_samples_per_second": 110.282,
78
+ "eval_steps_per_second": 3.452,
79
+ "step": 300
80
+ },
81
+ {
82
+ "epoch": 0.32817627754336615,
83
+ "grad_norm": 1.778275489807129,
84
+ "learning_rate": 2.6091846298031867e-06,
85
+ "loss": 0.059,
86
+ "step": 350
87
+ },
88
+ {
89
+ "epoch": 0.3750586029067042,
90
+ "grad_norm": 0.3131299316883087,
91
+ "learning_rate": 2.98406747891284e-06,
92
+ "loss": 0.0414,
93
+ "step": 400
94
+ },
95
+ {
96
+ "epoch": 0.4219409282700422,
97
+ "grad_norm": 0.203192800283432,
98
+ "learning_rate": 3.3589503280224936e-06,
99
+ "loss": 0.0385,
100
+ "step": 450
101
+ },
102
+ {
103
+ "epoch": 0.4219409282700422,
104
+ "eval_accuracy": 0.9943728018757327,
105
+ "eval_f1": 0.9915671414895327,
106
+ "eval_loss": 0.027930891141295433,
107
+ "eval_runtime": 77.8018,
108
+ "eval_samples_per_second": 109.638,
109
+ "eval_steps_per_second": 3.432,
110
+ "step": 450
111
+ },
112
+ {
113
+ "epoch": 0.46882325363338023,
114
+ "grad_norm": 0.5342408418655396,
115
+ "learning_rate": 3.7338331771321466e-06,
116
+ "loss": 0.0392,
117
+ "step": 500
118
+ },
119
+ {
120
+ "epoch": 0.5157055789967182,
121
+ "grad_norm": 0.7715256214141846,
122
+ "learning_rate": 4.1087160262418e-06,
123
+ "loss": 0.0303,
124
+ "step": 550
125
+ },
126
+ {
127
+ "epoch": 0.5625879043600562,
128
+ "grad_norm": 2.367220163345337,
129
+ "learning_rate": 4.4835988753514534e-06,
130
+ "loss": 0.0208,
131
+ "step": 600
132
+ },
133
+ {
134
+ "epoch": 0.5625879043600562,
135
+ "eval_accuracy": 0.9967174677608441,
136
+ "eval_f1": 0.9958795497944622,
137
+ "eval_loss": 0.018059343099594116,
138
+ "eval_runtime": 77.6862,
139
+ "eval_samples_per_second": 109.801,
140
+ "eval_steps_per_second": 3.437,
141
+ "step": 600
142
+ },
143
+ {
144
+ "epoch": 0.6094702297233943,
145
+ "grad_norm": 5.750198841094971,
146
+ "learning_rate": 4.8584817244611065e-06,
147
+ "loss": 0.0211,
148
+ "step": 650
149
+ },
150
+ {
151
+ "epoch": 0.6563525550867323,
152
+ "grad_norm": 1.2362596988677979,
153
+ "learning_rate": 5.2333645735707595e-06,
154
+ "loss": 0.0262,
155
+ "step": 700
156
+ },
157
+ {
158
+ "epoch": 0.7032348804500703,
159
+ "grad_norm": 0.045022640377283096,
160
+ "learning_rate": 5.608247422680413e-06,
161
+ "loss": 0.0142,
162
+ "step": 750
163
+ },
164
+ {
165
+ "epoch": 0.7032348804500703,
166
+ "eval_accuracy": 0.9963657678780774,
167
+ "eval_f1": 0.9953991663366644,
168
+ "eval_loss": 0.0179133377969265,
169
+ "eval_runtime": 78.1703,
170
+ "eval_samples_per_second": 109.121,
171
+ "eval_steps_per_second": 3.416,
172
+ "step": 750
173
+ },
174
+ {
175
+ "epoch": 0.7501172058134083,
176
+ "grad_norm": 0.2589455544948578,
177
+ "learning_rate": 5.983130271790066e-06,
178
+ "loss": 0.0229,
179
+ "step": 800
180
+ },
181
+ {
182
+ "epoch": 0.7969995311767464,
183
+ "grad_norm": 1.0219216346740723,
184
+ "learning_rate": 6.35801312089972e-06,
185
+ "loss": 0.0272,
186
+ "step": 850
187
+ },
188
+ {
189
+ "epoch": 0.8438818565400844,
190
+ "grad_norm": 5.783281326293945,
191
+ "learning_rate": 6.732895970009373e-06,
192
+ "loss": 0.029,
193
+ "step": 900
194
+ },
195
+ {
196
+ "epoch": 0.8438818565400844,
197
+ "eval_accuracy": 0.9964830011723329,
198
+ "eval_f1": 0.9955380069992853,
199
+ "eval_loss": 0.015631183981895447,
200
+ "eval_runtime": 77.5242,
201
+ "eval_samples_per_second": 110.03,
202
+ "eval_steps_per_second": 3.444,
203
+ "step": 900
204
+ },
205
+ {
206
+ "epoch": 0.8907641819034224,
207
+ "grad_norm": 0.03242630138993263,
208
+ "learning_rate": 7.107778819119027e-06,
209
+ "loss": 0.0136,
210
+ "step": 950
211
+ },
212
+ {
213
+ "epoch": 0.9376465072667605,
214
+ "grad_norm": 0.07519914209842682,
215
+ "learning_rate": 7.48266166822868e-06,
216
+ "loss": 0.0167,
217
+ "step": 1000
218
+ },
219
+ {
220
+ "epoch": 0.9845288326300985,
221
+ "grad_norm": 8.501079559326172,
222
+ "learning_rate": 7.857544517338333e-06,
223
+ "loss": 0.0153,
224
+ "step": 1050
225
+ },
226
+ {
227
+ "epoch": 0.9845288326300985,
228
+ "eval_accuracy": 0.9963657678780774,
229
+ "eval_f1": 0.9954965041531265,
230
+ "eval_loss": 0.014976329170167446,
231
+ "eval_runtime": 77.6596,
232
+ "eval_samples_per_second": 109.838,
233
+ "eval_steps_per_second": 3.438,
234
+ "step": 1050
235
+ },
236
+ {
237
+ "epoch": 1.030942334739803,
238
+ "grad_norm": 0.6377618908882141,
239
+ "learning_rate": 8.232427366447986e-06,
240
+ "loss": 0.0152,
241
+ "step": 1100
242
+ },
243
+ {
244
+ "epoch": 1.0778246601031412,
245
+ "grad_norm": 0.05754481628537178,
246
+ "learning_rate": 8.607310215557639e-06,
247
+ "loss": 0.0225,
248
+ "step": 1150
249
+ },
250
+ {
251
+ "epoch": 1.124706985466479,
252
+ "grad_norm": 0.14188943803310394,
253
+ "learning_rate": 8.982193064667292e-06,
254
+ "loss": 0.0163,
255
+ "step": 1200
256
+ },
257
+ {
258
+ "epoch": 1.124706985466479,
259
+ "eval_accuracy": 0.9963657678780774,
260
+ "eval_f1": 0.9954437982952228,
261
+ "eval_loss": 0.017581254243850708,
262
+ "eval_runtime": 77.8986,
263
+ "eval_samples_per_second": 109.501,
264
+ "eval_steps_per_second": 3.428,
265
+ "step": 1200
266
+ }
267
+ ],
268
+ "logging_steps": 50,
269
+ "max_steps": 10670,
270
+ "num_input_tokens_seen": 0,
271
+ "num_train_epochs": 10,
272
+ "save_steps": 150,
273
+ "stateful_callbacks": {
274
+ "EarlyStoppingCallback": {
275
+ "args": {
276
+ "early_stopping_patience": 4,
277
+ "early_stopping_threshold": 0.001
278
+ },
279
+ "attributes": {
280
+ "early_stopping_patience_counter": 2
281
+ }
282
+ },
283
+ "TrainerControl": {
284
+ "args": {
285
+ "should_epoch_stop": false,
286
+ "should_evaluate": false,
287
+ "should_log": false,
288
+ "should_save": true,
289
+ "should_training_stop": false
290
+ },
291
+ "attributes": {}
292
+ }
293
+ },
294
+ "total_flos": 2.019484367039693e+16,
295
+ "train_batch_size": 32,
296
+ "trial_name": null,
297
+ "trial_params": null
298
+ }