File size: 8,661 Bytes
981d736
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
{
  "best_metric": 0.09516655653715134,
  "best_model_checkpoint": "/home/philipp.meier/author_writing_sentences/outputs/specific/ernie/macro/easy_512/checkpoint-1512",
  "epoch": 9.999586811007354,
  "eval_steps": 500,
  "global_step": 15120,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.3305511941161887,
      "grad_norm": 2.844763994216919,
      "learning_rate": 4.834656084656085e-05,
      "loss": 0.1778,
      "step": 500
    },
    {
      "epoch": 0.6611023882323774,
      "grad_norm": 2.216350555419922,
      "learning_rate": 4.669312169312169e-05,
      "loss": 0.1443,
      "step": 1000
    },
    {
      "epoch": 0.9916535823485663,
      "grad_norm": 8.136266708374023,
      "learning_rate": 4.503968253968254e-05,
      "loss": 0.1292,
      "step": 1500
    },
    {
      "epoch": 0.9995868110073548,
      "eval_f1": 0.9527436209888852,
      "eval_loss": 0.09516655653715134,
      "eval_runtime": 88.8726,
      "eval_samples_per_second": 57.599,
      "eval_steps_per_second": 14.403,
      "step": 1512
    },
    {
      "epoch": 1.3226179654574002,
      "grad_norm": 8.809748649597168,
      "learning_rate": 4.3386243386243384e-05,
      "loss": 0.0895,
      "step": 2000
    },
    {
      "epoch": 1.6531691595735891,
      "grad_norm": 0.4540178179740906,
      "learning_rate": 4.173280423280423e-05,
      "loss": 0.0849,
      "step": 2500
    },
    {
      "epoch": 1.9837203536897778,
      "grad_norm": 14.030110359191895,
      "learning_rate": 4.007936507936508e-05,
      "loss": 0.085,
      "step": 3000
    },
    {
      "epoch": 1.999586811007355,
      "eval_f1": 0.9506637797905222,
      "eval_loss": 0.12027066200971603,
      "eval_runtime": 88.8085,
      "eval_samples_per_second": 57.641,
      "eval_steps_per_second": 14.413,
      "step": 3024
    },
    {
      "epoch": 2.3146847367986116,
      "grad_norm": 0.08342691510915756,
      "learning_rate": 3.8425925925925924e-05,
      "loss": 0.0554,
      "step": 3500
    },
    {
      "epoch": 2.6452359309148004,
      "grad_norm": 0.12781363725662231,
      "learning_rate": 3.677248677248677e-05,
      "loss": 0.0603,
      "step": 4000
    },
    {
      "epoch": 2.975787125030989,
      "grad_norm": 0.14807908236980438,
      "learning_rate": 3.511904761904762e-05,
      "loss": 0.0578,
      "step": 4500
    },
    {
      "epoch": 2.999586811007355,
      "eval_f1": 0.9429987599618843,
      "eval_loss": 0.1923331469297409,
      "eval_runtime": 88.636,
      "eval_samples_per_second": 57.753,
      "eval_steps_per_second": 14.441,
      "step": 4536
    },
    {
      "epoch": 3.3067515081398233,
      "grad_norm": 0.13493597507476807,
      "learning_rate": 3.3465608465608464e-05,
      "loss": 0.0336,
      "step": 5000
    },
    {
      "epoch": 3.637302702256012,
      "grad_norm": 5.746713638305664,
      "learning_rate": 3.181216931216931e-05,
      "loss": 0.0385,
      "step": 5500
    },
    {
      "epoch": 3.9678538963722008,
      "grad_norm": 8.010566711425781,
      "learning_rate": 3.0158730158730158e-05,
      "loss": 0.0397,
      "step": 6000
    },
    {
      "epoch": 3.999586811007355,
      "eval_f1": 0.9502365475637948,
      "eval_loss": 0.14363159239292145,
      "eval_runtime": 88.7191,
      "eval_samples_per_second": 57.699,
      "eval_steps_per_second": 14.428,
      "step": 6048
    },
    {
      "epoch": 4.298818279481035,
      "grad_norm": 24.7757511138916,
      "learning_rate": 2.8505291005291007e-05,
      "loss": 0.0297,
      "step": 6500
    },
    {
      "epoch": 4.629369473597223,
      "grad_norm": 24.24225616455078,
      "learning_rate": 2.6851851851851855e-05,
      "loss": 0.024,
      "step": 7000
    },
    {
      "epoch": 4.959920667713412,
      "grad_norm": 0.18736685812473297,
      "learning_rate": 2.5198412698412697e-05,
      "loss": 0.0257,
      "step": 7500
    },
    {
      "epoch": 4.9995868110073545,
      "eval_f1": 0.9588887459263877,
      "eval_loss": 0.18245960772037506,
      "eval_runtime": 88.6444,
      "eval_samples_per_second": 57.748,
      "eval_steps_per_second": 14.44,
      "step": 7560
    },
    {
      "epoch": 5.290885050822246,
      "grad_norm": 0.19512176513671875,
      "learning_rate": 2.3544973544973546e-05,
      "loss": 0.0184,
      "step": 8000
    },
    {
      "epoch": 5.621436244938435,
      "grad_norm": 0.03989516571164131,
      "learning_rate": 2.1891534391534395e-05,
      "loss": 0.0205,
      "step": 8500
    },
    {
      "epoch": 5.951987439054624,
      "grad_norm": 0.006726603023707867,
      "learning_rate": 2.023809523809524e-05,
      "loss": 0.0179,
      "step": 9000
    },
    {
      "epoch": 5.9995868110073545,
      "eval_f1": 0.9525947889542465,
      "eval_loss": 0.2241736799478531,
      "eval_runtime": 88.6595,
      "eval_samples_per_second": 57.738,
      "eval_steps_per_second": 14.437,
      "step": 9072
    },
    {
      "epoch": 6.282951822163458,
      "grad_norm": 0.06540829688310623,
      "learning_rate": 1.8584656084656086e-05,
      "loss": 0.0103,
      "step": 9500
    },
    {
      "epoch": 6.613503016279647,
      "grad_norm": 0.004820807836949825,
      "learning_rate": 1.693121693121693e-05,
      "loss": 0.013,
      "step": 10000
    },
    {
      "epoch": 6.944054210395835,
      "grad_norm": 7.895081520080566,
      "learning_rate": 1.527777777777778e-05,
      "loss": 0.0127,
      "step": 10500
    },
    {
      "epoch": 6.9995868110073545,
      "eval_f1": 0.9584218875344421,
      "eval_loss": 0.1747281849384308,
      "eval_runtime": 88.6774,
      "eval_samples_per_second": 57.726,
      "eval_steps_per_second": 14.434,
      "step": 10584
    },
    {
      "epoch": 7.275018593504669,
      "grad_norm": 0.03834864869713783,
      "learning_rate": 1.3624338624338626e-05,
      "loss": 0.0103,
      "step": 11000
    },
    {
      "epoch": 7.6055697876208574,
      "grad_norm": 0.005743283778429031,
      "learning_rate": 1.1970899470899471e-05,
      "loss": 0.0086,
      "step": 11500
    },
    {
      "epoch": 7.936120981737046,
      "grad_norm": 0.0013776550767943263,
      "learning_rate": 1.0317460317460318e-05,
      "loss": 0.0081,
      "step": 12000
    },
    {
      "epoch": 7.9995868110073545,
      "eval_f1": 0.9579563377597123,
      "eval_loss": 0.22722405195236206,
      "eval_runtime": 88.546,
      "eval_samples_per_second": 57.812,
      "eval_steps_per_second": 14.456,
      "step": 12096
    },
    {
      "epoch": 8.267085364845881,
      "grad_norm": 0.003926456440240145,
      "learning_rate": 8.664021164021165e-06,
      "loss": 0.006,
      "step": 12500
    },
    {
      "epoch": 8.59763655896207,
      "grad_norm": 0.00048606126802042127,
      "learning_rate": 7.010582010582011e-06,
      "loss": 0.0037,
      "step": 13000
    },
    {
      "epoch": 8.928187753078259,
      "grad_norm": 0.03147663176059723,
      "learning_rate": 5.357142857142857e-06,
      "loss": 0.0047,
      "step": 13500
    },
    {
      "epoch": 8.999586811007354,
      "eval_f1": 0.956967216467543,
      "eval_loss": 0.22612209618091583,
      "eval_runtime": 88.6133,
      "eval_samples_per_second": 57.768,
      "eval_steps_per_second": 14.445,
      "step": 13608
    },
    {
      "epoch": 9.259152136187092,
      "grad_norm": 0.003239526879042387,
      "learning_rate": 3.7037037037037037e-06,
      "loss": 0.0024,
      "step": 14000
    },
    {
      "epoch": 9.58970333030328,
      "grad_norm": 0.0006155924056656659,
      "learning_rate": 2.0502645502645504e-06,
      "loss": 0.0031,
      "step": 14500
    },
    {
      "epoch": 9.92025452441947,
      "grad_norm": 0.0004118815122637898,
      "learning_rate": 3.9682539682539683e-07,
      "loss": 0.0022,
      "step": 15000
    },
    {
      "epoch": 9.999586811007354,
      "eval_f1": 0.9576523514471682,
      "eval_loss": 0.24551521241664886,
      "eval_runtime": 88.6527,
      "eval_samples_per_second": 57.742,
      "eval_steps_per_second": 14.438,
      "step": 15120
    }
  ],
  "logging_steps": 500,
  "max_steps": 15120,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 10,
  "save_steps": 500,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 1.2732259702136832e+17,
  "train_batch_size": 4,
  "trial_name": null,
  "trial_params": null
}