File size: 7,864 Bytes
50e70f2
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
[
  {
    "loss": 1.7251173400878905,
    "grad_norm": 2.5178136825561523,
    "learning_rate": 5.673352435530086e-06,
    "epoch": 0.14357501794687724,
    "step": 100
  },
  {
    "loss": 0.22405649185180665,
    "grad_norm": 1.808869481086731,
    "learning_rate": 1.1404011461318051e-05,
    "epoch": 0.2871500358937545,
    "step": 200
  },
  {
    "loss": 0.11055788040161132,
    "grad_norm": 3.0120017528533936,
    "learning_rate": 1.7134670487106017e-05,
    "epoch": 0.43072505384063176,
    "step": 300
  },
  {
    "loss": 0.07818803310394287,
    "grad_norm": 3.042083501815796,
    "learning_rate": 1.9681122448979592e-05,
    "epoch": 0.574300071787509,
    "step": 400
  },
  {
    "loss": 0.06936465740203858,
    "grad_norm": 1.3447211980819702,
    "learning_rate": 1.9043367346938777e-05,
    "epoch": 0.7178750897343862,
    "step": 500
  },
  {
    "loss": 0.051946673393249515,
    "grad_norm": 1.8753048181533813,
    "learning_rate": 1.8405612244897962e-05,
    "epoch": 0.8614501076812635,
    "step": 600
  },
  {
    "eval_loss": 0.018037041649222374,
    "eval_precision": 0.9465214161921268,
    "eval_recall": 0.961035696329814,
    "eval_f1": 0.9537233379069479,
    "eval_accuracy": 0.9950597210931149,
    "eval_runtime": 11.3523,
    "eval_samples_per_second": 122.619,
    "eval_steps_per_second": 7.664,
    "epoch": 1.0,
    "step": 697
  },
  {
    "loss": 0.04297860622406006,
    "grad_norm": 1.4369804859161377,
    "learning_rate": 1.7767857142857143e-05,
    "epoch": 1.0043072505384063,
    "step": 700
  },
  {
    "loss": 0.032263004779815675,
    "grad_norm": 0.48515579104423523,
    "learning_rate": 1.713010204081633e-05,
    "epoch": 1.1478822684852836,
    "step": 800
  },
  {
    "loss": 0.028692266941070556,
    "grad_norm": 1.310250997543335,
    "learning_rate": 1.6492346938775513e-05,
    "epoch": 1.2914572864321607,
    "step": 900
  },
  {
    "loss": 0.0251308012008667,
    "grad_norm": 1.0862822532653809,
    "learning_rate": 1.5854591836734695e-05,
    "epoch": 1.435032304379038,
    "step": 1000
  },
  {
    "loss": 0.02465754985809326,
    "grad_norm": 0.4208371639251709,
    "learning_rate": 1.5216836734693878e-05,
    "epoch": 1.5786073223259152,
    "step": 1100
  },
  {
    "loss": 0.020062971115112304,
    "grad_norm": 1.954458475112915,
    "learning_rate": 1.4579081632653063e-05,
    "epoch": 1.7221823402727925,
    "step": 1200
  },
  {
    "loss": 0.020207085609436036,
    "grad_norm": 1.907931923866272,
    "learning_rate": 1.3941326530612247e-05,
    "epoch": 1.8657573582196698,
    "step": 1300
  },
  {
    "eval_loss": 0.013158891350030899,
    "eval_precision": 0.9662698412698413,
    "eval_recall": 0.9793866264454499,
    "eval_f1": 0.9727840199750312,
    "eval_accuracy": 0.996998311550247,
    "eval_runtime": 11.3998,
    "eval_samples_per_second": 122.108,
    "eval_steps_per_second": 7.632,
    "epoch": 2.0,
    "step": 1394
  },
  {
    "loss": 0.016276423931121827,
    "grad_norm": 0.7246897220611572,
    "learning_rate": 1.3303571428571429e-05,
    "epoch": 2.0086145010768126,
    "step": 1400
  },
  {
    "loss": 0.010126489400863647,
    "grad_norm": 0.07916412502527237,
    "learning_rate": 1.2665816326530614e-05,
    "epoch": 2.1521895190236897,
    "step": 1500
  },
  {
    "loss": 0.011953834295272827,
    "grad_norm": 0.1269012987613678,
    "learning_rate": 1.2028061224489797e-05,
    "epoch": 2.2957645369705673,
    "step": 1600
  },
  {
    "loss": 0.00914982557296753,
    "grad_norm": 0.6635536551475525,
    "learning_rate": 1.139030612244898e-05,
    "epoch": 2.4393395549174444,
    "step": 1700
  },
  {
    "loss": 0.01329527735710144,
    "grad_norm": 2.2957067489624023,
    "learning_rate": 1.0752551020408165e-05,
    "epoch": 2.5829145728643215,
    "step": 1800
  },
  {
    "loss": 0.00799597442150116,
    "grad_norm": 0.40347203612327576,
    "learning_rate": 1.0114795918367348e-05,
    "epoch": 2.726489590811199,
    "step": 1900
  },
  {
    "loss": 0.013600579500198363,
    "grad_norm": 1.115879774093628,
    "learning_rate": 9.477040816326531e-06,
    "epoch": 2.870064608758076,
    "step": 2000
  },
  {
    "eval_loss": 0.010336230508983135,
    "eval_precision": 0.9729930624380575,
    "eval_recall": 0.9871794871794872,
    "eval_f1": 0.9800349388570002,
    "eval_accuracy": 0.9977018322806579,
    "eval_runtime": 11.3805,
    "eval_samples_per_second": 122.314,
    "eval_steps_per_second": 7.645,
    "epoch": 3.0,
    "step": 2091
  },
  {
    "loss": 0.007430664896965027,
    "grad_norm": 1.7394297122955322,
    "learning_rate": 8.839285714285714e-06,
    "epoch": 3.012921751615219,
    "step": 2100
  },
  {
    "loss": 0.005927992463111878,
    "grad_norm": 0.03791365772485733,
    "learning_rate": 8.201530612244899e-06,
    "epoch": 3.156496769562096,
    "step": 2200
  },
  {
    "loss": 0.005083958506584167,
    "grad_norm": 0.03876778110861778,
    "learning_rate": 7.563775510204082e-06,
    "epoch": 3.3000717875089736,
    "step": 2300
  },
  {
    "loss": 0.00475325345993042,
    "grad_norm": 0.046694278717041016,
    "learning_rate": 6.926020408163265e-06,
    "epoch": 3.4436468054558507,
    "step": 2400
  },
  {
    "loss": 0.003969300091266632,
    "grad_norm": 0.2219376564025879,
    "learning_rate": 6.288265306122449e-06,
    "epoch": 3.5872218234027278,
    "step": 2500
  },
  {
    "loss": 0.00385463148355484,
    "grad_norm": 0.2034495770931244,
    "learning_rate": 5.6505102040816325e-06,
    "epoch": 3.7307968413496053,
    "step": 2600
  },
  {
    "loss": 0.0038687247037887573,
    "grad_norm": 0.12553541362285614,
    "learning_rate": 5.012755102040817e-06,
    "epoch": 3.8743718592964824,
    "step": 2700
  },
  {
    "eval_loss": 0.009008657187223434,
    "eval_precision": 0.9792655508368724,
    "eval_recall": 0.9854198089492208,
    "eval_f1": 0.9823330409723093,
    "eval_accuracy": 0.9980614095428678,
    "eval_runtime": 11.3502,
    "eval_samples_per_second": 122.641,
    "eval_steps_per_second": 7.665,
    "epoch": 4.0,
    "step": 2788
  },
  {
    "loss": 0.004914677143096924,
    "grad_norm": 0.978706955909729,
    "learning_rate": 4.3750000000000005e-06,
    "epoch": 4.017229002153625,
    "step": 2800
  },
  {
    "loss": 0.002940036952495575,
    "grad_norm": 0.8705828189849854,
    "learning_rate": 3.737244897959184e-06,
    "epoch": 4.160804020100502,
    "step": 2900
  },
  {
    "loss": 0.0025027459859848023,
    "grad_norm": 0.07296314090490341,
    "learning_rate": 3.099489795918368e-06,
    "epoch": 4.304379038047379,
    "step": 3000
  },
  {
    "loss": 0.0016908496618270874,
    "grad_norm": 0.0873495489358902,
    "learning_rate": 2.461734693877551e-06,
    "epoch": 4.447954055994257,
    "step": 3100
  },
  {
    "loss": 0.0020018962025642397,
    "grad_norm": 1.0358140468597412,
    "learning_rate": 1.8239795918367347e-06,
    "epoch": 4.5915290739411345,
    "step": 3200
  },
  {
    "loss": 0.00347354382276535,
    "grad_norm": 0.00410356605425477,
    "learning_rate": 1.1862244897959185e-06,
    "epoch": 4.735104091888012,
    "step": 3300
  },
  {
    "loss": 0.0016965478658676147,
    "grad_norm": 0.19883082807064056,
    "learning_rate": 5.484693877551021e-07,
    "epoch": 4.878679109834889,
    "step": 3400
  },
  {
    "eval_loss": 0.009895444847643375,
    "eval_precision": 0.9785963165754107,
    "eval_recall": 0.9884364002011061,
    "eval_f1": 0.9834917458729364,
    "eval_accuracy": 0.9980926771308861,
    "eval_runtime": 11.5284,
    "eval_samples_per_second": 120.745,
    "eval_steps_per_second": 7.547,
    "epoch": 5.0,
    "step": 3485
  },
  {
    "train_runtime": 1386.8294,
    "train_samples_per_second": 40.164,
    "train_steps_per_second": 2.513,
    "total_flos": 2469820965329304.0,
    "train_loss": 0.07437319711513464,
    "epoch": 5.0,
    "step": 3485
  }
]