0tizm0 commited on
Commit
a7b7900
·
verified ·
1 Parent(s): c569c61

Add training results

Browse files
Files changed (1) hide show
  1. finetune_gen_results.json +463 -0
finetune_gen_results.json ADDED
@@ -0,0 +1,463 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "base_model": "Qwen/Qwen2.5-1.5B-Instruct",
3
+ "n_train": 2170,
4
+ "n_val": 241,
5
+ "epochs": 3,
6
+ "lr": 0.0002,
7
+ "lora_r": 16,
8
+ "lora_alpha": 32,
9
+ "target_modules": [
10
+ "q_proj",
11
+ "k_proj",
12
+ "v_proj",
13
+ "o_proj"
14
+ ],
15
+ "max_seq_length": 512,
16
+ "effective_batch_size": 16,
17
+ "train_loss": 0.764826238155365,
18
+ "train_runtime_hours": 0.6582819166666666,
19
+ "log_history": [
20
+ {
21
+ "loss": 2.552408981323242,
22
+ "grad_norm": 0.76171875,
23
+ "learning_rate": 8.571428571428571e-05,
24
+ "entropy": 1.8315464213490487,
25
+ "num_tokens": 76676.0,
26
+ "mean_token_accuracy": 0.50861811414361,
27
+ "epoch": 0.07373271889400922,
28
+ "step": 10
29
+ },
30
+ {
31
+ "loss": 2.1456417083740233,
32
+ "grad_norm": 0.95703125,
33
+ "learning_rate": 0.00018095238095238095,
34
+ "entropy": 1.9786892756819725,
35
+ "num_tokens": 154217.0,
36
+ "mean_token_accuracy": 0.5448866959661245,
37
+ "epoch": 0.14746543778801843,
38
+ "step": 20
39
+ },
40
+ {
41
+ "loss": 1.4322235107421875,
42
+ "grad_norm": 0.85546875,
43
+ "learning_rate": 0.00019586563307493542,
44
+ "entropy": 1.5200105249881743,
45
+ "num_tokens": 231047.0,
46
+ "mean_token_accuracy": 0.6601599544286728,
47
+ "epoch": 0.22119815668202766,
48
+ "step": 30
49
+ },
50
+ {
51
+ "loss": 0.9665801048278808,
52
+ "grad_norm": 0.51171875,
53
+ "learning_rate": 0.00019069767441860466,
54
+ "entropy": 0.990651074051857,
55
+ "num_tokens": 307705.0,
56
+ "mean_token_accuracy": 0.7566879086196423,
57
+ "epoch": 0.29493087557603687,
58
+ "step": 40
59
+ },
60
+ {
61
+ "loss": 0.8407919883728028,
62
+ "grad_norm": 0.36328125,
63
+ "learning_rate": 0.00018552971576227392,
64
+ "entropy": 0.8534275718033314,
65
+ "num_tokens": 384451.0,
66
+ "mean_token_accuracy": 0.7813827939331531,
67
+ "epoch": 0.3686635944700461,
68
+ "step": 50
69
+ },
70
+ {
71
+ "loss": 0.7797271728515625,
72
+ "grad_norm": 0.390625,
73
+ "learning_rate": 0.00018036175710594315,
74
+ "entropy": 0.7866893894970417,
75
+ "num_tokens": 461341.0,
76
+ "mean_token_accuracy": 0.7925485543906688,
77
+ "epoch": 0.4423963133640553,
78
+ "step": 60
79
+ },
80
+ {
81
+ "loss": 0.7610339641571044,
82
+ "grad_norm": 0.357421875,
83
+ "learning_rate": 0.00017519379844961242,
84
+ "entropy": 0.7790591172873974,
85
+ "num_tokens": 538835.0,
86
+ "mean_token_accuracy": 0.7936315566301346,
87
+ "epoch": 0.5161290322580645,
88
+ "step": 70
89
+ },
90
+ {
91
+ "loss": 0.7355214595794678,
92
+ "grad_norm": 0.306640625,
93
+ "learning_rate": 0.00017002583979328165,
94
+ "entropy": 0.7375507041811943,
95
+ "num_tokens": 615491.0,
96
+ "mean_token_accuracy": 0.8002951353788376,
97
+ "epoch": 0.5898617511520737,
98
+ "step": 80
99
+ },
100
+ {
101
+ "loss": 0.7126219749450684,
102
+ "grad_norm": 0.373046875,
103
+ "learning_rate": 0.00016485788113695092,
104
+ "entropy": 0.7339154161512852,
105
+ "num_tokens": 692464.0,
106
+ "mean_token_accuracy": 0.8024542592465878,
107
+ "epoch": 0.663594470046083,
108
+ "step": 90
109
+ },
110
+ {
111
+ "loss": 0.689023494720459,
112
+ "grad_norm": 0.353515625,
113
+ "learning_rate": 0.00015968992248062015,
114
+ "entropy": 0.7066651649773121,
115
+ "num_tokens": 770119.0,
116
+ "mean_token_accuracy": 0.8058759093284606,
117
+ "epoch": 0.7373271889400922,
118
+ "step": 100
119
+ },
120
+ {
121
+ "loss": 0.690799617767334,
122
+ "grad_norm": 0.330078125,
123
+ "learning_rate": 0.00015452196382428942,
124
+ "entropy": 0.7113537535071373,
125
+ "num_tokens": 847925.0,
126
+ "mean_token_accuracy": 0.804828480631113,
127
+ "epoch": 0.8110599078341014,
128
+ "step": 110
129
+ },
130
+ {
131
+ "loss": 0.6837788581848144,
132
+ "grad_norm": 0.306640625,
133
+ "learning_rate": 0.00014935400516795865,
134
+ "entropy": 0.6914405129849911,
135
+ "num_tokens": 925131.0,
136
+ "mean_token_accuracy": 0.8068704783916474,
137
+ "epoch": 0.8847926267281107,
138
+ "step": 120
139
+ },
140
+ {
141
+ "loss": 0.6697667598724365,
142
+ "grad_norm": 0.318359375,
143
+ "learning_rate": 0.00014418604651162791,
144
+ "entropy": 0.6796459473669529,
145
+ "num_tokens": 1002463.0,
146
+ "mean_token_accuracy": 0.808288037031889,
147
+ "epoch": 0.9585253456221198,
148
+ "step": 130
149
+ },
150
+ {
151
+ "eval_loss": 0.6677101254463196,
152
+ "eval_runtime": 29.1121,
153
+ "eval_samples_per_second": 8.278,
154
+ "eval_steps_per_second": 4.156,
155
+ "eval_entropy": 0.6754765791341293,
156
+ "eval_num_tokens": 1045851.0,
157
+ "eval_mean_token_accuracy": 0.8084481388084159,
158
+ "epoch": 1.0,
159
+ "step": 136
160
+ },
161
+ {
162
+ "loss": 0.6666770458221436,
163
+ "grad_norm": 0.330078125,
164
+ "learning_rate": 0.00013901808785529718,
165
+ "entropy": 0.6792283948365744,
166
+ "num_tokens": 1076868.0,
167
+ "mean_token_accuracy": 0.8102635524489663,
168
+ "epoch": 1.0294930875576036,
169
+ "step": 140
170
+ },
171
+ {
172
+ "loss": 0.6558178901672364,
173
+ "grad_norm": 0.33203125,
174
+ "learning_rate": 0.0001338501291989664,
175
+ "entropy": 0.6627626478672027,
176
+ "num_tokens": 1153869.0,
177
+ "mean_token_accuracy": 0.810472310334444,
178
+ "epoch": 1.103225806451613,
179
+ "step": 150
180
+ },
181
+ {
182
+ "loss": 0.6550488471984863,
183
+ "grad_norm": 0.326171875,
184
+ "learning_rate": 0.00012868217054263568,
185
+ "entropy": 0.6594419095665216,
186
+ "num_tokens": 1231453.0,
187
+ "mean_token_accuracy": 0.8117372930049896,
188
+ "epoch": 1.176958525345622,
189
+ "step": 160
190
+ },
191
+ {
192
+ "loss": 0.6612972736358642,
193
+ "grad_norm": 0.3828125,
194
+ "learning_rate": 0.0001235142118863049,
195
+ "entropy": 0.6753951165825128,
196
+ "num_tokens": 1309627.0,
197
+ "mean_token_accuracy": 0.8095706656575203,
198
+ "epoch": 1.2506912442396314,
199
+ "step": 170
200
+ },
201
+ {
202
+ "loss": 0.6569454669952393,
203
+ "grad_norm": 0.34765625,
204
+ "learning_rate": 0.00011834625322997418,
205
+ "entropy": 0.665694921836257,
206
+ "num_tokens": 1386811.0,
207
+ "mean_token_accuracy": 0.8107919678092003,
208
+ "epoch": 1.3244239631336405,
209
+ "step": 180
210
+ },
211
+ {
212
+ "loss": 0.6450295448303223,
213
+ "grad_norm": 0.353515625,
214
+ "learning_rate": 0.00011317829457364341,
215
+ "entropy": 0.648330107703805,
216
+ "num_tokens": 1463955.0,
217
+ "mean_token_accuracy": 0.8132139191031456,
218
+ "epoch": 1.3981566820276496,
219
+ "step": 190
220
+ },
221
+ {
222
+ "loss": 0.6420782566070556,
223
+ "grad_norm": 0.365234375,
224
+ "learning_rate": 0.00010801033591731266,
225
+ "entropy": 0.651269332319498,
226
+ "num_tokens": 1540151.0,
227
+ "mean_token_accuracy": 0.8131035573780536,
228
+ "epoch": 1.471889400921659,
229
+ "step": 200
230
+ },
231
+ {
232
+ "loss": 0.6521349430084229,
233
+ "grad_norm": 0.349609375,
234
+ "learning_rate": 0.00010284237726098191,
235
+ "entropy": 0.6608554765582084,
236
+ "num_tokens": 1616833.0,
237
+ "mean_token_accuracy": 0.8111298240721225,
238
+ "epoch": 1.5456221198156683,
239
+ "step": 210
240
+ },
241
+ {
242
+ "loss": 0.6140251159667969,
243
+ "grad_norm": 0.345703125,
244
+ "learning_rate": 9.767441860465116e-05,
245
+ "entropy": 0.6182018022984266,
246
+ "num_tokens": 1694024.0,
247
+ "mean_token_accuracy": 0.8197848223149776,
248
+ "epoch": 1.6193548387096774,
249
+ "step": 220
250
+ },
251
+ {
252
+ "loss": 0.6408394336700439,
253
+ "grad_norm": 0.34375,
254
+ "learning_rate": 9.250645994832042e-05,
255
+ "entropy": 0.6458881605416537,
256
+ "num_tokens": 1771607.0,
257
+ "mean_token_accuracy": 0.8150972366333008,
258
+ "epoch": 1.6930875576036866,
259
+ "step": 230
260
+ },
261
+ {
262
+ "loss": 0.6265644073486328,
263
+ "grad_norm": 0.353515625,
264
+ "learning_rate": 8.733850129198967e-05,
265
+ "entropy": 0.6397458579391241,
266
+ "num_tokens": 1847726.0,
267
+ "mean_token_accuracy": 0.8172210827469826,
268
+ "epoch": 1.766820276497696,
269
+ "step": 240
270
+ },
271
+ {
272
+ "loss": 0.6415011405944824,
273
+ "grad_norm": 0.384765625,
274
+ "learning_rate": 8.217054263565892e-05,
275
+ "entropy": 0.6451383080333472,
276
+ "num_tokens": 1924932.0,
277
+ "mean_token_accuracy": 0.8145086012780667,
278
+ "epoch": 1.840552995391705,
279
+ "step": 250
280
+ },
281
+ {
282
+ "loss": 0.6441933155059815,
283
+ "grad_norm": 0.34765625,
284
+ "learning_rate": 7.700258397932817e-05,
285
+ "entropy": 0.6579485025256873,
286
+ "num_tokens": 2002388.0,
287
+ "mean_token_accuracy": 0.8131789050996303,
288
+ "epoch": 1.9142857142857141,
289
+ "step": 260
290
+ },
291
+ {
292
+ "loss": 0.632361650466919,
293
+ "grad_norm": 0.369140625,
294
+ "learning_rate": 7.183462532299742e-05,
295
+ "entropy": 0.6430431701242924,
296
+ "num_tokens": 2079444.0,
297
+ "mean_token_accuracy": 0.8157039448618889,
298
+ "epoch": 1.9880184331797235,
299
+ "step": 270
300
+ },
301
+ {
302
+ "eval_loss": 0.6317952275276184,
303
+ "eval_runtime": 29.0711,
304
+ "eval_samples_per_second": 8.29,
305
+ "eval_steps_per_second": 4.162,
306
+ "eval_entropy": 0.6311489190937074,
307
+ "eval_num_tokens": 2091702.0,
308
+ "eval_mean_token_accuracy": 0.8150874223590883,
309
+ "epoch": 2.0,
310
+ "step": 272
311
+ },
312
+ {
313
+ "loss": 0.6199068546295166,
314
+ "grad_norm": 0.38671875,
315
+ "learning_rate": 6.666666666666667e-05,
316
+ "entropy": 0.6327911719873354,
317
+ "num_tokens": 2153507.0,
318
+ "mean_token_accuracy": 0.8170148621905934,
319
+ "epoch": 2.058986175115207,
320
+ "step": 280
321
+ },
322
+ {
323
+ "loss": 0.6268198013305664,
324
+ "grad_norm": 0.36328125,
325
+ "learning_rate": 6.149870801033592e-05,
326
+ "entropy": 0.6392732232809066,
327
+ "num_tokens": 2231255.0,
328
+ "mean_token_accuracy": 0.815488800406456,
329
+ "epoch": 2.1327188940092165,
330
+ "step": 290
331
+ },
332
+ {
333
+ "loss": 0.6272803783416748,
334
+ "grad_norm": 0.390625,
335
+ "learning_rate": 5.6330749354005176e-05,
336
+ "entropy": 0.6307303428649902,
337
+ "num_tokens": 2308122.0,
338
+ "mean_token_accuracy": 0.8148489408195019,
339
+ "epoch": 2.206451612903226,
340
+ "step": 300
341
+ },
342
+ {
343
+ "loss": 0.623120641708374,
344
+ "grad_norm": 0.384765625,
345
+ "learning_rate": 5.1162790697674425e-05,
346
+ "entropy": 0.6393906135112047,
347
+ "num_tokens": 2385089.0,
348
+ "mean_token_accuracy": 0.8190745867788791,
349
+ "epoch": 2.2801843317972352,
350
+ "step": 310
351
+ },
352
+ {
353
+ "loss": 0.6218606472015381,
354
+ "grad_norm": 0.361328125,
355
+ "learning_rate": 4.5994832041343674e-05,
356
+ "entropy": 0.631640600785613,
357
+ "num_tokens": 2462365.0,
358
+ "mean_token_accuracy": 0.8174237549304962,
359
+ "epoch": 2.353917050691244,
360
+ "step": 320
361
+ },
362
+ {
363
+ "loss": 0.6136510372161865,
364
+ "grad_norm": 0.34765625,
365
+ "learning_rate": 4.082687338501292e-05,
366
+ "entropy": 0.6208217907696962,
367
+ "num_tokens": 2539176.0,
368
+ "mean_token_accuracy": 0.8184750378131866,
369
+ "epoch": 2.4276497695852535,
370
+ "step": 330
371
+ },
372
+ {
373
+ "loss": 0.6091049194335938,
374
+ "grad_norm": 0.37109375,
375
+ "learning_rate": 3.565891472868217e-05,
376
+ "entropy": 0.6129930958151817,
377
+ "num_tokens": 2616393.0,
378
+ "mean_token_accuracy": 0.8213351160287857,
379
+ "epoch": 2.501382488479263,
380
+ "step": 340
381
+ },
382
+ {
383
+ "loss": 0.6212622642517089,
384
+ "grad_norm": 0.36328125,
385
+ "learning_rate": 3.0490956072351423e-05,
386
+ "entropy": 0.6352405440062284,
387
+ "num_tokens": 2693576.0,
388
+ "mean_token_accuracy": 0.8173153273761272,
389
+ "epoch": 2.5751152073732717,
390
+ "step": 350
391
+ },
392
+ {
393
+ "loss": 0.6044797897338867,
394
+ "grad_norm": 0.37890625,
395
+ "learning_rate": 2.5322997416020672e-05,
396
+ "entropy": 0.6222694877535104,
397
+ "num_tokens": 2771056.0,
398
+ "mean_token_accuracy": 0.8224904254078865,
399
+ "epoch": 2.648847926267281,
400
+ "step": 360
401
+ },
402
+ {
403
+ "loss": 0.6131954669952393,
404
+ "grad_norm": 0.369140625,
405
+ "learning_rate": 2.0155038759689922e-05,
406
+ "entropy": 0.6224170979112387,
407
+ "num_tokens": 2848650.0,
408
+ "mean_token_accuracy": 0.8191598542034626,
409
+ "epoch": 2.7225806451612904,
410
+ "step": 370
411
+ },
412
+ {
413
+ "loss": 0.6075997352600098,
414
+ "grad_norm": 0.380859375,
415
+ "learning_rate": 1.4987080103359175e-05,
416
+ "entropy": 0.6128175765275955,
417
+ "num_tokens": 2925519.0,
418
+ "mean_token_accuracy": 0.8221696980297566,
419
+ "epoch": 2.7963133640552993,
420
+ "step": 380
421
+ },
422
+ {
423
+ "loss": 0.6221665859222412,
424
+ "grad_norm": 0.36328125,
425
+ "learning_rate": 9.819121447028424e-06,
426
+ "entropy": 0.6337126068770885,
427
+ "num_tokens": 3002700.0,
428
+ "mean_token_accuracy": 0.8168866612017155,
429
+ "epoch": 2.8700460829493086,
430
+ "step": 390
431
+ },
432
+ {
433
+ "loss": 0.6017860889434814,
434
+ "grad_norm": 0.376953125,
435
+ "learning_rate": 4.651162790697674e-06,
436
+ "entropy": 0.6161656700074672,
437
+ "num_tokens": 3079293.0,
438
+ "mean_token_accuracy": 0.8221336029469967,
439
+ "epoch": 2.943778801843318,
440
+ "step": 400
441
+ },
442
+ {
443
+ "eval_loss": 0.6240883469581604,
444
+ "eval_runtime": 29.0986,
445
+ "eval_samples_per_second": 8.282,
446
+ "eval_steps_per_second": 4.158,
447
+ "eval_entropy": 0.6179555137295368,
448
+ "eval_num_tokens": 3137553.0,
449
+ "eval_mean_token_accuracy": 0.8167788755795187,
450
+ "epoch": 3.0,
451
+ "step": 408
452
+ },
453
+ {
454
+ "train_runtime": 2369.8149,
455
+ "train_samples_per_second": 2.747,
456
+ "train_steps_per_second": 0.172,
457
+ "total_flos": 2.571934125068083e+16,
458
+ "train_loss": 0.764826238155365,
459
+ "epoch": 3.0,
460
+ "step": 408
461
+ }
462
+ ]
463
+ }