File size: 13,057 Bytes
aae5814
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 3.3955925826390754,
  "eval_steps": 100,
  "global_step": 200,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.08599838753023381,
      "grad_norm": 20.39691162109375,
      "learning_rate": 4e-08,
      "loss": 1.1993448257446289,
      "num_input_tokens_seen": 95768,
      "step": 5,
      "train_runtime": 130.2777,
      "train_tokens_per_second": 735.107
    },
    {
      "epoch": 0.17199677506046762,
      "grad_norm": 20.53337860107422,
      "learning_rate": 9e-08,
      "loss": 1.23364200592041,
      "num_input_tokens_seen": 192088,
      "step": 10,
      "train_runtime": 256.1595,
      "train_tokens_per_second": 749.876
    },
    {
      "epoch": 0.25799516259070143,
      "grad_norm": 17.26736068725586,
      "learning_rate": 1.4e-07,
      "loss": 1.2103577613830567,
      "num_input_tokens_seen": 285904,
      "step": 15,
      "train_runtime": 381.9483,
      "train_tokens_per_second": 748.541
    },
    {
      "epoch": 0.34399355012093524,
      "grad_norm": 13.094156265258789,
      "learning_rate": 1.8999999999999998e-07,
      "loss": 1.1606547355651855,
      "num_input_tokens_seen": 380136,
      "step": 20,
      "train_runtime": 507.8013,
      "train_tokens_per_second": 748.592
    },
    {
      "epoch": 0.42999193765116905,
      "grad_norm": 8.614981651306152,
      "learning_rate": 2.4e-07,
      "loss": 1.1257909774780273,
      "num_input_tokens_seen": 473768,
      "step": 25,
      "train_runtime": 634.7096,
      "train_tokens_per_second": 746.433
    },
    {
      "epoch": 0.5159903251814029,
      "grad_norm": 6.893142223358154,
      "learning_rate": 2.9e-07,
      "loss": 1.0529449462890625,
      "num_input_tokens_seen": 570960,
      "step": 30,
      "train_runtime": 760.0374,
      "train_tokens_per_second": 751.226
    },
    {
      "epoch": 0.6019887127116367,
      "grad_norm": 6.435474395751953,
      "learning_rate": 3.4000000000000003e-07,
      "loss": 0.9501470565795899,
      "num_input_tokens_seen": 666904,
      "step": 35,
      "train_runtime": 885.8858,
      "train_tokens_per_second": 752.81
    },
    {
      "epoch": 0.6879871002418705,
      "grad_norm": 6.33709192276001,
      "learning_rate": 3.8999999999999997e-07,
      "loss": 0.9997085571289063,
      "num_input_tokens_seen": 759040,
      "step": 40,
      "train_runtime": 1011.9639,
      "train_tokens_per_second": 750.066
    },
    {
      "epoch": 0.7739854877721043,
      "grad_norm": 6.392234802246094,
      "learning_rate": 4.3999999999999997e-07,
      "loss": 0.941748046875,
      "num_input_tokens_seen": 854112,
      "step": 45,
      "train_runtime": 1137.7802,
      "train_tokens_per_second": 750.683
    },
    {
      "epoch": 0.8599838753023381,
      "grad_norm": 6.084305763244629,
      "learning_rate": 4.9e-07,
      "loss": 0.8405242919921875,
      "num_input_tokens_seen": 950760,
      "step": 50,
      "train_runtime": 1263.8056,
      "train_tokens_per_second": 752.299
    },
    {
      "epoch": 0.9459822628325719,
      "grad_norm": 5.806552886962891,
      "learning_rate": 5.4e-07,
      "loss": 0.8304224014282227,
      "num_input_tokens_seen": 1044848,
      "step": 55,
      "train_runtime": 1389.4662,
      "train_tokens_per_second": 751.978
    },
    {
      "epoch": 1.0171996775060468,
      "grad_norm": 5.317915439605713,
      "learning_rate": 5.9e-07,
      "loss": 0.7544718265533448,
      "num_input_tokens_seen": 1125192,
      "step": 60,
      "train_runtime": 1494.191,
      "train_tokens_per_second": 753.044
    },
    {
      "epoch": 1.1031980650362805,
      "grad_norm": 5.279268741607666,
      "learning_rate": 6.4e-07,
      "loss": 0.7000977993011475,
      "num_input_tokens_seen": 1220824,
      "step": 65,
      "train_runtime": 1619.8853,
      "train_tokens_per_second": 753.648
    },
    {
      "epoch": 1.1891964525665144,
      "grad_norm": 5.333123683929443,
      "learning_rate": 6.9e-07,
      "loss": 0.6922206878662109,
      "num_input_tokens_seen": 1314816,
      "step": 70,
      "train_runtime": 1745.5942,
      "train_tokens_per_second": 753.22
    },
    {
      "epoch": 1.275194840096748,
      "grad_norm": 5.560202598571777,
      "learning_rate": 7.4e-07,
      "loss": 0.6772861003875732,
      "num_input_tokens_seen": 1410040,
      "step": 75,
      "train_runtime": 1871.2742,
      "train_tokens_per_second": 753.519
    },
    {
      "epoch": 1.361193227626982,
      "grad_norm": 5.5269389152526855,
      "learning_rate": 7.9e-07,
      "loss": 0.6707859992980957,
      "num_input_tokens_seen": 1506248,
      "step": 80,
      "train_runtime": 1997.6031,
      "train_tokens_per_second": 754.028
    },
    {
      "epoch": 1.4471916151572157,
      "grad_norm": 5.004036903381348,
      "learning_rate": 8.399999999999999e-07,
      "loss": 0.6331174850463868,
      "num_input_tokens_seen": 1599296,
      "step": 85,
      "train_runtime": 2123.3979,
      "train_tokens_per_second": 753.178
    },
    {
      "epoch": 1.5331900026874496,
      "grad_norm": 5.266488552093506,
      "learning_rate": 8.9e-07,
      "loss": 0.6387096405029297,
      "num_input_tokens_seen": 1693400,
      "step": 90,
      "train_runtime": 2248.9337,
      "train_tokens_per_second": 752.979
    },
    {
      "epoch": 1.6191883902176833,
      "grad_norm": 4.819321155548096,
      "learning_rate": 9.399999999999999e-07,
      "loss": 0.5934211730957031,
      "num_input_tokens_seen": 1787000,
      "step": 95,
      "train_runtime": 2374.4655,
      "train_tokens_per_second": 752.59
    },
    {
      "epoch": 1.7051867777479173,
      "grad_norm": 4.935013771057129,
      "learning_rate": 9.9e-07,
      "loss": 0.6045561790466308,
      "num_input_tokens_seen": 1882104,
      "step": 100,
      "train_runtime": 2500.4896,
      "train_tokens_per_second": 752.694
    },
    {
      "epoch": 1.7051867777479173,
      "eval_loss": 0.5743909478187561,
      "eval_runtime": 10.9213,
      "eval_samples_per_second": 71.786,
      "eval_steps_per_second": 17.947,
      "num_input_tokens_seen": 1882104,
      "step": 100
    },
    {
      "epoch": 1.7911851652781512,
      "grad_norm": 4.882491588592529,
      "learning_rate": 9.9983558411534e-07,
      "loss": 0.5929690361022949,
      "num_input_tokens_seen": 1975008,
      "step": 105,
      "train_runtime": 2637.3808,
      "train_tokens_per_second": 748.852
    },
    {
      "epoch": 1.877183552808385,
      "grad_norm": 4.714536190032959,
      "learning_rate": 9.991678299006205e-07,
      "loss": 0.5646411418914795,
      "num_input_tokens_seen": 2071992,
      "step": 110,
      "train_runtime": 2763.47,
      "train_tokens_per_second": 749.779
    },
    {
      "epoch": 1.9631819403386186,
      "grad_norm": 5.484632968902588,
      "learning_rate": 9.979871469976195e-07,
      "loss": 0.5584239006042481,
      "num_input_tokens_seen": 2169008,
      "step": 115,
      "train_runtime": 2889.0567,
      "train_tokens_per_second": 750.767
    },
    {
      "epoch": 2.0343993550120936,
      "grad_norm": 4.425460338592529,
      "learning_rate": 9.962947486378324e-07,
      "loss": 0.5410833358764648,
      "num_input_tokens_seen": 2247720,
      "step": 120,
      "train_runtime": 2993.1338,
      "train_tokens_per_second": 750.959
    },
    {
      "epoch": 2.1203977425423273,
      "grad_norm": 4.904783725738525,
      "learning_rate": 9.940923738749777e-07,
      "loss": 0.42338247299194337,
      "num_input_tokens_seen": 2345128,
      "step": 125,
      "train_runtime": 3118.6594,
      "train_tokens_per_second": 751.967
    },
    {
      "epoch": 2.206396130072561,
      "grad_norm": 5.408900260925293,
      "learning_rate": 9.91382285798002e-07,
      "loss": 0.4106863021850586,
      "num_input_tokens_seen": 2439936,
      "step": 130,
      "train_runtime": 3244.2671,
      "train_tokens_per_second": 752.076
    },
    {
      "epoch": 2.292394517602795,
      "grad_norm": 5.198470115661621,
      "learning_rate": 9.88167269205602e-07,
      "loss": 0.4100049495697021,
      "num_input_tokens_seen": 2534144,
      "step": 135,
      "train_runtime": 3369.5649,
      "train_tokens_per_second": 752.069
    },
    {
      "epoch": 2.378392905133029,
      "grad_norm": 5.204331398010254,
      "learning_rate": 9.844506277446576e-07,
      "loss": 0.4073524475097656,
      "num_input_tokens_seen": 2629448,
      "step": 140,
      "train_runtime": 3495.376,
      "train_tokens_per_second": 752.265
    },
    {
      "epoch": 2.4643912926632625,
      "grad_norm": 5.216585159301758,
      "learning_rate": 9.802361805155097e-07,
      "loss": 0.39515421390533445,
      "num_input_tokens_seen": 2727304,
      "step": 145,
      "train_runtime": 3621.1152,
      "train_tokens_per_second": 753.167
    },
    {
      "epoch": 2.550389680193496,
      "grad_norm": 5.4826226234436035,
      "learning_rate": 9.755282581475767e-07,
      "loss": 0.4133957862854004,
      "num_input_tokens_seen": 2821616,
      "step": 150,
      "train_runtime": 3747.4831,
      "train_tokens_per_second": 752.936
    },
    {
      "epoch": 2.63638806772373,
      "grad_norm": 5.135773181915283,
      "learning_rate": 9.703316983493412e-07,
      "loss": 0.4020789623260498,
      "num_input_tokens_seen": 2916400,
      "step": 155,
      "train_runtime": 3873.6018,
      "train_tokens_per_second": 752.891
    },
    {
      "epoch": 2.722386455253964,
      "grad_norm": 5.220492839813232,
      "learning_rate": 9.646518409372759e-07,
      "loss": 0.38811378479003905,
      "num_input_tokens_seen": 3011424,
      "step": 160,
      "train_runtime": 3999.9318,
      "train_tokens_per_second": 752.869
    },
    {
      "epoch": 2.8083848427841978,
      "grad_norm": 5.276327133178711,
      "learning_rate": 9.584945223488226e-07,
      "loss": 0.40136079788208007,
      "num_input_tokens_seen": 3105176,
      "step": 165,
      "train_runtime": 4126.3897,
      "train_tokens_per_second": 752.516
    },
    {
      "epoch": 2.8943832303144315,
      "grad_norm": 5.527720928192139,
      "learning_rate": 9.518660696450567e-07,
      "loss": 0.3835641860961914,
      "num_input_tokens_seen": 3199872,
      "step": 170,
      "train_runtime": 4252.3976,
      "train_tokens_per_second": 752.487
    },
    {
      "epoch": 2.9803816178446656,
      "grad_norm": 5.367305755615234,
      "learning_rate": 9.447732940092059e-07,
      "loss": 0.37801907062530515,
      "num_input_tokens_seen": 3293376,
      "step": 175,
      "train_runtime": 4378.5735,
      "train_tokens_per_second": 752.157
    },
    {
      "epoch": 3.05159903251814,
      "grad_norm": 4.809284210205078,
      "learning_rate": 9.372234837476977e-07,
      "loss": 0.31443004608154296,
      "num_input_tokens_seen": 3372136,
      "step": 180,
      "train_runtime": 4483.0506,
      "train_tokens_per_second": 752.197
    },
    {
      "epoch": 3.1375974200483743,
      "grad_norm": 6.2316436767578125,
      "learning_rate": 9.29224396800933e-07,
      "loss": 0.22384190559387207,
      "num_input_tokens_seen": 3466240,
      "step": 185,
      "train_runtime": 4609.5773,
      "train_tokens_per_second": 751.965
    },
    {
      "epoch": 3.223595807578608,
      "grad_norm": 7.395747661590576,
      "learning_rate": 9.207842527714765e-07,
      "loss": 0.23196635246276856,
      "num_input_tokens_seen": 3562616,
      "step": 190,
      "train_runtime": 4735.6611,
      "train_tokens_per_second": 752.295
    },
    {
      "epoch": 3.3095941951088417,
      "grad_norm": 5.527756214141846,
      "learning_rate": 9.119117244778607e-07,
      "loss": 0.22302393913269042,
      "num_input_tokens_seen": 3658328,
      "step": 195,
      "train_runtime": 4861.5497,
      "train_tokens_per_second": 752.502
    },
    {
      "epoch": 3.3955925826390754,
      "grad_norm": 5.768650054931641,
      "learning_rate": 9.02615929042678e-07,
      "loss": 0.23009986877441407,
      "num_input_tokens_seen": 3754416,
      "step": 200,
      "train_runtime": 4987.5371,
      "train_tokens_per_second": 752.76
    },
    {
      "epoch": 3.3955925826390754,
      "eval_loss": 0.6245584487915039,
      "eval_runtime": 10.9548,
      "eval_samples_per_second": 71.567,
      "eval_steps_per_second": 17.892,
      "num_input_tokens_seen": 3754416,
      "step": 200
    }
  ],
  "logging_steps": 5,
  "max_steps": 590,
  "num_input_tokens_seen": 3754416,
  "num_train_epochs": 10,
  "save_steps": 200,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 1.875151003100119e+17,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}