PEFT
Safetensors
task1-noikd / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
d0aeee8 verified
Raw
History Blame Contribute Delete
60.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 346,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002890173410404624,
"grad_norm": 3.9370672702789307,
"learning_rate": 0.0,
"loss": 0.7823,
"step": 1
},
{
"epoch": 0.005780346820809248,
"grad_norm": 4.416071891784668,
"learning_rate": 1.9230769230769234e-06,
"loss": 0.629,
"step": 2
},
{
"epoch": 0.008670520231213872,
"grad_norm": 3.350208044052124,
"learning_rate": 3.846153846153847e-06,
"loss": 0.6008,
"step": 3
},
{
"epoch": 0.011560693641618497,
"grad_norm": 5.232722282409668,
"learning_rate": 5.76923076923077e-06,
"loss": 0.679,
"step": 4
},
{
"epoch": 0.014450867052023121,
"grad_norm": 5.795490741729736,
"learning_rate": 7.692307692307694e-06,
"loss": 0.6057,
"step": 5
},
{
"epoch": 0.017341040462427744,
"grad_norm": 2.650235652923584,
"learning_rate": 9.615384615384616e-06,
"loss": 0.5199,
"step": 6
},
{
"epoch": 0.02023121387283237,
"grad_norm": 5.815310955047607,
"learning_rate": 1.153846153846154e-05,
"loss": 0.6076,
"step": 7
},
{
"epoch": 0.023121387283236993,
"grad_norm": 4.2339348793029785,
"learning_rate": 1.3461538461538462e-05,
"loss": 0.5701,
"step": 8
},
{
"epoch": 0.02601156069364162,
"grad_norm": 3.251315116882324,
"learning_rate": 1.5384615384615387e-05,
"loss": 0.6286,
"step": 9
},
{
"epoch": 0.028901734104046242,
"grad_norm": 3.5599253177642822,
"learning_rate": 1.730769230769231e-05,
"loss": 0.5566,
"step": 10
},
{
"epoch": 0.031791907514450865,
"grad_norm": 3.8673434257507324,
"learning_rate": 1.923076923076923e-05,
"loss": 0.566,
"step": 11
},
{
"epoch": 0.03468208092485549,
"grad_norm": 2.9952478408813477,
"learning_rate": 2.1153846153846154e-05,
"loss": 0.6937,
"step": 12
},
{
"epoch": 0.03757225433526012,
"grad_norm": 3.5281341075897217,
"learning_rate": 2.307692307692308e-05,
"loss": 0.6003,
"step": 13
},
{
"epoch": 0.04046242774566474,
"grad_norm": 2.567943572998047,
"learning_rate": 2.5e-05,
"loss": 0.574,
"step": 14
},
{
"epoch": 0.04335260115606936,
"grad_norm": 7.31712532043457,
"learning_rate": 2.6923076923076923e-05,
"loss": 0.7504,
"step": 15
},
{
"epoch": 0.046242774566473986,
"grad_norm": 3.452094316482544,
"learning_rate": 2.8846153846153845e-05,
"loss": 0.5304,
"step": 16
},
{
"epoch": 0.049132947976878616,
"grad_norm": 2.3348515033721924,
"learning_rate": 3.0769230769230774e-05,
"loss": 0.7141,
"step": 17
},
{
"epoch": 0.05202312138728324,
"grad_norm": 3.4695210456848145,
"learning_rate": 3.269230769230769e-05,
"loss": 0.7448,
"step": 18
},
{
"epoch": 0.05491329479768786,
"grad_norm": 3.985524892807007,
"learning_rate": 3.461538461538462e-05,
"loss": 0.5799,
"step": 19
},
{
"epoch": 0.057803468208092484,
"grad_norm": 7.525129318237305,
"learning_rate": 3.653846153846154e-05,
"loss": 0.7446,
"step": 20
},
{
"epoch": 0.06069364161849711,
"grad_norm": 3.323482036590576,
"learning_rate": 3.846153846153846e-05,
"loss": 0.7274,
"step": 21
},
{
"epoch": 0.06358381502890173,
"grad_norm": 3.6092894077301025,
"learning_rate": 4.038461538461539e-05,
"loss": 0.6002,
"step": 22
},
{
"epoch": 0.06647398843930635,
"grad_norm": 2.250667095184326,
"learning_rate": 4.230769230769231e-05,
"loss": 0.6739,
"step": 23
},
{
"epoch": 0.06936416184971098,
"grad_norm": 2.5381484031677246,
"learning_rate": 4.423076923076923e-05,
"loss": 0.567,
"step": 24
},
{
"epoch": 0.07225433526011561,
"grad_norm": 2.2124691009521484,
"learning_rate": 4.615384615384616e-05,
"loss": 0.4648,
"step": 25
},
{
"epoch": 0.07514450867052024,
"grad_norm": 2.2364096641540527,
"learning_rate": 4.8076923076923084e-05,
"loss": 0.6629,
"step": 26
},
{
"epoch": 0.07803468208092486,
"grad_norm": 2.588923454284668,
"learning_rate": 5e-05,
"loss": 0.7154,
"step": 27
},
{
"epoch": 0.08092485549132948,
"grad_norm": 3.086376667022705,
"learning_rate": 5.192307692307693e-05,
"loss": 0.8617,
"step": 28
},
{
"epoch": 0.0838150289017341,
"grad_norm": 3.7653937339782715,
"learning_rate": 5.384615384615385e-05,
"loss": 0.6039,
"step": 29
},
{
"epoch": 0.08670520231213873,
"grad_norm": 3.9989309310913086,
"learning_rate": 5.576923076923077e-05,
"loss": 0.6681,
"step": 30
},
{
"epoch": 0.08959537572254335,
"grad_norm": 4.816265106201172,
"learning_rate": 5.769230769230769e-05,
"loss": 0.7213,
"step": 31
},
{
"epoch": 0.09248554913294797,
"grad_norm": 3.2914583683013916,
"learning_rate": 5.9615384615384616e-05,
"loss": 0.7758,
"step": 32
},
{
"epoch": 0.0953757225433526,
"grad_norm": 3.1118175983428955,
"learning_rate": 6.153846153846155e-05,
"loss": 0.5624,
"step": 33
},
{
"epoch": 0.09826589595375723,
"grad_norm": 5.037220478057861,
"learning_rate": 6.346153846153847e-05,
"loss": 0.7326,
"step": 34
},
{
"epoch": 0.10115606936416185,
"grad_norm": 2.9716150760650635,
"learning_rate": 6.538461538461539e-05,
"loss": 0.7097,
"step": 35
},
{
"epoch": 0.10404624277456648,
"grad_norm": 2.0839149951934814,
"learning_rate": 6.730769230769232e-05,
"loss": 0.3874,
"step": 36
},
{
"epoch": 0.1069364161849711,
"grad_norm": 2.59799861907959,
"learning_rate": 6.923076923076924e-05,
"loss": 0.644,
"step": 37
},
{
"epoch": 0.10982658959537572,
"grad_norm": 1.9887621402740479,
"learning_rate": 7.115384615384616e-05,
"loss": 0.5105,
"step": 38
},
{
"epoch": 0.11271676300578035,
"grad_norm": 3.2830650806427,
"learning_rate": 7.307692307692307e-05,
"loss": 0.583,
"step": 39
},
{
"epoch": 0.11560693641618497,
"grad_norm": 3.3676438331604004,
"learning_rate": 7.500000000000001e-05,
"loss": 0.5169,
"step": 40
},
{
"epoch": 0.11849710982658959,
"grad_norm": 2.505805253982544,
"learning_rate": 7.692307692307693e-05,
"loss": 0.392,
"step": 41
},
{
"epoch": 0.12138728323699421,
"grad_norm": 2.655906915664673,
"learning_rate": 7.884615384615384e-05,
"loss": 0.4053,
"step": 42
},
{
"epoch": 0.12427745664739884,
"grad_norm": 1.7659504413604736,
"learning_rate": 8.076923076923078e-05,
"loss": 0.4875,
"step": 43
},
{
"epoch": 0.12716763005780346,
"grad_norm": 3.4093832969665527,
"learning_rate": 8.26923076923077e-05,
"loss": 0.6551,
"step": 44
},
{
"epoch": 0.13005780346820808,
"grad_norm": 2.3968050479888916,
"learning_rate": 8.461538461538461e-05,
"loss": 0.6544,
"step": 45
},
{
"epoch": 0.1329479768786127,
"grad_norm": 2.447908401489258,
"learning_rate": 8.653846153846155e-05,
"loss": 0.5097,
"step": 46
},
{
"epoch": 0.13583815028901733,
"grad_norm": 2.634861707687378,
"learning_rate": 8.846153846153847e-05,
"loss": 0.8126,
"step": 47
},
{
"epoch": 0.13872832369942195,
"grad_norm": 3.087886333465576,
"learning_rate": 9.038461538461538e-05,
"loss": 0.474,
"step": 48
},
{
"epoch": 0.1416184971098266,
"grad_norm": 1.9871000051498413,
"learning_rate": 9.230769230769232e-05,
"loss": 0.502,
"step": 49
},
{
"epoch": 0.14450867052023122,
"grad_norm": 2.1079649925231934,
"learning_rate": 9.423076923076924e-05,
"loss": 0.6775,
"step": 50
},
{
"epoch": 0.14739884393063585,
"grad_norm": 2.279636859893799,
"learning_rate": 9.615384615384617e-05,
"loss": 0.3945,
"step": 51
},
{
"epoch": 0.15028901734104047,
"grad_norm": 7.591819763183594,
"learning_rate": 9.807692307692307e-05,
"loss": 0.5324,
"step": 52
},
{
"epoch": 0.1531791907514451,
"grad_norm": 2.810758352279663,
"learning_rate": 0.0001,
"loss": 0.6335,
"step": 53
},
{
"epoch": 0.15606936416184972,
"grad_norm": 3.4945573806762695,
"learning_rate": 0.00010192307692307692,
"loss": 0.6339,
"step": 54
},
{
"epoch": 0.15895953757225434,
"grad_norm": 2.4195852279663086,
"learning_rate": 0.00010384615384615386,
"loss": 0.6265,
"step": 55
},
{
"epoch": 0.16184971098265896,
"grad_norm": 4.045713424682617,
"learning_rate": 0.00010576923076923077,
"loss": 0.5058,
"step": 56
},
{
"epoch": 0.16473988439306358,
"grad_norm": 6.170461177825928,
"learning_rate": 0.0001076923076923077,
"loss": 0.7443,
"step": 57
},
{
"epoch": 0.1676300578034682,
"grad_norm": 5.076367378234863,
"learning_rate": 0.00010961538461538463,
"loss": 0.7224,
"step": 58
},
{
"epoch": 0.17052023121387283,
"grad_norm": 2.8472208976745605,
"learning_rate": 0.00011153846153846154,
"loss": 0.7003,
"step": 59
},
{
"epoch": 0.17341040462427745,
"grad_norm": 3.887516736984253,
"learning_rate": 0.00011346153846153846,
"loss": 0.5184,
"step": 60
},
{
"epoch": 0.17630057803468208,
"grad_norm": 2.9809770584106445,
"learning_rate": 0.00011538461538461538,
"loss": 0.6372,
"step": 61
},
{
"epoch": 0.1791907514450867,
"grad_norm": 3.3168740272521973,
"learning_rate": 0.00011730769230769231,
"loss": 0.8749,
"step": 62
},
{
"epoch": 0.18208092485549132,
"grad_norm": 2.3886494636535645,
"learning_rate": 0.00011923076923076923,
"loss": 0.63,
"step": 63
},
{
"epoch": 0.18497109826589594,
"grad_norm": 3.550581693649292,
"learning_rate": 0.00012115384615384615,
"loss": 0.6952,
"step": 64
},
{
"epoch": 0.18786127167630057,
"grad_norm": 1.6568704843521118,
"learning_rate": 0.0001230769230769231,
"loss": 0.6446,
"step": 65
},
{
"epoch": 0.1907514450867052,
"grad_norm": 2.4530906677246094,
"learning_rate": 0.000125,
"loss": 0.5753,
"step": 66
},
{
"epoch": 0.1936416184971098,
"grad_norm": 4.94483757019043,
"learning_rate": 0.00012692307692307693,
"loss": 0.651,
"step": 67
},
{
"epoch": 0.19653179190751446,
"grad_norm": 2.2728497982025146,
"learning_rate": 0.00012884615384615387,
"loss": 0.4722,
"step": 68
},
{
"epoch": 0.1994219653179191,
"grad_norm": 3.363915205001831,
"learning_rate": 0.00013076923076923077,
"loss": 0.5268,
"step": 69
},
{
"epoch": 0.2023121387283237,
"grad_norm": 1.469285249710083,
"learning_rate": 0.0001326923076923077,
"loss": 0.5414,
"step": 70
},
{
"epoch": 0.20520231213872833,
"grad_norm": 2.001321315765381,
"learning_rate": 0.00013461538461538464,
"loss": 0.4984,
"step": 71
},
{
"epoch": 0.20809248554913296,
"grad_norm": 1.615578293800354,
"learning_rate": 0.00013653846153846154,
"loss": 0.5189,
"step": 72
},
{
"epoch": 0.21098265895953758,
"grad_norm": 2.58544921875,
"learning_rate": 0.00013846153846153847,
"loss": 0.4723,
"step": 73
},
{
"epoch": 0.2138728323699422,
"grad_norm": 4.005505084991455,
"learning_rate": 0.00014038461538461538,
"loss": 0.9459,
"step": 74
},
{
"epoch": 0.21676300578034682,
"grad_norm": 2.0257527828216553,
"learning_rate": 0.0001423076923076923,
"loss": 0.5122,
"step": 75
},
{
"epoch": 0.21965317919075145,
"grad_norm": 2.009340286254883,
"learning_rate": 0.00014423076923076924,
"loss": 0.6415,
"step": 76
},
{
"epoch": 0.22254335260115607,
"grad_norm": 4.007143974304199,
"learning_rate": 0.00014615384615384615,
"loss": 0.8222,
"step": 77
},
{
"epoch": 0.2254335260115607,
"grad_norm": 34.34696578979492,
"learning_rate": 0.00014807692307692308,
"loss": 0.6795,
"step": 78
},
{
"epoch": 0.22832369942196531,
"grad_norm": 2.1211211681365967,
"learning_rate": 0.00015000000000000001,
"loss": 0.5763,
"step": 79
},
{
"epoch": 0.23121387283236994,
"grad_norm": 2.6914966106414795,
"learning_rate": 0.00015192307692307692,
"loss": 0.4353,
"step": 80
},
{
"epoch": 0.23410404624277456,
"grad_norm": 2.4915385246276855,
"learning_rate": 0.00015384615384615385,
"loss": 0.4739,
"step": 81
},
{
"epoch": 0.23699421965317918,
"grad_norm": 1.9629167318344116,
"learning_rate": 0.00015576923076923078,
"loss": 0.4507,
"step": 82
},
{
"epoch": 0.2398843930635838,
"grad_norm": 2.2498514652252197,
"learning_rate": 0.0001576923076923077,
"loss": 0.5249,
"step": 83
},
{
"epoch": 0.24277456647398843,
"grad_norm": 3.2324705123901367,
"learning_rate": 0.00015961538461538462,
"loss": 0.7692,
"step": 84
},
{
"epoch": 0.24566473988439305,
"grad_norm": 3.8878443241119385,
"learning_rate": 0.00016153846153846155,
"loss": 0.6224,
"step": 85
},
{
"epoch": 0.24855491329479767,
"grad_norm": 2.0419256687164307,
"learning_rate": 0.00016346153846153846,
"loss": 0.5012,
"step": 86
},
{
"epoch": 0.2514450867052023,
"grad_norm": 2.7544190883636475,
"learning_rate": 0.0001653846153846154,
"loss": 0.6072,
"step": 87
},
{
"epoch": 0.2543352601156069,
"grad_norm": 3.405441999435425,
"learning_rate": 0.00016730769230769232,
"loss": 0.6974,
"step": 88
},
{
"epoch": 0.25722543352601157,
"grad_norm": 2.1978983879089355,
"learning_rate": 0.00016923076923076923,
"loss": 0.5411,
"step": 89
},
{
"epoch": 0.26011560693641617,
"grad_norm": 2.8346517086029053,
"learning_rate": 0.00017115384615384616,
"loss": 0.6154,
"step": 90
},
{
"epoch": 0.2630057803468208,
"grad_norm": 1.8299992084503174,
"learning_rate": 0.0001730769230769231,
"loss": 0.5467,
"step": 91
},
{
"epoch": 0.2658959537572254,
"grad_norm": 1.805290937423706,
"learning_rate": 0.000175,
"loss": 0.5242,
"step": 92
},
{
"epoch": 0.26878612716763006,
"grad_norm": 3.1289992332458496,
"learning_rate": 0.00017692307692307693,
"loss": 0.6632,
"step": 93
},
{
"epoch": 0.27167630057803466,
"grad_norm": 1.9893652200698853,
"learning_rate": 0.00017884615384615386,
"loss": 0.534,
"step": 94
},
{
"epoch": 0.2745664739884393,
"grad_norm": 2.8228728771209717,
"learning_rate": 0.00018076923076923077,
"loss": 0.5522,
"step": 95
},
{
"epoch": 0.2774566473988439,
"grad_norm": 5.480401515960693,
"learning_rate": 0.0001826923076923077,
"loss": 0.5951,
"step": 96
},
{
"epoch": 0.28034682080924855,
"grad_norm": 1.9437628984451294,
"learning_rate": 0.00018461538461538463,
"loss": 0.5347,
"step": 97
},
{
"epoch": 0.2832369942196532,
"grad_norm": 4.530723571777344,
"learning_rate": 0.00018653846153846154,
"loss": 0.6329,
"step": 98
},
{
"epoch": 0.2861271676300578,
"grad_norm": 3.0920236110687256,
"learning_rate": 0.00018846153846153847,
"loss": 0.7599,
"step": 99
},
{
"epoch": 0.28901734104046245,
"grad_norm": 3.0723931789398193,
"learning_rate": 0.00019038461538461538,
"loss": 0.586,
"step": 100
},
{
"epoch": 0.29190751445086704,
"grad_norm": 2.4468233585357666,
"learning_rate": 0.00019230769230769233,
"loss": 0.7774,
"step": 101
},
{
"epoch": 0.2947976878612717,
"grad_norm": 6.143571376800537,
"learning_rate": 0.00019423076923076924,
"loss": 0.712,
"step": 102
},
{
"epoch": 0.2976878612716763,
"grad_norm": 2.4695823192596436,
"learning_rate": 0.00019615384615384615,
"loss": 0.6704,
"step": 103
},
{
"epoch": 0.30057803468208094,
"grad_norm": 4.654829502105713,
"learning_rate": 0.0001980769230769231,
"loss": 0.6444,
"step": 104
},
{
"epoch": 0.30346820809248554,
"grad_norm": 3.845311403274536,
"learning_rate": 0.0002,
"loss": 0.6366,
"step": 105
},
{
"epoch": 0.3063583815028902,
"grad_norm": 2.1229615211486816,
"learning_rate": 0.0001999994343137953,
"loss": 0.7983,
"step": 106
},
{
"epoch": 0.3092485549132948,
"grad_norm": 2.988642692565918,
"learning_rate": 0.0001999977372615812,
"loss": 0.6751,
"step": 107
},
{
"epoch": 0.31213872832369943,
"grad_norm": 2.2913780212402344,
"learning_rate": 0.00019999490886255764,
"loss": 0.6133,
"step": 108
},
{
"epoch": 0.315028901734104,
"grad_norm": 2.898115634918213,
"learning_rate": 0.00019999094914872442,
"loss": 0.5056,
"step": 109
},
{
"epoch": 0.3179190751445087,
"grad_norm": 2.857929229736328,
"learning_rate": 0.00019998585816488062,
"loss": 0.712,
"step": 110
},
{
"epoch": 0.3208092485549133,
"grad_norm": 2.8301687240600586,
"learning_rate": 0.0001999796359686242,
"loss": 0.5472,
"step": 111
},
{
"epoch": 0.3236994219653179,
"grad_norm": 3.0969371795654297,
"learning_rate": 0.0001999722826303514,
"loss": 0.4581,
"step": 112
},
{
"epoch": 0.3265895953757225,
"grad_norm": 2.5169310569763184,
"learning_rate": 0.00019996379823325583,
"loss": 0.5334,
"step": 113
},
{
"epoch": 0.32947976878612717,
"grad_norm": 3.3007657527923584,
"learning_rate": 0.0001999541828733277,
"loss": 0.7297,
"step": 114
},
{
"epoch": 0.33236994219653176,
"grad_norm": 21.18800163269043,
"learning_rate": 0.0001999434366593524,
"loss": 0.5495,
"step": 115
},
{
"epoch": 0.3352601156069364,
"grad_norm": 8.522454261779785,
"learning_rate": 0.00019993155971290976,
"loss": 0.624,
"step": 116
},
{
"epoch": 0.33815028901734107,
"grad_norm": 1.84962797164917,
"learning_rate": 0.00019991855216837224,
"loss": 0.4016,
"step": 117
},
{
"epoch": 0.34104046242774566,
"grad_norm": 2.1188342571258545,
"learning_rate": 0.00019990441417290356,
"loss": 0.6547,
"step": 118
},
{
"epoch": 0.3439306358381503,
"grad_norm": 2.076533079147339,
"learning_rate": 0.00019988914588645715,
"loss": 0.5654,
"step": 119
},
{
"epoch": 0.3468208092485549,
"grad_norm": 13.100842475891113,
"learning_rate": 0.00019987274748177418,
"loss": 0.6586,
"step": 120
},
{
"epoch": 0.34971098265895956,
"grad_norm": 1.797593355178833,
"learning_rate": 0.00019985521914438165,
"loss": 0.5363,
"step": 121
},
{
"epoch": 0.35260115606936415,
"grad_norm": 2.258298635482788,
"learning_rate": 0.00019983656107259038,
"loss": 0.5949,
"step": 122
},
{
"epoch": 0.3554913294797688,
"grad_norm": 5.892148494720459,
"learning_rate": 0.0001998167734774926,
"loss": 0.5705,
"step": 123
},
{
"epoch": 0.3583815028901734,
"grad_norm": 2.987213373184204,
"learning_rate": 0.00019979585658295974,
"loss": 0.6599,
"step": 124
},
{
"epoch": 0.36127167630057805,
"grad_norm": 2.419527769088745,
"learning_rate": 0.00019977381062563976,
"loss": 0.6948,
"step": 125
},
{
"epoch": 0.36416184971098264,
"grad_norm": 2.2409467697143555,
"learning_rate": 0.0001997506358549545,
"loss": 0.5827,
"step": 126
},
{
"epoch": 0.3670520231213873,
"grad_norm": 2.3863720893859863,
"learning_rate": 0.000199726332533097,
"loss": 0.8235,
"step": 127
},
{
"epoch": 0.3699421965317919,
"grad_norm": 1.678702712059021,
"learning_rate": 0.00019970090093502827,
"loss": 0.4232,
"step": 128
},
{
"epoch": 0.37283236994219654,
"grad_norm": 4.783276081085205,
"learning_rate": 0.00019967434134847442,
"loss": 0.6973,
"step": 129
},
{
"epoch": 0.37572254335260113,
"grad_norm": 3.0118343830108643,
"learning_rate": 0.0001996466540739233,
"loss": 0.5849,
"step": 130
},
{
"epoch": 0.3786127167630058,
"grad_norm": 2.192545175552368,
"learning_rate": 0.00019961783942462104,
"loss": 0.7507,
"step": 131
},
{
"epoch": 0.3815028901734104,
"grad_norm": 3.163344383239746,
"learning_rate": 0.00019958789772656869,
"loss": 0.6065,
"step": 132
},
{
"epoch": 0.38439306358381503,
"grad_norm": 1.3310883045196533,
"learning_rate": 0.00019955682931851833,
"loss": 0.3459,
"step": 133
},
{
"epoch": 0.3872832369942196,
"grad_norm": 3.6161105632781982,
"learning_rate": 0.0001995246345519694,
"loss": 0.665,
"step": 134
},
{
"epoch": 0.3901734104046243,
"grad_norm": 2.0753307342529297,
"learning_rate": 0.00019949131379116454,
"loss": 0.5999,
"step": 135
},
{
"epoch": 0.3930635838150289,
"grad_norm": 2.1736884117126465,
"learning_rate": 0.00019945686741308568,
"loss": 0.5472,
"step": 136
},
{
"epoch": 0.3959537572254335,
"grad_norm": 2.0952184200286865,
"learning_rate": 0.00019942129580744966,
"loss": 0.6137,
"step": 137
},
{
"epoch": 0.3988439306358382,
"grad_norm": 1.5082194805145264,
"learning_rate": 0.00019938459937670377,
"loss": 0.5229,
"step": 138
},
{
"epoch": 0.40173410404624277,
"grad_norm": 3.1461093425750732,
"learning_rate": 0.00019934677853602133,
"loss": 0.6932,
"step": 139
},
{
"epoch": 0.4046242774566474,
"grad_norm": 1.8693922758102417,
"learning_rate": 0.00019930783371329685,
"loss": 0.5875,
"step": 140
},
{
"epoch": 0.407514450867052,
"grad_norm": 1.8485612869262695,
"learning_rate": 0.0001992677653491414,
"loss": 0.4922,
"step": 141
},
{
"epoch": 0.41040462427745666,
"grad_norm": 2.376498222351074,
"learning_rate": 0.0001992265738968773,
"loss": 0.5951,
"step": 142
},
{
"epoch": 0.41329479768786126,
"grad_norm": 2.426241159439087,
"learning_rate": 0.00019918425982253334,
"loss": 0.4374,
"step": 143
},
{
"epoch": 0.4161849710982659,
"grad_norm": 2.2753922939300537,
"learning_rate": 0.00019914082360483924,
"loss": 0.4364,
"step": 144
},
{
"epoch": 0.4190751445086705,
"grad_norm": 2.095066785812378,
"learning_rate": 0.00019909626573522043,
"loss": 0.6519,
"step": 145
},
{
"epoch": 0.42196531791907516,
"grad_norm": 2.852267026901245,
"learning_rate": 0.0001990505867177923,
"loss": 0.5457,
"step": 146
},
{
"epoch": 0.42485549132947975,
"grad_norm": 3.5912299156188965,
"learning_rate": 0.0001990037870693547,
"loss": 0.7239,
"step": 147
},
{
"epoch": 0.4277456647398844,
"grad_norm": 4.073753833770752,
"learning_rate": 0.00019895586731938592,
"loss": 0.6287,
"step": 148
},
{
"epoch": 0.430635838150289,
"grad_norm": 2.287214756011963,
"learning_rate": 0.00019890682801003675,
"loss": 0.6114,
"step": 149
},
{
"epoch": 0.43352601156069365,
"grad_norm": 2.5429766178131104,
"learning_rate": 0.00019885666969612448,
"loss": 0.5747,
"step": 150
},
{
"epoch": 0.43641618497109824,
"grad_norm": 2.150695562362671,
"learning_rate": 0.00019880539294512637,
"loss": 0.5074,
"step": 151
},
{
"epoch": 0.4393063583815029,
"grad_norm": 2.7403922080993652,
"learning_rate": 0.00019875299833717347,
"loss": 0.7536,
"step": 152
},
{
"epoch": 0.4421965317919075,
"grad_norm": 3.5008723735809326,
"learning_rate": 0.0001986994864650439,
"loss": 0.5453,
"step": 153
},
{
"epoch": 0.44508670520231214,
"grad_norm": 3.3700931072235107,
"learning_rate": 0.00019864485793415624,
"loss": 0.5161,
"step": 154
},
{
"epoch": 0.4479768786127168,
"grad_norm": 4.802188873291016,
"learning_rate": 0.00019858911336256257,
"loss": 0.5873,
"step": 155
},
{
"epoch": 0.4508670520231214,
"grad_norm": 3.60945463180542,
"learning_rate": 0.00019853225338094168,
"loss": 0.5683,
"step": 156
},
{
"epoch": 0.45375722543352603,
"grad_norm": 4.407507419586182,
"learning_rate": 0.00019847427863259163,
"loss": 0.728,
"step": 157
},
{
"epoch": 0.45664739884393063,
"grad_norm": 1.6969048976898193,
"learning_rate": 0.00019841518977342272,
"loss": 0.5366,
"step": 158
},
{
"epoch": 0.4595375722543353,
"grad_norm": 2.2711470127105713,
"learning_rate": 0.00019835498747195008,
"loss": 0.7255,
"step": 159
},
{
"epoch": 0.4624277456647399,
"grad_norm": 2.0575389862060547,
"learning_rate": 0.00019829367240928588,
"loss": 0.6399,
"step": 160
},
{
"epoch": 0.4653179190751445,
"grad_norm": 2.3591747283935547,
"learning_rate": 0.00019823124527913185,
"loss": 0.5612,
"step": 161
},
{
"epoch": 0.4682080924855491,
"grad_norm": 2.3247318267822266,
"learning_rate": 0.00019816770678777128,
"loss": 0.5823,
"step": 162
},
{
"epoch": 0.47109826589595377,
"grad_norm": 3.523776054382324,
"learning_rate": 0.0001981030576540612,
"loss": 0.4893,
"step": 163
},
{
"epoch": 0.47398843930635837,
"grad_norm": 3.408984899520874,
"learning_rate": 0.00019803729860942397,
"loss": 0.6303,
"step": 164
},
{
"epoch": 0.476878612716763,
"grad_norm": 3.002817392349243,
"learning_rate": 0.00019797043039783936,
"loss": 0.428,
"step": 165
},
{
"epoch": 0.4797687861271676,
"grad_norm": 3.649641990661621,
"learning_rate": 0.00019790245377583583,
"loss": 0.7745,
"step": 166
},
{
"epoch": 0.48265895953757226,
"grad_norm": 2.694066286087036,
"learning_rate": 0.0001978333695124821,
"loss": 0.5923,
"step": 167
},
{
"epoch": 0.48554913294797686,
"grad_norm": 2.237886905670166,
"learning_rate": 0.00019776317838937857,
"loss": 0.4241,
"step": 168
},
{
"epoch": 0.4884393063583815,
"grad_norm": 2.7256064414978027,
"learning_rate": 0.00019769188120064812,
"loss": 0.6667,
"step": 169
},
{
"epoch": 0.4913294797687861,
"grad_norm": 2.352391004562378,
"learning_rate": 0.00019761947875292753,
"loss": 0.5162,
"step": 170
},
{
"epoch": 0.49421965317919075,
"grad_norm": 1.806130290031433,
"learning_rate": 0.00019754597186535814,
"loss": 0.4271,
"step": 171
},
{
"epoch": 0.49710982658959535,
"grad_norm": 4.625753402709961,
"learning_rate": 0.00019747136136957652,
"loss": 0.6047,
"step": 172
},
{
"epoch": 0.5,
"grad_norm": 2.8794641494750977,
"learning_rate": 0.0001973956481097053,
"loss": 0.6079,
"step": 173
},
{
"epoch": 0.5028901734104047,
"grad_norm": 6.379122734069824,
"learning_rate": 0.0001973188329423434,
"loss": 0.6843,
"step": 174
},
{
"epoch": 0.5057803468208093,
"grad_norm": 2.9266347885131836,
"learning_rate": 0.0001972409167365564,
"loss": 0.6334,
"step": 175
},
{
"epoch": 0.5086705202312138,
"grad_norm": 2.3678627014160156,
"learning_rate": 0.0001971619003738668,
"loss": 0.492,
"step": 176
},
{
"epoch": 0.5115606936416185,
"grad_norm": 3.024791955947876,
"learning_rate": 0.0001970817847482439,
"loss": 0.6436,
"step": 177
},
{
"epoch": 0.5144508670520231,
"grad_norm": 3.649306535720825,
"learning_rate": 0.00019700057076609378,
"loss": 0.6762,
"step": 178
},
{
"epoch": 0.5173410404624278,
"grad_norm": 2.16876482963562,
"learning_rate": 0.000196918259346249,
"loss": 0.5429,
"step": 179
},
{
"epoch": 0.5202312138728323,
"grad_norm": 1.873070478439331,
"learning_rate": 0.00019683485141995833,
"loss": 0.5997,
"step": 180
},
{
"epoch": 0.523121387283237,
"grad_norm": 2.5793845653533936,
"learning_rate": 0.00019675034793087596,
"loss": 0.6044,
"step": 181
},
{
"epoch": 0.5260115606936416,
"grad_norm": 2.754002332687378,
"learning_rate": 0.00019666474983505113,
"loss": 0.5323,
"step": 182
},
{
"epoch": 0.5289017341040463,
"grad_norm": 6.170619964599609,
"learning_rate": 0.000196578058100917,
"loss": 0.5035,
"step": 183
},
{
"epoch": 0.5317919075144508,
"grad_norm": 3.233739137649536,
"learning_rate": 0.00019649027370927997,
"loss": 0.6136,
"step": 184
},
{
"epoch": 0.5346820809248555,
"grad_norm": 2.786198377609253,
"learning_rate": 0.0001964013976533084,
"loss": 0.6555,
"step": 185
},
{
"epoch": 0.5375722543352601,
"grad_norm": 2.3221449851989746,
"learning_rate": 0.00019631143093852148,
"loss": 0.5819,
"step": 186
},
{
"epoch": 0.5404624277456648,
"grad_norm": 1.9092758893966675,
"learning_rate": 0.00019622037458277784,
"loss": 0.3828,
"step": 187
},
{
"epoch": 0.5433526011560693,
"grad_norm": 2.4435617923736572,
"learning_rate": 0.0001961282296162639,
"loss": 0.4853,
"step": 188
},
{
"epoch": 0.546242774566474,
"grad_norm": 2.263637065887451,
"learning_rate": 0.00019603499708148244,
"loss": 0.7792,
"step": 189
},
{
"epoch": 0.5491329479768786,
"grad_norm": 2.559516668319702,
"learning_rate": 0.0001959406780332406,
"loss": 0.5439,
"step": 190
},
{
"epoch": 0.5520231213872833,
"grad_norm": 2.9668209552764893,
"learning_rate": 0.0001958452735386381,
"loss": 0.5781,
"step": 191
},
{
"epoch": 0.5549132947976878,
"grad_norm": 3.6928887367248535,
"learning_rate": 0.00019574878467705503,
"loss": 0.5792,
"step": 192
},
{
"epoch": 0.5578034682080925,
"grad_norm": 2.337376594543457,
"learning_rate": 0.00019565121254013979,
"loss": 0.4896,
"step": 193
},
{
"epoch": 0.5606936416184971,
"grad_norm": 2.748382091522217,
"learning_rate": 0.00019555255823179658,
"loss": 0.662,
"step": 194
},
{
"epoch": 0.5635838150289018,
"grad_norm": 2.579615354537964,
"learning_rate": 0.00019545282286817303,
"loss": 0.6095,
"step": 195
},
{
"epoch": 0.5664739884393064,
"grad_norm": 2.7549307346343994,
"learning_rate": 0.00019535200757764756,
"loss": 0.6316,
"step": 196
},
{
"epoch": 0.569364161849711,
"grad_norm": 2.628067970275879,
"learning_rate": 0.0001952501135008165,
"loss": 0.4392,
"step": 197
},
{
"epoch": 0.5722543352601156,
"grad_norm": 2.262127637863159,
"learning_rate": 0.00019514714179048138,
"loss": 0.6284,
"step": 198
},
{
"epoch": 0.5751445086705202,
"grad_norm": 2.566689968109131,
"learning_rate": 0.00019504309361163566,
"loss": 0.4821,
"step": 199
},
{
"epoch": 0.5780346820809249,
"grad_norm": 2.607999324798584,
"learning_rate": 0.0001949379701414518,
"loss": 0.4861,
"step": 200
},
{
"epoch": 0.5809248554913294,
"grad_norm": 2.9310553073883057,
"learning_rate": 0.00019483177256926767,
"loss": 0.5088,
"step": 201
},
{
"epoch": 0.5838150289017341,
"grad_norm": 2.301926851272583,
"learning_rate": 0.00019472450209657332,
"loss": 0.5875,
"step": 202
},
{
"epoch": 0.5867052023121387,
"grad_norm": 4.31220006942749,
"learning_rate": 0.0001946161599369973,
"loss": 0.5177,
"step": 203
},
{
"epoch": 0.5895953757225434,
"grad_norm": 5.5418806076049805,
"learning_rate": 0.0001945067473162929,
"loss": 0.7289,
"step": 204
},
{
"epoch": 0.5924855491329479,
"grad_norm": 2.7495758533477783,
"learning_rate": 0.00019439626547232433,
"loss": 0.6581,
"step": 205
},
{
"epoch": 0.5953757225433526,
"grad_norm": 2.0072743892669678,
"learning_rate": 0.00019428471565505266,
"loss": 0.4789,
"step": 206
},
{
"epoch": 0.5982658959537572,
"grad_norm": 3.7675414085388184,
"learning_rate": 0.0001941720991265218,
"loss": 0.6848,
"step": 207
},
{
"epoch": 0.6011560693641619,
"grad_norm": 3.958646774291992,
"learning_rate": 0.00019405841716084403,
"loss": 0.6269,
"step": 208
},
{
"epoch": 0.6040462427745664,
"grad_norm": 2.2104835510253906,
"learning_rate": 0.00019394367104418576,
"loss": 0.617,
"step": 209
},
{
"epoch": 0.6069364161849711,
"grad_norm": 2.2552006244659424,
"learning_rate": 0.00019382786207475293,
"loss": 0.4416,
"step": 210
},
{
"epoch": 0.6098265895953757,
"grad_norm": 15.497671127319336,
"learning_rate": 0.0001937109915627762,
"loss": 0.666,
"step": 211
},
{
"epoch": 0.6127167630057804,
"grad_norm": 2.6296205520629883,
"learning_rate": 0.00019359306083049636,
"loss": 0.6624,
"step": 212
},
{
"epoch": 0.615606936416185,
"grad_norm": 4.349939346313477,
"learning_rate": 0.00019347407121214914,
"loss": 0.4786,
"step": 213
},
{
"epoch": 0.6184971098265896,
"grad_norm": 2.537097454071045,
"learning_rate": 0.00019335402405395028,
"loss": 0.4485,
"step": 214
},
{
"epoch": 0.6213872832369942,
"grad_norm": 3.6856346130371094,
"learning_rate": 0.00019323292071408017,
"loss": 0.4687,
"step": 215
},
{
"epoch": 0.6242774566473989,
"grad_norm": 2.6125998497009277,
"learning_rate": 0.00019311076256266864,
"loss": 0.7223,
"step": 216
},
{
"epoch": 0.6271676300578035,
"grad_norm": 3.913726568222046,
"learning_rate": 0.00019298755098177926,
"loss": 0.6944,
"step": 217
},
{
"epoch": 0.630057803468208,
"grad_norm": 2.3693478107452393,
"learning_rate": 0.00019286328736539386,
"loss": 0.7544,
"step": 218
},
{
"epoch": 0.6329479768786127,
"grad_norm": 2.682445764541626,
"learning_rate": 0.00019273797311939673,
"loss": 0.6182,
"step": 219
},
{
"epoch": 0.6358381502890174,
"grad_norm": 3.0521161556243896,
"learning_rate": 0.00019261160966155868,
"loss": 0.7034,
"step": 220
},
{
"epoch": 0.638728323699422,
"grad_norm": 3.621244192123413,
"learning_rate": 0.00019248419842152098,
"loss": 0.5941,
"step": 221
},
{
"epoch": 0.6416184971098265,
"grad_norm": 2.721808433532715,
"learning_rate": 0.00019235574084077928,
"loss": 0.7672,
"step": 222
},
{
"epoch": 0.6445086705202312,
"grad_norm": 2.4917008876800537,
"learning_rate": 0.0001922262383726672,
"loss": 0.4996,
"step": 223
},
{
"epoch": 0.6473988439306358,
"grad_norm": 3.646599531173706,
"learning_rate": 0.00019209569248233993,
"loss": 0.6037,
"step": 224
},
{
"epoch": 0.6502890173410405,
"grad_norm": 3.664189577102661,
"learning_rate": 0.00019196410464675766,
"loss": 0.5182,
"step": 225
},
{
"epoch": 0.653179190751445,
"grad_norm": 2.6397323608398438,
"learning_rate": 0.0001918314763546688,
"loss": 0.5783,
"step": 226
},
{
"epoch": 0.6560693641618497,
"grad_norm": 2.6510138511657715,
"learning_rate": 0.00019169780910659333,
"loss": 0.6793,
"step": 227
},
{
"epoch": 0.6589595375722543,
"grad_norm": 3.0694491863250732,
"learning_rate": 0.0001915631044148056,
"loss": 0.4479,
"step": 228
},
{
"epoch": 0.661849710982659,
"grad_norm": 3.7711856365203857,
"learning_rate": 0.00019142736380331726,
"loss": 0.7316,
"step": 229
},
{
"epoch": 0.6647398843930635,
"grad_norm": 2.7517523765563965,
"learning_rate": 0.00019129058880786024,
"loss": 0.5471,
"step": 230
},
{
"epoch": 0.6676300578034682,
"grad_norm": 2.3987295627593994,
"learning_rate": 0.00019115278097586903,
"loss": 0.4568,
"step": 231
},
{
"epoch": 0.6705202312138728,
"grad_norm": 2.181942939758301,
"learning_rate": 0.00019101394186646345,
"loss": 0.5614,
"step": 232
},
{
"epoch": 0.6734104046242775,
"grad_norm": 2.290876626968384,
"learning_rate": 0.00019087407305043086,
"loss": 0.5251,
"step": 233
},
{
"epoch": 0.6763005780346821,
"grad_norm": 5.837953090667725,
"learning_rate": 0.00019073317611020848,
"loss": 0.6924,
"step": 234
},
{
"epoch": 0.6791907514450867,
"grad_norm": 3.119746446609497,
"learning_rate": 0.0001905912526398654,
"loss": 0.5943,
"step": 235
},
{
"epoch": 0.6820809248554913,
"grad_norm": 2.223395824432373,
"learning_rate": 0.00019044830424508455,
"loss": 0.5688,
"step": 236
},
{
"epoch": 0.684971098265896,
"grad_norm": 1.6361844539642334,
"learning_rate": 0.00019030433254314474,
"loss": 0.4861,
"step": 237
},
{
"epoch": 0.6878612716763006,
"grad_norm": 3.7753753662109375,
"learning_rate": 0.000190159339162902,
"loss": 0.6932,
"step": 238
},
{
"epoch": 0.6907514450867052,
"grad_norm": 2.1991114616394043,
"learning_rate": 0.00019001332574477146,
"loss": 0.6108,
"step": 239
},
{
"epoch": 0.6936416184971098,
"grad_norm": 1.838686466217041,
"learning_rate": 0.00018986629394070865,
"loss": 0.4206,
"step": 240
},
{
"epoch": 0.6965317919075145,
"grad_norm": 3.784005641937256,
"learning_rate": 0.00018971824541419083,
"loss": 0.4805,
"step": 241
},
{
"epoch": 0.6994219653179191,
"grad_norm": 2.2212157249450684,
"learning_rate": 0.00018956918184019817,
"loss": 0.6023,
"step": 242
},
{
"epoch": 0.7023121387283237,
"grad_norm": 3.059682607650757,
"learning_rate": 0.0001894191049051948,
"loss": 0.6481,
"step": 243
},
{
"epoch": 0.7052023121387283,
"grad_norm": 2.1957714557647705,
"learning_rate": 0.00018926801630710983,
"loss": 0.5271,
"step": 244
},
{
"epoch": 0.708092485549133,
"grad_norm": 2.217278003692627,
"learning_rate": 0.0001891159177553179,
"loss": 0.548,
"step": 245
},
{
"epoch": 0.7109826589595376,
"grad_norm": 7.11065149307251,
"learning_rate": 0.0001889628109706201,
"loss": 0.5929,
"step": 246
},
{
"epoch": 0.7138728323699421,
"grad_norm": 2.9294638633728027,
"learning_rate": 0.00018880869768522432,
"loss": 0.8404,
"step": 247
},
{
"epoch": 0.7167630057803468,
"grad_norm": 2.464937925338745,
"learning_rate": 0.00018865357964272577,
"loss": 0.5228,
"step": 248
},
{
"epoch": 0.7196531791907514,
"grad_norm": 5.483953475952148,
"learning_rate": 0.00018849745859808717,
"loss": 0.7952,
"step": 249
},
{
"epoch": 0.7225433526011561,
"grad_norm": 3.3269643783569336,
"learning_rate": 0.00018834033631761897,
"loss": 0.5185,
"step": 250
},
{
"epoch": 0.7254335260115607,
"grad_norm": 4.274049282073975,
"learning_rate": 0.00018818221457895926,
"loss": 0.5198,
"step": 251
},
{
"epoch": 0.7283236994219653,
"grad_norm": 2.5081751346588135,
"learning_rate": 0.00018802309517105382,
"loss": 0.6717,
"step": 252
},
{
"epoch": 0.7312138728323699,
"grad_norm": 4.274162769317627,
"learning_rate": 0.00018786297989413568,
"loss": 0.6262,
"step": 253
},
{
"epoch": 0.7341040462427746,
"grad_norm": 3.4678189754486084,
"learning_rate": 0.0001877018705597049,
"loss": 0.71,
"step": 254
},
{
"epoch": 0.7369942196531792,
"grad_norm": 2.3224284648895264,
"learning_rate": 0.00018753976899050812,
"loss": 0.5718,
"step": 255
},
{
"epoch": 0.7398843930635838,
"grad_norm": 4.533274173736572,
"learning_rate": 0.00018737667702051764,
"loss": 0.4812,
"step": 256
},
{
"epoch": 0.7427745664739884,
"grad_norm": 2.149564743041992,
"learning_rate": 0.00018721259649491113,
"loss": 0.7892,
"step": 257
},
{
"epoch": 0.7456647398843931,
"grad_norm": 2.2297182083129883,
"learning_rate": 0.00018704752927005034,
"loss": 0.5942,
"step": 258
},
{
"epoch": 0.7485549132947977,
"grad_norm": 3.122997522354126,
"learning_rate": 0.0001868814772134603,
"loss": 0.5706,
"step": 259
},
{
"epoch": 0.7514450867052023,
"grad_norm": 3.6341025829315186,
"learning_rate": 0.00018671444220380817,
"loss": 0.5485,
"step": 260
},
{
"epoch": 0.7543352601156069,
"grad_norm": 2.1841745376586914,
"learning_rate": 0.00018654642613088194,
"loss": 0.4739,
"step": 261
},
{
"epoch": 0.7572254335260116,
"grad_norm": 7.414590835571289,
"learning_rate": 0.00018637743089556914,
"loss": 0.7979,
"step": 262
},
{
"epoch": 0.7601156069364162,
"grad_norm": 2.0329999923706055,
"learning_rate": 0.0001862074584098352,
"loss": 0.3878,
"step": 263
},
{
"epoch": 0.7630057803468208,
"grad_norm": 4.028386116027832,
"learning_rate": 0.00018603651059670198,
"loss": 0.7106,
"step": 264
},
{
"epoch": 0.7658959537572254,
"grad_norm": 2.708350896835327,
"learning_rate": 0.00018586458939022586,
"loss": 0.562,
"step": 265
},
{
"epoch": 0.7687861271676301,
"grad_norm": 4.317127227783203,
"learning_rate": 0.0001856916967354759,
"loss": 0.485,
"step": 266
},
{
"epoch": 0.7716763005780347,
"grad_norm": 8.568375587463379,
"learning_rate": 0.00018551783458851189,
"loss": 0.82,
"step": 267
},
{
"epoch": 0.7745664739884393,
"grad_norm": 3.708395481109619,
"learning_rate": 0.00018534300491636222,
"loss": 0.7111,
"step": 268
},
{
"epoch": 0.7774566473988439,
"grad_norm": 2.675475835800171,
"learning_rate": 0.0001851672096970016,
"loss": 0.7277,
"step": 269
},
{
"epoch": 0.7803468208092486,
"grad_norm": 2.684645175933838,
"learning_rate": 0.00018499045091932854,
"loss": 0.7138,
"step": 270
},
{
"epoch": 0.7832369942196532,
"grad_norm": 3.9458086490631104,
"learning_rate": 0.00018481273058314316,
"loss": 0.5333,
"step": 271
},
{
"epoch": 0.7861271676300579,
"grad_norm": 4.5245513916015625,
"learning_rate": 0.00018463405069912427,
"loss": 0.5308,
"step": 272
},
{
"epoch": 0.7890173410404624,
"grad_norm": 2.7652056217193604,
"learning_rate": 0.00018445441328880682,
"loss": 0.5391,
"step": 273
},
{
"epoch": 0.791907514450867,
"grad_norm": 7.237354278564453,
"learning_rate": 0.00018427382038455886,
"loss": 0.6985,
"step": 274
},
{
"epoch": 0.7947976878612717,
"grad_norm": 2.6692569255828857,
"learning_rate": 0.00018409227402955871,
"loss": 0.6546,
"step": 275
},
{
"epoch": 0.7976878612716763,
"grad_norm": 1.994786262512207,
"learning_rate": 0.00018390977627777175,
"loss": 0.4695,
"step": 276
},
{
"epoch": 0.8005780346820809,
"grad_norm": 5.524865627288818,
"learning_rate": 0.00018372632919392716,
"loss": 0.6673,
"step": 277
},
{
"epoch": 0.8034682080924855,
"grad_norm": 3.635315418243408,
"learning_rate": 0.00018354193485349468,
"loss": 0.6133,
"step": 278
},
{
"epoch": 0.8063583815028902,
"grad_norm": 3.2820193767547607,
"learning_rate": 0.00018335659534266094,
"loss": 0.7466,
"step": 279
},
{
"epoch": 0.8092485549132948,
"grad_norm": 3.4014973640441895,
"learning_rate": 0.00018317031275830607,
"loss": 0.4627,
"step": 280
},
{
"epoch": 0.8121387283236994,
"grad_norm": 4.467175006866455,
"learning_rate": 0.00018298308920797985,
"loss": 0.4536,
"step": 281
},
{
"epoch": 0.815028901734104,
"grad_norm": 3.8209848403930664,
"learning_rate": 0.0001827949268098778,
"loss": 0.8547,
"step": 282
},
{
"epoch": 0.8179190751445087,
"grad_norm": 2.063258647918701,
"learning_rate": 0.00018260582769281743,
"loss": 0.6634,
"step": 283
},
{
"epoch": 0.8208092485549133,
"grad_norm": 2.9422028064727783,
"learning_rate": 0.000182415793996214,
"loss": 0.4401,
"step": 284
},
{
"epoch": 0.8236994219653179,
"grad_norm": 3.1813411712646484,
"learning_rate": 0.0001822248278700563,
"loss": 0.5283,
"step": 285
},
{
"epoch": 0.8265895953757225,
"grad_norm": 9.887743949890137,
"learning_rate": 0.00018203293147488236,
"loss": 0.5051,
"step": 286
},
{
"epoch": 0.8294797687861272,
"grad_norm": 4.48236608505249,
"learning_rate": 0.00018184010698175506,
"loss": 0.7181,
"step": 287
},
{
"epoch": 0.8323699421965318,
"grad_norm": 3.4190428256988525,
"learning_rate": 0.00018164635657223755,
"loss": 0.7888,
"step": 288
},
{
"epoch": 0.8352601156069365,
"grad_norm": 10.325818061828613,
"learning_rate": 0.0001814516824383685,
"loss": 0.4366,
"step": 289
},
{
"epoch": 0.838150289017341,
"grad_norm": 2.561169147491455,
"learning_rate": 0.0001812560867826373,
"loss": 0.5973,
"step": 290
},
{
"epoch": 0.8410404624277457,
"grad_norm": 4.17984676361084,
"learning_rate": 0.0001810595718179593,
"loss": 0.4812,
"step": 291
},
{
"epoch": 0.8439306358381503,
"grad_norm": 3.0180745124816895,
"learning_rate": 0.00018086213976765053,
"loss": 0.4245,
"step": 292
},
{
"epoch": 0.846820809248555,
"grad_norm": 6.802261829376221,
"learning_rate": 0.00018066379286540277,
"loss": 0.4595,
"step": 293
},
{
"epoch": 0.8497109826589595,
"grad_norm": 1.6967475414276123,
"learning_rate": 0.00018046453335525815,
"loss": 0.4073,
"step": 294
},
{
"epoch": 0.8526011560693642,
"grad_norm": 3.690838575363159,
"learning_rate": 0.00018026436349158378,
"loss": 0.6901,
"step": 295
},
{
"epoch": 0.8554913294797688,
"grad_norm": 3.418741464614868,
"learning_rate": 0.00018006328553904627,
"loss": 0.732,
"step": 296
},
{
"epoch": 0.8583815028901735,
"grad_norm": 3.8998119831085205,
"learning_rate": 0.00017986130177258608,
"loss": 0.6355,
"step": 297
},
{
"epoch": 0.861271676300578,
"grad_norm": 3.209516763687134,
"learning_rate": 0.00017965841447739185,
"loss": 0.4862,
"step": 298
},
{
"epoch": 0.8641618497109826,
"grad_norm": 24.562183380126953,
"learning_rate": 0.00017945462594887445,
"loss": 0.6583,
"step": 299
},
{
"epoch": 0.8670520231213873,
"grad_norm": 3.064171552658081,
"learning_rate": 0.00017924993849264103,
"loss": 0.7262,
"step": 300
},
{
"epoch": 0.869942196531792,
"grad_norm": 1.6912119388580322,
"learning_rate": 0.000179044354424469,
"loss": 0.6391,
"step": 301
},
{
"epoch": 0.8728323699421965,
"grad_norm": 2.97265887260437,
"learning_rate": 0.00017883787607027987,
"loss": 0.4633,
"step": 302
},
{
"epoch": 0.8757225433526011,
"grad_norm": 2.1716482639312744,
"learning_rate": 0.00017863050576611265,
"loss": 0.4842,
"step": 303
},
{
"epoch": 0.8786127167630058,
"grad_norm": 3.3700201511383057,
"learning_rate": 0.00017842224585809784,
"loss": 0.7675,
"step": 304
},
{
"epoch": 0.8815028901734104,
"grad_norm": 4.462961673736572,
"learning_rate": 0.00017821309870243054,
"loss": 0.5033,
"step": 305
},
{
"epoch": 0.884393063583815,
"grad_norm": 7.080619812011719,
"learning_rate": 0.00017800306666534396,
"loss": 0.7154,
"step": 306
},
{
"epoch": 0.8872832369942196,
"grad_norm": 3.385098934173584,
"learning_rate": 0.00017779215212308265,
"loss": 0.6784,
"step": 307
},
{
"epoch": 0.8901734104046243,
"grad_norm": 2.8170244693756104,
"learning_rate": 0.00017758035746187552,
"loss": 0.663,
"step": 308
},
{
"epoch": 0.8930635838150289,
"grad_norm": 2.564734935760498,
"learning_rate": 0.0001773676850779089,
"loss": 0.466,
"step": 309
},
{
"epoch": 0.8959537572254336,
"grad_norm": 2.207930088043213,
"learning_rate": 0.00017715413737729954,
"loss": 0.5421,
"step": 310
},
{
"epoch": 0.8988439306358381,
"grad_norm": 1.9721407890319824,
"learning_rate": 0.00017693971677606714,
"loss": 0.5395,
"step": 311
},
{
"epoch": 0.9017341040462428,
"grad_norm": 5.2571492195129395,
"learning_rate": 0.00017672442570010728,
"loss": 0.4617,
"step": 312
},
{
"epoch": 0.9046242774566474,
"grad_norm": 12.551994323730469,
"learning_rate": 0.00017650826658516375,
"loss": 0.8504,
"step": 313
},
{
"epoch": 0.9075144508670521,
"grad_norm": 2.4020979404449463,
"learning_rate": 0.00017629124187680114,
"loss": 0.5158,
"step": 314
},
{
"epoch": 0.9104046242774566,
"grad_norm": 2.782106876373291,
"learning_rate": 0.00017607335403037712,
"loss": 0.5181,
"step": 315
},
{
"epoch": 0.9132947976878613,
"grad_norm": 3.5315322875976562,
"learning_rate": 0.0001758546055110147,
"loss": 0.5841,
"step": 316
},
{
"epoch": 0.9161849710982659,
"grad_norm": 2.20084547996521,
"learning_rate": 0.00017563499879357425,
"loss": 0.7207,
"step": 317
},
{
"epoch": 0.9190751445086706,
"grad_norm": 5.749044418334961,
"learning_rate": 0.0001754145363626256,
"loss": 0.623,
"step": 318
},
{
"epoch": 0.9219653179190751,
"grad_norm": 5.372833728790283,
"learning_rate": 0.00017519322071241983,
"loss": 0.7168,
"step": 319
},
{
"epoch": 0.9248554913294798,
"grad_norm": 2.0625364780426025,
"learning_rate": 0.0001749710543468612,
"loss": 0.5682,
"step": 320
},
{
"epoch": 0.9277456647398844,
"grad_norm": 3.331332206726074,
"learning_rate": 0.0001747480397794786,
"loss": 0.662,
"step": 321
},
{
"epoch": 0.930635838150289,
"grad_norm": 3.0149612426757812,
"learning_rate": 0.00017452417953339736,
"loss": 0.5443,
"step": 322
},
{
"epoch": 0.9335260115606936,
"grad_norm": 3.1888411045074463,
"learning_rate": 0.0001742994761413105,
"loss": 0.5307,
"step": 323
},
{
"epoch": 0.9364161849710982,
"grad_norm": 4.96549129486084,
"learning_rate": 0.0001740739321454503,
"loss": 0.7167,
"step": 324
},
{
"epoch": 0.9393063583815029,
"grad_norm": 3.0004189014434814,
"learning_rate": 0.0001738475500975592,
"loss": 0.5697,
"step": 325
},
{
"epoch": 0.9421965317919075,
"grad_norm": 3.025585889816284,
"learning_rate": 0.0001736203325588613,
"loss": 0.6224,
"step": 326
},
{
"epoch": 0.9450867052023122,
"grad_norm": 8.415863037109375,
"learning_rate": 0.00017339228210003305,
"loss": 0.9839,
"step": 327
},
{
"epoch": 0.9479768786127167,
"grad_norm": 3.1184732913970947,
"learning_rate": 0.00017316340130117447,
"loss": 0.6527,
"step": 328
},
{
"epoch": 0.9508670520231214,
"grad_norm": 3.056459903717041,
"learning_rate": 0.00017293369275177983,
"loss": 0.5031,
"step": 329
},
{
"epoch": 0.953757225433526,
"grad_norm": 2.2492904663085938,
"learning_rate": 0.00017270315905070822,
"loss": 0.4739,
"step": 330
},
{
"epoch": 0.9566473988439307,
"grad_norm": 2.757836103439331,
"learning_rate": 0.0001724718028061543,
"loss": 0.5388,
"step": 331
},
{
"epoch": 0.9595375722543352,
"grad_norm": 16.38518524169922,
"learning_rate": 0.00017223962663561883,
"loss": 0.5233,
"step": 332
},
{
"epoch": 0.9624277456647399,
"grad_norm": 2.7943203449249268,
"learning_rate": 0.00017200663316587896,
"loss": 0.5698,
"step": 333
},
{
"epoch": 0.9653179190751445,
"grad_norm": 4.621982097625732,
"learning_rate": 0.00017177282503295848,
"loss": 0.5271,
"step": 334
},
{
"epoch": 0.9682080924855492,
"grad_norm": 2.5519659519195557,
"learning_rate": 0.0001715382048820981,
"loss": 0.6399,
"step": 335
},
{
"epoch": 0.9710982658959537,
"grad_norm": 2.6549270153045654,
"learning_rate": 0.00017130277536772553,
"loss": 0.6801,
"step": 336
},
{
"epoch": 0.9739884393063584,
"grad_norm": 2.7866361141204834,
"learning_rate": 0.00017106653915342527,
"loss": 0.5165,
"step": 337
},
{
"epoch": 0.976878612716763,
"grad_norm": 2.5869662761688232,
"learning_rate": 0.00017082949891190872,
"loss": 0.5575,
"step": 338
},
{
"epoch": 0.9797687861271677,
"grad_norm": 2.5677103996276855,
"learning_rate": 0.00017059165732498372,
"loss": 0.5489,
"step": 339
},
{
"epoch": 0.9826589595375722,
"grad_norm": 2.837841033935547,
"learning_rate": 0.00017035301708352441,
"loss": 0.5938,
"step": 340
},
{
"epoch": 0.9855491329479769,
"grad_norm": 12.183934211730957,
"learning_rate": 0.0001701135808874406,
"loss": 0.4811,
"step": 341
},
{
"epoch": 0.9884393063583815,
"grad_norm": 1.8770211935043335,
"learning_rate": 0.00016987335144564742,
"loss": 0.4219,
"step": 342
},
{
"epoch": 0.9913294797687862,
"grad_norm": 2.3958323001861572,
"learning_rate": 0.0001696323314760344,
"loss": 0.3887,
"step": 343
},
{
"epoch": 0.9942196531791907,
"grad_norm": 3.1324470043182373,
"learning_rate": 0.00016939052370543506,
"loss": 0.6096,
"step": 344
},
{
"epoch": 0.9971098265895953,
"grad_norm": 3.9226608276367188,
"learning_rate": 0.00016914793086959576,
"loss": 0.4421,
"step": 345
},
{
"epoch": 1.0,
"grad_norm": 2.756448268890381,
"learning_rate": 0.0001689045557131449,
"loss": 0.5187,
"step": 346
}
],
"logging_steps": 1,
"max_steps": 1038,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.139629116238739e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}