DRIP / llava /final /DRIP-4x /trainer_state.json
YusenPeng's picture
Upload folder using huggingface_hub
9d11698 verified
Raw
History Blame Contribute Delete
328 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9959462834527675,
"eval_steps": 500,
"global_step": 1215,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0008197088752697675,
"grad_norm": 31.25939821656355,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 5.3177666664123535,
"learning_rate": 5.405405405405406e-07,
"loss": 1.8609,
"step": 1
},
{
"epoch": 0.001639417750539535,
"grad_norm": 28.575098245458886,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 2.1312272548675537,
"learning_rate": 1.0810810810810812e-06,
"loss": 1.7546,
"step": 2
},
{
"epoch": 0.0024591266258093022,
"grad_norm": 35.302910540538655,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.8120243549346924,
"learning_rate": 1.6216216216216219e-06,
"loss": 1.9104,
"step": 3
},
{
"epoch": 0.00327883550107907,
"grad_norm": 28.634039822476534,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.312492847442627,
"learning_rate": 2.1621621621621623e-06,
"loss": 1.8445,
"step": 4
},
{
"epoch": 0.0040985443763488375,
"grad_norm": 25.357485404982537,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.3623862266540527,
"learning_rate": 2.702702702702703e-06,
"loss": 1.6938,
"step": 5
},
{
"epoch": 0.0049182532516186045,
"grad_norm": 19.5662850755774,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 1.245206356048584,
"learning_rate": 3.2432432432432437e-06,
"loss": 1.6152,
"step": 6
},
{
"epoch": 0.005737962126888372,
"grad_norm": 9.137300779870639,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.8372451663017273,
"learning_rate": 3.7837837837837844e-06,
"loss": 1.3146,
"step": 7
},
{
"epoch": 0.00655767100215814,
"grad_norm": 7.791104350630075,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 2.1447579860687256,
"learning_rate": 4.324324324324325e-06,
"loss": 1.299,
"step": 8
},
{
"epoch": 0.007377379877427907,
"grad_norm": 5.541357588032241,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.24441809952259064,
"learning_rate": 4.864864864864866e-06,
"loss": 1.2754,
"step": 9
},
{
"epoch": 0.008197088752697675,
"grad_norm": 4.13393577088879,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.197355031967163,
"learning_rate": 5.405405405405406e-06,
"loss": 1.1651,
"step": 10
},
{
"epoch": 0.009016797627967442,
"grad_norm": 3.676833401499189,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 3.709336996078491,
"learning_rate": 5.945945945945947e-06,
"loss": 1.1987,
"step": 11
},
{
"epoch": 0.009836506503237209,
"grad_norm": 3.5497626147579258,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.4290322065353394,
"learning_rate": 6.486486486486487e-06,
"loss": 1.1451,
"step": 12
},
{
"epoch": 0.010656215378506978,
"grad_norm": 3.399775349461851,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.176706314086914,
"learning_rate": 7.027027027027028e-06,
"loss": 1.0625,
"step": 13
},
{
"epoch": 0.011475924253776745,
"grad_norm": 3.3339546887964984,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.5657956004142761,
"learning_rate": 7.567567567567569e-06,
"loss": 1.1174,
"step": 14
},
{
"epoch": 0.012295633129046512,
"grad_norm": 4.256309321290241,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.1778795719146729,
"learning_rate": 8.108108108108109e-06,
"loss": 1.0536,
"step": 15
},
{
"epoch": 0.01311534200431628,
"grad_norm": 3.802125705375291,
"latest_boundary_loss": 0.008855608291924,
"latest_lm_loss": 1.082108736038208,
"learning_rate": 8.64864864864865e-06,
"loss": 1.0681,
"step": 16
},
{
"epoch": 0.013935050879586047,
"grad_norm": 2.9326206499608105,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.2558324337005615,
"learning_rate": 9.189189189189191e-06,
"loss": 1.0765,
"step": 17
},
{
"epoch": 0.014754759754855814,
"grad_norm": 3.6165711212099407,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.24362049996852875,
"learning_rate": 9.729729729729732e-06,
"loss": 1.0516,
"step": 18
},
{
"epoch": 0.015574468630125581,
"grad_norm": 3.3499866597655554,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.2392970323562622,
"learning_rate": 1.027027027027027e-05,
"loss": 1.0974,
"step": 19
},
{
"epoch": 0.01639417750539535,
"grad_norm": 2.579933987298249,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 1.0953041315078735,
"learning_rate": 1.0810810810810812e-05,
"loss": 0.9487,
"step": 20
},
{
"epoch": 0.017213886380665115,
"grad_norm": 2.3483221873953597,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.6745284795761108,
"learning_rate": 1.1351351351351352e-05,
"loss": 0.993,
"step": 21
},
{
"epoch": 0.018033595255934884,
"grad_norm": 3.742831275610467,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.16304448246955872,
"learning_rate": 1.1891891891891894e-05,
"loss": 1.024,
"step": 22
},
{
"epoch": 0.018853304131204653,
"grad_norm": 2.5090421699555763,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.8424432873725891,
"learning_rate": 1.2432432432432433e-05,
"loss": 0.9253,
"step": 23
},
{
"epoch": 0.019673013006474418,
"grad_norm": 2.000757438596482,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.4152683913707733,
"learning_rate": 1.2972972972972975e-05,
"loss": 0.9311,
"step": 24
},
{
"epoch": 0.020492721881744187,
"grad_norm": 1.979442548882158,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 0.9323436617851257,
"learning_rate": 1.3513513513513515e-05,
"loss": 0.9326,
"step": 25
},
{
"epoch": 0.021312430757013955,
"grad_norm": 1.7448079878118872,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.6967086791992188,
"learning_rate": 1.4054054054054055e-05,
"loss": 0.8942,
"step": 26
},
{
"epoch": 0.02213213963228372,
"grad_norm": 2.435272259451533,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.3207102119922638,
"learning_rate": 1.4594594594594596e-05,
"loss": 0.9435,
"step": 27
},
{
"epoch": 0.02295184850755349,
"grad_norm": 1.6929753203488551,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.8046767711639404,
"learning_rate": 1.5135135135135138e-05,
"loss": 0.9388,
"step": 28
},
{
"epoch": 0.023771557382823258,
"grad_norm": 2.262187294853859,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.7773157954216003,
"learning_rate": 1.5675675675675676e-05,
"loss": 0.949,
"step": 29
},
{
"epoch": 0.024591266258093023,
"grad_norm": 2.186886822212014,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 1.2209771871566772,
"learning_rate": 1.6216216216216218e-05,
"loss": 0.9025,
"step": 30
},
{
"epoch": 0.025410975133362792,
"grad_norm": 2.0485773861717824,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.9707640409469604,
"learning_rate": 1.6756756756756757e-05,
"loss": 0.9158,
"step": 31
},
{
"epoch": 0.02623068400863256,
"grad_norm": 1.9242556720903616,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.8456425666809082,
"learning_rate": 1.72972972972973e-05,
"loss": 0.9234,
"step": 32
},
{
"epoch": 0.027050392883902326,
"grad_norm": 1.8817845177661898,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.0457288026809692,
"learning_rate": 1.783783783783784e-05,
"loss": 0.9023,
"step": 33
},
{
"epoch": 0.027870101759172095,
"grad_norm": 1.5974806786235274,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.6266984343528748,
"learning_rate": 1.8378378378378383e-05,
"loss": 0.8629,
"step": 34
},
{
"epoch": 0.02868981063444186,
"grad_norm": 1.663888629403112,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.7136289477348328,
"learning_rate": 1.891891891891892e-05,
"loss": 0.8917,
"step": 35
},
{
"epoch": 0.02950951950971163,
"grad_norm": 1.7872923233559073,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 1.230485439300537,
"learning_rate": 1.9459459459459463e-05,
"loss": 0.8635,
"step": 36
},
{
"epoch": 0.030329228384981397,
"grad_norm": 1.6877007594211078,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.8077595829963684,
"learning_rate": 2e-05,
"loss": 0.9108,
"step": 37
},
{
"epoch": 0.031148937260251162,
"grad_norm": 1.6829630317279687,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 1.4435068368911743,
"learning_rate": 1.999996467887392e-05,
"loss": 0.8874,
"step": 38
},
{
"epoch": 0.03196864613552093,
"grad_norm": 1.359279741218244,
"latest_boundary_loss": 0.00950749684125185,
"latest_lm_loss": 1.0019148588180542,
"learning_rate": 1.9999858715745195e-05,
"loss": 0.8813,
"step": 39
},
{
"epoch": 0.0327883550107907,
"grad_norm": 1.4864524626512068,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.6017656326293945,
"learning_rate": 1.9999682111362368e-05,
"loss": 0.8822,
"step": 40
},
{
"epoch": 0.03360806388606047,
"grad_norm": 1.479905474829296,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.1819598376750946,
"learning_rate": 1.9999434866973018e-05,
"loss": 0.8409,
"step": 41
},
{
"epoch": 0.03442777276133023,
"grad_norm": 1.3212003159470103,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.8792177438735962,
"learning_rate": 1.999911698432373e-05,
"loss": 0.8811,
"step": 42
},
{
"epoch": 0.0352474816366,
"grad_norm": 1.6960213223283769,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.533574104309082,
"learning_rate": 1.9998728465660105e-05,
"loss": 0.8558,
"step": 43
},
{
"epoch": 0.03606719051186977,
"grad_norm": 1.893518679098996,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.093450903892517,
"learning_rate": 1.9998269313726722e-05,
"loss": 0.8378,
"step": 44
},
{
"epoch": 0.036886899387139536,
"grad_norm": 1.6735007412782994,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.6832482814788818,
"learning_rate": 1.9997739531767132e-05,
"loss": 0.8519,
"step": 45
},
{
"epoch": 0.037706608262409305,
"grad_norm": 1.6683964829519897,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.16073894500732422,
"learning_rate": 1.999713912352384e-05,
"loss": 0.8909,
"step": 46
},
{
"epoch": 0.038526317137679074,
"grad_norm": 2.5769564730458474,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.9443431496620178,
"learning_rate": 1.9996468093238256e-05,
"loss": 0.8974,
"step": 47
},
{
"epoch": 0.039346026012948836,
"grad_norm": 1.8967485674092166,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.8494566679000854,
"learning_rate": 1.9995726445650698e-05,
"loss": 0.8073,
"step": 48
},
{
"epoch": 0.040165734888218604,
"grad_norm": 1.723435229634082,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.097643256187439,
"learning_rate": 1.999491418600033e-05,
"loss": 0.8169,
"step": 49
},
{
"epoch": 0.04098544376348837,
"grad_norm": 1.527105240205358,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.4146791100502014,
"learning_rate": 1.999403132002513e-05,
"loss": 0.8518,
"step": 50
},
{
"epoch": 0.04180515263875814,
"grad_norm": 1.7320637245358526,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.7017815113067627,
"learning_rate": 1.9993077853961874e-05,
"loss": 0.8732,
"step": 51
},
{
"epoch": 0.04262486151402791,
"grad_norm": 1.6051506326311777,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 1.407310962677002,
"learning_rate": 1.999205379454605e-05,
"loss": 0.825,
"step": 52
},
{
"epoch": 0.04344457038929768,
"grad_norm": 1.7925669800476414,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.4606729745864868,
"learning_rate": 1.999095914901185e-05,
"loss": 0.8772,
"step": 53
},
{
"epoch": 0.04426427926456744,
"grad_norm": 1.542186786745815,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 1.0994019508361816,
"learning_rate": 1.9989793925092092e-05,
"loss": 0.8293,
"step": 54
},
{
"epoch": 0.04508398813983721,
"grad_norm": 1.7025691062836932,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.1215992271900177,
"learning_rate": 1.9988558131018188e-05,
"loss": 0.8448,
"step": 55
},
{
"epoch": 0.04590369701510698,
"grad_norm": 1.856626517805509,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 1.604791283607483,
"learning_rate": 1.9987251775520056e-05,
"loss": 0.8889,
"step": 56
},
{
"epoch": 0.04672340589037675,
"grad_norm": 1.591130439600799,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 1.3882758617401123,
"learning_rate": 1.9985874867826095e-05,
"loss": 0.8284,
"step": 57
},
{
"epoch": 0.047543114765646516,
"grad_norm": 1.5457923397878055,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.8114826679229736,
"learning_rate": 1.9984427417663085e-05,
"loss": 0.8869,
"step": 58
},
{
"epoch": 0.04836282364091628,
"grad_norm": 1.541201561325913,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.12212160974740982,
"learning_rate": 1.9982909435256143e-05,
"loss": 0.8339,
"step": 59
},
{
"epoch": 0.049182532516186046,
"grad_norm": 1.4132981100343078,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.1693421602249146,
"learning_rate": 1.998132093132864e-05,
"loss": 0.838,
"step": 60
},
{
"epoch": 0.050002241391455815,
"grad_norm": 1.5914305063888234,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.5888212323188782,
"learning_rate": 1.9979661917102116e-05,
"loss": 0.8659,
"step": 61
},
{
"epoch": 0.050821950266725584,
"grad_norm": 2.0348444853470142,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.7901957035064697,
"learning_rate": 1.997793240429623e-05,
"loss": 0.8222,
"step": 62
},
{
"epoch": 0.05164165914199535,
"grad_norm": 1.392502894520277,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.24341143667697906,
"learning_rate": 1.9976132405128646e-05,
"loss": 0.8568,
"step": 63
},
{
"epoch": 0.05246136801726512,
"grad_norm": 1.577969202664421,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.6221321821212769,
"learning_rate": 1.997426193231497e-05,
"loss": 0.8625,
"step": 64
},
{
"epoch": 0.05328107689253488,
"grad_norm": 1.3109183297694251,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.9815806746482849,
"learning_rate": 1.9972320999068636e-05,
"loss": 0.8322,
"step": 65
},
{
"epoch": 0.05410078576780465,
"grad_norm": 1.3729680816192045,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.8472562432289124,
"learning_rate": 1.997030961910084e-05,
"loss": 0.8716,
"step": 66
},
{
"epoch": 0.05492049464307442,
"grad_norm": 1.326944200238791,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.06413651257753372,
"learning_rate": 1.9968227806620413e-05,
"loss": 0.8405,
"step": 67
},
{
"epoch": 0.05574020351834419,
"grad_norm": 1.4117021923200894,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.19976989924907684,
"learning_rate": 1.9966075576333757e-05,
"loss": 0.8341,
"step": 68
},
{
"epoch": 0.05655991239361396,
"grad_norm": 1.3361285723526664,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.8418336510658264,
"learning_rate": 1.9963852943444703e-05,
"loss": 0.8589,
"step": 69
},
{
"epoch": 0.05737962126888372,
"grad_norm": 1.3912245618801216,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 1.5732471942901611,
"learning_rate": 1.996155992365444e-05,
"loss": 0.8336,
"step": 70
},
{
"epoch": 0.05819933014415349,
"grad_norm": 1.2070062463674183,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.08601975440979,
"learning_rate": 1.995919653316137e-05,
"loss": 0.824,
"step": 71
},
{
"epoch": 0.05901903901942326,
"grad_norm": 1.335040611105836,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.36412352323532104,
"learning_rate": 1.9956762788661018e-05,
"loss": 0.8422,
"step": 72
},
{
"epoch": 0.059838747894693026,
"grad_norm": 1.5185495432497875,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.6155502796173096,
"learning_rate": 1.9954258707345903e-05,
"loss": 0.8407,
"step": 73
},
{
"epoch": 0.060658456769962794,
"grad_norm": 1.6209437176668773,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 0.1864786297082901,
"learning_rate": 1.9951684306905418e-05,
"loss": 0.812,
"step": 74
},
{
"epoch": 0.06147816564523256,
"grad_norm": 1.753377664055131,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.1503336429595947,
"learning_rate": 1.9949039605525705e-05,
"loss": 0.8336,
"step": 75
},
{
"epoch": 0.062297874520502325,
"grad_norm": 1.6748790683626724,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.797813355922699,
"learning_rate": 1.9946324621889538e-05,
"loss": 0.8622,
"step": 76
},
{
"epoch": 0.0631175833957721,
"grad_norm": 1.9786701343389177,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 2.8772706985473633,
"learning_rate": 1.9943539375176164e-05,
"loss": 0.8606,
"step": 77
},
{
"epoch": 0.06393729227104186,
"grad_norm": 1.5328107519412169,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.7567794322967529,
"learning_rate": 1.99406838850612e-05,
"loss": 0.8126,
"step": 78
},
{
"epoch": 0.06475700114631162,
"grad_norm": 1.3299731535201258,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.5706217885017395,
"learning_rate": 1.9937758171716468e-05,
"loss": 0.8319,
"step": 79
},
{
"epoch": 0.0655767100215814,
"grad_norm": 1.2826156775428696,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.2339491844177246,
"learning_rate": 1.9934762255809866e-05,
"loss": 0.8338,
"step": 80
},
{
"epoch": 0.06639641889685116,
"grad_norm": 1.4135853186885827,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.7502679824829102,
"learning_rate": 1.993169615850522e-05,
"loss": 0.8451,
"step": 81
},
{
"epoch": 0.06721612777212094,
"grad_norm": 1.2531079580151232,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.3107645511627197,
"learning_rate": 1.992855990146213e-05,
"loss": 0.8384,
"step": 82
},
{
"epoch": 0.0680358366473907,
"grad_norm": 1.354109570277206,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 1.231244444847107,
"learning_rate": 1.9925353506835827e-05,
"loss": 0.8114,
"step": 83
},
{
"epoch": 0.06885554552266046,
"grad_norm": 1.3749557401519394,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.03806804493069649,
"learning_rate": 1.9922076997277e-05,
"loss": 0.7859,
"step": 84
},
{
"epoch": 0.06967525439793024,
"grad_norm": 1.168799411174339,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.8500906825065613,
"learning_rate": 1.9918730395931648e-05,
"loss": 0.8345,
"step": 85
},
{
"epoch": 0.0704949632732,
"grad_norm": 1.3061603459526208,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 1.041812777519226,
"learning_rate": 1.9915313726440922e-05,
"loss": 0.7831,
"step": 86
},
{
"epoch": 0.07131467214846977,
"grad_norm": 1.3404561638385657,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.0997252464294434,
"learning_rate": 1.9911827012940944e-05,
"loss": 0.8322,
"step": 87
},
{
"epoch": 0.07213438102373954,
"grad_norm": 1.4760469180002984,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.5108449459075928,
"learning_rate": 1.9908270280062643e-05,
"loss": 0.8312,
"step": 88
},
{
"epoch": 0.07295408989900931,
"grad_norm": 1.2326348475146698,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.5451737642288208,
"learning_rate": 1.9904643552931578e-05,
"loss": 0.8038,
"step": 89
},
{
"epoch": 0.07377379877427907,
"grad_norm": 1.512380507544568,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.2299585342407227,
"learning_rate": 1.9900946857167768e-05,
"loss": 0.8376,
"step": 90
},
{
"epoch": 0.07459350764954883,
"grad_norm": 1.5911836381997428,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.9883151650428772,
"learning_rate": 1.989718021888551e-05,
"loss": 0.8157,
"step": 91
},
{
"epoch": 0.07541321652481861,
"grad_norm": 1.3978617102980668,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.06017254665493965,
"learning_rate": 1.9893343664693177e-05,
"loss": 0.813,
"step": 92
},
{
"epoch": 0.07623292540008837,
"grad_norm": 1.7501747935459977,
"latest_boundary_loss": 0.008892906829714775,
"latest_lm_loss": 0.500453531742096,
"learning_rate": 1.9889437221693053e-05,
"loss": 0.8051,
"step": 93
},
{
"epoch": 0.07705263427535815,
"grad_norm": 1.6714122227195018,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.3647129237651825,
"learning_rate": 1.9885460917481137e-05,
"loss": 0.8456,
"step": 94
},
{
"epoch": 0.07787234315062791,
"grad_norm": 1.41809490894225,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.3116203844547272,
"learning_rate": 1.988141478014693e-05,
"loss": 0.7709,
"step": 95
},
{
"epoch": 0.07869205202589767,
"grad_norm": 1.31508854311171,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.0869554281234741,
"learning_rate": 1.9877298838273263e-05,
"loss": 0.8036,
"step": 96
},
{
"epoch": 0.07951176090116745,
"grad_norm": 1.501736998971986,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.3767385482788086,
"learning_rate": 1.9873113120936074e-05,
"loss": 0.8341,
"step": 97
},
{
"epoch": 0.08033146977643721,
"grad_norm": 1.3950892005942184,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.016499334946274757,
"learning_rate": 1.9868857657704215e-05,
"loss": 0.8035,
"step": 98
},
{
"epoch": 0.08115117865170698,
"grad_norm": 1.4412103297682761,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.016377875581383705,
"learning_rate": 1.9864532478639233e-05,
"loss": 0.8269,
"step": 99
},
{
"epoch": 0.08197088752697675,
"grad_norm": 1.5089601922926945,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 1.6621798276901245,
"learning_rate": 1.986013761429517e-05,
"loss": 0.8461,
"step": 100
},
{
"epoch": 0.08279059640224651,
"grad_norm": 1.324715924071776,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.30458226799964905,
"learning_rate": 1.9855673095718338e-05,
"loss": 0.8137,
"step": 101
},
{
"epoch": 0.08361030527751628,
"grad_norm": 1.2953067712761148,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.3760262429714203,
"learning_rate": 1.9851138954447097e-05,
"loss": 0.778,
"step": 102
},
{
"epoch": 0.08443001415278605,
"grad_norm": 1.3734209998446478,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.1049243211746216,
"learning_rate": 1.9846535222511648e-05,
"loss": 0.8102,
"step": 103
},
{
"epoch": 0.08524972302805582,
"grad_norm": 1.604522971243853,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.5241772532463074,
"learning_rate": 1.9841861932433784e-05,
"loss": 0.8374,
"step": 104
},
{
"epoch": 0.08606943190332558,
"grad_norm": 1.442726344196342,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.30671101808547974,
"learning_rate": 1.983711911722669e-05,
"loss": 0.8281,
"step": 105
},
{
"epoch": 0.08688914077859536,
"grad_norm": 1.4082398184230607,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.5678154826164246,
"learning_rate": 1.9832306810394665e-05,
"loss": 0.8182,
"step": 106
},
{
"epoch": 0.08770884965386512,
"grad_norm": 1.355781738267841,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.4872472286224365,
"learning_rate": 1.982742504593294e-05,
"loss": 0.8042,
"step": 107
},
{
"epoch": 0.08852855852913488,
"grad_norm": 1.4865717290375031,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.3586854934692383,
"learning_rate": 1.9822473858327398e-05,
"loss": 0.8437,
"step": 108
},
{
"epoch": 0.08934826740440466,
"grad_norm": 1.4691066939447524,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.4806958436965942,
"learning_rate": 1.9817453282554334e-05,
"loss": 0.7852,
"step": 109
},
{
"epoch": 0.09016797627967442,
"grad_norm": 1.45975271876467,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.8888470530509949,
"learning_rate": 1.981236335408024e-05,
"loss": 0.7873,
"step": 110
},
{
"epoch": 0.0909876851549442,
"grad_norm": 1.281147688908112,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.313239336013794,
"learning_rate": 1.98072041088615e-05,
"loss": 0.7808,
"step": 111
},
{
"epoch": 0.09180739403021396,
"grad_norm": 1.318499180510118,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 2.2904205322265625,
"learning_rate": 1.98019755833442e-05,
"loss": 0.7919,
"step": 112
},
{
"epoch": 0.09262710290548372,
"grad_norm": 1.6514661553574286,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.8095091581344604,
"learning_rate": 1.9796677814463812e-05,
"loss": 0.8265,
"step": 113
},
{
"epoch": 0.0934468117807535,
"grad_norm": 1.8210817232718945,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.8364806175231934,
"learning_rate": 1.9791310839644976e-05,
"loss": 0.8028,
"step": 114
},
{
"epoch": 0.09426652065602326,
"grad_norm": 1.47686559845631,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.9318500757217407,
"learning_rate": 1.97858746968012e-05,
"loss": 0.8062,
"step": 115
},
{
"epoch": 0.09508622953129303,
"grad_norm": 1.4067181377712976,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.295626163482666,
"learning_rate": 1.9780369424334633e-05,
"loss": 0.8803,
"step": 116
},
{
"epoch": 0.0959059384065628,
"grad_norm": 1.3059938126958721,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 2.0480308532714844,
"learning_rate": 1.9774795061135754e-05,
"loss": 0.7943,
"step": 117
},
{
"epoch": 0.09672564728183256,
"grad_norm": 1.2711365297039934,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.22573624551296234,
"learning_rate": 1.9769151646583122e-05,
"loss": 0.7814,
"step": 118
},
{
"epoch": 0.09754535615710233,
"grad_norm": 1.233652041377698,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 2.7930972576141357,
"learning_rate": 1.9763439220543084e-05,
"loss": 0.8613,
"step": 119
},
{
"epoch": 0.09836506503237209,
"grad_norm": 1.5933606736697221,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.2256191968917847,
"learning_rate": 1.9757657823369508e-05,
"loss": 0.8075,
"step": 120
},
{
"epoch": 0.09918477390764187,
"grad_norm": 1.2976777727698103,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.8939759135246277,
"learning_rate": 1.9751807495903484e-05,
"loss": 0.8253,
"step": 121
},
{
"epoch": 0.10000448278291163,
"grad_norm": 1.2750278572898648,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.21469955146312714,
"learning_rate": 1.9745888279473046e-05,
"loss": 0.7551,
"step": 122
},
{
"epoch": 0.1008241916581814,
"grad_norm": 1.2509134298671505,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.0077957212924957275,
"learning_rate": 1.973990021589287e-05,
"loss": 0.7845,
"step": 123
},
{
"epoch": 0.10164390053345117,
"grad_norm": 1.268455652366057,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.706210196018219,
"learning_rate": 1.9733843347463982e-05,
"loss": 0.8047,
"step": 124
},
{
"epoch": 0.10246360940872093,
"grad_norm": 1.4520085394026334,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.9769712090492249,
"learning_rate": 1.972771771697347e-05,
"loss": 0.7846,
"step": 125
},
{
"epoch": 0.1032833182839907,
"grad_norm": 1.5634694062668846,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.24579794704914093,
"learning_rate": 1.9721523367694167e-05,
"loss": 0.8508,
"step": 126
},
{
"epoch": 0.10410302715926047,
"grad_norm": 1.2388109712914996,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.081803798675537,
"learning_rate": 1.971526034338435e-05,
"loss": 0.8329,
"step": 127
},
{
"epoch": 0.10492273603453024,
"grad_norm": 1.3056037229518405,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.6683528423309326,
"learning_rate": 1.970892868828743e-05,
"loss": 0.7809,
"step": 128
},
{
"epoch": 0.1057424449098,
"grad_norm": 1.782112532137919,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.3602246344089508,
"learning_rate": 1.9702528447131647e-05,
"loss": 0.8308,
"step": 129
},
{
"epoch": 0.10656215378506977,
"grad_norm": 1.2401139307233116,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.41337674856185913,
"learning_rate": 1.969605966512975e-05,
"loss": 0.8055,
"step": 130
},
{
"epoch": 0.10738186266033954,
"grad_norm": 1.3965251425675373,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.8101109862327576,
"learning_rate": 1.9689522387978666e-05,
"loss": 0.8056,
"step": 131
},
{
"epoch": 0.1082015715356093,
"grad_norm": 1.234037598026031,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.1053365468978882,
"learning_rate": 1.9682916661859197e-05,
"loss": 0.8263,
"step": 132
},
{
"epoch": 0.10902128041087908,
"grad_norm": 1.3232513608726915,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.9295740127563477,
"learning_rate": 1.967624253343568e-05,
"loss": 0.7627,
"step": 133
},
{
"epoch": 0.10984098928614884,
"grad_norm": 1.2432992556335758,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.9913814067840576,
"learning_rate": 1.9669500049855657e-05,
"loss": 0.8001,
"step": 134
},
{
"epoch": 0.1106606981614186,
"grad_norm": 1.2510923129353873,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.1932474374771118,
"learning_rate": 1.9662689258749555e-05,
"loss": 0.8653,
"step": 135
},
{
"epoch": 0.11148040703668838,
"grad_norm": 1.3059187604638154,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.39536067843437195,
"learning_rate": 1.9655810208230334e-05,
"loss": 0.7872,
"step": 136
},
{
"epoch": 0.11230011591195814,
"grad_norm": 1.4628150077307818,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.5164303183555603,
"learning_rate": 1.9648862946893158e-05,
"loss": 0.7947,
"step": 137
},
{
"epoch": 0.11311982478722792,
"grad_norm": 1.3225046669141658,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.078872561454773,
"learning_rate": 1.964184752381504e-05,
"loss": 0.7767,
"step": 138
},
{
"epoch": 0.11393953366249768,
"grad_norm": 1.283186605342499,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.31678012013435364,
"learning_rate": 1.963476398855452e-05,
"loss": 0.805,
"step": 139
},
{
"epoch": 0.11475924253776744,
"grad_norm": 1.3759791913447301,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.2333240807056427,
"learning_rate": 1.9627612391151278e-05,
"loss": 0.7963,
"step": 140
},
{
"epoch": 0.11557895141303721,
"grad_norm": 1.7957212644518188,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.8966314792633057,
"learning_rate": 1.962039278212581e-05,
"loss": 0.7893,
"step": 141
},
{
"epoch": 0.11639866028830698,
"grad_norm": 1.527679140455293,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.17992189526557922,
"learning_rate": 1.961310521247906e-05,
"loss": 0.8149,
"step": 142
},
{
"epoch": 0.11721836916357675,
"grad_norm": 1.7673798049707574,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.29475894570350647,
"learning_rate": 1.9605749733692063e-05,
"loss": 0.8249,
"step": 143
},
{
"epoch": 0.11803807803884651,
"grad_norm": 1.390298947753657,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.006619862746447325,
"learning_rate": 1.9598326397725577e-05,
"loss": 0.8184,
"step": 144
},
{
"epoch": 0.11885778691411629,
"grad_norm": 1.1951783112653427,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.7959393262863159,
"learning_rate": 1.9590835257019715e-05,
"loss": 0.8059,
"step": 145
},
{
"epoch": 0.11967749578938605,
"grad_norm": 1.4330604805001435,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.895522952079773,
"learning_rate": 1.958327636449359e-05,
"loss": 0.7776,
"step": 146
},
{
"epoch": 0.12049720466465581,
"grad_norm": 1.4516095676857343,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.6711400151252747,
"learning_rate": 1.9575649773544914e-05,
"loss": 0.835,
"step": 147
},
{
"epoch": 0.12131691353992559,
"grad_norm": 1.2310197777300715,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.7660918831825256,
"learning_rate": 1.9567955538049643e-05,
"loss": 0.7995,
"step": 148
},
{
"epoch": 0.12213662241519535,
"grad_norm": 1.1784000062336917,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.4787771701812744,
"learning_rate": 1.9560193712361597e-05,
"loss": 0.794,
"step": 149
},
{
"epoch": 0.12295633129046513,
"grad_norm": 1.1771856624395576,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.8988789319992065,
"learning_rate": 1.9552364351312056e-05,
"loss": 0.7864,
"step": 150
},
{
"epoch": 0.12377604016573489,
"grad_norm": 1.4997905570411592,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.7451052069664001,
"learning_rate": 1.954446751020939e-05,
"loss": 0.7937,
"step": 151
},
{
"epoch": 0.12459574904100465,
"grad_norm": 1.5347241887498202,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.7448756694793701,
"learning_rate": 1.953650324483866e-05,
"loss": 0.8393,
"step": 152
},
{
"epoch": 0.12541545791627443,
"grad_norm": 1.5545586482351346,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.1357725858688354,
"learning_rate": 1.9528471611461235e-05,
"loss": 0.8164,
"step": 153
},
{
"epoch": 0.1262351667915442,
"grad_norm": 1.514121413011395,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.322968602180481,
"learning_rate": 1.952037266681438e-05,
"loss": 0.7979,
"step": 154
},
{
"epoch": 0.12705487566681395,
"grad_norm": 1.4339364294796415,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.3763850927352905,
"learning_rate": 1.9512206468110863e-05,
"loss": 0.8494,
"step": 155
},
{
"epoch": 0.12787458454208372,
"grad_norm": 1.2243463217022583,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.0551897287368774,
"learning_rate": 1.9503973073038554e-05,
"loss": 0.8084,
"step": 156
},
{
"epoch": 0.1286942934173535,
"grad_norm": 1.243251912546481,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.6112278699874878,
"learning_rate": 1.949567253976001e-05,
"loss": 0.8101,
"step": 157
},
{
"epoch": 0.12951400229262325,
"grad_norm": 1.0922332306001399,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 1.0528957843780518,
"learning_rate": 1.948730492691206e-05,
"loss": 0.7769,
"step": 158
},
{
"epoch": 0.13033371116789302,
"grad_norm": 1.3554070374669416,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.48605647683143616,
"learning_rate": 1.9478870293605416e-05,
"loss": 0.7884,
"step": 159
},
{
"epoch": 0.1311534200431628,
"grad_norm": 1.0967519114780133,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.7012131214141846,
"learning_rate": 1.947036869942422e-05,
"loss": 0.8133,
"step": 160
},
{
"epoch": 0.13197312891843258,
"grad_norm": 1.335130334150225,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.4529050290584564,
"learning_rate": 1.9461800204425653e-05,
"loss": 0.7768,
"step": 161
},
{
"epoch": 0.13279283779370232,
"grad_norm": 1.2631026348057708,
"latest_boundary_loss": 0.012135399505496025,
"latest_lm_loss": 1.148784875869751,
"learning_rate": 1.9453164869139488e-05,
"loss": 0.9354,
"step": 162
},
{
"epoch": 0.1336125466689721,
"grad_norm": 1.3849521951173502,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.233864426612854,
"learning_rate": 1.9444462754567682e-05,
"loss": 0.8348,
"step": 163
},
{
"epoch": 0.13443225554424187,
"grad_norm": 1.198858246316789,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 1.5828710794448853,
"learning_rate": 1.9435693922183935e-05,
"loss": 0.7869,
"step": 164
},
{
"epoch": 0.13525196441951162,
"grad_norm": 1.5339755068577603,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.18437950313091278,
"learning_rate": 1.9426858433933248e-05,
"loss": 0.7884,
"step": 165
},
{
"epoch": 0.1360716732947814,
"grad_norm": 1.2511009281740075,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.009370694868266582,
"learning_rate": 1.94179563522315e-05,
"loss": 0.8185,
"step": 166
},
{
"epoch": 0.13689138217005117,
"grad_norm": 1.5474138930481194,
"latest_boundary_loss": 0.00950749684125185,
"latest_lm_loss": 0.10782361775636673,
"learning_rate": 1.9408987739965006e-05,
"loss": 0.7846,
"step": 167
},
{
"epoch": 0.13771109104532092,
"grad_norm": 1.552496376319133,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.5321213603019714,
"learning_rate": 1.9399952660490057e-05,
"loss": 0.7929,
"step": 168
},
{
"epoch": 0.1385307999205907,
"grad_norm": 1.4886973327385027,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.3138216733932495,
"learning_rate": 1.9390851177632496e-05,
"loss": 0.7828,
"step": 169
},
{
"epoch": 0.13935050879586047,
"grad_norm": 1.3881426165392348,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 1.9412533044815063,
"learning_rate": 1.9381683355687245e-05,
"loss": 0.783,
"step": 170
},
{
"epoch": 0.14017021767113025,
"grad_norm": 1.2956024415729674,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.1368589699268341,
"learning_rate": 1.937244925941786e-05,
"loss": 0.823,
"step": 171
},
{
"epoch": 0.1409899265464,
"grad_norm": 1.345620406170132,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.025996984913945198,
"learning_rate": 1.9363148954056077e-05,
"loss": 0.805,
"step": 172
},
{
"epoch": 0.14180963542166977,
"grad_norm": 1.5176243475613849,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.28225523233413696,
"learning_rate": 1.9353782505301352e-05,
"loss": 0.7849,
"step": 173
},
{
"epoch": 0.14262934429693955,
"grad_norm": 1.1945873533436033,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.4188506603240967,
"learning_rate": 1.9344349979320386e-05,
"loss": 0.8088,
"step": 174
},
{
"epoch": 0.1434490531722093,
"grad_norm": 1.1803212549669022,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.8604617118835449,
"learning_rate": 1.9334851442746665e-05,
"loss": 0.8001,
"step": 175
},
{
"epoch": 0.14426876204747907,
"grad_norm": 1.340857069700188,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.954041063785553,
"learning_rate": 1.9325286962679993e-05,
"loss": 0.8094,
"step": 176
},
{
"epoch": 0.14508847092274885,
"grad_norm": 1.153467766591727,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.456565797328949,
"learning_rate": 1.9315656606686012e-05,
"loss": 0.8045,
"step": 177
},
{
"epoch": 0.14590817979801862,
"grad_norm": 1.2917180216805466,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.02715335413813591,
"learning_rate": 1.930596044279572e-05,
"loss": 0.7763,
"step": 178
},
{
"epoch": 0.14672788867328837,
"grad_norm": 1.165507961880491,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.49818554520606995,
"learning_rate": 1.9296198539505013e-05,
"loss": 0.7873,
"step": 179
},
{
"epoch": 0.14754759754855815,
"grad_norm": 1.1944293331747575,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.26211249828338623,
"learning_rate": 1.9286370965774166e-05,
"loss": 0.8055,
"step": 180
},
{
"epoch": 0.14836730642382792,
"grad_norm": 1.1384333258025627,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.254393458366394,
"learning_rate": 1.9276477791027374e-05,
"loss": 0.7819,
"step": 181
},
{
"epoch": 0.14918701529909767,
"grad_norm": 1.3758061222090787,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.362998604774475,
"learning_rate": 1.9266519085152254e-05,
"loss": 0.7993,
"step": 182
},
{
"epoch": 0.15000672417436745,
"grad_norm": 1.3983899195914573,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.3058644235134125,
"learning_rate": 1.9256494918499348e-05,
"loss": 0.8082,
"step": 183
},
{
"epoch": 0.15082643304963722,
"grad_norm": 1.2889670520819139,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.2846766710281372,
"learning_rate": 1.9246405361881623e-05,
"loss": 0.7732,
"step": 184
},
{
"epoch": 0.15164614192490697,
"grad_norm": 1.4671482285325368,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.6314696073532104,
"learning_rate": 1.9236250486573978e-05,
"loss": 0.7904,
"step": 185
},
{
"epoch": 0.15246585080017674,
"grad_norm": 1.32764787299484,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.5939447283744812,
"learning_rate": 1.9226030364312747e-05,
"loss": 0.8092,
"step": 186
},
{
"epoch": 0.15328555967544652,
"grad_norm": 1.2143518967854543,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.4104589521884918,
"learning_rate": 1.9215745067295168e-05,
"loss": 0.7743,
"step": 187
},
{
"epoch": 0.1541052685507163,
"grad_norm": 1.4447368509297,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.08697956055402756,
"learning_rate": 1.92053946681789e-05,
"loss": 0.8041,
"step": 188
},
{
"epoch": 0.15492497742598604,
"grad_norm": 1.3652843233917986,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.9079402685165405,
"learning_rate": 1.919497924008149e-05,
"loss": 0.7686,
"step": 189
},
{
"epoch": 0.15574468630125582,
"grad_norm": 1.4176566593100697,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.951805055141449,
"learning_rate": 1.918449885657987e-05,
"loss": 0.7422,
"step": 190
},
{
"epoch": 0.1565643951765256,
"grad_norm": 1.3789613780381453,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 2.791360378265381,
"learning_rate": 1.917395359170983e-05,
"loss": 0.7545,
"step": 191
},
{
"epoch": 0.15738410405179534,
"grad_norm": 1.3024122115001142,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.1578044891357422,
"learning_rate": 1.9163343519965494e-05,
"loss": 0.7939,
"step": 192
},
{
"epoch": 0.15820381292706512,
"grad_norm": 1.3090638080523762,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.8000185489654541,
"learning_rate": 1.91526687162988e-05,
"loss": 0.815,
"step": 193
},
{
"epoch": 0.1590235218023349,
"grad_norm": 1.4489255995430732,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.0648865699768066,
"learning_rate": 1.914192925611896e-05,
"loss": 0.7957,
"step": 194
},
{
"epoch": 0.15984323067760467,
"grad_norm": 1.1217275087391954,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.9026778340339661,
"learning_rate": 1.913112521529195e-05,
"loss": 0.7983,
"step": 195
},
{
"epoch": 0.16066293955287442,
"grad_norm": 1.2571563535483283,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.15003184974193573,
"learning_rate": 1.9120256670139942e-05,
"loss": 0.7685,
"step": 196
},
{
"epoch": 0.1614826484281442,
"grad_norm": 1.3256059128164384,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.6254536509513855,
"learning_rate": 1.9109323697440782e-05,
"loss": 0.774,
"step": 197
},
{
"epoch": 0.16230235730341397,
"grad_norm": 1.0825474686731895,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.0689915418624878,
"learning_rate": 1.909832637442746e-05,
"loss": 0.7631,
"step": 198
},
{
"epoch": 0.16312206617868372,
"grad_norm": 1.4072844889375942,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.3515931367874146,
"learning_rate": 1.9087264778787534e-05,
"loss": 0.8286,
"step": 199
},
{
"epoch": 0.1639417750539535,
"grad_norm": 1.2557774248064015,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.8982808589935303,
"learning_rate": 1.9076138988662615e-05,
"loss": 0.7957,
"step": 200
},
{
"epoch": 0.16476148392922327,
"grad_norm": 1.3182236812904482,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.5166087746620178,
"learning_rate": 1.9064949082647785e-05,
"loss": 0.7875,
"step": 201
},
{
"epoch": 0.16558119280449302,
"grad_norm": 1.2354520455560227,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.5807197690010071,
"learning_rate": 1.9053695139791058e-05,
"loss": 0.7756,
"step": 202
},
{
"epoch": 0.1664009016797628,
"grad_norm": 1.213996282836788,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.339682936668396,
"learning_rate": 1.904237723959283e-05,
"loss": 0.7979,
"step": 203
},
{
"epoch": 0.16722061055503257,
"grad_norm": 1.3463949305586629,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.595446228981018,
"learning_rate": 1.903099546200529e-05,
"loss": 0.7865,
"step": 204
},
{
"epoch": 0.16804031943030234,
"grad_norm": 1.135824244522318,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.149241328239441,
"learning_rate": 1.901954988743188e-05,
"loss": 0.7288,
"step": 205
},
{
"epoch": 0.1688600283055721,
"grad_norm": 1.15467724271601,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.32737183570861816,
"learning_rate": 1.9008040596726713e-05,
"loss": 0.7734,
"step": 206
},
{
"epoch": 0.16967973718084187,
"grad_norm": 1.103881165746411,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 1.1367260217666626,
"learning_rate": 1.8996467671194017e-05,
"loss": 0.7659,
"step": 207
},
{
"epoch": 0.17049944605611164,
"grad_norm": 1.2094644467914892,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.15180127322673798,
"learning_rate": 1.898483119258754e-05,
"loss": 0.7898,
"step": 208
},
{
"epoch": 0.1713191549313814,
"grad_norm": 1.1301454667904827,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.21561795473098755,
"learning_rate": 1.8973131243109987e-05,
"loss": 0.78,
"step": 209
},
{
"epoch": 0.17213886380665117,
"grad_norm": 1.1183014594084255,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.09423837810754776,
"learning_rate": 1.896136790541244e-05,
"loss": 0.7756,
"step": 210
},
{
"epoch": 0.17295857268192094,
"grad_norm": 1.1670877767689216,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.3362932205200195,
"learning_rate": 1.8949541262593764e-05,
"loss": 0.7819,
"step": 211
},
{
"epoch": 0.17377828155719072,
"grad_norm": 1.2166553504494542,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.7938234806060791,
"learning_rate": 1.8937651398200027e-05,
"loss": 0.7934,
"step": 212
},
{
"epoch": 0.17459799043246046,
"grad_norm": 1.3668099053241618,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.1043457984924316,
"learning_rate": 1.892569839622391e-05,
"loss": 0.7723,
"step": 213
},
{
"epoch": 0.17541769930773024,
"grad_norm": 1.247592744354801,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.1273113340139389,
"learning_rate": 1.8913682341104107e-05,
"loss": 0.7691,
"step": 214
},
{
"epoch": 0.17623740818300002,
"grad_norm": 1.3909974666968508,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.12624797224998474,
"learning_rate": 1.8901603317724742e-05,
"loss": 0.7827,
"step": 215
},
{
"epoch": 0.17705711705826976,
"grad_norm": 1.2889322631590703,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.0620657205581665,
"learning_rate": 1.8889461411414754e-05,
"loss": 0.765,
"step": 216
},
{
"epoch": 0.17787682593353954,
"grad_norm": 1.3958611857764947,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.3180302381515503,
"learning_rate": 1.8877256707947308e-05,
"loss": 0.7785,
"step": 217
},
{
"epoch": 0.17869653480880932,
"grad_norm": 1.21756144909098,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.1645722389221191,
"learning_rate": 1.886498929353917e-05,
"loss": 0.7397,
"step": 218
},
{
"epoch": 0.17951624368407906,
"grad_norm": 1.2819594204127502,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 1.0139302015304565,
"learning_rate": 1.8852659254850128e-05,
"loss": 0.7851,
"step": 219
},
{
"epoch": 0.18033595255934884,
"grad_norm": 1.2183181589832488,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.7074142694473267,
"learning_rate": 1.8840266678982343e-05,
"loss": 0.7823,
"step": 220
},
{
"epoch": 0.18115566143461861,
"grad_norm": 1.2113636726028785,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 1.2712079286575317,
"learning_rate": 1.882781165347977e-05,
"loss": 0.7712,
"step": 221
},
{
"epoch": 0.1819753703098884,
"grad_norm": 1.2312096012058535,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.47480735182762146,
"learning_rate": 1.8815294266327507e-05,
"loss": 0.8127,
"step": 222
},
{
"epoch": 0.18279507918515814,
"grad_norm": 1.2359042655527446,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.3055737018585205,
"learning_rate": 1.88027146059512e-05,
"loss": 0.7572,
"step": 223
},
{
"epoch": 0.1836147880604279,
"grad_norm": 1.3544601819389752,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.2657633125782013,
"learning_rate": 1.8790072761216406e-05,
"loss": 0.8142,
"step": 224
},
{
"epoch": 0.1844344969356977,
"grad_norm": 1.1533036316176342,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.4670569896697998,
"learning_rate": 1.8777368821427954e-05,
"loss": 0.7701,
"step": 225
},
{
"epoch": 0.18525420581096744,
"grad_norm": 1.4026457405650468,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.7761039137840271,
"learning_rate": 1.8764602876329346e-05,
"loss": 0.7926,
"step": 226
},
{
"epoch": 0.1860739146862372,
"grad_norm": 1.250584789629632,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 1.2559117078781128,
"learning_rate": 1.8751775016102087e-05,
"loss": 0.786,
"step": 227
},
{
"epoch": 0.186893623561507,
"grad_norm": 1.4799838979140456,
"latest_boundary_loss": 0.0112152099609375,
"latest_lm_loss": 0.22022885084152222,
"learning_rate": 1.8738885331365073e-05,
"loss": 0.7484,
"step": 228
},
{
"epoch": 0.18771333243677676,
"grad_norm": 1.2417682038964282,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.7168477773666382,
"learning_rate": 1.872593391317394e-05,
"loss": 0.7648,
"step": 229
},
{
"epoch": 0.1885330413120465,
"grad_norm": 1.2953299624267198,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.19695428013801575,
"learning_rate": 1.871292085302042e-05,
"loss": 0.7651,
"step": 230
},
{
"epoch": 0.1893527501873163,
"grad_norm": 1.2766212507963632,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.10029853880405426,
"learning_rate": 1.8699846242831707e-05,
"loss": 0.7733,
"step": 231
},
{
"epoch": 0.19017245906258606,
"grad_norm": 1.2213990144170908,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.284568727016449,
"learning_rate": 1.8686710174969786e-05,
"loss": 0.8054,
"step": 232
},
{
"epoch": 0.1909921679378558,
"grad_norm": 1.2770104730298277,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.001825555576942861,
"learning_rate": 1.86735127422308e-05,
"loss": 0.7766,
"step": 233
},
{
"epoch": 0.1918118768131256,
"grad_norm": 1.6434692119616476,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.6784384846687317,
"learning_rate": 1.866025403784439e-05,
"loss": 0.7799,
"step": 234
},
{
"epoch": 0.19263158568839536,
"grad_norm": 1.4265105313813045,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.7525010108947754,
"learning_rate": 1.8646934155473025e-05,
"loss": 0.7664,
"step": 235
},
{
"epoch": 0.1934512945636651,
"grad_norm": 1.2060269987170464,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.27714869379997253,
"learning_rate": 1.8633553189211353e-05,
"loss": 0.7691,
"step": 236
},
{
"epoch": 0.19427100343893489,
"grad_norm": 1.0505165658766114,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.33565133810043335,
"learning_rate": 1.862011123358554e-05,
"loss": 0.746,
"step": 237
},
{
"epoch": 0.19509071231420466,
"grad_norm": 1.261813453288812,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 2.038971185684204,
"learning_rate": 1.8606608383552583e-05,
"loss": 0.7916,
"step": 238
},
{
"epoch": 0.19591042118947444,
"grad_norm": 1.2008545562225126,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.9500068426132202,
"learning_rate": 1.8593044734499657e-05,
"loss": 0.7808,
"step": 239
},
{
"epoch": 0.19673013006474419,
"grad_norm": 1.3619254750713339,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.6996431350708008,
"learning_rate": 1.8579420382243433e-05,
"loss": 0.7481,
"step": 240
},
{
"epoch": 0.19754983894001396,
"grad_norm": 1.153666777588698,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.1772021055221558,
"learning_rate": 1.8565735423029406e-05,
"loss": 0.8016,
"step": 241
},
{
"epoch": 0.19836954781528374,
"grad_norm": 1.231054548881498,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.5607664585113525,
"learning_rate": 1.8551989953531204e-05,
"loss": 0.8225,
"step": 242
},
{
"epoch": 0.19918925669055348,
"grad_norm": 1.2539782363755292,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 1.0679620504379272,
"learning_rate": 1.8538184070849926e-05,
"loss": 0.784,
"step": 243
},
{
"epoch": 0.20000896556582326,
"grad_norm": 1.1540893065081963,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.9860201478004456,
"learning_rate": 1.8524317872513434e-05,
"loss": 0.7447,
"step": 244
},
{
"epoch": 0.20082867444109304,
"grad_norm": 1.243855447022029,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 1.2961859703063965,
"learning_rate": 1.8510391456475674e-05,
"loss": 0.7607,
"step": 245
},
{
"epoch": 0.2016483833163628,
"grad_norm": 1.4553171400299931,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.478272020816803,
"learning_rate": 1.8496404921115993e-05,
"loss": 0.7589,
"step": 246
},
{
"epoch": 0.20246809219163256,
"grad_norm": 1.2103811328904168,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.25575590133667,
"learning_rate": 1.8482358365238414e-05,
"loss": 0.7668,
"step": 247
},
{
"epoch": 0.20328780106690233,
"grad_norm": 1.3068140079840127,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.6374103426933289,
"learning_rate": 1.8468251888070982e-05,
"loss": 0.7923,
"step": 248
},
{
"epoch": 0.2041075099421721,
"grad_norm": 1.362995927789331,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.019213274121284485,
"learning_rate": 1.845408558926502e-05,
"loss": 0.7676,
"step": 249
},
{
"epoch": 0.20492721881744186,
"grad_norm": 1.3608255284218467,
"latest_boundary_loss": 0.0098554827272892,
"latest_lm_loss": 0.3416900038719177,
"learning_rate": 1.8439859568894464e-05,
"loss": 0.8042,
"step": 250
},
{
"epoch": 0.20574692769271163,
"grad_norm": 1.2739111624948265,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.111289381980896,
"learning_rate": 1.842557392745512e-05,
"loss": 0.7948,
"step": 251
},
{
"epoch": 0.2065666365679814,
"grad_norm": 1.0480475366167854,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 1.906036615371704,
"learning_rate": 1.8411228765863973e-05,
"loss": 0.7794,
"step": 252
},
{
"epoch": 0.20738634544325116,
"grad_norm": 1.139412002510562,
"latest_boundary_loss": 0.011813269928097725,
"latest_lm_loss": 0.361102819442749,
"learning_rate": 1.839682418545848e-05,
"loss": 0.7464,
"step": 253
},
{
"epoch": 0.20820605431852093,
"grad_norm": 1.1119026519518347,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 1.1063988208770752,
"learning_rate": 1.838236028799584e-05,
"loss": 0.7648,
"step": 254
},
{
"epoch": 0.2090257631937907,
"grad_norm": 1.0801419538749126,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.1630922108888626,
"learning_rate": 1.8367837175652284e-05,
"loss": 0.7683,
"step": 255
},
{
"epoch": 0.20984547206906048,
"grad_norm": 1.112279762705192,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.712288498878479,
"learning_rate": 1.8353254951022342e-05,
"loss": 0.7802,
"step": 256
},
{
"epoch": 0.21066518094433023,
"grad_norm": 1.1018482036235493,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 2.4364233016967773,
"learning_rate": 1.833861371711814e-05,
"loss": 0.7646,
"step": 257
},
{
"epoch": 0.2114848898196,
"grad_norm": 1.200356654925506,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.3319595456123352,
"learning_rate": 1.832391357736865e-05,
"loss": 0.7568,
"step": 258
},
{
"epoch": 0.21230459869486978,
"grad_norm": 1.2002443330310237,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.8385396003723145,
"learning_rate": 1.8309154635618967e-05,
"loss": 0.8085,
"step": 259
},
{
"epoch": 0.21312430757013953,
"grad_norm": 1.4634081498377687,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 1.1421477794647217,
"learning_rate": 1.829433699612958e-05,
"loss": 0.8162,
"step": 260
},
{
"epoch": 0.2139440164454093,
"grad_norm": 1.2596681738077358,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.10862617194652557,
"learning_rate": 1.827946076357564e-05,
"loss": 0.775,
"step": 261
},
{
"epoch": 0.21476372532067908,
"grad_norm": 1.2398802534827353,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.7453004121780396,
"learning_rate": 1.8264526043046193e-05,
"loss": 0.7937,
"step": 262
},
{
"epoch": 0.21558343419594886,
"grad_norm": 1.5633145196150309,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.2946339249610901,
"learning_rate": 1.824953294004347e-05,
"loss": 0.763,
"step": 263
},
{
"epoch": 0.2164031430712186,
"grad_norm": 1.1733624025964176,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.12872633337974548,
"learning_rate": 1.8234481560482136e-05,
"loss": 0.8005,
"step": 264
},
{
"epoch": 0.21722285194648838,
"grad_norm": 1.3398656380843015,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.3354813754558563,
"learning_rate": 1.8219372010688516e-05,
"loss": 0.7564,
"step": 265
},
{
"epoch": 0.21804256082175816,
"grad_norm": 1.4246550067705264,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.4522192478179932,
"learning_rate": 1.8204204397399875e-05,
"loss": 0.7723,
"step": 266
},
{
"epoch": 0.2188622696970279,
"grad_norm": 1.1745708213247588,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.18473327159881592,
"learning_rate": 1.8188978827763654e-05,
"loss": 0.7394,
"step": 267
},
{
"epoch": 0.21968197857229768,
"grad_norm": 1.2255538023699621,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.29951363801956177,
"learning_rate": 1.8173695409336703e-05,
"loss": 0.7659,
"step": 268
},
{
"epoch": 0.22050168744756746,
"grad_norm": 1.3905999193747347,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.6259192228317261,
"learning_rate": 1.815835425008453e-05,
"loss": 0.7589,
"step": 269
},
{
"epoch": 0.2213213963228372,
"grad_norm": 1.2852079273460868,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.17656244337558746,
"learning_rate": 1.814295545838054e-05,
"loss": 0.7461,
"step": 270
},
{
"epoch": 0.22214110519810698,
"grad_norm": 1.2497357325909428,
"latest_boundary_loss": 0.013131883926689625,
"latest_lm_loss": 0.12683294713497162,
"learning_rate": 1.8127499143005266e-05,
"loss": 0.7816,
"step": 271
},
{
"epoch": 0.22296081407337676,
"grad_norm": 1.4190221606987263,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.5428849458694458,
"learning_rate": 1.81119854131456e-05,
"loss": 0.7311,
"step": 272
},
{
"epoch": 0.22378052294864653,
"grad_norm": 1.797205817865895,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.05780012905597687,
"learning_rate": 1.809641437839403e-05,
"loss": 0.7685,
"step": 273
},
{
"epoch": 0.22460023182391628,
"grad_norm": 1.6433167931656745,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.149138331413269,
"learning_rate": 1.8080786148747842e-05,
"loss": 0.7719,
"step": 274
},
{
"epoch": 0.22541994069918606,
"grad_norm": 1.1824183570709803,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.7802443504333496,
"learning_rate": 1.8065100834608378e-05,
"loss": 0.8139,
"step": 275
},
{
"epoch": 0.22623964957445583,
"grad_norm": 1.2871312654535232,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.9594394564628601,
"learning_rate": 1.8049358546780227e-05,
"loss": 0.7475,
"step": 276
},
{
"epoch": 0.22705935844972558,
"grad_norm": 1.5199771118747738,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.05118134245276451,
"learning_rate": 1.8033559396470455e-05,
"loss": 0.7355,
"step": 277
},
{
"epoch": 0.22787906732499535,
"grad_norm": 1.3775407674488795,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.48853322863578796,
"learning_rate": 1.8017703495287815e-05,
"loss": 0.7614,
"step": 278
},
{
"epoch": 0.22869877620026513,
"grad_norm": 1.5150236406449658,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.0969005823135376,
"learning_rate": 1.8001790955241972e-05,
"loss": 0.7515,
"step": 279
},
{
"epoch": 0.22951848507553488,
"grad_norm": 1.5587104169773858,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.24048875272274017,
"learning_rate": 1.7985821888742687e-05,
"loss": 0.768,
"step": 280
},
{
"epoch": 0.23033819395080465,
"grad_norm": 1.3709131164575632,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 1.134320855140686,
"learning_rate": 1.7969796408599042e-05,
"loss": 0.7615,
"step": 281
},
{
"epoch": 0.23115790282607443,
"grad_norm": 1.5736631736487026,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.3996270895004272,
"learning_rate": 1.795371462801864e-05,
"loss": 0.7624,
"step": 282
},
{
"epoch": 0.2319776117013442,
"grad_norm": 1.3329207039551936,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.04914306849241257,
"learning_rate": 1.79375766606068e-05,
"loss": 0.7304,
"step": 283
},
{
"epoch": 0.23279732057661395,
"grad_norm": 1.095762286762134,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.1749358177185059,
"learning_rate": 1.7921382620365757e-05,
"loss": 0.7406,
"step": 284
},
{
"epoch": 0.23361702945188373,
"grad_norm": 1.1270703944706861,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.114078402519226,
"learning_rate": 1.7905132621693862e-05,
"loss": 0.7313,
"step": 285
},
{
"epoch": 0.2344367383271535,
"grad_norm": 1.1401888000553002,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.9270635843276978,
"learning_rate": 1.788882677938476e-05,
"loss": 0.7525,
"step": 286
},
{
"epoch": 0.23525644720242325,
"grad_norm": 1.5327849801377653,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.2532890737056732,
"learning_rate": 1.78724652086266e-05,
"loss": 0.7792,
"step": 287
},
{
"epoch": 0.23607615607769303,
"grad_norm": 1.2802765903195208,
"latest_boundary_loss": 0.0112152099609375,
"latest_lm_loss": 2.042780876159668,
"learning_rate": 1.7856048025001195e-05,
"loss": 0.7712,
"step": 288
},
{
"epoch": 0.2368958649529628,
"grad_norm": 1.2334210495817985,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.4526499807834625,
"learning_rate": 1.7839575344483237e-05,
"loss": 0.7849,
"step": 289
},
{
"epoch": 0.23771557382823258,
"grad_norm": 1.2425477896602664,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.6510121822357178,
"learning_rate": 1.7823047283439444e-05,
"loss": 0.7398,
"step": 290
},
{
"epoch": 0.23853528270350233,
"grad_norm": 1.0938249056699105,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.3264525532722473,
"learning_rate": 1.7806463958627765e-05,
"loss": 0.759,
"step": 291
},
{
"epoch": 0.2393549915787721,
"grad_norm": 1.2916826875203216,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 1.1825861930847168,
"learning_rate": 1.7789825487196538e-05,
"loss": 0.8018,
"step": 292
},
{
"epoch": 0.24017470045404188,
"grad_norm": 1.2755265332447003,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.8257743716239929,
"learning_rate": 1.7773131986683675e-05,
"loss": 0.7792,
"step": 293
},
{
"epoch": 0.24099440932931163,
"grad_norm": 1.289138890518447,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.3038530349731445,
"learning_rate": 1.775638357501582e-05,
"loss": 0.7669,
"step": 294
},
{
"epoch": 0.2418141182045814,
"grad_norm": 1.1670766376069939,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.29945409297943115,
"learning_rate": 1.7739580370507533e-05,
"loss": 0.7438,
"step": 295
},
{
"epoch": 0.24263382707985118,
"grad_norm": 1.2375205282382749,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.43008628487586975,
"learning_rate": 1.7722722491860427e-05,
"loss": 0.7462,
"step": 296
},
{
"epoch": 0.24345353595512093,
"grad_norm": 1.1900225589317992,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.8674753904342651,
"learning_rate": 1.7705810058162354e-05,
"loss": 0.7317,
"step": 297
},
{
"epoch": 0.2442732448303907,
"grad_norm": 1.3389797043071163,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.9116458892822266,
"learning_rate": 1.768884318888656e-05,
"loss": 0.7605,
"step": 298
},
{
"epoch": 0.24509295370566048,
"grad_norm": 1.7080360521539983,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.1164073944091797,
"learning_rate": 1.7671822003890825e-05,
"loss": 0.7429,
"step": 299
},
{
"epoch": 0.24591266258093025,
"grad_norm": 1.7303183183296784,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.656548023223877,
"learning_rate": 1.7654746623416637e-05,
"loss": 0.7675,
"step": 300
},
{
"epoch": 0.2467323714562,
"grad_norm": 1.5332639349905193,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.012393379583954811,
"learning_rate": 1.7637617168088327e-05,
"loss": 0.7485,
"step": 301
},
{
"epoch": 0.24755208033146978,
"grad_norm": 2.0182196844254934,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 1.0757160186767578,
"learning_rate": 1.762043375891223e-05,
"loss": 0.7532,
"step": 302
},
{
"epoch": 0.24837178920673955,
"grad_norm": 1.0882191320561219,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.9313108921051025,
"learning_rate": 1.7603196517275808e-05,
"loss": 0.7576,
"step": 303
},
{
"epoch": 0.2491914980820093,
"grad_norm": 1.4188446807929445,
"latest_boundary_loss": 0.010217878967523575,
"latest_lm_loss": 1.289720058441162,
"learning_rate": 1.758590556494683e-05,
"loss": 0.7491,
"step": 304
},
{
"epoch": 0.2500112069572791,
"grad_norm": 1.348859100576177,
"latest_boundary_loss": 0.012135399505496025,
"latest_lm_loss": 1.1527491807937622,
"learning_rate": 1.756856102407247e-05,
"loss": 0.7803,
"step": 305
},
{
"epoch": 0.25083091583254885,
"grad_norm": 1.1871132336505195,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.15170671045780182,
"learning_rate": 1.7551163017178473e-05,
"loss": 0.7587,
"step": 306
},
{
"epoch": 0.2516506247078186,
"grad_norm": 1.5470829712153078,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.1318871974945068,
"learning_rate": 1.753371166716828e-05,
"loss": 0.7654,
"step": 307
},
{
"epoch": 0.2524703335830884,
"grad_norm": 1.3171224905847938,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.05948929488658905,
"learning_rate": 1.7516207097322154e-05,
"loss": 0.7626,
"step": 308
},
{
"epoch": 0.2532900424583581,
"grad_norm": 1.1571731931590543,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.4976317882537842,
"learning_rate": 1.749864943129632e-05,
"loss": 0.7663,
"step": 309
},
{
"epoch": 0.2541097513336279,
"grad_norm": 1.078758672013003,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.3855668604373932,
"learning_rate": 1.748103879312209e-05,
"loss": 0.7378,
"step": 310
},
{
"epoch": 0.2549294602088977,
"grad_norm": 1.1687388545109743,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.8284977674484253,
"learning_rate": 1.746337530720497e-05,
"loss": 0.7993,
"step": 311
},
{
"epoch": 0.25574916908416745,
"grad_norm": 1.1097333146545336,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.43493300676345825,
"learning_rate": 1.7445659098323807e-05,
"loss": 0.7693,
"step": 312
},
{
"epoch": 0.2565688779594372,
"grad_norm": 1.3895573552106844,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.2684229910373688,
"learning_rate": 1.7427890291629895e-05,
"loss": 0.7659,
"step": 313
},
{
"epoch": 0.257388586834707,
"grad_norm": 1.175334830795283,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.9001120328903198,
"learning_rate": 1.7410069012646076e-05,
"loss": 0.8112,
"step": 314
},
{
"epoch": 0.2582082957099768,
"grad_norm": 1.1320954131207766,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.0786060318350792,
"learning_rate": 1.7392195387265888e-05,
"loss": 0.8095,
"step": 315
},
{
"epoch": 0.2590280045852465,
"grad_norm": 1.1137774103912135,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 2.116636037826538,
"learning_rate": 1.737426954175264e-05,
"loss": 0.7561,
"step": 316
},
{
"epoch": 0.25984771346051627,
"grad_norm": 1.2298598326343215,
"latest_boundary_loss": 0.0126245291903615,
"latest_lm_loss": 1.0506033897399902,
"learning_rate": 1.7356291602738542e-05,
"loss": 0.7551,
"step": 317
},
{
"epoch": 0.26066742233578605,
"grad_norm": 1.1565607414774337,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.8087133765220642,
"learning_rate": 1.733826169722381e-05,
"loss": 0.7579,
"step": 318
},
{
"epoch": 0.2614871312110558,
"grad_norm": 1.1613744624204663,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.7222955226898193,
"learning_rate": 1.732017995257575e-05,
"loss": 0.7473,
"step": 319
},
{
"epoch": 0.2623068400863256,
"grad_norm": 1.1436471583119088,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.029964566230774,
"learning_rate": 1.7302046496527882e-05,
"loss": 0.7818,
"step": 320
},
{
"epoch": 0.2631265489615954,
"grad_norm": 1.1910663973569198,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.9554945826530457,
"learning_rate": 1.7283861457179022e-05,
"loss": 0.8009,
"step": 321
},
{
"epoch": 0.26394625783686515,
"grad_norm": 1.2632429704281476,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.20354612171649933,
"learning_rate": 1.726562496299239e-05,
"loss": 0.7569,
"step": 322
},
{
"epoch": 0.26476596671213487,
"grad_norm": 1.0983717671884115,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.034584496170282364,
"learning_rate": 1.724733714279468e-05,
"loss": 0.761,
"step": 323
},
{
"epoch": 0.26558567558740465,
"grad_norm": 1.0477499097227814,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.48923203349113464,
"learning_rate": 1.7228998125775175e-05,
"loss": 0.7425,
"step": 324
},
{
"epoch": 0.2664053844626744,
"grad_norm": 1.340228371713637,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.011654120869934559,
"learning_rate": 1.721060804148482e-05,
"loss": 0.7828,
"step": 325
},
{
"epoch": 0.2672250933379442,
"grad_norm": 1.3578540813921194,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.1521583795547485,
"learning_rate": 1.7192167019835314e-05,
"loss": 0.8198,
"step": 326
},
{
"epoch": 0.268044802213214,
"grad_norm": 1.1299101092813861,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.002408386208117008,
"learning_rate": 1.717367519109819e-05,
"loss": 0.7315,
"step": 327
},
{
"epoch": 0.26886451108848375,
"grad_norm": 1.181439880106029,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.1732453554868698,
"learning_rate": 1.7155132685903888e-05,
"loss": 0.7604,
"step": 328
},
{
"epoch": 0.2696842199637535,
"grad_norm": 1.1651545872225744,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 1.2648510932922363,
"learning_rate": 1.713653963524084e-05,
"loss": 0.7737,
"step": 329
},
{
"epoch": 0.27050392883902324,
"grad_norm": 0.9459690643181343,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.14779794216156,
"learning_rate": 1.7117896170454542e-05,
"loss": 0.7713,
"step": 330
},
{
"epoch": 0.271323637714293,
"grad_norm": 1.2106270327103732,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.928825855255127,
"learning_rate": 1.7099202423246632e-05,
"loss": 0.7727,
"step": 331
},
{
"epoch": 0.2721433465895628,
"grad_norm": 0.9348248166210524,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.6661812663078308,
"learning_rate": 1.7080458525673948e-05,
"loss": 0.7403,
"step": 332
},
{
"epoch": 0.27296305546483257,
"grad_norm": 1.0602586687364872,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.2222480773925781,
"learning_rate": 1.7061664610147605e-05,
"loss": 0.7344,
"step": 333
},
{
"epoch": 0.27378276434010235,
"grad_norm": 1.0645433234115789,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.31431305408477783,
"learning_rate": 1.7042820809432057e-05,
"loss": 0.7239,
"step": 334
},
{
"epoch": 0.2746024732153721,
"grad_norm": 1.2180378095534536,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.3814491033554077,
"learning_rate": 1.702392725664415e-05,
"loss": 0.8173,
"step": 335
},
{
"epoch": 0.27542218209064184,
"grad_norm": 1.2137410974580587,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.6773765683174133,
"learning_rate": 1.70049840852522e-05,
"loss": 0.786,
"step": 336
},
{
"epoch": 0.2762418909659116,
"grad_norm": 1.2370935741477198,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 1.056388258934021,
"learning_rate": 1.6985991429075038e-05,
"loss": 0.7183,
"step": 337
},
{
"epoch": 0.2770615998411814,
"grad_norm": 1.3093794584268097,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 3.4595601558685303,
"learning_rate": 1.6966949422281058e-05,
"loss": 0.7468,
"step": 338
},
{
"epoch": 0.27788130871645117,
"grad_norm": 1.710868473169992,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.9647908210754395,
"learning_rate": 1.6947858199387296e-05,
"loss": 0.7939,
"step": 339
},
{
"epoch": 0.27870101759172095,
"grad_norm": 1.212495409931308,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.40625953674316406,
"learning_rate": 1.692871789525844e-05,
"loss": 0.7487,
"step": 340
},
{
"epoch": 0.2795207264669907,
"grad_norm": 1.0482189354901879,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.6986762285232544,
"learning_rate": 1.6909528645105908e-05,
"loss": 0.7087,
"step": 341
},
{
"epoch": 0.2803404353422605,
"grad_norm": 1.4187873466870942,
"latest_boundary_loss": 0.008855608291924,
"latest_lm_loss": 0.9669897556304932,
"learning_rate": 1.6890290584486892e-05,
"loss": 0.7479,
"step": 342
},
{
"epoch": 0.2811601442175302,
"grad_norm": 1.2321191576527397,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.8818368911743164,
"learning_rate": 1.687100384930338e-05,
"loss": 0.7655,
"step": 343
},
{
"epoch": 0.2819798530928,
"grad_norm": 1.218882091607278,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.4501078426837921,
"learning_rate": 1.685166857580122e-05,
"loss": 0.7457,
"step": 344
},
{
"epoch": 0.28279956196806977,
"grad_norm": 1.2515083536669707,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.8328303694725037,
"learning_rate": 1.683228490056913e-05,
"loss": 0.7791,
"step": 345
},
{
"epoch": 0.28361927084333954,
"grad_norm": 1.2606396268517954,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.486973762512207,
"learning_rate": 1.6812852960537763e-05,
"loss": 0.7609,
"step": 346
},
{
"epoch": 0.2844389797186093,
"grad_norm": 1.439727469843454,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.583997130393982,
"learning_rate": 1.6793372892978716e-05,
"loss": 0.7923,
"step": 347
},
{
"epoch": 0.2852586885938791,
"grad_norm": 1.2900481058444884,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.6450203061103821,
"learning_rate": 1.6773844835503574e-05,
"loss": 0.7375,
"step": 348
},
{
"epoch": 0.28607839746914887,
"grad_norm": 1.1445092464493982,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.6270523071289062,
"learning_rate": 1.6754268926062936e-05,
"loss": 0.728,
"step": 349
},
{
"epoch": 0.2868981063444186,
"grad_norm": 1.1197935862015225,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.6677144169807434,
"learning_rate": 1.6734645302945434e-05,
"loss": 0.7386,
"step": 350
},
{
"epoch": 0.28771781521968837,
"grad_norm": 1.5516206153328975,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.00457730982452631,
"learning_rate": 1.671497410477676e-05,
"loss": 0.748,
"step": 351
},
{
"epoch": 0.28853752409495814,
"grad_norm": 1.1760660331370985,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.2051688432693481,
"learning_rate": 1.6695255470518687e-05,
"loss": 0.7573,
"step": 352
},
{
"epoch": 0.2893572329702279,
"grad_norm": 1.1737340304389918,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.5741766095161438,
"learning_rate": 1.6675489539468094e-05,
"loss": 0.7835,
"step": 353
},
{
"epoch": 0.2901769418454977,
"grad_norm": 1.2220474332357378,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.0651415586471558,
"learning_rate": 1.665567645125596e-05,
"loss": 0.7549,
"step": 354
},
{
"epoch": 0.29099665072076747,
"grad_norm": 1.1198245204858515,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.3142130672931671,
"learning_rate": 1.6635816345846413e-05,
"loss": 0.8024,
"step": 355
},
{
"epoch": 0.29181635959603724,
"grad_norm": 1.160175666861782,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.8947227597236633,
"learning_rate": 1.66159093635357e-05,
"loss": 0.7385,
"step": 356
},
{
"epoch": 0.29263606847130696,
"grad_norm": 1.8429467670966544,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.1498366594314575,
"learning_rate": 1.659595564495124e-05,
"loss": 0.7941,
"step": 357
},
{
"epoch": 0.29345577734657674,
"grad_norm": 1.2825115095824218,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 2.7792720794677734,
"learning_rate": 1.6575955331050585e-05,
"loss": 0.7898,
"step": 358
},
{
"epoch": 0.2942754862218465,
"grad_norm": 1.5018008093636956,
"latest_boundary_loss": 0.010595110245049,
"latest_lm_loss": 1.5143988132476807,
"learning_rate": 1.6555908563120457e-05,
"loss": 0.7715,
"step": 359
},
{
"epoch": 0.2950951950971163,
"grad_norm": 1.4070401896853235,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.5355772972106934,
"learning_rate": 1.6535815482775745e-05,
"loss": 0.778,
"step": 360
},
{
"epoch": 0.29591490397238607,
"grad_norm": 1.1153938237688106,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 1.155535101890564,
"learning_rate": 1.6515676231958488e-05,
"loss": 0.7623,
"step": 361
},
{
"epoch": 0.29673461284765584,
"grad_norm": 1.1604011420722802,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.05568075180053711,
"learning_rate": 1.6495490952936898e-05,
"loss": 0.7198,
"step": 362
},
{
"epoch": 0.2975543217229256,
"grad_norm": 1.002778617881788,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.0034329891204834,
"learning_rate": 1.647525978830432e-05,
"loss": 0.7212,
"step": 363
},
{
"epoch": 0.29837403059819534,
"grad_norm": 1.0895273576749642,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.7533732652664185,
"learning_rate": 1.645498288097827e-05,
"loss": 0.7854,
"step": 364
},
{
"epoch": 0.2991937394734651,
"grad_norm": 1.1624355708047038,
"latest_boundary_loss": 0.008855608291924,
"latest_lm_loss": 1.1625741720199585,
"learning_rate": 1.6434660374199377e-05,
"loss": 0.7566,
"step": 365
},
{
"epoch": 0.3000134483487349,
"grad_norm": 1.0897411680197235,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 2.1761956214904785,
"learning_rate": 1.641429241153041e-05,
"loss": 0.7356,
"step": 366
},
{
"epoch": 0.30083315722400467,
"grad_norm": 1.1138571873195804,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.0779097080230713,
"learning_rate": 1.6393879136855247e-05,
"loss": 0.7545,
"step": 367
},
{
"epoch": 0.30165286609927444,
"grad_norm": 1.1688440573646057,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.11352968215942383,
"learning_rate": 1.6373420694377857e-05,
"loss": 0.784,
"step": 368
},
{
"epoch": 0.3024725749745442,
"grad_norm": 1.154933268259177,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.8499196767807007,
"learning_rate": 1.6352917228621284e-05,
"loss": 0.778,
"step": 369
},
{
"epoch": 0.30329228384981394,
"grad_norm": 1.1631085618547605,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.4340735077857971,
"learning_rate": 1.633236888442663e-05,
"loss": 0.7081,
"step": 370
},
{
"epoch": 0.3041119927250837,
"grad_norm": 1.0233956168157465,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 2.0934293270111084,
"learning_rate": 1.631177580695202e-05,
"loss": 0.7219,
"step": 371
},
{
"epoch": 0.3049317016003535,
"grad_norm": 1.0615378465781329,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.6719732284545898,
"learning_rate": 1.6291138141671598e-05,
"loss": 0.7252,
"step": 372
},
{
"epoch": 0.30575141047562326,
"grad_norm": 1.4269601756010983,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.20878413319587708,
"learning_rate": 1.6270456034374477e-05,
"loss": 0.7682,
"step": 373
},
{
"epoch": 0.30657111935089304,
"grad_norm": 1.15948742798124,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.0025855202693492174,
"learning_rate": 1.6249729631163718e-05,
"loss": 0.7509,
"step": 374
},
{
"epoch": 0.3073908282261628,
"grad_norm": 1.3110997619868459,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.10412515699863434,
"learning_rate": 1.6228959078455306e-05,
"loss": 0.7172,
"step": 375
},
{
"epoch": 0.3082105371014326,
"grad_norm": 1.1439178618100527,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.19717106223106384,
"learning_rate": 1.62081445229771e-05,
"loss": 0.7637,
"step": 376
},
{
"epoch": 0.3090302459767023,
"grad_norm": 1.269020910675217,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.4276922941207886,
"learning_rate": 1.6187286111767812e-05,
"loss": 0.771,
"step": 377
},
{
"epoch": 0.3098499548519721,
"grad_norm": 1.3375061257192655,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.5710009336471558,
"learning_rate": 1.616638399217595e-05,
"loss": 0.7826,
"step": 378
},
{
"epoch": 0.31066966372724186,
"grad_norm": 1.073632131841889,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.8715724945068359,
"learning_rate": 1.61454383118588e-05,
"loss": 0.7362,
"step": 379
},
{
"epoch": 0.31148937260251164,
"grad_norm": 1.0921386107746502,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.9326805472373962,
"learning_rate": 1.6124449218781358e-05,
"loss": 0.7303,
"step": 380
},
{
"epoch": 0.3123090814777814,
"grad_norm": 1.2688773597032257,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.7330528497695923,
"learning_rate": 1.6103416861215314e-05,
"loss": 0.7936,
"step": 381
},
{
"epoch": 0.3131287903530512,
"grad_norm": 1.165204450941577,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 1.072617530822754,
"learning_rate": 1.608234138773797e-05,
"loss": 0.7403,
"step": 382
},
{
"epoch": 0.31394849922832097,
"grad_norm": 1.4373080591127512,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.1570799350738525,
"learning_rate": 1.6061222947231224e-05,
"loss": 0.7292,
"step": 383
},
{
"epoch": 0.3147682081035907,
"grad_norm": 1.4898497396928483,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.1265507936477661,
"learning_rate": 1.6040061688880494e-05,
"loss": 0.8137,
"step": 384
},
{
"epoch": 0.31558791697886046,
"grad_norm": 1.2682922364467413,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.0434116125106812,
"learning_rate": 1.6018857762173672e-05,
"loss": 0.7405,
"step": 385
},
{
"epoch": 0.31640762585413024,
"grad_norm": 1.5142600008173759,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.4366573393344879,
"learning_rate": 1.5997611316900075e-05,
"loss": 0.7288,
"step": 386
},
{
"epoch": 0.3172273347294,
"grad_norm": 1.41046862385341,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.6512951850891113,
"learning_rate": 1.5976322503149373e-05,
"loss": 0.7692,
"step": 387
},
{
"epoch": 0.3180470436046698,
"grad_norm": 1.0853857992900688,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 2.4271011352539062,
"learning_rate": 1.5954991471310542e-05,
"loss": 0.7617,
"step": 388
},
{
"epoch": 0.31886675247993956,
"grad_norm": 1.1413565274647948,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.5793663859367371,
"learning_rate": 1.5933618372070805e-05,
"loss": 0.7787,
"step": 389
},
{
"epoch": 0.31968646135520934,
"grad_norm": 1.0201250861250861,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.8066156506538391,
"learning_rate": 1.5912203356414532e-05,
"loss": 0.7733,
"step": 390
},
{
"epoch": 0.32050617023047906,
"grad_norm": 1.0532882915217945,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 1.1418710947036743,
"learning_rate": 1.589074657562223e-05,
"loss": 0.723,
"step": 391
},
{
"epoch": 0.32132587910574884,
"grad_norm": 1.0453559715732401,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.694559633731842,
"learning_rate": 1.5869248181269427e-05,
"loss": 0.7621,
"step": 392
},
{
"epoch": 0.3221455879810186,
"grad_norm": 1.0151524975963433,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.45721903443336487,
"learning_rate": 1.5847708325225618e-05,
"loss": 0.7783,
"step": 393
},
{
"epoch": 0.3229652968562884,
"grad_norm": 1.156407244610918,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.5822734832763672,
"learning_rate": 1.5826127159653203e-05,
"loss": 0.7353,
"step": 394
},
{
"epoch": 0.32378500573155816,
"grad_norm": 1.4809181629779222,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.9310925602912903,
"learning_rate": 1.5804504837006396e-05,
"loss": 0.7151,
"step": 395
},
{
"epoch": 0.32460471460682794,
"grad_norm": 1.1219179492211147,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.0492651462554932,
"learning_rate": 1.578284151003015e-05,
"loss": 0.7407,
"step": 396
},
{
"epoch": 0.3254244234820977,
"grad_norm": 1.12490644399429,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.8332700729370117,
"learning_rate": 1.5761137331759084e-05,
"loss": 0.7279,
"step": 397
},
{
"epoch": 0.32624413235736743,
"grad_norm": 1.1773176619322447,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.241025447845459,
"learning_rate": 1.5739392455516408e-05,
"loss": 0.7266,
"step": 398
},
{
"epoch": 0.3270638412326372,
"grad_norm": 1.3260407471150357,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.8030115962028503,
"learning_rate": 1.571760703491282e-05,
"loss": 0.7686,
"step": 399
},
{
"epoch": 0.327883550107907,
"grad_norm": 1.1888045775860243,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.0539559125900269,
"learning_rate": 1.5695781223845442e-05,
"loss": 0.7517,
"step": 400
},
{
"epoch": 0.32870325898317676,
"grad_norm": 1.25614939891683,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.17292562127113342,
"learning_rate": 1.5673915176496716e-05,
"loss": 0.7473,
"step": 401
},
{
"epoch": 0.32952296785844654,
"grad_norm": 1.1967024681456992,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.26239249110221863,
"learning_rate": 1.5652009047333322e-05,
"loss": 0.7594,
"step": 402
},
{
"epoch": 0.3303426767337163,
"grad_norm": 1.3211135267641345,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.7740810513496399,
"learning_rate": 1.56300629911051e-05,
"loss": 0.7422,
"step": 403
},
{
"epoch": 0.33116238560898603,
"grad_norm": 1.2073290889140484,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 2.1549134254455566,
"learning_rate": 1.560807716284392e-05,
"loss": 0.7732,
"step": 404
},
{
"epoch": 0.3319820944842558,
"grad_norm": 1.1282420457224345,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.0053644180297852,
"learning_rate": 1.5586051717862634e-05,
"loss": 0.7611,
"step": 405
},
{
"epoch": 0.3328018033595256,
"grad_norm": 1.206384028030354,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.1088835000991821,
"learning_rate": 1.5563986811753948e-05,
"loss": 0.7476,
"step": 406
},
{
"epoch": 0.33362151223479536,
"grad_norm": 1.208696270431492,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.3628442287445068,
"learning_rate": 1.554188260038932e-05,
"loss": 0.7576,
"step": 407
},
{
"epoch": 0.33444122111006513,
"grad_norm": 1.2991685306475895,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.371116042137146,
"learning_rate": 1.551973923991788e-05,
"loss": 0.7761,
"step": 408
},
{
"epoch": 0.3352609299853349,
"grad_norm": 1.1638532413709233,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.44266730546951294,
"learning_rate": 1.5497556886765316e-05,
"loss": 0.7661,
"step": 409
},
{
"epoch": 0.3360806388606047,
"grad_norm": 1.2924453655106747,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.8117881417274475,
"learning_rate": 1.5475335697632768e-05,
"loss": 0.7732,
"step": 410
},
{
"epoch": 0.3369003477358744,
"grad_norm": 1.1190417782317583,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.7913511991500854,
"learning_rate": 1.545307582949571e-05,
"loss": 0.717,
"step": 411
},
{
"epoch": 0.3377200566111442,
"grad_norm": 1.227935814732426,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.9072880148887634,
"learning_rate": 1.5430777439602875e-05,
"loss": 0.7565,
"step": 412
},
{
"epoch": 0.33853976548641396,
"grad_norm": 1.157064752172727,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.3098393678665161,
"learning_rate": 1.540844068547511e-05,
"loss": 0.7881,
"step": 413
},
{
"epoch": 0.33935947436168373,
"grad_norm": 1.388601124472212,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.8129163980484009,
"learning_rate": 1.5386065724904273e-05,
"loss": 0.7327,
"step": 414
},
{
"epoch": 0.3401791832369535,
"grad_norm": 1.4468342034748307,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.7910501956939697,
"learning_rate": 1.536365271595212e-05,
"loss": 0.7775,
"step": 415
},
{
"epoch": 0.3409988921122233,
"grad_norm": 1.2744703044986754,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.7848953008651733,
"learning_rate": 1.5341201816949208e-05,
"loss": 0.7529,
"step": 416
},
{
"epoch": 0.34181860098749306,
"grad_norm": 1.2121112524138202,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.18250629305839539,
"learning_rate": 1.5318713186493736e-05,
"loss": 0.7446,
"step": 417
},
{
"epoch": 0.3426383098627628,
"grad_norm": 1.0920861486438693,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.2325786352157593,
"learning_rate": 1.529618698345045e-05,
"loss": 0.7518,
"step": 418
},
{
"epoch": 0.34345801873803256,
"grad_norm": 1.1246726579477655,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 1.1350693702697754,
"learning_rate": 1.5273623366949525e-05,
"loss": 0.6934,
"step": 419
},
{
"epoch": 0.34427772761330233,
"grad_norm": 1.104894519569579,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.9632548689842224,
"learning_rate": 1.5251022496385433e-05,
"loss": 0.7086,
"step": 420
},
{
"epoch": 0.3450974364885721,
"grad_norm": 1.1284625992921293,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.1495846062898636,
"learning_rate": 1.5228384531415809e-05,
"loss": 0.7797,
"step": 421
},
{
"epoch": 0.3459171453638419,
"grad_norm": 1.2624137005707725,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.107270359992981,
"learning_rate": 1.5205709631960337e-05,
"loss": 0.7533,
"step": 422
},
{
"epoch": 0.34673685423911166,
"grad_norm": 1.1679505360176594,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.004549090750515461,
"learning_rate": 1.5182997958199617e-05,
"loss": 0.7596,
"step": 423
},
{
"epoch": 0.34755656311438143,
"grad_norm": 1.0305863615343753,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.37779948115348816,
"learning_rate": 1.5160249670574026e-05,
"loss": 0.7608,
"step": 424
},
{
"epoch": 0.34837627198965115,
"grad_norm": 1.2653372287462519,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 1.3809720277786255,
"learning_rate": 1.5137464929782586e-05,
"loss": 0.7304,
"step": 425
},
{
"epoch": 0.34919598086492093,
"grad_norm": 1.1153671822751252,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.1054792404174805,
"learning_rate": 1.5114643896781844e-05,
"loss": 0.7494,
"step": 426
},
{
"epoch": 0.3500156897401907,
"grad_norm": 1.2198669463059018,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.7744995355606079,
"learning_rate": 1.5091786732784717e-05,
"loss": 0.698,
"step": 427
},
{
"epoch": 0.3508353986154605,
"grad_norm": 1.2469585371854122,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.008866140618920326,
"learning_rate": 1.5068893599259354e-05,
"loss": 0.7237,
"step": 428
},
{
"epoch": 0.35165510749073026,
"grad_norm": 1.1619422685629848,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.5654139518737793,
"learning_rate": 1.5045964657928006e-05,
"loss": 0.7499,
"step": 429
},
{
"epoch": 0.35247481636600003,
"grad_norm": 1.2874009337999313,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.8137609958648682,
"learning_rate": 1.5023000070765886e-05,
"loss": 0.7655,
"step": 430
},
{
"epoch": 0.3532945252412698,
"grad_norm": 1.181063898068999,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.5925420522689819,
"learning_rate": 1.5000000000000002e-05,
"loss": 0.7493,
"step": 431
},
{
"epoch": 0.35411423411653953,
"grad_norm": 1.431751641376893,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.24875760078430176,
"learning_rate": 1.4976964608108038e-05,
"loss": 0.7296,
"step": 432
},
{
"epoch": 0.3549339429918093,
"grad_norm": 1.450337835352188,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.7986298203468323,
"learning_rate": 1.495389405781719e-05,
"loss": 0.6947,
"step": 433
},
{
"epoch": 0.3557536518670791,
"grad_norm": 1.0828766180768115,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.1904706060886383,
"learning_rate": 1.4930788512103018e-05,
"loss": 0.7542,
"step": 434
},
{
"epoch": 0.35657336074234885,
"grad_norm": 1.4482726860430108,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.30834051966667175,
"learning_rate": 1.4907648134188304e-05,
"loss": 0.7347,
"step": 435
},
{
"epoch": 0.35739306961761863,
"grad_norm": 0.9680081995026547,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 1.0483452081680298,
"learning_rate": 1.488447308754189e-05,
"loss": 0.7167,
"step": 436
},
{
"epoch": 0.3582127784928884,
"grad_norm": 1.1076074093508796,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.2429572343826294,
"learning_rate": 1.486126353587752e-05,
"loss": 0.7631,
"step": 437
},
{
"epoch": 0.3590324873681581,
"grad_norm": 1.4414761947441783,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.3687969744205475,
"learning_rate": 1.4838019643152699e-05,
"loss": 0.7185,
"step": 438
},
{
"epoch": 0.3598521962434279,
"grad_norm": 1.0755669852842595,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.3020276427268982,
"learning_rate": 1.4814741573567514e-05,
"loss": 0.7242,
"step": 439
},
{
"epoch": 0.3606719051186977,
"grad_norm": 1.0601470562875042,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.6490952968597412,
"learning_rate": 1.47914294915635e-05,
"loss": 0.7257,
"step": 440
},
{
"epoch": 0.36149161399396745,
"grad_norm": 1.195441276823721,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.19314445555210114,
"learning_rate": 1.4768083561822451e-05,
"loss": 0.7449,
"step": 441
},
{
"epoch": 0.36231132286923723,
"grad_norm": 1.2435878806244167,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.7209780216217041,
"learning_rate": 1.4744703949265268e-05,
"loss": 0.7524,
"step": 442
},
{
"epoch": 0.363131031744507,
"grad_norm": 1.0983663881126378,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.9197759032249451,
"learning_rate": 1.4721290819050804e-05,
"loss": 0.7203,
"step": 443
},
{
"epoch": 0.3639507406197768,
"grad_norm": 1.0767216250890932,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.4858049750328064,
"learning_rate": 1.4697844336574685e-05,
"loss": 0.7286,
"step": 444
},
{
"epoch": 0.3647704494950465,
"grad_norm": 1.0905849338939828,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.1707854270935059,
"learning_rate": 1.467436466746814e-05,
"loss": 0.7085,
"step": 445
},
{
"epoch": 0.3655901583703163,
"grad_norm": 1.1226230206866399,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.9817597270011902,
"learning_rate": 1.465085197759684e-05,
"loss": 0.7608,
"step": 446
},
{
"epoch": 0.36640986724558605,
"grad_norm": 1.3369887187364704,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.8043301105499268,
"learning_rate": 1.4627306433059724e-05,
"loss": 0.738,
"step": 447
},
{
"epoch": 0.3672295761208558,
"grad_norm": 1.2364783941457635,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 0.8743286728858948,
"learning_rate": 1.4603728200187823e-05,
"loss": 0.7193,
"step": 448
},
{
"epoch": 0.3680492849961256,
"grad_norm": 1.1212546954830682,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.6300035119056702,
"learning_rate": 1.4580117445543077e-05,
"loss": 0.7568,
"step": 449
},
{
"epoch": 0.3688689938713954,
"grad_norm": 1.2932495912189028,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.608639657497406,
"learning_rate": 1.4556474335917181e-05,
"loss": 0.7809,
"step": 450
},
{
"epoch": 0.36968870274666515,
"grad_norm": 1.068165226472755,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.6490491628646851,
"learning_rate": 1.4532799038330385e-05,
"loss": 0.7382,
"step": 451
},
{
"epoch": 0.3705084116219349,
"grad_norm": 1.3394371514055623,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.12041778862476349,
"learning_rate": 1.4509091720030323e-05,
"loss": 0.7515,
"step": 452
},
{
"epoch": 0.37132812049720465,
"grad_norm": 1.1527658108193388,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.2717753052711487,
"learning_rate": 1.4485352548490827e-05,
"loss": 0.7418,
"step": 453
},
{
"epoch": 0.3721478293724744,
"grad_norm": 1.2454380396096107,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.3366001546382904,
"learning_rate": 1.4461581691410757e-05,
"loss": 0.7381,
"step": 454
},
{
"epoch": 0.3729675382477442,
"grad_norm": 1.435609533486633,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.6201334595680237,
"learning_rate": 1.4437779316712797e-05,
"loss": 0.7211,
"step": 455
},
{
"epoch": 0.373787247123014,
"grad_norm": 1.1719917475059904,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.3496711254119873,
"learning_rate": 1.4413945592542282e-05,
"loss": 0.7119,
"step": 456
},
{
"epoch": 0.37460695599828375,
"grad_norm": 1.2631644305361478,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.3474515676498413,
"learning_rate": 1.4390080687266013e-05,
"loss": 0.7389,
"step": 457
},
{
"epoch": 0.37542666487355353,
"grad_norm": 1.374481287587369,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.9217073321342468,
"learning_rate": 1.4366184769471053e-05,
"loss": 0.7995,
"step": 458
},
{
"epoch": 0.37624637374882325,
"grad_norm": 1.127443737194422,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.8698320388793945,
"learning_rate": 1.4342258007963541e-05,
"loss": 0.7308,
"step": 459
},
{
"epoch": 0.377066082624093,
"grad_norm": 1.2250914713943573,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.49510273337364197,
"learning_rate": 1.4318300571767514e-05,
"loss": 0.7036,
"step": 460
},
{
"epoch": 0.3778857914993628,
"grad_norm": 1.3170746977850143,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 0.9360310435295105,
"learning_rate": 1.4294312630123699e-05,
"loss": 0.8955,
"step": 461
},
{
"epoch": 0.3787055003746326,
"grad_norm": 0.9506962746552086,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.0116680096834898,
"learning_rate": 1.4270294352488316e-05,
"loss": 0.7484,
"step": 462
},
{
"epoch": 0.37952520924990235,
"grad_norm": 1.2476553828723418,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.415592759847641,
"learning_rate": 1.4246245908531883e-05,
"loss": 0.7755,
"step": 463
},
{
"epoch": 0.3803449181251721,
"grad_norm": 1.0975995086599653,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.9603267908096313,
"learning_rate": 1.4222167468138034e-05,
"loss": 0.732,
"step": 464
},
{
"epoch": 0.38116462700044185,
"grad_norm": 1.0281165949335278,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.9017184972763062,
"learning_rate": 1.4198059201402288e-05,
"loss": 0.7393,
"step": 465
},
{
"epoch": 0.3819843358757116,
"grad_norm": 1.0545039514632228,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.1416831016540527,
"learning_rate": 1.4173921278630874e-05,
"loss": 0.7382,
"step": 466
},
{
"epoch": 0.3828040447509814,
"grad_norm": 0.9931182499151184,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.2895710468292236,
"learning_rate": 1.4149753870339509e-05,
"loss": 0.7607,
"step": 467
},
{
"epoch": 0.3836237536262512,
"grad_norm": 1.2336519636658767,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.06740442663431168,
"learning_rate": 1.4125557147252215e-05,
"loss": 0.7406,
"step": 468
},
{
"epoch": 0.38444346250152095,
"grad_norm": 1.1112575513358713,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.37072986364364624,
"learning_rate": 1.410133128030009e-05,
"loss": 0.7604,
"step": 469
},
{
"epoch": 0.3852631713767907,
"grad_norm": 1.086751556557447,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.5848031640052795,
"learning_rate": 1.4077076440620112e-05,
"loss": 0.7241,
"step": 470
},
{
"epoch": 0.3860828802520605,
"grad_norm": 1.0116731470478444,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.8761907815933228,
"learning_rate": 1.4052792799553935e-05,
"loss": 0.7611,
"step": 471
},
{
"epoch": 0.3869025891273302,
"grad_norm": 1.138166849503837,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.6764221787452698,
"learning_rate": 1.4028480528646669e-05,
"loss": 0.7349,
"step": 472
},
{
"epoch": 0.3877222980026,
"grad_norm": 1.1322234026490996,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 2.2125132083892822,
"learning_rate": 1.4004139799645669e-05,
"loss": 0.7449,
"step": 473
},
{
"epoch": 0.38854200687786977,
"grad_norm": 1.163668181603229,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.7021305561065674,
"learning_rate": 1.3979770784499325e-05,
"loss": 0.735,
"step": 474
},
{
"epoch": 0.38936171575313955,
"grad_norm": 1.1154909803559077,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.3009178936481476,
"learning_rate": 1.3955373655355852e-05,
"loss": 0.7567,
"step": 475
},
{
"epoch": 0.3901814246284093,
"grad_norm": 1.2757091043663418,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.5716661810874939,
"learning_rate": 1.3930948584562062e-05,
"loss": 0.7388,
"step": 476
},
{
"epoch": 0.3910011335036791,
"grad_norm": 1.005428772677519,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.16034334897994995,
"learning_rate": 1.3906495744662159e-05,
"loss": 0.7399,
"step": 477
},
{
"epoch": 0.3918208423789489,
"grad_norm": 1.2098812588919146,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.3458595275878906,
"learning_rate": 1.3882015308396508e-05,
"loss": 0.7515,
"step": 478
},
{
"epoch": 0.3926405512542186,
"grad_norm": 1.0542600272021108,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.9916556477546692,
"learning_rate": 1.3857507448700425e-05,
"loss": 0.7659,
"step": 479
},
{
"epoch": 0.39346026012948837,
"grad_norm": 1.1305994420021006,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 1.3020050525665283,
"learning_rate": 1.3832972338702954e-05,
"loss": 0.7261,
"step": 480
},
{
"epoch": 0.39427996900475815,
"grad_norm": 1.3599263854538262,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.6249203681945801,
"learning_rate": 1.3808410151725633e-05,
"loss": 0.7338,
"step": 481
},
{
"epoch": 0.3950996778800279,
"grad_norm": 0.9868710509969043,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.1347353160381317,
"learning_rate": 1.3783821061281285e-05,
"loss": 0.7062,
"step": 482
},
{
"epoch": 0.3959193867552977,
"grad_norm": 1.0543382360242217,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.35934239625930786,
"learning_rate": 1.3759205241072782e-05,
"loss": 0.7774,
"step": 483
},
{
"epoch": 0.3967390956305675,
"grad_norm": 1.1322176499919472,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.1221669912338257,
"learning_rate": 1.3734562864991823e-05,
"loss": 0.7282,
"step": 484
},
{
"epoch": 0.39755880450583725,
"grad_norm": 1.301043094373027,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.604775071144104,
"learning_rate": 1.3709894107117698e-05,
"loss": 0.7796,
"step": 485
},
{
"epoch": 0.39837851338110697,
"grad_norm": 1.2657953160151474,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.021316409111023,
"learning_rate": 1.3685199141716074e-05,
"loss": 0.74,
"step": 486
},
{
"epoch": 0.39919822225637674,
"grad_norm": 1.1601299667099838,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.0085538625717163,
"learning_rate": 1.3660478143237748e-05,
"loss": 0.7207,
"step": 487
},
{
"epoch": 0.4000179311316465,
"grad_norm": 1.0745042630624322,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.265486717224121,
"learning_rate": 1.3635731286317415e-05,
"loss": 0.7337,
"step": 488
},
{
"epoch": 0.4008376400069163,
"grad_norm": 1.257397574792129,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.6353854537010193,
"learning_rate": 1.3610958745772456e-05,
"loss": 0.7496,
"step": 489
},
{
"epoch": 0.40165734888218607,
"grad_norm": 1.1644571038180695,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.8903603553771973,
"learning_rate": 1.3586160696601667e-05,
"loss": 0.7426,
"step": 490
},
{
"epoch": 0.40247705775745585,
"grad_norm": 0.9308681268157319,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.12310586124658585,
"learning_rate": 1.3561337313984053e-05,
"loss": 0.7252,
"step": 491
},
{
"epoch": 0.4032967666327256,
"grad_norm": 0.9657237434155711,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.023039432242512703,
"learning_rate": 1.3536488773277586e-05,
"loss": 0.7425,
"step": 492
},
{
"epoch": 0.40411647550799534,
"grad_norm": 1.3247122197056929,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.9444166421890259,
"learning_rate": 1.3511615250017948e-05,
"loss": 0.7122,
"step": 493
},
{
"epoch": 0.4049361843832651,
"grad_norm": 1.3853407443801946,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.9036451578140259,
"learning_rate": 1.3486716919917313e-05,
"loss": 0.7437,
"step": 494
},
{
"epoch": 0.4057558932585349,
"grad_norm": 1.1835695640951718,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.4188259243965149,
"learning_rate": 1.3461793958863087e-05,
"loss": 0.7303,
"step": 495
},
{
"epoch": 0.40657560213380467,
"grad_norm": 1.1724134694184811,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.006541498936712742,
"learning_rate": 1.3436846542916686e-05,
"loss": 0.7074,
"step": 496
},
{
"epoch": 0.40739531100907445,
"grad_norm": 1.1955449726577145,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.8993229269981384,
"learning_rate": 1.3411874848312274e-05,
"loss": 0.7392,
"step": 497
},
{
"epoch": 0.4082150198843442,
"grad_norm": 1.1214979705605859,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.1051256656646729,
"learning_rate": 1.338687905145552e-05,
"loss": 0.7717,
"step": 498
},
{
"epoch": 0.40903472875961394,
"grad_norm": 1.2736066433750048,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.8588690161705017,
"learning_rate": 1.3361859328922368e-05,
"loss": 0.7905,
"step": 499
},
{
"epoch": 0.4098544376348837,
"grad_norm": 1.0983803661857154,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 1.2294137477874756,
"learning_rate": 1.3336815857457772e-05,
"loss": 0.7287,
"step": 500
},
{
"epoch": 0.4106741465101535,
"grad_norm": 1.2890655846930097,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.059365153312683,
"learning_rate": 1.3311748813974454e-05,
"loss": 0.6994,
"step": 501
},
{
"epoch": 0.41149385538542327,
"grad_norm": 1.2107844781460742,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.3470935821533203,
"learning_rate": 1.3286658375551654e-05,
"loss": 0.7324,
"step": 502
},
{
"epoch": 0.41231356426069304,
"grad_norm": 1.3385292812796277,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.700898289680481,
"learning_rate": 1.3261544719433878e-05,
"loss": 0.7491,
"step": 503
},
{
"epoch": 0.4131332731359628,
"grad_norm": 1.2939670938215888,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.353203684091568,
"learning_rate": 1.3236408023029655e-05,
"loss": 0.7668,
"step": 504
},
{
"epoch": 0.4139529820112326,
"grad_norm": 1.147851487879954,
"latest_boundary_loss": 0.00950749684125185,
"latest_lm_loss": 2.3573265075683594,
"learning_rate": 1.3211248463910263e-05,
"loss": 0.7683,
"step": 505
},
{
"epoch": 0.4147726908865023,
"grad_norm": 1.2335117447655448,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.7799752950668335,
"learning_rate": 1.3186066219808498e-05,
"loss": 0.6936,
"step": 506
},
{
"epoch": 0.4155923997617721,
"grad_norm": 1.1170372539905529,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.4094339609146118,
"learning_rate": 1.3160861468617402e-05,
"loss": 0.7203,
"step": 507
},
{
"epoch": 0.41641210863704187,
"grad_norm": 1.4661414757878448,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 2.2824676036834717,
"learning_rate": 1.3135634388389016e-05,
"loss": 0.7154,
"step": 508
},
{
"epoch": 0.41723181751231164,
"grad_norm": 1.0196456579306,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.661888599395752,
"learning_rate": 1.311038515733311e-05,
"loss": 0.741,
"step": 509
},
{
"epoch": 0.4180515263875814,
"grad_norm": 1.1275553911545413,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.1694858074188232,
"learning_rate": 1.3085113953815948e-05,
"loss": 0.7395,
"step": 510
},
{
"epoch": 0.4188712352628512,
"grad_norm": 1.1461680509371541,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.6729932427406311,
"learning_rate": 1.3059820956358998e-05,
"loss": 0.7302,
"step": 511
},
{
"epoch": 0.41969094413812097,
"grad_norm": 1.1291615140620963,
"latest_boundary_loss": 0.009173923172056675,
"latest_lm_loss": 0.5655929446220398,
"learning_rate": 1.3034506343637687e-05,
"loss": 0.7483,
"step": 512
},
{
"epoch": 0.4205106530133907,
"grad_norm": 1.1655584396479437,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.03881552442908287,
"learning_rate": 1.3009170294480149e-05,
"loss": 0.7308,
"step": 513
},
{
"epoch": 0.42133036188866047,
"grad_norm": 1.0495402945312882,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 1.2888919115066528,
"learning_rate": 1.2983812987865936e-05,
"loss": 0.7263,
"step": 514
},
{
"epoch": 0.42215007076393024,
"grad_norm": 1.0955501569488508,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.059211887419223785,
"learning_rate": 1.2958434602924771e-05,
"loss": 0.7279,
"step": 515
},
{
"epoch": 0.4229697796392,
"grad_norm": 1.3890715551550903,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.8923695683479309,
"learning_rate": 1.2933035318935285e-05,
"loss": 0.7664,
"step": 516
},
{
"epoch": 0.4237894885144698,
"grad_norm": 1.223868985895175,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.6218183636665344,
"learning_rate": 1.290761531532374e-05,
"loss": 0.734,
"step": 517
},
{
"epoch": 0.42460919738973957,
"grad_norm": 1.1339782948741959,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.10604207217693329,
"learning_rate": 1.2882174771662765e-05,
"loss": 0.7519,
"step": 518
},
{
"epoch": 0.42542890626500934,
"grad_norm": 1.1938642967981403,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.4498766362667084,
"learning_rate": 1.2856713867670089e-05,
"loss": 0.7384,
"step": 519
},
{
"epoch": 0.42624861514027906,
"grad_norm": 1.2206350865787712,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 0.554764449596405,
"learning_rate": 1.2831232783207278e-05,
"loss": 0.7627,
"step": 520
},
{
"epoch": 0.42706832401554884,
"grad_norm": 1.0848106199767509,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.2671107053756714,
"learning_rate": 1.2805731698278442e-05,
"loss": 0.7152,
"step": 521
},
{
"epoch": 0.4278880328908186,
"grad_norm": 1.1873998531086574,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.7407390475273132,
"learning_rate": 1.2780210793028994e-05,
"loss": 0.7248,
"step": 522
},
{
"epoch": 0.4287077417660884,
"grad_norm": 1.1175539503369465,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.04558875039219856,
"learning_rate": 1.2754670247744353e-05,
"loss": 0.7582,
"step": 523
},
{
"epoch": 0.42952745064135817,
"grad_norm": 1.1747279815932254,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.1720225811004639,
"learning_rate": 1.272911024284869e-05,
"loss": 0.7082,
"step": 524
},
{
"epoch": 0.43034715951662794,
"grad_norm": 1.0195032381622187,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.30253586173057556,
"learning_rate": 1.2703530958903631e-05,
"loss": 0.7374,
"step": 525
},
{
"epoch": 0.4311668683918977,
"grad_norm": 1.02508790813853,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.024762794375419617,
"learning_rate": 1.2677932576606998e-05,
"loss": 0.7446,
"step": 526
},
{
"epoch": 0.43198657726716744,
"grad_norm": 1.0436409185663331,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 2.6144864559173584,
"learning_rate": 1.265231527679153e-05,
"loss": 0.6868,
"step": 527
},
{
"epoch": 0.4328062861424372,
"grad_norm": 1.0837854209927567,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.0316283702850342,
"learning_rate": 1.2626679240423605e-05,
"loss": 0.7094,
"step": 528
},
{
"epoch": 0.433625995017707,
"grad_norm": 1.0970445290150668,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.6730175614356995,
"learning_rate": 1.260102464860195e-05,
"loss": 0.7029,
"step": 529
},
{
"epoch": 0.43444570389297676,
"grad_norm": 0.9845107027650578,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.36988866329193115,
"learning_rate": 1.2575351682556387e-05,
"loss": 0.7287,
"step": 530
},
{
"epoch": 0.43526541276824654,
"grad_norm": 1.0551852431331465,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.8491936326026917,
"learning_rate": 1.2549660523646527e-05,
"loss": 0.7013,
"step": 531
},
{
"epoch": 0.4360851216435163,
"grad_norm": 1.1409667432397954,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.215164065361023,
"learning_rate": 1.2523951353360504e-05,
"loss": 0.6913,
"step": 532
},
{
"epoch": 0.43690483051878604,
"grad_norm": 1.2481842714766556,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.7520402073860168,
"learning_rate": 1.2498224353313684e-05,
"loss": 0.7328,
"step": 533
},
{
"epoch": 0.4377245393940558,
"grad_norm": 0.9648944088037319,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.33235761523246765,
"learning_rate": 1.2472479705247393e-05,
"loss": 0.6906,
"step": 534
},
{
"epoch": 0.4385442482693256,
"grad_norm": 1.109986630999586,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 0.04637651517987251,
"learning_rate": 1.2446717591027624e-05,
"loss": 0.7223,
"step": 535
},
{
"epoch": 0.43936395714459536,
"grad_norm": 1.1547579521081723,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.1103997230529785,
"learning_rate": 1.2420938192643746e-05,
"loss": 0.712,
"step": 536
},
{
"epoch": 0.44018366601986514,
"grad_norm": 0.9662969033428204,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.5339496731758118,
"learning_rate": 1.2395141692207244e-05,
"loss": 0.7405,
"step": 537
},
{
"epoch": 0.4410033748951349,
"grad_norm": 1.1567395843875306,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 1.1351995468139648,
"learning_rate": 1.2369328271950404e-05,
"loss": 0.7741,
"step": 538
},
{
"epoch": 0.4418230837704047,
"grad_norm": 1.1233943419980932,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.2399036884307861,
"learning_rate": 1.2343498114225038e-05,
"loss": 0.741,
"step": 539
},
{
"epoch": 0.4426427926456744,
"grad_norm": 1.4207818391730094,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.010393626056611538,
"learning_rate": 1.2317651401501201e-05,
"loss": 0.7307,
"step": 540
},
{
"epoch": 0.4434625015209442,
"grad_norm": 1.2255555286398303,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.7697814702987671,
"learning_rate": 1.229178831636589e-05,
"loss": 0.7216,
"step": 541
},
{
"epoch": 0.44428221039621396,
"grad_norm": 1.3881863141796988,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 0.99439936876297,
"learning_rate": 1.2265909041521764e-05,
"loss": 0.6919,
"step": 542
},
{
"epoch": 0.44510191927148374,
"grad_norm": 1.1200242781841891,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.002538105705752969,
"learning_rate": 1.2240013759785849e-05,
"loss": 0.6837,
"step": 543
},
{
"epoch": 0.4459216281467535,
"grad_norm": 1.4755758588162742,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.9102796912193298,
"learning_rate": 1.2214102654088248e-05,
"loss": 0.7379,
"step": 544
},
{
"epoch": 0.4467413370220233,
"grad_norm": 1.2072608424427014,
"latest_boundary_loss": 0.010217878967523575,
"latest_lm_loss": 0.5200499892234802,
"learning_rate": 1.2188175907470847e-05,
"loss": 0.723,
"step": 545
},
{
"epoch": 0.44756104589729306,
"grad_norm": 1.3118723912510926,
"latest_boundary_loss": 0.010783301666378975,
"latest_lm_loss": 0.6302790641784668,
"learning_rate": 1.2162233703086024e-05,
"loss": 0.7146,
"step": 546
},
{
"epoch": 0.4483807547725628,
"grad_norm": 1.3015491045292682,
"latest_boundary_loss": 0.009173923172056675,
"latest_lm_loss": 0.35810452699661255,
"learning_rate": 1.2136276224195349e-05,
"loss": 0.7129,
"step": 547
},
{
"epoch": 0.44920046364783256,
"grad_norm": 1.1115206010180478,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 1.2085323333740234,
"learning_rate": 1.2110303654168305e-05,
"loss": 0.7351,
"step": 548
},
{
"epoch": 0.45002017252310234,
"grad_norm": 1.2978456657040731,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.22683051228523254,
"learning_rate": 1.2084316176480972e-05,
"loss": 0.7369,
"step": 549
},
{
"epoch": 0.4508398813983721,
"grad_norm": 1.1386797203646921,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.8762317895889282,
"learning_rate": 1.2058313974714746e-05,
"loss": 0.7793,
"step": 550
},
{
"epoch": 0.4516595902736419,
"grad_norm": 1.133369505534749,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.18357262015342712,
"learning_rate": 1.2032297232555039e-05,
"loss": 0.7164,
"step": 551
},
{
"epoch": 0.45247929914891166,
"grad_norm": 1.0976464923659344,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.44615650177001953,
"learning_rate": 1.2006266133789975e-05,
"loss": 0.7183,
"step": 552
},
{
"epoch": 0.45329900802418144,
"grad_norm": 1.1047182843536714,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.0865058898925781,
"learning_rate": 1.1980220862309097e-05,
"loss": 0.7209,
"step": 553
},
{
"epoch": 0.45411871689945116,
"grad_norm": 0.8690509383094088,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.9522266387939453,
"learning_rate": 1.1954161602102068e-05,
"loss": 0.7248,
"step": 554
},
{
"epoch": 0.45493842577472093,
"grad_norm": 1.2804506079189952,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.9156290292739868,
"learning_rate": 1.1928088537257376e-05,
"loss": 0.7258,
"step": 555
},
{
"epoch": 0.4557581346499907,
"grad_norm": 1.170165270344948,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.4329899251461029,
"learning_rate": 1.1902001851961019e-05,
"loss": 0.7441,
"step": 556
},
{
"epoch": 0.4565778435252605,
"grad_norm": 1.1450043269486405,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.7363948822021484,
"learning_rate": 1.1875901730495215e-05,
"loss": 0.7485,
"step": 557
},
{
"epoch": 0.45739755240053026,
"grad_norm": 1.1176526384115035,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.8782221078872681,
"learning_rate": 1.1849788357237108e-05,
"loss": 0.722,
"step": 558
},
{
"epoch": 0.45821726127580004,
"grad_norm": 1.1399109509361585,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.7295437455177307,
"learning_rate": 1.1823661916657441e-05,
"loss": 0.7572,
"step": 559
},
{
"epoch": 0.45903697015106976,
"grad_norm": 1.176821184062998,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.22839243710041046,
"learning_rate": 1.1797522593319277e-05,
"loss": 0.7035,
"step": 560
},
{
"epoch": 0.45985667902633953,
"grad_norm": 1.0824518861080836,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.1131099462509155,
"learning_rate": 1.1771370571876681e-05,
"loss": 0.7579,
"step": 561
},
{
"epoch": 0.4606763879016093,
"grad_norm": 1.1658397590461065,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.500022292137146,
"learning_rate": 1.1745206037073426e-05,
"loss": 0.7197,
"step": 562
},
{
"epoch": 0.4614960967768791,
"grad_norm": 0.9696314773240985,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.3225027322769165,
"learning_rate": 1.1719029173741675e-05,
"loss": 0.7487,
"step": 563
},
{
"epoch": 0.46231580565214886,
"grad_norm": 1.2749941050242513,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.002359984442591667,
"learning_rate": 1.1692840166800688e-05,
"loss": 0.7855,
"step": 564
},
{
"epoch": 0.46313551452741863,
"grad_norm": 1.131174909872021,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 3.8920021057128906,
"learning_rate": 1.1666639201255507e-05,
"loss": 0.7333,
"step": 565
},
{
"epoch": 0.4639552234026884,
"grad_norm": 1.13226898831104,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.30660176277160645,
"learning_rate": 1.1640426462195654e-05,
"loss": 0.7062,
"step": 566
},
{
"epoch": 0.46477493227795813,
"grad_norm": 1.0344878166410363,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.33057618141174316,
"learning_rate": 1.1614202134793823e-05,
"loss": 0.694,
"step": 567
},
{
"epoch": 0.4655946411532279,
"grad_norm": 1.1937403952306902,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.015523593872785568,
"learning_rate": 1.1587966404304565e-05,
"loss": 0.6908,
"step": 568
},
{
"epoch": 0.4664143500284977,
"grad_norm": 1.1090389635648843,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.8839054107666016,
"learning_rate": 1.1561719456062995e-05,
"loss": 0.7354,
"step": 569
},
{
"epoch": 0.46723405890376746,
"grad_norm": 1.1840219229359357,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.514827311038971,
"learning_rate": 1.1535461475483461e-05,
"loss": 0.7264,
"step": 570
},
{
"epoch": 0.46805376777903723,
"grad_norm": 1.0017285522394928,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.6833021640777588,
"learning_rate": 1.150919264805825e-05,
"loss": 0.7183,
"step": 571
},
{
"epoch": 0.468873476654307,
"grad_norm": 0.9595248061054589,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.1614549160003662,
"learning_rate": 1.1482913159356281e-05,
"loss": 0.7504,
"step": 572
},
{
"epoch": 0.4696931855295768,
"grad_norm": 1.1999497042810918,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.9407356977462769,
"learning_rate": 1.1456623195021778e-05,
"loss": 0.7227,
"step": 573
},
{
"epoch": 0.4705128944048465,
"grad_norm": 1.1355241972313819,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.5009220242500305,
"learning_rate": 1.143032294077297e-05,
"loss": 0.7823,
"step": 574
},
{
"epoch": 0.4713326032801163,
"grad_norm": 1.1373593094185455,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.9563060402870178,
"learning_rate": 1.1404012582400778e-05,
"loss": 0.6815,
"step": 575
},
{
"epoch": 0.47215231215538606,
"grad_norm": 1.02016469051092,
"latest_boundary_loss": 0.0103687709197402,
"latest_lm_loss": 0.9105382561683655,
"learning_rate": 1.1377692305767496e-05,
"loss": 0.7352,
"step": 576
},
{
"epoch": 0.47297202103065583,
"grad_norm": 1.2452483209023992,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.5182563066482544,
"learning_rate": 1.1351362296805487e-05,
"loss": 0.7558,
"step": 577
},
{
"epoch": 0.4737917299059256,
"grad_norm": 1.1671462620742221,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.8756719827651978,
"learning_rate": 1.1325022741515865e-05,
"loss": 0.7339,
"step": 578
},
{
"epoch": 0.4746114387811954,
"grad_norm": 1.1830446171622626,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 2.7221529483795166,
"learning_rate": 1.1298673825967184e-05,
"loss": 0.7296,
"step": 579
},
{
"epoch": 0.47543114765646516,
"grad_norm": 1.067104366060196,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.6956509947776794,
"learning_rate": 1.1272315736294108e-05,
"loss": 0.779,
"step": 580
},
{
"epoch": 0.4762508565317349,
"grad_norm": 1.1437808356933874,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.2700379192829132,
"learning_rate": 1.1245948658696127e-05,
"loss": 0.7224,
"step": 581
},
{
"epoch": 0.47707056540700465,
"grad_norm": 1.0850681144037142,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.2734732925891876,
"learning_rate": 1.1219572779436215e-05,
"loss": 0.6841,
"step": 582
},
{
"epoch": 0.47789027428227443,
"grad_norm": 1.0295891703034161,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.6549234986305237,
"learning_rate": 1.1193188284839518e-05,
"loss": 0.7038,
"step": 583
},
{
"epoch": 0.4787099831575442,
"grad_norm": 0.9417735245212596,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.17740729451179504,
"learning_rate": 1.1166795361292055e-05,
"loss": 0.7134,
"step": 584
},
{
"epoch": 0.479529692032814,
"grad_norm": 1.0717976605903112,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.9407469034194946,
"learning_rate": 1.1140394195239376e-05,
"loss": 0.7312,
"step": 585
},
{
"epoch": 0.48034940090808376,
"grad_norm": 1.0454325438374934,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.17677555978298187,
"learning_rate": 1.1113984973185268e-05,
"loss": 0.7317,
"step": 586
},
{
"epoch": 0.48116910978335353,
"grad_norm": 1.1317207451327171,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.7309148907661438,
"learning_rate": 1.1087567881690422e-05,
"loss": 0.699,
"step": 587
},
{
"epoch": 0.48198881865862325,
"grad_norm": 1.1152857660587148,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.7345439195632935,
"learning_rate": 1.1061143107371122e-05,
"loss": 0.7697,
"step": 588
},
{
"epoch": 0.48280852753389303,
"grad_norm": 1.6202580460230573,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.0013889408437535167,
"learning_rate": 1.1034710836897922e-05,
"loss": 0.7546,
"step": 589
},
{
"epoch": 0.4836282364091628,
"grad_norm": 1.2262278117636485,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.024789571762085,
"learning_rate": 1.1008271256994338e-05,
"loss": 0.7729,
"step": 590
},
{
"epoch": 0.4844479452844326,
"grad_norm": 1.0314200043962447,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.0004191500192973763,
"learning_rate": 1.0981824554435518e-05,
"loss": 0.7379,
"step": 591
},
{
"epoch": 0.48526765415970236,
"grad_norm": 0.9605216918624647,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.8892647624015808,
"learning_rate": 1.095537091604692e-05,
"loss": 0.727,
"step": 592
},
{
"epoch": 0.48608736303497213,
"grad_norm": 1.1482266267714891,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.17624390125274658,
"learning_rate": 1.0928910528703007e-05,
"loss": 0.7201,
"step": 593
},
{
"epoch": 0.48690707191024185,
"grad_norm": 1.0711343930243284,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.4015139043331146,
"learning_rate": 1.0902443579325914e-05,
"loss": 0.7092,
"step": 594
},
{
"epoch": 0.4877267807855116,
"grad_norm": 1.0237731523270135,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.3743845224380493,
"learning_rate": 1.087597025488413e-05,
"loss": 0.7215,
"step": 595
},
{
"epoch": 0.4885464896607814,
"grad_norm": 1.195715711617991,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.1295346021652222,
"learning_rate": 1.0849490742391184e-05,
"loss": 0.7478,
"step": 596
},
{
"epoch": 0.4893661985360512,
"grad_norm": 0.8565471225253243,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.2088268995285034,
"learning_rate": 1.0823005228904315e-05,
"loss": 0.6693,
"step": 597
},
{
"epoch": 0.49018590741132095,
"grad_norm": 1.0579159505400326,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.006226507015526295,
"learning_rate": 1.0796513901523156e-05,
"loss": 0.7047,
"step": 598
},
{
"epoch": 0.49100561628659073,
"grad_norm": 1.2411125504060623,
"latest_boundary_loss": 0.010595110245049,
"latest_lm_loss": 1.092541217803955,
"learning_rate": 1.0770016947388407e-05,
"loss": 0.7204,
"step": 599
},
{
"epoch": 0.4918253251618605,
"grad_norm": 1.1697544242871416,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.0005898121744394302,
"learning_rate": 1.0743514553680521e-05,
"loss": 0.7191,
"step": 600
},
{
"epoch": 0.4926450340371302,
"grad_norm": 1.150186014642122,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.2228296846151352,
"learning_rate": 1.0717006907618377e-05,
"loss": 0.7198,
"step": 601
},
{
"epoch": 0.4934647429124,
"grad_norm": 1.0878926057306257,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.24664446711540222,
"learning_rate": 1.0690494196457954e-05,
"loss": 0.6972,
"step": 602
},
{
"epoch": 0.4942844517876698,
"grad_norm": 1.1557051213120508,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.2222727537155151,
"learning_rate": 1.066397660749102e-05,
"loss": 0.7766,
"step": 603
},
{
"epoch": 0.49510416066293955,
"grad_norm": 1.6902267456131215,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.47474098205566406,
"learning_rate": 1.0637454328043792e-05,
"loss": 0.7588,
"step": 604
},
{
"epoch": 0.4959238695382093,
"grad_norm": 1.1462993133221944,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.09917628020048141,
"learning_rate": 1.0610927545475624e-05,
"loss": 0.6974,
"step": 605
},
{
"epoch": 0.4967435784134791,
"grad_norm": 1.2330122895773428,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 2.0664823055267334,
"learning_rate": 1.0584396447177682e-05,
"loss": 0.7141,
"step": 606
},
{
"epoch": 0.4975632872887489,
"grad_norm": 1.1903223489656898,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.3248700201511383,
"learning_rate": 1.0557861220571626e-05,
"loss": 0.7436,
"step": 607
},
{
"epoch": 0.4983829961640186,
"grad_norm": 1.0525145726041336,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.9246601462364197,
"learning_rate": 1.0531322053108268e-05,
"loss": 0.7358,
"step": 608
},
{
"epoch": 0.4992027050392884,
"grad_norm": 1.073387686301777,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.7231375575065613,
"learning_rate": 1.050477913226626e-05,
"loss": 0.7099,
"step": 609
},
{
"epoch": 0.5000224139145582,
"grad_norm": 1.0785844051974611,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.9444078803062439,
"learning_rate": 1.0478232645550784e-05,
"loss": 0.7155,
"step": 610
},
{
"epoch": 0.5008421227898279,
"grad_norm": 1.2033871638732478,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.017397088930010796,
"learning_rate": 1.045168278049219e-05,
"loss": 0.6901,
"step": 611
},
{
"epoch": 0.5016618316650977,
"grad_norm": 1.245964229930425,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.8417883515357971,
"learning_rate": 1.042512972464471e-05,
"loss": 0.7753,
"step": 612
},
{
"epoch": 0.5024815405403674,
"grad_norm": 1.1704580710656929,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.7384148240089417,
"learning_rate": 1.0398573665585105e-05,
"loss": 0.7798,
"step": 613
},
{
"epoch": 0.5033012494156373,
"grad_norm": 1.03512114659302,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.712203025817871,
"learning_rate": 1.0372014790911365e-05,
"loss": 0.7085,
"step": 614
},
{
"epoch": 0.504120958290907,
"grad_norm": 1.0600114615644445,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.008176220580935478,
"learning_rate": 1.0345453288241356e-05,
"loss": 0.7381,
"step": 615
},
{
"epoch": 0.5049406671661768,
"grad_norm": 0.9570963129188469,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.1741873025894165,
"learning_rate": 1.0318889345211519e-05,
"loss": 0.6863,
"step": 616
},
{
"epoch": 0.5057603760414465,
"grad_norm": 1.0952226234220879,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.05534173920750618,
"learning_rate": 1.0292323149475527e-05,
"loss": 0.7389,
"step": 617
},
{
"epoch": 0.5065800849167162,
"grad_norm": 0.912949202558354,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.8197525143623352,
"learning_rate": 1.0265754888702972e-05,
"loss": 0.6844,
"step": 618
},
{
"epoch": 0.5073997937919861,
"grad_norm": 0.9542031231884737,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.9308606386184692,
"learning_rate": 1.023918475057803e-05,
"loss": 0.735,
"step": 619
},
{
"epoch": 0.5082195026672558,
"grad_norm": 1.118753957075958,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.1839903593063354,
"learning_rate": 1.0212612922798143e-05,
"loss": 0.721,
"step": 620
},
{
"epoch": 0.5090392115425256,
"grad_norm": 1.0574981809029294,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 1.0315492153167725,
"learning_rate": 1.0186039593072685e-05,
"loss": 0.7423,
"step": 621
},
{
"epoch": 0.5098589204177953,
"grad_norm": 1.080483408748035,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.323687195777893,
"learning_rate": 1.0159464949121642e-05,
"loss": 0.7038,
"step": 622
},
{
"epoch": 0.5106786292930652,
"grad_norm": 1.1495723023434858,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.4183761179447174,
"learning_rate": 1.0132889178674283e-05,
"loss": 0.6813,
"step": 623
},
{
"epoch": 0.5114983381683349,
"grad_norm": 1.0708901223645004,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.6019342541694641,
"learning_rate": 1.0106312469467841e-05,
"loss": 0.6973,
"step": 624
},
{
"epoch": 0.5123180470436046,
"grad_norm": 1.0609805328828794,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.6901552677154541,
"learning_rate": 1.0079735009246168e-05,
"loss": 0.7157,
"step": 625
},
{
"epoch": 0.5131377559188744,
"grad_norm": 1.0793708606491978,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.2777204513549805,
"learning_rate": 1.0053156985758435e-05,
"loss": 0.7053,
"step": 626
},
{
"epoch": 0.5139574647941442,
"grad_norm": 1.042882812280101,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 0.24890795350074768,
"learning_rate": 1.0026578586757778e-05,
"loss": 0.7315,
"step": 627
},
{
"epoch": 0.514777173669414,
"grad_norm": 1.0704113771661667,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.001798719633370638,
"learning_rate": 1e-05,
"loss": 0.7072,
"step": 628
},
{
"epoch": 0.5155968825446837,
"grad_norm": 1.2562455410918247,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.0021001591812819242,
"learning_rate": 9.973421413242224e-06,
"loss": 0.7203,
"step": 629
},
{
"epoch": 0.5164165914199536,
"grad_norm": 1.0994419417627264,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 0.7506188750267029,
"learning_rate": 9.946843014241572e-06,
"loss": 0.6909,
"step": 630
},
{
"epoch": 0.5172363002952233,
"grad_norm": 1.2375909342165958,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.39570170640945435,
"learning_rate": 9.920264990753837e-06,
"loss": 0.7544,
"step": 631
},
{
"epoch": 0.518056009170493,
"grad_norm": 1.096691302552204,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.8150815367698669,
"learning_rate": 9.89368753053216e-06,
"loss": 0.7264,
"step": 632
},
{
"epoch": 0.5188757180457628,
"grad_norm": 0.9242020166609775,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.5993018746376038,
"learning_rate": 9.867110821325717e-06,
"loss": 0.7034,
"step": 633
},
{
"epoch": 0.5196954269210325,
"grad_norm": 1.2875091637975744,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.6435448527336121,
"learning_rate": 9.84053505087836e-06,
"loss": 0.7659,
"step": 634
},
{
"epoch": 0.5205151357963024,
"grad_norm": 1.048438518894306,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.9572287797927856,
"learning_rate": 9.813960406927318e-06,
"loss": 0.7664,
"step": 635
},
{
"epoch": 0.5213348446715721,
"grad_norm": 1.0659205610623086,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 0.2686935067176819,
"learning_rate": 9.78738707720186e-06,
"loss": 0.7183,
"step": 636
},
{
"epoch": 0.5221545535468419,
"grad_norm": 1.1248446324679613,
"latest_boundary_loss": 0.011393229477107525,
"latest_lm_loss": 0.7095032334327698,
"learning_rate": 9.760815249421973e-06,
"loss": 0.6971,
"step": 637
},
{
"epoch": 0.5229742624221116,
"grad_norm": 1.0578124703072807,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.883781909942627,
"learning_rate": 9.734245111297033e-06,
"loss": 0.721,
"step": 638
},
{
"epoch": 0.5237939712973814,
"grad_norm": 1.1806363847040355,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.3163931667804718,
"learning_rate": 9.707676850524473e-06,
"loss": 0.7367,
"step": 639
},
{
"epoch": 0.5246136801726512,
"grad_norm": 1.219757523386211,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 1.1046773195266724,
"learning_rate": 9.681110654788483e-06,
"loss": 0.7116,
"step": 640
},
{
"epoch": 0.5254333890479209,
"grad_norm": 1.1347077944745365,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.4496431350708008,
"learning_rate": 9.654546711758646e-06,
"loss": 0.691,
"step": 641
},
{
"epoch": 0.5262530979231907,
"grad_norm": 1.0012148282442592,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.3716098666191101,
"learning_rate": 9.627985209088639e-06,
"loss": 0.6929,
"step": 642
},
{
"epoch": 0.5270728067984605,
"grad_norm": 1.1425197117924417,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.8193522095680237,
"learning_rate": 9.601426334414898e-06,
"loss": 0.729,
"step": 643
},
{
"epoch": 0.5278925156737303,
"grad_norm": 1.019986159100477,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.1597791910171509,
"learning_rate": 9.574870275355295e-06,
"loss": 0.7287,
"step": 644
},
{
"epoch": 0.528712224549,
"grad_norm": 1.1604093114457519,
"latest_boundary_loss": 0.009594811126589775,
"latest_lm_loss": 1.4892265796661377,
"learning_rate": 9.548317219507815e-06,
"loss": 0.7184,
"step": 645
},
{
"epoch": 0.5295319334242697,
"grad_norm": 1.483993991819289,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.12539419531822205,
"learning_rate": 9.521767354449218e-06,
"loss": 0.734,
"step": 646
},
{
"epoch": 0.5303516422995396,
"grad_norm": 1.036929526058256,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.7307741045951843,
"learning_rate": 9.49522086773374e-06,
"loss": 0.7328,
"step": 647
},
{
"epoch": 0.5311713511748093,
"grad_norm": 1.291486321466326,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.47581589221954346,
"learning_rate": 9.468677946891735e-06,
"loss": 0.7026,
"step": 648
},
{
"epoch": 0.5319910600500791,
"grad_norm": 1.1146219843058858,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.3764333724975586,
"learning_rate": 9.442138779428376e-06,
"loss": 0.739,
"step": 649
},
{
"epoch": 0.5328107689253488,
"grad_norm": 1.6522134850308168,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.19095967710018158,
"learning_rate": 9.41560355282232e-06,
"loss": 0.7323,
"step": 650
},
{
"epoch": 0.5336304778006187,
"grad_norm": 1.0716907194756398,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.652411699295044,
"learning_rate": 9.389072454524381e-06,
"loss": 0.7191,
"step": 651
},
{
"epoch": 0.5344501866758884,
"grad_norm": 1.0169426857981612,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.1539286375045776,
"learning_rate": 9.362545671956213e-06,
"loss": 0.7333,
"step": 652
},
{
"epoch": 0.5352698955511581,
"grad_norm": 1.1912984840702656,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.14942972362041473,
"learning_rate": 9.33602339250898e-06,
"loss": 0.716,
"step": 653
},
{
"epoch": 0.536089604426428,
"grad_norm": 0.9797072624325139,
"latest_boundary_loss": 0.0116666154935956,
"latest_lm_loss": 1.0117323398590088,
"learning_rate": 9.309505803542046e-06,
"loss": 0.7197,
"step": 654
},
{
"epoch": 0.5369093133016977,
"grad_norm": 1.27841091346885,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.050676703453064,
"learning_rate": 9.282993092381626e-06,
"loss": 0.7326,
"step": 655
},
{
"epoch": 0.5377290221769675,
"grad_norm": 1.2816175226911415,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.42775171995162964,
"learning_rate": 9.256485446319482e-06,
"loss": 0.7027,
"step": 656
},
{
"epoch": 0.5385487310522372,
"grad_norm": 0.9562760093022653,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.2111191302537918,
"learning_rate": 9.229983052611598e-06,
"loss": 0.7194,
"step": 657
},
{
"epoch": 0.539368439927507,
"grad_norm": 1.0168456417745109,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.758185863494873,
"learning_rate": 9.20348609847685e-06,
"loss": 0.6871,
"step": 658
},
{
"epoch": 0.5401881488027768,
"grad_norm": 1.1045357533948532,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.3062596619129181,
"learning_rate": 9.176994771095687e-06,
"loss": 0.7324,
"step": 659
},
{
"epoch": 0.5410078576780465,
"grad_norm": 1.0983805883314763,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.8686639666557312,
"learning_rate": 9.150509257608816e-06,
"loss": 0.717,
"step": 660
},
{
"epoch": 0.5418275665533163,
"grad_norm": 1.0487305785071754,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.10697158426046371,
"learning_rate": 9.124029745115872e-06,
"loss": 0.7225,
"step": 661
},
{
"epoch": 0.542647275428586,
"grad_norm": 1.0824569577135843,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.41282209753990173,
"learning_rate": 9.097556420674089e-06,
"loss": 0.7235,
"step": 662
},
{
"epoch": 0.5434669843038559,
"grad_norm": 0.9881158317647951,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.5716696977615356,
"learning_rate": 9.071089471296996e-06,
"loss": 0.7232,
"step": 663
},
{
"epoch": 0.5442866931791256,
"grad_norm": 1.2041587692705953,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.0194302797317505,
"learning_rate": 9.044629083953082e-06,
"loss": 0.7358,
"step": 664
},
{
"epoch": 0.5451064020543954,
"grad_norm": 1.0174095332724522,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.5871102213859558,
"learning_rate": 9.018175445564485e-06,
"loss": 0.7085,
"step": 665
},
{
"epoch": 0.5459261109296651,
"grad_norm": 1.0168596416332918,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.6220500469207764,
"learning_rate": 8.991728743005664e-06,
"loss": 0.6723,
"step": 666
},
{
"epoch": 0.5467458198049349,
"grad_norm": 1.1448265754305291,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.3487257659435272,
"learning_rate": 8.96528916310208e-06,
"loss": 0.6981,
"step": 667
},
{
"epoch": 0.5475655286802047,
"grad_norm": 1.1381546334876926,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.003576934803277254,
"learning_rate": 8.938856892628881e-06,
"loss": 0.7302,
"step": 668
},
{
"epoch": 0.5483852375554744,
"grad_norm": 1.120347942391586,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 1.5112172365188599,
"learning_rate": 8.912432118309581e-06,
"loss": 0.7211,
"step": 669
},
{
"epoch": 0.5492049464307442,
"grad_norm": 0.963984133932689,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.3610379099845886,
"learning_rate": 8.886015026814736e-06,
"loss": 0.7027,
"step": 670
},
{
"epoch": 0.550024655306014,
"grad_norm": 1.1969310080956581,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.8786677122116089,
"learning_rate": 8.859605804760626e-06,
"loss": 0.7521,
"step": 671
},
{
"epoch": 0.5508443641812837,
"grad_norm": 1.0563801749178237,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.1674472689628601,
"learning_rate": 8.833204638707948e-06,
"loss": 0.6914,
"step": 672
},
{
"epoch": 0.5516640730565535,
"grad_norm": 0.9770971298549285,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.758647084236145,
"learning_rate": 8.806811715160485e-06,
"loss": 0.6888,
"step": 673
},
{
"epoch": 0.5524837819318232,
"grad_norm": 0.9295606646059391,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.25262922048568726,
"learning_rate": 8.780427220563788e-06,
"loss": 0.6976,
"step": 674
},
{
"epoch": 0.5533034908070931,
"grad_norm": 1.0806826870168234,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.48504555225372314,
"learning_rate": 8.754051341303875e-06,
"loss": 0.7079,
"step": 675
},
{
"epoch": 0.5541231996823628,
"grad_norm": 1.122764144079733,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.0578742027282715,
"learning_rate": 8.727684263705896e-06,
"loss": 0.6942,
"step": 676
},
{
"epoch": 0.5549429085576326,
"grad_norm": 0.9773122373307848,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.07475745677947998,
"learning_rate": 8.701326174032821e-06,
"loss": 0.6928,
"step": 677
},
{
"epoch": 0.5557626174329023,
"grad_norm": 1.2777236653642965,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.0010771258966997266,
"learning_rate": 8.674977258484136e-06,
"loss": 0.7171,
"step": 678
},
{
"epoch": 0.5565823263081721,
"grad_norm": 0.9436931371907279,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.5083873271942139,
"learning_rate": 8.648637703194515e-06,
"loss": 0.6888,
"step": 679
},
{
"epoch": 0.5574020351834419,
"grad_norm": 1.0637358837003335,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.5062256455421448,
"learning_rate": 8.622307694232508e-06,
"loss": 0.7053,
"step": 680
},
{
"epoch": 0.5582217440587116,
"grad_norm": 1.1849567731343693,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.006737938616424799,
"learning_rate": 8.595987417599225e-06,
"loss": 0.7162,
"step": 681
},
{
"epoch": 0.5590414529339814,
"grad_norm": 1.004596122413389,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.0521949529647827,
"learning_rate": 8.569677059227033e-06,
"loss": 0.7004,
"step": 682
},
{
"epoch": 0.5598611618092512,
"grad_norm": 1.1290098203224677,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.6594796180725098,
"learning_rate": 8.543376804978223e-06,
"loss": 0.6797,
"step": 683
},
{
"epoch": 0.560680870684521,
"grad_norm": 0.929255384458776,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 2.161489963531494,
"learning_rate": 8.517086840643722e-06,
"loss": 0.7166,
"step": 684
},
{
"epoch": 0.5615005795597907,
"grad_norm": 1.1293721513691184,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.2538692355155945,
"learning_rate": 8.490807351941753e-06,
"loss": 0.7503,
"step": 685
},
{
"epoch": 0.5623202884350604,
"grad_norm": 1.0592932191803128,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 1.0668712854385376,
"learning_rate": 8.464538524516546e-06,
"loss": 0.7501,
"step": 686
},
{
"epoch": 0.5631399973103303,
"grad_norm": 1.0993364695474808,
"latest_boundary_loss": 0.008892906829714775,
"latest_lm_loss": 0.9446035623550415,
"learning_rate": 8.438280543937012e-06,
"loss": 0.7143,
"step": 687
},
{
"epoch": 0.5639597061856,
"grad_norm": 1.1829425988049713,
"latest_boundary_loss": 0.0098554827272892,
"latest_lm_loss": 0.15057814121246338,
"learning_rate": 8.412033595695436e-06,
"loss": 0.7026,
"step": 688
},
{
"epoch": 0.5647794150608698,
"grad_norm": 1.0224316632174533,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.05434364452958107,
"learning_rate": 8.385797865206178e-06,
"loss": 0.7269,
"step": 689
},
{
"epoch": 0.5655991239361395,
"grad_norm": 0.9314195854876334,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.9874452948570251,
"learning_rate": 8.359573537804347e-06,
"loss": 0.6928,
"step": 690
},
{
"epoch": 0.5664188328114094,
"grad_norm": 0.9786572196977079,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.6253742575645447,
"learning_rate": 8.333360798744496e-06,
"loss": 0.6971,
"step": 691
},
{
"epoch": 0.5672385416866791,
"grad_norm": 0.9234982658752885,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.8906906247138977,
"learning_rate": 8.307159833199317e-06,
"loss": 0.7238,
"step": 692
},
{
"epoch": 0.5680582505619488,
"grad_norm": 1.0401153607882172,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.8983895778656006,
"learning_rate": 8.28097082625833e-06,
"loss": 0.7262,
"step": 693
},
{
"epoch": 0.5688779594372186,
"grad_norm": 1.0168833635090133,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.5647414922714233,
"learning_rate": 8.254793962926579e-06,
"loss": 0.7088,
"step": 694
},
{
"epoch": 0.5696976683124884,
"grad_norm": 1.010860365594221,
"latest_boundary_loss": 0.00950749684125185,
"latest_lm_loss": 0.29505330324172974,
"learning_rate": 8.228629428123319e-06,
"loss": 0.7467,
"step": 695
},
{
"epoch": 0.5705173771877582,
"grad_norm": 1.297269460623968,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.4030215740203857,
"learning_rate": 8.202477406680725e-06,
"loss": 0.7027,
"step": 696
},
{
"epoch": 0.5713370860630279,
"grad_norm": 1.0523990935513807,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.48803091049194336,
"learning_rate": 8.17633808334256e-06,
"loss": 0.7217,
"step": 697
},
{
"epoch": 0.5721567949382977,
"grad_norm": 0.9699511942059086,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.06064368784427643,
"learning_rate": 8.150211642762895e-06,
"loss": 0.6941,
"step": 698
},
{
"epoch": 0.5729765038135675,
"grad_norm": 1.0664465478188756,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.089992642402649,
"learning_rate": 8.124098269504786e-06,
"loss": 0.7058,
"step": 699
},
{
"epoch": 0.5737962126888372,
"grad_norm": 1.090019343414517,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.26992881298065186,
"learning_rate": 8.097998148038986e-06,
"loss": 0.7102,
"step": 700
},
{
"epoch": 0.574615921564107,
"grad_norm": 1.0837025854165607,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.23298679292201996,
"learning_rate": 8.07191146274263e-06,
"loss": 0.6971,
"step": 701
},
{
"epoch": 0.5754356304393767,
"grad_norm": 1.1828882996025294,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.1900869607925415,
"learning_rate": 8.045838397897932e-06,
"loss": 0.7603,
"step": 702
},
{
"epoch": 0.5762553393146466,
"grad_norm": 1.0648146845978368,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.1167309284210205,
"learning_rate": 8.019779137690906e-06,
"loss": 0.7167,
"step": 703
},
{
"epoch": 0.5770750481899163,
"grad_norm": 0.9060772238092258,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.37196096777915955,
"learning_rate": 7.993733866210029e-06,
"loss": 0.7052,
"step": 704
},
{
"epoch": 0.5778947570651861,
"grad_norm": 1.0038910963883285,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.0469224452972412,
"learning_rate": 7.967702767444963e-06,
"loss": 0.7201,
"step": 705
},
{
"epoch": 0.5787144659404558,
"grad_norm": 1.1439741859893668,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.0404729843139648,
"learning_rate": 7.941686025285257e-06,
"loss": 0.7356,
"step": 706
},
{
"epoch": 0.5795341748157256,
"grad_norm": 0.9774561619983333,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 0.9486600160598755,
"learning_rate": 7.915683823519031e-06,
"loss": 0.7014,
"step": 707
},
{
"epoch": 0.5803538836909954,
"grad_norm": 1.1563971400713233,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 1.2141032218933105,
"learning_rate": 7.889696345831696e-06,
"loss": 0.7355,
"step": 708
},
{
"epoch": 0.5811735925662651,
"grad_norm": 1.0027386231768032,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.5893023014068604,
"learning_rate": 7.863723775804651e-06,
"loss": 0.7514,
"step": 709
},
{
"epoch": 0.5819933014415349,
"grad_norm": 1.0438296346077005,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.1433781087398529,
"learning_rate": 7.83776629691398e-06,
"loss": 0.7413,
"step": 710
},
{
"epoch": 0.5828130103168047,
"grad_norm": 1.0569019617674453,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.3599586486816406,
"learning_rate": 7.811824092529155e-06,
"loss": 0.7187,
"step": 711
},
{
"epoch": 0.5836327191920745,
"grad_norm": 1.2307496300122094,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.7800025939941406,
"learning_rate": 7.785897345911755e-06,
"loss": 0.7233,
"step": 712
},
{
"epoch": 0.5844524280673442,
"grad_norm": 1.032162961821882,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.8138336539268494,
"learning_rate": 7.759986240214155e-06,
"loss": 0.7077,
"step": 713
},
{
"epoch": 0.5852721369426139,
"grad_norm": 0.9998089389958766,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.3916796147823334,
"learning_rate": 7.734090958478241e-06,
"loss": 0.7551,
"step": 714
},
{
"epoch": 0.5860918458178838,
"grad_norm": 0.9717991966202033,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.3931790590286255,
"learning_rate": 7.708211683634112e-06,
"loss": 0.6926,
"step": 715
},
{
"epoch": 0.5869115546931535,
"grad_norm": 0.9138311813007235,
"latest_boundary_loss": 0.010595110245049,
"latest_lm_loss": 0.721996545791626,
"learning_rate": 7.6823485984988e-06,
"loss": 0.6819,
"step": 716
},
{
"epoch": 0.5877312635684233,
"grad_norm": 0.9545376926621199,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.988181471824646,
"learning_rate": 7.656501885774963e-06,
"loss": 0.7173,
"step": 717
},
{
"epoch": 0.588550972443693,
"grad_norm": 1.011919554024611,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.2733086347579956,
"learning_rate": 7.6306717280496e-06,
"loss": 0.7121,
"step": 718
},
{
"epoch": 0.5893706813189629,
"grad_norm": 0.9800324686806557,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 1.5348021984100342,
"learning_rate": 7.604858307792759e-06,
"loss": 0.6914,
"step": 719
},
{
"epoch": 0.5901903901942326,
"grad_norm": 0.9426442266619424,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.5834733247756958,
"learning_rate": 7.579061807356256e-06,
"loss": 0.6731,
"step": 720
},
{
"epoch": 0.5910100990695023,
"grad_norm": 0.9513618850429701,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.0011859288206323981,
"learning_rate": 7.553282408972382e-06,
"loss": 0.7153,
"step": 721
},
{
"epoch": 0.5918298079447721,
"grad_norm": 1.1870337882943776,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.412514567375183,
"learning_rate": 7.527520294752607e-06,
"loss": 0.7543,
"step": 722
},
{
"epoch": 0.5926495168200419,
"grad_norm": 1.0551940500521517,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.13889846205711365,
"learning_rate": 7.501775646686316e-06,
"loss": 0.7333,
"step": 723
},
{
"epoch": 0.5934692256953117,
"grad_norm": 1.0210313334853152,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.4544445872306824,
"learning_rate": 7.476048646639498e-06,
"loss": 0.7137,
"step": 724
},
{
"epoch": 0.5942889345705814,
"grad_norm": 0.9895796527273951,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.0005383042152971029,
"learning_rate": 7.450339476353475e-06,
"loss": 0.7155,
"step": 725
},
{
"epoch": 0.5951086434458512,
"grad_norm": 0.908321719879891,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.9301624894142151,
"learning_rate": 7.424648317443616e-06,
"loss": 0.6975,
"step": 726
},
{
"epoch": 0.595928352321121,
"grad_norm": 1.0427604517832747,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.8960895538330078,
"learning_rate": 7.398975351398054e-06,
"loss": 0.6717,
"step": 727
},
{
"epoch": 0.5967480611963907,
"grad_norm": 0.9103065754412873,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 1.0669386386871338,
"learning_rate": 7.3733207595764015e-06,
"loss": 0.678,
"step": 728
},
{
"epoch": 0.5975677700716605,
"grad_norm": 0.858223319516681,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 1.8137937784194946,
"learning_rate": 7.347684723208471e-06,
"loss": 0.6966,
"step": 729
},
{
"epoch": 0.5983874789469302,
"grad_norm": 1.1417557710739104,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.646855354309082,
"learning_rate": 7.322067423393002e-06,
"loss": 0.7068,
"step": 730
},
{
"epoch": 0.5992071878222001,
"grad_norm": 1.0399418384166026,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.36594298481941223,
"learning_rate": 7.2964690410963705e-06,
"loss": 0.7196,
"step": 731
},
{
"epoch": 0.6000268966974698,
"grad_norm": 1.100599718739737,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.636888861656189,
"learning_rate": 7.2708897571513116e-06,
"loss": 0.7042,
"step": 732
},
{
"epoch": 0.6008466055727396,
"grad_norm": 1.0597441344693008,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.339764267206192,
"learning_rate": 7.2453297522556475e-06,
"loss": 0.7335,
"step": 733
},
{
"epoch": 0.6016663144480093,
"grad_norm": 1.1333714411697555,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.8782387375831604,
"learning_rate": 7.2197892069710105e-06,
"loss": 0.7483,
"step": 734
},
{
"epoch": 0.602486023323279,
"grad_norm": 1.0403253194282391,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.0014681315515190363,
"learning_rate": 7.194268301721563e-06,
"loss": 0.7069,
"step": 735
},
{
"epoch": 0.6033057321985489,
"grad_norm": 1.1330466422231746,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.39263322949409485,
"learning_rate": 7.168767216792725e-06,
"loss": 0.6936,
"step": 736
},
{
"epoch": 0.6041254410738186,
"grad_norm": 0.9982790123001637,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.6533898115158081,
"learning_rate": 7.143286132329912e-06,
"loss": 0.7007,
"step": 737
},
{
"epoch": 0.6049451499490884,
"grad_norm": 1.0147745964752675,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.11286523193120956,
"learning_rate": 7.117825228337236e-06,
"loss": 0.7109,
"step": 738
},
{
"epoch": 0.6057648588243582,
"grad_norm": 1.027879798611688,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.6202219724655151,
"learning_rate": 7.092384684676263e-06,
"loss": 0.6944,
"step": 739
},
{
"epoch": 0.6065845676996279,
"grad_norm": 1.0220198583510278,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.7309264540672302,
"learning_rate": 7.066964681064716e-06,
"loss": 0.7627,
"step": 740
},
{
"epoch": 0.6074042765748977,
"grad_norm": 0.995070436220007,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.9904163479804993,
"learning_rate": 7.041565397075232e-06,
"loss": 0.7016,
"step": 741
},
{
"epoch": 0.6082239854501674,
"grad_norm": 1.0462281712285442,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.684150755405426,
"learning_rate": 7.016187012134069e-06,
"loss": 0.6559,
"step": 742
},
{
"epoch": 0.6090436943254373,
"grad_norm": 0.9719132367678389,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.336769700050354,
"learning_rate": 6.990829705519853e-06,
"loss": 0.7086,
"step": 743
},
{
"epoch": 0.609863403200707,
"grad_norm": 1.1516137776228703,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.5988958477973938,
"learning_rate": 6.965493656362314e-06,
"loss": 0.7196,
"step": 744
},
{
"epoch": 0.6106831120759768,
"grad_norm": 0.9685654606839458,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.9086645841598511,
"learning_rate": 6.940179043641005e-06,
"loss": 0.6602,
"step": 745
},
{
"epoch": 0.6115028209512465,
"grad_norm": 1.0417703319044727,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.0342119932174683,
"learning_rate": 6.914886046184055e-06,
"loss": 0.6792,
"step": 746
},
{
"epoch": 0.6123225298265162,
"grad_norm": 1.2757184092294236,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.06405255198478699,
"learning_rate": 6.889614842666892e-06,
"loss": 0.6759,
"step": 747
},
{
"epoch": 0.6131422387017861,
"grad_norm": 0.9870163010061376,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.5797122716903687,
"learning_rate": 6.86436561161099e-06,
"loss": 0.681,
"step": 748
},
{
"epoch": 0.6139619475770558,
"grad_norm": 0.9950408829914631,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.23887087404727936,
"learning_rate": 6.8391385313826035e-06,
"loss": 0.6819,
"step": 749
},
{
"epoch": 0.6147816564523256,
"grad_norm": 0.9863024335321804,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.8106602430343628,
"learning_rate": 6.813933780191504e-06,
"loss": 0.6826,
"step": 750
},
{
"epoch": 0.6156013653275954,
"grad_norm": 1.0505699466510683,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.3282902240753174,
"learning_rate": 6.788751536089739e-06,
"loss": 0.6966,
"step": 751
},
{
"epoch": 0.6164210742028652,
"grad_norm": 1.206619041745734,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.0014905950520187616,
"learning_rate": 6.763591976970347e-06,
"loss": 0.6944,
"step": 752
},
{
"epoch": 0.6172407830781349,
"grad_norm": 1.2549377685802665,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 2.319436550140381,
"learning_rate": 6.738455280566124e-06,
"loss": 0.6769,
"step": 753
},
{
"epoch": 0.6180604919534046,
"grad_norm": 0.9327746106525235,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.2720215320587158,
"learning_rate": 6.713341624448351e-06,
"loss": 0.7083,
"step": 754
},
{
"epoch": 0.6188802008286745,
"grad_norm": 1.0196798883725415,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.0331902503967285,
"learning_rate": 6.6882511860255505e-06,
"loss": 0.706,
"step": 755
},
{
"epoch": 0.6196999097039442,
"grad_norm": 1.2758874093450798,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.137378454208374,
"learning_rate": 6.663184142542233e-06,
"loss": 0.7327,
"step": 756
},
{
"epoch": 0.620519618579214,
"grad_norm": 0.9623443271792325,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.00035643347655422986,
"learning_rate": 6.638140671077633e-06,
"loss": 0.745,
"step": 757
},
{
"epoch": 0.6213393274544837,
"grad_norm": 1.1010299021596208,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.22510242462158203,
"learning_rate": 6.613120948544482e-06,
"loss": 0.6892,
"step": 758
},
{
"epoch": 0.6221590363297536,
"grad_norm": 1.1879723867442862,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 1.7979674339294434,
"learning_rate": 6.58812515168773e-06,
"loss": 0.7305,
"step": 759
},
{
"epoch": 0.6229787452050233,
"grad_norm": 1.152628417343709,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.07966076582670212,
"learning_rate": 6.563153457083315e-06,
"loss": 0.6811,
"step": 760
},
{
"epoch": 0.623798454080293,
"grad_norm": 1.0279289637006672,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.15796378254890442,
"learning_rate": 6.538206041136915e-06,
"loss": 0.6416,
"step": 761
},
{
"epoch": 0.6246181629555628,
"grad_norm": 0.861566264413089,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.7871353030204773,
"learning_rate": 6.513283080082692e-06,
"loss": 0.7014,
"step": 762
},
{
"epoch": 0.6254378718308325,
"grad_norm": 1.1408042828440967,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.8846269249916077,
"learning_rate": 6.488384749982054e-06,
"loss": 0.7151,
"step": 763
},
{
"epoch": 0.6262575807061024,
"grad_norm": 1.0238991997530897,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.27181968092918396,
"learning_rate": 6.463511226722416e-06,
"loss": 0.7488,
"step": 764
},
{
"epoch": 0.6270772895813721,
"grad_norm": 1.1223442145304743,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.2094594240188599,
"learning_rate": 6.438662686015947e-06,
"loss": 0.7338,
"step": 765
},
{
"epoch": 0.6278969984566419,
"grad_norm": 1.3461454909946964,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.8707993030548096,
"learning_rate": 6.413839303398337e-06,
"loss": 0.6769,
"step": 766
},
{
"epoch": 0.6287167073319117,
"grad_norm": 0.9114819592934308,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.27082979679107666,
"learning_rate": 6.389041254227548e-06,
"loss": 0.6853,
"step": 767
},
{
"epoch": 0.6295364162071814,
"grad_norm": 1.1636986726017515,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 1.2897359132766724,
"learning_rate": 6.364268713682586e-06,
"loss": 0.7573,
"step": 768
},
{
"epoch": 0.6303561250824512,
"grad_norm": 1.1077154481827316,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.9593300223350525,
"learning_rate": 6.339521856762254e-06,
"loss": 0.7336,
"step": 769
},
{
"epoch": 0.6311758339577209,
"grad_norm": 0.9316629955602134,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.0005913557251915336,
"learning_rate": 6.3148008582839284e-06,
"loss": 0.6661,
"step": 770
},
{
"epoch": 0.6319955428329908,
"grad_norm": 1.0938685504974952,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 1.1068240404129028,
"learning_rate": 6.290105892882303e-06,
"loss": 0.7122,
"step": 771
},
{
"epoch": 0.6328152517082605,
"grad_norm": 1.0335169883447488,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.3981740474700928,
"learning_rate": 6.265437135008181e-06,
"loss": 0.7315,
"step": 772
},
{
"epoch": 0.6336349605835303,
"grad_norm": 1.0065761523313361,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.002072848379611969,
"learning_rate": 6.240794758927222e-06,
"loss": 0.7239,
"step": 773
},
{
"epoch": 0.6344546694588,
"grad_norm": 0.9853651641848895,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.3314749598503113,
"learning_rate": 6.21617893871872e-06,
"loss": 0.6915,
"step": 774
},
{
"epoch": 0.6352743783340697,
"grad_norm": 0.9911812439359369,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.2504614591598511,
"learning_rate": 6.191589848274369e-06,
"loss": 0.6749,
"step": 775
},
{
"epoch": 0.6360940872093396,
"grad_norm": 0.9621284428121739,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.4438011050224304,
"learning_rate": 6.167027661297049e-06,
"loss": 0.6793,
"step": 776
},
{
"epoch": 0.6369137960846093,
"grad_norm": 0.9288287369334539,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.11139020323753357,
"learning_rate": 6.142492551299577e-06,
"loss": 0.7098,
"step": 777
},
{
"epoch": 0.6377335049598791,
"grad_norm": 0.8978047261244385,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.002336784265935421,
"learning_rate": 6.117984691603493e-06,
"loss": 0.6913,
"step": 778
},
{
"epoch": 0.6385532138351488,
"grad_norm": 1.0659236483624612,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.9679294228553772,
"learning_rate": 6.093504255337844e-06,
"loss": 0.7031,
"step": 779
},
{
"epoch": 0.6393729227104187,
"grad_norm": 1.0429042634997683,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.005642371717840433,
"learning_rate": 6.069051415437941e-06,
"loss": 0.6972,
"step": 780
},
{
"epoch": 0.6401926315856884,
"grad_norm": 0.9251865588777979,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.0008097427780739963,
"learning_rate": 6.044626344644151e-06,
"loss": 0.684,
"step": 781
},
{
"epoch": 0.6410123404609581,
"grad_norm": 1.025406119326292,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.17828942835330963,
"learning_rate": 6.020229215500677e-06,
"loss": 0.7155,
"step": 782
},
{
"epoch": 0.641832049336228,
"grad_norm": 1.07302989085031,
"latest_boundary_loss": 0.0112152099609375,
"latest_lm_loss": 0.8376822471618652,
"learning_rate": 5.995860200354335e-06,
"loss": 0.6759,
"step": 783
},
{
"epoch": 0.6426517582114977,
"grad_norm": 1.0997376451705585,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.223407506942749,
"learning_rate": 5.971519471353335e-06,
"loss": 0.7276,
"step": 784
},
{
"epoch": 0.6434714670867675,
"grad_norm": 1.3840180076019357,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.0012067434145137668,
"learning_rate": 5.9472072004460665e-06,
"loss": 0.7298,
"step": 785
},
{
"epoch": 0.6442911759620372,
"grad_norm": 1.159687035784195,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.0005477725062519312,
"learning_rate": 5.922923559379892e-06,
"loss": 0.6838,
"step": 786
},
{
"epoch": 0.645110884837307,
"grad_norm": 1.2062795930656114,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.0014804333914071321,
"learning_rate": 5.898668719699914e-06,
"loss": 0.7254,
"step": 787
},
{
"epoch": 0.6459305937125768,
"grad_norm": 1.0641490944417835,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 1.015197515487671,
"learning_rate": 5.874442852747788e-06,
"loss": 0.7085,
"step": 788
},
{
"epoch": 0.6467503025878465,
"grad_norm": 1.1965522575368512,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.4765951931476593,
"learning_rate": 5.850246129660494e-06,
"loss": 0.7129,
"step": 789
},
{
"epoch": 0.6475700114631163,
"grad_norm": 0.8794989065799094,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.22478081285953522,
"learning_rate": 5.82607872136913e-06,
"loss": 0.6787,
"step": 790
},
{
"epoch": 0.648389720338386,
"grad_norm": 1.0388251385975193,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 1.0969759225845337,
"learning_rate": 5.801940798597716e-06,
"loss": 0.6942,
"step": 791
},
{
"epoch": 0.6492094292136559,
"grad_norm": 1.0934328677471838,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.6132924556732178,
"learning_rate": 5.7778325318619665e-06,
"loss": 0.7305,
"step": 792
},
{
"epoch": 0.6500291380889256,
"grad_norm": 1.080649239654547,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 1.215937852859497,
"learning_rate": 5.753754091468116e-06,
"loss": 0.7101,
"step": 793
},
{
"epoch": 0.6508488469641954,
"grad_norm": 0.9175623322393451,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 1.305875301361084,
"learning_rate": 5.729705647511688e-06,
"loss": 0.6812,
"step": 794
},
{
"epoch": 0.6516685558394651,
"grad_norm": 0.9874086060895069,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.6243735551834106,
"learning_rate": 5.7056873698763035e-06,
"loss": 0.6495,
"step": 795
},
{
"epoch": 0.6524882647147349,
"grad_norm": 0.9202236004181785,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.21508236229419708,
"learning_rate": 5.681699428232488e-06,
"loss": 0.7015,
"step": 796
},
{
"epoch": 0.6533079735900047,
"grad_norm": 1.0662772408712355,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.26606371998786926,
"learning_rate": 5.657741992036463e-06,
"loss": 0.6942,
"step": 797
},
{
"epoch": 0.6541276824652744,
"grad_norm": 1.0762171889327197,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 1.0139234066009521,
"learning_rate": 5.633815230528954e-06,
"loss": 0.6634,
"step": 798
},
{
"epoch": 0.6549473913405442,
"grad_norm": 0.9301324525186185,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.267943799495697,
"learning_rate": 5.609919312733987e-06,
"loss": 0.6837,
"step": 799
},
{
"epoch": 0.655767100215814,
"grad_norm": 1.1052024267410168,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.45707234740257263,
"learning_rate": 5.586054407457717e-06,
"loss": 0.751,
"step": 800
},
{
"epoch": 0.6565868090910837,
"grad_norm": 1.0971169221373818,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.1730159521102905,
"learning_rate": 5.562220683287205e-06,
"loss": 0.73,
"step": 801
},
{
"epoch": 0.6574065179663535,
"grad_norm": 1.1236607533214953,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.030493974685669,
"learning_rate": 5.538418308589246e-06,
"loss": 0.7061,
"step": 802
},
{
"epoch": 0.6582262268416232,
"grad_norm": 1.1203165598308498,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.8180105090141296,
"learning_rate": 5.514647451509175e-06,
"loss": 0.7238,
"step": 803
},
{
"epoch": 0.6590459357168931,
"grad_norm": 0.8961935290600478,
"latest_boundary_loss": 0.009173923172056675,
"latest_lm_loss": 0.46520930528640747,
"learning_rate": 5.490908279969682e-06,
"loss": 0.6864,
"step": 804
},
{
"epoch": 0.6598656445921628,
"grad_norm": 1.133867797968168,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.6524696350097656,
"learning_rate": 5.467200961669619e-06,
"loss": 0.6721,
"step": 805
},
{
"epoch": 0.6606853534674326,
"grad_norm": 1.2065823134543583,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.9073443412780762,
"learning_rate": 5.443525664082818e-06,
"loss": 0.6804,
"step": 806
},
{
"epoch": 0.6615050623427023,
"grad_norm": 1.315266430569396,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.07658699154853821,
"learning_rate": 5.419882554456923e-06,
"loss": 0.6758,
"step": 807
},
{
"epoch": 0.6623247712179721,
"grad_norm": 1.142057250307418,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.9889833927154541,
"learning_rate": 5.39627179981218e-06,
"loss": 0.687,
"step": 808
},
{
"epoch": 0.6631444800932419,
"grad_norm": 0.9652432075655373,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.05204503610730171,
"learning_rate": 5.372693566940277e-06,
"loss": 0.7592,
"step": 809
},
{
"epoch": 0.6639641889685116,
"grad_norm": 1.1911062505658812,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.0005308053223416209,
"learning_rate": 5.349148022403162e-06,
"loss": 0.6587,
"step": 810
},
{
"epoch": 0.6647838978437814,
"grad_norm": 1.0441398423949482,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.6223710775375366,
"learning_rate": 5.325635332531864e-06,
"loss": 0.7027,
"step": 811
},
{
"epoch": 0.6656036067190512,
"grad_norm": 1.03817167677331,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.960883617401123,
"learning_rate": 5.302155663425319e-06,
"loss": 0.7157,
"step": 812
},
{
"epoch": 0.666423315594321,
"grad_norm": 1.084644257209891,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.0298640727996826,
"learning_rate": 5.278709180949195e-06,
"loss": 0.7125,
"step": 813
},
{
"epoch": 0.6672430244695907,
"grad_norm": 1.0891098751318016,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.9329481720924377,
"learning_rate": 5.255296050734733e-06,
"loss": 0.6778,
"step": 814
},
{
"epoch": 0.6680627333448604,
"grad_norm": 1.2502028508458847,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.3610039949417114,
"learning_rate": 5.231916438177552e-06,
"loss": 0.6616,
"step": 815
},
{
"epoch": 0.6688824422201303,
"grad_norm": 0.925724907408967,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.214050531387329,
"learning_rate": 5.208570508436501e-06,
"loss": 0.7153,
"step": 816
},
{
"epoch": 0.6697021510954,
"grad_norm": 0.9664206190275095,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.0005578378331847489,
"learning_rate": 5.1852584264324864e-06,
"loss": 0.6563,
"step": 817
},
{
"epoch": 0.6705218599706698,
"grad_norm": 0.9586595687477473,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.6733792424201965,
"learning_rate": 5.161980356847307e-06,
"loss": 0.6926,
"step": 818
},
{
"epoch": 0.6713415688459395,
"grad_norm": 0.9255498289661501,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.12955781817436218,
"learning_rate": 5.138736464122485e-06,
"loss": 0.6804,
"step": 819
},
{
"epoch": 0.6721612777212094,
"grad_norm": 0.9487906004164839,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 3.455559730529785,
"learning_rate": 5.115526912458113e-06,
"loss": 0.7025,
"step": 820
},
{
"epoch": 0.6729809865964791,
"grad_norm": 1.3078930916314684,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.3165035545825958,
"learning_rate": 5.092351865811698e-06,
"loss": 0.713,
"step": 821
},
{
"epoch": 0.6738006954717488,
"grad_norm": 1.2207341591946816,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.9034299850463867,
"learning_rate": 5.0692114878969845e-06,
"loss": 0.6991,
"step": 822
},
{
"epoch": 0.6746204043470186,
"grad_norm": 1.0055943176947524,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 1.3586221933364868,
"learning_rate": 5.046105942182815e-06,
"loss": 0.7097,
"step": 823
},
{
"epoch": 0.6754401132222884,
"grad_norm": 1.134757083387565,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.008022138848900795,
"learning_rate": 5.023035391891966e-06,
"loss": 0.7394,
"step": 824
},
{
"epoch": 0.6762598220975582,
"grad_norm": 0.8879732520006872,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 1.173811435699463,
"learning_rate": 5.000000000000003e-06,
"loss": 0.6943,
"step": 825
},
{
"epoch": 0.6770795309728279,
"grad_norm": 0.8574977914426216,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.5076913833618164,
"learning_rate": 4.97699992923412e-06,
"loss": 0.6979,
"step": 826
},
{
"epoch": 0.6778992398480977,
"grad_norm": 1.1037086397521318,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.9463548064231873,
"learning_rate": 4.954035342071994e-06,
"loss": 0.7248,
"step": 827
},
{
"epoch": 0.6787189487233675,
"grad_norm": 1.0073652316446564,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.014983057975769,
"learning_rate": 4.9311064007406494e-06,
"loss": 0.7265,
"step": 828
},
{
"epoch": 0.6795386575986372,
"grad_norm": 0.8631585749939532,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.07589959353208542,
"learning_rate": 4.908213267215287e-06,
"loss": 0.6815,
"step": 829
},
{
"epoch": 0.680358366473907,
"grad_norm": 0.8606209461703438,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.0183286666870117,
"learning_rate": 4.885356103218159e-06,
"loss": 0.6839,
"step": 830
},
{
"epoch": 0.6811780753491767,
"grad_norm": 1.25130555585431,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.23989424109458923,
"learning_rate": 4.862535070217416e-06,
"loss": 0.6987,
"step": 831
},
{
"epoch": 0.6819977842244466,
"grad_norm": 0.9930050218945115,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.8324053883552551,
"learning_rate": 4.839750329425979e-06,
"loss": 0.7158,
"step": 832
},
{
"epoch": 0.6828174930997163,
"grad_norm": 0.9472508769146017,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.528387725353241,
"learning_rate": 4.8170020418003884e-06,
"loss": 0.7259,
"step": 833
},
{
"epoch": 0.6836372019749861,
"grad_norm": 1.16858853336407,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.13132038712501526,
"learning_rate": 4.794290368039664e-06,
"loss": 0.7111,
"step": 834
},
{
"epoch": 0.6844569108502558,
"grad_norm": 1.1692990328517108,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.9375249147415161,
"learning_rate": 4.771615468584194e-06,
"loss": 0.6988,
"step": 835
},
{
"epoch": 0.6852766197255256,
"grad_norm": 1.1710441744717957,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.7154141664505005,
"learning_rate": 4.7489775036145715e-06,
"loss": 0.7116,
"step": 836
},
{
"epoch": 0.6860963286007954,
"grad_norm": 1.0607837634015245,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.00030830566538497806,
"learning_rate": 4.726376633050479e-06,
"loss": 0.7065,
"step": 837
},
{
"epoch": 0.6869160374760651,
"grad_norm": 1.434628115103455,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.31428781151771545,
"learning_rate": 4.703813016549555e-06,
"loss": 0.7043,
"step": 838
},
{
"epoch": 0.6877357463513349,
"grad_norm": 0.8892840982985057,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.6786776185035706,
"learning_rate": 4.681286813506271e-06,
"loss": 0.6908,
"step": 839
},
{
"epoch": 0.6885554552266047,
"grad_norm": 1.0688810765695658,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 0.5102680921554565,
"learning_rate": 4.658798183050796e-06,
"loss": 0.7242,
"step": 840
},
{
"epoch": 0.6893751641018745,
"grad_norm": 1.1689099085155596,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.0223958492279053,
"learning_rate": 4.636347284047878e-06,
"loss": 0.7174,
"step": 841
},
{
"epoch": 0.6901948729771442,
"grad_norm": 1.0589934053755845,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 0.718203067779541,
"learning_rate": 4.613934275095729e-06,
"loss": 0.6847,
"step": 842
},
{
"epoch": 0.6910145818524139,
"grad_norm": 1.1487810029443168,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.20583559572696686,
"learning_rate": 4.5915593145248926e-06,
"loss": 0.7045,
"step": 843
},
{
"epoch": 0.6918342907276838,
"grad_norm": 1.1842105020554863,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.5710063576698303,
"learning_rate": 4.569222560397126e-06,
"loss": 0.7044,
"step": 844
},
{
"epoch": 0.6926539996029535,
"grad_norm": 1.2730861654711523,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.17701531946659088,
"learning_rate": 4.546924170504292e-06,
"loss": 0.7031,
"step": 845
},
{
"epoch": 0.6934737084782233,
"grad_norm": 1.0862823878497603,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.005029784981161356,
"learning_rate": 4.524664302367239e-06,
"loss": 0.6877,
"step": 846
},
{
"epoch": 0.694293417353493,
"grad_norm": 0.9459479170002364,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.0004008638788945973,
"learning_rate": 4.502443113234688e-06,
"loss": 0.6989,
"step": 847
},
{
"epoch": 0.6951131262287629,
"grad_norm": 1.1465757945823667,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.283829927444458,
"learning_rate": 4.48026076008212e-06,
"loss": 0.6695,
"step": 848
},
{
"epoch": 0.6959328351040326,
"grad_norm": 1.0053718273105061,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.32908621430397034,
"learning_rate": 4.458117399610682e-06,
"loss": 0.6779,
"step": 849
},
{
"epoch": 0.6967525439793023,
"grad_norm": 0.9501225628003003,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.1048474311828613,
"learning_rate": 4.436013188246056e-06,
"loss": 0.6802,
"step": 850
},
{
"epoch": 0.6975722528545721,
"grad_norm": 1.272585533213532,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.8869845271110535,
"learning_rate": 4.4139482821373665e-06,
"loss": 0.7087,
"step": 851
},
{
"epoch": 0.6983919617298419,
"grad_norm": 1.298634500727238,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.2856828570365906,
"learning_rate": 4.391922837156082e-06,
"loss": 0.7037,
"step": 852
},
{
"epoch": 0.6992116706051117,
"grad_norm": 1.272153989512535,
"latest_boundary_loss": 0.010217878967523575,
"latest_lm_loss": 0.8536891937255859,
"learning_rate": 4.369937008894906e-06,
"loss": 0.7232,
"step": 853
},
{
"epoch": 0.7000313794803814,
"grad_norm": 1.1923084822356993,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.9743465185165405,
"learning_rate": 4.3479909526666775e-06,
"loss": 0.7082,
"step": 854
},
{
"epoch": 0.7008510883556512,
"grad_norm": 0.9289329434272517,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.16440057754516602,
"learning_rate": 4.326084823503287e-06,
"loss": 0.6622,
"step": 855
},
{
"epoch": 0.701670797230921,
"grad_norm": 1.051106179946181,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.841198205947876,
"learning_rate": 4.30421877615456e-06,
"loss": 0.7039,
"step": 856
},
{
"epoch": 0.7024905061061907,
"grad_norm": 0.8948391645013014,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.655964732170105,
"learning_rate": 4.282392965087182e-06,
"loss": 0.6917,
"step": 857
},
{
"epoch": 0.7033102149814605,
"grad_norm": 1.0097597555275502,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.32513657212257385,
"learning_rate": 4.260607544483596e-06,
"loss": 0.7092,
"step": 858
},
{
"epoch": 0.7041299238567302,
"grad_norm": 1.3704230014179217,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.10507223010063171,
"learning_rate": 4.23886266824092e-06,
"loss": 0.7203,
"step": 859
},
{
"epoch": 0.7049496327320001,
"grad_norm": 0.9877438539088613,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.19252876937389374,
"learning_rate": 4.217158489969857e-06,
"loss": 0.6967,
"step": 860
},
{
"epoch": 0.7057693416072698,
"grad_norm": 1.0634413405385343,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 1.4538038969039917,
"learning_rate": 4.195495162993607e-06,
"loss": 0.7492,
"step": 861
},
{
"epoch": 0.7065890504825396,
"grad_norm": 0.9647198580031782,
"latest_boundary_loss": 0.009594811126589775,
"latest_lm_loss": 0.9643508791923523,
"learning_rate": 4.173872840346798e-06,
"loss": 0.7123,
"step": 862
},
{
"epoch": 0.7074087593578093,
"grad_norm": 1.0711996559798689,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.10980099439620972,
"learning_rate": 4.152291674774384e-06,
"loss": 0.7193,
"step": 863
},
{
"epoch": 0.7082284682330791,
"grad_norm": 0.972251788670185,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 1.2302558422088623,
"learning_rate": 4.130751818730578e-06,
"loss": 0.7142,
"step": 864
},
{
"epoch": 0.7090481771083489,
"grad_norm": 0.9459005865793516,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.1377440243959427,
"learning_rate": 4.109253424377773e-06,
"loss": 0.7162,
"step": 865
},
{
"epoch": 0.7098678859836186,
"grad_norm": 1.088563431821855,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.11354351788759232,
"learning_rate": 4.08779664358547e-06,
"loss": 0.6988,
"step": 866
},
{
"epoch": 0.7106875948588884,
"grad_norm": 0.9713539872632391,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.0006984450155869126,
"learning_rate": 4.066381627929202e-06,
"loss": 0.6669,
"step": 867
},
{
"epoch": 0.7115073037341582,
"grad_norm": 0.9183399145736109,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 1.1253795623779297,
"learning_rate": 4.045008528689457e-06,
"loss": 0.6805,
"step": 868
},
{
"epoch": 0.7123270126094279,
"grad_norm": 1.0286213749155761,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.4194809198379517,
"learning_rate": 4.02367749685063e-06,
"loss": 0.7102,
"step": 869
},
{
"epoch": 0.7131467214846977,
"grad_norm": 0.9529707346876777,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.004144263919442892,
"learning_rate": 4.00238868309993e-06,
"loss": 0.6663,
"step": 870
},
{
"epoch": 0.7139664303599674,
"grad_norm": 1.1574389418963933,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.2732635736465454,
"learning_rate": 3.981142237826332e-06,
"loss": 0.7079,
"step": 871
},
{
"epoch": 0.7147861392352373,
"grad_norm": 0.9159115584785531,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.8676116466522217,
"learning_rate": 3.959938311119511e-06,
"loss": 0.71,
"step": 872
},
{
"epoch": 0.715605848110507,
"grad_norm": 0.9789967869727101,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.7186263799667358,
"learning_rate": 3.9387770527687795e-06,
"loss": 0.7327,
"step": 873
},
{
"epoch": 0.7164255569857768,
"grad_norm": 0.9233515451374933,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.4414817988872528,
"learning_rate": 3.917658612262033e-06,
"loss": 0.7098,
"step": 874
},
{
"epoch": 0.7172452658610465,
"grad_norm": 0.9704468069796672,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.9723040461540222,
"learning_rate": 3.8965831387846885e-06,
"loss": 0.6622,
"step": 875
},
{
"epoch": 0.7180649747363163,
"grad_norm": 1.0065511111333068,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.874070942401886,
"learning_rate": 3.875550781218644e-06,
"loss": 0.7033,
"step": 876
},
{
"epoch": 0.7188846836115861,
"grad_norm": 1.0371302526501174,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.02367703802883625,
"learning_rate": 3.854561688141205e-06,
"loss": 0.641,
"step": 877
},
{
"epoch": 0.7197043924868558,
"grad_norm": 1.0540898401173742,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.16339510679244995,
"learning_rate": 3.833616007824054e-06,
"loss": 0.7349,
"step": 878
},
{
"epoch": 0.7205241013621256,
"grad_norm": 1.048361377181232,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.2136911153793335,
"learning_rate": 3.8127138882321937e-06,
"loss": 0.7165,
"step": 879
},
{
"epoch": 0.7213438102373954,
"grad_norm": 0.9228631115088182,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 1.0548585653305054,
"learning_rate": 3.791855477022903e-06,
"loss": 0.7212,
"step": 880
},
{
"epoch": 0.7221635191126652,
"grad_norm": 0.8584023856292647,
"latest_boundary_loss": 0.013131883926689625,
"latest_lm_loss": 0.3909883201122284,
"learning_rate": 3.7710409215446986e-06,
"loss": 0.6469,
"step": 881
},
{
"epoch": 0.7229832279879349,
"grad_norm": 1.0830150854583134,
"latest_boundary_loss": 0.009594811126589775,
"latest_lm_loss": 0.00023115465592127293,
"learning_rate": 3.750270368836283e-06,
"loss": 0.6741,
"step": 882
},
{
"epoch": 0.7238029368632046,
"grad_norm": 0.8596386791002816,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.024373020976781845,
"learning_rate": 3.729543965625526e-06,
"loss": 0.6884,
"step": 883
},
{
"epoch": 0.7246226457384745,
"grad_norm": 0.9895399017159887,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.7909685373306274,
"learning_rate": 3.7088618583284054e-06,
"loss": 0.7105,
"step": 884
},
{
"epoch": 0.7254423546137442,
"grad_norm": 0.9926181483464435,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.0002601688611321151,
"learning_rate": 3.6882241930479824e-06,
"loss": 0.6739,
"step": 885
},
{
"epoch": 0.726262063489014,
"grad_norm": 1.1053880204468391,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.6977870464324951,
"learning_rate": 3.6676311155733745e-06,
"loss": 0.7397,
"step": 886
},
{
"epoch": 0.7270817723642837,
"grad_norm": 1.0391195526164008,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.1460070610046387,
"learning_rate": 3.6470827713787195e-06,
"loss": 0.7138,
"step": 887
},
{
"epoch": 0.7279014812395536,
"grad_norm": 1.0604176060213288,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.48403021693229675,
"learning_rate": 3.6265793056221465e-06,
"loss": 0.6748,
"step": 888
},
{
"epoch": 0.7287211901148233,
"grad_norm": 0.9079621333121072,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.0970895290374756,
"learning_rate": 3.606120863144753e-06,
"loss": 0.6761,
"step": 889
},
{
"epoch": 0.729540898990093,
"grad_norm": 1.2064609480322432,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.2686730623245239,
"learning_rate": 3.5857075884695915e-06,
"loss": 0.7682,
"step": 890
},
{
"epoch": 0.7303606078653628,
"grad_norm": 1.0465236368945114,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.3363715410232544,
"learning_rate": 3.5653396258006266e-06,
"loss": 0.7373,
"step": 891
},
{
"epoch": 0.7311803167406326,
"grad_norm": 1.033817078110439,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.3527984619140625,
"learning_rate": 3.5450171190217364e-06,
"loss": 0.6836,
"step": 892
},
{
"epoch": 0.7320000256159024,
"grad_norm": 0.8938748137335454,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.17023521661758423,
"learning_rate": 3.524740211695683e-06,
"loss": 0.6913,
"step": 893
},
{
"epoch": 0.7328197344911721,
"grad_norm": 0.9553969834884637,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.6163581013679504,
"learning_rate": 3.504509047063108e-06,
"loss": 0.7264,
"step": 894
},
{
"epoch": 0.7336394433664419,
"grad_norm": 1.0130308627994913,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.2378593683242798,
"learning_rate": 3.4843237680415153e-06,
"loss": 0.721,
"step": 895
},
{
"epoch": 0.7344591522417117,
"grad_norm": 1.0147511996337832,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.6772930026054382,
"learning_rate": 3.4641845172242573e-06,
"loss": 0.669,
"step": 896
},
{
"epoch": 0.7352788611169814,
"grad_norm": 1.1272666071401902,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 1.0259910821914673,
"learning_rate": 3.444091436879545e-06,
"loss": 0.7049,
"step": 897
},
{
"epoch": 0.7360985699922512,
"grad_norm": 1.0110241021172623,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.7800242304801941,
"learning_rate": 3.42404466894942e-06,
"loss": 0.6648,
"step": 898
},
{
"epoch": 0.7369182788675209,
"grad_norm": 1.2386336056561935,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.0924358367919922,
"learning_rate": 3.4040443550487645e-06,
"loss": 0.6665,
"step": 899
},
{
"epoch": 0.7377379877427908,
"grad_norm": 1.0853146437492893,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.02431701496243477,
"learning_rate": 3.384090636464301e-06,
"loss": 0.6759,
"step": 900
},
{
"epoch": 0.7385576966180605,
"grad_norm": 0.9805926397092164,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 1.1555978059768677,
"learning_rate": 3.364183654153592e-06,
"loss": 0.7459,
"step": 901
},
{
"epoch": 0.7393774054933303,
"grad_norm": 0.8549471226857189,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 1.3081523180007935,
"learning_rate": 3.344323548744044e-06,
"loss": 0.7161,
"step": 902
},
{
"epoch": 0.7401971143686,
"grad_norm": 1.002947424203249,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.7241700291633606,
"learning_rate": 3.32451046053191e-06,
"loss": 0.6787,
"step": 903
},
{
"epoch": 0.7410168232438697,
"grad_norm": 0.921019636633251,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.05222950130701065,
"learning_rate": 3.304744529481315e-06,
"loss": 0.7102,
"step": 904
},
{
"epoch": 0.7418365321191396,
"grad_norm": 0.9459595406059049,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.00010894708248088136,
"learning_rate": 3.285025895223244e-06,
"loss": 0.707,
"step": 905
},
{
"epoch": 0.7426562409944093,
"grad_norm": 1.1475510732298588,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.9933887124061584,
"learning_rate": 3.26535469705457e-06,
"loss": 0.7064,
"step": 906
},
{
"epoch": 0.7434759498696791,
"grad_norm": 0.9856313421911034,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.13646730780601501,
"learning_rate": 3.2457310739370684e-06,
"loss": 0.7135,
"step": 907
},
{
"epoch": 0.7442956587449489,
"grad_norm": 0.8824980761896706,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.7802220582962036,
"learning_rate": 3.2261551644964305e-06,
"loss": 0.7197,
"step": 908
},
{
"epoch": 0.7451153676202187,
"grad_norm": 1.4704739043068982,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.23710103332996368,
"learning_rate": 3.2066271070212873e-06,
"loss": 0.6525,
"step": 909
},
{
"epoch": 0.7459350764954884,
"grad_norm": 1.0331786056778853,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.0013111588777974248,
"learning_rate": 3.1871470394622407e-06,
"loss": 0.6624,
"step": 910
},
{
"epoch": 0.7467547853707581,
"grad_norm": 0.845459778364654,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.7174825668334961,
"learning_rate": 3.167715099430874e-06,
"loss": 0.6559,
"step": 911
},
{
"epoch": 0.747574494246028,
"grad_norm": 1.1948951087922604,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.9400781393051147,
"learning_rate": 3.148331424198784e-06,
"loss": 0.6589,
"step": 912
},
{
"epoch": 0.7483942031212977,
"grad_norm": 0.8320863846327636,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.23302511870861053,
"learning_rate": 3.1289961506966217e-06,
"loss": 0.6747,
"step": 913
},
{
"epoch": 0.7492139119965675,
"grad_norm": 0.9925033336920036,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.03568759933114052,
"learning_rate": 3.1097094155131122e-06,
"loss": 0.6851,
"step": 914
},
{
"epoch": 0.7500336208718372,
"grad_norm": 1.1074899171518326,
"latest_boundary_loss": 0.00856865756213665,
"latest_lm_loss": 0.8208504915237427,
"learning_rate": 3.0904713548940936e-06,
"loss": 0.672,
"step": 915
},
{
"epoch": 0.7508533297471071,
"grad_norm": 0.9536372119649517,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.10629161447286606,
"learning_rate": 3.0712821047415655e-06,
"loss": 0.6982,
"step": 916
},
{
"epoch": 0.7516730386223768,
"grad_norm": 0.8941158992964481,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 1.1275361776351929,
"learning_rate": 3.052141800612709e-06,
"loss": 0.6805,
"step": 917
},
{
"epoch": 0.7524927474976465,
"grad_norm": 1.0719328717584797,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.5270333290100098,
"learning_rate": 3.0330505777189433e-06,
"loss": 0.6842,
"step": 918
},
{
"epoch": 0.7533124563729163,
"grad_norm": 1.0727464117705965,
"latest_boundary_loss": 0.0074848597869277,
"latest_lm_loss": 0.9727941155433655,
"learning_rate": 3.0140085709249666e-06,
"loss": 0.7501,
"step": 919
},
{
"epoch": 0.754132165248186,
"grad_norm": 1.1136950816333502,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.1888251304626465,
"learning_rate": 2.9950159147478043e-06,
"loss": 0.7021,
"step": 920
},
{
"epoch": 0.7549518741234559,
"grad_norm": 0.9319384765550094,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.6955706477165222,
"learning_rate": 2.976072743355852e-06,
"loss": 0.6796,
"step": 921
},
{
"epoch": 0.7557715829987256,
"grad_norm": 0.8848849231660617,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.2427470684051514,
"learning_rate": 2.957179190567947e-06,
"loss": 0.6869,
"step": 922
},
{
"epoch": 0.7565912918739954,
"grad_norm": 1.0006888886789052,
"latest_boundary_loss": 0.010217878967523575,
"latest_lm_loss": 0.0002946022432297468,
"learning_rate": 2.938335389852397e-06,
"loss": 0.6832,
"step": 923
},
{
"epoch": 0.7574110007492652,
"grad_norm": 1.076035634783637,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.8657299876213074,
"learning_rate": 2.9195414743260544e-06,
"loss": 0.7096,
"step": 924
},
{
"epoch": 0.7582307096245349,
"grad_norm": 1.0414545470006744,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.2007744461297989,
"learning_rate": 2.9007975767533714e-06,
"loss": 0.6848,
"step": 925
},
{
"epoch": 0.7590504184998047,
"grad_norm": 0.9749957614688242,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.8693909645080566,
"learning_rate": 2.882103829545462e-06,
"loss": 0.6442,
"step": 926
},
{
"epoch": 0.7598701273750744,
"grad_norm": 1.2155833795827644,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.9701324701309204,
"learning_rate": 2.863460364759163e-06,
"loss": 0.7208,
"step": 927
},
{
"epoch": 0.7606898362503443,
"grad_norm": 0.9662824081661413,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.7305889129638672,
"learning_rate": 2.844867314096115e-06,
"loss": 0.6664,
"step": 928
},
{
"epoch": 0.761509545125614,
"grad_norm": 0.863484801682061,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.053075600415468216,
"learning_rate": 2.8263248089018116e-06,
"loss": 0.6896,
"step": 929
},
{
"epoch": 0.7623292540008837,
"grad_norm": 0.994486586704907,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.0955816507339478,
"learning_rate": 2.8078329801646876e-06,
"loss": 0.6709,
"step": 930
},
{
"epoch": 0.7631489628761535,
"grad_norm": 0.954565237644722,
"latest_boundary_loss": 0.00856865756213665,
"latest_lm_loss": 0.00038752073305658996,
"learning_rate": 2.789391958515183e-06,
"loss": 0.7004,
"step": 931
},
{
"epoch": 0.7639686717514232,
"grad_norm": 1.1788658783857842,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.1445330381393433,
"learning_rate": 2.77100187422483e-06,
"loss": 0.7058,
"step": 932
},
{
"epoch": 0.7647883806266931,
"grad_norm": 0.9151719451443651,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.5114860534667969,
"learning_rate": 2.7526628572053227e-06,
"loss": 0.7331,
"step": 933
},
{
"epoch": 0.7656080895019628,
"grad_norm": 0.9118852197200749,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.7835705280303955,
"learning_rate": 2.7343750370076127e-06,
"loss": 0.709,
"step": 934
},
{
"epoch": 0.7664277983772326,
"grad_norm": 0.9745870009419952,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.1845852136611938,
"learning_rate": 2.7161385428209773e-06,
"loss": 0.7286,
"step": 935
},
{
"epoch": 0.7672475072525023,
"grad_norm": 1.1133776325406939,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 0.8729183077812195,
"learning_rate": 2.6979535034721195e-06,
"loss": 0.6549,
"step": 936
},
{
"epoch": 0.7680672161277721,
"grad_norm": 0.8608364024623248,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.41703519225120544,
"learning_rate": 2.679820047424253e-06,
"loss": 0.6979,
"step": 937
},
{
"epoch": 0.7688869250030419,
"grad_norm": 1.601553094677427,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.1687843799591064,
"learning_rate": 2.6617383027761944e-06,
"loss": 0.7512,
"step": 938
},
{
"epoch": 0.7697066338783116,
"grad_norm": 1.1287827467484812,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.1085548400878906,
"learning_rate": 2.6437083972614575e-06,
"loss": 0.7045,
"step": 939
},
{
"epoch": 0.7705263427535815,
"grad_norm": 0.8670993619138684,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 1.5218075513839722,
"learning_rate": 2.625730458247362e-06,
"loss": 0.6589,
"step": 940
},
{
"epoch": 0.7713460516288512,
"grad_norm": 1.1144823097997716,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.32625648379325867,
"learning_rate": 2.6078046127341138e-06,
"loss": 0.6763,
"step": 941
},
{
"epoch": 0.772165760504121,
"grad_norm": 0.9007704755349102,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.18834565579891205,
"learning_rate": 2.5899309873539245e-06,
"loss": 0.7004,
"step": 942
},
{
"epoch": 0.7729854693793907,
"grad_norm": 1.05277473083264,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.6006239056587219,
"learning_rate": 2.5721097083701085e-06,
"loss": 0.7565,
"step": 943
},
{
"epoch": 0.7738051782546604,
"grad_norm": 1.1759661436417574,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.7691168189048767,
"learning_rate": 2.5543409016761935e-06,
"loss": 0.6621,
"step": 944
},
{
"epoch": 0.7746248871299303,
"grad_norm": 1.1301078148327819,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 1.1314184665679932,
"learning_rate": 2.5366246927950287e-06,
"loss": 0.7123,
"step": 945
},
{
"epoch": 0.7754445960052,
"grad_norm": 1.1881469720391336,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.5648930072784424,
"learning_rate": 2.518961206877911e-06,
"loss": 0.6893,
"step": 946
},
{
"epoch": 0.7762643048804698,
"grad_norm": 1.1623084965779718,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.9060161113739014,
"learning_rate": 2.5013505687036787e-06,
"loss": 0.7009,
"step": 947
},
{
"epoch": 0.7770840137557395,
"grad_norm": 1.0316653035646688,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.6944351196289062,
"learning_rate": 2.483792902677847e-06,
"loss": 0.6958,
"step": 948
},
{
"epoch": 0.7779037226310094,
"grad_norm": 0.9274081790363907,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.8879955410957336,
"learning_rate": 2.466288332831722e-06,
"loss": 0.7172,
"step": 949
},
{
"epoch": 0.7787234315062791,
"grad_norm": 1.0583495632469067,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.09301748871803284,
"learning_rate": 2.4488369828215286e-06,
"loss": 0.7081,
"step": 950
},
{
"epoch": 0.7795431403815488,
"grad_norm": 0.9753168157075798,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.636999785900116,
"learning_rate": 2.4314389759275334e-06,
"loss": 0.6734,
"step": 951
},
{
"epoch": 0.7803628492568186,
"grad_norm": 0.9534021502050944,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 1.3337091207504272,
"learning_rate": 2.4140944350531714e-06,
"loss": 0.6963,
"step": 952
},
{
"epoch": 0.7811825581320884,
"grad_norm": 0.890776573299897,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.8123337626457214,
"learning_rate": 2.3968034827241926e-06,
"loss": 0.6996,
"step": 953
},
{
"epoch": 0.7820022670073582,
"grad_norm": 1.1118780762372547,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.0012245753314346075,
"learning_rate": 2.379566241087774e-06,
"loss": 0.7003,
"step": 954
},
{
"epoch": 0.7828219758826279,
"grad_norm": 1.0871971559957156,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.062576413154602,
"learning_rate": 2.362382831911675e-06,
"loss": 0.7055,
"step": 955
},
{
"epoch": 0.7836416847578977,
"grad_norm": 1.0140452077753077,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.4054242372512817,
"learning_rate": 2.345253376583366e-06,
"loss": 0.7295,
"step": 956
},
{
"epoch": 0.7844613936331675,
"grad_norm": 0.8848083992596372,
"latest_boundary_loss": 0.01098675187677145,
"latest_lm_loss": 0.0006858808337710798,
"learning_rate": 2.3281779961091777e-06,
"loss": 0.7189,
"step": 957
},
{
"epoch": 0.7852811025084372,
"grad_norm": 0.8848961433823385,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.42628389596939087,
"learning_rate": 2.311156811113444e-06,
"loss": 0.6866,
"step": 958
},
{
"epoch": 0.786100811383707,
"grad_norm": 0.9832255525999846,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.22167763113975525,
"learning_rate": 2.294189941837647e-06,
"loss": 0.7015,
"step": 959
},
{
"epoch": 0.7869205202589767,
"grad_norm": 0.9663239369477896,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.11525467038154602,
"learning_rate": 2.277277508139576e-06,
"loss": 0.6699,
"step": 960
},
{
"epoch": 0.7877402291342466,
"grad_norm": 1.0687076019178068,
"latest_boundary_loss": 0.00950749684125185,
"latest_lm_loss": 0.669357180595398,
"learning_rate": 2.2604196294924696e-06,
"loss": 0.6688,
"step": 961
},
{
"epoch": 0.7885599380095163,
"grad_norm": 1.0186328764194088,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.40656358003616333,
"learning_rate": 2.2436164249841806e-06,
"loss": 0.6609,
"step": 962
},
{
"epoch": 0.7893796468847861,
"grad_norm": 1.3005810776140845,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 1.0091232061386108,
"learning_rate": 2.226868013316328e-06,
"loss": 0.6922,
"step": 963
},
{
"epoch": 0.7901993557600558,
"grad_norm": 1.016719470860335,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.9535509347915649,
"learning_rate": 2.2101745128034657e-06,
"loss": 0.7118,
"step": 964
},
{
"epoch": 0.7910190646353256,
"grad_norm": 0.8555830588445336,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.9251463413238525,
"learning_rate": 2.1935360413722397e-06,
"loss": 0.688,
"step": 965
},
{
"epoch": 0.7918387735105954,
"grad_norm": 0.9590372570673482,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.30590155720710754,
"learning_rate": 2.1769527165605563e-06,
"loss": 0.6854,
"step": 966
},
{
"epoch": 0.7926584823858651,
"grad_norm": 0.9309472953925859,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.0327022075653076,
"learning_rate": 2.160424655516764e-06,
"loss": 0.7032,
"step": 967
},
{
"epoch": 0.793478191261135,
"grad_norm": 0.879983313111112,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 1.5895096063613892,
"learning_rate": 2.1439519749988045e-06,
"loss": 0.6815,
"step": 968
},
{
"epoch": 0.7942979001364047,
"grad_norm": 0.9516534861975846,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.8126771450042725,
"learning_rate": 2.1275347913734023e-06,
"loss": 0.6921,
"step": 969
},
{
"epoch": 0.7951176090116745,
"grad_norm": 0.8679886397977469,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.15465228259563446,
"learning_rate": 2.1111732206152424e-06,
"loss": 0.6799,
"step": 970
},
{
"epoch": 0.7959373178869442,
"grad_norm": 0.8905284920004164,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 0.46578449010849,
"learning_rate": 2.0948673783061424e-06,
"loss": 0.6779,
"step": 971
},
{
"epoch": 0.7967570267622139,
"grad_norm": 0.8740505129031229,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.7735812664031982,
"learning_rate": 2.0786173796342468e-06,
"loss": 0.7062,
"step": 972
},
{
"epoch": 0.7975767356374838,
"grad_norm": 1.2678752586550928,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.14334075152873993,
"learning_rate": 2.0624233393932024e-06,
"loss": 0.6953,
"step": 973
},
{
"epoch": 0.7983964445127535,
"grad_norm": 0.8501612624018128,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.9814978241920471,
"learning_rate": 2.0462853719813624e-06,
"loss": 0.6781,
"step": 974
},
{
"epoch": 0.7992161533880233,
"grad_norm": 1.14524331192102,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.3802480101585388,
"learning_rate": 2.03020359140096e-06,
"loss": 0.7199,
"step": 975
},
{
"epoch": 0.800035862263293,
"grad_norm": 0.9569052323878949,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.5002812147140503,
"learning_rate": 2.0141781112573155e-06,
"loss": 0.7248,
"step": 976
},
{
"epoch": 0.8008555711385629,
"grad_norm": 1.124565773763351,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.000558853149414,
"learning_rate": 1.9982090447580305e-06,
"loss": 0.7142,
"step": 977
},
{
"epoch": 0.8016752800138326,
"grad_norm": 0.8191135419964003,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 0.4195655286312103,
"learning_rate": 1.9822965047121854e-06,
"loss": 0.6513,
"step": 978
},
{
"epoch": 0.8024949888891023,
"grad_norm": 0.8774315775408943,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.0927257537841797,
"learning_rate": 1.9664406035295493e-06,
"loss": 0.7211,
"step": 979
},
{
"epoch": 0.8033146977643721,
"grad_norm": 0.8983148739834376,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.670623779296875,
"learning_rate": 1.950641453219775e-06,
"loss": 0.714,
"step": 980
},
{
"epoch": 0.8041344066396419,
"grad_norm": 1.0496724237214288,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.9172088503837585,
"learning_rate": 1.934899165391623e-06,
"loss": 0.658,
"step": 981
},
{
"epoch": 0.8049541155149117,
"grad_norm": 0.8893037197349647,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.6485571265220642,
"learning_rate": 1.9192138512521585e-06,
"loss": 0.6735,
"step": 982
},
{
"epoch": 0.8057738243901814,
"grad_norm": 0.9199233502541971,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.29731521010398865,
"learning_rate": 1.9035856216059724e-06,
"loss": 0.6813,
"step": 983
},
{
"epoch": 0.8065935332654512,
"grad_norm": 0.9467014768078095,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.36839428544044495,
"learning_rate": 1.8880145868543997e-06,
"loss": 0.6908,
"step": 984
},
{
"epoch": 0.807413242140721,
"grad_norm": 0.9445538649699714,
"latest_boundary_loss": 0.0103687709197402,
"latest_lm_loss": 0.934324324131012,
"learning_rate": 1.8725008569947366e-06,
"loss": 0.7021,
"step": 985
},
{
"epoch": 0.8082329510159907,
"grad_norm": 0.9355494878229382,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.848320722579956,
"learning_rate": 1.8570445416194639e-06,
"loss": 0.6883,
"step": 986
},
{
"epoch": 0.8090526598912605,
"grad_norm": 0.9912822414208821,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.6447222828865051,
"learning_rate": 1.8416457499154727e-06,
"loss": 0.6907,
"step": 987
},
{
"epoch": 0.8098723687665302,
"grad_norm": 1.0732827811658538,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.2924770712852478,
"learning_rate": 1.8263045906633004e-06,
"loss": 0.6885,
"step": 988
},
{
"epoch": 0.8106920776418001,
"grad_norm": 0.8777093267510397,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.7189764380455017,
"learning_rate": 1.811021172236348e-06,
"loss": 0.6853,
"step": 989
},
{
"epoch": 0.8115117865170698,
"grad_norm": 1.1269311487189182,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.6757775545120239,
"learning_rate": 1.7957956026001256e-06,
"loss": 0.7025,
"step": 990
},
{
"epoch": 0.8123314953923396,
"grad_norm": 1.1260325534280595,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.9195502996444702,
"learning_rate": 1.7806279893114874e-06,
"loss": 0.7205,
"step": 991
},
{
"epoch": 0.8131512042676093,
"grad_norm": 0.9580347819519319,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.9153879880905151,
"learning_rate": 1.7655184395178683e-06,
"loss": 0.6874,
"step": 992
},
{
"epoch": 0.8139709131428791,
"grad_norm": 0.939969060922645,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.24218341708183289,
"learning_rate": 1.750467059956531e-06,
"loss": 0.6782,
"step": 993
},
{
"epoch": 0.8147906220181489,
"grad_norm": 0.9701751578092589,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.2839044332504272,
"learning_rate": 1.7354739569538081e-06,
"loss": 0.7003,
"step": 994
},
{
"epoch": 0.8156103308934186,
"grad_norm": 1.2966309162568703,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.0438741445541382,
"learning_rate": 1.7205392364243623e-06,
"loss": 0.6552,
"step": 995
},
{
"epoch": 0.8164300397686884,
"grad_norm": 0.9782367096504212,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.001082633389160037,
"learning_rate": 1.705663003870418e-06,
"loss": 0.6703,
"step": 996
},
{
"epoch": 0.8172497486439582,
"grad_norm": 1.088398164465581,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 2.4653303623199463,
"learning_rate": 1.6908453643810342e-06,
"loss": 0.6867,
"step": 997
},
{
"epoch": 0.8180694575192279,
"grad_norm": 1.011122031737629,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.00019123633683193475,
"learning_rate": 1.6760864226313534e-06,
"loss": 0.6932,
"step": 998
},
{
"epoch": 0.8188891663944977,
"grad_norm": 1.084594979554229,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.3952026665210724,
"learning_rate": 1.6613862828818628e-06,
"loss": 0.6944,
"step": 999
},
{
"epoch": 0.8197088752697674,
"grad_norm": 1.0884391468070609,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.07994883507490158,
"learning_rate": 1.6467450489776581e-06,
"loss": 0.7154,
"step": 1000
},
{
"epoch": 0.8205285841450373,
"grad_norm": 1.0528864366196309,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.5741978287696838,
"learning_rate": 1.6321628243477194e-06,
"loss": 0.7065,
"step": 1001
},
{
"epoch": 0.821348293020307,
"grad_norm": 0.9003726005193258,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.0834848880767822,
"learning_rate": 1.617639712004162e-06,
"loss": 0.6887,
"step": 1002
},
{
"epoch": 0.8221680018955768,
"grad_norm": 1.0953466203553535,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.8778793811798096,
"learning_rate": 1.6031758145415222e-06,
"loss": 0.7183,
"step": 1003
},
{
"epoch": 0.8229877107708465,
"grad_norm": 1.3094462897516457,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.7071510553359985,
"learning_rate": 1.5887712341360294e-06,
"loss": 0.655,
"step": 1004
},
{
"epoch": 0.8238074196461163,
"grad_norm": 1.2741079991507434,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.9826719164848328,
"learning_rate": 1.5744260725448845e-06,
"loss": 0.7098,
"step": 1005
},
{
"epoch": 0.8246271285213861,
"grad_norm": 1.3807979870256386,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.6817594170570374,
"learning_rate": 1.560140431105539e-06,
"loss": 0.7247,
"step": 1006
},
{
"epoch": 0.8254468373966558,
"grad_norm": 0.8873518519627774,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 0.792921781539917,
"learning_rate": 1.5459144107349788e-06,
"loss": 0.6827,
"step": 1007
},
{
"epoch": 0.8262665462719256,
"grad_norm": 1.1560254255031084,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.43505075573921204,
"learning_rate": 1.531748111929021e-06,
"loss": 0.6327,
"step": 1008
},
{
"epoch": 0.8270862551471954,
"grad_norm": 0.9376104245004846,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.8129606246948242,
"learning_rate": 1.5176416347615886e-06,
"loss": 0.6649,
"step": 1009
},
{
"epoch": 0.8279059640224652,
"grad_norm": 0.978107593811633,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.24315620958805084,
"learning_rate": 1.5035950788840125e-06,
"loss": 0.7299,
"step": 1010
},
{
"epoch": 0.8287256728977349,
"grad_norm": 1.0723796482612582,
"latest_boundary_loss": 0.0103687709197402,
"latest_lm_loss": 0.8571600914001465,
"learning_rate": 1.4896085435243279e-06,
"loss": 0.7352,
"step": 1011
},
{
"epoch": 0.8295453817730046,
"grad_norm": 0.8485706831514985,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.15590983629226685,
"learning_rate": 1.4756821274865696e-06,
"loss": 0.7033,
"step": 1012
},
{
"epoch": 0.8303650906482745,
"grad_norm": 1.1532029542009357,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.7850178480148315,
"learning_rate": 1.4618159291500777e-06,
"loss": 0.6994,
"step": 1013
},
{
"epoch": 0.8311847995235442,
"grad_norm": 0.9171322647842043,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 0.7002415657043457,
"learning_rate": 1.4480100464687973e-06,
"loss": 0.6907,
"step": 1014
},
{
"epoch": 0.832004508398814,
"grad_norm": 0.9461919135045116,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 1.250064730644226,
"learning_rate": 1.4342645769705977e-06,
"loss": 0.6756,
"step": 1015
},
{
"epoch": 0.8328242172740837,
"grad_norm": 0.9408275385934868,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.1754680573940277,
"learning_rate": 1.4205796177565688e-06,
"loss": 0.6778,
"step": 1016
},
{
"epoch": 0.8336439261493536,
"grad_norm": 0.8872063150499062,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 7.366668432950974e-05,
"learning_rate": 1.406955265500346e-06,
"loss": 0.7014,
"step": 1017
},
{
"epoch": 0.8344636350246233,
"grad_norm": 0.899092838204657,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.08955018222332001,
"learning_rate": 1.3933916164474193e-06,
"loss": 0.7095,
"step": 1018
},
{
"epoch": 0.835283343899893,
"grad_norm": 0.9039468050992078,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 1.009004831314087,
"learning_rate": 1.3798887664144634e-06,
"loss": 0.6693,
"step": 1019
},
{
"epoch": 0.8361030527751628,
"grad_norm": 0.9420936226816797,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.820389986038208,
"learning_rate": 1.3664468107886496e-06,
"loss": 0.6724,
"step": 1020
},
{
"epoch": 0.8369227616504326,
"grad_norm": 1.0337088108204833,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.7910609841346741,
"learning_rate": 1.3530658445269784e-06,
"loss": 0.6982,
"step": 1021
},
{
"epoch": 0.8377424705257024,
"grad_norm": 0.8920008801386402,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.0002237668086308986,
"learning_rate": 1.339745962155613e-06,
"loss": 0.6586,
"step": 1022
},
{
"epoch": 0.8385621794009721,
"grad_norm": 0.8878748630080873,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.21126195788383484,
"learning_rate": 1.3264872577692022e-06,
"loss": 0.6403,
"step": 1023
},
{
"epoch": 0.8393818882762419,
"grad_norm": 0.9824782887375642,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.4438121020793915,
"learning_rate": 1.3132898250302173e-06,
"loss": 0.7016,
"step": 1024
},
{
"epoch": 0.8402015971515117,
"grad_norm": 0.9284738755107322,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 0.6033508777618408,
"learning_rate": 1.3001537571682965e-06,
"loss": 0.6488,
"step": 1025
},
{
"epoch": 0.8410213060267814,
"grad_norm": 1.0275436466477972,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.733867883682251,
"learning_rate": 1.2870791469795818e-06,
"loss": 0.7057,
"step": 1026
},
{
"epoch": 0.8418410149020512,
"grad_norm": 1.0365172265383704,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.2995297610759735,
"learning_rate": 1.2740660868260634e-06,
"loss": 0.7127,
"step": 1027
},
{
"epoch": 0.8426607237773209,
"grad_norm": 0.925769380462904,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.0580196380615234,
"learning_rate": 1.2611146686349284e-06,
"loss": 0.7018,
"step": 1028
},
{
"epoch": 0.8434804326525908,
"grad_norm": 1.0284978604727517,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.5550094842910767,
"learning_rate": 1.2482249838979143e-06,
"loss": 0.705,
"step": 1029
},
{
"epoch": 0.8443001415278605,
"grad_norm": 1.0137142418446572,
"latest_boundary_loss": 0.008892906829714775,
"latest_lm_loss": 0.2271990329027176,
"learning_rate": 1.2353971236706564e-06,
"loss": 0.6913,
"step": 1030
},
{
"epoch": 0.8451198504031303,
"grad_norm": 1.1551457512764751,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.6798177361488342,
"learning_rate": 1.2226311785720468e-06,
"loss": 0.7064,
"step": 1031
},
{
"epoch": 0.8459395592784,
"grad_norm": 1.0026414252604277,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 2.053499460220337,
"learning_rate": 1.209927238783598e-06,
"loss": 0.6682,
"step": 1032
},
{
"epoch": 0.8467592681536698,
"grad_norm": 1.046122239654961,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.22483663260936737,
"learning_rate": 1.1972853940488017e-06,
"loss": 0.6941,
"step": 1033
},
{
"epoch": 0.8475789770289396,
"grad_norm": 0.9695514986754297,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.5129010677337646,
"learning_rate": 1.1847057336724965e-06,
"loss": 0.6948,
"step": 1034
},
{
"epoch": 0.8483986859042093,
"grad_norm": 1.1762465496505037,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 0.6429762840270996,
"learning_rate": 1.1721883465202333e-06,
"loss": 0.7089,
"step": 1035
},
{
"epoch": 0.8492183947794791,
"grad_norm": 0.9606560781970416,
"latest_boundary_loss": 0.0098554827272892,
"latest_lm_loss": 0.3866882026195526,
"learning_rate": 1.1597333210176587e-06,
"loss": 0.6832,
"step": 1036
},
{
"epoch": 0.8500381036547489,
"grad_norm": 1.107190116224884,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.437673568725586,
"learning_rate": 1.1473407451498752e-06,
"loss": 0.7013,
"step": 1037
},
{
"epoch": 0.8508578125300187,
"grad_norm": 0.9290125138612028,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.9868656396865845,
"learning_rate": 1.1350107064608317e-06,
"loss": 0.697,
"step": 1038
},
{
"epoch": 0.8516775214052884,
"grad_norm": 0.9671078986806978,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.0005372909945435822,
"learning_rate": 1.122743292052697e-06,
"loss": 0.6661,
"step": 1039
},
{
"epoch": 0.8524972302805581,
"grad_norm": 1.008315358751487,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.40882718563079834,
"learning_rate": 1.1105385885852483e-06,
"loss": 0.6802,
"step": 1040
},
{
"epoch": 0.853316939155828,
"grad_norm": 0.9590775800671869,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.6967741250991821,
"learning_rate": 1.0983966822752624e-06,
"loss": 0.7003,
"step": 1041
},
{
"epoch": 0.8541366480310977,
"grad_norm": 1.1614355933710476,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.2704944610595703,
"learning_rate": 1.0863176588958957e-06,
"loss": 0.7252,
"step": 1042
},
{
"epoch": 0.8549563569063675,
"grad_norm": 0.9282762173980162,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 1.2122578620910645,
"learning_rate": 1.0743016037760946e-06,
"loss": 0.7397,
"step": 1043
},
{
"epoch": 0.8557760657816372,
"grad_norm": 0.8913870616253222,
"latest_boundary_loss": 0.0079883998259902,
"latest_lm_loss": 0.3448260426521301,
"learning_rate": 1.0623486017999762e-06,
"loss": 0.6567,
"step": 1044
},
{
"epoch": 0.8565957746569071,
"grad_norm": 0.9640589480129242,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.5379891991615295,
"learning_rate": 1.0504587374062392e-06,
"loss": 0.6983,
"step": 1045
},
{
"epoch": 0.8574154835321768,
"grad_norm": 1.1505306352422153,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.6377214789390564,
"learning_rate": 1.0386320945875627e-06,
"loss": 0.6662,
"step": 1046
},
{
"epoch": 0.8582351924074465,
"grad_norm": 1.3888897604913257,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.1375789642333984,
"learning_rate": 1.0268687568900159e-06,
"loss": 0.6728,
"step": 1047
},
{
"epoch": 0.8590549012827163,
"grad_norm": 1.104199866708355,
"latest_boundary_loss": 0.0103687709197402,
"latest_lm_loss": 0.6023237705230713,
"learning_rate": 1.0151688074124645e-06,
"loss": 0.6672,
"step": 1048
},
{
"epoch": 0.859874610157986,
"grad_norm": 1.1294132645411175,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.9752814769744873,
"learning_rate": 1.0035323288059861e-06,
"loss": 0.6935,
"step": 1049
},
{
"epoch": 0.8606943190332559,
"grad_norm": 0.9265112367414724,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.01632915623486042,
"learning_rate": 9.919594032732893e-07,
"loss": 0.7239,
"step": 1050
},
{
"epoch": 0.8615140279085256,
"grad_norm": 0.9294787698824167,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.0293835401535034,
"learning_rate": 9.804501125681243e-07,
"loss": 0.6589,
"step": 1051
},
{
"epoch": 0.8623337367837954,
"grad_norm": 0.9643006666099048,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.3070087134838104,
"learning_rate": 9.690045379947134e-07,
"loss": 0.6573,
"step": 1052
},
{
"epoch": 0.8631534456590652,
"grad_norm": 1.3563527360759056,
"latest_boundary_loss": 0.009173923172056675,
"latest_lm_loss": 0.17437432706356049,
"learning_rate": 9.576227604071731e-07,
"loss": 0.6879,
"step": 1053
},
{
"epoch": 0.8639731545343349,
"grad_norm": 0.8590732970355337,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.5931690335273743,
"learning_rate": 9.463048602089431e-07,
"loss": 0.6628,
"step": 1054
},
{
"epoch": 0.8647928634096047,
"grad_norm": 0.8338811190256139,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.2343312501907349,
"learning_rate": 9.350509173522193e-07,
"loss": 0.6627,
"step": 1055
},
{
"epoch": 0.8656125722848744,
"grad_norm": 1.1185357563813256,
"latest_boundary_loss": 0.008855608291924,
"latest_lm_loss": 0.29267165064811707,
"learning_rate": 9.23861011337387e-07,
"loss": 0.71,
"step": 1056
},
{
"epoch": 0.8664322811601443,
"grad_norm": 0.9148950702345827,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 4.5893782953498885e-05,
"learning_rate": 9.127352212124663e-07,
"loss": 0.6903,
"step": 1057
},
{
"epoch": 0.867251990035414,
"grad_norm": 1.0796737879180378,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.4994605481624603,
"learning_rate": 9.016736255725434e-07,
"loss": 0.7115,
"step": 1058
},
{
"epoch": 0.8680716989106837,
"grad_norm": 1.234481545340778,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.6549656391143799,
"learning_rate": 8.906763025592191e-07,
"loss": 0.6888,
"step": 1059
},
{
"epoch": 0.8688914077859535,
"grad_norm": 0.8695815393820379,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.6221119165420532,
"learning_rate": 8.797433298600622e-07,
"loss": 0.6451,
"step": 1060
},
{
"epoch": 0.8697111166612232,
"grad_norm": 0.8979257159775406,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 1.1266192197799683,
"learning_rate": 8.688747847080514e-07,
"loss": 0.7057,
"step": 1061
},
{
"epoch": 0.8705308255364931,
"grad_norm": 0.8711264493055869,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.8611801862716675,
"learning_rate": 8.580707438810398e-07,
"loss": 0.6502,
"step": 1062
},
{
"epoch": 0.8713505344117628,
"grad_norm": 0.9036091564450818,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.20681270956993103,
"learning_rate": 8.473312837012027e-07,
"loss": 0.685,
"step": 1063
},
{
"epoch": 0.8721702432870326,
"grad_norm": 0.9140163464447754,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.5638993978500366,
"learning_rate": 8.366564800345089e-07,
"loss": 0.6863,
"step": 1064
},
{
"epoch": 0.8729899521623024,
"grad_norm": 0.903067803899594,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.46477872133255005,
"learning_rate": 8.260464082901732e-07,
"loss": 0.6525,
"step": 1065
},
{
"epoch": 0.8738096610375721,
"grad_norm": 1.092556604852937,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.7806563377380371,
"learning_rate": 8.155011434201332e-07,
"loss": 0.7041,
"step": 1066
},
{
"epoch": 0.8746293699128419,
"grad_norm": 0.8491791236441539,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.006742133758962154,
"learning_rate": 8.050207599185134e-07,
"loss": 0.7096,
"step": 1067
},
{
"epoch": 0.8754490787881116,
"grad_norm": 0.9756665543906982,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.70832759141922,
"learning_rate": 7.946053318211045e-07,
"loss": 0.6572,
"step": 1068
},
{
"epoch": 0.8762687876633815,
"grad_norm": 1.101734910519092,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.7115592360496521,
"learning_rate": 7.842549327048366e-07,
"loss": 0.7385,
"step": 1069
},
{
"epoch": 0.8770884965386512,
"grad_norm": 0.9894835075247712,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.0158761627972126,
"learning_rate": 7.739696356872562e-07,
"loss": 0.7242,
"step": 1070
},
{
"epoch": 0.877908205413921,
"grad_norm": 0.9280748729331179,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.22196367383003235,
"learning_rate": 7.637495134260242e-07,
"loss": 0.7011,
"step": 1071
},
{
"epoch": 0.8787279142891907,
"grad_norm": 1.0149104083424296,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.4822976589202881,
"learning_rate": 7.535946381183812e-07,
"loss": 0.7253,
"step": 1072
},
{
"epoch": 0.8795476231644604,
"grad_norm": 1.2503795542431604,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.6795845031738281,
"learning_rate": 7.435050815006562e-07,
"loss": 0.7076,
"step": 1073
},
{
"epoch": 0.8803673320397303,
"grad_norm": 1.1751629582487448,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.14189808070659637,
"learning_rate": 7.334809148477484e-07,
"loss": 0.7265,
"step": 1074
},
{
"epoch": 0.881187040915,
"grad_norm": 1.023633521389993,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.8233854174613953,
"learning_rate": 7.23522208972628e-07,
"loss": 0.6807,
"step": 1075
},
{
"epoch": 0.8820067497902698,
"grad_norm": 1.2040824272939745,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.30481016635894775,
"learning_rate": 7.136290342258378e-07,
"loss": 0.7227,
"step": 1076
},
{
"epoch": 0.8828264586655395,
"grad_norm": 0.9005012986512613,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.1280655711889267,
"learning_rate": 7.038014604949883e-07,
"loss": 0.7077,
"step": 1077
},
{
"epoch": 0.8836461675408094,
"grad_norm": 1.059509872562195,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.840686559677124,
"learning_rate": 6.940395572042791e-07,
"loss": 0.7117,
"step": 1078
},
{
"epoch": 0.8844658764160791,
"grad_norm": 0.9129497516398813,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.7105281352996826,
"learning_rate": 6.843433933139909e-07,
"loss": 0.6609,
"step": 1079
},
{
"epoch": 0.8852855852913488,
"grad_norm": 1.0055492519074114,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.26193323731422424,
"learning_rate": 6.747130373200095e-07,
"loss": 0.6809,
"step": 1080
},
{
"epoch": 0.8861052941666187,
"grad_norm": 0.8289548101765181,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 3.957617445848882e-05,
"learning_rate": 6.651485572533379e-07,
"loss": 0.6935,
"step": 1081
},
{
"epoch": 0.8869250030418884,
"grad_norm": 0.933368887026105,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 1.1051077842712402,
"learning_rate": 6.556500206796179e-07,
"loss": 0.7086,
"step": 1082
},
{
"epoch": 0.8877447119171582,
"grad_norm": 0.983078683713394,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.15434131026268005,
"learning_rate": 6.462174946986511e-07,
"loss": 0.6995,
"step": 1083
},
{
"epoch": 0.8885644207924279,
"grad_norm": 1.0403958045776212,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.6938844919204712,
"learning_rate": 6.368510459439248e-07,
"loss": 0.6779,
"step": 1084
},
{
"epoch": 0.8893841296676978,
"grad_norm": 1.014898112979336,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.8538143038749695,
"learning_rate": 6.275507405821435e-07,
"loss": 0.6834,
"step": 1085
},
{
"epoch": 0.8902038385429675,
"grad_norm": 0.8831074971134154,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.0254498720169067,
"learning_rate": 6.183166443127587e-07,
"loss": 0.6379,
"step": 1086
},
{
"epoch": 0.8910235474182372,
"grad_norm": 0.9164494491686246,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.2494126856327057,
"learning_rate": 6.091488223675058e-07,
"loss": 0.6661,
"step": 1087
},
{
"epoch": 0.891843256293507,
"grad_norm": 0.9521757488152639,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.3169527053833008,
"learning_rate": 6.000473395099438e-07,
"loss": 0.7202,
"step": 1088
},
{
"epoch": 0.8926629651687767,
"grad_norm": 0.9250157752699806,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.8193890452384949,
"learning_rate": 5.910122600349966e-07,
"loss": 0.63,
"step": 1089
},
{
"epoch": 0.8934826740440466,
"grad_norm": 0.9523240163296833,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.00014523675781674683,
"learning_rate": 5.820436477685021e-07,
"loss": 0.6442,
"step": 1090
},
{
"epoch": 0.8943023829193163,
"grad_norm": 0.8227508156020683,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.7804707884788513,
"learning_rate": 5.73141566066755e-07,
"loss": 0.6676,
"step": 1091
},
{
"epoch": 0.8951220917945861,
"grad_norm": 1.261248526588513,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 1.3599324226379395,
"learning_rate": 5.64306077816068e-07,
"loss": 0.7013,
"step": 1092
},
{
"epoch": 0.8959418006698558,
"grad_norm": 0.9319644278221783,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.0531415119767189,
"learning_rate": 5.555372454323182e-07,
"loss": 0.6535,
"step": 1093
},
{
"epoch": 0.8967615095451256,
"grad_norm": 0.9071109946846174,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.8236528635025024,
"learning_rate": 5.468351308605135e-07,
"loss": 0.6961,
"step": 1094
},
{
"epoch": 0.8975812184203954,
"grad_norm": 0.9375616149742969,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 1.3615353107452393,
"learning_rate": 5.3819979557435e-07,
"loss": 0.6586,
"step": 1095
},
{
"epoch": 0.8984009272956651,
"grad_norm": 0.9632662261783385,
"latest_boundary_loss": 0.009594811126589775,
"latest_lm_loss": 0.5572503209114075,
"learning_rate": 5.296313005757814e-07,
"loss": 0.6687,
"step": 1096
},
{
"epoch": 0.899220636170935,
"grad_norm": 0.8861229609171315,
"latest_boundary_loss": 0.009234958328306675,
"latest_lm_loss": 0.7815489768981934,
"learning_rate": 5.211297063945875e-07,
"loss": 0.7012,
"step": 1097
},
{
"epoch": 0.9000403450462047,
"grad_norm": 2.744907795248946,
"latest_boundary_loss": 0.0067888894118368626,
"latest_lm_loss": 0.9608690142631531,
"learning_rate": 5.126950730879399e-07,
"loss": 0.6937,
"step": 1098
},
{
"epoch": 0.9008600539214745,
"grad_norm": 0.8557651630869942,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.9524214863777161,
"learning_rate": 5.043274602399939e-07,
"loss": 0.6739,
"step": 1099
},
{
"epoch": 0.9016797627967442,
"grad_norm": 1.083706889006357,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.12171266227960587,
"learning_rate": 4.96026926961447e-07,
"loss": 0.6776,
"step": 1100
},
{
"epoch": 0.9024994716720139,
"grad_norm": 1.2036150383840019,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.5232874155044556,
"learning_rate": 4.877935318891381e-07,
"loss": 0.6978,
"step": 1101
},
{
"epoch": 0.9033191805472838,
"grad_norm": 0.8796425268642953,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.728472888469696,
"learning_rate": 4.796273331856227e-07,
"loss": 0.7009,
"step": 1102
},
{
"epoch": 0.9041388894225535,
"grad_norm": 0.949652909584135,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.12783630192279816,
"learning_rate": 4.715283885387678e-07,
"loss": 0.6546,
"step": 1103
},
{
"epoch": 0.9049585982978233,
"grad_norm": 0.9360180034577728,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 0.6264219880104065,
"learning_rate": 4.634967551613423e-07,
"loss": 0.7048,
"step": 1104
},
{
"epoch": 0.905778307173093,
"grad_norm": 0.9894781505404314,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 2.2205209732055664,
"learning_rate": 4.555324897906133e-07,
"loss": 0.6606,
"step": 1105
},
{
"epoch": 0.9065980160483629,
"grad_norm": 0.8961352599710566,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.8902292847633362,
"learning_rate": 4.476356486879474e-07,
"loss": 0.6665,
"step": 1106
},
{
"epoch": 0.9074177249236326,
"grad_norm": 0.9561799632029774,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 1.1162327527999878,
"learning_rate": 4.398062876384046e-07,
"loss": 0.6573,
"step": 1107
},
{
"epoch": 0.9082374337989023,
"grad_norm": 0.9264646692636851,
"latest_boundary_loss": 0.012135399505496025,
"latest_lm_loss": 0.8248792290687561,
"learning_rate": 4.320444619503583e-07,
"loss": 0.7286,
"step": 1108
},
{
"epoch": 0.9090571426741721,
"grad_norm": 0.9771695514002697,
"latest_boundary_loss": 0.00997246615588665,
"latest_lm_loss": 0.5312575697898865,
"learning_rate": 4.243502264550903e-07,
"loss": 0.7175,
"step": 1109
},
{
"epoch": 0.9098768515494419,
"grad_norm": 1.0255787947792963,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.16585031151771545,
"learning_rate": 4.1672363550641415e-07,
"loss": 0.7122,
"step": 1110
},
{
"epoch": 0.9106965604247117,
"grad_norm": 0.8691730766755638,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.0761048793792725,
"learning_rate": 4.0916474298028694e-07,
"loss": 0.6277,
"step": 1111
},
{
"epoch": 0.9115162692999814,
"grad_norm": 0.8647720897128677,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.2423782348632812,
"learning_rate": 4.016736022744272e-07,
"loss": 0.6404,
"step": 1112
},
{
"epoch": 0.9123359781752512,
"grad_norm": 0.9125626978873399,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 0.08720621466636658,
"learning_rate": 3.942502663079395e-07,
"loss": 0.6873,
"step": 1113
},
{
"epoch": 0.913155687050521,
"grad_norm": 0.9593819957244605,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.7371125817298889,
"learning_rate": 3.8689478752094167e-07,
"loss": 0.6735,
"step": 1114
},
{
"epoch": 0.9139753959257907,
"grad_norm": 0.9657999166500343,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 0.10703489929437637,
"learning_rate": 3.7960721787419164e-07,
"loss": 0.669,
"step": 1115
},
{
"epoch": 0.9147951048010605,
"grad_norm": 1.0245304385496954,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.2033360004425049,
"learning_rate": 3.7238760884872216e-07,
"loss": 0.6725,
"step": 1116
},
{
"epoch": 0.9156148136763302,
"grad_norm": 0.9603629571870653,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.01297867763787508,
"learning_rate": 3.6523601144548003e-07,
"loss": 0.6439,
"step": 1117
},
{
"epoch": 0.9164345225516001,
"grad_norm": 0.9464634813864072,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.09466932713985443,
"learning_rate": 3.5815247618495753e-07,
"loss": 0.6848,
"step": 1118
},
{
"epoch": 0.9172542314268698,
"grad_norm": 0.9447173243178177,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.45157015323638916,
"learning_rate": 3.5113705310684363e-07,
"loss": 0.6795,
"step": 1119
},
{
"epoch": 0.9180739403021395,
"grad_norm": 0.9303087695466622,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 0.05889945849776268,
"learning_rate": 3.441897917696679e-07,
"loss": 0.6707,
"step": 1120
},
{
"epoch": 0.9188936491774093,
"grad_norm": 0.9223108790160708,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.8003207445144653,
"learning_rate": 3.373107412504473e-07,
"loss": 0.7137,
"step": 1121
},
{
"epoch": 0.9197133580526791,
"grad_norm": 0.9317477661755202,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.4609176218509674,
"learning_rate": 3.30499950144344e-07,
"loss": 0.6737,
"step": 1122
},
{
"epoch": 0.9205330669279489,
"grad_norm": 0.9647382467153185,
"latest_boundary_loss": 0.011393229477107525,
"latest_lm_loss": 1.6046785116195679,
"learning_rate": 3.2375746656432284e-07,
"loss": 0.6836,
"step": 1123
},
{
"epoch": 0.9213527758032186,
"grad_norm": 0.9198925351400825,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.148537278175354,
"learning_rate": 3.170833381408045e-07,
"loss": 0.6604,
"step": 1124
},
{
"epoch": 0.9221724846784884,
"grad_norm": 1.0654224146292754,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 0.7485402226448059,
"learning_rate": 3.10477612021336e-07,
"loss": 0.6759,
"step": 1125
},
{
"epoch": 0.9229921935537582,
"grad_norm": 1.0353001603534244,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.8129321932792664,
"learning_rate": 3.03940334870253e-07,
"loss": 0.6607,
"step": 1126
},
{
"epoch": 0.9238119024290279,
"grad_norm": 1.042114244453928,
"latest_boundary_loss": 0.0057211983948946,
"latest_lm_loss": 1.2283984422683716,
"learning_rate": 2.974715528683547e-07,
"loss": 0.6552,
"step": 1127
},
{
"epoch": 0.9246316113042977,
"grad_norm": 0.8145880686253928,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.8882852792739868,
"learning_rate": 2.910713117125719e-07,
"loss": 0.6488,
"step": 1128
},
{
"epoch": 0.9254513201795674,
"grad_norm": 0.8804964820061129,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.5401952266693115,
"learning_rate": 2.8473965661565353e-07,
"loss": 0.6834,
"step": 1129
},
{
"epoch": 0.9262710290548373,
"grad_norm": 0.8887526697088693,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.616662323474884,
"learning_rate": 2.784766323058352e-07,
"loss": 0.6884,
"step": 1130
},
{
"epoch": 0.927090737930107,
"grad_norm": 1.0843288286789219,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.0312321186065674,
"learning_rate": 2.7228228302653037e-07,
"loss": 0.685,
"step": 1131
},
{
"epoch": 0.9279104468053768,
"grad_norm": 0.9939393721575795,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 0.0017697591101750731,
"learning_rate": 2.661566525360193e-07,
"loss": 0.6716,
"step": 1132
},
{
"epoch": 0.9287301556806465,
"grad_norm": 1.3318793706542362,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.6837891936302185,
"learning_rate": 2.600997841071329e-07,
"loss": 0.654,
"step": 1133
},
{
"epoch": 0.9295498645559163,
"grad_norm": 0.9315208103768039,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 6.049530566087924e-05,
"learning_rate": 2.54111720526955e-07,
"loss": 0.6847,
"step": 1134
},
{
"epoch": 0.9303695734311861,
"grad_norm": 0.908915974466263,
"latest_boundary_loss": 0.00856865756213665,
"latest_lm_loss": 0.5950667858123779,
"learning_rate": 2.4819250409651605e-07,
"loss": 0.7054,
"step": 1135
},
{
"epoch": 0.9311892823064558,
"grad_norm": 0.9859693685796354,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.00023288476222660393,
"learning_rate": 2.423421766304934e-07,
"loss": 0.6722,
"step": 1136
},
{
"epoch": 0.9320089911817256,
"grad_norm": 1.0252388819923457,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 0.8820898532867432,
"learning_rate": 2.3656077945691802e-07,
"loss": 0.6727,
"step": 1137
},
{
"epoch": 0.9328287000569954,
"grad_norm": 1.0350472265756638,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.5197891592979431,
"learning_rate": 2.308483534168815e-07,
"loss": 0.6961,
"step": 1138
},
{
"epoch": 0.9336484089322652,
"grad_norm": 0.899922510932412,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.6255961656570435,
"learning_rate": 2.2520493886424743e-07,
"loss": 0.6538,
"step": 1139
},
{
"epoch": 0.9344681178075349,
"grad_norm": 0.9970373502486537,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.5130091309547424,
"learning_rate": 2.1963057566536715e-07,
"loss": 0.7211,
"step": 1140
},
{
"epoch": 0.9352878266828046,
"grad_norm": 0.8730905920019364,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.7840816378593445,
"learning_rate": 2.1412530319879888e-07,
"loss": 0.6904,
"step": 1141
},
{
"epoch": 0.9361075355580745,
"grad_norm": 1.0311341998753194,
"latest_boundary_loss": 0.0074475607834756374,
"latest_lm_loss": 0.20129425823688507,
"learning_rate": 2.0868916035502785e-07,
"loss": 0.7055,
"step": 1142
},
{
"epoch": 0.9369272444333442,
"grad_norm": 0.7737336945908111,
"latest_boundary_loss": 0.010595110245049,
"latest_lm_loss": 0.13958147168159485,
"learning_rate": 2.0332218553618888e-07,
"loss": 0.665,
"step": 1143
},
{
"epoch": 0.937746953308614,
"grad_norm": 0.9223835504099516,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 1.8956537246704102,
"learning_rate": 1.9802441665580208e-07,
"loss": 0.6723,
"step": 1144
},
{
"epoch": 0.9385666621838837,
"grad_norm": 1.1542517963708663,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.1046380996704102,
"learning_rate": 1.9279589113850082e-07,
"loss": 0.7222,
"step": 1145
},
{
"epoch": 0.9393863710591536,
"grad_norm": 0.9779244421224661,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 1.248913288116455,
"learning_rate": 1.8763664591976426e-07,
"loss": 0.6628,
"step": 1146
},
{
"epoch": 0.9402060799344233,
"grad_norm": 1.0722139739185537,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.1151241064071655,
"learning_rate": 1.825467174456652e-07,
"loss": 0.6453,
"step": 1147
},
{
"epoch": 0.941025788809693,
"grad_norm": 0.9868709668273624,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.0328876972198486,
"learning_rate": 1.7752614167260484e-07,
"loss": 0.6761,
"step": 1148
},
{
"epoch": 0.9418454976849628,
"grad_norm": 1.0069100975811585,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.8549620509147644,
"learning_rate": 1.7257495406705959e-07,
"loss": 0.6866,
"step": 1149
},
{
"epoch": 0.9426652065602326,
"grad_norm": 0.9472942286819052,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.6810474991798401,
"learning_rate": 1.6769318960533465e-07,
"loss": 0.6982,
"step": 1150
},
{
"epoch": 0.9434849154355024,
"grad_norm": 0.8248801596333701,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 0.38281187415122986,
"learning_rate": 1.6288088277331303e-07,
"loss": 0.6364,
"step": 1151
},
{
"epoch": 0.9443046243107721,
"grad_norm": 1.0950298001641026,
"latest_boundary_loss": 0.009594811126589775,
"latest_lm_loss": 1.4213231801986694,
"learning_rate": 1.5813806756621475e-07,
"loss": 0.7097,
"step": 1152
},
{
"epoch": 0.9451243331860419,
"grad_norm": 0.8750449824861067,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.974471926689148,
"learning_rate": 1.5346477748835353e-07,
"loss": 0.6864,
"step": 1153
},
{
"epoch": 0.9459440420613117,
"grad_norm": 1.036573264436613,
"latest_boundary_loss": 0.0057737561874091625,
"latest_lm_loss": 1.0913333892822266,
"learning_rate": 1.488610455529038e-07,
"loss": 0.6795,
"step": 1154
},
{
"epoch": 0.9467637509365814,
"grad_norm": 1.0182122945649013,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.13572584092617035,
"learning_rate": 1.4432690428166528e-07,
"loss": 0.6866,
"step": 1155
},
{
"epoch": 0.9475834598118512,
"grad_norm": 1.1295049502284513,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.0016975275939330459,
"learning_rate": 1.39862385704832e-07,
"loss": 0.6223,
"step": 1156
},
{
"epoch": 0.9484031686871209,
"grad_norm": 0.9294627998649388,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.661367416381836,
"learning_rate": 1.3546752136076924e-07,
"loss": 0.6872,
"step": 1157
},
{
"epoch": 0.9492228775623908,
"grad_norm": 0.8673528883018865,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.8435372710227966,
"learning_rate": 1.3114234229578803e-07,
"loss": 0.6791,
"step": 1158
},
{
"epoch": 0.9500425864376605,
"grad_norm": 0.8864056422060821,
"latest_boundary_loss": 0.0085512800142169,
"latest_lm_loss": 0.9022582173347473,
"learning_rate": 1.2688687906392772e-07,
"loss": 0.6732,
"step": 1159
},
{
"epoch": 0.9508622953129303,
"grad_norm": 0.9705935393989046,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 0.2375027984380722,
"learning_rate": 1.2270116172673818e-07,
"loss": 0.6658,
"step": 1160
},
{
"epoch": 0.9516820041882,
"grad_norm": 1.0746487714819126,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 1.1714025735855103,
"learning_rate": 1.1858521985307126e-07,
"loss": 0.6641,
"step": 1161
},
{
"epoch": 0.9525017130634698,
"grad_norm": 0.8897494314587888,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 0.10726118087768555,
"learning_rate": 1.1453908251886636e-07,
"loss": 0.7123,
"step": 1162
},
{
"epoch": 0.9533214219387396,
"grad_norm": 1.3678314656268515,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.4614104926586151,
"learning_rate": 1.105627783069485e-07,
"loss": 0.6938,
"step": 1163
},
{
"epoch": 0.9541411308140093,
"grad_norm": 1.17640124821323,
"latest_boundary_loss": 0.007210625801235437,
"latest_lm_loss": 0.6621823906898499,
"learning_rate": 1.0665633530682618e-07,
"loss": 0.655,
"step": 1164
},
{
"epoch": 0.9549608396892791,
"grad_norm": 1.0373070064735386,
"latest_boundary_loss": 0.0077290004119277,
"latest_lm_loss": 0.3197590410709381,
"learning_rate": 1.0281978111449375e-07,
"loss": 0.7092,
"step": 1165
},
{
"epoch": 0.9557805485645489,
"grad_norm": 0.8863840478937884,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.0001209241381729953,
"learning_rate": 9.905314283223166e-08,
"loss": 0.7096,
"step": 1166
},
{
"epoch": 0.9566002574398187,
"grad_norm": 0.8996412393018711,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.8527716994285583,
"learning_rate": 9.535644706842318e-08,
"loss": 0.6852,
"step": 1167
},
{
"epoch": 0.9574199663150884,
"grad_norm": 0.9265852938058231,
"latest_boundary_loss": 0.0060293409042060375,
"latest_lm_loss": 0.762462854385376,
"learning_rate": 9.172971993735902e-08,
"loss": 0.6965,
"step": 1168
},
{
"epoch": 0.9582396751903581,
"grad_norm": 0.890612727837806,
"latest_boundary_loss": 0.006077660713344812,
"latest_lm_loss": 0.7109687924385071,
"learning_rate": 8.817298705905642e-08,
"loss": 0.6719,
"step": 1169
},
{
"epoch": 0.959059384065628,
"grad_norm": 0.9727157109292386,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.47297853231430054,
"learning_rate": 8.468627355907811e-08,
"loss": 0.6655,
"step": 1170
},
{
"epoch": 0.9598790929408977,
"grad_norm": 0.8230170305748943,
"latest_boundary_loss": 0.007701873779296875,
"latest_lm_loss": 0.808647096157074,
"learning_rate": 8.12696040683525e-08,
"loss": 0.6852,
"step": 1171
},
{
"epoch": 0.9606988018161675,
"grad_norm": 0.9320553097259945,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.16965647041797638,
"learning_rate": 7.792300272300268e-08,
"loss": 0.6951,
"step": 1172
},
{
"epoch": 0.9615185106914372,
"grad_norm": 0.9945696940159273,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 1.4004206657409668,
"learning_rate": 7.464649316417438e-08,
"loss": 0.6921,
"step": 1173
},
{
"epoch": 0.9623382195667071,
"grad_norm": 1.0546950021534516,
"latest_boundary_loss": 0.006991492584347725,
"latest_lm_loss": 0.698226809501648,
"learning_rate": 7.144009853786826e-08,
"loss": 0.6793,
"step": 1174
},
{
"epoch": 0.9631579284419768,
"grad_norm": 1.120323087414765,
"latest_boundary_loss": 0.00566058699041605,
"latest_lm_loss": 0.8183578848838806,
"learning_rate": 6.830384149478009e-08,
"loss": 0.6763,
"step": 1175
},
{
"epoch": 0.9639776373172465,
"grad_norm": 0.8765310892052712,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 1.318392038345337,
"learning_rate": 6.523774419013418e-08,
"loss": 0.6342,
"step": 1176
},
{
"epoch": 0.9647973461925163,
"grad_norm": 1.126438962440406,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 0.07761969417333603,
"learning_rate": 6.224182828353243e-08,
"loss": 0.7358,
"step": 1177
},
{
"epoch": 0.9656170550677861,
"grad_norm": 1.1099094935854124,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.969371497631073,
"learning_rate": 5.9316114938801076e-08,
"loss": 0.7111,
"step": 1178
},
{
"epoch": 0.9664367639430559,
"grad_norm": 1.0324488728855972,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.33742189407348633,
"learning_rate": 5.6460624823836405e-08,
"loss": 0.6906,
"step": 1179
},
{
"epoch": 0.9672564728183256,
"grad_norm": 0.9189827829789549,
"latest_boundary_loss": 0.0058042737655341625,
"latest_lm_loss": 2.154536485671997,
"learning_rate": 5.367537811046486e-08,
"loss": 0.7172,
"step": 1180
},
{
"epoch": 0.9680761816935954,
"grad_norm": 1.0206041012891969,
"latest_boundary_loss": 0.005970849189907312,
"latest_lm_loss": 1.0656417608261108,
"learning_rate": 5.096039447429535e-08,
"loss": 0.7161,
"step": 1181
},
{
"epoch": 0.9688958905688652,
"grad_norm": 1.2396346636276663,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.46780502796173096,
"learning_rate": 4.8315693094584945e-08,
"loss": 0.66,
"step": 1182
},
{
"epoch": 0.9697155994441349,
"grad_norm": 0.9936835694223108,
"latest_boundary_loss": 0.006434546783566475,
"latest_lm_loss": 0.9413383603096008,
"learning_rate": 4.57412926541001e-08,
"loss": 0.6781,
"step": 1183
},
{
"epoch": 0.9705353083194047,
"grad_norm": 0.9083977418455209,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.19331450760364532,
"learning_rate": 4.3237211338983396e-08,
"loss": 0.7134,
"step": 1184
},
{
"epoch": 0.9713550171946744,
"grad_norm": 0.9592795880182838,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.39722156524658203,
"learning_rate": 4.0803466838631454e-08,
"loss": 0.6747,
"step": 1185
},
{
"epoch": 0.9721747260699443,
"grad_norm": 0.9714053771381248,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 1.228805422782898,
"learning_rate": 3.8440076345561685e-08,
"loss": 0.7209,
"step": 1186
},
{
"epoch": 0.972994434945214,
"grad_norm": 0.921771241053584,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.7271464467048645,
"learning_rate": 3.6147056555296825e-08,
"loss": 0.6479,
"step": 1187
},
{
"epoch": 0.9738141438204837,
"grad_norm": 0.8660434095816893,
"latest_boundary_loss": 0.005879296455532312,
"latest_lm_loss": 0.5803873538970947,
"learning_rate": 3.392442366624615e-08,
"loss": 0.6916,
"step": 1188
},
{
"epoch": 0.9746338526957535,
"grad_norm": 0.9325181346039524,
"latest_boundary_loss": 0.006603240966796875,
"latest_lm_loss": 1.1471364498138428,
"learning_rate": 3.177219337958892e-08,
"loss": 0.6886,
"step": 1189
},
{
"epoch": 0.9754535615710233,
"grad_norm": 0.9683508984966774,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 0.00031163747189566493,
"learning_rate": 2.969038089916443e-08,
"loss": 0.6776,
"step": 1190
},
{
"epoch": 0.9762732704462931,
"grad_norm": 0.9746965577670207,
"latest_boundary_loss": 0.006282806396484375,
"latest_lm_loss": 1.1629018783569336,
"learning_rate": 2.767900093136544e-08,
"loss": 0.704,
"step": 1191
},
{
"epoch": 0.9770929793215628,
"grad_norm": 0.8719433107953927,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 1.1448140144348145,
"learning_rate": 2.573806768503162e-08,
"loss": 0.6693,
"step": 1192
},
{
"epoch": 0.9779126881968326,
"grad_norm": 1.065548685113908,
"latest_boundary_loss": 0.00684271939098835,
"latest_lm_loss": 1.1891309022903442,
"learning_rate": 2.386759487135293e-08,
"loss": 0.7103,
"step": 1193
},
{
"epoch": 0.9787323970721024,
"grad_norm": 0.963162500260635,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 0.4785090982913971,
"learning_rate": 2.206759570377193e-08,
"loss": 0.7191,
"step": 1194
},
{
"epoch": 0.9795521059473721,
"grad_norm": 1.0323228800970756,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.3327829837799072,
"learning_rate": 2.033808289788608e-08,
"loss": 0.7207,
"step": 1195
},
{
"epoch": 0.9803718148226419,
"grad_norm": 0.9321536596384047,
"latest_boundary_loss": 0.0058424207381904125,
"latest_lm_loss": 0.523434042930603,
"learning_rate": 1.8679068671364488e-08,
"loss": 0.6892,
"step": 1196
},
{
"epoch": 0.9811915236979116,
"grad_norm": 0.8815339123981941,
"latest_boundary_loss": 0.009594811126589775,
"latest_lm_loss": 1.6022361516952515,
"learning_rate": 1.7090564743857952e-08,
"loss": 0.7141,
"step": 1197
},
{
"epoch": 0.9820112325731815,
"grad_norm": 0.9588968707980078,
"latest_boundary_loss": 0.00704108364880085,
"latest_lm_loss": 0.6818172335624695,
"learning_rate": 1.557258233691572e-08,
"loss": 0.6641,
"step": 1198
},
{
"epoch": 0.9828309414484512,
"grad_norm": 0.8965615654269011,
"latest_boundary_loss": 0.0082622105255723,
"latest_lm_loss": 1.3347175121307373,
"learning_rate": 1.4125132173905542e-08,
"loss": 0.6756,
"step": 1199
},
{
"epoch": 0.983650650323721,
"grad_norm": 0.8716820353963431,
"latest_boundary_loss": 0.0057004294358193874,
"latest_lm_loss": 8.92801399459131e-05,
"learning_rate": 1.2748224479943727e-08,
"loss": 0.7151,
"step": 1200
},
{
"epoch": 0.9844703591989907,
"grad_norm": 1.2219211098964566,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 1.1162246465682983,
"learning_rate": 1.1441868981815207e-08,
"loss": 0.6877,
"step": 1201
},
{
"epoch": 0.9852900680742605,
"grad_norm": 0.9015750621516523,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.279168039560318,
"learning_rate": 1.0206074907909147e-08,
"loss": 0.6922,
"step": 1202
},
{
"epoch": 0.9861097769495303,
"grad_norm": 0.9373603261718022,
"latest_boundary_loss": 0.006199306808412075,
"latest_lm_loss": 1.2174696922302246,
"learning_rate": 9.040850988153437e-09,
"loss": 0.695,
"step": 1203
},
{
"epoch": 0.9869294858248,
"grad_norm": 0.9617940871081109,
"latest_boundary_loss": 0.00725555419921875,
"latest_lm_loss": 0.4450468122959137,
"learning_rate": 7.946205453953638e-09,
"loss": 0.6393,
"step": 1204
},
{
"epoch": 0.9877491947000698,
"grad_norm": 0.8399195599066075,
"latest_boundary_loss": 0.0061480202712118626,
"latest_lm_loss": 1.4880940914154053,
"learning_rate": 6.9221460381296845e-09,
"loss": 0.6631,
"step": 1205
},
{
"epoch": 0.9885689035753396,
"grad_norm": 0.9265625256512428,
"latest_boundary_loss": 0.0059276157990098,
"latest_lm_loss": 1.0487496852874756,
"learning_rate": 5.968679974870384e-09,
"loss": 0.6829,
"step": 1206
},
{
"epoch": 0.9893886124506094,
"grad_norm": 0.8043483109177013,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 1.7094249725341797,
"learning_rate": 5.08581399967345e-09,
"loss": 0.6843,
"step": 1207
},
{
"epoch": 0.9902083213258791,
"grad_norm": 0.8679269589207061,
"latest_boundary_loss": 0.005672454833984375,
"latest_lm_loss": 0.8320218324661255,
"learning_rate": 4.273554349303321e-09,
"loss": 0.6532,
"step": 1208
},
{
"epoch": 0.9910280302011488,
"grad_norm": 1.1488104222577598,
"latest_boundary_loss": 0.0079731410369277,
"latest_lm_loss": 1.1925472021102905,
"learning_rate": 3.5319067617445302e-09,
"loss": 0.6659,
"step": 1209
},
{
"epoch": 0.9918477390764187,
"grad_norm": 0.8415963783882109,
"latest_boundary_loss": 0.0064904955215752125,
"latest_lm_loss": 0.45819953083992004,
"learning_rate": 2.8608764761639542e-09,
"loss": 0.683,
"step": 1210
},
{
"epoch": 0.9926674479516884,
"grad_norm": 0.8306015065243869,
"latest_boundary_loss": 0.0056843226775527,
"latest_lm_loss": 0.113001748919487,
"learning_rate": 2.2604682328697393e-09,
"loss": 0.6541,
"step": 1211
},
{
"epoch": 0.9934871568269582,
"grad_norm": 1.1308654053245843,
"latest_boundary_loss": 0.0066587659530341625,
"latest_lm_loss": 0.1812564730644226,
"learning_rate": 1.7306862732813234e-09,
"loss": 0.7132,
"step": 1212
},
{
"epoch": 0.9943068657022279,
"grad_norm": 1.2160776786481124,
"latest_boundary_loss": 0.005664825439453125,
"latest_lm_loss": 3.743060733540915e-05,
"learning_rate": 1.2715343398972401e-09,
"loss": 0.669,
"step": 1213
},
{
"epoch": 0.9951265745774978,
"grad_norm": 0.9152975333346773,
"latest_boundary_loss": 0.0057445103302598,
"latest_lm_loss": 0.69028639793396,
"learning_rate": 8.830156762706932e-10,
"loss": 0.7089,
"step": 1214
},
{
"epoch": 0.9959462834527675,
"grad_norm": 1.0594461330043325,
"latest_boundary_loss": 0.006337060127407312,
"latest_lm_loss": 0.5989055633544922,
"learning_rate": 5.651330269840216e-10,
"loss": 0.7259,
"step": 1215
}
],
"logging_steps": 1.0,
"max_steps": 1219,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 15,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 8737604084170752.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}