{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9959462834527675, "eval_steps": 500, "global_step": 1215, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0008197088752697675, "grad_norm": 31.25939821656355, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 5.3177666664123535, "learning_rate": 5.405405405405406e-07, "loss": 1.8609, "step": 1 }, { "epoch": 0.001639417750539535, "grad_norm": 28.575098245458886, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 2.1312272548675537, "learning_rate": 1.0810810810810812e-06, "loss": 1.7546, "step": 2 }, { "epoch": 0.0024591266258093022, "grad_norm": 35.302910540538655, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.8120243549346924, "learning_rate": 1.6216216216216219e-06, "loss": 1.9104, "step": 3 }, { "epoch": 0.00327883550107907, "grad_norm": 28.634039822476534, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.312492847442627, "learning_rate": 2.1621621621621623e-06, "loss": 1.8445, "step": 4 }, { "epoch": 0.0040985443763488375, "grad_norm": 25.357485404982537, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.3623862266540527, "learning_rate": 2.702702702702703e-06, "loss": 1.6938, "step": 5 }, { "epoch": 0.0049182532516186045, "grad_norm": 19.5662850755774, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 1.245206356048584, "learning_rate": 3.2432432432432437e-06, "loss": 1.6152, "step": 6 }, { "epoch": 0.005737962126888372, "grad_norm": 9.137300779870639, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.8372451663017273, "learning_rate": 3.7837837837837844e-06, "loss": 1.3146, "step": 7 }, { "epoch": 0.00655767100215814, "grad_norm": 7.791104350630075, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 2.1447579860687256, "learning_rate": 4.324324324324325e-06, "loss": 1.299, "step": 8 }, { "epoch": 0.007377379877427907, "grad_norm": 5.541357588032241, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.24441809952259064, "learning_rate": 4.864864864864866e-06, "loss": 1.2754, "step": 9 }, { "epoch": 0.008197088752697675, "grad_norm": 4.13393577088879, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.197355031967163, "learning_rate": 5.405405405405406e-06, "loss": 1.1651, "step": 10 }, { "epoch": 0.009016797627967442, "grad_norm": 3.676833401499189, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 3.709336996078491, "learning_rate": 5.945945945945947e-06, "loss": 1.1987, "step": 11 }, { "epoch": 0.009836506503237209, "grad_norm": 3.5497626147579258, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.4290322065353394, "learning_rate": 6.486486486486487e-06, "loss": 1.1451, "step": 12 }, { "epoch": 0.010656215378506978, "grad_norm": 3.399775349461851, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.176706314086914, "learning_rate": 7.027027027027028e-06, "loss": 1.0625, "step": 13 }, { "epoch": 0.011475924253776745, "grad_norm": 3.3339546887964984, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.5657956004142761, "learning_rate": 7.567567567567569e-06, "loss": 1.1174, "step": 14 }, { "epoch": 0.012295633129046512, "grad_norm": 4.256309321290241, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.1778795719146729, "learning_rate": 8.108108108108109e-06, "loss": 1.0536, "step": 15 }, { "epoch": 0.01311534200431628, "grad_norm": 3.802125705375291, "latest_boundary_loss": 0.008855608291924, "latest_lm_loss": 1.082108736038208, "learning_rate": 8.64864864864865e-06, "loss": 1.0681, "step": 16 }, { "epoch": 0.013935050879586047, "grad_norm": 2.9326206499608105, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.2558324337005615, "learning_rate": 9.189189189189191e-06, "loss": 1.0765, "step": 17 }, { "epoch": 0.014754759754855814, "grad_norm": 3.6165711212099407, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.24362049996852875, "learning_rate": 9.729729729729732e-06, "loss": 1.0516, "step": 18 }, { "epoch": 0.015574468630125581, "grad_norm": 3.3499866597655554, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.2392970323562622, "learning_rate": 1.027027027027027e-05, "loss": 1.0974, "step": 19 }, { "epoch": 0.01639417750539535, "grad_norm": 2.579933987298249, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 1.0953041315078735, "learning_rate": 1.0810810810810812e-05, "loss": 0.9487, "step": 20 }, { "epoch": 0.017213886380665115, "grad_norm": 2.3483221873953597, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.6745284795761108, "learning_rate": 1.1351351351351352e-05, "loss": 0.993, "step": 21 }, { "epoch": 0.018033595255934884, "grad_norm": 3.742831275610467, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.16304448246955872, "learning_rate": 1.1891891891891894e-05, "loss": 1.024, "step": 22 }, { "epoch": 0.018853304131204653, "grad_norm": 2.5090421699555763, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.8424432873725891, "learning_rate": 1.2432432432432433e-05, "loss": 0.9253, "step": 23 }, { "epoch": 0.019673013006474418, "grad_norm": 2.000757438596482, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.4152683913707733, "learning_rate": 1.2972972972972975e-05, "loss": 0.9311, "step": 24 }, { "epoch": 0.020492721881744187, "grad_norm": 1.979442548882158, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 0.9323436617851257, "learning_rate": 1.3513513513513515e-05, "loss": 0.9326, "step": 25 }, { "epoch": 0.021312430757013955, "grad_norm": 1.7448079878118872, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.6967086791992188, "learning_rate": 1.4054054054054055e-05, "loss": 0.8942, "step": 26 }, { "epoch": 0.02213213963228372, "grad_norm": 2.435272259451533, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.3207102119922638, "learning_rate": 1.4594594594594596e-05, "loss": 0.9435, "step": 27 }, { "epoch": 0.02295184850755349, "grad_norm": 1.6929753203488551, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.8046767711639404, "learning_rate": 1.5135135135135138e-05, "loss": 0.9388, "step": 28 }, { "epoch": 0.023771557382823258, "grad_norm": 2.262187294853859, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.7773157954216003, "learning_rate": 1.5675675675675676e-05, "loss": 0.949, "step": 29 }, { "epoch": 0.024591266258093023, "grad_norm": 2.186886822212014, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 1.2209771871566772, "learning_rate": 1.6216216216216218e-05, "loss": 0.9025, "step": 30 }, { "epoch": 0.025410975133362792, "grad_norm": 2.0485773861717824, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.9707640409469604, "learning_rate": 1.6756756756756757e-05, "loss": 0.9158, "step": 31 }, { "epoch": 0.02623068400863256, "grad_norm": 1.9242556720903616, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.8456425666809082, "learning_rate": 1.72972972972973e-05, "loss": 0.9234, "step": 32 }, { "epoch": 0.027050392883902326, "grad_norm": 1.8817845177661898, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.0457288026809692, "learning_rate": 1.783783783783784e-05, "loss": 0.9023, "step": 33 }, { "epoch": 0.027870101759172095, "grad_norm": 1.5974806786235274, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.6266984343528748, "learning_rate": 1.8378378378378383e-05, "loss": 0.8629, "step": 34 }, { "epoch": 0.02868981063444186, "grad_norm": 1.663888629403112, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.7136289477348328, "learning_rate": 1.891891891891892e-05, "loss": 0.8917, "step": 35 }, { "epoch": 0.02950951950971163, "grad_norm": 1.7872923233559073, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 1.230485439300537, "learning_rate": 1.9459459459459463e-05, "loss": 0.8635, "step": 36 }, { "epoch": 0.030329228384981397, "grad_norm": 1.6877007594211078, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.8077595829963684, "learning_rate": 2e-05, "loss": 0.9108, "step": 37 }, { "epoch": 0.031148937260251162, "grad_norm": 1.6829630317279687, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 1.4435068368911743, "learning_rate": 1.999996467887392e-05, "loss": 0.8874, "step": 38 }, { "epoch": 0.03196864613552093, "grad_norm": 1.359279741218244, "latest_boundary_loss": 0.00950749684125185, "latest_lm_loss": 1.0019148588180542, "learning_rate": 1.9999858715745195e-05, "loss": 0.8813, "step": 39 }, { "epoch": 0.0327883550107907, "grad_norm": 1.4864524626512068, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.6017656326293945, "learning_rate": 1.9999682111362368e-05, "loss": 0.8822, "step": 40 }, { "epoch": 0.03360806388606047, "grad_norm": 1.479905474829296, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.1819598376750946, "learning_rate": 1.9999434866973018e-05, "loss": 0.8409, "step": 41 }, { "epoch": 0.03442777276133023, "grad_norm": 1.3212003159470103, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.8792177438735962, "learning_rate": 1.999911698432373e-05, "loss": 0.8811, "step": 42 }, { "epoch": 0.0352474816366, "grad_norm": 1.6960213223283769, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.533574104309082, "learning_rate": 1.9998728465660105e-05, "loss": 0.8558, "step": 43 }, { "epoch": 0.03606719051186977, "grad_norm": 1.893518679098996, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.093450903892517, "learning_rate": 1.9998269313726722e-05, "loss": 0.8378, "step": 44 }, { "epoch": 0.036886899387139536, "grad_norm": 1.6735007412782994, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.6832482814788818, "learning_rate": 1.9997739531767132e-05, "loss": 0.8519, "step": 45 }, { "epoch": 0.037706608262409305, "grad_norm": 1.6683964829519897, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.16073894500732422, "learning_rate": 1.999713912352384e-05, "loss": 0.8909, "step": 46 }, { "epoch": 0.038526317137679074, "grad_norm": 2.5769564730458474, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.9443431496620178, "learning_rate": 1.9996468093238256e-05, "loss": 0.8974, "step": 47 }, { "epoch": 0.039346026012948836, "grad_norm": 1.8967485674092166, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.8494566679000854, "learning_rate": 1.9995726445650698e-05, "loss": 0.8073, "step": 48 }, { "epoch": 0.040165734888218604, "grad_norm": 1.723435229634082, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.097643256187439, "learning_rate": 1.999491418600033e-05, "loss": 0.8169, "step": 49 }, { "epoch": 0.04098544376348837, "grad_norm": 1.527105240205358, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.4146791100502014, "learning_rate": 1.999403132002513e-05, "loss": 0.8518, "step": 50 }, { "epoch": 0.04180515263875814, "grad_norm": 1.7320637245358526, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.7017815113067627, "learning_rate": 1.9993077853961874e-05, "loss": 0.8732, "step": 51 }, { "epoch": 0.04262486151402791, "grad_norm": 1.6051506326311777, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 1.407310962677002, "learning_rate": 1.999205379454605e-05, "loss": 0.825, "step": 52 }, { "epoch": 0.04344457038929768, "grad_norm": 1.7925669800476414, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.4606729745864868, "learning_rate": 1.999095914901185e-05, "loss": 0.8772, "step": 53 }, { "epoch": 0.04426427926456744, "grad_norm": 1.542186786745815, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 1.0994019508361816, "learning_rate": 1.9989793925092092e-05, "loss": 0.8293, "step": 54 }, { "epoch": 0.04508398813983721, "grad_norm": 1.7025691062836932, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.1215992271900177, "learning_rate": 1.9988558131018188e-05, "loss": 0.8448, "step": 55 }, { "epoch": 0.04590369701510698, "grad_norm": 1.856626517805509, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 1.604791283607483, "learning_rate": 1.9987251775520056e-05, "loss": 0.8889, "step": 56 }, { "epoch": 0.04672340589037675, "grad_norm": 1.591130439600799, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 1.3882758617401123, "learning_rate": 1.9985874867826095e-05, "loss": 0.8284, "step": 57 }, { "epoch": 0.047543114765646516, "grad_norm": 1.5457923397878055, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.8114826679229736, "learning_rate": 1.9984427417663085e-05, "loss": 0.8869, "step": 58 }, { "epoch": 0.04836282364091628, "grad_norm": 1.541201561325913, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.12212160974740982, "learning_rate": 1.9982909435256143e-05, "loss": 0.8339, "step": 59 }, { "epoch": 0.049182532516186046, "grad_norm": 1.4132981100343078, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.1693421602249146, "learning_rate": 1.998132093132864e-05, "loss": 0.838, "step": 60 }, { "epoch": 0.050002241391455815, "grad_norm": 1.5914305063888234, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.5888212323188782, "learning_rate": 1.9979661917102116e-05, "loss": 0.8659, "step": 61 }, { "epoch": 0.050821950266725584, "grad_norm": 2.0348444853470142, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.7901957035064697, "learning_rate": 1.997793240429623e-05, "loss": 0.8222, "step": 62 }, { "epoch": 0.05164165914199535, "grad_norm": 1.392502894520277, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.24341143667697906, "learning_rate": 1.9976132405128646e-05, "loss": 0.8568, "step": 63 }, { "epoch": 0.05246136801726512, "grad_norm": 1.577969202664421, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.6221321821212769, "learning_rate": 1.997426193231497e-05, "loss": 0.8625, "step": 64 }, { "epoch": 0.05328107689253488, "grad_norm": 1.3109183297694251, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.9815806746482849, "learning_rate": 1.9972320999068636e-05, "loss": 0.8322, "step": 65 }, { "epoch": 0.05410078576780465, "grad_norm": 1.3729680816192045, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.8472562432289124, "learning_rate": 1.997030961910084e-05, "loss": 0.8716, "step": 66 }, { "epoch": 0.05492049464307442, "grad_norm": 1.326944200238791, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.06413651257753372, "learning_rate": 1.9968227806620413e-05, "loss": 0.8405, "step": 67 }, { "epoch": 0.05574020351834419, "grad_norm": 1.4117021923200894, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.19976989924907684, "learning_rate": 1.9966075576333757e-05, "loss": 0.8341, "step": 68 }, { "epoch": 0.05655991239361396, "grad_norm": 1.3361285723526664, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.8418336510658264, "learning_rate": 1.9963852943444703e-05, "loss": 0.8589, "step": 69 }, { "epoch": 0.05737962126888372, "grad_norm": 1.3912245618801216, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 1.5732471942901611, "learning_rate": 1.996155992365444e-05, "loss": 0.8336, "step": 70 }, { "epoch": 0.05819933014415349, "grad_norm": 1.2070062463674183, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.08601975440979, "learning_rate": 1.995919653316137e-05, "loss": 0.824, "step": 71 }, { "epoch": 0.05901903901942326, "grad_norm": 1.335040611105836, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.36412352323532104, "learning_rate": 1.9956762788661018e-05, "loss": 0.8422, "step": 72 }, { "epoch": 0.059838747894693026, "grad_norm": 1.5185495432497875, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.6155502796173096, "learning_rate": 1.9954258707345903e-05, "loss": 0.8407, "step": 73 }, { "epoch": 0.060658456769962794, "grad_norm": 1.6209437176668773, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 0.1864786297082901, "learning_rate": 1.9951684306905418e-05, "loss": 0.812, "step": 74 }, { "epoch": 0.06147816564523256, "grad_norm": 1.753377664055131, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.1503336429595947, "learning_rate": 1.9949039605525705e-05, "loss": 0.8336, "step": 75 }, { "epoch": 0.062297874520502325, "grad_norm": 1.6748790683626724, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.797813355922699, "learning_rate": 1.9946324621889538e-05, "loss": 0.8622, "step": 76 }, { "epoch": 0.0631175833957721, "grad_norm": 1.9786701343389177, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 2.8772706985473633, "learning_rate": 1.9943539375176164e-05, "loss": 0.8606, "step": 77 }, { "epoch": 0.06393729227104186, "grad_norm": 1.5328107519412169, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.7567794322967529, "learning_rate": 1.99406838850612e-05, "loss": 0.8126, "step": 78 }, { "epoch": 0.06475700114631162, "grad_norm": 1.3299731535201258, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.5706217885017395, "learning_rate": 1.9937758171716468e-05, "loss": 0.8319, "step": 79 }, { "epoch": 0.0655767100215814, "grad_norm": 1.2826156775428696, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.2339491844177246, "learning_rate": 1.9934762255809866e-05, "loss": 0.8338, "step": 80 }, { "epoch": 0.06639641889685116, "grad_norm": 1.4135853186885827, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.7502679824829102, "learning_rate": 1.993169615850522e-05, "loss": 0.8451, "step": 81 }, { "epoch": 0.06721612777212094, "grad_norm": 1.2531079580151232, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.3107645511627197, "learning_rate": 1.992855990146213e-05, "loss": 0.8384, "step": 82 }, { "epoch": 0.0680358366473907, "grad_norm": 1.354109570277206, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 1.231244444847107, "learning_rate": 1.9925353506835827e-05, "loss": 0.8114, "step": 83 }, { "epoch": 0.06885554552266046, "grad_norm": 1.3749557401519394, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.03806804493069649, "learning_rate": 1.9922076997277e-05, "loss": 0.7859, "step": 84 }, { "epoch": 0.06967525439793024, "grad_norm": 1.168799411174339, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.8500906825065613, "learning_rate": 1.9918730395931648e-05, "loss": 0.8345, "step": 85 }, { "epoch": 0.0704949632732, "grad_norm": 1.3061603459526208, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 1.041812777519226, "learning_rate": 1.9915313726440922e-05, "loss": 0.7831, "step": 86 }, { "epoch": 0.07131467214846977, "grad_norm": 1.3404561638385657, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.0997252464294434, "learning_rate": 1.9911827012940944e-05, "loss": 0.8322, "step": 87 }, { "epoch": 0.07213438102373954, "grad_norm": 1.4760469180002984, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.5108449459075928, "learning_rate": 1.9908270280062643e-05, "loss": 0.8312, "step": 88 }, { "epoch": 0.07295408989900931, "grad_norm": 1.2326348475146698, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.5451737642288208, "learning_rate": 1.9904643552931578e-05, "loss": 0.8038, "step": 89 }, { "epoch": 0.07377379877427907, "grad_norm": 1.512380507544568, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.2299585342407227, "learning_rate": 1.9900946857167768e-05, "loss": 0.8376, "step": 90 }, { "epoch": 0.07459350764954883, "grad_norm": 1.5911836381997428, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.9883151650428772, "learning_rate": 1.989718021888551e-05, "loss": 0.8157, "step": 91 }, { "epoch": 0.07541321652481861, "grad_norm": 1.3978617102980668, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.06017254665493965, "learning_rate": 1.9893343664693177e-05, "loss": 0.813, "step": 92 }, { "epoch": 0.07623292540008837, "grad_norm": 1.7501747935459977, "latest_boundary_loss": 0.008892906829714775, "latest_lm_loss": 0.500453531742096, "learning_rate": 1.9889437221693053e-05, "loss": 0.8051, "step": 93 }, { "epoch": 0.07705263427535815, "grad_norm": 1.6714122227195018, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.3647129237651825, "learning_rate": 1.9885460917481137e-05, "loss": 0.8456, "step": 94 }, { "epoch": 0.07787234315062791, "grad_norm": 1.41809490894225, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.3116203844547272, "learning_rate": 1.988141478014693e-05, "loss": 0.7709, "step": 95 }, { "epoch": 0.07869205202589767, "grad_norm": 1.31508854311171, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.0869554281234741, "learning_rate": 1.9877298838273263e-05, "loss": 0.8036, "step": 96 }, { "epoch": 0.07951176090116745, "grad_norm": 1.501736998971986, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.3767385482788086, "learning_rate": 1.9873113120936074e-05, "loss": 0.8341, "step": 97 }, { "epoch": 0.08033146977643721, "grad_norm": 1.3950892005942184, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.016499334946274757, "learning_rate": 1.9868857657704215e-05, "loss": 0.8035, "step": 98 }, { "epoch": 0.08115117865170698, "grad_norm": 1.4412103297682761, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.016377875581383705, "learning_rate": 1.9864532478639233e-05, "loss": 0.8269, "step": 99 }, { "epoch": 0.08197088752697675, "grad_norm": 1.5089601922926945, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 1.6621798276901245, "learning_rate": 1.986013761429517e-05, "loss": 0.8461, "step": 100 }, { "epoch": 0.08279059640224651, "grad_norm": 1.324715924071776, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.30458226799964905, "learning_rate": 1.9855673095718338e-05, "loss": 0.8137, "step": 101 }, { "epoch": 0.08361030527751628, "grad_norm": 1.2953067712761148, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.3760262429714203, "learning_rate": 1.9851138954447097e-05, "loss": 0.778, "step": 102 }, { "epoch": 0.08443001415278605, "grad_norm": 1.3734209998446478, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.1049243211746216, "learning_rate": 1.9846535222511648e-05, "loss": 0.8102, "step": 103 }, { "epoch": 0.08524972302805582, "grad_norm": 1.604522971243853, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.5241772532463074, "learning_rate": 1.9841861932433784e-05, "loss": 0.8374, "step": 104 }, { "epoch": 0.08606943190332558, "grad_norm": 1.442726344196342, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.30671101808547974, "learning_rate": 1.983711911722669e-05, "loss": 0.8281, "step": 105 }, { "epoch": 0.08688914077859536, "grad_norm": 1.4082398184230607, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.5678154826164246, "learning_rate": 1.9832306810394665e-05, "loss": 0.8182, "step": 106 }, { "epoch": 0.08770884965386512, "grad_norm": 1.355781738267841, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.4872472286224365, "learning_rate": 1.982742504593294e-05, "loss": 0.8042, "step": 107 }, { "epoch": 0.08852855852913488, "grad_norm": 1.4865717290375031, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.3586854934692383, "learning_rate": 1.9822473858327398e-05, "loss": 0.8437, "step": 108 }, { "epoch": 0.08934826740440466, "grad_norm": 1.4691066939447524, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.4806958436965942, "learning_rate": 1.9817453282554334e-05, "loss": 0.7852, "step": 109 }, { "epoch": 0.09016797627967442, "grad_norm": 1.45975271876467, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.8888470530509949, "learning_rate": 1.981236335408024e-05, "loss": 0.7873, "step": 110 }, { "epoch": 0.0909876851549442, "grad_norm": 1.281147688908112, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.313239336013794, "learning_rate": 1.98072041088615e-05, "loss": 0.7808, "step": 111 }, { "epoch": 0.09180739403021396, "grad_norm": 1.318499180510118, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 2.2904205322265625, "learning_rate": 1.98019755833442e-05, "loss": 0.7919, "step": 112 }, { "epoch": 0.09262710290548372, "grad_norm": 1.6514661553574286, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.8095091581344604, "learning_rate": 1.9796677814463812e-05, "loss": 0.8265, "step": 113 }, { "epoch": 0.0934468117807535, "grad_norm": 1.8210817232718945, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.8364806175231934, "learning_rate": 1.9791310839644976e-05, "loss": 0.8028, "step": 114 }, { "epoch": 0.09426652065602326, "grad_norm": 1.47686559845631, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.9318500757217407, "learning_rate": 1.97858746968012e-05, "loss": 0.8062, "step": 115 }, { "epoch": 0.09508622953129303, "grad_norm": 1.4067181377712976, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.295626163482666, "learning_rate": 1.9780369424334633e-05, "loss": 0.8803, "step": 116 }, { "epoch": 0.0959059384065628, "grad_norm": 1.3059938126958721, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 2.0480308532714844, "learning_rate": 1.9774795061135754e-05, "loss": 0.7943, "step": 117 }, { "epoch": 0.09672564728183256, "grad_norm": 1.2711365297039934, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.22573624551296234, "learning_rate": 1.9769151646583122e-05, "loss": 0.7814, "step": 118 }, { "epoch": 0.09754535615710233, "grad_norm": 1.233652041377698, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 2.7930972576141357, "learning_rate": 1.9763439220543084e-05, "loss": 0.8613, "step": 119 }, { "epoch": 0.09836506503237209, "grad_norm": 1.5933606736697221, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.2256191968917847, "learning_rate": 1.9757657823369508e-05, "loss": 0.8075, "step": 120 }, { "epoch": 0.09918477390764187, "grad_norm": 1.2976777727698103, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.8939759135246277, "learning_rate": 1.9751807495903484e-05, "loss": 0.8253, "step": 121 }, { "epoch": 0.10000448278291163, "grad_norm": 1.2750278572898648, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.21469955146312714, "learning_rate": 1.9745888279473046e-05, "loss": 0.7551, "step": 122 }, { "epoch": 0.1008241916581814, "grad_norm": 1.2509134298671505, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.0077957212924957275, "learning_rate": 1.973990021589287e-05, "loss": 0.7845, "step": 123 }, { "epoch": 0.10164390053345117, "grad_norm": 1.268455652366057, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.706210196018219, "learning_rate": 1.9733843347463982e-05, "loss": 0.8047, "step": 124 }, { "epoch": 0.10246360940872093, "grad_norm": 1.4520085394026334, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.9769712090492249, "learning_rate": 1.972771771697347e-05, "loss": 0.7846, "step": 125 }, { "epoch": 0.1032833182839907, "grad_norm": 1.5634694062668846, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.24579794704914093, "learning_rate": 1.9721523367694167e-05, "loss": 0.8508, "step": 126 }, { "epoch": 0.10410302715926047, "grad_norm": 1.2388109712914996, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.081803798675537, "learning_rate": 1.971526034338435e-05, "loss": 0.8329, "step": 127 }, { "epoch": 0.10492273603453024, "grad_norm": 1.3056037229518405, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.6683528423309326, "learning_rate": 1.970892868828743e-05, "loss": 0.7809, "step": 128 }, { "epoch": 0.1057424449098, "grad_norm": 1.782112532137919, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.3602246344089508, "learning_rate": 1.9702528447131647e-05, "loss": 0.8308, "step": 129 }, { "epoch": 0.10656215378506977, "grad_norm": 1.2401139307233116, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.41337674856185913, "learning_rate": 1.969605966512975e-05, "loss": 0.8055, "step": 130 }, { "epoch": 0.10738186266033954, "grad_norm": 1.3965251425675373, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.8101109862327576, "learning_rate": 1.9689522387978666e-05, "loss": 0.8056, "step": 131 }, { "epoch": 0.1082015715356093, "grad_norm": 1.234037598026031, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.1053365468978882, "learning_rate": 1.9682916661859197e-05, "loss": 0.8263, "step": 132 }, { "epoch": 0.10902128041087908, "grad_norm": 1.3232513608726915, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.9295740127563477, "learning_rate": 1.967624253343568e-05, "loss": 0.7627, "step": 133 }, { "epoch": 0.10984098928614884, "grad_norm": 1.2432992556335758, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.9913814067840576, "learning_rate": 1.9669500049855657e-05, "loss": 0.8001, "step": 134 }, { "epoch": 0.1106606981614186, "grad_norm": 1.2510923129353873, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.1932474374771118, "learning_rate": 1.9662689258749555e-05, "loss": 0.8653, "step": 135 }, { "epoch": 0.11148040703668838, "grad_norm": 1.3059187604638154, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.39536067843437195, "learning_rate": 1.9655810208230334e-05, "loss": 0.7872, "step": 136 }, { "epoch": 0.11230011591195814, "grad_norm": 1.4628150077307818, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.5164303183555603, "learning_rate": 1.9648862946893158e-05, "loss": 0.7947, "step": 137 }, { "epoch": 0.11311982478722792, "grad_norm": 1.3225046669141658, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.078872561454773, "learning_rate": 1.964184752381504e-05, "loss": 0.7767, "step": 138 }, { "epoch": 0.11393953366249768, "grad_norm": 1.283186605342499, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.31678012013435364, "learning_rate": 1.963476398855452e-05, "loss": 0.805, "step": 139 }, { "epoch": 0.11475924253776744, "grad_norm": 1.3759791913447301, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.2333240807056427, "learning_rate": 1.9627612391151278e-05, "loss": 0.7963, "step": 140 }, { "epoch": 0.11557895141303721, "grad_norm": 1.7957212644518188, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.8966314792633057, "learning_rate": 1.962039278212581e-05, "loss": 0.7893, "step": 141 }, { "epoch": 0.11639866028830698, "grad_norm": 1.527679140455293, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.17992189526557922, "learning_rate": 1.961310521247906e-05, "loss": 0.8149, "step": 142 }, { "epoch": 0.11721836916357675, "grad_norm": 1.7673798049707574, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.29475894570350647, "learning_rate": 1.9605749733692063e-05, "loss": 0.8249, "step": 143 }, { "epoch": 0.11803807803884651, "grad_norm": 1.390298947753657, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.006619862746447325, "learning_rate": 1.9598326397725577e-05, "loss": 0.8184, "step": 144 }, { "epoch": 0.11885778691411629, "grad_norm": 1.1951783112653427, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.7959393262863159, "learning_rate": 1.9590835257019715e-05, "loss": 0.8059, "step": 145 }, { "epoch": 0.11967749578938605, "grad_norm": 1.4330604805001435, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.895522952079773, "learning_rate": 1.958327636449359e-05, "loss": 0.7776, "step": 146 }, { "epoch": 0.12049720466465581, "grad_norm": 1.4516095676857343, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.6711400151252747, "learning_rate": 1.9575649773544914e-05, "loss": 0.835, "step": 147 }, { "epoch": 0.12131691353992559, "grad_norm": 1.2310197777300715, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.7660918831825256, "learning_rate": 1.9567955538049643e-05, "loss": 0.7995, "step": 148 }, { "epoch": 0.12213662241519535, "grad_norm": 1.1784000062336917, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.4787771701812744, "learning_rate": 1.9560193712361597e-05, "loss": 0.794, "step": 149 }, { "epoch": 0.12295633129046513, "grad_norm": 1.1771856624395576, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.8988789319992065, "learning_rate": 1.9552364351312056e-05, "loss": 0.7864, "step": 150 }, { "epoch": 0.12377604016573489, "grad_norm": 1.4997905570411592, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.7451052069664001, "learning_rate": 1.954446751020939e-05, "loss": 0.7937, "step": 151 }, { "epoch": 0.12459574904100465, "grad_norm": 1.5347241887498202, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.7448756694793701, "learning_rate": 1.953650324483866e-05, "loss": 0.8393, "step": 152 }, { "epoch": 0.12541545791627443, "grad_norm": 1.5545586482351346, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.1357725858688354, "learning_rate": 1.9528471611461235e-05, "loss": 0.8164, "step": 153 }, { "epoch": 0.1262351667915442, "grad_norm": 1.514121413011395, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.322968602180481, "learning_rate": 1.952037266681438e-05, "loss": 0.7979, "step": 154 }, { "epoch": 0.12705487566681395, "grad_norm": 1.4339364294796415, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.3763850927352905, "learning_rate": 1.9512206468110863e-05, "loss": 0.8494, "step": 155 }, { "epoch": 0.12787458454208372, "grad_norm": 1.2243463217022583, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.0551897287368774, "learning_rate": 1.9503973073038554e-05, "loss": 0.8084, "step": 156 }, { "epoch": 0.1286942934173535, "grad_norm": 1.243251912546481, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.6112278699874878, "learning_rate": 1.949567253976001e-05, "loss": 0.8101, "step": 157 }, { "epoch": 0.12951400229262325, "grad_norm": 1.0922332306001399, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 1.0528957843780518, "learning_rate": 1.948730492691206e-05, "loss": 0.7769, "step": 158 }, { "epoch": 0.13033371116789302, "grad_norm": 1.3554070374669416, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.48605647683143616, "learning_rate": 1.9478870293605416e-05, "loss": 0.7884, "step": 159 }, { "epoch": 0.1311534200431628, "grad_norm": 1.0967519114780133, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.7012131214141846, "learning_rate": 1.947036869942422e-05, "loss": 0.8133, "step": 160 }, { "epoch": 0.13197312891843258, "grad_norm": 1.335130334150225, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.4529050290584564, "learning_rate": 1.9461800204425653e-05, "loss": 0.7768, "step": 161 }, { "epoch": 0.13279283779370232, "grad_norm": 1.2631026348057708, "latest_boundary_loss": 0.012135399505496025, "latest_lm_loss": 1.148784875869751, "learning_rate": 1.9453164869139488e-05, "loss": 0.9354, "step": 162 }, { "epoch": 0.1336125466689721, "grad_norm": 1.3849521951173502, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.233864426612854, "learning_rate": 1.9444462754567682e-05, "loss": 0.8348, "step": 163 }, { "epoch": 0.13443225554424187, "grad_norm": 1.198858246316789, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 1.5828710794448853, "learning_rate": 1.9435693922183935e-05, "loss": 0.7869, "step": 164 }, { "epoch": 0.13525196441951162, "grad_norm": 1.5339755068577603, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.18437950313091278, "learning_rate": 1.9426858433933248e-05, "loss": 0.7884, "step": 165 }, { "epoch": 0.1360716732947814, "grad_norm": 1.2511009281740075, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.009370694868266582, "learning_rate": 1.94179563522315e-05, "loss": 0.8185, "step": 166 }, { "epoch": 0.13689138217005117, "grad_norm": 1.5474138930481194, "latest_boundary_loss": 0.00950749684125185, "latest_lm_loss": 0.10782361775636673, "learning_rate": 1.9408987739965006e-05, "loss": 0.7846, "step": 167 }, { "epoch": 0.13771109104532092, "grad_norm": 1.552496376319133, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.5321213603019714, "learning_rate": 1.9399952660490057e-05, "loss": 0.7929, "step": 168 }, { "epoch": 0.1385307999205907, "grad_norm": 1.4886973327385027, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.3138216733932495, "learning_rate": 1.9390851177632496e-05, "loss": 0.7828, "step": 169 }, { "epoch": 0.13935050879586047, "grad_norm": 1.3881426165392348, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 1.9412533044815063, "learning_rate": 1.9381683355687245e-05, "loss": 0.783, "step": 170 }, { "epoch": 0.14017021767113025, "grad_norm": 1.2956024415729674, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.1368589699268341, "learning_rate": 1.937244925941786e-05, "loss": 0.823, "step": 171 }, { "epoch": 0.1409899265464, "grad_norm": 1.345620406170132, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.025996984913945198, "learning_rate": 1.9363148954056077e-05, "loss": 0.805, "step": 172 }, { "epoch": 0.14180963542166977, "grad_norm": 1.5176243475613849, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.28225523233413696, "learning_rate": 1.9353782505301352e-05, "loss": 0.7849, "step": 173 }, { "epoch": 0.14262934429693955, "grad_norm": 1.1945873533436033, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.4188506603240967, "learning_rate": 1.9344349979320386e-05, "loss": 0.8088, "step": 174 }, { "epoch": 0.1434490531722093, "grad_norm": 1.1803212549669022, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.8604617118835449, "learning_rate": 1.9334851442746665e-05, "loss": 0.8001, "step": 175 }, { "epoch": 0.14426876204747907, "grad_norm": 1.340857069700188, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.954041063785553, "learning_rate": 1.9325286962679993e-05, "loss": 0.8094, "step": 176 }, { "epoch": 0.14508847092274885, "grad_norm": 1.153467766591727, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.456565797328949, "learning_rate": 1.9315656606686012e-05, "loss": 0.8045, "step": 177 }, { "epoch": 0.14590817979801862, "grad_norm": 1.2917180216805466, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.02715335413813591, "learning_rate": 1.930596044279572e-05, "loss": 0.7763, "step": 178 }, { "epoch": 0.14672788867328837, "grad_norm": 1.165507961880491, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.49818554520606995, "learning_rate": 1.9296198539505013e-05, "loss": 0.7873, "step": 179 }, { "epoch": 0.14754759754855815, "grad_norm": 1.1944293331747575, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.26211249828338623, "learning_rate": 1.9286370965774166e-05, "loss": 0.8055, "step": 180 }, { "epoch": 0.14836730642382792, "grad_norm": 1.1384333258025627, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.254393458366394, "learning_rate": 1.9276477791027374e-05, "loss": 0.7819, "step": 181 }, { "epoch": 0.14918701529909767, "grad_norm": 1.3758061222090787, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.362998604774475, "learning_rate": 1.9266519085152254e-05, "loss": 0.7993, "step": 182 }, { "epoch": 0.15000672417436745, "grad_norm": 1.3983899195914573, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.3058644235134125, "learning_rate": 1.9256494918499348e-05, "loss": 0.8082, "step": 183 }, { "epoch": 0.15082643304963722, "grad_norm": 1.2889670520819139, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.2846766710281372, "learning_rate": 1.9246405361881623e-05, "loss": 0.7732, "step": 184 }, { "epoch": 0.15164614192490697, "grad_norm": 1.4671482285325368, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.6314696073532104, "learning_rate": 1.9236250486573978e-05, "loss": 0.7904, "step": 185 }, { "epoch": 0.15246585080017674, "grad_norm": 1.32764787299484, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.5939447283744812, "learning_rate": 1.9226030364312747e-05, "loss": 0.8092, "step": 186 }, { "epoch": 0.15328555967544652, "grad_norm": 1.2143518967854543, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.4104589521884918, "learning_rate": 1.9215745067295168e-05, "loss": 0.7743, "step": 187 }, { "epoch": 0.1541052685507163, "grad_norm": 1.4447368509297, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.08697956055402756, "learning_rate": 1.92053946681789e-05, "loss": 0.8041, "step": 188 }, { "epoch": 0.15492497742598604, "grad_norm": 1.3652843233917986, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.9079402685165405, "learning_rate": 1.919497924008149e-05, "loss": 0.7686, "step": 189 }, { "epoch": 0.15574468630125582, "grad_norm": 1.4176566593100697, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.951805055141449, "learning_rate": 1.918449885657987e-05, "loss": 0.7422, "step": 190 }, { "epoch": 0.1565643951765256, "grad_norm": 1.3789613780381453, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 2.791360378265381, "learning_rate": 1.917395359170983e-05, "loss": 0.7545, "step": 191 }, { "epoch": 0.15738410405179534, "grad_norm": 1.3024122115001142, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.1578044891357422, "learning_rate": 1.9163343519965494e-05, "loss": 0.7939, "step": 192 }, { "epoch": 0.15820381292706512, "grad_norm": 1.3090638080523762, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.8000185489654541, "learning_rate": 1.91526687162988e-05, "loss": 0.815, "step": 193 }, { "epoch": 0.1590235218023349, "grad_norm": 1.4489255995430732, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.0648865699768066, "learning_rate": 1.914192925611896e-05, "loss": 0.7957, "step": 194 }, { "epoch": 0.15984323067760467, "grad_norm": 1.1217275087391954, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.9026778340339661, "learning_rate": 1.913112521529195e-05, "loss": 0.7983, "step": 195 }, { "epoch": 0.16066293955287442, "grad_norm": 1.2571563535483283, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.15003184974193573, "learning_rate": 1.9120256670139942e-05, "loss": 0.7685, "step": 196 }, { "epoch": 0.1614826484281442, "grad_norm": 1.3256059128164384, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.6254536509513855, "learning_rate": 1.9109323697440782e-05, "loss": 0.774, "step": 197 }, { "epoch": 0.16230235730341397, "grad_norm": 1.0825474686731895, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.0689915418624878, "learning_rate": 1.909832637442746e-05, "loss": 0.7631, "step": 198 }, { "epoch": 0.16312206617868372, "grad_norm": 1.4072844889375942, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.3515931367874146, "learning_rate": 1.9087264778787534e-05, "loss": 0.8286, "step": 199 }, { "epoch": 0.1639417750539535, "grad_norm": 1.2557774248064015, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.8982808589935303, "learning_rate": 1.9076138988662615e-05, "loss": 0.7957, "step": 200 }, { "epoch": 0.16476148392922327, "grad_norm": 1.3182236812904482, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.5166087746620178, "learning_rate": 1.9064949082647785e-05, "loss": 0.7875, "step": 201 }, { "epoch": 0.16558119280449302, "grad_norm": 1.2354520455560227, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.5807197690010071, "learning_rate": 1.9053695139791058e-05, "loss": 0.7756, "step": 202 }, { "epoch": 0.1664009016797628, "grad_norm": 1.213996282836788, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.339682936668396, "learning_rate": 1.904237723959283e-05, "loss": 0.7979, "step": 203 }, { "epoch": 0.16722061055503257, "grad_norm": 1.3463949305586629, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.595446228981018, "learning_rate": 1.903099546200529e-05, "loss": 0.7865, "step": 204 }, { "epoch": 0.16804031943030234, "grad_norm": 1.135824244522318, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.149241328239441, "learning_rate": 1.901954988743188e-05, "loss": 0.7288, "step": 205 }, { "epoch": 0.1688600283055721, "grad_norm": 1.15467724271601, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.32737183570861816, "learning_rate": 1.9008040596726713e-05, "loss": 0.7734, "step": 206 }, { "epoch": 0.16967973718084187, "grad_norm": 1.103881165746411, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 1.1367260217666626, "learning_rate": 1.8996467671194017e-05, "loss": 0.7659, "step": 207 }, { "epoch": 0.17049944605611164, "grad_norm": 1.2094644467914892, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.15180127322673798, "learning_rate": 1.898483119258754e-05, "loss": 0.7898, "step": 208 }, { "epoch": 0.1713191549313814, "grad_norm": 1.1301454667904827, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.21561795473098755, "learning_rate": 1.8973131243109987e-05, "loss": 0.78, "step": 209 }, { "epoch": 0.17213886380665117, "grad_norm": 1.1183014594084255, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.09423837810754776, "learning_rate": 1.896136790541244e-05, "loss": 0.7756, "step": 210 }, { "epoch": 0.17295857268192094, "grad_norm": 1.1670877767689216, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.3362932205200195, "learning_rate": 1.8949541262593764e-05, "loss": 0.7819, "step": 211 }, { "epoch": 0.17377828155719072, "grad_norm": 1.2166553504494542, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.7938234806060791, "learning_rate": 1.8937651398200027e-05, "loss": 0.7934, "step": 212 }, { "epoch": 0.17459799043246046, "grad_norm": 1.3668099053241618, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.1043457984924316, "learning_rate": 1.892569839622391e-05, "loss": 0.7723, "step": 213 }, { "epoch": 0.17541769930773024, "grad_norm": 1.247592744354801, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.1273113340139389, "learning_rate": 1.8913682341104107e-05, "loss": 0.7691, "step": 214 }, { "epoch": 0.17623740818300002, "grad_norm": 1.3909974666968508, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.12624797224998474, "learning_rate": 1.8901603317724742e-05, "loss": 0.7827, "step": 215 }, { "epoch": 0.17705711705826976, "grad_norm": 1.2889322631590703, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.0620657205581665, "learning_rate": 1.8889461411414754e-05, "loss": 0.765, "step": 216 }, { "epoch": 0.17787682593353954, "grad_norm": 1.3958611857764947, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.3180302381515503, "learning_rate": 1.8877256707947308e-05, "loss": 0.7785, "step": 217 }, { "epoch": 0.17869653480880932, "grad_norm": 1.21756144909098, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.1645722389221191, "learning_rate": 1.886498929353917e-05, "loss": 0.7397, "step": 218 }, { "epoch": 0.17951624368407906, "grad_norm": 1.2819594204127502, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 1.0139302015304565, "learning_rate": 1.8852659254850128e-05, "loss": 0.7851, "step": 219 }, { "epoch": 0.18033595255934884, "grad_norm": 1.2183181589832488, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.7074142694473267, "learning_rate": 1.8840266678982343e-05, "loss": 0.7823, "step": 220 }, { "epoch": 0.18115566143461861, "grad_norm": 1.2113636726028785, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 1.2712079286575317, "learning_rate": 1.882781165347977e-05, "loss": 0.7712, "step": 221 }, { "epoch": 0.1819753703098884, "grad_norm": 1.2312096012058535, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.47480735182762146, "learning_rate": 1.8815294266327507e-05, "loss": 0.8127, "step": 222 }, { "epoch": 0.18279507918515814, "grad_norm": 1.2359042655527446, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.3055737018585205, "learning_rate": 1.88027146059512e-05, "loss": 0.7572, "step": 223 }, { "epoch": 0.1836147880604279, "grad_norm": 1.3544601819389752, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.2657633125782013, "learning_rate": 1.8790072761216406e-05, "loss": 0.8142, "step": 224 }, { "epoch": 0.1844344969356977, "grad_norm": 1.1533036316176342, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.4670569896697998, "learning_rate": 1.8777368821427954e-05, "loss": 0.7701, "step": 225 }, { "epoch": 0.18525420581096744, "grad_norm": 1.4026457405650468, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.7761039137840271, "learning_rate": 1.8764602876329346e-05, "loss": 0.7926, "step": 226 }, { "epoch": 0.1860739146862372, "grad_norm": 1.250584789629632, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 1.2559117078781128, "learning_rate": 1.8751775016102087e-05, "loss": 0.786, "step": 227 }, { "epoch": 0.186893623561507, "grad_norm": 1.4799838979140456, "latest_boundary_loss": 0.0112152099609375, "latest_lm_loss": 0.22022885084152222, "learning_rate": 1.8738885331365073e-05, "loss": 0.7484, "step": 228 }, { "epoch": 0.18771333243677676, "grad_norm": 1.2417682038964282, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.7168477773666382, "learning_rate": 1.872593391317394e-05, "loss": 0.7648, "step": 229 }, { "epoch": 0.1885330413120465, "grad_norm": 1.2953299624267198, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.19695428013801575, "learning_rate": 1.871292085302042e-05, "loss": 0.7651, "step": 230 }, { "epoch": 0.1893527501873163, "grad_norm": 1.2766212507963632, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.10029853880405426, "learning_rate": 1.8699846242831707e-05, "loss": 0.7733, "step": 231 }, { "epoch": 0.19017245906258606, "grad_norm": 1.2213990144170908, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.284568727016449, "learning_rate": 1.8686710174969786e-05, "loss": 0.8054, "step": 232 }, { "epoch": 0.1909921679378558, "grad_norm": 1.2770104730298277, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.001825555576942861, "learning_rate": 1.86735127422308e-05, "loss": 0.7766, "step": 233 }, { "epoch": 0.1918118768131256, "grad_norm": 1.6434692119616476, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.6784384846687317, "learning_rate": 1.866025403784439e-05, "loss": 0.7799, "step": 234 }, { "epoch": 0.19263158568839536, "grad_norm": 1.4265105313813045, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.7525010108947754, "learning_rate": 1.8646934155473025e-05, "loss": 0.7664, "step": 235 }, { "epoch": 0.1934512945636651, "grad_norm": 1.2060269987170464, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.27714869379997253, "learning_rate": 1.8633553189211353e-05, "loss": 0.7691, "step": 236 }, { "epoch": 0.19427100343893489, "grad_norm": 1.0505165658766114, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.33565133810043335, "learning_rate": 1.862011123358554e-05, "loss": 0.746, "step": 237 }, { "epoch": 0.19509071231420466, "grad_norm": 1.261813453288812, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 2.038971185684204, "learning_rate": 1.8606608383552583e-05, "loss": 0.7916, "step": 238 }, { "epoch": 0.19591042118947444, "grad_norm": 1.2008545562225126, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.9500068426132202, "learning_rate": 1.8593044734499657e-05, "loss": 0.7808, "step": 239 }, { "epoch": 0.19673013006474419, "grad_norm": 1.3619254750713339, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.6996431350708008, "learning_rate": 1.8579420382243433e-05, "loss": 0.7481, "step": 240 }, { "epoch": 0.19754983894001396, "grad_norm": 1.153666777588698, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.1772021055221558, "learning_rate": 1.8565735423029406e-05, "loss": 0.8016, "step": 241 }, { "epoch": 0.19836954781528374, "grad_norm": 1.231054548881498, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.5607664585113525, "learning_rate": 1.8551989953531204e-05, "loss": 0.8225, "step": 242 }, { "epoch": 0.19918925669055348, "grad_norm": 1.2539782363755292, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 1.0679620504379272, "learning_rate": 1.8538184070849926e-05, "loss": 0.784, "step": 243 }, { "epoch": 0.20000896556582326, "grad_norm": 1.1540893065081963, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.9860201478004456, "learning_rate": 1.8524317872513434e-05, "loss": 0.7447, "step": 244 }, { "epoch": 0.20082867444109304, "grad_norm": 1.243855447022029, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 1.2961859703063965, "learning_rate": 1.8510391456475674e-05, "loss": 0.7607, "step": 245 }, { "epoch": 0.2016483833163628, "grad_norm": 1.4553171400299931, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.478272020816803, "learning_rate": 1.8496404921115993e-05, "loss": 0.7589, "step": 246 }, { "epoch": 0.20246809219163256, "grad_norm": 1.2103811328904168, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.25575590133667, "learning_rate": 1.8482358365238414e-05, "loss": 0.7668, "step": 247 }, { "epoch": 0.20328780106690233, "grad_norm": 1.3068140079840127, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.6374103426933289, "learning_rate": 1.8468251888070982e-05, "loss": 0.7923, "step": 248 }, { "epoch": 0.2041075099421721, "grad_norm": 1.362995927789331, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.019213274121284485, "learning_rate": 1.845408558926502e-05, "loss": 0.7676, "step": 249 }, { "epoch": 0.20492721881744186, "grad_norm": 1.3608255284218467, "latest_boundary_loss": 0.0098554827272892, "latest_lm_loss": 0.3416900038719177, "learning_rate": 1.8439859568894464e-05, "loss": 0.8042, "step": 250 }, { "epoch": 0.20574692769271163, "grad_norm": 1.2739111624948265, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.111289381980896, "learning_rate": 1.842557392745512e-05, "loss": 0.7948, "step": 251 }, { "epoch": 0.2065666365679814, "grad_norm": 1.0480475366167854, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 1.906036615371704, "learning_rate": 1.8411228765863973e-05, "loss": 0.7794, "step": 252 }, { "epoch": 0.20738634544325116, "grad_norm": 1.139412002510562, "latest_boundary_loss": 0.011813269928097725, "latest_lm_loss": 0.361102819442749, "learning_rate": 1.839682418545848e-05, "loss": 0.7464, "step": 253 }, { "epoch": 0.20820605431852093, "grad_norm": 1.1119026519518347, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 1.1063988208770752, "learning_rate": 1.838236028799584e-05, "loss": 0.7648, "step": 254 }, { "epoch": 0.2090257631937907, "grad_norm": 1.0801419538749126, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.1630922108888626, "learning_rate": 1.8367837175652284e-05, "loss": 0.7683, "step": 255 }, { "epoch": 0.20984547206906048, "grad_norm": 1.112279762705192, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.712288498878479, "learning_rate": 1.8353254951022342e-05, "loss": 0.7802, "step": 256 }, { "epoch": 0.21066518094433023, "grad_norm": 1.1018482036235493, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 2.4364233016967773, "learning_rate": 1.833861371711814e-05, "loss": 0.7646, "step": 257 }, { "epoch": 0.2114848898196, "grad_norm": 1.200356654925506, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.3319595456123352, "learning_rate": 1.832391357736865e-05, "loss": 0.7568, "step": 258 }, { "epoch": 0.21230459869486978, "grad_norm": 1.2002443330310237, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.8385396003723145, "learning_rate": 1.8309154635618967e-05, "loss": 0.8085, "step": 259 }, { "epoch": 0.21312430757013953, "grad_norm": 1.4634081498377687, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 1.1421477794647217, "learning_rate": 1.829433699612958e-05, "loss": 0.8162, "step": 260 }, { "epoch": 0.2139440164454093, "grad_norm": 1.2596681738077358, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.10862617194652557, "learning_rate": 1.827946076357564e-05, "loss": 0.775, "step": 261 }, { "epoch": 0.21476372532067908, "grad_norm": 1.2398802534827353, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.7453004121780396, "learning_rate": 1.8264526043046193e-05, "loss": 0.7937, "step": 262 }, { "epoch": 0.21558343419594886, "grad_norm": 1.5633145196150309, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.2946339249610901, "learning_rate": 1.824953294004347e-05, "loss": 0.763, "step": 263 }, { "epoch": 0.2164031430712186, "grad_norm": 1.1733624025964176, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.12872633337974548, "learning_rate": 1.8234481560482136e-05, "loss": 0.8005, "step": 264 }, { "epoch": 0.21722285194648838, "grad_norm": 1.3398656380843015, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.3354813754558563, "learning_rate": 1.8219372010688516e-05, "loss": 0.7564, "step": 265 }, { "epoch": 0.21804256082175816, "grad_norm": 1.4246550067705264, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.4522192478179932, "learning_rate": 1.8204204397399875e-05, "loss": 0.7723, "step": 266 }, { "epoch": 0.2188622696970279, "grad_norm": 1.1745708213247588, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.18473327159881592, "learning_rate": 1.8188978827763654e-05, "loss": 0.7394, "step": 267 }, { "epoch": 0.21968197857229768, "grad_norm": 1.2255538023699621, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.29951363801956177, "learning_rate": 1.8173695409336703e-05, "loss": 0.7659, "step": 268 }, { "epoch": 0.22050168744756746, "grad_norm": 1.3905999193747347, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.6259192228317261, "learning_rate": 1.815835425008453e-05, "loss": 0.7589, "step": 269 }, { "epoch": 0.2213213963228372, "grad_norm": 1.2852079273460868, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.17656244337558746, "learning_rate": 1.814295545838054e-05, "loss": 0.7461, "step": 270 }, { "epoch": 0.22214110519810698, "grad_norm": 1.2497357325909428, "latest_boundary_loss": 0.013131883926689625, "latest_lm_loss": 0.12683294713497162, "learning_rate": 1.8127499143005266e-05, "loss": 0.7816, "step": 271 }, { "epoch": 0.22296081407337676, "grad_norm": 1.4190221606987263, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.5428849458694458, "learning_rate": 1.81119854131456e-05, "loss": 0.7311, "step": 272 }, { "epoch": 0.22378052294864653, "grad_norm": 1.797205817865895, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.05780012905597687, "learning_rate": 1.809641437839403e-05, "loss": 0.7685, "step": 273 }, { "epoch": 0.22460023182391628, "grad_norm": 1.6433167931656745, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.149138331413269, "learning_rate": 1.8080786148747842e-05, "loss": 0.7719, "step": 274 }, { "epoch": 0.22541994069918606, "grad_norm": 1.1824183570709803, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.7802443504333496, "learning_rate": 1.8065100834608378e-05, "loss": 0.8139, "step": 275 }, { "epoch": 0.22623964957445583, "grad_norm": 1.2871312654535232, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.9594394564628601, "learning_rate": 1.8049358546780227e-05, "loss": 0.7475, "step": 276 }, { "epoch": 0.22705935844972558, "grad_norm": 1.5199771118747738, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.05118134245276451, "learning_rate": 1.8033559396470455e-05, "loss": 0.7355, "step": 277 }, { "epoch": 0.22787906732499535, "grad_norm": 1.3775407674488795, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.48853322863578796, "learning_rate": 1.8017703495287815e-05, "loss": 0.7614, "step": 278 }, { "epoch": 0.22869877620026513, "grad_norm": 1.5150236406449658, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.0969005823135376, "learning_rate": 1.8001790955241972e-05, "loss": 0.7515, "step": 279 }, { "epoch": 0.22951848507553488, "grad_norm": 1.5587104169773858, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.24048875272274017, "learning_rate": 1.7985821888742687e-05, "loss": 0.768, "step": 280 }, { "epoch": 0.23033819395080465, "grad_norm": 1.3709131164575632, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 1.134320855140686, "learning_rate": 1.7969796408599042e-05, "loss": 0.7615, "step": 281 }, { "epoch": 0.23115790282607443, "grad_norm": 1.5736631736487026, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.3996270895004272, "learning_rate": 1.795371462801864e-05, "loss": 0.7624, "step": 282 }, { "epoch": 0.2319776117013442, "grad_norm": 1.3329207039551936, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.04914306849241257, "learning_rate": 1.79375766606068e-05, "loss": 0.7304, "step": 283 }, { "epoch": 0.23279732057661395, "grad_norm": 1.095762286762134, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.1749358177185059, "learning_rate": 1.7921382620365757e-05, "loss": 0.7406, "step": 284 }, { "epoch": 0.23361702945188373, "grad_norm": 1.1270703944706861, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.114078402519226, "learning_rate": 1.7905132621693862e-05, "loss": 0.7313, "step": 285 }, { "epoch": 0.2344367383271535, "grad_norm": 1.1401888000553002, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.9270635843276978, "learning_rate": 1.788882677938476e-05, "loss": 0.7525, "step": 286 }, { "epoch": 0.23525644720242325, "grad_norm": 1.5327849801377653, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.2532890737056732, "learning_rate": 1.78724652086266e-05, "loss": 0.7792, "step": 287 }, { "epoch": 0.23607615607769303, "grad_norm": 1.2802765903195208, "latest_boundary_loss": 0.0112152099609375, "latest_lm_loss": 2.042780876159668, "learning_rate": 1.7856048025001195e-05, "loss": 0.7712, "step": 288 }, { "epoch": 0.2368958649529628, "grad_norm": 1.2334210495817985, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.4526499807834625, "learning_rate": 1.7839575344483237e-05, "loss": 0.7849, "step": 289 }, { "epoch": 0.23771557382823258, "grad_norm": 1.2425477896602664, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.6510121822357178, "learning_rate": 1.7823047283439444e-05, "loss": 0.7398, "step": 290 }, { "epoch": 0.23853528270350233, "grad_norm": 1.0938249056699105, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.3264525532722473, "learning_rate": 1.7806463958627765e-05, "loss": 0.759, "step": 291 }, { "epoch": 0.2393549915787721, "grad_norm": 1.2916826875203216, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 1.1825861930847168, "learning_rate": 1.7789825487196538e-05, "loss": 0.8018, "step": 292 }, { "epoch": 0.24017470045404188, "grad_norm": 1.2755265332447003, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.8257743716239929, "learning_rate": 1.7773131986683675e-05, "loss": 0.7792, "step": 293 }, { "epoch": 0.24099440932931163, "grad_norm": 1.289138890518447, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.3038530349731445, "learning_rate": 1.775638357501582e-05, "loss": 0.7669, "step": 294 }, { "epoch": 0.2418141182045814, "grad_norm": 1.1670766376069939, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.29945409297943115, "learning_rate": 1.7739580370507533e-05, "loss": 0.7438, "step": 295 }, { "epoch": 0.24263382707985118, "grad_norm": 1.2375205282382749, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.43008628487586975, "learning_rate": 1.7722722491860427e-05, "loss": 0.7462, "step": 296 }, { "epoch": 0.24345353595512093, "grad_norm": 1.1900225589317992, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.8674753904342651, "learning_rate": 1.7705810058162354e-05, "loss": 0.7317, "step": 297 }, { "epoch": 0.2442732448303907, "grad_norm": 1.3389797043071163, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.9116458892822266, "learning_rate": 1.768884318888656e-05, "loss": 0.7605, "step": 298 }, { "epoch": 0.24509295370566048, "grad_norm": 1.7080360521539983, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.1164073944091797, "learning_rate": 1.7671822003890825e-05, "loss": 0.7429, "step": 299 }, { "epoch": 0.24591266258093025, "grad_norm": 1.7303183183296784, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.656548023223877, "learning_rate": 1.7654746623416637e-05, "loss": 0.7675, "step": 300 }, { "epoch": 0.2467323714562, "grad_norm": 1.5332639349905193, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.012393379583954811, "learning_rate": 1.7637617168088327e-05, "loss": 0.7485, "step": 301 }, { "epoch": 0.24755208033146978, "grad_norm": 2.0182196844254934, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 1.0757160186767578, "learning_rate": 1.762043375891223e-05, "loss": 0.7532, "step": 302 }, { "epoch": 0.24837178920673955, "grad_norm": 1.0882191320561219, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.9313108921051025, "learning_rate": 1.7603196517275808e-05, "loss": 0.7576, "step": 303 }, { "epoch": 0.2491914980820093, "grad_norm": 1.4188446807929445, "latest_boundary_loss": 0.010217878967523575, "latest_lm_loss": 1.289720058441162, "learning_rate": 1.758590556494683e-05, "loss": 0.7491, "step": 304 }, { "epoch": 0.2500112069572791, "grad_norm": 1.348859100576177, "latest_boundary_loss": 0.012135399505496025, "latest_lm_loss": 1.1527491807937622, "learning_rate": 1.756856102407247e-05, "loss": 0.7803, "step": 305 }, { "epoch": 0.25083091583254885, "grad_norm": 1.1871132336505195, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.15170671045780182, "learning_rate": 1.7551163017178473e-05, "loss": 0.7587, "step": 306 }, { "epoch": 0.2516506247078186, "grad_norm": 1.5470829712153078, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.1318871974945068, "learning_rate": 1.753371166716828e-05, "loss": 0.7654, "step": 307 }, { "epoch": 0.2524703335830884, "grad_norm": 1.3171224905847938, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.05948929488658905, "learning_rate": 1.7516207097322154e-05, "loss": 0.7626, "step": 308 }, { "epoch": 0.2532900424583581, "grad_norm": 1.1571731931590543, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.4976317882537842, "learning_rate": 1.749864943129632e-05, "loss": 0.7663, "step": 309 }, { "epoch": 0.2541097513336279, "grad_norm": 1.078758672013003, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.3855668604373932, "learning_rate": 1.748103879312209e-05, "loss": 0.7378, "step": 310 }, { "epoch": 0.2549294602088977, "grad_norm": 1.1687388545109743, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.8284977674484253, "learning_rate": 1.746337530720497e-05, "loss": 0.7993, "step": 311 }, { "epoch": 0.25574916908416745, "grad_norm": 1.1097333146545336, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.43493300676345825, "learning_rate": 1.7445659098323807e-05, "loss": 0.7693, "step": 312 }, { "epoch": 0.2565688779594372, "grad_norm": 1.3895573552106844, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.2684229910373688, "learning_rate": 1.7427890291629895e-05, "loss": 0.7659, "step": 313 }, { "epoch": 0.257388586834707, "grad_norm": 1.175334830795283, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.9001120328903198, "learning_rate": 1.7410069012646076e-05, "loss": 0.8112, "step": 314 }, { "epoch": 0.2582082957099768, "grad_norm": 1.1320954131207766, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.0786060318350792, "learning_rate": 1.7392195387265888e-05, "loss": 0.8095, "step": 315 }, { "epoch": 0.2590280045852465, "grad_norm": 1.1137774103912135, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 2.116636037826538, "learning_rate": 1.737426954175264e-05, "loss": 0.7561, "step": 316 }, { "epoch": 0.25984771346051627, "grad_norm": 1.2298598326343215, "latest_boundary_loss": 0.0126245291903615, "latest_lm_loss": 1.0506033897399902, "learning_rate": 1.7356291602738542e-05, "loss": 0.7551, "step": 317 }, { "epoch": 0.26066742233578605, "grad_norm": 1.1565607414774337, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.8087133765220642, "learning_rate": 1.733826169722381e-05, "loss": 0.7579, "step": 318 }, { "epoch": 0.2614871312110558, "grad_norm": 1.1613744624204663, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.7222955226898193, "learning_rate": 1.732017995257575e-05, "loss": 0.7473, "step": 319 }, { "epoch": 0.2623068400863256, "grad_norm": 1.1436471583119088, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.029964566230774, "learning_rate": 1.7302046496527882e-05, "loss": 0.7818, "step": 320 }, { "epoch": 0.2631265489615954, "grad_norm": 1.1910663973569198, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.9554945826530457, "learning_rate": 1.7283861457179022e-05, "loss": 0.8009, "step": 321 }, { "epoch": 0.26394625783686515, "grad_norm": 1.2632429704281476, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.20354612171649933, "learning_rate": 1.726562496299239e-05, "loss": 0.7569, "step": 322 }, { "epoch": 0.26476596671213487, "grad_norm": 1.0983717671884115, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.034584496170282364, "learning_rate": 1.724733714279468e-05, "loss": 0.761, "step": 323 }, { "epoch": 0.26558567558740465, "grad_norm": 1.0477499097227814, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.48923203349113464, "learning_rate": 1.7228998125775175e-05, "loss": 0.7425, "step": 324 }, { "epoch": 0.2664053844626744, "grad_norm": 1.340228371713637, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.011654120869934559, "learning_rate": 1.721060804148482e-05, "loss": 0.7828, "step": 325 }, { "epoch": 0.2672250933379442, "grad_norm": 1.3578540813921194, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.1521583795547485, "learning_rate": 1.7192167019835314e-05, "loss": 0.8198, "step": 326 }, { "epoch": 0.268044802213214, "grad_norm": 1.1299101092813861, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.002408386208117008, "learning_rate": 1.717367519109819e-05, "loss": 0.7315, "step": 327 }, { "epoch": 0.26886451108848375, "grad_norm": 1.181439880106029, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.1732453554868698, "learning_rate": 1.7155132685903888e-05, "loss": 0.7604, "step": 328 }, { "epoch": 0.2696842199637535, "grad_norm": 1.1651545872225744, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 1.2648510932922363, "learning_rate": 1.713653963524084e-05, "loss": 0.7737, "step": 329 }, { "epoch": 0.27050392883902324, "grad_norm": 0.9459690643181343, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.14779794216156, "learning_rate": 1.7117896170454542e-05, "loss": 0.7713, "step": 330 }, { "epoch": 0.271323637714293, "grad_norm": 1.2106270327103732, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.928825855255127, "learning_rate": 1.7099202423246632e-05, "loss": 0.7727, "step": 331 }, { "epoch": 0.2721433465895628, "grad_norm": 0.9348248166210524, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.6661812663078308, "learning_rate": 1.7080458525673948e-05, "loss": 0.7403, "step": 332 }, { "epoch": 0.27296305546483257, "grad_norm": 1.0602586687364872, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.2222480773925781, "learning_rate": 1.7061664610147605e-05, "loss": 0.7344, "step": 333 }, { "epoch": 0.27378276434010235, "grad_norm": 1.0645433234115789, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.31431305408477783, "learning_rate": 1.7042820809432057e-05, "loss": 0.7239, "step": 334 }, { "epoch": 0.2746024732153721, "grad_norm": 1.2180378095534536, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.3814491033554077, "learning_rate": 1.702392725664415e-05, "loss": 0.8173, "step": 335 }, { "epoch": 0.27542218209064184, "grad_norm": 1.2137410974580587, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.6773765683174133, "learning_rate": 1.70049840852522e-05, "loss": 0.786, "step": 336 }, { "epoch": 0.2762418909659116, "grad_norm": 1.2370935741477198, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 1.056388258934021, "learning_rate": 1.6985991429075038e-05, "loss": 0.7183, "step": 337 }, { "epoch": 0.2770615998411814, "grad_norm": 1.3093794584268097, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 3.4595601558685303, "learning_rate": 1.6966949422281058e-05, "loss": 0.7468, "step": 338 }, { "epoch": 0.27788130871645117, "grad_norm": 1.710868473169992, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.9647908210754395, "learning_rate": 1.6947858199387296e-05, "loss": 0.7939, "step": 339 }, { "epoch": 0.27870101759172095, "grad_norm": 1.212495409931308, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.40625953674316406, "learning_rate": 1.692871789525844e-05, "loss": 0.7487, "step": 340 }, { "epoch": 0.2795207264669907, "grad_norm": 1.0482189354901879, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.6986762285232544, "learning_rate": 1.6909528645105908e-05, "loss": 0.7087, "step": 341 }, { "epoch": 0.2803404353422605, "grad_norm": 1.4187873466870942, "latest_boundary_loss": 0.008855608291924, "latest_lm_loss": 0.9669897556304932, "learning_rate": 1.6890290584486892e-05, "loss": 0.7479, "step": 342 }, { "epoch": 0.2811601442175302, "grad_norm": 1.2321191576527397, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.8818368911743164, "learning_rate": 1.687100384930338e-05, "loss": 0.7655, "step": 343 }, { "epoch": 0.2819798530928, "grad_norm": 1.218882091607278, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.4501078426837921, "learning_rate": 1.685166857580122e-05, "loss": 0.7457, "step": 344 }, { "epoch": 0.28279956196806977, "grad_norm": 1.2515083536669707, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.8328303694725037, "learning_rate": 1.683228490056913e-05, "loss": 0.7791, "step": 345 }, { "epoch": 0.28361927084333954, "grad_norm": 1.2606396268517954, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.486973762512207, "learning_rate": 1.6812852960537763e-05, "loss": 0.7609, "step": 346 }, { "epoch": 0.2844389797186093, "grad_norm": 1.439727469843454, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.583997130393982, "learning_rate": 1.6793372892978716e-05, "loss": 0.7923, "step": 347 }, { "epoch": 0.2852586885938791, "grad_norm": 1.2900481058444884, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.6450203061103821, "learning_rate": 1.6773844835503574e-05, "loss": 0.7375, "step": 348 }, { "epoch": 0.28607839746914887, "grad_norm": 1.1445092464493982, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.6270523071289062, "learning_rate": 1.6754268926062936e-05, "loss": 0.728, "step": 349 }, { "epoch": 0.2868981063444186, "grad_norm": 1.1197935862015225, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.6677144169807434, "learning_rate": 1.6734645302945434e-05, "loss": 0.7386, "step": 350 }, { "epoch": 0.28771781521968837, "grad_norm": 1.5516206153328975, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.00457730982452631, "learning_rate": 1.671497410477676e-05, "loss": 0.748, "step": 351 }, { "epoch": 0.28853752409495814, "grad_norm": 1.1760660331370985, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.2051688432693481, "learning_rate": 1.6695255470518687e-05, "loss": 0.7573, "step": 352 }, { "epoch": 0.2893572329702279, "grad_norm": 1.1737340304389918, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.5741766095161438, "learning_rate": 1.6675489539468094e-05, "loss": 0.7835, "step": 353 }, { "epoch": 0.2901769418454977, "grad_norm": 1.2220474332357378, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.0651415586471558, "learning_rate": 1.665567645125596e-05, "loss": 0.7549, "step": 354 }, { "epoch": 0.29099665072076747, "grad_norm": 1.1198245204858515, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.3142130672931671, "learning_rate": 1.6635816345846413e-05, "loss": 0.8024, "step": 355 }, { "epoch": 0.29181635959603724, "grad_norm": 1.160175666861782, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.8947227597236633, "learning_rate": 1.66159093635357e-05, "loss": 0.7385, "step": 356 }, { "epoch": 0.29263606847130696, "grad_norm": 1.8429467670966544, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.1498366594314575, "learning_rate": 1.659595564495124e-05, "loss": 0.7941, "step": 357 }, { "epoch": 0.29345577734657674, "grad_norm": 1.2825115095824218, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 2.7792720794677734, "learning_rate": 1.6575955331050585e-05, "loss": 0.7898, "step": 358 }, { "epoch": 0.2942754862218465, "grad_norm": 1.5018008093636956, "latest_boundary_loss": 0.010595110245049, "latest_lm_loss": 1.5143988132476807, "learning_rate": 1.6555908563120457e-05, "loss": 0.7715, "step": 359 }, { "epoch": 0.2950951950971163, "grad_norm": 1.4070401896853235, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.5355772972106934, "learning_rate": 1.6535815482775745e-05, "loss": 0.778, "step": 360 }, { "epoch": 0.29591490397238607, "grad_norm": 1.1153938237688106, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 1.155535101890564, "learning_rate": 1.6515676231958488e-05, "loss": 0.7623, "step": 361 }, { "epoch": 0.29673461284765584, "grad_norm": 1.1604011420722802, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.05568075180053711, "learning_rate": 1.6495490952936898e-05, "loss": 0.7198, "step": 362 }, { "epoch": 0.2975543217229256, "grad_norm": 1.002778617881788, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.0034329891204834, "learning_rate": 1.647525978830432e-05, "loss": 0.7212, "step": 363 }, { "epoch": 0.29837403059819534, "grad_norm": 1.0895273576749642, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.7533732652664185, "learning_rate": 1.645498288097827e-05, "loss": 0.7854, "step": 364 }, { "epoch": 0.2991937394734651, "grad_norm": 1.1624355708047038, "latest_boundary_loss": 0.008855608291924, "latest_lm_loss": 1.1625741720199585, "learning_rate": 1.6434660374199377e-05, "loss": 0.7566, "step": 365 }, { "epoch": 0.3000134483487349, "grad_norm": 1.0897411680197235, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 2.1761956214904785, "learning_rate": 1.641429241153041e-05, "loss": 0.7356, "step": 366 }, { "epoch": 0.30083315722400467, "grad_norm": 1.1138571873195804, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.0779097080230713, "learning_rate": 1.6393879136855247e-05, "loss": 0.7545, "step": 367 }, { "epoch": 0.30165286609927444, "grad_norm": 1.1688440573646057, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.11352968215942383, "learning_rate": 1.6373420694377857e-05, "loss": 0.784, "step": 368 }, { "epoch": 0.3024725749745442, "grad_norm": 1.154933268259177, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.8499196767807007, "learning_rate": 1.6352917228621284e-05, "loss": 0.778, "step": 369 }, { "epoch": 0.30329228384981394, "grad_norm": 1.1631085618547605, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.4340735077857971, "learning_rate": 1.633236888442663e-05, "loss": 0.7081, "step": 370 }, { "epoch": 0.3041119927250837, "grad_norm": 1.0233956168157465, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 2.0934293270111084, "learning_rate": 1.631177580695202e-05, "loss": 0.7219, "step": 371 }, { "epoch": 0.3049317016003535, "grad_norm": 1.0615378465781329, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.6719732284545898, "learning_rate": 1.6291138141671598e-05, "loss": 0.7252, "step": 372 }, { "epoch": 0.30575141047562326, "grad_norm": 1.4269601756010983, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.20878413319587708, "learning_rate": 1.6270456034374477e-05, "loss": 0.7682, "step": 373 }, { "epoch": 0.30657111935089304, "grad_norm": 1.15948742798124, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.0025855202693492174, "learning_rate": 1.6249729631163718e-05, "loss": 0.7509, "step": 374 }, { "epoch": 0.3073908282261628, "grad_norm": 1.3110997619868459, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.10412515699863434, "learning_rate": 1.6228959078455306e-05, "loss": 0.7172, "step": 375 }, { "epoch": 0.3082105371014326, "grad_norm": 1.1439178618100527, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.19717106223106384, "learning_rate": 1.62081445229771e-05, "loss": 0.7637, "step": 376 }, { "epoch": 0.3090302459767023, "grad_norm": 1.269020910675217, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.4276922941207886, "learning_rate": 1.6187286111767812e-05, "loss": 0.771, "step": 377 }, { "epoch": 0.3098499548519721, "grad_norm": 1.3375061257192655, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.5710009336471558, "learning_rate": 1.616638399217595e-05, "loss": 0.7826, "step": 378 }, { "epoch": 0.31066966372724186, "grad_norm": 1.073632131841889, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.8715724945068359, "learning_rate": 1.61454383118588e-05, "loss": 0.7362, "step": 379 }, { "epoch": 0.31148937260251164, "grad_norm": 1.0921386107746502, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.9326805472373962, "learning_rate": 1.6124449218781358e-05, "loss": 0.7303, "step": 380 }, { "epoch": 0.3123090814777814, "grad_norm": 1.2688773597032257, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.7330528497695923, "learning_rate": 1.6103416861215314e-05, "loss": 0.7936, "step": 381 }, { "epoch": 0.3131287903530512, "grad_norm": 1.165204450941577, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 1.072617530822754, "learning_rate": 1.608234138773797e-05, "loss": 0.7403, "step": 382 }, { "epoch": 0.31394849922832097, "grad_norm": 1.4373080591127512, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.1570799350738525, "learning_rate": 1.6061222947231224e-05, "loss": 0.7292, "step": 383 }, { "epoch": 0.3147682081035907, "grad_norm": 1.4898497396928483, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.1265507936477661, "learning_rate": 1.6040061688880494e-05, "loss": 0.8137, "step": 384 }, { "epoch": 0.31558791697886046, "grad_norm": 1.2682922364467413, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.0434116125106812, "learning_rate": 1.6018857762173672e-05, "loss": 0.7405, "step": 385 }, { "epoch": 0.31640762585413024, "grad_norm": 1.5142600008173759, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.4366573393344879, "learning_rate": 1.5997611316900075e-05, "loss": 0.7288, "step": 386 }, { "epoch": 0.3172273347294, "grad_norm": 1.41046862385341, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.6512951850891113, "learning_rate": 1.5976322503149373e-05, "loss": 0.7692, "step": 387 }, { "epoch": 0.3180470436046698, "grad_norm": 1.0853857992900688, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 2.4271011352539062, "learning_rate": 1.5954991471310542e-05, "loss": 0.7617, "step": 388 }, { "epoch": 0.31886675247993956, "grad_norm": 1.1413565274647948, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.5793663859367371, "learning_rate": 1.5933618372070805e-05, "loss": 0.7787, "step": 389 }, { "epoch": 0.31968646135520934, "grad_norm": 1.0201250861250861, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.8066156506538391, "learning_rate": 1.5912203356414532e-05, "loss": 0.7733, "step": 390 }, { "epoch": 0.32050617023047906, "grad_norm": 1.0532882915217945, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 1.1418710947036743, "learning_rate": 1.589074657562223e-05, "loss": 0.723, "step": 391 }, { "epoch": 0.32132587910574884, "grad_norm": 1.0453559715732401, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.694559633731842, "learning_rate": 1.5869248181269427e-05, "loss": 0.7621, "step": 392 }, { "epoch": 0.3221455879810186, "grad_norm": 1.0151524975963433, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.45721903443336487, "learning_rate": 1.5847708325225618e-05, "loss": 0.7783, "step": 393 }, { "epoch": 0.3229652968562884, "grad_norm": 1.156407244610918, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.5822734832763672, "learning_rate": 1.5826127159653203e-05, "loss": 0.7353, "step": 394 }, { "epoch": 0.32378500573155816, "grad_norm": 1.4809181629779222, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.9310925602912903, "learning_rate": 1.5804504837006396e-05, "loss": 0.7151, "step": 395 }, { "epoch": 0.32460471460682794, "grad_norm": 1.1219179492211147, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.0492651462554932, "learning_rate": 1.578284151003015e-05, "loss": 0.7407, "step": 396 }, { "epoch": 0.3254244234820977, "grad_norm": 1.12490644399429, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.8332700729370117, "learning_rate": 1.5761137331759084e-05, "loss": 0.7279, "step": 397 }, { "epoch": 0.32624413235736743, "grad_norm": 1.1773176619322447, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.241025447845459, "learning_rate": 1.5739392455516408e-05, "loss": 0.7266, "step": 398 }, { "epoch": 0.3270638412326372, "grad_norm": 1.3260407471150357, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.8030115962028503, "learning_rate": 1.571760703491282e-05, "loss": 0.7686, "step": 399 }, { "epoch": 0.327883550107907, "grad_norm": 1.1888045775860243, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.0539559125900269, "learning_rate": 1.5695781223845442e-05, "loss": 0.7517, "step": 400 }, { "epoch": 0.32870325898317676, "grad_norm": 1.25614939891683, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.17292562127113342, "learning_rate": 1.5673915176496716e-05, "loss": 0.7473, "step": 401 }, { "epoch": 0.32952296785844654, "grad_norm": 1.1967024681456992, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.26239249110221863, "learning_rate": 1.5652009047333322e-05, "loss": 0.7594, "step": 402 }, { "epoch": 0.3303426767337163, "grad_norm": 1.3211135267641345, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.7740810513496399, "learning_rate": 1.56300629911051e-05, "loss": 0.7422, "step": 403 }, { "epoch": 0.33116238560898603, "grad_norm": 1.2073290889140484, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 2.1549134254455566, "learning_rate": 1.560807716284392e-05, "loss": 0.7732, "step": 404 }, { "epoch": 0.3319820944842558, "grad_norm": 1.1282420457224345, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.0053644180297852, "learning_rate": 1.5586051717862634e-05, "loss": 0.7611, "step": 405 }, { "epoch": 0.3328018033595256, "grad_norm": 1.206384028030354, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.1088835000991821, "learning_rate": 1.5563986811753948e-05, "loss": 0.7476, "step": 406 }, { "epoch": 0.33362151223479536, "grad_norm": 1.208696270431492, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.3628442287445068, "learning_rate": 1.554188260038932e-05, "loss": 0.7576, "step": 407 }, { "epoch": 0.33444122111006513, "grad_norm": 1.2991685306475895, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.371116042137146, "learning_rate": 1.551973923991788e-05, "loss": 0.7761, "step": 408 }, { "epoch": 0.3352609299853349, "grad_norm": 1.1638532413709233, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.44266730546951294, "learning_rate": 1.5497556886765316e-05, "loss": 0.7661, "step": 409 }, { "epoch": 0.3360806388606047, "grad_norm": 1.2924453655106747, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.8117881417274475, "learning_rate": 1.5475335697632768e-05, "loss": 0.7732, "step": 410 }, { "epoch": 0.3369003477358744, "grad_norm": 1.1190417782317583, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.7913511991500854, "learning_rate": 1.545307582949571e-05, "loss": 0.717, "step": 411 }, { "epoch": 0.3377200566111442, "grad_norm": 1.227935814732426, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.9072880148887634, "learning_rate": 1.5430777439602875e-05, "loss": 0.7565, "step": 412 }, { "epoch": 0.33853976548641396, "grad_norm": 1.157064752172727, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.3098393678665161, "learning_rate": 1.540844068547511e-05, "loss": 0.7881, "step": 413 }, { "epoch": 0.33935947436168373, "grad_norm": 1.388601124472212, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.8129163980484009, "learning_rate": 1.5386065724904273e-05, "loss": 0.7327, "step": 414 }, { "epoch": 0.3401791832369535, "grad_norm": 1.4468342034748307, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.7910501956939697, "learning_rate": 1.536365271595212e-05, "loss": 0.7775, "step": 415 }, { "epoch": 0.3409988921122233, "grad_norm": 1.2744703044986754, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.7848953008651733, "learning_rate": 1.5341201816949208e-05, "loss": 0.7529, "step": 416 }, { "epoch": 0.34181860098749306, "grad_norm": 1.2121112524138202, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.18250629305839539, "learning_rate": 1.5318713186493736e-05, "loss": 0.7446, "step": 417 }, { "epoch": 0.3426383098627628, "grad_norm": 1.0920861486438693, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.2325786352157593, "learning_rate": 1.529618698345045e-05, "loss": 0.7518, "step": 418 }, { "epoch": 0.34345801873803256, "grad_norm": 1.1246726579477655, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 1.1350693702697754, "learning_rate": 1.5273623366949525e-05, "loss": 0.6934, "step": 419 }, { "epoch": 0.34427772761330233, "grad_norm": 1.104894519569579, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.9632548689842224, "learning_rate": 1.5251022496385433e-05, "loss": 0.7086, "step": 420 }, { "epoch": 0.3450974364885721, "grad_norm": 1.1284625992921293, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.1495846062898636, "learning_rate": 1.5228384531415809e-05, "loss": 0.7797, "step": 421 }, { "epoch": 0.3459171453638419, "grad_norm": 1.2624137005707725, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.107270359992981, "learning_rate": 1.5205709631960337e-05, "loss": 0.7533, "step": 422 }, { "epoch": 0.34673685423911166, "grad_norm": 1.1679505360176594, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.004549090750515461, "learning_rate": 1.5182997958199617e-05, "loss": 0.7596, "step": 423 }, { "epoch": 0.34755656311438143, "grad_norm": 1.0305863615343753, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.37779948115348816, "learning_rate": 1.5160249670574026e-05, "loss": 0.7608, "step": 424 }, { "epoch": 0.34837627198965115, "grad_norm": 1.2653372287462519, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 1.3809720277786255, "learning_rate": 1.5137464929782586e-05, "loss": 0.7304, "step": 425 }, { "epoch": 0.34919598086492093, "grad_norm": 1.1153671822751252, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.1054792404174805, "learning_rate": 1.5114643896781844e-05, "loss": 0.7494, "step": 426 }, { "epoch": 0.3500156897401907, "grad_norm": 1.2198669463059018, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.7744995355606079, "learning_rate": 1.5091786732784717e-05, "loss": 0.698, "step": 427 }, { "epoch": 0.3508353986154605, "grad_norm": 1.2469585371854122, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.008866140618920326, "learning_rate": 1.5068893599259354e-05, "loss": 0.7237, "step": 428 }, { "epoch": 0.35165510749073026, "grad_norm": 1.1619422685629848, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.5654139518737793, "learning_rate": 1.5045964657928006e-05, "loss": 0.7499, "step": 429 }, { "epoch": 0.35247481636600003, "grad_norm": 1.2874009337999313, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.8137609958648682, "learning_rate": 1.5023000070765886e-05, "loss": 0.7655, "step": 430 }, { "epoch": 0.3532945252412698, "grad_norm": 1.181063898068999, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.5925420522689819, "learning_rate": 1.5000000000000002e-05, "loss": 0.7493, "step": 431 }, { "epoch": 0.35411423411653953, "grad_norm": 1.431751641376893, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.24875760078430176, "learning_rate": 1.4976964608108038e-05, "loss": 0.7296, "step": 432 }, { "epoch": 0.3549339429918093, "grad_norm": 1.450337835352188, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.7986298203468323, "learning_rate": 1.495389405781719e-05, "loss": 0.6947, "step": 433 }, { "epoch": 0.3557536518670791, "grad_norm": 1.0828766180768115, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.1904706060886383, "learning_rate": 1.4930788512103018e-05, "loss": 0.7542, "step": 434 }, { "epoch": 0.35657336074234885, "grad_norm": 1.4482726860430108, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.30834051966667175, "learning_rate": 1.4907648134188304e-05, "loss": 0.7347, "step": 435 }, { "epoch": 0.35739306961761863, "grad_norm": 0.9680081995026547, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 1.0483452081680298, "learning_rate": 1.488447308754189e-05, "loss": 0.7167, "step": 436 }, { "epoch": 0.3582127784928884, "grad_norm": 1.1076074093508796, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.2429572343826294, "learning_rate": 1.486126353587752e-05, "loss": 0.7631, "step": 437 }, { "epoch": 0.3590324873681581, "grad_norm": 1.4414761947441783, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.3687969744205475, "learning_rate": 1.4838019643152699e-05, "loss": 0.7185, "step": 438 }, { "epoch": 0.3598521962434279, "grad_norm": 1.0755669852842595, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.3020276427268982, "learning_rate": 1.4814741573567514e-05, "loss": 0.7242, "step": 439 }, { "epoch": 0.3606719051186977, "grad_norm": 1.0601470562875042, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.6490952968597412, "learning_rate": 1.47914294915635e-05, "loss": 0.7257, "step": 440 }, { "epoch": 0.36149161399396745, "grad_norm": 1.195441276823721, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.19314445555210114, "learning_rate": 1.4768083561822451e-05, "loss": 0.7449, "step": 441 }, { "epoch": 0.36231132286923723, "grad_norm": 1.2435878806244167, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.7209780216217041, "learning_rate": 1.4744703949265268e-05, "loss": 0.7524, "step": 442 }, { "epoch": 0.363131031744507, "grad_norm": 1.0983663881126378, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.9197759032249451, "learning_rate": 1.4721290819050804e-05, "loss": 0.7203, "step": 443 }, { "epoch": 0.3639507406197768, "grad_norm": 1.0767216250890932, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.4858049750328064, "learning_rate": 1.4697844336574685e-05, "loss": 0.7286, "step": 444 }, { "epoch": 0.3647704494950465, "grad_norm": 1.0905849338939828, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.1707854270935059, "learning_rate": 1.467436466746814e-05, "loss": 0.7085, "step": 445 }, { "epoch": 0.3655901583703163, "grad_norm": 1.1226230206866399, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.9817597270011902, "learning_rate": 1.465085197759684e-05, "loss": 0.7608, "step": 446 }, { "epoch": 0.36640986724558605, "grad_norm": 1.3369887187364704, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.8043301105499268, "learning_rate": 1.4627306433059724e-05, "loss": 0.738, "step": 447 }, { "epoch": 0.3672295761208558, "grad_norm": 1.2364783941457635, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 0.8743286728858948, "learning_rate": 1.4603728200187823e-05, "loss": 0.7193, "step": 448 }, { "epoch": 0.3680492849961256, "grad_norm": 1.1212546954830682, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.6300035119056702, "learning_rate": 1.4580117445543077e-05, "loss": 0.7568, "step": 449 }, { "epoch": 0.3688689938713954, "grad_norm": 1.2932495912189028, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.608639657497406, "learning_rate": 1.4556474335917181e-05, "loss": 0.7809, "step": 450 }, { "epoch": 0.36968870274666515, "grad_norm": 1.068165226472755, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.6490491628646851, "learning_rate": 1.4532799038330385e-05, "loss": 0.7382, "step": 451 }, { "epoch": 0.3705084116219349, "grad_norm": 1.3394371514055623, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.12041778862476349, "learning_rate": 1.4509091720030323e-05, "loss": 0.7515, "step": 452 }, { "epoch": 0.37132812049720465, "grad_norm": 1.1527658108193388, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.2717753052711487, "learning_rate": 1.4485352548490827e-05, "loss": 0.7418, "step": 453 }, { "epoch": 0.3721478293724744, "grad_norm": 1.2454380396096107, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.3366001546382904, "learning_rate": 1.4461581691410757e-05, "loss": 0.7381, "step": 454 }, { "epoch": 0.3729675382477442, "grad_norm": 1.435609533486633, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.6201334595680237, "learning_rate": 1.4437779316712797e-05, "loss": 0.7211, "step": 455 }, { "epoch": 0.373787247123014, "grad_norm": 1.1719917475059904, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.3496711254119873, "learning_rate": 1.4413945592542282e-05, "loss": 0.7119, "step": 456 }, { "epoch": 0.37460695599828375, "grad_norm": 1.2631644305361478, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.3474515676498413, "learning_rate": 1.4390080687266013e-05, "loss": 0.7389, "step": 457 }, { "epoch": 0.37542666487355353, "grad_norm": 1.374481287587369, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.9217073321342468, "learning_rate": 1.4366184769471053e-05, "loss": 0.7995, "step": 458 }, { "epoch": 0.37624637374882325, "grad_norm": 1.127443737194422, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.8698320388793945, "learning_rate": 1.4342258007963541e-05, "loss": 0.7308, "step": 459 }, { "epoch": 0.377066082624093, "grad_norm": 1.2250914713943573, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.49510273337364197, "learning_rate": 1.4318300571767514e-05, "loss": 0.7036, "step": 460 }, { "epoch": 0.3778857914993628, "grad_norm": 1.3170746977850143, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 0.9360310435295105, "learning_rate": 1.4294312630123699e-05, "loss": 0.8955, "step": 461 }, { "epoch": 0.3787055003746326, "grad_norm": 0.9506962746552086, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.0116680096834898, "learning_rate": 1.4270294352488316e-05, "loss": 0.7484, "step": 462 }, { "epoch": 0.37952520924990235, "grad_norm": 1.2476553828723418, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.415592759847641, "learning_rate": 1.4246245908531883e-05, "loss": 0.7755, "step": 463 }, { "epoch": 0.3803449181251721, "grad_norm": 1.0975995086599653, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.9603267908096313, "learning_rate": 1.4222167468138034e-05, "loss": 0.732, "step": 464 }, { "epoch": 0.38116462700044185, "grad_norm": 1.0281165949335278, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.9017184972763062, "learning_rate": 1.4198059201402288e-05, "loss": 0.7393, "step": 465 }, { "epoch": 0.3819843358757116, "grad_norm": 1.0545039514632228, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.1416831016540527, "learning_rate": 1.4173921278630874e-05, "loss": 0.7382, "step": 466 }, { "epoch": 0.3828040447509814, "grad_norm": 0.9931182499151184, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.2895710468292236, "learning_rate": 1.4149753870339509e-05, "loss": 0.7607, "step": 467 }, { "epoch": 0.3836237536262512, "grad_norm": 1.2336519636658767, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.06740442663431168, "learning_rate": 1.4125557147252215e-05, "loss": 0.7406, "step": 468 }, { "epoch": 0.38444346250152095, "grad_norm": 1.1112575513358713, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.37072986364364624, "learning_rate": 1.410133128030009e-05, "loss": 0.7604, "step": 469 }, { "epoch": 0.3852631713767907, "grad_norm": 1.086751556557447, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.5848031640052795, "learning_rate": 1.4077076440620112e-05, "loss": 0.7241, "step": 470 }, { "epoch": 0.3860828802520605, "grad_norm": 1.0116731470478444, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.8761907815933228, "learning_rate": 1.4052792799553935e-05, "loss": 0.7611, "step": 471 }, { "epoch": 0.3869025891273302, "grad_norm": 1.138166849503837, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.6764221787452698, "learning_rate": 1.4028480528646669e-05, "loss": 0.7349, "step": 472 }, { "epoch": 0.3877222980026, "grad_norm": 1.1322234026490996, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 2.2125132083892822, "learning_rate": 1.4004139799645669e-05, "loss": 0.7449, "step": 473 }, { "epoch": 0.38854200687786977, "grad_norm": 1.163668181603229, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.7021305561065674, "learning_rate": 1.3979770784499325e-05, "loss": 0.735, "step": 474 }, { "epoch": 0.38936171575313955, "grad_norm": 1.1154909803559077, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.3009178936481476, "learning_rate": 1.3955373655355852e-05, "loss": 0.7567, "step": 475 }, { "epoch": 0.3901814246284093, "grad_norm": 1.2757091043663418, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.5716661810874939, "learning_rate": 1.3930948584562062e-05, "loss": 0.7388, "step": 476 }, { "epoch": 0.3910011335036791, "grad_norm": 1.005428772677519, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.16034334897994995, "learning_rate": 1.3906495744662159e-05, "loss": 0.7399, "step": 477 }, { "epoch": 0.3918208423789489, "grad_norm": 1.2098812588919146, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.3458595275878906, "learning_rate": 1.3882015308396508e-05, "loss": 0.7515, "step": 478 }, { "epoch": 0.3926405512542186, "grad_norm": 1.0542600272021108, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.9916556477546692, "learning_rate": 1.3857507448700425e-05, "loss": 0.7659, "step": 479 }, { "epoch": 0.39346026012948837, "grad_norm": 1.1305994420021006, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 1.3020050525665283, "learning_rate": 1.3832972338702954e-05, "loss": 0.7261, "step": 480 }, { "epoch": 0.39427996900475815, "grad_norm": 1.3599263854538262, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.6249203681945801, "learning_rate": 1.3808410151725633e-05, "loss": 0.7338, "step": 481 }, { "epoch": 0.3950996778800279, "grad_norm": 0.9868710509969043, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.1347353160381317, "learning_rate": 1.3783821061281285e-05, "loss": 0.7062, "step": 482 }, { "epoch": 0.3959193867552977, "grad_norm": 1.0543382360242217, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.35934239625930786, "learning_rate": 1.3759205241072782e-05, "loss": 0.7774, "step": 483 }, { "epoch": 0.3967390956305675, "grad_norm": 1.1322176499919472, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.1221669912338257, "learning_rate": 1.3734562864991823e-05, "loss": 0.7282, "step": 484 }, { "epoch": 0.39755880450583725, "grad_norm": 1.301043094373027, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.604775071144104, "learning_rate": 1.3709894107117698e-05, "loss": 0.7796, "step": 485 }, { "epoch": 0.39837851338110697, "grad_norm": 1.2657953160151474, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.021316409111023, "learning_rate": 1.3685199141716074e-05, "loss": 0.74, "step": 486 }, { "epoch": 0.39919822225637674, "grad_norm": 1.1601299667099838, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.0085538625717163, "learning_rate": 1.3660478143237748e-05, "loss": 0.7207, "step": 487 }, { "epoch": 0.4000179311316465, "grad_norm": 1.0745042630624322, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.265486717224121, "learning_rate": 1.3635731286317415e-05, "loss": 0.7337, "step": 488 }, { "epoch": 0.4008376400069163, "grad_norm": 1.257397574792129, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.6353854537010193, "learning_rate": 1.3610958745772456e-05, "loss": 0.7496, "step": 489 }, { "epoch": 0.40165734888218607, "grad_norm": 1.1644571038180695, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.8903603553771973, "learning_rate": 1.3586160696601667e-05, "loss": 0.7426, "step": 490 }, { "epoch": 0.40247705775745585, "grad_norm": 0.9308681268157319, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.12310586124658585, "learning_rate": 1.3561337313984053e-05, "loss": 0.7252, "step": 491 }, { "epoch": 0.4032967666327256, "grad_norm": 0.9657237434155711, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.023039432242512703, "learning_rate": 1.3536488773277586e-05, "loss": 0.7425, "step": 492 }, { "epoch": 0.40411647550799534, "grad_norm": 1.3247122197056929, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.9444166421890259, "learning_rate": 1.3511615250017948e-05, "loss": 0.7122, "step": 493 }, { "epoch": 0.4049361843832651, "grad_norm": 1.3853407443801946, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.9036451578140259, "learning_rate": 1.3486716919917313e-05, "loss": 0.7437, "step": 494 }, { "epoch": 0.4057558932585349, "grad_norm": 1.1835695640951718, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.4188259243965149, "learning_rate": 1.3461793958863087e-05, "loss": 0.7303, "step": 495 }, { "epoch": 0.40657560213380467, "grad_norm": 1.1724134694184811, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.006541498936712742, "learning_rate": 1.3436846542916686e-05, "loss": 0.7074, "step": 496 }, { "epoch": 0.40739531100907445, "grad_norm": 1.1955449726577145, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.8993229269981384, "learning_rate": 1.3411874848312274e-05, "loss": 0.7392, "step": 497 }, { "epoch": 0.4082150198843442, "grad_norm": 1.1214979705605859, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.1051256656646729, "learning_rate": 1.338687905145552e-05, "loss": 0.7717, "step": 498 }, { "epoch": 0.40903472875961394, "grad_norm": 1.2736066433750048, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.8588690161705017, "learning_rate": 1.3361859328922368e-05, "loss": 0.7905, "step": 499 }, { "epoch": 0.4098544376348837, "grad_norm": 1.0983803661857154, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 1.2294137477874756, "learning_rate": 1.3336815857457772e-05, "loss": 0.7287, "step": 500 }, { "epoch": 0.4106741465101535, "grad_norm": 1.2890655846930097, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.059365153312683, "learning_rate": 1.3311748813974454e-05, "loss": 0.6994, "step": 501 }, { "epoch": 0.41149385538542327, "grad_norm": 1.2107844781460742, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.3470935821533203, "learning_rate": 1.3286658375551654e-05, "loss": 0.7324, "step": 502 }, { "epoch": 0.41231356426069304, "grad_norm": 1.3385292812796277, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.700898289680481, "learning_rate": 1.3261544719433878e-05, "loss": 0.7491, "step": 503 }, { "epoch": 0.4131332731359628, "grad_norm": 1.2939670938215888, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.353203684091568, "learning_rate": 1.3236408023029655e-05, "loss": 0.7668, "step": 504 }, { "epoch": 0.4139529820112326, "grad_norm": 1.147851487879954, "latest_boundary_loss": 0.00950749684125185, "latest_lm_loss": 2.3573265075683594, "learning_rate": 1.3211248463910263e-05, "loss": 0.7683, "step": 505 }, { "epoch": 0.4147726908865023, "grad_norm": 1.2335117447655448, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.7799752950668335, "learning_rate": 1.3186066219808498e-05, "loss": 0.6936, "step": 506 }, { "epoch": 0.4155923997617721, "grad_norm": 1.1170372539905529, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.4094339609146118, "learning_rate": 1.3160861468617402e-05, "loss": 0.7203, "step": 507 }, { "epoch": 0.41641210863704187, "grad_norm": 1.4661414757878448, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 2.2824676036834717, "learning_rate": 1.3135634388389016e-05, "loss": 0.7154, "step": 508 }, { "epoch": 0.41723181751231164, "grad_norm": 1.0196456579306, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.661888599395752, "learning_rate": 1.311038515733311e-05, "loss": 0.741, "step": 509 }, { "epoch": 0.4180515263875814, "grad_norm": 1.1275553911545413, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.1694858074188232, "learning_rate": 1.3085113953815948e-05, "loss": 0.7395, "step": 510 }, { "epoch": 0.4188712352628512, "grad_norm": 1.1461680509371541, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.6729932427406311, "learning_rate": 1.3059820956358998e-05, "loss": 0.7302, "step": 511 }, { "epoch": 0.41969094413812097, "grad_norm": 1.1291615140620963, "latest_boundary_loss": 0.009173923172056675, "latest_lm_loss": 0.5655929446220398, "learning_rate": 1.3034506343637687e-05, "loss": 0.7483, "step": 512 }, { "epoch": 0.4205106530133907, "grad_norm": 1.1655584396479437, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.03881552442908287, "learning_rate": 1.3009170294480149e-05, "loss": 0.7308, "step": 513 }, { "epoch": 0.42133036188866047, "grad_norm": 1.0495402945312882, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 1.2888919115066528, "learning_rate": 1.2983812987865936e-05, "loss": 0.7263, "step": 514 }, { "epoch": 0.42215007076393024, "grad_norm": 1.0955501569488508, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.059211887419223785, "learning_rate": 1.2958434602924771e-05, "loss": 0.7279, "step": 515 }, { "epoch": 0.4229697796392, "grad_norm": 1.3890715551550903, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.8923695683479309, "learning_rate": 1.2933035318935285e-05, "loss": 0.7664, "step": 516 }, { "epoch": 0.4237894885144698, "grad_norm": 1.223868985895175, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.6218183636665344, "learning_rate": 1.290761531532374e-05, "loss": 0.734, "step": 517 }, { "epoch": 0.42460919738973957, "grad_norm": 1.1339782948741959, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.10604207217693329, "learning_rate": 1.2882174771662765e-05, "loss": 0.7519, "step": 518 }, { "epoch": 0.42542890626500934, "grad_norm": 1.1938642967981403, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.4498766362667084, "learning_rate": 1.2856713867670089e-05, "loss": 0.7384, "step": 519 }, { "epoch": 0.42624861514027906, "grad_norm": 1.2206350865787712, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 0.554764449596405, "learning_rate": 1.2831232783207278e-05, "loss": 0.7627, "step": 520 }, { "epoch": 0.42706832401554884, "grad_norm": 1.0848106199767509, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.2671107053756714, "learning_rate": 1.2805731698278442e-05, "loss": 0.7152, "step": 521 }, { "epoch": 0.4278880328908186, "grad_norm": 1.1873998531086574, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.7407390475273132, "learning_rate": 1.2780210793028994e-05, "loss": 0.7248, "step": 522 }, { "epoch": 0.4287077417660884, "grad_norm": 1.1175539503369465, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.04558875039219856, "learning_rate": 1.2754670247744353e-05, "loss": 0.7582, "step": 523 }, { "epoch": 0.42952745064135817, "grad_norm": 1.1747279815932254, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.1720225811004639, "learning_rate": 1.272911024284869e-05, "loss": 0.7082, "step": 524 }, { "epoch": 0.43034715951662794, "grad_norm": 1.0195032381622187, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.30253586173057556, "learning_rate": 1.2703530958903631e-05, "loss": 0.7374, "step": 525 }, { "epoch": 0.4311668683918977, "grad_norm": 1.02508790813853, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.024762794375419617, "learning_rate": 1.2677932576606998e-05, "loss": 0.7446, "step": 526 }, { "epoch": 0.43198657726716744, "grad_norm": 1.0436409185663331, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 2.6144864559173584, "learning_rate": 1.265231527679153e-05, "loss": 0.6868, "step": 527 }, { "epoch": 0.4328062861424372, "grad_norm": 1.0837854209927567, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.0316283702850342, "learning_rate": 1.2626679240423605e-05, "loss": 0.7094, "step": 528 }, { "epoch": 0.433625995017707, "grad_norm": 1.0970445290150668, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.6730175614356995, "learning_rate": 1.260102464860195e-05, "loss": 0.7029, "step": 529 }, { "epoch": 0.43444570389297676, "grad_norm": 0.9845107027650578, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.36988866329193115, "learning_rate": 1.2575351682556387e-05, "loss": 0.7287, "step": 530 }, { "epoch": 0.43526541276824654, "grad_norm": 1.0551852431331465, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.8491936326026917, "learning_rate": 1.2549660523646527e-05, "loss": 0.7013, "step": 531 }, { "epoch": 0.4360851216435163, "grad_norm": 1.1409667432397954, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.215164065361023, "learning_rate": 1.2523951353360504e-05, "loss": 0.6913, "step": 532 }, { "epoch": 0.43690483051878604, "grad_norm": 1.2481842714766556, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.7520402073860168, "learning_rate": 1.2498224353313684e-05, "loss": 0.7328, "step": 533 }, { "epoch": 0.4377245393940558, "grad_norm": 0.9648944088037319, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.33235761523246765, "learning_rate": 1.2472479705247393e-05, "loss": 0.6906, "step": 534 }, { "epoch": 0.4385442482693256, "grad_norm": 1.109986630999586, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 0.04637651517987251, "learning_rate": 1.2446717591027624e-05, "loss": 0.7223, "step": 535 }, { "epoch": 0.43936395714459536, "grad_norm": 1.1547579521081723, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.1103997230529785, "learning_rate": 1.2420938192643746e-05, "loss": 0.712, "step": 536 }, { "epoch": 0.44018366601986514, "grad_norm": 0.9662969033428204, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.5339496731758118, "learning_rate": 1.2395141692207244e-05, "loss": 0.7405, "step": 537 }, { "epoch": 0.4410033748951349, "grad_norm": 1.1567395843875306, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 1.1351995468139648, "learning_rate": 1.2369328271950404e-05, "loss": 0.7741, "step": 538 }, { "epoch": 0.4418230837704047, "grad_norm": 1.1233943419980932, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.2399036884307861, "learning_rate": 1.2343498114225038e-05, "loss": 0.741, "step": 539 }, { "epoch": 0.4426427926456744, "grad_norm": 1.4207818391730094, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.010393626056611538, "learning_rate": 1.2317651401501201e-05, "loss": 0.7307, "step": 540 }, { "epoch": 0.4434625015209442, "grad_norm": 1.2255555286398303, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.7697814702987671, "learning_rate": 1.229178831636589e-05, "loss": 0.7216, "step": 541 }, { "epoch": 0.44428221039621396, "grad_norm": 1.3881863141796988, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 0.99439936876297, "learning_rate": 1.2265909041521764e-05, "loss": 0.6919, "step": 542 }, { "epoch": 0.44510191927148374, "grad_norm": 1.1200242781841891, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.002538105705752969, "learning_rate": 1.2240013759785849e-05, "loss": 0.6837, "step": 543 }, { "epoch": 0.4459216281467535, "grad_norm": 1.4755758588162742, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.9102796912193298, "learning_rate": 1.2214102654088248e-05, "loss": 0.7379, "step": 544 }, { "epoch": 0.4467413370220233, "grad_norm": 1.2072608424427014, "latest_boundary_loss": 0.010217878967523575, "latest_lm_loss": 0.5200499892234802, "learning_rate": 1.2188175907470847e-05, "loss": 0.723, "step": 545 }, { "epoch": 0.44756104589729306, "grad_norm": 1.3118723912510926, "latest_boundary_loss": 0.010783301666378975, "latest_lm_loss": 0.6302790641784668, "learning_rate": 1.2162233703086024e-05, "loss": 0.7146, "step": 546 }, { "epoch": 0.4483807547725628, "grad_norm": 1.3015491045292682, "latest_boundary_loss": 0.009173923172056675, "latest_lm_loss": 0.35810452699661255, "learning_rate": 1.2136276224195349e-05, "loss": 0.7129, "step": 547 }, { "epoch": 0.44920046364783256, "grad_norm": 1.1115206010180478, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 1.2085323333740234, "learning_rate": 1.2110303654168305e-05, "loss": 0.7351, "step": 548 }, { "epoch": 0.45002017252310234, "grad_norm": 1.2978456657040731, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.22683051228523254, "learning_rate": 1.2084316176480972e-05, "loss": 0.7369, "step": 549 }, { "epoch": 0.4508398813983721, "grad_norm": 1.1386797203646921, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.8762317895889282, "learning_rate": 1.2058313974714746e-05, "loss": 0.7793, "step": 550 }, { "epoch": 0.4516595902736419, "grad_norm": 1.133369505534749, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.18357262015342712, "learning_rate": 1.2032297232555039e-05, "loss": 0.7164, "step": 551 }, { "epoch": 0.45247929914891166, "grad_norm": 1.0976464923659344, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.44615650177001953, "learning_rate": 1.2006266133789975e-05, "loss": 0.7183, "step": 552 }, { "epoch": 0.45329900802418144, "grad_norm": 1.1047182843536714, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.0865058898925781, "learning_rate": 1.1980220862309097e-05, "loss": 0.7209, "step": 553 }, { "epoch": 0.45411871689945116, "grad_norm": 0.8690509383094088, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.9522266387939453, "learning_rate": 1.1954161602102068e-05, "loss": 0.7248, "step": 554 }, { "epoch": 0.45493842577472093, "grad_norm": 1.2804506079189952, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.9156290292739868, "learning_rate": 1.1928088537257376e-05, "loss": 0.7258, "step": 555 }, { "epoch": 0.4557581346499907, "grad_norm": 1.170165270344948, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.4329899251461029, "learning_rate": 1.1902001851961019e-05, "loss": 0.7441, "step": 556 }, { "epoch": 0.4565778435252605, "grad_norm": 1.1450043269486405, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.7363948822021484, "learning_rate": 1.1875901730495215e-05, "loss": 0.7485, "step": 557 }, { "epoch": 0.45739755240053026, "grad_norm": 1.1176526384115035, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.8782221078872681, "learning_rate": 1.1849788357237108e-05, "loss": 0.722, "step": 558 }, { "epoch": 0.45821726127580004, "grad_norm": 1.1399109509361585, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.7295437455177307, "learning_rate": 1.1823661916657441e-05, "loss": 0.7572, "step": 559 }, { "epoch": 0.45903697015106976, "grad_norm": 1.176821184062998, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.22839243710041046, "learning_rate": 1.1797522593319277e-05, "loss": 0.7035, "step": 560 }, { "epoch": 0.45985667902633953, "grad_norm": 1.0824518861080836, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.1131099462509155, "learning_rate": 1.1771370571876681e-05, "loss": 0.7579, "step": 561 }, { "epoch": 0.4606763879016093, "grad_norm": 1.1658397590461065, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.500022292137146, "learning_rate": 1.1745206037073426e-05, "loss": 0.7197, "step": 562 }, { "epoch": 0.4614960967768791, "grad_norm": 0.9696314773240985, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.3225027322769165, "learning_rate": 1.1719029173741675e-05, "loss": 0.7487, "step": 563 }, { "epoch": 0.46231580565214886, "grad_norm": 1.2749941050242513, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.002359984442591667, "learning_rate": 1.1692840166800688e-05, "loss": 0.7855, "step": 564 }, { "epoch": 0.46313551452741863, "grad_norm": 1.131174909872021, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 3.8920021057128906, "learning_rate": 1.1666639201255507e-05, "loss": 0.7333, "step": 565 }, { "epoch": 0.4639552234026884, "grad_norm": 1.13226898831104, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.30660176277160645, "learning_rate": 1.1640426462195654e-05, "loss": 0.7062, "step": 566 }, { "epoch": 0.46477493227795813, "grad_norm": 1.0344878166410363, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.33057618141174316, "learning_rate": 1.1614202134793823e-05, "loss": 0.694, "step": 567 }, { "epoch": 0.4655946411532279, "grad_norm": 1.1937403952306902, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.015523593872785568, "learning_rate": 1.1587966404304565e-05, "loss": 0.6908, "step": 568 }, { "epoch": 0.4664143500284977, "grad_norm": 1.1090389635648843, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.8839054107666016, "learning_rate": 1.1561719456062995e-05, "loss": 0.7354, "step": 569 }, { "epoch": 0.46723405890376746, "grad_norm": 1.1840219229359357, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.514827311038971, "learning_rate": 1.1535461475483461e-05, "loss": 0.7264, "step": 570 }, { "epoch": 0.46805376777903723, "grad_norm": 1.0017285522394928, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.6833021640777588, "learning_rate": 1.150919264805825e-05, "loss": 0.7183, "step": 571 }, { "epoch": 0.468873476654307, "grad_norm": 0.9595248061054589, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.1614549160003662, "learning_rate": 1.1482913159356281e-05, "loss": 0.7504, "step": 572 }, { "epoch": 0.4696931855295768, "grad_norm": 1.1999497042810918, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.9407356977462769, "learning_rate": 1.1456623195021778e-05, "loss": 0.7227, "step": 573 }, { "epoch": 0.4705128944048465, "grad_norm": 1.1355241972313819, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.5009220242500305, "learning_rate": 1.143032294077297e-05, "loss": 0.7823, "step": 574 }, { "epoch": 0.4713326032801163, "grad_norm": 1.1373593094185455, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.9563060402870178, "learning_rate": 1.1404012582400778e-05, "loss": 0.6815, "step": 575 }, { "epoch": 0.47215231215538606, "grad_norm": 1.02016469051092, "latest_boundary_loss": 0.0103687709197402, "latest_lm_loss": 0.9105382561683655, "learning_rate": 1.1377692305767496e-05, "loss": 0.7352, "step": 576 }, { "epoch": 0.47297202103065583, "grad_norm": 1.2452483209023992, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.5182563066482544, "learning_rate": 1.1351362296805487e-05, "loss": 0.7558, "step": 577 }, { "epoch": 0.4737917299059256, "grad_norm": 1.1671462620742221, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.8756719827651978, "learning_rate": 1.1325022741515865e-05, "loss": 0.7339, "step": 578 }, { "epoch": 0.4746114387811954, "grad_norm": 1.1830446171622626, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 2.7221529483795166, "learning_rate": 1.1298673825967184e-05, "loss": 0.7296, "step": 579 }, { "epoch": 0.47543114765646516, "grad_norm": 1.067104366060196, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.6956509947776794, "learning_rate": 1.1272315736294108e-05, "loss": 0.779, "step": 580 }, { "epoch": 0.4762508565317349, "grad_norm": 1.1437808356933874, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.2700379192829132, "learning_rate": 1.1245948658696127e-05, "loss": 0.7224, "step": 581 }, { "epoch": 0.47707056540700465, "grad_norm": 1.0850681144037142, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.2734732925891876, "learning_rate": 1.1219572779436215e-05, "loss": 0.6841, "step": 582 }, { "epoch": 0.47789027428227443, "grad_norm": 1.0295891703034161, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.6549234986305237, "learning_rate": 1.1193188284839518e-05, "loss": 0.7038, "step": 583 }, { "epoch": 0.4787099831575442, "grad_norm": 0.9417735245212596, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.17740729451179504, "learning_rate": 1.1166795361292055e-05, "loss": 0.7134, "step": 584 }, { "epoch": 0.479529692032814, "grad_norm": 1.0717976605903112, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.9407469034194946, "learning_rate": 1.1140394195239376e-05, "loss": 0.7312, "step": 585 }, { "epoch": 0.48034940090808376, "grad_norm": 1.0454325438374934, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.17677555978298187, "learning_rate": 1.1113984973185268e-05, "loss": 0.7317, "step": 586 }, { "epoch": 0.48116910978335353, "grad_norm": 1.1317207451327171, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.7309148907661438, "learning_rate": 1.1087567881690422e-05, "loss": 0.699, "step": 587 }, { "epoch": 0.48198881865862325, "grad_norm": 1.1152857660587148, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.7345439195632935, "learning_rate": 1.1061143107371122e-05, "loss": 0.7697, "step": 588 }, { "epoch": 0.48280852753389303, "grad_norm": 1.6202580460230573, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.0013889408437535167, "learning_rate": 1.1034710836897922e-05, "loss": 0.7546, "step": 589 }, { "epoch": 0.4836282364091628, "grad_norm": 1.2262278117636485, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.024789571762085, "learning_rate": 1.1008271256994338e-05, "loss": 0.7729, "step": 590 }, { "epoch": 0.4844479452844326, "grad_norm": 1.0314200043962447, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.0004191500192973763, "learning_rate": 1.0981824554435518e-05, "loss": 0.7379, "step": 591 }, { "epoch": 0.48526765415970236, "grad_norm": 0.9605216918624647, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.8892647624015808, "learning_rate": 1.095537091604692e-05, "loss": 0.727, "step": 592 }, { "epoch": 0.48608736303497213, "grad_norm": 1.1482266267714891, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.17624390125274658, "learning_rate": 1.0928910528703007e-05, "loss": 0.7201, "step": 593 }, { "epoch": 0.48690707191024185, "grad_norm": 1.0711343930243284, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.4015139043331146, "learning_rate": 1.0902443579325914e-05, "loss": 0.7092, "step": 594 }, { "epoch": 0.4877267807855116, "grad_norm": 1.0237731523270135, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.3743845224380493, "learning_rate": 1.087597025488413e-05, "loss": 0.7215, "step": 595 }, { "epoch": 0.4885464896607814, "grad_norm": 1.195715711617991, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.1295346021652222, "learning_rate": 1.0849490742391184e-05, "loss": 0.7478, "step": 596 }, { "epoch": 0.4893661985360512, "grad_norm": 0.8565471225253243, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.2088268995285034, "learning_rate": 1.0823005228904315e-05, "loss": 0.6693, "step": 597 }, { "epoch": 0.49018590741132095, "grad_norm": 1.0579159505400326, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.006226507015526295, "learning_rate": 1.0796513901523156e-05, "loss": 0.7047, "step": 598 }, { "epoch": 0.49100561628659073, "grad_norm": 1.2411125504060623, "latest_boundary_loss": 0.010595110245049, "latest_lm_loss": 1.092541217803955, "learning_rate": 1.0770016947388407e-05, "loss": 0.7204, "step": 599 }, { "epoch": 0.4918253251618605, "grad_norm": 1.1697544242871416, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.0005898121744394302, "learning_rate": 1.0743514553680521e-05, "loss": 0.7191, "step": 600 }, { "epoch": 0.4926450340371302, "grad_norm": 1.150186014642122, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.2228296846151352, "learning_rate": 1.0717006907618377e-05, "loss": 0.7198, "step": 601 }, { "epoch": 0.4934647429124, "grad_norm": 1.0878926057306257, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.24664446711540222, "learning_rate": 1.0690494196457954e-05, "loss": 0.6972, "step": 602 }, { "epoch": 0.4942844517876698, "grad_norm": 1.1557051213120508, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.2222727537155151, "learning_rate": 1.066397660749102e-05, "loss": 0.7766, "step": 603 }, { "epoch": 0.49510416066293955, "grad_norm": 1.6902267456131215, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.47474098205566406, "learning_rate": 1.0637454328043792e-05, "loss": 0.7588, "step": 604 }, { "epoch": 0.4959238695382093, "grad_norm": 1.1462993133221944, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.09917628020048141, "learning_rate": 1.0610927545475624e-05, "loss": 0.6974, "step": 605 }, { "epoch": 0.4967435784134791, "grad_norm": 1.2330122895773428, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 2.0664823055267334, "learning_rate": 1.0584396447177682e-05, "loss": 0.7141, "step": 606 }, { "epoch": 0.4975632872887489, "grad_norm": 1.1903223489656898, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.3248700201511383, "learning_rate": 1.0557861220571626e-05, "loss": 0.7436, "step": 607 }, { "epoch": 0.4983829961640186, "grad_norm": 1.0525145726041336, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.9246601462364197, "learning_rate": 1.0531322053108268e-05, "loss": 0.7358, "step": 608 }, { "epoch": 0.4992027050392884, "grad_norm": 1.073387686301777, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.7231375575065613, "learning_rate": 1.050477913226626e-05, "loss": 0.7099, "step": 609 }, { "epoch": 0.5000224139145582, "grad_norm": 1.0785844051974611, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.9444078803062439, "learning_rate": 1.0478232645550784e-05, "loss": 0.7155, "step": 610 }, { "epoch": 0.5008421227898279, "grad_norm": 1.2033871638732478, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.017397088930010796, "learning_rate": 1.045168278049219e-05, "loss": 0.6901, "step": 611 }, { "epoch": 0.5016618316650977, "grad_norm": 1.245964229930425, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.8417883515357971, "learning_rate": 1.042512972464471e-05, "loss": 0.7753, "step": 612 }, { "epoch": 0.5024815405403674, "grad_norm": 1.1704580710656929, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.7384148240089417, "learning_rate": 1.0398573665585105e-05, "loss": 0.7798, "step": 613 }, { "epoch": 0.5033012494156373, "grad_norm": 1.03512114659302, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.712203025817871, "learning_rate": 1.0372014790911365e-05, "loss": 0.7085, "step": 614 }, { "epoch": 0.504120958290907, "grad_norm": 1.0600114615644445, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.008176220580935478, "learning_rate": 1.0345453288241356e-05, "loss": 0.7381, "step": 615 }, { "epoch": 0.5049406671661768, "grad_norm": 0.9570963129188469, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.1741873025894165, "learning_rate": 1.0318889345211519e-05, "loss": 0.6863, "step": 616 }, { "epoch": 0.5057603760414465, "grad_norm": 1.0952226234220879, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.05534173920750618, "learning_rate": 1.0292323149475527e-05, "loss": 0.7389, "step": 617 }, { "epoch": 0.5065800849167162, "grad_norm": 0.912949202558354, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.8197525143623352, "learning_rate": 1.0265754888702972e-05, "loss": 0.6844, "step": 618 }, { "epoch": 0.5073997937919861, "grad_norm": 0.9542031231884737, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.9308606386184692, "learning_rate": 1.023918475057803e-05, "loss": 0.735, "step": 619 }, { "epoch": 0.5082195026672558, "grad_norm": 1.118753957075958, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.1839903593063354, "learning_rate": 1.0212612922798143e-05, "loss": 0.721, "step": 620 }, { "epoch": 0.5090392115425256, "grad_norm": 1.0574981809029294, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 1.0315492153167725, "learning_rate": 1.0186039593072685e-05, "loss": 0.7423, "step": 621 }, { "epoch": 0.5098589204177953, "grad_norm": 1.080483408748035, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.323687195777893, "learning_rate": 1.0159464949121642e-05, "loss": 0.7038, "step": 622 }, { "epoch": 0.5106786292930652, "grad_norm": 1.1495723023434858, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.4183761179447174, "learning_rate": 1.0132889178674283e-05, "loss": 0.6813, "step": 623 }, { "epoch": 0.5114983381683349, "grad_norm": 1.0708901223645004, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.6019342541694641, "learning_rate": 1.0106312469467841e-05, "loss": 0.6973, "step": 624 }, { "epoch": 0.5123180470436046, "grad_norm": 1.0609805328828794, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.6901552677154541, "learning_rate": 1.0079735009246168e-05, "loss": 0.7157, "step": 625 }, { "epoch": 0.5131377559188744, "grad_norm": 1.0793708606491978, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.2777204513549805, "learning_rate": 1.0053156985758435e-05, "loss": 0.7053, "step": 626 }, { "epoch": 0.5139574647941442, "grad_norm": 1.042882812280101, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 0.24890795350074768, "learning_rate": 1.0026578586757778e-05, "loss": 0.7315, "step": 627 }, { "epoch": 0.514777173669414, "grad_norm": 1.0704113771661667, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.001798719633370638, "learning_rate": 1e-05, "loss": 0.7072, "step": 628 }, { "epoch": 0.5155968825446837, "grad_norm": 1.2562455410918247, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.0021001591812819242, "learning_rate": 9.973421413242224e-06, "loss": 0.7203, "step": 629 }, { "epoch": 0.5164165914199536, "grad_norm": 1.0994419417627264, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 0.7506188750267029, "learning_rate": 9.946843014241572e-06, "loss": 0.6909, "step": 630 }, { "epoch": 0.5172363002952233, "grad_norm": 1.2375909342165958, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.39570170640945435, "learning_rate": 9.920264990753837e-06, "loss": 0.7544, "step": 631 }, { "epoch": 0.518056009170493, "grad_norm": 1.096691302552204, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.8150815367698669, "learning_rate": 9.89368753053216e-06, "loss": 0.7264, "step": 632 }, { "epoch": 0.5188757180457628, "grad_norm": 0.9242020166609775, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.5993018746376038, "learning_rate": 9.867110821325717e-06, "loss": 0.7034, "step": 633 }, { "epoch": 0.5196954269210325, "grad_norm": 1.2875091637975744, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.6435448527336121, "learning_rate": 9.84053505087836e-06, "loss": 0.7659, "step": 634 }, { "epoch": 0.5205151357963024, "grad_norm": 1.048438518894306, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.9572287797927856, "learning_rate": 9.813960406927318e-06, "loss": 0.7664, "step": 635 }, { "epoch": 0.5213348446715721, "grad_norm": 1.0659205610623086, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 0.2686935067176819, "learning_rate": 9.78738707720186e-06, "loss": 0.7183, "step": 636 }, { "epoch": 0.5221545535468419, "grad_norm": 1.1248446324679613, "latest_boundary_loss": 0.011393229477107525, "latest_lm_loss": 0.7095032334327698, "learning_rate": 9.760815249421973e-06, "loss": 0.6971, "step": 637 }, { "epoch": 0.5229742624221116, "grad_norm": 1.0578124703072807, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.883781909942627, "learning_rate": 9.734245111297033e-06, "loss": 0.721, "step": 638 }, { "epoch": 0.5237939712973814, "grad_norm": 1.1806363847040355, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.3163931667804718, "learning_rate": 9.707676850524473e-06, "loss": 0.7367, "step": 639 }, { "epoch": 0.5246136801726512, "grad_norm": 1.219757523386211, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 1.1046773195266724, "learning_rate": 9.681110654788483e-06, "loss": 0.7116, "step": 640 }, { "epoch": 0.5254333890479209, "grad_norm": 1.1347077944745365, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.4496431350708008, "learning_rate": 9.654546711758646e-06, "loss": 0.691, "step": 641 }, { "epoch": 0.5262530979231907, "grad_norm": 1.0012148282442592, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.3716098666191101, "learning_rate": 9.627985209088639e-06, "loss": 0.6929, "step": 642 }, { "epoch": 0.5270728067984605, "grad_norm": 1.1425197117924417, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.8193522095680237, "learning_rate": 9.601426334414898e-06, "loss": 0.729, "step": 643 }, { "epoch": 0.5278925156737303, "grad_norm": 1.019986159100477, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.1597791910171509, "learning_rate": 9.574870275355295e-06, "loss": 0.7287, "step": 644 }, { "epoch": 0.528712224549, "grad_norm": 1.1604093114457519, "latest_boundary_loss": 0.009594811126589775, "latest_lm_loss": 1.4892265796661377, "learning_rate": 9.548317219507815e-06, "loss": 0.7184, "step": 645 }, { "epoch": 0.5295319334242697, "grad_norm": 1.483993991819289, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.12539419531822205, "learning_rate": 9.521767354449218e-06, "loss": 0.734, "step": 646 }, { "epoch": 0.5303516422995396, "grad_norm": 1.036929526058256, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.7307741045951843, "learning_rate": 9.49522086773374e-06, "loss": 0.7328, "step": 647 }, { "epoch": 0.5311713511748093, "grad_norm": 1.291486321466326, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.47581589221954346, "learning_rate": 9.468677946891735e-06, "loss": 0.7026, "step": 648 }, { "epoch": 0.5319910600500791, "grad_norm": 1.1146219843058858, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.3764333724975586, "learning_rate": 9.442138779428376e-06, "loss": 0.739, "step": 649 }, { "epoch": 0.5328107689253488, "grad_norm": 1.6522134850308168, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.19095967710018158, "learning_rate": 9.41560355282232e-06, "loss": 0.7323, "step": 650 }, { "epoch": 0.5336304778006187, "grad_norm": 1.0716907194756398, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.652411699295044, "learning_rate": 9.389072454524381e-06, "loss": 0.7191, "step": 651 }, { "epoch": 0.5344501866758884, "grad_norm": 1.0169426857981612, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.1539286375045776, "learning_rate": 9.362545671956213e-06, "loss": 0.7333, "step": 652 }, { "epoch": 0.5352698955511581, "grad_norm": 1.1912984840702656, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.14942972362041473, "learning_rate": 9.33602339250898e-06, "loss": 0.716, "step": 653 }, { "epoch": 0.536089604426428, "grad_norm": 0.9797072624325139, "latest_boundary_loss": 0.0116666154935956, "latest_lm_loss": 1.0117323398590088, "learning_rate": 9.309505803542046e-06, "loss": 0.7197, "step": 654 }, { "epoch": 0.5369093133016977, "grad_norm": 1.27841091346885, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.050676703453064, "learning_rate": 9.282993092381626e-06, "loss": 0.7326, "step": 655 }, { "epoch": 0.5377290221769675, "grad_norm": 1.2816175226911415, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.42775171995162964, "learning_rate": 9.256485446319482e-06, "loss": 0.7027, "step": 656 }, { "epoch": 0.5385487310522372, "grad_norm": 0.9562760093022653, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.2111191302537918, "learning_rate": 9.229983052611598e-06, "loss": 0.7194, "step": 657 }, { "epoch": 0.539368439927507, "grad_norm": 1.0168456417745109, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.758185863494873, "learning_rate": 9.20348609847685e-06, "loss": 0.6871, "step": 658 }, { "epoch": 0.5401881488027768, "grad_norm": 1.1045357533948532, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.3062596619129181, "learning_rate": 9.176994771095687e-06, "loss": 0.7324, "step": 659 }, { "epoch": 0.5410078576780465, "grad_norm": 1.0983805883314763, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.8686639666557312, "learning_rate": 9.150509257608816e-06, "loss": 0.717, "step": 660 }, { "epoch": 0.5418275665533163, "grad_norm": 1.0487305785071754, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.10697158426046371, "learning_rate": 9.124029745115872e-06, "loss": 0.7225, "step": 661 }, { "epoch": 0.542647275428586, "grad_norm": 1.0824569577135843, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.41282209753990173, "learning_rate": 9.097556420674089e-06, "loss": 0.7235, "step": 662 }, { "epoch": 0.5434669843038559, "grad_norm": 0.9881158317647951, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.5716696977615356, "learning_rate": 9.071089471296996e-06, "loss": 0.7232, "step": 663 }, { "epoch": 0.5442866931791256, "grad_norm": 1.2041587692705953, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.0194302797317505, "learning_rate": 9.044629083953082e-06, "loss": 0.7358, "step": 664 }, { "epoch": 0.5451064020543954, "grad_norm": 1.0174095332724522, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.5871102213859558, "learning_rate": 9.018175445564485e-06, "loss": 0.7085, "step": 665 }, { "epoch": 0.5459261109296651, "grad_norm": 1.0168596416332918, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.6220500469207764, "learning_rate": 8.991728743005664e-06, "loss": 0.6723, "step": 666 }, { "epoch": 0.5467458198049349, "grad_norm": 1.1448265754305291, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.3487257659435272, "learning_rate": 8.96528916310208e-06, "loss": 0.6981, "step": 667 }, { "epoch": 0.5475655286802047, "grad_norm": 1.1381546334876926, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.003576934803277254, "learning_rate": 8.938856892628881e-06, "loss": 0.7302, "step": 668 }, { "epoch": 0.5483852375554744, "grad_norm": 1.120347942391586, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 1.5112172365188599, "learning_rate": 8.912432118309581e-06, "loss": 0.7211, "step": 669 }, { "epoch": 0.5492049464307442, "grad_norm": 0.963984133932689, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.3610379099845886, "learning_rate": 8.886015026814736e-06, "loss": 0.7027, "step": 670 }, { "epoch": 0.550024655306014, "grad_norm": 1.1969310080956581, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.8786677122116089, "learning_rate": 8.859605804760626e-06, "loss": 0.7521, "step": 671 }, { "epoch": 0.5508443641812837, "grad_norm": 1.0563801749178237, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.1674472689628601, "learning_rate": 8.833204638707948e-06, "loss": 0.6914, "step": 672 }, { "epoch": 0.5516640730565535, "grad_norm": 0.9770971298549285, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.758647084236145, "learning_rate": 8.806811715160485e-06, "loss": 0.6888, "step": 673 }, { "epoch": 0.5524837819318232, "grad_norm": 0.9295606646059391, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.25262922048568726, "learning_rate": 8.780427220563788e-06, "loss": 0.6976, "step": 674 }, { "epoch": 0.5533034908070931, "grad_norm": 1.0806826870168234, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.48504555225372314, "learning_rate": 8.754051341303875e-06, "loss": 0.7079, "step": 675 }, { "epoch": 0.5541231996823628, "grad_norm": 1.122764144079733, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.0578742027282715, "learning_rate": 8.727684263705896e-06, "loss": 0.6942, "step": 676 }, { "epoch": 0.5549429085576326, "grad_norm": 0.9773122373307848, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.07475745677947998, "learning_rate": 8.701326174032821e-06, "loss": 0.6928, "step": 677 }, { "epoch": 0.5557626174329023, "grad_norm": 1.2777236653642965, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.0010771258966997266, "learning_rate": 8.674977258484136e-06, "loss": 0.7171, "step": 678 }, { "epoch": 0.5565823263081721, "grad_norm": 0.9436931371907279, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.5083873271942139, "learning_rate": 8.648637703194515e-06, "loss": 0.6888, "step": 679 }, { "epoch": 0.5574020351834419, "grad_norm": 1.0637358837003335, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.5062256455421448, "learning_rate": 8.622307694232508e-06, "loss": 0.7053, "step": 680 }, { "epoch": 0.5582217440587116, "grad_norm": 1.1849567731343693, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.006737938616424799, "learning_rate": 8.595987417599225e-06, "loss": 0.7162, "step": 681 }, { "epoch": 0.5590414529339814, "grad_norm": 1.004596122413389, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.0521949529647827, "learning_rate": 8.569677059227033e-06, "loss": 0.7004, "step": 682 }, { "epoch": 0.5598611618092512, "grad_norm": 1.1290098203224677, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.6594796180725098, "learning_rate": 8.543376804978223e-06, "loss": 0.6797, "step": 683 }, { "epoch": 0.560680870684521, "grad_norm": 0.929255384458776, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 2.161489963531494, "learning_rate": 8.517086840643722e-06, "loss": 0.7166, "step": 684 }, { "epoch": 0.5615005795597907, "grad_norm": 1.1293721513691184, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.2538692355155945, "learning_rate": 8.490807351941753e-06, "loss": 0.7503, "step": 685 }, { "epoch": 0.5623202884350604, "grad_norm": 1.0592932191803128, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 1.0668712854385376, "learning_rate": 8.464538524516546e-06, "loss": 0.7501, "step": 686 }, { "epoch": 0.5631399973103303, "grad_norm": 1.0993364695474808, "latest_boundary_loss": 0.008892906829714775, "latest_lm_loss": 0.9446035623550415, "learning_rate": 8.438280543937012e-06, "loss": 0.7143, "step": 687 }, { "epoch": 0.5639597061856, "grad_norm": 1.1829425988049713, "latest_boundary_loss": 0.0098554827272892, "latest_lm_loss": 0.15057814121246338, "learning_rate": 8.412033595695436e-06, "loss": 0.7026, "step": 688 }, { "epoch": 0.5647794150608698, "grad_norm": 1.0224316632174533, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.05434364452958107, "learning_rate": 8.385797865206178e-06, "loss": 0.7269, "step": 689 }, { "epoch": 0.5655991239361395, "grad_norm": 0.9314195854876334, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.9874452948570251, "learning_rate": 8.359573537804347e-06, "loss": 0.6928, "step": 690 }, { "epoch": 0.5664188328114094, "grad_norm": 0.9786572196977079, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.6253742575645447, "learning_rate": 8.333360798744496e-06, "loss": 0.6971, "step": 691 }, { "epoch": 0.5672385416866791, "grad_norm": 0.9234982658752885, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.8906906247138977, "learning_rate": 8.307159833199317e-06, "loss": 0.7238, "step": 692 }, { "epoch": 0.5680582505619488, "grad_norm": 1.0401153607882172, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.8983895778656006, "learning_rate": 8.28097082625833e-06, "loss": 0.7262, "step": 693 }, { "epoch": 0.5688779594372186, "grad_norm": 1.0168833635090133, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.5647414922714233, "learning_rate": 8.254793962926579e-06, "loss": 0.7088, "step": 694 }, { "epoch": 0.5696976683124884, "grad_norm": 1.010860365594221, "latest_boundary_loss": 0.00950749684125185, "latest_lm_loss": 0.29505330324172974, "learning_rate": 8.228629428123319e-06, "loss": 0.7467, "step": 695 }, { "epoch": 0.5705173771877582, "grad_norm": 1.297269460623968, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.4030215740203857, "learning_rate": 8.202477406680725e-06, "loss": 0.7027, "step": 696 }, { "epoch": 0.5713370860630279, "grad_norm": 1.0523990935513807, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.48803091049194336, "learning_rate": 8.17633808334256e-06, "loss": 0.7217, "step": 697 }, { "epoch": 0.5721567949382977, "grad_norm": 0.9699511942059086, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.06064368784427643, "learning_rate": 8.150211642762895e-06, "loss": 0.6941, "step": 698 }, { "epoch": 0.5729765038135675, "grad_norm": 1.0664465478188756, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.089992642402649, "learning_rate": 8.124098269504786e-06, "loss": 0.7058, "step": 699 }, { "epoch": 0.5737962126888372, "grad_norm": 1.090019343414517, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.26992881298065186, "learning_rate": 8.097998148038986e-06, "loss": 0.7102, "step": 700 }, { "epoch": 0.574615921564107, "grad_norm": 1.0837025854165607, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.23298679292201996, "learning_rate": 8.07191146274263e-06, "loss": 0.6971, "step": 701 }, { "epoch": 0.5754356304393767, "grad_norm": 1.1828882996025294, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.1900869607925415, "learning_rate": 8.045838397897932e-06, "loss": 0.7603, "step": 702 }, { "epoch": 0.5762553393146466, "grad_norm": 1.0648146845978368, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.1167309284210205, "learning_rate": 8.019779137690906e-06, "loss": 0.7167, "step": 703 }, { "epoch": 0.5770750481899163, "grad_norm": 0.9060772238092258, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.37196096777915955, "learning_rate": 7.993733866210029e-06, "loss": 0.7052, "step": 704 }, { "epoch": 0.5778947570651861, "grad_norm": 1.0038910963883285, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.0469224452972412, "learning_rate": 7.967702767444963e-06, "loss": 0.7201, "step": 705 }, { "epoch": 0.5787144659404558, "grad_norm": 1.1439741859893668, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.0404729843139648, "learning_rate": 7.941686025285257e-06, "loss": 0.7356, "step": 706 }, { "epoch": 0.5795341748157256, "grad_norm": 0.9774561619983333, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 0.9486600160598755, "learning_rate": 7.915683823519031e-06, "loss": 0.7014, "step": 707 }, { "epoch": 0.5803538836909954, "grad_norm": 1.1563971400713233, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 1.2141032218933105, "learning_rate": 7.889696345831696e-06, "loss": 0.7355, "step": 708 }, { "epoch": 0.5811735925662651, "grad_norm": 1.0027386231768032, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.5893023014068604, "learning_rate": 7.863723775804651e-06, "loss": 0.7514, "step": 709 }, { "epoch": 0.5819933014415349, "grad_norm": 1.0438296346077005, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.1433781087398529, "learning_rate": 7.83776629691398e-06, "loss": 0.7413, "step": 710 }, { "epoch": 0.5828130103168047, "grad_norm": 1.0569019617674453, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.3599586486816406, "learning_rate": 7.811824092529155e-06, "loss": 0.7187, "step": 711 }, { "epoch": 0.5836327191920745, "grad_norm": 1.2307496300122094, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.7800025939941406, "learning_rate": 7.785897345911755e-06, "loss": 0.7233, "step": 712 }, { "epoch": 0.5844524280673442, "grad_norm": 1.032162961821882, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.8138336539268494, "learning_rate": 7.759986240214155e-06, "loss": 0.7077, "step": 713 }, { "epoch": 0.5852721369426139, "grad_norm": 0.9998089389958766, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.3916796147823334, "learning_rate": 7.734090958478241e-06, "loss": 0.7551, "step": 714 }, { "epoch": 0.5860918458178838, "grad_norm": 0.9717991966202033, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.3931790590286255, "learning_rate": 7.708211683634112e-06, "loss": 0.6926, "step": 715 }, { "epoch": 0.5869115546931535, "grad_norm": 0.9138311813007235, "latest_boundary_loss": 0.010595110245049, "latest_lm_loss": 0.721996545791626, "learning_rate": 7.6823485984988e-06, "loss": 0.6819, "step": 716 }, { "epoch": 0.5877312635684233, "grad_norm": 0.9545376926621199, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.988181471824646, "learning_rate": 7.656501885774963e-06, "loss": 0.7173, "step": 717 }, { "epoch": 0.588550972443693, "grad_norm": 1.011919554024611, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.2733086347579956, "learning_rate": 7.6306717280496e-06, "loss": 0.7121, "step": 718 }, { "epoch": 0.5893706813189629, "grad_norm": 0.9800324686806557, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 1.5348021984100342, "learning_rate": 7.604858307792759e-06, "loss": 0.6914, "step": 719 }, { "epoch": 0.5901903901942326, "grad_norm": 0.9426442266619424, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.5834733247756958, "learning_rate": 7.579061807356256e-06, "loss": 0.6731, "step": 720 }, { "epoch": 0.5910100990695023, "grad_norm": 0.9513618850429701, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.0011859288206323981, "learning_rate": 7.553282408972382e-06, "loss": 0.7153, "step": 721 }, { "epoch": 0.5918298079447721, "grad_norm": 1.1870337882943776, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.412514567375183, "learning_rate": 7.527520294752607e-06, "loss": 0.7543, "step": 722 }, { "epoch": 0.5926495168200419, "grad_norm": 1.0551940500521517, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.13889846205711365, "learning_rate": 7.501775646686316e-06, "loss": 0.7333, "step": 723 }, { "epoch": 0.5934692256953117, "grad_norm": 1.0210313334853152, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.4544445872306824, "learning_rate": 7.476048646639498e-06, "loss": 0.7137, "step": 724 }, { "epoch": 0.5942889345705814, "grad_norm": 0.9895796527273951, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.0005383042152971029, "learning_rate": 7.450339476353475e-06, "loss": 0.7155, "step": 725 }, { "epoch": 0.5951086434458512, "grad_norm": 0.908321719879891, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.9301624894142151, "learning_rate": 7.424648317443616e-06, "loss": 0.6975, "step": 726 }, { "epoch": 0.595928352321121, "grad_norm": 1.0427604517832747, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.8960895538330078, "learning_rate": 7.398975351398054e-06, "loss": 0.6717, "step": 727 }, { "epoch": 0.5967480611963907, "grad_norm": 0.9103065754412873, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 1.0669386386871338, "learning_rate": 7.3733207595764015e-06, "loss": 0.678, "step": 728 }, { "epoch": 0.5975677700716605, "grad_norm": 0.858223319516681, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 1.8137937784194946, "learning_rate": 7.347684723208471e-06, "loss": 0.6966, "step": 729 }, { "epoch": 0.5983874789469302, "grad_norm": 1.1417557710739104, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.646855354309082, "learning_rate": 7.322067423393002e-06, "loss": 0.7068, "step": 730 }, { "epoch": 0.5992071878222001, "grad_norm": 1.0399418384166026, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.36594298481941223, "learning_rate": 7.2964690410963705e-06, "loss": 0.7196, "step": 731 }, { "epoch": 0.6000268966974698, "grad_norm": 1.100599718739737, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.636888861656189, "learning_rate": 7.2708897571513116e-06, "loss": 0.7042, "step": 732 }, { "epoch": 0.6008466055727396, "grad_norm": 1.0597441344693008, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.339764267206192, "learning_rate": 7.2453297522556475e-06, "loss": 0.7335, "step": 733 }, { "epoch": 0.6016663144480093, "grad_norm": 1.1333714411697555, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.8782387375831604, "learning_rate": 7.2197892069710105e-06, "loss": 0.7483, "step": 734 }, { "epoch": 0.602486023323279, "grad_norm": 1.0403253194282391, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.0014681315515190363, "learning_rate": 7.194268301721563e-06, "loss": 0.7069, "step": 735 }, { "epoch": 0.6033057321985489, "grad_norm": 1.1330466422231746, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.39263322949409485, "learning_rate": 7.168767216792725e-06, "loss": 0.6936, "step": 736 }, { "epoch": 0.6041254410738186, "grad_norm": 0.9982790123001637, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.6533898115158081, "learning_rate": 7.143286132329912e-06, "loss": 0.7007, "step": 737 }, { "epoch": 0.6049451499490884, "grad_norm": 1.0147745964752675, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.11286523193120956, "learning_rate": 7.117825228337236e-06, "loss": 0.7109, "step": 738 }, { "epoch": 0.6057648588243582, "grad_norm": 1.027879798611688, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.6202219724655151, "learning_rate": 7.092384684676263e-06, "loss": 0.6944, "step": 739 }, { "epoch": 0.6065845676996279, "grad_norm": 1.0220198583510278, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.7309264540672302, "learning_rate": 7.066964681064716e-06, "loss": 0.7627, "step": 740 }, { "epoch": 0.6074042765748977, "grad_norm": 0.995070436220007, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.9904163479804993, "learning_rate": 7.041565397075232e-06, "loss": 0.7016, "step": 741 }, { "epoch": 0.6082239854501674, "grad_norm": 1.0462281712285442, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.684150755405426, "learning_rate": 7.016187012134069e-06, "loss": 0.6559, "step": 742 }, { "epoch": 0.6090436943254373, "grad_norm": 0.9719132367678389, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.336769700050354, "learning_rate": 6.990829705519853e-06, "loss": 0.7086, "step": 743 }, { "epoch": 0.609863403200707, "grad_norm": 1.1516137776228703, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.5988958477973938, "learning_rate": 6.965493656362314e-06, "loss": 0.7196, "step": 744 }, { "epoch": 0.6106831120759768, "grad_norm": 0.9685654606839458, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.9086645841598511, "learning_rate": 6.940179043641005e-06, "loss": 0.6602, "step": 745 }, { "epoch": 0.6115028209512465, "grad_norm": 1.0417703319044727, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.0342119932174683, "learning_rate": 6.914886046184055e-06, "loss": 0.6792, "step": 746 }, { "epoch": 0.6123225298265162, "grad_norm": 1.2757184092294236, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.06405255198478699, "learning_rate": 6.889614842666892e-06, "loss": 0.6759, "step": 747 }, { "epoch": 0.6131422387017861, "grad_norm": 0.9870163010061376, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.5797122716903687, "learning_rate": 6.86436561161099e-06, "loss": 0.681, "step": 748 }, { "epoch": 0.6139619475770558, "grad_norm": 0.9950408829914631, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.23887087404727936, "learning_rate": 6.8391385313826035e-06, "loss": 0.6819, "step": 749 }, { "epoch": 0.6147816564523256, "grad_norm": 0.9863024335321804, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.8106602430343628, "learning_rate": 6.813933780191504e-06, "loss": 0.6826, "step": 750 }, { "epoch": 0.6156013653275954, "grad_norm": 1.0505699466510683, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.3282902240753174, "learning_rate": 6.788751536089739e-06, "loss": 0.6966, "step": 751 }, { "epoch": 0.6164210742028652, "grad_norm": 1.206619041745734, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.0014905950520187616, "learning_rate": 6.763591976970347e-06, "loss": 0.6944, "step": 752 }, { "epoch": 0.6172407830781349, "grad_norm": 1.2549377685802665, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 2.319436550140381, "learning_rate": 6.738455280566124e-06, "loss": 0.6769, "step": 753 }, { "epoch": 0.6180604919534046, "grad_norm": 0.9327746106525235, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.2720215320587158, "learning_rate": 6.713341624448351e-06, "loss": 0.7083, "step": 754 }, { "epoch": 0.6188802008286745, "grad_norm": 1.0196798883725415, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.0331902503967285, "learning_rate": 6.6882511860255505e-06, "loss": 0.706, "step": 755 }, { "epoch": 0.6196999097039442, "grad_norm": 1.2758874093450798, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.137378454208374, "learning_rate": 6.663184142542233e-06, "loss": 0.7327, "step": 756 }, { "epoch": 0.620519618579214, "grad_norm": 0.9623443271792325, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.00035643347655422986, "learning_rate": 6.638140671077633e-06, "loss": 0.745, "step": 757 }, { "epoch": 0.6213393274544837, "grad_norm": 1.1010299021596208, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.22510242462158203, "learning_rate": 6.613120948544482e-06, "loss": 0.6892, "step": 758 }, { "epoch": 0.6221590363297536, "grad_norm": 1.1879723867442862, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 1.7979674339294434, "learning_rate": 6.58812515168773e-06, "loss": 0.7305, "step": 759 }, { "epoch": 0.6229787452050233, "grad_norm": 1.152628417343709, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.07966076582670212, "learning_rate": 6.563153457083315e-06, "loss": 0.6811, "step": 760 }, { "epoch": 0.623798454080293, "grad_norm": 1.0279289637006672, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.15796378254890442, "learning_rate": 6.538206041136915e-06, "loss": 0.6416, "step": 761 }, { "epoch": 0.6246181629555628, "grad_norm": 0.861566264413089, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.7871353030204773, "learning_rate": 6.513283080082692e-06, "loss": 0.7014, "step": 762 }, { "epoch": 0.6254378718308325, "grad_norm": 1.1408042828440967, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.8846269249916077, "learning_rate": 6.488384749982054e-06, "loss": 0.7151, "step": 763 }, { "epoch": 0.6262575807061024, "grad_norm": 1.0238991997530897, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.27181968092918396, "learning_rate": 6.463511226722416e-06, "loss": 0.7488, "step": 764 }, { "epoch": 0.6270772895813721, "grad_norm": 1.1223442145304743, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.2094594240188599, "learning_rate": 6.438662686015947e-06, "loss": 0.7338, "step": 765 }, { "epoch": 0.6278969984566419, "grad_norm": 1.3461454909946964, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.8707993030548096, "learning_rate": 6.413839303398337e-06, "loss": 0.6769, "step": 766 }, { "epoch": 0.6287167073319117, "grad_norm": 0.9114819592934308, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.27082979679107666, "learning_rate": 6.389041254227548e-06, "loss": 0.6853, "step": 767 }, { "epoch": 0.6295364162071814, "grad_norm": 1.1636986726017515, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 1.2897359132766724, "learning_rate": 6.364268713682586e-06, "loss": 0.7573, "step": 768 }, { "epoch": 0.6303561250824512, "grad_norm": 1.1077154481827316, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.9593300223350525, "learning_rate": 6.339521856762254e-06, "loss": 0.7336, "step": 769 }, { "epoch": 0.6311758339577209, "grad_norm": 0.9316629955602134, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.0005913557251915336, "learning_rate": 6.3148008582839284e-06, "loss": 0.6661, "step": 770 }, { "epoch": 0.6319955428329908, "grad_norm": 1.0938685504974952, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 1.1068240404129028, "learning_rate": 6.290105892882303e-06, "loss": 0.7122, "step": 771 }, { "epoch": 0.6328152517082605, "grad_norm": 1.0335169883447488, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.3981740474700928, "learning_rate": 6.265437135008181e-06, "loss": 0.7315, "step": 772 }, { "epoch": 0.6336349605835303, "grad_norm": 1.0065761523313361, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.002072848379611969, "learning_rate": 6.240794758927222e-06, "loss": 0.7239, "step": 773 }, { "epoch": 0.6344546694588, "grad_norm": 0.9853651641848895, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.3314749598503113, "learning_rate": 6.21617893871872e-06, "loss": 0.6915, "step": 774 }, { "epoch": 0.6352743783340697, "grad_norm": 0.9911812439359369, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.2504614591598511, "learning_rate": 6.191589848274369e-06, "loss": 0.6749, "step": 775 }, { "epoch": 0.6360940872093396, "grad_norm": 0.9621284428121739, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.4438011050224304, "learning_rate": 6.167027661297049e-06, "loss": 0.6793, "step": 776 }, { "epoch": 0.6369137960846093, "grad_norm": 0.9288287369334539, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.11139020323753357, "learning_rate": 6.142492551299577e-06, "loss": 0.7098, "step": 777 }, { "epoch": 0.6377335049598791, "grad_norm": 0.8978047261244385, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.002336784265935421, "learning_rate": 6.117984691603493e-06, "loss": 0.6913, "step": 778 }, { "epoch": 0.6385532138351488, "grad_norm": 1.0659236483624612, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.9679294228553772, "learning_rate": 6.093504255337844e-06, "loss": 0.7031, "step": 779 }, { "epoch": 0.6393729227104187, "grad_norm": 1.0429042634997683, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.005642371717840433, "learning_rate": 6.069051415437941e-06, "loss": 0.6972, "step": 780 }, { "epoch": 0.6401926315856884, "grad_norm": 0.9251865588777979, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.0008097427780739963, "learning_rate": 6.044626344644151e-06, "loss": 0.684, "step": 781 }, { "epoch": 0.6410123404609581, "grad_norm": 1.025406119326292, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.17828942835330963, "learning_rate": 6.020229215500677e-06, "loss": 0.7155, "step": 782 }, { "epoch": 0.641832049336228, "grad_norm": 1.07302989085031, "latest_boundary_loss": 0.0112152099609375, "latest_lm_loss": 0.8376822471618652, "learning_rate": 5.995860200354335e-06, "loss": 0.6759, "step": 783 }, { "epoch": 0.6426517582114977, "grad_norm": 1.0997376451705585, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.223407506942749, "learning_rate": 5.971519471353335e-06, "loss": 0.7276, "step": 784 }, { "epoch": 0.6434714670867675, "grad_norm": 1.3840180076019357, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.0012067434145137668, "learning_rate": 5.9472072004460665e-06, "loss": 0.7298, "step": 785 }, { "epoch": 0.6442911759620372, "grad_norm": 1.159687035784195, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.0005477725062519312, "learning_rate": 5.922923559379892e-06, "loss": 0.6838, "step": 786 }, { "epoch": 0.645110884837307, "grad_norm": 1.2062795930656114, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.0014804333914071321, "learning_rate": 5.898668719699914e-06, "loss": 0.7254, "step": 787 }, { "epoch": 0.6459305937125768, "grad_norm": 1.0641490944417835, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 1.015197515487671, "learning_rate": 5.874442852747788e-06, "loss": 0.7085, "step": 788 }, { "epoch": 0.6467503025878465, "grad_norm": 1.1965522575368512, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.4765951931476593, "learning_rate": 5.850246129660494e-06, "loss": 0.7129, "step": 789 }, { "epoch": 0.6475700114631163, "grad_norm": 0.8794989065799094, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.22478081285953522, "learning_rate": 5.82607872136913e-06, "loss": 0.6787, "step": 790 }, { "epoch": 0.648389720338386, "grad_norm": 1.0388251385975193, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 1.0969759225845337, "learning_rate": 5.801940798597716e-06, "loss": 0.6942, "step": 791 }, { "epoch": 0.6492094292136559, "grad_norm": 1.0934328677471838, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.6132924556732178, "learning_rate": 5.7778325318619665e-06, "loss": 0.7305, "step": 792 }, { "epoch": 0.6500291380889256, "grad_norm": 1.080649239654547, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 1.215937852859497, "learning_rate": 5.753754091468116e-06, "loss": 0.7101, "step": 793 }, { "epoch": 0.6508488469641954, "grad_norm": 0.9175623322393451, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 1.305875301361084, "learning_rate": 5.729705647511688e-06, "loss": 0.6812, "step": 794 }, { "epoch": 0.6516685558394651, "grad_norm": 0.9874086060895069, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.6243735551834106, "learning_rate": 5.7056873698763035e-06, "loss": 0.6495, "step": 795 }, { "epoch": 0.6524882647147349, "grad_norm": 0.9202236004181785, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.21508236229419708, "learning_rate": 5.681699428232488e-06, "loss": 0.7015, "step": 796 }, { "epoch": 0.6533079735900047, "grad_norm": 1.0662772408712355, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.26606371998786926, "learning_rate": 5.657741992036463e-06, "loss": 0.6942, "step": 797 }, { "epoch": 0.6541276824652744, "grad_norm": 1.0762171889327197, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 1.0139234066009521, "learning_rate": 5.633815230528954e-06, "loss": 0.6634, "step": 798 }, { "epoch": 0.6549473913405442, "grad_norm": 0.9301324525186185, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.267943799495697, "learning_rate": 5.609919312733987e-06, "loss": 0.6837, "step": 799 }, { "epoch": 0.655767100215814, "grad_norm": 1.1052024267410168, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.45707234740257263, "learning_rate": 5.586054407457717e-06, "loss": 0.751, "step": 800 }, { "epoch": 0.6565868090910837, "grad_norm": 1.0971169221373818, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.1730159521102905, "learning_rate": 5.562220683287205e-06, "loss": 0.73, "step": 801 }, { "epoch": 0.6574065179663535, "grad_norm": 1.1236607533214953, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.030493974685669, "learning_rate": 5.538418308589246e-06, "loss": 0.7061, "step": 802 }, { "epoch": 0.6582262268416232, "grad_norm": 1.1203165598308498, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.8180105090141296, "learning_rate": 5.514647451509175e-06, "loss": 0.7238, "step": 803 }, { "epoch": 0.6590459357168931, "grad_norm": 0.8961935290600478, "latest_boundary_loss": 0.009173923172056675, "latest_lm_loss": 0.46520930528640747, "learning_rate": 5.490908279969682e-06, "loss": 0.6864, "step": 804 }, { "epoch": 0.6598656445921628, "grad_norm": 1.133867797968168, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.6524696350097656, "learning_rate": 5.467200961669619e-06, "loss": 0.6721, "step": 805 }, { "epoch": 0.6606853534674326, "grad_norm": 1.2065823134543583, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.9073443412780762, "learning_rate": 5.443525664082818e-06, "loss": 0.6804, "step": 806 }, { "epoch": 0.6615050623427023, "grad_norm": 1.315266430569396, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.07658699154853821, "learning_rate": 5.419882554456923e-06, "loss": 0.6758, "step": 807 }, { "epoch": 0.6623247712179721, "grad_norm": 1.142057250307418, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.9889833927154541, "learning_rate": 5.39627179981218e-06, "loss": 0.687, "step": 808 }, { "epoch": 0.6631444800932419, "grad_norm": 0.9652432075655373, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.05204503610730171, "learning_rate": 5.372693566940277e-06, "loss": 0.7592, "step": 809 }, { "epoch": 0.6639641889685116, "grad_norm": 1.1911062505658812, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.0005308053223416209, "learning_rate": 5.349148022403162e-06, "loss": 0.6587, "step": 810 }, { "epoch": 0.6647838978437814, "grad_norm": 1.0441398423949482, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.6223710775375366, "learning_rate": 5.325635332531864e-06, "loss": 0.7027, "step": 811 }, { "epoch": 0.6656036067190512, "grad_norm": 1.03817167677331, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.960883617401123, "learning_rate": 5.302155663425319e-06, "loss": 0.7157, "step": 812 }, { "epoch": 0.666423315594321, "grad_norm": 1.084644257209891, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.0298640727996826, "learning_rate": 5.278709180949195e-06, "loss": 0.7125, "step": 813 }, { "epoch": 0.6672430244695907, "grad_norm": 1.0891098751318016, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.9329481720924377, "learning_rate": 5.255296050734733e-06, "loss": 0.6778, "step": 814 }, { "epoch": 0.6680627333448604, "grad_norm": 1.2502028508458847, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.3610039949417114, "learning_rate": 5.231916438177552e-06, "loss": 0.6616, "step": 815 }, { "epoch": 0.6688824422201303, "grad_norm": 0.925724907408967, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.214050531387329, "learning_rate": 5.208570508436501e-06, "loss": 0.7153, "step": 816 }, { "epoch": 0.6697021510954, "grad_norm": 0.9664206190275095, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.0005578378331847489, "learning_rate": 5.1852584264324864e-06, "loss": 0.6563, "step": 817 }, { "epoch": 0.6705218599706698, "grad_norm": 0.9586595687477473, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.6733792424201965, "learning_rate": 5.161980356847307e-06, "loss": 0.6926, "step": 818 }, { "epoch": 0.6713415688459395, "grad_norm": 0.9255498289661501, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.12955781817436218, "learning_rate": 5.138736464122485e-06, "loss": 0.6804, "step": 819 }, { "epoch": 0.6721612777212094, "grad_norm": 0.9487906004164839, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 3.455559730529785, "learning_rate": 5.115526912458113e-06, "loss": 0.7025, "step": 820 }, { "epoch": 0.6729809865964791, "grad_norm": 1.3078930916314684, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.3165035545825958, "learning_rate": 5.092351865811698e-06, "loss": 0.713, "step": 821 }, { "epoch": 0.6738006954717488, "grad_norm": 1.2207341591946816, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.9034299850463867, "learning_rate": 5.0692114878969845e-06, "loss": 0.6991, "step": 822 }, { "epoch": 0.6746204043470186, "grad_norm": 1.0055943176947524, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 1.3586221933364868, "learning_rate": 5.046105942182815e-06, "loss": 0.7097, "step": 823 }, { "epoch": 0.6754401132222884, "grad_norm": 1.134757083387565, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.008022138848900795, "learning_rate": 5.023035391891966e-06, "loss": 0.7394, "step": 824 }, { "epoch": 0.6762598220975582, "grad_norm": 0.8879732520006872, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 1.173811435699463, "learning_rate": 5.000000000000003e-06, "loss": 0.6943, "step": 825 }, { "epoch": 0.6770795309728279, "grad_norm": 0.8574977914426216, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.5076913833618164, "learning_rate": 4.97699992923412e-06, "loss": 0.6979, "step": 826 }, { "epoch": 0.6778992398480977, "grad_norm": 1.1037086397521318, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.9463548064231873, "learning_rate": 4.954035342071994e-06, "loss": 0.7248, "step": 827 }, { "epoch": 0.6787189487233675, "grad_norm": 1.0073652316446564, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.014983057975769, "learning_rate": 4.9311064007406494e-06, "loss": 0.7265, "step": 828 }, { "epoch": 0.6795386575986372, "grad_norm": 0.8631585749939532, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.07589959353208542, "learning_rate": 4.908213267215287e-06, "loss": 0.6815, "step": 829 }, { "epoch": 0.680358366473907, "grad_norm": 0.8606209461703438, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.0183286666870117, "learning_rate": 4.885356103218159e-06, "loss": 0.6839, "step": 830 }, { "epoch": 0.6811780753491767, "grad_norm": 1.25130555585431, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.23989424109458923, "learning_rate": 4.862535070217416e-06, "loss": 0.6987, "step": 831 }, { "epoch": 0.6819977842244466, "grad_norm": 0.9930050218945115, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.8324053883552551, "learning_rate": 4.839750329425979e-06, "loss": 0.7158, "step": 832 }, { "epoch": 0.6828174930997163, "grad_norm": 0.9472508769146017, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.528387725353241, "learning_rate": 4.8170020418003884e-06, "loss": 0.7259, "step": 833 }, { "epoch": 0.6836372019749861, "grad_norm": 1.16858853336407, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.13132038712501526, "learning_rate": 4.794290368039664e-06, "loss": 0.7111, "step": 834 }, { "epoch": 0.6844569108502558, "grad_norm": 1.1692990328517108, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.9375249147415161, "learning_rate": 4.771615468584194e-06, "loss": 0.6988, "step": 835 }, { "epoch": 0.6852766197255256, "grad_norm": 1.1710441744717957, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.7154141664505005, "learning_rate": 4.7489775036145715e-06, "loss": 0.7116, "step": 836 }, { "epoch": 0.6860963286007954, "grad_norm": 1.0607837634015245, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.00030830566538497806, "learning_rate": 4.726376633050479e-06, "loss": 0.7065, "step": 837 }, { "epoch": 0.6869160374760651, "grad_norm": 1.434628115103455, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.31428781151771545, "learning_rate": 4.703813016549555e-06, "loss": 0.7043, "step": 838 }, { "epoch": 0.6877357463513349, "grad_norm": 0.8892840982985057, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.6786776185035706, "learning_rate": 4.681286813506271e-06, "loss": 0.6908, "step": 839 }, { "epoch": 0.6885554552266047, "grad_norm": 1.0688810765695658, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 0.5102680921554565, "learning_rate": 4.658798183050796e-06, "loss": 0.7242, "step": 840 }, { "epoch": 0.6893751641018745, "grad_norm": 1.1689099085155596, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.0223958492279053, "learning_rate": 4.636347284047878e-06, "loss": 0.7174, "step": 841 }, { "epoch": 0.6901948729771442, "grad_norm": 1.0589934053755845, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 0.718203067779541, "learning_rate": 4.613934275095729e-06, "loss": 0.6847, "step": 842 }, { "epoch": 0.6910145818524139, "grad_norm": 1.1487810029443168, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.20583559572696686, "learning_rate": 4.5915593145248926e-06, "loss": 0.7045, "step": 843 }, { "epoch": 0.6918342907276838, "grad_norm": 1.1842105020554863, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.5710063576698303, "learning_rate": 4.569222560397126e-06, "loss": 0.7044, "step": 844 }, { "epoch": 0.6926539996029535, "grad_norm": 1.2730861654711523, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.17701531946659088, "learning_rate": 4.546924170504292e-06, "loss": 0.7031, "step": 845 }, { "epoch": 0.6934737084782233, "grad_norm": 1.0862823878497603, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.005029784981161356, "learning_rate": 4.524664302367239e-06, "loss": 0.6877, "step": 846 }, { "epoch": 0.694293417353493, "grad_norm": 0.9459479170002364, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.0004008638788945973, "learning_rate": 4.502443113234688e-06, "loss": 0.6989, "step": 847 }, { "epoch": 0.6951131262287629, "grad_norm": 1.1465757945823667, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.283829927444458, "learning_rate": 4.48026076008212e-06, "loss": 0.6695, "step": 848 }, { "epoch": 0.6959328351040326, "grad_norm": 1.0053718273105061, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.32908621430397034, "learning_rate": 4.458117399610682e-06, "loss": 0.6779, "step": 849 }, { "epoch": 0.6967525439793023, "grad_norm": 0.9501225628003003, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.1048474311828613, "learning_rate": 4.436013188246056e-06, "loss": 0.6802, "step": 850 }, { "epoch": 0.6975722528545721, "grad_norm": 1.272585533213532, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.8869845271110535, "learning_rate": 4.4139482821373665e-06, "loss": 0.7087, "step": 851 }, { "epoch": 0.6983919617298419, "grad_norm": 1.298634500727238, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.2856828570365906, "learning_rate": 4.391922837156082e-06, "loss": 0.7037, "step": 852 }, { "epoch": 0.6992116706051117, "grad_norm": 1.272153989512535, "latest_boundary_loss": 0.010217878967523575, "latest_lm_loss": 0.8536891937255859, "learning_rate": 4.369937008894906e-06, "loss": 0.7232, "step": 853 }, { "epoch": 0.7000313794803814, "grad_norm": 1.1923084822356993, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.9743465185165405, "learning_rate": 4.3479909526666775e-06, "loss": 0.7082, "step": 854 }, { "epoch": 0.7008510883556512, "grad_norm": 0.9289329434272517, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.16440057754516602, "learning_rate": 4.326084823503287e-06, "loss": 0.6622, "step": 855 }, { "epoch": 0.701670797230921, "grad_norm": 1.051106179946181, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.841198205947876, "learning_rate": 4.30421877615456e-06, "loss": 0.7039, "step": 856 }, { "epoch": 0.7024905061061907, "grad_norm": 0.8948391645013014, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.655964732170105, "learning_rate": 4.282392965087182e-06, "loss": 0.6917, "step": 857 }, { "epoch": 0.7033102149814605, "grad_norm": 1.0097597555275502, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.32513657212257385, "learning_rate": 4.260607544483596e-06, "loss": 0.7092, "step": 858 }, { "epoch": 0.7041299238567302, "grad_norm": 1.3704230014179217, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.10507223010063171, "learning_rate": 4.23886266824092e-06, "loss": 0.7203, "step": 859 }, { "epoch": 0.7049496327320001, "grad_norm": 0.9877438539088613, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.19252876937389374, "learning_rate": 4.217158489969857e-06, "loss": 0.6967, "step": 860 }, { "epoch": 0.7057693416072698, "grad_norm": 1.0634413405385343, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 1.4538038969039917, "learning_rate": 4.195495162993607e-06, "loss": 0.7492, "step": 861 }, { "epoch": 0.7065890504825396, "grad_norm": 0.9647198580031782, "latest_boundary_loss": 0.009594811126589775, "latest_lm_loss": 0.9643508791923523, "learning_rate": 4.173872840346798e-06, "loss": 0.7123, "step": 862 }, { "epoch": 0.7074087593578093, "grad_norm": 1.0711996559798689, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.10980099439620972, "learning_rate": 4.152291674774384e-06, "loss": 0.7193, "step": 863 }, { "epoch": 0.7082284682330791, "grad_norm": 0.972251788670185, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 1.2302558422088623, "learning_rate": 4.130751818730578e-06, "loss": 0.7142, "step": 864 }, { "epoch": 0.7090481771083489, "grad_norm": 0.9459005865793516, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.1377440243959427, "learning_rate": 4.109253424377773e-06, "loss": 0.7162, "step": 865 }, { "epoch": 0.7098678859836186, "grad_norm": 1.088563431821855, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.11354351788759232, "learning_rate": 4.08779664358547e-06, "loss": 0.6988, "step": 866 }, { "epoch": 0.7106875948588884, "grad_norm": 0.9713539872632391, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.0006984450155869126, "learning_rate": 4.066381627929202e-06, "loss": 0.6669, "step": 867 }, { "epoch": 0.7115073037341582, "grad_norm": 0.9183399145736109, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 1.1253795623779297, "learning_rate": 4.045008528689457e-06, "loss": 0.6805, "step": 868 }, { "epoch": 0.7123270126094279, "grad_norm": 1.0286213749155761, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.4194809198379517, "learning_rate": 4.02367749685063e-06, "loss": 0.7102, "step": 869 }, { "epoch": 0.7131467214846977, "grad_norm": 0.9529707346876777, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.004144263919442892, "learning_rate": 4.00238868309993e-06, "loss": 0.6663, "step": 870 }, { "epoch": 0.7139664303599674, "grad_norm": 1.1574389418963933, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.2732635736465454, "learning_rate": 3.981142237826332e-06, "loss": 0.7079, "step": 871 }, { "epoch": 0.7147861392352373, "grad_norm": 0.9159115584785531, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.8676116466522217, "learning_rate": 3.959938311119511e-06, "loss": 0.71, "step": 872 }, { "epoch": 0.715605848110507, "grad_norm": 0.9789967869727101, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.7186263799667358, "learning_rate": 3.9387770527687795e-06, "loss": 0.7327, "step": 873 }, { "epoch": 0.7164255569857768, "grad_norm": 0.9233515451374933, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.4414817988872528, "learning_rate": 3.917658612262033e-06, "loss": 0.7098, "step": 874 }, { "epoch": 0.7172452658610465, "grad_norm": 0.9704468069796672, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.9723040461540222, "learning_rate": 3.8965831387846885e-06, "loss": 0.6622, "step": 875 }, { "epoch": 0.7180649747363163, "grad_norm": 1.0065511111333068, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.874070942401886, "learning_rate": 3.875550781218644e-06, "loss": 0.7033, "step": 876 }, { "epoch": 0.7188846836115861, "grad_norm": 1.0371302526501174, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.02367703802883625, "learning_rate": 3.854561688141205e-06, "loss": 0.641, "step": 877 }, { "epoch": 0.7197043924868558, "grad_norm": 1.0540898401173742, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.16339510679244995, "learning_rate": 3.833616007824054e-06, "loss": 0.7349, "step": 878 }, { "epoch": 0.7205241013621256, "grad_norm": 1.048361377181232, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.2136911153793335, "learning_rate": 3.8127138882321937e-06, "loss": 0.7165, "step": 879 }, { "epoch": 0.7213438102373954, "grad_norm": 0.9228631115088182, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 1.0548585653305054, "learning_rate": 3.791855477022903e-06, "loss": 0.7212, "step": 880 }, { "epoch": 0.7221635191126652, "grad_norm": 0.8584023856292647, "latest_boundary_loss": 0.013131883926689625, "latest_lm_loss": 0.3909883201122284, "learning_rate": 3.7710409215446986e-06, "loss": 0.6469, "step": 881 }, { "epoch": 0.7229832279879349, "grad_norm": 1.0830150854583134, "latest_boundary_loss": 0.009594811126589775, "latest_lm_loss": 0.00023115465592127293, "learning_rate": 3.750270368836283e-06, "loss": 0.6741, "step": 882 }, { "epoch": 0.7238029368632046, "grad_norm": 0.8596386791002816, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.024373020976781845, "learning_rate": 3.729543965625526e-06, "loss": 0.6884, "step": 883 }, { "epoch": 0.7246226457384745, "grad_norm": 0.9895399017159887, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.7909685373306274, "learning_rate": 3.7088618583284054e-06, "loss": 0.7105, "step": 884 }, { "epoch": 0.7254423546137442, "grad_norm": 0.9926181483464435, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.0002601688611321151, "learning_rate": 3.6882241930479824e-06, "loss": 0.6739, "step": 885 }, { "epoch": 0.726262063489014, "grad_norm": 1.1053880204468391, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.6977870464324951, "learning_rate": 3.6676311155733745e-06, "loss": 0.7397, "step": 886 }, { "epoch": 0.7270817723642837, "grad_norm": 1.0391195526164008, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.1460070610046387, "learning_rate": 3.6470827713787195e-06, "loss": 0.7138, "step": 887 }, { "epoch": 0.7279014812395536, "grad_norm": 1.0604176060213288, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.48403021693229675, "learning_rate": 3.6265793056221465e-06, "loss": 0.6748, "step": 888 }, { "epoch": 0.7287211901148233, "grad_norm": 0.9079621333121072, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.0970895290374756, "learning_rate": 3.606120863144753e-06, "loss": 0.6761, "step": 889 }, { "epoch": 0.729540898990093, "grad_norm": 1.2064609480322432, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.2686730623245239, "learning_rate": 3.5857075884695915e-06, "loss": 0.7682, "step": 890 }, { "epoch": 0.7303606078653628, "grad_norm": 1.0465236368945114, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.3363715410232544, "learning_rate": 3.5653396258006266e-06, "loss": 0.7373, "step": 891 }, { "epoch": 0.7311803167406326, "grad_norm": 1.033817078110439, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.3527984619140625, "learning_rate": 3.5450171190217364e-06, "loss": 0.6836, "step": 892 }, { "epoch": 0.7320000256159024, "grad_norm": 0.8938748137335454, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.17023521661758423, "learning_rate": 3.524740211695683e-06, "loss": 0.6913, "step": 893 }, { "epoch": 0.7328197344911721, "grad_norm": 0.9553969834884637, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.6163581013679504, "learning_rate": 3.504509047063108e-06, "loss": 0.7264, "step": 894 }, { "epoch": 0.7336394433664419, "grad_norm": 1.0130308627994913, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.2378593683242798, "learning_rate": 3.4843237680415153e-06, "loss": 0.721, "step": 895 }, { "epoch": 0.7344591522417117, "grad_norm": 1.0147511996337832, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.6772930026054382, "learning_rate": 3.4641845172242573e-06, "loss": 0.669, "step": 896 }, { "epoch": 0.7352788611169814, "grad_norm": 1.1272666071401902, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 1.0259910821914673, "learning_rate": 3.444091436879545e-06, "loss": 0.7049, "step": 897 }, { "epoch": 0.7360985699922512, "grad_norm": 1.0110241021172623, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.7800242304801941, "learning_rate": 3.42404466894942e-06, "loss": 0.6648, "step": 898 }, { "epoch": 0.7369182788675209, "grad_norm": 1.2386336056561935, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.0924358367919922, "learning_rate": 3.4040443550487645e-06, "loss": 0.6665, "step": 899 }, { "epoch": 0.7377379877427908, "grad_norm": 1.0853146437492893, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.02431701496243477, "learning_rate": 3.384090636464301e-06, "loss": 0.6759, "step": 900 }, { "epoch": 0.7385576966180605, "grad_norm": 0.9805926397092164, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 1.1555978059768677, "learning_rate": 3.364183654153592e-06, "loss": 0.7459, "step": 901 }, { "epoch": 0.7393774054933303, "grad_norm": 0.8549471226857189, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 1.3081523180007935, "learning_rate": 3.344323548744044e-06, "loss": 0.7161, "step": 902 }, { "epoch": 0.7401971143686, "grad_norm": 1.002947424203249, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.7241700291633606, "learning_rate": 3.32451046053191e-06, "loss": 0.6787, "step": 903 }, { "epoch": 0.7410168232438697, "grad_norm": 0.921019636633251, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.05222950130701065, "learning_rate": 3.304744529481315e-06, "loss": 0.7102, "step": 904 }, { "epoch": 0.7418365321191396, "grad_norm": 0.9459595406059049, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.00010894708248088136, "learning_rate": 3.285025895223244e-06, "loss": 0.707, "step": 905 }, { "epoch": 0.7426562409944093, "grad_norm": 1.1475510732298588, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.9933887124061584, "learning_rate": 3.26535469705457e-06, "loss": 0.7064, "step": 906 }, { "epoch": 0.7434759498696791, "grad_norm": 0.9856313421911034, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.13646730780601501, "learning_rate": 3.2457310739370684e-06, "loss": 0.7135, "step": 907 }, { "epoch": 0.7442956587449489, "grad_norm": 0.8824980761896706, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.7802220582962036, "learning_rate": 3.2261551644964305e-06, "loss": 0.7197, "step": 908 }, { "epoch": 0.7451153676202187, "grad_norm": 1.4704739043068982, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.23710103332996368, "learning_rate": 3.2066271070212873e-06, "loss": 0.6525, "step": 909 }, { "epoch": 0.7459350764954884, "grad_norm": 1.0331786056778853, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.0013111588777974248, "learning_rate": 3.1871470394622407e-06, "loss": 0.6624, "step": 910 }, { "epoch": 0.7467547853707581, "grad_norm": 0.845459778364654, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.7174825668334961, "learning_rate": 3.167715099430874e-06, "loss": 0.6559, "step": 911 }, { "epoch": 0.747574494246028, "grad_norm": 1.1948951087922604, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.9400781393051147, "learning_rate": 3.148331424198784e-06, "loss": 0.6589, "step": 912 }, { "epoch": 0.7483942031212977, "grad_norm": 0.8320863846327636, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.23302511870861053, "learning_rate": 3.1289961506966217e-06, "loss": 0.6747, "step": 913 }, { "epoch": 0.7492139119965675, "grad_norm": 0.9925033336920036, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.03568759933114052, "learning_rate": 3.1097094155131122e-06, "loss": 0.6851, "step": 914 }, { "epoch": 0.7500336208718372, "grad_norm": 1.1074899171518326, "latest_boundary_loss": 0.00856865756213665, "latest_lm_loss": 0.8208504915237427, "learning_rate": 3.0904713548940936e-06, "loss": 0.672, "step": 915 }, { "epoch": 0.7508533297471071, "grad_norm": 0.9536372119649517, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.10629161447286606, "learning_rate": 3.0712821047415655e-06, "loss": 0.6982, "step": 916 }, { "epoch": 0.7516730386223768, "grad_norm": 0.8941158992964481, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 1.1275361776351929, "learning_rate": 3.052141800612709e-06, "loss": 0.6805, "step": 917 }, { "epoch": 0.7524927474976465, "grad_norm": 1.0719328717584797, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.5270333290100098, "learning_rate": 3.0330505777189433e-06, "loss": 0.6842, "step": 918 }, { "epoch": 0.7533124563729163, "grad_norm": 1.0727464117705965, "latest_boundary_loss": 0.0074848597869277, "latest_lm_loss": 0.9727941155433655, "learning_rate": 3.0140085709249666e-06, "loss": 0.7501, "step": 919 }, { "epoch": 0.754132165248186, "grad_norm": 1.1136950816333502, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.1888251304626465, "learning_rate": 2.9950159147478043e-06, "loss": 0.7021, "step": 920 }, { "epoch": 0.7549518741234559, "grad_norm": 0.9319384765550094, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.6955706477165222, "learning_rate": 2.976072743355852e-06, "loss": 0.6796, "step": 921 }, { "epoch": 0.7557715829987256, "grad_norm": 0.8848849231660617, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.2427470684051514, "learning_rate": 2.957179190567947e-06, "loss": 0.6869, "step": 922 }, { "epoch": 0.7565912918739954, "grad_norm": 1.0006888886789052, "latest_boundary_loss": 0.010217878967523575, "latest_lm_loss": 0.0002946022432297468, "learning_rate": 2.938335389852397e-06, "loss": 0.6832, "step": 923 }, { "epoch": 0.7574110007492652, "grad_norm": 1.076035634783637, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.8657299876213074, "learning_rate": 2.9195414743260544e-06, "loss": 0.7096, "step": 924 }, { "epoch": 0.7582307096245349, "grad_norm": 1.0414545470006744, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.2007744461297989, "learning_rate": 2.9007975767533714e-06, "loss": 0.6848, "step": 925 }, { "epoch": 0.7590504184998047, "grad_norm": 0.9749957614688242, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.8693909645080566, "learning_rate": 2.882103829545462e-06, "loss": 0.6442, "step": 926 }, { "epoch": 0.7598701273750744, "grad_norm": 1.2155833795827644, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.9701324701309204, "learning_rate": 2.863460364759163e-06, "loss": 0.7208, "step": 927 }, { "epoch": 0.7606898362503443, "grad_norm": 0.9662824081661413, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.7305889129638672, "learning_rate": 2.844867314096115e-06, "loss": 0.6664, "step": 928 }, { "epoch": 0.761509545125614, "grad_norm": 0.863484801682061, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.053075600415468216, "learning_rate": 2.8263248089018116e-06, "loss": 0.6896, "step": 929 }, { "epoch": 0.7623292540008837, "grad_norm": 0.994486586704907, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.0955816507339478, "learning_rate": 2.8078329801646876e-06, "loss": 0.6709, "step": 930 }, { "epoch": 0.7631489628761535, "grad_norm": 0.954565237644722, "latest_boundary_loss": 0.00856865756213665, "latest_lm_loss": 0.00038752073305658996, "learning_rate": 2.789391958515183e-06, "loss": 0.7004, "step": 931 }, { "epoch": 0.7639686717514232, "grad_norm": 1.1788658783857842, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.1445330381393433, "learning_rate": 2.77100187422483e-06, "loss": 0.7058, "step": 932 }, { "epoch": 0.7647883806266931, "grad_norm": 0.9151719451443651, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.5114860534667969, "learning_rate": 2.7526628572053227e-06, "loss": 0.7331, "step": 933 }, { "epoch": 0.7656080895019628, "grad_norm": 0.9118852197200749, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.7835705280303955, "learning_rate": 2.7343750370076127e-06, "loss": 0.709, "step": 934 }, { "epoch": 0.7664277983772326, "grad_norm": 0.9745870009419952, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.1845852136611938, "learning_rate": 2.7161385428209773e-06, "loss": 0.7286, "step": 935 }, { "epoch": 0.7672475072525023, "grad_norm": 1.1133776325406939, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 0.8729183077812195, "learning_rate": 2.6979535034721195e-06, "loss": 0.6549, "step": 936 }, { "epoch": 0.7680672161277721, "grad_norm": 0.8608364024623248, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.41703519225120544, "learning_rate": 2.679820047424253e-06, "loss": 0.6979, "step": 937 }, { "epoch": 0.7688869250030419, "grad_norm": 1.601553094677427, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.1687843799591064, "learning_rate": 2.6617383027761944e-06, "loss": 0.7512, "step": 938 }, { "epoch": 0.7697066338783116, "grad_norm": 1.1287827467484812, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.1085548400878906, "learning_rate": 2.6437083972614575e-06, "loss": 0.7045, "step": 939 }, { "epoch": 0.7705263427535815, "grad_norm": 0.8670993619138684, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 1.5218075513839722, "learning_rate": 2.625730458247362e-06, "loss": 0.6589, "step": 940 }, { "epoch": 0.7713460516288512, "grad_norm": 1.1144823097997716, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.32625648379325867, "learning_rate": 2.6078046127341138e-06, "loss": 0.6763, "step": 941 }, { "epoch": 0.772165760504121, "grad_norm": 0.9007704755349102, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.18834565579891205, "learning_rate": 2.5899309873539245e-06, "loss": 0.7004, "step": 942 }, { "epoch": 0.7729854693793907, "grad_norm": 1.05277473083264, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.6006239056587219, "learning_rate": 2.5721097083701085e-06, "loss": 0.7565, "step": 943 }, { "epoch": 0.7738051782546604, "grad_norm": 1.1759661436417574, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.7691168189048767, "learning_rate": 2.5543409016761935e-06, "loss": 0.6621, "step": 944 }, { "epoch": 0.7746248871299303, "grad_norm": 1.1301078148327819, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 1.1314184665679932, "learning_rate": 2.5366246927950287e-06, "loss": 0.7123, "step": 945 }, { "epoch": 0.7754445960052, "grad_norm": 1.1881469720391336, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.5648930072784424, "learning_rate": 2.518961206877911e-06, "loss": 0.6893, "step": 946 }, { "epoch": 0.7762643048804698, "grad_norm": 1.1623084965779718, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.9060161113739014, "learning_rate": 2.5013505687036787e-06, "loss": 0.7009, "step": 947 }, { "epoch": 0.7770840137557395, "grad_norm": 1.0316653035646688, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.6944351196289062, "learning_rate": 2.483792902677847e-06, "loss": 0.6958, "step": 948 }, { "epoch": 0.7779037226310094, "grad_norm": 0.9274081790363907, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.8879955410957336, "learning_rate": 2.466288332831722e-06, "loss": 0.7172, "step": 949 }, { "epoch": 0.7787234315062791, "grad_norm": 1.0583495632469067, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.09301748871803284, "learning_rate": 2.4488369828215286e-06, "loss": 0.7081, "step": 950 }, { "epoch": 0.7795431403815488, "grad_norm": 0.9753168157075798, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.636999785900116, "learning_rate": 2.4314389759275334e-06, "loss": 0.6734, "step": 951 }, { "epoch": 0.7803628492568186, "grad_norm": 0.9534021502050944, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 1.3337091207504272, "learning_rate": 2.4140944350531714e-06, "loss": 0.6963, "step": 952 }, { "epoch": 0.7811825581320884, "grad_norm": 0.890776573299897, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.8123337626457214, "learning_rate": 2.3968034827241926e-06, "loss": 0.6996, "step": 953 }, { "epoch": 0.7820022670073582, "grad_norm": 1.1118780762372547, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.0012245753314346075, "learning_rate": 2.379566241087774e-06, "loss": 0.7003, "step": 954 }, { "epoch": 0.7828219758826279, "grad_norm": 1.0871971559957156, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.062576413154602, "learning_rate": 2.362382831911675e-06, "loss": 0.7055, "step": 955 }, { "epoch": 0.7836416847578977, "grad_norm": 1.0140452077753077, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.4054242372512817, "learning_rate": 2.345253376583366e-06, "loss": 0.7295, "step": 956 }, { "epoch": 0.7844613936331675, "grad_norm": 0.8848083992596372, "latest_boundary_loss": 0.01098675187677145, "latest_lm_loss": 0.0006858808337710798, "learning_rate": 2.3281779961091777e-06, "loss": 0.7189, "step": 957 }, { "epoch": 0.7852811025084372, "grad_norm": 0.8848961433823385, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.42628389596939087, "learning_rate": 2.311156811113444e-06, "loss": 0.6866, "step": 958 }, { "epoch": 0.786100811383707, "grad_norm": 0.9832255525999846, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.22167763113975525, "learning_rate": 2.294189941837647e-06, "loss": 0.7015, "step": 959 }, { "epoch": 0.7869205202589767, "grad_norm": 0.9663239369477896, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.11525467038154602, "learning_rate": 2.277277508139576e-06, "loss": 0.6699, "step": 960 }, { "epoch": 0.7877402291342466, "grad_norm": 1.0687076019178068, "latest_boundary_loss": 0.00950749684125185, "latest_lm_loss": 0.669357180595398, "learning_rate": 2.2604196294924696e-06, "loss": 0.6688, "step": 961 }, { "epoch": 0.7885599380095163, "grad_norm": 1.0186328764194088, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.40656358003616333, "learning_rate": 2.2436164249841806e-06, "loss": 0.6609, "step": 962 }, { "epoch": 0.7893796468847861, "grad_norm": 1.3005810776140845, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 1.0091232061386108, "learning_rate": 2.226868013316328e-06, "loss": 0.6922, "step": 963 }, { "epoch": 0.7901993557600558, "grad_norm": 1.016719470860335, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.9535509347915649, "learning_rate": 2.2101745128034657e-06, "loss": 0.7118, "step": 964 }, { "epoch": 0.7910190646353256, "grad_norm": 0.8555830588445336, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.9251463413238525, "learning_rate": 2.1935360413722397e-06, "loss": 0.688, "step": 965 }, { "epoch": 0.7918387735105954, "grad_norm": 0.9590372570673482, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.30590155720710754, "learning_rate": 2.1769527165605563e-06, "loss": 0.6854, "step": 966 }, { "epoch": 0.7926584823858651, "grad_norm": 0.9309472953925859, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.0327022075653076, "learning_rate": 2.160424655516764e-06, "loss": 0.7032, "step": 967 }, { "epoch": 0.793478191261135, "grad_norm": 0.879983313111112, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 1.5895096063613892, "learning_rate": 2.1439519749988045e-06, "loss": 0.6815, "step": 968 }, { "epoch": 0.7942979001364047, "grad_norm": 0.9516534861975846, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.8126771450042725, "learning_rate": 2.1275347913734023e-06, "loss": 0.6921, "step": 969 }, { "epoch": 0.7951176090116745, "grad_norm": 0.8679886397977469, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.15465228259563446, "learning_rate": 2.1111732206152424e-06, "loss": 0.6799, "step": 970 }, { "epoch": 0.7959373178869442, "grad_norm": 0.8905284920004164, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 0.46578449010849, "learning_rate": 2.0948673783061424e-06, "loss": 0.6779, "step": 971 }, { "epoch": 0.7967570267622139, "grad_norm": 0.8740505129031229, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.7735812664031982, "learning_rate": 2.0786173796342468e-06, "loss": 0.7062, "step": 972 }, { "epoch": 0.7975767356374838, "grad_norm": 1.2678752586550928, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.14334075152873993, "learning_rate": 2.0624233393932024e-06, "loss": 0.6953, "step": 973 }, { "epoch": 0.7983964445127535, "grad_norm": 0.8501612624018128, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.9814978241920471, "learning_rate": 2.0462853719813624e-06, "loss": 0.6781, "step": 974 }, { "epoch": 0.7992161533880233, "grad_norm": 1.14524331192102, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.3802480101585388, "learning_rate": 2.03020359140096e-06, "loss": 0.7199, "step": 975 }, { "epoch": 0.800035862263293, "grad_norm": 0.9569052323878949, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.5002812147140503, "learning_rate": 2.0141781112573155e-06, "loss": 0.7248, "step": 976 }, { "epoch": 0.8008555711385629, "grad_norm": 1.124565773763351, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.000558853149414, "learning_rate": 1.9982090447580305e-06, "loss": 0.7142, "step": 977 }, { "epoch": 0.8016752800138326, "grad_norm": 0.8191135419964003, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 0.4195655286312103, "learning_rate": 1.9822965047121854e-06, "loss": 0.6513, "step": 978 }, { "epoch": 0.8024949888891023, "grad_norm": 0.8774315775408943, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.0927257537841797, "learning_rate": 1.9664406035295493e-06, "loss": 0.7211, "step": 979 }, { "epoch": 0.8033146977643721, "grad_norm": 0.8983148739834376, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.670623779296875, "learning_rate": 1.950641453219775e-06, "loss": 0.714, "step": 980 }, { "epoch": 0.8041344066396419, "grad_norm": 1.0496724237214288, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.9172088503837585, "learning_rate": 1.934899165391623e-06, "loss": 0.658, "step": 981 }, { "epoch": 0.8049541155149117, "grad_norm": 0.8893037197349647, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.6485571265220642, "learning_rate": 1.9192138512521585e-06, "loss": 0.6735, "step": 982 }, { "epoch": 0.8057738243901814, "grad_norm": 0.9199233502541971, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.29731521010398865, "learning_rate": 1.9035856216059724e-06, "loss": 0.6813, "step": 983 }, { "epoch": 0.8065935332654512, "grad_norm": 0.9467014768078095, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.36839428544044495, "learning_rate": 1.8880145868543997e-06, "loss": 0.6908, "step": 984 }, { "epoch": 0.807413242140721, "grad_norm": 0.9445538649699714, "latest_boundary_loss": 0.0103687709197402, "latest_lm_loss": 0.934324324131012, "learning_rate": 1.8725008569947366e-06, "loss": 0.7021, "step": 985 }, { "epoch": 0.8082329510159907, "grad_norm": 0.9355494878229382, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.848320722579956, "learning_rate": 1.8570445416194639e-06, "loss": 0.6883, "step": 986 }, { "epoch": 0.8090526598912605, "grad_norm": 0.9912822414208821, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.6447222828865051, "learning_rate": 1.8416457499154727e-06, "loss": 0.6907, "step": 987 }, { "epoch": 0.8098723687665302, "grad_norm": 1.0732827811658538, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.2924770712852478, "learning_rate": 1.8263045906633004e-06, "loss": 0.6885, "step": 988 }, { "epoch": 0.8106920776418001, "grad_norm": 0.8777093267510397, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.7189764380455017, "learning_rate": 1.811021172236348e-06, "loss": 0.6853, "step": 989 }, { "epoch": 0.8115117865170698, "grad_norm": 1.1269311487189182, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.6757775545120239, "learning_rate": 1.7957956026001256e-06, "loss": 0.7025, "step": 990 }, { "epoch": 0.8123314953923396, "grad_norm": 1.1260325534280595, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.9195502996444702, "learning_rate": 1.7806279893114874e-06, "loss": 0.7205, "step": 991 }, { "epoch": 0.8131512042676093, "grad_norm": 0.9580347819519319, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.9153879880905151, "learning_rate": 1.7655184395178683e-06, "loss": 0.6874, "step": 992 }, { "epoch": 0.8139709131428791, "grad_norm": 0.939969060922645, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.24218341708183289, "learning_rate": 1.750467059956531e-06, "loss": 0.6782, "step": 993 }, { "epoch": 0.8147906220181489, "grad_norm": 0.9701751578092589, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.2839044332504272, "learning_rate": 1.7354739569538081e-06, "loss": 0.7003, "step": 994 }, { "epoch": 0.8156103308934186, "grad_norm": 1.2966309162568703, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.0438741445541382, "learning_rate": 1.7205392364243623e-06, "loss": 0.6552, "step": 995 }, { "epoch": 0.8164300397686884, "grad_norm": 0.9782367096504212, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.001082633389160037, "learning_rate": 1.705663003870418e-06, "loss": 0.6703, "step": 996 }, { "epoch": 0.8172497486439582, "grad_norm": 1.088398164465581, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 2.4653303623199463, "learning_rate": 1.6908453643810342e-06, "loss": 0.6867, "step": 997 }, { "epoch": 0.8180694575192279, "grad_norm": 1.011122031737629, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.00019123633683193475, "learning_rate": 1.6760864226313534e-06, "loss": 0.6932, "step": 998 }, { "epoch": 0.8188891663944977, "grad_norm": 1.084594979554229, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.3952026665210724, "learning_rate": 1.6613862828818628e-06, "loss": 0.6944, "step": 999 }, { "epoch": 0.8197088752697674, "grad_norm": 1.0884391468070609, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.07994883507490158, "learning_rate": 1.6467450489776581e-06, "loss": 0.7154, "step": 1000 }, { "epoch": 0.8205285841450373, "grad_norm": 1.0528864366196309, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.5741978287696838, "learning_rate": 1.6321628243477194e-06, "loss": 0.7065, "step": 1001 }, { "epoch": 0.821348293020307, "grad_norm": 0.9003726005193258, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.0834848880767822, "learning_rate": 1.617639712004162e-06, "loss": 0.6887, "step": 1002 }, { "epoch": 0.8221680018955768, "grad_norm": 1.0953466203553535, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.8778793811798096, "learning_rate": 1.6031758145415222e-06, "loss": 0.7183, "step": 1003 }, { "epoch": 0.8229877107708465, "grad_norm": 1.3094462897516457, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.7071510553359985, "learning_rate": 1.5887712341360294e-06, "loss": 0.655, "step": 1004 }, { "epoch": 0.8238074196461163, "grad_norm": 1.2741079991507434, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.9826719164848328, "learning_rate": 1.5744260725448845e-06, "loss": 0.7098, "step": 1005 }, { "epoch": 0.8246271285213861, "grad_norm": 1.3807979870256386, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.6817594170570374, "learning_rate": 1.560140431105539e-06, "loss": 0.7247, "step": 1006 }, { "epoch": 0.8254468373966558, "grad_norm": 0.8873518519627774, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 0.792921781539917, "learning_rate": 1.5459144107349788e-06, "loss": 0.6827, "step": 1007 }, { "epoch": 0.8262665462719256, "grad_norm": 1.1560254255031084, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.43505075573921204, "learning_rate": 1.531748111929021e-06, "loss": 0.6327, "step": 1008 }, { "epoch": 0.8270862551471954, "grad_norm": 0.9376104245004846, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.8129606246948242, "learning_rate": 1.5176416347615886e-06, "loss": 0.6649, "step": 1009 }, { "epoch": 0.8279059640224652, "grad_norm": 0.978107593811633, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.24315620958805084, "learning_rate": 1.5035950788840125e-06, "loss": 0.7299, "step": 1010 }, { "epoch": 0.8287256728977349, "grad_norm": 1.0723796482612582, "latest_boundary_loss": 0.0103687709197402, "latest_lm_loss": 0.8571600914001465, "learning_rate": 1.4896085435243279e-06, "loss": 0.7352, "step": 1011 }, { "epoch": 0.8295453817730046, "grad_norm": 0.8485706831514985, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.15590983629226685, "learning_rate": 1.4756821274865696e-06, "loss": 0.7033, "step": 1012 }, { "epoch": 0.8303650906482745, "grad_norm": 1.1532029542009357, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.7850178480148315, "learning_rate": 1.4618159291500777e-06, "loss": 0.6994, "step": 1013 }, { "epoch": 0.8311847995235442, "grad_norm": 0.9171322647842043, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 0.7002415657043457, "learning_rate": 1.4480100464687973e-06, "loss": 0.6907, "step": 1014 }, { "epoch": 0.832004508398814, "grad_norm": 0.9461919135045116, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 1.250064730644226, "learning_rate": 1.4342645769705977e-06, "loss": 0.6756, "step": 1015 }, { "epoch": 0.8328242172740837, "grad_norm": 0.9408275385934868, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.1754680573940277, "learning_rate": 1.4205796177565688e-06, "loss": 0.6778, "step": 1016 }, { "epoch": 0.8336439261493536, "grad_norm": 0.8872063150499062, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 7.366668432950974e-05, "learning_rate": 1.406955265500346e-06, "loss": 0.7014, "step": 1017 }, { "epoch": 0.8344636350246233, "grad_norm": 0.899092838204657, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.08955018222332001, "learning_rate": 1.3933916164474193e-06, "loss": 0.7095, "step": 1018 }, { "epoch": 0.835283343899893, "grad_norm": 0.9039468050992078, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 1.009004831314087, "learning_rate": 1.3798887664144634e-06, "loss": 0.6693, "step": 1019 }, { "epoch": 0.8361030527751628, "grad_norm": 0.9420936226816797, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.820389986038208, "learning_rate": 1.3664468107886496e-06, "loss": 0.6724, "step": 1020 }, { "epoch": 0.8369227616504326, "grad_norm": 1.0337088108204833, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.7910609841346741, "learning_rate": 1.3530658445269784e-06, "loss": 0.6982, "step": 1021 }, { "epoch": 0.8377424705257024, "grad_norm": 0.8920008801386402, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.0002237668086308986, "learning_rate": 1.339745962155613e-06, "loss": 0.6586, "step": 1022 }, { "epoch": 0.8385621794009721, "grad_norm": 0.8878748630080873, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.21126195788383484, "learning_rate": 1.3264872577692022e-06, "loss": 0.6403, "step": 1023 }, { "epoch": 0.8393818882762419, "grad_norm": 0.9824782887375642, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.4438121020793915, "learning_rate": 1.3132898250302173e-06, "loss": 0.7016, "step": 1024 }, { "epoch": 0.8402015971515117, "grad_norm": 0.9284738755107322, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 0.6033508777618408, "learning_rate": 1.3001537571682965e-06, "loss": 0.6488, "step": 1025 }, { "epoch": 0.8410213060267814, "grad_norm": 1.0275436466477972, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.733867883682251, "learning_rate": 1.2870791469795818e-06, "loss": 0.7057, "step": 1026 }, { "epoch": 0.8418410149020512, "grad_norm": 1.0365172265383704, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.2995297610759735, "learning_rate": 1.2740660868260634e-06, "loss": 0.7127, "step": 1027 }, { "epoch": 0.8426607237773209, "grad_norm": 0.925769380462904, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.0580196380615234, "learning_rate": 1.2611146686349284e-06, "loss": 0.7018, "step": 1028 }, { "epoch": 0.8434804326525908, "grad_norm": 1.0284978604727517, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.5550094842910767, "learning_rate": 1.2482249838979143e-06, "loss": 0.705, "step": 1029 }, { "epoch": 0.8443001415278605, "grad_norm": 1.0137142418446572, "latest_boundary_loss": 0.008892906829714775, "latest_lm_loss": 0.2271990329027176, "learning_rate": 1.2353971236706564e-06, "loss": 0.6913, "step": 1030 }, { "epoch": 0.8451198504031303, "grad_norm": 1.1551457512764751, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.6798177361488342, "learning_rate": 1.2226311785720468e-06, "loss": 0.7064, "step": 1031 }, { "epoch": 0.8459395592784, "grad_norm": 1.0026414252604277, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 2.053499460220337, "learning_rate": 1.209927238783598e-06, "loss": 0.6682, "step": 1032 }, { "epoch": 0.8467592681536698, "grad_norm": 1.046122239654961, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.22483663260936737, "learning_rate": 1.1972853940488017e-06, "loss": 0.6941, "step": 1033 }, { "epoch": 0.8475789770289396, "grad_norm": 0.9695514986754297, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.5129010677337646, "learning_rate": 1.1847057336724965e-06, "loss": 0.6948, "step": 1034 }, { "epoch": 0.8483986859042093, "grad_norm": 1.1762465496505037, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 0.6429762840270996, "learning_rate": 1.1721883465202333e-06, "loss": 0.7089, "step": 1035 }, { "epoch": 0.8492183947794791, "grad_norm": 0.9606560781970416, "latest_boundary_loss": 0.0098554827272892, "latest_lm_loss": 0.3866882026195526, "learning_rate": 1.1597333210176587e-06, "loss": 0.6832, "step": 1036 }, { "epoch": 0.8500381036547489, "grad_norm": 1.107190116224884, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.437673568725586, "learning_rate": 1.1473407451498752e-06, "loss": 0.7013, "step": 1037 }, { "epoch": 0.8508578125300187, "grad_norm": 0.9290125138612028, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.9868656396865845, "learning_rate": 1.1350107064608317e-06, "loss": 0.697, "step": 1038 }, { "epoch": 0.8516775214052884, "grad_norm": 0.9671078986806978, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.0005372909945435822, "learning_rate": 1.122743292052697e-06, "loss": 0.6661, "step": 1039 }, { "epoch": 0.8524972302805581, "grad_norm": 1.008315358751487, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.40882718563079834, "learning_rate": 1.1105385885852483e-06, "loss": 0.6802, "step": 1040 }, { "epoch": 0.853316939155828, "grad_norm": 0.9590775800671869, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.6967741250991821, "learning_rate": 1.0983966822752624e-06, "loss": 0.7003, "step": 1041 }, { "epoch": 0.8541366480310977, "grad_norm": 1.1614355933710476, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.2704944610595703, "learning_rate": 1.0863176588958957e-06, "loss": 0.7252, "step": 1042 }, { "epoch": 0.8549563569063675, "grad_norm": 0.9282762173980162, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 1.2122578620910645, "learning_rate": 1.0743016037760946e-06, "loss": 0.7397, "step": 1043 }, { "epoch": 0.8557760657816372, "grad_norm": 0.8913870616253222, "latest_boundary_loss": 0.0079883998259902, "latest_lm_loss": 0.3448260426521301, "learning_rate": 1.0623486017999762e-06, "loss": 0.6567, "step": 1044 }, { "epoch": 0.8565957746569071, "grad_norm": 0.9640589480129242, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.5379891991615295, "learning_rate": 1.0504587374062392e-06, "loss": 0.6983, "step": 1045 }, { "epoch": 0.8574154835321768, "grad_norm": 1.1505306352422153, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.6377214789390564, "learning_rate": 1.0386320945875627e-06, "loss": 0.6662, "step": 1046 }, { "epoch": 0.8582351924074465, "grad_norm": 1.3888897604913257, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.1375789642333984, "learning_rate": 1.0268687568900159e-06, "loss": 0.6728, "step": 1047 }, { "epoch": 0.8590549012827163, "grad_norm": 1.104199866708355, "latest_boundary_loss": 0.0103687709197402, "latest_lm_loss": 0.6023237705230713, "learning_rate": 1.0151688074124645e-06, "loss": 0.6672, "step": 1048 }, { "epoch": 0.859874610157986, "grad_norm": 1.1294132645411175, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.9752814769744873, "learning_rate": 1.0035323288059861e-06, "loss": 0.6935, "step": 1049 }, { "epoch": 0.8606943190332559, "grad_norm": 0.9265112367414724, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.01632915623486042, "learning_rate": 9.919594032732893e-07, "loss": 0.7239, "step": 1050 }, { "epoch": 0.8615140279085256, "grad_norm": 0.9294787698824167, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.0293835401535034, "learning_rate": 9.804501125681243e-07, "loss": 0.6589, "step": 1051 }, { "epoch": 0.8623337367837954, "grad_norm": 0.9643006666099048, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.3070087134838104, "learning_rate": 9.690045379947134e-07, "loss": 0.6573, "step": 1052 }, { "epoch": 0.8631534456590652, "grad_norm": 1.3563527360759056, "latest_boundary_loss": 0.009173923172056675, "latest_lm_loss": 0.17437432706356049, "learning_rate": 9.576227604071731e-07, "loss": 0.6879, "step": 1053 }, { "epoch": 0.8639731545343349, "grad_norm": 0.8590732970355337, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.5931690335273743, "learning_rate": 9.463048602089431e-07, "loss": 0.6628, "step": 1054 }, { "epoch": 0.8647928634096047, "grad_norm": 0.8338811190256139, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.2343312501907349, "learning_rate": 9.350509173522193e-07, "loss": 0.6627, "step": 1055 }, { "epoch": 0.8656125722848744, "grad_norm": 1.1185357563813256, "latest_boundary_loss": 0.008855608291924, "latest_lm_loss": 0.29267165064811707, "learning_rate": 9.23861011337387e-07, "loss": 0.71, "step": 1056 }, { "epoch": 0.8664322811601443, "grad_norm": 0.9148950702345827, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 4.5893782953498885e-05, "learning_rate": 9.127352212124663e-07, "loss": 0.6903, "step": 1057 }, { "epoch": 0.867251990035414, "grad_norm": 1.0796737879180378, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.4994605481624603, "learning_rate": 9.016736255725434e-07, "loss": 0.7115, "step": 1058 }, { "epoch": 0.8680716989106837, "grad_norm": 1.234481545340778, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.6549656391143799, "learning_rate": 8.906763025592191e-07, "loss": 0.6888, "step": 1059 }, { "epoch": 0.8688914077859535, "grad_norm": 0.8695815393820379, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.6221119165420532, "learning_rate": 8.797433298600622e-07, "loss": 0.6451, "step": 1060 }, { "epoch": 0.8697111166612232, "grad_norm": 0.8979257159775406, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 1.1266192197799683, "learning_rate": 8.688747847080514e-07, "loss": 0.7057, "step": 1061 }, { "epoch": 0.8705308255364931, "grad_norm": 0.8711264493055869, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.8611801862716675, "learning_rate": 8.580707438810398e-07, "loss": 0.6502, "step": 1062 }, { "epoch": 0.8713505344117628, "grad_norm": 0.9036091564450818, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.20681270956993103, "learning_rate": 8.473312837012027e-07, "loss": 0.685, "step": 1063 }, { "epoch": 0.8721702432870326, "grad_norm": 0.9140163464447754, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.5638993978500366, "learning_rate": 8.366564800345089e-07, "loss": 0.6863, "step": 1064 }, { "epoch": 0.8729899521623024, "grad_norm": 0.903067803899594, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.46477872133255005, "learning_rate": 8.260464082901732e-07, "loss": 0.6525, "step": 1065 }, { "epoch": 0.8738096610375721, "grad_norm": 1.092556604852937, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.7806563377380371, "learning_rate": 8.155011434201332e-07, "loss": 0.7041, "step": 1066 }, { "epoch": 0.8746293699128419, "grad_norm": 0.8491791236441539, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.006742133758962154, "learning_rate": 8.050207599185134e-07, "loss": 0.7096, "step": 1067 }, { "epoch": 0.8754490787881116, "grad_norm": 0.9756665543906982, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.70832759141922, "learning_rate": 7.946053318211045e-07, "loss": 0.6572, "step": 1068 }, { "epoch": 0.8762687876633815, "grad_norm": 1.101734910519092, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.7115592360496521, "learning_rate": 7.842549327048366e-07, "loss": 0.7385, "step": 1069 }, { "epoch": 0.8770884965386512, "grad_norm": 0.9894835075247712, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.0158761627972126, "learning_rate": 7.739696356872562e-07, "loss": 0.7242, "step": 1070 }, { "epoch": 0.877908205413921, "grad_norm": 0.9280748729331179, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.22196367383003235, "learning_rate": 7.637495134260242e-07, "loss": 0.7011, "step": 1071 }, { "epoch": 0.8787279142891907, "grad_norm": 1.0149104083424296, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.4822976589202881, "learning_rate": 7.535946381183812e-07, "loss": 0.7253, "step": 1072 }, { "epoch": 0.8795476231644604, "grad_norm": 1.2503795542431604, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.6795845031738281, "learning_rate": 7.435050815006562e-07, "loss": 0.7076, "step": 1073 }, { "epoch": 0.8803673320397303, "grad_norm": 1.1751629582487448, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.14189808070659637, "learning_rate": 7.334809148477484e-07, "loss": 0.7265, "step": 1074 }, { "epoch": 0.881187040915, "grad_norm": 1.023633521389993, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.8233854174613953, "learning_rate": 7.23522208972628e-07, "loss": 0.6807, "step": 1075 }, { "epoch": 0.8820067497902698, "grad_norm": 1.2040824272939745, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.30481016635894775, "learning_rate": 7.136290342258378e-07, "loss": 0.7227, "step": 1076 }, { "epoch": 0.8828264586655395, "grad_norm": 0.9005012986512613, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.1280655711889267, "learning_rate": 7.038014604949883e-07, "loss": 0.7077, "step": 1077 }, { "epoch": 0.8836461675408094, "grad_norm": 1.059509872562195, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.840686559677124, "learning_rate": 6.940395572042791e-07, "loss": 0.7117, "step": 1078 }, { "epoch": 0.8844658764160791, "grad_norm": 0.9129497516398813, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.7105281352996826, "learning_rate": 6.843433933139909e-07, "loss": 0.6609, "step": 1079 }, { "epoch": 0.8852855852913488, "grad_norm": 1.0055492519074114, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.26193323731422424, "learning_rate": 6.747130373200095e-07, "loss": 0.6809, "step": 1080 }, { "epoch": 0.8861052941666187, "grad_norm": 0.8289548101765181, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 3.957617445848882e-05, "learning_rate": 6.651485572533379e-07, "loss": 0.6935, "step": 1081 }, { "epoch": 0.8869250030418884, "grad_norm": 0.933368887026105, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 1.1051077842712402, "learning_rate": 6.556500206796179e-07, "loss": 0.7086, "step": 1082 }, { "epoch": 0.8877447119171582, "grad_norm": 0.983078683713394, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.15434131026268005, "learning_rate": 6.462174946986511e-07, "loss": 0.6995, "step": 1083 }, { "epoch": 0.8885644207924279, "grad_norm": 1.0403958045776212, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.6938844919204712, "learning_rate": 6.368510459439248e-07, "loss": 0.6779, "step": 1084 }, { "epoch": 0.8893841296676978, "grad_norm": 1.014898112979336, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.8538143038749695, "learning_rate": 6.275507405821435e-07, "loss": 0.6834, "step": 1085 }, { "epoch": 0.8902038385429675, "grad_norm": 0.8831074971134154, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.0254498720169067, "learning_rate": 6.183166443127587e-07, "loss": 0.6379, "step": 1086 }, { "epoch": 0.8910235474182372, "grad_norm": 0.9164494491686246, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.2494126856327057, "learning_rate": 6.091488223675058e-07, "loss": 0.6661, "step": 1087 }, { "epoch": 0.891843256293507, "grad_norm": 0.9521757488152639, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.3169527053833008, "learning_rate": 6.000473395099438e-07, "loss": 0.7202, "step": 1088 }, { "epoch": 0.8926629651687767, "grad_norm": 0.9250157752699806, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.8193890452384949, "learning_rate": 5.910122600349966e-07, "loss": 0.63, "step": 1089 }, { "epoch": 0.8934826740440466, "grad_norm": 0.9523240163296833, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.00014523675781674683, "learning_rate": 5.820436477685021e-07, "loss": 0.6442, "step": 1090 }, { "epoch": 0.8943023829193163, "grad_norm": 0.8227508156020683, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.7804707884788513, "learning_rate": 5.73141566066755e-07, "loss": 0.6676, "step": 1091 }, { "epoch": 0.8951220917945861, "grad_norm": 1.261248526588513, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 1.3599324226379395, "learning_rate": 5.64306077816068e-07, "loss": 0.7013, "step": 1092 }, { "epoch": 0.8959418006698558, "grad_norm": 0.9319644278221783, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.0531415119767189, "learning_rate": 5.555372454323182e-07, "loss": 0.6535, "step": 1093 }, { "epoch": 0.8967615095451256, "grad_norm": 0.9071109946846174, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.8236528635025024, "learning_rate": 5.468351308605135e-07, "loss": 0.6961, "step": 1094 }, { "epoch": 0.8975812184203954, "grad_norm": 0.9375616149742969, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 1.3615353107452393, "learning_rate": 5.3819979557435e-07, "loss": 0.6586, "step": 1095 }, { "epoch": 0.8984009272956651, "grad_norm": 0.9632662261783385, "latest_boundary_loss": 0.009594811126589775, "latest_lm_loss": 0.5572503209114075, "learning_rate": 5.296313005757814e-07, "loss": 0.6687, "step": 1096 }, { "epoch": 0.899220636170935, "grad_norm": 0.8861229609171315, "latest_boundary_loss": 0.009234958328306675, "latest_lm_loss": 0.7815489768981934, "learning_rate": 5.211297063945875e-07, "loss": 0.7012, "step": 1097 }, { "epoch": 0.9000403450462047, "grad_norm": 2.744907795248946, "latest_boundary_loss": 0.0067888894118368626, "latest_lm_loss": 0.9608690142631531, "learning_rate": 5.126950730879399e-07, "loss": 0.6937, "step": 1098 }, { "epoch": 0.9008600539214745, "grad_norm": 0.8557651630869942, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.9524214863777161, "learning_rate": 5.043274602399939e-07, "loss": 0.6739, "step": 1099 }, { "epoch": 0.9016797627967442, "grad_norm": 1.083706889006357, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.12171266227960587, "learning_rate": 4.96026926961447e-07, "loss": 0.6776, "step": 1100 }, { "epoch": 0.9024994716720139, "grad_norm": 1.2036150383840019, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.5232874155044556, "learning_rate": 4.877935318891381e-07, "loss": 0.6978, "step": 1101 }, { "epoch": 0.9033191805472838, "grad_norm": 0.8796425268642953, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.728472888469696, "learning_rate": 4.796273331856227e-07, "loss": 0.7009, "step": 1102 }, { "epoch": 0.9041388894225535, "grad_norm": 0.949652909584135, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.12783630192279816, "learning_rate": 4.715283885387678e-07, "loss": 0.6546, "step": 1103 }, { "epoch": 0.9049585982978233, "grad_norm": 0.9360180034577728, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 0.6264219880104065, "learning_rate": 4.634967551613423e-07, "loss": 0.7048, "step": 1104 }, { "epoch": 0.905778307173093, "grad_norm": 0.9894781505404314, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 2.2205209732055664, "learning_rate": 4.555324897906133e-07, "loss": 0.6606, "step": 1105 }, { "epoch": 0.9065980160483629, "grad_norm": 0.8961352599710566, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.8902292847633362, "learning_rate": 4.476356486879474e-07, "loss": 0.6665, "step": 1106 }, { "epoch": 0.9074177249236326, "grad_norm": 0.9561799632029774, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 1.1162327527999878, "learning_rate": 4.398062876384046e-07, "loss": 0.6573, "step": 1107 }, { "epoch": 0.9082374337989023, "grad_norm": 0.9264646692636851, "latest_boundary_loss": 0.012135399505496025, "latest_lm_loss": 0.8248792290687561, "learning_rate": 4.320444619503583e-07, "loss": 0.7286, "step": 1108 }, { "epoch": 0.9090571426741721, "grad_norm": 0.9771695514002697, "latest_boundary_loss": 0.00997246615588665, "latest_lm_loss": 0.5312575697898865, "learning_rate": 4.243502264550903e-07, "loss": 0.7175, "step": 1109 }, { "epoch": 0.9098768515494419, "grad_norm": 1.0255787947792963, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.16585031151771545, "learning_rate": 4.1672363550641415e-07, "loss": 0.7122, "step": 1110 }, { "epoch": 0.9106965604247117, "grad_norm": 0.8691730766755638, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.0761048793792725, "learning_rate": 4.0916474298028694e-07, "loss": 0.6277, "step": 1111 }, { "epoch": 0.9115162692999814, "grad_norm": 0.8647720897128677, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.2423782348632812, "learning_rate": 4.016736022744272e-07, "loss": 0.6404, "step": 1112 }, { "epoch": 0.9123359781752512, "grad_norm": 0.9125626978873399, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 0.08720621466636658, "learning_rate": 3.942502663079395e-07, "loss": 0.6873, "step": 1113 }, { "epoch": 0.913155687050521, "grad_norm": 0.9593819957244605, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.7371125817298889, "learning_rate": 3.8689478752094167e-07, "loss": 0.6735, "step": 1114 }, { "epoch": 0.9139753959257907, "grad_norm": 0.9657999166500343, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 0.10703489929437637, "learning_rate": 3.7960721787419164e-07, "loss": 0.669, "step": 1115 }, { "epoch": 0.9147951048010605, "grad_norm": 1.0245304385496954, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.2033360004425049, "learning_rate": 3.7238760884872216e-07, "loss": 0.6725, "step": 1116 }, { "epoch": 0.9156148136763302, "grad_norm": 0.9603629571870653, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.01297867763787508, "learning_rate": 3.6523601144548003e-07, "loss": 0.6439, "step": 1117 }, { "epoch": 0.9164345225516001, "grad_norm": 0.9464634813864072, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.09466932713985443, "learning_rate": 3.5815247618495753e-07, "loss": 0.6848, "step": 1118 }, { "epoch": 0.9172542314268698, "grad_norm": 0.9447173243178177, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.45157015323638916, "learning_rate": 3.5113705310684363e-07, "loss": 0.6795, "step": 1119 }, { "epoch": 0.9180739403021395, "grad_norm": 0.9303087695466622, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 0.05889945849776268, "learning_rate": 3.441897917696679e-07, "loss": 0.6707, "step": 1120 }, { "epoch": 0.9188936491774093, "grad_norm": 0.9223108790160708, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.8003207445144653, "learning_rate": 3.373107412504473e-07, "loss": 0.7137, "step": 1121 }, { "epoch": 0.9197133580526791, "grad_norm": 0.9317477661755202, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.4609176218509674, "learning_rate": 3.30499950144344e-07, "loss": 0.6737, "step": 1122 }, { "epoch": 0.9205330669279489, "grad_norm": 0.9647382467153185, "latest_boundary_loss": 0.011393229477107525, "latest_lm_loss": 1.6046785116195679, "learning_rate": 3.2375746656432284e-07, "loss": 0.6836, "step": 1123 }, { "epoch": 0.9213527758032186, "grad_norm": 0.9198925351400825, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.148537278175354, "learning_rate": 3.170833381408045e-07, "loss": 0.6604, "step": 1124 }, { "epoch": 0.9221724846784884, "grad_norm": 1.0654224146292754, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 0.7485402226448059, "learning_rate": 3.10477612021336e-07, "loss": 0.6759, "step": 1125 }, { "epoch": 0.9229921935537582, "grad_norm": 1.0353001603534244, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.8129321932792664, "learning_rate": 3.03940334870253e-07, "loss": 0.6607, "step": 1126 }, { "epoch": 0.9238119024290279, "grad_norm": 1.042114244453928, "latest_boundary_loss": 0.0057211983948946, "latest_lm_loss": 1.2283984422683716, "learning_rate": 2.974715528683547e-07, "loss": 0.6552, "step": 1127 }, { "epoch": 0.9246316113042977, "grad_norm": 0.8145880686253928, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.8882852792739868, "learning_rate": 2.910713117125719e-07, "loss": 0.6488, "step": 1128 }, { "epoch": 0.9254513201795674, "grad_norm": 0.8804964820061129, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.5401952266693115, "learning_rate": 2.8473965661565353e-07, "loss": 0.6834, "step": 1129 }, { "epoch": 0.9262710290548373, "grad_norm": 0.8887526697088693, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.616662323474884, "learning_rate": 2.784766323058352e-07, "loss": 0.6884, "step": 1130 }, { "epoch": 0.927090737930107, "grad_norm": 1.0843288286789219, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.0312321186065674, "learning_rate": 2.7228228302653037e-07, "loss": 0.685, "step": 1131 }, { "epoch": 0.9279104468053768, "grad_norm": 0.9939393721575795, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 0.0017697591101750731, "learning_rate": 2.661566525360193e-07, "loss": 0.6716, "step": 1132 }, { "epoch": 0.9287301556806465, "grad_norm": 1.3318793706542362, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.6837891936302185, "learning_rate": 2.600997841071329e-07, "loss": 0.654, "step": 1133 }, { "epoch": 0.9295498645559163, "grad_norm": 0.9315208103768039, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 6.049530566087924e-05, "learning_rate": 2.54111720526955e-07, "loss": 0.6847, "step": 1134 }, { "epoch": 0.9303695734311861, "grad_norm": 0.908915974466263, "latest_boundary_loss": 0.00856865756213665, "latest_lm_loss": 0.5950667858123779, "learning_rate": 2.4819250409651605e-07, "loss": 0.7054, "step": 1135 }, { "epoch": 0.9311892823064558, "grad_norm": 0.9859693685796354, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.00023288476222660393, "learning_rate": 2.423421766304934e-07, "loss": 0.6722, "step": 1136 }, { "epoch": 0.9320089911817256, "grad_norm": 1.0252388819923457, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 0.8820898532867432, "learning_rate": 2.3656077945691802e-07, "loss": 0.6727, "step": 1137 }, { "epoch": 0.9328287000569954, "grad_norm": 1.0350472265756638, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.5197891592979431, "learning_rate": 2.308483534168815e-07, "loss": 0.6961, "step": 1138 }, { "epoch": 0.9336484089322652, "grad_norm": 0.899922510932412, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.6255961656570435, "learning_rate": 2.2520493886424743e-07, "loss": 0.6538, "step": 1139 }, { "epoch": 0.9344681178075349, "grad_norm": 0.9970373502486537, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.5130091309547424, "learning_rate": 2.1963057566536715e-07, "loss": 0.7211, "step": 1140 }, { "epoch": 0.9352878266828046, "grad_norm": 0.8730905920019364, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.7840816378593445, "learning_rate": 2.1412530319879888e-07, "loss": 0.6904, "step": 1141 }, { "epoch": 0.9361075355580745, "grad_norm": 1.0311341998753194, "latest_boundary_loss": 0.0074475607834756374, "latest_lm_loss": 0.20129425823688507, "learning_rate": 2.0868916035502785e-07, "loss": 0.7055, "step": 1142 }, { "epoch": 0.9369272444333442, "grad_norm": 0.7737336945908111, "latest_boundary_loss": 0.010595110245049, "latest_lm_loss": 0.13958147168159485, "learning_rate": 2.0332218553618888e-07, "loss": 0.665, "step": 1143 }, { "epoch": 0.937746953308614, "grad_norm": 0.9223835504099516, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 1.8956537246704102, "learning_rate": 1.9802441665580208e-07, "loss": 0.6723, "step": 1144 }, { "epoch": 0.9385666621838837, "grad_norm": 1.1542517963708663, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.1046380996704102, "learning_rate": 1.9279589113850082e-07, "loss": 0.7222, "step": 1145 }, { "epoch": 0.9393863710591536, "grad_norm": 0.9779244421224661, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 1.248913288116455, "learning_rate": 1.8763664591976426e-07, "loss": 0.6628, "step": 1146 }, { "epoch": 0.9402060799344233, "grad_norm": 1.0722139739185537, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.1151241064071655, "learning_rate": 1.825467174456652e-07, "loss": 0.6453, "step": 1147 }, { "epoch": 0.941025788809693, "grad_norm": 0.9868709668273624, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.0328876972198486, "learning_rate": 1.7752614167260484e-07, "loss": 0.6761, "step": 1148 }, { "epoch": 0.9418454976849628, "grad_norm": 1.0069100975811585, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.8549620509147644, "learning_rate": 1.7257495406705959e-07, "loss": 0.6866, "step": 1149 }, { "epoch": 0.9426652065602326, "grad_norm": 0.9472942286819052, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.6810474991798401, "learning_rate": 1.6769318960533465e-07, "loss": 0.6982, "step": 1150 }, { "epoch": 0.9434849154355024, "grad_norm": 0.8248801596333701, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 0.38281187415122986, "learning_rate": 1.6288088277331303e-07, "loss": 0.6364, "step": 1151 }, { "epoch": 0.9443046243107721, "grad_norm": 1.0950298001641026, "latest_boundary_loss": 0.009594811126589775, "latest_lm_loss": 1.4213231801986694, "learning_rate": 1.5813806756621475e-07, "loss": 0.7097, "step": 1152 }, { "epoch": 0.9451243331860419, "grad_norm": 0.8750449824861067, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.974471926689148, "learning_rate": 1.5346477748835353e-07, "loss": 0.6864, "step": 1153 }, { "epoch": 0.9459440420613117, "grad_norm": 1.036573264436613, "latest_boundary_loss": 0.0057737561874091625, "latest_lm_loss": 1.0913333892822266, "learning_rate": 1.488610455529038e-07, "loss": 0.6795, "step": 1154 }, { "epoch": 0.9467637509365814, "grad_norm": 1.0182122945649013, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.13572584092617035, "learning_rate": 1.4432690428166528e-07, "loss": 0.6866, "step": 1155 }, { "epoch": 0.9475834598118512, "grad_norm": 1.1295049502284513, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.0016975275939330459, "learning_rate": 1.39862385704832e-07, "loss": 0.6223, "step": 1156 }, { "epoch": 0.9484031686871209, "grad_norm": 0.9294627998649388, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.661367416381836, "learning_rate": 1.3546752136076924e-07, "loss": 0.6872, "step": 1157 }, { "epoch": 0.9492228775623908, "grad_norm": 0.8673528883018865, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.8435372710227966, "learning_rate": 1.3114234229578803e-07, "loss": 0.6791, "step": 1158 }, { "epoch": 0.9500425864376605, "grad_norm": 0.8864056422060821, "latest_boundary_loss": 0.0085512800142169, "latest_lm_loss": 0.9022582173347473, "learning_rate": 1.2688687906392772e-07, "loss": 0.6732, "step": 1159 }, { "epoch": 0.9508622953129303, "grad_norm": 0.9705935393989046, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 0.2375027984380722, "learning_rate": 1.2270116172673818e-07, "loss": 0.6658, "step": 1160 }, { "epoch": 0.9516820041882, "grad_norm": 1.0746487714819126, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 1.1714025735855103, "learning_rate": 1.1858521985307126e-07, "loss": 0.6641, "step": 1161 }, { "epoch": 0.9525017130634698, "grad_norm": 0.8897494314587888, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 0.10726118087768555, "learning_rate": 1.1453908251886636e-07, "loss": 0.7123, "step": 1162 }, { "epoch": 0.9533214219387396, "grad_norm": 1.3678314656268515, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.4614104926586151, "learning_rate": 1.105627783069485e-07, "loss": 0.6938, "step": 1163 }, { "epoch": 0.9541411308140093, "grad_norm": 1.17640124821323, "latest_boundary_loss": 0.007210625801235437, "latest_lm_loss": 0.6621823906898499, "learning_rate": 1.0665633530682618e-07, "loss": 0.655, "step": 1164 }, { "epoch": 0.9549608396892791, "grad_norm": 1.0373070064735386, "latest_boundary_loss": 0.0077290004119277, "latest_lm_loss": 0.3197590410709381, "learning_rate": 1.0281978111449375e-07, "loss": 0.7092, "step": 1165 }, { "epoch": 0.9557805485645489, "grad_norm": 0.8863840478937884, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.0001209241381729953, "learning_rate": 9.905314283223166e-08, "loss": 0.7096, "step": 1166 }, { "epoch": 0.9566002574398187, "grad_norm": 0.8996412393018711, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.8527716994285583, "learning_rate": 9.535644706842318e-08, "loss": 0.6852, "step": 1167 }, { "epoch": 0.9574199663150884, "grad_norm": 0.9265852938058231, "latest_boundary_loss": 0.0060293409042060375, "latest_lm_loss": 0.762462854385376, "learning_rate": 9.172971993735902e-08, "loss": 0.6965, "step": 1168 }, { "epoch": 0.9582396751903581, "grad_norm": 0.890612727837806, "latest_boundary_loss": 0.006077660713344812, "latest_lm_loss": 0.7109687924385071, "learning_rate": 8.817298705905642e-08, "loss": 0.6719, "step": 1169 }, { "epoch": 0.959059384065628, "grad_norm": 0.9727157109292386, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.47297853231430054, "learning_rate": 8.468627355907811e-08, "loss": 0.6655, "step": 1170 }, { "epoch": 0.9598790929408977, "grad_norm": 0.8230170305748943, "latest_boundary_loss": 0.007701873779296875, "latest_lm_loss": 0.808647096157074, "learning_rate": 8.12696040683525e-08, "loss": 0.6852, "step": 1171 }, { "epoch": 0.9606988018161675, "grad_norm": 0.9320553097259945, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.16965647041797638, "learning_rate": 7.792300272300268e-08, "loss": 0.6951, "step": 1172 }, { "epoch": 0.9615185106914372, "grad_norm": 0.9945696940159273, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 1.4004206657409668, "learning_rate": 7.464649316417438e-08, "loss": 0.6921, "step": 1173 }, { "epoch": 0.9623382195667071, "grad_norm": 1.0546950021534516, "latest_boundary_loss": 0.006991492584347725, "latest_lm_loss": 0.698226809501648, "learning_rate": 7.144009853786826e-08, "loss": 0.6793, "step": 1174 }, { "epoch": 0.9631579284419768, "grad_norm": 1.120323087414765, "latest_boundary_loss": 0.00566058699041605, "latest_lm_loss": 0.8183578848838806, "learning_rate": 6.830384149478009e-08, "loss": 0.6763, "step": 1175 }, { "epoch": 0.9639776373172465, "grad_norm": 0.8765310892052712, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 1.318392038345337, "learning_rate": 6.523774419013418e-08, "loss": 0.6342, "step": 1176 }, { "epoch": 0.9647973461925163, "grad_norm": 1.126438962440406, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 0.07761969417333603, "learning_rate": 6.224182828353243e-08, "loss": 0.7358, "step": 1177 }, { "epoch": 0.9656170550677861, "grad_norm": 1.1099094935854124, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.969371497631073, "learning_rate": 5.9316114938801076e-08, "loss": 0.7111, "step": 1178 }, { "epoch": 0.9664367639430559, "grad_norm": 1.0324488728855972, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.33742189407348633, "learning_rate": 5.6460624823836405e-08, "loss": 0.6906, "step": 1179 }, { "epoch": 0.9672564728183256, "grad_norm": 0.9189827829789549, "latest_boundary_loss": 0.0058042737655341625, "latest_lm_loss": 2.154536485671997, "learning_rate": 5.367537811046486e-08, "loss": 0.7172, "step": 1180 }, { "epoch": 0.9680761816935954, "grad_norm": 1.0206041012891969, "latest_boundary_loss": 0.005970849189907312, "latest_lm_loss": 1.0656417608261108, "learning_rate": 5.096039447429535e-08, "loss": 0.7161, "step": 1181 }, { "epoch": 0.9688958905688652, "grad_norm": 1.2396346636276663, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.46780502796173096, "learning_rate": 4.8315693094584945e-08, "loss": 0.66, "step": 1182 }, { "epoch": 0.9697155994441349, "grad_norm": 0.9936835694223108, "latest_boundary_loss": 0.006434546783566475, "latest_lm_loss": 0.9413383603096008, "learning_rate": 4.57412926541001e-08, "loss": 0.6781, "step": 1183 }, { "epoch": 0.9705353083194047, "grad_norm": 0.9083977418455209, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.19331450760364532, "learning_rate": 4.3237211338983396e-08, "loss": 0.7134, "step": 1184 }, { "epoch": 0.9713550171946744, "grad_norm": 0.9592795880182838, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.39722156524658203, "learning_rate": 4.0803466838631454e-08, "loss": 0.6747, "step": 1185 }, { "epoch": 0.9721747260699443, "grad_norm": 0.9714053771381248, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 1.228805422782898, "learning_rate": 3.8440076345561685e-08, "loss": 0.7209, "step": 1186 }, { "epoch": 0.972994434945214, "grad_norm": 0.921771241053584, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.7271464467048645, "learning_rate": 3.6147056555296825e-08, "loss": 0.6479, "step": 1187 }, { "epoch": 0.9738141438204837, "grad_norm": 0.8660434095816893, "latest_boundary_loss": 0.005879296455532312, "latest_lm_loss": 0.5803873538970947, "learning_rate": 3.392442366624615e-08, "loss": 0.6916, "step": 1188 }, { "epoch": 0.9746338526957535, "grad_norm": 0.9325181346039524, "latest_boundary_loss": 0.006603240966796875, "latest_lm_loss": 1.1471364498138428, "learning_rate": 3.177219337958892e-08, "loss": 0.6886, "step": 1189 }, { "epoch": 0.9754535615710233, "grad_norm": 0.9683508984966774, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 0.00031163747189566493, "learning_rate": 2.969038089916443e-08, "loss": 0.6776, "step": 1190 }, { "epoch": 0.9762732704462931, "grad_norm": 0.9746965577670207, "latest_boundary_loss": 0.006282806396484375, "latest_lm_loss": 1.1629018783569336, "learning_rate": 2.767900093136544e-08, "loss": 0.704, "step": 1191 }, { "epoch": 0.9770929793215628, "grad_norm": 0.8719433107953927, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 1.1448140144348145, "learning_rate": 2.573806768503162e-08, "loss": 0.6693, "step": 1192 }, { "epoch": 0.9779126881968326, "grad_norm": 1.065548685113908, "latest_boundary_loss": 0.00684271939098835, "latest_lm_loss": 1.1891309022903442, "learning_rate": 2.386759487135293e-08, "loss": 0.7103, "step": 1193 }, { "epoch": 0.9787323970721024, "grad_norm": 0.963162500260635, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 0.4785090982913971, "learning_rate": 2.206759570377193e-08, "loss": 0.7191, "step": 1194 }, { "epoch": 0.9795521059473721, "grad_norm": 1.0323228800970756, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.3327829837799072, "learning_rate": 2.033808289788608e-08, "loss": 0.7207, "step": 1195 }, { "epoch": 0.9803718148226419, "grad_norm": 0.9321536596384047, "latest_boundary_loss": 0.0058424207381904125, "latest_lm_loss": 0.523434042930603, "learning_rate": 1.8679068671364488e-08, "loss": 0.6892, "step": 1196 }, { "epoch": 0.9811915236979116, "grad_norm": 0.8815339123981941, "latest_boundary_loss": 0.009594811126589775, "latest_lm_loss": 1.6022361516952515, "learning_rate": 1.7090564743857952e-08, "loss": 0.7141, "step": 1197 }, { "epoch": 0.9820112325731815, "grad_norm": 0.9588968707980078, "latest_boundary_loss": 0.00704108364880085, "latest_lm_loss": 0.6818172335624695, "learning_rate": 1.557258233691572e-08, "loss": 0.6641, "step": 1198 }, { "epoch": 0.9828309414484512, "grad_norm": 0.8965615654269011, "latest_boundary_loss": 0.0082622105255723, "latest_lm_loss": 1.3347175121307373, "learning_rate": 1.4125132173905542e-08, "loss": 0.6756, "step": 1199 }, { "epoch": 0.983650650323721, "grad_norm": 0.8716820353963431, "latest_boundary_loss": 0.0057004294358193874, "latest_lm_loss": 8.92801399459131e-05, "learning_rate": 1.2748224479943727e-08, "loss": 0.7151, "step": 1200 }, { "epoch": 0.9844703591989907, "grad_norm": 1.2219211098964566, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 1.1162246465682983, "learning_rate": 1.1441868981815207e-08, "loss": 0.6877, "step": 1201 }, { "epoch": 0.9852900680742605, "grad_norm": 0.9015750621516523, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.279168039560318, "learning_rate": 1.0206074907909147e-08, "loss": 0.6922, "step": 1202 }, { "epoch": 0.9861097769495303, "grad_norm": 0.9373603261718022, "latest_boundary_loss": 0.006199306808412075, "latest_lm_loss": 1.2174696922302246, "learning_rate": 9.040850988153437e-09, "loss": 0.695, "step": 1203 }, { "epoch": 0.9869294858248, "grad_norm": 0.9617940871081109, "latest_boundary_loss": 0.00725555419921875, "latest_lm_loss": 0.4450468122959137, "learning_rate": 7.946205453953638e-09, "loss": 0.6393, "step": 1204 }, { "epoch": 0.9877491947000698, "grad_norm": 0.8399195599066075, "latest_boundary_loss": 0.0061480202712118626, "latest_lm_loss": 1.4880940914154053, "learning_rate": 6.9221460381296845e-09, "loss": 0.6631, "step": 1205 }, { "epoch": 0.9885689035753396, "grad_norm": 0.9265625256512428, "latest_boundary_loss": 0.0059276157990098, "latest_lm_loss": 1.0487496852874756, "learning_rate": 5.968679974870384e-09, "loss": 0.6829, "step": 1206 }, { "epoch": 0.9893886124506094, "grad_norm": 0.8043483109177013, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 1.7094249725341797, "learning_rate": 5.08581399967345e-09, "loss": 0.6843, "step": 1207 }, { "epoch": 0.9902083213258791, "grad_norm": 0.8679269589207061, "latest_boundary_loss": 0.005672454833984375, "latest_lm_loss": 0.8320218324661255, "learning_rate": 4.273554349303321e-09, "loss": 0.6532, "step": 1208 }, { "epoch": 0.9910280302011488, "grad_norm": 1.1488104222577598, "latest_boundary_loss": 0.0079731410369277, "latest_lm_loss": 1.1925472021102905, "learning_rate": 3.5319067617445302e-09, "loss": 0.6659, "step": 1209 }, { "epoch": 0.9918477390764187, "grad_norm": 0.8415963783882109, "latest_boundary_loss": 0.0064904955215752125, "latest_lm_loss": 0.45819953083992004, "learning_rate": 2.8608764761639542e-09, "loss": 0.683, "step": 1210 }, { "epoch": 0.9926674479516884, "grad_norm": 0.8306015065243869, "latest_boundary_loss": 0.0056843226775527, "latest_lm_loss": 0.113001748919487, "learning_rate": 2.2604682328697393e-09, "loss": 0.6541, "step": 1211 }, { "epoch": 0.9934871568269582, "grad_norm": 1.1308654053245843, "latest_boundary_loss": 0.0066587659530341625, "latest_lm_loss": 0.1812564730644226, "learning_rate": 1.7306862732813234e-09, "loss": 0.7132, "step": 1212 }, { "epoch": 0.9943068657022279, "grad_norm": 1.2160776786481124, "latest_boundary_loss": 0.005664825439453125, "latest_lm_loss": 3.743060733540915e-05, "learning_rate": 1.2715343398972401e-09, "loss": 0.669, "step": 1213 }, { "epoch": 0.9951265745774978, "grad_norm": 0.9152975333346773, "latest_boundary_loss": 0.0057445103302598, "latest_lm_loss": 0.69028639793396, "learning_rate": 8.830156762706932e-10, "loss": 0.7089, "step": 1214 }, { "epoch": 0.9959462834527675, "grad_norm": 1.0594461330043325, "latest_boundary_loss": 0.006337060127407312, "latest_lm_loss": 0.5989055633544922, "learning_rate": 5.651330269840216e-10, "loss": 0.7259, "step": 1215 } ], "logging_steps": 1.0, "max_steps": 1219, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 15, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8737604084170752.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }