{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.24, "eval_steps": 250, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0016, "grad_norm": NaN, "learning_rate": 9.574468085106383e-06, "loss": 0.6083179950714112, "step": 10 }, { "epoch": 0.0032, "grad_norm": 0.2735198438167572, "learning_rate": 1.9148936170212766e-05, "loss": 0.6088993072509765, "step": 20 }, { "epoch": 0.0048, "grad_norm": 0.15276113152503967, "learning_rate": 2.9787234042553192e-05, "loss": 0.5225989818572998, "step": 30 }, { "epoch": 0.0064, "grad_norm": 0.17109858989715576, "learning_rate": 4.0425531914893614e-05, "loss": 0.4329381942749023, "step": 40 }, { "epoch": 0.008, "grad_norm": 0.17585736513137817, "learning_rate": 5.1063829787234044e-05, "loss": 0.35364015102386476, "step": 50 }, { "epoch": 0.0096, "grad_norm": 0.16095905005931854, "learning_rate": 6.170212765957447e-05, "loss": 0.26982028484344484, "step": 60 }, { "epoch": 0.0112, "grad_norm": 0.11053046584129333, "learning_rate": 7.23404255319149e-05, "loss": 0.20504410266876222, "step": 70 }, { "epoch": 0.0128, "grad_norm": 0.12669840455055237, "learning_rate": 8.297872340425533e-05, "loss": 0.19483240842819213, "step": 80 }, { "epoch": 0.0144, "grad_norm": 0.11641468852758408, "learning_rate": 9.361702127659576e-05, "loss": 0.17770581245422362, "step": 90 }, { "epoch": 0.016, "grad_norm": 0.14681392908096313, "learning_rate": 0.00010425531914893618, "loss": 0.15753360986709594, "step": 100 }, { "epoch": 0.0176, "grad_norm": 0.09883147478103638, "learning_rate": 0.00011489361702127661, "loss": 0.16169432401657105, "step": 110 }, { "epoch": 0.0192, "grad_norm": 0.1138603463768959, "learning_rate": 0.00012553191489361702, "loss": 0.16089822053909303, "step": 120 }, { "epoch": 0.0208, "grad_norm": 0.13063949346542358, "learning_rate": 0.00013617021276595746, "loss": 0.1603950023651123, "step": 130 }, { "epoch": 0.0224, "grad_norm": 0.06824357807636261, "learning_rate": 0.00014680851063829788, "loss": 0.14956578016281127, "step": 140 }, { "epoch": 0.024, "grad_norm": 0.12136659771203995, "learning_rate": 0.00015744680851063832, "loss": 0.1617922306060791, "step": 150 }, { "epoch": 0.0256, "grad_norm": 0.10032546520233154, "learning_rate": 0.00016808510638297873, "loss": 0.1547396659851074, "step": 160 }, { "epoch": 0.0272, "grad_norm": 0.07678422331809998, "learning_rate": 0.00017872340425531915, "loss": 0.14475579261779786, "step": 170 }, { "epoch": 0.0288, "grad_norm": 0.10933304578065872, "learning_rate": 0.00018936170212765957, "loss": 0.1330868124961853, "step": 180 }, { "epoch": 0.0304, "grad_norm": 0.12041473388671875, "learning_rate": 0.0002, "loss": 0.14836544990539552, "step": 190 }, { "epoch": 0.032, "grad_norm": 0.0896446481347084, "learning_rate": 0.00019967007588254704, "loss": 0.14405652284622192, "step": 200 }, { "epoch": 0.0336, "grad_norm": 0.0876811295747757, "learning_rate": 0.00019934015176509403, "loss": 0.14646297693252563, "step": 210 }, { "epoch": 0.0352, "grad_norm": 0.09327778220176697, "learning_rate": 0.00019901022764764106, "loss": 0.14419257640838623, "step": 220 }, { "epoch": 0.0368, "grad_norm": 0.08388442546129227, "learning_rate": 0.00019868030353018806, "loss": 0.15150091648101807, "step": 230 }, { "epoch": 0.0384, "grad_norm": 0.09979762881994247, "learning_rate": 0.00019835037941273509, "loss": 0.14006744623184203, "step": 240 }, { "epoch": 0.04, "grad_norm": 0.0845855325460434, "learning_rate": 0.0001980204552952821, "loss": 0.15045372247695923, "step": 250 }, { "epoch": 0.0416, "grad_norm": 0.09481288492679596, "learning_rate": 0.0001976905311778291, "loss": 0.15042688846588134, "step": 260 }, { "epoch": 0.0432, "grad_norm": 0.10349375009536743, "learning_rate": 0.0001973606070603761, "loss": 0.13992291688919067, "step": 270 }, { "epoch": 0.0448, "grad_norm": 0.07897678017616272, "learning_rate": 0.00019703068294292314, "loss": 0.13927781581878662, "step": 280 }, { "epoch": 0.0464, "grad_norm": 0.08341789990663528, "learning_rate": 0.00019670075882547014, "loss": 0.14076149463653564, "step": 290 }, { "epoch": 0.048, "grad_norm": 0.10565593093633652, "learning_rate": 0.00019637083470801716, "loss": 0.14325612783432007, "step": 300 }, { "epoch": 0.0496, "grad_norm": 0.07861499488353729, "learning_rate": 0.0001960409105905642, "loss": 0.1343199133872986, "step": 310 }, { "epoch": 0.0512, "grad_norm": 0.09252545982599258, "learning_rate": 0.0001957109864731112, "loss": 0.12891001701354982, "step": 320 }, { "epoch": 0.0528, "grad_norm": 0.08716761320829391, "learning_rate": 0.0001953810623556582, "loss": 0.1449826717376709, "step": 330 }, { "epoch": 0.0544, "grad_norm": 0.07750111818313599, "learning_rate": 0.0001950511382382052, "loss": 0.1274427056312561, "step": 340 }, { "epoch": 0.056, "grad_norm": 0.07396410405635834, "learning_rate": 0.00019472121412075224, "loss": 0.12241615056991577, "step": 350 }, { "epoch": 0.0576, "grad_norm": 0.07157568633556366, "learning_rate": 0.00019439129000329926, "loss": 0.14313431978225707, "step": 360 }, { "epoch": 0.0592, "grad_norm": 0.08780192583799362, "learning_rate": 0.00019406136588584626, "loss": 0.13534088134765626, "step": 370 }, { "epoch": 0.0608, "grad_norm": 0.09394513815641403, "learning_rate": 0.0001937314417683933, "loss": 0.1249586820602417, "step": 380 }, { "epoch": 0.0624, "grad_norm": 0.0853569507598877, "learning_rate": 0.0001934015176509403, "loss": 0.13353261947631836, "step": 390 }, { "epoch": 0.064, "grad_norm": 0.08356380462646484, "learning_rate": 0.00019307159353348731, "loss": 0.12304072380065918, "step": 400 }, { "epoch": 0.0656, "grad_norm": 0.08608467876911163, "learning_rate": 0.00019274166941603434, "loss": 0.13379846811294555, "step": 410 }, { "epoch": 0.0672, "grad_norm": 0.07890665531158447, "learning_rate": 0.0001924117452985813, "loss": 0.11951367855072022, "step": 420 }, { "epoch": 0.0688, "grad_norm": 0.08108149468898773, "learning_rate": 0.00019208182118112834, "loss": 0.12902278900146485, "step": 430 }, { "epoch": 0.0704, "grad_norm": 0.09603618830442429, "learning_rate": 0.00019175189706367536, "loss": 0.12690144777297974, "step": 440 }, { "epoch": 0.072, "grad_norm": 0.09471320360898972, "learning_rate": 0.00019142197294622236, "loss": 0.13802603483200074, "step": 450 }, { "epoch": 0.0736, "grad_norm": 0.08374392986297607, "learning_rate": 0.0001910920488287694, "loss": 0.12328752279281616, "step": 460 }, { "epoch": 0.0752, "grad_norm": 0.08944465219974518, "learning_rate": 0.00019076212471131642, "loss": 0.12756569385528566, "step": 470 }, { "epoch": 0.0768, "grad_norm": 0.0898577868938446, "learning_rate": 0.00019043220059386341, "loss": 0.13218681812286376, "step": 480 }, { "epoch": 0.0784, "grad_norm": 0.07767961174249649, "learning_rate": 0.00019010227647641044, "loss": 0.135015869140625, "step": 490 }, { "epoch": 0.08, "grad_norm": 0.0865555852651596, "learning_rate": 0.00018977235235895744, "loss": 0.128175950050354, "step": 500 }, { "epoch": 0.0816, "grad_norm": 0.07919178158044815, "learning_rate": 0.00018944242824150447, "loss": 0.12430660724639893, "step": 510 }, { "epoch": 0.0832, "grad_norm": 0.08649525046348572, "learning_rate": 0.0001891125041240515, "loss": 0.12590073347091674, "step": 520 }, { "epoch": 0.0848, "grad_norm": 0.08704695850610733, "learning_rate": 0.0001887825800065985, "loss": 0.12156925201416016, "step": 530 }, { "epoch": 0.0864, "grad_norm": 0.06752946227788925, "learning_rate": 0.00018845265588914552, "loss": 0.12604955434799195, "step": 540 }, { "epoch": 0.088, "grad_norm": 0.09034618735313416, "learning_rate": 0.00018812273177169252, "loss": 0.13052459955215454, "step": 550 }, { "epoch": 0.0896, "grad_norm": 0.0869947075843811, "learning_rate": 0.00018779280765423954, "loss": 0.12303999662399293, "step": 560 }, { "epoch": 0.0912, "grad_norm": 0.0702558308839798, "learning_rate": 0.00018746288353678654, "loss": 0.12230894565582276, "step": 570 }, { "epoch": 0.0928, "grad_norm": 0.08718933910131454, "learning_rate": 0.00018713295941933354, "loss": 0.1285646677017212, "step": 580 }, { "epoch": 0.0944, "grad_norm": 0.07396125048398972, "learning_rate": 0.00018680303530188057, "loss": 0.1259121775627136, "step": 590 }, { "epoch": 0.096, "grad_norm": 0.10813502222299576, "learning_rate": 0.0001864731111844276, "loss": 0.12581136226654052, "step": 600 }, { "epoch": 0.0976, "grad_norm": 0.07332257181406021, "learning_rate": 0.0001861431870669746, "loss": 0.120159912109375, "step": 610 }, { "epoch": 0.0992, "grad_norm": 0.08529425412416458, "learning_rate": 0.00018581326294952162, "loss": 0.1297559142112732, "step": 620 }, { "epoch": 0.1008, "grad_norm": 0.09605136513710022, "learning_rate": 0.00018548333883206864, "loss": 0.12067115306854248, "step": 630 }, { "epoch": 0.1024, "grad_norm": 0.08586304634809494, "learning_rate": 0.00018515341471461564, "loss": 0.12730380296707153, "step": 640 }, { "epoch": 0.104, "grad_norm": 0.06986010074615479, "learning_rate": 0.00018482349059716267, "loss": 0.12864140272140503, "step": 650 }, { "epoch": 0.1056, "grad_norm": 0.08565957844257355, "learning_rate": 0.00018449356647970967, "loss": 0.13535914421081544, "step": 660 }, { "epoch": 0.1072, "grad_norm": 0.07841351628303528, "learning_rate": 0.0001841636423622567, "loss": 0.12447234392166137, "step": 670 }, { "epoch": 0.1088, "grad_norm": 0.07424665987491608, "learning_rate": 0.00018383371824480372, "loss": 0.12037907838821411, "step": 680 }, { "epoch": 0.1104, "grad_norm": 0.0957612544298172, "learning_rate": 0.00018350379412735072, "loss": 0.11919810771942138, "step": 690 }, { "epoch": 0.112, "grad_norm": 0.07862170785665512, "learning_rate": 0.00018317387000989775, "loss": 0.12414863109588622, "step": 700 }, { "epoch": 0.1136, "grad_norm": 0.12410055845975876, "learning_rate": 0.00018284394589244474, "loss": 0.12083030939102173, "step": 710 }, { "epoch": 0.1152, "grad_norm": 0.07692275941371918, "learning_rate": 0.00018251402177499174, "loss": 0.11559462547302246, "step": 720 }, { "epoch": 0.1168, "grad_norm": 0.07810766994953156, "learning_rate": 0.00018218409765753877, "loss": 0.12092136144638062, "step": 730 }, { "epoch": 0.1184, "grad_norm": 0.08475863188505173, "learning_rate": 0.00018185417354008577, "loss": 0.12225215435028076, "step": 740 }, { "epoch": 0.12, "grad_norm": 0.09497244656085968, "learning_rate": 0.0001815242494226328, "loss": 0.12478446960449219, "step": 750 }, { "epoch": 0.1216, "grad_norm": 0.07779653370380402, "learning_rate": 0.00018119432530517982, "loss": 0.11081166267395019, "step": 760 }, { "epoch": 0.1232, "grad_norm": 0.08435814827680588, "learning_rate": 0.00018086440118772682, "loss": 0.10844987630844116, "step": 770 }, { "epoch": 0.1248, "grad_norm": 0.07567104697227478, "learning_rate": 0.00018053447707027385, "loss": 0.11887184381484986, "step": 780 }, { "epoch": 0.1264, "grad_norm": 0.07750700414180756, "learning_rate": 0.00018020455295282087, "loss": 0.11811846494674683, "step": 790 }, { "epoch": 0.128, "grad_norm": 0.09390198439359665, "learning_rate": 0.00017987462883536787, "loss": 0.11379201412200927, "step": 800 }, { "epoch": 0.1296, "grad_norm": 0.08400580286979675, "learning_rate": 0.0001795447047179149, "loss": 0.11909257173538208, "step": 810 }, { "epoch": 0.1312, "grad_norm": 0.09543855488300323, "learning_rate": 0.0001792147806004619, "loss": 0.10916774272918701, "step": 820 }, { "epoch": 0.1328, "grad_norm": 0.07908441871404648, "learning_rate": 0.00017888485648300892, "loss": 0.107346510887146, "step": 830 }, { "epoch": 0.1344, "grad_norm": 0.1085224449634552, "learning_rate": 0.00017855493236555595, "loss": 0.12227011919021606, "step": 840 }, { "epoch": 0.136, "grad_norm": 0.07472517341375351, "learning_rate": 0.00017822500824810295, "loss": 0.11575174331665039, "step": 850 }, { "epoch": 0.1376, "grad_norm": 0.07198534905910492, "learning_rate": 0.00017789508413064997, "loss": 0.12281327247619629, "step": 860 }, { "epoch": 0.1392, "grad_norm": 0.09142109006643295, "learning_rate": 0.00017756516001319697, "loss": 0.11497378349304199, "step": 870 }, { "epoch": 0.1408, "grad_norm": 0.09548252075910568, "learning_rate": 0.00017723523589574397, "loss": 0.11615512371063233, "step": 880 }, { "epoch": 0.1424, "grad_norm": 0.06250233203172684, "learning_rate": 0.000176905311778291, "loss": 0.11593252420425415, "step": 890 }, { "epoch": 0.144, "grad_norm": 0.08740886300802231, "learning_rate": 0.000176575387660838, "loss": 0.11546707153320312, "step": 900 }, { "epoch": 0.1456, "grad_norm": 0.11061470210552216, "learning_rate": 0.00017624546354338502, "loss": 0.12130849361419678, "step": 910 }, { "epoch": 0.1472, "grad_norm": 0.07824647426605225, "learning_rate": 0.00017591553942593205, "loss": 0.1188379168510437, "step": 920 }, { "epoch": 0.1488, "grad_norm": 0.08214984834194183, "learning_rate": 0.00017558561530847905, "loss": 0.11806504726409912, "step": 930 }, { "epoch": 0.1504, "grad_norm": 0.09313149005174637, "learning_rate": 0.00017525569119102607, "loss": 0.11112408638000489, "step": 940 }, { "epoch": 0.152, "grad_norm": 0.08523363620042801, "learning_rate": 0.0001749257670735731, "loss": 0.1136185884475708, "step": 950 }, { "epoch": 0.1536, "grad_norm": 0.06718438863754272, "learning_rate": 0.0001745958429561201, "loss": 0.1142117738723755, "step": 960 }, { "epoch": 0.1552, "grad_norm": 0.08877789974212646, "learning_rate": 0.00017426591883866713, "loss": 0.11236680746078491, "step": 970 }, { "epoch": 0.1568, "grad_norm": 0.07814772427082062, "learning_rate": 0.00017393599472121412, "loss": 0.10925638675689697, "step": 980 }, { "epoch": 0.1584, "grad_norm": 0.08659686148166656, "learning_rate": 0.00017360607060376115, "loss": 0.11623308658599854, "step": 990 }, { "epoch": 0.16, "grad_norm": 0.08823436498641968, "learning_rate": 0.00017327614648630818, "loss": 0.11374906301498414, "step": 1000 }, { "epoch": 0.1616, "grad_norm": 0.12844692170619965, "learning_rate": 0.00017294622236885518, "loss": 0.10570265054702759, "step": 1010 }, { "epoch": 0.1632, "grad_norm": 0.09296935796737671, "learning_rate": 0.00017261629825140217, "loss": 0.10974518060684205, "step": 1020 }, { "epoch": 0.1648, "grad_norm": 0.09684396535158157, "learning_rate": 0.0001722863741339492, "loss": 0.11235146522521973, "step": 1030 }, { "epoch": 0.1664, "grad_norm": 0.0794069766998291, "learning_rate": 0.0001719564500164962, "loss": 0.11345041990280151, "step": 1040 }, { "epoch": 0.168, "grad_norm": 0.0808623656630516, "learning_rate": 0.00017162652589904323, "loss": 0.11226475238800049, "step": 1050 }, { "epoch": 0.1696, "grad_norm": 0.09042982757091522, "learning_rate": 0.00017129660178159022, "loss": 0.11745167970657348, "step": 1060 }, { "epoch": 0.1712, "grad_norm": 0.0925358310341835, "learning_rate": 0.00017096667766413725, "loss": 0.11483606100082397, "step": 1070 }, { "epoch": 0.1728, "grad_norm": 0.08630611002445221, "learning_rate": 0.00017063675354668428, "loss": 0.11297872066497802, "step": 1080 }, { "epoch": 0.1744, "grad_norm": 0.07782171666622162, "learning_rate": 0.00017030682942923128, "loss": 0.12509260177612305, "step": 1090 }, { "epoch": 0.176, "grad_norm": 0.09083843231201172, "learning_rate": 0.0001699769053117783, "loss": 0.1190922737121582, "step": 1100 }, { "epoch": 0.1776, "grad_norm": 0.09185738116502762, "learning_rate": 0.00016964698119432533, "loss": 0.11026453971862793, "step": 1110 }, { "epoch": 0.1792, "grad_norm": 0.10063742846250534, "learning_rate": 0.00016931705707687233, "loss": 0.11582765579223633, "step": 1120 }, { "epoch": 0.1808, "grad_norm": 0.09147176891565323, "learning_rate": 0.00016898713295941935, "loss": 0.11444920301437378, "step": 1130 }, { "epoch": 0.1824, "grad_norm": 0.10646630078554153, "learning_rate": 0.00016865720884196635, "loss": 0.10560888051986694, "step": 1140 }, { "epoch": 0.184, "grad_norm": 0.12107925117015839, "learning_rate": 0.00016832728472451338, "loss": 0.11672050952911377, "step": 1150 }, { "epoch": 0.1856, "grad_norm": 0.10743635892868042, "learning_rate": 0.0001679973606070604, "loss": 0.11454172134399414, "step": 1160 }, { "epoch": 0.1872, "grad_norm": 0.0912097841501236, "learning_rate": 0.00016766743648960738, "loss": 0.10987292528152466, "step": 1170 }, { "epoch": 0.1888, "grad_norm": 0.08923039585351944, "learning_rate": 0.0001673375123721544, "loss": 0.11110665798187255, "step": 1180 }, { "epoch": 0.1904, "grad_norm": 0.11190492659807205, "learning_rate": 0.00016700758825470143, "loss": 0.12069671154022217, "step": 1190 }, { "epoch": 0.192, "grad_norm": 0.09391149133443832, "learning_rate": 0.00016667766413724843, "loss": 0.10857542753219604, "step": 1200 }, { "epoch": 0.1936, "grad_norm": 0.09822124242782593, "learning_rate": 0.00016634774001979545, "loss": 0.11493276357650757, "step": 1210 }, { "epoch": 0.1952, "grad_norm": 0.08219283819198608, "learning_rate": 0.00016601781590234245, "loss": 0.10868325233459472, "step": 1220 }, { "epoch": 0.1968, "grad_norm": 0.1040310487151146, "learning_rate": 0.00016568789178488948, "loss": 0.10602080821990967, "step": 1230 }, { "epoch": 0.1984, "grad_norm": 0.0804198682308197, "learning_rate": 0.0001653579676674365, "loss": 0.10579434633255005, "step": 1240 }, { "epoch": 0.2, "grad_norm": 0.08008287101984024, "learning_rate": 0.0001650280435499835, "loss": 0.10420469045639039, "step": 1250 }, { "epoch": 0.2016, "grad_norm": 0.08706449717283249, "learning_rate": 0.00016469811943253053, "loss": 0.10426139831542969, "step": 1260 }, { "epoch": 0.2032, "grad_norm": 0.10690020024776459, "learning_rate": 0.00016436819531507756, "loss": 0.10465244054794312, "step": 1270 }, { "epoch": 0.2048, "grad_norm": 0.10291136056184769, "learning_rate": 0.00016403827119762456, "loss": 0.09800633192062377, "step": 1280 }, { "epoch": 0.2064, "grad_norm": 0.09384270757436752, "learning_rate": 0.00016370834708017158, "loss": 0.10762728452682495, "step": 1290 }, { "epoch": 0.208, "grad_norm": 0.09748148173093796, "learning_rate": 0.00016337842296271858, "loss": 0.10190448760986329, "step": 1300 }, { "epoch": 0.2096, "grad_norm": 0.08641976118087769, "learning_rate": 0.0001630484988452656, "loss": 0.10793905258178711, "step": 1310 }, { "epoch": 0.2112, "grad_norm": 0.08845674246549606, "learning_rate": 0.0001627185747278126, "loss": 0.1030082106590271, "step": 1320 }, { "epoch": 0.2128, "grad_norm": 0.08985752612352371, "learning_rate": 0.0001623886506103596, "loss": 0.10357458591461181, "step": 1330 }, { "epoch": 0.2144, "grad_norm": 0.11634411662817001, "learning_rate": 0.00016205872649290663, "loss": 0.10648585557937622, "step": 1340 }, { "epoch": 0.216, "grad_norm": 0.10860881209373474, "learning_rate": 0.00016172880237545366, "loss": 0.10430452823638917, "step": 1350 }, { "epoch": 0.2176, "grad_norm": 0.10317538678646088, "learning_rate": 0.00016139887825800066, "loss": 0.10179120302200317, "step": 1360 }, { "epoch": 0.2192, "grad_norm": 0.10053454339504242, "learning_rate": 0.00016106895414054768, "loss": 0.10597822666168213, "step": 1370 }, { "epoch": 0.2208, "grad_norm": 0.08927279710769653, "learning_rate": 0.00016073903002309468, "loss": 0.09684351682662964, "step": 1380 }, { "epoch": 0.2224, "grad_norm": 0.1257501095533371, "learning_rate": 0.0001604091059056417, "loss": 0.11261625289916992, "step": 1390 }, { "epoch": 0.224, "grad_norm": 0.1243852972984314, "learning_rate": 0.00016007918178818873, "loss": 0.10365232229232788, "step": 1400 }, { "epoch": 0.2256, "grad_norm": 0.10740727186203003, "learning_rate": 0.00015974925767073573, "loss": 0.10951308012008668, "step": 1410 }, { "epoch": 0.2272, "grad_norm": 0.09918347746133804, "learning_rate": 0.00015941933355328276, "loss": 0.0985394537448883, "step": 1420 }, { "epoch": 0.2288, "grad_norm": 0.08673065900802612, "learning_rate": 0.00015908940943582978, "loss": 0.09536778330802917, "step": 1430 }, { "epoch": 0.2304, "grad_norm": 0.08423957228660583, "learning_rate": 0.00015875948531837678, "loss": 0.10208734273910522, "step": 1440 }, { "epoch": 0.232, "grad_norm": 0.08404131233692169, "learning_rate": 0.0001584295612009238, "loss": 0.11047152280807496, "step": 1450 }, { "epoch": 0.2336, "grad_norm": 0.09844925999641418, "learning_rate": 0.0001580996370834708, "loss": 0.10863144397735595, "step": 1460 }, { "epoch": 0.2352, "grad_norm": 0.0969533696770668, "learning_rate": 0.0001577697129660178, "loss": 0.10357078313827514, "step": 1470 }, { "epoch": 0.2368, "grad_norm": 0.09240443259477615, "learning_rate": 0.00015743978884856483, "loss": 0.1025089144706726, "step": 1480 }, { "epoch": 0.2384, "grad_norm": 0.08052058517932892, "learning_rate": 0.00015710986473111183, "loss": 0.10557924509048462, "step": 1490 }, { "epoch": 0.24, "grad_norm": 0.08213961869478226, "learning_rate": 0.00015677994061365886, "loss": 0.10791049003601075, "step": 1500 } ], "logging_steps": 10, "max_steps": 6250, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.807714853021389e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }