{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.16, "eval_steps": 250, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0016, "grad_norm": NaN, "learning_rate": 9.574468085106383e-06, "loss": 0.6083179950714112, "step": 10 }, { "epoch": 0.0032, "grad_norm": 0.2735198438167572, "learning_rate": 1.9148936170212766e-05, "loss": 0.6088993072509765, "step": 20 }, { "epoch": 0.0048, "grad_norm": 0.15276113152503967, "learning_rate": 2.9787234042553192e-05, "loss": 0.5225989818572998, "step": 30 }, { "epoch": 0.0064, "grad_norm": 0.17109858989715576, "learning_rate": 4.0425531914893614e-05, "loss": 0.4329381942749023, "step": 40 }, { "epoch": 0.008, "grad_norm": 0.17585736513137817, "learning_rate": 5.1063829787234044e-05, "loss": 0.35364015102386476, "step": 50 }, { "epoch": 0.0096, "grad_norm": 0.16095905005931854, "learning_rate": 6.170212765957447e-05, "loss": 0.26982028484344484, "step": 60 }, { "epoch": 0.0112, "grad_norm": 0.11053046584129333, "learning_rate": 7.23404255319149e-05, "loss": 0.20504410266876222, "step": 70 }, { "epoch": 0.0128, "grad_norm": 0.12669840455055237, "learning_rate": 8.297872340425533e-05, "loss": 0.19483240842819213, "step": 80 }, { "epoch": 0.0144, "grad_norm": 0.11641468852758408, "learning_rate": 9.361702127659576e-05, "loss": 0.17770581245422362, "step": 90 }, { "epoch": 0.016, "grad_norm": 0.14681392908096313, "learning_rate": 0.00010425531914893618, "loss": 0.15753360986709594, "step": 100 }, { "epoch": 0.0176, "grad_norm": 0.09883147478103638, "learning_rate": 0.00011489361702127661, "loss": 0.16169432401657105, "step": 110 }, { "epoch": 0.0192, "grad_norm": 0.1138603463768959, "learning_rate": 0.00012553191489361702, "loss": 0.16089822053909303, "step": 120 }, { "epoch": 0.0208, "grad_norm": 0.13063949346542358, "learning_rate": 0.00013617021276595746, "loss": 0.1603950023651123, "step": 130 }, { "epoch": 0.0224, "grad_norm": 0.06824357807636261, "learning_rate": 0.00014680851063829788, "loss": 0.14956578016281127, "step": 140 }, { "epoch": 0.024, "grad_norm": 0.12136659771203995, "learning_rate": 0.00015744680851063832, "loss": 0.1617922306060791, "step": 150 }, { "epoch": 0.0256, "grad_norm": 0.10032546520233154, "learning_rate": 0.00016808510638297873, "loss": 0.1547396659851074, "step": 160 }, { "epoch": 0.0272, "grad_norm": 0.07678422331809998, "learning_rate": 0.00017872340425531915, "loss": 0.14475579261779786, "step": 170 }, { "epoch": 0.0288, "grad_norm": 0.10933304578065872, "learning_rate": 0.00018936170212765957, "loss": 0.1330868124961853, "step": 180 }, { "epoch": 0.0304, "grad_norm": 0.12041473388671875, "learning_rate": 0.0002, "loss": 0.14836544990539552, "step": 190 }, { "epoch": 0.032, "grad_norm": 0.0896446481347084, "learning_rate": 0.00019967007588254704, "loss": 0.14405652284622192, "step": 200 }, { "epoch": 0.0336, "grad_norm": 0.0876811295747757, "learning_rate": 0.00019934015176509403, "loss": 0.14646297693252563, "step": 210 }, { "epoch": 0.0352, "grad_norm": 0.09327778220176697, "learning_rate": 0.00019901022764764106, "loss": 0.14419257640838623, "step": 220 }, { "epoch": 0.0368, "grad_norm": 0.08388442546129227, "learning_rate": 0.00019868030353018806, "loss": 0.15150091648101807, "step": 230 }, { "epoch": 0.0384, "grad_norm": 0.09979762881994247, "learning_rate": 0.00019835037941273509, "loss": 0.14006744623184203, "step": 240 }, { "epoch": 0.04, "grad_norm": 0.0845855325460434, "learning_rate": 0.0001980204552952821, "loss": 0.15045372247695923, "step": 250 }, { "epoch": 0.0416, "grad_norm": 0.09481288492679596, "learning_rate": 0.0001976905311778291, "loss": 0.15042688846588134, "step": 260 }, { "epoch": 0.0432, "grad_norm": 0.10349375009536743, "learning_rate": 0.0001973606070603761, "loss": 0.13992291688919067, "step": 270 }, { "epoch": 0.0448, "grad_norm": 0.07897678017616272, "learning_rate": 0.00019703068294292314, "loss": 0.13927781581878662, "step": 280 }, { "epoch": 0.0464, "grad_norm": 0.08341789990663528, "learning_rate": 0.00019670075882547014, "loss": 0.14076149463653564, "step": 290 }, { "epoch": 0.048, "grad_norm": 0.10565593093633652, "learning_rate": 0.00019637083470801716, "loss": 0.14325612783432007, "step": 300 }, { "epoch": 0.0496, "grad_norm": 0.07861499488353729, "learning_rate": 0.0001960409105905642, "loss": 0.1343199133872986, "step": 310 }, { "epoch": 0.0512, "grad_norm": 0.09252545982599258, "learning_rate": 0.0001957109864731112, "loss": 0.12891001701354982, "step": 320 }, { "epoch": 0.0528, "grad_norm": 0.08716761320829391, "learning_rate": 0.0001953810623556582, "loss": 0.1449826717376709, "step": 330 }, { "epoch": 0.0544, "grad_norm": 0.07750111818313599, "learning_rate": 0.0001950511382382052, "loss": 0.1274427056312561, "step": 340 }, { "epoch": 0.056, "grad_norm": 0.07396410405635834, "learning_rate": 0.00019472121412075224, "loss": 0.12241615056991577, "step": 350 }, { "epoch": 0.0576, "grad_norm": 0.07157568633556366, "learning_rate": 0.00019439129000329926, "loss": 0.14313431978225707, "step": 360 }, { "epoch": 0.0592, "grad_norm": 0.08780192583799362, "learning_rate": 0.00019406136588584626, "loss": 0.13534088134765626, "step": 370 }, { "epoch": 0.0608, "grad_norm": 0.09394513815641403, "learning_rate": 0.0001937314417683933, "loss": 0.1249586820602417, "step": 380 }, { "epoch": 0.0624, "grad_norm": 0.0853569507598877, "learning_rate": 0.0001934015176509403, "loss": 0.13353261947631836, "step": 390 }, { "epoch": 0.064, "grad_norm": 0.08356380462646484, "learning_rate": 0.00019307159353348731, "loss": 0.12304072380065918, "step": 400 }, { "epoch": 0.0656, "grad_norm": 0.08608467876911163, "learning_rate": 0.00019274166941603434, "loss": 0.13379846811294555, "step": 410 }, { "epoch": 0.0672, "grad_norm": 0.07890665531158447, "learning_rate": 0.0001924117452985813, "loss": 0.11951367855072022, "step": 420 }, { "epoch": 0.0688, "grad_norm": 0.08108149468898773, "learning_rate": 0.00019208182118112834, "loss": 0.12902278900146485, "step": 430 }, { "epoch": 0.0704, "grad_norm": 0.09603618830442429, "learning_rate": 0.00019175189706367536, "loss": 0.12690144777297974, "step": 440 }, { "epoch": 0.072, "grad_norm": 0.09471320360898972, "learning_rate": 0.00019142197294622236, "loss": 0.13802603483200074, "step": 450 }, { "epoch": 0.0736, "grad_norm": 0.08374392986297607, "learning_rate": 0.0001910920488287694, "loss": 0.12328752279281616, "step": 460 }, { "epoch": 0.0752, "grad_norm": 0.08944465219974518, "learning_rate": 0.00019076212471131642, "loss": 0.12756569385528566, "step": 470 }, { "epoch": 0.0768, "grad_norm": 0.0898577868938446, "learning_rate": 0.00019043220059386341, "loss": 0.13218681812286376, "step": 480 }, { "epoch": 0.0784, "grad_norm": 0.07767961174249649, "learning_rate": 0.00019010227647641044, "loss": 0.135015869140625, "step": 490 }, { "epoch": 0.08, "grad_norm": 0.0865555852651596, "learning_rate": 0.00018977235235895744, "loss": 0.128175950050354, "step": 500 }, { "epoch": 0.0816, "grad_norm": 0.07919178158044815, "learning_rate": 0.00018944242824150447, "loss": 0.12430660724639893, "step": 510 }, { "epoch": 0.0832, "grad_norm": 0.08649525046348572, "learning_rate": 0.0001891125041240515, "loss": 0.12590073347091674, "step": 520 }, { "epoch": 0.0848, "grad_norm": 0.08704695850610733, "learning_rate": 0.0001887825800065985, "loss": 0.12156925201416016, "step": 530 }, { "epoch": 0.0864, "grad_norm": 0.06752946227788925, "learning_rate": 0.00018845265588914552, "loss": 0.12604955434799195, "step": 540 }, { "epoch": 0.088, "grad_norm": 0.09034618735313416, "learning_rate": 0.00018812273177169252, "loss": 0.13052459955215454, "step": 550 }, { "epoch": 0.0896, "grad_norm": 0.0869947075843811, "learning_rate": 0.00018779280765423954, "loss": 0.12303999662399293, "step": 560 }, { "epoch": 0.0912, "grad_norm": 0.0702558308839798, "learning_rate": 0.00018746288353678654, "loss": 0.12230894565582276, "step": 570 }, { "epoch": 0.0928, "grad_norm": 0.08718933910131454, "learning_rate": 0.00018713295941933354, "loss": 0.1285646677017212, "step": 580 }, { "epoch": 0.0944, "grad_norm": 0.07396125048398972, "learning_rate": 0.00018680303530188057, "loss": 0.1259121775627136, "step": 590 }, { "epoch": 0.096, "grad_norm": 0.10813502222299576, "learning_rate": 0.0001864731111844276, "loss": 0.12581136226654052, "step": 600 }, { "epoch": 0.0976, "grad_norm": 0.07332257181406021, "learning_rate": 0.0001861431870669746, "loss": 0.120159912109375, "step": 610 }, { "epoch": 0.0992, "grad_norm": 0.08529425412416458, "learning_rate": 0.00018581326294952162, "loss": 0.1297559142112732, "step": 620 }, { "epoch": 0.1008, "grad_norm": 0.09605136513710022, "learning_rate": 0.00018548333883206864, "loss": 0.12067115306854248, "step": 630 }, { "epoch": 0.1024, "grad_norm": 0.08586304634809494, "learning_rate": 0.00018515341471461564, "loss": 0.12730380296707153, "step": 640 }, { "epoch": 0.104, "grad_norm": 0.06986010074615479, "learning_rate": 0.00018482349059716267, "loss": 0.12864140272140503, "step": 650 }, { "epoch": 0.1056, "grad_norm": 0.08565957844257355, "learning_rate": 0.00018449356647970967, "loss": 0.13535914421081544, "step": 660 }, { "epoch": 0.1072, "grad_norm": 0.07841351628303528, "learning_rate": 0.0001841636423622567, "loss": 0.12447234392166137, "step": 670 }, { "epoch": 0.1088, "grad_norm": 0.07424665987491608, "learning_rate": 0.00018383371824480372, "loss": 0.12037907838821411, "step": 680 }, { "epoch": 0.1104, "grad_norm": 0.0957612544298172, "learning_rate": 0.00018350379412735072, "loss": 0.11919810771942138, "step": 690 }, { "epoch": 0.112, "grad_norm": 0.07862170785665512, "learning_rate": 0.00018317387000989775, "loss": 0.12414863109588622, "step": 700 }, { "epoch": 0.1136, "grad_norm": 0.12410055845975876, "learning_rate": 0.00018284394589244474, "loss": 0.12083030939102173, "step": 710 }, { "epoch": 0.1152, "grad_norm": 0.07692275941371918, "learning_rate": 0.00018251402177499174, "loss": 0.11559462547302246, "step": 720 }, { "epoch": 0.1168, "grad_norm": 0.07810766994953156, "learning_rate": 0.00018218409765753877, "loss": 0.12092136144638062, "step": 730 }, { "epoch": 0.1184, "grad_norm": 0.08475863188505173, "learning_rate": 0.00018185417354008577, "loss": 0.12225215435028076, "step": 740 }, { "epoch": 0.12, "grad_norm": 0.09497244656085968, "learning_rate": 0.0001815242494226328, "loss": 0.12478446960449219, "step": 750 }, { "epoch": 0.1216, "grad_norm": 0.07779653370380402, "learning_rate": 0.00018119432530517982, "loss": 0.11081166267395019, "step": 760 }, { "epoch": 0.1232, "grad_norm": 0.08435814827680588, "learning_rate": 0.00018086440118772682, "loss": 0.10844987630844116, "step": 770 }, { "epoch": 0.1248, "grad_norm": 0.07567104697227478, "learning_rate": 0.00018053447707027385, "loss": 0.11887184381484986, "step": 780 }, { "epoch": 0.1264, "grad_norm": 0.07750700414180756, "learning_rate": 0.00018020455295282087, "loss": 0.11811846494674683, "step": 790 }, { "epoch": 0.128, "grad_norm": 0.09390198439359665, "learning_rate": 0.00017987462883536787, "loss": 0.11379201412200927, "step": 800 }, { "epoch": 0.1296, "grad_norm": 0.08400580286979675, "learning_rate": 0.0001795447047179149, "loss": 0.11909257173538208, "step": 810 }, { "epoch": 0.1312, "grad_norm": 0.09543855488300323, "learning_rate": 0.0001792147806004619, "loss": 0.10916774272918701, "step": 820 }, { "epoch": 0.1328, "grad_norm": 0.07908441871404648, "learning_rate": 0.00017888485648300892, "loss": 0.107346510887146, "step": 830 }, { "epoch": 0.1344, "grad_norm": 0.1085224449634552, "learning_rate": 0.00017855493236555595, "loss": 0.12227011919021606, "step": 840 }, { "epoch": 0.136, "grad_norm": 0.07472517341375351, "learning_rate": 0.00017822500824810295, "loss": 0.11575174331665039, "step": 850 }, { "epoch": 0.1376, "grad_norm": 0.07198534905910492, "learning_rate": 0.00017789508413064997, "loss": 0.12281327247619629, "step": 860 }, { "epoch": 0.1392, "grad_norm": 0.09142109006643295, "learning_rate": 0.00017756516001319697, "loss": 0.11497378349304199, "step": 870 }, { "epoch": 0.1408, "grad_norm": 0.09548252075910568, "learning_rate": 0.00017723523589574397, "loss": 0.11615512371063233, "step": 880 }, { "epoch": 0.1424, "grad_norm": 0.06250233203172684, "learning_rate": 0.000176905311778291, "loss": 0.11593252420425415, "step": 890 }, { "epoch": 0.144, "grad_norm": 0.08740886300802231, "learning_rate": 0.000176575387660838, "loss": 0.11546707153320312, "step": 900 }, { "epoch": 0.1456, "grad_norm": 0.11061470210552216, "learning_rate": 0.00017624546354338502, "loss": 0.12130849361419678, "step": 910 }, { "epoch": 0.1472, "grad_norm": 0.07824647426605225, "learning_rate": 0.00017591553942593205, "loss": 0.1188379168510437, "step": 920 }, { "epoch": 0.1488, "grad_norm": 0.08214984834194183, "learning_rate": 0.00017558561530847905, "loss": 0.11806504726409912, "step": 930 }, { "epoch": 0.1504, "grad_norm": 0.09313149005174637, "learning_rate": 0.00017525569119102607, "loss": 0.11112408638000489, "step": 940 }, { "epoch": 0.152, "grad_norm": 0.08523363620042801, "learning_rate": 0.0001749257670735731, "loss": 0.1136185884475708, "step": 950 }, { "epoch": 0.1536, "grad_norm": 0.06718438863754272, "learning_rate": 0.0001745958429561201, "loss": 0.1142117738723755, "step": 960 }, { "epoch": 0.1552, "grad_norm": 0.08877789974212646, "learning_rate": 0.00017426591883866713, "loss": 0.11236680746078491, "step": 970 }, { "epoch": 0.1568, "grad_norm": 0.07814772427082062, "learning_rate": 0.00017393599472121412, "loss": 0.10925638675689697, "step": 980 }, { "epoch": 0.1584, "grad_norm": 0.08659686148166656, "learning_rate": 0.00017360607060376115, "loss": 0.11623308658599854, "step": 990 }, { "epoch": 0.16, "grad_norm": 0.08823436498641968, "learning_rate": 0.00017327614648630818, "loss": 0.11374906301498414, "step": 1000 } ], "logging_steps": 10, "max_steps": 6250, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.8688917455755264e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }