{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.012572527769570711, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00012572527769570712, "grad_norm": 0.5962838530540466, "learning_rate": 4.75e-07, "loss": 3.0013919830322267, "step": 20 }, { "epoch": 0.00025145055539141424, "grad_norm": 0.6844280958175659, "learning_rate": 9.75e-07, "loss": 3.018001365661621, "step": 40 }, { "epoch": 0.0003771758330871213, "grad_norm": 0.4779929220676422, "learning_rate": 1.475e-06, "loss": 3.1058986663818358, "step": 60 }, { "epoch": 0.0005029011107828285, "grad_norm": 0.555294930934906, "learning_rate": 1.975e-06, "loss": 2.909657287597656, "step": 80 }, { "epoch": 0.0006286263884785355, "grad_norm": 0.5354552865028381, "learning_rate": 2.4750000000000004e-06, "loss": 2.8872909545898438, "step": 100 }, { "epoch": 0.0007543516661742426, "grad_norm": 0.5644583702087402, "learning_rate": 2.975e-06, "loss": 2.859341621398926, "step": 120 }, { "epoch": 0.0008800769438699498, "grad_norm": 0.630761981010437, "learning_rate": 3.4750000000000006e-06, "loss": 2.933867835998535, "step": 140 }, { "epoch": 0.001005802221565657, "grad_norm": 0.764999508857727, "learning_rate": 3.975e-06, "loss": 2.782645606994629, "step": 160 }, { "epoch": 0.001131527499261364, "grad_norm": 1.0221054553985596, "learning_rate": 4.475e-06, "loss": 2.8541688919067383, "step": 180 }, { "epoch": 0.001257252776957071, "grad_norm": 0.8221330046653748, "learning_rate": 4.975000000000001e-06, "loss": 2.6588584899902346, "step": 200 }, { "epoch": 0.0013829780546527782, "grad_norm": 0.873559832572937, "learning_rate": 5.475e-06, "loss": 2.549220848083496, "step": 220 }, { "epoch": 0.0015087033323484852, "grad_norm": 0.813358724117279, "learning_rate": 5.975e-06, "loss": 2.5854366302490233, "step": 240 }, { "epoch": 0.0016344286100441925, "grad_norm": 0.856169581413269, "learning_rate": 6.475000000000001e-06, "loss": 2.5309289932250976, "step": 260 }, { "epoch": 0.0017601538877398996, "grad_norm": 0.951108455657959, "learning_rate": 6.975000000000001e-06, "loss": 2.4736785888671875, "step": 280 }, { "epoch": 0.0018858791654356066, "grad_norm": 0.8016313910484314, "learning_rate": 7.4750000000000004e-06, "loss": 2.2943771362304686, "step": 300 }, { "epoch": 0.002011604443131314, "grad_norm": 0.915063202381134, "learning_rate": 7.975e-06, "loss": 2.3273014068603515, "step": 320 }, { "epoch": 0.0021373297208270208, "grad_norm": 0.720587968826294, "learning_rate": 8.475000000000001e-06, "loss": 2.350560760498047, "step": 340 }, { "epoch": 0.002263054998522728, "grad_norm": 0.711700439453125, "learning_rate": 8.975e-06, "loss": 2.3248199462890624, "step": 360 }, { "epoch": 0.002388780276218435, "grad_norm": 0.8843226432800293, "learning_rate": 9.475e-06, "loss": 2.335201454162598, "step": 380 }, { "epoch": 0.002514505553914142, "grad_norm": 0.4873352348804474, "learning_rate": 9.975e-06, "loss": 2.424860382080078, "step": 400 }, { "epoch": 0.0026402308316098495, "grad_norm": 0.6487540602684021, "learning_rate": 1.0475e-05, "loss": 2.2071765899658202, "step": 420 }, { "epoch": 0.0027659561093055563, "grad_norm": 0.6322605013847351, "learning_rate": 1.0975e-05, "loss": 2.2878080368041993, "step": 440 }, { "epoch": 0.0028916813870012636, "grad_norm": 0.5939791798591614, "learning_rate": 1.1475000000000001e-05, "loss": 2.3425870895385743, "step": 460 }, { "epoch": 0.0030174066646969705, "grad_norm": 0.6943904161453247, "learning_rate": 1.1975e-05, "loss": 2.2085947036743163, "step": 480 }, { "epoch": 0.0031431319423926777, "grad_norm": 0.7218244075775146, "learning_rate": 1.2475e-05, "loss": 2.2360507965087892, "step": 500 }, { "epoch": 0.003268857220088385, "grad_norm": 0.8252770900726318, "learning_rate": 1.2975e-05, "loss": 2.3641361236572265, "step": 520 }, { "epoch": 0.003394582497784092, "grad_norm": 0.5744673013687134, "learning_rate": 1.3475000000000002e-05, "loss": 2.236039924621582, "step": 540 }, { "epoch": 0.003520307775479799, "grad_norm": 0.6768812537193298, "learning_rate": 1.3975000000000003e-05, "loss": 2.2313003540039062, "step": 560 }, { "epoch": 0.003646033053175506, "grad_norm": 0.6503052711486816, "learning_rate": 1.4475e-05, "loss": 2.2801786422729493, "step": 580 }, { "epoch": 0.0037717583308712133, "grad_norm": 0.629787266254425, "learning_rate": 1.4975e-05, "loss": 2.346693420410156, "step": 600 }, { "epoch": 0.0038974836085669206, "grad_norm": 0.6764146089553833, "learning_rate": 1.5475e-05, "loss": 2.093250274658203, "step": 620 }, { "epoch": 0.004023208886262628, "grad_norm": 0.7266194224357605, "learning_rate": 1.5975000000000002e-05, "loss": 2.242112922668457, "step": 640 }, { "epoch": 0.004148934163958335, "grad_norm": 0.5509718656539917, "learning_rate": 1.6475e-05, "loss": 2.2910560607910155, "step": 660 }, { "epoch": 0.0042746594416540416, "grad_norm": 0.7285779714584351, "learning_rate": 1.6975000000000003e-05, "loss": 2.480996322631836, "step": 680 }, { "epoch": 0.004400384719349749, "grad_norm": 0.5729554295539856, "learning_rate": 1.7475e-05, "loss": 2.1267959594726564, "step": 700 }, { "epoch": 0.004526109997045456, "grad_norm": 0.6237987279891968, "learning_rate": 1.7975e-05, "loss": 2.3381301879882814, "step": 720 }, { "epoch": 0.004651835274741163, "grad_norm": 0.6548975110054016, "learning_rate": 1.8475000000000002e-05, "loss": 2.1999746322631837, "step": 740 }, { "epoch": 0.00477756055243687, "grad_norm": 0.614876389503479, "learning_rate": 1.8975e-05, "loss": 2.3489891052246095, "step": 760 }, { "epoch": 0.0049032858301325775, "grad_norm": 0.6543737053871155, "learning_rate": 1.9475000000000002e-05, "loss": 2.261593055725098, "step": 780 }, { "epoch": 0.005029011107828284, "grad_norm": 0.6650403141975403, "learning_rate": 1.9975e-05, "loss": 2.307338523864746, "step": 800 }, { "epoch": 0.005154736385523991, "grad_norm": 0.691130518913269, "learning_rate": 2.0475e-05, "loss": 2.2411531448364257, "step": 820 }, { "epoch": 0.005280461663219699, "grad_norm": 0.6249509453773499, "learning_rate": 2.0975e-05, "loss": 2.437354850769043, "step": 840 }, { "epoch": 0.005406186940915406, "grad_norm": 0.7308785319328308, "learning_rate": 2.1475e-05, "loss": 2.16713924407959, "step": 860 }, { "epoch": 0.005531912218611113, "grad_norm": 0.7222583889961243, "learning_rate": 2.1975000000000002e-05, "loss": 2.2146921157836914, "step": 880 }, { "epoch": 0.00565763749630682, "grad_norm": 0.8205286264419556, "learning_rate": 2.2475e-05, "loss": 2.1331754684448243, "step": 900 }, { "epoch": 0.005783362774002527, "grad_norm": 0.8732596635818481, "learning_rate": 2.2975000000000003e-05, "loss": 2.3930585861206053, "step": 920 }, { "epoch": 0.005909088051698234, "grad_norm": 0.8867924213409424, "learning_rate": 2.3475e-05, "loss": 2.325008773803711, "step": 940 }, { "epoch": 0.006034813329393941, "grad_norm": 0.6259322762489319, "learning_rate": 2.3975e-05, "loss": 2.1665245056152345, "step": 960 }, { "epoch": 0.006160538607089649, "grad_norm": 0.7788486480712891, "learning_rate": 2.4475000000000002e-05, "loss": 2.0807886123657227, "step": 980 }, { "epoch": 0.0062862638847853555, "grad_norm": 0.7346381545066833, "learning_rate": 2.4975e-05, "loss": 2.2518342971801757, "step": 1000 }, { "epoch": 0.006411989162481062, "grad_norm": 0.6551724672317505, "learning_rate": 2.5475e-05, "loss": 2.2025928497314453, "step": 1020 }, { "epoch": 0.00653771444017677, "grad_norm": 0.42648759484291077, "learning_rate": 2.5974999999999998e-05, "loss": 2.2169179916381836, "step": 1040 }, { "epoch": 0.006663439717872477, "grad_norm": 0.6696974039077759, "learning_rate": 2.6475e-05, "loss": 2.2179336547851562, "step": 1060 }, { "epoch": 0.006789164995568184, "grad_norm": 0.6720432043075562, "learning_rate": 2.6975000000000002e-05, "loss": 2.1793497085571287, "step": 1080 }, { "epoch": 0.0069148902732638915, "grad_norm": 0.7858997583389282, "learning_rate": 2.7475e-05, "loss": 2.2960178375244142, "step": 1100 }, { "epoch": 0.007040615550959598, "grad_norm": 0.6754783987998962, "learning_rate": 2.7975000000000002e-05, "loss": 2.193424415588379, "step": 1120 }, { "epoch": 0.007166340828655305, "grad_norm": 0.8978444933891296, "learning_rate": 2.8475e-05, "loss": 2.245846748352051, "step": 1140 }, { "epoch": 0.007292066106351012, "grad_norm": 0.6270891427993774, "learning_rate": 2.8975000000000003e-05, "loss": 2.222321891784668, "step": 1160 }, { "epoch": 0.00741779138404672, "grad_norm": 0.8105082511901855, "learning_rate": 2.9475e-05, "loss": 2.2370512008666994, "step": 1180 }, { "epoch": 0.007543516661742427, "grad_norm": 0.8254700303077698, "learning_rate": 2.9975000000000004e-05, "loss": 2.2856861114501954, "step": 1200 }, { "epoch": 0.0076692419394381334, "grad_norm": 0.7499117851257324, "learning_rate": 3.0475000000000002e-05, "loss": 2.145079803466797, "step": 1220 }, { "epoch": 0.007794967217133841, "grad_norm": 0.5796831846237183, "learning_rate": 3.0975e-05, "loss": 2.2193859100341795, "step": 1240 }, { "epoch": 0.007920692494829547, "grad_norm": 0.7580195069313049, "learning_rate": 3.1475e-05, "loss": 2.325836181640625, "step": 1260 }, { "epoch": 0.008046417772525256, "grad_norm": 0.7444676756858826, "learning_rate": 3.1975e-05, "loss": 2.176131820678711, "step": 1280 }, { "epoch": 0.008172143050220963, "grad_norm": 0.9642544984817505, "learning_rate": 3.2474999999999997e-05, "loss": 2.139938735961914, "step": 1300 }, { "epoch": 0.00829786832791667, "grad_norm": 0.8218713998794556, "learning_rate": 3.2975e-05, "loss": 2.2411163330078123, "step": 1320 }, { "epoch": 0.008423593605612376, "grad_norm": 1.0058637857437134, "learning_rate": 3.3475e-05, "loss": 2.2701160430908205, "step": 1340 }, { "epoch": 0.008549318883308083, "grad_norm": 0.9082450270652771, "learning_rate": 3.3975e-05, "loss": 2.223080635070801, "step": 1360 }, { "epoch": 0.00867504416100379, "grad_norm": 1.5511119365692139, "learning_rate": 3.4475000000000005e-05, "loss": 2.2058855056762696, "step": 1380 }, { "epoch": 0.008800769438699499, "grad_norm": 0.9214478731155396, "learning_rate": 3.4975e-05, "loss": 2.275226593017578, "step": 1400 }, { "epoch": 0.008926494716395205, "grad_norm": 0.7495436668395996, "learning_rate": 3.5475e-05, "loss": 2.0992334365844725, "step": 1420 }, { "epoch": 0.009052219994090912, "grad_norm": 0.7678313851356506, "learning_rate": 3.5975e-05, "loss": 2.151212692260742, "step": 1440 }, { "epoch": 0.009177945271786619, "grad_norm": 0.8514085412025452, "learning_rate": 3.6475000000000006e-05, "loss": 2.3009883880615236, "step": 1460 }, { "epoch": 0.009303670549482326, "grad_norm": 0.7245936393737793, "learning_rate": 3.6975000000000004e-05, "loss": 2.2095823287963867, "step": 1480 }, { "epoch": 0.009429395827178033, "grad_norm": 0.576258659362793, "learning_rate": 3.7475e-05, "loss": 2.2135459899902346, "step": 1500 }, { "epoch": 0.00955512110487374, "grad_norm": 0.7789803147315979, "learning_rate": 3.7975e-05, "loss": 2.172737884521484, "step": 1520 }, { "epoch": 0.009680846382569448, "grad_norm": 0.6502222418785095, "learning_rate": 3.8475e-05, "loss": 2.202811622619629, "step": 1540 }, { "epoch": 0.009806571660265155, "grad_norm": 0.7619134783744812, "learning_rate": 3.8975e-05, "loss": 2.120333671569824, "step": 1560 }, { "epoch": 0.009932296937960862, "grad_norm": 0.624914824962616, "learning_rate": 3.9475000000000004e-05, "loss": 2.133666229248047, "step": 1580 }, { "epoch": 0.010058022215656569, "grad_norm": 0.8268408179283142, "learning_rate": 3.9975e-05, "loss": 2.2280460357666017, "step": 1600 }, { "epoch": 0.010183747493352276, "grad_norm": 1.2030913829803467, "learning_rate": 4.0475e-05, "loss": 2.2895408630371095, "step": 1620 }, { "epoch": 0.010309472771047982, "grad_norm": 0.5576544404029846, "learning_rate": 4.0975e-05, "loss": 2.143132781982422, "step": 1640 }, { "epoch": 0.01043519804874369, "grad_norm": 0.6146367192268372, "learning_rate": 4.1475000000000005e-05, "loss": 2.0781791687011717, "step": 1660 }, { "epoch": 0.010560923326439398, "grad_norm": 0.637881875038147, "learning_rate": 4.1975000000000004e-05, "loss": 2.269753265380859, "step": 1680 }, { "epoch": 0.010686648604135105, "grad_norm": 1.2377184629440308, "learning_rate": 4.2475e-05, "loss": 2.3090824127197265, "step": 1700 }, { "epoch": 0.010812373881830812, "grad_norm": 1.0414743423461914, "learning_rate": 4.2975e-05, "loss": 2.2602685928344726, "step": 1720 }, { "epoch": 0.010938099159526518, "grad_norm": 0.7796839475631714, "learning_rate": 4.3475000000000006e-05, "loss": 2.3865522384643554, "step": 1740 }, { "epoch": 0.011063824437222225, "grad_norm": 0.7342143654823303, "learning_rate": 4.3975e-05, "loss": 2.3370746612548827, "step": 1760 }, { "epoch": 0.011189549714917932, "grad_norm": 0.6339659094810486, "learning_rate": 4.4475e-05, "loss": 2.2576133728027346, "step": 1780 }, { "epoch": 0.01131527499261364, "grad_norm": 0.6305493116378784, "learning_rate": 4.4975e-05, "loss": 2.146904945373535, "step": 1800 }, { "epoch": 0.011441000270309348, "grad_norm": 0.7393673658370972, "learning_rate": 4.5475e-05, "loss": 2.207014465332031, "step": 1820 }, { "epoch": 0.011566725548005054, "grad_norm": 0.5975062847137451, "learning_rate": 4.5975e-05, "loss": 2.2376119613647463, "step": 1840 }, { "epoch": 0.011692450825700761, "grad_norm": 0.8439088463783264, "learning_rate": 4.6475000000000005e-05, "loss": 2.172005844116211, "step": 1860 }, { "epoch": 0.011818176103396468, "grad_norm": 0.9270113110542297, "learning_rate": 4.6975000000000003e-05, "loss": 2.373341369628906, "step": 1880 }, { "epoch": 0.011943901381092175, "grad_norm": 0.8112410306930542, "learning_rate": 4.7475e-05, "loss": 2.2132829666137694, "step": 1900 }, { "epoch": 0.012069626658787882, "grad_norm": 0.7576470971107483, "learning_rate": 4.7975e-05, "loss": 2.1676565170288087, "step": 1920 }, { "epoch": 0.01219535193648359, "grad_norm": 0.6396933794021606, "learning_rate": 4.8475000000000006e-05, "loss": 2.1356874465942384, "step": 1940 }, { "epoch": 0.012321077214179297, "grad_norm": 0.9815897941589355, "learning_rate": 4.8975000000000005e-05, "loss": 2.153605651855469, "step": 1960 }, { "epoch": 0.012446802491875004, "grad_norm": 1.0716313123703003, "learning_rate": 4.9475e-05, "loss": 2.237149238586426, "step": 1980 }, { "epoch": 0.012572527769570711, "grad_norm": 0.7417507171630859, "learning_rate": 4.9975e-05, "loss": 2.3103559494018553, "step": 2000 } ], "logging_steps": 20, "max_steps": 160000, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.2369016881496474e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }