{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 13.157981349424027, "eval_steps": 3000, "global_step": 12000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.10970927043335162, "grad_norm": 0.468578577041626, "learning_rate": 5.4276315789473686e-06, "loss": 0.5462883758544922, "step": 100 }, { "epoch": 0.21941854086670323, "grad_norm": 0.45979681611061096, "learning_rate": 1.0910087719298246e-05, "loss": 0.2727891731262207, "step": 200 }, { "epoch": 0.32912781130005486, "grad_norm": 0.6285035610198975, "learning_rate": 1.6392543859649124e-05, "loss": 0.20325206756591796, "step": 300 }, { "epoch": 0.43883708173340646, "grad_norm": 0.49440646171569824, "learning_rate": 2.1875e-05, "loss": 0.17335186004638672, "step": 400 }, { "epoch": 0.5485463521667581, "grad_norm": 0.3639424443244934, "learning_rate": 2.735745614035088e-05, "loss": 0.1450818157196045, "step": 500 }, { "epoch": 0.6582556226001097, "grad_norm": 0.8926243782043457, "learning_rate": 3.2839912280701755e-05, "loss": 0.129285945892334, "step": 600 }, { "epoch": 0.7679648930334614, "grad_norm": 0.6681469082832336, "learning_rate": 3.8322368421052634e-05, "loss": 0.10414340019226075, "step": 700 }, { "epoch": 0.8776741634668129, "grad_norm": 0.470255583524704, "learning_rate": 4.3804824561403514e-05, "loss": 0.0889210319519043, "step": 800 }, { "epoch": 0.9873834339001646, "grad_norm": 0.6484633684158325, "learning_rate": 4.928728070175439e-05, "loss": 0.08110878944396972, "step": 900 }, { "epoch": 1.0965441579813495, "grad_norm": 0.42188429832458496, "learning_rate": 5.4769736842105266e-05, "loss": 0.0681976318359375, "step": 1000 }, { "epoch": 1.206253428414701, "grad_norm": 0.38744252920150757, "learning_rate": 6.0252192982456145e-05, "loss": 0.059779272079467774, "step": 1100 }, { "epoch": 1.3159626988480526, "grad_norm": 0.634701669216156, "learning_rate": 6.573464912280702e-05, "loss": 0.05309516906738281, "step": 1200 }, { "epoch": 1.4256719692814044, "grad_norm": 0.3459165692329407, "learning_rate": 7.12171052631579e-05, "loss": 0.04944893360137939, "step": 1300 }, { "epoch": 1.535381239714756, "grad_norm": 0.6033017635345459, "learning_rate": 7.669956140350878e-05, "loss": 0.04666784286499023, "step": 1400 }, { "epoch": 1.6450905101481075, "grad_norm": 0.6594127416610718, "learning_rate": 8.218201754385966e-05, "loss": 0.04396382808685303, "step": 1500 }, { "epoch": 1.7547997805814592, "grad_norm": 0.1653222292661667, "learning_rate": 8.766447368421054e-05, "loss": 0.041247625350952145, "step": 1600 }, { "epoch": 1.8645090510148108, "grad_norm": 0.3759867548942566, "learning_rate": 9.314692982456141e-05, "loss": 0.03404149293899536, "step": 1700 }, { "epoch": 1.9742183214481623, "grad_norm": 0.23973219096660614, "learning_rate": 9.862938596491229e-05, "loss": 0.03183579921722412, "step": 1800 }, { "epoch": 2.0833790455293473, "grad_norm": 0.325320303440094, "learning_rate": 9.999484984691653e-05, "loss": 0.03078770637512207, "step": 1900 }, { "epoch": 2.193088315962699, "grad_norm": 0.16789975762367249, "learning_rate": 9.9971962417026e-05, "loss": 0.027160501480102538, "step": 2000 }, { "epoch": 2.3027975863960504, "grad_norm": 0.39737239480018616, "learning_rate": 9.993077384438713e-05, "loss": 0.024041428565979003, "step": 2100 }, { "epoch": 2.412506856829402, "grad_norm": 0.36602410674095154, "learning_rate": 9.987129921341749e-05, "loss": 0.023267135620117188, "step": 2200 }, { "epoch": 2.5222161272627535, "grad_norm": 0.05183083936572075, "learning_rate": 9.97935603054052e-05, "loss": 0.02218881607055664, "step": 2300 }, { "epoch": 2.6319253976961052, "grad_norm": 0.23794086277484894, "learning_rate": 9.969758559053199e-05, "loss": 0.019391658306121825, "step": 2400 }, { "epoch": 2.741634668129457, "grad_norm": 0.46757692098617554, "learning_rate": 9.958341021744668e-05, "loss": 0.015924193859100343, "step": 2500 }, { "epoch": 2.8513439385628088, "grad_norm": 0.3365223705768585, "learning_rate": 9.945107600039271e-05, "loss": 0.016793460845947267, "step": 2600 }, { "epoch": 2.96105320899616, "grad_norm": 0.10865141451358795, "learning_rate": 9.930063140389458e-05, "loss": 0.015737195014953614, "step": 2700 }, { "epoch": 3.070213933077345, "grad_norm": 0.12908822298049927, "learning_rate": 9.913213152500879e-05, "loss": 0.012379565238952638, "step": 2800 }, { "epoch": 3.179923203510697, "grad_norm": 0.39894333481788635, "learning_rate": 9.89456380731457e-05, "loss": 0.010362827777862548, "step": 2900 }, { "epoch": 3.289632473944048, "grad_norm": 0.18888452649116516, "learning_rate": 9.874121934746984e-05, "loss": 0.010273929834365845, "step": 3000 }, { "epoch": 3.289632473944048, "eval_loss": 0.11601941287517548, "eval_runtime": 116.5005, "eval_samples_per_second": 27.631, "eval_steps_per_second": 6.91, "step": 3000 }, { "epoch": 3.3993417443774, "grad_norm": 0.24296416342258453, "learning_rate": 9.851895021188692e-05, "loss": 0.008741957545280456, "step": 3100 }, { "epoch": 3.5090510148107517, "grad_norm": 0.18995995819568634, "learning_rate": 9.827891206762634e-05, "loss": 0.009190759658813476, "step": 3200 }, { "epoch": 3.618760285244103, "grad_norm": 0.1456049531698227, "learning_rate": 9.802119282342995e-05, "loss": 0.009634263515472412, "step": 3300 }, { "epoch": 3.7284695556774547, "grad_norm": 0.9678109288215637, "learning_rate": 9.774588686335731e-05, "loss": 0.008319487571716308, "step": 3400 }, { "epoch": 3.8381788261108065, "grad_norm": 0.08138152211904526, "learning_rate": 9.74530950122196e-05, "loss": 0.009371925592422486, "step": 3500 }, { "epoch": 3.947888096544158, "grad_norm": 0.5730862617492676, "learning_rate": 9.71429244986547e-05, "loss": 0.007398140430450439, "step": 3600 }, { "epoch": 4.057048820625343, "grad_norm": 0.508908748626709, "learning_rate": 9.681548891585711e-05, "loss": 0.00682299017906189, "step": 3700 }, { "epoch": 4.1667580910586945, "grad_norm": 0.507350504398346, "learning_rate": 9.647090817997684e-05, "loss": 0.0053677594661712645, "step": 3800 }, { "epoch": 4.276467361492046, "grad_norm": 0.24189727008342743, "learning_rate": 9.610930848620274e-05, "loss": 0.003890502452850342, "step": 3900 }, { "epoch": 4.386176631925398, "grad_norm": 0.012589801102876663, "learning_rate": 9.573082226254632e-05, "loss": 0.006510751247406006, "step": 4000 }, { "epoch": 4.495885902358749, "grad_norm": 0.06403769552707672, "learning_rate": 9.533558812134284e-05, "loss": 0.00700473427772522, "step": 4100 }, { "epoch": 4.605595172792101, "grad_norm": 0.04759138450026512, "learning_rate": 9.492375080848754e-05, "loss": 0.008159146308898926, "step": 4200 }, { "epoch": 4.7153044432254525, "grad_norm": 0.1282065361738205, "learning_rate": 9.449546115042562e-05, "loss": 0.0043099141120910645, "step": 4300 }, { "epoch": 4.825013713658804, "grad_norm": 0.06390748172998428, "learning_rate": 9.405087599891538e-05, "loss": 0.006736204624176025, "step": 4400 }, { "epoch": 4.934722984092156, "grad_norm": 0.3489040434360504, "learning_rate": 9.35901581735846e-05, "loss": 0.005642812252044677, "step": 4500 }, { "epoch": 5.0438837081733405, "grad_norm": 0.06407257169485092, "learning_rate": 9.311347640230149e-05, "loss": 0.004873534739017487, "step": 4600 }, { "epoch": 5.153592978606692, "grad_norm": 0.4154542088508606, "learning_rate": 9.262100525938174e-05, "loss": 0.003611042499542236, "step": 4700 }, { "epoch": 5.263302249040044, "grad_norm": 0.35824549198150635, "learning_rate": 9.211292510165441e-05, "loss": 0.004827427566051483, "step": 4800 }, { "epoch": 5.373011519473396, "grad_norm": 0.018712563440203667, "learning_rate": 9.158942200241036e-05, "loss": 0.0049249035120010375, "step": 4900 }, { "epoch": 5.482720789906747, "grad_norm": 0.38031527400016785, "learning_rate": 9.105068768325671e-05, "loss": 0.003927983045578003, "step": 5000 }, { "epoch": 5.5924300603400985, "grad_norm": 0.15979327261447906, "learning_rate": 9.049691944390318e-05, "loss": 0.004007718861103058, "step": 5100 }, { "epoch": 5.70213933077345, "grad_norm": 0.16055099666118622, "learning_rate": 8.99283200899053e-05, "loss": 0.0029034724831581114, "step": 5200 }, { "epoch": 5.811848601206802, "grad_norm": 0.04370570927858353, "learning_rate": 8.934509785839125e-05, "loss": 0.002957637310028076, "step": 5300 }, { "epoch": 5.921557871640154, "grad_norm": 0.4308537244796753, "learning_rate": 8.874746634179962e-05, "loss": 0.006440707445144653, "step": 5400 }, { "epoch": 6.030718595721338, "grad_norm": 0.0070524257607758045, "learning_rate": 8.813564440965575e-05, "loss": 0.003051069974899292, "step": 5500 }, { "epoch": 6.14042786615469, "grad_norm": 0.0011389772407710552, "learning_rate": 8.750985612841563e-05, "loss": 0.0020513579249382017, "step": 5600 }, { "epoch": 6.250137136588042, "grad_norm": 0.3267161250114441, "learning_rate": 8.687033067940638e-05, "loss": 0.0032824283838272096, "step": 5700 }, { "epoch": 6.359846407021394, "grad_norm": 0.22967475652694702, "learning_rate": 8.621730227489358e-05, "loss": 0.0017755647003650666, "step": 5800 }, { "epoch": 6.4695556774547445, "grad_norm": 0.11276954412460327, "learning_rate": 8.555101007230614e-05, "loss": 0.0023945705592632294, "step": 5900 }, { "epoch": 6.579264947888096, "grad_norm": 0.029238076880574226, "learning_rate": 8.487169808665014e-05, "loss": 0.007325031161308289, "step": 6000 }, { "epoch": 6.579264947888096, "eval_loss": 0.09214479476213455, "eval_runtime": 116.3647, "eval_samples_per_second": 27.663, "eval_steps_per_second": 6.918, "step": 6000 }, { "epoch": 6.688974218321448, "grad_norm": 0.04784254729747772, "learning_rate": 8.417961510114356e-05, "loss": 0.003531929850578308, "step": 6100 }, { "epoch": 6.7986834887548, "grad_norm": 0.025865700095891953, "learning_rate": 8.347501457610494e-05, "loss": 0.004350661635398865, "step": 6200 }, { "epoch": 6.9083927591881515, "grad_norm": 0.07848550379276276, "learning_rate": 8.275815455612899e-05, "loss": 0.003835231363773346, "step": 6300 }, { "epoch": 7.017553483269336, "grad_norm": 0.5314407348632812, "learning_rate": 8.20292975755834e-05, "loss": 0.003852725923061371, "step": 6400 }, { "epoch": 7.127262753702688, "grad_norm": 0.004145840182900429, "learning_rate": 8.12887105624614e-05, "loss": 0.0037556231021881104, "step": 6500 }, { "epoch": 7.23697202413604, "grad_norm": 0.01268320344388485, "learning_rate": 8.053666474062508e-05, "loss": 0.0029447203874588012, "step": 6600 }, { "epoch": 7.346681294569391, "grad_norm": 0.16281633079051971, "learning_rate": 7.97734355304757e-05, "loss": 0.002923213243484497, "step": 6700 }, { "epoch": 7.456390565002743, "grad_norm": 0.14518429338932037, "learning_rate": 7.89993024480868e-05, "loss": 0.0024193134903907777, "step": 6800 }, { "epoch": 7.566099835436094, "grad_norm": 0.3797168433666229, "learning_rate": 7.821454900283775e-05, "loss": 0.0024912458658218383, "step": 6900 }, { "epoch": 7.675809105869446, "grad_norm": 0.5517730712890625, "learning_rate": 7.741946259358434e-05, "loss": 0.0023130226135253907, "step": 7000 }, { "epoch": 7.7855183763027975, "grad_norm": 0.22722378373146057, "learning_rate": 7.661433440340549e-05, "loss": 0.0026683008670806887, "step": 7100 }, { "epoch": 7.895227646736149, "grad_norm": 0.07195847481489182, "learning_rate": 7.579945929296352e-05, "loss": 0.00318217933177948, "step": 7200 }, { "epoch": 8.004388370817335, "grad_norm": 0.07402148842811584, "learning_rate": 7.49751356925181e-05, "loss": 0.0024203072488307954, "step": 7300 }, { "epoch": 8.114097641250686, "grad_norm": 0.0004932262236252427, "learning_rate": 7.414166549263253e-05, "loss": 0.0005915772542357445, "step": 7400 }, { "epoch": 8.223806911684036, "grad_norm": 0.14862555265426636, "learning_rate": 7.329935393361286e-05, "loss": 0.0015757225453853607, "step": 7500 }, { "epoch": 8.333516182117389, "grad_norm": 0.11636239290237427, "learning_rate": 7.244850949372044e-05, "loss": 0.0014248163998126983, "step": 7600 }, { "epoch": 8.44322545255074, "grad_norm": 0.02938424050807953, "learning_rate": 7.158944377619829e-05, "loss": 0.0008066059648990632, "step": 7700 }, { "epoch": 8.552934722984093, "grad_norm": 0.003459229366853833, "learning_rate": 7.072247139515337e-05, "loss": 0.0007172146439552307, "step": 7800 }, { "epoch": 8.662643993417444, "grad_norm": 1.0215219259262085, "learning_rate": 6.984790986033582e-05, "loss": 0.0024658374488353728, "step": 7900 }, { "epoch": 8.772353263850796, "grad_norm": 0.04188821464776993, "learning_rate": 6.896607946085818e-05, "loss": 0.003845172226428986, "step": 8000 }, { "epoch": 8.882062534284147, "grad_norm": 0.21492426097393036, "learning_rate": 6.807730314789622e-05, "loss": 0.0034224957227706907, "step": 8100 }, { "epoch": 8.991771804717498, "grad_norm": 0.001628322177566588, "learning_rate": 6.71819064164153e-05, "loss": 0.0017799775302410126, "step": 8200 }, { "epoch": 9.100932528798683, "grad_norm": 0.10092741996049881, "learning_rate": 6.628021718596485e-05, "loss": 0.0018181195855140686, "step": 8300 }, { "epoch": 9.210641799232036, "grad_norm": 0.011512243188917637, "learning_rate": 6.537256568058492e-05, "loss": 0.0007427728176116943, "step": 8400 }, { "epoch": 9.320351069665387, "grad_norm": 0.05302899330854416, "learning_rate": 6.445928430786898e-05, "loss": 0.0031538277864456175, "step": 8500 }, { "epoch": 9.430060340098738, "grad_norm": 0.003643701085820794, "learning_rate": 6.354070753722674e-05, "loss": 0.0019684681296348572, "step": 8600 }, { "epoch": 9.53976961053209, "grad_norm": 0.005743952933698893, "learning_rate": 6.261717177739202e-05, "loss": 0.002124977260828018, "step": 8700 }, { "epoch": 9.649478880965441, "grad_norm": 0.0006560595938935876, "learning_rate": 6.168901525322048e-05, "loss": 0.002307926416397095, "step": 8800 }, { "epoch": 9.759188151398794, "grad_norm": 0.014800022356212139, "learning_rate": 6.075657788182201e-05, "loss": 0.0020691359043121336, "step": 8900 }, { "epoch": 9.868897421832145, "grad_norm": 0.00023062083346303552, "learning_rate": 5.982020114807359e-05, "loss": 0.0011634621024131774, "step": 9000 }, { "epoch": 9.868897421832145, "eval_loss": 0.10657082498073578, "eval_runtime": 116.1296, "eval_samples_per_second": 27.719, "eval_steps_per_second": 6.932, "step": 9000 }, { "epoch": 9.978606692265496, "grad_norm": 0.005069139879196882, "learning_rate": 5.888022797955783e-05, "loss": 0.000807158499956131, "step": 9100 }, { "epoch": 10.087767416346681, "grad_norm": 0.0007675938541069627, "learning_rate": 5.793700262097326e-05, "loss": 0.000818609818816185, "step": 9200 }, { "epoch": 10.197476686780034, "grad_norm": 8.392518066102639e-05, "learning_rate": 5.699087050806219e-05, "loss": 0.0002204919047653675, "step": 9300 }, { "epoch": 10.307185957213385, "grad_norm": 0.001035814406350255, "learning_rate": 5.604217814110233e-05, "loss": 0.0010148981213569642, "step": 9400 }, { "epoch": 10.416895227646735, "grad_norm": 0.0005645599449053407, "learning_rate": 5.509127295800873e-05, "loss": 0.0009634912759065628, "step": 9500 }, { "epoch": 10.526604498080088, "grad_norm": 0.006124628707766533, "learning_rate": 5.413850320709213e-05, "loss": 0.002135903686285019, "step": 9600 }, { "epoch": 10.636313768513439, "grad_norm": 0.015287889167666435, "learning_rate": 5.318421781952063e-05, "loss": 0.001537524163722992, "step": 9700 }, { "epoch": 10.746023038946792, "grad_norm": 0.0016915776068344712, "learning_rate": 5.2228766281531184e-05, "loss": 0.000581161379814148, "step": 9800 }, { "epoch": 10.855732309380143, "grad_norm": 0.039407797157764435, "learning_rate": 5.127249850643801e-05, "loss": 0.0010789106786251068, "step": 9900 }, { "epoch": 10.965441579813493, "grad_norm": 0.0032954695634543896, "learning_rate": 5.031576470648437e-05, "loss": 0.0008925460278987885, "step": 10000 }, { "epoch": 11.074602303894679, "grad_norm": 0.0008019655360840261, "learning_rate": 4.935891526458493e-05, "loss": 0.0006475619226694107, "step": 10100 }, { "epoch": 11.184311574328031, "grad_norm": 0.001246742787770927, "learning_rate": 4.840230060600579e-05, "loss": 0.001001117080450058, "step": 10200 }, { "epoch": 11.294020844761382, "grad_norm": 0.004168672487139702, "learning_rate": 4.744627107002866e-05, "loss": 0.0009924402087926865, "step": 10300 }, { "epoch": 11.403730115194733, "grad_norm": 0.006193607579916716, "learning_rate": 4.649117678164694e-05, "loss": 0.0007412029802799225, "step": 10400 }, { "epoch": 11.513439385628086, "grad_norm": 0.04498029127717018, "learning_rate": 4.5537367523339915e-05, "loss": 0.001676485538482666, "step": 10500 }, { "epoch": 11.623148656061437, "grad_norm": 0.0013482400681823492, "learning_rate": 4.458519260697263e-05, "loss": 0.0006184951961040497, "step": 10600 }, { "epoch": 11.73285792649479, "grad_norm": 0.04078209772706032, "learning_rate": 4.363500074586795e-05, "loss": 0.00015302015468478204, "step": 10700 }, { "epoch": 11.84256719692814, "grad_norm": 0.00041609694017097354, "learning_rate": 4.268713992709801e-05, "loss": 0.0001718943752348423, "step": 10800 }, { "epoch": 11.952276467361493, "grad_norm": 0.001313285669311881, "learning_rate": 4.1741957284041396e-05, "loss": 0.0002560199424624443, "step": 10900 }, { "epoch": 12.061437191442677, "grad_norm": 0.20023229718208313, "learning_rate": 4.079979896925319e-05, "loss": 0.001909550279378891, "step": 11000 }, { "epoch": 12.17114646187603, "grad_norm": 0.017514726147055626, "learning_rate": 3.986101002769419e-05, "loss": 0.00020196065306663514, "step": 11100 }, { "epoch": 12.28085573230938, "grad_norm": 9.268768189940602e-05, "learning_rate": 3.89259342703655e-05, "loss": 0.0002678022161126137, "step": 11200 }, { "epoch": 12.390565002742731, "grad_norm": 0.00034697377122938633, "learning_rate": 3.799491414839556e-05, "loss": 0.00046276580542325974, "step": 11300 }, { "epoch": 12.500274273176084, "grad_norm": 0.0007233850774355233, "learning_rate": 3.7068290627624544e-05, "loss": 0.0004483434557914734, "step": 11400 }, { "epoch": 12.609983543609435, "grad_norm": 0.00960569642484188, "learning_rate": 3.614640306373329e-05, "loss": 0.00046372778713703154, "step": 11500 }, { "epoch": 12.719692814042787, "grad_norm": 8.914520003600046e-05, "learning_rate": 3.522958907796155e-05, "loss": 0.0001941412128508091, "step": 11600 }, { "epoch": 12.829402084476138, "grad_norm": 0.00025227374862879515, "learning_rate": 3.431818443346164e-05, "loss": 7.15433107689023e-05, "step": 11700 }, { "epoch": 12.939111354909489, "grad_norm": 7.685183663852513e-05, "learning_rate": 3.341252291233241e-05, "loss": 0.0002717839926481247, "step": 11800 }, { "epoch": 13.048272078990674, "grad_norm": 2.5767532861209475e-05, "learning_rate": 3.251293619337889e-05, "loss": 5.591163411736489e-05, "step": 11900 }, { "epoch": 13.157981349424027, "grad_norm": 7.815273420419544e-05, "learning_rate": 3.161975373064217e-05, "loss": 1.8522043246775867e-05, "step": 12000 }, { "epoch": 13.157981349424027, "eval_loss": 0.15513338148593903, "eval_runtime": 107.1852, "eval_samples_per_second": 30.032, "eval_steps_per_second": 7.51, "step": 12000 } ], "logging_steps": 100, "max_steps": 18240, "num_input_tokens_seen": 0, "num_train_epochs": 20, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.758640217053987e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }