{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 156, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.2914280891418457, "epoch": 0.012965964343598054, "grad_norm": 1.112913966178894, "learning_rate": 0.0, "loss": 2.1718008518218994, "mean_token_accuracy": 0.5190608203411102, "num_tokens": 130726.0, "step": 1 }, { "entropy": 1.2813172340393066, "epoch": 0.02593192868719611, "grad_norm": 1.0995973348617554, "learning_rate": 4.166666666666667e-06, "loss": 2.1320834159851074, "mean_token_accuracy": 0.5265823230147362, "num_tokens": 257394.0, "step": 2 }, { "entropy": 1.327770620584488, "epoch": 0.03889789303079417, "grad_norm": 0.9902980327606201, "learning_rate": 8.333333333333334e-06, "loss": 2.1106252670288086, "mean_token_accuracy": 0.5237875208258629, "num_tokens": 387496.0, "step": 3 }, { "entropy": 1.3719477504491806, "epoch": 0.05186385737439222, "grad_norm": 0.8683141469955444, "learning_rate": 1.25e-05, "loss": 2.0806920528411865, "mean_token_accuracy": 0.526897743344307, "num_tokens": 517915.0, "step": 4 }, { "entropy": 1.4400453567504883, "epoch": 0.06482982171799027, "grad_norm": 0.6660990715026855, "learning_rate": 1.6666666666666667e-05, "loss": 1.9889618158340454, "mean_token_accuracy": 0.5334466248750687, "num_tokens": 648540.0, "step": 5 }, { "entropy": 1.5626330226659775, "epoch": 0.07779578606158834, "grad_norm": 0.5204595923423767, "learning_rate": 2.0833333333333336e-05, "loss": 1.9843950271606445, "mean_token_accuracy": 0.5293373018503189, "num_tokens": 779170.0, "step": 6 }, { "entropy": 1.6014426946640015, "epoch": 0.09076175040518639, "grad_norm": 0.3845070004463196, "learning_rate": 2.5e-05, "loss": 1.887692928314209, "mean_token_accuracy": 0.5425543487071991, "num_tokens": 909516.0, "step": 7 }, { "entropy": 1.6851050555706024, "epoch": 0.10372771474878444, "grad_norm": 0.30755460262298584, "learning_rate": 2.916666666666667e-05, "loss": 1.8439122438430786, "mean_token_accuracy": 0.5476168766617775, "num_tokens": 1039198.0, "step": 8 }, { "entropy": 1.7548235952854156, "epoch": 0.1166936790923825, "grad_norm": 0.26733461022377014, "learning_rate": 3.3333333333333335e-05, "loss": 1.8185280561447144, "mean_token_accuracy": 0.5502617135643959, "num_tokens": 1169425.0, "step": 9 }, { "entropy": 1.7970841228961945, "epoch": 0.12965964343598055, "grad_norm": 0.26483356952667236, "learning_rate": 3.7500000000000003e-05, "loss": 1.7471606731414795, "mean_token_accuracy": 0.5560443699359894, "num_tokens": 1299168.0, "step": 10 }, { "entropy": 1.8392730802297592, "epoch": 0.1426256077795786, "grad_norm": 0.2690557837486267, "learning_rate": 4.166666666666667e-05, "loss": 1.736329197883606, "mean_token_accuracy": 0.5596349760890007, "num_tokens": 1430062.0, "step": 11 }, { "entropy": 1.885682463645935, "epoch": 0.15559157212317667, "grad_norm": 0.2904511094093323, "learning_rate": 4.5833333333333334e-05, "loss": 1.7258615493774414, "mean_token_accuracy": 0.5618793666362762, "num_tokens": 1560442.0, "step": 12 }, { "entropy": 1.9065079540014267, "epoch": 0.1685575364667747, "grad_norm": 0.3055932819843292, "learning_rate": 5e-05, "loss": 1.709148645401001, "mean_token_accuracy": 0.5631825849413872, "num_tokens": 1687626.0, "step": 13 }, { "entropy": 1.8885795921087265, "epoch": 0.18152350081037277, "grad_norm": 0.31618642807006836, "learning_rate": 4.9997496794168726e-05, "loss": 1.6640710830688477, "mean_token_accuracy": 0.5704818964004517, "num_tokens": 1817839.0, "step": 14 }, { "entropy": 1.799900770187378, "epoch": 0.19448946515397084, "grad_norm": 0.28537100553512573, "learning_rate": 4.998998767795805e-05, "loss": 1.5893642902374268, "mean_token_accuracy": 0.5844717845320702, "num_tokens": 1947846.0, "step": 15 }, { "entropy": 1.7524273693561554, "epoch": 0.20745542949756887, "grad_norm": 0.25802257657051086, "learning_rate": 4.9977474155117045e-05, "loss": 1.57011079788208, "mean_token_accuracy": 0.5896653309464455, "num_tokens": 2078221.0, "step": 16 }, { "entropy": 1.709429755806923, "epoch": 0.22042139384116693, "grad_norm": 0.22759748995304108, "learning_rate": 4.995995873155958e-05, "loss": 1.5693228244781494, "mean_token_accuracy": 0.5865247845649719, "num_tokens": 2208236.0, "step": 17 }, { "entropy": 1.6319102048873901, "epoch": 0.233387358184765, "grad_norm": 0.19342641532421112, "learning_rate": 4.99374449148625e-05, "loss": 1.528588056564331, "mean_token_accuracy": 0.5946438014507294, "num_tokens": 2338245.0, "step": 18 }, { "entropy": 1.5404616594314575, "epoch": 0.24635332252836303, "grad_norm": 0.1698416769504547, "learning_rate": 4.9909937213563165e-05, "loss": 1.4880129098892212, "mean_token_accuracy": 0.6007702648639679, "num_tokens": 2467411.0, "step": 19 }, { "entropy": 1.5045948326587677, "epoch": 0.2593192868719611, "grad_norm": 0.1683117300271988, "learning_rate": 4.987744113625665e-05, "loss": 1.5048375129699707, "mean_token_accuracy": 0.5982850342988968, "num_tokens": 2598113.0, "step": 20 }, { "entropy": 1.4073765128850937, "epoch": 0.27228525121555913, "grad_norm": 0.19874629378318787, "learning_rate": 4.9839963190492576e-05, "loss": 1.456631064414978, "mean_token_accuracy": 0.6086618900299072, "num_tokens": 2728430.0, "step": 21 }, { "entropy": 1.3884904980659485, "epoch": 0.2852512155591572, "grad_norm": 0.21319466829299927, "learning_rate": 4.979751088147192e-05, "loss": 1.4507615566253662, "mean_token_accuracy": 0.6082002520561218, "num_tokens": 2858506.0, "step": 22 }, { "entropy": 1.3483813256025314, "epoch": 0.29821717990275526, "grad_norm": 0.23800760507583618, "learning_rate": 4.975009271054409e-05, "loss": 1.4227944612503052, "mean_token_accuracy": 0.611847274005413, "num_tokens": 2985950.0, "step": 23 }, { "entropy": 1.3535500168800354, "epoch": 0.31118314424635335, "grad_norm": 0.21581389009952545, "learning_rate": 4.969771817350445e-05, "loss": 1.4188156127929688, "mean_token_accuracy": 0.6119491159915924, "num_tokens": 3112407.0, "step": 24 }, { "entropy": 1.338183343410492, "epoch": 0.3241491085899514, "grad_norm": 0.19480355083942413, "learning_rate": 4.9640397758692715e-05, "loss": 1.3919925689697266, "mean_token_accuracy": 0.6192305833101273, "num_tokens": 3242148.0, "step": 25 }, { "entropy": 1.3593887984752655, "epoch": 0.3371150729335494, "grad_norm": 0.15354962646961212, "learning_rate": 4.957814294489261e-05, "loss": 1.3766716718673706, "mean_token_accuracy": 0.6211562678217888, "num_tokens": 3373129.0, "step": 26 }, { "entropy": 1.362599864602089, "epoch": 0.3500810372771475, "grad_norm": 0.13560850918293, "learning_rate": 4.9510966199033174e-05, "loss": 1.349892258644104, "mean_token_accuracy": 0.6282063350081444, "num_tokens": 3503490.0, "step": 27 }, { "entropy": 1.3730409890413284, "epoch": 0.36304700162074555, "grad_norm": 0.13365128636360168, "learning_rate": 4.943888097369216e-05, "loss": 1.3391973972320557, "mean_token_accuracy": 0.6288642287254333, "num_tokens": 3631734.0, "step": 28 }, { "entropy": 1.371128425002098, "epoch": 0.3760129659643436, "grad_norm": 0.14155763387680054, "learning_rate": 4.936190170440208e-05, "loss": 1.32077956199646, "mean_token_accuracy": 0.6326342150568962, "num_tokens": 3762573.0, "step": 29 }, { "entropy": 1.407492458820343, "epoch": 0.3889789303079417, "grad_norm": 0.14185482263565063, "learning_rate": 4.928004380675941e-05, "loss": 1.3511477708816528, "mean_token_accuracy": 0.625172384083271, "num_tokens": 3893064.0, "step": 30 }, { "entropy": 1.3961241841316223, "epoch": 0.4019448946515397, "grad_norm": 0.13855496048927307, "learning_rate": 4.9193323673337476e-05, "loss": 1.336405873298645, "mean_token_accuracy": 0.6296647489070892, "num_tokens": 4023676.0, "step": 31 }, { "entropy": 1.3903988599777222, "epoch": 0.41491085899513774, "grad_norm": 0.13400253653526306, "learning_rate": 4.910175867040377e-05, "loss": 1.3442656993865967, "mean_token_accuracy": 0.627065122127533, "num_tokens": 4153956.0, "step": 32 }, { "entropy": 1.351208671927452, "epoch": 0.42787682333873583, "grad_norm": 0.12610815465450287, "learning_rate": 4.9005367134442235e-05, "loss": 1.3147870302200317, "mean_token_accuracy": 0.6329845190048218, "num_tokens": 4283315.0, "step": 33 }, { "entropy": 1.3148349225521088, "epoch": 0.44084278768233387, "grad_norm": 0.11920498311519623, "learning_rate": 4.890416836848127e-05, "loss": 1.2881569862365723, "mean_token_accuracy": 0.6375886723399162, "num_tokens": 4414063.0, "step": 34 }, { "entropy": 1.3178757429122925, "epoch": 0.4538087520259319, "grad_norm": 0.11554136872291565, "learning_rate": 4.8798182638228166e-05, "loss": 1.3023653030395508, "mean_token_accuracy": 0.635626994073391, "num_tokens": 4542894.0, "step": 35 }, { "entropy": 1.2868364304304123, "epoch": 0.46677471636953, "grad_norm": 0.11724869906902313, "learning_rate": 4.868743116801074e-05, "loss": 1.276515245437622, "mean_token_accuracy": 0.6388825476169586, "num_tokens": 4673393.0, "step": 36 }, { "entropy": 1.3117478638887405, "epoch": 0.47974068071312803, "grad_norm": 0.11675813794136047, "learning_rate": 4.857193613652711e-05, "loss": 1.319561243057251, "mean_token_accuracy": 0.6311607211828232, "num_tokens": 4803020.0, "step": 37 }, { "entropy": 1.269007459282875, "epoch": 0.49270664505672607, "grad_norm": 0.11431621760129929, "learning_rate": 4.845172067240415e-05, "loss": 1.2735211849212646, "mean_token_accuracy": 0.6423661559820175, "num_tokens": 4932686.0, "step": 38 }, { "entropy": 1.2656036466360092, "epoch": 0.5056726094003241, "grad_norm": 0.11062812805175781, "learning_rate": 4.8326808849565936e-05, "loss": 1.265828251838684, "mean_token_accuracy": 0.6441638022661209, "num_tokens": 5062963.0, "step": 39 }, { "entropy": 1.27534119784832, "epoch": 0.5186385737439222, "grad_norm": 0.11323992908000946, "learning_rate": 4.819722568241274e-05, "loss": 1.281820297241211, "mean_token_accuracy": 0.6388759091496468, "num_tokens": 5192982.0, "step": 40 }, { "entropy": 1.2759585976600647, "epoch": 0.5316045380875203, "grad_norm": 0.11570397019386292, "learning_rate": 4.806299712081172e-05, "loss": 1.276839256286621, "mean_token_accuracy": 0.6385012120008469, "num_tokens": 5323413.0, "step": 41 }, { "entropy": 1.265689566731453, "epoch": 0.5445705024311183, "grad_norm": 0.10930497944355011, "learning_rate": 4.792415004490034e-05, "loss": 1.2645472288131714, "mean_token_accuracy": 0.6423149555921555, "num_tokens": 5454255.0, "step": 42 }, { "entropy": 1.254970133304596, "epoch": 0.5575364667747164, "grad_norm": 0.10787371546030045, "learning_rate": 4.77807122597034e-05, "loss": 1.2552263736724854, "mean_token_accuracy": 0.6437231004238129, "num_tokens": 5583881.0, "step": 43 }, { "entropy": 1.2431457936763763, "epoch": 0.5705024311183144, "grad_norm": 0.10893784463405609, "learning_rate": 4.7632712489564926e-05, "loss": 1.2408338785171509, "mean_token_accuracy": 0.6460021436214447, "num_tokens": 5714257.0, "step": 44 }, { "entropy": 1.228305697441101, "epoch": 0.5834683954619124, "grad_norm": 0.11218206584453583, "learning_rate": 4.748018037239592e-05, "loss": 1.2231602668762207, "mean_token_accuracy": 0.6500201225280762, "num_tokens": 5844960.0, "step": 45 }, { "entropy": 1.2626090496778488, "epoch": 0.5964343598055105, "grad_norm": 0.11627671867609024, "learning_rate": 4.732314645373921e-05, "loss": 1.2628517150878906, "mean_token_accuracy": 0.6433948427438736, "num_tokens": 5974432.0, "step": 46 }, { "entropy": 1.2499435395002365, "epoch": 0.6094003241491086, "grad_norm": 0.1064961850643158, "learning_rate": 4.7161642180652464e-05, "loss": 1.2429689168930054, "mean_token_accuracy": 0.6463894993066788, "num_tokens": 6105159.0, "step": 47 }, { "entropy": 1.2387475371360779, "epoch": 0.6223662884927067, "grad_norm": 0.1059798151254654, "learning_rate": 4.699569989541074e-05, "loss": 1.2348564863204956, "mean_token_accuracy": 0.6485447883605957, "num_tokens": 6234686.0, "step": 48 }, { "entropy": 1.230888694524765, "epoch": 0.6353322528363047, "grad_norm": 0.10563136637210846, "learning_rate": 4.6825352829029705e-05, "loss": 1.2326059341430664, "mean_token_accuracy": 0.650854229927063, "num_tokens": 6364713.0, "step": 49 }, { "entropy": 1.2304238229990005, "epoch": 0.6482982171799028, "grad_norm": 0.10895860940217972, "learning_rate": 4.665063509461097e-05, "loss": 1.2246171236038208, "mean_token_accuracy": 0.6520287021994591, "num_tokens": 6494067.0, "step": 50 }, { "entropy": 1.2349478155374527, "epoch": 0.6612641815235009, "grad_norm": 0.11149362474679947, "learning_rate": 4.647158168051066e-05, "loss": 1.2276027202606201, "mean_token_accuracy": 0.6503733918070793, "num_tokens": 6624643.0, "step": 51 }, { "entropy": 1.2219702452421188, "epoch": 0.6742301458670988, "grad_norm": 0.10449287295341492, "learning_rate": 4.628822844333278e-05, "loss": 1.2258139848709106, "mean_token_accuracy": 0.6509344652295113, "num_tokens": 6754416.0, "step": 52 }, { "entropy": 1.2058308869600296, "epoch": 0.6871961102106969, "grad_norm": 0.10380305349826813, "learning_rate": 4.6100612100748765e-05, "loss": 1.214524745941162, "mean_token_accuracy": 0.6529537662863731, "num_tokens": 6885227.0, "step": 53 }, { "entropy": 1.2204056680202484, "epoch": 0.700162074554295, "grad_norm": 0.10786499083042145, "learning_rate": 4.59087702241444e-05, "loss": 1.2236121892929077, "mean_token_accuracy": 0.648014634847641, "num_tokens": 7011809.0, "step": 54 }, { "entropy": 1.2288042306900024, "epoch": 0.713128038897893, "grad_norm": 0.1033908799290657, "learning_rate": 4.571274123109606e-05, "loss": 1.2249078750610352, "mean_token_accuracy": 0.6486673802137375, "num_tokens": 7141874.0, "step": 55 }, { "entropy": 1.1886361241340637, "epoch": 0.7260940032414911, "grad_norm": 0.10556555539369583, "learning_rate": 4.551256437767719e-05, "loss": 1.1965718269348145, "mean_token_accuracy": 0.6559380367398262, "num_tokens": 7272536.0, "step": 56 }, { "entropy": 1.1931221783161163, "epoch": 0.7390599675850892, "grad_norm": 0.10483699291944504, "learning_rate": 4.530827975059715e-05, "loss": 1.1899445056915283, "mean_token_accuracy": 0.6578836813569069, "num_tokens": 7402306.0, "step": 57 }, { "entropy": 1.2073332518339157, "epoch": 0.7520259319286872, "grad_norm": 0.10389534384012222, "learning_rate": 4.5099928259173516e-05, "loss": 1.2089029550552368, "mean_token_accuracy": 0.6548937857151031, "num_tokens": 7532812.0, "step": 58 }, { "entropy": 1.2048113197088242, "epoch": 0.7649918962722853, "grad_norm": 0.10125990211963654, "learning_rate": 4.488755162713975e-05, "loss": 1.2044589519500732, "mean_token_accuracy": 0.6544741094112396, "num_tokens": 7663455.0, "step": 59 }, { "entropy": 1.1779465079307556, "epoch": 0.7779578606158833, "grad_norm": 0.10293558984994888, "learning_rate": 4.467119238428975e-05, "loss": 1.1754040718078613, "mean_token_accuracy": 0.6628620699048042, "num_tokens": 7791205.0, "step": 60 }, { "entropy": 1.2144263088703156, "epoch": 0.7909238249594813, "grad_norm": 0.10379968583583832, "learning_rate": 4.445089385796099e-05, "loss": 1.2083706855773926, "mean_token_accuracy": 0.6543944776058197, "num_tokens": 7918409.0, "step": 61 }, { "entropy": 1.1998531073331833, "epoch": 0.8038897893030794, "grad_norm": 0.10215966403484344, "learning_rate": 4.422670016435792e-05, "loss": 1.1933221817016602, "mean_token_accuracy": 0.6570570692420006, "num_tokens": 8048417.0, "step": 62 }, { "entropy": 1.200714260339737, "epoch": 0.8168557536466775, "grad_norm": 0.100275419652462, "learning_rate": 4.3998656199717435e-05, "loss": 1.189272165298462, "mean_token_accuracy": 0.6573792845010757, "num_tokens": 8179053.0, "step": 63 }, { "entropy": 1.1872155517339706, "epoch": 0.8298217179902755, "grad_norm": 0.10071317106485367, "learning_rate": 4.3766807631318106e-05, "loss": 1.1810928583145142, "mean_token_accuracy": 0.6583103537559509, "num_tokens": 8309355.0, "step": 64 }, { "entropy": 1.1796019226312637, "epoch": 0.8427876823338736, "grad_norm": 0.10065017640590668, "learning_rate": 4.353120088833501e-05, "loss": 1.17380952835083, "mean_token_accuracy": 0.6608408540487289, "num_tokens": 8439678.0, "step": 65 }, { "entropy": 1.1712117940187454, "epoch": 0.8557536466774717, "grad_norm": 0.09942107647657394, "learning_rate": 4.329188315254196e-05, "loss": 1.1702531576156616, "mean_token_accuracy": 0.6607685834169388, "num_tokens": 8569426.0, "step": 66 }, { "entropy": 1.1880214363336563, "epoch": 0.8687196110210696, "grad_norm": 0.10245856642723083, "learning_rate": 4.3048902348863116e-05, "loss": 1.1839733123779297, "mean_token_accuracy": 0.658528208732605, "num_tokens": 8698056.0, "step": 67 }, { "entropy": 1.1805013716220856, "epoch": 0.8816855753646677, "grad_norm": 0.1010119840502739, "learning_rate": 4.280230713577564e-05, "loss": 1.179073452949524, "mean_token_accuracy": 0.6590162664651871, "num_tokens": 8828822.0, "step": 68 }, { "entropy": 1.1775793582201004, "epoch": 0.8946515397082658, "grad_norm": 0.10408595204353333, "learning_rate": 4.255214689556557e-05, "loss": 1.1802899837493896, "mean_token_accuracy": 0.6601392850279808, "num_tokens": 8958617.0, "step": 69 }, { "entropy": 1.1794121712446213, "epoch": 0.9076175040518638, "grad_norm": 0.10349196195602417, "learning_rate": 4.229847172443866e-05, "loss": 1.1859654188156128, "mean_token_accuracy": 0.6571361273527145, "num_tokens": 9089619.0, "step": 70 }, { "entropy": 1.1704782098531723, "epoch": 0.9205834683954619, "grad_norm": 0.10455135256052017, "learning_rate": 4.204133242248832e-05, "loss": 1.1761753559112549, "mean_token_accuracy": 0.661134235560894, "num_tokens": 9220349.0, "step": 71 }, { "entropy": 1.2045030444860458, "epoch": 0.93354943273906, "grad_norm": 0.10628621280193329, "learning_rate": 4.1780780483522575e-05, "loss": 1.1999099254608154, "mean_token_accuracy": 0.6541163548827171, "num_tokens": 9350922.0, "step": 72 }, { "entropy": 1.194443255662918, "epoch": 0.946515397082658, "grad_norm": 0.10347249358892441, "learning_rate": 4.151686808475204e-05, "loss": 1.191763162612915, "mean_token_accuracy": 0.6565472781658173, "num_tokens": 9479617.0, "step": 73 }, { "entropy": 1.1695558428764343, "epoch": 0.9594813614262561, "grad_norm": 0.1053929403424263, "learning_rate": 4.1249648076341165e-05, "loss": 1.17070472240448, "mean_token_accuracy": 0.662074476480484, "num_tokens": 9609933.0, "step": 74 }, { "entropy": 1.1687128692865372, "epoch": 0.9724473257698542, "grad_norm": 0.10350026190280914, "learning_rate": 4.0979173970824626e-05, "loss": 1.1742582321166992, "mean_token_accuracy": 0.6614358499646187, "num_tokens": 9740065.0, "step": 75 }, { "entropy": 1.1681682914495468, "epoch": 0.9854132901134521, "grad_norm": 0.10243335366249084, "learning_rate": 4.070549993239106e-05, "loss": 1.1658577919006348, "mean_token_accuracy": 0.6637781262397766, "num_tokens": 9870742.0, "step": 76 }, { "entropy": 1.1639882773160934, "epoch": 0.9983792544570502, "grad_norm": 0.10228604823350906, "learning_rate": 4.0428680766036384e-05, "loss": 1.1644949913024902, "mean_token_accuracy": 0.6624981611967087, "num_tokens": 10001320.0, "step": 77 }, { "entropy": 1.1632845401763916, "epoch": 1.0, "grad_norm": 0.2728025019168854, "learning_rate": 4.0148771906588706e-05, "loss": 1.1762704849243164, "mean_token_accuracy": 0.6677740812301636, "num_tokens": 10009153.0, "step": 78 }, { "entropy": 1.1636807769536972, "epoch": 1.012965964343598, "grad_norm": 0.10475616157054901, "learning_rate": 3.986582940760717e-05, "loss": 1.148669958114624, "mean_token_accuracy": 0.6649533659219742, "num_tokens": 10140011.0, "step": 79 }, { "entropy": 1.1557996571063995, "epoch": 1.0259319286871962, "grad_norm": 0.10492753237485886, "learning_rate": 3.957990993015683e-05, "loss": 1.1505277156829834, "mean_token_accuracy": 0.6668093428015709, "num_tokens": 10270495.0, "step": 80 }, { "entropy": 1.15270234644413, "epoch": 1.0388978930307942, "grad_norm": 0.11243247240781784, "learning_rate": 3.929107073146197e-05, "loss": 1.1362740993499756, "mean_token_accuracy": 0.6668569073081017, "num_tokens": 10399470.0, "step": 81 }, { "entropy": 1.1315193176269531, "epoch": 1.0518638573743921, "grad_norm": 0.10758878290653229, "learning_rate": 3.899936965343989e-05, "loss": 1.124503254890442, "mean_token_accuracy": 0.6695496663451195, "num_tokens": 10529305.0, "step": 82 }, { "entropy": 1.1181457191705704, "epoch": 1.0648298217179903, "grad_norm": 0.10492865741252899, "learning_rate": 3.8704865111117746e-05, "loss": 1.115187406539917, "mean_token_accuracy": 0.6714175269007683, "num_tokens": 10658946.0, "step": 83 }, { "entropy": 1.0976143777370453, "epoch": 1.0777957860615883, "grad_norm": 0.1108441948890686, "learning_rate": 3.840761608093456e-05, "loss": 1.1016005277633667, "mean_token_accuracy": 0.6776464283466339, "num_tokens": 10785329.0, "step": 84 }, { "entropy": 1.0979181677103043, "epoch": 1.0907617504051863, "grad_norm": 0.10647857189178467, "learning_rate": 3.8107682088930794e-05, "loss": 1.1082489490509033, "mean_token_accuracy": 0.6754170134663582, "num_tokens": 10915123.0, "step": 85 }, { "entropy": 1.116148591041565, "epoch": 1.1037277147487845, "grad_norm": 0.10859860479831696, "learning_rate": 3.7805123198827857e-05, "loss": 1.1278622150421143, "mean_token_accuracy": 0.6695821657776833, "num_tokens": 11045591.0, "step": 86 }, { "entropy": 1.1232954412698746, "epoch": 1.1166936790923825, "grad_norm": 0.11128611862659454, "learning_rate": 3.7500000000000003e-05, "loss": 1.1274020671844482, "mean_token_accuracy": 0.671474426984787, "num_tokens": 11175412.0, "step": 87 }, { "entropy": 1.1286661922931671, "epoch": 1.1296596434359805, "grad_norm": 0.10658227652311325, "learning_rate": 3.719237359534087e-05, "loss": 1.1328142881393433, "mean_token_accuracy": 0.6698684319853783, "num_tokens": 11305669.0, "step": 88 }, { "entropy": 1.127964898943901, "epoch": 1.1426256077795787, "grad_norm": 0.1069759875535965, "learning_rate": 3.688230558902725e-05, "loss": 1.1221802234649658, "mean_token_accuracy": 0.6720241084694862, "num_tokens": 11433238.0, "step": 89 }, { "entropy": 1.1164967715740204, "epoch": 1.1555915721231766, "grad_norm": 0.1038687601685524, "learning_rate": 3.656985807418248e-05, "loss": 1.1091525554656982, "mean_token_accuracy": 0.6741333156824112, "num_tokens": 11563958.0, "step": 90 }, { "entropy": 1.119084969162941, "epoch": 1.1685575364667746, "grad_norm": 0.10730428993701935, "learning_rate": 3.6255093620441834e-05, "loss": 1.1172475814819336, "mean_token_accuracy": 0.6720305904746056, "num_tokens": 11694626.0, "step": 91 }, { "entropy": 1.1386660188436508, "epoch": 1.1815235008103728, "grad_norm": 0.11028113216161728, "learning_rate": 3.593807526142261e-05, "loss": 1.1373463869094849, "mean_token_accuracy": 0.6680505573749542, "num_tokens": 11824157.0, "step": 92 }, { "entropy": 1.128893181681633, "epoch": 1.1944894651539708, "grad_norm": 0.11066646128892899, "learning_rate": 3.56188664821012e-05, "loss": 1.1258357763290405, "mean_token_accuracy": 0.6708294078707695, "num_tokens": 11954860.0, "step": 93 }, { "entropy": 1.1333434879779816, "epoch": 1.2074554294975688, "grad_norm": 0.10427077114582062, "learning_rate": 3.529753120609982e-05, "loss": 1.1275739669799805, "mean_token_accuracy": 0.6714382618665695, "num_tokens": 12084728.0, "step": 94 }, { "entropy": 1.1430685371160507, "epoch": 1.220421393841167, "grad_norm": 0.10981430858373642, "learning_rate": 3.497413378288541e-05, "loss": 1.1324477195739746, "mean_token_accuracy": 0.6704236418008804, "num_tokens": 12215214.0, "step": 95 }, { "entropy": 1.1366370916366577, "epoch": 1.233387358184765, "grad_norm": 0.10740207880735397, "learning_rate": 3.464873897488322e-05, "loss": 1.1347224712371826, "mean_token_accuracy": 0.6679130420088768, "num_tokens": 12345791.0, "step": 96 }, { "entropy": 1.1018346101045609, "epoch": 1.246353322528363, "grad_norm": 0.10746090114116669, "learning_rate": 3.432141194450772e-05, "loss": 1.0866354703903198, "mean_token_accuracy": 0.6808393970131874, "num_tokens": 12475633.0, "step": 97 }, { "entropy": 1.1090585142374039, "epoch": 1.2593192868719612, "grad_norm": 0.10877131670713425, "learning_rate": 3.39922182411134e-05, "loss": 1.1041377782821655, "mean_token_accuracy": 0.6753545328974724, "num_tokens": 12605177.0, "step": 98 }, { "entropy": 1.1077013164758682, "epoch": 1.2722852512155591, "grad_norm": 0.10926997661590576, "learning_rate": 3.3661223787868094e-05, "loss": 1.1172577142715454, "mean_token_accuracy": 0.6722195670008659, "num_tokens": 12735595.0, "step": 99 }, { "entropy": 1.1127658933401108, "epoch": 1.2852512155591573, "grad_norm": 0.10727502405643463, "learning_rate": 3.332849486855144e-05, "loss": 1.1174246072769165, "mean_token_accuracy": 0.6732314750552177, "num_tokens": 12865899.0, "step": 100 }, { "entropy": 1.0990982204675674, "epoch": 1.2982171799027553, "grad_norm": 0.10772087424993515, "learning_rate": 3.2994098114281134e-05, "loss": 1.1063733100891113, "mean_token_accuracy": 0.6763543859124184, "num_tokens": 12996509.0, "step": 101 }, { "entropy": 1.1201854348182678, "epoch": 1.3111831442463533, "grad_norm": 0.11184152215719223, "learning_rate": 3.265810049016959e-05, "loss": 1.1337658166885376, "mean_token_accuracy": 0.6663447916507721, "num_tokens": 13126367.0, "step": 102 }, { "entropy": 1.1044498831033707, "epoch": 1.3241491085899515, "grad_norm": 0.10385634750127792, "learning_rate": 3.232056928191376e-05, "loss": 1.1014032363891602, "mean_token_accuracy": 0.6749187037348747, "num_tokens": 13256160.0, "step": 103 }, { "entropy": 1.1139792203903198, "epoch": 1.3371150729335495, "grad_norm": 0.10617262125015259, "learning_rate": 3.1981572082320756e-05, "loss": 1.114381194114685, "mean_token_accuracy": 0.6730919182300568, "num_tokens": 13386686.0, "step": 104 }, { "entropy": 1.109263002872467, "epoch": 1.3500810372771475, "grad_norm": 0.10793962329626083, "learning_rate": 3.164117677777191e-05, "loss": 1.1114559173583984, "mean_token_accuracy": 0.6728995367884636, "num_tokens": 13517375.0, "step": 105 }, { "entropy": 1.1261898875236511, "epoch": 1.3630470016207457, "grad_norm": 0.11161792278289795, "learning_rate": 3.1299451534628135e-05, "loss": 1.1193037033081055, "mean_token_accuracy": 0.6697596535086632, "num_tokens": 13646394.0, "step": 106 }, { "entropy": 1.1466472148895264, "epoch": 1.3760129659643436, "grad_norm": 0.10738440603017807, "learning_rate": 3.0956464785579124e-05, "loss": 1.1412131786346436, "mean_token_accuracy": 0.6665833070874214, "num_tokens": 13773038.0, "step": 107 }, { "entropy": 1.1069310754537582, "epoch": 1.3889789303079416, "grad_norm": 0.10599587112665176, "learning_rate": 3.061228521593931e-05, "loss": 1.0983221530914307, "mean_token_accuracy": 0.674115814268589, "num_tokens": 13903468.0, "step": 108 }, { "entropy": 1.1233480125665665, "epoch": 1.4019448946515398, "grad_norm": 0.10892873257398605, "learning_rate": 3.0266981749893157e-05, "loss": 1.126780390739441, "mean_token_accuracy": 0.6726226657629013, "num_tokens": 14033787.0, "step": 109 }, { "entropy": 1.096241980791092, "epoch": 1.4149108589951378, "grad_norm": 0.10745301842689514, "learning_rate": 2.9920623536692638e-05, "loss": 1.1037087440490723, "mean_token_accuracy": 0.6748801171779633, "num_tokens": 14163916.0, "step": 110 }, { "entropy": 1.1101316660642624, "epoch": 1.4278768233387358, "grad_norm": 0.10952413827180862, "learning_rate": 2.9573279936809667e-05, "loss": 1.1070921421051025, "mean_token_accuracy": 0.6747486442327499, "num_tokens": 14294199.0, "step": 111 }, { "entropy": 1.0932272672653198, "epoch": 1.440842787682334, "grad_norm": 0.11039680987596512, "learning_rate": 2.9225020508046232e-05, "loss": 1.091570496559143, "mean_token_accuracy": 0.677759513258934, "num_tokens": 14424508.0, "step": 112 }, { "entropy": 1.1011270582675934, "epoch": 1.453808752025932, "grad_norm": 0.10966617614030838, "learning_rate": 2.8875914991604948e-05, "loss": 1.0965993404388428, "mean_token_accuracy": 0.6767654791474342, "num_tokens": 14555279.0, "step": 113 }, { "entropy": 1.121464490890503, "epoch": 1.46677471636953, "grad_norm": 0.1066274344921112, "learning_rate": 2.8526033298122985e-05, "loss": 1.1188894510269165, "mean_token_accuracy": 0.672943226993084, "num_tokens": 14685565.0, "step": 114 }, { "entropy": 1.1038088649511337, "epoch": 1.4797406807131281, "grad_norm": 0.10668732225894928, "learning_rate": 2.8175445493671972e-05, "loss": 1.1041887998580933, "mean_token_accuracy": 0.6750313937664032, "num_tokens": 14812759.0, "step": 115 }, { "entropy": 1.0958739817142487, "epoch": 1.4927066450567261, "grad_norm": 0.10686630755662918, "learning_rate": 2.782422178572682e-05, "loss": 1.0925776958465576, "mean_token_accuracy": 0.6785185039043427, "num_tokens": 14941000.0, "step": 116 }, { "entropy": 1.0849932879209518, "epoch": 1.505672609400324, "grad_norm": 0.11030446738004684, "learning_rate": 2.7472432509106248e-05, "loss": 1.089538812637329, "mean_token_accuracy": 0.6786462068557739, "num_tokens": 15070714.0, "step": 117 }, { "entropy": 1.0971782058477402, "epoch": 1.5186385737439223, "grad_norm": 0.10946783423423767, "learning_rate": 2.7120148111887732e-05, "loss": 1.1029260158538818, "mean_token_accuracy": 0.6733038946986198, "num_tokens": 15200961.0, "step": 118 }, { "entropy": 1.097448006272316, "epoch": 1.5316045380875203, "grad_norm": 0.11014755070209503, "learning_rate": 2.6767439141299865e-05, "loss": 1.108152151107788, "mean_token_accuracy": 0.6721945106983185, "num_tokens": 15331874.0, "step": 119 }, { "entropy": 1.0913252234458923, "epoch": 1.5445705024311183, "grad_norm": 0.11296916753053665, "learning_rate": 2.6414376229594813e-05, "loss": 1.0995609760284424, "mean_token_accuracy": 0.6765489876270294, "num_tokens": 15461994.0, "step": 120 }, { "entropy": 1.085170827805996, "epoch": 1.5575364667747165, "grad_norm": 0.10830508917570114, "learning_rate": 2.606103007990371e-05, "loss": 1.0883557796478271, "mean_token_accuracy": 0.6772569045424461, "num_tokens": 15590673.0, "step": 121 }, { "entropy": 1.1014840751886368, "epoch": 1.5705024311183144, "grad_norm": 0.10925617814064026, "learning_rate": 2.570747145207796e-05, "loss": 1.1025630235671997, "mean_token_accuracy": 0.6747682243585587, "num_tokens": 15719889.0, "step": 122 }, { "entropy": 1.1068747788667679, "epoch": 1.5834683954619124, "grad_norm": 0.11549171060323715, "learning_rate": 2.5353771148519057e-05, "loss": 1.0953247547149658, "mean_token_accuracy": 0.6782373338937759, "num_tokens": 15849490.0, "step": 123 }, { "entropy": 1.108807235956192, "epoch": 1.5964343598055106, "grad_norm": 0.11398264020681381, "learning_rate": 2.5e-05, "loss": 1.1013944149017334, "mean_token_accuracy": 0.6768676191568375, "num_tokens": 15976291.0, "step": 124 }, { "entropy": 1.1027465015649796, "epoch": 1.6094003241491086, "grad_norm": 0.10796625912189484, "learning_rate": 2.4646228851480956e-05, "loss": 1.104917049407959, "mean_token_accuracy": 0.6731575652956963, "num_tokens": 16106724.0, "step": 125 }, { "entropy": 1.1067415177822113, "epoch": 1.6223662884927066, "grad_norm": 0.1104840338230133, "learning_rate": 2.429252854792205e-05, "loss": 1.1054627895355225, "mean_token_accuracy": 0.6742062270641327, "num_tokens": 16234720.0, "step": 126 }, { "entropy": 1.0894858539104462, "epoch": 1.6353322528363048, "grad_norm": 0.10652334243059158, "learning_rate": 2.39389699200963e-05, "loss": 1.086952805519104, "mean_token_accuracy": 0.6782950535416603, "num_tokens": 16365259.0, "step": 127 }, { "entropy": 1.0954291075468063, "epoch": 1.6482982171799028, "grad_norm": 0.10658770799636841, "learning_rate": 2.358562377040519e-05, "loss": 1.0909897089004517, "mean_token_accuracy": 0.6780865713953972, "num_tokens": 16495495.0, "step": 128 }, { "entropy": 1.1093836724758148, "epoch": 1.6612641815235007, "grad_norm": 0.10828336328268051, "learning_rate": 2.3232560858700137e-05, "loss": 1.1097731590270996, "mean_token_accuracy": 0.6727545708417892, "num_tokens": 16626073.0, "step": 129 }, { "entropy": 1.0927350223064423, "epoch": 1.674230145867099, "grad_norm": 0.10621214658021927, "learning_rate": 2.287985188811228e-05, "loss": 1.0940251350402832, "mean_token_accuracy": 0.6761066913604736, "num_tokens": 16756555.0, "step": 130 }, { "entropy": 1.086726352572441, "epoch": 1.687196110210697, "grad_norm": 0.11290633678436279, "learning_rate": 2.2527567490893758e-05, "loss": 1.077509880065918, "mean_token_accuracy": 0.6806528195738792, "num_tokens": 16885995.0, "step": 131 }, { "entropy": 1.1018610298633575, "epoch": 1.700162074554295, "grad_norm": 0.10830546915531158, "learning_rate": 2.2175778214273185e-05, "loss": 1.0975083112716675, "mean_token_accuracy": 0.673214353621006, "num_tokens": 17016748.0, "step": 132 }, { "entropy": 1.0952757894992828, "epoch": 1.7131280388978931, "grad_norm": 0.10807640105485916, "learning_rate": 2.182455450632803e-05, "loss": 1.0957316160202026, "mean_token_accuracy": 0.6757252290844917, "num_tokens": 17146683.0, "step": 133 }, { "entropy": 1.0976209491491318, "epoch": 1.726094003241491, "grad_norm": 0.10800565779209137, "learning_rate": 2.1473966701877025e-05, "loss": 1.096419334411621, "mean_token_accuracy": 0.6746199205517769, "num_tokens": 17274973.0, "step": 134 }, { "entropy": 1.0751748234033585, "epoch": 1.739059967585089, "grad_norm": 0.10800585150718689, "learning_rate": 2.1124085008395054e-05, "loss": 1.0767910480499268, "mean_token_accuracy": 0.6789162456989288, "num_tokens": 17405875.0, "step": 135 }, { "entropy": 1.0925790071487427, "epoch": 1.7520259319286873, "grad_norm": 0.11018182337284088, "learning_rate": 2.0774979491953777e-05, "loss": 1.0945611000061035, "mean_token_accuracy": 0.6763977259397507, "num_tokens": 17536552.0, "step": 136 }, { "entropy": 1.0801940858364105, "epoch": 1.7649918962722853, "grad_norm": 0.11004664748907089, "learning_rate": 2.0426720063190335e-05, "loss": 1.0840024948120117, "mean_token_accuracy": 0.6795907840132713, "num_tokens": 17667084.0, "step": 137 }, { "entropy": 1.101774275302887, "epoch": 1.7779578606158832, "grad_norm": 0.11290085315704346, "learning_rate": 2.0079376463307368e-05, "loss": 1.1003146171569824, "mean_token_accuracy": 0.6725303083658218, "num_tokens": 17797154.0, "step": 138 }, { "entropy": 1.0876109898090363, "epoch": 1.7909238249594814, "grad_norm": 0.10923700779676437, "learning_rate": 1.973301825010685e-05, "loss": 1.0939981937408447, "mean_token_accuracy": 0.6761084944009781, "num_tokens": 17927623.0, "step": 139 }, { "entropy": 1.0950998067855835, "epoch": 1.8038897893030794, "grad_norm": 0.10761875659227371, "learning_rate": 1.9387714784060685e-05, "loss": 1.0969429016113281, "mean_token_accuracy": 0.6767537295818329, "num_tokens": 18057219.0, "step": 140 }, { "entropy": 1.0717721432447433, "epoch": 1.8168557536466774, "grad_norm": 0.10666397213935852, "learning_rate": 1.904353521442088e-05, "loss": 1.0674877166748047, "mean_token_accuracy": 0.6818057596683502, "num_tokens": 18187740.0, "step": 141 }, { "entropy": 1.0777895599603653, "epoch": 1.8298217179902756, "grad_norm": 0.10904243588447571, "learning_rate": 1.8700548465371874e-05, "loss": 1.0738530158996582, "mean_token_accuracy": 0.6809927076101303, "num_tokens": 18317756.0, "step": 142 }, { "entropy": 1.101785123348236, "epoch": 1.8427876823338736, "grad_norm": 0.10715875774621964, "learning_rate": 1.8358823222228097e-05, "loss": 1.0919270515441895, "mean_token_accuracy": 0.678776703774929, "num_tokens": 18447271.0, "step": 143 }, { "entropy": 1.0927452445030212, "epoch": 1.8557536466774716, "grad_norm": 0.10798949003219604, "learning_rate": 1.801842791767925e-05, "loss": 1.0860735177993774, "mean_token_accuracy": 0.6769154742360115, "num_tokens": 18575231.0, "step": 144 }, { "entropy": 1.0916397273540497, "epoch": 1.8687196110210698, "grad_norm": 0.10715705901384354, "learning_rate": 1.7679430718086243e-05, "loss": 1.0911304950714111, "mean_token_accuracy": 0.6768953427672386, "num_tokens": 18706048.0, "step": 145 }, { "entropy": 1.0951158255338669, "epoch": 1.8816855753646677, "grad_norm": 0.1076439917087555, "learning_rate": 1.7341899509830416e-05, "loss": 1.0997498035430908, "mean_token_accuracy": 0.6743926852941513, "num_tokens": 18835570.0, "step": 146 }, { "entropy": 1.0841081887483597, "epoch": 1.8946515397082657, "grad_norm": 0.10601551085710526, "learning_rate": 1.700590188571887e-05, "loss": 1.0836725234985352, "mean_token_accuracy": 0.6787150353193283, "num_tokens": 18965989.0, "step": 147 }, { "entropy": 1.0767425745725632, "epoch": 1.907617504051864, "grad_norm": 0.10804559290409088, "learning_rate": 1.667150513144856e-05, "loss": 1.0883257389068604, "mean_token_accuracy": 0.6779815703630447, "num_tokens": 19096708.0, "step": 148 }, { "entropy": 1.060413271188736, "epoch": 1.920583468395462, "grad_norm": 0.10727375745773315, "learning_rate": 1.633877621213192e-05, "loss": 1.0628106594085693, "mean_token_accuracy": 0.6838557049632072, "num_tokens": 19227293.0, "step": 149 }, { "entropy": 1.0897396057844162, "epoch": 1.9335494327390599, "grad_norm": 0.10783149302005768, "learning_rate": 1.6007781758886607e-05, "loss": 1.094234824180603, "mean_token_accuracy": 0.6787025779485703, "num_tokens": 19357895.0, "step": 150 }, { "entropy": 1.0884075164794922, "epoch": 1.946515397082658, "grad_norm": 0.10528931021690369, "learning_rate": 1.567858805549229e-05, "loss": 1.0923658609390259, "mean_token_accuracy": 0.6776427254080772, "num_tokens": 19488633.0, "step": 151 }, { "entropy": 1.0847600251436234, "epoch": 1.959481361426256, "grad_norm": 0.10627288371324539, "learning_rate": 1.535126102511678e-05, "loss": 1.0859086513519287, "mean_token_accuracy": 0.6780032217502594, "num_tokens": 19619364.0, "step": 152 }, { "entropy": 1.0796795934438705, "epoch": 1.972447325769854, "grad_norm": 0.10828571766614914, "learning_rate": 1.5025866217114592e-05, "loss": 1.0796010494232178, "mean_token_accuracy": 0.6792254149913788, "num_tokens": 19749912.0, "step": 153 }, { "entropy": 1.0738196671009064, "epoch": 1.9854132901134522, "grad_norm": 0.1061541959643364, "learning_rate": 1.4702468793900188e-05, "loss": 1.0770832300186157, "mean_token_accuracy": 0.68254254758358, "num_tokens": 19879298.0, "step": 154 }, { "entropy": 1.0984497964382172, "epoch": 1.9983792544570502, "grad_norm": 0.11212106049060822, "learning_rate": 1.4381133517898804e-05, "loss": 1.0974631309509277, "mean_token_accuracy": 0.6762187778949738, "num_tokens": 20010115.0, "step": 155 }, { "entropy": 1.0801098346710205, "epoch": 2.0, "grad_norm": 0.2994791865348816, "learning_rate": 1.4061924738577403e-05, "loss": 1.0866824388504028, "mean_token_accuracy": 0.6810408234596252, "num_tokens": 20018306.0, "step": 156 } ], "logging_steps": 1, "max_steps": 234, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.773824948630979e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }