A1plus_v4_qwq_e2 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
1a3966c verified
Raw
History Blame Contribute Delete
47.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 156,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.2914280891418457,
"epoch": 0.012965964343598054,
"grad_norm": 1.112913966178894,
"learning_rate": 0.0,
"loss": 2.1718008518218994,
"mean_token_accuracy": 0.5190608203411102,
"num_tokens": 130726.0,
"step": 1
},
{
"entropy": 1.2813172340393066,
"epoch": 0.02593192868719611,
"grad_norm": 1.0995973348617554,
"learning_rate": 4.166666666666667e-06,
"loss": 2.1320834159851074,
"mean_token_accuracy": 0.5265823230147362,
"num_tokens": 257394.0,
"step": 2
},
{
"entropy": 1.327770620584488,
"epoch": 0.03889789303079417,
"grad_norm": 0.9902980327606201,
"learning_rate": 8.333333333333334e-06,
"loss": 2.1106252670288086,
"mean_token_accuracy": 0.5237875208258629,
"num_tokens": 387496.0,
"step": 3
},
{
"entropy": 1.3719477504491806,
"epoch": 0.05186385737439222,
"grad_norm": 0.8683141469955444,
"learning_rate": 1.25e-05,
"loss": 2.0806920528411865,
"mean_token_accuracy": 0.526897743344307,
"num_tokens": 517915.0,
"step": 4
},
{
"entropy": 1.4400453567504883,
"epoch": 0.06482982171799027,
"grad_norm": 0.6660990715026855,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.9889618158340454,
"mean_token_accuracy": 0.5334466248750687,
"num_tokens": 648540.0,
"step": 5
},
{
"entropy": 1.5626330226659775,
"epoch": 0.07779578606158834,
"grad_norm": 0.5204595923423767,
"learning_rate": 2.0833333333333336e-05,
"loss": 1.9843950271606445,
"mean_token_accuracy": 0.5293373018503189,
"num_tokens": 779170.0,
"step": 6
},
{
"entropy": 1.6014426946640015,
"epoch": 0.09076175040518639,
"grad_norm": 0.3845070004463196,
"learning_rate": 2.5e-05,
"loss": 1.887692928314209,
"mean_token_accuracy": 0.5425543487071991,
"num_tokens": 909516.0,
"step": 7
},
{
"entropy": 1.6851050555706024,
"epoch": 0.10372771474878444,
"grad_norm": 0.30755460262298584,
"learning_rate": 2.916666666666667e-05,
"loss": 1.8439122438430786,
"mean_token_accuracy": 0.5476168766617775,
"num_tokens": 1039198.0,
"step": 8
},
{
"entropy": 1.7548235952854156,
"epoch": 0.1166936790923825,
"grad_norm": 0.26733461022377014,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.8185280561447144,
"mean_token_accuracy": 0.5502617135643959,
"num_tokens": 1169425.0,
"step": 9
},
{
"entropy": 1.7970841228961945,
"epoch": 0.12965964343598055,
"grad_norm": 0.26483356952667236,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.7471606731414795,
"mean_token_accuracy": 0.5560443699359894,
"num_tokens": 1299168.0,
"step": 10
},
{
"entropy": 1.8392730802297592,
"epoch": 0.1426256077795786,
"grad_norm": 0.2690557837486267,
"learning_rate": 4.166666666666667e-05,
"loss": 1.736329197883606,
"mean_token_accuracy": 0.5596349760890007,
"num_tokens": 1430062.0,
"step": 11
},
{
"entropy": 1.885682463645935,
"epoch": 0.15559157212317667,
"grad_norm": 0.2904511094093323,
"learning_rate": 4.5833333333333334e-05,
"loss": 1.7258615493774414,
"mean_token_accuracy": 0.5618793666362762,
"num_tokens": 1560442.0,
"step": 12
},
{
"entropy": 1.9065079540014267,
"epoch": 0.1685575364667747,
"grad_norm": 0.3055932819843292,
"learning_rate": 5e-05,
"loss": 1.709148645401001,
"mean_token_accuracy": 0.5631825849413872,
"num_tokens": 1687626.0,
"step": 13
},
{
"entropy": 1.8885795921087265,
"epoch": 0.18152350081037277,
"grad_norm": 0.31618642807006836,
"learning_rate": 4.9997496794168726e-05,
"loss": 1.6640710830688477,
"mean_token_accuracy": 0.5704818964004517,
"num_tokens": 1817839.0,
"step": 14
},
{
"entropy": 1.799900770187378,
"epoch": 0.19448946515397084,
"grad_norm": 0.28537100553512573,
"learning_rate": 4.998998767795805e-05,
"loss": 1.5893642902374268,
"mean_token_accuracy": 0.5844717845320702,
"num_tokens": 1947846.0,
"step": 15
},
{
"entropy": 1.7524273693561554,
"epoch": 0.20745542949756887,
"grad_norm": 0.25802257657051086,
"learning_rate": 4.9977474155117045e-05,
"loss": 1.57011079788208,
"mean_token_accuracy": 0.5896653309464455,
"num_tokens": 2078221.0,
"step": 16
},
{
"entropy": 1.709429755806923,
"epoch": 0.22042139384116693,
"grad_norm": 0.22759748995304108,
"learning_rate": 4.995995873155958e-05,
"loss": 1.5693228244781494,
"mean_token_accuracy": 0.5865247845649719,
"num_tokens": 2208236.0,
"step": 17
},
{
"entropy": 1.6319102048873901,
"epoch": 0.233387358184765,
"grad_norm": 0.19342641532421112,
"learning_rate": 4.99374449148625e-05,
"loss": 1.528588056564331,
"mean_token_accuracy": 0.5946438014507294,
"num_tokens": 2338245.0,
"step": 18
},
{
"entropy": 1.5404616594314575,
"epoch": 0.24635332252836303,
"grad_norm": 0.1698416769504547,
"learning_rate": 4.9909937213563165e-05,
"loss": 1.4880129098892212,
"mean_token_accuracy": 0.6007702648639679,
"num_tokens": 2467411.0,
"step": 19
},
{
"entropy": 1.5045948326587677,
"epoch": 0.2593192868719611,
"grad_norm": 0.1683117300271988,
"learning_rate": 4.987744113625665e-05,
"loss": 1.5048375129699707,
"mean_token_accuracy": 0.5982850342988968,
"num_tokens": 2598113.0,
"step": 20
},
{
"entropy": 1.4073765128850937,
"epoch": 0.27228525121555913,
"grad_norm": 0.19874629378318787,
"learning_rate": 4.9839963190492576e-05,
"loss": 1.456631064414978,
"mean_token_accuracy": 0.6086618900299072,
"num_tokens": 2728430.0,
"step": 21
},
{
"entropy": 1.3884904980659485,
"epoch": 0.2852512155591572,
"grad_norm": 0.21319466829299927,
"learning_rate": 4.979751088147192e-05,
"loss": 1.4507615566253662,
"mean_token_accuracy": 0.6082002520561218,
"num_tokens": 2858506.0,
"step": 22
},
{
"entropy": 1.3483813256025314,
"epoch": 0.29821717990275526,
"grad_norm": 0.23800760507583618,
"learning_rate": 4.975009271054409e-05,
"loss": 1.4227944612503052,
"mean_token_accuracy": 0.611847274005413,
"num_tokens": 2985950.0,
"step": 23
},
{
"entropy": 1.3535500168800354,
"epoch": 0.31118314424635335,
"grad_norm": 0.21581389009952545,
"learning_rate": 4.969771817350445e-05,
"loss": 1.4188156127929688,
"mean_token_accuracy": 0.6119491159915924,
"num_tokens": 3112407.0,
"step": 24
},
{
"entropy": 1.338183343410492,
"epoch": 0.3241491085899514,
"grad_norm": 0.19480355083942413,
"learning_rate": 4.9640397758692715e-05,
"loss": 1.3919925689697266,
"mean_token_accuracy": 0.6192305833101273,
"num_tokens": 3242148.0,
"step": 25
},
{
"entropy": 1.3593887984752655,
"epoch": 0.3371150729335494,
"grad_norm": 0.15354962646961212,
"learning_rate": 4.957814294489261e-05,
"loss": 1.3766716718673706,
"mean_token_accuracy": 0.6211562678217888,
"num_tokens": 3373129.0,
"step": 26
},
{
"entropy": 1.362599864602089,
"epoch": 0.3500810372771475,
"grad_norm": 0.13560850918293,
"learning_rate": 4.9510966199033174e-05,
"loss": 1.349892258644104,
"mean_token_accuracy": 0.6282063350081444,
"num_tokens": 3503490.0,
"step": 27
},
{
"entropy": 1.3730409890413284,
"epoch": 0.36304700162074555,
"grad_norm": 0.13365128636360168,
"learning_rate": 4.943888097369216e-05,
"loss": 1.3391973972320557,
"mean_token_accuracy": 0.6288642287254333,
"num_tokens": 3631734.0,
"step": 28
},
{
"entropy": 1.371128425002098,
"epoch": 0.3760129659643436,
"grad_norm": 0.14155763387680054,
"learning_rate": 4.936190170440208e-05,
"loss": 1.32077956199646,
"mean_token_accuracy": 0.6326342150568962,
"num_tokens": 3762573.0,
"step": 29
},
{
"entropy": 1.407492458820343,
"epoch": 0.3889789303079417,
"grad_norm": 0.14185482263565063,
"learning_rate": 4.928004380675941e-05,
"loss": 1.3511477708816528,
"mean_token_accuracy": 0.625172384083271,
"num_tokens": 3893064.0,
"step": 30
},
{
"entropy": 1.3961241841316223,
"epoch": 0.4019448946515397,
"grad_norm": 0.13855496048927307,
"learning_rate": 4.9193323673337476e-05,
"loss": 1.336405873298645,
"mean_token_accuracy": 0.6296647489070892,
"num_tokens": 4023676.0,
"step": 31
},
{
"entropy": 1.3903988599777222,
"epoch": 0.41491085899513774,
"grad_norm": 0.13400253653526306,
"learning_rate": 4.910175867040377e-05,
"loss": 1.3442656993865967,
"mean_token_accuracy": 0.627065122127533,
"num_tokens": 4153956.0,
"step": 32
},
{
"entropy": 1.351208671927452,
"epoch": 0.42787682333873583,
"grad_norm": 0.12610815465450287,
"learning_rate": 4.9005367134442235e-05,
"loss": 1.3147870302200317,
"mean_token_accuracy": 0.6329845190048218,
"num_tokens": 4283315.0,
"step": 33
},
{
"entropy": 1.3148349225521088,
"epoch": 0.44084278768233387,
"grad_norm": 0.11920498311519623,
"learning_rate": 4.890416836848127e-05,
"loss": 1.2881569862365723,
"mean_token_accuracy": 0.6375886723399162,
"num_tokens": 4414063.0,
"step": 34
},
{
"entropy": 1.3178757429122925,
"epoch": 0.4538087520259319,
"grad_norm": 0.11554136872291565,
"learning_rate": 4.8798182638228166e-05,
"loss": 1.3023653030395508,
"mean_token_accuracy": 0.635626994073391,
"num_tokens": 4542894.0,
"step": 35
},
{
"entropy": 1.2868364304304123,
"epoch": 0.46677471636953,
"grad_norm": 0.11724869906902313,
"learning_rate": 4.868743116801074e-05,
"loss": 1.276515245437622,
"mean_token_accuracy": 0.6388825476169586,
"num_tokens": 4673393.0,
"step": 36
},
{
"entropy": 1.3117478638887405,
"epoch": 0.47974068071312803,
"grad_norm": 0.11675813794136047,
"learning_rate": 4.857193613652711e-05,
"loss": 1.319561243057251,
"mean_token_accuracy": 0.6311607211828232,
"num_tokens": 4803020.0,
"step": 37
},
{
"entropy": 1.269007459282875,
"epoch": 0.49270664505672607,
"grad_norm": 0.11431621760129929,
"learning_rate": 4.845172067240415e-05,
"loss": 1.2735211849212646,
"mean_token_accuracy": 0.6423661559820175,
"num_tokens": 4932686.0,
"step": 38
},
{
"entropy": 1.2656036466360092,
"epoch": 0.5056726094003241,
"grad_norm": 0.11062812805175781,
"learning_rate": 4.8326808849565936e-05,
"loss": 1.265828251838684,
"mean_token_accuracy": 0.6441638022661209,
"num_tokens": 5062963.0,
"step": 39
},
{
"entropy": 1.27534119784832,
"epoch": 0.5186385737439222,
"grad_norm": 0.11323992908000946,
"learning_rate": 4.819722568241274e-05,
"loss": 1.281820297241211,
"mean_token_accuracy": 0.6388759091496468,
"num_tokens": 5192982.0,
"step": 40
},
{
"entropy": 1.2759585976600647,
"epoch": 0.5316045380875203,
"grad_norm": 0.11570397019386292,
"learning_rate": 4.806299712081172e-05,
"loss": 1.276839256286621,
"mean_token_accuracy": 0.6385012120008469,
"num_tokens": 5323413.0,
"step": 41
},
{
"entropy": 1.265689566731453,
"epoch": 0.5445705024311183,
"grad_norm": 0.10930497944355011,
"learning_rate": 4.792415004490034e-05,
"loss": 1.2645472288131714,
"mean_token_accuracy": 0.6423149555921555,
"num_tokens": 5454255.0,
"step": 42
},
{
"entropy": 1.254970133304596,
"epoch": 0.5575364667747164,
"grad_norm": 0.10787371546030045,
"learning_rate": 4.77807122597034e-05,
"loss": 1.2552263736724854,
"mean_token_accuracy": 0.6437231004238129,
"num_tokens": 5583881.0,
"step": 43
},
{
"entropy": 1.2431457936763763,
"epoch": 0.5705024311183144,
"grad_norm": 0.10893784463405609,
"learning_rate": 4.7632712489564926e-05,
"loss": 1.2408338785171509,
"mean_token_accuracy": 0.6460021436214447,
"num_tokens": 5714257.0,
"step": 44
},
{
"entropy": 1.228305697441101,
"epoch": 0.5834683954619124,
"grad_norm": 0.11218206584453583,
"learning_rate": 4.748018037239592e-05,
"loss": 1.2231602668762207,
"mean_token_accuracy": 0.6500201225280762,
"num_tokens": 5844960.0,
"step": 45
},
{
"entropy": 1.2626090496778488,
"epoch": 0.5964343598055105,
"grad_norm": 0.11627671867609024,
"learning_rate": 4.732314645373921e-05,
"loss": 1.2628517150878906,
"mean_token_accuracy": 0.6433948427438736,
"num_tokens": 5974432.0,
"step": 46
},
{
"entropy": 1.2499435395002365,
"epoch": 0.6094003241491086,
"grad_norm": 0.1064961850643158,
"learning_rate": 4.7161642180652464e-05,
"loss": 1.2429689168930054,
"mean_token_accuracy": 0.6463894993066788,
"num_tokens": 6105159.0,
"step": 47
},
{
"entropy": 1.2387475371360779,
"epoch": 0.6223662884927067,
"grad_norm": 0.1059798151254654,
"learning_rate": 4.699569989541074e-05,
"loss": 1.2348564863204956,
"mean_token_accuracy": 0.6485447883605957,
"num_tokens": 6234686.0,
"step": 48
},
{
"entropy": 1.230888694524765,
"epoch": 0.6353322528363047,
"grad_norm": 0.10563136637210846,
"learning_rate": 4.6825352829029705e-05,
"loss": 1.2326059341430664,
"mean_token_accuracy": 0.650854229927063,
"num_tokens": 6364713.0,
"step": 49
},
{
"entropy": 1.2304238229990005,
"epoch": 0.6482982171799028,
"grad_norm": 0.10895860940217972,
"learning_rate": 4.665063509461097e-05,
"loss": 1.2246171236038208,
"mean_token_accuracy": 0.6520287021994591,
"num_tokens": 6494067.0,
"step": 50
},
{
"entropy": 1.2349478155374527,
"epoch": 0.6612641815235009,
"grad_norm": 0.11149362474679947,
"learning_rate": 4.647158168051066e-05,
"loss": 1.2276027202606201,
"mean_token_accuracy": 0.6503733918070793,
"num_tokens": 6624643.0,
"step": 51
},
{
"entropy": 1.2219702452421188,
"epoch": 0.6742301458670988,
"grad_norm": 0.10449287295341492,
"learning_rate": 4.628822844333278e-05,
"loss": 1.2258139848709106,
"mean_token_accuracy": 0.6509344652295113,
"num_tokens": 6754416.0,
"step": 52
},
{
"entropy": 1.2058308869600296,
"epoch": 0.6871961102106969,
"grad_norm": 0.10380305349826813,
"learning_rate": 4.6100612100748765e-05,
"loss": 1.214524745941162,
"mean_token_accuracy": 0.6529537662863731,
"num_tokens": 6885227.0,
"step": 53
},
{
"entropy": 1.2204056680202484,
"epoch": 0.700162074554295,
"grad_norm": 0.10786499083042145,
"learning_rate": 4.59087702241444e-05,
"loss": 1.2236121892929077,
"mean_token_accuracy": 0.648014634847641,
"num_tokens": 7011809.0,
"step": 54
},
{
"entropy": 1.2288042306900024,
"epoch": 0.713128038897893,
"grad_norm": 0.1033908799290657,
"learning_rate": 4.571274123109606e-05,
"loss": 1.2249078750610352,
"mean_token_accuracy": 0.6486673802137375,
"num_tokens": 7141874.0,
"step": 55
},
{
"entropy": 1.1886361241340637,
"epoch": 0.7260940032414911,
"grad_norm": 0.10556555539369583,
"learning_rate": 4.551256437767719e-05,
"loss": 1.1965718269348145,
"mean_token_accuracy": 0.6559380367398262,
"num_tokens": 7272536.0,
"step": 56
},
{
"entropy": 1.1931221783161163,
"epoch": 0.7390599675850892,
"grad_norm": 0.10483699291944504,
"learning_rate": 4.530827975059715e-05,
"loss": 1.1899445056915283,
"mean_token_accuracy": 0.6578836813569069,
"num_tokens": 7402306.0,
"step": 57
},
{
"entropy": 1.2073332518339157,
"epoch": 0.7520259319286872,
"grad_norm": 0.10389534384012222,
"learning_rate": 4.5099928259173516e-05,
"loss": 1.2089029550552368,
"mean_token_accuracy": 0.6548937857151031,
"num_tokens": 7532812.0,
"step": 58
},
{
"entropy": 1.2048113197088242,
"epoch": 0.7649918962722853,
"grad_norm": 0.10125990211963654,
"learning_rate": 4.488755162713975e-05,
"loss": 1.2044589519500732,
"mean_token_accuracy": 0.6544741094112396,
"num_tokens": 7663455.0,
"step": 59
},
{
"entropy": 1.1779465079307556,
"epoch": 0.7779578606158833,
"grad_norm": 0.10293558984994888,
"learning_rate": 4.467119238428975e-05,
"loss": 1.1754040718078613,
"mean_token_accuracy": 0.6628620699048042,
"num_tokens": 7791205.0,
"step": 60
},
{
"entropy": 1.2144263088703156,
"epoch": 0.7909238249594813,
"grad_norm": 0.10379968583583832,
"learning_rate": 4.445089385796099e-05,
"loss": 1.2083706855773926,
"mean_token_accuracy": 0.6543944776058197,
"num_tokens": 7918409.0,
"step": 61
},
{
"entropy": 1.1998531073331833,
"epoch": 0.8038897893030794,
"grad_norm": 0.10215966403484344,
"learning_rate": 4.422670016435792e-05,
"loss": 1.1933221817016602,
"mean_token_accuracy": 0.6570570692420006,
"num_tokens": 8048417.0,
"step": 62
},
{
"entropy": 1.200714260339737,
"epoch": 0.8168557536466775,
"grad_norm": 0.100275419652462,
"learning_rate": 4.3998656199717435e-05,
"loss": 1.189272165298462,
"mean_token_accuracy": 0.6573792845010757,
"num_tokens": 8179053.0,
"step": 63
},
{
"entropy": 1.1872155517339706,
"epoch": 0.8298217179902755,
"grad_norm": 0.10071317106485367,
"learning_rate": 4.3766807631318106e-05,
"loss": 1.1810928583145142,
"mean_token_accuracy": 0.6583103537559509,
"num_tokens": 8309355.0,
"step": 64
},
{
"entropy": 1.1796019226312637,
"epoch": 0.8427876823338736,
"grad_norm": 0.10065017640590668,
"learning_rate": 4.353120088833501e-05,
"loss": 1.17380952835083,
"mean_token_accuracy": 0.6608408540487289,
"num_tokens": 8439678.0,
"step": 65
},
{
"entropy": 1.1712117940187454,
"epoch": 0.8557536466774717,
"grad_norm": 0.09942107647657394,
"learning_rate": 4.329188315254196e-05,
"loss": 1.1702531576156616,
"mean_token_accuracy": 0.6607685834169388,
"num_tokens": 8569426.0,
"step": 66
},
{
"entropy": 1.1880214363336563,
"epoch": 0.8687196110210696,
"grad_norm": 0.10245856642723083,
"learning_rate": 4.3048902348863116e-05,
"loss": 1.1839733123779297,
"mean_token_accuracy": 0.658528208732605,
"num_tokens": 8698056.0,
"step": 67
},
{
"entropy": 1.1805013716220856,
"epoch": 0.8816855753646677,
"grad_norm": 0.1010119840502739,
"learning_rate": 4.280230713577564e-05,
"loss": 1.179073452949524,
"mean_token_accuracy": 0.6590162664651871,
"num_tokens": 8828822.0,
"step": 68
},
{
"entropy": 1.1775793582201004,
"epoch": 0.8946515397082658,
"grad_norm": 0.10408595204353333,
"learning_rate": 4.255214689556557e-05,
"loss": 1.1802899837493896,
"mean_token_accuracy": 0.6601392850279808,
"num_tokens": 8958617.0,
"step": 69
},
{
"entropy": 1.1794121712446213,
"epoch": 0.9076175040518638,
"grad_norm": 0.10349196195602417,
"learning_rate": 4.229847172443866e-05,
"loss": 1.1859654188156128,
"mean_token_accuracy": 0.6571361273527145,
"num_tokens": 9089619.0,
"step": 70
},
{
"entropy": 1.1704782098531723,
"epoch": 0.9205834683954619,
"grad_norm": 0.10455135256052017,
"learning_rate": 4.204133242248832e-05,
"loss": 1.1761753559112549,
"mean_token_accuracy": 0.661134235560894,
"num_tokens": 9220349.0,
"step": 71
},
{
"entropy": 1.2045030444860458,
"epoch": 0.93354943273906,
"grad_norm": 0.10628621280193329,
"learning_rate": 4.1780780483522575e-05,
"loss": 1.1999099254608154,
"mean_token_accuracy": 0.6541163548827171,
"num_tokens": 9350922.0,
"step": 72
},
{
"entropy": 1.194443255662918,
"epoch": 0.946515397082658,
"grad_norm": 0.10347249358892441,
"learning_rate": 4.151686808475204e-05,
"loss": 1.191763162612915,
"mean_token_accuracy": 0.6565472781658173,
"num_tokens": 9479617.0,
"step": 73
},
{
"entropy": 1.1695558428764343,
"epoch": 0.9594813614262561,
"grad_norm": 0.1053929403424263,
"learning_rate": 4.1249648076341165e-05,
"loss": 1.17070472240448,
"mean_token_accuracy": 0.662074476480484,
"num_tokens": 9609933.0,
"step": 74
},
{
"entropy": 1.1687128692865372,
"epoch": 0.9724473257698542,
"grad_norm": 0.10350026190280914,
"learning_rate": 4.0979173970824626e-05,
"loss": 1.1742582321166992,
"mean_token_accuracy": 0.6614358499646187,
"num_tokens": 9740065.0,
"step": 75
},
{
"entropy": 1.1681682914495468,
"epoch": 0.9854132901134521,
"grad_norm": 0.10243335366249084,
"learning_rate": 4.070549993239106e-05,
"loss": 1.1658577919006348,
"mean_token_accuracy": 0.6637781262397766,
"num_tokens": 9870742.0,
"step": 76
},
{
"entropy": 1.1639882773160934,
"epoch": 0.9983792544570502,
"grad_norm": 0.10228604823350906,
"learning_rate": 4.0428680766036384e-05,
"loss": 1.1644949913024902,
"mean_token_accuracy": 0.6624981611967087,
"num_tokens": 10001320.0,
"step": 77
},
{
"entropy": 1.1632845401763916,
"epoch": 1.0,
"grad_norm": 0.2728025019168854,
"learning_rate": 4.0148771906588706e-05,
"loss": 1.1762704849243164,
"mean_token_accuracy": 0.6677740812301636,
"num_tokens": 10009153.0,
"step": 78
},
{
"entropy": 1.1636807769536972,
"epoch": 1.012965964343598,
"grad_norm": 0.10475616157054901,
"learning_rate": 3.986582940760717e-05,
"loss": 1.148669958114624,
"mean_token_accuracy": 0.6649533659219742,
"num_tokens": 10140011.0,
"step": 79
},
{
"entropy": 1.1557996571063995,
"epoch": 1.0259319286871962,
"grad_norm": 0.10492753237485886,
"learning_rate": 3.957990993015683e-05,
"loss": 1.1505277156829834,
"mean_token_accuracy": 0.6668093428015709,
"num_tokens": 10270495.0,
"step": 80
},
{
"entropy": 1.15270234644413,
"epoch": 1.0388978930307942,
"grad_norm": 0.11243247240781784,
"learning_rate": 3.929107073146197e-05,
"loss": 1.1362740993499756,
"mean_token_accuracy": 0.6668569073081017,
"num_tokens": 10399470.0,
"step": 81
},
{
"entropy": 1.1315193176269531,
"epoch": 1.0518638573743921,
"grad_norm": 0.10758878290653229,
"learning_rate": 3.899936965343989e-05,
"loss": 1.124503254890442,
"mean_token_accuracy": 0.6695496663451195,
"num_tokens": 10529305.0,
"step": 82
},
{
"entropy": 1.1181457191705704,
"epoch": 1.0648298217179903,
"grad_norm": 0.10492865741252899,
"learning_rate": 3.8704865111117746e-05,
"loss": 1.115187406539917,
"mean_token_accuracy": 0.6714175269007683,
"num_tokens": 10658946.0,
"step": 83
},
{
"entropy": 1.0976143777370453,
"epoch": 1.0777957860615883,
"grad_norm": 0.1108441948890686,
"learning_rate": 3.840761608093456e-05,
"loss": 1.1016005277633667,
"mean_token_accuracy": 0.6776464283466339,
"num_tokens": 10785329.0,
"step": 84
},
{
"entropy": 1.0979181677103043,
"epoch": 1.0907617504051863,
"grad_norm": 0.10647857189178467,
"learning_rate": 3.8107682088930794e-05,
"loss": 1.1082489490509033,
"mean_token_accuracy": 0.6754170134663582,
"num_tokens": 10915123.0,
"step": 85
},
{
"entropy": 1.116148591041565,
"epoch": 1.1037277147487845,
"grad_norm": 0.10859860479831696,
"learning_rate": 3.7805123198827857e-05,
"loss": 1.1278622150421143,
"mean_token_accuracy": 0.6695821657776833,
"num_tokens": 11045591.0,
"step": 86
},
{
"entropy": 1.1232954412698746,
"epoch": 1.1166936790923825,
"grad_norm": 0.11128611862659454,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.1274020671844482,
"mean_token_accuracy": 0.671474426984787,
"num_tokens": 11175412.0,
"step": 87
},
{
"entropy": 1.1286661922931671,
"epoch": 1.1296596434359805,
"grad_norm": 0.10658227652311325,
"learning_rate": 3.719237359534087e-05,
"loss": 1.1328142881393433,
"mean_token_accuracy": 0.6698684319853783,
"num_tokens": 11305669.0,
"step": 88
},
{
"entropy": 1.127964898943901,
"epoch": 1.1426256077795787,
"grad_norm": 0.1069759875535965,
"learning_rate": 3.688230558902725e-05,
"loss": 1.1221802234649658,
"mean_token_accuracy": 0.6720241084694862,
"num_tokens": 11433238.0,
"step": 89
},
{
"entropy": 1.1164967715740204,
"epoch": 1.1555915721231766,
"grad_norm": 0.1038687601685524,
"learning_rate": 3.656985807418248e-05,
"loss": 1.1091525554656982,
"mean_token_accuracy": 0.6741333156824112,
"num_tokens": 11563958.0,
"step": 90
},
{
"entropy": 1.119084969162941,
"epoch": 1.1685575364667746,
"grad_norm": 0.10730428993701935,
"learning_rate": 3.6255093620441834e-05,
"loss": 1.1172475814819336,
"mean_token_accuracy": 0.6720305904746056,
"num_tokens": 11694626.0,
"step": 91
},
{
"entropy": 1.1386660188436508,
"epoch": 1.1815235008103728,
"grad_norm": 0.11028113216161728,
"learning_rate": 3.593807526142261e-05,
"loss": 1.1373463869094849,
"mean_token_accuracy": 0.6680505573749542,
"num_tokens": 11824157.0,
"step": 92
},
{
"entropy": 1.128893181681633,
"epoch": 1.1944894651539708,
"grad_norm": 0.11066646128892899,
"learning_rate": 3.56188664821012e-05,
"loss": 1.1258357763290405,
"mean_token_accuracy": 0.6708294078707695,
"num_tokens": 11954860.0,
"step": 93
},
{
"entropy": 1.1333434879779816,
"epoch": 1.2074554294975688,
"grad_norm": 0.10427077114582062,
"learning_rate": 3.529753120609982e-05,
"loss": 1.1275739669799805,
"mean_token_accuracy": 0.6714382618665695,
"num_tokens": 12084728.0,
"step": 94
},
{
"entropy": 1.1430685371160507,
"epoch": 1.220421393841167,
"grad_norm": 0.10981430858373642,
"learning_rate": 3.497413378288541e-05,
"loss": 1.1324477195739746,
"mean_token_accuracy": 0.6704236418008804,
"num_tokens": 12215214.0,
"step": 95
},
{
"entropy": 1.1366370916366577,
"epoch": 1.233387358184765,
"grad_norm": 0.10740207880735397,
"learning_rate": 3.464873897488322e-05,
"loss": 1.1347224712371826,
"mean_token_accuracy": 0.6679130420088768,
"num_tokens": 12345791.0,
"step": 96
},
{
"entropy": 1.1018346101045609,
"epoch": 1.246353322528363,
"grad_norm": 0.10746090114116669,
"learning_rate": 3.432141194450772e-05,
"loss": 1.0866354703903198,
"mean_token_accuracy": 0.6808393970131874,
"num_tokens": 12475633.0,
"step": 97
},
{
"entropy": 1.1090585142374039,
"epoch": 1.2593192868719612,
"grad_norm": 0.10877131670713425,
"learning_rate": 3.39922182411134e-05,
"loss": 1.1041377782821655,
"mean_token_accuracy": 0.6753545328974724,
"num_tokens": 12605177.0,
"step": 98
},
{
"entropy": 1.1077013164758682,
"epoch": 1.2722852512155591,
"grad_norm": 0.10926997661590576,
"learning_rate": 3.3661223787868094e-05,
"loss": 1.1172577142715454,
"mean_token_accuracy": 0.6722195670008659,
"num_tokens": 12735595.0,
"step": 99
},
{
"entropy": 1.1127658933401108,
"epoch": 1.2852512155591573,
"grad_norm": 0.10727502405643463,
"learning_rate": 3.332849486855144e-05,
"loss": 1.1174246072769165,
"mean_token_accuracy": 0.6732314750552177,
"num_tokens": 12865899.0,
"step": 100
},
{
"entropy": 1.0990982204675674,
"epoch": 1.2982171799027553,
"grad_norm": 0.10772087424993515,
"learning_rate": 3.2994098114281134e-05,
"loss": 1.1063733100891113,
"mean_token_accuracy": 0.6763543859124184,
"num_tokens": 12996509.0,
"step": 101
},
{
"entropy": 1.1201854348182678,
"epoch": 1.3111831442463533,
"grad_norm": 0.11184152215719223,
"learning_rate": 3.265810049016959e-05,
"loss": 1.1337658166885376,
"mean_token_accuracy": 0.6663447916507721,
"num_tokens": 13126367.0,
"step": 102
},
{
"entropy": 1.1044498831033707,
"epoch": 1.3241491085899515,
"grad_norm": 0.10385634750127792,
"learning_rate": 3.232056928191376e-05,
"loss": 1.1014032363891602,
"mean_token_accuracy": 0.6749187037348747,
"num_tokens": 13256160.0,
"step": 103
},
{
"entropy": 1.1139792203903198,
"epoch": 1.3371150729335495,
"grad_norm": 0.10617262125015259,
"learning_rate": 3.1981572082320756e-05,
"loss": 1.114381194114685,
"mean_token_accuracy": 0.6730919182300568,
"num_tokens": 13386686.0,
"step": 104
},
{
"entropy": 1.109263002872467,
"epoch": 1.3500810372771475,
"grad_norm": 0.10793962329626083,
"learning_rate": 3.164117677777191e-05,
"loss": 1.1114559173583984,
"mean_token_accuracy": 0.6728995367884636,
"num_tokens": 13517375.0,
"step": 105
},
{
"entropy": 1.1261898875236511,
"epoch": 1.3630470016207457,
"grad_norm": 0.11161792278289795,
"learning_rate": 3.1299451534628135e-05,
"loss": 1.1193037033081055,
"mean_token_accuracy": 0.6697596535086632,
"num_tokens": 13646394.0,
"step": 106
},
{
"entropy": 1.1466472148895264,
"epoch": 1.3760129659643436,
"grad_norm": 0.10738440603017807,
"learning_rate": 3.0956464785579124e-05,
"loss": 1.1412131786346436,
"mean_token_accuracy": 0.6665833070874214,
"num_tokens": 13773038.0,
"step": 107
},
{
"entropy": 1.1069310754537582,
"epoch": 1.3889789303079416,
"grad_norm": 0.10599587112665176,
"learning_rate": 3.061228521593931e-05,
"loss": 1.0983221530914307,
"mean_token_accuracy": 0.674115814268589,
"num_tokens": 13903468.0,
"step": 108
},
{
"entropy": 1.1233480125665665,
"epoch": 1.4019448946515398,
"grad_norm": 0.10892873257398605,
"learning_rate": 3.0266981749893157e-05,
"loss": 1.126780390739441,
"mean_token_accuracy": 0.6726226657629013,
"num_tokens": 14033787.0,
"step": 109
},
{
"entropy": 1.096241980791092,
"epoch": 1.4149108589951378,
"grad_norm": 0.10745301842689514,
"learning_rate": 2.9920623536692638e-05,
"loss": 1.1037087440490723,
"mean_token_accuracy": 0.6748801171779633,
"num_tokens": 14163916.0,
"step": 110
},
{
"entropy": 1.1101316660642624,
"epoch": 1.4278768233387358,
"grad_norm": 0.10952413827180862,
"learning_rate": 2.9573279936809667e-05,
"loss": 1.1070921421051025,
"mean_token_accuracy": 0.6747486442327499,
"num_tokens": 14294199.0,
"step": 111
},
{
"entropy": 1.0932272672653198,
"epoch": 1.440842787682334,
"grad_norm": 0.11039680987596512,
"learning_rate": 2.9225020508046232e-05,
"loss": 1.091570496559143,
"mean_token_accuracy": 0.677759513258934,
"num_tokens": 14424508.0,
"step": 112
},
{
"entropy": 1.1011270582675934,
"epoch": 1.453808752025932,
"grad_norm": 0.10966617614030838,
"learning_rate": 2.8875914991604948e-05,
"loss": 1.0965993404388428,
"mean_token_accuracy": 0.6767654791474342,
"num_tokens": 14555279.0,
"step": 113
},
{
"entropy": 1.121464490890503,
"epoch": 1.46677471636953,
"grad_norm": 0.1066274344921112,
"learning_rate": 2.8526033298122985e-05,
"loss": 1.1188894510269165,
"mean_token_accuracy": 0.672943226993084,
"num_tokens": 14685565.0,
"step": 114
},
{
"entropy": 1.1038088649511337,
"epoch": 1.4797406807131281,
"grad_norm": 0.10668732225894928,
"learning_rate": 2.8175445493671972e-05,
"loss": 1.1041887998580933,
"mean_token_accuracy": 0.6750313937664032,
"num_tokens": 14812759.0,
"step": 115
},
{
"entropy": 1.0958739817142487,
"epoch": 1.4927066450567261,
"grad_norm": 0.10686630755662918,
"learning_rate": 2.782422178572682e-05,
"loss": 1.0925776958465576,
"mean_token_accuracy": 0.6785185039043427,
"num_tokens": 14941000.0,
"step": 116
},
{
"entropy": 1.0849932879209518,
"epoch": 1.505672609400324,
"grad_norm": 0.11030446738004684,
"learning_rate": 2.7472432509106248e-05,
"loss": 1.089538812637329,
"mean_token_accuracy": 0.6786462068557739,
"num_tokens": 15070714.0,
"step": 117
},
{
"entropy": 1.0971782058477402,
"epoch": 1.5186385737439223,
"grad_norm": 0.10946783423423767,
"learning_rate": 2.7120148111887732e-05,
"loss": 1.1029260158538818,
"mean_token_accuracy": 0.6733038946986198,
"num_tokens": 15200961.0,
"step": 118
},
{
"entropy": 1.097448006272316,
"epoch": 1.5316045380875203,
"grad_norm": 0.11014755070209503,
"learning_rate": 2.6767439141299865e-05,
"loss": 1.108152151107788,
"mean_token_accuracy": 0.6721945106983185,
"num_tokens": 15331874.0,
"step": 119
},
{
"entropy": 1.0913252234458923,
"epoch": 1.5445705024311183,
"grad_norm": 0.11296916753053665,
"learning_rate": 2.6414376229594813e-05,
"loss": 1.0995609760284424,
"mean_token_accuracy": 0.6765489876270294,
"num_tokens": 15461994.0,
"step": 120
},
{
"entropy": 1.085170827805996,
"epoch": 1.5575364667747165,
"grad_norm": 0.10830508917570114,
"learning_rate": 2.606103007990371e-05,
"loss": 1.0883557796478271,
"mean_token_accuracy": 0.6772569045424461,
"num_tokens": 15590673.0,
"step": 121
},
{
"entropy": 1.1014840751886368,
"epoch": 1.5705024311183144,
"grad_norm": 0.10925617814064026,
"learning_rate": 2.570747145207796e-05,
"loss": 1.1025630235671997,
"mean_token_accuracy": 0.6747682243585587,
"num_tokens": 15719889.0,
"step": 122
},
{
"entropy": 1.1068747788667679,
"epoch": 1.5834683954619124,
"grad_norm": 0.11549171060323715,
"learning_rate": 2.5353771148519057e-05,
"loss": 1.0953247547149658,
"mean_token_accuracy": 0.6782373338937759,
"num_tokens": 15849490.0,
"step": 123
},
{
"entropy": 1.108807235956192,
"epoch": 1.5964343598055106,
"grad_norm": 0.11398264020681381,
"learning_rate": 2.5e-05,
"loss": 1.1013944149017334,
"mean_token_accuracy": 0.6768676191568375,
"num_tokens": 15976291.0,
"step": 124
},
{
"entropy": 1.1027465015649796,
"epoch": 1.6094003241491086,
"grad_norm": 0.10796625912189484,
"learning_rate": 2.4646228851480956e-05,
"loss": 1.104917049407959,
"mean_token_accuracy": 0.6731575652956963,
"num_tokens": 16106724.0,
"step": 125
},
{
"entropy": 1.1067415177822113,
"epoch": 1.6223662884927066,
"grad_norm": 0.1104840338230133,
"learning_rate": 2.429252854792205e-05,
"loss": 1.1054627895355225,
"mean_token_accuracy": 0.6742062270641327,
"num_tokens": 16234720.0,
"step": 126
},
{
"entropy": 1.0894858539104462,
"epoch": 1.6353322528363048,
"grad_norm": 0.10652334243059158,
"learning_rate": 2.39389699200963e-05,
"loss": 1.086952805519104,
"mean_token_accuracy": 0.6782950535416603,
"num_tokens": 16365259.0,
"step": 127
},
{
"entropy": 1.0954291075468063,
"epoch": 1.6482982171799028,
"grad_norm": 0.10658770799636841,
"learning_rate": 2.358562377040519e-05,
"loss": 1.0909897089004517,
"mean_token_accuracy": 0.6780865713953972,
"num_tokens": 16495495.0,
"step": 128
},
{
"entropy": 1.1093836724758148,
"epoch": 1.6612641815235007,
"grad_norm": 0.10828336328268051,
"learning_rate": 2.3232560858700137e-05,
"loss": 1.1097731590270996,
"mean_token_accuracy": 0.6727545708417892,
"num_tokens": 16626073.0,
"step": 129
},
{
"entropy": 1.0927350223064423,
"epoch": 1.674230145867099,
"grad_norm": 0.10621214658021927,
"learning_rate": 2.287985188811228e-05,
"loss": 1.0940251350402832,
"mean_token_accuracy": 0.6761066913604736,
"num_tokens": 16756555.0,
"step": 130
},
{
"entropy": 1.086726352572441,
"epoch": 1.687196110210697,
"grad_norm": 0.11290633678436279,
"learning_rate": 2.2527567490893758e-05,
"loss": 1.077509880065918,
"mean_token_accuracy": 0.6806528195738792,
"num_tokens": 16885995.0,
"step": 131
},
{
"entropy": 1.1018610298633575,
"epoch": 1.700162074554295,
"grad_norm": 0.10830546915531158,
"learning_rate": 2.2175778214273185e-05,
"loss": 1.0975083112716675,
"mean_token_accuracy": 0.673214353621006,
"num_tokens": 17016748.0,
"step": 132
},
{
"entropy": 1.0952757894992828,
"epoch": 1.7131280388978931,
"grad_norm": 0.10807640105485916,
"learning_rate": 2.182455450632803e-05,
"loss": 1.0957316160202026,
"mean_token_accuracy": 0.6757252290844917,
"num_tokens": 17146683.0,
"step": 133
},
{
"entropy": 1.0976209491491318,
"epoch": 1.726094003241491,
"grad_norm": 0.10800565779209137,
"learning_rate": 2.1473966701877025e-05,
"loss": 1.096419334411621,
"mean_token_accuracy": 0.6746199205517769,
"num_tokens": 17274973.0,
"step": 134
},
{
"entropy": 1.0751748234033585,
"epoch": 1.739059967585089,
"grad_norm": 0.10800585150718689,
"learning_rate": 2.1124085008395054e-05,
"loss": 1.0767910480499268,
"mean_token_accuracy": 0.6789162456989288,
"num_tokens": 17405875.0,
"step": 135
},
{
"entropy": 1.0925790071487427,
"epoch": 1.7520259319286873,
"grad_norm": 0.11018182337284088,
"learning_rate": 2.0774979491953777e-05,
"loss": 1.0945611000061035,
"mean_token_accuracy": 0.6763977259397507,
"num_tokens": 17536552.0,
"step": 136
},
{
"entropy": 1.0801940858364105,
"epoch": 1.7649918962722853,
"grad_norm": 0.11004664748907089,
"learning_rate": 2.0426720063190335e-05,
"loss": 1.0840024948120117,
"mean_token_accuracy": 0.6795907840132713,
"num_tokens": 17667084.0,
"step": 137
},
{
"entropy": 1.101774275302887,
"epoch": 1.7779578606158832,
"grad_norm": 0.11290085315704346,
"learning_rate": 2.0079376463307368e-05,
"loss": 1.1003146171569824,
"mean_token_accuracy": 0.6725303083658218,
"num_tokens": 17797154.0,
"step": 138
},
{
"entropy": 1.0876109898090363,
"epoch": 1.7909238249594814,
"grad_norm": 0.10923700779676437,
"learning_rate": 1.973301825010685e-05,
"loss": 1.0939981937408447,
"mean_token_accuracy": 0.6761084944009781,
"num_tokens": 17927623.0,
"step": 139
},
{
"entropy": 1.0950998067855835,
"epoch": 1.8038897893030794,
"grad_norm": 0.10761875659227371,
"learning_rate": 1.9387714784060685e-05,
"loss": 1.0969429016113281,
"mean_token_accuracy": 0.6767537295818329,
"num_tokens": 18057219.0,
"step": 140
},
{
"entropy": 1.0717721432447433,
"epoch": 1.8168557536466774,
"grad_norm": 0.10666397213935852,
"learning_rate": 1.904353521442088e-05,
"loss": 1.0674877166748047,
"mean_token_accuracy": 0.6818057596683502,
"num_tokens": 18187740.0,
"step": 141
},
{
"entropy": 1.0777895599603653,
"epoch": 1.8298217179902756,
"grad_norm": 0.10904243588447571,
"learning_rate": 1.8700548465371874e-05,
"loss": 1.0738530158996582,
"mean_token_accuracy": 0.6809927076101303,
"num_tokens": 18317756.0,
"step": 142
},
{
"entropy": 1.101785123348236,
"epoch": 1.8427876823338736,
"grad_norm": 0.10715875774621964,
"learning_rate": 1.8358823222228097e-05,
"loss": 1.0919270515441895,
"mean_token_accuracy": 0.678776703774929,
"num_tokens": 18447271.0,
"step": 143
},
{
"entropy": 1.0927452445030212,
"epoch": 1.8557536466774716,
"grad_norm": 0.10798949003219604,
"learning_rate": 1.801842791767925e-05,
"loss": 1.0860735177993774,
"mean_token_accuracy": 0.6769154742360115,
"num_tokens": 18575231.0,
"step": 144
},
{
"entropy": 1.0916397273540497,
"epoch": 1.8687196110210698,
"grad_norm": 0.10715705901384354,
"learning_rate": 1.7679430718086243e-05,
"loss": 1.0911304950714111,
"mean_token_accuracy": 0.6768953427672386,
"num_tokens": 18706048.0,
"step": 145
},
{
"entropy": 1.0951158255338669,
"epoch": 1.8816855753646677,
"grad_norm": 0.1076439917087555,
"learning_rate": 1.7341899509830416e-05,
"loss": 1.0997498035430908,
"mean_token_accuracy": 0.6743926852941513,
"num_tokens": 18835570.0,
"step": 146
},
{
"entropy": 1.0841081887483597,
"epoch": 1.8946515397082657,
"grad_norm": 0.10601551085710526,
"learning_rate": 1.700590188571887e-05,
"loss": 1.0836725234985352,
"mean_token_accuracy": 0.6787150353193283,
"num_tokens": 18965989.0,
"step": 147
},
{
"entropy": 1.0767425745725632,
"epoch": 1.907617504051864,
"grad_norm": 0.10804559290409088,
"learning_rate": 1.667150513144856e-05,
"loss": 1.0883257389068604,
"mean_token_accuracy": 0.6779815703630447,
"num_tokens": 19096708.0,
"step": 148
},
{
"entropy": 1.060413271188736,
"epoch": 1.920583468395462,
"grad_norm": 0.10727375745773315,
"learning_rate": 1.633877621213192e-05,
"loss": 1.0628106594085693,
"mean_token_accuracy": 0.6838557049632072,
"num_tokens": 19227293.0,
"step": 149
},
{
"entropy": 1.0897396057844162,
"epoch": 1.9335494327390599,
"grad_norm": 0.10783149302005768,
"learning_rate": 1.6007781758886607e-05,
"loss": 1.094234824180603,
"mean_token_accuracy": 0.6787025779485703,
"num_tokens": 19357895.0,
"step": 150
},
{
"entropy": 1.0884075164794922,
"epoch": 1.946515397082658,
"grad_norm": 0.10528931021690369,
"learning_rate": 1.567858805549229e-05,
"loss": 1.0923658609390259,
"mean_token_accuracy": 0.6776427254080772,
"num_tokens": 19488633.0,
"step": 151
},
{
"entropy": 1.0847600251436234,
"epoch": 1.959481361426256,
"grad_norm": 0.10627288371324539,
"learning_rate": 1.535126102511678e-05,
"loss": 1.0859086513519287,
"mean_token_accuracy": 0.6780032217502594,
"num_tokens": 19619364.0,
"step": 152
},
{
"entropy": 1.0796795934438705,
"epoch": 1.972447325769854,
"grad_norm": 0.10828571766614914,
"learning_rate": 1.5025866217114592e-05,
"loss": 1.0796010494232178,
"mean_token_accuracy": 0.6792254149913788,
"num_tokens": 19749912.0,
"step": 153
},
{
"entropy": 1.0738196671009064,
"epoch": 1.9854132901134522,
"grad_norm": 0.1061541959643364,
"learning_rate": 1.4702468793900188e-05,
"loss": 1.0770832300186157,
"mean_token_accuracy": 0.68254254758358,
"num_tokens": 19879298.0,
"step": 154
},
{
"entropy": 1.0984497964382172,
"epoch": 1.9983792544570502,
"grad_norm": 0.11212106049060822,
"learning_rate": 1.4381133517898804e-05,
"loss": 1.0974631309509277,
"mean_token_accuracy": 0.6762187778949738,
"num_tokens": 20010115.0,
"step": 155
},
{
"entropy": 1.0801098346710205,
"epoch": 2.0,
"grad_norm": 0.2994791865348816,
"learning_rate": 1.4061924738577403e-05,
"loss": 1.0866824388504028,
"mean_token_accuracy": 0.6810408234596252,
"num_tokens": 20018306.0,
"step": 156
}
],
"logging_steps": 1,
"max_steps": 234,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.773824948630979e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}