cryptobiosis's picture
Publish sanitized Stage 2 SFT1000 release
dc75d2b verified
Raw
History Blame Contribute Delete
27.6 kB
{
"max_steps": 88,
"save_steps": 22,
"is_world_process_zero": true,
"train_batch_size": 1,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"is_hyper_param_search": false,
"num_input_tokens_seen": 0,
"log_history": [
{
"entropy": 0.571594450622797,
"epoch": 0.022857142857142857,
"grad_norm": 2.03125,
"learning_rate": 0.0,
"loss": 1.892868161201477,
"mean_token_accuracy": 0.6494692210108042,
"num_tokens": 28665.0,
"step": 1
},
{
"entropy": 0.5400022976100445,
"epoch": 0.045714285714285714,
"grad_norm": 1.953125,
"learning_rate": 5e-05,
"loss": 1.3431090116500854,
"mean_token_accuracy": 0.6841957792639732,
"num_tokens": 56298.0,
"step": 2
},
{
"entropy": 0.5547708570957184,
"epoch": 0.06857142857142857,
"grad_norm": 2.046875,
"learning_rate": 0.0001,
"loss": 1.7731074094772339,
"mean_token_accuracy": 0.6730335894972086,
"num_tokens": 87134.0,
"step": 3
},
{
"entropy": 0.6138171833008528,
"epoch": 0.09142857142857143,
"grad_norm": 1.890625,
"learning_rate": 0.00015000000000000001,
"loss": 1.6849099397659302,
"mean_token_accuracy": 0.7163603082299232,
"num_tokens": 110491.0,
"step": 4
},
{
"entropy": 0.713952723890543,
"epoch": 0.11428571428571428,
"grad_norm": 1.609375,
"learning_rate": 0.0002,
"loss": 1.6369731426239014,
"mean_token_accuracy": 0.6762979347258806,
"num_tokens": 138858.0,
"step": 5
},
{
"entropy": 0.9489956572651863,
"epoch": 0.13714285714285715,
"grad_norm": 1.609375,
"learning_rate": 0.00019993007047883988,
"loss": 1.6043992042541504,
"mean_token_accuracy": 0.6542574372142553,
"num_tokens": 164666.0,
"step": 6
},
{
"entropy": 1.2052904553711414,
"epoch": 0.16,
"grad_norm": 2.046875,
"learning_rate": 0.00019972037971811802,
"loss": 1.1030031442642212,
"mean_token_accuracy": 0.7115810438990593,
"num_tokens": 198168.0,
"step": 7
},
{
"entropy": 1.5162354111671448,
"epoch": 0.18285714285714286,
"grad_norm": 2.609375,
"learning_rate": 0.00019937122098932428,
"loss": 1.338626503944397,
"mean_token_accuracy": 0.7028692364692688,
"num_tokens": 229142.0,
"step": 8
},
{
"entropy": 1.6831717118620872,
"epoch": 0.2057142857142857,
"grad_norm": 1.203125,
"learning_rate": 0.00019888308262251285,
"loss": 1.5491583347320557,
"mean_token_accuracy": 0.669173551723361,
"num_tokens": 257334.0,
"step": 9
},
{
"entropy": 1.2227612249553204,
"epoch": 0.22857142857142856,
"grad_norm": 0.6328125,
"learning_rate": 0.00019825664732332884,
"loss": 1.0137903690338135,
"mean_token_accuracy": 0.7204974591732025,
"num_tokens": 286904.0,
"step": 10
},
{
"entropy": 1.1638432145118713,
"epoch": 0.25142857142857145,
"grad_norm": 0.83984375,
"learning_rate": 0.00019749279121818235,
"loss": 1.0442439317703247,
"mean_token_accuracy": 0.7225705273449421,
"num_tokens": 313566.0,
"step": 11
},
{
"entropy": 1.090791016817093,
"epoch": 0.2742857142857143,
"grad_norm": 0.75,
"learning_rate": 0.00019659258262890683,
"loss": 1.2202626466751099,
"mean_token_accuracy": 0.6869607474654913,
"num_tokens": 343912.0,
"step": 12
},
{
"entropy": 1.100559327751398,
"epoch": 0.29714285714285715,
"grad_norm": 0.73046875,
"learning_rate": 0.0001955572805786141,
"loss": 1.4237300157546997,
"mean_token_accuracy": 0.7026770114898682,
"num_tokens": 367824.0,
"step": 13
},
{
"entropy": 1.0772063918411732,
"epoch": 0.32,
"grad_norm": 0.734375,
"learning_rate": 0.00019438833303083678,
"loss": 1.3612886667251587,
"mean_token_accuracy": 0.7167600486427546,
"num_tokens": 397629.0,
"step": 14
},
{
"entropy": 1.0418964736163616,
"epoch": 0.34285714285714286,
"grad_norm": 0.76171875,
"learning_rate": 0.00019308737486442045,
"loss": 1.2377914190292358,
"mean_token_accuracy": 0.7337369881570339,
"num_tokens": 426172.0,
"step": 15
},
{
"entropy": 1.02627420052886,
"epoch": 0.3657142857142857,
"grad_norm": 0.640625,
"learning_rate": 0.00019165622558699763,
"loss": 1.043224811553955,
"mean_token_accuracy": 0.757489874958992,
"num_tokens": 455884.0,
"step": 16
},
{
"entropy": 1.0985115952789783,
"epoch": 0.38857142857142857,
"grad_norm": 0.75390625,
"learning_rate": 0.0001900968867902419,
"loss": 1.0292891263961792,
"mean_token_accuracy": 0.7834405265748501,
"num_tokens": 479943.0,
"step": 17
},
{
"entropy": 0.9926935620605946,
"epoch": 0.4114285714285714,
"grad_norm": 0.5234375,
"learning_rate": 0.00018841153935046098,
"loss": 1.0027269124984741,
"mean_token_accuracy": 0.7445859499275684,
"num_tokens": 512401.0,
"step": 18
},
{
"entropy": 1.184921432286501,
"epoch": 0.4342857142857143,
"grad_norm": 0.6953125,
"learning_rate": 0.00018660254037844388,
"loss": 0.8860166072845459,
"mean_token_accuracy": 0.7711772620677948,
"num_tokens": 532314.0,
"step": 19
},
{
"entropy": 1.0456415861845016,
"epoch": 0.45714285714285713,
"grad_norm": 0.578125,
"learning_rate": 0.00018467241992282843,
"loss": 0.821132242679596,
"mean_token_accuracy": 0.7591653987765312,
"num_tokens": 560611.0,
"step": 20
},
{
"entropy": 1.0742540583014488,
"epoch": 0.48,
"grad_norm": 0.6640625,
"learning_rate": 0.0001826238774315995,
"loss": 1.1304452419281006,
"mean_token_accuracy": 0.7381897754967213,
"num_tokens": 582239.0,
"step": 21
},
{
"entropy": 1.0069492012262344,
"epoch": 0.5028571428571429,
"grad_norm": 0.83203125,
"learning_rate": 0.00018045977797666684,
"loss": 1.0569063425064087,
"mean_token_accuracy": 0.7475782930850983,
"num_tokens": 605785.0,
"step": 22
},
{
"epoch": 0.5028571428571429,
"eval_entropy": 1.0555952689051629,
"eval_loss": 1.0447686910629272,
"eval_mean_token_accuracy": 0.75280682772398,
"eval_num_tokens": 605785.0,
"eval_runtime": 77.2364,
"eval_samples_per_second": 1.295,
"eval_steps_per_second": 1.295,
"step": 22
},
{
"entropy": 1.0209653116762638,
"epoch": 0.5257142857142857,
"grad_norm": 0.6953125,
"learning_rate": 0.000178183148246803,
"loss": 0.9215176105499268,
"mean_token_accuracy": 0.7393636666238308,
"num_tokens": 630668.0,
"step": 23
},
{
"entropy": 1.1484412215650082,
"epoch": 0.5485714285714286,
"grad_norm": 0.63671875,
"learning_rate": 0.0001757971723145453,
"loss": 1.0585880279541016,
"mean_token_accuracy": 0.6772188358008862,
"num_tokens": 651568.0,
"step": 24
},
{
"entropy": 1.022590946406126,
"epoch": 0.5714285714285714,
"grad_norm": 0.6640625,
"learning_rate": 0.00017330518718298264,
"loss": 0.8019014596939087,
"mean_token_accuracy": 0.7844364829361439,
"num_tokens": 677010.0,
"step": 25
},
{
"entropy": 1.1501350328326225,
"epoch": 0.5942857142857143,
"grad_norm": 0.578125,
"learning_rate": 0.00017071067811865476,
"loss": 1.1763538122177124,
"mean_token_accuracy": 0.7165477126836777,
"num_tokens": 699559.0,
"step": 26
},
{
"entropy": 1.1520305536687374,
"epoch": 0.6171428571428571,
"grad_norm": 0.84765625,
"learning_rate": 0.00016801727377709194,
"loss": 1.3568904399871826,
"mean_token_accuracy": 0.7278081495314837,
"num_tokens": 723860.0,
"step": 27
},
{
"entropy": 1.1409958936274052,
"epoch": 0.64,
"grad_norm": 0.73828125,
"learning_rate": 0.00016522874112781213,
"loss": 1.2788770198822021,
"mean_token_accuracy": 0.688488058745861,
"num_tokens": 743869.0,
"step": 28
},
{
"entropy": 1.06721768155694,
"epoch": 0.6628571428571428,
"grad_norm": 0.796875,
"learning_rate": 0.00016234898018587337,
"loss": 0.9878795742988586,
"mean_token_accuracy": 0.7843082323670387,
"num_tokens": 767668.0,
"step": 29
},
{
"entropy": 0.9738106857985258,
"epoch": 0.6857142857142857,
"grad_norm": 0.578125,
"learning_rate": 0.00015938201855735014,
"loss": 0.7424539923667908,
"mean_token_accuracy": 0.7907082177698612,
"num_tokens": 796481.0,
"step": 30
},
{
"entropy": 0.9771843180060387,
"epoch": 0.7085714285714285,
"grad_norm": 0.75,
"learning_rate": 0.0001563320058063622,
"loss": 0.9626051187515259,
"mean_token_accuracy": 0.7523193173110485,
"num_tokens": 829764.0,
"step": 31
},
{
"entropy": 1.151510078459978,
"epoch": 0.7314285714285714,
"grad_norm": 0.78125,
"learning_rate": 0.00015320320765153367,
"loss": 1.270058512687683,
"mean_token_accuracy": 0.6807492543011904,
"num_tokens": 855562.0,
"step": 32
},
{
"entropy": 0.9595269281417131,
"epoch": 0.7542857142857143,
"grad_norm": 0.5625,
"learning_rate": 0.00015000000000000001,
"loss": 0.9262505173683167,
"mean_token_accuracy": 0.7448003850877285,
"num_tokens": 886448.0,
"step": 33
},
{
"entropy": 0.9837835170328617,
"epoch": 0.7771428571428571,
"grad_norm": 0.82421875,
"learning_rate": 0.0001467268628273062,
"loss": 0.7896201014518738,
"mean_token_accuracy": 0.7692355290055275,
"num_tokens": 909179.0,
"step": 34
},
{
"entropy": 1.0101780369877815,
"epoch": 0.8,
"grad_norm": 0.9375,
"learning_rate": 0.00014338837391175582,
"loss": 1.1079224348068237,
"mean_token_accuracy": 0.743992704898119,
"num_tokens": 932293.0,
"step": 35
},
{
"entropy": 1.124088928103447,
"epoch": 0.8228571428571428,
"grad_norm": 0.84375,
"learning_rate": 0.00013998920243197407,
"loss": 1.2773886919021606,
"mean_token_accuracy": 0.7306922785937786,
"num_tokens": 953785.0,
"step": 36
},
{
"entropy": 1.0273678377270699,
"epoch": 0.8457142857142858,
"grad_norm": 0.765625,
"learning_rate": 0.00013653410243663952,
"loss": 1.0014641284942627,
"mean_token_accuracy": 0.7343494817614555,
"num_tokens": 983541.0,
"step": 37
},
{
"entropy": 1.1427535712718964,
"epoch": 0.8685714285714285,
"grad_norm": 0.671875,
"learning_rate": 0.00013302790619551674,
"loss": 1.1199904680252075,
"mean_token_accuracy": 0.7464530095458031,
"num_tokens": 1009431.0,
"step": 38
},
{
"entropy": 1.1668125055730343,
"epoch": 0.8914285714285715,
"grad_norm": 0.6015625,
"learning_rate": 0.00012947551744109043,
"loss": 0.9645350575447083,
"mean_token_accuracy": 0.780300073325634,
"num_tokens": 1027701.0,
"step": 39
},
{
"entropy": 1.1839856766164303,
"epoch": 0.9142857142857143,
"grad_norm": 0.62109375,
"learning_rate": 0.00012588190451025207,
"loss": 1.2035199403762817,
"mean_token_accuracy": 0.7434030883014202,
"num_tokens": 1055642.0,
"step": 40
},
{
"entropy": 1.103015311062336,
"epoch": 0.9371428571428572,
"grad_norm": 0.62109375,
"learning_rate": 0.00012225209339563145,
"loss": 1.0058553218841553,
"mean_token_accuracy": 0.7543482556939125,
"num_tokens": 1084745.0,
"step": 41
},
{
"entropy": 1.1135993152856827,
"epoch": 0.96,
"grad_norm": 0.6953125,
"learning_rate": 0.00011859116071629149,
"loss": 1.2151912450790405,
"mean_token_accuracy": 0.7335421219468117,
"num_tokens": 1110320.0,
"step": 42
},
{
"entropy": 1.1436597369611263,
"epoch": 0.9828571428571429,
"grad_norm": 0.58203125,
"learning_rate": 0.00011490422661761744,
"loss": 1.0186842679977417,
"mean_token_accuracy": 0.7390037253499031,
"num_tokens": 1134964.0,
"step": 43
},
{
"entropy": 1.078730583190918,
"epoch": 1.0,
"grad_norm": 0.65625,
"learning_rate": 0.00011119644761033078,
"loss": 0.8101186752319336,
"mean_token_accuracy": 0.7597745011250178,
"num_tokens": 1153583.0,
"step": 44
},
{
"epoch": 1.0,
"eval_entropy": 1.0479114320874214,
"eval_loss": 0.9729008674621582,
"eval_mean_token_accuracy": 0.7565665817260743,
"eval_num_tokens": 1153583.0,
"eval_runtime": 77.2335,
"eval_samples_per_second": 1.295,
"eval_steps_per_second": 1.295,
"step": 44
},
{
"entropy": 1.0368036814033985,
"epoch": 1.022857142857143,
"grad_norm": 0.56640625,
"learning_rate": 0.00010747300935864243,
"loss": 0.8468512296676636,
"mean_token_accuracy": 0.8111352436244488,
"num_tokens": 1174609.0,
"step": 45
},
{
"entropy": 0.9628574140369892,
"epoch": 1.0457142857142858,
"grad_norm": 0.5546875,
"learning_rate": 0.0001037391194276326,
"loss": 0.5208293199539185,
"mean_token_accuracy": 0.8187313564121723,
"num_tokens": 1201897.0,
"step": 46
},
{
"entropy": 1.0299121290445328,
"epoch": 1.0685714285714285,
"grad_norm": 0.765625,
"learning_rate": 0.0001,
"loss": 0.7912545204162598,
"mean_token_accuracy": 0.7928437106311321,
"num_tokens": 1230046.0,
"step": 47
},
{
"entropy": 1.0342555530369282,
"epoch": 1.0914285714285714,
"grad_norm": 0.74609375,
"learning_rate": 9.626088057236745e-05,
"loss": 0.9557701349258423,
"mean_token_accuracy": 0.7545025758445263,
"num_tokens": 1257406.0,
"step": 48
},
{
"entropy": 0.9161418825387955,
"epoch": 1.1142857142857143,
"grad_norm": 0.7109375,
"learning_rate": 9.252699064135758e-05,
"loss": 1.0390901565551758,
"mean_token_accuracy": 0.7715597599744797,
"num_tokens": 1291055.0,
"step": 49
},
{
"entropy": 0.8812923058867455,
"epoch": 1.1371428571428572,
"grad_norm": 0.625,
"learning_rate": 8.880355238966923e-05,
"loss": 0.6828033328056335,
"mean_token_accuracy": 0.8140444047749043,
"num_tokens": 1318257.0,
"step": 50
},
{
"entropy": 1.0039622746407986,
"epoch": 1.16,
"grad_norm": 0.546875,
"learning_rate": 8.509577338238255e-05,
"loss": 0.7247803807258606,
"mean_token_accuracy": 0.7645618040114641,
"num_tokens": 1341106.0,
"step": 51
},
{
"entropy": 0.905966442078352,
"epoch": 1.1828571428571428,
"grad_norm": 0.5625,
"learning_rate": 8.140883928370855e-05,
"loss": 0.7403977513313293,
"mean_token_accuracy": 0.8016074895858765,
"num_tokens": 1369760.0,
"step": 52
},
{
"entropy": 0.9338806178420782,
"epoch": 1.2057142857142857,
"grad_norm": 0.490234375,
"learning_rate": 7.774790660436858e-05,
"loss": 0.6406869888305664,
"mean_token_accuracy": 0.7956290915608406,
"num_tokens": 1392567.0,
"step": 53
},
{
"entropy": 0.8846337422728539,
"epoch": 1.2285714285714286,
"grad_norm": 0.69921875,
"learning_rate": 7.411809548974792e-05,
"loss": 0.8057032823562622,
"mean_token_accuracy": 0.7973924726247787,
"num_tokens": 1419324.0,
"step": 54
},
{
"entropy": 0.9206812232732773,
"epoch": 1.2514285714285713,
"grad_norm": 0.8125,
"learning_rate": 7.052448255890957e-05,
"loss": 0.6728847026824951,
"mean_token_accuracy": 0.8473470285534859,
"num_tokens": 1446756.0,
"step": 55
},
{
"entropy": 0.9307001233100891,
"epoch": 1.2742857142857142,
"grad_norm": 0.8515625,
"learning_rate": 6.697209380448333e-05,
"loss": 0.7187720537185669,
"mean_token_accuracy": 0.8393540307879448,
"num_tokens": 1468062.0,
"step": 56
},
{
"entropy": 0.8503624759614468,
"epoch": 1.2971428571428572,
"grad_norm": 0.64453125,
"learning_rate": 6.34658975633605e-05,
"loss": 0.6491850018501282,
"mean_token_accuracy": 0.834420669823885,
"num_tokens": 1497763.0,
"step": 57
},
{
"entropy": 0.8430384919047356,
"epoch": 1.32,
"grad_norm": 0.62890625,
"learning_rate": 6.001079756802592e-05,
"loss": 0.7592802047729492,
"mean_token_accuracy": 0.7834662459790707,
"num_tokens": 1523103.0,
"step": 58
},
{
"entropy": 1.0481715574860573,
"epoch": 1.342857142857143,
"grad_norm": 1.15625,
"learning_rate": 5.6611626088244194e-05,
"loss": 0.8737943768501282,
"mean_token_accuracy": 0.7567208111286163,
"num_tokens": 1540582.0,
"step": 59
},
{
"entropy": 0.849721547216177,
"epoch": 1.3657142857142857,
"grad_norm": 0.8984375,
"learning_rate": 5.32731371726938e-05,
"loss": 0.7518897652626038,
"mean_token_accuracy": 0.8164225146174431,
"num_tokens": 1562096.0,
"step": 60
},
{
"entropy": 0.7319265194237232,
"epoch": 1.3885714285714286,
"grad_norm": 0.76953125,
"learning_rate": 5.000000000000002e-05,
"loss": 0.5088726282119751,
"mean_token_accuracy": 0.8368714712560177,
"num_tokens": 1588869.0,
"step": 61
},
{
"entropy": 0.7714136429131031,
"epoch": 1.4114285714285715,
"grad_norm": 0.515625,
"learning_rate": 4.6796792348466356e-05,
"loss": 0.5990605354309082,
"mean_token_accuracy": 0.8109956867992878,
"num_tokens": 1618753.0,
"step": 62
},
{
"entropy": 0.8922704569995403,
"epoch": 1.4342857142857142,
"grad_norm": 0.7265625,
"learning_rate": 4.3667994193637796e-05,
"loss": 0.7471989393234253,
"mean_token_accuracy": 0.8137485198676586,
"num_tokens": 1639035.0,
"step": 63
},
{
"entropy": 0.8474112637341022,
"epoch": 1.457142857142857,
"grad_norm": 0.9375,
"learning_rate": 4.0617981442649855e-05,
"loss": 0.9250304102897644,
"mean_token_accuracy": 0.7889886423945427,
"num_tokens": 1667695.0,
"step": 64
},
{
"entropy": 0.8302664868533611,
"epoch": 1.48,
"grad_norm": 0.8984375,
"learning_rate": 3.7651019814126654e-05,
"loss": 0.9558159112930298,
"mean_token_accuracy": 0.7763096019625664,
"num_tokens": 1691022.0,
"step": 65
},
{
"entropy": 0.8031172640621662,
"epoch": 1.502857142857143,
"grad_norm": 0.79296875,
"learning_rate": 3.477125887218792e-05,
"loss": 0.801313042640686,
"mean_token_accuracy": 0.8177301362156868,
"num_tokens": 1724435.0,
"step": 66
},
{
"epoch": 1.502857142857143,
"eval_entropy": 0.8457768812775612,
"eval_loss": 0.9875430464744568,
"eval_mean_token_accuracy": 0.756916128396988,
"eval_num_tokens": 1724435.0,
"eval_runtime": 77.2316,
"eval_samples_per_second": 1.295,
"eval_steps_per_second": 1.295,
"step": 66
},
{
"entropy": 0.841597568243742,
"epoch": 1.5257142857142858,
"grad_norm": 0.8359375,
"learning_rate": 3.198272622290804e-05,
"loss": 0.8447511196136475,
"mean_token_accuracy": 0.7982683703303337,
"num_tokens": 1752489.0,
"step": 67
},
{
"entropy": 0.873002614825964,
"epoch": 1.5485714285714285,
"grad_norm": 0.68359375,
"learning_rate": 2.9289321881345254e-05,
"loss": 0.8038796782493591,
"mean_token_accuracy": 0.8067350275814533,
"num_tokens": 1784291.0,
"step": 68
},
{
"entropy": 0.9177370071411133,
"epoch": 1.5714285714285714,
"grad_norm": 0.6796875,
"learning_rate": 2.669481281701739e-05,
"loss": 0.8557254672050476,
"mean_token_accuracy": 0.8137136548757553,
"num_tokens": 1804179.0,
"step": 69
},
{
"entropy": 0.8276135660707951,
"epoch": 1.5942857142857143,
"grad_norm": 0.73828125,
"learning_rate": 2.420282768545469e-05,
"loss": 0.6800186634063721,
"mean_token_accuracy": 0.8346021547913551,
"num_tokens": 1831612.0,
"step": 70
},
{
"entropy": 0.9364416636526585,
"epoch": 1.617142857142857,
"grad_norm": 0.75390625,
"learning_rate": 2.181685175319702e-05,
"loss": 0.7834956049919128,
"mean_token_accuracy": 0.7997728437185287,
"num_tokens": 1853595.0,
"step": 71
},
{
"entropy": 0.8710121884942055,
"epoch": 1.6400000000000001,
"grad_norm": 0.765625,
"learning_rate": 1.9540222023333166e-05,
"loss": 0.6057661771774292,
"mean_token_accuracy": 0.8205794207751751,
"num_tokens": 1882408.0,
"step": 72
},
{
"entropy": 0.8379442691802979,
"epoch": 1.6628571428571428,
"grad_norm": 0.7734375,
"learning_rate": 1.7376122568400532e-05,
"loss": 0.7106757760047913,
"mean_token_accuracy": 0.8180459216237068,
"num_tokens": 1904944.0,
"step": 73
},
{
"entropy": 0.8745108097791672,
"epoch": 1.6857142857142857,
"grad_norm": 1.2109375,
"learning_rate": 1.5327580077171587e-05,
"loss": 0.9369223713874817,
"mean_token_accuracy": 0.8044208958745003,
"num_tokens": 1933402.0,
"step": 74
},
{
"entropy": 0.8298410475254059,
"epoch": 1.7085714285714286,
"grad_norm": 0.8828125,
"learning_rate": 1.339745962155613e-05,
"loss": 0.6346684694290161,
"mean_token_accuracy": 0.8335375674068928,
"num_tokens": 1960093.0,
"step": 75
},
{
"entropy": 0.8175692446529865,
"epoch": 1.7314285714285713,
"grad_norm": 0.91796875,
"learning_rate": 1.1588460649539035e-05,
"loss": 0.9119294285774231,
"mean_token_accuracy": 0.8193050436675549,
"num_tokens": 1986339.0,
"step": 76
},
{
"entropy": 0.8975704163312912,
"epoch": 1.7542857142857144,
"grad_norm": 0.859375,
"learning_rate": 9.903113209758096e-06,
"loss": 0.7237526178359985,
"mean_token_accuracy": 0.7882252000272274,
"num_tokens": 2011176.0,
"step": 77
},
{
"entropy": 0.8363670147955418,
"epoch": 1.7771428571428571,
"grad_norm": 0.74609375,
"learning_rate": 8.343774413002381e-06,
"loss": 0.6269868016242981,
"mean_token_accuracy": 0.8103100657463074,
"num_tokens": 2041289.0,
"step": 78
},
{
"entropy": 0.8557109721004963,
"epoch": 1.8,
"grad_norm": 0.6171875,
"learning_rate": 6.9126251355795864e-06,
"loss": 0.5580326914787292,
"mean_token_accuracy": 0.8539069853723049,
"num_tokens": 2069418.0,
"step": 79
},
{
"entropy": 0.790475644171238,
"epoch": 1.822857142857143,
"grad_norm": 0.984375,
"learning_rate": 5.611666969163243e-06,
"loss": 0.6902757287025452,
"mean_token_accuracy": 0.8313734903931618,
"num_tokens": 2101162.0,
"step": 80
},
{
"entropy": 0.8487820513546467,
"epoch": 1.8457142857142856,
"grad_norm": 0.7265625,
"learning_rate": 4.442719421385922e-06,
"loss": 0.6248161792755127,
"mean_token_accuracy": 0.8196811378002167,
"num_tokens": 2129262.0,
"step": 81
},
{
"entropy": 0.8948404788970947,
"epoch": 1.8685714285714285,
"grad_norm": 0.87890625,
"learning_rate": 3.40741737109318e-06,
"loss": 0.8848119378089905,
"mean_token_accuracy": 0.7821721211075783,
"num_tokens": 2152597.0,
"step": 82
},
{
"entropy": 0.9239097908139229,
"epoch": 1.8914285714285715,
"grad_norm": 0.7421875,
"learning_rate": 2.5072087818176382e-06,
"loss": 0.7065685987472534,
"mean_token_accuracy": 0.807807132601738,
"num_tokens": 2177161.0,
"step": 83
},
{
"entropy": 0.7839450426399708,
"epoch": 1.9142857142857141,
"grad_norm": 0.77734375,
"learning_rate": 1.7433526766711728e-06,
"loss": 0.7359437942504883,
"mean_token_accuracy": 0.8403091952204704,
"num_tokens": 2209858.0,
"step": 84
},
{
"entropy": 0.843034666031599,
"epoch": 1.9371428571428573,
"grad_norm": 0.765625,
"learning_rate": 1.1169173774871478e-06,
"loss": 0.7045976519584656,
"mean_token_accuracy": 0.7968335002660751,
"num_tokens": 2238762.0,
"step": 85
},
{
"entropy": 0.8172502107918262,
"epoch": 1.96,
"grad_norm": 0.73046875,
"learning_rate": 6.287790106757396e-07,
"loss": 0.7153176665306091,
"mean_token_accuracy": 0.8268864750862122,
"num_tokens": 2266000.0,
"step": 86
},
{
"entropy": 0.9393381252884865,
"epoch": 1.9828571428571429,
"grad_norm": 0.8046875,
"learning_rate": 2.7962028188198706e-07,
"loss": 0.7222880721092224,
"mean_token_accuracy": 0.8043639399111271,
"num_tokens": 2291896.0,
"step": 87
},
{
"entropy": 0.9007064700126648,
"epoch": 2.0,
"grad_norm": 0.9453125,
"learning_rate": 6.992952116013918e-08,
"loss": 0.9412174224853516,
"mean_token_accuracy": 0.7673612783352534,
"num_tokens": 2307166.0,
"step": 88
},
{
"epoch": 2.0,
"eval_entropy": 0.8574838742613793,
"eval_loss": 0.9815174341201782,
"eval_mean_token_accuracy": 0.7545835164189338,
"eval_num_tokens": 2307166.0,
"eval_runtime": 77.2359,
"eval_samples_per_second": 1.295,
"eval_steps_per_second": 1.295,
"step": 88
},
{
"epoch": 2.0,
"step": 88,
"total_flos": 1.0597781694661018e+17,
"train_loss": 0.9580497294664383,
"train_runtime": 4168.6102,
"train_samples_per_second": 0.336,
"train_steps_per_second": 0.021
}
],
"trial_params": null,
"global_step": 88,
"is_local_process_zero": true,
"total_flos": 1.0597781694661018e+17,
"num_train_epochs": 2,
"epoch": 2.0,
"best_metric": null,
"trial_name": null
}