B1plus_v4_qwen72_e2 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
9a2ce90 verified
Raw
History Blame Contribute Delete
63.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 208,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.2957205325365067,
"epoch": 0.009685230024213076,
"grad_norm": 0.9995483160018921,
"learning_rate": 0.0,
"loss": 1.9372434616088867,
"mean_token_accuracy": 0.5489737018942833,
"num_tokens": 97740.0,
"step": 1
},
{
"entropy": 1.3194782882928848,
"epoch": 0.01937046004842615,
"grad_norm": 0.9814075827598572,
"learning_rate": 3.125e-06,
"loss": 1.95685613155365,
"mean_token_accuracy": 0.5466571971774101,
"num_tokens": 194347.0,
"step": 2
},
{
"entropy": 1.3409326374530792,
"epoch": 0.029055690072639227,
"grad_norm": 0.9050161838531494,
"learning_rate": 6.25e-06,
"loss": 1.938143253326416,
"mean_token_accuracy": 0.5483311638236046,
"num_tokens": 292306.0,
"step": 3
},
{
"entropy": 1.4396293759346008,
"epoch": 0.0387409200968523,
"grad_norm": 0.7553433775901794,
"learning_rate": 9.375000000000001e-06,
"loss": 1.9240221977233887,
"mean_token_accuracy": 0.5431711822748184,
"num_tokens": 389675.0,
"step": 4
},
{
"entropy": 1.5236343890428543,
"epoch": 0.048426150121065374,
"grad_norm": 0.5566913485527039,
"learning_rate": 1.25e-05,
"loss": 1.8870434761047363,
"mean_token_accuracy": 0.5487127229571342,
"num_tokens": 482548.0,
"step": 5
},
{
"entropy": 1.587360993027687,
"epoch": 0.05811138014527845,
"grad_norm": 0.41897791624069214,
"learning_rate": 1.5625e-05,
"loss": 1.790077567100525,
"mean_token_accuracy": 0.5560380145907402,
"num_tokens": 579772.0,
"step": 6
},
{
"entropy": 1.701308086514473,
"epoch": 0.06779661016949153,
"grad_norm": 0.3749634921550751,
"learning_rate": 1.8750000000000002e-05,
"loss": 1.7975553274154663,
"mean_token_accuracy": 0.5572659820318222,
"num_tokens": 677650.0,
"step": 7
},
{
"entropy": 1.7159235179424286,
"epoch": 0.0774818401937046,
"grad_norm": 0.32318735122680664,
"learning_rate": 2.1875e-05,
"loss": 1.726526141166687,
"mean_token_accuracy": 0.5642273500561714,
"num_tokens": 774231.0,
"step": 8
},
{
"entropy": 1.828441396355629,
"epoch": 0.08716707021791767,
"grad_norm": 0.3263152837753296,
"learning_rate": 2.5e-05,
"loss": 1.7625732421875,
"mean_token_accuracy": 0.5538319870829582,
"num_tokens": 868913.0,
"step": 9
},
{
"entropy": 1.8398680537939072,
"epoch": 0.09685230024213075,
"grad_norm": 0.3322964608669281,
"learning_rate": 2.8125000000000003e-05,
"loss": 1.6790331602096558,
"mean_token_accuracy": 0.5727217048406601,
"num_tokens": 966483.0,
"step": 10
},
{
"entropy": 1.800604209303856,
"epoch": 0.10653753026634383,
"grad_norm": 0.3253025412559509,
"learning_rate": 3.125e-05,
"loss": 1.6130985021591187,
"mean_token_accuracy": 0.5812065601348877,
"num_tokens": 1062677.0,
"step": 11
},
{
"entropy": 1.8502707928419113,
"epoch": 0.1162227602905569,
"grad_norm": 0.35978925228118896,
"learning_rate": 3.4375e-05,
"loss": 1.628458857536316,
"mean_token_accuracy": 0.5780329182744026,
"num_tokens": 1160086.0,
"step": 12
},
{
"entropy": 1.7924207001924515,
"epoch": 0.12590799031476999,
"grad_norm": 0.331644743680954,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.5732147693634033,
"mean_token_accuracy": 0.5900157392024994,
"num_tokens": 1257647.0,
"step": 13
},
{
"entropy": 1.7685164362192154,
"epoch": 0.13559322033898305,
"grad_norm": 0.326431006193161,
"learning_rate": 4.0625000000000005e-05,
"loss": 1.5668952465057373,
"mean_token_accuracy": 0.5877715274691582,
"num_tokens": 1354505.0,
"step": 14
},
{
"entropy": 1.5795451253652573,
"epoch": 0.14527845036319612,
"grad_norm": 0.26537618041038513,
"learning_rate": 4.375e-05,
"loss": 1.4661058187484741,
"mean_token_accuracy": 0.6071906611323357,
"num_tokens": 1450622.0,
"step": 15
},
{
"entropy": 1.5185481905937195,
"epoch": 0.1549636803874092,
"grad_norm": 0.24135415256023407,
"learning_rate": 4.6875e-05,
"loss": 1.4757945537567139,
"mean_token_accuracy": 0.6041631400585175,
"num_tokens": 1547908.0,
"step": 16
},
{
"entropy": 1.4099202752113342,
"epoch": 0.16464891041162227,
"grad_norm": 0.2752665579319,
"learning_rate": 5e-05,
"loss": 1.4465235471725464,
"mean_token_accuracy": 0.6097583919763565,
"num_tokens": 1645426.0,
"step": 17
},
{
"entropy": 1.3497764021158218,
"epoch": 0.17433414043583534,
"grad_norm": 0.26331380009651184,
"learning_rate": 4.999859193643945e-05,
"loss": 1.4109758138656616,
"mean_token_accuracy": 0.6169496104121208,
"num_tokens": 1742103.0,
"step": 18
},
{
"entropy": 1.3129477798938751,
"epoch": 0.18401937046004843,
"grad_norm": 0.25825461745262146,
"learning_rate": 4.999436790436924e-05,
"loss": 1.3865187168121338,
"mean_token_accuracy": 0.6188722252845764,
"num_tokens": 1839477.0,
"step": 19
},
{
"entropy": 1.292990192770958,
"epoch": 0.1937046004842615,
"grad_norm": 0.19367851316928864,
"learning_rate": 4.9987328379605816e-05,
"loss": 1.3164660930633545,
"mean_token_accuracy": 0.6362323462963104,
"num_tokens": 1936962.0,
"step": 20
},
{
"entropy": 1.376704841852188,
"epoch": 0.2033898305084746,
"grad_norm": 0.19777517020702362,
"learning_rate": 4.9977474155117045e-05,
"loss": 1.3734445571899414,
"mean_token_accuracy": 0.623312383890152,
"num_tokens": 2034780.0,
"step": 21
},
{
"entropy": 1.3632780611515045,
"epoch": 0.21307506053268765,
"grad_norm": 0.20455984771251678,
"learning_rate": 4.9964806340932865e-05,
"loss": 1.3468432426452637,
"mean_token_accuracy": 0.6259733065962791,
"num_tokens": 2132583.0,
"step": 22
},
{
"entropy": 1.3963707983493805,
"epoch": 0.22276029055690072,
"grad_norm": 0.20235121250152588,
"learning_rate": 4.9949326364020314e-05,
"loss": 1.3420944213867188,
"mean_token_accuracy": 0.629428505897522,
"num_tokens": 2226009.0,
"step": 23
},
{
"entropy": 1.3728236258029938,
"epoch": 0.2324455205811138,
"grad_norm": 0.19748054444789886,
"learning_rate": 4.993103596812268e-05,
"loss": 1.311779260635376,
"mean_token_accuracy": 0.6367133855819702,
"num_tokens": 2323884.0,
"step": 24
},
{
"entropy": 1.3855281174182892,
"epoch": 0.24213075060532688,
"grad_norm": 0.1842709332704544,
"learning_rate": 4.9909937213563165e-05,
"loss": 1.3212249279022217,
"mean_token_accuracy": 0.6343293562531471,
"num_tokens": 2420260.0,
"step": 25
},
{
"entropy": 1.3564256578683853,
"epoch": 0.25181598062953997,
"grad_norm": 0.17390435934066772,
"learning_rate": 4.988603247701277e-05,
"loss": 1.29941725730896,
"mean_token_accuracy": 0.6395170390605927,
"num_tokens": 2517078.0,
"step": 26
},
{
"entropy": 1.340470239520073,
"epoch": 0.26150121065375304,
"grad_norm": 0.16865943372249603,
"learning_rate": 4.985932445122257e-05,
"loss": 1.305230736732483,
"mean_token_accuracy": 0.6346895545721054,
"num_tokens": 2614502.0,
"step": 27
},
{
"entropy": 1.249424859881401,
"epoch": 0.2711864406779661,
"grad_norm": 0.16522753238677979,
"learning_rate": 4.982981614472039e-05,
"loss": 1.2451016902923584,
"mean_token_accuracy": 0.648459404706955,
"num_tokens": 2710926.0,
"step": 28
},
{
"entropy": 1.241905003786087,
"epoch": 0.28087167070217917,
"grad_norm": 0.1635328084230423,
"learning_rate": 4.979751088147192e-05,
"loss": 1.2533214092254639,
"mean_token_accuracy": 0.6469609588384628,
"num_tokens": 2807646.0,
"step": 29
},
{
"entropy": 1.2305553704500198,
"epoch": 0.29055690072639223,
"grad_norm": 0.1724368929862976,
"learning_rate": 4.97624123005063e-05,
"loss": 1.2500461339950562,
"mean_token_accuracy": 0.6472327932715416,
"num_tokens": 2905309.0,
"step": 30
},
{
"entropy": 1.2676000744104385,
"epoch": 0.30024213075060535,
"grad_norm": 0.1697048544883728,
"learning_rate": 4.972452435550614e-05,
"loss": 1.2715867757797241,
"mean_token_accuracy": 0.6399261504411697,
"num_tokens": 3002360.0,
"step": 31
},
{
"entropy": 1.259141355752945,
"epoch": 0.3099273607748184,
"grad_norm": 0.1588452011346817,
"learning_rate": 4.968385131436222e-05,
"loss": 1.2634798288345337,
"mean_token_accuracy": 0.6464442312717438,
"num_tokens": 3098670.0,
"step": 32
},
{
"entropy": 1.240147739648819,
"epoch": 0.3196125907990315,
"grad_norm": 0.16833168268203735,
"learning_rate": 4.9640397758692715e-05,
"loss": 1.234930396080017,
"mean_token_accuracy": 0.6492077708244324,
"num_tokens": 3196614.0,
"step": 33
},
{
"entropy": 1.2283259332180023,
"epoch": 0.32929782082324455,
"grad_norm": 0.15456287562847137,
"learning_rate": 4.9594168583327094e-05,
"loss": 1.209458589553833,
"mean_token_accuracy": 0.654823787510395,
"num_tokens": 3294374.0,
"step": 34
},
{
"entropy": 1.2569270879030228,
"epoch": 0.3389830508474576,
"grad_norm": 0.1605941504240036,
"learning_rate": 4.954516899575473e-05,
"loss": 1.239461898803711,
"mean_token_accuracy": 0.6469651088118553,
"num_tokens": 3392016.0,
"step": 35
},
{
"entropy": 1.2405883818864822,
"epoch": 0.3486682808716707,
"grad_norm": 0.14910897612571716,
"learning_rate": 4.949340451553833e-05,
"loss": 1.2166962623596191,
"mean_token_accuracy": 0.6551224812865257,
"num_tokens": 3489070.0,
"step": 36
},
{
"entropy": 1.215465858578682,
"epoch": 0.3583535108958838,
"grad_norm": 0.147048220038414,
"learning_rate": 4.943888097369216e-05,
"loss": 1.2016295194625854,
"mean_token_accuracy": 0.6562318950891495,
"num_tokens": 3586431.0,
"step": 37
},
{
"entropy": 1.2163386642932892,
"epoch": 0.36803874092009686,
"grad_norm": 0.15423355996608734,
"learning_rate": 4.938160451202521e-05,
"loss": 1.205035924911499,
"mean_token_accuracy": 0.6569599062204361,
"num_tokens": 3684062.0,
"step": 38
},
{
"entropy": 1.2028222680091858,
"epoch": 0.37772397094430993,
"grad_norm": 0.15404321253299713,
"learning_rate": 4.9321581582449365e-05,
"loss": 1.192380428314209,
"mean_token_accuracy": 0.6554796397686005,
"num_tokens": 3780819.0,
"step": 39
},
{
"entropy": 1.2089442908763885,
"epoch": 0.387409200968523,
"grad_norm": 0.14532388746738434,
"learning_rate": 4.9258818946252624e-05,
"loss": 1.2102763652801514,
"mean_token_accuracy": 0.6531244814395905,
"num_tokens": 3878336.0,
"step": 40
},
{
"entropy": 1.1934202015399933,
"epoch": 0.39709443099273606,
"grad_norm": 0.1453426033258438,
"learning_rate": 4.9193323673337476e-05,
"loss": 1.1972005367279053,
"mean_token_accuracy": 0.6552818641066551,
"num_tokens": 3975553.0,
"step": 41
},
{
"entropy": 1.1711555123329163,
"epoch": 0.4067796610169492,
"grad_norm": 0.1477774679660797,
"learning_rate": 4.912510314142448e-05,
"loss": 1.170544147491455,
"mean_token_accuracy": 0.6620478183031082,
"num_tokens": 4072191.0,
"step": 42
},
{
"entropy": 1.1826989650726318,
"epoch": 0.41646489104116224,
"grad_norm": 0.14542169868946075,
"learning_rate": 4.9054165035221236e-05,
"loss": 1.1799176931381226,
"mean_token_accuracy": 0.6598139330744743,
"num_tokens": 4169972.0,
"step": 43
},
{
"entropy": 1.1880664974451065,
"epoch": 0.4261501210653753,
"grad_norm": 0.1443413645029068,
"learning_rate": 4.898051734555676e-05,
"loss": 1.1854431629180908,
"mean_token_accuracy": 0.66011131554842,
"num_tokens": 4266802.0,
"step": 44
},
{
"entropy": 1.1752376854419708,
"epoch": 0.4358353510895884,
"grad_norm": 0.23293092846870422,
"learning_rate": 4.890416836848127e-05,
"loss": 1.172422170639038,
"mean_token_accuracy": 0.6633148416876793,
"num_tokens": 4364720.0,
"step": 45
},
{
"entropy": 1.1703867614269257,
"epoch": 0.44552058111380144,
"grad_norm": 0.1400470733642578,
"learning_rate": 4.88251267043318e-05,
"loss": 1.1647189855575562,
"mean_token_accuracy": 0.665075309574604,
"num_tokens": 4460849.0,
"step": 46
},
{
"entropy": 1.17378731071949,
"epoch": 0.4552058111380145,
"grad_norm": 0.1396193504333496,
"learning_rate": 4.87434012567633e-05,
"loss": 1.1746811866760254,
"mean_token_accuracy": 0.6617837771773338,
"num_tokens": 4558078.0,
"step": 47
},
{
"entropy": 1.1466614976525307,
"epoch": 0.4648910411622276,
"grad_norm": 0.14611490070819855,
"learning_rate": 4.865900123174574e-05,
"loss": 1.1373505592346191,
"mean_token_accuracy": 0.6694466471672058,
"num_tokens": 4656144.0,
"step": 48
},
{
"entropy": 1.1598657816648483,
"epoch": 0.4745762711864407,
"grad_norm": 0.1434149593114853,
"learning_rate": 4.857193613652711e-05,
"loss": 1.1583551168441772,
"mean_token_accuracy": 0.6666313409805298,
"num_tokens": 4752916.0,
"step": 49
},
{
"entropy": 1.1331430822610855,
"epoch": 0.48426150121065376,
"grad_norm": 0.13973699510097504,
"learning_rate": 4.848221577856243e-05,
"loss": 1.1207313537597656,
"mean_token_accuracy": 0.6732116788625717,
"num_tokens": 4850493.0,
"step": 50
},
{
"entropy": 1.145334169268608,
"epoch": 0.4939467312348668,
"grad_norm": 0.13802146911621094,
"learning_rate": 4.838985026440905e-05,
"loss": 1.134577989578247,
"mean_token_accuracy": 0.6739182397723198,
"num_tokens": 4948257.0,
"step": 51
},
{
"entropy": 1.1789843142032623,
"epoch": 0.5036319612590799,
"grad_norm": 0.14845487475395203,
"learning_rate": 4.829484999858815e-05,
"loss": 1.1688673496246338,
"mean_token_accuracy": 0.6578787639737129,
"num_tokens": 5045927.0,
"step": 52
},
{
"entropy": 1.1895974725484848,
"epoch": 0.513317191283293,
"grad_norm": 0.1441718488931656,
"learning_rate": 4.819722568241274e-05,
"loss": 1.1826505661010742,
"mean_token_accuracy": 0.6588587313890457,
"num_tokens": 5142165.0,
"step": 53
},
{
"entropy": 1.1316261738538742,
"epoch": 0.5230024213075061,
"grad_norm": 0.14087459444999695,
"learning_rate": 4.8096988312782174e-05,
"loss": 1.1231753826141357,
"mean_token_accuracy": 0.6710022836923599,
"num_tokens": 5239937.0,
"step": 54
},
{
"entropy": 1.1435543149709702,
"epoch": 0.5326876513317191,
"grad_norm": 0.14454324543476105,
"learning_rate": 4.799414918094347e-05,
"loss": 1.1403521299362183,
"mean_token_accuracy": 0.6671252995729446,
"num_tokens": 5336273.0,
"step": 55
},
{
"entropy": 1.0858831107616425,
"epoch": 0.5423728813559322,
"grad_norm": 0.14002826809883118,
"learning_rate": 4.788871987121937e-05,
"loss": 1.086983561515808,
"mean_token_accuracy": 0.6800005808472633,
"num_tokens": 5434119.0,
"step": 56
},
{
"entropy": 1.1357448101043701,
"epoch": 0.5520581113801453,
"grad_norm": 0.1409410983324051,
"learning_rate": 4.77807122597034e-05,
"loss": 1.145082950592041,
"mean_token_accuracy": 0.6666935756802559,
"num_tokens": 5530374.0,
"step": 57
},
{
"entropy": 1.121580258011818,
"epoch": 0.5617433414043583,
"grad_norm": 0.14635145664215088,
"learning_rate": 4.767013851292212e-05,
"loss": 1.134584665298462,
"mean_token_accuracy": 0.6697172001004219,
"num_tokens": 5627067.0,
"step": 58
},
{
"entropy": 1.1188838332891464,
"epoch": 0.5714285714285714,
"grad_norm": 0.14798252284526825,
"learning_rate": 4.755701108646463e-05,
"loss": 1.128434419631958,
"mean_token_accuracy": 0.6693471819162369,
"num_tokens": 5721452.0,
"step": 59
},
{
"entropy": 1.1582091152668,
"epoch": 0.5811138014527845,
"grad_norm": 0.14457716047763824,
"learning_rate": 4.744134272357948e-05,
"loss": 1.1655305624008179,
"mean_token_accuracy": 0.6602210402488708,
"num_tokens": 5818528.0,
"step": 60
},
{
"entropy": 1.1417238414287567,
"epoch": 0.5907990314769975,
"grad_norm": 0.1429831087589264,
"learning_rate": 4.732314645373921e-05,
"loss": 1.1227712631225586,
"mean_token_accuracy": 0.6702725440263748,
"num_tokens": 5915548.0,
"step": 61
},
{
"entropy": 1.1103073507547379,
"epoch": 0.6004842615012107,
"grad_norm": 0.14573390781879425,
"learning_rate": 4.7202435591172676e-05,
"loss": 1.0962705612182617,
"mean_token_accuracy": 0.6774255335330963,
"num_tokens": 6011742.0,
"step": 62
},
{
"entropy": 1.122736319899559,
"epoch": 0.6101694915254238,
"grad_norm": 0.14568699896335602,
"learning_rate": 4.7079223733365237e-05,
"loss": 1.108860731124878,
"mean_token_accuracy": 0.6744343638420105,
"num_tokens": 6108610.0,
"step": 63
},
{
"entropy": 1.1377546936273575,
"epoch": 0.6198547215496368,
"grad_norm": 0.15811605751514435,
"learning_rate": 4.6953524759527054e-05,
"loss": 1.1342792510986328,
"mean_token_accuracy": 0.6696078702807426,
"num_tokens": 6205888.0,
"step": 64
},
{
"entropy": 1.117256410419941,
"epoch": 0.6295399515738499,
"grad_norm": 0.14264215528964996,
"learning_rate": 4.6825352829029705e-05,
"loss": 1.112156629562378,
"mean_token_accuracy": 0.6736717820167542,
"num_tokens": 6303176.0,
"step": 65
},
{
"entropy": 1.1090807020664215,
"epoch": 0.639225181598063,
"grad_norm": 0.14527742564678192,
"learning_rate": 4.6694722379811185e-05,
"loss": 1.115394115447998,
"mean_token_accuracy": 0.6744855791330338,
"num_tokens": 6400425.0,
"step": 66
},
{
"entropy": 1.1179847419261932,
"epoch": 0.648910411622276,
"grad_norm": 0.14383482933044434,
"learning_rate": 4.656164812674951e-05,
"loss": 1.1273249387741089,
"mean_token_accuracy": 0.6708880066871643,
"num_tokens": 6497165.0,
"step": 67
},
{
"entropy": 1.1409042179584503,
"epoch": 0.6585956416464891,
"grad_norm": 0.15300460159778595,
"learning_rate": 4.642614506000523e-05,
"loss": 1.1354745626449585,
"mean_token_accuracy": 0.6670901477336884,
"num_tokens": 6594629.0,
"step": 68
},
{
"entropy": 1.0936977565288544,
"epoch": 0.6682808716707022,
"grad_norm": 0.14818546175956726,
"learning_rate": 4.628822844333278e-05,
"loss": 1.0947887897491455,
"mean_token_accuracy": 0.6786026880145073,
"num_tokens": 6691606.0,
"step": 69
},
{
"entropy": 1.1090299785137177,
"epoch": 0.6779661016949152,
"grad_norm": 0.14709310233592987,
"learning_rate": 4.614791381236115e-05,
"loss": 1.108567476272583,
"mean_token_accuracy": 0.6737446561455727,
"num_tokens": 6787144.0,
"step": 70
},
{
"entropy": 1.1130342036485672,
"epoch": 0.6876513317191283,
"grad_norm": 0.14786535501480103,
"learning_rate": 4.6005216972843864e-05,
"loss": 1.1175450086593628,
"mean_token_accuracy": 0.6724362820386887,
"num_tokens": 6884460.0,
"step": 71
},
{
"entropy": 1.090154156088829,
"epoch": 0.6973365617433414,
"grad_norm": 0.14625772833824158,
"learning_rate": 4.5860153998878494e-05,
"loss": 1.0817482471466064,
"mean_token_accuracy": 0.67938332259655,
"num_tokens": 6982209.0,
"step": 72
},
{
"entropy": 1.1123566552996635,
"epoch": 0.7070217917675545,
"grad_norm": 0.14828450977802277,
"learning_rate": 4.571274123109606e-05,
"loss": 1.1023019552230835,
"mean_token_accuracy": 0.675434984266758,
"num_tokens": 7078357.0,
"step": 73
},
{
"entropy": 1.1003855466842651,
"epoch": 0.7167070217917676,
"grad_norm": 0.14769022166728973,
"learning_rate": 4.5562995274820284e-05,
"loss": 1.0925781726837158,
"mean_token_accuracy": 0.679414302110672,
"num_tokens": 7174932.0,
"step": 74
},
{
"entropy": 1.066821463406086,
"epoch": 0.7263922518159807,
"grad_norm": 0.14872464537620544,
"learning_rate": 4.541093299819714e-05,
"loss": 1.0721882581710815,
"mean_token_accuracy": 0.6860671788454056,
"num_tokens": 7271358.0,
"step": 75
},
{
"entropy": 1.1028296649456024,
"epoch": 0.7360774818401937,
"grad_norm": 0.1491360366344452,
"learning_rate": 4.5256571530294664e-05,
"loss": 1.110499382019043,
"mean_token_accuracy": 0.6740638688206673,
"num_tokens": 7368532.0,
"step": 76
},
{
"entropy": 1.0569827035069466,
"epoch": 0.7457627118644068,
"grad_norm": 0.14861756563186646,
"learning_rate": 4.5099928259173516e-05,
"loss": 1.0642375946044922,
"mean_token_accuracy": 0.6815041974186897,
"num_tokens": 7465042.0,
"step": 77
},
{
"entropy": 1.0828624665737152,
"epoch": 0.7554479418886199,
"grad_norm": 0.15817824006080627,
"learning_rate": 4.4941020829928245e-05,
"loss": 1.086707353591919,
"mean_token_accuracy": 0.6801510155200958,
"num_tokens": 7561958.0,
"step": 78
},
{
"entropy": 1.0969925075769424,
"epoch": 0.7651331719128329,
"grad_norm": 0.1529255509376526,
"learning_rate": 4.477986714269972e-05,
"loss": 1.0899672508239746,
"mean_token_accuracy": 0.678456224501133,
"num_tokens": 7659711.0,
"step": 79
},
{
"entropy": 1.0624620243906975,
"epoch": 0.774818401937046,
"grad_norm": 0.15455132722854614,
"learning_rate": 4.4616485350658685e-05,
"loss": 1.0544354915618896,
"mean_token_accuracy": 0.6855011060833931,
"num_tokens": 7756475.0,
"step": 80
},
{
"entropy": 1.1112875491380692,
"epoch": 0.784503631961259,
"grad_norm": 0.14817237854003906,
"learning_rate": 4.445089385796099e-05,
"loss": 1.096229076385498,
"mean_token_accuracy": 0.6748161613941193,
"num_tokens": 7853572.0,
"step": 81
},
{
"entropy": 1.1143488436937332,
"epoch": 0.7941888619854721,
"grad_norm": 0.15500982105731964,
"learning_rate": 4.4283111317674374e-05,
"loss": 1.1159741878509521,
"mean_token_accuracy": 0.6718207076191902,
"num_tokens": 7951478.0,
"step": 82
},
{
"entropy": 1.0716768354177475,
"epoch": 0.8038740920096852,
"grad_norm": 0.14607810974121094,
"learning_rate": 4.4113156629677316e-05,
"loss": 1.0741264820098877,
"mean_token_accuracy": 0.6826100572943687,
"num_tokens": 8048090.0,
"step": 83
},
{
"entropy": 1.08623006939888,
"epoch": 0.8135593220338984,
"grad_norm": 0.1486004889011383,
"learning_rate": 4.394104893853007e-05,
"loss": 1.0830330848693848,
"mean_token_accuracy": 0.678254209458828,
"num_tokens": 8145495.0,
"step": 84
},
{
"entropy": 1.0595624893903732,
"epoch": 0.8232445520581114,
"grad_norm": 0.15346822142601013,
"learning_rate": 4.3766807631318106e-05,
"loss": 1.0648397207260132,
"mean_token_accuracy": 0.6820255219936371,
"num_tokens": 8243257.0,
"step": 85
},
{
"entropy": 1.0569987148046494,
"epoch": 0.8329297820823245,
"grad_norm": 0.15623626112937927,
"learning_rate": 4.359045233546827e-05,
"loss": 1.0685005187988281,
"mean_token_accuracy": 0.684545986354351,
"num_tokens": 8338257.0,
"step": 86
},
{
"entropy": 1.0479903519153595,
"epoch": 0.8426150121065376,
"grad_norm": 0.14811332523822784,
"learning_rate": 4.341200291653781e-05,
"loss": 1.058138132095337,
"mean_token_accuracy": 0.6859943941235542,
"num_tokens": 8436280.0,
"step": 87
},
{
"entropy": 1.1004953235387802,
"epoch": 0.8523002421307506,
"grad_norm": 0.1508825272321701,
"learning_rate": 4.323147947597666e-05,
"loss": 1.1114561557769775,
"mean_token_accuracy": 0.6722725033760071,
"num_tokens": 8534296.0,
"step": 88
},
{
"entropy": 1.0389911904931068,
"epoch": 0.8619854721549637,
"grad_norm": 0.1480080932378769,
"learning_rate": 4.3048902348863116e-05,
"loss": 1.0304014682769775,
"mean_token_accuracy": 0.6923525035381317,
"num_tokens": 8631835.0,
"step": 89
},
{
"entropy": 1.0742208510637283,
"epoch": 0.8716707021791767,
"grad_norm": 0.14625877141952515,
"learning_rate": 4.2864292101613136e-05,
"loss": 1.0725879669189453,
"mean_token_accuracy": 0.6854639276862144,
"num_tokens": 8728666.0,
"step": 90
},
{
"entropy": 1.036693975329399,
"epoch": 0.8813559322033898,
"grad_norm": 0.14420975744724274,
"learning_rate": 4.267766952966369e-05,
"loss": 1.0207698345184326,
"mean_token_accuracy": 0.6963317543268204,
"num_tokens": 8826157.0,
"step": 91
},
{
"entropy": 1.066306859254837,
"epoch": 0.8910411622276029,
"grad_norm": 0.154633030295372,
"learning_rate": 4.248905565513023e-05,
"loss": 1.0533056259155273,
"mean_token_accuracy": 0.6857179254293442,
"num_tokens": 8919599.0,
"step": 92
},
{
"entropy": 1.0462640300393105,
"epoch": 0.9007263922518159,
"grad_norm": 0.15113948285579681,
"learning_rate": 4.229847172443866e-05,
"loss": 1.0407187938690186,
"mean_token_accuracy": 0.6907829195261002,
"num_tokens": 9017083.0,
"step": 93
},
{
"entropy": 1.0615776777267456,
"epoch": 0.910411622276029,
"grad_norm": 0.1515236496925354,
"learning_rate": 4.210593920593201e-05,
"loss": 1.0574121475219727,
"mean_token_accuracy": 0.6874448731541634,
"num_tokens": 9114699.0,
"step": 94
},
{
"entropy": 1.0619953870773315,
"epoch": 0.9200968523002422,
"grad_norm": 0.15497922897338867,
"learning_rate": 4.191147978745218e-05,
"loss": 1.0640019178390503,
"mean_token_accuracy": 0.6830037236213684,
"num_tokens": 9212478.0,
"step": 95
},
{
"entropy": 1.0610519051551819,
"epoch": 0.9297820823244553,
"grad_norm": 0.16060221195220947,
"learning_rate": 4.171511537389684e-05,
"loss": 1.0584205389022827,
"mean_token_accuracy": 0.6856881454586983,
"num_tokens": 9309385.0,
"step": 96
},
{
"entropy": 1.0446307063102722,
"epoch": 0.9394673123486683,
"grad_norm": 0.15420550107955933,
"learning_rate": 4.151686808475204e-05,
"loss": 1.047270655632019,
"mean_token_accuracy": 0.6872993409633636,
"num_tokens": 9405674.0,
"step": 97
},
{
"entropy": 1.054522544145584,
"epoch": 0.9491525423728814,
"grad_norm": 0.15661559998989105,
"learning_rate": 4.131676025160047e-05,
"loss": 1.0625941753387451,
"mean_token_accuracy": 0.6845473125576973,
"num_tokens": 9502863.0,
"step": 98
},
{
"entropy": 1.0278218686580658,
"epoch": 0.9588377723970944,
"grad_norm": 0.15473391115665436,
"learning_rate": 4.111481441560598e-05,
"loss": 1.0273422002792358,
"mean_token_accuracy": 0.6932465434074402,
"num_tokens": 9600669.0,
"step": 99
},
{
"entropy": 1.041596107184887,
"epoch": 0.9685230024213075,
"grad_norm": 0.1449374407529831,
"learning_rate": 4.091105332497439e-05,
"loss": 1.0463595390319824,
"mean_token_accuracy": 0.6912512555718422,
"num_tokens": 9697304.0,
"step": 100
},
{
"entropy": 1.0684800148010254,
"epoch": 0.9782082324455206,
"grad_norm": 0.1515686959028244,
"learning_rate": 4.070549993239106e-05,
"loss": 1.0661861896514893,
"mean_token_accuracy": 0.6858441829681396,
"num_tokens": 9794066.0,
"step": 101
},
{
"entropy": 1.0518590733408928,
"epoch": 0.9878934624697336,
"grad_norm": 0.15803049504756927,
"learning_rate": 4.049817739243532e-05,
"loss": 1.037236213684082,
"mean_token_accuracy": 0.689392939209938,
"num_tokens": 9889545.0,
"step": 102
},
{
"entropy": 1.0445326566696167,
"epoch": 0.9975786924939467,
"grad_norm": 0.15257743000984192,
"learning_rate": 4.028910905897229e-05,
"loss": 1.0427336692810059,
"mean_token_accuracy": 0.6887638568878174,
"num_tokens": 9984866.0,
"step": 103
},
{
"entropy": 1.0611678957939148,
"epoch": 1.0,
"grad_norm": 0.2940840721130371,
"learning_rate": 4.007831848252211e-05,
"loss": 1.0530990362167358,
"mean_token_accuracy": 0.6814314126968384,
"num_tokens": 10009403.0,
"step": 104
},
{
"entropy": 1.0497082397341728,
"epoch": 1.0096852300242132,
"grad_norm": 0.1564565747976303,
"learning_rate": 3.986582940760717e-05,
"loss": 1.030436396598816,
"mean_token_accuracy": 0.6926182061433792,
"num_tokens": 10106335.0,
"step": 105
},
{
"entropy": 1.0123815387487411,
"epoch": 1.0193704600484261,
"grad_norm": 0.1642434448003769,
"learning_rate": 3.965166577007733e-05,
"loss": 1.0002119541168213,
"mean_token_accuracy": 0.6985866278409958,
"num_tokens": 10202191.0,
"step": 106
},
{
"entropy": 1.0041352361440659,
"epoch": 1.0290556900726393,
"grad_norm": 0.1648867130279541,
"learning_rate": 3.94358516944137e-05,
"loss": 1.0050082206726074,
"mean_token_accuracy": 0.6969355717301369,
"num_tokens": 10299771.0,
"step": 107
},
{
"entropy": 1.0074616223573685,
"epoch": 1.0387409200968523,
"grad_norm": 0.16517765820026398,
"learning_rate": 3.9218411491011176e-05,
"loss": 1.014854907989502,
"mean_token_accuracy": 0.6966256648302078,
"num_tokens": 10397225.0,
"step": 108
},
{
"entropy": 0.9936244934797287,
"epoch": 1.0484261501210654,
"grad_norm": 0.16205355525016785,
"learning_rate": 3.899936965343989e-05,
"loss": 1.0037654638290405,
"mean_token_accuracy": 0.6981071457266808,
"num_tokens": 10495072.0,
"step": 109
},
{
"entropy": 0.988917775452137,
"epoch": 1.0581113801452784,
"grad_norm": 0.16487880051136017,
"learning_rate": 3.877875085568623e-05,
"loss": 0.9998143911361694,
"mean_token_accuracy": 0.6989010348916054,
"num_tokens": 10593014.0,
"step": 110
},
{
"entropy": 1.0223135277628899,
"epoch": 1.0677966101694916,
"grad_norm": 0.1645587831735611,
"learning_rate": 3.8556579949373384e-05,
"loss": 1.023576021194458,
"mean_token_accuracy": 0.692980445921421,
"num_tokens": 10690703.0,
"step": 111
},
{
"entropy": 1.015090361237526,
"epoch": 1.0774818401937045,
"grad_norm": 0.15396536886692047,
"learning_rate": 3.833288196096194e-05,
"loss": 1.0166376829147339,
"mean_token_accuracy": 0.6936796456575394,
"num_tokens": 10788092.0,
"step": 112
},
{
"entropy": 1.0370544865727425,
"epoch": 1.0871670702179177,
"grad_norm": 0.159644216299057,
"learning_rate": 3.8107682088930794e-05,
"loss": 1.023399829864502,
"mean_token_accuracy": 0.6933755651116371,
"num_tokens": 10884533.0,
"step": 113
},
{
"entropy": 1.0179733633995056,
"epoch": 1.0968523002421307,
"grad_norm": 0.16513484716415405,
"learning_rate": 3.7881005700938635e-05,
"loss": 1.0117831230163574,
"mean_token_accuracy": 0.6966173946857452,
"num_tokens": 10980390.0,
"step": 114
},
{
"entropy": 1.0589358359575272,
"epoch": 1.1065375302663438,
"grad_norm": 0.16453009843826294,
"learning_rate": 3.7652878330966415e-05,
"loss": 1.041041612625122,
"mean_token_accuracy": 0.6878631860017776,
"num_tokens": 11076573.0,
"step": 115
},
{
"entropy": 1.0219000279903412,
"epoch": 1.116222760290557,
"grad_norm": 0.1623397022485733,
"learning_rate": 3.742332567644107e-05,
"loss": 1.0067601203918457,
"mean_token_accuracy": 0.6953606754541397,
"num_tokens": 11173211.0,
"step": 116
},
{
"entropy": 0.9765115603804588,
"epoch": 1.12590799031477,
"grad_norm": 0.15821851789951324,
"learning_rate": 3.719237359534087e-05,
"loss": 0.9680384397506714,
"mean_token_accuracy": 0.7078221663832664,
"num_tokens": 11269149.0,
"step": 117
},
{
"entropy": 1.0054796189069748,
"epoch": 1.1355932203389831,
"grad_norm": 0.16345135867595673,
"learning_rate": 3.6960048103282566e-05,
"loss": 1.0104200839996338,
"mean_token_accuracy": 0.6938582733273506,
"num_tokens": 11366538.0,
"step": 118
},
{
"entropy": 1.0051406398415565,
"epoch": 1.145278450363196,
"grad_norm": 0.155021533370018,
"learning_rate": 3.672637537059093e-05,
"loss": 1.0087268352508545,
"mean_token_accuracy": 0.6973330229520798,
"num_tokens": 11464379.0,
"step": 119
},
{
"entropy": 1.0200638100504875,
"epoch": 1.1549636803874093,
"grad_norm": 0.17094552516937256,
"learning_rate": 3.6491381719350756e-05,
"loss": 1.036880612373352,
"mean_token_accuracy": 0.6878476142883301,
"num_tokens": 11561148.0,
"step": 120
},
{
"entropy": 1.012288749217987,
"epoch": 1.1646489104116222,
"grad_norm": 0.16450250148773193,
"learning_rate": 3.6255093620441834e-05,
"loss": 1.0213954448699951,
"mean_token_accuracy": 0.6948853880167007,
"num_tokens": 11658242.0,
"step": 121
},
{
"entropy": 1.0086817741394043,
"epoch": 1.1743341404358354,
"grad_norm": 0.1626807153224945,
"learning_rate": 3.6017537690557115e-05,
"loss": 1.0057084560394287,
"mean_token_accuracy": 0.6975555568933487,
"num_tokens": 11754691.0,
"step": 122
},
{
"entropy": 0.9957757294178009,
"epoch": 1.1840193704600483,
"grad_norm": 0.15866564214229584,
"learning_rate": 3.577874068920446e-05,
"loss": 0.9769740104675293,
"mean_token_accuracy": 0.7049618437886238,
"num_tokens": 11851957.0,
"step": 123
},
{
"entropy": 1.023524522781372,
"epoch": 1.1937046004842615,
"grad_norm": 0.15701547265052795,
"learning_rate": 3.553872951569236e-05,
"loss": 1.0102542638778687,
"mean_token_accuracy": 0.6948281303048134,
"num_tokens": 11949158.0,
"step": 124
},
{
"entropy": 1.0255613550543785,
"epoch": 1.2033898305084745,
"grad_norm": 0.160598024725914,
"learning_rate": 3.529753120609982e-05,
"loss": 1.0142004489898682,
"mean_token_accuracy": 0.6950482055544853,
"num_tokens": 12047065.0,
"step": 125
},
{
"entropy": 1.0207768678665161,
"epoch": 1.2130750605326877,
"grad_norm": 0.1668667197227478,
"learning_rate": 3.505517293023088e-05,
"loss": 1.0299181938171387,
"mean_token_accuracy": 0.6932333111763,
"num_tokens": 12140843.0,
"step": 126
},
{
"entropy": 1.0096961930394173,
"epoch": 1.2227602905569008,
"grad_norm": 0.15583710372447968,
"learning_rate": 3.481168198855409e-05,
"loss": 1.0230910778045654,
"mean_token_accuracy": 0.6935219466686249,
"num_tokens": 12238169.0,
"step": 127
},
{
"entropy": 1.0121450945734978,
"epoch": 1.2324455205811138,
"grad_norm": 0.1601191908121109,
"learning_rate": 3.456708580912725e-05,
"loss": 1.0020897388458252,
"mean_token_accuracy": 0.6964283734560013,
"num_tokens": 12336055.0,
"step": 128
},
{
"entropy": 1.0203755050897598,
"epoch": 1.242130750605327,
"grad_norm": 0.16153757274150848,
"learning_rate": 3.432141194450772e-05,
"loss": 1.0235494375228882,
"mean_token_accuracy": 0.6922239810228348,
"num_tokens": 12433292.0,
"step": 129
},
{
"entropy": 0.9952817261219025,
"epoch": 1.25181598062954,
"grad_norm": 0.16117016971111298,
"learning_rate": 3.407468806864883e-05,
"loss": 0.9944422245025635,
"mean_token_accuracy": 0.6995577961206436,
"num_tokens": 12529632.0,
"step": 130
},
{
"entropy": 1.0067841857671738,
"epoch": 1.261501210653753,
"grad_norm": 0.15968872606754303,
"learning_rate": 3.382694197378252e-05,
"loss": 1.0131640434265137,
"mean_token_accuracy": 0.6946265995502472,
"num_tokens": 12627363.0,
"step": 131
},
{
"entropy": 1.0088231563568115,
"epoch": 1.271186440677966,
"grad_norm": 0.16917093098163605,
"learning_rate": 3.357820156728867e-05,
"loss": 1.0098109245300293,
"mean_token_accuracy": 0.6978933215141296,
"num_tokens": 12722873.0,
"step": 132
},
{
"entropy": 1.0022346451878548,
"epoch": 1.2808716707021792,
"grad_norm": 0.16208580136299133,
"learning_rate": 3.332849486855144e-05,
"loss": 1.0061886310577393,
"mean_token_accuracy": 0.6940922066569328,
"num_tokens": 12818842.0,
"step": 133
},
{
"entropy": 0.9971742331981659,
"epoch": 1.2905569007263922,
"grad_norm": 0.15936775505542755,
"learning_rate": 3.307785000580313e-05,
"loss": 0.9899219870567322,
"mean_token_accuracy": 0.7014091834425926,
"num_tokens": 12916424.0,
"step": 134
},
{
"entropy": 0.9976816847920418,
"epoch": 1.3002421307506054,
"grad_norm": 0.2688247561454773,
"learning_rate": 3.282629521295556e-05,
"loss": 1.000976324081421,
"mean_token_accuracy": 0.6989069283008575,
"num_tokens": 13012418.0,
"step": 135
},
{
"entropy": 0.9814217463135719,
"epoch": 1.3099273607748185,
"grad_norm": 0.1612652987241745,
"learning_rate": 3.257385882641971e-05,
"loss": 0.9776369333267212,
"mean_token_accuracy": 0.7035728245973587,
"num_tokens": 13109173.0,
"step": 136
},
{
"entropy": 1.001495622098446,
"epoch": 1.3196125907990315,
"grad_norm": 0.15470746159553528,
"learning_rate": 3.232056928191376e-05,
"loss": 0.9890879988670349,
"mean_token_accuracy": 0.6988591179251671,
"num_tokens": 13207226.0,
"step": 137
},
{
"entropy": 0.9967611879110336,
"epoch": 1.3292978208232444,
"grad_norm": 0.1591372787952423,
"learning_rate": 3.2066455111259945e-05,
"loss": 0.9965915679931641,
"mean_token_accuracy": 0.6986541524529457,
"num_tokens": 13304690.0,
"step": 138
},
{
"entropy": 0.9881946295499802,
"epoch": 1.3389830508474576,
"grad_norm": 0.16304631531238556,
"learning_rate": 3.1811544939170575e-05,
"loss": 0.9952649474143982,
"mean_token_accuracy": 0.6945862323045731,
"num_tokens": 13402318.0,
"step": 139
},
{
"entropy": 0.9948993697762489,
"epoch": 1.3486682808716708,
"grad_norm": 0.162835955619812,
"learning_rate": 3.155586748002362e-05,
"loss": 1.0011897087097168,
"mean_token_accuracy": 0.6979707032442093,
"num_tokens": 13498911.0,
"step": 140
},
{
"entropy": 1.0100372210144997,
"epoch": 1.3583535108958837,
"grad_norm": 0.1653631329536438,
"learning_rate": 3.1299451534628135e-05,
"loss": 1.0079827308654785,
"mean_token_accuracy": 0.6955159679055214,
"num_tokens": 13596489.0,
"step": 141
},
{
"entropy": 1.0005303993821144,
"epoch": 1.368038740920097,
"grad_norm": 0.15816530585289001,
"learning_rate": 3.1042325986980064e-05,
"loss": 0.9934114813804626,
"mean_token_accuracy": 0.6982027143239975,
"num_tokens": 13693181.0,
"step": 142
},
{
"entropy": 1.0108712911605835,
"epoch": 1.3777239709443099,
"grad_norm": 0.16801035404205322,
"learning_rate": 3.0784519801008546e-05,
"loss": 1.0035772323608398,
"mean_token_accuracy": 0.6946400851011276,
"num_tokens": 13790207.0,
"step": 143
},
{
"entropy": 0.9940394014120102,
"epoch": 1.387409200968523,
"grad_norm": 0.16538861393928528,
"learning_rate": 3.0526062017313254e-05,
"loss": 0.9854618906974792,
"mean_token_accuracy": 0.6998060122132301,
"num_tokens": 13886824.0,
"step": 144
},
{
"entropy": 1.015800602734089,
"epoch": 1.397094430992736,
"grad_norm": 0.16404059529304504,
"learning_rate": 3.0266981749893157e-05,
"loss": 1.010426640510559,
"mean_token_accuracy": 0.6951465085148811,
"num_tokens": 13984711.0,
"step": 145
},
{
"entropy": 1.0125101953744888,
"epoch": 1.4067796610169492,
"grad_norm": 0.1646854728460312,
"learning_rate": 3.0007308182866985e-05,
"loss": 1.0053914785385132,
"mean_token_accuracy": 0.693408191204071,
"num_tokens": 14082491.0,
"step": 146
},
{
"entropy": 1.0149571672081947,
"epoch": 1.4164648910411621,
"grad_norm": 0.27195093035697937,
"learning_rate": 2.974707056718571e-05,
"loss": 1.0218114852905273,
"mean_token_accuracy": 0.6915486976504326,
"num_tokens": 14178367.0,
"step": 147
},
{
"entropy": 1.0098140239715576,
"epoch": 1.4261501210653753,
"grad_norm": 0.16734321415424347,
"learning_rate": 2.9486298217337637e-05,
"loss": 1.0243513584136963,
"mean_token_accuracy": 0.6904255822300911,
"num_tokens": 14275669.0,
"step": 148
},
{
"entropy": 0.9736747220158577,
"epoch": 1.4358353510895885,
"grad_norm": 0.1625024378299713,
"learning_rate": 2.9225020508046232e-05,
"loss": 0.9738012552261353,
"mean_token_accuracy": 0.7017730921506882,
"num_tokens": 14372400.0,
"step": 149
},
{
"entropy": 1.016117848455906,
"epoch": 1.4455205811138014,
"grad_norm": 0.16163532435894012,
"learning_rate": 2.8963266870961226e-05,
"loss": 1.0025385618209839,
"mean_token_accuracy": 0.6962382420897484,
"num_tokens": 14468895.0,
"step": 150
},
{
"entropy": 1.000129446387291,
"epoch": 1.4552058111380144,
"grad_norm": 0.1636207103729248,
"learning_rate": 2.8701066791343288e-05,
"loss": 0.9981441497802734,
"mean_token_accuracy": 0.6979088559746742,
"num_tokens": 14566496.0,
"step": 151
},
{
"entropy": 1.0115438923239708,
"epoch": 1.4648910411622276,
"grad_norm": 0.16182203590869904,
"learning_rate": 2.8438449804742628e-05,
"loss": 1.0085995197296143,
"mean_token_accuracy": 0.6946075111627579,
"num_tokens": 14664097.0,
"step": 152
},
{
"entropy": 0.9745980277657509,
"epoch": 1.4745762711864407,
"grad_norm": 0.1606246829032898,
"learning_rate": 2.8175445493671972e-05,
"loss": 0.9741977453231812,
"mean_token_accuracy": 0.7038497105240822,
"num_tokens": 14761778.0,
"step": 153
},
{
"entropy": 0.9997073635458946,
"epoch": 1.4842615012106537,
"grad_norm": 0.1606900691986084,
"learning_rate": 2.7912083484274266e-05,
"loss": 1.0080050230026245,
"mean_token_accuracy": 0.6961813271045685,
"num_tokens": 14858797.0,
"step": 154
},
{
"entropy": 1.014495812356472,
"epoch": 1.4939467312348669,
"grad_norm": 0.16178575158119202,
"learning_rate": 2.7648393442985403e-05,
"loss": 1.0042692422866821,
"mean_token_accuracy": 0.69585070759058,
"num_tokens": 14955777.0,
"step": 155
},
{
"entropy": 1.0302998945116997,
"epoch": 1.5036319612590798,
"grad_norm": 0.16053006052970886,
"learning_rate": 2.7384405073192454e-05,
"loss": 1.0217926502227783,
"mean_token_accuracy": 0.6916443780064583,
"num_tokens": 15052841.0,
"step": 156
},
{
"entropy": 0.9914230555295944,
"epoch": 1.513317191283293,
"grad_norm": 0.15790845453739166,
"learning_rate": 2.7120148111887732e-05,
"loss": 0.9867815971374512,
"mean_token_accuracy": 0.7012891918420792,
"num_tokens": 15146917.0,
"step": 157
},
{
"entropy": 0.9733176603913307,
"epoch": 1.5230024213075062,
"grad_norm": 0.15671640634536743,
"learning_rate": 2.6855652326319063e-05,
"loss": 0.9663571715354919,
"mean_token_accuracy": 0.7067279890179634,
"num_tokens": 15244027.0,
"step": 158
},
{
"entropy": 0.9909517616033554,
"epoch": 1.5326876513317191,
"grad_norm": 0.15879209339618683,
"learning_rate": 2.659094751063666e-05,
"loss": 0.9971685409545898,
"mean_token_accuracy": 0.6988729164004326,
"num_tokens": 15340804.0,
"step": 159
},
{
"entropy": 1.0000923573970795,
"epoch": 1.542372881355932,
"grad_norm": 0.15917372703552246,
"learning_rate": 2.6326063482536934e-05,
"loss": 1.0012197494506836,
"mean_token_accuracy": 0.6966550797224045,
"num_tokens": 15437706.0,
"step": 160
},
{
"entropy": 1.0145022571086884,
"epoch": 1.5520581113801453,
"grad_norm": 0.16265787184238434,
"learning_rate": 2.606103007990371e-05,
"loss": 1.0111325979232788,
"mean_token_accuracy": 0.6933945044875145,
"num_tokens": 15531879.0,
"step": 161
},
{
"entropy": 1.0036377906799316,
"epoch": 1.5617433414043584,
"grad_norm": 0.16375237703323364,
"learning_rate": 2.579587715744712e-05,
"loss": 1.0029797554016113,
"mean_token_accuracy": 0.6955940127372742,
"num_tokens": 15629721.0,
"step": 162
},
{
"entropy": 1.0386734753847122,
"epoch": 1.5714285714285714,
"grad_norm": 0.16306881606578827,
"learning_rate": 2.5530634583340592e-05,
"loss": 1.0406312942504883,
"mean_token_accuracy": 0.6886710077524185,
"num_tokens": 15727030.0,
"step": 163
},
{
"entropy": 0.9940996393561363,
"epoch": 1.5811138014527844,
"grad_norm": 0.16509971022605896,
"learning_rate": 2.526533223585641e-05,
"loss": 0.9921597838401794,
"mean_token_accuracy": 0.7000836208462715,
"num_tokens": 15823642.0,
"step": 164
},
{
"entropy": 1.0113196671009064,
"epoch": 1.5907990314769975,
"grad_norm": 0.17014694213867188,
"learning_rate": 2.5e-05,
"loss": 1.000211238861084,
"mean_token_accuracy": 0.696845568716526,
"num_tokens": 15920894.0,
"step": 165
},
{
"entropy": 1.0079443007707596,
"epoch": 1.6004842615012107,
"grad_norm": 0.16094236075878143,
"learning_rate": 2.47346677641436e-05,
"loss": 0.9985548257827759,
"mean_token_accuracy": 0.6970102190971375,
"num_tokens": 16018678.0,
"step": 166
},
{
"entropy": 1.0026478096842766,
"epoch": 1.6101694915254239,
"grad_norm": 0.16517619788646698,
"learning_rate": 2.446936541665941e-05,
"loss": 0.9906925559043884,
"mean_token_accuracy": 0.6991379931569099,
"num_tokens": 16115100.0,
"step": 167
},
{
"entropy": 1.009756289422512,
"epoch": 1.6198547215496368,
"grad_norm": 0.16483961045742035,
"learning_rate": 2.4204122842552896e-05,
"loss": 1.0100080966949463,
"mean_token_accuracy": 0.6920091360807419,
"num_tokens": 16212185.0,
"step": 168
},
{
"entropy": 0.9892624393105507,
"epoch": 1.6295399515738498,
"grad_norm": 0.16626964509487152,
"learning_rate": 2.39389699200963e-05,
"loss": 0.9917020797729492,
"mean_token_accuracy": 0.6994179859757423,
"num_tokens": 16309607.0,
"step": 169
},
{
"entropy": 0.9693093672394753,
"epoch": 1.639225181598063,
"grad_norm": 0.16250012814998627,
"learning_rate": 2.3673936517463075e-05,
"loss": 0.9778143763542175,
"mean_token_accuracy": 0.7030152902007103,
"num_tokens": 16403478.0,
"step": 170
},
{
"entropy": 0.999257817864418,
"epoch": 1.6489104116222761,
"grad_norm": 0.16267414391040802,
"learning_rate": 2.3409052489363342e-05,
"loss": 1.008827805519104,
"mean_token_accuracy": 0.6968575343489647,
"num_tokens": 16499376.0,
"step": 171
},
{
"entropy": 0.9948962330818176,
"epoch": 1.658595641646489,
"grad_norm": 0.16714368760585785,
"learning_rate": 2.3144347673680936e-05,
"loss": 1.0074965953826904,
"mean_token_accuracy": 0.694792777299881,
"num_tokens": 16597152.0,
"step": 172
},
{
"entropy": 0.9955190569162369,
"epoch": 1.668280871670702,
"grad_norm": 0.17781881988048553,
"learning_rate": 2.287985188811228e-05,
"loss": 0.9991034269332886,
"mean_token_accuracy": 0.697237454354763,
"num_tokens": 16693593.0,
"step": 173
},
{
"entropy": 0.9868601709604263,
"epoch": 1.6779661016949152,
"grad_norm": 0.1637657880783081,
"learning_rate": 2.261559492680755e-05,
"loss": 0.9883804321289062,
"mean_token_accuracy": 0.7004631012678146,
"num_tokens": 16791648.0,
"step": 174
},
{
"entropy": 0.9998594745993614,
"epoch": 1.6876513317191284,
"grad_norm": 0.16492129862308502,
"learning_rate": 2.23516065570146e-05,
"loss": 0.988003134727478,
"mean_token_accuracy": 0.7004012763500214,
"num_tokens": 16887565.0,
"step": 175
},
{
"entropy": 0.9922599494457245,
"epoch": 1.6973365617433414,
"grad_norm": 0.16476185619831085,
"learning_rate": 2.2087916515725737e-05,
"loss": 0.9830120801925659,
"mean_token_accuracy": 0.7036381214857101,
"num_tokens": 16983866.0,
"step": 176
},
{
"entropy": 0.9667748808860779,
"epoch": 1.7070217917675545,
"grad_norm": 0.1622721403837204,
"learning_rate": 2.182455450632803e-05,
"loss": 0.9589613676071167,
"mean_token_accuracy": 0.7059106230735779,
"num_tokens": 17080511.0,
"step": 177
},
{
"entropy": 1.0044486820697784,
"epoch": 1.7167070217917675,
"grad_norm": 0.16303181648254395,
"learning_rate": 2.1561550195257378e-05,
"loss": 1.0007452964782715,
"mean_token_accuracy": 0.6962373182177544,
"num_tokens": 17177327.0,
"step": 178
},
{
"entropy": 0.9671204686164856,
"epoch": 1.7263922518159807,
"grad_norm": 0.16110743582248688,
"learning_rate": 2.1298933208656718e-05,
"loss": 0.9604004621505737,
"mean_token_accuracy": 0.7054437473416328,
"num_tokens": 17272025.0,
"step": 179
},
{
"entropy": 0.9986064434051514,
"epoch": 1.7360774818401938,
"grad_norm": 0.17059385776519775,
"learning_rate": 2.103673312903878e-05,
"loss": 1.0034087896347046,
"mean_token_accuracy": 0.695854052901268,
"num_tokens": 17369047.0,
"step": 180
},
{
"entropy": 1.0043450593948364,
"epoch": 1.7457627118644068,
"grad_norm": 0.16405996680259705,
"learning_rate": 2.0774979491953777e-05,
"loss": 1.004425048828125,
"mean_token_accuracy": 0.6962170526385307,
"num_tokens": 17466402.0,
"step": 181
},
{
"entropy": 0.9758473634719849,
"epoch": 1.7554479418886197,
"grad_norm": 0.1624099463224411,
"learning_rate": 2.0513701782662366e-05,
"loss": 0.9758256673812866,
"mean_token_accuracy": 0.702741451561451,
"num_tokens": 17563946.0,
"step": 182
},
{
"entropy": 0.9875493124127388,
"epoch": 1.765133171912833,
"grad_norm": 0.16150467097759247,
"learning_rate": 2.025292943281429e-05,
"loss": 0.9866945743560791,
"mean_token_accuracy": 0.7015281021595001,
"num_tokens": 17661994.0,
"step": 183
},
{
"entropy": 0.9763547852635384,
"epoch": 1.774818401937046,
"grad_norm": 0.16172127425670624,
"learning_rate": 1.9992691817133024e-05,
"loss": 0.9720677733421326,
"mean_token_accuracy": 0.7051981464028358,
"num_tokens": 17759062.0,
"step": 184
},
{
"entropy": 0.9876666143536568,
"epoch": 1.784503631961259,
"grad_norm": 0.1627873331308365,
"learning_rate": 1.973301825010685e-05,
"loss": 0.9883197546005249,
"mean_token_accuracy": 0.7009499967098236,
"num_tokens": 17857030.0,
"step": 185
},
{
"entropy": 0.9885219484567642,
"epoch": 1.794188861985472,
"grad_norm": 0.16328956186771393,
"learning_rate": 1.947393798268676e-05,
"loss": 0.9787638187408447,
"mean_token_accuracy": 0.7017620652914047,
"num_tokens": 17954718.0,
"step": 186
},
{
"entropy": 0.9936325624585152,
"epoch": 1.8038740920096852,
"grad_norm": 0.16579745709896088,
"learning_rate": 1.9215480198991466e-05,
"loss": 0.9860278964042664,
"mean_token_accuracy": 0.7013640478253365,
"num_tokens": 18052307.0,
"step": 187
},
{
"entropy": 0.9761279001832008,
"epoch": 1.8135593220338984,
"grad_norm": 0.16758285462856293,
"learning_rate": 1.895767401301994e-05,
"loss": 0.9741207361221313,
"mean_token_accuracy": 0.7015948817133904,
"num_tokens": 18149449.0,
"step": 188
},
{
"entropy": 0.9821500703692436,
"epoch": 1.8232445520581115,
"grad_norm": 0.15871122479438782,
"learning_rate": 1.8700548465371874e-05,
"loss": 0.9747895002365112,
"mean_token_accuracy": 0.7048889771103859,
"num_tokens": 18247120.0,
"step": 189
},
{
"entropy": 1.0027316063642502,
"epoch": 1.8329297820823245,
"grad_norm": 0.1635945439338684,
"learning_rate": 1.84441325199764e-05,
"loss": 1.0001788139343262,
"mean_token_accuracy": 0.696582555770874,
"num_tokens": 18344157.0,
"step": 190
},
{
"entropy": 0.9462392926216125,
"epoch": 1.8426150121065374,
"grad_norm": 0.1615677773952484,
"learning_rate": 1.818845506082943e-05,
"loss": 0.9510740637779236,
"mean_token_accuracy": 0.70773646235466,
"num_tokens": 18441268.0,
"step": 191
},
{
"entropy": 1.0037222057580948,
"epoch": 1.8523002421307506,
"grad_norm": 0.16842308640480042,
"learning_rate": 1.793354488874006e-05,
"loss": 1.0088788270950317,
"mean_token_accuracy": 0.6934759691357613,
"num_tokens": 18537788.0,
"step": 192
},
{
"entropy": 0.9667429774999619,
"epoch": 1.8619854721549638,
"grad_norm": 0.16219115257263184,
"learning_rate": 1.7679430718086243e-05,
"loss": 0.969014585018158,
"mean_token_accuracy": 0.7043875381350517,
"num_tokens": 18634210.0,
"step": 193
},
{
"entropy": 0.9850651919841766,
"epoch": 1.8716707021791767,
"grad_norm": 0.16740399599075317,
"learning_rate": 1.742614117358029e-05,
"loss": 0.9887316226959229,
"mean_token_accuracy": 0.6999648213386536,
"num_tokens": 18730773.0,
"step": 194
},
{
"entropy": 0.9965796321630478,
"epoch": 1.8813559322033897,
"grad_norm": 0.1601548194885254,
"learning_rate": 1.7173704787044446e-05,
"loss": 1.0006155967712402,
"mean_token_accuracy": 0.6969467177987099,
"num_tokens": 18828751.0,
"step": 195
},
{
"entropy": 0.9734840467572212,
"epoch": 1.8910411622276029,
"grad_norm": 0.16879691183567047,
"learning_rate": 1.6922149994196878e-05,
"loss": 0.9744443297386169,
"mean_token_accuracy": 0.7044009938836098,
"num_tokens": 18924854.0,
"step": 196
},
{
"entropy": 0.9900180175900459,
"epoch": 1.900726392251816,
"grad_norm": 0.16602978110313416,
"learning_rate": 1.667150513144856e-05,
"loss": 0.9910145998001099,
"mean_token_accuracy": 0.6993976980447769,
"num_tokens": 19022636.0,
"step": 197
},
{
"entropy": 1.0208289474248886,
"epoch": 1.910411622276029,
"grad_norm": 0.16639183461666107,
"learning_rate": 1.6421798432711345e-05,
"loss": 1.0081907510757446,
"mean_token_accuracy": 0.6937614306807518,
"num_tokens": 19119897.0,
"step": 198
},
{
"entropy": 1.0175106599926949,
"epoch": 1.9200968523002422,
"grad_norm": 0.16621938347816467,
"learning_rate": 1.617305802621748e-05,
"loss": 1.0121101140975952,
"mean_token_accuracy": 0.6952445805072784,
"num_tokens": 19216975.0,
"step": 199
},
{
"entropy": 0.993683896958828,
"epoch": 1.9297820823244551,
"grad_norm": 0.16414102911949158,
"learning_rate": 1.5925311931351172e-05,
"loss": 0.9927324056625366,
"mean_token_accuracy": 0.7005998194217682,
"num_tokens": 19314144.0,
"step": 200
},
{
"entropy": 0.9706481248140335,
"epoch": 1.9394673123486683,
"grad_norm": 0.16486144065856934,
"learning_rate": 1.567858805549229e-05,
"loss": 0.9645916819572449,
"mean_token_accuracy": 0.7075545489788055,
"num_tokens": 19411168.0,
"step": 201
},
{
"entropy": 0.9547639638185501,
"epoch": 1.9491525423728815,
"grad_norm": 0.16740481555461884,
"learning_rate": 1.5432914190872757e-05,
"loss": 0.9521715044975281,
"mean_token_accuracy": 0.7096640020608902,
"num_tokens": 19508050.0,
"step": 202
},
{
"entropy": 0.9757836386561394,
"epoch": 1.9588377723970944,
"grad_norm": 0.16067975759506226,
"learning_rate": 1.5188318011445906e-05,
"loss": 0.976540207862854,
"mean_token_accuracy": 0.7041280418634415,
"num_tokens": 19604931.0,
"step": 203
},
{
"entropy": 0.960599772632122,
"epoch": 1.9685230024213074,
"grad_norm": 0.16080203652381897,
"learning_rate": 1.4944827069769123e-05,
"loss": 0.9553600549697876,
"mean_token_accuracy": 0.7085657268762589,
"num_tokens": 19700943.0,
"step": 204
},
{
"entropy": 0.9594792500138283,
"epoch": 1.9782082324455206,
"grad_norm": 0.1573885977268219,
"learning_rate": 1.4702468793900188e-05,
"loss": 0.9603473544120789,
"mean_token_accuracy": 0.7059226110577583,
"num_tokens": 19798974.0,
"step": 205
},
{
"entropy": 0.9801315888762474,
"epoch": 1.9878934624697338,
"grad_norm": 0.16511794924736023,
"learning_rate": 1.4461270484307643e-05,
"loss": 0.9834091663360596,
"mean_token_accuracy": 0.7020789682865143,
"num_tokens": 19896619.0,
"step": 206
},
{
"entropy": 1.0063806548714638,
"epoch": 1.9975786924939467,
"grad_norm": 0.16854998469352722,
"learning_rate": 1.4221259310795543e-05,
"loss": 1.0062599182128906,
"mean_token_accuracy": 0.6940593868494034,
"num_tokens": 19994525.0,
"step": 207
},
{
"entropy": 1.0087562799453735,
"epoch": 2.0,
"grad_norm": 0.32751402258872986,
"learning_rate": 1.3982462309442889e-05,
"loss": 1.0107228755950928,
"mean_token_accuracy": 0.6938549876213074,
"num_tokens": 20018806.0,
"step": 208
}
],
"logging_steps": 1,
"max_steps": 312,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.8948254401683784e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}