mdlm_cot / checkpoint-2500-split3 /trainer_state.json
avgJo3's picture
Add files using upload-large-folder tool
f239f28 verified
Raw
History Blame Contribute Delete
35.7 kB
{
"best_global_step": 2500,
"best_metric": 1.9019721597678847,
"best_model_checkpoint": "/content/cot-split3/checkpoint-2500",
"epoch": 0.9788950232977015,
"eval_steps": 250,
"global_step": 2500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_bpd": 5.410557520272195,
"eval_entropy": 3.805819726348172,
"eval_loss": 3.754805564880371,
"eval_mean_token_accuracy": 0.3303780525619185,
"eval_nll": 3.7503126904340807,
"eval_num_tokens": 0.0,
"eval_ppl": 42.534380014623586,
"eval_runtime": 319.2646,
"eval_samples_per_second": 568.835,
"eval_steps_per_second": 8.889,
"step": 0
},
{
"entropy": 3.939532442367398,
"epoch": 0.00039155800931908063,
"grad_norm": 2.921875,
"learning_rate": 0.0,
"loss": 3.6805007457733154,
"mean_token_accuracy": 0.33797585886722376,
"num_tokens": 159295.0,
"step": 1
},
{
"entropy": 4.131688260781753,
"epoch": 0.009788950232977016,
"grad_norm": 1.828125,
"learning_rate": 9.375e-05,
"loss": 3.7089433670043945,
"mean_token_accuracy": 0.32488122625965454,
"num_tokens": 3875056.0,
"step": 25
},
{
"entropy": 4.03907456745432,
"epoch": 0.01957790046595403,
"grad_norm": 0.87109375,
"learning_rate": 0.00019140625,
"loss": 3.2840447998046876,
"mean_token_accuracy": 0.3501161635947849,
"num_tokens": 7796334.0,
"step": 50
},
{
"entropy": 3.718109237212473,
"epoch": 0.02936685069893105,
"grad_norm": 0.875,
"learning_rate": 0.0002890625,
"loss": 2.907643127441406,
"mean_token_accuracy": 0.37667007823156323,
"num_tokens": 11688138.0,
"step": 75
},
{
"entropy": 3.4646144502832286,
"epoch": 0.03915580093190806,
"grad_norm": 0.71484375,
"learning_rate": 0.00038671875,
"loss": 2.5448974609375,
"mean_token_accuracy": 0.41452789283904995,
"num_tokens": 15554877.0,
"step": 100
},
{
"entropy": 3.2713017840492147,
"epoch": 0.04894475116488508,
"grad_norm": 0.71484375,
"learning_rate": 0.000484375,
"loss": 2.4108335876464846,
"mean_token_accuracy": 0.4332291316341289,
"num_tokens": 19437565.0,
"step": 125
},
{
"entropy": 3.177977246980637,
"epoch": 0.0587337013978621,
"grad_norm": 0.6796875,
"learning_rate": 0.0004999075642455791,
"loss": 2.35259765625,
"mean_token_accuracy": 0.4402555277869966,
"num_tokens": 23324888.0,
"step": 150
},
{
"entropy": 3.1149309732260146,
"epoch": 0.06852265163083911,
"grad_norm": 0.6171875,
"learning_rate": 0.0004995565798713207,
"loss": 2.2896893310546873,
"mean_token_accuracy": 0.44857320203325,
"num_tokens": 27225978.0,
"step": 175
},
{
"entropy": 3.0429316923380134,
"epoch": 0.07831160186381612,
"grad_norm": 0.7109375,
"learning_rate": 0.0004989440608306114,
"loss": 2.2477577209472654,
"mean_token_accuracy": 0.45537929991850945,
"num_tokens": 31124891.0,
"step": 200
},
{
"entropy": 3.000580134712211,
"epoch": 0.08810055209679314,
"grad_norm": 0.73046875,
"learning_rate": 0.0004980706490418613,
"loss": 2.2050234985351564,
"mean_token_accuracy": 0.4608995247476681,
"num_tokens": 35005557.0,
"step": 225
},
{
"entropy": 2.972177586040443,
"epoch": 0.09788950232977016,
"grad_norm": 0.64453125,
"learning_rate": 0.0004969372598384225,
"loss": 2.1969384765625,
"mean_token_accuracy": 0.46284280083339074,
"num_tokens": 38902413.0,
"step": 250
},
{
"epoch": 0.09788950232977016,
"eval_bpd": 3.072745569254064,
"eval_entropy": 2.8243270517127983,
"eval_loss": 2.126833915710449,
"eval_mean_token_accuracy": 0.4728344847516112,
"eval_nll": 2.1298649279065187,
"eval_num_tokens": 38902413.0,
"eval_ppl": 8.41373027452248,
"eval_runtime": 318.4023,
"eval_samples_per_second": 570.376,
"eval_steps_per_second": 8.913,
"step": 250
},
{
"entropy": 2.9943911642269376,
"epoch": 0.10767845256274718,
"grad_norm": 0.6328125,
"learning_rate": 0.0004955450810093227,
"loss": 2.189352722167969,
"mean_token_accuracy": 0.4613144874232056,
"num_tokens": 42787954.0,
"step": 275
},
{
"entropy": 2.9854789787582336,
"epoch": 0.1174674027957242,
"grad_norm": 0.64453125,
"learning_rate": 0.0004938955715544644,
"loss": 2.197265625,
"mean_token_accuracy": 0.4586064115776618,
"num_tokens": 46649640.0,
"step": 300
},
{
"entropy": 2.967871895537734,
"epoch": 0.1272563530287012,
"grad_norm": 0.77734375,
"learning_rate": 0.0004919904601555969,
"loss": 2.1636979675292967,
"mean_token_accuracy": 0.46279846221708726,
"num_tokens": 50562181.0,
"step": 325
},
{
"entropy": 2.9346317600010297,
"epoch": 0.13704530326167821,
"grad_norm": 0.66796875,
"learning_rate": 0.0004898317433646626,
"loss": 2.1643003845214843,
"mean_token_accuracy": 0.4652492077421426,
"num_tokens": 54435712.0,
"step": 350
},
{
"entropy": 2.8769926588271595,
"epoch": 0.14683425349465523,
"grad_norm": 0.81640625,
"learning_rate": 0.00048742168351141525,
"loss": 2.1070077514648435,
"mean_token_accuracy": 0.4735955714097171,
"num_tokens": 58331515.0,
"step": 375
},
{
"entropy": 2.9047266886544443,
"epoch": 0.15662320372763225,
"grad_norm": 0.58984375,
"learning_rate": 0.00048476280633250404,
"loss": 2.1295965576171874,
"mean_token_accuracy": 0.4706730742865917,
"num_tokens": 62245696.0,
"step": 400
},
{
"entropy": 2.8752667624718105,
"epoch": 0.16641215396060927,
"grad_norm": 0.58203125,
"learning_rate": 0.00048185789832450813,
"loss": 2.11253173828125,
"mean_token_accuracy": 0.4743365019853278,
"num_tokens": 66145585.0,
"step": 425
},
{
"entropy": 2.8552429066577076,
"epoch": 0.17620110419358628,
"grad_norm": 0.59375,
"learning_rate": 0.00047871000382369524,
"loss": 2.0846556091308592,
"mean_token_accuracy": 0.47697299871989524,
"num_tokens": 70063214.0,
"step": 450
},
{
"entropy": 2.8341120851783472,
"epoch": 0.1859900544265633,
"grad_norm": 0.58203125,
"learning_rate": 0.0004753224218155648,
"loss": 2.068045349121094,
"mean_token_accuracy": 0.47787787454415265,
"num_tokens": 73984544.0,
"step": 475
},
{
"entropy": 2.8375192761847376,
"epoch": 0.19577900465954032,
"grad_norm": 0.61328125,
"learning_rate": 0.0004716987024775197,
"loss": 2.0847515869140625,
"mean_token_accuracy": 0.47784874690977935,
"num_tokens": 77862885.0,
"step": 500
},
{
"epoch": 0.19577900465954032,
"eval_bpd": 2.9090075702135,
"eval_entropy": 2.6186967416048157,
"eval_loss": 2.013190507888794,
"eval_mean_token_accuracy": 0.48935668935428794,
"eval_nll": 2.0163703955210246,
"eval_num_tokens": 77862885.0,
"eval_ppl": 7.5110133907515495,
"eval_runtime": 318.4358,
"eval_samples_per_second": 570.316,
"eval_steps_per_second": 8.912,
"step": 500
},
{
"entropy": 2.86442423287629,
"epoch": 0.20556795489251733,
"grad_norm": 0.6796875,
"learning_rate": 0.000467842643458289,
"loss": 2.097323455810547,
"mean_token_accuracy": 0.4766681852583933,
"num_tokens": 81738952.0,
"step": 525
},
{
"entropy": 2.8243706708841483,
"epoch": 0.21535690512549435,
"grad_norm": 0.6328125,
"learning_rate": 0.0004637582858980017,
"loss": 2.050118865966797,
"mean_token_accuracy": 0.48122489244307076,
"num_tokens": 85626497.0,
"step": 550
},
{
"entropy": 2.848133797467131,
"epoch": 0.22514585535847137,
"grad_norm": 0.84375,
"learning_rate": 0.0004594499101930825,
"loss": 2.0830853271484373,
"mean_token_accuracy": 0.47580645161290325,
"num_tokens": 89484956.0,
"step": 575
},
{
"entropy": 2.8410350923085876,
"epoch": 0.2349348055914484,
"grad_norm": 0.52734375,
"learning_rate": 0.00045492203151040655,
"loss": 2.0800726318359377,
"mean_token_accuracy": 0.47742178446222894,
"num_tokens": 93413171.0,
"step": 600
},
{
"entropy": 2.7831898042795857,
"epoch": 0.24472375582442538,
"grad_norm": 0.5859375,
"learning_rate": 0.00045017939505541626,
"loss": 2.0370738220214846,
"mean_token_accuracy": 0.4864190419562228,
"num_tokens": 97298042.0,
"step": 625
},
{
"entropy": 2.8064169968349897,
"epoch": 0.2545127060574024,
"grad_norm": 0.5546875,
"learning_rate": 0.00044522697109915813,
"loss": 2.061403503417969,
"mean_token_accuracy": 0.48147006407999693,
"num_tokens": 101194607.0,
"step": 650
},
{
"entropy": 2.7893201624619977,
"epoch": 0.26430165629037944,
"grad_norm": 0.5234375,
"learning_rate": 0.0004400699497694506,
"loss": 2.0294932556152343,
"mean_token_accuracy": 0.48583452555693873,
"num_tokens": 105105248.0,
"step": 675
},
{
"entropy": 2.766137535649265,
"epoch": 0.27409060652335643,
"grad_norm": 0.61328125,
"learning_rate": 0.00043471373561164396,
"loss": 2.0185002136230468,
"mean_token_accuracy": 0.48713530665141636,
"num_tokens": 108992058.0,
"step": 700
},
{
"entropy": 2.7472840214584604,
"epoch": 0.2838795567563335,
"grad_norm": 0.61328125,
"learning_rate": 0.00042916394192466997,
"loss": 2.007948150634766,
"mean_token_accuracy": 0.49140476584755016,
"num_tokens": 112863096.0,
"step": 725
},
{
"entropy": 2.8039981412212533,
"epoch": 0.29366850698931046,
"grad_norm": 0.60546875,
"learning_rate": 0.00042342638487831874,
"loss": 2.0519680786132812,
"mean_token_accuracy": 0.4848400037316914,
"num_tokens": 116741714.0,
"step": 750
},
{
"epoch": 0.29366850698931046,
"eval_bpd": 2.8368191124508524,
"eval_entropy": 2.5129475370871655,
"eval_loss": 1.963122010231018,
"eval_mean_token_accuracy": 0.49759134340714123,
"eval_nll": 1.9663331695538748,
"eval_num_tokens": 116741714.0,
"eval_ppl": 7.144430981798381,
"eval_runtime": 318.4485,
"eval_samples_per_second": 570.293,
"eval_steps_per_second": 8.912,
"step": 750
},
{
"entropy": 2.7818116819998244,
"epoch": 0.3034574572222875,
"grad_norm": 0.60546875,
"learning_rate": 0.0004175070774179078,
"loss": 2.0355569458007814,
"mean_token_accuracy": 0.4845890820401234,
"num_tokens": 120630485.0,
"step": 775
},
{
"entropy": 2.754836296553474,
"epoch": 0.3132464074552645,
"grad_norm": 0.6328125,
"learning_rate": 0.0004114122229627302,
"loss": 2.026649627685547,
"mean_token_accuracy": 0.4883731104937326,
"num_tokens": 124539577.0,
"step": 800
},
{
"entropy": 2.7313264609464514,
"epoch": 0.3230353576882415,
"grad_norm": 0.5546875,
"learning_rate": 0.00040514820890488664,
"loss": 1.9894279479980468,
"mean_token_accuracy": 0.493762371510729,
"num_tokens": 128444796.0,
"step": 825
},
{
"entropy": 2.799315380985199,
"epoch": 0.33282430792121853,
"grad_norm": 0.6171875,
"learning_rate": 0.00039872159991531533,
"loss": 2.04507568359375,
"mean_token_accuracy": 0.48317747648488935,
"num_tokens": 132371500.0,
"step": 850
},
{
"entropy": 2.7418567548344273,
"epoch": 0.3426132581541955,
"grad_norm": 0.64453125,
"learning_rate": 0.0003921391310640325,
"loss": 2.0068865966796876,
"mean_token_accuracy": 0.4890909259070856,
"num_tokens": 136267287.0,
"step": 875
},
{
"entropy": 2.7740001842357076,
"epoch": 0.35240220838717257,
"grad_norm": 0.62109375,
"learning_rate": 0.0003854077007617969,
"loss": 2.022200164794922,
"mean_token_accuracy": 0.4868092625998601,
"num_tokens": 140138103.0,
"step": 900
},
{
"entropy": 2.7364819494297907,
"epoch": 0.36219115862014956,
"grad_norm": 1.65625,
"learning_rate": 0.0003785343635305919,
"loss": 2.0004840087890625,
"mean_token_accuracy": 0.49300860279730147,
"num_tokens": 144053086.0,
"step": 925
},
{
"entropy": 2.739402972362386,
"epoch": 0.3719801088531266,
"grad_norm": 0.51953125,
"learning_rate": 0.00037152632261050483,
"loss": 1.9922245788574218,
"mean_token_accuracy": 0.4915943380171221,
"num_tokens": 147953420.0,
"step": 950
},
{
"entropy": 2.7438382548220077,
"epoch": 0.3817690590861036,
"grad_norm": 0.7265625,
"learning_rate": 0.0003643909224107492,
"loss": 2.0027291870117185,
"mean_token_accuracy": 0.48921148393722236,
"num_tokens": 151836411.0,
"step": 975
},
{
"entropy": 2.7921177392917085,
"epoch": 0.39155800931908064,
"grad_norm": 0.6171875,
"learning_rate": 0.00035713564081274257,
"loss": 2.0273634338378907,
"mean_token_accuracy": 0.48521556448666425,
"num_tokens": 155738536.0,
"step": 1000
},
{
"epoch": 0.39155800931908064,
"eval_bpd": 2.798010089627336,
"eval_entropy": 2.536048009293489,
"eval_loss": 1.9362056255340576,
"eval_mean_token_accuracy": 0.5017364167555982,
"eval_nll": 1.9394328048034677,
"eval_num_tokens": 155738536.0,
"eval_ppl": 6.95480511965251,
"eval_runtime": 318.4763,
"eval_samples_per_second": 570.243,
"eval_steps_per_second": 8.911,
"step": 1000
},
{
"entropy": 2.6852813685402612,
"epoch": 0.4013469595520576,
"grad_norm": 0.66015625,
"learning_rate": 0.0003497680813333055,
"loss": 1.966862030029297,
"mean_token_accuracy": 0.49858123107216257,
"num_tokens": 159635561.0,
"step": 1025
},
{
"entropy": 2.7182392248732024,
"epoch": 0.41113590978503467,
"grad_norm": 0.61328125,
"learning_rate": 0.0003422959651561952,
"loss": 1.9684019470214844,
"mean_token_accuracy": 0.4934097538623164,
"num_tokens": 163523845.0,
"step": 1050
},
{
"entropy": 2.723624222111781,
"epoch": 0.42092486001801166,
"grad_norm": 0.5546875,
"learning_rate": 0.0003347271230403245,
"loss": 1.9813336181640624,
"mean_token_accuracy": 0.4927086445159934,
"num_tokens": 167422317.0,
"step": 1075
},
{
"entropy": 2.692510651594633,
"epoch": 0.4307138102509887,
"grad_norm": 0.60546875,
"learning_rate": 0.00032706948711314597,
"loss": 1.9508421325683594,
"mean_token_accuracy": 0.4979150942691247,
"num_tokens": 171329965.0,
"step": 1100
},
{
"entropy": 2.7370277544203048,
"epoch": 0.4405027604839657,
"grad_norm": 0.55859375,
"learning_rate": 0.0003193310825578028,
"loss": 2.004888458251953,
"mean_token_accuracy": 0.4905988301989983,
"num_tokens": 175222947.0,
"step": 1125
},
{
"entropy": 2.7431375323996496,
"epoch": 0.45029171071694274,
"grad_norm": 0.51953125,
"learning_rate": 0.0003115200192027566,
"loss": 2.0024537658691406,
"mean_token_accuracy": 0.4898783212043249,
"num_tokens": 179148056.0,
"step": 1150
},
{
"entropy": 2.7380168134624645,
"epoch": 0.46008066094991973,
"grad_norm": 0.53515625,
"learning_rate": 0.00030364448302270787,
"loss": 1.981593017578125,
"mean_token_accuracy": 0.49313135497616134,
"num_tokens": 183043792.0,
"step": 1175
},
{
"entropy": 2.7328614630792543,
"epoch": 0.4698696111828968,
"grad_norm": 0.54296875,
"learning_rate": 0.0002957127275597154,
"loss": 1.999188690185547,
"mean_token_accuracy": 0.49086318694960057,
"num_tokens": 186926264.0,
"step": 1200
},
{
"entropy": 2.7342380331600005,
"epoch": 0.47965856141587376,
"grad_norm": 0.55078125,
"learning_rate": 0.0002877330652735044,
"loss": 1.9958016967773438,
"mean_token_accuracy": 0.491330924542103,
"num_tokens": 190854133.0,
"step": 1225
},
{
"entropy": 2.729595283099829,
"epoch": 0.48944751164885075,
"grad_norm": 0.56640625,
"learning_rate": 0.0002797138588300303,
"loss": 1.9835462951660157,
"mean_token_accuracy": 0.4924394890660959,
"num_tokens": 194753804.0,
"step": 1250
},
{
"epoch": 0.48944751164885075,
"eval_bpd": 2.7761820901665817,
"eval_entropy": 2.496259016098447,
"eval_loss": 1.9210537672042847,
"eval_mean_token_accuracy": 0.5045342520232504,
"eval_nll": 1.924302788519982,
"eval_num_tokens": 194753804.0,
"eval_ppl": 6.8503708433220005,
"eval_runtime": 318.4425,
"eval_samples_per_second": 570.304,
"eval_steps_per_second": 8.912,
"step": 1250
},
{
"entropy": 2.716212966863494,
"epoch": 0.4992364618818278,
"grad_norm": 0.53515625,
"learning_rate": 0.0002716635123374255,
"loss": 1.9872402954101562,
"mean_token_accuracy": 0.4946632478001808,
"num_tokens": 198626081.0,
"step": 1275
},
{
"entropy": 2.710371494440595,
"epoch": 0.5090254121148048,
"grad_norm": 0.578125,
"learning_rate": 0.00026359046253851537,
"loss": 1.9923269653320312,
"mean_token_accuracy": 0.4937079610850272,
"num_tokens": 202510698.0,
"step": 1300
},
{
"entropy": 2.7343069936045317,
"epoch": 0.5188143623477818,
"grad_norm": 0.55859375,
"learning_rate": 0.00025550316996913314,
"loss": 1.994044647216797,
"mean_token_accuracy": 0.49244318068188636,
"num_tokens": 206412904.0,
"step": 1325
},
{
"entropy": 2.742348145241906,
"epoch": 0.5286033125807589,
"grad_norm": 0.5390625,
"learning_rate": 0.00024741011009149944,
"loss": 1.9998208618164062,
"mean_token_accuracy": 0.4908574945170533,
"num_tokens": 210328167.0,
"step": 1350
},
{
"entropy": 2.724076816799444,
"epoch": 0.5383922628137359,
"grad_norm": 0.828125,
"learning_rate": 0.0002393197644119594,
"loss": 1.9833689880371095,
"mean_token_accuracy": 0.4942413058436947,
"num_tokens": 214229484.0,
"step": 1375
},
{
"entropy": 2.703643675804064,
"epoch": 0.5481812130467129,
"grad_norm": 0.53515625,
"learning_rate": 0.00023124061159238553,
"loss": 1.9649853515625,
"mean_token_accuracy": 0.49494697581620767,
"num_tokens": 218112413.0,
"step": 1400
},
{
"entropy": 2.676096756869268,
"epoch": 0.5579701632796898,
"grad_norm": 0.5546875,
"learning_rate": 0.0002231811185645613,
"loss": 1.9395463562011719,
"mean_token_accuracy": 0.49995920531962634,
"num_tokens": 222029177.0,
"step": 1425
},
{
"entropy": 2.7083076951825085,
"epoch": 0.567759113512667,
"grad_norm": 0.54296875,
"learning_rate": 0.00021514973165685783,
"loss": 1.9707827758789063,
"mean_token_accuracy": 0.49421519689406546,
"num_tokens": 225922154.0,
"step": 1450
},
{
"entropy": 2.6908386128611452,
"epoch": 0.5775480637456439,
"grad_norm": 0.5625,
"learning_rate": 0.00020715486774250342,
"loss": 1.9708702087402343,
"mean_token_accuracy": 0.49710921564991656,
"num_tokens": 229803415.0,
"step": 1475
},
{
"entropy": 2.6993993439695094,
"epoch": 0.5873370139786209,
"grad_norm": 0.5703125,
"learning_rate": 0.0001992049054187214,
"loss": 1.9545468139648436,
"mean_token_accuracy": 0.4976514485983912,
"num_tokens": 233716105.0,
"step": 1500
},
{
"epoch": 0.5873370139786209,
"eval_bpd": 2.7561543934923574,
"eval_entropy": 2.5443466803816968,
"eval_loss": 1.9071590900421143,
"eval_mean_token_accuracy": 0.5068238914979266,
"eval_nll": 1.9104206470371334,
"eval_num_tokens": 233716105.0,
"eval_ppl": 6.755930062868705,
"eval_runtime": 318.4228,
"eval_samples_per_second": 570.339,
"eval_steps_per_second": 8.913,
"step": 1500
},
{
"entropy": 2.6966697504184745,
"epoch": 0.5971259642115979,
"grad_norm": 0.578125,
"learning_rate": 0.00019130817622598124,
"loss": 1.9578515625,
"mean_token_accuracy": 0.4964109645637419,
"num_tokens": 237600620.0,
"step": 1525
},
{
"entropy": 2.7033514475924334,
"epoch": 0.606914914444575,
"grad_norm": 0.56640625,
"learning_rate": 0.0001834729559165655,
"loss": 1.9643101501464844,
"mean_token_accuracy": 0.49634019273442664,
"num_tokens": 241485071.0,
"step": 1550
},
{
"entropy": 2.717692422407934,
"epoch": 0.616703864677552,
"grad_norm": 0.52734375,
"learning_rate": 0.00017570745578160198,
"loss": 1.9810302734375,
"mean_token_accuracy": 0.49517153960338245,
"num_tokens": 245377062.0,
"step": 1575
},
{
"entropy": 2.725204793410659,
"epoch": 0.626492814910529,
"grad_norm": 0.515625,
"learning_rate": 0.0001680198140456516,
"loss": 1.9905001831054687,
"mean_token_accuracy": 0.4927978377032189,
"num_tokens": 249268102.0,
"step": 1600
},
{
"entropy": 2.7151895718309267,
"epoch": 0.636281765143506,
"grad_norm": 0.5703125,
"learning_rate": 0.00016041808733786915,
"loss": 1.9757655334472657,
"mean_token_accuracy": 0.49435293814632136,
"num_tokens": 253169575.0,
"step": 1625
},
{
"entropy": 2.684670246552436,
"epoch": 0.646070715376483,
"grad_norm": 0.55859375,
"learning_rate": 0.0001529102422486769,
"loss": 1.95475830078125,
"mean_token_accuracy": 0.4991906837479353,
"num_tokens": 257058288.0,
"step": 1650
},
{
"entropy": 2.7151397740572563,
"epoch": 0.6558596656094601,
"grad_norm": 0.55859375,
"learning_rate": 0.00014550414698079727,
"loss": 1.9787599182128905,
"mean_token_accuracy": 0.4948471062821136,
"num_tokens": 260965925.0,
"step": 1675
},
{
"entropy": 2.6747805638197337,
"epoch": 0.6656486158424371,
"grad_norm": 0.52734375,
"learning_rate": 0.00013820756310339665,
"loss": 1.945904998779297,
"mean_token_accuracy": 0.5007789977758781,
"num_tokens": 264875335.0,
"step": 1700
},
{
"entropy": 2.6830354690355294,
"epoch": 0.675437566075414,
"grad_norm": 0.53125,
"learning_rate": 0.00013102813741798025,
"loss": 1.9539076232910155,
"mean_token_accuracy": 0.49903066554834535,
"num_tokens": 268791461.0,
"step": 1725
},
{
"entropy": 2.662765131871894,
"epoch": 0.685226516308391,
"grad_norm": 0.56640625,
"learning_rate": 0.00012397339394456356,
"loss": 1.950017852783203,
"mean_token_accuracy": 0.5014596502385913,
"num_tokens": 272652226.0,
"step": 1750
},
{
"epoch": 0.685226516308391,
"eval_bpd": 2.7488492664222206,
"eval_entropy": 2.520750623280978,
"eval_loss": 1.902093529701233,
"eval_mean_token_accuracy": 0.5076032224026725,
"eval_nll": 1.9053571188048362,
"eval_num_tokens": 272652226.0,
"eval_ppl": 6.721807682983077,
"eval_runtime": 318.3902,
"eval_samples_per_second": 570.398,
"eval_steps_per_second": 8.914,
"step": 1750
},
{
"entropy": 2.7304805326112556,
"epoch": 0.6950154665413681,
"grad_norm": 0.5703125,
"learning_rate": 0.00011705072603651829,
"loss": 1.9920945739746094,
"mean_token_accuracy": 0.4919112391490569,
"num_tokens": 276555213.0,
"step": 1775
},
{
"entropy": 2.6686812855730433,
"epoch": 0.7048044167743451,
"grad_norm": 0.55859375,
"learning_rate": 0.00011026738863235674,
"loss": 1.9485256958007813,
"mean_token_accuracy": 0.5003510564778191,
"num_tokens": 280483168.0,
"step": 1800
},
{
"entropy": 2.739967521815523,
"epoch": 0.7145933670073221,
"grad_norm": 0.5625,
"learning_rate": 0.00010363049065257416,
"loss": 1.9830743408203124,
"mean_token_accuracy": 0.4915797393574036,
"num_tokens": 284377873.0,
"step": 1825
},
{
"entropy": 2.698982752705625,
"epoch": 0.7243823172402991,
"grad_norm": 0.625,
"learning_rate": 9.71469875495186e-05,
"loss": 1.964124755859375,
"mean_token_accuracy": 0.496017001010034,
"num_tokens": 288260608.0,
"step": 1850
},
{
"entropy": 2.683373723573216,
"epoch": 0.7341712674732762,
"grad_norm": 0.5390625,
"learning_rate": 9.082367401809396e-05,
"loss": 1.9577156066894532,
"mean_token_accuracy": 0.4987992949988984,
"num_tokens": 292198541.0,
"step": 1875
},
{
"entropy": 2.706842296094011,
"epoch": 0.7439602177062532,
"grad_norm": 0.5546875,
"learning_rate": 8.466717687493703e-05,
"loss": 1.9568612670898438,
"mean_token_accuracy": 0.4959953935881719,
"num_tokens": 296110198.0,
"step": 1900
},
{
"entropy": 2.7134012857924437,
"epoch": 0.7537491679392302,
"grad_norm": 0.53515625,
"learning_rate": 7.868394811353039e-05,
"loss": 1.989944305419922,
"mean_token_accuracy": 0.49300837097963085,
"num_tokens": 299993061.0,
"step": 1925
},
{
"entropy": 2.6834044473523524,
"epoch": 0.7635381181722072,
"grad_norm": 0.5546875,
"learning_rate": 7.288025814252918e-05,
"loss": 1.952486572265625,
"mean_token_accuracy": 0.4983726410717931,
"num_tokens": 303894183.0,
"step": 1950
},
{
"entropy": 2.6719225988585014,
"epoch": 0.7733270684051843,
"grad_norm": 0.51953125,
"learning_rate": 6.726218921438915e-05,
"loss": 1.93992919921875,
"mean_token_accuracy": 0.4986390935453886,
"num_tokens": 307806569.0,
"step": 1975
},
{
"entropy": 2.6906488245972353,
"epoch": 0.7831160186381613,
"grad_norm": 0.57421875,
"learning_rate": 6.183562905118107e-05,
"loss": 1.958197021484375,
"mean_token_accuracy": 0.4967591651106469,
"num_tokens": 311727930.0,
"step": 2000
},
{
"epoch": 0.7831160186381613,
"eval_bpd": 2.7447081438067773,
"eval_entropy": 2.5224358858056153,
"eval_loss": 1.8992265462875366,
"eval_mean_token_accuracy": 0.5077641835222869,
"eval_nll": 1.9024867113395885,
"eval_num_tokens": 311727930.0,
"eval_ppl": 6.702541020843852,
"eval_runtime": 318.3972,
"eval_samples_per_second": 570.385,
"eval_steps_per_second": 8.913,
"step": 2000
},
{
"entropy": 2.692847571895764,
"epoch": 0.7929049688711383,
"grad_norm": 0.54296875,
"learning_rate": 5.660626467427307e-05,
"loss": 1.9653746032714843,
"mean_token_accuracy": 0.4960952429953253,
"num_tokens": 315619973.0,
"step": 2025
},
{
"entropy": 2.6994904209462374,
"epoch": 0.8026939191041152,
"grad_norm": 0.546875,
"learning_rate": 5.157957644434627e-05,
"loss": 1.9680723571777343,
"mean_token_accuracy": 0.49756041665126527,
"num_tokens": 319484828.0,
"step": 2050
},
{
"entropy": 2.68640734189637,
"epoch": 0.8124828693370922,
"grad_norm": 0.52734375,
"learning_rate": 4.676083231799086e-05,
"loss": 1.9520834350585938,
"mean_token_accuracy": 0.49859836666433366,
"num_tokens": 323423122.0,
"step": 2075
},
{
"entropy": 2.6634044602616287,
"epoch": 0.8222718195700693,
"grad_norm": 0.49609375,
"learning_rate": 4.2155082326900877e-05,
"loss": 1.9399433898925782,
"mean_token_accuracy": 0.5020899480781442,
"num_tokens": 327302804.0,
"step": 2100
},
{
"entropy": 2.6912057347946354,
"epoch": 0.8320607698030463,
"grad_norm": 0.68359375,
"learning_rate": 3.7767153285453686e-05,
"loss": 1.9653933715820313,
"mean_token_accuracy": 0.49717872825327036,
"num_tokens": 331218187.0,
"step": 2125
},
{
"entropy": 2.7046046517021276,
"epoch": 0.8418497200360233,
"grad_norm": 0.5390625,
"learning_rate": 3.360164373222063e-05,
"loss": 1.982100067138672,
"mean_token_accuracy": 0.4947454706720563,
"num_tokens": 335143921.0,
"step": 2150
},
{
"entropy": 2.6821387397394765,
"epoch": 0.8516386702690003,
"grad_norm": 0.494140625,
"learning_rate": 2.966291911071012e-05,
"loss": 1.9384609985351562,
"mean_token_accuracy": 0.4992011088945707,
"num_tokens": 338985633.0,
"step": 2175
},
{
"entropy": 2.714641275012099,
"epoch": 0.8614276205019774,
"grad_norm": 0.53515625,
"learning_rate": 2.5955107194394062e-05,
"loss": 1.9649354553222655,
"mean_token_accuracy": 0.4940774985352163,
"num_tokens": 342892576.0,
"step": 2200
},
{
"entropy": 2.6872711382347774,
"epoch": 0.8712165707349544,
"grad_norm": 0.53125,
"learning_rate": 2.2482093760811617e-05,
"loss": 1.962772674560547,
"mean_token_accuracy": 0.4993625307712092,
"num_tokens": 346835933.0,
"step": 2225
},
{
"entropy": 2.676342596904866,
"epoch": 0.8810055209679314,
"grad_norm": 0.6875,
"learning_rate": 1.9247518519283968e-05,
"loss": 1.9479315185546875,
"mean_token_accuracy": 0.4994813839214091,
"num_tokens": 350719859.0,
"step": 2250
},
{
"epoch": 0.8810055209679314,
"eval_bpd": 2.7441256628978783,
"eval_entropy": 2.5175174792400643,
"eval_loss": 1.8988220691680908,
"eval_mean_token_accuracy": 0.5081831367590252,
"eval_nll": 1.902082966339855,
"eval_num_tokens": 350719859.0,
"eval_ppl": 6.699835449638354,
"eval_runtime": 318.406,
"eval_samples_per_second": 570.369,
"eval_steps_per_second": 8.913,
"step": 2250
},
{
"entropy": 2.7144406457761727,
"epoch": 0.8907944712009084,
"grad_norm": 0.546875,
"learning_rate": 1.625477129650835e-05,
"loss": 1.9875895690917968,
"mean_token_accuracy": 0.49512781017346974,
"num_tokens": 354612028.0,
"step": 2275
},
{
"entropy": 2.7052265682160703,
"epoch": 0.9005834214338855,
"grad_norm": 0.51953125,
"learning_rate": 1.3506988484027926e-05,
"loss": 1.98323486328125,
"mean_token_accuracy": 0.4958426919140038,
"num_tokens": 358517938.0,
"step": 2300
},
{
"entropy": 2.683134757355532,
"epoch": 0.9103723716668625,
"grad_norm": 0.52734375,
"learning_rate": 1.1007049751301789e-05,
"loss": 1.9486451721191407,
"mean_token_accuracy": 0.4983769791012847,
"num_tokens": 362392490.0,
"step": 2325
},
{
"entropy": 2.6868362478560734,
"epoch": 0.9201613218998395,
"grad_norm": 0.498046875,
"learning_rate": 8.757575027818238e-06,
"loss": 1.9728414916992187,
"mean_token_accuracy": 0.4980474413039569,
"num_tokens": 366305769.0,
"step": 2350
},
{
"entropy": 2.7114968257715675,
"epoch": 0.9299502721328164,
"grad_norm": 0.53515625,
"learning_rate": 6.760921757415439e-06,
"loss": 1.9739515686035156,
"mean_token_accuracy": 0.495761617308943,
"num_tokens": 370210294.0,
"step": 2375
},
{
"entropy": 2.723082096025959,
"epoch": 0.9397392223657935,
"grad_norm": 0.55859375,
"learning_rate": 5.0191824276862585e-06,
"loss": 1.9711668395996094,
"mean_token_accuracy": 0.4947962255092054,
"num_tokens": 374129359.0,
"step": 2400
},
{
"entropy": 2.7243931290128818,
"epoch": 0.9495281725987705,
"grad_norm": 0.5703125,
"learning_rate": 3.5341823770564385e-06,
"loss": 1.9800309753417968,
"mean_token_accuracy": 0.494186617936668,
"num_tokens": 378038492.0,
"step": 2425
},
{
"entropy": 2.6882893116541458,
"epoch": 0.9593171228317475,
"grad_norm": 0.5703125,
"learning_rate": 2.307477881834663e-06,
"loss": 1.960792236328125,
"mean_token_accuracy": 0.49821483996751215,
"num_tokens": 381921956.0,
"step": 2450
},
{
"entropy": 2.7129936127462098,
"epoch": 0.9691060730647245,
"grad_norm": 0.51953125,
"learning_rate": 1.340354525238785e-06,
"loss": 1.9839578247070313,
"mean_token_accuracy": 0.4944347484579711,
"num_tokens": 385800276.0,
"step": 2475
},
{
"entropy": 2.687453053126722,
"epoch": 0.9788950232977015,
"grad_norm": 0.54296875,
"learning_rate": 6.33825850107933e-07,
"loss": 1.9629275512695312,
"mean_token_accuracy": 0.49751757115833734,
"num_tokens": 389694012.0,
"step": 2500
},
{
"epoch": 0.9788950232977015,
"eval_bpd": 2.7439658028059983,
"eval_entropy": 2.518428092528893,
"eval_loss": 1.8987137079238892,
"eval_mean_token_accuracy": 0.5082029323805907,
"eval_nll": 1.9019721597678847,
"eval_num_tokens": 389694012.0,
"eval_ppl": 6.699093104968507,
"eval_runtime": 318.3733,
"eval_samples_per_second": 570.428,
"eval_steps_per_second": 8.914,
"step": 2500
}
],
"logging_steps": 25,
"max_steps": 2554,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.2656936251536998e+18,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}