Akanksha Devkar
Training in progress, step 338, checkpoint
1939c5e verified
Raw
History Blame Contribute Delete
104 kB
{
"best_global_step": 300,
"best_metric": 0.1870778650045395,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 50,
"global_step": 338,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 4.701416462659836,
"epoch": 0.002962962962962963,
"grad_norm": 24.56123924255371,
"learning_rate": 0.0,
"loss": 2.4745616912841797,
"mean_token_accuracy": 0.65498136729002,
"num_tokens": 16384.0,
"step": 1
},
{
"entropy": 4.710217773914337,
"epoch": 0.005925925925925926,
"grad_norm": 22.917617797851562,
"learning_rate": 2.0000000000000003e-06,
"loss": 2.328688859939575,
"mean_token_accuracy": 0.6696161925792694,
"num_tokens": 32768.0,
"step": 2
},
{
"entropy": 5.008031904697418,
"epoch": 0.008888888888888889,
"grad_norm": 23.581327438354492,
"learning_rate": 4.000000000000001e-06,
"loss": 2.373687982559204,
"mean_token_accuracy": 0.6377195976674557,
"num_tokens": 49152.0,
"step": 3
},
{
"entropy": 4.461768329143524,
"epoch": 0.011851851851851851,
"grad_norm": 21.659339904785156,
"learning_rate": 6e-06,
"loss": 2.188899278640747,
"mean_token_accuracy": 0.6830446049571037,
"num_tokens": 65536.0,
"step": 4
},
{
"entropy": 3.990667074918747,
"epoch": 0.014814814814814815,
"grad_norm": 27.289581298828125,
"learning_rate": 8.000000000000001e-06,
"loss": 1.9017679691314697,
"mean_token_accuracy": 0.6956704035401344,
"num_tokens": 81920.0,
"step": 5
},
{
"entropy": 4.510465860366821,
"epoch": 0.017777777777777778,
"grad_norm": 19.150859832763672,
"learning_rate": 1e-05,
"loss": 2.1146278381347656,
"mean_token_accuracy": 0.6657988280057907,
"num_tokens": 98304.0,
"step": 6
},
{
"entropy": 5.020317792892456,
"epoch": 0.02074074074074074,
"grad_norm": 15.287837982177734,
"learning_rate": 9.96996996996997e-06,
"loss": 1.7613449096679688,
"mean_token_accuracy": 0.6947520524263382,
"num_tokens": 114688.0,
"step": 7
},
{
"entropy": 4.912468284368515,
"epoch": 0.023703703703703703,
"grad_norm": 9.686163902282715,
"learning_rate": 9.93993993993994e-06,
"loss": 1.345112681388855,
"mean_token_accuracy": 0.7633048743009567,
"num_tokens": 131072.0,
"step": 8
},
{
"entropy": 4.621884375810623,
"epoch": 0.02666666666666667,
"grad_norm": 8.546224594116211,
"learning_rate": 9.90990990990991e-06,
"loss": 1.1717731952667236,
"mean_token_accuracy": 0.8044982850551605,
"num_tokens": 147456.0,
"step": 9
},
{
"entropy": 5.038796991109848,
"epoch": 0.02962962962962963,
"grad_norm": 6.685237884521484,
"learning_rate": 9.879879879879881e-06,
"loss": 1.0621838569641113,
"mean_token_accuracy": 0.7919343337416649,
"num_tokens": 163840.0,
"step": 10
},
{
"entropy": 4.503615289926529,
"epoch": 0.03259259259259259,
"grad_norm": 4.604543685913086,
"learning_rate": 9.849849849849851e-06,
"loss": 0.6260772347450256,
"mean_token_accuracy": 0.8595008999109268,
"num_tokens": 180224.0,
"step": 11
},
{
"entropy": 4.9618454575538635,
"epoch": 0.035555555555555556,
"grad_norm": 4.359870433807373,
"learning_rate": 9.81981981981982e-06,
"loss": 0.9231398105621338,
"mean_token_accuracy": 0.7866097167134285,
"num_tokens": 196608.0,
"step": 12
},
{
"entropy": 5.029646277427673,
"epoch": 0.03851851851851852,
"grad_norm": 4.168108940124512,
"learning_rate": 9.78978978978979e-06,
"loss": 0.7823256850242615,
"mean_token_accuracy": 0.8285031393170357,
"num_tokens": 212992.0,
"step": 13
},
{
"entropy": 4.752634763717651,
"epoch": 0.04148148148148148,
"grad_norm": 4.052370548248291,
"learning_rate": 9.75975975975976e-06,
"loss": 0.8456622958183289,
"mean_token_accuracy": 0.8258332759141922,
"num_tokens": 229376.0,
"step": 14
},
{
"entropy": 4.367532521486282,
"epoch": 0.044444444444444446,
"grad_norm": 2.7583987712860107,
"learning_rate": 9.729729729729732e-06,
"loss": 0.38843369483947754,
"mean_token_accuracy": 0.8896501585841179,
"num_tokens": 245760.0,
"step": 15
},
{
"entropy": 4.656139403581619,
"epoch": 0.047407407407407405,
"grad_norm": 4.212277412414551,
"learning_rate": 9.699699699699701e-06,
"loss": 0.8094176650047302,
"mean_token_accuracy": 0.8203602507710457,
"num_tokens": 262144.0,
"step": 16
},
{
"entropy": 4.927716374397278,
"epoch": 0.05037037037037037,
"grad_norm": 3.1427767276763916,
"learning_rate": 9.669669669669671e-06,
"loss": 0.6425362825393677,
"mean_token_accuracy": 0.8606718555092812,
"num_tokens": 278528.0,
"step": 17
},
{
"entropy": 5.264335453510284,
"epoch": 0.05333333333333334,
"grad_norm": 2.9270451068878174,
"learning_rate": 9.63963963963964e-06,
"loss": 0.5596555471420288,
"mean_token_accuracy": 0.8495745286345482,
"num_tokens": 294912.0,
"step": 18
},
{
"entropy": 4.823247134685516,
"epoch": 0.056296296296296296,
"grad_norm": 3.0255370140075684,
"learning_rate": 9.60960960960961e-06,
"loss": 0.5243310332298279,
"mean_token_accuracy": 0.8735020756721497,
"num_tokens": 311296.0,
"step": 19
},
{
"entropy": 4.711223393678665,
"epoch": 0.05925925925925926,
"grad_norm": 2.342226505279541,
"learning_rate": 9.57957957957958e-06,
"loss": 0.4596331715583801,
"mean_token_accuracy": 0.8677957728505135,
"num_tokens": 327680.0,
"step": 20
},
{
"entropy": 4.827401220798492,
"epoch": 0.06222222222222222,
"grad_norm": 2.128645420074463,
"learning_rate": 9.54954954954955e-06,
"loss": 0.5169314742088318,
"mean_token_accuracy": 0.8644424751400948,
"num_tokens": 344064.0,
"step": 21
},
{
"entropy": 4.730625569820404,
"epoch": 0.06518518518518518,
"grad_norm": 2.072950839996338,
"learning_rate": 9.51951951951952e-06,
"loss": 0.45018476247787476,
"mean_token_accuracy": 0.8857986330986023,
"num_tokens": 360448.0,
"step": 22
},
{
"entropy": 4.8472941517829895,
"epoch": 0.06814814814814815,
"grad_norm": 2.0330708026885986,
"learning_rate": 9.489489489489491e-06,
"loss": 0.44504502415657043,
"mean_token_accuracy": 0.8775075301527977,
"num_tokens": 376832.0,
"step": 23
},
{
"entropy": 4.573881030082703,
"epoch": 0.07111111111111111,
"grad_norm": 2.3058454990386963,
"learning_rate": 9.45945945945946e-06,
"loss": 0.4268365204334259,
"mean_token_accuracy": 0.9048123508691788,
"num_tokens": 393216.0,
"step": 24
},
{
"entropy": 4.396156758069992,
"epoch": 0.07407407407407407,
"grad_norm": 1.6368998289108276,
"learning_rate": 9.42942942942943e-06,
"loss": 0.37373656034469604,
"mean_token_accuracy": 0.9093844145536423,
"num_tokens": 409600.0,
"step": 25
},
{
"entropy": 4.735283553600311,
"epoch": 0.07703703703703704,
"grad_norm": 1.736892580986023,
"learning_rate": 9.3993993993994e-06,
"loss": 0.3806194067001343,
"mean_token_accuracy": 0.9068936184048653,
"num_tokens": 425984.0,
"step": 26
},
{
"entropy": 4.740741103887558,
"epoch": 0.08,
"grad_norm": 1.8124656677246094,
"learning_rate": 9.36936936936937e-06,
"loss": 0.4839091897010803,
"mean_token_accuracy": 0.8846660703420639,
"num_tokens": 442368.0,
"step": 27
},
{
"entropy": 4.820813536643982,
"epoch": 0.08296296296296296,
"grad_norm": 1.6148549318313599,
"learning_rate": 9.339339339339341e-06,
"loss": 0.3115249276161194,
"mean_token_accuracy": 0.9326120764017105,
"num_tokens": 458752.0,
"step": 28
},
{
"entropy": 4.844596207141876,
"epoch": 0.08592592592592592,
"grad_norm": 1.944309115409851,
"learning_rate": 9.30930930930931e-06,
"loss": 0.4823766350746155,
"mean_token_accuracy": 0.8930554986000061,
"num_tokens": 475136.0,
"step": 29
},
{
"entropy": 4.210876405239105,
"epoch": 0.08888888888888889,
"grad_norm": 1.4049290418624878,
"learning_rate": 9.27927927927928e-06,
"loss": 0.2616775631904602,
"mean_token_accuracy": 0.9358664155006409,
"num_tokens": 491520.0,
"step": 30
},
{
"entropy": 4.226673096418381,
"epoch": 0.09185185185185185,
"grad_norm": 1.5136734247207642,
"learning_rate": 9.24924924924925e-06,
"loss": 0.3573359549045563,
"mean_token_accuracy": 0.9113403558731079,
"num_tokens": 507904.0,
"step": 31
},
{
"entropy": 4.580118954181671,
"epoch": 0.09481481481481481,
"grad_norm": 1.5213615894317627,
"learning_rate": 9.21921921921922e-06,
"loss": 0.2795485854148865,
"mean_token_accuracy": 0.9298447221517563,
"num_tokens": 524288.0,
"step": 32
},
{
"entropy": 4.726915955543518,
"epoch": 0.09777777777777778,
"grad_norm": 1.466759443283081,
"learning_rate": 9.189189189189191e-06,
"loss": 0.297269344329834,
"mean_token_accuracy": 0.9181232526898384,
"num_tokens": 540672.0,
"step": 33
},
{
"entropy": 4.508806675672531,
"epoch": 0.10074074074074074,
"grad_norm": 1.411300539970398,
"learning_rate": 9.15915915915916e-06,
"loss": 0.27328386902809143,
"mean_token_accuracy": 0.9196836799383163,
"num_tokens": 557056.0,
"step": 34
},
{
"entropy": 4.150590598583221,
"epoch": 0.1037037037037037,
"grad_norm": 1.0787698030471802,
"learning_rate": 9.129129129129129e-06,
"loss": 0.2225482016801834,
"mean_token_accuracy": 0.9393472671508789,
"num_tokens": 573440.0,
"step": 35
},
{
"entropy": 4.8258116543293,
"epoch": 0.10666666666666667,
"grad_norm": 1.5515680313110352,
"learning_rate": 9.0990990990991e-06,
"loss": 0.36224499344825745,
"mean_token_accuracy": 0.9126538634300232,
"num_tokens": 589824.0,
"step": 36
},
{
"entropy": 4.613873243331909,
"epoch": 0.10962962962962963,
"grad_norm": 1.1958707571029663,
"learning_rate": 9.06906906906907e-06,
"loss": 0.2626018226146698,
"mean_token_accuracy": 0.9358126819133759,
"num_tokens": 606208.0,
"step": 37
},
{
"entropy": 4.751417100429535,
"epoch": 0.11259259259259259,
"grad_norm": 1.7754180431365967,
"learning_rate": 9.03903903903904e-06,
"loss": 0.41290533542633057,
"mean_token_accuracy": 0.8912962302565575,
"num_tokens": 622592.0,
"step": 38
},
{
"entropy": 4.497866570949554,
"epoch": 0.11555555555555555,
"grad_norm": 1.3581385612487793,
"learning_rate": 9.00900900900901e-06,
"loss": 0.3074203133583069,
"mean_token_accuracy": 0.9052062705159187,
"num_tokens": 638976.0,
"step": 39
},
{
"entropy": 3.9070385098457336,
"epoch": 0.11851851851851852,
"grad_norm": 0.9901930689811707,
"learning_rate": 8.97897897897898e-06,
"loss": 0.18705977499485016,
"mean_token_accuracy": 0.9510745629668236,
"num_tokens": 655360.0,
"step": 40
},
{
"entropy": 4.494014769792557,
"epoch": 0.12148148148148148,
"grad_norm": 0.931329071521759,
"learning_rate": 8.94894894894895e-06,
"loss": 0.15729889273643494,
"mean_token_accuracy": 0.9621974900364876,
"num_tokens": 671744.0,
"step": 41
},
{
"entropy": 4.150999903678894,
"epoch": 0.12444444444444444,
"grad_norm": 1.0970348119735718,
"learning_rate": 8.91891891891892e-06,
"loss": 0.19550678133964539,
"mean_token_accuracy": 0.9428130686283112,
"num_tokens": 688128.0,
"step": 42
},
{
"entropy": 4.554481625556946,
"epoch": 0.1274074074074074,
"grad_norm": 1.4370427131652832,
"learning_rate": 8.888888888888888e-06,
"loss": 0.281034916639328,
"mean_token_accuracy": 0.9330077469348907,
"num_tokens": 704512.0,
"step": 43
},
{
"entropy": 4.474077612161636,
"epoch": 0.13037037037037036,
"grad_norm": 1.3707451820373535,
"learning_rate": 8.85885885885886e-06,
"loss": 0.2653379440307617,
"mean_token_accuracy": 0.9189115986227989,
"num_tokens": 720896.0,
"step": 44
},
{
"entropy": 4.545973598957062,
"epoch": 0.13333333333333333,
"grad_norm": 1.3633112907409668,
"learning_rate": 8.82882882882883e-06,
"loss": 0.361990362405777,
"mean_token_accuracy": 0.914089597761631,
"num_tokens": 737280.0,
"step": 45
},
{
"entropy": 5.099069595336914,
"epoch": 0.1362962962962963,
"grad_norm": 1.5805450677871704,
"learning_rate": 8.798798798798799e-06,
"loss": 0.3552599251270294,
"mean_token_accuracy": 0.902031384408474,
"num_tokens": 753664.0,
"step": 46
},
{
"entropy": 4.682322978973389,
"epoch": 0.13925925925925925,
"grad_norm": 1.5990415811538696,
"learning_rate": 8.768768768768769e-06,
"loss": 0.2980004847049713,
"mean_token_accuracy": 0.9243276342749596,
"num_tokens": 770048.0,
"step": 47
},
{
"entropy": 3.8644610345363617,
"epoch": 0.14222222222222222,
"grad_norm": 1.1499457359313965,
"learning_rate": 8.738738738738739e-06,
"loss": 0.17076195776462555,
"mean_token_accuracy": 0.9673715531826019,
"num_tokens": 786432.0,
"step": 48
},
{
"entropy": 3.549734801054001,
"epoch": 0.1451851851851852,
"grad_norm": 1.0603333711624146,
"learning_rate": 8.70870870870871e-06,
"loss": 0.1853162944316864,
"mean_token_accuracy": 0.9549605473876,
"num_tokens": 802816.0,
"step": 49
},
{
"entropy": 4.565040707588196,
"epoch": 0.14814814814814814,
"grad_norm": 1.3161346912384033,
"learning_rate": 8.67867867867868e-06,
"loss": 0.2428000271320343,
"mean_token_accuracy": 0.941745437681675,
"num_tokens": 819200.0,
"step": 50
},
{
"epoch": 0.14814814814814814,
"eval_entropy": 4.431767495473226,
"eval_loss": 0.26340892910957336,
"eval_mean_token_accuracy": 0.9330609718958537,
"eval_num_tokens": 819200.0,
"eval_runtime": 41.8001,
"eval_samples_per_second": 14.354,
"eval_steps_per_second": 1.794,
"step": 50
},
{
"entropy": 4.543307781219482,
"epoch": 0.1511111111111111,
"grad_norm": 1.0699235200881958,
"learning_rate": 8.64864864864865e-06,
"loss": 0.21112632751464844,
"mean_token_accuracy": 0.9408096745610237,
"num_tokens": 835584.0,
"step": 51
},
{
"entropy": 4.287139475345612,
"epoch": 0.15407407407407409,
"grad_norm": 1.3812147378921509,
"learning_rate": 8.618618618618619e-06,
"loss": 0.33578288555145264,
"mean_token_accuracy": 0.8980858325958252,
"num_tokens": 851968.0,
"step": 52
},
{
"entropy": 4.334702581167221,
"epoch": 0.15703703703703703,
"grad_norm": 1.0601719617843628,
"learning_rate": 8.588588588588589e-06,
"loss": 0.20486582815647125,
"mean_token_accuracy": 0.9470738098025322,
"num_tokens": 868352.0,
"step": 53
},
{
"entropy": 4.366694152355194,
"epoch": 0.16,
"grad_norm": 1.1363606452941895,
"learning_rate": 8.55855855855856e-06,
"loss": 0.2239852249622345,
"mean_token_accuracy": 0.9437156841158867,
"num_tokens": 884736.0,
"step": 54
},
{
"entropy": 4.7676966190338135,
"epoch": 0.16296296296296298,
"grad_norm": 1.4757620096206665,
"learning_rate": 8.52852852852853e-06,
"loss": 0.2932360768318176,
"mean_token_accuracy": 0.9156305864453316,
"num_tokens": 901120.0,
"step": 55
},
{
"entropy": 3.975048542022705,
"epoch": 0.16592592592592592,
"grad_norm": 0.9454239010810852,
"learning_rate": 8.4984984984985e-06,
"loss": 0.1756972372531891,
"mean_token_accuracy": 0.9529843851923943,
"num_tokens": 917504.0,
"step": 56
},
{
"entropy": 4.308409333229065,
"epoch": 0.1688888888888889,
"grad_norm": 1.106583833694458,
"learning_rate": 8.46846846846847e-06,
"loss": 0.2179475724697113,
"mean_token_accuracy": 0.9476942420005798,
"num_tokens": 933888.0,
"step": 57
},
{
"entropy": 4.3459296226501465,
"epoch": 0.17185185185185184,
"grad_norm": 1.1199692487716675,
"learning_rate": 8.438438438438439e-06,
"loss": 0.19708535075187683,
"mean_token_accuracy": 0.9468630477786064,
"num_tokens": 950272.0,
"step": 58
},
{
"entropy": 4.2178795337677,
"epoch": 0.1748148148148148,
"grad_norm": 0.9635001420974731,
"learning_rate": 8.408408408408409e-06,
"loss": 0.22096095979213715,
"mean_token_accuracy": 0.9436954632401466,
"num_tokens": 966656.0,
"step": 59
},
{
"entropy": 4.530367374420166,
"epoch": 0.17777777777777778,
"grad_norm": 1.2648260593414307,
"learning_rate": 8.378378378378378e-06,
"loss": 0.2579096555709839,
"mean_token_accuracy": 0.9305993020534515,
"num_tokens": 983040.0,
"step": 60
},
{
"entropy": 4.394843816757202,
"epoch": 0.18074074074074073,
"grad_norm": 1.031794786453247,
"learning_rate": 8.348348348348348e-06,
"loss": 0.19525060057640076,
"mean_token_accuracy": 0.9447937682271004,
"num_tokens": 999424.0,
"step": 61
},
{
"entropy": 4.368332535028458,
"epoch": 0.1837037037037037,
"grad_norm": 1.1181342601776123,
"learning_rate": 8.31831831831832e-06,
"loss": 0.18430283665657043,
"mean_token_accuracy": 0.9516401365399361,
"num_tokens": 1015808.0,
"step": 62
},
{
"entropy": 4.473689407110214,
"epoch": 0.18666666666666668,
"grad_norm": 1.5281213521957397,
"learning_rate": 8.288288288288289e-06,
"loss": 0.2257380336523056,
"mean_token_accuracy": 0.9356214329600334,
"num_tokens": 1032192.0,
"step": 63
},
{
"entropy": 4.10108557343483,
"epoch": 0.18962962962962962,
"grad_norm": 0.8947974443435669,
"learning_rate": 8.258258258258259e-06,
"loss": 0.13964179158210754,
"mean_token_accuracy": 0.9607399925589561,
"num_tokens": 1048576.0,
"step": 64
},
{
"entropy": 4.5217985808849335,
"epoch": 0.1925925925925926,
"grad_norm": 1.2758291959762573,
"learning_rate": 8.228228228228229e-06,
"loss": 0.25637656450271606,
"mean_token_accuracy": 0.9300419837236404,
"num_tokens": 1064960.0,
"step": 65
},
{
"entropy": 4.629321813583374,
"epoch": 0.19555555555555557,
"grad_norm": 1.254235029220581,
"learning_rate": 8.198198198198198e-06,
"loss": 0.2535402774810791,
"mean_token_accuracy": 0.9174696281552315,
"num_tokens": 1081344.0,
"step": 66
},
{
"entropy": 3.9447177350521088,
"epoch": 0.1985185185185185,
"grad_norm": 0.9241489171981812,
"learning_rate": 8.16816816816817e-06,
"loss": 0.142357736825943,
"mean_token_accuracy": 0.9547562450170517,
"num_tokens": 1097728.0,
"step": 67
},
{
"entropy": 4.005536824464798,
"epoch": 0.20148148148148148,
"grad_norm": 0.9808012843132019,
"learning_rate": 8.13813813813814e-06,
"loss": 0.1787158101797104,
"mean_token_accuracy": 0.9517183899879456,
"num_tokens": 1114112.0,
"step": 68
},
{
"entropy": 4.408803582191467,
"epoch": 0.20444444444444446,
"grad_norm": 1.2708892822265625,
"learning_rate": 8.108108108108109e-06,
"loss": 0.2477702498435974,
"mean_token_accuracy": 0.927848644554615,
"num_tokens": 1130496.0,
"step": 69
},
{
"entropy": 4.427323371171951,
"epoch": 0.2074074074074074,
"grad_norm": 1.0906333923339844,
"learning_rate": 8.078078078078079e-06,
"loss": 0.18576793372631073,
"mean_token_accuracy": 0.9514018073678017,
"num_tokens": 1146880.0,
"step": 70
},
{
"entropy": 4.085136443376541,
"epoch": 0.21037037037037037,
"grad_norm": 0.9278141856193542,
"learning_rate": 8.048048048048048e-06,
"loss": 0.1597796231508255,
"mean_token_accuracy": 0.950559951364994,
"num_tokens": 1163264.0,
"step": 71
},
{
"entropy": 4.562773674726486,
"epoch": 0.21333333333333335,
"grad_norm": 1.222669005393982,
"learning_rate": 8.018018018018018e-06,
"loss": 0.23149636387825012,
"mean_token_accuracy": 0.9292395636439323,
"num_tokens": 1179648.0,
"step": 72
},
{
"entropy": 4.718744367361069,
"epoch": 0.2162962962962963,
"grad_norm": 1.4075634479522705,
"learning_rate": 7.987987987987988e-06,
"loss": 0.24038389325141907,
"mean_token_accuracy": 0.9325431138277054,
"num_tokens": 1196032.0,
"step": 73
},
{
"entropy": 5.075905919075012,
"epoch": 0.21925925925925926,
"grad_norm": 1.4967416524887085,
"learning_rate": 7.95795795795796e-06,
"loss": 0.3027274012565613,
"mean_token_accuracy": 0.9107383862137794,
"num_tokens": 1212416.0,
"step": 74
},
{
"entropy": 4.314110338687897,
"epoch": 0.2222222222222222,
"grad_norm": 0.9586232900619507,
"learning_rate": 7.927927927927929e-06,
"loss": 0.1696486622095108,
"mean_token_accuracy": 0.9494581520557404,
"num_tokens": 1228800.0,
"step": 75
},
{
"entropy": 4.872310161590576,
"epoch": 0.22518518518518518,
"grad_norm": 1.5255279541015625,
"learning_rate": 7.897897897897899e-06,
"loss": 0.3269280195236206,
"mean_token_accuracy": 0.9095799848437309,
"num_tokens": 1245184.0,
"step": 76
},
{
"entropy": 4.42020907998085,
"epoch": 0.22814814814814816,
"grad_norm": 1.4026970863342285,
"learning_rate": 7.867867867867868e-06,
"loss": 0.2915046215057373,
"mean_token_accuracy": 0.9215874075889587,
"num_tokens": 1261568.0,
"step": 77
},
{
"entropy": 4.672393083572388,
"epoch": 0.2311111111111111,
"grad_norm": 1.1211456060409546,
"learning_rate": 7.837837837837838e-06,
"loss": 0.17860044538974762,
"mean_token_accuracy": 0.9532517418265343,
"num_tokens": 1277952.0,
"step": 78
},
{
"entropy": 4.263626158237457,
"epoch": 0.23407407407407407,
"grad_norm": 1.2703758478164673,
"learning_rate": 7.807807807807808e-06,
"loss": 0.20677883923053741,
"mean_token_accuracy": 0.9517276138067245,
"num_tokens": 1294336.0,
"step": 79
},
{
"entropy": 4.612537890672684,
"epoch": 0.23703703703703705,
"grad_norm": 1.1560204029083252,
"learning_rate": 7.77777777777778e-06,
"loss": 0.20464098453521729,
"mean_token_accuracy": 0.9621888473629951,
"num_tokens": 1310720.0,
"step": 80
},
{
"entropy": 3.743598461151123,
"epoch": 0.24,
"grad_norm": 0.9571014046669006,
"learning_rate": 7.747747747747749e-06,
"loss": 0.16432294249534607,
"mean_token_accuracy": 0.949650265276432,
"num_tokens": 1327104.0,
"step": 81
},
{
"entropy": 4.481620937585831,
"epoch": 0.24296296296296296,
"grad_norm": 1.1675502061843872,
"learning_rate": 7.717717717717719e-06,
"loss": 0.21761369705200195,
"mean_token_accuracy": 0.9432580098509789,
"num_tokens": 1343488.0,
"step": 82
},
{
"entropy": 4.632976651191711,
"epoch": 0.24592592592592594,
"grad_norm": 1.4137561321258545,
"learning_rate": 7.687687687687688e-06,
"loss": 0.25227683782577515,
"mean_token_accuracy": 0.9236670285463333,
"num_tokens": 1359872.0,
"step": 83
},
{
"entropy": 4.919981598854065,
"epoch": 0.24888888888888888,
"grad_norm": 1.4102532863616943,
"learning_rate": 7.657657657657658e-06,
"loss": 0.28805384039878845,
"mean_token_accuracy": 0.9161391258239746,
"num_tokens": 1376256.0,
"step": 84
},
{
"entropy": 4.675688982009888,
"epoch": 0.2518518518518518,
"grad_norm": 1.0484553575515747,
"learning_rate": 7.6276276276276285e-06,
"loss": 0.17043615877628326,
"mean_token_accuracy": 0.9514751136302948,
"num_tokens": 1392640.0,
"step": 85
},
{
"entropy": 4.214458107948303,
"epoch": 0.2548148148148148,
"grad_norm": 0.9503604769706726,
"learning_rate": 7.597597597597598e-06,
"loss": 0.15311528742313385,
"mean_token_accuracy": 0.9494195133447647,
"num_tokens": 1409024.0,
"step": 86
},
{
"entropy": 4.548118233680725,
"epoch": 0.2577777777777778,
"grad_norm": 1.2899352312088013,
"learning_rate": 7.567567567567569e-06,
"loss": 0.2427193522453308,
"mean_token_accuracy": 0.9302617087960243,
"num_tokens": 1425408.0,
"step": 87
},
{
"entropy": 4.833130061626434,
"epoch": 0.2607407407407407,
"grad_norm": 1.1198095083236694,
"learning_rate": 7.5375375375375385e-06,
"loss": 0.2029549777507782,
"mean_token_accuracy": 0.9402985349297523,
"num_tokens": 1441792.0,
"step": 88
},
{
"entropy": 4.751594722270966,
"epoch": 0.2637037037037037,
"grad_norm": 1.1558674573898315,
"learning_rate": 7.507507507507507e-06,
"loss": 0.19649912416934967,
"mean_token_accuracy": 0.9425910338759422,
"num_tokens": 1458176.0,
"step": 89
},
{
"entropy": 4.8306790590286255,
"epoch": 0.26666666666666666,
"grad_norm": 1.3417739868164062,
"learning_rate": 7.477477477477479e-06,
"loss": 0.2961505055427551,
"mean_token_accuracy": 0.9253265932202339,
"num_tokens": 1474560.0,
"step": 90
},
{
"entropy": 4.5884115397930145,
"epoch": 0.2696296296296296,
"grad_norm": 1.0663913488388062,
"learning_rate": 7.447447447447448e-06,
"loss": 0.22267302870750427,
"mean_token_accuracy": 0.9426953792572021,
"num_tokens": 1490944.0,
"step": 91
},
{
"entropy": 4.409365922212601,
"epoch": 0.2725925925925926,
"grad_norm": 1.1096484661102295,
"learning_rate": 7.417417417417418e-06,
"loss": 0.26577574014663696,
"mean_token_accuracy": 0.9276531934738159,
"num_tokens": 1507328.0,
"step": 92
},
{
"entropy": 4.979451894760132,
"epoch": 0.27555555555555555,
"grad_norm": 1.0621061325073242,
"learning_rate": 7.387387387387388e-06,
"loss": 0.17089557647705078,
"mean_token_accuracy": 0.9540339037775993,
"num_tokens": 1523712.0,
"step": 93
},
{
"entropy": 4.742478549480438,
"epoch": 0.2785185185185185,
"grad_norm": 1.1826844215393066,
"learning_rate": 7.3573573573573575e-06,
"loss": 0.22930549085140228,
"mean_token_accuracy": 0.9388362243771553,
"num_tokens": 1540096.0,
"step": 94
},
{
"entropy": 4.794544339179993,
"epoch": 0.2814814814814815,
"grad_norm": 1.6299753189086914,
"learning_rate": 7.327327327327328e-06,
"loss": 0.28972867131233215,
"mean_token_accuracy": 0.9282878786325455,
"num_tokens": 1556480.0,
"step": 95
},
{
"entropy": 4.752287656068802,
"epoch": 0.28444444444444444,
"grad_norm": 1.3292368650436401,
"learning_rate": 7.297297297297298e-06,
"loss": 0.27213218808174133,
"mean_token_accuracy": 0.9241840839385986,
"num_tokens": 1572864.0,
"step": 96
},
{
"entropy": 4.4966756999492645,
"epoch": 0.2874074074074074,
"grad_norm": 1.0797817707061768,
"learning_rate": 7.267267267267268e-06,
"loss": 0.22773189842700958,
"mean_token_accuracy": 0.9454372152686119,
"num_tokens": 1589248.0,
"step": 97
},
{
"entropy": 4.7066821455955505,
"epoch": 0.2903703703703704,
"grad_norm": 1.4515063762664795,
"learning_rate": 7.237237237237238e-06,
"loss": 0.33411750197410583,
"mean_token_accuracy": 0.9117428660392761,
"num_tokens": 1605632.0,
"step": 98
},
{
"entropy": 4.119100630283356,
"epoch": 0.29333333333333333,
"grad_norm": 0.9465159773826599,
"learning_rate": 7.207207207207208e-06,
"loss": 0.14733517169952393,
"mean_token_accuracy": 0.9545356035232544,
"num_tokens": 1622016.0,
"step": 99
},
{
"entropy": 4.246767520904541,
"epoch": 0.2962962962962963,
"grad_norm": 1.176724910736084,
"learning_rate": 7.177177177177178e-06,
"loss": 0.30558162927627563,
"mean_token_accuracy": 0.9205343350768089,
"num_tokens": 1638400.0,
"step": 100
},
{
"epoch": 0.2962962962962963,
"eval_entropy": 4.449052244822184,
"eval_loss": 0.21724973618984222,
"eval_mean_token_accuracy": 0.9431627003351847,
"eval_num_tokens": 1638400.0,
"eval_runtime": 41.8075,
"eval_samples_per_second": 14.351,
"eval_steps_per_second": 1.794,
"step": 100
},
{
"entropy": 4.789787411689758,
"epoch": 0.2992592592592593,
"grad_norm": 1.145389199256897,
"learning_rate": 7.147147147147148e-06,
"loss": 0.15895400941371918,
"mean_token_accuracy": 0.9540646523237228,
"num_tokens": 1654784.0,
"step": 101
},
{
"entropy": 4.701952874660492,
"epoch": 0.3022222222222222,
"grad_norm": 1.3662292957305908,
"learning_rate": 7.117117117117117e-06,
"loss": 0.2931893467903137,
"mean_token_accuracy": 0.9204913973808289,
"num_tokens": 1671168.0,
"step": 102
},
{
"entropy": 4.134100794792175,
"epoch": 0.30518518518518517,
"grad_norm": 0.8953816294670105,
"learning_rate": 7.087087087087087e-06,
"loss": 0.1295047253370285,
"mean_token_accuracy": 0.9587932080030441,
"num_tokens": 1687552.0,
"step": 103
},
{
"entropy": 4.094232052564621,
"epoch": 0.30814814814814817,
"grad_norm": 1.1214549541473389,
"learning_rate": 7.057057057057057e-06,
"loss": 0.2239776849746704,
"mean_token_accuracy": 0.9460462778806686,
"num_tokens": 1703936.0,
"step": 104
},
{
"entropy": 4.961356997489929,
"epoch": 0.3111111111111111,
"grad_norm": 1.514918565750122,
"learning_rate": 7.027027027027028e-06,
"loss": 0.3581639528274536,
"mean_token_accuracy": 0.9032787084579468,
"num_tokens": 1720320.0,
"step": 105
},
{
"entropy": 4.607772380113602,
"epoch": 0.31407407407407406,
"grad_norm": 1.0798094272613525,
"learning_rate": 6.996996996996997e-06,
"loss": 0.23729060590267181,
"mean_token_accuracy": 0.9380658268928528,
"num_tokens": 1736704.0,
"step": 106
},
{
"entropy": 3.8316372632980347,
"epoch": 0.31703703703703706,
"grad_norm": 0.8145128488540649,
"learning_rate": 6.966966966966967e-06,
"loss": 0.1603461354970932,
"mean_token_accuracy": 0.9523681923747063,
"num_tokens": 1753088.0,
"step": 107
},
{
"entropy": 4.021235078573227,
"epoch": 0.32,
"grad_norm": 1.1897822618484497,
"learning_rate": 6.936936936936938e-06,
"loss": 0.2039574235677719,
"mean_token_accuracy": 0.9393771886825562,
"num_tokens": 1769472.0,
"step": 108
},
{
"entropy": 4.5552674531936646,
"epoch": 0.32296296296296295,
"grad_norm": 1.3548667430877686,
"learning_rate": 6.906906906906907e-06,
"loss": 0.2532401978969574,
"mean_token_accuracy": 0.9329179599881172,
"num_tokens": 1785856.0,
"step": 109
},
{
"entropy": 4.35027739405632,
"epoch": 0.32592592592592595,
"grad_norm": 1.1885968446731567,
"learning_rate": 6.876876876876878e-06,
"loss": 0.16808564960956573,
"mean_token_accuracy": 0.9461491629481316,
"num_tokens": 1802240.0,
"step": 110
},
{
"entropy": 4.751055091619492,
"epoch": 0.3288888888888889,
"grad_norm": 1.1899914741516113,
"learning_rate": 6.846846846846848e-06,
"loss": 0.26376423239707947,
"mean_token_accuracy": 0.9329497367143631,
"num_tokens": 1818624.0,
"step": 111
},
{
"entropy": 4.269050449132919,
"epoch": 0.33185185185185184,
"grad_norm": 1.1826343536376953,
"learning_rate": 6.816816816816817e-06,
"loss": 0.1682528555393219,
"mean_token_accuracy": 0.9482125043869019,
"num_tokens": 1835008.0,
"step": 112
},
{
"entropy": 4.640616059303284,
"epoch": 0.3348148148148148,
"grad_norm": 1.166980504989624,
"learning_rate": 6.786786786786788e-06,
"loss": 0.238769069314003,
"mean_token_accuracy": 0.9331283867359161,
"num_tokens": 1851392.0,
"step": 113
},
{
"entropy": 4.051734387874603,
"epoch": 0.3377777777777778,
"grad_norm": 0.9284724593162537,
"learning_rate": 6.7567567567567575e-06,
"loss": 0.11436547338962555,
"mean_token_accuracy": 0.9699687361717224,
"num_tokens": 1867776.0,
"step": 114
},
{
"entropy": 4.884681403636932,
"epoch": 0.34074074074074073,
"grad_norm": 1.0763801336288452,
"learning_rate": 6.726726726726728e-06,
"loss": 0.1629171222448349,
"mean_token_accuracy": 0.9543235972523689,
"num_tokens": 1884160.0,
"step": 115
},
{
"entropy": 4.778160870075226,
"epoch": 0.3437037037037037,
"grad_norm": 0.8610367178916931,
"learning_rate": 6.696696696696697e-06,
"loss": 0.12890088558197021,
"mean_token_accuracy": 0.9653410091996193,
"num_tokens": 1900544.0,
"step": 116
},
{
"entropy": 4.650707423686981,
"epoch": 0.3466666666666667,
"grad_norm": 1.150089144706726,
"learning_rate": 6.666666666666667e-06,
"loss": 0.21885131299495697,
"mean_token_accuracy": 0.9310262873768806,
"num_tokens": 1916928.0,
"step": 117
},
{
"entropy": 4.634554773569107,
"epoch": 0.3496296296296296,
"grad_norm": 1.1062830686569214,
"learning_rate": 6.636636636636637e-06,
"loss": 0.2054327428340912,
"mean_token_accuracy": 0.9322185516357422,
"num_tokens": 1933312.0,
"step": 118
},
{
"entropy": 4.514108449220657,
"epoch": 0.35259259259259257,
"grad_norm": 1.1394360065460205,
"learning_rate": 6.606606606606607e-06,
"loss": 0.2247684895992279,
"mean_token_accuracy": 0.9467405527830124,
"num_tokens": 1949696.0,
"step": 119
},
{
"entropy": 4.34781551361084,
"epoch": 0.35555555555555557,
"grad_norm": 1.0121259689331055,
"learning_rate": 6.5765765765765775e-06,
"loss": 0.1715734302997589,
"mean_token_accuracy": 0.9512444362044334,
"num_tokens": 1966080.0,
"step": 120
},
{
"entropy": 4.744591236114502,
"epoch": 0.3585185185185185,
"grad_norm": 1.1714106798171997,
"learning_rate": 6.546546546546547e-06,
"loss": 0.23964054882526398,
"mean_token_accuracy": 0.9383665025234222,
"num_tokens": 1982464.0,
"step": 121
},
{
"entropy": 4.511653900146484,
"epoch": 0.36148148148148146,
"grad_norm": 1.2332781553268433,
"learning_rate": 6.516516516516517e-06,
"loss": 0.23672592639923096,
"mean_token_accuracy": 0.9448187202215195,
"num_tokens": 1998848.0,
"step": 122
},
{
"entropy": 4.528300076723099,
"epoch": 0.36444444444444446,
"grad_norm": 0.917389452457428,
"learning_rate": 6.486486486486487e-06,
"loss": 0.15570732951164246,
"mean_token_accuracy": 0.9560035914182663,
"num_tokens": 2015232.0,
"step": 123
},
{
"entropy": 4.652964890003204,
"epoch": 0.3674074074074074,
"grad_norm": 1.0291730165481567,
"learning_rate": 6.456456456456457e-06,
"loss": 0.19984155893325806,
"mean_token_accuracy": 0.9478033557534218,
"num_tokens": 2031616.0,
"step": 124
},
{
"entropy": 4.196425557136536,
"epoch": 0.37037037037037035,
"grad_norm": 0.9853512048721313,
"learning_rate": 6.426426426426427e-06,
"loss": 0.17781120538711548,
"mean_token_accuracy": 0.9526060372591019,
"num_tokens": 2048000.0,
"step": 125
},
{
"entropy": 4.501747310161591,
"epoch": 0.37333333333333335,
"grad_norm": 0.885403037071228,
"learning_rate": 6.396396396396397e-06,
"loss": 0.10924738645553589,
"mean_token_accuracy": 0.9751126244664192,
"num_tokens": 2064384.0,
"step": 126
},
{
"entropy": 4.62592014670372,
"epoch": 0.3762962962962963,
"grad_norm": 1.5773086547851562,
"learning_rate": 6.366366366366366e-06,
"loss": 0.3295811414718628,
"mean_token_accuracy": 0.9110967963933945,
"num_tokens": 2080768.0,
"step": 127
},
{
"entropy": 5.021280109882355,
"epoch": 0.37925925925925924,
"grad_norm": 1.380358338356018,
"learning_rate": 6.336336336336338e-06,
"loss": 0.20020775496959686,
"mean_token_accuracy": 0.9450817406177521,
"num_tokens": 2097152.0,
"step": 128
},
{
"entropy": 4.440324813127518,
"epoch": 0.38222222222222224,
"grad_norm": 1.1773418188095093,
"learning_rate": 6.3063063063063065e-06,
"loss": 0.22019381821155548,
"mean_token_accuracy": 0.9418660625815392,
"num_tokens": 2113536.0,
"step": 129
},
{
"entropy": 4.698460668325424,
"epoch": 0.3851851851851852,
"grad_norm": 1.1396949291229248,
"learning_rate": 6.276276276276276e-06,
"loss": 0.18115706741809845,
"mean_token_accuracy": 0.94284238666296,
"num_tokens": 2129920.0,
"step": 130
},
{
"entropy": 5.005904167890549,
"epoch": 0.38814814814814813,
"grad_norm": 1.1489640474319458,
"learning_rate": 6.246246246246247e-06,
"loss": 0.14725539088249207,
"mean_token_accuracy": 0.9511874690651894,
"num_tokens": 2146304.0,
"step": 131
},
{
"entropy": 5.031860530376434,
"epoch": 0.39111111111111113,
"grad_norm": 1.3990733623504639,
"learning_rate": 6.2162162162162164e-06,
"loss": 0.24054200947284698,
"mean_token_accuracy": 0.9300425425171852,
"num_tokens": 2162688.0,
"step": 132
},
{
"entropy": 4.654724597930908,
"epoch": 0.3940740740740741,
"grad_norm": 1.083472728729248,
"learning_rate": 6.186186186186187e-06,
"loss": 0.21355129778385162,
"mean_token_accuracy": 0.9333104565739632,
"num_tokens": 2179072.0,
"step": 133
},
{
"entropy": 4.3352950513362885,
"epoch": 0.397037037037037,
"grad_norm": 1.2197173833847046,
"learning_rate": 6.156156156156157e-06,
"loss": 0.27208036184310913,
"mean_token_accuracy": 0.924175500869751,
"num_tokens": 2195456.0,
"step": 134
},
{
"entropy": 4.924069583415985,
"epoch": 0.4,
"grad_norm": 1.3885170221328735,
"learning_rate": 6.126126126126126e-06,
"loss": 0.2448231726884842,
"mean_token_accuracy": 0.93735421448946,
"num_tokens": 2211840.0,
"step": 135
},
{
"entropy": 4.7157105803489685,
"epoch": 0.40296296296296297,
"grad_norm": 1.4344000816345215,
"learning_rate": 6.096096096096097e-06,
"loss": 0.2515410780906677,
"mean_token_accuracy": 0.9249624758958817,
"num_tokens": 2228224.0,
"step": 136
},
{
"entropy": 4.590086460113525,
"epoch": 0.4059259259259259,
"grad_norm": 1.2284572124481201,
"learning_rate": 6.066066066066067e-06,
"loss": 0.2063797265291214,
"mean_token_accuracy": 0.9442784413695335,
"num_tokens": 2244608.0,
"step": 137
},
{
"entropy": 4.807889759540558,
"epoch": 0.4088888888888889,
"grad_norm": 1.7174497842788696,
"learning_rate": 6.036036036036037e-06,
"loss": 0.3287466764450073,
"mean_token_accuracy": 0.9112606719136238,
"num_tokens": 2260992.0,
"step": 138
},
{
"entropy": 4.269232541322708,
"epoch": 0.41185185185185186,
"grad_norm": 0.8105608224868774,
"learning_rate": 6.006006006006007e-06,
"loss": 0.12416984885931015,
"mean_token_accuracy": 0.9590313956141472,
"num_tokens": 2277376.0,
"step": 139
},
{
"entropy": 4.601140409708023,
"epoch": 0.4148148148148148,
"grad_norm": 1.2158101797103882,
"learning_rate": 5.975975975975976e-06,
"loss": 0.19056841731071472,
"mean_token_accuracy": 0.9466198459267616,
"num_tokens": 2293760.0,
"step": 140
},
{
"entropy": 5.092256844043732,
"epoch": 0.4177777777777778,
"grad_norm": 1.4425084590911865,
"learning_rate": 5.945945945945947e-06,
"loss": 0.30024221539497375,
"mean_token_accuracy": 0.9206296429038048,
"num_tokens": 2310144.0,
"step": 141
},
{
"entropy": 5.037581652402878,
"epoch": 0.42074074074074075,
"grad_norm": 1.5531865358352661,
"learning_rate": 5.915915915915916e-06,
"loss": 0.3754885196685791,
"mean_token_accuracy": 0.9084843918681145,
"num_tokens": 2326528.0,
"step": 142
},
{
"entropy": 4.724683046340942,
"epoch": 0.4237037037037037,
"grad_norm": 1.1647831201553345,
"learning_rate": 5.885885885885886e-06,
"loss": 0.26595643162727356,
"mean_token_accuracy": 0.9294901490211487,
"num_tokens": 2342912.0,
"step": 143
},
{
"entropy": 4.66888752579689,
"epoch": 0.4266666666666667,
"grad_norm": 1.2422510385513306,
"learning_rate": 5.855855855855856e-06,
"loss": 0.201975479722023,
"mean_token_accuracy": 0.937431775033474,
"num_tokens": 2359296.0,
"step": 144
},
{
"entropy": 5.061137318611145,
"epoch": 0.42962962962962964,
"grad_norm": 1.1814007759094238,
"learning_rate": 5.825825825825826e-06,
"loss": 0.21096129715442657,
"mean_token_accuracy": 0.944946400821209,
"num_tokens": 2375680.0,
"step": 145
},
{
"entropy": 4.937180817127228,
"epoch": 0.4325925925925926,
"grad_norm": 1.3031474351882935,
"learning_rate": 5.7957957957957965e-06,
"loss": 0.24075299501419067,
"mean_token_accuracy": 0.9233498498797417,
"num_tokens": 2392064.0,
"step": 146
},
{
"entropy": 4.4801307916641235,
"epoch": 0.43555555555555553,
"grad_norm": 1.0523452758789062,
"learning_rate": 5.765765765765766e-06,
"loss": 0.20990847051143646,
"mean_token_accuracy": 0.9455097988247871,
"num_tokens": 2408448.0,
"step": 147
},
{
"entropy": 4.410671651363373,
"epoch": 0.43851851851851853,
"grad_norm": 1.1729801893234253,
"learning_rate": 5.735735735735736e-06,
"loss": 0.20666182041168213,
"mean_token_accuracy": 0.9527652785181999,
"num_tokens": 2424832.0,
"step": 148
},
{
"entropy": 4.266784578561783,
"epoch": 0.4414814814814815,
"grad_norm": 1.0994833707809448,
"learning_rate": 5.7057057057057065e-06,
"loss": 0.17016655206680298,
"mean_token_accuracy": 0.9391877725720406,
"num_tokens": 2441216.0,
"step": 149
},
{
"entropy": 4.919064462184906,
"epoch": 0.4444444444444444,
"grad_norm": 1.5136151313781738,
"learning_rate": 5.675675675675676e-06,
"loss": 0.33089369535446167,
"mean_token_accuracy": 0.9111267700791359,
"num_tokens": 2457600.0,
"step": 150
},
{
"epoch": 0.4444444444444444,
"eval_entropy": 4.473293965657552,
"eval_loss": 0.20222364366054535,
"eval_mean_token_accuracy": 0.9461187330881754,
"eval_num_tokens": 2457600.0,
"eval_runtime": 41.8195,
"eval_samples_per_second": 14.347,
"eval_steps_per_second": 1.793,
"step": 150
},
{
"entropy": 4.558058649301529,
"epoch": 0.4474074074074074,
"grad_norm": 1.5376884937286377,
"learning_rate": 5.645645645645647e-06,
"loss": 0.3638846278190613,
"mean_token_accuracy": 0.9130012094974518,
"num_tokens": 2473984.0,
"step": 151
},
{
"entropy": 4.655219286680222,
"epoch": 0.45037037037037037,
"grad_norm": 1.4485206604003906,
"learning_rate": 5.615615615615616e-06,
"loss": 0.29070550203323364,
"mean_token_accuracy": 0.9349231794476509,
"num_tokens": 2490368.0,
"step": 152
},
{
"entropy": 4.120410114526749,
"epoch": 0.4533333333333333,
"grad_norm": 1.4900908470153809,
"learning_rate": 5.585585585585585e-06,
"loss": 0.2075977772474289,
"mean_token_accuracy": 0.941280372440815,
"num_tokens": 2506752.0,
"step": 153
},
{
"entropy": 4.852829605340958,
"epoch": 0.4562962962962963,
"grad_norm": 1.2578136920928955,
"learning_rate": 5.555555555555557e-06,
"loss": 0.2637161612510681,
"mean_token_accuracy": 0.9209686145186424,
"num_tokens": 2523136.0,
"step": 154
},
{
"entropy": 4.84997946023941,
"epoch": 0.45925925925925926,
"grad_norm": 1.26620352268219,
"learning_rate": 5.5255255255255255e-06,
"loss": 0.2449718415737152,
"mean_token_accuracy": 0.9436092749238014,
"num_tokens": 2539520.0,
"step": 155
},
{
"entropy": 4.473124235868454,
"epoch": 0.4622222222222222,
"grad_norm": 1.0916240215301514,
"learning_rate": 5.495495495495496e-06,
"loss": 0.19546659290790558,
"mean_token_accuracy": 0.9399038553237915,
"num_tokens": 2555904.0,
"step": 156
},
{
"entropy": 4.941104412078857,
"epoch": 0.4651851851851852,
"grad_norm": 1.2782196998596191,
"learning_rate": 5.465465465465466e-06,
"loss": 0.2740520238876343,
"mean_token_accuracy": 0.929001159965992,
"num_tokens": 2572288.0,
"step": 157
},
{
"entropy": 4.457964479923248,
"epoch": 0.46814814814814815,
"grad_norm": 0.8856244087219238,
"learning_rate": 5.4354354354354355e-06,
"loss": 0.1418902426958084,
"mean_token_accuracy": 0.9622244611382484,
"num_tokens": 2588672.0,
"step": 158
},
{
"entropy": 5.035272657871246,
"epoch": 0.4711111111111111,
"grad_norm": 1.441379427909851,
"learning_rate": 5.405405405405406e-06,
"loss": 0.27133798599243164,
"mean_token_accuracy": 0.9293553680181503,
"num_tokens": 2605056.0,
"step": 159
},
{
"entropy": 4.293529689311981,
"epoch": 0.4740740740740741,
"grad_norm": 0.9786353707313538,
"learning_rate": 5.375375375375376e-06,
"loss": 0.16610291600227356,
"mean_token_accuracy": 0.9514764472842216,
"num_tokens": 2621440.0,
"step": 160
},
{
"entropy": 4.59603413939476,
"epoch": 0.47703703703703704,
"grad_norm": 1.0930979251861572,
"learning_rate": 5.345345345345346e-06,
"loss": 0.18105587363243103,
"mean_token_accuracy": 0.9463809877634048,
"num_tokens": 2637824.0,
"step": 161
},
{
"entropy": 4.2250096797943115,
"epoch": 0.48,
"grad_norm": 1.1273365020751953,
"learning_rate": 5.315315315315316e-06,
"loss": 0.14089903235435486,
"mean_token_accuracy": 0.9578321501612663,
"num_tokens": 2654208.0,
"step": 162
},
{
"entropy": 4.682773381471634,
"epoch": 0.482962962962963,
"grad_norm": 1.227596402168274,
"learning_rate": 5.285285285285286e-06,
"loss": 0.19611728191375732,
"mean_token_accuracy": 0.9440445899963379,
"num_tokens": 2670592.0,
"step": 163
},
{
"entropy": 4.8632601499557495,
"epoch": 0.48592592592592593,
"grad_norm": 1.4043176174163818,
"learning_rate": 5.255255255255256e-06,
"loss": 0.3586108684539795,
"mean_token_accuracy": 0.906936950981617,
"num_tokens": 2686976.0,
"step": 164
},
{
"entropy": 4.995940268039703,
"epoch": 0.4888888888888889,
"grad_norm": 1.2404309511184692,
"learning_rate": 5.225225225225226e-06,
"loss": 0.24390891194343567,
"mean_token_accuracy": 0.9296717569231987,
"num_tokens": 2703360.0,
"step": 165
},
{
"entropy": 4.797116637229919,
"epoch": 0.4918518518518519,
"grad_norm": 1.1622867584228516,
"learning_rate": 5.195195195195195e-06,
"loss": 0.23147624731063843,
"mean_token_accuracy": 0.9457610249519348,
"num_tokens": 2719744.0,
"step": 166
},
{
"entropy": 4.39326399564743,
"epoch": 0.4948148148148148,
"grad_norm": 0.9756916761398315,
"learning_rate": 5.165165165165165e-06,
"loss": 0.17684155702590942,
"mean_token_accuracy": 0.9526332467794418,
"num_tokens": 2736128.0,
"step": 167
},
{
"entropy": 4.997508525848389,
"epoch": 0.49777777777777776,
"grad_norm": 1.3051714897155762,
"learning_rate": 5.135135135135135e-06,
"loss": 0.2765073776245117,
"mean_token_accuracy": 0.9134911745786667,
"num_tokens": 2752512.0,
"step": 168
},
{
"entropy": 4.755920052528381,
"epoch": 0.5007407407407407,
"grad_norm": 1.1401017904281616,
"learning_rate": 5.105105105105106e-06,
"loss": 0.161317840218544,
"mean_token_accuracy": 0.956555500626564,
"num_tokens": 2768896.0,
"step": 169
},
{
"entropy": 4.551803827285767,
"epoch": 0.5037037037037037,
"grad_norm": 1.263131022453308,
"learning_rate": 5.075075075075075e-06,
"loss": 0.21821963787078857,
"mean_token_accuracy": 0.9273721501231194,
"num_tokens": 2785280.0,
"step": 170
},
{
"entropy": 4.860443592071533,
"epoch": 0.5066666666666667,
"grad_norm": 1.6431126594543457,
"learning_rate": 5.045045045045045e-06,
"loss": 0.2978250980377197,
"mean_token_accuracy": 0.93219093978405,
"num_tokens": 2801664.0,
"step": 171
},
{
"entropy": 5.091837644577026,
"epoch": 0.5096296296296297,
"grad_norm": 1.2256911993026733,
"learning_rate": 5.0150150150150156e-06,
"loss": 0.22089162468910217,
"mean_token_accuracy": 0.9408608600497246,
"num_tokens": 2818048.0,
"step": 172
},
{
"entropy": 4.412120908498764,
"epoch": 0.5125925925925926,
"grad_norm": 0.961300253868103,
"learning_rate": 4.984984984984985e-06,
"loss": 0.1452527940273285,
"mean_token_accuracy": 0.9523980766534805,
"num_tokens": 2834432.0,
"step": 173
},
{
"entropy": 4.599301666021347,
"epoch": 0.5155555555555555,
"grad_norm": 1.2644505500793457,
"learning_rate": 4.954954954954955e-06,
"loss": 0.23289738595485687,
"mean_token_accuracy": 0.9304530620574951,
"num_tokens": 2850816.0,
"step": 174
},
{
"entropy": 4.892768442630768,
"epoch": 0.5185185185185185,
"grad_norm": 1.3745007514953613,
"learning_rate": 4.9249249249249255e-06,
"loss": 0.26232171058654785,
"mean_token_accuracy": 0.9334614500403404,
"num_tokens": 2867200.0,
"step": 175
},
{
"entropy": 4.197520017623901,
"epoch": 0.5214814814814814,
"grad_norm": 0.7528343796730042,
"learning_rate": 4.894894894894895e-06,
"loss": 0.08706651628017426,
"mean_token_accuracy": 0.9749511107802391,
"num_tokens": 2883584.0,
"step": 176
},
{
"entropy": 4.844129204750061,
"epoch": 0.5244444444444445,
"grad_norm": 0.9900454878807068,
"learning_rate": 4.864864864864866e-06,
"loss": 0.13525359332561493,
"mean_token_accuracy": 0.9629090502858162,
"num_tokens": 2899968.0,
"step": 177
},
{
"entropy": 4.392915487289429,
"epoch": 0.5274074074074074,
"grad_norm": 1.133989691734314,
"learning_rate": 4.8348348348348355e-06,
"loss": 0.21110782027244568,
"mean_token_accuracy": 0.9441019669175148,
"num_tokens": 2916352.0,
"step": 178
},
{
"entropy": 4.104142814874649,
"epoch": 0.5303703703703704,
"grad_norm": 0.850631833076477,
"learning_rate": 4.804804804804805e-06,
"loss": 0.10834487527608871,
"mean_token_accuracy": 0.9692110046744347,
"num_tokens": 2932736.0,
"step": 179
},
{
"entropy": 4.734551101922989,
"epoch": 0.5333333333333333,
"grad_norm": 1.3208616971969604,
"learning_rate": 4.774774774774775e-06,
"loss": 0.23270879685878754,
"mean_token_accuracy": 0.9379692524671555,
"num_tokens": 2949120.0,
"step": 180
},
{
"entropy": 4.912560999393463,
"epoch": 0.5362962962962963,
"grad_norm": 1.2346423864364624,
"learning_rate": 4.7447447447447454e-06,
"loss": 0.19857312738895416,
"mean_token_accuracy": 0.9455485790967941,
"num_tokens": 2965504.0,
"step": 181
},
{
"entropy": 4.509212881326675,
"epoch": 0.5392592592592592,
"grad_norm": 1.0463180541992188,
"learning_rate": 4.714714714714715e-06,
"loss": 0.16583660244941711,
"mean_token_accuracy": 0.9510217607021332,
"num_tokens": 2981888.0,
"step": 182
},
{
"entropy": 4.015108644962311,
"epoch": 0.5422222222222223,
"grad_norm": 1.0624524354934692,
"learning_rate": 4.684684684684685e-06,
"loss": 0.15331816673278809,
"mean_token_accuracy": 0.9658570662140846,
"num_tokens": 2998272.0,
"step": 183
},
{
"entropy": 4.083783894777298,
"epoch": 0.5451851851851852,
"grad_norm": 0.9544261693954468,
"learning_rate": 4.654654654654655e-06,
"loss": 0.14625918865203857,
"mean_token_accuracy": 0.9399384111166,
"num_tokens": 3014656.0,
"step": 184
},
{
"entropy": 4.890080273151398,
"epoch": 0.5481481481481482,
"grad_norm": 1.2931667566299438,
"learning_rate": 4.624624624624625e-06,
"loss": 0.24348178505897522,
"mean_token_accuracy": 0.938007041811943,
"num_tokens": 3031040.0,
"step": 185
},
{
"entropy": 4.95048725605011,
"epoch": 0.5511111111111111,
"grad_norm": 1.5240236520767212,
"learning_rate": 4.594594594594596e-06,
"loss": 0.343029260635376,
"mean_token_accuracy": 0.9150973930954933,
"num_tokens": 3047424.0,
"step": 186
},
{
"entropy": 4.586461454629898,
"epoch": 0.554074074074074,
"grad_norm": 1.1299018859863281,
"learning_rate": 4.5645645645645645e-06,
"loss": 0.15247294306755066,
"mean_token_accuracy": 0.9517891779541969,
"num_tokens": 3063808.0,
"step": 187
},
{
"entropy": 4.866858541965485,
"epoch": 0.557037037037037,
"grad_norm": 1.3016594648361206,
"learning_rate": 4.534534534534535e-06,
"loss": 0.21522042155265808,
"mean_token_accuracy": 0.9356319904327393,
"num_tokens": 3080192.0,
"step": 188
},
{
"entropy": 4.672504544258118,
"epoch": 0.56,
"grad_norm": 1.055087924003601,
"learning_rate": 4.504504504504505e-06,
"loss": 0.2004142701625824,
"mean_token_accuracy": 0.9426759034395218,
"num_tokens": 3096576.0,
"step": 189
},
{
"entropy": 4.583247601985931,
"epoch": 0.562962962962963,
"grad_norm": 1.2147111892700195,
"learning_rate": 4.474474474474475e-06,
"loss": 0.19617295265197754,
"mean_token_accuracy": 0.9414351284503937,
"num_tokens": 3112960.0,
"step": 190
},
{
"entropy": 4.45947140455246,
"epoch": 0.5659259259259259,
"grad_norm": 0.9906570911407471,
"learning_rate": 4.444444444444444e-06,
"loss": 0.1671217381954193,
"mean_token_accuracy": 0.949979692697525,
"num_tokens": 3129344.0,
"step": 191
},
{
"entropy": 4.343527674674988,
"epoch": 0.5688888888888889,
"grad_norm": 1.0607426166534424,
"learning_rate": 4.414414414414415e-06,
"loss": 0.1750665307044983,
"mean_token_accuracy": 0.9508633464574814,
"num_tokens": 3145728.0,
"step": 192
},
{
"entropy": 4.752969801425934,
"epoch": 0.5718518518518518,
"grad_norm": 1.6461411714553833,
"learning_rate": 4.384384384384384e-06,
"loss": 0.3614075481891632,
"mean_token_accuracy": 0.9037638604640961,
"num_tokens": 3162112.0,
"step": 193
},
{
"entropy": 4.508844017982483,
"epoch": 0.5748148148148148,
"grad_norm": 1.089011549949646,
"learning_rate": 4.354354354354355e-06,
"loss": 0.14948895573616028,
"mean_token_accuracy": 0.9594759792089462,
"num_tokens": 3178496.0,
"step": 194
},
{
"entropy": 5.090130269527435,
"epoch": 0.5777777777777777,
"grad_norm": 1.6512131690979004,
"learning_rate": 4.324324324324325e-06,
"loss": 0.2583276331424713,
"mean_token_accuracy": 0.9319260492920876,
"num_tokens": 3194880.0,
"step": 195
},
{
"entropy": 4.824137568473816,
"epoch": 0.5807407407407408,
"grad_norm": 1.3563088178634644,
"learning_rate": 4.294294294294294e-06,
"loss": 0.2706582546234131,
"mean_token_accuracy": 0.9324178025126457,
"num_tokens": 3211264.0,
"step": 196
},
{
"entropy": 4.71843621134758,
"epoch": 0.5837037037037037,
"grad_norm": 1.3810391426086426,
"learning_rate": 4.264264264264265e-06,
"loss": 0.24942129850387573,
"mean_token_accuracy": 0.9400762096047401,
"num_tokens": 3227648.0,
"step": 197
},
{
"entropy": 5.009927153587341,
"epoch": 0.5866666666666667,
"grad_norm": 1.4821265935897827,
"learning_rate": 4.234234234234235e-06,
"loss": 0.24027667939662933,
"mean_token_accuracy": 0.9404318556189537,
"num_tokens": 3244032.0,
"step": 198
},
{
"entropy": 4.441025912761688,
"epoch": 0.5896296296296296,
"grad_norm": 1.1178737878799438,
"learning_rate": 4.204204204204204e-06,
"loss": 0.16021518409252167,
"mean_token_accuracy": 0.9493553563952446,
"num_tokens": 3260416.0,
"step": 199
},
{
"entropy": 4.375000834465027,
"epoch": 0.5925925925925926,
"grad_norm": 0.8944060206413269,
"learning_rate": 4.174174174174174e-06,
"loss": 0.11856413632631302,
"mean_token_accuracy": 0.9657595604658127,
"num_tokens": 3276800.0,
"step": 200
},
{
"epoch": 0.5925925925925926,
"eval_entropy": 4.434207131067912,
"eval_loss": 0.19389286637306213,
"eval_mean_token_accuracy": 0.9477152585983276,
"eval_num_tokens": 3276800.0,
"eval_runtime": 41.8193,
"eval_samples_per_second": 14.347,
"eval_steps_per_second": 1.793,
"step": 200
},
{
"entropy": 4.466799020767212,
"epoch": 0.5955555555555555,
"grad_norm": 1.115869402885437,
"learning_rate": 4.1441441441441446e-06,
"loss": 0.1898970603942871,
"mean_token_accuracy": 0.9451106563210487,
"num_tokens": 3293184.0,
"step": 201
},
{
"entropy": 4.269784092903137,
"epoch": 0.5985185185185186,
"grad_norm": 0.9474321603775024,
"learning_rate": 4.114114114114114e-06,
"loss": 0.13602310419082642,
"mean_token_accuracy": 0.9589507281780243,
"num_tokens": 3309568.0,
"step": 202
},
{
"entropy": 4.54515814781189,
"epoch": 0.6014814814814815,
"grad_norm": 1.2822232246398926,
"learning_rate": 4.084084084084085e-06,
"loss": 0.22034525871276855,
"mean_token_accuracy": 0.9429414942860603,
"num_tokens": 3325952.0,
"step": 203
},
{
"entropy": 4.767253935337067,
"epoch": 0.6044444444444445,
"grad_norm": 1.2094990015029907,
"learning_rate": 4.0540540540540545e-06,
"loss": 0.23143570125102997,
"mean_token_accuracy": 0.9389630481600761,
"num_tokens": 3342336.0,
"step": 204
},
{
"entropy": 4.702608406543732,
"epoch": 0.6074074074074074,
"grad_norm": 1.2544713020324707,
"learning_rate": 4.024024024024024e-06,
"loss": 0.28470316529273987,
"mean_token_accuracy": 0.9257371500134468,
"num_tokens": 3358720.0,
"step": 205
},
{
"entropy": 4.597526431083679,
"epoch": 0.6103703703703703,
"grad_norm": 1.1126115322113037,
"learning_rate": 3.993993993993994e-06,
"loss": 0.1989898383617401,
"mean_token_accuracy": 0.9416873753070831,
"num_tokens": 3375104.0,
"step": 206
},
{
"entropy": 4.506279408931732,
"epoch": 0.6133333333333333,
"grad_norm": 0.8431299328804016,
"learning_rate": 3.9639639639639645e-06,
"loss": 0.13484124839305878,
"mean_token_accuracy": 0.95867919921875,
"num_tokens": 3391488.0,
"step": 207
},
{
"entropy": 4.58755087852478,
"epoch": 0.6162962962962963,
"grad_norm": 1.352049708366394,
"learning_rate": 3.933933933933934e-06,
"loss": 0.22309252619743347,
"mean_token_accuracy": 0.9428984001278877,
"num_tokens": 3407872.0,
"step": 208
},
{
"entropy": 4.268629372119904,
"epoch": 0.6192592592592593,
"grad_norm": 1.1418225765228271,
"learning_rate": 3.903903903903904e-06,
"loss": 0.24874381721019745,
"mean_token_accuracy": 0.9192089438438416,
"num_tokens": 3424256.0,
"step": 209
},
{
"entropy": 4.83259379863739,
"epoch": 0.6222222222222222,
"grad_norm": 1.3404130935668945,
"learning_rate": 3.8738738738738744e-06,
"loss": 0.24457751214504242,
"mean_token_accuracy": 0.937289871275425,
"num_tokens": 3440640.0,
"step": 210
},
{
"entropy": 4.678910106420517,
"epoch": 0.6251851851851852,
"grad_norm": 1.2527177333831787,
"learning_rate": 3.843843843843844e-06,
"loss": 0.22603629529476166,
"mean_token_accuracy": 0.9248089641332626,
"num_tokens": 3457024.0,
"step": 211
},
{
"entropy": 4.5991188287734985,
"epoch": 0.6281481481481481,
"grad_norm": 0.9777531623840332,
"learning_rate": 3.8138138138138143e-06,
"loss": 0.14755500853061676,
"mean_token_accuracy": 0.9557277113199234,
"num_tokens": 3473408.0,
"step": 212
},
{
"entropy": 4.511403858661652,
"epoch": 0.6311111111111111,
"grad_norm": 1.2577223777770996,
"learning_rate": 3.7837837837837844e-06,
"loss": 0.26127955317497253,
"mean_token_accuracy": 0.931500144302845,
"num_tokens": 3489792.0,
"step": 213
},
{
"entropy": 4.782365560531616,
"epoch": 0.6340740740740741,
"grad_norm": 1.1569401025772095,
"learning_rate": 3.7537537537537537e-06,
"loss": 0.19748210906982422,
"mean_token_accuracy": 0.9451235607266426,
"num_tokens": 3506176.0,
"step": 214
},
{
"entropy": 4.5431535840034485,
"epoch": 0.6370370370370371,
"grad_norm": 1.0455090999603271,
"learning_rate": 3.723723723723724e-06,
"loss": 0.18465566635131836,
"mean_token_accuracy": 0.947294220328331,
"num_tokens": 3522560.0,
"step": 215
},
{
"entropy": 4.15060818195343,
"epoch": 0.64,
"grad_norm": 0.9153735041618347,
"learning_rate": 3.693693693693694e-06,
"loss": 0.12476930022239685,
"mean_token_accuracy": 0.960964560508728,
"num_tokens": 3538944.0,
"step": 216
},
{
"entropy": 4.939278542995453,
"epoch": 0.642962962962963,
"grad_norm": 1.75506591796875,
"learning_rate": 3.663663663663664e-06,
"loss": 0.33442193269729614,
"mean_token_accuracy": 0.9232882410287857,
"num_tokens": 3555328.0,
"step": 217
},
{
"entropy": 4.662109076976776,
"epoch": 0.6459259259259259,
"grad_norm": 1.198652744293213,
"learning_rate": 3.633633633633634e-06,
"loss": 0.1985606849193573,
"mean_token_accuracy": 0.9437128081917763,
"num_tokens": 3571712.0,
"step": 218
},
{
"entropy": 4.011054754257202,
"epoch": 0.6488888888888888,
"grad_norm": 0.7987180352210999,
"learning_rate": 3.603603603603604e-06,
"loss": 0.12160375714302063,
"mean_token_accuracy": 0.9573516696691513,
"num_tokens": 3588096.0,
"step": 219
},
{
"entropy": 4.471042722463608,
"epoch": 0.6518518518518519,
"grad_norm": 1.1055737733840942,
"learning_rate": 3.573573573573574e-06,
"loss": 0.1902877688407898,
"mean_token_accuracy": 0.9458613023161888,
"num_tokens": 3604480.0,
"step": 220
},
{
"entropy": 4.585752725601196,
"epoch": 0.6548148148148148,
"grad_norm": 1.390073299407959,
"learning_rate": 3.5435435435435437e-06,
"loss": 0.2900771200656891,
"mean_token_accuracy": 0.9287381917238235,
"num_tokens": 3620864.0,
"step": 221
},
{
"entropy": 4.868175387382507,
"epoch": 0.6577777777777778,
"grad_norm": 1.0750362873077393,
"learning_rate": 3.513513513513514e-06,
"loss": 0.14728227257728577,
"mean_token_accuracy": 0.9561847373843193,
"num_tokens": 3637248.0,
"step": 222
},
{
"entropy": 4.30068638920784,
"epoch": 0.6607407407407407,
"grad_norm": 0.9645360112190247,
"learning_rate": 3.4834834834834835e-06,
"loss": 0.1360422521829605,
"mean_token_accuracy": 0.963471345603466,
"num_tokens": 3653632.0,
"step": 223
},
{
"entropy": 3.964165151119232,
"epoch": 0.6637037037037037,
"grad_norm": 0.8071714043617249,
"learning_rate": 3.4534534534534537e-06,
"loss": 0.1220124140381813,
"mean_token_accuracy": 0.9683285132050514,
"num_tokens": 3670016.0,
"step": 224
},
{
"entropy": 4.224881365895271,
"epoch": 0.6666666666666666,
"grad_norm": 1.177420973777771,
"learning_rate": 3.423423423423424e-06,
"loss": 0.25342920422554016,
"mean_token_accuracy": 0.9281225427985191,
"num_tokens": 3686400.0,
"step": 225
},
{
"entropy": 4.558864623308182,
"epoch": 0.6696296296296296,
"grad_norm": 1.1701397895812988,
"learning_rate": 3.393393393393394e-06,
"loss": 0.17833128571510315,
"mean_token_accuracy": 0.9490250796079636,
"num_tokens": 3702784.0,
"step": 226
},
{
"entropy": 4.978881150484085,
"epoch": 0.6725925925925926,
"grad_norm": 1.158742070198059,
"learning_rate": 3.363363363363364e-06,
"loss": 0.20285750925540924,
"mean_token_accuracy": 0.9312335178256035,
"num_tokens": 3719168.0,
"step": 227
},
{
"entropy": 4.179438591003418,
"epoch": 0.6755555555555556,
"grad_norm": 1.008829116821289,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.12895622849464417,
"mean_token_accuracy": 0.959755003452301,
"num_tokens": 3735552.0,
"step": 228
},
{
"entropy": 4.323319256305695,
"epoch": 0.6785185185185185,
"grad_norm": 0.979805588722229,
"learning_rate": 3.3033033033033035e-06,
"loss": 0.16936425864696503,
"mean_token_accuracy": 0.9553892686963081,
"num_tokens": 3751936.0,
"step": 229
},
{
"entropy": 4.394837021827698,
"epoch": 0.6814814814814815,
"grad_norm": 1.8132017850875854,
"learning_rate": 3.2732732732732736e-06,
"loss": 0.14924685657024384,
"mean_token_accuracy": 0.9515182301402092,
"num_tokens": 3768320.0,
"step": 230
},
{
"entropy": 4.344091087579727,
"epoch": 0.6844444444444444,
"grad_norm": 1.021894097328186,
"learning_rate": 3.2432432432432437e-06,
"loss": 0.1912682056427002,
"mean_token_accuracy": 0.938031829893589,
"num_tokens": 3784704.0,
"step": 231
},
{
"entropy": 4.561292320489883,
"epoch": 0.6874074074074074,
"grad_norm": 0.9297524094581604,
"learning_rate": 3.2132132132132134e-06,
"loss": 0.14056260883808136,
"mean_token_accuracy": 0.9600224196910858,
"num_tokens": 3801088.0,
"step": 232
},
{
"entropy": 4.751155436038971,
"epoch": 0.6903703703703704,
"grad_norm": 1.4993069171905518,
"learning_rate": 3.183183183183183e-06,
"loss": 0.3311198055744171,
"mean_token_accuracy": 0.91727364808321,
"num_tokens": 3817472.0,
"step": 233
},
{
"entropy": 3.6052426397800446,
"epoch": 0.6933333333333334,
"grad_norm": 0.792428195476532,
"learning_rate": 3.1531531531531532e-06,
"loss": 0.10642168670892715,
"mean_token_accuracy": 0.9628430530428886,
"num_tokens": 3833856.0,
"step": 234
},
{
"entropy": 4.941285133361816,
"epoch": 0.6962962962962963,
"grad_norm": 1.4012000560760498,
"learning_rate": 3.1231231231231234e-06,
"loss": 0.2629278600215912,
"mean_token_accuracy": 0.9188983291387558,
"num_tokens": 3850240.0,
"step": 235
},
{
"entropy": 4.552713304758072,
"epoch": 0.6992592592592592,
"grad_norm": 0.9069911241531372,
"learning_rate": 3.0930930930930935e-06,
"loss": 0.12337417900562286,
"mean_token_accuracy": 0.9626295566558838,
"num_tokens": 3866624.0,
"step": 236
},
{
"entropy": 4.564219534397125,
"epoch": 0.7022222222222222,
"grad_norm": 0.9812677502632141,
"learning_rate": 3.063063063063063e-06,
"loss": 0.1848071813583374,
"mean_token_accuracy": 0.9507527649402618,
"num_tokens": 3883008.0,
"step": 237
},
{
"entropy": 4.246627330780029,
"epoch": 0.7051851851851851,
"grad_norm": 0.947043776512146,
"learning_rate": 3.0330330330330333e-06,
"loss": 0.1329410970211029,
"mean_token_accuracy": 0.9477042853832245,
"num_tokens": 3899392.0,
"step": 238
},
{
"entropy": 4.977287948131561,
"epoch": 0.7081481481481482,
"grad_norm": 1.1813249588012695,
"learning_rate": 3.0030030030030034e-06,
"loss": 0.14123371243476868,
"mean_token_accuracy": 0.9628991261124611,
"num_tokens": 3915776.0,
"step": 239
},
{
"entropy": 5.06807667016983,
"epoch": 0.7111111111111111,
"grad_norm": 1.3652091026306152,
"learning_rate": 2.9729729729729736e-06,
"loss": 0.1918249875307083,
"mean_token_accuracy": 0.9512263685464859,
"num_tokens": 3932160.0,
"step": 240
},
{
"entropy": 4.769917339086533,
"epoch": 0.7140740740740741,
"grad_norm": 1.279091477394104,
"learning_rate": 2.942942942942943e-06,
"loss": 0.20959080755710602,
"mean_token_accuracy": 0.9461727887392044,
"num_tokens": 3948544.0,
"step": 241
},
{
"entropy": 4.704398810863495,
"epoch": 0.717037037037037,
"grad_norm": 1.2999058961868286,
"learning_rate": 2.912912912912913e-06,
"loss": 0.214752659201622,
"mean_token_accuracy": 0.9327414259314537,
"num_tokens": 3964928.0,
"step": 242
},
{
"entropy": 4.448032274842262,
"epoch": 0.72,
"grad_norm": 1.1233701705932617,
"learning_rate": 2.882882882882883e-06,
"loss": 0.2309226542711258,
"mean_token_accuracy": 0.9327290877699852,
"num_tokens": 3981312.0,
"step": 243
},
{
"entropy": 4.651471734046936,
"epoch": 0.7229629629629629,
"grad_norm": 1.2081260681152344,
"learning_rate": 2.8528528528528532e-06,
"loss": 0.20126961171627045,
"mean_token_accuracy": 0.9540340229868889,
"num_tokens": 3997696.0,
"step": 244
},
{
"entropy": 3.968225985765457,
"epoch": 0.725925925925926,
"grad_norm": 0.9694662690162659,
"learning_rate": 2.8228228228228234e-06,
"loss": 0.15460558235645294,
"mean_token_accuracy": 0.9566036984324455,
"num_tokens": 4014080.0,
"step": 245
},
{
"entropy": 4.390538901090622,
"epoch": 0.7288888888888889,
"grad_norm": 0.8548852205276489,
"learning_rate": 2.7927927927927926e-06,
"loss": 0.097850002348423,
"mean_token_accuracy": 0.9653645381331444,
"num_tokens": 4030464.0,
"step": 246
},
{
"entropy": 4.503017544746399,
"epoch": 0.7318518518518519,
"grad_norm": 1.3469693660736084,
"learning_rate": 2.7627627627627628e-06,
"loss": 0.24841120839118958,
"mean_token_accuracy": 0.9232476502656937,
"num_tokens": 4046848.0,
"step": 247
},
{
"entropy": 4.462825655937195,
"epoch": 0.7348148148148148,
"grad_norm": 1.4217870235443115,
"learning_rate": 2.732732732732733e-06,
"loss": 0.19937056303024292,
"mean_token_accuracy": 0.935769684612751,
"num_tokens": 4063232.0,
"step": 248
},
{
"entropy": 4.652177691459656,
"epoch": 0.7377777777777778,
"grad_norm": 0.8824627995491028,
"learning_rate": 2.702702702702703e-06,
"loss": 0.10789984464645386,
"mean_token_accuracy": 0.960510291159153,
"num_tokens": 4079616.0,
"step": 249
},
{
"entropy": 4.937440276145935,
"epoch": 0.7407407407407407,
"grad_norm": 1.3179996013641357,
"learning_rate": 2.672672672672673e-06,
"loss": 0.2225571870803833,
"mean_token_accuracy": 0.9387790188193321,
"num_tokens": 4096000.0,
"step": 250
},
{
"epoch": 0.7407407407407407,
"eval_entropy": 4.431756820678711,
"eval_loss": 0.18967284262180328,
"eval_mean_token_accuracy": 0.9489845228195191,
"eval_num_tokens": 4096000.0,
"eval_runtime": 41.787,
"eval_samples_per_second": 14.359,
"eval_steps_per_second": 1.795,
"step": 250
},
{
"entropy": 4.682657957077026,
"epoch": 0.7437037037037038,
"grad_norm": 1.3843475580215454,
"learning_rate": 2.642642642642643e-06,
"loss": 0.289166659116745,
"mean_token_accuracy": 0.9240095615386963,
"num_tokens": 4112384.0,
"step": 251
},
{
"entropy": 4.640824466943741,
"epoch": 0.7466666666666667,
"grad_norm": 1.3217209577560425,
"learning_rate": 2.612612612612613e-06,
"loss": 0.1822134405374527,
"mean_token_accuracy": 0.9433777928352356,
"num_tokens": 4128768.0,
"step": 252
},
{
"entropy": 4.447018921375275,
"epoch": 0.7496296296296296,
"grad_norm": 1.1168774366378784,
"learning_rate": 2.5825825825825827e-06,
"loss": 0.17142070829868317,
"mean_token_accuracy": 0.9459712356328964,
"num_tokens": 4145152.0,
"step": 253
},
{
"entropy": 3.9602254927158356,
"epoch": 0.7525925925925926,
"grad_norm": 0.8399432897567749,
"learning_rate": 2.552552552552553e-06,
"loss": 0.12639330327510834,
"mean_token_accuracy": 0.9613935053348541,
"num_tokens": 4161536.0,
"step": 254
},
{
"entropy": 4.601360231637955,
"epoch": 0.7555555555555555,
"grad_norm": 1.5550976991653442,
"learning_rate": 2.5225225225225225e-06,
"loss": 0.3048744797706604,
"mean_token_accuracy": 0.9272002652287483,
"num_tokens": 4177920.0,
"step": 255
},
{
"entropy": 4.242599338293076,
"epoch": 0.7585185185185185,
"grad_norm": 0.7686388492584229,
"learning_rate": 2.4924924924924926e-06,
"loss": 0.10443609952926636,
"mean_token_accuracy": 0.9714921414852142,
"num_tokens": 4194304.0,
"step": 256
},
{
"entropy": 4.363556146621704,
"epoch": 0.7614814814814815,
"grad_norm": 1.1787077188491821,
"learning_rate": 2.4624624624624628e-06,
"loss": 0.204661563038826,
"mean_token_accuracy": 0.9339022636413574,
"num_tokens": 4210688.0,
"step": 257
},
{
"entropy": 4.804235219955444,
"epoch": 0.7644444444444445,
"grad_norm": 1.2627975940704346,
"learning_rate": 2.432432432432433e-06,
"loss": 0.2364749014377594,
"mean_token_accuracy": 0.9268576577305794,
"num_tokens": 4227072.0,
"step": 258
},
{
"entropy": 4.747017592191696,
"epoch": 0.7674074074074074,
"grad_norm": 1.2610846757888794,
"learning_rate": 2.4024024024024026e-06,
"loss": 0.22435243427753448,
"mean_token_accuracy": 0.9417654201388359,
"num_tokens": 4243456.0,
"step": 259
},
{
"entropy": 4.638267368078232,
"epoch": 0.7703703703703704,
"grad_norm": 0.9914318323135376,
"learning_rate": 2.3723723723723727e-06,
"loss": 0.13380999863147736,
"mean_token_accuracy": 0.9633992239832878,
"num_tokens": 4259840.0,
"step": 260
},
{
"entropy": 4.573302686214447,
"epoch": 0.7733333333333333,
"grad_norm": 1.0350133180618286,
"learning_rate": 2.3423423423423424e-06,
"loss": 0.12615230679512024,
"mean_token_accuracy": 0.9685780853033066,
"num_tokens": 4276224.0,
"step": 261
},
{
"entropy": 4.689242094755173,
"epoch": 0.7762962962962963,
"grad_norm": 1.2482013702392578,
"learning_rate": 2.3123123123123125e-06,
"loss": 0.23291385173797607,
"mean_token_accuracy": 0.9366420358419418,
"num_tokens": 4292608.0,
"step": 262
},
{
"entropy": 3.998199611902237,
"epoch": 0.7792592592592592,
"grad_norm": 1.0057257413864136,
"learning_rate": 2.2822822822822822e-06,
"loss": 0.17179888486862183,
"mean_token_accuracy": 0.9553137645125389,
"num_tokens": 4308992.0,
"step": 263
},
{
"entropy": 4.225500136613846,
"epoch": 0.7822222222222223,
"grad_norm": 1.0887339115142822,
"learning_rate": 2.2522522522522524e-06,
"loss": 0.19778764247894287,
"mean_token_accuracy": 0.9462638273835182,
"num_tokens": 4325376.0,
"step": 264
},
{
"entropy": 4.825541436672211,
"epoch": 0.7851851851851852,
"grad_norm": 1.3681272268295288,
"learning_rate": 2.222222222222222e-06,
"loss": 0.2275351583957672,
"mean_token_accuracy": 0.9374270439147949,
"num_tokens": 4341760.0,
"step": 265
},
{
"entropy": 4.241901844739914,
"epoch": 0.7881481481481482,
"grad_norm": 0.8523630499839783,
"learning_rate": 2.192192192192192e-06,
"loss": 0.12036363780498505,
"mean_token_accuracy": 0.965179368853569,
"num_tokens": 4358144.0,
"step": 266
},
{
"entropy": 4.517692267894745,
"epoch": 0.7911111111111111,
"grad_norm": 1.3278928995132446,
"learning_rate": 2.1621621621621623e-06,
"loss": 0.22415080666542053,
"mean_token_accuracy": 0.9306197762489319,
"num_tokens": 4374528.0,
"step": 267
},
{
"entropy": 4.571178376674652,
"epoch": 0.794074074074074,
"grad_norm": 1.1973634958267212,
"learning_rate": 2.1321321321321325e-06,
"loss": 0.20524609088897705,
"mean_token_accuracy": 0.9440915882587433,
"num_tokens": 4390912.0,
"step": 268
},
{
"entropy": 4.527001351118088,
"epoch": 0.797037037037037,
"grad_norm": 1.1548199653625488,
"learning_rate": 2.102102102102102e-06,
"loss": 0.17511600255966187,
"mean_token_accuracy": 0.9538666158914566,
"num_tokens": 4407296.0,
"step": 269
},
{
"entropy": 4.6544947028160095,
"epoch": 0.8,
"grad_norm": 1.2351737022399902,
"learning_rate": 2.0720720720720723e-06,
"loss": 0.19483497738838196,
"mean_token_accuracy": 0.9452883303165436,
"num_tokens": 4423680.0,
"step": 270
},
{
"entropy": 5.057309329509735,
"epoch": 0.802962962962963,
"grad_norm": 1.6245460510253906,
"learning_rate": 2.0420420420420424e-06,
"loss": 0.2552773952484131,
"mean_token_accuracy": 0.9292241409420967,
"num_tokens": 4440064.0,
"step": 271
},
{
"entropy": 4.319163411855698,
"epoch": 0.8059259259259259,
"grad_norm": 1.1663082838058472,
"learning_rate": 2.012012012012012e-06,
"loss": 0.20227555930614471,
"mean_token_accuracy": 0.9424327984452248,
"num_tokens": 4456448.0,
"step": 272
},
{
"entropy": 4.2681728303432465,
"epoch": 0.8088888888888889,
"grad_norm": 1.123548150062561,
"learning_rate": 1.9819819819819822e-06,
"loss": 0.14079917967319489,
"mean_token_accuracy": 0.9620539620518684,
"num_tokens": 4472832.0,
"step": 273
},
{
"entropy": 4.891470432281494,
"epoch": 0.8118518518518518,
"grad_norm": 1.4096643924713135,
"learning_rate": 1.951951951951952e-06,
"loss": 0.28214773535728455,
"mean_token_accuracy": 0.9280454739928246,
"num_tokens": 4489216.0,
"step": 274
},
{
"entropy": 4.890909731388092,
"epoch": 0.8148148148148148,
"grad_norm": 1.5594446659088135,
"learning_rate": 1.921921921921922e-06,
"loss": 0.27530887722969055,
"mean_token_accuracy": 0.9204972609877586,
"num_tokens": 4505600.0,
"step": 275
},
{
"entropy": 4.334610432386398,
"epoch": 0.8177777777777778,
"grad_norm": 0.8866946697235107,
"learning_rate": 1.8918918918918922e-06,
"loss": 0.10634834319353104,
"mean_token_accuracy": 0.974961668252945,
"num_tokens": 4521984.0,
"step": 276
},
{
"entropy": 4.795411825180054,
"epoch": 0.8207407407407408,
"grad_norm": 1.2682218551635742,
"learning_rate": 1.861861861861862e-06,
"loss": 0.23752596974372864,
"mean_token_accuracy": 0.9372685104608536,
"num_tokens": 4538368.0,
"step": 277
},
{
"entropy": 4.446784436702728,
"epoch": 0.8237037037037037,
"grad_norm": 1.0979875326156616,
"learning_rate": 1.831831831831832e-06,
"loss": 0.17328760027885437,
"mean_token_accuracy": 0.9520234763622284,
"num_tokens": 4554752.0,
"step": 278
},
{
"entropy": 5.077227234840393,
"epoch": 0.8266666666666667,
"grad_norm": 1.7083468437194824,
"learning_rate": 1.801801801801802e-06,
"loss": 0.3257288336753845,
"mean_token_accuracy": 0.9132296666502953,
"num_tokens": 4571136.0,
"step": 279
},
{
"entropy": 4.317785233259201,
"epoch": 0.8296296296296296,
"grad_norm": 0.9281159043312073,
"learning_rate": 1.7717717717717719e-06,
"loss": 0.1367281675338745,
"mean_token_accuracy": 0.9651428610086441,
"num_tokens": 4587520.0,
"step": 280
},
{
"entropy": 5.042377591133118,
"epoch": 0.8325925925925926,
"grad_norm": 1.3829681873321533,
"learning_rate": 1.7417417417417418e-06,
"loss": 0.24436160922050476,
"mean_token_accuracy": 0.9278001636266708,
"num_tokens": 4603904.0,
"step": 281
},
{
"entropy": 4.584516406059265,
"epoch": 0.8355555555555556,
"grad_norm": 1.1155527830123901,
"learning_rate": 1.711711711711712e-06,
"loss": 0.19232724606990814,
"mean_token_accuracy": 0.9483994618058205,
"num_tokens": 4620288.0,
"step": 282
},
{
"entropy": 4.5082491636276245,
"epoch": 0.8385185185185186,
"grad_norm": 0.938524603843689,
"learning_rate": 1.681681681681682e-06,
"loss": 0.14862608909606934,
"mean_token_accuracy": 0.9592047855257988,
"num_tokens": 4636672.0,
"step": 283
},
{
"entropy": 4.207568436861038,
"epoch": 0.8414814814814815,
"grad_norm": 0.7634081244468689,
"learning_rate": 1.6516516516516517e-06,
"loss": 0.10312718152999878,
"mean_token_accuracy": 0.9655114337801933,
"num_tokens": 4653056.0,
"step": 284
},
{
"entropy": 4.553406655788422,
"epoch": 0.8444444444444444,
"grad_norm": 1.1271867752075195,
"learning_rate": 1.6216216216216219e-06,
"loss": 0.1725669503211975,
"mean_token_accuracy": 0.9447145611047745,
"num_tokens": 4669440.0,
"step": 285
},
{
"entropy": 4.9145150780677795,
"epoch": 0.8474074074074074,
"grad_norm": 1.121119737625122,
"learning_rate": 1.5915915915915916e-06,
"loss": 0.1591874212026596,
"mean_token_accuracy": 0.9459866732358932,
"num_tokens": 4685824.0,
"step": 286
},
{
"entropy": 4.546119570732117,
"epoch": 0.8503703703703703,
"grad_norm": 1.0445350408554077,
"learning_rate": 1.5615615615615617e-06,
"loss": 0.18919306993484497,
"mean_token_accuracy": 0.9420925006270409,
"num_tokens": 4702208.0,
"step": 287
},
{
"entropy": 4.208664923906326,
"epoch": 0.8533333333333334,
"grad_norm": 1.017647624015808,
"learning_rate": 1.5315315315315316e-06,
"loss": 0.12748247385025024,
"mean_token_accuracy": 0.9632326811552048,
"num_tokens": 4718592.0,
"step": 288
},
{
"entropy": 4.534173429012299,
"epoch": 0.8562962962962963,
"grad_norm": 0.9885667562484741,
"learning_rate": 1.5015015015015017e-06,
"loss": 0.16047002375125885,
"mean_token_accuracy": 0.9475576058030128,
"num_tokens": 4734976.0,
"step": 289
},
{
"entropy": 4.53923037648201,
"epoch": 0.8592592592592593,
"grad_norm": 1.4043318033218384,
"learning_rate": 1.4714714714714714e-06,
"loss": 0.23335830867290497,
"mean_token_accuracy": 0.9432575777173042,
"num_tokens": 4751360.0,
"step": 290
},
{
"entropy": 4.453351438045502,
"epoch": 0.8622222222222222,
"grad_norm": 1.2922645807266235,
"learning_rate": 1.4414414414414416e-06,
"loss": 0.2262791097164154,
"mean_token_accuracy": 0.9343696013092995,
"num_tokens": 4767744.0,
"step": 291
},
{
"entropy": 4.307468056678772,
"epoch": 0.8651851851851852,
"grad_norm": 0.8348132967948914,
"learning_rate": 1.4114114114114117e-06,
"loss": 0.10120698064565659,
"mean_token_accuracy": 0.9699218273162842,
"num_tokens": 4784128.0,
"step": 292
},
{
"entropy": 4.376435071229935,
"epoch": 0.8681481481481481,
"grad_norm": 0.9932755827903748,
"learning_rate": 1.3813813813813814e-06,
"loss": 0.16437053680419922,
"mean_token_accuracy": 0.9493629187345505,
"num_tokens": 4800512.0,
"step": 293
},
{
"entropy": 4.17171511054039,
"epoch": 0.8711111111111111,
"grad_norm": 1.0171509981155396,
"learning_rate": 1.3513513513513515e-06,
"loss": 0.15266487002372742,
"mean_token_accuracy": 0.9645697101950645,
"num_tokens": 4816896.0,
"step": 294
},
{
"entropy": 4.363181322813034,
"epoch": 0.8740740740740741,
"grad_norm": 1.1125446557998657,
"learning_rate": 1.3213213213213214e-06,
"loss": 0.16176161170005798,
"mean_token_accuracy": 0.954315535724163,
"num_tokens": 4833280.0,
"step": 295
},
{
"entropy": 4.970975339412689,
"epoch": 0.8770370370370371,
"grad_norm": 1.289873480796814,
"learning_rate": 1.2912912912912913e-06,
"loss": 0.20878392457962036,
"mean_token_accuracy": 0.9356447458267212,
"num_tokens": 4849664.0,
"step": 296
},
{
"entropy": 4.833039224147797,
"epoch": 0.88,
"grad_norm": 1.0888588428497314,
"learning_rate": 1.2612612612612613e-06,
"loss": 0.15500885248184204,
"mean_token_accuracy": 0.9589161276817322,
"num_tokens": 4866048.0,
"step": 297
},
{
"entropy": 4.779081165790558,
"epoch": 0.882962962962963,
"grad_norm": 1.266128420829773,
"learning_rate": 1.2312312312312314e-06,
"loss": 0.21074306964874268,
"mean_token_accuracy": 0.9407091289758682,
"num_tokens": 4882432.0,
"step": 298
},
{
"entropy": 4.6357011795043945,
"epoch": 0.8859259259259259,
"grad_norm": 1.3224912881851196,
"learning_rate": 1.2012012012012013e-06,
"loss": 0.2368646115064621,
"mean_token_accuracy": 0.9472242295742035,
"num_tokens": 4898816.0,
"step": 299
},
{
"entropy": 4.068840324878693,
"epoch": 0.8888888888888888,
"grad_norm": 0.85923832654953,
"learning_rate": 1.1711711711711712e-06,
"loss": 0.11753897368907928,
"mean_token_accuracy": 0.9662499204277992,
"num_tokens": 4915200.0,
"step": 300
},
{
"epoch": 0.8888888888888888,
"eval_entropy": 4.417586924235026,
"eval_loss": 0.1870778650045395,
"eval_mean_token_accuracy": 0.9491693472862244,
"eval_num_tokens": 4915200.0,
"eval_runtime": 41.7995,
"eval_samples_per_second": 14.354,
"eval_steps_per_second": 1.794,
"step": 300
},
{
"entropy": 5.071247100830078,
"epoch": 0.8918518518518519,
"grad_norm": 1.3558486700057983,
"learning_rate": 1.1411411411411411e-06,
"loss": 0.23602133989334106,
"mean_token_accuracy": 0.9276960417628288,
"num_tokens": 4931584.0,
"step": 301
},
{
"entropy": 4.117396056652069,
"epoch": 0.8948148148148148,
"grad_norm": 0.8388944268226624,
"learning_rate": 1.111111111111111e-06,
"loss": 0.11620326340198517,
"mean_token_accuracy": 0.9635635763406754,
"num_tokens": 4947968.0,
"step": 302
},
{
"entropy": 4.5542632937431335,
"epoch": 0.8977777777777778,
"grad_norm": 1.18254554271698,
"learning_rate": 1.0810810810810812e-06,
"loss": 0.1708286702632904,
"mean_token_accuracy": 0.9597087278962135,
"num_tokens": 4964352.0,
"step": 303
},
{
"entropy": 4.57982537150383,
"epoch": 0.9007407407407407,
"grad_norm": 1.3986045122146606,
"learning_rate": 1.051051051051051e-06,
"loss": 0.3021943271160126,
"mean_token_accuracy": 0.919133186340332,
"num_tokens": 4980736.0,
"step": 304
},
{
"entropy": 4.782330691814423,
"epoch": 0.9037037037037037,
"grad_norm": 1.1780952215194702,
"learning_rate": 1.0210210210210212e-06,
"loss": 0.21513484418392181,
"mean_token_accuracy": 0.9414290711283684,
"num_tokens": 4997120.0,
"step": 305
},
{
"entropy": 4.747852921485901,
"epoch": 0.9066666666666666,
"grad_norm": 1.4025940895080566,
"learning_rate": 9.909909909909911e-07,
"loss": 0.22148270905017853,
"mean_token_accuracy": 0.9464741870760918,
"num_tokens": 5013504.0,
"step": 306
},
{
"entropy": 4.174960762262344,
"epoch": 0.9096296296296297,
"grad_norm": 1.130652904510498,
"learning_rate": 9.60960960960961e-07,
"loss": 0.18711383640766144,
"mean_token_accuracy": 0.9580972418189049,
"num_tokens": 5029888.0,
"step": 307
},
{
"entropy": 4.478256374597549,
"epoch": 0.9125925925925926,
"grad_norm": 1.0640850067138672,
"learning_rate": 9.30930930930931e-07,
"loss": 0.1915970742702484,
"mean_token_accuracy": 0.9348175227642059,
"num_tokens": 5046272.0,
"step": 308
},
{
"entropy": 4.654453784227371,
"epoch": 0.9155555555555556,
"grad_norm": 1.0310114622116089,
"learning_rate": 9.00900900900901e-07,
"loss": 0.13161642849445343,
"mean_token_accuracy": 0.9586769789457321,
"num_tokens": 5062656.0,
"step": 309
},
{
"entropy": 4.399398684501648,
"epoch": 0.9185185185185185,
"grad_norm": 1.075095772743225,
"learning_rate": 8.708708708708709e-07,
"loss": 0.1970798522233963,
"mean_token_accuracy": 0.9442151561379433,
"num_tokens": 5079040.0,
"step": 310
},
{
"entropy": 4.483876526355743,
"epoch": 0.9214814814814815,
"grad_norm": 1.1613632440567017,
"learning_rate": 8.40840840840841e-07,
"loss": 0.21313047409057617,
"mean_token_accuracy": 0.9410364031791687,
"num_tokens": 5095424.0,
"step": 311
},
{
"entropy": 4.712851881980896,
"epoch": 0.9244444444444444,
"grad_norm": 1.041576623916626,
"learning_rate": 8.108108108108109e-07,
"loss": 0.14535699784755707,
"mean_token_accuracy": 0.9653985276818275,
"num_tokens": 5111808.0,
"step": 312
},
{
"entropy": 4.009306818246841,
"epoch": 0.9274074074074075,
"grad_norm": 0.8439784646034241,
"learning_rate": 7.807807807807808e-07,
"loss": 0.12768274545669556,
"mean_token_accuracy": 0.9642351046204567,
"num_tokens": 5128192.0,
"step": 313
},
{
"entropy": 3.9402647465467453,
"epoch": 0.9303703703703704,
"grad_norm": 0.6990681886672974,
"learning_rate": 7.507507507507509e-07,
"loss": 0.07188726961612701,
"mean_token_accuracy": 0.9686107113957405,
"num_tokens": 5144576.0,
"step": 314
},
{
"entropy": 4.321747362613678,
"epoch": 0.9333333333333333,
"grad_norm": 0.8538215756416321,
"learning_rate": 7.207207207207208e-07,
"loss": 0.12386510521173477,
"mean_token_accuracy": 0.9637529402971268,
"num_tokens": 5160960.0,
"step": 315
},
{
"entropy": 4.553303599357605,
"epoch": 0.9362962962962963,
"grad_norm": 1.160495638847351,
"learning_rate": 6.906906906906907e-07,
"loss": 0.19865782558918,
"mean_token_accuracy": 0.9452551826834679,
"num_tokens": 5177344.0,
"step": 316
},
{
"entropy": 4.6939592361450195,
"epoch": 0.9392592592592592,
"grad_norm": 1.1832135915756226,
"learning_rate": 6.606606606606607e-07,
"loss": 0.16584719717502594,
"mean_token_accuracy": 0.9571598693728447,
"num_tokens": 5193728.0,
"step": 317
},
{
"entropy": 4.5154470801353455,
"epoch": 0.9422222222222222,
"grad_norm": 1.1491987705230713,
"learning_rate": 6.306306306306306e-07,
"loss": 0.1722956746816635,
"mean_token_accuracy": 0.9531917944550514,
"num_tokens": 5210112.0,
"step": 318
},
{
"entropy": 4.328756272792816,
"epoch": 0.9451851851851852,
"grad_norm": 0.9116262793540955,
"learning_rate": 6.006006006006006e-07,
"loss": 0.11511941999197006,
"mean_token_accuracy": 0.9662261977791786,
"num_tokens": 5226496.0,
"step": 319
},
{
"entropy": 4.55816787481308,
"epoch": 0.9481481481481482,
"grad_norm": 1.2676368951797485,
"learning_rate": 5.705705705705706e-07,
"loss": 0.193391814827919,
"mean_token_accuracy": 0.9519508555531502,
"num_tokens": 5242880.0,
"step": 320
},
{
"entropy": 4.794662654399872,
"epoch": 0.9511111111111111,
"grad_norm": 1.181879997253418,
"learning_rate": 5.405405405405406e-07,
"loss": 0.19717438519001007,
"mean_token_accuracy": 0.9396635890007019,
"num_tokens": 5259264.0,
"step": 321
},
{
"entropy": 4.271101087331772,
"epoch": 0.9540740740740741,
"grad_norm": 1.1655861139297485,
"learning_rate": 5.105105105105106e-07,
"loss": 0.20040296018123627,
"mean_token_accuracy": 0.9409918263554573,
"num_tokens": 5275648.0,
"step": 322
},
{
"entropy": 4.867785483598709,
"epoch": 0.957037037037037,
"grad_norm": 1.4571250677108765,
"learning_rate": 4.804804804804805e-07,
"loss": 0.24724331498146057,
"mean_token_accuracy": 0.9226743578910828,
"num_tokens": 5292032.0,
"step": 323
},
{
"entropy": 5.1057488322258,
"epoch": 0.96,
"grad_norm": 1.5154188871383667,
"learning_rate": 4.504504504504505e-07,
"loss": 0.2607588469982147,
"mean_token_accuracy": 0.92790437489748,
"num_tokens": 5308416.0,
"step": 324
},
{
"entropy": 4.4008781015872955,
"epoch": 0.9629629629629629,
"grad_norm": 0.998136579990387,
"learning_rate": 4.204204204204205e-07,
"loss": 0.15995781123638153,
"mean_token_accuracy": 0.9598969668149948,
"num_tokens": 5324800.0,
"step": 325
},
{
"entropy": 3.9187879860401154,
"epoch": 0.965925925925926,
"grad_norm": 0.8381322026252747,
"learning_rate": 3.903903903903904e-07,
"loss": 0.126622274518013,
"mean_token_accuracy": 0.9611322283744812,
"num_tokens": 5341184.0,
"step": 326
},
{
"entropy": 4.744876116514206,
"epoch": 0.9688888888888889,
"grad_norm": 1.319761037826538,
"learning_rate": 3.603603603603604e-07,
"loss": 0.2034291923046112,
"mean_token_accuracy": 0.9343697354197502,
"num_tokens": 5357568.0,
"step": 327
},
{
"entropy": 4.7206811606884,
"epoch": 0.9718518518518519,
"grad_norm": 1.3094006776809692,
"learning_rate": 3.3033033033033036e-07,
"loss": 0.28418663144111633,
"mean_token_accuracy": 0.9168223366141319,
"num_tokens": 5373952.0,
"step": 328
},
{
"entropy": 4.250654578208923,
"epoch": 0.9748148148148148,
"grad_norm": 0.8762730956077576,
"learning_rate": 3.003003003003003e-07,
"loss": 0.14533185958862305,
"mean_token_accuracy": 0.9615647569298744,
"num_tokens": 5390336.0,
"step": 329
},
{
"entropy": 4.782383352518082,
"epoch": 0.9777777777777777,
"grad_norm": 1.4791736602783203,
"learning_rate": 2.702702702702703e-07,
"loss": 0.306484192609787,
"mean_token_accuracy": 0.9203394278883934,
"num_tokens": 5406720.0,
"step": 330
},
{
"entropy": 4.731139063835144,
"epoch": 0.9807407407407407,
"grad_norm": 1.1364384889602661,
"learning_rate": 2.4024024024024026e-07,
"loss": 0.187924325466156,
"mean_token_accuracy": 0.940864272415638,
"num_tokens": 5423104.0,
"step": 331
},
{
"entropy": 4.757296144962311,
"epoch": 0.9837037037037037,
"grad_norm": 1.2683117389678955,
"learning_rate": 2.1021021021021025e-07,
"loss": 0.2071211040019989,
"mean_token_accuracy": 0.9373601898550987,
"num_tokens": 5439488.0,
"step": 332
},
{
"entropy": 4.8207244873046875,
"epoch": 0.9866666666666667,
"grad_norm": 1.1348717212677002,
"learning_rate": 1.801801801801802e-07,
"loss": 0.16599202156066895,
"mean_token_accuracy": 0.9438209906220436,
"num_tokens": 5455872.0,
"step": 333
},
{
"entropy": 4.560002565383911,
"epoch": 0.9896296296296296,
"grad_norm": 1.0268224477767944,
"learning_rate": 1.5015015015015016e-07,
"loss": 0.18726664781570435,
"mean_token_accuracy": 0.9389617219567299,
"num_tokens": 5472256.0,
"step": 334
},
{
"entropy": 4.164048194885254,
"epoch": 0.9925925925925926,
"grad_norm": 0.8888510465621948,
"learning_rate": 1.2012012012012013e-07,
"loss": 0.08176050335168839,
"mean_token_accuracy": 0.9774916544556618,
"num_tokens": 5488640.0,
"step": 335
},
{
"entropy": 4.211227163672447,
"epoch": 0.9955555555555555,
"grad_norm": 1.0560649633407593,
"learning_rate": 9.00900900900901e-08,
"loss": 0.1871253103017807,
"mean_token_accuracy": 0.9461539313197136,
"num_tokens": 5505024.0,
"step": 336
},
{
"entropy": 4.4912309646606445,
"epoch": 0.9985185185185185,
"grad_norm": 1.1535362005233765,
"learning_rate": 6.006006006006006e-08,
"loss": 0.16527244448661804,
"mean_token_accuracy": 0.949486643075943,
"num_tokens": 5521408.0,
"step": 337
},
{
"entropy": 4.468047499656677,
"epoch": 1.0,
"grad_norm": 1.932939052581787,
"learning_rate": 3.003003003003003e-08,
"loss": 0.20345942676067352,
"mean_token_accuracy": 0.9499414712190628,
"num_tokens": 5529600.0,
"step": 338
}
],
"logging_steps": 1,
"max_steps": 338,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 5000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9.53130594336768e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}