B2plus_v4_qwq_e2 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
3ad6f77 verified
Raw
History Blame Contribute Delete
62.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 206,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3152819871902466,
"epoch": 0.009708737864077669,
"grad_norm": 1.013494849205017,
"learning_rate": 0.0,
"loss": 2.06831431388855,
"mean_token_accuracy": 0.5338841378688812,
"num_tokens": 97105.0,
"step": 1
},
{
"entropy": 1.3242674767971039,
"epoch": 0.019417475728155338,
"grad_norm": 1.0874853134155273,
"learning_rate": 3.125e-06,
"loss": 2.139530658721924,
"mean_token_accuracy": 0.5263050831854343,
"num_tokens": 192679.0,
"step": 2
},
{
"entropy": 1.355704814195633,
"epoch": 0.02912621359223301,
"grad_norm": 0.998701274394989,
"learning_rate": 6.25e-06,
"loss": 2.0967135429382324,
"mean_token_accuracy": 0.525411419570446,
"num_tokens": 290599.0,
"step": 3
},
{
"entropy": 1.4417763948440552,
"epoch": 0.038834951456310676,
"grad_norm": 0.8833345770835876,
"learning_rate": 9.375000000000001e-06,
"loss": 2.1067581176757812,
"mean_token_accuracy": 0.5188259109854698,
"num_tokens": 388130.0,
"step": 4
},
{
"entropy": 1.4466145783662796,
"epoch": 0.04854368932038835,
"grad_norm": 0.7175306081771851,
"learning_rate": 1.25e-05,
"loss": 1.998451590538025,
"mean_token_accuracy": 0.5344960391521454,
"num_tokens": 485983.0,
"step": 5
},
{
"entropy": 1.521438479423523,
"epoch": 0.05825242718446602,
"grad_norm": 0.5840274691581726,
"learning_rate": 1.5625e-05,
"loss": 1.966963768005371,
"mean_token_accuracy": 0.5378070250153542,
"num_tokens": 583257.0,
"step": 6
},
{
"entropy": 1.590747281908989,
"epoch": 0.06796116504854369,
"grad_norm": 0.5097014904022217,
"learning_rate": 1.8750000000000002e-05,
"loss": 1.9825010299682617,
"mean_token_accuracy": 0.5324273854494095,
"num_tokens": 678553.0,
"step": 7
},
{
"entropy": 1.6503181159496307,
"epoch": 0.07766990291262135,
"grad_norm": 0.374606192111969,
"learning_rate": 2.1875e-05,
"loss": 1.8895000219345093,
"mean_token_accuracy": 0.5438744276762009,
"num_tokens": 774991.0,
"step": 8
},
{
"entropy": 1.7381516695022583,
"epoch": 0.08737864077669903,
"grad_norm": 0.3151414096355438,
"learning_rate": 2.5e-05,
"loss": 1.8734210729599,
"mean_token_accuracy": 0.5423448756337166,
"num_tokens": 871685.0,
"step": 9
},
{
"entropy": 1.72954061627388,
"epoch": 0.0970873786407767,
"grad_norm": 0.26697251200675964,
"learning_rate": 2.8125000000000003e-05,
"loss": 1.7822761535644531,
"mean_token_accuracy": 0.5574369356036186,
"num_tokens": 968934.0,
"step": 10
},
{
"entropy": 1.8142512142658234,
"epoch": 0.10679611650485436,
"grad_norm": 0.26576197147369385,
"learning_rate": 3.125e-05,
"loss": 1.7738474607467651,
"mean_token_accuracy": 0.5553920194506645,
"num_tokens": 1066190.0,
"step": 11
},
{
"entropy": 1.8880750685930252,
"epoch": 0.11650485436893204,
"grad_norm": 0.2821778357028961,
"learning_rate": 3.4375e-05,
"loss": 1.7811144590377808,
"mean_token_accuracy": 0.554568275809288,
"num_tokens": 1163717.0,
"step": 12
},
{
"entropy": 1.8850630968809128,
"epoch": 0.1262135922330097,
"grad_norm": 0.2994160056114197,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.731427550315857,
"mean_token_accuracy": 0.5632588267326355,
"num_tokens": 1261260.0,
"step": 13
},
{
"entropy": 1.9034151881933212,
"epoch": 0.13592233009708737,
"grad_norm": 0.3169096112251282,
"learning_rate": 4.0625000000000005e-05,
"loss": 1.7296199798583984,
"mean_token_accuracy": 0.5644616037607193,
"num_tokens": 1358315.0,
"step": 14
},
{
"entropy": 1.861739456653595,
"epoch": 0.14563106796116504,
"grad_norm": 0.3155674636363983,
"learning_rate": 4.375e-05,
"loss": 1.673210859298706,
"mean_token_accuracy": 0.576985627412796,
"num_tokens": 1455424.0,
"step": 15
},
{
"entropy": 1.838089257478714,
"epoch": 0.1553398058252427,
"grad_norm": 0.30909860134124756,
"learning_rate": 4.6875e-05,
"loss": 1.6549508571624756,
"mean_token_accuracy": 0.5776421800255775,
"num_tokens": 1552741.0,
"step": 16
},
{
"entropy": 1.8052831888198853,
"epoch": 0.1650485436893204,
"grad_norm": 0.2848927080631256,
"learning_rate": 5e-05,
"loss": 1.6311283111572266,
"mean_token_accuracy": 0.5776514038443565,
"num_tokens": 1650044.0,
"step": 17
},
{
"entropy": 1.7298080027103424,
"epoch": 0.17475728155339806,
"grad_norm": 0.24145011603832245,
"learning_rate": 4.999856295503635e-05,
"loss": 1.6070364713668823,
"mean_token_accuracy": 0.5808622017502785,
"num_tokens": 1747782.0,
"step": 18
},
{
"entropy": 1.64244344830513,
"epoch": 0.18446601941747573,
"grad_norm": 0.20389729738235474,
"learning_rate": 4.999425198535325e-05,
"loss": 1.5785616636276245,
"mean_token_accuracy": 0.5904434770345688,
"num_tokens": 1845724.0,
"step": 19
},
{
"entropy": 1.5861433744430542,
"epoch": 0.1941747572815534,
"grad_norm": 0.1882556676864624,
"learning_rate": 4.998706758655528e-05,
"loss": 1.561955213546753,
"mean_token_accuracy": 0.5861038938164711,
"num_tokens": 1943411.0,
"step": 20
},
{
"entropy": 1.4805333763360977,
"epoch": 0.20388349514563106,
"grad_norm": 0.19283851981163025,
"learning_rate": 4.997701058458676e-05,
"loss": 1.510377287864685,
"mean_token_accuracy": 0.5976782292127609,
"num_tokens": 2041045.0,
"step": 21
},
{
"entropy": 1.4247176200151443,
"epoch": 0.21359223300970873,
"grad_norm": 0.2663690149784088,
"learning_rate": 4.996408213563684e-05,
"loss": 1.5150444507598877,
"mean_token_accuracy": 0.5990786626935005,
"num_tokens": 2138535.0,
"step": 22
},
{
"entropy": 1.4107022881507874,
"epoch": 0.22330097087378642,
"grad_norm": 0.24283358454704285,
"learning_rate": 4.994828372600649e-05,
"loss": 1.4896345138549805,
"mean_token_accuracy": 0.6046600863337517,
"num_tokens": 2235538.0,
"step": 23
},
{
"entropy": 1.3890789598226547,
"epoch": 0.23300970873786409,
"grad_norm": 0.2506687343120575,
"learning_rate": 4.9929617171937724e-05,
"loss": 1.4759382009506226,
"mean_token_accuracy": 0.6044173762202263,
"num_tokens": 2332954.0,
"step": 24
},
{
"entropy": 1.4158536195755005,
"epoch": 0.24271844660194175,
"grad_norm": 0.2098265439271927,
"learning_rate": 4.9908084619404735e-05,
"loss": 1.4671399593353271,
"mean_token_accuracy": 0.6056077107787132,
"num_tokens": 2431031.0,
"step": 25
},
{
"entropy": 1.4332131743431091,
"epoch": 0.2524271844660194,
"grad_norm": 0.17440126836299896,
"learning_rate": 4.988368854386722e-05,
"loss": 1.4597738981246948,
"mean_token_accuracy": 0.6085917800664902,
"num_tokens": 2527933.0,
"step": 26
},
{
"entropy": 1.4164835065603256,
"epoch": 0.2621359223300971,
"grad_norm": 0.1584484875202179,
"learning_rate": 4.985643174998578e-05,
"loss": 1.4157624244689941,
"mean_token_accuracy": 0.6172334477305412,
"num_tokens": 2625130.0,
"step": 27
},
{
"entropy": 1.448016420006752,
"epoch": 0.27184466019417475,
"grad_norm": 0.15808650851249695,
"learning_rate": 4.982631737129948e-05,
"loss": 1.4137294292449951,
"mean_token_accuracy": 0.6172233298420906,
"num_tokens": 2722735.0,
"step": 28
},
{
"entropy": 1.4877165704965591,
"epoch": 0.2815533980582524,
"grad_norm": 0.15937305986881256,
"learning_rate": 4.9793348869865616e-05,
"loss": 1.4389235973358154,
"mean_token_accuracy": 0.6117468476295471,
"num_tokens": 2820721.0,
"step": 29
},
{
"entropy": 1.4804623126983643,
"epoch": 0.2912621359223301,
"grad_norm": 0.15408481657505035,
"learning_rate": 4.9757530035861716e-05,
"loss": 1.4307830333709717,
"mean_token_accuracy": 0.6147695183753967,
"num_tokens": 2918531.0,
"step": 30
},
{
"entropy": 1.431130662560463,
"epoch": 0.30097087378640774,
"grad_norm": 0.15174533426761627,
"learning_rate": 4.971886498714977e-05,
"loss": 1.3788732290267944,
"mean_token_accuracy": 0.6244773417711258,
"num_tokens": 3014027.0,
"step": 31
},
{
"entropy": 1.432707354426384,
"epoch": 0.3106796116504854,
"grad_norm": 0.14417818188667297,
"learning_rate": 4.967735816880286e-05,
"loss": 1.3854697942733765,
"mean_token_accuracy": 0.6244093701243401,
"num_tokens": 3111172.0,
"step": 32
},
{
"entropy": 1.408346712589264,
"epoch": 0.32038834951456313,
"grad_norm": 0.13806791603565216,
"learning_rate": 4.963301435259413e-05,
"loss": 1.37909734249115,
"mean_token_accuracy": 0.6215110719203949,
"num_tokens": 3208860.0,
"step": 33
},
{
"entropy": 1.3968226611614227,
"epoch": 0.3300970873786408,
"grad_norm": 0.14189019799232483,
"learning_rate": 4.95858386364482e-05,
"loss": 1.3762025833129883,
"mean_token_accuracy": 0.6241011992096901,
"num_tokens": 3305964.0,
"step": 34
},
{
"entropy": 1.3652866929769516,
"epoch": 0.33980582524271846,
"grad_norm": 0.13668735325336456,
"learning_rate": 4.9535836443855096e-05,
"loss": 1.3661797046661377,
"mean_token_accuracy": 0.6231197491288185,
"num_tokens": 3403337.0,
"step": 35
},
{
"entropy": 1.3354476243257523,
"epoch": 0.34951456310679613,
"grad_norm": 0.13242210447788239,
"learning_rate": 4.948301352324673e-05,
"loss": 1.3337945938110352,
"mean_token_accuracy": 0.6336007639765739,
"num_tokens": 3500500.0,
"step": 36
},
{
"entropy": 1.3027702569961548,
"epoch": 0.3592233009708738,
"grad_norm": 0.12860701978206635,
"learning_rate": 4.942737594733609e-05,
"loss": 1.3151164054870605,
"mean_token_accuracy": 0.6383665949106216,
"num_tokens": 3597306.0,
"step": 37
},
{
"entropy": 1.3396568596363068,
"epoch": 0.36893203883495146,
"grad_norm": 0.1314004808664322,
"learning_rate": 4.9368930112419e-05,
"loss": 1.3459738492965698,
"mean_token_accuracy": 0.6287253126502037,
"num_tokens": 3694352.0,
"step": 38
},
{
"entropy": 1.331050619482994,
"epoch": 0.3786407766990291,
"grad_norm": 0.12769116461277008,
"learning_rate": 4.930768273763889e-05,
"loss": 1.3475216627120972,
"mean_token_accuracy": 0.6293819546699524,
"num_tokens": 3792464.0,
"step": 39
},
{
"entropy": 1.328546553850174,
"epoch": 0.3883495145631068,
"grad_norm": 0.1277284175157547,
"learning_rate": 4.92436408642143e-05,
"loss": 1.3299285173416138,
"mean_token_accuracy": 0.6318994611501694,
"num_tokens": 3889619.0,
"step": 40
},
{
"entropy": 1.320247620344162,
"epoch": 0.39805825242718446,
"grad_norm": 0.12813310325145721,
"learning_rate": 4.917681185462934e-05,
"loss": 1.3119574785232544,
"mean_token_accuracy": 0.6348763853311539,
"num_tokens": 3986630.0,
"step": 41
},
{
"entropy": 1.3185490667819977,
"epoch": 0.4077669902912621,
"grad_norm": 0.1228400245308876,
"learning_rate": 4.910720339178735e-05,
"loss": 1.310436725616455,
"mean_token_accuracy": 0.6377311646938324,
"num_tokens": 4083691.0,
"step": 42
},
{
"entropy": 1.3097300678491592,
"epoch": 0.4174757281553398,
"grad_norm": 0.12255794554948807,
"learning_rate": 4.90348234781276e-05,
"loss": 1.2923684120178223,
"mean_token_accuracy": 0.6398537456989288,
"num_tokens": 4181870.0,
"step": 43
},
{
"entropy": 1.3270199447870255,
"epoch": 0.42718446601941745,
"grad_norm": 0.13049428164958954,
"learning_rate": 4.895968043470532e-05,
"loss": 1.3082845211029053,
"mean_token_accuracy": 0.6348344013094902,
"num_tokens": 4277672.0,
"step": 44
},
{
"entropy": 1.2746291309595108,
"epoch": 0.4368932038834951,
"grad_norm": 0.11880674958229065,
"learning_rate": 4.8881782900235094e-05,
"loss": 1.2675082683563232,
"mean_token_accuracy": 0.6442193761467934,
"num_tokens": 4375365.0,
"step": 45
},
{
"entropy": 1.2948976457118988,
"epoch": 0.44660194174757284,
"grad_norm": 0.12034562975168228,
"learning_rate": 4.880113983009768e-05,
"loss": 1.2931270599365234,
"mean_token_accuracy": 0.638730451464653,
"num_tokens": 4472689.0,
"step": 46
},
{
"entropy": 1.3306090533733368,
"epoch": 0.4563106796116505,
"grad_norm": 0.12678076326847076,
"learning_rate": 4.87177604953105e-05,
"loss": 1.3286418914794922,
"mean_token_accuracy": 0.630160316824913,
"num_tokens": 4569961.0,
"step": 47
},
{
"entropy": 1.2873755544424057,
"epoch": 0.46601941747572817,
"grad_norm": 0.12189076095819473,
"learning_rate": 4.86316544814618e-05,
"loss": 1.2889766693115234,
"mean_token_accuracy": 0.6420179456472397,
"num_tokens": 4667359.0,
"step": 48
},
{
"entropy": 1.2845768928527832,
"epoch": 0.47572815533980584,
"grad_norm": 0.12239941954612732,
"learning_rate": 4.854283168760868e-05,
"loss": 1.2809079885482788,
"mean_token_accuracy": 0.6406335309147835,
"num_tokens": 4765400.0,
"step": 49
},
{
"entropy": 1.271145537495613,
"epoch": 0.4854368932038835,
"grad_norm": 0.11950168758630753,
"learning_rate": 4.8451302325139004e-05,
"loss": 1.2703527212142944,
"mean_token_accuracy": 0.6420813724398613,
"num_tokens": 4863204.0,
"step": 50
},
{
"entropy": 1.2670437693595886,
"epoch": 0.49514563106796117,
"grad_norm": 0.12081712484359741,
"learning_rate": 4.835707691659753e-05,
"loss": 1.2614223957061768,
"mean_token_accuracy": 0.6454492062330246,
"num_tokens": 4960926.0,
"step": 51
},
{
"entropy": 1.2643397003412247,
"epoch": 0.5048543689320388,
"grad_norm": 0.12239903211593628,
"learning_rate": 4.8260166294476164e-05,
"loss": 1.2616130113601685,
"mean_token_accuracy": 0.645437128841877,
"num_tokens": 5058013.0,
"step": 52
},
{
"entropy": 1.2825093269348145,
"epoch": 0.5145631067961165,
"grad_norm": 0.1260427087545395,
"learning_rate": 4.8160581599968625e-05,
"loss": 1.277658224105835,
"mean_token_accuracy": 0.6420258656144142,
"num_tokens": 5153970.0,
"step": 53
},
{
"entropy": 1.2708389461040497,
"epoch": 0.5242718446601942,
"grad_norm": 0.12050087749958038,
"learning_rate": 4.8058334281689595e-05,
"loss": 1.2695984840393066,
"mean_token_accuracy": 0.642313040792942,
"num_tokens": 5251276.0,
"step": 54
},
{
"entropy": 1.2563078105449677,
"epoch": 0.5339805825242718,
"grad_norm": 0.11743330955505371,
"learning_rate": 4.7953436094358595e-05,
"loss": 1.2539889812469482,
"mean_token_accuracy": 0.6447448581457138,
"num_tokens": 5348605.0,
"step": 55
},
{
"entropy": 1.2068996280431747,
"epoch": 0.5436893203883495,
"grad_norm": 0.12018584460020065,
"learning_rate": 4.784589909744855e-05,
"loss": 1.216509222984314,
"mean_token_accuracy": 0.6554165631532669,
"num_tokens": 5446513.0,
"step": 56
},
{
"entropy": 1.2394993752241135,
"epoch": 0.5533980582524272,
"grad_norm": 0.12352150678634644,
"learning_rate": 4.7735735653799463e-05,
"loss": 1.2473233938217163,
"mean_token_accuracy": 0.6503345593810081,
"num_tokens": 5543963.0,
"step": 57
},
{
"entropy": 1.246939942240715,
"epoch": 0.5631067961165048,
"grad_norm": 0.12477197498083115,
"learning_rate": 4.762295842819707e-05,
"loss": 1.250666618347168,
"mean_token_accuracy": 0.6479302644729614,
"num_tokens": 5641181.0,
"step": 58
},
{
"entropy": 1.2309289276599884,
"epoch": 0.5728155339805825,
"grad_norm": 0.12381109595298767,
"learning_rate": 4.75075803859169e-05,
"loss": 1.2395830154418945,
"mean_token_accuracy": 0.6485741809010506,
"num_tokens": 5738020.0,
"step": 59
},
{
"entropy": 1.2478574961423874,
"epoch": 0.5825242718446602,
"grad_norm": 0.11805979907512665,
"learning_rate": 4.7389614791233726e-05,
"loss": 1.2468922138214111,
"mean_token_accuracy": 0.6481822803616524,
"num_tokens": 5835528.0,
"step": 60
},
{
"entropy": 1.2492798864841461,
"epoch": 0.5922330097087378,
"grad_norm": 0.12080500274896622,
"learning_rate": 4.726907520589664e-05,
"loss": 1.237337589263916,
"mean_token_accuracy": 0.6492728218436241,
"num_tokens": 5933622.0,
"step": 61
},
{
"entropy": 1.2176159173250198,
"epoch": 0.6019417475728155,
"grad_norm": 0.11797010898590088,
"learning_rate": 4.714597548756996e-05,
"loss": 1.2085245847702026,
"mean_token_accuracy": 0.6568486616015434,
"num_tokens": 6030609.0,
"step": 62
},
{
"entropy": 1.2172307223081589,
"epoch": 0.6116504854368932,
"grad_norm": 0.12290960550308228,
"learning_rate": 4.702032978824011e-05,
"loss": 1.209407091140747,
"mean_token_accuracy": 0.6554706916213036,
"num_tokens": 6127908.0,
"step": 63
},
{
"entropy": 1.2215903252363205,
"epoch": 0.6213592233009708,
"grad_norm": 0.12479083985090256,
"learning_rate": 4.6892152552588655e-05,
"loss": 1.2204253673553467,
"mean_token_accuracy": 0.6541763246059418,
"num_tokens": 6225260.0,
"step": 64
},
{
"entropy": 1.235756516456604,
"epoch": 0.6310679611650486,
"grad_norm": 0.12294752150774002,
"learning_rate": 4.6761458516331655e-05,
"loss": 1.2323334217071533,
"mean_token_accuracy": 0.6487969532608986,
"num_tokens": 6322811.0,
"step": 65
},
{
"entropy": 1.2219218015670776,
"epoch": 0.6407766990291263,
"grad_norm": 0.12319876253604889,
"learning_rate": 4.662826270452565e-05,
"loss": 1.2222312688827515,
"mean_token_accuracy": 0.6520592123270035,
"num_tokens": 6419134.0,
"step": 66
},
{
"entropy": 1.2260529547929764,
"epoch": 0.6504854368932039,
"grad_norm": 0.12657777965068817,
"learning_rate": 4.649258042984026e-05,
"loss": 1.2416422367095947,
"mean_token_accuracy": 0.6495706215500832,
"num_tokens": 6516137.0,
"step": 67
},
{
"entropy": 1.1933054029941559,
"epoch": 0.6601941747572816,
"grad_norm": 0.12323662638664246,
"learning_rate": 4.6354427290797875e-05,
"loss": 1.2011079788208008,
"mean_token_accuracy": 0.6561424136161804,
"num_tokens": 6613796.0,
"step": 68
},
{
"entropy": 1.221726194024086,
"epoch": 0.6699029126213593,
"grad_norm": 0.12489137798547745,
"learning_rate": 4.621381916998029e-05,
"loss": 1.2248003482818604,
"mean_token_accuracy": 0.6516422927379608,
"num_tokens": 6711660.0,
"step": 69
},
{
"entropy": 1.206027626991272,
"epoch": 0.6796116504854369,
"grad_norm": 0.12634317576885223,
"learning_rate": 4.607077223220285e-05,
"loss": 1.2010035514831543,
"mean_token_accuracy": 0.6585103869438171,
"num_tokens": 6808587.0,
"step": 70
},
{
"entropy": 1.2234635204076767,
"epoch": 0.6893203883495146,
"grad_norm": 0.12501473724842072,
"learning_rate": 4.592530292265609e-05,
"loss": 1.214389681816101,
"mean_token_accuracy": 0.652966596186161,
"num_tokens": 6906120.0,
"step": 71
},
{
"entropy": 1.20992873609066,
"epoch": 0.6990291262135923,
"grad_norm": 0.12392093241214752,
"learning_rate": 4.5777427965015096e-05,
"loss": 1.2072722911834717,
"mean_token_accuracy": 0.6577531844377518,
"num_tokens": 7004058.0,
"step": 72
},
{
"entropy": 1.1975662112236023,
"epoch": 0.7087378640776699,
"grad_norm": 0.12035489082336426,
"learning_rate": 4.562716435951692e-05,
"loss": 1.1932990550994873,
"mean_token_accuracy": 0.6592987105250359,
"num_tokens": 7101920.0,
"step": 73
},
{
"entropy": 1.210291549563408,
"epoch": 0.7184466019417476,
"grad_norm": 0.12668585777282715,
"learning_rate": 4.5474529381006146e-05,
"loss": 1.1978528499603271,
"mean_token_accuracy": 0.6573837548494339,
"num_tokens": 7198756.0,
"step": 74
},
{
"entropy": 1.2065477669239044,
"epoch": 0.7281553398058253,
"grad_norm": 0.1260020136833191,
"learning_rate": 4.531954057694897e-05,
"loss": 1.211967945098877,
"mean_token_accuracy": 0.6572022661566734,
"num_tokens": 7296339.0,
"step": 75
},
{
"entropy": 1.2129930704832077,
"epoch": 0.7378640776699029,
"grad_norm": 0.12252921611070633,
"learning_rate": 4.516221576541581e-05,
"loss": 1.2114158868789673,
"mean_token_accuracy": 0.6573594808578491,
"num_tokens": 7393950.0,
"step": 76
},
{
"entropy": 1.1850701719522476,
"epoch": 0.7475728155339806,
"grad_norm": 0.1253945231437683,
"learning_rate": 4.5002573033032904e-05,
"loss": 1.1827876567840576,
"mean_token_accuracy": 0.6604309305548668,
"num_tokens": 7489205.0,
"step": 77
},
{
"entropy": 1.2005933076143265,
"epoch": 0.7572815533980582,
"grad_norm": 0.126405268907547,
"learning_rate": 4.484063073290301e-05,
"loss": 1.1962429285049438,
"mean_token_accuracy": 0.6605332940816879,
"num_tokens": 7584161.0,
"step": 78
},
{
"entropy": 1.167565494775772,
"epoch": 0.7669902912621359,
"grad_norm": 0.12077456712722778,
"learning_rate": 4.467640748249548e-05,
"loss": 1.173671841621399,
"mean_token_accuracy": 0.666810154914856,
"num_tokens": 7681353.0,
"step": 79
},
{
"entropy": 1.1648044735193253,
"epoch": 0.7766990291262136,
"grad_norm": 0.1220446452498436,
"learning_rate": 4.4509922161505926e-05,
"loss": 1.1669106483459473,
"mean_token_accuracy": 0.6648600175976753,
"num_tokens": 7778582.0,
"step": 80
},
{
"entropy": 1.1993677020072937,
"epoch": 0.7864077669902912,
"grad_norm": 0.12758223712444305,
"learning_rate": 4.4341193909685686e-05,
"loss": 1.2060935497283936,
"mean_token_accuracy": 0.656955823302269,
"num_tokens": 7874950.0,
"step": 81
},
{
"entropy": 1.1694086194038391,
"epoch": 0.7961165048543689,
"grad_norm": 0.12749262154102325,
"learning_rate": 4.417024212464152e-05,
"loss": 1.1744275093078613,
"mean_token_accuracy": 0.6638457253575325,
"num_tokens": 7971956.0,
"step": 82
},
{
"entropy": 1.1816840171813965,
"epoch": 0.8058252427184466,
"grad_norm": 0.12547384202480316,
"learning_rate": 4.399708645960559e-05,
"loss": 1.1782863140106201,
"mean_token_accuracy": 0.6614864841103554,
"num_tokens": 8068461.0,
"step": 83
},
{
"entropy": 1.1679448634386063,
"epoch": 0.8155339805825242,
"grad_norm": 0.12635710835456848,
"learning_rate": 4.382174682117598e-05,
"loss": 1.1667355298995972,
"mean_token_accuracy": 0.6685158833861351,
"num_tokens": 8166250.0,
"step": 84
},
{
"entropy": 1.1952285468578339,
"epoch": 0.8252427184466019,
"grad_norm": 0.12347149848937988,
"learning_rate": 4.364424336702825e-05,
"loss": 1.1968965530395508,
"mean_token_accuracy": 0.6564839482307434,
"num_tokens": 8263412.0,
"step": 85
},
{
"entropy": 1.162320762872696,
"epoch": 0.8349514563106796,
"grad_norm": 0.1282951831817627,
"learning_rate": 4.346459650359798e-05,
"loss": 1.165436029434204,
"mean_token_accuracy": 0.6640432700514793,
"num_tokens": 8361054.0,
"step": 86
},
{
"entropy": 1.1757322996854782,
"epoch": 0.8446601941747572,
"grad_norm": 0.12616223096847534,
"learning_rate": 4.328282688373479e-05,
"loss": 1.1854305267333984,
"mean_token_accuracy": 0.6585058197379112,
"num_tokens": 8458058.0,
"step": 87
},
{
"entropy": 1.2041359692811966,
"epoch": 0.8543689320388349,
"grad_norm": 0.12326717376708984,
"learning_rate": 4.3098955404328045e-05,
"loss": 1.2033782005310059,
"mean_token_accuracy": 0.6559617221355438,
"num_tokens": 8552707.0,
"step": 88
},
{
"entropy": 1.1909528076648712,
"epoch": 0.8640776699029126,
"grad_norm": 0.12603110074996948,
"learning_rate": 4.29130032039044e-05,
"loss": 1.1859486103057861,
"mean_token_accuracy": 0.6600593701004982,
"num_tokens": 8648715.0,
"step": 89
},
{
"entropy": 1.1856964826583862,
"epoch": 0.8737864077669902,
"grad_norm": 0.1260392963886261,
"learning_rate": 4.272499166019771e-05,
"loss": 1.1915158033370972,
"mean_token_accuracy": 0.6585908159613609,
"num_tokens": 8744790.0,
"step": 90
},
{
"entropy": 1.1794664412736893,
"epoch": 0.883495145631068,
"grad_norm": 0.12392019480466843,
"learning_rate": 4.253494238769134e-05,
"loss": 1.183051586151123,
"mean_token_accuracy": 0.6626226082444191,
"num_tokens": 8841963.0,
"step": 91
},
{
"entropy": 1.170656368136406,
"epoch": 0.8932038834951457,
"grad_norm": 0.12465117126703262,
"learning_rate": 4.234287723513326e-05,
"loss": 1.1673667430877686,
"mean_token_accuracy": 0.6653531640768051,
"num_tokens": 8938823.0,
"step": 92
},
{
"entropy": 1.1882077753543854,
"epoch": 0.9029126213592233,
"grad_norm": 0.12566819787025452,
"learning_rate": 4.2148818283024304e-05,
"loss": 1.1874932050704956,
"mean_token_accuracy": 0.6594797223806381,
"num_tokens": 9036976.0,
"step": 93
},
{
"entropy": 1.1583750993013382,
"epoch": 0.912621359223301,
"grad_norm": 0.12392456829547882,
"learning_rate": 4.195278784107964e-05,
"loss": 1.1598093509674072,
"mean_token_accuracy": 0.6643186137080193,
"num_tokens": 9134903.0,
"step": 94
},
{
"entropy": 1.18809275329113,
"epoch": 0.9223300970873787,
"grad_norm": 0.12459253519773483,
"learning_rate": 4.175480844566404e-05,
"loss": 1.1854370832443237,
"mean_token_accuracy": 0.6601575016975403,
"num_tokens": 9231494.0,
"step": 95
},
{
"entropy": 1.175073578953743,
"epoch": 0.9320388349514563,
"grad_norm": 0.12408064305782318,
"learning_rate": 4.1554902857200924e-05,
"loss": 1.1680026054382324,
"mean_token_accuracy": 0.6664741188287735,
"num_tokens": 9328418.0,
"step": 96
},
{
"entropy": 1.1660194247961044,
"epoch": 0.941747572815534,
"grad_norm": 0.1269122213125229,
"learning_rate": 4.135309405755583e-05,
"loss": 1.1648091077804565,
"mean_token_accuracy": 0.6640554815530777,
"num_tokens": 9426256.0,
"step": 97
},
{
"entropy": 1.1806619465351105,
"epoch": 0.9514563106796117,
"grad_norm": 0.12446007132530212,
"learning_rate": 4.11494052473943e-05,
"loss": 1.1816036701202393,
"mean_token_accuracy": 0.6603836715221405,
"num_tokens": 9523841.0,
"step": 98
},
{
"entropy": 1.143372431397438,
"epoch": 0.9611650485436893,
"grad_norm": 0.12895351648330688,
"learning_rate": 4.094385984351462e-05,
"loss": 1.1549444198608398,
"mean_token_accuracy": 0.6684554740786552,
"num_tokens": 9621225.0,
"step": 99
},
{
"entropy": 1.157622754573822,
"epoch": 0.970873786407767,
"grad_norm": 0.12986451387405396,
"learning_rate": 4.073648147615579e-05,
"loss": 1.1613187789916992,
"mean_token_accuracy": 0.6658940613269806,
"num_tokens": 9718805.0,
"step": 100
},
{
"entropy": 1.1661712676286697,
"epoch": 0.9805825242718447,
"grad_norm": 0.12773863971233368,
"learning_rate": 4.052729398628089e-05,
"loss": 1.1692513227462769,
"mean_token_accuracy": 0.6620098426938057,
"num_tokens": 9816814.0,
"step": 101
},
{
"entropy": 1.1614899933338165,
"epoch": 0.9902912621359223,
"grad_norm": 0.12632128596305847,
"learning_rate": 4.031632142283622e-05,
"loss": 1.155547857284546,
"mean_token_accuracy": 0.6674634590744972,
"num_tokens": 9914411.0,
"step": 102
},
{
"entropy": 1.145766094326973,
"epoch": 1.0,
"grad_norm": 0.12433107942342758,
"learning_rate": 4.0103588039986556e-05,
"loss": 1.14786958694458,
"mean_token_accuracy": 0.6690786927938461,
"num_tokens": 10010251.0,
"step": 103
},
{
"entropy": 1.1341409236192703,
"epoch": 1.0097087378640777,
"grad_norm": 0.12799648940563202,
"learning_rate": 3.988911829432682e-05,
"loss": 1.1098670959472656,
"mean_token_accuracy": 0.6751041486859322,
"num_tokens": 10106628.0,
"step": 104
},
{
"entropy": 1.1491402089595795,
"epoch": 1.0194174757281553,
"grad_norm": 0.12858925759792328,
"learning_rate": 3.967293684207042e-05,
"loss": 1.1254563331604004,
"mean_token_accuracy": 0.6731077134609222,
"num_tokens": 10203919.0,
"step": 105
},
{
"entropy": 1.1238928586244583,
"epoch": 1.029126213592233,
"grad_norm": 0.12643985450267792,
"learning_rate": 3.945506853621476e-05,
"loss": 1.1088980436325073,
"mean_token_accuracy": 0.6773268133401871,
"num_tokens": 10301090.0,
"step": 106
},
{
"entropy": 1.1413813680410385,
"epoch": 1.0388349514563107,
"grad_norm": 0.12904314696788788,
"learning_rate": 3.923553842368396e-05,
"loss": 1.1306235790252686,
"mean_token_accuracy": 0.6715306341648102,
"num_tokens": 10398407.0,
"step": 107
},
{
"entropy": 1.1197253912687302,
"epoch": 1.0485436893203883,
"grad_norm": 0.1303851157426834,
"learning_rate": 3.901437174244943e-05,
"loss": 1.1225614547729492,
"mean_token_accuracy": 0.6706969887018204,
"num_tokens": 10496286.0,
"step": 108
},
{
"entropy": 1.122231513261795,
"epoch": 1.058252427184466,
"grad_norm": 0.1349845975637436,
"learning_rate": 3.879159391862839e-05,
"loss": 1.1277834177017212,
"mean_token_accuracy": 0.6702014356851578,
"num_tokens": 10593041.0,
"step": 109
},
{
"entropy": 1.115450069308281,
"epoch": 1.0679611650485437,
"grad_norm": 0.13234294950962067,
"learning_rate": 3.856723056356084e-05,
"loss": 1.1329256296157837,
"mean_token_accuracy": 0.6710078343749046,
"num_tokens": 10690608.0,
"step": 110
},
{
"entropy": 1.102941244840622,
"epoch": 1.0776699029126213,
"grad_norm": 0.13028526306152344,
"learning_rate": 3.834130747086512e-05,
"loss": 1.1175909042358398,
"mean_token_accuracy": 0.677011676132679,
"num_tokens": 10788441.0,
"step": 111
},
{
"entropy": 1.1198238283395767,
"epoch": 1.087378640776699,
"grad_norm": 0.1328689604997635,
"learning_rate": 3.811385061347263e-05,
"loss": 1.1254500150680542,
"mean_token_accuracy": 0.6724693179130554,
"num_tokens": 10886095.0,
"step": 112
},
{
"entropy": 1.1324098259210587,
"epoch": 1.0970873786407767,
"grad_norm": 0.12953810393810272,
"learning_rate": 3.788488614064188e-05,
"loss": 1.1315046548843384,
"mean_token_accuracy": 0.6697050705552101,
"num_tokens": 10983700.0,
"step": 113
},
{
"entropy": 1.1275495439767838,
"epoch": 1.1067961165048543,
"grad_norm": 0.1354612112045288,
"learning_rate": 3.7654440374952286e-05,
"loss": 1.1271648406982422,
"mean_token_accuracy": 0.672305554151535,
"num_tokens": 11081141.0,
"step": 114
},
{
"entropy": 1.1429592818021774,
"epoch": 1.116504854368932,
"grad_norm": 0.1337576061487198,
"learning_rate": 3.742253980927799e-05,
"loss": 1.1285946369171143,
"mean_token_accuracy": 0.6733437776565552,
"num_tokens": 11178553.0,
"step": 115
},
{
"entropy": 1.1202867925167084,
"epoch": 1.1262135922330097,
"grad_norm": 0.13228580355644226,
"learning_rate": 3.7189211103742206e-05,
"loss": 1.1025102138519287,
"mean_token_accuracy": 0.6800560057163239,
"num_tokens": 11275288.0,
"step": 116
},
{
"entropy": 1.0949921309947968,
"epoch": 1.1359223300970873,
"grad_norm": 0.1253608763217926,
"learning_rate": 3.695448108265221e-05,
"loss": 1.085485816001892,
"mean_token_accuracy": 0.6812227368354797,
"num_tokens": 11372523.0,
"step": 117
},
{
"entropy": 1.1151315122842789,
"epoch": 1.145631067961165,
"grad_norm": 0.12856075167655945,
"learning_rate": 3.671837673141559e-05,
"loss": 1.1069122552871704,
"mean_token_accuracy": 0.6765121668577194,
"num_tokens": 11470482.0,
"step": 118
},
{
"entropy": 1.0998107194900513,
"epoch": 1.1553398058252426,
"grad_norm": 0.12800323963165283,
"learning_rate": 3.648092519343783e-05,
"loss": 1.1018128395080566,
"mean_token_accuracy": 0.676878921687603,
"num_tokens": 11568438.0,
"step": 119
},
{
"entropy": 1.1217384338378906,
"epoch": 1.1650485436893203,
"grad_norm": 0.13246221840381622,
"learning_rate": 3.6242153767001895e-05,
"loss": 1.1250511407852173,
"mean_token_accuracy": 0.6719321832060814,
"num_tokens": 11665644.0,
"step": 120
},
{
"entropy": 1.1170085221529007,
"epoch": 1.174757281553398,
"grad_norm": 0.13148824870586395,
"learning_rate": 3.600208990212984e-05,
"loss": 1.1268041133880615,
"mean_token_accuracy": 0.6731199100613594,
"num_tokens": 11762261.0,
"step": 121
},
{
"entropy": 1.1139017194509506,
"epoch": 1.1844660194174756,
"grad_norm": 0.1360619217157364,
"learning_rate": 3.5760761197427095e-05,
"loss": 1.1233904361724854,
"mean_token_accuracy": 0.6718152910470963,
"num_tokens": 11860108.0,
"step": 122
},
{
"entropy": 1.0983168631792068,
"epoch": 1.1941747572815533,
"grad_norm": 0.1338312178850174,
"learning_rate": 3.551819539690965e-05,
"loss": 1.1016520261764526,
"mean_token_accuracy": 0.6767120957374573,
"num_tokens": 11957749.0,
"step": 123
},
{
"entropy": 1.1032237857580185,
"epoch": 1.203883495145631,
"grad_norm": 0.1313079446554184,
"learning_rate": 3.527442038681446e-05,
"loss": 1.100191593170166,
"mean_token_accuracy": 0.678658239543438,
"num_tokens": 12055121.0,
"step": 124
},
{
"entropy": 1.1136897951364517,
"epoch": 1.2135922330097086,
"grad_norm": 0.13034434616565704,
"learning_rate": 3.5029464192393555e-05,
"loss": 1.1128168106079102,
"mean_token_accuracy": 0.67413529753685,
"num_tokens": 12151377.0,
"step": 125
},
{
"entropy": 1.1389924734830856,
"epoch": 1.2233009708737863,
"grad_norm": 0.1353037804365158,
"learning_rate": 3.478335497469219e-05,
"loss": 1.1380655765533447,
"mean_token_accuracy": 0.6695696339011192,
"num_tokens": 12248560.0,
"step": 126
},
{
"entropy": 1.107931211590767,
"epoch": 1.233009708737864,
"grad_norm": 0.13514992594718933,
"learning_rate": 3.45361210273113e-05,
"loss": 1.1055539846420288,
"mean_token_accuracy": 0.6756316646933556,
"num_tokens": 12345865.0,
"step": 127
},
{
"entropy": 1.1335723251104355,
"epoch": 1.2427184466019416,
"grad_norm": 0.13835780322551727,
"learning_rate": 3.42877907731548e-05,
"loss": 1.1302151679992676,
"mean_token_accuracy": 0.669251911342144,
"num_tokens": 12443200.0,
"step": 128
},
{
"entropy": 1.1074748188257217,
"epoch": 1.2524271844660193,
"grad_norm": 0.13170616328716278,
"learning_rate": 3.403839276116199e-05,
"loss": 1.1079301834106445,
"mean_token_accuracy": 0.6757740005850792,
"num_tokens": 12540890.0,
"step": 129
},
{
"entropy": 1.095900535583496,
"epoch": 1.262135922330097,
"grad_norm": 0.13312096893787384,
"learning_rate": 3.378795566302541e-05,
"loss": 1.0944111347198486,
"mean_token_accuracy": 0.6820532456040382,
"num_tokens": 12637489.0,
"step": 130
},
{
"entropy": 1.139050379395485,
"epoch": 1.2718446601941746,
"grad_norm": 0.13441915810108185,
"learning_rate": 3.3536508269894724e-05,
"loss": 1.143053412437439,
"mean_token_accuracy": 0.6661617383360863,
"num_tokens": 12735387.0,
"step": 131
},
{
"entropy": 1.1290362179279327,
"epoch": 1.2815533980582523,
"grad_norm": 0.13508093357086182,
"learning_rate": 3.3284079489066725e-05,
"loss": 1.1235984563827515,
"mean_token_accuracy": 0.6717719659209251,
"num_tokens": 12832975.0,
"step": 132
},
{
"entropy": 1.0883319675922394,
"epoch": 1.29126213592233,
"grad_norm": 0.12796825170516968,
"learning_rate": 3.303069834066206e-05,
"loss": 1.0845664739608765,
"mean_token_accuracy": 0.6816640943288803,
"num_tokens": 12930517.0,
"step": 133
},
{
"entropy": 1.1136111319065094,
"epoch": 1.3009708737864076,
"grad_norm": 0.13345250487327576,
"learning_rate": 3.2776393954289e-05,
"loss": 1.1119763851165771,
"mean_token_accuracy": 0.6760792285203934,
"num_tokens": 13027442.0,
"step": 134
},
{
"entropy": 1.1128307431936264,
"epoch": 1.3106796116504853,
"grad_norm": 0.13406725227832794,
"learning_rate": 3.252119556569454e-05,
"loss": 1.1177759170532227,
"mean_token_accuracy": 0.6735335886478424,
"num_tokens": 13124793.0,
"step": 135
},
{
"entropy": 1.0935580134391785,
"epoch": 1.3203883495145632,
"grad_norm": 0.13077104091644287,
"learning_rate": 3.226513251340341e-05,
"loss": 1.0963619947433472,
"mean_token_accuracy": 0.6799755468964577,
"num_tokens": 13222075.0,
"step": 136
},
{
"entropy": 1.106724590063095,
"epoch": 1.3300970873786409,
"grad_norm": 0.13231448829174042,
"learning_rate": 3.200823423534519e-05,
"loss": 1.1073098182678223,
"mean_token_accuracy": 0.6749509125947952,
"num_tokens": 13319423.0,
"step": 137
},
{
"entropy": 1.1182805299758911,
"epoch": 1.3398058252427185,
"grad_norm": 0.13593561947345734,
"learning_rate": 3.175053026547002e-05,
"loss": 1.1097687482833862,
"mean_token_accuracy": 0.6745005398988724,
"num_tokens": 13416786.0,
"step": 138
},
{
"entropy": 1.102017655968666,
"epoch": 1.3495145631067962,
"grad_norm": 0.12999407947063446,
"learning_rate": 3.149205023035324e-05,
"loss": 1.094827651977539,
"mean_token_accuracy": 0.6781732141971588,
"num_tokens": 13513688.0,
"step": 139
},
{
"entropy": 1.1274291574954987,
"epoch": 1.3592233009708738,
"grad_norm": 0.1388029307126999,
"learning_rate": 3.123282384578947e-05,
"loss": 1.1278557777404785,
"mean_token_accuracy": 0.6717119812965393,
"num_tokens": 13607205.0,
"step": 140
},
{
"entropy": 1.0886951833963394,
"epoch": 1.3689320388349515,
"grad_norm": 0.1308942288160324,
"learning_rate": 3.097288091337635e-05,
"loss": 1.0786107778549194,
"mean_token_accuracy": 0.6831399872899055,
"num_tokens": 13705043.0,
"step": 141
},
{
"entropy": 1.1056243032217026,
"epoch": 1.3786407766990292,
"grad_norm": 0.13267813622951508,
"learning_rate": 3.0712251317088424e-05,
"loss": 1.1058636903762817,
"mean_token_accuracy": 0.676319070160389,
"num_tokens": 13800688.0,
"step": 142
},
{
"entropy": 1.064341314136982,
"epoch": 1.3883495145631068,
"grad_norm": 0.13194353878498077,
"learning_rate": 3.0450965019841592e-05,
"loss": 1.0774102210998535,
"mean_token_accuracy": 0.6842505931854248,
"num_tokens": 13898532.0,
"step": 143
},
{
"entropy": 1.0963745787739754,
"epoch": 1.3980582524271845,
"grad_norm": 0.13382062315940857,
"learning_rate": 3.018905206004846e-05,
"loss": 1.1064839363098145,
"mean_token_accuracy": 0.6754385456442833,
"num_tokens": 13996316.0,
"step": 144
},
{
"entropy": 1.0882743149995804,
"epoch": 1.4077669902912622,
"grad_norm": 0.13834838569164276,
"learning_rate": 2.9926542548165e-05,
"loss": 1.095473051071167,
"mean_token_accuracy": 0.6777098774909973,
"num_tokens": 14093597.0,
"step": 145
},
{
"entropy": 1.112631008028984,
"epoch": 1.4174757281553398,
"grad_norm": 0.13094595074653625,
"learning_rate": 2.9663466663228978e-05,
"loss": 1.1103705167770386,
"mean_token_accuracy": 0.6743965744972229,
"num_tokens": 14190530.0,
"step": 146
},
{
"entropy": 1.1073136031627655,
"epoch": 1.4271844660194175,
"grad_norm": 0.13101445138454437,
"learning_rate": 2.939985464939043e-05,
"loss": 1.0990314483642578,
"mean_token_accuracy": 0.677456445991993,
"num_tokens": 14287147.0,
"step": 147
},
{
"entropy": 1.0993877053260803,
"epoch": 1.4368932038834952,
"grad_norm": 0.13668039441108704,
"learning_rate": 2.91357368124347e-05,
"loss": 1.0901072025299072,
"mean_token_accuracy": 0.6798613220453262,
"num_tokens": 14384467.0,
"step": 148
},
{
"entropy": 1.1148638427257538,
"epoch": 1.4466019417475728,
"grad_norm": 0.13427703082561493,
"learning_rate": 2.887114351629839e-05,
"loss": 1.1118576526641846,
"mean_token_accuracy": 0.6752256974577904,
"num_tokens": 14481672.0,
"step": 149
},
{
"entropy": 1.1126298606395721,
"epoch": 1.4563106796116505,
"grad_norm": 0.13493342697620392,
"learning_rate": 2.8606105179578585e-05,
"loss": 1.103308916091919,
"mean_token_accuracy": 0.6754327192902565,
"num_tokens": 14579140.0,
"step": 150
},
{
"entropy": 1.1269358694553375,
"epoch": 1.4660194174757282,
"grad_norm": 0.1375623494386673,
"learning_rate": 2.834065227203584e-05,
"loss": 1.1257972717285156,
"mean_token_accuracy": 0.6717520728707314,
"num_tokens": 14675405.0,
"step": 151
},
{
"entropy": 1.091068834066391,
"epoch": 1.4757281553398058,
"grad_norm": 0.13285107910633087,
"learning_rate": 2.8074815311091263e-05,
"loss": 1.0854649543762207,
"mean_token_accuracy": 0.6809473261237144,
"num_tokens": 14771912.0,
"step": 152
},
{
"entropy": 1.088371217250824,
"epoch": 1.4854368932038835,
"grad_norm": 0.12998193502426147,
"learning_rate": 2.780862485831814e-05,
"loss": 1.088443636894226,
"mean_token_accuracy": 0.6804046705365181,
"num_tokens": 14869059.0,
"step": 153
},
{
"entropy": 1.0733504742383957,
"epoch": 1.4951456310679612,
"grad_norm": 0.13263165950775146,
"learning_rate": 2.754211151592841e-05,
"loss": 1.0766732692718506,
"mean_token_accuracy": 0.6827335134148598,
"num_tokens": 14966471.0,
"step": 154
},
{
"entropy": 1.0793418139219284,
"epoch": 1.5048543689320388,
"grad_norm": 0.13578683137893677,
"learning_rate": 2.7275305923254606e-05,
"loss": 1.0825673341751099,
"mean_token_accuracy": 0.6809343695640564,
"num_tokens": 15064288.0,
"step": 155
},
{
"entropy": 1.0963272899389267,
"epoch": 1.5145631067961165,
"grad_norm": 0.13607671856880188,
"learning_rate": 2.7008238753227383e-05,
"loss": 1.098541021347046,
"mean_token_accuracy": 0.6789273098111153,
"num_tokens": 15161784.0,
"step": 156
},
{
"entropy": 1.0859090983867645,
"epoch": 1.5242718446601942,
"grad_norm": 0.13354609906673431,
"learning_rate": 2.674094070884926e-05,
"loss": 1.082608699798584,
"mean_token_accuracy": 0.6817299351096153,
"num_tokens": 15258172.0,
"step": 157
},
{
"entropy": 1.0621516406536102,
"epoch": 1.5339805825242718,
"grad_norm": 0.13234467804431915,
"learning_rate": 2.6473442519664933e-05,
"loss": 1.067661166191101,
"mean_token_accuracy": 0.6867925897240639,
"num_tokens": 15356321.0,
"step": 158
},
{
"entropy": 1.072020262479782,
"epoch": 1.5436893203883495,
"grad_norm": 0.13347479701042175,
"learning_rate": 2.6205774938228432e-05,
"loss": 1.0770134925842285,
"mean_token_accuracy": 0.6840454787015915,
"num_tokens": 15454280.0,
"step": 159
},
{
"entropy": 1.1073368191719055,
"epoch": 1.5533980582524272,
"grad_norm": 0.13910114765167236,
"learning_rate": 2.5937968736567746e-05,
"loss": 1.1051959991455078,
"mean_token_accuracy": 0.6768160760402679,
"num_tokens": 15548567.0,
"step": 160
},
{
"entropy": 1.096828117966652,
"epoch": 1.5631067961165048,
"grad_norm": 0.13016392290592194,
"learning_rate": 2.5670054702647146e-05,
"loss": 1.096802830696106,
"mean_token_accuracy": 0.6764859855175018,
"num_tokens": 15646127.0,
"step": 161
},
{
"entropy": 1.080091506242752,
"epoch": 1.5728155339805825,
"grad_norm": 0.13738420605659485,
"learning_rate": 2.540206363682768e-05,
"loss": 1.0735712051391602,
"mean_token_accuracy": 0.6868385076522827,
"num_tokens": 15743035.0,
"step": 162
},
{
"entropy": 1.0919175893068314,
"epoch": 1.5825242718446602,
"grad_norm": 0.13039371371269226,
"learning_rate": 2.513402634832627e-05,
"loss": 1.0824579000473022,
"mean_token_accuracy": 0.6828672811388969,
"num_tokens": 15840620.0,
"step": 163
},
{
"entropy": 1.1115864664316177,
"epoch": 1.5922330097087378,
"grad_norm": 0.1381915658712387,
"learning_rate": 2.486597365167374e-05,
"loss": 1.1111185550689697,
"mean_token_accuracy": 0.6739100441336632,
"num_tokens": 15934881.0,
"step": 164
},
{
"entropy": 1.112838163971901,
"epoch": 1.6019417475728155,
"grad_norm": 0.1360097974538803,
"learning_rate": 2.4597936363172327e-05,
"loss": 1.115320086479187,
"mean_token_accuracy": 0.6730142682790756,
"num_tokens": 16031255.0,
"step": 165
},
{
"entropy": 1.1212502270936966,
"epoch": 1.6116504854368932,
"grad_norm": 0.13571614027023315,
"learning_rate": 2.4329945297352856e-05,
"loss": 1.1150697469711304,
"mean_token_accuracy": 0.6693666502833366,
"num_tokens": 16128504.0,
"step": 166
},
{
"entropy": 1.1456474959850311,
"epoch": 1.6213592233009708,
"grad_norm": 0.13418100774288177,
"learning_rate": 2.4062031263432267e-05,
"loss": 1.1406886577606201,
"mean_token_accuracy": 0.6659777089953423,
"num_tokens": 16225326.0,
"step": 167
},
{
"entropy": 1.1106930375099182,
"epoch": 1.6310679611650487,
"grad_norm": 0.13814160227775574,
"learning_rate": 2.379422506177157e-05,
"loss": 1.1088345050811768,
"mean_token_accuracy": 0.6740678325295448,
"num_tokens": 16322821.0,
"step": 168
},
{
"entropy": 1.0945058912038803,
"epoch": 1.6407766990291264,
"grad_norm": 0.13345304131507874,
"learning_rate": 2.352655748033508e-05,
"loss": 1.0935648679733276,
"mean_token_accuracy": 0.6785749718546867,
"num_tokens": 16420465.0,
"step": 169
},
{
"entropy": 1.1017240583896637,
"epoch": 1.650485436893204,
"grad_norm": 0.13569359481334686,
"learning_rate": 2.3259059291150744e-05,
"loss": 1.1082301139831543,
"mean_token_accuracy": 0.6771815866231918,
"num_tokens": 16517503.0,
"step": 170
},
{
"entropy": 1.0889143496751785,
"epoch": 1.6601941747572817,
"grad_norm": 0.13005991280078888,
"learning_rate": 2.2991761246772623e-05,
"loss": 1.0856151580810547,
"mean_token_accuracy": 0.6784548461437225,
"num_tokens": 16614912.0,
"step": 171
},
{
"entropy": 1.0579037442803383,
"epoch": 1.6699029126213594,
"grad_norm": 0.1313212513923645,
"learning_rate": 2.2724694076745396e-05,
"loss": 1.0559953451156616,
"mean_token_accuracy": 0.6898924559354782,
"num_tokens": 16712592.0,
"step": 172
},
{
"entropy": 1.1083923876285553,
"epoch": 1.679611650485437,
"grad_norm": 0.13689088821411133,
"learning_rate": 2.245788848407159e-05,
"loss": 1.1079823970794678,
"mean_token_accuracy": 0.6759866625070572,
"num_tokens": 16810516.0,
"step": 173
},
{
"entropy": 1.0712365210056305,
"epoch": 1.6893203883495147,
"grad_norm": 0.13318578898906708,
"learning_rate": 2.2191375141681867e-05,
"loss": 1.0704731941223145,
"mean_token_accuracy": 0.6857739463448524,
"num_tokens": 16907482.0,
"step": 174
},
{
"entropy": 1.0663366466760635,
"epoch": 1.6990291262135924,
"grad_norm": 0.13724525272846222,
"learning_rate": 2.1925184688908733e-05,
"loss": 1.0599327087402344,
"mean_token_accuracy": 0.6870192289352417,
"num_tokens": 17004782.0,
"step": 175
},
{
"entropy": 1.0753221213817596,
"epoch": 1.70873786407767,
"grad_norm": 0.13162659108638763,
"learning_rate": 2.165934772796417e-05,
"loss": 1.0721540451049805,
"mean_token_accuracy": 0.6858146041631699,
"num_tokens": 17102923.0,
"step": 176
},
{
"entropy": 1.0932756066322327,
"epoch": 1.7184466019417477,
"grad_norm": 0.13949009776115417,
"learning_rate": 2.139389482042142e-05,
"loss": 1.0997275114059448,
"mean_token_accuracy": 0.6768719181418419,
"num_tokens": 17199802.0,
"step": 177
},
{
"entropy": 1.0782397091388702,
"epoch": 1.7281553398058254,
"grad_norm": 0.13670584559440613,
"learning_rate": 2.1128856483701624e-05,
"loss": 1.0765775442123413,
"mean_token_accuracy": 0.6813456863164902,
"num_tokens": 17297366.0,
"step": 178
},
{
"entropy": 1.1082730144262314,
"epoch": 1.737864077669903,
"grad_norm": 0.13865377008914948,
"learning_rate": 2.0864263187565307e-05,
"loss": 1.1068543195724487,
"mean_token_accuracy": 0.6740632429718971,
"num_tokens": 17394536.0,
"step": 179
},
{
"entropy": 1.0805223286151886,
"epoch": 1.7475728155339807,
"grad_norm": 0.13269315659999847,
"learning_rate": 2.0600145350609586e-05,
"loss": 1.083526611328125,
"mean_token_accuracy": 0.6796915903687477,
"num_tokens": 17492516.0,
"step": 180
},
{
"entropy": 1.0782201439142227,
"epoch": 1.7572815533980584,
"grad_norm": 0.1363665759563446,
"learning_rate": 2.033653333677103e-05,
"loss": 1.0777041912078857,
"mean_token_accuracy": 0.681628406047821,
"num_tokens": 17589926.0,
"step": 181
},
{
"entropy": 1.0712686330080032,
"epoch": 1.766990291262136,
"grad_norm": 0.13791945576667786,
"learning_rate": 2.0073457451835e-05,
"loss": 1.0800034999847412,
"mean_token_accuracy": 0.6833217963576317,
"num_tokens": 17686993.0,
"step": 182
},
{
"entropy": 1.1033148169517517,
"epoch": 1.7766990291262137,
"grad_norm": 0.1398749202489853,
"learning_rate": 1.9810947939951546e-05,
"loss": 1.09896719455719,
"mean_token_accuracy": 0.6757858321070671,
"num_tokens": 17784319.0,
"step": 183
},
{
"entropy": 1.0812745094299316,
"epoch": 1.7864077669902914,
"grad_norm": 0.13486915826797485,
"learning_rate": 1.9549034980158403e-05,
"loss": 1.0731672048568726,
"mean_token_accuracy": 0.6828427761793137,
"num_tokens": 17880977.0,
"step": 184
},
{
"entropy": 1.066931888461113,
"epoch": 1.796116504854369,
"grad_norm": 0.13600149750709534,
"learning_rate": 1.928774868291158e-05,
"loss": 1.0673391819000244,
"mean_token_accuracy": 0.686062753200531,
"num_tokens": 17978329.0,
"step": 185
},
{
"entropy": 1.071746215224266,
"epoch": 1.8058252427184467,
"grad_norm": 0.13377977907657623,
"learning_rate": 1.9027119086623645e-05,
"loss": 1.078979730606079,
"mean_token_accuracy": 0.6813490614295006,
"num_tokens": 18075785.0,
"step": 186
},
{
"entropy": 1.0819374173879623,
"epoch": 1.8155339805825244,
"grad_norm": 0.13810507953166962,
"learning_rate": 1.8767176154210537e-05,
"loss": 1.0912374258041382,
"mean_token_accuracy": 0.6771052777767181,
"num_tokens": 18172695.0,
"step": 187
},
{
"entropy": 1.0893210768699646,
"epoch": 1.825242718446602,
"grad_norm": 0.13837401568889618,
"learning_rate": 1.850794976964677e-05,
"loss": 1.0948269367218018,
"mean_token_accuracy": 0.6772284880280495,
"num_tokens": 18269124.0,
"step": 188
},
{
"entropy": 1.0922745019197464,
"epoch": 1.8349514563106797,
"grad_norm": 0.1368655264377594,
"learning_rate": 1.8249469734529994e-05,
"loss": 1.094635248184204,
"mean_token_accuracy": 0.6792716234922409,
"num_tokens": 18367249.0,
"step": 189
},
{
"entropy": 1.0973671078681946,
"epoch": 1.8446601941747574,
"grad_norm": 0.13867440819740295,
"learning_rate": 1.7991765764654813e-05,
"loss": 1.0981615781784058,
"mean_token_accuracy": 0.6770187169313431,
"num_tokens": 18463910.0,
"step": 190
},
{
"entropy": 1.0979862809181213,
"epoch": 1.854368932038835,
"grad_norm": 0.13719773292541504,
"learning_rate": 1.7734867486596594e-05,
"loss": 1.0996887683868408,
"mean_token_accuracy": 0.6748794317245483,
"num_tokens": 18561195.0,
"step": 191
},
{
"entropy": 1.0835170894861221,
"epoch": 1.8640776699029127,
"grad_norm": 0.13240128755569458,
"learning_rate": 1.7478804434305465e-05,
"loss": 1.0772799253463745,
"mean_token_accuracy": 0.681126669049263,
"num_tokens": 18658873.0,
"step": 192
},
{
"entropy": 1.0795052200555801,
"epoch": 1.8737864077669903,
"grad_norm": 0.13433118164539337,
"learning_rate": 1.7223606045711006e-05,
"loss": 1.075081706047058,
"mean_token_accuracy": 0.6832121908664703,
"num_tokens": 18755726.0,
"step": 193
},
{
"entropy": 1.093080535531044,
"epoch": 1.883495145631068,
"grad_norm": 0.13910488784313202,
"learning_rate": 1.6969301659337944e-05,
"loss": 1.0920544862747192,
"mean_token_accuracy": 0.6785269528627396,
"num_tokens": 18852964.0,
"step": 194
},
{
"entropy": 1.0945715457201004,
"epoch": 1.8932038834951457,
"grad_norm": 0.13376078009605408,
"learning_rate": 1.6715920510933274e-05,
"loss": 1.08772873878479,
"mean_token_accuracy": 0.6802259981632233,
"num_tokens": 18950306.0,
"step": 195
},
{
"entropy": 1.0904459059238434,
"epoch": 1.9029126213592233,
"grad_norm": 0.13289691507816315,
"learning_rate": 1.646349173010528e-05,
"loss": 1.079534888267517,
"mean_token_accuracy": 0.6807990521192551,
"num_tokens": 19047745.0,
"step": 196
},
{
"entropy": 1.084108181297779,
"epoch": 1.912621359223301,
"grad_norm": 0.13117721676826477,
"learning_rate": 1.6212044336974596e-05,
"loss": 1.0817947387695312,
"mean_token_accuracy": 0.6821762919425964,
"num_tokens": 19144506.0,
"step": 197
},
{
"entropy": 1.1004932224750519,
"epoch": 1.9223300970873787,
"grad_norm": 0.13507765531539917,
"learning_rate": 1.596160723883802e-05,
"loss": 1.0958290100097656,
"mean_token_accuracy": 0.6797609329223633,
"num_tokens": 19242731.0,
"step": 198
},
{
"entropy": 1.0579907447099686,
"epoch": 1.9320388349514563,
"grad_norm": 0.13918183743953705,
"learning_rate": 1.57122092268452e-05,
"loss": 1.0589427947998047,
"mean_token_accuracy": 0.6888704299926758,
"num_tokens": 19339951.0,
"step": 199
},
{
"entropy": 1.069817140698433,
"epoch": 1.941747572815534,
"grad_norm": 0.13269823789596558,
"learning_rate": 1.5463878972688705e-05,
"loss": 1.067978858947754,
"mean_token_accuracy": 0.6849696636199951,
"num_tokens": 19437708.0,
"step": 200
},
{
"entropy": 1.072118565440178,
"epoch": 1.9514563106796117,
"grad_norm": 0.1348169893026352,
"learning_rate": 1.5216645025307814e-05,
"loss": 1.0756759643554688,
"mean_token_accuracy": 0.6812460944056511,
"num_tokens": 19534829.0,
"step": 201
},
{
"entropy": 1.0803940147161484,
"epoch": 1.9611650485436893,
"grad_norm": 0.1353556215763092,
"learning_rate": 1.4970535807606453e-05,
"loss": 1.0730772018432617,
"mean_token_accuracy": 0.6812914535403252,
"num_tokens": 19632310.0,
"step": 202
},
{
"entropy": 1.1029697358608246,
"epoch": 1.970873786407767,
"grad_norm": 0.13503853976726532,
"learning_rate": 1.4725579613185547e-05,
"loss": 1.1056077480316162,
"mean_token_accuracy": 0.6741223260760307,
"num_tokens": 19730041.0,
"step": 203
},
{
"entropy": 1.0752769261598587,
"epoch": 1.9805825242718447,
"grad_norm": 0.13670338690280914,
"learning_rate": 1.4481804603090357e-05,
"loss": 1.0759882926940918,
"mean_token_accuracy": 0.6815044358372688,
"num_tokens": 19827501.0,
"step": 204
},
{
"entropy": 1.0689293816685677,
"epoch": 1.9902912621359223,
"grad_norm": 0.13970424234867096,
"learning_rate": 1.4239238802572908e-05,
"loss": 1.076995849609375,
"mean_token_accuracy": 0.6857749298214912,
"num_tokens": 19923357.0,
"step": 205
},
{
"entropy": 1.0659722238779068,
"epoch": 2.0,
"grad_norm": 0.1367228478193283,
"learning_rate": 1.3997910097870165e-05,
"loss": 1.067176103591919,
"mean_token_accuracy": 0.6823889762163162,
"num_tokens": 20020502.0,
"step": 206
}
],
"logging_steps": 1,
"max_steps": 309,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.3022063767763026e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}