B1minus_v4_e1 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
3dbe9eb verified
Raw
History Blame Contribute Delete
31.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 103,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3063052594661713,
"epoch": 0.009708737864077669,
"grad_norm": 1.3077822923660278,
"learning_rate": 0.0,
"loss": 2.1177937984466553,
"mean_token_accuracy": 0.5264865458011627,
"num_tokens": 96695.0,
"step": 1
},
{
"entropy": 1.3945444822311401,
"epoch": 0.019417475728155338,
"grad_norm": 1.4227101802825928,
"learning_rate": 3.125e-06,
"loss": 2.264981746673584,
"mean_token_accuracy": 0.49969692155718803,
"num_tokens": 193992.0,
"step": 2
},
{
"entropy": 1.3749237358570099,
"epoch": 0.02912621359223301,
"grad_norm": 1.1497575044631958,
"learning_rate": 6.25e-06,
"loss": 2.0460948944091797,
"mean_token_accuracy": 0.5287926904857159,
"num_tokens": 291993.0,
"step": 3
},
{
"entropy": 1.4135093837976456,
"epoch": 0.038834951456310676,
"grad_norm": 1.0101280212402344,
"learning_rate": 9.375000000000001e-06,
"loss": 2.0115394592285156,
"mean_token_accuracy": 0.5312202051281929,
"num_tokens": 389906.0,
"step": 4
},
{
"entropy": 1.5345965921878815,
"epoch": 0.04854368932038835,
"grad_norm": 0.8249343037605286,
"learning_rate": 1.25e-05,
"loss": 1.9907541275024414,
"mean_token_accuracy": 0.5317840278148651,
"num_tokens": 487090.0,
"step": 5
},
{
"entropy": 1.628997579216957,
"epoch": 0.05825242718446602,
"grad_norm": 0.6037535071372986,
"learning_rate": 1.5625e-05,
"loss": 1.917801856994629,
"mean_token_accuracy": 0.541858084499836,
"num_tokens": 584439.0,
"step": 6
},
{
"entropy": 1.8246440291404724,
"epoch": 0.06796116504854369,
"grad_norm": 0.3977610468864441,
"learning_rate": 1.8750000000000002e-05,
"loss": 1.8268287181854248,
"mean_token_accuracy": 0.5501810759305954,
"num_tokens": 681933.0,
"step": 7
},
{
"entropy": 1.9396448135375977,
"epoch": 0.07766990291262135,
"grad_norm": 0.47858306765556335,
"learning_rate": 2.1875e-05,
"loss": 1.7852939367294312,
"mean_token_accuracy": 0.5552558451890945,
"num_tokens": 777167.0,
"step": 8
},
{
"entropy": 1.9606482535600662,
"epoch": 0.08737864077669903,
"grad_norm": 0.5253126621246338,
"learning_rate": 2.5e-05,
"loss": 1.7283756732940674,
"mean_token_accuracy": 0.5672201961278915,
"num_tokens": 875080.0,
"step": 9
},
{
"entropy": 1.9720240384340286,
"epoch": 0.0970873786407767,
"grad_norm": 0.5374228954315186,
"learning_rate": 2.8125000000000003e-05,
"loss": 1.711395263671875,
"mean_token_accuracy": 0.5681185722351074,
"num_tokens": 973099.0,
"step": 10
},
{
"entropy": 1.82131689786911,
"epoch": 0.10679611650485436,
"grad_norm": 0.43059229850769043,
"learning_rate": 3.125e-05,
"loss": 1.6381919384002686,
"mean_token_accuracy": 0.5789104923605919,
"num_tokens": 1070082.0,
"step": 11
},
{
"entropy": 1.6750145703554153,
"epoch": 0.11650485436893204,
"grad_norm": 0.335764616727829,
"learning_rate": 3.4375e-05,
"loss": 1.5634382963180542,
"mean_token_accuracy": 0.5890125557780266,
"num_tokens": 1167345.0,
"step": 12
},
{
"entropy": 1.616977572441101,
"epoch": 0.1262135922330097,
"grad_norm": 0.29735782742500305,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.59102201461792,
"mean_token_accuracy": 0.5816583260893822,
"num_tokens": 1265097.0,
"step": 13
},
{
"entropy": 1.5444462895393372,
"epoch": 0.13592233009708737,
"grad_norm": 0.29059097170829773,
"learning_rate": 4.0625000000000005e-05,
"loss": 1.574419379234314,
"mean_token_accuracy": 0.5849687159061432,
"num_tokens": 1362414.0,
"step": 14
},
{
"entropy": 1.4560510218143463,
"epoch": 0.14563106796116504,
"grad_norm": 0.2826174199581146,
"learning_rate": 4.375e-05,
"loss": 1.5245388746261597,
"mean_token_accuracy": 0.5940257161855698,
"num_tokens": 1458384.0,
"step": 15
},
{
"entropy": 1.4310729652643204,
"epoch": 0.1553398058252427,
"grad_norm": 0.2571217119693756,
"learning_rate": 4.6875e-05,
"loss": 1.493829607963562,
"mean_token_accuracy": 0.5997192710638046,
"num_tokens": 1555321.0,
"step": 16
},
{
"entropy": 1.3802899718284607,
"epoch": 0.1650485436893204,
"grad_norm": 0.24408026039600372,
"learning_rate": 5e-05,
"loss": 1.4393625259399414,
"mean_token_accuracy": 0.6103221923112869,
"num_tokens": 1652989.0,
"step": 17
},
{
"entropy": 1.423762321472168,
"epoch": 0.17475728155339806,
"grad_norm": 0.260315865278244,
"learning_rate": 4.999856295503635e-05,
"loss": 1.4357669353485107,
"mean_token_accuracy": 0.6085835695266724,
"num_tokens": 1749968.0,
"step": 18
},
{
"entropy": 1.4223755896091461,
"epoch": 0.18446601941747573,
"grad_norm": 0.26641297340393066,
"learning_rate": 4.999425198535325e-05,
"loss": 1.4089168310165405,
"mean_token_accuracy": 0.6123870462179184,
"num_tokens": 1847337.0,
"step": 19
},
{
"entropy": 1.4421514868736267,
"epoch": 0.1941747572815534,
"grad_norm": 0.2118070274591446,
"learning_rate": 4.998706758655528e-05,
"loss": 1.4083303213119507,
"mean_token_accuracy": 0.6158460900187492,
"num_tokens": 1944252.0,
"step": 20
},
{
"entropy": 1.3758682906627655,
"epoch": 0.20388349514563106,
"grad_norm": 0.21211183071136475,
"learning_rate": 4.997701058458676e-05,
"loss": 1.3528016805648804,
"mean_token_accuracy": 0.6290531530976295,
"num_tokens": 2041362.0,
"step": 21
},
{
"entropy": 1.3912087827920914,
"epoch": 0.21359223300970873,
"grad_norm": 0.20889078080654144,
"learning_rate": 4.996408213563684e-05,
"loss": 1.3577451705932617,
"mean_token_accuracy": 0.6254735365509987,
"num_tokens": 2139370.0,
"step": 22
},
{
"entropy": 1.3215357810258865,
"epoch": 0.22330097087378642,
"grad_norm": 0.20261520147323608,
"learning_rate": 4.994828372600649e-05,
"loss": 1.300628662109375,
"mean_token_accuracy": 0.6371148228645325,
"num_tokens": 2233615.0,
"step": 23
},
{
"entropy": 1.3306704312562943,
"epoch": 0.23300970873786409,
"grad_norm": 0.19877074658870697,
"learning_rate": 4.9929617171937724e-05,
"loss": 1.3034857511520386,
"mean_token_accuracy": 0.6345249861478806,
"num_tokens": 2330947.0,
"step": 24
},
{
"entropy": 1.3362696319818497,
"epoch": 0.24271844660194175,
"grad_norm": 0.17692981660366058,
"learning_rate": 4.9908084619404735e-05,
"loss": 1.3098223209381104,
"mean_token_accuracy": 0.6328666806221008,
"num_tokens": 2428936.0,
"step": 25
},
{
"entropy": 1.3557860553264618,
"epoch": 0.2524271844660194,
"grad_norm": 0.19237112998962402,
"learning_rate": 4.988368854386722e-05,
"loss": 1.3239411115646362,
"mean_token_accuracy": 0.6320360824465752,
"num_tokens": 2526310.0,
"step": 26
},
{
"entropy": 1.32492034137249,
"epoch": 0.2621359223300971,
"grad_norm": 0.19819748401641846,
"learning_rate": 4.985643174998578e-05,
"loss": 1.3037995100021362,
"mean_token_accuracy": 0.6353878080844879,
"num_tokens": 2623215.0,
"step": 27
},
{
"entropy": 1.2510884702205658,
"epoch": 0.27184466019417475,
"grad_norm": 0.17776808142662048,
"learning_rate": 4.982631737129948e-05,
"loss": 1.2440943717956543,
"mean_token_accuracy": 0.6481084004044533,
"num_tokens": 2720683.0,
"step": 28
},
{
"entropy": 1.287326768040657,
"epoch": 0.2815533980582524,
"grad_norm": 0.17891287803649902,
"learning_rate": 4.9793348869865616e-05,
"loss": 1.29865300655365,
"mean_token_accuracy": 0.6353446468710899,
"num_tokens": 2818153.0,
"step": 29
},
{
"entropy": 1.2316195368766785,
"epoch": 0.2912621359223301,
"grad_norm": 0.17647312581539154,
"learning_rate": 4.9757530035861716e-05,
"loss": 1.253545880317688,
"mean_token_accuracy": 0.6457989513874054,
"num_tokens": 2915748.0,
"step": 30
},
{
"entropy": 1.169528603553772,
"epoch": 0.30097087378640774,
"grad_norm": 0.16643674671649933,
"learning_rate": 4.971886498714977e-05,
"loss": 1.1838676929473877,
"mean_token_accuracy": 0.6634209230542183,
"num_tokens": 3013095.0,
"step": 31
},
{
"entropy": 1.2801441848278046,
"epoch": 0.3106796116504854,
"grad_norm": 0.17172685265541077,
"learning_rate": 4.967735816880286e-05,
"loss": 1.2642897367477417,
"mean_token_accuracy": 0.6400710195302963,
"num_tokens": 3110631.0,
"step": 32
},
{
"entropy": 1.2720160782337189,
"epoch": 0.32038834951456313,
"grad_norm": 0.16451463103294373,
"learning_rate": 4.963301435259413e-05,
"loss": 1.2586028575897217,
"mean_token_accuracy": 0.6447242349386215,
"num_tokens": 3207970.0,
"step": 33
},
{
"entropy": 1.2911356091499329,
"epoch": 0.3300970873786408,
"grad_norm": 0.1695583015680313,
"learning_rate": 4.95858386364482e-05,
"loss": 1.2504911422729492,
"mean_token_accuracy": 0.6436235383152962,
"num_tokens": 3305342.0,
"step": 34
},
{
"entropy": 1.2505649775266647,
"epoch": 0.33980582524271846,
"grad_norm": 0.1600319743156433,
"learning_rate": 4.9535836443855096e-05,
"loss": 1.2131391763687134,
"mean_token_accuracy": 0.6537701711058617,
"num_tokens": 3399739.0,
"step": 35
},
{
"entropy": 1.1979082226753235,
"epoch": 0.34951456310679613,
"grad_norm": 0.15272502601146698,
"learning_rate": 4.948301352324673e-05,
"loss": 1.1704742908477783,
"mean_token_accuracy": 0.6647882163524628,
"num_tokens": 3497430.0,
"step": 36
},
{
"entropy": 1.2117689549922943,
"epoch": 0.3592233009708738,
"grad_norm": 0.15061117708683014,
"learning_rate": 4.942737594733609e-05,
"loss": 1.1953562498092651,
"mean_token_accuracy": 0.6564236953854561,
"num_tokens": 3593935.0,
"step": 37
},
{
"entropy": 1.1917639821767807,
"epoch": 0.36893203883495146,
"grad_norm": 0.15709325671195984,
"learning_rate": 4.9368930112419e-05,
"loss": 1.1850690841674805,
"mean_token_accuracy": 0.660385861992836,
"num_tokens": 3691118.0,
"step": 38
},
{
"entropy": 1.2446843981742859,
"epoch": 0.3786407766990291,
"grad_norm": 0.16046260297298431,
"learning_rate": 4.930768273763889e-05,
"loss": 1.2477033138275146,
"mean_token_accuracy": 0.6435192674398422,
"num_tokens": 3788648.0,
"step": 39
},
{
"entropy": 1.2205789387226105,
"epoch": 0.3883495145631068,
"grad_norm": 0.1660885363817215,
"learning_rate": 4.92436408642143e-05,
"loss": 1.2170484066009521,
"mean_token_accuracy": 0.6503675952553749,
"num_tokens": 3886532.0,
"step": 40
},
{
"entropy": 1.205104410648346,
"epoch": 0.39805825242718446,
"grad_norm": 0.15774689614772797,
"learning_rate": 4.917681185462934e-05,
"loss": 1.207252860069275,
"mean_token_accuracy": 0.655083142220974,
"num_tokens": 3984443.0,
"step": 41
},
{
"entropy": 1.1894231885671616,
"epoch": 0.4077669902912621,
"grad_norm": 0.1520465910434723,
"learning_rate": 4.910720339178735e-05,
"loss": 1.1727756261825562,
"mean_token_accuracy": 0.6604171320796013,
"num_tokens": 4082127.0,
"step": 42
},
{
"entropy": 1.1813564747571945,
"epoch": 0.4174757281553398,
"grad_norm": 0.1579592078924179,
"learning_rate": 4.90348234781276e-05,
"loss": 1.1708219051361084,
"mean_token_accuracy": 0.6622453778982162,
"num_tokens": 4179696.0,
"step": 43
},
{
"entropy": 1.1847212761640549,
"epoch": 0.42718446601941745,
"grad_norm": 0.16752171516418457,
"learning_rate": 4.895968043470532e-05,
"loss": 1.1717603206634521,
"mean_token_accuracy": 0.6604401022195816,
"num_tokens": 4276989.0,
"step": 44
},
{
"entropy": 1.1232565939426422,
"epoch": 0.4368932038834951,
"grad_norm": 0.16498398780822754,
"learning_rate": 4.8881782900235094e-05,
"loss": 1.1282835006713867,
"mean_token_accuracy": 0.6696558594703674,
"num_tokens": 4374513.0,
"step": 45
},
{
"entropy": 1.1546286791563034,
"epoch": 0.44660194174757284,
"grad_norm": 0.16002920269966125,
"learning_rate": 4.880113983009768e-05,
"loss": 1.163672924041748,
"mean_token_accuracy": 0.6636269986629486,
"num_tokens": 4472543.0,
"step": 46
},
{
"entropy": 1.220591351389885,
"epoch": 0.4563106796116505,
"grad_norm": 0.15611808001995087,
"learning_rate": 4.87177604953105e-05,
"loss": 1.227357268333435,
"mean_token_accuracy": 0.6496708914637566,
"num_tokens": 4570196.0,
"step": 47
},
{
"entropy": 1.1873502284288406,
"epoch": 0.46601941747572817,
"grad_norm": 0.15429329872131348,
"learning_rate": 4.86316544814618e-05,
"loss": 1.1806132793426514,
"mean_token_accuracy": 0.6577019914984703,
"num_tokens": 4667589.0,
"step": 48
},
{
"entropy": 1.1497704908251762,
"epoch": 0.47572815533980584,
"grad_norm": 0.14651840925216675,
"learning_rate": 4.854283168760868e-05,
"loss": 1.132278323173523,
"mean_token_accuracy": 0.6702492162585258,
"num_tokens": 4765775.0,
"step": 49
},
{
"entropy": 1.19112890958786,
"epoch": 0.4854368932038835,
"grad_norm": 0.16413071751594543,
"learning_rate": 4.8451302325139004e-05,
"loss": 1.1689636707305908,
"mean_token_accuracy": 0.6610261425375938,
"num_tokens": 4864001.0,
"step": 50
},
{
"entropy": 1.1795462369918823,
"epoch": 0.49514563106796117,
"grad_norm": 0.1465304046869278,
"learning_rate": 4.835707691659753e-05,
"loss": 1.1613165140151978,
"mean_token_accuracy": 0.6660530865192413,
"num_tokens": 4960993.0,
"step": 51
},
{
"entropy": 1.1446045935153961,
"epoch": 0.5048543689320388,
"grad_norm": 0.1478618085384369,
"learning_rate": 4.8260166294476164e-05,
"loss": 1.1292091608047485,
"mean_token_accuracy": 0.6699203625321388,
"num_tokens": 5058285.0,
"step": 52
},
{
"entropy": 1.1335399597883224,
"epoch": 0.5145631067961165,
"grad_norm": 0.15407773852348328,
"learning_rate": 4.8160581599968625e-05,
"loss": 1.1282105445861816,
"mean_token_accuracy": 0.6706565544009209,
"num_tokens": 5155340.0,
"step": 53
},
{
"entropy": 1.1364393010735512,
"epoch": 0.5242718446601942,
"grad_norm": 0.15273907780647278,
"learning_rate": 4.8058334281689595e-05,
"loss": 1.1344889402389526,
"mean_token_accuracy": 0.668300211429596,
"num_tokens": 5253290.0,
"step": 54
},
{
"entropy": 1.1561526656150818,
"epoch": 0.5339805825242718,
"grad_norm": 0.15070948004722595,
"learning_rate": 4.7953436094358595e-05,
"loss": 1.145023226737976,
"mean_token_accuracy": 0.6662660464644432,
"num_tokens": 5350631.0,
"step": 55
},
{
"entropy": 1.1212447136640549,
"epoch": 0.5436893203883495,
"grad_norm": 0.1489776223897934,
"learning_rate": 4.784589909744855e-05,
"loss": 1.1079856157302856,
"mean_token_accuracy": 0.6758884415030479,
"num_tokens": 5447338.0,
"step": 56
},
{
"entropy": 1.1728671193122864,
"epoch": 0.5533980582524272,
"grad_norm": 0.1548493206501007,
"learning_rate": 4.7735735653799463e-05,
"loss": 1.159340739250183,
"mean_token_accuracy": 0.6629773899912834,
"num_tokens": 5543513.0,
"step": 57
},
{
"entropy": 1.1602209657430649,
"epoch": 0.5631067961165048,
"grad_norm": 0.15153397619724274,
"learning_rate": 4.762295842819707e-05,
"loss": 1.1558430194854736,
"mean_token_accuracy": 0.6631080582737923,
"num_tokens": 5640853.0,
"step": 58
},
{
"entropy": 1.167491763830185,
"epoch": 0.5728155339805825,
"grad_norm": 0.15950381755828857,
"learning_rate": 4.75075803859169e-05,
"loss": 1.1687371730804443,
"mean_token_accuracy": 0.662310965359211,
"num_tokens": 5737838.0,
"step": 59
},
{
"entropy": 1.1121539771556854,
"epoch": 0.5825242718446602,
"grad_norm": 0.15362070500850677,
"learning_rate": 4.7389614791233726e-05,
"loss": 1.122381567955017,
"mean_token_accuracy": 0.6725770682096481,
"num_tokens": 5835215.0,
"step": 60
},
{
"entropy": 1.1065661907196045,
"epoch": 0.5922330097087378,
"grad_norm": 0.15264824032783508,
"learning_rate": 4.726907520589664e-05,
"loss": 1.1158289909362793,
"mean_token_accuracy": 0.673554889857769,
"num_tokens": 5933071.0,
"step": 61
},
{
"entropy": 1.1254866421222687,
"epoch": 0.6019417475728155,
"grad_norm": 0.1510513871908188,
"learning_rate": 4.714597548756996e-05,
"loss": 1.1177195310592651,
"mean_token_accuracy": 0.6726218238472939,
"num_tokens": 6030510.0,
"step": 62
},
{
"entropy": 1.1632820963859558,
"epoch": 0.6116504854368932,
"grad_norm": 0.15587088465690613,
"learning_rate": 4.702032978824011e-05,
"loss": 1.1515460014343262,
"mean_token_accuracy": 0.6640657410025597,
"num_tokens": 6128308.0,
"step": 63
},
{
"entropy": 1.13534314930439,
"epoch": 0.6213592233009708,
"grad_norm": 0.15413475036621094,
"learning_rate": 4.6892152552588655e-05,
"loss": 1.1225864887237549,
"mean_token_accuracy": 0.6697054132819176,
"num_tokens": 6225307.0,
"step": 64
},
{
"entropy": 1.1529878377914429,
"epoch": 0.6310679611650486,
"grad_norm": 0.14912283420562744,
"learning_rate": 4.6761458516331655e-05,
"loss": 1.137518048286438,
"mean_token_accuracy": 0.6690729334950447,
"num_tokens": 6322345.0,
"step": 65
},
{
"entropy": 1.162615068256855,
"epoch": 0.6407766990291263,
"grad_norm": 0.15968185663223267,
"learning_rate": 4.662826270452565e-05,
"loss": 1.148972988128662,
"mean_token_accuracy": 0.6663458272814751,
"num_tokens": 6419830.0,
"step": 66
},
{
"entropy": 1.1012173295021057,
"epoch": 0.6504854368932039,
"grad_norm": 0.15278087556362152,
"learning_rate": 4.649258042984026e-05,
"loss": 1.0935297012329102,
"mean_token_accuracy": 0.6765975803136826,
"num_tokens": 6517180.0,
"step": 67
},
{
"entropy": 1.1730160862207413,
"epoch": 0.6601941747572816,
"grad_norm": 0.15458795428276062,
"learning_rate": 4.6354427290797875e-05,
"loss": 1.1597059965133667,
"mean_token_accuracy": 0.6620247736573219,
"num_tokens": 6614441.0,
"step": 68
},
{
"entropy": 1.1525196582078934,
"epoch": 0.6699029126213593,
"grad_norm": 0.15900148451328278,
"learning_rate": 4.621381916998029e-05,
"loss": 1.1408532857894897,
"mean_token_accuracy": 0.6672633439302444,
"num_tokens": 6711921.0,
"step": 69
},
{
"entropy": 1.1234073489904404,
"epoch": 0.6796116504854369,
"grad_norm": 0.9614858031272888,
"learning_rate": 4.607077223220285e-05,
"loss": 1.1134552955627441,
"mean_token_accuracy": 0.6734683215618134,
"num_tokens": 6808916.0,
"step": 70
},
{
"entropy": 1.1003537625074387,
"epoch": 0.6893203883495146,
"grad_norm": 0.27281081676483154,
"learning_rate": 4.592530292265609e-05,
"loss": 1.093156337738037,
"mean_token_accuracy": 0.677058070898056,
"num_tokens": 6905733.0,
"step": 71
},
{
"entropy": 1.1193806380033493,
"epoch": 0.6990291262135923,
"grad_norm": 0.15709951519966125,
"learning_rate": 4.5777427965015096e-05,
"loss": 1.1156103610992432,
"mean_token_accuracy": 0.6733296439051628,
"num_tokens": 7002459.0,
"step": 72
},
{
"entropy": 1.0762626677751541,
"epoch": 0.7087378640776699,
"grad_norm": 0.14975018799304962,
"learning_rate": 4.562716435951692e-05,
"loss": 1.0788187980651855,
"mean_token_accuracy": 0.6805250495672226,
"num_tokens": 7100490.0,
"step": 73
},
{
"entropy": 1.1070052459836006,
"epoch": 0.7184466019417476,
"grad_norm": 0.163674458861351,
"learning_rate": 4.5474529381006146e-05,
"loss": 1.1094239950180054,
"mean_token_accuracy": 0.6733985841274261,
"num_tokens": 7197967.0,
"step": 74
},
{
"entropy": 1.133701667189598,
"epoch": 0.7281553398058253,
"grad_norm": 0.16219182312488556,
"learning_rate": 4.531954057694897e-05,
"loss": 1.131150484085083,
"mean_token_accuracy": 0.6676085367798805,
"num_tokens": 7292478.0,
"step": 75
},
{
"entropy": 1.151291936635971,
"epoch": 0.7378640776699029,
"grad_norm": 0.15997757017612457,
"learning_rate": 4.516221576541581e-05,
"loss": 1.1296626329421997,
"mean_token_accuracy": 0.6666271537542343,
"num_tokens": 7389056.0,
"step": 76
},
{
"entropy": 1.1276646926999092,
"epoch": 0.7475728155339806,
"grad_norm": 0.16011382639408112,
"learning_rate": 4.5002573033032904e-05,
"loss": 1.1120346784591675,
"mean_token_accuracy": 0.6736837849020958,
"num_tokens": 7486257.0,
"step": 77
},
{
"entropy": 1.115042731165886,
"epoch": 0.7572815533980582,
"grad_norm": 0.1535303145647049,
"learning_rate": 4.484063073290301e-05,
"loss": 1.1091301441192627,
"mean_token_accuracy": 0.6762245669960976,
"num_tokens": 7583265.0,
"step": 78
},
{
"entropy": 1.087426796555519,
"epoch": 0.7669902912621359,
"grad_norm": 0.16656380891799927,
"learning_rate": 4.467640748249548e-05,
"loss": 1.0862419605255127,
"mean_token_accuracy": 0.6805471926927567,
"num_tokens": 7680175.0,
"step": 79
},
{
"entropy": 1.1316653937101364,
"epoch": 0.7766990291262136,
"grad_norm": 0.15928491950035095,
"learning_rate": 4.4509922161505926e-05,
"loss": 1.1360259056091309,
"mean_token_accuracy": 0.6669512763619423,
"num_tokens": 7777798.0,
"step": 80
},
{
"entropy": 1.1151190549135208,
"epoch": 0.7864077669902912,
"grad_norm": 0.15734143555164337,
"learning_rate": 4.4341193909685686e-05,
"loss": 1.1140034198760986,
"mean_token_accuracy": 0.6693683862686157,
"num_tokens": 7875637.0,
"step": 81
},
{
"entropy": 1.1036027371883392,
"epoch": 0.7961165048543689,
"grad_norm": 0.16518977284431458,
"learning_rate": 4.417024212464152e-05,
"loss": 1.0992156267166138,
"mean_token_accuracy": 0.6753587499260902,
"num_tokens": 7973214.0,
"step": 82
},
{
"entropy": 1.1240820437669754,
"epoch": 0.8058252427184466,
"grad_norm": 0.15742117166519165,
"learning_rate": 4.399708645960559e-05,
"loss": 1.1219127178192139,
"mean_token_accuracy": 0.6707674041390419,
"num_tokens": 8071015.0,
"step": 83
},
{
"entropy": 1.0782043635845184,
"epoch": 0.8155339805825242,
"grad_norm": 0.15135641396045685,
"learning_rate": 4.382174682117598e-05,
"loss": 1.0685319900512695,
"mean_token_accuracy": 0.6833792477846146,
"num_tokens": 8167887.0,
"step": 84
},
{
"entropy": 1.1078387796878815,
"epoch": 0.8252427184466019,
"grad_norm": 0.15460753440856934,
"learning_rate": 4.364424336702825e-05,
"loss": 1.1065967082977295,
"mean_token_accuracy": 0.6753173843026161,
"num_tokens": 8265328.0,
"step": 85
},
{
"entropy": 1.109467014670372,
"epoch": 0.8349514563106796,
"grad_norm": 0.15673620998859406,
"learning_rate": 4.346459650359798e-05,
"loss": 1.1054904460906982,
"mean_token_accuracy": 0.6707606092095375,
"num_tokens": 8362790.0,
"step": 86
},
{
"entropy": 1.125985011458397,
"epoch": 0.8446601941747572,
"grad_norm": 0.1561659872531891,
"learning_rate": 4.328282688373479e-05,
"loss": 1.111283302307129,
"mean_token_accuracy": 0.6752806529402733,
"num_tokens": 8460119.0,
"step": 87
},
{
"entropy": 1.0695659816265106,
"epoch": 0.8543689320388349,
"grad_norm": 0.16007103025913239,
"learning_rate": 4.3098955404328045e-05,
"loss": 1.056589961051941,
"mean_token_accuracy": 0.6865223124623299,
"num_tokens": 8555768.0,
"step": 88
},
{
"entropy": 1.0883630514144897,
"epoch": 0.8640776699029126,
"grad_norm": 0.15864451229572296,
"learning_rate": 4.29130032039044e-05,
"loss": 1.0721038579940796,
"mean_token_accuracy": 0.6814716532826424,
"num_tokens": 8653989.0,
"step": 89
},
{
"entropy": 1.0660209506750107,
"epoch": 0.8737864077669902,
"grad_norm": 0.15096718072891235,
"learning_rate": 4.272499166019771e-05,
"loss": 1.0504462718963623,
"mean_token_accuracy": 0.6850994229316711,
"num_tokens": 8751995.0,
"step": 90
},
{
"entropy": 1.1066109761595726,
"epoch": 0.883495145631068,
"grad_norm": 0.16408860683441162,
"learning_rate": 4.253494238769134e-05,
"loss": 1.106789231300354,
"mean_token_accuracy": 0.6758328899741173,
"num_tokens": 8848370.0,
"step": 91
},
{
"entropy": 1.0865231901407242,
"epoch": 0.8932038834951457,
"grad_norm": 0.1649610996246338,
"learning_rate": 4.234287723513326e-05,
"loss": 1.095716118812561,
"mean_token_accuracy": 0.6755226477980614,
"num_tokens": 8946065.0,
"step": 92
},
{
"entropy": 1.0563477203249931,
"epoch": 0.9029126213592233,
"grad_norm": 0.15605774521827698,
"learning_rate": 4.2148818283024304e-05,
"loss": 1.0641911029815674,
"mean_token_accuracy": 0.684117816388607,
"num_tokens": 9043734.0,
"step": 93
},
{
"entropy": 1.1027402877807617,
"epoch": 0.912621359223301,
"grad_norm": 0.1745792031288147,
"learning_rate": 4.195278784107964e-05,
"loss": 1.093820571899414,
"mean_token_accuracy": 0.6766936853528023,
"num_tokens": 9141101.0,
"step": 94
},
{
"entropy": 1.1108492761850357,
"epoch": 0.9223300970873787,
"grad_norm": 0.1714155375957489,
"learning_rate": 4.175480844566404e-05,
"loss": 1.0948399305343628,
"mean_token_accuracy": 0.6759923100471497,
"num_tokens": 9238764.0,
"step": 95
},
{
"entropy": 1.092107117176056,
"epoch": 0.9320388349514563,
"grad_norm": 0.16130048036575317,
"learning_rate": 4.1554902857200924e-05,
"loss": 1.0810198783874512,
"mean_token_accuracy": 0.6786670908331871,
"num_tokens": 9335019.0,
"step": 96
},
{
"entropy": 1.0851488932967186,
"epoch": 0.941747572815534,
"grad_norm": 0.16832125186920166,
"learning_rate": 4.135309405755583e-05,
"loss": 1.073775291442871,
"mean_token_accuracy": 0.6807554513216019,
"num_tokens": 9433084.0,
"step": 97
},
{
"entropy": 1.0768142491579056,
"epoch": 0.9514563106796117,
"grad_norm": 0.16131848096847534,
"learning_rate": 4.11494052473943e-05,
"loss": 1.0637844800949097,
"mean_token_accuracy": 0.6831372752785683,
"num_tokens": 9530495.0,
"step": 98
},
{
"entropy": 1.063091091811657,
"epoch": 0.9611650485436893,
"grad_norm": 0.16142332553863525,
"learning_rate": 4.094385984351462e-05,
"loss": 1.0600042343139648,
"mean_token_accuracy": 0.6849533692002296,
"num_tokens": 9628209.0,
"step": 99
},
{
"entropy": 1.0749415531754494,
"epoch": 0.970873786407767,
"grad_norm": 0.18972496688365936,
"learning_rate": 4.073648147615579e-05,
"loss": 1.0742400884628296,
"mean_token_accuracy": 0.6798612177371979,
"num_tokens": 9726165.0,
"step": 100
},
{
"entropy": 1.0456555485725403,
"epoch": 0.9805825242718447,
"grad_norm": 0.1582217514514923,
"learning_rate": 4.052729398628089e-05,
"loss": 1.0480663776397705,
"mean_token_accuracy": 0.6852379813790321,
"num_tokens": 9823616.0,
"step": 101
},
{
"entropy": 1.0736559927463531,
"epoch": 0.9902912621359223,
"grad_norm": 0.16985982656478882,
"learning_rate": 4.031632142283622e-05,
"loss": 1.0799673795700073,
"mean_token_accuracy": 0.6796677485108376,
"num_tokens": 9921527.0,
"step": 102
},
{
"entropy": 1.0745692774653435,
"epoch": 1.0,
"grad_norm": 0.16134285926818848,
"learning_rate": 4.0103588039986556e-05,
"loss": 1.078010082244873,
"mean_token_accuracy": 0.6782025918364525,
"num_tokens": 10018894.0,
"step": 103
}
],
"logging_steps": 1,
"max_steps": 309,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.4093087033157222e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}