A2minus_v4_e2 / trainer_state.json
Taywon's picture
Upload folder using huggingface_hub
dddad69 verified
Raw
History Blame Contribute Delete
47.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 156,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.2969624996185303,
"epoch": 0.012861736334405145,
"grad_norm": 1.222815990447998,
"learning_rate": 0.0,
"loss": 2.025021553039551,
"mean_token_accuracy": 0.5397194549441338,
"num_tokens": 128512.0,
"step": 1
},
{
"entropy": 1.3495921194553375,
"epoch": 0.02572347266881029,
"grad_norm": 1.2900104522705078,
"learning_rate": 4.166666666666667e-06,
"loss": 2.113243341445923,
"mean_token_accuracy": 0.5239669531583786,
"num_tokens": 258439.0,
"step": 2
},
{
"entropy": 1.4065107256174088,
"epoch": 0.03858520900321544,
"grad_norm": 1.1876918077468872,
"learning_rate": 8.333333333333334e-06,
"loss": 2.0984230041503906,
"mean_token_accuracy": 0.525254875421524,
"num_tokens": 387958.0,
"step": 3
},
{
"entropy": 1.4473730325698853,
"epoch": 0.05144694533762058,
"grad_norm": 0.995452880859375,
"learning_rate": 1.25e-05,
"loss": 2.0187673568725586,
"mean_token_accuracy": 0.534252941608429,
"num_tokens": 516779.0,
"step": 4
},
{
"entropy": 1.626717284321785,
"epoch": 0.06430868167202572,
"grad_norm": 0.6222253441810608,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.9110387563705444,
"mean_token_accuracy": 0.5435223057866096,
"num_tokens": 645829.0,
"step": 5
},
{
"entropy": 1.810067042708397,
"epoch": 0.07717041800643087,
"grad_norm": 0.42118003964424133,
"learning_rate": 2.0833333333333336e-05,
"loss": 1.8789349794387817,
"mean_token_accuracy": 0.5466088876128197,
"num_tokens": 774435.0,
"step": 6
},
{
"entropy": 1.9707088768482208,
"epoch": 0.09003215434083602,
"grad_norm": 0.4645366072654724,
"learning_rate": 2.5e-05,
"loss": 1.8074758052825928,
"mean_token_accuracy": 0.5567064955830574,
"num_tokens": 903545.0,
"step": 7
},
{
"entropy": 1.9890314191579819,
"epoch": 0.10289389067524116,
"grad_norm": 0.5461070537567139,
"learning_rate": 2.916666666666667e-05,
"loss": 1.7440648078918457,
"mean_token_accuracy": 0.5663307011127472,
"num_tokens": 1033070.0,
"step": 8
},
{
"entropy": 1.968129649758339,
"epoch": 0.1157556270096463,
"grad_norm": 0.5405251383781433,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.7069363594055176,
"mean_token_accuracy": 0.5683588162064552,
"num_tokens": 1162755.0,
"step": 9
},
{
"entropy": 1.8345413953065872,
"epoch": 0.12861736334405144,
"grad_norm": 0.42177239060401917,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.65086030960083,
"mean_token_accuracy": 0.5773059874773026,
"num_tokens": 1290164.0,
"step": 10
},
{
"entropy": 1.6431169360876083,
"epoch": 0.1414790996784566,
"grad_norm": 0.31144559383392334,
"learning_rate": 4.166666666666667e-05,
"loss": 1.582027792930603,
"mean_token_accuracy": 0.5872198939323425,
"num_tokens": 1419501.0,
"step": 11
},
{
"entropy": 1.544620230793953,
"epoch": 0.15434083601286175,
"grad_norm": 0.27825888991355896,
"learning_rate": 4.5833333333333334e-05,
"loss": 1.5446865558624268,
"mean_token_accuracy": 0.594700962305069,
"num_tokens": 1547996.0,
"step": 12
},
{
"entropy": 1.4267793744802475,
"epoch": 0.16720257234726688,
"grad_norm": 0.2835897207260132,
"learning_rate": 5e-05,
"loss": 1.509974479675293,
"mean_token_accuracy": 0.6006790399551392,
"num_tokens": 1676937.0,
"step": 13
},
{
"entropy": 1.3972271531820297,
"epoch": 0.18006430868167203,
"grad_norm": 0.25854921340942383,
"learning_rate": 4.9997496794168726e-05,
"loss": 1.491778016090393,
"mean_token_accuracy": 0.6045994758605957,
"num_tokens": 1806013.0,
"step": 14
},
{
"entropy": 1.4395506381988525,
"epoch": 0.19292604501607716,
"grad_norm": 0.22095996141433716,
"learning_rate": 4.998998767795805e-05,
"loss": 1.4883487224578857,
"mean_token_accuracy": 0.6050755307078362,
"num_tokens": 1935387.0,
"step": 15
},
{
"entropy": 1.4550755470991135,
"epoch": 0.2057877813504823,
"grad_norm": 0.24221676588058472,
"learning_rate": 4.9977474155117045e-05,
"loss": 1.4858245849609375,
"mean_token_accuracy": 0.6017315089702606,
"num_tokens": 2065100.0,
"step": 16
},
{
"entropy": 1.4459427893161774,
"epoch": 0.21864951768488747,
"grad_norm": 0.25146999955177307,
"learning_rate": 4.995995873155958e-05,
"loss": 1.4274994134902954,
"mean_token_accuracy": 0.6151479333639145,
"num_tokens": 2194685.0,
"step": 17
},
{
"entropy": 1.4442210048437119,
"epoch": 0.2315112540192926,
"grad_norm": 0.2271786779165268,
"learning_rate": 4.99374449148625e-05,
"loss": 1.4092518091201782,
"mean_token_accuracy": 0.6148851290345192,
"num_tokens": 2324963.0,
"step": 18
},
{
"entropy": 1.4254360347986221,
"epoch": 0.24437299035369775,
"grad_norm": 0.18994390964508057,
"learning_rate": 4.9909937213563165e-05,
"loss": 1.3825007677078247,
"mean_token_accuracy": 0.6199355497956276,
"num_tokens": 2454343.0,
"step": 19
},
{
"entropy": 1.3843167871236801,
"epoch": 0.2572347266881029,
"grad_norm": 0.18420229852199554,
"learning_rate": 4.987744113625665e-05,
"loss": 1.3471739292144775,
"mean_token_accuracy": 0.6283371672034264,
"num_tokens": 2584405.0,
"step": 20
},
{
"entropy": 1.3585271686315536,
"epoch": 0.27009646302250806,
"grad_norm": 0.18983817100524902,
"learning_rate": 4.9839963190492576e-05,
"loss": 1.3283567428588867,
"mean_token_accuracy": 0.6319968476891518,
"num_tokens": 2709555.0,
"step": 21
},
{
"entropy": 1.3483584225177765,
"epoch": 0.2829581993569132,
"grad_norm": 0.18332050740718842,
"learning_rate": 4.979751088147192e-05,
"loss": 1.33201003074646,
"mean_token_accuracy": 0.6298539489507675,
"num_tokens": 2839191.0,
"step": 22
},
{
"entropy": 1.334426462650299,
"epoch": 0.2958199356913183,
"grad_norm": 0.16615396738052368,
"learning_rate": 4.975009271054409e-05,
"loss": 1.3058710098266602,
"mean_token_accuracy": 0.6357970610260963,
"num_tokens": 2968625.0,
"step": 23
},
{
"entropy": 1.3269707262516022,
"epoch": 0.3086816720257235,
"grad_norm": 0.16659598052501678,
"learning_rate": 4.969771817350445e-05,
"loss": 1.298633337020874,
"mean_token_accuracy": 0.6390289217233658,
"num_tokens": 3098193.0,
"step": 24
},
{
"entropy": 1.3264441937208176,
"epoch": 0.3215434083601286,
"grad_norm": 0.18099723756313324,
"learning_rate": 4.9640397758692715e-05,
"loss": 1.2919727563858032,
"mean_token_accuracy": 0.6379936411976814,
"num_tokens": 3226304.0,
"step": 25
},
{
"entropy": 1.2971351444721222,
"epoch": 0.33440514469453375,
"grad_norm": 0.16978149116039276,
"learning_rate": 4.957814294489261e-05,
"loss": 1.283421277999878,
"mean_token_accuracy": 0.6396878883242607,
"num_tokens": 3356150.0,
"step": 26
},
{
"entropy": 1.2420216798782349,
"epoch": 0.34726688102893893,
"grad_norm": 0.15654370188713074,
"learning_rate": 4.9510966199033174e-05,
"loss": 1.2411205768585205,
"mean_token_accuracy": 0.6497687473893166,
"num_tokens": 3485881.0,
"step": 27
},
{
"entropy": 1.2905446141958237,
"epoch": 0.36012861736334406,
"grad_norm": 0.15767726302146912,
"learning_rate": 4.943888097369216e-05,
"loss": 1.2969235181808472,
"mean_token_accuracy": 0.6399867981672287,
"num_tokens": 3614360.0,
"step": 28
},
{
"entropy": 1.2797959297895432,
"epoch": 0.3729903536977492,
"grad_norm": 0.1609920859336853,
"learning_rate": 4.936190170440208e-05,
"loss": 1.281036615371704,
"mean_token_accuracy": 0.6414945125579834,
"num_tokens": 3742757.0,
"step": 29
},
{
"entropy": 1.2370718121528625,
"epoch": 0.3858520900321543,
"grad_norm": 0.15289531648159027,
"learning_rate": 4.928004380675941e-05,
"loss": 1.2397706508636475,
"mean_token_accuracy": 0.6485739275813103,
"num_tokens": 3872361.0,
"step": 30
},
{
"entropy": 1.2661651074886322,
"epoch": 0.3987138263665595,
"grad_norm": 0.15539875626564026,
"learning_rate": 4.9193323673337476e-05,
"loss": 1.2545585632324219,
"mean_token_accuracy": 0.646148107945919,
"num_tokens": 4001029.0,
"step": 31
},
{
"entropy": 1.259293794631958,
"epoch": 0.4115755627009646,
"grad_norm": 0.15602311491966248,
"learning_rate": 4.910175867040377e-05,
"loss": 1.2386581897735596,
"mean_token_accuracy": 0.6532392650842667,
"num_tokens": 4129746.0,
"step": 32
},
{
"entropy": 1.2246208488941193,
"epoch": 0.42443729903536975,
"grad_norm": 0.15040729939937592,
"learning_rate": 4.9005367134442235e-05,
"loss": 1.2012075185775757,
"mean_token_accuracy": 0.6605038940906525,
"num_tokens": 4258908.0,
"step": 33
},
{
"entropy": 1.2688497006893158,
"epoch": 0.43729903536977494,
"grad_norm": 0.14351816475391388,
"learning_rate": 4.890416836848127e-05,
"loss": 1.2468310594558716,
"mean_token_accuracy": 0.6454005613923073,
"num_tokens": 4388837.0,
"step": 34
},
{
"entropy": 1.2282109707593918,
"epoch": 0.45016077170418006,
"grad_norm": 0.14232277870178223,
"learning_rate": 4.8798182638228166e-05,
"loss": 1.2170629501342773,
"mean_token_accuracy": 0.6531817615032196,
"num_tokens": 4518130.0,
"step": 35
},
{
"entropy": 1.2145698070526123,
"epoch": 0.4630225080385852,
"grad_norm": 0.14945274591445923,
"learning_rate": 4.868743116801074e-05,
"loss": 1.2234522104263306,
"mean_token_accuracy": 0.6538028195500374,
"num_tokens": 4647727.0,
"step": 36
},
{
"entropy": 1.2184867858886719,
"epoch": 0.4758842443729904,
"grad_norm": 0.14716529846191406,
"learning_rate": 4.857193613652711e-05,
"loss": 1.2205889225006104,
"mean_token_accuracy": 0.6552813798189163,
"num_tokens": 4776814.0,
"step": 37
},
{
"entropy": 1.2501244097948074,
"epoch": 0.4887459807073955,
"grad_norm": 0.13584738969802856,
"learning_rate": 4.845172067240415e-05,
"loss": 1.232811689376831,
"mean_token_accuracy": 0.6496494188904762,
"num_tokens": 4906642.0,
"step": 38
},
{
"entropy": 1.2297646403312683,
"epoch": 0.5016077170418006,
"grad_norm": 0.1445397287607193,
"learning_rate": 4.8326808849565936e-05,
"loss": 1.2179179191589355,
"mean_token_accuracy": 0.6524648442864418,
"num_tokens": 5035784.0,
"step": 39
},
{
"entropy": 1.2054394781589508,
"epoch": 0.5144694533762058,
"grad_norm": 0.1438300460577011,
"learning_rate": 4.819722568241274e-05,
"loss": 1.1902542114257812,
"mean_token_accuracy": 0.6586381196975708,
"num_tokens": 5163483.0,
"step": 40
},
{
"entropy": 1.1801835894584656,
"epoch": 0.5273311897106109,
"grad_norm": 0.13536524772644043,
"learning_rate": 4.806299712081172e-05,
"loss": 1.1734623908996582,
"mean_token_accuracy": 0.6613527312874794,
"num_tokens": 5289099.0,
"step": 41
},
{
"entropy": 1.2093226611614227,
"epoch": 0.5401929260450161,
"grad_norm": 0.13810646533966064,
"learning_rate": 4.792415004490034e-05,
"loss": 1.2002174854278564,
"mean_token_accuracy": 0.6581337600946426,
"num_tokens": 5414735.0,
"step": 42
},
{
"entropy": 1.1848722696304321,
"epoch": 0.5530546623794212,
"grad_norm": 0.1468912959098816,
"learning_rate": 4.77807122597034e-05,
"loss": 1.1885192394256592,
"mean_token_accuracy": 0.6589618176221848,
"num_tokens": 5543143.0,
"step": 43
},
{
"entropy": 1.181750476360321,
"epoch": 0.5659163987138264,
"grad_norm": 0.1429019272327423,
"learning_rate": 4.7632712489564926e-05,
"loss": 1.1800310611724854,
"mean_token_accuracy": 0.6618404239416122,
"num_tokens": 5671758.0,
"step": 44
},
{
"entropy": 1.223798543214798,
"epoch": 0.5787781350482315,
"grad_norm": 0.13423405587673187,
"learning_rate": 4.748018037239592e-05,
"loss": 1.2137880325317383,
"mean_token_accuracy": 0.6538020968437195,
"num_tokens": 5801203.0,
"step": 45
},
{
"entropy": 1.1596673130989075,
"epoch": 0.5916398713826366,
"grad_norm": 0.14085975289344788,
"learning_rate": 4.732314645373921e-05,
"loss": 1.1383979320526123,
"mean_token_accuracy": 0.6676715686917305,
"num_tokens": 5929286.0,
"step": 46
},
{
"entropy": 1.1791094541549683,
"epoch": 0.6045016077170418,
"grad_norm": 0.14022590219974518,
"learning_rate": 4.7161642180652464e-05,
"loss": 1.1624398231506348,
"mean_token_accuracy": 0.6638200730085373,
"num_tokens": 6055494.0,
"step": 47
},
{
"entropy": 1.17191481590271,
"epoch": 0.617363344051447,
"grad_norm": 0.14044098556041718,
"learning_rate": 4.699569989541074e-05,
"loss": 1.1661159992218018,
"mean_token_accuracy": 0.6632223278284073,
"num_tokens": 6184519.0,
"step": 48
},
{
"entropy": 1.1261081546545029,
"epoch": 0.6302250803858521,
"grad_norm": 0.13071966171264648,
"learning_rate": 4.6825352829029705e-05,
"loss": 1.1280871629714966,
"mean_token_accuracy": 0.672090008854866,
"num_tokens": 6313996.0,
"step": 49
},
{
"entropy": 1.108861967921257,
"epoch": 0.6430868167202572,
"grad_norm": 0.13524308800697327,
"learning_rate": 4.665063509461097e-05,
"loss": 1.1100517511367798,
"mean_token_accuracy": 0.6758645325899124,
"num_tokens": 6442914.0,
"step": 50
},
{
"entropy": 1.1622951924800873,
"epoch": 0.6559485530546624,
"grad_norm": 0.14350417256355286,
"learning_rate": 4.647158168051066e-05,
"loss": 1.1698243618011475,
"mean_token_accuracy": 0.661836288869381,
"num_tokens": 6569312.0,
"step": 51
},
{
"entropy": 1.1530523151159286,
"epoch": 0.6688102893890675,
"grad_norm": 0.13998498022556305,
"learning_rate": 4.628822844333278e-05,
"loss": 1.135171890258789,
"mean_token_accuracy": 0.6697984710335732,
"num_tokens": 6698149.0,
"step": 52
},
{
"entropy": 1.1557507067918777,
"epoch": 0.6816720257234726,
"grad_norm": 0.13826699554920197,
"learning_rate": 4.6100612100748765e-05,
"loss": 1.1333105564117432,
"mean_token_accuracy": 0.6696186140179634,
"num_tokens": 6827547.0,
"step": 53
},
{
"entropy": 1.1415271162986755,
"epoch": 0.6945337620578779,
"grad_norm": 0.14170631766319275,
"learning_rate": 4.59087702241444e-05,
"loss": 1.1154472827911377,
"mean_token_accuracy": 0.6728732585906982,
"num_tokens": 6956641.0,
"step": 54
},
{
"entropy": 1.133439689874649,
"epoch": 0.707395498392283,
"grad_norm": 0.19915136694908142,
"learning_rate": 4.571274123109606e-05,
"loss": 1.12148916721344,
"mean_token_accuracy": 0.6721195057034492,
"num_tokens": 7087072.0,
"step": 55
},
{
"entropy": 1.1475654691457748,
"epoch": 0.7202572347266881,
"grad_norm": 0.1380179524421692,
"learning_rate": 4.551256437767719e-05,
"loss": 1.147176742553711,
"mean_token_accuracy": 0.6669263690710068,
"num_tokens": 7217233.0,
"step": 56
},
{
"entropy": 1.1235886365175247,
"epoch": 0.7331189710610932,
"grad_norm": 0.14977428317070007,
"learning_rate": 4.530827975059715e-05,
"loss": 1.1248936653137207,
"mean_token_accuracy": 0.6717223599553108,
"num_tokens": 7345601.0,
"step": 57
},
{
"entropy": 1.0966329723596573,
"epoch": 0.7459807073954984,
"grad_norm": 0.13217344880104065,
"learning_rate": 4.5099928259173516e-05,
"loss": 1.0947030782699585,
"mean_token_accuracy": 0.6786246225237846,
"num_tokens": 7473430.0,
"step": 58
},
{
"entropy": 1.1365204900503159,
"epoch": 0.7588424437299035,
"grad_norm": 0.12866446375846863,
"learning_rate": 4.488755162713975e-05,
"loss": 1.126430869102478,
"mean_token_accuracy": 0.6728999614715576,
"num_tokens": 7602826.0,
"step": 59
},
{
"entropy": 1.1535387188196182,
"epoch": 0.7717041800643086,
"grad_norm": 0.1415134221315384,
"learning_rate": 4.467119238428975e-05,
"loss": 1.1418571472167969,
"mean_token_accuracy": 0.6701028272509575,
"num_tokens": 7732028.0,
"step": 60
},
{
"entropy": 1.1234214305877686,
"epoch": 0.7845659163987139,
"grad_norm": 0.14994795620441437,
"learning_rate": 4.445089385796099e-05,
"loss": 1.1106842756271362,
"mean_token_accuracy": 0.6764309927821159,
"num_tokens": 7860385.0,
"step": 61
},
{
"entropy": 1.0901593267917633,
"epoch": 0.797427652733119,
"grad_norm": 0.13637474179267883,
"learning_rate": 4.422670016435792e-05,
"loss": 1.0811570882797241,
"mean_token_accuracy": 0.6831180602312088,
"num_tokens": 7989531.0,
"step": 62
},
{
"entropy": 1.1060381978750229,
"epoch": 0.8102893890675241,
"grad_norm": 0.1306847780942917,
"learning_rate": 4.3998656199717435e-05,
"loss": 1.1069831848144531,
"mean_token_accuracy": 0.6745292320847511,
"num_tokens": 8118824.0,
"step": 63
},
{
"entropy": 1.1469190865755081,
"epoch": 0.8231511254019293,
"grad_norm": 0.14836829900741577,
"learning_rate": 4.3766807631318106e-05,
"loss": 1.1478967666625977,
"mean_token_accuracy": 0.6674168556928635,
"num_tokens": 8248122.0,
"step": 64
},
{
"entropy": 1.1051507145166397,
"epoch": 0.8360128617363344,
"grad_norm": 0.1413162350654602,
"learning_rate": 4.353120088833501e-05,
"loss": 1.0933685302734375,
"mean_token_accuracy": 0.6783376038074493,
"num_tokens": 8376429.0,
"step": 65
},
{
"entropy": 1.1381653249263763,
"epoch": 0.8488745980707395,
"grad_norm": 0.13279159367084503,
"learning_rate": 4.329188315254196e-05,
"loss": 1.1261053085327148,
"mean_token_accuracy": 0.6716507449746132,
"num_tokens": 8504687.0,
"step": 66
},
{
"entropy": 1.1401405185461044,
"epoch": 0.8617363344051447,
"grad_norm": 0.14999179542064667,
"learning_rate": 4.3048902348863116e-05,
"loss": 1.122992992401123,
"mean_token_accuracy": 0.6721775308251381,
"num_tokens": 8635119.0,
"step": 67
},
{
"entropy": 1.1104646772146225,
"epoch": 0.8745980707395499,
"grad_norm": 0.15244296193122864,
"learning_rate": 4.280230713577564e-05,
"loss": 1.0963469743728638,
"mean_token_accuracy": 0.6784974113106728,
"num_tokens": 8765133.0,
"step": 68
},
{
"entropy": 1.1325141787528992,
"epoch": 0.887459807073955,
"grad_norm": 0.13338243961334229,
"learning_rate": 4.255214689556557e-05,
"loss": 1.133899211883545,
"mean_token_accuracy": 0.6714881733059883,
"num_tokens": 8895437.0,
"step": 69
},
{
"entropy": 1.1021241694688797,
"epoch": 0.9003215434083601,
"grad_norm": 0.14672274887561798,
"learning_rate": 4.229847172443866e-05,
"loss": 1.1050517559051514,
"mean_token_accuracy": 0.6782850474119186,
"num_tokens": 9023472.0,
"step": 70
},
{
"entropy": 1.0665733218193054,
"epoch": 0.9131832797427653,
"grad_norm": 0.1326168030500412,
"learning_rate": 4.204133242248832e-05,
"loss": 1.0614970922470093,
"mean_token_accuracy": 0.6890874728560448,
"num_tokens": 9152924.0,
"step": 71
},
{
"entropy": 1.0804976969957352,
"epoch": 0.9260450160771704,
"grad_norm": 0.14258776605129242,
"learning_rate": 4.1780780483522575e-05,
"loss": 1.071770191192627,
"mean_token_accuracy": 0.6831802353262901,
"num_tokens": 9282930.0,
"step": 72
},
{
"entropy": 1.0698173642158508,
"epoch": 0.9389067524115756,
"grad_norm": 0.13697165250778198,
"learning_rate": 4.151686808475204e-05,
"loss": 1.057246208190918,
"mean_token_accuracy": 0.6859329044818878,
"num_tokens": 9410776.0,
"step": 73
},
{
"entropy": 1.0982066690921783,
"epoch": 0.9517684887459807,
"grad_norm": 0.14332003891468048,
"learning_rate": 4.1249648076341165e-05,
"loss": 1.08486008644104,
"mean_token_accuracy": 0.6810793280601501,
"num_tokens": 9539314.0,
"step": 74
},
{
"entropy": 1.1045535802841187,
"epoch": 0.9646302250803859,
"grad_norm": 0.14386016130447388,
"learning_rate": 4.0979173970824626e-05,
"loss": 1.1035948991775513,
"mean_token_accuracy": 0.6733438894152641,
"num_tokens": 9668102.0,
"step": 75
},
{
"entropy": 1.0924865305423737,
"epoch": 0.977491961414791,
"grad_norm": 0.13745297491550446,
"learning_rate": 4.070549993239106e-05,
"loss": 1.090521216392517,
"mean_token_accuracy": 0.6789770871400833,
"num_tokens": 9797707.0,
"step": 76
},
{
"entropy": 1.0984582901000977,
"epoch": 0.9903536977491961,
"grad_norm": 0.14490951597690582,
"learning_rate": 4.0428680766036384e-05,
"loss": 1.1076843738555908,
"mean_token_accuracy": 0.6759174689650536,
"num_tokens": 9927684.0,
"step": 77
},
{
"entropy": 1.0977885921796162,
"epoch": 1.0,
"grad_norm": 0.15585829317569733,
"learning_rate": 4.0148771906588706e-05,
"loss": 1.0940134525299072,
"mean_token_accuracy": 0.6789492865403494,
"num_tokens": 9998574.0,
"step": 78
},
{
"entropy": 1.1048902124166489,
"epoch": 1.0128617363344052,
"grad_norm": 0.13507987558841705,
"learning_rate": 3.986582940760717e-05,
"loss": 1.0746995210647583,
"mean_token_accuracy": 0.6833242624998093,
"num_tokens": 10127337.0,
"step": 79
},
{
"entropy": 1.1200366914272308,
"epoch": 1.0257234726688103,
"grad_norm": 0.14873428642749786,
"learning_rate": 3.957990993015683e-05,
"loss": 1.0768001079559326,
"mean_token_accuracy": 0.6837869137525558,
"num_tokens": 10253323.0,
"step": 80
},
{
"entropy": 1.1033698171377182,
"epoch": 1.0385852090032155,
"grad_norm": 0.1395098865032196,
"learning_rate": 3.929107073146197e-05,
"loss": 1.0733070373535156,
"mean_token_accuracy": 0.6825986951589584,
"num_tokens": 10383034.0,
"step": 81
},
{
"entropy": 1.0916118025779724,
"epoch": 1.0514469453376205,
"grad_norm": 0.156707301735878,
"learning_rate": 3.899936965343989e-05,
"loss": 1.0789391994476318,
"mean_token_accuracy": 0.6803915277123451,
"num_tokens": 10512684.0,
"step": 82
},
{
"entropy": 1.0437547490000725,
"epoch": 1.0643086816720257,
"grad_norm": 0.14007939398288727,
"learning_rate": 3.8704865111117746e-05,
"loss": 1.046311378479004,
"mean_token_accuracy": 0.6876395344734192,
"num_tokens": 10642582.0,
"step": 83
},
{
"entropy": 1.0586023032665253,
"epoch": 1.077170418006431,
"grad_norm": 0.14878074824810028,
"learning_rate": 3.840761608093456e-05,
"loss": 1.0626013278961182,
"mean_token_accuracy": 0.6854664832353592,
"num_tokens": 10772130.0,
"step": 84
},
{
"entropy": 1.042947493493557,
"epoch": 1.090032154340836,
"grad_norm": 0.14047543704509735,
"learning_rate": 3.8107682088930794e-05,
"loss": 1.0462985038757324,
"mean_token_accuracy": 0.6900991648435593,
"num_tokens": 10902329.0,
"step": 85
},
{
"entropy": 1.0503267794847488,
"epoch": 1.1028938906752412,
"grad_norm": 0.13753578066825867,
"learning_rate": 3.7805123198827857e-05,
"loss": 1.0447890758514404,
"mean_token_accuracy": 0.6877391710877419,
"num_tokens": 11032146.0,
"step": 86
},
{
"entropy": 1.0541549250483513,
"epoch": 1.1157556270096463,
"grad_norm": 0.14761823415756226,
"learning_rate": 3.7500000000000003e-05,
"loss": 1.0494050979614258,
"mean_token_accuracy": 0.6881443187594414,
"num_tokens": 11162722.0,
"step": 87
},
{
"entropy": 1.0610276013612747,
"epoch": 1.1286173633440515,
"grad_norm": 0.13982513546943665,
"learning_rate": 3.719237359534087e-05,
"loss": 1.0486375093460083,
"mean_token_accuracy": 0.6868740543723106,
"num_tokens": 11291557.0,
"step": 88
},
{
"entropy": 1.0592399910092354,
"epoch": 1.1414790996784565,
"grad_norm": 0.14512217044830322,
"learning_rate": 3.688230558902725e-05,
"loss": 1.0511451959609985,
"mean_token_accuracy": 0.6883272528648376,
"num_tokens": 11420683.0,
"step": 89
},
{
"entropy": 1.1003997921943665,
"epoch": 1.1543408360128617,
"grad_norm": 0.13833674788475037,
"learning_rate": 3.656985807418248e-05,
"loss": 1.0804483890533447,
"mean_token_accuracy": 0.6791831701993942,
"num_tokens": 11549517.0,
"step": 90
},
{
"entropy": 1.058895729482174,
"epoch": 1.167202572347267,
"grad_norm": 0.14019837975502014,
"learning_rate": 3.6255093620441834e-05,
"loss": 1.0490373373031616,
"mean_token_accuracy": 0.6885469257831573,
"num_tokens": 11678919.0,
"step": 91
},
{
"entropy": 1.0490736663341522,
"epoch": 1.180064308681672,
"grad_norm": 0.15101630985736847,
"learning_rate": 3.593807526142261e-05,
"loss": 1.0475131273269653,
"mean_token_accuracy": 0.6890112012624741,
"num_tokens": 11808171.0,
"step": 92
},
{
"entropy": 1.067186251282692,
"epoch": 1.1929260450160772,
"grad_norm": 0.14192728698253632,
"learning_rate": 3.56188664821012e-05,
"loss": 1.068861961364746,
"mean_token_accuracy": 0.6839301511645317,
"num_tokens": 11937495.0,
"step": 93
},
{
"entropy": 1.0729520842432976,
"epoch": 1.2057877813504823,
"grad_norm": 0.13931463658809662,
"learning_rate": 3.529753120609982e-05,
"loss": 1.0626987218856812,
"mean_token_accuracy": 0.6865019202232361,
"num_tokens": 12065721.0,
"step": 94
},
{
"entropy": 1.0651484578847885,
"epoch": 1.2186495176848875,
"grad_norm": 0.14170296490192413,
"learning_rate": 3.497413378288541e-05,
"loss": 1.065182089805603,
"mean_token_accuracy": 0.6859815120697021,
"num_tokens": 12195222.0,
"step": 95
},
{
"entropy": 1.0627811029553413,
"epoch": 1.2315112540192925,
"grad_norm": 0.15864631533622742,
"learning_rate": 3.464873897488322e-05,
"loss": 1.064727783203125,
"mean_token_accuracy": 0.6850855350494385,
"num_tokens": 12325399.0,
"step": 96
},
{
"entropy": 1.0540687665343285,
"epoch": 1.2443729903536977,
"grad_norm": 0.1563236117362976,
"learning_rate": 3.432141194450772e-05,
"loss": 1.0473036766052246,
"mean_token_accuracy": 0.6896297782659531,
"num_tokens": 12455203.0,
"step": 97
},
{
"entropy": 1.0381047055125237,
"epoch": 1.257234726688103,
"grad_norm": 0.1378972828388214,
"learning_rate": 3.39922182411134e-05,
"loss": 1.0351678133010864,
"mean_token_accuracy": 0.6909719184041023,
"num_tokens": 12582864.0,
"step": 98
},
{
"entropy": 1.0567686855793,
"epoch": 1.270096463022508,
"grad_norm": 0.1447557955980301,
"learning_rate": 3.3661223787868094e-05,
"loss": 1.045164704322815,
"mean_token_accuracy": 0.6886090338230133,
"num_tokens": 12711992.0,
"step": 99
},
{
"entropy": 1.0664659440517426,
"epoch": 1.2829581993569132,
"grad_norm": 0.14579758048057556,
"learning_rate": 3.332849486855144e-05,
"loss": 1.0578923225402832,
"mean_token_accuracy": 0.6857578605413437,
"num_tokens": 12841160.0,
"step": 100
},
{
"entropy": 1.0501502603292465,
"epoch": 1.2958199356913183,
"grad_norm": 0.14204849302768707,
"learning_rate": 3.2994098114281134e-05,
"loss": 1.0381393432617188,
"mean_token_accuracy": 0.6887901425361633,
"num_tokens": 12967285.0,
"step": 101
},
{
"entropy": 1.0534097403287888,
"epoch": 1.3086816720257235,
"grad_norm": 0.1419542282819748,
"learning_rate": 3.265810049016959e-05,
"loss": 1.0446325540542603,
"mean_token_accuracy": 0.6880638003349304,
"num_tokens": 13095177.0,
"step": 102
},
{
"entropy": 1.0461725443601608,
"epoch": 1.3215434083601285,
"grad_norm": 0.14444847404956818,
"learning_rate": 3.232056928191376e-05,
"loss": 1.032381296157837,
"mean_token_accuracy": 0.691328376531601,
"num_tokens": 13224870.0,
"step": 103
},
{
"entropy": 1.0287123173475266,
"epoch": 1.3344051446945338,
"grad_norm": 0.14262095093727112,
"learning_rate": 3.1981572082320756e-05,
"loss": 1.0161638259887695,
"mean_token_accuracy": 0.6958137080073357,
"num_tokens": 13355092.0,
"step": 104
},
{
"entropy": 1.0425420626997948,
"epoch": 1.347266881028939,
"grad_norm": 0.14054642617702484,
"learning_rate": 3.164117677777191e-05,
"loss": 1.037819266319275,
"mean_token_accuracy": 0.690584309399128,
"num_tokens": 13482910.0,
"step": 105
},
{
"entropy": 1.0867420881986618,
"epoch": 1.360128617363344,
"grad_norm": 0.14352700114250183,
"learning_rate": 3.1299451534628135e-05,
"loss": 1.0806154012680054,
"mean_token_accuracy": 0.6801560521125793,
"num_tokens": 13610860.0,
"step": 106
},
{
"entropy": 1.0425082966685295,
"epoch": 1.3729903536977492,
"grad_norm": 0.14772510528564453,
"learning_rate": 3.0956464785579124e-05,
"loss": 1.0282400846481323,
"mean_token_accuracy": 0.6922867074608803,
"num_tokens": 13739967.0,
"step": 107
},
{
"entropy": 1.033432051539421,
"epoch": 1.3858520900321543,
"grad_norm": 0.1441124826669693,
"learning_rate": 3.061228521593931e-05,
"loss": 1.0348222255706787,
"mean_token_accuracy": 0.6906738951802254,
"num_tokens": 13869092.0,
"step": 108
},
{
"entropy": 1.0250284597277641,
"epoch": 1.3987138263665595,
"grad_norm": 0.14241281151771545,
"learning_rate": 3.0266981749893157e-05,
"loss": 1.019615650177002,
"mean_token_accuracy": 0.6946801096200943,
"num_tokens": 13999751.0,
"step": 109
},
{
"entropy": 1.0539506748318672,
"epoch": 1.4115755627009645,
"grad_norm": 0.14640918374061584,
"learning_rate": 2.9920623536692638e-05,
"loss": 1.0554652214050293,
"mean_token_accuracy": 0.6877814680337906,
"num_tokens": 14126193.0,
"step": 110
},
{
"entropy": 1.0477852746844292,
"epoch": 1.4244372990353698,
"grad_norm": 0.13899168372154236,
"learning_rate": 2.9573279936809667e-05,
"loss": 1.0390174388885498,
"mean_token_accuracy": 0.6889165490865707,
"num_tokens": 14255192.0,
"step": 111
},
{
"entropy": 1.028913527727127,
"epoch": 1.437299035369775,
"grad_norm": 0.14846587181091309,
"learning_rate": 2.9225020508046232e-05,
"loss": 1.02781343460083,
"mean_token_accuracy": 0.6925171986222267,
"num_tokens": 14383678.0,
"step": 112
},
{
"entropy": 1.040368527173996,
"epoch": 1.45016077170418,
"grad_norm": 0.14321881532669067,
"learning_rate": 2.8875914991604948e-05,
"loss": 1.040635108947754,
"mean_token_accuracy": 0.6885931342840195,
"num_tokens": 14513886.0,
"step": 113
},
{
"entropy": 1.0307907313108444,
"epoch": 1.4630225080385852,
"grad_norm": 0.13824157416820526,
"learning_rate": 2.8526033298122985e-05,
"loss": 1.0185027122497559,
"mean_token_accuracy": 0.6952621415257454,
"num_tokens": 14644185.0,
"step": 114
},
{
"entropy": 1.0155034512281418,
"epoch": 1.4758842443729905,
"grad_norm": 0.14209888875484467,
"learning_rate": 2.8175445493671972e-05,
"loss": 0.996734619140625,
"mean_token_accuracy": 0.6990666836500168,
"num_tokens": 14769497.0,
"step": 115
},
{
"entropy": 1.021187648177147,
"epoch": 1.4887459807073955,
"grad_norm": 0.14187516272068024,
"learning_rate": 2.782422178572682e-05,
"loss": 1.0097088813781738,
"mean_token_accuracy": 0.6962587013840675,
"num_tokens": 14898899.0,
"step": 116
},
{
"entropy": 1.0390162095427513,
"epoch": 1.5016077170418005,
"grad_norm": 0.1539003998041153,
"learning_rate": 2.7472432509106248e-05,
"loss": 1.0348460674285889,
"mean_token_accuracy": 0.6902582123875618,
"num_tokens": 15029008.0,
"step": 117
},
{
"entropy": 1.084839791059494,
"epoch": 1.5144694533762058,
"grad_norm": 0.15639474987983704,
"learning_rate": 2.7120148111887732e-05,
"loss": 1.0750864744186401,
"mean_token_accuracy": 0.6826967149972916,
"num_tokens": 15157238.0,
"step": 118
},
{
"entropy": 1.0497614741325378,
"epoch": 1.527331189710611,
"grad_norm": 0.14684948325157166,
"learning_rate": 2.6767439141299865e-05,
"loss": 1.0455033779144287,
"mean_token_accuracy": 0.6880874261260033,
"num_tokens": 15285438.0,
"step": 119
},
{
"entropy": 1.03941510617733,
"epoch": 1.540192926045016,
"grad_norm": 0.143926739692688,
"learning_rate": 2.6414376229594813e-05,
"loss": 1.0348516702651978,
"mean_token_accuracy": 0.6904465183615685,
"num_tokens": 15413195.0,
"step": 120
},
{
"entropy": 1.0160878226161003,
"epoch": 1.5530546623794212,
"grad_norm": 0.14575257897377014,
"learning_rate": 2.606103007990371e-05,
"loss": 1.006327509880066,
"mean_token_accuracy": 0.6950085982680321,
"num_tokens": 15542436.0,
"step": 121
},
{
"entropy": 1.054566353559494,
"epoch": 1.5659163987138265,
"grad_norm": 0.14473803341388702,
"learning_rate": 2.570747145207796e-05,
"loss": 1.0497708320617676,
"mean_token_accuracy": 0.6880283355712891,
"num_tokens": 15669820.0,
"step": 122
},
{
"entropy": 1.0369255393743515,
"epoch": 1.5787781350482315,
"grad_norm": 0.14907261729240417,
"learning_rate": 2.5353771148519057e-05,
"loss": 1.0358316898345947,
"mean_token_accuracy": 0.6919823661446571,
"num_tokens": 15797917.0,
"step": 123
},
{
"entropy": 1.029112845659256,
"epoch": 1.5916398713826365,
"grad_norm": 0.14412133395671844,
"learning_rate": 2.5e-05,
"loss": 1.0267410278320312,
"mean_token_accuracy": 0.6918147578835487,
"num_tokens": 15926059.0,
"step": 124
},
{
"entropy": 1.0285268500447273,
"epoch": 1.6045016077170418,
"grad_norm": 0.1455468088388443,
"learning_rate": 2.4646228851480956e-05,
"loss": 1.0172383785247803,
"mean_token_accuracy": 0.6961864978075027,
"num_tokens": 16055416.0,
"step": 125
},
{
"entropy": 1.0407991334795952,
"epoch": 1.617363344051447,
"grad_norm": 0.14318124949932098,
"learning_rate": 2.429252854792205e-05,
"loss": 1.0395405292510986,
"mean_token_accuracy": 0.6874824613332748,
"num_tokens": 16185719.0,
"step": 126
},
{
"entropy": 1.0249589011073112,
"epoch": 1.630225080385852,
"grad_norm": 0.1448572725057602,
"learning_rate": 2.39389699200963e-05,
"loss": 1.015451431274414,
"mean_token_accuracy": 0.6942317560315132,
"num_tokens": 16314607.0,
"step": 127
},
{
"entropy": 1.039283350110054,
"epoch": 1.6430868167202572,
"grad_norm": 0.1484907567501068,
"learning_rate": 2.358562377040519e-05,
"loss": 1.028055191040039,
"mean_token_accuracy": 0.6915712878108025,
"num_tokens": 16441937.0,
"step": 128
},
{
"entropy": 1.0223650634288788,
"epoch": 1.6559485530546625,
"grad_norm": 0.14289766550064087,
"learning_rate": 2.3232560858700137e-05,
"loss": 1.008897304534912,
"mean_token_accuracy": 0.6952646598219872,
"num_tokens": 16571389.0,
"step": 129
},
{
"entropy": 0.9995019808411598,
"epoch": 1.6688102893890675,
"grad_norm": 0.14972709119319916,
"learning_rate": 2.287985188811228e-05,
"loss": 0.987511157989502,
"mean_token_accuracy": 0.7003577873110771,
"num_tokens": 16701314.0,
"step": 130
},
{
"entropy": 1.0168959125876427,
"epoch": 1.6816720257234725,
"grad_norm": 0.1496725082397461,
"learning_rate": 2.2527567490893758e-05,
"loss": 1.0123668909072876,
"mean_token_accuracy": 0.6951291859149933,
"num_tokens": 16830317.0,
"step": 131
},
{
"entropy": 1.0190805196762085,
"epoch": 1.694533762057878,
"grad_norm": 0.15911011397838593,
"learning_rate": 2.2175778214273185e-05,
"loss": 1.0175803899765015,
"mean_token_accuracy": 0.6933339908719063,
"num_tokens": 16959965.0,
"step": 132
},
{
"entropy": 1.0380867347121239,
"epoch": 1.707395498392283,
"grad_norm": 0.14191225171089172,
"learning_rate": 2.182455450632803e-05,
"loss": 1.0294275283813477,
"mean_token_accuracy": 0.6917987540364265,
"num_tokens": 17089870.0,
"step": 133
},
{
"entropy": 1.0180665403604507,
"epoch": 1.720257234726688,
"grad_norm": 0.1482504904270172,
"learning_rate": 2.1473966701877025e-05,
"loss": 1.0076394081115723,
"mean_token_accuracy": 0.6966089159250259,
"num_tokens": 17218254.0,
"step": 134
},
{
"entropy": 1.0091007053852081,
"epoch": 1.7331189710610932,
"grad_norm": 0.15382039546966553,
"learning_rate": 2.1124085008395054e-05,
"loss": 1.003111481666565,
"mean_token_accuracy": 0.70043034106493,
"num_tokens": 17347960.0,
"step": 135
},
{
"entropy": 1.0102703422307968,
"epoch": 1.7459807073954985,
"grad_norm": 0.18475782871246338,
"learning_rate": 2.0774979491953777e-05,
"loss": 1.0030856132507324,
"mean_token_accuracy": 0.6967976689338684,
"num_tokens": 17476832.0,
"step": 136
},
{
"entropy": 1.0280822068452835,
"epoch": 1.7588424437299035,
"grad_norm": 0.15235531330108643,
"learning_rate": 2.0426720063190335e-05,
"loss": 1.0269193649291992,
"mean_token_accuracy": 0.6915133595466614,
"num_tokens": 17606491.0,
"step": 137
},
{
"entropy": 1.038973644375801,
"epoch": 1.7717041800643085,
"grad_norm": 0.1467663049697876,
"learning_rate": 2.0079376463307368e-05,
"loss": 1.0385396480560303,
"mean_token_accuracy": 0.6904850155115128,
"num_tokens": 17735828.0,
"step": 138
},
{
"entropy": 1.007546715438366,
"epoch": 1.784565916398714,
"grad_norm": 0.15167458355426788,
"learning_rate": 1.973301825010685e-05,
"loss": 1.0009288787841797,
"mean_token_accuracy": 0.6996477469801903,
"num_tokens": 17865343.0,
"step": 139
},
{
"entropy": 1.0457243248820305,
"epoch": 1.797427652733119,
"grad_norm": 0.14147217571735382,
"learning_rate": 1.9387714784060685e-05,
"loss": 1.0354124307632446,
"mean_token_accuracy": 0.6904323399066925,
"num_tokens": 17993892.0,
"step": 140
},
{
"entropy": 1.0493519008159637,
"epoch": 1.810289389067524,
"grad_norm": 0.14349812269210815,
"learning_rate": 1.904353521442088e-05,
"loss": 1.043258786201477,
"mean_token_accuracy": 0.6896533966064453,
"num_tokens": 18122215.0,
"step": 141
},
{
"entropy": 1.0361140668392181,
"epoch": 1.8231511254019293,
"grad_norm": 0.14594632387161255,
"learning_rate": 1.8700548465371874e-05,
"loss": 1.0246191024780273,
"mean_token_accuracy": 0.6924104690551758,
"num_tokens": 18250505.0,
"step": 142
},
{
"entropy": 0.996397003531456,
"epoch": 1.8360128617363345,
"grad_norm": 0.13873013854026794,
"learning_rate": 1.8358823222228097e-05,
"loss": 0.9915734529495239,
"mean_token_accuracy": 0.6993561685085297,
"num_tokens": 18381218.0,
"step": 143
},
{
"entropy": 1.0313754975795746,
"epoch": 1.8488745980707395,
"grad_norm": 0.15026451647281647,
"learning_rate": 1.801842791767925e-05,
"loss": 1.016987681388855,
"mean_token_accuracy": 0.6936725974082947,
"num_tokens": 18510172.0,
"step": 144
},
{
"entropy": 1.0371734127402306,
"epoch": 1.8617363344051447,
"grad_norm": 0.14328952133655548,
"learning_rate": 1.7679430718086243e-05,
"loss": 1.029707908630371,
"mean_token_accuracy": 0.6911671832203865,
"num_tokens": 18639469.0,
"step": 145
},
{
"entropy": 1.0529436096549034,
"epoch": 1.87459807073955,
"grad_norm": 0.15134425461292267,
"learning_rate": 1.7341899509830416e-05,
"loss": 1.0452293157577515,
"mean_token_accuracy": 0.6891046240925789,
"num_tokens": 18769333.0,
"step": 146
},
{
"entropy": 1.0049605518579483,
"epoch": 1.887459807073955,
"grad_norm": 0.1447063535451889,
"learning_rate": 1.700590188571887e-05,
"loss": 1.0040454864501953,
"mean_token_accuracy": 0.6978042870759964,
"num_tokens": 18897391.0,
"step": 147
},
{
"entropy": 1.0140637308359146,
"epoch": 1.90032154340836,
"grad_norm": 0.1438555121421814,
"learning_rate": 1.667150513144856e-05,
"loss": 1.007043480873108,
"mean_token_accuracy": 0.698374018073082,
"num_tokens": 19026977.0,
"step": 148
},
{
"entropy": 1.0184678137302399,
"epoch": 1.9131832797427653,
"grad_norm": 0.1421106904745102,
"learning_rate": 1.633877621213192e-05,
"loss": 1.01150381565094,
"mean_token_accuracy": 0.6960654258728027,
"num_tokens": 19154514.0,
"step": 149
},
{
"entropy": 1.0100202932953835,
"epoch": 1.9260450160771705,
"grad_norm": 0.1437564641237259,
"learning_rate": 1.6007781758886607e-05,
"loss": 1.003399133682251,
"mean_token_accuracy": 0.6989860460162163,
"num_tokens": 19282293.0,
"step": 150
},
{
"entropy": 1.0097703114151955,
"epoch": 1.9389067524115755,
"grad_norm": 0.14791278541088104,
"learning_rate": 1.567858805549229e-05,
"loss": 1.0031559467315674,
"mean_token_accuracy": 0.6982970088720322,
"num_tokens": 19412057.0,
"step": 151
},
{
"entropy": 0.9986948445439339,
"epoch": 1.9517684887459807,
"grad_norm": 0.14181585609912872,
"learning_rate": 1.535126102511678e-05,
"loss": 0.9911055564880371,
"mean_token_accuracy": 0.7003660649061203,
"num_tokens": 19538894.0,
"step": 152
},
{
"entropy": 1.0326199233531952,
"epoch": 1.964630225080386,
"grad_norm": 0.14459078013896942,
"learning_rate": 1.5025866217114592e-05,
"loss": 1.029758095741272,
"mean_token_accuracy": 0.690429113805294,
"num_tokens": 19669050.0,
"step": 153
},
{
"entropy": 1.024147979915142,
"epoch": 1.977491961414791,
"grad_norm": 0.14128583669662476,
"learning_rate": 1.4702468793900188e-05,
"loss": 1.0202356576919556,
"mean_token_accuracy": 0.6920891180634499,
"num_tokens": 19796666.0,
"step": 154
},
{
"entropy": 1.0354069098830223,
"epoch": 1.990353697749196,
"grad_norm": 0.14648661017417908,
"learning_rate": 1.4381133517898804e-05,
"loss": 1.0325945615768433,
"mean_token_accuracy": 0.6926636919379234,
"num_tokens": 19927210.0,
"step": 155
},
{
"entropy": 0.9808994829654694,
"epoch": 2.0,
"grad_norm": 0.1645454615354538,
"learning_rate": 1.4061924738577403e-05,
"loss": 0.992160975933075,
"mean_token_accuracy": 0.706730475028356,
"num_tokens": 19999816.0,
"step": 156
}
],
"logging_steps": 1,
"max_steps": 234,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.1148252728794808e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}