binary-r1-lora / checkpoint-600 /trainer_state.json
SoulInPsyAbstract's picture
Upload folder using huggingface_hub
060ef7d verified
Raw
History Blame Contribute Delete
31 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0434227330779056,
"eval_steps": 500,
"global_step": 600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.017028522775649212,
"grad_norm": 2.3286359310150146,
"learning_rate": 0.0001988623435722412,
"loss": 4.1641,
"mean_token_accuracy": 0.3866006717085838,
"num_tokens": 4326.0,
"step": 5
},
{
"epoch": 0.034057045551298425,
"grad_norm": 1.4926602840423584,
"learning_rate": 0.00019772468714448238,
"loss": 2.0591,
"mean_token_accuracy": 0.6790341928601265,
"num_tokens": 8676.0,
"step": 10
},
{
"epoch": 0.05108556832694764,
"grad_norm": 1.0835968255996704,
"learning_rate": 0.00019658703071672356,
"loss": 1.3145,
"mean_token_accuracy": 0.8256841972470284,
"num_tokens": 12796.0,
"step": 15
},
{
"epoch": 0.06811409110259685,
"grad_norm": 0.7724414467811584,
"learning_rate": 0.00019544937428896475,
"loss": 1.3324,
"mean_token_accuracy": 0.8117582932114601,
"num_tokens": 17119.0,
"step": 20
},
{
"epoch": 0.08514261387824607,
"grad_norm": 0.785762369632721,
"learning_rate": 0.00019431171786120593,
"loss": 1.3375,
"mean_token_accuracy": 0.8029867172241211,
"num_tokens": 21499.0,
"step": 25
},
{
"epoch": 0.10217113665389528,
"grad_norm": 0.6702725291252136,
"learning_rate": 0.00019317406143344712,
"loss": 1.2159,
"mean_token_accuracy": 0.8230627462267875,
"num_tokens": 25785.0,
"step": 30
},
{
"epoch": 0.11919965942954448,
"grad_norm": 0.6287369728088379,
"learning_rate": 0.0001920364050056883,
"loss": 1.1634,
"mean_token_accuracy": 0.8315445825457572,
"num_tokens": 29980.0,
"step": 35
},
{
"epoch": 0.1362281822051937,
"grad_norm": 0.6573143005371094,
"learning_rate": 0.00019089874857792946,
"loss": 1.3762,
"mean_token_accuracy": 0.7971536681056023,
"num_tokens": 34497.0,
"step": 40
},
{
"epoch": 0.1532567049808429,
"grad_norm": 0.6560688614845276,
"learning_rate": 0.00018976109215017067,
"loss": 1.1589,
"mean_token_accuracy": 0.8251897826790809,
"num_tokens": 38800.0,
"step": 45
},
{
"epoch": 0.17028522775649213,
"grad_norm": 0.6654791831970215,
"learning_rate": 0.00018862343572241183,
"loss": 1.1498,
"mean_token_accuracy": 0.8319168403744698,
"num_tokens": 43055.0,
"step": 50
},
{
"epoch": 0.18731375053214133,
"grad_norm": 0.7387417554855347,
"learning_rate": 0.00018748577929465302,
"loss": 1.1265,
"mean_token_accuracy": 0.8290244281291962,
"num_tokens": 47346.0,
"step": 55
},
{
"epoch": 0.20434227330779056,
"grad_norm": 0.5795997977256775,
"learning_rate": 0.0001863481228668942,
"loss": 1.0046,
"mean_token_accuracy": 0.8534704640507698,
"num_tokens": 51485.0,
"step": 60
},
{
"epoch": 0.22137079608343976,
"grad_norm": 0.6834130883216858,
"learning_rate": 0.0001852104664391354,
"loss": 1.113,
"mean_token_accuracy": 0.8345914751291275,
"num_tokens": 55716.0,
"step": 65
},
{
"epoch": 0.23839931885908897,
"grad_norm": 0.7211284041404724,
"learning_rate": 0.00018407281001137657,
"loss": 1.2132,
"mean_token_accuracy": 0.8207321017980576,
"num_tokens": 60030.0,
"step": 70
},
{
"epoch": 0.2554278416347382,
"grad_norm": 0.6312271356582642,
"learning_rate": 0.00018293515358361776,
"loss": 1.0987,
"mean_token_accuracy": 0.8333725541830063,
"num_tokens": 64288.0,
"step": 75
},
{
"epoch": 0.2724563644103874,
"grad_norm": 0.7119404077529907,
"learning_rate": 0.00018179749715585894,
"loss": 1.0981,
"mean_token_accuracy": 0.8323698997497558,
"num_tokens": 68548.0,
"step": 80
},
{
"epoch": 0.2894848871860366,
"grad_norm": 0.9000201225280762,
"learning_rate": 0.00018065984072810013,
"loss": 1.146,
"mean_token_accuracy": 0.8253335595130921,
"num_tokens": 72914.0,
"step": 85
},
{
"epoch": 0.3065134099616858,
"grad_norm": 0.6050537824630737,
"learning_rate": 0.0001795221843003413,
"loss": 1.0111,
"mean_token_accuracy": 0.842674246430397,
"num_tokens": 77168.0,
"step": 90
},
{
"epoch": 0.32354193273733506,
"grad_norm": 0.684512197971344,
"learning_rate": 0.0001783845278725825,
"loss": 1.1186,
"mean_token_accuracy": 0.8351956441998482,
"num_tokens": 81439.0,
"step": 95
},
{
"epoch": 0.34057045551298426,
"grad_norm": 0.7323129773139954,
"learning_rate": 0.00017724687144482368,
"loss": 1.1287,
"mean_token_accuracy": 0.8245970487594605,
"num_tokens": 85773.0,
"step": 100
},
{
"epoch": 0.35759897828863346,
"grad_norm": 0.7547741532325745,
"learning_rate": 0.00017610921501706487,
"loss": 1.0868,
"mean_token_accuracy": 0.8298466548323631,
"num_tokens": 90117.0,
"step": 105
},
{
"epoch": 0.37462750106428266,
"grad_norm": 0.7113769054412842,
"learning_rate": 0.00017497155858930602,
"loss": 1.1214,
"mean_token_accuracy": 0.8299670115113258,
"num_tokens": 94412.0,
"step": 110
},
{
"epoch": 0.39165602383993187,
"grad_norm": 0.7486220002174377,
"learning_rate": 0.00017383390216154724,
"loss": 1.1452,
"mean_token_accuracy": 0.8283886179327965,
"num_tokens": 98782.0,
"step": 115
},
{
"epoch": 0.4086845466155811,
"grad_norm": 0.658633828163147,
"learning_rate": 0.0001726962457337884,
"loss": 1.0415,
"mean_token_accuracy": 0.8431179687380791,
"num_tokens": 103011.0,
"step": 120
},
{
"epoch": 0.4257130693912303,
"grad_norm": 0.783794105052948,
"learning_rate": 0.0001715585893060296,
"loss": 1.1056,
"mean_token_accuracy": 0.8254878520965576,
"num_tokens": 107402.0,
"step": 125
},
{
"epoch": 0.4427415921668795,
"grad_norm": 0.7954565286636353,
"learning_rate": 0.00017042093287827076,
"loss": 1.0518,
"mean_token_accuracy": 0.8375606715679169,
"num_tokens": 111707.0,
"step": 130
},
{
"epoch": 0.45977011494252873,
"grad_norm": 0.6913949847221375,
"learning_rate": 0.00016928327645051198,
"loss": 1.1104,
"mean_token_accuracy": 0.8326424166560173,
"num_tokens": 115998.0,
"step": 135
},
{
"epoch": 0.47679863771817793,
"grad_norm": 0.7918037176132202,
"learning_rate": 0.00016814562002275313,
"loss": 1.0495,
"mean_token_accuracy": 0.8390962019562721,
"num_tokens": 120271.0,
"step": 140
},
{
"epoch": 0.49382716049382713,
"grad_norm": 0.7816826701164246,
"learning_rate": 0.00016700796359499432,
"loss": 1.0463,
"mean_token_accuracy": 0.8433194428682327,
"num_tokens": 124461.0,
"step": 145
},
{
"epoch": 0.5108556832694764,
"grad_norm": 0.8069042563438416,
"learning_rate": 0.0001658703071672355,
"loss": 1.0664,
"mean_token_accuracy": 0.8278923153877258,
"num_tokens": 128781.0,
"step": 150
},
{
"epoch": 0.5278842060451255,
"grad_norm": 1.0114731788635254,
"learning_rate": 0.0001647326507394767,
"loss": 1.1217,
"mean_token_accuracy": 0.8267972275614739,
"num_tokens": 133167.0,
"step": 155
},
{
"epoch": 0.5449127288207748,
"grad_norm": 0.7900378704071045,
"learning_rate": 0.00016359499431171787,
"loss": 0.971,
"mean_token_accuracy": 0.8421565622091294,
"num_tokens": 137464.0,
"step": 160
},
{
"epoch": 0.561941251596424,
"grad_norm": 0.8059927821159363,
"learning_rate": 0.00016245733788395906,
"loss": 1.0457,
"mean_token_accuracy": 0.8381335601210594,
"num_tokens": 141760.0,
"step": 165
},
{
"epoch": 0.5789697743720732,
"grad_norm": 0.7589371800422668,
"learning_rate": 0.00016131968145620024,
"loss": 1.0208,
"mean_token_accuracy": 0.8342296928167343,
"num_tokens": 146051.0,
"step": 170
},
{
"epoch": 0.5959982971477225,
"grad_norm": 0.692416250705719,
"learning_rate": 0.00016018202502844143,
"loss": 0.9837,
"mean_token_accuracy": 0.8510025009512902,
"num_tokens": 150270.0,
"step": 175
},
{
"epoch": 0.6130268199233716,
"grad_norm": 0.6662923097610474,
"learning_rate": 0.0001590443686006826,
"loss": 0.9835,
"mean_token_accuracy": 0.8463438332080842,
"num_tokens": 154537.0,
"step": 180
},
{
"epoch": 0.6300553426990209,
"grad_norm": 0.7452691793441772,
"learning_rate": 0.0001579067121729238,
"loss": 1.0496,
"mean_token_accuracy": 0.8375737622380257,
"num_tokens": 158810.0,
"step": 185
},
{
"epoch": 0.6470838654746701,
"grad_norm": 0.809700608253479,
"learning_rate": 0.00015676905574516496,
"loss": 1.0595,
"mean_token_accuracy": 0.8294038504362107,
"num_tokens": 163213.0,
"step": 190
},
{
"epoch": 0.6641123882503193,
"grad_norm": 0.7708745002746582,
"learning_rate": 0.00015563139931740617,
"loss": 1.0976,
"mean_token_accuracy": 0.8289313957095146,
"num_tokens": 167607.0,
"step": 195
},
{
"epoch": 0.6811409110259685,
"grad_norm": 0.6482141613960266,
"learning_rate": 0.00015449374288964733,
"loss": 1.0701,
"mean_token_accuracy": 0.8261386752128601,
"num_tokens": 172024.0,
"step": 200
},
{
"epoch": 0.6981694338016177,
"grad_norm": 0.7164883613586426,
"learning_rate": 0.00015335608646188854,
"loss": 0.9878,
"mean_token_accuracy": 0.8418964132666588,
"num_tokens": 176317.0,
"step": 205
},
{
"epoch": 0.7151979565772669,
"grad_norm": 0.710343599319458,
"learning_rate": 0.0001522184300341297,
"loss": 0.9306,
"mean_token_accuracy": 0.8468034327030182,
"num_tokens": 180558.0,
"step": 210
},
{
"epoch": 0.7322264793529162,
"grad_norm": 0.863784909248352,
"learning_rate": 0.00015108077360637088,
"loss": 1.0544,
"mean_token_accuracy": 0.8359945684671402,
"num_tokens": 184885.0,
"step": 215
},
{
"epoch": 0.7492550021285653,
"grad_norm": 0.8381637930870056,
"learning_rate": 0.00014994311717861207,
"loss": 1.0522,
"mean_token_accuracy": 0.836811026930809,
"num_tokens": 189219.0,
"step": 220
},
{
"epoch": 0.7662835249042146,
"grad_norm": 0.683501124382019,
"learning_rate": 0.00014880546075085325,
"loss": 0.9427,
"mean_token_accuracy": 0.8544979348778725,
"num_tokens": 193437.0,
"step": 225
},
{
"epoch": 0.7833120476798637,
"grad_norm": 0.7609812617301941,
"learning_rate": 0.00014766780432309444,
"loss": 1.0048,
"mean_token_accuracy": 0.8403829500079155,
"num_tokens": 197724.0,
"step": 230
},
{
"epoch": 0.800340570455513,
"grad_norm": 0.8223949074745178,
"learning_rate": 0.00014653014789533562,
"loss": 1.078,
"mean_token_accuracy": 0.8296335831284523,
"num_tokens": 202141.0,
"step": 235
},
{
"epoch": 0.8173690932311622,
"grad_norm": 0.9807024002075195,
"learning_rate": 0.0001453924914675768,
"loss": 0.9295,
"mean_token_accuracy": 0.8495418474078178,
"num_tokens": 206333.0,
"step": 240
},
{
"epoch": 0.8343976160068114,
"grad_norm": 0.7864217162132263,
"learning_rate": 0.000144254835039818,
"loss": 1.0326,
"mean_token_accuracy": 0.8422158002853394,
"num_tokens": 210593.0,
"step": 245
},
{
"epoch": 0.8514261387824607,
"grad_norm": 0.8183476328849792,
"learning_rate": 0.00014311717861205915,
"loss": 1.0419,
"mean_token_accuracy": 0.8332764700055122,
"num_tokens": 214925.0,
"step": 250
},
{
"epoch": 0.8684546615581098,
"grad_norm": 0.7906543612480164,
"learning_rate": 0.00014197952218430036,
"loss": 0.9278,
"mean_token_accuracy": 0.8531344652175903,
"num_tokens": 219106.0,
"step": 255
},
{
"epoch": 0.885483184333759,
"grad_norm": 0.7864625453948975,
"learning_rate": 0.00014084186575654152,
"loss": 0.9764,
"mean_token_accuracy": 0.8394758701324463,
"num_tokens": 223398.0,
"step": 260
},
{
"epoch": 0.9025117071094083,
"grad_norm": 0.7231821417808533,
"learning_rate": 0.00013970420932878273,
"loss": 1.0357,
"mean_token_accuracy": 0.8368565306067467,
"num_tokens": 227720.0,
"step": 265
},
{
"epoch": 0.9195402298850575,
"grad_norm": 0.7288718223571777,
"learning_rate": 0.0001385665529010239,
"loss": 1.0178,
"mean_token_accuracy": 0.842984040081501,
"num_tokens": 232021.0,
"step": 270
},
{
"epoch": 0.9365687526607067,
"grad_norm": 0.7466130256652832,
"learning_rate": 0.0001374288964732651,
"loss": 0.9974,
"mean_token_accuracy": 0.8431279867887497,
"num_tokens": 236312.0,
"step": 275
},
{
"epoch": 0.9535972754363559,
"grad_norm": 0.7876543402671814,
"learning_rate": 0.00013629124004550626,
"loss": 1.0057,
"mean_token_accuracy": 0.8389794036746026,
"num_tokens": 240594.0,
"step": 280
},
{
"epoch": 0.9706257982120051,
"grad_norm": 0.738293468952179,
"learning_rate": 0.00013515358361774744,
"loss": 0.9129,
"mean_token_accuracy": 0.8528255730867386,
"num_tokens": 244859.0,
"step": 285
},
{
"epoch": 0.9876543209876543,
"grad_norm": 0.8145989775657654,
"learning_rate": 0.00013401592718998863,
"loss": 0.9188,
"mean_token_accuracy": 0.8555046319961548,
"num_tokens": 249060.0,
"step": 290
},
{
"epoch": 1.0046828437633035,
"grad_norm": 0.693233072757721,
"learning_rate": 0.00013287827076222981,
"loss": 1.0648,
"mean_token_accuracy": 0.8477524280548095,
"num_tokens": 253361.0,
"step": 295
},
{
"epoch": 1.0217113665389528,
"grad_norm": 0.8171095848083496,
"learning_rate": 0.000131740614334471,
"loss": 0.883,
"mean_token_accuracy": 0.8561580404639244,
"num_tokens": 257633.0,
"step": 300
},
{
"epoch": 1.038739889314602,
"grad_norm": 0.7343988418579102,
"learning_rate": 0.00013060295790671218,
"loss": 0.8591,
"mean_token_accuracy": 0.8583228841423989,
"num_tokens": 261975.0,
"step": 305
},
{
"epoch": 1.055768412090251,
"grad_norm": 0.6689726114273071,
"learning_rate": 0.00012946530147895337,
"loss": 0.8397,
"mean_token_accuracy": 0.8668102487921715,
"num_tokens": 266174.0,
"step": 310
},
{
"epoch": 1.0727969348659003,
"grad_norm": 0.8284767270088196,
"learning_rate": 0.00012832764505119455,
"loss": 0.9108,
"mean_token_accuracy": 0.8551412716507911,
"num_tokens": 270416.0,
"step": 315
},
{
"epoch": 1.0898254576415496,
"grad_norm": 0.7800877690315247,
"learning_rate": 0.0001271899886234357,
"loss": 0.923,
"mean_token_accuracy": 0.8521544948220253,
"num_tokens": 274802.0,
"step": 320
},
{
"epoch": 1.1068539804171988,
"grad_norm": 0.803035318851471,
"learning_rate": 0.00012605233219567692,
"loss": 0.9009,
"mean_token_accuracy": 0.8583568409085274,
"num_tokens": 279061.0,
"step": 325
},
{
"epoch": 1.123882503192848,
"grad_norm": 0.7928335666656494,
"learning_rate": 0.00012491467576791808,
"loss": 0.8677,
"mean_token_accuracy": 0.860838033258915,
"num_tokens": 283290.0,
"step": 330
},
{
"epoch": 1.1409110259684971,
"grad_norm": 0.82757967710495,
"learning_rate": 0.0001237770193401593,
"loss": 0.9326,
"mean_token_accuracy": 0.8526211172342301,
"num_tokens": 287627.0,
"step": 335
},
{
"epoch": 1.1579395487441464,
"grad_norm": 0.8021914958953857,
"learning_rate": 0.00012263936291240045,
"loss": 0.9066,
"mean_token_accuracy": 0.8505649596452713,
"num_tokens": 291975.0,
"step": 340
},
{
"epoch": 1.1749680715197957,
"grad_norm": 0.7565475106239319,
"learning_rate": 0.00012150170648464165,
"loss": 0.8812,
"mean_token_accuracy": 0.8562570214271545,
"num_tokens": 296232.0,
"step": 345
},
{
"epoch": 1.191996594295445,
"grad_norm": 0.8126978278160095,
"learning_rate": 0.00012036405005688282,
"loss": 0.905,
"mean_token_accuracy": 0.8556828230619431,
"num_tokens": 300591.0,
"step": 350
},
{
"epoch": 1.2090251170710942,
"grad_norm": 0.8174765706062317,
"learning_rate": 0.000119226393629124,
"loss": 0.9861,
"mean_token_accuracy": 0.8424012079834938,
"num_tokens": 304998.0,
"step": 355
},
{
"epoch": 1.2260536398467432,
"grad_norm": 0.8921035528182983,
"learning_rate": 0.00011808873720136519,
"loss": 0.7724,
"mean_token_accuracy": 0.8735315829515458,
"num_tokens": 309137.0,
"step": 360
},
{
"epoch": 1.2430821626223925,
"grad_norm": 0.855992317199707,
"learning_rate": 0.00011695108077360638,
"loss": 0.8922,
"mean_token_accuracy": 0.854039640724659,
"num_tokens": 313389.0,
"step": 365
},
{
"epoch": 1.2601106853980417,
"grad_norm": 0.9408860206604004,
"learning_rate": 0.00011581342434584756,
"loss": 0.9254,
"mean_token_accuracy": 0.8507854476571083,
"num_tokens": 317743.0,
"step": 370
},
{
"epoch": 1.277139208173691,
"grad_norm": 0.7847197651863098,
"learning_rate": 0.00011467576791808873,
"loss": 0.8563,
"mean_token_accuracy": 0.869862625002861,
"num_tokens": 321873.0,
"step": 375
},
{
"epoch": 1.29416773094934,
"grad_norm": 0.8556840419769287,
"learning_rate": 0.00011353811149032993,
"loss": 0.8489,
"mean_token_accuracy": 0.8591933220624923,
"num_tokens": 326124.0,
"step": 380
},
{
"epoch": 1.3111962537249893,
"grad_norm": 0.8849514126777649,
"learning_rate": 0.0001124004550625711,
"loss": 0.8526,
"mean_token_accuracy": 0.8600789621472359,
"num_tokens": 330405.0,
"step": 385
},
{
"epoch": 1.3282247765006385,
"grad_norm": 0.8099865913391113,
"learning_rate": 0.00011126279863481229,
"loss": 0.9309,
"mean_token_accuracy": 0.8511071890592575,
"num_tokens": 334701.0,
"step": 390
},
{
"epoch": 1.3452532992762878,
"grad_norm": 0.8668401837348938,
"learning_rate": 0.00011012514220705347,
"loss": 0.8671,
"mean_token_accuracy": 0.8605618432164193,
"num_tokens": 338951.0,
"step": 395
},
{
"epoch": 1.362281822051937,
"grad_norm": 0.8669872283935547,
"learning_rate": 0.00010898748577929466,
"loss": 0.8796,
"mean_token_accuracy": 0.8592276558279991,
"num_tokens": 343203.0,
"step": 400
},
{
"epoch": 1.3793103448275863,
"grad_norm": 0.8468757271766663,
"learning_rate": 0.00010784982935153584,
"loss": 0.8941,
"mean_token_accuracy": 0.8553030788898468,
"num_tokens": 347460.0,
"step": 405
},
{
"epoch": 1.3963388676032356,
"grad_norm": 0.8839651346206665,
"learning_rate": 0.00010671217292377703,
"loss": 0.913,
"mean_token_accuracy": 0.8489826336503029,
"num_tokens": 351850.0,
"step": 410
},
{
"epoch": 1.4133673903788846,
"grad_norm": 0.8808367848396301,
"learning_rate": 0.00010557451649601821,
"loss": 0.8158,
"mean_token_accuracy": 0.8628147393465042,
"num_tokens": 356104.0,
"step": 415
},
{
"epoch": 1.4303959131545338,
"grad_norm": 0.9303593039512634,
"learning_rate": 0.00010443686006825938,
"loss": 0.8737,
"mean_token_accuracy": 0.8497098922729492,
"num_tokens": 360445.0,
"step": 420
},
{
"epoch": 1.447424435930183,
"grad_norm": 0.7914776802062988,
"learning_rate": 0.00010329920364050057,
"loss": 0.9168,
"mean_token_accuracy": 0.8531492814421654,
"num_tokens": 364778.0,
"step": 425
},
{
"epoch": 1.4644529587058321,
"grad_norm": 0.8661580085754395,
"learning_rate": 0.00010216154721274175,
"loss": 0.8335,
"mean_token_accuracy": 0.8674297228455543,
"num_tokens": 368961.0,
"step": 430
},
{
"epoch": 1.4814814814814814,
"grad_norm": 0.8548939228057861,
"learning_rate": 0.00010102389078498294,
"loss": 0.9314,
"mean_token_accuracy": 0.8409372463822364,
"num_tokens": 373355.0,
"step": 435
},
{
"epoch": 1.4985100042571307,
"grad_norm": 0.8668932914733887,
"learning_rate": 9.988623435722412e-05,
"loss": 0.8482,
"mean_token_accuracy": 0.8576690852642059,
"num_tokens": 377652.0,
"step": 440
},
{
"epoch": 1.51553852703278,
"grad_norm": 0.8412478566169739,
"learning_rate": 9.874857792946531e-05,
"loss": 0.8791,
"mean_token_accuracy": 0.8531419888138772,
"num_tokens": 381969.0,
"step": 445
},
{
"epoch": 1.5325670498084292,
"grad_norm": 0.8298078179359436,
"learning_rate": 9.761092150170649e-05,
"loss": 0.7418,
"mean_token_accuracy": 0.8757623940706253,
"num_tokens": 386149.0,
"step": 450
},
{
"epoch": 1.5495955725840784,
"grad_norm": 0.8505256772041321,
"learning_rate": 9.647326507394768e-05,
"loss": 0.8107,
"mean_token_accuracy": 0.8660028412938118,
"num_tokens": 390316.0,
"step": 455
},
{
"epoch": 1.5666240953597277,
"grad_norm": 0.72185879945755,
"learning_rate": 9.533560864618886e-05,
"loss": 0.8601,
"mean_token_accuracy": 0.8591737478971482,
"num_tokens": 394651.0,
"step": 460
},
{
"epoch": 1.5836526181353767,
"grad_norm": 1.0382378101348877,
"learning_rate": 9.419795221843003e-05,
"loss": 0.849,
"mean_token_accuracy": 0.8591210901737213,
"num_tokens": 398879.0,
"step": 465
},
{
"epoch": 1.600681140911026,
"grad_norm": 0.7781236171722412,
"learning_rate": 9.306029579067122e-05,
"loss": 0.8587,
"mean_token_accuracy": 0.8554968953132629,
"num_tokens": 403154.0,
"step": 470
},
{
"epoch": 1.617709663686675,
"grad_norm": 0.9941114187240601,
"learning_rate": 9.19226393629124e-05,
"loss": 1.0077,
"mean_token_accuracy": 0.8324473947286606,
"num_tokens": 407653.0,
"step": 475
},
{
"epoch": 1.6347381864623243,
"grad_norm": 0.791912853717804,
"learning_rate": 9.078498293515359e-05,
"loss": 0.8211,
"mean_token_accuracy": 0.8655396267771721,
"num_tokens": 411904.0,
"step": 480
},
{
"epoch": 1.6517667092379735,
"grad_norm": 0.8509976267814636,
"learning_rate": 8.964732650739477e-05,
"loss": 0.8895,
"mean_token_accuracy": 0.8587504833936691,
"num_tokens": 416159.0,
"step": 485
},
{
"epoch": 1.6687952320136228,
"grad_norm": 1.0071176290512085,
"learning_rate": 8.850967007963596e-05,
"loss": 0.9112,
"mean_token_accuracy": 0.8539686873555183,
"num_tokens": 420513.0,
"step": 490
},
{
"epoch": 1.685823754789272,
"grad_norm": 0.8273159861564636,
"learning_rate": 8.737201365187714e-05,
"loss": 0.8383,
"mean_token_accuracy": 0.8577379778027534,
"num_tokens": 424759.0,
"step": 495
},
{
"epoch": 1.7028522775649213,
"grad_norm": 0.8064838647842407,
"learning_rate": 8.623435722411833e-05,
"loss": 0.8397,
"mean_token_accuracy": 0.8636475175619125,
"num_tokens": 429018.0,
"step": 500
},
{
"epoch": 1.7198808003405706,
"grad_norm": 0.7176003456115723,
"learning_rate": 8.509670079635951e-05,
"loss": 0.7738,
"mean_token_accuracy": 0.8699946105480194,
"num_tokens": 433124.0,
"step": 505
},
{
"epoch": 1.7369093231162198,
"grad_norm": 0.8316643834114075,
"learning_rate": 8.395904436860069e-05,
"loss": 0.9191,
"mean_token_accuracy": 0.8493718564510345,
"num_tokens": 437449.0,
"step": 510
},
{
"epoch": 1.7539378458918689,
"grad_norm": 0.9423941373825073,
"learning_rate": 8.282138794084187e-05,
"loss": 0.8749,
"mean_token_accuracy": 0.8558909714221954,
"num_tokens": 441753.0,
"step": 515
},
{
"epoch": 1.770966368667518,
"grad_norm": 0.8593487739562988,
"learning_rate": 8.168373151308306e-05,
"loss": 0.8463,
"mean_token_accuracy": 0.857591399550438,
"num_tokens": 446036.0,
"step": 520
},
{
"epoch": 1.7879948914431671,
"grad_norm": 0.7944974303245544,
"learning_rate": 8.054607508532424e-05,
"loss": 0.8275,
"mean_token_accuracy": 0.859096622467041,
"num_tokens": 450298.0,
"step": 525
},
{
"epoch": 1.8050234142188164,
"grad_norm": 0.7622503042221069,
"learning_rate": 7.940841865756543e-05,
"loss": 0.8846,
"mean_token_accuracy": 0.8580268025398254,
"num_tokens": 454595.0,
"step": 530
},
{
"epoch": 1.8220519369944657,
"grad_norm": 0.8578078746795654,
"learning_rate": 7.827076222980661e-05,
"loss": 0.7674,
"mean_token_accuracy": 0.8716912001371384,
"num_tokens": 458807.0,
"step": 535
},
{
"epoch": 1.839080459770115,
"grad_norm": 1.0383292436599731,
"learning_rate": 7.71331058020478e-05,
"loss": 0.9129,
"mean_token_accuracy": 0.8489386543631554,
"num_tokens": 463150.0,
"step": 540
},
{
"epoch": 1.8561089825457642,
"grad_norm": 0.8726801872253418,
"learning_rate": 7.599544937428897e-05,
"loss": 0.877,
"mean_token_accuracy": 0.8568779289722442,
"num_tokens": 467472.0,
"step": 545
},
{
"epoch": 1.8731375053214134,
"grad_norm": 0.9192221164703369,
"learning_rate": 7.485779294653015e-05,
"loss": 0.9341,
"mean_token_accuracy": 0.8403045237064362,
"num_tokens": 471930.0,
"step": 550
},
{
"epoch": 1.8901660280970627,
"grad_norm": 0.8688830137252808,
"learning_rate": 7.372013651877134e-05,
"loss": 0.8244,
"mean_token_accuracy": 0.8679932355880737,
"num_tokens": 476140.0,
"step": 555
},
{
"epoch": 1.907194550872712,
"grad_norm": 0.8286635279655457,
"learning_rate": 7.258248009101252e-05,
"loss": 0.8725,
"mean_token_accuracy": 0.8549414992332458,
"num_tokens": 480474.0,
"step": 560
},
{
"epoch": 1.924223073648361,
"grad_norm": 0.789902925491333,
"learning_rate": 7.14448236632537e-05,
"loss": 0.8135,
"mean_token_accuracy": 0.8649365425109863,
"num_tokens": 484805.0,
"step": 565
},
{
"epoch": 1.9412515964240102,
"grad_norm": 0.8496629595756531,
"learning_rate": 7.030716723549489e-05,
"loss": 0.9036,
"mean_token_accuracy": 0.8460123494267464,
"num_tokens": 489275.0,
"step": 570
},
{
"epoch": 1.9582801191996593,
"grad_norm": 0.8411655426025391,
"learning_rate": 6.916951080773608e-05,
"loss": 0.9346,
"mean_token_accuracy": 0.8429780200123786,
"num_tokens": 493726.0,
"step": 575
},
{
"epoch": 1.9753086419753085,
"grad_norm": 0.8502522706985474,
"learning_rate": 6.803185437997726e-05,
"loss": 0.8703,
"mean_token_accuracy": 0.8595944106578827,
"num_tokens": 498022.0,
"step": 580
},
{
"epoch": 1.9923371647509578,
"grad_norm": 0.743918776512146,
"learning_rate": 6.689419795221843e-05,
"loss": 0.8815,
"mean_token_accuracy": 0.851164074242115,
"num_tokens": 502352.0,
"step": 585
},
{
"epoch": 2.009365687526607,
"grad_norm": 0.7339876294136047,
"learning_rate": 6.575654152445962e-05,
"loss": 0.9297,
"mean_token_accuracy": 0.8610147342085839,
"num_tokens": 506669.0,
"step": 590
},
{
"epoch": 2.0263942103022563,
"grad_norm": 0.903137743473053,
"learning_rate": 6.46188850967008e-05,
"loss": 0.7306,
"mean_token_accuracy": 0.8799364000558854,
"num_tokens": 510931.0,
"step": 595
},
{
"epoch": 2.0434227330779056,
"grad_norm": 0.8741887807846069,
"learning_rate": 6.348122866894199e-05,
"loss": 0.777,
"mean_token_accuracy": 0.8718036338686943,
"num_tokens": 515254.0,
"step": 600
}
],
"logging_steps": 5,
"max_steps": 879,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4829514093385728.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}