snerta-8l-base / trainer_state.json
ivlcic's picture
Upload 6 files
0803cfb verified
Raw
History Blame Contribute Delete
22.8 kB
{
"best_global_step": 64215,
"best_metric": 0.9238630978137686,
"best_model_checkpoint": "/workspace/cannopy/result/train/token/ner/ner.mdeberta3.b16.lr2e-05/checkpoint-64215",
"epoch": 20.0,
"eval_steps": 500,
"global_step": 85620,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.0,
"grad_norm": 1.3367141485214233,
"learning_rate": 1.6660179057999222e-05,
"loss": 0.39717576459756776,
"step": 4281
},
{
"epoch": 1.0,
"eval_acc": 0.9832746262039067,
"eval_f1": 0.8776248509468665,
"eval_label.LOC.f1": 0.93492293505467,
"eval_label.LOC.p": 0.923727710529741,
"eval_label.LOC.r": 0.9463928523803173,
"eval_label.MISC.f1": 0.7478156071105755,
"eval_label.MISC.p": 0.7107674684994273,
"eval_label.MISC.r": 0.7889383343928799,
"eval_label.ORG.f1": 0.8458744915746658,
"eval_label.ORG.p": 0.8004123711340206,
"eval_label.ORG.r": 0.8968119513322039,
"eval_label.PER.f1": 0.9085019077100281,
"eval_label.PER.p": 0.9105339105339105,
"eval_label.PER.r": 0.906478954173251,
"eval_loss": 0.056813765317201614,
"eval_p": 0.8554767533490938,
"eval_r": 0.9009502468982116,
"eval_runtime": 32.4812,
"eval_samples_per_second": 555.891,
"eval_steps_per_second": 17.395,
"step": 4281
},
{
"epoch": 2.0,
"grad_norm": 1.3472847938537598,
"learning_rate": 1.9149375015531425e-05,
"loss": 0.09596302698104633,
"step": 8562
},
{
"epoch": 2.0,
"eval_acc": 0.9856530176011911,
"eval_f1": 0.8988005842779847,
"eval_label.LOC.f1": 0.9451052150045746,
"eval_label.LOC.p": 0.9266948609509164,
"eval_label.LOC.r": 0.9642619015868783,
"eval_label.MISC.f1": 0.7947612732095491,
"eval_label.MISC.p": 0.8305613305613305,
"eval_label.MISC.r": 0.7619198982835347,
"eval_label.ORG.f1": 0.8627658769207479,
"eval_label.ORG.p": 0.8483179517713605,
"eval_label.ORG.r": 0.8777144617280148,
"eval_label.PER.f1": 0.9268951784952354,
"eval_label.PER.p": 0.9177580622447543,
"eval_label.PER.r": 0.9362160609107887,
"eval_loss": 0.05167277529835701,
"eval_p": 0.8913007997388608,
"eval_r": 0.9064276525996929,
"eval_runtime": 32.474,
"eval_samples_per_second": 556.014,
"eval_steps_per_second": 17.399,
"step": 8562
},
{
"epoch": 3.0,
"grad_norm": 0.4700154662132263,
"learning_rate": 1.808553465371139e-05,
"loss": 0.06998056341793682,
"step": 12843
},
{
"epoch": 3.0,
"eval_acc": 0.9857843901985095,
"eval_f1": 0.9082807731434385,
"eval_label.LOC.f1": 0.9483767961681746,
"eval_label.LOC.p": 0.946236559139785,
"eval_label.LOC.r": 0.9505267368982531,
"eval_label.MISC.f1": 0.8065855829130822,
"eval_label.MISC.p": 0.7561179087875417,
"eval_label.MISC.r": 0.8642720915448188,
"eval_label.ORG.f1": 0.8929755803436841,
"eval_label.ORG.p": 0.8743911439114391,
"eval_label.ORG.r": 0.9123671646388418,
"eval_label.PER.f1": 0.9285511766373687,
"eval_label.PER.p": 0.916468448299986,
"eval_label.PER.r": 0.9409567590863381,
"eval_loss": 0.04598889499902725,
"eval_p": 0.8910223144784639,
"eval_r": 0.9262210050209553,
"eval_runtime": 33.4856,
"eval_samples_per_second": 539.217,
"eval_steps_per_second": 16.873,
"step": 12843
},
{
"epoch": 4.0,
"grad_norm": 0.12420473247766495,
"learning_rate": 1.7021694291891355e-05,
"loss": 0.05369556821748715,
"step": 17124
},
{
"epoch": 4.0,
"eval_acc": 0.9874183368776566,
"eval_f1": 0.9158554693944893,
"eval_label.LOC.f1": 0.9499669093315686,
"eval_label.LOC.p": 0.9429772697411641,
"eval_label.LOC.r": 0.9570609414588612,
"eval_label.MISC.f1": 0.8372469635627531,
"eval_label.MISC.p": 0.8534169692967977,
"eval_label.MISC.r": 0.8216783216783217,
"eval_label.ORG.f1": 0.8995784402288467,
"eval_label.ORG.p": 0.8798409659843911,
"eval_label.ORG.r": 0.9202217772986293,
"eval_label.PER.f1": 0.9292334219412314,
"eval_label.PER.p": 0.9294337453291176,
"eval_label.PER.r": 0.9290331848872289,
"eval_loss": 0.04518148675560951,
"eval_p": 0.9104104309319775,
"eval_r": 0.9213660317855513,
"eval_runtime": 32.8809,
"eval_samples_per_second": 549.133,
"eval_steps_per_second": 17.183,
"step": 17124
},
{
"epoch": 5.0,
"grad_norm": 0.2671431601047516,
"learning_rate": 1.595785393007132e-05,
"loss": 0.04225894363927273,
"step": 21405
},
{
"epoch": 5.0,
"eval_acc": 0.9871884348323494,
"eval_f1": 0.9171679967260078,
"eval_label.LOC.f1": 0.9532500165311116,
"eval_label.LOC.p": 0.9454354669464848,
"eval_label.LOC.r": 0.961194825976797,
"eval_label.MISC.f1": 0.8348736906962415,
"eval_label.MISC.p": 0.8099222952779438,
"eval_label.MISC.r": 0.8614113159567705,
"eval_label.ORG.f1": 0.901406320883109,
"eval_label.ORG.p": 0.8853408584583395,
"eval_label.ORG.r": 0.9180656091175111,
"eval_label.PER.f1": 0.9312139140352127,
"eval_label.PER.p": 0.9241652518392756,
"eval_label.PER.r": 0.9383709237178566,
"eval_loss": 0.048478372395038605,
"eval_p": 0.904727302087118,
"eval_r": 0.9299555998174198,
"eval_runtime": 32.4315,
"eval_samples_per_second": 556.742,
"eval_steps_per_second": 17.421,
"step": 21405
},
{
"epoch": 6.0,
"grad_norm": 0.6828418374061584,
"learning_rate": 1.4894013568251286e-05,
"loss": 0.033062972968996365,
"step": 25686
},
{
"epoch": 6.0,
"eval_acc": 0.9869092680630479,
"eval_f1": 0.9160358586169406,
"eval_label.LOC.f1": 0.9566717536991572,
"eval_label.LOC.p": 0.9520602218700476,
"eval_label.LOC.r": 0.9613281770902787,
"eval_label.MISC.f1": 0.8213117307991898,
"eval_label.MISC.p": 0.8053773296669722,
"eval_label.MISC.r": 0.8378893833439288,
"eval_label.ORG.f1": 0.9023171285779191,
"eval_label.ORG.p": 0.8875316549977655,
"eval_label.ORG.r": 0.9176035730787001,
"eval_label.PER.f1": 0.9286171802718668,
"eval_label.PER.p": 0.9201692524682652,
"eval_label.PER.r": 0.9372216635540871,
"eval_loss": 0.053501419723033905,
"eval_p": 0.9058341447581953,
"eval_r": 0.9264699780073862,
"eval_runtime": 32.9114,
"eval_samples_per_second": 548.625,
"eval_steps_per_second": 17.167,
"step": 25686
},
{
"epoch": 7.0,
"grad_norm": 0.4229598343372345,
"learning_rate": 1.3830173206431251e-05,
"loss": 0.025886756631431945,
"step": 29967
},
{
"epoch": 7.0,
"eval_acc": 0.9871747501867955,
"eval_f1": 0.9166171437939302,
"eval_label.LOC.f1": 0.9542040545031572,
"eval_label.LOC.p": 0.9512324410283594,
"eval_label.LOC.r": 0.957194292572343,
"eval_label.MISC.f1": 0.8256130790190737,
"eval_label.MISC.p": 0.7881502890173411,
"eval_label.MISC.r": 0.8668150031786396,
"eval_label.ORG.f1": 0.9035007610350075,
"eval_label.ORG.p": 0.8930344516323153,
"eval_label.ORG.r": 0.914215308794086,
"eval_label.PER.f1": 0.9314677327241576,
"eval_label.PER.p": 0.9257840215694622,
"eval_label.PER.r": 0.9372216635540871,
"eval_loss": 0.059339962899684906,
"eval_p": 0.9054655870445344,
"eval_r": 0.928046806921449,
"eval_runtime": 32.612,
"eval_samples_per_second": 553.661,
"eval_steps_per_second": 17.325,
"step": 29967
},
{
"epoch": 8.0,
"grad_norm": 0.656637966632843,
"learning_rate": 1.2766332844611218e-05,
"loss": 0.02074824090149881,
"step": 34248
},
{
"epoch": 8.0,
"eval_acc": 0.987262331918341,
"eval_f1": 0.9183782232607716,
"eval_label.LOC.f1": 0.9538971807628523,
"eval_label.LOC.p": 0.9490496304118268,
"eval_label.LOC.r": 0.9587945059341245,
"eval_label.MISC.f1": 0.8343888537048765,
"eval_label.MISC.p": 0.831230283911672,
"eval_label.MISC.r": 0.8375715193897012,
"eval_label.ORG.f1": 0.8998067489222537,
"eval_label.ORG.p": 0.8695589714121534,
"eval_label.ORG.r": 0.932234714307716,
"eval_label.PER.f1": 0.9359443368481457,
"eval_label.PER.p": 0.9346704871060172,
"eval_label.PER.r": 0.9372216635540871,
"eval_loss": 0.06151953712105751,
"eval_p": 0.907441163365334,
"eval_r": 0.9295821403377733,
"eval_runtime": 32.5433,
"eval_samples_per_second": 554.83,
"eval_steps_per_second": 17.361,
"step": 34248
},
{
"epoch": 9.0,
"grad_norm": 1.0659022331237793,
"learning_rate": 1.1702492482791184e-05,
"loss": 0.01647565521332906,
"step": 38529
},
{
"epoch": 9.0,
"eval_acc": 0.987234962627233,
"eval_f1": 0.9183171361791118,
"eval_label.LOC.f1": 0.9529481834425253,
"eval_label.LOC.p": 0.9458749343142406,
"eval_label.LOC.r": 0.9601280170689426,
"eval_label.MISC.f1": 0.8366175329712956,
"eval_label.MISC.p": 0.8172173385874507,
"eval_label.MISC.r": 0.8569612205975843,
"eval_label.ORG.f1": 0.9041033779188392,
"eval_label.ORG.p": 0.8875370919881306,
"eval_label.ORG.r": 0.9212998613891884,
"eval_label.PER.f1": 0.9319985698963175,
"eval_label.PER.p": 0.9278189066059226,
"eval_label.PER.r": 0.9362160609107887,
"eval_loss": 0.06663035601377487,
"eval_p": 0.9075987841945289,
"eval_r": 0.9292916718536038,
"eval_runtime": 32.3615,
"eval_samples_per_second": 557.947,
"eval_steps_per_second": 17.459,
"step": 38529
},
{
"epoch": 10.0,
"grad_norm": 0.06852112710475922,
"learning_rate": 1.0638652120971149e-05,
"loss": 0.012914503882126786,
"step": 42810
},
{
"epoch": 10.0,
"eval_acc": 0.9880013027782567,
"eval_f1": 0.9225139285787711,
"eval_label.LOC.f1": 0.9541126686061888,
"eval_label.LOC.p": 0.9462295081967214,
"eval_label.LOC.r": 0.9621282837711694,
"eval_label.MISC.f1": 0.8479798773777708,
"eval_label.MISC.p": 0.8388802488335926,
"eval_label.MISC.r": 0.8572790845518118,
"eval_label.ORG.f1": 0.9100626049778593,
"eval_label.ORG.p": 0.9023467070401211,
"eval_label.ORG.r": 0.9179115971045742,
"eval_label.PER.f1": 0.933845497225779,
"eval_label.PER.p": 0.924897844159504,
"eval_label.PER.r": 0.942967964372935,
"eval_loss": 0.07016361504793167,
"eval_p": 0.9141879227446826,
"eval_r": 0.9309929872608822,
"eval_runtime": 32.9069,
"eval_samples_per_second": 548.699,
"eval_steps_per_second": 17.17,
"step": 42810
},
{
"epoch": 11.0,
"grad_norm": 1.4090399742126465,
"learning_rate": 9.574811759151116e-06,
"loss": 0.010248644444965309,
"step": 47091
},
{
"epoch": 11.0,
"eval_acc": 0.9879328795504868,
"eval_f1": 0.9214825151863405,
"eval_label.LOC.f1": 0.9554612937433723,
"eval_label.LOC.p": 0.9497957570167348,
"eval_label.LOC.r": 0.961194825976797,
"eval_label.MISC.f1": 0.8431096511809792,
"eval_label.MISC.p": 0.8299969202340622,
"eval_label.MISC.r": 0.8566433566433567,
"eval_label.ORG.f1": 0.9066000605510142,
"eval_label.ORG.p": 0.8913528798928412,
"eval_label.ORG.r": 0.9223779454797474,
"eval_label.PER.f1": 0.9346633416458853,
"eval_label.PER.p": 0.9271981905569692,
"eval_label.PER.r": 0.9422496767705789,
"eval_loss": 0.07261578738689423,
"eval_p": 0.911567664135775,
"eval_r": 0.9316154197269596,
"eval_runtime": 32.2895,
"eval_samples_per_second": 559.191,
"eval_steps_per_second": 17.498,
"step": 47091
},
{
"epoch": 12.0,
"grad_norm": 2.3597915172576904,
"learning_rate": 8.510971397331081e-06,
"loss": 0.008314984113750711,
"step": 51372
},
{
"epoch": 12.0,
"eval_acc": 0.9877330837253985,
"eval_f1": 0.9202380952380953,
"eval_label.LOC.f1": 0.9561705508474576,
"eval_label.LOC.p": 0.9495069033530572,
"eval_label.LOC.r": 0.9629283904520602,
"eval_label.MISC.f1": 0.8422717924379053,
"eval_label.MISC.p": 0.8384251968503937,
"eval_label.MISC.r": 0.8461538461538461,
"eval_label.ORG.f1": 0.9035845795446007,
"eval_label.ORG.p": 0.882301144702084,
"eval_label.ORG.r": 0.9259202217772986,
"eval_label.PER.f1": 0.932513583071204,
"eval_label.PER.p": 0.9281343389782268,
"eval_label.PER.r": 0.9369343485131446,
"eval_loss": 0.07839750498533249,
"eval_p": 0.9104829210836278,
"eval_r": 0.9302045728038508,
"eval_runtime": 32.9029,
"eval_samples_per_second": 548.767,
"eval_steps_per_second": 17.172,
"step": 51372
},
{
"epoch": 13.0,
"grad_norm": 0.18180809915065765,
"learning_rate": 7.4471310355110474e-06,
"loss": 0.006686228676617521,
"step": 55653
},
{
"epoch": 13.0,
"eval_acc": 0.9875524464040857,
"eval_f1": 0.9198900693219574,
"eval_label.LOC.f1": 0.9554880464931977,
"eval_label.LOC.p": 0.9464869815517467,
"eval_label.LOC.r": 0.9646619549273237,
"eval_label.MISC.f1": 0.8379507816127534,
"eval_label.MISC.p": 0.8165912518853695,
"eval_label.MISC.r": 0.8604577240940877,
"eval_label.ORG.f1": 0.9057290087905425,
"eval_label.ORG.p": 0.8915411009995524,
"eval_label.ORG.r": 0.9203757893115663,
"eval_label.PER.f1": 0.9325882942904218,
"eval_label.PER.p": 0.93012289225493,
"eval_label.PER.r": 0.9350668007470191,
"eval_loss": 0.08158153295516968,
"eval_p": 0.9094448274463685,
"eval_r": 0.9305780322834972,
"eval_runtime": 32.4013,
"eval_samples_per_second": 557.261,
"eval_steps_per_second": 17.438,
"step": 55653
},
{
"epoch": 14.0,
"grad_norm": 0.18500462174415588,
"learning_rate": 6.383290673691012e-06,
"loss": 0.005471784470933978,
"step": 59934
},
{
"epoch": 14.0,
"eval_acc": 0.9871911717614602,
"eval_f1": 0.9195246875640237,
"eval_label.LOC.f1": 0.9548378539690962,
"eval_label.LOC.p": 0.9497361477572559,
"eval_label.LOC.r": 0.9599946659554607,
"eval_label.MISC.f1": 0.8372093023255813,
"eval_label.MISC.p": 0.8171912832929782,
"eval_label.MISC.r": 0.8582326764144946,
"eval_label.ORG.f1": 0.90653782273894,
"eval_label.ORG.p": 0.8890863320005923,
"eval_label.ORG.r": 0.9246881256738025,
"eval_label.PER.f1": 0.9316708229426433,
"eval_label.PER.p": 0.9242295730845349,
"eval_label.PER.r": 0.9392328688406838,
"eval_loss": 0.08883294463157654,
"eval_p": 0.9081380761604144,
"eval_r": 0.9312004647495746,
"eval_runtime": 32.3818,
"eval_samples_per_second": 557.597,
"eval_steps_per_second": 17.448,
"step": 59934
},
{
"epoch": 15.0,
"grad_norm": 0.22286078333854675,
"learning_rate": 5.319450311870977e-06,
"loss": 0.004570412318357322,
"step": 64215
},
{
"epoch": 15.0,
"eval_acc": 0.988053304431362,
"eval_f1": 0.9238630978137686,
"eval_label.LOC.f1": 0.9564351175454908,
"eval_label.LOC.p": 0.9526392379944437,
"eval_label.LOC.r": 0.9602613681824244,
"eval_label.MISC.f1": 0.8461170467230107,
"eval_label.MISC.p": 0.84896,
"eval_label.MISC.r": 0.8432930705657978,
"eval_label.ORG.f1": 0.9100128661167033,
"eval_label.ORG.p": 0.8946428571428572,
"eval_label.ORG.r": 0.9259202217772986,
"eval_label.PER.f1": 0.9367360068625348,
"eval_label.PER.p": 0.9322709163346613,
"eval_label.PER.r": 0.9412440741272806,
"eval_loss": 0.0887371227145195,
"eval_p": 0.9175671250818599,
"eval_r": 0.9302460683015893,
"eval_runtime": 32.8226,
"eval_samples_per_second": 550.109,
"eval_steps_per_second": 17.214,
"step": 64215
},
{
"epoch": 16.0,
"grad_norm": 0.09178588539361954,
"learning_rate": 4.255609950050943e-06,
"loss": 0.003622644723394546,
"step": 68496
},
{
"epoch": 16.0,
"eval_acc": 0.9879684596289271,
"eval_f1": 0.9229315974289998,
"eval_label.LOC.f1": 0.9551214361140442,
"eval_label.LOC.p": 0.9455115640925127,
"eval_label.LOC.r": 0.9649286571542872,
"eval_label.MISC.f1": 0.8459366175086288,
"eval_label.MISC.p": 0.8351920693928129,
"eval_label.MISC.r": 0.8569612205975843,
"eval_label.ORG.f1": 0.9098784194528875,
"eval_label.ORG.p": 0.8980050997450127,
"eval_label.ORG.r": 0.9220699214538735,
"eval_label.PER.f1": 0.9354078937977304,
"eval_label.PER.p": 0.9295035460992908,
"eval_label.PER.r": 0.9413877316477518,
"eval_loss": 0.09383999556303024,
"eval_p": 0.913570208960078,
"eval_r": 0.932486825179468,
"eval_runtime": 32.431,
"eval_samples_per_second": 556.751,
"eval_steps_per_second": 17.422,
"step": 68496
},
{
"epoch": 17.0,
"grad_norm": 0.5162076354026794,
"learning_rate": 3.191769588230909e-06,
"loss": 0.002951568544704595,
"step": 72777
},
{
"epoch": 17.0,
"eval_acc": 0.9879985658491459,
"eval_f1": 0.9234442866259083,
"eval_label.LOC.f1": 0.9560388708931051,
"eval_label.LOC.p": 0.947954902988988,
"eval_label.LOC.r": 0.9642619015868783,
"eval_label.MISC.f1": 0.8496981251986019,
"eval_label.MISC.p": 0.849428208386277,
"eval_label.MISC.r": 0.8499682136045772,
"eval_label.ORG.f1": 0.910155952833777,
"eval_label.ORG.p": 0.8992784125075165,
"eval_label.ORG.r": 0.9212998613891884,
"eval_label.PER.f1": 0.9338471419396276,
"eval_label.PER.p": 0.9278218944980148,
"eval_label.PER.r": 0.9399511564430398,
"eval_loss": 0.09467604756355286,
"eval_p": 0.9162581699346405,
"eval_r": 0.9307440142744512,
"eval_runtime": 32.3822,
"eval_samples_per_second": 557.59,
"eval_steps_per_second": 17.448,
"step": 72777
},
{
"epoch": 18.0,
"grad_norm": 0.003633791347965598,
"learning_rate": 2.127929226410875e-06,
"loss": 0.0021125146981239096,
"step": 77058
},
{
"epoch": 18.0,
"eval_acc": 0.9878316131733872,
"eval_f1": 0.9223450284003527,
"eval_label.LOC.f1": 0.9541914191419141,
"eval_label.LOC.p": 0.9447131093974643,
"eval_label.LOC.r": 0.9638618482464328,
"eval_label.MISC.f1": 0.8473520249221183,
"eval_label.MISC.p": 0.8307880268784361,
"eval_label.MISC.r": 0.8645899554990464,
"eval_label.ORG.f1": 0.9091460640072804,
"eval_label.ORG.p": 0.8955625280143433,
"eval_label.ORG.r": 0.9231480055444324,
"eval_label.PER.f1": 0.9346941688673185,
"eval_label.PER.p": 0.9287943262411348,
"eval_label.PER.r": 0.9406694440453958,
"eval_loss": 0.09958989918231964,
"eval_p": 0.9117074752716069,
"eval_r": 0.9332337441387609,
"eval_runtime": 32.3603,
"eval_samples_per_second": 557.968,
"eval_steps_per_second": 17.46,
"step": 77058
},
{
"epoch": 19.0,
"grad_norm": 0.0006278403452597558,
"learning_rate": 1.0640888645908402e-06,
"loss": 0.0016824499075447836,
"step": 81339
},
{
"epoch": 19.0,
"eval_acc": 0.9881053060844671,
"eval_f1": 0.92369345855854,
"eval_label.LOC.f1": 0.9557276156442328,
"eval_label.LOC.p": 0.9486337362059906,
"eval_label.LOC.r": 0.9629283904520602,
"eval_label.MISC.f1": 0.8502278799308502,
"eval_label.MISC.p": 0.8408455082374884,
"eval_label.MISC.r": 0.8598219961856326,
"eval_label.ORG.f1": 0.911369332421964,
"eval_label.ORG.p": 0.8990110878034162,
"eval_label.ORG.r": 0.9240720776220546,
"eval_label.PER.f1": 0.9340847481809103,
"eval_label.PER.p": 0.9277313305937367,
"eval_label.PER.r": 0.9405257865249246,
"eval_loss": 0.09979883581399918,
"eval_p": 0.9150244299674267,
"eval_r": 0.9325283206772065,
"eval_runtime": 32.7242,
"eval_samples_per_second": 551.763,
"eval_steps_per_second": 17.265,
"step": 81339
},
{
"epoch": 20.0,
"grad_norm": 0.0003999824111815542,
"learning_rate": 2.485027708058945e-10,
"loss": 0.0014637853742286275,
"step": 85620
},
{
"epoch": 20.0,
"eval_acc": 0.9881107799426887,
"eval_f1": 0.9238326208484051,
"eval_label.LOC.f1": 0.9561130601707817,
"eval_label.LOC.p": 0.9492639327024185,
"eval_label.LOC.r": 0.963061741565542,
"eval_label.MISC.f1": 0.8494572911750827,
"eval_label.MISC.p": 0.8408595453129866,
"eval_label.MISC.r": 0.8582326764144946,
"eval_label.ORG.f1": 0.9107603581727122,
"eval_label.ORG.p": 0.8976813762154077,
"eval_label.ORG.r": 0.9242260896349915,
"eval_label.PER.f1": 0.935064935064935,
"eval_label.PER.p": 0.9289663972777541,
"eval_label.PER.r": 0.9412440741272806,
"eval_loss": 0.10018600523471832,
"eval_p": 0.9152176568799121,
"eval_r": 0.9326113116726835,
"eval_runtime": 32.2631,
"eval_samples_per_second": 559.649,
"eval_steps_per_second": 17.512,
"step": 85620
},
{
"epoch": 20.0,
"step": 85620,
"total_flos": 1.3381069410175074e+17,
"train_loss": 0.040764350686165754,
"train_runtime": 15630.4696,
"train_samples_per_second": 175.264,
"train_steps_per_second": 5.478
}
],
"logging_steps": 500,
"max_steps": 85620,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.3381069410175074e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}