{ "best_global_step": 64215, "best_metric": 0.9238630978137686, "best_model_checkpoint": "/workspace/cannopy/result/train/token/ner/ner.mdeberta3.b16.lr2e-05/checkpoint-64215", "epoch": 20.0, "eval_steps": 500, "global_step": 85620, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.0, "grad_norm": 1.3367141485214233, "learning_rate": 1.6660179057999222e-05, "loss": 0.39717576459756776, "step": 4281 }, { "epoch": 1.0, "eval_acc": 0.9832746262039067, "eval_f1": 0.8776248509468665, "eval_label.LOC.f1": 0.93492293505467, "eval_label.LOC.p": 0.923727710529741, "eval_label.LOC.r": 0.9463928523803173, "eval_label.MISC.f1": 0.7478156071105755, "eval_label.MISC.p": 0.7107674684994273, "eval_label.MISC.r": 0.7889383343928799, "eval_label.ORG.f1": 0.8458744915746658, "eval_label.ORG.p": 0.8004123711340206, "eval_label.ORG.r": 0.8968119513322039, "eval_label.PER.f1": 0.9085019077100281, "eval_label.PER.p": 0.9105339105339105, "eval_label.PER.r": 0.906478954173251, "eval_loss": 0.056813765317201614, "eval_p": 0.8554767533490938, "eval_r": 0.9009502468982116, "eval_runtime": 32.4812, "eval_samples_per_second": 555.891, "eval_steps_per_second": 17.395, "step": 4281 }, { "epoch": 2.0, "grad_norm": 1.3472847938537598, "learning_rate": 1.9149375015531425e-05, "loss": 0.09596302698104633, "step": 8562 }, { "epoch": 2.0, "eval_acc": 0.9856530176011911, "eval_f1": 0.8988005842779847, "eval_label.LOC.f1": 0.9451052150045746, "eval_label.LOC.p": 0.9266948609509164, "eval_label.LOC.r": 0.9642619015868783, "eval_label.MISC.f1": 0.7947612732095491, "eval_label.MISC.p": 0.8305613305613305, "eval_label.MISC.r": 0.7619198982835347, "eval_label.ORG.f1": 0.8627658769207479, "eval_label.ORG.p": 0.8483179517713605, "eval_label.ORG.r": 0.8777144617280148, "eval_label.PER.f1": 0.9268951784952354, "eval_label.PER.p": 0.9177580622447543, "eval_label.PER.r": 0.9362160609107887, "eval_loss": 0.05167277529835701, "eval_p": 0.8913007997388608, "eval_r": 0.9064276525996929, "eval_runtime": 32.474, "eval_samples_per_second": 556.014, "eval_steps_per_second": 17.399, "step": 8562 }, { "epoch": 3.0, "grad_norm": 0.4700154662132263, "learning_rate": 1.808553465371139e-05, "loss": 0.06998056341793682, "step": 12843 }, { "epoch": 3.0, "eval_acc": 0.9857843901985095, "eval_f1": 0.9082807731434385, "eval_label.LOC.f1": 0.9483767961681746, "eval_label.LOC.p": 0.946236559139785, "eval_label.LOC.r": 0.9505267368982531, "eval_label.MISC.f1": 0.8065855829130822, "eval_label.MISC.p": 0.7561179087875417, "eval_label.MISC.r": 0.8642720915448188, "eval_label.ORG.f1": 0.8929755803436841, "eval_label.ORG.p": 0.8743911439114391, "eval_label.ORG.r": 0.9123671646388418, "eval_label.PER.f1": 0.9285511766373687, "eval_label.PER.p": 0.916468448299986, "eval_label.PER.r": 0.9409567590863381, "eval_loss": 0.04598889499902725, "eval_p": 0.8910223144784639, "eval_r": 0.9262210050209553, "eval_runtime": 33.4856, "eval_samples_per_second": 539.217, "eval_steps_per_second": 16.873, "step": 12843 }, { "epoch": 4.0, "grad_norm": 0.12420473247766495, "learning_rate": 1.7021694291891355e-05, "loss": 0.05369556821748715, "step": 17124 }, { "epoch": 4.0, "eval_acc": 0.9874183368776566, "eval_f1": 0.9158554693944893, "eval_label.LOC.f1": 0.9499669093315686, "eval_label.LOC.p": 0.9429772697411641, "eval_label.LOC.r": 0.9570609414588612, "eval_label.MISC.f1": 0.8372469635627531, "eval_label.MISC.p": 0.8534169692967977, "eval_label.MISC.r": 0.8216783216783217, "eval_label.ORG.f1": 0.8995784402288467, "eval_label.ORG.p": 0.8798409659843911, "eval_label.ORG.r": 0.9202217772986293, "eval_label.PER.f1": 0.9292334219412314, "eval_label.PER.p": 0.9294337453291176, "eval_label.PER.r": 0.9290331848872289, "eval_loss": 0.04518148675560951, "eval_p": 0.9104104309319775, "eval_r": 0.9213660317855513, "eval_runtime": 32.8809, "eval_samples_per_second": 549.133, "eval_steps_per_second": 17.183, "step": 17124 }, { "epoch": 5.0, "grad_norm": 0.2671431601047516, "learning_rate": 1.595785393007132e-05, "loss": 0.04225894363927273, "step": 21405 }, { "epoch": 5.0, "eval_acc": 0.9871884348323494, "eval_f1": 0.9171679967260078, "eval_label.LOC.f1": 0.9532500165311116, "eval_label.LOC.p": 0.9454354669464848, "eval_label.LOC.r": 0.961194825976797, "eval_label.MISC.f1": 0.8348736906962415, "eval_label.MISC.p": 0.8099222952779438, "eval_label.MISC.r": 0.8614113159567705, "eval_label.ORG.f1": 0.901406320883109, "eval_label.ORG.p": 0.8853408584583395, "eval_label.ORG.r": 0.9180656091175111, "eval_label.PER.f1": 0.9312139140352127, "eval_label.PER.p": 0.9241652518392756, "eval_label.PER.r": 0.9383709237178566, "eval_loss": 0.048478372395038605, "eval_p": 0.904727302087118, "eval_r": 0.9299555998174198, "eval_runtime": 32.4315, "eval_samples_per_second": 556.742, "eval_steps_per_second": 17.421, "step": 21405 }, { "epoch": 6.0, "grad_norm": 0.6828418374061584, "learning_rate": 1.4894013568251286e-05, "loss": 0.033062972968996365, "step": 25686 }, { "epoch": 6.0, "eval_acc": 0.9869092680630479, "eval_f1": 0.9160358586169406, "eval_label.LOC.f1": 0.9566717536991572, "eval_label.LOC.p": 0.9520602218700476, "eval_label.LOC.r": 0.9613281770902787, "eval_label.MISC.f1": 0.8213117307991898, "eval_label.MISC.p": 0.8053773296669722, "eval_label.MISC.r": 0.8378893833439288, "eval_label.ORG.f1": 0.9023171285779191, "eval_label.ORG.p": 0.8875316549977655, "eval_label.ORG.r": 0.9176035730787001, "eval_label.PER.f1": 0.9286171802718668, "eval_label.PER.p": 0.9201692524682652, "eval_label.PER.r": 0.9372216635540871, "eval_loss": 0.053501419723033905, "eval_p": 0.9058341447581953, "eval_r": 0.9264699780073862, "eval_runtime": 32.9114, "eval_samples_per_second": 548.625, "eval_steps_per_second": 17.167, "step": 25686 }, { "epoch": 7.0, "grad_norm": 0.4229598343372345, "learning_rate": 1.3830173206431251e-05, "loss": 0.025886756631431945, "step": 29967 }, { "epoch": 7.0, "eval_acc": 0.9871747501867955, "eval_f1": 0.9166171437939302, "eval_label.LOC.f1": 0.9542040545031572, "eval_label.LOC.p": 0.9512324410283594, "eval_label.LOC.r": 0.957194292572343, "eval_label.MISC.f1": 0.8256130790190737, "eval_label.MISC.p": 0.7881502890173411, "eval_label.MISC.r": 0.8668150031786396, "eval_label.ORG.f1": 0.9035007610350075, "eval_label.ORG.p": 0.8930344516323153, "eval_label.ORG.r": 0.914215308794086, "eval_label.PER.f1": 0.9314677327241576, "eval_label.PER.p": 0.9257840215694622, "eval_label.PER.r": 0.9372216635540871, "eval_loss": 0.059339962899684906, "eval_p": 0.9054655870445344, "eval_r": 0.928046806921449, "eval_runtime": 32.612, "eval_samples_per_second": 553.661, "eval_steps_per_second": 17.325, "step": 29967 }, { "epoch": 8.0, "grad_norm": 0.656637966632843, "learning_rate": 1.2766332844611218e-05, "loss": 0.02074824090149881, "step": 34248 }, { "epoch": 8.0, "eval_acc": 0.987262331918341, "eval_f1": 0.9183782232607716, "eval_label.LOC.f1": 0.9538971807628523, "eval_label.LOC.p": 0.9490496304118268, "eval_label.LOC.r": 0.9587945059341245, "eval_label.MISC.f1": 0.8343888537048765, "eval_label.MISC.p": 0.831230283911672, "eval_label.MISC.r": 0.8375715193897012, "eval_label.ORG.f1": 0.8998067489222537, "eval_label.ORG.p": 0.8695589714121534, "eval_label.ORG.r": 0.932234714307716, "eval_label.PER.f1": 0.9359443368481457, "eval_label.PER.p": 0.9346704871060172, "eval_label.PER.r": 0.9372216635540871, "eval_loss": 0.06151953712105751, "eval_p": 0.907441163365334, "eval_r": 0.9295821403377733, "eval_runtime": 32.5433, "eval_samples_per_second": 554.83, "eval_steps_per_second": 17.361, "step": 34248 }, { "epoch": 9.0, "grad_norm": 1.0659022331237793, "learning_rate": 1.1702492482791184e-05, "loss": 0.01647565521332906, "step": 38529 }, { "epoch": 9.0, "eval_acc": 0.987234962627233, "eval_f1": 0.9183171361791118, "eval_label.LOC.f1": 0.9529481834425253, "eval_label.LOC.p": 0.9458749343142406, "eval_label.LOC.r": 0.9601280170689426, "eval_label.MISC.f1": 0.8366175329712956, "eval_label.MISC.p": 0.8172173385874507, "eval_label.MISC.r": 0.8569612205975843, "eval_label.ORG.f1": 0.9041033779188392, "eval_label.ORG.p": 0.8875370919881306, "eval_label.ORG.r": 0.9212998613891884, "eval_label.PER.f1": 0.9319985698963175, "eval_label.PER.p": 0.9278189066059226, "eval_label.PER.r": 0.9362160609107887, "eval_loss": 0.06663035601377487, "eval_p": 0.9075987841945289, "eval_r": 0.9292916718536038, "eval_runtime": 32.3615, "eval_samples_per_second": 557.947, "eval_steps_per_second": 17.459, "step": 38529 }, { "epoch": 10.0, "grad_norm": 0.06852112710475922, "learning_rate": 1.0638652120971149e-05, "loss": 0.012914503882126786, "step": 42810 }, { "epoch": 10.0, "eval_acc": 0.9880013027782567, "eval_f1": 0.9225139285787711, "eval_label.LOC.f1": 0.9541126686061888, "eval_label.LOC.p": 0.9462295081967214, "eval_label.LOC.r": 0.9621282837711694, "eval_label.MISC.f1": 0.8479798773777708, "eval_label.MISC.p": 0.8388802488335926, "eval_label.MISC.r": 0.8572790845518118, "eval_label.ORG.f1": 0.9100626049778593, "eval_label.ORG.p": 0.9023467070401211, "eval_label.ORG.r": 0.9179115971045742, "eval_label.PER.f1": 0.933845497225779, "eval_label.PER.p": 0.924897844159504, "eval_label.PER.r": 0.942967964372935, "eval_loss": 0.07016361504793167, "eval_p": 0.9141879227446826, "eval_r": 0.9309929872608822, "eval_runtime": 32.9069, "eval_samples_per_second": 548.699, "eval_steps_per_second": 17.17, "step": 42810 }, { "epoch": 11.0, "grad_norm": 1.4090399742126465, "learning_rate": 9.574811759151116e-06, "loss": 0.010248644444965309, "step": 47091 }, { "epoch": 11.0, "eval_acc": 0.9879328795504868, "eval_f1": 0.9214825151863405, "eval_label.LOC.f1": 0.9554612937433723, "eval_label.LOC.p": 0.9497957570167348, "eval_label.LOC.r": 0.961194825976797, "eval_label.MISC.f1": 0.8431096511809792, "eval_label.MISC.p": 0.8299969202340622, "eval_label.MISC.r": 0.8566433566433567, "eval_label.ORG.f1": 0.9066000605510142, "eval_label.ORG.p": 0.8913528798928412, "eval_label.ORG.r": 0.9223779454797474, "eval_label.PER.f1": 0.9346633416458853, "eval_label.PER.p": 0.9271981905569692, "eval_label.PER.r": 0.9422496767705789, "eval_loss": 0.07261578738689423, "eval_p": 0.911567664135775, "eval_r": 0.9316154197269596, "eval_runtime": 32.2895, "eval_samples_per_second": 559.191, "eval_steps_per_second": 17.498, "step": 47091 }, { "epoch": 12.0, "grad_norm": 2.3597915172576904, "learning_rate": 8.510971397331081e-06, "loss": 0.008314984113750711, "step": 51372 }, { "epoch": 12.0, "eval_acc": 0.9877330837253985, "eval_f1": 0.9202380952380953, "eval_label.LOC.f1": 0.9561705508474576, "eval_label.LOC.p": 0.9495069033530572, "eval_label.LOC.r": 0.9629283904520602, "eval_label.MISC.f1": 0.8422717924379053, "eval_label.MISC.p": 0.8384251968503937, "eval_label.MISC.r": 0.8461538461538461, "eval_label.ORG.f1": 0.9035845795446007, "eval_label.ORG.p": 0.882301144702084, "eval_label.ORG.r": 0.9259202217772986, "eval_label.PER.f1": 0.932513583071204, "eval_label.PER.p": 0.9281343389782268, "eval_label.PER.r": 0.9369343485131446, "eval_loss": 0.07839750498533249, "eval_p": 0.9104829210836278, "eval_r": 0.9302045728038508, "eval_runtime": 32.9029, "eval_samples_per_second": 548.767, "eval_steps_per_second": 17.172, "step": 51372 }, { "epoch": 13.0, "grad_norm": 0.18180809915065765, "learning_rate": 7.4471310355110474e-06, "loss": 0.006686228676617521, "step": 55653 }, { "epoch": 13.0, "eval_acc": 0.9875524464040857, "eval_f1": 0.9198900693219574, "eval_label.LOC.f1": 0.9554880464931977, "eval_label.LOC.p": 0.9464869815517467, "eval_label.LOC.r": 0.9646619549273237, "eval_label.MISC.f1": 0.8379507816127534, "eval_label.MISC.p": 0.8165912518853695, "eval_label.MISC.r": 0.8604577240940877, "eval_label.ORG.f1": 0.9057290087905425, "eval_label.ORG.p": 0.8915411009995524, "eval_label.ORG.r": 0.9203757893115663, "eval_label.PER.f1": 0.9325882942904218, "eval_label.PER.p": 0.93012289225493, "eval_label.PER.r": 0.9350668007470191, "eval_loss": 0.08158153295516968, "eval_p": 0.9094448274463685, "eval_r": 0.9305780322834972, "eval_runtime": 32.4013, "eval_samples_per_second": 557.261, "eval_steps_per_second": 17.438, "step": 55653 }, { "epoch": 14.0, "grad_norm": 0.18500462174415588, "learning_rate": 6.383290673691012e-06, "loss": 0.005471784470933978, "step": 59934 }, { "epoch": 14.0, "eval_acc": 0.9871911717614602, "eval_f1": 0.9195246875640237, "eval_label.LOC.f1": 0.9548378539690962, "eval_label.LOC.p": 0.9497361477572559, "eval_label.LOC.r": 0.9599946659554607, "eval_label.MISC.f1": 0.8372093023255813, "eval_label.MISC.p": 0.8171912832929782, "eval_label.MISC.r": 0.8582326764144946, "eval_label.ORG.f1": 0.90653782273894, "eval_label.ORG.p": 0.8890863320005923, "eval_label.ORG.r": 0.9246881256738025, "eval_label.PER.f1": 0.9316708229426433, "eval_label.PER.p": 0.9242295730845349, "eval_label.PER.r": 0.9392328688406838, "eval_loss": 0.08883294463157654, "eval_p": 0.9081380761604144, "eval_r": 0.9312004647495746, "eval_runtime": 32.3818, "eval_samples_per_second": 557.597, "eval_steps_per_second": 17.448, "step": 59934 }, { "epoch": 15.0, "grad_norm": 0.22286078333854675, "learning_rate": 5.319450311870977e-06, "loss": 0.004570412318357322, "step": 64215 }, { "epoch": 15.0, "eval_acc": 0.988053304431362, "eval_f1": 0.9238630978137686, "eval_label.LOC.f1": 0.9564351175454908, "eval_label.LOC.p": 0.9526392379944437, "eval_label.LOC.r": 0.9602613681824244, "eval_label.MISC.f1": 0.8461170467230107, "eval_label.MISC.p": 0.84896, "eval_label.MISC.r": 0.8432930705657978, "eval_label.ORG.f1": 0.9100128661167033, "eval_label.ORG.p": 0.8946428571428572, "eval_label.ORG.r": 0.9259202217772986, "eval_label.PER.f1": 0.9367360068625348, "eval_label.PER.p": 0.9322709163346613, "eval_label.PER.r": 0.9412440741272806, "eval_loss": 0.0887371227145195, "eval_p": 0.9175671250818599, "eval_r": 0.9302460683015893, "eval_runtime": 32.8226, "eval_samples_per_second": 550.109, "eval_steps_per_second": 17.214, "step": 64215 }, { "epoch": 16.0, "grad_norm": 0.09178588539361954, "learning_rate": 4.255609950050943e-06, "loss": 0.003622644723394546, "step": 68496 }, { "epoch": 16.0, "eval_acc": 0.9879684596289271, "eval_f1": 0.9229315974289998, "eval_label.LOC.f1": 0.9551214361140442, "eval_label.LOC.p": 0.9455115640925127, "eval_label.LOC.r": 0.9649286571542872, "eval_label.MISC.f1": 0.8459366175086288, "eval_label.MISC.p": 0.8351920693928129, "eval_label.MISC.r": 0.8569612205975843, "eval_label.ORG.f1": 0.9098784194528875, "eval_label.ORG.p": 0.8980050997450127, "eval_label.ORG.r": 0.9220699214538735, "eval_label.PER.f1": 0.9354078937977304, "eval_label.PER.p": 0.9295035460992908, "eval_label.PER.r": 0.9413877316477518, "eval_loss": 0.09383999556303024, "eval_p": 0.913570208960078, "eval_r": 0.932486825179468, "eval_runtime": 32.431, "eval_samples_per_second": 556.751, "eval_steps_per_second": 17.422, "step": 68496 }, { "epoch": 17.0, "grad_norm": 0.5162076354026794, "learning_rate": 3.191769588230909e-06, "loss": 0.002951568544704595, "step": 72777 }, { "epoch": 17.0, "eval_acc": 0.9879985658491459, "eval_f1": 0.9234442866259083, "eval_label.LOC.f1": 0.9560388708931051, "eval_label.LOC.p": 0.947954902988988, "eval_label.LOC.r": 0.9642619015868783, "eval_label.MISC.f1": 0.8496981251986019, "eval_label.MISC.p": 0.849428208386277, "eval_label.MISC.r": 0.8499682136045772, "eval_label.ORG.f1": 0.910155952833777, "eval_label.ORG.p": 0.8992784125075165, "eval_label.ORG.r": 0.9212998613891884, "eval_label.PER.f1": 0.9338471419396276, "eval_label.PER.p": 0.9278218944980148, "eval_label.PER.r": 0.9399511564430398, "eval_loss": 0.09467604756355286, "eval_p": 0.9162581699346405, "eval_r": 0.9307440142744512, "eval_runtime": 32.3822, "eval_samples_per_second": 557.59, "eval_steps_per_second": 17.448, "step": 72777 }, { "epoch": 18.0, "grad_norm": 0.003633791347965598, "learning_rate": 2.127929226410875e-06, "loss": 0.0021125146981239096, "step": 77058 }, { "epoch": 18.0, "eval_acc": 0.9878316131733872, "eval_f1": 0.9223450284003527, "eval_label.LOC.f1": 0.9541914191419141, "eval_label.LOC.p": 0.9447131093974643, "eval_label.LOC.r": 0.9638618482464328, "eval_label.MISC.f1": 0.8473520249221183, "eval_label.MISC.p": 0.8307880268784361, "eval_label.MISC.r": 0.8645899554990464, "eval_label.ORG.f1": 0.9091460640072804, "eval_label.ORG.p": 0.8955625280143433, "eval_label.ORG.r": 0.9231480055444324, "eval_label.PER.f1": 0.9346941688673185, "eval_label.PER.p": 0.9287943262411348, "eval_label.PER.r": 0.9406694440453958, "eval_loss": 0.09958989918231964, "eval_p": 0.9117074752716069, "eval_r": 0.9332337441387609, "eval_runtime": 32.3603, "eval_samples_per_second": 557.968, "eval_steps_per_second": 17.46, "step": 77058 }, { "epoch": 19.0, "grad_norm": 0.0006278403452597558, "learning_rate": 1.0640888645908402e-06, "loss": 0.0016824499075447836, "step": 81339 }, { "epoch": 19.0, "eval_acc": 0.9881053060844671, "eval_f1": 0.92369345855854, "eval_label.LOC.f1": 0.9557276156442328, "eval_label.LOC.p": 0.9486337362059906, "eval_label.LOC.r": 0.9629283904520602, "eval_label.MISC.f1": 0.8502278799308502, "eval_label.MISC.p": 0.8408455082374884, "eval_label.MISC.r": 0.8598219961856326, "eval_label.ORG.f1": 0.911369332421964, "eval_label.ORG.p": 0.8990110878034162, "eval_label.ORG.r": 0.9240720776220546, "eval_label.PER.f1": 0.9340847481809103, "eval_label.PER.p": 0.9277313305937367, "eval_label.PER.r": 0.9405257865249246, "eval_loss": 0.09979883581399918, "eval_p": 0.9150244299674267, "eval_r": 0.9325283206772065, "eval_runtime": 32.7242, "eval_samples_per_second": 551.763, "eval_steps_per_second": 17.265, "step": 81339 }, { "epoch": 20.0, "grad_norm": 0.0003999824111815542, "learning_rate": 2.485027708058945e-10, "loss": 0.0014637853742286275, "step": 85620 }, { "epoch": 20.0, "eval_acc": 0.9881107799426887, "eval_f1": 0.9238326208484051, "eval_label.LOC.f1": 0.9561130601707817, "eval_label.LOC.p": 0.9492639327024185, "eval_label.LOC.r": 0.963061741565542, "eval_label.MISC.f1": 0.8494572911750827, "eval_label.MISC.p": 0.8408595453129866, "eval_label.MISC.r": 0.8582326764144946, "eval_label.ORG.f1": 0.9107603581727122, "eval_label.ORG.p": 0.8976813762154077, "eval_label.ORG.r": 0.9242260896349915, "eval_label.PER.f1": 0.935064935064935, "eval_label.PER.p": 0.9289663972777541, "eval_label.PER.r": 0.9412440741272806, "eval_loss": 0.10018600523471832, "eval_p": 0.9152176568799121, "eval_r": 0.9326113116726835, "eval_runtime": 32.2631, "eval_samples_per_second": 559.649, "eval_steps_per_second": 17.512, "step": 85620 }, { "epoch": 20.0, "step": 85620, "total_flos": 1.3381069410175074e+17, "train_loss": 0.040764350686165754, "train_runtime": 15630.4696, "train_samples_per_second": 175.264, "train_steps_per_second": 5.478 } ], "logging_steps": 500, "max_steps": 85620, "num_input_tokens_seen": 0, "num_train_epochs": 20, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.3381069410175074e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }