{ "best_global_step": 366, "best_metric": 0.41911664605140686, "best_model_checkpoint": "training_output/run_20260713_203733/model/checkpoint-366", "epoch": 3.0, "eval_steps": 500, "global_step": 1098, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0273224043715847, "grad_norm": 4.927176475524902, "learning_rate": 7.377049180327868e-07, "loss": 0.6899909496307373, "step": 10 }, { "epoch": 0.0546448087431694, "grad_norm": 6.0230512619018555, "learning_rate": 1.557377049180328e-06, "loss": 0.7346426486968994, "step": 20 }, { "epoch": 0.08196721311475409, "grad_norm": 6.2535271644592285, "learning_rate": 2.377049180327869e-06, "loss": 0.6693419456481934, "step": 30 }, { "epoch": 0.1092896174863388, "grad_norm": 10.038297653198242, "learning_rate": 3.1967213114754097e-06, "loss": 0.6888828277587891, "step": 40 }, { "epoch": 0.1366120218579235, "grad_norm": 10.041961669921875, "learning_rate": 4.016393442622951e-06, "loss": 0.623580026626587, "step": 50 }, { "epoch": 0.16393442622950818, "grad_norm": 9.107032775878906, "learning_rate": 4.836065573770492e-06, "loss": 0.692430830001831, "step": 60 }, { "epoch": 0.1912568306010929, "grad_norm": 9.090417861938477, "learning_rate": 5.655737704918032e-06, "loss": 0.6110644817352295, "step": 70 }, { "epoch": 0.2185792349726776, "grad_norm": 7.914913177490234, "learning_rate": 6.4754098360655735e-06, "loss": 0.6268288612365722, "step": 80 }, { "epoch": 0.2459016393442623, "grad_norm": 8.18041706085205, "learning_rate": 7.2950819672131145e-06, "loss": 0.6859075546264648, "step": 90 }, { "epoch": 0.273224043715847, "grad_norm": 5.7157392501831055, "learning_rate": 8.114754098360657e-06, "loss": 0.7717578887939454, "step": 100 }, { "epoch": 0.3005464480874317, "grad_norm": 11.109936714172363, "learning_rate": 8.934426229508197e-06, "loss": 0.6476659774780273, "step": 110 }, { "epoch": 0.32786885245901637, "grad_norm": 10.369423866271973, "learning_rate": 9.754098360655738e-06, "loss": 0.6707509994506836, "step": 120 }, { "epoch": 0.3551912568306011, "grad_norm": 10.730874061584473, "learning_rate": 1.0573770491803279e-05, "loss": 0.6787842750549317, "step": 130 }, { "epoch": 0.3825136612021858, "grad_norm": 8.120079040527344, "learning_rate": 1.139344262295082e-05, "loss": 0.6765446186065673, "step": 140 }, { "epoch": 0.4098360655737705, "grad_norm": 14.429889678955078, "learning_rate": 1.221311475409836e-05, "loss": 0.623370361328125, "step": 150 }, { "epoch": 0.4371584699453552, "grad_norm": 9.193517684936523, "learning_rate": 1.3032786885245902e-05, "loss": 0.6362186908721924, "step": 160 }, { "epoch": 0.4644808743169399, "grad_norm": 8.7772855758667, "learning_rate": 1.3852459016393443e-05, "loss": 0.6641538619995118, "step": 170 }, { "epoch": 0.4918032786885246, "grad_norm": 5.2151780128479, "learning_rate": 1.4672131147540984e-05, "loss": 0.6653701782226562, "step": 180 }, { "epoch": 0.5191256830601093, "grad_norm": 17.197834014892578, "learning_rate": 1.5491803278688525e-05, "loss": 0.6582591533660889, "step": 190 }, { "epoch": 0.546448087431694, "grad_norm": 7.26473331451416, "learning_rate": 1.6311475409836068e-05, "loss": 0.765175724029541, "step": 200 }, { "epoch": 0.5737704918032787, "grad_norm": 5.47290563583374, "learning_rate": 1.7131147540983607e-05, "loss": 0.676247501373291, "step": 210 }, { "epoch": 0.6010928961748634, "grad_norm": 4.55684232711792, "learning_rate": 1.7950819672131146e-05, "loss": 0.6748649597167968, "step": 220 }, { "epoch": 0.6284153005464481, "grad_norm": 9.52070140838623, "learning_rate": 1.877049180327869e-05, "loss": 0.7023877143859864, "step": 230 }, { "epoch": 0.6557377049180327, "grad_norm": 10.813623428344727, "learning_rate": 1.959016393442623e-05, "loss": 0.5075790405273437, "step": 240 }, { "epoch": 0.6830601092896175, "grad_norm": 15.77322769165039, "learning_rate": 2.040983606557377e-05, "loss": 0.5947454929351806, "step": 250 }, { "epoch": 0.7103825136612022, "grad_norm": 14.141736030578613, "learning_rate": 2.122950819672131e-05, "loss": 0.7629669666290283, "step": 260 }, { "epoch": 0.7377049180327869, "grad_norm": 0.5761239528656006, "learning_rate": 2.2049180327868853e-05, "loss": 0.717600679397583, "step": 270 }, { "epoch": 0.7650273224043715, "grad_norm": 13.026739120483398, "learning_rate": 2.2868852459016393e-05, "loss": 1.5919431686401366, "step": 280 }, { "epoch": 0.7923497267759563, "grad_norm": 12.15133285522461, "learning_rate": 2.3688524590163936e-05, "loss": 0.6558570861816406, "step": 290 }, { "epoch": 0.819672131147541, "grad_norm": 20.35292625427246, "learning_rate": 2.4508196721311478e-05, "loss": 0.6991987705230713, "step": 300 }, { "epoch": 0.8469945355191257, "grad_norm": 9.59134292602539, "learning_rate": 2.5327868852459018e-05, "loss": 1.1239334106445313, "step": 310 }, { "epoch": 0.8743169398907104, "grad_norm": 4.265232086181641, "learning_rate": 2.6147540983606557e-05, "loss": 0.4866987705230713, "step": 320 }, { "epoch": 0.9016393442622951, "grad_norm": 9.87460708618164, "learning_rate": 2.69672131147541e-05, "loss": 0.7435293674468995, "step": 330 }, { "epoch": 0.9289617486338798, "grad_norm": 12.707701683044434, "learning_rate": 2.7786885245901642e-05, "loss": 0.9141542434692382, "step": 340 }, { "epoch": 0.9562841530054644, "grad_norm": 2.9138967990875244, "learning_rate": 2.860655737704918e-05, "loss": 0.5319347858428956, "step": 350 }, { "epoch": 0.9836065573770492, "grad_norm": 6.917504787445068, "learning_rate": 2.942622950819672e-05, "loss": 0.5438683509826661, "step": 360 }, { "epoch": 1.0, "eval_accuracy": 0.8492, "eval_confusion_matrix": [ [ 282, 0 ], [ 54, 22 ] ], "eval_f1": 0.449, "eval_loss": 0.41911664605140686, "eval_pr_auc": 0.6187, "eval_precision": 1.0, "eval_recall": 0.2895, "eval_roc_auc": 0.7485, "eval_runtime": 138.7598, "eval_samples_per_second": 2.58, "eval_steps_per_second": 0.649, "step": 366 }, { "epoch": 1.010928961748634, "grad_norm": 6.519931316375732, "learning_rate": 2.9972677595628417e-05, "loss": 0.796769380569458, "step": 370 }, { "epoch": 1.0382513661202186, "grad_norm": 4.874457359313965, "learning_rate": 2.98816029143898e-05, "loss": 0.398636531829834, "step": 380 }, { "epoch": 1.0655737704918034, "grad_norm": 15.488590240478516, "learning_rate": 2.9790528233151184e-05, "loss": 0.7061968803405761, "step": 390 }, { "epoch": 1.092896174863388, "grad_norm": 19.74693489074707, "learning_rate": 2.9699453551912568e-05, "loss": 0.5211454391479492, "step": 400 }, { "epoch": 1.1202185792349726, "grad_norm": 2.513188362121582, "learning_rate": 2.9608378870673954e-05, "loss": 0.7898036003112793, "step": 410 }, { "epoch": 1.1475409836065573, "grad_norm": 25.31527328491211, "learning_rate": 2.9517304189435338e-05, "loss": 0.8195189476013184, "step": 420 }, { "epoch": 1.174863387978142, "grad_norm": 26.276199340820312, "learning_rate": 2.942622950819672e-05, "loss": 0.8042145729064941, "step": 430 }, { "epoch": 1.2021857923497268, "grad_norm": 19.838821411132812, "learning_rate": 2.9335154826958105e-05, "loss": 0.5532180786132812, "step": 440 }, { "epoch": 1.2295081967213115, "grad_norm": 1.5704028606414795, "learning_rate": 2.924408014571949e-05, "loss": 0.46767144203186034, "step": 450 }, { "epoch": 1.2568306010928962, "grad_norm": 0.24576333165168762, "learning_rate": 2.9153005464480875e-05, "loss": 0.7125775337219238, "step": 460 }, { "epoch": 1.2841530054644807, "grad_norm": 2.8051435947418213, "learning_rate": 2.9061930783242258e-05, "loss": 1.4706084251403808, "step": 470 }, { "epoch": 1.3114754098360657, "grad_norm": 2.1515614986419678, "learning_rate": 2.897085610200364e-05, "loss": 0.740934181213379, "step": 480 }, { "epoch": 1.3387978142076502, "grad_norm": 5.335806846618652, "learning_rate": 2.8879781420765028e-05, "loss": 0.5567354679107666, "step": 490 }, { "epoch": 1.366120218579235, "grad_norm": 9.499934196472168, "learning_rate": 2.878870673952641e-05, "loss": 0.5102160930633545, "step": 500 }, { "epoch": 1.3934426229508197, "grad_norm": 0.30213791131973267, "learning_rate": 2.8697632058287795e-05, "loss": 0.8127809524536133, "step": 510 }, { "epoch": 1.4207650273224044, "grad_norm": 17.827165603637695, "learning_rate": 2.860655737704918e-05, "loss": 1.3400749206542968, "step": 520 }, { "epoch": 1.4480874316939891, "grad_norm": 2.58740234375, "learning_rate": 2.8515482695810565e-05, "loss": 0.5003597736358643, "step": 530 }, { "epoch": 1.4754098360655736, "grad_norm": 22.007869720458984, "learning_rate": 2.842440801457195e-05, "loss": 1.6859323501586914, "step": 540 }, { "epoch": 1.5027322404371586, "grad_norm": 14.658230781555176, "learning_rate": 2.8333333333333332e-05, "loss": 0.9195033073425293, "step": 550 }, { "epoch": 1.530054644808743, "grad_norm": 1.4521483182907104, "learning_rate": 2.8242258652094715e-05, "loss": 0.4108741283416748, "step": 560 }, { "epoch": 1.5573770491803278, "grad_norm": 10.377533912658691, "learning_rate": 2.8151183970856102e-05, "loss": 0.655418586730957, "step": 570 }, { "epoch": 1.5846994535519126, "grad_norm": 0.5859184265136719, "learning_rate": 2.8060109289617486e-05, "loss": 1.2600435256958007, "step": 580 }, { "epoch": 1.6120218579234973, "grad_norm": 0.8876230120658875, "learning_rate": 2.796903460837887e-05, "loss": 1.0982278823852538, "step": 590 }, { "epoch": 1.639344262295082, "grad_norm": 13.285502433776855, "learning_rate": 2.7877959927140256e-05, "loss": 0.6685476779937745, "step": 600 }, { "epoch": 1.6666666666666665, "grad_norm": 0.6555774211883545, "learning_rate": 2.7786885245901642e-05, "loss": 0.19812407493591308, "step": 610 }, { "epoch": 1.6939890710382515, "grad_norm": 2.7470834255218506, "learning_rate": 2.7695810564663026e-05, "loss": 1.1334525108337403, "step": 620 }, { "epoch": 1.721311475409836, "grad_norm": 14.42418098449707, "learning_rate": 2.760473588342441e-05, "loss": 0.9498401641845703, "step": 630 }, { "epoch": 1.748633879781421, "grad_norm": 57.35378646850586, "learning_rate": 2.7513661202185793e-05, "loss": 1.2678983688354493, "step": 640 }, { "epoch": 1.7759562841530054, "grad_norm": 0.7189310789108276, "learning_rate": 2.742258652094718e-05, "loss": 0.6106186389923096, "step": 650 }, { "epoch": 1.8032786885245902, "grad_norm": 13.546385765075684, "learning_rate": 2.7331511839708563e-05, "loss": 1.4015119552612305, "step": 660 }, { "epoch": 1.830601092896175, "grad_norm": 8.754522323608398, "learning_rate": 2.7240437158469946e-05, "loss": 0.9790468215942383, "step": 670 }, { "epoch": 1.8579234972677594, "grad_norm": 13.214091300964355, "learning_rate": 2.7149362477231333e-05, "loss": 0.6752419948577881, "step": 680 }, { "epoch": 1.8852459016393444, "grad_norm": 2.506131887435913, "learning_rate": 2.7058287795992716e-05, "loss": 0.2787914752960205, "step": 690 }, { "epoch": 1.9125683060109289, "grad_norm": 0.4683574438095093, "learning_rate": 2.69672131147541e-05, "loss": 0.8134347915649414, "step": 700 }, { "epoch": 1.9398907103825138, "grad_norm": 0.8958243131637573, "learning_rate": 2.6876138433515483e-05, "loss": 0.4489922046661377, "step": 710 }, { "epoch": 1.9672131147540983, "grad_norm": 95.41824340820312, "learning_rate": 2.678506375227687e-05, "loss": 0.9731103897094726, "step": 720 }, { "epoch": 1.994535519125683, "grad_norm": 0.7653670907020569, "learning_rate": 2.6693989071038253e-05, "loss": 1.0658687591552733, "step": 730 }, { "epoch": 2.0, "eval_accuracy": 0.8659, "eval_confusion_matrix": [ [ 281, 1 ], [ 47, 29 ] ], "eval_f1": 0.5472, "eval_loss": 0.45224741101264954, "eval_pr_auc": 0.6674, "eval_precision": 0.9667, "eval_recall": 0.3816, "eval_roc_auc": 0.8086, "eval_runtime": 137.9939, "eval_samples_per_second": 2.594, "eval_steps_per_second": 0.652, "step": 732 }, { "epoch": 2.021857923497268, "grad_norm": 32.09031677246094, "learning_rate": 2.6602914389799637e-05, "loss": 0.7306198120117188, "step": 740 }, { "epoch": 2.0491803278688523, "grad_norm": 51.15188217163086, "learning_rate": 2.651183970856102e-05, "loss": 0.49246606826782224, "step": 750 }, { "epoch": 2.0765027322404372, "grad_norm": 0.5293377041816711, "learning_rate": 2.6420765027322407e-05, "loss": 0.30229816436767576, "step": 760 }, { "epoch": 2.1038251366120218, "grad_norm": 0.5600886344909668, "learning_rate": 2.632969034608379e-05, "loss": 1.428311824798584, "step": 770 }, { "epoch": 2.1311475409836067, "grad_norm": 8.111888885498047, "learning_rate": 2.6238615664845174e-05, "loss": 0.7316344738006592, "step": 780 }, { "epoch": 2.158469945355191, "grad_norm": 9.91689682006836, "learning_rate": 2.6147540983606557e-05, "loss": 0.7728833198547364, "step": 790 }, { "epoch": 2.185792349726776, "grad_norm": 24.687915802001953, "learning_rate": 2.6056466302367944e-05, "loss": 0.6872700691223145, "step": 800 }, { "epoch": 2.2131147540983607, "grad_norm": 15.530792236328125, "learning_rate": 2.5965391621129327e-05, "loss": 0.8627532005310059, "step": 810 }, { "epoch": 2.240437158469945, "grad_norm": 0.7304887175559998, "learning_rate": 2.587431693989071e-05, "loss": 0.5328950405120849, "step": 820 }, { "epoch": 2.26775956284153, "grad_norm": 52.83394241333008, "learning_rate": 2.5783242258652094e-05, "loss": 0.45772466659545896, "step": 830 }, { "epoch": 2.2950819672131146, "grad_norm": 23.795230865478516, "learning_rate": 2.569216757741348e-05, "loss": 0.6016922950744629, "step": 840 }, { "epoch": 2.3224043715846996, "grad_norm": 22.11771011352539, "learning_rate": 2.5601092896174864e-05, "loss": 0.5151076316833496, "step": 850 }, { "epoch": 2.349726775956284, "grad_norm": 0.44267675280570984, "learning_rate": 2.5510018214936247e-05, "loss": 0.9358211517333984, "step": 860 }, { "epoch": 2.3770491803278686, "grad_norm": 0.3188877999782562, "learning_rate": 2.541894353369763e-05, "loss": 0.46982393264770506, "step": 870 }, { "epoch": 2.4043715846994536, "grad_norm": 0.409311980009079, "learning_rate": 2.5327868852459018e-05, "loss": 0.5571242332458496, "step": 880 }, { "epoch": 2.431693989071038, "grad_norm": 0.22160018980503082, "learning_rate": 2.52367941712204e-05, "loss": 0.686149263381958, "step": 890 }, { "epoch": 2.459016393442623, "grad_norm": 56.0511360168457, "learning_rate": 2.5145719489981784e-05, "loss": 0.4332759857177734, "step": 900 }, { "epoch": 2.4863387978142075, "grad_norm": 14.211305618286133, "learning_rate": 2.5054644808743168e-05, "loss": 0.46988306045532224, "step": 910 }, { "epoch": 2.5136612021857925, "grad_norm": 0.394004762172699, "learning_rate": 2.4963570127504555e-05, "loss": 0.3961897611618042, "step": 920 }, { "epoch": 2.540983606557377, "grad_norm": 56.96977233886719, "learning_rate": 2.4872495446265938e-05, "loss": 1.283346939086914, "step": 930 }, { "epoch": 2.5683060109289615, "grad_norm": 24.957056045532227, "learning_rate": 2.478142076502732e-05, "loss": 0.8271417617797852, "step": 940 }, { "epoch": 2.5956284153005464, "grad_norm": 1.057257056236267, "learning_rate": 2.4690346083788705e-05, "loss": 1.5506049156188966, "step": 950 }, { "epoch": 2.6229508196721314, "grad_norm": 2.8221116065979004, "learning_rate": 2.459927140255009e-05, "loss": 0.5170619487762451, "step": 960 }, { "epoch": 2.650273224043716, "grad_norm": 9.166945457458496, "learning_rate": 2.4508196721311478e-05, "loss": 1.0213055610656738, "step": 970 }, { "epoch": 2.6775956284153004, "grad_norm": 13.581059455871582, "learning_rate": 2.441712204007286e-05, "loss": 0.604024600982666, "step": 980 }, { "epoch": 2.7049180327868854, "grad_norm": 0.4070906639099121, "learning_rate": 2.4326047358834245e-05, "loss": 0.7995193481445313, "step": 990 }, { "epoch": 2.73224043715847, "grad_norm": 0.3183801472187042, "learning_rate": 2.4234972677595632e-05, "loss": 0.7718863487243652, "step": 1000 }, { "epoch": 2.7595628415300544, "grad_norm": 15.769966125488281, "learning_rate": 2.4143897996357015e-05, "loss": 0.7727096080780029, "step": 1010 }, { "epoch": 2.7868852459016393, "grad_norm": 13.82215690612793, "learning_rate": 2.40528233151184e-05, "loss": 0.6281228542327881, "step": 1020 }, { "epoch": 2.8142076502732243, "grad_norm": 0.24273018538951874, "learning_rate": 2.3961748633879782e-05, "loss": 0.7842752933502197, "step": 1030 }, { "epoch": 2.841530054644809, "grad_norm": 0.21391047537326813, "learning_rate": 2.387067395264117e-05, "loss": 0.8222448348999023, "step": 1040 }, { "epoch": 2.8688524590163933, "grad_norm": 0.5637283325195312, "learning_rate": 2.3779599271402552e-05, "loss": 1.0477510452270509, "step": 1050 }, { "epoch": 2.8961748633879782, "grad_norm": 0.2845185101032257, "learning_rate": 2.3688524590163936e-05, "loss": 0.6434628009796143, "step": 1060 }, { "epoch": 2.9234972677595628, "grad_norm": 1.1965957880020142, "learning_rate": 2.359744990892532e-05, "loss": 0.47115397453308105, "step": 1070 }, { "epoch": 2.9508196721311473, "grad_norm": 0.9190018773078918, "learning_rate": 2.3506375227686706e-05, "loss": 0.7713288784027099, "step": 1080 }, { "epoch": 2.978142076502732, "grad_norm": 1.0127384662628174, "learning_rate": 2.341530054644809e-05, "loss": 0.6314740657806397, "step": 1090 }, { "epoch": 3.0, "eval_accuracy": 0.8547, "eval_confusion_matrix": [ [ 277, 5 ], [ 47, 29 ] ], "eval_f1": 0.5273, "eval_loss": 0.498869389295578, "eval_pr_auc": 0.6438, "eval_precision": 0.8529, "eval_recall": 0.3816, "eval_roc_auc": 0.7867, "eval_runtime": 137.6925, "eval_samples_per_second": 2.6, "eval_steps_per_second": 0.654, "step": 1098 } ], "logging_steps": 10, "max_steps": 3660, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 2 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1155583755141120.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }