[ { "loss": 1.7251173400878905, "grad_norm": 2.5178136825561523, "learning_rate": 5.673352435530086e-06, "epoch": 0.14357501794687724, "step": 100 }, { "loss": 0.22405649185180665, "grad_norm": 1.808869481086731, "learning_rate": 1.1404011461318051e-05, "epoch": 0.2871500358937545, "step": 200 }, { "loss": 0.11055788040161132, "grad_norm": 3.0120017528533936, "learning_rate": 1.7134670487106017e-05, "epoch": 0.43072505384063176, "step": 300 }, { "loss": 0.07818803310394287, "grad_norm": 3.042083501815796, "learning_rate": 1.9681122448979592e-05, "epoch": 0.574300071787509, "step": 400 }, { "loss": 0.06936465740203858, "grad_norm": 1.3447211980819702, "learning_rate": 1.9043367346938777e-05, "epoch": 0.7178750897343862, "step": 500 }, { "loss": 0.051946673393249515, "grad_norm": 1.8753048181533813, "learning_rate": 1.8405612244897962e-05, "epoch": 0.8614501076812635, "step": 600 }, { "eval_loss": 0.018037041649222374, "eval_precision": 0.9465214161921268, "eval_recall": 0.961035696329814, "eval_f1": 0.9537233379069479, "eval_accuracy": 0.9950597210931149, "eval_runtime": 11.3523, "eval_samples_per_second": 122.619, "eval_steps_per_second": 7.664, "epoch": 1.0, "step": 697 }, { "loss": 0.04297860622406006, "grad_norm": 1.4369804859161377, "learning_rate": 1.7767857142857143e-05, "epoch": 1.0043072505384063, "step": 700 }, { "loss": 0.032263004779815675, "grad_norm": 0.48515579104423523, "learning_rate": 1.713010204081633e-05, "epoch": 1.1478822684852836, "step": 800 }, { "loss": 0.028692266941070556, "grad_norm": 1.310250997543335, "learning_rate": 1.6492346938775513e-05, "epoch": 1.2914572864321607, "step": 900 }, { "loss": 0.0251308012008667, "grad_norm": 1.0862822532653809, "learning_rate": 1.5854591836734695e-05, "epoch": 1.435032304379038, "step": 1000 }, { "loss": 0.02465754985809326, "grad_norm": 0.4208371639251709, "learning_rate": 1.5216836734693878e-05, "epoch": 1.5786073223259152, "step": 1100 }, { "loss": 0.020062971115112304, "grad_norm": 1.954458475112915, "learning_rate": 1.4579081632653063e-05, "epoch": 1.7221823402727925, "step": 1200 }, { "loss": 0.020207085609436036, "grad_norm": 1.907931923866272, "learning_rate": 1.3941326530612247e-05, "epoch": 1.8657573582196698, "step": 1300 }, { "eval_loss": 0.013158891350030899, "eval_precision": 0.9662698412698413, "eval_recall": 0.9793866264454499, "eval_f1": 0.9727840199750312, "eval_accuracy": 0.996998311550247, "eval_runtime": 11.3998, "eval_samples_per_second": 122.108, "eval_steps_per_second": 7.632, "epoch": 2.0, "step": 1394 }, { "loss": 0.016276423931121827, "grad_norm": 0.7246897220611572, "learning_rate": 1.3303571428571429e-05, "epoch": 2.0086145010768126, "step": 1400 }, { "loss": 0.010126489400863647, "grad_norm": 0.07916412502527237, "learning_rate": 1.2665816326530614e-05, "epoch": 2.1521895190236897, "step": 1500 }, { "loss": 0.011953834295272827, "grad_norm": 0.1269012987613678, "learning_rate": 1.2028061224489797e-05, "epoch": 2.2957645369705673, "step": 1600 }, { "loss": 0.00914982557296753, "grad_norm": 0.6635536551475525, "learning_rate": 1.139030612244898e-05, "epoch": 2.4393395549174444, "step": 1700 }, { "loss": 0.01329527735710144, "grad_norm": 2.2957067489624023, "learning_rate": 1.0752551020408165e-05, "epoch": 2.5829145728643215, "step": 1800 }, { "loss": 0.00799597442150116, "grad_norm": 0.40347203612327576, "learning_rate": 1.0114795918367348e-05, "epoch": 2.726489590811199, "step": 1900 }, { "loss": 0.013600579500198363, "grad_norm": 1.115879774093628, "learning_rate": 9.477040816326531e-06, "epoch": 2.870064608758076, "step": 2000 }, { "eval_loss": 0.010336230508983135, "eval_precision": 0.9729930624380575, "eval_recall": 0.9871794871794872, "eval_f1": 0.9800349388570002, "eval_accuracy": 0.9977018322806579, "eval_runtime": 11.3805, "eval_samples_per_second": 122.314, "eval_steps_per_second": 7.645, "epoch": 3.0, "step": 2091 }, { "loss": 0.007430664896965027, "grad_norm": 1.7394297122955322, "learning_rate": 8.839285714285714e-06, "epoch": 3.012921751615219, "step": 2100 }, { "loss": 0.005927992463111878, "grad_norm": 0.03791365772485733, "learning_rate": 8.201530612244899e-06, "epoch": 3.156496769562096, "step": 2200 }, { "loss": 0.005083958506584167, "grad_norm": 0.03876778110861778, "learning_rate": 7.563775510204082e-06, "epoch": 3.3000717875089736, "step": 2300 }, { "loss": 0.00475325345993042, "grad_norm": 0.046694278717041016, "learning_rate": 6.926020408163265e-06, "epoch": 3.4436468054558507, "step": 2400 }, { "loss": 0.003969300091266632, "grad_norm": 0.2219376564025879, "learning_rate": 6.288265306122449e-06, "epoch": 3.5872218234027278, "step": 2500 }, { "loss": 0.00385463148355484, "grad_norm": 0.2034495770931244, "learning_rate": 5.6505102040816325e-06, "epoch": 3.7307968413496053, "step": 2600 }, { "loss": 0.0038687247037887573, "grad_norm": 0.12553541362285614, "learning_rate": 5.012755102040817e-06, "epoch": 3.8743718592964824, "step": 2700 }, { "eval_loss": 0.009008657187223434, "eval_precision": 0.9792655508368724, "eval_recall": 0.9854198089492208, "eval_f1": 0.9823330409723093, "eval_accuracy": 0.9980614095428678, "eval_runtime": 11.3502, "eval_samples_per_second": 122.641, "eval_steps_per_second": 7.665, "epoch": 4.0, "step": 2788 }, { "loss": 0.004914677143096924, "grad_norm": 0.978706955909729, "learning_rate": 4.3750000000000005e-06, "epoch": 4.017229002153625, "step": 2800 }, { "loss": 0.002940036952495575, "grad_norm": 0.8705828189849854, "learning_rate": 3.737244897959184e-06, "epoch": 4.160804020100502, "step": 2900 }, { "loss": 0.0025027459859848023, "grad_norm": 0.07296314090490341, "learning_rate": 3.099489795918368e-06, "epoch": 4.304379038047379, "step": 3000 }, { "loss": 0.0016908496618270874, "grad_norm": 0.0873495489358902, "learning_rate": 2.461734693877551e-06, "epoch": 4.447954055994257, "step": 3100 }, { "loss": 0.0020018962025642397, "grad_norm": 1.0358140468597412, "learning_rate": 1.8239795918367347e-06, "epoch": 4.5915290739411345, "step": 3200 }, { "loss": 0.00347354382276535, "grad_norm": 0.00410356605425477, "learning_rate": 1.1862244897959185e-06, "epoch": 4.735104091888012, "step": 3300 }, { "loss": 0.0016965478658676147, "grad_norm": 0.19883082807064056, "learning_rate": 5.484693877551021e-07, "epoch": 4.878679109834889, "step": 3400 }, { "eval_loss": 0.009895444847643375, "eval_precision": 0.9785963165754107, "eval_recall": 0.9884364002011061, "eval_f1": 0.9834917458729364, "eval_accuracy": 0.9980926771308861, "eval_runtime": 11.5284, "eval_samples_per_second": 120.745, "eval_steps_per_second": 7.547, "epoch": 5.0, "step": 3485 }, { "train_runtime": 1386.8294, "train_samples_per_second": 40.164, "train_steps_per_second": 2.513, "total_flos": 2469820965329304.0, "train_loss": 0.07437319711513464, "epoch": 5.0, "step": 3485 } ]