| { |
| "best_metric": 6.367209434509277, |
| "best_model_checkpoint": "learning_source_20260316/genome_sequence/bert-output/genome_sequence-large/checkpoint-55000", |
| "epoch": 535.6726178924898, |
| "eval_steps": 100, |
| "global_step": 60000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.22179096201829776, |
| "grad_norm": 1.0070414543151855, |
| "learning_rate": 3e-06, |
| "loss": 8.0811, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.22179096201829776, |
| "eval_loss": 7.71008825302124, |
| "eval_runtime": 187.0287, |
| "eval_samples_per_second": 53.468, |
| "eval_steps_per_second": 6.683, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.4435819240365955, |
| "grad_norm": 0.8634200692176819, |
| "learning_rate": 6e-06, |
| "loss": 7.5417, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.4435819240365955, |
| "eval_loss": 7.327251434326172, |
| "eval_runtime": 187.1689, |
| "eval_samples_per_second": 53.428, |
| "eval_steps_per_second": 6.678, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.6653728860548933, |
| "grad_norm": 0.34057387709617615, |
| "learning_rate": 5.989966555183947e-06, |
| "loss": 7.2586, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.6653728860548933, |
| "eval_loss": 7.16713285446167, |
| "eval_runtime": 186.9919, |
| "eval_samples_per_second": 53.478, |
| "eval_steps_per_second": 6.685, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.887163848073191, |
| "grad_norm": 0.21436895430088043, |
| "learning_rate": 5.979933110367893e-06, |
| "loss": 7.1622, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.887163848073191, |
| "eval_loss": 7.128611087799072, |
| "eval_runtime": 186.9143, |
| "eval_samples_per_second": 53.5, |
| "eval_steps_per_second": 6.688, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.1089548100914888, |
| "grad_norm": 0.9315573573112488, |
| "learning_rate": 5.96989966555184e-06, |
| "loss": 7.1284, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.1089548100914888, |
| "eval_loss": 7.088557243347168, |
| "eval_runtime": 187.062, |
| "eval_samples_per_second": 53.458, |
| "eval_steps_per_second": 6.682, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.3307457721097866, |
| "grad_norm": 2.157287359237671, |
| "learning_rate": 5.959866220735786e-06, |
| "loss": 7.0934, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.3307457721097866, |
| "eval_loss": 7.06817102432251, |
| "eval_runtime": 187.1579, |
| "eval_samples_per_second": 53.431, |
| "eval_steps_per_second": 6.679, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.5525367341280842, |
| "grad_norm": 0.6227704286575317, |
| "learning_rate": 5.949832775919732e-06, |
| "loss": 7.0745, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.5525367341280842, |
| "eval_loss": 7.053982734680176, |
| "eval_runtime": 187.1727, |
| "eval_samples_per_second": 53.427, |
| "eval_steps_per_second": 6.678, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.774327696146382, |
| "grad_norm": 0.2588270902633667, |
| "learning_rate": 5.939799331103679e-06, |
| "loss": 7.0637, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.774327696146382, |
| "eval_loss": 7.0445451736450195, |
| "eval_runtime": 187.2068, |
| "eval_samples_per_second": 53.417, |
| "eval_steps_per_second": 6.677, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.9961186581646797, |
| "grad_norm": 0.23316305875778198, |
| "learning_rate": 5.929765886287626e-06, |
| "loss": 7.0551, |
| "step": 900 |
| }, |
| { |
| "epoch": 1.9961186581646797, |
| "eval_loss": 7.040402889251709, |
| "eval_runtime": 187.2019, |
| "eval_samples_per_second": 53.418, |
| "eval_steps_per_second": 6.677, |
| "step": 900 |
| }, |
| { |
| "epoch": 2.2179096201829775, |
| "grad_norm": 0.3035018742084503, |
| "learning_rate": 5.919732441471572e-06, |
| "loss": 7.047, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.2179096201829775, |
| "eval_loss": 7.034200191497803, |
| "eval_runtime": 187.0513, |
| "eval_samples_per_second": 53.461, |
| "eval_steps_per_second": 6.683, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.4397005822012754, |
| "grad_norm": 0.17462466657161713, |
| "learning_rate": 5.9096989966555185e-06, |
| "loss": 7.0445, |
| "step": 1100 |
| }, |
| { |
| "epoch": 2.4397005822012754, |
| "eval_loss": 7.031188488006592, |
| "eval_runtime": 187.3229, |
| "eval_samples_per_second": 53.384, |
| "eval_steps_per_second": 6.673, |
| "step": 1100 |
| }, |
| { |
| "epoch": 2.6614915442195732, |
| "grad_norm": 0.33147501945495605, |
| "learning_rate": 5.899665551839465e-06, |
| "loss": 7.0413, |
| "step": 1200 |
| }, |
| { |
| "epoch": 2.6614915442195732, |
| "eval_loss": 7.028659343719482, |
| "eval_runtime": 187.313, |
| "eval_samples_per_second": 53.387, |
| "eval_steps_per_second": 6.673, |
| "step": 1200 |
| }, |
| { |
| "epoch": 2.8832825062378706, |
| "grad_norm": 1.94842529296875, |
| "learning_rate": 5.889632107023412e-06, |
| "loss": 7.0407, |
| "step": 1300 |
| }, |
| { |
| "epoch": 2.8832825062378706, |
| "eval_loss": 7.033056259155273, |
| "eval_runtime": 187.18, |
| "eval_samples_per_second": 53.425, |
| "eval_steps_per_second": 6.678, |
| "step": 1300 |
| }, |
| { |
| "epoch": 3.1050734682561685, |
| "grad_norm": 0.31123045086860657, |
| "learning_rate": 5.879598662207358e-06, |
| "loss": 7.0399, |
| "step": 1400 |
| }, |
| { |
| "epoch": 3.1050734682561685, |
| "eval_loss": 7.026875019073486, |
| "eval_runtime": 194.8815, |
| "eval_samples_per_second": 51.313, |
| "eval_steps_per_second": 6.414, |
| "step": 1400 |
| }, |
| { |
| "epoch": 3.3268644302744663, |
| "grad_norm": 0.6879256367683411, |
| "learning_rate": 5.869565217391305e-06, |
| "loss": 7.0354, |
| "step": 1500 |
| }, |
| { |
| "epoch": 3.3268644302744663, |
| "eval_loss": 7.0256500244140625, |
| "eval_runtime": 186.9583, |
| "eval_samples_per_second": 53.488, |
| "eval_steps_per_second": 6.686, |
| "step": 1500 |
| }, |
| { |
| "epoch": 3.548655392292764, |
| "grad_norm": 0.6064356565475464, |
| "learning_rate": 5.8595317725752514e-06, |
| "loss": 7.0339, |
| "step": 1600 |
| }, |
| { |
| "epoch": 3.548655392292764, |
| "eval_loss": 7.025866985321045, |
| "eval_runtime": 187.1435, |
| "eval_samples_per_second": 53.435, |
| "eval_steps_per_second": 6.679, |
| "step": 1600 |
| }, |
| { |
| "epoch": 3.770446354311062, |
| "grad_norm": 0.7898679971694946, |
| "learning_rate": 5.849498327759197e-06, |
| "loss": 7.0324, |
| "step": 1700 |
| }, |
| { |
| "epoch": 3.770446354311062, |
| "eval_loss": 7.0187907218933105, |
| "eval_runtime": 187.196, |
| "eval_samples_per_second": 53.42, |
| "eval_steps_per_second": 6.677, |
| "step": 1700 |
| }, |
| { |
| "epoch": 3.9922373163293594, |
| "grad_norm": 0.9011751413345337, |
| "learning_rate": 5.839464882943144e-06, |
| "loss": 7.028, |
| "step": 1800 |
| }, |
| { |
| "epoch": 3.9922373163293594, |
| "eval_loss": 7.006008625030518, |
| "eval_runtime": 187.3528, |
| "eval_samples_per_second": 53.375, |
| "eval_steps_per_second": 6.672, |
| "step": 1800 |
| }, |
| { |
| "epoch": 4.214028278347658, |
| "grad_norm": 1.6079226732254028, |
| "learning_rate": 5.829431438127091e-06, |
| "loss": 7.011, |
| "step": 1900 |
| }, |
| { |
| "epoch": 4.214028278347658, |
| "eval_loss": 6.987495422363281, |
| "eval_runtime": 187.4062, |
| "eval_samples_per_second": 53.36, |
| "eval_steps_per_second": 6.67, |
| "step": 1900 |
| }, |
| { |
| "epoch": 4.435819240365955, |
| "grad_norm": 1.481960415840149, |
| "learning_rate": 5.819397993311037e-06, |
| "loss": 6.9459, |
| "step": 2000 |
| }, |
| { |
| "epoch": 4.435819240365955, |
| "eval_loss": 6.7907280921936035, |
| "eval_runtime": 187.5173, |
| "eval_samples_per_second": 53.328, |
| "eval_steps_per_second": 6.666, |
| "step": 2000 |
| }, |
| { |
| "epoch": 4.6576102023842525, |
| "grad_norm": 1.2325085401535034, |
| "learning_rate": 5.8093645484949836e-06, |
| "loss": 6.7706, |
| "step": 2100 |
| }, |
| { |
| "epoch": 4.6576102023842525, |
| "eval_loss": 6.649820327758789, |
| "eval_runtime": 187.8681, |
| "eval_samples_per_second": 53.229, |
| "eval_steps_per_second": 6.654, |
| "step": 2100 |
| }, |
| { |
| "epoch": 4.879401164402551, |
| "grad_norm": 0.5991578698158264, |
| "learning_rate": 5.79933110367893e-06, |
| "loss": 6.6775, |
| "step": 2200 |
| }, |
| { |
| "epoch": 4.879401164402551, |
| "eval_loss": 6.594548225402832, |
| "eval_runtime": 187.9284, |
| "eval_samples_per_second": 53.212, |
| "eval_steps_per_second": 6.651, |
| "step": 2200 |
| }, |
| { |
| "epoch": 5.101192126420848, |
| "grad_norm": 0.5165764093399048, |
| "learning_rate": 5.789297658862876e-06, |
| "loss": 6.6216, |
| "step": 2300 |
| }, |
| { |
| "epoch": 5.101192126420848, |
| "eval_loss": 6.557372570037842, |
| "eval_runtime": 187.4192, |
| "eval_samples_per_second": 53.356, |
| "eval_steps_per_second": 6.67, |
| "step": 2300 |
| }, |
| { |
| "epoch": 5.3229830884391465, |
| "grad_norm": 0.9580274820327759, |
| "learning_rate": 5.779264214046823e-06, |
| "loss": 6.5874, |
| "step": 2400 |
| }, |
| { |
| "epoch": 5.3229830884391465, |
| "eval_loss": 6.537918567657471, |
| "eval_runtime": 187.5204, |
| "eval_samples_per_second": 53.328, |
| "eval_steps_per_second": 6.666, |
| "step": 2400 |
| }, |
| { |
| "epoch": 5.544774050457444, |
| "grad_norm": 1.0393297672271729, |
| "learning_rate": 5.76923076923077e-06, |
| "loss": 6.5652, |
| "step": 2500 |
| }, |
| { |
| "epoch": 5.544774050457444, |
| "eval_loss": 6.521939754486084, |
| "eval_runtime": 187.4537, |
| "eval_samples_per_second": 53.347, |
| "eval_steps_per_second": 6.668, |
| "step": 2500 |
| }, |
| { |
| "epoch": 5.766565012475741, |
| "grad_norm": 0.9627366662025452, |
| "learning_rate": 5.759197324414716e-06, |
| "loss": 6.5446, |
| "step": 2600 |
| }, |
| { |
| "epoch": 5.766565012475741, |
| "eval_loss": 6.509204387664795, |
| "eval_runtime": 187.6214, |
| "eval_samples_per_second": 53.299, |
| "eval_steps_per_second": 6.662, |
| "step": 2600 |
| }, |
| { |
| "epoch": 5.98835597449404, |
| "grad_norm": 0.6260984539985657, |
| "learning_rate": 5.7491638795986624e-06, |
| "loss": 6.5315, |
| "step": 2700 |
| }, |
| { |
| "epoch": 5.98835597449404, |
| "eval_loss": 6.503715515136719, |
| "eval_runtime": 187.5274, |
| "eval_samples_per_second": 53.326, |
| "eval_steps_per_second": 6.666, |
| "step": 2700 |
| }, |
| { |
| "epoch": 6.210146936512337, |
| "grad_norm": 1.0884116888046265, |
| "learning_rate": 5.739130434782609e-06, |
| "loss": 6.5202, |
| "step": 2800 |
| }, |
| { |
| "epoch": 6.210146936512337, |
| "eval_loss": 6.498012065887451, |
| "eval_runtime": 187.9298, |
| "eval_samples_per_second": 53.211, |
| "eval_steps_per_second": 6.651, |
| "step": 2800 |
| }, |
| { |
| "epoch": 6.431937898530635, |
| "grad_norm": 2.436113119125366, |
| "learning_rate": 5.729096989966555e-06, |
| "loss": 6.5118, |
| "step": 2900 |
| }, |
| { |
| "epoch": 6.431937898530635, |
| "eval_loss": 6.493314266204834, |
| "eval_runtime": 187.7394, |
| "eval_samples_per_second": 53.265, |
| "eval_steps_per_second": 6.658, |
| "step": 2900 |
| }, |
| { |
| "epoch": 6.653728860548933, |
| "grad_norm": 0.5587801337242126, |
| "learning_rate": 5.719063545150502e-06, |
| "loss": 6.5023, |
| "step": 3000 |
| }, |
| { |
| "epoch": 6.653728860548933, |
| "eval_loss": 6.485339641571045, |
| "eval_runtime": 187.7624, |
| "eval_samples_per_second": 53.259, |
| "eval_steps_per_second": 6.657, |
| "step": 3000 |
| }, |
| { |
| "epoch": 6.87551982256723, |
| "grad_norm": 0.7650394439697266, |
| "learning_rate": 5.709030100334449e-06, |
| "loss": 6.4958, |
| "step": 3100 |
| }, |
| { |
| "epoch": 6.87551982256723, |
| "eval_loss": 6.47775411605835, |
| "eval_runtime": 187.7412, |
| "eval_samples_per_second": 53.265, |
| "eval_steps_per_second": 6.658, |
| "step": 3100 |
| }, |
| { |
| "epoch": 7.097310784585528, |
| "grad_norm": 0.8987262845039368, |
| "learning_rate": 5.698996655518395e-06, |
| "loss": 6.4903, |
| "step": 3200 |
| }, |
| { |
| "epoch": 7.097310784585528, |
| "eval_loss": 6.474526405334473, |
| "eval_runtime": 187.4357, |
| "eval_samples_per_second": 53.352, |
| "eval_steps_per_second": 6.669, |
| "step": 3200 |
| }, |
| { |
| "epoch": 7.319101746603826, |
| "grad_norm": 1.3211281299591064, |
| "learning_rate": 5.688963210702341e-06, |
| "loss": 6.4853, |
| "step": 3300 |
| }, |
| { |
| "epoch": 7.319101746603826, |
| "eval_loss": 6.471477508544922, |
| "eval_runtime": 184.369, |
| "eval_samples_per_second": 54.239, |
| "eval_steps_per_second": 6.78, |
| "step": 3300 |
| }, |
| { |
| "epoch": 7.540892708622124, |
| "grad_norm": 0.45453569293022156, |
| "learning_rate": 5.678929765886288e-06, |
| "loss": 6.4787, |
| "step": 3400 |
| }, |
| { |
| "epoch": 7.540892708622124, |
| "eval_loss": 6.467108249664307, |
| "eval_runtime": 187.6686, |
| "eval_samples_per_second": 53.285, |
| "eval_steps_per_second": 6.661, |
| "step": 3400 |
| }, |
| { |
| "epoch": 7.762683670640421, |
| "grad_norm": 1.5148217678070068, |
| "learning_rate": 5.668896321070235e-06, |
| "loss": 6.4758, |
| "step": 3500 |
| }, |
| { |
| "epoch": 7.762683670640421, |
| "eval_loss": 6.464193820953369, |
| "eval_runtime": 187.269, |
| "eval_samples_per_second": 53.399, |
| "eval_steps_per_second": 6.675, |
| "step": 3500 |
| }, |
| { |
| "epoch": 7.984474632658719, |
| "grad_norm": 0.7506269216537476, |
| "learning_rate": 5.658862876254181e-06, |
| "loss": 6.4727, |
| "step": 3600 |
| }, |
| { |
| "epoch": 7.984474632658719, |
| "eval_loss": 6.461331367492676, |
| "eval_runtime": 187.3466, |
| "eval_samples_per_second": 53.377, |
| "eval_steps_per_second": 6.672, |
| "step": 3600 |
| }, |
| { |
| "epoch": 8.206265594677017, |
| "grad_norm": 0.7681010961532593, |
| "learning_rate": 5.6488294314381275e-06, |
| "loss": 6.4678, |
| "step": 3700 |
| }, |
| { |
| "epoch": 8.206265594677017, |
| "eval_loss": 6.460472583770752, |
| "eval_runtime": 187.6598, |
| "eval_samples_per_second": 53.288, |
| "eval_steps_per_second": 6.661, |
| "step": 3700 |
| }, |
| { |
| "epoch": 8.428056556695315, |
| "grad_norm": 1.467830777168274, |
| "learning_rate": 5.638795986622074e-06, |
| "loss": 6.4643, |
| "step": 3800 |
| }, |
| { |
| "epoch": 8.428056556695315, |
| "eval_loss": 6.454957485198975, |
| "eval_runtime": 187.5697, |
| "eval_samples_per_second": 53.314, |
| "eval_steps_per_second": 6.664, |
| "step": 3800 |
| }, |
| { |
| "epoch": 8.649847518713612, |
| "grad_norm": 1.0356554985046387, |
| "learning_rate": 5.62876254180602e-06, |
| "loss": 6.459, |
| "step": 3900 |
| }, |
| { |
| "epoch": 8.649847518713612, |
| "eval_loss": 6.457272052764893, |
| "eval_runtime": 187.6233, |
| "eval_samples_per_second": 53.298, |
| "eval_steps_per_second": 6.662, |
| "step": 3900 |
| }, |
| { |
| "epoch": 8.87163848073191, |
| "grad_norm": 1.155139446258545, |
| "learning_rate": 5.618729096989967e-06, |
| "loss": 6.4574, |
| "step": 4000 |
| }, |
| { |
| "epoch": 8.87163848073191, |
| "eval_loss": 6.452768802642822, |
| "eval_runtime": 187.5301, |
| "eval_samples_per_second": 53.325, |
| "eval_steps_per_second": 6.666, |
| "step": 4000 |
| }, |
| { |
| "epoch": 9.093429442750208, |
| "grad_norm": 1.3142337799072266, |
| "learning_rate": 5.608695652173914e-06, |
| "loss": 6.4542, |
| "step": 4100 |
| }, |
| { |
| "epoch": 9.093429442750208, |
| "eval_loss": 6.4489216804504395, |
| "eval_runtime": 187.5651, |
| "eval_samples_per_second": 53.315, |
| "eval_steps_per_second": 6.664, |
| "step": 4100 |
| }, |
| { |
| "epoch": 9.315220404768505, |
| "grad_norm": 1.0297998189926147, |
| "learning_rate": 5.59866220735786e-06, |
| "loss": 6.4502, |
| "step": 4200 |
| }, |
| { |
| "epoch": 9.315220404768505, |
| "eval_loss": 6.446488857269287, |
| "eval_runtime": 187.6096, |
| "eval_samples_per_second": 53.302, |
| "eval_steps_per_second": 6.663, |
| "step": 4200 |
| }, |
| { |
| "epoch": 9.537011366786803, |
| "grad_norm": 1.2892968654632568, |
| "learning_rate": 5.588628762541806e-06, |
| "loss": 6.4486, |
| "step": 4300 |
| }, |
| { |
| "epoch": 9.537011366786803, |
| "eval_loss": 6.445422649383545, |
| "eval_runtime": 187.752, |
| "eval_samples_per_second": 53.262, |
| "eval_steps_per_second": 6.658, |
| "step": 4300 |
| }, |
| { |
| "epoch": 9.758802328805102, |
| "grad_norm": 0.5449041724205017, |
| "learning_rate": 5.578595317725753e-06, |
| "loss": 6.4454, |
| "step": 4400 |
| }, |
| { |
| "epoch": 9.758802328805102, |
| "eval_loss": 6.443131446838379, |
| "eval_runtime": 187.7716, |
| "eval_samples_per_second": 53.256, |
| "eval_steps_per_second": 6.657, |
| "step": 4400 |
| }, |
| { |
| "epoch": 9.9805932908234, |
| "grad_norm": 1.4572607278823853, |
| "learning_rate": 5.568561872909699e-06, |
| "loss": 6.4393, |
| "step": 4500 |
| }, |
| { |
| "epoch": 9.9805932908234, |
| "eval_loss": 6.443836688995361, |
| "eval_runtime": 187.7389, |
| "eval_samples_per_second": 53.265, |
| "eval_steps_per_second": 6.658, |
| "step": 4500 |
| }, |
| { |
| "epoch": 10.202384252841696, |
| "grad_norm": 0.9354243278503418, |
| "learning_rate": 5.558528428093646e-06, |
| "loss": 6.4402, |
| "step": 4600 |
| }, |
| { |
| "epoch": 10.202384252841696, |
| "eval_loss": 6.441638946533203, |
| "eval_runtime": 187.5818, |
| "eval_samples_per_second": 53.31, |
| "eval_steps_per_second": 6.664, |
| "step": 4600 |
| }, |
| { |
| "epoch": 10.424175214859995, |
| "grad_norm": 0.7258580327033997, |
| "learning_rate": 5.548494983277593e-06, |
| "loss": 6.4396, |
| "step": 4700 |
| }, |
| { |
| "epoch": 10.424175214859995, |
| "eval_loss": 6.438319206237793, |
| "eval_runtime": 187.6587, |
| "eval_samples_per_second": 53.288, |
| "eval_steps_per_second": 6.661, |
| "step": 4700 |
| }, |
| { |
| "epoch": 10.645966176878293, |
| "grad_norm": 1.2118555307388306, |
| "learning_rate": 5.5384615384615385e-06, |
| "loss": 6.4367, |
| "step": 4800 |
| }, |
| { |
| "epoch": 10.645966176878293, |
| "eval_loss": 6.441310882568359, |
| "eval_runtime": 187.6565, |
| "eval_samples_per_second": 53.289, |
| "eval_steps_per_second": 6.661, |
| "step": 4800 |
| }, |
| { |
| "epoch": 10.86775713889659, |
| "grad_norm": 1.159846305847168, |
| "learning_rate": 5.528428093645485e-06, |
| "loss": 6.4326, |
| "step": 4900 |
| }, |
| { |
| "epoch": 10.86775713889659, |
| "eval_loss": 6.43587589263916, |
| "eval_runtime": 187.6574, |
| "eval_samples_per_second": 53.289, |
| "eval_steps_per_second": 6.661, |
| "step": 4900 |
| }, |
| { |
| "epoch": 11.089548100914888, |
| "grad_norm": 0.7025282382965088, |
| "learning_rate": 5.518394648829432e-06, |
| "loss": 6.4308, |
| "step": 5000 |
| }, |
| { |
| "epoch": 11.089548100914888, |
| "eval_loss": 6.433752536773682, |
| "eval_runtime": 187.5262, |
| "eval_samples_per_second": 53.326, |
| "eval_steps_per_second": 6.666, |
| "step": 5000 |
| }, |
| { |
| "epoch": 11.311339062933186, |
| "grad_norm": 0.7697749137878418, |
| "learning_rate": 5.508361204013378e-06, |
| "loss": 6.4301, |
| "step": 5100 |
| }, |
| { |
| "epoch": 11.311339062933186, |
| "eval_loss": 6.435794353485107, |
| "eval_runtime": 187.6165, |
| "eval_samples_per_second": 53.3, |
| "eval_steps_per_second": 6.663, |
| "step": 5100 |
| }, |
| { |
| "epoch": 11.533130024951483, |
| "grad_norm": 1.069169044494629, |
| "learning_rate": 5.498327759197324e-06, |
| "loss": 6.4282, |
| "step": 5200 |
| }, |
| { |
| "epoch": 11.533130024951483, |
| "eval_loss": 6.428864479064941, |
| "eval_runtime": 187.7174, |
| "eval_samples_per_second": 53.272, |
| "eval_steps_per_second": 6.659, |
| "step": 5200 |
| }, |
| { |
| "epoch": 11.75492098696978, |
| "grad_norm": 0.7605268955230713, |
| "learning_rate": 5.488294314381271e-06, |
| "loss": 6.427, |
| "step": 5300 |
| }, |
| { |
| "epoch": 11.75492098696978, |
| "eval_loss": 6.429623603820801, |
| "eval_runtime": 187.7429, |
| "eval_samples_per_second": 53.264, |
| "eval_steps_per_second": 6.658, |
| "step": 5300 |
| }, |
| { |
| "epoch": 11.97671194898808, |
| "grad_norm": 1.2731574773788452, |
| "learning_rate": 5.478260869565217e-06, |
| "loss": 6.4248, |
| "step": 5400 |
| }, |
| { |
| "epoch": 11.97671194898808, |
| "eval_loss": 6.4345574378967285, |
| "eval_runtime": 187.759, |
| "eval_samples_per_second": 53.26, |
| "eval_steps_per_second": 6.657, |
| "step": 5400 |
| }, |
| { |
| "epoch": 12.198502911006376, |
| "grad_norm": 0.501266360282898, |
| "learning_rate": 5.468227424749163e-06, |
| "loss": 6.4238, |
| "step": 5500 |
| }, |
| { |
| "epoch": 12.198502911006376, |
| "eval_loss": 6.431957244873047, |
| "eval_runtime": 187.6761, |
| "eval_samples_per_second": 53.283, |
| "eval_steps_per_second": 6.66, |
| "step": 5500 |
| }, |
| { |
| "epoch": 12.420293873024674, |
| "grad_norm": 1.1356490850448608, |
| "learning_rate": 5.45819397993311e-06, |
| "loss": 6.4206, |
| "step": 5600 |
| }, |
| { |
| "epoch": 12.420293873024674, |
| "eval_loss": 6.427853107452393, |
| "eval_runtime": 187.6504, |
| "eval_samples_per_second": 53.291, |
| "eval_steps_per_second": 6.661, |
| "step": 5600 |
| }, |
| { |
| "epoch": 12.642084835042972, |
| "grad_norm": 0.8015862107276917, |
| "learning_rate": 5.448160535117057e-06, |
| "loss": 6.4211, |
| "step": 5700 |
| }, |
| { |
| "epoch": 12.642084835042972, |
| "eval_loss": 6.431809425354004, |
| "eval_runtime": 187.7474, |
| "eval_samples_per_second": 53.263, |
| "eval_steps_per_second": 6.658, |
| "step": 5700 |
| }, |
| { |
| "epoch": 12.86387579706127, |
| "grad_norm": 0.4582173228263855, |
| "learning_rate": 5.438127090301003e-06, |
| "loss": 6.4194, |
| "step": 5800 |
| }, |
| { |
| "epoch": 12.86387579706127, |
| "eval_loss": 6.428267478942871, |
| "eval_runtime": 187.7371, |
| "eval_samples_per_second": 53.266, |
| "eval_steps_per_second": 6.658, |
| "step": 5800 |
| }, |
| { |
| "epoch": 13.085666759079567, |
| "grad_norm": 0.5481283068656921, |
| "learning_rate": 5.4280936454849495e-06, |
| "loss": 6.4158, |
| "step": 5900 |
| }, |
| { |
| "epoch": 13.085666759079567, |
| "eval_loss": 6.426946640014648, |
| "eval_runtime": 187.6213, |
| "eval_samples_per_second": 53.299, |
| "eval_steps_per_second": 6.662, |
| "step": 5900 |
| }, |
| { |
| "epoch": 13.307457721097865, |
| "grad_norm": 0.7986653447151184, |
| "learning_rate": 5.418060200668896e-06, |
| "loss": 6.4177, |
| "step": 6000 |
| }, |
| { |
| "epoch": 13.307457721097865, |
| "eval_loss": 6.428122043609619, |
| "eval_runtime": 187.2985, |
| "eval_samples_per_second": 53.391, |
| "eval_steps_per_second": 6.674, |
| "step": 6000 |
| }, |
| { |
| "epoch": 13.529248683116164, |
| "grad_norm": 0.9855276346206665, |
| "learning_rate": 5.408026755852843e-06, |
| "loss": 6.4158, |
| "step": 6100 |
| }, |
| { |
| "epoch": 13.529248683116164, |
| "eval_loss": 6.425644397735596, |
| "eval_runtime": 187.3504, |
| "eval_samples_per_second": 53.376, |
| "eval_steps_per_second": 6.672, |
| "step": 6100 |
| }, |
| { |
| "epoch": 13.75103964513446, |
| "grad_norm": 0.674077570438385, |
| "learning_rate": 5.397993311036789e-06, |
| "loss": 6.4144, |
| "step": 6200 |
| }, |
| { |
| "epoch": 13.75103964513446, |
| "eval_loss": 6.425694465637207, |
| "eval_runtime": 187.5833, |
| "eval_samples_per_second": 53.31, |
| "eval_steps_per_second": 6.664, |
| "step": 6200 |
| }, |
| { |
| "epoch": 13.972830607152758, |
| "grad_norm": 0.9573073387145996, |
| "learning_rate": 5.387959866220736e-06, |
| "loss": 6.4145, |
| "step": 6300 |
| }, |
| { |
| "epoch": 13.972830607152758, |
| "eval_loss": 6.426056385040283, |
| "eval_runtime": 187.6486, |
| "eval_samples_per_second": 53.291, |
| "eval_steps_per_second": 6.661, |
| "step": 6300 |
| }, |
| { |
| "epoch": 14.194621569171057, |
| "grad_norm": 1.219962239265442, |
| "learning_rate": 5.3779264214046825e-06, |
| "loss": 6.4108, |
| "step": 6400 |
| }, |
| { |
| "epoch": 14.194621569171057, |
| "eval_loss": 6.422914981842041, |
| "eval_runtime": 187.3992, |
| "eval_samples_per_second": 53.362, |
| "eval_steps_per_second": 6.67, |
| "step": 6400 |
| }, |
| { |
| "epoch": 14.416412531189353, |
| "grad_norm": 0.7925574779510498, |
| "learning_rate": 5.367892976588628e-06, |
| "loss": 6.4109, |
| "step": 6500 |
| }, |
| { |
| "epoch": 14.416412531189353, |
| "eval_loss": 6.424429893493652, |
| "eval_runtime": 187.4044, |
| "eval_samples_per_second": 53.361, |
| "eval_steps_per_second": 6.67, |
| "step": 6500 |
| }, |
| { |
| "epoch": 14.638203493207651, |
| "grad_norm": 0.6920539736747742, |
| "learning_rate": 5.357859531772575e-06, |
| "loss": 6.4111, |
| "step": 6600 |
| }, |
| { |
| "epoch": 14.638203493207651, |
| "eval_loss": 6.425134181976318, |
| "eval_runtime": 187.6179, |
| "eval_samples_per_second": 53.3, |
| "eval_steps_per_second": 6.662, |
| "step": 6600 |
| }, |
| { |
| "epoch": 14.85999445522595, |
| "grad_norm": 0.731540322303772, |
| "learning_rate": 5.347826086956522e-06, |
| "loss": 6.4102, |
| "step": 6700 |
| }, |
| { |
| "epoch": 14.85999445522595, |
| "eval_loss": 6.428023338317871, |
| "eval_runtime": 187.5914, |
| "eval_samples_per_second": 53.307, |
| "eval_steps_per_second": 6.663, |
| "step": 6700 |
| }, |
| { |
| "epoch": 15.081785417244248, |
| "grad_norm": 0.9497311115264893, |
| "learning_rate": 5.337792642140468e-06, |
| "loss": 6.4083, |
| "step": 6800 |
| }, |
| { |
| "epoch": 15.081785417244248, |
| "eval_loss": 6.423036098480225, |
| "eval_runtime": 187.4236, |
| "eval_samples_per_second": 53.355, |
| "eval_steps_per_second": 6.669, |
| "step": 6800 |
| }, |
| { |
| "epoch": 15.303576379262545, |
| "grad_norm": 0.6871623396873474, |
| "learning_rate": 5.327759197324415e-06, |
| "loss": 6.4075, |
| "step": 6900 |
| }, |
| { |
| "epoch": 15.303576379262545, |
| "eval_loss": 6.425256729125977, |
| "eval_runtime": 187.5086, |
| "eval_samples_per_second": 53.331, |
| "eval_steps_per_second": 6.666, |
| "step": 6900 |
| }, |
| { |
| "epoch": 15.525367341280843, |
| "grad_norm": 0.5820502042770386, |
| "learning_rate": 5.317725752508361e-06, |
| "loss": 6.4066, |
| "step": 7000 |
| }, |
| { |
| "epoch": 15.525367341280843, |
| "eval_loss": 6.425621509552002, |
| "eval_runtime": 187.786, |
| "eval_samples_per_second": 53.252, |
| "eval_steps_per_second": 6.657, |
| "step": 7000 |
| }, |
| { |
| "epoch": 15.747158303299141, |
| "grad_norm": 1.0221792459487915, |
| "learning_rate": 5.307692307692307e-06, |
| "loss": 6.4074, |
| "step": 7100 |
| }, |
| { |
| "epoch": 15.747158303299141, |
| "eval_loss": 6.419933319091797, |
| "eval_runtime": 187.8686, |
| "eval_samples_per_second": 53.229, |
| "eval_steps_per_second": 6.654, |
| "step": 7100 |
| }, |
| { |
| "epoch": 15.968949265317438, |
| "grad_norm": 0.5439109802246094, |
| "learning_rate": 5.297658862876254e-06, |
| "loss": 6.4051, |
| "step": 7200 |
| }, |
| { |
| "epoch": 15.968949265317438, |
| "eval_loss": 6.417891025543213, |
| "eval_runtime": 187.9103, |
| "eval_samples_per_second": 53.217, |
| "eval_steps_per_second": 6.652, |
| "step": 7200 |
| }, |
| { |
| "epoch": 16.190740227335738, |
| "grad_norm": 0.48691362142562866, |
| "learning_rate": 5.287625418060201e-06, |
| "loss": 6.4048, |
| "step": 7300 |
| }, |
| { |
| "epoch": 16.190740227335738, |
| "eval_loss": 6.4206414222717285, |
| "eval_runtime": 187.7538, |
| "eval_samples_per_second": 53.261, |
| "eval_steps_per_second": 6.658, |
| "step": 7300 |
| }, |
| { |
| "epoch": 16.412531189354034, |
| "grad_norm": 0.4550572633743286, |
| "learning_rate": 5.277591973244147e-06, |
| "loss": 6.4042, |
| "step": 7400 |
| }, |
| { |
| "epoch": 16.412531189354034, |
| "eval_loss": 6.424399375915527, |
| "eval_runtime": 187.7838, |
| "eval_samples_per_second": 53.253, |
| "eval_steps_per_second": 6.657, |
| "step": 7400 |
| }, |
| { |
| "epoch": 16.63432215137233, |
| "grad_norm": 0.9620975852012634, |
| "learning_rate": 5.2675585284280935e-06, |
| "loss": 6.4028, |
| "step": 7500 |
| }, |
| { |
| "epoch": 16.63432215137233, |
| "eval_loss": 6.422457695007324, |
| "eval_runtime": 187.7527, |
| "eval_samples_per_second": 53.262, |
| "eval_steps_per_second": 6.658, |
| "step": 7500 |
| }, |
| { |
| "epoch": 16.85611311339063, |
| "grad_norm": 0.5464668273925781, |
| "learning_rate": 5.25752508361204e-06, |
| "loss": 6.4028, |
| "step": 7600 |
| }, |
| { |
| "epoch": 16.85611311339063, |
| "eval_loss": 6.416252136230469, |
| "eval_runtime": 187.8194, |
| "eval_samples_per_second": 53.243, |
| "eval_steps_per_second": 6.655, |
| "step": 7600 |
| }, |
| { |
| "epoch": 17.077904075408927, |
| "grad_norm": 0.9427766799926758, |
| "learning_rate": 5.247491638795986e-06, |
| "loss": 6.4017, |
| "step": 7700 |
| }, |
| { |
| "epoch": 17.077904075408927, |
| "eval_loss": 6.420745372772217, |
| "eval_runtime": 187.3478, |
| "eval_samples_per_second": 53.377, |
| "eval_steps_per_second": 6.672, |
| "step": 7700 |
| }, |
| { |
| "epoch": 17.299695037427224, |
| "grad_norm": 0.6187496185302734, |
| "learning_rate": 5.237458193979933e-06, |
| "loss": 6.4029, |
| "step": 7800 |
| }, |
| { |
| "epoch": 17.299695037427224, |
| "eval_loss": 6.418467044830322, |
| "eval_runtime": 187.4874, |
| "eval_samples_per_second": 53.337, |
| "eval_steps_per_second": 6.667, |
| "step": 7800 |
| }, |
| { |
| "epoch": 17.521485999445524, |
| "grad_norm": 1.0530321598052979, |
| "learning_rate": 5.22742474916388e-06, |
| "loss": 6.4007, |
| "step": 7900 |
| }, |
| { |
| "epoch": 17.521485999445524, |
| "eval_loss": 6.421618938446045, |
| "eval_runtime": 187.6722, |
| "eval_samples_per_second": 53.284, |
| "eval_steps_per_second": 6.661, |
| "step": 7900 |
| }, |
| { |
| "epoch": 17.74327696146382, |
| "grad_norm": 0.5843673944473267, |
| "learning_rate": 5.2173913043478265e-06, |
| "loss": 6.3996, |
| "step": 8000 |
| }, |
| { |
| "epoch": 17.74327696146382, |
| "eval_loss": 6.414370059967041, |
| "eval_runtime": 187.7088, |
| "eval_samples_per_second": 53.274, |
| "eval_steps_per_second": 6.659, |
| "step": 8000 |
| }, |
| { |
| "epoch": 35.99805932908234, |
| "grad_norm": 0.7473396062850952, |
| "learning_rate": 5.207357859531772e-06, |
| "loss": 6.3985, |
| "step": 8100 |
| }, |
| { |
| "epoch": 35.99805932908234, |
| "eval_loss": 6.4200849533081055, |
| "eval_runtime": 175.8905, |
| "eval_samples_per_second": 56.854, |
| "eval_steps_per_second": 3.553, |
| "step": 8100 |
| }, |
| { |
| "epoch": 36.44164125311894, |
| "grad_norm": 1.399119257926941, |
| "learning_rate": 5.197324414715719e-06, |
| "loss": 6.3988, |
| "step": 8200 |
| }, |
| { |
| "epoch": 36.44164125311894, |
| "eval_loss": 6.415561676025391, |
| "eval_runtime": 175.9246, |
| "eval_samples_per_second": 56.843, |
| "eval_steps_per_second": 3.553, |
| "step": 8200 |
| }, |
| { |
| "epoch": 36.88522317715553, |
| "grad_norm": 0.7817428112030029, |
| "learning_rate": 5.187290969899666e-06, |
| "loss": 6.3974, |
| "step": 8300 |
| }, |
| { |
| "epoch": 36.88522317715553, |
| "eval_loss": 6.418274402618408, |
| "eval_runtime": 175.9184, |
| "eval_samples_per_second": 56.845, |
| "eval_steps_per_second": 3.553, |
| "step": 8300 |
| }, |
| { |
| "epoch": 37.328805101192124, |
| "grad_norm": 0.43301448225975037, |
| "learning_rate": 5.177257525083612e-06, |
| "loss": 6.3975, |
| "step": 8400 |
| }, |
| { |
| "epoch": 37.328805101192124, |
| "eval_loss": 6.416856288909912, |
| "eval_runtime": 175.9451, |
| "eval_samples_per_second": 56.836, |
| "eval_steps_per_second": 3.552, |
| "step": 8400 |
| }, |
| { |
| "epoch": 37.772387025228724, |
| "grad_norm": 0.7033133506774902, |
| "learning_rate": 5.167224080267559e-06, |
| "loss": 6.398, |
| "step": 8500 |
| }, |
| { |
| "epoch": 37.772387025228724, |
| "eval_loss": 6.419331073760986, |
| "eval_runtime": 175.9226, |
| "eval_samples_per_second": 56.843, |
| "eval_steps_per_second": 3.553, |
| "step": 8500 |
| }, |
| { |
| "epoch": 38.21596894926532, |
| "grad_norm": 0.5272181630134583, |
| "learning_rate": 5.157190635451505e-06, |
| "loss": 6.3974, |
| "step": 8600 |
| }, |
| { |
| "epoch": 38.21596894926532, |
| "eval_loss": 6.415123462677002, |
| "eval_runtime": 177.1859, |
| "eval_samples_per_second": 56.438, |
| "eval_steps_per_second": 3.527, |
| "step": 8600 |
| }, |
| { |
| "epoch": 38.65955087330191, |
| "grad_norm": 0.21561351418495178, |
| "learning_rate": 5.147157190635451e-06, |
| "loss": 6.3959, |
| "step": 8700 |
| }, |
| { |
| "epoch": 38.65955087330191, |
| "eval_loss": 6.416403770446777, |
| "eval_runtime": 175.9188, |
| "eval_samples_per_second": 56.844, |
| "eval_steps_per_second": 3.553, |
| "step": 8700 |
| }, |
| { |
| "epoch": 39.10313279733851, |
| "grad_norm": 0.43310365080833435, |
| "learning_rate": 5.137123745819398e-06, |
| "loss": 6.3961, |
| "step": 8800 |
| }, |
| { |
| "epoch": 39.10313279733851, |
| "eval_loss": 6.419050693511963, |
| "eval_runtime": 176.1984, |
| "eval_samples_per_second": 56.754, |
| "eval_steps_per_second": 3.547, |
| "step": 8800 |
| }, |
| { |
| "epoch": 39.5467147213751, |
| "grad_norm": 0.37988752126693726, |
| "learning_rate": 5.127090301003345e-06, |
| "loss": 6.3963, |
| "step": 8900 |
| }, |
| { |
| "epoch": 39.5467147213751, |
| "eval_loss": 6.4194416999816895, |
| "eval_runtime": 177.1378, |
| "eval_samples_per_second": 56.453, |
| "eval_steps_per_second": 3.528, |
| "step": 8900 |
| }, |
| { |
| "epoch": 39.990296645411696, |
| "grad_norm": 0.5972484350204468, |
| "learning_rate": 5.117056856187291e-06, |
| "loss": 6.3957, |
| "step": 9000 |
| }, |
| { |
| "epoch": 39.990296645411696, |
| "eval_loss": 6.413427829742432, |
| "eval_runtime": 177.3512, |
| "eval_samples_per_second": 56.385, |
| "eval_steps_per_second": 3.524, |
| "step": 9000 |
| }, |
| { |
| "epoch": 40.4338785694483, |
| "grad_norm": 0.6110886931419373, |
| "learning_rate": 5.1070234113712375e-06, |
| "loss": 6.3956, |
| "step": 9100 |
| }, |
| { |
| "epoch": 40.4338785694483, |
| "eval_loss": 6.413400650024414, |
| "eval_runtime": 177.2258, |
| "eval_samples_per_second": 56.425, |
| "eval_steps_per_second": 3.527, |
| "step": 9100 |
| }, |
| { |
| "epoch": 40.87746049348489, |
| "grad_norm": 0.45949310064315796, |
| "learning_rate": 5.096989966555184e-06, |
| "loss": 6.3938, |
| "step": 9200 |
| }, |
| { |
| "epoch": 40.87746049348489, |
| "eval_loss": 6.4161882400512695, |
| "eval_runtime": 176.173, |
| "eval_samples_per_second": 56.762, |
| "eval_steps_per_second": 3.548, |
| "step": 9200 |
| }, |
| { |
| "epoch": 41.32104241752148, |
| "grad_norm": 0.2691323459148407, |
| "learning_rate": 5.08695652173913e-06, |
| "loss": 6.3943, |
| "step": 9300 |
| }, |
| { |
| "epoch": 41.32104241752148, |
| "eval_loss": 6.41210412979126, |
| "eval_runtime": 177.2828, |
| "eval_samples_per_second": 56.407, |
| "eval_steps_per_second": 3.525, |
| "step": 9300 |
| }, |
| { |
| "epoch": 41.76462434155808, |
| "grad_norm": 0.6407902836799622, |
| "learning_rate": 5.076923076923077e-06, |
| "loss": 6.3939, |
| "step": 9400 |
| }, |
| { |
| "epoch": 41.76462434155808, |
| "eval_loss": 6.41355562210083, |
| "eval_runtime": 177.2932, |
| "eval_samples_per_second": 56.404, |
| "eval_steps_per_second": 3.525, |
| "step": 9400 |
| }, |
| { |
| "epoch": 42.208206265594676, |
| "grad_norm": 0.3573991656303406, |
| "learning_rate": 5.066889632107024e-06, |
| "loss": 6.3938, |
| "step": 9500 |
| }, |
| { |
| "epoch": 42.208206265594676, |
| "eval_loss": 6.415012836456299, |
| "eval_runtime": 176.0231, |
| "eval_samples_per_second": 56.811, |
| "eval_steps_per_second": 3.551, |
| "step": 9500 |
| }, |
| { |
| "epoch": 42.651788189631276, |
| "grad_norm": 0.5135132074356079, |
| "learning_rate": 5.05685618729097e-06, |
| "loss": 6.3933, |
| "step": 9600 |
| }, |
| { |
| "epoch": 42.651788189631276, |
| "eval_loss": 6.413679122924805, |
| "eval_runtime": 176.0231, |
| "eval_samples_per_second": 56.811, |
| "eval_steps_per_second": 3.551, |
| "step": 9600 |
| }, |
| { |
| "epoch": 43.09537011366787, |
| "grad_norm": 0.6957016587257385, |
| "learning_rate": 5.046822742474916e-06, |
| "loss": 6.393, |
| "step": 9700 |
| }, |
| { |
| "epoch": 43.09537011366787, |
| "eval_loss": 6.414681434631348, |
| "eval_runtime": 176.1102, |
| "eval_samples_per_second": 56.783, |
| "eval_steps_per_second": 3.549, |
| "step": 9700 |
| }, |
| { |
| "epoch": 43.53895203770446, |
| "grad_norm": 0.6068916916847229, |
| "learning_rate": 5.036789297658863e-06, |
| "loss": 6.3921, |
| "step": 9800 |
| }, |
| { |
| "epoch": 43.53895203770446, |
| "eval_loss": 6.4130144119262695, |
| "eval_runtime": 176.7572, |
| "eval_samples_per_second": 56.575, |
| "eval_steps_per_second": 3.536, |
| "step": 9800 |
| }, |
| { |
| "epoch": 43.98253396174106, |
| "grad_norm": 0.5968314409255981, |
| "learning_rate": 5.02675585284281e-06, |
| "loss": 6.3925, |
| "step": 9900 |
| }, |
| { |
| "epoch": 43.98253396174106, |
| "eval_loss": 6.410362720489502, |
| "eval_runtime": 176.0642, |
| "eval_samples_per_second": 56.797, |
| "eval_steps_per_second": 3.55, |
| "step": 9900 |
| }, |
| { |
| "epoch": 44.426115885777655, |
| "grad_norm": 0.4509466886520386, |
| "learning_rate": 5.016722408026756e-06, |
| "loss": 6.391, |
| "step": 10000 |
| }, |
| { |
| "epoch": 44.426115885777655, |
| "eval_loss": 6.412291526794434, |
| "eval_runtime": 176.0769, |
| "eval_samples_per_second": 56.793, |
| "eval_steps_per_second": 3.55, |
| "step": 10000 |
| }, |
| { |
| "epoch": 90.17099135063206, |
| "grad_norm": 0.6186116337776184, |
| "learning_rate": 5.0066889632107026e-06, |
| "loss": 6.391, |
| "step": 10100 |
| }, |
| { |
| "epoch": 90.17099135063206, |
| "eval_loss": 6.412010192871094, |
| "eval_runtime": 89.0077, |
| "eval_samples_per_second": 112.35, |
| "eval_steps_per_second": 3.517, |
| "step": 10100 |
| }, |
| { |
| "epoch": 91.05810601020183, |
| "grad_norm": 0.5779035687446594, |
| "learning_rate": 4.996655518394649e-06, |
| "loss": 6.3897, |
| "step": 10200 |
| }, |
| { |
| "epoch": 91.05810601020183, |
| "eval_loss": 6.411357879638672, |
| "eval_runtime": 88.2289, |
| "eval_samples_per_second": 113.342, |
| "eval_steps_per_second": 3.548, |
| "step": 10200 |
| }, |
| { |
| "epoch": 91.94522066977157, |
| "grad_norm": 0.4683433473110199, |
| "learning_rate": 4.986622073578595e-06, |
| "loss": 6.3909, |
| "step": 10300 |
| }, |
| { |
| "epoch": 91.94522066977157, |
| "eval_loss": 6.40939998626709, |
| "eval_runtime": 88.21, |
| "eval_samples_per_second": 113.366, |
| "eval_steps_per_second": 3.548, |
| "step": 10300 |
| }, |
| { |
| "epoch": 92.83233532934132, |
| "grad_norm": 0.32136374711990356, |
| "learning_rate": 4.976588628762542e-06, |
| "loss": 6.3902, |
| "step": 10400 |
| }, |
| { |
| "epoch": 92.83233532934132, |
| "eval_loss": 6.409432888031006, |
| "eval_runtime": 88.5101, |
| "eval_samples_per_second": 112.982, |
| "eval_steps_per_second": 3.536, |
| "step": 10400 |
| }, |
| { |
| "epoch": 93.71944998891107, |
| "grad_norm": 0.536392092704773, |
| "learning_rate": 4.966555183946489e-06, |
| "loss": 6.3899, |
| "step": 10500 |
| }, |
| { |
| "epoch": 93.71944998891107, |
| "eval_loss": 6.4088335037231445, |
| "eval_runtime": 88.2323, |
| "eval_samples_per_second": 113.337, |
| "eval_steps_per_second": 3.547, |
| "step": 10500 |
| }, |
| { |
| "epoch": 94.60656464848081, |
| "grad_norm": 0.36826851963996887, |
| "learning_rate": 4.956521739130435e-06, |
| "loss": 6.3894, |
| "step": 10600 |
| }, |
| { |
| "epoch": 94.60656464848081, |
| "eval_loss": 6.412118434906006, |
| "eval_runtime": 89.0058, |
| "eval_samples_per_second": 112.352, |
| "eval_steps_per_second": 3.517, |
| "step": 10600 |
| }, |
| { |
| "epoch": 95.49367930805056, |
| "grad_norm": 0.37616053223609924, |
| "learning_rate": 4.9464882943143815e-06, |
| "loss": 6.3882, |
| "step": 10700 |
| }, |
| { |
| "epoch": 95.49367930805056, |
| "eval_loss": 6.4095306396484375, |
| "eval_runtime": 88.2076, |
| "eval_samples_per_second": 113.369, |
| "eval_steps_per_second": 3.548, |
| "step": 10700 |
| }, |
| { |
| "epoch": 96.38079396762032, |
| "grad_norm": 0.5474613904953003, |
| "learning_rate": 4.936454849498328e-06, |
| "loss": 6.3889, |
| "step": 10800 |
| }, |
| { |
| "epoch": 96.38079396762032, |
| "eval_loss": 6.411876678466797, |
| "eval_runtime": 88.2153, |
| "eval_samples_per_second": 113.359, |
| "eval_steps_per_second": 3.548, |
| "step": 10800 |
| }, |
| { |
| "epoch": 97.26790862719007, |
| "grad_norm": 0.5602962970733643, |
| "learning_rate": 4.926421404682274e-06, |
| "loss": 6.3891, |
| "step": 10900 |
| }, |
| { |
| "epoch": 97.26790862719007, |
| "eval_loss": 6.408635139465332, |
| "eval_runtime": 88.9688, |
| "eval_samples_per_second": 112.399, |
| "eval_steps_per_second": 3.518, |
| "step": 10900 |
| }, |
| { |
| "epoch": 98.15502328675981, |
| "grad_norm": 0.46944743394851685, |
| "learning_rate": 4.916387959866221e-06, |
| "loss": 6.388, |
| "step": 11000 |
| }, |
| { |
| "epoch": 98.15502328675981, |
| "eval_loss": 6.408023834228516, |
| "eval_runtime": 89.0299, |
| "eval_samples_per_second": 112.322, |
| "eval_steps_per_second": 3.516, |
| "step": 11000 |
| }, |
| { |
| "epoch": 99.04213794632956, |
| "grad_norm": 0.5612199306488037, |
| "learning_rate": 4.906354515050168e-06, |
| "loss": 6.388, |
| "step": 11100 |
| }, |
| { |
| "epoch": 99.04213794632956, |
| "eval_loss": 6.408627510070801, |
| "eval_runtime": 89.0002, |
| "eval_samples_per_second": 112.359, |
| "eval_steps_per_second": 3.517, |
| "step": 11100 |
| }, |
| { |
| "epoch": 99.92925260589931, |
| "grad_norm": 0.5043811798095703, |
| "learning_rate": 4.8963210702341136e-06, |
| "loss": 6.3866, |
| "step": 11200 |
| }, |
| { |
| "epoch": 99.92925260589931, |
| "eval_loss": 6.4089789390563965, |
| "eval_runtime": 89.0751, |
| "eval_samples_per_second": 112.265, |
| "eval_steps_per_second": 3.514, |
| "step": 11200 |
| }, |
| { |
| "epoch": 100.81636726546907, |
| "grad_norm": 0.5718743205070496, |
| "learning_rate": 4.88628762541806e-06, |
| "loss": 6.3872, |
| "step": 11300 |
| }, |
| { |
| "epoch": 100.81636726546907, |
| "eval_loss": 6.405999183654785, |
| "eval_runtime": 88.2069, |
| "eval_samples_per_second": 113.37, |
| "eval_steps_per_second": 3.548, |
| "step": 11300 |
| }, |
| { |
| "epoch": 101.70348192503882, |
| "grad_norm": 0.5030497312545776, |
| "learning_rate": 4.876254180602007e-06, |
| "loss": 6.3869, |
| "step": 11400 |
| }, |
| { |
| "epoch": 101.70348192503882, |
| "eval_loss": 6.408895969390869, |
| "eval_runtime": 88.2117, |
| "eval_samples_per_second": 113.364, |
| "eval_steps_per_second": 3.548, |
| "step": 11400 |
| }, |
| { |
| "epoch": 102.59059658460856, |
| "grad_norm": 0.3895309269428253, |
| "learning_rate": 4.866220735785953e-06, |
| "loss": 6.3866, |
| "step": 11500 |
| }, |
| { |
| "epoch": 102.59059658460856, |
| "eval_loss": 6.408517360687256, |
| "eval_runtime": 88.1944, |
| "eval_samples_per_second": 113.386, |
| "eval_steps_per_second": 3.549, |
| "step": 11500 |
| }, |
| { |
| "epoch": 103.47771124417831, |
| "grad_norm": 0.3549971282482147, |
| "learning_rate": 4.8561872909699e-06, |
| "loss": 6.3865, |
| "step": 11600 |
| }, |
| { |
| "epoch": 103.47771124417831, |
| "eval_loss": 6.409358501434326, |
| "eval_runtime": 88.1985, |
| "eval_samples_per_second": 113.381, |
| "eval_steps_per_second": 3.549, |
| "step": 11600 |
| }, |
| { |
| "epoch": 104.36482590374806, |
| "grad_norm": 0.3515787720680237, |
| "learning_rate": 4.8461538461538465e-06, |
| "loss": 6.3861, |
| "step": 11700 |
| }, |
| { |
| "epoch": 104.36482590374806, |
| "eval_loss": 6.409560203552246, |
| "eval_runtime": 88.565, |
| "eval_samples_per_second": 112.911, |
| "eval_steps_per_second": 3.534, |
| "step": 11700 |
| }, |
| { |
| "epoch": 105.2519405633178, |
| "grad_norm": 0.5682891011238098, |
| "learning_rate": 4.8361204013377925e-06, |
| "loss": 6.3863, |
| "step": 11800 |
| }, |
| { |
| "epoch": 105.2519405633178, |
| "eval_loss": 6.405972480773926, |
| "eval_runtime": 89.025, |
| "eval_samples_per_second": 112.328, |
| "eval_steps_per_second": 3.516, |
| "step": 11800 |
| }, |
| { |
| "epoch": 106.13905522288756, |
| "grad_norm": 0.3571348488330841, |
| "learning_rate": 4.826086956521739e-06, |
| "loss": 6.385, |
| "step": 11900 |
| }, |
| { |
| "epoch": 106.13905522288756, |
| "eval_loss": 6.399210453033447, |
| "eval_runtime": 88.4184, |
| "eval_samples_per_second": 113.099, |
| "eval_steps_per_second": 3.54, |
| "step": 11900 |
| }, |
| { |
| "epoch": 107.02616988245731, |
| "grad_norm": 0.4465329647064209, |
| "learning_rate": 4.816053511705686e-06, |
| "loss": 6.3854, |
| "step": 12000 |
| }, |
| { |
| "epoch": 107.02616988245731, |
| "eval_loss": 6.4048357009887695, |
| "eval_runtime": 88.2058, |
| "eval_samples_per_second": 113.371, |
| "eval_steps_per_second": 3.549, |
| "step": 12000 |
| }, |
| { |
| "epoch": 107.91328454202706, |
| "grad_norm": 0.3734528422355652, |
| "learning_rate": 4.806020066889633e-06, |
| "loss": 6.3857, |
| "step": 12100 |
| }, |
| { |
| "epoch": 107.91328454202706, |
| "eval_loss": 6.401259422302246, |
| "eval_runtime": 88.9844, |
| "eval_samples_per_second": 112.379, |
| "eval_steps_per_second": 3.517, |
| "step": 12100 |
| }, |
| { |
| "epoch": 108.8003992015968, |
| "grad_norm": 0.48566725850105286, |
| "learning_rate": 4.795986622073579e-06, |
| "loss": 6.3849, |
| "step": 12200 |
| }, |
| { |
| "epoch": 108.8003992015968, |
| "eval_loss": 6.406267166137695, |
| "eval_runtime": 89.0118, |
| "eval_samples_per_second": 112.345, |
| "eval_steps_per_second": 3.516, |
| "step": 12200 |
| }, |
| { |
| "epoch": 109.68751386116655, |
| "grad_norm": 0.35902583599090576, |
| "learning_rate": 4.785953177257525e-06, |
| "loss": 6.3846, |
| "step": 12300 |
| }, |
| { |
| "epoch": 109.68751386116655, |
| "eval_loss": 6.407033443450928, |
| "eval_runtime": 88.9668, |
| "eval_samples_per_second": 112.401, |
| "eval_steps_per_second": 3.518, |
| "step": 12300 |
| }, |
| { |
| "epoch": 110.57462852073631, |
| "grad_norm": 0.6619898676872253, |
| "learning_rate": 4.775919732441472e-06, |
| "loss": 6.3849, |
| "step": 12400 |
| }, |
| { |
| "epoch": 110.57462852073631, |
| "eval_loss": 6.399672031402588, |
| "eval_runtime": 88.1986, |
| "eval_samples_per_second": 113.381, |
| "eval_steps_per_second": 3.549, |
| "step": 12400 |
| }, |
| { |
| "epoch": 111.46174318030606, |
| "grad_norm": 0.4180016815662384, |
| "learning_rate": 4.765886287625418e-06, |
| "loss": 6.3834, |
| "step": 12500 |
| }, |
| { |
| "epoch": 111.46174318030606, |
| "eval_loss": 6.401187419891357, |
| "eval_runtime": 88.2008, |
| "eval_samples_per_second": 113.378, |
| "eval_steps_per_second": 3.549, |
| "step": 12500 |
| }, |
| { |
| "epoch": 112.3488578398758, |
| "grad_norm": 0.4805915951728821, |
| "learning_rate": 4.755852842809365e-06, |
| "loss": 6.3847, |
| "step": 12600 |
| }, |
| { |
| "epoch": 112.3488578398758, |
| "eval_loss": 6.398319721221924, |
| "eval_runtime": 88.2116, |
| "eval_samples_per_second": 113.364, |
| "eval_steps_per_second": 3.548, |
| "step": 12600 |
| }, |
| { |
| "epoch": 113.23597249944555, |
| "grad_norm": 0.5308820009231567, |
| "learning_rate": 4.745819397993312e-06, |
| "loss": 6.3833, |
| "step": 12700 |
| }, |
| { |
| "epoch": 113.23597249944555, |
| "eval_loss": 6.403678894042969, |
| "eval_runtime": 89.0114, |
| "eval_samples_per_second": 112.345, |
| "eval_steps_per_second": 3.516, |
| "step": 12700 |
| }, |
| { |
| "epoch": 114.1230871590153, |
| "grad_norm": 0.48248058557510376, |
| "learning_rate": 4.7357859531772575e-06, |
| "loss": 6.3829, |
| "step": 12800 |
| }, |
| { |
| "epoch": 114.1230871590153, |
| "eval_loss": 6.405944347381592, |
| "eval_runtime": 88.9912, |
| "eval_samples_per_second": 112.371, |
| "eval_steps_per_second": 3.517, |
| "step": 12800 |
| }, |
| { |
| "epoch": 115.01020181858505, |
| "grad_norm": 0.3773874044418335, |
| "learning_rate": 4.725752508361204e-06, |
| "loss": 6.3829, |
| "step": 12900 |
| }, |
| { |
| "epoch": 115.01020181858505, |
| "eval_loss": 6.401638031005859, |
| "eval_runtime": 89.0327, |
| "eval_samples_per_second": 112.318, |
| "eval_steps_per_second": 3.516, |
| "step": 12900 |
| }, |
| { |
| "epoch": 115.8973164781548, |
| "grad_norm": 0.3370400369167328, |
| "learning_rate": 4.715719063545151e-06, |
| "loss": 6.383, |
| "step": 13000 |
| }, |
| { |
| "epoch": 115.8973164781548, |
| "eval_loss": 6.406683921813965, |
| "eval_runtime": 88.2165, |
| "eval_samples_per_second": 113.357, |
| "eval_steps_per_second": 3.548, |
| "step": 13000 |
| }, |
| { |
| "epoch": 116.78443113772455, |
| "grad_norm": 0.30239006876945496, |
| "learning_rate": 4.705685618729097e-06, |
| "loss": 6.3824, |
| "step": 13100 |
| }, |
| { |
| "epoch": 116.78443113772455, |
| "eval_loss": 6.402139663696289, |
| "eval_runtime": 88.197, |
| "eval_samples_per_second": 113.382, |
| "eval_steps_per_second": 3.549, |
| "step": 13100 |
| }, |
| { |
| "epoch": 117.6715457972943, |
| "grad_norm": 0.5257315039634705, |
| "learning_rate": 4.695652173913044e-06, |
| "loss": 6.3825, |
| "step": 13200 |
| }, |
| { |
| "epoch": 117.6715457972943, |
| "eval_loss": 6.398579120635986, |
| "eval_runtime": 88.1944, |
| "eval_samples_per_second": 113.386, |
| "eval_steps_per_second": 3.549, |
| "step": 13200 |
| }, |
| { |
| "epoch": 118.55866045686405, |
| "grad_norm": 0.32334333658218384, |
| "learning_rate": 4.6856187290969905e-06, |
| "loss": 6.3822, |
| "step": 13300 |
| }, |
| { |
| "epoch": 118.55866045686405, |
| "eval_loss": 6.406438827514648, |
| "eval_runtime": 88.2027, |
| "eval_samples_per_second": 113.375, |
| "eval_steps_per_second": 3.549, |
| "step": 13300 |
| }, |
| { |
| "epoch": 119.4457751164338, |
| "grad_norm": 0.34099674224853516, |
| "learning_rate": 4.675585284280936e-06, |
| "loss": 6.3817, |
| "step": 13400 |
| }, |
| { |
| "epoch": 119.4457751164338, |
| "eval_loss": 6.404513835906982, |
| "eval_runtime": 88.1855, |
| "eval_samples_per_second": 113.397, |
| "eval_steps_per_second": 3.549, |
| "step": 13400 |
| }, |
| { |
| "epoch": 120.33288977600355, |
| "grad_norm": 0.3633241653442383, |
| "learning_rate": 4.665551839464883e-06, |
| "loss": 6.3817, |
| "step": 13500 |
| }, |
| { |
| "epoch": 120.33288977600355, |
| "eval_loss": 6.398531913757324, |
| "eval_runtime": 88.9997, |
| "eval_samples_per_second": 112.36, |
| "eval_steps_per_second": 3.517, |
| "step": 13500 |
| }, |
| { |
| "epoch": 121.2200044355733, |
| "grad_norm": 0.28118014335632324, |
| "learning_rate": 4.65551839464883e-06, |
| "loss": 6.3818, |
| "step": 13600 |
| }, |
| { |
| "epoch": 121.2200044355733, |
| "eval_loss": 6.400463104248047, |
| "eval_runtime": 88.2057, |
| "eval_samples_per_second": 113.371, |
| "eval_steps_per_second": 3.549, |
| "step": 13600 |
| }, |
| { |
| "epoch": 122.10711909514305, |
| "grad_norm": 0.3721919655799866, |
| "learning_rate": 4.645484949832776e-06, |
| "loss": 6.3812, |
| "step": 13700 |
| }, |
| { |
| "epoch": 122.10711909514305, |
| "eval_loss": 6.405807971954346, |
| "eval_runtime": 88.4667, |
| "eval_samples_per_second": 113.037, |
| "eval_steps_per_second": 3.538, |
| "step": 13700 |
| }, |
| { |
| "epoch": 122.9942337547128, |
| "grad_norm": 0.3147549033164978, |
| "learning_rate": 4.635451505016723e-06, |
| "loss": 6.3814, |
| "step": 13800 |
| }, |
| { |
| "epoch": 122.9942337547128, |
| "eval_loss": 6.402772426605225, |
| "eval_runtime": 89.0204, |
| "eval_samples_per_second": 112.334, |
| "eval_steps_per_second": 3.516, |
| "step": 13800 |
| }, |
| { |
| "epoch": 123.88134841428254, |
| "grad_norm": 0.21372230350971222, |
| "learning_rate": 4.625418060200669e-06, |
| "loss": 6.3804, |
| "step": 13900 |
| }, |
| { |
| "epoch": 123.88134841428254, |
| "eval_loss": 6.403747081756592, |
| "eval_runtime": 88.2131, |
| "eval_samples_per_second": 113.362, |
| "eval_steps_per_second": 3.548, |
| "step": 13900 |
| }, |
| { |
| "epoch": 124.76846307385229, |
| "grad_norm": 0.3438258767127991, |
| "learning_rate": 4.615384615384616e-06, |
| "loss": 6.3814, |
| "step": 14000 |
| }, |
| { |
| "epoch": 124.76846307385229, |
| "eval_loss": 6.397274494171143, |
| "eval_runtime": 88.1984, |
| "eval_samples_per_second": 113.381, |
| "eval_steps_per_second": 3.549, |
| "step": 14000 |
| }, |
| { |
| "epoch": 125.65557773342205, |
| "grad_norm": 0.22329987585544586, |
| "learning_rate": 4.605351170568562e-06, |
| "loss": 6.3806, |
| "step": 14100 |
| }, |
| { |
| "epoch": 125.65557773342205, |
| "eval_loss": 6.4013991355896, |
| "eval_runtime": 88.1883, |
| "eval_samples_per_second": 113.394, |
| "eval_steps_per_second": 3.549, |
| "step": 14100 |
| }, |
| { |
| "epoch": 126.5426923929918, |
| "grad_norm": 0.4979691803455353, |
| "learning_rate": 4.595317725752509e-06, |
| "loss": 6.3806, |
| "step": 14200 |
| }, |
| { |
| "epoch": 126.5426923929918, |
| "eval_loss": 6.398404121398926, |
| "eval_runtime": 88.1886, |
| "eval_samples_per_second": 113.393, |
| "eval_steps_per_second": 3.549, |
| "step": 14200 |
| }, |
| { |
| "epoch": 127.42980705256154, |
| "grad_norm": 0.3812222182750702, |
| "learning_rate": 4.585284280936456e-06, |
| "loss": 6.3797, |
| "step": 14300 |
| }, |
| { |
| "epoch": 127.42980705256154, |
| "eval_loss": 6.403315544128418, |
| "eval_runtime": 88.1816, |
| "eval_samples_per_second": 113.402, |
| "eval_steps_per_second": 3.549, |
| "step": 14300 |
| }, |
| { |
| "epoch": 128.3169217121313, |
| "grad_norm": 0.33830001950263977, |
| "learning_rate": 4.5752508361204015e-06, |
| "loss": 6.38, |
| "step": 14400 |
| }, |
| { |
| "epoch": 128.3169217121313, |
| "eval_loss": 6.399970054626465, |
| "eval_runtime": 88.3617, |
| "eval_samples_per_second": 113.171, |
| "eval_steps_per_second": 3.542, |
| "step": 14400 |
| }, |
| { |
| "epoch": 129.20403637170105, |
| "grad_norm": 0.41163602471351624, |
| "learning_rate": 4.565217391304348e-06, |
| "loss": 6.3801, |
| "step": 14500 |
| }, |
| { |
| "epoch": 129.20403637170105, |
| "eval_loss": 6.398497581481934, |
| "eval_runtime": 88.9909, |
| "eval_samples_per_second": 112.371, |
| "eval_steps_per_second": 3.517, |
| "step": 14500 |
| }, |
| { |
| "epoch": 130.09115103127078, |
| "grad_norm": 0.3605528771877289, |
| "learning_rate": 4.555183946488295e-06, |
| "loss": 6.3795, |
| "step": 14600 |
| }, |
| { |
| "epoch": 130.09115103127078, |
| "eval_loss": 6.401362419128418, |
| "eval_runtime": 88.9771, |
| "eval_samples_per_second": 112.388, |
| "eval_steps_per_second": 3.518, |
| "step": 14600 |
| }, |
| { |
| "epoch": 130.97826569084054, |
| "grad_norm": 0.2761962115764618, |
| "learning_rate": 4.545150501672241e-06, |
| "loss": 6.38, |
| "step": 14700 |
| }, |
| { |
| "epoch": 130.97826569084054, |
| "eval_loss": 6.400545120239258, |
| "eval_runtime": 88.9856, |
| "eval_samples_per_second": 112.378, |
| "eval_steps_per_second": 3.517, |
| "step": 14700 |
| }, |
| { |
| "epoch": 131.86538035041028, |
| "grad_norm": 0.365429162979126, |
| "learning_rate": 4.535117056856188e-06, |
| "loss": 6.3792, |
| "step": 14800 |
| }, |
| { |
| "epoch": 131.86538035041028, |
| "eval_loss": 6.398355484008789, |
| "eval_runtime": 88.1678, |
| "eval_samples_per_second": 113.42, |
| "eval_steps_per_second": 3.55, |
| "step": 14800 |
| }, |
| { |
| "epoch": 132.75249500998004, |
| "grad_norm": 0.38731637597084045, |
| "learning_rate": 4.5250836120401345e-06, |
| "loss": 6.3786, |
| "step": 14900 |
| }, |
| { |
| "epoch": 132.75249500998004, |
| "eval_loss": 6.404902458190918, |
| "eval_runtime": 88.9734, |
| "eval_samples_per_second": 112.393, |
| "eval_steps_per_second": 3.518, |
| "step": 14900 |
| }, |
| { |
| "epoch": 133.6396096695498, |
| "grad_norm": 0.4588160514831543, |
| "learning_rate": 4.51505016722408e-06, |
| "loss": 6.3786, |
| "step": 15000 |
| }, |
| { |
| "epoch": 133.6396096695498, |
| "eval_loss": 6.4006571769714355, |
| "eval_runtime": 88.1689, |
| "eval_samples_per_second": 113.419, |
| "eval_steps_per_second": 3.55, |
| "step": 15000 |
| }, |
| { |
| "epoch": 134.52672432911953, |
| "grad_norm": 0.36677706241607666, |
| "learning_rate": 4.505016722408027e-06, |
| "loss": 6.3781, |
| "step": 15100 |
| }, |
| { |
| "epoch": 134.52672432911953, |
| "eval_loss": 6.399155616760254, |
| "eval_runtime": 88.1918, |
| "eval_samples_per_second": 113.389, |
| "eval_steps_per_second": 3.549, |
| "step": 15100 |
| }, |
| { |
| "epoch": 135.4138389886893, |
| "grad_norm": 0.45701250433921814, |
| "learning_rate": 4.494983277591973e-06, |
| "loss": 6.3784, |
| "step": 15200 |
| }, |
| { |
| "epoch": 135.4138389886893, |
| "eval_loss": 6.398295879364014, |
| "eval_runtime": 88.4103, |
| "eval_samples_per_second": 113.109, |
| "eval_steps_per_second": 3.54, |
| "step": 15200 |
| }, |
| { |
| "epoch": 136.30095364825902, |
| "grad_norm": 0.325771689414978, |
| "learning_rate": 4.48494983277592e-06, |
| "loss": 6.3782, |
| "step": 15300 |
| }, |
| { |
| "epoch": 136.30095364825902, |
| "eval_loss": 6.395936489105225, |
| "eval_runtime": 88.9861, |
| "eval_samples_per_second": 112.377, |
| "eval_steps_per_second": 3.517, |
| "step": 15300 |
| }, |
| { |
| "epoch": 137.1880683078288, |
| "grad_norm": 0.4405640959739685, |
| "learning_rate": 4.474916387959866e-06, |
| "loss": 6.3787, |
| "step": 15400 |
| }, |
| { |
| "epoch": 137.1880683078288, |
| "eval_loss": 6.403024196624756, |
| "eval_runtime": 89.0043, |
| "eval_samples_per_second": 112.354, |
| "eval_steps_per_second": 3.517, |
| "step": 15400 |
| }, |
| { |
| "epoch": 138.07518296739855, |
| "grad_norm": 0.38074126839637756, |
| "learning_rate": 4.4648829431438125e-06, |
| "loss": 6.3784, |
| "step": 15500 |
| }, |
| { |
| "epoch": 138.07518296739855, |
| "eval_loss": 6.396382808685303, |
| "eval_runtime": 89.0099, |
| "eval_samples_per_second": 112.347, |
| "eval_steps_per_second": 3.516, |
| "step": 15500 |
| }, |
| { |
| "epoch": 138.96229762696828, |
| "grad_norm": 0.3605077862739563, |
| "learning_rate": 4.454849498327759e-06, |
| "loss": 6.3776, |
| "step": 15600 |
| }, |
| { |
| "epoch": 138.96229762696828, |
| "eval_loss": 6.398861885070801, |
| "eval_runtime": 88.1985, |
| "eval_samples_per_second": 113.381, |
| "eval_steps_per_second": 3.549, |
| "step": 15600 |
| }, |
| { |
| "epoch": 139.84941228653804, |
| "grad_norm": 0.3661845028400421, |
| "learning_rate": 4.444816053511705e-06, |
| "loss": 6.3783, |
| "step": 15700 |
| }, |
| { |
| "epoch": 139.84941228653804, |
| "eval_loss": 6.395369529724121, |
| "eval_runtime": 88.2035, |
| "eval_samples_per_second": 113.374, |
| "eval_steps_per_second": 3.549, |
| "step": 15700 |
| }, |
| { |
| "epoch": 140.73652694610777, |
| "grad_norm": 0.30928805470466614, |
| "learning_rate": 4.434782608695652e-06, |
| "loss": 6.3774, |
| "step": 15800 |
| }, |
| { |
| "epoch": 140.73652694610777, |
| "eval_loss": 6.397764682769775, |
| "eval_runtime": 88.2064, |
| "eval_samples_per_second": 113.37, |
| "eval_steps_per_second": 3.548, |
| "step": 15800 |
| }, |
| { |
| "epoch": 141.62364160567753, |
| "grad_norm": 0.2911752462387085, |
| "learning_rate": 4.424749163879599e-06, |
| "loss": 6.3774, |
| "step": 15900 |
| }, |
| { |
| "epoch": 141.62364160567753, |
| "eval_loss": 6.392827033996582, |
| "eval_runtime": 88.2018, |
| "eval_samples_per_second": 113.376, |
| "eval_steps_per_second": 3.549, |
| "step": 15900 |
| }, |
| { |
| "epoch": 142.5107562652473, |
| "grad_norm": 0.36379653215408325, |
| "learning_rate": 4.414715719063545e-06, |
| "loss": 6.3769, |
| "step": 16000 |
| }, |
| { |
| "epoch": 142.5107562652473, |
| "eval_loss": 6.394837379455566, |
| "eval_runtime": 88.1516, |
| "eval_samples_per_second": 113.441, |
| "eval_steps_per_second": 3.551, |
| "step": 16000 |
| }, |
| { |
| "epoch": 143.39787092481703, |
| "grad_norm": 0.3171352744102478, |
| "learning_rate": 4.404682274247491e-06, |
| "loss": 6.3775, |
| "step": 16100 |
| }, |
| { |
| "epoch": 143.39787092481703, |
| "eval_loss": 6.400154113769531, |
| "eval_runtime": 89.0041, |
| "eval_samples_per_second": 112.354, |
| "eval_steps_per_second": 3.517, |
| "step": 16100 |
| }, |
| { |
| "epoch": 144.2849855843868, |
| "grad_norm": 0.28629449009895325, |
| "learning_rate": 4.394648829431438e-06, |
| "loss": 6.3759, |
| "step": 16200 |
| }, |
| { |
| "epoch": 144.2849855843868, |
| "eval_loss": 6.39397668838501, |
| "eval_runtime": 88.9886, |
| "eval_samples_per_second": 112.374, |
| "eval_steps_per_second": 3.517, |
| "step": 16200 |
| }, |
| { |
| "epoch": 145.17210024395652, |
| "grad_norm": 0.20145787298679352, |
| "learning_rate": 4.384615384615384e-06, |
| "loss": 6.3771, |
| "step": 16300 |
| }, |
| { |
| "epoch": 145.17210024395652, |
| "eval_loss": 6.394731521606445, |
| "eval_runtime": 88.9884, |
| "eval_samples_per_second": 112.374, |
| "eval_steps_per_second": 3.517, |
| "step": 16300 |
| }, |
| { |
| "epoch": 146.05921490352628, |
| "grad_norm": 0.3465804159641266, |
| "learning_rate": 4.374581939799331e-06, |
| "loss": 6.3773, |
| "step": 16400 |
| }, |
| { |
| "epoch": 146.05921490352628, |
| "eval_loss": 6.397264003753662, |
| "eval_runtime": 88.9701, |
| "eval_samples_per_second": 112.397, |
| "eval_steps_per_second": 3.518, |
| "step": 16400 |
| }, |
| { |
| "epoch": 146.94632956309604, |
| "grad_norm": 0.37951675057411194, |
| "learning_rate": 4.364548494983278e-06, |
| "loss": 6.3765, |
| "step": 16500 |
| }, |
| { |
| "epoch": 146.94632956309604, |
| "eval_loss": 6.393067359924316, |
| "eval_runtime": 88.2113, |
| "eval_samples_per_second": 113.364, |
| "eval_steps_per_second": 3.548, |
| "step": 16500 |
| }, |
| { |
| "epoch": 147.83344422266578, |
| "grad_norm": 0.28946706652641296, |
| "learning_rate": 4.354515050167224e-06, |
| "loss": 6.3766, |
| "step": 16600 |
| }, |
| { |
| "epoch": 147.83344422266578, |
| "eval_loss": 6.395288467407227, |
| "eval_runtime": 88.2164, |
| "eval_samples_per_second": 113.358, |
| "eval_steps_per_second": 3.548, |
| "step": 16600 |
| }, |
| { |
| "epoch": 148.72055888223554, |
| "grad_norm": 0.33570635318756104, |
| "learning_rate": 4.34448160535117e-06, |
| "loss": 6.3766, |
| "step": 16700 |
| }, |
| { |
| "epoch": 148.72055888223554, |
| "eval_loss": 6.3955864906311035, |
| "eval_runtime": 88.202, |
| "eval_samples_per_second": 113.376, |
| "eval_steps_per_second": 3.549, |
| "step": 16700 |
| }, |
| { |
| "epoch": 149.60767354180527, |
| "grad_norm": 0.2830164134502411, |
| "learning_rate": 4.334448160535117e-06, |
| "loss": 6.3765, |
| "step": 16800 |
| }, |
| { |
| "epoch": 149.60767354180527, |
| "eval_loss": 6.393207550048828, |
| "eval_runtime": 88.1971, |
| "eval_samples_per_second": 113.382, |
| "eval_steps_per_second": 3.549, |
| "step": 16800 |
| }, |
| { |
| "epoch": 150.49478820137503, |
| "grad_norm": 0.3951200544834137, |
| "learning_rate": 4.324414715719064e-06, |
| "loss": 6.3754, |
| "step": 16900 |
| }, |
| { |
| "epoch": 150.49478820137503, |
| "eval_loss": 6.3931732177734375, |
| "eval_runtime": 88.1964, |
| "eval_samples_per_second": 113.383, |
| "eval_steps_per_second": 3.549, |
| "step": 16900 |
| }, |
| { |
| "epoch": 151.3819028609448, |
| "grad_norm": 0.40401121973991394, |
| "learning_rate": 4.31438127090301e-06, |
| "loss": 6.3767, |
| "step": 17000 |
| }, |
| { |
| "epoch": 151.3819028609448, |
| "eval_loss": 6.395325183868408, |
| "eval_runtime": 89.0101, |
| "eval_samples_per_second": 112.347, |
| "eval_steps_per_second": 3.516, |
| "step": 17000 |
| }, |
| { |
| "epoch": 152.26901752051452, |
| "grad_norm": 0.35907265543937683, |
| "learning_rate": 4.3043478260869565e-06, |
| "loss": 6.3756, |
| "step": 17100 |
| }, |
| { |
| "epoch": 152.26901752051452, |
| "eval_loss": 6.391872882843018, |
| "eval_runtime": 88.9952, |
| "eval_samples_per_second": 112.366, |
| "eval_steps_per_second": 3.517, |
| "step": 17100 |
| }, |
| { |
| "epoch": 153.15613218008428, |
| "grad_norm": 0.20859681069850922, |
| "learning_rate": 4.294314381270903e-06, |
| "loss": 6.376, |
| "step": 17200 |
| }, |
| { |
| "epoch": 153.15613218008428, |
| "eval_loss": 6.389963150024414, |
| "eval_runtime": 95.4338, |
| "eval_samples_per_second": 104.785, |
| "eval_steps_per_second": 3.28, |
| "step": 17200 |
| }, |
| { |
| "epoch": 154.04324683965402, |
| "grad_norm": 0.23594261705875397, |
| "learning_rate": 4.284280936454849e-06, |
| "loss": 6.3755, |
| "step": 17300 |
| }, |
| { |
| "epoch": 154.04324683965402, |
| "eval_loss": 6.392347812652588, |
| "eval_runtime": 88.9816, |
| "eval_samples_per_second": 112.383, |
| "eval_steps_per_second": 3.518, |
| "step": 17300 |
| }, |
| { |
| "epoch": 154.93036149922378, |
| "grad_norm": 0.38356783986091614, |
| "learning_rate": 4.274247491638796e-06, |
| "loss": 6.3754, |
| "step": 17400 |
| }, |
| { |
| "epoch": 154.93036149922378, |
| "eval_loss": 6.3949875831604, |
| "eval_runtime": 88.1932, |
| "eval_samples_per_second": 113.387, |
| "eval_steps_per_second": 3.549, |
| "step": 17400 |
| }, |
| { |
| "epoch": 155.8174761587935, |
| "grad_norm": 0.48420754075050354, |
| "learning_rate": 4.264214046822743e-06, |
| "loss": 6.3755, |
| "step": 17500 |
| }, |
| { |
| "epoch": 155.8174761587935, |
| "eval_loss": 6.391012668609619, |
| "eval_runtime": 88.1801, |
| "eval_samples_per_second": 113.404, |
| "eval_steps_per_second": 3.55, |
| "step": 17500 |
| }, |
| { |
| "epoch": 156.70459081836327, |
| "grad_norm": 0.2329307347536087, |
| "learning_rate": 4.254180602006689e-06, |
| "loss": 6.3749, |
| "step": 17600 |
| }, |
| { |
| "epoch": 156.70459081836327, |
| "eval_loss": 6.396329879760742, |
| "eval_runtime": 88.202, |
| "eval_samples_per_second": 113.376, |
| "eval_steps_per_second": 3.549, |
| "step": 17600 |
| }, |
| { |
| "epoch": 157.59170547793303, |
| "grad_norm": 0.3357428312301636, |
| "learning_rate": 4.244147157190635e-06, |
| "loss": 6.3742, |
| "step": 17700 |
| }, |
| { |
| "epoch": 157.59170547793303, |
| "eval_loss": 6.396499156951904, |
| "eval_runtime": 88.2077, |
| "eval_samples_per_second": 113.369, |
| "eval_steps_per_second": 3.548, |
| "step": 17700 |
| }, |
| { |
| "epoch": 158.47882013750277, |
| "grad_norm": 0.34573179483413696, |
| "learning_rate": 4.234113712374582e-06, |
| "loss": 6.3751, |
| "step": 17800 |
| }, |
| { |
| "epoch": 158.47882013750277, |
| "eval_loss": 6.397115707397461, |
| "eval_runtime": 89.0011, |
| "eval_samples_per_second": 112.358, |
| "eval_steps_per_second": 3.517, |
| "step": 17800 |
| }, |
| { |
| "epoch": 159.36593479707253, |
| "grad_norm": 0.2784799039363861, |
| "learning_rate": 4.224080267558528e-06, |
| "loss": 6.3746, |
| "step": 17900 |
| }, |
| { |
| "epoch": 159.36593479707253, |
| "eval_loss": 6.3902907371521, |
| "eval_runtime": 88.9792, |
| "eval_samples_per_second": 112.386, |
| "eval_steps_per_second": 3.518, |
| "step": 17900 |
| }, |
| { |
| "epoch": 160.25304945664226, |
| "grad_norm": 0.3247807025909424, |
| "learning_rate": 4.214046822742475e-06, |
| "loss": 6.3752, |
| "step": 18000 |
| }, |
| { |
| "epoch": 160.25304945664226, |
| "eval_loss": 6.3876519203186035, |
| "eval_runtime": 88.2968, |
| "eval_samples_per_second": 113.254, |
| "eval_steps_per_second": 3.545, |
| "step": 18000 |
| }, |
| { |
| "epoch": 161.14016411621202, |
| "grad_norm": 0.34148281812667847, |
| "learning_rate": 4.2040133779264216e-06, |
| "loss": 6.3743, |
| "step": 18100 |
| }, |
| { |
| "epoch": 161.14016411621202, |
| "eval_loss": 6.394918918609619, |
| "eval_runtime": 88.2131, |
| "eval_samples_per_second": 113.362, |
| "eval_steps_per_second": 3.548, |
| "step": 18100 |
| }, |
| { |
| "epoch": 162.02727877578178, |
| "grad_norm": 0.26453569531440735, |
| "learning_rate": 4.1939799331103675e-06, |
| "loss": 6.3745, |
| "step": 18200 |
| }, |
| { |
| "epoch": 162.02727877578178, |
| "eval_loss": 6.392609596252441, |
| "eval_runtime": 88.4146, |
| "eval_samples_per_second": 113.104, |
| "eval_steps_per_second": 3.54, |
| "step": 18200 |
| }, |
| { |
| "epoch": 162.9143934353515, |
| "grad_norm": 0.3914986848831177, |
| "learning_rate": 4.183946488294314e-06, |
| "loss": 6.373, |
| "step": 18300 |
| }, |
| { |
| "epoch": 162.9143934353515, |
| "eval_loss": 6.394564628601074, |
| "eval_runtime": 89.0398, |
| "eval_samples_per_second": 112.309, |
| "eval_steps_per_second": 3.515, |
| "step": 18300 |
| }, |
| { |
| "epoch": 163.80150809492127, |
| "grad_norm": 0.28945302963256836, |
| "learning_rate": 4.173913043478261e-06, |
| "loss": 6.3742, |
| "step": 18400 |
| }, |
| { |
| "epoch": 163.80150809492127, |
| "eval_loss": 6.388834476470947, |
| "eval_runtime": 88.9988, |
| "eval_samples_per_second": 112.361, |
| "eval_steps_per_second": 3.517, |
| "step": 18400 |
| }, |
| { |
| "epoch": 164.688622754491, |
| "grad_norm": 0.3480592370033264, |
| "learning_rate": 4.163879598662208e-06, |
| "loss": 6.3744, |
| "step": 18500 |
| }, |
| { |
| "epoch": 164.688622754491, |
| "eval_loss": 6.389362335205078, |
| "eval_runtime": 88.197, |
| "eval_samples_per_second": 113.383, |
| "eval_steps_per_second": 3.549, |
| "step": 18500 |
| }, |
| { |
| "epoch": 165.57573741406077, |
| "grad_norm": 0.3804326355457306, |
| "learning_rate": 4.153846153846154e-06, |
| "loss": 6.3738, |
| "step": 18600 |
| }, |
| { |
| "epoch": 165.57573741406077, |
| "eval_loss": 6.391166687011719, |
| "eval_runtime": 88.1914, |
| "eval_samples_per_second": 113.39, |
| "eval_steps_per_second": 3.549, |
| "step": 18600 |
| }, |
| { |
| "epoch": 166.46285207363053, |
| "grad_norm": 0.3824601471424103, |
| "learning_rate": 4.1438127090301005e-06, |
| "loss": 6.3739, |
| "step": 18700 |
| }, |
| { |
| "epoch": 166.46285207363053, |
| "eval_loss": 6.391639709472656, |
| "eval_runtime": 89.0022, |
| "eval_samples_per_second": 112.357, |
| "eval_steps_per_second": 3.517, |
| "step": 18700 |
| }, |
| { |
| "epoch": 167.34996673320026, |
| "grad_norm": 0.5406671762466431, |
| "learning_rate": 4.133779264214047e-06, |
| "loss": 6.3745, |
| "step": 18800 |
| }, |
| { |
| "epoch": 167.34996673320026, |
| "eval_loss": 6.395472049713135, |
| "eval_runtime": 89.0201, |
| "eval_samples_per_second": 112.334, |
| "eval_steps_per_second": 3.516, |
| "step": 18800 |
| }, |
| { |
| "epoch": 168.23708139277002, |
| "grad_norm": 0.2246076464653015, |
| "learning_rate": 4.123745819397993e-06, |
| "loss": 6.3732, |
| "step": 18900 |
| }, |
| { |
| "epoch": 168.23708139277002, |
| "eval_loss": 6.391103744506836, |
| "eval_runtime": 89.0121, |
| "eval_samples_per_second": 112.344, |
| "eval_steps_per_second": 3.516, |
| "step": 18900 |
| }, |
| { |
| "epoch": 169.12419605233976, |
| "grad_norm": 0.2771269977092743, |
| "learning_rate": 4.11371237458194e-06, |
| "loss": 6.3734, |
| "step": 19000 |
| }, |
| { |
| "epoch": 169.12419605233976, |
| "eval_loss": 6.390963077545166, |
| "eval_runtime": 88.1853, |
| "eval_samples_per_second": 113.398, |
| "eval_steps_per_second": 3.549, |
| "step": 19000 |
| }, |
| { |
| "epoch": 170.01131071190952, |
| "grad_norm": 0.2982538640499115, |
| "learning_rate": 4.103678929765887e-06, |
| "loss": 6.3746, |
| "step": 19100 |
| }, |
| { |
| "epoch": 170.01131071190952, |
| "eval_loss": 6.398984432220459, |
| "eval_runtime": 88.1945, |
| "eval_samples_per_second": 113.386, |
| "eval_steps_per_second": 3.549, |
| "step": 19100 |
| }, |
| { |
| "epoch": 170.89842537147928, |
| "grad_norm": 0.22554722428321838, |
| "learning_rate": 4.0936454849498326e-06, |
| "loss": 6.3732, |
| "step": 19200 |
| }, |
| { |
| "epoch": 170.89842537147928, |
| "eval_loss": 6.391036033630371, |
| "eval_runtime": 88.1888, |
| "eval_samples_per_second": 113.393, |
| "eval_steps_per_second": 3.549, |
| "step": 19200 |
| }, |
| { |
| "epoch": 171.785540031049, |
| "grad_norm": 0.3837653398513794, |
| "learning_rate": 4.083612040133779e-06, |
| "loss": 6.374, |
| "step": 19300 |
| }, |
| { |
| "epoch": 171.785540031049, |
| "eval_loss": 6.392332553863525, |
| "eval_runtime": 88.1841, |
| "eval_samples_per_second": 113.399, |
| "eval_steps_per_second": 3.549, |
| "step": 19300 |
| }, |
| { |
| "epoch": 172.67265469061877, |
| "grad_norm": 0.4505990445613861, |
| "learning_rate": 4.073578595317726e-06, |
| "loss": 6.3736, |
| "step": 19400 |
| }, |
| { |
| "epoch": 172.67265469061877, |
| "eval_loss": 6.393078327178955, |
| "eval_runtime": 88.1837, |
| "eval_samples_per_second": 113.4, |
| "eval_steps_per_second": 3.549, |
| "step": 19400 |
| }, |
| { |
| "epoch": 173.5597693501885, |
| "grad_norm": 0.2350095808506012, |
| "learning_rate": 4.063545150501672e-06, |
| "loss": 6.3729, |
| "step": 19500 |
| }, |
| { |
| "epoch": 173.5597693501885, |
| "eval_loss": 6.391619682312012, |
| "eval_runtime": 88.1784, |
| "eval_samples_per_second": 113.406, |
| "eval_steps_per_second": 3.55, |
| "step": 19500 |
| }, |
| { |
| "epoch": 174.44688400975826, |
| "grad_norm": 0.36420518159866333, |
| "learning_rate": 4.053511705685619e-06, |
| "loss": 6.373, |
| "step": 19600 |
| }, |
| { |
| "epoch": 174.44688400975826, |
| "eval_loss": 6.386290550231934, |
| "eval_runtime": 88.1738, |
| "eval_samples_per_second": 113.412, |
| "eval_steps_per_second": 3.55, |
| "step": 19600 |
| }, |
| { |
| "epoch": 175.333998669328, |
| "grad_norm": 0.4323490560054779, |
| "learning_rate": 4.0434782608695655e-06, |
| "loss": 6.3731, |
| "step": 19700 |
| }, |
| { |
| "epoch": 175.333998669328, |
| "eval_loss": 6.385765075683594, |
| "eval_runtime": 89.0281, |
| "eval_samples_per_second": 112.324, |
| "eval_steps_per_second": 3.516, |
| "step": 19700 |
| }, |
| { |
| "epoch": 176.22111332889776, |
| "grad_norm": 0.37750956416130066, |
| "learning_rate": 4.0334448160535115e-06, |
| "loss": 6.373, |
| "step": 19800 |
| }, |
| { |
| "epoch": 176.22111332889776, |
| "eval_loss": 6.3935017585754395, |
| "eval_runtime": 88.1584, |
| "eval_samples_per_second": 113.432, |
| "eval_steps_per_second": 3.55, |
| "step": 19800 |
| }, |
| { |
| "epoch": 177.10822798846752, |
| "grad_norm": 0.28360995650291443, |
| "learning_rate": 4.023411371237458e-06, |
| "loss": 6.3736, |
| "step": 19900 |
| }, |
| { |
| "epoch": 177.10822798846752, |
| "eval_loss": 6.388575077056885, |
| "eval_runtime": 88.1723, |
| "eval_samples_per_second": 113.414, |
| "eval_steps_per_second": 3.55, |
| "step": 19900 |
| }, |
| { |
| "epoch": 177.99534264803725, |
| "grad_norm": 0.2375970482826233, |
| "learning_rate": 4.013377926421405e-06, |
| "loss": 6.3722, |
| "step": 20000 |
| }, |
| { |
| "epoch": 177.99534264803725, |
| "eval_loss": 6.387614727020264, |
| "eval_runtime": 88.1835, |
| "eval_samples_per_second": 113.4, |
| "eval_steps_per_second": 3.549, |
| "step": 20000 |
| }, |
| { |
| "epoch": 178.882457307607, |
| "grad_norm": 0.2644791901111603, |
| "learning_rate": 4.003344481605351e-06, |
| "loss": 6.3732, |
| "step": 20100 |
| }, |
| { |
| "epoch": 178.882457307607, |
| "eval_loss": 6.388434410095215, |
| "eval_runtime": 88.9803, |
| "eval_samples_per_second": 112.384, |
| "eval_steps_per_second": 3.518, |
| "step": 20100 |
| }, |
| { |
| "epoch": 179.76957196717674, |
| "grad_norm": 0.3010362386703491, |
| "learning_rate": 3.993311036789298e-06, |
| "loss": 6.3723, |
| "step": 20200 |
| }, |
| { |
| "epoch": 179.76957196717674, |
| "eval_loss": 6.388959884643555, |
| "eval_runtime": 88.7132, |
| "eval_samples_per_second": 112.723, |
| "eval_steps_per_second": 3.528, |
| "step": 20200 |
| }, |
| { |
| "epoch": 180.6566866267465, |
| "grad_norm": 0.33606797456741333, |
| "learning_rate": 3.9832775919732444e-06, |
| "loss": 6.3728, |
| "step": 20300 |
| }, |
| { |
| "epoch": 180.6566866267465, |
| "eval_loss": 6.3911051750183105, |
| "eval_runtime": 88.163, |
| "eval_samples_per_second": 113.426, |
| "eval_steps_per_second": 3.55, |
| "step": 20300 |
| }, |
| { |
| "epoch": 181.54380128631627, |
| "grad_norm": 0.2511981725692749, |
| "learning_rate": 3.97324414715719e-06, |
| "loss": 6.3715, |
| "step": 20400 |
| }, |
| { |
| "epoch": 181.54380128631627, |
| "eval_loss": 6.390799045562744, |
| "eval_runtime": 88.9917, |
| "eval_samples_per_second": 112.37, |
| "eval_steps_per_second": 3.517, |
| "step": 20400 |
| }, |
| { |
| "epoch": 182.430915945886, |
| "grad_norm": 0.4115006923675537, |
| "learning_rate": 3.963210702341137e-06, |
| "loss": 6.3722, |
| "step": 20500 |
| }, |
| { |
| "epoch": 182.430915945886, |
| "eval_loss": 6.391343116760254, |
| "eval_runtime": 89.0042, |
| "eval_samples_per_second": 112.354, |
| "eval_steps_per_second": 3.517, |
| "step": 20500 |
| }, |
| { |
| "epoch": 183.31803060545576, |
| "grad_norm": 0.37600409984588623, |
| "learning_rate": 3.953177257525084e-06, |
| "loss": 6.3732, |
| "step": 20600 |
| }, |
| { |
| "epoch": 183.31803060545576, |
| "eval_loss": 6.3869404792785645, |
| "eval_runtime": 88.1885, |
| "eval_samples_per_second": 113.393, |
| "eval_steps_per_second": 3.549, |
| "step": 20600 |
| }, |
| { |
| "epoch": 184.2051452650255, |
| "grad_norm": 0.2008831650018692, |
| "learning_rate": 3.943143812709031e-06, |
| "loss": 6.3717, |
| "step": 20700 |
| }, |
| { |
| "epoch": 184.2051452650255, |
| "eval_loss": 6.388400077819824, |
| "eval_runtime": 89.0024, |
| "eval_samples_per_second": 112.357, |
| "eval_steps_per_second": 3.517, |
| "step": 20700 |
| }, |
| { |
| "epoch": 185.09225992459525, |
| "grad_norm": 0.2809048891067505, |
| "learning_rate": 3.9331103678929765e-06, |
| "loss": 6.3716, |
| "step": 20800 |
| }, |
| { |
| "epoch": 185.09225992459525, |
| "eval_loss": 6.388489723205566, |
| "eval_runtime": 89.025, |
| "eval_samples_per_second": 112.328, |
| "eval_steps_per_second": 3.516, |
| "step": 20800 |
| }, |
| { |
| "epoch": 185.97937458416501, |
| "grad_norm": 0.3136514127254486, |
| "learning_rate": 3.923076923076923e-06, |
| "loss": 6.3722, |
| "step": 20900 |
| }, |
| { |
| "epoch": 185.97937458416501, |
| "eval_loss": 6.38933801651001, |
| "eval_runtime": 88.1827, |
| "eval_samples_per_second": 113.401, |
| "eval_steps_per_second": 3.549, |
| "step": 20900 |
| }, |
| { |
| "epoch": 186.86648924373475, |
| "grad_norm": 0.3162117004394531, |
| "learning_rate": 3.91304347826087e-06, |
| "loss": 6.371, |
| "step": 21000 |
| }, |
| { |
| "epoch": 186.86648924373475, |
| "eval_loss": 6.390033721923828, |
| "eval_runtime": 88.1889, |
| "eval_samples_per_second": 113.393, |
| "eval_steps_per_second": 3.549, |
| "step": 21000 |
| }, |
| { |
| "epoch": 187.7536039033045, |
| "grad_norm": 0.23877596855163574, |
| "learning_rate": 3.903010033444816e-06, |
| "loss": 6.3721, |
| "step": 21100 |
| }, |
| { |
| "epoch": 187.7536039033045, |
| "eval_loss": 6.386390686035156, |
| "eval_runtime": 88.199, |
| "eval_samples_per_second": 113.38, |
| "eval_steps_per_second": 3.549, |
| "step": 21100 |
| }, |
| { |
| "epoch": 188.64071856287424, |
| "grad_norm": 0.2724982500076294, |
| "learning_rate": 3.892976588628763e-06, |
| "loss": 6.3721, |
| "step": 21200 |
| }, |
| { |
| "epoch": 188.64071856287424, |
| "eval_loss": 6.392521858215332, |
| "eval_runtime": 88.1971, |
| "eval_samples_per_second": 113.382, |
| "eval_steps_per_second": 3.549, |
| "step": 21200 |
| }, |
| { |
| "epoch": 189.527833222444, |
| "grad_norm": 0.3006499707698822, |
| "learning_rate": 3.8829431438127095e-06, |
| "loss": 6.3718, |
| "step": 21300 |
| }, |
| { |
| "epoch": 189.527833222444, |
| "eval_loss": 6.38844633102417, |
| "eval_runtime": 89.0375, |
| "eval_samples_per_second": 112.312, |
| "eval_steps_per_second": 3.515, |
| "step": 21300 |
| }, |
| { |
| "epoch": 190.41494788201376, |
| "grad_norm": 0.23349860310554504, |
| "learning_rate": 3.8729096989966554e-06, |
| "loss": 6.3721, |
| "step": 21400 |
| }, |
| { |
| "epoch": 190.41494788201376, |
| "eval_loss": 6.385097503662109, |
| "eval_runtime": 89.0004, |
| "eval_samples_per_second": 112.359, |
| "eval_steps_per_second": 3.517, |
| "step": 21400 |
| }, |
| { |
| "epoch": 191.3020625415835, |
| "grad_norm": 0.23078705370426178, |
| "learning_rate": 3.862876254180602e-06, |
| "loss": 6.371, |
| "step": 21500 |
| }, |
| { |
| "epoch": 191.3020625415835, |
| "eval_loss": 6.389979839324951, |
| "eval_runtime": 88.1937, |
| "eval_samples_per_second": 113.387, |
| "eval_steps_per_second": 3.549, |
| "step": 21500 |
| }, |
| { |
| "epoch": 192.18917720115326, |
| "grad_norm": 0.22322630882263184, |
| "learning_rate": 3.852842809364549e-06, |
| "loss": 6.3725, |
| "step": 21600 |
| }, |
| { |
| "epoch": 192.18917720115326, |
| "eval_loss": 6.38612699508667, |
| "eval_runtime": 89.0235, |
| "eval_samples_per_second": 112.33, |
| "eval_steps_per_second": 3.516, |
| "step": 21600 |
| }, |
| { |
| "epoch": 193.076291860723, |
| "grad_norm": 0.34750744700431824, |
| "learning_rate": 3.842809364548495e-06, |
| "loss": 6.3708, |
| "step": 21700 |
| }, |
| { |
| "epoch": 193.076291860723, |
| "eval_loss": 6.3872575759887695, |
| "eval_runtime": 88.1897, |
| "eval_samples_per_second": 113.392, |
| "eval_steps_per_second": 3.549, |
| "step": 21700 |
| }, |
| { |
| "epoch": 193.96340652029275, |
| "grad_norm": 0.22122953832149506, |
| "learning_rate": 3.832775919732442e-06, |
| "loss": 6.372, |
| "step": 21800 |
| }, |
| { |
| "epoch": 193.96340652029275, |
| "eval_loss": 6.389639854431152, |
| "eval_runtime": 88.1935, |
| "eval_samples_per_second": 113.387, |
| "eval_steps_per_second": 3.549, |
| "step": 21800 |
| }, |
| { |
| "epoch": 194.8505211798625, |
| "grad_norm": 0.20957332849502563, |
| "learning_rate": 3.822742474916388e-06, |
| "loss": 6.3723, |
| "step": 21900 |
| }, |
| { |
| "epoch": 194.8505211798625, |
| "eval_loss": 6.3914899826049805, |
| "eval_runtime": 88.631, |
| "eval_samples_per_second": 112.827, |
| "eval_steps_per_second": 3.531, |
| "step": 21900 |
| }, |
| { |
| "epoch": 195.73763583943224, |
| "grad_norm": 0.24526910483837128, |
| "learning_rate": 3.8127090301003347e-06, |
| "loss": 6.3713, |
| "step": 22000 |
| }, |
| { |
| "epoch": 195.73763583943224, |
| "eval_loss": 6.390371799468994, |
| "eval_runtime": 88.1852, |
| "eval_samples_per_second": 113.398, |
| "eval_steps_per_second": 3.549, |
| "step": 22000 |
| }, |
| { |
| "epoch": 196.624750499002, |
| "grad_norm": 0.28146272897720337, |
| "learning_rate": 3.802675585284281e-06, |
| "loss": 6.3711, |
| "step": 22100 |
| }, |
| { |
| "epoch": 196.624750499002, |
| "eval_loss": 6.388413906097412, |
| "eval_runtime": 88.1826, |
| "eval_samples_per_second": 113.401, |
| "eval_steps_per_second": 3.549, |
| "step": 22100 |
| }, |
| { |
| "epoch": 197.51186515857174, |
| "grad_norm": 0.42305833101272583, |
| "learning_rate": 3.792642140468228e-06, |
| "loss": 6.3712, |
| "step": 22200 |
| }, |
| { |
| "epoch": 197.51186515857174, |
| "eval_loss": 6.388478755950928, |
| "eval_runtime": 88.9985, |
| "eval_samples_per_second": 112.361, |
| "eval_steps_per_second": 3.517, |
| "step": 22200 |
| }, |
| { |
| "epoch": 198.3989798181415, |
| "grad_norm": 0.2139986753463745, |
| "learning_rate": 3.782608695652174e-06, |
| "loss": 6.3705, |
| "step": 22300 |
| }, |
| { |
| "epoch": 198.3989798181415, |
| "eval_loss": 6.390077114105225, |
| "eval_runtime": 88.9954, |
| "eval_samples_per_second": 112.365, |
| "eval_steps_per_second": 3.517, |
| "step": 22300 |
| }, |
| { |
| "epoch": 199.28609447771123, |
| "grad_norm": 0.28066742420196533, |
| "learning_rate": 3.7725752508361205e-06, |
| "loss": 6.3712, |
| "step": 22400 |
| }, |
| { |
| "epoch": 199.28609447771123, |
| "eval_loss": 6.386248588562012, |
| "eval_runtime": 88.1802, |
| "eval_samples_per_second": 113.404, |
| "eval_steps_per_second": 3.55, |
| "step": 22400 |
| }, |
| { |
| "epoch": 200.173209137281, |
| "grad_norm": 0.30369654297828674, |
| "learning_rate": 3.7625418060200673e-06, |
| "loss": 6.3703, |
| "step": 22500 |
| }, |
| { |
| "epoch": 200.173209137281, |
| "eval_loss": 6.390934944152832, |
| "eval_runtime": 88.9996, |
| "eval_samples_per_second": 112.36, |
| "eval_steps_per_second": 3.517, |
| "step": 22500 |
| }, |
| { |
| "epoch": 201.06032379685075, |
| "grad_norm": 0.2702006995677948, |
| "learning_rate": 3.7525083612040136e-06, |
| "loss": 6.3711, |
| "step": 22600 |
| }, |
| { |
| "epoch": 201.06032379685075, |
| "eval_loss": 6.38742208480835, |
| "eval_runtime": 88.1934, |
| "eval_samples_per_second": 113.387, |
| "eval_steps_per_second": 3.549, |
| "step": 22600 |
| }, |
| { |
| "epoch": 201.94743845642049, |
| "grad_norm": 0.2468644678592682, |
| "learning_rate": 3.74247491638796e-06, |
| "loss": 6.3717, |
| "step": 22700 |
| }, |
| { |
| "epoch": 201.94743845642049, |
| "eval_loss": 6.383710861206055, |
| "eval_runtime": 88.1839, |
| "eval_samples_per_second": 113.399, |
| "eval_steps_per_second": 3.549, |
| "step": 22700 |
| }, |
| { |
| "epoch": 202.83455311599025, |
| "grad_norm": 0.39605483412742615, |
| "learning_rate": 3.7324414715719067e-06, |
| "loss": 6.3704, |
| "step": 22800 |
| }, |
| { |
| "epoch": 202.83455311599025, |
| "eval_loss": 6.386079788208008, |
| "eval_runtime": 88.1808, |
| "eval_samples_per_second": 113.403, |
| "eval_steps_per_second": 3.55, |
| "step": 22800 |
| }, |
| { |
| "epoch": 203.72166777555998, |
| "grad_norm": 0.26171693205833435, |
| "learning_rate": 3.722408026755853e-06, |
| "loss": 6.3707, |
| "step": 22900 |
| }, |
| { |
| "epoch": 203.72166777555998, |
| "eval_loss": 6.387109279632568, |
| "eval_runtime": 88.1813, |
| "eval_samples_per_second": 113.403, |
| "eval_steps_per_second": 3.55, |
| "step": 22900 |
| }, |
| { |
| "epoch": 204.60878243512974, |
| "grad_norm": 0.26537904143333435, |
| "learning_rate": 3.7123745819398e-06, |
| "loss": 6.3712, |
| "step": 23000 |
| }, |
| { |
| "epoch": 204.60878243512974, |
| "eval_loss": 6.389610290527344, |
| "eval_runtime": 89.0112, |
| "eval_samples_per_second": 112.345, |
| "eval_steps_per_second": 3.516, |
| "step": 23000 |
| }, |
| { |
| "epoch": 205.4958970946995, |
| "grad_norm": 0.2203078716993332, |
| "learning_rate": 3.702341137123746e-06, |
| "loss": 6.3696, |
| "step": 23100 |
| }, |
| { |
| "epoch": 205.4958970946995, |
| "eval_loss": 6.3849568367004395, |
| "eval_runtime": 88.9819, |
| "eval_samples_per_second": 112.382, |
| "eval_steps_per_second": 3.518, |
| "step": 23100 |
| }, |
| { |
| "epoch": 206.38301175426923, |
| "grad_norm": 0.23989248275756836, |
| "learning_rate": 3.6923076923076925e-06, |
| "loss": 6.37, |
| "step": 23200 |
| }, |
| { |
| "epoch": 206.38301175426923, |
| "eval_loss": 6.39259147644043, |
| "eval_runtime": 88.1947, |
| "eval_samples_per_second": 113.386, |
| "eval_steps_per_second": 3.549, |
| "step": 23200 |
| }, |
| { |
| "epoch": 207.270126413839, |
| "grad_norm": 0.2467869073152542, |
| "learning_rate": 3.6822742474916393e-06, |
| "loss": 6.3701, |
| "step": 23300 |
| }, |
| { |
| "epoch": 207.270126413839, |
| "eval_loss": 6.386963367462158, |
| "eval_runtime": 89.001, |
| "eval_samples_per_second": 112.358, |
| "eval_steps_per_second": 3.517, |
| "step": 23300 |
| }, |
| { |
| "epoch": 208.15724107340873, |
| "grad_norm": 0.3064594268798828, |
| "learning_rate": 3.6722408026755856e-06, |
| "loss": 6.3706, |
| "step": 23400 |
| }, |
| { |
| "epoch": 208.15724107340873, |
| "eval_loss": 6.382241249084473, |
| "eval_runtime": 88.1745, |
| "eval_samples_per_second": 113.411, |
| "eval_steps_per_second": 3.55, |
| "step": 23400 |
| }, |
| { |
| "epoch": 209.0443557329785, |
| "grad_norm": 0.2418460100889206, |
| "learning_rate": 3.662207357859532e-06, |
| "loss": 6.3693, |
| "step": 23500 |
| }, |
| { |
| "epoch": 209.0443557329785, |
| "eval_loss": 6.387510776519775, |
| "eval_runtime": 88.983, |
| "eval_samples_per_second": 112.381, |
| "eval_steps_per_second": 3.518, |
| "step": 23500 |
| }, |
| { |
| "epoch": 209.93147039254825, |
| "grad_norm": 0.5038089156150818, |
| "learning_rate": 3.6521739130434787e-06, |
| "loss": 6.3699, |
| "step": 23600 |
| }, |
| { |
| "epoch": 209.93147039254825, |
| "eval_loss": 6.392237663269043, |
| "eval_runtime": 88.1898, |
| "eval_samples_per_second": 113.392, |
| "eval_steps_per_second": 3.549, |
| "step": 23600 |
| }, |
| { |
| "epoch": 210.81858505211798, |
| "grad_norm": 0.30169734358787537, |
| "learning_rate": 3.642140468227425e-06, |
| "loss": 6.3706, |
| "step": 23700 |
| }, |
| { |
| "epoch": 210.81858505211798, |
| "eval_loss": 6.392018795013428, |
| "eval_runtime": 88.9849, |
| "eval_samples_per_second": 112.379, |
| "eval_steps_per_second": 3.517, |
| "step": 23700 |
| }, |
| { |
| "epoch": 211.70569971168774, |
| "grad_norm": 0.2609444558620453, |
| "learning_rate": 3.6321070234113714e-06, |
| "loss": 6.3706, |
| "step": 23800 |
| }, |
| { |
| "epoch": 211.70569971168774, |
| "eval_loss": 6.388724327087402, |
| "eval_runtime": 88.6575, |
| "eval_samples_per_second": 112.794, |
| "eval_steps_per_second": 3.53, |
| "step": 23800 |
| }, |
| { |
| "epoch": 212.59281437125748, |
| "grad_norm": 0.21443623304367065, |
| "learning_rate": 3.622073578595318e-06, |
| "loss": 6.3703, |
| "step": 23900 |
| }, |
| { |
| "epoch": 212.59281437125748, |
| "eval_loss": 6.385756015777588, |
| "eval_runtime": 88.9775, |
| "eval_samples_per_second": 112.388, |
| "eval_steps_per_second": 3.518, |
| "step": 23900 |
| }, |
| { |
| "epoch": 213.47992903082724, |
| "grad_norm": 0.22561503946781158, |
| "learning_rate": 3.6120401337792645e-06, |
| "loss": 6.3697, |
| "step": 24000 |
| }, |
| { |
| "epoch": 213.47992903082724, |
| "eval_loss": 6.388892650604248, |
| "eval_runtime": 88.1935, |
| "eval_samples_per_second": 113.387, |
| "eval_steps_per_second": 3.549, |
| "step": 24000 |
| }, |
| { |
| "epoch": 214.367043690397, |
| "grad_norm": 0.23940326273441315, |
| "learning_rate": 3.6020066889632112e-06, |
| "loss": 6.3689, |
| "step": 24100 |
| }, |
| { |
| "epoch": 214.367043690397, |
| "eval_loss": 6.386131286621094, |
| "eval_runtime": 88.4334, |
| "eval_samples_per_second": 113.079, |
| "eval_steps_per_second": 3.539, |
| "step": 24100 |
| }, |
| { |
| "epoch": 215.25415834996673, |
| "grad_norm": 0.3109673857688904, |
| "learning_rate": 3.5919732441471576e-06, |
| "loss": 6.3694, |
| "step": 24200 |
| }, |
| { |
| "epoch": 215.25415834996673, |
| "eval_loss": 6.3832244873046875, |
| "eval_runtime": 89.0249, |
| "eval_samples_per_second": 112.328, |
| "eval_steps_per_second": 3.516, |
| "step": 24200 |
| }, |
| { |
| "epoch": 216.1412730095365, |
| "grad_norm": 0.2562812566757202, |
| "learning_rate": 3.581939799331104e-06, |
| "loss": 6.3686, |
| "step": 24300 |
| }, |
| { |
| "epoch": 216.1412730095365, |
| "eval_loss": 6.385456085205078, |
| "eval_runtime": 88.1951, |
| "eval_samples_per_second": 113.385, |
| "eval_steps_per_second": 3.549, |
| "step": 24300 |
| }, |
| { |
| "epoch": 217.02838766910622, |
| "grad_norm": 0.33149996399879456, |
| "learning_rate": 3.5719063545150507e-06, |
| "loss": 6.3696, |
| "step": 24400 |
| }, |
| { |
| "epoch": 217.02838766910622, |
| "eval_loss": 6.387702465057373, |
| "eval_runtime": 88.9847, |
| "eval_samples_per_second": 112.379, |
| "eval_steps_per_second": 3.517, |
| "step": 24400 |
| }, |
| { |
| "epoch": 217.91550232867598, |
| "grad_norm": 0.2598579525947571, |
| "learning_rate": 3.561872909698997e-06, |
| "loss": 6.3699, |
| "step": 24500 |
| }, |
| { |
| "epoch": 217.91550232867598, |
| "eval_loss": 6.38595724105835, |
| "eval_runtime": 88.198, |
| "eval_samples_per_second": 113.381, |
| "eval_steps_per_second": 3.549, |
| "step": 24500 |
| }, |
| { |
| "epoch": 218.80261698824572, |
| "grad_norm": 0.2651689648628235, |
| "learning_rate": 3.5518394648829434e-06, |
| "loss": 6.3703, |
| "step": 24600 |
| }, |
| { |
| "epoch": 218.80261698824572, |
| "eval_loss": 6.383368968963623, |
| "eval_runtime": 89.0584, |
| "eval_samples_per_second": 112.286, |
| "eval_steps_per_second": 3.515, |
| "step": 24600 |
| }, |
| { |
| "epoch": 219.68973164781548, |
| "grad_norm": 0.25209030508995056, |
| "learning_rate": 3.54180602006689e-06, |
| "loss": 6.3703, |
| "step": 24700 |
| }, |
| { |
| "epoch": 219.68973164781548, |
| "eval_loss": 6.389649868011475, |
| "eval_runtime": 89.0152, |
| "eval_samples_per_second": 112.34, |
| "eval_steps_per_second": 3.516, |
| "step": 24700 |
| }, |
| { |
| "epoch": 220.57684630738524, |
| "grad_norm": 0.16648085415363312, |
| "learning_rate": 3.5317725752508365e-06, |
| "loss": 6.3694, |
| "step": 24800 |
| }, |
| { |
| "epoch": 220.57684630738524, |
| "eval_loss": 6.384476661682129, |
| "eval_runtime": 89.0288, |
| "eval_samples_per_second": 112.323, |
| "eval_steps_per_second": 3.516, |
| "step": 24800 |
| }, |
| { |
| "epoch": 221.46396096695497, |
| "grad_norm": 0.25535905361175537, |
| "learning_rate": 3.521739130434783e-06, |
| "loss": 6.3701, |
| "step": 24900 |
| }, |
| { |
| "epoch": 221.46396096695497, |
| "eval_loss": 6.383844375610352, |
| "eval_runtime": 88.1889, |
| "eval_samples_per_second": 113.393, |
| "eval_steps_per_second": 3.549, |
| "step": 24900 |
| }, |
| { |
| "epoch": 222.35107562652473, |
| "grad_norm": 0.14982174336910248, |
| "learning_rate": 3.5117056856187296e-06, |
| "loss": 6.3689, |
| "step": 25000 |
| }, |
| { |
| "epoch": 222.35107562652473, |
| "eval_loss": 6.383812427520752, |
| "eval_runtime": 88.1955, |
| "eval_samples_per_second": 113.385, |
| "eval_steps_per_second": 3.549, |
| "step": 25000 |
| }, |
| { |
| "epoch": 223.23819028609446, |
| "grad_norm": 0.24092227220535278, |
| "learning_rate": 3.501672240802676e-06, |
| "loss": 6.3696, |
| "step": 25100 |
| }, |
| { |
| "epoch": 223.23819028609446, |
| "eval_loss": 6.387426376342773, |
| "eval_runtime": 88.8638, |
| "eval_samples_per_second": 112.532, |
| "eval_steps_per_second": 3.522, |
| "step": 25100 |
| }, |
| { |
| "epoch": 224.12530494566423, |
| "grad_norm": 0.3173174262046814, |
| "learning_rate": 3.491638795986622e-06, |
| "loss": 6.3685, |
| "step": 25200 |
| }, |
| { |
| "epoch": 224.12530494566423, |
| "eval_loss": 6.387609004974365, |
| "eval_runtime": 88.9892, |
| "eval_samples_per_second": 112.373, |
| "eval_steps_per_second": 3.517, |
| "step": 25200 |
| }, |
| { |
| "epoch": 225.012419605234, |
| "grad_norm": 0.2092152088880539, |
| "learning_rate": 3.481605351170568e-06, |
| "loss": 6.3695, |
| "step": 25300 |
| }, |
| { |
| "epoch": 225.012419605234, |
| "eval_loss": 6.386031627655029, |
| "eval_runtime": 88.2056, |
| "eval_samples_per_second": 113.371, |
| "eval_steps_per_second": 3.549, |
| "step": 25300 |
| }, |
| { |
| "epoch": 225.89953426480372, |
| "grad_norm": 0.2362297624349594, |
| "learning_rate": 3.471571906354515e-06, |
| "loss": 6.3684, |
| "step": 25400 |
| }, |
| { |
| "epoch": 225.89953426480372, |
| "eval_loss": 6.389245510101318, |
| "eval_runtime": 88.1955, |
| "eval_samples_per_second": 113.384, |
| "eval_steps_per_second": 3.549, |
| "step": 25400 |
| }, |
| { |
| "epoch": 226.78664892437348, |
| "grad_norm": 0.16113384068012238, |
| "learning_rate": 3.4615384615384613e-06, |
| "loss": 6.3688, |
| "step": 25500 |
| }, |
| { |
| "epoch": 226.78664892437348, |
| "eval_loss": 6.388128757476807, |
| "eval_runtime": 88.1884, |
| "eval_samples_per_second": 113.394, |
| "eval_steps_per_second": 3.549, |
| "step": 25500 |
| }, |
| { |
| "epoch": 227.6737635839432, |
| "grad_norm": 0.28249019384384155, |
| "learning_rate": 3.4515050167224076e-06, |
| "loss": 6.3685, |
| "step": 25600 |
| }, |
| { |
| "epoch": 227.6737635839432, |
| "eval_loss": 6.38515043258667, |
| "eval_runtime": 89.0087, |
| "eval_samples_per_second": 112.349, |
| "eval_steps_per_second": 3.517, |
| "step": 25600 |
| }, |
| { |
| "epoch": 228.56087824351297, |
| "grad_norm": 0.2178281992673874, |
| "learning_rate": 3.4414715719063544e-06, |
| "loss": 6.3692, |
| "step": 25700 |
| }, |
| { |
| "epoch": 228.56087824351297, |
| "eval_loss": 6.385435104370117, |
| "eval_runtime": 89.0004, |
| "eval_samples_per_second": 112.359, |
| "eval_steps_per_second": 3.517, |
| "step": 25700 |
| }, |
| { |
| "epoch": 229.44799290308273, |
| "grad_norm": 0.2855147123336792, |
| "learning_rate": 3.4314381270903007e-06, |
| "loss": 6.3691, |
| "step": 25800 |
| }, |
| { |
| "epoch": 229.44799290308273, |
| "eval_loss": 6.384737491607666, |
| "eval_runtime": 89.03, |
| "eval_samples_per_second": 112.322, |
| "eval_steps_per_second": 3.516, |
| "step": 25800 |
| }, |
| { |
| "epoch": 230.33510756265247, |
| "grad_norm": 0.2967989146709442, |
| "learning_rate": 3.4214046822742475e-06, |
| "loss": 6.3688, |
| "step": 25900 |
| }, |
| { |
| "epoch": 230.33510756265247, |
| "eval_loss": 6.380478382110596, |
| "eval_runtime": 88.1811, |
| "eval_samples_per_second": 113.403, |
| "eval_steps_per_second": 3.55, |
| "step": 25900 |
| }, |
| { |
| "epoch": 231.22222222222223, |
| "grad_norm": 0.23676429688930511, |
| "learning_rate": 3.411371237458194e-06, |
| "loss": 6.3689, |
| "step": 26000 |
| }, |
| { |
| "epoch": 231.22222222222223, |
| "eval_loss": 6.383557319641113, |
| "eval_runtime": 88.9992, |
| "eval_samples_per_second": 112.361, |
| "eval_steps_per_second": 3.517, |
| "step": 26000 |
| }, |
| { |
| "epoch": 232.10933688179196, |
| "grad_norm": 0.26867687702178955, |
| "learning_rate": 3.40133779264214e-06, |
| "loss": 6.3687, |
| "step": 26100 |
| }, |
| { |
| "epoch": 232.10933688179196, |
| "eval_loss": 6.382840633392334, |
| "eval_runtime": 88.2227, |
| "eval_samples_per_second": 113.349, |
| "eval_steps_per_second": 3.548, |
| "step": 26100 |
| }, |
| { |
| "epoch": 232.99645154136172, |
| "grad_norm": 0.31317785382270813, |
| "learning_rate": 3.391304347826087e-06, |
| "loss": 6.3681, |
| "step": 26200 |
| }, |
| { |
| "epoch": 232.99645154136172, |
| "eval_loss": 6.383928298950195, |
| "eval_runtime": 88.1948, |
| "eval_samples_per_second": 113.385, |
| "eval_steps_per_second": 3.549, |
| "step": 26200 |
| }, |
| { |
| "epoch": 233.88356620093148, |
| "grad_norm": 0.19290131330490112, |
| "learning_rate": 3.3812709030100333e-06, |
| "loss": 6.3686, |
| "step": 26300 |
| }, |
| { |
| "epoch": 233.88356620093148, |
| "eval_loss": 6.383606910705566, |
| "eval_runtime": 88.1805, |
| "eval_samples_per_second": 113.404, |
| "eval_steps_per_second": 3.55, |
| "step": 26300 |
| }, |
| { |
| "epoch": 234.77068086050122, |
| "grad_norm": 0.2145206481218338, |
| "learning_rate": 3.3712374581939796e-06, |
| "loss": 6.3683, |
| "step": 26400 |
| }, |
| { |
| "epoch": 234.77068086050122, |
| "eval_loss": 6.382413864135742, |
| "eval_runtime": 89.0087, |
| "eval_samples_per_second": 112.349, |
| "eval_steps_per_second": 3.517, |
| "step": 26400 |
| }, |
| { |
| "epoch": 235.65779552007098, |
| "grad_norm": 0.23395557701587677, |
| "learning_rate": 3.3612040133779264e-06, |
| "loss": 6.3685, |
| "step": 26500 |
| }, |
| { |
| "epoch": 235.65779552007098, |
| "eval_loss": 6.381302356719971, |
| "eval_runtime": 89.0044, |
| "eval_samples_per_second": 112.354, |
| "eval_steps_per_second": 3.517, |
| "step": 26500 |
| }, |
| { |
| "epoch": 236.5449101796407, |
| "grad_norm": 0.2277672439813614, |
| "learning_rate": 3.3511705685618727e-06, |
| "loss": 6.3694, |
| "step": 26600 |
| }, |
| { |
| "epoch": 236.5449101796407, |
| "eval_loss": 6.382754325866699, |
| "eval_runtime": 88.1906, |
| "eval_samples_per_second": 113.391, |
| "eval_steps_per_second": 3.549, |
| "step": 26600 |
| }, |
| { |
| "epoch": 237.43202483921047, |
| "grad_norm": 0.15456043183803558, |
| "learning_rate": 3.3411371237458195e-06, |
| "loss": 6.3674, |
| "step": 26700 |
| }, |
| { |
| "epoch": 237.43202483921047, |
| "eval_loss": 6.385075569152832, |
| "eval_runtime": 89.0461, |
| "eval_samples_per_second": 112.301, |
| "eval_steps_per_second": 3.515, |
| "step": 26700 |
| }, |
| { |
| "epoch": 238.31913949878023, |
| "grad_norm": 0.2268277257680893, |
| "learning_rate": 3.331103678929766e-06, |
| "loss": 6.3679, |
| "step": 26800 |
| }, |
| { |
| "epoch": 238.31913949878023, |
| "eval_loss": 6.382864952087402, |
| "eval_runtime": 88.1787, |
| "eval_samples_per_second": 113.406, |
| "eval_steps_per_second": 3.55, |
| "step": 26800 |
| }, |
| { |
| "epoch": 239.20625415834996, |
| "grad_norm": 0.2599903643131256, |
| "learning_rate": 3.321070234113712e-06, |
| "loss": 6.3681, |
| "step": 26900 |
| }, |
| { |
| "epoch": 239.20625415834996, |
| "eval_loss": 6.382370948791504, |
| "eval_runtime": 88.1887, |
| "eval_samples_per_second": 113.393, |
| "eval_steps_per_second": 3.549, |
| "step": 26900 |
| }, |
| { |
| "epoch": 240.09336881791972, |
| "grad_norm": 0.2117336094379425, |
| "learning_rate": 3.311036789297659e-06, |
| "loss": 6.3686, |
| "step": 27000 |
| }, |
| { |
| "epoch": 240.09336881791972, |
| "eval_loss": 6.381521701812744, |
| "eval_runtime": 88.9818, |
| "eval_samples_per_second": 112.382, |
| "eval_steps_per_second": 3.518, |
| "step": 27000 |
| }, |
| { |
| "epoch": 240.98048347748946, |
| "grad_norm": 0.20599253475666046, |
| "learning_rate": 3.3010033444816052e-06, |
| "loss": 6.3683, |
| "step": 27100 |
| }, |
| { |
| "epoch": 240.98048347748946, |
| "eval_loss": 6.382330417633057, |
| "eval_runtime": 88.1957, |
| "eval_samples_per_second": 113.384, |
| "eval_steps_per_second": 3.549, |
| "step": 27100 |
| }, |
| { |
| "epoch": 241.86759813705922, |
| "grad_norm": 0.22722215950489044, |
| "learning_rate": 3.2909698996655516e-06, |
| "loss": 6.3678, |
| "step": 27200 |
| }, |
| { |
| "epoch": 241.86759813705922, |
| "eval_loss": 6.3871564865112305, |
| "eval_runtime": 88.1783, |
| "eval_samples_per_second": 113.407, |
| "eval_steps_per_second": 3.55, |
| "step": 27200 |
| }, |
| { |
| "epoch": 242.75471279662895, |
| "grad_norm": 0.259403795003891, |
| "learning_rate": 3.2809364548494983e-06, |
| "loss": 6.3681, |
| "step": 27300 |
| }, |
| { |
| "epoch": 242.75471279662895, |
| "eval_loss": 6.384130954742432, |
| "eval_runtime": 89.014, |
| "eval_samples_per_second": 112.342, |
| "eval_steps_per_second": 3.516, |
| "step": 27300 |
| }, |
| { |
| "epoch": 243.6418274561987, |
| "grad_norm": 0.25630879402160645, |
| "learning_rate": 3.2709030100334447e-06, |
| "loss": 6.3682, |
| "step": 27400 |
| }, |
| { |
| "epoch": 243.6418274561987, |
| "eval_loss": 6.382914066314697, |
| "eval_runtime": 89.0259, |
| "eval_samples_per_second": 112.327, |
| "eval_steps_per_second": 3.516, |
| "step": 27400 |
| }, |
| { |
| "epoch": 244.52894211576847, |
| "grad_norm": 0.28536516427993774, |
| "learning_rate": 3.260869565217391e-06, |
| "loss": 6.3686, |
| "step": 27500 |
| }, |
| { |
| "epoch": 244.52894211576847, |
| "eval_loss": 6.386742115020752, |
| "eval_runtime": 88.9916, |
| "eval_samples_per_second": 112.37, |
| "eval_steps_per_second": 3.517, |
| "step": 27500 |
| }, |
| { |
| "epoch": 245.4160567753382, |
| "grad_norm": 0.1816515326499939, |
| "learning_rate": 3.2508361204013378e-06, |
| "loss": 6.3667, |
| "step": 27600 |
| }, |
| { |
| "epoch": 245.4160567753382, |
| "eval_loss": 6.380117416381836, |
| "eval_runtime": 88.9894, |
| "eval_samples_per_second": 112.373, |
| "eval_steps_per_second": 3.517, |
| "step": 27600 |
| }, |
| { |
| "epoch": 246.30317143490797, |
| "grad_norm": 0.24183250963687897, |
| "learning_rate": 3.240802675585284e-06, |
| "loss": 6.3675, |
| "step": 27700 |
| }, |
| { |
| "epoch": 246.30317143490797, |
| "eval_loss": 6.3849968910217285, |
| "eval_runtime": 88.1725, |
| "eval_samples_per_second": 113.414, |
| "eval_steps_per_second": 3.55, |
| "step": 27700 |
| }, |
| { |
| "epoch": 247.1902860944777, |
| "grad_norm": 0.28278273344039917, |
| "learning_rate": 3.230769230769231e-06, |
| "loss": 6.368, |
| "step": 27800 |
| }, |
| { |
| "epoch": 247.1902860944777, |
| "eval_loss": 6.382080554962158, |
| "eval_runtime": 88.1841, |
| "eval_samples_per_second": 113.399, |
| "eval_steps_per_second": 3.549, |
| "step": 27800 |
| }, |
| { |
| "epoch": 248.07740075404746, |
| "grad_norm": 0.27085331082344055, |
| "learning_rate": 3.2207357859531772e-06, |
| "loss": 6.3686, |
| "step": 27900 |
| }, |
| { |
| "epoch": 248.07740075404746, |
| "eval_loss": 6.384332656860352, |
| "eval_runtime": 88.1761, |
| "eval_samples_per_second": 113.409, |
| "eval_steps_per_second": 3.55, |
| "step": 27900 |
| }, |
| { |
| "epoch": 248.96451541361722, |
| "grad_norm": 0.18361283838748932, |
| "learning_rate": 3.2107023411371236e-06, |
| "loss": 6.3667, |
| "step": 28000 |
| }, |
| { |
| "epoch": 248.96451541361722, |
| "eval_loss": 6.383978843688965, |
| "eval_runtime": 88.1931, |
| "eval_samples_per_second": 113.388, |
| "eval_steps_per_second": 3.549, |
| "step": 28000 |
| }, |
| { |
| "epoch": 249.85163007318695, |
| "grad_norm": 0.20948508381843567, |
| "learning_rate": 3.2006688963210703e-06, |
| "loss": 6.3683, |
| "step": 28100 |
| }, |
| { |
| "epoch": 249.85163007318695, |
| "eval_loss": 6.383596420288086, |
| "eval_runtime": 88.1945, |
| "eval_samples_per_second": 113.386, |
| "eval_steps_per_second": 3.549, |
| "step": 28100 |
| }, |
| { |
| "epoch": 250.73874473275671, |
| "grad_norm": 0.2579098641872406, |
| "learning_rate": 3.1906354515050167e-06, |
| "loss": 6.3679, |
| "step": 28200 |
| }, |
| { |
| "epoch": 250.73874473275671, |
| "eval_loss": 6.38535213470459, |
| "eval_runtime": 89.0182, |
| "eval_samples_per_second": 112.337, |
| "eval_steps_per_second": 3.516, |
| "step": 28200 |
| }, |
| { |
| "epoch": 251.62585939232645, |
| "grad_norm": 0.16455556452274323, |
| "learning_rate": 3.180602006688963e-06, |
| "loss": 6.3679, |
| "step": 28300 |
| }, |
| { |
| "epoch": 251.62585939232645, |
| "eval_loss": 6.3854899406433105, |
| "eval_runtime": 88.1768, |
| "eval_samples_per_second": 113.409, |
| "eval_steps_per_second": 3.55, |
| "step": 28300 |
| }, |
| { |
| "epoch": 252.5129740518962, |
| "grad_norm": 0.15089711546897888, |
| "learning_rate": 3.1705685618729098e-06, |
| "loss": 6.3674, |
| "step": 28400 |
| }, |
| { |
| "epoch": 252.5129740518962, |
| "eval_loss": 6.380008697509766, |
| "eval_runtime": 88.186, |
| "eval_samples_per_second": 113.397, |
| "eval_steps_per_second": 3.549, |
| "step": 28400 |
| }, |
| { |
| "epoch": 253.40008871146597, |
| "grad_norm": 0.19287870824337006, |
| "learning_rate": 3.160535117056856e-06, |
| "loss": 6.3671, |
| "step": 28500 |
| }, |
| { |
| "epoch": 253.40008871146597, |
| "eval_loss": 6.381292343139648, |
| "eval_runtime": 89.0041, |
| "eval_samples_per_second": 112.354, |
| "eval_steps_per_second": 3.517, |
| "step": 28500 |
| }, |
| { |
| "epoch": 254.2872033710357, |
| "grad_norm": 0.28032493591308594, |
| "learning_rate": 3.1505016722408024e-06, |
| "loss": 6.3684, |
| "step": 28600 |
| }, |
| { |
| "epoch": 254.2872033710357, |
| "eval_loss": 6.381994247436523, |
| "eval_runtime": 88.2052, |
| "eval_samples_per_second": 113.372, |
| "eval_steps_per_second": 3.549, |
| "step": 28600 |
| }, |
| { |
| "epoch": 255.17431803060546, |
| "grad_norm": 0.2228955328464508, |
| "learning_rate": 3.140468227424749e-06, |
| "loss": 6.3673, |
| "step": 28700 |
| }, |
| { |
| "epoch": 255.17431803060546, |
| "eval_loss": 6.3841552734375, |
| "eval_runtime": 88.1783, |
| "eval_samples_per_second": 113.407, |
| "eval_steps_per_second": 3.55, |
| "step": 28700 |
| }, |
| { |
| "epoch": 256.0614326901752, |
| "grad_norm": 0.2289431095123291, |
| "learning_rate": 3.1304347826086955e-06, |
| "loss": 6.3667, |
| "step": 28800 |
| }, |
| { |
| "epoch": 256.0614326901752, |
| "eval_loss": 6.383512020111084, |
| "eval_runtime": 89.0073, |
| "eval_samples_per_second": 112.35, |
| "eval_steps_per_second": 3.517, |
| "step": 28800 |
| }, |
| { |
| "epoch": 256.94854734974496, |
| "grad_norm": 0.17454871535301208, |
| "learning_rate": 3.1204013377926423e-06, |
| "loss": 6.3668, |
| "step": 28900 |
| }, |
| { |
| "epoch": 256.94854734974496, |
| "eval_loss": 6.386359214782715, |
| "eval_runtime": 88.1766, |
| "eval_samples_per_second": 113.409, |
| "eval_steps_per_second": 3.55, |
| "step": 28900 |
| }, |
| { |
| "epoch": 257.8356620093147, |
| "grad_norm": 0.19062787294387817, |
| "learning_rate": 3.1103678929765886e-06, |
| "loss": 6.3671, |
| "step": 29000 |
| }, |
| { |
| "epoch": 257.8356620093147, |
| "eval_loss": 6.382784366607666, |
| "eval_runtime": 89.0271, |
| "eval_samples_per_second": 112.325, |
| "eval_steps_per_second": 3.516, |
| "step": 29000 |
| }, |
| { |
| "epoch": 258.7227766688845, |
| "grad_norm": 0.19611743092536926, |
| "learning_rate": 3.100334448160535e-06, |
| "loss": 6.3673, |
| "step": 29100 |
| }, |
| { |
| "epoch": 258.7227766688845, |
| "eval_loss": 6.378743648529053, |
| "eval_runtime": 89.0, |
| "eval_samples_per_second": 112.36, |
| "eval_steps_per_second": 3.517, |
| "step": 29100 |
| }, |
| { |
| "epoch": 259.6098913284542, |
| "grad_norm": 0.20483489334583282, |
| "learning_rate": 3.0903010033444818e-06, |
| "loss": 6.3666, |
| "step": 29200 |
| }, |
| { |
| "epoch": 259.6098913284542, |
| "eval_loss": 6.384799003601074, |
| "eval_runtime": 88.186, |
| "eval_samples_per_second": 113.397, |
| "eval_steps_per_second": 3.549, |
| "step": 29200 |
| }, |
| { |
| "epoch": 260.49700598802394, |
| "grad_norm": 0.1686568409204483, |
| "learning_rate": 3.080267558528428e-06, |
| "loss": 6.3678, |
| "step": 29300 |
| }, |
| { |
| "epoch": 260.49700598802394, |
| "eval_loss": 6.38092565536499, |
| "eval_runtime": 88.191, |
| "eval_samples_per_second": 113.39, |
| "eval_steps_per_second": 3.549, |
| "step": 29300 |
| }, |
| { |
| "epoch": 261.3841206475937, |
| "grad_norm": 0.16638343036174774, |
| "learning_rate": 3.0702341137123744e-06, |
| "loss": 6.3671, |
| "step": 29400 |
| }, |
| { |
| "epoch": 261.3841206475937, |
| "eval_loss": 6.380900859832764, |
| "eval_runtime": 88.1878, |
| "eval_samples_per_second": 113.394, |
| "eval_steps_per_second": 3.549, |
| "step": 29400 |
| }, |
| { |
| "epoch": 262.27123530716347, |
| "grad_norm": 0.16073353588581085, |
| "learning_rate": 3.060200668896321e-06, |
| "loss": 6.3668, |
| "step": 29500 |
| }, |
| { |
| "epoch": 262.27123530716347, |
| "eval_loss": 6.382925033569336, |
| "eval_runtime": 88.184, |
| "eval_samples_per_second": 113.399, |
| "eval_steps_per_second": 3.549, |
| "step": 29500 |
| }, |
| { |
| "epoch": 263.1583499667332, |
| "grad_norm": 0.2387487143278122, |
| "learning_rate": 3.0501672240802675e-06, |
| "loss": 6.3665, |
| "step": 29600 |
| }, |
| { |
| "epoch": 263.1583499667332, |
| "eval_loss": 6.3799662590026855, |
| "eval_runtime": 88.1877, |
| "eval_samples_per_second": 113.394, |
| "eval_steps_per_second": 3.549, |
| "step": 29600 |
| }, |
| { |
| "epoch": 264.04546462630293, |
| "grad_norm": 0.22873957455158234, |
| "learning_rate": 3.0401337792642143e-06, |
| "loss": 6.3666, |
| "step": 29700 |
| }, |
| { |
| "epoch": 264.04546462630293, |
| "eval_loss": 6.379544734954834, |
| "eval_runtime": 88.1981, |
| "eval_samples_per_second": 113.381, |
| "eval_steps_per_second": 3.549, |
| "step": 29700 |
| }, |
| { |
| "epoch": 264.9325792858727, |
| "grad_norm": 0.20048406720161438, |
| "learning_rate": 3.0301003344481606e-06, |
| "loss": 6.3668, |
| "step": 29800 |
| }, |
| { |
| "epoch": 264.9325792858727, |
| "eval_loss": 6.380821228027344, |
| "eval_runtime": 88.1967, |
| "eval_samples_per_second": 113.383, |
| "eval_steps_per_second": 3.549, |
| "step": 29800 |
| }, |
| { |
| "epoch": 265.81969394544245, |
| "grad_norm": 0.20105549693107605, |
| "learning_rate": 3.020066889632107e-06, |
| "loss": 6.3663, |
| "step": 29900 |
| }, |
| { |
| "epoch": 265.81969394544245, |
| "eval_loss": 6.3833537101745605, |
| "eval_runtime": 88.9918, |
| "eval_samples_per_second": 112.37, |
| "eval_steps_per_second": 3.517, |
| "step": 29900 |
| }, |
| { |
| "epoch": 266.7068086050122, |
| "grad_norm": 0.26339054107666016, |
| "learning_rate": 3.0100334448160537e-06, |
| "loss": 6.3663, |
| "step": 30000 |
| }, |
| { |
| "epoch": 266.7068086050122, |
| "eval_loss": 6.388853073120117, |
| "eval_runtime": 89.0161, |
| "eval_samples_per_second": 112.339, |
| "eval_steps_per_second": 3.516, |
| "step": 30000 |
| }, |
| { |
| "epoch": 267.593923264582, |
| "grad_norm": 0.1931493878364563, |
| "learning_rate": 3e-06, |
| "loss": 6.3666, |
| "step": 30100 |
| }, |
| { |
| "epoch": 267.593923264582, |
| "eval_loss": 6.378931045532227, |
| "eval_runtime": 88.2044, |
| "eval_samples_per_second": 113.373, |
| "eval_steps_per_second": 3.549, |
| "step": 30100 |
| }, |
| { |
| "epoch": 268.4810379241517, |
| "grad_norm": 0.268880158662796, |
| "learning_rate": 2.9899665551839464e-06, |
| "loss": 6.367, |
| "step": 30200 |
| }, |
| { |
| "epoch": 268.4810379241517, |
| "eval_loss": 6.381078243255615, |
| "eval_runtime": 88.182, |
| "eval_samples_per_second": 113.402, |
| "eval_steps_per_second": 3.549, |
| "step": 30200 |
| }, |
| { |
| "epoch": 269.36815258372144, |
| "grad_norm": 0.15537361800670624, |
| "learning_rate": 2.979933110367893e-06, |
| "loss": 6.3659, |
| "step": 30300 |
| }, |
| { |
| "epoch": 269.36815258372144, |
| "eval_loss": 6.38137674331665, |
| "eval_runtime": 88.1976, |
| "eval_samples_per_second": 113.382, |
| "eval_steps_per_second": 3.549, |
| "step": 30300 |
| }, |
| { |
| "epoch": 270.2552672432912, |
| "grad_norm": 0.23357395827770233, |
| "learning_rate": 2.9698996655518395e-06, |
| "loss": 6.3661, |
| "step": 30400 |
| }, |
| { |
| "epoch": 270.2552672432912, |
| "eval_loss": 6.384622573852539, |
| "eval_runtime": 88.1861, |
| "eval_samples_per_second": 113.397, |
| "eval_steps_per_second": 3.549, |
| "step": 30400 |
| }, |
| { |
| "epoch": 271.14238190286096, |
| "grad_norm": 0.29505735635757446, |
| "learning_rate": 2.959866220735786e-06, |
| "loss": 6.3666, |
| "step": 30500 |
| }, |
| { |
| "epoch": 271.14238190286096, |
| "eval_loss": 6.383800983428955, |
| "eval_runtime": 88.188, |
| "eval_samples_per_second": 113.394, |
| "eval_steps_per_second": 3.549, |
| "step": 30500 |
| }, |
| { |
| "epoch": 272.0294965624307, |
| "grad_norm": 0.14850308001041412, |
| "learning_rate": 2.9498327759197326e-06, |
| "loss": 6.3664, |
| "step": 30600 |
| }, |
| { |
| "epoch": 272.0294965624307, |
| "eval_loss": 6.384856224060059, |
| "eval_runtime": 88.1953, |
| "eval_samples_per_second": 113.385, |
| "eval_steps_per_second": 3.549, |
| "step": 30600 |
| }, |
| { |
| "epoch": 272.9166112220004, |
| "grad_norm": 0.16296862065792084, |
| "learning_rate": 2.939799331103679e-06, |
| "loss": 6.3667, |
| "step": 30700 |
| }, |
| { |
| "epoch": 272.9166112220004, |
| "eval_loss": 6.380056858062744, |
| "eval_runtime": 88.6214, |
| "eval_samples_per_second": 112.84, |
| "eval_steps_per_second": 3.532, |
| "step": 30700 |
| }, |
| { |
| "epoch": 273.8037258815702, |
| "grad_norm": 0.212349534034729, |
| "learning_rate": 2.9297658862876257e-06, |
| "loss": 6.3659, |
| "step": 30800 |
| }, |
| { |
| "epoch": 273.8037258815702, |
| "eval_loss": 6.379006862640381, |
| "eval_runtime": 89.0119, |
| "eval_samples_per_second": 112.345, |
| "eval_steps_per_second": 3.516, |
| "step": 30800 |
| }, |
| { |
| "epoch": 274.69084054113995, |
| "grad_norm": 0.18035291135311127, |
| "learning_rate": 2.919732441471572e-06, |
| "loss": 6.3664, |
| "step": 30900 |
| }, |
| { |
| "epoch": 274.69084054113995, |
| "eval_loss": 6.382543563842773, |
| "eval_runtime": 89.0418, |
| "eval_samples_per_second": 112.307, |
| "eval_steps_per_second": 3.515, |
| "step": 30900 |
| }, |
| { |
| "epoch": 275.5779552007097, |
| "grad_norm": 0.24907241761684418, |
| "learning_rate": 2.9096989966555184e-06, |
| "loss": 6.3669, |
| "step": 31000 |
| }, |
| { |
| "epoch": 275.5779552007097, |
| "eval_loss": 6.379300594329834, |
| "eval_runtime": 88.2037, |
| "eval_samples_per_second": 113.374, |
| "eval_steps_per_second": 3.549, |
| "step": 31000 |
| }, |
| { |
| "epoch": 276.4650698602794, |
| "grad_norm": 0.1900593638420105, |
| "learning_rate": 2.899665551839465e-06, |
| "loss": 6.367, |
| "step": 31100 |
| }, |
| { |
| "epoch": 276.4650698602794, |
| "eval_loss": 6.3781561851501465, |
| "eval_runtime": 89.0059, |
| "eval_samples_per_second": 112.352, |
| "eval_steps_per_second": 3.517, |
| "step": 31100 |
| }, |
| { |
| "epoch": 277.3521845198492, |
| "grad_norm": 0.16180412471294403, |
| "learning_rate": 2.8896321070234115e-06, |
| "loss": 6.3663, |
| "step": 31200 |
| }, |
| { |
| "epoch": 277.3521845198492, |
| "eval_loss": 6.377742767333984, |
| "eval_runtime": 89.0264, |
| "eval_samples_per_second": 112.326, |
| "eval_steps_per_second": 3.516, |
| "step": 31200 |
| }, |
| { |
| "epoch": 278.23929917941894, |
| "grad_norm": 0.15212863683700562, |
| "learning_rate": 2.879598662207358e-06, |
| "loss": 6.3667, |
| "step": 31300 |
| }, |
| { |
| "epoch": 278.23929917941894, |
| "eval_loss": 6.379834175109863, |
| "eval_runtime": 88.1893, |
| "eval_samples_per_second": 113.392, |
| "eval_steps_per_second": 3.549, |
| "step": 31300 |
| }, |
| { |
| "epoch": 279.1264138389887, |
| "grad_norm": 0.17719916999340057, |
| "learning_rate": 2.8695652173913046e-06, |
| "loss": 6.3662, |
| "step": 31400 |
| }, |
| { |
| "epoch": 279.1264138389887, |
| "eval_loss": 6.383392333984375, |
| "eval_runtime": 88.1973, |
| "eval_samples_per_second": 113.382, |
| "eval_steps_per_second": 3.549, |
| "step": 31400 |
| }, |
| { |
| "epoch": 280.01352849855846, |
| "grad_norm": 0.25364619493484497, |
| "learning_rate": 2.859531772575251e-06, |
| "loss": 6.3667, |
| "step": 31500 |
| }, |
| { |
| "epoch": 280.01352849855846, |
| "eval_loss": 6.38493537902832, |
| "eval_runtime": 88.2155, |
| "eval_samples_per_second": 113.359, |
| "eval_steps_per_second": 3.548, |
| "step": 31500 |
| }, |
| { |
| "epoch": 280.90064315812816, |
| "grad_norm": 0.14650413393974304, |
| "learning_rate": 2.8494983277591977e-06, |
| "loss": 6.3657, |
| "step": 31600 |
| }, |
| { |
| "epoch": 280.90064315812816, |
| "eval_loss": 6.381402015686035, |
| "eval_runtime": 89.0091, |
| "eval_samples_per_second": 112.348, |
| "eval_steps_per_second": 3.516, |
| "step": 31600 |
| }, |
| { |
| "epoch": 281.7877578176979, |
| "grad_norm": 0.18827463686466217, |
| "learning_rate": 2.839464882943144e-06, |
| "loss": 6.366, |
| "step": 31700 |
| }, |
| { |
| "epoch": 281.7877578176979, |
| "eval_loss": 6.382148265838623, |
| "eval_runtime": 89.0075, |
| "eval_samples_per_second": 112.35, |
| "eval_steps_per_second": 3.517, |
| "step": 31700 |
| }, |
| { |
| "epoch": 282.6748724772677, |
| "grad_norm": 0.1384831815958023, |
| "learning_rate": 2.8294314381270904e-06, |
| "loss": 6.3652, |
| "step": 31800 |
| }, |
| { |
| "epoch": 282.6748724772677, |
| "eval_loss": 6.384429454803467, |
| "eval_runtime": 89.0178, |
| "eval_samples_per_second": 112.337, |
| "eval_steps_per_second": 3.516, |
| "step": 31800 |
| }, |
| { |
| "epoch": 283.56198713683744, |
| "grad_norm": 0.2322372943162918, |
| "learning_rate": 2.819397993311037e-06, |
| "loss": 6.3665, |
| "step": 31900 |
| }, |
| { |
| "epoch": 283.56198713683744, |
| "eval_loss": 6.378748416900635, |
| "eval_runtime": 88.1981, |
| "eval_samples_per_second": 113.381, |
| "eval_steps_per_second": 3.549, |
| "step": 31900 |
| }, |
| { |
| "epoch": 284.4491017964072, |
| "grad_norm": 0.18588069081306458, |
| "learning_rate": 2.8093645484949835e-06, |
| "loss": 6.3655, |
| "step": 32000 |
| }, |
| { |
| "epoch": 284.4491017964072, |
| "eval_loss": 6.383064270019531, |
| "eval_runtime": 88.9701, |
| "eval_samples_per_second": 112.397, |
| "eval_steps_per_second": 3.518, |
| "step": 32000 |
| }, |
| { |
| "epoch": 285.3362164559769, |
| "grad_norm": 0.24989992380142212, |
| "learning_rate": 2.79933110367893e-06, |
| "loss": 6.3657, |
| "step": 32100 |
| }, |
| { |
| "epoch": 285.3362164559769, |
| "eval_loss": 6.381895542144775, |
| "eval_runtime": 88.1861, |
| "eval_samples_per_second": 113.396, |
| "eval_steps_per_second": 3.549, |
| "step": 32100 |
| }, |
| { |
| "epoch": 286.22333111554667, |
| "grad_norm": 0.15007902681827545, |
| "learning_rate": 2.7892976588628766e-06, |
| "loss": 6.3655, |
| "step": 32200 |
| }, |
| { |
| "epoch": 286.22333111554667, |
| "eval_loss": 6.381099224090576, |
| "eval_runtime": 88.2079, |
| "eval_samples_per_second": 113.368, |
| "eval_steps_per_second": 3.548, |
| "step": 32200 |
| }, |
| { |
| "epoch": 287.11044577511643, |
| "grad_norm": 0.1818419098854065, |
| "learning_rate": 2.779264214046823e-06, |
| "loss": 6.3647, |
| "step": 32300 |
| }, |
| { |
| "epoch": 287.11044577511643, |
| "eval_loss": 6.380296230316162, |
| "eval_runtime": 88.1867, |
| "eval_samples_per_second": 113.396, |
| "eval_steps_per_second": 3.549, |
| "step": 32300 |
| }, |
| { |
| "epoch": 287.9975604346862, |
| "grad_norm": 0.16886812448501587, |
| "learning_rate": 2.7692307692307693e-06, |
| "loss": 6.3657, |
| "step": 32400 |
| }, |
| { |
| "epoch": 287.9975604346862, |
| "eval_loss": 6.378762245178223, |
| "eval_runtime": 89.0581, |
| "eval_samples_per_second": 112.286, |
| "eval_steps_per_second": 3.515, |
| "step": 32400 |
| }, |
| { |
| "epoch": 288.88467509425595, |
| "grad_norm": 0.1774781197309494, |
| "learning_rate": 2.759197324414716e-06, |
| "loss": 6.3652, |
| "step": 32500 |
| }, |
| { |
| "epoch": 288.88467509425595, |
| "eval_loss": 6.377442359924316, |
| "eval_runtime": 89.0228, |
| "eval_samples_per_second": 112.331, |
| "eval_steps_per_second": 3.516, |
| "step": 32500 |
| }, |
| { |
| "epoch": 289.77178975382566, |
| "grad_norm": 0.22276373207569122, |
| "learning_rate": 2.749163879598662e-06, |
| "loss": 6.3651, |
| "step": 32600 |
| }, |
| { |
| "epoch": 289.77178975382566, |
| "eval_loss": 6.378692626953125, |
| "eval_runtime": 88.9428, |
| "eval_samples_per_second": 112.432, |
| "eval_steps_per_second": 3.519, |
| "step": 32600 |
| }, |
| { |
| "epoch": 290.6589044133954, |
| "grad_norm": 0.17587396502494812, |
| "learning_rate": 2.7391304347826087e-06, |
| "loss": 6.3659, |
| "step": 32700 |
| }, |
| { |
| "epoch": 290.6589044133954, |
| "eval_loss": 6.381659984588623, |
| "eval_runtime": 88.9921, |
| "eval_samples_per_second": 112.37, |
| "eval_steps_per_second": 3.517, |
| "step": 32700 |
| }, |
| { |
| "epoch": 291.5460190729652, |
| "grad_norm": 0.14095981419086456, |
| "learning_rate": 2.729096989966555e-06, |
| "loss": 6.3658, |
| "step": 32800 |
| }, |
| { |
| "epoch": 291.5460190729652, |
| "eval_loss": 6.3807477951049805, |
| "eval_runtime": 88.2004, |
| "eval_samples_per_second": 113.378, |
| "eval_steps_per_second": 3.549, |
| "step": 32800 |
| }, |
| { |
| "epoch": 292.43313373253494, |
| "grad_norm": 0.24706387519836426, |
| "learning_rate": 2.7190635451505014e-06, |
| "loss": 6.3664, |
| "step": 32900 |
| }, |
| { |
| "epoch": 292.43313373253494, |
| "eval_loss": 6.381751537322998, |
| "eval_runtime": 88.2016, |
| "eval_samples_per_second": 113.377, |
| "eval_steps_per_second": 3.549, |
| "step": 32900 |
| }, |
| { |
| "epoch": 293.3202483921047, |
| "grad_norm": 0.22346995770931244, |
| "learning_rate": 2.709030100334448e-06, |
| "loss": 6.3639, |
| "step": 33000 |
| }, |
| { |
| "epoch": 293.3202483921047, |
| "eval_loss": 6.382026195526123, |
| "eval_runtime": 88.1835, |
| "eval_samples_per_second": 113.4, |
| "eval_steps_per_second": 3.549, |
| "step": 33000 |
| }, |
| { |
| "epoch": 294.2073630516744, |
| "grad_norm": 0.172585129737854, |
| "learning_rate": 2.6989966555183945e-06, |
| "loss": 6.3672, |
| "step": 33100 |
| }, |
| { |
| "epoch": 294.2073630516744, |
| "eval_loss": 6.37891149520874, |
| "eval_runtime": 88.1788, |
| "eval_samples_per_second": 113.406, |
| "eval_steps_per_second": 3.55, |
| "step": 33100 |
| }, |
| { |
| "epoch": 295.09447771124417, |
| "grad_norm": 0.19066356122493744, |
| "learning_rate": 2.6889632107023413e-06, |
| "loss": 6.3665, |
| "step": 33200 |
| }, |
| { |
| "epoch": 295.09447771124417, |
| "eval_loss": 6.381018161773682, |
| "eval_runtime": 88.2083, |
| "eval_samples_per_second": 113.368, |
| "eval_steps_per_second": 3.548, |
| "step": 33200 |
| }, |
| { |
| "epoch": 295.9815923708139, |
| "grad_norm": 0.18018165230751038, |
| "learning_rate": 2.6789297658862876e-06, |
| "loss": 6.3654, |
| "step": 33300 |
| }, |
| { |
| "epoch": 295.9815923708139, |
| "eval_loss": 6.384938716888428, |
| "eval_runtime": 89.0301, |
| "eval_samples_per_second": 112.322, |
| "eval_steps_per_second": 3.516, |
| "step": 33300 |
| }, |
| { |
| "epoch": 296.8687070303837, |
| "grad_norm": 0.20351873338222504, |
| "learning_rate": 2.668896321070234e-06, |
| "loss": 6.3657, |
| "step": 33400 |
| }, |
| { |
| "epoch": 296.8687070303837, |
| "eval_loss": 6.382087230682373, |
| "eval_runtime": 88.6634, |
| "eval_samples_per_second": 112.786, |
| "eval_steps_per_second": 3.53, |
| "step": 33400 |
| }, |
| { |
| "epoch": 297.75582168995345, |
| "grad_norm": 0.13977867364883423, |
| "learning_rate": 2.6588628762541807e-06, |
| "loss": 6.3651, |
| "step": 33500 |
| }, |
| { |
| "epoch": 297.75582168995345, |
| "eval_loss": 6.378364086151123, |
| "eval_runtime": 88.988, |
| "eval_samples_per_second": 112.375, |
| "eval_steps_per_second": 3.517, |
| "step": 33500 |
| }, |
| { |
| "epoch": 298.64293634952315, |
| "grad_norm": 0.17024530470371246, |
| "learning_rate": 2.648829431438127e-06, |
| "loss": 6.3661, |
| "step": 33600 |
| }, |
| { |
| "epoch": 298.64293634952315, |
| "eval_loss": 6.375431060791016, |
| "eval_runtime": 88.1687, |
| "eval_samples_per_second": 113.419, |
| "eval_steps_per_second": 3.55, |
| "step": 33600 |
| }, |
| { |
| "epoch": 299.5300510090929, |
| "grad_norm": 0.2234225571155548, |
| "learning_rate": 2.6387959866220734e-06, |
| "loss": 6.3654, |
| "step": 33700 |
| }, |
| { |
| "epoch": 299.5300510090929, |
| "eval_loss": 6.378067970275879, |
| "eval_runtime": 88.1651, |
| "eval_samples_per_second": 113.424, |
| "eval_steps_per_second": 3.55, |
| "step": 33700 |
| }, |
| { |
| "epoch": 300.4171656686627, |
| "grad_norm": 0.2681805193424225, |
| "learning_rate": 2.62876254180602e-06, |
| "loss": 6.3655, |
| "step": 33800 |
| }, |
| { |
| "epoch": 300.4171656686627, |
| "eval_loss": 6.379166603088379, |
| "eval_runtime": 88.1788, |
| "eval_samples_per_second": 113.406, |
| "eval_steps_per_second": 3.55, |
| "step": 33800 |
| }, |
| { |
| "epoch": 301.30428032823244, |
| "grad_norm": 0.1696304976940155, |
| "learning_rate": 2.6187290969899665e-06, |
| "loss": 6.3653, |
| "step": 33900 |
| }, |
| { |
| "epoch": 301.30428032823244, |
| "eval_loss": 6.376532554626465, |
| "eval_runtime": 88.1839, |
| "eval_samples_per_second": 113.399, |
| "eval_steps_per_second": 3.549, |
| "step": 33900 |
| }, |
| { |
| "epoch": 302.1913949878022, |
| "grad_norm": 0.2099679708480835, |
| "learning_rate": 2.6086956521739132e-06, |
| "loss": 6.3654, |
| "step": 34000 |
| }, |
| { |
| "epoch": 302.1913949878022, |
| "eval_loss": 6.383284568786621, |
| "eval_runtime": 88.1787, |
| "eval_samples_per_second": 113.406, |
| "eval_steps_per_second": 3.55, |
| "step": 34000 |
| }, |
| { |
| "epoch": 303.0785096473719, |
| "grad_norm": 0.16611598432064056, |
| "learning_rate": 2.5986622073578596e-06, |
| "loss": 6.3651, |
| "step": 34100 |
| }, |
| { |
| "epoch": 303.0785096473719, |
| "eval_loss": 6.381277084350586, |
| "eval_runtime": 88.3292, |
| "eval_samples_per_second": 113.213, |
| "eval_steps_per_second": 3.544, |
| "step": 34100 |
| }, |
| { |
| "epoch": 303.96562430694166, |
| "grad_norm": 0.19213254749774933, |
| "learning_rate": 2.588628762541806e-06, |
| "loss": 6.3652, |
| "step": 34200 |
| }, |
| { |
| "epoch": 303.96562430694166, |
| "eval_loss": 6.383517265319824, |
| "eval_runtime": 89.0065, |
| "eval_samples_per_second": 112.351, |
| "eval_steps_per_second": 3.517, |
| "step": 34200 |
| }, |
| { |
| "epoch": 304.8527389665114, |
| "grad_norm": 0.16786985099315643, |
| "learning_rate": 2.5785953177257527e-06, |
| "loss": 6.365, |
| "step": 34300 |
| }, |
| { |
| "epoch": 304.8527389665114, |
| "eval_loss": 6.381478786468506, |
| "eval_runtime": 89.048, |
| "eval_samples_per_second": 112.299, |
| "eval_steps_per_second": 3.515, |
| "step": 34300 |
| }, |
| { |
| "epoch": 305.7398536260812, |
| "grad_norm": 0.1815180480480194, |
| "learning_rate": 2.568561872909699e-06, |
| "loss": 6.365, |
| "step": 34400 |
| }, |
| { |
| "epoch": 305.7398536260812, |
| "eval_loss": 6.379263877868652, |
| "eval_runtime": 89.0151, |
| "eval_samples_per_second": 112.34, |
| "eval_steps_per_second": 3.516, |
| "step": 34400 |
| }, |
| { |
| "epoch": 306.62696828565095, |
| "grad_norm": 0.23312950134277344, |
| "learning_rate": 2.5585284280936454e-06, |
| "loss": 6.3646, |
| "step": 34500 |
| }, |
| { |
| "epoch": 306.62696828565095, |
| "eval_loss": 6.380245685577393, |
| "eval_runtime": 89.0276, |
| "eval_samples_per_second": 112.325, |
| "eval_steps_per_second": 3.516, |
| "step": 34500 |
| }, |
| { |
| "epoch": 307.51408294522065, |
| "grad_norm": 0.17679564654827118, |
| "learning_rate": 2.548494983277592e-06, |
| "loss": 6.3644, |
| "step": 34600 |
| }, |
| { |
| "epoch": 307.51408294522065, |
| "eval_loss": 6.380576133728027, |
| "eval_runtime": 89.0337, |
| "eval_samples_per_second": 112.317, |
| "eval_steps_per_second": 3.516, |
| "step": 34600 |
| }, |
| { |
| "epoch": 308.4011976047904, |
| "grad_norm": 0.15505360066890717, |
| "learning_rate": 2.5384615384615385e-06, |
| "loss": 6.3652, |
| "step": 34700 |
| }, |
| { |
| "epoch": 308.4011976047904, |
| "eval_loss": 6.379436492919922, |
| "eval_runtime": 89.0636, |
| "eval_samples_per_second": 112.279, |
| "eval_steps_per_second": 3.514, |
| "step": 34700 |
| }, |
| { |
| "epoch": 309.2883122643602, |
| "grad_norm": 0.1679382175207138, |
| "learning_rate": 2.528428093645485e-06, |
| "loss": 6.3651, |
| "step": 34800 |
| }, |
| { |
| "epoch": 309.2883122643602, |
| "eval_loss": 6.37863302230835, |
| "eval_runtime": 89.0287, |
| "eval_samples_per_second": 112.323, |
| "eval_steps_per_second": 3.516, |
| "step": 34800 |
| }, |
| { |
| "epoch": 310.17542692392993, |
| "grad_norm": 0.1264224648475647, |
| "learning_rate": 2.5183946488294316e-06, |
| "loss": 6.365, |
| "step": 34900 |
| }, |
| { |
| "epoch": 310.17542692392993, |
| "eval_loss": 6.381104469299316, |
| "eval_runtime": 88.9777, |
| "eval_samples_per_second": 112.388, |
| "eval_steps_per_second": 3.518, |
| "step": 34900 |
| }, |
| { |
| "epoch": 311.0625415834997, |
| "grad_norm": 0.17346155643463135, |
| "learning_rate": 2.508361204013378e-06, |
| "loss": 6.3654, |
| "step": 35000 |
| }, |
| { |
| "epoch": 311.0625415834997, |
| "eval_loss": 6.379766464233398, |
| "eval_runtime": 88.9982, |
| "eval_samples_per_second": 112.362, |
| "eval_steps_per_second": 3.517, |
| "step": 35000 |
| }, |
| { |
| "epoch": 311.9496562430694, |
| "grad_norm": 0.2368006557226181, |
| "learning_rate": 2.4983277591973247e-06, |
| "loss": 6.3649, |
| "step": 35100 |
| }, |
| { |
| "epoch": 311.9496562430694, |
| "eval_loss": 6.376424789428711, |
| "eval_runtime": 89.004, |
| "eval_samples_per_second": 112.354, |
| "eval_steps_per_second": 3.517, |
| "step": 35100 |
| }, |
| { |
| "epoch": 312.83677090263916, |
| "grad_norm": 0.14664936065673828, |
| "learning_rate": 2.488294314381271e-06, |
| "loss": 6.365, |
| "step": 35200 |
| }, |
| { |
| "epoch": 312.83677090263916, |
| "eval_loss": 6.381261825561523, |
| "eval_runtime": 88.9989, |
| "eval_samples_per_second": 112.361, |
| "eval_steps_per_second": 3.517, |
| "step": 35200 |
| }, |
| { |
| "epoch": 313.7238855622089, |
| "grad_norm": 0.19366291165351868, |
| "learning_rate": 2.4782608695652173e-06, |
| "loss": 6.3656, |
| "step": 35300 |
| }, |
| { |
| "epoch": 313.7238855622089, |
| "eval_loss": 6.381620407104492, |
| "eval_runtime": 88.9954, |
| "eval_samples_per_second": 112.365, |
| "eval_steps_per_second": 3.517, |
| "step": 35300 |
| }, |
| { |
| "epoch": 314.6110002217787, |
| "grad_norm": 0.17280568182468414, |
| "learning_rate": 2.468227424749164e-06, |
| "loss": 6.3645, |
| "step": 35400 |
| }, |
| { |
| "epoch": 314.6110002217787, |
| "eval_loss": 6.376659870147705, |
| "eval_runtime": 89.0013, |
| "eval_samples_per_second": 112.358, |
| "eval_steps_per_second": 3.517, |
| "step": 35400 |
| }, |
| { |
| "epoch": 315.49811488134844, |
| "grad_norm": 0.20302744209766388, |
| "learning_rate": 2.4581939799331104e-06, |
| "loss": 6.3645, |
| "step": 35500 |
| }, |
| { |
| "epoch": 315.49811488134844, |
| "eval_loss": 6.376570701599121, |
| "eval_runtime": 88.9754, |
| "eval_samples_per_second": 112.391, |
| "eval_steps_per_second": 3.518, |
| "step": 35500 |
| }, |
| { |
| "epoch": 316.38522954091815, |
| "grad_norm": 0.18067042529582977, |
| "learning_rate": 2.4481605351170568e-06, |
| "loss": 6.3643, |
| "step": 35600 |
| }, |
| { |
| "epoch": 316.38522954091815, |
| "eval_loss": 6.377087593078613, |
| "eval_runtime": 89.0091, |
| "eval_samples_per_second": 112.348, |
| "eval_steps_per_second": 3.516, |
| "step": 35600 |
| }, |
| { |
| "epoch": 317.2723442004879, |
| "grad_norm": 0.17471148073673248, |
| "learning_rate": 2.4381270903010035e-06, |
| "loss": 6.3648, |
| "step": 35700 |
| }, |
| { |
| "epoch": 317.2723442004879, |
| "eval_loss": 6.380537509918213, |
| "eval_runtime": 88.9943, |
| "eval_samples_per_second": 112.367, |
| "eval_steps_per_second": 3.517, |
| "step": 35700 |
| }, |
| { |
| "epoch": 318.15945886005767, |
| "grad_norm": 0.20188532769680023, |
| "learning_rate": 2.42809364548495e-06, |
| "loss": 6.3648, |
| "step": 35800 |
| }, |
| { |
| "epoch": 318.15945886005767, |
| "eval_loss": 6.380505084991455, |
| "eval_runtime": 89.0195, |
| "eval_samples_per_second": 112.335, |
| "eval_steps_per_second": 3.516, |
| "step": 35800 |
| }, |
| { |
| "epoch": 319.04657351962743, |
| "grad_norm": 0.1507243514060974, |
| "learning_rate": 2.4180602006688962e-06, |
| "loss": 6.3644, |
| "step": 35900 |
| }, |
| { |
| "epoch": 319.04657351962743, |
| "eval_loss": 6.3797736167907715, |
| "eval_runtime": 89.0064, |
| "eval_samples_per_second": 112.351, |
| "eval_steps_per_second": 3.517, |
| "step": 35900 |
| }, |
| { |
| "epoch": 319.93368817919713, |
| "grad_norm": 0.21795004606246948, |
| "learning_rate": 2.408026755852843e-06, |
| "loss": 6.3639, |
| "step": 36000 |
| }, |
| { |
| "epoch": 319.93368817919713, |
| "eval_loss": 6.379575729370117, |
| "eval_runtime": 88.9863, |
| "eval_samples_per_second": 112.377, |
| "eval_steps_per_second": 3.517, |
| "step": 36000 |
| }, |
| { |
| "epoch": 322.3211721327382, |
| "grad_norm": 0.16106590628623962, |
| "learning_rate": 2.3979933110367893e-06, |
| "loss": 6.3637, |
| "step": 36100 |
| }, |
| { |
| "epoch": 322.3211721327382, |
| "eval_loss": 6.3763837814331055, |
| "eval_runtime": 51.0122, |
| "eval_samples_per_second": 196.032, |
| "eval_steps_per_second": 3.509, |
| "step": 36100 |
| }, |
| { |
| "epoch": 323.21385600621, |
| "grad_norm": 0.1778295785188675, |
| "learning_rate": 2.387959866220736e-06, |
| "loss": 6.3645, |
| "step": 36200 |
| }, |
| { |
| "epoch": 323.21385600621, |
| "eval_loss": 6.37896728515625, |
| "eval_runtime": 51.0085, |
| "eval_samples_per_second": 196.046, |
| "eval_steps_per_second": 3.509, |
| "step": 36200 |
| }, |
| { |
| "epoch": 324.10653987968175, |
| "grad_norm": 0.16518907248973846, |
| "learning_rate": 2.3779264214046824e-06, |
| "loss": 6.3644, |
| "step": 36300 |
| }, |
| { |
| "epoch": 324.10653987968175, |
| "eval_loss": 6.379991054534912, |
| "eval_runtime": 50.9898, |
| "eval_samples_per_second": 196.118, |
| "eval_steps_per_second": 3.511, |
| "step": 36300 |
| }, |
| { |
| "epoch": 324.9992237531535, |
| "grad_norm": 0.17673678696155548, |
| "learning_rate": 2.3678929765886288e-06, |
| "loss": 6.363, |
| "step": 36400 |
| }, |
| { |
| "epoch": 324.9992237531535, |
| "eval_loss": 6.377546310424805, |
| "eval_runtime": 51.0024, |
| "eval_samples_per_second": 196.069, |
| "eval_steps_per_second": 3.51, |
| "step": 36400 |
| }, |
| { |
| "epoch": 325.89190762662525, |
| "grad_norm": 0.18940462172031403, |
| "learning_rate": 2.3578595317725755e-06, |
| "loss": 6.3639, |
| "step": 36500 |
| }, |
| { |
| "epoch": 325.89190762662525, |
| "eval_loss": 6.381035327911377, |
| "eval_runtime": 50.9912, |
| "eval_samples_per_second": 196.112, |
| "eval_steps_per_second": 3.51, |
| "step": 36500 |
| }, |
| { |
| "epoch": 326.784591500097, |
| "grad_norm": 0.17796489596366882, |
| "learning_rate": 2.347826086956522e-06, |
| "loss": 6.3641, |
| "step": 36600 |
| }, |
| { |
| "epoch": 326.784591500097, |
| "eval_loss": 6.379162311553955, |
| "eval_runtime": 50.9814, |
| "eval_samples_per_second": 196.15, |
| "eval_steps_per_second": 3.511, |
| "step": 36600 |
| }, |
| { |
| "epoch": 327.6772753735688, |
| "grad_norm": 0.14749275147914886, |
| "learning_rate": 2.337792642140468e-06, |
| "loss": 6.3643, |
| "step": 36700 |
| }, |
| { |
| "epoch": 327.6772753735688, |
| "eval_loss": 6.379159450531006, |
| "eval_runtime": 51.0081, |
| "eval_samples_per_second": 196.047, |
| "eval_steps_per_second": 3.509, |
| "step": 36700 |
| }, |
| { |
| "epoch": 328.5699592470406, |
| "grad_norm": 0.2123512327671051, |
| "learning_rate": 2.327759197324415e-06, |
| "loss": 6.3642, |
| "step": 36800 |
| }, |
| { |
| "epoch": 328.5699592470406, |
| "eval_loss": 6.38007116317749, |
| "eval_runtime": 50.9674, |
| "eval_samples_per_second": 196.204, |
| "eval_steps_per_second": 3.512, |
| "step": 36800 |
| }, |
| { |
| "epoch": 329.4626431205123, |
| "grad_norm": 0.16111308336257935, |
| "learning_rate": 2.3177257525083613e-06, |
| "loss": 6.3642, |
| "step": 36900 |
| }, |
| { |
| "epoch": 329.4626431205123, |
| "eval_loss": 6.381565570831299, |
| "eval_runtime": 50.965, |
| "eval_samples_per_second": 196.213, |
| "eval_steps_per_second": 3.512, |
| "step": 36900 |
| }, |
| { |
| "epoch": 330.3553269939841, |
| "grad_norm": 0.1736401915550232, |
| "learning_rate": 2.307692307692308e-06, |
| "loss": 6.3638, |
| "step": 37000 |
| }, |
| { |
| "epoch": 330.3553269939841, |
| "eval_loss": 6.379702568054199, |
| "eval_runtime": 50.9633, |
| "eval_samples_per_second": 196.22, |
| "eval_steps_per_second": 3.512, |
| "step": 37000 |
| }, |
| { |
| "epoch": 331.24801086745583, |
| "grad_norm": 0.144011989235878, |
| "learning_rate": 2.2976588628762544e-06, |
| "loss": 6.3638, |
| "step": 37100 |
| }, |
| { |
| "epoch": 331.24801086745583, |
| "eval_loss": 6.3794684410095215, |
| "eval_runtime": 51.0336, |
| "eval_samples_per_second": 195.949, |
| "eval_steps_per_second": 3.507, |
| "step": 37100 |
| }, |
| { |
| "epoch": 332.14069474092764, |
| "grad_norm": 0.18693791329860687, |
| "learning_rate": 2.2876254180602008e-06, |
| "loss": 6.364, |
| "step": 37200 |
| }, |
| { |
| "epoch": 332.14069474092764, |
| "eval_loss": 6.369089126586914, |
| "eval_runtime": 50.982, |
| "eval_samples_per_second": 196.148, |
| "eval_steps_per_second": 3.511, |
| "step": 37200 |
| }, |
| { |
| "epoch": 333.0333786143994, |
| "grad_norm": 0.2004149854183197, |
| "learning_rate": 2.2775919732441475e-06, |
| "loss": 6.3636, |
| "step": 37300 |
| }, |
| { |
| "epoch": 333.0333786143994, |
| "eval_loss": 6.379798889160156, |
| "eval_runtime": 50.9846, |
| "eval_samples_per_second": 196.138, |
| "eval_steps_per_second": 3.511, |
| "step": 37300 |
| }, |
| { |
| "epoch": 333.92606248787115, |
| "grad_norm": 0.21116772294044495, |
| "learning_rate": 2.267558528428094e-06, |
| "loss": 6.3638, |
| "step": 37400 |
| }, |
| { |
| "epoch": 333.92606248787115, |
| "eval_loss": 6.378098487854004, |
| "eval_runtime": 50.9792, |
| "eval_samples_per_second": 196.159, |
| "eval_steps_per_second": 3.511, |
| "step": 37400 |
| }, |
| { |
| "epoch": 334.8187463613429, |
| "grad_norm": 0.20911183953285217, |
| "learning_rate": 2.25752508361204e-06, |
| "loss": 6.3648, |
| "step": 37500 |
| }, |
| { |
| "epoch": 334.8187463613429, |
| "eval_loss": 6.374560356140137, |
| "eval_runtime": 50.5111, |
| "eval_samples_per_second": 197.976, |
| "eval_steps_per_second": 3.544, |
| "step": 37500 |
| }, |
| { |
| "epoch": 335.71143023481466, |
| "grad_norm": 0.1895991563796997, |
| "learning_rate": 2.2474916387959865e-06, |
| "loss": 6.3629, |
| "step": 37600 |
| }, |
| { |
| "epoch": 335.71143023481466, |
| "eval_loss": 6.377721309661865, |
| "eval_runtime": 50.9554, |
| "eval_samples_per_second": 196.25, |
| "eval_steps_per_second": 3.513, |
| "step": 37600 |
| }, |
| { |
| "epoch": 336.6041141082864, |
| "grad_norm": 0.23114106059074402, |
| "learning_rate": 2.237458193979933e-06, |
| "loss": 6.3648, |
| "step": 37700 |
| }, |
| { |
| "epoch": 336.6041141082864, |
| "eval_loss": 6.377990245819092, |
| "eval_runtime": 51.011, |
| "eval_samples_per_second": 196.036, |
| "eval_steps_per_second": 3.509, |
| "step": 37700 |
| }, |
| { |
| "epoch": 337.4967979817582, |
| "grad_norm": 0.1858934611082077, |
| "learning_rate": 2.2274247491638796e-06, |
| "loss": 6.3632, |
| "step": 37800 |
| }, |
| { |
| "epoch": 337.4967979817582, |
| "eval_loss": 6.380919933319092, |
| "eval_runtime": 50.986, |
| "eval_samples_per_second": 196.132, |
| "eval_steps_per_second": 3.511, |
| "step": 37800 |
| }, |
| { |
| "epoch": 338.38948185523, |
| "grad_norm": 0.1767103672027588, |
| "learning_rate": 2.217391304347826e-06, |
| "loss": 6.3647, |
| "step": 37900 |
| }, |
| { |
| "epoch": 338.38948185523, |
| "eval_loss": 6.374737739562988, |
| "eval_runtime": 50.9864, |
| "eval_samples_per_second": 196.131, |
| "eval_steps_per_second": 3.511, |
| "step": 37900 |
| }, |
| { |
| "epoch": 339.2821657287017, |
| "grad_norm": 0.17408744990825653, |
| "learning_rate": 2.2073578595317723e-06, |
| "loss": 6.3639, |
| "step": 38000 |
| }, |
| { |
| "epoch": 339.2821657287017, |
| "eval_loss": 6.3790283203125, |
| "eval_runtime": 50.9845, |
| "eval_samples_per_second": 196.138, |
| "eval_steps_per_second": 3.511, |
| "step": 38000 |
| }, |
| { |
| "epoch": 340.1748496021735, |
| "grad_norm": 0.16043353080749512, |
| "learning_rate": 2.197324414715719e-06, |
| "loss": 6.3631, |
| "step": 38100 |
| }, |
| { |
| "epoch": 340.1748496021735, |
| "eval_loss": 6.377453327178955, |
| "eval_runtime": 51.0066, |
| "eval_samples_per_second": 196.053, |
| "eval_steps_per_second": 3.509, |
| "step": 38100 |
| }, |
| { |
| "epoch": 341.06753347564523, |
| "grad_norm": 0.18346284329891205, |
| "learning_rate": 2.1872909698996654e-06, |
| "loss": 6.3638, |
| "step": 38200 |
| }, |
| { |
| "epoch": 341.06753347564523, |
| "eval_loss": 6.3782172203063965, |
| "eval_runtime": 50.987, |
| "eval_samples_per_second": 196.129, |
| "eval_steps_per_second": 3.511, |
| "step": 38200 |
| }, |
| { |
| "epoch": 341.96021734911704, |
| "grad_norm": 0.1794682890176773, |
| "learning_rate": 2.177257525083612e-06, |
| "loss": 6.3642, |
| "step": 38300 |
| }, |
| { |
| "epoch": 341.96021734911704, |
| "eval_loss": 6.383487701416016, |
| "eval_runtime": 51.0216, |
| "eval_samples_per_second": 195.996, |
| "eval_steps_per_second": 3.508, |
| "step": 38300 |
| }, |
| { |
| "epoch": 342.8529012225888, |
| "grad_norm": 0.18743447959423065, |
| "learning_rate": 2.1672240802675585e-06, |
| "loss": 6.3635, |
| "step": 38400 |
| }, |
| { |
| "epoch": 342.8529012225888, |
| "eval_loss": 6.378910064697266, |
| "eval_runtime": 50.985, |
| "eval_samples_per_second": 196.136, |
| "eval_steps_per_second": 3.511, |
| "step": 38400 |
| }, |
| { |
| "epoch": 343.74558509606055, |
| "grad_norm": 0.21308189630508423, |
| "learning_rate": 2.157190635451505e-06, |
| "loss": 6.3638, |
| "step": 38500 |
| }, |
| { |
| "epoch": 343.74558509606055, |
| "eval_loss": 6.3776469230651855, |
| "eval_runtime": 51.0198, |
| "eval_samples_per_second": 196.002, |
| "eval_steps_per_second": 3.508, |
| "step": 38500 |
| }, |
| { |
| "epoch": 344.6382689695323, |
| "grad_norm": 0.19906771183013916, |
| "learning_rate": 2.1471571906354516e-06, |
| "loss": 6.3635, |
| "step": 38600 |
| }, |
| { |
| "epoch": 344.6382689695323, |
| "eval_loss": 6.378528118133545, |
| "eval_runtime": 50.8807, |
| "eval_samples_per_second": 196.538, |
| "eval_steps_per_second": 3.518, |
| "step": 38600 |
| }, |
| { |
| "epoch": 345.53095284300406, |
| "grad_norm": 0.15157081186771393, |
| "learning_rate": 2.137123745819398e-06, |
| "loss": 6.3638, |
| "step": 38700 |
| }, |
| { |
| "epoch": 345.53095284300406, |
| "eval_loss": 6.377796649932861, |
| "eval_runtime": 50.9807, |
| "eval_samples_per_second": 196.153, |
| "eval_steps_per_second": 3.511, |
| "step": 38700 |
| }, |
| { |
| "epoch": 346.4236367164758, |
| "grad_norm": 0.13750579953193665, |
| "learning_rate": 2.1270903010033443e-06, |
| "loss": 6.3633, |
| "step": 38800 |
| }, |
| { |
| "epoch": 346.4236367164758, |
| "eval_loss": 6.373489856719971, |
| "eval_runtime": 51.0164, |
| "eval_samples_per_second": 196.015, |
| "eval_steps_per_second": 3.509, |
| "step": 38800 |
| }, |
| { |
| "epoch": 347.3163205899476, |
| "grad_norm": 0.14071586728096008, |
| "learning_rate": 2.117056856187291e-06, |
| "loss": 6.3638, |
| "step": 38900 |
| }, |
| { |
| "epoch": 347.3163205899476, |
| "eval_loss": 6.374903202056885, |
| "eval_runtime": 50.9908, |
| "eval_samples_per_second": 196.114, |
| "eval_steps_per_second": 3.51, |
| "step": 38900 |
| }, |
| { |
| "epoch": 348.2090044634194, |
| "grad_norm": 0.20056802034378052, |
| "learning_rate": 2.1070234113712374e-06, |
| "loss": 6.3625, |
| "step": 39000 |
| }, |
| { |
| "epoch": 348.2090044634194, |
| "eval_loss": 6.374448299407959, |
| "eval_runtime": 50.9627, |
| "eval_samples_per_second": 196.222, |
| "eval_steps_per_second": 3.512, |
| "step": 39000 |
| }, |
| { |
| "epoch": 349.10168833689113, |
| "grad_norm": 0.1474703550338745, |
| "learning_rate": 2.0969899665551837e-06, |
| "loss": 6.3644, |
| "step": 39100 |
| }, |
| { |
| "epoch": 349.10168833689113, |
| "eval_loss": 6.375302314758301, |
| "eval_runtime": 51.0147, |
| "eval_samples_per_second": 196.022, |
| "eval_steps_per_second": 3.509, |
| "step": 39100 |
| }, |
| { |
| "epoch": 349.9943722103629, |
| "grad_norm": 0.1974957287311554, |
| "learning_rate": 2.0869565217391305e-06, |
| "loss": 6.3636, |
| "step": 39200 |
| }, |
| { |
| "epoch": 349.9943722103629, |
| "eval_loss": 6.3749308586120605, |
| "eval_runtime": 50.9972, |
| "eval_samples_per_second": 196.089, |
| "eval_steps_per_second": 3.51, |
| "step": 39200 |
| }, |
| { |
| "epoch": 350.88705608383464, |
| "grad_norm": 0.1811438351869583, |
| "learning_rate": 2.076923076923077e-06, |
| "loss": 6.3641, |
| "step": 39300 |
| }, |
| { |
| "epoch": 350.88705608383464, |
| "eval_loss": 6.373296737670898, |
| "eval_runtime": 51.0664, |
| "eval_samples_per_second": 195.824, |
| "eval_steps_per_second": 3.505, |
| "step": 39300 |
| }, |
| { |
| "epoch": 351.77973995730645, |
| "grad_norm": 0.19500285387039185, |
| "learning_rate": 2.0668896321070236e-06, |
| "loss": 6.3635, |
| "step": 39400 |
| }, |
| { |
| "epoch": 351.77973995730645, |
| "eval_loss": 6.3765153884887695, |
| "eval_runtime": 50.9989, |
| "eval_samples_per_second": 196.083, |
| "eval_steps_per_second": 3.51, |
| "step": 39400 |
| }, |
| { |
| "epoch": 352.6724238307782, |
| "grad_norm": 0.14763915538787842, |
| "learning_rate": 2.05685618729097e-06, |
| "loss": 6.363, |
| "step": 39500 |
| }, |
| { |
| "epoch": 352.6724238307782, |
| "eval_loss": 6.380082607269287, |
| "eval_runtime": 51.0221, |
| "eval_samples_per_second": 195.993, |
| "eval_steps_per_second": 3.508, |
| "step": 39500 |
| }, |
| { |
| "epoch": 353.56510770424995, |
| "grad_norm": 0.14987926185131073, |
| "learning_rate": 2.0468227424749163e-06, |
| "loss": 6.3625, |
| "step": 39600 |
| }, |
| { |
| "epoch": 353.56510770424995, |
| "eval_loss": 6.375669002532959, |
| "eval_runtime": 50.9913, |
| "eval_samples_per_second": 196.112, |
| "eval_steps_per_second": 3.51, |
| "step": 39600 |
| }, |
| { |
| "epoch": 354.4577915777217, |
| "grad_norm": 0.1568908393383026, |
| "learning_rate": 2.036789297658863e-06, |
| "loss": 6.3639, |
| "step": 39700 |
| }, |
| { |
| "epoch": 354.4577915777217, |
| "eval_loss": 6.374993801116943, |
| "eval_runtime": 50.9889, |
| "eval_samples_per_second": 196.121, |
| "eval_steps_per_second": 3.511, |
| "step": 39700 |
| }, |
| { |
| "epoch": 355.35047545119346, |
| "grad_norm": 0.1752849966287613, |
| "learning_rate": 2.0267558528428094e-06, |
| "loss": 6.3636, |
| "step": 39800 |
| }, |
| { |
| "epoch": 355.35047545119346, |
| "eval_loss": 6.3728227615356445, |
| "eval_runtime": 51.0076, |
| "eval_samples_per_second": 196.049, |
| "eval_steps_per_second": 3.509, |
| "step": 39800 |
| }, |
| { |
| "epoch": 356.24315932466527, |
| "grad_norm": 0.15474580228328705, |
| "learning_rate": 2.0167224080267557e-06, |
| "loss": 6.3632, |
| "step": 39900 |
| }, |
| { |
| "epoch": 356.24315932466527, |
| "eval_loss": 6.374934196472168, |
| "eval_runtime": 50.9903, |
| "eval_samples_per_second": 196.116, |
| "eval_steps_per_second": 3.51, |
| "step": 39900 |
| }, |
| { |
| "epoch": 357.135843198137, |
| "grad_norm": 0.1670171320438385, |
| "learning_rate": 2.0066889632107025e-06, |
| "loss": 6.3632, |
| "step": 40000 |
| }, |
| { |
| "epoch": 357.135843198137, |
| "eval_loss": 6.3780436515808105, |
| "eval_runtime": 50.9795, |
| "eval_samples_per_second": 196.157, |
| "eval_steps_per_second": 3.511, |
| "step": 40000 |
| }, |
| { |
| "epoch": 358.0285270716088, |
| "grad_norm": 0.159672349691391, |
| "learning_rate": 1.996655518394649e-06, |
| "loss": 6.3633, |
| "step": 40100 |
| }, |
| { |
| "epoch": 358.0285270716088, |
| "eval_loss": 6.376949310302734, |
| "eval_runtime": 50.9704, |
| "eval_samples_per_second": 196.192, |
| "eval_steps_per_second": 3.512, |
| "step": 40100 |
| }, |
| { |
| "epoch": 358.92121094508053, |
| "grad_norm": 0.11732380092144012, |
| "learning_rate": 1.986622073578595e-06, |
| "loss": 6.3624, |
| "step": 40200 |
| }, |
| { |
| "epoch": 358.92121094508053, |
| "eval_loss": 6.378962516784668, |
| "eval_runtime": 51.2082, |
| "eval_samples_per_second": 195.281, |
| "eval_steps_per_second": 3.496, |
| "step": 40200 |
| }, |
| { |
| "epoch": 359.8138948185523, |
| "grad_norm": 0.16079199314117432, |
| "learning_rate": 1.976588628762542e-06, |
| "loss": 6.3627, |
| "step": 40300 |
| }, |
| { |
| "epoch": 359.8138948185523, |
| "eval_loss": 6.376839637756348, |
| "eval_runtime": 51.2246, |
| "eval_samples_per_second": 195.219, |
| "eval_steps_per_second": 3.494, |
| "step": 40300 |
| }, |
| { |
| "epoch": 360.70657869202404, |
| "grad_norm": 0.1894705593585968, |
| "learning_rate": 1.9665551839464883e-06, |
| "loss": 6.3629, |
| "step": 40400 |
| }, |
| { |
| "epoch": 360.70657869202404, |
| "eval_loss": 6.376771450042725, |
| "eval_runtime": 50.9722, |
| "eval_samples_per_second": 196.185, |
| "eval_steps_per_second": 3.512, |
| "step": 40400 |
| }, |
| { |
| "epoch": 361.59926256549585, |
| "grad_norm": 0.15382538735866547, |
| "learning_rate": 1.956521739130435e-06, |
| "loss": 6.3629, |
| "step": 40500 |
| }, |
| { |
| "epoch": 361.59926256549585, |
| "eval_loss": 6.377914905548096, |
| "eval_runtime": 50.9641, |
| "eval_samples_per_second": 196.217, |
| "eval_steps_per_second": 3.512, |
| "step": 40500 |
| }, |
| { |
| "epoch": 362.4919464389676, |
| "grad_norm": 0.20456081628799438, |
| "learning_rate": 1.9464882943143814e-06, |
| "loss": 6.3619, |
| "step": 40600 |
| }, |
| { |
| "epoch": 362.4919464389676, |
| "eval_loss": 6.38068962097168, |
| "eval_runtime": 50.9716, |
| "eval_samples_per_second": 196.188, |
| "eval_steps_per_second": 3.512, |
| "step": 40600 |
| }, |
| { |
| "epoch": 363.38463031243936, |
| "grad_norm": 0.18184669315814972, |
| "learning_rate": 1.9364548494983277e-06, |
| "loss": 6.3628, |
| "step": 40700 |
| }, |
| { |
| "epoch": 363.38463031243936, |
| "eval_loss": 6.375256061553955, |
| "eval_runtime": 50.9921, |
| "eval_samples_per_second": 196.109, |
| "eval_steps_per_second": 3.51, |
| "step": 40700 |
| }, |
| { |
| "epoch": 364.2773141859111, |
| "grad_norm": 0.12955954670906067, |
| "learning_rate": 1.9264214046822745e-06, |
| "loss": 6.3634, |
| "step": 40800 |
| }, |
| { |
| "epoch": 364.2773141859111, |
| "eval_loss": 6.379732608795166, |
| "eval_runtime": 50.9701, |
| "eval_samples_per_second": 196.193, |
| "eval_steps_per_second": 3.512, |
| "step": 40800 |
| }, |
| { |
| "epoch": 365.16999805938286, |
| "grad_norm": 0.1785167008638382, |
| "learning_rate": 1.916387959866221e-06, |
| "loss": 6.3616, |
| "step": 40900 |
| }, |
| { |
| "epoch": 365.16999805938286, |
| "eval_loss": 6.372657775878906, |
| "eval_runtime": 50.9791, |
| "eval_samples_per_second": 196.159, |
| "eval_steps_per_second": 3.511, |
| "step": 40900 |
| }, |
| { |
| "epoch": 366.0626819328547, |
| "grad_norm": 0.17105770111083984, |
| "learning_rate": 1.9063545150501674e-06, |
| "loss": 6.3622, |
| "step": 41000 |
| }, |
| { |
| "epoch": 366.0626819328547, |
| "eval_loss": 6.378147602081299, |
| "eval_runtime": 50.9646, |
| "eval_samples_per_second": 196.214, |
| "eval_steps_per_second": 3.512, |
| "step": 41000 |
| }, |
| { |
| "epoch": 366.9553658063264, |
| "grad_norm": 0.16092269122600555, |
| "learning_rate": 1.896321070234114e-06, |
| "loss": 6.363, |
| "step": 41100 |
| }, |
| { |
| "epoch": 366.9553658063264, |
| "eval_loss": 6.378008842468262, |
| "eval_runtime": 50.971, |
| "eval_samples_per_second": 196.19, |
| "eval_steps_per_second": 3.512, |
| "step": 41100 |
| }, |
| { |
| "epoch": 367.8480496797982, |
| "grad_norm": 0.18064095079898834, |
| "learning_rate": 1.8862876254180603e-06, |
| "loss": 6.363, |
| "step": 41200 |
| }, |
| { |
| "epoch": 367.8480496797982, |
| "eval_loss": 6.373415470123291, |
| "eval_runtime": 50.9712, |
| "eval_samples_per_second": 196.189, |
| "eval_steps_per_second": 3.512, |
| "step": 41200 |
| }, |
| { |
| "epoch": 368.74073355326993, |
| "grad_norm": 0.14576148986816406, |
| "learning_rate": 1.8762541806020068e-06, |
| "loss": 6.3617, |
| "step": 41300 |
| }, |
| { |
| "epoch": 368.74073355326993, |
| "eval_loss": 6.375607013702393, |
| "eval_runtime": 50.965, |
| "eval_samples_per_second": 196.213, |
| "eval_steps_per_second": 3.512, |
| "step": 41300 |
| }, |
| { |
| "epoch": 369.6334174267417, |
| "grad_norm": 0.14404740929603577, |
| "learning_rate": 1.8662207357859534e-06, |
| "loss": 6.3629, |
| "step": 41400 |
| }, |
| { |
| "epoch": 369.6334174267417, |
| "eval_loss": 6.378086090087891, |
| "eval_runtime": 50.9589, |
| "eval_samples_per_second": 196.236, |
| "eval_steps_per_second": 3.513, |
| "step": 41400 |
| }, |
| { |
| "epoch": 370.52610130021344, |
| "grad_norm": 0.19737081229686737, |
| "learning_rate": 1.8561872909699e-06, |
| "loss": 6.3627, |
| "step": 41500 |
| }, |
| { |
| "epoch": 370.52610130021344, |
| "eval_loss": 6.375402927398682, |
| "eval_runtime": 50.9619, |
| "eval_samples_per_second": 196.225, |
| "eval_steps_per_second": 3.512, |
| "step": 41500 |
| }, |
| { |
| "epoch": 371.41878517368525, |
| "grad_norm": 0.14666880667209625, |
| "learning_rate": 1.8461538461538462e-06, |
| "loss": 6.3621, |
| "step": 41600 |
| }, |
| { |
| "epoch": 371.41878517368525, |
| "eval_loss": 6.375915050506592, |
| "eval_runtime": 50.9649, |
| "eval_samples_per_second": 196.213, |
| "eval_steps_per_second": 3.512, |
| "step": 41600 |
| }, |
| { |
| "epoch": 372.311469047157, |
| "grad_norm": 0.21582022309303284, |
| "learning_rate": 1.8361204013377928e-06, |
| "loss": 6.3626, |
| "step": 41700 |
| }, |
| { |
| "epoch": 372.311469047157, |
| "eval_loss": 6.38447904586792, |
| "eval_runtime": 50.9609, |
| "eval_samples_per_second": 196.229, |
| "eval_steps_per_second": 3.512, |
| "step": 41700 |
| }, |
| { |
| "epoch": 373.20415292062876, |
| "grad_norm": 0.1295013576745987, |
| "learning_rate": 1.8260869565217394e-06, |
| "loss": 6.362, |
| "step": 41800 |
| }, |
| { |
| "epoch": 373.20415292062876, |
| "eval_loss": 6.375004768371582, |
| "eval_runtime": 50.9807, |
| "eval_samples_per_second": 196.153, |
| "eval_steps_per_second": 3.511, |
| "step": 41800 |
| }, |
| { |
| "epoch": 374.0968367941005, |
| "grad_norm": 0.21674145758152008, |
| "learning_rate": 1.8160535117056857e-06, |
| "loss": 6.3622, |
| "step": 41900 |
| }, |
| { |
| "epoch": 374.0968367941005, |
| "eval_loss": 6.373767375946045, |
| "eval_runtime": 50.9601, |
| "eval_samples_per_second": 196.232, |
| "eval_steps_per_second": 3.513, |
| "step": 41900 |
| }, |
| { |
| "epoch": 374.98952066757226, |
| "grad_norm": 0.16833952069282532, |
| "learning_rate": 1.8060200668896322e-06, |
| "loss": 6.3621, |
| "step": 42000 |
| }, |
| { |
| "epoch": 374.98952066757226, |
| "eval_loss": 6.375979900360107, |
| "eval_runtime": 50.9671, |
| "eval_samples_per_second": 196.205, |
| "eval_steps_per_second": 3.512, |
| "step": 42000 |
| }, |
| { |
| "epoch": 375.8822045410441, |
| "grad_norm": 0.13281434774398804, |
| "learning_rate": 1.7959866220735788e-06, |
| "loss": 6.3622, |
| "step": 42100 |
| }, |
| { |
| "epoch": 375.8822045410441, |
| "eval_loss": 6.377115726470947, |
| "eval_runtime": 51.0774, |
| "eval_samples_per_second": 195.781, |
| "eval_steps_per_second": 3.504, |
| "step": 42100 |
| }, |
| { |
| "epoch": 376.77488841451583, |
| "grad_norm": 0.14955252408981323, |
| "learning_rate": 1.7859531772575253e-06, |
| "loss": 6.3622, |
| "step": 42200 |
| }, |
| { |
| "epoch": 376.77488841451583, |
| "eval_loss": 6.378284454345703, |
| "eval_runtime": 50.975, |
| "eval_samples_per_second": 196.175, |
| "eval_steps_per_second": 3.512, |
| "step": 42200 |
| }, |
| { |
| "epoch": 377.6675722879876, |
| "grad_norm": 0.1695183515548706, |
| "learning_rate": 1.7759197324414717e-06, |
| "loss": 6.3609, |
| "step": 42300 |
| }, |
| { |
| "epoch": 377.6675722879876, |
| "eval_loss": 6.377320766448975, |
| "eval_runtime": 50.9555, |
| "eval_samples_per_second": 196.25, |
| "eval_steps_per_second": 3.513, |
| "step": 42300 |
| }, |
| { |
| "epoch": 378.56025616145934, |
| "grad_norm": 0.1487826108932495, |
| "learning_rate": 1.7658862876254182e-06, |
| "loss": 6.3636, |
| "step": 42400 |
| }, |
| { |
| "epoch": 378.56025616145934, |
| "eval_loss": 6.373607158660889, |
| "eval_runtime": 50.958, |
| "eval_samples_per_second": 196.24, |
| "eval_steps_per_second": 3.513, |
| "step": 42400 |
| }, |
| { |
| "epoch": 379.4529400349311, |
| "grad_norm": 0.15890148282051086, |
| "learning_rate": 1.7558528428093648e-06, |
| "loss": 6.3622, |
| "step": 42500 |
| }, |
| { |
| "epoch": 379.4529400349311, |
| "eval_loss": 6.378411769866943, |
| "eval_runtime": 50.9578, |
| "eval_samples_per_second": 196.241, |
| "eval_steps_per_second": 3.513, |
| "step": 42500 |
| }, |
| { |
| "epoch": 380.3456239084029, |
| "grad_norm": 0.13191881775856018, |
| "learning_rate": 1.745819397993311e-06, |
| "loss": 6.3625, |
| "step": 42600 |
| }, |
| { |
| "epoch": 380.3456239084029, |
| "eval_loss": 6.380100250244141, |
| "eval_runtime": 50.9563, |
| "eval_samples_per_second": 196.246, |
| "eval_steps_per_second": 3.513, |
| "step": 42600 |
| }, |
| { |
| "epoch": 381.23830778187465, |
| "grad_norm": 0.13398431241512299, |
| "learning_rate": 1.7357859531772575e-06, |
| "loss": 6.3631, |
| "step": 42700 |
| }, |
| { |
| "epoch": 381.23830778187465, |
| "eval_loss": 6.372678756713867, |
| "eval_runtime": 50.967, |
| "eval_samples_per_second": 196.205, |
| "eval_steps_per_second": 3.512, |
| "step": 42700 |
| }, |
| { |
| "epoch": 382.1309916553464, |
| "grad_norm": 0.1774672120809555, |
| "learning_rate": 1.7257525083612038e-06, |
| "loss": 6.3619, |
| "step": 42800 |
| }, |
| { |
| "epoch": 382.1309916553464, |
| "eval_loss": 6.374143600463867, |
| "eval_runtime": 50.9527, |
| "eval_samples_per_second": 196.26, |
| "eval_steps_per_second": 3.513, |
| "step": 42800 |
| }, |
| { |
| "epoch": 383.02367552881816, |
| "grad_norm": 0.15919719636440277, |
| "learning_rate": 1.7157190635451504e-06, |
| "loss": 6.3625, |
| "step": 42900 |
| }, |
| { |
| "epoch": 383.02367552881816, |
| "eval_loss": 6.380612373352051, |
| "eval_runtime": 50.9597, |
| "eval_samples_per_second": 196.233, |
| "eval_steps_per_second": 3.513, |
| "step": 42900 |
| }, |
| { |
| "epoch": 383.9163594022899, |
| "grad_norm": 0.15100547671318054, |
| "learning_rate": 1.705685618729097e-06, |
| "loss": 6.3624, |
| "step": 43000 |
| }, |
| { |
| "epoch": 383.9163594022899, |
| "eval_loss": 6.375205039978027, |
| "eval_runtime": 51.0178, |
| "eval_samples_per_second": 196.01, |
| "eval_steps_per_second": 3.509, |
| "step": 43000 |
| }, |
| { |
| "epoch": 384.80904327576167, |
| "grad_norm": 0.17773090302944183, |
| "learning_rate": 1.6956521739130435e-06, |
| "loss": 6.3622, |
| "step": 43100 |
| }, |
| { |
| "epoch": 384.80904327576167, |
| "eval_loss": 6.377906322479248, |
| "eval_runtime": 50.9528, |
| "eval_samples_per_second": 196.26, |
| "eval_steps_per_second": 3.513, |
| "step": 43100 |
| }, |
| { |
| "epoch": 385.7017271492335, |
| "grad_norm": 0.16673114895820618, |
| "learning_rate": 1.6856187290969898e-06, |
| "loss": 6.3614, |
| "step": 43200 |
| }, |
| { |
| "epoch": 385.7017271492335, |
| "eval_loss": 6.3741583824157715, |
| "eval_runtime": 50.9886, |
| "eval_samples_per_second": 196.122, |
| "eval_steps_per_second": 3.511, |
| "step": 43200 |
| }, |
| { |
| "epoch": 386.59441102270523, |
| "grad_norm": 0.13911914825439453, |
| "learning_rate": 1.6755852842809363e-06, |
| "loss": 6.3627, |
| "step": 43300 |
| }, |
| { |
| "epoch": 386.59441102270523, |
| "eval_loss": 6.376387596130371, |
| "eval_runtime": 50.9745, |
| "eval_samples_per_second": 196.177, |
| "eval_steps_per_second": 3.512, |
| "step": 43300 |
| }, |
| { |
| "epoch": 387.487094896177, |
| "grad_norm": 0.14674533903598785, |
| "learning_rate": 1.665551839464883e-06, |
| "loss": 6.3615, |
| "step": 43400 |
| }, |
| { |
| "epoch": 387.487094896177, |
| "eval_loss": 6.374913692474365, |
| "eval_runtime": 50.964, |
| "eval_samples_per_second": 196.217, |
| "eval_steps_per_second": 3.512, |
| "step": 43400 |
| }, |
| { |
| "epoch": 388.37977876964874, |
| "grad_norm": 0.14424017071723938, |
| "learning_rate": 1.6555183946488294e-06, |
| "loss": 6.3614, |
| "step": 43500 |
| }, |
| { |
| "epoch": 388.37977876964874, |
| "eval_loss": 6.3738508224487305, |
| "eval_runtime": 50.9746, |
| "eval_samples_per_second": 196.176, |
| "eval_steps_per_second": 3.512, |
| "step": 43500 |
| }, |
| { |
| "epoch": 389.2724626431205, |
| "grad_norm": 0.12726858258247375, |
| "learning_rate": 1.6454849498327758e-06, |
| "loss": 6.3631, |
| "step": 43600 |
| }, |
| { |
| "epoch": 389.2724626431205, |
| "eval_loss": 6.377626895904541, |
| "eval_runtime": 50.9831, |
| "eval_samples_per_second": 196.143, |
| "eval_steps_per_second": 3.511, |
| "step": 43600 |
| }, |
| { |
| "epoch": 390.1651465165923, |
| "grad_norm": 0.1261419951915741, |
| "learning_rate": 1.6354515050167223e-06, |
| "loss": 6.362, |
| "step": 43700 |
| }, |
| { |
| "epoch": 390.1651465165923, |
| "eval_loss": 6.371913433074951, |
| "eval_runtime": 50.9952, |
| "eval_samples_per_second": 196.097, |
| "eval_steps_per_second": 3.51, |
| "step": 43700 |
| }, |
| { |
| "epoch": 391.05783039006405, |
| "grad_norm": 0.15761396288871765, |
| "learning_rate": 1.6254180602006689e-06, |
| "loss": 6.3625, |
| "step": 43800 |
| }, |
| { |
| "epoch": 391.05783039006405, |
| "eval_loss": 6.372257709503174, |
| "eval_runtime": 50.9814, |
| "eval_samples_per_second": 196.15, |
| "eval_steps_per_second": 3.511, |
| "step": 43800 |
| }, |
| { |
| "epoch": 391.9505142635358, |
| "grad_norm": 0.14318187534809113, |
| "learning_rate": 1.6153846153846154e-06, |
| "loss": 6.3622, |
| "step": 43900 |
| }, |
| { |
| "epoch": 391.9505142635358, |
| "eval_loss": 6.375759601593018, |
| "eval_runtime": 50.9942, |
| "eval_samples_per_second": 196.101, |
| "eval_steps_per_second": 3.51, |
| "step": 43900 |
| }, |
| { |
| "epoch": 392.84319813700756, |
| "grad_norm": 0.13848328590393066, |
| "learning_rate": 1.6053511705685618e-06, |
| "loss": 6.3612, |
| "step": 44000 |
| }, |
| { |
| "epoch": 392.84319813700756, |
| "eval_loss": 6.376217842102051, |
| "eval_runtime": 50.9908, |
| "eval_samples_per_second": 196.114, |
| "eval_steps_per_second": 3.51, |
| "step": 44000 |
| }, |
| { |
| "epoch": 393.7358820104793, |
| "grad_norm": 0.13598565757274628, |
| "learning_rate": 1.5953177257525083e-06, |
| "loss": 6.3625, |
| "step": 44100 |
| }, |
| { |
| "epoch": 393.7358820104793, |
| "eval_loss": 6.37490701675415, |
| "eval_runtime": 50.978, |
| "eval_samples_per_second": 196.163, |
| "eval_steps_per_second": 3.511, |
| "step": 44100 |
| }, |
| { |
| "epoch": 394.62856588395107, |
| "grad_norm": 0.14148621261119843, |
| "learning_rate": 1.5852842809364549e-06, |
| "loss": 6.3615, |
| "step": 44200 |
| }, |
| { |
| "epoch": 394.62856588395107, |
| "eval_loss": 6.378378868103027, |
| "eval_runtime": 50.9657, |
| "eval_samples_per_second": 196.21, |
| "eval_steps_per_second": 3.512, |
| "step": 44200 |
| }, |
| { |
| "epoch": 395.5212497574229, |
| "grad_norm": 0.13936679065227509, |
| "learning_rate": 1.5752508361204012e-06, |
| "loss": 6.3626, |
| "step": 44300 |
| }, |
| { |
| "epoch": 395.5212497574229, |
| "eval_loss": 6.374247074127197, |
| "eval_runtime": 50.9816, |
| "eval_samples_per_second": 196.149, |
| "eval_steps_per_second": 3.511, |
| "step": 44300 |
| }, |
| { |
| "epoch": 396.41393363089463, |
| "grad_norm": 0.163307785987854, |
| "learning_rate": 1.5652173913043478e-06, |
| "loss": 6.3611, |
| "step": 44400 |
| }, |
| { |
| "epoch": 396.41393363089463, |
| "eval_loss": 6.37465763092041, |
| "eval_runtime": 50.9876, |
| "eval_samples_per_second": 196.126, |
| "eval_steps_per_second": 3.511, |
| "step": 44400 |
| }, |
| { |
| "epoch": 397.3066175043664, |
| "grad_norm": 0.1514696627855301, |
| "learning_rate": 1.5551839464882943e-06, |
| "loss": 6.3614, |
| "step": 44500 |
| }, |
| { |
| "epoch": 397.3066175043664, |
| "eval_loss": 6.374813079833984, |
| "eval_runtime": 50.9704, |
| "eval_samples_per_second": 196.192, |
| "eval_steps_per_second": 3.512, |
| "step": 44500 |
| }, |
| { |
| "epoch": 398.19930137783814, |
| "grad_norm": 0.12864980101585388, |
| "learning_rate": 1.5451505016722409e-06, |
| "loss": 6.3611, |
| "step": 44600 |
| }, |
| { |
| "epoch": 398.19930137783814, |
| "eval_loss": 6.374229431152344, |
| "eval_runtime": 50.9713, |
| "eval_samples_per_second": 196.189, |
| "eval_steps_per_second": 3.512, |
| "step": 44600 |
| }, |
| { |
| "epoch": 399.0919852513099, |
| "grad_norm": 0.18459634482860565, |
| "learning_rate": 1.5351170568561872e-06, |
| "loss": 6.3623, |
| "step": 44700 |
| }, |
| { |
| "epoch": 399.0919852513099, |
| "eval_loss": 6.374811172485352, |
| "eval_runtime": 50.9833, |
| "eval_samples_per_second": 196.143, |
| "eval_steps_per_second": 3.511, |
| "step": 44700 |
| }, |
| { |
| "epoch": 399.9846691247817, |
| "grad_norm": 0.14292342960834503, |
| "learning_rate": 1.5250836120401338e-06, |
| "loss": 6.3611, |
| "step": 44800 |
| }, |
| { |
| "epoch": 399.9846691247817, |
| "eval_loss": 6.373171329498291, |
| "eval_runtime": 50.971, |
| "eval_samples_per_second": 196.19, |
| "eval_steps_per_second": 3.512, |
| "step": 44800 |
| }, |
| { |
| "epoch": 400.87735299825346, |
| "grad_norm": 0.14087602496147156, |
| "learning_rate": 1.5150501672240803e-06, |
| "loss": 6.3619, |
| "step": 44900 |
| }, |
| { |
| "epoch": 400.87735299825346, |
| "eval_loss": 6.3750786781311035, |
| "eval_runtime": 50.9873, |
| "eval_samples_per_second": 196.127, |
| "eval_steps_per_second": 3.511, |
| "step": 44900 |
| }, |
| { |
| "epoch": 401.7700368717252, |
| "grad_norm": 0.1677563190460205, |
| "learning_rate": 1.5050167224080269e-06, |
| "loss": 6.361, |
| "step": 45000 |
| }, |
| { |
| "epoch": 401.7700368717252, |
| "eval_loss": 6.37678337097168, |
| "eval_runtime": 50.9768, |
| "eval_samples_per_second": 196.168, |
| "eval_steps_per_second": 3.511, |
| "step": 45000 |
| }, |
| { |
| "epoch": 402.66272074519696, |
| "grad_norm": 0.16920335590839386, |
| "learning_rate": 1.4949832775919732e-06, |
| "loss": 6.3622, |
| "step": 45100 |
| }, |
| { |
| "epoch": 402.66272074519696, |
| "eval_loss": 6.371730327606201, |
| "eval_runtime": 51.1672, |
| "eval_samples_per_second": 195.438, |
| "eval_steps_per_second": 3.498, |
| "step": 45100 |
| }, |
| { |
| "epoch": 403.5554046186687, |
| "grad_norm": 0.1975216269493103, |
| "learning_rate": 1.4849498327759198e-06, |
| "loss": 6.3615, |
| "step": 45200 |
| }, |
| { |
| "epoch": 403.5554046186687, |
| "eval_loss": 6.373182773590088, |
| "eval_runtime": 50.97, |
| "eval_samples_per_second": 196.194, |
| "eval_steps_per_second": 3.512, |
| "step": 45200 |
| }, |
| { |
| "epoch": 404.4480884921405, |
| "grad_norm": 0.14191223680973053, |
| "learning_rate": 1.4749163879598663e-06, |
| "loss": 6.3616, |
| "step": 45300 |
| }, |
| { |
| "epoch": 404.4480884921405, |
| "eval_loss": 6.373088359832764, |
| "eval_runtime": 51.0328, |
| "eval_samples_per_second": 195.952, |
| "eval_steps_per_second": 3.508, |
| "step": 45300 |
| }, |
| { |
| "epoch": 405.3407723656123, |
| "grad_norm": 0.1346922665834427, |
| "learning_rate": 1.4648829431438129e-06, |
| "loss": 6.3612, |
| "step": 45400 |
| }, |
| { |
| "epoch": 405.3407723656123, |
| "eval_loss": 6.374698162078857, |
| "eval_runtime": 50.9921, |
| "eval_samples_per_second": 196.109, |
| "eval_steps_per_second": 3.51, |
| "step": 45400 |
| }, |
| { |
| "epoch": 406.23345623908403, |
| "grad_norm": 0.14625421166419983, |
| "learning_rate": 1.4548494983277592e-06, |
| "loss": 6.3618, |
| "step": 45500 |
| }, |
| { |
| "epoch": 406.23345623908403, |
| "eval_loss": 6.374713897705078, |
| "eval_runtime": 50.9902, |
| "eval_samples_per_second": 196.116, |
| "eval_steps_per_second": 3.51, |
| "step": 45500 |
| }, |
| { |
| "epoch": 407.1261401125558, |
| "grad_norm": 0.1339327096939087, |
| "learning_rate": 1.4448160535117058e-06, |
| "loss": 6.3614, |
| "step": 45600 |
| }, |
| { |
| "epoch": 407.1261401125558, |
| "eval_loss": 6.375463962554932, |
| "eval_runtime": 50.9843, |
| "eval_samples_per_second": 196.139, |
| "eval_steps_per_second": 3.511, |
| "step": 45600 |
| }, |
| { |
| "epoch": 408.01882398602754, |
| "grad_norm": 0.1191440001130104, |
| "learning_rate": 1.4347826086956523e-06, |
| "loss": 6.3616, |
| "step": 45700 |
| }, |
| { |
| "epoch": 408.01882398602754, |
| "eval_loss": 6.372775554656982, |
| "eval_runtime": 50.976, |
| "eval_samples_per_second": 196.171, |
| "eval_steps_per_second": 3.511, |
| "step": 45700 |
| }, |
| { |
| "epoch": 408.9115078594993, |
| "grad_norm": 0.14053776860237122, |
| "learning_rate": 1.4247491638795989e-06, |
| "loss": 6.3615, |
| "step": 45800 |
| }, |
| { |
| "epoch": 408.9115078594993, |
| "eval_loss": 6.376742362976074, |
| "eval_runtime": 50.9922, |
| "eval_samples_per_second": 196.108, |
| "eval_steps_per_second": 3.51, |
| "step": 45800 |
| }, |
| { |
| "epoch": 409.8041917329711, |
| "grad_norm": 0.1356232613325119, |
| "learning_rate": 1.4147157190635452e-06, |
| "loss": 6.3608, |
| "step": 45900 |
| }, |
| { |
| "epoch": 409.8041917329711, |
| "eval_loss": 6.3739728927612305, |
| "eval_runtime": 50.9685, |
| "eval_samples_per_second": 196.2, |
| "eval_steps_per_second": 3.512, |
| "step": 45900 |
| }, |
| { |
| "epoch": 410.69687560644286, |
| "grad_norm": 0.17138876020908356, |
| "learning_rate": 1.4046822742474917e-06, |
| "loss": 6.3613, |
| "step": 46000 |
| }, |
| { |
| "epoch": 410.69687560644286, |
| "eval_loss": 6.381918907165527, |
| "eval_runtime": 50.9709, |
| "eval_samples_per_second": 196.19, |
| "eval_steps_per_second": 3.512, |
| "step": 46000 |
| }, |
| { |
| "epoch": 411.5895594799146, |
| "grad_norm": 0.15673908591270447, |
| "learning_rate": 1.3946488294314383e-06, |
| "loss": 6.3619, |
| "step": 46100 |
| }, |
| { |
| "epoch": 411.5895594799146, |
| "eval_loss": 6.375350475311279, |
| "eval_runtime": 50.9723, |
| "eval_samples_per_second": 196.185, |
| "eval_steps_per_second": 3.512, |
| "step": 46100 |
| }, |
| { |
| "epoch": 412.48224335338637, |
| "grad_norm": 0.13772110641002655, |
| "learning_rate": 1.3846153846153846e-06, |
| "loss": 6.3609, |
| "step": 46200 |
| }, |
| { |
| "epoch": 412.48224335338637, |
| "eval_loss": 6.374034881591797, |
| "eval_runtime": 50.9636, |
| "eval_samples_per_second": 196.219, |
| "eval_steps_per_second": 3.512, |
| "step": 46200 |
| }, |
| { |
| "epoch": 413.3749272268581, |
| "grad_norm": 0.12614521384239197, |
| "learning_rate": 1.374581939799331e-06, |
| "loss": 6.3617, |
| "step": 46300 |
| }, |
| { |
| "epoch": 413.3749272268581, |
| "eval_loss": 6.375347137451172, |
| "eval_runtime": 50.9521, |
| "eval_samples_per_second": 196.263, |
| "eval_steps_per_second": 3.513, |
| "step": 46300 |
| }, |
| { |
| "epoch": 414.26761110032993, |
| "grad_norm": 0.13640394806861877, |
| "learning_rate": 1.3645484949832775e-06, |
| "loss": 6.3608, |
| "step": 46400 |
| }, |
| { |
| "epoch": 414.26761110032993, |
| "eval_loss": 6.378127574920654, |
| "eval_runtime": 50.9727, |
| "eval_samples_per_second": 196.184, |
| "eval_steps_per_second": 3.512, |
| "step": 46400 |
| }, |
| { |
| "epoch": 415.1602949738017, |
| "grad_norm": 0.17697331309318542, |
| "learning_rate": 1.354515050167224e-06, |
| "loss": 6.3614, |
| "step": 46500 |
| }, |
| { |
| "epoch": 415.1602949738017, |
| "eval_loss": 6.370326995849609, |
| "eval_runtime": 50.9684, |
| "eval_samples_per_second": 196.2, |
| "eval_steps_per_second": 3.512, |
| "step": 46500 |
| }, |
| { |
| "epoch": 416.05297884727344, |
| "grad_norm": 0.12979310750961304, |
| "learning_rate": 1.3444816053511706e-06, |
| "loss": 6.3618, |
| "step": 46600 |
| }, |
| { |
| "epoch": 416.05297884727344, |
| "eval_loss": 6.3708062171936035, |
| "eval_runtime": 50.983, |
| "eval_samples_per_second": 196.144, |
| "eval_steps_per_second": 3.511, |
| "step": 46600 |
| }, |
| { |
| "epoch": 416.9456627207452, |
| "grad_norm": 0.1369139850139618, |
| "learning_rate": 1.334448160535117e-06, |
| "loss": 6.3616, |
| "step": 46700 |
| }, |
| { |
| "epoch": 416.9456627207452, |
| "eval_loss": 6.375351905822754, |
| "eval_runtime": 50.979, |
| "eval_samples_per_second": 196.159, |
| "eval_steps_per_second": 3.511, |
| "step": 46700 |
| }, |
| { |
| "epoch": 417.83834659421694, |
| "grad_norm": 0.1491391658782959, |
| "learning_rate": 1.3244147157190635e-06, |
| "loss": 6.3612, |
| "step": 46800 |
| }, |
| { |
| "epoch": 417.83834659421694, |
| "eval_loss": 6.378176689147949, |
| "eval_runtime": 50.9644, |
| "eval_samples_per_second": 196.215, |
| "eval_steps_per_second": 3.512, |
| "step": 46800 |
| }, |
| { |
| "epoch": 418.7310304676887, |
| "grad_norm": 0.1265108585357666, |
| "learning_rate": 1.31438127090301e-06, |
| "loss": 6.361, |
| "step": 46900 |
| }, |
| { |
| "epoch": 418.7310304676887, |
| "eval_loss": 6.372585773468018, |
| "eval_runtime": 50.9948, |
| "eval_samples_per_second": 196.098, |
| "eval_steps_per_second": 3.51, |
| "step": 46900 |
| }, |
| { |
| "epoch": 419.6237143411605, |
| "grad_norm": 0.16357433795928955, |
| "learning_rate": 1.3043478260869566e-06, |
| "loss": 6.3608, |
| "step": 47000 |
| }, |
| { |
| "epoch": 419.6237143411605, |
| "eval_loss": 6.373856067657471, |
| "eval_runtime": 50.9849, |
| "eval_samples_per_second": 196.137, |
| "eval_steps_per_second": 3.511, |
| "step": 47000 |
| }, |
| { |
| "epoch": 420.51639821463226, |
| "grad_norm": 0.12764860689640045, |
| "learning_rate": 1.294314381270903e-06, |
| "loss": 6.3618, |
| "step": 47100 |
| }, |
| { |
| "epoch": 420.51639821463226, |
| "eval_loss": 6.377871513366699, |
| "eval_runtime": 50.9803, |
| "eval_samples_per_second": 196.154, |
| "eval_steps_per_second": 3.511, |
| "step": 47100 |
| }, |
| { |
| "epoch": 421.409082088104, |
| "grad_norm": 0.14270265400409698, |
| "learning_rate": 1.2842809364548495e-06, |
| "loss": 6.3608, |
| "step": 47200 |
| }, |
| { |
| "epoch": 421.409082088104, |
| "eval_loss": 6.3771162033081055, |
| "eval_runtime": 50.9877, |
| "eval_samples_per_second": 196.126, |
| "eval_steps_per_second": 3.511, |
| "step": 47200 |
| }, |
| { |
| "epoch": 422.30176596157577, |
| "grad_norm": 0.13178826868534088, |
| "learning_rate": 1.274247491638796e-06, |
| "loss": 6.3612, |
| "step": 47300 |
| }, |
| { |
| "epoch": 422.30176596157577, |
| "eval_loss": 6.375566482543945, |
| "eval_runtime": 50.9884, |
| "eval_samples_per_second": 196.123, |
| "eval_steps_per_second": 3.511, |
| "step": 47300 |
| }, |
| { |
| "epoch": 423.1944498350475, |
| "grad_norm": 0.17805926501750946, |
| "learning_rate": 1.2642140468227424e-06, |
| "loss": 6.361, |
| "step": 47400 |
| }, |
| { |
| "epoch": 423.1944498350475, |
| "eval_loss": 6.3782830238342285, |
| "eval_runtime": 50.983, |
| "eval_samples_per_second": 196.144, |
| "eval_steps_per_second": 3.511, |
| "step": 47400 |
| }, |
| { |
| "epoch": 424.08713370851933, |
| "grad_norm": 0.12532693147659302, |
| "learning_rate": 1.254180602006689e-06, |
| "loss": 6.3615, |
| "step": 47500 |
| }, |
| { |
| "epoch": 424.08713370851933, |
| "eval_loss": 6.372131824493408, |
| "eval_runtime": 50.9739, |
| "eval_samples_per_second": 196.179, |
| "eval_steps_per_second": 3.512, |
| "step": 47500 |
| }, |
| { |
| "epoch": 424.9798175819911, |
| "grad_norm": 0.18605230748653412, |
| "learning_rate": 1.2441471571906355e-06, |
| "loss": 6.3608, |
| "step": 47600 |
| }, |
| { |
| "epoch": 424.9798175819911, |
| "eval_loss": 6.375829696655273, |
| "eval_runtime": 50.9794, |
| "eval_samples_per_second": 196.158, |
| "eval_steps_per_second": 3.511, |
| "step": 47600 |
| }, |
| { |
| "epoch": 425.87250145546284, |
| "grad_norm": 0.13004036247730255, |
| "learning_rate": 1.234113712374582e-06, |
| "loss": 6.3611, |
| "step": 47700 |
| }, |
| { |
| "epoch": 425.87250145546284, |
| "eval_loss": 6.3748297691345215, |
| "eval_runtime": 50.9638, |
| "eval_samples_per_second": 196.218, |
| "eval_steps_per_second": 3.512, |
| "step": 47700 |
| }, |
| { |
| "epoch": 426.7651853289346, |
| "grad_norm": 0.14566391706466675, |
| "learning_rate": 1.2240802675585284e-06, |
| "loss": 6.3614, |
| "step": 47800 |
| }, |
| { |
| "epoch": 426.7651853289346, |
| "eval_loss": 6.375539302825928, |
| "eval_runtime": 50.9667, |
| "eval_samples_per_second": 196.206, |
| "eval_steps_per_second": 3.512, |
| "step": 47800 |
| }, |
| { |
| "epoch": 427.65786920240635, |
| "grad_norm": 0.12622636556625366, |
| "learning_rate": 1.214046822742475e-06, |
| "loss": 6.3602, |
| "step": 47900 |
| }, |
| { |
| "epoch": 427.65786920240635, |
| "eval_loss": 6.371495723724365, |
| "eval_runtime": 50.9753, |
| "eval_samples_per_second": 196.174, |
| "eval_steps_per_second": 3.512, |
| "step": 47900 |
| }, |
| { |
| "epoch": 428.55055307587816, |
| "grad_norm": 0.14083540439605713, |
| "learning_rate": 1.2040133779264215e-06, |
| "loss": 6.3616, |
| "step": 48000 |
| }, |
| { |
| "epoch": 428.55055307587816, |
| "eval_loss": 6.37429141998291, |
| "eval_runtime": 50.9764, |
| "eval_samples_per_second": 196.169, |
| "eval_steps_per_second": 3.511, |
| "step": 48000 |
| }, |
| { |
| "epoch": 429.4432369493499, |
| "grad_norm": 0.12131120264530182, |
| "learning_rate": 1.193979933110368e-06, |
| "loss": 6.3611, |
| "step": 48100 |
| }, |
| { |
| "epoch": 429.4432369493499, |
| "eval_loss": 6.371769428253174, |
| "eval_runtime": 51.0086, |
| "eval_samples_per_second": 196.045, |
| "eval_steps_per_second": 3.509, |
| "step": 48100 |
| }, |
| { |
| "epoch": 430.33592082282166, |
| "grad_norm": 0.11834459006786346, |
| "learning_rate": 1.1839464882943144e-06, |
| "loss": 6.3605, |
| "step": 48200 |
| }, |
| { |
| "epoch": 430.33592082282166, |
| "eval_loss": 6.368320465087891, |
| "eval_runtime": 50.9661, |
| "eval_samples_per_second": 196.209, |
| "eval_steps_per_second": 3.512, |
| "step": 48200 |
| }, |
| { |
| "epoch": 431.2286046962934, |
| "grad_norm": 0.13733911514282227, |
| "learning_rate": 1.173913043478261e-06, |
| "loss": 6.3607, |
| "step": 48300 |
| }, |
| { |
| "epoch": 431.2286046962934, |
| "eval_loss": 6.371362686157227, |
| "eval_runtime": 50.9504, |
| "eval_samples_per_second": 196.269, |
| "eval_steps_per_second": 3.513, |
| "step": 48300 |
| }, |
| { |
| "epoch": 432.12128856976517, |
| "grad_norm": 0.12458811700344086, |
| "learning_rate": 1.1638795986622075e-06, |
| "loss": 6.3604, |
| "step": 48400 |
| }, |
| { |
| "epoch": 432.12128856976517, |
| "eval_loss": 6.372464179992676, |
| "eval_runtime": 50.9762, |
| "eval_samples_per_second": 196.17, |
| "eval_steps_per_second": 3.511, |
| "step": 48400 |
| }, |
| { |
| "epoch": 433.0139724432369, |
| "grad_norm": 0.16090624034404755, |
| "learning_rate": 1.153846153846154e-06, |
| "loss": 6.3611, |
| "step": 48500 |
| }, |
| { |
| "epoch": 433.0139724432369, |
| "eval_loss": 6.373631000518799, |
| "eval_runtime": 50.9618, |
| "eval_samples_per_second": 196.226, |
| "eval_steps_per_second": 3.512, |
| "step": 48500 |
| }, |
| { |
| "epoch": 433.90665631670873, |
| "grad_norm": 0.12443886697292328, |
| "learning_rate": 1.1438127090301004e-06, |
| "loss": 6.361, |
| "step": 48600 |
| }, |
| { |
| "epoch": 433.90665631670873, |
| "eval_loss": 6.3762993812561035, |
| "eval_runtime": 50.9606, |
| "eval_samples_per_second": 196.23, |
| "eval_steps_per_second": 3.513, |
| "step": 48600 |
| }, |
| { |
| "epoch": 434.7993401901805, |
| "grad_norm": 0.14061865210533142, |
| "learning_rate": 1.133779264214047e-06, |
| "loss": 6.36, |
| "step": 48700 |
| }, |
| { |
| "epoch": 434.7993401901805, |
| "eval_loss": 6.3731865882873535, |
| "eval_runtime": 50.9932, |
| "eval_samples_per_second": 196.105, |
| "eval_steps_per_second": 3.51, |
| "step": 48700 |
| }, |
| { |
| "epoch": 435.69202406365224, |
| "grad_norm": 0.12875817716121674, |
| "learning_rate": 1.1237458193979933e-06, |
| "loss": 6.3614, |
| "step": 48800 |
| }, |
| { |
| "epoch": 435.69202406365224, |
| "eval_loss": 6.372591018676758, |
| "eval_runtime": 50.9814, |
| "eval_samples_per_second": 196.15, |
| "eval_steps_per_second": 3.511, |
| "step": 48800 |
| }, |
| { |
| "epoch": 436.584707937124, |
| "grad_norm": 0.1300763338804245, |
| "learning_rate": 1.1137123745819398e-06, |
| "loss": 6.3611, |
| "step": 48900 |
| }, |
| { |
| "epoch": 436.584707937124, |
| "eval_loss": 6.375086784362793, |
| "eval_runtime": 50.9667, |
| "eval_samples_per_second": 196.207, |
| "eval_steps_per_second": 3.512, |
| "step": 48900 |
| }, |
| { |
| "epoch": 437.47739181059575, |
| "grad_norm": 0.12522312998771667, |
| "learning_rate": 1.1036789297658862e-06, |
| "loss": 6.3605, |
| "step": 49000 |
| }, |
| { |
| "epoch": 437.47739181059575, |
| "eval_loss": 6.373082637786865, |
| "eval_runtime": 50.9686, |
| "eval_samples_per_second": 196.199, |
| "eval_steps_per_second": 3.512, |
| "step": 49000 |
| }, |
| { |
| "epoch": 438.37007568406756, |
| "grad_norm": 0.15034428238868713, |
| "learning_rate": 1.0936454849498327e-06, |
| "loss": 6.3601, |
| "step": 49100 |
| }, |
| { |
| "epoch": 438.37007568406756, |
| "eval_loss": 6.369637489318848, |
| "eval_runtime": 50.9806, |
| "eval_samples_per_second": 196.153, |
| "eval_steps_per_second": 3.511, |
| "step": 49100 |
| }, |
| { |
| "epoch": 439.2627595575393, |
| "grad_norm": 0.14699020981788635, |
| "learning_rate": 1.0836120401337793e-06, |
| "loss": 6.3602, |
| "step": 49200 |
| }, |
| { |
| "epoch": 439.2627595575393, |
| "eval_loss": 6.3717498779296875, |
| "eval_runtime": 50.9494, |
| "eval_samples_per_second": 196.273, |
| "eval_steps_per_second": 3.513, |
| "step": 49200 |
| }, |
| { |
| "epoch": 440.15544343101107, |
| "grad_norm": 0.1339484453201294, |
| "learning_rate": 1.0735785953177258e-06, |
| "loss": 6.3608, |
| "step": 49300 |
| }, |
| { |
| "epoch": 440.15544343101107, |
| "eval_loss": 6.374644756317139, |
| "eval_runtime": 50.9591, |
| "eval_samples_per_second": 196.236, |
| "eval_steps_per_second": 3.513, |
| "step": 49300 |
| }, |
| { |
| "epoch": 441.0481273044828, |
| "grad_norm": 0.10889836400747299, |
| "learning_rate": 1.0635451505016722e-06, |
| "loss": 6.3602, |
| "step": 49400 |
| }, |
| { |
| "epoch": 441.0481273044828, |
| "eval_loss": 6.375630855560303, |
| "eval_runtime": 50.9618, |
| "eval_samples_per_second": 196.225, |
| "eval_steps_per_second": 3.512, |
| "step": 49400 |
| }, |
| { |
| "epoch": 441.9408111779546, |
| "grad_norm": 0.135609433054924, |
| "learning_rate": 1.0535117056856187e-06, |
| "loss": 6.3596, |
| "step": 49500 |
| }, |
| { |
| "epoch": 441.9408111779546, |
| "eval_loss": 6.37455940246582, |
| "eval_runtime": 50.968, |
| "eval_samples_per_second": 196.201, |
| "eval_steps_per_second": 3.512, |
| "step": 49500 |
| }, |
| { |
| "epoch": 442.8334950514263, |
| "grad_norm": 0.13086004555225372, |
| "learning_rate": 1.0434782608695653e-06, |
| "loss": 6.3601, |
| "step": 49600 |
| }, |
| { |
| "epoch": 442.8334950514263, |
| "eval_loss": 6.375424385070801, |
| "eval_runtime": 50.9762, |
| "eval_samples_per_second": 196.17, |
| "eval_steps_per_second": 3.511, |
| "step": 49600 |
| }, |
| { |
| "epoch": 443.72617892489814, |
| "grad_norm": 0.1462557315826416, |
| "learning_rate": 1.0334448160535118e-06, |
| "loss": 6.3606, |
| "step": 49700 |
| }, |
| { |
| "epoch": 443.72617892489814, |
| "eval_loss": 6.376568794250488, |
| "eval_runtime": 50.9824, |
| "eval_samples_per_second": 196.146, |
| "eval_steps_per_second": 3.511, |
| "step": 49700 |
| }, |
| { |
| "epoch": 444.6188627983699, |
| "grad_norm": 0.15183542668819427, |
| "learning_rate": 1.0234113712374581e-06, |
| "loss": 6.3595, |
| "step": 49800 |
| }, |
| { |
| "epoch": 444.6188627983699, |
| "eval_loss": 6.368979454040527, |
| "eval_runtime": 50.9624, |
| "eval_samples_per_second": 196.223, |
| "eval_steps_per_second": 3.512, |
| "step": 49800 |
| }, |
| { |
| "epoch": 445.51154667184164, |
| "grad_norm": 0.1357332020998001, |
| "learning_rate": 1.0133779264214047e-06, |
| "loss": 6.3605, |
| "step": 49900 |
| }, |
| { |
| "epoch": 445.51154667184164, |
| "eval_loss": 6.374391555786133, |
| "eval_runtime": 50.959, |
| "eval_samples_per_second": 196.236, |
| "eval_steps_per_second": 3.513, |
| "step": 49900 |
| }, |
| { |
| "epoch": 446.4042305453134, |
| "grad_norm": 0.14846473932266235, |
| "learning_rate": 1.0033444816053512e-06, |
| "loss": 6.3608, |
| "step": 50000 |
| }, |
| { |
| "epoch": 446.4042305453134, |
| "eval_loss": 6.372031211853027, |
| "eval_runtime": 50.9866, |
| "eval_samples_per_second": 196.13, |
| "eval_steps_per_second": 3.511, |
| "step": 50000 |
| }, |
| { |
| "epoch": 447.29691441878515, |
| "grad_norm": 0.1612795740365982, |
| "learning_rate": 9.933110367892976e-07, |
| "loss": 6.3606, |
| "step": 50100 |
| }, |
| { |
| "epoch": 447.29691441878515, |
| "eval_loss": 6.372196674346924, |
| "eval_runtime": 51.0079, |
| "eval_samples_per_second": 196.048, |
| "eval_steps_per_second": 3.509, |
| "step": 50100 |
| }, |
| { |
| "epoch": 448.18959829225696, |
| "grad_norm": 0.1360219269990921, |
| "learning_rate": 9.832775919732441e-07, |
| "loss": 6.3605, |
| "step": 50200 |
| }, |
| { |
| "epoch": 448.18959829225696, |
| "eval_loss": 6.374830722808838, |
| "eval_runtime": 50.9535, |
| "eval_samples_per_second": 196.257, |
| "eval_steps_per_second": 3.513, |
| "step": 50200 |
| }, |
| { |
| "epoch": 449.0822821657287, |
| "grad_norm": 0.14171314239501953, |
| "learning_rate": 9.732441471571907e-07, |
| "loss": 6.36, |
| "step": 50300 |
| }, |
| { |
| "epoch": 449.0822821657287, |
| "eval_loss": 6.374056816101074, |
| "eval_runtime": 50.9648, |
| "eval_samples_per_second": 196.214, |
| "eval_steps_per_second": 3.512, |
| "step": 50300 |
| }, |
| { |
| "epoch": 449.97496603920047, |
| "grad_norm": 0.10322766751050949, |
| "learning_rate": 9.632107023411372e-07, |
| "loss": 6.3595, |
| "step": 50400 |
| }, |
| { |
| "epoch": 449.97496603920047, |
| "eval_loss": 6.373784065246582, |
| "eval_runtime": 50.9502, |
| "eval_samples_per_second": 196.27, |
| "eval_steps_per_second": 3.513, |
| "step": 50400 |
| }, |
| { |
| "epoch": 450.8676499126722, |
| "grad_norm": 0.14763601124286652, |
| "learning_rate": 9.531772575250837e-07, |
| "loss": 6.3593, |
| "step": 50500 |
| }, |
| { |
| "epoch": 450.8676499126722, |
| "eval_loss": 6.373796463012695, |
| "eval_runtime": 50.9901, |
| "eval_samples_per_second": 196.117, |
| "eval_steps_per_second": 3.51, |
| "step": 50500 |
| }, |
| { |
| "epoch": 451.760333786144, |
| "grad_norm": 0.18021999299526215, |
| "learning_rate": 9.431438127090301e-07, |
| "loss": 6.3612, |
| "step": 50600 |
| }, |
| { |
| "epoch": 451.760333786144, |
| "eval_loss": 6.371494293212891, |
| "eval_runtime": 50.9922, |
| "eval_samples_per_second": 196.108, |
| "eval_steps_per_second": 3.51, |
| "step": 50600 |
| }, |
| { |
| "epoch": 452.6530176596158, |
| "grad_norm": 0.1338716447353363, |
| "learning_rate": 9.331103678929767e-07, |
| "loss": 6.3594, |
| "step": 50700 |
| }, |
| { |
| "epoch": 452.6530176596158, |
| "eval_loss": 6.3735032081604, |
| "eval_runtime": 50.4979, |
| "eval_samples_per_second": 198.028, |
| "eval_steps_per_second": 3.545, |
| "step": 50700 |
| }, |
| { |
| "epoch": 453.54570153308754, |
| "grad_norm": 0.11512942612171173, |
| "learning_rate": 9.230769230769231e-07, |
| "loss": 6.3605, |
| "step": 50800 |
| }, |
| { |
| "epoch": 453.54570153308754, |
| "eval_loss": 6.373264789581299, |
| "eval_runtime": 50.9877, |
| "eval_samples_per_second": 196.126, |
| "eval_steps_per_second": 3.511, |
| "step": 50800 |
| }, |
| { |
| "epoch": 454.4383854065593, |
| "grad_norm": 0.09796648472547531, |
| "learning_rate": 9.130434782608697e-07, |
| "loss": 6.3601, |
| "step": 50900 |
| }, |
| { |
| "epoch": 454.4383854065593, |
| "eval_loss": 6.374275207519531, |
| "eval_runtime": 50.9875, |
| "eval_samples_per_second": 196.126, |
| "eval_steps_per_second": 3.511, |
| "step": 50900 |
| }, |
| { |
| "epoch": 455.33106928003104, |
| "grad_norm": 0.1316356211900711, |
| "learning_rate": 9.030100334448161e-07, |
| "loss": 6.3601, |
| "step": 51000 |
| }, |
| { |
| "epoch": 455.33106928003104, |
| "eval_loss": 6.374828338623047, |
| "eval_runtime": 50.4891, |
| "eval_samples_per_second": 198.063, |
| "eval_steps_per_second": 3.545, |
| "step": 51000 |
| }, |
| { |
| "epoch": 456.2237531535028, |
| "grad_norm": 0.17832376062870026, |
| "learning_rate": 8.929765886287627e-07, |
| "loss": 6.3604, |
| "step": 51100 |
| }, |
| { |
| "epoch": 456.2237531535028, |
| "eval_loss": 6.371827602386475, |
| "eval_runtime": 50.9826, |
| "eval_samples_per_second": 196.145, |
| "eval_steps_per_second": 3.511, |
| "step": 51100 |
| }, |
| { |
| "epoch": 457.11643702697455, |
| "grad_norm": 0.14637400209903717, |
| "learning_rate": 8.829431438127091e-07, |
| "loss": 6.36, |
| "step": 51200 |
| }, |
| { |
| "epoch": 457.11643702697455, |
| "eval_loss": 6.375898361206055, |
| "eval_runtime": 50.495, |
| "eval_samples_per_second": 198.039, |
| "eval_steps_per_second": 3.545, |
| "step": 51200 |
| }, |
| { |
| "epoch": 458.00912090044636, |
| "grad_norm": 0.16641865670681, |
| "learning_rate": 8.729096989966555e-07, |
| "loss": 6.3595, |
| "step": 51300 |
| }, |
| { |
| "epoch": 458.00912090044636, |
| "eval_loss": 6.375617027282715, |
| "eval_runtime": 50.9794, |
| "eval_samples_per_second": 196.158, |
| "eval_steps_per_second": 3.511, |
| "step": 51300 |
| }, |
| { |
| "epoch": 458.9018047739181, |
| "grad_norm": 0.12667568027973175, |
| "learning_rate": 8.628762541806019e-07, |
| "loss": 6.3599, |
| "step": 51400 |
| }, |
| { |
| "epoch": 458.9018047739181, |
| "eval_loss": 6.368325710296631, |
| "eval_runtime": 50.4918, |
| "eval_samples_per_second": 198.052, |
| "eval_steps_per_second": 3.545, |
| "step": 51400 |
| }, |
| { |
| "epoch": 459.79448864738987, |
| "grad_norm": 0.1586967408657074, |
| "learning_rate": 8.528428093645485e-07, |
| "loss": 6.3599, |
| "step": 51500 |
| }, |
| { |
| "epoch": 459.79448864738987, |
| "eval_loss": 6.37186861038208, |
| "eval_runtime": 50.9603, |
| "eval_samples_per_second": 196.231, |
| "eval_steps_per_second": 3.513, |
| "step": 51500 |
| }, |
| { |
| "epoch": 460.6871725208616, |
| "grad_norm": 0.11572112888097763, |
| "learning_rate": 8.428093645484949e-07, |
| "loss": 6.3597, |
| "step": 51600 |
| }, |
| { |
| "epoch": 460.6871725208616, |
| "eval_loss": 6.371321678161621, |
| "eval_runtime": 50.9929, |
| "eval_samples_per_second": 196.106, |
| "eval_steps_per_second": 3.51, |
| "step": 51600 |
| }, |
| { |
| "epoch": 461.5798563943334, |
| "grad_norm": 0.12478705495595932, |
| "learning_rate": 8.327759197324414e-07, |
| "loss": 6.3598, |
| "step": 51700 |
| }, |
| { |
| "epoch": 461.5798563943334, |
| "eval_loss": 6.373435974121094, |
| "eval_runtime": 50.9766, |
| "eval_samples_per_second": 196.168, |
| "eval_steps_per_second": 3.511, |
| "step": 51700 |
| }, |
| { |
| "epoch": 462.4725402678052, |
| "grad_norm": 0.12946990132331848, |
| "learning_rate": 8.227424749163879e-07, |
| "loss": 6.3613, |
| "step": 51800 |
| }, |
| { |
| "epoch": 462.4725402678052, |
| "eval_loss": 6.371443748474121, |
| "eval_runtime": 50.9724, |
| "eval_samples_per_second": 196.185, |
| "eval_steps_per_second": 3.512, |
| "step": 51800 |
| }, |
| { |
| "epoch": 463.36522414127694, |
| "grad_norm": 0.13125728070735931, |
| "learning_rate": 8.127090301003344e-07, |
| "loss": 6.3602, |
| "step": 51900 |
| }, |
| { |
| "epoch": 463.36522414127694, |
| "eval_loss": 6.373104095458984, |
| "eval_runtime": 50.946, |
| "eval_samples_per_second": 196.286, |
| "eval_steps_per_second": 3.514, |
| "step": 51900 |
| }, |
| { |
| "epoch": 464.2579080147487, |
| "grad_norm": 0.1575118899345398, |
| "learning_rate": 8.026755852842809e-07, |
| "loss": 6.3599, |
| "step": 52000 |
| }, |
| { |
| "epoch": 464.2579080147487, |
| "eval_loss": 6.371898651123047, |
| "eval_runtime": 50.9549, |
| "eval_samples_per_second": 196.252, |
| "eval_steps_per_second": 3.513, |
| "step": 52000 |
| }, |
| { |
| "epoch": 465.15059188822045, |
| "grad_norm": 0.13345403969287872, |
| "learning_rate": 7.926421404682274e-07, |
| "loss": 6.3604, |
| "step": 52100 |
| }, |
| { |
| "epoch": 465.15059188822045, |
| "eval_loss": 6.374370098114014, |
| "eval_runtime": 50.488, |
| "eval_samples_per_second": 198.067, |
| "eval_steps_per_second": 3.545, |
| "step": 52100 |
| }, |
| { |
| "epoch": 466.0432757616922, |
| "grad_norm": 0.12134841084480286, |
| "learning_rate": 7.826086956521739e-07, |
| "loss": 6.3597, |
| "step": 52200 |
| }, |
| { |
| "epoch": 466.0432757616922, |
| "eval_loss": 6.370124816894531, |
| "eval_runtime": 50.9572, |
| "eval_samples_per_second": 196.243, |
| "eval_steps_per_second": 3.513, |
| "step": 52200 |
| }, |
| { |
| "epoch": 466.93595963516395, |
| "grad_norm": 0.14935283362865448, |
| "learning_rate": 7.725752508361204e-07, |
| "loss": 6.3599, |
| "step": 52300 |
| }, |
| { |
| "epoch": 466.93595963516395, |
| "eval_loss": 6.372580051422119, |
| "eval_runtime": 50.9516, |
| "eval_samples_per_second": 196.265, |
| "eval_steps_per_second": 3.513, |
| "step": 52300 |
| }, |
| { |
| "epoch": 467.82864350863576, |
| "grad_norm": 0.11806395649909973, |
| "learning_rate": 7.625418060200669e-07, |
| "loss": 6.3602, |
| "step": 52400 |
| }, |
| { |
| "epoch": 467.82864350863576, |
| "eval_loss": 6.37704610824585, |
| "eval_runtime": 50.9684, |
| "eval_samples_per_second": 196.2, |
| "eval_steps_per_second": 3.512, |
| "step": 52400 |
| }, |
| { |
| "epoch": 468.7213273821075, |
| "grad_norm": 0.1526840329170227, |
| "learning_rate": 7.525083612040134e-07, |
| "loss": 6.3594, |
| "step": 52500 |
| }, |
| { |
| "epoch": 468.7213273821075, |
| "eval_loss": 6.372363090515137, |
| "eval_runtime": 50.9653, |
| "eval_samples_per_second": 196.212, |
| "eval_steps_per_second": 3.512, |
| "step": 52500 |
| }, |
| { |
| "epoch": 469.61401125557927, |
| "grad_norm": 0.1198643147945404, |
| "learning_rate": 7.424749163879599e-07, |
| "loss": 6.3602, |
| "step": 52600 |
| }, |
| { |
| "epoch": 469.61401125557927, |
| "eval_loss": 6.370110034942627, |
| "eval_runtime": 50.9739, |
| "eval_samples_per_second": 196.179, |
| "eval_steps_per_second": 3.512, |
| "step": 52600 |
| }, |
| { |
| "epoch": 470.506695129051, |
| "grad_norm": 0.12439325451850891, |
| "learning_rate": 7.324414715719064e-07, |
| "loss": 6.3597, |
| "step": 52700 |
| }, |
| { |
| "epoch": 470.506695129051, |
| "eval_loss": 6.370666980743408, |
| "eval_runtime": 50.4975, |
| "eval_samples_per_second": 198.03, |
| "eval_steps_per_second": 3.545, |
| "step": 52700 |
| }, |
| { |
| "epoch": 471.3993790025228, |
| "grad_norm": 0.13444113731384277, |
| "learning_rate": 7.224080267558529e-07, |
| "loss": 6.359, |
| "step": 52800 |
| }, |
| { |
| "epoch": 471.3993790025228, |
| "eval_loss": 6.369675159454346, |
| "eval_runtime": 50.9791, |
| "eval_samples_per_second": 196.159, |
| "eval_steps_per_second": 3.511, |
| "step": 52800 |
| }, |
| { |
| "epoch": 472.2920628759946, |
| "grad_norm": 0.11212828010320663, |
| "learning_rate": 7.123745819397994e-07, |
| "loss": 6.3595, |
| "step": 52900 |
| }, |
| { |
| "epoch": 472.2920628759946, |
| "eval_loss": 6.36935567855835, |
| "eval_runtime": 50.9962, |
| "eval_samples_per_second": 196.093, |
| "eval_steps_per_second": 3.51, |
| "step": 52900 |
| }, |
| { |
| "epoch": 473.18474674946634, |
| "grad_norm": 0.1080106794834137, |
| "learning_rate": 7.023411371237459e-07, |
| "loss": 6.3595, |
| "step": 53000 |
| }, |
| { |
| "epoch": 473.18474674946634, |
| "eval_loss": 6.37483024597168, |
| "eval_runtime": 50.9694, |
| "eval_samples_per_second": 196.196, |
| "eval_steps_per_second": 3.512, |
| "step": 53000 |
| }, |
| { |
| "epoch": 474.0774306229381, |
| "grad_norm": 0.131260484457016, |
| "learning_rate": 6.923076923076923e-07, |
| "loss": 6.3599, |
| "step": 53100 |
| }, |
| { |
| "epoch": 474.0774306229381, |
| "eval_loss": 6.372048377990723, |
| "eval_runtime": 50.9726, |
| "eval_samples_per_second": 196.184, |
| "eval_steps_per_second": 3.512, |
| "step": 53100 |
| }, |
| { |
| "epoch": 474.97011449640985, |
| "grad_norm": 0.11120131611824036, |
| "learning_rate": 6.822742474916388e-07, |
| "loss": 6.3595, |
| "step": 53200 |
| }, |
| { |
| "epoch": 474.97011449640985, |
| "eval_loss": 6.371298789978027, |
| "eval_runtime": 50.9746, |
| "eval_samples_per_second": 196.176, |
| "eval_steps_per_second": 3.512, |
| "step": 53200 |
| }, |
| { |
| "epoch": 475.8627983698816, |
| "grad_norm": 0.1382032185792923, |
| "learning_rate": 6.722408026755853e-07, |
| "loss": 6.3597, |
| "step": 53300 |
| }, |
| { |
| "epoch": 475.8627983698816, |
| "eval_loss": 6.375929832458496, |
| "eval_runtime": 50.9847, |
| "eval_samples_per_second": 196.137, |
| "eval_steps_per_second": 3.511, |
| "step": 53300 |
| }, |
| { |
| "epoch": 476.7554822433534, |
| "grad_norm": 0.11284707486629486, |
| "learning_rate": 6.622073578595318e-07, |
| "loss": 6.3591, |
| "step": 53400 |
| }, |
| { |
| "epoch": 476.7554822433534, |
| "eval_loss": 6.373961925506592, |
| "eval_runtime": 50.9718, |
| "eval_samples_per_second": 196.187, |
| "eval_steps_per_second": 3.512, |
| "step": 53400 |
| }, |
| { |
| "epoch": 477.64816611682517, |
| "grad_norm": 0.11296847462654114, |
| "learning_rate": 6.521739130434783e-07, |
| "loss": 6.3599, |
| "step": 53500 |
| }, |
| { |
| "epoch": 477.64816611682517, |
| "eval_loss": 6.373483657836914, |
| "eval_runtime": 50.9566, |
| "eval_samples_per_second": 196.245, |
| "eval_steps_per_second": 3.513, |
| "step": 53500 |
| }, |
| { |
| "epoch": 478.5408499902969, |
| "grad_norm": 0.1363115906715393, |
| "learning_rate": 6.421404682274248e-07, |
| "loss": 6.3597, |
| "step": 53600 |
| }, |
| { |
| "epoch": 478.5408499902969, |
| "eval_loss": 6.37340784072876, |
| "eval_runtime": 50.9626, |
| "eval_samples_per_second": 196.222, |
| "eval_steps_per_second": 3.512, |
| "step": 53600 |
| }, |
| { |
| "epoch": 479.4335338637687, |
| "grad_norm": 0.12509457767009735, |
| "learning_rate": 6.321070234113712e-07, |
| "loss": 6.3593, |
| "step": 53700 |
| }, |
| { |
| "epoch": 479.4335338637687, |
| "eval_loss": 6.374527931213379, |
| "eval_runtime": 50.9733, |
| "eval_samples_per_second": 196.181, |
| "eval_steps_per_second": 3.512, |
| "step": 53700 |
| }, |
| { |
| "epoch": 480.3262177372404, |
| "grad_norm": 0.1320326179265976, |
| "learning_rate": 6.220735785953178e-07, |
| "loss": 6.3593, |
| "step": 53800 |
| }, |
| { |
| "epoch": 480.3262177372404, |
| "eval_loss": 6.376550674438477, |
| "eval_runtime": 50.966, |
| "eval_samples_per_second": 196.209, |
| "eval_steps_per_second": 3.512, |
| "step": 53800 |
| }, |
| { |
| "epoch": 481.2189016107122, |
| "grad_norm": 0.1382244974374771, |
| "learning_rate": 6.120401337792642e-07, |
| "loss": 6.3598, |
| "step": 53900 |
| }, |
| { |
| "epoch": 481.2189016107122, |
| "eval_loss": 6.372669696807861, |
| "eval_runtime": 50.9557, |
| "eval_samples_per_second": 196.249, |
| "eval_steps_per_second": 3.513, |
| "step": 53900 |
| }, |
| { |
| "epoch": 482.111585484184, |
| "grad_norm": 0.12267334014177322, |
| "learning_rate": 6.020066889632107e-07, |
| "loss": 6.3601, |
| "step": 54000 |
| }, |
| { |
| "epoch": 482.111585484184, |
| "eval_loss": 6.377495765686035, |
| "eval_runtime": 50.9659, |
| "eval_samples_per_second": 196.21, |
| "eval_steps_per_second": 3.512, |
| "step": 54000 |
| }, |
| { |
| "epoch": 483.00426935765574, |
| "grad_norm": 0.13831213116645813, |
| "learning_rate": 5.919732441471572e-07, |
| "loss": 6.3593, |
| "step": 54100 |
| }, |
| { |
| "epoch": 483.00426935765574, |
| "eval_loss": 6.3768439292907715, |
| "eval_runtime": 51.0259, |
| "eval_samples_per_second": 195.979, |
| "eval_steps_per_second": 3.508, |
| "step": 54100 |
| }, |
| { |
| "epoch": 483.8969532311275, |
| "grad_norm": 0.127532958984375, |
| "learning_rate": 5.819397993311037e-07, |
| "loss": 6.36, |
| "step": 54200 |
| }, |
| { |
| "epoch": 483.8969532311275, |
| "eval_loss": 6.369021415710449, |
| "eval_runtime": 50.5058, |
| "eval_samples_per_second": 197.997, |
| "eval_steps_per_second": 3.544, |
| "step": 54200 |
| }, |
| { |
| "epoch": 484.78963710459925, |
| "grad_norm": 0.11770881712436676, |
| "learning_rate": 5.719063545150502e-07, |
| "loss": 6.3589, |
| "step": 54300 |
| }, |
| { |
| "epoch": 484.78963710459925, |
| "eval_loss": 6.375646591186523, |
| "eval_runtime": 50.9866, |
| "eval_samples_per_second": 196.13, |
| "eval_steps_per_second": 3.511, |
| "step": 54300 |
| }, |
| { |
| "epoch": 485.682320978071, |
| "grad_norm": 0.1295900046825409, |
| "learning_rate": 5.618729096989966e-07, |
| "loss": 6.3594, |
| "step": 54400 |
| }, |
| { |
| "epoch": 485.682320978071, |
| "eval_loss": 6.371916770935059, |
| "eval_runtime": 50.9696, |
| "eval_samples_per_second": 196.196, |
| "eval_steps_per_second": 3.512, |
| "step": 54400 |
| }, |
| { |
| "epoch": 486.5750048515428, |
| "grad_norm": 0.11955253779888153, |
| "learning_rate": 5.518394648829431e-07, |
| "loss": 6.3595, |
| "step": 54500 |
| }, |
| { |
| "epoch": 486.5750048515428, |
| "eval_loss": 6.3733906745910645, |
| "eval_runtime": 50.9551, |
| "eval_samples_per_second": 196.251, |
| "eval_steps_per_second": 3.513, |
| "step": 54500 |
| }, |
| { |
| "epoch": 487.46768872501457, |
| "grad_norm": 0.12596124410629272, |
| "learning_rate": 5.418060200668896e-07, |
| "loss": 6.3597, |
| "step": 54600 |
| }, |
| { |
| "epoch": 487.46768872501457, |
| "eval_loss": 6.372114658355713, |
| "eval_runtime": 50.4972, |
| "eval_samples_per_second": 198.031, |
| "eval_steps_per_second": 3.545, |
| "step": 54600 |
| }, |
| { |
| "epoch": 488.3603725984863, |
| "grad_norm": 0.1110687404870987, |
| "learning_rate": 5.317725752508361e-07, |
| "loss": 6.3591, |
| "step": 54700 |
| }, |
| { |
| "epoch": 488.3603725984863, |
| "eval_loss": 6.370881080627441, |
| "eval_runtime": 50.963, |
| "eval_samples_per_second": 196.221, |
| "eval_steps_per_second": 3.512, |
| "step": 54700 |
| }, |
| { |
| "epoch": 489.2530564719581, |
| "grad_norm": 0.12368372082710266, |
| "learning_rate": 5.217391304347826e-07, |
| "loss": 6.3595, |
| "step": 54800 |
| }, |
| { |
| "epoch": 489.2530564719581, |
| "eval_loss": 6.371975421905518, |
| "eval_runtime": 50.9641, |
| "eval_samples_per_second": 196.216, |
| "eval_steps_per_second": 3.512, |
| "step": 54800 |
| }, |
| { |
| "epoch": 490.14574034542983, |
| "grad_norm": 0.1045992448925972, |
| "learning_rate": 5.117056856187291e-07, |
| "loss": 6.3587, |
| "step": 54900 |
| }, |
| { |
| "epoch": 490.14574034542983, |
| "eval_loss": 6.374923229217529, |
| "eval_runtime": 50.9721, |
| "eval_samples_per_second": 196.186, |
| "eval_steps_per_second": 3.512, |
| "step": 54900 |
| }, |
| { |
| "epoch": 491.03842421890164, |
| "grad_norm": 0.12338841706514359, |
| "learning_rate": 5.016722408026756e-07, |
| "loss": 6.3605, |
| "step": 55000 |
| }, |
| { |
| "epoch": 491.03842421890164, |
| "eval_loss": 6.367209434509277, |
| "eval_runtime": 50.9647, |
| "eval_samples_per_second": 196.214, |
| "eval_steps_per_second": 3.512, |
| "step": 55000 |
| }, |
| { |
| "epoch": 491.9311080923734, |
| "grad_norm": 0.12877170741558075, |
| "learning_rate": 4.916387959866221e-07, |
| "loss": 6.3591, |
| "step": 55100 |
| }, |
| { |
| "epoch": 491.9311080923734, |
| "eval_loss": 6.373247146606445, |
| "eval_runtime": 50.9752, |
| "eval_samples_per_second": 196.174, |
| "eval_steps_per_second": 3.512, |
| "step": 55100 |
| }, |
| { |
| "epoch": 492.82379196584515, |
| "grad_norm": 0.1188189759850502, |
| "learning_rate": 4.816053511705686e-07, |
| "loss": 6.3586, |
| "step": 55200 |
| }, |
| { |
| "epoch": 492.82379196584515, |
| "eval_loss": 6.371592998504639, |
| "eval_runtime": 50.9797, |
| "eval_samples_per_second": 196.157, |
| "eval_steps_per_second": 3.511, |
| "step": 55200 |
| }, |
| { |
| "epoch": 493.7164758393169, |
| "grad_norm": 0.14705920219421387, |
| "learning_rate": 4.7157190635451506e-07, |
| "loss": 6.3589, |
| "step": 55300 |
| }, |
| { |
| "epoch": 493.7164758393169, |
| "eval_loss": 6.375323295593262, |
| "eval_runtime": 50.9746, |
| "eval_samples_per_second": 196.176, |
| "eval_steps_per_second": 3.512, |
| "step": 55300 |
| }, |
| { |
| "epoch": 494.60915971278865, |
| "grad_norm": 0.1193486750125885, |
| "learning_rate": 4.6153846153846156e-07, |
| "loss": 6.3604, |
| "step": 55400 |
| }, |
| { |
| "epoch": 494.60915971278865, |
| "eval_loss": 6.3740973472595215, |
| "eval_runtime": 50.966, |
| "eval_samples_per_second": 196.209, |
| "eval_steps_per_second": 3.512, |
| "step": 55400 |
| }, |
| { |
| "epoch": 495.5018435862604, |
| "grad_norm": 0.12742812931537628, |
| "learning_rate": 4.5150501672240806e-07, |
| "loss": 6.3603, |
| "step": 55500 |
| }, |
| { |
| "epoch": 495.5018435862604, |
| "eval_loss": 6.37678337097168, |
| "eval_runtime": 50.9604, |
| "eval_samples_per_second": 196.231, |
| "eval_steps_per_second": 3.513, |
| "step": 55500 |
| }, |
| { |
| "epoch": 496.3945274597322, |
| "grad_norm": 0.1414756029844284, |
| "learning_rate": 4.4147157190635456e-07, |
| "loss": 6.3595, |
| "step": 55600 |
| }, |
| { |
| "epoch": 496.3945274597322, |
| "eval_loss": 6.373994827270508, |
| "eval_runtime": 50.9792, |
| "eval_samples_per_second": 196.158, |
| "eval_steps_per_second": 3.511, |
| "step": 55600 |
| }, |
| { |
| "epoch": 497.28721133320397, |
| "grad_norm": 0.11560999602079391, |
| "learning_rate": 4.3143812709030095e-07, |
| "loss": 6.3599, |
| "step": 55700 |
| }, |
| { |
| "epoch": 497.28721133320397, |
| "eval_loss": 6.374427318572998, |
| "eval_runtime": 50.5007, |
| "eval_samples_per_second": 198.017, |
| "eval_steps_per_second": 3.545, |
| "step": 55700 |
| }, |
| { |
| "epoch": 498.1798952066757, |
| "grad_norm": 0.16057543456554413, |
| "learning_rate": 4.2140468227424745e-07, |
| "loss": 6.3604, |
| "step": 55800 |
| }, |
| { |
| "epoch": 498.1798952066757, |
| "eval_loss": 6.375630855560303, |
| "eval_runtime": 50.9586, |
| "eval_samples_per_second": 196.238, |
| "eval_steps_per_second": 3.513, |
| "step": 55800 |
| }, |
| { |
| "epoch": 499.0725790801475, |
| "grad_norm": 0.14680643379688263, |
| "learning_rate": 4.1137123745819395e-07, |
| "loss": 6.3589, |
| "step": 55900 |
| }, |
| { |
| "epoch": 499.0725790801475, |
| "eval_loss": 6.373570919036865, |
| "eval_runtime": 50.4998, |
| "eval_samples_per_second": 198.02, |
| "eval_steps_per_second": 3.545, |
| "step": 55900 |
| }, |
| { |
| "epoch": 499.96526295361923, |
| "grad_norm": 0.12228725850582123, |
| "learning_rate": 4.0133779264214045e-07, |
| "loss": 6.3594, |
| "step": 56000 |
| }, |
| { |
| "epoch": 499.96526295361923, |
| "eval_loss": 6.371649742126465, |
| "eval_runtime": 50.9786, |
| "eval_samples_per_second": 196.161, |
| "eval_steps_per_second": 3.511, |
| "step": 56000 |
| }, |
| { |
| "epoch": 500.85794682709104, |
| "grad_norm": 0.12265335768461227, |
| "learning_rate": 3.9130434782608694e-07, |
| "loss": 6.3594, |
| "step": 56100 |
| }, |
| { |
| "epoch": 500.85794682709104, |
| "eval_loss": 6.376364231109619, |
| "eval_runtime": 50.9881, |
| "eval_samples_per_second": 196.124, |
| "eval_steps_per_second": 3.511, |
| "step": 56100 |
| }, |
| { |
| "epoch": 501.7506307005628, |
| "grad_norm": 0.10380034893751144, |
| "learning_rate": 3.8127090301003344e-07, |
| "loss": 6.36, |
| "step": 56200 |
| }, |
| { |
| "epoch": 501.7506307005628, |
| "eval_loss": 6.37660551071167, |
| "eval_runtime": 50.9903, |
| "eval_samples_per_second": 196.116, |
| "eval_steps_per_second": 3.51, |
| "step": 56200 |
| }, |
| { |
| "epoch": 502.64331457403455, |
| "grad_norm": 0.1066294014453888, |
| "learning_rate": 3.7123745819397994e-07, |
| "loss": 6.3596, |
| "step": 56300 |
| }, |
| { |
| "epoch": 502.64331457403455, |
| "eval_loss": 6.371345043182373, |
| "eval_runtime": 51.0067, |
| "eval_samples_per_second": 196.053, |
| "eval_steps_per_second": 3.509, |
| "step": 56300 |
| }, |
| { |
| "epoch": 503.5359984475063, |
| "grad_norm": 0.12047789245843887, |
| "learning_rate": 3.6120401337792644e-07, |
| "loss": 6.3592, |
| "step": 56400 |
| }, |
| { |
| "epoch": 503.5359984475063, |
| "eval_loss": 6.371187686920166, |
| "eval_runtime": 50.502, |
| "eval_samples_per_second": 198.012, |
| "eval_steps_per_second": 3.544, |
| "step": 56400 |
| }, |
| { |
| "epoch": 504.42868232097806, |
| "grad_norm": 0.12361543625593185, |
| "learning_rate": 3.5117056856187294e-07, |
| "loss": 6.3589, |
| "step": 56500 |
| }, |
| { |
| "epoch": 504.42868232097806, |
| "eval_loss": 6.369196891784668, |
| "eval_runtime": 50.9845, |
| "eval_samples_per_second": 196.138, |
| "eval_steps_per_second": 3.511, |
| "step": 56500 |
| }, |
| { |
| "epoch": 505.3213661944498, |
| "grad_norm": 0.10645488649606705, |
| "learning_rate": 3.411371237458194e-07, |
| "loss": 6.3595, |
| "step": 56600 |
| }, |
| { |
| "epoch": 505.3213661944498, |
| "eval_loss": 6.372078895568848, |
| "eval_runtime": 50.9783, |
| "eval_samples_per_second": 196.162, |
| "eval_steps_per_second": 3.511, |
| "step": 56600 |
| }, |
| { |
| "epoch": 506.2140500679216, |
| "grad_norm": 0.12366556376218796, |
| "learning_rate": 3.311036789297659e-07, |
| "loss": 6.3604, |
| "step": 56700 |
| }, |
| { |
| "epoch": 506.2140500679216, |
| "eval_loss": 6.3741960525512695, |
| "eval_runtime": 50.54, |
| "eval_samples_per_second": 197.863, |
| "eval_steps_per_second": 3.542, |
| "step": 56700 |
| }, |
| { |
| "epoch": 507.1067339413934, |
| "grad_norm": 0.10554321855306625, |
| "learning_rate": 3.210702341137124e-07, |
| "loss": 6.3593, |
| "step": 56800 |
| }, |
| { |
| "epoch": 507.1067339413934, |
| "eval_loss": 6.375464916229248, |
| "eval_runtime": 50.9673, |
| "eval_samples_per_second": 196.204, |
| "eval_steps_per_second": 3.512, |
| "step": 56800 |
| }, |
| { |
| "epoch": 507.9994178148651, |
| "grad_norm": 0.11263983696699142, |
| "learning_rate": 3.110367892976589e-07, |
| "loss": 6.3597, |
| "step": 56900 |
| }, |
| { |
| "epoch": 507.9994178148651, |
| "eval_loss": 6.370204925537109, |
| "eval_runtime": 50.9973, |
| "eval_samples_per_second": 196.089, |
| "eval_steps_per_second": 3.51, |
| "step": 56900 |
| }, |
| { |
| "epoch": 508.8921016883369, |
| "grad_norm": 0.11769650131464005, |
| "learning_rate": 3.010033444816054e-07, |
| "loss": 6.3589, |
| "step": 57000 |
| }, |
| { |
| "epoch": 508.8921016883369, |
| "eval_loss": 6.374892234802246, |
| "eval_runtime": 51.0033, |
| "eval_samples_per_second": 196.066, |
| "eval_steps_per_second": 3.51, |
| "step": 57000 |
| }, |
| { |
| "epoch": 509.78478556180863, |
| "grad_norm": 0.12533652782440186, |
| "learning_rate": 2.9096989966555187e-07, |
| "loss": 6.3585, |
| "step": 57100 |
| }, |
| { |
| "epoch": 509.78478556180863, |
| "eval_loss": 6.370015621185303, |
| "eval_runtime": 50.9934, |
| "eval_samples_per_second": 196.104, |
| "eval_steps_per_second": 3.51, |
| "step": 57100 |
| }, |
| { |
| "epoch": 510.67746943528044, |
| "grad_norm": 0.11758119612932205, |
| "learning_rate": 2.809364548494983e-07, |
| "loss": 6.3588, |
| "step": 57200 |
| }, |
| { |
| "epoch": 510.67746943528044, |
| "eval_loss": 6.374600410461426, |
| "eval_runtime": 50.4993, |
| "eval_samples_per_second": 198.023, |
| "eval_steps_per_second": 3.545, |
| "step": 57200 |
| }, |
| { |
| "epoch": 511.5701533087522, |
| "grad_norm": 0.13065285980701447, |
| "learning_rate": 2.709030100334448e-07, |
| "loss": 6.3595, |
| "step": 57300 |
| }, |
| { |
| "epoch": 511.5701533087522, |
| "eval_loss": 6.372690677642822, |
| "eval_runtime": 50.9923, |
| "eval_samples_per_second": 196.108, |
| "eval_steps_per_second": 3.51, |
| "step": 57300 |
| }, |
| { |
| "epoch": 512.4628371822239, |
| "grad_norm": 0.11216452717781067, |
| "learning_rate": 2.608695652173913e-07, |
| "loss": 6.3594, |
| "step": 57400 |
| }, |
| { |
| "epoch": 512.4628371822239, |
| "eval_loss": 6.370244026184082, |
| "eval_runtime": 50.981, |
| "eval_samples_per_second": 196.152, |
| "eval_steps_per_second": 3.511, |
| "step": 57400 |
| }, |
| { |
| "epoch": 513.3555210556957, |
| "grad_norm": 0.11593976616859436, |
| "learning_rate": 2.508361204013378e-07, |
| "loss": 6.3599, |
| "step": 57500 |
| }, |
| { |
| "epoch": 513.3555210556957, |
| "eval_loss": 6.3737688064575195, |
| "eval_runtime": 50.9877, |
| "eval_samples_per_second": 196.126, |
| "eval_steps_per_second": 3.511, |
| "step": 57500 |
| }, |
| { |
| "epoch": 514.2482049291675, |
| "grad_norm": 0.1154174879193306, |
| "learning_rate": 2.408026755852843e-07, |
| "loss": 6.3598, |
| "step": 57600 |
| }, |
| { |
| "epoch": 514.2482049291675, |
| "eval_loss": 6.373289108276367, |
| "eval_runtime": 50.9752, |
| "eval_samples_per_second": 196.174, |
| "eval_steps_per_second": 3.512, |
| "step": 57600 |
| }, |
| { |
| "epoch": 515.1408888026392, |
| "grad_norm": 0.12078119069337845, |
| "learning_rate": 2.3076923076923078e-07, |
| "loss": 6.3592, |
| "step": 57700 |
| }, |
| { |
| "epoch": 515.1408888026392, |
| "eval_loss": 6.371698379516602, |
| "eval_runtime": 50.9768, |
| "eval_samples_per_second": 196.168, |
| "eval_steps_per_second": 3.511, |
| "step": 57700 |
| }, |
| { |
| "epoch": 516.033572676111, |
| "grad_norm": 0.09368869662284851, |
| "learning_rate": 2.2073578595317728e-07, |
| "loss": 6.3593, |
| "step": 57800 |
| }, |
| { |
| "epoch": 516.033572676111, |
| "eval_loss": 6.372560024261475, |
| "eval_runtime": 50.9893, |
| "eval_samples_per_second": 196.119, |
| "eval_steps_per_second": 3.511, |
| "step": 57800 |
| }, |
| { |
| "epoch": 516.9262565495827, |
| "grad_norm": 0.09950955212116241, |
| "learning_rate": 2.1070234113712372e-07, |
| "loss": 6.3593, |
| "step": 57900 |
| }, |
| { |
| "epoch": 516.9262565495827, |
| "eval_loss": 6.375257968902588, |
| "eval_runtime": 50.9655, |
| "eval_samples_per_second": 196.211, |
| "eval_steps_per_second": 3.512, |
| "step": 57900 |
| }, |
| { |
| "epoch": 517.8189404230545, |
| "grad_norm": 0.12712809443473816, |
| "learning_rate": 2.0066889632107022e-07, |
| "loss": 6.3587, |
| "step": 58000 |
| }, |
| { |
| "epoch": 517.8189404230545, |
| "eval_loss": 6.374295234680176, |
| "eval_runtime": 50.9826, |
| "eval_samples_per_second": 196.145, |
| "eval_steps_per_second": 3.511, |
| "step": 58000 |
| }, |
| { |
| "epoch": 518.7116242965263, |
| "grad_norm": 0.11053524911403656, |
| "learning_rate": 1.9063545150501672e-07, |
| "loss": 6.3594, |
| "step": 58100 |
| }, |
| { |
| "epoch": 518.7116242965263, |
| "eval_loss": 6.376541614532471, |
| "eval_runtime": 50.9747, |
| "eval_samples_per_second": 196.176, |
| "eval_steps_per_second": 3.512, |
| "step": 58100 |
| }, |
| { |
| "epoch": 519.604308169998, |
| "grad_norm": 0.10716045647859573, |
| "learning_rate": 1.8060200668896322e-07, |
| "loss": 6.3586, |
| "step": 58200 |
| }, |
| { |
| "epoch": 519.604308169998, |
| "eval_loss": 6.373443126678467, |
| "eval_runtime": 50.9793, |
| "eval_samples_per_second": 196.158, |
| "eval_steps_per_second": 3.511, |
| "step": 58200 |
| }, |
| { |
| "epoch": 520.4969920434698, |
| "grad_norm": 0.1010851114988327, |
| "learning_rate": 1.705685618729097e-07, |
| "loss": 6.3583, |
| "step": 58300 |
| }, |
| { |
| "epoch": 520.4969920434698, |
| "eval_loss": 6.375570297241211, |
| "eval_runtime": 50.9829, |
| "eval_samples_per_second": 196.144, |
| "eval_steps_per_second": 3.511, |
| "step": 58300 |
| }, |
| { |
| "epoch": 521.3896759169415, |
| "grad_norm": 0.10243038833141327, |
| "learning_rate": 1.605351170568562e-07, |
| "loss": 6.359, |
| "step": 58400 |
| }, |
| { |
| "epoch": 521.3896759169415, |
| "eval_loss": 6.37014627456665, |
| "eval_runtime": 50.9806, |
| "eval_samples_per_second": 196.153, |
| "eval_steps_per_second": 3.511, |
| "step": 58400 |
| }, |
| { |
| "epoch": 522.2823597904134, |
| "grad_norm": 0.11007111519575119, |
| "learning_rate": 1.505016722408027e-07, |
| "loss": 6.3597, |
| "step": 58500 |
| }, |
| { |
| "epoch": 522.2823597904134, |
| "eval_loss": 6.367834091186523, |
| "eval_runtime": 50.9773, |
| "eval_samples_per_second": 196.166, |
| "eval_steps_per_second": 3.511, |
| "step": 58500 |
| }, |
| { |
| "epoch": 523.1750436638852, |
| "grad_norm": 0.10557661205530167, |
| "learning_rate": 1.4046822742474916e-07, |
| "loss": 6.3597, |
| "step": 58600 |
| }, |
| { |
| "epoch": 523.1750436638852, |
| "eval_loss": 6.3743696212768555, |
| "eval_runtime": 50.9815, |
| "eval_samples_per_second": 196.15, |
| "eval_steps_per_second": 3.511, |
| "step": 58600 |
| }, |
| { |
| "epoch": 524.0677275373569, |
| "grad_norm": 0.11409670859575272, |
| "learning_rate": 1.3043478260869566e-07, |
| "loss": 6.3595, |
| "step": 58700 |
| }, |
| { |
| "epoch": 524.0677275373569, |
| "eval_loss": 6.372434139251709, |
| "eval_runtime": 50.9833, |
| "eval_samples_per_second": 196.143, |
| "eval_steps_per_second": 3.511, |
| "step": 58700 |
| }, |
| { |
| "epoch": 524.9604114108287, |
| "grad_norm": 0.11429371684789658, |
| "learning_rate": 1.2040133779264215e-07, |
| "loss": 6.3583, |
| "step": 58800 |
| }, |
| { |
| "epoch": 524.9604114108287, |
| "eval_loss": 6.374448776245117, |
| "eval_runtime": 50.9877, |
| "eval_samples_per_second": 196.126, |
| "eval_steps_per_second": 3.511, |
| "step": 58800 |
| }, |
| { |
| "epoch": 525.8530952843004, |
| "grad_norm": 0.11243493109941483, |
| "learning_rate": 1.1036789297658864e-07, |
| "loss": 6.3594, |
| "step": 58900 |
| }, |
| { |
| "epoch": 525.8530952843004, |
| "eval_loss": 6.372460842132568, |
| "eval_runtime": 50.9747, |
| "eval_samples_per_second": 196.176, |
| "eval_steps_per_second": 3.512, |
| "step": 58900 |
| }, |
| { |
| "epoch": 526.7457791577722, |
| "grad_norm": 0.10929535329341888, |
| "learning_rate": 1.0033444816053511e-07, |
| "loss": 6.3596, |
| "step": 59000 |
| }, |
| { |
| "epoch": 526.7457791577722, |
| "eval_loss": 6.372054576873779, |
| "eval_runtime": 50.9854, |
| "eval_samples_per_second": 196.134, |
| "eval_steps_per_second": 3.511, |
| "step": 59000 |
| }, |
| { |
| "epoch": 527.638463031244, |
| "grad_norm": 0.10336798429489136, |
| "learning_rate": 9.030100334448161e-08, |
| "loss": 6.3588, |
| "step": 59100 |
| }, |
| { |
| "epoch": 527.638463031244, |
| "eval_loss": 6.373047828674316, |
| "eval_runtime": 50.9782, |
| "eval_samples_per_second": 196.162, |
| "eval_steps_per_second": 3.511, |
| "step": 59100 |
| }, |
| { |
| "epoch": 528.5311469047157, |
| "grad_norm": 0.11266309767961502, |
| "learning_rate": 8.02675585284281e-08, |
| "loss": 6.3602, |
| "step": 59200 |
| }, |
| { |
| "epoch": 528.5311469047157, |
| "eval_loss": 6.370576858520508, |
| "eval_runtime": 51.0093, |
| "eval_samples_per_second": 196.043, |
| "eval_steps_per_second": 3.509, |
| "step": 59200 |
| }, |
| { |
| "epoch": 529.4238307781875, |
| "grad_norm": 0.10325779765844345, |
| "learning_rate": 7.023411371237458e-08, |
| "loss": 6.3595, |
| "step": 59300 |
| }, |
| { |
| "epoch": 529.4238307781875, |
| "eval_loss": 6.371870994567871, |
| "eval_runtime": 50.501, |
| "eval_samples_per_second": 198.016, |
| "eval_steps_per_second": 3.544, |
| "step": 59300 |
| }, |
| { |
| "epoch": 530.3165146516592, |
| "grad_norm": 0.09962137043476105, |
| "learning_rate": 6.020066889632108e-08, |
| "loss": 6.358, |
| "step": 59400 |
| }, |
| { |
| "epoch": 530.3165146516592, |
| "eval_loss": 6.365788459777832, |
| "eval_runtime": 50.983, |
| "eval_samples_per_second": 196.144, |
| "eval_steps_per_second": 3.511, |
| "step": 59400 |
| }, |
| { |
| "epoch": 531.209198525131, |
| "grad_norm": 0.10900256037712097, |
| "learning_rate": 5.0167224080267556e-08, |
| "loss": 6.359, |
| "step": 59500 |
| }, |
| { |
| "epoch": 531.209198525131, |
| "eval_loss": 6.371830940246582, |
| "eval_runtime": 46.7226, |
| "eval_samples_per_second": 214.029, |
| "eval_steps_per_second": 3.831, |
| "step": 59500 |
| }, |
| { |
| "epoch": 532.1018823986028, |
| "grad_norm": 0.10019946843385696, |
| "learning_rate": 4.013377926421405e-08, |
| "loss": 6.3591, |
| "step": 59600 |
| }, |
| { |
| "epoch": 532.1018823986028, |
| "eval_loss": 6.372683048248291, |
| "eval_runtime": 50.9869, |
| "eval_samples_per_second": 196.129, |
| "eval_steps_per_second": 3.511, |
| "step": 59600 |
| }, |
| { |
| "epoch": 532.9945662720745, |
| "grad_norm": 0.10921988636255264, |
| "learning_rate": 3.010033444816054e-08, |
| "loss": 6.3601, |
| "step": 59700 |
| }, |
| { |
| "epoch": 532.9945662720745, |
| "eval_loss": 6.371883392333984, |
| "eval_runtime": 50.5044, |
| "eval_samples_per_second": 198.002, |
| "eval_steps_per_second": 3.544, |
| "step": 59700 |
| }, |
| { |
| "epoch": 533.8872501455463, |
| "grad_norm": 0.09983010590076447, |
| "learning_rate": 2.0066889632107024e-08, |
| "loss": 6.3597, |
| "step": 59800 |
| }, |
| { |
| "epoch": 533.8872501455463, |
| "eval_loss": 6.372203350067139, |
| "eval_runtime": 51.0084, |
| "eval_samples_per_second": 196.046, |
| "eval_steps_per_second": 3.509, |
| "step": 59800 |
| }, |
| { |
| "epoch": 534.779934019018, |
| "grad_norm": 0.10680444538593292, |
| "learning_rate": 1.0033444816053512e-08, |
| "loss": 6.3592, |
| "step": 59900 |
| }, |
| { |
| "epoch": 534.779934019018, |
| "eval_loss": 6.379711627960205, |
| "eval_runtime": 50.9976, |
| "eval_samples_per_second": 196.088, |
| "eval_steps_per_second": 3.51, |
| "step": 59900 |
| }, |
| { |
| "epoch": 535.6726178924898, |
| "grad_norm": 0.10077936947345734, |
| "learning_rate": 0.0, |
| "loss": 6.3593, |
| "step": 60000 |
| }, |
| { |
| "epoch": 535.6726178924898, |
| "eval_loss": 6.370903968811035, |
| "eval_runtime": 50.9925, |
| "eval_samples_per_second": 196.107, |
| "eval_steps_per_second": 3.51, |
| "step": 60000 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 60000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 536, |
| "save_steps": 1000, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 4.808412969204368e+20, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|