{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 31, "global_step": 159, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.018867924528301886, "grad_norm": 0.9160448908805847, "learning_rate": 0.0, "loss": 2.72265625, "step": 1 }, { "epoch": 0.03773584905660377, "grad_norm": 0.5443944334983826, "learning_rate": 6.25e-06, "loss": 2.095703125, "step": 2 }, { "epoch": 0.05660377358490566, "grad_norm": 0.7521076798439026, "learning_rate": 1.25e-05, "loss": 2.4833984375, "step": 3 }, { "epoch": 0.07547169811320754, "grad_norm": 0.4434555470943451, "learning_rate": 1.8750000000000002e-05, "loss": 1.9140625, "step": 4 }, { "epoch": 0.09433962264150944, "grad_norm": 0.397516667842865, "learning_rate": 2.5e-05, "loss": 1.791748046875, "step": 5 }, { "epoch": 0.11320754716981132, "grad_norm": 0.36063775420188904, "learning_rate": 3.125e-05, "loss": 1.845703125, "step": 6 }, { "epoch": 0.1320754716981132, "grad_norm": 0.29012879729270935, "learning_rate": 3.7500000000000003e-05, "loss": 2.0087890625, "step": 7 }, { "epoch": 0.1509433962264151, "grad_norm": 0.23380061984062195, "learning_rate": 4.375e-05, "loss": 1.912109375, "step": 8 }, { "epoch": 0.16981132075471697, "grad_norm": 0.26473182439804077, "learning_rate": 5e-05, "loss": 1.9580078125, "step": 9 }, { "epoch": 0.18867924528301888, "grad_norm": 0.2436726838350296, "learning_rate": 5.6250000000000005e-05, "loss": 1.8037109375, "step": 10 }, { "epoch": 0.20754716981132076, "grad_norm": 0.17534290254116058, "learning_rate": 6.25e-05, "loss": 1.513671875, "step": 11 }, { "epoch": 0.22641509433962265, "grad_norm": 0.31353089213371277, "learning_rate": 6.875e-05, "loss": 1.74609375, "step": 12 }, { "epoch": 0.24528301886792453, "grad_norm": 0.1890019029378891, "learning_rate": 7.500000000000001e-05, "loss": 1.478515625, "step": 13 }, { "epoch": 0.2641509433962264, "grad_norm": 0.2181335985660553, "learning_rate": 8.125000000000001e-05, "loss": 1.439453125, "step": 14 }, { "epoch": 0.2830188679245283, "grad_norm": 0.1583699882030487, "learning_rate": 8.75e-05, "loss": 1.345703125, "step": 15 }, { "epoch": 0.3018867924528302, "grad_norm": 0.39862334728240967, "learning_rate": 9.375e-05, "loss": 1.30078125, "step": 16 }, { "epoch": 0.32075471698113206, "grad_norm": 0.4889472723007202, "learning_rate": 0.0001, "loss": 1.020751953125, "step": 17 }, { "epoch": 0.33962264150943394, "grad_norm": 0.22474290430545807, "learning_rate": 9.998914092779207e-05, "loss": 1.10888671875, "step": 18 }, { "epoch": 0.3584905660377358, "grad_norm": 0.21462957561016083, "learning_rate": 9.995656895203267e-05, "loss": 1.16650390625, "step": 19 }, { "epoch": 0.37735849056603776, "grad_norm": 0.2226303219795227, "learning_rate": 9.990229979278567e-05, "loss": 1.04833984375, "step": 20 }, { "epoch": 0.39622641509433965, "grad_norm": 0.19752401113510132, "learning_rate": 9.982635964172747e-05, "loss": 1.020751953125, "step": 21 }, { "epoch": 0.41509433962264153, "grad_norm": 0.14107196033000946, "learning_rate": 9.972878514950619e-05, "loss": 0.99072265625, "step": 22 }, { "epoch": 0.4339622641509434, "grad_norm": 0.14339610934257507, "learning_rate": 9.960962340805332e-05, "loss": 0.9814453125, "step": 23 }, { "epoch": 0.4528301886792453, "grad_norm": 0.11852391809225082, "learning_rate": 9.946893192785568e-05, "loss": 1.03125, "step": 24 }, { "epoch": 0.4716981132075472, "grad_norm": 0.12675724923610687, "learning_rate": 9.930677861019963e-05, "loss": 0.8095703125, "step": 25 }, { "epoch": 0.49056603773584906, "grad_norm": 0.13236619532108307, "learning_rate": 9.912324171440008e-05, "loss": 0.66748046875, "step": 26 }, { "epoch": 0.5094339622641509, "grad_norm": 0.11803070455789566, "learning_rate": 9.89184098200305e-05, "loss": 0.5257568359375, "step": 27 }, { "epoch": 0.5283018867924528, "grad_norm": 0.14111293852329254, "learning_rate": 9.869238178417235e-05, "loss": 0.68310546875, "step": 28 }, { "epoch": 0.5471698113207547, "grad_norm": 0.23157398402690887, "learning_rate": 9.844526669370392e-05, "loss": 0.3009033203125, "step": 29 }, { "epoch": 0.5660377358490566, "grad_norm": 0.10609235614538193, "learning_rate": 9.81771838126524e-05, "loss": 0.71923828125, "step": 30 }, { "epoch": 0.5849056603773585, "grad_norm": 0.08503806591033936, "learning_rate": 9.788826252463388e-05, "loss": 0.536865234375, "step": 31 }, { "epoch": 0.6037735849056604, "grad_norm": 0.07262135297060013, "learning_rate": 9.757864227040969e-05, "loss": 0.64617919921875, "step": 32 }, { "epoch": 0.6226415094339622, "grad_norm": 0.047836314886808395, "learning_rate": 9.724847248058859e-05, "loss": 0.76177978515625, "step": 33 }, { "epoch": 0.6415094339622641, "grad_norm": 0.09082711488008499, "learning_rate": 9.689791250350787e-05, "loss": 0.4765625, "step": 34 }, { "epoch": 0.660377358490566, "grad_norm": 0.04307923838496208, "learning_rate": 9.652713152832772e-05, "loss": 0.85736083984375, "step": 35 }, { "epoch": 0.660377358490566, "eval_loss": 0.756591796875, "eval_runtime": 5.4394, "eval_samples_per_second": 0.552, "eval_steps_per_second": 0.184, "step": 35 }, { "epoch": 0.6792452830188679, "grad_norm": 0.06730978190898895, "learning_rate": 9.613630850337626e-05, "loss": 0.605224609375, "step": 36 }, { "epoch": 0.6981132075471698, "grad_norm": 0.054134998470544815, "learning_rate": 9.572563204978451e-05, "loss": 0.529541015625, "step": 37 }, { "epoch": 0.7169811320754716, "grad_norm": 0.04065776243805885, "learning_rate": 9.529530037045311e-05, "loss": 0.5693359375, "step": 38 }, { "epoch": 0.7358490566037735, "grad_norm": 0.03646336495876312, "learning_rate": 9.484552115439445e-05, "loss": 0.63250732421875, "step": 39 }, { "epoch": 0.7547169811320755, "grad_norm": 0.05910707637667656, "learning_rate": 9.437651147649675e-05, "loss": 0.4556884765625, "step": 40 }, { "epoch": 0.7735849056603774, "grad_norm": 0.03508642688393593, "learning_rate": 9.388849769275819e-05, "loss": 0.79693603515625, "step": 41 }, { "epoch": 0.7924528301886793, "grad_norm": 0.03845144808292389, "learning_rate": 9.338171533104165e-05, "loss": 0.80572509765625, "step": 42 }, { "epoch": 0.8113207547169812, "grad_norm": 0.03844299539923668, "learning_rate": 9.285640897740315e-05, "loss": 0.7535400390625, "step": 43 }, { "epoch": 0.8301886792452831, "grad_norm": 0.04553592577576637, "learning_rate": 9.231283215804827e-05, "loss": 0.348114013671875, "step": 44 }, { "epoch": 0.8490566037735849, "grad_norm": 0.03860464319586754, "learning_rate": 9.175124721697398e-05, "loss": 0.50250244140625, "step": 45 }, { "epoch": 0.8679245283018868, "grad_norm": 0.040941134095191956, "learning_rate": 9.117192518935477e-05, "loss": 0.51824951171875, "step": 46 }, { "epoch": 0.8867924528301887, "grad_norm": 0.036735646426677704, "learning_rate": 9.057514567073416e-05, "loss": 0.82611083984375, "step": 47 }, { "epoch": 0.9056603773584906, "grad_norm": 0.048354849219322205, "learning_rate": 8.996119668208483e-05, "loss": 0.34613037109375, "step": 48 }, { "epoch": 0.9245283018867925, "grad_norm": 0.03629879280924797, "learning_rate": 8.933037453080231e-05, "loss": 0.7056884765625, "step": 49 }, { "epoch": 0.9433962264150944, "grad_norm": 0.03945612534880638, "learning_rate": 8.868298366769954e-05, "loss": 0.4949951171875, "step": 50 }, { "epoch": 0.9622641509433962, "grad_norm": 0.03107060305774212, "learning_rate": 8.801933654007119e-05, "loss": 0.84393310546875, "step": 51 }, { "epoch": 0.9811320754716981, "grad_norm": 0.03779706358909607, "learning_rate": 8.733975344089852e-05, "loss": 0.355377197265625, "step": 52 }, { "epoch": 1.0, "grad_norm": 0.03321205452084541, "learning_rate": 8.6644562354268e-05, "loss": 0.262298583984375, "step": 53 }, { "epoch": 1.0188679245283019, "grad_norm": 0.03069538250565529, "learning_rate": 8.593409879707777e-05, "loss": 0.30084228515625, "step": 54 }, { "epoch": 1.0377358490566038, "grad_norm": 0.03414987400174141, "learning_rate": 8.520870565710866e-05, "loss": 0.8505859375, "step": 55 }, { "epoch": 1.0566037735849056, "grad_norm": 0.02888660319149494, "learning_rate": 8.446873302753784e-05, "loss": 0.482421875, "step": 56 }, { "epoch": 1.0754716981132075, "grad_norm": 0.03213921934366226, "learning_rate": 8.371453803797488e-05, "loss": 0.8316650390625, "step": 57 }, { "epoch": 1.0943396226415094, "grad_norm": 0.022419078275561333, "learning_rate": 8.294648468210209e-05, "loss": 0.598419189453125, "step": 58 }, { "epoch": 1.1132075471698113, "grad_norm": 0.021831678226590157, "learning_rate": 8.216494364200169e-05, "loss": 0.328033447265625, "step": 59 }, { "epoch": 1.1320754716981132, "grad_norm": 0.025370784103870392, "learning_rate": 8.137029210925539e-05, "loss": 0.6046142578125, "step": 60 }, { "epoch": 1.150943396226415, "grad_norm": 0.02519148774445057, "learning_rate": 8.056291360290201e-05, "loss": 0.5687103271484375, "step": 61 }, { "epoch": 1.169811320754717, "grad_norm": 0.022458959370851517, "learning_rate": 7.974319778434157e-05, "loss": 0.39935302734375, "step": 62 }, { "epoch": 1.1886792452830188, "grad_norm": 0.052403755486011505, "learning_rate": 7.891154026927469e-05, "loss": 0.47015380859375, "step": 63 }, { "epoch": 1.2075471698113207, "grad_norm": 0.02445453405380249, "learning_rate": 7.806834243676837e-05, "loss": 0.777740478515625, "step": 64 }, { "epoch": 1.2264150943396226, "grad_norm": 0.02027270942926407, "learning_rate": 7.721401123554034e-05, "loss": 0.457611083984375, "step": 65 }, { "epoch": 1.2452830188679245, "grad_norm": 0.023989953100681305, "learning_rate": 7.634895898755521e-05, "loss": 0.716796875, "step": 66 }, { "epoch": 1.2452830188679245, "eval_loss": 0.7044677734375, "eval_runtime": 5.43, "eval_samples_per_second": 0.552, "eval_steps_per_second": 0.184, "step": 66 }, { "epoch": 1.2641509433962264, "grad_norm": 0.024166857823729515, "learning_rate": 7.547360318902743e-05, "loss": 0.62408447265625, "step": 67 }, { "epoch": 1.2830188679245282, "grad_norm": 0.028676064684987068, "learning_rate": 7.458836630892693e-05, "loss": 0.906494140625, "step": 68 }, { "epoch": 1.3018867924528301, "grad_norm": 0.020518383011221886, "learning_rate": 7.369367558508489e-05, "loss": 0.30908203125, "step": 69 }, { "epoch": 1.320754716981132, "grad_norm": 0.11661913990974426, "learning_rate": 7.278996281799797e-05, "loss": 0.507965087890625, "step": 70 }, { "epoch": 1.3396226415094339, "grad_norm": 0.02599608711898327, "learning_rate": 7.18776641624303e-05, "loss": 0.64666748046875, "step": 71 }, { "epoch": 1.3584905660377358, "grad_norm": 0.028015300631523132, "learning_rate": 7.095721991691411e-05, "loss": 0.7392578125, "step": 72 }, { "epoch": 1.3773584905660377, "grad_norm": 0.024578798562288284, "learning_rate": 7.002907431125057e-05, "loss": 0.6336669921875, "step": 73 }, { "epoch": 1.3962264150943398, "grad_norm": 0.02427557297050953, "learning_rate": 6.909367529211306e-05, "loss": 0.6378173828125, "step": 74 }, { "epoch": 1.4150943396226414, "grad_norm": 0.02489621192216873, "learning_rate": 6.815147430685678e-05, "loss": 0.75396728515625, "step": 75 }, { "epoch": 1.4339622641509435, "grad_norm": 0.026317507028579712, "learning_rate": 6.720292608563877e-05, "loss": 0.74066162109375, "step": 76 }, { "epoch": 1.4528301886792452, "grad_norm": 0.026842059567570686, "learning_rate": 6.624848842195356e-05, "loss": 0.84844970703125, "step": 77 }, { "epoch": 1.4716981132075473, "grad_norm": 0.02483026497066021, "learning_rate": 6.528862195169039e-05, "loss": 0.62548828125, "step": 78 }, { "epoch": 1.490566037735849, "grad_norm": 0.02440921775996685, "learning_rate": 6.43237899308186e-05, "loss": 0.5023193359375, "step": 79 }, { "epoch": 1.509433962264151, "grad_norm": 0.021304575726389885, "learning_rate": 6.335445801180859e-05, "loss": 0.38848876953125, "step": 80 }, { "epoch": 1.5283018867924527, "grad_norm": 0.024867858737707138, "learning_rate": 6.238109401889598e-05, "loss": 0.58270263671875, "step": 81 }, { "epoch": 1.5471698113207548, "grad_norm": 0.022254586219787598, "learning_rate": 6.140416772229784e-05, "loss": 0.18841552734375, "step": 82 }, { "epoch": 1.5660377358490565, "grad_norm": 0.023492569103837013, "learning_rate": 6.042415061148954e-05, "loss": 0.6334228515625, "step": 83 }, { "epoch": 1.5849056603773586, "grad_norm": 0.019843759015202522, "learning_rate": 5.944151566765205e-05, "loss": 0.4464263916015625, "step": 84 }, { "epoch": 1.6037735849056602, "grad_norm": 0.026993080973625183, "learning_rate": 5.845673713539911e-05, "loss": 0.560821533203125, "step": 85 }, { "epoch": 1.6226415094339623, "grad_norm": 0.025686046108603477, "learning_rate": 5.747029029389475e-05, "loss": 0.6922607421875, "step": 86 }, { "epoch": 1.641509433962264, "grad_norm": 0.02275293879210949, "learning_rate": 5.6482651227471436e-05, "loss": 0.38201904296875, "step": 87 }, { "epoch": 1.6603773584905661, "grad_norm": 0.02670340985059738, "learning_rate": 5.5494296595859764e-05, "loss": 0.790191650390625, "step": 88 }, { "epoch": 1.6792452830188678, "grad_norm": 0.02301422692835331, "learning_rate": 5.450570340414024e-05, "loss": 0.5341796875, "step": 89 }, { "epoch": 1.6981132075471699, "grad_norm": 0.02345620095729828, "learning_rate": 5.3517348772528574e-05, "loss": 0.4722900390625, "step": 90 }, { "epoch": 1.7169811320754715, "grad_norm": 0.024356689304113388, "learning_rate": 5.252970970610527e-05, "loss": 0.51446533203125, "step": 91 }, { "epoch": 1.7358490566037736, "grad_norm": 0.02343251183629036, "learning_rate": 5.154326286460089e-05, "loss": 0.57806396484375, "step": 92 }, { "epoch": 1.7547169811320755, "grad_norm": 0.01980278082191944, "learning_rate": 5.055848433234796e-05, "loss": 0.400054931640625, "step": 93 }, { "epoch": 1.7735849056603774, "grad_norm": 0.02493242546916008, "learning_rate": 4.9575849388510473e-05, "loss": 0.74359130859375, "step": 94 }, { "epoch": 1.7924528301886793, "grad_norm": 0.027098434045910835, "learning_rate": 4.859583227770218e-05, "loss": 0.75225830078125, "step": 95 }, { "epoch": 1.8113207547169812, "grad_norm": 0.02704058215022087, "learning_rate": 4.761890598110403e-05, "loss": 0.704345703125, "step": 96 }, { "epoch": 1.830188679245283, "grad_norm": 0.01941896229982376, "learning_rate": 4.664554198819141e-05, "loss": 0.317626953125, "step": 97 }, { "epoch": 1.830188679245283, "eval_loss": 0.6927490234375, "eval_runtime": 5.4223, "eval_samples_per_second": 0.553, "eval_steps_per_second": 0.184, "step": 97 }, { "epoch": 1.849056603773585, "grad_norm": 0.02108132652938366, "learning_rate": 4.5676210069181405e-05, "loss": 0.46380615234375, "step": 98 }, { "epoch": 1.8679245283018868, "grad_norm": 0.02277522347867489, "learning_rate": 4.471137804830963e-05, "loss": 0.482635498046875, "step": 99 }, { "epoch": 1.8867924528301887, "grad_norm": 0.02586280182003975, "learning_rate": 4.375151157804645e-05, "loss": 0.77655029296875, "step": 100 }, { "epoch": 1.9056603773584906, "grad_norm": 0.020695367828011513, "learning_rate": 4.279707391436124e-05, "loss": 0.3177490234375, "step": 101 }, { "epoch": 1.9245283018867925, "grad_norm": 0.026092447340488434, "learning_rate": 4.1848525693143235e-05, "loss": 0.6651611328125, "step": 102 }, { "epoch": 1.9433962264150944, "grad_norm": 0.019947027787566185, "learning_rate": 4.090632470788695e-05, "loss": 0.46533203125, "step": 103 }, { "epoch": 1.9622641509433962, "grad_norm": 0.02738369069993496, "learning_rate": 3.997092568874944e-05, "loss": 0.80084228515625, "step": 104 }, { "epoch": 1.9811320754716981, "grad_norm": 0.019547849893569946, "learning_rate": 3.904278008308589e-05, "loss": 0.333221435546875, "step": 105 }, { "epoch": 2.0, "grad_norm": 0.01958700828254223, "learning_rate": 3.812233583756972e-05, "loss": 0.24285888671875, "step": 106 }, { "epoch": 2.018867924528302, "grad_norm": 0.020026640966534615, "learning_rate": 3.721003718200204e-05, "loss": 0.279296875, "step": 107 }, { "epoch": 2.0377358490566038, "grad_norm": 0.027759267017245293, "learning_rate": 3.630632441491512e-05, "loss": 0.8104248046875, "step": 108 }, { "epoch": 2.056603773584906, "grad_norm": 0.021983085200190544, "learning_rate": 3.5411633691073096e-05, "loss": 0.46087646484375, "step": 109 }, { "epoch": 2.0754716981132075, "grad_norm": 0.029194500297307968, "learning_rate": 3.4526396810972584e-05, "loss": 0.79443359375, "step": 110 }, { "epoch": 2.0943396226415096, "grad_norm": 0.022142434492707253, "learning_rate": 3.3651041012444804e-05, "loss": 0.569732666015625, "step": 111 }, { "epoch": 2.1132075471698113, "grad_norm": 0.019784018397331238, "learning_rate": 3.2785988764459664e-05, "loss": 0.31280517578125, "step": 112 }, { "epoch": 2.1320754716981134, "grad_norm": 0.025928346440196037, "learning_rate": 3.193165756323165e-05, "loss": 0.577880859375, "step": 113 }, { "epoch": 2.150943396226415, "grad_norm": 0.02521391585469246, "learning_rate": 3.1088459730725335e-05, "loss": 0.54052734375, "step": 114 }, { "epoch": 2.169811320754717, "grad_norm": 0.021982381120324135, "learning_rate": 3.0256802215658437e-05, "loss": 0.3807373046875, "step": 115 }, { "epoch": 2.188679245283019, "grad_norm": 0.022596165537834167, "learning_rate": 2.9437086397097995e-05, "loss": 0.451141357421875, "step": 116 }, { "epoch": 2.207547169811321, "grad_norm": 0.0256204754114151, "learning_rate": 2.862970789074463e-05, "loss": 0.746856689453125, "step": 117 }, { "epoch": 2.2264150943396226, "grad_norm": 0.021772582083940506, "learning_rate": 2.7835056357998323e-05, "loss": 0.4388427734375, "step": 118 }, { "epoch": 2.2452830188679247, "grad_norm": 0.025826886296272278, "learning_rate": 2.7053515317897925e-05, "loss": 0.6865234375, "step": 119 }, { "epoch": 2.2641509433962264, "grad_norm": 0.025294864550232887, "learning_rate": 2.6285461962025115e-05, "loss": 0.601287841796875, "step": 120 }, { "epoch": 2.2830188679245285, "grad_norm": 0.03068646416068077, "learning_rate": 2.5531266972462177e-05, "loss": 0.873291015625, "step": 121 }, { "epoch": 2.30188679245283, "grad_norm": 0.021428707987070084, "learning_rate": 2.479129434289134e-05, "loss": 0.296875, "step": 122 }, { "epoch": 2.3207547169811322, "grad_norm": 0.020753471180796623, "learning_rate": 2.4065901202922232e-05, "loss": 0.488677978515625, "step": 123 }, { "epoch": 2.339622641509434, "grad_norm": 0.02610793523490429, "learning_rate": 2.3355437645732004e-05, "loss": 0.62261962890625, "step": 124 }, { "epoch": 2.358490566037736, "grad_norm": 0.03154842555522919, "learning_rate": 2.2660246559101505e-05, "loss": 0.7137451171875, "step": 125 }, { "epoch": 2.3773584905660377, "grad_norm": 0.025154979899525642, "learning_rate": 2.1980663459928834e-05, "loss": 0.6123046875, "step": 126 }, { "epoch": 2.3962264150943398, "grad_norm": 0.026202384382486343, "learning_rate": 2.1317016332300447e-05, "loss": 0.614532470703125, "step": 127 }, { "epoch": 2.4150943396226414, "grad_norm": 0.027304857969284058, "learning_rate": 2.0669625469197693e-05, "loss": 0.72918701171875, "step": 128 }, { "epoch": 2.4150943396226414, "eval_loss": 0.685791015625, "eval_runtime": 5.4318, "eval_samples_per_second": 0.552, "eval_steps_per_second": 0.184, "step": 128 }, { "epoch": 2.4339622641509435, "grad_norm": 0.0265318863093853, "learning_rate": 2.003880331791518e-05, "loss": 0.718353271484375, "step": 129 }, { "epoch": 2.452830188679245, "grad_norm": 0.027988294139504433, "learning_rate": 1.9424854329265856e-05, "loss": 0.81939697265625, "step": 130 }, { "epoch": 2.4716981132075473, "grad_norm": 0.02585024945437908, "learning_rate": 1.882807481064525e-05, "loss": 0.60516357421875, "step": 131 }, { "epoch": 2.490566037735849, "grad_norm": 0.024814441800117493, "learning_rate": 1.824875278302603e-05, "loss": 0.488037109375, "step": 132 }, { "epoch": 2.509433962264151, "grad_norm": 0.021639952436089516, "learning_rate": 1.7687167841951734e-05, "loss": 0.377105712890625, "step": 133 }, { "epoch": 2.5283018867924527, "grad_norm": 0.025735825300216675, "learning_rate": 1.7143591022596845e-05, "loss": 0.56768798828125, "step": 134 }, { "epoch": 2.547169811320755, "grad_norm": 0.015821518376469612, "learning_rate": 1.661828466895836e-05, "loss": 0.18328857421875, "step": 135 }, { "epoch": 2.5660377358490565, "grad_norm": 0.026461446657776833, "learning_rate": 1.6111502307241837e-05, "loss": 0.615020751953125, "step": 136 }, { "epoch": 2.5849056603773586, "grad_norm": 0.021281061694025993, "learning_rate": 1.5623488523503256e-05, "loss": 0.4334869384765625, "step": 137 }, { "epoch": 2.6037735849056602, "grad_norm": 0.024843210354447365, "learning_rate": 1.515447884560556e-05, "loss": 0.54547119140625, "step": 138 }, { "epoch": 2.6226415094339623, "grad_norm": 0.029024476185441017, "learning_rate": 1.47046996295469e-05, "loss": 0.67083740234375, "step": 139 }, { "epoch": 2.641509433962264, "grad_norm": 0.02433478645980358, "learning_rate": 1.4274367950215495e-05, "loss": 0.37200927734375, "step": 140 }, { "epoch": 2.660377358490566, "grad_norm": 0.02773123048245907, "learning_rate": 1.3863691496623755e-05, "loss": 0.770782470703125, "step": 141 }, { "epoch": 2.6792452830188678, "grad_norm": 0.023714495822787285, "learning_rate": 1.3472868471672284e-05, "loss": 0.52044677734375, "step": 142 }, { "epoch": 2.69811320754717, "grad_norm": 0.02553577907383442, "learning_rate": 1.3102087496492127e-05, "loss": 0.46014404296875, "step": 143 }, { "epoch": 2.7169811320754715, "grad_norm": 0.024819141253829002, "learning_rate": 1.2751527519411405e-05, "loss": 0.5006103515625, "step": 144 }, { "epoch": 2.7358490566037736, "grad_norm": 0.024170102551579475, "learning_rate": 1.2421357729590315e-05, "loss": 0.56585693359375, "step": 145 }, { "epoch": 2.7547169811320753, "grad_norm": 0.021928368136286736, "learning_rate": 1.2111737475366126e-05, "loss": 0.39080810546875, "step": 146 }, { "epoch": 2.7735849056603774, "grad_norm": 0.0276940930634737, "learning_rate": 1.1822816187347623e-05, "loss": 0.7254638671875, "step": 147 }, { "epoch": 2.7924528301886795, "grad_norm": 0.028834933415055275, "learning_rate": 1.155473330629609e-05, "loss": 0.7357177734375, "step": 148 }, { "epoch": 2.811320754716981, "grad_norm": 0.02765583246946335, "learning_rate": 1.130761821582766e-05, "loss": 0.6878662109375, "step": 149 }, { "epoch": 2.830188679245283, "grad_norm": 0.018916428089141846, "learning_rate": 1.1081590179969499e-05, "loss": 0.31195068359375, "step": 150 }, { "epoch": 2.849056603773585, "grad_norm": 0.02231622487306595, "learning_rate": 1.087675828559994e-05, "loss": 0.45281982421875, "step": 151 }, { "epoch": 2.867924528301887, "grad_norm": 0.023466696962714195, "learning_rate": 1.0693221389800372e-05, "loss": 0.47271728515625, "step": 152 }, { "epoch": 2.8867924528301887, "grad_norm": 0.028103815391659737, "learning_rate": 1.0531068072144323e-05, "loss": 0.76141357421875, "step": 153 }, { "epoch": 2.9056603773584904, "grad_norm": 0.019869353622198105, "learning_rate": 1.039037659194669e-05, "loss": 0.311370849609375, "step": 154 }, { "epoch": 2.9245283018867925, "grad_norm": 0.027084778994321823, "learning_rate": 1.0271214850493804e-05, "loss": 0.651123046875, "step": 155 }, { "epoch": 2.9433962264150946, "grad_norm": 0.021756336092948914, "learning_rate": 1.017364035827255e-05, "loss": 0.45587158203125, "step": 156 }, { "epoch": 2.9622641509433962, "grad_norm": 0.029050158336758614, "learning_rate": 1.0097700207214337e-05, "loss": 0.78509521484375, "step": 157 }, { "epoch": 2.981132075471698, "grad_norm": 0.02259492501616478, "learning_rate": 1.0043431047967333e-05, "loss": 0.326934814453125, "step": 158 }, { "epoch": 3.0, "grad_norm": 0.02022467367351055, "learning_rate": 1.0010859072207936e-05, "loss": 0.236328125, "step": 159 }, { "epoch": 3.0, "eval_loss": 0.682373046875, "eval_runtime": 5.4116, "eval_samples_per_second": 0.554, "eval_steps_per_second": 0.185, "step": 159 } ], "logging_steps": 1.0, "max_steps": 159, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.382086886631565e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }