AgroVeritas-Scout-17B / trainer_state.json
MarianaCodebase's picture
Add files using upload-large-folder tool
612f22e verified
Raw
History Blame Contribute Delete
30.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 31,
"global_step": 159,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.018867924528301886,
"grad_norm": 0.9160448908805847,
"learning_rate": 0.0,
"loss": 2.72265625,
"step": 1
},
{
"epoch": 0.03773584905660377,
"grad_norm": 0.5443944334983826,
"learning_rate": 6.25e-06,
"loss": 2.095703125,
"step": 2
},
{
"epoch": 0.05660377358490566,
"grad_norm": 0.7521076798439026,
"learning_rate": 1.25e-05,
"loss": 2.4833984375,
"step": 3
},
{
"epoch": 0.07547169811320754,
"grad_norm": 0.4434555470943451,
"learning_rate": 1.8750000000000002e-05,
"loss": 1.9140625,
"step": 4
},
{
"epoch": 0.09433962264150944,
"grad_norm": 0.397516667842865,
"learning_rate": 2.5e-05,
"loss": 1.791748046875,
"step": 5
},
{
"epoch": 0.11320754716981132,
"grad_norm": 0.36063775420188904,
"learning_rate": 3.125e-05,
"loss": 1.845703125,
"step": 6
},
{
"epoch": 0.1320754716981132,
"grad_norm": 0.29012879729270935,
"learning_rate": 3.7500000000000003e-05,
"loss": 2.0087890625,
"step": 7
},
{
"epoch": 0.1509433962264151,
"grad_norm": 0.23380061984062195,
"learning_rate": 4.375e-05,
"loss": 1.912109375,
"step": 8
},
{
"epoch": 0.16981132075471697,
"grad_norm": 0.26473182439804077,
"learning_rate": 5e-05,
"loss": 1.9580078125,
"step": 9
},
{
"epoch": 0.18867924528301888,
"grad_norm": 0.2436726838350296,
"learning_rate": 5.6250000000000005e-05,
"loss": 1.8037109375,
"step": 10
},
{
"epoch": 0.20754716981132076,
"grad_norm": 0.17534290254116058,
"learning_rate": 6.25e-05,
"loss": 1.513671875,
"step": 11
},
{
"epoch": 0.22641509433962265,
"grad_norm": 0.31353089213371277,
"learning_rate": 6.875e-05,
"loss": 1.74609375,
"step": 12
},
{
"epoch": 0.24528301886792453,
"grad_norm": 0.1890019029378891,
"learning_rate": 7.500000000000001e-05,
"loss": 1.478515625,
"step": 13
},
{
"epoch": 0.2641509433962264,
"grad_norm": 0.2181335985660553,
"learning_rate": 8.125000000000001e-05,
"loss": 1.439453125,
"step": 14
},
{
"epoch": 0.2830188679245283,
"grad_norm": 0.1583699882030487,
"learning_rate": 8.75e-05,
"loss": 1.345703125,
"step": 15
},
{
"epoch": 0.3018867924528302,
"grad_norm": 0.39862334728240967,
"learning_rate": 9.375e-05,
"loss": 1.30078125,
"step": 16
},
{
"epoch": 0.32075471698113206,
"grad_norm": 0.4889472723007202,
"learning_rate": 0.0001,
"loss": 1.020751953125,
"step": 17
},
{
"epoch": 0.33962264150943394,
"grad_norm": 0.22474290430545807,
"learning_rate": 9.998914092779207e-05,
"loss": 1.10888671875,
"step": 18
},
{
"epoch": 0.3584905660377358,
"grad_norm": 0.21462957561016083,
"learning_rate": 9.995656895203267e-05,
"loss": 1.16650390625,
"step": 19
},
{
"epoch": 0.37735849056603776,
"grad_norm": 0.2226303219795227,
"learning_rate": 9.990229979278567e-05,
"loss": 1.04833984375,
"step": 20
},
{
"epoch": 0.39622641509433965,
"grad_norm": 0.19752401113510132,
"learning_rate": 9.982635964172747e-05,
"loss": 1.020751953125,
"step": 21
},
{
"epoch": 0.41509433962264153,
"grad_norm": 0.14107196033000946,
"learning_rate": 9.972878514950619e-05,
"loss": 0.99072265625,
"step": 22
},
{
"epoch": 0.4339622641509434,
"grad_norm": 0.14339610934257507,
"learning_rate": 9.960962340805332e-05,
"loss": 0.9814453125,
"step": 23
},
{
"epoch": 0.4528301886792453,
"grad_norm": 0.11852391809225082,
"learning_rate": 9.946893192785568e-05,
"loss": 1.03125,
"step": 24
},
{
"epoch": 0.4716981132075472,
"grad_norm": 0.12675724923610687,
"learning_rate": 9.930677861019963e-05,
"loss": 0.8095703125,
"step": 25
},
{
"epoch": 0.49056603773584906,
"grad_norm": 0.13236619532108307,
"learning_rate": 9.912324171440008e-05,
"loss": 0.66748046875,
"step": 26
},
{
"epoch": 0.5094339622641509,
"grad_norm": 0.11803070455789566,
"learning_rate": 9.89184098200305e-05,
"loss": 0.5257568359375,
"step": 27
},
{
"epoch": 0.5283018867924528,
"grad_norm": 0.14111293852329254,
"learning_rate": 9.869238178417235e-05,
"loss": 0.68310546875,
"step": 28
},
{
"epoch": 0.5471698113207547,
"grad_norm": 0.23157398402690887,
"learning_rate": 9.844526669370392e-05,
"loss": 0.3009033203125,
"step": 29
},
{
"epoch": 0.5660377358490566,
"grad_norm": 0.10609235614538193,
"learning_rate": 9.81771838126524e-05,
"loss": 0.71923828125,
"step": 30
},
{
"epoch": 0.5849056603773585,
"grad_norm": 0.08503806591033936,
"learning_rate": 9.788826252463388e-05,
"loss": 0.536865234375,
"step": 31
},
{
"epoch": 0.6037735849056604,
"grad_norm": 0.07262135297060013,
"learning_rate": 9.757864227040969e-05,
"loss": 0.64617919921875,
"step": 32
},
{
"epoch": 0.6226415094339622,
"grad_norm": 0.047836314886808395,
"learning_rate": 9.724847248058859e-05,
"loss": 0.76177978515625,
"step": 33
},
{
"epoch": 0.6415094339622641,
"grad_norm": 0.09082711488008499,
"learning_rate": 9.689791250350787e-05,
"loss": 0.4765625,
"step": 34
},
{
"epoch": 0.660377358490566,
"grad_norm": 0.04307923838496208,
"learning_rate": 9.652713152832772e-05,
"loss": 0.85736083984375,
"step": 35
},
{
"epoch": 0.660377358490566,
"eval_loss": 0.756591796875,
"eval_runtime": 5.4394,
"eval_samples_per_second": 0.552,
"eval_steps_per_second": 0.184,
"step": 35
},
{
"epoch": 0.6792452830188679,
"grad_norm": 0.06730978190898895,
"learning_rate": 9.613630850337626e-05,
"loss": 0.605224609375,
"step": 36
},
{
"epoch": 0.6981132075471698,
"grad_norm": 0.054134998470544815,
"learning_rate": 9.572563204978451e-05,
"loss": 0.529541015625,
"step": 37
},
{
"epoch": 0.7169811320754716,
"grad_norm": 0.04065776243805885,
"learning_rate": 9.529530037045311e-05,
"loss": 0.5693359375,
"step": 38
},
{
"epoch": 0.7358490566037735,
"grad_norm": 0.03646336495876312,
"learning_rate": 9.484552115439445e-05,
"loss": 0.63250732421875,
"step": 39
},
{
"epoch": 0.7547169811320755,
"grad_norm": 0.05910707637667656,
"learning_rate": 9.437651147649675e-05,
"loss": 0.4556884765625,
"step": 40
},
{
"epoch": 0.7735849056603774,
"grad_norm": 0.03508642688393593,
"learning_rate": 9.388849769275819e-05,
"loss": 0.79693603515625,
"step": 41
},
{
"epoch": 0.7924528301886793,
"grad_norm": 0.03845144808292389,
"learning_rate": 9.338171533104165e-05,
"loss": 0.80572509765625,
"step": 42
},
{
"epoch": 0.8113207547169812,
"grad_norm": 0.03844299539923668,
"learning_rate": 9.285640897740315e-05,
"loss": 0.7535400390625,
"step": 43
},
{
"epoch": 0.8301886792452831,
"grad_norm": 0.04553592577576637,
"learning_rate": 9.231283215804827e-05,
"loss": 0.348114013671875,
"step": 44
},
{
"epoch": 0.8490566037735849,
"grad_norm": 0.03860464319586754,
"learning_rate": 9.175124721697398e-05,
"loss": 0.50250244140625,
"step": 45
},
{
"epoch": 0.8679245283018868,
"grad_norm": 0.040941134095191956,
"learning_rate": 9.117192518935477e-05,
"loss": 0.51824951171875,
"step": 46
},
{
"epoch": 0.8867924528301887,
"grad_norm": 0.036735646426677704,
"learning_rate": 9.057514567073416e-05,
"loss": 0.82611083984375,
"step": 47
},
{
"epoch": 0.9056603773584906,
"grad_norm": 0.048354849219322205,
"learning_rate": 8.996119668208483e-05,
"loss": 0.34613037109375,
"step": 48
},
{
"epoch": 0.9245283018867925,
"grad_norm": 0.03629879280924797,
"learning_rate": 8.933037453080231e-05,
"loss": 0.7056884765625,
"step": 49
},
{
"epoch": 0.9433962264150944,
"grad_norm": 0.03945612534880638,
"learning_rate": 8.868298366769954e-05,
"loss": 0.4949951171875,
"step": 50
},
{
"epoch": 0.9622641509433962,
"grad_norm": 0.03107060305774212,
"learning_rate": 8.801933654007119e-05,
"loss": 0.84393310546875,
"step": 51
},
{
"epoch": 0.9811320754716981,
"grad_norm": 0.03779706358909607,
"learning_rate": 8.733975344089852e-05,
"loss": 0.355377197265625,
"step": 52
},
{
"epoch": 1.0,
"grad_norm": 0.03321205452084541,
"learning_rate": 8.6644562354268e-05,
"loss": 0.262298583984375,
"step": 53
},
{
"epoch": 1.0188679245283019,
"grad_norm": 0.03069538250565529,
"learning_rate": 8.593409879707777e-05,
"loss": 0.30084228515625,
"step": 54
},
{
"epoch": 1.0377358490566038,
"grad_norm": 0.03414987400174141,
"learning_rate": 8.520870565710866e-05,
"loss": 0.8505859375,
"step": 55
},
{
"epoch": 1.0566037735849056,
"grad_norm": 0.02888660319149494,
"learning_rate": 8.446873302753784e-05,
"loss": 0.482421875,
"step": 56
},
{
"epoch": 1.0754716981132075,
"grad_norm": 0.03213921934366226,
"learning_rate": 8.371453803797488e-05,
"loss": 0.8316650390625,
"step": 57
},
{
"epoch": 1.0943396226415094,
"grad_norm": 0.022419078275561333,
"learning_rate": 8.294648468210209e-05,
"loss": 0.598419189453125,
"step": 58
},
{
"epoch": 1.1132075471698113,
"grad_norm": 0.021831678226590157,
"learning_rate": 8.216494364200169e-05,
"loss": 0.328033447265625,
"step": 59
},
{
"epoch": 1.1320754716981132,
"grad_norm": 0.025370784103870392,
"learning_rate": 8.137029210925539e-05,
"loss": 0.6046142578125,
"step": 60
},
{
"epoch": 1.150943396226415,
"grad_norm": 0.02519148774445057,
"learning_rate": 8.056291360290201e-05,
"loss": 0.5687103271484375,
"step": 61
},
{
"epoch": 1.169811320754717,
"grad_norm": 0.022458959370851517,
"learning_rate": 7.974319778434157e-05,
"loss": 0.39935302734375,
"step": 62
},
{
"epoch": 1.1886792452830188,
"grad_norm": 0.052403755486011505,
"learning_rate": 7.891154026927469e-05,
"loss": 0.47015380859375,
"step": 63
},
{
"epoch": 1.2075471698113207,
"grad_norm": 0.02445453405380249,
"learning_rate": 7.806834243676837e-05,
"loss": 0.777740478515625,
"step": 64
},
{
"epoch": 1.2264150943396226,
"grad_norm": 0.02027270942926407,
"learning_rate": 7.721401123554034e-05,
"loss": 0.457611083984375,
"step": 65
},
{
"epoch": 1.2452830188679245,
"grad_norm": 0.023989953100681305,
"learning_rate": 7.634895898755521e-05,
"loss": 0.716796875,
"step": 66
},
{
"epoch": 1.2452830188679245,
"eval_loss": 0.7044677734375,
"eval_runtime": 5.43,
"eval_samples_per_second": 0.552,
"eval_steps_per_second": 0.184,
"step": 66
},
{
"epoch": 1.2641509433962264,
"grad_norm": 0.024166857823729515,
"learning_rate": 7.547360318902743e-05,
"loss": 0.62408447265625,
"step": 67
},
{
"epoch": 1.2830188679245282,
"grad_norm": 0.028676064684987068,
"learning_rate": 7.458836630892693e-05,
"loss": 0.906494140625,
"step": 68
},
{
"epoch": 1.3018867924528301,
"grad_norm": 0.020518383011221886,
"learning_rate": 7.369367558508489e-05,
"loss": 0.30908203125,
"step": 69
},
{
"epoch": 1.320754716981132,
"grad_norm": 0.11661913990974426,
"learning_rate": 7.278996281799797e-05,
"loss": 0.507965087890625,
"step": 70
},
{
"epoch": 1.3396226415094339,
"grad_norm": 0.02599608711898327,
"learning_rate": 7.18776641624303e-05,
"loss": 0.64666748046875,
"step": 71
},
{
"epoch": 1.3584905660377358,
"grad_norm": 0.028015300631523132,
"learning_rate": 7.095721991691411e-05,
"loss": 0.7392578125,
"step": 72
},
{
"epoch": 1.3773584905660377,
"grad_norm": 0.024578798562288284,
"learning_rate": 7.002907431125057e-05,
"loss": 0.6336669921875,
"step": 73
},
{
"epoch": 1.3962264150943398,
"grad_norm": 0.02427557297050953,
"learning_rate": 6.909367529211306e-05,
"loss": 0.6378173828125,
"step": 74
},
{
"epoch": 1.4150943396226414,
"grad_norm": 0.02489621192216873,
"learning_rate": 6.815147430685678e-05,
"loss": 0.75396728515625,
"step": 75
},
{
"epoch": 1.4339622641509435,
"grad_norm": 0.026317507028579712,
"learning_rate": 6.720292608563877e-05,
"loss": 0.74066162109375,
"step": 76
},
{
"epoch": 1.4528301886792452,
"grad_norm": 0.026842059567570686,
"learning_rate": 6.624848842195356e-05,
"loss": 0.84844970703125,
"step": 77
},
{
"epoch": 1.4716981132075473,
"grad_norm": 0.02483026497066021,
"learning_rate": 6.528862195169039e-05,
"loss": 0.62548828125,
"step": 78
},
{
"epoch": 1.490566037735849,
"grad_norm": 0.02440921775996685,
"learning_rate": 6.43237899308186e-05,
"loss": 0.5023193359375,
"step": 79
},
{
"epoch": 1.509433962264151,
"grad_norm": 0.021304575726389885,
"learning_rate": 6.335445801180859e-05,
"loss": 0.38848876953125,
"step": 80
},
{
"epoch": 1.5283018867924527,
"grad_norm": 0.024867858737707138,
"learning_rate": 6.238109401889598e-05,
"loss": 0.58270263671875,
"step": 81
},
{
"epoch": 1.5471698113207548,
"grad_norm": 0.022254586219787598,
"learning_rate": 6.140416772229784e-05,
"loss": 0.18841552734375,
"step": 82
},
{
"epoch": 1.5660377358490565,
"grad_norm": 0.023492569103837013,
"learning_rate": 6.042415061148954e-05,
"loss": 0.6334228515625,
"step": 83
},
{
"epoch": 1.5849056603773586,
"grad_norm": 0.019843759015202522,
"learning_rate": 5.944151566765205e-05,
"loss": 0.4464263916015625,
"step": 84
},
{
"epoch": 1.6037735849056602,
"grad_norm": 0.026993080973625183,
"learning_rate": 5.845673713539911e-05,
"loss": 0.560821533203125,
"step": 85
},
{
"epoch": 1.6226415094339623,
"grad_norm": 0.025686046108603477,
"learning_rate": 5.747029029389475e-05,
"loss": 0.6922607421875,
"step": 86
},
{
"epoch": 1.641509433962264,
"grad_norm": 0.02275293879210949,
"learning_rate": 5.6482651227471436e-05,
"loss": 0.38201904296875,
"step": 87
},
{
"epoch": 1.6603773584905661,
"grad_norm": 0.02670340985059738,
"learning_rate": 5.5494296595859764e-05,
"loss": 0.790191650390625,
"step": 88
},
{
"epoch": 1.6792452830188678,
"grad_norm": 0.02301422692835331,
"learning_rate": 5.450570340414024e-05,
"loss": 0.5341796875,
"step": 89
},
{
"epoch": 1.6981132075471699,
"grad_norm": 0.02345620095729828,
"learning_rate": 5.3517348772528574e-05,
"loss": 0.4722900390625,
"step": 90
},
{
"epoch": 1.7169811320754715,
"grad_norm": 0.024356689304113388,
"learning_rate": 5.252970970610527e-05,
"loss": 0.51446533203125,
"step": 91
},
{
"epoch": 1.7358490566037736,
"grad_norm": 0.02343251183629036,
"learning_rate": 5.154326286460089e-05,
"loss": 0.57806396484375,
"step": 92
},
{
"epoch": 1.7547169811320755,
"grad_norm": 0.01980278082191944,
"learning_rate": 5.055848433234796e-05,
"loss": 0.400054931640625,
"step": 93
},
{
"epoch": 1.7735849056603774,
"grad_norm": 0.02493242546916008,
"learning_rate": 4.9575849388510473e-05,
"loss": 0.74359130859375,
"step": 94
},
{
"epoch": 1.7924528301886793,
"grad_norm": 0.027098434045910835,
"learning_rate": 4.859583227770218e-05,
"loss": 0.75225830078125,
"step": 95
},
{
"epoch": 1.8113207547169812,
"grad_norm": 0.02704058215022087,
"learning_rate": 4.761890598110403e-05,
"loss": 0.704345703125,
"step": 96
},
{
"epoch": 1.830188679245283,
"grad_norm": 0.01941896229982376,
"learning_rate": 4.664554198819141e-05,
"loss": 0.317626953125,
"step": 97
},
{
"epoch": 1.830188679245283,
"eval_loss": 0.6927490234375,
"eval_runtime": 5.4223,
"eval_samples_per_second": 0.553,
"eval_steps_per_second": 0.184,
"step": 97
},
{
"epoch": 1.849056603773585,
"grad_norm": 0.02108132652938366,
"learning_rate": 4.5676210069181405e-05,
"loss": 0.46380615234375,
"step": 98
},
{
"epoch": 1.8679245283018868,
"grad_norm": 0.02277522347867489,
"learning_rate": 4.471137804830963e-05,
"loss": 0.482635498046875,
"step": 99
},
{
"epoch": 1.8867924528301887,
"grad_norm": 0.02586280182003975,
"learning_rate": 4.375151157804645e-05,
"loss": 0.77655029296875,
"step": 100
},
{
"epoch": 1.9056603773584906,
"grad_norm": 0.020695367828011513,
"learning_rate": 4.279707391436124e-05,
"loss": 0.3177490234375,
"step": 101
},
{
"epoch": 1.9245283018867925,
"grad_norm": 0.026092447340488434,
"learning_rate": 4.1848525693143235e-05,
"loss": 0.6651611328125,
"step": 102
},
{
"epoch": 1.9433962264150944,
"grad_norm": 0.019947027787566185,
"learning_rate": 4.090632470788695e-05,
"loss": 0.46533203125,
"step": 103
},
{
"epoch": 1.9622641509433962,
"grad_norm": 0.02738369069993496,
"learning_rate": 3.997092568874944e-05,
"loss": 0.80084228515625,
"step": 104
},
{
"epoch": 1.9811320754716981,
"grad_norm": 0.019547849893569946,
"learning_rate": 3.904278008308589e-05,
"loss": 0.333221435546875,
"step": 105
},
{
"epoch": 2.0,
"grad_norm": 0.01958700828254223,
"learning_rate": 3.812233583756972e-05,
"loss": 0.24285888671875,
"step": 106
},
{
"epoch": 2.018867924528302,
"grad_norm": 0.020026640966534615,
"learning_rate": 3.721003718200204e-05,
"loss": 0.279296875,
"step": 107
},
{
"epoch": 2.0377358490566038,
"grad_norm": 0.027759267017245293,
"learning_rate": 3.630632441491512e-05,
"loss": 0.8104248046875,
"step": 108
},
{
"epoch": 2.056603773584906,
"grad_norm": 0.021983085200190544,
"learning_rate": 3.5411633691073096e-05,
"loss": 0.46087646484375,
"step": 109
},
{
"epoch": 2.0754716981132075,
"grad_norm": 0.029194500297307968,
"learning_rate": 3.4526396810972584e-05,
"loss": 0.79443359375,
"step": 110
},
{
"epoch": 2.0943396226415096,
"grad_norm": 0.022142434492707253,
"learning_rate": 3.3651041012444804e-05,
"loss": 0.569732666015625,
"step": 111
},
{
"epoch": 2.1132075471698113,
"grad_norm": 0.019784018397331238,
"learning_rate": 3.2785988764459664e-05,
"loss": 0.31280517578125,
"step": 112
},
{
"epoch": 2.1320754716981134,
"grad_norm": 0.025928346440196037,
"learning_rate": 3.193165756323165e-05,
"loss": 0.577880859375,
"step": 113
},
{
"epoch": 2.150943396226415,
"grad_norm": 0.02521391585469246,
"learning_rate": 3.1088459730725335e-05,
"loss": 0.54052734375,
"step": 114
},
{
"epoch": 2.169811320754717,
"grad_norm": 0.021982381120324135,
"learning_rate": 3.0256802215658437e-05,
"loss": 0.3807373046875,
"step": 115
},
{
"epoch": 2.188679245283019,
"grad_norm": 0.022596165537834167,
"learning_rate": 2.9437086397097995e-05,
"loss": 0.451141357421875,
"step": 116
},
{
"epoch": 2.207547169811321,
"grad_norm": 0.0256204754114151,
"learning_rate": 2.862970789074463e-05,
"loss": 0.746856689453125,
"step": 117
},
{
"epoch": 2.2264150943396226,
"grad_norm": 0.021772582083940506,
"learning_rate": 2.7835056357998323e-05,
"loss": 0.4388427734375,
"step": 118
},
{
"epoch": 2.2452830188679247,
"grad_norm": 0.025826886296272278,
"learning_rate": 2.7053515317897925e-05,
"loss": 0.6865234375,
"step": 119
},
{
"epoch": 2.2641509433962264,
"grad_norm": 0.025294864550232887,
"learning_rate": 2.6285461962025115e-05,
"loss": 0.601287841796875,
"step": 120
},
{
"epoch": 2.2830188679245285,
"grad_norm": 0.03068646416068077,
"learning_rate": 2.5531266972462177e-05,
"loss": 0.873291015625,
"step": 121
},
{
"epoch": 2.30188679245283,
"grad_norm": 0.021428707987070084,
"learning_rate": 2.479129434289134e-05,
"loss": 0.296875,
"step": 122
},
{
"epoch": 2.3207547169811322,
"grad_norm": 0.020753471180796623,
"learning_rate": 2.4065901202922232e-05,
"loss": 0.488677978515625,
"step": 123
},
{
"epoch": 2.339622641509434,
"grad_norm": 0.02610793523490429,
"learning_rate": 2.3355437645732004e-05,
"loss": 0.62261962890625,
"step": 124
},
{
"epoch": 2.358490566037736,
"grad_norm": 0.03154842555522919,
"learning_rate": 2.2660246559101505e-05,
"loss": 0.7137451171875,
"step": 125
},
{
"epoch": 2.3773584905660377,
"grad_norm": 0.025154979899525642,
"learning_rate": 2.1980663459928834e-05,
"loss": 0.6123046875,
"step": 126
},
{
"epoch": 2.3962264150943398,
"grad_norm": 0.026202384382486343,
"learning_rate": 2.1317016332300447e-05,
"loss": 0.614532470703125,
"step": 127
},
{
"epoch": 2.4150943396226414,
"grad_norm": 0.027304857969284058,
"learning_rate": 2.0669625469197693e-05,
"loss": 0.72918701171875,
"step": 128
},
{
"epoch": 2.4150943396226414,
"eval_loss": 0.685791015625,
"eval_runtime": 5.4318,
"eval_samples_per_second": 0.552,
"eval_steps_per_second": 0.184,
"step": 128
},
{
"epoch": 2.4339622641509435,
"grad_norm": 0.0265318863093853,
"learning_rate": 2.003880331791518e-05,
"loss": 0.718353271484375,
"step": 129
},
{
"epoch": 2.452830188679245,
"grad_norm": 0.027988294139504433,
"learning_rate": 1.9424854329265856e-05,
"loss": 0.81939697265625,
"step": 130
},
{
"epoch": 2.4716981132075473,
"grad_norm": 0.02585024945437908,
"learning_rate": 1.882807481064525e-05,
"loss": 0.60516357421875,
"step": 131
},
{
"epoch": 2.490566037735849,
"grad_norm": 0.024814441800117493,
"learning_rate": 1.824875278302603e-05,
"loss": 0.488037109375,
"step": 132
},
{
"epoch": 2.509433962264151,
"grad_norm": 0.021639952436089516,
"learning_rate": 1.7687167841951734e-05,
"loss": 0.377105712890625,
"step": 133
},
{
"epoch": 2.5283018867924527,
"grad_norm": 0.025735825300216675,
"learning_rate": 1.7143591022596845e-05,
"loss": 0.56768798828125,
"step": 134
},
{
"epoch": 2.547169811320755,
"grad_norm": 0.015821518376469612,
"learning_rate": 1.661828466895836e-05,
"loss": 0.18328857421875,
"step": 135
},
{
"epoch": 2.5660377358490565,
"grad_norm": 0.026461446657776833,
"learning_rate": 1.6111502307241837e-05,
"loss": 0.615020751953125,
"step": 136
},
{
"epoch": 2.5849056603773586,
"grad_norm": 0.021281061694025993,
"learning_rate": 1.5623488523503256e-05,
"loss": 0.4334869384765625,
"step": 137
},
{
"epoch": 2.6037735849056602,
"grad_norm": 0.024843210354447365,
"learning_rate": 1.515447884560556e-05,
"loss": 0.54547119140625,
"step": 138
},
{
"epoch": 2.6226415094339623,
"grad_norm": 0.029024476185441017,
"learning_rate": 1.47046996295469e-05,
"loss": 0.67083740234375,
"step": 139
},
{
"epoch": 2.641509433962264,
"grad_norm": 0.02433478645980358,
"learning_rate": 1.4274367950215495e-05,
"loss": 0.37200927734375,
"step": 140
},
{
"epoch": 2.660377358490566,
"grad_norm": 0.02773123048245907,
"learning_rate": 1.3863691496623755e-05,
"loss": 0.770782470703125,
"step": 141
},
{
"epoch": 2.6792452830188678,
"grad_norm": 0.023714495822787285,
"learning_rate": 1.3472868471672284e-05,
"loss": 0.52044677734375,
"step": 142
},
{
"epoch": 2.69811320754717,
"grad_norm": 0.02553577907383442,
"learning_rate": 1.3102087496492127e-05,
"loss": 0.46014404296875,
"step": 143
},
{
"epoch": 2.7169811320754715,
"grad_norm": 0.024819141253829002,
"learning_rate": 1.2751527519411405e-05,
"loss": 0.5006103515625,
"step": 144
},
{
"epoch": 2.7358490566037736,
"grad_norm": 0.024170102551579475,
"learning_rate": 1.2421357729590315e-05,
"loss": 0.56585693359375,
"step": 145
},
{
"epoch": 2.7547169811320753,
"grad_norm": 0.021928368136286736,
"learning_rate": 1.2111737475366126e-05,
"loss": 0.39080810546875,
"step": 146
},
{
"epoch": 2.7735849056603774,
"grad_norm": 0.0276940930634737,
"learning_rate": 1.1822816187347623e-05,
"loss": 0.7254638671875,
"step": 147
},
{
"epoch": 2.7924528301886795,
"grad_norm": 0.028834933415055275,
"learning_rate": 1.155473330629609e-05,
"loss": 0.7357177734375,
"step": 148
},
{
"epoch": 2.811320754716981,
"grad_norm": 0.02765583246946335,
"learning_rate": 1.130761821582766e-05,
"loss": 0.6878662109375,
"step": 149
},
{
"epoch": 2.830188679245283,
"grad_norm": 0.018916428089141846,
"learning_rate": 1.1081590179969499e-05,
"loss": 0.31195068359375,
"step": 150
},
{
"epoch": 2.849056603773585,
"grad_norm": 0.02231622487306595,
"learning_rate": 1.087675828559994e-05,
"loss": 0.45281982421875,
"step": 151
},
{
"epoch": 2.867924528301887,
"grad_norm": 0.023466696962714195,
"learning_rate": 1.0693221389800372e-05,
"loss": 0.47271728515625,
"step": 152
},
{
"epoch": 2.8867924528301887,
"grad_norm": 0.028103815391659737,
"learning_rate": 1.0531068072144323e-05,
"loss": 0.76141357421875,
"step": 153
},
{
"epoch": 2.9056603773584904,
"grad_norm": 0.019869353622198105,
"learning_rate": 1.039037659194669e-05,
"loss": 0.311370849609375,
"step": 154
},
{
"epoch": 2.9245283018867925,
"grad_norm": 0.027084778994321823,
"learning_rate": 1.0271214850493804e-05,
"loss": 0.651123046875,
"step": 155
},
{
"epoch": 2.9433962264150946,
"grad_norm": 0.021756336092948914,
"learning_rate": 1.017364035827255e-05,
"loss": 0.45587158203125,
"step": 156
},
{
"epoch": 2.9622641509433962,
"grad_norm": 0.029050158336758614,
"learning_rate": 1.0097700207214337e-05,
"loss": 0.78509521484375,
"step": 157
},
{
"epoch": 2.981132075471698,
"grad_norm": 0.02259492501616478,
"learning_rate": 1.0043431047967333e-05,
"loss": 0.326934814453125,
"step": 158
},
{
"epoch": 3.0,
"grad_norm": 0.02022467367351055,
"learning_rate": 1.0010859072207936e-05,
"loss": 0.236328125,
"step": 159
},
{
"epoch": 3.0,
"eval_loss": 0.682373046875,
"eval_runtime": 5.4116,
"eval_samples_per_second": 0.554,
"eval_steps_per_second": 0.185,
"step": 159
}
],
"logging_steps": 1.0,
"max_steps": 159,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.382086886631565e+19,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}