adaption_agronomy_qa_pairs / trainer_state.json
RayNene's picture
Add 11 files
9253303 verified
Raw
History Blame Contribute Delete
26.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 28,
"global_step": 140,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.014285714285714285,
"grad_norm": 0.2301674634218216,
"learning_rate": 0.0,
"loss": 1.6484375,
"step": 1
},
{
"epoch": 0.02857142857142857,
"grad_norm": 0.22452111542224884,
"learning_rate": 1.4285714285714285e-05,
"loss": 1.6533203125,
"step": 2
},
{
"epoch": 0.04285714285714286,
"grad_norm": 0.20813249051570892,
"learning_rate": 2.857142857142857e-05,
"loss": 1.6640625,
"step": 3
},
{
"epoch": 0.05714285714285714,
"grad_norm": 0.1457422524690628,
"learning_rate": 4.2857142857142856e-05,
"loss": 1.5908203125,
"step": 4
},
{
"epoch": 0.07142857142857142,
"grad_norm": 0.10130278021097183,
"learning_rate": 5.714285714285714e-05,
"loss": 1.548828125,
"step": 5
},
{
"epoch": 0.08571428571428572,
"grad_norm": 0.13983897864818573,
"learning_rate": 7.142857142857143e-05,
"loss": 1.5234375,
"step": 6
},
{
"epoch": 0.1,
"grad_norm": 0.14988909661769867,
"learning_rate": 8.571428571428571e-05,
"loss": 1.4619140625,
"step": 7
},
{
"epoch": 0.11428571428571428,
"grad_norm": 0.12844695150852203,
"learning_rate": 0.0001,
"loss": 1.4208984375,
"step": 8
},
{
"epoch": 0.12857142857142856,
"grad_norm": 0.10155356675386429,
"learning_rate": 9.998744667454123e-05,
"loss": 1.4248046875,
"step": 9
},
{
"epoch": 0.14285714285714285,
"grad_norm": 0.07152616232633591,
"learning_rate": 9.994979370198627e-05,
"loss": 1.3486328125,
"step": 10
},
{
"epoch": 0.15714285714285714,
"grad_norm": 0.06663011759519577,
"learning_rate": 9.988706208989151e-05,
"loss": 1.306640625,
"step": 11
},
{
"epoch": 0.17142857142857143,
"grad_norm": 0.06677305698394775,
"learning_rate": 9.979928683782777e-05,
"loss": 1.302734375,
"step": 12
},
{
"epoch": 0.18571428571428572,
"grad_norm": 0.05471112206578255,
"learning_rate": 9.968651691785309e-05,
"loss": 1.2978515625,
"step": 13
},
{
"epoch": 0.2,
"grad_norm": 0.05604815483093262,
"learning_rate": 9.954881524719004e-05,
"loss": 1.2958984375,
"step": 14
},
{
"epoch": 0.21428571428571427,
"grad_norm": 0.06290843337774277,
"learning_rate": 9.938625865312251e-05,
"loss": 1.28515625,
"step": 15
},
{
"epoch": 0.22857142857142856,
"grad_norm": 0.05813497677445412,
"learning_rate": 9.91989378301319e-05,
"loss": 1.216796875,
"step": 16
},
{
"epoch": 0.24285714285714285,
"grad_norm": 0.057633932679891586,
"learning_rate": 9.898695728929623e-05,
"loss": 1.2666015625,
"step": 17
},
{
"epoch": 0.2571428571428571,
"grad_norm": 0.053865354508161545,
"learning_rate": 9.875043529998088e-05,
"loss": 1.25,
"step": 18
},
{
"epoch": 0.2714285714285714,
"grad_norm": 0.05344673618674278,
"learning_rate": 9.848950382385293e-05,
"loss": 1.248046875,
"step": 19
},
{
"epoch": 0.2857142857142857,
"grad_norm": 0.04980555549263954,
"learning_rate": 9.820430844125647e-05,
"loss": 1.21484375,
"step": 20
},
{
"epoch": 0.3,
"grad_norm": 0.05198637396097183,
"learning_rate": 9.789500826998962e-05,
"loss": 1.2265625,
"step": 21
},
{
"epoch": 0.3142857142857143,
"grad_norm": 0.051235176622867584,
"learning_rate": 9.756177587652856e-05,
"loss": 1.193359375,
"step": 22
},
{
"epoch": 0.32857142857142857,
"grad_norm": 0.05366426706314087,
"learning_rate": 9.720479717974835e-05,
"loss": 1.1884765625,
"step": 23
},
{
"epoch": 0.34285714285714286,
"grad_norm": 0.05358980968594551,
"learning_rate": 9.682427134719396e-05,
"loss": 1.1806640625,
"step": 24
},
{
"epoch": 0.35714285714285715,
"grad_norm": 0.05572328716516495,
"learning_rate": 9.642041068395971e-05,
"loss": 1.1748046875,
"step": 25
},
{
"epoch": 0.37142857142857144,
"grad_norm": 0.05449635162949562,
"learning_rate": 9.599344051423873e-05,
"loss": 1.134765625,
"step": 26
},
{
"epoch": 0.38571428571428573,
"grad_norm": 0.0521831288933754,
"learning_rate": 9.554359905560886e-05,
"loss": 1.15234375,
"step": 27
},
{
"epoch": 0.4,
"grad_norm": 0.04832952469587326,
"learning_rate": 9.507113728612501e-05,
"loss": 1.14013671875,
"step": 28
},
{
"epoch": 0.4,
"eval_loss": 1.12841796875,
"eval_runtime": 6.3919,
"eval_samples_per_second": 1.095,
"eval_steps_per_second": 0.156,
"step": 28
},
{
"epoch": 0.4142857142857143,
"grad_norm": 0.054382070899009705,
"learning_rate": 9.4576318804292e-05,
"loss": 1.1416015625,
"step": 29
},
{
"epoch": 0.42857142857142855,
"grad_norm": 0.056724973022937775,
"learning_rate": 9.405941968199635e-05,
"loss": 1.0859375,
"step": 30
},
{
"epoch": 0.44285714285714284,
"grad_norm": 0.052214112132787704,
"learning_rate": 9.35207283104785e-05,
"loss": 1.1142578125,
"step": 31
},
{
"epoch": 0.45714285714285713,
"grad_norm": 0.05902480706572533,
"learning_rate": 9.296054523943223e-05,
"loss": 1.12109375,
"step": 32
},
{
"epoch": 0.4714285714285714,
"grad_norm": 0.05499668046832085,
"learning_rate": 9.237918300932004e-05,
"loss": 1.05712890625,
"step": 33
},
{
"epoch": 0.4857142857142857,
"grad_norm": 0.04787338897585869,
"learning_rate": 9.177696597699902e-05,
"loss": 1.05419921875,
"step": 34
},
{
"epoch": 0.5,
"grad_norm": 0.050695084035396576,
"learning_rate": 9.115423013475376e-05,
"loss": 1.04150390625,
"step": 35
},
{
"epoch": 0.5142857142857142,
"grad_norm": 0.055649545043706894,
"learning_rate": 9.051132292283771e-05,
"loss": 1.08837890625,
"step": 36
},
{
"epoch": 0.5285714285714286,
"grad_norm": 0.05247028172016144,
"learning_rate": 8.984860303562737e-05,
"loss": 1.06787109375,
"step": 37
},
{
"epoch": 0.5428571428571428,
"grad_norm": 0.05999448150396347,
"learning_rate": 8.91664402214975e-05,
"loss": 1.09375,
"step": 38
},
{
"epoch": 0.5571428571428572,
"grad_norm": 0.053369153290987015,
"learning_rate": 8.846521507652904e-05,
"loss": 1.06494140625,
"step": 39
},
{
"epoch": 0.5714285714285714,
"grad_norm": 0.054364919662475586,
"learning_rate": 8.774531883216487e-05,
"loss": 1.0703125,
"step": 40
},
{
"epoch": 0.5857142857142857,
"grad_norm": 0.05390971899032593,
"learning_rate": 8.70071531369318e-05,
"loss": 0.9931640625,
"step": 41
},
{
"epoch": 0.6,
"grad_norm": 0.05540841072797775,
"learning_rate": 8.625112983235038e-05,
"loss": 1.05078125,
"step": 42
},
{
"epoch": 0.6142857142857143,
"grad_norm": 0.054859407246112823,
"learning_rate": 8.547767072315835e-05,
"loss": 1.0068359375,
"step": 43
},
{
"epoch": 0.6285714285714286,
"grad_norm": 0.0654584988951683,
"learning_rate": 8.468720734197464e-05,
"loss": 1.0673828125,
"step": 44
},
{
"epoch": 0.6428571428571429,
"grad_norm": 0.06306427717208862,
"learning_rate": 8.388018070853642e-05,
"loss": 1.03515625,
"step": 45
},
{
"epoch": 0.6571428571428571,
"grad_norm": 0.05659706890583038,
"learning_rate": 8.305704108364301e-05,
"loss": 1.00830078125,
"step": 46
},
{
"epoch": 0.6714285714285714,
"grad_norm": 0.058154042810201645,
"learning_rate": 8.22182477179437e-05,
"loss": 1.04150390625,
"step": 47
},
{
"epoch": 0.6857142857142857,
"grad_norm": 0.05709483101963997,
"learning_rate": 8.136426859571013e-05,
"loss": 1.02001953125,
"step": 48
},
{
"epoch": 0.7,
"grad_norm": 0.05433674529194832,
"learning_rate": 8.049558017373592e-05,
"loss": 1.01123046875,
"step": 49
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.0570937804877758,
"learning_rate": 7.961266711550922e-05,
"loss": 1.00830078125,
"step": 50
},
{
"epoch": 0.7285714285714285,
"grad_norm": 0.059223074465990067,
"learning_rate": 7.871602202080656e-05,
"loss": 1.02099609375,
"step": 51
},
{
"epoch": 0.7428571428571429,
"grad_norm": 0.06066058203577995,
"learning_rate": 7.78061451508588e-05,
"loss": 0.99365234375,
"step": 52
},
{
"epoch": 0.7571428571428571,
"grad_norm": 0.05862792953848839,
"learning_rate": 7.688354414924266e-05,
"loss": 0.939453125,
"step": 53
},
{
"epoch": 0.7714285714285715,
"grad_norm": 0.06388234347105026,
"learning_rate": 7.594873375865335e-05,
"loss": 0.966796875,
"step": 54
},
{
"epoch": 0.7857142857142857,
"grad_norm": 0.05540330708026886,
"learning_rate": 7.500223553371642e-05,
"loss": 0.93212890625,
"step": 55
},
{
"epoch": 0.8,
"grad_norm": 0.0587574727833271,
"learning_rate": 7.404457754999913e-05,
"loss": 0.99365234375,
"step": 56
},
{
"epoch": 0.8,
"eval_loss": 0.98876953125,
"eval_runtime": 6.3799,
"eval_samples_per_second": 1.097,
"eval_steps_per_second": 0.157,
"step": 56
},
{
"epoch": 0.8142857142857143,
"grad_norm": 0.058628544211387634,
"learning_rate": 7.307629410938363e-05,
"loss": 0.978515625,
"step": 57
},
{
"epoch": 0.8285714285714286,
"grad_norm": 0.06110001727938652,
"learning_rate": 7.20979254419662e-05,
"loss": 0.9921875,
"step": 58
},
{
"epoch": 0.8428571428571429,
"grad_norm": 0.059112727642059326,
"learning_rate": 7.11100174046491e-05,
"loss": 0.95458984375,
"step": 59
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.055121202021837234,
"learning_rate": 7.011312117659304e-05,
"loss": 0.93603515625,
"step": 60
},
{
"epoch": 0.8714285714285714,
"grad_norm": 0.06230216100811958,
"learning_rate": 6.910779295170017e-05,
"loss": 0.95703125,
"step": 61
},
{
"epoch": 0.8857142857142857,
"grad_norm": 0.05832396820187569,
"learning_rate": 6.80945936282994e-05,
"loss": 0.94970703125,
"step": 62
},
{
"epoch": 0.9,
"grad_norm": 0.05860510468482971,
"learning_rate": 6.707408849620682e-05,
"loss": 0.9365234375,
"step": 63
},
{
"epoch": 0.9142857142857143,
"grad_norm": 0.06364964693784714,
"learning_rate": 6.604684692133597e-05,
"loss": 0.978515625,
"step": 64
},
{
"epoch": 0.9285714285714286,
"grad_norm": 0.0612567700445652,
"learning_rate": 6.501344202803414e-05,
"loss": 0.953125,
"step": 65
},
{
"epoch": 0.9428571428571428,
"grad_norm": 0.05668887495994568,
"learning_rate": 6.397445037932167e-05,
"loss": 0.9521484375,
"step": 66
},
{
"epoch": 0.9571428571428572,
"grad_norm": 0.06072384864091873,
"learning_rate": 6.293045165521248e-05,
"loss": 0.93701171875,
"step": 67
},
{
"epoch": 0.9714285714285714,
"grad_norm": 0.06082940474152565,
"learning_rate": 6.188202832929608e-05,
"loss": 0.96044921875,
"step": 68
},
{
"epoch": 0.9857142857142858,
"grad_norm": 0.06168084964156151,
"learning_rate": 6.082976534376037e-05,
"loss": 0.94384765625,
"step": 69
},
{
"epoch": 1.0,
"grad_norm": 0.059236977249383926,
"learning_rate": 5.977424978303762e-05,
"loss": 0.919921875,
"step": 70
},
{
"epoch": 1.0142857142857142,
"grad_norm": 0.058729320764541626,
"learning_rate": 5.8716070546254966e-05,
"loss": 0.9013671875,
"step": 71
},
{
"epoch": 1.0285714285714285,
"grad_norm": 0.061870310455560684,
"learning_rate": 5.765581801867254e-05,
"loss": 0.92138671875,
"step": 72
},
{
"epoch": 1.042857142857143,
"grad_norm": 0.06547029316425323,
"learning_rate": 5.659408374229244e-05,
"loss": 0.91748046875,
"step": 73
},
{
"epoch": 1.0571428571428572,
"grad_norm": 0.058774255216121674,
"learning_rate": 5.553146008582232e-05,
"loss": 0.927734375,
"step": 74
},
{
"epoch": 1.0714285714285714,
"grad_norm": 0.06608563661575317,
"learning_rate": 5.4468539914177705e-05,
"loss": 0.92236328125,
"step": 75
},
{
"epoch": 1.0857142857142856,
"grad_norm": 0.065040722489357,
"learning_rate": 5.340591625770758e-05,
"loss": 0.91796875,
"step": 76
},
{
"epoch": 1.1,
"grad_norm": 0.06403814256191254,
"learning_rate": 5.234418198132748e-05,
"loss": 0.89501953125,
"step": 77
},
{
"epoch": 1.1142857142857143,
"grad_norm": 0.06091045215725899,
"learning_rate": 5.128392945374505e-05,
"loss": 0.8935546875,
"step": 78
},
{
"epoch": 1.1285714285714286,
"grad_norm": 0.06854798644781113,
"learning_rate": 5.02257502169624e-05,
"loss": 0.9140625,
"step": 79
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.06155310198664665,
"learning_rate": 4.9170234656239655e-05,
"loss": 0.88818359375,
"step": 80
},
{
"epoch": 1.157142857142857,
"grad_norm": 0.06304619461297989,
"learning_rate": 4.811797167070393e-05,
"loss": 0.89111328125,
"step": 81
},
{
"epoch": 1.1714285714285715,
"grad_norm": 0.06259562075138092,
"learning_rate": 4.706954834478753e-05,
"loss": 0.875,
"step": 82
},
{
"epoch": 1.1857142857142857,
"grad_norm": 0.05829339101910591,
"learning_rate": 4.6025549620678357e-05,
"loss": 0.9091796875,
"step": 83
},
{
"epoch": 1.2,
"grad_norm": 0.06398149579763412,
"learning_rate": 4.498655797196586e-05,
"loss": 0.8994140625,
"step": 84
},
{
"epoch": 1.2,
"eval_loss": 0.9287109375,
"eval_runtime": 6.377,
"eval_samples_per_second": 1.098,
"eval_steps_per_second": 0.157,
"step": 84
},
{
"epoch": 1.2142857142857142,
"grad_norm": 0.06233156844973564,
"learning_rate": 4.395315307866405e-05,
"loss": 0.9013671875,
"step": 85
},
{
"epoch": 1.2285714285714286,
"grad_norm": 0.06106571480631828,
"learning_rate": 4.2925911503793207e-05,
"loss": 0.85302734375,
"step": 86
},
{
"epoch": 1.2428571428571429,
"grad_norm": 0.061428941786289215,
"learning_rate": 4.1905406371700605e-05,
"loss": 0.89208984375,
"step": 87
},
{
"epoch": 1.2571428571428571,
"grad_norm": 0.06285811215639114,
"learning_rate": 4.089220704829986e-05,
"loss": 0.89697265625,
"step": 88
},
{
"epoch": 1.2714285714285714,
"grad_norm": 0.0686308816075325,
"learning_rate": 3.988687882340698e-05,
"loss": 0.89111328125,
"step": 89
},
{
"epoch": 1.2857142857142856,
"grad_norm": 0.06331058591604233,
"learning_rate": 3.8889982595350916e-05,
"loss": 0.88134765625,
"step": 90
},
{
"epoch": 1.3,
"grad_norm": 0.06306147575378418,
"learning_rate": 3.790207455803381e-05,
"loss": 0.89013671875,
"step": 91
},
{
"epoch": 1.3142857142857143,
"grad_norm": 0.06359851360321045,
"learning_rate": 3.692370589061639e-05,
"loss": 0.86572265625,
"step": 92
},
{
"epoch": 1.3285714285714285,
"grad_norm": 0.061125222593545914,
"learning_rate": 3.595542245000089e-05,
"loss": 0.8876953125,
"step": 93
},
{
"epoch": 1.342857142857143,
"grad_norm": 0.06186739355325699,
"learning_rate": 3.499776446628361e-05,
"loss": 0.8818359375,
"step": 94
},
{
"epoch": 1.3571428571428572,
"grad_norm": 0.066498301923275,
"learning_rate": 3.405126624134666e-05,
"loss": 0.86962890625,
"step": 95
},
{
"epoch": 1.3714285714285714,
"grad_norm": 0.05984362214803696,
"learning_rate": 3.311645585075734e-05,
"loss": 0.85400390625,
"step": 96
},
{
"epoch": 1.3857142857142857,
"grad_norm": 0.0650252252817154,
"learning_rate": 3.21938548491412e-05,
"loss": 0.86767578125,
"step": 97
},
{
"epoch": 1.4,
"grad_norm": 0.06282398849725723,
"learning_rate": 3.1283977979193456e-05,
"loss": 0.8720703125,
"step": 98
},
{
"epoch": 1.4142857142857144,
"grad_norm": 0.06282205134630203,
"learning_rate": 3.0387332884490805e-05,
"loss": 0.875,
"step": 99
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.06260594725608826,
"learning_rate": 2.9504419826264113e-05,
"loss": 0.8330078125,
"step": 100
},
{
"epoch": 1.4428571428571428,
"grad_norm": 0.06598624587059021,
"learning_rate": 2.8635731404289895e-05,
"loss": 0.849609375,
"step": 101
},
{
"epoch": 1.457142857142857,
"grad_norm": 0.068242646753788,
"learning_rate": 2.7781752282056328e-05,
"loss": 0.857421875,
"step": 102
},
{
"epoch": 1.4714285714285715,
"grad_norm": 0.06488832831382751,
"learning_rate": 2.6942958916356998e-05,
"loss": 0.8115234375,
"step": 103
},
{
"epoch": 1.4857142857142858,
"grad_norm": 0.0600808784365654,
"learning_rate": 2.6119819291463592e-05,
"loss": 0.82177734375,
"step": 104
},
{
"epoch": 1.5,
"grad_norm": 0.06046265736222267,
"learning_rate": 2.531279265802538e-05,
"loss": 0.81640625,
"step": 105
},
{
"epoch": 1.5142857142857142,
"grad_norm": 0.06981690227985382,
"learning_rate": 2.4522329276841663e-05,
"loss": 0.8564453125,
"step": 106
},
{
"epoch": 1.5285714285714285,
"grad_norm": 0.06316579878330231,
"learning_rate": 2.3748870167649613e-05,
"loss": 0.841796875,
"step": 107
},
{
"epoch": 1.5428571428571427,
"grad_norm": 0.06674682348966599,
"learning_rate": 2.299284686306823e-05,
"loss": 0.86376953125,
"step": 108
},
{
"epoch": 1.5571428571428572,
"grad_norm": 0.06432048976421356,
"learning_rate": 2.2254681167835123e-05,
"loss": 0.84814453125,
"step": 109
},
{
"epoch": 1.5714285714285714,
"grad_norm": 0.06504345685243607,
"learning_rate": 2.1534784923470968e-05,
"loss": 0.85302734375,
"step": 110
},
{
"epoch": 1.5857142857142859,
"grad_norm": 0.06324882805347443,
"learning_rate": 2.083355977850252e-05,
"loss": 0.793212890625,
"step": 111
},
{
"epoch": 1.6,
"grad_norm": 0.06541915982961655,
"learning_rate": 2.0151396964372642e-05,
"loss": 0.84228515625,
"step": 112
},
{
"epoch": 1.6,
"eval_loss": 0.89697265625,
"eval_runtime": 6.3864,
"eval_samples_per_second": 1.096,
"eval_steps_per_second": 0.157,
"step": 112
},
{
"epoch": 1.6142857142857143,
"grad_norm": 0.06446194648742676,
"learning_rate": 1.9488677077162295e-05,
"loss": 0.8037109375,
"step": 113
},
{
"epoch": 1.6285714285714286,
"grad_norm": 0.07079339772462845,
"learning_rate": 1.8845769865246253e-05,
"loss": 0.84423828125,
"step": 114
},
{
"epoch": 1.6428571428571428,
"grad_norm": 0.06356216967105865,
"learning_rate": 1.822303402300099e-05,
"loss": 0.83642578125,
"step": 115
},
{
"epoch": 1.657142857142857,
"grad_norm": 0.06385171413421631,
"learning_rate": 1.7620816990679977e-05,
"loss": 0.81396484375,
"step": 116
},
{
"epoch": 1.6714285714285713,
"grad_norm": 0.06617320328950882,
"learning_rate": 1.703945476056778e-05,
"loss": 0.85107421875,
"step": 117
},
{
"epoch": 1.6857142857142857,
"grad_norm": 0.08020178228616714,
"learning_rate": 1.6479271689521503e-05,
"loss": 0.830078125,
"step": 118
},
{
"epoch": 1.7,
"grad_norm": 0.06245279684662819,
"learning_rate": 1.5940580318003663e-05,
"loss": 0.82861328125,
"step": 119
},
{
"epoch": 1.7142857142857144,
"grad_norm": 0.06454663723707199,
"learning_rate": 1.5423681195707997e-05,
"loss": 0.82763671875,
"step": 120
},
{
"epoch": 1.7285714285714286,
"grad_norm": 0.06728047877550125,
"learning_rate": 1.4928862713874994e-05,
"loss": 0.833984375,
"step": 121
},
{
"epoch": 1.7428571428571429,
"grad_norm": 0.06479737162590027,
"learning_rate": 1.4456400944391146e-05,
"loss": 0.81640625,
"step": 122
},
{
"epoch": 1.7571428571428571,
"grad_norm": 0.06522734463214874,
"learning_rate": 1.4006559485761281e-05,
"loss": 0.774658203125,
"step": 123
},
{
"epoch": 1.7714285714285714,
"grad_norm": 0.0664784386754036,
"learning_rate": 1.3579589316040298e-05,
"loss": 0.79248046875,
"step": 124
},
{
"epoch": 1.7857142857142856,
"grad_norm": 0.0612151101231575,
"learning_rate": 1.3175728652806046e-05,
"loss": 0.77099609375,
"step": 125
},
{
"epoch": 1.8,
"grad_norm": 0.06594721227884293,
"learning_rate": 1.2795202820251664e-05,
"loss": 0.8271484375,
"step": 126
},
{
"epoch": 1.8142857142857143,
"grad_norm": 0.06843268871307373,
"learning_rate": 1.2438224123471442e-05,
"loss": 0.814453125,
"step": 127
},
{
"epoch": 1.8285714285714287,
"grad_norm": 0.06743902713060379,
"learning_rate": 1.210499173001039e-05,
"loss": 0.83203125,
"step": 128
},
{
"epoch": 1.842857142857143,
"grad_norm": 0.06749514490365982,
"learning_rate": 1.1795691558743535e-05,
"loss": 0.7998046875,
"step": 129
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.07553337514400482,
"learning_rate": 1.1510496176147086e-05,
"loss": 0.7900390625,
"step": 130
},
{
"epoch": 1.8714285714285714,
"grad_norm": 0.06856156140565872,
"learning_rate": 1.1249564700019125e-05,
"loss": 0.79833984375,
"step": 131
},
{
"epoch": 1.8857142857142857,
"grad_norm": 0.06377129256725311,
"learning_rate": 1.1013042710703766e-05,
"loss": 0.80224609375,
"step": 132
},
{
"epoch": 1.9,
"grad_norm": 0.0656968355178833,
"learning_rate": 1.0801062169868106e-05,
"loss": 0.7890625,
"step": 133
},
{
"epoch": 1.9142857142857141,
"grad_norm": 0.07750661671161652,
"learning_rate": 1.0613741346877497e-05,
"loss": 0.8212890625,
"step": 134
},
{
"epoch": 1.9285714285714286,
"grad_norm": 0.06959044188261032,
"learning_rate": 1.0451184752809978e-05,
"loss": 0.806640625,
"step": 135
},
{
"epoch": 1.9428571428571428,
"grad_norm": 0.0659778043627739,
"learning_rate": 1.031348308214692e-05,
"loss": 0.81494140625,
"step": 136
},
{
"epoch": 1.9571428571428573,
"grad_norm": 0.06762561202049255,
"learning_rate": 1.0200713162172245e-05,
"loss": 0.7978515625,
"step": 137
},
{
"epoch": 1.9714285714285715,
"grad_norm": 0.06678938865661621,
"learning_rate": 1.0112937910108495e-05,
"loss": 0.8232421875,
"step": 138
},
{
"epoch": 1.9857142857142858,
"grad_norm": 0.06764549016952515,
"learning_rate": 1.0050206298013732e-05,
"loss": 0.81005859375,
"step": 139
},
{
"epoch": 2.0,
"grad_norm": 0.07080282270908356,
"learning_rate": 1.0012553325458767e-05,
"loss": 0.7509765625,
"step": 140
},
{
"epoch": 2.0,
"eval_loss": 0.88427734375,
"eval_runtime": 6.376,
"eval_samples_per_second": 1.098,
"eval_steps_per_second": 0.157,
"step": 140
}
],
"logging_steps": 1.0,
"max_steps": 140,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1609016895637815e+19,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}