test-lora / trainer_state.json
pamohlyakov-work's picture
Upload 14 files
5a6db7a verified
Raw
History Blame Contribute Delete
25.9 kB
{
"best_global_step": 110,
"best_metric": 0.0009438548004254699,
"best_model_checkpoint": "./lora_adapter/checkpoint-110",
"epoch": 3.8177777777777777,
"eval_steps": 10,
"global_step": 110,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_loss": 5.712841987609863,
"eval_runtime": 5.5217,
"eval_samples_per_second": 9.055,
"eval_steps_per_second": 9.055,
"step": 0
},
{
"epoch": 0,
"eval_perplexity": 302.7302023645728,
"step": 0
},
{
"epoch": 0.035555555555555556,
"grad_norm": 0.3103635609149933,
"learning_rate": 0.0,
"loss": 5.682491779327393,
"step": 1
},
{
"epoch": 0.07111111111111111,
"grad_norm": 0.4182112216949463,
"learning_rate": 8.333333333333334e-06,
"loss": 6.0904059410095215,
"step": 2
},
{
"epoch": 0.10666666666666667,
"grad_norm": 0.403287798166275,
"learning_rate": 1.6666666666666667e-05,
"loss": 5.459848403930664,
"step": 3
},
{
"epoch": 0.14222222222222222,
"grad_norm": 0.4156350791454315,
"learning_rate": 2.5e-05,
"loss": 5.875328063964844,
"step": 4
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.35492172837257385,
"learning_rate": 3.3333333333333335e-05,
"loss": 5.3188605308532715,
"step": 5
},
{
"epoch": 0.21333333333333335,
"grad_norm": 0.3586452007293701,
"learning_rate": 4.166666666666667e-05,
"loss": 5.076211929321289,
"step": 6
},
{
"epoch": 0.24888888888888888,
"grad_norm": 0.40670934319496155,
"learning_rate": 5e-05,
"loss": 4.494481563568115,
"step": 7
},
{
"epoch": 0.28444444444444444,
"grad_norm": 0.4478435218334198,
"learning_rate": 5.833333333333334e-05,
"loss": 4.102505207061768,
"step": 8
},
{
"epoch": 0.32,
"grad_norm": 0.4579038619995117,
"learning_rate": 6.666666666666667e-05,
"loss": 3.379936695098877,
"step": 9
},
{
"epoch": 0.35555555555555557,
"grad_norm": 0.38791775703430176,
"learning_rate": 7.500000000000001e-05,
"loss": 2.952427387237549,
"step": 10
},
{
"epoch": 0.35555555555555557,
"eval_loss": 2.718632221221924,
"eval_runtime": 5.4982,
"eval_samples_per_second": 9.094,
"eval_steps_per_second": 9.094,
"step": 10
},
{
"epoch": 0.35555555555555557,
"eval_perplexity": 15.15957311568705,
"step": 10
},
{
"epoch": 0.39111111111111113,
"grad_norm": 0.7142107486724854,
"learning_rate": 8.333333333333334e-05,
"loss": 2.6527280807495117,
"step": 11
},
{
"epoch": 0.4266666666666667,
"grad_norm": 0.46958744525909424,
"learning_rate": 9.166666666666667e-05,
"loss": 2.0736618041992188,
"step": 12
},
{
"epoch": 0.4622222222222222,
"grad_norm": 0.46414491534233093,
"learning_rate": 0.0001,
"loss": 1.5400762557983398,
"step": 13
},
{
"epoch": 0.49777777777777776,
"grad_norm": 0.3608834445476532,
"learning_rate": 9.999490215047167e-05,
"loss": 1.2599258422851562,
"step": 14
},
{
"epoch": 0.5333333333333333,
"grad_norm": 0.3089125156402588,
"learning_rate": 9.997960964140947e-05,
"loss": 1.0378409624099731,
"step": 15
},
{
"epoch": 0.5688888888888889,
"grad_norm": 0.23846635222434998,
"learning_rate": 9.995412559116979e-05,
"loss": 0.683804452419281,
"step": 16
},
{
"epoch": 0.6044444444444445,
"grad_norm": 0.25005361437797546,
"learning_rate": 9.991845519630678e-05,
"loss": 0.6251506805419922,
"step": 17
},
{
"epoch": 0.64,
"grad_norm": 0.17282210290431976,
"learning_rate": 9.987260573051269e-05,
"loss": 0.40306615829467773,
"step": 18
},
{
"epoch": 0.6755555555555556,
"grad_norm": 0.14316385984420776,
"learning_rate": 9.981658654313457e-05,
"loss": 0.36748170852661133,
"step": 19
},
{
"epoch": 0.7111111111111111,
"grad_norm": 0.09027505666017532,
"learning_rate": 9.975040905726798e-05,
"loss": 0.3596840500831604,
"step": 20
},
{
"epoch": 0.7111111111111111,
"eval_loss": 0.34836798906326294,
"eval_runtime": 5.5169,
"eval_samples_per_second": 9.063,
"eval_steps_per_second": 9.063,
"step": 20
},
{
"epoch": 0.7111111111111111,
"eval_perplexity": 1.4167535036209495,
"step": 20
},
{
"epoch": 0.7466666666666667,
"grad_norm": 0.07985851913690567,
"learning_rate": 9.967408676742751e-05,
"loss": 0.36926567554473877,
"step": 21
},
{
"epoch": 0.7822222222222223,
"grad_norm": 0.06538072973489761,
"learning_rate": 9.958763523679514e-05,
"loss": 0.3178553879261017,
"step": 22
},
{
"epoch": 0.8177777777777778,
"grad_norm": 0.05077500641345978,
"learning_rate": 9.949107209404665e-05,
"loss": 0.19684894382953644,
"step": 23
},
{
"epoch": 0.8533333333333334,
"grad_norm": 0.10189707577228546,
"learning_rate": 9.938441702975689e-05,
"loss": 0.2359190434217453,
"step": 24
},
{
"epoch": 0.8888888888888888,
"grad_norm": 0.06018666550517082,
"learning_rate": 9.926769179238466e-05,
"loss": 0.24584323167800903,
"step": 25
},
{
"epoch": 0.9244444444444444,
"grad_norm": 0.05413977429270744,
"learning_rate": 9.914092018383778e-05,
"loss": 0.17237712442874908,
"step": 26
},
{
"epoch": 0.96,
"grad_norm": 0.042994916439056396,
"learning_rate": 9.900412805461967e-05,
"loss": 0.15629145503044128,
"step": 27
},
{
"epoch": 0.9955555555555555,
"grad_norm": 0.0588720478117466,
"learning_rate": 9.885734329855798e-05,
"loss": 0.1863369643688202,
"step": 28
},
{
"epoch": 1.0,
"grad_norm": 0.15661829710006714,
"learning_rate": 9.870059584711668e-05,
"loss": 0.2297505885362625,
"step": 29
},
{
"epoch": 1.0355555555555556,
"grad_norm": 0.03409217298030853,
"learning_rate": 9.853391766329263e-05,
"loss": 0.06839371472597122,
"step": 30
},
{
"epoch": 1.0355555555555556,
"eval_loss": 0.0960446149110794,
"eval_runtime": 5.4537,
"eval_samples_per_second": 9.168,
"eval_steps_per_second": 9.168,
"step": 30
},
{
"epoch": 1.0355555555555556,
"eval_perplexity": 1.1008081753572803,
"step": 30
},
{
"epoch": 1.0711111111111111,
"grad_norm": 0.03011409193277359,
"learning_rate": 9.835734273509786e-05,
"loss": 0.07586748898029327,
"step": 31
},
{
"epoch": 1.1066666666666667,
"grad_norm": 0.03701885789632797,
"learning_rate": 9.817090706862895e-05,
"loss": 0.0892762839794159,
"step": 32
},
{
"epoch": 1.1422222222222222,
"grad_norm": 0.03201104328036308,
"learning_rate": 9.797464868072488e-05,
"loss": 0.08438154309988022,
"step": 33
},
{
"epoch": 1.1777777777777778,
"grad_norm": 0.03157950937747955,
"learning_rate": 9.776860759121484e-05,
"loss": 0.04694896563887596,
"step": 34
},
{
"epoch": 1.2133333333333334,
"grad_norm": 0.032276663929224014,
"learning_rate": 9.755282581475769e-05,
"loss": 0.07806245237588882,
"step": 35
},
{
"epoch": 1.248888888888889,
"grad_norm": 0.030301420018076897,
"learning_rate": 9.73273473522745e-05,
"loss": 0.0493946447968483,
"step": 36
},
{
"epoch": 1.2844444444444445,
"grad_norm": 0.027570156380534172,
"learning_rate": 9.709221818197624e-05,
"loss": 0.06280327588319778,
"step": 37
},
{
"epoch": 1.32,
"grad_norm": 0.025066696107387543,
"learning_rate": 9.68474862499881e-05,
"loss": 0.05094042792916298,
"step": 38
},
{
"epoch": 1.3555555555555556,
"grad_norm": 0.02456921711564064,
"learning_rate": 9.659320146057262e-05,
"loss": 0.03677443787455559,
"step": 39
},
{
"epoch": 1.3911111111111112,
"grad_norm": 0.02479228563606739,
"learning_rate": 9.632941566595357e-05,
"loss": 0.03535553067922592,
"step": 40
},
{
"epoch": 1.3911111111111112,
"eval_loss": 0.022668220102787018,
"eval_runtime": 5.6373,
"eval_samples_per_second": 8.87,
"eval_steps_per_second": 8.87,
"step": 40
},
{
"epoch": 1.3911111111111112,
"eval_perplexity": 1.022927096593193,
"step": 40
},
{
"epoch": 1.4266666666666667,
"grad_norm": 0.016291167587041855,
"learning_rate": 9.60561826557425e-05,
"loss": 0.019891822710633278,
"step": 41
},
{
"epoch": 1.462222222222222,
"grad_norm": 0.01630846969783306,
"learning_rate": 9.577355814597031e-05,
"loss": 0.023395322263240814,
"step": 42
},
{
"epoch": 1.4977777777777779,
"grad_norm": 0.014682851731777191,
"learning_rate": 9.548159976772592e-05,
"loss": 0.01620781607925892,
"step": 43
},
{
"epoch": 1.5333333333333332,
"grad_norm": 0.004914387129247189,
"learning_rate": 9.518036705540458e-05,
"loss": 0.006628153380006552,
"step": 44
},
{
"epoch": 1.568888888888889,
"grad_norm": 0.005044769961386919,
"learning_rate": 9.486992143456792e-05,
"loss": 0.0069605098105967045,
"step": 45
},
{
"epoch": 1.6044444444444443,
"grad_norm": 0.010346329770982265,
"learning_rate": 9.45503262094184e-05,
"loss": 0.009333918802440166,
"step": 46
},
{
"epoch": 1.6400000000000001,
"grad_norm": 0.005329441279172897,
"learning_rate": 9.422164654989072e-05,
"loss": 0.006601989734917879,
"step": 47
},
{
"epoch": 1.6755555555555555,
"grad_norm": 0.008117754012346268,
"learning_rate": 9.388394947836279e-05,
"loss": 0.006798232439905405,
"step": 48
},
{
"epoch": 1.7111111111111112,
"grad_norm": 0.008304511196911335,
"learning_rate": 9.353730385598887e-05,
"loss": 0.006939806509763002,
"step": 49
},
{
"epoch": 1.7466666666666666,
"grad_norm": 0.005011966452002525,
"learning_rate": 9.318178036865785e-05,
"loss": 0.005817799363285303,
"step": 50
},
{
"epoch": 1.7466666666666666,
"eval_loss": 0.005097925662994385,
"eval_runtime": 5.4641,
"eval_samples_per_second": 9.151,
"eval_steps_per_second": 9.151,
"step": 50
},
{
"epoch": 1.7466666666666666,
"eval_perplexity": 1.0051109421957325,
"step": 50
},
{
"epoch": 1.7822222222222224,
"grad_norm": 0.00494053028523922,
"learning_rate": 9.281745151257946e-05,
"loss": 0.005493980832397938,
"step": 51
},
{
"epoch": 1.8177777777777777,
"grad_norm": 0.003944819793105125,
"learning_rate": 9.244439157950114e-05,
"loss": 0.004002867732197046,
"step": 52
},
{
"epoch": 1.8533333333333335,
"grad_norm": 0.002889649011194706,
"learning_rate": 9.206267664155907e-05,
"loss": 0.00337179284542799,
"step": 53
},
{
"epoch": 1.8888888888888888,
"grad_norm": 0.0023699572775512934,
"learning_rate": 9.167238453576589e-05,
"loss": 0.003095966763794422,
"step": 54
},
{
"epoch": 1.9244444444444444,
"grad_norm": 0.009545288980007172,
"learning_rate": 9.12735948481387e-05,
"loss": 0.005139315500855446,
"step": 55
},
{
"epoch": 1.96,
"grad_norm": 0.0045837461948394775,
"learning_rate": 9.086638889747035e-05,
"loss": 0.0036253915168344975,
"step": 56
},
{
"epoch": 1.9955555555555555,
"grad_norm": 0.008223620243370533,
"learning_rate": 9.045084971874738e-05,
"loss": 0.004782550968229771,
"step": 57
},
{
"epoch": 2.0,
"grad_norm": 0.005293046589940786,
"learning_rate": 9.002706204621803e-05,
"loss": 0.003609852399677038,
"step": 58
},
{
"epoch": 2.0355555555555553,
"grad_norm": 0.0016866261139512062,
"learning_rate": 8.959511229611376e-05,
"loss": 0.0023398897610604763,
"step": 59
},
{
"epoch": 2.071111111111111,
"grad_norm": 0.0024739305954426527,
"learning_rate": 8.915508854902778e-05,
"loss": 0.0026166446041315794,
"step": 60
},
{
"epoch": 2.071111111111111,
"eval_loss": 0.0024453848600387573,
"eval_runtime": 5.4775,
"eval_samples_per_second": 9.128,
"eval_steps_per_second": 9.128,
"step": 60
},
{
"epoch": 2.071111111111111,
"eval_perplexity": 1.002448377252282,
"step": 60
},
{
"epoch": 2.1066666666666665,
"grad_norm": 0.0023085270076990128,
"learning_rate": 8.870708053195413e-05,
"loss": 0.002390390494838357,
"step": 61
},
{
"epoch": 2.1422222222222222,
"grad_norm": 0.0026797724422067404,
"learning_rate": 8.825117959999116e-05,
"loss": 0.002457966562360525,
"step": 62
},
{
"epoch": 2.1777777777777776,
"grad_norm": 0.0013235695660114288,
"learning_rate": 8.778747871771292e-05,
"loss": 0.0019208687590435147,
"step": 63
},
{
"epoch": 2.2133333333333334,
"grad_norm": 0.0019502972718328238,
"learning_rate": 8.731607244021236e-05,
"loss": 0.0020442644599825144,
"step": 64
},
{
"epoch": 2.2488888888888887,
"grad_norm": 0.0014056526124477386,
"learning_rate": 8.683705689382024e-05,
"loss": 0.0020194968674331903,
"step": 65
},
{
"epoch": 2.2844444444444445,
"grad_norm": 0.0016124699031934142,
"learning_rate": 8.635052975650369e-05,
"loss": 0.001853243331424892,
"step": 66
},
{
"epoch": 2.32,
"grad_norm": 0.0014297482557594776,
"learning_rate": 8.585659023794818e-05,
"loss": 0.002052597003057599,
"step": 67
},
{
"epoch": 2.3555555555555556,
"grad_norm": 0.0011592477094382048,
"learning_rate": 8.535533905932738e-05,
"loss": 0.0016631247708573937,
"step": 68
},
{
"epoch": 2.391111111111111,
"grad_norm": 0.0014637873973697424,
"learning_rate": 8.484687843276469e-05,
"loss": 0.0018859267001971602,
"step": 69
},
{
"epoch": 2.4266666666666667,
"grad_norm": 0.0009684404940344393,
"learning_rate": 8.433131204049067e-05,
"loss": 0.001511464361101389,
"step": 70
},
{
"epoch": 2.4266666666666667,
"eval_loss": 0.0016330081271007657,
"eval_runtime": 5.4569,
"eval_samples_per_second": 9.163,
"eval_steps_per_second": 9.163,
"step": 70
},
{
"epoch": 2.4266666666666667,
"eval_perplexity": 1.0016343422109635,
"step": 70
},
{
"epoch": 2.462222222222222,
"grad_norm": 0.0010153243783861399,
"learning_rate": 8.380874501370097e-05,
"loss": 0.0015972007531672716,
"step": 71
},
{
"epoch": 2.497777777777778,
"grad_norm": 0.0009011203073896468,
"learning_rate": 8.327928391111841e-05,
"loss": 0.0013946370454505086,
"step": 72
},
{
"epoch": 2.533333333333333,
"grad_norm": 0.0009017665288411081,
"learning_rate": 8.274303669726426e-05,
"loss": 0.0014331797137856483,
"step": 73
},
{
"epoch": 2.568888888888889,
"grad_norm": 0.0009415379608981311,
"learning_rate": 8.220011272044277e-05,
"loss": 0.001520266872830689,
"step": 74
},
{
"epoch": 2.6044444444444443,
"grad_norm": 0.0009506358182989061,
"learning_rate": 8.165062269044353e-05,
"loss": 0.001505439169704914,
"step": 75
},
{
"epoch": 2.64,
"grad_norm": 0.0007934041786938906,
"learning_rate": 8.109467865596612e-05,
"loss": 0.0013778579887002707,
"step": 76
},
{
"epoch": 2.6755555555555555,
"grad_norm": 0.0008148634806275368,
"learning_rate": 8.053239398177191e-05,
"loss": 0.001370853278785944,
"step": 77
},
{
"epoch": 2.7111111111111112,
"grad_norm": 0.0006598148611374199,
"learning_rate": 7.996388332556735e-05,
"loss": 0.0011620635632425547,
"step": 78
},
{
"epoch": 2.7466666666666666,
"grad_norm": 0.0008030621684156358,
"learning_rate": 7.938926261462366e-05,
"loss": 0.0012577238958328962,
"step": 79
},
{
"epoch": 2.7822222222222224,
"grad_norm": 0.0008109168848022819,
"learning_rate": 7.880864902213765e-05,
"loss": 0.0013199358945712447,
"step": 80
},
{
"epoch": 2.7822222222222224,
"eval_loss": 0.0013468421529978514,
"eval_runtime": 5.4617,
"eval_samples_per_second": 9.155,
"eval_steps_per_second": 9.155,
"step": 80
},
{
"epoch": 2.7822222222222224,
"eval_perplexity": 1.0013477495522192,
"step": 80
},
{
"epoch": 2.8177777777777777,
"grad_norm": 0.0007556782802566886,
"learning_rate": 7.822216094333847e-05,
"loss": 0.001324485638178885,
"step": 81
},
{
"epoch": 2.8533333333333335,
"grad_norm": 0.0008008314180187881,
"learning_rate": 7.762991797134514e-05,
"loss": 0.0012606465024873614,
"step": 82
},
{
"epoch": 2.888888888888889,
"grad_norm": 0.0007433093851432204,
"learning_rate": 7.703204087277988e-05,
"loss": 0.0012966024223715067,
"step": 83
},
{
"epoch": 2.924444444444444,
"grad_norm": 0.0007187623996287584,
"learning_rate": 7.64286515631421e-05,
"loss": 0.001278804033063352,
"step": 84
},
{
"epoch": 2.96,
"grad_norm": 0.0007242705905809999,
"learning_rate": 7.58198730819481e-05,
"loss": 0.0012370930053293705,
"step": 85
},
{
"epoch": 2.9955555555555557,
"grad_norm": 0.0005744029767811298,
"learning_rate": 7.52058295676416e-05,
"loss": 0.0010438471799716353,
"step": 86
},
{
"epoch": 3.0,
"grad_norm": 0.0008678279700689018,
"learning_rate": 7.45866462322802e-05,
"loss": 0.0009476285194978118,
"step": 87
},
{
"epoch": 3.0355555555555553,
"grad_norm": 0.0006672442541457713,
"learning_rate": 7.396244933600285e-05,
"loss": 0.0011832310119643807,
"step": 88
},
{
"epoch": 3.071111111111111,
"grad_norm": 0.0007027190877124667,
"learning_rate": 7.333336616128369e-05,
"loss": 0.0011928146705031395,
"step": 89
},
{
"epoch": 3.1066666666666665,
"grad_norm": 0.0005659974412992597,
"learning_rate": 7.269952498697734e-05,
"loss": 0.0010046998504549265,
"step": 90
},
{
"epoch": 3.1066666666666665,
"eval_loss": 0.001156785525381565,
"eval_runtime": 5.4591,
"eval_samples_per_second": 9.159,
"eval_steps_per_second": 9.159,
"step": 90
},
{
"epoch": 3.1066666666666665,
"eval_perplexity": 1.0011574548598248,
"step": 90
},
{
"epoch": 3.1422222222222222,
"grad_norm": 0.0007686283788643777,
"learning_rate": 7.206105506216106e-05,
"loss": 0.0012316190404817462,
"step": 91
},
{
"epoch": 3.1777777777777776,
"grad_norm": 0.0007238875259645283,
"learning_rate": 7.141808657977907e-05,
"loss": 0.0012630725977942348,
"step": 92
},
{
"epoch": 3.2133333333333334,
"grad_norm": 0.0005691683618351817,
"learning_rate": 7.077075065009433e-05,
"loss": 0.0010533572640269995,
"step": 93
},
{
"epoch": 3.2488888888888887,
"grad_norm": 0.0005341364885680377,
"learning_rate": 7.01191792739534e-05,
"loss": 0.0009238627390004694,
"step": 94
},
{
"epoch": 3.2844444444444445,
"grad_norm": 0.0006295841885730624,
"learning_rate": 6.946350531586959e-05,
"loss": 0.0011080841068178415,
"step": 95
},
{
"epoch": 3.32,
"grad_norm": 0.000528680335264653,
"learning_rate": 6.880386247692999e-05,
"loss": 0.001002258388325572,
"step": 96
},
{
"epoch": 3.3555555555555556,
"grad_norm": 0.0005391994491219521,
"learning_rate": 6.814038526753205e-05,
"loss": 0.0009756924118846655,
"step": 97
},
{
"epoch": 3.391111111111111,
"grad_norm": 0.0004892258439213037,
"learning_rate": 6.747320897995493e-05,
"loss": 0.0009195349994115531,
"step": 98
},
{
"epoch": 3.4266666666666667,
"grad_norm": 0.0006504295743070543,
"learning_rate": 6.680246966077151e-05,
"loss": 0.0010819350136443973,
"step": 99
},
{
"epoch": 3.462222222222222,
"grad_norm": 0.0005436805658973753,
"learning_rate": 6.61283040831067e-05,
"loss": 0.0010187672451138496,
"step": 100
},
{
"epoch": 3.462222222222222,
"eval_loss": 0.00102730724029243,
"eval_runtime": 5.4639,
"eval_samples_per_second": 9.151,
"eval_steps_per_second": 9.151,
"step": 100
},
{
"epoch": 3.462222222222222,
"eval_perplexity": 1.0010278351011184,
"step": 100
},
{
"epoch": 3.497777777777778,
"grad_norm": 0.0005463913548737764,
"learning_rate": 6.545084971874738e-05,
"loss": 0.0010149093577638268,
"step": 101
},
{
"epoch": 3.533333333333333,
"grad_norm": 0.0005039684474468231,
"learning_rate": 6.477024471011001e-05,
"loss": 0.0009072019602172077,
"step": 102
},
{
"epoch": 3.568888888888889,
"grad_norm": 0.0005210865056142211,
"learning_rate": 6.408662784207149e-05,
"loss": 0.0009972177213057876,
"step": 103
},
{
"epoch": 3.6044444444444443,
"grad_norm": 0.0006203350494615734,
"learning_rate": 6.340013851366896e-05,
"loss": 0.0010793538531288505,
"step": 104
},
{
"epoch": 3.64,
"grad_norm": 0.0004328833019826561,
"learning_rate": 6.271091670967436e-05,
"loss": 0.0008299812907353044,
"step": 105
},
{
"epoch": 3.6755555555555555,
"grad_norm": 0.0004699431301560253,
"learning_rate": 6.201910297204962e-05,
"loss": 0.0008918773382902145,
"step": 106
},
{
"epoch": 3.7111111111111112,
"grad_norm": 0.0005212542018853128,
"learning_rate": 6.132483837128823e-05,
"loss": 0.0008914040517993271,
"step": 107
},
{
"epoch": 3.7466666666666666,
"grad_norm": 0.000499907648190856,
"learning_rate": 6.062826447764883e-05,
"loss": 0.0009607981191948056,
"step": 108
},
{
"epoch": 3.7822222222222224,
"grad_norm": 0.00046874224790371954,
"learning_rate": 5.992952333228728e-05,
"loss": 0.000899041595403105,
"step": 109
},
{
"epoch": 3.8177777777777777,
"grad_norm": 0.00046614641905762255,
"learning_rate": 5.9228757418292266e-05,
"loss": 0.0009188801050186157,
"step": 110
},
{
"epoch": 3.8177777777777777,
"eval_loss": 0.0009438548004254699,
"eval_runtime": 5.47,
"eval_samples_per_second": 9.141,
"eval_steps_per_second": 9.141,
"step": 110
},
{
"epoch": 3.8177777777777777,
"eval_perplexity": 1.0009443003715415,
"step": 110
},
{
"epoch": 3.8177777777777777,
"step": 110,
"total_flos": 1.1595012073517875e+17,
"train_loss": 0.5676066864086103,
"train_runtime": 733.6059,
"train_samples_per_second": 4.907,
"train_steps_per_second": 0.316
},
{
"epoch": 3.8177777777777777,
"eval_loss": 0.0009438548004254699,
"eval_runtime": 5.4371,
"eval_samples_per_second": 9.196,
"eval_steps_per_second": 9.196,
"step": 110
},
{
"epoch": 3.8177777777777777,
"eval_perplexity": 1.0009443003715415,
"step": 110
}
],
"logging_steps": 1,
"max_steps": 232,
"num_input_tokens_seen": 0,
"num_train_epochs": 8,
"save_steps": 10,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.001
},
"attributes": {
"early_stopping_patience_counter": 5
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1595012073517875e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}