{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 28, "global_step": 140, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.014285714285714285, "grad_norm": 0.2301674634218216, "learning_rate": 0.0, "loss": 1.6484375, "step": 1 }, { "epoch": 0.02857142857142857, "grad_norm": 0.22452111542224884, "learning_rate": 1.4285714285714285e-05, "loss": 1.6533203125, "step": 2 }, { "epoch": 0.04285714285714286, "grad_norm": 0.20813249051570892, "learning_rate": 2.857142857142857e-05, "loss": 1.6640625, "step": 3 }, { "epoch": 0.05714285714285714, "grad_norm": 0.1457422524690628, "learning_rate": 4.2857142857142856e-05, "loss": 1.5908203125, "step": 4 }, { "epoch": 0.07142857142857142, "grad_norm": 0.10130278021097183, "learning_rate": 5.714285714285714e-05, "loss": 1.548828125, "step": 5 }, { "epoch": 0.08571428571428572, "grad_norm": 0.13983897864818573, "learning_rate": 7.142857142857143e-05, "loss": 1.5234375, "step": 6 }, { "epoch": 0.1, "grad_norm": 0.14988909661769867, "learning_rate": 8.571428571428571e-05, "loss": 1.4619140625, "step": 7 }, { "epoch": 0.11428571428571428, "grad_norm": 0.12844695150852203, "learning_rate": 0.0001, "loss": 1.4208984375, "step": 8 }, { "epoch": 0.12857142857142856, "grad_norm": 0.10155356675386429, "learning_rate": 9.998744667454123e-05, "loss": 1.4248046875, "step": 9 }, { "epoch": 0.14285714285714285, "grad_norm": 0.07152616232633591, "learning_rate": 9.994979370198627e-05, "loss": 1.3486328125, "step": 10 }, { "epoch": 0.15714285714285714, "grad_norm": 0.06663011759519577, "learning_rate": 9.988706208989151e-05, "loss": 1.306640625, "step": 11 }, { "epoch": 0.17142857142857143, "grad_norm": 0.06677305698394775, "learning_rate": 9.979928683782777e-05, "loss": 1.302734375, "step": 12 }, { "epoch": 0.18571428571428572, "grad_norm": 0.05471112206578255, "learning_rate": 9.968651691785309e-05, "loss": 1.2978515625, "step": 13 }, { "epoch": 0.2, "grad_norm": 0.05604815483093262, "learning_rate": 9.954881524719004e-05, "loss": 1.2958984375, "step": 14 }, { "epoch": 0.21428571428571427, "grad_norm": 0.06290843337774277, "learning_rate": 9.938625865312251e-05, "loss": 1.28515625, "step": 15 }, { "epoch": 0.22857142857142856, "grad_norm": 0.05813497677445412, "learning_rate": 9.91989378301319e-05, "loss": 1.216796875, "step": 16 }, { "epoch": 0.24285714285714285, "grad_norm": 0.057633932679891586, "learning_rate": 9.898695728929623e-05, "loss": 1.2666015625, "step": 17 }, { "epoch": 0.2571428571428571, "grad_norm": 0.053865354508161545, "learning_rate": 9.875043529998088e-05, "loss": 1.25, "step": 18 }, { "epoch": 0.2714285714285714, "grad_norm": 0.05344673618674278, "learning_rate": 9.848950382385293e-05, "loss": 1.248046875, "step": 19 }, { "epoch": 0.2857142857142857, "grad_norm": 0.04980555549263954, "learning_rate": 9.820430844125647e-05, "loss": 1.21484375, "step": 20 }, { "epoch": 0.3, "grad_norm": 0.05198637396097183, "learning_rate": 9.789500826998962e-05, "loss": 1.2265625, "step": 21 }, { "epoch": 0.3142857142857143, "grad_norm": 0.051235176622867584, "learning_rate": 9.756177587652856e-05, "loss": 1.193359375, "step": 22 }, { "epoch": 0.32857142857142857, "grad_norm": 0.05366426706314087, "learning_rate": 9.720479717974835e-05, "loss": 1.1884765625, "step": 23 }, { "epoch": 0.34285714285714286, "grad_norm": 0.05358980968594551, "learning_rate": 9.682427134719396e-05, "loss": 1.1806640625, "step": 24 }, { "epoch": 0.35714285714285715, "grad_norm": 0.05572328716516495, "learning_rate": 9.642041068395971e-05, "loss": 1.1748046875, "step": 25 }, { "epoch": 0.37142857142857144, "grad_norm": 0.05449635162949562, "learning_rate": 9.599344051423873e-05, "loss": 1.134765625, "step": 26 }, { "epoch": 0.38571428571428573, "grad_norm": 0.0521831288933754, "learning_rate": 9.554359905560886e-05, "loss": 1.15234375, "step": 27 }, { "epoch": 0.4, "grad_norm": 0.04832952469587326, "learning_rate": 9.507113728612501e-05, "loss": 1.14013671875, "step": 28 }, { "epoch": 0.4, "eval_loss": 1.12841796875, "eval_runtime": 6.3919, "eval_samples_per_second": 1.095, "eval_steps_per_second": 0.156, "step": 28 }, { "epoch": 0.4142857142857143, "grad_norm": 0.054382070899009705, "learning_rate": 9.4576318804292e-05, "loss": 1.1416015625, "step": 29 }, { "epoch": 0.42857142857142855, "grad_norm": 0.056724973022937775, "learning_rate": 9.405941968199635e-05, "loss": 1.0859375, "step": 30 }, { "epoch": 0.44285714285714284, "grad_norm": 0.052214112132787704, "learning_rate": 9.35207283104785e-05, "loss": 1.1142578125, "step": 31 }, { "epoch": 0.45714285714285713, "grad_norm": 0.05902480706572533, "learning_rate": 9.296054523943223e-05, "loss": 1.12109375, "step": 32 }, { "epoch": 0.4714285714285714, "grad_norm": 0.05499668046832085, "learning_rate": 9.237918300932004e-05, "loss": 1.05712890625, "step": 33 }, { "epoch": 0.4857142857142857, "grad_norm": 0.04787338897585869, "learning_rate": 9.177696597699902e-05, "loss": 1.05419921875, "step": 34 }, { "epoch": 0.5, "grad_norm": 0.050695084035396576, "learning_rate": 9.115423013475376e-05, "loss": 1.04150390625, "step": 35 }, { "epoch": 0.5142857142857142, "grad_norm": 0.055649545043706894, "learning_rate": 9.051132292283771e-05, "loss": 1.08837890625, "step": 36 }, { "epoch": 0.5285714285714286, "grad_norm": 0.05247028172016144, "learning_rate": 8.984860303562737e-05, "loss": 1.06787109375, "step": 37 }, { "epoch": 0.5428571428571428, "grad_norm": 0.05999448150396347, "learning_rate": 8.91664402214975e-05, "loss": 1.09375, "step": 38 }, { "epoch": 0.5571428571428572, "grad_norm": 0.053369153290987015, "learning_rate": 8.846521507652904e-05, "loss": 1.06494140625, "step": 39 }, { "epoch": 0.5714285714285714, "grad_norm": 0.054364919662475586, "learning_rate": 8.774531883216487e-05, "loss": 1.0703125, "step": 40 }, { "epoch": 0.5857142857142857, "grad_norm": 0.05390971899032593, "learning_rate": 8.70071531369318e-05, "loss": 0.9931640625, "step": 41 }, { "epoch": 0.6, "grad_norm": 0.05540841072797775, "learning_rate": 8.625112983235038e-05, "loss": 1.05078125, "step": 42 }, { "epoch": 0.6142857142857143, "grad_norm": 0.054859407246112823, "learning_rate": 8.547767072315835e-05, "loss": 1.0068359375, "step": 43 }, { "epoch": 0.6285714285714286, "grad_norm": 0.0654584988951683, "learning_rate": 8.468720734197464e-05, "loss": 1.0673828125, "step": 44 }, { "epoch": 0.6428571428571429, "grad_norm": 0.06306427717208862, "learning_rate": 8.388018070853642e-05, "loss": 1.03515625, "step": 45 }, { "epoch": 0.6571428571428571, "grad_norm": 0.05659706890583038, "learning_rate": 8.305704108364301e-05, "loss": 1.00830078125, "step": 46 }, { "epoch": 0.6714285714285714, "grad_norm": 0.058154042810201645, "learning_rate": 8.22182477179437e-05, "loss": 1.04150390625, "step": 47 }, { "epoch": 0.6857142857142857, "grad_norm": 0.05709483101963997, "learning_rate": 8.136426859571013e-05, "loss": 1.02001953125, "step": 48 }, { "epoch": 0.7, "grad_norm": 0.05433674529194832, "learning_rate": 8.049558017373592e-05, "loss": 1.01123046875, "step": 49 }, { "epoch": 0.7142857142857143, "grad_norm": 0.0570937804877758, "learning_rate": 7.961266711550922e-05, "loss": 1.00830078125, "step": 50 }, { "epoch": 0.7285714285714285, "grad_norm": 0.059223074465990067, "learning_rate": 7.871602202080656e-05, "loss": 1.02099609375, "step": 51 }, { "epoch": 0.7428571428571429, "grad_norm": 0.06066058203577995, "learning_rate": 7.78061451508588e-05, "loss": 0.99365234375, "step": 52 }, { "epoch": 0.7571428571428571, "grad_norm": 0.05862792953848839, "learning_rate": 7.688354414924266e-05, "loss": 0.939453125, "step": 53 }, { "epoch": 0.7714285714285715, "grad_norm": 0.06388234347105026, "learning_rate": 7.594873375865335e-05, "loss": 0.966796875, "step": 54 }, { "epoch": 0.7857142857142857, "grad_norm": 0.05540330708026886, "learning_rate": 7.500223553371642e-05, "loss": 0.93212890625, "step": 55 }, { "epoch": 0.8, "grad_norm": 0.0587574727833271, "learning_rate": 7.404457754999913e-05, "loss": 0.99365234375, "step": 56 }, { "epoch": 0.8, "eval_loss": 0.98876953125, "eval_runtime": 6.3799, "eval_samples_per_second": 1.097, "eval_steps_per_second": 0.157, "step": 56 }, { "epoch": 0.8142857142857143, "grad_norm": 0.058628544211387634, "learning_rate": 7.307629410938363e-05, "loss": 0.978515625, "step": 57 }, { "epoch": 0.8285714285714286, "grad_norm": 0.06110001727938652, "learning_rate": 7.20979254419662e-05, "loss": 0.9921875, "step": 58 }, { "epoch": 0.8428571428571429, "grad_norm": 0.059112727642059326, "learning_rate": 7.11100174046491e-05, "loss": 0.95458984375, "step": 59 }, { "epoch": 0.8571428571428571, "grad_norm": 0.055121202021837234, "learning_rate": 7.011312117659304e-05, "loss": 0.93603515625, "step": 60 }, { "epoch": 0.8714285714285714, "grad_norm": 0.06230216100811958, "learning_rate": 6.910779295170017e-05, "loss": 0.95703125, "step": 61 }, { "epoch": 0.8857142857142857, "grad_norm": 0.05832396820187569, "learning_rate": 6.80945936282994e-05, "loss": 0.94970703125, "step": 62 }, { "epoch": 0.9, "grad_norm": 0.05860510468482971, "learning_rate": 6.707408849620682e-05, "loss": 0.9365234375, "step": 63 }, { "epoch": 0.9142857142857143, "grad_norm": 0.06364964693784714, "learning_rate": 6.604684692133597e-05, "loss": 0.978515625, "step": 64 }, { "epoch": 0.9285714285714286, "grad_norm": 0.0612567700445652, "learning_rate": 6.501344202803414e-05, "loss": 0.953125, "step": 65 }, { "epoch": 0.9428571428571428, "grad_norm": 0.05668887495994568, "learning_rate": 6.397445037932167e-05, "loss": 0.9521484375, "step": 66 }, { "epoch": 0.9571428571428572, "grad_norm": 0.06072384864091873, "learning_rate": 6.293045165521248e-05, "loss": 0.93701171875, "step": 67 }, { "epoch": 0.9714285714285714, "grad_norm": 0.06082940474152565, "learning_rate": 6.188202832929608e-05, "loss": 0.96044921875, "step": 68 }, { "epoch": 0.9857142857142858, "grad_norm": 0.06168084964156151, "learning_rate": 6.082976534376037e-05, "loss": 0.94384765625, "step": 69 }, { "epoch": 1.0, "grad_norm": 0.059236977249383926, "learning_rate": 5.977424978303762e-05, "loss": 0.919921875, "step": 70 }, { "epoch": 1.0142857142857142, "grad_norm": 0.058729320764541626, "learning_rate": 5.8716070546254966e-05, "loss": 0.9013671875, "step": 71 }, { "epoch": 1.0285714285714285, "grad_norm": 0.061870310455560684, "learning_rate": 5.765581801867254e-05, "loss": 0.92138671875, "step": 72 }, { "epoch": 1.042857142857143, "grad_norm": 0.06547029316425323, "learning_rate": 5.659408374229244e-05, "loss": 0.91748046875, "step": 73 }, { "epoch": 1.0571428571428572, "grad_norm": 0.058774255216121674, "learning_rate": 5.553146008582232e-05, "loss": 0.927734375, "step": 74 }, { "epoch": 1.0714285714285714, "grad_norm": 0.06608563661575317, "learning_rate": 5.4468539914177705e-05, "loss": 0.92236328125, "step": 75 }, { "epoch": 1.0857142857142856, "grad_norm": 0.065040722489357, "learning_rate": 5.340591625770758e-05, "loss": 0.91796875, "step": 76 }, { "epoch": 1.1, "grad_norm": 0.06403814256191254, "learning_rate": 5.234418198132748e-05, "loss": 0.89501953125, "step": 77 }, { "epoch": 1.1142857142857143, "grad_norm": 0.06091045215725899, "learning_rate": 5.128392945374505e-05, "loss": 0.8935546875, "step": 78 }, { "epoch": 1.1285714285714286, "grad_norm": 0.06854798644781113, "learning_rate": 5.02257502169624e-05, "loss": 0.9140625, "step": 79 }, { "epoch": 1.1428571428571428, "grad_norm": 0.06155310198664665, "learning_rate": 4.9170234656239655e-05, "loss": 0.88818359375, "step": 80 }, { "epoch": 1.157142857142857, "grad_norm": 0.06304619461297989, "learning_rate": 4.811797167070393e-05, "loss": 0.89111328125, "step": 81 }, { "epoch": 1.1714285714285715, "grad_norm": 0.06259562075138092, "learning_rate": 4.706954834478753e-05, "loss": 0.875, "step": 82 }, { "epoch": 1.1857142857142857, "grad_norm": 0.05829339101910591, "learning_rate": 4.6025549620678357e-05, "loss": 0.9091796875, "step": 83 }, { "epoch": 1.2, "grad_norm": 0.06398149579763412, "learning_rate": 4.498655797196586e-05, "loss": 0.8994140625, "step": 84 }, { "epoch": 1.2, "eval_loss": 0.9287109375, "eval_runtime": 6.377, "eval_samples_per_second": 1.098, "eval_steps_per_second": 0.157, "step": 84 }, { "epoch": 1.2142857142857142, "grad_norm": 0.06233156844973564, "learning_rate": 4.395315307866405e-05, "loss": 0.9013671875, "step": 85 }, { "epoch": 1.2285714285714286, "grad_norm": 0.06106571480631828, "learning_rate": 4.2925911503793207e-05, "loss": 0.85302734375, "step": 86 }, { "epoch": 1.2428571428571429, "grad_norm": 0.061428941786289215, "learning_rate": 4.1905406371700605e-05, "loss": 0.89208984375, "step": 87 }, { "epoch": 1.2571428571428571, "grad_norm": 0.06285811215639114, "learning_rate": 4.089220704829986e-05, "loss": 0.89697265625, "step": 88 }, { "epoch": 1.2714285714285714, "grad_norm": 0.0686308816075325, "learning_rate": 3.988687882340698e-05, "loss": 0.89111328125, "step": 89 }, { "epoch": 1.2857142857142856, "grad_norm": 0.06331058591604233, "learning_rate": 3.8889982595350916e-05, "loss": 0.88134765625, "step": 90 }, { "epoch": 1.3, "grad_norm": 0.06306147575378418, "learning_rate": 3.790207455803381e-05, "loss": 0.89013671875, "step": 91 }, { "epoch": 1.3142857142857143, "grad_norm": 0.06359851360321045, "learning_rate": 3.692370589061639e-05, "loss": 0.86572265625, "step": 92 }, { "epoch": 1.3285714285714285, "grad_norm": 0.061125222593545914, "learning_rate": 3.595542245000089e-05, "loss": 0.8876953125, "step": 93 }, { "epoch": 1.342857142857143, "grad_norm": 0.06186739355325699, "learning_rate": 3.499776446628361e-05, "loss": 0.8818359375, "step": 94 }, { "epoch": 1.3571428571428572, "grad_norm": 0.066498301923275, "learning_rate": 3.405126624134666e-05, "loss": 0.86962890625, "step": 95 }, { "epoch": 1.3714285714285714, "grad_norm": 0.05984362214803696, "learning_rate": 3.311645585075734e-05, "loss": 0.85400390625, "step": 96 }, { "epoch": 1.3857142857142857, "grad_norm": 0.0650252252817154, "learning_rate": 3.21938548491412e-05, "loss": 0.86767578125, "step": 97 }, { "epoch": 1.4, "grad_norm": 0.06282398849725723, "learning_rate": 3.1283977979193456e-05, "loss": 0.8720703125, "step": 98 }, { "epoch": 1.4142857142857144, "grad_norm": 0.06282205134630203, "learning_rate": 3.0387332884490805e-05, "loss": 0.875, "step": 99 }, { "epoch": 1.4285714285714286, "grad_norm": 0.06260594725608826, "learning_rate": 2.9504419826264113e-05, "loss": 0.8330078125, "step": 100 }, { "epoch": 1.4428571428571428, "grad_norm": 0.06598624587059021, "learning_rate": 2.8635731404289895e-05, "loss": 0.849609375, "step": 101 }, { "epoch": 1.457142857142857, "grad_norm": 0.068242646753788, "learning_rate": 2.7781752282056328e-05, "loss": 0.857421875, "step": 102 }, { "epoch": 1.4714285714285715, "grad_norm": 0.06488832831382751, "learning_rate": 2.6942958916356998e-05, "loss": 0.8115234375, "step": 103 }, { "epoch": 1.4857142857142858, "grad_norm": 0.0600808784365654, "learning_rate": 2.6119819291463592e-05, "loss": 0.82177734375, "step": 104 }, { "epoch": 1.5, "grad_norm": 0.06046265736222267, "learning_rate": 2.531279265802538e-05, "loss": 0.81640625, "step": 105 }, { "epoch": 1.5142857142857142, "grad_norm": 0.06981690227985382, "learning_rate": 2.4522329276841663e-05, "loss": 0.8564453125, "step": 106 }, { "epoch": 1.5285714285714285, "grad_norm": 0.06316579878330231, "learning_rate": 2.3748870167649613e-05, "loss": 0.841796875, "step": 107 }, { "epoch": 1.5428571428571427, "grad_norm": 0.06674682348966599, "learning_rate": 2.299284686306823e-05, "loss": 0.86376953125, "step": 108 }, { "epoch": 1.5571428571428572, "grad_norm": 0.06432048976421356, "learning_rate": 2.2254681167835123e-05, "loss": 0.84814453125, "step": 109 }, { "epoch": 1.5714285714285714, "grad_norm": 0.06504345685243607, "learning_rate": 2.1534784923470968e-05, "loss": 0.85302734375, "step": 110 }, { "epoch": 1.5857142857142859, "grad_norm": 0.06324882805347443, "learning_rate": 2.083355977850252e-05, "loss": 0.793212890625, "step": 111 }, { "epoch": 1.6, "grad_norm": 0.06541915982961655, "learning_rate": 2.0151396964372642e-05, "loss": 0.84228515625, "step": 112 }, { "epoch": 1.6, "eval_loss": 0.89697265625, "eval_runtime": 6.3864, "eval_samples_per_second": 1.096, "eval_steps_per_second": 0.157, "step": 112 }, { "epoch": 1.6142857142857143, "grad_norm": 0.06446194648742676, "learning_rate": 1.9488677077162295e-05, "loss": 0.8037109375, "step": 113 }, { "epoch": 1.6285714285714286, "grad_norm": 0.07079339772462845, "learning_rate": 1.8845769865246253e-05, "loss": 0.84423828125, "step": 114 }, { "epoch": 1.6428571428571428, "grad_norm": 0.06356216967105865, "learning_rate": 1.822303402300099e-05, "loss": 0.83642578125, "step": 115 }, { "epoch": 1.657142857142857, "grad_norm": 0.06385171413421631, "learning_rate": 1.7620816990679977e-05, "loss": 0.81396484375, "step": 116 }, { "epoch": 1.6714285714285713, "grad_norm": 0.06617320328950882, "learning_rate": 1.703945476056778e-05, "loss": 0.85107421875, "step": 117 }, { "epoch": 1.6857142857142857, "grad_norm": 0.08020178228616714, "learning_rate": 1.6479271689521503e-05, "loss": 0.830078125, "step": 118 }, { "epoch": 1.7, "grad_norm": 0.06245279684662819, "learning_rate": 1.5940580318003663e-05, "loss": 0.82861328125, "step": 119 }, { "epoch": 1.7142857142857144, "grad_norm": 0.06454663723707199, "learning_rate": 1.5423681195707997e-05, "loss": 0.82763671875, "step": 120 }, { "epoch": 1.7285714285714286, "grad_norm": 0.06728047877550125, "learning_rate": 1.4928862713874994e-05, "loss": 0.833984375, "step": 121 }, { "epoch": 1.7428571428571429, "grad_norm": 0.06479737162590027, "learning_rate": 1.4456400944391146e-05, "loss": 0.81640625, "step": 122 }, { "epoch": 1.7571428571428571, "grad_norm": 0.06522734463214874, "learning_rate": 1.4006559485761281e-05, "loss": 0.774658203125, "step": 123 }, { "epoch": 1.7714285714285714, "grad_norm": 0.0664784386754036, "learning_rate": 1.3579589316040298e-05, "loss": 0.79248046875, "step": 124 }, { "epoch": 1.7857142857142856, "grad_norm": 0.0612151101231575, "learning_rate": 1.3175728652806046e-05, "loss": 0.77099609375, "step": 125 }, { "epoch": 1.8, "grad_norm": 0.06594721227884293, "learning_rate": 1.2795202820251664e-05, "loss": 0.8271484375, "step": 126 }, { "epoch": 1.8142857142857143, "grad_norm": 0.06843268871307373, "learning_rate": 1.2438224123471442e-05, "loss": 0.814453125, "step": 127 }, { "epoch": 1.8285714285714287, "grad_norm": 0.06743902713060379, "learning_rate": 1.210499173001039e-05, "loss": 0.83203125, "step": 128 }, { "epoch": 1.842857142857143, "grad_norm": 0.06749514490365982, "learning_rate": 1.1795691558743535e-05, "loss": 0.7998046875, "step": 129 }, { "epoch": 1.8571428571428572, "grad_norm": 0.07553337514400482, "learning_rate": 1.1510496176147086e-05, "loss": 0.7900390625, "step": 130 }, { "epoch": 1.8714285714285714, "grad_norm": 0.06856156140565872, "learning_rate": 1.1249564700019125e-05, "loss": 0.79833984375, "step": 131 }, { "epoch": 1.8857142857142857, "grad_norm": 0.06377129256725311, "learning_rate": 1.1013042710703766e-05, "loss": 0.80224609375, "step": 132 }, { "epoch": 1.9, "grad_norm": 0.0656968355178833, "learning_rate": 1.0801062169868106e-05, "loss": 0.7890625, "step": 133 }, { "epoch": 1.9142857142857141, "grad_norm": 0.07750661671161652, "learning_rate": 1.0613741346877497e-05, "loss": 0.8212890625, "step": 134 }, { "epoch": 1.9285714285714286, "grad_norm": 0.06959044188261032, "learning_rate": 1.0451184752809978e-05, "loss": 0.806640625, "step": 135 }, { "epoch": 1.9428571428571428, "grad_norm": 0.0659778043627739, "learning_rate": 1.031348308214692e-05, "loss": 0.81494140625, "step": 136 }, { "epoch": 1.9571428571428573, "grad_norm": 0.06762561202049255, "learning_rate": 1.0200713162172245e-05, "loss": 0.7978515625, "step": 137 }, { "epoch": 1.9714285714285715, "grad_norm": 0.06678938865661621, "learning_rate": 1.0112937910108495e-05, "loss": 0.8232421875, "step": 138 }, { "epoch": 1.9857142857142858, "grad_norm": 0.06764549016952515, "learning_rate": 1.0050206298013732e-05, "loss": 0.81005859375, "step": 139 }, { "epoch": 2.0, "grad_norm": 0.07080282270908356, "learning_rate": 1.0012553325458767e-05, "loss": 0.7509765625, "step": 140 }, { "epoch": 2.0, "eval_loss": 0.88427734375, "eval_runtime": 6.376, "eval_samples_per_second": 1.098, "eval_steps_per_second": 0.157, "step": 140 } ], "logging_steps": 1.0, "max_steps": 140, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1609016895637815e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }