{ "best_global_step": 110, "best_metric": 0.0009438548004254699, "best_model_checkpoint": "./lora_adapter/checkpoint-110", "epoch": 3.8177777777777777, "eval_steps": 10, "global_step": 110, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_loss": 5.712841987609863, "eval_runtime": 5.5217, "eval_samples_per_second": 9.055, "eval_steps_per_second": 9.055, "step": 0 }, { "epoch": 0, "eval_perplexity": 302.7302023645728, "step": 0 }, { "epoch": 0.035555555555555556, "grad_norm": 0.3103635609149933, "learning_rate": 0.0, "loss": 5.682491779327393, "step": 1 }, { "epoch": 0.07111111111111111, "grad_norm": 0.4182112216949463, "learning_rate": 8.333333333333334e-06, "loss": 6.0904059410095215, "step": 2 }, { "epoch": 0.10666666666666667, "grad_norm": 0.403287798166275, "learning_rate": 1.6666666666666667e-05, "loss": 5.459848403930664, "step": 3 }, { "epoch": 0.14222222222222222, "grad_norm": 0.4156350791454315, "learning_rate": 2.5e-05, "loss": 5.875328063964844, "step": 4 }, { "epoch": 0.17777777777777778, "grad_norm": 0.35492172837257385, "learning_rate": 3.3333333333333335e-05, "loss": 5.3188605308532715, "step": 5 }, { "epoch": 0.21333333333333335, "grad_norm": 0.3586452007293701, "learning_rate": 4.166666666666667e-05, "loss": 5.076211929321289, "step": 6 }, { "epoch": 0.24888888888888888, "grad_norm": 0.40670934319496155, "learning_rate": 5e-05, "loss": 4.494481563568115, "step": 7 }, { "epoch": 0.28444444444444444, "grad_norm": 0.4478435218334198, "learning_rate": 5.833333333333334e-05, "loss": 4.102505207061768, "step": 8 }, { "epoch": 0.32, "grad_norm": 0.4579038619995117, "learning_rate": 6.666666666666667e-05, "loss": 3.379936695098877, "step": 9 }, { "epoch": 0.35555555555555557, "grad_norm": 0.38791775703430176, "learning_rate": 7.500000000000001e-05, "loss": 2.952427387237549, "step": 10 }, { "epoch": 0.35555555555555557, "eval_loss": 2.718632221221924, "eval_runtime": 5.4982, "eval_samples_per_second": 9.094, "eval_steps_per_second": 9.094, "step": 10 }, { "epoch": 0.35555555555555557, "eval_perplexity": 15.15957311568705, "step": 10 }, { "epoch": 0.39111111111111113, "grad_norm": 0.7142107486724854, "learning_rate": 8.333333333333334e-05, "loss": 2.6527280807495117, "step": 11 }, { "epoch": 0.4266666666666667, "grad_norm": 0.46958744525909424, "learning_rate": 9.166666666666667e-05, "loss": 2.0736618041992188, "step": 12 }, { "epoch": 0.4622222222222222, "grad_norm": 0.46414491534233093, "learning_rate": 0.0001, "loss": 1.5400762557983398, "step": 13 }, { "epoch": 0.49777777777777776, "grad_norm": 0.3608834445476532, "learning_rate": 9.999490215047167e-05, "loss": 1.2599258422851562, "step": 14 }, { "epoch": 0.5333333333333333, "grad_norm": 0.3089125156402588, "learning_rate": 9.997960964140947e-05, "loss": 1.0378409624099731, "step": 15 }, { "epoch": 0.5688888888888889, "grad_norm": 0.23846635222434998, "learning_rate": 9.995412559116979e-05, "loss": 0.683804452419281, "step": 16 }, { "epoch": 0.6044444444444445, "grad_norm": 0.25005361437797546, "learning_rate": 9.991845519630678e-05, "loss": 0.6251506805419922, "step": 17 }, { "epoch": 0.64, "grad_norm": 0.17282210290431976, "learning_rate": 9.987260573051269e-05, "loss": 0.40306615829467773, "step": 18 }, { "epoch": 0.6755555555555556, "grad_norm": 0.14316385984420776, "learning_rate": 9.981658654313457e-05, "loss": 0.36748170852661133, "step": 19 }, { "epoch": 0.7111111111111111, "grad_norm": 0.09027505666017532, "learning_rate": 9.975040905726798e-05, "loss": 0.3596840500831604, "step": 20 }, { "epoch": 0.7111111111111111, "eval_loss": 0.34836798906326294, "eval_runtime": 5.5169, "eval_samples_per_second": 9.063, "eval_steps_per_second": 9.063, "step": 20 }, { "epoch": 0.7111111111111111, "eval_perplexity": 1.4167535036209495, "step": 20 }, { "epoch": 0.7466666666666667, "grad_norm": 0.07985851913690567, "learning_rate": 9.967408676742751e-05, "loss": 0.36926567554473877, "step": 21 }, { "epoch": 0.7822222222222223, "grad_norm": 0.06538072973489761, "learning_rate": 9.958763523679514e-05, "loss": 0.3178553879261017, "step": 22 }, { "epoch": 0.8177777777777778, "grad_norm": 0.05077500641345978, "learning_rate": 9.949107209404665e-05, "loss": 0.19684894382953644, "step": 23 }, { "epoch": 0.8533333333333334, "grad_norm": 0.10189707577228546, "learning_rate": 9.938441702975689e-05, "loss": 0.2359190434217453, "step": 24 }, { "epoch": 0.8888888888888888, "grad_norm": 0.06018666550517082, "learning_rate": 9.926769179238466e-05, "loss": 0.24584323167800903, "step": 25 }, { "epoch": 0.9244444444444444, "grad_norm": 0.05413977429270744, "learning_rate": 9.914092018383778e-05, "loss": 0.17237712442874908, "step": 26 }, { "epoch": 0.96, "grad_norm": 0.042994916439056396, "learning_rate": 9.900412805461967e-05, "loss": 0.15629145503044128, "step": 27 }, { "epoch": 0.9955555555555555, "grad_norm": 0.0588720478117466, "learning_rate": 9.885734329855798e-05, "loss": 0.1863369643688202, "step": 28 }, { "epoch": 1.0, "grad_norm": 0.15661829710006714, "learning_rate": 9.870059584711668e-05, "loss": 0.2297505885362625, "step": 29 }, { "epoch": 1.0355555555555556, "grad_norm": 0.03409217298030853, "learning_rate": 9.853391766329263e-05, "loss": 0.06839371472597122, "step": 30 }, { "epoch": 1.0355555555555556, "eval_loss": 0.0960446149110794, "eval_runtime": 5.4537, "eval_samples_per_second": 9.168, "eval_steps_per_second": 9.168, "step": 30 }, { "epoch": 1.0355555555555556, "eval_perplexity": 1.1008081753572803, "step": 30 }, { "epoch": 1.0711111111111111, "grad_norm": 0.03011409193277359, "learning_rate": 9.835734273509786e-05, "loss": 0.07586748898029327, "step": 31 }, { "epoch": 1.1066666666666667, "grad_norm": 0.03701885789632797, "learning_rate": 9.817090706862895e-05, "loss": 0.0892762839794159, "step": 32 }, { "epoch": 1.1422222222222222, "grad_norm": 0.03201104328036308, "learning_rate": 9.797464868072488e-05, "loss": 0.08438154309988022, "step": 33 }, { "epoch": 1.1777777777777778, "grad_norm": 0.03157950937747955, "learning_rate": 9.776860759121484e-05, "loss": 0.04694896563887596, "step": 34 }, { "epoch": 1.2133333333333334, "grad_norm": 0.032276663929224014, "learning_rate": 9.755282581475769e-05, "loss": 0.07806245237588882, "step": 35 }, { "epoch": 1.248888888888889, "grad_norm": 0.030301420018076897, "learning_rate": 9.73273473522745e-05, "loss": 0.0493946447968483, "step": 36 }, { "epoch": 1.2844444444444445, "grad_norm": 0.027570156380534172, "learning_rate": 9.709221818197624e-05, "loss": 0.06280327588319778, "step": 37 }, { "epoch": 1.32, "grad_norm": 0.025066696107387543, "learning_rate": 9.68474862499881e-05, "loss": 0.05094042792916298, "step": 38 }, { "epoch": 1.3555555555555556, "grad_norm": 0.02456921711564064, "learning_rate": 9.659320146057262e-05, "loss": 0.03677443787455559, "step": 39 }, { "epoch": 1.3911111111111112, "grad_norm": 0.02479228563606739, "learning_rate": 9.632941566595357e-05, "loss": 0.03535553067922592, "step": 40 }, { "epoch": 1.3911111111111112, "eval_loss": 0.022668220102787018, "eval_runtime": 5.6373, "eval_samples_per_second": 8.87, "eval_steps_per_second": 8.87, "step": 40 }, { "epoch": 1.3911111111111112, "eval_perplexity": 1.022927096593193, "step": 40 }, { "epoch": 1.4266666666666667, "grad_norm": 0.016291167587041855, "learning_rate": 9.60561826557425e-05, "loss": 0.019891822710633278, "step": 41 }, { "epoch": 1.462222222222222, "grad_norm": 0.01630846969783306, "learning_rate": 9.577355814597031e-05, "loss": 0.023395322263240814, "step": 42 }, { "epoch": 1.4977777777777779, "grad_norm": 0.014682851731777191, "learning_rate": 9.548159976772592e-05, "loss": 0.01620781607925892, "step": 43 }, { "epoch": 1.5333333333333332, "grad_norm": 0.004914387129247189, "learning_rate": 9.518036705540458e-05, "loss": 0.006628153380006552, "step": 44 }, { "epoch": 1.568888888888889, "grad_norm": 0.005044769961386919, "learning_rate": 9.486992143456792e-05, "loss": 0.0069605098105967045, "step": 45 }, { "epoch": 1.6044444444444443, "grad_norm": 0.010346329770982265, "learning_rate": 9.45503262094184e-05, "loss": 0.009333918802440166, "step": 46 }, { "epoch": 1.6400000000000001, "grad_norm": 0.005329441279172897, "learning_rate": 9.422164654989072e-05, "loss": 0.006601989734917879, "step": 47 }, { "epoch": 1.6755555555555555, "grad_norm": 0.008117754012346268, "learning_rate": 9.388394947836279e-05, "loss": 0.006798232439905405, "step": 48 }, { "epoch": 1.7111111111111112, "grad_norm": 0.008304511196911335, "learning_rate": 9.353730385598887e-05, "loss": 0.006939806509763002, "step": 49 }, { "epoch": 1.7466666666666666, "grad_norm": 0.005011966452002525, "learning_rate": 9.318178036865785e-05, "loss": 0.005817799363285303, "step": 50 }, { "epoch": 1.7466666666666666, "eval_loss": 0.005097925662994385, "eval_runtime": 5.4641, "eval_samples_per_second": 9.151, "eval_steps_per_second": 9.151, "step": 50 }, { "epoch": 1.7466666666666666, "eval_perplexity": 1.0051109421957325, "step": 50 }, { "epoch": 1.7822222222222224, "grad_norm": 0.00494053028523922, "learning_rate": 9.281745151257946e-05, "loss": 0.005493980832397938, "step": 51 }, { "epoch": 1.8177777777777777, "grad_norm": 0.003944819793105125, "learning_rate": 9.244439157950114e-05, "loss": 0.004002867732197046, "step": 52 }, { "epoch": 1.8533333333333335, "grad_norm": 0.002889649011194706, "learning_rate": 9.206267664155907e-05, "loss": 0.00337179284542799, "step": 53 }, { "epoch": 1.8888888888888888, "grad_norm": 0.0023699572775512934, "learning_rate": 9.167238453576589e-05, "loss": 0.003095966763794422, "step": 54 }, { "epoch": 1.9244444444444444, "grad_norm": 0.009545288980007172, "learning_rate": 9.12735948481387e-05, "loss": 0.005139315500855446, "step": 55 }, { "epoch": 1.96, "grad_norm": 0.0045837461948394775, "learning_rate": 9.086638889747035e-05, "loss": 0.0036253915168344975, "step": 56 }, { "epoch": 1.9955555555555555, "grad_norm": 0.008223620243370533, "learning_rate": 9.045084971874738e-05, "loss": 0.004782550968229771, "step": 57 }, { "epoch": 2.0, "grad_norm": 0.005293046589940786, "learning_rate": 9.002706204621803e-05, "loss": 0.003609852399677038, "step": 58 }, { "epoch": 2.0355555555555553, "grad_norm": 0.0016866261139512062, "learning_rate": 8.959511229611376e-05, "loss": 0.0023398897610604763, "step": 59 }, { "epoch": 2.071111111111111, "grad_norm": 0.0024739305954426527, "learning_rate": 8.915508854902778e-05, "loss": 0.0026166446041315794, "step": 60 }, { "epoch": 2.071111111111111, "eval_loss": 0.0024453848600387573, "eval_runtime": 5.4775, "eval_samples_per_second": 9.128, "eval_steps_per_second": 9.128, "step": 60 }, { "epoch": 2.071111111111111, "eval_perplexity": 1.002448377252282, "step": 60 }, { "epoch": 2.1066666666666665, "grad_norm": 0.0023085270076990128, "learning_rate": 8.870708053195413e-05, "loss": 0.002390390494838357, "step": 61 }, { "epoch": 2.1422222222222222, "grad_norm": 0.0026797724422067404, "learning_rate": 8.825117959999116e-05, "loss": 0.002457966562360525, "step": 62 }, { "epoch": 2.1777777777777776, "grad_norm": 0.0013235695660114288, "learning_rate": 8.778747871771292e-05, "loss": 0.0019208687590435147, "step": 63 }, { "epoch": 2.2133333333333334, "grad_norm": 0.0019502972718328238, "learning_rate": 8.731607244021236e-05, "loss": 0.0020442644599825144, "step": 64 }, { "epoch": 2.2488888888888887, "grad_norm": 0.0014056526124477386, "learning_rate": 8.683705689382024e-05, "loss": 0.0020194968674331903, "step": 65 }, { "epoch": 2.2844444444444445, "grad_norm": 0.0016124699031934142, "learning_rate": 8.635052975650369e-05, "loss": 0.001853243331424892, "step": 66 }, { "epoch": 2.32, "grad_norm": 0.0014297482557594776, "learning_rate": 8.585659023794818e-05, "loss": 0.002052597003057599, "step": 67 }, { "epoch": 2.3555555555555556, "grad_norm": 0.0011592477094382048, "learning_rate": 8.535533905932738e-05, "loss": 0.0016631247708573937, "step": 68 }, { "epoch": 2.391111111111111, "grad_norm": 0.0014637873973697424, "learning_rate": 8.484687843276469e-05, "loss": 0.0018859267001971602, "step": 69 }, { "epoch": 2.4266666666666667, "grad_norm": 0.0009684404940344393, "learning_rate": 8.433131204049067e-05, "loss": 0.001511464361101389, "step": 70 }, { "epoch": 2.4266666666666667, "eval_loss": 0.0016330081271007657, "eval_runtime": 5.4569, "eval_samples_per_second": 9.163, "eval_steps_per_second": 9.163, "step": 70 }, { "epoch": 2.4266666666666667, "eval_perplexity": 1.0016343422109635, "step": 70 }, { "epoch": 2.462222222222222, "grad_norm": 0.0010153243783861399, "learning_rate": 8.380874501370097e-05, "loss": 0.0015972007531672716, "step": 71 }, { "epoch": 2.497777777777778, "grad_norm": 0.0009011203073896468, "learning_rate": 8.327928391111841e-05, "loss": 0.0013946370454505086, "step": 72 }, { "epoch": 2.533333333333333, "grad_norm": 0.0009017665288411081, "learning_rate": 8.274303669726426e-05, "loss": 0.0014331797137856483, "step": 73 }, { "epoch": 2.568888888888889, "grad_norm": 0.0009415379608981311, "learning_rate": 8.220011272044277e-05, "loss": 0.001520266872830689, "step": 74 }, { "epoch": 2.6044444444444443, "grad_norm": 0.0009506358182989061, "learning_rate": 8.165062269044353e-05, "loss": 0.001505439169704914, "step": 75 }, { "epoch": 2.64, "grad_norm": 0.0007934041786938906, "learning_rate": 8.109467865596612e-05, "loss": 0.0013778579887002707, "step": 76 }, { "epoch": 2.6755555555555555, "grad_norm": 0.0008148634806275368, "learning_rate": 8.053239398177191e-05, "loss": 0.001370853278785944, "step": 77 }, { "epoch": 2.7111111111111112, "grad_norm": 0.0006598148611374199, "learning_rate": 7.996388332556735e-05, "loss": 0.0011620635632425547, "step": 78 }, { "epoch": 2.7466666666666666, "grad_norm": 0.0008030621684156358, "learning_rate": 7.938926261462366e-05, "loss": 0.0012577238958328962, "step": 79 }, { "epoch": 2.7822222222222224, "grad_norm": 0.0008109168848022819, "learning_rate": 7.880864902213765e-05, "loss": 0.0013199358945712447, "step": 80 }, { "epoch": 2.7822222222222224, "eval_loss": 0.0013468421529978514, "eval_runtime": 5.4617, "eval_samples_per_second": 9.155, "eval_steps_per_second": 9.155, "step": 80 }, { "epoch": 2.7822222222222224, "eval_perplexity": 1.0013477495522192, "step": 80 }, { "epoch": 2.8177777777777777, "grad_norm": 0.0007556782802566886, "learning_rate": 7.822216094333847e-05, "loss": 0.001324485638178885, "step": 81 }, { "epoch": 2.8533333333333335, "grad_norm": 0.0008008314180187881, "learning_rate": 7.762991797134514e-05, "loss": 0.0012606465024873614, "step": 82 }, { "epoch": 2.888888888888889, "grad_norm": 0.0007433093851432204, "learning_rate": 7.703204087277988e-05, "loss": 0.0012966024223715067, "step": 83 }, { "epoch": 2.924444444444444, "grad_norm": 0.0007187623996287584, "learning_rate": 7.64286515631421e-05, "loss": 0.001278804033063352, "step": 84 }, { "epoch": 2.96, "grad_norm": 0.0007242705905809999, "learning_rate": 7.58198730819481e-05, "loss": 0.0012370930053293705, "step": 85 }, { "epoch": 2.9955555555555557, "grad_norm": 0.0005744029767811298, "learning_rate": 7.52058295676416e-05, "loss": 0.0010438471799716353, "step": 86 }, { "epoch": 3.0, "grad_norm": 0.0008678279700689018, "learning_rate": 7.45866462322802e-05, "loss": 0.0009476285194978118, "step": 87 }, { "epoch": 3.0355555555555553, "grad_norm": 0.0006672442541457713, "learning_rate": 7.396244933600285e-05, "loss": 0.0011832310119643807, "step": 88 }, { "epoch": 3.071111111111111, "grad_norm": 0.0007027190877124667, "learning_rate": 7.333336616128369e-05, "loss": 0.0011928146705031395, "step": 89 }, { "epoch": 3.1066666666666665, "grad_norm": 0.0005659974412992597, "learning_rate": 7.269952498697734e-05, "loss": 0.0010046998504549265, "step": 90 }, { "epoch": 3.1066666666666665, "eval_loss": 0.001156785525381565, "eval_runtime": 5.4591, "eval_samples_per_second": 9.159, "eval_steps_per_second": 9.159, "step": 90 }, { "epoch": 3.1066666666666665, "eval_perplexity": 1.0011574548598248, "step": 90 }, { "epoch": 3.1422222222222222, "grad_norm": 0.0007686283788643777, "learning_rate": 7.206105506216106e-05, "loss": 0.0012316190404817462, "step": 91 }, { "epoch": 3.1777777777777776, "grad_norm": 0.0007238875259645283, "learning_rate": 7.141808657977907e-05, "loss": 0.0012630725977942348, "step": 92 }, { "epoch": 3.2133333333333334, "grad_norm": 0.0005691683618351817, "learning_rate": 7.077075065009433e-05, "loss": 0.0010533572640269995, "step": 93 }, { "epoch": 3.2488888888888887, "grad_norm": 0.0005341364885680377, "learning_rate": 7.01191792739534e-05, "loss": 0.0009238627390004694, "step": 94 }, { "epoch": 3.2844444444444445, "grad_norm": 0.0006295841885730624, "learning_rate": 6.946350531586959e-05, "loss": 0.0011080841068178415, "step": 95 }, { "epoch": 3.32, "grad_norm": 0.000528680335264653, "learning_rate": 6.880386247692999e-05, "loss": 0.001002258388325572, "step": 96 }, { "epoch": 3.3555555555555556, "grad_norm": 0.0005391994491219521, "learning_rate": 6.814038526753205e-05, "loss": 0.0009756924118846655, "step": 97 }, { "epoch": 3.391111111111111, "grad_norm": 0.0004892258439213037, "learning_rate": 6.747320897995493e-05, "loss": 0.0009195349994115531, "step": 98 }, { "epoch": 3.4266666666666667, "grad_norm": 0.0006504295743070543, "learning_rate": 6.680246966077151e-05, "loss": 0.0010819350136443973, "step": 99 }, { "epoch": 3.462222222222222, "grad_norm": 0.0005436805658973753, "learning_rate": 6.61283040831067e-05, "loss": 0.0010187672451138496, "step": 100 }, { "epoch": 3.462222222222222, "eval_loss": 0.00102730724029243, "eval_runtime": 5.4639, "eval_samples_per_second": 9.151, "eval_steps_per_second": 9.151, "step": 100 }, { "epoch": 3.462222222222222, "eval_perplexity": 1.0010278351011184, "step": 100 }, { "epoch": 3.497777777777778, "grad_norm": 0.0005463913548737764, "learning_rate": 6.545084971874738e-05, "loss": 0.0010149093577638268, "step": 101 }, { "epoch": 3.533333333333333, "grad_norm": 0.0005039684474468231, "learning_rate": 6.477024471011001e-05, "loss": 0.0009072019602172077, "step": 102 }, { "epoch": 3.568888888888889, "grad_norm": 0.0005210865056142211, "learning_rate": 6.408662784207149e-05, "loss": 0.0009972177213057876, "step": 103 }, { "epoch": 3.6044444444444443, "grad_norm": 0.0006203350494615734, "learning_rate": 6.340013851366896e-05, "loss": 0.0010793538531288505, "step": 104 }, { "epoch": 3.64, "grad_norm": 0.0004328833019826561, "learning_rate": 6.271091670967436e-05, "loss": 0.0008299812907353044, "step": 105 }, { "epoch": 3.6755555555555555, "grad_norm": 0.0004699431301560253, "learning_rate": 6.201910297204962e-05, "loss": 0.0008918773382902145, "step": 106 }, { "epoch": 3.7111111111111112, "grad_norm": 0.0005212542018853128, "learning_rate": 6.132483837128823e-05, "loss": 0.0008914040517993271, "step": 107 }, { "epoch": 3.7466666666666666, "grad_norm": 0.000499907648190856, "learning_rate": 6.062826447764883e-05, "loss": 0.0009607981191948056, "step": 108 }, { "epoch": 3.7822222222222224, "grad_norm": 0.00046874224790371954, "learning_rate": 5.992952333228728e-05, "loss": 0.000899041595403105, "step": 109 }, { "epoch": 3.8177777777777777, "grad_norm": 0.00046614641905762255, "learning_rate": 5.9228757418292266e-05, "loss": 0.0009188801050186157, "step": 110 }, { "epoch": 3.8177777777777777, "eval_loss": 0.0009438548004254699, "eval_runtime": 5.47, "eval_samples_per_second": 9.141, "eval_steps_per_second": 9.141, "step": 110 }, { "epoch": 3.8177777777777777, "eval_perplexity": 1.0009443003715415, "step": 110 }, { "epoch": 3.8177777777777777, "step": 110, "total_flos": 1.1595012073517875e+17, "train_loss": 0.5676066864086103, "train_runtime": 733.6059, "train_samples_per_second": 4.907, "train_steps_per_second": 0.316 }, { "epoch": 3.8177777777777777, "eval_loss": 0.0009438548004254699, "eval_runtime": 5.4371, "eval_samples_per_second": 9.196, "eval_steps_per_second": 9.196, "step": 110 }, { "epoch": 3.8177777777777777, "eval_perplexity": 1.0009443003715415, "step": 110 } ], "logging_steps": 1, "max_steps": 232, "num_input_tokens_seen": 0, "num_train_epochs": 8, "save_steps": 10, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.001 }, "attributes": { "early_stopping_patience_counter": 5 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1595012073517875e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }