RuleMaze / Training_Result /regular /checkpoint /trainer_state.json
Fish-03's picture
Upload folder using huggingface_hub
056e831 verified
Raw
History Blame
24.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 13.157981349424027,
"eval_steps": 3000,
"global_step": 12000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.10970927043335162,
"grad_norm": 0.468578577041626,
"learning_rate": 5.4276315789473686e-06,
"loss": 0.5462883758544922,
"step": 100
},
{
"epoch": 0.21941854086670323,
"grad_norm": 0.45979681611061096,
"learning_rate": 1.0910087719298246e-05,
"loss": 0.2727891731262207,
"step": 200
},
{
"epoch": 0.32912781130005486,
"grad_norm": 0.6285035610198975,
"learning_rate": 1.6392543859649124e-05,
"loss": 0.20325206756591796,
"step": 300
},
{
"epoch": 0.43883708173340646,
"grad_norm": 0.49440646171569824,
"learning_rate": 2.1875e-05,
"loss": 0.17335186004638672,
"step": 400
},
{
"epoch": 0.5485463521667581,
"grad_norm": 0.3639424443244934,
"learning_rate": 2.735745614035088e-05,
"loss": 0.1450818157196045,
"step": 500
},
{
"epoch": 0.6582556226001097,
"grad_norm": 0.8926243782043457,
"learning_rate": 3.2839912280701755e-05,
"loss": 0.129285945892334,
"step": 600
},
{
"epoch": 0.7679648930334614,
"grad_norm": 0.6681469082832336,
"learning_rate": 3.8322368421052634e-05,
"loss": 0.10414340019226075,
"step": 700
},
{
"epoch": 0.8776741634668129,
"grad_norm": 0.470255583524704,
"learning_rate": 4.3804824561403514e-05,
"loss": 0.0889210319519043,
"step": 800
},
{
"epoch": 0.9873834339001646,
"grad_norm": 0.6484633684158325,
"learning_rate": 4.928728070175439e-05,
"loss": 0.08110878944396972,
"step": 900
},
{
"epoch": 1.0965441579813495,
"grad_norm": 0.42188429832458496,
"learning_rate": 5.4769736842105266e-05,
"loss": 0.0681976318359375,
"step": 1000
},
{
"epoch": 1.206253428414701,
"grad_norm": 0.38744252920150757,
"learning_rate": 6.0252192982456145e-05,
"loss": 0.059779272079467774,
"step": 1100
},
{
"epoch": 1.3159626988480526,
"grad_norm": 0.634701669216156,
"learning_rate": 6.573464912280702e-05,
"loss": 0.05309516906738281,
"step": 1200
},
{
"epoch": 1.4256719692814044,
"grad_norm": 0.3459165692329407,
"learning_rate": 7.12171052631579e-05,
"loss": 0.04944893360137939,
"step": 1300
},
{
"epoch": 1.535381239714756,
"grad_norm": 0.6033017635345459,
"learning_rate": 7.669956140350878e-05,
"loss": 0.04666784286499023,
"step": 1400
},
{
"epoch": 1.6450905101481075,
"grad_norm": 0.6594127416610718,
"learning_rate": 8.218201754385966e-05,
"loss": 0.04396382808685303,
"step": 1500
},
{
"epoch": 1.7547997805814592,
"grad_norm": 0.1653222292661667,
"learning_rate": 8.766447368421054e-05,
"loss": 0.041247625350952145,
"step": 1600
},
{
"epoch": 1.8645090510148108,
"grad_norm": 0.3759867548942566,
"learning_rate": 9.314692982456141e-05,
"loss": 0.03404149293899536,
"step": 1700
},
{
"epoch": 1.9742183214481623,
"grad_norm": 0.23973219096660614,
"learning_rate": 9.862938596491229e-05,
"loss": 0.03183579921722412,
"step": 1800
},
{
"epoch": 2.0833790455293473,
"grad_norm": 0.325320303440094,
"learning_rate": 9.999484984691653e-05,
"loss": 0.03078770637512207,
"step": 1900
},
{
"epoch": 2.193088315962699,
"grad_norm": 0.16789975762367249,
"learning_rate": 9.9971962417026e-05,
"loss": 0.027160501480102538,
"step": 2000
},
{
"epoch": 2.3027975863960504,
"grad_norm": 0.39737239480018616,
"learning_rate": 9.993077384438713e-05,
"loss": 0.024041428565979003,
"step": 2100
},
{
"epoch": 2.412506856829402,
"grad_norm": 0.36602410674095154,
"learning_rate": 9.987129921341749e-05,
"loss": 0.023267135620117188,
"step": 2200
},
{
"epoch": 2.5222161272627535,
"grad_norm": 0.05183083936572075,
"learning_rate": 9.97935603054052e-05,
"loss": 0.02218881607055664,
"step": 2300
},
{
"epoch": 2.6319253976961052,
"grad_norm": 0.23794086277484894,
"learning_rate": 9.969758559053199e-05,
"loss": 0.019391658306121825,
"step": 2400
},
{
"epoch": 2.741634668129457,
"grad_norm": 0.46757692098617554,
"learning_rate": 9.958341021744668e-05,
"loss": 0.015924193859100343,
"step": 2500
},
{
"epoch": 2.8513439385628088,
"grad_norm": 0.3365223705768585,
"learning_rate": 9.945107600039271e-05,
"loss": 0.016793460845947267,
"step": 2600
},
{
"epoch": 2.96105320899616,
"grad_norm": 0.10865141451358795,
"learning_rate": 9.930063140389458e-05,
"loss": 0.015737195014953614,
"step": 2700
},
{
"epoch": 3.070213933077345,
"grad_norm": 0.12908822298049927,
"learning_rate": 9.913213152500879e-05,
"loss": 0.012379565238952638,
"step": 2800
},
{
"epoch": 3.179923203510697,
"grad_norm": 0.39894333481788635,
"learning_rate": 9.89456380731457e-05,
"loss": 0.010362827777862548,
"step": 2900
},
{
"epoch": 3.289632473944048,
"grad_norm": 0.18888452649116516,
"learning_rate": 9.874121934746984e-05,
"loss": 0.010273929834365845,
"step": 3000
},
{
"epoch": 3.289632473944048,
"eval_loss": 0.11601941287517548,
"eval_runtime": 116.5005,
"eval_samples_per_second": 27.631,
"eval_steps_per_second": 6.91,
"step": 3000
},
{
"epoch": 3.3993417443774,
"grad_norm": 0.24296416342258453,
"learning_rate": 9.851895021188692e-05,
"loss": 0.008741957545280456,
"step": 3100
},
{
"epoch": 3.5090510148107517,
"grad_norm": 0.18995995819568634,
"learning_rate": 9.827891206762634e-05,
"loss": 0.009190759658813476,
"step": 3200
},
{
"epoch": 3.618760285244103,
"grad_norm": 0.1456049531698227,
"learning_rate": 9.802119282342995e-05,
"loss": 0.009634263515472412,
"step": 3300
},
{
"epoch": 3.7284695556774547,
"grad_norm": 0.9678109288215637,
"learning_rate": 9.774588686335731e-05,
"loss": 0.008319487571716308,
"step": 3400
},
{
"epoch": 3.8381788261108065,
"grad_norm": 0.08138152211904526,
"learning_rate": 9.74530950122196e-05,
"loss": 0.009371925592422486,
"step": 3500
},
{
"epoch": 3.947888096544158,
"grad_norm": 0.5730862617492676,
"learning_rate": 9.71429244986547e-05,
"loss": 0.007398140430450439,
"step": 3600
},
{
"epoch": 4.057048820625343,
"grad_norm": 0.508908748626709,
"learning_rate": 9.681548891585711e-05,
"loss": 0.00682299017906189,
"step": 3700
},
{
"epoch": 4.1667580910586945,
"grad_norm": 0.507350504398346,
"learning_rate": 9.647090817997684e-05,
"loss": 0.0053677594661712645,
"step": 3800
},
{
"epoch": 4.276467361492046,
"grad_norm": 0.24189727008342743,
"learning_rate": 9.610930848620274e-05,
"loss": 0.003890502452850342,
"step": 3900
},
{
"epoch": 4.386176631925398,
"grad_norm": 0.012589801102876663,
"learning_rate": 9.573082226254632e-05,
"loss": 0.006510751247406006,
"step": 4000
},
{
"epoch": 4.495885902358749,
"grad_norm": 0.06403769552707672,
"learning_rate": 9.533558812134284e-05,
"loss": 0.00700473427772522,
"step": 4100
},
{
"epoch": 4.605595172792101,
"grad_norm": 0.04759138450026512,
"learning_rate": 9.492375080848754e-05,
"loss": 0.008159146308898926,
"step": 4200
},
{
"epoch": 4.7153044432254525,
"grad_norm": 0.1282065361738205,
"learning_rate": 9.449546115042562e-05,
"loss": 0.0043099141120910645,
"step": 4300
},
{
"epoch": 4.825013713658804,
"grad_norm": 0.06390748172998428,
"learning_rate": 9.405087599891538e-05,
"loss": 0.006736204624176025,
"step": 4400
},
{
"epoch": 4.934722984092156,
"grad_norm": 0.3489040434360504,
"learning_rate": 9.35901581735846e-05,
"loss": 0.005642812252044677,
"step": 4500
},
{
"epoch": 5.0438837081733405,
"grad_norm": 0.06407257169485092,
"learning_rate": 9.311347640230149e-05,
"loss": 0.004873534739017487,
"step": 4600
},
{
"epoch": 5.153592978606692,
"grad_norm": 0.4154542088508606,
"learning_rate": 9.262100525938174e-05,
"loss": 0.003611042499542236,
"step": 4700
},
{
"epoch": 5.263302249040044,
"grad_norm": 0.35824549198150635,
"learning_rate": 9.211292510165441e-05,
"loss": 0.004827427566051483,
"step": 4800
},
{
"epoch": 5.373011519473396,
"grad_norm": 0.018712563440203667,
"learning_rate": 9.158942200241036e-05,
"loss": 0.0049249035120010375,
"step": 4900
},
{
"epoch": 5.482720789906747,
"grad_norm": 0.38031527400016785,
"learning_rate": 9.105068768325671e-05,
"loss": 0.003927983045578003,
"step": 5000
},
{
"epoch": 5.5924300603400985,
"grad_norm": 0.15979327261447906,
"learning_rate": 9.049691944390318e-05,
"loss": 0.004007718861103058,
"step": 5100
},
{
"epoch": 5.70213933077345,
"grad_norm": 0.16055099666118622,
"learning_rate": 8.99283200899053e-05,
"loss": 0.0029034724831581114,
"step": 5200
},
{
"epoch": 5.811848601206802,
"grad_norm": 0.04370570927858353,
"learning_rate": 8.934509785839125e-05,
"loss": 0.002957637310028076,
"step": 5300
},
{
"epoch": 5.921557871640154,
"grad_norm": 0.4308537244796753,
"learning_rate": 8.874746634179962e-05,
"loss": 0.006440707445144653,
"step": 5400
},
{
"epoch": 6.030718595721338,
"grad_norm": 0.0070524257607758045,
"learning_rate": 8.813564440965575e-05,
"loss": 0.003051069974899292,
"step": 5500
},
{
"epoch": 6.14042786615469,
"grad_norm": 0.0011389772407710552,
"learning_rate": 8.750985612841563e-05,
"loss": 0.0020513579249382017,
"step": 5600
},
{
"epoch": 6.250137136588042,
"grad_norm": 0.3267161250114441,
"learning_rate": 8.687033067940638e-05,
"loss": 0.0032824283838272096,
"step": 5700
},
{
"epoch": 6.359846407021394,
"grad_norm": 0.22967475652694702,
"learning_rate": 8.621730227489358e-05,
"loss": 0.0017755647003650666,
"step": 5800
},
{
"epoch": 6.4695556774547445,
"grad_norm": 0.11276954412460327,
"learning_rate": 8.555101007230614e-05,
"loss": 0.0023945705592632294,
"step": 5900
},
{
"epoch": 6.579264947888096,
"grad_norm": 0.029238076880574226,
"learning_rate": 8.487169808665014e-05,
"loss": 0.007325031161308289,
"step": 6000
},
{
"epoch": 6.579264947888096,
"eval_loss": 0.09214479476213455,
"eval_runtime": 116.3647,
"eval_samples_per_second": 27.663,
"eval_steps_per_second": 6.918,
"step": 6000
},
{
"epoch": 6.688974218321448,
"grad_norm": 0.04784254729747772,
"learning_rate": 8.417961510114356e-05,
"loss": 0.003531929850578308,
"step": 6100
},
{
"epoch": 6.7986834887548,
"grad_norm": 0.025865700095891953,
"learning_rate": 8.347501457610494e-05,
"loss": 0.004350661635398865,
"step": 6200
},
{
"epoch": 6.9083927591881515,
"grad_norm": 0.07848550379276276,
"learning_rate": 8.275815455612899e-05,
"loss": 0.003835231363773346,
"step": 6300
},
{
"epoch": 7.017553483269336,
"grad_norm": 0.5314407348632812,
"learning_rate": 8.20292975755834e-05,
"loss": 0.003852725923061371,
"step": 6400
},
{
"epoch": 7.127262753702688,
"grad_norm": 0.004145840182900429,
"learning_rate": 8.12887105624614e-05,
"loss": 0.0037556231021881104,
"step": 6500
},
{
"epoch": 7.23697202413604,
"grad_norm": 0.01268320344388485,
"learning_rate": 8.053666474062508e-05,
"loss": 0.0029447203874588012,
"step": 6600
},
{
"epoch": 7.346681294569391,
"grad_norm": 0.16281633079051971,
"learning_rate": 7.97734355304757e-05,
"loss": 0.002923213243484497,
"step": 6700
},
{
"epoch": 7.456390565002743,
"grad_norm": 0.14518429338932037,
"learning_rate": 7.89993024480868e-05,
"loss": 0.0024193134903907777,
"step": 6800
},
{
"epoch": 7.566099835436094,
"grad_norm": 0.3797168433666229,
"learning_rate": 7.821454900283775e-05,
"loss": 0.0024912458658218383,
"step": 6900
},
{
"epoch": 7.675809105869446,
"grad_norm": 0.5517730712890625,
"learning_rate": 7.741946259358434e-05,
"loss": 0.0023130226135253907,
"step": 7000
},
{
"epoch": 7.7855183763027975,
"grad_norm": 0.22722378373146057,
"learning_rate": 7.661433440340549e-05,
"loss": 0.0026683008670806887,
"step": 7100
},
{
"epoch": 7.895227646736149,
"grad_norm": 0.07195847481489182,
"learning_rate": 7.579945929296352e-05,
"loss": 0.00318217933177948,
"step": 7200
},
{
"epoch": 8.004388370817335,
"grad_norm": 0.07402148842811584,
"learning_rate": 7.49751356925181e-05,
"loss": 0.0024203072488307954,
"step": 7300
},
{
"epoch": 8.114097641250686,
"grad_norm": 0.0004932262236252427,
"learning_rate": 7.414166549263253e-05,
"loss": 0.0005915772542357445,
"step": 7400
},
{
"epoch": 8.223806911684036,
"grad_norm": 0.14862555265426636,
"learning_rate": 7.329935393361286e-05,
"loss": 0.0015757225453853607,
"step": 7500
},
{
"epoch": 8.333516182117389,
"grad_norm": 0.11636239290237427,
"learning_rate": 7.244850949372044e-05,
"loss": 0.0014248163998126983,
"step": 7600
},
{
"epoch": 8.44322545255074,
"grad_norm": 0.02938424050807953,
"learning_rate": 7.158944377619829e-05,
"loss": 0.0008066059648990632,
"step": 7700
},
{
"epoch": 8.552934722984093,
"grad_norm": 0.003459229366853833,
"learning_rate": 7.072247139515337e-05,
"loss": 0.0007172146439552307,
"step": 7800
},
{
"epoch": 8.662643993417444,
"grad_norm": 1.0215219259262085,
"learning_rate": 6.984790986033582e-05,
"loss": 0.0024658374488353728,
"step": 7900
},
{
"epoch": 8.772353263850796,
"grad_norm": 0.04188821464776993,
"learning_rate": 6.896607946085818e-05,
"loss": 0.003845172226428986,
"step": 8000
},
{
"epoch": 8.882062534284147,
"grad_norm": 0.21492426097393036,
"learning_rate": 6.807730314789622e-05,
"loss": 0.0034224957227706907,
"step": 8100
},
{
"epoch": 8.991771804717498,
"grad_norm": 0.001628322177566588,
"learning_rate": 6.71819064164153e-05,
"loss": 0.0017799775302410126,
"step": 8200
},
{
"epoch": 9.100932528798683,
"grad_norm": 0.10092741996049881,
"learning_rate": 6.628021718596485e-05,
"loss": 0.0018181195855140686,
"step": 8300
},
{
"epoch": 9.210641799232036,
"grad_norm": 0.011512243188917637,
"learning_rate": 6.537256568058492e-05,
"loss": 0.0007427728176116943,
"step": 8400
},
{
"epoch": 9.320351069665387,
"grad_norm": 0.05302899330854416,
"learning_rate": 6.445928430786898e-05,
"loss": 0.0031538277864456175,
"step": 8500
},
{
"epoch": 9.430060340098738,
"grad_norm": 0.003643701085820794,
"learning_rate": 6.354070753722674e-05,
"loss": 0.0019684681296348572,
"step": 8600
},
{
"epoch": 9.53976961053209,
"grad_norm": 0.005743952933698893,
"learning_rate": 6.261717177739202e-05,
"loss": 0.002124977260828018,
"step": 8700
},
{
"epoch": 9.649478880965441,
"grad_norm": 0.0006560595938935876,
"learning_rate": 6.168901525322048e-05,
"loss": 0.002307926416397095,
"step": 8800
},
{
"epoch": 9.759188151398794,
"grad_norm": 0.014800022356212139,
"learning_rate": 6.075657788182201e-05,
"loss": 0.0020691359043121336,
"step": 8900
},
{
"epoch": 9.868897421832145,
"grad_norm": 0.00023062083346303552,
"learning_rate": 5.982020114807359e-05,
"loss": 0.0011634621024131774,
"step": 9000
},
{
"epoch": 9.868897421832145,
"eval_loss": 0.10657082498073578,
"eval_runtime": 116.1296,
"eval_samples_per_second": 27.719,
"eval_steps_per_second": 6.932,
"step": 9000
},
{
"epoch": 9.978606692265496,
"grad_norm": 0.005069139879196882,
"learning_rate": 5.888022797955783e-05,
"loss": 0.000807158499956131,
"step": 9100
},
{
"epoch": 10.087767416346681,
"grad_norm": 0.0007675938541069627,
"learning_rate": 5.793700262097326e-05,
"loss": 0.000818609818816185,
"step": 9200
},
{
"epoch": 10.197476686780034,
"grad_norm": 8.392518066102639e-05,
"learning_rate": 5.699087050806219e-05,
"loss": 0.0002204919047653675,
"step": 9300
},
{
"epoch": 10.307185957213385,
"grad_norm": 0.001035814406350255,
"learning_rate": 5.604217814110233e-05,
"loss": 0.0010148981213569642,
"step": 9400
},
{
"epoch": 10.416895227646735,
"grad_norm": 0.0005645599449053407,
"learning_rate": 5.509127295800873e-05,
"loss": 0.0009634912759065628,
"step": 9500
},
{
"epoch": 10.526604498080088,
"grad_norm": 0.006124628707766533,
"learning_rate": 5.413850320709213e-05,
"loss": 0.002135903686285019,
"step": 9600
},
{
"epoch": 10.636313768513439,
"grad_norm": 0.015287889167666435,
"learning_rate": 5.318421781952063e-05,
"loss": 0.001537524163722992,
"step": 9700
},
{
"epoch": 10.746023038946792,
"grad_norm": 0.0016915776068344712,
"learning_rate": 5.2228766281531184e-05,
"loss": 0.000581161379814148,
"step": 9800
},
{
"epoch": 10.855732309380143,
"grad_norm": 0.039407797157764435,
"learning_rate": 5.127249850643801e-05,
"loss": 0.0010789106786251068,
"step": 9900
},
{
"epoch": 10.965441579813493,
"grad_norm": 0.0032954695634543896,
"learning_rate": 5.031576470648437e-05,
"loss": 0.0008925460278987885,
"step": 10000
},
{
"epoch": 11.074602303894679,
"grad_norm": 0.0008019655360840261,
"learning_rate": 4.935891526458493e-05,
"loss": 0.0006475619226694107,
"step": 10100
},
{
"epoch": 11.184311574328031,
"grad_norm": 0.001246742787770927,
"learning_rate": 4.840230060600579e-05,
"loss": 0.001001117080450058,
"step": 10200
},
{
"epoch": 11.294020844761382,
"grad_norm": 0.004168672487139702,
"learning_rate": 4.744627107002866e-05,
"loss": 0.0009924402087926865,
"step": 10300
},
{
"epoch": 11.403730115194733,
"grad_norm": 0.006193607579916716,
"learning_rate": 4.649117678164694e-05,
"loss": 0.0007412029802799225,
"step": 10400
},
{
"epoch": 11.513439385628086,
"grad_norm": 0.04498029127717018,
"learning_rate": 4.5537367523339915e-05,
"loss": 0.001676485538482666,
"step": 10500
},
{
"epoch": 11.623148656061437,
"grad_norm": 0.0013482400681823492,
"learning_rate": 4.458519260697263e-05,
"loss": 0.0006184951961040497,
"step": 10600
},
{
"epoch": 11.73285792649479,
"grad_norm": 0.04078209772706032,
"learning_rate": 4.363500074586795e-05,
"loss": 0.00015302015468478204,
"step": 10700
},
{
"epoch": 11.84256719692814,
"grad_norm": 0.00041609694017097354,
"learning_rate": 4.268713992709801e-05,
"loss": 0.0001718943752348423,
"step": 10800
},
{
"epoch": 11.952276467361493,
"grad_norm": 0.001313285669311881,
"learning_rate": 4.1741957284041396e-05,
"loss": 0.0002560199424624443,
"step": 10900
},
{
"epoch": 12.061437191442677,
"grad_norm": 0.20023229718208313,
"learning_rate": 4.079979896925319e-05,
"loss": 0.001909550279378891,
"step": 11000
},
{
"epoch": 12.17114646187603,
"grad_norm": 0.017514726147055626,
"learning_rate": 3.986101002769419e-05,
"loss": 0.00020196065306663514,
"step": 11100
},
{
"epoch": 12.28085573230938,
"grad_norm": 9.268768189940602e-05,
"learning_rate": 3.89259342703655e-05,
"loss": 0.0002678022161126137,
"step": 11200
},
{
"epoch": 12.390565002742731,
"grad_norm": 0.00034697377122938633,
"learning_rate": 3.799491414839556e-05,
"loss": 0.00046276580542325974,
"step": 11300
},
{
"epoch": 12.500274273176084,
"grad_norm": 0.0007233850774355233,
"learning_rate": 3.7068290627624544e-05,
"loss": 0.0004483434557914734,
"step": 11400
},
{
"epoch": 12.609983543609435,
"grad_norm": 0.00960569642484188,
"learning_rate": 3.614640306373329e-05,
"loss": 0.00046372778713703154,
"step": 11500
},
{
"epoch": 12.719692814042787,
"grad_norm": 8.914520003600046e-05,
"learning_rate": 3.522958907796155e-05,
"loss": 0.0001941412128508091,
"step": 11600
},
{
"epoch": 12.829402084476138,
"grad_norm": 0.00025227374862879515,
"learning_rate": 3.431818443346164e-05,
"loss": 7.15433107689023e-05,
"step": 11700
},
{
"epoch": 12.939111354909489,
"grad_norm": 7.685183663852513e-05,
"learning_rate": 3.341252291233241e-05,
"loss": 0.0002717839926481247,
"step": 11800
},
{
"epoch": 13.048272078990674,
"grad_norm": 2.5767532861209475e-05,
"learning_rate": 3.251293619337889e-05,
"loss": 5.591163411736489e-05,
"step": 11900
},
{
"epoch": 13.157981349424027,
"grad_norm": 7.815273420419544e-05,
"learning_rate": 3.161975373064217e-05,
"loss": 1.8522043246775867e-05,
"step": 12000
},
{
"epoch": 13.157981349424027,
"eval_loss": 0.15513338148593903,
"eval_runtime": 107.1852,
"eval_samples_per_second": 30.032,
"eval_steps_per_second": 7.51,
"step": 12000
}
],
"logging_steps": 100,
"max_steps": 18240,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 3000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.758640217053987e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}