roun1-traing-final / trainer_state.json
master103525's picture
Upload folder using huggingface_hub
4be8e89 verified
Raw
History Blame Contribute Delete
46.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.6337188923939713,
"eval_steps": 500,
"global_step": 904,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0035050823694356818,
"grad_norm": 34.28617477416992,
"learning_rate": 1.6634586466165415e-06,
"loss": 0.3831,
"mean_token_accuracy": 0.8712963074445724,
"num_tokens": 344200.0,
"step": 5
},
{
"epoch": 0.0070101647388713636,
"grad_norm": 2.2588274478912354,
"learning_rate": 3.7427819548872183e-06,
"loss": 0.1348,
"mean_token_accuracy": 0.9599537253379822,
"num_tokens": 689149.0,
"step": 10
},
{
"epoch": 0.010515247108307046,
"grad_norm": 0.7412953972816467,
"learning_rate": 5.822105263157896e-06,
"loss": 0.1038,
"mean_token_accuracy": 0.9601852089166641,
"num_tokens": 1035106.0,
"step": 15
},
{
"epoch": 0.014020329477742727,
"grad_norm": 0.8367692828178406,
"learning_rate": 7.901428571428572e-06,
"loss": 0.092,
"mean_token_accuracy": 0.9664351999759674,
"num_tokens": 1384179.0,
"step": 20
},
{
"epoch": 0.01752541184717841,
"grad_norm": 0.9332820773124695,
"learning_rate": 9.98075187969925e-06,
"loss": 0.0722,
"mean_token_accuracy": 0.9747685253620147,
"num_tokens": 1731414.0,
"step": 25
},
{
"epoch": 0.02103049421661409,
"grad_norm": 1.3677386045455933,
"learning_rate": 1.2060075187969928e-05,
"loss": 0.0689,
"mean_token_accuracy": 0.977314829826355,
"num_tokens": 2081016.0,
"step": 30
},
{
"epoch": 0.02453557658604977,
"grad_norm": 0.9507705569267273,
"learning_rate": 1.4139398496240603e-05,
"loss": 0.0602,
"mean_token_accuracy": 0.9782407462596894,
"num_tokens": 2425641.0,
"step": 35
},
{
"epoch": 0.028040658955485454,
"grad_norm": 0.9917059540748596,
"learning_rate": 1.4555208926572781e-05,
"loss": 0.0509,
"mean_token_accuracy": 0.9810185313224793,
"num_tokens": 2772582.0,
"step": 40
},
{
"epoch": 0.031545741324921134,
"grad_norm": 0.5380669236183167,
"learning_rate": 1.4554988613674284e-05,
"loss": 0.0557,
"mean_token_accuracy": 0.9784722357988358,
"num_tokens": 3116560.0,
"step": 45
},
{
"epoch": 0.03505082369435682,
"grad_norm": 0.6936527490615845,
"learning_rate": 1.4554598836576865e-05,
"loss": 0.052,
"mean_token_accuracy": 0.9803240865468978,
"num_tokens": 3462279.0,
"step": 50
},
{
"epoch": 0.0385559060637925,
"grad_norm": 0.7106812596321106,
"learning_rate": 1.4554039607382746e-05,
"loss": 0.0494,
"mean_token_accuracy": 0.9807870477437973,
"num_tokens": 3807370.0,
"step": 55
},
{
"epoch": 0.04206098843322818,
"grad_norm": 1.0563263893127441,
"learning_rate": 1.4553310943455462e-05,
"loss": 0.0398,
"mean_token_accuracy": 0.9849537283182144,
"num_tokens": 4153983.0,
"step": 60
},
{
"epoch": 0.04556607080266386,
"grad_norm": 0.7298295497894287,
"learning_rate": 1.4552412867419349e-05,
"loss": 0.0467,
"mean_token_accuracy": 0.9833333402872085,
"num_tokens": 4499283.0,
"step": 65
},
{
"epoch": 0.04907115317209954,
"grad_norm": 0.5817667841911316,
"learning_rate": 1.4551345407158823e-05,
"loss": 0.0488,
"mean_token_accuracy": 0.9791666716337204,
"num_tokens": 4843821.0,
"step": 70
},
{
"epoch": 0.052576235541535225,
"grad_norm": 0.4315837025642395,
"learning_rate": 1.455010859581752e-05,
"loss": 0.0381,
"mean_token_accuracy": 0.9861111283302307,
"num_tokens": 5189702.0,
"step": 75
},
{
"epoch": 0.05608131791097091,
"grad_norm": 0.6540916562080383,
"learning_rate": 1.4548702471797281e-05,
"loss": 0.0364,
"mean_token_accuracy": 0.9872685372829437,
"num_tokens": 5536282.0,
"step": 80
},
{
"epoch": 0.05958640028040659,
"grad_norm": 0.6374391317367554,
"learning_rate": 1.4547127078756926e-05,
"loss": 0.0319,
"mean_token_accuracy": 0.9879629909992218,
"num_tokens": 5880437.0,
"step": 85
},
{
"epoch": 0.06309148264984227,
"grad_norm": 0.6164258718490601,
"learning_rate": 1.4545382465610937e-05,
"loss": 0.0288,
"mean_token_accuracy": 0.987500011920929,
"num_tokens": 6229654.0,
"step": 90
},
{
"epoch": 0.06659656501927795,
"grad_norm": 0.5443395972251892,
"learning_rate": 1.4543468686527915e-05,
"loss": 0.0452,
"mean_token_accuracy": 0.9826389074325561,
"num_tokens": 6574571.0,
"step": 95
},
{
"epoch": 0.07010164738871363,
"grad_norm": 0.40494611859321594,
"learning_rate": 1.45413858009289e-05,
"loss": 0.0369,
"mean_token_accuracy": 0.9851852089166642,
"num_tokens": 6922334.0,
"step": 100
},
{
"epoch": 0.07360672975814932,
"grad_norm": 0.4939163029193878,
"learning_rate": 1.453913387348554e-05,
"loss": 0.0338,
"mean_token_accuracy": 0.9858796447515488,
"num_tokens": 7267485.0,
"step": 105
},
{
"epoch": 0.077111812127585,
"grad_norm": 0.5785835981369019,
"learning_rate": 1.453671297411807e-05,
"loss": 0.0402,
"mean_token_accuracy": 0.9858796387910843,
"num_tokens": 7613308.0,
"step": 110
},
{
"epoch": 0.08061689449702068,
"grad_norm": 0.6168781518936157,
"learning_rate": 1.4534123177993137e-05,
"loss": 0.0355,
"mean_token_accuracy": 0.9856481611728668,
"num_tokens": 7959953.0,
"step": 115
},
{
"epoch": 0.08412197686645637,
"grad_norm": 0.5103176832199097,
"learning_rate": 1.4531364565521482e-05,
"loss": 0.0333,
"mean_token_accuracy": 0.9861111402511596,
"num_tokens": 8307851.0,
"step": 120
},
{
"epoch": 0.08762705923589205,
"grad_norm": 0.6440109610557556,
"learning_rate": 1.452843722235544e-05,
"loss": 0.0406,
"mean_token_accuracy": 0.9840277969837189,
"num_tokens": 8652302.0,
"step": 125
},
{
"epoch": 0.09113214160532772,
"grad_norm": 0.38599690794944763,
"learning_rate": 1.4525341239386265e-05,
"loss": 0.0338,
"mean_token_accuracy": 0.9877315014600754,
"num_tokens": 8997305.0,
"step": 130
},
{
"epoch": 0.0946372239747634,
"grad_norm": 0.3226912021636963,
"learning_rate": 1.452207671274132e-05,
"loss": 0.0316,
"mean_token_accuracy": 0.9886574268341064,
"num_tokens": 9343578.0,
"step": 135
},
{
"epoch": 0.09814230634419908,
"grad_norm": 0.3602822422981262,
"learning_rate": 1.45186437437811e-05,
"loss": 0.0264,
"mean_token_accuracy": 0.9881944715976715,
"num_tokens": 9689335.0,
"step": 140
},
{
"epoch": 0.10164738871363477,
"grad_norm": 0.5718931555747986,
"learning_rate": 1.4515042439096063e-05,
"loss": 0.0393,
"mean_token_accuracy": 0.9849537163972855,
"num_tokens": 10035392.0,
"step": 145
},
{
"epoch": 0.10515247108307045,
"grad_norm": 0.4808923006057739,
"learning_rate": 1.4511272910503343e-05,
"loss": 0.0319,
"mean_token_accuracy": 0.9875000268220901,
"num_tokens": 10381828.0,
"step": 150
},
{
"epoch": 0.10865755345250613,
"grad_norm": 0.2157701849937439,
"learning_rate": 1.4507335275043267e-05,
"loss": 0.0254,
"mean_token_accuracy": 0.9898148387670517,
"num_tokens": 10728103.0,
"step": 155
},
{
"epoch": 0.11216263582194182,
"grad_norm": 0.4944171905517578,
"learning_rate": 1.4503229654975717e-05,
"loss": 0.032,
"mean_token_accuracy": 0.9877315104007721,
"num_tokens": 11074857.0,
"step": 160
},
{
"epoch": 0.1156677181913775,
"grad_norm": 0.4375927448272705,
"learning_rate": 1.449895617777635e-05,
"loss": 0.0318,
"mean_token_accuracy": 0.9868055731058121,
"num_tokens": 11420935.0,
"step": 165
},
{
"epoch": 0.11917280056081318,
"grad_norm": 0.3322710692882538,
"learning_rate": 1.4494514976132613e-05,
"loss": 0.0285,
"mean_token_accuracy": 0.9891203850507736,
"num_tokens": 11767206.0,
"step": 170
},
{
"epoch": 0.12267788293024887,
"grad_norm": 0.32739579677581787,
"learning_rate": 1.4489906187939658e-05,
"loss": 0.0256,
"mean_token_accuracy": 0.9900463253259659,
"num_tokens": 12113613.0,
"step": 175
},
{
"epoch": 0.12618296529968454,
"grad_norm": 0.46730878949165344,
"learning_rate": 1.4485129956296029e-05,
"loss": 0.0328,
"mean_token_accuracy": 0.9870370507240296,
"num_tokens": 12458188.0,
"step": 180
},
{
"epoch": 0.12968804766912023,
"grad_norm": 0.546477735042572,
"learning_rate": 1.4480186429499237e-05,
"loss": 0.0324,
"mean_token_accuracy": 0.9870370596647262,
"num_tokens": 12804081.0,
"step": 185
},
{
"epoch": 0.1331931300385559,
"grad_norm": 0.5323887467384338,
"learning_rate": 1.4475075761041149e-05,
"loss": 0.0274,
"mean_token_accuracy": 0.9879629820585251,
"num_tokens": 13150545.0,
"step": 190
},
{
"epoch": 0.1366982124079916,
"grad_norm": 0.38450950384140015,
"learning_rate": 1.4469798109603229e-05,
"loss": 0.0317,
"mean_token_accuracy": 0.9868055820465088,
"num_tokens": 13495797.0,
"step": 195
},
{
"epoch": 0.14020329477742727,
"grad_norm": 0.4323956370353699,
"learning_rate": 1.4464353639051596e-05,
"loss": 0.0299,
"mean_token_accuracy": 0.9884259521961212,
"num_tokens": 13841841.0,
"step": 200
},
{
"epoch": 0.14370837714686296,
"grad_norm": 0.2992998957633972,
"learning_rate": 1.4458742518431953e-05,
"loss": 0.0264,
"mean_token_accuracy": 0.9900463253259659,
"num_tokens": 14190171.0,
"step": 205
},
{
"epoch": 0.14721345951629863,
"grad_norm": 0.5052563548088074,
"learning_rate": 1.4452964921964331e-05,
"loss": 0.0318,
"mean_token_accuracy": 0.9898148447275161,
"num_tokens": 14535839.0,
"step": 210
},
{
"epoch": 0.1507185418857343,
"grad_norm": 0.4144446849822998,
"learning_rate": 1.444702102903768e-05,
"loss": 0.0303,
"mean_token_accuracy": 0.9875000178813934,
"num_tokens": 14881253.0,
"step": 215
},
{
"epoch": 0.15422362425517,
"grad_norm": 0.5403540134429932,
"learning_rate": 1.4440911024204294e-05,
"loss": 0.0283,
"mean_token_accuracy": 0.9875000298023224,
"num_tokens": 15226228.0,
"step": 220
},
{
"epoch": 0.15772870662460567,
"grad_norm": 0.4785594046115875,
"learning_rate": 1.443463509717409e-05,
"loss": 0.031,
"mean_token_accuracy": 0.9865740895271301,
"num_tokens": 15571620.0,
"step": 225
},
{
"epoch": 0.16123378899404137,
"grad_norm": 0.41378340125083923,
"learning_rate": 1.442819344280871e-05,
"loss": 0.0238,
"mean_token_accuracy": 0.9907407611608505,
"num_tokens": 15918913.0,
"step": 230
},
{
"epoch": 0.16473887136347704,
"grad_norm": 0.4847274124622345,
"learning_rate": 1.4421586261115488e-05,
"loss": 0.0278,
"mean_token_accuracy": 0.9893518805503845,
"num_tokens": 16267955.0,
"step": 235
},
{
"epoch": 0.16824395373291273,
"grad_norm": 0.31813815236091614,
"learning_rate": 1.4414813757241202e-05,
"loss": 0.0313,
"mean_token_accuracy": 0.9881944686174393,
"num_tokens": 16612410.0,
"step": 240
},
{
"epoch": 0.1717490361023484,
"grad_norm": 0.3177052438259125,
"learning_rate": 1.4407876141465748e-05,
"loss": 0.0266,
"mean_token_accuracy": 0.9891204059123992,
"num_tokens": 16957764.0,
"step": 245
},
{
"epoch": 0.1752541184717841,
"grad_norm": 0.3826673924922943,
"learning_rate": 1.4400773629195588e-05,
"loss": 0.0357,
"mean_token_accuracy": 0.9847222417593002,
"num_tokens": 17304294.0,
"step": 250
},
{
"epoch": 0.17875920084121977,
"grad_norm": 0.48539939522743225,
"learning_rate": 1.4393506440957055e-05,
"loss": 0.0278,
"mean_token_accuracy": 0.9884259581565857,
"num_tokens": 17650961.0,
"step": 255
},
{
"epoch": 0.18226428321065544,
"grad_norm": 0.626573383808136,
"learning_rate": 1.4386074802389532e-05,
"loss": 0.0337,
"mean_token_accuracy": 0.9875000298023224,
"num_tokens": 17995184.0,
"step": 260
},
{
"epoch": 0.18576936558009113,
"grad_norm": 0.5070188641548157,
"learning_rate": 1.4378478944238419e-05,
"loss": 0.0326,
"mean_token_accuracy": 0.9877315104007721,
"num_tokens": 18341450.0,
"step": 265
},
{
"epoch": 0.1892744479495268,
"grad_norm": 0.41273266077041626,
"learning_rate": 1.4370719102347984e-05,
"loss": 0.0321,
"mean_token_accuracy": 0.9879629909992218,
"num_tokens": 18688049.0,
"step": 270
},
{
"epoch": 0.1927795303189625,
"grad_norm": 0.2910098433494568,
"learning_rate": 1.4362795517654034e-05,
"loss": 0.024,
"mean_token_accuracy": 0.9907407641410828,
"num_tokens": 19033873.0,
"step": 275
},
{
"epoch": 0.19628461268839817,
"grad_norm": 0.4974495768547058,
"learning_rate": 1.435470843617644e-05,
"loss": 0.0267,
"mean_token_accuracy": 0.9900463253259659,
"num_tokens": 19378640.0,
"step": 280
},
{
"epoch": 0.19978969505783387,
"grad_norm": 0.36540356278419495,
"learning_rate": 1.4346458109011491e-05,
"loss": 0.027,
"mean_token_accuracy": 0.9888889104127884,
"num_tokens": 19723286.0,
"step": 285
},
{
"epoch": 0.20329477742726954,
"grad_norm": 0.47516849637031555,
"learning_rate": 1.4338044792324107e-05,
"loss": 0.0269,
"mean_token_accuracy": 0.9900463163852692,
"num_tokens": 20069296.0,
"step": 290
},
{
"epoch": 0.20679985979670523,
"grad_norm": 0.4357232451438904,
"learning_rate": 1.432946874733987e-05,
"loss": 0.0331,
"mean_token_accuracy": 0.9884259551763535,
"num_tokens": 20416004.0,
"step": 295
},
{
"epoch": 0.2103049421661409,
"grad_norm": 0.4937360882759094,
"learning_rate": 1.4320730240336934e-05,
"loss": 0.0187,
"mean_token_accuracy": 0.9937500208616257,
"num_tokens": 20764277.0,
"step": 300
},
{
"epoch": 0.2138100245355766,
"grad_norm": 0.276079386472702,
"learning_rate": 1.4311829542637738e-05,
"loss": 0.0267,
"mean_token_accuracy": 0.98935187458992,
"num_tokens": 21112041.0,
"step": 305
},
{
"epoch": 0.21731510690501227,
"grad_norm": 0.42910081148147583,
"learning_rate": 1.4302766930600593e-05,
"loss": 0.0291,
"mean_token_accuracy": 0.9891203969717026,
"num_tokens": 21458856.0,
"step": 310
},
{
"epoch": 0.22082018927444794,
"grad_norm": 0.6333709359169006,
"learning_rate": 1.42935426856111e-05,
"loss": 0.0327,
"mean_token_accuracy": 0.9886574298143387,
"num_tokens": 21806361.0,
"step": 315
},
{
"epoch": 0.22432527164388363,
"grad_norm": 0.23009836673736572,
"learning_rate": 1.4284157094073407e-05,
"loss": 0.0165,
"mean_token_accuracy": 0.9932870596647263,
"num_tokens": 22152746.0,
"step": 320
},
{
"epoch": 0.2278303540133193,
"grad_norm": 0.3802606463432312,
"learning_rate": 1.4274610447401327e-05,
"loss": 0.0263,
"mean_token_accuracy": 0.9891203939914703,
"num_tokens": 22499422.0,
"step": 325
},
{
"epoch": 0.231335436382755,
"grad_norm": 0.4347723722457886,
"learning_rate": 1.4264903042009281e-05,
"loss": 0.0278,
"mean_token_accuracy": 0.9886574298143387,
"num_tokens": 22844958.0,
"step": 330
},
{
"epoch": 0.23484051875219067,
"grad_norm": 0.49451401829719543,
"learning_rate": 1.4255035179303093e-05,
"loss": 0.0223,
"mean_token_accuracy": 0.9916666865348815,
"num_tokens": 23190999.0,
"step": 335
},
{
"epoch": 0.23834560112162637,
"grad_norm": 0.24139922857284546,
"learning_rate": 1.4245007165670638e-05,
"loss": 0.0282,
"mean_token_accuracy": 0.988657432794571,
"num_tokens": 23537740.0,
"step": 340
},
{
"epoch": 0.24185068349106204,
"grad_norm": 0.32044461369514465,
"learning_rate": 1.4234819312472335e-05,
"loss": 0.0225,
"mean_token_accuracy": 0.9909722447395325,
"num_tokens": 23883934.0,
"step": 345
},
{
"epoch": 0.24535576586049773,
"grad_norm": 0.18548811972141266,
"learning_rate": 1.422447193603146e-05,
"loss": 0.0235,
"mean_token_accuracy": 0.9912037342786789,
"num_tokens": 24231722.0,
"step": 350
},
{
"epoch": 0.2488608482299334,
"grad_norm": 0.45737743377685547,
"learning_rate": 1.4213965357624343e-05,
"loss": 0.0253,
"mean_token_accuracy": 0.9905092865228653,
"num_tokens": 24577887.0,
"step": 355
},
{
"epoch": 0.25236593059936907,
"grad_norm": 0.3616850972175598,
"learning_rate": 1.4203299903470387e-05,
"loss": 0.0263,
"mean_token_accuracy": 0.9900463253259659,
"num_tokens": 24922653.0,
"step": 360
},
{
"epoch": 0.25587101296880477,
"grad_norm": 0.4848349094390869,
"learning_rate": 1.419247590472193e-05,
"loss": 0.0242,
"mean_token_accuracy": 0.9900463253259659,
"num_tokens": 25269418.0,
"step": 365
},
{
"epoch": 0.25937609533824046,
"grad_norm": 0.2585952877998352,
"learning_rate": 1.4181493697453978e-05,
"loss": 0.0203,
"mean_token_accuracy": 0.993055573105812,
"num_tokens": 25616271.0,
"step": 370
},
{
"epoch": 0.2628811777076761,
"grad_norm": 0.35240036249160767,
"learning_rate": 1.417035362265376e-05,
"loss": 0.0246,
"mean_token_accuracy": 0.9902778029441833,
"num_tokens": 25961709.0,
"step": 375
},
{
"epoch": 0.2663862600771118,
"grad_norm": 0.4934576749801636,
"learning_rate": 1.4159056026210145e-05,
"loss": 0.0245,
"mean_token_accuracy": 0.9907407611608505,
"num_tokens": 26305582.0,
"step": 380
},
{
"epoch": 0.2698913424465475,
"grad_norm": 0.5466775298118591,
"learning_rate": 1.41476012589029e-05,
"loss": 0.0276,
"mean_token_accuracy": 0.988425949215889,
"num_tokens": 26651187.0,
"step": 385
},
{
"epoch": 0.2733964248159832,
"grad_norm": 0.38013315200805664,
"learning_rate": 1.4135989676391804e-05,
"loss": 0.0228,
"mean_token_accuracy": 0.9916666835546494,
"num_tokens": 26998191.0,
"step": 390
},
{
"epoch": 0.27690150718541884,
"grad_norm": 0.28799182176589966,
"learning_rate": 1.4124221639205589e-05,
"loss": 0.0227,
"mean_token_accuracy": 0.9912037283182145,
"num_tokens": 27343339.0,
"step": 395
},
{
"epoch": 0.28040658955485454,
"grad_norm": 0.42601919174194336,
"learning_rate": 1.4112297512730775e-05,
"loss": 0.0306,
"mean_token_accuracy": 0.989814841747284,
"num_tokens": 27688319.0,
"step": 400
},
{
"epoch": 0.28391167192429023,
"grad_norm": 0.4378221333026886,
"learning_rate": 1.4100217667200293e-05,
"loss": 0.0312,
"mean_token_accuracy": 0.9886574268341064,
"num_tokens": 28033195.0,
"step": 405
},
{
"epoch": 0.28741675429372593,
"grad_norm": 0.3670158386230469,
"learning_rate": 1.4087982477682015e-05,
"loss": 0.0245,
"mean_token_accuracy": 0.9912037223577499,
"num_tokens": 28380397.0,
"step": 410
},
{
"epoch": 0.29092183666316157,
"grad_norm": 0.26418375968933105,
"learning_rate": 1.4075592324067092e-05,
"loss": 0.0277,
"mean_token_accuracy": 0.9891203969717026,
"num_tokens": 28727209.0,
"step": 415
},
{
"epoch": 0.29442691903259727,
"grad_norm": 0.207740917801857,
"learning_rate": 1.4063047591058165e-05,
"loss": 0.0218,
"mean_token_accuracy": 0.9912037253379822,
"num_tokens": 29073179.0,
"step": 420
},
{
"epoch": 0.29793200140203296,
"grad_norm": 0.2558346688747406,
"learning_rate": 1.4050348668157424e-05,
"loss": 0.0252,
"mean_token_accuracy": 0.990972250699997,
"num_tokens": 29419021.0,
"step": 425
},
{
"epoch": 0.3014370837714686,
"grad_norm": 0.4200788736343384,
"learning_rate": 1.4037495949654506e-05,
"loss": 0.0293,
"mean_token_accuracy": 0.9900463193655014,
"num_tokens": 29762751.0,
"step": 430
},
{
"epoch": 0.3049421661409043,
"grad_norm": 0.2755083739757538,
"learning_rate": 1.4024489834614261e-05,
"loss": 0.0273,
"mean_token_accuracy": 0.9884259551763535,
"num_tokens": 30107869.0,
"step": 435
},
{
"epoch": 0.30844724851034,
"grad_norm": 0.456945538520813,
"learning_rate": 1.4011330726864357e-05,
"loss": 0.0266,
"mean_token_accuracy": 0.9900463163852692,
"num_tokens": 30454247.0,
"step": 440
},
{
"epoch": 0.3119523308797757,
"grad_norm": 0.3265325427055359,
"learning_rate": 1.3998019034982736e-05,
"loss": 0.0209,
"mean_token_accuracy": 0.992129647731781,
"num_tokens": 30801926.0,
"step": 445
},
{
"epoch": 0.31545741324921134,
"grad_norm": 0.2476506531238556,
"learning_rate": 1.3984555172284941e-05,
"loss": 0.0261,
"mean_token_accuracy": 0.9900463283061981,
"num_tokens": 31148230.0,
"step": 450
},
{
"epoch": 0.31896249561864704,
"grad_norm": 0.36999770998954773,
"learning_rate": 1.3970939556811277e-05,
"loss": 0.0281,
"mean_token_accuracy": 0.9907407641410828,
"num_tokens": 31495694.0,
"step": 455
},
{
"epoch": 0.32246757798808273,
"grad_norm": 0.2715221643447876,
"learning_rate": 1.3957172611313823e-05,
"loss": 0.0218,
"mean_token_accuracy": 0.9925926178693771,
"num_tokens": 31840699.0,
"step": 460
},
{
"epoch": 0.32597266035751843,
"grad_norm": 0.2700594365596771,
"learning_rate": 1.394325476324332e-05,
"loss": 0.0271,
"mean_token_accuracy": 0.9912037342786789,
"num_tokens": 32185556.0,
"step": 465
},
{
"epoch": 0.32947774272695407,
"grad_norm": 0.21484653651714325,
"learning_rate": 1.392918644473589e-05,
"loss": 0.0259,
"mean_token_accuracy": 0.9902777999639512,
"num_tokens": 32530728.0,
"step": 470
},
{
"epoch": 0.33298282509638977,
"grad_norm": 0.22852717339992523,
"learning_rate": 1.391496809259962e-05,
"loss": 0.0202,
"mean_token_accuracy": 0.9914352059364319,
"num_tokens": 32876136.0,
"step": 475
},
{
"epoch": 0.33648790746582546,
"grad_norm": 0.19366268813610077,
"learning_rate": 1.3900600148300999e-05,
"loss": 0.0198,
"mean_token_accuracy": 0.9925926148891449,
"num_tokens": 33224897.0,
"step": 480
},
{
"epoch": 0.3399929898352611,
"grad_norm": 0.34376469254493713,
"learning_rate": 1.3886083057951215e-05,
"loss": 0.0221,
"mean_token_accuracy": 0.9909722477197647,
"num_tokens": 33569560.0,
"step": 485
},
{
"epoch": 0.3434980722046968,
"grad_norm": 0.3154052197933197,
"learning_rate": 1.3871417272292302e-05,
"loss": 0.0165,
"mean_token_accuracy": 0.9932870537042617,
"num_tokens": 33917915.0,
"step": 490
},
{
"epoch": 0.3470031545741325,
"grad_norm": 0.7269891500473022,
"learning_rate": 1.3856603246683142e-05,
"loss": 0.0259,
"mean_token_accuracy": 0.9900463134050369,
"num_tokens": 34266968.0,
"step": 495
},
{
"epoch": 0.3505082369435682,
"grad_norm": 0.295919805765152,
"learning_rate": 1.3841641441085326e-05,
"loss": 0.0244,
"mean_token_accuracy": 0.9905092865228653,
"num_tokens": 34610972.0,
"step": 500
},
{
"epoch": 0.35401331931300384,
"grad_norm": 0.29701659083366394,
"learning_rate": 1.3826532320048878e-05,
"loss": 0.0286,
"mean_token_accuracy": 0.9891203939914703,
"num_tokens": 34957824.0,
"step": 505
},
{
"epoch": 0.35751840168243953,
"grad_norm": 0.2628810703754425,
"learning_rate": 1.3811276352697828e-05,
"loss": 0.0244,
"mean_token_accuracy": 0.9905092865228653,
"num_tokens": 35303692.0,
"step": 510
},
{
"epoch": 0.36102348405187523,
"grad_norm": 0.3597927689552307,
"learning_rate": 1.3795874012715648e-05,
"loss": 0.028,
"mean_token_accuracy": 0.9879629820585251,
"num_tokens": 35645530.0,
"step": 515
},
{
"epoch": 0.3645285664213109,
"grad_norm": 0.32699424028396606,
"learning_rate": 1.3780325778330534e-05,
"loss": 0.0228,
"mean_token_accuracy": 0.9907407641410828,
"num_tokens": 35991177.0,
"step": 520
},
{
"epoch": 0.36803364879074657,
"grad_norm": 0.15913930535316467,
"learning_rate": 1.3764632132300581e-05,
"loss": 0.0198,
"mean_token_accuracy": 0.9918981730937958,
"num_tokens": 36337605.0,
"step": 525
},
{
"epoch": 0.37153873116018227,
"grad_norm": 0.3119915723800659,
"learning_rate": 1.3748793561898764e-05,
"loss": 0.0251,
"mean_token_accuracy": 0.9895833522081375,
"num_tokens": 36681421.0,
"step": 530
},
{
"epoch": 0.37504381352961796,
"grad_norm": 0.39117053151130676,
"learning_rate": 1.3732810558897835e-05,
"loss": 0.0211,
"mean_token_accuracy": 0.9928241014480591,
"num_tokens": 37026944.0,
"step": 535
},
{
"epoch": 0.3785488958990536,
"grad_norm": 0.3502909541130066,
"learning_rate": 1.3716683619555033e-05,
"loss": 0.0263,
"mean_token_accuracy": 0.9900463253259659,
"num_tokens": 37370755.0,
"step": 540
},
{
"epoch": 0.3820539782684893,
"grad_norm": 0.31072738766670227,
"learning_rate": 1.3700413244596699e-05,
"loss": 0.0216,
"mean_token_accuracy": 0.9909722477197647,
"num_tokens": 37714729.0,
"step": 545
},
{
"epoch": 0.385559060637925,
"grad_norm": 0.48028165102005005,
"learning_rate": 1.3683999939202699e-05,
"loss": 0.0204,
"mean_token_accuracy": 0.9930555760860443,
"num_tokens": 38060011.0,
"step": 550
},
{
"epoch": 0.3890641430073607,
"grad_norm": 0.23708078265190125,
"learning_rate": 1.3667444212990769e-05,
"loss": 0.0233,
"mean_token_accuracy": 0.9907407701015473,
"num_tokens": 38406163.0,
"step": 555
},
{
"epoch": 0.39256922537679634,
"grad_norm": 0.27202486991882324,
"learning_rate": 1.3650746580000666e-05,
"loss": 0.0317,
"mean_token_accuracy": 0.9884259521961212,
"num_tokens": 38751788.0,
"step": 560
},
{
"epoch": 0.39607430774623203,
"grad_norm": 0.282675564289093,
"learning_rate": 1.3633907558678228e-05,
"loss": 0.0203,
"mean_token_accuracy": 0.9912037312984466,
"num_tokens": 39099308.0,
"step": 565
},
{
"epoch": 0.39957939011566773,
"grad_norm": 0.24003824591636658,
"learning_rate": 1.3616927671859265e-05,
"loss": 0.0287,
"mean_token_accuracy": 0.9895833551883697,
"num_tokens": 39444954.0,
"step": 570
},
{
"epoch": 0.4030844724851034,
"grad_norm": 0.3294246196746826,
"learning_rate": 1.3599807446753329e-05,
"loss": 0.025,
"mean_token_accuracy": 0.9914352089166641,
"num_tokens": 39791492.0,
"step": 575
},
{
"epoch": 0.40658955485453907,
"grad_norm": 0.22785353660583496,
"learning_rate": 1.3582547414927342e-05,
"loss": 0.023,
"mean_token_accuracy": 0.9909722536802292,
"num_tokens": 40135708.0,
"step": 580
},
{
"epoch": 0.41009463722397477,
"grad_norm": 0.21163974702358246,
"learning_rate": 1.3565148112289092e-05,
"loss": 0.0208,
"mean_token_accuracy": 0.9914352118968963,
"num_tokens": 40482309.0,
"step": 585
},
{
"epoch": 0.41359971959341046,
"grad_norm": 0.1579979658126831,
"learning_rate": 1.3547610079070603e-05,
"loss": 0.0226,
"mean_token_accuracy": 0.9907407611608505,
"num_tokens": 40827349.0,
"step": 590
},
{
"epoch": 0.4171048019628461,
"grad_norm": 0.3718387484550476,
"learning_rate": 1.3529933859811347e-05,
"loss": 0.0145,
"mean_token_accuracy": 0.9944444596767426,
"num_tokens": 41173619.0,
"step": 595
},
{
"epoch": 0.4206098843322818,
"grad_norm": 0.350474089384079,
"learning_rate": 1.3512120003341342e-05,
"loss": 0.0197,
"mean_token_accuracy": 0.993055573105812,
"num_tokens": 41521399.0,
"step": 600
},
{
"epoch": 0.4241149667017175,
"grad_norm": 0.32240647077560425,
"learning_rate": 1.349416906276412e-05,
"loss": 0.0182,
"mean_token_accuracy": 0.9928241014480591,
"num_tokens": 41867601.0,
"step": 605
},
{
"epoch": 0.4276200490711532,
"grad_norm": 0.22535887360572815,
"learning_rate": 1.3476081595439533e-05,
"loss": 0.0187,
"mean_token_accuracy": 0.9921296536922455,
"num_tokens": 42213052.0,
"step": 610
},
{
"epoch": 0.43112513144058884,
"grad_norm": 0.215674489736557,
"learning_rate": 1.3457858162966473e-05,
"loss": 0.021,
"mean_token_accuracy": 0.9923611342906952,
"num_tokens": 42560556.0,
"step": 615
},
{
"epoch": 0.43463021381002453,
"grad_norm": 0.320464164018631,
"learning_rate": 1.3439499331165413e-05,
"loss": 0.0264,
"mean_token_accuracy": 0.9905092895030976,
"num_tokens": 42905238.0,
"step": 620
},
{
"epoch": 0.43813529617946023,
"grad_norm": 0.34197351336479187,
"learning_rate": 1.3421005670060854e-05,
"loss": 0.0226,
"mean_token_accuracy": 0.9918981701135635,
"num_tokens": 43251741.0,
"step": 625
},
{
"epoch": 0.4416403785488959,
"grad_norm": 0.20396408438682556,
"learning_rate": 1.340237775386362e-05,
"loss": 0.0212,
"mean_token_accuracy": 0.9918981671333313,
"num_tokens": 43597173.0,
"step": 630
},
{
"epoch": 0.44514546091833157,
"grad_norm": 0.23026834428310394,
"learning_rate": 1.3383616160953025e-05,
"loss": 0.0244,
"mean_token_accuracy": 0.990740767121315,
"num_tokens": 43942748.0,
"step": 635
},
{
"epoch": 0.44865054328776727,
"grad_norm": 0.39719080924987793,
"learning_rate": 1.3364721473858925e-05,
"loss": 0.0268,
"mean_token_accuracy": 0.9891203939914703,
"num_tokens": 44286026.0,
"step": 640
},
{
"epoch": 0.45215562565720296,
"grad_norm": 0.1993078738451004,
"learning_rate": 1.334569427924362e-05,
"loss": 0.0263,
"mean_token_accuracy": 0.9893518805503845,
"num_tokens": 44630973.0,
"step": 645
},
{
"epoch": 0.4556607080266386,
"grad_norm": 0.2192801535129547,
"learning_rate": 1.332653516788365e-05,
"loss": 0.0203,
"mean_token_accuracy": 0.9932870596647263,
"num_tokens": 44977716.0,
"step": 650
},
{
"epoch": 0.4591657903960743,
"grad_norm": 0.16559746861457825,
"learning_rate": 1.3307244734651444e-05,
"loss": 0.0205,
"mean_token_accuracy": 0.992361131310463,
"num_tokens": 45323673.0,
"step": 655
},
{
"epoch": 0.46267087276551,
"grad_norm": 0.39821863174438477,
"learning_rate": 1.3287823578496848e-05,
"loss": 0.0225,
"mean_token_accuracy": 0.9912037283182145,
"num_tokens": 45668268.0,
"step": 660
},
{
"epoch": 0.4661759551349457,
"grad_norm": 0.30601146817207336,
"learning_rate": 1.3268272302428538e-05,
"loss": 0.0238,
"mean_token_accuracy": 0.9918981730937958,
"num_tokens": 46012933.0,
"step": 665
},
{
"epoch": 0.46968103750438134,
"grad_norm": 0.1988631635904312,
"learning_rate": 1.3248591513495287e-05,
"loss": 0.0227,
"mean_token_accuracy": 0.9918981790542603,
"num_tokens": 46359392.0,
"step": 670
},
{
"epoch": 0.47318611987381703,
"grad_norm": 0.21044372022151947,
"learning_rate": 1.3228781822767123e-05,
"loss": 0.0197,
"mean_token_accuracy": 0.9932870537042617,
"num_tokens": 46708087.0,
"step": 675
},
{
"epoch": 0.47669120224325273,
"grad_norm": 0.246845081448555,
"learning_rate": 1.3208843845316351e-05,
"loss": 0.0262,
"mean_token_accuracy": 0.9902777969837189,
"num_tokens": 47053413.0,
"step": 680
},
{
"epoch": 0.4801962846126884,
"grad_norm": 0.304241418838501,
"learning_rate": 1.3188778200198464e-05,
"loss": 0.0199,
"mean_token_accuracy": 0.9930555760860443,
"num_tokens": 47399096.0,
"step": 685
},
{
"epoch": 0.48370136698212407,
"grad_norm": 0.3896429240703583,
"learning_rate": 1.3168585510432912e-05,
"loss": 0.0239,
"mean_token_accuracy": 0.9907407611608505,
"num_tokens": 47746091.0,
"step": 690
},
{
"epoch": 0.48720644935155977,
"grad_norm": 0.19101302325725555,
"learning_rate": 1.3148266402983764e-05,
"loss": 0.0241,
"mean_token_accuracy": 0.9909722536802292,
"num_tokens": 48093067.0,
"step": 695
},
{
"epoch": 0.49071153172099546,
"grad_norm": 0.3942578434944153,
"learning_rate": 1.3127821508740234e-05,
"loss": 0.0237,
"mean_token_accuracy": 0.9909722477197647,
"num_tokens": 48440358.0,
"step": 700
},
{
"epoch": 0.4942166140904311,
"grad_norm": 0.25786906480789185,
"learning_rate": 1.3107251462497104e-05,
"loss": 0.0172,
"mean_token_accuracy": 0.9937500178813934,
"num_tokens": 48785888.0,
"step": 705
},
{
"epoch": 0.4977216964598668,
"grad_norm": 0.25595828890800476,
"learning_rate": 1.308655690293501e-05,
"loss": 0.0211,
"mean_token_accuracy": 0.9921296566724778,
"num_tokens": 49133883.0,
"step": 710
},
{
"epoch": 0.5012267788293024,
"grad_norm": 0.4982813000679016,
"learning_rate": 1.30657384726006e-05,
"loss": 0.0246,
"mean_token_accuracy": 0.9907407641410828,
"num_tokens": 49479461.0,
"step": 715
},
{
"epoch": 0.5047318611987381,
"grad_norm": 0.17003466188907623,
"learning_rate": 1.3044796817886604e-05,
"loss": 0.0231,
"mean_token_accuracy": 0.990740767121315,
"num_tokens": 49826669.0,
"step": 720
},
{
"epoch": 0.5082369435681738,
"grad_norm": 0.48894596099853516,
"learning_rate": 1.302373258901175e-05,
"loss": 0.0271,
"mean_token_accuracy": 0.9895833522081375,
"num_tokens": 50173702.0,
"step": 725
},
{
"epoch": 0.5117420259376095,
"grad_norm": 0.19587291777133942,
"learning_rate": 1.3002546440000574e-05,
"loss": 0.0203,
"mean_token_accuracy": 0.9928240954875946,
"num_tokens": 50520986.0,
"step": 730
},
{
"epoch": 0.5152471083070452,
"grad_norm": 0.16303904354572296,
"learning_rate": 1.2981239028663118e-05,
"loss": 0.02,
"mean_token_accuracy": 0.9928240984678268,
"num_tokens": 50869887.0,
"step": 735
},
{
"epoch": 0.5187521906764809,
"grad_norm": 0.40286949276924133,
"learning_rate": 1.2959811016574516e-05,
"loss": 0.0202,
"mean_token_accuracy": 0.9925926148891449,
"num_tokens": 51215571.0,
"step": 740
},
{
"epoch": 0.5222572730459166,
"grad_norm": 0.28973695635795593,
"learning_rate": 1.293826306905443e-05,
"loss": 0.0151,
"mean_token_accuracy": 0.9956018686294555,
"num_tokens": 51565405.0,
"step": 745
},
{
"epoch": 0.5257623554153522,
"grad_norm": 0.22685499489307404,
"learning_rate": 1.291659585514641e-05,
"loss": 0.0238,
"mean_token_accuracy": 0.9909722477197647,
"num_tokens": 51909491.0,
"step": 750
},
{
"epoch": 0.5292674377847879,
"grad_norm": 0.3714602589607239,
"learning_rate": 1.2894810047597117e-05,
"loss": 0.0216,
"mean_token_accuracy": 0.9916666924953461,
"num_tokens": 52254972.0,
"step": 755
},
{
"epoch": 0.5327725201542236,
"grad_norm": 0.3512303829193115,
"learning_rate": 1.2872906322835427e-05,
"loss": 0.0216,
"mean_token_accuracy": 0.9912037342786789,
"num_tokens": 52600661.0,
"step": 760
},
{
"epoch": 0.5362776025236593,
"grad_norm": 0.40395596623420715,
"learning_rate": 1.2850885360951444e-05,
"loss": 0.0238,
"mean_token_accuracy": 0.9912037253379822,
"num_tokens": 52947400.0,
"step": 765
},
{
"epoch": 0.539782684893095,
"grad_norm": 0.17548592388629913,
"learning_rate": 1.2828747845675365e-05,
"loss": 0.0209,
"mean_token_accuracy": 0.9921296536922455,
"num_tokens": 53292011.0,
"step": 770
},
{
"epoch": 0.5432877672625307,
"grad_norm": 0.2115519940853119,
"learning_rate": 1.2806494464356268e-05,
"loss": 0.0202,
"mean_token_accuracy": 0.9925926208496094,
"num_tokens": 53637287.0,
"step": 775
},
{
"epoch": 0.5467928496319664,
"grad_norm": 0.23128850758075714,
"learning_rate": 1.2784125907940757e-05,
"loss": 0.0228,
"mean_token_accuracy": 0.9916666895151138,
"num_tokens": 53984793.0,
"step": 780
},
{
"epoch": 0.550297932001402,
"grad_norm": 0.18116140365600586,
"learning_rate": 1.2761642870951521e-05,
"loss": 0.024,
"mean_token_accuracy": 0.9916666895151138,
"num_tokens": 54332790.0,
"step": 785
},
{
"epoch": 0.5538030143708377,
"grad_norm": 0.17702384293079376,
"learning_rate": 1.2739046051465753e-05,
"loss": 0.0257,
"mean_token_accuracy": 0.992361131310463,
"num_tokens": 54676947.0,
"step": 790
},
{
"epoch": 0.5573080967402734,
"grad_norm": 0.1663278341293335,
"learning_rate": 1.2716336151093504e-05,
"loss": 0.0239,
"mean_token_accuracy": 0.9907407641410828,
"num_tokens": 55022329.0,
"step": 795
},
{
"epoch": 0.5608131791097091,
"grad_norm": 0.203016459941864,
"learning_rate": 1.2693513874955856e-05,
"loss": 0.0192,
"mean_token_accuracy": 0.9925926119089127,
"num_tokens": 55370670.0,
"step": 800
},
{
"epoch": 0.5643182614791448,
"grad_norm": 0.22700652480125427,
"learning_rate": 1.2670579931663075e-05,
"loss": 0.021,
"mean_token_accuracy": 0.9912037283182145,
"num_tokens": 55714180.0,
"step": 805
},
{
"epoch": 0.5678233438485805,
"grad_norm": 0.14696234464645386,
"learning_rate": 1.2647535033292579e-05,
"loss": 0.0179,
"mean_token_accuracy": 0.993750023841858,
"num_tokens": 56058942.0,
"step": 810
},
{
"epoch": 0.5713284262180162,
"grad_norm": 0.19595181941986084,
"learning_rate": 1.2624379895366826e-05,
"loss": 0.0207,
"mean_token_accuracy": 0.9932870596647263,
"num_tokens": 56405485.0,
"step": 815
},
{
"epoch": 0.5748335085874519,
"grad_norm": 0.3681330680847168,
"learning_rate": 1.2601115236831133e-05,
"loss": 0.0211,
"mean_token_accuracy": 0.9923611283302307,
"num_tokens": 56751094.0,
"step": 820
},
{
"epoch": 0.5783385909568874,
"grad_norm": 0.18621279299259186,
"learning_rate": 1.2577741780031305e-05,
"loss": 0.0212,
"mean_token_accuracy": 0.991898176074028,
"num_tokens": 57098566.0,
"step": 825
},
{
"epoch": 0.5818436733263231,
"grad_norm": 0.5042465329170227,
"learning_rate": 1.2554260250691247e-05,
"loss": 0.0262,
"mean_token_accuracy": 0.9900463193655014,
"num_tokens": 57444269.0,
"step": 830
},
{
"epoch": 0.5853487556957588,
"grad_norm": 0.34705427289009094,
"learning_rate": 1.2530671377890408e-05,
"loss": 0.0248,
"mean_token_accuracy": 0.990972250699997,
"num_tokens": 57788886.0,
"step": 835
},
{
"epoch": 0.5888538380651945,
"grad_norm": 0.21251268684864044,
"learning_rate": 1.2506975894041152e-05,
"loss": 0.0185,
"mean_token_accuracy": 0.9930555760860443,
"num_tokens": 58135230.0,
"step": 840
},
{
"epoch": 0.5923589204346302,
"grad_norm": 0.32092639803886414,
"learning_rate": 1.2483174534866015e-05,
"loss": 0.0222,
"mean_token_accuracy": 0.9925926089286804,
"num_tokens": 58477843.0,
"step": 845
},
{
"epoch": 0.5958640028040659,
"grad_norm": 0.3195016086101532,
"learning_rate": 1.2459268039374866e-05,
"loss": 0.0227,
"mean_token_accuracy": 0.9916666895151138,
"num_tokens": 58822570.0,
"step": 850
},
{
"epoch": 0.5993690851735016,
"grad_norm": 0.39674413204193115,
"learning_rate": 1.2435257149841951e-05,
"loss": 0.019,
"mean_token_accuracy": 0.9932870626449585,
"num_tokens": 59171737.0,
"step": 855
},
{
"epoch": 0.6028741675429372,
"grad_norm": 0.1586899757385254,
"learning_rate": 1.2411142611782862e-05,
"loss": 0.0213,
"mean_token_accuracy": 0.9912037283182145,
"num_tokens": 59517800.0,
"step": 860
},
{
"epoch": 0.6063792499123729,
"grad_norm": 0.284656822681427,
"learning_rate": 1.2386925173931375e-05,
"loss": 0.0209,
"mean_token_accuracy": 0.9928240954875946,
"num_tokens": 59862858.0,
"step": 865
},
{
"epoch": 0.6098843322818086,
"grad_norm": 0.6032276153564453,
"learning_rate": 1.2362605588216207e-05,
"loss": 0.0215,
"mean_token_accuracy": 0.9928241014480591,
"num_tokens": 60210881.0,
"step": 870
},
{
"epoch": 0.6133894146512443,
"grad_norm": 0.15096986293792725,
"learning_rate": 1.2338184609737674e-05,
"loss": 0.0232,
"mean_token_accuracy": 0.9914351999759674,
"num_tokens": 60553976.0,
"step": 875
},
{
"epoch": 0.61689449702068,
"grad_norm": 0.23778441548347473,
"learning_rate": 1.2313662996744242e-05,
"loss": 0.0249,
"mean_token_accuracy": 0.990740767121315,
"num_tokens": 60900821.0,
"step": 880
},
{
"epoch": 0.6203995793901157,
"grad_norm": 0.22427886724472046,
"learning_rate": 1.228904151060898e-05,
"loss": 0.0181,
"mean_token_accuracy": 0.9930555790662765,
"num_tokens": 61247776.0,
"step": 885
},
{
"epoch": 0.6239046617595514,
"grad_norm": 0.1573123037815094,
"learning_rate": 1.226432091580593e-05,
"loss": 0.0199,
"mean_token_accuracy": 0.9923611402511596,
"num_tokens": 61593112.0,
"step": 890
},
{
"epoch": 0.627409744128987,
"grad_norm": 0.2529422342777252,
"learning_rate": 1.2239501979886356e-05,
"loss": 0.0256,
"mean_token_accuracy": 0.9900463223457336,
"num_tokens": 61937169.0,
"step": 895
},
{
"epoch": 0.6309148264984227,
"grad_norm": 0.1565939337015152,
"learning_rate": 1.2214585473454935e-05,
"loss": 0.0223,
"mean_token_accuracy": 0.9923611372709275,
"num_tokens": 62283554.0,
"step": 900
}
],
"logging_steps": 5,
"max_steps": 2854,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.1493963380099645e+18,
"train_batch_size": 6,
"trial_name": null,
"trial_params": null
}