tiger-mathqa-llama / trainer_state.json
matboz's picture
Upload folder using huggingface_hub
9d6c26d verified
Raw
History Blame Contribute Delete
44.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 10.0,
"eval_steps": 500,
"global_step": 1570,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3206602305173873,
"epoch": 0.064,
"grad_norm": 0.9292202591896057,
"learning_rate": 3.7500000000000005e-06,
"loss": 1.1131,
"mean_token_accuracy": 0.7011688977479935,
"num_tokens": 167271.0,
"step": 10
},
{
"entropy": 1.3284908413887024,
"epoch": 0.128,
"grad_norm": 0.660650908946991,
"learning_rate": 7.916666666666667e-06,
"loss": 1.0843,
"mean_token_accuracy": 0.7041632518172264,
"num_tokens": 335534.0,
"step": 20
},
{
"entropy": 1.3329698264598846,
"epoch": 0.192,
"grad_norm": 0.46980366110801697,
"learning_rate": 1.2083333333333333e-05,
"loss": 0.9948,
"mean_token_accuracy": 0.7138608112931252,
"num_tokens": 504764.0,
"step": 30
},
{
"entropy": 1.3528490722179414,
"epoch": 0.256,
"grad_norm": 0.3592575192451477,
"learning_rate": 1.6250000000000002e-05,
"loss": 0.9485,
"mean_token_accuracy": 0.721599918603897,
"num_tokens": 674680.0,
"step": 40
},
{
"entropy": 1.3213547974824906,
"epoch": 0.32,
"grad_norm": 0.31555160880088806,
"learning_rate": 1.9999978697023387e-05,
"loss": 0.9296,
"mean_token_accuracy": 0.7227451264858246,
"num_tokens": 839934.0,
"step": 50
},
{
"entropy": 1.2997384041547775,
"epoch": 0.384,
"grad_norm": 0.2809937000274658,
"learning_rate": 1.999742244965125e-05,
"loss": 0.9414,
"mean_token_accuracy": 0.7233463451266289,
"num_tokens": 1005135.0,
"step": 60
},
{
"entropy": 1.2680538922548295,
"epoch": 0.448,
"grad_norm": 0.28027236461639404,
"learning_rate": 1.9990606854864625e-05,
"loss": 0.8823,
"mean_token_accuracy": 0.7340415641665459,
"num_tokens": 1172366.0,
"step": 70
},
{
"entropy": 1.2720171421766282,
"epoch": 0.512,
"grad_norm": 0.27143529057502747,
"learning_rate": 1.997953481641056e-05,
"loss": 0.882,
"mean_token_accuracy": 0.7348188936710358,
"num_tokens": 1340013.0,
"step": 80
},
{
"entropy": 1.2880662232637405,
"epoch": 0.576,
"grad_norm": 0.2534484565258026,
"learning_rate": 1.9964211051470778e-05,
"loss": 0.8938,
"mean_token_accuracy": 0.7337884500622749,
"num_tokens": 1507478.0,
"step": 90
},
{
"entropy": 1.2950494319200516,
"epoch": 0.64,
"grad_norm": 0.29349154233932495,
"learning_rate": 1.994464208865191e-05,
"loss": 0.9225,
"mean_token_accuracy": 0.7275586023926734,
"num_tokens": 1680653.0,
"step": 100
},
{
"entropy": 1.2790019273757935,
"epoch": 0.704,
"grad_norm": 0.2847479581832886,
"learning_rate": 1.9920836265204047e-05,
"loss": 0.8916,
"mean_token_accuracy": 0.7341030821204185,
"num_tokens": 1851057.0,
"step": 110
},
{
"entropy": 1.2715142965316772,
"epoch": 0.768,
"grad_norm": 0.27320924401283264,
"learning_rate": 1.989280372346868e-05,
"loss": 0.8824,
"mean_token_accuracy": 0.7345656096935272,
"num_tokens": 2018983.0,
"step": 120
},
{
"entropy": 1.3021604150533677,
"epoch": 0.832,
"grad_norm": 0.31183984875679016,
"learning_rate": 1.986055640655763e-05,
"loss": 0.9231,
"mean_token_accuracy": 0.7273582145571709,
"num_tokens": 2188992.0,
"step": 130
},
{
"entropy": 1.2842024236917495,
"epoch": 0.896,
"grad_norm": 0.3226590156555176,
"learning_rate": 1.9824108053264726e-05,
"loss": 0.8858,
"mean_token_accuracy": 0.7334808766841888,
"num_tokens": 2358611.0,
"step": 140
},
{
"entropy": 1.2750529646873474,
"epoch": 0.96,
"grad_norm": 0.3014202415943146,
"learning_rate": 1.9783474192212484e-05,
"loss": 0.8843,
"mean_token_accuracy": 0.7379685431718827,
"num_tokens": 2527068.0,
"step": 150
},
{
"entropy": 1.286011647533726,
"epoch": 1.0192,
"grad_norm": 0.31638771295547485,
"learning_rate": 1.9738672135236218e-05,
"loss": 0.9009,
"mean_token_accuracy": 0.7322732838424476,
"num_tokens": 2685134.0,
"step": 160
},
{
"entropy": 1.2853516817092896,
"epoch": 1.0832,
"grad_norm": 0.29617786407470703,
"learning_rate": 1.968972097000843e-05,
"loss": 0.8978,
"mean_token_accuracy": 0.7337976396083832,
"num_tokens": 2852350.0,
"step": 170
},
{
"entropy": 1.261508396267891,
"epoch": 1.1472,
"grad_norm": 0.34440022706985474,
"learning_rate": 1.96366415519066e-05,
"loss": 0.8612,
"mean_token_accuracy": 0.7381596371531487,
"num_tokens": 3021070.0,
"step": 180
},
{
"entropy": 1.263030657172203,
"epoch": 1.2112,
"grad_norm": 0.3183440864086151,
"learning_rate": 1.957945649512788e-05,
"loss": 0.8775,
"mean_token_accuracy": 0.7360784441232682,
"num_tokens": 3188758.0,
"step": 190
},
{
"entropy": 1.2699549317359924,
"epoch": 1.2752,
"grad_norm": 0.316829651594162,
"learning_rate": 1.951819016305442e-05,
"loss": 0.871,
"mean_token_accuracy": 0.7383767917752266,
"num_tokens": 3356098.0,
"step": 200
},
{
"entropy": 1.284775710105896,
"epoch": 1.3392,
"grad_norm": 0.3272818922996521,
"learning_rate": 1.9452868657873513e-05,
"loss": 0.87,
"mean_token_accuracy": 0.7359273687005043,
"num_tokens": 3522909.0,
"step": 210
},
{
"entropy": 1.2776107609272003,
"epoch": 1.4032,
"grad_norm": 0.34563735127449036,
"learning_rate": 1.9383519809456862e-05,
"loss": 0.8833,
"mean_token_accuracy": 0.735480035841465,
"num_tokens": 3686875.0,
"step": 220
},
{
"entropy": 1.262231531739235,
"epoch": 1.4672,
"grad_norm": 0.33589527010917664,
"learning_rate": 1.931017316350384e-05,
"loss": 0.8653,
"mean_token_accuracy": 0.736232727766037,
"num_tokens": 3853087.0,
"step": 230
},
{
"entropy": 1.2684703916311264,
"epoch": 1.5312000000000001,
"grad_norm": 0.3261985182762146,
"learning_rate": 1.9232859968953702e-05,
"loss": 0.88,
"mean_token_accuracy": 0.7341130167245865,
"num_tokens": 4021454.0,
"step": 240
},
{
"entropy": 1.2511296778917314,
"epoch": 1.5952,
"grad_norm": 0.3339959681034088,
"learning_rate": 1.9151613164672136e-05,
"loss": 0.8526,
"mean_token_accuracy": 0.7398458629846573,
"num_tokens": 4192689.0,
"step": 250
},
{
"entropy": 1.2628758728504181,
"epoch": 1.6592,
"grad_norm": 0.3413638472557068,
"learning_rate": 1.9066467365417844e-05,
"loss": 0.8691,
"mean_token_accuracy": 0.7368915528059006,
"num_tokens": 4361378.0,
"step": 260
},
{
"entropy": 1.2695908069610595,
"epoch": 1.7231999999999998,
"grad_norm": 0.3355003595352173,
"learning_rate": 1.8977458847095117e-05,
"loss": 0.8584,
"mean_token_accuracy": 0.7388368755578995,
"num_tokens": 4527968.0,
"step": 270
},
{
"entropy": 1.2557695835828782,
"epoch": 1.7872,
"grad_norm": 0.35713067650794983,
"learning_rate": 1.888462553129867e-05,
"loss": 0.8615,
"mean_token_accuracy": 0.7374937132000923,
"num_tokens": 4697185.0,
"step": 280
},
{
"entropy": 1.258004653453827,
"epoch": 1.8512,
"grad_norm": 0.35476240515708923,
"learning_rate": 1.878800696915737e-05,
"loss": 0.8735,
"mean_token_accuracy": 0.7390823766589165,
"num_tokens": 4869268.0,
"step": 290
},
{
"entropy": 1.2416281551122665,
"epoch": 1.9152,
"grad_norm": 0.2956583797931671,
"learning_rate": 1.868764432448369e-05,
"loss": 0.8587,
"mean_token_accuracy": 0.7391577690839768,
"num_tokens": 5041668.0,
"step": 300
},
{
"entropy": 1.2554892003536224,
"epoch": 1.9792,
"grad_norm": 0.36443835496902466,
"learning_rate": 1.8583580356236065e-05,
"loss": 0.8784,
"mean_token_accuracy": 0.7360676273703575,
"num_tokens": 5211130.0,
"step": 310
},
{
"entropy": 1.2533008375683345,
"epoch": 2.0384,
"grad_norm": 0.37365785241127014,
"learning_rate": 1.8475859400301708e-05,
"loss": 0.8448,
"mean_token_accuracy": 0.7391577572435946,
"num_tokens": 5365597.0,
"step": 320
},
{
"entropy": 1.2590773075819015,
"epoch": 2.1024,
"grad_norm": 0.44947031140327454,
"learning_rate": 1.8364527350607527e-05,
"loss": 0.8602,
"mean_token_accuracy": 0.7381724148988724,
"num_tokens": 5529944.0,
"step": 330
},
{
"entropy": 1.2393722623586654,
"epoch": 2.1664,
"grad_norm": 0.3682183027267456,
"learning_rate": 1.824963163956726e-05,
"loss": 0.8516,
"mean_token_accuracy": 0.7419341534376145,
"num_tokens": 5701741.0,
"step": 340
},
{
"entropy": 1.224160623550415,
"epoch": 2.2304,
"grad_norm": 0.3923819959163666,
"learning_rate": 1.8131221217873175e-05,
"loss": 0.8377,
"mean_token_accuracy": 0.7442746981978416,
"num_tokens": 5873777.0,
"step": 350
},
{
"entropy": 1.2588546723127365,
"epoch": 2.2944,
"grad_norm": 0.39916929602622986,
"learning_rate": 1.8009346533640877e-05,
"loss": 0.878,
"mean_token_accuracy": 0.7364423900842667,
"num_tokens": 6044077.0,
"step": 360
},
{
"entropy": 1.2643144816160201,
"epoch": 2.3584,
"grad_norm": 0.420813649892807,
"learning_rate": 1.7884059510916167e-05,
"loss": 0.8603,
"mean_token_accuracy": 0.7379584088921547,
"num_tokens": 6208773.0,
"step": 370
},
{
"entropy": 1.2406759321689607,
"epoch": 2.4224,
"grad_norm": 0.3934536278247833,
"learning_rate": 1.7755413527553087e-05,
"loss": 0.8452,
"mean_token_accuracy": 0.7419968873262406,
"num_tokens": 6375486.0,
"step": 380
},
{
"entropy": 1.239344623684883,
"epoch": 2.4864,
"grad_norm": 0.3987742066383362,
"learning_rate": 1.7623463392472574e-05,
"loss": 0.8515,
"mean_token_accuracy": 0.7414514541625976,
"num_tokens": 6546290.0,
"step": 390
},
{
"entropy": 1.2116641372442245,
"epoch": 2.5504,
"grad_norm": 0.43099576234817505,
"learning_rate": 1.748826532231142e-05,
"loss": 0.8209,
"mean_token_accuracy": 0.746632432937622,
"num_tokens": 6717949.0,
"step": 400
},
{
"entropy": 1.2477060765028,
"epoch": 2.6144,
"grad_norm": 0.41407084465026855,
"learning_rate": 1.7349876917471474e-05,
"loss": 0.8456,
"mean_token_accuracy": 0.7417222335934639,
"num_tokens": 6883125.0,
"step": 410
},
{
"entropy": 1.2271479934453964,
"epoch": 2.6784,
"grad_norm": 0.4161278307437897,
"learning_rate": 1.7208357137579318e-05,
"loss": 0.8411,
"mean_token_accuracy": 0.744826503098011,
"num_tokens": 7053271.0,
"step": 420
},
{
"entropy": 1.2537022173404693,
"epoch": 2.7424,
"grad_norm": 0.39646434783935547,
"learning_rate": 1.7063766276366814e-05,
"loss": 0.875,
"mean_token_accuracy": 0.7370057612657547,
"num_tokens": 7225737.0,
"step": 430
},
{
"entropy": 1.229554709792137,
"epoch": 2.8064,
"grad_norm": 0.409257173538208,
"learning_rate": 1.6916165935983323e-05,
"loss": 0.8434,
"mean_token_accuracy": 0.7419100552797318,
"num_tokens": 7393850.0,
"step": 440
},
{
"entropy": 1.2586964070796967,
"epoch": 2.8704,
"grad_norm": 0.44094783067703247,
"learning_rate": 1.676561900075041e-05,
"loss": 0.8623,
"mean_token_accuracy": 0.7402451306581497,
"num_tokens": 7560159.0,
"step": 450
},
{
"entropy": 1.2187331795692444,
"epoch": 2.9344,
"grad_norm": 0.3948505222797394,
"learning_rate": 1.6612189610370336e-05,
"loss": 0.82,
"mean_token_accuracy": 0.7458591118454934,
"num_tokens": 7726778.0,
"step": 460
},
{
"entropy": 1.2287385314702988,
"epoch": 2.9984,
"grad_norm": 0.4345516562461853,
"learning_rate": 1.6455943132599698e-05,
"loss": 0.8396,
"mean_token_accuracy": 0.7434753939509392,
"num_tokens": 7896364.0,
"step": 470
},
{
"entropy": 1.2102074913076453,
"epoch": 3.0576,
"grad_norm": 0.42504480481147766,
"learning_rate": 1.6296946135399835e-05,
"loss": 0.821,
"mean_token_accuracy": 0.7462124454008566,
"num_tokens": 8050254.0,
"step": 480
},
{
"entropy": 1.2117455512285233,
"epoch": 3.1216,
"grad_norm": 0.44672510027885437,
"learning_rate": 1.613526635857591e-05,
"loss": 0.8198,
"mean_token_accuracy": 0.7464832335710525,
"num_tokens": 8217439.0,
"step": 490
},
{
"entropy": 1.2218973994255067,
"epoch": 3.1856,
"grad_norm": 0.4569561779499054,
"learning_rate": 1.5970972684916754e-05,
"loss": 0.8394,
"mean_token_accuracy": 0.743482106924057,
"num_tokens": 8384749.0,
"step": 500
},
{
"entropy": 1.205233234167099,
"epoch": 3.2496,
"grad_norm": 0.49336662888526917,
"learning_rate": 1.5804135110847708e-05,
"loss": 0.8126,
"mean_token_accuracy": 0.7476648792624474,
"num_tokens": 8552626.0,
"step": 510
},
{
"entropy": 1.2141715466976166,
"epoch": 3.3136,
"grad_norm": 0.47234952449798584,
"learning_rate": 1.5634824716609037e-05,
"loss": 0.8199,
"mean_token_accuracy": 0.7487053409218788,
"num_tokens": 8719495.0,
"step": 520
},
{
"entropy": 1.2043092876672745,
"epoch": 3.3776,
"grad_norm": 0.4978366792201996,
"learning_rate": 1.5463113635972577e-05,
"loss": 0.8121,
"mean_token_accuracy": 0.7485451966524124,
"num_tokens": 8889843.0,
"step": 530
},
{
"entropy": 1.2383090078830719,
"epoch": 3.4416,
"grad_norm": 0.473350465297699,
"learning_rate": 1.528907502550954e-05,
"loss": 0.8633,
"mean_token_accuracy": 0.7431078001856803,
"num_tokens": 9059897.0,
"step": 540
},
{
"entropy": 1.1710155814886094,
"epoch": 3.5056000000000003,
"grad_norm": 0.48414960503578186,
"learning_rate": 1.5112783033422547e-05,
"loss": 0.7952,
"mean_token_accuracy": 0.751731738448143,
"num_tokens": 9230970.0,
"step": 550
},
{
"entropy": 1.194032496213913,
"epoch": 3.5696,
"grad_norm": 0.5241577625274658,
"learning_rate": 1.4934312767955193e-05,
"loss": 0.8106,
"mean_token_accuracy": 0.748333002626896,
"num_tokens": 9400137.0,
"step": 560
},
{
"entropy": 1.203871914744377,
"epoch": 3.6336,
"grad_norm": 0.4763513505458832,
"learning_rate": 1.4753740265392595e-05,
"loss": 0.8321,
"mean_token_accuracy": 0.7462276950478554,
"num_tokens": 9569468.0,
"step": 570
},
{
"entropy": 1.2193732023239137,
"epoch": 3.6976,
"grad_norm": 0.5063449740409851,
"learning_rate": 1.4571142457666536e-05,
"loss": 0.8297,
"mean_token_accuracy": 0.7442631095647811,
"num_tokens": 9739091.0,
"step": 580
},
{
"entropy": 1.20502949655056,
"epoch": 3.7616,
"grad_norm": 0.5168077945709229,
"learning_rate": 1.4386597139579041e-05,
"loss": 0.8087,
"mean_token_accuracy": 0.750263799726963,
"num_tokens": 9903536.0,
"step": 590
},
{
"entropy": 1.211077681183815,
"epoch": 3.8256,
"grad_norm": 0.5382931232452393,
"learning_rate": 1.4200182935658327e-05,
"loss": 0.8212,
"mean_token_accuracy": 0.7472874745726585,
"num_tokens": 10070133.0,
"step": 600
},
{
"entropy": 1.2020549327135086,
"epoch": 3.8895999999999997,
"grad_norm": 0.4987923502922058,
"learning_rate": 1.4011979266661235e-05,
"loss": 0.8239,
"mean_token_accuracy": 0.7469061449170112,
"num_tokens": 10242501.0,
"step": 610
},
{
"entropy": 1.210327258706093,
"epoch": 3.9536,
"grad_norm": 0.5201823115348816,
"learning_rate": 1.3822066315736477e-05,
"loss": 0.8274,
"mean_token_accuracy": 0.746899065375328,
"num_tokens": 10411438.0,
"step": 620
},
{
"entropy": 1.2165618264997327,
"epoch": 4.0128,
"grad_norm": 0.5398468971252441,
"learning_rate": 1.363052499426302e-05,
"loss": 0.831,
"mean_token_accuracy": 0.7447031430295996,
"num_tokens": 10568566.0,
"step": 630
},
{
"entropy": 1.1632685348391534,
"epoch": 4.0768,
"grad_norm": 0.6215068697929382,
"learning_rate": 1.3437436907378225e-05,
"loss": 0.7707,
"mean_token_accuracy": 0.7566415458917618,
"num_tokens": 10736787.0,
"step": 640
},
{
"entropy": 1.1855787336826324,
"epoch": 4.1408,
"grad_norm": 0.5971937775611877,
"learning_rate": 1.3242884319210463e-05,
"loss": 0.8059,
"mean_token_accuracy": 0.7505464211106301,
"num_tokens": 10907187.0,
"step": 650
},
{
"entropy": 1.1913582772016524,
"epoch": 4.2048,
"grad_norm": 0.64606112241745,
"learning_rate": 1.3046950117830888e-05,
"loss": 0.8079,
"mean_token_accuracy": 0.7538586258888245,
"num_tokens": 11076448.0,
"step": 660
},
{
"entropy": 1.1633977055549622,
"epoch": 4.2688,
"grad_norm": 0.6025974750518799,
"learning_rate": 1.2849717779939439e-05,
"loss": 0.7804,
"mean_token_accuracy": 0.754143525660038,
"num_tokens": 11246044.0,
"step": 670
},
{
"entropy": 1.172673773765564,
"epoch": 4.3328,
"grad_norm": 0.5885686278343201,
"learning_rate": 1.2651271335300063e-05,
"loss": 0.798,
"mean_token_accuracy": 0.7523474931716919,
"num_tokens": 11415782.0,
"step": 680
},
{
"entropy": 1.1495980948209763,
"epoch": 4.3968,
"grad_norm": 0.6189532279968262,
"learning_rate": 1.2451695330940268e-05,
"loss": 0.766,
"mean_token_accuracy": 0.7611258506774903,
"num_tokens": 11581998.0,
"step": 690
},
{
"entropy": 1.1974951326847076,
"epoch": 4.4608,
"grad_norm": 0.6507912874221802,
"learning_rate": 1.2251074795130339e-05,
"loss": 0.8261,
"mean_token_accuracy": 0.7475854620337486,
"num_tokens": 11752776.0,
"step": 700
},
{
"entropy": 1.1862800359725951,
"epoch": 4.5248,
"grad_norm": 0.6506279110908508,
"learning_rate": 1.2049495201157489e-05,
"loss": 0.7858,
"mean_token_accuracy": 0.7544367983937263,
"num_tokens": 11916319.0,
"step": 710
},
{
"entropy": 1.1888660967350007,
"epoch": 4.5888,
"grad_norm": 0.7014175653457642,
"learning_rate": 1.1847042430910451e-05,
"loss": 0.8118,
"mean_token_accuracy": 0.7482251942157745,
"num_tokens": 12084487.0,
"step": 720
},
{
"entropy": 1.1586445271968842,
"epoch": 4.6528,
"grad_norm": 0.6517874598503113,
"learning_rate": 1.1643802738289955e-05,
"loss": 0.7778,
"mean_token_accuracy": 0.7564518004655838,
"num_tokens": 12253339.0,
"step": 730
},
{
"entropy": 1.1812776714563369,
"epoch": 4.7168,
"grad_norm": 0.6842546463012695,
"learning_rate": 1.1439862712460721e-05,
"loss": 0.7957,
"mean_token_accuracy": 0.7507700502872467,
"num_tokens": 12423311.0,
"step": 740
},
{
"entropy": 1.1869671106338502,
"epoch": 4.7808,
"grad_norm": 0.6829348206520081,
"learning_rate": 1.1235309240960621e-05,
"loss": 0.8125,
"mean_token_accuracy": 0.7493612572550774,
"num_tokens": 12593509.0,
"step": 750
},
{
"entropy": 1.1620380729436874,
"epoch": 4.8448,
"grad_norm": 0.5931580066680908,
"learning_rate": 1.1030229472682719e-05,
"loss": 0.7863,
"mean_token_accuracy": 0.7565168127417564,
"num_tokens": 12762574.0,
"step": 760
},
{
"entropy": 1.1934880197048188,
"epoch": 4.9088,
"grad_norm": 0.673819899559021,
"learning_rate": 1.0824710780745954e-05,
"loss": 0.7921,
"mean_token_accuracy": 0.7512735366821289,
"num_tokens": 12927608.0,
"step": 770
},
{
"entropy": 1.1958867460489273,
"epoch": 4.9728,
"grad_norm": 0.6820770502090454,
"learning_rate": 1.06188407252703e-05,
"loss": 0.8103,
"mean_token_accuracy": 0.7500374510884285,
"num_tokens": 13095807.0,
"step": 780
},
{
"entropy": 1.1728345767871753,
"epoch": 5.032,
"grad_norm": 0.7087289094924927,
"learning_rate": 1.0412707016072254e-05,
"loss": 0.7749,
"mean_token_accuracy": 0.7583866667103123,
"num_tokens": 13248102.0,
"step": 790
},
{
"entropy": 1.1663290411233902,
"epoch": 5.096,
"grad_norm": 0.7355737686157227,
"learning_rate": 1.0206397475296548e-05,
"loss": 0.7779,
"mean_token_accuracy": 0.7589040651917458,
"num_tokens": 13413512.0,
"step": 800
},
{
"entropy": 1.1404080986976624,
"epoch": 5.16,
"grad_norm": 0.7504479885101318,
"learning_rate": 1e-05,
"loss": 0.7517,
"mean_token_accuracy": 0.7618933707475662,
"num_tokens": 13583993.0,
"step": 810
},
{
"entropy": 1.1676405906677245,
"epoch": 5.224,
"grad_norm": 0.8724946975708008,
"learning_rate": 9.793602524703456e-06,
"loss": 0.7773,
"mean_token_accuracy": 0.7555600613355636,
"num_tokens": 13751270.0,
"step": 820
},
{
"entropy": 1.1330503553152085,
"epoch": 5.288,
"grad_norm": 0.7498918175697327,
"learning_rate": 9.58729298392775e-06,
"loss": 0.7475,
"mean_token_accuracy": 0.7617968454957008,
"num_tokens": 13921584.0,
"step": 830
},
{
"entropy": 1.1508350551128388,
"epoch": 5.352,
"grad_norm": 0.7500905990600586,
"learning_rate": 9.381159274729704e-06,
"loss": 0.7849,
"mean_token_accuracy": 0.7576810494065285,
"num_tokens": 14091937.0,
"step": 840
},
{
"entropy": 1.1224143624305725,
"epoch": 5.416,
"grad_norm": 0.7415691614151001,
"learning_rate": 9.175289219254051e-06,
"loss": 0.7341,
"mean_token_accuracy": 0.7673233345150947,
"num_tokens": 14260356.0,
"step": 850
},
{
"entropy": 1.1505684763193131,
"epoch": 5.48,
"grad_norm": 0.7703384757041931,
"learning_rate": 8.969770527317283e-06,
"loss": 0.7658,
"mean_token_accuracy": 0.7610488831996918,
"num_tokens": 14424125.0,
"step": 860
},
{
"entropy": 1.1513787150382995,
"epoch": 5.5440000000000005,
"grad_norm": 0.8211115002632141,
"learning_rate": 8.764690759039382e-06,
"loss": 0.7727,
"mean_token_accuracy": 0.7584890708327293,
"num_tokens": 14594600.0,
"step": 870
},
{
"entropy": 1.1472541570663453,
"epoch": 5.608,
"grad_norm": 0.7482420206069946,
"learning_rate": 8.56013728753928e-06,
"loss": 0.7767,
"mean_token_accuracy": 0.7584212064743042,
"num_tokens": 14765974.0,
"step": 880
},
{
"entropy": 1.1245936155319214,
"epoch": 5.672,
"grad_norm": 0.7992265224456787,
"learning_rate": 8.356197261710048e-06,
"loss": 0.7602,
"mean_token_accuracy": 0.7592591598629952,
"num_tokens": 14936349.0,
"step": 890
},
{
"entropy": 1.1513198018074036,
"epoch": 5.736,
"grad_norm": 0.7653408050537109,
"learning_rate": 8.152957569089552e-06,
"loss": 0.7622,
"mean_token_accuracy": 0.760157561302185,
"num_tokens": 15105256.0,
"step": 900
},
{
"entropy": 1.1511808067560196,
"epoch": 5.8,
"grad_norm": 0.802228569984436,
"learning_rate": 7.950504798842513e-06,
"loss": 0.7685,
"mean_token_accuracy": 0.7571253061294556,
"num_tokens": 15276369.0,
"step": 910
},
{
"entropy": 1.1488977074623108,
"epoch": 5.864,
"grad_norm": 0.8278489708900452,
"learning_rate": 7.748925204869667e-06,
"loss": 0.7704,
"mean_token_accuracy": 0.7605934232473374,
"num_tokens": 15444886.0,
"step": 920
},
{
"entropy": 1.1339735567569733,
"epoch": 5.928,
"grad_norm": 0.897056519985199,
"learning_rate": 7.548304669059735e-06,
"loss": 0.754,
"mean_token_accuracy": 0.7624502271413803,
"num_tokens": 15613205.0,
"step": 930
},
{
"entropy": 1.1681912243366241,
"epoch": 5.992,
"grad_norm": 0.8365456461906433,
"learning_rate": 7.348728664699939e-06,
"loss": 0.7771,
"mean_token_accuracy": 0.758332185447216,
"num_tokens": 15780285.0,
"step": 940
},
{
"entropy": 1.1275109552048348,
"epoch": 6.0512,
"grad_norm": 0.7828477025032043,
"learning_rate": 7.150282220060564e-06,
"loss": 0.7577,
"mean_token_accuracy": 0.7635239346607311,
"num_tokens": 15938875.0,
"step": 950
},
{
"entropy": 1.1234853833913803,
"epoch": 6.1152,
"grad_norm": 0.8459082245826721,
"learning_rate": 6.9530498821691165e-06,
"loss": 0.7387,
"mean_token_accuracy": 0.7674040615558624,
"num_tokens": 16107143.0,
"step": 960
},
{
"entropy": 1.1044875085353851,
"epoch": 6.1792,
"grad_norm": 0.964129626750946,
"learning_rate": 6.757115680789539e-06,
"loss": 0.7323,
"mean_token_accuracy": 0.7670143201947213,
"num_tokens": 16275215.0,
"step": 970
},
{
"entropy": 1.1271264016628266,
"epoch": 6.2432,
"grad_norm": 0.9594255089759827,
"learning_rate": 6.562563092621776e-06,
"loss": 0.7441,
"mean_token_accuracy": 0.7671423986554146,
"num_tokens": 16442930.0,
"step": 980
},
{
"entropy": 1.1283981755375863,
"epoch": 6.3072,
"grad_norm": 0.9190363883972168,
"learning_rate": 6.369475005736984e-06,
"loss": 0.7594,
"mean_token_accuracy": 0.7621881037950515,
"num_tokens": 16612141.0,
"step": 990
},
{
"entropy": 1.1091500714421272,
"epoch": 6.3712,
"grad_norm": 0.8615358471870422,
"learning_rate": 6.177933684263524e-06,
"loss": 0.7352,
"mean_token_accuracy": 0.7689472794532776,
"num_tokens": 16783610.0,
"step": 1000
},
{
"entropy": 1.0969498217105866,
"epoch": 6.4352,
"grad_norm": 0.9383291602134705,
"learning_rate": 5.988020733338767e-06,
"loss": 0.705,
"mean_token_accuracy": 0.772877112030983,
"num_tokens": 16951601.0,
"step": 1010
},
{
"entropy": 1.1219998925924302,
"epoch": 6.4992,
"grad_norm": 0.9278421998023987,
"learning_rate": 5.7998170643416795e-06,
"loss": 0.7366,
"mean_token_accuracy": 0.7668613627552986,
"num_tokens": 17118402.0,
"step": 1020
},
{
"entropy": 1.1189097076654435,
"epoch": 6.5632,
"grad_norm": 0.8941367268562317,
"learning_rate": 5.613402860420962e-06,
"loss": 0.7423,
"mean_token_accuracy": 0.7693732514977455,
"num_tokens": 17285077.0,
"step": 1030
},
{
"entropy": 1.1192366987466813,
"epoch": 6.6272,
"grad_norm": 0.9321838617324829,
"learning_rate": 5.428857542333465e-06,
"loss": 0.7383,
"mean_token_accuracy": 0.766059798002243,
"num_tokens": 17454468.0,
"step": 1040
},
{
"entropy": 1.1280045241117478,
"epoch": 6.6912,
"grad_norm": 0.9867642521858215,
"learning_rate": 5.246259734607411e-06,
"loss": 0.7452,
"mean_token_accuracy": 0.7636990651488305,
"num_tokens": 17622278.0,
"step": 1050
},
{
"entropy": 1.1145729750394822,
"epoch": 6.7552,
"grad_norm": 1.00631844997406,
"learning_rate": 5.065687232044811e-06,
"loss": 0.731,
"mean_token_accuracy": 0.7677978798747063,
"num_tokens": 17791512.0,
"step": 1060
},
{
"entropy": 1.1203809767961501,
"epoch": 6.8192,
"grad_norm": 0.9962554574012756,
"learning_rate": 4.887216966577458e-06,
"loss": 0.742,
"mean_token_accuracy": 0.7627907797694207,
"num_tokens": 17960407.0,
"step": 1070
},
{
"entropy": 1.1107396587729454,
"epoch": 6.8832,
"grad_norm": 0.9973596930503845,
"learning_rate": 4.710924974490463e-06,
"loss": 0.7249,
"mean_token_accuracy": 0.7697675704956055,
"num_tokens": 18125304.0,
"step": 1080
},
{
"entropy": 1.12523413002491,
"epoch": 6.9472000000000005,
"grad_norm": 0.9931960105895996,
"learning_rate": 4.536886364027428e-06,
"loss": 0.7455,
"mean_token_accuracy": 0.763170848786831,
"num_tokens": 18294233.0,
"step": 1090
},
{
"entropy": 1.1127794884346627,
"epoch": 7.0064,
"grad_norm": 0.8755695223808289,
"learning_rate": 4.365175283390968e-06,
"loss": 0.7232,
"mean_token_accuracy": 0.7706596577489698,
"num_tokens": 18452285.0,
"step": 1100
},
{
"entropy": 1.0963766992092132,
"epoch": 7.0704,
"grad_norm": 1.0143297910690308,
"learning_rate": 4.195864889152295e-06,
"loss": 0.7005,
"mean_token_accuracy": 0.7757644459605217,
"num_tokens": 18620732.0,
"step": 1110
},
{
"entropy": 1.0792216598987578,
"epoch": 7.1344,
"grad_norm": 1.0209460258483887,
"learning_rate": 4.029027315083251e-06,
"loss": 0.6906,
"mean_token_accuracy": 0.7794409260153771,
"num_tokens": 18787944.0,
"step": 1120
},
{
"entropy": 1.102518378198147,
"epoch": 7.1984,
"grad_norm": 1.0153676271438599,
"learning_rate": 3.864733641424093e-06,
"loss": 0.7044,
"mean_token_accuracy": 0.774037578701973,
"num_tokens": 18951875.0,
"step": 1130
},
{
"entropy": 1.1013861119747161,
"epoch": 7.2624,
"grad_norm": 1.0647627115249634,
"learning_rate": 3.703053864600169e-06,
"loss": 0.7215,
"mean_token_accuracy": 0.7702529579401016,
"num_tokens": 19121454.0,
"step": 1140
},
{
"entropy": 1.089624047279358,
"epoch": 7.3264,
"grad_norm": 1.0077697038650513,
"learning_rate": 3.544056867400306e-06,
"loss": 0.7079,
"mean_token_accuracy": 0.7726217702031135,
"num_tokens": 19290430.0,
"step": 1150
},
{
"entropy": 1.1091026380658149,
"epoch": 7.3904,
"grad_norm": 1.0901305675506592,
"learning_rate": 3.3878103896296677e-06,
"loss": 0.7233,
"mean_token_accuracy": 0.7718619227409362,
"num_tokens": 19458849.0,
"step": 1160
},
{
"entropy": 1.0947757676243781,
"epoch": 7.4544,
"grad_norm": 1.028538703918457,
"learning_rate": 3.2343809992495945e-06,
"loss": 0.7119,
"mean_token_accuracy": 0.7740111395716667,
"num_tokens": 19625293.0,
"step": 1170
},
{
"entropy": 1.10685034096241,
"epoch": 7.5184,
"grad_norm": 1.026236653327942,
"learning_rate": 3.083834064016682e-06,
"loss": 0.7273,
"mean_token_accuracy": 0.7731231868267059,
"num_tokens": 19794945.0,
"step": 1180
},
{
"entropy": 1.0935991361737252,
"epoch": 7.5824,
"grad_norm": 1.1131870746612549,
"learning_rate": 2.9362337236331884e-06,
"loss": 0.7074,
"mean_token_accuracy": 0.7722717076539993,
"num_tokens": 19963076.0,
"step": 1190
},
{
"entropy": 1.1043099403381347,
"epoch": 7.6464,
"grad_norm": 1.0670139789581299,
"learning_rate": 2.791642862420686e-06,
"loss": 0.7258,
"mean_token_accuracy": 0.7688395619392395,
"num_tokens": 20134923.0,
"step": 1200
},
{
"entropy": 1.102524772286415,
"epoch": 7.7104,
"grad_norm": 1.0460227727890015,
"learning_rate": 2.6501230825285294e-06,
"loss": 0.7122,
"mean_token_accuracy": 0.7745070040225983,
"num_tokens": 20301990.0,
"step": 1210
},
{
"entropy": 1.0997470021247864,
"epoch": 7.7744,
"grad_norm": 1.1005793809890747,
"learning_rate": 2.5117346776885843e-06,
"loss": 0.7343,
"mean_token_accuracy": 0.7664325267076493,
"num_tokens": 20470721.0,
"step": 1220
},
{
"entropy": 1.1047000914812088,
"epoch": 7.8384,
"grad_norm": 1.01988685131073,
"learning_rate": 2.3765366075274287e-06,
"loss": 0.7188,
"mean_token_accuracy": 0.7712782993912697,
"num_tokens": 20637672.0,
"step": 1230
},
{
"entropy": 1.1048908308148384,
"epoch": 7.9024,
"grad_norm": 1.042604684829712,
"learning_rate": 2.2445864724469146e-06,
"loss": 0.7214,
"mean_token_accuracy": 0.7692830249667167,
"num_tokens": 20809780.0,
"step": 1240
},
{
"entropy": 1.1015258342027665,
"epoch": 7.9664,
"grad_norm": 1.0530294179916382,
"learning_rate": 2.1159404890838365e-06,
"loss": 0.7174,
"mean_token_accuracy": 0.7710513040423393,
"num_tokens": 20977925.0,
"step": 1250
},
{
"entropy": 1.1052203758342847,
"epoch": 8.0256,
"grad_norm": 1.0588289499282837,
"learning_rate": 1.990653466359125e-06,
"loss": 0.7231,
"mean_token_accuracy": 0.7697531097644085,
"num_tokens": 21135709.0,
"step": 1260
},
{
"entropy": 1.0664937138557433,
"epoch": 8.0896,
"grad_norm": 1.1996620893478394,
"learning_rate": 1.8687787821268255e-06,
"loss": 0.6798,
"mean_token_accuracy": 0.7811540484428405,
"num_tokens": 21305580.0,
"step": 1270
},
{
"entropy": 1.0717683494091035,
"epoch": 8.1536,
"grad_norm": 1.1794630289077759,
"learning_rate": 1.7503683604327426e-06,
"loss": 0.6944,
"mean_token_accuracy": 0.7757708877325058,
"num_tokens": 21476026.0,
"step": 1280
},
{
"entropy": 1.0876216664910316,
"epoch": 8.2176,
"grad_norm": 1.0743852853775024,
"learning_rate": 1.6354726493924745e-06,
"loss": 0.7044,
"mean_token_accuracy": 0.7734724819660187,
"num_tokens": 21644729.0,
"step": 1290
},
{
"entropy": 1.0878884211182593,
"epoch": 8.2816,
"grad_norm": 1.1732165813446045,
"learning_rate": 1.5241405996982928e-06,
"loss": 0.7015,
"mean_token_accuracy": 0.7772793591022491,
"num_tokens": 21811332.0,
"step": 1300
},
{
"entropy": 1.080038744211197,
"epoch": 8.3456,
"grad_norm": 1.1939797401428223,
"learning_rate": 1.4164196437639355e-06,
"loss": 0.6929,
"mean_token_accuracy": 0.7762296363711357,
"num_tokens": 21976237.0,
"step": 1310
},
{
"entropy": 1.0742896348237991,
"epoch": 8.4096,
"grad_norm": 1.1042524576187134,
"learning_rate": 1.3123556755163114e-06,
"loss": 0.6917,
"mean_token_accuracy": 0.7782910659909248,
"num_tokens": 22145608.0,
"step": 1320
},
{
"entropy": 1.077732390165329,
"epoch": 8.4736,
"grad_norm": 1.0329608917236328,
"learning_rate": 1.2119930308426264e-06,
"loss": 0.6967,
"mean_token_accuracy": 0.7769305527210235,
"num_tokens": 22313707.0,
"step": 1330
},
{
"entropy": 1.103071777522564,
"epoch": 8.5376,
"grad_norm": 1.110071063041687,
"learning_rate": 1.1153744687013313e-06,
"loss": 0.7219,
"mean_token_accuracy": 0.7715903207659721,
"num_tokens": 22481770.0,
"step": 1340
},
{
"entropy": 1.099236251413822,
"epoch": 8.6016,
"grad_norm": 0.999956488609314,
"learning_rate": 1.0225411529048857e-06,
"loss": 0.7184,
"mean_token_accuracy": 0.7770519211888314,
"num_tokens": 22649599.0,
"step": 1350
},
{
"entropy": 1.0735243171453477,
"epoch": 8.6656,
"grad_norm": 1.0479539632797241,
"learning_rate": 9.33532634582156e-07,
"loss": 0.6895,
"mean_token_accuracy": 0.7782353475689888,
"num_tokens": 22818752.0,
"step": 1360
},
{
"entropy": 1.0788584634661675,
"epoch": 8.7296,
"grad_norm": 1.0581979751586914,
"learning_rate": 8.483868353278657e-07,
"loss": 0.7061,
"mean_token_accuracy": 0.7732961744070053,
"num_tokens": 22987614.0,
"step": 1370
},
{
"entropy": 1.1177189975976944,
"epoch": 8.7936,
"grad_norm": 1.100332498550415,
"learning_rate": 7.671400310462984e-07,
"loss": 0.7289,
"mean_token_accuracy": 0.7704362392425537,
"num_tokens": 23154417.0,
"step": 1380
},
{
"entropy": 1.0906570345163344,
"epoch": 8.8576,
"grad_norm": 1.1676188707351685,
"learning_rate": 6.898268364961591e-07,
"loss": 0.7094,
"mean_token_accuracy": 0.7727909624576569,
"num_tokens": 23322493.0,
"step": 1390
},
{
"entropy": 1.0766915142536164,
"epoch": 8.9216,
"grad_norm": 1.0389209985733032,
"learning_rate": 6.164801905431394e-07,
"loss": 0.7106,
"mean_token_accuracy": 0.7720396503806114,
"num_tokens": 23498552.0,
"step": 1400
},
{
"entropy": 1.0853375509381293,
"epoch": 8.9856,
"grad_norm": 1.101219892501831,
"learning_rate": 5.471313421264879e-07,
"loss": 0.6867,
"mean_token_accuracy": 0.7808714762330056,
"num_tokens": 23663155.0,
"step": 1410
},
{
"entropy": 1.0748054787919328,
"epoch": 9.0448,
"grad_norm": 1.1024824380874634,
"learning_rate": 4.818098369455793e-07,
"loss": 0.6784,
"mean_token_accuracy": 0.7802738080153594,
"num_tokens": 23817642.0,
"step": 1420
},
{
"entropy": 1.0809885799884795,
"epoch": 9.1088,
"grad_norm": 1.0660940408706665,
"learning_rate": 4.20543504872124e-07,
"loss": 0.6928,
"mean_token_accuracy": 0.7785634055733681,
"num_tokens": 23986616.0,
"step": 1430
},
{
"entropy": 1.0696254506707192,
"epoch": 9.1728,
"grad_norm": 1.098575472831726,
"learning_rate": 3.633584480934016e-07,
"loss": 0.6848,
"mean_token_accuracy": 0.7822138294577599,
"num_tokens": 24153973.0,
"step": 1440
},
{
"entropy": 1.0600635647773742,
"epoch": 9.2368,
"grad_norm": 1.1507972478866577,
"learning_rate": 3.1027902999157146e-07,
"loss": 0.67,
"mean_token_accuracy": 0.7815300151705742,
"num_tokens": 24321980.0,
"step": 1450
},
{
"entropy": 1.0735993713140488,
"epoch": 9.3008,
"grad_norm": 1.1208281517028809,
"learning_rate": 2.61327864763784e-07,
"loss": 0.691,
"mean_token_accuracy": 0.7773459628224373,
"num_tokens": 24491957.0,
"step": 1460
},
{
"entropy": 1.0888471096754073,
"epoch": 9.3648,
"grad_norm": 1.0866674184799194,
"learning_rate": 2.1652580778751875e-07,
"loss": 0.7091,
"mean_token_accuracy": 0.7754179865121842,
"num_tokens": 24658306.0,
"step": 1470
},
{
"entropy": 1.0891848027706146,
"epoch": 9.4288,
"grad_norm": 1.111118197441101,
"learning_rate": 1.758919467352771e-07,
"loss": 0.6999,
"mean_token_accuracy": 0.7776159614324569,
"num_tokens": 24821950.0,
"step": 1480
},
{
"entropy": 1.068458940088749,
"epoch": 9.4928,
"grad_norm": 1.1345736980438232,
"learning_rate": 1.3944359344237214e-07,
"loss": 0.6819,
"mean_token_accuracy": 0.7809593558311463,
"num_tokens": 24991570.0,
"step": 1490
},
{
"entropy": 1.0842776700854302,
"epoch": 9.556799999999999,
"grad_norm": 1.0693023204803467,
"learning_rate": 1.0719627653131948e-07,
"loss": 0.7059,
"mean_token_accuracy": 0.7756290450692177,
"num_tokens": 25160961.0,
"step": 1500
},
{
"entropy": 1.0747777849435807,
"epoch": 9.6208,
"grad_norm": 1.1459989547729492,
"learning_rate": 7.916373479595507e-08,
"loss": 0.6964,
"mean_token_accuracy": 0.7755286246538162,
"num_tokens": 25330836.0,
"step": 1510
},
{
"entropy": 1.0941903442144394,
"epoch": 9.6848,
"grad_norm": 1.103893518447876,
"learning_rate": 5.535791134809176e-08,
"loss": 0.7116,
"mean_token_accuracy": 0.7722656220197678,
"num_tokens": 25499639.0,
"step": 1520
},
{
"entropy": 1.0937790602445603,
"epoch": 9.7488,
"grad_norm": 1.2139781713485718,
"learning_rate": 3.57889485292251e-08,
"loss": 0.7092,
"mean_token_accuracy": 0.7771677598357201,
"num_tokens": 25666081.0,
"step": 1530
},
{
"entropy": 1.0790585070848464,
"epoch": 9.8128,
"grad_norm": 1.0998142957687378,
"learning_rate": 2.046518358944094e-08,
"loss": 0.7061,
"mean_token_accuracy": 0.7749298721551895,
"num_tokens": 25836012.0,
"step": 1540
},
{
"entropy": 1.087978368997574,
"epoch": 9.8768,
"grad_norm": 1.1979362964630127,
"learning_rate": 9.393145135377924e-09,
"loss": 0.7221,
"mean_token_accuracy": 0.7720273390412331,
"num_tokens": 26007577.0,
"step": 1550
},
{
"entropy": 1.077130888402462,
"epoch": 9.9408,
"grad_norm": 0.9926674962043762,
"learning_rate": 2.5775503487501795e-09,
"loss": 0.6815,
"mean_token_accuracy": 0.7797598227858543,
"num_tokens": 26176310.0,
"step": 1560
},
{
"entropy": 1.0749925036688108,
"epoch": 10.0,
"grad_norm": 2.0213756561279297,
"learning_rate": 2.1302976616066616e-11,
"loss": 0.6932,
"mean_token_accuracy": 0.7767725538563084,
"num_tokens": 26334470.0,
"step": 1570
}
],
"logging_steps": 10,
"max_steps": 1570,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.184067262525866e+18,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}