{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 10.0, "eval_steps": 500, "global_step": 1570, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3206602305173873, "epoch": 0.064, "grad_norm": 0.9292202591896057, "learning_rate": 3.7500000000000005e-06, "loss": 1.1131, "mean_token_accuracy": 0.7011688977479935, "num_tokens": 167271.0, "step": 10 }, { "entropy": 1.3284908413887024, "epoch": 0.128, "grad_norm": 0.660650908946991, "learning_rate": 7.916666666666667e-06, "loss": 1.0843, "mean_token_accuracy": 0.7041632518172264, "num_tokens": 335534.0, "step": 20 }, { "entropy": 1.3329698264598846, "epoch": 0.192, "grad_norm": 0.46980366110801697, "learning_rate": 1.2083333333333333e-05, "loss": 0.9948, "mean_token_accuracy": 0.7138608112931252, "num_tokens": 504764.0, "step": 30 }, { "entropy": 1.3528490722179414, "epoch": 0.256, "grad_norm": 0.3592575192451477, "learning_rate": 1.6250000000000002e-05, "loss": 0.9485, "mean_token_accuracy": 0.721599918603897, "num_tokens": 674680.0, "step": 40 }, { "entropy": 1.3213547974824906, "epoch": 0.32, "grad_norm": 0.31555160880088806, "learning_rate": 1.9999978697023387e-05, "loss": 0.9296, "mean_token_accuracy": 0.7227451264858246, "num_tokens": 839934.0, "step": 50 }, { "entropy": 1.2997384041547775, "epoch": 0.384, "grad_norm": 0.2809937000274658, "learning_rate": 1.999742244965125e-05, "loss": 0.9414, "mean_token_accuracy": 0.7233463451266289, "num_tokens": 1005135.0, "step": 60 }, { "entropy": 1.2680538922548295, "epoch": 0.448, "grad_norm": 0.28027236461639404, "learning_rate": 1.9990606854864625e-05, "loss": 0.8823, "mean_token_accuracy": 0.7340415641665459, "num_tokens": 1172366.0, "step": 70 }, { "entropy": 1.2720171421766282, "epoch": 0.512, "grad_norm": 0.27143529057502747, "learning_rate": 1.997953481641056e-05, "loss": 0.882, "mean_token_accuracy": 0.7348188936710358, "num_tokens": 1340013.0, "step": 80 }, { "entropy": 1.2880662232637405, "epoch": 0.576, "grad_norm": 0.2534484565258026, "learning_rate": 1.9964211051470778e-05, "loss": 0.8938, "mean_token_accuracy": 0.7337884500622749, "num_tokens": 1507478.0, "step": 90 }, { "entropy": 1.2950494319200516, "epoch": 0.64, "grad_norm": 0.29349154233932495, "learning_rate": 1.994464208865191e-05, "loss": 0.9225, "mean_token_accuracy": 0.7275586023926734, "num_tokens": 1680653.0, "step": 100 }, { "entropy": 1.2790019273757935, "epoch": 0.704, "grad_norm": 0.2847479581832886, "learning_rate": 1.9920836265204047e-05, "loss": 0.8916, "mean_token_accuracy": 0.7341030821204185, "num_tokens": 1851057.0, "step": 110 }, { "entropy": 1.2715142965316772, "epoch": 0.768, "grad_norm": 0.27320924401283264, "learning_rate": 1.989280372346868e-05, "loss": 0.8824, "mean_token_accuracy": 0.7345656096935272, "num_tokens": 2018983.0, "step": 120 }, { "entropy": 1.3021604150533677, "epoch": 0.832, "grad_norm": 0.31183984875679016, "learning_rate": 1.986055640655763e-05, "loss": 0.9231, "mean_token_accuracy": 0.7273582145571709, "num_tokens": 2188992.0, "step": 130 }, { "entropy": 1.2842024236917495, "epoch": 0.896, "grad_norm": 0.3226590156555176, "learning_rate": 1.9824108053264726e-05, "loss": 0.8858, "mean_token_accuracy": 0.7334808766841888, "num_tokens": 2358611.0, "step": 140 }, { "entropy": 1.2750529646873474, "epoch": 0.96, "grad_norm": 0.3014202415943146, "learning_rate": 1.9783474192212484e-05, "loss": 0.8843, "mean_token_accuracy": 0.7379685431718827, "num_tokens": 2527068.0, "step": 150 }, { "entropy": 1.286011647533726, "epoch": 1.0192, "grad_norm": 0.31638771295547485, "learning_rate": 1.9738672135236218e-05, "loss": 0.9009, "mean_token_accuracy": 0.7322732838424476, "num_tokens": 2685134.0, "step": 160 }, { "entropy": 1.2853516817092896, "epoch": 1.0832, "grad_norm": 0.29617786407470703, "learning_rate": 1.968972097000843e-05, "loss": 0.8978, "mean_token_accuracy": 0.7337976396083832, "num_tokens": 2852350.0, "step": 170 }, { "entropy": 1.261508396267891, "epoch": 1.1472, "grad_norm": 0.34440022706985474, "learning_rate": 1.96366415519066e-05, "loss": 0.8612, "mean_token_accuracy": 0.7381596371531487, "num_tokens": 3021070.0, "step": 180 }, { "entropy": 1.263030657172203, "epoch": 1.2112, "grad_norm": 0.3183440864086151, "learning_rate": 1.957945649512788e-05, "loss": 0.8775, "mean_token_accuracy": 0.7360784441232682, "num_tokens": 3188758.0, "step": 190 }, { "entropy": 1.2699549317359924, "epoch": 1.2752, "grad_norm": 0.316829651594162, "learning_rate": 1.951819016305442e-05, "loss": 0.871, "mean_token_accuracy": 0.7383767917752266, "num_tokens": 3356098.0, "step": 200 }, { "entropy": 1.284775710105896, "epoch": 1.3392, "grad_norm": 0.3272818922996521, "learning_rate": 1.9452868657873513e-05, "loss": 0.87, "mean_token_accuracy": 0.7359273687005043, "num_tokens": 3522909.0, "step": 210 }, { "entropy": 1.2776107609272003, "epoch": 1.4032, "grad_norm": 0.34563735127449036, "learning_rate": 1.9383519809456862e-05, "loss": 0.8833, "mean_token_accuracy": 0.735480035841465, "num_tokens": 3686875.0, "step": 220 }, { "entropy": 1.262231531739235, "epoch": 1.4672, "grad_norm": 0.33589527010917664, "learning_rate": 1.931017316350384e-05, "loss": 0.8653, "mean_token_accuracy": 0.736232727766037, "num_tokens": 3853087.0, "step": 230 }, { "entropy": 1.2684703916311264, "epoch": 1.5312000000000001, "grad_norm": 0.3261985182762146, "learning_rate": 1.9232859968953702e-05, "loss": 0.88, "mean_token_accuracy": 0.7341130167245865, "num_tokens": 4021454.0, "step": 240 }, { "entropy": 1.2511296778917314, "epoch": 1.5952, "grad_norm": 0.3339959681034088, "learning_rate": 1.9151613164672136e-05, "loss": 0.8526, "mean_token_accuracy": 0.7398458629846573, "num_tokens": 4192689.0, "step": 250 }, { "entropy": 1.2628758728504181, "epoch": 1.6592, "grad_norm": 0.3413638472557068, "learning_rate": 1.9066467365417844e-05, "loss": 0.8691, "mean_token_accuracy": 0.7368915528059006, "num_tokens": 4361378.0, "step": 260 }, { "entropy": 1.2695908069610595, "epoch": 1.7231999999999998, "grad_norm": 0.3355003595352173, "learning_rate": 1.8977458847095117e-05, "loss": 0.8584, "mean_token_accuracy": 0.7388368755578995, "num_tokens": 4527968.0, "step": 270 }, { "entropy": 1.2557695835828782, "epoch": 1.7872, "grad_norm": 0.35713067650794983, "learning_rate": 1.888462553129867e-05, "loss": 0.8615, "mean_token_accuracy": 0.7374937132000923, "num_tokens": 4697185.0, "step": 280 }, { "entropy": 1.258004653453827, "epoch": 1.8512, "grad_norm": 0.35476240515708923, "learning_rate": 1.878800696915737e-05, "loss": 0.8735, "mean_token_accuracy": 0.7390823766589165, "num_tokens": 4869268.0, "step": 290 }, { "entropy": 1.2416281551122665, "epoch": 1.9152, "grad_norm": 0.2956583797931671, "learning_rate": 1.868764432448369e-05, "loss": 0.8587, "mean_token_accuracy": 0.7391577690839768, "num_tokens": 5041668.0, "step": 300 }, { "entropy": 1.2554892003536224, "epoch": 1.9792, "grad_norm": 0.36443835496902466, "learning_rate": 1.8583580356236065e-05, "loss": 0.8784, "mean_token_accuracy": 0.7360676273703575, "num_tokens": 5211130.0, "step": 310 }, { "entropy": 1.2533008375683345, "epoch": 2.0384, "grad_norm": 0.37365785241127014, "learning_rate": 1.8475859400301708e-05, "loss": 0.8448, "mean_token_accuracy": 0.7391577572435946, "num_tokens": 5365597.0, "step": 320 }, { "entropy": 1.2590773075819015, "epoch": 2.1024, "grad_norm": 0.44947031140327454, "learning_rate": 1.8364527350607527e-05, "loss": 0.8602, "mean_token_accuracy": 0.7381724148988724, "num_tokens": 5529944.0, "step": 330 }, { "entropy": 1.2393722623586654, "epoch": 2.1664, "grad_norm": 0.3682183027267456, "learning_rate": 1.824963163956726e-05, "loss": 0.8516, "mean_token_accuracy": 0.7419341534376145, "num_tokens": 5701741.0, "step": 340 }, { "entropy": 1.224160623550415, "epoch": 2.2304, "grad_norm": 0.3923819959163666, "learning_rate": 1.8131221217873175e-05, "loss": 0.8377, "mean_token_accuracy": 0.7442746981978416, "num_tokens": 5873777.0, "step": 350 }, { "entropy": 1.2588546723127365, "epoch": 2.2944, "grad_norm": 0.39916929602622986, "learning_rate": 1.8009346533640877e-05, "loss": 0.878, "mean_token_accuracy": 0.7364423900842667, "num_tokens": 6044077.0, "step": 360 }, { "entropy": 1.2643144816160201, "epoch": 2.3584, "grad_norm": 0.420813649892807, "learning_rate": 1.7884059510916167e-05, "loss": 0.8603, "mean_token_accuracy": 0.7379584088921547, "num_tokens": 6208773.0, "step": 370 }, { "entropy": 1.2406759321689607, "epoch": 2.4224, "grad_norm": 0.3934536278247833, "learning_rate": 1.7755413527553087e-05, "loss": 0.8452, "mean_token_accuracy": 0.7419968873262406, "num_tokens": 6375486.0, "step": 380 }, { "entropy": 1.239344623684883, "epoch": 2.4864, "grad_norm": 0.3987742066383362, "learning_rate": 1.7623463392472574e-05, "loss": 0.8515, "mean_token_accuracy": 0.7414514541625976, "num_tokens": 6546290.0, "step": 390 }, { "entropy": 1.2116641372442245, "epoch": 2.5504, "grad_norm": 0.43099576234817505, "learning_rate": 1.748826532231142e-05, "loss": 0.8209, "mean_token_accuracy": 0.746632432937622, "num_tokens": 6717949.0, "step": 400 }, { "entropy": 1.2477060765028, "epoch": 2.6144, "grad_norm": 0.41407084465026855, "learning_rate": 1.7349876917471474e-05, "loss": 0.8456, "mean_token_accuracy": 0.7417222335934639, "num_tokens": 6883125.0, "step": 410 }, { "entropy": 1.2271479934453964, "epoch": 2.6784, "grad_norm": 0.4161278307437897, "learning_rate": 1.7208357137579318e-05, "loss": 0.8411, "mean_token_accuracy": 0.744826503098011, "num_tokens": 7053271.0, "step": 420 }, { "entropy": 1.2537022173404693, "epoch": 2.7424, "grad_norm": 0.39646434783935547, "learning_rate": 1.7063766276366814e-05, "loss": 0.875, "mean_token_accuracy": 0.7370057612657547, "num_tokens": 7225737.0, "step": 430 }, { "entropy": 1.229554709792137, "epoch": 2.8064, "grad_norm": 0.409257173538208, "learning_rate": 1.6916165935983323e-05, "loss": 0.8434, "mean_token_accuracy": 0.7419100552797318, "num_tokens": 7393850.0, "step": 440 }, { "entropy": 1.2586964070796967, "epoch": 2.8704, "grad_norm": 0.44094783067703247, "learning_rate": 1.676561900075041e-05, "loss": 0.8623, "mean_token_accuracy": 0.7402451306581497, "num_tokens": 7560159.0, "step": 450 }, { "entropy": 1.2187331795692444, "epoch": 2.9344, "grad_norm": 0.3948505222797394, "learning_rate": 1.6612189610370336e-05, "loss": 0.82, "mean_token_accuracy": 0.7458591118454934, "num_tokens": 7726778.0, "step": 460 }, { "entropy": 1.2287385314702988, "epoch": 2.9984, "grad_norm": 0.4345516562461853, "learning_rate": 1.6455943132599698e-05, "loss": 0.8396, "mean_token_accuracy": 0.7434753939509392, "num_tokens": 7896364.0, "step": 470 }, { "entropy": 1.2102074913076453, "epoch": 3.0576, "grad_norm": 0.42504480481147766, "learning_rate": 1.6296946135399835e-05, "loss": 0.821, "mean_token_accuracy": 0.7462124454008566, "num_tokens": 8050254.0, "step": 480 }, { "entropy": 1.2117455512285233, "epoch": 3.1216, "grad_norm": 0.44672510027885437, "learning_rate": 1.613526635857591e-05, "loss": 0.8198, "mean_token_accuracy": 0.7464832335710525, "num_tokens": 8217439.0, "step": 490 }, { "entropy": 1.2218973994255067, "epoch": 3.1856, "grad_norm": 0.4569561779499054, "learning_rate": 1.5970972684916754e-05, "loss": 0.8394, "mean_token_accuracy": 0.743482106924057, "num_tokens": 8384749.0, "step": 500 }, { "entropy": 1.205233234167099, "epoch": 3.2496, "grad_norm": 0.49336662888526917, "learning_rate": 1.5804135110847708e-05, "loss": 0.8126, "mean_token_accuracy": 0.7476648792624474, "num_tokens": 8552626.0, "step": 510 }, { "entropy": 1.2141715466976166, "epoch": 3.3136, "grad_norm": 0.47234952449798584, "learning_rate": 1.5634824716609037e-05, "loss": 0.8199, "mean_token_accuracy": 0.7487053409218788, "num_tokens": 8719495.0, "step": 520 }, { "entropy": 1.2043092876672745, "epoch": 3.3776, "grad_norm": 0.4978366792201996, "learning_rate": 1.5463113635972577e-05, "loss": 0.8121, "mean_token_accuracy": 0.7485451966524124, "num_tokens": 8889843.0, "step": 530 }, { "entropy": 1.2383090078830719, "epoch": 3.4416, "grad_norm": 0.473350465297699, "learning_rate": 1.528907502550954e-05, "loss": 0.8633, "mean_token_accuracy": 0.7431078001856803, "num_tokens": 9059897.0, "step": 540 }, { "entropy": 1.1710155814886094, "epoch": 3.5056000000000003, "grad_norm": 0.48414960503578186, "learning_rate": 1.5112783033422547e-05, "loss": 0.7952, "mean_token_accuracy": 0.751731738448143, "num_tokens": 9230970.0, "step": 550 }, { "entropy": 1.194032496213913, "epoch": 3.5696, "grad_norm": 0.5241577625274658, "learning_rate": 1.4934312767955193e-05, "loss": 0.8106, "mean_token_accuracy": 0.748333002626896, "num_tokens": 9400137.0, "step": 560 }, { "entropy": 1.203871914744377, "epoch": 3.6336, "grad_norm": 0.4763513505458832, "learning_rate": 1.4753740265392595e-05, "loss": 0.8321, "mean_token_accuracy": 0.7462276950478554, "num_tokens": 9569468.0, "step": 570 }, { "entropy": 1.2193732023239137, "epoch": 3.6976, "grad_norm": 0.5063449740409851, "learning_rate": 1.4571142457666536e-05, "loss": 0.8297, "mean_token_accuracy": 0.7442631095647811, "num_tokens": 9739091.0, "step": 580 }, { "entropy": 1.20502949655056, "epoch": 3.7616, "grad_norm": 0.5168077945709229, "learning_rate": 1.4386597139579041e-05, "loss": 0.8087, "mean_token_accuracy": 0.750263799726963, "num_tokens": 9903536.0, "step": 590 }, { "entropy": 1.211077681183815, "epoch": 3.8256, "grad_norm": 0.5382931232452393, "learning_rate": 1.4200182935658327e-05, "loss": 0.8212, "mean_token_accuracy": 0.7472874745726585, "num_tokens": 10070133.0, "step": 600 }, { "entropy": 1.2020549327135086, "epoch": 3.8895999999999997, "grad_norm": 0.4987923502922058, "learning_rate": 1.4011979266661235e-05, "loss": 0.8239, "mean_token_accuracy": 0.7469061449170112, "num_tokens": 10242501.0, "step": 610 }, { "entropy": 1.210327258706093, "epoch": 3.9536, "grad_norm": 0.5201823115348816, "learning_rate": 1.3822066315736477e-05, "loss": 0.8274, "mean_token_accuracy": 0.746899065375328, "num_tokens": 10411438.0, "step": 620 }, { "entropy": 1.2165618264997327, "epoch": 4.0128, "grad_norm": 0.5398468971252441, "learning_rate": 1.363052499426302e-05, "loss": 0.831, "mean_token_accuracy": 0.7447031430295996, "num_tokens": 10568566.0, "step": 630 }, { "entropy": 1.1632685348391534, "epoch": 4.0768, "grad_norm": 0.6215068697929382, "learning_rate": 1.3437436907378225e-05, "loss": 0.7707, "mean_token_accuracy": 0.7566415458917618, "num_tokens": 10736787.0, "step": 640 }, { "entropy": 1.1855787336826324, "epoch": 4.1408, "grad_norm": 0.5971937775611877, "learning_rate": 1.3242884319210463e-05, "loss": 0.8059, "mean_token_accuracy": 0.7505464211106301, "num_tokens": 10907187.0, "step": 650 }, { "entropy": 1.1913582772016524, "epoch": 4.2048, "grad_norm": 0.64606112241745, "learning_rate": 1.3046950117830888e-05, "loss": 0.8079, "mean_token_accuracy": 0.7538586258888245, "num_tokens": 11076448.0, "step": 660 }, { "entropy": 1.1633977055549622, "epoch": 4.2688, "grad_norm": 0.6025974750518799, "learning_rate": 1.2849717779939439e-05, "loss": 0.7804, "mean_token_accuracy": 0.754143525660038, "num_tokens": 11246044.0, "step": 670 }, { "entropy": 1.172673773765564, "epoch": 4.3328, "grad_norm": 0.5885686278343201, "learning_rate": 1.2651271335300063e-05, "loss": 0.798, "mean_token_accuracy": 0.7523474931716919, "num_tokens": 11415782.0, "step": 680 }, { "entropy": 1.1495980948209763, "epoch": 4.3968, "grad_norm": 0.6189532279968262, "learning_rate": 1.2451695330940268e-05, "loss": 0.766, "mean_token_accuracy": 0.7611258506774903, "num_tokens": 11581998.0, "step": 690 }, { "entropy": 1.1974951326847076, "epoch": 4.4608, "grad_norm": 0.6507912874221802, "learning_rate": 1.2251074795130339e-05, "loss": 0.8261, "mean_token_accuracy": 0.7475854620337486, "num_tokens": 11752776.0, "step": 700 }, { "entropy": 1.1862800359725951, "epoch": 4.5248, "grad_norm": 0.6506279110908508, "learning_rate": 1.2049495201157489e-05, "loss": 0.7858, "mean_token_accuracy": 0.7544367983937263, "num_tokens": 11916319.0, "step": 710 }, { "entropy": 1.1888660967350007, "epoch": 4.5888, "grad_norm": 0.7014175653457642, "learning_rate": 1.1847042430910451e-05, "loss": 0.8118, "mean_token_accuracy": 0.7482251942157745, "num_tokens": 12084487.0, "step": 720 }, { "entropy": 1.1586445271968842, "epoch": 4.6528, "grad_norm": 0.6517874598503113, "learning_rate": 1.1643802738289955e-05, "loss": 0.7778, "mean_token_accuracy": 0.7564518004655838, "num_tokens": 12253339.0, "step": 730 }, { "entropy": 1.1812776714563369, "epoch": 4.7168, "grad_norm": 0.6842546463012695, "learning_rate": 1.1439862712460721e-05, "loss": 0.7957, "mean_token_accuracy": 0.7507700502872467, "num_tokens": 12423311.0, "step": 740 }, { "entropy": 1.1869671106338502, "epoch": 4.7808, "grad_norm": 0.6829348206520081, "learning_rate": 1.1235309240960621e-05, "loss": 0.8125, "mean_token_accuracy": 0.7493612572550774, "num_tokens": 12593509.0, "step": 750 }, { "entropy": 1.1620380729436874, "epoch": 4.8448, "grad_norm": 0.5931580066680908, "learning_rate": 1.1030229472682719e-05, "loss": 0.7863, "mean_token_accuracy": 0.7565168127417564, "num_tokens": 12762574.0, "step": 760 }, { "entropy": 1.1934880197048188, "epoch": 4.9088, "grad_norm": 0.673819899559021, "learning_rate": 1.0824710780745954e-05, "loss": 0.7921, "mean_token_accuracy": 0.7512735366821289, "num_tokens": 12927608.0, "step": 770 }, { "entropy": 1.1958867460489273, "epoch": 4.9728, "grad_norm": 0.6820770502090454, "learning_rate": 1.06188407252703e-05, "loss": 0.8103, "mean_token_accuracy": 0.7500374510884285, "num_tokens": 13095807.0, "step": 780 }, { "entropy": 1.1728345767871753, "epoch": 5.032, "grad_norm": 0.7087289094924927, "learning_rate": 1.0412707016072254e-05, "loss": 0.7749, "mean_token_accuracy": 0.7583866667103123, "num_tokens": 13248102.0, "step": 790 }, { "entropy": 1.1663290411233902, "epoch": 5.096, "grad_norm": 0.7355737686157227, "learning_rate": 1.0206397475296548e-05, "loss": 0.7779, "mean_token_accuracy": 0.7589040651917458, "num_tokens": 13413512.0, "step": 800 }, { "entropy": 1.1404080986976624, "epoch": 5.16, "grad_norm": 0.7504479885101318, "learning_rate": 1e-05, "loss": 0.7517, "mean_token_accuracy": 0.7618933707475662, "num_tokens": 13583993.0, "step": 810 }, { "entropy": 1.1676405906677245, "epoch": 5.224, "grad_norm": 0.8724946975708008, "learning_rate": 9.793602524703456e-06, "loss": 0.7773, "mean_token_accuracy": 0.7555600613355636, "num_tokens": 13751270.0, "step": 820 }, { "entropy": 1.1330503553152085, "epoch": 5.288, "grad_norm": 0.7498918175697327, "learning_rate": 9.58729298392775e-06, "loss": 0.7475, "mean_token_accuracy": 0.7617968454957008, "num_tokens": 13921584.0, "step": 830 }, { "entropy": 1.1508350551128388, "epoch": 5.352, "grad_norm": 0.7500905990600586, "learning_rate": 9.381159274729704e-06, "loss": 0.7849, "mean_token_accuracy": 0.7576810494065285, "num_tokens": 14091937.0, "step": 840 }, { "entropy": 1.1224143624305725, "epoch": 5.416, "grad_norm": 0.7415691614151001, "learning_rate": 9.175289219254051e-06, "loss": 0.7341, "mean_token_accuracy": 0.7673233345150947, "num_tokens": 14260356.0, "step": 850 }, { "entropy": 1.1505684763193131, "epoch": 5.48, "grad_norm": 0.7703384757041931, "learning_rate": 8.969770527317283e-06, "loss": 0.7658, "mean_token_accuracy": 0.7610488831996918, "num_tokens": 14424125.0, "step": 860 }, { "entropy": 1.1513787150382995, "epoch": 5.5440000000000005, "grad_norm": 0.8211115002632141, "learning_rate": 8.764690759039382e-06, "loss": 0.7727, "mean_token_accuracy": 0.7584890708327293, "num_tokens": 14594600.0, "step": 870 }, { "entropy": 1.1472541570663453, "epoch": 5.608, "grad_norm": 0.7482420206069946, "learning_rate": 8.56013728753928e-06, "loss": 0.7767, "mean_token_accuracy": 0.7584212064743042, "num_tokens": 14765974.0, "step": 880 }, { "entropy": 1.1245936155319214, "epoch": 5.672, "grad_norm": 0.7992265224456787, "learning_rate": 8.356197261710048e-06, "loss": 0.7602, "mean_token_accuracy": 0.7592591598629952, "num_tokens": 14936349.0, "step": 890 }, { "entropy": 1.1513198018074036, "epoch": 5.736, "grad_norm": 0.7653408050537109, "learning_rate": 8.152957569089552e-06, "loss": 0.7622, "mean_token_accuracy": 0.760157561302185, "num_tokens": 15105256.0, "step": 900 }, { "entropy": 1.1511808067560196, "epoch": 5.8, "grad_norm": 0.802228569984436, "learning_rate": 7.950504798842513e-06, "loss": 0.7685, "mean_token_accuracy": 0.7571253061294556, "num_tokens": 15276369.0, "step": 910 }, { "entropy": 1.1488977074623108, "epoch": 5.864, "grad_norm": 0.8278489708900452, "learning_rate": 7.748925204869667e-06, "loss": 0.7704, "mean_token_accuracy": 0.7605934232473374, "num_tokens": 15444886.0, "step": 920 }, { "entropy": 1.1339735567569733, "epoch": 5.928, "grad_norm": 0.897056519985199, "learning_rate": 7.548304669059735e-06, "loss": 0.754, "mean_token_accuracy": 0.7624502271413803, "num_tokens": 15613205.0, "step": 930 }, { "entropy": 1.1681912243366241, "epoch": 5.992, "grad_norm": 0.8365456461906433, "learning_rate": 7.348728664699939e-06, "loss": 0.7771, "mean_token_accuracy": 0.758332185447216, "num_tokens": 15780285.0, "step": 940 }, { "entropy": 1.1275109552048348, "epoch": 6.0512, "grad_norm": 0.7828477025032043, "learning_rate": 7.150282220060564e-06, "loss": 0.7577, "mean_token_accuracy": 0.7635239346607311, "num_tokens": 15938875.0, "step": 950 }, { "entropy": 1.1234853833913803, "epoch": 6.1152, "grad_norm": 0.8459082245826721, "learning_rate": 6.9530498821691165e-06, "loss": 0.7387, "mean_token_accuracy": 0.7674040615558624, "num_tokens": 16107143.0, "step": 960 }, { "entropy": 1.1044875085353851, "epoch": 6.1792, "grad_norm": 0.964129626750946, "learning_rate": 6.757115680789539e-06, "loss": 0.7323, "mean_token_accuracy": 0.7670143201947213, "num_tokens": 16275215.0, "step": 970 }, { "entropy": 1.1271264016628266, "epoch": 6.2432, "grad_norm": 0.9594255089759827, "learning_rate": 6.562563092621776e-06, "loss": 0.7441, "mean_token_accuracy": 0.7671423986554146, "num_tokens": 16442930.0, "step": 980 }, { "entropy": 1.1283981755375863, "epoch": 6.3072, "grad_norm": 0.9190363883972168, "learning_rate": 6.369475005736984e-06, "loss": 0.7594, "mean_token_accuracy": 0.7621881037950515, "num_tokens": 16612141.0, "step": 990 }, { "entropy": 1.1091500714421272, "epoch": 6.3712, "grad_norm": 0.8615358471870422, "learning_rate": 6.177933684263524e-06, "loss": 0.7352, "mean_token_accuracy": 0.7689472794532776, "num_tokens": 16783610.0, "step": 1000 }, { "entropy": 1.0969498217105866, "epoch": 6.4352, "grad_norm": 0.9383291602134705, "learning_rate": 5.988020733338767e-06, "loss": 0.705, "mean_token_accuracy": 0.772877112030983, "num_tokens": 16951601.0, "step": 1010 }, { "entropy": 1.1219998925924302, "epoch": 6.4992, "grad_norm": 0.9278421998023987, "learning_rate": 5.7998170643416795e-06, "loss": 0.7366, "mean_token_accuracy": 0.7668613627552986, "num_tokens": 17118402.0, "step": 1020 }, { "entropy": 1.1189097076654435, "epoch": 6.5632, "grad_norm": 0.8941367268562317, "learning_rate": 5.613402860420962e-06, "loss": 0.7423, "mean_token_accuracy": 0.7693732514977455, "num_tokens": 17285077.0, "step": 1030 }, { "entropy": 1.1192366987466813, "epoch": 6.6272, "grad_norm": 0.9321838617324829, "learning_rate": 5.428857542333465e-06, "loss": 0.7383, "mean_token_accuracy": 0.766059798002243, "num_tokens": 17454468.0, "step": 1040 }, { "entropy": 1.1280045241117478, "epoch": 6.6912, "grad_norm": 0.9867642521858215, "learning_rate": 5.246259734607411e-06, "loss": 0.7452, "mean_token_accuracy": 0.7636990651488305, "num_tokens": 17622278.0, "step": 1050 }, { "entropy": 1.1145729750394822, "epoch": 6.7552, "grad_norm": 1.00631844997406, "learning_rate": 5.065687232044811e-06, "loss": 0.731, "mean_token_accuracy": 0.7677978798747063, "num_tokens": 17791512.0, "step": 1060 }, { "entropy": 1.1203809767961501, "epoch": 6.8192, "grad_norm": 0.9962554574012756, "learning_rate": 4.887216966577458e-06, "loss": 0.742, "mean_token_accuracy": 0.7627907797694207, "num_tokens": 17960407.0, "step": 1070 }, { "entropy": 1.1107396587729454, "epoch": 6.8832, "grad_norm": 0.9973596930503845, "learning_rate": 4.710924974490463e-06, "loss": 0.7249, "mean_token_accuracy": 0.7697675704956055, "num_tokens": 18125304.0, "step": 1080 }, { "entropy": 1.12523413002491, "epoch": 6.9472000000000005, "grad_norm": 0.9931960105895996, "learning_rate": 4.536886364027428e-06, "loss": 0.7455, "mean_token_accuracy": 0.763170848786831, "num_tokens": 18294233.0, "step": 1090 }, { "entropy": 1.1127794884346627, "epoch": 7.0064, "grad_norm": 0.8755695223808289, "learning_rate": 4.365175283390968e-06, "loss": 0.7232, "mean_token_accuracy": 0.7706596577489698, "num_tokens": 18452285.0, "step": 1100 }, { "entropy": 1.0963766992092132, "epoch": 7.0704, "grad_norm": 1.0143297910690308, "learning_rate": 4.195864889152295e-06, "loss": 0.7005, "mean_token_accuracy": 0.7757644459605217, "num_tokens": 18620732.0, "step": 1110 }, { "entropy": 1.0792216598987578, "epoch": 7.1344, "grad_norm": 1.0209460258483887, "learning_rate": 4.029027315083251e-06, "loss": 0.6906, "mean_token_accuracy": 0.7794409260153771, "num_tokens": 18787944.0, "step": 1120 }, { "entropy": 1.102518378198147, "epoch": 7.1984, "grad_norm": 1.0153676271438599, "learning_rate": 3.864733641424093e-06, "loss": 0.7044, "mean_token_accuracy": 0.774037578701973, "num_tokens": 18951875.0, "step": 1130 }, { "entropy": 1.1013861119747161, "epoch": 7.2624, "grad_norm": 1.0647627115249634, "learning_rate": 3.703053864600169e-06, "loss": 0.7215, "mean_token_accuracy": 0.7702529579401016, "num_tokens": 19121454.0, "step": 1140 }, { "entropy": 1.089624047279358, "epoch": 7.3264, "grad_norm": 1.0077697038650513, "learning_rate": 3.544056867400306e-06, "loss": 0.7079, "mean_token_accuracy": 0.7726217702031135, "num_tokens": 19290430.0, "step": 1150 }, { "entropy": 1.1091026380658149, "epoch": 7.3904, "grad_norm": 1.0901305675506592, "learning_rate": 3.3878103896296677e-06, "loss": 0.7233, "mean_token_accuracy": 0.7718619227409362, "num_tokens": 19458849.0, "step": 1160 }, { "entropy": 1.0947757676243781, "epoch": 7.4544, "grad_norm": 1.028538703918457, "learning_rate": 3.2343809992495945e-06, "loss": 0.7119, "mean_token_accuracy": 0.7740111395716667, "num_tokens": 19625293.0, "step": 1170 }, { "entropy": 1.10685034096241, "epoch": 7.5184, "grad_norm": 1.026236653327942, "learning_rate": 3.083834064016682e-06, "loss": 0.7273, "mean_token_accuracy": 0.7731231868267059, "num_tokens": 19794945.0, "step": 1180 }, { "entropy": 1.0935991361737252, "epoch": 7.5824, "grad_norm": 1.1131870746612549, "learning_rate": 2.9362337236331884e-06, "loss": 0.7074, "mean_token_accuracy": 0.7722717076539993, "num_tokens": 19963076.0, "step": 1190 }, { "entropy": 1.1043099403381347, "epoch": 7.6464, "grad_norm": 1.0670139789581299, "learning_rate": 2.791642862420686e-06, "loss": 0.7258, "mean_token_accuracy": 0.7688395619392395, "num_tokens": 20134923.0, "step": 1200 }, { "entropy": 1.102524772286415, "epoch": 7.7104, "grad_norm": 1.0460227727890015, "learning_rate": 2.6501230825285294e-06, "loss": 0.7122, "mean_token_accuracy": 0.7745070040225983, "num_tokens": 20301990.0, "step": 1210 }, { "entropy": 1.0997470021247864, "epoch": 7.7744, "grad_norm": 1.1005793809890747, "learning_rate": 2.5117346776885843e-06, "loss": 0.7343, "mean_token_accuracy": 0.7664325267076493, "num_tokens": 20470721.0, "step": 1220 }, { "entropy": 1.1047000914812088, "epoch": 7.8384, "grad_norm": 1.01988685131073, "learning_rate": 2.3765366075274287e-06, "loss": 0.7188, "mean_token_accuracy": 0.7712782993912697, "num_tokens": 20637672.0, "step": 1230 }, { "entropy": 1.1048908308148384, "epoch": 7.9024, "grad_norm": 1.042604684829712, "learning_rate": 2.2445864724469146e-06, "loss": 0.7214, "mean_token_accuracy": 0.7692830249667167, "num_tokens": 20809780.0, "step": 1240 }, { "entropy": 1.1015258342027665, "epoch": 7.9664, "grad_norm": 1.0530294179916382, "learning_rate": 2.1159404890838365e-06, "loss": 0.7174, "mean_token_accuracy": 0.7710513040423393, "num_tokens": 20977925.0, "step": 1250 }, { "entropy": 1.1052203758342847, "epoch": 8.0256, "grad_norm": 1.0588289499282837, "learning_rate": 1.990653466359125e-06, "loss": 0.7231, "mean_token_accuracy": 0.7697531097644085, "num_tokens": 21135709.0, "step": 1260 }, { "entropy": 1.0664937138557433, "epoch": 8.0896, "grad_norm": 1.1996620893478394, "learning_rate": 1.8687787821268255e-06, "loss": 0.6798, "mean_token_accuracy": 0.7811540484428405, "num_tokens": 21305580.0, "step": 1270 }, { "entropy": 1.0717683494091035, "epoch": 8.1536, "grad_norm": 1.1794630289077759, "learning_rate": 1.7503683604327426e-06, "loss": 0.6944, "mean_token_accuracy": 0.7757708877325058, "num_tokens": 21476026.0, "step": 1280 }, { "entropy": 1.0876216664910316, "epoch": 8.2176, "grad_norm": 1.0743852853775024, "learning_rate": 1.6354726493924745e-06, "loss": 0.7044, "mean_token_accuracy": 0.7734724819660187, "num_tokens": 21644729.0, "step": 1290 }, { "entropy": 1.0878884211182593, "epoch": 8.2816, "grad_norm": 1.1732165813446045, "learning_rate": 1.5241405996982928e-06, "loss": 0.7015, "mean_token_accuracy": 0.7772793591022491, "num_tokens": 21811332.0, "step": 1300 }, { "entropy": 1.080038744211197, "epoch": 8.3456, "grad_norm": 1.1939797401428223, "learning_rate": 1.4164196437639355e-06, "loss": 0.6929, "mean_token_accuracy": 0.7762296363711357, "num_tokens": 21976237.0, "step": 1310 }, { "entropy": 1.0742896348237991, "epoch": 8.4096, "grad_norm": 1.1042524576187134, "learning_rate": 1.3123556755163114e-06, "loss": 0.6917, "mean_token_accuracy": 0.7782910659909248, "num_tokens": 22145608.0, "step": 1320 }, { "entropy": 1.077732390165329, "epoch": 8.4736, "grad_norm": 1.0329608917236328, "learning_rate": 1.2119930308426264e-06, "loss": 0.6967, "mean_token_accuracy": 0.7769305527210235, "num_tokens": 22313707.0, "step": 1330 }, { "entropy": 1.103071777522564, "epoch": 8.5376, "grad_norm": 1.110071063041687, "learning_rate": 1.1153744687013313e-06, "loss": 0.7219, "mean_token_accuracy": 0.7715903207659721, "num_tokens": 22481770.0, "step": 1340 }, { "entropy": 1.099236251413822, "epoch": 8.6016, "grad_norm": 0.999956488609314, "learning_rate": 1.0225411529048857e-06, "loss": 0.7184, "mean_token_accuracy": 0.7770519211888314, "num_tokens": 22649599.0, "step": 1350 }, { "entropy": 1.0735243171453477, "epoch": 8.6656, "grad_norm": 1.0479539632797241, "learning_rate": 9.33532634582156e-07, "loss": 0.6895, "mean_token_accuracy": 0.7782353475689888, "num_tokens": 22818752.0, "step": 1360 }, { "entropy": 1.0788584634661675, "epoch": 8.7296, "grad_norm": 1.0581979751586914, "learning_rate": 8.483868353278657e-07, "loss": 0.7061, "mean_token_accuracy": 0.7732961744070053, "num_tokens": 22987614.0, "step": 1370 }, { "entropy": 1.1177189975976944, "epoch": 8.7936, "grad_norm": 1.100332498550415, "learning_rate": 7.671400310462984e-07, "loss": 0.7289, "mean_token_accuracy": 0.7704362392425537, "num_tokens": 23154417.0, "step": 1380 }, { "entropy": 1.0906570345163344, "epoch": 8.8576, "grad_norm": 1.1676188707351685, "learning_rate": 6.898268364961591e-07, "loss": 0.7094, "mean_token_accuracy": 0.7727909624576569, "num_tokens": 23322493.0, "step": 1390 }, { "entropy": 1.0766915142536164, "epoch": 8.9216, "grad_norm": 1.0389209985733032, "learning_rate": 6.164801905431394e-07, "loss": 0.7106, "mean_token_accuracy": 0.7720396503806114, "num_tokens": 23498552.0, "step": 1400 }, { "entropy": 1.0853375509381293, "epoch": 8.9856, "grad_norm": 1.101219892501831, "learning_rate": 5.471313421264879e-07, "loss": 0.6867, "mean_token_accuracy": 0.7808714762330056, "num_tokens": 23663155.0, "step": 1410 }, { "entropy": 1.0748054787919328, "epoch": 9.0448, "grad_norm": 1.1024824380874634, "learning_rate": 4.818098369455793e-07, "loss": 0.6784, "mean_token_accuracy": 0.7802738080153594, "num_tokens": 23817642.0, "step": 1420 }, { "entropy": 1.0809885799884795, "epoch": 9.1088, "grad_norm": 1.0660940408706665, "learning_rate": 4.20543504872124e-07, "loss": 0.6928, "mean_token_accuracy": 0.7785634055733681, "num_tokens": 23986616.0, "step": 1430 }, { "entropy": 1.0696254506707192, "epoch": 9.1728, "grad_norm": 1.098575472831726, "learning_rate": 3.633584480934016e-07, "loss": 0.6848, "mean_token_accuracy": 0.7822138294577599, "num_tokens": 24153973.0, "step": 1440 }, { "entropy": 1.0600635647773742, "epoch": 9.2368, "grad_norm": 1.1507972478866577, "learning_rate": 3.1027902999157146e-07, "loss": 0.67, "mean_token_accuracy": 0.7815300151705742, "num_tokens": 24321980.0, "step": 1450 }, { "entropy": 1.0735993713140488, "epoch": 9.3008, "grad_norm": 1.1208281517028809, "learning_rate": 2.61327864763784e-07, "loss": 0.691, "mean_token_accuracy": 0.7773459628224373, "num_tokens": 24491957.0, "step": 1460 }, { "entropy": 1.0888471096754073, "epoch": 9.3648, "grad_norm": 1.0866674184799194, "learning_rate": 2.1652580778751875e-07, "loss": 0.7091, "mean_token_accuracy": 0.7754179865121842, "num_tokens": 24658306.0, "step": 1470 }, { "entropy": 1.0891848027706146, "epoch": 9.4288, "grad_norm": 1.111118197441101, "learning_rate": 1.758919467352771e-07, "loss": 0.6999, "mean_token_accuracy": 0.7776159614324569, "num_tokens": 24821950.0, "step": 1480 }, { "entropy": 1.068458940088749, "epoch": 9.4928, "grad_norm": 1.1345736980438232, "learning_rate": 1.3944359344237214e-07, "loss": 0.6819, "mean_token_accuracy": 0.7809593558311463, "num_tokens": 24991570.0, "step": 1490 }, { "entropy": 1.0842776700854302, "epoch": 9.556799999999999, "grad_norm": 1.0693023204803467, "learning_rate": 1.0719627653131948e-07, "loss": 0.7059, "mean_token_accuracy": 0.7756290450692177, "num_tokens": 25160961.0, "step": 1500 }, { "entropy": 1.0747777849435807, "epoch": 9.6208, "grad_norm": 1.1459989547729492, "learning_rate": 7.916373479595507e-08, "loss": 0.6964, "mean_token_accuracy": 0.7755286246538162, "num_tokens": 25330836.0, "step": 1510 }, { "entropy": 1.0941903442144394, "epoch": 9.6848, "grad_norm": 1.103893518447876, "learning_rate": 5.535791134809176e-08, "loss": 0.7116, "mean_token_accuracy": 0.7722656220197678, "num_tokens": 25499639.0, "step": 1520 }, { "entropy": 1.0937790602445603, "epoch": 9.7488, "grad_norm": 1.2139781713485718, "learning_rate": 3.57889485292251e-08, "loss": 0.7092, "mean_token_accuracy": 0.7771677598357201, "num_tokens": 25666081.0, "step": 1530 }, { "entropy": 1.0790585070848464, "epoch": 9.8128, "grad_norm": 1.0998142957687378, "learning_rate": 2.046518358944094e-08, "loss": 0.7061, "mean_token_accuracy": 0.7749298721551895, "num_tokens": 25836012.0, "step": 1540 }, { "entropy": 1.087978368997574, "epoch": 9.8768, "grad_norm": 1.1979362964630127, "learning_rate": 9.393145135377924e-09, "loss": 0.7221, "mean_token_accuracy": 0.7720273390412331, "num_tokens": 26007577.0, "step": 1550 }, { "entropy": 1.077130888402462, "epoch": 9.9408, "grad_norm": 0.9926674962043762, "learning_rate": 2.5775503487501795e-09, "loss": 0.6815, "mean_token_accuracy": 0.7797598227858543, "num_tokens": 26176310.0, "step": 1560 }, { "entropy": 1.0749925036688108, "epoch": 10.0, "grad_norm": 2.0213756561279297, "learning_rate": 2.1302976616066616e-11, "loss": 0.6932, "mean_token_accuracy": 0.7767725538563084, "num_tokens": 26334470.0, "step": 1570 } ], "logging_steps": 10, "max_steps": 1570, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.184067262525866e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }