{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 198, "global_step": 1980, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010108668182966893, "grad_norm": 0.4873044788837433, "learning_rate": 0.0, "loss": 0.9551, "num_input_tokens_seen": 1998, "step": 1, "train_runtime": 4.5289, "train_tokens_per_second": 441.167 }, { "epoch": 0.0020217336365933787, "grad_norm": 0.4253540635108948, "learning_rate": 4e-05, "loss": 0.8258, "num_input_tokens_seen": 4262, "step": 2, "train_runtime": 6.4124, "train_tokens_per_second": 664.645 }, { "epoch": 0.003032600454890068, "grad_norm": 0.522351861000061, "learning_rate": 8e-05, "loss": 0.9482, "num_input_tokens_seen": 6200, "step": 3, "train_runtime": 8.1846, "train_tokens_per_second": 757.523 }, { "epoch": 0.004043467273186757, "grad_norm": 0.5153616666793823, "learning_rate": 0.00012, "loss": 0.8615, "num_input_tokens_seen": 8052, "step": 4, "train_runtime": 9.7901, "train_tokens_per_second": 822.461 }, { "epoch": 0.005054334091483447, "grad_norm": 0.7847296595573425, "learning_rate": 0.00016, "loss": 1.0249, "num_input_tokens_seen": 9692, "step": 5, "train_runtime": 11.4662, "train_tokens_per_second": 845.267 }, { "epoch": 0.006065200909780136, "grad_norm": 0.48074302077293396, "learning_rate": 0.0002, "loss": 0.7242, "num_input_tokens_seen": 11676, "step": 6, "train_runtime": 13.3663, "train_tokens_per_second": 873.539 }, { "epoch": 0.0070760677280768255, "grad_norm": 0.5613217353820801, "learning_rate": 0.0001998987341772152, "loss": 0.5166, "num_input_tokens_seen": 13238, "step": 7, "train_runtime": 14.9884, "train_tokens_per_second": 883.217 }, { "epoch": 0.008086934546373515, "grad_norm": 0.3947386145591736, "learning_rate": 0.0001997974683544304, "loss": 0.3962, "num_input_tokens_seen": 15272, "step": 8, "train_runtime": 16.7975, "train_tokens_per_second": 909.182 }, { "epoch": 0.009097801364670205, "grad_norm": 0.4128956198692322, "learning_rate": 0.00019969620253164558, "loss": 0.3897, "num_input_tokens_seen": 17090, "step": 9, "train_runtime": 18.5089, "train_tokens_per_second": 923.342 }, { "epoch": 0.010108668182966895, "grad_norm": 0.4657420217990875, "learning_rate": 0.00019959493670886075, "loss": 0.4569, "num_input_tokens_seen": 19018, "step": 10, "train_runtime": 20.1885, "train_tokens_per_second": 942.02 }, { "epoch": 0.011119535001263583, "grad_norm": 0.4372606873512268, "learning_rate": 0.00019949367088607596, "loss": 0.3667, "num_input_tokens_seen": 21072, "step": 11, "train_runtime": 21.9933, "train_tokens_per_second": 958.11 }, { "epoch": 0.012130401819560273, "grad_norm": 0.29161205887794495, "learning_rate": 0.00019939240506329115, "loss": 0.3203, "num_input_tokens_seen": 23612, "step": 12, "train_runtime": 24.0274, "train_tokens_per_second": 982.712 }, { "epoch": 0.013141268637856963, "grad_norm": 0.4845719039440155, "learning_rate": 0.00019929113924050632, "loss": 0.4122, "num_input_tokens_seen": 24886, "step": 13, "train_runtime": 25.5607, "train_tokens_per_second": 973.603 }, { "epoch": 0.014152135456153651, "grad_norm": 0.39806467294692993, "learning_rate": 0.00019918987341772154, "loss": 0.2891, "num_input_tokens_seen": 26718, "step": 14, "train_runtime": 27.2874, "train_tokens_per_second": 979.134 }, { "epoch": 0.015163002274450341, "grad_norm": 0.3543863296508789, "learning_rate": 0.00019908860759493673, "loss": 0.4272, "num_input_tokens_seen": 28968, "step": 15, "train_runtime": 29.2312, "train_tokens_per_second": 990.997 }, { "epoch": 0.01617386909274703, "grad_norm": 0.33626294136047363, "learning_rate": 0.0001989873417721519, "loss": 0.2618, "num_input_tokens_seen": 30542, "step": 16, "train_runtime": 30.8899, "train_tokens_per_second": 988.737 }, { "epoch": 0.01718473591104372, "grad_norm": 0.30460983514785767, "learning_rate": 0.0001988860759493671, "loss": 0.2975, "num_input_tokens_seen": 32276, "step": 17, "train_runtime": 32.5496, "train_tokens_per_second": 991.595 }, { "epoch": 0.01819560272934041, "grad_norm": 0.31722599267959595, "learning_rate": 0.00019878481012658227, "loss": 0.2809, "num_input_tokens_seen": 33716, "step": 18, "train_runtime": 34.1265, "train_tokens_per_second": 987.973 }, { "epoch": 0.0192064695476371, "grad_norm": 0.35153570771217346, "learning_rate": 0.00019868354430379746, "loss": 0.3387, "num_input_tokens_seen": 35506, "step": 19, "train_runtime": 35.7353, "train_tokens_per_second": 993.583 }, { "epoch": 0.02021733636593379, "grad_norm": 0.3597993552684784, "learning_rate": 0.00019858227848101268, "loss": 0.2891, "num_input_tokens_seen": 37408, "step": 20, "train_runtime": 37.4995, "train_tokens_per_second": 997.561 }, { "epoch": 0.02122820318423048, "grad_norm": 0.40770795941352844, "learning_rate": 0.00019848101265822785, "loss": 0.3535, "num_input_tokens_seen": 39344, "step": 21, "train_runtime": 39.1813, "train_tokens_per_second": 1004.154 }, { "epoch": 0.022239070002527166, "grad_norm": 0.29805222153663635, "learning_rate": 0.00019837974683544304, "loss": 0.3261, "num_input_tokens_seen": 41504, "step": 22, "train_runtime": 41.0211, "train_tokens_per_second": 1011.771 }, { "epoch": 0.023249936820823856, "grad_norm": 0.33333706855773926, "learning_rate": 0.00019827848101265825, "loss": 0.2981, "num_input_tokens_seen": 43398, "step": 23, "train_runtime": 42.7634, "train_tokens_per_second": 1014.841 }, { "epoch": 0.024260803639120546, "grad_norm": 0.3034307360649109, "learning_rate": 0.00019817721518987342, "loss": 0.2549, "num_input_tokens_seen": 45312, "step": 24, "train_runtime": 44.5424, "train_tokens_per_second": 1017.277 }, { "epoch": 0.025271670457417236, "grad_norm": 0.33897197246551514, "learning_rate": 0.0001980759493670886, "loss": 0.268, "num_input_tokens_seen": 46780, "step": 25, "train_runtime": 46.1397, "train_tokens_per_second": 1013.878 }, { "epoch": 0.026282537275713926, "grad_norm": 0.3111315667629242, "learning_rate": 0.0001979746835443038, "loss": 0.2719, "num_input_tokens_seen": 48436, "step": 26, "train_runtime": 47.8076, "train_tokens_per_second": 1013.145 }, { "epoch": 0.027293404094010616, "grad_norm": 0.3690702021121979, "learning_rate": 0.000197873417721519, "loss": 0.3425, "num_input_tokens_seen": 50246, "step": 27, "train_runtime": 49.4904, "train_tokens_per_second": 1015.268 }, { "epoch": 0.028304270912307302, "grad_norm": 0.29139432311058044, "learning_rate": 0.00019777215189873418, "loss": 0.2403, "num_input_tokens_seen": 52080, "step": 28, "train_runtime": 51.2374, "train_tokens_per_second": 1016.446 }, { "epoch": 0.029315137730603992, "grad_norm": 0.3654118776321411, "learning_rate": 0.00019767088607594937, "loss": 0.3419, "num_input_tokens_seen": 53724, "step": 29, "train_runtime": 52.9181, "train_tokens_per_second": 1015.23 }, { "epoch": 0.030326004548900682, "grad_norm": 0.3280225098133087, "learning_rate": 0.00019756962025316456, "loss": 0.2571, "num_input_tokens_seen": 55372, "step": 30, "train_runtime": 54.5194, "train_tokens_per_second": 1015.638 }, { "epoch": 0.03133687136719737, "grad_norm": 0.27247095108032227, "learning_rate": 0.00019746835443037975, "loss": 0.2048, "num_input_tokens_seen": 57012, "step": 31, "train_runtime": 58.5787, "train_tokens_per_second": 973.254 }, { "epoch": 0.03234773818549406, "grad_norm": 0.24623878300189972, "learning_rate": 0.00019736708860759494, "loss": 0.2631, "num_input_tokens_seen": 59328, "step": 32, "train_runtime": 60.5506, "train_tokens_per_second": 979.808 }, { "epoch": 0.03335860500379075, "grad_norm": 0.40265941619873047, "learning_rate": 0.00019726582278481014, "loss": 0.2294, "num_input_tokens_seen": 60640, "step": 33, "train_runtime": 62.0709, "train_tokens_per_second": 976.947 }, { "epoch": 0.03436947182208744, "grad_norm": 0.2988276779651642, "learning_rate": 0.00019716455696202533, "loss": 0.2675, "num_input_tokens_seen": 62976, "step": 34, "train_runtime": 63.956, "train_tokens_per_second": 984.678 }, { "epoch": 0.03538033864038413, "grad_norm": 0.37253138422966003, "learning_rate": 0.00019706329113924052, "loss": 0.2998, "num_input_tokens_seen": 64994, "step": 35, "train_runtime": 65.7974, "train_tokens_per_second": 987.79 }, { "epoch": 0.03639120545868082, "grad_norm": 0.37015262246131897, "learning_rate": 0.0001969620253164557, "loss": 0.2078, "num_input_tokens_seen": 66600, "step": 36, "train_runtime": 67.3916, "train_tokens_per_second": 988.254 }, { "epoch": 0.037402072276977505, "grad_norm": 0.34977278113365173, "learning_rate": 0.0001968607594936709, "loss": 0.3089, "num_input_tokens_seen": 68622, "step": 37, "train_runtime": 69.1144, "train_tokens_per_second": 992.875 }, { "epoch": 0.0384129390952742, "grad_norm": 0.3342492878437042, "learning_rate": 0.0001967594936708861, "loss": 0.3135, "num_input_tokens_seen": 70364, "step": 38, "train_runtime": 70.8181, "train_tokens_per_second": 993.587 }, { "epoch": 0.039423805913570885, "grad_norm": 0.34639793634414673, "learning_rate": 0.00019665822784810128, "loss": 0.2722, "num_input_tokens_seen": 72130, "step": 39, "train_runtime": 72.4387, "train_tokens_per_second": 995.739 }, { "epoch": 0.04043467273186758, "grad_norm": 0.30288997292518616, "learning_rate": 0.00019655696202531647, "loss": 0.1647, "num_input_tokens_seen": 74042, "step": 40, "train_runtime": 74.266, "train_tokens_per_second": 996.983 }, { "epoch": 0.041445539550164265, "grad_norm": 0.34732452034950256, "learning_rate": 0.00019645569620253166, "loss": 0.2737, "num_input_tokens_seen": 76178, "step": 41, "train_runtime": 76.6877, "train_tokens_per_second": 993.354 }, { "epoch": 0.04245640636846096, "grad_norm": 0.3373444378376007, "learning_rate": 0.00019635443037974683, "loss": 0.1763, "num_input_tokens_seen": 77916, "step": 42, "train_runtime": 78.3588, "train_tokens_per_second": 994.349 }, { "epoch": 0.043467273186757645, "grad_norm": 0.29695427417755127, "learning_rate": 0.00019625316455696204, "loss": 0.2235, "num_input_tokens_seen": 79524, "step": 43, "train_runtime": 79.9569, "train_tokens_per_second": 994.586 }, { "epoch": 0.04447814000505433, "grad_norm": 0.30779194831848145, "learning_rate": 0.00019615189873417723, "loss": 0.2355, "num_input_tokens_seen": 81330, "step": 44, "train_runtime": 81.7036, "train_tokens_per_second": 995.427 }, { "epoch": 0.045489006823351025, "grad_norm": 0.3187408745288849, "learning_rate": 0.0001960506329113924, "loss": 0.3051, "num_input_tokens_seen": 83266, "step": 45, "train_runtime": 83.404, "train_tokens_per_second": 998.345 }, { "epoch": 0.04649987364164771, "grad_norm": 0.31425026059150696, "learning_rate": 0.00019594936708860762, "loss": 0.2152, "num_input_tokens_seen": 85536, "step": 46, "train_runtime": 85.3767, "train_tokens_per_second": 1001.866 }, { "epoch": 0.047510740459944405, "grad_norm": 0.3499682545661926, "learning_rate": 0.0001958481012658228, "loss": 0.2051, "num_input_tokens_seen": 87530, "step": 47, "train_runtime": 87.1458, "train_tokens_per_second": 1004.409 }, { "epoch": 0.04852160727824109, "grad_norm": 0.29931217432022095, "learning_rate": 0.00019574683544303797, "loss": 0.2634, "num_input_tokens_seen": 89404, "step": 48, "train_runtime": 88.8415, "train_tokens_per_second": 1006.332 }, { "epoch": 0.04953247409653778, "grad_norm": 0.31406113505363464, "learning_rate": 0.0001956455696202532, "loss": 0.2824, "num_input_tokens_seen": 91598, "step": 49, "train_runtime": 90.6844, "train_tokens_per_second": 1010.074 }, { "epoch": 0.05054334091483447, "grad_norm": 0.2785133719444275, "learning_rate": 0.00019554430379746835, "loss": 0.2575, "num_input_tokens_seen": 93776, "step": 50, "train_runtime": 92.5267, "train_tokens_per_second": 1013.502 }, { "epoch": 0.05155420773313116, "grad_norm": 0.31789687275886536, "learning_rate": 0.00019544303797468354, "loss": 0.1854, "num_input_tokens_seen": 95578, "step": 51, "train_runtime": 94.2097, "train_tokens_per_second": 1014.524 }, { "epoch": 0.05256507455142785, "grad_norm": 0.3141697645187378, "learning_rate": 0.00019534177215189876, "loss": 0.1852, "num_input_tokens_seen": 97450, "step": 52, "train_runtime": 96.012, "train_tokens_per_second": 1014.977 }, { "epoch": 0.05357594136972454, "grad_norm": 0.3136524558067322, "learning_rate": 0.00019524050632911392, "loss": 0.2625, "num_input_tokens_seen": 99408, "step": 53, "train_runtime": 97.7861, "train_tokens_per_second": 1016.587 }, { "epoch": 0.05458680818802123, "grad_norm": 0.3242315351963043, "learning_rate": 0.00019513924050632912, "loss": 0.1751, "num_input_tokens_seen": 100788, "step": 54, "train_runtime": 99.346, "train_tokens_per_second": 1014.515 }, { "epoch": 0.05559767500631792, "grad_norm": 0.36038273572921753, "learning_rate": 0.00019503797468354433, "loss": 0.2772, "num_input_tokens_seen": 102596, "step": 55, "train_runtime": 101.0294, "train_tokens_per_second": 1015.506 }, { "epoch": 0.056608541824614604, "grad_norm": 0.35775113105773926, "learning_rate": 0.0001949367088607595, "loss": 0.3227, "num_input_tokens_seen": 104604, "step": 56, "train_runtime": 102.7993, "train_tokens_per_second": 1017.555 }, { "epoch": 0.0576194086429113, "grad_norm": 0.3312723934650421, "learning_rate": 0.0001948354430379747, "loss": 0.3182, "num_input_tokens_seen": 106376, "step": 57, "train_runtime": 104.4071, "train_tokens_per_second": 1018.858 }, { "epoch": 0.058630275461207984, "grad_norm": 0.22781355679035187, "learning_rate": 0.00019473417721518988, "loss": 0.1965, "num_input_tokens_seen": 108598, "step": 58, "train_runtime": 106.315, "train_tokens_per_second": 1021.474 }, { "epoch": 0.05964114227950468, "grad_norm": 0.38329920172691345, "learning_rate": 0.00019463291139240507, "loss": 0.2272, "num_input_tokens_seen": 110334, "step": 59, "train_runtime": 107.9998, "train_tokens_per_second": 1021.613 }, { "epoch": 0.060652009097801364, "grad_norm": 0.42992767691612244, "learning_rate": 0.00019453164556962026, "loss": 0.1986, "num_input_tokens_seen": 111732, "step": 60, "train_runtime": 109.564, "train_tokens_per_second": 1019.788 }, { "epoch": 0.06166287591609806, "grad_norm": 0.32373154163360596, "learning_rate": 0.00019443037974683545, "loss": 0.2735, "num_input_tokens_seen": 114016, "step": 61, "train_runtime": 113.7251, "train_tokens_per_second": 1002.558 }, { "epoch": 0.06267374273439474, "grad_norm": 0.34583255648612976, "learning_rate": 0.00019432911392405064, "loss": 0.2463, "num_input_tokens_seen": 115918, "step": 62, "train_runtime": 115.4902, "train_tokens_per_second": 1003.705 }, { "epoch": 0.06368460955269144, "grad_norm": 0.3125549852848053, "learning_rate": 0.00019422784810126583, "loss": 0.2226, "num_input_tokens_seen": 118102, "step": 63, "train_runtime": 117.3214, "train_tokens_per_second": 1006.653 }, { "epoch": 0.06469547637098812, "grad_norm": 0.29421722888946533, "learning_rate": 0.00019412658227848102, "loss": 0.1892, "num_input_tokens_seen": 120104, "step": 64, "train_runtime": 119.144, "train_tokens_per_second": 1008.057 }, { "epoch": 0.06570634318928481, "grad_norm": 0.41534146666526794, "learning_rate": 0.00019402531645569622, "loss": 0.2665, "num_input_tokens_seen": 121812, "step": 65, "train_runtime": 120.8223, "train_tokens_per_second": 1008.191 }, { "epoch": 0.0667172100075815, "grad_norm": 0.35454341769218445, "learning_rate": 0.00019392405063291138, "loss": 0.2388, "num_input_tokens_seen": 124036, "step": 66, "train_runtime": 122.7939, "train_tokens_per_second": 1010.115 }, { "epoch": 0.0677280768258782, "grad_norm": 0.31525930762290955, "learning_rate": 0.0001938227848101266, "loss": 0.221, "num_input_tokens_seen": 126360, "step": 67, "train_runtime": 124.7271, "train_tokens_per_second": 1013.091 }, { "epoch": 0.06873894364417488, "grad_norm": 0.3576384484767914, "learning_rate": 0.0001937215189873418, "loss": 0.2088, "num_input_tokens_seen": 128576, "step": 68, "train_runtime": 126.5829, "train_tokens_per_second": 1015.746 }, { "epoch": 0.06974981046247157, "grad_norm": 0.3103581368923187, "learning_rate": 0.00019362025316455695, "loss": 0.3964, "num_input_tokens_seen": 130716, "step": 69, "train_runtime": 128.4967, "train_tokens_per_second": 1017.271 }, { "epoch": 0.07076067728076826, "grad_norm": 0.3163643479347229, "learning_rate": 0.00019351898734177217, "loss": 0.3141, "num_input_tokens_seen": 132542, "step": 70, "train_runtime": 130.1847, "train_tokens_per_second": 1018.108 }, { "epoch": 0.07177154409906494, "grad_norm": 0.3137971758842468, "learning_rate": 0.00019341772151898736, "loss": 0.2044, "num_input_tokens_seen": 134086, "step": 71, "train_runtime": 131.8034, "train_tokens_per_second": 1017.319 }, { "epoch": 0.07278241091736164, "grad_norm": 0.29651039838790894, "learning_rate": 0.00019331645569620252, "loss": 0.157, "num_input_tokens_seen": 135710, "step": 72, "train_runtime": 133.4291, "train_tokens_per_second": 1017.095 }, { "epoch": 0.07379327773565833, "grad_norm": 0.29748690128326416, "learning_rate": 0.00019321518987341774, "loss": 0.2198, "num_input_tokens_seen": 137462, "step": 73, "train_runtime": 135.1885, "train_tokens_per_second": 1016.817 }, { "epoch": 0.07480414455395501, "grad_norm": 0.2688922584056854, "learning_rate": 0.0001931139240506329, "loss": 0.2184, "num_input_tokens_seen": 139066, "step": 74, "train_runtime": 136.793, "train_tokens_per_second": 1016.617 }, { "epoch": 0.0758150113722517, "grad_norm": 0.23618099093437195, "learning_rate": 0.0001930126582278481, "loss": 0.1644, "num_input_tokens_seen": 140966, "step": 75, "train_runtime": 138.4966, "train_tokens_per_second": 1017.83 }, { "epoch": 0.0768258781905484, "grad_norm": 0.2990943193435669, "learning_rate": 0.00019291139240506331, "loss": 0.2145, "num_input_tokens_seen": 142822, "step": 76, "train_runtime": 140.2559, "train_tokens_per_second": 1018.296 }, { "epoch": 0.07783674500884509, "grad_norm": 0.26312482357025146, "learning_rate": 0.00019281012658227848, "loss": 0.3069, "num_input_tokens_seen": 145096, "step": 77, "train_runtime": 142.2699, "train_tokens_per_second": 1019.864 }, { "epoch": 0.07884761182714177, "grad_norm": 0.26823654770851135, "learning_rate": 0.00019270886075949367, "loss": 0.1723, "num_input_tokens_seen": 147358, "step": 78, "train_runtime": 144.1752, "train_tokens_per_second": 1022.076 }, { "epoch": 0.07985847864543846, "grad_norm": 0.3408774435520172, "learning_rate": 0.0001926075949367089, "loss": 0.2358, "num_input_tokens_seen": 148978, "step": 79, "train_runtime": 145.7997, "train_tokens_per_second": 1021.799 }, { "epoch": 0.08086934546373516, "grad_norm": 0.4547388553619385, "learning_rate": 0.00019250632911392405, "loss": 0.2754, "num_input_tokens_seen": 150736, "step": 80, "train_runtime": 147.5363, "train_tokens_per_second": 1021.688 }, { "epoch": 0.08188021228203184, "grad_norm": 0.40629148483276367, "learning_rate": 0.00019240506329113924, "loss": 0.274, "num_input_tokens_seen": 152112, "step": 81, "train_runtime": 149.0717, "train_tokens_per_second": 1020.395 }, { "epoch": 0.08289107910032853, "grad_norm": 0.39234459400177, "learning_rate": 0.00019230379746835443, "loss": 0.2205, "num_input_tokens_seen": 154138, "step": 82, "train_runtime": 150.8524, "train_tokens_per_second": 1021.78 }, { "epoch": 0.08390194591862522, "grad_norm": 0.3805030584335327, "learning_rate": 0.00019220253164556962, "loss": 0.2239, "num_input_tokens_seen": 155784, "step": 83, "train_runtime": 152.511, "train_tokens_per_second": 1021.461 }, { "epoch": 0.08491281273692192, "grad_norm": 0.3097169101238251, "learning_rate": 0.00019210126582278481, "loss": 0.1396, "num_input_tokens_seen": 157204, "step": 84, "train_runtime": 154.0995, "train_tokens_per_second": 1020.146 }, { "epoch": 0.0859236795552186, "grad_norm": 0.44679346680641174, "learning_rate": 0.000192, "loss": 0.2751, "num_input_tokens_seen": 158824, "step": 85, "train_runtime": 155.7905, "train_tokens_per_second": 1019.472 }, { "epoch": 0.08693454637351529, "grad_norm": 0.4235474765300751, "learning_rate": 0.0001918987341772152, "loss": 0.2625, "num_input_tokens_seen": 160912, "step": 86, "train_runtime": 157.6529, "train_tokens_per_second": 1020.673 }, { "epoch": 0.08794541319181198, "grad_norm": 0.35191550850868225, "learning_rate": 0.0001917974683544304, "loss": 0.2039, "num_input_tokens_seen": 163074, "step": 87, "train_runtime": 159.4907, "train_tokens_per_second": 1022.467 }, { "epoch": 0.08895628001010866, "grad_norm": 0.4148600399494171, "learning_rate": 0.00019169620253164558, "loss": 0.1857, "num_input_tokens_seen": 164552, "step": 88, "train_runtime": 161.097, "train_tokens_per_second": 1021.447 }, { "epoch": 0.08996714682840536, "grad_norm": 0.4624585211277008, "learning_rate": 0.00019159493670886077, "loss": 0.242, "num_input_tokens_seen": 166358, "step": 89, "train_runtime": 162.8719, "train_tokens_per_second": 1021.404 }, { "epoch": 0.09097801364670205, "grad_norm": 0.4638700783252716, "learning_rate": 0.00019149367088607596, "loss": 0.3036, "num_input_tokens_seen": 168030, "step": 90, "train_runtime": 164.5661, "train_tokens_per_second": 1021.048 }, { "epoch": 0.09198888046499874, "grad_norm": 0.321336030960083, "learning_rate": 0.00019139240506329115, "loss": 0.2824, "num_input_tokens_seen": 170032, "step": 91, "train_runtime": 168.3683, "train_tokens_per_second": 1009.881 }, { "epoch": 0.09299974728329542, "grad_norm": 0.39739641547203064, "learning_rate": 0.00019129113924050634, "loss": 0.2554, "num_input_tokens_seen": 171476, "step": 92, "train_runtime": 169.9782, "train_tokens_per_second": 1008.812 }, { "epoch": 0.09401061410159212, "grad_norm": 0.34846046566963196, "learning_rate": 0.00019118987341772153, "loss": 0.2037, "num_input_tokens_seen": 173370, "step": 93, "train_runtime": 171.6984, "train_tokens_per_second": 1009.736 }, { "epoch": 0.09502148091988881, "grad_norm": 0.3384343683719635, "learning_rate": 0.00019108860759493672, "loss": 0.1363, "num_input_tokens_seen": 175448, "step": 94, "train_runtime": 173.525, "train_tokens_per_second": 1011.082 }, { "epoch": 0.09603234773818549, "grad_norm": 0.3351871073246002, "learning_rate": 0.0001909873417721519, "loss": 0.1844, "num_input_tokens_seen": 177164, "step": 95, "train_runtime": 175.1545, "train_tokens_per_second": 1011.473 }, { "epoch": 0.09704321455648218, "grad_norm": 0.40943101048469543, "learning_rate": 0.0001908860759493671, "loss": 0.2371, "num_input_tokens_seen": 178574, "step": 96, "train_runtime": 176.7506, "train_tokens_per_second": 1010.316 }, { "epoch": 0.09805408137477888, "grad_norm": 0.34281614422798157, "learning_rate": 0.0001907848101265823, "loss": 0.2115, "num_input_tokens_seen": 180732, "step": 97, "train_runtime": 178.6029, "train_tokens_per_second": 1011.921 }, { "epoch": 0.09906494819307556, "grad_norm": 0.3453739285469055, "learning_rate": 0.00019068354430379746, "loss": 0.2594, "num_input_tokens_seen": 183094, "step": 98, "train_runtime": 180.6157, "train_tokens_per_second": 1013.722 }, { "epoch": 0.10007581501137225, "grad_norm": 0.3091121017932892, "learning_rate": 0.00019058227848101268, "loss": 0.292, "num_input_tokens_seen": 185286, "step": 99, "train_runtime": 182.5425, "train_tokens_per_second": 1015.029 }, { "epoch": 0.10108668182966894, "grad_norm": 0.3359338641166687, "learning_rate": 0.00019048101265822787, "loss": 0.2609, "num_input_tokens_seen": 186894, "step": 100, "train_runtime": 184.2232, "train_tokens_per_second": 1014.498 }, { "epoch": 0.10209754864796564, "grad_norm": 0.39591389894485474, "learning_rate": 0.00019037974683544303, "loss": 0.3126, "num_input_tokens_seen": 188862, "step": 101, "train_runtime": 186.0581, "train_tokens_per_second": 1015.07 }, { "epoch": 0.10310841546626232, "grad_norm": 0.2912481129169464, "learning_rate": 0.00019027848101265825, "loss": 0.3256, "num_input_tokens_seen": 190642, "step": 102, "train_runtime": 187.7639, "train_tokens_per_second": 1015.328 }, { "epoch": 0.10411928228455901, "grad_norm": 0.30756765604019165, "learning_rate": 0.00019017721518987344, "loss": 0.2803, "num_input_tokens_seen": 192360, "step": 103, "train_runtime": 189.5118, "train_tokens_per_second": 1015.029 }, { "epoch": 0.1051301491028557, "grad_norm": 0.2889096736907959, "learning_rate": 0.0001900759493670886, "loss": 0.2099, "num_input_tokens_seen": 194740, "step": 104, "train_runtime": 191.5138, "train_tokens_per_second": 1016.846 }, { "epoch": 0.10614101592115238, "grad_norm": 0.33699703216552734, "learning_rate": 0.00018997468354430382, "loss": 0.2379, "num_input_tokens_seen": 197156, "step": 105, "train_runtime": 193.5292, "train_tokens_per_second": 1018.74 }, { "epoch": 0.10715188273944908, "grad_norm": 0.42451784014701843, "learning_rate": 0.00018987341772151899, "loss": 0.2275, "num_input_tokens_seen": 198724, "step": 106, "train_runtime": 195.1297, "train_tokens_per_second": 1018.42 }, { "epoch": 0.10816274955774577, "grad_norm": 0.35566970705986023, "learning_rate": 0.00018977215189873418, "loss": 0.3391, "num_input_tokens_seen": 200392, "step": 107, "train_runtime": 196.7609, "train_tokens_per_second": 1018.454 }, { "epoch": 0.10917361637604246, "grad_norm": 0.30473417043685913, "learning_rate": 0.0001896708860759494, "loss": 0.332, "num_input_tokens_seen": 202462, "step": 108, "train_runtime": 198.6138, "train_tokens_per_second": 1019.376 }, { "epoch": 0.11018448319433914, "grad_norm": 0.451630175113678, "learning_rate": 0.00018956962025316456, "loss": 0.1844, "num_input_tokens_seen": 204072, "step": 109, "train_runtime": 200.2296, "train_tokens_per_second": 1019.19 }, { "epoch": 0.11119535001263584, "grad_norm": 0.43709272146224976, "learning_rate": 0.00018946835443037975, "loss": 0.3005, "num_input_tokens_seen": 205860, "step": 110, "train_runtime": 201.8833, "train_tokens_per_second": 1019.698 }, { "epoch": 0.11220621683093253, "grad_norm": 0.28327277302742004, "learning_rate": 0.00018936708860759497, "loss": 0.1795, "num_input_tokens_seen": 207538, "step": 111, "train_runtime": 203.5769, "train_tokens_per_second": 1019.458 }, { "epoch": 0.11321708364922921, "grad_norm": 0.5263530611991882, "learning_rate": 0.00018926582278481013, "loss": 0.2676, "num_input_tokens_seen": 209106, "step": 112, "train_runtime": 205.2913, "train_tokens_per_second": 1018.582 }, { "epoch": 0.1142279504675259, "grad_norm": 0.37919676303863525, "learning_rate": 0.00018916455696202532, "loss": 0.2701, "num_input_tokens_seen": 210810, "step": 113, "train_runtime": 206.9779, "train_tokens_per_second": 1018.514 }, { "epoch": 0.1152388172858226, "grad_norm": 0.45175403356552124, "learning_rate": 0.0001890632911392405, "loss": 0.2468, "num_input_tokens_seen": 212672, "step": 114, "train_runtime": 208.6858, "train_tokens_per_second": 1019.101 }, { "epoch": 0.11624968410411929, "grad_norm": 0.431393027305603, "learning_rate": 0.0001889620253164557, "loss": 0.2553, "num_input_tokens_seen": 214800, "step": 115, "train_runtime": 210.6283, "train_tokens_per_second": 1019.806 }, { "epoch": 0.11726055092241597, "grad_norm": 0.43366989493370056, "learning_rate": 0.0001888607594936709, "loss": 0.2309, "num_input_tokens_seen": 216784, "step": 116, "train_runtime": 212.4119, "train_tokens_per_second": 1020.583 }, { "epoch": 0.11827141774071266, "grad_norm": 0.48804113268852234, "learning_rate": 0.00018875949367088608, "loss": 0.2464, "num_input_tokens_seen": 218508, "step": 117, "train_runtime": 214.1126, "train_tokens_per_second": 1020.528 }, { "epoch": 0.11928228455900936, "grad_norm": 0.49241119623184204, "learning_rate": 0.00018865822784810128, "loss": 0.246, "num_input_tokens_seen": 220070, "step": 118, "train_runtime": 215.7771, "train_tokens_per_second": 1019.895 }, { "epoch": 0.12029315137730603, "grad_norm": 0.3341336250305176, "learning_rate": 0.00018855696202531647, "loss": 0.1921, "num_input_tokens_seen": 221972, "step": 119, "train_runtime": 217.5522, "train_tokens_per_second": 1020.316 }, { "epoch": 0.12130401819560273, "grad_norm": 0.37389177083969116, "learning_rate": 0.00018845569620253166, "loss": 0.1806, "num_input_tokens_seen": 223738, "step": 120, "train_runtime": 219.291, "train_tokens_per_second": 1020.279 }, { "epoch": 0.12231488501389942, "grad_norm": 0.3373318016529083, "learning_rate": 0.00018835443037974685, "loss": 0.146, "num_input_tokens_seen": 225128, "step": 121, "train_runtime": 223.1066, "train_tokens_per_second": 1009.06 }, { "epoch": 0.12332575183219611, "grad_norm": 0.3741705119609833, "learning_rate": 0.000188253164556962, "loss": 0.2245, "num_input_tokens_seen": 226914, "step": 122, "train_runtime": 224.8128, "train_tokens_per_second": 1009.346 }, { "epoch": 0.1243366186504928, "grad_norm": 0.35638299584388733, "learning_rate": 0.00018815189873417723, "loss": 0.1852, "num_input_tokens_seen": 228850, "step": 123, "train_runtime": 226.5813, "train_tokens_per_second": 1010.013 }, { "epoch": 0.1253474854687895, "grad_norm": 0.3549748957157135, "learning_rate": 0.00018805063291139242, "loss": 0.2209, "num_input_tokens_seen": 230448, "step": 124, "train_runtime": 228.1882, "train_tokens_per_second": 1009.903 }, { "epoch": 0.12635835228708617, "grad_norm": 0.425045371055603, "learning_rate": 0.00018794936708860758, "loss": 0.2184, "num_input_tokens_seen": 232126, "step": 125, "train_runtime": 229.8679, "train_tokens_per_second": 1009.824 }, { "epoch": 0.12736921910538287, "grad_norm": 0.3064917027950287, "learning_rate": 0.0001878481012658228, "loss": 0.2005, "num_input_tokens_seen": 234350, "step": 126, "train_runtime": 231.7397, "train_tokens_per_second": 1011.264 }, { "epoch": 0.12838008592367955, "grad_norm": 0.3639183044433594, "learning_rate": 0.000187746835443038, "loss": 0.3228, "num_input_tokens_seen": 236724, "step": 127, "train_runtime": 233.7157, "train_tokens_per_second": 1012.872 }, { "epoch": 0.12939095274197623, "grad_norm": 0.4401392638683319, "learning_rate": 0.00018764556962025316, "loss": 0.2403, "num_input_tokens_seen": 238836, "step": 128, "train_runtime": 235.6082, "train_tokens_per_second": 1013.7 }, { "epoch": 0.13040181956027294, "grad_norm": 0.40510451793670654, "learning_rate": 0.00018754430379746837, "loss": 0.2402, "num_input_tokens_seen": 240594, "step": 129, "train_runtime": 237.2283, "train_tokens_per_second": 1014.187 }, { "epoch": 0.13141268637856962, "grad_norm": 0.4582486152648926, "learning_rate": 0.00018744303797468354, "loss": 0.27, "num_input_tokens_seen": 242398, "step": 130, "train_runtime": 238.8715, "train_tokens_per_second": 1014.763 }, { "epoch": 0.1324235531968663, "grad_norm": 0.35521116852760315, "learning_rate": 0.00018734177215189873, "loss": 0.2177, "num_input_tokens_seen": 244080, "step": 131, "train_runtime": 240.4803, "train_tokens_per_second": 1014.969 }, { "epoch": 0.133434420015163, "grad_norm": 0.3867698013782501, "learning_rate": 0.00018724050632911395, "loss": 0.3857, "num_input_tokens_seen": 245858, "step": 132, "train_runtime": 242.2765, "train_tokens_per_second": 1014.782 }, { "epoch": 0.1344452868334597, "grad_norm": 0.29385513067245483, "learning_rate": 0.0001871392405063291, "loss": 0.2192, "num_input_tokens_seen": 247804, "step": 133, "train_runtime": 244.066, "train_tokens_per_second": 1015.315 }, { "epoch": 0.1354561536517564, "grad_norm": 0.2909926176071167, "learning_rate": 0.0001870379746835443, "loss": 0.2115, "num_input_tokens_seen": 249694, "step": 134, "train_runtime": 245.8824, "train_tokens_per_second": 1015.502 }, { "epoch": 0.13646702047005307, "grad_norm": 0.3936549127101898, "learning_rate": 0.00018693670886075952, "loss": 0.222, "num_input_tokens_seen": 251606, "step": 135, "train_runtime": 247.7136, "train_tokens_per_second": 1015.713 }, { "epoch": 0.13747788728834975, "grad_norm": 0.3142557740211487, "learning_rate": 0.00018683544303797468, "loss": 0.2112, "num_input_tokens_seen": 253332, "step": 136, "train_runtime": 249.3943, "train_tokens_per_second": 1015.789 }, { "epoch": 0.13848875410664646, "grad_norm": 0.3500168025493622, "learning_rate": 0.00018673417721518987, "loss": 0.1939, "num_input_tokens_seen": 254974, "step": 137, "train_runtime": 251.1025, "train_tokens_per_second": 1015.418 }, { "epoch": 0.13949962092494314, "grad_norm": 0.3195367157459259, "learning_rate": 0.00018663291139240507, "loss": 0.3256, "num_input_tokens_seen": 256608, "step": 138, "train_runtime": 252.7901, "train_tokens_per_second": 1015.103 }, { "epoch": 0.14051048774323982, "grad_norm": 0.2949298620223999, "learning_rate": 0.00018653164556962026, "loss": 0.198, "num_input_tokens_seen": 258288, "step": 139, "train_runtime": 254.4778, "train_tokens_per_second": 1014.973 }, { "epoch": 0.14152135456153653, "grad_norm": 0.313806414604187, "learning_rate": 0.00018643037974683545, "loss": 0.1996, "num_input_tokens_seen": 260148, "step": 140, "train_runtime": 256.3055, "train_tokens_per_second": 1014.992 }, { "epoch": 0.1425322213798332, "grad_norm": 0.4024338126182556, "learning_rate": 0.00018632911392405064, "loss": 0.1987, "num_input_tokens_seen": 261654, "step": 141, "train_runtime": 257.8953, "train_tokens_per_second": 1014.574 }, { "epoch": 0.1435430881981299, "grad_norm": 0.45130419731140137, "learning_rate": 0.00018622784810126583, "loss": 0.1909, "num_input_tokens_seen": 263218, "step": 142, "train_runtime": 259.4938, "train_tokens_per_second": 1014.352 }, { "epoch": 0.1445539550164266, "grad_norm": 0.541994571685791, "learning_rate": 0.00018612658227848102, "loss": 0.2816, "num_input_tokens_seen": 264632, "step": 143, "train_runtime": 261.0919, "train_tokens_per_second": 1013.559 }, { "epoch": 0.14556482183472327, "grad_norm": 0.3926849663257599, "learning_rate": 0.0001860253164556962, "loss": 0.1541, "num_input_tokens_seen": 266864, "step": 144, "train_runtime": 262.9617, "train_tokens_per_second": 1014.84 }, { "epoch": 0.14657568865301995, "grad_norm": 0.39028400182724, "learning_rate": 0.0001859240506329114, "loss": 0.2019, "num_input_tokens_seen": 268848, "step": 145, "train_runtime": 264.8027, "train_tokens_per_second": 1015.277 }, { "epoch": 0.14758655547131666, "grad_norm": 0.417856901884079, "learning_rate": 0.0001858227848101266, "loss": 0.1816, "num_input_tokens_seen": 270722, "step": 146, "train_runtime": 266.5571, "train_tokens_per_second": 1015.625 }, { "epoch": 0.14859742228961334, "grad_norm": 0.41069379448890686, "learning_rate": 0.00018572151898734178, "loss": 0.1997, "num_input_tokens_seen": 272600, "step": 147, "train_runtime": 268.3283, "train_tokens_per_second": 1015.92 }, { "epoch": 0.14960828910791002, "grad_norm": 0.3944964110851288, "learning_rate": 0.00018562025316455697, "loss": 0.2941, "num_input_tokens_seen": 274420, "step": 148, "train_runtime": 269.984, "train_tokens_per_second": 1016.431 }, { "epoch": 0.15061915592620673, "grad_norm": 0.27445194125175476, "learning_rate": 0.00018551898734177216, "loss": 0.2761, "num_input_tokens_seen": 276326, "step": 149, "train_runtime": 271.7695, "train_tokens_per_second": 1016.766 }, { "epoch": 0.1516300227445034, "grad_norm": 0.5121089220046997, "learning_rate": 0.00018541772151898736, "loss": 0.2627, "num_input_tokens_seen": 277910, "step": 150, "train_runtime": 273.3918, "train_tokens_per_second": 1016.526 }, { "epoch": 0.15264088956280011, "grad_norm": 0.45720142126083374, "learning_rate": 0.00018531645569620255, "loss": 0.1706, "num_input_tokens_seen": 279798, "step": 151, "train_runtime": 276.9048, "train_tokens_per_second": 1010.448 }, { "epoch": 0.1536517563810968, "grad_norm": 0.31884294748306274, "learning_rate": 0.00018521518987341774, "loss": 0.1553, "num_input_tokens_seen": 281512, "step": 152, "train_runtime": 278.6516, "train_tokens_per_second": 1010.265 }, { "epoch": 0.15466262319939347, "grad_norm": 0.37187591195106506, "learning_rate": 0.00018511392405063293, "loss": 0.2538, "num_input_tokens_seen": 283374, "step": 153, "train_runtime": 280.3843, "train_tokens_per_second": 1010.663 }, { "epoch": 0.15567349001769018, "grad_norm": 0.4017643630504608, "learning_rate": 0.0001850126582278481, "loss": 0.2104, "num_input_tokens_seen": 285236, "step": 154, "train_runtime": 282.035, "train_tokens_per_second": 1011.35 }, { "epoch": 0.15668435683598686, "grad_norm": 0.3263136148452759, "learning_rate": 0.0001849113924050633, "loss": 0.2665, "num_input_tokens_seen": 287594, "step": 155, "train_runtime": 284.034, "train_tokens_per_second": 1012.534 }, { "epoch": 0.15769522365428354, "grad_norm": 0.39439326524734497, "learning_rate": 0.0001848101265822785, "loss": 0.216, "num_input_tokens_seen": 289730, "step": 156, "train_runtime": 285.8955, "train_tokens_per_second": 1013.412 }, { "epoch": 0.15870609047258025, "grad_norm": 0.39812779426574707, "learning_rate": 0.00018470886075949366, "loss": 0.2137, "num_input_tokens_seen": 291880, "step": 157, "train_runtime": 287.7431, "train_tokens_per_second": 1014.377 }, { "epoch": 0.15971695729087693, "grad_norm": 0.43934911489486694, "learning_rate": 0.00018460759493670888, "loss": 0.2193, "num_input_tokens_seen": 293984, "step": 158, "train_runtime": 289.5963, "train_tokens_per_second": 1015.151 }, { "epoch": 0.1607278241091736, "grad_norm": 0.4106093943119049, "learning_rate": 0.00018450632911392407, "loss": 0.2226, "num_input_tokens_seen": 296006, "step": 159, "train_runtime": 291.4338, "train_tokens_per_second": 1015.689 }, { "epoch": 0.1617386909274703, "grad_norm": 0.45763731002807617, "learning_rate": 0.00018440506329113924, "loss": 0.2325, "num_input_tokens_seen": 297474, "step": 160, "train_runtime": 293.06, "train_tokens_per_second": 1015.062 }, { "epoch": 0.162749557745767, "grad_norm": 0.4370255768299103, "learning_rate": 0.00018430379746835445, "loss": 0.2749, "num_input_tokens_seen": 299154, "step": 161, "train_runtime": 294.7502, "train_tokens_per_second": 1014.941 }, { "epoch": 0.16376042456406367, "grad_norm": 0.4296151101589203, "learning_rate": 0.00018420253164556962, "loss": 0.2165, "num_input_tokens_seen": 300562, "step": 162, "train_runtime": 296.3494, "train_tokens_per_second": 1014.215 }, { "epoch": 0.16477129138236038, "grad_norm": 0.3881031274795532, "learning_rate": 0.0001841012658227848, "loss": 0.2646, "num_input_tokens_seen": 302242, "step": 163, "train_runtime": 298.027, "train_tokens_per_second": 1014.143 }, { "epoch": 0.16578215820065706, "grad_norm": 0.39300647377967834, "learning_rate": 0.00018400000000000003, "loss": 0.1683, "num_input_tokens_seen": 303996, "step": 164, "train_runtime": 299.7329, "train_tokens_per_second": 1014.223 }, { "epoch": 0.16679302501895377, "grad_norm": 0.3293854892253876, "learning_rate": 0.0001838987341772152, "loss": 0.2492, "num_input_tokens_seen": 305954, "step": 165, "train_runtime": 301.5051, "train_tokens_per_second": 1014.756 }, { "epoch": 0.16780389183725045, "grad_norm": 0.3706817328929901, "learning_rate": 0.00018379746835443038, "loss": 0.242, "num_input_tokens_seen": 307566, "step": 166, "train_runtime": 303.1229, "train_tokens_per_second": 1014.658 }, { "epoch": 0.16881475865554713, "grad_norm": 0.3900180160999298, "learning_rate": 0.0001836962025316456, "loss": 0.2467, "num_input_tokens_seen": 309354, "step": 167, "train_runtime": 304.841, "train_tokens_per_second": 1014.804 }, { "epoch": 0.16982562547384383, "grad_norm": 0.41680508852005005, "learning_rate": 0.00018359493670886076, "loss": 0.2333, "num_input_tokens_seen": 310996, "step": 168, "train_runtime": 306.5227, "train_tokens_per_second": 1014.594 }, { "epoch": 0.1708364922921405, "grad_norm": 0.29431745409965515, "learning_rate": 0.00018349367088607595, "loss": 0.157, "num_input_tokens_seen": 313404, "step": 169, "train_runtime": 308.5847, "train_tokens_per_second": 1015.618 }, { "epoch": 0.1718473591104372, "grad_norm": 0.3451148569583893, "learning_rate": 0.00018339240506329115, "loss": 0.2472, "num_input_tokens_seen": 315656, "step": 170, "train_runtime": 310.5227, "train_tokens_per_second": 1016.531 }, { "epoch": 0.1728582259287339, "grad_norm": 0.5661376118659973, "learning_rate": 0.00018329113924050634, "loss": 0.343, "num_input_tokens_seen": 317108, "step": 171, "train_runtime": 312.097, "train_tokens_per_second": 1016.056 }, { "epoch": 0.17386909274703058, "grad_norm": 0.3814907968044281, "learning_rate": 0.00018318987341772153, "loss": 0.2181, "num_input_tokens_seen": 318558, "step": 172, "train_runtime": 313.6739, "train_tokens_per_second": 1015.571 }, { "epoch": 0.17487995956532726, "grad_norm": 0.3652172088623047, "learning_rate": 0.00018308860759493672, "loss": 0.2136, "num_input_tokens_seen": 320342, "step": 173, "train_runtime": 315.3775, "train_tokens_per_second": 1015.741 }, { "epoch": 0.17589082638362397, "grad_norm": 0.3934604823589325, "learning_rate": 0.0001829873417721519, "loss": 0.2771, "num_input_tokens_seen": 322282, "step": 174, "train_runtime": 317.2426, "train_tokens_per_second": 1015.885 }, { "epoch": 0.17690169320192065, "grad_norm": 0.2914677560329437, "learning_rate": 0.0001828860759493671, "loss": 0.2556, "num_input_tokens_seen": 324562, "step": 175, "train_runtime": 319.2256, "train_tokens_per_second": 1016.717 }, { "epoch": 0.17791256002021733, "grad_norm": 0.359348326921463, "learning_rate": 0.0001827848101265823, "loss": 0.2204, "num_input_tokens_seen": 326460, "step": 176, "train_runtime": 320.9467, "train_tokens_per_second": 1017.178 }, { "epoch": 0.17892342683851403, "grad_norm": 0.36025404930114746, "learning_rate": 0.00018268354430379748, "loss": 0.2518, "num_input_tokens_seen": 328256, "step": 177, "train_runtime": 322.6783, "train_tokens_per_second": 1017.285 }, { "epoch": 0.1799342936568107, "grad_norm": 0.42412030696868896, "learning_rate": 0.00018258227848101267, "loss": 0.2573, "num_input_tokens_seen": 330068, "step": 178, "train_runtime": 324.4329, "train_tokens_per_second": 1017.369 }, { "epoch": 0.1809451604751074, "grad_norm": 0.3933882713317871, "learning_rate": 0.00018248101265822786, "loss": 0.2604, "num_input_tokens_seen": 331562, "step": 179, "train_runtime": 326.0377, "train_tokens_per_second": 1016.944 }, { "epoch": 0.1819560272934041, "grad_norm": 0.34556353092193604, "learning_rate": 0.00018237974683544305, "loss": 0.1406, "num_input_tokens_seen": 332972, "step": 180, "train_runtime": 327.6457, "train_tokens_per_second": 1016.256 }, { "epoch": 0.18296689411170078, "grad_norm": 0.3858505189418793, "learning_rate": 0.00018227848101265824, "loss": 0.4204, "num_input_tokens_seen": 334670, "step": 181, "train_runtime": 331.3835, "train_tokens_per_second": 1009.917 }, { "epoch": 0.18397776092999749, "grad_norm": 0.3960411250591278, "learning_rate": 0.00018217721518987344, "loss": 0.1473, "num_input_tokens_seen": 336074, "step": 182, "train_runtime": 332.9713, "train_tokens_per_second": 1009.318 }, { "epoch": 0.18498862774829417, "grad_norm": 0.2916383743286133, "learning_rate": 0.00018207594936708863, "loss": 0.1958, "num_input_tokens_seen": 338036, "step": 183, "train_runtime": 334.7676, "train_tokens_per_second": 1009.763 }, { "epoch": 0.18599949456659085, "grad_norm": 0.3205072581768036, "learning_rate": 0.0001819746835443038, "loss": 0.2232, "num_input_tokens_seen": 339804, "step": 184, "train_runtime": 336.5239, "train_tokens_per_second": 1009.747 }, { "epoch": 0.18701036138488755, "grad_norm": 0.3922429382801056, "learning_rate": 0.000181873417721519, "loss": 0.1972, "num_input_tokens_seen": 341750, "step": 185, "train_runtime": 338.2584, "train_tokens_per_second": 1010.322 }, { "epoch": 0.18802122820318423, "grad_norm": 0.39398542046546936, "learning_rate": 0.00018177215189873417, "loss": 0.3266, "num_input_tokens_seen": 343670, "step": 186, "train_runtime": 340.0841, "train_tokens_per_second": 1010.544 }, { "epoch": 0.1890320950214809, "grad_norm": 0.3316863775253296, "learning_rate": 0.00018167088607594936, "loss": 0.1562, "num_input_tokens_seen": 345674, "step": 187, "train_runtime": 341.8852, "train_tokens_per_second": 1011.082 }, { "epoch": 0.19004296183977762, "grad_norm": 0.4948942959308624, "learning_rate": 0.00018156962025316458, "loss": 0.2739, "num_input_tokens_seen": 347344, "step": 188, "train_runtime": 343.5796, "train_tokens_per_second": 1010.956 }, { "epoch": 0.1910538286580743, "grad_norm": 0.3622047007083893, "learning_rate": 0.00018146835443037974, "loss": 0.1862, "num_input_tokens_seen": 349468, "step": 189, "train_runtime": 345.3919, "train_tokens_per_second": 1011.801 }, { "epoch": 0.19206469547637098, "grad_norm": 0.37027546763420105, "learning_rate": 0.00018136708860759493, "loss": 0.2266, "num_input_tokens_seen": 351544, "step": 190, "train_runtime": 347.2422, "train_tokens_per_second": 1012.389 }, { "epoch": 0.19307556229466769, "grad_norm": 0.3605174422264099, "learning_rate": 0.00018126582278481013, "loss": 0.3304, "num_input_tokens_seen": 353346, "step": 191, "train_runtime": 348.9445, "train_tokens_per_second": 1012.614 }, { "epoch": 0.19408642911296436, "grad_norm": 0.4563489258289337, "learning_rate": 0.00018116455696202532, "loss": 0.3384, "num_input_tokens_seen": 355628, "step": 192, "train_runtime": 350.9503, "train_tokens_per_second": 1013.329 }, { "epoch": 0.19509729593126104, "grad_norm": 0.5172436237335205, "learning_rate": 0.0001810632911392405, "loss": 0.278, "num_input_tokens_seen": 357234, "step": 193, "train_runtime": 352.5674, "train_tokens_per_second": 1013.236 }, { "epoch": 0.19610816274955775, "grad_norm": 0.41404810547828674, "learning_rate": 0.0001809620253164557, "loss": 0.2162, "num_input_tokens_seen": 359288, "step": 194, "train_runtime": 354.414, "train_tokens_per_second": 1013.752 }, { "epoch": 0.19711902956785443, "grad_norm": 0.3381623327732086, "learning_rate": 0.0001808607594936709, "loss": 0.1617, "num_input_tokens_seen": 360876, "step": 195, "train_runtime": 356.0269, "train_tokens_per_second": 1013.62 }, { "epoch": 0.1981298963861511, "grad_norm": 0.2769710421562195, "learning_rate": 0.00018075949367088608, "loss": 0.2259, "num_input_tokens_seen": 362952, "step": 196, "train_runtime": 357.8201, "train_tokens_per_second": 1014.342 }, { "epoch": 0.19914076320444782, "grad_norm": 0.3348582684993744, "learning_rate": 0.00018065822784810127, "loss": 0.2149, "num_input_tokens_seen": 365048, "step": 197, "train_runtime": 359.7149, "train_tokens_per_second": 1014.826 }, { "epoch": 0.2001516300227445, "grad_norm": 0.3476252555847168, "learning_rate": 0.00018055696202531646, "loss": 0.2743, "num_input_tokens_seen": 366994, "step": 198, "train_runtime": 361.4935, "train_tokens_per_second": 1015.216 }, { "epoch": 0.2001516300227445, "eval_loss": 0.2194075733423233, "eval_runtime": 61.429, "eval_samples_per_second": 14.309, "eval_steps_per_second": 7.163, "num_input_tokens_seen": 366994, "step": 198 }, { "epoch": 0.2011624968410412, "grad_norm": 0.42954811453819275, "learning_rate": 0.00018045569620253165, "loss": 0.2171, "num_input_tokens_seen": 368404, "step": 199, "train_runtime": 424.4999, "train_tokens_per_second": 867.854 }, { "epoch": 0.20217336365933788, "grad_norm": 0.39108145236968994, "learning_rate": 0.00018035443037974684, "loss": 0.2095, "num_input_tokens_seen": 370232, "step": 200, "train_runtime": 426.1921, "train_tokens_per_second": 868.697 }, { "epoch": 0.20318423047763456, "grad_norm": 0.3512146472930908, "learning_rate": 0.00018025316455696203, "loss": 0.2122, "num_input_tokens_seen": 372250, "step": 201, "train_runtime": 428.0407, "train_tokens_per_second": 869.66 }, { "epoch": 0.20419509729593127, "grad_norm": 0.3715672194957733, "learning_rate": 0.00018015189873417723, "loss": 0.189, "num_input_tokens_seen": 374026, "step": 202, "train_runtime": 429.7707, "train_tokens_per_second": 870.292 }, { "epoch": 0.20520596411422795, "grad_norm": 0.45648568868637085, "learning_rate": 0.00018005063291139242, "loss": 0.2295, "num_input_tokens_seen": 375588, "step": 203, "train_runtime": 431.4083, "train_tokens_per_second": 870.609 }, { "epoch": 0.20621683093252463, "grad_norm": 0.4618614912033081, "learning_rate": 0.0001799493670886076, "loss": 0.2562, "num_input_tokens_seen": 377394, "step": 204, "train_runtime": 433.1983, "train_tokens_per_second": 871.181 }, { "epoch": 0.20722769775082134, "grad_norm": 0.4303542673587799, "learning_rate": 0.0001798481012658228, "loss": 0.1736, "num_input_tokens_seen": 379322, "step": 205, "train_runtime": 434.9163, "train_tokens_per_second": 872.172 }, { "epoch": 0.20823856456911802, "grad_norm": 0.48945361375808716, "learning_rate": 0.000179746835443038, "loss": 0.2474, "num_input_tokens_seen": 380978, "step": 206, "train_runtime": 436.5303, "train_tokens_per_second": 872.741 }, { "epoch": 0.2092494313874147, "grad_norm": 0.3990488350391388, "learning_rate": 0.00017964556962025315, "loss": 0.1922, "num_input_tokens_seen": 382954, "step": 207, "train_runtime": 438.3619, "train_tokens_per_second": 873.602 }, { "epoch": 0.2102602982057114, "grad_norm": 0.3929692208766937, "learning_rate": 0.00017954430379746837, "loss": 0.2035, "num_input_tokens_seen": 384998, "step": 208, "train_runtime": 440.2896, "train_tokens_per_second": 874.42 }, { "epoch": 0.21127116502400808, "grad_norm": 0.41196030378341675, "learning_rate": 0.00017944303797468356, "loss": 0.2038, "num_input_tokens_seen": 386652, "step": 209, "train_runtime": 441.9145, "train_tokens_per_second": 874.948 }, { "epoch": 0.21228203184230476, "grad_norm": 0.5543971061706543, "learning_rate": 0.00017934177215189872, "loss": 0.1938, "num_input_tokens_seen": 388026, "step": 210, "train_runtime": 443.4899, "train_tokens_per_second": 874.938 }, { "epoch": 0.21329289866060147, "grad_norm": 0.3725636303424835, "learning_rate": 0.00017924050632911394, "loss": 0.2182, "num_input_tokens_seen": 389782, "step": 211, "train_runtime": 447.2462, "train_tokens_per_second": 871.515 }, { "epoch": 0.21430376547889815, "grad_norm": 0.3938060998916626, "learning_rate": 0.00017913924050632913, "loss": 0.1772, "num_input_tokens_seen": 391886, "step": 212, "train_runtime": 449.0725, "train_tokens_per_second": 872.656 }, { "epoch": 0.21531463229719486, "grad_norm": 0.3155343234539032, "learning_rate": 0.0001790379746835443, "loss": 0.1668, "num_input_tokens_seen": 393538, "step": 213, "train_runtime": 450.7652, "train_tokens_per_second": 873.044 }, { "epoch": 0.21632549911549154, "grad_norm": 0.34781721234321594, "learning_rate": 0.00017893670886075952, "loss": 0.1614, "num_input_tokens_seen": 395470, "step": 214, "train_runtime": 452.6355, "train_tokens_per_second": 873.705 }, { "epoch": 0.21733636593378822, "grad_norm": 0.38830557465553284, "learning_rate": 0.00017883544303797468, "loss": 0.1959, "num_input_tokens_seen": 397572, "step": 215, "train_runtime": 454.4439, "train_tokens_per_second": 874.854 }, { "epoch": 0.21834723275208492, "grad_norm": 0.434148907661438, "learning_rate": 0.00017873417721518987, "loss": 0.2942, "num_input_tokens_seen": 399248, "step": 216, "train_runtime": 456.0767, "train_tokens_per_second": 875.397 }, { "epoch": 0.2193580995703816, "grad_norm": 0.3435661196708679, "learning_rate": 0.0001786329113924051, "loss": 0.1627, "num_input_tokens_seen": 401300, "step": 217, "train_runtime": 457.9212, "train_tokens_per_second": 876.352 }, { "epoch": 0.22036896638867828, "grad_norm": 0.31093019247055054, "learning_rate": 0.00017853164556962025, "loss": 0.2145, "num_input_tokens_seen": 403792, "step": 218, "train_runtime": 460.0322, "train_tokens_per_second": 877.747 }, { "epoch": 0.221379833206975, "grad_norm": 0.4084714651107788, "learning_rate": 0.00017843037974683544, "loss": 0.3023, "num_input_tokens_seen": 405542, "step": 219, "train_runtime": 461.669, "train_tokens_per_second": 878.426 }, { "epoch": 0.22239070002527167, "grad_norm": 0.3440285921096802, "learning_rate": 0.00017832911392405066, "loss": 0.1894, "num_input_tokens_seen": 407284, "step": 220, "train_runtime": 463.3644, "train_tokens_per_second": 878.971 }, { "epoch": 0.22340156684356835, "grad_norm": 0.38901078701019287, "learning_rate": 0.00017822784810126582, "loss": 0.2994, "num_input_tokens_seen": 408822, "step": 221, "train_runtime": 464.9742, "train_tokens_per_second": 879.236 }, { "epoch": 0.22441243366186506, "grad_norm": 0.3624526858329773, "learning_rate": 0.00017812658227848101, "loss": 0.2181, "num_input_tokens_seen": 410890, "step": 222, "train_runtime": 466.8144, "train_tokens_per_second": 880.2 }, { "epoch": 0.22542330048016174, "grad_norm": 0.3111014664173126, "learning_rate": 0.0001780253164556962, "loss": 0.1725, "num_input_tokens_seen": 413154, "step": 223, "train_runtime": 468.769, "train_tokens_per_second": 881.36 }, { "epoch": 0.22643416729845842, "grad_norm": 0.41633716225624084, "learning_rate": 0.0001779240506329114, "loss": 0.1863, "num_input_tokens_seen": 414952, "step": 224, "train_runtime": 470.4852, "train_tokens_per_second": 881.966 }, { "epoch": 0.22744503411675512, "grad_norm": 0.326198011636734, "learning_rate": 0.0001778227848101266, "loss": 0.2084, "num_input_tokens_seen": 417118, "step": 225, "train_runtime": 472.4207, "train_tokens_per_second": 882.938 }, { "epoch": 0.2284559009350518, "grad_norm": 0.4119671881198883, "learning_rate": 0.00017772151898734178, "loss": 0.1664, "num_input_tokens_seen": 418874, "step": 226, "train_runtime": 474.1206, "train_tokens_per_second": 883.476 }, { "epoch": 0.22946676775334848, "grad_norm": 0.4336074888706207, "learning_rate": 0.00017762025316455697, "loss": 0.2245, "num_input_tokens_seen": 420976, "step": 227, "train_runtime": 475.9922, "train_tokens_per_second": 884.418 }, { "epoch": 0.2304776345716452, "grad_norm": 0.3529372215270996, "learning_rate": 0.00017751898734177216, "loss": 0.3078, "num_input_tokens_seen": 422772, "step": 228, "train_runtime": 477.7538, "train_tokens_per_second": 884.916 }, { "epoch": 0.23148850138994187, "grad_norm": 0.36478540301322937, "learning_rate": 0.00017741772151898735, "loss": 0.236, "num_input_tokens_seen": 424808, "step": 229, "train_runtime": 479.5427, "train_tokens_per_second": 885.861 }, { "epoch": 0.23249936820823858, "grad_norm": 0.36925044655799866, "learning_rate": 0.00017731645569620254, "loss": 0.3449, "num_input_tokens_seen": 426316, "step": 230, "train_runtime": 481.1515, "train_tokens_per_second": 886.033 }, { "epoch": 0.23351023502653526, "grad_norm": 0.35536423325538635, "learning_rate": 0.00017721518987341773, "loss": 0.2149, "num_input_tokens_seen": 428032, "step": 231, "train_runtime": 482.8356, "train_tokens_per_second": 886.496 }, { "epoch": 0.23452110184483194, "grad_norm": 0.3737644553184509, "learning_rate": 0.00017711392405063292, "loss": 0.2188, "num_input_tokens_seen": 430370, "step": 232, "train_runtime": 484.8382, "train_tokens_per_second": 887.657 }, { "epoch": 0.23553196866312864, "grad_norm": 0.30169618129730225, "learning_rate": 0.00017701265822784811, "loss": 0.1643, "num_input_tokens_seen": 432208, "step": 233, "train_runtime": 486.5744, "train_tokens_per_second": 888.267 }, { "epoch": 0.23654283548142532, "grad_norm": 0.42626598477363586, "learning_rate": 0.0001769113924050633, "loss": 0.2891, "num_input_tokens_seen": 434056, "step": 234, "train_runtime": 488.3877, "train_tokens_per_second": 888.753 }, { "epoch": 0.237553702299722, "grad_norm": 0.4076259136199951, "learning_rate": 0.0001768101265822785, "loss": 0.2513, "num_input_tokens_seen": 436298, "step": 235, "train_runtime": 490.3713, "train_tokens_per_second": 889.73 }, { "epoch": 0.2385645691180187, "grad_norm": 0.39652830362319946, "learning_rate": 0.0001767088607594937, "loss": 0.3282, "num_input_tokens_seen": 438264, "step": 236, "train_runtime": 492.1979, "train_tokens_per_second": 890.422 }, { "epoch": 0.2395754359363154, "grad_norm": 0.43892091512680054, "learning_rate": 0.00017660759493670888, "loss": 0.2807, "num_input_tokens_seen": 440096, "step": 237, "train_runtime": 493.8945, "train_tokens_per_second": 891.073 }, { "epoch": 0.24058630275461207, "grad_norm": 0.45497018098831177, "learning_rate": 0.00017650632911392407, "loss": 0.1972, "num_input_tokens_seen": 441640, "step": 238, "train_runtime": 495.5074, "train_tokens_per_second": 891.288 }, { "epoch": 0.24159716957290878, "grad_norm": 0.441567599773407, "learning_rate": 0.00017640506329113923, "loss": 0.2892, "num_input_tokens_seen": 443558, "step": 239, "train_runtime": 497.226, "train_tokens_per_second": 892.065 }, { "epoch": 0.24260803639120546, "grad_norm": 0.5874553918838501, "learning_rate": 0.00017630379746835445, "loss": 0.1985, "num_input_tokens_seen": 444900, "step": 240, "train_runtime": 498.8049, "train_tokens_per_second": 891.932 }, { "epoch": 0.24361890320950214, "grad_norm": 0.46553996205329895, "learning_rate": 0.00017620253164556964, "loss": 0.2307, "num_input_tokens_seen": 446356, "step": 241, "train_runtime": 502.4771, "train_tokens_per_second": 888.311 }, { "epoch": 0.24462977002779884, "grad_norm": 0.3993649482727051, "learning_rate": 0.0001761012658227848, "loss": 0.1905, "num_input_tokens_seen": 447858, "step": 242, "train_runtime": 504.1376, "train_tokens_per_second": 888.365 }, { "epoch": 0.24564063684609552, "grad_norm": 0.3534109592437744, "learning_rate": 0.00017600000000000002, "loss": 0.1715, "num_input_tokens_seen": 449478, "step": 243, "train_runtime": 505.7563, "train_tokens_per_second": 888.725 }, { "epoch": 0.24665150366439223, "grad_norm": 0.40606966614723206, "learning_rate": 0.0001758987341772152, "loss": 0.2179, "num_input_tokens_seen": 451442, "step": 244, "train_runtime": 507.6019, "train_tokens_per_second": 889.362 }, { "epoch": 0.2476623704826889, "grad_norm": 0.3612362742424011, "learning_rate": 0.00017579746835443038, "loss": 0.1328, "num_input_tokens_seen": 452948, "step": 245, "train_runtime": 509.2145, "train_tokens_per_second": 889.503 }, { "epoch": 0.2486732373009856, "grad_norm": 0.38469746708869934, "learning_rate": 0.0001756962025316456, "loss": 0.187, "num_input_tokens_seen": 454934, "step": 246, "train_runtime": 511.0563, "train_tokens_per_second": 890.184 }, { "epoch": 0.2496841041192823, "grad_norm": 0.4440872073173523, "learning_rate": 0.00017559493670886076, "loss": 0.3736, "num_input_tokens_seen": 456716, "step": 247, "train_runtime": 512.7952, "train_tokens_per_second": 890.64 }, { "epoch": 0.250694970937579, "grad_norm": 0.43680766224861145, "learning_rate": 0.00017549367088607595, "loss": 0.161, "num_input_tokens_seen": 458266, "step": 248, "train_runtime": 514.4249, "train_tokens_per_second": 890.832 }, { "epoch": 0.2517058377558757, "grad_norm": 0.3658226430416107, "learning_rate": 0.00017539240506329117, "loss": 0.2598, "num_input_tokens_seen": 459798, "step": 249, "train_runtime": 516.1364, "train_tokens_per_second": 890.846 }, { "epoch": 0.25271670457417234, "grad_norm": 0.31666117906570435, "learning_rate": 0.00017529113924050633, "loss": 0.1772, "num_input_tokens_seen": 461594, "step": 250, "train_runtime": 517.9112, "train_tokens_per_second": 891.261 }, { "epoch": 0.25372757139246904, "grad_norm": 0.31696584820747375, "learning_rate": 0.00017518987341772152, "loss": 0.3119, "num_input_tokens_seen": 463962, "step": 251, "train_runtime": 519.9303, "train_tokens_per_second": 892.354 }, { "epoch": 0.25473843821076575, "grad_norm": 0.36062178015708923, "learning_rate": 0.00017508860759493674, "loss": 0.1571, "num_input_tokens_seen": 465908, "step": 252, "train_runtime": 521.7069, "train_tokens_per_second": 893.046 }, { "epoch": 0.2557493050290624, "grad_norm": 0.41598281264305115, "learning_rate": 0.0001749873417721519, "loss": 0.2414, "num_input_tokens_seen": 467770, "step": 253, "train_runtime": 523.471, "train_tokens_per_second": 893.593 }, { "epoch": 0.2567601718473591, "grad_norm": 0.361608624458313, "learning_rate": 0.0001748860759493671, "loss": 0.201, "num_input_tokens_seen": 469856, "step": 254, "train_runtime": 525.3382, "train_tokens_per_second": 894.388 }, { "epoch": 0.2577710386656558, "grad_norm": 0.28574812412261963, "learning_rate": 0.00017478481012658229, "loss": 0.2026, "num_input_tokens_seen": 472246, "step": 255, "train_runtime": 527.4042, "train_tokens_per_second": 895.416 }, { "epoch": 0.25878190548395247, "grad_norm": 0.39967218041419983, "learning_rate": 0.00017468354430379748, "loss": 0.1907, "num_input_tokens_seen": 473990, "step": 256, "train_runtime": 529.0961, "train_tokens_per_second": 895.849 }, { "epoch": 0.2597927723022492, "grad_norm": 0.3359277546405792, "learning_rate": 0.00017458227848101267, "loss": 0.279, "num_input_tokens_seen": 476312, "step": 257, "train_runtime": 531.0411, "train_tokens_per_second": 896.94 }, { "epoch": 0.2608036391205459, "grad_norm": 0.3367970287799835, "learning_rate": 0.00017448101265822786, "loss": 0.2644, "num_input_tokens_seen": 478152, "step": 258, "train_runtime": 532.6894, "train_tokens_per_second": 897.619 }, { "epoch": 0.26181450593884253, "grad_norm": 0.39386895298957825, "learning_rate": 0.00017437974683544305, "loss": 0.1985, "num_input_tokens_seen": 480216, "step": 259, "train_runtime": 534.5423, "train_tokens_per_second": 898.369 }, { "epoch": 0.26282537275713924, "grad_norm": 0.33743321895599365, "learning_rate": 0.00017427848101265824, "loss": 0.2987, "num_input_tokens_seen": 482288, "step": 260, "train_runtime": 536.3894, "train_tokens_per_second": 899.138 }, { "epoch": 0.26383623957543595, "grad_norm": 0.49012792110443115, "learning_rate": 0.00017417721518987343, "loss": 0.2798, "num_input_tokens_seen": 483850, "step": 261, "train_runtime": 538.0804, "train_tokens_per_second": 899.215 }, { "epoch": 0.2648471063937326, "grad_norm": 0.41628557443618774, "learning_rate": 0.00017407594936708862, "loss": 0.2674, "num_input_tokens_seen": 485646, "step": 262, "train_runtime": 539.8519, "train_tokens_per_second": 899.591 }, { "epoch": 0.2658579732120293, "grad_norm": 0.49774986505508423, "learning_rate": 0.00017397468354430379, "loss": 0.27, "num_input_tokens_seen": 487634, "step": 263, "train_runtime": 541.6853, "train_tokens_per_second": 900.216 }, { "epoch": 0.266868840030326, "grad_norm": 0.35518673062324524, "learning_rate": 0.000173873417721519, "loss": 0.1975, "num_input_tokens_seen": 489650, "step": 264, "train_runtime": 543.461, "train_tokens_per_second": 900.985 }, { "epoch": 0.26787970684862267, "grad_norm": 0.43562984466552734, "learning_rate": 0.0001737721518987342, "loss": 0.2114, "num_input_tokens_seen": 491834, "step": 265, "train_runtime": 545.341, "train_tokens_per_second": 901.883 }, { "epoch": 0.2688905736669194, "grad_norm": 0.3897487223148346, "learning_rate": 0.00017367088607594936, "loss": 0.2255, "num_input_tokens_seen": 494118, "step": 266, "train_runtime": 547.3362, "train_tokens_per_second": 902.769 }, { "epoch": 0.2699014404852161, "grad_norm": 0.41832661628723145, "learning_rate": 0.00017356962025316458, "loss": 0.235, "num_input_tokens_seen": 495884, "step": 267, "train_runtime": 549.1008, "train_tokens_per_second": 903.084 }, { "epoch": 0.2709123073035128, "grad_norm": 0.4256960153579712, "learning_rate": 0.00017346835443037977, "loss": 0.2551, "num_input_tokens_seen": 497916, "step": 268, "train_runtime": 550.8381, "train_tokens_per_second": 903.924 }, { "epoch": 0.27192317412180944, "grad_norm": 0.43746358156204224, "learning_rate": 0.00017336708860759493, "loss": 0.1557, "num_input_tokens_seen": 499520, "step": 269, "train_runtime": 552.5099, "train_tokens_per_second": 904.092 }, { "epoch": 0.27293404094010615, "grad_norm": 0.43507421016693115, "learning_rate": 0.00017326582278481015, "loss": 0.2928, "num_input_tokens_seen": 501704, "step": 270, "train_runtime": 554.4475, "train_tokens_per_second": 904.872 }, { "epoch": 0.27394490775840286, "grad_norm": 0.43564385175704956, "learning_rate": 0.0001731645569620253, "loss": 0.2278, "num_input_tokens_seen": 503400, "step": 271, "train_runtime": 557.8461, "train_tokens_per_second": 902.399 }, { "epoch": 0.2749557745766995, "grad_norm": 0.47292283177375793, "learning_rate": 0.0001730632911392405, "loss": 0.2152, "num_input_tokens_seen": 505150, "step": 272, "train_runtime": 559.6529, "train_tokens_per_second": 902.613 }, { "epoch": 0.2759666413949962, "grad_norm": 0.420528769493103, "learning_rate": 0.00017296202531645572, "loss": 0.1803, "num_input_tokens_seen": 506914, "step": 273, "train_runtime": 561.4075, "train_tokens_per_second": 902.934 }, { "epoch": 0.2769775082132929, "grad_norm": 0.3233083188533783, "learning_rate": 0.00017286075949367088, "loss": 0.2905, "num_input_tokens_seen": 509386, "step": 274, "train_runtime": 563.4828, "train_tokens_per_second": 903.996 }, { "epoch": 0.2779883750315896, "grad_norm": 0.3598622977733612, "learning_rate": 0.00017275949367088608, "loss": 0.2707, "num_input_tokens_seen": 510774, "step": 275, "train_runtime": 565.0835, "train_tokens_per_second": 903.891 }, { "epoch": 0.2789992418498863, "grad_norm": 0.4031928479671478, "learning_rate": 0.0001726582278481013, "loss": 0.1487, "num_input_tokens_seen": 512408, "step": 276, "train_runtime": 566.7789, "train_tokens_per_second": 904.07 }, { "epoch": 0.280010108668183, "grad_norm": 0.35309258103370667, "learning_rate": 0.00017255696202531646, "loss": 0.2066, "num_input_tokens_seen": 514444, "step": 277, "train_runtime": 568.6336, "train_tokens_per_second": 904.702 }, { "epoch": 0.28102097548647964, "grad_norm": 0.3811109960079193, "learning_rate": 0.00017245569620253165, "loss": 0.2566, "num_input_tokens_seen": 516154, "step": 278, "train_runtime": 570.3865, "train_tokens_per_second": 904.92 }, { "epoch": 0.28203184230477635, "grad_norm": 0.39953625202178955, "learning_rate": 0.00017235443037974684, "loss": 0.2417, "num_input_tokens_seen": 518388, "step": 279, "train_runtime": 572.267, "train_tokens_per_second": 905.85 }, { "epoch": 0.28304270912307306, "grad_norm": 0.4009864926338196, "learning_rate": 0.00017225316455696203, "loss": 0.2438, "num_input_tokens_seen": 520276, "step": 280, "train_runtime": 573.9768, "train_tokens_per_second": 906.441 }, { "epoch": 0.2840535759413697, "grad_norm": 0.45036402344703674, "learning_rate": 0.00017215189873417722, "loss": 0.1924, "num_input_tokens_seen": 522032, "step": 281, "train_runtime": 575.7105, "train_tokens_per_second": 906.761 }, { "epoch": 0.2850644427596664, "grad_norm": 0.48415297269821167, "learning_rate": 0.0001720506329113924, "loss": 0.1766, "num_input_tokens_seen": 523640, "step": 282, "train_runtime": 577.335, "train_tokens_per_second": 906.995 }, { "epoch": 0.2860753095779631, "grad_norm": 0.4514244794845581, "learning_rate": 0.0001719493670886076, "loss": 0.1805, "num_input_tokens_seen": 525432, "step": 283, "train_runtime": 578.9738, "train_tokens_per_second": 907.523 }, { "epoch": 0.2870861763962598, "grad_norm": 0.4642978310585022, "learning_rate": 0.0001718481012658228, "loss": 0.1902, "num_input_tokens_seen": 527470, "step": 284, "train_runtime": 580.7784, "train_tokens_per_second": 908.212 }, { "epoch": 0.2880970432145565, "grad_norm": 0.4242786169052124, "learning_rate": 0.00017174683544303798, "loss": 0.1567, "num_input_tokens_seen": 529352, "step": 285, "train_runtime": 582.5114, "train_tokens_per_second": 908.741 }, { "epoch": 0.2891079100328532, "grad_norm": 0.46856752038002014, "learning_rate": 0.00017164556962025317, "loss": 0.249, "num_input_tokens_seen": 531024, "step": 286, "train_runtime": 584.1487, "train_tokens_per_second": 909.056 }, { "epoch": 0.29011877685114984, "grad_norm": 0.4047328531742096, "learning_rate": 0.00017154430379746837, "loss": 0.228, "num_input_tokens_seen": 533078, "step": 287, "train_runtime": 585.9552, "train_tokens_per_second": 909.759 }, { "epoch": 0.29112964366944655, "grad_norm": 0.3408379852771759, "learning_rate": 0.00017144303797468356, "loss": 0.1971, "num_input_tokens_seen": 535470, "step": 288, "train_runtime": 587.9542, "train_tokens_per_second": 910.734 }, { "epoch": 0.29214051048774325, "grad_norm": 0.489050954580307, "learning_rate": 0.00017134177215189875, "loss": 0.1943, "num_input_tokens_seen": 537330, "step": 289, "train_runtime": 589.7218, "train_tokens_per_second": 911.158 }, { "epoch": 0.2931513773060399, "grad_norm": 0.400348037481308, "learning_rate": 0.00017124050632911394, "loss": 0.2157, "num_input_tokens_seen": 539286, "step": 290, "train_runtime": 591.4963, "train_tokens_per_second": 911.732 }, { "epoch": 0.2941622441243366, "grad_norm": 0.3712882399559021, "learning_rate": 0.00017113924050632913, "loss": 0.168, "num_input_tokens_seen": 541432, "step": 291, "train_runtime": 593.4921, "train_tokens_per_second": 912.282 }, { "epoch": 0.2951731109426333, "grad_norm": 0.32833173871040344, "learning_rate": 0.00017103797468354432, "loss": 0.1658, "num_input_tokens_seen": 543382, "step": 292, "train_runtime": 595.3108, "train_tokens_per_second": 912.77 }, { "epoch": 0.29618397776093, "grad_norm": 0.36027055978775024, "learning_rate": 0.0001709367088607595, "loss": 0.1858, "num_input_tokens_seen": 545264, "step": 293, "train_runtime": 597.0765, "train_tokens_per_second": 913.223 }, { "epoch": 0.2971948445792267, "grad_norm": 0.27264341711997986, "learning_rate": 0.0001708354430379747, "loss": 0.195, "num_input_tokens_seen": 547576, "step": 294, "train_runtime": 599.0353, "train_tokens_per_second": 914.096 }, { "epoch": 0.2982057113975234, "grad_norm": 0.46067139506340027, "learning_rate": 0.00017073417721518987, "loss": 0.2759, "num_input_tokens_seen": 549512, "step": 295, "train_runtime": 600.8085, "train_tokens_per_second": 914.621 }, { "epoch": 0.29921657821582004, "grad_norm": 0.3848015367984772, "learning_rate": 0.00017063291139240508, "loss": 0.1802, "num_input_tokens_seen": 550774, "step": 296, "train_runtime": 602.3542, "train_tokens_per_second": 914.369 }, { "epoch": 0.30022744503411675, "grad_norm": 0.36973848938941956, "learning_rate": 0.00017053164556962027, "loss": 0.181, "num_input_tokens_seen": 552806, "step": 297, "train_runtime": 604.2172, "train_tokens_per_second": 914.913 }, { "epoch": 0.30123831185241345, "grad_norm": 0.2873566150665283, "learning_rate": 0.00017043037974683544, "loss": 0.1467, "num_input_tokens_seen": 555204, "step": 298, "train_runtime": 606.2635, "train_tokens_per_second": 915.78 }, { "epoch": 0.30224917867071016, "grad_norm": 0.37974682450294495, "learning_rate": 0.00017032911392405066, "loss": 0.1634, "num_input_tokens_seen": 556868, "step": 299, "train_runtime": 607.9181, "train_tokens_per_second": 916.025 }, { "epoch": 0.3032600454890068, "grad_norm": 0.3785713016986847, "learning_rate": 0.00017022784810126585, "loss": 0.1746, "num_input_tokens_seen": 558456, "step": 300, "train_runtime": 609.5133, "train_tokens_per_second": 916.233 }, { "epoch": 0.3042709123073035, "grad_norm": 0.4307490289211273, "learning_rate": 0.000170126582278481, "loss": 0.2887, "num_input_tokens_seen": 560334, "step": 301, "train_runtime": 612.9674, "train_tokens_per_second": 914.133 }, { "epoch": 0.30528177912560023, "grad_norm": 0.36402326822280884, "learning_rate": 0.00017002531645569623, "loss": 0.1913, "num_input_tokens_seen": 562316, "step": 302, "train_runtime": 614.8226, "train_tokens_per_second": 914.599 }, { "epoch": 0.3062926459438969, "grad_norm": 0.33439892530441284, "learning_rate": 0.0001699240506329114, "loss": 0.1823, "num_input_tokens_seen": 564448, "step": 303, "train_runtime": 616.6247, "train_tokens_per_second": 915.383 }, { "epoch": 0.3073035127621936, "grad_norm": 0.5432685017585754, "learning_rate": 0.00016982278481012658, "loss": 0.1848, "num_input_tokens_seen": 565648, "step": 304, "train_runtime": 618.1611, "train_tokens_per_second": 915.049 }, { "epoch": 0.3083143795804903, "grad_norm": 0.5558014512062073, "learning_rate": 0.0001697215189873418, "loss": 0.2158, "num_input_tokens_seen": 567142, "step": 305, "train_runtime": 619.8092, "train_tokens_per_second": 915.027 }, { "epoch": 0.30932524639878695, "grad_norm": 0.43292495608329773, "learning_rate": 0.00016962025316455696, "loss": 0.3157, "num_input_tokens_seen": 569422, "step": 306, "train_runtime": 621.7428, "train_tokens_per_second": 915.848 }, { "epoch": 0.31033611321708365, "grad_norm": 0.4133246839046478, "learning_rate": 0.00016951898734177216, "loss": 0.1982, "num_input_tokens_seen": 571246, "step": 307, "train_runtime": 623.4886, "train_tokens_per_second": 916.209 }, { "epoch": 0.31134698003538036, "grad_norm": 0.36801382899284363, "learning_rate": 0.00016941772151898737, "loss": 0.272, "num_input_tokens_seen": 573048, "step": 308, "train_runtime": 625.1869, "train_tokens_per_second": 916.603 }, { "epoch": 0.312357846853677, "grad_norm": 0.41676491498947144, "learning_rate": 0.00016931645569620254, "loss": 0.2582, "num_input_tokens_seen": 575496, "step": 309, "train_runtime": 627.2635, "train_tokens_per_second": 917.471 }, { "epoch": 0.3133687136719737, "grad_norm": 0.44287529587745667, "learning_rate": 0.00016921518987341773, "loss": 0.2554, "num_input_tokens_seen": 577466, "step": 310, "train_runtime": 629.0362, "train_tokens_per_second": 918.017 }, { "epoch": 0.3143795804902704, "grad_norm": 0.5288241505622864, "learning_rate": 0.00016911392405063292, "loss": 0.2612, "num_input_tokens_seen": 579274, "step": 311, "train_runtime": 630.6707, "train_tokens_per_second": 918.505 }, { "epoch": 0.3153904473085671, "grad_norm": 0.36141201853752136, "learning_rate": 0.0001690126582278481, "loss": 0.2379, "num_input_tokens_seen": 580918, "step": 312, "train_runtime": 632.2878, "train_tokens_per_second": 918.756 }, { "epoch": 0.3164013141268638, "grad_norm": 0.34109199047088623, "learning_rate": 0.0001689113924050633, "loss": 0.2135, "num_input_tokens_seen": 583062, "step": 313, "train_runtime": 634.2596, "train_tokens_per_second": 919.28 }, { "epoch": 0.3174121809451605, "grad_norm": 0.40509626269340515, "learning_rate": 0.0001688101265822785, "loss": 0.1945, "num_input_tokens_seen": 585200, "step": 314, "train_runtime": 636.1207, "train_tokens_per_second": 919.951 }, { "epoch": 0.31842304776345715, "grad_norm": 0.38416141271591187, "learning_rate": 0.00016870886075949368, "loss": 0.1894, "num_input_tokens_seen": 586980, "step": 315, "train_runtime": 637.755, "train_tokens_per_second": 920.385 }, { "epoch": 0.31943391458175385, "grad_norm": 0.4075499176979065, "learning_rate": 0.00016860759493670887, "loss": 0.2793, "num_input_tokens_seen": 589100, "step": 316, "train_runtime": 639.6146, "train_tokens_per_second": 921.023 }, { "epoch": 0.32044478140005056, "grad_norm": 0.3548603355884552, "learning_rate": 0.00016850632911392406, "loss": 0.2055, "num_input_tokens_seen": 591336, "step": 317, "train_runtime": 641.5444, "train_tokens_per_second": 921.738 }, { "epoch": 0.3214556482183472, "grad_norm": 0.4027518332004547, "learning_rate": 0.00016840506329113925, "loss": 0.2338, "num_input_tokens_seen": 593528, "step": 318, "train_runtime": 643.4589, "train_tokens_per_second": 922.402 }, { "epoch": 0.3224665150366439, "grad_norm": 0.4063768684864044, "learning_rate": 0.00016830379746835442, "loss": 0.1914, "num_input_tokens_seen": 595364, "step": 319, "train_runtime": 645.3109, "train_tokens_per_second": 922.6 }, { "epoch": 0.3234773818549406, "grad_norm": 0.41555434465408325, "learning_rate": 0.00016820253164556964, "loss": 0.2672, "num_input_tokens_seen": 597190, "step": 320, "train_runtime": 647.035, "train_tokens_per_second": 922.964 }, { "epoch": 0.3244882486732373, "grad_norm": 0.4873950183391571, "learning_rate": 0.00016810126582278483, "loss": 0.1835, "num_input_tokens_seen": 598648, "step": 321, "train_runtime": 648.6144, "train_tokens_per_second": 922.964 }, { "epoch": 0.325499115491534, "grad_norm": 0.3299708664417267, "learning_rate": 0.000168, "loss": 0.218, "num_input_tokens_seen": 600346, "step": 322, "train_runtime": 650.307, "train_tokens_per_second": 923.173 }, { "epoch": 0.3265099823098307, "grad_norm": 0.4436740577220917, "learning_rate": 0.0001678987341772152, "loss": 0.2922, "num_input_tokens_seen": 601936, "step": 323, "train_runtime": 651.9296, "train_tokens_per_second": 923.314 }, { "epoch": 0.32752084912812734, "grad_norm": 0.39118847250938416, "learning_rate": 0.0001677974683544304, "loss": 0.2583, "num_input_tokens_seen": 604046, "step": 324, "train_runtime": 653.7406, "train_tokens_per_second": 923.984 }, { "epoch": 0.32853171594642405, "grad_norm": 0.34720638394355774, "learning_rate": 0.00016769620253164556, "loss": 0.1586, "num_input_tokens_seen": 605926, "step": 325, "train_runtime": 655.518, "train_tokens_per_second": 924.347 }, { "epoch": 0.32954258276472076, "grad_norm": 0.45301494002342224, "learning_rate": 0.00016759493670886078, "loss": 0.2335, "num_input_tokens_seen": 607350, "step": 326, "train_runtime": 657.1179, "train_tokens_per_second": 924.263 }, { "epoch": 0.3305534495830174, "grad_norm": 0.5036170482635498, "learning_rate": 0.00016749367088607594, "loss": 0.2673, "num_input_tokens_seen": 608644, "step": 327, "train_runtime": 658.6868, "train_tokens_per_second": 924.026 }, { "epoch": 0.3315643164013141, "grad_norm": 0.5227355360984802, "learning_rate": 0.00016739240506329114, "loss": 0.1654, "num_input_tokens_seen": 609744, "step": 328, "train_runtime": 660.2289, "train_tokens_per_second": 923.534 }, { "epoch": 0.3325751832196108, "grad_norm": 0.3550918400287628, "learning_rate": 0.00016729113924050635, "loss": 0.1822, "num_input_tokens_seen": 611858, "step": 329, "train_runtime": 662.079, "train_tokens_per_second": 924.146 }, { "epoch": 0.33358605003790753, "grad_norm": 0.46741363406181335, "learning_rate": 0.00016718987341772152, "loss": 0.2668, "num_input_tokens_seen": 613746, "step": 330, "train_runtime": 663.838, "train_tokens_per_second": 924.542 }, { "epoch": 0.3345969168562042, "grad_norm": 0.42439013719558716, "learning_rate": 0.0001670886075949367, "loss": 0.2303, "num_input_tokens_seen": 615626, "step": 331, "train_runtime": 667.3259, "train_tokens_per_second": 922.527 }, { "epoch": 0.3356077836745009, "grad_norm": 0.3509574830532074, "learning_rate": 0.00016698734177215193, "loss": 0.2095, "num_input_tokens_seen": 618124, "step": 332, "train_runtime": 669.3305, "train_tokens_per_second": 923.496 }, { "epoch": 0.3366186504927976, "grad_norm": 0.39720645546913147, "learning_rate": 0.0001668860759493671, "loss": 0.1346, "num_input_tokens_seen": 619796, "step": 333, "train_runtime": 671.0706, "train_tokens_per_second": 923.593 }, { "epoch": 0.33762951731109425, "grad_norm": 0.36094117164611816, "learning_rate": 0.00016678481012658228, "loss": 0.1887, "num_input_tokens_seen": 621398, "step": 334, "train_runtime": 672.701, "train_tokens_per_second": 923.736 }, { "epoch": 0.33864038412939096, "grad_norm": 0.29542970657348633, "learning_rate": 0.00016668354430379747, "loss": 0.2556, "num_input_tokens_seen": 623336, "step": 335, "train_runtime": 674.4235, "train_tokens_per_second": 924.25 }, { "epoch": 0.33965125094768767, "grad_norm": 0.4342578649520874, "learning_rate": 0.00016658227848101266, "loss": 0.184, "num_input_tokens_seen": 625088, "step": 336, "train_runtime": 676.1745, "train_tokens_per_second": 924.448 }, { "epoch": 0.3406621177659843, "grad_norm": 0.3464232087135315, "learning_rate": 0.00016648101265822785, "loss": 0.2506, "num_input_tokens_seen": 627178, "step": 337, "train_runtime": 678.1014, "train_tokens_per_second": 924.903 }, { "epoch": 0.341672984584281, "grad_norm": 0.4655736982822418, "learning_rate": 0.00016637974683544304, "loss": 0.2721, "num_input_tokens_seen": 629028, "step": 338, "train_runtime": 679.8682, "train_tokens_per_second": 925.221 }, { "epoch": 0.34268385140257773, "grad_norm": 0.3931097090244293, "learning_rate": 0.00016627848101265824, "loss": 0.2022, "num_input_tokens_seen": 630700, "step": 339, "train_runtime": 681.5671, "train_tokens_per_second": 925.367 }, { "epoch": 0.3436947182208744, "grad_norm": 0.3931916654109955, "learning_rate": 0.00016617721518987343, "loss": 0.2413, "num_input_tokens_seen": 632710, "step": 340, "train_runtime": 683.408, "train_tokens_per_second": 925.816 }, { "epoch": 0.3447055850391711, "grad_norm": 0.5007351636886597, "learning_rate": 0.00016607594936708862, "loss": 0.2408, "num_input_tokens_seen": 634168, "step": 341, "train_runtime": 685.0014, "train_tokens_per_second": 925.791 }, { "epoch": 0.3457164518574678, "grad_norm": 0.36407172679901123, "learning_rate": 0.0001659746835443038, "loss": 0.2262, "num_input_tokens_seen": 636054, "step": 342, "train_runtime": 686.7729, "train_tokens_per_second": 926.149 }, { "epoch": 0.34672731867576445, "grad_norm": 0.39440491795539856, "learning_rate": 0.000165873417721519, "loss": 0.194, "num_input_tokens_seen": 638242, "step": 343, "train_runtime": 688.6932, "train_tokens_per_second": 926.744 }, { "epoch": 0.34773818549406116, "grad_norm": 0.45356428623199463, "learning_rate": 0.0001657721518987342, "loss": 0.1776, "num_input_tokens_seen": 640084, "step": 344, "train_runtime": 690.4041, "train_tokens_per_second": 927.115 }, { "epoch": 0.34874905231235787, "grad_norm": 0.47393128275871277, "learning_rate": 0.00016567088607594938, "loss": 0.1357, "num_input_tokens_seen": 641340, "step": 345, "train_runtime": 691.9391, "train_tokens_per_second": 926.873 }, { "epoch": 0.3497599191306545, "grad_norm": 0.5046817064285278, "learning_rate": 0.00016556962025316457, "loss": 0.241, "num_input_tokens_seen": 643024, "step": 346, "train_runtime": 693.5728, "train_tokens_per_second": 927.118 }, { "epoch": 0.3507707859489512, "grad_norm": 0.3809065520763397, "learning_rate": 0.00016546835443037976, "loss": 0.2097, "num_input_tokens_seen": 645680, "step": 347, "train_runtime": 695.7296, "train_tokens_per_second": 928.062 }, { "epoch": 0.35178165276724793, "grad_norm": 0.5797727108001709, "learning_rate": 0.00016536708860759495, "loss": 0.1894, "num_input_tokens_seen": 646868, "step": 348, "train_runtime": 697.2946, "train_tokens_per_second": 927.683 }, { "epoch": 0.3527925195855446, "grad_norm": 0.3871445953845978, "learning_rate": 0.00016526582278481014, "loss": 0.1193, "num_input_tokens_seen": 648398, "step": 349, "train_runtime": 698.9061, "train_tokens_per_second": 927.733 }, { "epoch": 0.3538033864038413, "grad_norm": 0.3448233902454376, "learning_rate": 0.00016516455696202533, "loss": 0.1705, "num_input_tokens_seen": 650210, "step": 350, "train_runtime": 700.6107, "train_tokens_per_second": 928.062 }, { "epoch": 0.354814253222138, "grad_norm": 0.5008251667022705, "learning_rate": 0.0001650632911392405, "loss": 0.1996, "num_input_tokens_seen": 652020, "step": 351, "train_runtime": 702.3609, "train_tokens_per_second": 928.326 }, { "epoch": 0.35582512004043465, "grad_norm": 0.453442245721817, "learning_rate": 0.00016496202531645572, "loss": 0.2222, "num_input_tokens_seen": 653632, "step": 352, "train_runtime": 703.9744, "train_tokens_per_second": 928.488 }, { "epoch": 0.35683598685873136, "grad_norm": 0.46873143315315247, "learning_rate": 0.0001648607594936709, "loss": 0.224, "num_input_tokens_seen": 655572, "step": 353, "train_runtime": 705.6982, "train_tokens_per_second": 928.969 }, { "epoch": 0.35784685367702807, "grad_norm": 0.44376879930496216, "learning_rate": 0.00016475949367088607, "loss": 0.1884, "num_input_tokens_seen": 657532, "step": 354, "train_runtime": 707.5266, "train_tokens_per_second": 929.339 }, { "epoch": 0.3588577204953247, "grad_norm": 0.26693281531333923, "learning_rate": 0.0001646582278481013, "loss": 0.1841, "num_input_tokens_seen": 660468, "step": 355, "train_runtime": 709.8611, "train_tokens_per_second": 930.419 }, { "epoch": 0.3598685873136214, "grad_norm": 0.41272827982902527, "learning_rate": 0.00016455696202531648, "loss": 0.1723, "num_input_tokens_seen": 661950, "step": 356, "train_runtime": 711.4576, "train_tokens_per_second": 930.414 }, { "epoch": 0.36087945413191813, "grad_norm": 0.45240455865859985, "learning_rate": 0.00016445569620253164, "loss": 0.2, "num_input_tokens_seen": 664054, "step": 357, "train_runtime": 713.2613, "train_tokens_per_second": 931.011 }, { "epoch": 0.3618903209502148, "grad_norm": 0.47014230489730835, "learning_rate": 0.00016435443037974686, "loss": 0.147, "num_input_tokens_seen": 665740, "step": 358, "train_runtime": 714.8885, "train_tokens_per_second": 931.25 }, { "epoch": 0.3629011877685115, "grad_norm": 0.44238078594207764, "learning_rate": 0.00016425316455696202, "loss": 0.2292, "num_input_tokens_seen": 667738, "step": 359, "train_runtime": 716.669, "train_tokens_per_second": 931.724 }, { "epoch": 0.3639120545868082, "grad_norm": 0.4482760429382324, "learning_rate": 0.00016415189873417722, "loss": 0.2046, "num_input_tokens_seen": 669706, "step": 360, "train_runtime": 718.5261, "train_tokens_per_second": 932.055 }, { "epoch": 0.36492292140510485, "grad_norm": 0.4080590307712555, "learning_rate": 0.00016405063291139243, "loss": 0.1379, "num_input_tokens_seen": 671454, "step": 361, "train_runtime": 722.292, "train_tokens_per_second": 929.616 }, { "epoch": 0.36593378822340156, "grad_norm": 0.5153780579566956, "learning_rate": 0.0001639493670886076, "loss": 0.302, "num_input_tokens_seen": 673490, "step": 362, "train_runtime": 724.0677, "train_tokens_per_second": 930.148 }, { "epoch": 0.36694465504169826, "grad_norm": 0.492509126663208, "learning_rate": 0.0001638481012658228, "loss": 0.2379, "num_input_tokens_seen": 675348, "step": 363, "train_runtime": 725.8596, "train_tokens_per_second": 930.411 }, { "epoch": 0.36795552185999497, "grad_norm": 0.3708415627479553, "learning_rate": 0.000163746835443038, "loss": 0.1876, "num_input_tokens_seen": 676866, "step": 364, "train_runtime": 727.5376, "train_tokens_per_second": 930.352 }, { "epoch": 0.3689663886782916, "grad_norm": 0.3933420181274414, "learning_rate": 0.00016364556962025317, "loss": 0.1904, "num_input_tokens_seen": 678574, "step": 365, "train_runtime": 729.1914, "train_tokens_per_second": 930.584 }, { "epoch": 0.36997725549658833, "grad_norm": 0.4342649281024933, "learning_rate": 0.00016354430379746836, "loss": 0.3707, "num_input_tokens_seen": 680838, "step": 366, "train_runtime": 731.1776, "train_tokens_per_second": 931.153 }, { "epoch": 0.37098812231488504, "grad_norm": 0.3595677316188812, "learning_rate": 0.00016344303797468355, "loss": 0.3111, "num_input_tokens_seen": 682828, "step": 367, "train_runtime": 732.978, "train_tokens_per_second": 931.58 }, { "epoch": 0.3719989891331817, "grad_norm": 0.48728400468826294, "learning_rate": 0.00016334177215189874, "loss": 0.2889, "num_input_tokens_seen": 684490, "step": 368, "train_runtime": 734.6687, "train_tokens_per_second": 931.699 }, { "epoch": 0.3730098559514784, "grad_norm": 0.47918418049812317, "learning_rate": 0.00016324050632911393, "loss": 0.211, "num_input_tokens_seen": 686330, "step": 369, "train_runtime": 736.4335, "train_tokens_per_second": 931.965 }, { "epoch": 0.3740207227697751, "grad_norm": 0.4765119254589081, "learning_rate": 0.00016313924050632912, "loss": 0.2642, "num_input_tokens_seen": 688430, "step": 370, "train_runtime": 738.2917, "train_tokens_per_second": 932.463 }, { "epoch": 0.37503158958807176, "grad_norm": 0.35585442185401917, "learning_rate": 0.00016303797468354431, "loss": 0.143, "num_input_tokens_seen": 690160, "step": 371, "train_runtime": 739.9946, "train_tokens_per_second": 932.656 }, { "epoch": 0.37604245640636846, "grad_norm": 0.37591856718063354, "learning_rate": 0.00016293670886075948, "loss": 0.1499, "num_input_tokens_seen": 691482, "step": 372, "train_runtime": 741.5746, "train_tokens_per_second": 932.451 }, { "epoch": 0.37705332322466517, "grad_norm": 0.40079328417778015, "learning_rate": 0.0001628354430379747, "loss": 0.2112, "num_input_tokens_seen": 693254, "step": 373, "train_runtime": 743.2675, "train_tokens_per_second": 932.711 }, { "epoch": 0.3780641900429618, "grad_norm": 0.5272864103317261, "learning_rate": 0.0001627341772151899, "loss": 0.2159, "num_input_tokens_seen": 694622, "step": 374, "train_runtime": 744.8578, "train_tokens_per_second": 932.557 }, { "epoch": 0.37907505686125853, "grad_norm": 0.3017108142375946, "learning_rate": 0.00016263291139240505, "loss": 0.3006, "num_input_tokens_seen": 697032, "step": 375, "train_runtime": 746.853, "train_tokens_per_second": 933.292 }, { "epoch": 0.38008592367955524, "grad_norm": 0.35110485553741455, "learning_rate": 0.00016253164556962027, "loss": 0.2897, "num_input_tokens_seen": 698714, "step": 376, "train_runtime": 748.5523, "train_tokens_per_second": 933.42 }, { "epoch": 0.3810967904978519, "grad_norm": 0.4561986029148102, "learning_rate": 0.00016243037974683546, "loss": 0.2057, "num_input_tokens_seen": 700308, "step": 377, "train_runtime": 750.1681, "train_tokens_per_second": 933.535 }, { "epoch": 0.3821076573161486, "grad_norm": 0.35886335372924805, "learning_rate": 0.00016232911392405062, "loss": 0.1541, "num_input_tokens_seen": 701994, "step": 378, "train_runtime": 751.8394, "train_tokens_per_second": 933.702 }, { "epoch": 0.3831185241344453, "grad_norm": 0.3360520899295807, "learning_rate": 0.00016222784810126584, "loss": 0.1871, "num_input_tokens_seen": 703676, "step": 379, "train_runtime": 753.472, "train_tokens_per_second": 933.911 }, { "epoch": 0.38412939095274196, "grad_norm": 0.4519248306751251, "learning_rate": 0.000162126582278481, "loss": 0.1392, "num_input_tokens_seen": 705024, "step": 380, "train_runtime": 755.0632, "train_tokens_per_second": 933.728 }, { "epoch": 0.38514025777103866, "grad_norm": 0.36681482195854187, "learning_rate": 0.0001620253164556962, "loss": 0.2327, "num_input_tokens_seen": 707296, "step": 381, "train_runtime": 757.0505, "train_tokens_per_second": 934.278 }, { "epoch": 0.38615112458933537, "grad_norm": 0.5280442833900452, "learning_rate": 0.00016192405063291141, "loss": 0.1413, "num_input_tokens_seen": 708956, "step": 382, "train_runtime": 758.7625, "train_tokens_per_second": 934.358 }, { "epoch": 0.387161991407632, "grad_norm": 0.521888792514801, "learning_rate": 0.00016182278481012658, "loss": 0.1752, "num_input_tokens_seen": 710732, "step": 383, "train_runtime": 760.5251, "train_tokens_per_second": 934.528 }, { "epoch": 0.38817285822592873, "grad_norm": 0.5253322720527649, "learning_rate": 0.00016172151898734177, "loss": 0.2107, "num_input_tokens_seen": 712236, "step": 384, "train_runtime": 762.1972, "train_tokens_per_second": 934.451 }, { "epoch": 0.38918372504422544, "grad_norm": 0.49969637393951416, "learning_rate": 0.000161620253164557, "loss": 0.1558, "num_input_tokens_seen": 713692, "step": 385, "train_runtime": 763.8581, "train_tokens_per_second": 934.325 }, { "epoch": 0.3901945918625221, "grad_norm": 0.4234883487224579, "learning_rate": 0.00016151898734177215, "loss": 0.2551, "num_input_tokens_seen": 715676, "step": 386, "train_runtime": 765.6249, "train_tokens_per_second": 934.761 }, { "epoch": 0.3912054586808188, "grad_norm": 0.40212076902389526, "learning_rate": 0.00016141772151898734, "loss": 0.2003, "num_input_tokens_seen": 717782, "step": 387, "train_runtime": 767.426, "train_tokens_per_second": 935.311 }, { "epoch": 0.3922163254991155, "grad_norm": 0.471465528011322, "learning_rate": 0.00016131645569620253, "loss": 0.1965, "num_input_tokens_seen": 719358, "step": 388, "train_runtime": 769.0566, "train_tokens_per_second": 935.377 }, { "epoch": 0.39322719231741216, "grad_norm": 0.3209170401096344, "learning_rate": 0.00016121518987341772, "loss": 0.2519, "num_input_tokens_seen": 721732, "step": 389, "train_runtime": 771.0593, "train_tokens_per_second": 936.027 }, { "epoch": 0.39423805913570886, "grad_norm": 0.4539428949356079, "learning_rate": 0.00016111392405063291, "loss": 0.3083, "num_input_tokens_seen": 723654, "step": 390, "train_runtime": 772.7774, "train_tokens_per_second": 936.433 }, { "epoch": 0.39524892595400557, "grad_norm": 0.33022862672805786, "learning_rate": 0.0001610126582278481, "loss": 0.1552, "num_input_tokens_seen": 725402, "step": 391, "train_runtime": 777.0095, "train_tokens_per_second": 933.582 }, { "epoch": 0.3962597927723022, "grad_norm": 0.43771734833717346, "learning_rate": 0.0001609113924050633, "loss": 0.2918, "num_input_tokens_seen": 727426, "step": 392, "train_runtime": 778.864, "train_tokens_per_second": 933.958 }, { "epoch": 0.39727065959059893, "grad_norm": 0.429280161857605, "learning_rate": 0.00016081012658227849, "loss": 0.2256, "num_input_tokens_seen": 729244, "step": 393, "train_runtime": 780.5887, "train_tokens_per_second": 934.223 }, { "epoch": 0.39828152640889564, "grad_norm": 0.4618457853794098, "learning_rate": 0.00016070886075949368, "loss": 0.2437, "num_input_tokens_seen": 731254, "step": 394, "train_runtime": 782.3836, "train_tokens_per_second": 934.649 }, { "epoch": 0.39929239322719234, "grad_norm": 0.43775153160095215, "learning_rate": 0.00016060759493670887, "loss": 0.3196, "num_input_tokens_seen": 732820, "step": 395, "train_runtime": 784.0466, "train_tokens_per_second": 934.664 }, { "epoch": 0.400303260045489, "grad_norm": 0.35830020904541016, "learning_rate": 0.00016050632911392406, "loss": 0.2727, "num_input_tokens_seen": 734410, "step": 396, "train_runtime": 785.7472, "train_tokens_per_second": 934.664 }, { "epoch": 0.400303260045489, "eval_loss": 0.20691320300102234, "eval_runtime": 61.343, "eval_samples_per_second": 14.329, "eval_steps_per_second": 7.173, "num_input_tokens_seen": 734410, "step": 396 }, { "epoch": 0.4013141268637857, "grad_norm": 0.2852393388748169, "learning_rate": 0.00016040506329113925, "loss": 0.1643, "num_input_tokens_seen": 736226, "step": 397, "train_runtime": 848.7979, "train_tokens_per_second": 867.375 }, { "epoch": 0.4023249936820824, "grad_norm": 0.40798038244247437, "learning_rate": 0.00016030379746835444, "loss": 0.2066, "num_input_tokens_seen": 738040, "step": 398, "train_runtime": 850.5616, "train_tokens_per_second": 867.709 }, { "epoch": 0.40333586050037906, "grad_norm": 0.36145034432411194, "learning_rate": 0.00016020253164556963, "loss": 0.1648, "num_input_tokens_seen": 739850, "step": 399, "train_runtime": 852.3272, "train_tokens_per_second": 868.035 }, { "epoch": 0.40434672731867577, "grad_norm": 0.34595760703086853, "learning_rate": 0.00016010126582278482, "loss": 0.2276, "num_input_tokens_seen": 741854, "step": 400, "train_runtime": 854.192, "train_tokens_per_second": 868.486 }, { "epoch": 0.4053575941369725, "grad_norm": 0.3657154142856598, "learning_rate": 0.00016, "loss": 0.2051, "num_input_tokens_seen": 743758, "step": 401, "train_runtime": 855.8502, "train_tokens_per_second": 869.028 }, { "epoch": 0.40636846095526913, "grad_norm": 0.4583825469017029, "learning_rate": 0.0001598987341772152, "loss": 0.2541, "num_input_tokens_seen": 745548, "step": 402, "train_runtime": 857.5461, "train_tokens_per_second": 869.397 }, { "epoch": 0.40737932777356584, "grad_norm": 0.47932156920433044, "learning_rate": 0.0001597974683544304, "loss": 0.2077, "num_input_tokens_seen": 747458, "step": 403, "train_runtime": 859.3099, "train_tokens_per_second": 869.835 }, { "epoch": 0.40839019459186254, "grad_norm": 0.428975909948349, "learning_rate": 0.00015969620253164556, "loss": 0.1823, "num_input_tokens_seen": 749572, "step": 404, "train_runtime": 861.1996, "train_tokens_per_second": 870.381 }, { "epoch": 0.4094010614101592, "grad_norm": 0.44719934463500977, "learning_rate": 0.00015959493670886078, "loss": 0.2358, "num_input_tokens_seen": 751616, "step": 405, "train_runtime": 863.0914, "train_tokens_per_second": 870.842 }, { "epoch": 0.4104119282284559, "grad_norm": 0.4692244231700897, "learning_rate": 0.00015949367088607597, "loss": 0.1761, "num_input_tokens_seen": 753438, "step": 406, "train_runtime": 864.7987, "train_tokens_per_second": 871.229 }, { "epoch": 0.4114227950467526, "grad_norm": 0.43564677238464355, "learning_rate": 0.00015939240506329113, "loss": 0.2654, "num_input_tokens_seen": 755350, "step": 407, "train_runtime": 866.531, "train_tokens_per_second": 871.694 }, { "epoch": 0.41243366186504926, "grad_norm": 0.4037442207336426, "learning_rate": 0.00015929113924050635, "loss": 0.1779, "num_input_tokens_seen": 757048, "step": 408, "train_runtime": 868.1611, "train_tokens_per_second": 872.013 }, { "epoch": 0.41344452868334597, "grad_norm": 0.5000036358833313, "learning_rate": 0.00015918987341772154, "loss": 0.3085, "num_input_tokens_seen": 759332, "step": 409, "train_runtime": 870.0899, "train_tokens_per_second": 872.705 }, { "epoch": 0.4144553955016427, "grad_norm": 0.446573406457901, "learning_rate": 0.0001590886075949367, "loss": 0.1944, "num_input_tokens_seen": 761534, "step": 410, "train_runtime": 872.027, "train_tokens_per_second": 873.292 }, { "epoch": 0.41546626231993933, "grad_norm": 0.3965902030467987, "learning_rate": 0.00015898734177215192, "loss": 0.1915, "num_input_tokens_seen": 763376, "step": 411, "train_runtime": 873.7386, "train_tokens_per_second": 873.689 }, { "epoch": 0.41647712913823604, "grad_norm": 0.25173959136009216, "learning_rate": 0.00015888607594936709, "loss": 0.2171, "num_input_tokens_seen": 766474, "step": 412, "train_runtime": 876.1057, "train_tokens_per_second": 874.865 }, { "epoch": 0.41748799595653274, "grad_norm": 0.2912166714668274, "learning_rate": 0.00015878481012658228, "loss": 0.195, "num_input_tokens_seen": 768510, "step": 413, "train_runtime": 877.9189, "train_tokens_per_second": 875.377 }, { "epoch": 0.4184988627748294, "grad_norm": 0.5279189944267273, "learning_rate": 0.0001586835443037975, "loss": 0.2741, "num_input_tokens_seen": 770568, "step": 414, "train_runtime": 879.7505, "train_tokens_per_second": 875.894 }, { "epoch": 0.4195097295931261, "grad_norm": 0.4628985822200775, "learning_rate": 0.00015858227848101266, "loss": 0.1722, "num_input_tokens_seen": 772174, "step": 415, "train_runtime": 881.4115, "train_tokens_per_second": 876.065 }, { "epoch": 0.4205205964114228, "grad_norm": 0.4825090765953064, "learning_rate": 0.00015848101265822785, "loss": 0.2368, "num_input_tokens_seen": 773982, "step": 416, "train_runtime": 883.1648, "train_tokens_per_second": 876.373 }, { "epoch": 0.42153146322971946, "grad_norm": 0.3585876524448395, "learning_rate": 0.00015837974683544307, "loss": 0.1864, "num_input_tokens_seen": 776102, "step": 417, "train_runtime": 885.0508, "train_tokens_per_second": 876.901 }, { "epoch": 0.42254233004801617, "grad_norm": 0.34322065114974976, "learning_rate": 0.00015827848101265823, "loss": 0.1826, "num_input_tokens_seen": 777932, "step": 418, "train_runtime": 886.7617, "train_tokens_per_second": 877.273 }, { "epoch": 0.4235531968663129, "grad_norm": 0.43742963671684265, "learning_rate": 0.00015817721518987342, "loss": 0.1833, "num_input_tokens_seen": 779846, "step": 419, "train_runtime": 888.5002, "train_tokens_per_second": 877.711 }, { "epoch": 0.4245640636846095, "grad_norm": 0.398015558719635, "learning_rate": 0.0001580759493670886, "loss": 0.2383, "num_input_tokens_seen": 781654, "step": 420, "train_runtime": 890.2081, "train_tokens_per_second": 878.058 }, { "epoch": 0.42557493050290623, "grad_norm": 0.4031146764755249, "learning_rate": 0.0001579746835443038, "loss": 0.1862, "num_input_tokens_seen": 783354, "step": 421, "train_runtime": 893.8915, "train_tokens_per_second": 876.341 }, { "epoch": 0.42658579732120294, "grad_norm": 0.35829827189445496, "learning_rate": 0.000157873417721519, "loss": 0.1866, "num_input_tokens_seen": 785382, "step": 422, "train_runtime": 895.7333, "train_tokens_per_second": 876.803 }, { "epoch": 0.4275966641394996, "grad_norm": 0.3397190272808075, "learning_rate": 0.00015777215189873418, "loss": 0.117, "num_input_tokens_seen": 787096, "step": 423, "train_runtime": 897.5052, "train_tokens_per_second": 876.982 }, { "epoch": 0.4286075309577963, "grad_norm": 0.39190611243247986, "learning_rate": 0.00015767088607594938, "loss": 0.1694, "num_input_tokens_seen": 788940, "step": 424, "train_runtime": 899.2529, "train_tokens_per_second": 877.328 }, { "epoch": 0.429618397776093, "grad_norm": 0.3337407112121582, "learning_rate": 0.00015756962025316457, "loss": 0.2326, "num_input_tokens_seen": 791164, "step": 425, "train_runtime": 901.1837, "train_tokens_per_second": 877.916 }, { "epoch": 0.4306292645943897, "grad_norm": 0.46486571431159973, "learning_rate": 0.00015746835443037976, "loss": 0.2316, "num_input_tokens_seen": 792874, "step": 426, "train_runtime": 902.8159, "train_tokens_per_second": 878.223 }, { "epoch": 0.43164013141268637, "grad_norm": 0.4039671719074249, "learning_rate": 0.00015736708860759495, "loss": 0.1757, "num_input_tokens_seen": 794330, "step": 427, "train_runtime": 904.4436, "train_tokens_per_second": 878.253 }, { "epoch": 0.4326509982309831, "grad_norm": 0.36065515875816345, "learning_rate": 0.0001572658227848101, "loss": 0.1402, "num_input_tokens_seen": 796094, "step": 428, "train_runtime": 906.134, "train_tokens_per_second": 878.561 }, { "epoch": 0.4336618650492798, "grad_norm": 0.3220762014389038, "learning_rate": 0.00015716455696202533, "loss": 0.1747, "num_input_tokens_seen": 798060, "step": 429, "train_runtime": 907.8011, "train_tokens_per_second": 879.113 }, { "epoch": 0.43467273186757643, "grad_norm": 0.42454615235328674, "learning_rate": 0.00015706329113924052, "loss": 0.2688, "num_input_tokens_seen": 799862, "step": 430, "train_runtime": 909.4977, "train_tokens_per_second": 879.455 }, { "epoch": 0.43568359868587314, "grad_norm": 0.5222974419593811, "learning_rate": 0.00015696202531645568, "loss": 0.2158, "num_input_tokens_seen": 801506, "step": 431, "train_runtime": 911.1798, "train_tokens_per_second": 879.635 }, { "epoch": 0.43669446550416985, "grad_norm": 0.38617977499961853, "learning_rate": 0.0001568607594936709, "loss": 0.1557, "num_input_tokens_seen": 804264, "step": 432, "train_runtime": 913.3571, "train_tokens_per_second": 880.558 }, { "epoch": 0.4377053323224665, "grad_norm": 0.40649381279945374, "learning_rate": 0.0001567594936708861, "loss": 0.194, "num_input_tokens_seen": 806084, "step": 433, "train_runtime": 915.0544, "train_tokens_per_second": 880.914 }, { "epoch": 0.4387161991407632, "grad_norm": 0.5631338357925415, "learning_rate": 0.00015665822784810126, "loss": 0.2402, "num_input_tokens_seen": 807584, "step": 434, "train_runtime": 916.6591, "train_tokens_per_second": 881.008 }, { "epoch": 0.4397270659590599, "grad_norm": 0.4309951663017273, "learning_rate": 0.00015655696202531647, "loss": 0.3269, "num_input_tokens_seen": 809506, "step": 435, "train_runtime": 918.4248, "train_tokens_per_second": 881.407 }, { "epoch": 0.44073793277735657, "grad_norm": 0.35738056898117065, "learning_rate": 0.00015645569620253164, "loss": 0.1802, "num_input_tokens_seen": 811374, "step": 436, "train_runtime": 920.0792, "train_tokens_per_second": 881.852 }, { "epoch": 0.4417487995956533, "grad_norm": 0.462649405002594, "learning_rate": 0.00015635443037974683, "loss": 0.2103, "num_input_tokens_seen": 813486, "step": 437, "train_runtime": 921.9783, "train_tokens_per_second": 882.327 }, { "epoch": 0.44275966641395, "grad_norm": 0.29911482334136963, "learning_rate": 0.00015625316455696205, "loss": 0.1508, "num_input_tokens_seen": 815772, "step": 438, "train_runtime": 923.9162, "train_tokens_per_second": 882.95 }, { "epoch": 0.44377053323224663, "grad_norm": 0.4340844452381134, "learning_rate": 0.0001561518987341772, "loss": 0.2338, "num_input_tokens_seen": 818164, "step": 439, "train_runtime": 925.9139, "train_tokens_per_second": 883.629 }, { "epoch": 0.44478140005054334, "grad_norm": 0.4801517426967621, "learning_rate": 0.0001560506329113924, "loss": 0.185, "num_input_tokens_seen": 820120, "step": 440, "train_runtime": 927.7473, "train_tokens_per_second": 883.991 }, { "epoch": 0.44579226686884005, "grad_norm": 0.4134570062160492, "learning_rate": 0.00015594936708860762, "loss": 0.3063, "num_input_tokens_seen": 821738, "step": 441, "train_runtime": 929.4355, "train_tokens_per_second": 884.126 }, { "epoch": 0.4468031336871367, "grad_norm": 0.3586715757846832, "learning_rate": 0.00015584810126582278, "loss": 0.2401, "num_input_tokens_seen": 823640, "step": 442, "train_runtime": 931.1808, "train_tokens_per_second": 884.511 }, { "epoch": 0.4478140005054334, "grad_norm": 0.4239972233772278, "learning_rate": 0.00015574683544303797, "loss": 0.2167, "num_input_tokens_seen": 825460, "step": 443, "train_runtime": 933.0131, "train_tokens_per_second": 884.725 }, { "epoch": 0.4488248673237301, "grad_norm": 0.3098328113555908, "learning_rate": 0.00015564556962025317, "loss": 0.2958, "num_input_tokens_seen": 827636, "step": 444, "train_runtime": 934.8758, "train_tokens_per_second": 885.29 }, { "epoch": 0.44983573414202677, "grad_norm": 0.3603465259075165, "learning_rate": 0.00015554430379746836, "loss": 0.2206, "num_input_tokens_seen": 829770, "step": 445, "train_runtime": 936.6778, "train_tokens_per_second": 885.865 }, { "epoch": 0.4508466009603235, "grad_norm": 0.31367743015289307, "learning_rate": 0.00015544303797468355, "loss": 0.2102, "num_input_tokens_seen": 831986, "step": 446, "train_runtime": 938.6113, "train_tokens_per_second": 886.401 }, { "epoch": 0.4518574677786202, "grad_norm": 0.4784441888332367, "learning_rate": 0.00015534177215189874, "loss": 0.2591, "num_input_tokens_seen": 833484, "step": 447, "train_runtime": 940.2268, "train_tokens_per_second": 886.471 }, { "epoch": 0.45286833459691683, "grad_norm": 0.3459112346172333, "learning_rate": 0.00015524050632911393, "loss": 0.3216, "num_input_tokens_seen": 835392, "step": 448, "train_runtime": 942.015, "train_tokens_per_second": 886.814 }, { "epoch": 0.45387920141521354, "grad_norm": 0.302502304315567, "learning_rate": 0.00015513924050632912, "loss": 0.141, "num_input_tokens_seen": 837616, "step": 449, "train_runtime": 943.9455, "train_tokens_per_second": 887.356 }, { "epoch": 0.45489006823351025, "grad_norm": 0.33230262994766235, "learning_rate": 0.0001550379746835443, "loss": 0.2712, "num_input_tokens_seen": 840092, "step": 450, "train_runtime": 945.9858, "train_tokens_per_second": 888.06 }, { "epoch": 0.4559009350518069, "grad_norm": 0.2827284634113312, "learning_rate": 0.0001549367088607595, "loss": 0.1218, "num_input_tokens_seen": 842154, "step": 451, "train_runtime": 950.0303, "train_tokens_per_second": 886.45 }, { "epoch": 0.4569118018701036, "grad_norm": 0.35446277260780334, "learning_rate": 0.0001548354430379747, "loss": 0.238, "num_input_tokens_seen": 844514, "step": 452, "train_runtime": 952.0426, "train_tokens_per_second": 887.055 }, { "epoch": 0.4579226686884003, "grad_norm": 0.3898954689502716, "learning_rate": 0.00015473417721518988, "loss": 0.2343, "num_input_tokens_seen": 846476, "step": 453, "train_runtime": 953.8182, "train_tokens_per_second": 887.461 }, { "epoch": 0.45893353550669697, "grad_norm": 0.5028534531593323, "learning_rate": 0.00015463291139240507, "loss": 0.2647, "num_input_tokens_seen": 848444, "step": 454, "train_runtime": 955.6586, "train_tokens_per_second": 887.811 }, { "epoch": 0.4599444023249937, "grad_norm": 0.45474883913993835, "learning_rate": 0.00015453164556962026, "loss": 0.2045, "num_input_tokens_seen": 850126, "step": 455, "train_runtime": 957.3945, "train_tokens_per_second": 887.958 }, { "epoch": 0.4609552691432904, "grad_norm": 0.3534106910228729, "learning_rate": 0.00015443037974683546, "loss": 0.143, "num_input_tokens_seen": 851994, "step": 456, "train_runtime": 959.161, "train_tokens_per_second": 888.27 }, { "epoch": 0.4619661359615871, "grad_norm": 0.392352819442749, "learning_rate": 0.00015432911392405065, "loss": 0.2864, "num_input_tokens_seen": 854360, "step": 457, "train_runtime": 961.1696, "train_tokens_per_second": 888.875 }, { "epoch": 0.46297700277988374, "grad_norm": 0.481840044260025, "learning_rate": 0.00015422784810126584, "loss": 0.3185, "num_input_tokens_seen": 856634, "step": 458, "train_runtime": 963.1613, "train_tokens_per_second": 889.398 }, { "epoch": 0.46398786959818045, "grad_norm": 0.4527128040790558, "learning_rate": 0.00015412658227848103, "loss": 0.1872, "num_input_tokens_seen": 858330, "step": 459, "train_runtime": 964.7923, "train_tokens_per_second": 889.653 }, { "epoch": 0.46499873641647715, "grad_norm": 0.5048484206199646, "learning_rate": 0.0001540253164556962, "loss": 0.2681, "num_input_tokens_seen": 860108, "step": 460, "train_runtime": 966.4711, "train_tokens_per_second": 889.947 }, { "epoch": 0.4660096032347738, "grad_norm": 0.49292078614234924, "learning_rate": 0.0001539240506329114, "loss": 0.3287, "num_input_tokens_seen": 861860, "step": 461, "train_runtime": 968.1427, "train_tokens_per_second": 890.22 }, { "epoch": 0.4670204700530705, "grad_norm": 0.41087356209754944, "learning_rate": 0.0001538227848101266, "loss": 0.1956, "num_input_tokens_seen": 863356, "step": 462, "train_runtime": 969.7452, "train_tokens_per_second": 890.292 }, { "epoch": 0.4680313368713672, "grad_norm": 0.3939993977546692, "learning_rate": 0.00015372151898734176, "loss": 0.2667, "num_input_tokens_seen": 865252, "step": 463, "train_runtime": 971.5792, "train_tokens_per_second": 890.563 }, { "epoch": 0.4690422036896639, "grad_norm": 0.3936285972595215, "learning_rate": 0.00015362025316455698, "loss": 0.2168, "num_input_tokens_seen": 867254, "step": 464, "train_runtime": 973.3133, "train_tokens_per_second": 891.033 }, { "epoch": 0.4700530705079606, "grad_norm": 0.4447113871574402, "learning_rate": 0.00015351898734177217, "loss": 0.2208, "num_input_tokens_seen": 868816, "step": 465, "train_runtime": 974.9772, "train_tokens_per_second": 891.114 }, { "epoch": 0.4710639373262573, "grad_norm": 0.32850441336631775, "learning_rate": 0.00015341772151898734, "loss": 0.238, "num_input_tokens_seen": 870760, "step": 466, "train_runtime": 976.7589, "train_tokens_per_second": 891.479 }, { "epoch": 0.47207480414455394, "grad_norm": 0.4373947083950043, "learning_rate": 0.00015331645569620255, "loss": 0.1596, "num_input_tokens_seen": 872386, "step": 467, "train_runtime": 978.3926, "train_tokens_per_second": 891.652 }, { "epoch": 0.47308567096285065, "grad_norm": 0.34838488698005676, "learning_rate": 0.00015321518987341772, "loss": 0.23, "num_input_tokens_seen": 874220, "step": 468, "train_runtime": 980.1526, "train_tokens_per_second": 891.922 }, { "epoch": 0.47409653778114735, "grad_norm": 0.3535575866699219, "learning_rate": 0.0001531139240506329, "loss": 0.1748, "num_input_tokens_seen": 876046, "step": 469, "train_runtime": 981.9579, "train_tokens_per_second": 892.142 }, { "epoch": 0.475107404599444, "grad_norm": 0.4254951477050781, "learning_rate": 0.00015301265822784813, "loss": 0.1954, "num_input_tokens_seen": 877734, "step": 470, "train_runtime": 983.6426, "train_tokens_per_second": 892.33 }, { "epoch": 0.4761182714177407, "grad_norm": 0.4093538522720337, "learning_rate": 0.0001529113924050633, "loss": 0.2269, "num_input_tokens_seen": 879312, "step": 471, "train_runtime": 985.3279, "train_tokens_per_second": 892.406 }, { "epoch": 0.4771291382360374, "grad_norm": 0.42421266436576843, "learning_rate": 0.00015281012658227848, "loss": 0.1913, "num_input_tokens_seen": 881290, "step": 472, "train_runtime": 987.2085, "train_tokens_per_second": 892.709 }, { "epoch": 0.47814000505433407, "grad_norm": 0.47526732087135315, "learning_rate": 0.0001527088607594937, "loss": 0.2237, "num_input_tokens_seen": 882800, "step": 473, "train_runtime": 988.825, "train_tokens_per_second": 892.777 }, { "epoch": 0.4791508718726308, "grad_norm": 0.42744213342666626, "learning_rate": 0.00015260759493670886, "loss": 0.1693, "num_input_tokens_seen": 884462, "step": 474, "train_runtime": 990.4888, "train_tokens_per_second": 892.955 }, { "epoch": 0.4801617386909275, "grad_norm": 0.4059623181819916, "learning_rate": 0.00015250632911392405, "loss": 0.172, "num_input_tokens_seen": 886444, "step": 475, "train_runtime": 992.2762, "train_tokens_per_second": 893.344 }, { "epoch": 0.48117260550922414, "grad_norm": 0.4145307242870331, "learning_rate": 0.00015240506329113924, "loss": 0.2311, "num_input_tokens_seen": 888522, "step": 476, "train_runtime": 994.1315, "train_tokens_per_second": 893.767 }, { "epoch": 0.48218347232752085, "grad_norm": 0.4267613887786865, "learning_rate": 0.00015230379746835444, "loss": 0.1474, "num_input_tokens_seen": 890008, "step": 477, "train_runtime": 995.7988, "train_tokens_per_second": 893.763 }, { "epoch": 0.48319433914581755, "grad_norm": 0.30390217900276184, "learning_rate": 0.00015220253164556963, "loss": 0.3236, "num_input_tokens_seen": 892472, "step": 478, "train_runtime": 997.83, "train_tokens_per_second": 894.413 }, { "epoch": 0.4842052059641142, "grad_norm": 0.4135509729385376, "learning_rate": 0.00015210126582278482, "loss": 0.1404, "num_input_tokens_seen": 894160, "step": 479, "train_runtime": 999.5224, "train_tokens_per_second": 894.587 }, { "epoch": 0.4852160727824109, "grad_norm": 0.422590047121048, "learning_rate": 0.000152, "loss": 0.216, "num_input_tokens_seen": 896218, "step": 480, "train_runtime": 1001.3637, "train_tokens_per_second": 894.998 }, { "epoch": 0.4862269396007076, "grad_norm": 0.45324161648750305, "learning_rate": 0.0001518987341772152, "loss": 0.1877, "num_input_tokens_seen": 898014, "step": 481, "train_runtime": 1005.1959, "train_tokens_per_second": 893.372 }, { "epoch": 0.48723780641900427, "grad_norm": 0.3673161566257477, "learning_rate": 0.0001517974683544304, "loss": 0.1691, "num_input_tokens_seen": 900284, "step": 482, "train_runtime": 1007.1287, "train_tokens_per_second": 893.912 }, { "epoch": 0.488248673237301, "grad_norm": 0.3802099823951721, "learning_rate": 0.00015169620253164558, "loss": 0.2305, "num_input_tokens_seen": 902464, "step": 483, "train_runtime": 1009.0475, "train_tokens_per_second": 894.372 }, { "epoch": 0.4892595400555977, "grad_norm": 0.4809756577014923, "learning_rate": 0.00015159493670886074, "loss": 0.2301, "num_input_tokens_seen": 904160, "step": 484, "train_runtime": 1010.6663, "train_tokens_per_second": 894.618 }, { "epoch": 0.49027040687389434, "grad_norm": 0.2805626392364502, "learning_rate": 0.00015149367088607596, "loss": 0.2022, "num_input_tokens_seen": 905996, "step": 485, "train_runtime": 1012.3667, "train_tokens_per_second": 894.929 }, { "epoch": 0.49128127369219105, "grad_norm": 0.37523695826530457, "learning_rate": 0.00015139240506329115, "loss": 0.1751, "num_input_tokens_seen": 907368, "step": 486, "train_runtime": 1013.9526, "train_tokens_per_second": 894.882 }, { "epoch": 0.49229214051048775, "grad_norm": 0.4012540876865387, "learning_rate": 0.00015129113924050632, "loss": 0.1721, "num_input_tokens_seen": 909380, "step": 487, "train_runtime": 1015.7416, "train_tokens_per_second": 895.287 }, { "epoch": 0.49330300732878446, "grad_norm": 0.6578808426856995, "learning_rate": 0.00015118987341772154, "loss": 0.3186, "num_input_tokens_seen": 911348, "step": 488, "train_runtime": 1017.5278, "train_tokens_per_second": 895.649 }, { "epoch": 0.4943138741470811, "grad_norm": 0.3889693319797516, "learning_rate": 0.00015108860759493673, "loss": 0.1356, "num_input_tokens_seen": 913306, "step": 489, "train_runtime": 1019.2522, "train_tokens_per_second": 896.055 }, { "epoch": 0.4953247409653778, "grad_norm": 0.6702691912651062, "learning_rate": 0.0001509873417721519, "loss": 0.1721, "num_input_tokens_seen": 915058, "step": 490, "train_runtime": 1020.9492, "train_tokens_per_second": 896.282 }, { "epoch": 0.4963356077836745, "grad_norm": 0.4354226589202881, "learning_rate": 0.0001508860759493671, "loss": 0.1891, "num_input_tokens_seen": 916702, "step": 491, "train_runtime": 1022.6346, "train_tokens_per_second": 896.412 }, { "epoch": 0.4973464746019712, "grad_norm": 0.5096386671066284, "learning_rate": 0.00015078481012658227, "loss": 0.1441, "num_input_tokens_seen": 918266, "step": 492, "train_runtime": 1024.3221, "train_tokens_per_second": 896.462 }, { "epoch": 0.4983573414202679, "grad_norm": 0.45088422298431396, "learning_rate": 0.00015068354430379746, "loss": 0.2398, "num_input_tokens_seen": 920190, "step": 493, "train_runtime": 1026.1133, "train_tokens_per_second": 896.772 }, { "epoch": 0.4993682082385646, "grad_norm": 0.4552615284919739, "learning_rate": 0.00015058227848101268, "loss": 0.2524, "num_input_tokens_seen": 921704, "step": 494, "train_runtime": 1027.7338, "train_tokens_per_second": 896.831 }, { "epoch": 0.5003790750568613, "grad_norm": 0.4810153543949127, "learning_rate": 0.00015048101265822784, "loss": 0.2148, "num_input_tokens_seen": 923178, "step": 495, "train_runtime": 1029.3314, "train_tokens_per_second": 896.871 }, { "epoch": 0.501389941875158, "grad_norm": 0.4851894974708557, "learning_rate": 0.00015037974683544303, "loss": 0.3121, "num_input_tokens_seen": 925008, "step": 496, "train_runtime": 1031.111, "train_tokens_per_second": 897.098 }, { "epoch": 0.5024008086934546, "grad_norm": 0.4135304391384125, "learning_rate": 0.00015027848101265825, "loss": 0.2264, "num_input_tokens_seen": 926962, "step": 497, "train_runtime": 1032.8891, "train_tokens_per_second": 897.446 }, { "epoch": 0.5034116755117514, "grad_norm": 0.3830285966396332, "learning_rate": 0.00015017721518987342, "loss": 0.1614, "num_input_tokens_seen": 928622, "step": 498, "train_runtime": 1034.5809, "train_tokens_per_second": 897.583 }, { "epoch": 0.504422542330048, "grad_norm": 0.36824968457221985, "learning_rate": 0.0001500759493670886, "loss": 0.1645, "num_input_tokens_seen": 930538, "step": 499, "train_runtime": 1036.2947, "train_tokens_per_second": 897.947 }, { "epoch": 0.5054334091483447, "grad_norm": 0.32907575368881226, "learning_rate": 0.0001499746835443038, "loss": 0.1928, "num_input_tokens_seen": 932480, "step": 500, "train_runtime": 1038.091, "train_tokens_per_second": 898.264 }, { "epoch": 0.5064442759666414, "grad_norm": 0.43304961919784546, "learning_rate": 0.000149873417721519, "loss": 0.1576, "num_input_tokens_seen": 934090, "step": 501, "train_runtime": 1039.7844, "train_tokens_per_second": 898.35 }, { "epoch": 0.5074551427849381, "grad_norm": 0.45645779371261597, "learning_rate": 0.00014977215189873418, "loss": 0.1772, "num_input_tokens_seen": 935766, "step": 502, "train_runtime": 1041.4731, "train_tokens_per_second": 898.502 }, { "epoch": 0.5084660096032347, "grad_norm": 0.38893789052963257, "learning_rate": 0.00014967088607594937, "loss": 0.1828, "num_input_tokens_seen": 937732, "step": 503, "train_runtime": 1043.2656, "train_tokens_per_second": 898.843 }, { "epoch": 0.5094768764215315, "grad_norm": 0.3733377456665039, "learning_rate": 0.00014956962025316456, "loss": 0.2014, "num_input_tokens_seen": 939214, "step": 504, "train_runtime": 1044.871, "train_tokens_per_second": 898.88 }, { "epoch": 0.5104877432398282, "grad_norm": 0.3456538915634155, "learning_rate": 0.00014946835443037975, "loss": 0.1535, "num_input_tokens_seen": 941428, "step": 505, "train_runtime": 1046.752, "train_tokens_per_second": 899.38 }, { "epoch": 0.5114986100581248, "grad_norm": 0.4836580157279968, "learning_rate": 0.00014936708860759494, "loss": 0.2011, "num_input_tokens_seen": 943318, "step": 506, "train_runtime": 1048.5512, "train_tokens_per_second": 899.639 }, { "epoch": 0.5125094768764216, "grad_norm": 0.41217049956321716, "learning_rate": 0.00014926582278481013, "loss": 0.1694, "num_input_tokens_seen": 945338, "step": 507, "train_runtime": 1050.2881, "train_tokens_per_second": 900.075 }, { "epoch": 0.5135203436947182, "grad_norm": 0.38519519567489624, "learning_rate": 0.00014916455696202532, "loss": 0.1512, "num_input_tokens_seen": 947502, "step": 508, "train_runtime": 1052.1162, "train_tokens_per_second": 900.568 }, { "epoch": 0.5145312105130149, "grad_norm": 0.45736628770828247, "learning_rate": 0.00014906329113924052, "loss": 0.3374, "num_input_tokens_seen": 949186, "step": 509, "train_runtime": 1053.8219, "train_tokens_per_second": 900.708 }, { "epoch": 0.5155420773313116, "grad_norm": 0.3352411389350891, "learning_rate": 0.0001489620253164557, "loss": 0.1256, "num_input_tokens_seen": 951300, "step": 510, "train_runtime": 1055.6844, "train_tokens_per_second": 901.122 }, { "epoch": 0.5165529441496083, "grad_norm": 0.36706387996673584, "learning_rate": 0.0001488607594936709, "loss": 0.1673, "num_input_tokens_seen": 953168, "step": 511, "train_runtime": 1059.1365, "train_tokens_per_second": 899.948 }, { "epoch": 0.5175638109679049, "grad_norm": 0.3382917642593384, "learning_rate": 0.0001487594936708861, "loss": 0.1971, "num_input_tokens_seen": 955434, "step": 512, "train_runtime": 1061.1152, "train_tokens_per_second": 900.406 }, { "epoch": 0.5185746777862017, "grad_norm": 0.48139604926109314, "learning_rate": 0.00014865822784810128, "loss": 0.2688, "num_input_tokens_seen": 957034, "step": 513, "train_runtime": 1062.777, "train_tokens_per_second": 900.503 }, { "epoch": 0.5195855446044984, "grad_norm": 0.39226430654525757, "learning_rate": 0.00014855696202531647, "loss": 0.2352, "num_input_tokens_seen": 958986, "step": 514, "train_runtime": 1064.6216, "train_tokens_per_second": 900.776 }, { "epoch": 0.520596411422795, "grad_norm": 0.45412585139274597, "learning_rate": 0.00014845569620253166, "loss": 0.1738, "num_input_tokens_seen": 961100, "step": 515, "train_runtime": 1066.5289, "train_tokens_per_second": 901.148 }, { "epoch": 0.5216072782410918, "grad_norm": 0.38501042127609253, "learning_rate": 0.00014835443037974682, "loss": 0.1626, "num_input_tokens_seen": 963022, "step": 516, "train_runtime": 1068.2401, "train_tokens_per_second": 901.503 }, { "epoch": 0.5226181450593884, "grad_norm": 0.384539932012558, "learning_rate": 0.00014825316455696204, "loss": 0.2145, "num_input_tokens_seen": 964910, "step": 517, "train_runtime": 1070.0265, "train_tokens_per_second": 901.763 }, { "epoch": 0.5236290118776851, "grad_norm": 0.6114786863327026, "learning_rate": 0.00014815189873417723, "loss": 0.2917, "num_input_tokens_seen": 966458, "step": 518, "train_runtime": 1071.6494, "train_tokens_per_second": 901.842 }, { "epoch": 0.5246398786959818, "grad_norm": 0.3773212432861328, "learning_rate": 0.0001480506329113924, "loss": 0.2422, "num_input_tokens_seen": 968034, "step": 519, "train_runtime": 1073.256, "train_tokens_per_second": 901.96 }, { "epoch": 0.5256507455142785, "grad_norm": 0.3456310033798218, "learning_rate": 0.00014794936708860761, "loss": 0.2735, "num_input_tokens_seen": 970254, "step": 520, "train_runtime": 1075.1839, "train_tokens_per_second": 902.408 }, { "epoch": 0.5266616123325751, "grad_norm": 0.47020086646080017, "learning_rate": 0.0001478481012658228, "loss": 0.1886, "num_input_tokens_seen": 971846, "step": 521, "train_runtime": 1076.8399, "train_tokens_per_second": 902.498 }, { "epoch": 0.5276724791508719, "grad_norm": 0.4325953722000122, "learning_rate": 0.00014774683544303797, "loss": 0.2944, "num_input_tokens_seen": 973748, "step": 522, "train_runtime": 1078.6153, "train_tokens_per_second": 902.776 }, { "epoch": 0.5286833459691685, "grad_norm": 0.47092968225479126, "learning_rate": 0.0001476455696202532, "loss": 0.2113, "num_input_tokens_seen": 975376, "step": 523, "train_runtime": 1080.3551, "train_tokens_per_second": 902.829 }, { "epoch": 0.5296942127874652, "grad_norm": 0.44826313853263855, "learning_rate": 0.00014754430379746835, "loss": 0.2931, "num_input_tokens_seen": 977280, "step": 524, "train_runtime": 1082.1186, "train_tokens_per_second": 903.117 }, { "epoch": 0.530705079605762, "grad_norm": 0.3668995201587677, "learning_rate": 0.00014744303797468354, "loss": 0.1651, "num_input_tokens_seen": 979808, "step": 525, "train_runtime": 1084.2343, "train_tokens_per_second": 903.687 }, { "epoch": 0.5317159464240586, "grad_norm": 0.40047508478164673, "learning_rate": 0.00014734177215189876, "loss": 0.2185, "num_input_tokens_seen": 981994, "step": 526, "train_runtime": 1086.1076, "train_tokens_per_second": 904.141 }, { "epoch": 0.5327268132423553, "grad_norm": 0.2596887946128845, "learning_rate": 0.00014724050632911392, "loss": 0.176, "num_input_tokens_seen": 983680, "step": 527, "train_runtime": 1087.7293, "train_tokens_per_second": 904.343 }, { "epoch": 0.533737680060652, "grad_norm": 0.36929258704185486, "learning_rate": 0.00014713924050632911, "loss": 0.1758, "num_input_tokens_seen": 985244, "step": 528, "train_runtime": 1089.3627, "train_tokens_per_second": 904.422 }, { "epoch": 0.5347485468789487, "grad_norm": 0.4168088138103485, "learning_rate": 0.00014703797468354433, "loss": 0.1534, "num_input_tokens_seen": 987174, "step": 529, "train_runtime": 1091.1598, "train_tokens_per_second": 904.702 }, { "epoch": 0.5357594136972453, "grad_norm": 0.43357694149017334, "learning_rate": 0.0001469367088607595, "loss": 0.2082, "num_input_tokens_seen": 988916, "step": 530, "train_runtime": 1092.8046, "train_tokens_per_second": 904.934 }, { "epoch": 0.5367702805155421, "grad_norm": 0.4053344428539276, "learning_rate": 0.0001468354430379747, "loss": 0.1625, "num_input_tokens_seen": 990246, "step": 531, "train_runtime": 1094.3918, "train_tokens_per_second": 904.837 }, { "epoch": 0.5377811473338387, "grad_norm": 0.3580296039581299, "learning_rate": 0.00014673417721518988, "loss": 0.2563, "num_input_tokens_seen": 992026, "step": 532, "train_runtime": 1096.0996, "train_tokens_per_second": 905.051 }, { "epoch": 0.5387920141521354, "grad_norm": 0.38738858699798584, "learning_rate": 0.00014663291139240507, "loss": 0.1965, "num_input_tokens_seen": 993518, "step": 533, "train_runtime": 1097.7914, "train_tokens_per_second": 905.015 }, { "epoch": 0.5398028809704322, "grad_norm": 0.4551422894001007, "learning_rate": 0.00014653164556962026, "loss": 0.3162, "num_input_tokens_seen": 995702, "step": 534, "train_runtime": 1099.6768, "train_tokens_per_second": 905.45 }, { "epoch": 0.5408137477887288, "grad_norm": 0.37893468141555786, "learning_rate": 0.00014643037974683545, "loss": 0.1811, "num_input_tokens_seen": 997600, "step": 535, "train_runtime": 1101.4888, "train_tokens_per_second": 905.683 }, { "epoch": 0.5418246146070256, "grad_norm": 0.4151322543621063, "learning_rate": 0.00014632911392405064, "loss": 0.1891, "num_input_tokens_seen": 999420, "step": 536, "train_runtime": 1103.1944, "train_tokens_per_second": 905.933 }, { "epoch": 0.5428354814253222, "grad_norm": 0.4174366295337677, "learning_rate": 0.00014622784810126583, "loss": 0.1765, "num_input_tokens_seen": 1001196, "step": 537, "train_runtime": 1104.9331, "train_tokens_per_second": 906.115 }, { "epoch": 0.5438463482436189, "grad_norm": 0.29842501878738403, "learning_rate": 0.00014612658227848102, "loss": 0.2105, "num_input_tokens_seen": 1003184, "step": 538, "train_runtime": 1106.726, "train_tokens_per_second": 906.443 }, { "epoch": 0.5448572150619156, "grad_norm": 0.4382702112197876, "learning_rate": 0.00014602531645569621, "loss": 0.2244, "num_input_tokens_seen": 1005212, "step": 539, "train_runtime": 1108.5599, "train_tokens_per_second": 906.773 }, { "epoch": 0.5458680818802123, "grad_norm": 0.5053007006645203, "learning_rate": 0.00014592405063291138, "loss": 0.2209, "num_input_tokens_seen": 1007078, "step": 540, "train_runtime": 1110.3033, "train_tokens_per_second": 907.03 }, { "epoch": 0.546878948698509, "grad_norm": 0.4378385543823242, "learning_rate": 0.0001458227848101266, "loss": 0.1674, "num_input_tokens_seen": 1008832, "step": 541, "train_runtime": 1113.699, "train_tokens_per_second": 905.839 }, { "epoch": 0.5478898155168057, "grad_norm": 0.31743279099464417, "learning_rate": 0.00014572151898734179, "loss": 0.2119, "num_input_tokens_seen": 1011414, "step": 542, "train_runtime": 1115.7944, "train_tokens_per_second": 906.452 }, { "epoch": 0.5489006823351024, "grad_norm": 0.4299280643463135, "learning_rate": 0.00014562025316455695, "loss": 0.2422, "num_input_tokens_seen": 1013356, "step": 543, "train_runtime": 1117.5224, "train_tokens_per_second": 906.788 }, { "epoch": 0.549911549153399, "grad_norm": 0.37672558426856995, "learning_rate": 0.00014551898734177217, "loss": 0.1441, "num_input_tokens_seen": 1015100, "step": 544, "train_runtime": 1119.2239, "train_tokens_per_second": 906.968 }, { "epoch": 0.5509224159716958, "grad_norm": 0.4549933969974518, "learning_rate": 0.00014541772151898733, "loss": 0.2114, "num_input_tokens_seen": 1017160, "step": 545, "train_runtime": 1121.0675, "train_tokens_per_second": 907.314 }, { "epoch": 0.5519332827899924, "grad_norm": 0.3631333112716675, "learning_rate": 0.00014531645569620252, "loss": 0.1708, "num_input_tokens_seen": 1019486, "step": 546, "train_runtime": 1123.0554, "train_tokens_per_second": 907.779 }, { "epoch": 0.5529441496082891, "grad_norm": 0.38967546820640564, "learning_rate": 0.00014521518987341774, "loss": 0.1762, "num_input_tokens_seen": 1021352, "step": 547, "train_runtime": 1124.7761, "train_tokens_per_second": 908.049 }, { "epoch": 0.5539550164265858, "grad_norm": 0.41608816385269165, "learning_rate": 0.0001451139240506329, "loss": 0.2531, "num_input_tokens_seen": 1023204, "step": 548, "train_runtime": 1126.5952, "train_tokens_per_second": 908.227 }, { "epoch": 0.5549658832448825, "grad_norm": 0.38755542039871216, "learning_rate": 0.0001450126582278481, "loss": 0.1732, "num_input_tokens_seen": 1025652, "step": 549, "train_runtime": 1128.604, "train_tokens_per_second": 908.779 }, { "epoch": 0.5559767500631791, "grad_norm": 0.528978168964386, "learning_rate": 0.0001449113924050633, "loss": 0.2496, "num_input_tokens_seen": 1027620, "step": 550, "train_runtime": 1130.3782, "train_tokens_per_second": 909.094 }, { "epoch": 0.5569876168814759, "grad_norm": 0.422991544008255, "learning_rate": 0.00014481012658227848, "loss": 0.1859, "num_input_tokens_seen": 1029384, "step": 551, "train_runtime": 1132.146, "train_tokens_per_second": 909.233 }, { "epoch": 0.5579984836997726, "grad_norm": 0.3693796396255493, "learning_rate": 0.00014470886075949367, "loss": 0.183, "num_input_tokens_seen": 1031376, "step": 552, "train_runtime": 1133.9194, "train_tokens_per_second": 909.567 }, { "epoch": 0.5590093505180692, "grad_norm": 0.4130207598209381, "learning_rate": 0.00014460759493670886, "loss": 0.1545, "num_input_tokens_seen": 1033068, "step": 553, "train_runtime": 1135.6172, "train_tokens_per_second": 909.697 }, { "epoch": 0.560020217336366, "grad_norm": 0.4068583548069, "learning_rate": 0.00014450632911392405, "loss": 0.1753, "num_input_tokens_seen": 1034514, "step": 554, "train_runtime": 1137.2561, "train_tokens_per_second": 909.658 }, { "epoch": 0.5610310841546626, "grad_norm": 0.37618324160575867, "learning_rate": 0.00014440506329113924, "loss": 0.1619, "num_input_tokens_seen": 1036280, "step": 555, "train_runtime": 1138.9987, "train_tokens_per_second": 909.817 }, { "epoch": 0.5620419509729593, "grad_norm": 0.5306529402732849, "learning_rate": 0.00014430379746835443, "loss": 0.1499, "num_input_tokens_seen": 1038124, "step": 556, "train_runtime": 1140.7426, "train_tokens_per_second": 910.042 }, { "epoch": 0.563052817791256, "grad_norm": 0.41581252217292786, "learning_rate": 0.00014420253164556962, "loss": 0.2099, "num_input_tokens_seen": 1039450, "step": 557, "train_runtime": 1142.3274, "train_tokens_per_second": 909.941 }, { "epoch": 0.5640636846095527, "grad_norm": 0.4545428454875946, "learning_rate": 0.0001441012658227848, "loss": 0.2257, "num_input_tokens_seen": 1041268, "step": 558, "train_runtime": 1144.031, "train_tokens_per_second": 910.175 }, { "epoch": 0.5650745514278493, "grad_norm": 0.4114132821559906, "learning_rate": 0.000144, "loss": 0.1979, "num_input_tokens_seen": 1043102, "step": 559, "train_runtime": 1145.7788, "train_tokens_per_second": 910.387 }, { "epoch": 0.5660854182461461, "grad_norm": 0.4922008216381073, "learning_rate": 0.0001438987341772152, "loss": 0.1924, "num_input_tokens_seen": 1044816, "step": 560, "train_runtime": 1147.4845, "train_tokens_per_second": 910.527 }, { "epoch": 0.5670962850644428, "grad_norm": 0.390349417924881, "learning_rate": 0.00014379746835443039, "loss": 0.1824, "num_input_tokens_seen": 1046774, "step": 561, "train_runtime": 1149.2201, "train_tokens_per_second": 910.856 }, { "epoch": 0.5681071518827394, "grad_norm": 0.5121869444847107, "learning_rate": 0.00014369620253164558, "loss": 0.2223, "num_input_tokens_seen": 1048378, "step": 562, "train_runtime": 1150.8973, "train_tokens_per_second": 910.922 }, { "epoch": 0.5691180187010362, "grad_norm": 0.3791031241416931, "learning_rate": 0.00014359493670886077, "loss": 0.1767, "num_input_tokens_seen": 1050576, "step": 563, "train_runtime": 1152.8289, "train_tokens_per_second": 911.303 }, { "epoch": 0.5701288855193328, "grad_norm": 0.4632573425769806, "learning_rate": 0.00014349367088607596, "loss": 0.16, "num_input_tokens_seen": 1052246, "step": 564, "train_runtime": 1154.5757, "train_tokens_per_second": 911.37 }, { "epoch": 0.5711397523376295, "grad_norm": 0.5109297037124634, "learning_rate": 0.00014339240506329115, "loss": 0.1945, "num_input_tokens_seen": 1053862, "step": 565, "train_runtime": 1156.1996, "train_tokens_per_second": 911.488 }, { "epoch": 0.5721506191559262, "grad_norm": 0.4783368706703186, "learning_rate": 0.00014329113924050634, "loss": 0.2149, "num_input_tokens_seen": 1055614, "step": 566, "train_runtime": 1157.8965, "train_tokens_per_second": 911.665 }, { "epoch": 0.5731614859742229, "grad_norm": 0.3857126533985138, "learning_rate": 0.00014318987341772153, "loss": 0.2684, "num_input_tokens_seen": 1057856, "step": 567, "train_runtime": 1159.8785, "train_tokens_per_second": 912.04 }, { "epoch": 0.5741723527925195, "grad_norm": 0.49782082438468933, "learning_rate": 0.00014308860759493672, "loss": 0.2032, "num_input_tokens_seen": 1059884, "step": 568, "train_runtime": 1161.7286, "train_tokens_per_second": 912.334 }, { "epoch": 0.5751832196108163, "grad_norm": 0.4673866927623749, "learning_rate": 0.00014298734177215188, "loss": 0.1962, "num_input_tokens_seen": 1061424, "step": 569, "train_runtime": 1163.3897, "train_tokens_per_second": 912.355 }, { "epoch": 0.576194086429113, "grad_norm": 0.360312283039093, "learning_rate": 0.0001428860759493671, "loss": 0.2023, "num_input_tokens_seen": 1063634, "step": 570, "train_runtime": 1165.2763, "train_tokens_per_second": 912.774 }, { "epoch": 0.5772049532474096, "grad_norm": 0.371200293302536, "learning_rate": 0.0001427848101265823, "loss": 0.2356, "num_input_tokens_seen": 1066160, "step": 571, "train_runtime": 1169.0693, "train_tokens_per_second": 911.973 }, { "epoch": 0.5782158200657064, "grad_norm": 0.4121630787849426, "learning_rate": 0.00014268354430379746, "loss": 0.1596, "num_input_tokens_seen": 1068052, "step": 572, "train_runtime": 1170.8747, "train_tokens_per_second": 912.183 }, { "epoch": 0.579226686884003, "grad_norm": 0.5687708258628845, "learning_rate": 0.00014258227848101268, "loss": 0.3351, "num_input_tokens_seen": 1069696, "step": 573, "train_runtime": 1172.4881, "train_tokens_per_second": 912.33 }, { "epoch": 0.5802375537022997, "grad_norm": 0.2903662323951721, "learning_rate": 0.00014248101265822787, "loss": 0.1987, "num_input_tokens_seen": 1071820, "step": 574, "train_runtime": 1174.2988, "train_tokens_per_second": 912.732 }, { "epoch": 0.5812484205205964, "grad_norm": 0.306836873292923, "learning_rate": 0.00014237974683544303, "loss": 0.1047, "num_input_tokens_seen": 1074216, "step": 575, "train_runtime": 1176.2553, "train_tokens_per_second": 913.251 }, { "epoch": 0.5822592873388931, "grad_norm": 0.4702828526496887, "learning_rate": 0.00014227848101265825, "loss": 0.3093, "num_input_tokens_seen": 1075822, "step": 576, "train_runtime": 1177.9242, "train_tokens_per_second": 913.32 }, { "epoch": 0.5832701541571897, "grad_norm": 0.47218936681747437, "learning_rate": 0.0001421772151898734, "loss": 0.2416, "num_input_tokens_seen": 1078104, "step": 577, "train_runtime": 1179.8512, "train_tokens_per_second": 913.763 }, { "epoch": 0.5842810209754865, "grad_norm": 0.331085205078125, "learning_rate": 0.0001420759493670886, "loss": 0.2187, "num_input_tokens_seen": 1079748, "step": 578, "train_runtime": 1181.5279, "train_tokens_per_second": 913.857 }, { "epoch": 0.5852918877937832, "grad_norm": 0.4153466820716858, "learning_rate": 0.00014197468354430382, "loss": 0.2032, "num_input_tokens_seen": 1081338, "step": 579, "train_runtime": 1183.1568, "train_tokens_per_second": 913.943 }, { "epoch": 0.5863027546120798, "grad_norm": 0.3859248757362366, "learning_rate": 0.00014187341772151898, "loss": 0.203, "num_input_tokens_seen": 1083466, "step": 580, "train_runtime": 1185.0429, "train_tokens_per_second": 914.284 }, { "epoch": 0.5873136214303766, "grad_norm": 0.463846892118454, "learning_rate": 0.00014177215189873418, "loss": 0.2193, "num_input_tokens_seen": 1085340, "step": 581, "train_runtime": 1186.765, "train_tokens_per_second": 914.537 }, { "epoch": 0.5883244882486732, "grad_norm": 0.3924486041069031, "learning_rate": 0.0001416708860759494, "loss": 0.2138, "num_input_tokens_seen": 1087066, "step": 582, "train_runtime": 1188.3924, "train_tokens_per_second": 914.737 }, { "epoch": 0.5893353550669699, "grad_norm": 0.3305489122867584, "learning_rate": 0.00014156962025316456, "loss": 0.225, "num_input_tokens_seen": 1089186, "step": 583, "train_runtime": 1190.2641, "train_tokens_per_second": 915.079 }, { "epoch": 0.5903462218852666, "grad_norm": 0.3427446484565735, "learning_rate": 0.00014146835443037975, "loss": 0.3415, "num_input_tokens_seen": 1091036, "step": 584, "train_runtime": 1192.0466, "train_tokens_per_second": 915.263 }, { "epoch": 0.5913570887035633, "grad_norm": 0.47477230429649353, "learning_rate": 0.00014136708860759494, "loss": 0.322, "num_input_tokens_seen": 1092928, "step": 585, "train_runtime": 1193.7624, "train_tokens_per_second": 915.532 }, { "epoch": 0.59236795552186, "grad_norm": 0.32592275738716125, "learning_rate": 0.00014126582278481013, "loss": 0.2132, "num_input_tokens_seen": 1094898, "step": 586, "train_runtime": 1195.5584, "train_tokens_per_second": 915.805 }, { "epoch": 0.5933788223401567, "grad_norm": 0.45266860723495483, "learning_rate": 0.00014116455696202532, "loss": 0.2134, "num_input_tokens_seen": 1096502, "step": 587, "train_runtime": 1197.2439, "train_tokens_per_second": 915.855 }, { "epoch": 0.5943896891584534, "grad_norm": 0.4829668402671814, "learning_rate": 0.0001410632911392405, "loss": 0.1822, "num_input_tokens_seen": 1097890, "step": 588, "train_runtime": 1198.8313, "train_tokens_per_second": 915.8 }, { "epoch": 0.59540055597675, "grad_norm": 0.46501827239990234, "learning_rate": 0.0001409620253164557, "loss": 0.1881, "num_input_tokens_seen": 1099700, "step": 589, "train_runtime": 1200.5457, "train_tokens_per_second": 916.0 }, { "epoch": 0.5964114227950468, "grad_norm": 0.3549115061759949, "learning_rate": 0.0001408607594936709, "loss": 0.2193, "num_input_tokens_seen": 1102062, "step": 590, "train_runtime": 1202.555, "train_tokens_per_second": 916.434 }, { "epoch": 0.5974222896133434, "grad_norm": 0.520986795425415, "learning_rate": 0.00014075949367088608, "loss": 0.2858, "num_input_tokens_seen": 1103904, "step": 591, "train_runtime": 1204.3327, "train_tokens_per_second": 916.611 }, { "epoch": 0.5984331564316401, "grad_norm": 0.5083928108215332, "learning_rate": 0.00014065822784810127, "loss": 0.2111, "num_input_tokens_seen": 1105536, "step": 592, "train_runtime": 1205.9703, "train_tokens_per_second": 916.719 }, { "epoch": 0.5994440232499368, "grad_norm": 0.4003691077232361, "learning_rate": 0.00014055696202531647, "loss": 0.1758, "num_input_tokens_seen": 1107264, "step": 593, "train_runtime": 1207.6622, "train_tokens_per_second": 916.866 }, { "epoch": 0.6004548900682335, "grad_norm": 0.3368241786956787, "learning_rate": 0.00014045569620253166, "loss": 0.1774, "num_input_tokens_seen": 1109584, "step": 594, "train_runtime": 1209.6215, "train_tokens_per_second": 917.298 }, { "epoch": 0.6004548900682335, "eval_loss": 0.1999172419309616, "eval_runtime": 61.4282, "eval_samples_per_second": 14.309, "eval_steps_per_second": 7.163, "num_input_tokens_seen": 1109584, "step": 594 }, { "epoch": 0.6014657568865301, "grad_norm": 0.5142544507980347, "learning_rate": 0.00014035443037974685, "loss": 0.2682, "num_input_tokens_seen": 1111106, "step": 595, "train_runtime": 1272.7308, "train_tokens_per_second": 873.009 }, { "epoch": 0.6024766237048269, "grad_norm": 0.42380717396736145, "learning_rate": 0.00014025316455696204, "loss": 0.1566, "num_input_tokens_seen": 1113288, "step": 596, "train_runtime": 1274.5414, "train_tokens_per_second": 873.481 }, { "epoch": 0.6034874905231236, "grad_norm": 0.452054888010025, "learning_rate": 0.00014015189873417723, "loss": 0.1474, "num_input_tokens_seen": 1115252, "step": 597, "train_runtime": 1276.3727, "train_tokens_per_second": 873.767 }, { "epoch": 0.6044983573414203, "grad_norm": 0.535305380821228, "learning_rate": 0.00014005063291139242, "loss": 0.2835, "num_input_tokens_seen": 1116960, "step": 598, "train_runtime": 1278.0142, "train_tokens_per_second": 873.981 }, { "epoch": 0.605509224159717, "grad_norm": 0.5015350580215454, "learning_rate": 0.0001399493670886076, "loss": 0.1981, "num_input_tokens_seen": 1118466, "step": 599, "train_runtime": 1279.5965, "train_tokens_per_second": 874.077 }, { "epoch": 0.6065200909780136, "grad_norm": 0.44699451327323914, "learning_rate": 0.0001398481012658228, "loss": 0.2412, "num_input_tokens_seen": 1120110, "step": 600, "train_runtime": 1281.2265, "train_tokens_per_second": 874.248 }, { "epoch": 0.6075309577963104, "grad_norm": 0.42712441086769104, "learning_rate": 0.00013974683544303796, "loss": 0.2404, "num_input_tokens_seen": 1122134, "step": 601, "train_runtime": 1285.133, "train_tokens_per_second": 873.166 }, { "epoch": 0.608541824614607, "grad_norm": 0.5717500448226929, "learning_rate": 0.00013964556962025318, "loss": 0.2623, "num_input_tokens_seen": 1123944, "step": 602, "train_runtime": 1286.9072, "train_tokens_per_second": 873.368 }, { "epoch": 0.6095526914329037, "grad_norm": 0.4131810963153839, "learning_rate": 0.00013954430379746837, "loss": 0.1334, "num_input_tokens_seen": 1125774, "step": 603, "train_runtime": 1288.6145, "train_tokens_per_second": 873.631 }, { "epoch": 0.6105635582512005, "grad_norm": 0.42398935556411743, "learning_rate": 0.00013944303797468354, "loss": 0.1776, "num_input_tokens_seen": 1127612, "step": 604, "train_runtime": 1290.4229, "train_tokens_per_second": 873.831 }, { "epoch": 0.6115744250694971, "grad_norm": 0.47160011529922485, "learning_rate": 0.00013934177215189876, "loss": 0.2297, "num_input_tokens_seen": 1129478, "step": 605, "train_runtime": 1292.2006, "train_tokens_per_second": 874.073 }, { "epoch": 0.6125852918877938, "grad_norm": 0.3654675781726837, "learning_rate": 0.00013924050632911395, "loss": 0.1374, "num_input_tokens_seen": 1131272, "step": 606, "train_runtime": 1293.841, "train_tokens_per_second": 874.352 }, { "epoch": 0.6135961587060905, "grad_norm": 0.42554304003715515, "learning_rate": 0.0001391392405063291, "loss": 0.2403, "num_input_tokens_seen": 1133002, "step": 607, "train_runtime": 1295.582, "train_tokens_per_second": 874.512 }, { "epoch": 0.6146070255243872, "grad_norm": 0.38294222950935364, "learning_rate": 0.0001390379746835443, "loss": 0.2169, "num_input_tokens_seen": 1135134, "step": 608, "train_runtime": 1297.3831, "train_tokens_per_second": 874.941 }, { "epoch": 0.6156178923426838, "grad_norm": 0.419821172952652, "learning_rate": 0.0001389367088607595, "loss": 0.1488, "num_input_tokens_seen": 1136798, "step": 609, "train_runtime": 1299.0132, "train_tokens_per_second": 875.124 }, { "epoch": 0.6166287591609806, "grad_norm": 0.4196281433105469, "learning_rate": 0.00013883544303797468, "loss": 0.15, "num_input_tokens_seen": 1138694, "step": 610, "train_runtime": 1300.7687, "train_tokens_per_second": 875.401 }, { "epoch": 0.6176396259792772, "grad_norm": 0.4162880778312683, "learning_rate": 0.00013873417721518987, "loss": 0.1656, "num_input_tokens_seen": 1140184, "step": 611, "train_runtime": 1302.4433, "train_tokens_per_second": 875.419 }, { "epoch": 0.6186504927975739, "grad_norm": 0.47770410776138306, "learning_rate": 0.00013863291139240506, "loss": 0.3258, "num_input_tokens_seen": 1142572, "step": 612, "train_runtime": 1304.386, "train_tokens_per_second": 875.946 }, { "epoch": 0.6196613596158707, "grad_norm": 0.49336400628089905, "learning_rate": 0.00013853164556962025, "loss": 0.2225, "num_input_tokens_seen": 1144346, "step": 613, "train_runtime": 1306.0177, "train_tokens_per_second": 876.21 }, { "epoch": 0.6206722264341673, "grad_norm": 0.45543521642684937, "learning_rate": 0.00013843037974683545, "loss": 0.1773, "num_input_tokens_seen": 1145922, "step": 614, "train_runtime": 1307.6453, "train_tokens_per_second": 876.325 }, { "epoch": 0.621683093252464, "grad_norm": 0.3972449004650116, "learning_rate": 0.00013832911392405064, "loss": 0.1437, "num_input_tokens_seen": 1147932, "step": 615, "train_runtime": 1309.4836, "train_tokens_per_second": 876.63 }, { "epoch": 0.6226939600707607, "grad_norm": 0.5032971501350403, "learning_rate": 0.00013822784810126583, "loss": 0.2274, "num_input_tokens_seen": 1149966, "step": 616, "train_runtime": 1311.3488, "train_tokens_per_second": 876.934 }, { "epoch": 0.6237048268890574, "grad_norm": 0.5544525980949402, "learning_rate": 0.00013812658227848102, "loss": 0.2774, "num_input_tokens_seen": 1151980, "step": 617, "train_runtime": 1313.1947, "train_tokens_per_second": 877.235 }, { "epoch": 0.624715693707354, "grad_norm": 0.4054725170135498, "learning_rate": 0.0001380253164556962, "loss": 0.1844, "num_input_tokens_seen": 1154506, "step": 618, "train_runtime": 1315.2554, "train_tokens_per_second": 877.781 }, { "epoch": 0.6257265605256508, "grad_norm": 0.4948369860649109, "learning_rate": 0.0001379240506329114, "loss": 0.2104, "num_input_tokens_seen": 1156236, "step": 619, "train_runtime": 1317.0121, "train_tokens_per_second": 877.924 }, { "epoch": 0.6267374273439474, "grad_norm": 0.4355620741844177, "learning_rate": 0.0001378227848101266, "loss": 0.2392, "num_input_tokens_seen": 1158250, "step": 620, "train_runtime": 1318.8694, "train_tokens_per_second": 878.214 }, { "epoch": 0.6277482941622441, "grad_norm": 0.49952054023742676, "learning_rate": 0.00013772151898734178, "loss": 0.257, "num_input_tokens_seen": 1159834, "step": 621, "train_runtime": 1320.4982, "train_tokens_per_second": 878.331 }, { "epoch": 0.6287591609805409, "grad_norm": 0.4113228917121887, "learning_rate": 0.00013762025316455697, "loss": 0.1428, "num_input_tokens_seen": 1161566, "step": 622, "train_runtime": 1322.2029, "train_tokens_per_second": 878.508 }, { "epoch": 0.6297700277988375, "grad_norm": 0.40772753953933716, "learning_rate": 0.00013751898734177216, "loss": 0.2294, "num_input_tokens_seen": 1163734, "step": 623, "train_runtime": 1324.0694, "train_tokens_per_second": 878.907 }, { "epoch": 0.6307808946171342, "grad_norm": 0.36806434392929077, "learning_rate": 0.00013741772151898735, "loss": 0.2122, "num_input_tokens_seen": 1165512, "step": 624, "train_runtime": 1325.8261, "train_tokens_per_second": 879.084 }, { "epoch": 0.6317917614354309, "grad_norm": 0.3921598494052887, "learning_rate": 0.00013731645569620252, "loss": 0.1499, "num_input_tokens_seen": 1167786, "step": 625, "train_runtime": 1327.7854, "train_tokens_per_second": 879.499 }, { "epoch": 0.6328026282537276, "grad_norm": 0.5765639543533325, "learning_rate": 0.00013721518987341774, "loss": 0.1781, "num_input_tokens_seen": 1169068, "step": 626, "train_runtime": 1329.3517, "train_tokens_per_second": 879.427 }, { "epoch": 0.6338134950720242, "grad_norm": 0.4361734092235565, "learning_rate": 0.00013711392405063293, "loss": 0.1977, "num_input_tokens_seen": 1170292, "step": 627, "train_runtime": 1330.9128, "train_tokens_per_second": 879.315 }, { "epoch": 0.634824361890321, "grad_norm": 0.4898892045021057, "learning_rate": 0.0001370126582278481, "loss": 0.1883, "num_input_tokens_seen": 1172330, "step": 628, "train_runtime": 1332.7698, "train_tokens_per_second": 879.619 }, { "epoch": 0.6358352287086176, "grad_norm": 0.39373868703842163, "learning_rate": 0.0001369113924050633, "loss": 0.2619, "num_input_tokens_seen": 1174324, "step": 629, "train_runtime": 1334.4959, "train_tokens_per_second": 879.976 }, { "epoch": 0.6368460955269143, "grad_norm": 0.5396379828453064, "learning_rate": 0.0001368101265822785, "loss": 0.2839, "num_input_tokens_seen": 1176344, "step": 630, "train_runtime": 1336.2338, "train_tokens_per_second": 880.343 }, { "epoch": 0.637856962345211, "grad_norm": 0.47252243757247925, "learning_rate": 0.00013670886075949366, "loss": 0.1488, "num_input_tokens_seen": 1178350, "step": 631, "train_runtime": 1340.0088, "train_tokens_per_second": 879.36 }, { "epoch": 0.6388678291635077, "grad_norm": 0.45499494671821594, "learning_rate": 0.00013660759493670888, "loss": 0.2265, "num_input_tokens_seen": 1180318, "step": 632, "train_runtime": 1341.8151, "train_tokens_per_second": 879.643 }, { "epoch": 0.6398786959818044, "grad_norm": 0.45699816942214966, "learning_rate": 0.00013650632911392404, "loss": 0.2249, "num_input_tokens_seen": 1182472, "step": 633, "train_runtime": 1343.6785, "train_tokens_per_second": 880.026 }, { "epoch": 0.6408895628001011, "grad_norm": 0.4991965591907501, "learning_rate": 0.00013640506329113924, "loss": 0.2452, "num_input_tokens_seen": 1184080, "step": 634, "train_runtime": 1345.3167, "train_tokens_per_second": 880.15 }, { "epoch": 0.6419004296183978, "grad_norm": 0.4307124614715576, "learning_rate": 0.00013630379746835445, "loss": 0.1796, "num_input_tokens_seen": 1186314, "step": 635, "train_runtime": 1347.2777, "train_tokens_per_second": 880.527 }, { "epoch": 0.6429112964366944, "grad_norm": 0.41934290528297424, "learning_rate": 0.00013620253164556962, "loss": 0.2379, "num_input_tokens_seen": 1188320, "step": 636, "train_runtime": 1349.0601, "train_tokens_per_second": 880.85 }, { "epoch": 0.6439221632549912, "grad_norm": 0.3485095798969269, "learning_rate": 0.0001361012658227848, "loss": 0.2734, "num_input_tokens_seen": 1189978, "step": 637, "train_runtime": 1350.7358, "train_tokens_per_second": 880.985 }, { "epoch": 0.6449330300732878, "grad_norm": 0.4292319715023041, "learning_rate": 0.00013600000000000003, "loss": 0.158, "num_input_tokens_seen": 1191680, "step": 638, "train_runtime": 1352.3584, "train_tokens_per_second": 881.187 }, { "epoch": 0.6459438968915845, "grad_norm": 0.3399895131587982, "learning_rate": 0.0001358987341772152, "loss": 0.1869, "num_input_tokens_seen": 1194270, "step": 639, "train_runtime": 1354.4558, "train_tokens_per_second": 881.734 }, { "epoch": 0.6469547637098813, "grad_norm": 0.4121042490005493, "learning_rate": 0.00013579746835443038, "loss": 0.1869, "num_input_tokens_seen": 1196906, "step": 640, "train_runtime": 1356.5211, "train_tokens_per_second": 882.335 }, { "epoch": 0.6479656305281779, "grad_norm": 0.4975435137748718, "learning_rate": 0.00013569620253164557, "loss": 0.2162, "num_input_tokens_seen": 1198600, "step": 641, "train_runtime": 1358.246, "train_tokens_per_second": 882.462 }, { "epoch": 0.6489764973464746, "grad_norm": 0.5656388998031616, "learning_rate": 0.00013559493670886076, "loss": 0.3482, "num_input_tokens_seen": 1200188, "step": 642, "train_runtime": 1359.8671, "train_tokens_per_second": 882.577 }, { "epoch": 0.6499873641647713, "grad_norm": 0.45611894130706787, "learning_rate": 0.00013549367088607595, "loss": 0.1694, "num_input_tokens_seen": 1202518, "step": 643, "train_runtime": 1361.8079, "train_tokens_per_second": 883.031 }, { "epoch": 0.650998230983068, "grad_norm": 0.5768261551856995, "learning_rate": 0.00013539240506329114, "loss": 0.2855, "num_input_tokens_seen": 1204106, "step": 644, "train_runtime": 1363.4386, "train_tokens_per_second": 883.139 }, { "epoch": 0.6520090978013646, "grad_norm": 0.4159179627895355, "learning_rate": 0.00013529113924050633, "loss": 0.2193, "num_input_tokens_seen": 1206452, "step": 645, "train_runtime": 1365.3405, "train_tokens_per_second": 883.627 }, { "epoch": 0.6530199646196614, "grad_norm": 0.4470064043998718, "learning_rate": 0.00013518987341772153, "loss": 0.2135, "num_input_tokens_seen": 1208614, "step": 646, "train_runtime": 1367.2625, "train_tokens_per_second": 883.966 }, { "epoch": 0.654030831437958, "grad_norm": 0.41663551330566406, "learning_rate": 0.00013508860759493672, "loss": 0.2353, "num_input_tokens_seen": 1209990, "step": 647, "train_runtime": 1368.861, "train_tokens_per_second": 883.939 }, { "epoch": 0.6550416982562547, "grad_norm": 0.3976331651210785, "learning_rate": 0.0001349873417721519, "loss": 0.1853, "num_input_tokens_seen": 1211572, "step": 648, "train_runtime": 1370.5441, "train_tokens_per_second": 884.008 }, { "epoch": 0.6560525650745515, "grad_norm": 0.3913930356502533, "learning_rate": 0.0001348860759493671, "loss": 0.1631, "num_input_tokens_seen": 1213344, "step": 649, "train_runtime": 1372.2407, "train_tokens_per_second": 884.206 }, { "epoch": 0.6570634318928481, "grad_norm": 0.4002862274646759, "learning_rate": 0.0001347848101265823, "loss": 0.2661, "num_input_tokens_seen": 1215340, "step": 650, "train_runtime": 1374.0117, "train_tokens_per_second": 884.519 }, { "epoch": 0.6580742987111448, "grad_norm": 0.3866746723651886, "learning_rate": 0.00013468354430379748, "loss": 0.2703, "num_input_tokens_seen": 1217024, "step": 651, "train_runtime": 1375.7145, "train_tokens_per_second": 884.649 }, { "epoch": 0.6590851655294415, "grad_norm": 0.4973559081554413, "learning_rate": 0.00013458227848101267, "loss": 0.1676, "num_input_tokens_seen": 1218734, "step": 652, "train_runtime": 1377.3536, "train_tokens_per_second": 884.837 }, { "epoch": 0.6600960323477382, "grad_norm": 0.5597884058952332, "learning_rate": 0.00013448101265822786, "loss": 0.3641, "num_input_tokens_seen": 1220580, "step": 653, "train_runtime": 1379.0588, "train_tokens_per_second": 885.082 }, { "epoch": 0.6611068991660348, "grad_norm": 0.46370941400527954, "learning_rate": 0.00013437974683544305, "loss": 0.2083, "num_input_tokens_seen": 1222446, "step": 654, "train_runtime": 1380.894, "train_tokens_per_second": 885.257 }, { "epoch": 0.6621177659843316, "grad_norm": 0.5185815095901489, "learning_rate": 0.00013427848101265824, "loss": 0.1914, "num_input_tokens_seen": 1224226, "step": 655, "train_runtime": 1382.6009, "train_tokens_per_second": 885.451 }, { "epoch": 0.6631286328026282, "grad_norm": 0.452104777097702, "learning_rate": 0.00013417721518987343, "loss": 0.2125, "num_input_tokens_seen": 1226252, "step": 656, "train_runtime": 1384.3852, "train_tokens_per_second": 885.774 }, { "epoch": 0.6641394996209249, "grad_norm": 0.353582501411438, "learning_rate": 0.0001340759493670886, "loss": 0.1754, "num_input_tokens_seen": 1228886, "step": 657, "train_runtime": 1386.5012, "train_tokens_per_second": 886.322 }, { "epoch": 0.6651503664392217, "grad_norm": 0.42549431324005127, "learning_rate": 0.00013397468354430382, "loss": 0.155, "num_input_tokens_seen": 1231158, "step": 658, "train_runtime": 1388.4567, "train_tokens_per_second": 886.71 }, { "epoch": 0.6661612332575183, "grad_norm": 0.4215696454048157, "learning_rate": 0.000133873417721519, "loss": 0.2138, "num_input_tokens_seen": 1232656, "step": 659, "train_runtime": 1390.1232, "train_tokens_per_second": 886.724 }, { "epoch": 0.6671721000758151, "grad_norm": 0.3711097836494446, "learning_rate": 0.00013377215189873417, "loss": 0.1722, "num_input_tokens_seen": 1234186, "step": 660, "train_runtime": 1391.7882, "train_tokens_per_second": 886.763 }, { "epoch": 0.6681829668941117, "grad_norm": 0.4210507869720459, "learning_rate": 0.0001336708860759494, "loss": 0.1515, "num_input_tokens_seen": 1236296, "step": 661, "train_runtime": 1395.7178, "train_tokens_per_second": 885.778 }, { "epoch": 0.6691938337124084, "grad_norm": 0.3783086836338043, "learning_rate": 0.00013356962025316458, "loss": 0.1955, "num_input_tokens_seen": 1238166, "step": 662, "train_runtime": 1397.438, "train_tokens_per_second": 886.026 }, { "epoch": 0.6702047005307051, "grad_norm": 0.4010985195636749, "learning_rate": 0.00013346835443037974, "loss": 0.2455, "num_input_tokens_seen": 1240276, "step": 663, "train_runtime": 1399.2322, "train_tokens_per_second": 886.398 }, { "epoch": 0.6712155673490018, "grad_norm": 0.43554016947746277, "learning_rate": 0.00013336708860759496, "loss": 0.1425, "num_input_tokens_seen": 1241846, "step": 664, "train_runtime": 1400.9068, "train_tokens_per_second": 886.459 }, { "epoch": 0.6722264341672984, "grad_norm": 0.3944196403026581, "learning_rate": 0.00013326582278481012, "loss": 0.2067, "num_input_tokens_seen": 1243514, "step": 665, "train_runtime": 1402.5471, "train_tokens_per_second": 886.611 }, { "epoch": 0.6732373009855952, "grad_norm": 0.4447316825389862, "learning_rate": 0.00013316455696202532, "loss": 0.2011, "num_input_tokens_seen": 1245576, "step": 666, "train_runtime": 1404.3991, "train_tokens_per_second": 886.91 }, { "epoch": 0.6742481678038919, "grad_norm": 0.4452163279056549, "learning_rate": 0.00013306329113924053, "loss": 0.2443, "num_input_tokens_seen": 1247542, "step": 667, "train_runtime": 1406.2335, "train_tokens_per_second": 887.151 }, { "epoch": 0.6752590346221885, "grad_norm": 0.45511099696159363, "learning_rate": 0.0001329620253164557, "loss": 0.19, "num_input_tokens_seen": 1249648, "step": 668, "train_runtime": 1408.1208, "train_tokens_per_second": 887.458 }, { "epoch": 0.6762699014404853, "grad_norm": 0.2935425639152527, "learning_rate": 0.0001328607594936709, "loss": 0.258, "num_input_tokens_seen": 1251566, "step": 669, "train_runtime": 1409.8916, "train_tokens_per_second": 887.704 }, { "epoch": 0.6772807682587819, "grad_norm": 0.4612777531147003, "learning_rate": 0.0001327594936708861, "loss": 0.2456, "num_input_tokens_seen": 1253414, "step": 670, "train_runtime": 1411.6445, "train_tokens_per_second": 887.911 }, { "epoch": 0.6782916350770786, "grad_norm": 0.38125815987586975, "learning_rate": 0.00013265822784810127, "loss": 0.1427, "num_input_tokens_seen": 1255404, "step": 671, "train_runtime": 1413.484, "train_tokens_per_second": 888.163 }, { "epoch": 0.6793025018953753, "grad_norm": 0.4688827395439148, "learning_rate": 0.00013255696202531646, "loss": 0.2247, "num_input_tokens_seen": 1257308, "step": 672, "train_runtime": 1415.2099, "train_tokens_per_second": 888.425 }, { "epoch": 0.680313368713672, "grad_norm": 0.2908744513988495, "learning_rate": 0.00013245569620253165, "loss": 0.1254, "num_input_tokens_seen": 1258656, "step": 673, "train_runtime": 1416.7941, "train_tokens_per_second": 888.383 }, { "epoch": 0.6813242355319686, "grad_norm": 0.43420150876045227, "learning_rate": 0.00013235443037974684, "loss": 0.2506, "num_input_tokens_seen": 1260934, "step": 674, "train_runtime": 1418.7324, "train_tokens_per_second": 888.775 }, { "epoch": 0.6823351023502654, "grad_norm": 0.5073977112770081, "learning_rate": 0.00013225316455696203, "loss": 0.1734, "num_input_tokens_seen": 1262612, "step": 675, "train_runtime": 1420.4166, "train_tokens_per_second": 888.903 }, { "epoch": 0.683345969168562, "grad_norm": 0.5391412973403931, "learning_rate": 0.00013215189873417722, "loss": 0.2277, "num_input_tokens_seen": 1263840, "step": 676, "train_runtime": 1421.9759, "train_tokens_per_second": 888.791 }, { "epoch": 0.6843568359868587, "grad_norm": 0.41563281416893005, "learning_rate": 0.00013205063291139241, "loss": 0.1413, "num_input_tokens_seen": 1266208, "step": 677, "train_runtime": 1424.0361, "train_tokens_per_second": 889.168 }, { "epoch": 0.6853677028051555, "grad_norm": 0.3735334873199463, "learning_rate": 0.0001319493670886076, "loss": 0.3, "num_input_tokens_seen": 1267706, "step": 678, "train_runtime": 1425.7347, "train_tokens_per_second": 889.16 }, { "epoch": 0.6863785696234521, "grad_norm": 0.5222294330596924, "learning_rate": 0.0001318481012658228, "loss": 0.2447, "num_input_tokens_seen": 1269792, "step": 679, "train_runtime": 1427.5909, "train_tokens_per_second": 889.465 }, { "epoch": 0.6873894364417488, "grad_norm": 0.47381308674812317, "learning_rate": 0.000131746835443038, "loss": 0.2701, "num_input_tokens_seen": 1272086, "step": 680, "train_runtime": 1429.5168, "train_tokens_per_second": 889.871 }, { "epoch": 0.6884003032600455, "grad_norm": 0.3976532816886902, "learning_rate": 0.00013164556962025315, "loss": 0.1387, "num_input_tokens_seen": 1273896, "step": 681, "train_runtime": 1431.2722, "train_tokens_per_second": 890.045 }, { "epoch": 0.6894111700783422, "grad_norm": 0.5570082068443298, "learning_rate": 0.00013154430379746837, "loss": 0.2635, "num_input_tokens_seen": 1276032, "step": 682, "train_runtime": 1433.1965, "train_tokens_per_second": 890.34 }, { "epoch": 0.6904220368966388, "grad_norm": 0.5047719478607178, "learning_rate": 0.00013144303797468356, "loss": 0.3581, "num_input_tokens_seen": 1277888, "step": 683, "train_runtime": 1434.9191, "train_tokens_per_second": 890.565 }, { "epoch": 0.6914329037149356, "grad_norm": 0.5290535688400269, "learning_rate": 0.00013134177215189872, "loss": 0.1986, "num_input_tokens_seen": 1279506, "step": 684, "train_runtime": 1436.5453, "train_tokens_per_second": 890.683 }, { "epoch": 0.6924437705332323, "grad_norm": 0.49076324701309204, "learning_rate": 0.00013124050632911394, "loss": 0.1877, "num_input_tokens_seen": 1281218, "step": 685, "train_runtime": 1438.2277, "train_tokens_per_second": 890.831 }, { "epoch": 0.6934546373515289, "grad_norm": 0.4349224269390106, "learning_rate": 0.00013113924050632913, "loss": 0.1873, "num_input_tokens_seen": 1282962, "step": 686, "train_runtime": 1439.9793, "train_tokens_per_second": 890.959 }, { "epoch": 0.6944655041698257, "grad_norm": 0.3889138698577881, "learning_rate": 0.0001310379746835443, "loss": 0.2006, "num_input_tokens_seen": 1284568, "step": 687, "train_runtime": 1441.6789, "train_tokens_per_second": 891.022 }, { "epoch": 0.6954763709881223, "grad_norm": 0.40236109495162964, "learning_rate": 0.00013093670886075951, "loss": 0.2049, "num_input_tokens_seen": 1286224, "step": 688, "train_runtime": 1443.3211, "train_tokens_per_second": 891.156 }, { "epoch": 0.696487237806419, "grad_norm": 0.3458422124385834, "learning_rate": 0.00013083544303797468, "loss": 0.2041, "num_input_tokens_seen": 1288048, "step": 689, "train_runtime": 1445.0887, "train_tokens_per_second": 891.328 }, { "epoch": 0.6974981046247157, "grad_norm": 0.45814043283462524, "learning_rate": 0.00013073417721518987, "loss": 0.1965, "num_input_tokens_seen": 1289712, "step": 690, "train_runtime": 1446.7832, "train_tokens_per_second": 891.434 }, { "epoch": 0.6985089714430124, "grad_norm": 0.36505913734436035, "learning_rate": 0.0001306329113924051, "loss": 0.1506, "num_input_tokens_seen": 1291352, "step": 691, "train_runtime": 1450.5428, "train_tokens_per_second": 890.254 }, { "epoch": 0.699519838261309, "grad_norm": 0.5061760544776917, "learning_rate": 0.00013053164556962025, "loss": 0.2407, "num_input_tokens_seen": 1293044, "step": 692, "train_runtime": 1452.1997, "train_tokens_per_second": 890.404 }, { "epoch": 0.7005307050796058, "grad_norm": 0.36819201707839966, "learning_rate": 0.00013043037974683544, "loss": 0.4679, "num_input_tokens_seen": 1294774, "step": 693, "train_runtime": 1453.891, "train_tokens_per_second": 890.558 }, { "epoch": 0.7015415718979024, "grad_norm": 0.3914896249771118, "learning_rate": 0.00013032911392405066, "loss": 0.1971, "num_input_tokens_seen": 1296520, "step": 694, "train_runtime": 1455.5855, "train_tokens_per_second": 890.721 }, { "epoch": 0.7025524387161991, "grad_norm": 0.37987568974494934, "learning_rate": 0.00013022784810126582, "loss": 0.2146, "num_input_tokens_seen": 1298658, "step": 695, "train_runtime": 1457.4366, "train_tokens_per_second": 891.056 }, { "epoch": 0.7035633055344959, "grad_norm": 0.44168776273727417, "learning_rate": 0.00013012658227848101, "loss": 0.2155, "num_input_tokens_seen": 1300618, "step": 696, "train_runtime": 1459.261, "train_tokens_per_second": 891.285 }, { "epoch": 0.7045741723527925, "grad_norm": 0.3115847110748291, "learning_rate": 0.0001300253164556962, "loss": 0.1736, "num_input_tokens_seen": 1302984, "step": 697, "train_runtime": 1461.215, "train_tokens_per_second": 891.713 }, { "epoch": 0.7055850391710892, "grad_norm": 0.4177860617637634, "learning_rate": 0.0001299240506329114, "loss": 0.1859, "num_input_tokens_seen": 1304498, "step": 698, "train_runtime": 1462.8754, "train_tokens_per_second": 891.736 }, { "epoch": 0.7065959059893859, "grad_norm": 0.5578729510307312, "learning_rate": 0.00012982278481012659, "loss": 0.2147, "num_input_tokens_seen": 1306128, "step": 699, "train_runtime": 1464.5811, "train_tokens_per_second": 891.81 }, { "epoch": 0.7076067728076826, "grad_norm": 0.6117987632751465, "learning_rate": 0.00012972151898734178, "loss": 0.2632, "num_input_tokens_seen": 1307666, "step": 700, "train_runtime": 1466.2011, "train_tokens_per_second": 891.874 }, { "epoch": 0.7086176396259792, "grad_norm": 0.39309704303741455, "learning_rate": 0.00012962025316455697, "loss": 0.2293, "num_input_tokens_seen": 1309742, "step": 701, "train_runtime": 1468.051, "train_tokens_per_second": 892.164 }, { "epoch": 0.709628506444276, "grad_norm": 0.43305808305740356, "learning_rate": 0.00012951898734177216, "loss": 0.2504, "num_input_tokens_seen": 1311894, "step": 702, "train_runtime": 1469.9164, "train_tokens_per_second": 892.496 }, { "epoch": 0.7106393732625726, "grad_norm": 0.46049821376800537, "learning_rate": 0.00012941772151898735, "loss": 0.1748, "num_input_tokens_seen": 1313542, "step": 703, "train_runtime": 1471.6117, "train_tokens_per_second": 892.587 }, { "epoch": 0.7116502400808693, "grad_norm": 0.5031542778015137, "learning_rate": 0.00012931645569620254, "loss": 0.1891, "num_input_tokens_seen": 1315136, "step": 704, "train_runtime": 1473.2394, "train_tokens_per_second": 892.683 }, { "epoch": 0.7126611068991661, "grad_norm": 0.43103334307670593, "learning_rate": 0.00012921518987341773, "loss": 0.1379, "num_input_tokens_seen": 1316974, "step": 705, "train_runtime": 1474.9401, "train_tokens_per_second": 892.9 }, { "epoch": 0.7136719737174627, "grad_norm": 0.39274096488952637, "learning_rate": 0.00012911392405063292, "loss": 0.1556, "num_input_tokens_seen": 1318902, "step": 706, "train_runtime": 1476.7012, "train_tokens_per_second": 893.141 }, { "epoch": 0.7146828405357594, "grad_norm": 0.4736999571323395, "learning_rate": 0.0001290126582278481, "loss": 0.2823, "num_input_tokens_seen": 1320710, "step": 707, "train_runtime": 1478.3976, "train_tokens_per_second": 893.339 }, { "epoch": 0.7156937073540561, "grad_norm": 0.5220576524734497, "learning_rate": 0.0001289113924050633, "loss": 0.2178, "num_input_tokens_seen": 1322216, "step": 708, "train_runtime": 1480.0601, "train_tokens_per_second": 893.353 }, { "epoch": 0.7167045741723528, "grad_norm": 0.4497409164905548, "learning_rate": 0.0001288101265822785, "loss": 0.2251, "num_input_tokens_seen": 1324022, "step": 709, "train_runtime": 1481.775, "train_tokens_per_second": 893.538 }, { "epoch": 0.7177154409906494, "grad_norm": 0.47773632407188416, "learning_rate": 0.00012870886075949369, "loss": 0.2139, "num_input_tokens_seen": 1325794, "step": 710, "train_runtime": 1483.4324, "train_tokens_per_second": 893.734 }, { "epoch": 0.7187263078089462, "grad_norm": 0.47331786155700684, "learning_rate": 0.00012860759493670888, "loss": 0.1787, "num_input_tokens_seen": 1328058, "step": 711, "train_runtime": 1485.3072, "train_tokens_per_second": 894.13 }, { "epoch": 0.7197371746272428, "grad_norm": 0.4962442219257355, "learning_rate": 0.00012850632911392407, "loss": 0.1936, "num_input_tokens_seen": 1329944, "step": 712, "train_runtime": 1487.0413, "train_tokens_per_second": 894.356 }, { "epoch": 0.7207480414455395, "grad_norm": 0.47528332471847534, "learning_rate": 0.00012840506329113923, "loss": 0.1644, "num_input_tokens_seen": 1331844, "step": 713, "train_runtime": 1488.7594, "train_tokens_per_second": 894.6 }, { "epoch": 0.7217589082638363, "grad_norm": 0.4774949550628662, "learning_rate": 0.00012830379746835445, "loss": 0.1908, "num_input_tokens_seen": 1333816, "step": 714, "train_runtime": 1490.5403, "train_tokens_per_second": 894.854 }, { "epoch": 0.7227697750821329, "grad_norm": 0.43645143508911133, "learning_rate": 0.00012820253164556964, "loss": 0.149, "num_input_tokens_seen": 1335350, "step": 715, "train_runtime": 1492.2145, "train_tokens_per_second": 894.878 }, { "epoch": 0.7237806419004296, "grad_norm": 0.38800936937332153, "learning_rate": 0.0001281012658227848, "loss": 0.2146, "num_input_tokens_seen": 1337112, "step": 716, "train_runtime": 1493.9178, "train_tokens_per_second": 895.037 }, { "epoch": 0.7247915087187263, "grad_norm": 0.49082088470458984, "learning_rate": 0.00012800000000000002, "loss": 0.1886, "num_input_tokens_seen": 1339114, "step": 717, "train_runtime": 1495.7185, "train_tokens_per_second": 895.298 }, { "epoch": 0.725802375537023, "grad_norm": 0.4170313775539398, "learning_rate": 0.0001278987341772152, "loss": 0.1569, "num_input_tokens_seen": 1341268, "step": 718, "train_runtime": 1497.6402, "train_tokens_per_second": 895.588 }, { "epoch": 0.7268132423553196, "grad_norm": 0.46090570092201233, "learning_rate": 0.00012779746835443038, "loss": 0.1811, "num_input_tokens_seen": 1343108, "step": 719, "train_runtime": 1499.4014, "train_tokens_per_second": 895.763 }, { "epoch": 0.7278241091736164, "grad_norm": 0.4252725839614868, "learning_rate": 0.0001276962025316456, "loss": 0.2131, "num_input_tokens_seen": 1344944, "step": 720, "train_runtime": 1501.1569, "train_tokens_per_second": 895.938 }, { "epoch": 0.728834975991913, "grad_norm": 0.44955697655677795, "learning_rate": 0.00012759493670886076, "loss": 0.2252, "num_input_tokens_seen": 1346962, "step": 721, "train_runtime": 1504.7453, "train_tokens_per_second": 895.143 }, { "epoch": 0.7298458428102097, "grad_norm": 0.47491171956062317, "learning_rate": 0.00012749367088607595, "loss": 0.1559, "num_input_tokens_seen": 1348754, "step": 722, "train_runtime": 1506.5053, "train_tokens_per_second": 895.287 }, { "epoch": 0.7308567096285065, "grad_norm": 0.4124668836593628, "learning_rate": 0.00012739240506329117, "loss": 0.2047, "num_input_tokens_seen": 1350670, "step": 723, "train_runtime": 1508.3267, "train_tokens_per_second": 895.476 }, { "epoch": 0.7318675764468031, "grad_norm": 0.30529698729515076, "learning_rate": 0.00012729113924050633, "loss": 0.1088, "num_input_tokens_seen": 1353106, "step": 724, "train_runtime": 1510.3529, "train_tokens_per_second": 895.887 }, { "epoch": 0.7328784432650999, "grad_norm": 0.3167610764503479, "learning_rate": 0.00012718987341772152, "loss": 0.1771, "num_input_tokens_seen": 1355056, "step": 725, "train_runtime": 1512.0713, "train_tokens_per_second": 896.159 }, { "epoch": 0.7338893100833965, "grad_norm": 0.36973923444747925, "learning_rate": 0.0001270886075949367, "loss": 0.2096, "num_input_tokens_seen": 1356638, "step": 726, "train_runtime": 1513.6977, "train_tokens_per_second": 896.241 }, { "epoch": 0.7349001769016932, "grad_norm": 0.5283274054527283, "learning_rate": 0.0001269873417721519, "loss": 0.1622, "num_input_tokens_seen": 1358056, "step": 727, "train_runtime": 1515.2781, "train_tokens_per_second": 896.242 }, { "epoch": 0.7359110437199899, "grad_norm": 0.44161418080329895, "learning_rate": 0.0001268860759493671, "loss": 0.1642, "num_input_tokens_seen": 1359776, "step": 728, "train_runtime": 1516.9189, "train_tokens_per_second": 896.407 }, { "epoch": 0.7369219105382866, "grad_norm": 0.4106193780899048, "learning_rate": 0.00012678481012658228, "loss": 0.1819, "num_input_tokens_seen": 1361576, "step": 729, "train_runtime": 1518.632, "train_tokens_per_second": 896.581 }, { "epoch": 0.7379327773565832, "grad_norm": 0.3663170039653778, "learning_rate": 0.00012668354430379748, "loss": 0.1841, "num_input_tokens_seen": 1363414, "step": 730, "train_runtime": 1520.3902, "train_tokens_per_second": 896.753 }, { "epoch": 0.73894364417488, "grad_norm": 0.45822158455848694, "learning_rate": 0.00012658227848101267, "loss": 0.1727, "num_input_tokens_seen": 1365166, "step": 731, "train_runtime": 1522.1061, "train_tokens_per_second": 896.893 }, { "epoch": 0.7399545109931767, "grad_norm": 0.44998377561569214, "learning_rate": 0.00012648101265822786, "loss": 0.1803, "num_input_tokens_seen": 1366760, "step": 732, "train_runtime": 1523.7404, "train_tokens_per_second": 896.977 }, { "epoch": 0.7409653778114733, "grad_norm": 0.38428956270217896, "learning_rate": 0.00012637974683544305, "loss": 0.1601, "num_input_tokens_seen": 1368492, "step": 733, "train_runtime": 1525.3789, "train_tokens_per_second": 897.149 }, { "epoch": 0.7419762446297701, "grad_norm": 0.41664576530456543, "learning_rate": 0.0001262784810126582, "loss": 0.1784, "num_input_tokens_seen": 1370530, "step": 734, "train_runtime": 1527.1619, "train_tokens_per_second": 897.436 }, { "epoch": 0.7429871114480667, "grad_norm": 0.4322846531867981, "learning_rate": 0.00012617721518987343, "loss": 0.1484, "num_input_tokens_seen": 1372698, "step": 735, "train_runtime": 1529.0505, "train_tokens_per_second": 897.745 }, { "epoch": 0.7439979782663634, "grad_norm": 0.49796196818351746, "learning_rate": 0.00012607594936708862, "loss": 0.2135, "num_input_tokens_seen": 1374798, "step": 736, "train_runtime": 1530.9322, "train_tokens_per_second": 898.014 }, { "epoch": 0.7450088450846601, "grad_norm": 0.40537935495376587, "learning_rate": 0.00012597468354430378, "loss": 0.251, "num_input_tokens_seen": 1376982, "step": 737, "train_runtime": 1532.8699, "train_tokens_per_second": 898.303 }, { "epoch": 0.7460197119029568, "grad_norm": 0.48897862434387207, "learning_rate": 0.000125873417721519, "loss": 0.2775, "num_input_tokens_seen": 1378818, "step": 738, "train_runtime": 1534.5843, "train_tokens_per_second": 898.496 }, { "epoch": 0.7470305787212534, "grad_norm": 0.5688496828079224, "learning_rate": 0.0001257721518987342, "loss": 0.227, "num_input_tokens_seen": 1380380, "step": 739, "train_runtime": 1536.2047, "train_tokens_per_second": 898.565 }, { "epoch": 0.7480414455395502, "grad_norm": 0.390685498714447, "learning_rate": 0.00012567088607594936, "loss": 0.1397, "num_input_tokens_seen": 1382458, "step": 740, "train_runtime": 1538.0695, "train_tokens_per_second": 898.827 }, { "epoch": 0.7490523123578469, "grad_norm": 0.5368296504020691, "learning_rate": 0.00012556962025316457, "loss": 0.1804, "num_input_tokens_seen": 1384230, "step": 741, "train_runtime": 1539.7765, "train_tokens_per_second": 898.981 }, { "epoch": 0.7500631791761435, "grad_norm": 0.4591348469257355, "learning_rate": 0.00012546835443037974, "loss": 0.1778, "num_input_tokens_seen": 1386176, "step": 742, "train_runtime": 1541.5473, "train_tokens_per_second": 899.211 }, { "epoch": 0.7510740459944403, "grad_norm": 0.4368685781955719, "learning_rate": 0.00012536708860759493, "loss": 0.156, "num_input_tokens_seen": 1387826, "step": 743, "train_runtime": 1543.243, "train_tokens_per_second": 899.292 }, { "epoch": 0.7520849128127369, "grad_norm": 0.29662302136421204, "learning_rate": 0.00012526582278481015, "loss": 0.2113, "num_input_tokens_seen": 1390232, "step": 744, "train_runtime": 1545.2493, "train_tokens_per_second": 899.681 }, { "epoch": 0.7530957796310336, "grad_norm": 0.4854196012020111, "learning_rate": 0.0001251645569620253, "loss": 0.1335, "num_input_tokens_seen": 1392116, "step": 745, "train_runtime": 1547.0203, "train_tokens_per_second": 899.869 }, { "epoch": 0.7541066464493303, "grad_norm": 0.6670404076576233, "learning_rate": 0.0001250632911392405, "loss": 0.2498, "num_input_tokens_seen": 1393572, "step": 746, "train_runtime": 1548.6386, "train_tokens_per_second": 899.869 }, { "epoch": 0.755117513267627, "grad_norm": 0.4352905750274658, "learning_rate": 0.00012496202531645572, "loss": 0.1736, "num_input_tokens_seen": 1395382, "step": 747, "train_runtime": 1550.3484, "train_tokens_per_second": 900.044 }, { "epoch": 0.7561283800859236, "grad_norm": 0.475554496049881, "learning_rate": 0.00012486075949367088, "loss": 0.1525, "num_input_tokens_seen": 1397442, "step": 748, "train_runtime": 1552.1008, "train_tokens_per_second": 900.355 }, { "epoch": 0.7571392469042204, "grad_norm": 0.43190351128578186, "learning_rate": 0.00012475949367088607, "loss": 0.1808, "num_input_tokens_seen": 1399870, "step": 749, "train_runtime": 1554.0692, "train_tokens_per_second": 900.777 }, { "epoch": 0.7581501137225171, "grad_norm": 0.4478033781051636, "learning_rate": 0.00012465822784810126, "loss": 0.2439, "num_input_tokens_seen": 1402104, "step": 750, "train_runtime": 1555.9526, "train_tokens_per_second": 901.123 }, { "epoch": 0.7591609805408137, "grad_norm": 0.4629665017127991, "learning_rate": 0.00012455696202531646, "loss": 0.2138, "num_input_tokens_seen": 1403906, "step": 751, "train_runtime": 1559.4725, "train_tokens_per_second": 900.244 }, { "epoch": 0.7601718473591105, "grad_norm": 0.39230385422706604, "learning_rate": 0.00012445569620253165, "loss": 0.1478, "num_input_tokens_seen": 1405970, "step": 752, "train_runtime": 1561.3892, "train_tokens_per_second": 900.461 }, { "epoch": 0.7611827141774071, "grad_norm": 0.5002062320709229, "learning_rate": 0.00012435443037974684, "loss": 0.2248, "num_input_tokens_seen": 1407986, "step": 753, "train_runtime": 1563.1658, "train_tokens_per_second": 900.727 }, { "epoch": 0.7621935809957038, "grad_norm": 0.3833402097225189, "learning_rate": 0.00012425316455696203, "loss": 0.1683, "num_input_tokens_seen": 1409718, "step": 754, "train_runtime": 1564.9194, "train_tokens_per_second": 900.825 }, { "epoch": 0.7632044478140005, "grad_norm": 0.530303418636322, "learning_rate": 0.00012415189873417722, "loss": 0.2111, "num_input_tokens_seen": 1411278, "step": 755, "train_runtime": 1566.5443, "train_tokens_per_second": 900.886 }, { "epoch": 0.7642153146322972, "grad_norm": 0.3445185422897339, "learning_rate": 0.0001240506329113924, "loss": 0.1959, "num_input_tokens_seen": 1413560, "step": 756, "train_runtime": 1568.5295, "train_tokens_per_second": 901.201 }, { "epoch": 0.7652261814505938, "grad_norm": 0.5255396366119385, "learning_rate": 0.0001239493670886076, "loss": 0.2558, "num_input_tokens_seen": 1415670, "step": 757, "train_runtime": 1570.3826, "train_tokens_per_second": 901.481 }, { "epoch": 0.7662370482688906, "grad_norm": 0.3746929168701172, "learning_rate": 0.0001238481012658228, "loss": 0.1443, "num_input_tokens_seen": 1417504, "step": 758, "train_runtime": 1572.121, "train_tokens_per_second": 901.651 }, { "epoch": 0.7672479150871873, "grad_norm": 0.4821506142616272, "learning_rate": 0.00012374683544303798, "loss": 0.235, "num_input_tokens_seen": 1419526, "step": 759, "train_runtime": 1573.9626, "train_tokens_per_second": 901.88 }, { "epoch": 0.7682587819054839, "grad_norm": 0.4334051012992859, "learning_rate": 0.00012364556962025317, "loss": 0.1309, "num_input_tokens_seen": 1421724, "step": 760, "train_runtime": 1575.8729, "train_tokens_per_second": 902.182 }, { "epoch": 0.7692696487237807, "grad_norm": 0.38763320446014404, "learning_rate": 0.00012354430379746836, "loss": 0.2261, "num_input_tokens_seen": 1423704, "step": 761, "train_runtime": 1577.6764, "train_tokens_per_second": 902.406 }, { "epoch": 0.7702805155420773, "grad_norm": 0.400185227394104, "learning_rate": 0.00012344303797468356, "loss": 0.1233, "num_input_tokens_seen": 1425830, "step": 762, "train_runtime": 1579.5407, "train_tokens_per_second": 902.686 }, { "epoch": 0.771291382360374, "grad_norm": 0.47351810336112976, "learning_rate": 0.00012334177215189875, "loss": 0.1551, "num_input_tokens_seen": 1427436, "step": 763, "train_runtime": 1581.2153, "train_tokens_per_second": 902.746 }, { "epoch": 0.7723022491786707, "grad_norm": 0.40420597791671753, "learning_rate": 0.00012324050632911394, "loss": 0.2703, "num_input_tokens_seen": 1429530, "step": 764, "train_runtime": 1583.0653, "train_tokens_per_second": 903.014 }, { "epoch": 0.7733131159969674, "grad_norm": 0.4711056649684906, "learning_rate": 0.00012313924050632913, "loss": 0.1923, "num_input_tokens_seen": 1431692, "step": 765, "train_runtime": 1584.942, "train_tokens_per_second": 903.309 }, { "epoch": 0.774323982815264, "grad_norm": 0.4936767518520355, "learning_rate": 0.0001230379746835443, "loss": 0.1866, "num_input_tokens_seen": 1433506, "step": 766, "train_runtime": 1586.6431, "train_tokens_per_second": 903.484 }, { "epoch": 0.7753348496335608, "grad_norm": 0.4346882402896881, "learning_rate": 0.0001229367088607595, "loss": 0.0903, "num_input_tokens_seen": 1435216, "step": 767, "train_runtime": 1588.3444, "train_tokens_per_second": 903.592 }, { "epoch": 0.7763457164518575, "grad_norm": 0.47223055362701416, "learning_rate": 0.0001228354430379747, "loss": 0.2075, "num_input_tokens_seen": 1437180, "step": 768, "train_runtime": 1590.0702, "train_tokens_per_second": 903.847 }, { "epoch": 0.7773565832701541, "grad_norm": 0.40802159905433655, "learning_rate": 0.00012273417721518986, "loss": 0.1695, "num_input_tokens_seen": 1439174, "step": 769, "train_runtime": 1591.9123, "train_tokens_per_second": 904.054 }, { "epoch": 0.7783674500884509, "grad_norm": 0.5417159795761108, "learning_rate": 0.00012263291139240508, "loss": 0.259, "num_input_tokens_seen": 1440818, "step": 770, "train_runtime": 1593.5367, "train_tokens_per_second": 904.164 }, { "epoch": 0.7793783169067475, "grad_norm": 0.47632548213005066, "learning_rate": 0.00012253164556962027, "loss": 0.2161, "num_input_tokens_seen": 1442724, "step": 771, "train_runtime": 1595.3854, "train_tokens_per_second": 904.311 }, { "epoch": 0.7803891837250442, "grad_norm": 0.4863998293876648, "learning_rate": 0.00012243037974683544, "loss": 0.1861, "num_input_tokens_seen": 1444634, "step": 772, "train_runtime": 1597.1699, "train_tokens_per_second": 904.496 }, { "epoch": 0.7814000505433409, "grad_norm": 0.4289018213748932, "learning_rate": 0.00012232911392405065, "loss": 0.3262, "num_input_tokens_seen": 1446376, "step": 773, "train_runtime": 1598.8017, "train_tokens_per_second": 904.663 }, { "epoch": 0.7824109173616376, "grad_norm": 0.48690351843833923, "learning_rate": 0.00012222784810126582, "loss": 0.1836, "num_input_tokens_seen": 1447954, "step": 774, "train_runtime": 1600.4292, "train_tokens_per_second": 904.729 }, { "epoch": 0.7834217841799342, "grad_norm": 0.45947712659835815, "learning_rate": 0.000122126582278481, "loss": 0.1649, "num_input_tokens_seen": 1449790, "step": 775, "train_runtime": 1602.1404, "train_tokens_per_second": 904.908 }, { "epoch": 0.784432650998231, "grad_norm": 0.44784119725227356, "learning_rate": 0.00012202531645569621, "loss": 0.1773, "num_input_tokens_seen": 1451420, "step": 776, "train_runtime": 1603.7562, "train_tokens_per_second": 905.013 }, { "epoch": 0.7854435178165277, "grad_norm": 0.5048577785491943, "learning_rate": 0.00012192405063291139, "loss": 0.4025, "num_input_tokens_seen": 1453310, "step": 777, "train_runtime": 1605.526, "train_tokens_per_second": 905.192 }, { "epoch": 0.7864543846348243, "grad_norm": 0.37859445810317993, "learning_rate": 0.0001218227848101266, "loss": 0.2033, "num_input_tokens_seen": 1455086, "step": 778, "train_runtime": 1607.2298, "train_tokens_per_second": 905.338 }, { "epoch": 0.7874652514531211, "grad_norm": 0.5107361078262329, "learning_rate": 0.00012172151898734179, "loss": 0.1705, "num_input_tokens_seen": 1456632, "step": 779, "train_runtime": 1608.8468, "train_tokens_per_second": 905.389 }, { "epoch": 0.7884761182714177, "grad_norm": 0.44889283180236816, "learning_rate": 0.00012162025316455696, "loss": 0.1574, "num_input_tokens_seen": 1458412, "step": 780, "train_runtime": 1610.6019, "train_tokens_per_second": 905.507 }, { "epoch": 0.7894869850897144, "grad_norm": 0.3823074698448181, "learning_rate": 0.00012151898734177217, "loss": 0.2528, "num_input_tokens_seen": 1460750, "step": 781, "train_runtime": 1614.3246, "train_tokens_per_second": 904.868 }, { "epoch": 0.7904978519080111, "grad_norm": 0.4243546426296234, "learning_rate": 0.00012141772151898733, "loss": 0.2872, "num_input_tokens_seen": 1463018, "step": 782, "train_runtime": 1616.2762, "train_tokens_per_second": 905.178 }, { "epoch": 0.7915087187263078, "grad_norm": 0.34533020853996277, "learning_rate": 0.00012131645569620254, "loss": 0.2406, "num_input_tokens_seen": 1464998, "step": 783, "train_runtime": 1618.0801, "train_tokens_per_second": 905.393 }, { "epoch": 0.7925195855446044, "grad_norm": 0.33816954493522644, "learning_rate": 0.00012121518987341774, "loss": 0.1489, "num_input_tokens_seen": 1467092, "step": 784, "train_runtime": 1620.0305, "train_tokens_per_second": 905.595 }, { "epoch": 0.7935304523629012, "grad_norm": 0.5090389251708984, "learning_rate": 0.0001211139240506329, "loss": 0.3019, "num_input_tokens_seen": 1468734, "step": 785, "train_runtime": 1621.7232, "train_tokens_per_second": 905.663 }, { "epoch": 0.7945413191811979, "grad_norm": 0.46344900131225586, "learning_rate": 0.00012101265822784811, "loss": 0.1949, "num_input_tokens_seen": 1470256, "step": 786, "train_runtime": 1623.3271, "train_tokens_per_second": 905.705 }, { "epoch": 0.7955521859994946, "grad_norm": 0.5146666169166565, "learning_rate": 0.00012091139240506331, "loss": 0.2443, "num_input_tokens_seen": 1471828, "step": 787, "train_runtime": 1624.9462, "train_tokens_per_second": 905.77 }, { "epoch": 0.7965630528177913, "grad_norm": 0.43645817041397095, "learning_rate": 0.00012081012658227848, "loss": 0.2064, "num_input_tokens_seen": 1473878, "step": 788, "train_runtime": 1626.7993, "train_tokens_per_second": 905.999 }, { "epoch": 0.7975739196360879, "grad_norm": 0.44168621301651, "learning_rate": 0.00012070886075949368, "loss": 0.2864, "num_input_tokens_seen": 1476312, "step": 789, "train_runtime": 1628.7774, "train_tokens_per_second": 906.393 }, { "epoch": 0.7985847864543847, "grad_norm": 0.5032877326011658, "learning_rate": 0.00012060759493670886, "loss": 0.2168, "num_input_tokens_seen": 1478126, "step": 790, "train_runtime": 1630.5462, "train_tokens_per_second": 906.522 }, { "epoch": 0.7995956532726813, "grad_norm": 0.3511337637901306, "learning_rate": 0.00012050632911392405, "loss": 0.2164, "num_input_tokens_seen": 1480092, "step": 791, "train_runtime": 1632.3919, "train_tokens_per_second": 906.701 }, { "epoch": 0.800606520090978, "grad_norm": 0.558936357498169, "learning_rate": 0.00012040506329113925, "loss": 0.2207, "num_input_tokens_seen": 1481796, "step": 792, "train_runtime": 1634.0818, "train_tokens_per_second": 906.807 }, { "epoch": 0.800606520090978, "eval_loss": 0.19605906307697296, "eval_runtime": 61.4416, "eval_samples_per_second": 14.306, "eval_steps_per_second": 7.161, "num_input_tokens_seen": 1481796, "step": 792 }, { "epoch": 0.8016173869092748, "grad_norm": 0.48004817962646484, "learning_rate": 0.00012030379746835443, "loss": 0.2437, "num_input_tokens_seen": 1483304, "step": 793, "train_runtime": 1697.1412, "train_tokens_per_second": 874.002 }, { "epoch": 0.8026282537275714, "grad_norm": 0.37774133682250977, "learning_rate": 0.00012020253164556962, "loss": 0.1135, "num_input_tokens_seen": 1484762, "step": 794, "train_runtime": 1698.7761, "train_tokens_per_second": 874.019 }, { "epoch": 0.8036391205458681, "grad_norm": 0.4917088449001312, "learning_rate": 0.00012010126582278483, "loss": 0.2255, "num_input_tokens_seen": 1486508, "step": 795, "train_runtime": 1700.5321, "train_tokens_per_second": 874.143 }, { "epoch": 0.8046499873641648, "grad_norm": 0.4402884244918823, "learning_rate": 0.00012, "loss": 0.1763, "num_input_tokens_seen": 1488478, "step": 796, "train_runtime": 1702.2929, "train_tokens_per_second": 874.396 }, { "epoch": 0.8056608541824615, "grad_norm": 0.37884581089019775, "learning_rate": 0.0001198987341772152, "loss": 0.193, "num_input_tokens_seen": 1490572, "step": 797, "train_runtime": 1704.0914, "train_tokens_per_second": 874.702 }, { "epoch": 0.8066717210007581, "grad_norm": 0.4645121991634369, "learning_rate": 0.00011979746835443037, "loss": 0.2041, "num_input_tokens_seen": 1492388, "step": 798, "train_runtime": 1705.7437, "train_tokens_per_second": 874.919 }, { "epoch": 0.8076825878190549, "grad_norm": 0.4440683126449585, "learning_rate": 0.00011969620253164558, "loss": 0.2565, "num_input_tokens_seen": 1494258, "step": 799, "train_runtime": 1707.4461, "train_tokens_per_second": 875.142 }, { "epoch": 0.8086934546373515, "grad_norm": 0.3711960017681122, "learning_rate": 0.00011959493670886077, "loss": 0.1793, "num_input_tokens_seen": 1496008, "step": 800, "train_runtime": 1709.1545, "train_tokens_per_second": 875.291 }, { "epoch": 0.8097043214556482, "grad_norm": 0.5635051727294922, "learning_rate": 0.00011949367088607594, "loss": 0.2713, "num_input_tokens_seen": 1497806, "step": 801, "train_runtime": 1710.8502, "train_tokens_per_second": 875.475 }, { "epoch": 0.810715188273945, "grad_norm": 0.3368736505508423, "learning_rate": 0.00011939240506329115, "loss": 0.2824, "num_input_tokens_seen": 1499654, "step": 802, "train_runtime": 1712.5673, "train_tokens_per_second": 875.676 }, { "epoch": 0.8117260550922416, "grad_norm": 0.35640907287597656, "learning_rate": 0.00011929113924050634, "loss": 0.1959, "num_input_tokens_seen": 1502054, "step": 803, "train_runtime": 1714.6426, "train_tokens_per_second": 876.016 }, { "epoch": 0.8127369219105383, "grad_norm": 0.42300862073898315, "learning_rate": 0.00011918987341772152, "loss": 0.1734, "num_input_tokens_seen": 1503636, "step": 804, "train_runtime": 1716.2663, "train_tokens_per_second": 876.109 }, { "epoch": 0.813747788728835, "grad_norm": 0.4077221155166626, "learning_rate": 0.00011908860759493672, "loss": 0.249, "num_input_tokens_seen": 1505588, "step": 805, "train_runtime": 1718.1438, "train_tokens_per_second": 876.288 }, { "epoch": 0.8147586555471317, "grad_norm": 0.5087118148803711, "learning_rate": 0.0001189873417721519, "loss": 0.2233, "num_input_tokens_seen": 1507126, "step": 806, "train_runtime": 1719.7569, "train_tokens_per_second": 876.36 }, { "epoch": 0.8157695223654283, "grad_norm": 0.31490835547447205, "learning_rate": 0.00011888607594936709, "loss": 0.1315, "num_input_tokens_seen": 1509118, "step": 807, "train_runtime": 1721.5542, "train_tokens_per_second": 876.602 }, { "epoch": 0.8167803891837251, "grad_norm": 0.485928475856781, "learning_rate": 0.00011878481012658229, "loss": 0.254, "num_input_tokens_seen": 1510842, "step": 808, "train_runtime": 1723.2535, "train_tokens_per_second": 876.738 }, { "epoch": 0.8177912560020217, "grad_norm": 0.5121615529060364, "learning_rate": 0.00011868354430379747, "loss": 0.1921, "num_input_tokens_seen": 1512260, "step": 809, "train_runtime": 1724.8624, "train_tokens_per_second": 876.742 }, { "epoch": 0.8188021228203184, "grad_norm": 0.5394084453582764, "learning_rate": 0.00011858227848101266, "loss": 0.2328, "num_input_tokens_seen": 1514086, "step": 810, "train_runtime": 1726.572, "train_tokens_per_second": 876.932 }, { "epoch": 0.8198129896386152, "grad_norm": 0.46057066321372986, "learning_rate": 0.00011848101265822787, "loss": 0.2042, "num_input_tokens_seen": 1515896, "step": 811, "train_runtime": 1730.3617, "train_tokens_per_second": 876.057 }, { "epoch": 0.8208238564569118, "grad_norm": 0.428923100233078, "learning_rate": 0.00011837974683544304, "loss": 0.2546, "num_input_tokens_seen": 1518066, "step": 812, "train_runtime": 1732.237, "train_tokens_per_second": 876.362 }, { "epoch": 0.8218347232752085, "grad_norm": 0.43719565868377686, "learning_rate": 0.00011827848101265823, "loss": 0.1651, "num_input_tokens_seen": 1519894, "step": 813, "train_runtime": 1733.9345, "train_tokens_per_second": 876.558 }, { "epoch": 0.8228455900935052, "grad_norm": 0.41401392221450806, "learning_rate": 0.00011817721518987341, "loss": 0.1753, "num_input_tokens_seen": 1521416, "step": 814, "train_runtime": 1735.5397, "train_tokens_per_second": 876.624 }, { "epoch": 0.8238564569118019, "grad_norm": 0.447737455368042, "learning_rate": 0.00011807594936708862, "loss": 0.1801, "num_input_tokens_seen": 1523152, "step": 815, "train_runtime": 1737.3043, "train_tokens_per_second": 876.733 }, { "epoch": 0.8248673237300985, "grad_norm": 0.32408955693244934, "learning_rate": 0.0001179746835443038, "loss": 0.1166, "num_input_tokens_seen": 1525124, "step": 816, "train_runtime": 1739.0719, "train_tokens_per_second": 876.976 }, { "epoch": 0.8258781905483953, "grad_norm": 0.3348199129104614, "learning_rate": 0.00011787341772151898, "loss": 0.2547, "num_input_tokens_seen": 1526764, "step": 817, "train_runtime": 1740.7565, "train_tokens_per_second": 877.069 }, { "epoch": 0.8268890573666919, "grad_norm": 0.35868316888809204, "learning_rate": 0.00011777215189873419, "loss": 0.2158, "num_input_tokens_seen": 1528806, "step": 818, "train_runtime": 1742.5511, "train_tokens_per_second": 877.338 }, { "epoch": 0.8278999241849886, "grad_norm": 0.46953269839286804, "learning_rate": 0.00011767088607594938, "loss": 0.1645, "num_input_tokens_seen": 1530316, "step": 819, "train_runtime": 1744.1514, "train_tokens_per_second": 877.399 }, { "epoch": 0.8289107910032854, "grad_norm": 0.49311771988868713, "learning_rate": 0.00011756962025316456, "loss": 0.2754, "num_input_tokens_seen": 1532088, "step": 820, "train_runtime": 1745.8603, "train_tokens_per_second": 877.555 }, { "epoch": 0.829921657821582, "grad_norm": 0.5105012059211731, "learning_rate": 0.00011746835443037976, "loss": 0.2313, "num_input_tokens_seen": 1534130, "step": 821, "train_runtime": 1747.6999, "train_tokens_per_second": 877.799 }, { "epoch": 0.8309325246398787, "grad_norm": 0.5455875992774963, "learning_rate": 0.00011736708860759494, "loss": 0.1658, "num_input_tokens_seen": 1535566, "step": 822, "train_runtime": 1749.297, "train_tokens_per_second": 877.819 }, { "epoch": 0.8319433914581754, "grad_norm": 0.33632540702819824, "learning_rate": 0.00011726582278481013, "loss": 0.1832, "num_input_tokens_seen": 1537676, "step": 823, "train_runtime": 1751.2157, "train_tokens_per_second": 878.062 }, { "epoch": 0.8329542582764721, "grad_norm": 0.417454332113266, "learning_rate": 0.00011716455696202533, "loss": 0.2208, "num_input_tokens_seen": 1540372, "step": 824, "train_runtime": 1753.4293, "train_tokens_per_second": 878.491 }, { "epoch": 0.8339651250947687, "grad_norm": 0.49717605113983154, "learning_rate": 0.00011706329113924051, "loss": 0.2049, "num_input_tokens_seen": 1542294, "step": 825, "train_runtime": 1755.2116, "train_tokens_per_second": 878.694 }, { "epoch": 0.8349759919130655, "grad_norm": 0.5155264735221863, "learning_rate": 0.0001169620253164557, "loss": 0.297, "num_input_tokens_seen": 1543944, "step": 826, "train_runtime": 1756.8393, "train_tokens_per_second": 878.819 }, { "epoch": 0.8359868587313621, "grad_norm": 0.5160174369812012, "learning_rate": 0.0001168607594936709, "loss": 0.3208, "num_input_tokens_seen": 1545834, "step": 827, "train_runtime": 1758.5485, "train_tokens_per_second": 879.04 }, { "epoch": 0.8369977255496588, "grad_norm": 0.5705915689468384, "learning_rate": 0.00011675949367088608, "loss": 0.3488, "num_input_tokens_seen": 1547776, "step": 828, "train_runtime": 1760.2679, "train_tokens_per_second": 879.284 }, { "epoch": 0.8380085923679556, "grad_norm": 0.48469799757003784, "learning_rate": 0.00011665822784810127, "loss": 0.2096, "num_input_tokens_seen": 1549604, "step": 829, "train_runtime": 1762.0434, "train_tokens_per_second": 879.436 }, { "epoch": 0.8390194591862522, "grad_norm": 0.4165559411048889, "learning_rate": 0.00011655696202531645, "loss": 0.2704, "num_input_tokens_seen": 1551412, "step": 830, "train_runtime": 1763.7986, "train_tokens_per_second": 879.586 }, { "epoch": 0.8400303260045489, "grad_norm": 0.43866249918937683, "learning_rate": 0.00011645569620253166, "loss": 0.2007, "num_input_tokens_seen": 1553322, "step": 831, "train_runtime": 1765.6164, "train_tokens_per_second": 879.762 }, { "epoch": 0.8410411928228456, "grad_norm": 0.36295077204704285, "learning_rate": 0.00011635443037974685, "loss": 0.2139, "num_input_tokens_seen": 1555272, "step": 832, "train_runtime": 1767.3998, "train_tokens_per_second": 879.977 }, { "epoch": 0.8420520596411423, "grad_norm": 0.4608427882194519, "learning_rate": 0.00011625316455696202, "loss": 0.2087, "num_input_tokens_seen": 1557374, "step": 833, "train_runtime": 1769.25, "train_tokens_per_second": 880.245 }, { "epoch": 0.8430629264594389, "grad_norm": 0.3304494321346283, "learning_rate": 0.00011615189873417723, "loss": 0.1256, "num_input_tokens_seen": 1559176, "step": 834, "train_runtime": 1770.9643, "train_tokens_per_second": 880.411 }, { "epoch": 0.8440737932777357, "grad_norm": 0.3980521559715271, "learning_rate": 0.00011605063291139242, "loss": 0.1561, "num_input_tokens_seen": 1561254, "step": 835, "train_runtime": 1772.8262, "train_tokens_per_second": 880.658 }, { "epoch": 0.8450846600960323, "grad_norm": 0.49653252959251404, "learning_rate": 0.0001159493670886076, "loss": 0.2097, "num_input_tokens_seen": 1562938, "step": 836, "train_runtime": 1774.4581, "train_tokens_per_second": 880.797 }, { "epoch": 0.846095526914329, "grad_norm": 0.37524303793907166, "learning_rate": 0.0001158481012658228, "loss": 0.1431, "num_input_tokens_seen": 1564634, "step": 837, "train_runtime": 1776.0892, "train_tokens_per_second": 880.943 }, { "epoch": 0.8471063937326258, "grad_norm": 0.41417282819747925, "learning_rate": 0.00011574683544303796, "loss": 0.1756, "num_input_tokens_seen": 1566696, "step": 838, "train_runtime": 1777.8811, "train_tokens_per_second": 881.215 }, { "epoch": 0.8481172605509224, "grad_norm": 0.32036110758781433, "learning_rate": 0.00011564556962025317, "loss": 0.3549, "num_input_tokens_seen": 1568400, "step": 839, "train_runtime": 1779.6076, "train_tokens_per_second": 881.318 }, { "epoch": 0.849128127369219, "grad_norm": 0.4309079945087433, "learning_rate": 0.00011554430379746837, "loss": 0.2009, "num_input_tokens_seen": 1570560, "step": 840, "train_runtime": 1781.5342, "train_tokens_per_second": 881.577 }, { "epoch": 0.8501389941875158, "grad_norm": 0.36666759848594666, "learning_rate": 0.00011544303797468354, "loss": 0.1309, "num_input_tokens_seen": 1572078, "step": 841, "train_runtime": 1784.9546, "train_tokens_per_second": 880.738 }, { "epoch": 0.8511498610058125, "grad_norm": 0.4371661841869354, "learning_rate": 0.00011534177215189874, "loss": 0.1629, "num_input_tokens_seen": 1573858, "step": 842, "train_runtime": 1786.6094, "train_tokens_per_second": 880.919 }, { "epoch": 0.8521607278241091, "grad_norm": 0.4695513844490051, "learning_rate": 0.00011524050632911395, "loss": 0.2096, "num_input_tokens_seen": 1575802, "step": 843, "train_runtime": 1788.4411, "train_tokens_per_second": 881.104 }, { "epoch": 0.8531715946424059, "grad_norm": 0.5117560029029846, "learning_rate": 0.00011513924050632911, "loss": 0.1798, "num_input_tokens_seen": 1577894, "step": 844, "train_runtime": 1790.3082, "train_tokens_per_second": 881.353 }, { "epoch": 0.8541824614607025, "grad_norm": 0.46726614236831665, "learning_rate": 0.00011503797468354431, "loss": 0.1902, "num_input_tokens_seen": 1579838, "step": 845, "train_runtime": 1792.0991, "train_tokens_per_second": 881.557 }, { "epoch": 0.8551933282789992, "grad_norm": 0.396850049495697, "learning_rate": 0.00011493670886075949, "loss": 0.1679, "num_input_tokens_seen": 1581532, "step": 846, "train_runtime": 1793.8163, "train_tokens_per_second": 881.658 }, { "epoch": 0.856204195097296, "grad_norm": 0.4181012213230133, "learning_rate": 0.00011483544303797468, "loss": 0.2638, "num_input_tokens_seen": 1584082, "step": 847, "train_runtime": 1795.8959, "train_tokens_per_second": 882.057 }, { "epoch": 0.8572150619155926, "grad_norm": 0.5064924359321594, "learning_rate": 0.00011473417721518989, "loss": 0.244, "num_input_tokens_seen": 1585974, "step": 848, "train_runtime": 1797.6786, "train_tokens_per_second": 882.234 }, { "epoch": 0.8582259287338894, "grad_norm": 0.3508239984512329, "learning_rate": 0.00011463291139240506, "loss": 0.2887, "num_input_tokens_seen": 1588014, "step": 849, "train_runtime": 1799.5745, "train_tokens_per_second": 882.439 }, { "epoch": 0.859236795552186, "grad_norm": 0.43819907307624817, "learning_rate": 0.00011453164556962025, "loss": 0.1741, "num_input_tokens_seen": 1589460, "step": 850, "train_runtime": 1801.1844, "train_tokens_per_second": 882.453 }, { "epoch": 0.8602476623704827, "grad_norm": 0.5680981278419495, "learning_rate": 0.00011443037974683546, "loss": 0.2763, "num_input_tokens_seen": 1591552, "step": 851, "train_runtime": 1803.0431, "train_tokens_per_second": 882.703 }, { "epoch": 0.8612585291887794, "grad_norm": 0.47815704345703125, "learning_rate": 0.00011432911392405064, "loss": 0.1554, "num_input_tokens_seen": 1593368, "step": 852, "train_runtime": 1804.8094, "train_tokens_per_second": 882.846 }, { "epoch": 0.8622693960070761, "grad_norm": 0.43788331747055054, "learning_rate": 0.00011422784810126583, "loss": 0.2106, "num_input_tokens_seen": 1595052, "step": 853, "train_runtime": 1806.4393, "train_tokens_per_second": 882.981 }, { "epoch": 0.8632802628253727, "grad_norm": 0.5186537504196167, "learning_rate": 0.000114126582278481, "loss": 0.2235, "num_input_tokens_seen": 1596774, "step": 854, "train_runtime": 1808.1298, "train_tokens_per_second": 883.108 }, { "epoch": 0.8642911296436695, "grad_norm": 0.4398152530193329, "learning_rate": 0.00011402531645569621, "loss": 0.2736, "num_input_tokens_seen": 1598976, "step": 855, "train_runtime": 1810.0631, "train_tokens_per_second": 883.381 }, { "epoch": 0.8653019964619661, "grad_norm": 0.42215922474861145, "learning_rate": 0.0001139240506329114, "loss": 0.1749, "num_input_tokens_seen": 1600644, "step": 856, "train_runtime": 1811.7673, "train_tokens_per_second": 883.471 }, { "epoch": 0.8663128632802628, "grad_norm": 0.44031965732574463, "learning_rate": 0.00011382278481012658, "loss": 0.1371, "num_input_tokens_seen": 1602544, "step": 857, "train_runtime": 1813.5741, "train_tokens_per_second": 883.639 }, { "epoch": 0.8673237300985596, "grad_norm": 0.3823223412036896, "learning_rate": 0.00011372151898734178, "loss": 0.2225, "num_input_tokens_seen": 1604252, "step": 858, "train_runtime": 1815.314, "train_tokens_per_second": 883.733 }, { "epoch": 0.8683345969168562, "grad_norm": 0.5721985697746277, "learning_rate": 0.00011362025316455697, "loss": 0.2417, "num_input_tokens_seen": 1605764, "step": 859, "train_runtime": 1816.9033, "train_tokens_per_second": 883.792 }, { "epoch": 0.8693454637351529, "grad_norm": 0.44026222825050354, "learning_rate": 0.00011351898734177215, "loss": 0.182, "num_input_tokens_seen": 1607886, "step": 860, "train_runtime": 1818.7565, "train_tokens_per_second": 884.058 }, { "epoch": 0.8703563305534496, "grad_norm": 0.440901517868042, "learning_rate": 0.00011341772151898735, "loss": 0.1252, "num_input_tokens_seen": 1609856, "step": 861, "train_runtime": 1820.4279, "train_tokens_per_second": 884.328 }, { "epoch": 0.8713671973717463, "grad_norm": 0.49819907546043396, "learning_rate": 0.00011331645569620253, "loss": 0.2334, "num_input_tokens_seen": 1611762, "step": 862, "train_runtime": 1822.2147, "train_tokens_per_second": 884.507 }, { "epoch": 0.8723780641900429, "grad_norm": 0.5641105771064758, "learning_rate": 0.00011321518987341772, "loss": 0.193, "num_input_tokens_seen": 1613372, "step": 863, "train_runtime": 1823.8516, "train_tokens_per_second": 884.596 }, { "epoch": 0.8733889310083397, "grad_norm": 0.3912726044654846, "learning_rate": 0.00011311392405063293, "loss": 0.1918, "num_input_tokens_seen": 1615290, "step": 864, "train_runtime": 1825.6272, "train_tokens_per_second": 884.786 }, { "epoch": 0.8743997978266363, "grad_norm": 0.4572635591030121, "learning_rate": 0.0001130126582278481, "loss": 0.2682, "num_input_tokens_seen": 1617398, "step": 865, "train_runtime": 1827.4296, "train_tokens_per_second": 885.067 }, { "epoch": 0.875410664644933, "grad_norm": 0.4834804832935333, "learning_rate": 0.0001129113924050633, "loss": 0.1872, "num_input_tokens_seen": 1619110, "step": 866, "train_runtime": 1829.1819, "train_tokens_per_second": 885.155 }, { "epoch": 0.8764215314632298, "grad_norm": 0.4358219504356384, "learning_rate": 0.0001128101265822785, "loss": 0.1598, "num_input_tokens_seen": 1621110, "step": 867, "train_runtime": 1830.9625, "train_tokens_per_second": 885.387 }, { "epoch": 0.8774323982815264, "grad_norm": 0.5084313750267029, "learning_rate": 0.00011270886075949368, "loss": 0.2373, "num_input_tokens_seen": 1623138, "step": 868, "train_runtime": 1832.8883, "train_tokens_per_second": 885.563 }, { "epoch": 0.8784432650998231, "grad_norm": 0.43396979570388794, "learning_rate": 0.00011260759493670887, "loss": 0.1147, "num_input_tokens_seen": 1624772, "step": 869, "train_runtime": 1834.5083, "train_tokens_per_second": 885.672 }, { "epoch": 0.8794541319181198, "grad_norm": 0.4286526143550873, "learning_rate": 0.00011250632911392404, "loss": 0.1809, "num_input_tokens_seen": 1627124, "step": 870, "train_runtime": 1836.56, "train_tokens_per_second": 885.963 }, { "epoch": 0.8804649987364165, "grad_norm": 0.3508733808994293, "learning_rate": 0.00011240506329113925, "loss": 0.2037, "num_input_tokens_seen": 1628594, "step": 871, "train_runtime": 1840.2075, "train_tokens_per_second": 885.006 }, { "epoch": 0.8814758655547131, "grad_norm": 0.45954668521881104, "learning_rate": 0.00011230379746835444, "loss": 0.1671, "num_input_tokens_seen": 1630380, "step": 872, "train_runtime": 1841.9197, "train_tokens_per_second": 885.153 }, { "epoch": 0.8824867323730099, "grad_norm": 0.6832849979400635, "learning_rate": 0.00011220253164556962, "loss": 0.2442, "num_input_tokens_seen": 1632128, "step": 873, "train_runtime": 1843.5621, "train_tokens_per_second": 885.312 }, { "epoch": 0.8834975991913065, "grad_norm": 0.48650091886520386, "learning_rate": 0.00011210126582278482, "loss": 0.33, "num_input_tokens_seen": 1634194, "step": 874, "train_runtime": 1845.4676, "train_tokens_per_second": 885.518 }, { "epoch": 0.8845084660096032, "grad_norm": 0.565884530544281, "learning_rate": 0.00011200000000000001, "loss": 0.2553, "num_input_tokens_seen": 1635922, "step": 875, "train_runtime": 1847.2051, "train_tokens_per_second": 885.62 }, { "epoch": 0.8855193328279, "grad_norm": 0.445090651512146, "learning_rate": 0.00011189873417721519, "loss": 0.1394, "num_input_tokens_seen": 1638068, "step": 876, "train_runtime": 1849.1313, "train_tokens_per_second": 885.858 }, { "epoch": 0.8865301996461966, "grad_norm": 0.5211514830589294, "learning_rate": 0.0001117974683544304, "loss": 0.2277, "num_input_tokens_seen": 1639642, "step": 877, "train_runtime": 1850.7581, "train_tokens_per_second": 885.93 }, { "epoch": 0.8875410664644933, "grad_norm": 0.4003089964389801, "learning_rate": 0.00011169620253164557, "loss": 0.2932, "num_input_tokens_seen": 1641240, "step": 878, "train_runtime": 1852.3803, "train_tokens_per_second": 886.017 }, { "epoch": 0.88855193328279, "grad_norm": 0.40674495697021484, "learning_rate": 0.00011159493670886076, "loss": 0.1979, "num_input_tokens_seen": 1643092, "step": 879, "train_runtime": 1854.1722, "train_tokens_per_second": 886.159 }, { "epoch": 0.8895628001010867, "grad_norm": 0.5176137089729309, "learning_rate": 0.00011149367088607597, "loss": 0.2057, "num_input_tokens_seen": 1644710, "step": 880, "train_runtime": 1855.8244, "train_tokens_per_second": 886.242 }, { "epoch": 0.8905736669193833, "grad_norm": 0.38269540667533875, "learning_rate": 0.00011139240506329114, "loss": 0.2282, "num_input_tokens_seen": 1646118, "step": 881, "train_runtime": 1857.4097, "train_tokens_per_second": 886.244 }, { "epoch": 0.8915845337376801, "grad_norm": 0.38651415705680847, "learning_rate": 0.00011129113924050633, "loss": 0.1238, "num_input_tokens_seen": 1647746, "step": 882, "train_runtime": 1859.0404, "train_tokens_per_second": 886.342 }, { "epoch": 0.8925954005559767, "grad_norm": 0.4340237081050873, "learning_rate": 0.00011118987341772154, "loss": 0.163, "num_input_tokens_seen": 1649270, "step": 883, "train_runtime": 1860.6619, "train_tokens_per_second": 886.389 }, { "epoch": 0.8936062673742734, "grad_norm": 0.34248411655426025, "learning_rate": 0.00011108860759493672, "loss": 0.1758, "num_input_tokens_seen": 1652040, "step": 884, "train_runtime": 1862.8963, "train_tokens_per_second": 886.813 }, { "epoch": 0.8946171341925702, "grad_norm": 0.36963558197021484, "learning_rate": 0.0001109873417721519, "loss": 0.1487, "num_input_tokens_seen": 1654126, "step": 885, "train_runtime": 1864.6948, "train_tokens_per_second": 887.076 }, { "epoch": 0.8956280010108668, "grad_norm": 0.6001124382019043, "learning_rate": 0.00011088607594936708, "loss": 0.2062, "num_input_tokens_seen": 1655560, "step": 886, "train_runtime": 1866.3026, "train_tokens_per_second": 887.08 }, { "epoch": 0.8966388678291635, "grad_norm": 0.47406721115112305, "learning_rate": 0.00011078481012658229, "loss": 0.1831, "num_input_tokens_seen": 1657012, "step": 887, "train_runtime": 1867.9057, "train_tokens_per_second": 887.096 }, { "epoch": 0.8976497346474602, "grad_norm": 0.5258237719535828, "learning_rate": 0.00011068354430379748, "loss": 0.2067, "num_input_tokens_seen": 1658512, "step": 888, "train_runtime": 1869.5274, "train_tokens_per_second": 887.129 }, { "epoch": 0.8986606014657569, "grad_norm": 0.3512861132621765, "learning_rate": 0.00011058227848101266, "loss": 0.1172, "num_input_tokens_seen": 1660652, "step": 889, "train_runtime": 1871.3802, "train_tokens_per_second": 887.394 }, { "epoch": 0.8996714682840535, "grad_norm": 0.5059172511100769, "learning_rate": 0.00011048101265822786, "loss": 0.2965, "num_input_tokens_seen": 1662352, "step": 890, "train_runtime": 1873.0933, "train_tokens_per_second": 887.49 }, { "epoch": 0.9006823351023503, "grad_norm": 0.3939543068408966, "learning_rate": 0.00011037974683544305, "loss": 0.1308, "num_input_tokens_seen": 1664158, "step": 891, "train_runtime": 1874.8841, "train_tokens_per_second": 887.606 }, { "epoch": 0.901693201920647, "grad_norm": 0.4661056399345398, "learning_rate": 0.00011027848101265823, "loss": 0.2556, "num_input_tokens_seen": 1666046, "step": 892, "train_runtime": 1876.6867, "train_tokens_per_second": 887.759 }, { "epoch": 0.9027040687389436, "grad_norm": 0.3504481017589569, "learning_rate": 0.00011017721518987343, "loss": 0.1371, "num_input_tokens_seen": 1667806, "step": 893, "train_runtime": 1878.402, "train_tokens_per_second": 887.886 }, { "epoch": 0.9037149355572404, "grad_norm": 0.4064381718635559, "learning_rate": 0.00011007594936708861, "loss": 0.1452, "num_input_tokens_seen": 1669604, "step": 894, "train_runtime": 1880.1036, "train_tokens_per_second": 888.038 }, { "epoch": 0.904725802375537, "grad_norm": 0.4747428297996521, "learning_rate": 0.0001099746835443038, "loss": 0.1422, "num_input_tokens_seen": 1671732, "step": 895, "train_runtime": 1881.9667, "train_tokens_per_second": 888.29 }, { "epoch": 0.9057366691938337, "grad_norm": 0.5185026526451111, "learning_rate": 0.000109873417721519, "loss": 0.165, "num_input_tokens_seen": 1673544, "step": 896, "train_runtime": 1883.6717, "train_tokens_per_second": 888.448 }, { "epoch": 0.9067475360121304, "grad_norm": 0.490278959274292, "learning_rate": 0.00010977215189873418, "loss": 0.1568, "num_input_tokens_seen": 1675252, "step": 897, "train_runtime": 1885.2941, "train_tokens_per_second": 888.589 }, { "epoch": 0.9077584028304271, "grad_norm": 0.5024723410606384, "learning_rate": 0.00010967088607594937, "loss": 0.1858, "num_input_tokens_seen": 1676740, "step": 898, "train_runtime": 1886.951, "train_tokens_per_second": 888.598 }, { "epoch": 0.9087692696487237, "grad_norm": 0.4894983470439911, "learning_rate": 0.00010956962025316458, "loss": 0.2375, "num_input_tokens_seen": 1678430, "step": 899, "train_runtime": 1888.6525, "train_tokens_per_second": 888.692 }, { "epoch": 0.9097801364670205, "grad_norm": 0.6311760544776917, "learning_rate": 0.00010946835443037976, "loss": 0.3262, "num_input_tokens_seen": 1679904, "step": 900, "train_runtime": 1890.2784, "train_tokens_per_second": 888.707 }, { "epoch": 0.9107910032853171, "grad_norm": 0.44200921058654785, "learning_rate": 0.00010936708860759495, "loss": 0.1833, "num_input_tokens_seen": 1682032, "step": 901, "train_runtime": 1894.2738, "train_tokens_per_second": 887.956 }, { "epoch": 0.9118018701036138, "grad_norm": 0.44553565979003906, "learning_rate": 0.00010926582278481012, "loss": 0.2013, "num_input_tokens_seen": 1683836, "step": 902, "train_runtime": 1895.917, "train_tokens_per_second": 888.138 }, { "epoch": 0.9128127369219106, "grad_norm": 0.4635987877845764, "learning_rate": 0.00010916455696202533, "loss": 0.1742, "num_input_tokens_seen": 1685886, "step": 903, "train_runtime": 1897.7649, "train_tokens_per_second": 888.353 }, { "epoch": 0.9138236037402072, "grad_norm": 0.49628710746765137, "learning_rate": 0.00010906329113924052, "loss": 0.2352, "num_input_tokens_seen": 1687828, "step": 904, "train_runtime": 1899.5327, "train_tokens_per_second": 888.549 }, { "epoch": 0.9148344705585039, "grad_norm": 0.4151511490345001, "learning_rate": 0.0001089620253164557, "loss": 0.1543, "num_input_tokens_seen": 1689976, "step": 905, "train_runtime": 1901.4789, "train_tokens_per_second": 888.769 }, { "epoch": 0.9158453373768006, "grad_norm": 0.4763267934322357, "learning_rate": 0.00010886075949367089, "loss": 0.2248, "num_input_tokens_seen": 1692238, "step": 906, "train_runtime": 1903.4353, "train_tokens_per_second": 889.044 }, { "epoch": 0.9168562041950973, "grad_norm": 0.5129389762878418, "learning_rate": 0.00010875949367088606, "loss": 0.263, "num_input_tokens_seen": 1693838, "step": 907, "train_runtime": 1905.0418, "train_tokens_per_second": 889.134 }, { "epoch": 0.9178670710133939, "grad_norm": 0.4036412835121155, "learning_rate": 0.00010865822784810127, "loss": 0.1658, "num_input_tokens_seen": 1695652, "step": 908, "train_runtime": 1906.8261, "train_tokens_per_second": 889.254 }, { "epoch": 0.9188779378316907, "grad_norm": 0.4002031683921814, "learning_rate": 0.00010855696202531646, "loss": 0.1565, "num_input_tokens_seen": 1697394, "step": 909, "train_runtime": 1908.5323, "train_tokens_per_second": 889.371 }, { "epoch": 0.9198888046499873, "grad_norm": 0.37694117426872253, "learning_rate": 0.00010845569620253164, "loss": 0.1316, "num_input_tokens_seen": 1699096, "step": 910, "train_runtime": 1910.1776, "train_tokens_per_second": 889.496 }, { "epoch": 0.9208996714682841, "grad_norm": 0.45809051394462585, "learning_rate": 0.00010835443037974684, "loss": 0.1461, "num_input_tokens_seen": 1700584, "step": 911, "train_runtime": 1911.777, "train_tokens_per_second": 889.531 }, { "epoch": 0.9219105382865808, "grad_norm": 0.3088432252407074, "learning_rate": 0.00010825316455696203, "loss": 0.1236, "num_input_tokens_seen": 1702466, "step": 912, "train_runtime": 1913.5441, "train_tokens_per_second": 889.693 }, { "epoch": 0.9229214051048774, "grad_norm": 0.37983253598213196, "learning_rate": 0.00010815189873417721, "loss": 0.2337, "num_input_tokens_seen": 1704424, "step": 913, "train_runtime": 1915.3946, "train_tokens_per_second": 889.855 }, { "epoch": 0.9239322719231742, "grad_norm": 0.4673791825771332, "learning_rate": 0.00010805063291139241, "loss": 0.2648, "num_input_tokens_seen": 1706634, "step": 914, "train_runtime": 1917.3303, "train_tokens_per_second": 890.11 }, { "epoch": 0.9249431387414708, "grad_norm": 0.3637625277042389, "learning_rate": 0.00010794936708860759, "loss": 0.2364, "num_input_tokens_seen": 1708190, "step": 915, "train_runtime": 1918.9495, "train_tokens_per_second": 890.169 }, { "epoch": 0.9259540055597675, "grad_norm": 0.5477350354194641, "learning_rate": 0.00010784810126582278, "loss": 0.2038, "num_input_tokens_seen": 1710078, "step": 916, "train_runtime": 1920.6526, "train_tokens_per_second": 890.363 }, { "epoch": 0.9269648723780642, "grad_norm": 0.37270766496658325, "learning_rate": 0.00010774683544303799, "loss": 0.3118, "num_input_tokens_seen": 1712108, "step": 917, "train_runtime": 1922.451, "train_tokens_per_second": 890.586 }, { "epoch": 0.9279757391963609, "grad_norm": 0.47466373443603516, "learning_rate": 0.00010764556962025316, "loss": 0.1641, "num_input_tokens_seen": 1713890, "step": 918, "train_runtime": 1924.1644, "train_tokens_per_second": 890.719 }, { "epoch": 0.9289866060146575, "grad_norm": 0.34475672245025635, "learning_rate": 0.00010754430379746835, "loss": 0.1686, "num_input_tokens_seen": 1715514, "step": 919, "train_runtime": 1925.8389, "train_tokens_per_second": 890.788 }, { "epoch": 0.9299974728329543, "grad_norm": 0.4040345251560211, "learning_rate": 0.00010744303797468356, "loss": 0.2292, "num_input_tokens_seen": 1717310, "step": 920, "train_runtime": 1927.4771, "train_tokens_per_second": 890.963 }, { "epoch": 0.931008339651251, "grad_norm": 0.31060582399368286, "learning_rate": 0.00010734177215189874, "loss": 0.1675, "num_input_tokens_seen": 1719370, "step": 921, "train_runtime": 1929.2779, "train_tokens_per_second": 891.199 }, { "epoch": 0.9320192064695476, "grad_norm": 0.5087334513664246, "learning_rate": 0.00010724050632911393, "loss": 0.2097, "num_input_tokens_seen": 1720898, "step": 922, "train_runtime": 1930.8921, "train_tokens_per_second": 891.245 }, { "epoch": 0.9330300732878444, "grad_norm": 0.49266955256462097, "learning_rate": 0.0001071392405063291, "loss": 0.1669, "num_input_tokens_seen": 1722320, "step": 923, "train_runtime": 1932.4963, "train_tokens_per_second": 891.241 }, { "epoch": 0.934040940106141, "grad_norm": 0.4892714321613312, "learning_rate": 0.00010703797468354431, "loss": 0.1801, "num_input_tokens_seen": 1724026, "step": 924, "train_runtime": 1934.1203, "train_tokens_per_second": 891.375 }, { "epoch": 0.9350518069244377, "grad_norm": 0.38709861040115356, "learning_rate": 0.0001069367088607595, "loss": 0.2007, "num_input_tokens_seen": 1725858, "step": 925, "train_runtime": 1935.8307, "train_tokens_per_second": 891.534 }, { "epoch": 0.9360626737427344, "grad_norm": 0.35277503728866577, "learning_rate": 0.00010683544303797468, "loss": 0.1485, "num_input_tokens_seen": 1728054, "step": 926, "train_runtime": 1937.7581, "train_tokens_per_second": 891.78 }, { "epoch": 0.9370735405610311, "grad_norm": 0.4426005482673645, "learning_rate": 0.00010673417721518988, "loss": 0.24, "num_input_tokens_seen": 1729916, "step": 927, "train_runtime": 1939.4776, "train_tokens_per_second": 891.949 }, { "epoch": 0.9380844073793277, "grad_norm": 0.500525176525116, "learning_rate": 0.00010663291139240507, "loss": 0.1672, "num_input_tokens_seen": 1731898, "step": 928, "train_runtime": 1941.2709, "train_tokens_per_second": 892.146 }, { "epoch": 0.9390952741976245, "grad_norm": 0.4140866696834564, "learning_rate": 0.00010653164556962025, "loss": 0.1954, "num_input_tokens_seen": 1733716, "step": 929, "train_runtime": 1942.9892, "train_tokens_per_second": 892.293 }, { "epoch": 0.9401061410159212, "grad_norm": 0.47640150785446167, "learning_rate": 0.00010643037974683545, "loss": 0.1977, "num_input_tokens_seen": 1735832, "step": 930, "train_runtime": 1944.8405, "train_tokens_per_second": 892.532 }, { "epoch": 0.9411170078342178, "grad_norm": 0.36944422125816345, "learning_rate": 0.00010632911392405063, "loss": 0.122, "num_input_tokens_seen": 1737384, "step": 931, "train_runtime": 1948.2939, "train_tokens_per_second": 891.746 }, { "epoch": 0.9421278746525146, "grad_norm": 0.5811285972595215, "learning_rate": 0.00010622784810126582, "loss": 0.2328, "num_input_tokens_seen": 1739056, "step": 932, "train_runtime": 1949.9299, "train_tokens_per_second": 891.856 }, { "epoch": 0.9431387414708112, "grad_norm": 0.34662237763404846, "learning_rate": 0.00010612658227848103, "loss": 0.1625, "num_input_tokens_seen": 1740828, "step": 933, "train_runtime": 1951.7454, "train_tokens_per_second": 891.934 }, { "epoch": 0.9441496082891079, "grad_norm": 0.4259108603000641, "learning_rate": 0.0001060253164556962, "loss": 0.2795, "num_input_tokens_seen": 1742910, "step": 934, "train_runtime": 1953.5277, "train_tokens_per_second": 892.186 }, { "epoch": 0.9451604751074046, "grad_norm": 0.48577380180358887, "learning_rate": 0.0001059240506329114, "loss": 0.2043, "num_input_tokens_seen": 1744572, "step": 935, "train_runtime": 1955.1964, "train_tokens_per_second": 892.275 }, { "epoch": 0.9461713419257013, "grad_norm": 0.43631938099861145, "learning_rate": 0.0001058227848101266, "loss": 0.2168, "num_input_tokens_seen": 1746228, "step": 936, "train_runtime": 1956.8999, "train_tokens_per_second": 892.344 }, { "epoch": 0.9471822087439979, "grad_norm": 0.5370936393737793, "learning_rate": 0.00010572151898734178, "loss": 0.1935, "num_input_tokens_seen": 1747712, "step": 937, "train_runtime": 1958.5506, "train_tokens_per_second": 892.35 }, { "epoch": 0.9481930755622947, "grad_norm": 0.42087486386299133, "learning_rate": 0.00010562025316455697, "loss": 0.1533, "num_input_tokens_seen": 1749338, "step": 938, "train_runtime": 1960.1919, "train_tokens_per_second": 892.432 }, { "epoch": 0.9492039423805914, "grad_norm": 0.40185943245887756, "learning_rate": 0.00010551898734177214, "loss": 0.1454, "num_input_tokens_seen": 1751606, "step": 939, "train_runtime": 1962.0743, "train_tokens_per_second": 892.732 }, { "epoch": 0.950214809198888, "grad_norm": 0.48460665345191956, "learning_rate": 0.00010541772151898735, "loss": 0.1571, "num_input_tokens_seen": 1753256, "step": 940, "train_runtime": 1963.7585, "train_tokens_per_second": 892.806 }, { "epoch": 0.9512256760171848, "grad_norm": 0.38726770877838135, "learning_rate": 0.00010531645569620254, "loss": 0.1855, "num_input_tokens_seen": 1755012, "step": 941, "train_runtime": 1965.4757, "train_tokens_per_second": 892.92 }, { "epoch": 0.9522365428354814, "grad_norm": 0.4741378724575043, "learning_rate": 0.00010521518987341772, "loss": 0.2114, "num_input_tokens_seen": 1757092, "step": 942, "train_runtime": 1967.4445, "train_tokens_per_second": 893.083 }, { "epoch": 0.9532474096537781, "grad_norm": 0.4324609637260437, "learning_rate": 0.00010511392405063292, "loss": 0.1409, "num_input_tokens_seen": 1759050, "step": 943, "train_runtime": 1969.2276, "train_tokens_per_second": 893.269 }, { "epoch": 0.9542582764720748, "grad_norm": 0.44481709599494934, "learning_rate": 0.00010501265822784811, "loss": 0.15, "num_input_tokens_seen": 1761294, "step": 944, "train_runtime": 1971.1068, "train_tokens_per_second": 893.556 }, { "epoch": 0.9552691432903715, "grad_norm": 0.5897843241691589, "learning_rate": 0.00010491139240506329, "loss": 0.2701, "num_input_tokens_seen": 1762946, "step": 945, "train_runtime": 1972.804, "train_tokens_per_second": 893.624 }, { "epoch": 0.9562800101086681, "grad_norm": 0.4730886220932007, "learning_rate": 0.0001048101265822785, "loss": 0.2201, "num_input_tokens_seen": 1764748, "step": 946, "train_runtime": 1974.5699, "train_tokens_per_second": 893.738 }, { "epoch": 0.9572908769269649, "grad_norm": 0.40383127331733704, "learning_rate": 0.00010470886075949367, "loss": 0.1941, "num_input_tokens_seen": 1766552, "step": 947, "train_runtime": 1976.2317, "train_tokens_per_second": 893.899 }, { "epoch": 0.9583017437452616, "grad_norm": 0.4525023102760315, "learning_rate": 0.00010460759493670886, "loss": 0.1174, "num_input_tokens_seen": 1768384, "step": 948, "train_runtime": 1978.0176, "train_tokens_per_second": 894.018 }, { "epoch": 0.9593126105635582, "grad_norm": 0.4887596070766449, "learning_rate": 0.00010450632911392407, "loss": 0.2909, "num_input_tokens_seen": 1770632, "step": 949, "train_runtime": 1979.9106, "train_tokens_per_second": 894.299 }, { "epoch": 0.960323477381855, "grad_norm": 0.41555631160736084, "learning_rate": 0.00010440506329113924, "loss": 0.1795, "num_input_tokens_seen": 1772254, "step": 950, "train_runtime": 1981.5407, "train_tokens_per_second": 894.382 }, { "epoch": 0.9613343442001516, "grad_norm": 0.47362515330314636, "learning_rate": 0.00010430379746835443, "loss": 0.1567, "num_input_tokens_seen": 1774112, "step": 951, "train_runtime": 1983.2649, "train_tokens_per_second": 894.541 }, { "epoch": 0.9623452110184483, "grad_norm": 0.31603702902793884, "learning_rate": 0.00010420253164556964, "loss": 0.2471, "num_input_tokens_seen": 1776174, "step": 952, "train_runtime": 1985.193, "train_tokens_per_second": 894.711 }, { "epoch": 0.963356077836745, "grad_norm": 0.5144686102867126, "learning_rate": 0.00010410126582278482, "loss": 0.1522, "num_input_tokens_seen": 1777928, "step": 953, "train_runtime": 1986.8906, "train_tokens_per_second": 894.829 }, { "epoch": 0.9643669446550417, "grad_norm": 0.4585995674133301, "learning_rate": 0.00010400000000000001, "loss": 0.2274, "num_input_tokens_seen": 1779882, "step": 954, "train_runtime": 1988.6373, "train_tokens_per_second": 895.026 }, { "epoch": 0.9653778114733383, "grad_norm": 0.4180617332458496, "learning_rate": 0.00010389873417721518, "loss": 0.1751, "num_input_tokens_seen": 1782042, "step": 955, "train_runtime": 1990.5086, "train_tokens_per_second": 895.27 }, { "epoch": 0.9663886782916351, "grad_norm": 0.4923889636993408, "learning_rate": 0.00010379746835443039, "loss": 0.2123, "num_input_tokens_seen": 1783590, "step": 956, "train_runtime": 1992.1379, "train_tokens_per_second": 895.315 }, { "epoch": 0.9673995451099318, "grad_norm": 0.3163554072380066, "learning_rate": 0.00010369620253164558, "loss": 0.1705, "num_input_tokens_seen": 1785550, "step": 957, "train_runtime": 1993.9263, "train_tokens_per_second": 895.494 }, { "epoch": 0.9684104119282284, "grad_norm": 0.4780999720096588, "learning_rate": 0.00010359493670886076, "loss": 0.1776, "num_input_tokens_seen": 1787542, "step": 958, "train_runtime": 1995.6758, "train_tokens_per_second": 895.708 }, { "epoch": 0.9694212787465252, "grad_norm": 0.40335267782211304, "learning_rate": 0.00010349367088607596, "loss": 0.2025, "num_input_tokens_seen": 1789302, "step": 959, "train_runtime": 1997.4394, "train_tokens_per_second": 895.798 }, { "epoch": 0.9704321455648218, "grad_norm": 0.38821494579315186, "learning_rate": 0.00010339240506329115, "loss": 0.157, "num_input_tokens_seen": 1790948, "step": 960, "train_runtime": 1999.1173, "train_tokens_per_second": 895.869 }, { "epoch": 0.9714430123831185, "grad_norm": 0.4874069094657898, "learning_rate": 0.00010329113924050633, "loss": 0.1973, "num_input_tokens_seen": 1792550, "step": 961, "train_runtime": 2002.5561, "train_tokens_per_second": 895.131 }, { "epoch": 0.9724538792014152, "grad_norm": 0.47805511951446533, "learning_rate": 0.00010318987341772153, "loss": 0.2067, "num_input_tokens_seen": 1794244, "step": 962, "train_runtime": 2004.2911, "train_tokens_per_second": 895.201 }, { "epoch": 0.9734647460197119, "grad_norm": 0.4922966957092285, "learning_rate": 0.0001030886075949367, "loss": 0.217, "num_input_tokens_seen": 1796822, "step": 963, "train_runtime": 2006.3891, "train_tokens_per_second": 895.55 }, { "epoch": 0.9744756128380085, "grad_norm": 0.4031835198402405, "learning_rate": 0.0001029873417721519, "loss": 0.1446, "num_input_tokens_seen": 1798388, "step": 964, "train_runtime": 2008.0338, "train_tokens_per_second": 895.596 }, { "epoch": 0.9754864796563053, "grad_norm": 0.38097310066223145, "learning_rate": 0.0001028860759493671, "loss": 0.1828, "num_input_tokens_seen": 1799948, "step": 965, "train_runtime": 2009.7162, "train_tokens_per_second": 895.623 }, { "epoch": 0.976497346474602, "grad_norm": 0.46160629391670227, "learning_rate": 0.00010278481012658227, "loss": 0.1712, "num_input_tokens_seen": 1801522, "step": 966, "train_runtime": 2011.3349, "train_tokens_per_second": 895.685 }, { "epoch": 0.9775082132928986, "grad_norm": 0.38964974880218506, "learning_rate": 0.00010268354430379747, "loss": 0.1581, "num_input_tokens_seen": 1803924, "step": 967, "train_runtime": 2013.3514, "train_tokens_per_second": 895.981 }, { "epoch": 0.9785190801111954, "grad_norm": 0.5489251613616943, "learning_rate": 0.00010258227848101268, "loss": 0.1597, "num_input_tokens_seen": 1805646, "step": 968, "train_runtime": 2014.9986, "train_tokens_per_second": 896.103 }, { "epoch": 0.979529946929492, "grad_norm": 0.4700818359851837, "learning_rate": 0.00010248101265822784, "loss": 0.1419, "num_input_tokens_seen": 1807420, "step": 969, "train_runtime": 2016.6913, "train_tokens_per_second": 896.23 }, { "epoch": 0.9805408137477887, "grad_norm": 0.41527441143989563, "learning_rate": 0.00010237974683544305, "loss": 0.1869, "num_input_tokens_seen": 1809092, "step": 970, "train_runtime": 2018.3856, "train_tokens_per_second": 896.306 }, { "epoch": 0.9815516805660854, "grad_norm": 0.4509820342063904, "learning_rate": 0.00010227848101265822, "loss": 0.2115, "num_input_tokens_seen": 1810918, "step": 971, "train_runtime": 2020.1121, "train_tokens_per_second": 896.444 }, { "epoch": 0.9825625473843821, "grad_norm": 0.42594748735427856, "learning_rate": 0.00010217721518987342, "loss": 0.1725, "num_input_tokens_seen": 1812822, "step": 972, "train_runtime": 2021.8401, "train_tokens_per_second": 896.62 }, { "epoch": 0.9835734142026787, "grad_norm": 0.3903284966945648, "learning_rate": 0.00010207594936708862, "loss": 0.2107, "num_input_tokens_seen": 1814844, "step": 973, "train_runtime": 2023.6509, "train_tokens_per_second": 896.817 }, { "epoch": 0.9845842810209755, "grad_norm": 0.4419352412223816, "learning_rate": 0.0001019746835443038, "loss": 0.2286, "num_input_tokens_seen": 1816696, "step": 974, "train_runtime": 2025.4299, "train_tokens_per_second": 896.943 }, { "epoch": 0.9855951478392722, "grad_norm": 0.32668042182922363, "learning_rate": 0.00010187341772151899, "loss": 0.1398, "num_input_tokens_seen": 1818574, "step": 975, "train_runtime": 2027.2656, "train_tokens_per_second": 897.058 }, { "epoch": 0.9866060146575689, "grad_norm": 0.46488189697265625, "learning_rate": 0.00010177215189873419, "loss": 0.1968, "num_input_tokens_seen": 1820238, "step": 976, "train_runtime": 2028.9558, "train_tokens_per_second": 897.13 }, { "epoch": 0.9876168814758656, "grad_norm": 0.41473039984703064, "learning_rate": 0.00010167088607594937, "loss": 0.1952, "num_input_tokens_seen": 1822212, "step": 977, "train_runtime": 2030.7573, "train_tokens_per_second": 897.307 }, { "epoch": 0.9886277482941622, "grad_norm": 0.5555244088172913, "learning_rate": 0.00010156962025316456, "loss": 0.2162, "num_input_tokens_seen": 1824152, "step": 978, "train_runtime": 2032.5897, "train_tokens_per_second": 897.452 }, { "epoch": 0.989638615112459, "grad_norm": 0.5394989252090454, "learning_rate": 0.00010146835443037974, "loss": 0.1803, "num_input_tokens_seen": 1825594, "step": 979, "train_runtime": 2034.1999, "train_tokens_per_second": 897.451 }, { "epoch": 0.9906494819307556, "grad_norm": 0.531579852104187, "learning_rate": 0.00010136708860759494, "loss": 0.2835, "num_input_tokens_seen": 1827552, "step": 980, "train_runtime": 2035.9638, "train_tokens_per_second": 897.635 }, { "epoch": 0.9916603487490523, "grad_norm": 0.43535366654396057, "learning_rate": 0.00010126582278481013, "loss": 0.1601, "num_input_tokens_seen": 1829358, "step": 981, "train_runtime": 2037.686, "train_tokens_per_second": 897.762 }, { "epoch": 0.992671215567349, "grad_norm": 0.5188285708427429, "learning_rate": 0.00010116455696202531, "loss": 0.1547, "num_input_tokens_seen": 1830736, "step": 982, "train_runtime": 2039.2779, "train_tokens_per_second": 897.737 }, { "epoch": 0.9936820823856457, "grad_norm": 0.4486296474933624, "learning_rate": 0.00010106329113924051, "loss": 0.3112, "num_input_tokens_seen": 1833394, "step": 983, "train_runtime": 2041.4343, "train_tokens_per_second": 898.091 }, { "epoch": 0.9946929492039424, "grad_norm": 0.4547290802001953, "learning_rate": 0.0001009620253164557, "loss": 0.2592, "num_input_tokens_seen": 1835190, "step": 984, "train_runtime": 2043.195, "train_tokens_per_second": 898.196 }, { "epoch": 0.9957038160222391, "grad_norm": 0.5215474367141724, "learning_rate": 0.00010086075949367088, "loss": 0.1686, "num_input_tokens_seen": 1836778, "step": 985, "train_runtime": 2044.8837, "train_tokens_per_second": 898.231 }, { "epoch": 0.9967146828405358, "grad_norm": 0.5124213695526123, "learning_rate": 0.00010075949367088609, "loss": 0.1822, "num_input_tokens_seen": 1838628, "step": 986, "train_runtime": 2046.6339, "train_tokens_per_second": 898.367 }, { "epoch": 0.9977255496588324, "grad_norm": 0.4229728877544403, "learning_rate": 0.00010065822784810126, "loss": 0.1431, "num_input_tokens_seen": 1840538, "step": 987, "train_runtime": 2048.4102, "train_tokens_per_second": 898.52 }, { "epoch": 0.9987364164771292, "grad_norm": 0.45670852065086365, "learning_rate": 0.00010055696202531646, "loss": 0.1699, "num_input_tokens_seen": 1842408, "step": 988, "train_runtime": 2050.1812, "train_tokens_per_second": 898.656 }, { "epoch": 0.9997472832954258, "grad_norm": 0.5166110992431641, "learning_rate": 0.00010045569620253166, "loss": 0.2698, "num_input_tokens_seen": 1844106, "step": 989, "train_runtime": 2051.8893, "train_tokens_per_second": 898.736 }, { "epoch": 1.0, "grad_norm": 0.7430378794670105, "learning_rate": 0.00010035443037974684, "loss": 0.0709, "num_input_tokens_seen": 1844288, "step": 990, "train_runtime": 2053.7136, "train_tokens_per_second": 898.026 }, { "epoch": 1.0, "eval_loss": 0.19176971912384033, "eval_runtime": 61.5512, "eval_samples_per_second": 14.281, "eval_steps_per_second": 7.149, "num_input_tokens_seen": 1844288, "step": 990 }, { "epoch": 1.0010108668182967, "grad_norm": 0.24361146986484528, "learning_rate": 0.00010025316455696203, "loss": 0.046, "num_input_tokens_seen": 1845740, "step": 991, "train_runtime": 2119.0572, "train_tokens_per_second": 871.019 }, { "epoch": 1.0020217336365933, "grad_norm": 0.3321000635623932, "learning_rate": 0.00010015189873417723, "loss": 0.094, "num_input_tokens_seen": 1847776, "step": 992, "train_runtime": 2120.9125, "train_tokens_per_second": 871.217 }, { "epoch": 1.0030326004548902, "grad_norm": 0.27356022596359253, "learning_rate": 0.00010005063291139241, "loss": 0.062, "num_input_tokens_seen": 1849706, "step": 993, "train_runtime": 2122.7041, "train_tokens_per_second": 871.391 }, { "epoch": 1.0040434672731868, "grad_norm": 0.2503027617931366, "learning_rate": 9.99493670886076e-05, "loss": 0.1359, "num_input_tokens_seen": 1851240, "step": 994, "train_runtime": 2124.317, "train_tokens_per_second": 871.452 }, { "epoch": 1.0050543340914835, "grad_norm": 0.2093895673751831, "learning_rate": 9.984810126582279e-05, "loss": 0.1028, "num_input_tokens_seen": 1853212, "step": 995, "train_runtime": 2126.1284, "train_tokens_per_second": 871.637 }, { "epoch": 1.0060652009097801, "grad_norm": 0.2690771520137787, "learning_rate": 9.974683544303798e-05, "loss": 0.0303, "num_input_tokens_seen": 1855100, "step": 996, "train_runtime": 2127.8927, "train_tokens_per_second": 871.801 }, { "epoch": 1.0070760677280768, "grad_norm": 0.22197206318378448, "learning_rate": 9.964556962025316e-05, "loss": 0.0914, "num_input_tokens_seen": 1856994, "step": 997, "train_runtime": 2129.6679, "train_tokens_per_second": 871.964 }, { "epoch": 1.0080869345463734, "grad_norm": 0.34467798471450806, "learning_rate": 9.954430379746836e-05, "loss": 0.0718, "num_input_tokens_seen": 1858826, "step": 998, "train_runtime": 2131.4066, "train_tokens_per_second": 872.112 }, { "epoch": 1.0090978013646703, "grad_norm": 0.20582760870456696, "learning_rate": 9.944303797468355e-05, "loss": 0.0431, "num_input_tokens_seen": 1860690, "step": 999, "train_runtime": 2133.1821, "train_tokens_per_second": 872.26 }, { "epoch": 1.010108668182967, "grad_norm": 0.3075924217700958, "learning_rate": 9.934177215189873e-05, "loss": 0.0431, "num_input_tokens_seen": 1862246, "step": 1000, "train_runtime": 2134.804, "train_tokens_per_second": 872.326 }, { "epoch": 1.0111195350012636, "grad_norm": 0.2964280843734741, "learning_rate": 9.924050632911392e-05, "loss": 0.0318, "num_input_tokens_seen": 1863944, "step": 1001, "train_runtime": 2136.4715, "train_tokens_per_second": 872.44 }, { "epoch": 1.0121304018195603, "grad_norm": 0.3516748547554016, "learning_rate": 9.913924050632913e-05, "loss": 0.0513, "num_input_tokens_seen": 1865368, "step": 1002, "train_runtime": 2138.0769, "train_tokens_per_second": 872.451 }, { "epoch": 1.013141268637857, "grad_norm": 0.2860864996910095, "learning_rate": 9.90379746835443e-05, "loss": 0.0489, "num_input_tokens_seen": 1867136, "step": 1003, "train_runtime": 2139.7771, "train_tokens_per_second": 872.584 }, { "epoch": 1.0141521354561536, "grad_norm": 0.37862107157707214, "learning_rate": 9.89367088607595e-05, "loss": 0.178, "num_input_tokens_seen": 1869088, "step": 1004, "train_runtime": 2141.5819, "train_tokens_per_second": 872.76 }, { "epoch": 1.0151630022744504, "grad_norm": 0.3571180999279022, "learning_rate": 9.883544303797469e-05, "loss": 0.0284, "num_input_tokens_seen": 1871130, "step": 1005, "train_runtime": 2143.4425, "train_tokens_per_second": 872.956 }, { "epoch": 1.016173869092747, "grad_norm": 0.26994094252586365, "learning_rate": 9.873417721518988e-05, "loss": 0.1106, "num_input_tokens_seen": 1872784, "step": 1006, "train_runtime": 2145.1338, "train_tokens_per_second": 873.038 }, { "epoch": 1.0171847359110437, "grad_norm": 0.2408159077167511, "learning_rate": 9.863291139240507e-05, "loss": 0.0723, "num_input_tokens_seen": 1874410, "step": 1007, "train_runtime": 2146.7525, "train_tokens_per_second": 873.137 }, { "epoch": 1.0181956027293404, "grad_norm": 0.3475908637046814, "learning_rate": 9.853164556962026e-05, "loss": 0.0311, "num_input_tokens_seen": 1876104, "step": 1008, "train_runtime": 2148.4439, "train_tokens_per_second": 873.239 }, { "epoch": 1.019206469547637, "grad_norm": 0.40700891613960266, "learning_rate": 9.843037974683545e-05, "loss": 0.1947, "num_input_tokens_seen": 1878062, "step": 1009, "train_runtime": 2150.2693, "train_tokens_per_second": 873.408 }, { "epoch": 1.0202173363659337, "grad_norm": 0.3501214385032654, "learning_rate": 9.832911392405064e-05, "loss": 0.0469, "num_input_tokens_seen": 1879806, "step": 1010, "train_runtime": 2151.9607, "train_tokens_per_second": 873.532 }, { "epoch": 1.0212282031842306, "grad_norm": 0.40707865357398987, "learning_rate": 9.822784810126583e-05, "loss": 0.0656, "num_input_tokens_seen": 1881208, "step": 1011, "train_runtime": 2153.5599, "train_tokens_per_second": 873.534 }, { "epoch": 1.0222390700025272, "grad_norm": 0.34942948818206787, "learning_rate": 9.812658227848102e-05, "loss": 0.0218, "num_input_tokens_seen": 1883406, "step": 1012, "train_runtime": 2155.4902, "train_tokens_per_second": 873.772 }, { "epoch": 1.0232499368208239, "grad_norm": 0.3891485035419464, "learning_rate": 9.80253164556962e-05, "loss": 0.0482, "num_input_tokens_seen": 1885370, "step": 1013, "train_runtime": 2157.2709, "train_tokens_per_second": 873.961 }, { "epoch": 1.0242608036391205, "grad_norm": 0.5246986150741577, "learning_rate": 9.79240506329114e-05, "loss": 0.0606, "num_input_tokens_seen": 1886950, "step": 1014, "train_runtime": 2158.9591, "train_tokens_per_second": 874.009 }, { "epoch": 1.0252716704574172, "grad_norm": 0.5961692929267883, "learning_rate": 9.78227848101266e-05, "loss": 0.0907, "num_input_tokens_seen": 1888814, "step": 1015, "train_runtime": 2160.6831, "train_tokens_per_second": 874.174 }, { "epoch": 1.0262825372757138, "grad_norm": 0.4271422326564789, "learning_rate": 9.772151898734177e-05, "loss": 0.0645, "num_input_tokens_seen": 1890906, "step": 1016, "train_runtime": 2162.5297, "train_tokens_per_second": 874.395 }, { "epoch": 1.0272934040940107, "grad_norm": 0.4589087665081024, "learning_rate": 9.762025316455696e-05, "loss": 0.0707, "num_input_tokens_seen": 1892428, "step": 1017, "train_runtime": 2164.1205, "train_tokens_per_second": 874.456 }, { "epoch": 1.0283042709123074, "grad_norm": 0.24373966455459595, "learning_rate": 9.751898734177217e-05, "loss": 0.104, "num_input_tokens_seen": 1893974, "step": 1018, "train_runtime": 2165.709, "train_tokens_per_second": 874.528 }, { "epoch": 1.029315137730604, "grad_norm": 0.45167598128318787, "learning_rate": 9.741772151898734e-05, "loss": 0.0858, "num_input_tokens_seen": 1896382, "step": 1019, "train_runtime": 2167.6871, "train_tokens_per_second": 874.841 }, { "epoch": 1.0303260045489007, "grad_norm": 0.27746036648750305, "learning_rate": 9.731645569620254e-05, "loss": 0.057, "num_input_tokens_seen": 1898498, "step": 1020, "train_runtime": 2169.5488, "train_tokens_per_second": 875.066 }, { "epoch": 1.0313368713671973, "grad_norm": 0.39703670144081116, "learning_rate": 9.721518987341773e-05, "loss": 0.0855, "num_input_tokens_seen": 1900310, "step": 1021, "train_runtime": 2173.0011, "train_tokens_per_second": 874.509 }, { "epoch": 1.032347738185494, "grad_norm": 0.3907689154148102, "learning_rate": 9.711392405063292e-05, "loss": 0.1593, "num_input_tokens_seen": 1902106, "step": 1022, "train_runtime": 2174.6974, "train_tokens_per_second": 874.653 }, { "epoch": 1.0333586050037908, "grad_norm": 0.3423595428466797, "learning_rate": 9.701265822784811e-05, "loss": 0.0361, "num_input_tokens_seen": 1903878, "step": 1023, "train_runtime": 2176.3963, "train_tokens_per_second": 874.785 }, { "epoch": 1.0343694718220875, "grad_norm": 0.42263948917388916, "learning_rate": 9.69113924050633e-05, "loss": 0.0662, "num_input_tokens_seen": 1905900, "step": 1024, "train_runtime": 2178.2753, "train_tokens_per_second": 874.958 }, { "epoch": 1.0353803386403841, "grad_norm": 0.27596285939216614, "learning_rate": 9.681012658227848e-05, "loss": 0.0496, "num_input_tokens_seen": 1907698, "step": 1025, "train_runtime": 2179.9902, "train_tokens_per_second": 875.095 }, { "epoch": 1.0363912054586808, "grad_norm": 0.3455818295478821, "learning_rate": 9.670886075949368e-05, "loss": 0.0935, "num_input_tokens_seen": 1910000, "step": 1026, "train_runtime": 2181.9243, "train_tokens_per_second": 875.374 }, { "epoch": 1.0374020722769774, "grad_norm": 0.3340929448604584, "learning_rate": 9.660759493670887e-05, "loss": 0.0975, "num_input_tokens_seen": 1912230, "step": 1027, "train_runtime": 2183.7967, "train_tokens_per_second": 875.645 }, { "epoch": 1.038412939095274, "grad_norm": 0.40362825989723206, "learning_rate": 9.650632911392405e-05, "loss": 0.0635, "num_input_tokens_seen": 1914156, "step": 1028, "train_runtime": 2185.6328, "train_tokens_per_second": 875.79 }, { "epoch": 1.039423805913571, "grad_norm": 0.2972779870033264, "learning_rate": 9.640506329113924e-05, "loss": 0.0416, "num_input_tokens_seen": 1916246, "step": 1029, "train_runtime": 2187.4457, "train_tokens_per_second": 876.02 }, { "epoch": 1.0404346727318676, "grad_norm": 0.4286695122718811, "learning_rate": 9.630379746835444e-05, "loss": 0.0973, "num_input_tokens_seen": 1918102, "step": 1030, "train_runtime": 2189.1716, "train_tokens_per_second": 876.177 }, { "epoch": 1.0414455395501643, "grad_norm": 0.4273298382759094, "learning_rate": 9.620253164556962e-05, "loss": 0.1216, "num_input_tokens_seen": 1919908, "step": 1031, "train_runtime": 2190.8848, "train_tokens_per_second": 876.316 }, { "epoch": 1.042456406368461, "grad_norm": 0.36308878660202026, "learning_rate": 9.610126582278481e-05, "loss": 0.1528, "num_input_tokens_seen": 1921780, "step": 1032, "train_runtime": 2192.6132, "train_tokens_per_second": 876.479 }, { "epoch": 1.0434672731867576, "grad_norm": 0.33895182609558105, "learning_rate": 9.6e-05, "loss": 0.1029, "num_input_tokens_seen": 1923268, "step": 1033, "train_runtime": 2194.2234, "train_tokens_per_second": 876.514 }, { "epoch": 1.0444781400050542, "grad_norm": 0.2617810368537903, "learning_rate": 9.58987341772152e-05, "loss": 0.0807, "num_input_tokens_seen": 1925508, "step": 1034, "train_runtime": 2196.1433, "train_tokens_per_second": 876.768 }, { "epoch": 1.045489006823351, "grad_norm": 0.2915429472923279, "learning_rate": 9.579746835443038e-05, "loss": 0.0973, "num_input_tokens_seen": 1927592, "step": 1035, "train_runtime": 2198.0043, "train_tokens_per_second": 876.974 }, { "epoch": 1.0464998736416478, "grad_norm": 0.30873245000839233, "learning_rate": 9.569620253164557e-05, "loss": 0.0949, "num_input_tokens_seen": 1929746, "step": 1036, "train_runtime": 2199.9238, "train_tokens_per_second": 877.188 }, { "epoch": 1.0475107404599444, "grad_norm": 0.359919935464859, "learning_rate": 9.559493670886077e-05, "loss": 0.0556, "num_input_tokens_seen": 1931610, "step": 1037, "train_runtime": 2201.6888, "train_tokens_per_second": 877.331 }, { "epoch": 1.048521607278241, "grad_norm": 0.2546060383319855, "learning_rate": 9.549367088607596e-05, "loss": 0.0726, "num_input_tokens_seen": 1933750, "step": 1038, "train_runtime": 2203.5409, "train_tokens_per_second": 877.565 }, { "epoch": 1.0495324740965377, "grad_norm": 0.3829679787158966, "learning_rate": 9.539240506329115e-05, "loss": 0.2009, "num_input_tokens_seen": 1935630, "step": 1039, "train_runtime": 2205.3721, "train_tokens_per_second": 877.689 }, { "epoch": 1.0505433409148344, "grad_norm": 0.4177955985069275, "learning_rate": 9.529113924050634e-05, "loss": 0.101, "num_input_tokens_seen": 1937598, "step": 1040, "train_runtime": 2207.165, "train_tokens_per_second": 877.867 }, { "epoch": 1.0515542077331312, "grad_norm": 0.45883163809776306, "learning_rate": 9.518987341772152e-05, "loss": 0.1335, "num_input_tokens_seen": 1939094, "step": 1041, "train_runtime": 2208.789, "train_tokens_per_second": 877.899 }, { "epoch": 1.052565074551428, "grad_norm": 0.4552958905696869, "learning_rate": 9.508860759493672e-05, "loss": 0.0738, "num_input_tokens_seen": 1941070, "step": 1042, "train_runtime": 2210.5737, "train_tokens_per_second": 878.084 }, { "epoch": 1.0535759413697245, "grad_norm": 0.18470849096775055, "learning_rate": 9.498734177215191e-05, "loss": 0.0279, "num_input_tokens_seen": 1942698, "step": 1043, "train_runtime": 2212.2018, "train_tokens_per_second": 878.174 }, { "epoch": 1.0545868081880212, "grad_norm": 0.4260298013687134, "learning_rate": 9.488607594936709e-05, "loss": 0.1243, "num_input_tokens_seen": 1944222, "step": 1044, "train_runtime": 2213.8126, "train_tokens_per_second": 878.223 }, { "epoch": 1.0555976750063178, "grad_norm": 0.3968278169631958, "learning_rate": 9.478481012658228e-05, "loss": 0.0851, "num_input_tokens_seen": 1946298, "step": 1045, "train_runtime": 2215.6159, "train_tokens_per_second": 878.446 }, { "epoch": 1.0566085418246145, "grad_norm": 0.2895992696285248, "learning_rate": 9.468354430379748e-05, "loss": 0.0401, "num_input_tokens_seen": 1947932, "step": 1046, "train_runtime": 2217.3417, "train_tokens_per_second": 878.499 }, { "epoch": 1.0576194086429114, "grad_norm": 0.4029696583747864, "learning_rate": 9.458227848101266e-05, "loss": 0.1037, "num_input_tokens_seen": 1950306, "step": 1047, "train_runtime": 2219.2727, "train_tokens_per_second": 878.804 }, { "epoch": 1.058630275461208, "grad_norm": 0.3831733167171478, "learning_rate": 9.448101265822785e-05, "loss": 0.1348, "num_input_tokens_seen": 1951976, "step": 1048, "train_runtime": 2220.9575, "train_tokens_per_second": 878.889 }, { "epoch": 1.0596411422795047, "grad_norm": 0.3044146001338959, "learning_rate": 9.437974683544304e-05, "loss": 0.0806, "num_input_tokens_seen": 1953982, "step": 1049, "train_runtime": 2222.8203, "train_tokens_per_second": 879.055 }, { "epoch": 1.0606520090978013, "grad_norm": 0.36417829990386963, "learning_rate": 9.427848101265823e-05, "loss": 0.0968, "num_input_tokens_seen": 1956104, "step": 1050, "train_runtime": 2224.6377, "train_tokens_per_second": 879.291 }, { "epoch": 1.061662875916098, "grad_norm": 0.2965594530105591, "learning_rate": 9.417721518987342e-05, "loss": 0.0781, "num_input_tokens_seen": 1957770, "step": 1051, "train_runtime": 2228.4921, "train_tokens_per_second": 878.518 }, { "epoch": 1.0626737427343946, "grad_norm": 0.3719140589237213, "learning_rate": 9.407594936708861e-05, "loss": 0.1011, "num_input_tokens_seen": 1959422, "step": 1052, "train_runtime": 2230.1841, "train_tokens_per_second": 878.592 }, { "epoch": 1.0636846095526915, "grad_norm": 0.3414093852043152, "learning_rate": 9.397468354430379e-05, "loss": 0.1451, "num_input_tokens_seen": 1961164, "step": 1053, "train_runtime": 2231.9, "train_tokens_per_second": 878.697 }, { "epoch": 1.0646954763709882, "grad_norm": 0.2993382513523102, "learning_rate": 9.3873417721519e-05, "loss": 0.0429, "num_input_tokens_seen": 1962830, "step": 1054, "train_runtime": 2233.5124, "train_tokens_per_second": 878.809 }, { "epoch": 1.0657063431892848, "grad_norm": 0.3396962881088257, "learning_rate": 9.377215189873419e-05, "loss": 0.1145, "num_input_tokens_seen": 1965386, "step": 1055, "train_runtime": 2235.5603, "train_tokens_per_second": 879.147 }, { "epoch": 1.0667172100075815, "grad_norm": 0.3782525658607483, "learning_rate": 9.367088607594936e-05, "loss": 0.0931, "num_input_tokens_seen": 1967074, "step": 1056, "train_runtime": 2237.2015, "train_tokens_per_second": 879.257 }, { "epoch": 1.0677280768258781, "grad_norm": 0.5178813934326172, "learning_rate": 9.356962025316456e-05, "loss": 0.0713, "num_input_tokens_seen": 1969174, "step": 1057, "train_runtime": 2239.1319, "train_tokens_per_second": 879.436 }, { "epoch": 1.068738943644175, "grad_norm": 0.31324502825737, "learning_rate": 9.346835443037976e-05, "loss": 0.0796, "num_input_tokens_seen": 1970990, "step": 1058, "train_runtime": 2240.8356, "train_tokens_per_second": 879.578 }, { "epoch": 1.0697498104624716, "grad_norm": 0.26674196124076843, "learning_rate": 9.336708860759494e-05, "loss": 0.0412, "num_input_tokens_seen": 1972654, "step": 1059, "train_runtime": 2242.4661, "train_tokens_per_second": 879.681 }, { "epoch": 1.0707606772807683, "grad_norm": 0.3870038092136383, "learning_rate": 9.326582278481013e-05, "loss": 0.1371, "num_input_tokens_seen": 1974310, "step": 1060, "train_runtime": 2244.0988, "train_tokens_per_second": 879.779 }, { "epoch": 1.071771544099065, "grad_norm": 0.27661511301994324, "learning_rate": 9.316455696202532e-05, "loss": 0.1257, "num_input_tokens_seen": 1976672, "step": 1061, "train_runtime": 2246.1201, "train_tokens_per_second": 880.038 }, { "epoch": 1.0727824109173616, "grad_norm": 0.45711833238601685, "learning_rate": 9.306329113924051e-05, "loss": 0.0916, "num_input_tokens_seen": 1978514, "step": 1062, "train_runtime": 2247.8339, "train_tokens_per_second": 880.187 }, { "epoch": 1.0737932777356582, "grad_norm": 0.3385152816772461, "learning_rate": 9.29620253164557e-05, "loss": 0.0559, "num_input_tokens_seen": 1979866, "step": 1063, "train_runtime": 2249.4216, "train_tokens_per_second": 880.167 }, { "epoch": 1.074804144553955, "grad_norm": 0.5051232576370239, "learning_rate": 9.286075949367089e-05, "loss": 0.0513, "num_input_tokens_seen": 1981886, "step": 1064, "train_runtime": 2251.2888, "train_tokens_per_second": 880.334 }, { "epoch": 1.0758150113722518, "grad_norm": 0.4586871266365051, "learning_rate": 9.275949367088608e-05, "loss": 0.0684, "num_input_tokens_seen": 1983562, "step": 1065, "train_runtime": 2252.9276, "train_tokens_per_second": 880.438 }, { "epoch": 1.0768258781905484, "grad_norm": 0.2923198938369751, "learning_rate": 9.265822784810127e-05, "loss": 0.1598, "num_input_tokens_seen": 1985662, "step": 1066, "train_runtime": 2254.7797, "train_tokens_per_second": 880.646 }, { "epoch": 1.077836745008845, "grad_norm": 0.297481507062912, "learning_rate": 9.255696202531646e-05, "loss": 0.1192, "num_input_tokens_seen": 1987774, "step": 1067, "train_runtime": 2256.5919, "train_tokens_per_second": 880.874 }, { "epoch": 1.0788476118271417, "grad_norm": 0.2412688434123993, "learning_rate": 9.245569620253165e-05, "loss": 0.0521, "num_input_tokens_seen": 1989582, "step": 1068, "train_runtime": 2258.3519, "train_tokens_per_second": 880.988 }, { "epoch": 1.0798584786454384, "grad_norm": 0.31675273180007935, "learning_rate": 9.235443037974683e-05, "loss": 0.0476, "num_input_tokens_seen": 1991786, "step": 1069, "train_runtime": 2260.2833, "train_tokens_per_second": 881.211 }, { "epoch": 1.0808693454637353, "grad_norm": 0.3629102408885956, "learning_rate": 9.225316455696204e-05, "loss": 0.0311, "num_input_tokens_seen": 1994004, "step": 1070, "train_runtime": 2262.153, "train_tokens_per_second": 881.463 }, { "epoch": 1.081880212282032, "grad_norm": 0.45810672640800476, "learning_rate": 9.215189873417723e-05, "loss": 0.0772, "num_input_tokens_seen": 1995720, "step": 1071, "train_runtime": 2263.8917, "train_tokens_per_second": 881.544 }, { "epoch": 1.0828910791003286, "grad_norm": 0.38692861795425415, "learning_rate": 9.20506329113924e-05, "loss": 0.0693, "num_input_tokens_seen": 1997650, "step": 1072, "train_runtime": 2265.6152, "train_tokens_per_second": 881.725 }, { "epoch": 1.0839019459186252, "grad_norm": 0.34584349393844604, "learning_rate": 9.19493670886076e-05, "loss": 0.0416, "num_input_tokens_seen": 1999524, "step": 1073, "train_runtime": 2267.2896, "train_tokens_per_second": 881.901 }, { "epoch": 1.0849128127369219, "grad_norm": 0.3601796627044678, "learning_rate": 9.18481012658228e-05, "loss": 0.1123, "num_input_tokens_seen": 2001770, "step": 1074, "train_runtime": 2269.2289, "train_tokens_per_second": 882.137 }, { "epoch": 1.0859236795552185, "grad_norm": 0.32827287912368774, "learning_rate": 9.174683544303798e-05, "loss": 0.126, "num_input_tokens_seen": 2003678, "step": 1075, "train_runtime": 2270.9486, "train_tokens_per_second": 882.309 }, { "epoch": 1.0869345463735154, "grad_norm": 0.3239614963531494, "learning_rate": 9.164556962025317e-05, "loss": 0.1015, "num_input_tokens_seen": 2005346, "step": 1076, "train_runtime": 2272.5704, "train_tokens_per_second": 882.413 }, { "epoch": 1.087945413191812, "grad_norm": 0.4321143627166748, "learning_rate": 9.154430379746836e-05, "loss": 0.0358, "num_input_tokens_seen": 2006840, "step": 1077, "train_runtime": 2274.1903, "train_tokens_per_second": 882.442 }, { "epoch": 1.0889562800101087, "grad_norm": 0.2403334379196167, "learning_rate": 9.144303797468355e-05, "loss": 0.0312, "num_input_tokens_seen": 2008588, "step": 1078, "train_runtime": 2275.966, "train_tokens_per_second": 882.521 }, { "epoch": 1.0899671468284053, "grad_norm": 0.3006885051727295, "learning_rate": 9.134177215189874e-05, "loss": 0.022, "num_input_tokens_seen": 2010390, "step": 1079, "train_runtime": 2277.6646, "train_tokens_per_second": 882.654 }, { "epoch": 1.090978013646702, "grad_norm": 0.2884374260902405, "learning_rate": 9.124050632911393e-05, "loss": 0.026, "num_input_tokens_seen": 2012638, "step": 1080, "train_runtime": 2279.6622, "train_tokens_per_second": 882.867 }, { "epoch": 1.0919888804649986, "grad_norm": 0.3214394152164459, "learning_rate": 9.113924050632912e-05, "loss": 0.1656, "num_input_tokens_seen": 2014266, "step": 1081, "train_runtime": 2283.3275, "train_tokens_per_second": 882.163 }, { "epoch": 1.0929997472832955, "grad_norm": 0.39283737540245056, "learning_rate": 9.103797468354431e-05, "loss": 0.0515, "num_input_tokens_seen": 2016072, "step": 1082, "train_runtime": 2285.0962, "train_tokens_per_second": 882.27 }, { "epoch": 1.0940106141015922, "grad_norm": 0.3431110382080078, "learning_rate": 9.09367088607595e-05, "loss": 0.053, "num_input_tokens_seen": 2017770, "step": 1083, "train_runtime": 2286.7899, "train_tokens_per_second": 882.359 }, { "epoch": 1.0950214809198888, "grad_norm": 0.32653939723968506, "learning_rate": 9.083544303797468e-05, "loss": 0.0447, "num_input_tokens_seen": 2019542, "step": 1084, "train_runtime": 2288.5158, "train_tokens_per_second": 882.468 }, { "epoch": 1.0960323477381855, "grad_norm": 0.242202028632164, "learning_rate": 9.073417721518987e-05, "loss": 0.0291, "num_input_tokens_seen": 2021506, "step": 1085, "train_runtime": 2290.3281, "train_tokens_per_second": 882.627 }, { "epoch": 1.0970432145564821, "grad_norm": 0.3730691969394684, "learning_rate": 9.063291139240506e-05, "loss": 0.0508, "num_input_tokens_seen": 2023396, "step": 1086, "train_runtime": 2292.152, "train_tokens_per_second": 882.749 }, { "epoch": 1.0980540813747788, "grad_norm": 0.39965662360191345, "learning_rate": 9.053164556962025e-05, "loss": 0.0432, "num_input_tokens_seen": 2025186, "step": 1087, "train_runtime": 2293.9077, "train_tokens_per_second": 882.854 }, { "epoch": 1.0990649481930757, "grad_norm": 0.34458547830581665, "learning_rate": 9.043037974683544e-05, "loss": 0.0679, "num_input_tokens_seen": 2026682, "step": 1088, "train_runtime": 2295.5735, "train_tokens_per_second": 882.865 }, { "epoch": 1.1000758150113723, "grad_norm": 0.34177741408348083, "learning_rate": 9.032911392405064e-05, "loss": 0.1758, "num_input_tokens_seen": 2028208, "step": 1089, "train_runtime": 2297.2198, "train_tokens_per_second": 882.897 }, { "epoch": 1.101086681829669, "grad_norm": 0.48805323243141174, "learning_rate": 9.022784810126583e-05, "loss": 0.0477, "num_input_tokens_seen": 2029754, "step": 1090, "train_runtime": 2298.8366, "train_tokens_per_second": 882.948 }, { "epoch": 1.1020975486479656, "grad_norm": 0.288225919008255, "learning_rate": 9.012658227848102e-05, "loss": 0.0549, "num_input_tokens_seen": 2031872, "step": 1091, "train_runtime": 2300.7141, "train_tokens_per_second": 883.148 }, { "epoch": 1.1031084154662623, "grad_norm": 0.42553961277008057, "learning_rate": 9.002531645569621e-05, "loss": 0.0634, "num_input_tokens_seen": 2033980, "step": 1092, "train_runtime": 2302.5273, "train_tokens_per_second": 883.368 }, { "epoch": 1.104119282284559, "grad_norm": 0.5542956590652466, "learning_rate": 8.99240506329114e-05, "loss": 0.0595, "num_input_tokens_seen": 2036178, "step": 1093, "train_runtime": 2304.394, "train_tokens_per_second": 883.607 }, { "epoch": 1.1051301491028558, "grad_norm": 0.41452354192733765, "learning_rate": 8.982278481012658e-05, "loss": 0.0516, "num_input_tokens_seen": 2037792, "step": 1094, "train_runtime": 2306.0108, "train_tokens_per_second": 883.687 }, { "epoch": 1.1061410159211524, "grad_norm": 0.3179354667663574, "learning_rate": 8.972151898734178e-05, "loss": 0.1416, "num_input_tokens_seen": 2040220, "step": 1095, "train_runtime": 2308.0192, "train_tokens_per_second": 883.97 }, { "epoch": 1.107151882739449, "grad_norm": 0.3286201059818268, "learning_rate": 8.962025316455697e-05, "loss": 0.0264, "num_input_tokens_seen": 2041982, "step": 1096, "train_runtime": 2309.7185, "train_tokens_per_second": 884.083 }, { "epoch": 1.1081627495577457, "grad_norm": 0.421648234128952, "learning_rate": 8.951898734177215e-05, "loss": 0.0449, "num_input_tokens_seen": 2044038, "step": 1097, "train_runtime": 2311.455, "train_tokens_per_second": 884.308 }, { "epoch": 1.1091736163760424, "grad_norm": 0.35226207971572876, "learning_rate": 8.941772151898734e-05, "loss": 0.1058, "num_input_tokens_seen": 2045950, "step": 1098, "train_runtime": 2313.294, "train_tokens_per_second": 884.431 }, { "epoch": 1.110184483194339, "grad_norm": 0.20200014114379883, "learning_rate": 8.931645569620254e-05, "loss": 0.0489, "num_input_tokens_seen": 2047962, "step": 1099, "train_runtime": 2315.1192, "train_tokens_per_second": 884.603 }, { "epoch": 1.111195350012636, "grad_norm": 0.4560726583003998, "learning_rate": 8.921518987341772e-05, "loss": 0.0622, "num_input_tokens_seen": 2049682, "step": 1100, "train_runtime": 2316.8105, "train_tokens_per_second": 884.7 }, { "epoch": 1.1122062168309326, "grad_norm": 0.3359977602958679, "learning_rate": 8.911392405063291e-05, "loss": 0.0531, "num_input_tokens_seen": 2051370, "step": 1101, "train_runtime": 2318.4953, "train_tokens_per_second": 884.785 }, { "epoch": 1.1132170836492292, "grad_norm": 0.5087964534759521, "learning_rate": 8.90126582278481e-05, "loss": 0.0531, "num_input_tokens_seen": 2053164, "step": 1102, "train_runtime": 2320.2096, "train_tokens_per_second": 884.905 }, { "epoch": 1.1142279504675259, "grad_norm": 0.37344732880592346, "learning_rate": 8.89113924050633e-05, "loss": 0.1366, "num_input_tokens_seen": 2055164, "step": 1103, "train_runtime": 2322.0528, "train_tokens_per_second": 885.063 }, { "epoch": 1.1152388172858225, "grad_norm": 0.3142015337944031, "learning_rate": 8.881012658227848e-05, "loss": 0.0699, "num_input_tokens_seen": 2057456, "step": 1104, "train_runtime": 2323.9863, "train_tokens_per_second": 885.313 }, { "epoch": 1.1162496841041194, "grad_norm": 0.3405570685863495, "learning_rate": 8.870886075949368e-05, "loss": 0.0395, "num_input_tokens_seen": 2059120, "step": 1105, "train_runtime": 2325.5819, "train_tokens_per_second": 885.421 }, { "epoch": 1.117260550922416, "grad_norm": 0.31558433175086975, "learning_rate": 8.860759493670887e-05, "loss": 0.0485, "num_input_tokens_seen": 2060882, "step": 1106, "train_runtime": 2327.2823, "train_tokens_per_second": 885.532 }, { "epoch": 1.1182714177407127, "grad_norm": 0.42414557933807373, "learning_rate": 8.850632911392406e-05, "loss": 0.1039, "num_input_tokens_seen": 2063240, "step": 1107, "train_runtime": 2329.3205, "train_tokens_per_second": 885.769 }, { "epoch": 1.1192822845590094, "grad_norm": 0.6100692749023438, "learning_rate": 8.840506329113925e-05, "loss": 0.0778, "num_input_tokens_seen": 2064608, "step": 1108, "train_runtime": 2330.9285, "train_tokens_per_second": 885.745 }, { "epoch": 1.120293151377306, "grad_norm": 0.44799551367759705, "learning_rate": 8.830379746835444e-05, "loss": 0.0979, "num_input_tokens_seen": 2066824, "step": 1109, "train_runtime": 2332.7952, "train_tokens_per_second": 885.986 }, { "epoch": 1.1213040181956027, "grad_norm": 0.34168317914009094, "learning_rate": 8.820253164556962e-05, "loss": 0.0554, "num_input_tokens_seen": 2068742, "step": 1110, "train_runtime": 2334.5112, "train_tokens_per_second": 886.156 }, { "epoch": 1.1223148850138993, "grad_norm": 0.39773309230804443, "learning_rate": 8.810126582278482e-05, "loss": 0.083, "num_input_tokens_seen": 2071100, "step": 1111, "train_runtime": 2338.6237, "train_tokens_per_second": 885.606 }, { "epoch": 1.1233257518321962, "grad_norm": 0.26959148049354553, "learning_rate": 8.800000000000001e-05, "loss": 0.0457, "num_input_tokens_seen": 2072880, "step": 1112, "train_runtime": 2340.3205, "train_tokens_per_second": 885.725 }, { "epoch": 1.1243366186504928, "grad_norm": 0.3094308376312256, "learning_rate": 8.789873417721519e-05, "loss": 0.0481, "num_input_tokens_seen": 2075158, "step": 1113, "train_runtime": 2342.2121, "train_tokens_per_second": 885.982 }, { "epoch": 1.1253474854687895, "grad_norm": 0.4985480010509491, "learning_rate": 8.779746835443038e-05, "loss": 0.1692, "num_input_tokens_seen": 2077388, "step": 1114, "train_runtime": 2344.0949, "train_tokens_per_second": 886.222 }, { "epoch": 1.1263583522870861, "grad_norm": 0.3150419592857361, "learning_rate": 8.769620253164558e-05, "loss": 0.0445, "num_input_tokens_seen": 2079292, "step": 1115, "train_runtime": 2345.8065, "train_tokens_per_second": 886.387 }, { "epoch": 1.1273692191053828, "grad_norm": 0.4649672508239746, "learning_rate": 8.759493670886076e-05, "loss": 0.0667, "num_input_tokens_seen": 2080902, "step": 1116, "train_runtime": 2347.4431, "train_tokens_per_second": 886.455 }, { "epoch": 1.1283800859236797, "grad_norm": 0.4875417649745941, "learning_rate": 8.749367088607595e-05, "loss": 0.0914, "num_input_tokens_seen": 2082774, "step": 1117, "train_runtime": 2349.1682, "train_tokens_per_second": 886.601 }, { "epoch": 1.1293909527419763, "grad_norm": 0.2514392137527466, "learning_rate": 8.739240506329114e-05, "loss": 0.0481, "num_input_tokens_seen": 2084720, "step": 1118, "train_runtime": 2351.0173, "train_tokens_per_second": 886.731 }, { "epoch": 1.130401819560273, "grad_norm": 0.19609114527702332, "learning_rate": 8.729113924050633e-05, "loss": 0.0405, "num_input_tokens_seen": 2086904, "step": 1119, "train_runtime": 2352.9594, "train_tokens_per_second": 886.927 }, { "epoch": 1.1314126863785696, "grad_norm": 0.29445865750312805, "learning_rate": 8.718987341772152e-05, "loss": 0.0424, "num_input_tokens_seen": 2088958, "step": 1120, "train_runtime": 2354.8254, "train_tokens_per_second": 887.097 }, { "epoch": 1.1324235531968663, "grad_norm": 0.4594338834285736, "learning_rate": 8.708860759493672e-05, "loss": 0.0702, "num_input_tokens_seen": 2090674, "step": 1121, "train_runtime": 2356.5126, "train_tokens_per_second": 887.19 }, { "epoch": 1.133434420015163, "grad_norm": 0.390930712223053, "learning_rate": 8.698734177215189e-05, "loss": 0.0691, "num_input_tokens_seen": 2092630, "step": 1122, "train_runtime": 2358.2898, "train_tokens_per_second": 887.351 }, { "epoch": 1.1344452868334596, "grad_norm": 0.3874446451663971, "learning_rate": 8.68860759493671e-05, "loss": 0.0394, "num_input_tokens_seen": 2094284, "step": 1123, "train_runtime": 2359.9757, "train_tokens_per_second": 887.418 }, { "epoch": 1.1354561536517565, "grad_norm": 0.360215425491333, "learning_rate": 8.678481012658229e-05, "loss": 0.06, "num_input_tokens_seen": 2096298, "step": 1124, "train_runtime": 2361.8277, "train_tokens_per_second": 887.575 }, { "epoch": 1.136467020470053, "grad_norm": 0.4048649072647095, "learning_rate": 8.668354430379747e-05, "loss": 0.0638, "num_input_tokens_seen": 2098198, "step": 1125, "train_runtime": 2363.6, "train_tokens_per_second": 887.713 }, { "epoch": 1.1374778872883498, "grad_norm": 0.3208785951137543, "learning_rate": 8.658227848101266e-05, "loss": 0.0395, "num_input_tokens_seen": 2099910, "step": 1126, "train_runtime": 2365.2767, "train_tokens_per_second": 887.807 }, { "epoch": 1.1384887541066464, "grad_norm": 0.43860435485839844, "learning_rate": 8.648101265822786e-05, "loss": 0.0561, "num_input_tokens_seen": 2101548, "step": 1127, "train_runtime": 2366.9564, "train_tokens_per_second": 887.869 }, { "epoch": 1.139499620924943, "grad_norm": 0.30121687054634094, "learning_rate": 8.637974683544304e-05, "loss": 0.1921, "num_input_tokens_seen": 2104028, "step": 1128, "train_runtime": 2369.0309, "train_tokens_per_second": 888.139 }, { "epoch": 1.14051048774324, "grad_norm": 0.3415144681930542, "learning_rate": 8.627848101265823e-05, "loss": 0.0322, "num_input_tokens_seen": 2105922, "step": 1129, "train_runtime": 2370.8187, "train_tokens_per_second": 888.268 }, { "epoch": 1.1415213545615366, "grad_norm": 0.2572648227214813, "learning_rate": 8.617721518987342e-05, "loss": 0.1802, "num_input_tokens_seen": 2107714, "step": 1130, "train_runtime": 2372.5233, "train_tokens_per_second": 888.385 }, { "epoch": 1.1425322213798332, "grad_norm": 0.2720210552215576, "learning_rate": 8.607594936708861e-05, "loss": 0.1128, "num_input_tokens_seen": 2110432, "step": 1131, "train_runtime": 2374.6963, "train_tokens_per_second": 888.717 }, { "epoch": 1.1435430881981299, "grad_norm": 0.3224233090877533, "learning_rate": 8.59746835443038e-05, "loss": 0.1062, "num_input_tokens_seen": 2112168, "step": 1132, "train_runtime": 2376.4259, "train_tokens_per_second": 888.8 }, { "epoch": 1.1445539550164265, "grad_norm": 0.5241628289222717, "learning_rate": 8.587341772151899e-05, "loss": 0.0833, "num_input_tokens_seen": 2113676, "step": 1133, "train_runtime": 2378.0408, "train_tokens_per_second": 888.831 }, { "epoch": 1.1455648218347232, "grad_norm": 0.27714425325393677, "learning_rate": 8.577215189873418e-05, "loss": 0.1047, "num_input_tokens_seen": 2115176, "step": 1134, "train_runtime": 2379.645, "train_tokens_per_second": 888.862 }, { "epoch": 1.1465756886530198, "grad_norm": 0.32457640767097473, "learning_rate": 8.567088607594937e-05, "loss": 0.1355, "num_input_tokens_seen": 2116832, "step": 1135, "train_runtime": 2381.276, "train_tokens_per_second": 888.949 }, { "epoch": 1.1475865554713167, "grad_norm": 0.4045936167240143, "learning_rate": 8.556962025316456e-05, "loss": 0.0853, "num_input_tokens_seen": 2118662, "step": 1136, "train_runtime": 2383.0636, "train_tokens_per_second": 889.05 }, { "epoch": 1.1485974222896134, "grad_norm": 0.3420049846172333, "learning_rate": 8.546835443037976e-05, "loss": 0.0969, "num_input_tokens_seen": 2121236, "step": 1137, "train_runtime": 2385.1986, "train_tokens_per_second": 889.333 }, { "epoch": 1.14960828910791, "grad_norm": 0.3446069657802582, "learning_rate": 8.536708860759493e-05, "loss": 0.0682, "num_input_tokens_seen": 2123430, "step": 1138, "train_runtime": 2387.1744, "train_tokens_per_second": 889.516 }, { "epoch": 1.1506191559262067, "grad_norm": 0.32399219274520874, "learning_rate": 8.526582278481014e-05, "loss": 0.0283, "num_input_tokens_seen": 2124798, "step": 1139, "train_runtime": 2388.7569, "train_tokens_per_second": 889.499 }, { "epoch": 1.1516300227445033, "grad_norm": 0.4422810673713684, "learning_rate": 8.516455696202533e-05, "loss": 0.0887, "num_input_tokens_seen": 2126354, "step": 1140, "train_runtime": 2390.4271, "train_tokens_per_second": 889.529 }, { "epoch": 1.1526408895628002, "grad_norm": 0.43380090594291687, "learning_rate": 8.50632911392405e-05, "loss": 0.1153, "num_input_tokens_seen": 2128266, "step": 1141, "train_runtime": 2393.949, "train_tokens_per_second": 889.019 }, { "epoch": 1.1536517563810968, "grad_norm": 0.6191344857215881, "learning_rate": 8.49620253164557e-05, "loss": 0.1236, "num_input_tokens_seen": 2129752, "step": 1142, "train_runtime": 2395.5717, "train_tokens_per_second": 889.037 }, { "epoch": 1.1546626231993935, "grad_norm": 0.40897995233535767, "learning_rate": 8.48607594936709e-05, "loss": 0.0446, "num_input_tokens_seen": 2131820, "step": 1143, "train_runtime": 2397.4345, "train_tokens_per_second": 889.209 }, { "epoch": 1.1556734900176902, "grad_norm": 0.28095927834510803, "learning_rate": 8.475949367088608e-05, "loss": 0.0398, "num_input_tokens_seen": 2133928, "step": 1144, "train_runtime": 2399.2461, "train_tokens_per_second": 889.416 }, { "epoch": 1.1566843568359868, "grad_norm": 0.2282506823539734, "learning_rate": 8.465822784810127e-05, "loss": 0.0309, "num_input_tokens_seen": 2136234, "step": 1145, "train_runtime": 2401.1357, "train_tokens_per_second": 889.677 }, { "epoch": 1.1576952236542835, "grad_norm": 0.30796393752098083, "learning_rate": 8.455696202531646e-05, "loss": 0.1371, "num_input_tokens_seen": 2138160, "step": 1146, "train_runtime": 2402.8561, "train_tokens_per_second": 889.841 }, { "epoch": 1.1587060904725803, "grad_norm": 0.3619937300682068, "learning_rate": 8.445569620253165e-05, "loss": 0.0338, "num_input_tokens_seen": 2139622, "step": 1147, "train_runtime": 2404.4774, "train_tokens_per_second": 889.849 }, { "epoch": 1.159716957290877, "grad_norm": 0.41102486848831177, "learning_rate": 8.435443037974684e-05, "loss": 0.1406, "num_input_tokens_seen": 2141228, "step": 1148, "train_runtime": 2406.1442, "train_tokens_per_second": 889.9 }, { "epoch": 1.1607278241091736, "grad_norm": 0.5577710270881653, "learning_rate": 8.425316455696203e-05, "loss": 0.0679, "num_input_tokens_seen": 2143202, "step": 1149, "train_runtime": 2407.9249, "train_tokens_per_second": 890.062 }, { "epoch": 1.1617386909274703, "grad_norm": 0.3255091905593872, "learning_rate": 8.415189873417721e-05, "loss": 0.0295, "num_input_tokens_seen": 2145368, "step": 1150, "train_runtime": 2409.8477, "train_tokens_per_second": 890.25 }, { "epoch": 1.162749557745767, "grad_norm": 0.3634073734283447, "learning_rate": 8.405063291139241e-05, "loss": 0.0908, "num_input_tokens_seen": 2147748, "step": 1151, "train_runtime": 2411.8587, "train_tokens_per_second": 890.495 }, { "epoch": 1.1637604245640636, "grad_norm": 0.3885149359703064, "learning_rate": 8.39493670886076e-05, "loss": 0.0875, "num_input_tokens_seen": 2149888, "step": 1152, "train_runtime": 2413.7537, "train_tokens_per_second": 890.682 }, { "epoch": 1.1647712913823605, "grad_norm": 0.3698866665363312, "learning_rate": 8.384810126582278e-05, "loss": 0.0948, "num_input_tokens_seen": 2151634, "step": 1153, "train_runtime": 2415.4029, "train_tokens_per_second": 890.797 }, { "epoch": 1.1657821582006571, "grad_norm": 0.2277451604604721, "learning_rate": 8.374683544303797e-05, "loss": 0.0245, "num_input_tokens_seen": 2153826, "step": 1154, "train_runtime": 2417.339, "train_tokens_per_second": 890.99 }, { "epoch": 1.1667930250189538, "grad_norm": 0.26030606031417847, "learning_rate": 8.364556962025318e-05, "loss": 0.0546, "num_input_tokens_seen": 2155448, "step": 1155, "train_runtime": 2419.0155, "train_tokens_per_second": 891.043 }, { "epoch": 1.1678038918372504, "grad_norm": 0.33531326055526733, "learning_rate": 8.354430379746835e-05, "loss": 0.0323, "num_input_tokens_seen": 2157312, "step": 1156, "train_runtime": 2420.7965, "train_tokens_per_second": 891.158 }, { "epoch": 1.168814758655547, "grad_norm": 0.35256895422935486, "learning_rate": 8.344303797468354e-05, "loss": 0.1167, "num_input_tokens_seen": 2158738, "step": 1157, "train_runtime": 2422.3912, "train_tokens_per_second": 891.16 }, { "epoch": 1.1698256254738437, "grad_norm": 0.32339709997177124, "learning_rate": 8.334177215189874e-05, "loss": 0.077, "num_input_tokens_seen": 2160564, "step": 1158, "train_runtime": 2424.1473, "train_tokens_per_second": 891.268 }, { "epoch": 1.1708364922921406, "grad_norm": 0.5041233897209167, "learning_rate": 8.324050632911393e-05, "loss": 0.0848, "num_input_tokens_seen": 2162618, "step": 1159, "train_runtime": 2426.01, "train_tokens_per_second": 891.43 }, { "epoch": 1.1718473591104372, "grad_norm": 0.6854803562164307, "learning_rate": 8.313924050632912e-05, "loss": 0.1656, "num_input_tokens_seen": 2164408, "step": 1160, "train_runtime": 2427.7162, "train_tokens_per_second": 891.541 }, { "epoch": 1.172858225928734, "grad_norm": 0.48390182852745056, "learning_rate": 8.303797468354431e-05, "loss": 0.0474, "num_input_tokens_seen": 2166420, "step": 1161, "train_runtime": 2429.5733, "train_tokens_per_second": 891.687 }, { "epoch": 1.1738690927470306, "grad_norm": 0.27975279092788696, "learning_rate": 8.29367088607595e-05, "loss": 0.0353, "num_input_tokens_seen": 2168606, "step": 1162, "train_runtime": 2431.4379, "train_tokens_per_second": 891.903 }, { "epoch": 1.1748799595653272, "grad_norm": 0.3532312214374542, "learning_rate": 8.283544303797469e-05, "loss": 0.0818, "num_input_tokens_seen": 2170476, "step": 1163, "train_runtime": 2433.221, "train_tokens_per_second": 892.018 }, { "epoch": 1.175890826383624, "grad_norm": 0.2860186696052551, "learning_rate": 8.273417721518988e-05, "loss": 0.0292, "num_input_tokens_seen": 2172142, "step": 1164, "train_runtime": 2434.8494, "train_tokens_per_second": 892.105 }, { "epoch": 1.1769016932019207, "grad_norm": 0.23471611738204956, "learning_rate": 8.263291139240507e-05, "loss": 0.0132, "num_input_tokens_seen": 2173994, "step": 1165, "train_runtime": 2436.6149, "train_tokens_per_second": 892.219 }, { "epoch": 1.1779125600202174, "grad_norm": 0.2529040575027466, "learning_rate": 8.253164556962025e-05, "loss": 0.1016, "num_input_tokens_seen": 2176036, "step": 1166, "train_runtime": 2438.4839, "train_tokens_per_second": 892.373 }, { "epoch": 1.178923426838514, "grad_norm": 0.5520626902580261, "learning_rate": 8.243037974683545e-05, "loss": 0.0648, "num_input_tokens_seen": 2178188, "step": 1167, "train_runtime": 2440.3515, "train_tokens_per_second": 892.571 }, { "epoch": 1.1799342936568107, "grad_norm": 0.26322516798973083, "learning_rate": 8.232911392405064e-05, "loss": 0.1911, "num_input_tokens_seen": 2180116, "step": 1168, "train_runtime": 2442.1151, "train_tokens_per_second": 892.716 }, { "epoch": 1.1809451604751073, "grad_norm": 0.30632102489471436, "learning_rate": 8.222784810126582e-05, "loss": 0.0724, "num_input_tokens_seen": 2182022, "step": 1169, "train_runtime": 2443.9252, "train_tokens_per_second": 892.835 }, { "epoch": 1.181956027293404, "grad_norm": 0.37983787059783936, "learning_rate": 8.212658227848101e-05, "loss": 0.0636, "num_input_tokens_seen": 2183786, "step": 1170, "train_runtime": 2445.614, "train_tokens_per_second": 892.94 }, { "epoch": 1.1829668941117009, "grad_norm": 0.27352458238601685, "learning_rate": 8.202531645569622e-05, "loss": 0.0448, "num_input_tokens_seen": 2185608, "step": 1171, "train_runtime": 2449.5647, "train_tokens_per_second": 892.243 }, { "epoch": 1.1839777609299975, "grad_norm": 0.3310551643371582, "learning_rate": 8.19240506329114e-05, "loss": 0.0392, "num_input_tokens_seen": 2187262, "step": 1172, "train_runtime": 2451.1776, "train_tokens_per_second": 892.331 }, { "epoch": 1.1849886277482942, "grad_norm": 0.2715113162994385, "learning_rate": 8.182278481012658e-05, "loss": 0.0856, "num_input_tokens_seen": 2189264, "step": 1173, "train_runtime": 2452.9596, "train_tokens_per_second": 892.499 }, { "epoch": 1.1859994945665908, "grad_norm": 0.24654069542884827, "learning_rate": 8.172151898734178e-05, "loss": 0.0574, "num_input_tokens_seen": 2191248, "step": 1174, "train_runtime": 2454.751, "train_tokens_per_second": 892.656 }, { "epoch": 1.1870103613848875, "grad_norm": 0.25723373889923096, "learning_rate": 8.162025316455697e-05, "loss": 0.0796, "num_input_tokens_seen": 2193162, "step": 1175, "train_runtime": 2456.5376, "train_tokens_per_second": 892.786 }, { "epoch": 1.1880212282031843, "grad_norm": 0.25851204991340637, "learning_rate": 8.151898734177216e-05, "loss": 0.057, "num_input_tokens_seen": 2195312, "step": 1176, "train_runtime": 2458.4245, "train_tokens_per_second": 892.975 }, { "epoch": 1.189032095021481, "grad_norm": 0.3143210709095001, "learning_rate": 8.141772151898735e-05, "loss": 0.1391, "num_input_tokens_seen": 2196974, "step": 1177, "train_runtime": 2460.0596, "train_tokens_per_second": 893.057 }, { "epoch": 1.1900429618397776, "grad_norm": 0.32049065828323364, "learning_rate": 8.131645569620253e-05, "loss": 0.0956, "num_input_tokens_seen": 2198798, "step": 1178, "train_runtime": 2461.7765, "train_tokens_per_second": 893.175 }, { "epoch": 1.1910538286580743, "grad_norm": 0.4614190459251404, "learning_rate": 8.121518987341773e-05, "loss": 0.0635, "num_input_tokens_seen": 2200684, "step": 1179, "train_runtime": 2463.535, "train_tokens_per_second": 893.303 }, { "epoch": 1.192064695476371, "grad_norm": 0.3254811763763428, "learning_rate": 8.111392405063292e-05, "loss": 0.2184, "num_input_tokens_seen": 2202666, "step": 1180, "train_runtime": 2465.3133, "train_tokens_per_second": 893.463 }, { "epoch": 1.1930755622946676, "grad_norm": 0.3342306315898895, "learning_rate": 8.10126582278481e-05, "loss": 0.0521, "num_input_tokens_seen": 2204414, "step": 1181, "train_runtime": 2467.1121, "train_tokens_per_second": 893.52 }, { "epoch": 1.1940864291129643, "grad_norm": 0.43980565667152405, "learning_rate": 8.091139240506329e-05, "loss": 0.1383, "num_input_tokens_seen": 2206550, "step": 1182, "train_runtime": 2468.9852, "train_tokens_per_second": 893.707 }, { "epoch": 1.1950972959312611, "grad_norm": 0.35847440361976624, "learning_rate": 8.08101265822785e-05, "loss": 0.0688, "num_input_tokens_seen": 2208522, "step": 1183, "train_runtime": 2470.7873, "train_tokens_per_second": 893.854 }, { "epoch": 1.1961081627495578, "grad_norm": 0.3575953543186188, "learning_rate": 8.070886075949367e-05, "loss": 0.0786, "num_input_tokens_seen": 2209880, "step": 1184, "train_runtime": 2472.393, "train_tokens_per_second": 893.822 }, { "epoch": 1.1971190295678544, "grad_norm": 0.25793489813804626, "learning_rate": 8.060759493670886e-05, "loss": 0.0911, "num_input_tokens_seen": 2211972, "step": 1185, "train_runtime": 2474.2572, "train_tokens_per_second": 893.994 }, { "epoch": 1.198129896386151, "grad_norm": 0.4657045900821686, "learning_rate": 8.050632911392405e-05, "loss": 0.0691, "num_input_tokens_seen": 2213722, "step": 1186, "train_runtime": 2475.9573, "train_tokens_per_second": 894.087 }, { "epoch": 1.1991407632044477, "grad_norm": 0.466621071100235, "learning_rate": 8.040506329113924e-05, "loss": 0.0462, "num_input_tokens_seen": 2215788, "step": 1187, "train_runtime": 2477.8066, "train_tokens_per_second": 894.254 }, { "epoch": 1.2001516300227446, "grad_norm": 0.4542536735534668, "learning_rate": 8.030379746835443e-05, "loss": 0.1318, "num_input_tokens_seen": 2217242, "step": 1188, "train_runtime": 2479.4571, "train_tokens_per_second": 894.245 }, { "epoch": 1.2001516300227446, "eval_loss": 0.20719842612743378, "eval_runtime": 61.1791, "eval_samples_per_second": 14.368, "eval_steps_per_second": 7.192, "num_input_tokens_seen": 2217242, "step": 1188 }, { "epoch": 1.2011624968410413, "grad_norm": 0.34237897396087646, "learning_rate": 8.020253164556962e-05, "loss": 0.0498, "num_input_tokens_seen": 2218976, "step": 1189, "train_runtime": 2542.3915, "train_tokens_per_second": 872.791 }, { "epoch": 1.202173363659338, "grad_norm": 0.31419843435287476, "learning_rate": 8.010126582278482e-05, "loss": 0.0723, "num_input_tokens_seen": 2221286, "step": 1190, "train_runtime": 2544.3813, "train_tokens_per_second": 873.016 }, { "epoch": 1.2031842304776346, "grad_norm": 0.2560994625091553, "learning_rate": 8e-05, "loss": 0.0825, "num_input_tokens_seen": 2223160, "step": 1191, "train_runtime": 2546.0924, "train_tokens_per_second": 873.165 }, { "epoch": 1.2041950972959312, "grad_norm": 0.3249039351940155, "learning_rate": 7.98987341772152e-05, "loss": 0.0333, "num_input_tokens_seen": 2224882, "step": 1192, "train_runtime": 2547.8416, "train_tokens_per_second": 873.242 }, { "epoch": 1.2052059641142279, "grad_norm": 0.4017309248447418, "learning_rate": 7.979746835443039e-05, "loss": 0.1118, "num_input_tokens_seen": 2226830, "step": 1193, "train_runtime": 2549.6224, "train_tokens_per_second": 873.396 }, { "epoch": 1.2062168309325245, "grad_norm": 0.3083512783050537, "learning_rate": 7.969620253164557e-05, "loss": 0.0293, "num_input_tokens_seen": 2229160, "step": 1194, "train_runtime": 2551.5595, "train_tokens_per_second": 873.646 }, { "epoch": 1.2072276977508214, "grad_norm": 0.3623747229576111, "learning_rate": 7.959493670886077e-05, "loss": 0.0367, "num_input_tokens_seen": 2230942, "step": 1195, "train_runtime": 2553.3159, "train_tokens_per_second": 873.743 }, { "epoch": 1.208238564569118, "grad_norm": 0.3974745571613312, "learning_rate": 7.949367088607596e-05, "loss": 0.0992, "num_input_tokens_seen": 2232456, "step": 1196, "train_runtime": 2554.8992, "train_tokens_per_second": 873.794 }, { "epoch": 1.2092494313874147, "grad_norm": 0.3379092216491699, "learning_rate": 7.939240506329114e-05, "loss": 0.0423, "num_input_tokens_seen": 2234064, "step": 1197, "train_runtime": 2556.5189, "train_tokens_per_second": 873.87 }, { "epoch": 1.2102602982057113, "grad_norm": 0.44574904441833496, "learning_rate": 7.929113924050633e-05, "loss": 0.0256, "num_input_tokens_seen": 2235656, "step": 1198, "train_runtime": 2558.1361, "train_tokens_per_second": 873.939 }, { "epoch": 1.211271165024008, "grad_norm": 0.4556899070739746, "learning_rate": 7.918987341772153e-05, "loss": 0.1008, "num_input_tokens_seen": 2237148, "step": 1199, "train_runtime": 2559.8067, "train_tokens_per_second": 873.952 }, { "epoch": 1.2122820318423049, "grad_norm": 0.3602530360221863, "learning_rate": 7.908860759493671e-05, "loss": 0.1514, "num_input_tokens_seen": 2238558, "step": 1200, "train_runtime": 2561.4404, "train_tokens_per_second": 873.945 }, { "epoch": 1.2132928986606015, "grad_norm": 0.3926827311515808, "learning_rate": 7.89873417721519e-05, "loss": 0.0879, "num_input_tokens_seen": 2240102, "step": 1201, "train_runtime": 2565.3309, "train_tokens_per_second": 873.221 }, { "epoch": 1.2143037654788982, "grad_norm": 0.36526402831077576, "learning_rate": 7.888607594936709e-05, "loss": 0.0548, "num_input_tokens_seen": 2241606, "step": 1202, "train_runtime": 2566.9898, "train_tokens_per_second": 873.243 }, { "epoch": 1.2153146322971948, "grad_norm": 0.26066580414772034, "learning_rate": 7.878481012658228e-05, "loss": 0.0252, "num_input_tokens_seen": 2243026, "step": 1203, "train_runtime": 2568.5626, "train_tokens_per_second": 873.261 }, { "epoch": 1.2163254991154915, "grad_norm": 0.32624346017837524, "learning_rate": 7.868354430379747e-05, "loss": 0.1306, "num_input_tokens_seen": 2245108, "step": 1204, "train_runtime": 2570.4056, "train_tokens_per_second": 873.445 }, { "epoch": 1.2173363659337881, "grad_norm": 0.35179993510246277, "learning_rate": 7.858227848101266e-05, "loss": 0.0839, "num_input_tokens_seen": 2246944, "step": 1205, "train_runtime": 2572.1135, "train_tokens_per_second": 873.579 }, { "epoch": 1.218347232752085, "grad_norm": 0.4054023027420044, "learning_rate": 7.848101265822784e-05, "loss": 0.0769, "num_input_tokens_seen": 2248626, "step": 1206, "train_runtime": 2573.8102, "train_tokens_per_second": 873.656 }, { "epoch": 1.2193580995703817, "grad_norm": 0.28881245851516724, "learning_rate": 7.837974683544305e-05, "loss": 0.0969, "num_input_tokens_seen": 2251106, "step": 1207, "train_runtime": 2575.8394, "train_tokens_per_second": 873.931 }, { "epoch": 1.2203689663886783, "grad_norm": 0.3547137677669525, "learning_rate": 7.827848101265824e-05, "loss": 0.0946, "num_input_tokens_seen": 2252336, "step": 1208, "train_runtime": 2577.3751, "train_tokens_per_second": 873.888 }, { "epoch": 1.221379833206975, "grad_norm": 0.4218279719352722, "learning_rate": 7.817721518987341e-05, "loss": 0.0559, "num_input_tokens_seen": 2254426, "step": 1209, "train_runtime": 2579.1698, "train_tokens_per_second": 874.09 }, { "epoch": 1.2223907000252716, "grad_norm": 0.36659857630729675, "learning_rate": 7.80759493670886e-05, "loss": 0.0272, "num_input_tokens_seen": 2256016, "step": 1210, "train_runtime": 2580.7789, "train_tokens_per_second": 874.161 }, { "epoch": 1.2234015668435683, "grad_norm": 0.34027570486068726, "learning_rate": 7.797468354430381e-05, "loss": 0.0657, "num_input_tokens_seen": 2257654, "step": 1211, "train_runtime": 2582.3909, "train_tokens_per_second": 874.25 }, { "epoch": 1.2244124336618651, "grad_norm": 0.3136456608772278, "learning_rate": 7.787341772151899e-05, "loss": 0.0409, "num_input_tokens_seen": 2259316, "step": 1212, "train_runtime": 2584.0769, "train_tokens_per_second": 874.322 }, { "epoch": 1.2254233004801618, "grad_norm": 0.23020558059215546, "learning_rate": 7.777215189873418e-05, "loss": 0.1319, "num_input_tokens_seen": 2261760, "step": 1213, "train_runtime": 2586.1467, "train_tokens_per_second": 874.568 }, { "epoch": 1.2264341672984584, "grad_norm": 0.5002903342247009, "learning_rate": 7.767088607594937e-05, "loss": 0.0491, "num_input_tokens_seen": 2263620, "step": 1214, "train_runtime": 2587.9609, "train_tokens_per_second": 874.673 }, { "epoch": 1.227445034116755, "grad_norm": 0.26744261384010315, "learning_rate": 7.756962025316456e-05, "loss": 0.1518, "num_input_tokens_seen": 2266624, "step": 1215, "train_runtime": 2590.3504, "train_tokens_per_second": 875.026 }, { "epoch": 1.2284559009350517, "grad_norm": 0.2974698841571808, "learning_rate": 7.746835443037975e-05, "loss": 0.0455, "num_input_tokens_seen": 2268118, "step": 1216, "train_runtime": 2591.9528, "train_tokens_per_second": 875.061 }, { "epoch": 1.2294667677533484, "grad_norm": 0.3523530066013336, "learning_rate": 7.736708860759494e-05, "loss": 0.0743, "num_input_tokens_seen": 2270112, "step": 1217, "train_runtime": 2593.7499, "train_tokens_per_second": 875.224 }, { "epoch": 1.2304776345716453, "grad_norm": 0.306835412979126, "learning_rate": 7.726582278481013e-05, "loss": 0.0995, "num_input_tokens_seen": 2272270, "step": 1218, "train_runtime": 2595.5679, "train_tokens_per_second": 875.442 }, { "epoch": 1.231488501389942, "grad_norm": 0.25264307856559753, "learning_rate": 7.716455696202532e-05, "loss": 0.0369, "num_input_tokens_seen": 2274252, "step": 1219, "train_runtime": 2597.3688, "train_tokens_per_second": 875.598 }, { "epoch": 1.2324993682082386, "grad_norm": 0.39503711462020874, "learning_rate": 7.706329113924051e-05, "loss": 0.1344, "num_input_tokens_seen": 2276608, "step": 1220, "train_runtime": 2599.3439, "train_tokens_per_second": 875.839 }, { "epoch": 1.2335102350265352, "grad_norm": 0.35884588956832886, "learning_rate": 7.69620253164557e-05, "loss": 0.0246, "num_input_tokens_seen": 2278464, "step": 1221, "train_runtime": 2601.0513, "train_tokens_per_second": 875.978 }, { "epoch": 1.2345211018448319, "grad_norm": 0.2843872904777527, "learning_rate": 7.686075949367088e-05, "loss": 0.0794, "num_input_tokens_seen": 2280334, "step": 1222, "train_runtime": 2602.7639, "train_tokens_per_second": 876.12 }, { "epoch": 1.2355319686631288, "grad_norm": 0.40163278579711914, "learning_rate": 7.675949367088609e-05, "loss": 0.0399, "num_input_tokens_seen": 2282350, "step": 1223, "train_runtime": 2604.5568, "train_tokens_per_second": 876.291 }, { "epoch": 1.2365428354814254, "grad_norm": 0.3127462863922119, "learning_rate": 7.665822784810128e-05, "loss": 0.0333, "num_input_tokens_seen": 2284232, "step": 1224, "train_runtime": 2606.2777, "train_tokens_per_second": 876.435 }, { "epoch": 1.237553702299722, "grad_norm": 0.3897799551486969, "learning_rate": 7.655696202531645e-05, "loss": 0.0609, "num_input_tokens_seen": 2286378, "step": 1225, "train_runtime": 2608.1654, "train_tokens_per_second": 876.623 }, { "epoch": 1.2385645691180187, "grad_norm": 0.4516952931880951, "learning_rate": 7.645569620253165e-05, "loss": 0.126, "num_input_tokens_seen": 2288376, "step": 1226, "train_runtime": 2609.9431, "train_tokens_per_second": 876.792 }, { "epoch": 1.2395754359363154, "grad_norm": 0.41795146465301514, "learning_rate": 7.635443037974685e-05, "loss": 0.0528, "num_input_tokens_seen": 2290008, "step": 1227, "train_runtime": 2611.6834, "train_tokens_per_second": 876.832 }, { "epoch": 1.240586302754612, "grad_norm": 0.26265859603881836, "learning_rate": 7.625316455696203e-05, "loss": 0.1215, "num_input_tokens_seen": 2291396, "step": 1228, "train_runtime": 2613.2831, "train_tokens_per_second": 876.827 }, { "epoch": 1.2415971695729087, "grad_norm": 0.2844543159008026, "learning_rate": 7.615189873417722e-05, "loss": 0.0642, "num_input_tokens_seen": 2293300, "step": 1229, "train_runtime": 2615.0049, "train_tokens_per_second": 876.977 }, { "epoch": 1.2426080363912055, "grad_norm": 0.2673298120498657, "learning_rate": 7.605063291139241e-05, "loss": 0.0301, "num_input_tokens_seen": 2295184, "step": 1230, "train_runtime": 2616.7145, "train_tokens_per_second": 877.124 }, { "epoch": 1.2436189032095022, "grad_norm": 0.4001712203025818, "learning_rate": 7.59493670886076e-05, "loss": 0.0542, "num_input_tokens_seen": 2296654, "step": 1231, "train_runtime": 2620.9099, "train_tokens_per_second": 876.281 }, { "epoch": 1.2446297700277988, "grad_norm": 0.44643983244895935, "learning_rate": 7.584810126582279e-05, "loss": 0.0727, "num_input_tokens_seen": 2299028, "step": 1232, "train_runtime": 2622.8712, "train_tokens_per_second": 876.531 }, { "epoch": 1.2456406368460955, "grad_norm": 0.3430020809173584, "learning_rate": 7.574683544303798e-05, "loss": 0.1021, "num_input_tokens_seen": 2300760, "step": 1233, "train_runtime": 2624.5658, "train_tokens_per_second": 876.625 }, { "epoch": 1.2466515036643921, "grad_norm": 0.45810046792030334, "learning_rate": 7.564556962025316e-05, "loss": 0.0639, "num_input_tokens_seen": 2302192, "step": 1234, "train_runtime": 2626.2183, "train_tokens_per_second": 876.619 }, { "epoch": 1.247662370482689, "grad_norm": 0.40292829275131226, "learning_rate": 7.554430379746836e-05, "loss": 0.1584, "num_input_tokens_seen": 2303964, "step": 1235, "train_runtime": 2627.9219, "train_tokens_per_second": 876.725 }, { "epoch": 1.2486732373009857, "grad_norm": 0.2423546016216278, "learning_rate": 7.544303797468355e-05, "loss": 0.0649, "num_input_tokens_seen": 2306384, "step": 1236, "train_runtime": 2629.9422, "train_tokens_per_second": 876.971 }, { "epoch": 1.2496841041192823, "grad_norm": 0.231626957654953, "learning_rate": 7.534177215189873e-05, "loss": 0.0303, "num_input_tokens_seen": 2308302, "step": 1237, "train_runtime": 2631.7215, "train_tokens_per_second": 877.107 }, { "epoch": 1.250694970937579, "grad_norm": 0.2823111116886139, "learning_rate": 7.524050632911392e-05, "loss": 0.0369, "num_input_tokens_seen": 2310652, "step": 1238, "train_runtime": 2633.6657, "train_tokens_per_second": 877.352 }, { "epoch": 1.2517058377558756, "grad_norm": 0.28391867876052856, "learning_rate": 7.513924050632913e-05, "loss": 0.0312, "num_input_tokens_seen": 2312742, "step": 1239, "train_runtime": 2635.5242, "train_tokens_per_second": 877.526 }, { "epoch": 1.2527167045741723, "grad_norm": 0.290244996547699, "learning_rate": 7.50379746835443e-05, "loss": 0.059, "num_input_tokens_seen": 2314768, "step": 1240, "train_runtime": 2637.3763, "train_tokens_per_second": 877.678 }, { "epoch": 1.253727571392469, "grad_norm": 0.2558806240558624, "learning_rate": 7.49367088607595e-05, "loss": 0.0435, "num_input_tokens_seen": 2316864, "step": 1241, "train_runtime": 2639.2359, "train_tokens_per_second": 877.854 }, { "epoch": 1.2547384382107658, "grad_norm": 0.3218919634819031, "learning_rate": 7.483544303797469e-05, "loss": 0.0948, "num_input_tokens_seen": 2319096, "step": 1242, "train_runtime": 2641.1826, "train_tokens_per_second": 878.052 }, { "epoch": 1.2557493050290625, "grad_norm": 0.24845680594444275, "learning_rate": 7.473417721518988e-05, "loss": 0.1325, "num_input_tokens_seen": 2321292, "step": 1243, "train_runtime": 2643.0508, "train_tokens_per_second": 878.262 }, { "epoch": 1.256760171847359, "grad_norm": 0.2059890478849411, "learning_rate": 7.463291139240507e-05, "loss": 0.1042, "num_input_tokens_seen": 2323460, "step": 1244, "train_runtime": 2644.9776, "train_tokens_per_second": 878.442 }, { "epoch": 1.2577710386656558, "grad_norm": 0.6027005314826965, "learning_rate": 7.453164556962026e-05, "loss": 0.0673, "num_input_tokens_seen": 2325092, "step": 1245, "train_runtime": 2646.5949, "train_tokens_per_second": 878.522 }, { "epoch": 1.2587819054839524, "grad_norm": 0.40883567929267883, "learning_rate": 7.443037974683545e-05, "loss": 0.0867, "num_input_tokens_seen": 2327080, "step": 1246, "train_runtime": 2648.3789, "train_tokens_per_second": 878.681 }, { "epoch": 1.2597927723022493, "grad_norm": 0.5405418276786804, "learning_rate": 7.432911392405064e-05, "loss": 0.0869, "num_input_tokens_seen": 2329076, "step": 1247, "train_runtime": 2650.1605, "train_tokens_per_second": 878.843 }, { "epoch": 1.260803639120546, "grad_norm": 0.49589258432388306, "learning_rate": 7.422784810126583e-05, "loss": 0.0613, "num_input_tokens_seen": 2330756, "step": 1248, "train_runtime": 2651.8634, "train_tokens_per_second": 878.913 }, { "epoch": 1.2618145059388426, "grad_norm": 0.5561320781707764, "learning_rate": 7.412658227848102e-05, "loss": 0.1042, "num_input_tokens_seen": 2332434, "step": 1249, "train_runtime": 2653.5588, "train_tokens_per_second": 878.983 }, { "epoch": 1.2628253727571392, "grad_norm": 0.2283097803592682, "learning_rate": 7.40253164556962e-05, "loss": 0.0729, "num_input_tokens_seen": 2334348, "step": 1250, "train_runtime": 2655.3257, "train_tokens_per_second": 879.119 }, { "epoch": 1.263836239575436, "grad_norm": 0.5350798964500427, "learning_rate": 7.39240506329114e-05, "loss": 0.1618, "num_input_tokens_seen": 2335872, "step": 1251, "train_runtime": 2656.9785, "train_tokens_per_second": 879.146 }, { "epoch": 1.2648471063937325, "grad_norm": 0.4096823036670685, "learning_rate": 7.38227848101266e-05, "loss": 0.0496, "num_input_tokens_seen": 2337458, "step": 1252, "train_runtime": 2658.604, "train_tokens_per_second": 879.205 }, { "epoch": 1.2658579732120292, "grad_norm": 0.3206482231616974, "learning_rate": 7.372151898734177e-05, "loss": 0.0954, "num_input_tokens_seen": 2339236, "step": 1253, "train_runtime": 2660.2984, "train_tokens_per_second": 879.313 }, { "epoch": 1.266868840030326, "grad_norm": 0.2557467222213745, "learning_rate": 7.362025316455696e-05, "loss": 0.0385, "num_input_tokens_seen": 2340906, "step": 1254, "train_runtime": 2661.9943, "train_tokens_per_second": 879.381 }, { "epoch": 1.2678797068486227, "grad_norm": 0.35144689679145813, "learning_rate": 7.351898734177217e-05, "loss": 0.1125, "num_input_tokens_seen": 2342640, "step": 1255, "train_runtime": 2663.6248, "train_tokens_per_second": 879.493 }, { "epoch": 1.2688905736669194, "grad_norm": 0.28803375363349915, "learning_rate": 7.341772151898734e-05, "loss": 0.0336, "num_input_tokens_seen": 2344838, "step": 1256, "train_runtime": 2665.5011, "train_tokens_per_second": 879.699 }, { "epoch": 1.269901440485216, "grad_norm": 0.4108582139015198, "learning_rate": 7.331645569620253e-05, "loss": 0.086, "num_input_tokens_seen": 2346846, "step": 1257, "train_runtime": 2667.3419, "train_tokens_per_second": 879.844 }, { "epoch": 1.270912307303513, "grad_norm": 0.23005342483520508, "learning_rate": 7.321518987341773e-05, "loss": 0.02, "num_input_tokens_seen": 2348908, "step": 1258, "train_runtime": 2669.2325, "train_tokens_per_second": 879.994 }, { "epoch": 1.2719231741218096, "grad_norm": 0.26932668685913086, "learning_rate": 7.311392405063292e-05, "loss": 0.0154, "num_input_tokens_seen": 2350608, "step": 1259, "train_runtime": 2670.9113, "train_tokens_per_second": 880.077 }, { "epoch": 1.2729340409401062, "grad_norm": 0.23961332440376282, "learning_rate": 7.301265822784811e-05, "loss": 0.066, "num_input_tokens_seen": 2352324, "step": 1260, "train_runtime": 2672.6533, "train_tokens_per_second": 880.146 }, { "epoch": 1.2739449077584029, "grad_norm": 0.28488975763320923, "learning_rate": 7.29113924050633e-05, "loss": 0.0394, "num_input_tokens_seen": 2353934, "step": 1261, "train_runtime": 2676.1921, "train_tokens_per_second": 879.583 }, { "epoch": 1.2749557745766995, "grad_norm": 0.3717709183692932, "learning_rate": 7.281012658227848e-05, "loss": 0.0278, "num_input_tokens_seen": 2356002, "step": 1262, "train_runtime": 2678.0484, "train_tokens_per_second": 879.746 }, { "epoch": 1.2759666413949962, "grad_norm": 0.47229495644569397, "learning_rate": 7.270886075949367e-05, "loss": 0.0501, "num_input_tokens_seen": 2357928, "step": 1263, "train_runtime": 2679.8879, "train_tokens_per_second": 879.861 }, { "epoch": 1.2769775082132928, "grad_norm": 0.32415246963500977, "learning_rate": 7.260759493670887e-05, "loss": 0.0423, "num_input_tokens_seen": 2360130, "step": 1264, "train_runtime": 2681.829, "train_tokens_per_second": 880.045 }, { "epoch": 1.2779883750315895, "grad_norm": 0.30456259846687317, "learning_rate": 7.250632911392405e-05, "loss": 0.0736, "num_input_tokens_seen": 2361726, "step": 1265, "train_runtime": 2683.5246, "train_tokens_per_second": 880.084 }, { "epoch": 1.2789992418498863, "grad_norm": 0.4040810465812683, "learning_rate": 7.240506329113924e-05, "loss": 0.1235, "num_input_tokens_seen": 2363846, "step": 1266, "train_runtime": 2685.4004, "train_tokens_per_second": 880.258 }, { "epoch": 1.280010108668183, "grad_norm": 0.33810141682624817, "learning_rate": 7.230379746835443e-05, "loss": 0.0497, "num_input_tokens_seen": 2366592, "step": 1267, "train_runtime": 2687.5555, "train_tokens_per_second": 880.574 }, { "epoch": 1.2810209754864796, "grad_norm": 0.3703427314758301, "learning_rate": 7.220253164556962e-05, "loss": 0.0948, "num_input_tokens_seen": 2368360, "step": 1268, "train_runtime": 2689.2081, "train_tokens_per_second": 880.69 }, { "epoch": 1.2820318423047763, "grad_norm": 0.2576245069503784, "learning_rate": 7.210126582278481e-05, "loss": 0.0566, "num_input_tokens_seen": 2370460, "step": 1269, "train_runtime": 2691.1227, "train_tokens_per_second": 880.844 }, { "epoch": 1.2830427091230732, "grad_norm": 0.2916818857192993, "learning_rate": 7.2e-05, "loss": 0.0788, "num_input_tokens_seen": 2372182, "step": 1270, "train_runtime": 2692.8773, "train_tokens_per_second": 880.91 }, { "epoch": 1.2840535759413698, "grad_norm": 0.39087337255477905, "learning_rate": 7.189873417721519e-05, "loss": 0.0985, "num_input_tokens_seen": 2373984, "step": 1271, "train_runtime": 2694.5948, "train_tokens_per_second": 881.017 }, { "epoch": 1.2850644427596665, "grad_norm": 0.4398673176765442, "learning_rate": 7.179746835443038e-05, "loss": 0.1272, "num_input_tokens_seen": 2375920, "step": 1272, "train_runtime": 2696.3816, "train_tokens_per_second": 881.151 }, { "epoch": 1.2860753095779631, "grad_norm": 0.3793856203556061, "learning_rate": 7.169620253164557e-05, "loss": 0.0538, "num_input_tokens_seen": 2378138, "step": 1273, "train_runtime": 2698.2551, "train_tokens_per_second": 881.361 }, { "epoch": 1.2870861763962598, "grad_norm": 0.2971085011959076, "learning_rate": 7.159493670886077e-05, "loss": 0.0252, "num_input_tokens_seen": 2379852, "step": 1274, "train_runtime": 2699.8921, "train_tokens_per_second": 881.462 }, { "epoch": 1.2880970432145564, "grad_norm": 0.48829659819602966, "learning_rate": 7.149367088607594e-05, "loss": 0.0508, "num_input_tokens_seen": 2381660, "step": 1275, "train_runtime": 2701.6418, "train_tokens_per_second": 881.56 }, { "epoch": 1.289107910032853, "grad_norm": 0.37237298488616943, "learning_rate": 7.139240506329115e-05, "loss": 0.0845, "num_input_tokens_seen": 2383732, "step": 1276, "train_runtime": 2703.5435, "train_tokens_per_second": 881.707 }, { "epoch": 1.2901187768511497, "grad_norm": 0.33351263403892517, "learning_rate": 7.129113924050634e-05, "loss": 0.0412, "num_input_tokens_seen": 2385694, "step": 1277, "train_runtime": 2705.3429, "train_tokens_per_second": 881.845 }, { "epoch": 1.2911296436694466, "grad_norm": 0.3546872138977051, "learning_rate": 7.118987341772152e-05, "loss": 0.1491, "num_input_tokens_seen": 2387894, "step": 1278, "train_runtime": 2707.2325, "train_tokens_per_second": 882.042 }, { "epoch": 1.2921405104877433, "grad_norm": 0.34062474966049194, "learning_rate": 7.10886075949367e-05, "loss": 0.0945, "num_input_tokens_seen": 2390248, "step": 1279, "train_runtime": 2709.2367, "train_tokens_per_second": 882.259 }, { "epoch": 1.29315137730604, "grad_norm": 0.37184667587280273, "learning_rate": 7.098734177215191e-05, "loss": 0.08, "num_input_tokens_seen": 2391690, "step": 1280, "train_runtime": 2710.8289, "train_tokens_per_second": 882.273 }, { "epoch": 1.2941622441243366, "grad_norm": 0.4290751814842224, "learning_rate": 7.088607594936709e-05, "loss": 0.0748, "num_input_tokens_seen": 2393278, "step": 1281, "train_runtime": 2712.516, "train_tokens_per_second": 882.309 }, { "epoch": 1.2951731109426334, "grad_norm": 0.29007312655448914, "learning_rate": 7.078481012658228e-05, "loss": 0.1079, "num_input_tokens_seen": 2396084, "step": 1282, "train_runtime": 2714.8145, "train_tokens_per_second": 882.596 }, { "epoch": 1.29618397776093, "grad_norm": 0.23827768862247467, "learning_rate": 7.068354430379747e-05, "loss": 0.0196, "num_input_tokens_seen": 2398130, "step": 1283, "train_runtime": 2716.6148, "train_tokens_per_second": 882.764 }, { "epoch": 1.2971948445792267, "grad_norm": 0.28175145387649536, "learning_rate": 7.058227848101266e-05, "loss": 0.0687, "num_input_tokens_seen": 2399778, "step": 1284, "train_runtime": 2718.2537, "train_tokens_per_second": 882.838 }, { "epoch": 1.2982057113975234, "grad_norm": 0.44550999999046326, "learning_rate": 7.048101265822785e-05, "loss": 0.0755, "num_input_tokens_seen": 2401530, "step": 1285, "train_runtime": 2719.9545, "train_tokens_per_second": 882.93 }, { "epoch": 1.29921657821582, "grad_norm": 0.3413219749927521, "learning_rate": 7.037974683544304e-05, "loss": 0.0886, "num_input_tokens_seen": 2403522, "step": 1286, "train_runtime": 2721.7392, "train_tokens_per_second": 883.083 }, { "epoch": 1.3002274450341167, "grad_norm": 0.36198854446411133, "learning_rate": 7.027848101265823e-05, "loss": 0.0656, "num_input_tokens_seen": 2405756, "step": 1287, "train_runtime": 2723.6802, "train_tokens_per_second": 883.274 }, { "epoch": 1.3012383118524133, "grad_norm": 0.3648776710033417, "learning_rate": 7.017721518987342e-05, "loss": 0.0472, "num_input_tokens_seen": 2407866, "step": 1288, "train_runtime": 2725.5304, "train_tokens_per_second": 883.449 }, { "epoch": 1.3022491786707102, "grad_norm": 0.21727511286735535, "learning_rate": 7.007594936708861e-05, "loss": 0.0413, "num_input_tokens_seen": 2409742, "step": 1289, "train_runtime": 2727.2362, "train_tokens_per_second": 883.584 }, { "epoch": 1.3032600454890069, "grad_norm": 0.37237033247947693, "learning_rate": 6.99746835443038e-05, "loss": 0.0809, "num_input_tokens_seen": 2411498, "step": 1290, "train_runtime": 2728.9538, "train_tokens_per_second": 883.671 }, { "epoch": 1.3042709123073035, "grad_norm": 0.35302239656448364, "learning_rate": 6.987341772151898e-05, "loss": 0.0929, "num_input_tokens_seen": 2413020, "step": 1291, "train_runtime": 2732.5694, "train_tokens_per_second": 883.059 }, { "epoch": 1.3052817791256002, "grad_norm": 0.45146867632865906, "learning_rate": 6.977215189873419e-05, "loss": 0.0652, "num_input_tokens_seen": 2414744, "step": 1292, "train_runtime": 2734.3149, "train_tokens_per_second": 883.126 }, { "epoch": 1.3062926459438968, "grad_norm": 0.30090656876564026, "learning_rate": 6.967088607594938e-05, "loss": 0.06, "num_input_tokens_seen": 2416852, "step": 1293, "train_runtime": 2736.1742, "train_tokens_per_second": 883.296 }, { "epoch": 1.3073035127621937, "grad_norm": 0.33946192264556885, "learning_rate": 6.956962025316455e-05, "loss": 0.046, "num_input_tokens_seen": 2418370, "step": 1294, "train_runtime": 2737.8548, "train_tokens_per_second": 883.308 }, { "epoch": 1.3083143795804903, "grad_norm": 0.44936761260032654, "learning_rate": 6.946835443037975e-05, "loss": 0.046, "num_input_tokens_seen": 2420094, "step": 1295, "train_runtime": 2739.5672, "train_tokens_per_second": 883.386 }, { "epoch": 1.309325246398787, "grad_norm": 0.37103450298309326, "learning_rate": 6.936708860759494e-05, "loss": 0.0731, "num_input_tokens_seen": 2422344, "step": 1296, "train_runtime": 2741.5021, "train_tokens_per_second": 883.583 }, { "epoch": 1.3103361132170837, "grad_norm": 0.27331382036209106, "learning_rate": 6.926582278481013e-05, "loss": 0.0901, "num_input_tokens_seen": 2424196, "step": 1297, "train_runtime": 2743.1713, "train_tokens_per_second": 883.72 }, { "epoch": 1.3113469800353803, "grad_norm": 0.46463069319725037, "learning_rate": 6.916455696202532e-05, "loss": 0.0529, "num_input_tokens_seen": 2425842, "step": 1298, "train_runtime": 2744.9191, "train_tokens_per_second": 883.757 }, { "epoch": 1.312357846853677, "grad_norm": 0.41775521636009216, "learning_rate": 6.906329113924051e-05, "loss": 0.053, "num_input_tokens_seen": 2427566, "step": 1299, "train_runtime": 2746.8158, "train_tokens_per_second": 883.775 }, { "epoch": 1.3133687136719736, "grad_norm": 0.3045608699321747, "learning_rate": 6.89620253164557e-05, "loss": 0.0531, "num_input_tokens_seen": 2429296, "step": 1300, "train_runtime": 2748.5091, "train_tokens_per_second": 883.86 }, { "epoch": 1.3143795804902705, "grad_norm": 0.3907722532749176, "learning_rate": 6.886075949367089e-05, "loss": 0.0361, "num_input_tokens_seen": 2431194, "step": 1301, "train_runtime": 2750.3507, "train_tokens_per_second": 883.958 }, { "epoch": 1.3153904473085671, "grad_norm": 0.3585439622402191, "learning_rate": 6.875949367088608e-05, "loss": 0.1059, "num_input_tokens_seen": 2433072, "step": 1302, "train_runtime": 2752.0697, "train_tokens_per_second": 884.088 }, { "epoch": 1.3164013141268638, "grad_norm": 0.513984739780426, "learning_rate": 6.865822784810126e-05, "loss": 0.2062, "num_input_tokens_seen": 2435092, "step": 1303, "train_runtime": 2753.8707, "train_tokens_per_second": 884.243 }, { "epoch": 1.3174121809451604, "grad_norm": 0.4001423418521881, "learning_rate": 6.855696202531646e-05, "loss": 0.1015, "num_input_tokens_seen": 2437404, "step": 1304, "train_runtime": 2755.9159, "train_tokens_per_second": 884.426 }, { "epoch": 1.318423047763457, "grad_norm": 0.3177363872528076, "learning_rate": 6.845569620253165e-05, "loss": 0.1289, "num_input_tokens_seen": 2439236, "step": 1305, "train_runtime": 2757.6363, "train_tokens_per_second": 884.539 }, { "epoch": 1.319433914581754, "grad_norm": 0.32245272397994995, "learning_rate": 6.835443037974683e-05, "loss": 0.0861, "num_input_tokens_seen": 2441176, "step": 1306, "train_runtime": 2759.4412, "train_tokens_per_second": 884.663 }, { "epoch": 1.3204447814000506, "grad_norm": 0.3399496078491211, "learning_rate": 6.825316455696202e-05, "loss": 0.0657, "num_input_tokens_seen": 2442982, "step": 1307, "train_runtime": 2761.1924, "train_tokens_per_second": 884.756 }, { "epoch": 1.3214556482183473, "grad_norm": 0.3486602008342743, "learning_rate": 6.815189873417723e-05, "loss": 0.0756, "num_input_tokens_seen": 2444502, "step": 1308, "train_runtime": 2762.797, "train_tokens_per_second": 884.792 }, { "epoch": 1.322466515036644, "grad_norm": 0.28970780968666077, "learning_rate": 6.80506329113924e-05, "loss": 0.0294, "num_input_tokens_seen": 2446644, "step": 1309, "train_runtime": 2764.653, "train_tokens_per_second": 884.973 }, { "epoch": 1.3234773818549406, "grad_norm": 0.3342728912830353, "learning_rate": 6.79493670886076e-05, "loss": 0.1295, "num_input_tokens_seen": 2448848, "step": 1310, "train_runtime": 2766.6034, "train_tokens_per_second": 885.146 }, { "epoch": 1.3244882486732372, "grad_norm": 0.5038242340087891, "learning_rate": 6.784810126582279e-05, "loss": 0.1202, "num_input_tokens_seen": 2450452, "step": 1311, "train_runtime": 2768.2202, "train_tokens_per_second": 885.208 }, { "epoch": 1.3254991154915339, "grad_norm": 0.44264596700668335, "learning_rate": 6.774683544303798e-05, "loss": 0.0554, "num_input_tokens_seen": 2452540, "step": 1312, "train_runtime": 2769.9719, "train_tokens_per_second": 885.402 }, { "epoch": 1.3265099823098307, "grad_norm": 0.337912380695343, "learning_rate": 6.764556962025317e-05, "loss": 0.1283, "num_input_tokens_seen": 2454236, "step": 1313, "train_runtime": 2771.6721, "train_tokens_per_second": 885.471 }, { "epoch": 1.3275208491281274, "grad_norm": 0.2829691469669342, "learning_rate": 6.754430379746836e-05, "loss": 0.08, "num_input_tokens_seen": 2456178, "step": 1314, "train_runtime": 2773.5032, "train_tokens_per_second": 885.587 }, { "epoch": 1.328531715946424, "grad_norm": 0.18844102323055267, "learning_rate": 6.744303797468355e-05, "loss": 0.0127, "num_input_tokens_seen": 2457798, "step": 1315, "train_runtime": 2775.1247, "train_tokens_per_second": 885.653 }, { "epoch": 1.3295425827647207, "grad_norm": 0.3522207736968994, "learning_rate": 6.734177215189874e-05, "loss": 0.1038, "num_input_tokens_seen": 2459950, "step": 1316, "train_runtime": 2776.9924, "train_tokens_per_second": 885.832 }, { "epoch": 1.3305534495830174, "grad_norm": 0.36738115549087524, "learning_rate": 6.724050632911393e-05, "loss": 0.0799, "num_input_tokens_seen": 2461440, "step": 1317, "train_runtime": 2778.6313, "train_tokens_per_second": 885.846 }, { "epoch": 1.3315643164013142, "grad_norm": 0.408785879611969, "learning_rate": 6.713924050632912e-05, "loss": 0.0607, "num_input_tokens_seen": 2463362, "step": 1318, "train_runtime": 2780.431, "train_tokens_per_second": 885.964 }, { "epoch": 1.3325751832196109, "grad_norm": 0.3836084306240082, "learning_rate": 6.70379746835443e-05, "loss": 0.1412, "num_input_tokens_seen": 2465416, "step": 1319, "train_runtime": 2782.2881, "train_tokens_per_second": 886.111 }, { "epoch": 1.3335860500379075, "grad_norm": 0.4433416724205017, "learning_rate": 6.69367088607595e-05, "loss": 0.0528, "num_input_tokens_seen": 2467378, "step": 1320, "train_runtime": 2784.1379, "train_tokens_per_second": 886.227 }, { "epoch": 1.3345969168562042, "grad_norm": 0.29245951771736145, "learning_rate": 6.68354430379747e-05, "loss": 0.0795, "num_input_tokens_seen": 2469082, "step": 1321, "train_runtime": 2787.5549, "train_tokens_per_second": 885.752 }, { "epoch": 1.3356077836745008, "grad_norm": 0.356962651014328, "learning_rate": 6.673417721518987e-05, "loss": 0.0404, "num_input_tokens_seen": 2470532, "step": 1322, "train_runtime": 2789.1885, "train_tokens_per_second": 885.753 }, { "epoch": 1.3366186504927975, "grad_norm": 0.38898488879203796, "learning_rate": 6.663291139240506e-05, "loss": 0.0621, "num_input_tokens_seen": 2471952, "step": 1323, "train_runtime": 2790.7695, "train_tokens_per_second": 885.76 }, { "epoch": 1.3376295173110941, "grad_norm": 0.33297595381736755, "learning_rate": 6.653164556962027e-05, "loss": 0.0325, "num_input_tokens_seen": 2473502, "step": 1324, "train_runtime": 2792.3898, "train_tokens_per_second": 885.801 }, { "epoch": 1.338640384129391, "grad_norm": 0.3344525694847107, "learning_rate": 6.643037974683544e-05, "loss": 0.0495, "num_input_tokens_seen": 2475404, "step": 1325, "train_runtime": 2794.0516, "train_tokens_per_second": 885.955 }, { "epoch": 1.3396512509476877, "grad_norm": 0.25987255573272705, "learning_rate": 6.632911392405063e-05, "loss": 0.0453, "num_input_tokens_seen": 2477228, "step": 1326, "train_runtime": 2795.7635, "train_tokens_per_second": 886.065 }, { "epoch": 1.3406621177659843, "grad_norm": 0.36128169298171997, "learning_rate": 6.622784810126583e-05, "loss": 0.1, "num_input_tokens_seen": 2479076, "step": 1327, "train_runtime": 2797.5404, "train_tokens_per_second": 886.163 }, { "epoch": 1.341672984584281, "grad_norm": 0.3184932768344879, "learning_rate": 6.612658227848102e-05, "loss": 0.0227, "num_input_tokens_seen": 2480822, "step": 1328, "train_runtime": 2799.2869, "train_tokens_per_second": 886.234 }, { "epoch": 1.3426838514025778, "grad_norm": 0.33535587787628174, "learning_rate": 6.602531645569621e-05, "loss": 0.1504, "num_input_tokens_seen": 2482556, "step": 1329, "train_runtime": 2801.035, "train_tokens_per_second": 886.3 }, { "epoch": 1.3436947182208745, "grad_norm": 0.5460361838340759, "learning_rate": 6.59240506329114e-05, "loss": 0.1411, "num_input_tokens_seen": 2484660, "step": 1330, "train_runtime": 2802.9043, "train_tokens_per_second": 886.459 }, { "epoch": 1.3447055850391711, "grad_norm": 0.40229368209838867, "learning_rate": 6.582278481012658e-05, "loss": 0.0349, "num_input_tokens_seen": 2486850, "step": 1331, "train_runtime": 2804.8425, "train_tokens_per_second": 886.627 }, { "epoch": 1.3457164518574678, "grad_norm": 0.5042855143547058, "learning_rate": 6.572151898734178e-05, "loss": 0.1286, "num_input_tokens_seen": 2488602, "step": 1332, "train_runtime": 2806.5521, "train_tokens_per_second": 886.711 }, { "epoch": 1.3467273186757645, "grad_norm": 0.5470770597457886, "learning_rate": 6.562025316455697e-05, "loss": 0.1217, "num_input_tokens_seen": 2490866, "step": 1333, "train_runtime": 2808.483, "train_tokens_per_second": 886.908 }, { "epoch": 1.347738185494061, "grad_norm": 0.42767834663391113, "learning_rate": 6.551898734177215e-05, "loss": 0.0439, "num_input_tokens_seen": 2492602, "step": 1334, "train_runtime": 2810.1877, "train_tokens_per_second": 886.988 }, { "epoch": 1.3487490523123578, "grad_norm": 0.40733814239501953, "learning_rate": 6.541772151898734e-05, "loss": 0.0532, "num_input_tokens_seen": 2494526, "step": 1335, "train_runtime": 2811.9748, "train_tokens_per_second": 887.108 }, { "epoch": 1.3497599191306544, "grad_norm": 0.41067591309547424, "learning_rate": 6.531645569620254e-05, "loss": 0.1522, "num_input_tokens_seen": 2496016, "step": 1336, "train_runtime": 2813.6241, "train_tokens_per_second": 887.118 }, { "epoch": 1.3507707859489513, "grad_norm": 0.26213085651397705, "learning_rate": 6.521518987341772e-05, "loss": 0.0301, "num_input_tokens_seen": 2497684, "step": 1337, "train_runtime": 2815.2457, "train_tokens_per_second": 887.199 }, { "epoch": 1.351781652767248, "grad_norm": 0.4205595850944519, "learning_rate": 6.511392405063291e-05, "loss": 0.0763, "num_input_tokens_seen": 2499736, "step": 1338, "train_runtime": 2817.045, "train_tokens_per_second": 887.361 }, { "epoch": 1.3527925195855446, "grad_norm": 0.3436855971813202, "learning_rate": 6.50126582278481e-05, "loss": 0.0415, "num_input_tokens_seen": 2501926, "step": 1339, "train_runtime": 2818.916, "train_tokens_per_second": 887.549 }, { "epoch": 1.3538033864038412, "grad_norm": 0.31082549691200256, "learning_rate": 6.491139240506329e-05, "loss": 0.0413, "num_input_tokens_seen": 2503974, "step": 1340, "train_runtime": 2820.7687, "train_tokens_per_second": 887.692 }, { "epoch": 1.354814253222138, "grad_norm": 0.3663766086101532, "learning_rate": 6.481012658227848e-05, "loss": 0.1151, "num_input_tokens_seen": 2506114, "step": 1341, "train_runtime": 2822.5852, "train_tokens_per_second": 887.879 }, { "epoch": 1.3558251200404348, "grad_norm": 0.341423362493515, "learning_rate": 6.470886075949367e-05, "loss": 0.0466, "num_input_tokens_seen": 2507914, "step": 1342, "train_runtime": 2824.3415, "train_tokens_per_second": 887.964 }, { "epoch": 1.3568359868587314, "grad_norm": 0.4148929715156555, "learning_rate": 6.460759493670887e-05, "loss": 0.0426, "num_input_tokens_seen": 2509662, "step": 1343, "train_runtime": 2826.1124, "train_tokens_per_second": 888.026 }, { "epoch": 1.357846853677028, "grad_norm": 0.35411393642425537, "learning_rate": 6.450632911392406e-05, "loss": 0.0679, "num_input_tokens_seen": 2511950, "step": 1344, "train_runtime": 2828.1134, "train_tokens_per_second": 888.207 }, { "epoch": 1.3588577204953247, "grad_norm": 0.3845215141773224, "learning_rate": 6.440506329113925e-05, "loss": 0.0429, "num_input_tokens_seen": 2513682, "step": 1345, "train_runtime": 2829.7547, "train_tokens_per_second": 888.304 }, { "epoch": 1.3598685873136214, "grad_norm": 0.30208733677864075, "learning_rate": 6.430379746835444e-05, "loss": 0.2562, "num_input_tokens_seen": 2515712, "step": 1346, "train_runtime": 2831.6435, "train_tokens_per_second": 888.428 }, { "epoch": 1.360879454131918, "grad_norm": 0.28983309864997864, "learning_rate": 6.420253164556962e-05, "loss": 0.0508, "num_input_tokens_seen": 2517720, "step": 1347, "train_runtime": 2833.4729, "train_tokens_per_second": 888.563 }, { "epoch": 1.3618903209502147, "grad_norm": 0.2847015857696533, "learning_rate": 6.410126582278482e-05, "loss": 0.0374, "num_input_tokens_seen": 2519868, "step": 1348, "train_runtime": 2835.3992, "train_tokens_per_second": 888.717 }, { "epoch": 1.3629011877685115, "grad_norm": 0.2689174711704254, "learning_rate": 6.400000000000001e-05, "loss": 0.0817, "num_input_tokens_seen": 2521818, "step": 1349, "train_runtime": 2837.0755, "train_tokens_per_second": 888.879 }, { "epoch": 1.3639120545868082, "grad_norm": 0.41363146901130676, "learning_rate": 6.389873417721519e-05, "loss": 0.0979, "num_input_tokens_seen": 2523804, "step": 1350, "train_runtime": 2838.8603, "train_tokens_per_second": 889.02 }, { "epoch": 1.3649229214051048, "grad_norm": 0.29461362957954407, "learning_rate": 6.379746835443038e-05, "loss": 0.1459, "num_input_tokens_seen": 2525558, "step": 1351, "train_runtime": 2842.5738, "train_tokens_per_second": 888.476 }, { "epoch": 1.3659337882234015, "grad_norm": 0.3976391553878784, "learning_rate": 6.369620253164558e-05, "loss": 0.0774, "num_input_tokens_seen": 2527482, "step": 1352, "train_runtime": 2844.296, "train_tokens_per_second": 888.614 }, { "epoch": 1.3669446550416984, "grad_norm": 0.4617343544960022, "learning_rate": 6.359493670886076e-05, "loss": 0.1341, "num_input_tokens_seen": 2529434, "step": 1353, "train_runtime": 2846.0612, "train_tokens_per_second": 888.749 }, { "epoch": 1.367955521859995, "grad_norm": 0.2891669273376465, "learning_rate": 6.349367088607595e-05, "loss": 0.0605, "num_input_tokens_seen": 2531414, "step": 1354, "train_runtime": 2847.8729, "train_tokens_per_second": 888.879 }, { "epoch": 1.3689663886782917, "grad_norm": 0.16765184700489044, "learning_rate": 6.339240506329114e-05, "loss": 0.0406, "num_input_tokens_seen": 2532808, "step": 1355, "train_runtime": 2849.4694, "train_tokens_per_second": 888.87 }, { "epoch": 1.3699772554965883, "grad_norm": 0.4383516311645508, "learning_rate": 6.329113924050633e-05, "loss": 0.1015, "num_input_tokens_seen": 2534488, "step": 1356, "train_runtime": 2851.1636, "train_tokens_per_second": 888.931 }, { "epoch": 1.370988122314885, "grad_norm": 0.3356960117816925, "learning_rate": 6.318987341772152e-05, "loss": 0.0329, "num_input_tokens_seen": 2536656, "step": 1357, "train_runtime": 2853.1036, "train_tokens_per_second": 889.087 }, { "epoch": 1.3719989891331816, "grad_norm": 0.24229836463928223, "learning_rate": 6.308860759493671e-05, "loss": 0.0946, "num_input_tokens_seen": 2538702, "step": 1358, "train_runtime": 2854.9724, "train_tokens_per_second": 889.221 }, { "epoch": 1.3730098559514783, "grad_norm": 0.41483476758003235, "learning_rate": 6.298734177215189e-05, "loss": 0.1443, "num_input_tokens_seen": 2540198, "step": 1359, "train_runtime": 2856.5761, "train_tokens_per_second": 889.246 }, { "epoch": 1.3740207227697752, "grad_norm": 0.36345934867858887, "learning_rate": 6.28860759493671e-05, "loss": 0.0292, "num_input_tokens_seen": 2542196, "step": 1360, "train_runtime": 2858.4441, "train_tokens_per_second": 889.364 }, { "epoch": 1.3750315895880718, "grad_norm": 0.4974648058414459, "learning_rate": 6.278481012658229e-05, "loss": 0.1213, "num_input_tokens_seen": 2543920, "step": 1361, "train_runtime": 2860.1455, "train_tokens_per_second": 889.437 }, { "epoch": 1.3760424564063685, "grad_norm": 0.3402421474456787, "learning_rate": 6.268354430379746e-05, "loss": 0.0458, "num_input_tokens_seen": 2545776, "step": 1362, "train_runtime": 2861.9062, "train_tokens_per_second": 889.539 }, { "epoch": 1.3770533232246651, "grad_norm": 0.20843306183815002, "learning_rate": 6.258227848101266e-05, "loss": 0.047, "num_input_tokens_seen": 2547750, "step": 1363, "train_runtime": 2863.7086, "train_tokens_per_second": 889.668 }, { "epoch": 1.3780641900429618, "grad_norm": 0.36995962262153625, "learning_rate": 6.248101265822786e-05, "loss": 0.0634, "num_input_tokens_seen": 2549424, "step": 1364, "train_runtime": 2865.4682, "train_tokens_per_second": 889.706 }, { "epoch": 1.3790750568612586, "grad_norm": 0.34429794549942017, "learning_rate": 6.237974683544304e-05, "loss": 0.0384, "num_input_tokens_seen": 2550926, "step": 1365, "train_runtime": 2867.1842, "train_tokens_per_second": 889.697 }, { "epoch": 1.3800859236795553, "grad_norm": 0.27338913083076477, "learning_rate": 6.227848101265823e-05, "loss": 0.048, "num_input_tokens_seen": 2552352, "step": 1366, "train_runtime": 2868.7893, "train_tokens_per_second": 889.697 }, { "epoch": 1.381096790497852, "grad_norm": 0.41747793555259705, "learning_rate": 6.217721518987342e-05, "loss": 0.1508, "num_input_tokens_seen": 2554060, "step": 1367, "train_runtime": 2870.5414, "train_tokens_per_second": 889.749 }, { "epoch": 1.3821076573161486, "grad_norm": 0.3080999255180359, "learning_rate": 6.207594936708861e-05, "loss": 0.141, "num_input_tokens_seen": 2556302, "step": 1368, "train_runtime": 2872.4817, "train_tokens_per_second": 889.928 }, { "epoch": 1.3831185241344452, "grad_norm": 0.27430495619773865, "learning_rate": 6.19746835443038e-05, "loss": 0.021, "num_input_tokens_seen": 2558024, "step": 1369, "train_runtime": 2874.1655, "train_tokens_per_second": 890.006 }, { "epoch": 1.384129390952742, "grad_norm": 0.21422269940376282, "learning_rate": 6.187341772151899e-05, "loss": 0.1405, "num_input_tokens_seen": 2560244, "step": 1370, "train_runtime": 2876.0679, "train_tokens_per_second": 890.189 }, { "epoch": 1.3851402577710386, "grad_norm": 0.295729398727417, "learning_rate": 6.177215189873418e-05, "loss": 0.015, "num_input_tokens_seen": 2562024, "step": 1371, "train_runtime": 2877.7989, "train_tokens_per_second": 890.272 }, { "epoch": 1.3861511245893354, "grad_norm": 0.4139345586299896, "learning_rate": 6.167088607594937e-05, "loss": 0.0476, "num_input_tokens_seen": 2563776, "step": 1372, "train_runtime": 2879.422, "train_tokens_per_second": 890.379 }, { "epoch": 1.387161991407632, "grad_norm": 0.2090672254562378, "learning_rate": 6.156962025316456e-05, "loss": 0.0731, "num_input_tokens_seen": 2565618, "step": 1373, "train_runtime": 2881.1338, "train_tokens_per_second": 890.489 }, { "epoch": 1.3881728582259287, "grad_norm": 0.3067643344402313, "learning_rate": 6.146835443037975e-05, "loss": 0.0723, "num_input_tokens_seen": 2567786, "step": 1374, "train_runtime": 2883.0016, "train_tokens_per_second": 890.664 }, { "epoch": 1.3891837250442254, "grad_norm": 0.3311604857444763, "learning_rate": 6.136708860759493e-05, "loss": 0.1445, "num_input_tokens_seen": 2569640, "step": 1375, "train_runtime": 2884.7164, "train_tokens_per_second": 890.777 }, { "epoch": 1.390194591862522, "grad_norm": 0.424031138420105, "learning_rate": 6.126582278481014e-05, "loss": 0.0714, "num_input_tokens_seen": 2571758, "step": 1376, "train_runtime": 2886.5299, "train_tokens_per_second": 890.951 }, { "epoch": 1.391205458680819, "grad_norm": 0.5352917909622192, "learning_rate": 6.116455696202533e-05, "loss": 0.0757, "num_input_tokens_seen": 2573584, "step": 1377, "train_runtime": 2888.2479, "train_tokens_per_second": 891.054 }, { "epoch": 1.3922163254991156, "grad_norm": 0.2344108521938324, "learning_rate": 6.10632911392405e-05, "loss": 0.0965, "num_input_tokens_seen": 2576038, "step": 1378, "train_runtime": 2890.3425, "train_tokens_per_second": 891.257 }, { "epoch": 1.3932271923174122, "grad_norm": 0.33207178115844727, "learning_rate": 6.0962025316455695e-05, "loss": 0.057, "num_input_tokens_seen": 2578072, "step": 1379, "train_runtime": 2892.1479, "train_tokens_per_second": 891.404 }, { "epoch": 1.3942380591357089, "grad_norm": 0.2377287745475769, "learning_rate": 6.086075949367089e-05, "loss": 0.0498, "num_input_tokens_seen": 2579774, "step": 1380, "train_runtime": 2893.905, "train_tokens_per_second": 891.451 }, { "epoch": 1.3952489259540055, "grad_norm": 0.24418236315250397, "learning_rate": 6.0759493670886084e-05, "loss": 0.0331, "num_input_tokens_seen": 2581642, "step": 1381, "train_runtime": 2897.7031, "train_tokens_per_second": 890.927 }, { "epoch": 1.3962597927723022, "grad_norm": 0.22728894650936127, "learning_rate": 6.065822784810127e-05, "loss": 0.0991, "num_input_tokens_seen": 2583334, "step": 1382, "train_runtime": 2899.3988, "train_tokens_per_second": 890.99 }, { "epoch": 1.3972706595905988, "grad_norm": 0.33506718277931213, "learning_rate": 6.055696202531645e-05, "loss": 0.0872, "num_input_tokens_seen": 2585250, "step": 1383, "train_runtime": 2901.198, "train_tokens_per_second": 891.097 }, { "epoch": 1.3982815264088957, "grad_norm": 0.3591923415660858, "learning_rate": 6.0455696202531656e-05, "loss": 0.05, "num_input_tokens_seen": 2587364, "step": 1384, "train_runtime": 2903.069, "train_tokens_per_second": 891.251 }, { "epoch": 1.3992923932271923, "grad_norm": 0.2582985758781433, "learning_rate": 6.035443037974684e-05, "loss": 0.1784, "num_input_tokens_seen": 2588714, "step": 1385, "train_runtime": 2904.6736, "train_tokens_per_second": 891.224 }, { "epoch": 1.400303260045489, "grad_norm": 0.3208470046520233, "learning_rate": 6.0253164556962024e-05, "loss": 0.0324, "num_input_tokens_seen": 2590470, "step": 1386, "train_runtime": 2906.3788, "train_tokens_per_second": 891.305 }, { "epoch": 1.400303260045489, "eval_loss": 0.21137197315692902, "eval_runtime": 61.4915, "eval_samples_per_second": 14.295, "eval_steps_per_second": 7.155, "num_input_tokens_seen": 2590470, "step": 1386 }, { "epoch": 1.4013141268637856, "grad_norm": 0.28233349323272705, "learning_rate": 6.0151898734177215e-05, "loss": 0.0357, "num_input_tokens_seen": 2592686, "step": 1387, "train_runtime": 2969.748, "train_tokens_per_second": 873.032 }, { "epoch": 1.4023249936820825, "grad_norm": 0.3834882080554962, "learning_rate": 6.005063291139241e-05, "loss": 0.1386, "num_input_tokens_seen": 2594374, "step": 1388, "train_runtime": 2971.3719, "train_tokens_per_second": 873.123 }, { "epoch": 1.4033358605003792, "grad_norm": 0.3518659472465515, "learning_rate": 5.99493670886076e-05, "loss": 0.0791, "num_input_tokens_seen": 2596580, "step": 1389, "train_runtime": 2973.2451, "train_tokens_per_second": 873.315 }, { "epoch": 1.4043467273186758, "grad_norm": 0.37290677428245544, "learning_rate": 5.984810126582279e-05, "loss": 0.048, "num_input_tokens_seen": 2598032, "step": 1390, "train_runtime": 2974.8336, "train_tokens_per_second": 873.337 }, { "epoch": 1.4053575941369725, "grad_norm": 0.4034007489681244, "learning_rate": 5.974683544303797e-05, "loss": 0.0334, "num_input_tokens_seen": 2599522, "step": 1391, "train_runtime": 2976.4546, "train_tokens_per_second": 873.362 }, { "epoch": 1.4063684609552691, "grad_norm": 0.30299344658851624, "learning_rate": 5.964556962025317e-05, "loss": 0.0587, "num_input_tokens_seen": 2601542, "step": 1392, "train_runtime": 2978.236, "train_tokens_per_second": 873.518 }, { "epoch": 1.4073793277735658, "grad_norm": 0.3894141614437103, "learning_rate": 5.954430379746836e-05, "loss": 0.0768, "num_input_tokens_seen": 2603504, "step": 1393, "train_runtime": 2980.0739, "train_tokens_per_second": 873.637 }, { "epoch": 1.4083901945918624, "grad_norm": 0.2617016136646271, "learning_rate": 5.9443037974683544e-05, "loss": 0.1277, "num_input_tokens_seen": 2605752, "step": 1394, "train_runtime": 2981.9398, "train_tokens_per_second": 873.845 }, { "epoch": 1.409401061410159, "grad_norm": 0.24910065531730652, "learning_rate": 5.9341772151898735e-05, "loss": 0.0458, "num_input_tokens_seen": 2607290, "step": 1395, "train_runtime": 2983.5491, "train_tokens_per_second": 873.889 }, { "epoch": 1.410411928228456, "grad_norm": 0.3577074408531189, "learning_rate": 5.924050632911393e-05, "loss": 0.0453, "num_input_tokens_seen": 2609448, "step": 1396, "train_runtime": 2985.4559, "train_tokens_per_second": 874.053 }, { "epoch": 1.4114227950467526, "grad_norm": 0.46218645572662354, "learning_rate": 5.913924050632912e-05, "loss": 0.1106, "num_input_tokens_seen": 2611600, "step": 1397, "train_runtime": 2987.3305, "train_tokens_per_second": 874.225 }, { "epoch": 1.4124336618650493, "grad_norm": 0.5550116300582886, "learning_rate": 5.903797468354431e-05, "loss": 0.0689, "num_input_tokens_seen": 2612936, "step": 1398, "train_runtime": 2988.9389, "train_tokens_per_second": 874.202 }, { "epoch": 1.413444528683346, "grad_norm": 0.5216653943061829, "learning_rate": 5.893670886075949e-05, "loss": 0.0712, "num_input_tokens_seen": 2614638, "step": 1399, "train_runtime": 2990.6319, "train_tokens_per_second": 874.276 }, { "epoch": 1.4144553955016428, "grad_norm": 0.36964768171310425, "learning_rate": 5.883544303797469e-05, "loss": 0.0502, "num_input_tokens_seen": 2616204, "step": 1400, "train_runtime": 2992.2461, "train_tokens_per_second": 874.328 }, { "epoch": 1.4154662623199394, "grad_norm": 0.38824814558029175, "learning_rate": 5.873417721518988e-05, "loss": 0.1205, "num_input_tokens_seen": 2618418, "step": 1401, "train_runtime": 2994.2495, "train_tokens_per_second": 874.482 }, { "epoch": 1.416477129138236, "grad_norm": 0.4073863923549652, "learning_rate": 5.8632911392405064e-05, "loss": 0.0877, "num_input_tokens_seen": 2620624, "step": 1402, "train_runtime": 2996.1851, "train_tokens_per_second": 874.654 }, { "epoch": 1.4174879959565327, "grad_norm": 0.5225967168807983, "learning_rate": 5.8531645569620255e-05, "loss": 0.0655, "num_input_tokens_seen": 2622554, "step": 1403, "train_runtime": 2997.9627, "train_tokens_per_second": 874.779 }, { "epoch": 1.4184988627748294, "grad_norm": 0.35591739416122437, "learning_rate": 5.843037974683545e-05, "loss": 0.1118, "num_input_tokens_seen": 2625194, "step": 1404, "train_runtime": 3000.1237, "train_tokens_per_second": 875.029 }, { "epoch": 1.419509729593126, "grad_norm": 0.3223467767238617, "learning_rate": 5.832911392405064e-05, "loss": 0.1114, "num_input_tokens_seen": 2627128, "step": 1405, "train_runtime": 3001.8466, "train_tokens_per_second": 875.171 }, { "epoch": 1.4205205964114227, "grad_norm": 0.36426904797554016, "learning_rate": 5.822784810126583e-05, "loss": 0.2153, "num_input_tokens_seen": 2629208, "step": 1406, "train_runtime": 3003.729, "train_tokens_per_second": 875.315 }, { "epoch": 1.4215314632297193, "grad_norm": 0.39519429206848145, "learning_rate": 5.812658227848101e-05, "loss": 0.0641, "num_input_tokens_seen": 2631256, "step": 1407, "train_runtime": 3005.5097, "train_tokens_per_second": 875.477 }, { "epoch": 1.4225423300480162, "grad_norm": 0.47091037034988403, "learning_rate": 5.802531645569621e-05, "loss": 0.0916, "num_input_tokens_seen": 2633626, "step": 1408, "train_runtime": 3007.5159, "train_tokens_per_second": 875.681 }, { "epoch": 1.4235531968663129, "grad_norm": 0.3183493912220001, "learning_rate": 5.79240506329114e-05, "loss": 0.0391, "num_input_tokens_seen": 2635146, "step": 1409, "train_runtime": 3009.2026, "train_tokens_per_second": 875.696 }, { "epoch": 1.4245640636846095, "grad_norm": 0.4309399724006653, "learning_rate": 5.7822784810126584e-05, "loss": 0.055, "num_input_tokens_seen": 2636952, "step": 1410, "train_runtime": 3010.919, "train_tokens_per_second": 875.796 }, { "epoch": 1.4255749305029062, "grad_norm": 0.2628016173839569, "learning_rate": 5.772151898734177e-05, "loss": 0.0538, "num_input_tokens_seen": 2639144, "step": 1411, "train_runtime": 3014.8839, "train_tokens_per_second": 875.372 }, { "epoch": 1.426585797321203, "grad_norm": 0.2927537262439728, "learning_rate": 5.762025316455697e-05, "loss": 0.0942, "num_input_tokens_seen": 2641920, "step": 1412, "train_runtime": 3017.1754, "train_tokens_per_second": 875.627 }, { "epoch": 1.4275966641394997, "grad_norm": 0.40520450472831726, "learning_rate": 5.751898734177216e-05, "loss": 0.1373, "num_input_tokens_seen": 2643916, "step": 1413, "train_runtime": 3019.0157, "train_tokens_per_second": 875.754 }, { "epoch": 1.4286075309577964, "grad_norm": 0.43820634484291077, "learning_rate": 5.741772151898734e-05, "loss": 0.0545, "num_input_tokens_seen": 2645654, "step": 1414, "train_runtime": 3020.7261, "train_tokens_per_second": 875.834 }, { "epoch": 1.429618397776093, "grad_norm": 0.33604276180267334, "learning_rate": 5.731645569620253e-05, "loss": 0.0901, "num_input_tokens_seen": 2647666, "step": 1415, "train_runtime": 3022.5572, "train_tokens_per_second": 875.969 }, { "epoch": 1.4306292645943897, "grad_norm": 0.3733352720737457, "learning_rate": 5.721518987341773e-05, "loss": 0.0755, "num_input_tokens_seen": 2649700, "step": 1416, "train_runtime": 3024.4378, "train_tokens_per_second": 876.097 }, { "epoch": 1.4316401314126863, "grad_norm": 0.1657431572675705, "learning_rate": 5.7113924050632913e-05, "loss": 0.0267, "num_input_tokens_seen": 2651426, "step": 1417, "train_runtime": 3026.1256, "train_tokens_per_second": 876.178 }, { "epoch": 1.432650998230983, "grad_norm": 0.37970614433288574, "learning_rate": 5.7012658227848104e-05, "loss": 0.104, "num_input_tokens_seen": 2653400, "step": 1418, "train_runtime": 3027.9692, "train_tokens_per_second": 876.297 }, { "epoch": 1.4336618650492798, "grad_norm": 0.28047189116477966, "learning_rate": 5.691139240506329e-05, "loss": 0.1058, "num_input_tokens_seen": 2655334, "step": 1419, "train_runtime": 3029.8187, "train_tokens_per_second": 876.4 }, { "epoch": 1.4346727318675765, "grad_norm": 0.37715446949005127, "learning_rate": 5.6810126582278486e-05, "loss": 0.0315, "num_input_tokens_seen": 2657226, "step": 1420, "train_runtime": 3031.5956, "train_tokens_per_second": 876.511 }, { "epoch": 1.4356835986858731, "grad_norm": 0.258142352104187, "learning_rate": 5.670886075949368e-05, "loss": 0.0281, "num_input_tokens_seen": 2659126, "step": 1421, "train_runtime": 3033.3202, "train_tokens_per_second": 876.639 }, { "epoch": 1.4366944655041698, "grad_norm": 0.254810631275177, "learning_rate": 5.660759493670886e-05, "loss": 0.1667, "num_input_tokens_seen": 2660518, "step": 1422, "train_runtime": 3034.9171, "train_tokens_per_second": 876.636 }, { "epoch": 1.4377053323224664, "grad_norm": 0.1798725575208664, "learning_rate": 5.650632911392405e-05, "loss": 0.0269, "num_input_tokens_seen": 2663040, "step": 1423, "train_runtime": 3036.9671, "train_tokens_per_second": 876.875 }, { "epoch": 1.4387161991407633, "grad_norm": 0.25288665294647217, "learning_rate": 5.640506329113925e-05, "loss": 0.1269, "num_input_tokens_seen": 2664688, "step": 1424, "train_runtime": 3038.6365, "train_tokens_per_second": 876.935 }, { "epoch": 1.43972706595906, "grad_norm": 0.47461217641830444, "learning_rate": 5.6303797468354433e-05, "loss": 0.0824, "num_input_tokens_seen": 2666324, "step": 1425, "train_runtime": 3040.2615, "train_tokens_per_second": 877.005 }, { "epoch": 1.4407379327773566, "grad_norm": 0.31943273544311523, "learning_rate": 5.6202531645569624e-05, "loss": 0.0615, "num_input_tokens_seen": 2667832, "step": 1426, "train_runtime": 3041.8692, "train_tokens_per_second": 877.037 }, { "epoch": 1.4417487995956533, "grad_norm": 0.3467959463596344, "learning_rate": 5.610126582278481e-05, "loss": 0.0626, "num_input_tokens_seen": 2670182, "step": 1427, "train_runtime": 3043.8189, "train_tokens_per_second": 877.247 }, { "epoch": 1.44275966641395, "grad_norm": 0.2863708734512329, "learning_rate": 5.6000000000000006e-05, "loss": 0.042, "num_input_tokens_seen": 2672256, "step": 1428, "train_runtime": 3045.6698, "train_tokens_per_second": 877.395 }, { "epoch": 1.4437705332322466, "grad_norm": 0.2715647518634796, "learning_rate": 5.58987341772152e-05, "loss": 0.066, "num_input_tokens_seen": 2674658, "step": 1429, "train_runtime": 3047.7358, "train_tokens_per_second": 877.589 }, { "epoch": 1.4447814000505432, "grad_norm": 0.4483523666858673, "learning_rate": 5.579746835443038e-05, "loss": 0.1065, "num_input_tokens_seen": 2676262, "step": 1430, "train_runtime": 3049.4143, "train_tokens_per_second": 877.631 }, { "epoch": 1.44579226686884, "grad_norm": 0.37149494886398315, "learning_rate": 5.569620253164557e-05, "loss": 0.1401, "num_input_tokens_seen": 2677980, "step": 1431, "train_runtime": 3051.129, "train_tokens_per_second": 877.701 }, { "epoch": 1.4468031336871368, "grad_norm": 0.4825318455696106, "learning_rate": 5.559493670886077e-05, "loss": 0.1057, "num_input_tokens_seen": 2679978, "step": 1432, "train_runtime": 3052.9173, "train_tokens_per_second": 877.842 }, { "epoch": 1.4478140005054334, "grad_norm": 0.3357631266117096, "learning_rate": 5.549367088607595e-05, "loss": 0.094, "num_input_tokens_seen": 2681664, "step": 1433, "train_runtime": 3054.6065, "train_tokens_per_second": 877.908 }, { "epoch": 1.44882486732373, "grad_norm": 0.4023161232471466, "learning_rate": 5.5392405063291144e-05, "loss": 0.1144, "num_input_tokens_seen": 2683520, "step": 1434, "train_runtime": 3056.4155, "train_tokens_per_second": 877.996 }, { "epoch": 1.4498357341420267, "grad_norm": 0.3820077180862427, "learning_rate": 5.529113924050633e-05, "loss": 0.1455, "num_input_tokens_seen": 2685230, "step": 1435, "train_runtime": 3058.1037, "train_tokens_per_second": 878.07 }, { "epoch": 1.4508466009603236, "grad_norm": 0.34831374883651733, "learning_rate": 5.5189873417721526e-05, "loss": 0.2111, "num_input_tokens_seen": 2687424, "step": 1436, "train_runtime": 3060.0303, "train_tokens_per_second": 878.234 }, { "epoch": 1.4518574677786202, "grad_norm": 0.32861289381980896, "learning_rate": 5.508860759493672e-05, "loss": 0.2198, "num_input_tokens_seen": 2689360, "step": 1437, "train_runtime": 3061.8241, "train_tokens_per_second": 878.352 }, { "epoch": 1.4528683345969169, "grad_norm": 0.23808349668979645, "learning_rate": 5.49873417721519e-05, "loss": 0.0651, "num_input_tokens_seen": 2691382, "step": 1438, "train_runtime": 3063.6001, "train_tokens_per_second": 878.503 }, { "epoch": 1.4538792014152135, "grad_norm": 0.14567086100578308, "learning_rate": 5.488607594936709e-05, "loss": 0.0224, "num_input_tokens_seen": 2693508, "step": 1439, "train_runtime": 3065.5261, "train_tokens_per_second": 878.645 }, { "epoch": 1.4548900682335102, "grad_norm": 0.22057169675827026, "learning_rate": 5.478481012658229e-05, "loss": 0.0611, "num_input_tokens_seen": 2695340, "step": 1440, "train_runtime": 3067.2633, "train_tokens_per_second": 878.744 }, { "epoch": 1.4559009350518068, "grad_norm": 0.3443472981452942, "learning_rate": 5.468354430379747e-05, "loss": 0.0563, "num_input_tokens_seen": 2696972, "step": 1441, "train_runtime": 3070.6772, "train_tokens_per_second": 878.299 }, { "epoch": 1.4569118018701035, "grad_norm": 0.23556926846504211, "learning_rate": 5.4582278481012664e-05, "loss": 0.1597, "num_input_tokens_seen": 2699172, "step": 1442, "train_runtime": 3072.6709, "train_tokens_per_second": 878.445 }, { "epoch": 1.4579226686884004, "grad_norm": 0.36331993341445923, "learning_rate": 5.448101265822785e-05, "loss": 0.0577, "num_input_tokens_seen": 2700880, "step": 1443, "train_runtime": 3074.3674, "train_tokens_per_second": 878.516 }, { "epoch": 1.458933535506697, "grad_norm": 0.4046872556209564, "learning_rate": 5.437974683544303e-05, "loss": 0.0983, "num_input_tokens_seen": 2702438, "step": 1444, "train_runtime": 3076.0295, "train_tokens_per_second": 878.547 }, { "epoch": 1.4599444023249937, "grad_norm": 0.2128485143184662, "learning_rate": 5.427848101265823e-05, "loss": 0.0173, "num_input_tokens_seen": 2704200, "step": 1445, "train_runtime": 3077.6838, "train_tokens_per_second": 878.648 }, { "epoch": 1.4609552691432903, "grad_norm": 0.38131779432296753, "learning_rate": 5.417721518987342e-05, "loss": 0.056, "num_input_tokens_seen": 2706008, "step": 1446, "train_runtime": 3079.4984, "train_tokens_per_second": 878.717 }, { "epoch": 1.4619661359615872, "grad_norm": 0.35823047161102295, "learning_rate": 5.4075949367088605e-05, "loss": 0.0531, "num_input_tokens_seen": 2707540, "step": 1447, "train_runtime": 3081.1191, "train_tokens_per_second": 878.752 }, { "epoch": 1.4629770027798839, "grad_norm": 0.2395031452178955, "learning_rate": 5.3974683544303796e-05, "loss": 0.1408, "num_input_tokens_seen": 2709564, "step": 1448, "train_runtime": 3082.9246, "train_tokens_per_second": 878.894 }, { "epoch": 1.4639878695981805, "grad_norm": 0.40758129954338074, "learning_rate": 5.387341772151899e-05, "loss": 0.0408, "num_input_tokens_seen": 2710994, "step": 1449, "train_runtime": 3084.5386, "train_tokens_per_second": 878.898 }, { "epoch": 1.4649987364164772, "grad_norm": 0.31139180064201355, "learning_rate": 5.377215189873418e-05, "loss": 0.0307, "num_input_tokens_seen": 2712410, "step": 1450, "train_runtime": 3086.1274, "train_tokens_per_second": 878.904 }, { "epoch": 1.4660096032347738, "grad_norm": 0.2450462430715561, "learning_rate": 5.367088607594937e-05, "loss": 0.0372, "num_input_tokens_seen": 2714996, "step": 1451, "train_runtime": 3088.2612, "train_tokens_per_second": 879.134 }, { "epoch": 1.4670204700530705, "grad_norm": 0.40233591198921204, "learning_rate": 5.356962025316455e-05, "loss": 0.0536, "num_input_tokens_seen": 2716772, "step": 1452, "train_runtime": 3089.9649, "train_tokens_per_second": 879.224 }, { "epoch": 1.468031336871367, "grad_norm": 0.24486950039863586, "learning_rate": 5.346835443037975e-05, "loss": 0.0746, "num_input_tokens_seen": 2718616, "step": 1453, "train_runtime": 3091.6601, "train_tokens_per_second": 879.339 }, { "epoch": 1.4690422036896638, "grad_norm": 0.42018240690231323, "learning_rate": 5.336708860759494e-05, "loss": 0.0476, "num_input_tokens_seen": 2720192, "step": 1454, "train_runtime": 3093.2788, "train_tokens_per_second": 879.388 }, { "epoch": 1.4700530705079606, "grad_norm": 0.198269322514534, "learning_rate": 5.3265822784810125e-05, "loss": 0.0358, "num_input_tokens_seen": 2722282, "step": 1455, "train_runtime": 3095.1375, "train_tokens_per_second": 879.535 }, { "epoch": 1.4710639373262573, "grad_norm": 0.20242540538311005, "learning_rate": 5.3164556962025316e-05, "loss": 0.1001, "num_input_tokens_seen": 2724290, "step": 1456, "train_runtime": 3096.984, "train_tokens_per_second": 879.659 }, { "epoch": 1.472074804144554, "grad_norm": 0.3628647029399872, "learning_rate": 5.306329113924051e-05, "loss": 0.1764, "num_input_tokens_seen": 2726146, "step": 1457, "train_runtime": 3098.6931, "train_tokens_per_second": 879.773 }, { "epoch": 1.4730856709628506, "grad_norm": 0.43536707758903503, "learning_rate": 5.29620253164557e-05, "loss": 0.0972, "num_input_tokens_seen": 2727922, "step": 1458, "train_runtime": 3100.4723, "train_tokens_per_second": 879.841 }, { "epoch": 1.4740965377811475, "grad_norm": 0.3844117522239685, "learning_rate": 5.286075949367089e-05, "loss": 0.0652, "num_input_tokens_seen": 2729780, "step": 1459, "train_runtime": 3102.2896, "train_tokens_per_second": 879.924 }, { "epoch": 1.4751074045994441, "grad_norm": 0.27764007449150085, "learning_rate": 5.275949367088607e-05, "loss": 0.0623, "num_input_tokens_seen": 2731426, "step": 1460, "train_runtime": 3103.9148, "train_tokens_per_second": 879.994 }, { "epoch": 1.4761182714177408, "grad_norm": 0.3226267993450165, "learning_rate": 5.265822784810127e-05, "loss": 0.0749, "num_input_tokens_seen": 2733218, "step": 1461, "train_runtime": 3105.6197, "train_tokens_per_second": 880.088 }, { "epoch": 1.4771291382360374, "grad_norm": 0.4703887403011322, "learning_rate": 5.255696202531646e-05, "loss": 0.0883, "num_input_tokens_seen": 2734970, "step": 1462, "train_runtime": 3107.3154, "train_tokens_per_second": 880.171 }, { "epoch": 1.478140005054334, "grad_norm": 0.37779703736305237, "learning_rate": 5.2455696202531645e-05, "loss": 0.0593, "num_input_tokens_seen": 2737162, "step": 1463, "train_runtime": 3109.3016, "train_tokens_per_second": 880.314 }, { "epoch": 1.4791508718726307, "grad_norm": 0.27329879999160767, "learning_rate": 5.2354430379746836e-05, "loss": 0.0346, "num_input_tokens_seen": 2739624, "step": 1464, "train_runtime": 3111.3646, "train_tokens_per_second": 880.522 }, { "epoch": 1.4801617386909274, "grad_norm": 0.3650558888912201, "learning_rate": 5.225316455696203e-05, "loss": 0.0862, "num_input_tokens_seen": 2741206, "step": 1465, "train_runtime": 3112.956, "train_tokens_per_second": 880.58 }, { "epoch": 1.481172605509224, "grad_norm": 0.42867252230644226, "learning_rate": 5.215189873417722e-05, "loss": 0.0948, "num_input_tokens_seen": 2743158, "step": 1466, "train_runtime": 3114.7956, "train_tokens_per_second": 880.686 }, { "epoch": 1.482183472327521, "grad_norm": 0.36611321568489075, "learning_rate": 5.205063291139241e-05, "loss": 0.0708, "num_input_tokens_seen": 2744750, "step": 1467, "train_runtime": 3116.4765, "train_tokens_per_second": 880.722 }, { "epoch": 1.4831943391458176, "grad_norm": 0.30326777696609497, "learning_rate": 5.194936708860759e-05, "loss": 0.1159, "num_input_tokens_seen": 2746582, "step": 1468, "train_runtime": 3118.2017, "train_tokens_per_second": 880.822 }, { "epoch": 1.4842052059641142, "grad_norm": 0.29910722374916077, "learning_rate": 5.184810126582279e-05, "loss": 0.0493, "num_input_tokens_seen": 2748374, "step": 1469, "train_runtime": 3119.9215, "train_tokens_per_second": 880.911 }, { "epoch": 1.4852160727824109, "grad_norm": 0.2985762059688568, "learning_rate": 5.174683544303798e-05, "loss": 0.0416, "num_input_tokens_seen": 2750720, "step": 1470, "train_runtime": 3121.8744, "train_tokens_per_second": 881.112 }, { "epoch": 1.4862269396007077, "grad_norm": 0.25838208198547363, "learning_rate": 5.1645569620253165e-05, "loss": 0.0414, "num_input_tokens_seen": 2752434, "step": 1471, "train_runtime": 3125.6142, "train_tokens_per_second": 880.606 }, { "epoch": 1.4872378064190044, "grad_norm": 0.3674798309803009, "learning_rate": 5.154430379746835e-05, "loss": 0.0974, "num_input_tokens_seen": 2754166, "step": 1472, "train_runtime": 3127.2442, "train_tokens_per_second": 880.701 }, { "epoch": 1.488248673237301, "grad_norm": 0.22060970962047577, "learning_rate": 5.144303797468355e-05, "loss": 0.0979, "num_input_tokens_seen": 2755320, "step": 1473, "train_runtime": 3128.7706, "train_tokens_per_second": 880.64 }, { "epoch": 1.4892595400555977, "grad_norm": 0.27728044986724854, "learning_rate": 5.134177215189874e-05, "loss": 0.1148, "num_input_tokens_seen": 2757252, "step": 1474, "train_runtime": 3130.5213, "train_tokens_per_second": 880.764 }, { "epoch": 1.4902704068738943, "grad_norm": 0.25170692801475525, "learning_rate": 5.124050632911392e-05, "loss": 0.05, "num_input_tokens_seen": 2759246, "step": 1475, "train_runtime": 3132.362, "train_tokens_per_second": 880.883 }, { "epoch": 1.491281273692191, "grad_norm": 0.31603336334228516, "learning_rate": 5.113924050632911e-05, "loss": 0.0422, "num_input_tokens_seen": 2761248, "step": 1476, "train_runtime": 3134.2084, "train_tokens_per_second": 881.003 }, { "epoch": 1.4922921405104876, "grad_norm": 0.3758082985877991, "learning_rate": 5.103797468354431e-05, "loss": 0.0333, "num_input_tokens_seen": 2762948, "step": 1477, "train_runtime": 3135.9247, "train_tokens_per_second": 881.063 }, { "epoch": 1.4933030073287845, "grad_norm": 0.369672030210495, "learning_rate": 5.0936708860759494e-05, "loss": 0.0411, "num_input_tokens_seen": 2764634, "step": 1478, "train_runtime": 3137.63, "train_tokens_per_second": 881.122 }, { "epoch": 1.4943138741470812, "grad_norm": 0.20284321904182434, "learning_rate": 5.0835443037974685e-05, "loss": 0.0414, "num_input_tokens_seen": 2766290, "step": 1479, "train_runtime": 3139.3137, "train_tokens_per_second": 881.177 }, { "epoch": 1.4953247409653778, "grad_norm": 0.29138898849487305, "learning_rate": 5.073417721518987e-05, "loss": 0.0975, "num_input_tokens_seen": 2768234, "step": 1480, "train_runtime": 3141.0871, "train_tokens_per_second": 881.298 }, { "epoch": 1.4963356077836745, "grad_norm": 0.4115141034126282, "learning_rate": 5.0632911392405066e-05, "loss": 0.123, "num_input_tokens_seen": 2770010, "step": 1481, "train_runtime": 3142.785, "train_tokens_per_second": 881.387 }, { "epoch": 1.4973464746019711, "grad_norm": 0.34994015097618103, "learning_rate": 5.053164556962026e-05, "loss": 0.1712, "num_input_tokens_seen": 2771664, "step": 1482, "train_runtime": 3144.4863, "train_tokens_per_second": 881.436 }, { "epoch": 1.498357341420268, "grad_norm": 0.43992385268211365, "learning_rate": 5.043037974683544e-05, "loss": 0.0763, "num_input_tokens_seen": 2773310, "step": 1483, "train_runtime": 3146.1792, "train_tokens_per_second": 881.485 }, { "epoch": 1.4993682082385646, "grad_norm": 0.4387452006340027, "learning_rate": 5.032911392405063e-05, "loss": 0.0745, "num_input_tokens_seen": 2775210, "step": 1484, "train_runtime": 3148.0333, "train_tokens_per_second": 881.569 }, { "epoch": 1.5003790750568613, "grad_norm": 0.33656683564186096, "learning_rate": 5.022784810126583e-05, "loss": 0.0368, "num_input_tokens_seen": 2777192, "step": 1485, "train_runtime": 3149.8982, "train_tokens_per_second": 881.677 }, { "epoch": 1.501389941875158, "grad_norm": 0.5562018752098083, "learning_rate": 5.0126582278481014e-05, "loss": 0.0609, "num_input_tokens_seen": 2778950, "step": 1486, "train_runtime": 3151.6367, "train_tokens_per_second": 881.748 }, { "epoch": 1.5024008086934546, "grad_norm": 0.36017367243766785, "learning_rate": 5.0025316455696205e-05, "loss": 0.0746, "num_input_tokens_seen": 2780576, "step": 1487, "train_runtime": 3153.3209, "train_tokens_per_second": 881.793 }, { "epoch": 1.5034116755117513, "grad_norm": 0.3708136975765228, "learning_rate": 4.9924050632911396e-05, "loss": 0.0551, "num_input_tokens_seen": 2782116, "step": 1488, "train_runtime": 3154.9402, "train_tokens_per_second": 881.828 }, { "epoch": 1.504422542330048, "grad_norm": 0.42238691449165344, "learning_rate": 4.982278481012658e-05, "loss": 0.0532, "num_input_tokens_seen": 2784170, "step": 1489, "train_runtime": 3156.7509, "train_tokens_per_second": 881.973 }, { "epoch": 1.5054334091483446, "grad_norm": 0.3960866630077362, "learning_rate": 4.972151898734178e-05, "loss": 0.0558, "num_input_tokens_seen": 2786032, "step": 1490, "train_runtime": 3158.5452, "train_tokens_per_second": 882.062 }, { "epoch": 1.5064442759666414, "grad_norm": 0.3032436966896057, "learning_rate": 4.962025316455696e-05, "loss": 0.0347, "num_input_tokens_seen": 2788644, "step": 1491, "train_runtime": 3160.6442, "train_tokens_per_second": 882.302 }, { "epoch": 1.507455142784938, "grad_norm": 0.39984366297721863, "learning_rate": 4.951898734177215e-05, "loss": 0.0481, "num_input_tokens_seen": 2790430, "step": 1492, "train_runtime": 3162.3949, "train_tokens_per_second": 882.379 }, { "epoch": 1.5084660096032347, "grad_norm": 0.4460970461368561, "learning_rate": 4.941772151898734e-05, "loss": 0.0616, "num_input_tokens_seen": 2792424, "step": 1493, "train_runtime": 3164.2405, "train_tokens_per_second": 882.494 }, { "epoch": 1.5094768764215316, "grad_norm": 0.3381402790546417, "learning_rate": 4.9316455696202534e-05, "loss": 0.0423, "num_input_tokens_seen": 2794332, "step": 1494, "train_runtime": 3166.0287, "train_tokens_per_second": 882.598 }, { "epoch": 1.5104877432398283, "grad_norm": 0.36955997347831726, "learning_rate": 4.9215189873417725e-05, "loss": 0.0366, "num_input_tokens_seen": 2795796, "step": 1495, "train_runtime": 3167.6879, "train_tokens_per_second": 882.598 }, { "epoch": 1.511498610058125, "grad_norm": 0.407127320766449, "learning_rate": 4.9113924050632915e-05, "loss": 0.0543, "num_input_tokens_seen": 2798410, "step": 1496, "train_runtime": 3169.8453, "train_tokens_per_second": 882.822 }, { "epoch": 1.5125094768764216, "grad_norm": 0.38967975974082947, "learning_rate": 4.90126582278481e-05, "loss": 0.1244, "num_input_tokens_seen": 2800614, "step": 1497, "train_runtime": 3171.7991, "train_tokens_per_second": 882.973 }, { "epoch": 1.5135203436947182, "grad_norm": 0.28805011510849, "learning_rate": 4.89113924050633e-05, "loss": 0.0468, "num_input_tokens_seen": 2802866, "step": 1498, "train_runtime": 3173.806, "train_tokens_per_second": 883.125 }, { "epoch": 1.5145312105130149, "grad_norm": 0.4989212453365326, "learning_rate": 4.881012658227848e-05, "loss": 0.036, "num_input_tokens_seen": 2804408, "step": 1499, "train_runtime": 3175.4213, "train_tokens_per_second": 883.161 }, { "epoch": 1.5155420773313115, "grad_norm": 0.255536824464798, "learning_rate": 4.870886075949367e-05, "loss": 0.0824, "num_input_tokens_seen": 2806676, "step": 1500, "train_runtime": 3177.43, "train_tokens_per_second": 883.316 }, { "epoch": 1.5165529441496082, "grad_norm": 0.3267623782157898, "learning_rate": 4.860759493670886e-05, "loss": 0.1602, "num_input_tokens_seen": 2808414, "step": 1501, "train_runtime": 3181.2601, "train_tokens_per_second": 882.799 }, { "epoch": 1.5175638109679048, "grad_norm": 0.30580955743789673, "learning_rate": 4.8506329113924054e-05, "loss": 0.0183, "num_input_tokens_seen": 2810224, "step": 1502, "train_runtime": 3183.084, "train_tokens_per_second": 882.862 }, { "epoch": 1.5185746777862017, "grad_norm": 0.43657007813453674, "learning_rate": 4.840506329113924e-05, "loss": 0.0496, "num_input_tokens_seen": 2812152, "step": 1503, "train_runtime": 3184.8541, "train_tokens_per_second": 882.977 }, { "epoch": 1.5195855446044984, "grad_norm": 0.2714919149875641, "learning_rate": 4.8303797468354435e-05, "loss": 0.0309, "num_input_tokens_seen": 2814074, "step": 1504, "train_runtime": 3186.6372, "train_tokens_per_second": 883.086 }, { "epoch": 1.520596411422795, "grad_norm": 0.46852630376815796, "learning_rate": 4.820253164556962e-05, "loss": 0.0327, "num_input_tokens_seen": 2816038, "step": 1505, "train_runtime": 3188.4322, "train_tokens_per_second": 883.205 }, { "epoch": 1.5216072782410919, "grad_norm": 0.40275445580482483, "learning_rate": 4.810126582278481e-05, "loss": 0.1504, "num_input_tokens_seen": 2817524, "step": 1506, "train_runtime": 3190.0526, "train_tokens_per_second": 883.222 }, { "epoch": 1.5226181450593885, "grad_norm": 0.44762805104255676, "learning_rate": 4.8e-05, "loss": 0.0871, "num_input_tokens_seen": 2819094, "step": 1507, "train_runtime": 3191.6739, "train_tokens_per_second": 883.265 }, { "epoch": 1.5236290118776852, "grad_norm": 0.2706007659435272, "learning_rate": 4.789873417721519e-05, "loss": 0.1611, "num_input_tokens_seen": 2820686, "step": 1508, "train_runtime": 3193.3418, "train_tokens_per_second": 883.302 }, { "epoch": 1.5246398786959818, "grad_norm": 0.4310125708580017, "learning_rate": 4.779746835443038e-05, "loss": 0.0975, "num_input_tokens_seen": 2822080, "step": 1509, "train_runtime": 3194.9949, "train_tokens_per_second": 883.282 }, { "epoch": 1.5256507455142785, "grad_norm": 0.3630162179470062, "learning_rate": 4.7696202531645574e-05, "loss": 0.2405, "num_input_tokens_seen": 2823804, "step": 1510, "train_runtime": 3196.6974, "train_tokens_per_second": 883.35 }, { "epoch": 1.5266616123325751, "grad_norm": 0.34434300661087036, "learning_rate": 4.759493670886076e-05, "loss": 0.042, "num_input_tokens_seen": 2825408, "step": 1511, "train_runtime": 3198.4159, "train_tokens_per_second": 883.377 }, { "epoch": 1.5276724791508718, "grad_norm": 0.48471885919570923, "learning_rate": 4.7493670886075955e-05, "loss": 0.0832, "num_input_tokens_seen": 2827282, "step": 1512, "train_runtime": 3200.2488, "train_tokens_per_second": 883.457 }, { "epoch": 1.5286833459691684, "grad_norm": 0.44771021604537964, "learning_rate": 4.739240506329114e-05, "loss": 0.0669, "num_input_tokens_seen": 2829082, "step": 1513, "train_runtime": 3201.9645, "train_tokens_per_second": 883.546 }, { "epoch": 1.529694212787465, "grad_norm": 0.3776264488697052, "learning_rate": 4.729113924050633e-05, "loss": 0.0445, "num_input_tokens_seen": 2831086, "step": 1514, "train_runtime": 3203.8063, "train_tokens_per_second": 883.663 }, { "epoch": 1.530705079605762, "grad_norm": 0.33710846304893494, "learning_rate": 4.718987341772152e-05, "loss": 0.0439, "num_input_tokens_seen": 2832904, "step": 1515, "train_runtime": 3205.507, "train_tokens_per_second": 883.762 }, { "epoch": 1.5317159464240586, "grad_norm": 0.353338360786438, "learning_rate": 4.708860759493671e-05, "loss": 0.0891, "num_input_tokens_seen": 2834864, "step": 1516, "train_runtime": 3207.3208, "train_tokens_per_second": 883.873 }, { "epoch": 1.5327268132423553, "grad_norm": 0.46391379833221436, "learning_rate": 4.6987341772151896e-05, "loss": 0.0762, "num_input_tokens_seen": 2836794, "step": 1517, "train_runtime": 3209.0364, "train_tokens_per_second": 884.002 }, { "epoch": 1.5337376800606521, "grad_norm": 0.2619151473045349, "learning_rate": 4.6886075949367094e-05, "loss": 0.0406, "num_input_tokens_seen": 2838746, "step": 1518, "train_runtime": 3210.8295, "train_tokens_per_second": 884.116 }, { "epoch": 1.5347485468789488, "grad_norm": 0.46926215291023254, "learning_rate": 4.678481012658228e-05, "loss": 0.0659, "num_input_tokens_seen": 2840782, "step": 1519, "train_runtime": 3212.67, "train_tokens_per_second": 884.243 }, { "epoch": 1.5357594136972454, "grad_norm": 0.2542581856250763, "learning_rate": 4.668354430379747e-05, "loss": 0.0446, "num_input_tokens_seen": 2842928, "step": 1520, "train_runtime": 3214.5995, "train_tokens_per_second": 884.38 }, { "epoch": 1.536770280515542, "grad_norm": 0.3810141086578369, "learning_rate": 4.658227848101266e-05, "loss": 0.0705, "num_input_tokens_seen": 2844540, "step": 1521, "train_runtime": 3216.2804, "train_tokens_per_second": 884.419 }, { "epoch": 1.5377811473338387, "grad_norm": 0.2847379446029663, "learning_rate": 4.648101265822785e-05, "loss": 0.1102, "num_input_tokens_seen": 2846628, "step": 1522, "train_runtime": 3218.1191, "train_tokens_per_second": 884.563 }, { "epoch": 1.5387920141521354, "grad_norm": 0.33421334624290466, "learning_rate": 4.637974683544304e-05, "loss": 0.0659, "num_input_tokens_seen": 2848616, "step": 1523, "train_runtime": 3219.9061, "train_tokens_per_second": 884.689 }, { "epoch": 1.539802880970432, "grad_norm": 0.45817071199417114, "learning_rate": 4.627848101265823e-05, "loss": 0.141, "num_input_tokens_seen": 2850186, "step": 1524, "train_runtime": 3221.577, "train_tokens_per_second": 884.718 }, { "epoch": 1.5408137477887287, "grad_norm": 0.28081759810447693, "learning_rate": 4.6177215189873416e-05, "loss": 0.0962, "num_input_tokens_seen": 2851894, "step": 1525, "train_runtime": 3223.2834, "train_tokens_per_second": 884.779 }, { "epoch": 1.5418246146070256, "grad_norm": 0.3415515124797821, "learning_rate": 4.6075949367088614e-05, "loss": 0.0708, "num_input_tokens_seen": 2853984, "step": 1526, "train_runtime": 3225.1453, "train_tokens_per_second": 884.916 }, { "epoch": 1.5428354814253222, "grad_norm": 0.3951292634010315, "learning_rate": 4.59746835443038e-05, "loss": 0.1512, "num_input_tokens_seen": 2855646, "step": 1527, "train_runtime": 3226.7713, "train_tokens_per_second": 884.986 }, { "epoch": 1.5438463482436189, "grad_norm": 0.3425312042236328, "learning_rate": 4.587341772151899e-05, "loss": 0.0356, "num_input_tokens_seen": 2857392, "step": 1528, "train_runtime": 3228.4822, "train_tokens_per_second": 885.057 }, { "epoch": 1.5448572150619158, "grad_norm": 0.2674088478088379, "learning_rate": 4.577215189873418e-05, "loss": 0.0757, "num_input_tokens_seen": 2859654, "step": 1529, "train_runtime": 3230.4704, "train_tokens_per_second": 885.213 }, { "epoch": 1.5458680818802124, "grad_norm": 0.364071786403656, "learning_rate": 4.567088607594937e-05, "loss": 0.0911, "num_input_tokens_seen": 2861464, "step": 1530, "train_runtime": 3232.1115, "train_tokens_per_second": 885.323 }, { "epoch": 1.546878948698509, "grad_norm": 0.39632412791252136, "learning_rate": 4.556962025316456e-05, "loss": 0.0403, "num_input_tokens_seen": 2863206, "step": 1531, "train_runtime": 3235.5505, "train_tokens_per_second": 884.921 }, { "epoch": 1.5478898155168057, "grad_norm": 0.4037443697452545, "learning_rate": 4.546835443037975e-05, "loss": 0.0994, "num_input_tokens_seen": 2865276, "step": 1532, "train_runtime": 3237.3464, "train_tokens_per_second": 885.069 }, { "epoch": 1.5489006823351024, "grad_norm": 0.26075279712677, "learning_rate": 4.5367088607594936e-05, "loss": 0.2078, "num_input_tokens_seen": 2867388, "step": 1533, "train_runtime": 3239.207, "train_tokens_per_second": 885.213 }, { "epoch": 1.549911549153399, "grad_norm": 0.37886476516723633, "learning_rate": 4.526582278481013e-05, "loss": 0.0221, "num_input_tokens_seen": 2869110, "step": 1534, "train_runtime": 3240.9013, "train_tokens_per_second": 885.281 }, { "epoch": 1.5509224159716957, "grad_norm": 0.3209759294986725, "learning_rate": 4.516455696202532e-05, "loss": 0.0385, "num_input_tokens_seen": 2870932, "step": 1535, "train_runtime": 3242.6459, "train_tokens_per_second": 885.367 }, { "epoch": 1.5519332827899923, "grad_norm": 0.27610719203948975, "learning_rate": 4.506329113924051e-05, "loss": 0.1039, "num_input_tokens_seen": 2872076, "step": 1536, "train_runtime": 3244.1883, "train_tokens_per_second": 885.299 }, { "epoch": 1.552944149608289, "grad_norm": 0.38578173518180847, "learning_rate": 4.49620253164557e-05, "loss": 0.0651, "num_input_tokens_seen": 2874312, "step": 1537, "train_runtime": 3246.0648, "train_tokens_per_second": 885.476 }, { "epoch": 1.5539550164265858, "grad_norm": 0.1943003535270691, "learning_rate": 4.486075949367089e-05, "loss": 0.049, "num_input_tokens_seen": 2876204, "step": 1538, "train_runtime": 3247.7282, "train_tokens_per_second": 885.605 }, { "epoch": 1.5549658832448825, "grad_norm": 0.32248440384864807, "learning_rate": 4.4759493670886074e-05, "loss": 0.0629, "num_input_tokens_seen": 2878178, "step": 1539, "train_runtime": 3249.456, "train_tokens_per_second": 885.741 }, { "epoch": 1.5559767500631791, "grad_norm": 0.30921298265457153, "learning_rate": 4.465822784810127e-05, "loss": 0.0512, "num_input_tokens_seen": 2880524, "step": 1540, "train_runtime": 3251.5319, "train_tokens_per_second": 885.898 }, { "epoch": 1.556987616881476, "grad_norm": 0.3740369975566864, "learning_rate": 4.4556962025316456e-05, "loss": 0.0876, "num_input_tokens_seen": 2882240, "step": 1541, "train_runtime": 3253.2256, "train_tokens_per_second": 885.964 }, { "epoch": 1.5579984836997727, "grad_norm": 0.4145367741584778, "learning_rate": 4.445569620253165e-05, "loss": 0.0164, "num_input_tokens_seen": 2883906, "step": 1542, "train_runtime": 3254.927, "train_tokens_per_second": 886.012 }, { "epoch": 1.5590093505180693, "grad_norm": 0.30224737524986267, "learning_rate": 4.435443037974684e-05, "loss": 0.0824, "num_input_tokens_seen": 2885680, "step": 1543, "train_runtime": 3256.6356, "train_tokens_per_second": 886.092 }, { "epoch": 1.560020217336366, "grad_norm": 0.3344022333621979, "learning_rate": 4.425316455696203e-05, "loss": 0.0506, "num_input_tokens_seen": 2887422, "step": 1544, "train_runtime": 3258.2614, "train_tokens_per_second": 886.185 }, { "epoch": 1.5610310841546626, "grad_norm": 0.3814561069011688, "learning_rate": 4.415189873417722e-05, "loss": 0.1226, "num_input_tokens_seen": 2889730, "step": 1545, "train_runtime": 3260.1931, "train_tokens_per_second": 886.368 }, { "epoch": 1.5620419509729593, "grad_norm": 0.37799033522605896, "learning_rate": 4.405063291139241e-05, "loss": 0.0354, "num_input_tokens_seen": 2891488, "step": 1546, "train_runtime": 3261.8884, "train_tokens_per_second": 886.446 }, { "epoch": 1.563052817791256, "grad_norm": 0.3428725004196167, "learning_rate": 4.3949367088607594e-05, "loss": 0.0671, "num_input_tokens_seen": 2893978, "step": 1547, "train_runtime": 3263.9428, "train_tokens_per_second": 886.651 }, { "epoch": 1.5640636846095526, "grad_norm": 0.3052919805049896, "learning_rate": 4.384810126582279e-05, "loss": 0.1173, "num_input_tokens_seen": 2895564, "step": 1548, "train_runtime": 3265.6051, "train_tokens_per_second": 886.685 }, { "epoch": 1.5650745514278492, "grad_norm": 0.30939236283302307, "learning_rate": 4.3746835443037976e-05, "loss": 0.0366, "num_input_tokens_seen": 2897434, "step": 1549, "train_runtime": 3267.3342, "train_tokens_per_second": 886.788 }, { "epoch": 1.566085418246146, "grad_norm": 0.3609532117843628, "learning_rate": 4.364556962025317e-05, "loss": 0.1215, "num_input_tokens_seen": 2899540, "step": 1550, "train_runtime": 3269.2306, "train_tokens_per_second": 886.918 }, { "epoch": 1.5670962850644428, "grad_norm": 0.3999773859977722, "learning_rate": 4.354430379746836e-05, "loss": 0.0909, "num_input_tokens_seen": 2901558, "step": 1551, "train_runtime": 3271.0838, "train_tokens_per_second": 887.033 }, { "epoch": 1.5681071518827394, "grad_norm": 0.3055749833583832, "learning_rate": 4.344303797468355e-05, "loss": 0.03, "num_input_tokens_seen": 2903400, "step": 1552, "train_runtime": 3272.7857, "train_tokens_per_second": 887.134 }, { "epoch": 1.5691180187010363, "grad_norm": 0.3198142349720001, "learning_rate": 4.334177215189873e-05, "loss": 0.0436, "num_input_tokens_seen": 2904874, "step": 1553, "train_runtime": 3274.3998, "train_tokens_per_second": 887.147 }, { "epoch": 1.570128885519333, "grad_norm": 0.38498926162719727, "learning_rate": 4.324050632911393e-05, "loss": 0.1081, "num_input_tokens_seen": 2906934, "step": 1554, "train_runtime": 3276.2922, "train_tokens_per_second": 887.263 }, { "epoch": 1.5711397523376296, "grad_norm": 0.4477058947086334, "learning_rate": 4.3139240506329114e-05, "loss": 0.0794, "num_input_tokens_seen": 2908718, "step": 1555, "train_runtime": 3278.0016, "train_tokens_per_second": 887.345 }, { "epoch": 1.5721506191559262, "grad_norm": 0.4519939124584198, "learning_rate": 4.3037974683544305e-05, "loss": 0.1103, "num_input_tokens_seen": 2910224, "step": 1556, "train_runtime": 3279.6009, "train_tokens_per_second": 887.371 }, { "epoch": 1.573161485974223, "grad_norm": 0.2098495066165924, "learning_rate": 4.2936708860759496e-05, "loss": 0.0446, "num_input_tokens_seen": 2911796, "step": 1557, "train_runtime": 3281.301, "train_tokens_per_second": 887.391 }, { "epoch": 1.5741723527925195, "grad_norm": 0.36339613795280457, "learning_rate": 4.283544303797469e-05, "loss": 0.1402, "num_input_tokens_seen": 2914342, "step": 1558, "train_runtime": 3283.508, "train_tokens_per_second": 887.57 }, { "epoch": 1.5751832196108162, "grad_norm": 0.4097069203853607, "learning_rate": 4.273417721518988e-05, "loss": 0.1268, "num_input_tokens_seen": 2915786, "step": 1559, "train_runtime": 3285.0914, "train_tokens_per_second": 887.581 }, { "epoch": 1.5761940864291129, "grad_norm": 0.26405400037765503, "learning_rate": 4.263291139240507e-05, "loss": 0.0301, "num_input_tokens_seen": 2917450, "step": 1560, "train_runtime": 3286.7227, "train_tokens_per_second": 887.647 }, { "epoch": 1.5772049532474095, "grad_norm": 0.4004761874675751, "learning_rate": 4.253164556962025e-05, "loss": 0.1261, "num_input_tokens_seen": 2919334, "step": 1561, "train_runtime": 3290.5112, "train_tokens_per_second": 887.198 }, { "epoch": 1.5782158200657064, "grad_norm": 0.367236465215683, "learning_rate": 4.243037974683545e-05, "loss": 0.0542, "num_input_tokens_seen": 2920826, "step": 1562, "train_runtime": 3292.1237, "train_tokens_per_second": 887.216 }, { "epoch": 1.579226686884003, "grad_norm": 0.37024685740470886, "learning_rate": 4.2329113924050634e-05, "loss": 0.1237, "num_input_tokens_seen": 2923084, "step": 1563, "train_runtime": 3294.0702, "train_tokens_per_second": 887.378 }, { "epoch": 1.5802375537022997, "grad_norm": 0.43871355056762695, "learning_rate": 4.2227848101265825e-05, "loss": 0.1158, "num_input_tokens_seen": 2925074, "step": 1564, "train_runtime": 3295.8527, "train_tokens_per_second": 887.501 }, { "epoch": 1.5812484205205966, "grad_norm": 0.3516930043697357, "learning_rate": 4.2126582278481016e-05, "loss": 0.1077, "num_input_tokens_seen": 2926876, "step": 1565, "train_runtime": 3297.569, "train_tokens_per_second": 887.586 }, { "epoch": 1.5822592873388932, "grad_norm": 0.34721431136131287, "learning_rate": 4.202531645569621e-05, "loss": 0.0515, "num_input_tokens_seen": 2928626, "step": 1566, "train_runtime": 3299.2715, "train_tokens_per_second": 887.658 }, { "epoch": 1.5832701541571899, "grad_norm": 0.46014919877052307, "learning_rate": 4.192405063291139e-05, "loss": 0.0941, "num_input_tokens_seen": 2930188, "step": 1567, "train_runtime": 3300.9259, "train_tokens_per_second": 887.687 }, { "epoch": 1.5842810209754865, "grad_norm": 0.2739830017089844, "learning_rate": 4.182278481012659e-05, "loss": 0.0173, "num_input_tokens_seen": 2932382, "step": 1568, "train_runtime": 3302.8715, "train_tokens_per_second": 887.828 }, { "epoch": 1.5852918877937832, "grad_norm": 0.28977423906326294, "learning_rate": 4.172151898734177e-05, "loss": 0.06, "num_input_tokens_seen": 2934348, "step": 1569, "train_runtime": 3304.7439, "train_tokens_per_second": 887.92 }, { "epoch": 1.5863027546120798, "grad_norm": 0.29666587710380554, "learning_rate": 4.162025316455696e-05, "loss": 0.028, "num_input_tokens_seen": 2935992, "step": 1570, "train_runtime": 3306.3523, "train_tokens_per_second": 887.985 }, { "epoch": 1.5873136214303765, "grad_norm": 0.24439549446105957, "learning_rate": 4.1518987341772154e-05, "loss": 0.0288, "num_input_tokens_seen": 2937884, "step": 1571, "train_runtime": 3308.1229, "train_tokens_per_second": 888.082 }, { "epoch": 1.5883244882486731, "grad_norm": 0.2889177203178406, "learning_rate": 4.1417721518987345e-05, "loss": 0.0612, "num_input_tokens_seen": 2939926, "step": 1572, "train_runtime": 3309.9791, "train_tokens_per_second": 888.201 }, { "epoch": 1.5893353550669698, "grad_norm": 0.301922082901001, "learning_rate": 4.1316455696202536e-05, "loss": 0.0876, "num_input_tokens_seen": 2941746, "step": 1573, "train_runtime": 3311.6266, "train_tokens_per_second": 888.308 }, { "epoch": 1.5903462218852666, "grad_norm": 0.33724361658096313, "learning_rate": 4.121518987341773e-05, "loss": 0.0364, "num_input_tokens_seen": 2943372, "step": 1574, "train_runtime": 3313.3024, "train_tokens_per_second": 888.35 }, { "epoch": 1.5913570887035633, "grad_norm": 0.32761749625205994, "learning_rate": 4.111392405063291e-05, "loss": 0.0884, "num_input_tokens_seen": 2945414, "step": 1575, "train_runtime": 3315.0984, "train_tokens_per_second": 888.485 }, { "epoch": 1.59236795552186, "grad_norm": 0.3484243154525757, "learning_rate": 4.101265822784811e-05, "loss": 0.0564, "num_input_tokens_seen": 2947230, "step": 1576, "train_runtime": 3316.7599, "train_tokens_per_second": 888.587 }, { "epoch": 1.5933788223401568, "grad_norm": 0.239505335688591, "learning_rate": 4.091139240506329e-05, "loss": 0.0246, "num_input_tokens_seen": 2949028, "step": 1577, "train_runtime": 3318.4555, "train_tokens_per_second": 888.675 }, { "epoch": 1.5943896891584535, "grad_norm": 0.6944891214370728, "learning_rate": 4.081012658227848e-05, "loss": 0.0375, "num_input_tokens_seen": 2950658, "step": 1578, "train_runtime": 3320.0662, "train_tokens_per_second": 888.735 }, { "epoch": 1.5954005559767501, "grad_norm": 0.3439199924468994, "learning_rate": 4.0708860759493674e-05, "loss": 0.0358, "num_input_tokens_seen": 2952280, "step": 1579, "train_runtime": 3321.745, "train_tokens_per_second": 888.774 }, { "epoch": 1.5964114227950468, "grad_norm": 0.36311614513397217, "learning_rate": 4.0607594936708865e-05, "loss": 0.0393, "num_input_tokens_seen": 2953958, "step": 1580, "train_runtime": 3323.4213, "train_tokens_per_second": 888.83 }, { "epoch": 1.5974222896133434, "grad_norm": 0.35376057028770447, "learning_rate": 4.050632911392405e-05, "loss": 0.1029, "num_input_tokens_seen": 2955546, "step": 1581, "train_runtime": 3325.052, "train_tokens_per_second": 888.872 }, { "epoch": 1.59843315643164, "grad_norm": 0.3227643668651581, "learning_rate": 4.040506329113925e-05, "loss": 0.0779, "num_input_tokens_seen": 2957638, "step": 1582, "train_runtime": 3326.9713, "train_tokens_per_second": 888.988 }, { "epoch": 1.5994440232499367, "grad_norm": 0.26405656337738037, "learning_rate": 4.030379746835443e-05, "loss": 0.0572, "num_input_tokens_seen": 2959866, "step": 1583, "train_runtime": 3328.8558, "train_tokens_per_second": 889.154 }, { "epoch": 1.6004548900682334, "grad_norm": 0.40279439091682434, "learning_rate": 4.020253164556962e-05, "loss": 0.0615, "num_input_tokens_seen": 2961808, "step": 1584, "train_runtime": 3330.637, "train_tokens_per_second": 889.262 }, { "epoch": 1.6004548900682334, "eval_loss": 0.20690308511257172, "eval_runtime": 61.4454, "eval_samples_per_second": 14.305, "eval_steps_per_second": 7.161, "num_input_tokens_seen": 2961808, "step": 1584 }, { "epoch": 1.60146575688653, "grad_norm": 0.21898916363716125, "learning_rate": 4.010126582278481e-05, "loss": 0.0401, "num_input_tokens_seen": 2963660, "step": 1585, "train_runtime": 3393.812, "train_tokens_per_second": 873.254 }, { "epoch": 1.602476623704827, "grad_norm": 0.36059755086898804, "learning_rate": 4e-05, "loss": 0.0928, "num_input_tokens_seen": 2965198, "step": 1586, "train_runtime": 3395.4389, "train_tokens_per_second": 873.289 }, { "epoch": 1.6034874905231236, "grad_norm": 0.2097867876291275, "learning_rate": 3.9898734177215194e-05, "loss": 0.0634, "num_input_tokens_seen": 2966894, "step": 1587, "train_runtime": 3397.1445, "train_tokens_per_second": 873.349 }, { "epoch": 1.6044983573414204, "grad_norm": 0.433549165725708, "learning_rate": 3.9797468354430385e-05, "loss": 0.0814, "num_input_tokens_seen": 2968904, "step": 1588, "train_runtime": 3398.9986, "train_tokens_per_second": 873.464 }, { "epoch": 1.605509224159717, "grad_norm": 0.24861283600330353, "learning_rate": 3.969620253164557e-05, "loss": 0.0224, "num_input_tokens_seen": 2971010, "step": 1589, "train_runtime": 3400.846, "train_tokens_per_second": 873.609 }, { "epoch": 1.6065200909780137, "grad_norm": 0.3574238717556, "learning_rate": 3.959493670886077e-05, "loss": 0.0343, "num_input_tokens_seen": 2972712, "step": 1590, "train_runtime": 3402.5278, "train_tokens_per_second": 873.677 }, { "epoch": 1.6075309577963104, "grad_norm": 0.37372520565986633, "learning_rate": 3.949367088607595e-05, "loss": 0.0454, "num_input_tokens_seen": 2974944, "step": 1591, "train_runtime": 3406.6108, "train_tokens_per_second": 873.286 }, { "epoch": 1.608541824614607, "grad_norm": 0.22096741199493408, "learning_rate": 3.939240506329114e-05, "loss": 0.0798, "num_input_tokens_seen": 2976462, "step": 1592, "train_runtime": 3408.2282, "train_tokens_per_second": 873.317 }, { "epoch": 1.6095526914329037, "grad_norm": 0.5310118794441223, "learning_rate": 3.929113924050633e-05, "loss": 0.1122, "num_input_tokens_seen": 2977774, "step": 1593, "train_runtime": 3409.8306, "train_tokens_per_second": 873.291 }, { "epoch": 1.6105635582512003, "grad_norm": 0.5043955445289612, "learning_rate": 3.918987341772152e-05, "loss": 0.067, "num_input_tokens_seen": 2979276, "step": 1594, "train_runtime": 3411.4498, "train_tokens_per_second": 873.317 }, { "epoch": 1.611574425069497, "grad_norm": 0.33924058079719543, "learning_rate": 3.908860759493671e-05, "loss": 0.0631, "num_input_tokens_seen": 2980924, "step": 1595, "train_runtime": 3413.1497, "train_tokens_per_second": 873.365 }, { "epoch": 1.6125852918877936, "grad_norm": 0.41132983565330505, "learning_rate": 3.8987341772151905e-05, "loss": 0.0758, "num_input_tokens_seen": 2982850, "step": 1596, "train_runtime": 3414.8769, "train_tokens_per_second": 873.487 }, { "epoch": 1.6135961587060905, "grad_norm": 0.23638512194156647, "learning_rate": 3.888607594936709e-05, "loss": 0.098, "num_input_tokens_seen": 2985090, "step": 1597, "train_runtime": 3416.8191, "train_tokens_per_second": 873.646 }, { "epoch": 1.6146070255243872, "grad_norm": 0.2883054316043854, "learning_rate": 3.878481012658228e-05, "loss": 0.1323, "num_input_tokens_seen": 2986740, "step": 1598, "train_runtime": 3418.4258, "train_tokens_per_second": 873.718 }, { "epoch": 1.6156178923426838, "grad_norm": 0.5699235796928406, "learning_rate": 3.868354430379747e-05, "loss": 0.1003, "num_input_tokens_seen": 2988010, "step": 1599, "train_runtime": 3420.015, "train_tokens_per_second": 873.683 }, { "epoch": 1.6166287591609807, "grad_norm": 0.3784661293029785, "learning_rate": 3.858227848101266e-05, "loss": 0.0631, "num_input_tokens_seen": 2989514, "step": 1600, "train_runtime": 3421.6311, "train_tokens_per_second": 873.71 }, { "epoch": 1.6176396259792774, "grad_norm": 0.5482260584831238, "learning_rate": 3.848101265822785e-05, "loss": 0.1314, "num_input_tokens_seen": 2991438, "step": 1601, "train_runtime": 3423.4669, "train_tokens_per_second": 873.804 }, { "epoch": 1.618650492797574, "grad_norm": 0.2891421318054199, "learning_rate": 3.837974683544304e-05, "loss": 0.1128, "num_input_tokens_seen": 2993592, "step": 1602, "train_runtime": 3425.4128, "train_tokens_per_second": 873.936 }, { "epoch": 1.6196613596158707, "grad_norm": 0.3944542109966278, "learning_rate": 3.827848101265823e-05, "loss": 0.0539, "num_input_tokens_seen": 2995730, "step": 1603, "train_runtime": 3427.2325, "train_tokens_per_second": 874.096 }, { "epoch": 1.6206722264341673, "grad_norm": 0.25274398922920227, "learning_rate": 3.8177215189873425e-05, "loss": 0.0646, "num_input_tokens_seen": 2997638, "step": 1604, "train_runtime": 3429.0067, "train_tokens_per_second": 874.2 }, { "epoch": 1.621683093252464, "grad_norm": 0.2859501838684082, "learning_rate": 3.807594936708861e-05, "loss": 0.0308, "num_input_tokens_seen": 2999940, "step": 1605, "train_runtime": 3430.9704, "train_tokens_per_second": 874.371 }, { "epoch": 1.6226939600707606, "grad_norm": 0.3490632474422455, "learning_rate": 3.79746835443038e-05, "loss": 0.0791, "num_input_tokens_seen": 3001676, "step": 1606, "train_runtime": 3432.7221, "train_tokens_per_second": 874.43 }, { "epoch": 1.6237048268890573, "grad_norm": 0.22489693760871887, "learning_rate": 3.787341772151899e-05, "loss": 0.0332, "num_input_tokens_seen": 3003440, "step": 1607, "train_runtime": 3434.3838, "train_tokens_per_second": 874.521 }, { "epoch": 1.624715693707354, "grad_norm": 0.33829188346862793, "learning_rate": 3.777215189873418e-05, "loss": 0.1052, "num_input_tokens_seen": 3005078, "step": 1608, "train_runtime": 3436.1076, "train_tokens_per_second": 874.559 }, { "epoch": 1.6257265605256508, "grad_norm": 0.3595799505710602, "learning_rate": 3.7670886075949366e-05, "loss": 0.0979, "num_input_tokens_seen": 3007042, "step": 1609, "train_runtime": 3437.8351, "train_tokens_per_second": 874.691 }, { "epoch": 1.6267374273439474, "grad_norm": 0.40967512130737305, "learning_rate": 3.756962025316456e-05, "loss": 0.0536, "num_input_tokens_seen": 3008866, "step": 1610, "train_runtime": 3439.5656, "train_tokens_per_second": 874.781 }, { "epoch": 1.627748294162244, "grad_norm": 0.20662987232208252, "learning_rate": 3.746835443037975e-05, "loss": 0.1028, "num_input_tokens_seen": 3010694, "step": 1611, "train_runtime": 3441.2932, "train_tokens_per_second": 874.873 }, { "epoch": 1.628759160980541, "grad_norm": 0.47322145104408264, "learning_rate": 3.736708860759494e-05, "loss": 0.1607, "num_input_tokens_seen": 3012564, "step": 1612, "train_runtime": 3443.0161, "train_tokens_per_second": 874.978 }, { "epoch": 1.6297700277988376, "grad_norm": 0.4481852352619171, "learning_rate": 3.726582278481013e-05, "loss": 0.0523, "num_input_tokens_seen": 3014556, "step": 1613, "train_runtime": 3444.8321, "train_tokens_per_second": 875.095 }, { "epoch": 1.6307808946171343, "grad_norm": 0.29072868824005127, "learning_rate": 3.716455696202532e-05, "loss": 0.0495, "num_input_tokens_seen": 3016728, "step": 1614, "train_runtime": 3446.7291, "train_tokens_per_second": 875.244 }, { "epoch": 1.631791761435431, "grad_norm": 0.43090128898620605, "learning_rate": 3.706329113924051e-05, "loss": 0.0723, "num_input_tokens_seen": 3018388, "step": 1615, "train_runtime": 3448.4321, "train_tokens_per_second": 875.293 }, { "epoch": 1.6328026282537276, "grad_norm": 0.2544103264808655, "learning_rate": 3.69620253164557e-05, "loss": 0.0485, "num_input_tokens_seen": 3020116, "step": 1616, "train_runtime": 3450.198, "train_tokens_per_second": 875.346 }, { "epoch": 1.6338134950720242, "grad_norm": 0.36950311064720154, "learning_rate": 3.6860759493670886e-05, "loss": 0.0395, "num_input_tokens_seen": 3022582, "step": 1617, "train_runtime": 3452.2543, "train_tokens_per_second": 875.539 }, { "epoch": 1.6348243618903209, "grad_norm": 0.5384958982467651, "learning_rate": 3.675949367088608e-05, "loss": 0.0612, "num_input_tokens_seen": 3024602, "step": 1618, "train_runtime": 3454.0514, "train_tokens_per_second": 875.668 }, { "epoch": 1.6358352287086175, "grad_norm": 0.3118353486061096, "learning_rate": 3.665822784810127e-05, "loss": 0.0377, "num_input_tokens_seen": 3026142, "step": 1619, "train_runtime": 3455.7186, "train_tokens_per_second": 875.691 }, { "epoch": 1.6368460955269142, "grad_norm": 0.2323567271232605, "learning_rate": 3.655696202531646e-05, "loss": 0.111, "num_input_tokens_seen": 3028408, "step": 1620, "train_runtime": 3457.7347, "train_tokens_per_second": 875.836 }, { "epoch": 1.637856962345211, "grad_norm": 0.2999313175678253, "learning_rate": 3.645569620253165e-05, "loss": 0.0919, "num_input_tokens_seen": 3029928, "step": 1621, "train_runtime": 3461.5257, "train_tokens_per_second": 875.316 }, { "epoch": 1.6388678291635077, "grad_norm": 0.2249026745557785, "learning_rate": 3.635443037974683e-05, "loss": 0.0493, "num_input_tokens_seen": 3031656, "step": 1622, "train_runtime": 3463.177, "train_tokens_per_second": 875.397 }, { "epoch": 1.6398786959818044, "grad_norm": 0.3893710672855377, "learning_rate": 3.6253164556962024e-05, "loss": 0.0686, "num_input_tokens_seen": 3033868, "step": 1623, "train_runtime": 3465.1688, "train_tokens_per_second": 875.533 }, { "epoch": 1.6408895628001012, "grad_norm": 0.2950393855571747, "learning_rate": 3.6151898734177215e-05, "loss": 0.0519, "num_input_tokens_seen": 3035604, "step": 1624, "train_runtime": 3466.8271, "train_tokens_per_second": 875.614 }, { "epoch": 1.6419004296183979, "grad_norm": 0.3039438724517822, "learning_rate": 3.6050632911392405e-05, "loss": 0.0658, "num_input_tokens_seen": 3037318, "step": 1625, "train_runtime": 3468.6247, "train_tokens_per_second": 875.655 }, { "epoch": 1.6429112964366945, "grad_norm": 0.31106412410736084, "learning_rate": 3.5949367088607596e-05, "loss": 0.0486, "num_input_tokens_seen": 3038774, "step": 1626, "train_runtime": 3470.2353, "train_tokens_per_second": 875.668 }, { "epoch": 1.6439221632549912, "grad_norm": 0.31181344389915466, "learning_rate": 3.584810126582279e-05, "loss": 0.0405, "num_input_tokens_seen": 3041112, "step": 1627, "train_runtime": 3472.2348, "train_tokens_per_second": 875.837 }, { "epoch": 1.6449330300732878, "grad_norm": 0.245428204536438, "learning_rate": 3.574683544303797e-05, "loss": 0.0519, "num_input_tokens_seen": 3042706, "step": 1628, "train_runtime": 3473.8686, "train_tokens_per_second": 875.884 }, { "epoch": 1.6459438968915845, "grad_norm": 0.5006813406944275, "learning_rate": 3.564556962025317e-05, "loss": 0.0562, "num_input_tokens_seen": 3044244, "step": 1629, "train_runtime": 3475.5517, "train_tokens_per_second": 875.902 }, { "epoch": 1.6469547637098811, "grad_norm": 0.5197868943214417, "learning_rate": 3.554430379746835e-05, "loss": 0.0743, "num_input_tokens_seen": 3045864, "step": 1630, "train_runtime": 3477.1808, "train_tokens_per_second": 875.958 }, { "epoch": 1.6479656305281778, "grad_norm": 0.472901314496994, "learning_rate": 3.5443037974683544e-05, "loss": 0.0701, "num_input_tokens_seen": 3047418, "step": 1631, "train_runtime": 3478.8007, "train_tokens_per_second": 875.997 }, { "epoch": 1.6489764973464744, "grad_norm": 0.286668062210083, "learning_rate": 3.5341772151898735e-05, "loss": 0.1391, "num_input_tokens_seen": 3049356, "step": 1632, "train_runtime": 3480.5941, "train_tokens_per_second": 876.102 }, { "epoch": 1.6499873641647713, "grad_norm": 0.37653443217277527, "learning_rate": 3.5240506329113925e-05, "loss": 0.0457, "num_input_tokens_seen": 3051262, "step": 1633, "train_runtime": 3482.4096, "train_tokens_per_second": 876.193 }, { "epoch": 1.650998230983068, "grad_norm": 0.29574844241142273, "learning_rate": 3.5139240506329116e-05, "loss": 0.0891, "num_input_tokens_seen": 3053406, "step": 1634, "train_runtime": 3484.3254, "train_tokens_per_second": 876.326 }, { "epoch": 1.6520090978013646, "grad_norm": 0.3396419584751129, "learning_rate": 3.503797468354431e-05, "loss": 0.0389, "num_input_tokens_seen": 3055568, "step": 1635, "train_runtime": 3486.2441, "train_tokens_per_second": 876.464 }, { "epoch": 1.6530199646196615, "grad_norm": 0.2615917921066284, "learning_rate": 3.493670886075949e-05, "loss": 0.0213, "num_input_tokens_seen": 3057390, "step": 1636, "train_runtime": 3488.0114, "train_tokens_per_second": 876.542 }, { "epoch": 1.6540308314379581, "grad_norm": 0.29763129353523254, "learning_rate": 3.483544303797469e-05, "loss": 0.0337, "num_input_tokens_seen": 3059462, "step": 1637, "train_runtime": 3489.8733, "train_tokens_per_second": 876.668 }, { "epoch": 1.6550416982562548, "grad_norm": 0.34447604417800903, "learning_rate": 3.473417721518987e-05, "loss": 0.0297, "num_input_tokens_seen": 3061326, "step": 1638, "train_runtime": 3491.6033, "train_tokens_per_second": 876.768 }, { "epoch": 1.6560525650745515, "grad_norm": 0.3206090033054352, "learning_rate": 3.4632911392405064e-05, "loss": 0.0405, "num_input_tokens_seen": 3062970, "step": 1639, "train_runtime": 3493.2486, "train_tokens_per_second": 876.826 }, { "epoch": 1.657063431892848, "grad_norm": 0.30783480405807495, "learning_rate": 3.4531645569620255e-05, "loss": 0.1111, "num_input_tokens_seen": 3064720, "step": 1640, "train_runtime": 3494.9723, "train_tokens_per_second": 876.894 }, { "epoch": 1.6580742987111448, "grad_norm": 0.3695422112941742, "learning_rate": 3.4430379746835445e-05, "loss": 0.1878, "num_input_tokens_seen": 3066876, "step": 1641, "train_runtime": 3496.7743, "train_tokens_per_second": 877.059 }, { "epoch": 1.6590851655294414, "grad_norm": 0.29870784282684326, "learning_rate": 3.432911392405063e-05, "loss": 0.0641, "num_input_tokens_seen": 3068808, "step": 1642, "train_runtime": 3498.5693, "train_tokens_per_second": 877.161 }, { "epoch": 1.660096032347738, "grad_norm": 0.22628048062324524, "learning_rate": 3.422784810126583e-05, "loss": 0.0922, "num_input_tokens_seen": 3070700, "step": 1643, "train_runtime": 3500.2827, "train_tokens_per_second": 877.272 }, { "epoch": 1.6611068991660347, "grad_norm": 0.31168633699417114, "learning_rate": 3.412658227848101e-05, "loss": 0.0971, "num_input_tokens_seen": 3072532, "step": 1644, "train_runtime": 3502.0445, "train_tokens_per_second": 877.354 }, { "epoch": 1.6621177659843316, "grad_norm": 0.381340891122818, "learning_rate": 3.40253164556962e-05, "loss": 0.0354, "num_input_tokens_seen": 3074744, "step": 1645, "train_runtime": 3503.9945, "train_tokens_per_second": 877.497 }, { "epoch": 1.6631286328026282, "grad_norm": 0.39735448360443115, "learning_rate": 3.392405063291139e-05, "loss": 0.1051, "num_input_tokens_seen": 3076964, "step": 1646, "train_runtime": 3505.912, "train_tokens_per_second": 877.65 }, { "epoch": 1.664139499620925, "grad_norm": 0.3131244480609894, "learning_rate": 3.3822784810126584e-05, "loss": 0.0336, "num_input_tokens_seen": 3078936, "step": 1647, "train_runtime": 3507.6954, "train_tokens_per_second": 877.766 }, { "epoch": 1.6651503664392218, "grad_norm": 0.3398909866809845, "learning_rate": 3.3721518987341775e-05, "loss": 0.0456, "num_input_tokens_seen": 3080974, "step": 1648, "train_runtime": 3509.5487, "train_tokens_per_second": 877.883 }, { "epoch": 1.6661612332575184, "grad_norm": 0.31063729524612427, "learning_rate": 3.3620253164556965e-05, "loss": 0.0512, "num_input_tokens_seen": 3082698, "step": 1649, "train_runtime": 3511.2723, "train_tokens_per_second": 877.943 }, { "epoch": 1.667172100075815, "grad_norm": 0.29326948523521423, "learning_rate": 3.351898734177215e-05, "loss": 0.0589, "num_input_tokens_seen": 3084766, "step": 1650, "train_runtime": 3513.0733, "train_tokens_per_second": 878.082 }, { "epoch": 1.6681829668941117, "grad_norm": 0.3226855993270874, "learning_rate": 3.341772151898735e-05, "loss": 0.09, "num_input_tokens_seen": 3086578, "step": 1651, "train_runtime": 3516.59, "train_tokens_per_second": 877.719 }, { "epoch": 1.6691938337124084, "grad_norm": 0.429928183555603, "learning_rate": 3.331645569620253e-05, "loss": 0.0788, "num_input_tokens_seen": 3088930, "step": 1652, "train_runtime": 3518.6015, "train_tokens_per_second": 877.886 }, { "epoch": 1.670204700530705, "grad_norm": 0.2601509392261505, "learning_rate": 3.321518987341772e-05, "loss": 0.0299, "num_input_tokens_seen": 3091036, "step": 1653, "train_runtime": 3520.4146, "train_tokens_per_second": 878.032 }, { "epoch": 1.6712155673490017, "grad_norm": 0.22332744300365448, "learning_rate": 3.311392405063291e-05, "loss": 0.0211, "num_input_tokens_seen": 3093124, "step": 1654, "train_runtime": 3522.3461, "train_tokens_per_second": 878.143 }, { "epoch": 1.6722264341672983, "grad_norm": 0.455143004655838, "learning_rate": 3.3012658227848104e-05, "loss": 0.148, "num_input_tokens_seen": 3094950, "step": 1655, "train_runtime": 3524.0557, "train_tokens_per_second": 878.235 }, { "epoch": 1.6732373009855952, "grad_norm": 0.2553136646747589, "learning_rate": 3.291139240506329e-05, "loss": 0.0257, "num_input_tokens_seen": 3096976, "step": 1656, "train_runtime": 3525.8481, "train_tokens_per_second": 878.363 }, { "epoch": 1.6742481678038919, "grad_norm": 0.29013291001319885, "learning_rate": 3.2810126582278485e-05, "loss": 0.0216, "num_input_tokens_seen": 3098344, "step": 1657, "train_runtime": 3527.4394, "train_tokens_per_second": 878.355 }, { "epoch": 1.6752590346221885, "grad_norm": 0.2900941073894501, "learning_rate": 3.270886075949367e-05, "loss": 0.0176, "num_input_tokens_seen": 3099804, "step": 1658, "train_runtime": 3529.0384, "train_tokens_per_second": 878.371 }, { "epoch": 1.6762699014404854, "grad_norm": 0.35698002576828003, "learning_rate": 3.260759493670886e-05, "loss": 0.0771, "num_input_tokens_seen": 3101562, "step": 1659, "train_runtime": 3530.7335, "train_tokens_per_second": 878.447 }, { "epoch": 1.677280768258782, "grad_norm": 0.3415001630783081, "learning_rate": 3.250632911392405e-05, "loss": 0.0489, "num_input_tokens_seen": 3103098, "step": 1660, "train_runtime": 3532.3562, "train_tokens_per_second": 878.478 }, { "epoch": 1.6782916350770787, "grad_norm": 0.22493651509284973, "learning_rate": 3.240506329113924e-05, "loss": 0.0553, "num_input_tokens_seen": 3104696, "step": 1661, "train_runtime": 3534.0299, "train_tokens_per_second": 878.514 }, { "epoch": 1.6793025018953753, "grad_norm": 0.34866082668304443, "learning_rate": 3.230379746835443e-05, "loss": 0.0657, "num_input_tokens_seen": 3106364, "step": 1662, "train_runtime": 3535.7287, "train_tokens_per_second": 878.564 }, { "epoch": 1.680313368713672, "grad_norm": 0.36344191431999207, "learning_rate": 3.2202531645569624e-05, "loss": 0.1163, "num_input_tokens_seen": 3108372, "step": 1663, "train_runtime": 3537.4666, "train_tokens_per_second": 878.7 }, { "epoch": 1.6813242355319686, "grad_norm": 0.2658107280731201, "learning_rate": 3.210126582278481e-05, "loss": 0.0744, "num_input_tokens_seen": 3110926, "step": 1664, "train_runtime": 3539.5363, "train_tokens_per_second": 878.908 }, { "epoch": 1.6823351023502653, "grad_norm": 0.24368809163570404, "learning_rate": 3.2000000000000005e-05, "loss": 0.1506, "num_input_tokens_seen": 3112924, "step": 1665, "train_runtime": 3541.3191, "train_tokens_per_second": 879.03 }, { "epoch": 1.683345969168562, "grad_norm": 0.40462726354599, "learning_rate": 3.189873417721519e-05, "loss": 0.0738, "num_input_tokens_seen": 3114486, "step": 1666, "train_runtime": 3542.9466, "train_tokens_per_second": 879.067 }, { "epoch": 1.6843568359868586, "grad_norm": 0.29145365953445435, "learning_rate": 3.179746835443038e-05, "loss": 0.0673, "num_input_tokens_seen": 3115978, "step": 1667, "train_runtime": 3544.6292, "train_tokens_per_second": 879.07 }, { "epoch": 1.6853677028051555, "grad_norm": 0.49398040771484375, "learning_rate": 3.169620253164557e-05, "loss": 0.0958, "num_input_tokens_seen": 3117472, "step": 1668, "train_runtime": 3546.2591, "train_tokens_per_second": 879.087 }, { "epoch": 1.6863785696234521, "grad_norm": 0.28147852420806885, "learning_rate": 3.159493670886076e-05, "loss": 0.0506, "num_input_tokens_seen": 3119424, "step": 1669, "train_runtime": 3548.1174, "train_tokens_per_second": 879.177 }, { "epoch": 1.6873894364417488, "grad_norm": 0.2428324669599533, "learning_rate": 3.1493670886075946e-05, "loss": 0.2152, "num_input_tokens_seen": 3121726, "step": 1670, "train_runtime": 3550.011, "train_tokens_per_second": 879.357 }, { "epoch": 1.6884003032600456, "grad_norm": 0.4500986337661743, "learning_rate": 3.1392405063291144e-05, "loss": 0.0839, "num_input_tokens_seen": 3123334, "step": 1671, "train_runtime": 3551.6968, "train_tokens_per_second": 879.392 }, { "epoch": 1.6894111700783423, "grad_norm": 0.4447426199913025, "learning_rate": 3.129113924050633e-05, "loss": 0.0878, "num_input_tokens_seen": 3125578, "step": 1672, "train_runtime": 3553.6451, "train_tokens_per_second": 879.541 }, { "epoch": 1.690422036896639, "grad_norm": 0.2644793689250946, "learning_rate": 3.118987341772152e-05, "loss": 0.028, "num_input_tokens_seen": 3127446, "step": 1673, "train_runtime": 3555.392, "train_tokens_per_second": 879.635 }, { "epoch": 1.6914329037149356, "grad_norm": 0.2933402955532074, "learning_rate": 3.108860759493671e-05, "loss": 0.1343, "num_input_tokens_seen": 3129356, "step": 1674, "train_runtime": 3557.1717, "train_tokens_per_second": 879.731 }, { "epoch": 1.6924437705332323, "grad_norm": 0.33312034606933594, "learning_rate": 3.09873417721519e-05, "loss": 0.0464, "num_input_tokens_seen": 3131180, "step": 1675, "train_runtime": 3558.8963, "train_tokens_per_second": 879.818 }, { "epoch": 1.693454637351529, "grad_norm": 0.42872354388237, "learning_rate": 3.088607594936709e-05, "loss": 0.1049, "num_input_tokens_seen": 3132998, "step": 1676, "train_runtime": 3560.6798, "train_tokens_per_second": 879.888 }, { "epoch": 1.6944655041698256, "grad_norm": 0.4059085547924042, "learning_rate": 3.078481012658228e-05, "loss": 0.085, "num_input_tokens_seen": 3134908, "step": 1677, "train_runtime": 3562.5173, "train_tokens_per_second": 879.97 }, { "epoch": 1.6954763709881222, "grad_norm": 0.34580790996551514, "learning_rate": 3.0683544303797466e-05, "loss": 0.0289, "num_input_tokens_seen": 3136666, "step": 1678, "train_runtime": 3564.2872, "train_tokens_per_second": 880.026 }, { "epoch": 1.6964872378064189, "grad_norm": 0.3064793050289154, "learning_rate": 3.0582278481012664e-05, "loss": 0.0506, "num_input_tokens_seen": 3138340, "step": 1679, "train_runtime": 3565.9111, "train_tokens_per_second": 880.095 }, { "epoch": 1.6974981046247157, "grad_norm": 0.32855427265167236, "learning_rate": 3.0481012658227848e-05, "loss": 0.0277, "num_input_tokens_seen": 3140538, "step": 1680, "train_runtime": 3567.7794, "train_tokens_per_second": 880.25 }, { "epoch": 1.6985089714430124, "grad_norm": 0.17733171582221985, "learning_rate": 3.0379746835443042e-05, "loss": 0.072, "num_input_tokens_seen": 3142338, "step": 1681, "train_runtime": 3571.6203, "train_tokens_per_second": 879.807 }, { "epoch": 1.699519838261309, "grad_norm": 0.3169107735157013, "learning_rate": 3.0278481012658226e-05, "loss": 0.131, "num_input_tokens_seen": 3144178, "step": 1682, "train_runtime": 3573.4073, "train_tokens_per_second": 879.882 }, { "epoch": 1.700530705079606, "grad_norm": 0.5541936159133911, "learning_rate": 3.017721518987342e-05, "loss": 0.0643, "num_input_tokens_seen": 3145768, "step": 1683, "train_runtime": 3575.0448, "train_tokens_per_second": 879.924 }, { "epoch": 1.7015415718979026, "grad_norm": 0.385830283164978, "learning_rate": 3.0075949367088608e-05, "loss": 0.0573, "num_input_tokens_seen": 3147908, "step": 1684, "train_runtime": 3576.9055, "train_tokens_per_second": 880.065 }, { "epoch": 1.7025524387161992, "grad_norm": 0.3147771954536438, "learning_rate": 2.99746835443038e-05, "loss": 0.0588, "num_input_tokens_seen": 3149528, "step": 1685, "train_runtime": 3578.5851, "train_tokens_per_second": 880.104 }, { "epoch": 1.7035633055344959, "grad_norm": 0.35411569476127625, "learning_rate": 2.9873417721518986e-05, "loss": 0.2247, "num_input_tokens_seen": 3151662, "step": 1686, "train_runtime": 3580.4425, "train_tokens_per_second": 880.244 }, { "epoch": 1.7045741723527925, "grad_norm": 0.3230752646923065, "learning_rate": 2.977215189873418e-05, "loss": 0.0929, "num_input_tokens_seen": 3153480, "step": 1687, "train_runtime": 3582.2102, "train_tokens_per_second": 880.317 }, { "epoch": 1.7055850391710892, "grad_norm": 0.3497144877910614, "learning_rate": 2.9670886075949368e-05, "loss": 0.0765, "num_input_tokens_seen": 3155566, "step": 1688, "train_runtime": 3584.0104, "train_tokens_per_second": 880.457 }, { "epoch": 1.7065959059893858, "grad_norm": 0.3007948696613312, "learning_rate": 2.956962025316456e-05, "loss": 0.0661, "num_input_tokens_seen": 3157276, "step": 1689, "train_runtime": 3585.713, "train_tokens_per_second": 880.516 }, { "epoch": 1.7076067728076825, "grad_norm": 0.24831940233707428, "learning_rate": 2.9468354430379746e-05, "loss": 0.1695, "num_input_tokens_seen": 3158966, "step": 1690, "train_runtime": 3587.4078, "train_tokens_per_second": 880.571 }, { "epoch": 1.7086176396259791, "grad_norm": 0.22481276094913483, "learning_rate": 2.936708860759494e-05, "loss": 0.0347, "num_input_tokens_seen": 3161430, "step": 1691, "train_runtime": 3589.4596, "train_tokens_per_second": 880.754 }, { "epoch": 1.709628506444276, "grad_norm": 0.4430962800979614, "learning_rate": 2.9265822784810128e-05, "loss": 0.0589, "num_input_tokens_seen": 3163380, "step": 1692, "train_runtime": 3591.215, "train_tokens_per_second": 880.866 }, { "epoch": 1.7106393732625726, "grad_norm": 0.4412935674190521, "learning_rate": 2.916455696202532e-05, "loss": 0.093, "num_input_tokens_seen": 3164830, "step": 1693, "train_runtime": 3592.8208, "train_tokens_per_second": 880.876 }, { "epoch": 1.7116502400808693, "grad_norm": 0.3547500967979431, "learning_rate": 2.9063291139240506e-05, "loss": 0.0606, "num_input_tokens_seen": 3166754, "step": 1694, "train_runtime": 3594.6097, "train_tokens_per_second": 880.973 }, { "epoch": 1.7126611068991662, "grad_norm": 0.27725890278816223, "learning_rate": 2.89620253164557e-05, "loss": 0.1469, "num_input_tokens_seen": 3168720, "step": 1695, "train_runtime": 3596.458, "train_tokens_per_second": 881.067 }, { "epoch": 1.7136719737174628, "grad_norm": 0.3641546368598938, "learning_rate": 2.8860759493670884e-05, "loss": 0.0755, "num_input_tokens_seen": 3170374, "step": 1696, "train_runtime": 3598.1465, "train_tokens_per_second": 881.113 }, { "epoch": 1.7146828405357595, "grad_norm": 0.31772106885910034, "learning_rate": 2.875949367088608e-05, "loss": 0.1011, "num_input_tokens_seen": 3172188, "step": 1697, "train_runtime": 3599.8613, "train_tokens_per_second": 881.197 }, { "epoch": 1.7156937073540561, "grad_norm": 0.2380431741476059, "learning_rate": 2.8658227848101266e-05, "loss": 0.1429, "num_input_tokens_seen": 3174010, "step": 1698, "train_runtime": 3601.633, "train_tokens_per_second": 881.27 }, { "epoch": 1.7167045741723528, "grad_norm": 0.2958558201789856, "learning_rate": 2.8556962025316457e-05, "loss": 0.1072, "num_input_tokens_seen": 3175792, "step": 1699, "train_runtime": 3603.3646, "train_tokens_per_second": 881.341 }, { "epoch": 1.7177154409906494, "grad_norm": 0.33768099546432495, "learning_rate": 2.8455696202531644e-05, "loss": 0.0603, "num_input_tokens_seen": 3177884, "step": 1700, "train_runtime": 3605.164, "train_tokens_per_second": 881.481 }, { "epoch": 1.718726307808946, "grad_norm": 0.5989857316017151, "learning_rate": 2.835443037974684e-05, "loss": 0.1356, "num_input_tokens_seen": 3179780, "step": 1701, "train_runtime": 3606.9538, "train_tokens_per_second": 881.569 }, { "epoch": 1.7197371746272427, "grad_norm": 0.33277639746665955, "learning_rate": 2.8253164556962026e-05, "loss": 0.0285, "num_input_tokens_seen": 3181572, "step": 1702, "train_runtime": 3608.6584, "train_tokens_per_second": 881.65 }, { "epoch": 1.7207480414455394, "grad_norm": 0.2743334174156189, "learning_rate": 2.8151898734177217e-05, "loss": 0.1222, "num_input_tokens_seen": 3183630, "step": 1703, "train_runtime": 3610.523, "train_tokens_per_second": 881.764 }, { "epoch": 1.7217589082638363, "grad_norm": 0.44329899549484253, "learning_rate": 2.8050632911392404e-05, "loss": 0.0812, "num_input_tokens_seen": 3185760, "step": 1704, "train_runtime": 3612.3822, "train_tokens_per_second": 881.9 }, { "epoch": 1.722769775082133, "grad_norm": 0.4088926613330841, "learning_rate": 2.79493670886076e-05, "loss": 0.0677, "num_input_tokens_seen": 3187358, "step": 1705, "train_runtime": 3614.0081, "train_tokens_per_second": 881.945 }, { "epoch": 1.7237806419004296, "grad_norm": 0.25346213579177856, "learning_rate": 2.7848101265822786e-05, "loss": 0.0398, "num_input_tokens_seen": 3189602, "step": 1706, "train_runtime": 3615.9007, "train_tokens_per_second": 882.104 }, { "epoch": 1.7247915087187264, "grad_norm": 0.3881666362285614, "learning_rate": 2.7746835443037977e-05, "loss": 0.1507, "num_input_tokens_seen": 3191628, "step": 1707, "train_runtime": 3617.7394, "train_tokens_per_second": 882.216 }, { "epoch": 1.725802375537023, "grad_norm": 0.19983576238155365, "learning_rate": 2.7645569620253164e-05, "loss": 0.0417, "num_input_tokens_seen": 3193318, "step": 1708, "train_runtime": 3619.4224, "train_tokens_per_second": 882.273 }, { "epoch": 1.7268132423553197, "grad_norm": 0.34657493233680725, "learning_rate": 2.754430379746836e-05, "loss": 0.0355, "num_input_tokens_seen": 3195264, "step": 1709, "train_runtime": 3621.202, "train_tokens_per_second": 882.377 }, { "epoch": 1.7278241091736164, "grad_norm": 0.36328038573265076, "learning_rate": 2.7443037974683546e-05, "loss": 0.038, "num_input_tokens_seen": 3196688, "step": 1710, "train_runtime": 3622.8077, "train_tokens_per_second": 882.379 }, { "epoch": 1.728834975991913, "grad_norm": 0.2944445312023163, "learning_rate": 2.7341772151898737e-05, "loss": 0.0572, "num_input_tokens_seen": 3198552, "step": 1711, "train_runtime": 3626.5823, "train_tokens_per_second": 881.974 }, { "epoch": 1.7298458428102097, "grad_norm": 0.3125305771827698, "learning_rate": 2.7240506329113924e-05, "loss": 0.1438, "num_input_tokens_seen": 3200708, "step": 1712, "train_runtime": 3628.3926, "train_tokens_per_second": 882.128 }, { "epoch": 1.7308567096285064, "grad_norm": 0.5570347905158997, "learning_rate": 2.7139240506329115e-05, "loss": 0.0744, "num_input_tokens_seen": 3202646, "step": 1713, "train_runtime": 3630.2888, "train_tokens_per_second": 882.201 }, { "epoch": 1.731867576446803, "grad_norm": 0.4130195081233978, "learning_rate": 2.7037974683544302e-05, "loss": 0.1418, "num_input_tokens_seen": 3204522, "step": 1714, "train_runtime": 3632.0503, "train_tokens_per_second": 882.29 }, { "epoch": 1.7328784432650999, "grad_norm": 0.41316428780555725, "learning_rate": 2.6936708860759497e-05, "loss": 0.0336, "num_input_tokens_seen": 3206614, "step": 1715, "train_runtime": 3633.8169, "train_tokens_per_second": 882.437 }, { "epoch": 1.7338893100833965, "grad_norm": 0.2011561542749405, "learning_rate": 2.6835443037974684e-05, "loss": 0.1147, "num_input_tokens_seen": 3208340, "step": 1716, "train_runtime": 3635.5185, "train_tokens_per_second": 882.499 }, { "epoch": 1.7349001769016932, "grad_norm": 0.32938793301582336, "learning_rate": 2.6734177215189875e-05, "loss": 0.0375, "num_input_tokens_seen": 3209928, "step": 1717, "train_runtime": 3637.2106, "train_tokens_per_second": 882.525 }, { "epoch": 1.73591104371999, "grad_norm": 0.3284657299518585, "learning_rate": 2.6632911392405062e-05, "loss": 0.1219, "num_input_tokens_seen": 3211956, "step": 1718, "train_runtime": 3639.0588, "train_tokens_per_second": 882.634 }, { "epoch": 1.7369219105382867, "grad_norm": 0.2739722728729248, "learning_rate": 2.6531645569620257e-05, "loss": 0.0915, "num_input_tokens_seen": 3213430, "step": 1719, "train_runtime": 3640.678, "train_tokens_per_second": 882.646 }, { "epoch": 1.7379327773565834, "grad_norm": 0.36229974031448364, "learning_rate": 2.6430379746835444e-05, "loss": 0.0325, "num_input_tokens_seen": 3214796, "step": 1720, "train_runtime": 3642.278, "train_tokens_per_second": 882.633 }, { "epoch": 1.73894364417488, "grad_norm": 0.3124796152114868, "learning_rate": 2.6329113924050635e-05, "loss": 0.0319, "num_input_tokens_seen": 3216342, "step": 1721, "train_runtime": 3643.9185, "train_tokens_per_second": 882.66 }, { "epoch": 1.7399545109931767, "grad_norm": 0.39590394496917725, "learning_rate": 2.6227848101265822e-05, "loss": 0.0648, "num_input_tokens_seen": 3218220, "step": 1722, "train_runtime": 3645.689, "train_tokens_per_second": 882.747 }, { "epoch": 1.7409653778114733, "grad_norm": 0.5818724632263184, "learning_rate": 2.6126582278481017e-05, "loss": 0.0365, "num_input_tokens_seen": 3219820, "step": 1723, "train_runtime": 3647.3174, "train_tokens_per_second": 882.791 }, { "epoch": 1.74197624462977, "grad_norm": 0.4091465473175049, "learning_rate": 2.6025316455696204e-05, "loss": 0.0574, "num_input_tokens_seen": 3221266, "step": 1724, "train_runtime": 3648.9129, "train_tokens_per_second": 882.802 }, { "epoch": 1.7429871114480666, "grad_norm": 0.3920089304447174, "learning_rate": 2.5924050632911395e-05, "loss": 0.0678, "num_input_tokens_seen": 3222628, "step": 1725, "train_runtime": 3650.4884, "train_tokens_per_second": 882.794 }, { "epoch": 1.7439979782663633, "grad_norm": 0.2700601816177368, "learning_rate": 2.5822784810126582e-05, "loss": 0.1054, "num_input_tokens_seen": 3224814, "step": 1726, "train_runtime": 3652.4073, "train_tokens_per_second": 882.928 }, { "epoch": 1.7450088450846601, "grad_norm": 0.31126463413238525, "learning_rate": 2.5721518987341777e-05, "loss": 0.0776, "num_input_tokens_seen": 3226534, "step": 1727, "train_runtime": 3654.0474, "train_tokens_per_second": 883.003 }, { "epoch": 1.7460197119029568, "grad_norm": 0.20121997594833374, "learning_rate": 2.562025316455696e-05, "loss": 0.0697, "num_input_tokens_seen": 3228730, "step": 1728, "train_runtime": 3656.025, "train_tokens_per_second": 883.126 }, { "epoch": 1.7470305787212534, "grad_norm": 0.34647297859191895, "learning_rate": 2.5518987341772155e-05, "loss": 0.086, "num_input_tokens_seen": 3230610, "step": 1729, "train_runtime": 3657.7975, "train_tokens_per_second": 883.212 }, { "epoch": 1.7480414455395503, "grad_norm": 0.30007243156433105, "learning_rate": 2.5417721518987342e-05, "loss": 0.0508, "num_input_tokens_seen": 3232674, "step": 1730, "train_runtime": 3659.6546, "train_tokens_per_second": 883.328 }, { "epoch": 1.749052312357847, "grad_norm": 0.3535133898258209, "learning_rate": 2.5316455696202533e-05, "loss": 0.0361, "num_input_tokens_seen": 3234534, "step": 1731, "train_runtime": 3661.3835, "train_tokens_per_second": 883.419 }, { "epoch": 1.7500631791761436, "grad_norm": 0.28902703523635864, "learning_rate": 2.521518987341772e-05, "loss": 0.0799, "num_input_tokens_seen": 3236180, "step": 1732, "train_runtime": 3663.0059, "train_tokens_per_second": 883.477 }, { "epoch": 1.7510740459944403, "grad_norm": 0.2519863545894623, "learning_rate": 2.5113924050632915e-05, "loss": 0.1221, "num_input_tokens_seen": 3237998, "step": 1733, "train_runtime": 3664.7267, "train_tokens_per_second": 883.558 }, { "epoch": 1.752084912812737, "grad_norm": 0.1911328136920929, "learning_rate": 2.5012658227848102e-05, "loss": 0.0492, "num_input_tokens_seen": 3239724, "step": 1734, "train_runtime": 3666.3628, "train_tokens_per_second": 883.634 }, { "epoch": 1.7530957796310336, "grad_norm": 0.20987670123577118, "learning_rate": 2.491139240506329e-05, "loss": 0.0397, "num_input_tokens_seen": 3241578, "step": 1735, "train_runtime": 3668.13, "train_tokens_per_second": 883.714 }, { "epoch": 1.7541066464493302, "grad_norm": 0.4213102459907532, "learning_rate": 2.481012658227848e-05, "loss": 0.1066, "num_input_tokens_seen": 3243238, "step": 1736, "train_runtime": 3669.7713, "train_tokens_per_second": 883.771 }, { "epoch": 1.7551175132676269, "grad_norm": 0.3850823938846588, "learning_rate": 2.470886075949367e-05, "loss": 0.0777, "num_input_tokens_seen": 3244444, "step": 1737, "train_runtime": 3671.3175, "train_tokens_per_second": 883.727 }, { "epoch": 1.7561283800859235, "grad_norm": 0.34885308146476746, "learning_rate": 2.4607594936708862e-05, "loss": 0.0747, "num_input_tokens_seen": 3246040, "step": 1738, "train_runtime": 3672.9985, "train_tokens_per_second": 883.757 }, { "epoch": 1.7571392469042204, "grad_norm": 0.5272138118743896, "learning_rate": 2.450632911392405e-05, "loss": 0.0817, "num_input_tokens_seen": 3247988, "step": 1739, "train_runtime": 3674.7367, "train_tokens_per_second": 883.87 }, { "epoch": 1.758150113722517, "grad_norm": 0.5044370889663696, "learning_rate": 2.440506329113924e-05, "loss": 0.0728, "num_input_tokens_seen": 3249736, "step": 1740, "train_runtime": 3676.4452, "train_tokens_per_second": 883.934 }, { "epoch": 1.7591609805408137, "grad_norm": 0.23041538894176483, "learning_rate": 2.430379746835443e-05, "loss": 0.0555, "num_input_tokens_seen": 3251864, "step": 1741, "train_runtime": 3680.0506, "train_tokens_per_second": 883.647 }, { "epoch": 1.7601718473591106, "grad_norm": 0.2476688027381897, "learning_rate": 2.420253164556962e-05, "loss": 0.0848, "num_input_tokens_seen": 3253816, "step": 1742, "train_runtime": 3681.8431, "train_tokens_per_second": 883.747 }, { "epoch": 1.7611827141774072, "grad_norm": 0.32131579518318176, "learning_rate": 2.410126582278481e-05, "loss": 0.0918, "num_input_tokens_seen": 3255658, "step": 1743, "train_runtime": 3683.5575, "train_tokens_per_second": 883.835 }, { "epoch": 1.762193580995704, "grad_norm": 0.2802947163581848, "learning_rate": 2.4e-05, "loss": 0.0356, "num_input_tokens_seen": 3257502, "step": 1744, "train_runtime": 3685.3504, "train_tokens_per_second": 883.906 }, { "epoch": 1.7632044478140005, "grad_norm": 0.3082278370857239, "learning_rate": 2.389873417721519e-05, "loss": 0.0543, "num_input_tokens_seen": 3259444, "step": 1745, "train_runtime": 3687.1265, "train_tokens_per_second": 884.007 }, { "epoch": 1.7642153146322972, "grad_norm": 0.23779797554016113, "learning_rate": 2.379746835443038e-05, "loss": 0.075, "num_input_tokens_seen": 3261450, "step": 1746, "train_runtime": 3688.973, "train_tokens_per_second": 884.108 }, { "epoch": 1.7652261814505938, "grad_norm": 0.37954798340797424, "learning_rate": 2.369620253164557e-05, "loss": 0.0447, "num_input_tokens_seen": 3263334, "step": 1747, "train_runtime": 3690.7708, "train_tokens_per_second": 884.188 }, { "epoch": 1.7662370482688905, "grad_norm": 0.3391364812850952, "learning_rate": 2.359493670886076e-05, "loss": 0.0673, "num_input_tokens_seen": 3265210, "step": 1748, "train_runtime": 3692.514, "train_tokens_per_second": 884.278 }, { "epoch": 1.7672479150871871, "grad_norm": 0.2723386585712433, "learning_rate": 2.3493670886075948e-05, "loss": 0.0744, "num_input_tokens_seen": 3267092, "step": 1749, "train_runtime": 3694.2161, "train_tokens_per_second": 884.38 }, { "epoch": 1.7682587819054838, "grad_norm": 0.21548764407634735, "learning_rate": 2.339240506329114e-05, "loss": 0.0099, "num_input_tokens_seen": 3269218, "step": 1750, "train_runtime": 3696.0707, "train_tokens_per_second": 884.512 }, { "epoch": 1.7692696487237807, "grad_norm": 0.3597107529640198, "learning_rate": 2.329113924050633e-05, "loss": 0.0323, "num_input_tokens_seen": 3270860, "step": 1751, "train_runtime": 3697.7877, "train_tokens_per_second": 884.545 }, { "epoch": 1.7702805155420773, "grad_norm": 0.3120933175086975, "learning_rate": 2.318987341772152e-05, "loss": 0.0341, "num_input_tokens_seen": 3272532, "step": 1752, "train_runtime": 3699.4245, "train_tokens_per_second": 884.606 }, { "epoch": 1.771291382360374, "grad_norm": 0.32579106092453003, "learning_rate": 2.3088607594936708e-05, "loss": 0.0383, "num_input_tokens_seen": 3273872, "step": 1753, "train_runtime": 3701.0004, "train_tokens_per_second": 884.591 }, { "epoch": 1.7723022491786709, "grad_norm": 0.3475702702999115, "learning_rate": 2.29873417721519e-05, "loss": 0.0292, "num_input_tokens_seen": 3275510, "step": 1754, "train_runtime": 3702.6831, "train_tokens_per_second": 884.631 }, { "epoch": 1.7733131159969675, "grad_norm": 0.37655583024024963, "learning_rate": 2.288607594936709e-05, "loss": 0.0319, "num_input_tokens_seen": 3278086, "step": 1755, "train_runtime": 3704.8254, "train_tokens_per_second": 884.815 }, { "epoch": 1.7743239828152642, "grad_norm": 0.3488801121711731, "learning_rate": 2.278481012658228e-05, "loss": 0.1461, "num_input_tokens_seen": 3279882, "step": 1756, "train_runtime": 3706.5955, "train_tokens_per_second": 884.877 }, { "epoch": 1.7753348496335608, "grad_norm": 0.31840255856513977, "learning_rate": 2.2683544303797468e-05, "loss": 0.0267, "num_input_tokens_seen": 3281578, "step": 1757, "train_runtime": 3708.2196, "train_tokens_per_second": 884.947 }, { "epoch": 1.7763457164518575, "grad_norm": 0.2555081844329834, "learning_rate": 2.258227848101266e-05, "loss": 0.0237, "num_input_tokens_seen": 3283602, "step": 1758, "train_runtime": 3710.0757, "train_tokens_per_second": 885.05 }, { "epoch": 1.7773565832701541, "grad_norm": 0.36034834384918213, "learning_rate": 2.248101265822785e-05, "loss": 0.1254, "num_input_tokens_seen": 3285178, "step": 1759, "train_runtime": 3711.761, "train_tokens_per_second": 885.073 }, { "epoch": 1.7783674500884508, "grad_norm": 0.2103455513715744, "learning_rate": 2.2379746835443037e-05, "loss": 0.0703, "num_input_tokens_seen": 3286980, "step": 1760, "train_runtime": 3713.5712, "train_tokens_per_second": 885.126 }, { "epoch": 1.7793783169067474, "grad_norm": 0.34630411863327026, "learning_rate": 2.2278481012658228e-05, "loss": 0.0573, "num_input_tokens_seen": 3288718, "step": 1761, "train_runtime": 3715.2592, "train_tokens_per_second": 885.192 }, { "epoch": 1.780389183725044, "grad_norm": 0.2746468782424927, "learning_rate": 2.217721518987342e-05, "loss": 0.0984, "num_input_tokens_seen": 3290670, "step": 1762, "train_runtime": 3717.0411, "train_tokens_per_second": 885.293 }, { "epoch": 1.781400050543341, "grad_norm": 0.5191876888275146, "learning_rate": 2.207594936708861e-05, "loss": 0.0789, "num_input_tokens_seen": 3292230, "step": 1763, "train_runtime": 3718.6756, "train_tokens_per_second": 885.323 }, { "epoch": 1.7824109173616376, "grad_norm": 0.3496468663215637, "learning_rate": 2.1974683544303797e-05, "loss": 0.0712, "num_input_tokens_seen": 3293984, "step": 1764, "train_runtime": 3720.4005, "train_tokens_per_second": 885.384 }, { "epoch": 1.7834217841799342, "grad_norm": 0.46741724014282227, "learning_rate": 2.1873417721518988e-05, "loss": 0.0604, "num_input_tokens_seen": 3296392, "step": 1765, "train_runtime": 3722.4133, "train_tokens_per_second": 885.552 }, { "epoch": 1.7844326509982311, "grad_norm": 0.33283084630966187, "learning_rate": 2.177215189873418e-05, "loss": 0.0525, "num_input_tokens_seen": 3298364, "step": 1766, "train_runtime": 3724.1851, "train_tokens_per_second": 885.661 }, { "epoch": 1.7854435178165278, "grad_norm": 0.3500096797943115, "learning_rate": 2.1670886075949366e-05, "loss": 0.0521, "num_input_tokens_seen": 3299992, "step": 1767, "train_runtime": 3725.8865, "train_tokens_per_second": 885.693 }, { "epoch": 1.7864543846348244, "grad_norm": 0.23019525408744812, "learning_rate": 2.1569620253164557e-05, "loss": 0.1603, "num_input_tokens_seen": 3301884, "step": 1768, "train_runtime": 3727.6217, "train_tokens_per_second": 885.788 }, { "epoch": 1.787465251453121, "grad_norm": 0.42400750517845154, "learning_rate": 2.1468354430379748e-05, "loss": 0.0456, "num_input_tokens_seen": 3303846, "step": 1769, "train_runtime": 3729.4567, "train_tokens_per_second": 885.879 }, { "epoch": 1.7884761182714177, "grad_norm": 0.3044002950191498, "learning_rate": 2.136708860759494e-05, "loss": 0.1083, "num_input_tokens_seen": 3305626, "step": 1770, "train_runtime": 3731.1867, "train_tokens_per_second": 885.945 }, { "epoch": 1.7894869850897144, "grad_norm": 0.30707088112831116, "learning_rate": 2.1265822784810126e-05, "loss": 0.0409, "num_input_tokens_seen": 3307618, "step": 1771, "train_runtime": 3734.7376, "train_tokens_per_second": 885.636 }, { "epoch": 1.790497851908011, "grad_norm": 0.32700610160827637, "learning_rate": 2.1164556962025317e-05, "loss": 0.0749, "num_input_tokens_seen": 3309164, "step": 1772, "train_runtime": 3736.3737, "train_tokens_per_second": 885.662 }, { "epoch": 1.7915087187263077, "grad_norm": 0.27235326170921326, "learning_rate": 2.1063291139240508e-05, "loss": 0.0986, "num_input_tokens_seen": 3311314, "step": 1773, "train_runtime": 3738.2442, "train_tokens_per_second": 885.794 }, { "epoch": 1.7925195855446043, "grad_norm": 0.2995695471763611, "learning_rate": 2.0962025316455695e-05, "loss": 0.0565, "num_input_tokens_seen": 3312934, "step": 1774, "train_runtime": 3739.8736, "train_tokens_per_second": 885.841 }, { "epoch": 1.7935304523629012, "grad_norm": 0.5493440628051758, "learning_rate": 2.0860759493670886e-05, "loss": 0.0548, "num_input_tokens_seen": 3314462, "step": 1775, "train_runtime": 3741.4919, "train_tokens_per_second": 885.866 }, { "epoch": 1.7945413191811979, "grad_norm": 0.31136009097099304, "learning_rate": 2.0759493670886077e-05, "loss": 0.0986, "num_input_tokens_seen": 3316446, "step": 1776, "train_runtime": 3743.3178, "train_tokens_per_second": 885.964 }, { "epoch": 1.7955521859994947, "grad_norm": 0.3378680348396301, "learning_rate": 2.0658227848101268e-05, "loss": 0.0402, "num_input_tokens_seen": 3319010, "step": 1777, "train_runtime": 3745.3702, "train_tokens_per_second": 886.163 }, { "epoch": 1.7965630528177914, "grad_norm": 0.37042444944381714, "learning_rate": 2.0556962025316455e-05, "loss": 0.191, "num_input_tokens_seen": 3320802, "step": 1778, "train_runtime": 3747.0782, "train_tokens_per_second": 886.238 }, { "epoch": 1.797573919636088, "grad_norm": 0.38629478216171265, "learning_rate": 2.0455696202531646e-05, "loss": 0.0713, "num_input_tokens_seen": 3322928, "step": 1779, "train_runtime": 3748.9524, "train_tokens_per_second": 886.362 }, { "epoch": 1.7985847864543847, "grad_norm": 0.40462711453437805, "learning_rate": 2.0354430379746837e-05, "loss": 0.0559, "num_input_tokens_seen": 3324696, "step": 1780, "train_runtime": 3750.6599, "train_tokens_per_second": 886.43 }, { "epoch": 1.7995956532726813, "grad_norm": 0.302253782749176, "learning_rate": 2.0253164556962025e-05, "loss": 0.0445, "num_input_tokens_seen": 3327390, "step": 1781, "train_runtime": 3752.8492, "train_tokens_per_second": 886.63 }, { "epoch": 1.800606520090978, "grad_norm": 0.29382818937301636, "learning_rate": 2.0151898734177215e-05, "loss": 0.1435, "num_input_tokens_seen": 3329486, "step": 1782, "train_runtime": 3754.7199, "train_tokens_per_second": 886.747 }, { "epoch": 1.800606520090978, "eval_loss": 0.20694167912006378, "eval_runtime": 61.4529, "eval_samples_per_second": 14.304, "eval_steps_per_second": 7.16, "num_input_tokens_seen": 3329486, "step": 1782 }, { "epoch": 1.8016173869092746, "grad_norm": 0.3214450478553772, "learning_rate": 2.0050632911392406e-05, "loss": 0.046, "num_input_tokens_seen": 3331678, "step": 1783, "train_runtime": 3818.12, "train_tokens_per_second": 872.596 }, { "epoch": 1.8026282537275713, "grad_norm": 0.3057961165904999, "learning_rate": 1.9949367088607597e-05, "loss": 0.0407, "num_input_tokens_seen": 3333514, "step": 1784, "train_runtime": 3819.8521, "train_tokens_per_second": 872.681 }, { "epoch": 1.803639120545868, "grad_norm": 0.47353193163871765, "learning_rate": 1.9848101265822785e-05, "loss": 0.0548, "num_input_tokens_seen": 3334950, "step": 1785, "train_runtime": 3821.4494, "train_tokens_per_second": 872.692 }, { "epoch": 1.8046499873641648, "grad_norm": 0.16872140765190125, "learning_rate": 1.9746835443037975e-05, "loss": 0.0205, "num_input_tokens_seen": 3337092, "step": 1786, "train_runtime": 3823.3552, "train_tokens_per_second": 872.818 }, { "epoch": 1.8056608541824615, "grad_norm": 0.4897010624408722, "learning_rate": 1.9645569620253166e-05, "loss": 0.0493, "num_input_tokens_seen": 3338772, "step": 1787, "train_runtime": 3825.0592, "train_tokens_per_second": 872.868 }, { "epoch": 1.8066717210007581, "grad_norm": 0.38819557428359985, "learning_rate": 1.9544303797468354e-05, "loss": 0.0433, "num_input_tokens_seen": 3340352, "step": 1788, "train_runtime": 3826.7388, "train_tokens_per_second": 872.898 }, { "epoch": 1.807682587819055, "grad_norm": 0.3572562038898468, "learning_rate": 1.9443037974683544e-05, "loss": 0.0382, "num_input_tokens_seen": 3341712, "step": 1789, "train_runtime": 3828.3062, "train_tokens_per_second": 872.896 }, { "epoch": 1.8086934546373516, "grad_norm": 0.2987414300441742, "learning_rate": 1.9341772151898735e-05, "loss": 0.0293, "num_input_tokens_seen": 3343778, "step": 1790, "train_runtime": 3830.2175, "train_tokens_per_second": 872.999 }, { "epoch": 1.8097043214556483, "grad_norm": 0.41519400477409363, "learning_rate": 1.9240506329113926e-05, "loss": 0.069, "num_input_tokens_seen": 3345650, "step": 1791, "train_runtime": 3831.9996, "train_tokens_per_second": 873.082 }, { "epoch": 1.810715188273945, "grad_norm": 0.4155493378639221, "learning_rate": 1.9139240506329114e-05, "loss": 0.0594, "num_input_tokens_seen": 3347852, "step": 1792, "train_runtime": 3833.8915, "train_tokens_per_second": 873.226 }, { "epoch": 1.8117260550922416, "grad_norm": 0.3513873517513275, "learning_rate": 1.9037974683544304e-05, "loss": 0.1218, "num_input_tokens_seen": 3349184, "step": 1793, "train_runtime": 3835.4717, "train_tokens_per_second": 873.213 }, { "epoch": 1.8127369219105383, "grad_norm": 0.3495260179042816, "learning_rate": 1.8936708860759495e-05, "loss": 0.0555, "num_input_tokens_seen": 3350614, "step": 1794, "train_runtime": 3837.0898, "train_tokens_per_second": 873.218 }, { "epoch": 1.813747788728835, "grad_norm": 0.20336616039276123, "learning_rate": 1.8835443037974683e-05, "loss": 0.0497, "num_input_tokens_seen": 3353054, "step": 1795, "train_runtime": 3839.1117, "train_tokens_per_second": 873.393 }, { "epoch": 1.8147586555471316, "grad_norm": 0.3769696056842804, "learning_rate": 1.8734177215189874e-05, "loss": 0.0932, "num_input_tokens_seen": 3354852, "step": 1796, "train_runtime": 3840.8695, "train_tokens_per_second": 873.462 }, { "epoch": 1.8157695223654282, "grad_norm": 0.21609970927238464, "learning_rate": 1.8632911392405064e-05, "loss": 0.0657, "num_input_tokens_seen": 3357008, "step": 1797, "train_runtime": 3842.7192, "train_tokens_per_second": 873.602 }, { "epoch": 1.816780389183725, "grad_norm": 0.37451791763305664, "learning_rate": 1.8531645569620255e-05, "loss": 0.0478, "num_input_tokens_seen": 3358872, "step": 1798, "train_runtime": 3844.546, "train_tokens_per_second": 873.672 }, { "epoch": 1.8177912560020217, "grad_norm": 0.3367696702480316, "learning_rate": 1.8430379746835443e-05, "loss": 0.1427, "num_input_tokens_seen": 3360660, "step": 1799, "train_runtime": 3846.252, "train_tokens_per_second": 873.749 }, { "epoch": 1.8188021228203184, "grad_norm": 0.2870897948741913, "learning_rate": 1.8329113924050634e-05, "loss": 0.0223, "num_input_tokens_seen": 3362738, "step": 1800, "train_runtime": 3848.1006, "train_tokens_per_second": 873.87 }, { "epoch": 1.8198129896386153, "grad_norm": 0.3743988573551178, "learning_rate": 1.8227848101265824e-05, "loss": 0.0339, "num_input_tokens_seen": 3364764, "step": 1801, "train_runtime": 3851.9506, "train_tokens_per_second": 873.522 }, { "epoch": 1.820823856456912, "grad_norm": 0.22562061250209808, "learning_rate": 1.8126582278481012e-05, "loss": 0.0584, "num_input_tokens_seen": 3366966, "step": 1802, "train_runtime": 3853.901, "train_tokens_per_second": 873.651 }, { "epoch": 1.8218347232752086, "grad_norm": 0.3605365455150604, "learning_rate": 1.8025316455696203e-05, "loss": 0.0829, "num_input_tokens_seen": 3368778, "step": 1803, "train_runtime": 3855.622, "train_tokens_per_second": 873.731 }, { "epoch": 1.8228455900935052, "grad_norm": 0.43901732563972473, "learning_rate": 1.7924050632911394e-05, "loss": 0.1063, "num_input_tokens_seen": 3370368, "step": 1804, "train_runtime": 3857.2, "train_tokens_per_second": 873.786 }, { "epoch": 1.8238564569118019, "grad_norm": 0.35778892040252686, "learning_rate": 1.7822784810126584e-05, "loss": 0.113, "num_input_tokens_seen": 3371894, "step": 1805, "train_runtime": 3858.8239, "train_tokens_per_second": 873.814 }, { "epoch": 1.8248673237300985, "grad_norm": 0.3990665674209595, "learning_rate": 1.7721518987341772e-05, "loss": 0.0982, "num_input_tokens_seen": 3373826, "step": 1806, "train_runtime": 3860.6086, "train_tokens_per_second": 873.91 }, { "epoch": 1.8258781905483952, "grad_norm": 0.44509217143058777, "learning_rate": 1.7620253164556963e-05, "loss": 0.0537, "num_input_tokens_seen": 3375664, "step": 1807, "train_runtime": 3862.3432, "train_tokens_per_second": 873.994 }, { "epoch": 1.8268890573666918, "grad_norm": 0.3205857574939728, "learning_rate": 1.7518987341772154e-05, "loss": 0.0567, "num_input_tokens_seen": 3377254, "step": 1808, "train_runtime": 3863.9629, "train_tokens_per_second": 874.039 }, { "epoch": 1.8278999241849885, "grad_norm": 0.2987648844718933, "learning_rate": 1.7417721518987344e-05, "loss": 0.0287, "num_input_tokens_seen": 3379152, "step": 1809, "train_runtime": 3865.6868, "train_tokens_per_second": 874.14 }, { "epoch": 1.8289107910032854, "grad_norm": 0.35453036427497864, "learning_rate": 1.7316455696202532e-05, "loss": 0.0238, "num_input_tokens_seen": 3380618, "step": 1810, "train_runtime": 3867.2852, "train_tokens_per_second": 874.158 }, { "epoch": 1.829921657821582, "grad_norm": 0.2638246417045593, "learning_rate": 1.7215189873417723e-05, "loss": 0.0755, "num_input_tokens_seen": 3382000, "step": 1811, "train_runtime": 3868.875, "train_tokens_per_second": 874.156 }, { "epoch": 1.8309325246398787, "grad_norm": 0.28177931904792786, "learning_rate": 1.7113924050632914e-05, "loss": 0.0293, "num_input_tokens_seen": 3383976, "step": 1812, "train_runtime": 3870.602, "train_tokens_per_second": 874.276 }, { "epoch": 1.8319433914581755, "grad_norm": 0.3644472658634186, "learning_rate": 1.70126582278481e-05, "loss": 0.1228, "num_input_tokens_seen": 3385922, "step": 1813, "train_runtime": 3872.3279, "train_tokens_per_second": 874.389 }, { "epoch": 1.8329542582764722, "grad_norm": 0.33471110463142395, "learning_rate": 1.6911392405063292e-05, "loss": 0.1181, "num_input_tokens_seen": 3387892, "step": 1814, "train_runtime": 3874.1621, "train_tokens_per_second": 874.484 }, { "epoch": 1.8339651250947688, "grad_norm": 0.347408264875412, "learning_rate": 1.6810126582278483e-05, "loss": 0.0354, "num_input_tokens_seen": 3389992, "step": 1815, "train_runtime": 3875.9632, "train_tokens_per_second": 874.619 }, { "epoch": 1.8349759919130655, "grad_norm": 0.4522991180419922, "learning_rate": 1.6708860759493674e-05, "loss": 0.1691, "num_input_tokens_seen": 3392154, "step": 1816, "train_runtime": 3877.7827, "train_tokens_per_second": 874.766 }, { "epoch": 1.8359868587313621, "grad_norm": 0.3917560279369354, "learning_rate": 1.660759493670886e-05, "loss": 0.0793, "num_input_tokens_seen": 3393572, "step": 1817, "train_runtime": 3879.4085, "train_tokens_per_second": 874.765 }, { "epoch": 1.8369977255496588, "grad_norm": 0.36581575870513916, "learning_rate": 1.6506329113924052e-05, "loss": 0.0852, "num_input_tokens_seen": 3395228, "step": 1818, "train_runtime": 3881.0571, "train_tokens_per_second": 874.82 }, { "epoch": 1.8380085923679554, "grad_norm": 0.3207392394542694, "learning_rate": 1.6405063291139243e-05, "loss": 0.066, "num_input_tokens_seen": 3396648, "step": 1819, "train_runtime": 3882.6866, "train_tokens_per_second": 874.819 }, { "epoch": 1.839019459186252, "grad_norm": 0.4688638746738434, "learning_rate": 1.630379746835443e-05, "loss": 0.1553, "num_input_tokens_seen": 3398164, "step": 1820, "train_runtime": 3884.2839, "train_tokens_per_second": 874.85 }, { "epoch": 1.8400303260045487, "grad_norm": 0.32755982875823975, "learning_rate": 1.620253164556962e-05, "loss": 0.0862, "num_input_tokens_seen": 3399916, "step": 1821, "train_runtime": 3885.9857, "train_tokens_per_second": 874.917 }, { "epoch": 1.8410411928228456, "grad_norm": 0.4200737476348877, "learning_rate": 1.6101265822784812e-05, "loss": 0.0665, "num_input_tokens_seen": 3401452, "step": 1822, "train_runtime": 3887.6163, "train_tokens_per_second": 874.945 }, { "epoch": 1.8420520596411423, "grad_norm": 0.3440350592136383, "learning_rate": 1.6000000000000003e-05, "loss": 0.0328, "num_input_tokens_seen": 3403272, "step": 1823, "train_runtime": 3889.3348, "train_tokens_per_second": 875.027 }, { "epoch": 1.843062926459439, "grad_norm": 0.30478882789611816, "learning_rate": 1.589873417721519e-05, "loss": 0.0214, "num_input_tokens_seen": 3404636, "step": 1824, "train_runtime": 3890.8991, "train_tokens_per_second": 875.026 }, { "epoch": 1.8440737932777358, "grad_norm": 0.46187645196914673, "learning_rate": 1.579746835443038e-05, "loss": 0.0318, "num_input_tokens_seen": 3406056, "step": 1825, "train_runtime": 3892.4702, "train_tokens_per_second": 875.037 }, { "epoch": 1.8450846600960324, "grad_norm": 0.35042065382003784, "learning_rate": 1.5696202531645572e-05, "loss": 0.1106, "num_input_tokens_seen": 3407952, "step": 1826, "train_runtime": 3894.2944, "train_tokens_per_second": 875.114 }, { "epoch": 1.846095526914329, "grad_norm": 0.3137063980102539, "learning_rate": 1.559493670886076e-05, "loss": 0.0514, "num_input_tokens_seen": 3409784, "step": 1827, "train_runtime": 3896.117, "train_tokens_per_second": 875.175 }, { "epoch": 1.8471063937326258, "grad_norm": 0.40788382291793823, "learning_rate": 1.549367088607595e-05, "loss": 0.0454, "num_input_tokens_seen": 3411602, "step": 1828, "train_runtime": 3897.8444, "train_tokens_per_second": 875.254 }, { "epoch": 1.8481172605509224, "grad_norm": 0.17767295241355896, "learning_rate": 1.539240506329114e-05, "loss": 0.0308, "num_input_tokens_seen": 3413314, "step": 1829, "train_runtime": 3899.4894, "train_tokens_per_second": 875.323 }, { "epoch": 1.849128127369219, "grad_norm": 0.4391786754131317, "learning_rate": 1.5291139240506332e-05, "loss": 0.088, "num_input_tokens_seen": 3415466, "step": 1830, "train_runtime": 3901.4023, "train_tokens_per_second": 875.446 }, { "epoch": 1.8501389941875157, "grad_norm": 0.35986626148223877, "learning_rate": 1.5189873417721521e-05, "loss": 0.0578, "num_input_tokens_seen": 3417180, "step": 1831, "train_runtime": 3904.9063, "train_tokens_per_second": 875.099 }, { "epoch": 1.8511498610058124, "grad_norm": 0.3671015799045563, "learning_rate": 1.508860759493671e-05, "loss": 0.0485, "num_input_tokens_seen": 3418982, "step": 1832, "train_runtime": 3906.6302, "train_tokens_per_second": 875.174 }, { "epoch": 1.852160727824109, "grad_norm": 0.6754432916641235, "learning_rate": 1.49873417721519e-05, "loss": 0.0383, "num_input_tokens_seen": 3420756, "step": 1833, "train_runtime": 3908.3341, "train_tokens_per_second": 875.247 }, { "epoch": 1.8531715946424059, "grad_norm": 0.2855415642261505, "learning_rate": 1.488607594936709e-05, "loss": 0.07, "num_input_tokens_seen": 3422560, "step": 1834, "train_runtime": 3910.0398, "train_tokens_per_second": 875.326 }, { "epoch": 1.8541824614607025, "grad_norm": 0.41475895047187805, "learning_rate": 1.478481012658228e-05, "loss": 0.0623, "num_input_tokens_seen": 3424078, "step": 1835, "train_runtime": 3911.6975, "train_tokens_per_second": 875.343 }, { "epoch": 1.8551933282789992, "grad_norm": 0.20816388726234436, "learning_rate": 1.468354430379747e-05, "loss": 0.0667, "num_input_tokens_seen": 3426512, "step": 1836, "train_runtime": 3913.7126, "train_tokens_per_second": 875.514 }, { "epoch": 1.856204195097296, "grad_norm": 0.46875783801078796, "learning_rate": 1.458227848101266e-05, "loss": 0.0446, "num_input_tokens_seen": 3428360, "step": 1837, "train_runtime": 3915.4882, "train_tokens_per_second": 875.589 }, { "epoch": 1.8572150619155927, "grad_norm": 0.3428696393966675, "learning_rate": 1.448101265822785e-05, "loss": 0.0689, "num_input_tokens_seen": 3430342, "step": 1838, "train_runtime": 3917.2267, "train_tokens_per_second": 875.707 }, { "epoch": 1.8582259287338894, "grad_norm": 0.2921421229839325, "learning_rate": 1.437974683544304e-05, "loss": 0.0396, "num_input_tokens_seen": 3431844, "step": 1839, "train_runtime": 3918.8142, "train_tokens_per_second": 875.735 }, { "epoch": 1.859236795552186, "grad_norm": 0.41684088110923767, "learning_rate": 1.4278481012658228e-05, "loss": 0.0785, "num_input_tokens_seen": 3433804, "step": 1840, "train_runtime": 3920.5941, "train_tokens_per_second": 875.838 }, { "epoch": 1.8602476623704827, "grad_norm": 0.3576996624469757, "learning_rate": 1.417721518987342e-05, "loss": 0.072, "num_input_tokens_seen": 3435836, "step": 1841, "train_runtime": 3922.3962, "train_tokens_per_second": 875.953 }, { "epoch": 1.8612585291887793, "grad_norm": 0.3274343013763428, "learning_rate": 1.4075949367088608e-05, "loss": 0.073, "num_input_tokens_seen": 3437454, "step": 1842, "train_runtime": 3924.0883, "train_tokens_per_second": 875.988 }, { "epoch": 1.862269396007076, "grad_norm": 0.40019598603248596, "learning_rate": 1.39746835443038e-05, "loss": 0.1571, "num_input_tokens_seen": 3439068, "step": 1843, "train_runtime": 3925.7205, "train_tokens_per_second": 876.035 }, { "epoch": 1.8632802628253726, "grad_norm": 0.45412638783454895, "learning_rate": 1.3873417721518988e-05, "loss": 0.1255, "num_input_tokens_seen": 3440584, "step": 1844, "train_runtime": 3927.3415, "train_tokens_per_second": 876.059 }, { "epoch": 1.8642911296436695, "grad_norm": 0.3301598131656647, "learning_rate": 1.377215189873418e-05, "loss": 0.1778, "num_input_tokens_seen": 3442392, "step": 1845, "train_runtime": 3929.0573, "train_tokens_per_second": 876.137 }, { "epoch": 1.8653019964619661, "grad_norm": 0.5462703108787537, "learning_rate": 1.3670886075949368e-05, "loss": 0.0503, "num_input_tokens_seen": 3444012, "step": 1846, "train_runtime": 3930.6795, "train_tokens_per_second": 876.187 }, { "epoch": 1.8663128632802628, "grad_norm": 0.37690606713294983, "learning_rate": 1.3569620253164557e-05, "loss": 0.0401, "num_input_tokens_seen": 3445536, "step": 1847, "train_runtime": 3932.3011, "train_tokens_per_second": 876.214 }, { "epoch": 1.8673237300985597, "grad_norm": 0.257944792509079, "learning_rate": 1.3468354430379748e-05, "loss": 0.0307, "num_input_tokens_seen": 3447234, "step": 1848, "train_runtime": 3933.9451, "train_tokens_per_second": 876.279 }, { "epoch": 1.8683345969168563, "grad_norm": 0.31285640597343445, "learning_rate": 1.3367088607594937e-05, "loss": 0.0523, "num_input_tokens_seen": 3449022, "step": 1849, "train_runtime": 3935.6335, "train_tokens_per_second": 876.358 }, { "epoch": 1.869345463735153, "grad_norm": 0.32242077589035034, "learning_rate": 1.3265822784810128e-05, "loss": 0.1425, "num_input_tokens_seen": 3450846, "step": 1850, "train_runtime": 3937.3614, "train_tokens_per_second": 876.436 }, { "epoch": 1.8703563305534496, "grad_norm": 0.281527578830719, "learning_rate": 1.3164556962025317e-05, "loss": 0.0651, "num_input_tokens_seen": 3452606, "step": 1851, "train_runtime": 3939.0014, "train_tokens_per_second": 876.518 }, { "epoch": 1.8713671973717463, "grad_norm": 0.22572745382785797, "learning_rate": 1.3063291139240508e-05, "loss": 0.0144, "num_input_tokens_seen": 3454210, "step": 1852, "train_runtime": 3940.6835, "train_tokens_per_second": 876.551 }, { "epoch": 1.872378064190043, "grad_norm": 0.32201293110847473, "learning_rate": 1.2962025316455697e-05, "loss": 0.0941, "num_input_tokens_seen": 3455988, "step": 1853, "train_runtime": 3942.4027, "train_tokens_per_second": 876.62 }, { "epoch": 1.8733889310083396, "grad_norm": 0.4775518476963043, "learning_rate": 1.2860759493670888e-05, "loss": 0.0417, "num_input_tokens_seen": 3457496, "step": 1854, "train_runtime": 3943.9925, "train_tokens_per_second": 876.649 }, { "epoch": 1.8743997978266362, "grad_norm": 0.21644511818885803, "learning_rate": 1.2759493670886077e-05, "loss": 0.0687, "num_input_tokens_seen": 3459732, "step": 1855, "train_runtime": 3945.9906, "train_tokens_per_second": 876.771 }, { "epoch": 1.875410664644933, "grad_norm": 0.29097041487693787, "learning_rate": 1.2658227848101267e-05, "loss": 0.0206, "num_input_tokens_seen": 3461420, "step": 1856, "train_runtime": 3947.691, "train_tokens_per_second": 876.821 }, { "epoch": 1.8764215314632298, "grad_norm": 0.2558102309703827, "learning_rate": 1.2556962025316457e-05, "loss": 0.123, "num_input_tokens_seen": 3463444, "step": 1857, "train_runtime": 3949.5483, "train_tokens_per_second": 876.922 }, { "epoch": 1.8774323982815264, "grad_norm": 0.3625556230545044, "learning_rate": 1.2455696202531645e-05, "loss": 0.059, "num_input_tokens_seen": 3465548, "step": 1858, "train_runtime": 3951.4562, "train_tokens_per_second": 877.031 }, { "epoch": 1.878443265099823, "grad_norm": 0.28841790556907654, "learning_rate": 1.2354430379746836e-05, "loss": 0.0564, "num_input_tokens_seen": 3467678, "step": 1859, "train_runtime": 3953.3142, "train_tokens_per_second": 877.157 }, { "epoch": 1.87945413191812, "grad_norm": 0.34299448132514954, "learning_rate": 1.2253164556962025e-05, "loss": 0.0818, "num_input_tokens_seen": 3469522, "step": 1860, "train_runtime": 3955.088, "train_tokens_per_second": 877.23 }, { "epoch": 1.8804649987364166, "grad_norm": 0.3639189898967743, "learning_rate": 1.2151898734177216e-05, "loss": 0.0583, "num_input_tokens_seen": 3471412, "step": 1861, "train_runtime": 3958.8851, "train_tokens_per_second": 876.866 }, { "epoch": 1.8814758655547132, "grad_norm": 0.45584601163864136, "learning_rate": 1.2050632911392405e-05, "loss": 0.0928, "num_input_tokens_seen": 3473686, "step": 1862, "train_runtime": 3960.8914, "train_tokens_per_second": 876.996 }, { "epoch": 1.88248673237301, "grad_norm": 0.28255757689476013, "learning_rate": 1.1949367088607596e-05, "loss": 0.1055, "num_input_tokens_seen": 3475678, "step": 1863, "train_runtime": 3962.6863, "train_tokens_per_second": 877.101 }, { "epoch": 1.8834975991913065, "grad_norm": 0.39519962668418884, "learning_rate": 1.1848101265822785e-05, "loss": 0.0951, "num_input_tokens_seen": 3477542, "step": 1864, "train_runtime": 3964.341, "train_tokens_per_second": 877.206 }, { "epoch": 1.8845084660096032, "grad_norm": 0.18378497660160065, "learning_rate": 1.1746835443037974e-05, "loss": 0.014, "num_input_tokens_seen": 3479142, "step": 1865, "train_runtime": 3966.0296, "train_tokens_per_second": 877.236 }, { "epoch": 1.8855193328278999, "grad_norm": 0.21587584912776947, "learning_rate": 1.1645569620253165e-05, "loss": 0.1544, "num_input_tokens_seen": 3481038, "step": 1866, "train_runtime": 3967.7558, "train_tokens_per_second": 877.332 }, { "epoch": 1.8865301996461965, "grad_norm": 0.41051149368286133, "learning_rate": 1.1544303797468354e-05, "loss": 0.0752, "num_input_tokens_seen": 3482548, "step": 1867, "train_runtime": 3969.3621, "train_tokens_per_second": 877.357 }, { "epoch": 1.8875410664644932, "grad_norm": 0.34189385175704956, "learning_rate": 1.1443037974683545e-05, "loss": 0.1331, "num_input_tokens_seen": 3484614, "step": 1868, "train_runtime": 3971.1844, "train_tokens_per_second": 877.475 }, { "epoch": 1.88855193328279, "grad_norm": 0.2599343955516815, "learning_rate": 1.1341772151898734e-05, "loss": 0.0678, "num_input_tokens_seen": 3486578, "step": 1869, "train_runtime": 3972.9682, "train_tokens_per_second": 877.575 }, { "epoch": 1.8895628001010867, "grad_norm": 0.3474741280078888, "learning_rate": 1.1240506329113925e-05, "loss": 0.0243, "num_input_tokens_seen": 3488246, "step": 1870, "train_runtime": 3974.5922, "train_tokens_per_second": 877.636 }, { "epoch": 1.8905736669193833, "grad_norm": 0.354998379945755, "learning_rate": 1.1139240506329114e-05, "loss": 0.05, "num_input_tokens_seen": 3490076, "step": 1871, "train_runtime": 3976.316, "train_tokens_per_second": 877.716 }, { "epoch": 1.8915845337376802, "grad_norm": 0.3715677261352539, "learning_rate": 1.1037974683544305e-05, "loss": 0.052, "num_input_tokens_seen": 3492288, "step": 1872, "train_runtime": 3978.2722, "train_tokens_per_second": 877.84 }, { "epoch": 1.8925954005559769, "grad_norm": 0.3217340409755707, "learning_rate": 1.0936708860759494e-05, "loss": 0.0388, "num_input_tokens_seen": 3494018, "step": 1873, "train_runtime": 3979.9176, "train_tokens_per_second": 877.912 }, { "epoch": 1.8936062673742735, "grad_norm": 0.2525309920310974, "learning_rate": 1.0835443037974683e-05, "loss": 0.0584, "num_input_tokens_seen": 3495862, "step": 1874, "train_runtime": 3981.7067, "train_tokens_per_second": 877.981 }, { "epoch": 1.8946171341925702, "grad_norm": 0.2678094804286957, "learning_rate": 1.0734177215189874e-05, "loss": 0.1625, "num_input_tokens_seen": 3497378, "step": 1875, "train_runtime": 3983.3387, "train_tokens_per_second": 878.002 }, { "epoch": 1.8956280010108668, "grad_norm": 0.38275614380836487, "learning_rate": 1.0632911392405063e-05, "loss": 0.0356, "num_input_tokens_seen": 3498964, "step": 1876, "train_runtime": 3985.0118, "train_tokens_per_second": 878.031 }, { "epoch": 1.8966388678291635, "grad_norm": 0.2158384770154953, "learning_rate": 1.0531645569620254e-05, "loss": 0.0943, "num_input_tokens_seen": 3500910, "step": 1877, "train_runtime": 3986.8023, "train_tokens_per_second": 878.125 }, { "epoch": 1.8976497346474601, "grad_norm": 0.5794618725776672, "learning_rate": 1.0430379746835443e-05, "loss": 0.066, "num_input_tokens_seen": 3502370, "step": 1878, "train_runtime": 3988.4101, "train_tokens_per_second": 878.137 }, { "epoch": 1.8986606014657568, "grad_norm": 0.31127601861953735, "learning_rate": 1.0329113924050634e-05, "loss": 0.0508, "num_input_tokens_seen": 3504322, "step": 1879, "train_runtime": 3990.1957, "train_tokens_per_second": 878.233 }, { "epoch": 1.8996714682840534, "grad_norm": 0.3494141101837158, "learning_rate": 1.0227848101265823e-05, "loss": 0.0555, "num_input_tokens_seen": 3506208, "step": 1880, "train_runtime": 3991.9845, "train_tokens_per_second": 878.312 }, { "epoch": 1.9006823351023503, "grad_norm": 0.22893235087394714, "learning_rate": 1.0126582278481012e-05, "loss": 0.0702, "num_input_tokens_seen": 3508008, "step": 1881, "train_runtime": 3993.6982, "train_tokens_per_second": 878.386 }, { "epoch": 1.901693201920647, "grad_norm": 0.37710627913475037, "learning_rate": 1.0025316455696203e-05, "loss": 0.0735, "num_input_tokens_seen": 3510068, "step": 1882, "train_runtime": 3995.5624, "train_tokens_per_second": 878.492 }, { "epoch": 1.9027040687389436, "grad_norm": 0.30796605348587036, "learning_rate": 9.924050632911392e-06, "loss": 0.0956, "num_input_tokens_seen": 3512120, "step": 1883, "train_runtime": 3997.3825, "train_tokens_per_second": 878.605 }, { "epoch": 1.9037149355572405, "grad_norm": 0.19698543846607208, "learning_rate": 9.822784810126583e-06, "loss": 0.0373, "num_input_tokens_seen": 3513688, "step": 1884, "train_runtime": 3999.0201, "train_tokens_per_second": 878.637 }, { "epoch": 1.9047258023755371, "grad_norm": 0.3822472095489502, "learning_rate": 9.721518987341772e-06, "loss": 0.106, "num_input_tokens_seen": 3515550, "step": 1885, "train_runtime": 4000.8138, "train_tokens_per_second": 878.709 }, { "epoch": 1.9057366691938338, "grad_norm": 0.362237811088562, "learning_rate": 9.620253164556963e-06, "loss": 0.1226, "num_input_tokens_seen": 3517484, "step": 1886, "train_runtime": 4002.6698, "train_tokens_per_second": 878.784 }, { "epoch": 1.9067475360121304, "grad_norm": 0.4247080981731415, "learning_rate": 9.518987341772152e-06, "loss": 0.1002, "num_input_tokens_seen": 3519024, "step": 1887, "train_runtime": 4004.3403, "train_tokens_per_second": 878.802 }, { "epoch": 1.907758402830427, "grad_norm": 0.33333954215049744, "learning_rate": 9.417721518987341e-06, "loss": 0.1222, "num_input_tokens_seen": 3520706, "step": 1888, "train_runtime": 4005.9704, "train_tokens_per_second": 878.865 }, { "epoch": 1.9087692696487237, "grad_norm": 0.4789365530014038, "learning_rate": 9.316455696202532e-06, "loss": 0.1789, "num_input_tokens_seen": 3522746, "step": 1889, "train_runtime": 4007.8431, "train_tokens_per_second": 878.963 }, { "epoch": 1.9097801364670204, "grad_norm": 0.34310978651046753, "learning_rate": 9.215189873417721e-06, "loss": 0.0462, "num_input_tokens_seen": 3524824, "step": 1890, "train_runtime": 4009.7533, "train_tokens_per_second": 879.063 }, { "epoch": 1.910791003285317, "grad_norm": 0.31715911626815796, "learning_rate": 9.113924050632912e-06, "loss": 0.0603, "num_input_tokens_seen": 3526718, "step": 1891, "train_runtime": 4013.5824, "train_tokens_per_second": 878.696 }, { "epoch": 1.9118018701036137, "grad_norm": 0.3918403685092926, "learning_rate": 9.012658227848101e-06, "loss": 0.0488, "num_input_tokens_seen": 3528542, "step": 1892, "train_runtime": 4015.368, "train_tokens_per_second": 878.759 }, { "epoch": 1.9128127369219106, "grad_norm": 0.4037635624408722, "learning_rate": 8.911392405063292e-06, "loss": 0.0704, "num_input_tokens_seen": 3530010, "step": 1893, "train_runtime": 4016.9815, "train_tokens_per_second": 878.772 }, { "epoch": 1.9138236037402072, "grad_norm": 0.25474458932876587, "learning_rate": 8.810126582278481e-06, "loss": 0.0843, "num_input_tokens_seen": 3531598, "step": 1894, "train_runtime": 4018.6069, "train_tokens_per_second": 878.812 }, { "epoch": 1.9148344705585039, "grad_norm": 0.28693681955337524, "learning_rate": 8.708860759493672e-06, "loss": 0.0828, "num_input_tokens_seen": 3533364, "step": 1895, "train_runtime": 4020.3776, "train_tokens_per_second": 878.864 }, { "epoch": 1.9158453373768007, "grad_norm": 0.35959458351135254, "learning_rate": 8.607594936708861e-06, "loss": 0.0628, "num_input_tokens_seen": 3535146, "step": 1896, "train_runtime": 4022.0371, "train_tokens_per_second": 878.944 }, { "epoch": 1.9168562041950974, "grad_norm": 0.44091129302978516, "learning_rate": 8.50632911392405e-06, "loss": 0.1202, "num_input_tokens_seen": 3537024, "step": 1897, "train_runtime": 4023.8337, "train_tokens_per_second": 879.018 }, { "epoch": 1.917867071013394, "grad_norm": 0.4475288391113281, "learning_rate": 8.405063291139241e-06, "loss": 0.0818, "num_input_tokens_seen": 3538894, "step": 1898, "train_runtime": 4025.6565, "train_tokens_per_second": 879.085 }, { "epoch": 1.9188779378316907, "grad_norm": 0.36203065514564514, "learning_rate": 8.30379746835443e-06, "loss": 0.0476, "num_input_tokens_seen": 3541112, "step": 1899, "train_runtime": 4027.5907, "train_tokens_per_second": 879.213 }, { "epoch": 1.9198888046499873, "grad_norm": 0.27448907494544983, "learning_rate": 8.202531645569621e-06, "loss": 0.0956, "num_input_tokens_seen": 3543566, "step": 1900, "train_runtime": 4029.6121, "train_tokens_per_second": 879.381 }, { "epoch": 1.920899671468284, "grad_norm": 0.26250508427619934, "learning_rate": 8.10126582278481e-06, "loss": 0.0818, "num_input_tokens_seen": 3545538, "step": 1901, "train_runtime": 4031.4416, "train_tokens_per_second": 879.472 }, { "epoch": 1.9219105382865806, "grad_norm": 0.4708884656429291, "learning_rate": 8.000000000000001e-06, "loss": 0.0688, "num_input_tokens_seen": 3546782, "step": 1902, "train_runtime": 4032.9791, "train_tokens_per_second": 879.445 }, { "epoch": 1.9229214051048773, "grad_norm": 0.7044501304626465, "learning_rate": 7.89873417721519e-06, "loss": 0.0739, "num_input_tokens_seen": 3548922, "step": 1903, "train_runtime": 4034.8493, "train_tokens_per_second": 879.567 }, { "epoch": 1.9239322719231742, "grad_norm": 0.3273887038230896, "learning_rate": 7.79746835443038e-06, "loss": 0.2211, "num_input_tokens_seen": 3550554, "step": 1904, "train_runtime": 4036.5337, "train_tokens_per_second": 879.605 }, { "epoch": 1.9249431387414708, "grad_norm": 0.37105241417884827, "learning_rate": 7.69620253164557e-06, "loss": 0.075, "num_input_tokens_seen": 3552364, "step": 1905, "train_runtime": 4038.292, "train_tokens_per_second": 879.67 }, { "epoch": 1.9259540055597675, "grad_norm": 0.4764083921909332, "learning_rate": 7.5949367088607605e-06, "loss": 0.1963, "num_input_tokens_seen": 3553992, "step": 1906, "train_runtime": 4040.0242, "train_tokens_per_second": 879.696 }, { "epoch": 1.9269648723780644, "grad_norm": 0.22545349597930908, "learning_rate": 7.49367088607595e-06, "loss": 0.0792, "num_input_tokens_seen": 3555994, "step": 1907, "train_runtime": 4041.8702, "train_tokens_per_second": 879.789 }, { "epoch": 1.927975739196361, "grad_norm": 0.21613523364067078, "learning_rate": 7.39240506329114e-06, "loss": 0.0392, "num_input_tokens_seen": 3557394, "step": 1908, "train_runtime": 4043.4633, "train_tokens_per_second": 879.789 }, { "epoch": 1.9289866060146577, "grad_norm": 0.3875751495361328, "learning_rate": 7.29113924050633e-06, "loss": 0.0777, "num_input_tokens_seen": 3560020, "step": 1909, "train_runtime": 4045.6219, "train_tokens_per_second": 879.969 }, { "epoch": 1.9299974728329543, "grad_norm": 0.24568264186382294, "learning_rate": 7.18987341772152e-06, "loss": 0.1334, "num_input_tokens_seen": 3562156, "step": 1910, "train_runtime": 4047.4314, "train_tokens_per_second": 880.103 }, { "epoch": 1.931008339651251, "grad_norm": 0.2617509365081787, "learning_rate": 7.08860759493671e-06, "loss": 0.1945, "num_input_tokens_seen": 3563986, "step": 1911, "train_runtime": 4049.1581, "train_tokens_per_second": 880.18 }, { "epoch": 1.9320192064695476, "grad_norm": 0.23431828618049622, "learning_rate": 6.9873417721519e-06, "loss": 0.027, "num_input_tokens_seen": 3566308, "step": 1912, "train_runtime": 4051.1941, "train_tokens_per_second": 880.31 }, { "epoch": 1.9330300732878443, "grad_norm": 0.36068475246429443, "learning_rate": 6.88607594936709e-06, "loss": 0.0826, "num_input_tokens_seen": 3568304, "step": 1913, "train_runtime": 4052.9919, "train_tokens_per_second": 880.412 }, { "epoch": 1.934040940106141, "grad_norm": 0.3782718777656555, "learning_rate": 6.784810126582279e-06, "loss": 0.1143, "num_input_tokens_seen": 3570556, "step": 1914, "train_runtime": 4055.0012, "train_tokens_per_second": 880.531 }, { "epoch": 1.9350518069244376, "grad_norm": 0.28000250458717346, "learning_rate": 6.683544303797469e-06, "loss": 0.09, "num_input_tokens_seen": 3572374, "step": 1915, "train_runtime": 4056.6524, "train_tokens_per_second": 880.621 }, { "epoch": 1.9360626737427344, "grad_norm": 0.3298400342464447, "learning_rate": 6.582278481012659e-06, "loss": 0.0588, "num_input_tokens_seen": 3574458, "step": 1916, "train_runtime": 4058.4978, "train_tokens_per_second": 880.734 }, { "epoch": 1.937073540561031, "grad_norm": 0.23989160358905792, "learning_rate": 6.481012658227849e-06, "loss": 0.0431, "num_input_tokens_seen": 3575954, "step": 1917, "train_runtime": 4060.1131, "train_tokens_per_second": 880.752 }, { "epoch": 1.9380844073793277, "grad_norm": 0.3262454569339752, "learning_rate": 6.379746835443039e-06, "loss": 0.0407, "num_input_tokens_seen": 3578000, "step": 1918, "train_runtime": 4061.9716, "train_tokens_per_second": 880.853 }, { "epoch": 1.9390952741976246, "grad_norm": 0.28369343280792236, "learning_rate": 6.278481012658229e-06, "loss": 0.0817, "num_input_tokens_seen": 3580114, "step": 1919, "train_runtime": 4063.834, "train_tokens_per_second": 880.97 }, { "epoch": 1.9401061410159213, "grad_norm": 0.24143604934215546, "learning_rate": 6.177215189873418e-06, "loss": 0.0345, "num_input_tokens_seen": 3582430, "step": 1920, "train_runtime": 4065.7856, "train_tokens_per_second": 881.116 }, { "epoch": 1.941117007834218, "grad_norm": 0.3521853983402252, "learning_rate": 6.075949367088608e-06, "loss": 0.0389, "num_input_tokens_seen": 3584138, "step": 1921, "train_runtime": 4069.4925, "train_tokens_per_second": 880.733 }, { "epoch": 1.9421278746525146, "grad_norm": 0.43395107984542847, "learning_rate": 5.974683544303798e-06, "loss": 0.17, "num_input_tokens_seen": 3585998, "step": 1922, "train_runtime": 4071.2663, "train_tokens_per_second": 880.807 }, { "epoch": 1.9431387414708112, "grad_norm": 0.23371769487857819, "learning_rate": 5.873417721518987e-06, "loss": 0.0624, "num_input_tokens_seen": 3588064, "step": 1923, "train_runtime": 4073.0557, "train_tokens_per_second": 880.927 }, { "epoch": 1.9441496082891079, "grad_norm": 0.49193838238716125, "learning_rate": 5.772151898734177e-06, "loss": 0.0673, "num_input_tokens_seen": 3590246, "step": 1924, "train_runtime": 4074.9349, "train_tokens_per_second": 881.056 }, { "epoch": 1.9451604751074045, "grad_norm": 0.3861614465713501, "learning_rate": 5.670886075949367e-06, "loss": 0.1078, "num_input_tokens_seen": 3591950, "step": 1925, "train_runtime": 4076.6286, "train_tokens_per_second": 881.108 }, { "epoch": 1.9461713419257012, "grad_norm": 0.22905173897743225, "learning_rate": 5.569620253164557e-06, "loss": 0.0623, "num_input_tokens_seen": 3593526, "step": 1926, "train_runtime": 4078.3093, "train_tokens_per_second": 881.131 }, { "epoch": 1.9471822087439978, "grad_norm": 0.33775705099105835, "learning_rate": 5.468354430379747e-06, "loss": 0.0639, "num_input_tokens_seen": 3594912, "step": 1927, "train_runtime": 4079.9028, "train_tokens_per_second": 881.127 }, { "epoch": 1.9481930755622947, "grad_norm": 0.23181428015232086, "learning_rate": 5.367088607594937e-06, "loss": 0.031, "num_input_tokens_seen": 3596888, "step": 1928, "train_runtime": 4081.6845, "train_tokens_per_second": 881.226 }, { "epoch": 1.9492039423805914, "grad_norm": 0.313874214887619, "learning_rate": 5.265822784810127e-06, "loss": 0.019, "num_input_tokens_seen": 3598914, "step": 1929, "train_runtime": 4083.5516, "train_tokens_per_second": 881.32 }, { "epoch": 1.950214809198888, "grad_norm": 0.20736163854599, "learning_rate": 5.164556962025317e-06, "loss": 0.0261, "num_input_tokens_seen": 3600660, "step": 1930, "train_runtime": 4085.2556, "train_tokens_per_second": 881.379 }, { "epoch": 1.9512256760171849, "grad_norm": 0.2333381623029709, "learning_rate": 5.063291139240506e-06, "loss": 0.0581, "num_input_tokens_seen": 3602410, "step": 1931, "train_runtime": 4086.9643, "train_tokens_per_second": 881.439 }, { "epoch": 1.9522365428354815, "grad_norm": 0.2814578711986542, "learning_rate": 4.962025316455696e-06, "loss": 0.0584, "num_input_tokens_seen": 3603912, "step": 1932, "train_runtime": 4088.5787, "train_tokens_per_second": 881.458 }, { "epoch": 1.9532474096537782, "grad_norm": 0.24945557117462158, "learning_rate": 4.860759493670886e-06, "loss": 0.0943, "num_input_tokens_seen": 3605632, "step": 1933, "train_runtime": 4090.2269, "train_tokens_per_second": 881.524 }, { "epoch": 1.9542582764720748, "grad_norm": 0.2942098379135132, "learning_rate": 4.759493670886076e-06, "loss": 0.0861, "num_input_tokens_seen": 3607248, "step": 1934, "train_runtime": 4091.8579, "train_tokens_per_second": 881.567 }, { "epoch": 1.9552691432903715, "grad_norm": 0.2916257977485657, "learning_rate": 4.658227848101266e-06, "loss": 0.0192, "num_input_tokens_seen": 3609602, "step": 1935, "train_runtime": 4093.8655, "train_tokens_per_second": 881.71 }, { "epoch": 1.9562800101086681, "grad_norm": 0.2910366356372833, "learning_rate": 4.556962025316456e-06, "loss": 0.0753, "num_input_tokens_seen": 3611586, "step": 1936, "train_runtime": 4095.5503, "train_tokens_per_second": 881.832 }, { "epoch": 1.9572908769269648, "grad_norm": 0.2816304862499237, "learning_rate": 4.455696202531646e-06, "loss": 0.0829, "num_input_tokens_seen": 3613422, "step": 1937, "train_runtime": 4097.2667, "train_tokens_per_second": 881.91 }, { "epoch": 1.9583017437452614, "grad_norm": 0.6069521903991699, "learning_rate": 4.354430379746836e-06, "loss": 0.1285, "num_input_tokens_seen": 3615344, "step": 1938, "train_runtime": 4098.9904, "train_tokens_per_second": 882.008 }, { "epoch": 1.959312610563558, "grad_norm": 0.30993974208831787, "learning_rate": 4.253164556962025e-06, "loss": 0.0374, "num_input_tokens_seen": 3617668, "step": 1939, "train_runtime": 4100.9925, "train_tokens_per_second": 882.145 }, { "epoch": 1.960323477381855, "grad_norm": 0.3111766278743744, "learning_rate": 4.151898734177215e-06, "loss": 0.0367, "num_input_tokens_seen": 3619994, "step": 1940, "train_runtime": 4102.9379, "train_tokens_per_second": 882.293 }, { "epoch": 1.9613343442001516, "grad_norm": 0.25089362263679504, "learning_rate": 4.050632911392405e-06, "loss": 0.0452, "num_input_tokens_seen": 3621498, "step": 1941, "train_runtime": 4104.615, "train_tokens_per_second": 882.299 }, { "epoch": 1.9623452110184483, "grad_norm": 0.4375602602958679, "learning_rate": 3.949367088607595e-06, "loss": 0.0825, "num_input_tokens_seen": 3623018, "step": 1942, "train_runtime": 4106.2249, "train_tokens_per_second": 882.323 }, { "epoch": 1.9633560778367452, "grad_norm": 0.305571049451828, "learning_rate": 3.848101265822785e-06, "loss": 0.189, "num_input_tokens_seen": 3624918, "step": 1943, "train_runtime": 4107.9957, "train_tokens_per_second": 882.406 }, { "epoch": 1.9643669446550418, "grad_norm": 0.189753919839859, "learning_rate": 3.746835443037975e-06, "loss": 0.0161, "num_input_tokens_seen": 3626724, "step": 1944, "train_runtime": 4109.762, "train_tokens_per_second": 882.466 }, { "epoch": 1.9653778114733385, "grad_norm": 0.2611081600189209, "learning_rate": 3.645569620253165e-06, "loss": 0.0419, "num_input_tokens_seen": 3628918, "step": 1945, "train_runtime": 4111.6253, "train_tokens_per_second": 882.599 }, { "epoch": 1.966388678291635, "grad_norm": 0.5160294771194458, "learning_rate": 3.544303797468355e-06, "loss": 0.0625, "num_input_tokens_seen": 3630596, "step": 1946, "train_runtime": 4113.3186, "train_tokens_per_second": 882.644 }, { "epoch": 1.9673995451099318, "grad_norm": 0.21070647239685059, "learning_rate": 3.443037974683545e-06, "loss": 0.0314, "num_input_tokens_seen": 3632930, "step": 1947, "train_runtime": 4115.2625, "train_tokens_per_second": 882.794 }, { "epoch": 1.9684104119282284, "grad_norm": 0.38716843724250793, "learning_rate": 3.3417721518987344e-06, "loss": 0.0306, "num_input_tokens_seen": 3634688, "step": 1948, "train_runtime": 4116.9753, "train_tokens_per_second": 882.854 }, { "epoch": 1.969421278746525, "grad_norm": 0.33610138297080994, "learning_rate": 3.2405063291139244e-06, "loss": 0.0394, "num_input_tokens_seen": 3636356, "step": 1949, "train_runtime": 4118.6084, "train_tokens_per_second": 882.909 }, { "epoch": 1.9704321455648217, "grad_norm": 0.2751634418964386, "learning_rate": 3.1392405063291144e-06, "loss": 0.0264, "num_input_tokens_seen": 3638022, "step": 1950, "train_runtime": 4120.2459, "train_tokens_per_second": 882.962 }, { "epoch": 1.9714430123831184, "grad_norm": 0.3494411110877991, "learning_rate": 3.037974683544304e-06, "loss": 0.1783, "num_input_tokens_seen": 3640064, "step": 1951, "train_runtime": 4123.8275, "train_tokens_per_second": 882.691 }, { "epoch": 1.9724538792014152, "grad_norm": 0.278598427772522, "learning_rate": 2.9367088607594935e-06, "loss": 0.1578, "num_input_tokens_seen": 3642054, "step": 1952, "train_runtime": 4125.6131, "train_tokens_per_second": 882.791 }, { "epoch": 1.973464746019712, "grad_norm": 0.2557959258556366, "learning_rate": 2.8354430379746835e-06, "loss": 0.0403, "num_input_tokens_seen": 3644092, "step": 1953, "train_runtime": 4127.4745, "train_tokens_per_second": 882.887 }, { "epoch": 1.9744756128380085, "grad_norm": 0.5219696760177612, "learning_rate": 2.7341772151898735e-06, "loss": 0.0724, "num_input_tokens_seen": 3646030, "step": 1954, "train_runtime": 4129.2676, "train_tokens_per_second": 882.973 }, { "epoch": 1.9754864796563054, "grad_norm": 0.16795364022254944, "learning_rate": 2.6329113924050635e-06, "loss": 0.082, "num_input_tokens_seen": 3648064, "step": 1955, "train_runtime": 4131.1025, "train_tokens_per_second": 883.073 }, { "epoch": 1.976497346474602, "grad_norm": 0.3070884644985199, "learning_rate": 2.531645569620253e-06, "loss": 0.1373, "num_input_tokens_seen": 3649644, "step": 1956, "train_runtime": 4132.731, "train_tokens_per_second": 883.107 }, { "epoch": 1.9775082132928987, "grad_norm": 0.37285706400871277, "learning_rate": 2.430379746835443e-06, "loss": 0.1259, "num_input_tokens_seen": 3651276, "step": 1957, "train_runtime": 4134.3503, "train_tokens_per_second": 883.156 }, { "epoch": 1.9785190801111954, "grad_norm": 0.3180710971355438, "learning_rate": 2.329113924050633e-06, "loss": 0.0952, "num_input_tokens_seen": 3652972, "step": 1958, "train_runtime": 4136.0556, "train_tokens_per_second": 883.202 }, { "epoch": 1.979529946929492, "grad_norm": 0.3023328185081482, "learning_rate": 2.227848101265823e-06, "loss": 0.0269, "num_input_tokens_seen": 3654638, "step": 1959, "train_runtime": 4137.6924, "train_tokens_per_second": 883.255 }, { "epoch": 1.9805408137477887, "grad_norm": 0.26938310265541077, "learning_rate": 2.1265822784810126e-06, "loss": 0.0985, "num_input_tokens_seen": 3656578, "step": 1960, "train_runtime": 4139.4251, "train_tokens_per_second": 883.354 }, { "epoch": 1.9815516805660853, "grad_norm": 0.31211763620376587, "learning_rate": 2.0253164556962026e-06, "loss": 0.0916, "num_input_tokens_seen": 3658518, "step": 1961, "train_runtime": 4141.2147, "train_tokens_per_second": 883.441 }, { "epoch": 1.982562547384382, "grad_norm": 0.31595489382743835, "learning_rate": 1.9240506329113926e-06, "loss": 0.0505, "num_input_tokens_seen": 3660208, "step": 1962, "train_runtime": 4142.8399, "train_tokens_per_second": 883.502 }, { "epoch": 1.9835734142026786, "grad_norm": 0.2708406150341034, "learning_rate": 1.8227848101265824e-06, "loss": 0.1296, "num_input_tokens_seen": 3661700, "step": 1963, "train_runtime": 4144.4475, "train_tokens_per_second": 883.519 }, { "epoch": 1.9845842810209755, "grad_norm": 0.2860327363014221, "learning_rate": 1.7215189873417724e-06, "loss": 0.0329, "num_input_tokens_seen": 3663864, "step": 1964, "train_runtime": 4146.3123, "train_tokens_per_second": 883.644 }, { "epoch": 1.9855951478392722, "grad_norm": 0.3053610622882843, "learning_rate": 1.6202531645569622e-06, "loss": 0.0283, "num_input_tokens_seen": 3665944, "step": 1965, "train_runtime": 4148.2215, "train_tokens_per_second": 883.739 }, { "epoch": 1.986606014657569, "grad_norm": 0.32138562202453613, "learning_rate": 1.518987341772152e-06, "loss": 0.1864, "num_input_tokens_seen": 3667618, "step": 1966, "train_runtime": 4149.9149, "train_tokens_per_second": 883.781 }, { "epoch": 1.9876168814758657, "grad_norm": 0.28214770555496216, "learning_rate": 1.4177215189873418e-06, "loss": 0.0554, "num_input_tokens_seen": 3669234, "step": 1967, "train_runtime": 4151.5454, "train_tokens_per_second": 883.824 }, { "epoch": 1.9886277482941623, "grad_norm": 0.2837907671928406, "learning_rate": 1.3164556962025317e-06, "loss": 0.0279, "num_input_tokens_seen": 3671044, "step": 1968, "train_runtime": 4153.2579, "train_tokens_per_second": 883.895 }, { "epoch": 1.989638615112459, "grad_norm": 0.22075307369232178, "learning_rate": 1.2151898734177215e-06, "loss": 0.0838, "num_input_tokens_seen": 3672762, "step": 1969, "train_runtime": 4154.9586, "train_tokens_per_second": 883.947 }, { "epoch": 1.9906494819307556, "grad_norm": 0.46182411909103394, "learning_rate": 1.1139240506329115e-06, "loss": 0.1019, "num_input_tokens_seen": 3674320, "step": 1970, "train_runtime": 4156.5486, "train_tokens_per_second": 883.983 }, { "epoch": 1.9916603487490523, "grad_norm": 0.5559793710708618, "learning_rate": 1.0126582278481013e-06, "loss": 0.0564, "num_input_tokens_seen": 3675884, "step": 1971, "train_runtime": 4158.1782, "train_tokens_per_second": 884.013 }, { "epoch": 1.992671215567349, "grad_norm": 0.2674468457698822, "learning_rate": 9.113924050632912e-07, "loss": 0.0762, "num_input_tokens_seen": 3677952, "step": 1972, "train_runtime": 4159.9284, "train_tokens_per_second": 884.138 }, { "epoch": 1.9936820823856456, "grad_norm": 0.4438008964061737, "learning_rate": 8.101265822784811e-07, "loss": 0.1007, "num_input_tokens_seen": 3679434, "step": 1973, "train_runtime": 4161.5398, "train_tokens_per_second": 884.152 }, { "epoch": 1.9946929492039422, "grad_norm": 0.27451828122138977, "learning_rate": 7.088607594936709e-07, "loss": 0.1345, "num_input_tokens_seen": 3681674, "step": 1974, "train_runtime": 4163.4179, "train_tokens_per_second": 884.291 }, { "epoch": 1.9957038160222391, "grad_norm": 0.3934115469455719, "learning_rate": 6.075949367088608e-07, "loss": 0.0663, "num_input_tokens_seen": 3683144, "step": 1975, "train_runtime": 4165.0573, "train_tokens_per_second": 884.296 }, { "epoch": 1.9967146828405358, "grad_norm": 0.3689475357532501, "learning_rate": 5.063291139240507e-07, "loss": 0.0331, "num_input_tokens_seen": 3684728, "step": 1976, "train_runtime": 4166.6966, "train_tokens_per_second": 884.328 }, { "epoch": 1.9977255496588324, "grad_norm": 0.33448612689971924, "learning_rate": 4.0506329113924055e-07, "loss": 0.1883, "num_input_tokens_seen": 3686432, "step": 1977, "train_runtime": 4168.3366, "train_tokens_per_second": 884.389 }, { "epoch": 1.9987364164771293, "grad_norm": 0.3961541950702667, "learning_rate": 3.037974683544304e-07, "loss": 0.0497, "num_input_tokens_seen": 3687956, "step": 1978, "train_runtime": 4169.961, "train_tokens_per_second": 884.41 }, { "epoch": 1.999747283295426, "grad_norm": 0.24878139793872833, "learning_rate": 2.0253164556962027e-07, "loss": 0.0542, "num_input_tokens_seen": 3690326, "step": 1979, "train_runtime": 4171.9135, "train_tokens_per_second": 884.564 }, { "epoch": 2.0, "grad_norm": 0.8398122191429138, "learning_rate": 1.0126582278481014e-07, "loss": 0.1104, "num_input_tokens_seen": 3690454, "step": 1980, "train_runtime": 4172.3104, "train_tokens_per_second": 884.511 }, { "epoch": 2.0, "eval_loss": 0.20445670187473297, "eval_runtime": 61.4995, "eval_samples_per_second": 14.293, "eval_steps_per_second": 7.155, "num_input_tokens_seen": 3690454, "step": 1980 } ], "logging_steps": 1, "max_steps": 1980, "num_input_tokens_seen": 3690454, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.141614475047936e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }