{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.7167381974248928, "eval_steps": 100, "global_step": 400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02145922746781116, "grad_norm": 3.03324294090271, "learning_rate": 8.000000000000001e-06, "loss": 1.6153003692626953, "num_input_tokens_seen": 58112, "step": 5, "train_runtime": 7.4685, "train_tokens_per_second": 7780.897 }, { "epoch": 0.04291845493562232, "grad_norm": 1.29582941532135, "learning_rate": 1.8e-05, "loss": 1.470921516418457, "num_input_tokens_seen": 123392, "step": 10, "train_runtime": 12.4602, "train_tokens_per_second": 9902.863 }, { "epoch": 0.06437768240343347, "grad_norm": 1.0643380880355835, "learning_rate": 2.8000000000000003e-05, "loss": 1.1773520469665528, "num_input_tokens_seen": 183808, "step": 15, "train_runtime": 17.3966, "train_tokens_per_second": 10565.773 }, { "epoch": 0.08583690987124463, "grad_norm": 0.9673917889595032, "learning_rate": 3.8e-05, "loss": 0.991020393371582, "num_input_tokens_seen": 237312, "step": 20, "train_runtime": 21.6738, "train_tokens_per_second": 10949.243 }, { "epoch": 0.1072961373390558, "grad_norm": 1.0297874212265015, "learning_rate": 4.8e-05, "loss": 0.9735608100891113, "num_input_tokens_seen": 294400, "step": 25, "train_runtime": 25.962, "train_tokens_per_second": 11339.643 }, { "epoch": 0.12875536480686695, "grad_norm": 0.950329601764679, "learning_rate": 5.8e-05, "loss": 0.8873712539672851, "num_input_tokens_seen": 349952, "step": 30, "train_runtime": 30.609, "train_tokens_per_second": 11432.978 }, { "epoch": 0.15021459227467812, "grad_norm": 0.9307717680931091, "learning_rate": 6.800000000000001e-05, "loss": 0.8720953941345215, "num_input_tokens_seen": 404992, "step": 35, "train_runtime": 34.7568, "train_tokens_per_second": 11652.181 }, { "epoch": 0.17167381974248927, "grad_norm": 0.9645226001739502, "learning_rate": 7.800000000000001e-05, "loss": 0.8684850692749023, "num_input_tokens_seen": 461056, "step": 40, "train_runtime": 39.036, "train_tokens_per_second": 11811.04 }, { "epoch": 0.19313304721030042, "grad_norm": 0.9567210674285889, "learning_rate": 8.800000000000001e-05, "loss": 0.7938490390777588, "num_input_tokens_seen": 518144, "step": 45, "train_runtime": 43.9371, "train_tokens_per_second": 11792.858 }, { "epoch": 0.2145922746781116, "grad_norm": 0.9292750358581543, "learning_rate": 9.8e-05, "loss": 0.7703328609466553, "num_input_tokens_seen": 568576, "step": 50, "train_runtime": 47.9296, "train_tokens_per_second": 11862.735 }, { "epoch": 0.23605150214592274, "grad_norm": 0.9988890886306763, "learning_rate": 0.00010800000000000001, "loss": 0.7470858573913575, "num_input_tokens_seen": 619264, "step": 55, "train_runtime": 51.9347, "train_tokens_per_second": 11923.905 }, { "epoch": 0.2575107296137339, "grad_norm": 1.0609540939331055, "learning_rate": 0.000118, "loss": 0.7434512138366699, "num_input_tokens_seen": 674304, "step": 60, "train_runtime": 56.2719, "train_tokens_per_second": 11982.969 }, { "epoch": 0.27896995708154504, "grad_norm": 1.0313714742660522, "learning_rate": 0.00012800000000000002, "loss": 0.7007692337036133, "num_input_tokens_seen": 735744, "step": 65, "train_runtime": 61.1614, "train_tokens_per_second": 12029.548 }, { "epoch": 0.30042918454935624, "grad_norm": 0.8622630834579468, "learning_rate": 0.000138, "loss": 0.7205728530883789, "num_input_tokens_seen": 789760, "step": 70, "train_runtime": 65.595, "train_tokens_per_second": 12039.941 }, { "epoch": 0.3218884120171674, "grad_norm": 0.9945432543754578, "learning_rate": 0.000148, "loss": 0.6990869522094727, "num_input_tokens_seen": 845568, "step": 75, "train_runtime": 69.9997, "train_tokens_per_second": 12079.588 }, { "epoch": 0.34334763948497854, "grad_norm": 0.8772686719894409, "learning_rate": 0.00015800000000000002, "loss": 0.7007846355438232, "num_input_tokens_seen": 900864, "step": 80, "train_runtime": 74.2575, "train_tokens_per_second": 12131.625 }, { "epoch": 0.3648068669527897, "grad_norm": 0.888869047164917, "learning_rate": 0.000168, "loss": 0.6950747489929199, "num_input_tokens_seen": 964608, "step": 85, "train_runtime": 79.9415, "train_tokens_per_second": 12066.42 }, { "epoch": 0.38626609442060084, "grad_norm": 1.1443110704421997, "learning_rate": 0.00017800000000000002, "loss": 0.7211706638336182, "num_input_tokens_seen": 1023744, "step": 90, "train_runtime": 85.0578, "train_tokens_per_second": 12035.856 }, { "epoch": 0.40772532188841204, "grad_norm": 0.9073887467384338, "learning_rate": 0.000188, "loss": 0.6607097625732422, "num_input_tokens_seen": 1080320, "step": 95, "train_runtime": 89.6566, "train_tokens_per_second": 12049.537 }, { "epoch": 0.4291845493562232, "grad_norm": 0.9436500668525696, "learning_rate": 0.00019800000000000002, "loss": 0.7111758232116699, "num_input_tokens_seen": 1141248, "step": 100, "train_runtime": 95.1795, "train_tokens_per_second": 11990.483 }, { "epoch": 0.4291845493562232, "eval_loss": 0.6004661917686462, "eval_runtime": 22.148, "eval_samples_per_second": 35.398, "eval_steps_per_second": 17.699, "num_input_tokens_seen": 1141248, "step": 100 }, { "epoch": 0.45064377682403434, "grad_norm": 0.916501522064209, "learning_rate": 0.00019997799506149338, "loss": 0.6870423316955566, "num_input_tokens_seen": 1192192, "step": 105, "train_runtime": 137.2215, "train_tokens_per_second": 8688.083 }, { "epoch": 0.4721030042918455, "grad_norm": 0.8930872678756714, "learning_rate": 0.000199888616596235, "loss": 0.6905088424682617, "num_input_tokens_seen": 1248000, "step": 110, "train_runtime": 141.7812, "train_tokens_per_second": 8802.295 }, { "epoch": 0.49356223175965663, "grad_norm": 0.8945744037628174, "learning_rate": 0.00019973055070849913, "loss": 0.6668004035949707, "num_input_tokens_seen": 1305856, "step": 115, "train_runtime": 146.4487, "train_tokens_per_second": 8916.818 }, { "epoch": 0.5150214592274678, "grad_norm": 0.9365142583847046, "learning_rate": 0.0001995039060907352, "loss": 0.6359036445617676, "num_input_tokens_seen": 1370368, "step": 120, "train_runtime": 151.6609, "train_tokens_per_second": 9035.739 }, { "epoch": 0.5364806866952789, "grad_norm": 0.9572582244873047, "learning_rate": 0.00019920883859288034, "loss": 0.6302140235900879, "num_input_tokens_seen": 1425920, "step": 125, "train_runtime": 156.1545, "train_tokens_per_second": 9131.47 }, { "epoch": 0.5579399141630901, "grad_norm": 0.9190641045570374, "learning_rate": 0.00019884555111519058, "loss": 0.6023337364196777, "num_input_tokens_seen": 1477376, "step": 130, "train_runtime": 160.3216, "train_tokens_per_second": 9215.078 }, { "epoch": 0.5793991416309013, "grad_norm": 0.7973408102989197, "learning_rate": 0.0001984142934687186, "loss": 0.6142975330352783, "num_input_tokens_seen": 1537024, "step": 135, "train_runtime": 165.1747, "train_tokens_per_second": 9305.443 }, { "epoch": 0.6008583690987125, "grad_norm": 0.8307357430458069, "learning_rate": 0.00019791536220353356, "loss": 0.6178459167480469, "num_input_tokens_seen": 1600000, "step": 140, "train_runtime": 170.1853, "train_tokens_per_second": 9401.52 }, { "epoch": 0.6223175965665236, "grad_norm": 0.9216153025627136, "learning_rate": 0.00019734910040480137, "loss": 0.5878005027770996, "num_input_tokens_seen": 1657600, "step": 145, "train_runtime": 175.0946, "train_tokens_per_second": 9466.883 }, { "epoch": 0.6437768240343348, "grad_norm": 0.9538068175315857, "learning_rate": 0.0001967158974568656, "loss": 0.6823252677917481, "num_input_tokens_seen": 1711104, "step": 150, "train_runtime": 179.7828, "train_tokens_per_second": 9517.616 }, { "epoch": 0.6652360515021459, "grad_norm": 0.8435113430023193, "learning_rate": 0.00019601618877549112, "loss": 0.6517625331878663, "num_input_tokens_seen": 1762048, "step": 155, "train_runtime": 183.8306, "train_tokens_per_second": 9585.173 }, { "epoch": 0.6866952789699571, "grad_norm": 0.8970490097999573, "learning_rate": 0.00019525045550845482, "loss": 0.6671280860900879, "num_input_tokens_seen": 1820416, "step": 160, "train_runtime": 188.5304, "train_tokens_per_second": 9655.824 }, { "epoch": 0.7081545064377682, "grad_norm": 0.8489075303077698, "learning_rate": 0.00019441922420468898, "loss": 0.6579770565032959, "num_input_tokens_seen": 1876992, "step": 165, "train_runtime": 193.0354, "train_tokens_per_second": 9723.564 }, { "epoch": 0.7296137339055794, "grad_norm": 0.911480188369751, "learning_rate": 0.00019352306645220517, "loss": 0.6479627609252929, "num_input_tokens_seen": 1927680, "step": 170, "train_runtime": 196.9591, "train_tokens_per_second": 9787.21 }, { "epoch": 0.7510729613733905, "grad_norm": 0.9032346606254578, "learning_rate": 0.00019256259848504737, "loss": 0.6328952789306641, "num_input_tokens_seen": 1984768, "step": 175, "train_runtime": 201.5699, "train_tokens_per_second": 9846.551 }, { "epoch": 0.7725321888412017, "grad_norm": 0.9176375865936279, "learning_rate": 0.00019153848075954466, "loss": 0.6545487403869629, "num_input_tokens_seen": 2047744, "step": 180, "train_runtime": 206.7957, "train_tokens_per_second": 9902.254 }, { "epoch": 0.7939914163090128, "grad_norm": 0.8009106516838074, "learning_rate": 0.000190451417500155, "loss": 0.5557879447937012, "num_input_tokens_seen": 2124032, "step": 185, "train_runtime": 214.0583, "train_tokens_per_second": 9922.681 }, { "epoch": 0.8154506437768241, "grad_norm": 0.8755921721458435, "learning_rate": 0.0001893021562152122, "loss": 0.6030447006225585, "num_input_tokens_seen": 2178304, "step": 190, "train_runtime": 218.3854, "train_tokens_per_second": 9974.585 }, { "epoch": 0.8369098712446352, "grad_norm": 0.7998857498168945, "learning_rate": 0.00018809148718290918, "loss": 0.6215959072113038, "num_input_tokens_seen": 2234112, "step": 195, "train_runtime": 222.6461, "train_tokens_per_second": 10034.362 }, { "epoch": 0.8583690987124464, "grad_norm": 0.8616818785667419, "learning_rate": 0.00018682024290787093, "loss": 0.615071964263916, "num_input_tokens_seen": 2289920, "step": 200, "train_runtime": 227.2286, "train_tokens_per_second": 10077.603 }, { "epoch": 0.8583690987124464, "eval_loss": 0.5416203737258911, "eval_runtime": 23.1771, "eval_samples_per_second": 33.827, "eval_steps_per_second": 16.913, "num_input_tokens_seen": 2289920, "step": 200 }, { "epoch": 0.8798283261802575, "grad_norm": 0.866408109664917, "learning_rate": 0.00018548929754869095, "loss": 0.6127395629882812, "num_input_tokens_seen": 2336768, "step": 205, "train_runtime": 269.3352, "train_tokens_per_second": 8676.059 }, { "epoch": 0.9012875536480687, "grad_norm": 0.7758891582489014, "learning_rate": 0.00018409956631682475, "loss": 0.619700813293457, "num_input_tokens_seen": 2398720, "step": 210, "train_runtime": 274.7853, "train_tokens_per_second": 8729.432 }, { "epoch": 0.9227467811158798, "grad_norm": 0.8826097249984741, "learning_rate": 0.00018265200484725362, "loss": 0.6074517726898193, "num_input_tokens_seen": 2456064, "step": 215, "train_runtime": 279.0929, "train_tokens_per_second": 8800.166 }, { "epoch": 0.944206008583691, "grad_norm": 0.9082592725753784, "learning_rate": 0.0001811476085413517, "loss": 0.6168807506561279, "num_input_tokens_seen": 2513408, "step": 220, "train_runtime": 283.5383, "train_tokens_per_second": 8864.438 }, { "epoch": 0.9656652360515021, "grad_norm": 0.7310217618942261, "learning_rate": 0.00017958741188240805, "loss": 0.5989558696746826, "num_input_tokens_seen": 2577664, "step": 225, "train_runtime": 288.997, "train_tokens_per_second": 8919.346 }, { "epoch": 0.9871244635193133, "grad_norm": 0.7489120364189148, "learning_rate": 0.0001779724877242745, "loss": 0.5686917781829834, "num_input_tokens_seen": 2634752, "step": 230, "train_runtime": 293.5938, "train_tokens_per_second": 8974.142 }, { "epoch": 1.0085836909871244, "grad_norm": 0.6700829267501831, "learning_rate": 0.00017630394655362798, "loss": 0.4931748867034912, "num_input_tokens_seen": 2695424, "step": 235, "train_runtime": 298.6586, "train_tokens_per_second": 9025.102 }, { "epoch": 1.0300429184549356, "grad_norm": 0.8137433528900146, "learning_rate": 0.00017458293572635572, "loss": 0.41871185302734376, "num_input_tokens_seen": 2759680, "step": 240, "train_runtime": 304.168, "train_tokens_per_second": 9072.882 }, { "epoch": 1.0515021459227467, "grad_norm": 0.8284509778022766, "learning_rate": 0.00017281063867858687, "loss": 0.39093842506408694, "num_input_tokens_seen": 2821376, "step": 245, "train_runtime": 309.2922, "train_tokens_per_second": 9122.041 }, { "epoch": 1.0729613733905579, "grad_norm": 0.8212636113166809, "learning_rate": 0.00017098827411291475, "loss": 0.41676993370056153, "num_input_tokens_seen": 2879744, "step": 250, "train_runtime": 314.1833, "train_tokens_per_second": 9165.809 }, { "epoch": 1.094420600858369, "grad_norm": 0.9262588024139404, "learning_rate": 0.00016911709516036753, "loss": 0.43643965721130373, "num_input_tokens_seen": 2939648, "step": 255, "train_runtime": 318.9898, "train_tokens_per_second": 9215.492 }, { "epoch": 1.1158798283261802, "grad_norm": 0.8408174514770508, "learning_rate": 0.0001671983885187055, "loss": 0.42370119094848635, "num_input_tokens_seen": 2993152, "step": 260, "train_runtime": 323.4471, "train_tokens_per_second": 9253.915 }, { "epoch": 1.1373390557939915, "grad_norm": 0.857381284236908, "learning_rate": 0.00016523347356763572, "loss": 0.42381582260131834, "num_input_tokens_seen": 3044608, "step": 265, "train_runtime": 327.4141, "train_tokens_per_second": 9298.953 }, { "epoch": 1.1587982832618025, "grad_norm": 0.9033918380737305, "learning_rate": 0.0001632237014615537, "loss": 0.40540313720703125, "num_input_tokens_seen": 3104768, "step": 270, "train_runtime": 332.1893, "train_tokens_per_second": 9346.38 }, { "epoch": 1.1802575107296138, "grad_norm": 0.7994610667228699, "learning_rate": 0.00016117045420043543, "loss": 0.4465446472167969, "num_input_tokens_seen": 3160832, "step": 275, "train_runtime": 336.8133, "train_tokens_per_second": 9384.521 }, { "epoch": 1.201716738197425, "grad_norm": 0.8270825147628784, "learning_rate": 0.0001590751436795186, "loss": 0.41684885025024415, "num_input_tokens_seen": 3222016, "step": 280, "train_runtime": 341.7825, "train_tokens_per_second": 9427.094 }, { "epoch": 1.2231759656652361, "grad_norm": 0.8962671756744385, "learning_rate": 0.00015693921071842688, "loss": 0.42808146476745607, "num_input_tokens_seen": 3283456, "step": 285, "train_runtime": 346.6683, "train_tokens_per_second": 9471.463 }, { "epoch": 1.2446351931330473, "grad_norm": 0.8256343007087708, "learning_rate": 0.00015476412407040445, "loss": 0.40830087661743164, "num_input_tokens_seen": 3344128, "step": 290, "train_runtime": 351.6457, "train_tokens_per_second": 9509.935 }, { "epoch": 1.2660944206008584, "grad_norm": 0.7946646809577942, "learning_rate": 0.00015255137941234227, "loss": 0.46245832443237306, "num_input_tokens_seen": 3399936, "step": 295, "train_runtime": 356.2532, "train_tokens_per_second": 9543.595 }, { "epoch": 1.2875536480686696, "grad_norm": 0.7553455829620361, "learning_rate": 0.0001503024983162908, "loss": 0.4185676574707031, "num_input_tokens_seen": 3448576, "step": 300, "train_runtime": 360.2579, "train_tokens_per_second": 9572.519 }, { "epoch": 1.2875536480686696, "eval_loss": 0.5272337198257446, "eval_runtime": 23.4826, "eval_samples_per_second": 33.386, "eval_steps_per_second": 16.693, "num_input_tokens_seen": 3448576, "step": 300 }, { "epoch": 1.3090128755364807, "grad_norm": 0.7643769979476929, "learning_rate": 0.00014801902720316568, "loss": 0.41739530563354493, "num_input_tokens_seen": 3507456, "step": 305, "train_runtime": 403.3091, "train_tokens_per_second": 8696.694 }, { "epoch": 1.3304721030042919, "grad_norm": 0.7832750678062439, "learning_rate": 0.0001457025362793669, "loss": 0.43469972610473634, "num_input_tokens_seen": 3572992, "step": 310, "train_runtime": 408.9235, "train_tokens_per_second": 8737.555 }, { "epoch": 1.351931330472103, "grad_norm": 0.8122566938400269, "learning_rate": 0.00014335461845704173, "loss": 0.4958329200744629, "num_input_tokens_seen": 3628032, "step": 315, "train_runtime": 413.3099, "train_tokens_per_second": 8777.994 }, { "epoch": 1.3733905579399142, "grad_norm": 0.8401719927787781, "learning_rate": 0.00014097688825873437, "loss": 0.4470388412475586, "num_input_tokens_seen": 3685120, "step": 320, "train_runtime": 417.6895, "train_tokens_per_second": 8822.631 }, { "epoch": 1.3948497854077253, "grad_norm": 0.911494255065918, "learning_rate": 0.00013857098070717543, "loss": 0.4368776321411133, "num_input_tokens_seen": 3736064, "step": 325, "train_runtime": 421.8302, "train_tokens_per_second": 8856.796 }, { "epoch": 1.4163090128755365, "grad_norm": 0.8921552300453186, "learning_rate": 0.00013613855020097476, "loss": 0.41593198776245116, "num_input_tokens_seen": 3786752, "step": 330, "train_runtime": 425.7613, "train_tokens_per_second": 8894.073 }, { "epoch": 1.4377682403433476, "grad_norm": 0.899163007736206, "learning_rate": 0.00013368126937699055, "loss": 0.41350326538085935, "num_input_tokens_seen": 3836928, "step": 335, "train_runtime": 429.9947, "train_tokens_per_second": 8923.198 }, { "epoch": 1.4592274678111588, "grad_norm": 0.8040919303894043, "learning_rate": 0.00013120082796015694, "loss": 0.41482973098754883, "num_input_tokens_seen": 3902976, "step": 340, "train_runtime": 435.7465, "train_tokens_per_second": 8956.988 }, { "epoch": 1.48068669527897, "grad_norm": 0.786900520324707, "learning_rate": 0.00012869893160156144, "loss": 0.4156362056732178, "num_input_tokens_seen": 3965952, "step": 345, "train_runtime": 441.2677, "train_tokens_per_second": 8987.632 }, { "epoch": 1.5021459227467813, "grad_norm": 0.8730544447898865, "learning_rate": 0.0001261773007055708, "loss": 0.46176786422729493, "num_input_tokens_seen": 4019456, "step": 350, "train_runtime": 445.6914, "train_tokens_per_second": 9018.474 }, { "epoch": 1.5236051502145922, "grad_norm": 0.8831098079681396, "learning_rate": 0.00012363766924681176, "loss": 0.42528247833251953, "num_input_tokens_seen": 4070656, "step": 355, "train_runtime": 449.6375, "train_tokens_per_second": 9053.196 }, { "epoch": 1.5450643776824036, "grad_norm": 0.8320629000663757, "learning_rate": 0.00012108178357782078, "loss": 0.4190709114074707, "num_input_tokens_seen": 4125696, "step": 360, "train_runtime": 454.0433, "train_tokens_per_second": 9086.569 }, { "epoch": 1.5665236051502145, "grad_norm": 0.8362066149711609, "learning_rate": 0.00011851140122818154, "loss": 0.4130504608154297, "num_input_tokens_seen": 4175360, "step": 365, "train_runtime": 457.9743, "train_tokens_per_second": 9117.018 }, { "epoch": 1.5879828326180259, "grad_norm": 0.8794524669647217, "learning_rate": 0.0001159282896959774, "loss": 0.38641934394836425, "num_input_tokens_seen": 4226304, "step": 370, "train_runtime": 461.8462, "train_tokens_per_second": 9150.891 }, { "epoch": 1.6094420600858368, "grad_norm": 0.7941300272941589, "learning_rate": 0.00011333422523238856, "loss": 0.38475966453552246, "num_input_tokens_seen": 4286976, "step": 375, "train_runtime": 466.4935, "train_tokens_per_second": 9189.788 }, { "epoch": 1.6309012875536482, "grad_norm": 0.8813296556472778, "learning_rate": 0.0001107309916202705, "loss": 0.43069748878479003, "num_input_tokens_seen": 4338944, "step": 380, "train_runtime": 470.4846, "train_tokens_per_second": 9222.287 }, { "epoch": 1.652360515021459, "grad_norm": 0.7397964000701904, "learning_rate": 0.00010812037894755335, "loss": 0.4383960247039795, "num_input_tokens_seen": 4389376, "step": 385, "train_runtime": 474.5481, "train_tokens_per_second": 9249.592 }, { "epoch": 1.6738197424892705, "grad_norm": 0.7971178889274597, "learning_rate": 0.00010550418237630546, "loss": 0.41924076080322265, "num_input_tokens_seen": 4445952, "step": 390, "train_runtime": 478.7928, "train_tokens_per_second": 9285.753 }, { "epoch": 1.6952789699570814, "grad_norm": 0.7272794246673584, "learning_rate": 0.00010288420090830804, "loss": 0.4299598693847656, "num_input_tokens_seen": 4498176, "step": 395, "train_runtime": 483.0335, "train_tokens_per_second": 9312.348 }, { "epoch": 1.7167381974248928, "grad_norm": 0.7986837029457092, "learning_rate": 0.00010026223614798911, "loss": 0.40703516006469725, "num_input_tokens_seen": 4548608, "step": 400, "train_runtime": 487.1484, "train_tokens_per_second": 9337.213 }, { "epoch": 1.7167381974248928, "eval_loss": 0.4985992908477783, "eval_runtime": 24.698, "eval_samples_per_second": 31.743, "eval_steps_per_second": 15.872, "num_input_tokens_seen": 4548608, "step": 400 } ], "logging_steps": 5, "max_steps": 699, "num_input_tokens_seen": 4548608, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.9720867698743706e+17, "train_batch_size": 32, "trial_name": null, "trial_params": null }