{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.003111817993223152, "eval_steps": 500, "global_step": 900, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 3.4575755480257244e-05, "grad_norm": 38.12546920776367, "learning_rate": 4.8e-07, "loss": 9.3097, "step": 10 }, { "epoch": 6.915151096051449e-05, "grad_norm": 31.766887664794922, "learning_rate": 1.0799999999999998e-06, "loss": 9.293, "step": 20 }, { "epoch": 0.00010372726644077173, "grad_norm": 48.67866897583008, "learning_rate": 1.6799999999999998e-06, "loss": 9.2784, "step": 30 }, { "epoch": 0.00013830302192102898, "grad_norm": 33.25461959838867, "learning_rate": 2.2799999999999998e-06, "loss": 9.2793, "step": 40 }, { "epoch": 0.00017287877740128623, "grad_norm": 35.62735366821289, "learning_rate": 2.8799999999999995e-06, "loss": 9.2657, "step": 50 }, { "epoch": 0.00020745453288154345, "grad_norm": 43.818328857421875, "learning_rate": 3.4799999999999993e-06, "loss": 9.2616, "step": 60 }, { "epoch": 0.0002420302883618007, "grad_norm": 43.82963943481445, "learning_rate": 4.079999999999999e-06, "loss": 9.2633, "step": 70 }, { "epoch": 0.00027660604384205796, "grad_norm": 57.38799285888672, "learning_rate": 4.679999999999999e-06, "loss": 9.2308, "step": 80 }, { "epoch": 0.0003111817993223152, "grad_norm": 44.78755187988281, "learning_rate": 5.28e-06, "loss": 9.2083, "step": 90 }, { "epoch": 0.00034575755480257246, "grad_norm": 40.440338134765625, "learning_rate": 5.88e-06, "loss": 9.2418, "step": 100 }, { "epoch": 0.00038033331028282965, "grad_norm": 36.28009033203125, "learning_rate": 6.48e-06, "loss": 9.2208, "step": 110 }, { "epoch": 0.0004149090657630869, "grad_norm": 42.1943473815918, "learning_rate": 7.079999999999999e-06, "loss": 9.2197, "step": 120 }, { "epoch": 0.00044948482124334416, "grad_norm": 37.897483825683594, "learning_rate": 7.68e-06, "loss": 9.2271, "step": 130 }, { "epoch": 0.0004840605767236014, "grad_norm": 33.77066421508789, "learning_rate": 8.279999999999999e-06, "loss": 9.2311, "step": 140 }, { "epoch": 0.0005186363322038587, "grad_norm": 34.798553466796875, "learning_rate": 8.88e-06, "loss": 9.2079, "step": 150 }, { "epoch": 0.0005532120876841159, "grad_norm": 39.236812591552734, "learning_rate": 9.48e-06, "loss": 9.2186, "step": 160 }, { "epoch": 0.0005877878431643732, "grad_norm": 37.878868103027344, "learning_rate": 1.0079999999999998e-05, "loss": 9.2176, "step": 170 }, { "epoch": 0.0006223635986446304, "grad_norm": 64.34676361083984, "learning_rate": 1.068e-05, "loss": 9.2086, "step": 180 }, { "epoch": 0.0006569393541248877, "grad_norm": 35.60507583618164, "learning_rate": 1.1279999999999999e-05, "loss": 9.2045, "step": 190 }, { "epoch": 0.0006915151096051449, "grad_norm": 45.516971588134766, "learning_rate": 1.188e-05, "loss": 9.2144, "step": 200 }, { "epoch": 0.0007260908650854022, "grad_norm": 33.20392608642578, "learning_rate": 1.2479999999999999e-05, "loss": 9.1846, "step": 210 }, { "epoch": 0.0007606666205656593, "grad_norm": 33.04153060913086, "learning_rate": 1.3019999999999999e-05, "loss": 9.1875, "step": 220 }, { "epoch": 0.0007952423760459166, "grad_norm": 29.512754440307617, "learning_rate": 1.362e-05, "loss": 9.1849, "step": 230 }, { "epoch": 0.0008298181315261738, "grad_norm": 24.111255645751953, "learning_rate": 1.4219999999999998e-05, "loss": 9.2074, "step": 240 }, { "epoch": 0.0008643938870064311, "grad_norm": 36.84242630004883, "learning_rate": 1.4819999999999999e-05, "loss": 9.1818, "step": 250 }, { "epoch": 0.0008989696424866883, "grad_norm": 22.629037857055664, "learning_rate": 1.5419999999999998e-05, "loss": 9.1991, "step": 260 }, { "epoch": 0.0009335453979669456, "grad_norm": 28.257951736450195, "learning_rate": 1.602e-05, "loss": 9.1579, "step": 270 }, { "epoch": 0.0009681211534472028, "grad_norm": 26.29328155517578, "learning_rate": 1.6619999999999997e-05, "loss": 9.1753, "step": 280 }, { "epoch": 0.00100269690892746, "grad_norm": 30.55463981628418, "learning_rate": 1.7219999999999998e-05, "loss": 9.1663, "step": 290 }, { "epoch": 0.0010372726644077173, "grad_norm": 30.852642059326172, "learning_rate": 1.782e-05, "loss": 9.1624, "step": 300 }, { "epoch": 0.0010718484198879745, "grad_norm": 30.8385009765625, "learning_rate": 1.842e-05, "loss": 9.1754, "step": 310 }, { "epoch": 0.0011064241753682318, "grad_norm": 16.846324920654297, "learning_rate": 1.9019999999999997e-05, "loss": 9.1774, "step": 320 }, { "epoch": 0.001140999930848489, "grad_norm": 26.020891189575195, "learning_rate": 1.962e-05, "loss": 9.1461, "step": 330 }, { "epoch": 0.0011755756863287463, "grad_norm": 24.087093353271484, "learning_rate": 2.022e-05, "loss": 9.1698, "step": 340 }, { "epoch": 0.0012101514418090035, "grad_norm": 22.612030029296875, "learning_rate": 2.082e-05, "loss": 9.1564, "step": 350 }, { "epoch": 0.0012447271972892608, "grad_norm": 24.23309898376465, "learning_rate": 2.1419999999999998e-05, "loss": 9.1407, "step": 360 }, { "epoch": 0.001279302952769518, "grad_norm": 19.798912048339844, "learning_rate": 2.202e-05, "loss": 9.1916, "step": 370 }, { "epoch": 0.0013138787082497753, "grad_norm": 17.621305465698242, "learning_rate": 2.2619999999999997e-05, "loss": 9.1724, "step": 380 }, { "epoch": 0.0013484544637300325, "grad_norm": 19.028974533081055, "learning_rate": 2.3219999999999998e-05, "loss": 9.1416, "step": 390 }, { "epoch": 0.0013830302192102898, "grad_norm": 15.816458702087402, "learning_rate": 2.382e-05, "loss": 9.1704, "step": 400 }, { "epoch": 0.001417605974690547, "grad_norm": 19.060916900634766, "learning_rate": 2.4419999999999997e-05, "loss": 9.1527, "step": 410 }, { "epoch": 0.0014521817301708043, "grad_norm": 23.854291915893555, "learning_rate": 2.5019999999999998e-05, "loss": 9.146, "step": 420 }, { "epoch": 0.0014867574856510615, "grad_norm": 20.823823928833008, "learning_rate": 2.562e-05, "loss": 9.1528, "step": 430 }, { "epoch": 0.0015213332411313186, "grad_norm": 20.012248992919922, "learning_rate": 2.622e-05, "loss": 9.133, "step": 440 }, { "epoch": 0.001555908996611576, "grad_norm": 17.968521118164062, "learning_rate": 2.6819999999999997e-05, "loss": 9.1451, "step": 450 }, { "epoch": 0.0015904847520918331, "grad_norm": 19.263395309448242, "learning_rate": 2.7419999999999995e-05, "loss": 9.1414, "step": 460 }, { "epoch": 0.0016250605075720905, "grad_norm": 19.886655807495117, "learning_rate": 2.8019999999999996e-05, "loss": 9.1132, "step": 470 }, { "epoch": 0.0016596362630523476, "grad_norm": 20.179471969604492, "learning_rate": 2.8619999999999997e-05, "loss": 9.1274, "step": 480 }, { "epoch": 0.001694212018532605, "grad_norm": 16.05131721496582, "learning_rate": 2.9219999999999998e-05, "loss": 9.1407, "step": 490 }, { "epoch": 0.0017287877740128621, "grad_norm": 16.787809371948242, "learning_rate": 2.982e-05, "loss": 9.1274, "step": 500 }, { "epoch": 0.0017633635294931195, "grad_norm": 14.712662696838379, "learning_rate": 3.042e-05, "loss": 9.1694, "step": 510 }, { "epoch": 0.0017979392849733766, "grad_norm": 14.417969703674316, "learning_rate": 3.102e-05, "loss": 9.1474, "step": 520 }, { "epoch": 0.001832515040453634, "grad_norm": 29.00182342529297, "learning_rate": 3.161999999999999e-05, "loss": 9.1549, "step": 530 }, { "epoch": 0.0018670907959338911, "grad_norm": 16.824987411499023, "learning_rate": 3.221999999999999e-05, "loss": 9.1384, "step": 540 }, { "epoch": 0.0019016665514141485, "grad_norm": 18.04323387145996, "learning_rate": 3.2819999999999994e-05, "loss": 9.1522, "step": 550 }, { "epoch": 0.0019362423068944056, "grad_norm": 14.293987274169922, "learning_rate": 3.3419999999999995e-05, "loss": 9.1301, "step": 560 }, { "epoch": 0.0019708180623746628, "grad_norm": 19.81171226501465, "learning_rate": 3.4019999999999996e-05, "loss": 9.1233, "step": 570 }, { "epoch": 0.00200539381785492, "grad_norm": 14.640559196472168, "learning_rate": 3.462e-05, "loss": 9.1311, "step": 580 }, { "epoch": 0.0020399695733351775, "grad_norm": 18.38323974609375, "learning_rate": 3.522e-05, "loss": 9.1222, "step": 590 }, { "epoch": 0.0020745453288154346, "grad_norm": 17.136762619018555, "learning_rate": 3.582e-05, "loss": 9.1199, "step": 600 }, { "epoch": 0.0021091210842956918, "grad_norm": 15.868051528930664, "learning_rate": 3.6419999999999994e-05, "loss": 9.1615, "step": 610 }, { "epoch": 0.002143696839775949, "grad_norm": 12.776758193969727, "learning_rate": 3.7019999999999995e-05, "loss": 9.1367, "step": 620 }, { "epoch": 0.0021782725952562065, "grad_norm": 24.72905731201172, "learning_rate": 3.762e-05, "loss": 9.0972, "step": 630 }, { "epoch": 0.0022128483507364636, "grad_norm": 10.394266128540039, "learning_rate": 3.822e-05, "loss": 9.1424, "step": 640 }, { "epoch": 0.002247424106216721, "grad_norm": 23.022293090820312, "learning_rate": 3.881999999999999e-05, "loss": 9.1513, "step": 650 }, { "epoch": 0.002281999861696978, "grad_norm": 13.62468147277832, "learning_rate": 3.941999999999999e-05, "loss": 9.1056, "step": 660 }, { "epoch": 0.0023165756171772355, "grad_norm": 10.622007369995117, "learning_rate": 4.001999999999999e-05, "loss": 9.1389, "step": 670 }, { "epoch": 0.0023511513726574926, "grad_norm": 12.142419815063477, "learning_rate": 4.0619999999999994e-05, "loss": 9.1279, "step": 680 }, { "epoch": 0.00238572712813775, "grad_norm": 11.485246658325195, "learning_rate": 4.1219999999999995e-05, "loss": 9.1175, "step": 690 }, { "epoch": 0.002420302883618007, "grad_norm": 10.780238151550293, "learning_rate": 4.1819999999999996e-05, "loss": 9.1417, "step": 700 }, { "epoch": 0.0024548786390982645, "grad_norm": 11.59386157989502, "learning_rate": 4.242e-05, "loss": 9.1246, "step": 710 }, { "epoch": 0.0024894543945785217, "grad_norm": 24.624088287353516, "learning_rate": 4.302e-05, "loss": 9.121, "step": 720 }, { "epoch": 0.002524030150058779, "grad_norm": 11.020679473876953, "learning_rate": 4.362e-05, "loss": 9.1379, "step": 730 }, { "epoch": 0.002558605905539036, "grad_norm": 14.969200134277344, "learning_rate": 4.422e-05, "loss": 9.1268, "step": 740 }, { "epoch": 0.002593181661019293, "grad_norm": 14.996768951416016, "learning_rate": 4.4819999999999994e-05, "loss": 9.1071, "step": 750 }, { "epoch": 0.0026277574164995507, "grad_norm": 16.976953506469727, "learning_rate": 4.5419999999999995e-05, "loss": 9.1073, "step": 760 }, { "epoch": 0.002662333171979808, "grad_norm": 17.404489517211914, "learning_rate": 4.6019999999999996e-05, "loss": 9.0887, "step": 770 }, { "epoch": 0.002696908927460065, "grad_norm": 11.283190727233887, "learning_rate": 4.662e-05, "loss": 9.1061, "step": 780 }, { "epoch": 0.002731484682940322, "grad_norm": 30.573930740356445, "learning_rate": 4.722e-05, "loss": 9.0974, "step": 790 }, { "epoch": 0.0027660604384205797, "grad_norm": 13.684494972229004, "learning_rate": 4.781999999999999e-05, "loss": 9.1181, "step": 800 }, { "epoch": 0.002800636193900837, "grad_norm": 8.140137672424316, "learning_rate": 4.8419999999999994e-05, "loss": 9.1429, "step": 810 }, { "epoch": 0.002835211949381094, "grad_norm": 11.793691635131836, "learning_rate": 4.9019999999999995e-05, "loss": 9.1238, "step": 820 }, { "epoch": 0.002869787704861351, "grad_norm": 10.155129432678223, "learning_rate": 4.956e-05, "loss": 9.1099, "step": 830 }, { "epoch": 0.0029043634603416087, "grad_norm": 18.905136108398438, "learning_rate": 5.0159999999999994e-05, "loss": 9.118, "step": 840 }, { "epoch": 0.002938939215821866, "grad_norm": 14.191570281982422, "learning_rate": 5.0759999999999995e-05, "loss": 9.0971, "step": 850 }, { "epoch": 0.002973514971302123, "grad_norm": 13.144892692565918, "learning_rate": 5.1359999999999996e-05, "loss": 9.1168, "step": 860 }, { "epoch": 0.00300809072678238, "grad_norm": 17.27440643310547, "learning_rate": 5.195999999999999e-05, "loss": 9.1007, "step": 870 }, { "epoch": 0.0030426664822626372, "grad_norm": 14.852960586547852, "learning_rate": 5.255999999999999e-05, "loss": 9.1023, "step": 880 }, { "epoch": 0.003077242237742895, "grad_norm": 12.116819381713867, "learning_rate": 5.315999999999999e-05, "loss": 9.1209, "step": 890 }, { "epoch": 0.003111817993223152, "grad_norm": 13.627985000610352, "learning_rate": 5.3759999999999994e-05, "loss": 9.1106, "step": 900 } ], "logging_steps": 10, "max_steps": 1000000, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2860446038016000.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }