{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 625, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.016, "grad_norm": 0.0, "learning_rate": 7.936507936507936e-06, "loss": 0.103, "step": 10 }, { "epoch": 0.032, "grad_norm": 0.24380330741405487, "learning_rate": 1.5873015873015872e-05, "loss": 0.1262, "step": 20 }, { "epoch": 0.048, "grad_norm": 0.1586637645959854, "learning_rate": 2.380952380952381e-05, "loss": 0.2298, "step": 30 }, { "epoch": 0.064, "grad_norm": 0.282357394695282, "learning_rate": 3.1746031746031745e-05, "loss": 0.1866, "step": 40 }, { "epoch": 0.08, "grad_norm": 0.23044410347938538, "learning_rate": 3.968253968253968e-05, "loss": 0.2232, "step": 50 }, { "epoch": 0.096, "grad_norm": 0.0, "learning_rate": 4.761904761904762e-05, "loss": 0.1182, "step": 60 }, { "epoch": 0.112, "grad_norm": 0.0, "learning_rate": 4.9980862826611875e-05, "loss": 0.1124, "step": 70 }, { "epoch": 0.128, "grad_norm": 0.37043747305870056, "learning_rate": 4.988720025682995e-05, "loss": 0.083, "step": 80 }, { "epoch": 0.144, "grad_norm": 0.0, "learning_rate": 4.971578953735912e-05, "loss": 0.0396, "step": 90 }, { "epoch": 0.16, "grad_norm": 0.19477824866771698, "learning_rate": 4.946716615897932e-05, "loss": 0.0685, "step": 100 }, { "epoch": 0.176, "grad_norm": 0.0, "learning_rate": 4.9142106826480114e-05, "loss": 0.0525, "step": 110 }, { "epoch": 0.192, "grad_norm": 0.20189929008483887, "learning_rate": 4.874162703221823e-05, "loss": 0.0684, "step": 120 }, { "epoch": 0.208, "grad_norm": 0.2944314181804657, "learning_rate": 4.8266977883697515e-05, "loss": 0.0693, "step": 130 }, { "epoch": 0.224, "grad_norm": 0.0, "learning_rate": 4.771964219508222e-05, "loss": 0.0621, "step": 140 }, { "epoch": 0.24, "grad_norm": 0.0, "learning_rate": 4.710132985485355e-05, "loss": 0.0185, "step": 150 }, { "epoch": 0.256, "grad_norm": 0.0, "learning_rate": 4.6413972484081216e-05, "loss": 0.0492, "step": 160 }, { "epoch": 0.272, "grad_norm": 0.18733273446559906, "learning_rate": 4.5659717401997655e-05, "loss": 0.0541, "step": 170 }, { "epoch": 0.288, "grad_norm": 0.0, "learning_rate": 4.4840920917726426e-05, "loss": 0.0409, "step": 180 }, { "epoch": 0.304, "grad_norm": 0.16774742305278778, "learning_rate": 4.396014096912182e-05, "loss": 0.0752, "step": 190 }, { "epoch": 0.32, "grad_norm": 0.2138904631137848, "learning_rate": 4.302012913171584e-05, "loss": 0.0634, "step": 200 }, { "epoch": 0.336, "grad_norm": 0.16526997089385986, "learning_rate": 4.2023822022737016e-05, "loss": 0.0814, "step": 210 }, { "epoch": 0.352, "grad_norm": 0.0, "learning_rate": 4.0974332127054914e-05, "loss": 0.0329, "step": 220 }, { "epoch": 0.368, "grad_norm": 0.19396360218524933, "learning_rate": 3.9874938073710336e-05, "loss": 0.0575, "step": 230 }, { "epoch": 0.384, "grad_norm": 0.16870930790901184, "learning_rate": 3.872907439340758e-05, "loss": 0.0532, "step": 240 }, { "epoch": 0.4, "grad_norm": 0.18818065524101257, "learning_rate": 3.75403207889666e-05, "loss": 0.0422, "step": 250 }, { "epoch": 0.416, "grad_norm": 0.2430911660194397, "learning_rate": 3.631239095225417e-05, "loss": 0.0733, "step": 260 }, { "epoch": 0.432, "grad_norm": 0.17143367230892181, "learning_rate": 3.504912096253061e-05, "loss": 0.059, "step": 270 }, { "epoch": 0.448, "grad_norm": 0.19384104013442993, "learning_rate": 3.375445730245546e-05, "loss": 0.0717, "step": 280 }, { "epoch": 0.464, "grad_norm": 0.0, "learning_rate": 3.243244452919072e-05, "loss": 0.0457, "step": 290 }, { "epoch": 0.48, "grad_norm": 0.2219766527414322, "learning_rate": 3.108721263911706e-05, "loss": 0.0607, "step": 300 }, { "epoch": 0.496, "grad_norm": 0.0, "learning_rate": 2.9722964165636264e-05, "loss": 0.062, "step": 310 }, { "epoch": 0.512, "grad_norm": 0.2979666292667389, "learning_rate": 2.8343961050366275e-05, "loss": 0.0567, "step": 320 }, { "epoch": 0.528, "grad_norm": 0.2317102998495102, "learning_rate": 2.695451132874385e-05, "loss": 0.0493, "step": 330 }, { "epoch": 0.544, "grad_norm": 0.255515992641449, "learning_rate": 2.5558955671628965e-05, "loss": 0.029, "step": 340 }, { "epoch": 0.56, "grad_norm": 0.25291353464126587, "learning_rate": 2.416165382495565e-05, "loss": 0.0612, "step": 350 }, { "epoch": 0.576, "grad_norm": 0.0, "learning_rate": 2.2766970989791696e-05, "loss": 0.0281, "step": 360 }, { "epoch": 0.592, "grad_norm": 0.0, "learning_rate": 2.1379264185356544e-05, "loss": 0.0261, "step": 370 }, { "epoch": 0.608, "grad_norm": 0.3032894432544708, "learning_rate": 2.000286863759934e-05, "loss": 0.034, "step": 380 }, { "epoch": 0.624, "grad_norm": 0.27459245920181274, "learning_rate": 1.8642084235859765e-05, "loss": 0.0536, "step": 390 }, { "epoch": 0.64, "grad_norm": 0.0, "learning_rate": 1.7301162099921013e-05, "loss": 0.0276, "step": 400 }, { "epoch": 0.656, "grad_norm": 0.0, "learning_rate": 1.5984291299420117e-05, "loss": 0.0536, "step": 410 }, { "epoch": 0.672, "grad_norm": 0.0, "learning_rate": 1.4695585767104092e-05, "loss": 0.039, "step": 420 }, { "epoch": 0.688, "grad_norm": 0.0, "learning_rate": 1.3439071446815452e-05, "loss": 0.0548, "step": 430 }, { "epoch": 0.704, "grad_norm": 0.18401296436786652, "learning_rate": 1.2218673716356919e-05, "loss": 0.0259, "step": 440 }, { "epoch": 0.72, "grad_norm": 0.0, "learning_rate": 1.103820512452661e-05, "loss": 0.0562, "step": 450 }, { "epoch": 0.736, "grad_norm": 0.27832138538360596, "learning_rate": 9.901353480633468e-06, "loss": 0.0784, "step": 460 }, { "epoch": 0.752, "grad_norm": 0.3106365203857422, "learning_rate": 8.811670333701544e-06, "loss": 0.0416, "step": 470 }, { "epoch": 0.768, "grad_norm": 0.0, "learning_rate": 7.77255987735434e-06, "loss": 0.0327, "step": 480 }, { "epoch": 0.784, "grad_norm": 0.19409137964248657, "learning_rate": 6.787268315040604e-06, "loss": 0.0695, "step": 490 }, { "epoch": 0.8, "grad_norm": 0.0, "learning_rate": 5.8588737188248285e-06, "loss": 0.0474, "step": 500 }, { "epoch": 0.816, "grad_norm": 0.0, "learning_rate": 4.9902764134238165e-06, "loss": 0.0434, "step": 510 }, { "epoch": 0.832, "grad_norm": 0.22170156240463257, "learning_rate": 4.184189915529796e-06, "loss": 0.0694, "step": 520 }, { "epoch": 0.848, "grad_norm": 0.3862822651863098, "learning_rate": 3.443132456725817e-06, "loss": 0.0396, "step": 530 }, { "epoch": 0.864, "grad_norm": 0.0, "learning_rate": 2.769419116476052e-06, "loss": 0.0484, "step": 540 }, { "epoch": 0.88, "grad_norm": 0.0, "learning_rate": 2.165154589767651e-06, "loss": 0.0598, "step": 550 }, { "epoch": 0.896, "grad_norm": 0.24787913262844086, "learning_rate": 1.632226611998322e-06, "loss": 0.0469, "step": 560 }, { "epoch": 0.912, "grad_norm": 0.0, "learning_rate": 1.1723000616502167e-06, "loss": 0.0464, "step": 570 }, { "epoch": 0.928, "grad_norm": 0.0, "learning_rate": 7.868117591737583e-07, "loss": 0.0571, "step": 580 }, { "epoch": 0.944, "grad_norm": 0.2985147535800934, "learning_rate": 4.769659783295383e-07, "loss": 0.0645, "step": 590 }, { "epoch": 0.96, "grad_norm": 0.0, "learning_rate": 2.4373068401120356e-07, "loss": 0.0473, "step": 600 }, { "epoch": 0.976, "grad_norm": 0.1989932507276535, "learning_rate": 8.783450830224249e-08, "loss": 0.0658, "step": 610 }, { "epoch": 0.992, "grad_norm": 0.25899210572242737, "learning_rate": 9.764474213677654e-09, "loss": 0.0438, "step": 620 } ], "logging_steps": 10, "max_steps": 625, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.713640389083136e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }