{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 100, "global_step": 890, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05629838142153413, "grad_norm": 73.79827880859375, "learning_rate": 6.741573033707865e-07, "loss": 1.1142, "step": 25 }, { "epoch": 0.11259676284306826, "grad_norm": 42.81636047363281, "learning_rate": 1.3764044943820225e-06, "loss": 0.9691, "step": 50 }, { "epoch": 0.1688951442646024, "grad_norm": 47.96848678588867, "learning_rate": 2.078651685393259e-06, "loss": 0.8995, "step": 75 }, { "epoch": 0.22519352568613651, "grad_norm": 31.566650390625, "learning_rate": 2.7808988764044947e-06, "loss": 0.8544, "step": 100 }, { "epoch": 0.22519352568613651, "eval_loss": 0.8106070160865784, "eval_runtime": 144.058, "eval_samples_per_second": 17.639, "eval_steps_per_second": 4.415, "step": 100 }, { "epoch": 0.28149190710767064, "grad_norm": 38.754512786865234, "learning_rate": 3.4831460674157306e-06, "loss": 0.8218, "step": 125 }, { "epoch": 0.3377902885292048, "grad_norm": 31.520471572875977, "learning_rate": 4.185393258426967e-06, "loss": 0.8258, "step": 150 }, { "epoch": 0.39408866995073893, "grad_norm": 56.859840393066406, "learning_rate": 4.8876404494382024e-06, "loss": 0.7988, "step": 175 }, { "epoch": 0.45038705137227303, "grad_norm": 30.1495361328125, "learning_rate": 4.989275486268417e-06, "loss": 0.8601, "step": 200 }, { "epoch": 0.45038705137227303, "eval_loss": 0.7438946962356567, "eval_runtime": 143.9368, "eval_samples_per_second": 17.654, "eval_steps_per_second": 4.419, "step": 200 }, { "epoch": 0.5066854327938072, "grad_norm": 31.79728889465332, "learning_rate": 4.948681495949055e-06, "loss": 0.8459, "step": 225 }, { "epoch": 0.5629838142153413, "grad_norm": 49.886512756347656, "learning_rate": 4.878322110300771e-06, "loss": 0.7708, "step": 250 }, { "epoch": 0.6192821956368755, "grad_norm": 43.86843490600586, "learning_rate": 4.779052595691355e-06, "loss": 0.8003, "step": 275 }, { "epoch": 0.6755805770584096, "grad_norm": 40.10922622680664, "learning_rate": 4.652079640843434e-06, "loss": 0.7687, "step": 300 }, { "epoch": 0.6755805770584096, "eval_loss": 0.7006282806396484, "eval_runtime": 144.0594, "eval_samples_per_second": 17.639, "eval_steps_per_second": 4.415, "step": 300 }, { "epoch": 0.7318789584799437, "grad_norm": 44.42373275756836, "learning_rate": 4.498946688709216e-06, "loss": 0.7929, "step": 325 }, { "epoch": 0.7881773399014779, "grad_norm": 28.532670974731445, "learning_rate": 4.321515174867686e-06, "loss": 0.7436, "step": 350 }, { "epoch": 0.844475721323012, "grad_norm": 31.210020065307617, "learning_rate": 4.121941900504316e-06, "loss": 0.7638, "step": 375 }, { "epoch": 0.9007741027445461, "grad_norm": 22.040390014648438, "learning_rate": 3.902652815020175e-06, "loss": 0.7845, "step": 400 }, { "epoch": 0.9007741027445461, "eval_loss": 0.68995600938797, "eval_runtime": 143.9705, "eval_samples_per_second": 17.649, "eval_steps_per_second": 4.418, "step": 400 }, { "epoch": 0.9570724841660803, "grad_norm": 38.43577194213867, "learning_rate": 3.6663135269607413e-06, "loss": 0.7506, "step": 425 }, { "epoch": 1.011259676284307, "grad_norm": 16.64950180053711, "learning_rate": 3.415796901724183e-06, "loss": 0.7202, "step": 450 }, { "epoch": 1.067558057705841, "grad_norm": 43.190391540527344, "learning_rate": 3.154148139921102e-06, "loss": 0.4167, "step": 475 }, { "epoch": 1.123856439127375, "grad_norm": 54.2507209777832, "learning_rate": 2.884547760882115e-06, "loss": 0.4801, "step": 500 }, { "epoch": 1.123856439127375, "eval_loss": 0.8393383622169495, "eval_runtime": 143.8302, "eval_samples_per_second": 17.667, "eval_steps_per_second": 4.422, "step": 500 }, { "epoch": 1.1801548205489092, "grad_norm": 29.468156814575195, "learning_rate": 2.610272941274012e-06, "loss": 0.468, "step": 525 }, { "epoch": 1.2364532019704433, "grad_norm": 54.59718704223633, "learning_rate": 2.3346576787799995e-06, "loss": 0.4276, "step": 550 }, { "epoch": 1.2927515833919774, "grad_norm": 24.585559844970703, "learning_rate": 2.0610522650816985e-06, "loss": 0.4573, "step": 575 }, { "epoch": 1.3490499648135117, "grad_norm": 46.79640579223633, "learning_rate": 1.7927825607764699e-06, "loss": 0.4322, "step": 600 }, { "epoch": 1.3490499648135117, "eval_loss": 0.8045698404312134, "eval_runtime": 143.8316, "eval_samples_per_second": 17.666, "eval_steps_per_second": 4.422, "step": 600 }, { "epoch": 1.4053483462350458, "grad_norm": 38.788055419921875, "learning_rate": 1.5331095672712463e-06, "loss": 0.4275, "step": 625 }, { "epoch": 1.4616467276565799, "grad_norm": 44.83256530761719, "learning_rate": 1.2851897870841026e-06, "loss": 0.4328, "step": 650 }, { "epoch": 1.517945109078114, "grad_norm": 42.977962493896484, "learning_rate": 1.0520368544011661e-06, "loss": 0.5033, "step": 675 }, { "epoch": 1.574243490499648, "grad_norm": 29.950496673583984, "learning_rate": 8.364849022956395e-07, "loss": 0.4405, "step": 700 }, { "epoch": 1.574243490499648, "eval_loss": 0.7927849292755127, "eval_runtime": 143.8064, "eval_samples_per_second": 17.67, "eval_steps_per_second": 4.423, "step": 700 }, { "epoch": 1.6305418719211824, "grad_norm": 24.71552085876465, "learning_rate": 6.41154111905393e-07, "loss": 0.4053, "step": 725 }, { "epoch": 1.6868402533427163, "grad_norm": 25.670047760009766, "learning_rate": 4.684188623424088e-07, "loss": 0.4095, "step": 750 }, { "epoch": 1.7431386347642506, "grad_norm": 32.34583282470703, "learning_rate": 3.203788684936535e-07, "loss": 0.49, "step": 775 }, { "epoch": 1.7994370161857847, "grad_norm": 20.85134506225586, "learning_rate": 1.9883365755312357e-07, "loss": 0.4536, "step": 800 }, { "epoch": 1.7994370161857847, "eval_loss": 0.7712846398353577, "eval_runtime": 143.8777, "eval_samples_per_second": 17.661, "eval_steps_per_second": 4.42, "step": 800 }, { "epoch": 1.8557353976073188, "grad_norm": 41.842350006103516, "learning_rate": 1.0526069454024651e-07, "loss": 0.4295, "step": 825 }, { "epoch": 1.912033779028853, "grad_norm": 64.68550109863281, "learning_rate": 4.079742270388321e-08, "loss": 0.4199, "step": 850 }, { "epoch": 1.968332160450387, "grad_norm": 29.4891414642334, "learning_rate": 6.2274371230905405e-09, "loss": 0.5146, "step": 875 } ], "logging_steps": 25, "max_steps": 890, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.5382222970290176e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }