| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.0, |
| "eval_steps": 100, |
| "global_step": 890, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.05629838142153413, |
| "grad_norm": 73.79827880859375, |
| "learning_rate": 6.741573033707865e-07, |
| "loss": 1.1142, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.11259676284306826, |
| "grad_norm": 42.81636047363281, |
| "learning_rate": 1.3764044943820225e-06, |
| "loss": 0.9691, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.1688951442646024, |
| "grad_norm": 47.96848678588867, |
| "learning_rate": 2.078651685393259e-06, |
| "loss": 0.8995, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.22519352568613651, |
| "grad_norm": 31.566650390625, |
| "learning_rate": 2.7808988764044947e-06, |
| "loss": 0.8544, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.22519352568613651, |
| "eval_loss": 0.8106070160865784, |
| "eval_runtime": 144.058, |
| "eval_samples_per_second": 17.639, |
| "eval_steps_per_second": 4.415, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.28149190710767064, |
| "grad_norm": 38.754512786865234, |
| "learning_rate": 3.4831460674157306e-06, |
| "loss": 0.8218, |
| "step": 125 |
| }, |
| { |
| "epoch": 0.3377902885292048, |
| "grad_norm": 31.520471572875977, |
| "learning_rate": 4.185393258426967e-06, |
| "loss": 0.8258, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.39408866995073893, |
| "grad_norm": 56.859840393066406, |
| "learning_rate": 4.8876404494382024e-06, |
| "loss": 0.7988, |
| "step": 175 |
| }, |
| { |
| "epoch": 0.45038705137227303, |
| "grad_norm": 30.1495361328125, |
| "learning_rate": 4.989275486268417e-06, |
| "loss": 0.8601, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.45038705137227303, |
| "eval_loss": 0.7438946962356567, |
| "eval_runtime": 143.9368, |
| "eval_samples_per_second": 17.654, |
| "eval_steps_per_second": 4.419, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.5066854327938072, |
| "grad_norm": 31.79728889465332, |
| "learning_rate": 4.948681495949055e-06, |
| "loss": 0.8459, |
| "step": 225 |
| }, |
| { |
| "epoch": 0.5629838142153413, |
| "grad_norm": 49.886512756347656, |
| "learning_rate": 4.878322110300771e-06, |
| "loss": 0.7708, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.6192821956368755, |
| "grad_norm": 43.86843490600586, |
| "learning_rate": 4.779052595691355e-06, |
| "loss": 0.8003, |
| "step": 275 |
| }, |
| { |
| "epoch": 0.6755805770584096, |
| "grad_norm": 40.10922622680664, |
| "learning_rate": 4.652079640843434e-06, |
| "loss": 0.7687, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.6755805770584096, |
| "eval_loss": 0.7006282806396484, |
| "eval_runtime": 144.0594, |
| "eval_samples_per_second": 17.639, |
| "eval_steps_per_second": 4.415, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.7318789584799437, |
| "grad_norm": 44.42373275756836, |
| "learning_rate": 4.498946688709216e-06, |
| "loss": 0.7929, |
| "step": 325 |
| }, |
| { |
| "epoch": 0.7881773399014779, |
| "grad_norm": 28.532670974731445, |
| "learning_rate": 4.321515174867686e-06, |
| "loss": 0.7436, |
| "step": 350 |
| }, |
| { |
| "epoch": 0.844475721323012, |
| "grad_norm": 31.210020065307617, |
| "learning_rate": 4.121941900504316e-06, |
| "loss": 0.7638, |
| "step": 375 |
| }, |
| { |
| "epoch": 0.9007741027445461, |
| "grad_norm": 22.040390014648438, |
| "learning_rate": 3.902652815020175e-06, |
| "loss": 0.7845, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.9007741027445461, |
| "eval_loss": 0.68995600938797, |
| "eval_runtime": 143.9705, |
| "eval_samples_per_second": 17.649, |
| "eval_steps_per_second": 4.418, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.9570724841660803, |
| "grad_norm": 38.43577194213867, |
| "learning_rate": 3.6663135269607413e-06, |
| "loss": 0.7506, |
| "step": 425 |
| }, |
| { |
| "epoch": 1.011259676284307, |
| "grad_norm": 16.64950180053711, |
| "learning_rate": 3.415796901724183e-06, |
| "loss": 0.7202, |
| "step": 450 |
| }, |
| { |
| "epoch": 1.067558057705841, |
| "grad_norm": 43.190391540527344, |
| "learning_rate": 3.154148139921102e-06, |
| "loss": 0.4167, |
| "step": 475 |
| }, |
| { |
| "epoch": 1.123856439127375, |
| "grad_norm": 54.2507209777832, |
| "learning_rate": 2.884547760882115e-06, |
| "loss": 0.4801, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.123856439127375, |
| "eval_loss": 0.8393383622169495, |
| "eval_runtime": 143.8302, |
| "eval_samples_per_second": 17.667, |
| "eval_steps_per_second": 4.422, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.1801548205489092, |
| "grad_norm": 29.468156814575195, |
| "learning_rate": 2.610272941274012e-06, |
| "loss": 0.468, |
| "step": 525 |
| }, |
| { |
| "epoch": 1.2364532019704433, |
| "grad_norm": 54.59718704223633, |
| "learning_rate": 2.3346576787799995e-06, |
| "loss": 0.4276, |
| "step": 550 |
| }, |
| { |
| "epoch": 1.2927515833919774, |
| "grad_norm": 24.585559844970703, |
| "learning_rate": 2.0610522650816985e-06, |
| "loss": 0.4573, |
| "step": 575 |
| }, |
| { |
| "epoch": 1.3490499648135117, |
| "grad_norm": 46.79640579223633, |
| "learning_rate": 1.7927825607764699e-06, |
| "loss": 0.4322, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.3490499648135117, |
| "eval_loss": 0.8045698404312134, |
| "eval_runtime": 143.8316, |
| "eval_samples_per_second": 17.666, |
| "eval_steps_per_second": 4.422, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.4053483462350458, |
| "grad_norm": 38.788055419921875, |
| "learning_rate": 1.5331095672712463e-06, |
| "loss": 0.4275, |
| "step": 625 |
| }, |
| { |
| "epoch": 1.4616467276565799, |
| "grad_norm": 44.83256530761719, |
| "learning_rate": 1.2851897870841026e-06, |
| "loss": 0.4328, |
| "step": 650 |
| }, |
| { |
| "epoch": 1.517945109078114, |
| "grad_norm": 42.977962493896484, |
| "learning_rate": 1.0520368544011661e-06, |
| "loss": 0.5033, |
| "step": 675 |
| }, |
| { |
| "epoch": 1.574243490499648, |
| "grad_norm": 29.950496673583984, |
| "learning_rate": 8.364849022956395e-07, |
| "loss": 0.4405, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.574243490499648, |
| "eval_loss": 0.7927849292755127, |
| "eval_runtime": 143.8064, |
| "eval_samples_per_second": 17.67, |
| "eval_steps_per_second": 4.423, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.6305418719211824, |
| "grad_norm": 24.71552085876465, |
| "learning_rate": 6.41154111905393e-07, |
| "loss": 0.4053, |
| "step": 725 |
| }, |
| { |
| "epoch": 1.6868402533427163, |
| "grad_norm": 25.670047760009766, |
| "learning_rate": 4.684188623424088e-07, |
| "loss": 0.4095, |
| "step": 750 |
| }, |
| { |
| "epoch": 1.7431386347642506, |
| "grad_norm": 32.34583282470703, |
| "learning_rate": 3.203788684936535e-07, |
| "loss": 0.49, |
| "step": 775 |
| }, |
| { |
| "epoch": 1.7994370161857847, |
| "grad_norm": 20.85134506225586, |
| "learning_rate": 1.9883365755312357e-07, |
| "loss": 0.4536, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.7994370161857847, |
| "eval_loss": 0.7712846398353577, |
| "eval_runtime": 143.8777, |
| "eval_samples_per_second": 17.661, |
| "eval_steps_per_second": 4.42, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.8557353976073188, |
| "grad_norm": 41.842350006103516, |
| "learning_rate": 1.0526069454024651e-07, |
| "loss": 0.4295, |
| "step": 825 |
| }, |
| { |
| "epoch": 1.912033779028853, |
| "grad_norm": 64.68550109863281, |
| "learning_rate": 4.079742270388321e-08, |
| "loss": 0.4199, |
| "step": 850 |
| }, |
| { |
| "epoch": 1.968332160450387, |
| "grad_norm": 29.4891414642334, |
| "learning_rate": 6.2274371230905405e-09, |
| "loss": 0.5146, |
| "step": 875 |
| } |
| ], |
| "logging_steps": 25, |
| "max_steps": 890, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 2, |
| "save_steps": 300, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.5382222970290176e+17, |
| "train_batch_size": 2, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|