MNLP_M3_mcqa_model / trainer_state.json
matverest's picture
Upload 15 files
5dc7cd4 verified
Raw
History Blame Contribute Delete
8.53 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 100,
"global_step": 890,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05629838142153413,
"grad_norm": 73.79827880859375,
"learning_rate": 6.741573033707865e-07,
"loss": 1.1142,
"step": 25
},
{
"epoch": 0.11259676284306826,
"grad_norm": 42.81636047363281,
"learning_rate": 1.3764044943820225e-06,
"loss": 0.9691,
"step": 50
},
{
"epoch": 0.1688951442646024,
"grad_norm": 47.96848678588867,
"learning_rate": 2.078651685393259e-06,
"loss": 0.8995,
"step": 75
},
{
"epoch": 0.22519352568613651,
"grad_norm": 31.566650390625,
"learning_rate": 2.7808988764044947e-06,
"loss": 0.8544,
"step": 100
},
{
"epoch": 0.22519352568613651,
"eval_loss": 0.8106070160865784,
"eval_runtime": 144.058,
"eval_samples_per_second": 17.639,
"eval_steps_per_second": 4.415,
"step": 100
},
{
"epoch": 0.28149190710767064,
"grad_norm": 38.754512786865234,
"learning_rate": 3.4831460674157306e-06,
"loss": 0.8218,
"step": 125
},
{
"epoch": 0.3377902885292048,
"grad_norm": 31.520471572875977,
"learning_rate": 4.185393258426967e-06,
"loss": 0.8258,
"step": 150
},
{
"epoch": 0.39408866995073893,
"grad_norm": 56.859840393066406,
"learning_rate": 4.8876404494382024e-06,
"loss": 0.7988,
"step": 175
},
{
"epoch": 0.45038705137227303,
"grad_norm": 30.1495361328125,
"learning_rate": 4.989275486268417e-06,
"loss": 0.8601,
"step": 200
},
{
"epoch": 0.45038705137227303,
"eval_loss": 0.7438946962356567,
"eval_runtime": 143.9368,
"eval_samples_per_second": 17.654,
"eval_steps_per_second": 4.419,
"step": 200
},
{
"epoch": 0.5066854327938072,
"grad_norm": 31.79728889465332,
"learning_rate": 4.948681495949055e-06,
"loss": 0.8459,
"step": 225
},
{
"epoch": 0.5629838142153413,
"grad_norm": 49.886512756347656,
"learning_rate": 4.878322110300771e-06,
"loss": 0.7708,
"step": 250
},
{
"epoch": 0.6192821956368755,
"grad_norm": 43.86843490600586,
"learning_rate": 4.779052595691355e-06,
"loss": 0.8003,
"step": 275
},
{
"epoch": 0.6755805770584096,
"grad_norm": 40.10922622680664,
"learning_rate": 4.652079640843434e-06,
"loss": 0.7687,
"step": 300
},
{
"epoch": 0.6755805770584096,
"eval_loss": 0.7006282806396484,
"eval_runtime": 144.0594,
"eval_samples_per_second": 17.639,
"eval_steps_per_second": 4.415,
"step": 300
},
{
"epoch": 0.7318789584799437,
"grad_norm": 44.42373275756836,
"learning_rate": 4.498946688709216e-06,
"loss": 0.7929,
"step": 325
},
{
"epoch": 0.7881773399014779,
"grad_norm": 28.532670974731445,
"learning_rate": 4.321515174867686e-06,
"loss": 0.7436,
"step": 350
},
{
"epoch": 0.844475721323012,
"grad_norm": 31.210020065307617,
"learning_rate": 4.121941900504316e-06,
"loss": 0.7638,
"step": 375
},
{
"epoch": 0.9007741027445461,
"grad_norm": 22.040390014648438,
"learning_rate": 3.902652815020175e-06,
"loss": 0.7845,
"step": 400
},
{
"epoch": 0.9007741027445461,
"eval_loss": 0.68995600938797,
"eval_runtime": 143.9705,
"eval_samples_per_second": 17.649,
"eval_steps_per_second": 4.418,
"step": 400
},
{
"epoch": 0.9570724841660803,
"grad_norm": 38.43577194213867,
"learning_rate": 3.6663135269607413e-06,
"loss": 0.7506,
"step": 425
},
{
"epoch": 1.011259676284307,
"grad_norm": 16.64950180053711,
"learning_rate": 3.415796901724183e-06,
"loss": 0.7202,
"step": 450
},
{
"epoch": 1.067558057705841,
"grad_norm": 43.190391540527344,
"learning_rate": 3.154148139921102e-06,
"loss": 0.4167,
"step": 475
},
{
"epoch": 1.123856439127375,
"grad_norm": 54.2507209777832,
"learning_rate": 2.884547760882115e-06,
"loss": 0.4801,
"step": 500
},
{
"epoch": 1.123856439127375,
"eval_loss": 0.8393383622169495,
"eval_runtime": 143.8302,
"eval_samples_per_second": 17.667,
"eval_steps_per_second": 4.422,
"step": 500
},
{
"epoch": 1.1801548205489092,
"grad_norm": 29.468156814575195,
"learning_rate": 2.610272941274012e-06,
"loss": 0.468,
"step": 525
},
{
"epoch": 1.2364532019704433,
"grad_norm": 54.59718704223633,
"learning_rate": 2.3346576787799995e-06,
"loss": 0.4276,
"step": 550
},
{
"epoch": 1.2927515833919774,
"grad_norm": 24.585559844970703,
"learning_rate": 2.0610522650816985e-06,
"loss": 0.4573,
"step": 575
},
{
"epoch": 1.3490499648135117,
"grad_norm": 46.79640579223633,
"learning_rate": 1.7927825607764699e-06,
"loss": 0.4322,
"step": 600
},
{
"epoch": 1.3490499648135117,
"eval_loss": 0.8045698404312134,
"eval_runtime": 143.8316,
"eval_samples_per_second": 17.666,
"eval_steps_per_second": 4.422,
"step": 600
},
{
"epoch": 1.4053483462350458,
"grad_norm": 38.788055419921875,
"learning_rate": 1.5331095672712463e-06,
"loss": 0.4275,
"step": 625
},
{
"epoch": 1.4616467276565799,
"grad_norm": 44.83256530761719,
"learning_rate": 1.2851897870841026e-06,
"loss": 0.4328,
"step": 650
},
{
"epoch": 1.517945109078114,
"grad_norm": 42.977962493896484,
"learning_rate": 1.0520368544011661e-06,
"loss": 0.5033,
"step": 675
},
{
"epoch": 1.574243490499648,
"grad_norm": 29.950496673583984,
"learning_rate": 8.364849022956395e-07,
"loss": 0.4405,
"step": 700
},
{
"epoch": 1.574243490499648,
"eval_loss": 0.7927849292755127,
"eval_runtime": 143.8064,
"eval_samples_per_second": 17.67,
"eval_steps_per_second": 4.423,
"step": 700
},
{
"epoch": 1.6305418719211824,
"grad_norm": 24.71552085876465,
"learning_rate": 6.41154111905393e-07,
"loss": 0.4053,
"step": 725
},
{
"epoch": 1.6868402533427163,
"grad_norm": 25.670047760009766,
"learning_rate": 4.684188623424088e-07,
"loss": 0.4095,
"step": 750
},
{
"epoch": 1.7431386347642506,
"grad_norm": 32.34583282470703,
"learning_rate": 3.203788684936535e-07,
"loss": 0.49,
"step": 775
},
{
"epoch": 1.7994370161857847,
"grad_norm": 20.85134506225586,
"learning_rate": 1.9883365755312357e-07,
"loss": 0.4536,
"step": 800
},
{
"epoch": 1.7994370161857847,
"eval_loss": 0.7712846398353577,
"eval_runtime": 143.8777,
"eval_samples_per_second": 17.661,
"eval_steps_per_second": 4.42,
"step": 800
},
{
"epoch": 1.8557353976073188,
"grad_norm": 41.842350006103516,
"learning_rate": 1.0526069454024651e-07,
"loss": 0.4295,
"step": 825
},
{
"epoch": 1.912033779028853,
"grad_norm": 64.68550109863281,
"learning_rate": 4.079742270388321e-08,
"loss": 0.4199,
"step": 850
},
{
"epoch": 1.968332160450387,
"grad_norm": 29.4891414642334,
"learning_rate": 6.2274371230905405e-09,
"loss": 0.5146,
"step": 875
}
],
"logging_steps": 25,
"max_steps": 890,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 300,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.5382222970290176e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}