ernie_easy_model / trainer_state.json
phmei96's picture
Upload 7 files
981d736 verified
Raw
History Blame Contribute Delete
8.66 kB
{
"best_metric": 0.09516655653715134,
"best_model_checkpoint": "/home/philipp.meier/author_writing_sentences/outputs/specific/ernie/macro/easy_512/checkpoint-1512",
"epoch": 9.999586811007354,
"eval_steps": 500,
"global_step": 15120,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.3305511941161887,
"grad_norm": 2.844763994216919,
"learning_rate": 4.834656084656085e-05,
"loss": 0.1778,
"step": 500
},
{
"epoch": 0.6611023882323774,
"grad_norm": 2.216350555419922,
"learning_rate": 4.669312169312169e-05,
"loss": 0.1443,
"step": 1000
},
{
"epoch": 0.9916535823485663,
"grad_norm": 8.136266708374023,
"learning_rate": 4.503968253968254e-05,
"loss": 0.1292,
"step": 1500
},
{
"epoch": 0.9995868110073548,
"eval_f1": 0.9527436209888852,
"eval_loss": 0.09516655653715134,
"eval_runtime": 88.8726,
"eval_samples_per_second": 57.599,
"eval_steps_per_second": 14.403,
"step": 1512
},
{
"epoch": 1.3226179654574002,
"grad_norm": 8.809748649597168,
"learning_rate": 4.3386243386243384e-05,
"loss": 0.0895,
"step": 2000
},
{
"epoch": 1.6531691595735891,
"grad_norm": 0.4540178179740906,
"learning_rate": 4.173280423280423e-05,
"loss": 0.0849,
"step": 2500
},
{
"epoch": 1.9837203536897778,
"grad_norm": 14.030110359191895,
"learning_rate": 4.007936507936508e-05,
"loss": 0.085,
"step": 3000
},
{
"epoch": 1.999586811007355,
"eval_f1": 0.9506637797905222,
"eval_loss": 0.12027066200971603,
"eval_runtime": 88.8085,
"eval_samples_per_second": 57.641,
"eval_steps_per_second": 14.413,
"step": 3024
},
{
"epoch": 2.3146847367986116,
"grad_norm": 0.08342691510915756,
"learning_rate": 3.8425925925925924e-05,
"loss": 0.0554,
"step": 3500
},
{
"epoch": 2.6452359309148004,
"grad_norm": 0.12781363725662231,
"learning_rate": 3.677248677248677e-05,
"loss": 0.0603,
"step": 4000
},
{
"epoch": 2.975787125030989,
"grad_norm": 0.14807908236980438,
"learning_rate": 3.511904761904762e-05,
"loss": 0.0578,
"step": 4500
},
{
"epoch": 2.999586811007355,
"eval_f1": 0.9429987599618843,
"eval_loss": 0.1923331469297409,
"eval_runtime": 88.636,
"eval_samples_per_second": 57.753,
"eval_steps_per_second": 14.441,
"step": 4536
},
{
"epoch": 3.3067515081398233,
"grad_norm": 0.13493597507476807,
"learning_rate": 3.3465608465608464e-05,
"loss": 0.0336,
"step": 5000
},
{
"epoch": 3.637302702256012,
"grad_norm": 5.746713638305664,
"learning_rate": 3.181216931216931e-05,
"loss": 0.0385,
"step": 5500
},
{
"epoch": 3.9678538963722008,
"grad_norm": 8.010566711425781,
"learning_rate": 3.0158730158730158e-05,
"loss": 0.0397,
"step": 6000
},
{
"epoch": 3.999586811007355,
"eval_f1": 0.9502365475637948,
"eval_loss": 0.14363159239292145,
"eval_runtime": 88.7191,
"eval_samples_per_second": 57.699,
"eval_steps_per_second": 14.428,
"step": 6048
},
{
"epoch": 4.298818279481035,
"grad_norm": 24.7757511138916,
"learning_rate": 2.8505291005291007e-05,
"loss": 0.0297,
"step": 6500
},
{
"epoch": 4.629369473597223,
"grad_norm": 24.24225616455078,
"learning_rate": 2.6851851851851855e-05,
"loss": 0.024,
"step": 7000
},
{
"epoch": 4.959920667713412,
"grad_norm": 0.18736685812473297,
"learning_rate": 2.5198412698412697e-05,
"loss": 0.0257,
"step": 7500
},
{
"epoch": 4.9995868110073545,
"eval_f1": 0.9588887459263877,
"eval_loss": 0.18245960772037506,
"eval_runtime": 88.6444,
"eval_samples_per_second": 57.748,
"eval_steps_per_second": 14.44,
"step": 7560
},
{
"epoch": 5.290885050822246,
"grad_norm": 0.19512176513671875,
"learning_rate": 2.3544973544973546e-05,
"loss": 0.0184,
"step": 8000
},
{
"epoch": 5.621436244938435,
"grad_norm": 0.03989516571164131,
"learning_rate": 2.1891534391534395e-05,
"loss": 0.0205,
"step": 8500
},
{
"epoch": 5.951987439054624,
"grad_norm": 0.006726603023707867,
"learning_rate": 2.023809523809524e-05,
"loss": 0.0179,
"step": 9000
},
{
"epoch": 5.9995868110073545,
"eval_f1": 0.9525947889542465,
"eval_loss": 0.2241736799478531,
"eval_runtime": 88.6595,
"eval_samples_per_second": 57.738,
"eval_steps_per_second": 14.437,
"step": 9072
},
{
"epoch": 6.282951822163458,
"grad_norm": 0.06540829688310623,
"learning_rate": 1.8584656084656086e-05,
"loss": 0.0103,
"step": 9500
},
{
"epoch": 6.613503016279647,
"grad_norm": 0.004820807836949825,
"learning_rate": 1.693121693121693e-05,
"loss": 0.013,
"step": 10000
},
{
"epoch": 6.944054210395835,
"grad_norm": 7.895081520080566,
"learning_rate": 1.527777777777778e-05,
"loss": 0.0127,
"step": 10500
},
{
"epoch": 6.9995868110073545,
"eval_f1": 0.9584218875344421,
"eval_loss": 0.1747281849384308,
"eval_runtime": 88.6774,
"eval_samples_per_second": 57.726,
"eval_steps_per_second": 14.434,
"step": 10584
},
{
"epoch": 7.275018593504669,
"grad_norm": 0.03834864869713783,
"learning_rate": 1.3624338624338626e-05,
"loss": 0.0103,
"step": 11000
},
{
"epoch": 7.6055697876208574,
"grad_norm": 0.005743283778429031,
"learning_rate": 1.1970899470899471e-05,
"loss": 0.0086,
"step": 11500
},
{
"epoch": 7.936120981737046,
"grad_norm": 0.0013776550767943263,
"learning_rate": 1.0317460317460318e-05,
"loss": 0.0081,
"step": 12000
},
{
"epoch": 7.9995868110073545,
"eval_f1": 0.9579563377597123,
"eval_loss": 0.22722405195236206,
"eval_runtime": 88.546,
"eval_samples_per_second": 57.812,
"eval_steps_per_second": 14.456,
"step": 12096
},
{
"epoch": 8.267085364845881,
"grad_norm": 0.003926456440240145,
"learning_rate": 8.664021164021165e-06,
"loss": 0.006,
"step": 12500
},
{
"epoch": 8.59763655896207,
"grad_norm": 0.00048606126802042127,
"learning_rate": 7.010582010582011e-06,
"loss": 0.0037,
"step": 13000
},
{
"epoch": 8.928187753078259,
"grad_norm": 0.03147663176059723,
"learning_rate": 5.357142857142857e-06,
"loss": 0.0047,
"step": 13500
},
{
"epoch": 8.999586811007354,
"eval_f1": 0.956967216467543,
"eval_loss": 0.22612209618091583,
"eval_runtime": 88.6133,
"eval_samples_per_second": 57.768,
"eval_steps_per_second": 14.445,
"step": 13608
},
{
"epoch": 9.259152136187092,
"grad_norm": 0.003239526879042387,
"learning_rate": 3.7037037037037037e-06,
"loss": 0.0024,
"step": 14000
},
{
"epoch": 9.58970333030328,
"grad_norm": 0.0006155924056656659,
"learning_rate": 2.0502645502645504e-06,
"loss": 0.0031,
"step": 14500
},
{
"epoch": 9.92025452441947,
"grad_norm": 0.0004118815122637898,
"learning_rate": 3.9682539682539683e-07,
"loss": 0.0022,
"step": 15000
},
{
"epoch": 9.999586811007354,
"eval_f1": 0.9576523514471682,
"eval_loss": 0.24551521241664886,
"eval_runtime": 88.6527,
"eval_samples_per_second": 57.742,
"eval_steps_per_second": 14.438,
"step": 15120
}
],
"logging_steps": 500,
"max_steps": 15120,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.2732259702136832e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}