SmolLlama3 / trainer_state.json
maharnab's picture
Upload folder using huggingface_hub
fc9297d verified
Raw
History Blame Contribute Delete
12.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 100,
"global_step": 1875,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3540814772248269,
"epoch": 0.16,
"grad_norm": 0.29296875,
"learning_rate": 0.00019973673694024,
"loss": 1.4633206176757811,
"mean_token_accuracy": 0.6500224708765745,
"num_tokens": 1238177.0,
"step": 100
},
{
"epoch": 0.16,
"eval_entropy": 1.0408895498230344,
"eval_loss": 1.0171571969985962,
"eval_mean_token_accuracy": 0.7146944498258924,
"eval_num_tokens": 1238177.0,
"eval_runtime": 78.8867,
"eval_samples_per_second": 6.338,
"eval_steps_per_second": 0.799,
"step": 100
},
{
"entropy": 0.9953572849929333,
"epoch": 0.32,
"grad_norm": 0.283203125,
"learning_rate": 0.00019700443730801413,
"loss": 0.9830435943603516,
"mean_token_accuracy": 0.7228847779333591,
"num_tokens": 2525507.0,
"step": 200
},
{
"epoch": 0.32,
"eval_entropy": 1.0137588391228327,
"eval_loss": 0.9846630692481995,
"eval_mean_token_accuracy": 0.7225528132347834,
"eval_num_tokens": 2525507.0,
"eval_runtime": 78.7428,
"eval_samples_per_second": 6.35,
"eval_steps_per_second": 0.8,
"step": 200
},
{
"entropy": 0.998912007957697,
"epoch": 0.48,
"grad_norm": 0.392578125,
"learning_rate": 0.00019138263836827288,
"loss": 0.9803644561767578,
"mean_token_accuracy": 0.7225449255108833,
"num_tokens": 3772872.0,
"step": 300
},
{
"epoch": 0.48,
"eval_entropy": 0.9792825617487468,
"eval_loss": 0.9684324860572815,
"eval_mean_token_accuracy": 0.7254447255815778,
"eval_num_tokens": 3772872.0,
"eval_runtime": 78.7266,
"eval_samples_per_second": 6.351,
"eval_steps_per_second": 0.8,
"step": 300
},
{
"entropy": 0.9658883933722973,
"epoch": 0.64,
"grad_norm": 0.314453125,
"learning_rate": 0.00018303879827647975,
"loss": 0.9450923919677734,
"mean_token_accuracy": 0.7311204792559147,
"num_tokens": 4984433.0,
"step": 400
},
{
"epoch": 0.64,
"eval_entropy": 0.9519493419026571,
"eval_loss": 0.9587358832359314,
"eval_mean_token_accuracy": 0.7281927579925174,
"eval_num_tokens": 4984433.0,
"eval_runtime": 78.7548,
"eval_samples_per_second": 6.349,
"eval_steps_per_second": 0.8,
"step": 400
},
{
"entropy": 0.9506746862828731,
"epoch": 0.8,
"grad_norm": 0.287109375,
"learning_rate": 0.00017222145741734626,
"loss": 0.9352159118652343,
"mean_token_accuracy": 0.7334290930628776,
"num_tokens": 6278212.0,
"step": 500
},
{
"epoch": 0.8,
"eval_entropy": 0.9630418930734906,
"eval_loss": 0.9499430060386658,
"eval_mean_token_accuracy": 0.7301400247074309,
"eval_num_tokens": 6278212.0,
"eval_runtime": 78.8947,
"eval_samples_per_second": 6.338,
"eval_steps_per_second": 0.799,
"step": 500
},
{
"entropy": 0.9404085071384907,
"epoch": 0.96,
"grad_norm": 0.36328125,
"learning_rate": 0.0001592528350603103,
"loss": 0.9235909271240235,
"mean_token_accuracy": 0.7360797208547593,
"num_tokens": 7515414.0,
"step": 600
},
{
"epoch": 0.96,
"eval_entropy": 0.9610084844014001,
"eval_loss": 0.9445458054542542,
"eval_mean_token_accuracy": 0.7312900613224695,
"eval_num_tokens": 7515414.0,
"eval_runtime": 78.809,
"eval_samples_per_second": 6.344,
"eval_steps_per_second": 0.799,
"step": 600
},
{
"entropy": 0.8863665771484375,
"epoch": 1.12,
"grad_norm": 0.33984375,
"learning_rate": 0.0001445192313207067,
"loss": 0.8664443969726563,
"mean_token_accuracy": 0.751860016733408,
"num_tokens": 8791049.0,
"step": 700
},
{
"epoch": 1.12,
"eval_entropy": 0.8678532384690785,
"eval_loss": 0.9490408897399902,
"eval_mean_token_accuracy": 0.7310751146740384,
"eval_num_tokens": 8791049.0,
"eval_runtime": 78.889,
"eval_samples_per_second": 6.338,
"eval_steps_per_second": 0.799,
"step": 700
},
{
"entropy": 0.8653571680933237,
"epoch": 1.28,
"grad_norm": 0.341796875,
"learning_rate": 0.0001284595203261965,
"loss": 0.8425308227539062,
"mean_token_accuracy": 0.7570811548829078,
"num_tokens": 10023730.0,
"step": 800
},
{
"epoch": 1.28,
"eval_entropy": 0.8799236341128274,
"eval_loss": 0.9464381337165833,
"eval_mean_token_accuracy": 0.731743007425278,
"eval_num_tokens": 10023730.0,
"eval_runtime": 78.7704,
"eval_samples_per_second": 6.348,
"eval_steps_per_second": 0.8,
"step": 800
},
{
"entropy": 0.8525189873576164,
"epoch": 1.44,
"grad_norm": 0.326171875,
"learning_rate": 0.00011155207734584263,
"loss": 0.8311178588867187,
"mean_token_accuracy": 0.758762137889862,
"num_tokens": 11272481.0,
"step": 900
},
{
"epoch": 1.44,
"eval_entropy": 0.8737099454516456,
"eval_loss": 0.9428508281707764,
"eval_mean_token_accuracy": 0.7328412476040068,
"eval_num_tokens": 11272481.0,
"eval_runtime": 78.9808,
"eval_samples_per_second": 6.331,
"eval_steps_per_second": 0.798,
"step": 900
},
{
"entropy": 0.8523794415593148,
"epoch": 1.6,
"grad_norm": 0.322265625,
"learning_rate": 9.430052928723153e-05,
"loss": 0.8334156799316407,
"mean_token_accuracy": 0.7607765494287014,
"num_tokens": 12541228.0,
"step": 1000
},
{
"epoch": 1.6,
"eval_entropy": 0.8634761429968334,
"eval_loss": 0.939626932144165,
"eval_mean_token_accuracy": 0.7337213830342368,
"eval_num_tokens": 12541228.0,
"eval_runtime": 78.7473,
"eval_samples_per_second": 6.349,
"eval_steps_per_second": 0.8,
"step": 1000
},
{
"entropy": 0.848904173374176,
"epoch": 1.76,
"grad_norm": 0.296875,
"learning_rate": 7.721875301571359e-05,
"loss": 0.8279781341552734,
"mean_token_accuracy": 0.761102753430605,
"num_tokens": 13787594.0,
"step": 1100
},
{
"epoch": 1.76,
"eval_entropy": 0.8816202557276166,
"eval_loss": 0.9332679510116577,
"eval_mean_token_accuracy": 0.7345179215310111,
"eval_num_tokens": 13787594.0,
"eval_runtime": 78.8468,
"eval_samples_per_second": 6.341,
"eval_steps_per_second": 0.799,
"step": 1100
},
{
"entropy": 0.8487374657392501,
"epoch": 1.92,
"grad_norm": 0.361328125,
"learning_rate": 6.0815568355179556e-05,
"loss": 0.8284202575683594,
"mean_token_accuracy": 0.7601838798820972,
"num_tokens": 15024952.0,
"step": 1200
},
{
"epoch": 1.92,
"eval_entropy": 0.8655259221319168,
"eval_loss": 0.9299662113189697,
"eval_mean_token_accuracy": 0.7359667079789298,
"eval_num_tokens": 15024952.0,
"eval_runtime": 78.81,
"eval_samples_per_second": 6.344,
"eval_steps_per_second": 0.799,
"step": 1200
},
{
"entropy": 0.7959265542775392,
"epoch": 2.08,
"grad_norm": 0.39453125,
"learning_rate": 4.5579581724397255e-05,
"loss": 0.765469741821289,
"mean_token_accuracy": 0.7783753572404385,
"num_tokens": 16289561.0,
"step": 1300
},
{
"epoch": 2.08,
"eval_entropy": 0.7987193597687615,
"eval_loss": 0.9503117799758911,
"eval_mean_token_accuracy": 0.73391526464432,
"eval_num_tokens": 16289561.0,
"eval_runtime": 78.8942,
"eval_samples_per_second": 6.338,
"eval_steps_per_second": 0.799,
"step": 1300
},
{
"entropy": 0.7321610506623983,
"epoch": 2.24,
"grad_norm": 0.392578125,
"learning_rate": 3.196463187590929e-05,
"loss": 0.6977394866943359,
"mean_token_accuracy": 0.7958511321246624,
"num_tokens": 17566179.0,
"step": 1400
},
{
"epoch": 2.24,
"eval_entropy": 0.7957971247415694,
"eval_loss": 0.9516386985778809,
"eval_mean_token_accuracy": 0.7339397157941546,
"eval_num_tokens": 17566179.0,
"eval_runtime": 78.9187,
"eval_samples_per_second": 6.336,
"eval_steps_per_second": 0.798,
"step": 1400
},
{
"entropy": 0.7484312203526496,
"epoch": 2.4,
"grad_norm": 0.36328125,
"learning_rate": 2.0376271269487514e-05,
"loss": 0.7148262023925781,
"mean_token_accuracy": 0.7925588050484658,
"num_tokens": 18823409.0,
"step": 1500
},
{
"epoch": 2.4,
"eval_entropy": 0.7901531098380922,
"eval_loss": 0.952657163143158,
"eval_mean_token_accuracy": 0.7342138498548477,
"eval_num_tokens": 18823409.0,
"eval_runtime": 78.7246,
"eval_samples_per_second": 6.351,
"eval_steps_per_second": 0.8,
"step": 1500
},
{
"entropy": 0.7353997033834457,
"epoch": 2.56,
"grad_norm": 0.404296875,
"learning_rate": 1.1159685763395111e-05,
"loss": 0.6989010620117188,
"mean_token_accuracy": 0.7955636675655842,
"num_tokens": 20029991.0,
"step": 1600
},
{
"epoch": 2.56,
"eval_entropy": 0.7921941649346125,
"eval_loss": 0.9510936141014099,
"eval_mean_token_accuracy": 0.7344856574421837,
"eval_num_tokens": 20029991.0,
"eval_runtime": 78.6039,
"eval_samples_per_second": 6.361,
"eval_steps_per_second": 0.801,
"step": 1600
},
{
"entropy": 0.7453224293142557,
"epoch": 2.7199999999999998,
"grad_norm": 0.376953125,
"learning_rate": 4.58941246311464e-06,
"loss": 0.712043685913086,
"mean_token_accuracy": 0.7924758359789849,
"num_tokens": 21285971.0,
"step": 1700
},
{
"epoch": 2.7199999999999998,
"eval_entropy": 0.7924881426114885,
"eval_loss": 0.9510090351104736,
"eval_mean_token_accuracy": 0.7344099529205806,
"eval_num_tokens": 21285971.0,
"eval_runtime": 78.7793,
"eval_samples_per_second": 6.347,
"eval_steps_per_second": 0.8,
"step": 1700
},
{
"entropy": 0.7430764560401439,
"epoch": 2.88,
"grad_norm": 0.404296875,
"learning_rate": 8.611620049653879e-07,
"loss": 0.7093801879882813,
"mean_token_accuracy": 0.7932735744118691,
"num_tokens": 22529694.0,
"step": 1800
},
{
"epoch": 2.88,
"eval_entropy": 0.7928767279973106,
"eval_loss": 0.9508963823318481,
"eval_mean_token_accuracy": 0.7343375957201398,
"eval_num_tokens": 22529694.0,
"eval_runtime": 78.867,
"eval_samples_per_second": 6.34,
"eval_steps_per_second": 0.799,
"step": 1800
},
{
"epoch": 3.0,
"eval_entropy": 0.7928942896070934,
"eval_loss": 0.9508863687515259,
"eval_mean_token_accuracy": 0.734485215610928,
"eval_num_tokens": 23462628.0,
"eval_runtime": 78.8215,
"eval_samples_per_second": 6.343,
"eval_steps_per_second": 0.799,
"step": 1875
}
],
"logging_steps": 100,
"max_steps": 1875,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.6703999720219935e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}