CBY0517's picture
Upload folder using huggingface_hub
a3ab541 verified
Raw
History Blame Contribute Delete
9.41 kB
{
"best_metric": 0.022366832941770554,
"best_model_checkpoint": "tw-cn-context-classifier/checkpoint-314",
"epoch": 2.0,
"eval_steps": 500,
"global_step": 314,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.044585987261146494,
"grad_norm": 4.861356258392334,
"learning_rate": 2.222222222222222e-06,
"loss": 0.6812,
"step": 7
},
{
"epoch": 0.08917197452229299,
"grad_norm": 5.701432228088379,
"learning_rate": 4.444444444444444e-06,
"loss": 0.6625,
"step": 14
},
{
"epoch": 0.1337579617834395,
"grad_norm": 9.67529010772705,
"learning_rate": 6.666666666666667e-06,
"loss": 0.6396,
"step": 21
},
{
"epoch": 0.17834394904458598,
"grad_norm": 6.278923034667969,
"learning_rate": 8.888888888888888e-06,
"loss": 0.6029,
"step": 28
},
{
"epoch": 0.2229299363057325,
"grad_norm": 3.7738094329833984,
"learning_rate": 1.1111111111111113e-05,
"loss": 0.4799,
"step": 35
},
{
"epoch": 0.267515923566879,
"grad_norm": 4.174890041351318,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.3843,
"step": 42
},
{
"epoch": 0.31210191082802546,
"grad_norm": 5.322546005249023,
"learning_rate": 1.555555555555556e-05,
"loss": 0.2303,
"step": 49
},
{
"epoch": 0.35668789808917195,
"grad_norm": 1.734724521636963,
"learning_rate": 1.7777777777777777e-05,
"loss": 0.0953,
"step": 56
},
{
"epoch": 0.4012738853503185,
"grad_norm": 0.5622832775115967,
"learning_rate": 2e-05,
"loss": 0.0398,
"step": 63
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.2177177220582962,
"learning_rate": 1.975221238938053e-05,
"loss": 0.0152,
"step": 70
},
{
"epoch": 0.49044585987261147,
"grad_norm": 0.12123537808656693,
"learning_rate": 1.9504424778761063e-05,
"loss": 0.0076,
"step": 77
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.13101454079151154,
"learning_rate": 1.9256637168141596e-05,
"loss": 0.0557,
"step": 84
},
{
"epoch": 0.5796178343949044,
"grad_norm": 0.08730276674032211,
"learning_rate": 1.9008849557522125e-05,
"loss": 0.0035,
"step": 91
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.07024876028299332,
"learning_rate": 1.8761061946902657e-05,
"loss": 0.0027,
"step": 98
},
{
"epoch": 0.6687898089171974,
"grad_norm": 0.05537857860326767,
"learning_rate": 1.8513274336283186e-05,
"loss": 0.0023,
"step": 105
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.04929512366652489,
"learning_rate": 1.826548672566372e-05,
"loss": 0.058,
"step": 112
},
{
"epoch": 0.7579617834394905,
"grad_norm": 0.05506855249404907,
"learning_rate": 1.8017699115044248e-05,
"loss": 0.0018,
"step": 119
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.056426189839839935,
"learning_rate": 1.776991150442478e-05,
"loss": 0.0016,
"step": 126
},
{
"epoch": 0.8471337579617835,
"grad_norm": 0.11536817252635956,
"learning_rate": 1.7522123893805313e-05,
"loss": 0.1204,
"step": 133
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.2547154724597931,
"learning_rate": 1.7274336283185842e-05,
"loss": 0.0542,
"step": 140
},
{
"epoch": 0.9363057324840764,
"grad_norm": 0.10147877037525177,
"learning_rate": 1.702654867256637e-05,
"loss": 0.004,
"step": 147
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.06237854063510895,
"learning_rate": 1.6778761061946903e-05,
"loss": 0.0022,
"step": 154
},
{
"epoch": 1.0,
"eval_accuracy": 0.9968152866242038,
"eval_auc": 0.9999492880035701,
"eval_f1": 0.9968051118210862,
"eval_loss": 0.02294245921075344,
"eval_precision": 1.0,
"eval_recall": 0.9936305732484076,
"eval_runtime": 65.0436,
"eval_samples_per_second": 9.655,
"eval_steps_per_second": 0.307,
"step": 157
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.04382710158824921,
"learning_rate": 1.6530973451327436e-05,
"loss": 0.0016,
"step": 161
},
{
"epoch": 1.070063694267516,
"grad_norm": 0.038911979645490646,
"learning_rate": 1.628318584070797e-05,
"loss": 0.0492,
"step": 168
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.039950430393218994,
"learning_rate": 1.6035398230088498e-05,
"loss": 0.0013,
"step": 175
},
{
"epoch": 1.1592356687898089,
"grad_norm": 0.04444283992052078,
"learning_rate": 1.5787610619469027e-05,
"loss": 0.0541,
"step": 182
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.8840770721435547,
"learning_rate": 1.553982300884956e-05,
"loss": 0.002,
"step": 189
},
{
"epoch": 1.2484076433121019,
"grad_norm": 0.0330999530851841,
"learning_rate": 1.5292035398230088e-05,
"loss": 0.0013,
"step": 196
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.0437622107565403,
"learning_rate": 1.5044247787610619e-05,
"loss": 0.0012,
"step": 203
},
{
"epoch": 1.3375796178343948,
"grad_norm": 0.03020174615085125,
"learning_rate": 1.4796460176991151e-05,
"loss": 0.0011,
"step": 210
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.02413470856845379,
"learning_rate": 1.4548672566371682e-05,
"loss": 0.001,
"step": 217
},
{
"epoch": 1.426751592356688,
"grad_norm": 0.033314965665340424,
"learning_rate": 1.4300884955752215e-05,
"loss": 0.0009,
"step": 224
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.02173658274114132,
"learning_rate": 1.4053097345132744e-05,
"loss": 0.0009,
"step": 231
},
{
"epoch": 1.515923566878981,
"grad_norm": 0.02424098365008831,
"learning_rate": 1.3805309734513275e-05,
"loss": 0.0549,
"step": 238
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.12424007803201675,
"learning_rate": 1.3557522123893807e-05,
"loss": 0.0704,
"step": 245
},
{
"epoch": 1.605095541401274,
"grad_norm": 0.0554329939186573,
"learning_rate": 1.3309734513274338e-05,
"loss": 0.0022,
"step": 252
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.02428065985441208,
"learning_rate": 1.3061946902654867e-05,
"loss": 0.0021,
"step": 259
},
{
"epoch": 1.694267515923567,
"grad_norm": 0.03345051407814026,
"learning_rate": 1.28141592920354e-05,
"loss": 0.059,
"step": 266
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.04772985354065895,
"learning_rate": 1.256637168141593e-05,
"loss": 0.0656,
"step": 273
},
{
"epoch": 1.78343949044586,
"grad_norm": 0.07988367229700089,
"learning_rate": 1.2318584070796463e-05,
"loss": 0.0017,
"step": 280
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.03602590411901474,
"learning_rate": 1.2070796460176992e-05,
"loss": 0.0014,
"step": 287
},
{
"epoch": 1.872611464968153,
"grad_norm": 0.030409082770347595,
"learning_rate": 1.1823008849557523e-05,
"loss": 0.001,
"step": 294
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.031838107854127884,
"learning_rate": 1.1575221238938055e-05,
"loss": 0.001,
"step": 301
},
{
"epoch": 1.9617834394904459,
"grad_norm": 0.029339779168367386,
"learning_rate": 1.1327433628318584e-05,
"loss": 0.0009,
"step": 308
},
{
"epoch": 2.0,
"eval_accuracy": 0.9968152866242038,
"eval_auc": 0.9999391456042841,
"eval_f1": 0.9968051118210862,
"eval_loss": 0.022366832941770554,
"eval_precision": 1.0,
"eval_recall": 0.9936305732484076,
"eval_runtime": 76.7054,
"eval_samples_per_second": 8.187,
"eval_steps_per_second": 0.261,
"step": 314
}
],
"logging_steps": 7,
"max_steps": 628,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.01
},
"attributes": {
"early_stopping_patience_counter": 1
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 330467485532160.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}