{ "best_metric": 0.022366832941770554, "best_model_checkpoint": "tw-cn-context-classifier/checkpoint-314", "epoch": 2.0, "eval_steps": 500, "global_step": 314, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.044585987261146494, "grad_norm": 4.861356258392334, "learning_rate": 2.222222222222222e-06, "loss": 0.6812, "step": 7 }, { "epoch": 0.08917197452229299, "grad_norm": 5.701432228088379, "learning_rate": 4.444444444444444e-06, "loss": 0.6625, "step": 14 }, { "epoch": 0.1337579617834395, "grad_norm": 9.67529010772705, "learning_rate": 6.666666666666667e-06, "loss": 0.6396, "step": 21 }, { "epoch": 0.17834394904458598, "grad_norm": 6.278923034667969, "learning_rate": 8.888888888888888e-06, "loss": 0.6029, "step": 28 }, { "epoch": 0.2229299363057325, "grad_norm": 3.7738094329833984, "learning_rate": 1.1111111111111113e-05, "loss": 0.4799, "step": 35 }, { "epoch": 0.267515923566879, "grad_norm": 4.174890041351318, "learning_rate": 1.3333333333333333e-05, "loss": 0.3843, "step": 42 }, { "epoch": 0.31210191082802546, "grad_norm": 5.322546005249023, "learning_rate": 1.555555555555556e-05, "loss": 0.2303, "step": 49 }, { "epoch": 0.35668789808917195, "grad_norm": 1.734724521636963, "learning_rate": 1.7777777777777777e-05, "loss": 0.0953, "step": 56 }, { "epoch": 0.4012738853503185, "grad_norm": 0.5622832775115967, "learning_rate": 2e-05, "loss": 0.0398, "step": 63 }, { "epoch": 0.445859872611465, "grad_norm": 0.2177177220582962, "learning_rate": 1.975221238938053e-05, "loss": 0.0152, "step": 70 }, { "epoch": 0.49044585987261147, "grad_norm": 0.12123537808656693, "learning_rate": 1.9504424778761063e-05, "loss": 0.0076, "step": 77 }, { "epoch": 0.535031847133758, "grad_norm": 0.13101454079151154, "learning_rate": 1.9256637168141596e-05, "loss": 0.0557, "step": 84 }, { "epoch": 0.5796178343949044, "grad_norm": 0.08730276674032211, "learning_rate": 1.9008849557522125e-05, "loss": 0.0035, "step": 91 }, { "epoch": 0.6242038216560509, "grad_norm": 0.07024876028299332, "learning_rate": 1.8761061946902657e-05, "loss": 0.0027, "step": 98 }, { "epoch": 0.6687898089171974, "grad_norm": 0.05537857860326767, "learning_rate": 1.8513274336283186e-05, "loss": 0.0023, "step": 105 }, { "epoch": 0.7133757961783439, "grad_norm": 0.04929512366652489, "learning_rate": 1.826548672566372e-05, "loss": 0.058, "step": 112 }, { "epoch": 0.7579617834394905, "grad_norm": 0.05506855249404907, "learning_rate": 1.8017699115044248e-05, "loss": 0.0018, "step": 119 }, { "epoch": 0.802547770700637, "grad_norm": 0.056426189839839935, "learning_rate": 1.776991150442478e-05, "loss": 0.0016, "step": 126 }, { "epoch": 0.8471337579617835, "grad_norm": 0.11536817252635956, "learning_rate": 1.7522123893805313e-05, "loss": 0.1204, "step": 133 }, { "epoch": 0.89171974522293, "grad_norm": 0.2547154724597931, "learning_rate": 1.7274336283185842e-05, "loss": 0.0542, "step": 140 }, { "epoch": 0.9363057324840764, "grad_norm": 0.10147877037525177, "learning_rate": 1.702654867256637e-05, "loss": 0.004, "step": 147 }, { "epoch": 0.9808917197452229, "grad_norm": 0.06237854063510895, "learning_rate": 1.6778761061946903e-05, "loss": 0.0022, "step": 154 }, { "epoch": 1.0, "eval_accuracy": 0.9968152866242038, "eval_auc": 0.9999492880035701, "eval_f1": 0.9968051118210862, "eval_loss": 0.02294245921075344, "eval_precision": 1.0, "eval_recall": 0.9936305732484076, "eval_runtime": 65.0436, "eval_samples_per_second": 9.655, "eval_steps_per_second": 0.307, "step": 157 }, { "epoch": 1.0254777070063694, "grad_norm": 0.04382710158824921, "learning_rate": 1.6530973451327436e-05, "loss": 0.0016, "step": 161 }, { "epoch": 1.070063694267516, "grad_norm": 0.038911979645490646, "learning_rate": 1.628318584070797e-05, "loss": 0.0492, "step": 168 }, { "epoch": 1.1146496815286624, "grad_norm": 0.039950430393218994, "learning_rate": 1.6035398230088498e-05, "loss": 0.0013, "step": 175 }, { "epoch": 1.1592356687898089, "grad_norm": 0.04444283992052078, "learning_rate": 1.5787610619469027e-05, "loss": 0.0541, "step": 182 }, { "epoch": 1.2038216560509554, "grad_norm": 0.8840770721435547, "learning_rate": 1.553982300884956e-05, "loss": 0.002, "step": 189 }, { "epoch": 1.2484076433121019, "grad_norm": 0.0330999530851841, "learning_rate": 1.5292035398230088e-05, "loss": 0.0013, "step": 196 }, { "epoch": 1.2929936305732483, "grad_norm": 0.0437622107565403, "learning_rate": 1.5044247787610619e-05, "loss": 0.0012, "step": 203 }, { "epoch": 1.3375796178343948, "grad_norm": 0.03020174615085125, "learning_rate": 1.4796460176991151e-05, "loss": 0.0011, "step": 210 }, { "epoch": 1.3821656050955413, "grad_norm": 0.02413470856845379, "learning_rate": 1.4548672566371682e-05, "loss": 0.001, "step": 217 }, { "epoch": 1.426751592356688, "grad_norm": 0.033314965665340424, "learning_rate": 1.4300884955752215e-05, "loss": 0.0009, "step": 224 }, { "epoch": 1.4713375796178343, "grad_norm": 0.02173658274114132, "learning_rate": 1.4053097345132744e-05, "loss": 0.0009, "step": 231 }, { "epoch": 1.515923566878981, "grad_norm": 0.02424098365008831, "learning_rate": 1.3805309734513275e-05, "loss": 0.0549, "step": 238 }, { "epoch": 1.5605095541401273, "grad_norm": 0.12424007803201675, "learning_rate": 1.3557522123893807e-05, "loss": 0.0704, "step": 245 }, { "epoch": 1.605095541401274, "grad_norm": 0.0554329939186573, "learning_rate": 1.3309734513274338e-05, "loss": 0.0022, "step": 252 }, { "epoch": 1.6496815286624202, "grad_norm": 0.02428065985441208, "learning_rate": 1.3061946902654867e-05, "loss": 0.0021, "step": 259 }, { "epoch": 1.694267515923567, "grad_norm": 0.03345051407814026, "learning_rate": 1.28141592920354e-05, "loss": 0.059, "step": 266 }, { "epoch": 1.7388535031847132, "grad_norm": 0.04772985354065895, "learning_rate": 1.256637168141593e-05, "loss": 0.0656, "step": 273 }, { "epoch": 1.78343949044586, "grad_norm": 0.07988367229700089, "learning_rate": 1.2318584070796463e-05, "loss": 0.0017, "step": 280 }, { "epoch": 1.8280254777070064, "grad_norm": 0.03602590411901474, "learning_rate": 1.2070796460176992e-05, "loss": 0.0014, "step": 287 }, { "epoch": 1.872611464968153, "grad_norm": 0.030409082770347595, "learning_rate": 1.1823008849557523e-05, "loss": 0.001, "step": 294 }, { "epoch": 1.9171974522292994, "grad_norm": 0.031838107854127884, "learning_rate": 1.1575221238938055e-05, "loss": 0.001, "step": 301 }, { "epoch": 1.9617834394904459, "grad_norm": 0.029339779168367386, "learning_rate": 1.1327433628318584e-05, "loss": 0.0009, "step": 308 }, { "epoch": 2.0, "eval_accuracy": 0.9968152866242038, "eval_auc": 0.9999391456042841, "eval_f1": 0.9968051118210862, "eval_loss": 0.022366832941770554, "eval_precision": 1.0, "eval_recall": 0.9936305732484076, "eval_runtime": 76.7054, "eval_samples_per_second": 8.187, "eval_steps_per_second": 0.261, "step": 314 } ], "logging_steps": 7, "max_steps": 628, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.01 }, "attributes": { "early_stopping_patience_counter": 1 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 330467485532160.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }