Invalid JSON:Unexpected token 'I', ..."ad_norm": Infinity,
"... is not valid JSON
| { | |
| "best_metric": 0.0012908950448036194, | |
| "best_model_checkpoint": "gender\\checkpoint-72", | |
| "epoch": 9.0, | |
| "eval_steps": 500, | |
| "global_step": 72, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.125, | |
| "grad_norm": 8.839544296264648, | |
| "learning_rate": 3.125e-06, | |
| "loss": 0.7543, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": Infinity, | |
| "learning_rate": 3.125e-06, | |
| "loss": 0.8194, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.375, | |
| "grad_norm": 10.062314987182617, | |
| "learning_rate": 6.25e-06, | |
| "loss": 0.8397, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 8.579401969909668, | |
| "learning_rate": 9.375000000000001e-06, | |
| "loss": 0.758, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.625, | |
| "grad_norm": 12.681062698364258, | |
| "learning_rate": 1.25e-05, | |
| "loss": 0.9867, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 13.662342071533203, | |
| "learning_rate": 1.5625e-05, | |
| "loss": 0.6524, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.875, | |
| "grad_norm": 8.97331714630127, | |
| "learning_rate": 1.8750000000000002e-05, | |
| "loss": 0.9147, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 6.345348834991455, | |
| "learning_rate": 2.1875e-05, | |
| "loss": 0.4983, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_accuracy": 0.75, | |
| "eval_auc": 0.6875, | |
| "eval_f1": 0.0, | |
| "eval_loss": 0.6031913757324219, | |
| "eval_precision": 0.0, | |
| "eval_recall": 0.0, | |
| "eval_runtime": 0.064, | |
| "eval_samples_per_second": 250.101, | |
| "eval_steps_per_second": 15.631, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 1.125, | |
| "grad_norm": 8.304693222045898, | |
| "learning_rate": 2.5e-05, | |
| "loss": 0.6723, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 5.756776809692383, | |
| "learning_rate": 2.8125000000000003e-05, | |
| "loss": 0.3328, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 1.375, | |
| "grad_norm": 6.210690975189209, | |
| "learning_rate": 3.125e-05, | |
| "loss": 0.4256, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 10.43043041229248, | |
| "learning_rate": 3.4375e-05, | |
| "loss": 0.6545, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 1.625, | |
| "grad_norm": 4.654361248016357, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 0.2891, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 7.63759183883667, | |
| "learning_rate": 4.0625000000000005e-05, | |
| "loss": 0.4828, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 1.875, | |
| "grad_norm": 6.132064342498779, | |
| "learning_rate": 4.375e-05, | |
| "loss": 0.4312, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 3.3374931812286377, | |
| "learning_rate": 4.6875e-05, | |
| "loss": 0.2086, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_accuracy": 0.8125, | |
| "eval_auc": 1.0, | |
| "eval_f1": 0.4, | |
| "eval_loss": 0.3224067687988281, | |
| "eval_precision": 1.0, | |
| "eval_recall": 0.25, | |
| "eval_runtime": 0.0587, | |
| "eval_samples_per_second": 272.474, | |
| "eval_steps_per_second": 17.03, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 2.125, | |
| "grad_norm": 3.077073335647583, | |
| "learning_rate": 5e-05, | |
| "loss": 0.1397, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 2.25, | |
| "grad_norm": 4.40862512588501, | |
| "learning_rate": 4.965277777777778e-05, | |
| "loss": 0.3093, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 2.375, | |
| "grad_norm": 3.4765329360961914, | |
| "learning_rate": 4.930555555555556e-05, | |
| "loss": 0.2167, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "grad_norm": 1.5243409872055054, | |
| "learning_rate": 4.8958333333333335e-05, | |
| "loss": 0.0778, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 2.625, | |
| "grad_norm": 3.61657977104187, | |
| "learning_rate": 4.8611111111111115e-05, | |
| "loss": 0.1989, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 2.75, | |
| "grad_norm": 3.2988128662109375, | |
| "learning_rate": 4.8263888888888895e-05, | |
| "loss": 0.197, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 2.875, | |
| "grad_norm": 1.3049061298370361, | |
| "learning_rate": 4.791666666666667e-05, | |
| "loss": 0.0648, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 2.643069267272949, | |
| "learning_rate": 4.756944444444444e-05, | |
| "loss": 0.0701, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_accuracy": 1.0, | |
| "eval_auc": 1.0, | |
| "eval_f1": 1.0, | |
| "eval_loss": 0.0625617504119873, | |
| "eval_precision": 1.0, | |
| "eval_recall": 1.0, | |
| "eval_runtime": 0.0556, | |
| "eval_samples_per_second": 287.572, | |
| "eval_steps_per_second": 17.973, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 3.125, | |
| "grad_norm": 3.6841492652893066, | |
| "learning_rate": 4.722222222222222e-05, | |
| "loss": 0.1321, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 3.25, | |
| "grad_norm": 0.8644580841064453, | |
| "learning_rate": 4.6875e-05, | |
| "loss": 0.0245, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 3.375, | |
| "grad_norm": 0.6396610736846924, | |
| "learning_rate": 4.652777777777778e-05, | |
| "loss": 0.0204, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 3.5, | |
| "grad_norm": 5.226676940917969, | |
| "learning_rate": 4.618055555555556e-05, | |
| "loss": 0.0882, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 3.625, | |
| "grad_norm": 3.9581685066223145, | |
| "learning_rate": 4.5833333333333334e-05, | |
| "loss": 0.091, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 3.75, | |
| "grad_norm": 0.2740299105644226, | |
| "learning_rate": 4.5486111111111114e-05, | |
| "loss": 0.0087, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 3.875, | |
| "grad_norm": 0.6588912010192871, | |
| "learning_rate": 4.5138888888888894e-05, | |
| "loss": 0.0175, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "grad_norm": 6.047511577606201, | |
| "learning_rate": 4.4791666666666673e-05, | |
| "loss": 0.0809, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_accuracy": 1.0, | |
| "eval_auc": 1.0, | |
| "eval_f1": 1.0, | |
| "eval_loss": 0.01665613055229187, | |
| "eval_precision": 1.0, | |
| "eval_recall": 1.0, | |
| "eval_runtime": 0.0561, | |
| "eval_samples_per_second": 285.035, | |
| "eval_steps_per_second": 17.815, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 4.125, | |
| "grad_norm": 3.6106154918670654, | |
| "learning_rate": 4.4444444444444447e-05, | |
| "loss": 0.098, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 4.25, | |
| "grad_norm": 0.26180651783943176, | |
| "learning_rate": 4.4097222222222226e-05, | |
| "loss": 0.0072, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 4.375, | |
| "grad_norm": 0.784140408039093, | |
| "learning_rate": 4.375e-05, | |
| "loss": 0.0209, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 4.5, | |
| "grad_norm": 0.07298047840595245, | |
| "learning_rate": 4.340277777777778e-05, | |
| "loss": 0.0025, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 4.625, | |
| "grad_norm": 0.06727258116006851, | |
| "learning_rate": 4.305555555555556e-05, | |
| "loss": 0.0025, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 4.75, | |
| "grad_norm": 0.21512272953987122, | |
| "learning_rate": 4.270833333333333e-05, | |
| "loss": 0.0048, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 4.875, | |
| "grad_norm": 0.19965760409832, | |
| "learning_rate": 4.236111111111111e-05, | |
| "loss": 0.0051, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 0.27846547961235046, | |
| "learning_rate": 4.201388888888889e-05, | |
| "loss": 0.0049, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_accuracy": 1.0, | |
| "eval_auc": 1.0, | |
| "eval_f1": 1.0, | |
| "eval_loss": 0.009060055017471313, | |
| "eval_precision": 1.0, | |
| "eval_recall": 1.0, | |
| "eval_runtime": 0.0529, | |
| "eval_samples_per_second": 302.334, | |
| "eval_steps_per_second": 18.896, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 5.125, | |
| "grad_norm": 2.1866636276245117, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 0.0473, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 5.25, | |
| "grad_norm": 3.711268186569214, | |
| "learning_rate": 4.1319444444444445e-05, | |
| "loss": 0.061, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 5.375, | |
| "grad_norm": 0.03193037211894989, | |
| "learning_rate": 4.0972222222222225e-05, | |
| "loss": 0.0011, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 5.5, | |
| "grad_norm": 0.0857921689748764, | |
| "learning_rate": 4.0625000000000005e-05, | |
| "loss": 0.0021, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 5.625, | |
| "grad_norm": 0.10865919291973114, | |
| "learning_rate": 4.027777777777778e-05, | |
| "loss": 0.0028, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 5.75, | |
| "grad_norm": 0.11789407581090927, | |
| "learning_rate": 3.993055555555556e-05, | |
| "loss": 0.0035, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 5.875, | |
| "grad_norm": 0.051877208054065704, | |
| "learning_rate": 3.958333333333333e-05, | |
| "loss": 0.0009, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "grad_norm": 0.9682751893997192, | |
| "learning_rate": 3.923611111111111e-05, | |
| "loss": 0.0112, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_accuracy": 1.0, | |
| "eval_auc": 1.0, | |
| "eval_f1": 1.0, | |
| "eval_loss": 0.01014169305562973, | |
| "eval_precision": 1.0, | |
| "eval_recall": 1.0, | |
| "eval_runtime": 0.0571, | |
| "eval_samples_per_second": 280.203, | |
| "eval_steps_per_second": 17.513, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 6.125, | |
| "grad_norm": 0.2799108922481537, | |
| "learning_rate": 3.888888888888889e-05, | |
| "loss": 0.0042, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 6.25, | |
| "grad_norm": 0.02485131472349167, | |
| "learning_rate": 3.854166666666667e-05, | |
| "loss": 0.0006, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 6.375, | |
| "grad_norm": 0.07226316630840302, | |
| "learning_rate": 3.8194444444444444e-05, | |
| "loss": 0.0021, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 6.5, | |
| "grad_norm": 0.14999447762966156, | |
| "learning_rate": 3.7847222222222224e-05, | |
| "loss": 0.0034, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 6.625, | |
| "grad_norm": 0.24165014922618866, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 0.0032, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 6.75, | |
| "grad_norm": 8.056694030761719, | |
| "learning_rate": 3.715277777777778e-05, | |
| "loss": 0.0603, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 6.875, | |
| "grad_norm": 0.07370386272668839, | |
| "learning_rate": 3.6805555555555556e-05, | |
| "loss": 0.0015, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "grad_norm": 0.02779821865260601, | |
| "learning_rate": 3.6458333333333336e-05, | |
| "loss": 0.0007, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_accuracy": 1.0, | |
| "eval_auc": 1.0, | |
| "eval_f1": 1.0, | |
| "eval_loss": 0.0030152201652526855, | |
| "eval_precision": 1.0, | |
| "eval_recall": 1.0, | |
| "eval_runtime": 0.0532, | |
| "eval_samples_per_second": 300.996, | |
| "eval_steps_per_second": 18.812, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 7.125, | |
| "grad_norm": 11.091121673583984, | |
| "learning_rate": 3.611111111111111e-05, | |
| "loss": 0.4382, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 7.25, | |
| "grad_norm": 0.02736804261803627, | |
| "learning_rate": 3.576388888888889e-05, | |
| "loss": 0.0007, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 7.375, | |
| "grad_norm": 0.06560361385345459, | |
| "learning_rate": 3.541666666666667e-05, | |
| "loss": 0.0012, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 7.5, | |
| "grad_norm": 0.033276110887527466, | |
| "learning_rate": 3.506944444444444e-05, | |
| "loss": 0.0009, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 7.625, | |
| "grad_norm": 0.02789870649576187, | |
| "learning_rate": 3.472222222222222e-05, | |
| "loss": 0.0009, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 7.75, | |
| "grad_norm": 0.024605700746178627, | |
| "learning_rate": 3.4375e-05, | |
| "loss": 0.0007, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 7.875, | |
| "grad_norm": 1.4100219011306763, | |
| "learning_rate": 3.402777777777778e-05, | |
| "loss": 0.0241, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "grad_norm": 0.01102516334503889, | |
| "learning_rate": 3.368055555555556e-05, | |
| "loss": 0.0004, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "eval_accuracy": 1.0, | |
| "eval_auc": 1.0, | |
| "eval_f1": 1.0, | |
| "eval_loss": 0.0015663951635360718, | |
| "eval_precision": 1.0, | |
| "eval_recall": 1.0, | |
| "eval_runtime": 0.06, | |
| "eval_samples_per_second": 266.724, | |
| "eval_steps_per_second": 16.67, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 8.125, | |
| "grad_norm": 0.025314731523394585, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 0.0009, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 8.25, | |
| "grad_norm": 0.019100826233625412, | |
| "learning_rate": 3.2986111111111115e-05, | |
| "loss": 0.0006, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 8.375, | |
| "grad_norm": 0.3341350555419922, | |
| "learning_rate": 3.263888888888889e-05, | |
| "loss": 0.0059, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 8.5, | |
| "grad_norm": 0.47374579310417175, | |
| "learning_rate": 3.229166666666667e-05, | |
| "loss": 0.0046, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 8.625, | |
| "grad_norm": 0.030372226610779762, | |
| "learning_rate": 3.194444444444444e-05, | |
| "loss": 0.0011, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 8.75, | |
| "grad_norm": 0.02839597873389721, | |
| "learning_rate": 3.159722222222222e-05, | |
| "loss": 0.0008, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 8.875, | |
| "grad_norm": 0.0297985952347517, | |
| "learning_rate": 3.125e-05, | |
| "loss": 0.001, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "grad_norm": 0.019845914095640182, | |
| "learning_rate": 3.090277777777778e-05, | |
| "loss": 0.0007, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "eval_accuracy": 1.0, | |
| "eval_auc": 1.0, | |
| "eval_f1": 1.0, | |
| "eval_loss": 0.0012908950448036194, | |
| "eval_precision": 1.0, | |
| "eval_recall": 1.0, | |
| "eval_runtime": 0.0567, | |
| "eval_samples_per_second": 282.131, | |
| "eval_steps_per_second": 17.633, | |
| "step": 72 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 160, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 20, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 5, | |
| "early_stopping_threshold": 0.01 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 5 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.463538601800499e+16, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |