| { | |
| "best_global_step": 210, | |
| "best_metric": 0.896, | |
| "best_model_checkpoint": "C:\\Users\\azizmohamed.miladi_a\\Desktop\\GuichetOI_ML\\models\\classifier\\checkpoint-210", | |
| "epoch": 6.0, | |
| "eval_steps": 500, | |
| "global_step": 210, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.2898550724637681, | |
| "grad_norm": 9.624526977539062, | |
| "learning_rate": 3.91304347826087e-06, | |
| "loss": 3.6916267395019533, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.5797101449275363, | |
| "grad_norm": 14.441962242126465, | |
| "learning_rate": 8.260869565217392e-06, | |
| "loss": 3.6258655548095704, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.8695652173913043, | |
| "grad_norm": 8.163778305053711, | |
| "learning_rate": 1.2608695652173915e-05, | |
| "loss": 3.4986854553222657, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_accuracy": 0.6, | |
| "eval_loss": 1.6575028896331787, | |
| "eval_runtime": 148.9919, | |
| "eval_samples_per_second": 0.839, | |
| "eval_steps_per_second": 0.107, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 1.144927536231884, | |
| "grad_norm": 31.98755645751953, | |
| "learning_rate": 1.6956521739130437e-05, | |
| "loss": 3.070163917541504, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 1.434782608695652, | |
| "grad_norm": 28.577415466308594, | |
| "learning_rate": 1.999519459156716e-05, | |
| "loss": 2.9280990600585937, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 1.7246376811594204, | |
| "grad_norm": 21.18294334411621, | |
| "learning_rate": 1.9909893526171745e-05, | |
| "loss": 2.360361099243164, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 14.277557373046875, | |
| "learning_rate": 1.9718853502700783e-05, | |
| "loss": 2.2741134643554686, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_accuracy": 0.776, | |
| "eval_loss": 0.9326786398887634, | |
| "eval_runtime": 146.9167, | |
| "eval_samples_per_second": 0.851, | |
| "eval_steps_per_second": 0.109, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 2.289855072463768, | |
| "grad_norm": 14.20412826538086, | |
| "learning_rate": 1.942411292580304e-05, | |
| "loss": 1.7156837463378907, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 2.579710144927536, | |
| "grad_norm": 16.971263885498047, | |
| "learning_rate": 1.902881668915688e-05, | |
| "loss": 1.8933340072631837, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 2.869565217391304, | |
| "grad_norm": 27.035112380981445, | |
| "learning_rate": 1.853718261932964e-05, | |
| "loss": 1.401157760620117, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_accuracy": 0.856, | |
| "eval_loss": 0.6431578993797302, | |
| "eval_runtime": 147.2608, | |
| "eval_samples_per_second": 0.849, | |
| "eval_steps_per_second": 0.109, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 3.1449275362318843, | |
| "grad_norm": 19.40919303894043, | |
| "learning_rate": 1.7954456471400393e-05, | |
| "loss": 1.2568418502807617, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 3.4347826086956523, | |
| "grad_norm": 33.98841094970703, | |
| "learning_rate": 1.7286855956544616e-05, | |
| "loss": 1.4773143768310546, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 3.7246376811594204, | |
| "grad_norm": 42.596099853515625, | |
| "learning_rate": 1.6541504398808633e-05, | |
| "loss": 1.325703239440918, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "grad_norm": 9.05463981628418, | |
| "learning_rate": 1.5726354728958736e-05, | |
| "loss": 0.936131477355957, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_accuracy": 0.848, | |
| "eval_loss": 0.5704618096351624, | |
| "eval_runtime": 146.5658, | |
| "eval_samples_per_second": 0.853, | |
| "eval_steps_per_second": 0.109, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 4.2898550724637685, | |
| "grad_norm": 22.953588485717773, | |
| "learning_rate": 1.4850104626393598e-05, | |
| "loss": 0.8413548469543457, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 4.579710144927536, | |
| "grad_norm": 11.811186790466309, | |
| "learning_rate": 1.392210371455913e-05, | |
| "loss": 0.8283905982971191, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 4.869565217391305, | |
| "grad_norm": 10.801919937133789, | |
| "learning_rate": 1.2952253800094467e-05, | |
| "loss": 1.2056690216064454, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_accuracy": 0.872, | |
| "eval_loss": 0.4952421486377716, | |
| "eval_runtime": 143.0417, | |
| "eval_samples_per_second": 0.874, | |
| "eval_steps_per_second": 0.112, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 5.144927536231884, | |
| "grad_norm": 7.648271560668945, | |
| "learning_rate": 1.1950903220161286e-05, | |
| "loss": 0.8253307342529297, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 5.434782608695652, | |
| "grad_norm": 31.05258560180664, | |
| "learning_rate": 1.0928736425274702e-05, | |
| "loss": 0.6119639873504639, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 5.72463768115942, | |
| "grad_norm": 18.84103775024414, | |
| "learning_rate": 9.89665997579133e-06, | |
| "loss": 0.8575582504272461, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "grad_norm": 11.322463989257812, | |
| "learning_rate": 8.865686168476458e-06, | |
| "loss": 0.74702467918396, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_accuracy": 0.896, | |
| "eval_loss": 0.44246727228164673, | |
| "eval_runtime": 147.6208, | |
| "eval_samples_per_second": 0.847, | |
| "eval_steps_per_second": 0.108, | |
| "step": 210 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 350, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 879062029664256.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |