| { |
| "best_metric": 0.09516655653715134, |
| "best_model_checkpoint": "/home/philipp.meier/author_writing_sentences/outputs/specific/ernie/macro/easy_512/checkpoint-1512", |
| "epoch": 9.999586811007354, |
| "eval_steps": 500, |
| "global_step": 15120, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.3305511941161887, |
| "grad_norm": 2.844763994216919, |
| "learning_rate": 4.834656084656085e-05, |
| "loss": 0.1778, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.6611023882323774, |
| "grad_norm": 2.216350555419922, |
| "learning_rate": 4.669312169312169e-05, |
| "loss": 0.1443, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.9916535823485663, |
| "grad_norm": 8.136266708374023, |
| "learning_rate": 4.503968253968254e-05, |
| "loss": 0.1292, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.9995868110073548, |
| "eval_f1": 0.9527436209888852, |
| "eval_loss": 0.09516655653715134, |
| "eval_runtime": 88.8726, |
| "eval_samples_per_second": 57.599, |
| "eval_steps_per_second": 14.403, |
| "step": 1512 |
| }, |
| { |
| "epoch": 1.3226179654574002, |
| "grad_norm": 8.809748649597168, |
| "learning_rate": 4.3386243386243384e-05, |
| "loss": 0.0895, |
| "step": 2000 |
| }, |
| { |
| "epoch": 1.6531691595735891, |
| "grad_norm": 0.4540178179740906, |
| "learning_rate": 4.173280423280423e-05, |
| "loss": 0.0849, |
| "step": 2500 |
| }, |
| { |
| "epoch": 1.9837203536897778, |
| "grad_norm": 14.030110359191895, |
| "learning_rate": 4.007936507936508e-05, |
| "loss": 0.085, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.999586811007355, |
| "eval_f1": 0.9506637797905222, |
| "eval_loss": 0.12027066200971603, |
| "eval_runtime": 88.8085, |
| "eval_samples_per_second": 57.641, |
| "eval_steps_per_second": 14.413, |
| "step": 3024 |
| }, |
| { |
| "epoch": 2.3146847367986116, |
| "grad_norm": 0.08342691510915756, |
| "learning_rate": 3.8425925925925924e-05, |
| "loss": 0.0554, |
| "step": 3500 |
| }, |
| { |
| "epoch": 2.6452359309148004, |
| "grad_norm": 0.12781363725662231, |
| "learning_rate": 3.677248677248677e-05, |
| "loss": 0.0603, |
| "step": 4000 |
| }, |
| { |
| "epoch": 2.975787125030989, |
| "grad_norm": 0.14807908236980438, |
| "learning_rate": 3.511904761904762e-05, |
| "loss": 0.0578, |
| "step": 4500 |
| }, |
| { |
| "epoch": 2.999586811007355, |
| "eval_f1": 0.9429987599618843, |
| "eval_loss": 0.1923331469297409, |
| "eval_runtime": 88.636, |
| "eval_samples_per_second": 57.753, |
| "eval_steps_per_second": 14.441, |
| "step": 4536 |
| }, |
| { |
| "epoch": 3.3067515081398233, |
| "grad_norm": 0.13493597507476807, |
| "learning_rate": 3.3465608465608464e-05, |
| "loss": 0.0336, |
| "step": 5000 |
| }, |
| { |
| "epoch": 3.637302702256012, |
| "grad_norm": 5.746713638305664, |
| "learning_rate": 3.181216931216931e-05, |
| "loss": 0.0385, |
| "step": 5500 |
| }, |
| { |
| "epoch": 3.9678538963722008, |
| "grad_norm": 8.010566711425781, |
| "learning_rate": 3.0158730158730158e-05, |
| "loss": 0.0397, |
| "step": 6000 |
| }, |
| { |
| "epoch": 3.999586811007355, |
| "eval_f1": 0.9502365475637948, |
| "eval_loss": 0.14363159239292145, |
| "eval_runtime": 88.7191, |
| "eval_samples_per_second": 57.699, |
| "eval_steps_per_second": 14.428, |
| "step": 6048 |
| }, |
| { |
| "epoch": 4.298818279481035, |
| "grad_norm": 24.7757511138916, |
| "learning_rate": 2.8505291005291007e-05, |
| "loss": 0.0297, |
| "step": 6500 |
| }, |
| { |
| "epoch": 4.629369473597223, |
| "grad_norm": 24.24225616455078, |
| "learning_rate": 2.6851851851851855e-05, |
| "loss": 0.024, |
| "step": 7000 |
| }, |
| { |
| "epoch": 4.959920667713412, |
| "grad_norm": 0.18736685812473297, |
| "learning_rate": 2.5198412698412697e-05, |
| "loss": 0.0257, |
| "step": 7500 |
| }, |
| { |
| "epoch": 4.9995868110073545, |
| "eval_f1": 0.9588887459263877, |
| "eval_loss": 0.18245960772037506, |
| "eval_runtime": 88.6444, |
| "eval_samples_per_second": 57.748, |
| "eval_steps_per_second": 14.44, |
| "step": 7560 |
| }, |
| { |
| "epoch": 5.290885050822246, |
| "grad_norm": 0.19512176513671875, |
| "learning_rate": 2.3544973544973546e-05, |
| "loss": 0.0184, |
| "step": 8000 |
| }, |
| { |
| "epoch": 5.621436244938435, |
| "grad_norm": 0.03989516571164131, |
| "learning_rate": 2.1891534391534395e-05, |
| "loss": 0.0205, |
| "step": 8500 |
| }, |
| { |
| "epoch": 5.951987439054624, |
| "grad_norm": 0.006726603023707867, |
| "learning_rate": 2.023809523809524e-05, |
| "loss": 0.0179, |
| "step": 9000 |
| }, |
| { |
| "epoch": 5.9995868110073545, |
| "eval_f1": 0.9525947889542465, |
| "eval_loss": 0.2241736799478531, |
| "eval_runtime": 88.6595, |
| "eval_samples_per_second": 57.738, |
| "eval_steps_per_second": 14.437, |
| "step": 9072 |
| }, |
| { |
| "epoch": 6.282951822163458, |
| "grad_norm": 0.06540829688310623, |
| "learning_rate": 1.8584656084656086e-05, |
| "loss": 0.0103, |
| "step": 9500 |
| }, |
| { |
| "epoch": 6.613503016279647, |
| "grad_norm": 0.004820807836949825, |
| "learning_rate": 1.693121693121693e-05, |
| "loss": 0.013, |
| "step": 10000 |
| }, |
| { |
| "epoch": 6.944054210395835, |
| "grad_norm": 7.895081520080566, |
| "learning_rate": 1.527777777777778e-05, |
| "loss": 0.0127, |
| "step": 10500 |
| }, |
| { |
| "epoch": 6.9995868110073545, |
| "eval_f1": 0.9584218875344421, |
| "eval_loss": 0.1747281849384308, |
| "eval_runtime": 88.6774, |
| "eval_samples_per_second": 57.726, |
| "eval_steps_per_second": 14.434, |
| "step": 10584 |
| }, |
| { |
| "epoch": 7.275018593504669, |
| "grad_norm": 0.03834864869713783, |
| "learning_rate": 1.3624338624338626e-05, |
| "loss": 0.0103, |
| "step": 11000 |
| }, |
| { |
| "epoch": 7.6055697876208574, |
| "grad_norm": 0.005743283778429031, |
| "learning_rate": 1.1970899470899471e-05, |
| "loss": 0.0086, |
| "step": 11500 |
| }, |
| { |
| "epoch": 7.936120981737046, |
| "grad_norm": 0.0013776550767943263, |
| "learning_rate": 1.0317460317460318e-05, |
| "loss": 0.0081, |
| "step": 12000 |
| }, |
| { |
| "epoch": 7.9995868110073545, |
| "eval_f1": 0.9579563377597123, |
| "eval_loss": 0.22722405195236206, |
| "eval_runtime": 88.546, |
| "eval_samples_per_second": 57.812, |
| "eval_steps_per_second": 14.456, |
| "step": 12096 |
| }, |
| { |
| "epoch": 8.267085364845881, |
| "grad_norm": 0.003926456440240145, |
| "learning_rate": 8.664021164021165e-06, |
| "loss": 0.006, |
| "step": 12500 |
| }, |
| { |
| "epoch": 8.59763655896207, |
| "grad_norm": 0.00048606126802042127, |
| "learning_rate": 7.010582010582011e-06, |
| "loss": 0.0037, |
| "step": 13000 |
| }, |
| { |
| "epoch": 8.928187753078259, |
| "grad_norm": 0.03147663176059723, |
| "learning_rate": 5.357142857142857e-06, |
| "loss": 0.0047, |
| "step": 13500 |
| }, |
| { |
| "epoch": 8.999586811007354, |
| "eval_f1": 0.956967216467543, |
| "eval_loss": 0.22612209618091583, |
| "eval_runtime": 88.6133, |
| "eval_samples_per_second": 57.768, |
| "eval_steps_per_second": 14.445, |
| "step": 13608 |
| }, |
| { |
| "epoch": 9.259152136187092, |
| "grad_norm": 0.003239526879042387, |
| "learning_rate": 3.7037037037037037e-06, |
| "loss": 0.0024, |
| "step": 14000 |
| }, |
| { |
| "epoch": 9.58970333030328, |
| "grad_norm": 0.0006155924056656659, |
| "learning_rate": 2.0502645502645504e-06, |
| "loss": 0.0031, |
| "step": 14500 |
| }, |
| { |
| "epoch": 9.92025452441947, |
| "grad_norm": 0.0004118815122637898, |
| "learning_rate": 3.9682539682539683e-07, |
| "loss": 0.0022, |
| "step": 15000 |
| }, |
| { |
| "epoch": 9.999586811007354, |
| "eval_f1": 0.9576523514471682, |
| "eval_loss": 0.24551521241664886, |
| "eval_runtime": 88.6527, |
| "eval_samples_per_second": 57.742, |
| "eval_steps_per_second": 14.438, |
| "step": 15120 |
| } |
| ], |
| "logging_steps": 500, |
| "max_steps": 15120, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 10, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.2732259702136832e+17, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|