{ "best_global_step": 200, "best_metric": 0.0003925538039766252, "best_model_checkpoint": "tr-sentiment-model\\checkpoint-200", "epoch": 2.0, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05, "grad_norm": 31.119638442993164, "learning_rate": 1.9600000000000002e-05, "loss": 0.8165468215942383, "step": 5 }, { "epoch": 0.1, "grad_norm": 12.373876571655273, "learning_rate": 1.91e-05, "loss": 0.5896224498748779, "step": 10 }, { "epoch": 0.15, "grad_norm": 10.269111633300781, "learning_rate": 1.86e-05, "loss": 0.6049572467803955, "step": 15 }, { "epoch": 0.2, "grad_norm": 19.01222801208496, "learning_rate": 1.8100000000000003e-05, "loss": 0.6137516021728515, "step": 20 }, { "epoch": 0.25, "grad_norm": 15.121289253234863, "learning_rate": 1.76e-05, "loss": 0.47811298370361327, "step": 25 }, { "epoch": 0.3, "grad_norm": 15.115927696228027, "learning_rate": 1.7100000000000002e-05, "loss": 0.4332573890686035, "step": 30 }, { "epoch": 0.35, "grad_norm": 11.673855781555176, "learning_rate": 1.66e-05, "loss": 0.28487935066223147, "step": 35 }, { "epoch": 0.4, "grad_norm": 23.57175064086914, "learning_rate": 1.6100000000000002e-05, "loss": 0.20236294269561766, "step": 40 }, { "epoch": 0.45, "grad_norm": 1.82466721534729, "learning_rate": 1.5600000000000003e-05, "loss": 0.11973601579666138, "step": 45 }, { "epoch": 0.5, "grad_norm": 0.8704144954681396, "learning_rate": 1.5100000000000001e-05, "loss": 0.04779849350452423, "step": 50 }, { "epoch": 0.55, "grad_norm": 0.5238797068595886, "learning_rate": 1.46e-05, "loss": 0.047495442628860476, "step": 55 }, { "epoch": 0.6, "grad_norm": 0.25120118260383606, "learning_rate": 1.41e-05, "loss": 0.010647669434547424, "step": 60 }, { "epoch": 0.65, "grad_norm": 0.1290791928768158, "learning_rate": 1.3600000000000002e-05, "loss": 0.008740333467721939, "step": 65 }, { "epoch": 0.7, "grad_norm": 0.07909256219863892, "learning_rate": 1.3100000000000002e-05, "loss": 0.004749870300292969, "step": 70 }, { "epoch": 0.75, "grad_norm": 0.09023287892341614, "learning_rate": 1.2600000000000001e-05, "loss": 0.002569456771016121, "step": 75 }, { "epoch": 0.8, "grad_norm": 0.06576652824878693, "learning_rate": 1.2100000000000001e-05, "loss": 0.0023083891719579697, "step": 80 }, { "epoch": 0.85, "grad_norm": 0.061244454234838486, "learning_rate": 1.16e-05, "loss": 0.0019361034035682678, "step": 85 }, { "epoch": 0.9, "grad_norm": 0.05338131636381149, "learning_rate": 1.1100000000000002e-05, "loss": 0.001786946691572666, "step": 90 }, { "epoch": 0.95, "grad_norm": 0.03496626392006874, "learning_rate": 1.0600000000000002e-05, "loss": 0.0014607097022235394, "step": 95 }, { "epoch": 1.0, "grad_norm": 0.0410640686750412, "learning_rate": 1.0100000000000002e-05, "loss": 0.0014525197446346283, "step": 100 }, { "epoch": 1.0, "eval_accuracy": 1.0, "eval_loss": 0.0007943756063468754, "eval_runtime": 26.5532, "eval_samples_per_second": 3.766, "eval_steps_per_second": 0.942, "step": 100 }, { "epoch": 1.05, "grad_norm": 0.03476925566792488, "learning_rate": 9.600000000000001e-06, "loss": 0.001148415356874466, "step": 105 }, { "epoch": 1.1, "grad_norm": 0.030995864421129227, "learning_rate": 9.100000000000001e-06, "loss": 0.0012477874755859376, "step": 110 }, { "epoch": 1.15, "grad_norm": 0.022863049060106277, "learning_rate": 8.6e-06, "loss": 0.0009570728056132793, "step": 115 }, { "epoch": 1.2, "grad_norm": 0.025992313399910927, "learning_rate": 8.1e-06, "loss": 0.0009571532718837261, "step": 120 }, { "epoch": 1.25, "grad_norm": 0.02837001159787178, "learning_rate": 7.600000000000001e-06, "loss": 0.0009419848211109638, "step": 125 }, { "epoch": 1.3, "grad_norm": 0.020482724532485008, "learning_rate": 7.100000000000001e-06, "loss": 0.000887809693813324, "step": 130 }, { "epoch": 1.35, "grad_norm": 0.024091143161058426, "learning_rate": 6.600000000000001e-06, "loss": 0.0008436970412731171, "step": 135 }, { "epoch": 1.4, "grad_norm": 0.019256388768553734, "learning_rate": 6.1e-06, "loss": 0.0007690337486565113, "step": 140 }, { "epoch": 1.45, "grad_norm": 0.0230976864695549, "learning_rate": 5.600000000000001e-06, "loss": 0.0007221823558211327, "step": 145 }, { "epoch": 1.5, "grad_norm": 0.01936892233788967, "learning_rate": 5.1e-06, "loss": 0.0007346693892031908, "step": 150 }, { "epoch": 1.55, "grad_norm": 0.021034760400652885, "learning_rate": 4.600000000000001e-06, "loss": 0.0007220861036330462, "step": 155 }, { "epoch": 1.6, "grad_norm": 0.01564309187233448, "learning_rate": 4.1e-06, "loss": 0.0006218148395419121, "step": 160 }, { "epoch": 1.65, "grad_norm": 0.016282767057418823, "learning_rate": 3.6000000000000003e-06, "loss": 0.0006177808623760939, "step": 165 }, { "epoch": 1.7, "grad_norm": 0.022097593173384666, "learning_rate": 3.1000000000000004e-06, "loss": 0.0006359980441629886, "step": 170 }, { "epoch": 1.75, "grad_norm": 0.01770627871155739, "learning_rate": 2.6e-06, "loss": 0.0006778056267648935, "step": 175 }, { "epoch": 1.8, "grad_norm": 0.020395858213305473, "learning_rate": 2.1000000000000002e-06, "loss": 0.0006870470941066742, "step": 180 }, { "epoch": 1.85, "grad_norm": 0.016721302643418312, "learning_rate": 1.6000000000000001e-06, "loss": 0.0006109749898314476, "step": 185 }, { "epoch": 1.9, "grad_norm": 0.02269955538213253, "learning_rate": 1.1e-06, "loss": 0.0007013730704784393, "step": 190 }, { "epoch": 1.95, "grad_norm": 0.018245233222842216, "learning_rate": 6.000000000000001e-07, "loss": 0.0006785429082810879, "step": 195 }, { "epoch": 2.0, "grad_norm": 0.01847158744931221, "learning_rate": 1.0000000000000001e-07, "loss": 0.0006762909702956677, "step": 200 }, { "epoch": 2.0, "eval_accuracy": 1.0, "eval_loss": 0.0003925538039766252, "eval_runtime": 25.5298, "eval_samples_per_second": 3.917, "eval_steps_per_second": 0.979, "step": 200 } ], "logging_steps": 5, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 210488844288000.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }