| { | |
| "best_global_step": 200, | |
| "best_metric": 0.0003925538039766252, | |
| "best_model_checkpoint": "tr-sentiment-model\\checkpoint-200", | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 200, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 31.119638442993164, | |
| "learning_rate": 1.9600000000000002e-05, | |
| "loss": 0.8165468215942383, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 12.373876571655273, | |
| "learning_rate": 1.91e-05, | |
| "loss": 0.5896224498748779, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 10.269111633300781, | |
| "learning_rate": 1.86e-05, | |
| "loss": 0.6049572467803955, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 19.01222801208496, | |
| "learning_rate": 1.8100000000000003e-05, | |
| "loss": 0.6137516021728515, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 15.121289253234863, | |
| "learning_rate": 1.76e-05, | |
| "loss": 0.47811298370361327, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 15.115927696228027, | |
| "learning_rate": 1.7100000000000002e-05, | |
| "loss": 0.4332573890686035, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 11.673855781555176, | |
| "learning_rate": 1.66e-05, | |
| "loss": 0.28487935066223147, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 23.57175064086914, | |
| "learning_rate": 1.6100000000000002e-05, | |
| "loss": 0.20236294269561766, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 1.82466721534729, | |
| "learning_rate": 1.5600000000000003e-05, | |
| "loss": 0.11973601579666138, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 0.8704144954681396, | |
| "learning_rate": 1.5100000000000001e-05, | |
| "loss": 0.04779849350452423, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 0.5238797068595886, | |
| "learning_rate": 1.46e-05, | |
| "loss": 0.047495442628860476, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.25120118260383606, | |
| "learning_rate": 1.41e-05, | |
| "loss": 0.010647669434547424, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 0.1290791928768158, | |
| "learning_rate": 1.3600000000000002e-05, | |
| "loss": 0.008740333467721939, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 0.07909256219863892, | |
| "learning_rate": 1.3100000000000002e-05, | |
| "loss": 0.004749870300292969, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 0.09023287892341614, | |
| "learning_rate": 1.2600000000000001e-05, | |
| "loss": 0.002569456771016121, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.06576652824878693, | |
| "learning_rate": 1.2100000000000001e-05, | |
| "loss": 0.0023083891719579697, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 0.061244454234838486, | |
| "learning_rate": 1.16e-05, | |
| "loss": 0.0019361034035682678, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 0.05338131636381149, | |
| "learning_rate": 1.1100000000000002e-05, | |
| "loss": 0.001786946691572666, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 0.03496626392006874, | |
| "learning_rate": 1.0600000000000002e-05, | |
| "loss": 0.0014607097022235394, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.0410640686750412, | |
| "learning_rate": 1.0100000000000002e-05, | |
| "loss": 0.0014525197446346283, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_accuracy": 1.0, | |
| "eval_loss": 0.0007943756063468754, | |
| "eval_runtime": 26.5532, | |
| "eval_samples_per_second": 3.766, | |
| "eval_steps_per_second": 0.942, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 0.03476925566792488, | |
| "learning_rate": 9.600000000000001e-06, | |
| "loss": 0.001148415356874466, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 0.030995864421129227, | |
| "learning_rate": 9.100000000000001e-06, | |
| "loss": 0.0012477874755859376, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 0.022863049060106277, | |
| "learning_rate": 8.6e-06, | |
| "loss": 0.0009570728056132793, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 0.025992313399910927, | |
| "learning_rate": 8.1e-06, | |
| "loss": 0.0009571532718837261, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 0.02837001159787178, | |
| "learning_rate": 7.600000000000001e-06, | |
| "loss": 0.0009419848211109638, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 0.020482724532485008, | |
| "learning_rate": 7.100000000000001e-06, | |
| "loss": 0.000887809693813324, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 0.024091143161058426, | |
| "learning_rate": 6.600000000000001e-06, | |
| "loss": 0.0008436970412731171, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.019256388768553734, | |
| "learning_rate": 6.1e-06, | |
| "loss": 0.0007690337486565113, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 0.0230976864695549, | |
| "learning_rate": 5.600000000000001e-06, | |
| "loss": 0.0007221823558211327, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 0.01936892233788967, | |
| "learning_rate": 5.1e-06, | |
| "loss": 0.0007346693892031908, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 0.021034760400652885, | |
| "learning_rate": 4.600000000000001e-06, | |
| "loss": 0.0007220861036330462, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 0.01564309187233448, | |
| "learning_rate": 4.1e-06, | |
| "loss": 0.0006218148395419121, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 0.016282767057418823, | |
| "learning_rate": 3.6000000000000003e-06, | |
| "loss": 0.0006177808623760939, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 0.022097593173384666, | |
| "learning_rate": 3.1000000000000004e-06, | |
| "loss": 0.0006359980441629886, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 0.01770627871155739, | |
| "learning_rate": 2.6e-06, | |
| "loss": 0.0006778056267648935, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.020395858213305473, | |
| "learning_rate": 2.1000000000000002e-06, | |
| "loss": 0.0006870470941066742, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 0.016721302643418312, | |
| "learning_rate": 1.6000000000000001e-06, | |
| "loss": 0.0006109749898314476, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 0.02269955538213253, | |
| "learning_rate": 1.1e-06, | |
| "loss": 0.0007013730704784393, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 0.018245233222842216, | |
| "learning_rate": 6.000000000000001e-07, | |
| "loss": 0.0006785429082810879, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.01847158744931221, | |
| "learning_rate": 1.0000000000000001e-07, | |
| "loss": 0.0006762909702956677, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_accuracy": 1.0, | |
| "eval_loss": 0.0003925538039766252, | |
| "eval_runtime": 25.5298, | |
| "eval_samples_per_second": 3.917, | |
| "eval_steps_per_second": 0.979, | |
| "step": 200 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 200, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 210488844288000.0, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |