{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4819277108433735, "eval_steps": 500, "global_step": 20, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "aux_loss": 8.112077713012695, "entropy": 0.5542473942041397, "epoch": 0.024096385542168676, "grad_norm": 12.316938400268555, "learning_rate": 0.0, "loss": 4.649446487426758, "mean_token_accuracy": 0.4230975955724716, "num_tokens": 3858.0, "step": 1 }, { "aux_loss": 8.104777336120605, "entropy": 0.5576090589165688, "epoch": 0.04819277108433735, "grad_norm": 11.46682357788086, "learning_rate": 5e-05, "loss": 4.360793590545654, "mean_token_accuracy": 0.4478432685136795, "num_tokens": 7881.0, "step": 2 }, { "aux_loss": 8.111183881759644, "entropy": 0.6309102177619934, "epoch": 0.07228915662650602, "grad_norm": 11.137980461120605, "learning_rate": 0.0001, "loss": 4.385745048522949, "mean_token_accuracy": 0.41679511964321136, "num_tokens": 11760.0, "step": 3 }, { "aux_loss": 8.115976572036743, "entropy": 0.8519729971885681, "epoch": 0.0963855421686747, "grad_norm": 8.42417049407959, "learning_rate": 9.924038765061042e-05, "loss": 3.61301326751709, "mean_token_accuracy": 0.4827836826443672, "num_tokens": 15787.0, "step": 4 }, { "aux_loss": 8.109588623046875, "entropy": 1.0264470428228378, "epoch": 0.12048192771084337, "grad_norm": 6.576476573944092, "learning_rate": 9.698463103929542e-05, "loss": 3.2094621658325195, "mean_token_accuracy": 0.49186357110738754, "num_tokens": 19714.0, "step": 5 }, { "aux_loss": 8.101800441741943, "entropy": 0.9288285374641418, "epoch": 0.14457831325301204, "grad_norm": 3.9594063758850098, "learning_rate": 9.330127018922194e-05, "loss": 2.2841343879699707, "mean_token_accuracy": 0.6183864176273346, "num_tokens": 23795.0, "step": 6 }, { "aux_loss": 8.114001750946045, "entropy": 1.2128139585256577, "epoch": 0.1686746987951807, "grad_norm": 6.381528377532959, "learning_rate": 8.83022221559489e-05, "loss": 2.5765533447265625, "mean_token_accuracy": 0.556639589369297, "num_tokens": 27782.0, "step": 7 }, { "aux_loss": 8.114900350570679, "entropy": 1.2565034925937653, "epoch": 0.1927710843373494, "grad_norm": 7.642035961151123, "learning_rate": 8.213938048432697e-05, "loss": 2.305990219116211, "mean_token_accuracy": 0.5857522785663605, "num_tokens": 31747.0, "step": 8 }, { "aux_loss": 8.110223054885864, "entropy": 1.3893296420574188, "epoch": 0.21686746987951808, "grad_norm": 3.114738941192627, "learning_rate": 7.500000000000001e-05, "loss": 2.2381560802459717, "mean_token_accuracy": 0.5757552534341812, "num_tokens": 35843.0, "step": 9 }, { "aux_loss": 8.100109577178955, "entropy": 1.3012381047010422, "epoch": 0.24096385542168675, "grad_norm": 2.429396390914917, "learning_rate": 6.710100716628344e-05, "loss": 1.8264377117156982, "mean_token_accuracy": 0.6413185894489288, "num_tokens": 39849.0, "step": 10 }, { "aux_loss": 8.10316777229309, "entropy": 1.3610867857933044, "epoch": 0.26506024096385544, "grad_norm": 2.0293450355529785, "learning_rate": 5.868240888334653e-05, "loss": 1.8157933950424194, "mean_token_accuracy": 0.6315982639789581, "num_tokens": 43801.0, "step": 11 }, { "aux_loss": 8.107757568359375, "entropy": 1.3844908773899078, "epoch": 0.2891566265060241, "grad_norm": 2.0684814453125, "learning_rate": 5e-05, "loss": 1.7225821018218994, "mean_token_accuracy": 0.6499734818935394, "num_tokens": 47890.0, "step": 12 }, { "aux_loss": 8.115497589111328, "entropy": 1.3100078850984573, "epoch": 0.3132530120481928, "grad_norm": 1.7339991331100464, "learning_rate": 4.131759111665349e-05, "loss": 1.5674974918365479, "mean_token_accuracy": 0.6856758892536163, "num_tokens": 51984.0, "step": 13 }, { "aux_loss": 8.117025375366211, "entropy": 1.4904241859912872, "epoch": 0.3373493975903614, "grad_norm": 2.1457736492156982, "learning_rate": 3.289899283371657e-05, "loss": 1.7369965314865112, "mean_token_accuracy": 0.6343775242567062, "num_tokens": 55908.0, "step": 14 }, { "aux_loss": 8.109899997711182, "entropy": 1.2758602499961853, "epoch": 0.3614457831325301, "grad_norm": 1.6773629188537598, "learning_rate": 2.500000000000001e-05, "loss": 1.4753482341766357, "mean_token_accuracy": 0.6864070445299149, "num_tokens": 59886.0, "step": 15 }, { "aux_loss": 8.102123498916626, "entropy": 1.4675858318805695, "epoch": 0.3855421686746988, "grad_norm": 1.817078709602356, "learning_rate": 1.7860619515673033e-05, "loss": 1.649685025215149, "mean_token_accuracy": 0.6493639498949051, "num_tokens": 63900.0, "step": 16 }, { "aux_loss": 8.11583948135376, "entropy": 1.6035236716270447, "epoch": 0.40963855421686746, "grad_norm": 2.301260471343994, "learning_rate": 1.1697777844051105e-05, "loss": 1.7476608753204346, "mean_token_accuracy": 0.6294074505567551, "num_tokens": 67857.0, "step": 17 }, { "aux_loss": 8.110026121139526, "entropy": 1.5781865417957306, "epoch": 0.43373493975903615, "grad_norm": 1.9237574338912964, "learning_rate": 6.698729810778065e-06, "loss": 1.7121555805206299, "mean_token_accuracy": 0.6350390315055847, "num_tokens": 71882.0, "step": 18 }, { "aux_loss": 8.128801584243774, "entropy": 1.5062502324581146, "epoch": 0.4578313253012048, "grad_norm": 2.0424976348876953, "learning_rate": 3.0153689607045845e-06, "loss": 1.6763399839401245, "mean_token_accuracy": 0.6374592185020447, "num_tokens": 75767.0, "step": 19 }, { "aux_loss": 8.109554052352905, "entropy": 1.2872552573680878, "epoch": 0.4819277108433735, "grad_norm": 1.4331955909729004, "learning_rate": 7.596123493895991e-07, "loss": 1.464625358581543, "mean_token_accuracy": 0.6907707750797272, "num_tokens": 79715.0, "step": 20 } ], "logging_steps": 1, "max_steps": 20, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 10, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.633858114438272e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }