tiny-pickle-35b-LoRA / checkpoint-20 /trainer_state.json
vsan's picture
Add files using upload-large-folder tool
eaa124f verified
Raw
History Blame Contribute Delete
7.42 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.4819277108433735,
"eval_steps": 500,
"global_step": 20,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"aux_loss": 8.112077713012695,
"entropy": 0.5542473942041397,
"epoch": 0.024096385542168676,
"grad_norm": 12.316938400268555,
"learning_rate": 0.0,
"loss": 4.649446487426758,
"mean_token_accuracy": 0.4230975955724716,
"num_tokens": 3858.0,
"step": 1
},
{
"aux_loss": 8.104777336120605,
"entropy": 0.5576090589165688,
"epoch": 0.04819277108433735,
"grad_norm": 11.46682357788086,
"learning_rate": 5e-05,
"loss": 4.360793590545654,
"mean_token_accuracy": 0.4478432685136795,
"num_tokens": 7881.0,
"step": 2
},
{
"aux_loss": 8.111183881759644,
"entropy": 0.6309102177619934,
"epoch": 0.07228915662650602,
"grad_norm": 11.137980461120605,
"learning_rate": 0.0001,
"loss": 4.385745048522949,
"mean_token_accuracy": 0.41679511964321136,
"num_tokens": 11760.0,
"step": 3
},
{
"aux_loss": 8.115976572036743,
"entropy": 0.8519729971885681,
"epoch": 0.0963855421686747,
"grad_norm": 8.42417049407959,
"learning_rate": 9.924038765061042e-05,
"loss": 3.61301326751709,
"mean_token_accuracy": 0.4827836826443672,
"num_tokens": 15787.0,
"step": 4
},
{
"aux_loss": 8.109588623046875,
"entropy": 1.0264470428228378,
"epoch": 0.12048192771084337,
"grad_norm": 6.576476573944092,
"learning_rate": 9.698463103929542e-05,
"loss": 3.2094621658325195,
"mean_token_accuracy": 0.49186357110738754,
"num_tokens": 19714.0,
"step": 5
},
{
"aux_loss": 8.101800441741943,
"entropy": 0.9288285374641418,
"epoch": 0.14457831325301204,
"grad_norm": 3.9594063758850098,
"learning_rate": 9.330127018922194e-05,
"loss": 2.2841343879699707,
"mean_token_accuracy": 0.6183864176273346,
"num_tokens": 23795.0,
"step": 6
},
{
"aux_loss": 8.114001750946045,
"entropy": 1.2128139585256577,
"epoch": 0.1686746987951807,
"grad_norm": 6.381528377532959,
"learning_rate": 8.83022221559489e-05,
"loss": 2.5765533447265625,
"mean_token_accuracy": 0.556639589369297,
"num_tokens": 27782.0,
"step": 7
},
{
"aux_loss": 8.114900350570679,
"entropy": 1.2565034925937653,
"epoch": 0.1927710843373494,
"grad_norm": 7.642035961151123,
"learning_rate": 8.213938048432697e-05,
"loss": 2.305990219116211,
"mean_token_accuracy": 0.5857522785663605,
"num_tokens": 31747.0,
"step": 8
},
{
"aux_loss": 8.110223054885864,
"entropy": 1.3893296420574188,
"epoch": 0.21686746987951808,
"grad_norm": 3.114738941192627,
"learning_rate": 7.500000000000001e-05,
"loss": 2.2381560802459717,
"mean_token_accuracy": 0.5757552534341812,
"num_tokens": 35843.0,
"step": 9
},
{
"aux_loss": 8.100109577178955,
"entropy": 1.3012381047010422,
"epoch": 0.24096385542168675,
"grad_norm": 2.429396390914917,
"learning_rate": 6.710100716628344e-05,
"loss": 1.8264377117156982,
"mean_token_accuracy": 0.6413185894489288,
"num_tokens": 39849.0,
"step": 10
},
{
"aux_loss": 8.10316777229309,
"entropy": 1.3610867857933044,
"epoch": 0.26506024096385544,
"grad_norm": 2.0293450355529785,
"learning_rate": 5.868240888334653e-05,
"loss": 1.8157933950424194,
"mean_token_accuracy": 0.6315982639789581,
"num_tokens": 43801.0,
"step": 11
},
{
"aux_loss": 8.107757568359375,
"entropy": 1.3844908773899078,
"epoch": 0.2891566265060241,
"grad_norm": 2.0684814453125,
"learning_rate": 5e-05,
"loss": 1.7225821018218994,
"mean_token_accuracy": 0.6499734818935394,
"num_tokens": 47890.0,
"step": 12
},
{
"aux_loss": 8.115497589111328,
"entropy": 1.3100078850984573,
"epoch": 0.3132530120481928,
"grad_norm": 1.7339991331100464,
"learning_rate": 4.131759111665349e-05,
"loss": 1.5674974918365479,
"mean_token_accuracy": 0.6856758892536163,
"num_tokens": 51984.0,
"step": 13
},
{
"aux_loss": 8.117025375366211,
"entropy": 1.4904241859912872,
"epoch": 0.3373493975903614,
"grad_norm": 2.1457736492156982,
"learning_rate": 3.289899283371657e-05,
"loss": 1.7369965314865112,
"mean_token_accuracy": 0.6343775242567062,
"num_tokens": 55908.0,
"step": 14
},
{
"aux_loss": 8.109899997711182,
"entropy": 1.2758602499961853,
"epoch": 0.3614457831325301,
"grad_norm": 1.6773629188537598,
"learning_rate": 2.500000000000001e-05,
"loss": 1.4753482341766357,
"mean_token_accuracy": 0.6864070445299149,
"num_tokens": 59886.0,
"step": 15
},
{
"aux_loss": 8.102123498916626,
"entropy": 1.4675858318805695,
"epoch": 0.3855421686746988,
"grad_norm": 1.817078709602356,
"learning_rate": 1.7860619515673033e-05,
"loss": 1.649685025215149,
"mean_token_accuracy": 0.6493639498949051,
"num_tokens": 63900.0,
"step": 16
},
{
"aux_loss": 8.11583948135376,
"entropy": 1.6035236716270447,
"epoch": 0.40963855421686746,
"grad_norm": 2.301260471343994,
"learning_rate": 1.1697777844051105e-05,
"loss": 1.7476608753204346,
"mean_token_accuracy": 0.6294074505567551,
"num_tokens": 67857.0,
"step": 17
},
{
"aux_loss": 8.110026121139526,
"entropy": 1.5781865417957306,
"epoch": 0.43373493975903615,
"grad_norm": 1.9237574338912964,
"learning_rate": 6.698729810778065e-06,
"loss": 1.7121555805206299,
"mean_token_accuracy": 0.6350390315055847,
"num_tokens": 71882.0,
"step": 18
},
{
"aux_loss": 8.128801584243774,
"entropy": 1.5062502324581146,
"epoch": 0.4578313253012048,
"grad_norm": 2.0424976348876953,
"learning_rate": 3.0153689607045845e-06,
"loss": 1.6763399839401245,
"mean_token_accuracy": 0.6374592185020447,
"num_tokens": 75767.0,
"step": 19
},
{
"aux_loss": 8.109554052352905,
"entropy": 1.2872552573680878,
"epoch": 0.4819277108433735,
"grad_norm": 1.4331955909729004,
"learning_rate": 7.596123493895991e-07,
"loss": 1.464625358581543,
"mean_token_accuracy": 0.6907707750797272,
"num_tokens": 79715.0,
"step": 20
}
],
"logging_steps": 1,
"max_steps": 20,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 10,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.633858114438272e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}