GaMS3-12B-Instruct-Lex-2-test1 / trainer_state.json
tknez's picture
Upload folder using huggingface_hub
aae5814 verified
Raw
History Blame Contribute Delete
13.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.3955925826390754,
"eval_steps": 100,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.08599838753023381,
"grad_norm": 20.39691162109375,
"learning_rate": 4e-08,
"loss": 1.1993448257446289,
"num_input_tokens_seen": 95768,
"step": 5,
"train_runtime": 130.2777,
"train_tokens_per_second": 735.107
},
{
"epoch": 0.17199677506046762,
"grad_norm": 20.53337860107422,
"learning_rate": 9e-08,
"loss": 1.23364200592041,
"num_input_tokens_seen": 192088,
"step": 10,
"train_runtime": 256.1595,
"train_tokens_per_second": 749.876
},
{
"epoch": 0.25799516259070143,
"grad_norm": 17.26736068725586,
"learning_rate": 1.4e-07,
"loss": 1.2103577613830567,
"num_input_tokens_seen": 285904,
"step": 15,
"train_runtime": 381.9483,
"train_tokens_per_second": 748.541
},
{
"epoch": 0.34399355012093524,
"grad_norm": 13.094156265258789,
"learning_rate": 1.8999999999999998e-07,
"loss": 1.1606547355651855,
"num_input_tokens_seen": 380136,
"step": 20,
"train_runtime": 507.8013,
"train_tokens_per_second": 748.592
},
{
"epoch": 0.42999193765116905,
"grad_norm": 8.614981651306152,
"learning_rate": 2.4e-07,
"loss": 1.1257909774780273,
"num_input_tokens_seen": 473768,
"step": 25,
"train_runtime": 634.7096,
"train_tokens_per_second": 746.433
},
{
"epoch": 0.5159903251814029,
"grad_norm": 6.893142223358154,
"learning_rate": 2.9e-07,
"loss": 1.0529449462890625,
"num_input_tokens_seen": 570960,
"step": 30,
"train_runtime": 760.0374,
"train_tokens_per_second": 751.226
},
{
"epoch": 0.6019887127116367,
"grad_norm": 6.435474395751953,
"learning_rate": 3.4000000000000003e-07,
"loss": 0.9501470565795899,
"num_input_tokens_seen": 666904,
"step": 35,
"train_runtime": 885.8858,
"train_tokens_per_second": 752.81
},
{
"epoch": 0.6879871002418705,
"grad_norm": 6.33709192276001,
"learning_rate": 3.8999999999999997e-07,
"loss": 0.9997085571289063,
"num_input_tokens_seen": 759040,
"step": 40,
"train_runtime": 1011.9639,
"train_tokens_per_second": 750.066
},
{
"epoch": 0.7739854877721043,
"grad_norm": 6.392234802246094,
"learning_rate": 4.3999999999999997e-07,
"loss": 0.941748046875,
"num_input_tokens_seen": 854112,
"step": 45,
"train_runtime": 1137.7802,
"train_tokens_per_second": 750.683
},
{
"epoch": 0.8599838753023381,
"grad_norm": 6.084305763244629,
"learning_rate": 4.9e-07,
"loss": 0.8405242919921875,
"num_input_tokens_seen": 950760,
"step": 50,
"train_runtime": 1263.8056,
"train_tokens_per_second": 752.299
},
{
"epoch": 0.9459822628325719,
"grad_norm": 5.806552886962891,
"learning_rate": 5.4e-07,
"loss": 0.8304224014282227,
"num_input_tokens_seen": 1044848,
"step": 55,
"train_runtime": 1389.4662,
"train_tokens_per_second": 751.978
},
{
"epoch": 1.0171996775060468,
"grad_norm": 5.317915439605713,
"learning_rate": 5.9e-07,
"loss": 0.7544718265533448,
"num_input_tokens_seen": 1125192,
"step": 60,
"train_runtime": 1494.191,
"train_tokens_per_second": 753.044
},
{
"epoch": 1.1031980650362805,
"grad_norm": 5.279268741607666,
"learning_rate": 6.4e-07,
"loss": 0.7000977993011475,
"num_input_tokens_seen": 1220824,
"step": 65,
"train_runtime": 1619.8853,
"train_tokens_per_second": 753.648
},
{
"epoch": 1.1891964525665144,
"grad_norm": 5.333123683929443,
"learning_rate": 6.9e-07,
"loss": 0.6922206878662109,
"num_input_tokens_seen": 1314816,
"step": 70,
"train_runtime": 1745.5942,
"train_tokens_per_second": 753.22
},
{
"epoch": 1.275194840096748,
"grad_norm": 5.560202598571777,
"learning_rate": 7.4e-07,
"loss": 0.6772861003875732,
"num_input_tokens_seen": 1410040,
"step": 75,
"train_runtime": 1871.2742,
"train_tokens_per_second": 753.519
},
{
"epoch": 1.361193227626982,
"grad_norm": 5.5269389152526855,
"learning_rate": 7.9e-07,
"loss": 0.6707859992980957,
"num_input_tokens_seen": 1506248,
"step": 80,
"train_runtime": 1997.6031,
"train_tokens_per_second": 754.028
},
{
"epoch": 1.4471916151572157,
"grad_norm": 5.004036903381348,
"learning_rate": 8.399999999999999e-07,
"loss": 0.6331174850463868,
"num_input_tokens_seen": 1599296,
"step": 85,
"train_runtime": 2123.3979,
"train_tokens_per_second": 753.178
},
{
"epoch": 1.5331900026874496,
"grad_norm": 5.266488552093506,
"learning_rate": 8.9e-07,
"loss": 0.6387096405029297,
"num_input_tokens_seen": 1693400,
"step": 90,
"train_runtime": 2248.9337,
"train_tokens_per_second": 752.979
},
{
"epoch": 1.6191883902176833,
"grad_norm": 4.819321155548096,
"learning_rate": 9.399999999999999e-07,
"loss": 0.5934211730957031,
"num_input_tokens_seen": 1787000,
"step": 95,
"train_runtime": 2374.4655,
"train_tokens_per_second": 752.59
},
{
"epoch": 1.7051867777479173,
"grad_norm": 4.935013771057129,
"learning_rate": 9.9e-07,
"loss": 0.6045561790466308,
"num_input_tokens_seen": 1882104,
"step": 100,
"train_runtime": 2500.4896,
"train_tokens_per_second": 752.694
},
{
"epoch": 1.7051867777479173,
"eval_loss": 0.5743909478187561,
"eval_runtime": 10.9213,
"eval_samples_per_second": 71.786,
"eval_steps_per_second": 17.947,
"num_input_tokens_seen": 1882104,
"step": 100
},
{
"epoch": 1.7911851652781512,
"grad_norm": 4.882491588592529,
"learning_rate": 9.9983558411534e-07,
"loss": 0.5929690361022949,
"num_input_tokens_seen": 1975008,
"step": 105,
"train_runtime": 2637.3808,
"train_tokens_per_second": 748.852
},
{
"epoch": 1.877183552808385,
"grad_norm": 4.714536190032959,
"learning_rate": 9.991678299006205e-07,
"loss": 0.5646411418914795,
"num_input_tokens_seen": 2071992,
"step": 110,
"train_runtime": 2763.47,
"train_tokens_per_second": 749.779
},
{
"epoch": 1.9631819403386186,
"grad_norm": 5.484632968902588,
"learning_rate": 9.979871469976195e-07,
"loss": 0.5584239006042481,
"num_input_tokens_seen": 2169008,
"step": 115,
"train_runtime": 2889.0567,
"train_tokens_per_second": 750.767
},
{
"epoch": 2.0343993550120936,
"grad_norm": 4.425460338592529,
"learning_rate": 9.962947486378324e-07,
"loss": 0.5410833358764648,
"num_input_tokens_seen": 2247720,
"step": 120,
"train_runtime": 2993.1338,
"train_tokens_per_second": 750.959
},
{
"epoch": 2.1203977425423273,
"grad_norm": 4.904783725738525,
"learning_rate": 9.940923738749777e-07,
"loss": 0.42338247299194337,
"num_input_tokens_seen": 2345128,
"step": 125,
"train_runtime": 3118.6594,
"train_tokens_per_second": 751.967
},
{
"epoch": 2.206396130072561,
"grad_norm": 5.408900260925293,
"learning_rate": 9.91382285798002e-07,
"loss": 0.4106863021850586,
"num_input_tokens_seen": 2439936,
"step": 130,
"train_runtime": 3244.2671,
"train_tokens_per_second": 752.076
},
{
"epoch": 2.292394517602795,
"grad_norm": 5.198470115661621,
"learning_rate": 9.88167269205602e-07,
"loss": 0.4100049495697021,
"num_input_tokens_seen": 2534144,
"step": 135,
"train_runtime": 3369.5649,
"train_tokens_per_second": 752.069
},
{
"epoch": 2.378392905133029,
"grad_norm": 5.204331398010254,
"learning_rate": 9.844506277446576e-07,
"loss": 0.4073524475097656,
"num_input_tokens_seen": 2629448,
"step": 140,
"train_runtime": 3495.376,
"train_tokens_per_second": 752.265
},
{
"epoch": 2.4643912926632625,
"grad_norm": 5.216585159301758,
"learning_rate": 9.802361805155097e-07,
"loss": 0.39515421390533445,
"num_input_tokens_seen": 2727304,
"step": 145,
"train_runtime": 3621.1152,
"train_tokens_per_second": 753.167
},
{
"epoch": 2.550389680193496,
"grad_norm": 5.4826226234436035,
"learning_rate": 9.755282581475767e-07,
"loss": 0.4133957862854004,
"num_input_tokens_seen": 2821616,
"step": 150,
"train_runtime": 3747.4831,
"train_tokens_per_second": 752.936
},
{
"epoch": 2.63638806772373,
"grad_norm": 5.135773181915283,
"learning_rate": 9.703316983493412e-07,
"loss": 0.4020789623260498,
"num_input_tokens_seen": 2916400,
"step": 155,
"train_runtime": 3873.6018,
"train_tokens_per_second": 752.891
},
{
"epoch": 2.722386455253964,
"grad_norm": 5.220492839813232,
"learning_rate": 9.646518409372759e-07,
"loss": 0.38811378479003905,
"num_input_tokens_seen": 3011424,
"step": 160,
"train_runtime": 3999.9318,
"train_tokens_per_second": 752.869
},
{
"epoch": 2.8083848427841978,
"grad_norm": 5.276327133178711,
"learning_rate": 9.584945223488226e-07,
"loss": 0.40136079788208007,
"num_input_tokens_seen": 3105176,
"step": 165,
"train_runtime": 4126.3897,
"train_tokens_per_second": 752.516
},
{
"epoch": 2.8943832303144315,
"grad_norm": 5.527720928192139,
"learning_rate": 9.518660696450567e-07,
"loss": 0.3835641860961914,
"num_input_tokens_seen": 3199872,
"step": 170,
"train_runtime": 4252.3976,
"train_tokens_per_second": 752.487
},
{
"epoch": 2.9803816178446656,
"grad_norm": 5.367305755615234,
"learning_rate": 9.447732940092059e-07,
"loss": 0.37801907062530515,
"num_input_tokens_seen": 3293376,
"step": 175,
"train_runtime": 4378.5735,
"train_tokens_per_second": 752.157
},
{
"epoch": 3.05159903251814,
"grad_norm": 4.809284210205078,
"learning_rate": 9.372234837476977e-07,
"loss": 0.31443004608154296,
"num_input_tokens_seen": 3372136,
"step": 180,
"train_runtime": 4483.0506,
"train_tokens_per_second": 752.197
},
{
"epoch": 3.1375974200483743,
"grad_norm": 6.2316436767578125,
"learning_rate": 9.29224396800933e-07,
"loss": 0.22384190559387207,
"num_input_tokens_seen": 3466240,
"step": 185,
"train_runtime": 4609.5773,
"train_tokens_per_second": 751.965
},
{
"epoch": 3.223595807578608,
"grad_norm": 7.395747661590576,
"learning_rate": 9.207842527714765e-07,
"loss": 0.23196635246276856,
"num_input_tokens_seen": 3562616,
"step": 190,
"train_runtime": 4735.6611,
"train_tokens_per_second": 752.295
},
{
"epoch": 3.3095941951088417,
"grad_norm": 5.527756214141846,
"learning_rate": 9.119117244778607e-07,
"loss": 0.22302393913269042,
"num_input_tokens_seen": 3658328,
"step": 195,
"train_runtime": 4861.5497,
"train_tokens_per_second": 752.502
},
{
"epoch": 3.3955925826390754,
"grad_norm": 5.768650054931641,
"learning_rate": 9.02615929042678e-07,
"loss": 0.23009986877441407,
"num_input_tokens_seen": 3754416,
"step": 200,
"train_runtime": 4987.5371,
"train_tokens_per_second": 752.76
},
{
"epoch": 3.3955925826390754,
"eval_loss": 0.6245584487915039,
"eval_runtime": 10.9548,
"eval_samples_per_second": 71.567,
"eval_steps_per_second": 17.892,
"num_input_tokens_seen": 3754416,
"step": 200
}
],
"logging_steps": 5,
"max_steps": 590,
"num_input_tokens_seen": 3754416,
"num_train_epochs": 10,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.875151003100119e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}