GaMS3-12B-Instruct-Lex-2-LoRA / trainer_state.json
tknez's picture
Upload folder using huggingface_hub
426a9ce verified
Raw
History Blame Contribute Delete
25.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.7167381974248928,
"eval_steps": 100,
"global_step": 400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02145922746781116,
"grad_norm": 3.03324294090271,
"learning_rate": 8.000000000000001e-06,
"loss": 1.6153003692626953,
"num_input_tokens_seen": 58112,
"step": 5,
"train_runtime": 7.4685,
"train_tokens_per_second": 7780.897
},
{
"epoch": 0.04291845493562232,
"grad_norm": 1.29582941532135,
"learning_rate": 1.8e-05,
"loss": 1.470921516418457,
"num_input_tokens_seen": 123392,
"step": 10,
"train_runtime": 12.4602,
"train_tokens_per_second": 9902.863
},
{
"epoch": 0.06437768240343347,
"grad_norm": 1.0643380880355835,
"learning_rate": 2.8000000000000003e-05,
"loss": 1.1773520469665528,
"num_input_tokens_seen": 183808,
"step": 15,
"train_runtime": 17.3966,
"train_tokens_per_second": 10565.773
},
{
"epoch": 0.08583690987124463,
"grad_norm": 0.9673917889595032,
"learning_rate": 3.8e-05,
"loss": 0.991020393371582,
"num_input_tokens_seen": 237312,
"step": 20,
"train_runtime": 21.6738,
"train_tokens_per_second": 10949.243
},
{
"epoch": 0.1072961373390558,
"grad_norm": 1.0297874212265015,
"learning_rate": 4.8e-05,
"loss": 0.9735608100891113,
"num_input_tokens_seen": 294400,
"step": 25,
"train_runtime": 25.962,
"train_tokens_per_second": 11339.643
},
{
"epoch": 0.12875536480686695,
"grad_norm": 0.950329601764679,
"learning_rate": 5.8e-05,
"loss": 0.8873712539672851,
"num_input_tokens_seen": 349952,
"step": 30,
"train_runtime": 30.609,
"train_tokens_per_second": 11432.978
},
{
"epoch": 0.15021459227467812,
"grad_norm": 0.9307717680931091,
"learning_rate": 6.800000000000001e-05,
"loss": 0.8720953941345215,
"num_input_tokens_seen": 404992,
"step": 35,
"train_runtime": 34.7568,
"train_tokens_per_second": 11652.181
},
{
"epoch": 0.17167381974248927,
"grad_norm": 0.9645226001739502,
"learning_rate": 7.800000000000001e-05,
"loss": 0.8684850692749023,
"num_input_tokens_seen": 461056,
"step": 40,
"train_runtime": 39.036,
"train_tokens_per_second": 11811.04
},
{
"epoch": 0.19313304721030042,
"grad_norm": 0.9567210674285889,
"learning_rate": 8.800000000000001e-05,
"loss": 0.7938490390777588,
"num_input_tokens_seen": 518144,
"step": 45,
"train_runtime": 43.9371,
"train_tokens_per_second": 11792.858
},
{
"epoch": 0.2145922746781116,
"grad_norm": 0.9292750358581543,
"learning_rate": 9.8e-05,
"loss": 0.7703328609466553,
"num_input_tokens_seen": 568576,
"step": 50,
"train_runtime": 47.9296,
"train_tokens_per_second": 11862.735
},
{
"epoch": 0.23605150214592274,
"grad_norm": 0.9988890886306763,
"learning_rate": 0.00010800000000000001,
"loss": 0.7470858573913575,
"num_input_tokens_seen": 619264,
"step": 55,
"train_runtime": 51.9347,
"train_tokens_per_second": 11923.905
},
{
"epoch": 0.2575107296137339,
"grad_norm": 1.0609540939331055,
"learning_rate": 0.000118,
"loss": 0.7434512138366699,
"num_input_tokens_seen": 674304,
"step": 60,
"train_runtime": 56.2719,
"train_tokens_per_second": 11982.969
},
{
"epoch": 0.27896995708154504,
"grad_norm": 1.0313714742660522,
"learning_rate": 0.00012800000000000002,
"loss": 0.7007692337036133,
"num_input_tokens_seen": 735744,
"step": 65,
"train_runtime": 61.1614,
"train_tokens_per_second": 12029.548
},
{
"epoch": 0.30042918454935624,
"grad_norm": 0.8622630834579468,
"learning_rate": 0.000138,
"loss": 0.7205728530883789,
"num_input_tokens_seen": 789760,
"step": 70,
"train_runtime": 65.595,
"train_tokens_per_second": 12039.941
},
{
"epoch": 0.3218884120171674,
"grad_norm": 0.9945432543754578,
"learning_rate": 0.000148,
"loss": 0.6990869522094727,
"num_input_tokens_seen": 845568,
"step": 75,
"train_runtime": 69.9997,
"train_tokens_per_second": 12079.588
},
{
"epoch": 0.34334763948497854,
"grad_norm": 0.8772686719894409,
"learning_rate": 0.00015800000000000002,
"loss": 0.7007846355438232,
"num_input_tokens_seen": 900864,
"step": 80,
"train_runtime": 74.2575,
"train_tokens_per_second": 12131.625
},
{
"epoch": 0.3648068669527897,
"grad_norm": 0.888869047164917,
"learning_rate": 0.000168,
"loss": 0.6950747489929199,
"num_input_tokens_seen": 964608,
"step": 85,
"train_runtime": 79.9415,
"train_tokens_per_second": 12066.42
},
{
"epoch": 0.38626609442060084,
"grad_norm": 1.1443110704421997,
"learning_rate": 0.00017800000000000002,
"loss": 0.7211706638336182,
"num_input_tokens_seen": 1023744,
"step": 90,
"train_runtime": 85.0578,
"train_tokens_per_second": 12035.856
},
{
"epoch": 0.40772532188841204,
"grad_norm": 0.9073887467384338,
"learning_rate": 0.000188,
"loss": 0.6607097625732422,
"num_input_tokens_seen": 1080320,
"step": 95,
"train_runtime": 89.6566,
"train_tokens_per_second": 12049.537
},
{
"epoch": 0.4291845493562232,
"grad_norm": 0.9436500668525696,
"learning_rate": 0.00019800000000000002,
"loss": 0.7111758232116699,
"num_input_tokens_seen": 1141248,
"step": 100,
"train_runtime": 95.1795,
"train_tokens_per_second": 11990.483
},
{
"epoch": 0.4291845493562232,
"eval_loss": 0.6004661917686462,
"eval_runtime": 22.148,
"eval_samples_per_second": 35.398,
"eval_steps_per_second": 17.699,
"num_input_tokens_seen": 1141248,
"step": 100
},
{
"epoch": 0.45064377682403434,
"grad_norm": 0.916501522064209,
"learning_rate": 0.00019997799506149338,
"loss": 0.6870423316955566,
"num_input_tokens_seen": 1192192,
"step": 105,
"train_runtime": 137.2215,
"train_tokens_per_second": 8688.083
},
{
"epoch": 0.4721030042918455,
"grad_norm": 0.8930872678756714,
"learning_rate": 0.000199888616596235,
"loss": 0.6905088424682617,
"num_input_tokens_seen": 1248000,
"step": 110,
"train_runtime": 141.7812,
"train_tokens_per_second": 8802.295
},
{
"epoch": 0.49356223175965663,
"grad_norm": 0.8945744037628174,
"learning_rate": 0.00019973055070849913,
"loss": 0.6668004035949707,
"num_input_tokens_seen": 1305856,
"step": 115,
"train_runtime": 146.4487,
"train_tokens_per_second": 8916.818
},
{
"epoch": 0.5150214592274678,
"grad_norm": 0.9365142583847046,
"learning_rate": 0.0001995039060907352,
"loss": 0.6359036445617676,
"num_input_tokens_seen": 1370368,
"step": 120,
"train_runtime": 151.6609,
"train_tokens_per_second": 9035.739
},
{
"epoch": 0.5364806866952789,
"grad_norm": 0.9572582244873047,
"learning_rate": 0.00019920883859288034,
"loss": 0.6302140235900879,
"num_input_tokens_seen": 1425920,
"step": 125,
"train_runtime": 156.1545,
"train_tokens_per_second": 9131.47
},
{
"epoch": 0.5579399141630901,
"grad_norm": 0.9190641045570374,
"learning_rate": 0.00019884555111519058,
"loss": 0.6023337364196777,
"num_input_tokens_seen": 1477376,
"step": 130,
"train_runtime": 160.3216,
"train_tokens_per_second": 9215.078
},
{
"epoch": 0.5793991416309013,
"grad_norm": 0.7973408102989197,
"learning_rate": 0.0001984142934687186,
"loss": 0.6142975330352783,
"num_input_tokens_seen": 1537024,
"step": 135,
"train_runtime": 165.1747,
"train_tokens_per_second": 9305.443
},
{
"epoch": 0.6008583690987125,
"grad_norm": 0.8307357430458069,
"learning_rate": 0.00019791536220353356,
"loss": 0.6178459167480469,
"num_input_tokens_seen": 1600000,
"step": 140,
"train_runtime": 170.1853,
"train_tokens_per_second": 9401.52
},
{
"epoch": 0.6223175965665236,
"grad_norm": 0.9216153025627136,
"learning_rate": 0.00019734910040480137,
"loss": 0.5878005027770996,
"num_input_tokens_seen": 1657600,
"step": 145,
"train_runtime": 175.0946,
"train_tokens_per_second": 9466.883
},
{
"epoch": 0.6437768240343348,
"grad_norm": 0.9538068175315857,
"learning_rate": 0.0001967158974568656,
"loss": 0.6823252677917481,
"num_input_tokens_seen": 1711104,
"step": 150,
"train_runtime": 179.7828,
"train_tokens_per_second": 9517.616
},
{
"epoch": 0.6652360515021459,
"grad_norm": 0.8435113430023193,
"learning_rate": 0.00019601618877549112,
"loss": 0.6517625331878663,
"num_input_tokens_seen": 1762048,
"step": 155,
"train_runtime": 183.8306,
"train_tokens_per_second": 9585.173
},
{
"epoch": 0.6866952789699571,
"grad_norm": 0.8970490097999573,
"learning_rate": 0.00019525045550845482,
"loss": 0.6671280860900879,
"num_input_tokens_seen": 1820416,
"step": 160,
"train_runtime": 188.5304,
"train_tokens_per_second": 9655.824
},
{
"epoch": 0.7081545064377682,
"grad_norm": 0.8489075303077698,
"learning_rate": 0.00019441922420468898,
"loss": 0.6579770565032959,
"num_input_tokens_seen": 1876992,
"step": 165,
"train_runtime": 193.0354,
"train_tokens_per_second": 9723.564
},
{
"epoch": 0.7296137339055794,
"grad_norm": 0.911480188369751,
"learning_rate": 0.00019352306645220517,
"loss": 0.6479627609252929,
"num_input_tokens_seen": 1927680,
"step": 170,
"train_runtime": 196.9591,
"train_tokens_per_second": 9787.21
},
{
"epoch": 0.7510729613733905,
"grad_norm": 0.9032346606254578,
"learning_rate": 0.00019256259848504737,
"loss": 0.6328952789306641,
"num_input_tokens_seen": 1984768,
"step": 175,
"train_runtime": 201.5699,
"train_tokens_per_second": 9846.551
},
{
"epoch": 0.7725321888412017,
"grad_norm": 0.9176375865936279,
"learning_rate": 0.00019153848075954466,
"loss": 0.6545487403869629,
"num_input_tokens_seen": 2047744,
"step": 180,
"train_runtime": 206.7957,
"train_tokens_per_second": 9902.254
},
{
"epoch": 0.7939914163090128,
"grad_norm": 0.8009106516838074,
"learning_rate": 0.000190451417500155,
"loss": 0.5557879447937012,
"num_input_tokens_seen": 2124032,
"step": 185,
"train_runtime": 214.0583,
"train_tokens_per_second": 9922.681
},
{
"epoch": 0.8154506437768241,
"grad_norm": 0.8755921721458435,
"learning_rate": 0.0001893021562152122,
"loss": 0.6030447006225585,
"num_input_tokens_seen": 2178304,
"step": 190,
"train_runtime": 218.3854,
"train_tokens_per_second": 9974.585
},
{
"epoch": 0.8369098712446352,
"grad_norm": 0.7998857498168945,
"learning_rate": 0.00018809148718290918,
"loss": 0.6215959072113038,
"num_input_tokens_seen": 2234112,
"step": 195,
"train_runtime": 222.6461,
"train_tokens_per_second": 10034.362
},
{
"epoch": 0.8583690987124464,
"grad_norm": 0.8616818785667419,
"learning_rate": 0.00018682024290787093,
"loss": 0.615071964263916,
"num_input_tokens_seen": 2289920,
"step": 200,
"train_runtime": 227.2286,
"train_tokens_per_second": 10077.603
},
{
"epoch": 0.8583690987124464,
"eval_loss": 0.5416203737258911,
"eval_runtime": 23.1771,
"eval_samples_per_second": 33.827,
"eval_steps_per_second": 16.913,
"num_input_tokens_seen": 2289920,
"step": 200
},
{
"epoch": 0.8798283261802575,
"grad_norm": 0.866408109664917,
"learning_rate": 0.00018548929754869095,
"loss": 0.6127395629882812,
"num_input_tokens_seen": 2336768,
"step": 205,
"train_runtime": 269.3352,
"train_tokens_per_second": 8676.059
},
{
"epoch": 0.9012875536480687,
"grad_norm": 0.7758891582489014,
"learning_rate": 0.00018409956631682475,
"loss": 0.619700813293457,
"num_input_tokens_seen": 2398720,
"step": 210,
"train_runtime": 274.7853,
"train_tokens_per_second": 8729.432
},
{
"epoch": 0.9227467811158798,
"grad_norm": 0.8826097249984741,
"learning_rate": 0.00018265200484725362,
"loss": 0.6074517726898193,
"num_input_tokens_seen": 2456064,
"step": 215,
"train_runtime": 279.0929,
"train_tokens_per_second": 8800.166
},
{
"epoch": 0.944206008583691,
"grad_norm": 0.9082592725753784,
"learning_rate": 0.0001811476085413517,
"loss": 0.6168807506561279,
"num_input_tokens_seen": 2513408,
"step": 220,
"train_runtime": 283.5383,
"train_tokens_per_second": 8864.438
},
{
"epoch": 0.9656652360515021,
"grad_norm": 0.7310217618942261,
"learning_rate": 0.00017958741188240805,
"loss": 0.5989558696746826,
"num_input_tokens_seen": 2577664,
"step": 225,
"train_runtime": 288.997,
"train_tokens_per_second": 8919.346
},
{
"epoch": 0.9871244635193133,
"grad_norm": 0.7489120364189148,
"learning_rate": 0.0001779724877242745,
"loss": 0.5686917781829834,
"num_input_tokens_seen": 2634752,
"step": 230,
"train_runtime": 293.5938,
"train_tokens_per_second": 8974.142
},
{
"epoch": 1.0085836909871244,
"grad_norm": 0.6700829267501831,
"learning_rate": 0.00017630394655362798,
"loss": 0.4931748867034912,
"num_input_tokens_seen": 2695424,
"step": 235,
"train_runtime": 298.6586,
"train_tokens_per_second": 9025.102
},
{
"epoch": 1.0300429184549356,
"grad_norm": 0.8137433528900146,
"learning_rate": 0.00017458293572635572,
"loss": 0.41871185302734376,
"num_input_tokens_seen": 2759680,
"step": 240,
"train_runtime": 304.168,
"train_tokens_per_second": 9072.882
},
{
"epoch": 1.0515021459227467,
"grad_norm": 0.8284509778022766,
"learning_rate": 0.00017281063867858687,
"loss": 0.39093842506408694,
"num_input_tokens_seen": 2821376,
"step": 245,
"train_runtime": 309.2922,
"train_tokens_per_second": 9122.041
},
{
"epoch": 1.0729613733905579,
"grad_norm": 0.8212636113166809,
"learning_rate": 0.00017098827411291475,
"loss": 0.41676993370056153,
"num_input_tokens_seen": 2879744,
"step": 250,
"train_runtime": 314.1833,
"train_tokens_per_second": 9165.809
},
{
"epoch": 1.094420600858369,
"grad_norm": 0.9262588024139404,
"learning_rate": 0.00016911709516036753,
"loss": 0.43643965721130373,
"num_input_tokens_seen": 2939648,
"step": 255,
"train_runtime": 318.9898,
"train_tokens_per_second": 9215.492
},
{
"epoch": 1.1158798283261802,
"grad_norm": 0.8408174514770508,
"learning_rate": 0.0001671983885187055,
"loss": 0.42370119094848635,
"num_input_tokens_seen": 2993152,
"step": 260,
"train_runtime": 323.4471,
"train_tokens_per_second": 9253.915
},
{
"epoch": 1.1373390557939915,
"grad_norm": 0.857381284236908,
"learning_rate": 0.00016523347356763572,
"loss": 0.42381582260131834,
"num_input_tokens_seen": 3044608,
"step": 265,
"train_runtime": 327.4141,
"train_tokens_per_second": 9298.953
},
{
"epoch": 1.1587982832618025,
"grad_norm": 0.9033918380737305,
"learning_rate": 0.0001632237014615537,
"loss": 0.40540313720703125,
"num_input_tokens_seen": 3104768,
"step": 270,
"train_runtime": 332.1893,
"train_tokens_per_second": 9346.38
},
{
"epoch": 1.1802575107296138,
"grad_norm": 0.7994610667228699,
"learning_rate": 0.00016117045420043543,
"loss": 0.4465446472167969,
"num_input_tokens_seen": 3160832,
"step": 275,
"train_runtime": 336.8133,
"train_tokens_per_second": 9384.521
},
{
"epoch": 1.201716738197425,
"grad_norm": 0.8270825147628784,
"learning_rate": 0.0001590751436795186,
"loss": 0.41684885025024415,
"num_input_tokens_seen": 3222016,
"step": 280,
"train_runtime": 341.7825,
"train_tokens_per_second": 9427.094
},
{
"epoch": 1.2231759656652361,
"grad_norm": 0.8962671756744385,
"learning_rate": 0.00015693921071842688,
"loss": 0.42808146476745607,
"num_input_tokens_seen": 3283456,
"step": 285,
"train_runtime": 346.6683,
"train_tokens_per_second": 9471.463
},
{
"epoch": 1.2446351931330473,
"grad_norm": 0.8256343007087708,
"learning_rate": 0.00015476412407040445,
"loss": 0.40830087661743164,
"num_input_tokens_seen": 3344128,
"step": 290,
"train_runtime": 351.6457,
"train_tokens_per_second": 9509.935
},
{
"epoch": 1.2660944206008584,
"grad_norm": 0.7946646809577942,
"learning_rate": 0.00015255137941234227,
"loss": 0.46245832443237306,
"num_input_tokens_seen": 3399936,
"step": 295,
"train_runtime": 356.2532,
"train_tokens_per_second": 9543.595
},
{
"epoch": 1.2875536480686696,
"grad_norm": 0.7553455829620361,
"learning_rate": 0.0001503024983162908,
"loss": 0.4185676574707031,
"num_input_tokens_seen": 3448576,
"step": 300,
"train_runtime": 360.2579,
"train_tokens_per_second": 9572.519
},
{
"epoch": 1.2875536480686696,
"eval_loss": 0.5272337198257446,
"eval_runtime": 23.4826,
"eval_samples_per_second": 33.386,
"eval_steps_per_second": 16.693,
"num_input_tokens_seen": 3448576,
"step": 300
},
{
"epoch": 1.3090128755364807,
"grad_norm": 0.7643769979476929,
"learning_rate": 0.00014801902720316568,
"loss": 0.41739530563354493,
"num_input_tokens_seen": 3507456,
"step": 305,
"train_runtime": 403.3091,
"train_tokens_per_second": 8696.694
},
{
"epoch": 1.3304721030042919,
"grad_norm": 0.7832750678062439,
"learning_rate": 0.0001457025362793669,
"loss": 0.43469972610473634,
"num_input_tokens_seen": 3572992,
"step": 310,
"train_runtime": 408.9235,
"train_tokens_per_second": 8737.555
},
{
"epoch": 1.351931330472103,
"grad_norm": 0.8122566938400269,
"learning_rate": 0.00014335461845704173,
"loss": 0.4958329200744629,
"num_input_tokens_seen": 3628032,
"step": 315,
"train_runtime": 413.3099,
"train_tokens_per_second": 8777.994
},
{
"epoch": 1.3733905579399142,
"grad_norm": 0.8401719927787781,
"learning_rate": 0.00014097688825873437,
"loss": 0.4470388412475586,
"num_input_tokens_seen": 3685120,
"step": 320,
"train_runtime": 417.6895,
"train_tokens_per_second": 8822.631
},
{
"epoch": 1.3948497854077253,
"grad_norm": 0.911494255065918,
"learning_rate": 0.00013857098070717543,
"loss": 0.4368776321411133,
"num_input_tokens_seen": 3736064,
"step": 325,
"train_runtime": 421.8302,
"train_tokens_per_second": 8856.796
},
{
"epoch": 1.4163090128755365,
"grad_norm": 0.8921552300453186,
"learning_rate": 0.00013613855020097476,
"loss": 0.41593198776245116,
"num_input_tokens_seen": 3786752,
"step": 330,
"train_runtime": 425.7613,
"train_tokens_per_second": 8894.073
},
{
"epoch": 1.4377682403433476,
"grad_norm": 0.899163007736206,
"learning_rate": 0.00013368126937699055,
"loss": 0.41350326538085935,
"num_input_tokens_seen": 3836928,
"step": 335,
"train_runtime": 429.9947,
"train_tokens_per_second": 8923.198
},
{
"epoch": 1.4592274678111588,
"grad_norm": 0.8040919303894043,
"learning_rate": 0.00013120082796015694,
"loss": 0.41482973098754883,
"num_input_tokens_seen": 3902976,
"step": 340,
"train_runtime": 435.7465,
"train_tokens_per_second": 8956.988
},
{
"epoch": 1.48068669527897,
"grad_norm": 0.786900520324707,
"learning_rate": 0.00012869893160156144,
"loss": 0.4156362056732178,
"num_input_tokens_seen": 3965952,
"step": 345,
"train_runtime": 441.2677,
"train_tokens_per_second": 8987.632
},
{
"epoch": 1.5021459227467813,
"grad_norm": 0.8730544447898865,
"learning_rate": 0.0001261773007055708,
"loss": 0.46176786422729493,
"num_input_tokens_seen": 4019456,
"step": 350,
"train_runtime": 445.6914,
"train_tokens_per_second": 9018.474
},
{
"epoch": 1.5236051502145922,
"grad_norm": 0.8831098079681396,
"learning_rate": 0.00012363766924681176,
"loss": 0.42528247833251953,
"num_input_tokens_seen": 4070656,
"step": 355,
"train_runtime": 449.6375,
"train_tokens_per_second": 9053.196
},
{
"epoch": 1.5450643776824036,
"grad_norm": 0.8320629000663757,
"learning_rate": 0.00012108178357782078,
"loss": 0.4190709114074707,
"num_input_tokens_seen": 4125696,
"step": 360,
"train_runtime": 454.0433,
"train_tokens_per_second": 9086.569
},
{
"epoch": 1.5665236051502145,
"grad_norm": 0.8362066149711609,
"learning_rate": 0.00011851140122818154,
"loss": 0.4130504608154297,
"num_input_tokens_seen": 4175360,
"step": 365,
"train_runtime": 457.9743,
"train_tokens_per_second": 9117.018
},
{
"epoch": 1.5879828326180259,
"grad_norm": 0.8794524669647217,
"learning_rate": 0.0001159282896959774,
"loss": 0.38641934394836425,
"num_input_tokens_seen": 4226304,
"step": 370,
"train_runtime": 461.8462,
"train_tokens_per_second": 9150.891
},
{
"epoch": 1.6094420600858368,
"grad_norm": 0.7941300272941589,
"learning_rate": 0.00011333422523238856,
"loss": 0.38475966453552246,
"num_input_tokens_seen": 4286976,
"step": 375,
"train_runtime": 466.4935,
"train_tokens_per_second": 9189.788
},
{
"epoch": 1.6309012875536482,
"grad_norm": 0.8813296556472778,
"learning_rate": 0.0001107309916202705,
"loss": 0.43069748878479003,
"num_input_tokens_seen": 4338944,
"step": 380,
"train_runtime": 470.4846,
"train_tokens_per_second": 9222.287
},
{
"epoch": 1.652360515021459,
"grad_norm": 0.7397964000701904,
"learning_rate": 0.00010812037894755335,
"loss": 0.4383960247039795,
"num_input_tokens_seen": 4389376,
"step": 385,
"train_runtime": 474.5481,
"train_tokens_per_second": 9249.592
},
{
"epoch": 1.6738197424892705,
"grad_norm": 0.7971178889274597,
"learning_rate": 0.00010550418237630546,
"loss": 0.41924076080322265,
"num_input_tokens_seen": 4445952,
"step": 390,
"train_runtime": 478.7928,
"train_tokens_per_second": 9285.753
},
{
"epoch": 1.6952789699570814,
"grad_norm": 0.7272794246673584,
"learning_rate": 0.00010288420090830804,
"loss": 0.4299598693847656,
"num_input_tokens_seen": 4498176,
"step": 395,
"train_runtime": 483.0335,
"train_tokens_per_second": 9312.348
},
{
"epoch": 1.7167381974248928,
"grad_norm": 0.7986837029457092,
"learning_rate": 0.00010026223614798911,
"loss": 0.40703516006469725,
"num_input_tokens_seen": 4548608,
"step": 400,
"train_runtime": 487.1484,
"train_tokens_per_second": 9337.213
},
{
"epoch": 1.7167381974248928,
"eval_loss": 0.4985992908477783,
"eval_runtime": 24.698,
"eval_samples_per_second": 31.743,
"eval_steps_per_second": 15.872,
"num_input_tokens_seen": 4548608,
"step": 400
}
],
"logging_steps": 5,
"max_steps": 699,
"num_input_tokens_seen": 4548608,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.9720867698743706e+17,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}