wav2vec2-base-sna-cleaned / trainer_state.json
CasperMuz's picture
End of training
a02528e verified
Raw
History Blame Contribute Delete
34.4 kB
{
"best_global_step": 3750,
"best_metric": 37.71349186892212,
"best_model_checkpoint": "./wav2vec2-base-sna-cleaned/checkpoint-3750",
"epoch": 4.796163069544365,
"eval_steps": 250,
"global_step": 4000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02997601918465228,
"grad_norm": 87.95906829833984,
"learning_rate": 1.8e-06,
"loss": 65.4899169921875,
"step": 25
},
{
"epoch": 0.05995203836930456,
"grad_norm": 163.35479736328125,
"learning_rate": 3.675e-06,
"loss": 59.3804345703125,
"step": 50
},
{
"epoch": 0.08992805755395683,
"grad_norm": 117.41580963134766,
"learning_rate": 5.55e-06,
"loss": 38.9528857421875,
"step": 75
},
{
"epoch": 0.11990407673860912,
"grad_norm": 42.569610595703125,
"learning_rate": 7.425e-06,
"loss": 17.7254150390625,
"step": 100
},
{
"epoch": 0.1498800959232614,
"grad_norm": 15.584668159484863,
"learning_rate": 9.3e-06,
"loss": 13.227435302734374,
"step": 125
},
{
"epoch": 0.17985611510791366,
"grad_norm": 19.06544303894043,
"learning_rate": 1.1175e-05,
"loss": 12.7419970703125,
"step": 150
},
{
"epoch": 0.20983213429256595,
"grad_norm": 9.686856269836426,
"learning_rate": 1.305e-05,
"loss": 12.3552099609375,
"step": 175
},
{
"epoch": 0.23980815347721823,
"grad_norm": 19.430574417114258,
"learning_rate": 1.4925e-05,
"loss": 12.184576416015625,
"step": 200
},
{
"epoch": 0.2697841726618705,
"grad_norm": 8.859325408935547,
"learning_rate": 1.6800000000000002e-05,
"loss": 11.995687255859375,
"step": 225
},
{
"epoch": 0.2997601918465228,
"grad_norm": 7.194825172424316,
"learning_rate": 1.8675000000000003e-05,
"loss": 11.898416748046875,
"step": 250
},
{
"epoch": 0.2997601918465228,
"eval_loss": 2.9574084281921387,
"eval_runtime": 17.3027,
"eval_samples_per_second": 93.627,
"eval_steps_per_second": 11.732,
"eval_wer": 99.9972760208112,
"step": 250
},
{
"epoch": 0.32973621103117506,
"grad_norm": 6.046307563781738,
"learning_rate": 2.055e-05,
"loss": 11.7874072265625,
"step": 275
},
{
"epoch": 0.3597122302158273,
"grad_norm": 2.4176154136657715,
"learning_rate": 2.2425000000000003e-05,
"loss": 11.74424560546875,
"step": 300
},
{
"epoch": 0.38968824940047964,
"grad_norm": 2.773775815963745,
"learning_rate": 2.43e-05,
"loss": 11.693775634765625,
"step": 325
},
{
"epoch": 0.4196642685851319,
"grad_norm": 5.9898552894592285,
"learning_rate": 2.6175000000000003e-05,
"loss": 11.669410400390625,
"step": 350
},
{
"epoch": 0.44964028776978415,
"grad_norm": 2.4337611198425293,
"learning_rate": 2.805e-05,
"loss": 11.601651611328125,
"step": 375
},
{
"epoch": 0.47961630695443647,
"grad_norm": 6.943758964538574,
"learning_rate": 2.9925000000000002e-05,
"loss": 11.6068701171875,
"step": 400
},
{
"epoch": 0.5095923261390888,
"grad_norm": 9.041548728942871,
"learning_rate": 2.98e-05,
"loss": 11.59481201171875,
"step": 425
},
{
"epoch": 0.539568345323741,
"grad_norm": 2.0354104042053223,
"learning_rate": 2.9591666666666667e-05,
"loss": 11.573612060546875,
"step": 450
},
{
"epoch": 0.5695443645083933,
"grad_norm": 1.5390305519104004,
"learning_rate": 2.9383333333333334e-05,
"loss": 11.53906005859375,
"step": 475
},
{
"epoch": 0.5995203836930456,
"grad_norm": 5.494091510772705,
"learning_rate": 2.9175e-05,
"loss": 11.54445556640625,
"step": 500
},
{
"epoch": 0.5995203836930456,
"eval_loss": 2.8992974758148193,
"eval_runtime": 17.2261,
"eval_samples_per_second": 94.044,
"eval_steps_per_second": 11.784,
"eval_wer": 99.9972760208112,
"step": 500
},
{
"epoch": 0.6294964028776978,
"grad_norm": 2.440443515777588,
"learning_rate": 2.8966666666666665e-05,
"loss": 11.5015576171875,
"step": 525
},
{
"epoch": 0.6594724220623501,
"grad_norm": 4.654289722442627,
"learning_rate": 2.8758333333333332e-05,
"loss": 11.103582763671875,
"step": 550
},
{
"epoch": 0.6894484412470024,
"grad_norm": 6.255335330963135,
"learning_rate": 2.855e-05,
"loss": 10.390032958984374,
"step": 575
},
{
"epoch": 0.7194244604316546,
"grad_norm": 10.0020112991333,
"learning_rate": 2.8341666666666667e-05,
"loss": 9.397643432617187,
"step": 600
},
{
"epoch": 0.749400479616307,
"grad_norm": 7.839452266693115,
"learning_rate": 2.8133333333333334e-05,
"loss": 7.82263671875,
"step": 625
},
{
"epoch": 0.7793764988009593,
"grad_norm": 7.001938343048096,
"learning_rate": 2.7924999999999998e-05,
"loss": 6.276546020507812,
"step": 650
},
{
"epoch": 0.8093525179856115,
"grad_norm": 6.308192729949951,
"learning_rate": 2.771666666666667e-05,
"loss": 5.47916259765625,
"step": 675
},
{
"epoch": 0.8393285371702638,
"grad_norm": 10.70156478881836,
"learning_rate": 2.7508333333333336e-05,
"loss": 4.5777520751953125,
"step": 700
},
{
"epoch": 0.8693045563549161,
"grad_norm": 7.3394551277160645,
"learning_rate": 2.7300000000000003e-05,
"loss": 4.2768948364257815,
"step": 725
},
{
"epoch": 0.8992805755395683,
"grad_norm": 9.546968460083008,
"learning_rate": 2.7091666666666667e-05,
"loss": 3.8439666748046877,
"step": 750
},
{
"epoch": 0.8992805755395683,
"eval_loss": 0.814090371131897,
"eval_runtime": 17.3358,
"eval_samples_per_second": 93.448,
"eval_steps_per_second": 11.71,
"eval_wer": 98.76603742747405,
"step": 750
},
{
"epoch": 0.9292565947242206,
"grad_norm": 5.7955803871154785,
"learning_rate": 2.6883333333333334e-05,
"loss": 3.4320477294921874,
"step": 775
},
{
"epoch": 0.9592326139088729,
"grad_norm": 7.267416477203369,
"learning_rate": 2.6675e-05,
"loss": 3.3107342529296875,
"step": 800
},
{
"epoch": 0.9892086330935251,
"grad_norm": 5.454007148742676,
"learning_rate": 2.646666666666667e-05,
"loss": 3.279764404296875,
"step": 825
},
{
"epoch": 1.0191846522781776,
"grad_norm": 6.052438735961914,
"learning_rate": 2.6258333333333336e-05,
"loss": 2.929551086425781,
"step": 850
},
{
"epoch": 1.0491606714628297,
"grad_norm": 5.4171319007873535,
"learning_rate": 2.605e-05,
"loss": 2.633551025390625,
"step": 875
},
{
"epoch": 1.079136690647482,
"grad_norm": 6.3133320808410645,
"learning_rate": 2.5841666666666667e-05,
"loss": 2.9070010375976563,
"step": 900
},
{
"epoch": 1.1091127098321343,
"grad_norm": 5.874911785125732,
"learning_rate": 2.5633333333333334e-05,
"loss": 2.554573516845703,
"step": 925
},
{
"epoch": 1.1390887290167866,
"grad_norm": 4.682479381561279,
"learning_rate": 2.5425e-05,
"loss": 2.424696960449219,
"step": 950
},
{
"epoch": 1.169064748201439,
"grad_norm": 5.821262836456299,
"learning_rate": 2.5216666666666665e-05,
"loss": 2.3822782897949217,
"step": 975
},
{
"epoch": 1.1990407673860912,
"grad_norm": 4.946887969970703,
"learning_rate": 2.5008333333333332e-05,
"loss": 2.3326264953613283,
"step": 1000
},
{
"epoch": 1.1990407673860912,
"eval_loss": 0.5055655241012573,
"eval_runtime": 17.356,
"eval_samples_per_second": 93.339,
"eval_steps_per_second": 11.696,
"eval_wer": 56.12759118520334,
"step": 1000
},
{
"epoch": 1.2290167865707433,
"grad_norm": 5.456410884857178,
"learning_rate": 2.48e-05,
"loss": 2.232008819580078,
"step": 1025
},
{
"epoch": 1.2589928057553956,
"grad_norm": 12.988375663757324,
"learning_rate": 2.4591666666666667e-05,
"loss": 2.308787841796875,
"step": 1050
},
{
"epoch": 1.288968824940048,
"grad_norm": 5.91463565826416,
"learning_rate": 2.4383333333333334e-05,
"loss": 2.133858489990234,
"step": 1075
},
{
"epoch": 1.3189448441247003,
"grad_norm": 5.080030918121338,
"learning_rate": 2.4174999999999998e-05,
"loss": 2.111269836425781,
"step": 1100
},
{
"epoch": 1.3489208633093526,
"grad_norm": 6.5078959465026855,
"learning_rate": 2.3966666666666665e-05,
"loss": 1.9835806274414063,
"step": 1125
},
{
"epoch": 1.3788968824940047,
"grad_norm": 6.049032688140869,
"learning_rate": 2.3758333333333333e-05,
"loss": 1.948318328857422,
"step": 1150
},
{
"epoch": 1.4088729016786572,
"grad_norm": 4.487147808074951,
"learning_rate": 2.3550000000000003e-05,
"loss": 1.9143856811523436,
"step": 1175
},
{
"epoch": 1.4388489208633093,
"grad_norm": 4.666418075561523,
"learning_rate": 2.3341666666666667e-05,
"loss": 1.9930302429199218,
"step": 1200
},
{
"epoch": 1.4688249400479616,
"grad_norm": 5.2837233543396,
"learning_rate": 2.3133333333333334e-05,
"loss": 1.9030076599121093,
"step": 1225
},
{
"epoch": 1.498800959232614,
"grad_norm": 4.892092227935791,
"learning_rate": 2.2925e-05,
"loss": 1.993743896484375,
"step": 1250
},
{
"epoch": 1.498800959232614,
"eval_loss": 0.4353557825088501,
"eval_runtime": 17.8784,
"eval_samples_per_second": 90.612,
"eval_steps_per_second": 11.355,
"eval_wer": 49.77254773773529,
"step": 1250
},
{
"epoch": 1.5287769784172662,
"grad_norm": 4.702995777130127,
"learning_rate": 2.271666666666667e-05,
"loss": 1.8019261169433594,
"step": 1275
},
{
"epoch": 1.5587529976019185,
"grad_norm": 5.374894618988037,
"learning_rate": 2.2508333333333336e-05,
"loss": 1.9548370361328125,
"step": 1300
},
{
"epoch": 1.5887290167865706,
"grad_norm": 5.36961555480957,
"learning_rate": 2.23e-05,
"loss": 1.6951516723632813,
"step": 1325
},
{
"epoch": 1.6187050359712232,
"grad_norm": 5.167247772216797,
"learning_rate": 2.2091666666666667e-05,
"loss": 1.887311248779297,
"step": 1350
},
{
"epoch": 1.6486810551558753,
"grad_norm": 4.589432716369629,
"learning_rate": 2.1883333333333334e-05,
"loss": 1.8049166870117188,
"step": 1375
},
{
"epoch": 1.6786570743405276,
"grad_norm": 4.192942142486572,
"learning_rate": 2.1675e-05,
"loss": 1.8473945617675782,
"step": 1400
},
{
"epoch": 1.70863309352518,
"grad_norm": 4.900947570800781,
"learning_rate": 2.1466666666666666e-05,
"loss": 1.7062265014648437,
"step": 1425
},
{
"epoch": 1.738609112709832,
"grad_norm": 4.3333587646484375,
"learning_rate": 2.1258333333333333e-05,
"loss": 1.7642361450195312,
"step": 1450
},
{
"epoch": 1.7685851318944845,
"grad_norm": 5.301547050476074,
"learning_rate": 2.105e-05,
"loss": 1.6472731018066407,
"step": 1475
},
{
"epoch": 1.7985611510791366,
"grad_norm": 4.614596366882324,
"learning_rate": 2.0841666666666667e-05,
"loss": 1.8639109802246094,
"step": 1500
},
{
"epoch": 1.7985611510791366,
"eval_loss": 0.3815246522426605,
"eval_runtime": 17.5598,
"eval_samples_per_second": 92.256,
"eval_steps_per_second": 11.561,
"eval_wer": 45.07640761624581,
"step": 1500
},
{
"epoch": 1.828537170263789,
"grad_norm": 4.178606033325195,
"learning_rate": 2.0633333333333335e-05,
"loss": 1.5441552734375,
"step": 1525
},
{
"epoch": 1.8585131894484412,
"grad_norm": 4.956863880157471,
"learning_rate": 2.0425e-05,
"loss": 1.9137911987304688,
"step": 1550
},
{
"epoch": 1.8884892086330936,
"grad_norm": 4.828672885894775,
"learning_rate": 2.0216666666666666e-05,
"loss": 1.5100914001464845,
"step": 1575
},
{
"epoch": 1.9184652278177459,
"grad_norm": 3.7223966121673584,
"learning_rate": 2.0008333333333333e-05,
"loss": 1.688656768798828,
"step": 1600
},
{
"epoch": 1.948441247002398,
"grad_norm": 5.0394062995910645,
"learning_rate": 1.98e-05,
"loss": 1.5531495666503907,
"step": 1625
},
{
"epoch": 1.9784172661870505,
"grad_norm": 4.3810954093933105,
"learning_rate": 1.9591666666666664e-05,
"loss": 1.7138851928710936,
"step": 1650
},
{
"epoch": 2.0083932853717026,
"grad_norm": 3.4982099533081055,
"learning_rate": 1.938333333333333e-05,
"loss": 1.5514004516601563,
"step": 1675
},
{
"epoch": 2.038369304556355,
"grad_norm": 4.8457136154174805,
"learning_rate": 1.9175000000000002e-05,
"loss": 1.5973490905761718,
"step": 1700
},
{
"epoch": 2.068345323741007,
"grad_norm": 4.1086602210998535,
"learning_rate": 1.896666666666667e-05,
"loss": 1.5693655395507813,
"step": 1725
},
{
"epoch": 2.0983213429256593,
"grad_norm": 4.984743118286133,
"learning_rate": 1.8758333333333336e-05,
"loss": 1.5768695068359375,
"step": 1750
},
{
"epoch": 2.0983213429256593,
"eval_loss": 0.3492273688316345,
"eval_runtime": 17.4669,
"eval_samples_per_second": 92.747,
"eval_steps_per_second": 11.622,
"eval_wer": 43.68445425076952,
"step": 1750
},
{
"epoch": 2.128297362110312,
"grad_norm": 4.139465808868408,
"learning_rate": 1.855e-05,
"loss": 1.5272630310058595,
"step": 1775
},
{
"epoch": 2.158273381294964,
"grad_norm": 4.634520053863525,
"learning_rate": 1.8341666666666668e-05,
"loss": 1.4187347412109375,
"step": 1800
},
{
"epoch": 2.1882494004796165,
"grad_norm": 3.5434200763702393,
"learning_rate": 1.8133333333333335e-05,
"loss": 1.5776219177246094,
"step": 1825
},
{
"epoch": 2.2182254196642686,
"grad_norm": 4.246279716491699,
"learning_rate": 1.7925000000000002e-05,
"loss": 1.4354205322265625,
"step": 1850
},
{
"epoch": 2.2482014388489207,
"grad_norm": 3.7664794921875,
"learning_rate": 1.7716666666666666e-05,
"loss": 1.4057354736328125,
"step": 1875
},
{
"epoch": 2.278177458033573,
"grad_norm": 5.111608028411865,
"learning_rate": 1.7508333333333333e-05,
"loss": 1.5491357421875,
"step": 1900
},
{
"epoch": 2.3081534772182253,
"grad_norm": 4.471536636352539,
"learning_rate": 1.73e-05,
"loss": 1.4842294311523438,
"step": 1925
},
{
"epoch": 2.338129496402878,
"grad_norm": 3.7081987857818604,
"learning_rate": 1.7091666666666668e-05,
"loss": 1.450211181640625,
"step": 1950
},
{
"epoch": 2.36810551558753,
"grad_norm": 3.8253395557403564,
"learning_rate": 1.6883333333333335e-05,
"loss": 1.376385498046875,
"step": 1975
},
{
"epoch": 2.3980815347721824,
"grad_norm": 3.773341417312622,
"learning_rate": 1.6675e-05,
"loss": 1.4288015747070313,
"step": 2000
},
{
"epoch": 2.3980815347721824,
"eval_loss": 0.33844250440597534,
"eval_runtime": 17.2583,
"eval_samples_per_second": 93.868,
"eval_steps_per_second": 11.762,
"eval_wer": 41.22470104328403,
"step": 2000
},
{
"epoch": 2.4280575539568345,
"grad_norm": 3.5804367065429688,
"learning_rate": 1.6466666666666666e-05,
"loss": 1.4616065979003907,
"step": 2025
},
{
"epoch": 2.4580335731414866,
"grad_norm": 4.723759651184082,
"learning_rate": 1.6258333333333333e-05,
"loss": 1.3814134216308593,
"step": 2050
},
{
"epoch": 2.488009592326139,
"grad_norm": 3.2633466720581055,
"learning_rate": 1.605e-05,
"loss": 1.393878173828125,
"step": 2075
},
{
"epoch": 2.5179856115107913,
"grad_norm": 4.216237545013428,
"learning_rate": 1.5841666666666664e-05,
"loss": 1.40193603515625,
"step": 2100
},
{
"epoch": 2.547961630695444,
"grad_norm": 3.037777900695801,
"learning_rate": 1.563333333333333e-05,
"loss": 1.3580673217773438,
"step": 2125
},
{
"epoch": 2.577937649880096,
"grad_norm": 5.0248847007751465,
"learning_rate": 1.5425e-05,
"loss": 1.572769012451172,
"step": 2150
},
{
"epoch": 2.6079136690647484,
"grad_norm": 3.7339730262756348,
"learning_rate": 1.5216666666666668e-05,
"loss": 1.5580809020996094,
"step": 2175
},
{
"epoch": 2.6378896882494005,
"grad_norm": 3.7687699794769287,
"learning_rate": 1.5008333333333335e-05,
"loss": 1.427168731689453,
"step": 2200
},
{
"epoch": 2.6678657074340526,
"grad_norm": 3.9816343784332275,
"learning_rate": 1.48e-05,
"loss": 1.3857545471191406,
"step": 2225
},
{
"epoch": 2.697841726618705,
"grad_norm": 3.972137212753296,
"learning_rate": 1.4591666666666666e-05,
"loss": 1.331875,
"step": 2250
},
{
"epoch": 2.697841726618705,
"eval_loss": 0.3375837802886963,
"eval_runtime": 17.4226,
"eval_samples_per_second": 92.983,
"eval_steps_per_second": 11.652,
"eval_wer": 40.461986870420304,
"step": 2250
},
{
"epoch": 2.7278177458033572,
"grad_norm": 3.696455717086792,
"learning_rate": 1.4383333333333333e-05,
"loss": 1.2858570861816405,
"step": 2275
},
{
"epoch": 2.7577937649880093,
"grad_norm": 3.8930845260620117,
"learning_rate": 1.4174999999999999e-05,
"loss": 1.3353477478027345,
"step": 2300
},
{
"epoch": 2.787769784172662,
"grad_norm": 3.240628719329834,
"learning_rate": 1.3966666666666666e-05,
"loss": 1.5282106018066406,
"step": 2325
},
{
"epoch": 2.8177458033573144,
"grad_norm": 4.53059196472168,
"learning_rate": 1.3758333333333335e-05,
"loss": 1.325364990234375,
"step": 2350
},
{
"epoch": 2.8477218225419665,
"grad_norm": 3.9437687397003174,
"learning_rate": 1.355e-05,
"loss": 1.3545150756835938,
"step": 2375
},
{
"epoch": 2.8776978417266186,
"grad_norm": 4.234551906585693,
"learning_rate": 1.3341666666666668e-05,
"loss": 1.3189064025878907,
"step": 2400
},
{
"epoch": 2.907673860911271,
"grad_norm": 3.8854103088378906,
"learning_rate": 1.3133333333333334e-05,
"loss": 1.3604727172851563,
"step": 2425
},
{
"epoch": 2.937649880095923,
"grad_norm": 4.403459072113037,
"learning_rate": 1.2925e-05,
"loss": 1.3202362060546875,
"step": 2450
},
{
"epoch": 2.9676258992805753,
"grad_norm": 3.7993664741516113,
"learning_rate": 1.2716666666666666e-05,
"loss": 1.3466416931152343,
"step": 2475
},
{
"epoch": 2.997601918465228,
"grad_norm": 4.246622562408447,
"learning_rate": 1.2508333333333334e-05,
"loss": 1.255322494506836,
"step": 2500
},
{
"epoch": 2.997601918465228,
"eval_loss": 0.32123640179634094,
"eval_runtime": 17.9027,
"eval_samples_per_second": 90.489,
"eval_steps_per_second": 11.339,
"eval_wer": 39.50587017515186,
"step": 2500
},
{
"epoch": 3.02757793764988,
"grad_norm": 4.5194411277771,
"learning_rate": 1.2299999999999999e-05,
"loss": 1.3707557678222657,
"step": 2525
},
{
"epoch": 3.0575539568345325,
"grad_norm": 4.761359214782715,
"learning_rate": 1.2091666666666666e-05,
"loss": 1.2971902465820313,
"step": 2550
},
{
"epoch": 3.0875299760191846,
"grad_norm": 3.902237892150879,
"learning_rate": 1.1883333333333334e-05,
"loss": 1.3517869567871095,
"step": 2575
},
{
"epoch": 3.117505995203837,
"grad_norm": 4.836638450622559,
"learning_rate": 1.1675000000000001e-05,
"loss": 1.204417724609375,
"step": 2600
},
{
"epoch": 3.147482014388489,
"grad_norm": 3.637927770614624,
"learning_rate": 1.1466666666666668e-05,
"loss": 1.3902195739746093,
"step": 2625
},
{
"epoch": 3.1774580335731413,
"grad_norm": 5.192939281463623,
"learning_rate": 1.1258333333333334e-05,
"loss": 1.210543670654297,
"step": 2650
},
{
"epoch": 3.207434052757794,
"grad_norm": 3.76882004737854,
"learning_rate": 1.1050000000000001e-05,
"loss": 1.292550048828125,
"step": 2675
},
{
"epoch": 3.237410071942446,
"grad_norm": 4.45828104019165,
"learning_rate": 1.0841666666666666e-05,
"loss": 1.1661454010009766,
"step": 2700
},
{
"epoch": 3.2673860911270984,
"grad_norm": 3.8488924503326416,
"learning_rate": 1.0633333333333334e-05,
"loss": 1.3198445129394532,
"step": 2725
},
{
"epoch": 3.2973621103117505,
"grad_norm": 4.573055744171143,
"learning_rate": 1.0425e-05,
"loss": 1.215043182373047,
"step": 2750
},
{
"epoch": 3.2973621103117505,
"eval_loss": 0.3164944350719452,
"eval_runtime": 17.9593,
"eval_samples_per_second": 90.204,
"eval_steps_per_second": 11.303,
"eval_wer": 39.07003350494402,
"step": 2750
},
{
"epoch": 3.327338129496403,
"grad_norm": 3.0178797245025635,
"learning_rate": 1.0216666666666667e-05,
"loss": 1.3084765625,
"step": 2775
},
{
"epoch": 3.357314148681055,
"grad_norm": 4.195224285125732,
"learning_rate": 1.0008333333333334e-05,
"loss": 1.2380980682373046,
"step": 2800
},
{
"epoch": 3.3872901678657072,
"grad_norm": 3.9489684104919434,
"learning_rate": 9.8e-06,
"loss": 1.3261349487304688,
"step": 2825
},
{
"epoch": 3.41726618705036,
"grad_norm": 4.707721710205078,
"learning_rate": 9.591666666666668e-06,
"loss": 1.166817626953125,
"step": 2850
},
{
"epoch": 3.447242206235012,
"grad_norm": 3.6897363662719727,
"learning_rate": 9.383333333333334e-06,
"loss": 1.3451451110839843,
"step": 2875
},
{
"epoch": 3.4772182254196644,
"grad_norm": 3.894786834716797,
"learning_rate": 9.175000000000001e-06,
"loss": 1.215664825439453,
"step": 2900
},
{
"epoch": 3.5071942446043165,
"grad_norm": 4.44349479675293,
"learning_rate": 8.966666666666667e-06,
"loss": 1.2665501403808594,
"step": 2925
},
{
"epoch": 3.537170263788969,
"grad_norm": 4.028308868408203,
"learning_rate": 8.758333333333334e-06,
"loss": 1.1728402709960937,
"step": 2950
},
{
"epoch": 3.567146282973621,
"grad_norm": 3.627992630004883,
"learning_rate": 8.55e-06,
"loss": 1.2784690856933594,
"step": 2975
},
{
"epoch": 3.597122302158273,
"grad_norm": 3.8370578289031982,
"learning_rate": 8.341666666666667e-06,
"loss": 1.1342899322509765,
"step": 3000
},
{
"epoch": 3.597122302158273,
"eval_loss": 0.310255765914917,
"eval_runtime": 18.0427,
"eval_samples_per_second": 89.787,
"eval_steps_per_second": 11.251,
"eval_wer": 38.22287597722753,
"step": 3000
},
{
"epoch": 3.6270983213429258,
"grad_norm": 2.9377591609954834,
"learning_rate": 8.133333333333334e-06,
"loss": 1.3874595642089844,
"step": 3025
},
{
"epoch": 3.657074340527578,
"grad_norm": 5.296197414398193,
"learning_rate": 7.925e-06,
"loss": 1.1686283111572267,
"step": 3050
},
{
"epoch": 3.68705035971223,
"grad_norm": 3.4494028091430664,
"learning_rate": 7.716666666666667e-06,
"loss": 1.202396469116211,
"step": 3075
},
{
"epoch": 3.7170263788968825,
"grad_norm": 4.737746238708496,
"learning_rate": 7.508333333333333e-06,
"loss": 1.1863296508789063,
"step": 3100
},
{
"epoch": 3.747002398081535,
"grad_norm": 3.7916765213012695,
"learning_rate": 7.3e-06,
"loss": 1.3395465087890626,
"step": 3125
},
{
"epoch": 3.776978417266187,
"grad_norm": 4.551313400268555,
"learning_rate": 7.091666666666667e-06,
"loss": 1.1056033325195314,
"step": 3150
},
{
"epoch": 3.806954436450839,
"grad_norm": 4.075565338134766,
"learning_rate": 6.883333333333334e-06,
"loss": 1.3138325500488282,
"step": 3175
},
{
"epoch": 3.8369304556354917,
"grad_norm": 3.972641706466675,
"learning_rate": 6.6750000000000005e-06,
"loss": 1.1527600860595704,
"step": 3200
},
{
"epoch": 3.866906474820144,
"grad_norm": 3.812631845474243,
"learning_rate": 6.466666666666667e-06,
"loss": 1.2789608001708985,
"step": 3225
},
{
"epoch": 3.896882494004796,
"grad_norm": 5.695910930633545,
"learning_rate": 6.258333333333333e-06,
"loss": 1.1754793548583984,
"step": 3250
},
{
"epoch": 3.896882494004796,
"eval_loss": 0.3044012486934662,
"eval_runtime": 18.0122,
"eval_samples_per_second": 89.939,
"eval_steps_per_second": 11.27,
"eval_wer": 38.53613358393942,
"step": 3250
},
{
"epoch": 3.9268585131894485,
"grad_norm": 3.0165011882781982,
"learning_rate": 6.05e-06,
"loss": 1.3710069274902343,
"step": 3275
},
{
"epoch": 3.956834532374101,
"grad_norm": 4.425358295440674,
"learning_rate": 5.841666666666667e-06,
"loss": 1.1081704711914062,
"step": 3300
},
{
"epoch": 3.986810551558753,
"grad_norm": 4.782137393951416,
"learning_rate": 5.633333333333333e-06,
"loss": 1.438135986328125,
"step": 3325
},
{
"epoch": 4.016786570743405,
"grad_norm": 3.2695047855377197,
"learning_rate": 5.4250000000000006e-06,
"loss": 1.1687757873535156,
"step": 3350
},
{
"epoch": 4.046762589928058,
"grad_norm": 3.6320788860321045,
"learning_rate": 5.216666666666667e-06,
"loss": 1.139478988647461,
"step": 3375
},
{
"epoch": 4.07673860911271,
"grad_norm": 3.5363335609436035,
"learning_rate": 5.008333333333333e-06,
"loss": 1.2308349609375,
"step": 3400
},
{
"epoch": 4.106714628297362,
"grad_norm": 3.7217462062835693,
"learning_rate": 4.800000000000001e-06,
"loss": 1.1875200653076172,
"step": 3425
},
{
"epoch": 4.136690647482014,
"grad_norm": 3.1459712982177734,
"learning_rate": 4.591666666666667e-06,
"loss": 1.1901798248291016,
"step": 3450
},
{
"epoch": 4.166666666666667,
"grad_norm": 3.7371957302093506,
"learning_rate": 4.3833333333333334e-06,
"loss": 1.0538123321533204,
"step": 3475
},
{
"epoch": 4.196642685851319,
"grad_norm": 3.7070775032043457,
"learning_rate": 4.175e-06,
"loss": 1.193154525756836,
"step": 3500
},
{
"epoch": 4.196642685851319,
"eval_loss": 0.30022621154785156,
"eval_runtime": 18.115,
"eval_samples_per_second": 89.428,
"eval_steps_per_second": 11.206,
"eval_wer": 37.855138786739666,
"step": 3500
},
{
"epoch": 4.226618705035971,
"grad_norm": 3.048323154449463,
"learning_rate": 3.966666666666666e-06,
"loss": 1.1228433990478515,
"step": 3525
},
{
"epoch": 4.256594724220624,
"grad_norm": 3.1846795082092285,
"learning_rate": 3.758333333333333e-06,
"loss": 1.2151748657226562,
"step": 3550
},
{
"epoch": 4.286570743405276,
"grad_norm": 4.277435302734375,
"learning_rate": 3.55e-06,
"loss": 1.146432876586914,
"step": 3575
},
{
"epoch": 4.316546762589928,
"grad_norm": 3.3862087726593018,
"learning_rate": 3.3416666666666667e-06,
"loss": 1.2336856079101564,
"step": 3600
},
{
"epoch": 4.34652278177458,
"grad_norm": 4.78780460357666,
"learning_rate": 3.1333333333333335e-06,
"loss": 1.1951210021972656,
"step": 3625
},
{
"epoch": 4.376498800959233,
"grad_norm": 3.9586503505706787,
"learning_rate": 2.9250000000000004e-06,
"loss": 1.227743148803711,
"step": 3650
},
{
"epoch": 4.406474820143885,
"grad_norm": 4.07125186920166,
"learning_rate": 2.7166666666666668e-06,
"loss": 1.1534527587890624,
"step": 3675
},
{
"epoch": 4.436450839328537,
"grad_norm": 3.8952131271362305,
"learning_rate": 2.508333333333333e-06,
"loss": 1.1760161590576172,
"step": 3700
},
{
"epoch": 4.46642685851319,
"grad_norm": 4.782440185546875,
"learning_rate": 2.3e-06,
"loss": 1.0955001068115235,
"step": 3725
},
{
"epoch": 4.496402877697841,
"grad_norm": 3.4196395874023438,
"learning_rate": 2.091666666666667e-06,
"loss": 1.3582955932617187,
"step": 3750
},
{
"epoch": 4.496402877697841,
"eval_loss": 0.29945749044418335,
"eval_runtime": 18.1526,
"eval_samples_per_second": 89.244,
"eval_steps_per_second": 11.183,
"eval_wer": 37.71349186892212,
"step": 3750
},
{
"epoch": 4.526378896882494,
"grad_norm": 4.029821395874023,
"learning_rate": 1.8833333333333334e-06,
"loss": 1.050459747314453,
"step": 3775
},
{
"epoch": 4.556354916067146,
"grad_norm": 3.5950191020965576,
"learning_rate": 1.675e-06,
"loss": 1.2073076629638673,
"step": 3800
},
{
"epoch": 4.586330935251799,
"grad_norm": 3.9220163822174072,
"learning_rate": 1.4666666666666669e-06,
"loss": 1.0614564514160156,
"step": 3825
},
{
"epoch": 4.616306954436451,
"grad_norm": 28.386432647705078,
"learning_rate": 1.2583333333333333e-06,
"loss": 1.43855224609375,
"step": 3850
},
{
"epoch": 4.646282973621103,
"grad_norm": 3.9794702529907227,
"learning_rate": 1.0500000000000001e-06,
"loss": 1.1082134246826172,
"step": 3875
},
{
"epoch": 4.676258992805756,
"grad_norm": 2.8433194160461426,
"learning_rate": 8.416666666666667e-07,
"loss": 1.1347400665283203,
"step": 3900
},
{
"epoch": 4.706235011990408,
"grad_norm": 3.9949467182159424,
"learning_rate": 6.333333333333333e-07,
"loss": 1.2218107604980468,
"step": 3925
},
{
"epoch": 4.73621103117506,
"grad_norm": 3.4458863735198975,
"learning_rate": 4.25e-07,
"loss": 1.222669906616211,
"step": 3950
},
{
"epoch": 4.766187050359712,
"grad_norm": 3.780194044113159,
"learning_rate": 2.1666666666666667e-07,
"loss": 1.122889175415039,
"step": 3975
},
{
"epoch": 4.796163069544365,
"grad_norm": 2.996938705444336,
"learning_rate": 8.333333333333334e-09,
"loss": 1.305466766357422,
"step": 4000
},
{
"epoch": 4.796163069544365,
"eval_loss": 0.30047205090522766,
"eval_runtime": 17.9707,
"eval_samples_per_second": 90.147,
"eval_steps_per_second": 11.296,
"eval_wer": 37.73255972324371,
"step": 4000
},
{
"epoch": 4.796163069544365,
"step": 4000,
"total_flos": 1.186592111130968e+19,
"train_loss": 4.035597569465637,
"train_runtime": 1379.9989,
"train_samples_per_second": 46.377,
"train_steps_per_second": 2.899
}
],
"logging_steps": 25,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 250,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.1
},
"attributes": {
"early_stopping_patience_counter": 1
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.186592111130968e+19,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}