{ "best_global_step": 3750, "best_metric": 37.71349186892212, "best_model_checkpoint": "./wav2vec2-base-sna-cleaned/checkpoint-3750", "epoch": 4.796163069544365, "eval_steps": 250, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02997601918465228, "grad_norm": 87.95906829833984, "learning_rate": 1.8e-06, "loss": 65.4899169921875, "step": 25 }, { "epoch": 0.05995203836930456, "grad_norm": 163.35479736328125, "learning_rate": 3.675e-06, "loss": 59.3804345703125, "step": 50 }, { "epoch": 0.08992805755395683, "grad_norm": 117.41580963134766, "learning_rate": 5.55e-06, "loss": 38.9528857421875, "step": 75 }, { "epoch": 0.11990407673860912, "grad_norm": 42.569610595703125, "learning_rate": 7.425e-06, "loss": 17.7254150390625, "step": 100 }, { "epoch": 0.1498800959232614, "grad_norm": 15.584668159484863, "learning_rate": 9.3e-06, "loss": 13.227435302734374, "step": 125 }, { "epoch": 0.17985611510791366, "grad_norm": 19.06544303894043, "learning_rate": 1.1175e-05, "loss": 12.7419970703125, "step": 150 }, { "epoch": 0.20983213429256595, "grad_norm": 9.686856269836426, "learning_rate": 1.305e-05, "loss": 12.3552099609375, "step": 175 }, { "epoch": 0.23980815347721823, "grad_norm": 19.430574417114258, "learning_rate": 1.4925e-05, "loss": 12.184576416015625, "step": 200 }, { "epoch": 0.2697841726618705, "grad_norm": 8.859325408935547, "learning_rate": 1.6800000000000002e-05, "loss": 11.995687255859375, "step": 225 }, { "epoch": 0.2997601918465228, "grad_norm": 7.194825172424316, "learning_rate": 1.8675000000000003e-05, "loss": 11.898416748046875, "step": 250 }, { "epoch": 0.2997601918465228, "eval_loss": 2.9574084281921387, "eval_runtime": 17.3027, "eval_samples_per_second": 93.627, "eval_steps_per_second": 11.732, "eval_wer": 99.9972760208112, "step": 250 }, { "epoch": 0.32973621103117506, "grad_norm": 6.046307563781738, "learning_rate": 2.055e-05, "loss": 11.7874072265625, "step": 275 }, { "epoch": 0.3597122302158273, "grad_norm": 2.4176154136657715, "learning_rate": 2.2425000000000003e-05, "loss": 11.74424560546875, "step": 300 }, { "epoch": 0.38968824940047964, "grad_norm": 2.773775815963745, "learning_rate": 2.43e-05, "loss": 11.693775634765625, "step": 325 }, { "epoch": 0.4196642685851319, "grad_norm": 5.9898552894592285, "learning_rate": 2.6175000000000003e-05, "loss": 11.669410400390625, "step": 350 }, { "epoch": 0.44964028776978415, "grad_norm": 2.4337611198425293, "learning_rate": 2.805e-05, "loss": 11.601651611328125, "step": 375 }, { "epoch": 0.47961630695443647, "grad_norm": 6.943758964538574, "learning_rate": 2.9925000000000002e-05, "loss": 11.6068701171875, "step": 400 }, { "epoch": 0.5095923261390888, "grad_norm": 9.041548728942871, "learning_rate": 2.98e-05, "loss": 11.59481201171875, "step": 425 }, { "epoch": 0.539568345323741, "grad_norm": 2.0354104042053223, "learning_rate": 2.9591666666666667e-05, "loss": 11.573612060546875, "step": 450 }, { "epoch": 0.5695443645083933, "grad_norm": 1.5390305519104004, "learning_rate": 2.9383333333333334e-05, "loss": 11.53906005859375, "step": 475 }, { "epoch": 0.5995203836930456, "grad_norm": 5.494091510772705, "learning_rate": 2.9175e-05, "loss": 11.54445556640625, "step": 500 }, { "epoch": 0.5995203836930456, "eval_loss": 2.8992974758148193, "eval_runtime": 17.2261, "eval_samples_per_second": 94.044, "eval_steps_per_second": 11.784, "eval_wer": 99.9972760208112, "step": 500 }, { "epoch": 0.6294964028776978, "grad_norm": 2.440443515777588, "learning_rate": 2.8966666666666665e-05, "loss": 11.5015576171875, "step": 525 }, { "epoch": 0.6594724220623501, "grad_norm": 4.654289722442627, "learning_rate": 2.8758333333333332e-05, "loss": 11.103582763671875, "step": 550 }, { "epoch": 0.6894484412470024, "grad_norm": 6.255335330963135, "learning_rate": 2.855e-05, "loss": 10.390032958984374, "step": 575 }, { "epoch": 0.7194244604316546, "grad_norm": 10.0020112991333, "learning_rate": 2.8341666666666667e-05, "loss": 9.397643432617187, "step": 600 }, { "epoch": 0.749400479616307, "grad_norm": 7.839452266693115, "learning_rate": 2.8133333333333334e-05, "loss": 7.82263671875, "step": 625 }, { "epoch": 0.7793764988009593, "grad_norm": 7.001938343048096, "learning_rate": 2.7924999999999998e-05, "loss": 6.276546020507812, "step": 650 }, { "epoch": 0.8093525179856115, "grad_norm": 6.308192729949951, "learning_rate": 2.771666666666667e-05, "loss": 5.47916259765625, "step": 675 }, { "epoch": 0.8393285371702638, "grad_norm": 10.70156478881836, "learning_rate": 2.7508333333333336e-05, "loss": 4.5777520751953125, "step": 700 }, { "epoch": 0.8693045563549161, "grad_norm": 7.3394551277160645, "learning_rate": 2.7300000000000003e-05, "loss": 4.2768948364257815, "step": 725 }, { "epoch": 0.8992805755395683, "grad_norm": 9.546968460083008, "learning_rate": 2.7091666666666667e-05, "loss": 3.8439666748046877, "step": 750 }, { "epoch": 0.8992805755395683, "eval_loss": 0.814090371131897, "eval_runtime": 17.3358, "eval_samples_per_second": 93.448, "eval_steps_per_second": 11.71, "eval_wer": 98.76603742747405, "step": 750 }, { "epoch": 0.9292565947242206, "grad_norm": 5.7955803871154785, "learning_rate": 2.6883333333333334e-05, "loss": 3.4320477294921874, "step": 775 }, { "epoch": 0.9592326139088729, "grad_norm": 7.267416477203369, "learning_rate": 2.6675e-05, "loss": 3.3107342529296875, "step": 800 }, { "epoch": 0.9892086330935251, "grad_norm": 5.454007148742676, "learning_rate": 2.646666666666667e-05, "loss": 3.279764404296875, "step": 825 }, { "epoch": 1.0191846522781776, "grad_norm": 6.052438735961914, "learning_rate": 2.6258333333333336e-05, "loss": 2.929551086425781, "step": 850 }, { "epoch": 1.0491606714628297, "grad_norm": 5.4171319007873535, "learning_rate": 2.605e-05, "loss": 2.633551025390625, "step": 875 }, { "epoch": 1.079136690647482, "grad_norm": 6.3133320808410645, "learning_rate": 2.5841666666666667e-05, "loss": 2.9070010375976563, "step": 900 }, { "epoch": 1.1091127098321343, "grad_norm": 5.874911785125732, "learning_rate": 2.5633333333333334e-05, "loss": 2.554573516845703, "step": 925 }, { "epoch": 1.1390887290167866, "grad_norm": 4.682479381561279, "learning_rate": 2.5425e-05, "loss": 2.424696960449219, "step": 950 }, { "epoch": 1.169064748201439, "grad_norm": 5.821262836456299, "learning_rate": 2.5216666666666665e-05, "loss": 2.3822782897949217, "step": 975 }, { "epoch": 1.1990407673860912, "grad_norm": 4.946887969970703, "learning_rate": 2.5008333333333332e-05, "loss": 2.3326264953613283, "step": 1000 }, { "epoch": 1.1990407673860912, "eval_loss": 0.5055655241012573, "eval_runtime": 17.356, "eval_samples_per_second": 93.339, "eval_steps_per_second": 11.696, "eval_wer": 56.12759118520334, "step": 1000 }, { "epoch": 1.2290167865707433, "grad_norm": 5.456410884857178, "learning_rate": 2.48e-05, "loss": 2.232008819580078, "step": 1025 }, { "epoch": 1.2589928057553956, "grad_norm": 12.988375663757324, "learning_rate": 2.4591666666666667e-05, "loss": 2.308787841796875, "step": 1050 }, { "epoch": 1.288968824940048, "grad_norm": 5.91463565826416, "learning_rate": 2.4383333333333334e-05, "loss": 2.133858489990234, "step": 1075 }, { "epoch": 1.3189448441247003, "grad_norm": 5.080030918121338, "learning_rate": 2.4174999999999998e-05, "loss": 2.111269836425781, "step": 1100 }, { "epoch": 1.3489208633093526, "grad_norm": 6.5078959465026855, "learning_rate": 2.3966666666666665e-05, "loss": 1.9835806274414063, "step": 1125 }, { "epoch": 1.3788968824940047, "grad_norm": 6.049032688140869, "learning_rate": 2.3758333333333333e-05, "loss": 1.948318328857422, "step": 1150 }, { "epoch": 1.4088729016786572, "grad_norm": 4.487147808074951, "learning_rate": 2.3550000000000003e-05, "loss": 1.9143856811523436, "step": 1175 }, { "epoch": 1.4388489208633093, "grad_norm": 4.666418075561523, "learning_rate": 2.3341666666666667e-05, "loss": 1.9930302429199218, "step": 1200 }, { "epoch": 1.4688249400479616, "grad_norm": 5.2837233543396, "learning_rate": 2.3133333333333334e-05, "loss": 1.9030076599121093, "step": 1225 }, { "epoch": 1.498800959232614, "grad_norm": 4.892092227935791, "learning_rate": 2.2925e-05, "loss": 1.993743896484375, "step": 1250 }, { "epoch": 1.498800959232614, "eval_loss": 0.4353557825088501, "eval_runtime": 17.8784, "eval_samples_per_second": 90.612, "eval_steps_per_second": 11.355, "eval_wer": 49.77254773773529, "step": 1250 }, { "epoch": 1.5287769784172662, "grad_norm": 4.702995777130127, "learning_rate": 2.271666666666667e-05, "loss": 1.8019261169433594, "step": 1275 }, { "epoch": 1.5587529976019185, "grad_norm": 5.374894618988037, "learning_rate": 2.2508333333333336e-05, "loss": 1.9548370361328125, "step": 1300 }, { "epoch": 1.5887290167865706, "grad_norm": 5.36961555480957, "learning_rate": 2.23e-05, "loss": 1.6951516723632813, "step": 1325 }, { "epoch": 1.6187050359712232, "grad_norm": 5.167247772216797, "learning_rate": 2.2091666666666667e-05, "loss": 1.887311248779297, "step": 1350 }, { "epoch": 1.6486810551558753, "grad_norm": 4.589432716369629, "learning_rate": 2.1883333333333334e-05, "loss": 1.8049166870117188, "step": 1375 }, { "epoch": 1.6786570743405276, "grad_norm": 4.192942142486572, "learning_rate": 2.1675e-05, "loss": 1.8473945617675782, "step": 1400 }, { "epoch": 1.70863309352518, "grad_norm": 4.900947570800781, "learning_rate": 2.1466666666666666e-05, "loss": 1.7062265014648437, "step": 1425 }, { "epoch": 1.738609112709832, "grad_norm": 4.3333587646484375, "learning_rate": 2.1258333333333333e-05, "loss": 1.7642361450195312, "step": 1450 }, { "epoch": 1.7685851318944845, "grad_norm": 5.301547050476074, "learning_rate": 2.105e-05, "loss": 1.6472731018066407, "step": 1475 }, { "epoch": 1.7985611510791366, "grad_norm": 4.614596366882324, "learning_rate": 2.0841666666666667e-05, "loss": 1.8639109802246094, "step": 1500 }, { "epoch": 1.7985611510791366, "eval_loss": 0.3815246522426605, "eval_runtime": 17.5598, "eval_samples_per_second": 92.256, "eval_steps_per_second": 11.561, "eval_wer": 45.07640761624581, "step": 1500 }, { "epoch": 1.828537170263789, "grad_norm": 4.178606033325195, "learning_rate": 2.0633333333333335e-05, "loss": 1.5441552734375, "step": 1525 }, { "epoch": 1.8585131894484412, "grad_norm": 4.956863880157471, "learning_rate": 2.0425e-05, "loss": 1.9137911987304688, "step": 1550 }, { "epoch": 1.8884892086330936, "grad_norm": 4.828672885894775, "learning_rate": 2.0216666666666666e-05, "loss": 1.5100914001464845, "step": 1575 }, { "epoch": 1.9184652278177459, "grad_norm": 3.7223966121673584, "learning_rate": 2.0008333333333333e-05, "loss": 1.688656768798828, "step": 1600 }, { "epoch": 1.948441247002398, "grad_norm": 5.0394062995910645, "learning_rate": 1.98e-05, "loss": 1.5531495666503907, "step": 1625 }, { "epoch": 1.9784172661870505, "grad_norm": 4.3810954093933105, "learning_rate": 1.9591666666666664e-05, "loss": 1.7138851928710936, "step": 1650 }, { "epoch": 2.0083932853717026, "grad_norm": 3.4982099533081055, "learning_rate": 1.938333333333333e-05, "loss": 1.5514004516601563, "step": 1675 }, { "epoch": 2.038369304556355, "grad_norm": 4.8457136154174805, "learning_rate": 1.9175000000000002e-05, "loss": 1.5973490905761718, "step": 1700 }, { "epoch": 2.068345323741007, "grad_norm": 4.1086602210998535, "learning_rate": 1.896666666666667e-05, "loss": 1.5693655395507813, "step": 1725 }, { "epoch": 2.0983213429256593, "grad_norm": 4.984743118286133, "learning_rate": 1.8758333333333336e-05, "loss": 1.5768695068359375, "step": 1750 }, { "epoch": 2.0983213429256593, "eval_loss": 0.3492273688316345, "eval_runtime": 17.4669, "eval_samples_per_second": 92.747, "eval_steps_per_second": 11.622, "eval_wer": 43.68445425076952, "step": 1750 }, { "epoch": 2.128297362110312, "grad_norm": 4.139465808868408, "learning_rate": 1.855e-05, "loss": 1.5272630310058595, "step": 1775 }, { "epoch": 2.158273381294964, "grad_norm": 4.634520053863525, "learning_rate": 1.8341666666666668e-05, "loss": 1.4187347412109375, "step": 1800 }, { "epoch": 2.1882494004796165, "grad_norm": 3.5434200763702393, "learning_rate": 1.8133333333333335e-05, "loss": 1.5776219177246094, "step": 1825 }, { "epoch": 2.2182254196642686, "grad_norm": 4.246279716491699, "learning_rate": 1.7925000000000002e-05, "loss": 1.4354205322265625, "step": 1850 }, { "epoch": 2.2482014388489207, "grad_norm": 3.7664794921875, "learning_rate": 1.7716666666666666e-05, "loss": 1.4057354736328125, "step": 1875 }, { "epoch": 2.278177458033573, "grad_norm": 5.111608028411865, "learning_rate": 1.7508333333333333e-05, "loss": 1.5491357421875, "step": 1900 }, { "epoch": 2.3081534772182253, "grad_norm": 4.471536636352539, "learning_rate": 1.73e-05, "loss": 1.4842294311523438, "step": 1925 }, { "epoch": 2.338129496402878, "grad_norm": 3.7081987857818604, "learning_rate": 1.7091666666666668e-05, "loss": 1.450211181640625, "step": 1950 }, { "epoch": 2.36810551558753, "grad_norm": 3.8253395557403564, "learning_rate": 1.6883333333333335e-05, "loss": 1.376385498046875, "step": 1975 }, { "epoch": 2.3980815347721824, "grad_norm": 3.773341417312622, "learning_rate": 1.6675e-05, "loss": 1.4288015747070313, "step": 2000 }, { "epoch": 2.3980815347721824, "eval_loss": 0.33844250440597534, "eval_runtime": 17.2583, "eval_samples_per_second": 93.868, "eval_steps_per_second": 11.762, "eval_wer": 41.22470104328403, "step": 2000 }, { "epoch": 2.4280575539568345, "grad_norm": 3.5804367065429688, "learning_rate": 1.6466666666666666e-05, "loss": 1.4616065979003907, "step": 2025 }, { "epoch": 2.4580335731414866, "grad_norm": 4.723759651184082, "learning_rate": 1.6258333333333333e-05, "loss": 1.3814134216308593, "step": 2050 }, { "epoch": 2.488009592326139, "grad_norm": 3.2633466720581055, "learning_rate": 1.605e-05, "loss": 1.393878173828125, "step": 2075 }, { "epoch": 2.5179856115107913, "grad_norm": 4.216237545013428, "learning_rate": 1.5841666666666664e-05, "loss": 1.40193603515625, "step": 2100 }, { "epoch": 2.547961630695444, "grad_norm": 3.037777900695801, "learning_rate": 1.563333333333333e-05, "loss": 1.3580673217773438, "step": 2125 }, { "epoch": 2.577937649880096, "grad_norm": 5.0248847007751465, "learning_rate": 1.5425e-05, "loss": 1.572769012451172, "step": 2150 }, { "epoch": 2.6079136690647484, "grad_norm": 3.7339730262756348, "learning_rate": 1.5216666666666668e-05, "loss": 1.5580809020996094, "step": 2175 }, { "epoch": 2.6378896882494005, "grad_norm": 3.7687699794769287, "learning_rate": 1.5008333333333335e-05, "loss": 1.427168731689453, "step": 2200 }, { "epoch": 2.6678657074340526, "grad_norm": 3.9816343784332275, "learning_rate": 1.48e-05, "loss": 1.3857545471191406, "step": 2225 }, { "epoch": 2.697841726618705, "grad_norm": 3.972137212753296, "learning_rate": 1.4591666666666666e-05, "loss": 1.331875, "step": 2250 }, { "epoch": 2.697841726618705, "eval_loss": 0.3375837802886963, "eval_runtime": 17.4226, "eval_samples_per_second": 92.983, "eval_steps_per_second": 11.652, "eval_wer": 40.461986870420304, "step": 2250 }, { "epoch": 2.7278177458033572, "grad_norm": 3.696455717086792, "learning_rate": 1.4383333333333333e-05, "loss": 1.2858570861816405, "step": 2275 }, { "epoch": 2.7577937649880093, "grad_norm": 3.8930845260620117, "learning_rate": 1.4174999999999999e-05, "loss": 1.3353477478027345, "step": 2300 }, { "epoch": 2.787769784172662, "grad_norm": 3.240628719329834, "learning_rate": 1.3966666666666666e-05, "loss": 1.5282106018066406, "step": 2325 }, { "epoch": 2.8177458033573144, "grad_norm": 4.53059196472168, "learning_rate": 1.3758333333333335e-05, "loss": 1.325364990234375, "step": 2350 }, { "epoch": 2.8477218225419665, "grad_norm": 3.9437687397003174, "learning_rate": 1.355e-05, "loss": 1.3545150756835938, "step": 2375 }, { "epoch": 2.8776978417266186, "grad_norm": 4.234551906585693, "learning_rate": 1.3341666666666668e-05, "loss": 1.3189064025878907, "step": 2400 }, { "epoch": 2.907673860911271, "grad_norm": 3.8854103088378906, "learning_rate": 1.3133333333333334e-05, "loss": 1.3604727172851563, "step": 2425 }, { "epoch": 2.937649880095923, "grad_norm": 4.403459072113037, "learning_rate": 1.2925e-05, "loss": 1.3202362060546875, "step": 2450 }, { "epoch": 2.9676258992805753, "grad_norm": 3.7993664741516113, "learning_rate": 1.2716666666666666e-05, "loss": 1.3466416931152343, "step": 2475 }, { "epoch": 2.997601918465228, "grad_norm": 4.246622562408447, "learning_rate": 1.2508333333333334e-05, "loss": 1.255322494506836, "step": 2500 }, { "epoch": 2.997601918465228, "eval_loss": 0.32123640179634094, "eval_runtime": 17.9027, "eval_samples_per_second": 90.489, "eval_steps_per_second": 11.339, "eval_wer": 39.50587017515186, "step": 2500 }, { "epoch": 3.02757793764988, "grad_norm": 4.5194411277771, "learning_rate": 1.2299999999999999e-05, "loss": 1.3707557678222657, "step": 2525 }, { "epoch": 3.0575539568345325, "grad_norm": 4.761359214782715, "learning_rate": 1.2091666666666666e-05, "loss": 1.2971902465820313, "step": 2550 }, { "epoch": 3.0875299760191846, "grad_norm": 3.902237892150879, "learning_rate": 1.1883333333333334e-05, "loss": 1.3517869567871095, "step": 2575 }, { "epoch": 3.117505995203837, "grad_norm": 4.836638450622559, "learning_rate": 1.1675000000000001e-05, "loss": 1.204417724609375, "step": 2600 }, { "epoch": 3.147482014388489, "grad_norm": 3.637927770614624, "learning_rate": 1.1466666666666668e-05, "loss": 1.3902195739746093, "step": 2625 }, { "epoch": 3.1774580335731413, "grad_norm": 5.192939281463623, "learning_rate": 1.1258333333333334e-05, "loss": 1.210543670654297, "step": 2650 }, { "epoch": 3.207434052757794, "grad_norm": 3.76882004737854, "learning_rate": 1.1050000000000001e-05, "loss": 1.292550048828125, "step": 2675 }, { "epoch": 3.237410071942446, "grad_norm": 4.45828104019165, "learning_rate": 1.0841666666666666e-05, "loss": 1.1661454010009766, "step": 2700 }, { "epoch": 3.2673860911270984, "grad_norm": 3.8488924503326416, "learning_rate": 1.0633333333333334e-05, "loss": 1.3198445129394532, "step": 2725 }, { "epoch": 3.2973621103117505, "grad_norm": 4.573055744171143, "learning_rate": 1.0425e-05, "loss": 1.215043182373047, "step": 2750 }, { "epoch": 3.2973621103117505, "eval_loss": 0.3164944350719452, "eval_runtime": 17.9593, "eval_samples_per_second": 90.204, "eval_steps_per_second": 11.303, "eval_wer": 39.07003350494402, "step": 2750 }, { "epoch": 3.327338129496403, "grad_norm": 3.0178797245025635, "learning_rate": 1.0216666666666667e-05, "loss": 1.3084765625, "step": 2775 }, { "epoch": 3.357314148681055, "grad_norm": 4.195224285125732, "learning_rate": 1.0008333333333334e-05, "loss": 1.2380980682373046, "step": 2800 }, { "epoch": 3.3872901678657072, "grad_norm": 3.9489684104919434, "learning_rate": 9.8e-06, "loss": 1.3261349487304688, "step": 2825 }, { "epoch": 3.41726618705036, "grad_norm": 4.707721710205078, "learning_rate": 9.591666666666668e-06, "loss": 1.166817626953125, "step": 2850 }, { "epoch": 3.447242206235012, "grad_norm": 3.6897363662719727, "learning_rate": 9.383333333333334e-06, "loss": 1.3451451110839843, "step": 2875 }, { "epoch": 3.4772182254196644, "grad_norm": 3.894786834716797, "learning_rate": 9.175000000000001e-06, "loss": 1.215664825439453, "step": 2900 }, { "epoch": 3.5071942446043165, "grad_norm": 4.44349479675293, "learning_rate": 8.966666666666667e-06, "loss": 1.2665501403808594, "step": 2925 }, { "epoch": 3.537170263788969, "grad_norm": 4.028308868408203, "learning_rate": 8.758333333333334e-06, "loss": 1.1728402709960937, "step": 2950 }, { "epoch": 3.567146282973621, "grad_norm": 3.627992630004883, "learning_rate": 8.55e-06, "loss": 1.2784690856933594, "step": 2975 }, { "epoch": 3.597122302158273, "grad_norm": 3.8370578289031982, "learning_rate": 8.341666666666667e-06, "loss": 1.1342899322509765, "step": 3000 }, { "epoch": 3.597122302158273, "eval_loss": 0.310255765914917, "eval_runtime": 18.0427, "eval_samples_per_second": 89.787, "eval_steps_per_second": 11.251, "eval_wer": 38.22287597722753, "step": 3000 }, { "epoch": 3.6270983213429258, "grad_norm": 2.9377591609954834, "learning_rate": 8.133333333333334e-06, "loss": 1.3874595642089844, "step": 3025 }, { "epoch": 3.657074340527578, "grad_norm": 5.296197414398193, "learning_rate": 7.925e-06, "loss": 1.1686283111572267, "step": 3050 }, { "epoch": 3.68705035971223, "grad_norm": 3.4494028091430664, "learning_rate": 7.716666666666667e-06, "loss": 1.202396469116211, "step": 3075 }, { "epoch": 3.7170263788968825, "grad_norm": 4.737746238708496, "learning_rate": 7.508333333333333e-06, "loss": 1.1863296508789063, "step": 3100 }, { "epoch": 3.747002398081535, "grad_norm": 3.7916765213012695, "learning_rate": 7.3e-06, "loss": 1.3395465087890626, "step": 3125 }, { "epoch": 3.776978417266187, "grad_norm": 4.551313400268555, "learning_rate": 7.091666666666667e-06, "loss": 1.1056033325195314, "step": 3150 }, { "epoch": 3.806954436450839, "grad_norm": 4.075565338134766, "learning_rate": 6.883333333333334e-06, "loss": 1.3138325500488282, "step": 3175 }, { "epoch": 3.8369304556354917, "grad_norm": 3.972641706466675, "learning_rate": 6.6750000000000005e-06, "loss": 1.1527600860595704, "step": 3200 }, { "epoch": 3.866906474820144, "grad_norm": 3.812631845474243, "learning_rate": 6.466666666666667e-06, "loss": 1.2789608001708985, "step": 3225 }, { "epoch": 3.896882494004796, "grad_norm": 5.695910930633545, "learning_rate": 6.258333333333333e-06, "loss": 1.1754793548583984, "step": 3250 }, { "epoch": 3.896882494004796, "eval_loss": 0.3044012486934662, "eval_runtime": 18.0122, "eval_samples_per_second": 89.939, "eval_steps_per_second": 11.27, "eval_wer": 38.53613358393942, "step": 3250 }, { "epoch": 3.9268585131894485, "grad_norm": 3.0165011882781982, "learning_rate": 6.05e-06, "loss": 1.3710069274902343, "step": 3275 }, { "epoch": 3.956834532374101, "grad_norm": 4.425358295440674, "learning_rate": 5.841666666666667e-06, "loss": 1.1081704711914062, "step": 3300 }, { "epoch": 3.986810551558753, "grad_norm": 4.782137393951416, "learning_rate": 5.633333333333333e-06, "loss": 1.438135986328125, "step": 3325 }, { "epoch": 4.016786570743405, "grad_norm": 3.2695047855377197, "learning_rate": 5.4250000000000006e-06, "loss": 1.1687757873535156, "step": 3350 }, { "epoch": 4.046762589928058, "grad_norm": 3.6320788860321045, "learning_rate": 5.216666666666667e-06, "loss": 1.139478988647461, "step": 3375 }, { "epoch": 4.07673860911271, "grad_norm": 3.5363335609436035, "learning_rate": 5.008333333333333e-06, "loss": 1.2308349609375, "step": 3400 }, { "epoch": 4.106714628297362, "grad_norm": 3.7217462062835693, "learning_rate": 4.800000000000001e-06, "loss": 1.1875200653076172, "step": 3425 }, { "epoch": 4.136690647482014, "grad_norm": 3.1459712982177734, "learning_rate": 4.591666666666667e-06, "loss": 1.1901798248291016, "step": 3450 }, { "epoch": 4.166666666666667, "grad_norm": 3.7371957302093506, "learning_rate": 4.3833333333333334e-06, "loss": 1.0538123321533204, "step": 3475 }, { "epoch": 4.196642685851319, "grad_norm": 3.7070775032043457, "learning_rate": 4.175e-06, "loss": 1.193154525756836, "step": 3500 }, { "epoch": 4.196642685851319, "eval_loss": 0.30022621154785156, "eval_runtime": 18.115, "eval_samples_per_second": 89.428, "eval_steps_per_second": 11.206, "eval_wer": 37.855138786739666, "step": 3500 }, { "epoch": 4.226618705035971, "grad_norm": 3.048323154449463, "learning_rate": 3.966666666666666e-06, "loss": 1.1228433990478515, "step": 3525 }, { "epoch": 4.256594724220624, "grad_norm": 3.1846795082092285, "learning_rate": 3.758333333333333e-06, "loss": 1.2151748657226562, "step": 3550 }, { "epoch": 4.286570743405276, "grad_norm": 4.277435302734375, "learning_rate": 3.55e-06, "loss": 1.146432876586914, "step": 3575 }, { "epoch": 4.316546762589928, "grad_norm": 3.3862087726593018, "learning_rate": 3.3416666666666667e-06, "loss": 1.2336856079101564, "step": 3600 }, { "epoch": 4.34652278177458, "grad_norm": 4.78780460357666, "learning_rate": 3.1333333333333335e-06, "loss": 1.1951210021972656, "step": 3625 }, { "epoch": 4.376498800959233, "grad_norm": 3.9586503505706787, "learning_rate": 2.9250000000000004e-06, "loss": 1.227743148803711, "step": 3650 }, { "epoch": 4.406474820143885, "grad_norm": 4.07125186920166, "learning_rate": 2.7166666666666668e-06, "loss": 1.1534527587890624, "step": 3675 }, { "epoch": 4.436450839328537, "grad_norm": 3.8952131271362305, "learning_rate": 2.508333333333333e-06, "loss": 1.1760161590576172, "step": 3700 }, { "epoch": 4.46642685851319, "grad_norm": 4.782440185546875, "learning_rate": 2.3e-06, "loss": 1.0955001068115235, "step": 3725 }, { "epoch": 4.496402877697841, "grad_norm": 3.4196395874023438, "learning_rate": 2.091666666666667e-06, "loss": 1.3582955932617187, "step": 3750 }, { "epoch": 4.496402877697841, "eval_loss": 0.29945749044418335, "eval_runtime": 18.1526, "eval_samples_per_second": 89.244, "eval_steps_per_second": 11.183, "eval_wer": 37.71349186892212, "step": 3750 }, { "epoch": 4.526378896882494, "grad_norm": 4.029821395874023, "learning_rate": 1.8833333333333334e-06, "loss": 1.050459747314453, "step": 3775 }, { "epoch": 4.556354916067146, "grad_norm": 3.5950191020965576, "learning_rate": 1.675e-06, "loss": 1.2073076629638673, "step": 3800 }, { "epoch": 4.586330935251799, "grad_norm": 3.9220163822174072, "learning_rate": 1.4666666666666669e-06, "loss": 1.0614564514160156, "step": 3825 }, { "epoch": 4.616306954436451, "grad_norm": 28.386432647705078, "learning_rate": 1.2583333333333333e-06, "loss": 1.43855224609375, "step": 3850 }, { "epoch": 4.646282973621103, "grad_norm": 3.9794702529907227, "learning_rate": 1.0500000000000001e-06, "loss": 1.1082134246826172, "step": 3875 }, { "epoch": 4.676258992805756, "grad_norm": 2.8433194160461426, "learning_rate": 8.416666666666667e-07, "loss": 1.1347400665283203, "step": 3900 }, { "epoch": 4.706235011990408, "grad_norm": 3.9949467182159424, "learning_rate": 6.333333333333333e-07, "loss": 1.2218107604980468, "step": 3925 }, { "epoch": 4.73621103117506, "grad_norm": 3.4458863735198975, "learning_rate": 4.25e-07, "loss": 1.222669906616211, "step": 3950 }, { "epoch": 4.766187050359712, "grad_norm": 3.780194044113159, "learning_rate": 2.1666666666666667e-07, "loss": 1.122889175415039, "step": 3975 }, { "epoch": 4.796163069544365, "grad_norm": 2.996938705444336, "learning_rate": 8.333333333333334e-09, "loss": 1.305466766357422, "step": 4000 }, { "epoch": 4.796163069544365, "eval_loss": 0.30047205090522766, "eval_runtime": 17.9707, "eval_samples_per_second": 90.147, "eval_steps_per_second": 11.296, "eval_wer": 37.73255972324371, "step": 4000 }, { "epoch": 4.796163069544365, "step": 4000, "total_flos": 1.186592111130968e+19, "train_loss": 4.035597569465637, "train_runtime": 1379.9989, "train_samples_per_second": 46.377, "train_steps_per_second": 2.899 } ], "logging_steps": 25, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 250, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.1 }, "attributes": { "early_stopping_patience_counter": 1 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.186592111130968e+19, "train_batch_size": 4, "trial_name": null, "trial_params": null }