{ "best_global_step": 4000, "best_metric": 0.21596803588952754, "best_model_checkpoint": "/workspace/checkpoints-av/msp_e2e_ctc/checkpoint-4000", "epoch": 1.0, "eval_steps": 500, "global_step": 10000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0025, "grad_norm": 8.04428768157959, "learning_rate": 9.600000000000001e-06, "loss": 7.127101440429687, "step": 25 }, { "epoch": 0.005, "grad_norm": 8.43156623840332, "learning_rate": 1.9600000000000002e-05, "loss": 4.697780151367187, "step": 50 }, { "epoch": 0.0075, "grad_norm": 3.904343366622925, "learning_rate": 2.96e-05, "loss": 3.743772277832031, "step": 75 }, { "epoch": 0.01, "grad_norm": 3.055377960205078, "learning_rate": 3.960000000000001e-05, "loss": 2.656860656738281, "step": 100 }, { "epoch": 0.0125, "grad_norm": 2.4546093940734863, "learning_rate": 4.96e-05, "loss": 2.414398498535156, "step": 125 }, { "epoch": 0.015, "grad_norm": 3.393557071685791, "learning_rate": 5.96e-05, "loss": 2.355498809814453, "step": 150 }, { "epoch": 0.0175, "grad_norm": 2.8310353755950928, "learning_rate": 6.96e-05, "loss": 2.3629690551757814, "step": 175 }, { "epoch": 0.02, "grad_norm": 3.3908843994140625, "learning_rate": 7.960000000000001e-05, "loss": 2.298575439453125, "step": 200 }, { "epoch": 0.0225, "grad_norm": 2.8602232933044434, "learning_rate": 8.960000000000001e-05, "loss": 2.285859375, "step": 225 }, { "epoch": 0.025, "grad_norm": 4.637383460998535, "learning_rate": 9.960000000000001e-05, "loss": 2.467720794677734, "step": 250 }, { "epoch": 0.0275, "grad_norm": 2.0761306285858154, "learning_rate": 0.00010960000000000001, "loss": 2.3147714233398435, "step": 275 }, { "epoch": 0.03, "grad_norm": 2.8212428092956543, "learning_rate": 0.00011960000000000001, "loss": 2.453261260986328, "step": 300 }, { "epoch": 0.0325, "grad_norm": 4.797104358673096, "learning_rate": 0.0001296, "loss": 2.4396128845214844, "step": 325 }, { "epoch": 0.035, "grad_norm": 4.374691009521484, "learning_rate": 0.0001396, "loss": 2.343565673828125, "step": 350 }, { "epoch": 0.0375, "grad_norm": 4.064563274383545, "learning_rate": 0.0001496, "loss": 2.250940704345703, "step": 375 }, { "epoch": 0.04, "grad_norm": 3.3617475032806396, "learning_rate": 0.0001596, "loss": 2.319589385986328, "step": 400 }, { "epoch": 0.0425, "grad_norm": 2.7767529487609863, "learning_rate": 0.0001696, "loss": 2.4519082641601564, "step": 425 }, { "epoch": 0.045, "grad_norm": 4.268216133117676, "learning_rate": 0.0001796, "loss": 2.317582702636719, "step": 450 }, { "epoch": 0.0475, "grad_norm": 1.932944416999817, "learning_rate": 0.0001896, "loss": 2.2180686950683595, "step": 475 }, { "epoch": 0.05, "grad_norm": 2.41548228263855, "learning_rate": 0.0001996, "loss": 2.4416712951660156, "step": 500 }, { "epoch": 0.05, "eval_cer": 0.16142419080068143, "eval_loss": 1.5633715391159058, "eval_runtime": 99.4493, "eval_samples_per_second": 14.641, "eval_steps_per_second": 0.463, "eval_wer": 0.3212533295948409, "step": 500 }, { "epoch": 0.0525, "grad_norm": 2.496230363845825, "learning_rate": 0.00019999685049180394, "loss": 2.244039764404297, "step": 525 }, { "epoch": 0.055, "grad_norm": 1.956568956375122, "learning_rate": 0.0001999868717996323, "loss": 2.39022216796875, "step": 550 }, { "epoch": 0.0575, "grad_norm": 2.2251765727996826, "learning_rate": 0.00019997005913759068, "loss": 2.3402642822265625, "step": 575 }, { "epoch": 0.06, "grad_norm": 4.093571662902832, "learning_rate": 0.00019994641365480214, "loss": 2.530718994140625, "step": 600 }, { "epoch": 0.0625, "grad_norm": 2.388291120529175, "learning_rate": 0.00019991593696740405, "loss": 2.4927822875976564, "step": 625 }, { "epoch": 0.065, "grad_norm": 2.476865530014038, "learning_rate": 0.00019987863115843748, "loss": 2.43189453125, "step": 650 }, { "epoch": 0.0675, "grad_norm": 2.6366164684295654, "learning_rate": 0.00019983449877770495, "loss": 2.4924627685546876, "step": 675 }, { "epoch": 0.07, "grad_norm": 2.0813474655151367, "learning_rate": 0.00019978354284159604, "loss": 2.47088134765625, "step": 700 }, { "epoch": 0.0725, "grad_norm": 2.2441253662109375, "learning_rate": 0.00019972576683288128, "loss": 2.444411163330078, "step": 725 }, { "epoch": 0.075, "grad_norm": 1.8759963512420654, "learning_rate": 0.00019966117470047418, "loss": 2.3306341552734375, "step": 750 }, { "epoch": 0.0775, "grad_norm": 3.6834940910339355, "learning_rate": 0.00019958977085916113, "loss": 2.3836322021484375, "step": 775 }, { "epoch": 0.08, "grad_norm": 2.361351251602173, "learning_rate": 0.00019951156018929985, "loss": 2.4483242797851563, "step": 800 }, { "epoch": 0.0825, "grad_norm": 1.5636104345321655, "learning_rate": 0.00019942654803648574, "loss": 2.4330813598632814, "step": 825 }, { "epoch": 0.085, "grad_norm": 4.691361904144287, "learning_rate": 0.00019933474021118652, "loss": 2.420093994140625, "step": 850 }, { "epoch": 0.0875, "grad_norm": 2.050384998321533, "learning_rate": 0.0001992361429883451, "loss": 2.2977276611328126, "step": 875 }, { "epoch": 0.09, "grad_norm": 3.0928971767425537, "learning_rate": 0.00019913076310695068, "loss": 2.3863540649414063, "step": 900 }, { "epoch": 0.0925, "grad_norm": 2.323233127593994, "learning_rate": 0.00019901860776957815, "loss": 2.278043212890625, "step": 925 }, { "epoch": 0.095, "grad_norm": 3.15425705909729, "learning_rate": 0.00019889968464189588, "loss": 2.418150634765625, "step": 950 }, { "epoch": 0.0975, "grad_norm": 2.0778608322143555, "learning_rate": 0.00019877400185214165, "loss": 2.3605302429199218, "step": 975 }, { "epoch": 0.1, "grad_norm": 3.228522300720215, "learning_rate": 0.00019864156799056723, "loss": 2.4653065490722654, "step": 1000 }, { "epoch": 0.1, "eval_cer": 0.12089267461669506, "eval_loss": 1.4769799709320068, "eval_runtime": 98.9656, "eval_samples_per_second": 14.712, "eval_steps_per_second": 0.465, "eval_wer": 0.24400672928641526, "step": 1000 }, { "epoch": 0.1025, "grad_norm": 2.1160504817962646, "learning_rate": 0.0001985023921088511, "loss": 2.5620989990234375, "step": 1025 }, { "epoch": 0.105, "grad_norm": 2.091463327407837, "learning_rate": 0.00019835648371947987, "loss": 2.5808676147460936, "step": 1050 }, { "epoch": 0.1075, "grad_norm": 3.3528618812561035, "learning_rate": 0.00019820385279509822, "loss": 2.596577453613281, "step": 1075 }, { "epoch": 0.11, "grad_norm": 1.9095429182052612, "learning_rate": 0.000198044509767827, "loss": 2.593738708496094, "step": 1100 }, { "epoch": 0.1125, "grad_norm": 2.25166654586792, "learning_rate": 0.00019787846552855054, "loss": 2.4640257263183596, "step": 1125 }, { "epoch": 0.115, "grad_norm": 2.254211664199829, "learning_rate": 0.00019770573142617197, "loss": 2.3456986999511718, "step": 1150 }, { "epoch": 0.1175, "grad_norm": 2.2005534172058105, "learning_rate": 0.00019752631926683775, "loss": 2.4674136352539064, "step": 1175 }, { "epoch": 0.12, "grad_norm": 1.7976740598678589, "learning_rate": 0.00019734024131313067, "loss": 2.4166830444335936, "step": 1200 }, { "epoch": 0.1225, "grad_norm": 2.3863418102264404, "learning_rate": 0.00019714751028323166, "loss": 2.438814392089844, "step": 1225 }, { "epoch": 0.125, "grad_norm": 3.311290979385376, "learning_rate": 0.0001969481393500506, "loss": 2.406153259277344, "step": 1250 }, { "epoch": 0.1275, "grad_norm": 5.752159118652344, "learning_rate": 0.00019674214214032598, "loss": 2.2879945373535158, "step": 1275 }, { "epoch": 0.13, "grad_norm": 2.109788656234741, "learning_rate": 0.00019652953273369342, "loss": 2.3744522094726563, "step": 1300 }, { "epoch": 0.1325, "grad_norm": 1.5383687019348145, "learning_rate": 0.00019631032566172344, "loss": 2.3803326416015627, "step": 1325 }, { "epoch": 0.135, "grad_norm": 2.9055371284484863, "learning_rate": 0.00019608453590692822, "loss": 2.3387161254882813, "step": 1350 }, { "epoch": 0.1375, "grad_norm": 2.196284294128418, "learning_rate": 0.0001958521789017376, "loss": 2.323087463378906, "step": 1375 }, { "epoch": 0.14, "grad_norm": 1.8836430311203003, "learning_rate": 0.0001956132705274442, "loss": 2.234120178222656, "step": 1400 }, { "epoch": 0.1425, "grad_norm": 1.8475207090377808, "learning_rate": 0.00019536782711311807, "loss": 2.293027191162109, "step": 1425 }, { "epoch": 0.145, "grad_norm": 1.8547334671020508, "learning_rate": 0.00019511586543449053, "loss": 2.243158264160156, "step": 1450 }, { "epoch": 0.1475, "grad_norm": 2.3523902893066406, "learning_rate": 0.00019485740271280765, "loss": 2.274371337890625, "step": 1475 }, { "epoch": 0.15, "grad_norm": 2.411062717437744, "learning_rate": 0.00019459245661365313, "loss": 2.365634002685547, "step": 1500 }, { "epoch": 0.15, "eval_cer": 0.11594548551959113, "eval_loss": 1.423877477645874, "eval_runtime": 98.4968, "eval_samples_per_second": 14.782, "eval_steps_per_second": 0.467, "eval_wer": 0.24074723117902705, "step": 1500 }, { "epoch": 0.1525, "grad_norm": 2.0285370349884033, "learning_rate": 0.00019432104524574087, "loss": 2.468669738769531, "step": 1525 }, { "epoch": 0.155, "grad_norm": 2.2131717205047607, "learning_rate": 0.00019404318715967732, "loss": 2.5288356018066405, "step": 1550 }, { "epoch": 0.1575, "grad_norm": 2.3619260787963867, "learning_rate": 0.0001937589013466936, "loss": 2.3784559631347655, "step": 1575 }, { "epoch": 0.16, "grad_norm": 1.704810619354248, "learning_rate": 0.00019346820723734745, "loss": 2.286223907470703, "step": 1600 }, { "epoch": 0.1625, "grad_norm": 2.17364501953125, "learning_rate": 0.00019317112470019503, "loss": 2.4997410583496094, "step": 1625 }, { "epoch": 0.165, "grad_norm": 1.9224309921264648, "learning_rate": 0.00019286767404043316, "loss": 2.392764434814453, "step": 1650 }, { "epoch": 0.1675, "grad_norm": 2.331049919128418, "learning_rate": 0.0001925578759985113, "loss": 2.371828765869141, "step": 1675 }, { "epoch": 0.17, "grad_norm": 2.191542148590088, "learning_rate": 0.00019224175174871415, "loss": 2.293146667480469, "step": 1700 }, { "epoch": 0.1725, "grad_norm": 1.853737711906433, "learning_rate": 0.0001919193228977142, "loss": 2.4427305603027345, "step": 1725 }, { "epoch": 0.175, "grad_norm": 1.6019384860992432, "learning_rate": 0.0001915906114830952, "loss": 2.3477943420410154, "step": 1750 }, { "epoch": 0.1775, "grad_norm": 2.125684976577759, "learning_rate": 0.00019125563997184563, "loss": 2.455902099609375, "step": 1775 }, { "epoch": 0.18, "grad_norm": 1.6694984436035156, "learning_rate": 0.00019091443125882337, "loss": 2.335185241699219, "step": 1800 }, { "epoch": 0.1825, "grad_norm": 1.8382054567337036, "learning_rate": 0.00019056700866519063, "loss": 2.1945234680175782, "step": 1825 }, { "epoch": 0.185, "grad_norm": 1.8865960836410522, "learning_rate": 0.00019021339593682028, "loss": 2.3078712463378905, "step": 1850 }, { "epoch": 0.1875, "grad_norm": 3.637312173843384, "learning_rate": 0.00018985361724267256, "loss": 2.3725929260253906, "step": 1875 }, { "epoch": 0.19, "grad_norm": 2.0592007637023926, "learning_rate": 0.00018948769717314328, "loss": 2.300412292480469, "step": 1900 }, { "epoch": 0.1925, "grad_norm": 2.4111757278442383, "learning_rate": 0.0001891156607383831, "loss": 2.218678741455078, "step": 1925 }, { "epoch": 0.195, "grad_norm": 1.5851012468338013, "learning_rate": 0.00018873753336658822, "loss": 2.3549868774414064, "step": 1950 }, { "epoch": 0.1975, "grad_norm": 2.3010220527648926, "learning_rate": 0.00018835334090226214, "loss": 2.336710662841797, "step": 1975 }, { "epoch": 0.2, "grad_norm": 2.793161392211914, "learning_rate": 0.0001879631096044495, "loss": 2.4607310485839844, "step": 2000 }, { "epoch": 0.2, "eval_cer": 0.13946166950596253, "eval_loss": 1.6668776273727417, "eval_runtime": 96.2028, "eval_samples_per_second": 15.135, "eval_steps_per_second": 0.478, "eval_wer": 0.2859245759147624, "step": 2000 }, { "epoch": 0.2025, "grad_norm": 2.5048420429229736, "learning_rate": 0.0001875668661449411, "loss": 2.3207608032226563, "step": 2025 }, { "epoch": 0.205, "grad_norm": 2.479046106338501, "learning_rate": 0.0001871646376064511, "loss": 2.226656188964844, "step": 2050 }, { "epoch": 0.2075, "grad_norm": 1.7231593132019043, "learning_rate": 0.00018675645148076578, "loss": 2.308455047607422, "step": 2075 }, { "epoch": 0.21, "grad_norm": 1.5906119346618652, "learning_rate": 0.0001863423356668646, "loss": 2.35341796875, "step": 2100 }, { "epoch": 0.2125, "grad_norm": 2.1919968128204346, "learning_rate": 0.00018592231846901335, "loss": 2.3587355041503906, "step": 2125 }, { "epoch": 0.215, "grad_norm": 1.5849632024765015, "learning_rate": 0.00018549642859482963, "loss": 2.259740905761719, "step": 2150 }, { "epoch": 0.2175, "grad_norm": 1.6398062705993652, "learning_rate": 0.00018506469515332054, "loss": 2.234868927001953, "step": 2175 }, { "epoch": 0.22, "grad_norm": 2.203387498855591, "learning_rate": 0.0001846271476528934, "loss": 2.4610299682617187, "step": 2200 }, { "epoch": 0.2225, "grad_norm": 2.0128378868103027, "learning_rate": 0.00018418381599933853, "loss": 2.4086659240722654, "step": 2225 }, { "epoch": 0.225, "grad_norm": 1.7606065273284912, "learning_rate": 0.00018373473049378562, "loss": 2.546702575683594, "step": 2250 }, { "epoch": 0.2275, "grad_norm": 2.066452980041504, "learning_rate": 0.00018327992183063248, "loss": 2.2808355712890624, "step": 2275 }, { "epoch": 0.23, "grad_norm": 1.9987760782241821, "learning_rate": 0.00018281942109544698, "loss": 2.445269012451172, "step": 2300 }, { "epoch": 0.2325, "grad_norm": 1.608620285987854, "learning_rate": 0.00018235325976284275, "loss": 2.1912208557128907, "step": 2325 }, { "epoch": 0.235, "grad_norm": 2.238555431365967, "learning_rate": 0.00018188146969432762, "loss": 2.4058465576171875, "step": 2350 }, { "epoch": 0.2375, "grad_norm": 2.2178099155426025, "learning_rate": 0.00018140408313612608, "loss": 2.3438116455078126, "step": 2375 }, { "epoch": 0.24, "grad_norm": 1.9142024517059326, "learning_rate": 0.00018092113271697522, "loss": 2.4138525390625, "step": 2400 }, { "epoch": 0.2425, "grad_norm": 3.3786633014678955, "learning_rate": 0.00018043265144589466, "loss": 2.2731494140625, "step": 2425 }, { "epoch": 0.245, "grad_norm": 2.6107332706451416, "learning_rate": 0.00017993867270993047, "loss": 2.230762481689453, "step": 2450 }, { "epoch": 0.2475, "grad_norm": 2.1159350872039795, "learning_rate": 0.000179439230271873, "loss": 2.5371829223632814, "step": 2475 }, { "epoch": 0.25, "grad_norm": 2.519641876220703, "learning_rate": 0.00017893435826794952, "loss": 2.2601394653320312, "step": 2500 }, { "epoch": 0.25, "eval_cer": 0.12031345826235093, "eval_loss": 1.3391743898391724, "eval_runtime": 94.2011, "eval_samples_per_second": 15.456, "eval_steps_per_second": 0.488, "eval_wer": 0.24439226132062247, "step": 2500 }, { "epoch": 0.2525, "grad_norm": 1.6987061500549316, "learning_rate": 0.00017842409120549083, "loss": 2.4055056762695313, "step": 2525 }, { "epoch": 0.255, "grad_norm": 2.0303497314453125, "learning_rate": 0.00017790846396057277, "loss": 2.3995057678222658, "step": 2550 }, { "epoch": 0.2575, "grad_norm": 1.8574965000152588, "learning_rate": 0.00017738751177563268, "loss": 2.3057664489746093, "step": 2575 }, { "epoch": 0.26, "grad_norm": 2.6739280223846436, "learning_rate": 0.00017686127025706038, "loss": 2.460683135986328, "step": 2600 }, { "epoch": 0.2625, "grad_norm": 2.627385377883911, "learning_rate": 0.00017632977537276464, "loss": 2.3323692321777343, "step": 2625 }, { "epoch": 0.265, "grad_norm": 2.019179582595825, "learning_rate": 0.00017579306344971474, "loss": 2.2955747985839845, "step": 2650 }, { "epoch": 0.2675, "grad_norm": 2.7610855102539062, "learning_rate": 0.00017525117117145772, "loss": 2.1901036071777344, "step": 2675 }, { "epoch": 0.27, "grad_norm": 2.6274731159210205, "learning_rate": 0.00017470413557561099, "loss": 2.2772340393066406, "step": 2700 }, { "epoch": 0.2725, "grad_norm": 2.032763719558716, "learning_rate": 0.0001741519940513308, "loss": 2.396791687011719, "step": 2725 }, { "epoch": 0.275, "grad_norm": 2.050870895385742, "learning_rate": 0.00017359478433675698, "loss": 2.3125306701660158, "step": 2750 }, { "epoch": 0.2775, "grad_norm": 1.2312886714935303, "learning_rate": 0.00017303254451643332, "loss": 2.144034729003906, "step": 2775 }, { "epoch": 0.28, "grad_norm": 3.1948437690734863, "learning_rate": 0.0001724653130187047, "loss": 2.200022735595703, "step": 2800 }, { "epoch": 0.2825, "grad_norm": 1.904383659362793, "learning_rate": 0.00017189312861309045, "loss": 2.312091522216797, "step": 2825 }, { "epoch": 0.285, "grad_norm": 2.27195143699646, "learning_rate": 0.00017131603040763471, "loss": 2.4758482360839844, "step": 2850 }, { "epoch": 0.2875, "grad_norm": 2.656093120574951, "learning_rate": 0.0001707340578462332, "loss": 2.3429974365234374, "step": 2875 }, { "epoch": 0.29, "grad_norm": 1.7262226343154907, "learning_rate": 0.00017014725070593742, "loss": 2.27993408203125, "step": 2900 }, { "epoch": 0.2925, "grad_norm": 1.816863775253296, "learning_rate": 0.00016955564909423596, "loss": 2.2374249267578126, "step": 2925 }, { "epoch": 0.295, "grad_norm": 2.0505402088165283, "learning_rate": 0.0001689592934463131, "loss": 2.355446472167969, "step": 2950 }, { "epoch": 0.2975, "grad_norm": 2.572733163833618, "learning_rate": 0.0001683582245222852, "loss": 2.390894012451172, "step": 2975 }, { "epoch": 0.3, "grad_norm": 1.4850176572799683, "learning_rate": 0.0001677524834044148, "loss": 2.2053892517089846, "step": 3000 }, { "epoch": 0.3, "eval_cer": 0.11883475298126064, "eval_loss": 1.3329604864120483, "eval_runtime": 94.3216, "eval_samples_per_second": 15.437, "eval_steps_per_second": 0.488, "eval_wer": 0.24281508481704753, "step": 3000 }, { "epoch": 0.3025, "grad_norm": 2.223933696746826, "learning_rate": 0.00016714211149430268, "loss": 2.1159332275390623, "step": 3025 }, { "epoch": 0.305, "grad_norm": 1.66571044921875, "learning_rate": 0.00016652715051005808, "loss": 2.345655822753906, "step": 3050 }, { "epoch": 0.3075, "grad_norm": 2.4676051139831543, "learning_rate": 0.0001659076424834474, "loss": 2.394458770751953, "step": 3075 }, { "epoch": 0.31, "grad_norm": 1.780862808227539, "learning_rate": 0.0001652836297570214, "loss": 2.2932537841796874, "step": 3100 }, { "epoch": 0.3125, "grad_norm": 2.951003074645996, "learning_rate": 0.00016465515498122093, "loss": 2.239581756591797, "step": 3125 }, { "epoch": 0.315, "grad_norm": 1.861158013343811, "learning_rate": 0.0001640222611114621, "loss": 2.2416726684570314, "step": 3150 }, { "epoch": 0.3175, "grad_norm": 2.0734827518463135, "learning_rate": 0.00016338499140520024, "loss": 2.313903503417969, "step": 3175 }, { "epoch": 0.32, "grad_norm": 2.6787068843841553, "learning_rate": 0.00016274338941897325, "loss": 2.296602325439453, "step": 3200 }, { "epoch": 0.3225, "grad_norm": 1.5169554948806763, "learning_rate": 0.00016209749900542462, "loss": 2.1584397888183595, "step": 3225 }, { "epoch": 0.325, "grad_norm": 1.8395015001296997, "learning_rate": 0.00016144736431030613, "loss": 2.237540283203125, "step": 3250 }, { "epoch": 0.3275, "grad_norm": 1.6821995973587036, "learning_rate": 0.00016079302976946055, "loss": 2.3045135498046876, "step": 3275 }, { "epoch": 0.33, "grad_norm": 2.5113303661346436, "learning_rate": 0.00016013454010578465, "loss": 2.229774627685547, "step": 3300 }, { "epoch": 0.3325, "grad_norm": 2.1875202655792236, "learning_rate": 0.00015947194032617213, "loss": 2.03060302734375, "step": 3325 }, { "epoch": 0.335, "grad_norm": 2.628626585006714, "learning_rate": 0.00015880527571843792, "loss": 2.2274468994140624, "step": 3350 }, { "epoch": 0.3375, "grad_norm": 3.26328444480896, "learning_rate": 0.00015813459184822222, "loss": 2.2913862609863282, "step": 3375 }, { "epoch": 0.34, "grad_norm": 1.828529953956604, "learning_rate": 0.00015745993455587676, "loss": 2.326069183349609, "step": 3400 }, { "epoch": 0.3425, "grad_norm": 1.8822145462036133, "learning_rate": 0.00015678134995333128, "loss": 2.4681741333007814, "step": 3425 }, { "epoch": 0.345, "grad_norm": 2.786712169647217, "learning_rate": 0.00015609888442094194, "loss": 2.508190002441406, "step": 3450 }, { "epoch": 0.3475, "grad_norm": 2.1335978507995605, "learning_rate": 0.00015541258460432134, "loss": 2.429823455810547, "step": 3475 }, { "epoch": 0.35, "grad_norm": 1.7754604816436768, "learning_rate": 0.00015472249741115031, "loss": 2.061129913330078, "step": 3500 }, { "epoch": 0.35, "eval_cer": 0.19653151618398637, "eval_loss": 1.8721370697021484, "eval_runtime": 97.6571, "eval_samples_per_second": 14.909, "eval_steps_per_second": 0.471, "eval_wer": 0.36520398149446237, "step": 3500 }, { "epoch": 0.3525, "grad_norm": 1.9794024229049683, "learning_rate": 0.00015402867000797178, "loss": 2.4051849365234377, "step": 3525 }, { "epoch": 0.355, "grad_norm": 2.1352591514587402, "learning_rate": 0.00015333114981696717, "loss": 2.457940673828125, "step": 3550 }, { "epoch": 0.3575, "grad_norm": 3.111924648284912, "learning_rate": 0.00015262998451271497, "loss": 2.361605377197266, "step": 3575 }, { "epoch": 0.36, "grad_norm": 2.966064929962158, "learning_rate": 0.00015192522201893237, "loss": 2.3615626525878906, "step": 3600 }, { "epoch": 0.3625, "grad_norm": 1.8772096633911133, "learning_rate": 0.00015121691050519953, "loss": 2.2799105834960938, "step": 3625 }, { "epoch": 0.365, "grad_norm": 2.3451404571533203, "learning_rate": 0.00015050509838366764, "loss": 2.34386962890625, "step": 3650 }, { "epoch": 0.3675, "grad_norm": 2.5135364532470703, "learning_rate": 0.00014978983430574962, "loss": 2.3400205993652343, "step": 3675 }, { "epoch": 0.37, "grad_norm": 1.7440122365951538, "learning_rate": 0.0001490711671587951, "loss": 2.4299208068847657, "step": 3700 }, { "epoch": 0.3725, "grad_norm": 1.7665159702301025, "learning_rate": 0.00014834914606274896, "loss": 2.3621759033203125, "step": 3725 }, { "epoch": 0.375, "grad_norm": 1.7222715616226196, "learning_rate": 0.0001476238203667939, "loss": 2.2579191589355467, "step": 3750 }, { "epoch": 0.3775, "grad_norm": 1.6460919380187988, "learning_rate": 0.00014689523964597792, "loss": 2.2938653564453126, "step": 3775 }, { "epoch": 0.38, "grad_norm": 1.9907219409942627, "learning_rate": 0.00014616345369782534, "loss": 2.246376953125, "step": 3800 }, { "epoch": 0.3825, "grad_norm": 2.8839938640594482, "learning_rate": 0.00014542851253893373, "loss": 2.445607147216797, "step": 3825 }, { "epoch": 0.385, "grad_norm": 2.404881000518799, "learning_rate": 0.000144690466401555, "loss": 2.2871961975097657, "step": 3850 }, { "epoch": 0.3875, "grad_norm": 2.3075459003448486, "learning_rate": 0.00014394936573016226, "loss": 2.408760986328125, "step": 3875 }, { "epoch": 0.39, "grad_norm": 1.6438523530960083, "learning_rate": 0.000143205261178002, "loss": 2.3683087158203127, "step": 3900 }, { "epoch": 0.3925, "grad_norm": 5.861391067504883, "learning_rate": 0.0001424582036036319, "loss": 2.342762298583984, "step": 3925 }, { "epoch": 0.395, "grad_norm": 1.7755112648010254, "learning_rate": 0.0001417082440674448, "loss": 2.2705897521972656, "step": 3950 }, { "epoch": 0.3975, "grad_norm": 1.6583561897277832, "learning_rate": 0.00014095543382817882, "loss": 2.2572897338867186, "step": 3975 }, { "epoch": 0.4, "grad_norm": 1.4067355394363403, "learning_rate": 0.0001401998243394138, "loss": 2.2651954650878907, "step": 4000 }, { "epoch": 0.4, "eval_cer": 0.10498807495741057, "eval_loss": 1.2884368896484375, "eval_runtime": 97.2686, "eval_samples_per_second": 14.969, "eval_steps_per_second": 0.473, "eval_wer": 0.21596803588952754, "step": 4000 }, { "epoch": 0.4025, "grad_norm": 1.605221152305603, "learning_rate": 0.0001394414672460546, "loss": 2.4976361083984373, "step": 4025 }, { "epoch": 0.405, "grad_norm": 1.156703233718872, "learning_rate": 0.00013868041438080112, "loss": 2.497575225830078, "step": 4050 }, { "epoch": 0.4075, "grad_norm": 1.5397531986236572, "learning_rate": 0.00013791671776060583, "loss": 2.265808410644531, "step": 4075 }, { "epoch": 0.41, "grad_norm": 1.9549108743667603, "learning_rate": 0.0001371504295831183, "loss": 2.3842532348632814, "step": 4100 }, { "epoch": 0.4125, "grad_norm": 1.9217745065689087, "learning_rate": 0.00013638160222311746, "loss": 2.4043014526367186, "step": 4125 }, { "epoch": 0.415, "grad_norm": 2.51631498336792, "learning_rate": 0.00013561028822893216, "loss": 2.284119873046875, "step": 4150 }, { "epoch": 0.4175, "grad_norm": 1.2171545028686523, "learning_rate": 0.0001348365403188493, "loss": 2.2890667724609375, "step": 4175 }, { "epoch": 0.42, "grad_norm": 2.4048573970794678, "learning_rate": 0.00013406041137751075, "loss": 2.3984063720703124, "step": 4200 }, { "epoch": 0.4225, "grad_norm": 1.4632928371429443, "learning_rate": 0.00013328195445229868, "loss": 2.229521942138672, "step": 4225 }, { "epoch": 0.425, "grad_norm": 1.730931043624878, "learning_rate": 0.00013250122274970983, "loss": 2.254394836425781, "step": 4250 }, { "epoch": 0.4275, "grad_norm": 1.4507620334625244, "learning_rate": 0.00013171826963171904, "loss": 2.4484910583496093, "step": 4275 }, { "epoch": 0.43, "grad_norm": 1.3706517219543457, "learning_rate": 0.00013093314861213187, "loss": 2.3848532104492186, "step": 4300 }, { "epoch": 0.4325, "grad_norm": 2.392287015914917, "learning_rate": 0.00013014591335292703, "loss": 2.4290875244140624, "step": 4325 }, { "epoch": 0.435, "grad_norm": 1.7551754713058472, "learning_rate": 0.00012935661766058887, "loss": 2.3814404296875, "step": 4350 }, { "epoch": 0.4375, "grad_norm": 1.7651501893997192, "learning_rate": 0.00012856531548242943, "loss": 2.3211224365234373, "step": 4375 }, { "epoch": 0.44, "grad_norm": 1.352349877357483, "learning_rate": 0.0001277720609029015, "loss": 2.3048651123046877, "step": 4400 }, { "epoch": 0.4425, "grad_norm": 1.621042251586914, "learning_rate": 0.0001269769081399018, "loss": 2.28550537109375, "step": 4425 }, { "epoch": 0.445, "grad_norm": 3.0360352993011475, "learning_rate": 0.00012617991154106553, "loss": 2.2011154174804686, "step": 4450 }, { "epoch": 0.4475, "grad_norm": 1.738326072692871, "learning_rate": 0.0001253811255800515, "loss": 2.2040435791015627, "step": 4475 }, { "epoch": 0.45, "grad_norm": 1.242429494857788, "learning_rate": 0.00012458060485281904, "loss": 2.194516143798828, "step": 4500 }, { "epoch": 0.45, "eval_cer": 0.18675979557069847, "eval_loss": 2.0404677391052246, "eval_runtime": 99.6893, "eval_samples_per_second": 14.605, "eval_steps_per_second": 0.461, "eval_wer": 0.34512126734894155, "step": 4500 }, { "epoch": 0.4525, "grad_norm": 2.7530839443206787, "learning_rate": 0.00012377840407389656, "loss": 2.2013865661621095, "step": 4525 }, { "epoch": 0.455, "grad_norm": 2.2198078632354736, "learning_rate": 0.00012297457807264163, "loss": 2.087595977783203, "step": 4550 }, { "epoch": 0.4575, "grad_norm": 1.2474287748336792, "learning_rate": 0.0001221691817894937, "loss": 2.194997100830078, "step": 4575 }, { "epoch": 0.46, "grad_norm": 12.5129976272583, "learning_rate": 0.00012136227027221887, "loss": 2.182381286621094, "step": 4600 }, { "epoch": 0.4625, "grad_norm": 2.9374215602874756, "learning_rate": 0.00012055389867214753, "loss": 2.1406234741210937, "step": 4625 }, { "epoch": 0.465, "grad_norm": 1.6920939683914185, "learning_rate": 0.00011974412224040467, "loss": 2.18834228515625, "step": 4650 }, { "epoch": 0.4675, "grad_norm": 2.295588493347168, "learning_rate": 0.00011893299632413377, "loss": 2.2244253540039063, "step": 4675 }, { "epoch": 0.47, "grad_norm": 1.572840929031372, "learning_rate": 0.00011812057636271374, "loss": 2.3844418334960937, "step": 4700 }, { "epoch": 0.4725, "grad_norm": 2.083305597305298, "learning_rate": 0.00011730691788396979, "loss": 2.2655848693847656, "step": 4725 }, { "epoch": 0.475, "grad_norm": 1.814949631690979, "learning_rate": 0.00011649207650037808, "loss": 2.308854217529297, "step": 4750 }, { "epoch": 0.4775, "grad_norm": 3.0101680755615234, "learning_rate": 0.00011567610790526484, "loss": 2.4060545349121094, "step": 4775 }, { "epoch": 0.48, "grad_norm": 1.7078293561935425, "learning_rate": 0.0001148590678689996, "loss": 2.3611572265625, "step": 4800 }, { "epoch": 0.4825, "grad_norm": 1.662838101387024, "learning_rate": 0.00011404101223518356, "loss": 2.110723419189453, "step": 4825 }, { "epoch": 0.485, "grad_norm": 1.8207811117172241, "learning_rate": 0.00011322199691683259, "loss": 2.248436279296875, "step": 4850 }, { "epoch": 0.4875, "grad_norm": 2.421273708343506, "learning_rate": 0.0001124020778925558, "loss": 2.1612274169921877, "step": 4875 }, { "epoch": 0.49, "grad_norm": 1.8812896013259888, "learning_rate": 0.00011158131120272935, "loss": 2.2600140380859375, "step": 4900 }, { "epoch": 0.4925, "grad_norm": 2.3663277626037598, "learning_rate": 0.00011075975294566618, "loss": 2.5313677978515625, "step": 4925 }, { "epoch": 0.495, "grad_norm": 1.6257905960083008, "learning_rate": 0.00010993745927378192, "loss": 2.264820251464844, "step": 4950 }, { "epoch": 0.4975, "grad_norm": 1.4130210876464844, "learning_rate": 0.0001091144863897567, "loss": 2.407576141357422, "step": 4975 }, { "epoch": 0.5, "grad_norm": 1.7429734468460083, "learning_rate": 0.00010829089054269397, "loss": 2.4363131713867188, "step": 5000 }, { "epoch": 0.5, "eval_cer": 0.13365587734241907, "eval_loss": 1.4915677309036255, "eval_runtime": 97.2843, "eval_samples_per_second": 14.966, "eval_steps_per_second": 0.473, "eval_wer": 0.27344735735314735, "step": 5000 }, { "epoch": 0.5025, "grad_norm": 2.2105283737182617, "learning_rate": 0.00010746672802427584, "loss": 2.6081527709960937, "step": 5025 }, { "epoch": 0.505, "grad_norm": 2.152991771697998, "learning_rate": 0.00010664205516491567, "loss": 2.3156581115722656, "step": 5050 }, { "epoch": 0.5075, "grad_norm": 1.6704784631729126, "learning_rate": 0.00010581692832990795, "loss": 2.2569061279296876, "step": 5075 }, { "epoch": 0.51, "grad_norm": 1.809422492980957, "learning_rate": 0.0001049914039155758, "loss": 2.292207946777344, "step": 5100 }, { "epoch": 0.5125, "grad_norm": 2.8532326221466064, "learning_rate": 0.00010416553834541636, "loss": 2.262637939453125, "step": 5125 }, { "epoch": 0.515, "grad_norm": 1.7250112295150757, "learning_rate": 0.00010333938806624428, "loss": 2.311736755371094, "step": 5150 }, { "epoch": 0.5175, "grad_norm": 1.786499261856079, "learning_rate": 0.00010251300954433376, "loss": 2.295980987548828, "step": 5175 }, { "epoch": 0.52, "grad_norm": 1.7907332181930542, "learning_rate": 0.00010168645926155901, "loss": 2.1306143188476563, "step": 5200 }, { "epoch": 0.5225, "grad_norm": 1.8260570764541626, "learning_rate": 0.00010085979371153397, "loss": 2.4332316589355467, "step": 5225 }, { "epoch": 0.525, "grad_norm": 3.8928639888763428, "learning_rate": 0.00010003306939575083, "loss": 2.1371470642089845, "step": 5250 }, { "epoch": 0.5275, "grad_norm": 1.4477559328079224, "learning_rate": 9.920634281971844e-05, "loss": 2.2873826599121094, "step": 5275 }, { "epoch": 0.53, "grad_norm": 1.9820969104766846, "learning_rate": 9.837967048910006e-05, "loss": 2.370744171142578, "step": 5300 }, { "epoch": 0.5325, "grad_norm": 1.9542760848999023, "learning_rate": 9.755310890585138e-05, "loss": 2.317779998779297, "step": 5325 }, { "epoch": 0.535, "grad_norm": 1.4388443231582642, "learning_rate": 9.672671456435866e-05, "loss": 2.232802734375, "step": 5350 }, { "epoch": 0.5375, "grad_norm": 1.827918529510498, "learning_rate": 9.590054394757745e-05, "loss": 2.215179138183594, "step": 5375 }, { "epoch": 0.54, "grad_norm": 1.4861502647399902, "learning_rate": 9.507465352317186e-05, "loss": 2.2451414489746093, "step": 5400 }, { "epoch": 0.5425, "grad_norm": 1.4316998720169067, "learning_rate": 9.424909973965539e-05, "loss": 2.188051910400391, "step": 5425 }, { "epoch": 0.545, "grad_norm": 1.6524759531021118, "learning_rate": 9.342393902253252e-05, "loss": 2.3306240844726562, "step": 5450 }, { "epoch": 0.5475, "grad_norm": 1.512019157409668, "learning_rate": 9.259922777044213e-05, "loss": 2.300531921386719, "step": 5475 }, { "epoch": 0.55, "grad_norm": 1.4672224521636963, "learning_rate": 9.177502235130284e-05, "loss": 2.119959411621094, "step": 5500 }, { "epoch": 0.55, "eval_cer": 0.12580579216354343, "eval_loss": 1.4867600202560425, "eval_runtime": 107.689, "eval_samples_per_second": 13.52, "eval_steps_per_second": 0.427, "eval_wer": 0.2515070797700827, "step": 5500 }, { "epoch": 0.5525, "grad_norm": 3.694199323654175, "learning_rate": 9.095137909846017e-05, "loss": 2.093580780029297, "step": 5525 }, { "epoch": 0.555, "grad_norm": 1.6778661012649536, "learning_rate": 9.012835430683642e-05, "loss": 2.211465148925781, "step": 5550 }, { "epoch": 0.5575, "grad_norm": 1.4538211822509766, "learning_rate": 8.93060042290828e-05, "loss": 2.067851867675781, "step": 5575 }, { "epoch": 0.56, "grad_norm": 1.399057388305664, "learning_rate": 8.848438507173474e-05, "loss": 2.2560064697265627, "step": 5600 }, { "epoch": 0.5625, "grad_norm": 1.7285677194595337, "learning_rate": 8.76635529913703e-05, "loss": 2.305147705078125, "step": 5625 }, { "epoch": 0.565, "grad_norm": 1.3977117538452148, "learning_rate": 8.684356409077176e-05, "loss": 2.1981732177734377, "step": 5650 }, { "epoch": 0.5675, "grad_norm": 1.377535343170166, "learning_rate": 8.602447441509128e-05, "loss": 2.1758804321289062, "step": 5675 }, { "epoch": 0.57, "grad_norm": 1.4587531089782715, "learning_rate": 8.520633994802014e-05, "loss": 2.157071533203125, "step": 5700 }, { "epoch": 0.5725, "grad_norm": 1.4554935693740845, "learning_rate": 8.438921660796246e-05, "loss": 1.999080047607422, "step": 5725 }, { "epoch": 0.575, "grad_norm": 2.2711434364318848, "learning_rate": 8.357316024421302e-05, "loss": 2.1546482849121094, "step": 5750 }, { "epoch": 0.5775, "grad_norm": 1.8232475519180298, "learning_rate": 8.27582266331403e-05, "loss": 2.173642272949219, "step": 5775 }, { "epoch": 0.58, "grad_norm": 1.3171988725662231, "learning_rate": 8.194447147437411e-05, "loss": 2.3818399047851564, "step": 5800 }, { "epoch": 0.5825, "grad_norm": 1.943204402923584, "learning_rate": 8.11319503869986e-05, "loss": 2.1704754638671875, "step": 5825 }, { "epoch": 0.585, "grad_norm": 1.4433194398880005, "learning_rate": 8.032071890575078e-05, "loss": 2.342074432373047, "step": 5850 }, { "epoch": 0.5875, "grad_norm": 1.7247374057769775, "learning_rate": 7.95108324772248e-05, "loss": 2.0461408996582033, "step": 5875 }, { "epoch": 0.59, "grad_norm": 1.8924514055252075, "learning_rate": 7.870234645608221e-05, "loss": 2.158209228515625, "step": 5900 }, { "epoch": 0.5925, "grad_norm": 1.7629958391189575, "learning_rate": 7.789531610126864e-05, "loss": 2.1048355102539062, "step": 5925 }, { "epoch": 0.595, "grad_norm": 1.9589917659759521, "learning_rate": 7.708979657223681e-05, "loss": 2.182529296875, "step": 5950 }, { "epoch": 0.5975, "grad_norm": 1.8531277179718018, "learning_rate": 7.628584292517651e-05, "loss": 2.281885070800781, "step": 5975 }, { "epoch": 0.6, "grad_norm": 1.4821549654006958, "learning_rate": 7.548351010925159e-05, "loss": 2.2227223205566404, "step": 6000 }, { "epoch": 0.6, "eval_cer": 0.11651788756388416, "eval_loss": 1.365559458732605, "eval_runtime": 98.5438, "eval_samples_per_second": 14.775, "eval_steps_per_second": 0.467, "eval_wer": 0.23790831347259217, "step": 6000 }, { "epoch": 0.6025, "grad_norm": 5.139744281768799, "learning_rate": 7.468285296284425e-05, "loss": 2.2776620483398435, "step": 6025 }, { "epoch": 0.605, "grad_norm": 1.4555790424346924, "learning_rate": 7.38839262098069e-05, "loss": 2.350541076660156, "step": 6050 }, { "epoch": 0.6075, "grad_norm": 1.830809235572815, "learning_rate": 7.308678445572183e-05, "loss": 2.420984191894531, "step": 6075 }, { "epoch": 0.61, "grad_norm": 1.5413800477981567, "learning_rate": 7.229148218416905e-05, "loss": 2.0628668212890626, "step": 6100 }, { "epoch": 0.6125, "grad_norm": 1.5212156772613525, "learning_rate": 7.149807375300239e-05, "loss": 2.1369078063964846, "step": 6125 }, { "epoch": 0.615, "grad_norm": 1.639372706413269, "learning_rate": 7.070661339063421e-05, "loss": 2.1265322875976564, "step": 6150 }, { "epoch": 0.6175, "grad_norm": 1.3873976469039917, "learning_rate": 6.991715519232893e-05, "loss": 2.2606741333007814, "step": 6175 }, { "epoch": 0.62, "grad_norm": 2.0001771450042725, "learning_rate": 6.912975311650573e-05, "loss": 2.0394573974609376, "step": 6200 }, { "epoch": 0.6225, "grad_norm": 1.5461382865905762, "learning_rate": 6.834446098105055e-05, "loss": 2.025839080810547, "step": 6225 }, { "epoch": 0.625, "grad_norm": 1.2012392282485962, "learning_rate": 6.75613324596377e-05, "loss": 2.127050323486328, "step": 6250 }, { "epoch": 0.6275, "grad_norm": 1.4980227947235107, "learning_rate": 6.678042107806136e-05, "loss": 2.1705177307128904, "step": 6275 }, { "epoch": 0.63, "grad_norm": 1.7649891376495361, "learning_rate": 6.600178021057713e-05, "loss": 2.1629388427734373, "step": 6300 }, { "epoch": 0.6325, "grad_norm": 1.4063870906829834, "learning_rate": 6.522546307625399e-05, "loss": 2.252629852294922, "step": 6325 }, { "epoch": 0.635, "grad_norm": 1.8891024589538574, "learning_rate": 6.445152273533687e-05, "loss": 2.310922088623047, "step": 6350 }, { "epoch": 0.6375, "grad_norm": 1.461951494216919, "learning_rate": 6.368001208561998e-05, "loss": 2.2186619567871095, "step": 6375 }, { "epoch": 0.64, "grad_norm": 2.2162909507751465, "learning_rate": 6.291098385883146e-05, "loss": 2.2705178833007813, "step": 6400 }, { "epoch": 0.6425, "grad_norm": 1.6403982639312744, "learning_rate": 6.214449061702898e-05, "loss": 2.287322235107422, "step": 6425 }, { "epoch": 0.645, "grad_norm": 1.4998693466186523, "learning_rate": 6.13805847490075e-05, "loss": 2.2243331909179687, "step": 6450 }, { "epoch": 0.6475, "grad_norm": 1.5675662755966187, "learning_rate": 6.061931846671833e-05, "loss": 2.196006011962891, "step": 6475 }, { "epoch": 0.65, "grad_norm": 1.4675372838974, "learning_rate": 5.986074380170068e-05, "loss": 2.098954162597656, "step": 6500 }, { "epoch": 0.65, "eval_cer": 0.12910391822827938, "eval_loss": 1.4575581550598145, "eval_runtime": 97.7619, "eval_samples_per_second": 14.893, "eval_steps_per_second": 0.471, "eval_wer": 0.2552222066451703, "step": 6500 }, { "epoch": 0.6525, "grad_norm": 1.0977084636688232, "learning_rate": 5.910491260152522e-05, "loss": 2.0651014709472655, "step": 6525 }, { "epoch": 0.655, "grad_norm": 1.7557512521743774, "learning_rate": 5.835187652625047e-05, "loss": 2.1543315124511717, "step": 6550 }, { "epoch": 0.6575, "grad_norm": 3.4759411811828613, "learning_rate": 5.7601687044891925e-05, "loss": 2.154296569824219, "step": 6575 }, { "epoch": 0.66, "grad_norm": 1.4857603311538696, "learning_rate": 5.6854395431904094e-05, "loss": 2.239384765625, "step": 6600 }, { "epoch": 0.6625, "grad_norm": 1.2919102907180786, "learning_rate": 5.611005276367605e-05, "loss": 2.1780934143066406, "step": 6625 }, { "epoch": 0.665, "grad_norm": 1.4281810522079468, "learning_rate": 5.536870991504044e-05, "loss": 2.2144403076171875, "step": 6650 }, { "epoch": 0.6675, "grad_norm": 1.7376158237457275, "learning_rate": 5.463041755579619e-05, "loss": 2.1022102355957033, "step": 6675 }, { "epoch": 0.67, "grad_norm": 2.0145184993743896, "learning_rate": 5.389522614724536e-05, "loss": 2.2605833435058593, "step": 6700 }, { "epoch": 0.6725, "grad_norm": 2.8310012817382812, "learning_rate": 5.316318593874415e-05, "loss": 2.3267457580566404, "step": 6725 }, { "epoch": 0.675, "grad_norm": 2.145875930786133, "learning_rate": 5.2434346964268344e-05, "loss": 2.6324166870117187, "step": 6750 }, { "epoch": 0.6775, "grad_norm": 1.6132903099060059, "learning_rate": 5.170875903899375e-05, "loss": 2.091797180175781, "step": 6775 }, { "epoch": 0.68, "grad_norm": 1.7022608518600464, "learning_rate": 5.098647175589118e-05, "loss": 2.0755772399902344, "step": 6800 }, { "epoch": 0.6825, "grad_norm": 1.4856054782867432, "learning_rate": 5.026753448233703e-05, "loss": 2.1015928649902342, "step": 6825 }, { "epoch": 0.685, "grad_norm": 1.8448196649551392, "learning_rate": 4.9551996356738915e-05, "loss": 2.1693138122558593, "step": 6850 }, { "epoch": 0.6875, "grad_norm": 1.4995580911636353, "learning_rate": 4.883990628517725e-05, "loss": 2.2492982482910158, "step": 6875 }, { "epoch": 0.69, "grad_norm": 1.3703680038452148, "learning_rate": 4.813131293806253e-05, "loss": 2.2033477783203126, "step": 6900 }, { "epoch": 0.6925, "grad_norm": 1.49030339717865, "learning_rate": 4.7426264746808755e-05, "loss": 2.1979034423828123, "step": 6925 }, { "epoch": 0.695, "grad_norm": 1.582387924194336, "learning_rate": 4.6724809900523256e-05, "loss": 2.2166607666015623, "step": 6950 }, { "epoch": 0.6975, "grad_norm": 1.0378532409667969, "learning_rate": 4.6026996342713e-05, "loss": 2.1302786254882813, "step": 6975 }, { "epoch": 0.7, "grad_norm": 1.779466986656189, "learning_rate": 4.533287176800772e-05, "loss": 2.1397467041015625, "step": 7000 }, { "epoch": 0.7, "eval_cer": 0.14284838160136287, "eval_loss": 1.5793243646621704, "eval_runtime": 100.9249, "eval_samples_per_second": 14.427, "eval_steps_per_second": 0.456, "eval_wer": 0.27923033786625545, "step": 7000 }, { "epoch": 0.7025, "grad_norm": 1.4482125043869019, "learning_rate": 4.464248361890006e-05, "loss": 2.3440916442871096, "step": 7025 }, { "epoch": 0.705, "grad_norm": 1.4733315706253052, "learning_rate": 4.3955879082502926e-05, "loss": 2.148384857177734, "step": 7050 }, { "epoch": 0.7075, "grad_norm": 1.8669700622558594, "learning_rate": 4.327310508732437e-05, "loss": 2.0429644775390625, "step": 7075 }, { "epoch": 0.71, "grad_norm": 2.0535337924957275, "learning_rate": 4.2594208300059946e-05, "loss": 2.117684173583984, "step": 7100 }, { "epoch": 0.7125, "grad_norm": 1.4492615461349487, "learning_rate": 4.191923512240327e-05, "loss": 2.1872657775878905, "step": 7125 }, { "epoch": 0.715, "grad_norm": 1.1772300004959106, "learning_rate": 4.1248231687874414e-05, "loss": 2.0845387268066404, "step": 7150 }, { "epoch": 0.7175, "grad_norm": 1.9866479635238647, "learning_rate": 4.058124385866685e-05, "loss": 2.17061279296875, "step": 7175 }, { "epoch": 0.72, "grad_norm": 1.3913525342941284, "learning_rate": 3.991831722251268e-05, "loss": 2.2543954467773437, "step": 7200 }, { "epoch": 0.7225, "grad_norm": 2.026390314102173, "learning_rate": 3.925949708956689e-05, "loss": 2.156564483642578, "step": 7225 }, { "epoch": 0.725, "grad_norm": 2.187021017074585, "learning_rate": 3.860482848931042e-05, "loss": 2.227943115234375, "step": 7250 }, { "epoch": 0.7275, "grad_norm": 1.6608995199203491, "learning_rate": 3.7954356167472485e-05, "loss": 2.1599061584472654, "step": 7275 }, { "epoch": 0.73, "grad_norm": 1.626770257949829, "learning_rate": 3.730812458297222e-05, "loss": 2.021209411621094, "step": 7300 }, { "epoch": 0.7325, "grad_norm": 1.2525973320007324, "learning_rate": 3.6666177904879994e-05, "loss": 2.138314514160156, "step": 7325 }, { "epoch": 0.735, "grad_norm": 1.5164086818695068, "learning_rate": 3.6028560009398535e-05, "loss": 2.248671417236328, "step": 7350 }, { "epoch": 0.7375, "grad_norm": 1.4386738538742065, "learning_rate": 3.5395314476864026e-05, "loss": 2.1806785583496096, "step": 7375 }, { "epoch": 0.74, "grad_norm": 1.779341220855713, "learning_rate": 3.4766484588767434e-05, "loss": 2.100335693359375, "step": 7400 }, { "epoch": 0.7425, "grad_norm": 1.8158776760101318, "learning_rate": 3.4142113324796344e-05, "loss": 2.1199974060058593, "step": 7425 }, { "epoch": 0.745, "grad_norm": 1.8703250885009766, "learning_rate": 3.3522243359897184e-05, "loss": 2.220720672607422, "step": 7450 }, { "epoch": 0.7475, "grad_norm": 1.5516717433929443, "learning_rate": 3.290691706135871e-05, "loss": 2.0985394287109376, "step": 7475 }, { "epoch": 0.75, "grad_norm": 2.0880203247070312, "learning_rate": 3.229617648591604e-05, "loss": 2.174041290283203, "step": 7500 }, { "epoch": 0.75, "eval_cer": 0.11913458262350937, "eval_loss": 1.444368600845337, "eval_runtime": 94.4985, "eval_samples_per_second": 15.408, "eval_steps_per_second": 0.487, "eval_wer": 0.2379784102060844, "step": 7500 }, { "epoch": 0.7525, "grad_norm": 1.6245286464691162, "learning_rate": 3.1690063376876246e-05, "loss": 2.077626190185547, "step": 7525 }, { "epoch": 0.755, "grad_norm": 1.5519412755966187, "learning_rate": 3.108861916126518e-05, "loss": 2.1642431640625, "step": 7550 }, { "epoch": 0.7575, "grad_norm": 1.6812665462493896, "learning_rate": 3.0491884946996054e-05, "loss": 2.266511993408203, "step": 7575 }, { "epoch": 0.76, "grad_norm": 1.6865683794021606, "learning_rate": 2.989990152005976e-05, "loss": 2.032673645019531, "step": 7600 }, { "epoch": 0.7625, "grad_norm": 1.674428105354309, "learning_rate": 2.9312709341737153e-05, "loss": 2.2226411437988283, "step": 7625 }, { "epoch": 0.765, "grad_norm": 1.8106178045272827, "learning_rate": 2.8730348545833618e-05, "loss": 2.046322784423828, "step": 7650 }, { "epoch": 0.7675, "grad_norm": 1.2184237241744995, "learning_rate": 2.8152858935936e-05, "loss": 2.101376953125, "step": 7675 }, { "epoch": 0.77, "grad_norm": 1.2026764154434204, "learning_rate": 2.7580279982692013e-05, "loss": 2.0226611328125, "step": 7700 }, { "epoch": 0.7725, "grad_norm": 1.4784437417984009, "learning_rate": 2.701265082111253e-05, "loss": 2.14648193359375, "step": 7725 }, { "epoch": 0.775, "grad_norm": 1.3903934955596924, "learning_rate": 2.6450010247896728e-05, "loss": 2.024711151123047, "step": 7750 }, { "epoch": 0.7775, "grad_norm": 1.257865071296692, "learning_rate": 2.589239671878041e-05, "loss": 2.2576043701171873, "step": 7775 }, { "epoch": 0.78, "grad_norm": 1.4572250843048096, "learning_rate": 2.533984834590758e-05, "loss": 2.22150146484375, "step": 7800 }, { "epoch": 0.7825, "grad_norm": 1.6356014013290405, "learning_rate": 2.4792402895225553e-05, "loss": 2.189641571044922, "step": 7825 }, { "epoch": 0.785, "grad_norm": 1.3937262296676636, "learning_rate": 2.4250097783903692e-05, "loss": 1.9916804504394532, "step": 7850 }, { "epoch": 0.7875, "grad_norm": 1.893620252609253, "learning_rate": 2.3712970077775964e-05, "loss": 2.1063442993164063, "step": 7875 }, { "epoch": 0.79, "grad_norm": 1.7967338562011719, "learning_rate": 2.3181056488807607e-05, "loss": 2.2335971069335936, "step": 7900 }, { "epoch": 0.7925, "grad_norm": 2.007983684539795, "learning_rate": 2.2654393372585848e-05, "loss": 2.112566375732422, "step": 7925 }, { "epoch": 0.795, "grad_norm": 1.513131856918335, "learning_rate": 2.21330167258351e-05, "loss": 2.16599853515625, "step": 7950 }, { "epoch": 0.7975, "grad_norm": 1.498331069946289, "learning_rate": 2.161696218395658e-05, "loss": 2.137431640625, "step": 7975 }, { "epoch": 0.8, "grad_norm": 1.2613261938095093, "learning_rate": 2.1106265018592752e-05, "loss": 2.34350830078125, "step": 8000 }, { "epoch": 0.8, "eval_cer": 0.1230664395229983, "eval_loss": 1.4125823974609375, "eval_runtime": 97.7133, "eval_samples_per_second": 14.901, "eval_steps_per_second": 0.471, "eval_wer": 0.24351605215196973, "step": 8000 }, { "epoch": 0.8025, "grad_norm": 2.232102870941162, "learning_rate": 2.0600960135216462e-05, "loss": 2.2054771423339843, "step": 8025 }, { "epoch": 0.805, "grad_norm": 1.2436963319778442, "learning_rate": 2.010108207074527e-05, "loss": 2.0917733764648436, "step": 8050 }, { "epoch": 0.8075, "grad_norm": 1.5534099340438843, "learning_rate": 1.960666499118089e-05, "loss": 2.129667053222656, "step": 8075 }, { "epoch": 0.81, "grad_norm": 1.6899291276931763, "learning_rate": 1.911774268927394e-05, "loss": 2.2986248779296874, "step": 8100 }, { "epoch": 0.8125, "grad_norm": 2.3437321186065674, "learning_rate": 1.863434858221429e-05, "loss": 2.099478912353516, "step": 8125 }, { "epoch": 0.815, "grad_norm": 1.8261597156524658, "learning_rate": 1.8156515709347033e-05, "loss": 2.1615660095214846, "step": 8150 }, { "epoch": 0.8175, "grad_norm": 1.6776697635650635, "learning_rate": 1.7684276729914305e-05, "loss": 2.229272766113281, "step": 8175 }, { "epoch": 0.82, "grad_norm": 1.2899510860443115, "learning_rate": 1.7217663920823068e-05, "loss": 2.0697711181640623, "step": 8200 }, { "epoch": 0.8225, "grad_norm": 1.627907395362854, "learning_rate": 1.6756709174438978e-05, "loss": 1.9809979248046874, "step": 8225 }, { "epoch": 0.825, "grad_norm": 1.6771968603134155, "learning_rate": 1.6301443996406662e-05, "loss": 1.786422882080078, "step": 8250 }, { "epoch": 0.8275, "grad_norm": 1.8237980604171753, "learning_rate": 1.585189950349627e-05, "loss": 2.0105300903320313, "step": 8275 }, { "epoch": 0.83, "grad_norm": 1.6596792936325073, "learning_rate": 1.5408106421476753e-05, "loss": 1.8981912231445313, "step": 8300 }, { "epoch": 0.8325, "grad_norm": 1.3936231136322021, "learning_rate": 1.4970095083015757e-05, "loss": 2.0365556335449218, "step": 8325 }, { "epoch": 0.835, "grad_norm": 1.6055278778076172, "learning_rate": 1.4537895425606407e-05, "loss": 2.1483555603027344, "step": 8350 }, { "epoch": 0.8375, "grad_norm": 1.1807600259780884, "learning_rate": 1.4111536989521213e-05, "loss": 1.9491183471679687, "step": 8375 }, { "epoch": 0.84, "grad_norm": 1.5801160335540771, "learning_rate": 1.3691048915792893e-05, "loss": 1.9624462890625, "step": 8400 }, { "epoch": 0.8425, "grad_norm": 1.202498435974121, "learning_rate": 1.3276459944222785e-05, "loss": 2.2168756103515626, "step": 8425 }, { "epoch": 0.845, "grad_norm": 1.7413278818130493, "learning_rate": 1.286779841141631e-05, "loss": 2.16740234375, "step": 8450 }, { "epoch": 0.8475, "grad_norm": 2.2603840827941895, "learning_rate": 1.2465092248846422e-05, "loss": 2.189974060058594, "step": 8475 }, { "epoch": 0.85, "grad_norm": 1.7048544883728027, "learning_rate": 1.206836898094439e-05, "loss": 2.057767333984375, "step": 8500 }, { "epoch": 0.85, "eval_cer": 0.11645655877342419, "eval_loss": 1.3806432485580444, "eval_runtime": 97.8639, "eval_samples_per_second": 14.878, "eval_steps_per_second": 0.47, "eval_wer": 0.2347189120986962, "step": 8500 }, { "epoch": 0.8525, "grad_norm": 1.520108699798584, "learning_rate": 1.1677655723218594e-05, "loss": 2.138619232177734, "step": 8525 }, { "epoch": 0.855, "grad_norm": 1.469742774963379, "learning_rate": 1.1292979180401209e-05, "loss": 2.1907090759277343, "step": 8550 }, { "epoch": 0.8575, "grad_norm": 1.6531875133514404, "learning_rate": 1.0914365644622926e-05, "loss": 2.1050286865234376, "step": 8575 }, { "epoch": 0.86, "grad_norm": 1.6312158107757568, "learning_rate": 1.0541840993616004e-05, "loss": 2.0515817260742186, "step": 8600 }, { "epoch": 0.8625, "grad_norm": 1.8661822080612183, "learning_rate": 1.0175430688945486e-05, "loss": 2.315790557861328, "step": 8625 }, { "epoch": 0.865, "grad_norm": 2.089953660964966, "learning_rate": 9.815159774268978e-06, "loss": 2.402613525390625, "step": 8650 }, { "epoch": 0.8675, "grad_norm": 1.5258253812789917, "learning_rate": 9.461052873624942e-06, "loss": 1.9790252685546874, "step": 8675 }, { "epoch": 0.87, "grad_norm": 1.4712804555892944, "learning_rate": 9.11313418974965e-06, "loss": 2.132662353515625, "step": 8700 }, { "epoch": 0.8725, "grad_norm": 1.8603571653366089, "learning_rate": 8.771427502422979e-06, "loss": 2.027366943359375, "step": 8725 }, { "epoch": 0.875, "grad_norm": 2.1210811138153076, "learning_rate": 8.435956166843117e-06, "loss": 2.066180877685547, "step": 8750 }, { "epoch": 0.8775, "grad_norm": 1.4630470275878906, "learning_rate": 8.106743112030223e-06, "loss": 2.0400991821289063, "step": 8775 }, { "epoch": 0.88, "grad_norm": 1.7319868803024292, "learning_rate": 7.783810839259286e-06, "loss": 2.1061160278320314, "step": 8800 }, { "epoch": 0.8825, "grad_norm": 1.5619069337844849, "learning_rate": 7.467181420522173e-06, "loss": 2.1499870300292967, "step": 8825 }, { "epoch": 0.885, "grad_norm": 1.473605990409851, "learning_rate": 7.156876497019072e-06, "loss": 2.0396578979492186, "step": 8850 }, { "epoch": 0.8875, "grad_norm": 1.5723377466201782, "learning_rate": 6.852917277679305e-06, "loss": 2.095478973388672, "step": 8875 }, { "epoch": 0.89, "grad_norm": 1.7452499866485596, "learning_rate": 6.555324537711749e-06, "loss": 2.088753356933594, "step": 8900 }, { "epoch": 0.8925, "grad_norm": 1.4047157764434814, "learning_rate": 6.264118617184878e-06, "loss": 2.006247253417969, "step": 8925 }, { "epoch": 0.895, "grad_norm": 1.5385630130767822, "learning_rate": 5.979319419636531e-06, "loss": 2.0545005798339844, "step": 8950 }, { "epoch": 0.8975, "grad_norm": 1.3976651430130005, "learning_rate": 5.700946410713548e-06, "loss": 2.0425811767578126, "step": 8975 }, { "epoch": 0.9, "grad_norm": 1.7689292430877686, "learning_rate": 5.4290186168413195e-06, "loss": 2.113001251220703, "step": 9000 }, { "epoch": 0.9, "eval_cer": 0.12256899488926747, "eval_loss": 1.428444504737854, "eval_runtime": 99.6669, "eval_samples_per_second": 14.609, "eval_steps_per_second": 0.462, "eval_wer": 0.2449179868218141, "step": 9000 }, { "epoch": 0.9025, "grad_norm": 1.8464909791946411, "learning_rate": 5.163554623923339e-06, "loss": 2.3079527282714842, "step": 9025 }, { "epoch": 0.905, "grad_norm": 1.3554507493972778, "learning_rate": 4.904572576070898e-06, "loss": 1.9901699829101562, "step": 9050 }, { "epoch": 0.9075, "grad_norm": 2.5160086154937744, "learning_rate": 4.652090174362933e-06, "loss": 2.355846405029297, "step": 9075 }, { "epoch": 0.91, "grad_norm": 1.3784635066986084, "learning_rate": 4.406124675636236e-06, "loss": 1.9769573974609376, "step": 9100 }, { "epoch": 0.9125, "grad_norm": 1.8741276264190674, "learning_rate": 4.166692891305901e-06, "loss": 2.159720916748047, "step": 9125 }, { "epoch": 0.915, "grad_norm": 1.5177477598190308, "learning_rate": 3.933811186216341e-06, "loss": 2.190943145751953, "step": 9150 }, { "epoch": 0.9175, "grad_norm": 1.6856800317764282, "learning_rate": 3.70749547752276e-06, "loss": 1.8975885009765625, "step": 9175 }, { "epoch": 0.92, "grad_norm": 1.606224775314331, "learning_rate": 3.487761233603204e-06, "loss": 2.0187437438964846, "step": 9200 }, { "epoch": 0.9225, "grad_norm": 1.8462681770324707, "learning_rate": 3.2746234730013814e-06, "loss": 2.093716278076172, "step": 9225 }, { "epoch": 0.925, "grad_norm": 1.1840476989746094, "learning_rate": 3.0680967634000855e-06, "loss": 2.1287353515625, "step": 9250 }, { "epoch": 0.9275, "grad_norm": 1.4410308599472046, "learning_rate": 2.8681952206256024e-06, "loss": 2.0268960571289063, "step": 9275 }, { "epoch": 0.93, "grad_norm": 2.162745475769043, "learning_rate": 2.6749325076828147e-06, "loss": 2.032665100097656, "step": 9300 }, { "epoch": 0.9325, "grad_norm": 1.4856213331222534, "learning_rate": 2.488321833821461e-06, "loss": 2.0829930114746094, "step": 9325 }, { "epoch": 0.935, "grad_norm": 1.5334405899047852, "learning_rate": 2.3083759536331907e-06, "loss": 2.0290562438964845, "step": 9350 }, { "epoch": 0.9375, "grad_norm": 1.4322729110717773, "learning_rate": 2.135107166179895e-06, "loss": 2.0317987060546874, "step": 9375 }, { "epoch": 0.94, "grad_norm": 3.075627326965332, "learning_rate": 1.9685273141530348e-06, "loss": 2.0745269775390627, "step": 9400 }, { "epoch": 0.9425, "grad_norm": 1.6498782634735107, "learning_rate": 1.8086477830642211e-06, "loss": 2.1034091186523436, "step": 9425 }, { "epoch": 0.945, "grad_norm": 1.5094914436340332, "learning_rate": 1.6554795004670388e-06, "loss": 2.139844970703125, "step": 9450 }, { "epoch": 0.9475, "grad_norm": 1.1315068006515503, "learning_rate": 1.5090329352101197e-06, "loss": 2.188152313232422, "step": 9475 }, { "epoch": 0.95, "grad_norm": 1.2506731748580933, "learning_rate": 1.3693180967216612e-06, "loss": 2.1455296325683593, "step": 9500 }, { "epoch": 0.95, "eval_cer": 0.12331175468483815, "eval_loss": 1.442671537399292, "eval_runtime": 97.491, "eval_samples_per_second": 14.935, "eval_steps_per_second": 0.472, "eval_wer": 0.24751156596102622, "step": 9500 }, { "epoch": 0.9525, "grad_norm": 1.4666153192520142, "learning_rate": 1.2363445343253177e-06, "loss": 2.1449468994140624, "step": 9525 }, { "epoch": 0.955, "grad_norm": 1.250496506690979, "learning_rate": 1.1101213365874109e-06, "loss": 2.0825015258789064, "step": 9550 }, { "epoch": 0.9575, "grad_norm": 1.8249273300170898, "learning_rate": 9.9065713069586e-07, "loss": 2.190665435791016, "step": 9575 }, { "epoch": 0.96, "grad_norm": 1.633515477180481, "learning_rate": 8.779600818704436e-07, "loss": 2.0684149169921877, "step": 9600 }, { "epoch": 0.9625, "grad_norm": 1.526536464691162, "learning_rate": 7.720378928047334e-07, "loss": 2.2017979431152344, "step": 9625 }, { "epoch": 0.965, "grad_norm": 1.0879954099655151, "learning_rate": 6.728978031396715e-07, "loss": 2.0479502868652344, "step": 9650 }, { "epoch": 0.9675, "grad_norm": 1.6106431484222412, "learning_rate": 5.805465889686779e-07, "loss": 2.167593231201172, "step": 9675 }, { "epoch": 0.97, "grad_norm": 1.4785369634628296, "learning_rate": 4.949905623745754e-07, "loss": 2.1969068908691405, "step": 9700 }, { "epoch": 0.9725, "grad_norm": 1.4101808071136475, "learning_rate": 4.162355709981247e-07, "loss": 1.9459999084472657, "step": 9725 }, { "epoch": 0.975, "grad_norm": 1.7263907194137573, "learning_rate": 3.442869976383767e-07, "loss": 2.139817199707031, "step": 9750 }, { "epoch": 0.9775, "grad_norm": 1.5900930166244507, "learning_rate": 2.791497598847448e-07, "loss": 2.2311444091796875, "step": 9775 }, { "epoch": 0.98, "grad_norm": 1.627547264099121, "learning_rate": 2.2082830978091827e-07, "loss": 2.224051818847656, "step": 9800 }, { "epoch": 0.9825, "grad_norm": 1.6145861148834229, "learning_rate": 1.693266335205279e-07, "loss": 2.142480773925781, "step": 9825 }, { "epoch": 0.985, "grad_norm": 2.347938060760498, "learning_rate": 1.2464825117473046e-07, "loss": 2.230269775390625, "step": 9850 }, { "epoch": 0.9875, "grad_norm": 1.9687460660934448, "learning_rate": 8.679621645162339e-08, "loss": 2.1646629333496095, "step": 9875 }, { "epoch": 0.99, "grad_norm": 1.6123799085617065, "learning_rate": 5.577311648748973e-08, "loss": 2.268137664794922, "step": 9900 }, { "epoch": 0.9925, "grad_norm": 2.6218087673187256, "learning_rate": 3.1581071670006015e-08, "loss": 2.13885498046875, "step": 9925 }, { "epoch": 0.995, "grad_norm": 1.5530320405960083, "learning_rate": 1.4221735493291643e-08, "loss": 2.364825439453125, "step": 9950 }, { "epoch": 0.9975, "grad_norm": 1.5830848217010498, "learning_rate": 3.69629444493258e-09, "loss": 2.3132223510742187, "step": 9975 }, { "epoch": 1.0, "grad_norm": 1.4912697076797485, "learning_rate": 5.467924824031911e-12, "loss": 2.1259417724609375, "step": 10000 }, { "epoch": 1.0, "eval_cer": 0.12461328790459966, "eval_loss": 1.4531149864196777, "eval_runtime": 97.7851, "eval_samples_per_second": 14.89, "eval_steps_per_second": 0.47, "eval_wer": 0.24968456469928502, "step": 10000 } ], "logging_steps": 25, "max_steps": 10000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.210732413610433e+20, "train_batch_size": 32, "trial_name": null, "trial_params": null }