MSP / last-checkpoint /trainer_state.json
MahmoodAnaam's picture
Training in progress, step 10000, checkpoint
e88dcf6 verified
Raw
History Blame Contribute Delete
75.3 kB
{
"best_global_step": 4000,
"best_metric": 0.21596803588952754,
"best_model_checkpoint": "/workspace/checkpoints-av/msp_e2e_ctc/checkpoint-4000",
"epoch": 1.0,
"eval_steps": 500,
"global_step": 10000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0025,
"grad_norm": 8.04428768157959,
"learning_rate": 9.600000000000001e-06,
"loss": 7.127101440429687,
"step": 25
},
{
"epoch": 0.005,
"grad_norm": 8.43156623840332,
"learning_rate": 1.9600000000000002e-05,
"loss": 4.697780151367187,
"step": 50
},
{
"epoch": 0.0075,
"grad_norm": 3.904343366622925,
"learning_rate": 2.96e-05,
"loss": 3.743772277832031,
"step": 75
},
{
"epoch": 0.01,
"grad_norm": 3.055377960205078,
"learning_rate": 3.960000000000001e-05,
"loss": 2.656860656738281,
"step": 100
},
{
"epoch": 0.0125,
"grad_norm": 2.4546093940734863,
"learning_rate": 4.96e-05,
"loss": 2.414398498535156,
"step": 125
},
{
"epoch": 0.015,
"grad_norm": 3.393557071685791,
"learning_rate": 5.96e-05,
"loss": 2.355498809814453,
"step": 150
},
{
"epoch": 0.0175,
"grad_norm": 2.8310353755950928,
"learning_rate": 6.96e-05,
"loss": 2.3629690551757814,
"step": 175
},
{
"epoch": 0.02,
"grad_norm": 3.3908843994140625,
"learning_rate": 7.960000000000001e-05,
"loss": 2.298575439453125,
"step": 200
},
{
"epoch": 0.0225,
"grad_norm": 2.8602232933044434,
"learning_rate": 8.960000000000001e-05,
"loss": 2.285859375,
"step": 225
},
{
"epoch": 0.025,
"grad_norm": 4.637383460998535,
"learning_rate": 9.960000000000001e-05,
"loss": 2.467720794677734,
"step": 250
},
{
"epoch": 0.0275,
"grad_norm": 2.0761306285858154,
"learning_rate": 0.00010960000000000001,
"loss": 2.3147714233398435,
"step": 275
},
{
"epoch": 0.03,
"grad_norm": 2.8212428092956543,
"learning_rate": 0.00011960000000000001,
"loss": 2.453261260986328,
"step": 300
},
{
"epoch": 0.0325,
"grad_norm": 4.797104358673096,
"learning_rate": 0.0001296,
"loss": 2.4396128845214844,
"step": 325
},
{
"epoch": 0.035,
"grad_norm": 4.374691009521484,
"learning_rate": 0.0001396,
"loss": 2.343565673828125,
"step": 350
},
{
"epoch": 0.0375,
"grad_norm": 4.064563274383545,
"learning_rate": 0.0001496,
"loss": 2.250940704345703,
"step": 375
},
{
"epoch": 0.04,
"grad_norm": 3.3617475032806396,
"learning_rate": 0.0001596,
"loss": 2.319589385986328,
"step": 400
},
{
"epoch": 0.0425,
"grad_norm": 2.7767529487609863,
"learning_rate": 0.0001696,
"loss": 2.4519082641601564,
"step": 425
},
{
"epoch": 0.045,
"grad_norm": 4.268216133117676,
"learning_rate": 0.0001796,
"loss": 2.317582702636719,
"step": 450
},
{
"epoch": 0.0475,
"grad_norm": 1.932944416999817,
"learning_rate": 0.0001896,
"loss": 2.2180686950683595,
"step": 475
},
{
"epoch": 0.05,
"grad_norm": 2.41548228263855,
"learning_rate": 0.0001996,
"loss": 2.4416712951660156,
"step": 500
},
{
"epoch": 0.05,
"eval_cer": 0.16142419080068143,
"eval_loss": 1.5633715391159058,
"eval_runtime": 99.4493,
"eval_samples_per_second": 14.641,
"eval_steps_per_second": 0.463,
"eval_wer": 0.3212533295948409,
"step": 500
},
{
"epoch": 0.0525,
"grad_norm": 2.496230363845825,
"learning_rate": 0.00019999685049180394,
"loss": 2.244039764404297,
"step": 525
},
{
"epoch": 0.055,
"grad_norm": 1.956568956375122,
"learning_rate": 0.0001999868717996323,
"loss": 2.39022216796875,
"step": 550
},
{
"epoch": 0.0575,
"grad_norm": 2.2251765727996826,
"learning_rate": 0.00019997005913759068,
"loss": 2.3402642822265625,
"step": 575
},
{
"epoch": 0.06,
"grad_norm": 4.093571662902832,
"learning_rate": 0.00019994641365480214,
"loss": 2.530718994140625,
"step": 600
},
{
"epoch": 0.0625,
"grad_norm": 2.388291120529175,
"learning_rate": 0.00019991593696740405,
"loss": 2.4927822875976564,
"step": 625
},
{
"epoch": 0.065,
"grad_norm": 2.476865530014038,
"learning_rate": 0.00019987863115843748,
"loss": 2.43189453125,
"step": 650
},
{
"epoch": 0.0675,
"grad_norm": 2.6366164684295654,
"learning_rate": 0.00019983449877770495,
"loss": 2.4924627685546876,
"step": 675
},
{
"epoch": 0.07,
"grad_norm": 2.0813474655151367,
"learning_rate": 0.00019978354284159604,
"loss": 2.47088134765625,
"step": 700
},
{
"epoch": 0.0725,
"grad_norm": 2.2441253662109375,
"learning_rate": 0.00019972576683288128,
"loss": 2.444411163330078,
"step": 725
},
{
"epoch": 0.075,
"grad_norm": 1.8759963512420654,
"learning_rate": 0.00019966117470047418,
"loss": 2.3306341552734375,
"step": 750
},
{
"epoch": 0.0775,
"grad_norm": 3.6834940910339355,
"learning_rate": 0.00019958977085916113,
"loss": 2.3836322021484375,
"step": 775
},
{
"epoch": 0.08,
"grad_norm": 2.361351251602173,
"learning_rate": 0.00019951156018929985,
"loss": 2.4483242797851563,
"step": 800
},
{
"epoch": 0.0825,
"grad_norm": 1.5636104345321655,
"learning_rate": 0.00019942654803648574,
"loss": 2.4330813598632814,
"step": 825
},
{
"epoch": 0.085,
"grad_norm": 4.691361904144287,
"learning_rate": 0.00019933474021118652,
"loss": 2.420093994140625,
"step": 850
},
{
"epoch": 0.0875,
"grad_norm": 2.050384998321533,
"learning_rate": 0.0001992361429883451,
"loss": 2.2977276611328126,
"step": 875
},
{
"epoch": 0.09,
"grad_norm": 3.0928971767425537,
"learning_rate": 0.00019913076310695068,
"loss": 2.3863540649414063,
"step": 900
},
{
"epoch": 0.0925,
"grad_norm": 2.323233127593994,
"learning_rate": 0.00019901860776957815,
"loss": 2.278043212890625,
"step": 925
},
{
"epoch": 0.095,
"grad_norm": 3.15425705909729,
"learning_rate": 0.00019889968464189588,
"loss": 2.418150634765625,
"step": 950
},
{
"epoch": 0.0975,
"grad_norm": 2.0778608322143555,
"learning_rate": 0.00019877400185214165,
"loss": 2.3605302429199218,
"step": 975
},
{
"epoch": 0.1,
"grad_norm": 3.228522300720215,
"learning_rate": 0.00019864156799056723,
"loss": 2.4653065490722654,
"step": 1000
},
{
"epoch": 0.1,
"eval_cer": 0.12089267461669506,
"eval_loss": 1.4769799709320068,
"eval_runtime": 98.9656,
"eval_samples_per_second": 14.712,
"eval_steps_per_second": 0.465,
"eval_wer": 0.24400672928641526,
"step": 1000
},
{
"epoch": 0.1025,
"grad_norm": 2.1160504817962646,
"learning_rate": 0.0001985023921088511,
"loss": 2.5620989990234375,
"step": 1025
},
{
"epoch": 0.105,
"grad_norm": 2.091463327407837,
"learning_rate": 0.00019835648371947987,
"loss": 2.5808676147460936,
"step": 1050
},
{
"epoch": 0.1075,
"grad_norm": 3.3528618812561035,
"learning_rate": 0.00019820385279509822,
"loss": 2.596577453613281,
"step": 1075
},
{
"epoch": 0.11,
"grad_norm": 1.9095429182052612,
"learning_rate": 0.000198044509767827,
"loss": 2.593738708496094,
"step": 1100
},
{
"epoch": 0.1125,
"grad_norm": 2.25166654586792,
"learning_rate": 0.00019787846552855054,
"loss": 2.4640257263183596,
"step": 1125
},
{
"epoch": 0.115,
"grad_norm": 2.254211664199829,
"learning_rate": 0.00019770573142617197,
"loss": 2.3456986999511718,
"step": 1150
},
{
"epoch": 0.1175,
"grad_norm": 2.2005534172058105,
"learning_rate": 0.00019752631926683775,
"loss": 2.4674136352539064,
"step": 1175
},
{
"epoch": 0.12,
"grad_norm": 1.7976740598678589,
"learning_rate": 0.00019734024131313067,
"loss": 2.4166830444335936,
"step": 1200
},
{
"epoch": 0.1225,
"grad_norm": 2.3863418102264404,
"learning_rate": 0.00019714751028323166,
"loss": 2.438814392089844,
"step": 1225
},
{
"epoch": 0.125,
"grad_norm": 3.311290979385376,
"learning_rate": 0.0001969481393500506,
"loss": 2.406153259277344,
"step": 1250
},
{
"epoch": 0.1275,
"grad_norm": 5.752159118652344,
"learning_rate": 0.00019674214214032598,
"loss": 2.2879945373535158,
"step": 1275
},
{
"epoch": 0.13,
"grad_norm": 2.109788656234741,
"learning_rate": 0.00019652953273369342,
"loss": 2.3744522094726563,
"step": 1300
},
{
"epoch": 0.1325,
"grad_norm": 1.5383687019348145,
"learning_rate": 0.00019631032566172344,
"loss": 2.3803326416015627,
"step": 1325
},
{
"epoch": 0.135,
"grad_norm": 2.9055371284484863,
"learning_rate": 0.00019608453590692822,
"loss": 2.3387161254882813,
"step": 1350
},
{
"epoch": 0.1375,
"grad_norm": 2.196284294128418,
"learning_rate": 0.0001958521789017376,
"loss": 2.323087463378906,
"step": 1375
},
{
"epoch": 0.14,
"grad_norm": 1.8836430311203003,
"learning_rate": 0.0001956132705274442,
"loss": 2.234120178222656,
"step": 1400
},
{
"epoch": 0.1425,
"grad_norm": 1.8475207090377808,
"learning_rate": 0.00019536782711311807,
"loss": 2.293027191162109,
"step": 1425
},
{
"epoch": 0.145,
"grad_norm": 1.8547334671020508,
"learning_rate": 0.00019511586543449053,
"loss": 2.243158264160156,
"step": 1450
},
{
"epoch": 0.1475,
"grad_norm": 2.3523902893066406,
"learning_rate": 0.00019485740271280765,
"loss": 2.274371337890625,
"step": 1475
},
{
"epoch": 0.15,
"grad_norm": 2.411062717437744,
"learning_rate": 0.00019459245661365313,
"loss": 2.365634002685547,
"step": 1500
},
{
"epoch": 0.15,
"eval_cer": 0.11594548551959113,
"eval_loss": 1.423877477645874,
"eval_runtime": 98.4968,
"eval_samples_per_second": 14.782,
"eval_steps_per_second": 0.467,
"eval_wer": 0.24074723117902705,
"step": 1500
},
{
"epoch": 0.1525,
"grad_norm": 2.0285370349884033,
"learning_rate": 0.00019432104524574087,
"loss": 2.468669738769531,
"step": 1525
},
{
"epoch": 0.155,
"grad_norm": 2.2131717205047607,
"learning_rate": 0.00019404318715967732,
"loss": 2.5288356018066405,
"step": 1550
},
{
"epoch": 0.1575,
"grad_norm": 2.3619260787963867,
"learning_rate": 0.0001937589013466936,
"loss": 2.3784559631347655,
"step": 1575
},
{
"epoch": 0.16,
"grad_norm": 1.704810619354248,
"learning_rate": 0.00019346820723734745,
"loss": 2.286223907470703,
"step": 1600
},
{
"epoch": 0.1625,
"grad_norm": 2.17364501953125,
"learning_rate": 0.00019317112470019503,
"loss": 2.4997410583496094,
"step": 1625
},
{
"epoch": 0.165,
"grad_norm": 1.9224309921264648,
"learning_rate": 0.00019286767404043316,
"loss": 2.392764434814453,
"step": 1650
},
{
"epoch": 0.1675,
"grad_norm": 2.331049919128418,
"learning_rate": 0.0001925578759985113,
"loss": 2.371828765869141,
"step": 1675
},
{
"epoch": 0.17,
"grad_norm": 2.191542148590088,
"learning_rate": 0.00019224175174871415,
"loss": 2.293146667480469,
"step": 1700
},
{
"epoch": 0.1725,
"grad_norm": 1.853737711906433,
"learning_rate": 0.0001919193228977142,
"loss": 2.4427305603027345,
"step": 1725
},
{
"epoch": 0.175,
"grad_norm": 1.6019384860992432,
"learning_rate": 0.0001915906114830952,
"loss": 2.3477943420410154,
"step": 1750
},
{
"epoch": 0.1775,
"grad_norm": 2.125684976577759,
"learning_rate": 0.00019125563997184563,
"loss": 2.455902099609375,
"step": 1775
},
{
"epoch": 0.18,
"grad_norm": 1.6694984436035156,
"learning_rate": 0.00019091443125882337,
"loss": 2.335185241699219,
"step": 1800
},
{
"epoch": 0.1825,
"grad_norm": 1.8382054567337036,
"learning_rate": 0.00019056700866519063,
"loss": 2.1945234680175782,
"step": 1825
},
{
"epoch": 0.185,
"grad_norm": 1.8865960836410522,
"learning_rate": 0.00019021339593682028,
"loss": 2.3078712463378905,
"step": 1850
},
{
"epoch": 0.1875,
"grad_norm": 3.637312173843384,
"learning_rate": 0.00018985361724267256,
"loss": 2.3725929260253906,
"step": 1875
},
{
"epoch": 0.19,
"grad_norm": 2.0592007637023926,
"learning_rate": 0.00018948769717314328,
"loss": 2.300412292480469,
"step": 1900
},
{
"epoch": 0.1925,
"grad_norm": 2.4111757278442383,
"learning_rate": 0.0001891156607383831,
"loss": 2.218678741455078,
"step": 1925
},
{
"epoch": 0.195,
"grad_norm": 1.5851012468338013,
"learning_rate": 0.00018873753336658822,
"loss": 2.3549868774414064,
"step": 1950
},
{
"epoch": 0.1975,
"grad_norm": 2.3010220527648926,
"learning_rate": 0.00018835334090226214,
"loss": 2.336710662841797,
"step": 1975
},
{
"epoch": 0.2,
"grad_norm": 2.793161392211914,
"learning_rate": 0.0001879631096044495,
"loss": 2.4607310485839844,
"step": 2000
},
{
"epoch": 0.2,
"eval_cer": 0.13946166950596253,
"eval_loss": 1.6668776273727417,
"eval_runtime": 96.2028,
"eval_samples_per_second": 15.135,
"eval_steps_per_second": 0.478,
"eval_wer": 0.2859245759147624,
"step": 2000
},
{
"epoch": 0.2025,
"grad_norm": 2.5048420429229736,
"learning_rate": 0.0001875668661449411,
"loss": 2.3207608032226563,
"step": 2025
},
{
"epoch": 0.205,
"grad_norm": 2.479046106338501,
"learning_rate": 0.0001871646376064511,
"loss": 2.226656188964844,
"step": 2050
},
{
"epoch": 0.2075,
"grad_norm": 1.7231593132019043,
"learning_rate": 0.00018675645148076578,
"loss": 2.308455047607422,
"step": 2075
},
{
"epoch": 0.21,
"grad_norm": 1.5906119346618652,
"learning_rate": 0.0001863423356668646,
"loss": 2.35341796875,
"step": 2100
},
{
"epoch": 0.2125,
"grad_norm": 2.1919968128204346,
"learning_rate": 0.00018592231846901335,
"loss": 2.3587355041503906,
"step": 2125
},
{
"epoch": 0.215,
"grad_norm": 1.5849632024765015,
"learning_rate": 0.00018549642859482963,
"loss": 2.259740905761719,
"step": 2150
},
{
"epoch": 0.2175,
"grad_norm": 1.6398062705993652,
"learning_rate": 0.00018506469515332054,
"loss": 2.234868927001953,
"step": 2175
},
{
"epoch": 0.22,
"grad_norm": 2.203387498855591,
"learning_rate": 0.0001846271476528934,
"loss": 2.4610299682617187,
"step": 2200
},
{
"epoch": 0.2225,
"grad_norm": 2.0128378868103027,
"learning_rate": 0.00018418381599933853,
"loss": 2.4086659240722654,
"step": 2225
},
{
"epoch": 0.225,
"grad_norm": 1.7606065273284912,
"learning_rate": 0.00018373473049378562,
"loss": 2.546702575683594,
"step": 2250
},
{
"epoch": 0.2275,
"grad_norm": 2.066452980041504,
"learning_rate": 0.00018327992183063248,
"loss": 2.2808355712890624,
"step": 2275
},
{
"epoch": 0.23,
"grad_norm": 1.9987760782241821,
"learning_rate": 0.00018281942109544698,
"loss": 2.445269012451172,
"step": 2300
},
{
"epoch": 0.2325,
"grad_norm": 1.608620285987854,
"learning_rate": 0.00018235325976284275,
"loss": 2.1912208557128907,
"step": 2325
},
{
"epoch": 0.235,
"grad_norm": 2.238555431365967,
"learning_rate": 0.00018188146969432762,
"loss": 2.4058465576171875,
"step": 2350
},
{
"epoch": 0.2375,
"grad_norm": 2.2178099155426025,
"learning_rate": 0.00018140408313612608,
"loss": 2.3438116455078126,
"step": 2375
},
{
"epoch": 0.24,
"grad_norm": 1.9142024517059326,
"learning_rate": 0.00018092113271697522,
"loss": 2.4138525390625,
"step": 2400
},
{
"epoch": 0.2425,
"grad_norm": 3.3786633014678955,
"learning_rate": 0.00018043265144589466,
"loss": 2.2731494140625,
"step": 2425
},
{
"epoch": 0.245,
"grad_norm": 2.6107332706451416,
"learning_rate": 0.00017993867270993047,
"loss": 2.230762481689453,
"step": 2450
},
{
"epoch": 0.2475,
"grad_norm": 2.1159350872039795,
"learning_rate": 0.000179439230271873,
"loss": 2.5371829223632814,
"step": 2475
},
{
"epoch": 0.25,
"grad_norm": 2.519641876220703,
"learning_rate": 0.00017893435826794952,
"loss": 2.2601394653320312,
"step": 2500
},
{
"epoch": 0.25,
"eval_cer": 0.12031345826235093,
"eval_loss": 1.3391743898391724,
"eval_runtime": 94.2011,
"eval_samples_per_second": 15.456,
"eval_steps_per_second": 0.488,
"eval_wer": 0.24439226132062247,
"step": 2500
},
{
"epoch": 0.2525,
"grad_norm": 1.6987061500549316,
"learning_rate": 0.00017842409120549083,
"loss": 2.4055056762695313,
"step": 2525
},
{
"epoch": 0.255,
"grad_norm": 2.0303497314453125,
"learning_rate": 0.00017790846396057277,
"loss": 2.3995057678222658,
"step": 2550
},
{
"epoch": 0.2575,
"grad_norm": 1.8574965000152588,
"learning_rate": 0.00017738751177563268,
"loss": 2.3057664489746093,
"step": 2575
},
{
"epoch": 0.26,
"grad_norm": 2.6739280223846436,
"learning_rate": 0.00017686127025706038,
"loss": 2.460683135986328,
"step": 2600
},
{
"epoch": 0.2625,
"grad_norm": 2.627385377883911,
"learning_rate": 0.00017632977537276464,
"loss": 2.3323692321777343,
"step": 2625
},
{
"epoch": 0.265,
"grad_norm": 2.019179582595825,
"learning_rate": 0.00017579306344971474,
"loss": 2.2955747985839845,
"step": 2650
},
{
"epoch": 0.2675,
"grad_norm": 2.7610855102539062,
"learning_rate": 0.00017525117117145772,
"loss": 2.1901036071777344,
"step": 2675
},
{
"epoch": 0.27,
"grad_norm": 2.6274731159210205,
"learning_rate": 0.00017470413557561099,
"loss": 2.2772340393066406,
"step": 2700
},
{
"epoch": 0.2725,
"grad_norm": 2.032763719558716,
"learning_rate": 0.0001741519940513308,
"loss": 2.396791687011719,
"step": 2725
},
{
"epoch": 0.275,
"grad_norm": 2.050870895385742,
"learning_rate": 0.00017359478433675698,
"loss": 2.3125306701660158,
"step": 2750
},
{
"epoch": 0.2775,
"grad_norm": 1.2312886714935303,
"learning_rate": 0.00017303254451643332,
"loss": 2.144034729003906,
"step": 2775
},
{
"epoch": 0.28,
"grad_norm": 3.1948437690734863,
"learning_rate": 0.0001724653130187047,
"loss": 2.200022735595703,
"step": 2800
},
{
"epoch": 0.2825,
"grad_norm": 1.904383659362793,
"learning_rate": 0.00017189312861309045,
"loss": 2.312091522216797,
"step": 2825
},
{
"epoch": 0.285,
"grad_norm": 2.27195143699646,
"learning_rate": 0.00017131603040763471,
"loss": 2.4758482360839844,
"step": 2850
},
{
"epoch": 0.2875,
"grad_norm": 2.656093120574951,
"learning_rate": 0.0001707340578462332,
"loss": 2.3429974365234374,
"step": 2875
},
{
"epoch": 0.29,
"grad_norm": 1.7262226343154907,
"learning_rate": 0.00017014725070593742,
"loss": 2.27993408203125,
"step": 2900
},
{
"epoch": 0.2925,
"grad_norm": 1.816863775253296,
"learning_rate": 0.00016955564909423596,
"loss": 2.2374249267578126,
"step": 2925
},
{
"epoch": 0.295,
"grad_norm": 2.0505402088165283,
"learning_rate": 0.0001689592934463131,
"loss": 2.355446472167969,
"step": 2950
},
{
"epoch": 0.2975,
"grad_norm": 2.572733163833618,
"learning_rate": 0.0001683582245222852,
"loss": 2.390894012451172,
"step": 2975
},
{
"epoch": 0.3,
"grad_norm": 1.4850176572799683,
"learning_rate": 0.0001677524834044148,
"loss": 2.2053892517089846,
"step": 3000
},
{
"epoch": 0.3,
"eval_cer": 0.11883475298126064,
"eval_loss": 1.3329604864120483,
"eval_runtime": 94.3216,
"eval_samples_per_second": 15.437,
"eval_steps_per_second": 0.488,
"eval_wer": 0.24281508481704753,
"step": 3000
},
{
"epoch": 0.3025,
"grad_norm": 2.223933696746826,
"learning_rate": 0.00016714211149430268,
"loss": 2.1159332275390623,
"step": 3025
},
{
"epoch": 0.305,
"grad_norm": 1.66571044921875,
"learning_rate": 0.00016652715051005808,
"loss": 2.345655822753906,
"step": 3050
},
{
"epoch": 0.3075,
"grad_norm": 2.4676051139831543,
"learning_rate": 0.0001659076424834474,
"loss": 2.394458770751953,
"step": 3075
},
{
"epoch": 0.31,
"grad_norm": 1.780862808227539,
"learning_rate": 0.0001652836297570214,
"loss": 2.2932537841796874,
"step": 3100
},
{
"epoch": 0.3125,
"grad_norm": 2.951003074645996,
"learning_rate": 0.00016465515498122093,
"loss": 2.239581756591797,
"step": 3125
},
{
"epoch": 0.315,
"grad_norm": 1.861158013343811,
"learning_rate": 0.0001640222611114621,
"loss": 2.2416726684570314,
"step": 3150
},
{
"epoch": 0.3175,
"grad_norm": 2.0734827518463135,
"learning_rate": 0.00016338499140520024,
"loss": 2.313903503417969,
"step": 3175
},
{
"epoch": 0.32,
"grad_norm": 2.6787068843841553,
"learning_rate": 0.00016274338941897325,
"loss": 2.296602325439453,
"step": 3200
},
{
"epoch": 0.3225,
"grad_norm": 1.5169554948806763,
"learning_rate": 0.00016209749900542462,
"loss": 2.1584397888183595,
"step": 3225
},
{
"epoch": 0.325,
"grad_norm": 1.8395015001296997,
"learning_rate": 0.00016144736431030613,
"loss": 2.237540283203125,
"step": 3250
},
{
"epoch": 0.3275,
"grad_norm": 1.6821995973587036,
"learning_rate": 0.00016079302976946055,
"loss": 2.3045135498046876,
"step": 3275
},
{
"epoch": 0.33,
"grad_norm": 2.5113303661346436,
"learning_rate": 0.00016013454010578465,
"loss": 2.229774627685547,
"step": 3300
},
{
"epoch": 0.3325,
"grad_norm": 2.1875202655792236,
"learning_rate": 0.00015947194032617213,
"loss": 2.03060302734375,
"step": 3325
},
{
"epoch": 0.335,
"grad_norm": 2.628626585006714,
"learning_rate": 0.00015880527571843792,
"loss": 2.2274468994140624,
"step": 3350
},
{
"epoch": 0.3375,
"grad_norm": 3.26328444480896,
"learning_rate": 0.00015813459184822222,
"loss": 2.2913862609863282,
"step": 3375
},
{
"epoch": 0.34,
"grad_norm": 1.828529953956604,
"learning_rate": 0.00015745993455587676,
"loss": 2.326069183349609,
"step": 3400
},
{
"epoch": 0.3425,
"grad_norm": 1.8822145462036133,
"learning_rate": 0.00015678134995333128,
"loss": 2.4681741333007814,
"step": 3425
},
{
"epoch": 0.345,
"grad_norm": 2.786712169647217,
"learning_rate": 0.00015609888442094194,
"loss": 2.508190002441406,
"step": 3450
},
{
"epoch": 0.3475,
"grad_norm": 2.1335978507995605,
"learning_rate": 0.00015541258460432134,
"loss": 2.429823455810547,
"step": 3475
},
{
"epoch": 0.35,
"grad_norm": 1.7754604816436768,
"learning_rate": 0.00015472249741115031,
"loss": 2.061129913330078,
"step": 3500
},
{
"epoch": 0.35,
"eval_cer": 0.19653151618398637,
"eval_loss": 1.8721370697021484,
"eval_runtime": 97.6571,
"eval_samples_per_second": 14.909,
"eval_steps_per_second": 0.471,
"eval_wer": 0.36520398149446237,
"step": 3500
},
{
"epoch": 0.3525,
"grad_norm": 1.9794024229049683,
"learning_rate": 0.00015402867000797178,
"loss": 2.4051849365234377,
"step": 3525
},
{
"epoch": 0.355,
"grad_norm": 2.1352591514587402,
"learning_rate": 0.00015333114981696717,
"loss": 2.457940673828125,
"step": 3550
},
{
"epoch": 0.3575,
"grad_norm": 3.111924648284912,
"learning_rate": 0.00015262998451271497,
"loss": 2.361605377197266,
"step": 3575
},
{
"epoch": 0.36,
"grad_norm": 2.966064929962158,
"learning_rate": 0.00015192522201893237,
"loss": 2.3615626525878906,
"step": 3600
},
{
"epoch": 0.3625,
"grad_norm": 1.8772096633911133,
"learning_rate": 0.00015121691050519953,
"loss": 2.2799105834960938,
"step": 3625
},
{
"epoch": 0.365,
"grad_norm": 2.3451404571533203,
"learning_rate": 0.00015050509838366764,
"loss": 2.34386962890625,
"step": 3650
},
{
"epoch": 0.3675,
"grad_norm": 2.5135364532470703,
"learning_rate": 0.00014978983430574962,
"loss": 2.3400205993652343,
"step": 3675
},
{
"epoch": 0.37,
"grad_norm": 1.7440122365951538,
"learning_rate": 0.0001490711671587951,
"loss": 2.4299208068847657,
"step": 3700
},
{
"epoch": 0.3725,
"grad_norm": 1.7665159702301025,
"learning_rate": 0.00014834914606274896,
"loss": 2.3621759033203125,
"step": 3725
},
{
"epoch": 0.375,
"grad_norm": 1.7222715616226196,
"learning_rate": 0.0001476238203667939,
"loss": 2.2579191589355467,
"step": 3750
},
{
"epoch": 0.3775,
"grad_norm": 1.6460919380187988,
"learning_rate": 0.00014689523964597792,
"loss": 2.2938653564453126,
"step": 3775
},
{
"epoch": 0.38,
"grad_norm": 1.9907219409942627,
"learning_rate": 0.00014616345369782534,
"loss": 2.246376953125,
"step": 3800
},
{
"epoch": 0.3825,
"grad_norm": 2.8839938640594482,
"learning_rate": 0.00014542851253893373,
"loss": 2.445607147216797,
"step": 3825
},
{
"epoch": 0.385,
"grad_norm": 2.404881000518799,
"learning_rate": 0.000144690466401555,
"loss": 2.2871961975097657,
"step": 3850
},
{
"epoch": 0.3875,
"grad_norm": 2.3075459003448486,
"learning_rate": 0.00014394936573016226,
"loss": 2.408760986328125,
"step": 3875
},
{
"epoch": 0.39,
"grad_norm": 1.6438523530960083,
"learning_rate": 0.000143205261178002,
"loss": 2.3683087158203127,
"step": 3900
},
{
"epoch": 0.3925,
"grad_norm": 5.861391067504883,
"learning_rate": 0.0001424582036036319,
"loss": 2.342762298583984,
"step": 3925
},
{
"epoch": 0.395,
"grad_norm": 1.7755112648010254,
"learning_rate": 0.0001417082440674448,
"loss": 2.2705897521972656,
"step": 3950
},
{
"epoch": 0.3975,
"grad_norm": 1.6583561897277832,
"learning_rate": 0.00014095543382817882,
"loss": 2.2572897338867186,
"step": 3975
},
{
"epoch": 0.4,
"grad_norm": 1.4067355394363403,
"learning_rate": 0.0001401998243394138,
"loss": 2.2651954650878907,
"step": 4000
},
{
"epoch": 0.4,
"eval_cer": 0.10498807495741057,
"eval_loss": 1.2884368896484375,
"eval_runtime": 97.2686,
"eval_samples_per_second": 14.969,
"eval_steps_per_second": 0.473,
"eval_wer": 0.21596803588952754,
"step": 4000
},
{
"epoch": 0.4025,
"grad_norm": 1.605221152305603,
"learning_rate": 0.0001394414672460546,
"loss": 2.4976361083984373,
"step": 4025
},
{
"epoch": 0.405,
"grad_norm": 1.156703233718872,
"learning_rate": 0.00013868041438080112,
"loss": 2.497575225830078,
"step": 4050
},
{
"epoch": 0.4075,
"grad_norm": 1.5397531986236572,
"learning_rate": 0.00013791671776060583,
"loss": 2.265808410644531,
"step": 4075
},
{
"epoch": 0.41,
"grad_norm": 1.9549108743667603,
"learning_rate": 0.0001371504295831183,
"loss": 2.3842532348632814,
"step": 4100
},
{
"epoch": 0.4125,
"grad_norm": 1.9217745065689087,
"learning_rate": 0.00013638160222311746,
"loss": 2.4043014526367186,
"step": 4125
},
{
"epoch": 0.415,
"grad_norm": 2.51631498336792,
"learning_rate": 0.00013561028822893216,
"loss": 2.284119873046875,
"step": 4150
},
{
"epoch": 0.4175,
"grad_norm": 1.2171545028686523,
"learning_rate": 0.0001348365403188493,
"loss": 2.2890667724609375,
"step": 4175
},
{
"epoch": 0.42,
"grad_norm": 2.4048573970794678,
"learning_rate": 0.00013406041137751075,
"loss": 2.3984063720703124,
"step": 4200
},
{
"epoch": 0.4225,
"grad_norm": 1.4632928371429443,
"learning_rate": 0.00013328195445229868,
"loss": 2.229521942138672,
"step": 4225
},
{
"epoch": 0.425,
"grad_norm": 1.730931043624878,
"learning_rate": 0.00013250122274970983,
"loss": 2.254394836425781,
"step": 4250
},
{
"epoch": 0.4275,
"grad_norm": 1.4507620334625244,
"learning_rate": 0.00013171826963171904,
"loss": 2.4484910583496093,
"step": 4275
},
{
"epoch": 0.43,
"grad_norm": 1.3706517219543457,
"learning_rate": 0.00013093314861213187,
"loss": 2.3848532104492186,
"step": 4300
},
{
"epoch": 0.4325,
"grad_norm": 2.392287015914917,
"learning_rate": 0.00013014591335292703,
"loss": 2.4290875244140624,
"step": 4325
},
{
"epoch": 0.435,
"grad_norm": 1.7551754713058472,
"learning_rate": 0.00012935661766058887,
"loss": 2.3814404296875,
"step": 4350
},
{
"epoch": 0.4375,
"grad_norm": 1.7651501893997192,
"learning_rate": 0.00012856531548242943,
"loss": 2.3211224365234373,
"step": 4375
},
{
"epoch": 0.44,
"grad_norm": 1.352349877357483,
"learning_rate": 0.0001277720609029015,
"loss": 2.3048651123046877,
"step": 4400
},
{
"epoch": 0.4425,
"grad_norm": 1.621042251586914,
"learning_rate": 0.0001269769081399018,
"loss": 2.28550537109375,
"step": 4425
},
{
"epoch": 0.445,
"grad_norm": 3.0360352993011475,
"learning_rate": 0.00012617991154106553,
"loss": 2.2011154174804686,
"step": 4450
},
{
"epoch": 0.4475,
"grad_norm": 1.738326072692871,
"learning_rate": 0.0001253811255800515,
"loss": 2.2040435791015627,
"step": 4475
},
{
"epoch": 0.45,
"grad_norm": 1.242429494857788,
"learning_rate": 0.00012458060485281904,
"loss": 2.194516143798828,
"step": 4500
},
{
"epoch": 0.45,
"eval_cer": 0.18675979557069847,
"eval_loss": 2.0404677391052246,
"eval_runtime": 99.6893,
"eval_samples_per_second": 14.605,
"eval_steps_per_second": 0.461,
"eval_wer": 0.34512126734894155,
"step": 4500
},
{
"epoch": 0.4525,
"grad_norm": 2.7530839443206787,
"learning_rate": 0.00012377840407389656,
"loss": 2.2013865661621095,
"step": 4525
},
{
"epoch": 0.455,
"grad_norm": 2.2198078632354736,
"learning_rate": 0.00012297457807264163,
"loss": 2.087595977783203,
"step": 4550
},
{
"epoch": 0.4575,
"grad_norm": 1.2474287748336792,
"learning_rate": 0.0001221691817894937,
"loss": 2.194997100830078,
"step": 4575
},
{
"epoch": 0.46,
"grad_norm": 12.5129976272583,
"learning_rate": 0.00012136227027221887,
"loss": 2.182381286621094,
"step": 4600
},
{
"epoch": 0.4625,
"grad_norm": 2.9374215602874756,
"learning_rate": 0.00012055389867214753,
"loss": 2.1406234741210937,
"step": 4625
},
{
"epoch": 0.465,
"grad_norm": 1.6920939683914185,
"learning_rate": 0.00011974412224040467,
"loss": 2.18834228515625,
"step": 4650
},
{
"epoch": 0.4675,
"grad_norm": 2.295588493347168,
"learning_rate": 0.00011893299632413377,
"loss": 2.2244253540039063,
"step": 4675
},
{
"epoch": 0.47,
"grad_norm": 1.572840929031372,
"learning_rate": 0.00011812057636271374,
"loss": 2.3844418334960937,
"step": 4700
},
{
"epoch": 0.4725,
"grad_norm": 2.083305597305298,
"learning_rate": 0.00011730691788396979,
"loss": 2.2655848693847656,
"step": 4725
},
{
"epoch": 0.475,
"grad_norm": 1.814949631690979,
"learning_rate": 0.00011649207650037808,
"loss": 2.308854217529297,
"step": 4750
},
{
"epoch": 0.4775,
"grad_norm": 3.0101680755615234,
"learning_rate": 0.00011567610790526484,
"loss": 2.4060545349121094,
"step": 4775
},
{
"epoch": 0.48,
"grad_norm": 1.7078293561935425,
"learning_rate": 0.0001148590678689996,
"loss": 2.3611572265625,
"step": 4800
},
{
"epoch": 0.4825,
"grad_norm": 1.662838101387024,
"learning_rate": 0.00011404101223518356,
"loss": 2.110723419189453,
"step": 4825
},
{
"epoch": 0.485,
"grad_norm": 1.8207811117172241,
"learning_rate": 0.00011322199691683259,
"loss": 2.248436279296875,
"step": 4850
},
{
"epoch": 0.4875,
"grad_norm": 2.421273708343506,
"learning_rate": 0.0001124020778925558,
"loss": 2.1612274169921877,
"step": 4875
},
{
"epoch": 0.49,
"grad_norm": 1.8812896013259888,
"learning_rate": 0.00011158131120272935,
"loss": 2.2600140380859375,
"step": 4900
},
{
"epoch": 0.4925,
"grad_norm": 2.3663277626037598,
"learning_rate": 0.00011075975294566618,
"loss": 2.5313677978515625,
"step": 4925
},
{
"epoch": 0.495,
"grad_norm": 1.6257905960083008,
"learning_rate": 0.00010993745927378192,
"loss": 2.264820251464844,
"step": 4950
},
{
"epoch": 0.4975,
"grad_norm": 1.4130210876464844,
"learning_rate": 0.0001091144863897567,
"loss": 2.407576141357422,
"step": 4975
},
{
"epoch": 0.5,
"grad_norm": 1.7429734468460083,
"learning_rate": 0.00010829089054269397,
"loss": 2.4363131713867188,
"step": 5000
},
{
"epoch": 0.5,
"eval_cer": 0.13365587734241907,
"eval_loss": 1.4915677309036255,
"eval_runtime": 97.2843,
"eval_samples_per_second": 14.966,
"eval_steps_per_second": 0.473,
"eval_wer": 0.27344735735314735,
"step": 5000
},
{
"epoch": 0.5025,
"grad_norm": 2.2105283737182617,
"learning_rate": 0.00010746672802427584,
"loss": 2.6081527709960937,
"step": 5025
},
{
"epoch": 0.505,
"grad_norm": 2.152991771697998,
"learning_rate": 0.00010664205516491567,
"loss": 2.3156581115722656,
"step": 5050
},
{
"epoch": 0.5075,
"grad_norm": 1.6704784631729126,
"learning_rate": 0.00010581692832990795,
"loss": 2.2569061279296876,
"step": 5075
},
{
"epoch": 0.51,
"grad_norm": 1.809422492980957,
"learning_rate": 0.0001049914039155758,
"loss": 2.292207946777344,
"step": 5100
},
{
"epoch": 0.5125,
"grad_norm": 2.8532326221466064,
"learning_rate": 0.00010416553834541636,
"loss": 2.262637939453125,
"step": 5125
},
{
"epoch": 0.515,
"grad_norm": 1.7250112295150757,
"learning_rate": 0.00010333938806624428,
"loss": 2.311736755371094,
"step": 5150
},
{
"epoch": 0.5175,
"grad_norm": 1.786499261856079,
"learning_rate": 0.00010251300954433376,
"loss": 2.295980987548828,
"step": 5175
},
{
"epoch": 0.52,
"grad_norm": 1.7907332181930542,
"learning_rate": 0.00010168645926155901,
"loss": 2.1306143188476563,
"step": 5200
},
{
"epoch": 0.5225,
"grad_norm": 1.8260570764541626,
"learning_rate": 0.00010085979371153397,
"loss": 2.4332316589355467,
"step": 5225
},
{
"epoch": 0.525,
"grad_norm": 3.8928639888763428,
"learning_rate": 0.00010003306939575083,
"loss": 2.1371470642089845,
"step": 5250
},
{
"epoch": 0.5275,
"grad_norm": 1.4477559328079224,
"learning_rate": 9.920634281971844e-05,
"loss": 2.2873826599121094,
"step": 5275
},
{
"epoch": 0.53,
"grad_norm": 1.9820969104766846,
"learning_rate": 9.837967048910006e-05,
"loss": 2.370744171142578,
"step": 5300
},
{
"epoch": 0.5325,
"grad_norm": 1.9542760848999023,
"learning_rate": 9.755310890585138e-05,
"loss": 2.317779998779297,
"step": 5325
},
{
"epoch": 0.535,
"grad_norm": 1.4388443231582642,
"learning_rate": 9.672671456435866e-05,
"loss": 2.232802734375,
"step": 5350
},
{
"epoch": 0.5375,
"grad_norm": 1.827918529510498,
"learning_rate": 9.590054394757745e-05,
"loss": 2.215179138183594,
"step": 5375
},
{
"epoch": 0.54,
"grad_norm": 1.4861502647399902,
"learning_rate": 9.507465352317186e-05,
"loss": 2.2451414489746093,
"step": 5400
},
{
"epoch": 0.5425,
"grad_norm": 1.4316998720169067,
"learning_rate": 9.424909973965539e-05,
"loss": 2.188051910400391,
"step": 5425
},
{
"epoch": 0.545,
"grad_norm": 1.6524759531021118,
"learning_rate": 9.342393902253252e-05,
"loss": 2.3306240844726562,
"step": 5450
},
{
"epoch": 0.5475,
"grad_norm": 1.512019157409668,
"learning_rate": 9.259922777044213e-05,
"loss": 2.300531921386719,
"step": 5475
},
{
"epoch": 0.55,
"grad_norm": 1.4672224521636963,
"learning_rate": 9.177502235130284e-05,
"loss": 2.119959411621094,
"step": 5500
},
{
"epoch": 0.55,
"eval_cer": 0.12580579216354343,
"eval_loss": 1.4867600202560425,
"eval_runtime": 107.689,
"eval_samples_per_second": 13.52,
"eval_steps_per_second": 0.427,
"eval_wer": 0.2515070797700827,
"step": 5500
},
{
"epoch": 0.5525,
"grad_norm": 3.694199323654175,
"learning_rate": 9.095137909846017e-05,
"loss": 2.093580780029297,
"step": 5525
},
{
"epoch": 0.555,
"grad_norm": 1.6778661012649536,
"learning_rate": 9.012835430683642e-05,
"loss": 2.211465148925781,
"step": 5550
},
{
"epoch": 0.5575,
"grad_norm": 1.4538211822509766,
"learning_rate": 8.93060042290828e-05,
"loss": 2.067851867675781,
"step": 5575
},
{
"epoch": 0.56,
"grad_norm": 1.399057388305664,
"learning_rate": 8.848438507173474e-05,
"loss": 2.2560064697265627,
"step": 5600
},
{
"epoch": 0.5625,
"grad_norm": 1.7285677194595337,
"learning_rate": 8.76635529913703e-05,
"loss": 2.305147705078125,
"step": 5625
},
{
"epoch": 0.565,
"grad_norm": 1.3977117538452148,
"learning_rate": 8.684356409077176e-05,
"loss": 2.1981732177734377,
"step": 5650
},
{
"epoch": 0.5675,
"grad_norm": 1.377535343170166,
"learning_rate": 8.602447441509128e-05,
"loss": 2.1758804321289062,
"step": 5675
},
{
"epoch": 0.57,
"grad_norm": 1.4587531089782715,
"learning_rate": 8.520633994802014e-05,
"loss": 2.157071533203125,
"step": 5700
},
{
"epoch": 0.5725,
"grad_norm": 1.4554935693740845,
"learning_rate": 8.438921660796246e-05,
"loss": 1.999080047607422,
"step": 5725
},
{
"epoch": 0.575,
"grad_norm": 2.2711434364318848,
"learning_rate": 8.357316024421302e-05,
"loss": 2.1546482849121094,
"step": 5750
},
{
"epoch": 0.5775,
"grad_norm": 1.8232475519180298,
"learning_rate": 8.27582266331403e-05,
"loss": 2.173642272949219,
"step": 5775
},
{
"epoch": 0.58,
"grad_norm": 1.3171988725662231,
"learning_rate": 8.194447147437411e-05,
"loss": 2.3818399047851564,
"step": 5800
},
{
"epoch": 0.5825,
"grad_norm": 1.943204402923584,
"learning_rate": 8.11319503869986e-05,
"loss": 2.1704754638671875,
"step": 5825
},
{
"epoch": 0.585,
"grad_norm": 1.4433194398880005,
"learning_rate": 8.032071890575078e-05,
"loss": 2.342074432373047,
"step": 5850
},
{
"epoch": 0.5875,
"grad_norm": 1.7247374057769775,
"learning_rate": 7.95108324772248e-05,
"loss": 2.0461408996582033,
"step": 5875
},
{
"epoch": 0.59,
"grad_norm": 1.8924514055252075,
"learning_rate": 7.870234645608221e-05,
"loss": 2.158209228515625,
"step": 5900
},
{
"epoch": 0.5925,
"grad_norm": 1.7629958391189575,
"learning_rate": 7.789531610126864e-05,
"loss": 2.1048355102539062,
"step": 5925
},
{
"epoch": 0.595,
"grad_norm": 1.9589917659759521,
"learning_rate": 7.708979657223681e-05,
"loss": 2.182529296875,
"step": 5950
},
{
"epoch": 0.5975,
"grad_norm": 1.8531277179718018,
"learning_rate": 7.628584292517651e-05,
"loss": 2.281885070800781,
"step": 5975
},
{
"epoch": 0.6,
"grad_norm": 1.4821549654006958,
"learning_rate": 7.548351010925159e-05,
"loss": 2.2227223205566404,
"step": 6000
},
{
"epoch": 0.6,
"eval_cer": 0.11651788756388416,
"eval_loss": 1.365559458732605,
"eval_runtime": 98.5438,
"eval_samples_per_second": 14.775,
"eval_steps_per_second": 0.467,
"eval_wer": 0.23790831347259217,
"step": 6000
},
{
"epoch": 0.6025,
"grad_norm": 5.139744281768799,
"learning_rate": 7.468285296284425e-05,
"loss": 2.2776620483398435,
"step": 6025
},
{
"epoch": 0.605,
"grad_norm": 1.4555790424346924,
"learning_rate": 7.38839262098069e-05,
"loss": 2.350541076660156,
"step": 6050
},
{
"epoch": 0.6075,
"grad_norm": 1.830809235572815,
"learning_rate": 7.308678445572183e-05,
"loss": 2.420984191894531,
"step": 6075
},
{
"epoch": 0.61,
"grad_norm": 1.5413800477981567,
"learning_rate": 7.229148218416905e-05,
"loss": 2.0628668212890626,
"step": 6100
},
{
"epoch": 0.6125,
"grad_norm": 1.5212156772613525,
"learning_rate": 7.149807375300239e-05,
"loss": 2.1369078063964846,
"step": 6125
},
{
"epoch": 0.615,
"grad_norm": 1.639372706413269,
"learning_rate": 7.070661339063421e-05,
"loss": 2.1265322875976564,
"step": 6150
},
{
"epoch": 0.6175,
"grad_norm": 1.3873976469039917,
"learning_rate": 6.991715519232893e-05,
"loss": 2.2606741333007814,
"step": 6175
},
{
"epoch": 0.62,
"grad_norm": 2.0001771450042725,
"learning_rate": 6.912975311650573e-05,
"loss": 2.0394573974609376,
"step": 6200
},
{
"epoch": 0.6225,
"grad_norm": 1.5461382865905762,
"learning_rate": 6.834446098105055e-05,
"loss": 2.025839080810547,
"step": 6225
},
{
"epoch": 0.625,
"grad_norm": 1.2012392282485962,
"learning_rate": 6.75613324596377e-05,
"loss": 2.127050323486328,
"step": 6250
},
{
"epoch": 0.6275,
"grad_norm": 1.4980227947235107,
"learning_rate": 6.678042107806136e-05,
"loss": 2.1705177307128904,
"step": 6275
},
{
"epoch": 0.63,
"grad_norm": 1.7649891376495361,
"learning_rate": 6.600178021057713e-05,
"loss": 2.1629388427734373,
"step": 6300
},
{
"epoch": 0.6325,
"grad_norm": 1.4063870906829834,
"learning_rate": 6.522546307625399e-05,
"loss": 2.252629852294922,
"step": 6325
},
{
"epoch": 0.635,
"grad_norm": 1.8891024589538574,
"learning_rate": 6.445152273533687e-05,
"loss": 2.310922088623047,
"step": 6350
},
{
"epoch": 0.6375,
"grad_norm": 1.461951494216919,
"learning_rate": 6.368001208561998e-05,
"loss": 2.2186619567871095,
"step": 6375
},
{
"epoch": 0.64,
"grad_norm": 2.2162909507751465,
"learning_rate": 6.291098385883146e-05,
"loss": 2.2705178833007813,
"step": 6400
},
{
"epoch": 0.6425,
"grad_norm": 1.6403982639312744,
"learning_rate": 6.214449061702898e-05,
"loss": 2.287322235107422,
"step": 6425
},
{
"epoch": 0.645,
"grad_norm": 1.4998693466186523,
"learning_rate": 6.13805847490075e-05,
"loss": 2.2243331909179687,
"step": 6450
},
{
"epoch": 0.6475,
"grad_norm": 1.5675662755966187,
"learning_rate": 6.061931846671833e-05,
"loss": 2.196006011962891,
"step": 6475
},
{
"epoch": 0.65,
"grad_norm": 1.4675372838974,
"learning_rate": 5.986074380170068e-05,
"loss": 2.098954162597656,
"step": 6500
},
{
"epoch": 0.65,
"eval_cer": 0.12910391822827938,
"eval_loss": 1.4575581550598145,
"eval_runtime": 97.7619,
"eval_samples_per_second": 14.893,
"eval_steps_per_second": 0.471,
"eval_wer": 0.2552222066451703,
"step": 6500
},
{
"epoch": 0.6525,
"grad_norm": 1.0977084636688232,
"learning_rate": 5.910491260152522e-05,
"loss": 2.0651014709472655,
"step": 6525
},
{
"epoch": 0.655,
"grad_norm": 1.7557512521743774,
"learning_rate": 5.835187652625047e-05,
"loss": 2.1543315124511717,
"step": 6550
},
{
"epoch": 0.6575,
"grad_norm": 3.4759411811828613,
"learning_rate": 5.7601687044891925e-05,
"loss": 2.154296569824219,
"step": 6575
},
{
"epoch": 0.66,
"grad_norm": 1.4857603311538696,
"learning_rate": 5.6854395431904094e-05,
"loss": 2.239384765625,
"step": 6600
},
{
"epoch": 0.6625,
"grad_norm": 1.2919102907180786,
"learning_rate": 5.611005276367605e-05,
"loss": 2.1780934143066406,
"step": 6625
},
{
"epoch": 0.665,
"grad_norm": 1.4281810522079468,
"learning_rate": 5.536870991504044e-05,
"loss": 2.2144403076171875,
"step": 6650
},
{
"epoch": 0.6675,
"grad_norm": 1.7376158237457275,
"learning_rate": 5.463041755579619e-05,
"loss": 2.1022102355957033,
"step": 6675
},
{
"epoch": 0.67,
"grad_norm": 2.0145184993743896,
"learning_rate": 5.389522614724536e-05,
"loss": 2.2605833435058593,
"step": 6700
},
{
"epoch": 0.6725,
"grad_norm": 2.8310012817382812,
"learning_rate": 5.316318593874415e-05,
"loss": 2.3267457580566404,
"step": 6725
},
{
"epoch": 0.675,
"grad_norm": 2.145875930786133,
"learning_rate": 5.2434346964268344e-05,
"loss": 2.6324166870117187,
"step": 6750
},
{
"epoch": 0.6775,
"grad_norm": 1.6132903099060059,
"learning_rate": 5.170875903899375e-05,
"loss": 2.091797180175781,
"step": 6775
},
{
"epoch": 0.68,
"grad_norm": 1.7022608518600464,
"learning_rate": 5.098647175589118e-05,
"loss": 2.0755772399902344,
"step": 6800
},
{
"epoch": 0.6825,
"grad_norm": 1.4856054782867432,
"learning_rate": 5.026753448233703e-05,
"loss": 2.1015928649902342,
"step": 6825
},
{
"epoch": 0.685,
"grad_norm": 1.8448196649551392,
"learning_rate": 4.9551996356738915e-05,
"loss": 2.1693138122558593,
"step": 6850
},
{
"epoch": 0.6875,
"grad_norm": 1.4995580911636353,
"learning_rate": 4.883990628517725e-05,
"loss": 2.2492982482910158,
"step": 6875
},
{
"epoch": 0.69,
"grad_norm": 1.3703680038452148,
"learning_rate": 4.813131293806253e-05,
"loss": 2.2033477783203126,
"step": 6900
},
{
"epoch": 0.6925,
"grad_norm": 1.49030339717865,
"learning_rate": 4.7426264746808755e-05,
"loss": 2.1979034423828123,
"step": 6925
},
{
"epoch": 0.695,
"grad_norm": 1.582387924194336,
"learning_rate": 4.6724809900523256e-05,
"loss": 2.2166607666015623,
"step": 6950
},
{
"epoch": 0.6975,
"grad_norm": 1.0378532409667969,
"learning_rate": 4.6026996342713e-05,
"loss": 2.1302786254882813,
"step": 6975
},
{
"epoch": 0.7,
"grad_norm": 1.779466986656189,
"learning_rate": 4.533287176800772e-05,
"loss": 2.1397467041015625,
"step": 7000
},
{
"epoch": 0.7,
"eval_cer": 0.14284838160136287,
"eval_loss": 1.5793243646621704,
"eval_runtime": 100.9249,
"eval_samples_per_second": 14.427,
"eval_steps_per_second": 0.456,
"eval_wer": 0.27923033786625545,
"step": 7000
},
{
"epoch": 0.7025,
"grad_norm": 1.4482125043869019,
"learning_rate": 4.464248361890006e-05,
"loss": 2.3440916442871096,
"step": 7025
},
{
"epoch": 0.705,
"grad_norm": 1.4733315706253052,
"learning_rate": 4.3955879082502926e-05,
"loss": 2.148384857177734,
"step": 7050
},
{
"epoch": 0.7075,
"grad_norm": 1.8669700622558594,
"learning_rate": 4.327310508732437e-05,
"loss": 2.0429644775390625,
"step": 7075
},
{
"epoch": 0.71,
"grad_norm": 2.0535337924957275,
"learning_rate": 4.2594208300059946e-05,
"loss": 2.117684173583984,
"step": 7100
},
{
"epoch": 0.7125,
"grad_norm": 1.4492615461349487,
"learning_rate": 4.191923512240327e-05,
"loss": 2.1872657775878905,
"step": 7125
},
{
"epoch": 0.715,
"grad_norm": 1.1772300004959106,
"learning_rate": 4.1248231687874414e-05,
"loss": 2.0845387268066404,
"step": 7150
},
{
"epoch": 0.7175,
"grad_norm": 1.9866479635238647,
"learning_rate": 4.058124385866685e-05,
"loss": 2.17061279296875,
"step": 7175
},
{
"epoch": 0.72,
"grad_norm": 1.3913525342941284,
"learning_rate": 3.991831722251268e-05,
"loss": 2.2543954467773437,
"step": 7200
},
{
"epoch": 0.7225,
"grad_norm": 2.026390314102173,
"learning_rate": 3.925949708956689e-05,
"loss": 2.156564483642578,
"step": 7225
},
{
"epoch": 0.725,
"grad_norm": 2.187021017074585,
"learning_rate": 3.860482848931042e-05,
"loss": 2.227943115234375,
"step": 7250
},
{
"epoch": 0.7275,
"grad_norm": 1.6608995199203491,
"learning_rate": 3.7954356167472485e-05,
"loss": 2.1599061584472654,
"step": 7275
},
{
"epoch": 0.73,
"grad_norm": 1.626770257949829,
"learning_rate": 3.730812458297222e-05,
"loss": 2.021209411621094,
"step": 7300
},
{
"epoch": 0.7325,
"grad_norm": 1.2525973320007324,
"learning_rate": 3.6666177904879994e-05,
"loss": 2.138314514160156,
"step": 7325
},
{
"epoch": 0.735,
"grad_norm": 1.5164086818695068,
"learning_rate": 3.6028560009398535e-05,
"loss": 2.248671417236328,
"step": 7350
},
{
"epoch": 0.7375,
"grad_norm": 1.4386738538742065,
"learning_rate": 3.5395314476864026e-05,
"loss": 2.1806785583496096,
"step": 7375
},
{
"epoch": 0.74,
"grad_norm": 1.779341220855713,
"learning_rate": 3.4766484588767434e-05,
"loss": 2.100335693359375,
"step": 7400
},
{
"epoch": 0.7425,
"grad_norm": 1.8158776760101318,
"learning_rate": 3.4142113324796344e-05,
"loss": 2.1199974060058593,
"step": 7425
},
{
"epoch": 0.745,
"grad_norm": 1.8703250885009766,
"learning_rate": 3.3522243359897184e-05,
"loss": 2.220720672607422,
"step": 7450
},
{
"epoch": 0.7475,
"grad_norm": 1.5516717433929443,
"learning_rate": 3.290691706135871e-05,
"loss": 2.0985394287109376,
"step": 7475
},
{
"epoch": 0.75,
"grad_norm": 2.0880203247070312,
"learning_rate": 3.229617648591604e-05,
"loss": 2.174041290283203,
"step": 7500
},
{
"epoch": 0.75,
"eval_cer": 0.11913458262350937,
"eval_loss": 1.444368600845337,
"eval_runtime": 94.4985,
"eval_samples_per_second": 15.408,
"eval_steps_per_second": 0.487,
"eval_wer": 0.2379784102060844,
"step": 7500
},
{
"epoch": 0.7525,
"grad_norm": 1.6245286464691162,
"learning_rate": 3.1690063376876246e-05,
"loss": 2.077626190185547,
"step": 7525
},
{
"epoch": 0.755,
"grad_norm": 1.5519412755966187,
"learning_rate": 3.108861916126518e-05,
"loss": 2.1642431640625,
"step": 7550
},
{
"epoch": 0.7575,
"grad_norm": 1.6812665462493896,
"learning_rate": 3.0491884946996054e-05,
"loss": 2.266511993408203,
"step": 7575
},
{
"epoch": 0.76,
"grad_norm": 1.6865683794021606,
"learning_rate": 2.989990152005976e-05,
"loss": 2.032673645019531,
"step": 7600
},
{
"epoch": 0.7625,
"grad_norm": 1.674428105354309,
"learning_rate": 2.9312709341737153e-05,
"loss": 2.2226411437988283,
"step": 7625
},
{
"epoch": 0.765,
"grad_norm": 1.8106178045272827,
"learning_rate": 2.8730348545833618e-05,
"loss": 2.046322784423828,
"step": 7650
},
{
"epoch": 0.7675,
"grad_norm": 1.2184237241744995,
"learning_rate": 2.8152858935936e-05,
"loss": 2.101376953125,
"step": 7675
},
{
"epoch": 0.77,
"grad_norm": 1.2026764154434204,
"learning_rate": 2.7580279982692013e-05,
"loss": 2.0226611328125,
"step": 7700
},
{
"epoch": 0.7725,
"grad_norm": 1.4784437417984009,
"learning_rate": 2.701265082111253e-05,
"loss": 2.14648193359375,
"step": 7725
},
{
"epoch": 0.775,
"grad_norm": 1.3903934955596924,
"learning_rate": 2.6450010247896728e-05,
"loss": 2.024711151123047,
"step": 7750
},
{
"epoch": 0.7775,
"grad_norm": 1.257865071296692,
"learning_rate": 2.589239671878041e-05,
"loss": 2.2576043701171873,
"step": 7775
},
{
"epoch": 0.78,
"grad_norm": 1.4572250843048096,
"learning_rate": 2.533984834590758e-05,
"loss": 2.22150146484375,
"step": 7800
},
{
"epoch": 0.7825,
"grad_norm": 1.6356014013290405,
"learning_rate": 2.4792402895225553e-05,
"loss": 2.189641571044922,
"step": 7825
},
{
"epoch": 0.785,
"grad_norm": 1.3937262296676636,
"learning_rate": 2.4250097783903692e-05,
"loss": 1.9916804504394532,
"step": 7850
},
{
"epoch": 0.7875,
"grad_norm": 1.893620252609253,
"learning_rate": 2.3712970077775964e-05,
"loss": 2.1063442993164063,
"step": 7875
},
{
"epoch": 0.79,
"grad_norm": 1.7967338562011719,
"learning_rate": 2.3181056488807607e-05,
"loss": 2.2335971069335936,
"step": 7900
},
{
"epoch": 0.7925,
"grad_norm": 2.007983684539795,
"learning_rate": 2.2654393372585848e-05,
"loss": 2.112566375732422,
"step": 7925
},
{
"epoch": 0.795,
"grad_norm": 1.513131856918335,
"learning_rate": 2.21330167258351e-05,
"loss": 2.16599853515625,
"step": 7950
},
{
"epoch": 0.7975,
"grad_norm": 1.498331069946289,
"learning_rate": 2.161696218395658e-05,
"loss": 2.137431640625,
"step": 7975
},
{
"epoch": 0.8,
"grad_norm": 1.2613261938095093,
"learning_rate": 2.1106265018592752e-05,
"loss": 2.34350830078125,
"step": 8000
},
{
"epoch": 0.8,
"eval_cer": 0.1230664395229983,
"eval_loss": 1.4125823974609375,
"eval_runtime": 97.7133,
"eval_samples_per_second": 14.901,
"eval_steps_per_second": 0.471,
"eval_wer": 0.24351605215196973,
"step": 8000
},
{
"epoch": 0.8025,
"grad_norm": 2.232102870941162,
"learning_rate": 2.0600960135216462e-05,
"loss": 2.2054771423339843,
"step": 8025
},
{
"epoch": 0.805,
"grad_norm": 1.2436963319778442,
"learning_rate": 2.010108207074527e-05,
"loss": 2.0917733764648436,
"step": 8050
},
{
"epoch": 0.8075,
"grad_norm": 1.5534099340438843,
"learning_rate": 1.960666499118089e-05,
"loss": 2.129667053222656,
"step": 8075
},
{
"epoch": 0.81,
"grad_norm": 1.6899291276931763,
"learning_rate": 1.911774268927394e-05,
"loss": 2.2986248779296874,
"step": 8100
},
{
"epoch": 0.8125,
"grad_norm": 2.3437321186065674,
"learning_rate": 1.863434858221429e-05,
"loss": 2.099478912353516,
"step": 8125
},
{
"epoch": 0.815,
"grad_norm": 1.8261597156524658,
"learning_rate": 1.8156515709347033e-05,
"loss": 2.1615660095214846,
"step": 8150
},
{
"epoch": 0.8175,
"grad_norm": 1.6776697635650635,
"learning_rate": 1.7684276729914305e-05,
"loss": 2.229272766113281,
"step": 8175
},
{
"epoch": 0.82,
"grad_norm": 1.2899510860443115,
"learning_rate": 1.7217663920823068e-05,
"loss": 2.0697711181640623,
"step": 8200
},
{
"epoch": 0.8225,
"grad_norm": 1.627907395362854,
"learning_rate": 1.6756709174438978e-05,
"loss": 1.9809979248046874,
"step": 8225
},
{
"epoch": 0.825,
"grad_norm": 1.6771968603134155,
"learning_rate": 1.6301443996406662e-05,
"loss": 1.786422882080078,
"step": 8250
},
{
"epoch": 0.8275,
"grad_norm": 1.8237980604171753,
"learning_rate": 1.585189950349627e-05,
"loss": 2.0105300903320313,
"step": 8275
},
{
"epoch": 0.83,
"grad_norm": 1.6596792936325073,
"learning_rate": 1.5408106421476753e-05,
"loss": 1.8981912231445313,
"step": 8300
},
{
"epoch": 0.8325,
"grad_norm": 1.3936231136322021,
"learning_rate": 1.4970095083015757e-05,
"loss": 2.0365556335449218,
"step": 8325
},
{
"epoch": 0.835,
"grad_norm": 1.6055278778076172,
"learning_rate": 1.4537895425606407e-05,
"loss": 2.1483555603027344,
"step": 8350
},
{
"epoch": 0.8375,
"grad_norm": 1.1807600259780884,
"learning_rate": 1.4111536989521213e-05,
"loss": 1.9491183471679687,
"step": 8375
},
{
"epoch": 0.84,
"grad_norm": 1.5801160335540771,
"learning_rate": 1.3691048915792893e-05,
"loss": 1.9624462890625,
"step": 8400
},
{
"epoch": 0.8425,
"grad_norm": 1.202498435974121,
"learning_rate": 1.3276459944222785e-05,
"loss": 2.2168756103515626,
"step": 8425
},
{
"epoch": 0.845,
"grad_norm": 1.7413278818130493,
"learning_rate": 1.286779841141631e-05,
"loss": 2.16740234375,
"step": 8450
},
{
"epoch": 0.8475,
"grad_norm": 2.2603840827941895,
"learning_rate": 1.2465092248846422e-05,
"loss": 2.189974060058594,
"step": 8475
},
{
"epoch": 0.85,
"grad_norm": 1.7048544883728027,
"learning_rate": 1.206836898094439e-05,
"loss": 2.057767333984375,
"step": 8500
},
{
"epoch": 0.85,
"eval_cer": 0.11645655877342419,
"eval_loss": 1.3806432485580444,
"eval_runtime": 97.8639,
"eval_samples_per_second": 14.878,
"eval_steps_per_second": 0.47,
"eval_wer": 0.2347189120986962,
"step": 8500
},
{
"epoch": 0.8525,
"grad_norm": 1.520108699798584,
"learning_rate": 1.1677655723218594e-05,
"loss": 2.138619232177734,
"step": 8525
},
{
"epoch": 0.855,
"grad_norm": 1.469742774963379,
"learning_rate": 1.1292979180401209e-05,
"loss": 2.1907090759277343,
"step": 8550
},
{
"epoch": 0.8575,
"grad_norm": 1.6531875133514404,
"learning_rate": 1.0914365644622926e-05,
"loss": 2.1050286865234376,
"step": 8575
},
{
"epoch": 0.86,
"grad_norm": 1.6312158107757568,
"learning_rate": 1.0541840993616004e-05,
"loss": 2.0515817260742186,
"step": 8600
},
{
"epoch": 0.8625,
"grad_norm": 1.8661822080612183,
"learning_rate": 1.0175430688945486e-05,
"loss": 2.315790557861328,
"step": 8625
},
{
"epoch": 0.865,
"grad_norm": 2.089953660964966,
"learning_rate": 9.815159774268978e-06,
"loss": 2.402613525390625,
"step": 8650
},
{
"epoch": 0.8675,
"grad_norm": 1.5258253812789917,
"learning_rate": 9.461052873624942e-06,
"loss": 1.9790252685546874,
"step": 8675
},
{
"epoch": 0.87,
"grad_norm": 1.4712804555892944,
"learning_rate": 9.11313418974965e-06,
"loss": 2.132662353515625,
"step": 8700
},
{
"epoch": 0.8725,
"grad_norm": 1.8603571653366089,
"learning_rate": 8.771427502422979e-06,
"loss": 2.027366943359375,
"step": 8725
},
{
"epoch": 0.875,
"grad_norm": 2.1210811138153076,
"learning_rate": 8.435956166843117e-06,
"loss": 2.066180877685547,
"step": 8750
},
{
"epoch": 0.8775,
"grad_norm": 1.4630470275878906,
"learning_rate": 8.106743112030223e-06,
"loss": 2.0400991821289063,
"step": 8775
},
{
"epoch": 0.88,
"grad_norm": 1.7319868803024292,
"learning_rate": 7.783810839259286e-06,
"loss": 2.1061160278320314,
"step": 8800
},
{
"epoch": 0.8825,
"grad_norm": 1.5619069337844849,
"learning_rate": 7.467181420522173e-06,
"loss": 2.1499870300292967,
"step": 8825
},
{
"epoch": 0.885,
"grad_norm": 1.473605990409851,
"learning_rate": 7.156876497019072e-06,
"loss": 2.0396578979492186,
"step": 8850
},
{
"epoch": 0.8875,
"grad_norm": 1.5723377466201782,
"learning_rate": 6.852917277679305e-06,
"loss": 2.095478973388672,
"step": 8875
},
{
"epoch": 0.89,
"grad_norm": 1.7452499866485596,
"learning_rate": 6.555324537711749e-06,
"loss": 2.088753356933594,
"step": 8900
},
{
"epoch": 0.8925,
"grad_norm": 1.4047157764434814,
"learning_rate": 6.264118617184878e-06,
"loss": 2.006247253417969,
"step": 8925
},
{
"epoch": 0.895,
"grad_norm": 1.5385630130767822,
"learning_rate": 5.979319419636531e-06,
"loss": 2.0545005798339844,
"step": 8950
},
{
"epoch": 0.8975,
"grad_norm": 1.3976651430130005,
"learning_rate": 5.700946410713548e-06,
"loss": 2.0425811767578126,
"step": 8975
},
{
"epoch": 0.9,
"grad_norm": 1.7689292430877686,
"learning_rate": 5.4290186168413195e-06,
"loss": 2.113001251220703,
"step": 9000
},
{
"epoch": 0.9,
"eval_cer": 0.12256899488926747,
"eval_loss": 1.428444504737854,
"eval_runtime": 99.6669,
"eval_samples_per_second": 14.609,
"eval_steps_per_second": 0.462,
"eval_wer": 0.2449179868218141,
"step": 9000
},
{
"epoch": 0.9025,
"grad_norm": 1.8464909791946411,
"learning_rate": 5.163554623923339e-06,
"loss": 2.3079527282714842,
"step": 9025
},
{
"epoch": 0.905,
"grad_norm": 1.3554507493972778,
"learning_rate": 4.904572576070898e-06,
"loss": 1.9901699829101562,
"step": 9050
},
{
"epoch": 0.9075,
"grad_norm": 2.5160086154937744,
"learning_rate": 4.652090174362933e-06,
"loss": 2.355846405029297,
"step": 9075
},
{
"epoch": 0.91,
"grad_norm": 1.3784635066986084,
"learning_rate": 4.406124675636236e-06,
"loss": 1.9769573974609376,
"step": 9100
},
{
"epoch": 0.9125,
"grad_norm": 1.8741276264190674,
"learning_rate": 4.166692891305901e-06,
"loss": 2.159720916748047,
"step": 9125
},
{
"epoch": 0.915,
"grad_norm": 1.5177477598190308,
"learning_rate": 3.933811186216341e-06,
"loss": 2.190943145751953,
"step": 9150
},
{
"epoch": 0.9175,
"grad_norm": 1.6856800317764282,
"learning_rate": 3.70749547752276e-06,
"loss": 1.8975885009765625,
"step": 9175
},
{
"epoch": 0.92,
"grad_norm": 1.606224775314331,
"learning_rate": 3.487761233603204e-06,
"loss": 2.0187437438964846,
"step": 9200
},
{
"epoch": 0.9225,
"grad_norm": 1.8462681770324707,
"learning_rate": 3.2746234730013814e-06,
"loss": 2.093716278076172,
"step": 9225
},
{
"epoch": 0.925,
"grad_norm": 1.1840476989746094,
"learning_rate": 3.0680967634000855e-06,
"loss": 2.1287353515625,
"step": 9250
},
{
"epoch": 0.9275,
"grad_norm": 1.4410308599472046,
"learning_rate": 2.8681952206256024e-06,
"loss": 2.0268960571289063,
"step": 9275
},
{
"epoch": 0.93,
"grad_norm": 2.162745475769043,
"learning_rate": 2.6749325076828147e-06,
"loss": 2.032665100097656,
"step": 9300
},
{
"epoch": 0.9325,
"grad_norm": 1.4856213331222534,
"learning_rate": 2.488321833821461e-06,
"loss": 2.0829930114746094,
"step": 9325
},
{
"epoch": 0.935,
"grad_norm": 1.5334405899047852,
"learning_rate": 2.3083759536331907e-06,
"loss": 2.0290562438964845,
"step": 9350
},
{
"epoch": 0.9375,
"grad_norm": 1.4322729110717773,
"learning_rate": 2.135107166179895e-06,
"loss": 2.0317987060546874,
"step": 9375
},
{
"epoch": 0.94,
"grad_norm": 3.075627326965332,
"learning_rate": 1.9685273141530348e-06,
"loss": 2.0745269775390627,
"step": 9400
},
{
"epoch": 0.9425,
"grad_norm": 1.6498782634735107,
"learning_rate": 1.8086477830642211e-06,
"loss": 2.1034091186523436,
"step": 9425
},
{
"epoch": 0.945,
"grad_norm": 1.5094914436340332,
"learning_rate": 1.6554795004670388e-06,
"loss": 2.139844970703125,
"step": 9450
},
{
"epoch": 0.9475,
"grad_norm": 1.1315068006515503,
"learning_rate": 1.5090329352101197e-06,
"loss": 2.188152313232422,
"step": 9475
},
{
"epoch": 0.95,
"grad_norm": 1.2506731748580933,
"learning_rate": 1.3693180967216612e-06,
"loss": 2.1455296325683593,
"step": 9500
},
{
"epoch": 0.95,
"eval_cer": 0.12331175468483815,
"eval_loss": 1.442671537399292,
"eval_runtime": 97.491,
"eval_samples_per_second": 14.935,
"eval_steps_per_second": 0.472,
"eval_wer": 0.24751156596102622,
"step": 9500
},
{
"epoch": 0.9525,
"grad_norm": 1.4666153192520142,
"learning_rate": 1.2363445343253177e-06,
"loss": 2.1449468994140624,
"step": 9525
},
{
"epoch": 0.955,
"grad_norm": 1.250496506690979,
"learning_rate": 1.1101213365874109e-06,
"loss": 2.0825015258789064,
"step": 9550
},
{
"epoch": 0.9575,
"grad_norm": 1.8249273300170898,
"learning_rate": 9.9065713069586e-07,
"loss": 2.190665435791016,
"step": 9575
},
{
"epoch": 0.96,
"grad_norm": 1.633515477180481,
"learning_rate": 8.779600818704436e-07,
"loss": 2.0684149169921877,
"step": 9600
},
{
"epoch": 0.9625,
"grad_norm": 1.526536464691162,
"learning_rate": 7.720378928047334e-07,
"loss": 2.2017979431152344,
"step": 9625
},
{
"epoch": 0.965,
"grad_norm": 1.0879954099655151,
"learning_rate": 6.728978031396715e-07,
"loss": 2.0479502868652344,
"step": 9650
},
{
"epoch": 0.9675,
"grad_norm": 1.6106431484222412,
"learning_rate": 5.805465889686779e-07,
"loss": 2.167593231201172,
"step": 9675
},
{
"epoch": 0.97,
"grad_norm": 1.4785369634628296,
"learning_rate": 4.949905623745754e-07,
"loss": 2.1969068908691405,
"step": 9700
},
{
"epoch": 0.9725,
"grad_norm": 1.4101808071136475,
"learning_rate": 4.162355709981247e-07,
"loss": 1.9459999084472657,
"step": 9725
},
{
"epoch": 0.975,
"grad_norm": 1.7263907194137573,
"learning_rate": 3.442869976383767e-07,
"loss": 2.139817199707031,
"step": 9750
},
{
"epoch": 0.9775,
"grad_norm": 1.5900930166244507,
"learning_rate": 2.791497598847448e-07,
"loss": 2.2311444091796875,
"step": 9775
},
{
"epoch": 0.98,
"grad_norm": 1.627547264099121,
"learning_rate": 2.2082830978091827e-07,
"loss": 2.224051818847656,
"step": 9800
},
{
"epoch": 0.9825,
"grad_norm": 1.6145861148834229,
"learning_rate": 1.693266335205279e-07,
"loss": 2.142480773925781,
"step": 9825
},
{
"epoch": 0.985,
"grad_norm": 2.347938060760498,
"learning_rate": 1.2464825117473046e-07,
"loss": 2.230269775390625,
"step": 9850
},
{
"epoch": 0.9875,
"grad_norm": 1.9687460660934448,
"learning_rate": 8.679621645162339e-08,
"loss": 2.1646629333496095,
"step": 9875
},
{
"epoch": 0.99,
"grad_norm": 1.6123799085617065,
"learning_rate": 5.577311648748973e-08,
"loss": 2.268137664794922,
"step": 9900
},
{
"epoch": 0.9925,
"grad_norm": 2.6218087673187256,
"learning_rate": 3.1581071670006015e-08,
"loss": 2.13885498046875,
"step": 9925
},
{
"epoch": 0.995,
"grad_norm": 1.5530320405960083,
"learning_rate": 1.4221735493291643e-08,
"loss": 2.364825439453125,
"step": 9950
},
{
"epoch": 0.9975,
"grad_norm": 1.5830848217010498,
"learning_rate": 3.69629444493258e-09,
"loss": 2.3132223510742187,
"step": 9975
},
{
"epoch": 1.0,
"grad_norm": 1.4912697076797485,
"learning_rate": 5.467924824031911e-12,
"loss": 2.1259417724609375,
"step": 10000
},
{
"epoch": 1.0,
"eval_cer": 0.12461328790459966,
"eval_loss": 1.4531149864196777,
"eval_runtime": 97.7851,
"eval_samples_per_second": 14.89,
"eval_steps_per_second": 0.47,
"eval_wer": 0.24968456469928502,
"step": 10000
}
],
"logging_steps": 25,
"max_steps": 10000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.210732413610433e+20,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}