Automatic Speech Recognition
Transformers
TensorBoard
Safetensors
msp
Generated from Trainer
custom_code
Instructions to use MahmoodAnaam/MSP with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use MahmoodAnaam/MSP with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("automatic-speech-recognition", model="MahmoodAnaam/MSP", trust_remote_code=True)# Load model directly from transformers import AutoModelForCTC model = AutoModelForCTC.from_pretrained("MahmoodAnaam/MSP", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 4000, | |
| "best_metric": 0.21596803588952754, | |
| "best_model_checkpoint": "/workspace/checkpoints-av/msp_e2e_ctc/checkpoint-4000", | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 10000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0025, | |
| "grad_norm": 8.04428768157959, | |
| "learning_rate": 9.600000000000001e-06, | |
| "loss": 7.127101440429687, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.005, | |
| "grad_norm": 8.43156623840332, | |
| "learning_rate": 1.9600000000000002e-05, | |
| "loss": 4.697780151367187, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.0075, | |
| "grad_norm": 3.904343366622925, | |
| "learning_rate": 2.96e-05, | |
| "loss": 3.743772277832031, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 3.055377960205078, | |
| "learning_rate": 3.960000000000001e-05, | |
| "loss": 2.656860656738281, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.0125, | |
| "grad_norm": 2.4546093940734863, | |
| "learning_rate": 4.96e-05, | |
| "loss": 2.414398498535156, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.015, | |
| "grad_norm": 3.393557071685791, | |
| "learning_rate": 5.96e-05, | |
| "loss": 2.355498809814453, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.0175, | |
| "grad_norm": 2.8310353755950928, | |
| "learning_rate": 6.96e-05, | |
| "loss": 2.3629690551757814, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 3.3908843994140625, | |
| "learning_rate": 7.960000000000001e-05, | |
| "loss": 2.298575439453125, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.0225, | |
| "grad_norm": 2.8602232933044434, | |
| "learning_rate": 8.960000000000001e-05, | |
| "loss": 2.285859375, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.025, | |
| "grad_norm": 4.637383460998535, | |
| "learning_rate": 9.960000000000001e-05, | |
| "loss": 2.467720794677734, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.0275, | |
| "grad_norm": 2.0761306285858154, | |
| "learning_rate": 0.00010960000000000001, | |
| "loss": 2.3147714233398435, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 2.8212428092956543, | |
| "learning_rate": 0.00011960000000000001, | |
| "loss": 2.453261260986328, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.0325, | |
| "grad_norm": 4.797104358673096, | |
| "learning_rate": 0.0001296, | |
| "loss": 2.4396128845214844, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.035, | |
| "grad_norm": 4.374691009521484, | |
| "learning_rate": 0.0001396, | |
| "loss": 2.343565673828125, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.0375, | |
| "grad_norm": 4.064563274383545, | |
| "learning_rate": 0.0001496, | |
| "loss": 2.250940704345703, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 3.3617475032806396, | |
| "learning_rate": 0.0001596, | |
| "loss": 2.319589385986328, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.0425, | |
| "grad_norm": 2.7767529487609863, | |
| "learning_rate": 0.0001696, | |
| "loss": 2.4519082641601564, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 0.045, | |
| "grad_norm": 4.268216133117676, | |
| "learning_rate": 0.0001796, | |
| "loss": 2.317582702636719, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.0475, | |
| "grad_norm": 1.932944416999817, | |
| "learning_rate": 0.0001896, | |
| "loss": 2.2180686950683595, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 2.41548228263855, | |
| "learning_rate": 0.0001996, | |
| "loss": 2.4416712951660156, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "eval_cer": 0.16142419080068143, | |
| "eval_loss": 1.5633715391159058, | |
| "eval_runtime": 99.4493, | |
| "eval_samples_per_second": 14.641, | |
| "eval_steps_per_second": 0.463, | |
| "eval_wer": 0.3212533295948409, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.0525, | |
| "grad_norm": 2.496230363845825, | |
| "learning_rate": 0.00019999685049180394, | |
| "loss": 2.244039764404297, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 0.055, | |
| "grad_norm": 1.956568956375122, | |
| "learning_rate": 0.0001999868717996323, | |
| "loss": 2.39022216796875, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.0575, | |
| "grad_norm": 2.2251765727996826, | |
| "learning_rate": 0.00019997005913759068, | |
| "loss": 2.3402642822265625, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 4.093571662902832, | |
| "learning_rate": 0.00019994641365480214, | |
| "loss": 2.530718994140625, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.0625, | |
| "grad_norm": 2.388291120529175, | |
| "learning_rate": 0.00019991593696740405, | |
| "loss": 2.4927822875976564, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 0.065, | |
| "grad_norm": 2.476865530014038, | |
| "learning_rate": 0.00019987863115843748, | |
| "loss": 2.43189453125, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.0675, | |
| "grad_norm": 2.6366164684295654, | |
| "learning_rate": 0.00019983449877770495, | |
| "loss": 2.4924627685546876, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 2.0813474655151367, | |
| "learning_rate": 0.00019978354284159604, | |
| "loss": 2.47088134765625, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.0725, | |
| "grad_norm": 2.2441253662109375, | |
| "learning_rate": 0.00019972576683288128, | |
| "loss": 2.444411163330078, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 0.075, | |
| "grad_norm": 1.8759963512420654, | |
| "learning_rate": 0.00019966117470047418, | |
| "loss": 2.3306341552734375, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.0775, | |
| "grad_norm": 3.6834940910339355, | |
| "learning_rate": 0.00019958977085916113, | |
| "loss": 2.3836322021484375, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 2.361351251602173, | |
| "learning_rate": 0.00019951156018929985, | |
| "loss": 2.4483242797851563, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.0825, | |
| "grad_norm": 1.5636104345321655, | |
| "learning_rate": 0.00019942654803648574, | |
| "loss": 2.4330813598632814, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 0.085, | |
| "grad_norm": 4.691361904144287, | |
| "learning_rate": 0.00019933474021118652, | |
| "loss": 2.420093994140625, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.0875, | |
| "grad_norm": 2.050384998321533, | |
| "learning_rate": 0.0001992361429883451, | |
| "loss": 2.2977276611328126, | |
| "step": 875 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 3.0928971767425537, | |
| "learning_rate": 0.00019913076310695068, | |
| "loss": 2.3863540649414063, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.0925, | |
| "grad_norm": 2.323233127593994, | |
| "learning_rate": 0.00019901860776957815, | |
| "loss": 2.278043212890625, | |
| "step": 925 | |
| }, | |
| { | |
| "epoch": 0.095, | |
| "grad_norm": 3.15425705909729, | |
| "learning_rate": 0.00019889968464189588, | |
| "loss": 2.418150634765625, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.0975, | |
| "grad_norm": 2.0778608322143555, | |
| "learning_rate": 0.00019877400185214165, | |
| "loss": 2.3605302429199218, | |
| "step": 975 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 3.228522300720215, | |
| "learning_rate": 0.00019864156799056723, | |
| "loss": 2.4653065490722654, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "eval_cer": 0.12089267461669506, | |
| "eval_loss": 1.4769799709320068, | |
| "eval_runtime": 98.9656, | |
| "eval_samples_per_second": 14.712, | |
| "eval_steps_per_second": 0.465, | |
| "eval_wer": 0.24400672928641526, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.1025, | |
| "grad_norm": 2.1160504817962646, | |
| "learning_rate": 0.0001985023921088511, | |
| "loss": 2.5620989990234375, | |
| "step": 1025 | |
| }, | |
| { | |
| "epoch": 0.105, | |
| "grad_norm": 2.091463327407837, | |
| "learning_rate": 0.00019835648371947987, | |
| "loss": 2.5808676147460936, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.1075, | |
| "grad_norm": 3.3528618812561035, | |
| "learning_rate": 0.00019820385279509822, | |
| "loss": 2.596577453613281, | |
| "step": 1075 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 1.9095429182052612, | |
| "learning_rate": 0.000198044509767827, | |
| "loss": 2.593738708496094, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.1125, | |
| "grad_norm": 2.25166654586792, | |
| "learning_rate": 0.00019787846552855054, | |
| "loss": 2.4640257263183596, | |
| "step": 1125 | |
| }, | |
| { | |
| "epoch": 0.115, | |
| "grad_norm": 2.254211664199829, | |
| "learning_rate": 0.00019770573142617197, | |
| "loss": 2.3456986999511718, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.1175, | |
| "grad_norm": 2.2005534172058105, | |
| "learning_rate": 0.00019752631926683775, | |
| "loss": 2.4674136352539064, | |
| "step": 1175 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 1.7976740598678589, | |
| "learning_rate": 0.00019734024131313067, | |
| "loss": 2.4166830444335936, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.1225, | |
| "grad_norm": 2.3863418102264404, | |
| "learning_rate": 0.00019714751028323166, | |
| "loss": 2.438814392089844, | |
| "step": 1225 | |
| }, | |
| { | |
| "epoch": 0.125, | |
| "grad_norm": 3.311290979385376, | |
| "learning_rate": 0.0001969481393500506, | |
| "loss": 2.406153259277344, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.1275, | |
| "grad_norm": 5.752159118652344, | |
| "learning_rate": 0.00019674214214032598, | |
| "loss": 2.2879945373535158, | |
| "step": 1275 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 2.109788656234741, | |
| "learning_rate": 0.00019652953273369342, | |
| "loss": 2.3744522094726563, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.1325, | |
| "grad_norm": 1.5383687019348145, | |
| "learning_rate": 0.00019631032566172344, | |
| "loss": 2.3803326416015627, | |
| "step": 1325 | |
| }, | |
| { | |
| "epoch": 0.135, | |
| "grad_norm": 2.9055371284484863, | |
| "learning_rate": 0.00019608453590692822, | |
| "loss": 2.3387161254882813, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.1375, | |
| "grad_norm": 2.196284294128418, | |
| "learning_rate": 0.0001958521789017376, | |
| "loss": 2.323087463378906, | |
| "step": 1375 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 1.8836430311203003, | |
| "learning_rate": 0.0001956132705274442, | |
| "loss": 2.234120178222656, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.1425, | |
| "grad_norm": 1.8475207090377808, | |
| "learning_rate": 0.00019536782711311807, | |
| "loss": 2.293027191162109, | |
| "step": 1425 | |
| }, | |
| { | |
| "epoch": 0.145, | |
| "grad_norm": 1.8547334671020508, | |
| "learning_rate": 0.00019511586543449053, | |
| "loss": 2.243158264160156, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.1475, | |
| "grad_norm": 2.3523902893066406, | |
| "learning_rate": 0.00019485740271280765, | |
| "loss": 2.274371337890625, | |
| "step": 1475 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 2.411062717437744, | |
| "learning_rate": 0.00019459245661365313, | |
| "loss": 2.365634002685547, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "eval_cer": 0.11594548551959113, | |
| "eval_loss": 1.423877477645874, | |
| "eval_runtime": 98.4968, | |
| "eval_samples_per_second": 14.782, | |
| "eval_steps_per_second": 0.467, | |
| "eval_wer": 0.24074723117902705, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.1525, | |
| "grad_norm": 2.0285370349884033, | |
| "learning_rate": 0.00019432104524574087, | |
| "loss": 2.468669738769531, | |
| "step": 1525 | |
| }, | |
| { | |
| "epoch": 0.155, | |
| "grad_norm": 2.2131717205047607, | |
| "learning_rate": 0.00019404318715967732, | |
| "loss": 2.5288356018066405, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.1575, | |
| "grad_norm": 2.3619260787963867, | |
| "learning_rate": 0.0001937589013466936, | |
| "loss": 2.3784559631347655, | |
| "step": 1575 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 1.704810619354248, | |
| "learning_rate": 0.00019346820723734745, | |
| "loss": 2.286223907470703, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.1625, | |
| "grad_norm": 2.17364501953125, | |
| "learning_rate": 0.00019317112470019503, | |
| "loss": 2.4997410583496094, | |
| "step": 1625 | |
| }, | |
| { | |
| "epoch": 0.165, | |
| "grad_norm": 1.9224309921264648, | |
| "learning_rate": 0.00019286767404043316, | |
| "loss": 2.392764434814453, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.1675, | |
| "grad_norm": 2.331049919128418, | |
| "learning_rate": 0.0001925578759985113, | |
| "loss": 2.371828765869141, | |
| "step": 1675 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 2.191542148590088, | |
| "learning_rate": 0.00019224175174871415, | |
| "loss": 2.293146667480469, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.1725, | |
| "grad_norm": 1.853737711906433, | |
| "learning_rate": 0.0001919193228977142, | |
| "loss": 2.4427305603027345, | |
| "step": 1725 | |
| }, | |
| { | |
| "epoch": 0.175, | |
| "grad_norm": 1.6019384860992432, | |
| "learning_rate": 0.0001915906114830952, | |
| "loss": 2.3477943420410154, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.1775, | |
| "grad_norm": 2.125684976577759, | |
| "learning_rate": 0.00019125563997184563, | |
| "loss": 2.455902099609375, | |
| "step": 1775 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 1.6694984436035156, | |
| "learning_rate": 0.00019091443125882337, | |
| "loss": 2.335185241699219, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.1825, | |
| "grad_norm": 1.8382054567337036, | |
| "learning_rate": 0.00019056700866519063, | |
| "loss": 2.1945234680175782, | |
| "step": 1825 | |
| }, | |
| { | |
| "epoch": 0.185, | |
| "grad_norm": 1.8865960836410522, | |
| "learning_rate": 0.00019021339593682028, | |
| "loss": 2.3078712463378905, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.1875, | |
| "grad_norm": 3.637312173843384, | |
| "learning_rate": 0.00018985361724267256, | |
| "loss": 2.3725929260253906, | |
| "step": 1875 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 2.0592007637023926, | |
| "learning_rate": 0.00018948769717314328, | |
| "loss": 2.300412292480469, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.1925, | |
| "grad_norm": 2.4111757278442383, | |
| "learning_rate": 0.0001891156607383831, | |
| "loss": 2.218678741455078, | |
| "step": 1925 | |
| }, | |
| { | |
| "epoch": 0.195, | |
| "grad_norm": 1.5851012468338013, | |
| "learning_rate": 0.00018873753336658822, | |
| "loss": 2.3549868774414064, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.1975, | |
| "grad_norm": 2.3010220527648926, | |
| "learning_rate": 0.00018835334090226214, | |
| "loss": 2.336710662841797, | |
| "step": 1975 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 2.793161392211914, | |
| "learning_rate": 0.0001879631096044495, | |
| "loss": 2.4607310485839844, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "eval_cer": 0.13946166950596253, | |
| "eval_loss": 1.6668776273727417, | |
| "eval_runtime": 96.2028, | |
| "eval_samples_per_second": 15.135, | |
| "eval_steps_per_second": 0.478, | |
| "eval_wer": 0.2859245759147624, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.2025, | |
| "grad_norm": 2.5048420429229736, | |
| "learning_rate": 0.0001875668661449411, | |
| "loss": 2.3207608032226563, | |
| "step": 2025 | |
| }, | |
| { | |
| "epoch": 0.205, | |
| "grad_norm": 2.479046106338501, | |
| "learning_rate": 0.0001871646376064511, | |
| "loss": 2.226656188964844, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.2075, | |
| "grad_norm": 1.7231593132019043, | |
| "learning_rate": 0.00018675645148076578, | |
| "loss": 2.308455047607422, | |
| "step": 2075 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 1.5906119346618652, | |
| "learning_rate": 0.0001863423356668646, | |
| "loss": 2.35341796875, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.2125, | |
| "grad_norm": 2.1919968128204346, | |
| "learning_rate": 0.00018592231846901335, | |
| "loss": 2.3587355041503906, | |
| "step": 2125 | |
| }, | |
| { | |
| "epoch": 0.215, | |
| "grad_norm": 1.5849632024765015, | |
| "learning_rate": 0.00018549642859482963, | |
| "loss": 2.259740905761719, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.2175, | |
| "grad_norm": 1.6398062705993652, | |
| "learning_rate": 0.00018506469515332054, | |
| "loss": 2.234868927001953, | |
| "step": 2175 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 2.203387498855591, | |
| "learning_rate": 0.0001846271476528934, | |
| "loss": 2.4610299682617187, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.2225, | |
| "grad_norm": 2.0128378868103027, | |
| "learning_rate": 0.00018418381599933853, | |
| "loss": 2.4086659240722654, | |
| "step": 2225 | |
| }, | |
| { | |
| "epoch": 0.225, | |
| "grad_norm": 1.7606065273284912, | |
| "learning_rate": 0.00018373473049378562, | |
| "loss": 2.546702575683594, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.2275, | |
| "grad_norm": 2.066452980041504, | |
| "learning_rate": 0.00018327992183063248, | |
| "loss": 2.2808355712890624, | |
| "step": 2275 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 1.9987760782241821, | |
| "learning_rate": 0.00018281942109544698, | |
| "loss": 2.445269012451172, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.2325, | |
| "grad_norm": 1.608620285987854, | |
| "learning_rate": 0.00018235325976284275, | |
| "loss": 2.1912208557128907, | |
| "step": 2325 | |
| }, | |
| { | |
| "epoch": 0.235, | |
| "grad_norm": 2.238555431365967, | |
| "learning_rate": 0.00018188146969432762, | |
| "loss": 2.4058465576171875, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.2375, | |
| "grad_norm": 2.2178099155426025, | |
| "learning_rate": 0.00018140408313612608, | |
| "loss": 2.3438116455078126, | |
| "step": 2375 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 1.9142024517059326, | |
| "learning_rate": 0.00018092113271697522, | |
| "loss": 2.4138525390625, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.2425, | |
| "grad_norm": 3.3786633014678955, | |
| "learning_rate": 0.00018043265144589466, | |
| "loss": 2.2731494140625, | |
| "step": 2425 | |
| }, | |
| { | |
| "epoch": 0.245, | |
| "grad_norm": 2.6107332706451416, | |
| "learning_rate": 0.00017993867270993047, | |
| "loss": 2.230762481689453, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.2475, | |
| "grad_norm": 2.1159350872039795, | |
| "learning_rate": 0.000179439230271873, | |
| "loss": 2.5371829223632814, | |
| "step": 2475 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 2.519641876220703, | |
| "learning_rate": 0.00017893435826794952, | |
| "loss": 2.2601394653320312, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "eval_cer": 0.12031345826235093, | |
| "eval_loss": 1.3391743898391724, | |
| "eval_runtime": 94.2011, | |
| "eval_samples_per_second": 15.456, | |
| "eval_steps_per_second": 0.488, | |
| "eval_wer": 0.24439226132062247, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.2525, | |
| "grad_norm": 1.6987061500549316, | |
| "learning_rate": 0.00017842409120549083, | |
| "loss": 2.4055056762695313, | |
| "step": 2525 | |
| }, | |
| { | |
| "epoch": 0.255, | |
| "grad_norm": 2.0303497314453125, | |
| "learning_rate": 0.00017790846396057277, | |
| "loss": 2.3995057678222658, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.2575, | |
| "grad_norm": 1.8574965000152588, | |
| "learning_rate": 0.00017738751177563268, | |
| "loss": 2.3057664489746093, | |
| "step": 2575 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 2.6739280223846436, | |
| "learning_rate": 0.00017686127025706038, | |
| "loss": 2.460683135986328, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.2625, | |
| "grad_norm": 2.627385377883911, | |
| "learning_rate": 0.00017632977537276464, | |
| "loss": 2.3323692321777343, | |
| "step": 2625 | |
| }, | |
| { | |
| "epoch": 0.265, | |
| "grad_norm": 2.019179582595825, | |
| "learning_rate": 0.00017579306344971474, | |
| "loss": 2.2955747985839845, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.2675, | |
| "grad_norm": 2.7610855102539062, | |
| "learning_rate": 0.00017525117117145772, | |
| "loss": 2.1901036071777344, | |
| "step": 2675 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 2.6274731159210205, | |
| "learning_rate": 0.00017470413557561099, | |
| "loss": 2.2772340393066406, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.2725, | |
| "grad_norm": 2.032763719558716, | |
| "learning_rate": 0.0001741519940513308, | |
| "loss": 2.396791687011719, | |
| "step": 2725 | |
| }, | |
| { | |
| "epoch": 0.275, | |
| "grad_norm": 2.050870895385742, | |
| "learning_rate": 0.00017359478433675698, | |
| "loss": 2.3125306701660158, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.2775, | |
| "grad_norm": 1.2312886714935303, | |
| "learning_rate": 0.00017303254451643332, | |
| "loss": 2.144034729003906, | |
| "step": 2775 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 3.1948437690734863, | |
| "learning_rate": 0.0001724653130187047, | |
| "loss": 2.200022735595703, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.2825, | |
| "grad_norm": 1.904383659362793, | |
| "learning_rate": 0.00017189312861309045, | |
| "loss": 2.312091522216797, | |
| "step": 2825 | |
| }, | |
| { | |
| "epoch": 0.285, | |
| "grad_norm": 2.27195143699646, | |
| "learning_rate": 0.00017131603040763471, | |
| "loss": 2.4758482360839844, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.2875, | |
| "grad_norm": 2.656093120574951, | |
| "learning_rate": 0.0001707340578462332, | |
| "loss": 2.3429974365234374, | |
| "step": 2875 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 1.7262226343154907, | |
| "learning_rate": 0.00017014725070593742, | |
| "loss": 2.27993408203125, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.2925, | |
| "grad_norm": 1.816863775253296, | |
| "learning_rate": 0.00016955564909423596, | |
| "loss": 2.2374249267578126, | |
| "step": 2925 | |
| }, | |
| { | |
| "epoch": 0.295, | |
| "grad_norm": 2.0505402088165283, | |
| "learning_rate": 0.0001689592934463131, | |
| "loss": 2.355446472167969, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 0.2975, | |
| "grad_norm": 2.572733163833618, | |
| "learning_rate": 0.0001683582245222852, | |
| "loss": 2.390894012451172, | |
| "step": 2975 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 1.4850176572799683, | |
| "learning_rate": 0.0001677524834044148, | |
| "loss": 2.2053892517089846, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "eval_cer": 0.11883475298126064, | |
| "eval_loss": 1.3329604864120483, | |
| "eval_runtime": 94.3216, | |
| "eval_samples_per_second": 15.437, | |
| "eval_steps_per_second": 0.488, | |
| "eval_wer": 0.24281508481704753, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.3025, | |
| "grad_norm": 2.223933696746826, | |
| "learning_rate": 0.00016714211149430268, | |
| "loss": 2.1159332275390623, | |
| "step": 3025 | |
| }, | |
| { | |
| "epoch": 0.305, | |
| "grad_norm": 1.66571044921875, | |
| "learning_rate": 0.00016652715051005808, | |
| "loss": 2.345655822753906, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 0.3075, | |
| "grad_norm": 2.4676051139831543, | |
| "learning_rate": 0.0001659076424834474, | |
| "loss": 2.394458770751953, | |
| "step": 3075 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 1.780862808227539, | |
| "learning_rate": 0.0001652836297570214, | |
| "loss": 2.2932537841796874, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.3125, | |
| "grad_norm": 2.951003074645996, | |
| "learning_rate": 0.00016465515498122093, | |
| "loss": 2.239581756591797, | |
| "step": 3125 | |
| }, | |
| { | |
| "epoch": 0.315, | |
| "grad_norm": 1.861158013343811, | |
| "learning_rate": 0.0001640222611114621, | |
| "loss": 2.2416726684570314, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 0.3175, | |
| "grad_norm": 2.0734827518463135, | |
| "learning_rate": 0.00016338499140520024, | |
| "loss": 2.313903503417969, | |
| "step": 3175 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 2.6787068843841553, | |
| "learning_rate": 0.00016274338941897325, | |
| "loss": 2.296602325439453, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.3225, | |
| "grad_norm": 1.5169554948806763, | |
| "learning_rate": 0.00016209749900542462, | |
| "loss": 2.1584397888183595, | |
| "step": 3225 | |
| }, | |
| { | |
| "epoch": 0.325, | |
| "grad_norm": 1.8395015001296997, | |
| "learning_rate": 0.00016144736431030613, | |
| "loss": 2.237540283203125, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.3275, | |
| "grad_norm": 1.6821995973587036, | |
| "learning_rate": 0.00016079302976946055, | |
| "loss": 2.3045135498046876, | |
| "step": 3275 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 2.5113303661346436, | |
| "learning_rate": 0.00016013454010578465, | |
| "loss": 2.229774627685547, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.3325, | |
| "grad_norm": 2.1875202655792236, | |
| "learning_rate": 0.00015947194032617213, | |
| "loss": 2.03060302734375, | |
| "step": 3325 | |
| }, | |
| { | |
| "epoch": 0.335, | |
| "grad_norm": 2.628626585006714, | |
| "learning_rate": 0.00015880527571843792, | |
| "loss": 2.2274468994140624, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 0.3375, | |
| "grad_norm": 3.26328444480896, | |
| "learning_rate": 0.00015813459184822222, | |
| "loss": 2.2913862609863282, | |
| "step": 3375 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 1.828529953956604, | |
| "learning_rate": 0.00015745993455587676, | |
| "loss": 2.326069183349609, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.3425, | |
| "grad_norm": 1.8822145462036133, | |
| "learning_rate": 0.00015678134995333128, | |
| "loss": 2.4681741333007814, | |
| "step": 3425 | |
| }, | |
| { | |
| "epoch": 0.345, | |
| "grad_norm": 2.786712169647217, | |
| "learning_rate": 0.00015609888442094194, | |
| "loss": 2.508190002441406, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 0.3475, | |
| "grad_norm": 2.1335978507995605, | |
| "learning_rate": 0.00015541258460432134, | |
| "loss": 2.429823455810547, | |
| "step": 3475 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 1.7754604816436768, | |
| "learning_rate": 0.00015472249741115031, | |
| "loss": 2.061129913330078, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "eval_cer": 0.19653151618398637, | |
| "eval_loss": 1.8721370697021484, | |
| "eval_runtime": 97.6571, | |
| "eval_samples_per_second": 14.909, | |
| "eval_steps_per_second": 0.471, | |
| "eval_wer": 0.36520398149446237, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.3525, | |
| "grad_norm": 1.9794024229049683, | |
| "learning_rate": 0.00015402867000797178, | |
| "loss": 2.4051849365234377, | |
| "step": 3525 | |
| }, | |
| { | |
| "epoch": 0.355, | |
| "grad_norm": 2.1352591514587402, | |
| "learning_rate": 0.00015333114981696717, | |
| "loss": 2.457940673828125, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 0.3575, | |
| "grad_norm": 3.111924648284912, | |
| "learning_rate": 0.00015262998451271497, | |
| "loss": 2.361605377197266, | |
| "step": 3575 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 2.966064929962158, | |
| "learning_rate": 0.00015192522201893237, | |
| "loss": 2.3615626525878906, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.3625, | |
| "grad_norm": 1.8772096633911133, | |
| "learning_rate": 0.00015121691050519953, | |
| "loss": 2.2799105834960938, | |
| "step": 3625 | |
| }, | |
| { | |
| "epoch": 0.365, | |
| "grad_norm": 2.3451404571533203, | |
| "learning_rate": 0.00015050509838366764, | |
| "loss": 2.34386962890625, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 0.3675, | |
| "grad_norm": 2.5135364532470703, | |
| "learning_rate": 0.00014978983430574962, | |
| "loss": 2.3400205993652343, | |
| "step": 3675 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 1.7440122365951538, | |
| "learning_rate": 0.0001490711671587951, | |
| "loss": 2.4299208068847657, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.3725, | |
| "grad_norm": 1.7665159702301025, | |
| "learning_rate": 0.00014834914606274896, | |
| "loss": 2.3621759033203125, | |
| "step": 3725 | |
| }, | |
| { | |
| "epoch": 0.375, | |
| "grad_norm": 1.7222715616226196, | |
| "learning_rate": 0.0001476238203667939, | |
| "loss": 2.2579191589355467, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.3775, | |
| "grad_norm": 1.6460919380187988, | |
| "learning_rate": 0.00014689523964597792, | |
| "loss": 2.2938653564453126, | |
| "step": 3775 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 1.9907219409942627, | |
| "learning_rate": 0.00014616345369782534, | |
| "loss": 2.246376953125, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.3825, | |
| "grad_norm": 2.8839938640594482, | |
| "learning_rate": 0.00014542851253893373, | |
| "loss": 2.445607147216797, | |
| "step": 3825 | |
| }, | |
| { | |
| "epoch": 0.385, | |
| "grad_norm": 2.404881000518799, | |
| "learning_rate": 0.000144690466401555, | |
| "loss": 2.2871961975097657, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 0.3875, | |
| "grad_norm": 2.3075459003448486, | |
| "learning_rate": 0.00014394936573016226, | |
| "loss": 2.408760986328125, | |
| "step": 3875 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 1.6438523530960083, | |
| "learning_rate": 0.000143205261178002, | |
| "loss": 2.3683087158203127, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.3925, | |
| "grad_norm": 5.861391067504883, | |
| "learning_rate": 0.0001424582036036319, | |
| "loss": 2.342762298583984, | |
| "step": 3925 | |
| }, | |
| { | |
| "epoch": 0.395, | |
| "grad_norm": 1.7755112648010254, | |
| "learning_rate": 0.0001417082440674448, | |
| "loss": 2.2705897521972656, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 0.3975, | |
| "grad_norm": 1.6583561897277832, | |
| "learning_rate": 0.00014095543382817882, | |
| "loss": 2.2572897338867186, | |
| "step": 3975 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 1.4067355394363403, | |
| "learning_rate": 0.0001401998243394138, | |
| "loss": 2.2651954650878907, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_cer": 0.10498807495741057, | |
| "eval_loss": 1.2884368896484375, | |
| "eval_runtime": 97.2686, | |
| "eval_samples_per_second": 14.969, | |
| "eval_steps_per_second": 0.473, | |
| "eval_wer": 0.21596803588952754, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.4025, | |
| "grad_norm": 1.605221152305603, | |
| "learning_rate": 0.0001394414672460546, | |
| "loss": 2.4976361083984373, | |
| "step": 4025 | |
| }, | |
| { | |
| "epoch": 0.405, | |
| "grad_norm": 1.156703233718872, | |
| "learning_rate": 0.00013868041438080112, | |
| "loss": 2.497575225830078, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 0.4075, | |
| "grad_norm": 1.5397531986236572, | |
| "learning_rate": 0.00013791671776060583, | |
| "loss": 2.265808410644531, | |
| "step": 4075 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 1.9549108743667603, | |
| "learning_rate": 0.0001371504295831183, | |
| "loss": 2.3842532348632814, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 0.4125, | |
| "grad_norm": 1.9217745065689087, | |
| "learning_rate": 0.00013638160222311746, | |
| "loss": 2.4043014526367186, | |
| "step": 4125 | |
| }, | |
| { | |
| "epoch": 0.415, | |
| "grad_norm": 2.51631498336792, | |
| "learning_rate": 0.00013561028822893216, | |
| "loss": 2.284119873046875, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 0.4175, | |
| "grad_norm": 1.2171545028686523, | |
| "learning_rate": 0.0001348365403188493, | |
| "loss": 2.2890667724609375, | |
| "step": 4175 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 2.4048573970794678, | |
| "learning_rate": 0.00013406041137751075, | |
| "loss": 2.3984063720703124, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.4225, | |
| "grad_norm": 1.4632928371429443, | |
| "learning_rate": 0.00013328195445229868, | |
| "loss": 2.229521942138672, | |
| "step": 4225 | |
| }, | |
| { | |
| "epoch": 0.425, | |
| "grad_norm": 1.730931043624878, | |
| "learning_rate": 0.00013250122274970983, | |
| "loss": 2.254394836425781, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 0.4275, | |
| "grad_norm": 1.4507620334625244, | |
| "learning_rate": 0.00013171826963171904, | |
| "loss": 2.4484910583496093, | |
| "step": 4275 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 1.3706517219543457, | |
| "learning_rate": 0.00013093314861213187, | |
| "loss": 2.3848532104492186, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 0.4325, | |
| "grad_norm": 2.392287015914917, | |
| "learning_rate": 0.00013014591335292703, | |
| "loss": 2.4290875244140624, | |
| "step": 4325 | |
| }, | |
| { | |
| "epoch": 0.435, | |
| "grad_norm": 1.7551754713058472, | |
| "learning_rate": 0.00012935661766058887, | |
| "loss": 2.3814404296875, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 0.4375, | |
| "grad_norm": 1.7651501893997192, | |
| "learning_rate": 0.00012856531548242943, | |
| "loss": 2.3211224365234373, | |
| "step": 4375 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 1.352349877357483, | |
| "learning_rate": 0.0001277720609029015, | |
| "loss": 2.3048651123046877, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.4425, | |
| "grad_norm": 1.621042251586914, | |
| "learning_rate": 0.0001269769081399018, | |
| "loss": 2.28550537109375, | |
| "step": 4425 | |
| }, | |
| { | |
| "epoch": 0.445, | |
| "grad_norm": 3.0360352993011475, | |
| "learning_rate": 0.00012617991154106553, | |
| "loss": 2.2011154174804686, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 0.4475, | |
| "grad_norm": 1.738326072692871, | |
| "learning_rate": 0.0001253811255800515, | |
| "loss": 2.2040435791015627, | |
| "step": 4475 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 1.242429494857788, | |
| "learning_rate": 0.00012458060485281904, | |
| "loss": 2.194516143798828, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "eval_cer": 0.18675979557069847, | |
| "eval_loss": 2.0404677391052246, | |
| "eval_runtime": 99.6893, | |
| "eval_samples_per_second": 14.605, | |
| "eval_steps_per_second": 0.461, | |
| "eval_wer": 0.34512126734894155, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.4525, | |
| "grad_norm": 2.7530839443206787, | |
| "learning_rate": 0.00012377840407389656, | |
| "loss": 2.2013865661621095, | |
| "step": 4525 | |
| }, | |
| { | |
| "epoch": 0.455, | |
| "grad_norm": 2.2198078632354736, | |
| "learning_rate": 0.00012297457807264163, | |
| "loss": 2.087595977783203, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 0.4575, | |
| "grad_norm": 1.2474287748336792, | |
| "learning_rate": 0.0001221691817894937, | |
| "loss": 2.194997100830078, | |
| "step": 4575 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 12.5129976272583, | |
| "learning_rate": 0.00012136227027221887, | |
| "loss": 2.182381286621094, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 0.4625, | |
| "grad_norm": 2.9374215602874756, | |
| "learning_rate": 0.00012055389867214753, | |
| "loss": 2.1406234741210937, | |
| "step": 4625 | |
| }, | |
| { | |
| "epoch": 0.465, | |
| "grad_norm": 1.6920939683914185, | |
| "learning_rate": 0.00011974412224040467, | |
| "loss": 2.18834228515625, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 0.4675, | |
| "grad_norm": 2.295588493347168, | |
| "learning_rate": 0.00011893299632413377, | |
| "loss": 2.2244253540039063, | |
| "step": 4675 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 1.572840929031372, | |
| "learning_rate": 0.00011812057636271374, | |
| "loss": 2.3844418334960937, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 0.4725, | |
| "grad_norm": 2.083305597305298, | |
| "learning_rate": 0.00011730691788396979, | |
| "loss": 2.2655848693847656, | |
| "step": 4725 | |
| }, | |
| { | |
| "epoch": 0.475, | |
| "grad_norm": 1.814949631690979, | |
| "learning_rate": 0.00011649207650037808, | |
| "loss": 2.308854217529297, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 0.4775, | |
| "grad_norm": 3.0101680755615234, | |
| "learning_rate": 0.00011567610790526484, | |
| "loss": 2.4060545349121094, | |
| "step": 4775 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 1.7078293561935425, | |
| "learning_rate": 0.0001148590678689996, | |
| "loss": 2.3611572265625, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 0.4825, | |
| "grad_norm": 1.662838101387024, | |
| "learning_rate": 0.00011404101223518356, | |
| "loss": 2.110723419189453, | |
| "step": 4825 | |
| }, | |
| { | |
| "epoch": 0.485, | |
| "grad_norm": 1.8207811117172241, | |
| "learning_rate": 0.00011322199691683259, | |
| "loss": 2.248436279296875, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 0.4875, | |
| "grad_norm": 2.421273708343506, | |
| "learning_rate": 0.0001124020778925558, | |
| "loss": 2.1612274169921877, | |
| "step": 4875 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 1.8812896013259888, | |
| "learning_rate": 0.00011158131120272935, | |
| "loss": 2.2600140380859375, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 0.4925, | |
| "grad_norm": 2.3663277626037598, | |
| "learning_rate": 0.00011075975294566618, | |
| "loss": 2.5313677978515625, | |
| "step": 4925 | |
| }, | |
| { | |
| "epoch": 0.495, | |
| "grad_norm": 1.6257905960083008, | |
| "learning_rate": 0.00010993745927378192, | |
| "loss": 2.264820251464844, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 0.4975, | |
| "grad_norm": 1.4130210876464844, | |
| "learning_rate": 0.0001091144863897567, | |
| "loss": 2.407576141357422, | |
| "step": 4975 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 1.7429734468460083, | |
| "learning_rate": 0.00010829089054269397, | |
| "loss": 2.4363131713867188, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "eval_cer": 0.13365587734241907, | |
| "eval_loss": 1.4915677309036255, | |
| "eval_runtime": 97.2843, | |
| "eval_samples_per_second": 14.966, | |
| "eval_steps_per_second": 0.473, | |
| "eval_wer": 0.27344735735314735, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.5025, | |
| "grad_norm": 2.2105283737182617, | |
| "learning_rate": 0.00010746672802427584, | |
| "loss": 2.6081527709960937, | |
| "step": 5025 | |
| }, | |
| { | |
| "epoch": 0.505, | |
| "grad_norm": 2.152991771697998, | |
| "learning_rate": 0.00010664205516491567, | |
| "loss": 2.3156581115722656, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 0.5075, | |
| "grad_norm": 1.6704784631729126, | |
| "learning_rate": 0.00010581692832990795, | |
| "loss": 2.2569061279296876, | |
| "step": 5075 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 1.809422492980957, | |
| "learning_rate": 0.0001049914039155758, | |
| "loss": 2.292207946777344, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 0.5125, | |
| "grad_norm": 2.8532326221466064, | |
| "learning_rate": 0.00010416553834541636, | |
| "loss": 2.262637939453125, | |
| "step": 5125 | |
| }, | |
| { | |
| "epoch": 0.515, | |
| "grad_norm": 1.7250112295150757, | |
| "learning_rate": 0.00010333938806624428, | |
| "loss": 2.311736755371094, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 0.5175, | |
| "grad_norm": 1.786499261856079, | |
| "learning_rate": 0.00010251300954433376, | |
| "loss": 2.295980987548828, | |
| "step": 5175 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 1.7907332181930542, | |
| "learning_rate": 0.00010168645926155901, | |
| "loss": 2.1306143188476563, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 0.5225, | |
| "grad_norm": 1.8260570764541626, | |
| "learning_rate": 0.00010085979371153397, | |
| "loss": 2.4332316589355467, | |
| "step": 5225 | |
| }, | |
| { | |
| "epoch": 0.525, | |
| "grad_norm": 3.8928639888763428, | |
| "learning_rate": 0.00010003306939575083, | |
| "loss": 2.1371470642089845, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 0.5275, | |
| "grad_norm": 1.4477559328079224, | |
| "learning_rate": 9.920634281971844e-05, | |
| "loss": 2.2873826599121094, | |
| "step": 5275 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 1.9820969104766846, | |
| "learning_rate": 9.837967048910006e-05, | |
| "loss": 2.370744171142578, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 0.5325, | |
| "grad_norm": 1.9542760848999023, | |
| "learning_rate": 9.755310890585138e-05, | |
| "loss": 2.317779998779297, | |
| "step": 5325 | |
| }, | |
| { | |
| "epoch": 0.535, | |
| "grad_norm": 1.4388443231582642, | |
| "learning_rate": 9.672671456435866e-05, | |
| "loss": 2.232802734375, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 0.5375, | |
| "grad_norm": 1.827918529510498, | |
| "learning_rate": 9.590054394757745e-05, | |
| "loss": 2.215179138183594, | |
| "step": 5375 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 1.4861502647399902, | |
| "learning_rate": 9.507465352317186e-05, | |
| "loss": 2.2451414489746093, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 0.5425, | |
| "grad_norm": 1.4316998720169067, | |
| "learning_rate": 9.424909973965539e-05, | |
| "loss": 2.188051910400391, | |
| "step": 5425 | |
| }, | |
| { | |
| "epoch": 0.545, | |
| "grad_norm": 1.6524759531021118, | |
| "learning_rate": 9.342393902253252e-05, | |
| "loss": 2.3306240844726562, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 0.5475, | |
| "grad_norm": 1.512019157409668, | |
| "learning_rate": 9.259922777044213e-05, | |
| "loss": 2.300531921386719, | |
| "step": 5475 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 1.4672224521636963, | |
| "learning_rate": 9.177502235130284e-05, | |
| "loss": 2.119959411621094, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "eval_cer": 0.12580579216354343, | |
| "eval_loss": 1.4867600202560425, | |
| "eval_runtime": 107.689, | |
| "eval_samples_per_second": 13.52, | |
| "eval_steps_per_second": 0.427, | |
| "eval_wer": 0.2515070797700827, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.5525, | |
| "grad_norm": 3.694199323654175, | |
| "learning_rate": 9.095137909846017e-05, | |
| "loss": 2.093580780029297, | |
| "step": 5525 | |
| }, | |
| { | |
| "epoch": 0.555, | |
| "grad_norm": 1.6778661012649536, | |
| "learning_rate": 9.012835430683642e-05, | |
| "loss": 2.211465148925781, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 0.5575, | |
| "grad_norm": 1.4538211822509766, | |
| "learning_rate": 8.93060042290828e-05, | |
| "loss": 2.067851867675781, | |
| "step": 5575 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 1.399057388305664, | |
| "learning_rate": 8.848438507173474e-05, | |
| "loss": 2.2560064697265627, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 0.5625, | |
| "grad_norm": 1.7285677194595337, | |
| "learning_rate": 8.76635529913703e-05, | |
| "loss": 2.305147705078125, | |
| "step": 5625 | |
| }, | |
| { | |
| "epoch": 0.565, | |
| "grad_norm": 1.3977117538452148, | |
| "learning_rate": 8.684356409077176e-05, | |
| "loss": 2.1981732177734377, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 0.5675, | |
| "grad_norm": 1.377535343170166, | |
| "learning_rate": 8.602447441509128e-05, | |
| "loss": 2.1758804321289062, | |
| "step": 5675 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 1.4587531089782715, | |
| "learning_rate": 8.520633994802014e-05, | |
| "loss": 2.157071533203125, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 0.5725, | |
| "grad_norm": 1.4554935693740845, | |
| "learning_rate": 8.438921660796246e-05, | |
| "loss": 1.999080047607422, | |
| "step": 5725 | |
| }, | |
| { | |
| "epoch": 0.575, | |
| "grad_norm": 2.2711434364318848, | |
| "learning_rate": 8.357316024421302e-05, | |
| "loss": 2.1546482849121094, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 0.5775, | |
| "grad_norm": 1.8232475519180298, | |
| "learning_rate": 8.27582266331403e-05, | |
| "loss": 2.173642272949219, | |
| "step": 5775 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 1.3171988725662231, | |
| "learning_rate": 8.194447147437411e-05, | |
| "loss": 2.3818399047851564, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 0.5825, | |
| "grad_norm": 1.943204402923584, | |
| "learning_rate": 8.11319503869986e-05, | |
| "loss": 2.1704754638671875, | |
| "step": 5825 | |
| }, | |
| { | |
| "epoch": 0.585, | |
| "grad_norm": 1.4433194398880005, | |
| "learning_rate": 8.032071890575078e-05, | |
| "loss": 2.342074432373047, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 0.5875, | |
| "grad_norm": 1.7247374057769775, | |
| "learning_rate": 7.95108324772248e-05, | |
| "loss": 2.0461408996582033, | |
| "step": 5875 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 1.8924514055252075, | |
| "learning_rate": 7.870234645608221e-05, | |
| "loss": 2.158209228515625, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 0.5925, | |
| "grad_norm": 1.7629958391189575, | |
| "learning_rate": 7.789531610126864e-05, | |
| "loss": 2.1048355102539062, | |
| "step": 5925 | |
| }, | |
| { | |
| "epoch": 0.595, | |
| "grad_norm": 1.9589917659759521, | |
| "learning_rate": 7.708979657223681e-05, | |
| "loss": 2.182529296875, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 0.5975, | |
| "grad_norm": 1.8531277179718018, | |
| "learning_rate": 7.628584292517651e-05, | |
| "loss": 2.281885070800781, | |
| "step": 5975 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 1.4821549654006958, | |
| "learning_rate": 7.548351010925159e-05, | |
| "loss": 2.2227223205566404, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "eval_cer": 0.11651788756388416, | |
| "eval_loss": 1.365559458732605, | |
| "eval_runtime": 98.5438, | |
| "eval_samples_per_second": 14.775, | |
| "eval_steps_per_second": 0.467, | |
| "eval_wer": 0.23790831347259217, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.6025, | |
| "grad_norm": 5.139744281768799, | |
| "learning_rate": 7.468285296284425e-05, | |
| "loss": 2.2776620483398435, | |
| "step": 6025 | |
| }, | |
| { | |
| "epoch": 0.605, | |
| "grad_norm": 1.4555790424346924, | |
| "learning_rate": 7.38839262098069e-05, | |
| "loss": 2.350541076660156, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 0.6075, | |
| "grad_norm": 1.830809235572815, | |
| "learning_rate": 7.308678445572183e-05, | |
| "loss": 2.420984191894531, | |
| "step": 6075 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 1.5413800477981567, | |
| "learning_rate": 7.229148218416905e-05, | |
| "loss": 2.0628668212890626, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 0.6125, | |
| "grad_norm": 1.5212156772613525, | |
| "learning_rate": 7.149807375300239e-05, | |
| "loss": 2.1369078063964846, | |
| "step": 6125 | |
| }, | |
| { | |
| "epoch": 0.615, | |
| "grad_norm": 1.639372706413269, | |
| "learning_rate": 7.070661339063421e-05, | |
| "loss": 2.1265322875976564, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 0.6175, | |
| "grad_norm": 1.3873976469039917, | |
| "learning_rate": 6.991715519232893e-05, | |
| "loss": 2.2606741333007814, | |
| "step": 6175 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 2.0001771450042725, | |
| "learning_rate": 6.912975311650573e-05, | |
| "loss": 2.0394573974609376, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 0.6225, | |
| "grad_norm": 1.5461382865905762, | |
| "learning_rate": 6.834446098105055e-05, | |
| "loss": 2.025839080810547, | |
| "step": 6225 | |
| }, | |
| { | |
| "epoch": 0.625, | |
| "grad_norm": 1.2012392282485962, | |
| "learning_rate": 6.75613324596377e-05, | |
| "loss": 2.127050323486328, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 0.6275, | |
| "grad_norm": 1.4980227947235107, | |
| "learning_rate": 6.678042107806136e-05, | |
| "loss": 2.1705177307128904, | |
| "step": 6275 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 1.7649891376495361, | |
| "learning_rate": 6.600178021057713e-05, | |
| "loss": 2.1629388427734373, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 0.6325, | |
| "grad_norm": 1.4063870906829834, | |
| "learning_rate": 6.522546307625399e-05, | |
| "loss": 2.252629852294922, | |
| "step": 6325 | |
| }, | |
| { | |
| "epoch": 0.635, | |
| "grad_norm": 1.8891024589538574, | |
| "learning_rate": 6.445152273533687e-05, | |
| "loss": 2.310922088623047, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 0.6375, | |
| "grad_norm": 1.461951494216919, | |
| "learning_rate": 6.368001208561998e-05, | |
| "loss": 2.2186619567871095, | |
| "step": 6375 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 2.2162909507751465, | |
| "learning_rate": 6.291098385883146e-05, | |
| "loss": 2.2705178833007813, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 0.6425, | |
| "grad_norm": 1.6403982639312744, | |
| "learning_rate": 6.214449061702898e-05, | |
| "loss": 2.287322235107422, | |
| "step": 6425 | |
| }, | |
| { | |
| "epoch": 0.645, | |
| "grad_norm": 1.4998693466186523, | |
| "learning_rate": 6.13805847490075e-05, | |
| "loss": 2.2243331909179687, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 0.6475, | |
| "grad_norm": 1.5675662755966187, | |
| "learning_rate": 6.061931846671833e-05, | |
| "loss": 2.196006011962891, | |
| "step": 6475 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 1.4675372838974, | |
| "learning_rate": 5.986074380170068e-05, | |
| "loss": 2.098954162597656, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "eval_cer": 0.12910391822827938, | |
| "eval_loss": 1.4575581550598145, | |
| "eval_runtime": 97.7619, | |
| "eval_samples_per_second": 14.893, | |
| "eval_steps_per_second": 0.471, | |
| "eval_wer": 0.2552222066451703, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.6525, | |
| "grad_norm": 1.0977084636688232, | |
| "learning_rate": 5.910491260152522e-05, | |
| "loss": 2.0651014709472655, | |
| "step": 6525 | |
| }, | |
| { | |
| "epoch": 0.655, | |
| "grad_norm": 1.7557512521743774, | |
| "learning_rate": 5.835187652625047e-05, | |
| "loss": 2.1543315124511717, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 0.6575, | |
| "grad_norm": 3.4759411811828613, | |
| "learning_rate": 5.7601687044891925e-05, | |
| "loss": 2.154296569824219, | |
| "step": 6575 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 1.4857603311538696, | |
| "learning_rate": 5.6854395431904094e-05, | |
| "loss": 2.239384765625, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 0.6625, | |
| "grad_norm": 1.2919102907180786, | |
| "learning_rate": 5.611005276367605e-05, | |
| "loss": 2.1780934143066406, | |
| "step": 6625 | |
| }, | |
| { | |
| "epoch": 0.665, | |
| "grad_norm": 1.4281810522079468, | |
| "learning_rate": 5.536870991504044e-05, | |
| "loss": 2.2144403076171875, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 0.6675, | |
| "grad_norm": 1.7376158237457275, | |
| "learning_rate": 5.463041755579619e-05, | |
| "loss": 2.1022102355957033, | |
| "step": 6675 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 2.0145184993743896, | |
| "learning_rate": 5.389522614724536e-05, | |
| "loss": 2.2605833435058593, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 0.6725, | |
| "grad_norm": 2.8310012817382812, | |
| "learning_rate": 5.316318593874415e-05, | |
| "loss": 2.3267457580566404, | |
| "step": 6725 | |
| }, | |
| { | |
| "epoch": 0.675, | |
| "grad_norm": 2.145875930786133, | |
| "learning_rate": 5.2434346964268344e-05, | |
| "loss": 2.6324166870117187, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 0.6775, | |
| "grad_norm": 1.6132903099060059, | |
| "learning_rate": 5.170875903899375e-05, | |
| "loss": 2.091797180175781, | |
| "step": 6775 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 1.7022608518600464, | |
| "learning_rate": 5.098647175589118e-05, | |
| "loss": 2.0755772399902344, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 0.6825, | |
| "grad_norm": 1.4856054782867432, | |
| "learning_rate": 5.026753448233703e-05, | |
| "loss": 2.1015928649902342, | |
| "step": 6825 | |
| }, | |
| { | |
| "epoch": 0.685, | |
| "grad_norm": 1.8448196649551392, | |
| "learning_rate": 4.9551996356738915e-05, | |
| "loss": 2.1693138122558593, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 0.6875, | |
| "grad_norm": 1.4995580911636353, | |
| "learning_rate": 4.883990628517725e-05, | |
| "loss": 2.2492982482910158, | |
| "step": 6875 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 1.3703680038452148, | |
| "learning_rate": 4.813131293806253e-05, | |
| "loss": 2.2033477783203126, | |
| "step": 6900 | |
| }, | |
| { | |
| "epoch": 0.6925, | |
| "grad_norm": 1.49030339717865, | |
| "learning_rate": 4.7426264746808755e-05, | |
| "loss": 2.1979034423828123, | |
| "step": 6925 | |
| }, | |
| { | |
| "epoch": 0.695, | |
| "grad_norm": 1.582387924194336, | |
| "learning_rate": 4.6724809900523256e-05, | |
| "loss": 2.2166607666015623, | |
| "step": 6950 | |
| }, | |
| { | |
| "epoch": 0.6975, | |
| "grad_norm": 1.0378532409667969, | |
| "learning_rate": 4.6026996342713e-05, | |
| "loss": 2.1302786254882813, | |
| "step": 6975 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 1.779466986656189, | |
| "learning_rate": 4.533287176800772e-05, | |
| "loss": 2.1397467041015625, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "eval_cer": 0.14284838160136287, | |
| "eval_loss": 1.5793243646621704, | |
| "eval_runtime": 100.9249, | |
| "eval_samples_per_second": 14.427, | |
| "eval_steps_per_second": 0.456, | |
| "eval_wer": 0.27923033786625545, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.7025, | |
| "grad_norm": 1.4482125043869019, | |
| "learning_rate": 4.464248361890006e-05, | |
| "loss": 2.3440916442871096, | |
| "step": 7025 | |
| }, | |
| { | |
| "epoch": 0.705, | |
| "grad_norm": 1.4733315706253052, | |
| "learning_rate": 4.3955879082502926e-05, | |
| "loss": 2.148384857177734, | |
| "step": 7050 | |
| }, | |
| { | |
| "epoch": 0.7075, | |
| "grad_norm": 1.8669700622558594, | |
| "learning_rate": 4.327310508732437e-05, | |
| "loss": 2.0429644775390625, | |
| "step": 7075 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 2.0535337924957275, | |
| "learning_rate": 4.2594208300059946e-05, | |
| "loss": 2.117684173583984, | |
| "step": 7100 | |
| }, | |
| { | |
| "epoch": 0.7125, | |
| "grad_norm": 1.4492615461349487, | |
| "learning_rate": 4.191923512240327e-05, | |
| "loss": 2.1872657775878905, | |
| "step": 7125 | |
| }, | |
| { | |
| "epoch": 0.715, | |
| "grad_norm": 1.1772300004959106, | |
| "learning_rate": 4.1248231687874414e-05, | |
| "loss": 2.0845387268066404, | |
| "step": 7150 | |
| }, | |
| { | |
| "epoch": 0.7175, | |
| "grad_norm": 1.9866479635238647, | |
| "learning_rate": 4.058124385866685e-05, | |
| "loss": 2.17061279296875, | |
| "step": 7175 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 1.3913525342941284, | |
| "learning_rate": 3.991831722251268e-05, | |
| "loss": 2.2543954467773437, | |
| "step": 7200 | |
| }, | |
| { | |
| "epoch": 0.7225, | |
| "grad_norm": 2.026390314102173, | |
| "learning_rate": 3.925949708956689e-05, | |
| "loss": 2.156564483642578, | |
| "step": 7225 | |
| }, | |
| { | |
| "epoch": 0.725, | |
| "grad_norm": 2.187021017074585, | |
| "learning_rate": 3.860482848931042e-05, | |
| "loss": 2.227943115234375, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 0.7275, | |
| "grad_norm": 1.6608995199203491, | |
| "learning_rate": 3.7954356167472485e-05, | |
| "loss": 2.1599061584472654, | |
| "step": 7275 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 1.626770257949829, | |
| "learning_rate": 3.730812458297222e-05, | |
| "loss": 2.021209411621094, | |
| "step": 7300 | |
| }, | |
| { | |
| "epoch": 0.7325, | |
| "grad_norm": 1.2525973320007324, | |
| "learning_rate": 3.6666177904879994e-05, | |
| "loss": 2.138314514160156, | |
| "step": 7325 | |
| }, | |
| { | |
| "epoch": 0.735, | |
| "grad_norm": 1.5164086818695068, | |
| "learning_rate": 3.6028560009398535e-05, | |
| "loss": 2.248671417236328, | |
| "step": 7350 | |
| }, | |
| { | |
| "epoch": 0.7375, | |
| "grad_norm": 1.4386738538742065, | |
| "learning_rate": 3.5395314476864026e-05, | |
| "loss": 2.1806785583496096, | |
| "step": 7375 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 1.779341220855713, | |
| "learning_rate": 3.4766484588767434e-05, | |
| "loss": 2.100335693359375, | |
| "step": 7400 | |
| }, | |
| { | |
| "epoch": 0.7425, | |
| "grad_norm": 1.8158776760101318, | |
| "learning_rate": 3.4142113324796344e-05, | |
| "loss": 2.1199974060058593, | |
| "step": 7425 | |
| }, | |
| { | |
| "epoch": 0.745, | |
| "grad_norm": 1.8703250885009766, | |
| "learning_rate": 3.3522243359897184e-05, | |
| "loss": 2.220720672607422, | |
| "step": 7450 | |
| }, | |
| { | |
| "epoch": 0.7475, | |
| "grad_norm": 1.5516717433929443, | |
| "learning_rate": 3.290691706135871e-05, | |
| "loss": 2.0985394287109376, | |
| "step": 7475 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 2.0880203247070312, | |
| "learning_rate": 3.229617648591604e-05, | |
| "loss": 2.174041290283203, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "eval_cer": 0.11913458262350937, | |
| "eval_loss": 1.444368600845337, | |
| "eval_runtime": 94.4985, | |
| "eval_samples_per_second": 15.408, | |
| "eval_steps_per_second": 0.487, | |
| "eval_wer": 0.2379784102060844, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.7525, | |
| "grad_norm": 1.6245286464691162, | |
| "learning_rate": 3.1690063376876246e-05, | |
| "loss": 2.077626190185547, | |
| "step": 7525 | |
| }, | |
| { | |
| "epoch": 0.755, | |
| "grad_norm": 1.5519412755966187, | |
| "learning_rate": 3.108861916126518e-05, | |
| "loss": 2.1642431640625, | |
| "step": 7550 | |
| }, | |
| { | |
| "epoch": 0.7575, | |
| "grad_norm": 1.6812665462493896, | |
| "learning_rate": 3.0491884946996054e-05, | |
| "loss": 2.266511993408203, | |
| "step": 7575 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 1.6865683794021606, | |
| "learning_rate": 2.989990152005976e-05, | |
| "loss": 2.032673645019531, | |
| "step": 7600 | |
| }, | |
| { | |
| "epoch": 0.7625, | |
| "grad_norm": 1.674428105354309, | |
| "learning_rate": 2.9312709341737153e-05, | |
| "loss": 2.2226411437988283, | |
| "step": 7625 | |
| }, | |
| { | |
| "epoch": 0.765, | |
| "grad_norm": 1.8106178045272827, | |
| "learning_rate": 2.8730348545833618e-05, | |
| "loss": 2.046322784423828, | |
| "step": 7650 | |
| }, | |
| { | |
| "epoch": 0.7675, | |
| "grad_norm": 1.2184237241744995, | |
| "learning_rate": 2.8152858935936e-05, | |
| "loss": 2.101376953125, | |
| "step": 7675 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 1.2026764154434204, | |
| "learning_rate": 2.7580279982692013e-05, | |
| "loss": 2.0226611328125, | |
| "step": 7700 | |
| }, | |
| { | |
| "epoch": 0.7725, | |
| "grad_norm": 1.4784437417984009, | |
| "learning_rate": 2.701265082111253e-05, | |
| "loss": 2.14648193359375, | |
| "step": 7725 | |
| }, | |
| { | |
| "epoch": 0.775, | |
| "grad_norm": 1.3903934955596924, | |
| "learning_rate": 2.6450010247896728e-05, | |
| "loss": 2.024711151123047, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 0.7775, | |
| "grad_norm": 1.257865071296692, | |
| "learning_rate": 2.589239671878041e-05, | |
| "loss": 2.2576043701171873, | |
| "step": 7775 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 1.4572250843048096, | |
| "learning_rate": 2.533984834590758e-05, | |
| "loss": 2.22150146484375, | |
| "step": 7800 | |
| }, | |
| { | |
| "epoch": 0.7825, | |
| "grad_norm": 1.6356014013290405, | |
| "learning_rate": 2.4792402895225553e-05, | |
| "loss": 2.189641571044922, | |
| "step": 7825 | |
| }, | |
| { | |
| "epoch": 0.785, | |
| "grad_norm": 1.3937262296676636, | |
| "learning_rate": 2.4250097783903692e-05, | |
| "loss": 1.9916804504394532, | |
| "step": 7850 | |
| }, | |
| { | |
| "epoch": 0.7875, | |
| "grad_norm": 1.893620252609253, | |
| "learning_rate": 2.3712970077775964e-05, | |
| "loss": 2.1063442993164063, | |
| "step": 7875 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 1.7967338562011719, | |
| "learning_rate": 2.3181056488807607e-05, | |
| "loss": 2.2335971069335936, | |
| "step": 7900 | |
| }, | |
| { | |
| "epoch": 0.7925, | |
| "grad_norm": 2.007983684539795, | |
| "learning_rate": 2.2654393372585848e-05, | |
| "loss": 2.112566375732422, | |
| "step": 7925 | |
| }, | |
| { | |
| "epoch": 0.795, | |
| "grad_norm": 1.513131856918335, | |
| "learning_rate": 2.21330167258351e-05, | |
| "loss": 2.16599853515625, | |
| "step": 7950 | |
| }, | |
| { | |
| "epoch": 0.7975, | |
| "grad_norm": 1.498331069946289, | |
| "learning_rate": 2.161696218395658e-05, | |
| "loss": 2.137431640625, | |
| "step": 7975 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 1.2613261938095093, | |
| "learning_rate": 2.1106265018592752e-05, | |
| "loss": 2.34350830078125, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_cer": 0.1230664395229983, | |
| "eval_loss": 1.4125823974609375, | |
| "eval_runtime": 97.7133, | |
| "eval_samples_per_second": 14.901, | |
| "eval_steps_per_second": 0.471, | |
| "eval_wer": 0.24351605215196973, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.8025, | |
| "grad_norm": 2.232102870941162, | |
| "learning_rate": 2.0600960135216462e-05, | |
| "loss": 2.2054771423339843, | |
| "step": 8025 | |
| }, | |
| { | |
| "epoch": 0.805, | |
| "grad_norm": 1.2436963319778442, | |
| "learning_rate": 2.010108207074527e-05, | |
| "loss": 2.0917733764648436, | |
| "step": 8050 | |
| }, | |
| { | |
| "epoch": 0.8075, | |
| "grad_norm": 1.5534099340438843, | |
| "learning_rate": 1.960666499118089e-05, | |
| "loss": 2.129667053222656, | |
| "step": 8075 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 1.6899291276931763, | |
| "learning_rate": 1.911774268927394e-05, | |
| "loss": 2.2986248779296874, | |
| "step": 8100 | |
| }, | |
| { | |
| "epoch": 0.8125, | |
| "grad_norm": 2.3437321186065674, | |
| "learning_rate": 1.863434858221429e-05, | |
| "loss": 2.099478912353516, | |
| "step": 8125 | |
| }, | |
| { | |
| "epoch": 0.815, | |
| "grad_norm": 1.8261597156524658, | |
| "learning_rate": 1.8156515709347033e-05, | |
| "loss": 2.1615660095214846, | |
| "step": 8150 | |
| }, | |
| { | |
| "epoch": 0.8175, | |
| "grad_norm": 1.6776697635650635, | |
| "learning_rate": 1.7684276729914305e-05, | |
| "loss": 2.229272766113281, | |
| "step": 8175 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 1.2899510860443115, | |
| "learning_rate": 1.7217663920823068e-05, | |
| "loss": 2.0697711181640623, | |
| "step": 8200 | |
| }, | |
| { | |
| "epoch": 0.8225, | |
| "grad_norm": 1.627907395362854, | |
| "learning_rate": 1.6756709174438978e-05, | |
| "loss": 1.9809979248046874, | |
| "step": 8225 | |
| }, | |
| { | |
| "epoch": 0.825, | |
| "grad_norm": 1.6771968603134155, | |
| "learning_rate": 1.6301443996406662e-05, | |
| "loss": 1.786422882080078, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 0.8275, | |
| "grad_norm": 1.8237980604171753, | |
| "learning_rate": 1.585189950349627e-05, | |
| "loss": 2.0105300903320313, | |
| "step": 8275 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 1.6596792936325073, | |
| "learning_rate": 1.5408106421476753e-05, | |
| "loss": 1.8981912231445313, | |
| "step": 8300 | |
| }, | |
| { | |
| "epoch": 0.8325, | |
| "grad_norm": 1.3936231136322021, | |
| "learning_rate": 1.4970095083015757e-05, | |
| "loss": 2.0365556335449218, | |
| "step": 8325 | |
| }, | |
| { | |
| "epoch": 0.835, | |
| "grad_norm": 1.6055278778076172, | |
| "learning_rate": 1.4537895425606407e-05, | |
| "loss": 2.1483555603027344, | |
| "step": 8350 | |
| }, | |
| { | |
| "epoch": 0.8375, | |
| "grad_norm": 1.1807600259780884, | |
| "learning_rate": 1.4111536989521213e-05, | |
| "loss": 1.9491183471679687, | |
| "step": 8375 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 1.5801160335540771, | |
| "learning_rate": 1.3691048915792893e-05, | |
| "loss": 1.9624462890625, | |
| "step": 8400 | |
| }, | |
| { | |
| "epoch": 0.8425, | |
| "grad_norm": 1.202498435974121, | |
| "learning_rate": 1.3276459944222785e-05, | |
| "loss": 2.2168756103515626, | |
| "step": 8425 | |
| }, | |
| { | |
| "epoch": 0.845, | |
| "grad_norm": 1.7413278818130493, | |
| "learning_rate": 1.286779841141631e-05, | |
| "loss": 2.16740234375, | |
| "step": 8450 | |
| }, | |
| { | |
| "epoch": 0.8475, | |
| "grad_norm": 2.2603840827941895, | |
| "learning_rate": 1.2465092248846422e-05, | |
| "loss": 2.189974060058594, | |
| "step": 8475 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 1.7048544883728027, | |
| "learning_rate": 1.206836898094439e-05, | |
| "loss": 2.057767333984375, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "eval_cer": 0.11645655877342419, | |
| "eval_loss": 1.3806432485580444, | |
| "eval_runtime": 97.8639, | |
| "eval_samples_per_second": 14.878, | |
| "eval_steps_per_second": 0.47, | |
| "eval_wer": 0.2347189120986962, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.8525, | |
| "grad_norm": 1.520108699798584, | |
| "learning_rate": 1.1677655723218594e-05, | |
| "loss": 2.138619232177734, | |
| "step": 8525 | |
| }, | |
| { | |
| "epoch": 0.855, | |
| "grad_norm": 1.469742774963379, | |
| "learning_rate": 1.1292979180401209e-05, | |
| "loss": 2.1907090759277343, | |
| "step": 8550 | |
| }, | |
| { | |
| "epoch": 0.8575, | |
| "grad_norm": 1.6531875133514404, | |
| "learning_rate": 1.0914365644622926e-05, | |
| "loss": 2.1050286865234376, | |
| "step": 8575 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 1.6312158107757568, | |
| "learning_rate": 1.0541840993616004e-05, | |
| "loss": 2.0515817260742186, | |
| "step": 8600 | |
| }, | |
| { | |
| "epoch": 0.8625, | |
| "grad_norm": 1.8661822080612183, | |
| "learning_rate": 1.0175430688945486e-05, | |
| "loss": 2.315790557861328, | |
| "step": 8625 | |
| }, | |
| { | |
| "epoch": 0.865, | |
| "grad_norm": 2.089953660964966, | |
| "learning_rate": 9.815159774268978e-06, | |
| "loss": 2.402613525390625, | |
| "step": 8650 | |
| }, | |
| { | |
| "epoch": 0.8675, | |
| "grad_norm": 1.5258253812789917, | |
| "learning_rate": 9.461052873624942e-06, | |
| "loss": 1.9790252685546874, | |
| "step": 8675 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 1.4712804555892944, | |
| "learning_rate": 9.11313418974965e-06, | |
| "loss": 2.132662353515625, | |
| "step": 8700 | |
| }, | |
| { | |
| "epoch": 0.8725, | |
| "grad_norm": 1.8603571653366089, | |
| "learning_rate": 8.771427502422979e-06, | |
| "loss": 2.027366943359375, | |
| "step": 8725 | |
| }, | |
| { | |
| "epoch": 0.875, | |
| "grad_norm": 2.1210811138153076, | |
| "learning_rate": 8.435956166843117e-06, | |
| "loss": 2.066180877685547, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 0.8775, | |
| "grad_norm": 1.4630470275878906, | |
| "learning_rate": 8.106743112030223e-06, | |
| "loss": 2.0400991821289063, | |
| "step": 8775 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 1.7319868803024292, | |
| "learning_rate": 7.783810839259286e-06, | |
| "loss": 2.1061160278320314, | |
| "step": 8800 | |
| }, | |
| { | |
| "epoch": 0.8825, | |
| "grad_norm": 1.5619069337844849, | |
| "learning_rate": 7.467181420522173e-06, | |
| "loss": 2.1499870300292967, | |
| "step": 8825 | |
| }, | |
| { | |
| "epoch": 0.885, | |
| "grad_norm": 1.473605990409851, | |
| "learning_rate": 7.156876497019072e-06, | |
| "loss": 2.0396578979492186, | |
| "step": 8850 | |
| }, | |
| { | |
| "epoch": 0.8875, | |
| "grad_norm": 1.5723377466201782, | |
| "learning_rate": 6.852917277679305e-06, | |
| "loss": 2.095478973388672, | |
| "step": 8875 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 1.7452499866485596, | |
| "learning_rate": 6.555324537711749e-06, | |
| "loss": 2.088753356933594, | |
| "step": 8900 | |
| }, | |
| { | |
| "epoch": 0.8925, | |
| "grad_norm": 1.4047157764434814, | |
| "learning_rate": 6.264118617184878e-06, | |
| "loss": 2.006247253417969, | |
| "step": 8925 | |
| }, | |
| { | |
| "epoch": 0.895, | |
| "grad_norm": 1.5385630130767822, | |
| "learning_rate": 5.979319419636531e-06, | |
| "loss": 2.0545005798339844, | |
| "step": 8950 | |
| }, | |
| { | |
| "epoch": 0.8975, | |
| "grad_norm": 1.3976651430130005, | |
| "learning_rate": 5.700946410713548e-06, | |
| "loss": 2.0425811767578126, | |
| "step": 8975 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 1.7689292430877686, | |
| "learning_rate": 5.4290186168413195e-06, | |
| "loss": 2.113001251220703, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "eval_cer": 0.12256899488926747, | |
| "eval_loss": 1.428444504737854, | |
| "eval_runtime": 99.6669, | |
| "eval_samples_per_second": 14.609, | |
| "eval_steps_per_second": 0.462, | |
| "eval_wer": 0.2449179868218141, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.9025, | |
| "grad_norm": 1.8464909791946411, | |
| "learning_rate": 5.163554623923339e-06, | |
| "loss": 2.3079527282714842, | |
| "step": 9025 | |
| }, | |
| { | |
| "epoch": 0.905, | |
| "grad_norm": 1.3554507493972778, | |
| "learning_rate": 4.904572576070898e-06, | |
| "loss": 1.9901699829101562, | |
| "step": 9050 | |
| }, | |
| { | |
| "epoch": 0.9075, | |
| "grad_norm": 2.5160086154937744, | |
| "learning_rate": 4.652090174362933e-06, | |
| "loss": 2.355846405029297, | |
| "step": 9075 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 1.3784635066986084, | |
| "learning_rate": 4.406124675636236e-06, | |
| "loss": 1.9769573974609376, | |
| "step": 9100 | |
| }, | |
| { | |
| "epoch": 0.9125, | |
| "grad_norm": 1.8741276264190674, | |
| "learning_rate": 4.166692891305901e-06, | |
| "loss": 2.159720916748047, | |
| "step": 9125 | |
| }, | |
| { | |
| "epoch": 0.915, | |
| "grad_norm": 1.5177477598190308, | |
| "learning_rate": 3.933811186216341e-06, | |
| "loss": 2.190943145751953, | |
| "step": 9150 | |
| }, | |
| { | |
| "epoch": 0.9175, | |
| "grad_norm": 1.6856800317764282, | |
| "learning_rate": 3.70749547752276e-06, | |
| "loss": 1.8975885009765625, | |
| "step": 9175 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 1.606224775314331, | |
| "learning_rate": 3.487761233603204e-06, | |
| "loss": 2.0187437438964846, | |
| "step": 9200 | |
| }, | |
| { | |
| "epoch": 0.9225, | |
| "grad_norm": 1.8462681770324707, | |
| "learning_rate": 3.2746234730013814e-06, | |
| "loss": 2.093716278076172, | |
| "step": 9225 | |
| }, | |
| { | |
| "epoch": 0.925, | |
| "grad_norm": 1.1840476989746094, | |
| "learning_rate": 3.0680967634000855e-06, | |
| "loss": 2.1287353515625, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 0.9275, | |
| "grad_norm": 1.4410308599472046, | |
| "learning_rate": 2.8681952206256024e-06, | |
| "loss": 2.0268960571289063, | |
| "step": 9275 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 2.162745475769043, | |
| "learning_rate": 2.6749325076828147e-06, | |
| "loss": 2.032665100097656, | |
| "step": 9300 | |
| }, | |
| { | |
| "epoch": 0.9325, | |
| "grad_norm": 1.4856213331222534, | |
| "learning_rate": 2.488321833821461e-06, | |
| "loss": 2.0829930114746094, | |
| "step": 9325 | |
| }, | |
| { | |
| "epoch": 0.935, | |
| "grad_norm": 1.5334405899047852, | |
| "learning_rate": 2.3083759536331907e-06, | |
| "loss": 2.0290562438964845, | |
| "step": 9350 | |
| }, | |
| { | |
| "epoch": 0.9375, | |
| "grad_norm": 1.4322729110717773, | |
| "learning_rate": 2.135107166179895e-06, | |
| "loss": 2.0317987060546874, | |
| "step": 9375 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 3.075627326965332, | |
| "learning_rate": 1.9685273141530348e-06, | |
| "loss": 2.0745269775390627, | |
| "step": 9400 | |
| }, | |
| { | |
| "epoch": 0.9425, | |
| "grad_norm": 1.6498782634735107, | |
| "learning_rate": 1.8086477830642211e-06, | |
| "loss": 2.1034091186523436, | |
| "step": 9425 | |
| }, | |
| { | |
| "epoch": 0.945, | |
| "grad_norm": 1.5094914436340332, | |
| "learning_rate": 1.6554795004670388e-06, | |
| "loss": 2.139844970703125, | |
| "step": 9450 | |
| }, | |
| { | |
| "epoch": 0.9475, | |
| "grad_norm": 1.1315068006515503, | |
| "learning_rate": 1.5090329352101197e-06, | |
| "loss": 2.188152313232422, | |
| "step": 9475 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 1.2506731748580933, | |
| "learning_rate": 1.3693180967216612e-06, | |
| "loss": 2.1455296325683593, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "eval_cer": 0.12331175468483815, | |
| "eval_loss": 1.442671537399292, | |
| "eval_runtime": 97.491, | |
| "eval_samples_per_second": 14.935, | |
| "eval_steps_per_second": 0.472, | |
| "eval_wer": 0.24751156596102622, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.9525, | |
| "grad_norm": 1.4666153192520142, | |
| "learning_rate": 1.2363445343253177e-06, | |
| "loss": 2.1449468994140624, | |
| "step": 9525 | |
| }, | |
| { | |
| "epoch": 0.955, | |
| "grad_norm": 1.250496506690979, | |
| "learning_rate": 1.1101213365874109e-06, | |
| "loss": 2.0825015258789064, | |
| "step": 9550 | |
| }, | |
| { | |
| "epoch": 0.9575, | |
| "grad_norm": 1.8249273300170898, | |
| "learning_rate": 9.9065713069586e-07, | |
| "loss": 2.190665435791016, | |
| "step": 9575 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 1.633515477180481, | |
| "learning_rate": 8.779600818704436e-07, | |
| "loss": 2.0684149169921877, | |
| "step": 9600 | |
| }, | |
| { | |
| "epoch": 0.9625, | |
| "grad_norm": 1.526536464691162, | |
| "learning_rate": 7.720378928047334e-07, | |
| "loss": 2.2017979431152344, | |
| "step": 9625 | |
| }, | |
| { | |
| "epoch": 0.965, | |
| "grad_norm": 1.0879954099655151, | |
| "learning_rate": 6.728978031396715e-07, | |
| "loss": 2.0479502868652344, | |
| "step": 9650 | |
| }, | |
| { | |
| "epoch": 0.9675, | |
| "grad_norm": 1.6106431484222412, | |
| "learning_rate": 5.805465889686779e-07, | |
| "loss": 2.167593231201172, | |
| "step": 9675 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 1.4785369634628296, | |
| "learning_rate": 4.949905623745754e-07, | |
| "loss": 2.1969068908691405, | |
| "step": 9700 | |
| }, | |
| { | |
| "epoch": 0.9725, | |
| "grad_norm": 1.4101808071136475, | |
| "learning_rate": 4.162355709981247e-07, | |
| "loss": 1.9459999084472657, | |
| "step": 9725 | |
| }, | |
| { | |
| "epoch": 0.975, | |
| "grad_norm": 1.7263907194137573, | |
| "learning_rate": 3.442869976383767e-07, | |
| "loss": 2.139817199707031, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 0.9775, | |
| "grad_norm": 1.5900930166244507, | |
| "learning_rate": 2.791497598847448e-07, | |
| "loss": 2.2311444091796875, | |
| "step": 9775 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 1.627547264099121, | |
| "learning_rate": 2.2082830978091827e-07, | |
| "loss": 2.224051818847656, | |
| "step": 9800 | |
| }, | |
| { | |
| "epoch": 0.9825, | |
| "grad_norm": 1.6145861148834229, | |
| "learning_rate": 1.693266335205279e-07, | |
| "loss": 2.142480773925781, | |
| "step": 9825 | |
| }, | |
| { | |
| "epoch": 0.985, | |
| "grad_norm": 2.347938060760498, | |
| "learning_rate": 1.2464825117473046e-07, | |
| "loss": 2.230269775390625, | |
| "step": 9850 | |
| }, | |
| { | |
| "epoch": 0.9875, | |
| "grad_norm": 1.9687460660934448, | |
| "learning_rate": 8.679621645162339e-08, | |
| "loss": 2.1646629333496095, | |
| "step": 9875 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 1.6123799085617065, | |
| "learning_rate": 5.577311648748973e-08, | |
| "loss": 2.268137664794922, | |
| "step": 9900 | |
| }, | |
| { | |
| "epoch": 0.9925, | |
| "grad_norm": 2.6218087673187256, | |
| "learning_rate": 3.1581071670006015e-08, | |
| "loss": 2.13885498046875, | |
| "step": 9925 | |
| }, | |
| { | |
| "epoch": 0.995, | |
| "grad_norm": 1.5530320405960083, | |
| "learning_rate": 1.4221735493291643e-08, | |
| "loss": 2.364825439453125, | |
| "step": 9950 | |
| }, | |
| { | |
| "epoch": 0.9975, | |
| "grad_norm": 1.5830848217010498, | |
| "learning_rate": 3.69629444493258e-09, | |
| "loss": 2.3132223510742187, | |
| "step": 9975 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 1.4912697076797485, | |
| "learning_rate": 5.467924824031911e-12, | |
| "loss": 2.1259417724609375, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_cer": 0.12461328790459966, | |
| "eval_loss": 1.4531149864196777, | |
| "eval_runtime": 97.7851, | |
| "eval_samples_per_second": 14.89, | |
| "eval_steps_per_second": 0.47, | |
| "eval_wer": 0.24968456469928502, | |
| "step": 10000 | |
| } | |
| ], | |
| "logging_steps": 25, | |
| "max_steps": 10000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 9223372036854775807, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.210732413610433e+20, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |