Instructions to use FMZGL/Gemma2-9b-cv93 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FMZGL/Gemma2-9b-cv93 with PEFT:
from peft import PeftModel from transformers import AutoModelForSequenceClassification base_model = AutoModelForSequenceClassification.from_pretrained("/root/autodl-tmp/model/gemma2-9b-it-bf16") model = PeftModel.from_pretrained(base_model, "FMZGL/Gemma2-9b-cv93") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 3600, | |
| "best_metric": 0.36828258633613586, | |
| "best_model_checkpoint": "saves/Gemma-2-9B/lora_seqcls/train_seqcls/checkpoint-1000", | |
| "epoch": 2.9603014399138745, | |
| "eval_steps": 100, | |
| "global_step": 5500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0053828556048983985, | |
| "grad_norm": 198.63441467285156, | |
| "learning_rate": 6.474820143884892e-06, | |
| "loss": 19.1404296875, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.010765711209796797, | |
| "grad_norm": 130.11439514160156, | |
| "learning_rate": 1.366906474820144e-05, | |
| "loss": 16.12879333496094, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.016148566814695196, | |
| "grad_norm": 94.73497009277344, | |
| "learning_rate": 2.0863309352517988e-05, | |
| "loss": 11.966738891601562, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.021531422419593594, | |
| "grad_norm": 55.8490104675293, | |
| "learning_rate": 2.805755395683453e-05, | |
| "loss": 9.874456787109375, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.02691427802449199, | |
| "grad_norm": 53.740142822265625, | |
| "learning_rate": 3.5251798561151075e-05, | |
| "loss": 7.273980712890625, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.03229713362939039, | |
| "grad_norm": 83.30630493164062, | |
| "learning_rate": 4.244604316546763e-05, | |
| "loss": 6.787509155273438, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.03767998923428879, | |
| "grad_norm": 96.4136734008789, | |
| "learning_rate": 4.964028776978418e-05, | |
| "loss": 6.7754661560058596, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.04306284483918719, | |
| "grad_norm": 77.66259765625, | |
| "learning_rate": 5.683453237410072e-05, | |
| "loss": 5.704140853881836, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.04844570044408559, | |
| "grad_norm": 46.28746032714844, | |
| "learning_rate": 6.402877697841726e-05, | |
| "loss": 4.287641906738282, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.05382855604898398, | |
| "grad_norm": 121.80719757080078, | |
| "learning_rate": 7.122302158273382e-05, | |
| "loss": 4.469888305664062, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.05382855604898398, | |
| "eval_loss": 1.1105364561080933, | |
| "eval_runtime": 64.1061, | |
| "eval_samples_per_second": 51.524, | |
| "eval_steps_per_second": 12.885, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.059211411653882384, | |
| "grad_norm": 82.3691635131836, | |
| "learning_rate": 7.841726618705037e-05, | |
| "loss": 4.892630767822266, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.06459426725878079, | |
| "grad_norm": 53.88746643066406, | |
| "learning_rate": 8.561151079136692e-05, | |
| "loss": 3.885559844970703, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.06997712286367919, | |
| "grad_norm": 59.405372619628906, | |
| "learning_rate": 9.280575539568345e-05, | |
| "loss": 3.8151809692382814, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.07535997846857757, | |
| "grad_norm": 85.99320220947266, | |
| "learning_rate": 0.0001, | |
| "loss": 4.0115612030029295, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.08074283407347597, | |
| "grad_norm": 40.51960754394531, | |
| "learning_rate": 0.00010719424460431656, | |
| "loss": 3.4070945739746095, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.08612568967837438, | |
| "grad_norm": 73.72062683105469, | |
| "learning_rate": 0.00011438848920863309, | |
| "loss": 4.7824043273925785, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.09150854528327278, | |
| "grad_norm": 62.74378204345703, | |
| "learning_rate": 0.00012158273381294964, | |
| "loss": 4.632376480102539, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.09689140088817118, | |
| "grad_norm": 41.6406364440918, | |
| "learning_rate": 0.0001287769784172662, | |
| "loss": 3.02130126953125, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.10227425649306958, | |
| "grad_norm": 55.67851257324219, | |
| "learning_rate": 0.00013597122302158273, | |
| "loss": 4.105777359008789, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.10765711209796797, | |
| "grad_norm": 88.68601989746094, | |
| "learning_rate": 0.0001431654676258993, | |
| "loss": 3.745909881591797, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.10765711209796797, | |
| "eval_loss": 1.129400610923767, | |
| "eval_runtime": 64.0494, | |
| "eval_samples_per_second": 51.57, | |
| "eval_steps_per_second": 12.896, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.11303996770286637, | |
| "grad_norm": 44.12594223022461, | |
| "learning_rate": 0.00015035971223021583, | |
| "loss": 4.0704700469970705, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.11842282330776477, | |
| "grad_norm": 41.71208572387695, | |
| "learning_rate": 0.00015755395683453237, | |
| "loss": 3.3986480712890623, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.12380567891266317, | |
| "grad_norm": 51.5625, | |
| "learning_rate": 0.00016474820143884893, | |
| "loss": 3.7478317260742187, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.12918853451756157, | |
| "grad_norm": 54.59484100341797, | |
| "learning_rate": 0.00017194244604316547, | |
| "loss": 4.002623748779297, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.13457139012245997, | |
| "grad_norm": 34.029727935791016, | |
| "learning_rate": 0.000179136690647482, | |
| "loss": 3.538894271850586, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.13995424572735837, | |
| "grad_norm": 19.37107276916504, | |
| "learning_rate": 0.00018633093525179857, | |
| "loss": 3.356983184814453, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.14533710133225677, | |
| "grad_norm": 58.17410659790039, | |
| "learning_rate": 0.0001935251798561151, | |
| "loss": 3.4610286712646485, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.15071995693715515, | |
| "grad_norm": 115.1293716430664, | |
| "learning_rate": 0.00019999998240562744, | |
| "loss": 4.566124343872071, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.15610281254205355, | |
| "grad_norm": 52.380348205566406, | |
| "learning_rate": 0.0001999978710884105, | |
| "loss": 4.061540222167968, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.16148566814695195, | |
| "grad_norm": 63.469581604003906, | |
| "learning_rate": 0.00019999224098180877, | |
| "loss": 3.930801773071289, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.16148566814695195, | |
| "eval_loss": 0.9815971255302429, | |
| "eval_runtime": 64.185, | |
| "eval_samples_per_second": 51.461, | |
| "eval_steps_per_second": 12.869, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.16686852375185035, | |
| "grad_norm": 18.164447784423828, | |
| "learning_rate": 0.00019998309228393805, | |
| "loss": 4.083843612670899, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.17225137935674875, | |
| "grad_norm": 93.28253936767578, | |
| "learning_rate": 0.00019997042531672858, | |
| "loss": 3.1324670791625975, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.17763423496164715, | |
| "grad_norm": 49.66929626464844, | |
| "learning_rate": 0.00019995424052591376, | |
| "loss": 4.83184928894043, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.18301709056654555, | |
| "grad_norm": 43.669410705566406, | |
| "learning_rate": 0.00019993453848101442, | |
| "loss": 3.0538238525390624, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.18839994617144395, | |
| "grad_norm": 28.3753719329834, | |
| "learning_rate": 0.00019991131987531877, | |
| "loss": 3.760041427612305, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.19378280177634236, | |
| "grad_norm": 26.99091148376465, | |
| "learning_rate": 0.00019988458552585808, | |
| "loss": 3.3557403564453123, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.19916565738124076, | |
| "grad_norm": 42.94520568847656, | |
| "learning_rate": 0.00019985433637337776, | |
| "loss": 3.5249252319335938, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.20454851298613916, | |
| "grad_norm": 34.760292053222656, | |
| "learning_rate": 0.00019982057348230447, | |
| "loss": 3.889664077758789, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.20993136859103753, | |
| "grad_norm": 22.45956802368164, | |
| "learning_rate": 0.00019978329804070858, | |
| "loss": 3.2252212524414063, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.21531422419593593, | |
| "grad_norm": 54.65021514892578, | |
| "learning_rate": 0.0001997425113602622, | |
| "loss": 3.99298095703125, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.21531422419593593, | |
| "eval_loss": 0.8698179721832275, | |
| "eval_runtime": 64.4139, | |
| "eval_samples_per_second": 51.278, | |
| "eval_steps_per_second": 12.823, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.22069707980083433, | |
| "grad_norm": 37.18206024169922, | |
| "learning_rate": 0.0001996982148761933, | |
| "loss": 2.9811370849609373, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.22607993540573273, | |
| "grad_norm": 33.8664436340332, | |
| "learning_rate": 0.0001996504101472351, | |
| "loss": 2.5169837951660154, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.23146279101063114, | |
| "grad_norm": 45.07470703125, | |
| "learning_rate": 0.00019959909885557112, | |
| "loss": 3.458451843261719, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.23684564661552954, | |
| "grad_norm": 25.689266204833984, | |
| "learning_rate": 0.00019954428280677603, | |
| "loss": 3.2378326416015626, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.24222850222042794, | |
| "grad_norm": 53.7376594543457, | |
| "learning_rate": 0.0001994859639297522, | |
| "loss": 3.302751159667969, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.24761135782532634, | |
| "grad_norm": 49.085391998291016, | |
| "learning_rate": 0.00019942414427666187, | |
| "loss": 2.930678939819336, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.2529942134302247, | |
| "grad_norm": 23.53020477294922, | |
| "learning_rate": 0.00019935882602285462, | |
| "loss": 3.5229896545410155, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.25837706903512314, | |
| "grad_norm": 42.54838562011719, | |
| "learning_rate": 0.00019929001146679127, | |
| "loss": 3.073961639404297, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.2637599246400215, | |
| "grad_norm": 36.783966064453125, | |
| "learning_rate": 0.0001992177030299626, | |
| "loss": 2.839693069458008, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.26914278024491994, | |
| "grad_norm": 29.89275360107422, | |
| "learning_rate": 0.0001991419032568044, | |
| "loss": 3.5954513549804688, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.26914278024491994, | |
| "eval_loss": 0.7735958099365234, | |
| "eval_runtime": 64.2996, | |
| "eval_samples_per_second": 51.369, | |
| "eval_steps_per_second": 12.846, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.2745256358498183, | |
| "grad_norm": 15.766196250915527, | |
| "learning_rate": 0.0001990626148146078, | |
| "loss": 2.6433101654052735, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.27990849145471675, | |
| "grad_norm": 15.622676849365234, | |
| "learning_rate": 0.00019897984049342552, | |
| "loss": 2.2897308349609373, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.2852913470596151, | |
| "grad_norm": 64.56971740722656, | |
| "learning_rate": 0.0001988935832059736, | |
| "loss": 4.1805778503417965, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.29067420266451355, | |
| "grad_norm": 30.153961181640625, | |
| "learning_rate": 0.0001988038459875289, | |
| "loss": 2.8382762908935546, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.2960570582694119, | |
| "grad_norm": 28.525348663330078, | |
| "learning_rate": 0.00019871063199582237, | |
| "loss": 3.3420616149902345, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.3014399138743103, | |
| "grad_norm": 25.80811882019043, | |
| "learning_rate": 0.0001986139445109279, | |
| "loss": 2.491804504394531, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.3068227694792087, | |
| "grad_norm": 42.330684661865234, | |
| "learning_rate": 0.00019851378693514686, | |
| "loss": 3.0271644592285156, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.3122056250841071, | |
| "grad_norm": 40.063087463378906, | |
| "learning_rate": 0.00019841016279288846, | |
| "loss": 2.38574161529541, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.3175884806890055, | |
| "grad_norm": 36.078636169433594, | |
| "learning_rate": 0.0001983030757305456, | |
| "loss": 2.8599777221679688, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.3229713362939039, | |
| "grad_norm": 37.90999984741211, | |
| "learning_rate": 0.0001981925295163667, | |
| "loss": 3.3058528900146484, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.3229713362939039, | |
| "eval_loss": 0.724442720413208, | |
| "eval_runtime": 64.0896, | |
| "eval_samples_per_second": 51.537, | |
| "eval_steps_per_second": 12.888, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.32835419189880233, | |
| "grad_norm": 34.73746871948242, | |
| "learning_rate": 0.00019807852804032305, | |
| "loss": 3.4641307830810546, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.3337370475037007, | |
| "grad_norm": 72.2687759399414, | |
| "learning_rate": 0.00019796107531397188, | |
| "loss": 4.683813858032226, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.33911990310859913, | |
| "grad_norm": 30.93055534362793, | |
| "learning_rate": 0.00019784017547031522, | |
| "loss": 2.6965951919555664, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.3445027587134975, | |
| "grad_norm": 18.676742553710938, | |
| "learning_rate": 0.00019771583276365453, | |
| "loss": 2.5014991760253906, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.34988561431839593, | |
| "grad_norm": 42.73445510864258, | |
| "learning_rate": 0.0001975880515694409, | |
| "loss": 3.033338737487793, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.3552684699232943, | |
| "grad_norm": 47.229732513427734, | |
| "learning_rate": 0.00019745683638412116, | |
| "loss": 3.065496635437012, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.3606513255281927, | |
| "grad_norm": 36.450660705566406, | |
| "learning_rate": 0.00019732219182497964, | |
| "loss": 2.9941673278808594, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.3660341811330911, | |
| "grad_norm": 45.24620056152344, | |
| "learning_rate": 0.00019718412262997566, | |
| "loss": 2.664113998413086, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.3714170367379895, | |
| "grad_norm": 22.437503814697266, | |
| "learning_rate": 0.0001970426336575768, | |
| "loss": 1.6834583282470703, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.3767998923428879, | |
| "grad_norm": 36.59716033935547, | |
| "learning_rate": 0.000196897729886588, | |
| "loss": 2.480428123474121, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.3767998923428879, | |
| "eval_loss": 0.6947948932647705, | |
| "eval_runtime": 64.1166, | |
| "eval_samples_per_second": 51.516, | |
| "eval_steps_per_second": 12.883, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.3821827479477863, | |
| "grad_norm": 45.49883270263672, | |
| "learning_rate": 0.00019674941641597638, | |
| "loss": 2.7860897064208983, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.3875656035526847, | |
| "grad_norm": 33.21625518798828, | |
| "learning_rate": 0.00019659769846469164, | |
| "loss": 3.083520698547363, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.3929484591575831, | |
| "grad_norm": 16.77117919921875, | |
| "learning_rate": 0.00019644258137148263, | |
| "loss": 2.312260055541992, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.3983313147624815, | |
| "grad_norm": 51.02537536621094, | |
| "learning_rate": 0.00019628407059470938, | |
| "loss": 3.675634002685547, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.4037141703673799, | |
| "grad_norm": 20.05516242980957, | |
| "learning_rate": 0.00019612217171215094, | |
| "loss": 2.1038530349731444, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.4090970259722783, | |
| "grad_norm": 35.98112869262695, | |
| "learning_rate": 0.00019595689042080944, | |
| "loss": 2.4246122360229494, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.4144798815771767, | |
| "grad_norm": 27.854074478149414, | |
| "learning_rate": 0.0001957882325367091, | |
| "loss": 2.453342056274414, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.41986273718207506, | |
| "grad_norm": 40.96638870239258, | |
| "learning_rate": 0.000195616203994692, | |
| "loss": 2.2066173553466797, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.4252455927869735, | |
| "grad_norm": 19.81163215637207, | |
| "learning_rate": 0.00019544081084820915, | |
| "loss": 2.4471906661987304, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.43062844839187187, | |
| "grad_norm": 42.2238883972168, | |
| "learning_rate": 0.00019526205926910734, | |
| "loss": 2.8852027893066405, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.43062844839187187, | |
| "eval_loss": 0.7064014077186584, | |
| "eval_runtime": 64.4405, | |
| "eval_samples_per_second": 51.257, | |
| "eval_steps_per_second": 12.818, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.4360113039967703, | |
| "grad_norm": 32.852134704589844, | |
| "learning_rate": 0.00019507995554741205, | |
| "loss": 2.385086441040039, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.44139415960166867, | |
| "grad_norm": 6.121428489685059, | |
| "learning_rate": 0.00019489450609110618, | |
| "loss": 1.8915294647216796, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.4467770152065671, | |
| "grad_norm": 24.810670852661133, | |
| "learning_rate": 0.00019470571742590437, | |
| "loss": 2.8130746841430665, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.45215987081146547, | |
| "grad_norm": 32.280818939208984, | |
| "learning_rate": 0.0001945135961950236, | |
| "loss": 2.450386619567871, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.4575427264163639, | |
| "grad_norm": 48.205787658691406, | |
| "learning_rate": 0.0001943181491589493, | |
| "loss": 3.0519411087036135, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.46292558202126227, | |
| "grad_norm": 22.858253479003906, | |
| "learning_rate": 0.00019411938319519734, | |
| "loss": 2.4671669006347656, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.4683084376261607, | |
| "grad_norm": 45.50665283203125, | |
| "learning_rate": 0.00019391730529807238, | |
| "loss": 2.972084808349609, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.4736912932310591, | |
| "grad_norm": 19.182138442993164, | |
| "learning_rate": 0.0001937119225784213, | |
| "loss": 1.9543575286865233, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.4790741488359575, | |
| "grad_norm": 53.60784149169922, | |
| "learning_rate": 0.00019350324226338338, | |
| "loss": 3.198233413696289, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.4844570044408559, | |
| "grad_norm": 28.96963882446289, | |
| "learning_rate": 0.00019329127169613564, | |
| "loss": 3.061937141418457, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.4844570044408559, | |
| "eval_loss": 0.6995744109153748, | |
| "eval_runtime": 64.1823, | |
| "eval_samples_per_second": 51.463, | |
| "eval_steps_per_second": 12.87, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.48983986004575425, | |
| "grad_norm": 42.73357009887695, | |
| "learning_rate": 0.00019307601833563475, | |
| "loss": 3.221673583984375, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.4952227156506527, | |
| "grad_norm": 21.203781127929688, | |
| "learning_rate": 0.00019285748975635437, | |
| "loss": 2.1903615951538087, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.500605571255551, | |
| "grad_norm": 21.64086151123047, | |
| "learning_rate": 0.0001926356936480186, | |
| "loss": 2.1224742889404298, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.5059884268604494, | |
| "grad_norm": 35.52275466918945, | |
| "learning_rate": 0.0001924106378153316, | |
| "loss": 3.230604553222656, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.5113712824653479, | |
| "grad_norm": 26.517505645751953, | |
| "learning_rate": 0.00019218233017770264, | |
| "loss": 2.1124088287353517, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.5167541380702463, | |
| "grad_norm": 27.521711349487305, | |
| "learning_rate": 0.0001919507787689677, | |
| "loss": 2.729749298095703, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.5221369936751447, | |
| "grad_norm": 33.03516387939453, | |
| "learning_rate": 0.00019171599173710662, | |
| "loss": 1.914764976501465, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.527519849280043, | |
| "grad_norm": 28.447750091552734, | |
| "learning_rate": 0.00019147797734395648, | |
| "loss": 1.99549560546875, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.5329027048849415, | |
| "grad_norm": 19.028818130493164, | |
| "learning_rate": 0.0001912367439649207, | |
| "loss": 1.8732738494873047, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.5382855604898399, | |
| "grad_norm": 26.41012191772461, | |
| "learning_rate": 0.00019099230008867463, | |
| "loss": 2.936910057067871, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.5382855604898399, | |
| "eval_loss": 0.6647254228591919, | |
| "eval_runtime": 64.3533, | |
| "eval_samples_per_second": 51.326, | |
| "eval_steps_per_second": 12.835, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.5436684160947383, | |
| "grad_norm": 29.55500602722168, | |
| "learning_rate": 0.00019074465431686652, | |
| "loss": 2.9467599868774412, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.5490512716996366, | |
| "grad_norm": 15.729572296142578, | |
| "learning_rate": 0.00019049381536381503, | |
| "loss": 2.841005325317383, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.554434127304535, | |
| "grad_norm": 7.53200626373291, | |
| "learning_rate": 0.0001902397920562025, | |
| "loss": 1.8715387344360352, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.5598169829094335, | |
| "grad_norm": 35.68206787109375, | |
| "learning_rate": 0.0001899825933327644, | |
| "loss": 2.8048942565917967, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.5651998385143319, | |
| "grad_norm": 46.12540054321289, | |
| "learning_rate": 0.00018972222824397485, | |
| "loss": 2.888982963562012, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.5705826941192302, | |
| "grad_norm": 28.082979202270508, | |
| "learning_rate": 0.00018945870595172797, | |
| "loss": 2.8277057647705077, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.5759655497241286, | |
| "grad_norm": 8.667706489562988, | |
| "learning_rate": 0.00018919203572901559, | |
| "loss": 1.7566593170166016, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.5813484053290271, | |
| "grad_norm": 32.86021423339844, | |
| "learning_rate": 0.000188922226959601, | |
| "loss": 2.00911922454834, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.5867312609339255, | |
| "grad_norm": 20.026046752929688, | |
| "learning_rate": 0.00018864928913768866, | |
| "loss": 3.050994873046875, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.5921141165388238, | |
| "grad_norm": 34.74673843383789, | |
| "learning_rate": 0.00018837323186759016, | |
| "loss": 2.7538400650024415, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.5921141165388238, | |
| "eval_loss": 0.671667754650116, | |
| "eval_runtime": 64.3041, | |
| "eval_samples_per_second": 51.365, | |
| "eval_steps_per_second": 12.845, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.5974969721437222, | |
| "grad_norm": 26.802404403686523, | |
| "learning_rate": 0.00018809406486338618, | |
| "loss": 2.579293060302734, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.6028798277486206, | |
| "grad_norm": 37.77304458618164, | |
| "learning_rate": 0.00018781179794858478, | |
| "loss": 2.3671943664550783, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.6082626833535191, | |
| "grad_norm": 40.37071228027344, | |
| "learning_rate": 0.00018752644105577565, | |
| "loss": 1.8490634918212892, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.6136455389584174, | |
| "grad_norm": 58.33607482910156, | |
| "learning_rate": 0.0001872380042262806, | |
| "loss": 2.5194568634033203, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.6190283945633158, | |
| "grad_norm": 18.999311447143555, | |
| "learning_rate": 0.0001869464976098003, | |
| "loss": 2.8447465896606445, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.6244112501682142, | |
| "grad_norm": 9.258393287658691, | |
| "learning_rate": 0.00018665193146405695, | |
| "loss": 1.3028793334960938, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.6297941057731127, | |
| "grad_norm": 36.751834869384766, | |
| "learning_rate": 0.00018635431615443354, | |
| "loss": 2.4607158660888673, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.635176961378011, | |
| "grad_norm": 32.03705596923828, | |
| "learning_rate": 0.00018605366215360887, | |
| "loss": 2.4548139572143555, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.6405598169829094, | |
| "grad_norm": 83.0655746459961, | |
| "learning_rate": 0.00018574998004118932, | |
| "loss": 4.094330215454102, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.6459426725878078, | |
| "grad_norm": 16.984663009643555, | |
| "learning_rate": 0.00018544328050333625, | |
| "loss": 2.0978935241699217, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.6459426725878078, | |
| "eval_loss": 0.5826177597045898, | |
| "eval_runtime": 64.1932, | |
| "eval_samples_per_second": 51.454, | |
| "eval_steps_per_second": 12.867, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.6513255281927063, | |
| "grad_norm": 31.547466278076172, | |
| "learning_rate": 0.00018513357433239022, | |
| "loss": 2.314143753051758, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.6567083837976047, | |
| "grad_norm": 50.67429733276367, | |
| "learning_rate": 0.00018482087242649117, | |
| "loss": 4.206168746948242, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.662091239402503, | |
| "grad_norm": 31.81623649597168, | |
| "learning_rate": 0.00018450518578919475, | |
| "loss": 2.8035467147827147, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.6674740950074014, | |
| "grad_norm": 24.316707611083984, | |
| "learning_rate": 0.00018418652552908537, | |
| "loss": 2.3980735778808593, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.6728569506122998, | |
| "grad_norm": 34.293701171875, | |
| "learning_rate": 0.00018386490285938516, | |
| "loss": 2.651681900024414, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.6782398062171983, | |
| "grad_norm": 34.4983024597168, | |
| "learning_rate": 0.0001835403290975594, | |
| "loss": 2.2850324630737306, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.6836226618220966, | |
| "grad_norm": 31.51317596435547, | |
| "learning_rate": 0.00018321281566491835, | |
| "loss": 1.8678964614868163, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.689005517426995, | |
| "grad_norm": 88.34801483154297, | |
| "learning_rate": 0.0001828823740862152, | |
| "loss": 2.051138496398926, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.6943883730318934, | |
| "grad_norm": 23.922054290771484, | |
| "learning_rate": 0.00018254901598924078, | |
| "loss": 1.466459083557129, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.6997712286367919, | |
| "grad_norm": 39.07735824584961, | |
| "learning_rate": 0.00018221275310441405, | |
| "loss": 2.2651920318603516, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.6997712286367919, | |
| "eval_loss": 0.6614837646484375, | |
| "eval_runtime": 63.9775, | |
| "eval_samples_per_second": 51.628, | |
| "eval_steps_per_second": 12.911, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.7051540842416902, | |
| "grad_norm": 51.51314926147461, | |
| "learning_rate": 0.0001818735972643697, | |
| "loss": 2.400813102722168, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.7105369398465886, | |
| "grad_norm": 27.827117919921875, | |
| "learning_rate": 0.0001815315604035414, | |
| "loss": 2.1232112884521483, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.715919795451487, | |
| "grad_norm": 39.04352951049805, | |
| "learning_rate": 0.00018118665455774227, | |
| "loss": 2.0058998107910155, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.7213026510563854, | |
| "grad_norm": 21.7037296295166, | |
| "learning_rate": 0.00018083889186374088, | |
| "loss": 4.023828125, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.7266855066612838, | |
| "grad_norm": 23.27933120727539, | |
| "learning_rate": 0.00018048828455883455, | |
| "loss": 2.1123376846313477, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.7320683622661822, | |
| "grad_norm": 23.154111862182617, | |
| "learning_rate": 0.00018013484498041854, | |
| "loss": 2.0040388107299805, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.7374512178710806, | |
| "grad_norm": 36.17502212524414, | |
| "learning_rate": 0.000179778585565552, | |
| "loss": 1.7808284759521484, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.742834073475979, | |
| "grad_norm": 46.8353385925293, | |
| "learning_rate": 0.0001794195188505203, | |
| "loss": 2.6809072494506836, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.7482169290808774, | |
| "grad_norm": 19.901514053344727, | |
| "learning_rate": 0.00017905765747039385, | |
| "loss": 2.2484678268432616, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.7535997846857758, | |
| "grad_norm": 31.01380729675293, | |
| "learning_rate": 0.0001786930141585836, | |
| "loss": 1.9935230255126952, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.7535997846857758, | |
| "eval_loss": 0.5672405362129211, | |
| "eval_runtime": 64.147, | |
| "eval_samples_per_second": 51.491, | |
| "eval_steps_per_second": 12.877, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.7589826402906742, | |
| "grad_norm": 40.08690643310547, | |
| "learning_rate": 0.00017832560174639282, | |
| "loss": 2.275004577636719, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.7643654958955726, | |
| "grad_norm": 33.389278411865234, | |
| "learning_rate": 0.00017795543316256578, | |
| "loss": 2.6517934799194336, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.769748351500471, | |
| "grad_norm": 24.02670669555664, | |
| "learning_rate": 0.0001775825214328326, | |
| "loss": 1.8687612533569335, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.7751312071053694, | |
| "grad_norm": 39.74971008300781, | |
| "learning_rate": 0.00017720687967945093, | |
| "loss": 2.8546443939208985, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.7805140627102678, | |
| "grad_norm": 42.48725891113281, | |
| "learning_rate": 0.0001768285211207444, | |
| "loss": 2.515781784057617, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.7858969183151662, | |
| "grad_norm": 24.863798141479492, | |
| "learning_rate": 0.00017644745907063723, | |
| "loss": 1.927882766723633, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.7912797739200645, | |
| "grad_norm": 9.220629692077637, | |
| "learning_rate": 0.00017606370693818584, | |
| "loss": 1.976559829711914, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.796662629524963, | |
| "grad_norm": 48.26815414428711, | |
| "learning_rate": 0.000175677278227107, | |
| "loss": 2.111470413208008, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.8020454851298614, | |
| "grad_norm": 39.00963592529297, | |
| "learning_rate": 0.00017528818653530273, | |
| "loss": 1.7109893798828124, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.8074283407347598, | |
| "grad_norm": 24.070545196533203, | |
| "learning_rate": 0.0001748964455543816, | |
| "loss": 3.191597747802734, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.8074283407347598, | |
| "eval_loss": 0.5993195176124573, | |
| "eval_runtime": 63.9501, | |
| "eval_samples_per_second": 51.65, | |
| "eval_steps_per_second": 12.916, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.8128111963396581, | |
| "grad_norm": 12.18187141418457, | |
| "learning_rate": 0.00017450206906917713, | |
| "loss": 2.0544879913330076, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.8181940519445566, | |
| "grad_norm": 28.476694107055664, | |
| "learning_rate": 0.0001741050709572627, | |
| "loss": 2.3975988388061524, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.823576907549455, | |
| "grad_norm": 24.376489639282227, | |
| "learning_rate": 0.0001737054651884631, | |
| "loss": 1.8688972473144532, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.8289597631543534, | |
| "grad_norm": 38.94839096069336, | |
| "learning_rate": 0.00017330326582436304, | |
| "loss": 2.3757015228271485, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.8343426187592518, | |
| "grad_norm": 37.19301223754883, | |
| "learning_rate": 0.00017289848701781244, | |
| "loss": 2.7712066650390623, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.8397254743641501, | |
| "grad_norm": 23.972366333007812, | |
| "learning_rate": 0.0001724911430124281, | |
| "loss": 2.109449005126953, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.8451083299690486, | |
| "grad_norm": 37.52610397338867, | |
| "learning_rate": 0.0001720812481420929, | |
| "loss": 1.802728271484375, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.850491185573947, | |
| "grad_norm": 16.366283416748047, | |
| "learning_rate": 0.00017166881683045103, | |
| "loss": 2.741063117980957, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.8558740411788454, | |
| "grad_norm": 38.8548469543457, | |
| "learning_rate": 0.00017125386359040067, | |
| "loss": 1.7972919464111328, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.8612568967837437, | |
| "grad_norm": 22.872310638427734, | |
| "learning_rate": 0.00017083640302358326, | |
| "loss": 2.159262275695801, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.8612568967837437, | |
| "eval_loss": 0.4924517571926117, | |
| "eval_runtime": 64.2275, | |
| "eval_samples_per_second": 51.427, | |
| "eval_steps_per_second": 12.861, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.8666397523886422, | |
| "grad_norm": 27.983964920043945, | |
| "learning_rate": 0.00017041644981986967, | |
| "loss": 1.717204475402832, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.8720226079935406, | |
| "grad_norm": 21.148286819458008, | |
| "learning_rate": 0.00016999401875684316, | |
| "loss": 2.8551345825195313, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.877405463598439, | |
| "grad_norm": 80.67280578613281, | |
| "learning_rate": 0.0001695691246992797, | |
| "loss": 2.6277225494384764, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.8827883192033373, | |
| "grad_norm": 18.69855308532715, | |
| "learning_rate": 0.0001691417825986245, | |
| "loss": 2.1024648666381838, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.8881711748082358, | |
| "grad_norm": 34.107303619384766, | |
| "learning_rate": 0.00016871200749246626, | |
| "loss": 2.2313766479492188, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.8935540304131342, | |
| "grad_norm": 40.186038970947266, | |
| "learning_rate": 0.00016827981450400774, | |
| "loss": 2.4880607604980467, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.8989368860180326, | |
| "grad_norm": 70.78448486328125, | |
| "learning_rate": 0.00016784521884153362, | |
| "loss": 2.738982582092285, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.9043197416229309, | |
| "grad_norm": 36.99370193481445, | |
| "learning_rate": 0.00016740823579787558, | |
| "loss": 2.254520606994629, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.9097025972278293, | |
| "grad_norm": 39.36662673950195, | |
| "learning_rate": 0.00016696888074987392, | |
| "loss": 1.8448904037475586, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.9150854528327278, | |
| "grad_norm": 61.377532958984375, | |
| "learning_rate": 0.00016652716915783658, | |
| "loss": 2.130519485473633, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.9150854528327278, | |
| "eval_loss": 0.532718300819397, | |
| "eval_runtime": 64.1771, | |
| "eval_samples_per_second": 51.467, | |
| "eval_steps_per_second": 12.871, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.9204683084376262, | |
| "grad_norm": 40.985164642333984, | |
| "learning_rate": 0.00016608311656499504, | |
| "loss": 3.142055702209473, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.9258511640425245, | |
| "grad_norm": 15.224512100219727, | |
| "learning_rate": 0.0001656367385969575, | |
| "loss": 2.681681823730469, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.9312340196474229, | |
| "grad_norm": 30.765071868896484, | |
| "learning_rate": 0.00016518805096115888, | |
| "loss": 2.4531631469726562, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.9366168752523214, | |
| "grad_norm": 39.2271614074707, | |
| "learning_rate": 0.00016473706944630822, | |
| "loss": 1.7306629180908204, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.9419997308572198, | |
| "grad_norm": 28.554643630981445, | |
| "learning_rate": 0.00016428380992183304, | |
| "loss": 2.5790334701538087, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.9473825864621181, | |
| "grad_norm": 31.55245590209961, | |
| "learning_rate": 0.0001638282883373209, | |
| "loss": 2.3022281646728517, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.9527654420670165, | |
| "grad_norm": 29.733423233032227, | |
| "learning_rate": 0.00016337052072195823, | |
| "loss": 1.7397018432617188, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.958148297671915, | |
| "grad_norm": 28.3569393157959, | |
| "learning_rate": 0.00016291052318396625, | |
| "loss": 2.331684112548828, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.9635311532768134, | |
| "grad_norm": 31.536741256713867, | |
| "learning_rate": 0.00016244831191003406, | |
| "loss": 1.9013969421386718, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.9689140088817118, | |
| "grad_norm": 27.39286231994629, | |
| "learning_rate": 0.0001619839031647491, | |
| "loss": 1.9535322189331055, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.9689140088817118, | |
| "eval_loss": 0.4878155589103699, | |
| "eval_runtime": 63.9092, | |
| "eval_samples_per_second": 51.683, | |
| "eval_steps_per_second": 12.925, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.9742968644866101, | |
| "grad_norm": 35.60191345214844, | |
| "learning_rate": 0.00016151731329002505, | |
| "loss": 2.3475147247314454, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.9796797200915085, | |
| "grad_norm": 54.64162826538086, | |
| "learning_rate": 0.0001610485587045263, | |
| "loss": 2.4532806396484377, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.985062575696407, | |
| "grad_norm": 24.01209831237793, | |
| "learning_rate": 0.00016057765590309067, | |
| "loss": 1.9294677734375, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.9904454313013054, | |
| "grad_norm": 28.77838706970215, | |
| "learning_rate": 0.00016010462145614872, | |
| "loss": 2.6661401748657227, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.9958282869062037, | |
| "grad_norm": 23.397241592407227, | |
| "learning_rate": 0.0001596294720091407, | |
| "loss": 2.083774375915527, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 1.0010765711209797, | |
| "grad_norm": 24.451494216918945, | |
| "learning_rate": 0.0001591522242819309, | |
| "loss": 1.6308988571166991, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 1.0064594267258782, | |
| "grad_norm": 35.17308044433594, | |
| "learning_rate": 0.00015867289506821914, | |
| "loss": 2.0649885177612304, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 1.0118422823307764, | |
| "grad_norm": 18.505117416381836, | |
| "learning_rate": 0.00015819150123495005, | |
| "loss": 1.7077461242675782, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 1.017225137935675, | |
| "grad_norm": 32.787864685058594, | |
| "learning_rate": 0.00015770805972171935, | |
| "loss": 1.5830881118774414, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 1.0226079935405732, | |
| "grad_norm": 49.975154876708984, | |
| "learning_rate": 0.00015722258754017783, | |
| "loss": 2.320701026916504, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.0226079935405732, | |
| "eval_loss": 0.5473566055297852, | |
| "eval_runtime": 64.1602, | |
| "eval_samples_per_second": 51.481, | |
| "eval_steps_per_second": 12.874, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.0279908491454717, | |
| "grad_norm": 95.95193481445312, | |
| "learning_rate": 0.00015673510177343283, | |
| "loss": 2.1278076171875, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 1.0333737047503702, | |
| "grad_norm": 38.54022979736328, | |
| "learning_rate": 0.00015624561957544686, | |
| "loss": 1.865066146850586, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 1.0387565603552684, | |
| "grad_norm": 42.10824203491211, | |
| "learning_rate": 0.0001557541581704343, | |
| "loss": 2.5854557037353514, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 1.044139415960167, | |
| "grad_norm": 29.79697608947754, | |
| "learning_rate": 0.00015526073485225506, | |
| "loss": 1.4342741012573241, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 1.0495222715650652, | |
| "grad_norm": 19.559640884399414, | |
| "learning_rate": 0.0001547653669838061, | |
| "loss": 1.4350951194763184, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 1.0549051271699637, | |
| "grad_norm": 36.87428665161133, | |
| "learning_rate": 0.0001542680719964105, | |
| "loss": 1.7127342224121094, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 1.0602879827748621, | |
| "grad_norm": 20.139524459838867, | |
| "learning_rate": 0.000153768867389204, | |
| "loss": 1.6490812301635742, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 1.0656708383797604, | |
| "grad_norm": 32.64472579956055, | |
| "learning_rate": 0.0001532677707285194, | |
| "loss": 1.6485609054565429, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 1.0710536939846589, | |
| "grad_norm": 42.68798828125, | |
| "learning_rate": 0.00015276479964726808, | |
| "loss": 2.758069610595703, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 1.0764365495895571, | |
| "grad_norm": 39.17344284057617, | |
| "learning_rate": 0.0001522599718443199, | |
| "loss": 2.326355743408203, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.0764365495895571, | |
| "eval_loss": 0.5851911306381226, | |
| "eval_runtime": 63.9143, | |
| "eval_samples_per_second": 51.679, | |
| "eval_steps_per_second": 12.924, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.0818194051944556, | |
| "grad_norm": 26.366891860961914, | |
| "learning_rate": 0.0001517533050838802, | |
| "loss": 1.368880844116211, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 1.0872022607993541, | |
| "grad_norm": 50.400123596191406, | |
| "learning_rate": 0.00015124481719486465, | |
| "loss": 1.787089729309082, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 1.0925851164042524, | |
| "grad_norm": 9.160683631896973, | |
| "learning_rate": 0.00015073452607027214, | |
| "loss": 1.864046859741211, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 1.0979679720091509, | |
| "grad_norm": 19.865297317504883, | |
| "learning_rate": 0.00015022244966655482, | |
| "loss": 1.632607650756836, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 1.1033508276140493, | |
| "grad_norm": 49.69865036010742, | |
| "learning_rate": 0.00014970860600298642, | |
| "loss": 1.7247093200683594, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 1.1087336832189476, | |
| "grad_norm": 43.50836181640625, | |
| "learning_rate": 0.0001491930131610282, | |
| "loss": 1.298050880432129, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 1.114116538823846, | |
| "grad_norm": 55.050758361816406, | |
| "learning_rate": 0.00014867568928369256, | |
| "loss": 1.6693323135375977, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 1.1194993944287444, | |
| "grad_norm": 66.28153228759766, | |
| "learning_rate": 0.00014815665257490482, | |
| "loss": 2.2023120880126954, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 1.1248822500336428, | |
| "grad_norm": 38.08374786376953, | |
| "learning_rate": 0.00014763592129886228, | |
| "loss": 1.427632713317871, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 1.1302651056385413, | |
| "grad_norm": 42.69854736328125, | |
| "learning_rate": 0.000147113513779392, | |
| "loss": 2.1791011810302736, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.1302651056385413, | |
| "eval_loss": 0.5500441789627075, | |
| "eval_runtime": 63.9044, | |
| "eval_samples_per_second": 51.687, | |
| "eval_steps_per_second": 12.926, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.1356479612434396, | |
| "grad_norm": 27.943300247192383, | |
| "learning_rate": 0.0001465894483993057, | |
| "loss": 1.6217365264892578, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 1.141030816848338, | |
| "grad_norm": 34.99180221557617, | |
| "learning_rate": 0.00014606374359975286, | |
| "loss": 2.2697931289672852, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 1.1464136724532366, | |
| "grad_norm": 27.82872772216797, | |
| "learning_rate": 0.000145536417879572, | |
| "loss": 2.0169490814208983, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 1.1517965280581348, | |
| "grad_norm": 18.295881271362305, | |
| "learning_rate": 0.00014500748979463966, | |
| "loss": 1.2729131698608398, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 1.1571793836630333, | |
| "grad_norm": 18.062448501586914, | |
| "learning_rate": 0.00014447697795721737, | |
| "loss": 2.3540084838867186, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 1.1625622392679316, | |
| "grad_norm": 41.10131072998047, | |
| "learning_rate": 0.00014394490103529676, | |
| "loss": 2.1076675415039063, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 1.16794509487283, | |
| "grad_norm": 39.552982330322266, | |
| "learning_rate": 0.0001434112777519427, | |
| "loss": 2.1465015411376953, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 1.1733279504777285, | |
| "grad_norm": 28.34930419921875, | |
| "learning_rate": 0.0001428761268846344, | |
| "loss": 1.4876040458679198, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 1.1787108060826268, | |
| "grad_norm": 26.313669204711914, | |
| "learning_rate": 0.00014233946726460462, | |
| "loss": 1.5450728416442872, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 1.1840936616875253, | |
| "grad_norm": 14.592830657958984, | |
| "learning_rate": 0.00014180131777617716, | |
| "loss": 2.097823715209961, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.1840936616875253, | |
| "eval_loss": 0.4937271177768707, | |
| "eval_runtime": 64.1972, | |
| "eval_samples_per_second": 51.451, | |
| "eval_steps_per_second": 12.867, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.1894765172924235, | |
| "grad_norm": 57.555904388427734, | |
| "learning_rate": 0.00014126169735610225, | |
| "loss": 1.3126806259155273, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 1.194859372897322, | |
| "grad_norm": 49.10297775268555, | |
| "learning_rate": 0.00014072062499289023, | |
| "loss": 1.8571784973144532, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 1.2002422285022205, | |
| "grad_norm": 63.582420349121094, | |
| "learning_rate": 0.00014017811972614325, | |
| "loss": 1.6554574966430664, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 1.2056250841071188, | |
| "grad_norm": 38.78810501098633, | |
| "learning_rate": 0.0001396342006458855, | |
| "loss": 1.6202888488769531, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 1.2110079397120173, | |
| "grad_norm": 27.394638061523438, | |
| "learning_rate": 0.00013908888689189133, | |
| "loss": 2.127480697631836, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 1.2163907953169155, | |
| "grad_norm": 48.140830993652344, | |
| "learning_rate": 0.00013854219765301165, | |
| "loss": 1.8078197479248046, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 1.221773650921814, | |
| "grad_norm": 44.98652267456055, | |
| "learning_rate": 0.00013799415216649897, | |
| "loss": 2.2878448486328127, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 1.2271565065267125, | |
| "grad_norm": 10.705018043518066, | |
| "learning_rate": 0.0001374447697173303, | |
| "loss": 2.145868682861328, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 1.2325393621316107, | |
| "grad_norm": 27.23916244506836, | |
| "learning_rate": 0.00013689406963752844, | |
| "loss": 1.3377301216125488, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 1.2379222177365092, | |
| "grad_norm": 34.806480407714844, | |
| "learning_rate": 0.00013634207130548194, | |
| "loss": 1.9754547119140624, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.2379222177365092, | |
| "eval_loss": 0.47936686873435974, | |
| "eval_runtime": 64.2268, | |
| "eval_samples_per_second": 51.427, | |
| "eval_steps_per_second": 12.861, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.2433050733414075, | |
| "grad_norm": 32.58279037475586, | |
| "learning_rate": 0.00013578879414526292, | |
| "loss": 1.7109735488891602, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 1.248687928946306, | |
| "grad_norm": 33.94943618774414, | |
| "learning_rate": 0.000135234257625944, | |
| "loss": 2.3083892822265626, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 1.2540707845512045, | |
| "grad_norm": 35.721805572509766, | |
| "learning_rate": 0.00013467848126091266, | |
| "loss": 1.966238021850586, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 1.259453640156103, | |
| "grad_norm": 22.220964431762695, | |
| "learning_rate": 0.00013412148460718507, | |
| "loss": 1.9786643981933594, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 1.2648364957610012, | |
| "grad_norm": 22.529788970947266, | |
| "learning_rate": 0.00013356328726471753, | |
| "loss": 2.2097476959228515, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 1.2702193513658995, | |
| "grad_norm": 14.958813667297363, | |
| "learning_rate": 0.00013300390887571715, | |
| "loss": 1.8351505279541016, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 1.275602206970798, | |
| "grad_norm": 17.01559829711914, | |
| "learning_rate": 0.00013244336912395026, | |
| "loss": 1.9661121368408203, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 1.2809850625756964, | |
| "grad_norm": 28.454547882080078, | |
| "learning_rate": 0.00013188168773405008, | |
| "loss": 1.6221160888671875, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 1.286367918180595, | |
| "grad_norm": 41.18201446533203, | |
| "learning_rate": 0.00013131888447082254, | |
| "loss": 1.636754035949707, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 1.2917507737854932, | |
| "grad_norm": 34.558536529541016, | |
| "learning_rate": 0.00013075497913855072, | |
| "loss": 1.8497133255004883, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 1.2917507737854932, | |
| "eval_loss": 0.5467978119850159, | |
| "eval_runtime": 64.2912, | |
| "eval_samples_per_second": 51.376, | |
| "eval_steps_per_second": 12.848, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 1.2971336293903917, | |
| "grad_norm": 43.164146423339844, | |
| "learning_rate": 0.00013018999158029802, | |
| "loss": 2.0868755340576173, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 1.30251648499529, | |
| "grad_norm": 13.502433776855469, | |
| "learning_rate": 0.00012962394167720997, | |
| "loss": 2.3471694946289063, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 1.3078993406001884, | |
| "grad_norm": 11.673425674438477, | |
| "learning_rate": 0.00012905684934781447, | |
| "loss": 0.8880938529968262, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 1.313282196205087, | |
| "grad_norm": 24.767826080322266, | |
| "learning_rate": 0.00012848873454732106, | |
| "loss": 1.9171413421630858, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 1.3186650518099852, | |
| "grad_norm": 31.41339111328125, | |
| "learning_rate": 0.0001279196172669186, | |
| "loss": 1.550046443939209, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 1.3240479074148837, | |
| "grad_norm": 42.19283676147461, | |
| "learning_rate": 0.00012734951753307194, | |
| "loss": 1.5069122314453125, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 1.329430763019782, | |
| "grad_norm": 34.4764289855957, | |
| "learning_rate": 0.00012677845540681702, | |
| "loss": 1.5139981269836427, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 1.3348136186246804, | |
| "grad_norm": 45.293399810791016, | |
| "learning_rate": 0.00012620645098305514, | |
| "loss": 2.5238950729370115, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 1.3401964742295789, | |
| "grad_norm": 21.721302032470703, | |
| "learning_rate": 0.0001256335243898458, | |
| "loss": 2.452337646484375, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 1.3455793298344771, | |
| "grad_norm": 32.277462005615234, | |
| "learning_rate": 0.00012505969578769827, | |
| "loss": 1.747513198852539, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.3455793298344771, | |
| "eval_loss": 0.5084195137023926, | |
| "eval_runtime": 64.3491, | |
| "eval_samples_per_second": 51.329, | |
| "eval_steps_per_second": 12.836, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.3509621854393756, | |
| "grad_norm": 28.49180793762207, | |
| "learning_rate": 0.00012448498536886242, | |
| "loss": 1.7691278457641602, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 1.356345041044274, | |
| "grad_norm": 19.427194595336914, | |
| "learning_rate": 0.00012390941335661793, | |
| "loss": 1.7051538467407226, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 1.3617278966491724, | |
| "grad_norm": 25.067476272583008, | |
| "learning_rate": 0.00012333300000456294, | |
| "loss": 1.2319503784179688, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 1.3671107522540709, | |
| "grad_norm": 43.21786880493164, | |
| "learning_rate": 0.00012275576559590107, | |
| "loss": 1.9394664764404297, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 1.3724936078589691, | |
| "grad_norm": 33.55292510986328, | |
| "learning_rate": 0.0001221777304427278, | |
| "loss": 1.6529422760009767, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 1.3778764634638676, | |
| "grad_norm": 17.388324737548828, | |
| "learning_rate": 0.00012159891488531583, | |
| "loss": 1.6362987518310548, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 1.3832593190687659, | |
| "grad_norm": 11.812196731567383, | |
| "learning_rate": 0.00012101933929139911, | |
| "loss": 1.3777896881103515, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 1.3886421746736644, | |
| "grad_norm": 10.543932914733887, | |
| "learning_rate": 0.00012043902405545635, | |
| "loss": 1.7387680053710937, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 1.3940250302785628, | |
| "grad_norm": 25.3862247467041, | |
| "learning_rate": 0.00011985798959799315, | |
| "loss": 1.6691925048828125, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 1.399407885883461, | |
| "grad_norm": 44.17007064819336, | |
| "learning_rate": 0.00011927625636482364, | |
| "loss": 1.8721656799316406, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 1.399407885883461, | |
| "eval_loss": 0.5541885495185852, | |
| "eval_runtime": 63.9819, | |
| "eval_samples_per_second": 51.624, | |
| "eval_steps_per_second": 12.91, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 1.4047907414883596, | |
| "grad_norm": 30.539979934692383, | |
| "learning_rate": 0.00011869384482635087, | |
| "loss": 1.5085716247558594, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 1.4101735970932578, | |
| "grad_norm": 39.790950775146484, | |
| "learning_rate": 0.00011811077547684652, | |
| "loss": 1.9276805877685548, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 1.4155564526981563, | |
| "grad_norm": 26.07389259338379, | |
| "learning_rate": 0.00011752706883372975, | |
| "loss": 1.6762975692749023, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 1.4209393083030548, | |
| "grad_norm": 19.482772827148438, | |
| "learning_rate": 0.00011694274543684525, | |
| "loss": 1.6249858856201171, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 1.4263221639079533, | |
| "grad_norm": 27.41213607788086, | |
| "learning_rate": 0.00011635782584774042, | |
| "loss": 1.7710115432739257, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 1.4317050195128516, | |
| "grad_norm": 44.63675308227539, | |
| "learning_rate": 0.00011577233064894184, | |
| "loss": 1.3814048767089844, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 1.43708787511775, | |
| "grad_norm": 35.491634368896484, | |
| "learning_rate": 0.00011518628044323105, | |
| "loss": 2.505926322937012, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 1.4424707307226483, | |
| "grad_norm": 19.543800354003906, | |
| "learning_rate": 0.00011459969585291952, | |
| "loss": 1.4784714698791503, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 1.4478535863275468, | |
| "grad_norm": 17.39204978942871, | |
| "learning_rate": 0.00011401259751912294, | |
| "loss": 1.8356576919555665, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 1.4532364419324453, | |
| "grad_norm": 30.696813583374023, | |
| "learning_rate": 0.000113425006101035, | |
| "loss": 1.7911975860595704, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 1.4532364419324453, | |
| "eval_loss": 0.4373091459274292, | |
| "eval_runtime": 63.9584, | |
| "eval_samples_per_second": 51.643, | |
| "eval_steps_per_second": 12.915, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 1.4586192975373435, | |
| "grad_norm": 62.493797302246094, | |
| "learning_rate": 0.00011283694227520032, | |
| "loss": 1.1635123252868653, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 1.464002153142242, | |
| "grad_norm": 37.97821807861328, | |
| "learning_rate": 0.00011224842673478692, | |
| "loss": 1.40887451171875, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 1.4693850087471403, | |
| "grad_norm": 29.938425064086914, | |
| "learning_rate": 0.00011165948018885803, | |
| "loss": 1.6324567794799805, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 1.4747678643520388, | |
| "grad_norm": 20.280174255371094, | |
| "learning_rate": 0.00011107012336164342, | |
| "loss": 1.2600415229797364, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 1.4801507199569373, | |
| "grad_norm": 37.221309661865234, | |
| "learning_rate": 0.00011048037699181007, | |
| "loss": 1.7051061630249023, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 1.4855335755618355, | |
| "grad_norm": 10.49577808380127, | |
| "learning_rate": 0.00010989026183173241, | |
| "loss": 1.4941570281982421, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 1.490916431166734, | |
| "grad_norm": 22.56839370727539, | |
| "learning_rate": 0.00010929979864676214, | |
| "loss": 1.240116786956787, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 1.4962992867716323, | |
| "grad_norm": 19.91226577758789, | |
| "learning_rate": 0.00010870900821449747, | |
| "loss": 1.3393290519714356, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 1.5016821423765307, | |
| "grad_norm": 32.016357421875, | |
| "learning_rate": 0.00010811791132405202, | |
| "loss": 1.7406791687011718, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 1.5070649979814292, | |
| "grad_norm": 50.24219512939453, | |
| "learning_rate": 0.00010752652877532318, | |
| "loss": 1.9366174697875977, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 1.5070649979814292, | |
| "eval_loss": 0.43302831053733826, | |
| "eval_runtime": 63.946, | |
| "eval_samples_per_second": 51.653, | |
| "eval_steps_per_second": 12.917, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 1.5124478535863275, | |
| "grad_norm": 35.96293258666992, | |
| "learning_rate": 0.00010693488137826042, | |
| "loss": 1.8892341613769532, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 1.517830709191226, | |
| "grad_norm": 20.087125778198242, | |
| "learning_rate": 0.00010634298995213267, | |
| "loss": 1.5483041763305665, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 1.5232135647961242, | |
| "grad_norm": 44.48786926269531, | |
| "learning_rate": 0.00010575087532479608, | |
| "loss": 2.049909210205078, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 1.5285964204010227, | |
| "grad_norm": 13.480371475219727, | |
| "learning_rate": 0.0001051585583319608, | |
| "loss": 1.4279634475708007, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 1.5339792760059212, | |
| "grad_norm": 12.939706802368164, | |
| "learning_rate": 0.0001045660598164581, | |
| "loss": 1.3665541648864745, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 1.5393621316108197, | |
| "grad_norm": 12.383955001831055, | |
| "learning_rate": 0.00010397340062750666, | |
| "loss": 1.9608146667480468, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 1.544744987215718, | |
| "grad_norm": 31.020015716552734, | |
| "learning_rate": 0.00010338060161997911, | |
| "loss": 1.3746890068054198, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 1.5501278428206162, | |
| "grad_norm": 38.224365234375, | |
| "learning_rate": 0.00010278768365366809, | |
| "loss": 1.9677223205566405, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 1.5555106984255147, | |
| "grad_norm": 16.846071243286133, | |
| "learning_rate": 0.00010219466759255225, | |
| "loss": 2.040707588195801, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 1.5608935540304132, | |
| "grad_norm": 14.602941513061523, | |
| "learning_rate": 0.00010160157430406201, | |
| "loss": 1.4509224891662598, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 1.5608935540304132, | |
| "eval_loss": 0.4190095067024231, | |
| "eval_runtime": 63.6149, | |
| "eval_samples_per_second": 51.922, | |
| "eval_steps_per_second": 12.984, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 1.5662764096353117, | |
| "grad_norm": 6.937775611877441, | |
| "learning_rate": 0.00010100842465834537, | |
| "loss": 1.9573307037353516, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 1.57165926524021, | |
| "grad_norm": 30.520694732666016, | |
| "learning_rate": 0.00010041523952753346, | |
| "loss": 1.8950252532958984, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 1.5770421208451082, | |
| "grad_norm": 38.1561279296875, | |
| "learning_rate": 9.982203978500608e-05, | |
| "loss": 1.7020187377929688, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 1.5824249764500067, | |
| "grad_norm": 27.7998104095459, | |
| "learning_rate": 9.922884630465717e-05, | |
| "loss": 1.7406475067138671, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 1.5878078320549052, | |
| "grad_norm": 20.777448654174805, | |
| "learning_rate": 9.86356799601603e-05, | |
| "loss": 1.344972515106201, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 1.5931906876598037, | |
| "grad_norm": 18.08922004699707, | |
| "learning_rate": 9.804256162423427e-05, | |
| "loss": 1.6805049896240234, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 1.598573543264702, | |
| "grad_norm": 15.266389846801758, | |
| "learning_rate": 9.744951216790837e-05, | |
| "loss": 1.569887638092041, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 1.6039563988696002, | |
| "grad_norm": 24.077733993530273, | |
| "learning_rate": 9.685655245978823e-05, | |
| "loss": 1.4327526092529297, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 1.6093392544744987, | |
| "grad_norm": 29.76258087158203, | |
| "learning_rate": 9.626370336532132e-05, | |
| "loss": 1.696345901489258, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 1.6147221100793971, | |
| "grad_norm": 22.80702781677246, | |
| "learning_rate": 9.567098574606279e-05, | |
| "loss": 0.9164070129394531, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.6147221100793971, | |
| "eval_loss": 0.45202314853668213, | |
| "eval_runtime": 63.7845, | |
| "eval_samples_per_second": 51.784, | |
| "eval_steps_per_second": 12.95, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.6201049656842956, | |
| "grad_norm": 28.408498764038086, | |
| "learning_rate": 9.507842045894128e-05, | |
| "loss": 1.2415037155151367, | |
| "step": 3010 | |
| }, | |
| { | |
| "epoch": 1.625487821289194, | |
| "grad_norm": 17.381816864013672, | |
| "learning_rate": 9.448602835552512e-05, | |
| "loss": 1.1174392700195312, | |
| "step": 3020 | |
| }, | |
| { | |
| "epoch": 1.6308706768940922, | |
| "grad_norm": 41.50532913208008, | |
| "learning_rate": 9.389383028128866e-05, | |
| "loss": 2.0566314697265624, | |
| "step": 3030 | |
| }, | |
| { | |
| "epoch": 1.6362535324989906, | |
| "grad_norm": 43.86766052246094, | |
| "learning_rate": 9.330184707487837e-05, | |
| "loss": 1.5256672859191895, | |
| "step": 3040 | |
| }, | |
| { | |
| "epoch": 1.6416363881038891, | |
| "grad_norm": 22.702362060546875, | |
| "learning_rate": 9.271009956738004e-05, | |
| "loss": 1.5772756576538085, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 1.6470192437087876, | |
| "grad_norm": 20.469390869140625, | |
| "learning_rate": 9.211860858158538e-05, | |
| "loss": 1.4132847785949707, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 1.6524020993136859, | |
| "grad_norm": 23.878665924072266, | |
| "learning_rate": 9.152739493125962e-05, | |
| "loss": 1.7029796600341798, | |
| "step": 3070 | |
| }, | |
| { | |
| "epoch": 1.6577849549185844, | |
| "grad_norm": 20.67031478881836, | |
| "learning_rate": 9.09364794204087e-05, | |
| "loss": 1.7173995971679688, | |
| "step": 3080 | |
| }, | |
| { | |
| "epoch": 1.6631678105234826, | |
| "grad_norm": 26.168128967285156, | |
| "learning_rate": 9.034588284254765e-05, | |
| "loss": 1.3580098152160645, | |
| "step": 3090 | |
| }, | |
| { | |
| "epoch": 1.668550666128381, | |
| "grad_norm": 36.75242233276367, | |
| "learning_rate": 8.975562597996855e-05, | |
| "loss": 1.6930839538574218, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 1.668550666128381, | |
| "eval_loss": 0.4625987410545349, | |
| "eval_runtime": 63.5645, | |
| "eval_samples_per_second": 51.963, | |
| "eval_steps_per_second": 12.995, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 1.6739335217332796, | |
| "grad_norm": 26.191268920898438, | |
| "learning_rate": 8.916572960300947e-05, | |
| "loss": 2.067066955566406, | |
| "step": 3110 | |
| }, | |
| { | |
| "epoch": 1.679316377338178, | |
| "grad_norm": 30.239843368530273, | |
| "learning_rate": 8.857621446932334e-05, | |
| "loss": 1.3582192420959474, | |
| "step": 3120 | |
| }, | |
| { | |
| "epoch": 1.6846992329430763, | |
| "grad_norm": 11.36849308013916, | |
| "learning_rate": 8.798710132314778e-05, | |
| "loss": 1.4313419342041016, | |
| "step": 3130 | |
| }, | |
| { | |
| "epoch": 1.6900820885479746, | |
| "grad_norm": 24.18775177001953, | |
| "learning_rate": 8.739841089457494e-05, | |
| "loss": 1.6131771087646485, | |
| "step": 3140 | |
| }, | |
| { | |
| "epoch": 1.695464944152873, | |
| "grad_norm": 17.61792755126953, | |
| "learning_rate": 8.681016389882217e-05, | |
| "loss": 1.5064881324768067, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 1.7008477997577716, | |
| "grad_norm": 36.965396881103516, | |
| "learning_rate": 8.622238103550293e-05, | |
| "loss": 2.0960357666015623, | |
| "step": 3160 | |
| }, | |
| { | |
| "epoch": 1.70623065536267, | |
| "grad_norm": 15.143284797668457, | |
| "learning_rate": 8.563508298789865e-05, | |
| "loss": 1.0306715011596679, | |
| "step": 3170 | |
| }, | |
| { | |
| "epoch": 1.7116135109675683, | |
| "grad_norm": 21.073841094970703, | |
| "learning_rate": 8.504829042223055e-05, | |
| "loss": 1.4934981346130372, | |
| "step": 3180 | |
| }, | |
| { | |
| "epoch": 1.7169963665724666, | |
| "grad_norm": 14.031085968017578, | |
| "learning_rate": 8.44620239869328e-05, | |
| "loss": 1.470815372467041, | |
| "step": 3190 | |
| }, | |
| { | |
| "epoch": 1.722379222177365, | |
| "grad_norm": 12.69394302368164, | |
| "learning_rate": 8.387630431192562e-05, | |
| "loss": 1.4816364288330077, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 1.722379222177365, | |
| "eval_loss": 0.4099518358707428, | |
| "eval_runtime": 63.7017, | |
| "eval_samples_per_second": 51.851, | |
| "eval_steps_per_second": 12.967, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 1.7277620777822635, | |
| "grad_norm": 36.04399871826172, | |
| "learning_rate": 8.329115200788962e-05, | |
| "loss": 1.2866575241088867, | |
| "step": 3210 | |
| }, | |
| { | |
| "epoch": 1.733144933387162, | |
| "grad_norm": 15.661164283752441, | |
| "learning_rate": 8.270658766554023e-05, | |
| "loss": 1.2794793128967286, | |
| "step": 3220 | |
| }, | |
| { | |
| "epoch": 1.7385277889920603, | |
| "grad_norm": 14.594550132751465, | |
| "learning_rate": 8.212263185490347e-05, | |
| "loss": 0.900571060180664, | |
| "step": 3230 | |
| }, | |
| { | |
| "epoch": 1.7439106445969585, | |
| "grad_norm": 23.809280395507812, | |
| "learning_rate": 8.153930512459182e-05, | |
| "loss": 1.2999605178833007, | |
| "step": 3240 | |
| }, | |
| { | |
| "epoch": 1.749293500201857, | |
| "grad_norm": 24.3289737701416, | |
| "learning_rate": 8.095662800108141e-05, | |
| "loss": 0.756270456314087, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 1.7546763558067555, | |
| "grad_norm": 55.45784378051758, | |
| "learning_rate": 8.037462098798942e-05, | |
| "loss": 1.5912586212158204, | |
| "step": 3260 | |
| }, | |
| { | |
| "epoch": 1.760059211411654, | |
| "grad_norm": 20.93805694580078, | |
| "learning_rate": 7.97933045653529e-05, | |
| "loss": 1.602321243286133, | |
| "step": 3270 | |
| }, | |
| { | |
| "epoch": 1.7654420670165523, | |
| "grad_norm": 37.905189514160156, | |
| "learning_rate": 7.92126991889079e-05, | |
| "loss": 1.5339111328125, | |
| "step": 3280 | |
| }, | |
| { | |
| "epoch": 1.7708249226214505, | |
| "grad_norm": 24.21660804748535, | |
| "learning_rate": 7.863282528936978e-05, | |
| "loss": 1.646210289001465, | |
| "step": 3290 | |
| }, | |
| { | |
| "epoch": 1.776207778226349, | |
| "grad_norm": 18.371828079223633, | |
| "learning_rate": 7.805370327171402e-05, | |
| "loss": 1.3416717529296875, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 1.776207778226349, | |
| "eval_loss": 0.4250826835632324, | |
| "eval_runtime": 63.8411, | |
| "eval_samples_per_second": 51.738, | |
| "eval_steps_per_second": 12.938, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 1.7815906338312475, | |
| "grad_norm": 37.405426025390625, | |
| "learning_rate": 7.747535351445871e-05, | |
| "loss": 1.5578692436218262, | |
| "step": 3310 | |
| }, | |
| { | |
| "epoch": 1.786973489436146, | |
| "grad_norm": 62.97222900390625, | |
| "learning_rate": 7.689779636894687e-05, | |
| "loss": 2.0751113891601562, | |
| "step": 3320 | |
| }, | |
| { | |
| "epoch": 1.7923563450410442, | |
| "grad_norm": 24.98927879333496, | |
| "learning_rate": 7.632105215863072e-05, | |
| "loss": 1.8148933410644532, | |
| "step": 3330 | |
| }, | |
| { | |
| "epoch": 1.7977392006459427, | |
| "grad_norm": 17.803342819213867, | |
| "learning_rate": 7.57451411783564e-05, | |
| "loss": 1.1781111717224122, | |
| "step": 3340 | |
| }, | |
| { | |
| "epoch": 1.803122056250841, | |
| "grad_norm": 31.60127067565918, | |
| "learning_rate": 7.517008369364973e-05, | |
| "loss": 1.2258566856384276, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 1.8085049118557395, | |
| "grad_norm": 21.834125518798828, | |
| "learning_rate": 7.459589994000331e-05, | |
| "loss": 1.8756603240966796, | |
| "step": 3360 | |
| }, | |
| { | |
| "epoch": 1.813887767460638, | |
| "grad_norm": 8.82114315032959, | |
| "learning_rate": 7.402261012216418e-05, | |
| "loss": 1.5807505607604981, | |
| "step": 3370 | |
| }, | |
| { | |
| "epoch": 1.8192706230655362, | |
| "grad_norm": 6.503419399261475, | |
| "learning_rate": 7.345023441342312e-05, | |
| "loss": 1.110390567779541, | |
| "step": 3380 | |
| }, | |
| { | |
| "epoch": 1.8246534786704347, | |
| "grad_norm": 17.47008514404297, | |
| "learning_rate": 7.287879295490454e-05, | |
| "loss": 1.7794336318969726, | |
| "step": 3390 | |
| }, | |
| { | |
| "epoch": 1.830036334275333, | |
| "grad_norm": 20.7091121673584, | |
| "learning_rate": 7.230830585485799e-05, | |
| "loss": 1.1825596809387207, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 1.830036334275333, | |
| "eval_loss": 0.3694857954978943, | |
| "eval_runtime": 63.578, | |
| "eval_samples_per_second": 51.952, | |
| "eval_steps_per_second": 12.992, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 1.8354191898802314, | |
| "grad_norm": 26.3618221282959, | |
| "learning_rate": 7.173879318795027e-05, | |
| "loss": 1.3671013832092285, | |
| "step": 3410 | |
| }, | |
| { | |
| "epoch": 1.84080204548513, | |
| "grad_norm": 14.309059143066406, | |
| "learning_rate": 7.117027499455938e-05, | |
| "loss": 1.7152782440185548, | |
| "step": 3420 | |
| }, | |
| { | |
| "epoch": 1.8461849010900284, | |
| "grad_norm": 14.735411643981934, | |
| "learning_rate": 7.060277128006896e-05, | |
| "loss": 1.2705150604248048, | |
| "step": 3430 | |
| }, | |
| { | |
| "epoch": 1.8515677566949267, | |
| "grad_norm": 37.376731872558594, | |
| "learning_rate": 7.003630201416469e-05, | |
| "loss": 0.823548698425293, | |
| "step": 3440 | |
| }, | |
| { | |
| "epoch": 1.856950612299825, | |
| "grad_norm": 30.746421813964844, | |
| "learning_rate": 6.947088713013127e-05, | |
| "loss": 1.9406600952148438, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 1.8623334679047234, | |
| "grad_norm": 28.229276657104492, | |
| "learning_rate": 6.89065465241513e-05, | |
| "loss": 1.542259120941162, | |
| "step": 3460 | |
| }, | |
| { | |
| "epoch": 1.867716323509622, | |
| "grad_norm": 6.486597537994385, | |
| "learning_rate": 6.834330005460472e-05, | |
| "loss": 1.522111701965332, | |
| "step": 3470 | |
| }, | |
| { | |
| "epoch": 1.8730991791145204, | |
| "grad_norm": 21.441097259521484, | |
| "learning_rate": 6.778116754137058e-05, | |
| "loss": 1.2606025695800782, | |
| "step": 3480 | |
| }, | |
| { | |
| "epoch": 1.8784820347194187, | |
| "grad_norm": 7.534696102142334, | |
| "learning_rate": 6.722016876512916e-05, | |
| "loss": 1.5245902061462402, | |
| "step": 3490 | |
| }, | |
| { | |
| "epoch": 1.883864890324317, | |
| "grad_norm": 32.19171142578125, | |
| "learning_rate": 6.666032346666613e-05, | |
| "loss": 1.5431558609008789, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 1.883864890324317, | |
| "eval_loss": 0.37625691294670105, | |
| "eval_runtime": 63.829, | |
| "eval_samples_per_second": 51.748, | |
| "eval_steps_per_second": 12.941, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 1.8892477459292154, | |
| "grad_norm": 23.33196258544922, | |
| "learning_rate": 6.610165134617778e-05, | |
| "loss": 1.21827974319458, | |
| "step": 3510 | |
| }, | |
| { | |
| "epoch": 1.894630601534114, | |
| "grad_norm": 40.78279113769531, | |
| "learning_rate": 6.554417206257795e-05, | |
| "loss": 1.7008653640747071, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 1.9000134571390124, | |
| "grad_norm": 23.865211486816406, | |
| "learning_rate": 6.498790523280607e-05, | |
| "loss": 1.0905473709106446, | |
| "step": 3530 | |
| }, | |
| { | |
| "epoch": 1.9053963127439106, | |
| "grad_norm": 26.986589431762695, | |
| "learning_rate": 6.44328704311371e-05, | |
| "loss": 1.2692423820495606, | |
| "step": 3540 | |
| }, | |
| { | |
| "epoch": 1.910779168348809, | |
| "grad_norm": 15.614501953125, | |
| "learning_rate": 6.387908718849239e-05, | |
| "loss": 1.1699938774108887, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 1.9161620239537074, | |
| "grad_norm": 16.81165313720703, | |
| "learning_rate": 6.332657499175291e-05, | |
| "loss": 1.7018922805786132, | |
| "step": 3560 | |
| }, | |
| { | |
| "epoch": 1.9215448795586059, | |
| "grad_norm": 23.331390380859375, | |
| "learning_rate": 6.277535328307296e-05, | |
| "loss": 1.1255874633789062, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 1.9269277351635044, | |
| "grad_norm": 24.57452964782715, | |
| "learning_rate": 6.222544145919653e-05, | |
| "loss": 2.053675079345703, | |
| "step": 3580 | |
| }, | |
| { | |
| "epoch": 1.9323105907684026, | |
| "grad_norm": 13.287324905395508, | |
| "learning_rate": 6.167685887077444e-05, | |
| "loss": 1.2274766921997071, | |
| "step": 3590 | |
| }, | |
| { | |
| "epoch": 1.9376934463733009, | |
| "grad_norm": 18.1403865814209, | |
| "learning_rate": 6.112962482168356e-05, | |
| "loss": 1.2781085968017578, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 1.9376934463733009, | |
| "eval_loss": 0.36828258633613586, | |
| "eval_runtime": 63.8932, | |
| "eval_samples_per_second": 51.696, | |
| "eval_steps_per_second": 12.928, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 1.9430763019781994, | |
| "grad_norm": 19.552724838256836, | |
| "learning_rate": 6.058375856834742e-05, | |
| "loss": 1.5518939971923829, | |
| "step": 3610 | |
| }, | |
| { | |
| "epoch": 1.9484591575830978, | |
| "grad_norm": 25.114530563354492, | |
| "learning_rate": 6.003927931905875e-05, | |
| "loss": 1.3678104400634765, | |
| "step": 3620 | |
| }, | |
| { | |
| "epoch": 1.9538420131879963, | |
| "grad_norm": 24.832029342651367, | |
| "learning_rate": 5.949620623330351e-05, | |
| "loss": 1.3850306510925292, | |
| "step": 3630 | |
| }, | |
| { | |
| "epoch": 1.9592248687928946, | |
| "grad_norm": 28.975635528564453, | |
| "learning_rate": 5.895455842108656e-05, | |
| "loss": 2.144721031188965, | |
| "step": 3640 | |
| }, | |
| { | |
| "epoch": 1.964607724397793, | |
| "grad_norm": 20.551748275756836, | |
| "learning_rate": 5.841435494225946e-05, | |
| "loss": 1.024734878540039, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 1.9699905800026913, | |
| "grad_norm": 28.49460792541504, | |
| "learning_rate": 5.7875614805849464e-05, | |
| "loss": 1.2350109100341797, | |
| "step": 3660 | |
| }, | |
| { | |
| "epoch": 1.9753734356075898, | |
| "grad_norm": 46.727195739746094, | |
| "learning_rate": 5.7338356969390996e-05, | |
| "loss": 1.4352140426635742, | |
| "step": 3670 | |
| }, | |
| { | |
| "epoch": 1.9807562912124883, | |
| "grad_norm": 22.224246978759766, | |
| "learning_rate": 5.680260033825819e-05, | |
| "loss": 1.4729737281799316, | |
| "step": 3680 | |
| }, | |
| { | |
| "epoch": 1.9861391468173866, | |
| "grad_norm": 21.090652465820312, | |
| "learning_rate": 5.626836376499991e-05, | |
| "loss": 1.332131576538086, | |
| "step": 3690 | |
| }, | |
| { | |
| "epoch": 1.991522002422285, | |
| "grad_norm": 19.748018264770508, | |
| "learning_rate": 5.573566604867616e-05, | |
| "loss": 1.1651579856872558, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 1.991522002422285, | |
| "eval_loss": 0.3755303621292114, | |
| "eval_runtime": 63.642, | |
| "eval_samples_per_second": 51.9, | |
| "eval_steps_per_second": 12.979, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 1.9969048580271833, | |
| "grad_norm": 26.874662399291992, | |
| "learning_rate": 5.5204525934196715e-05, | |
| "loss": 1.8782270431518555, | |
| "step": 3710 | |
| }, | |
| { | |
| "epoch": 2.0021531422419594, | |
| "grad_norm": 11.230367660522461, | |
| "learning_rate": 5.4674962111661396e-05, | |
| "loss": 1.1111202239990234, | |
| "step": 3720 | |
| }, | |
| { | |
| "epoch": 2.007535997846858, | |
| "grad_norm": 11.470046043395996, | |
| "learning_rate": 5.4146993215702614e-05, | |
| "loss": 1.2164538383483887, | |
| "step": 3730 | |
| }, | |
| { | |
| "epoch": 2.0129188534517564, | |
| "grad_norm": 14.980729103088379, | |
| "learning_rate": 5.362063782482918e-05, | |
| "loss": 0.72305908203125, | |
| "step": 3740 | |
| }, | |
| { | |
| "epoch": 2.0183017090566544, | |
| "grad_norm": 22.74243927001953, | |
| "learning_rate": 5.309591446077316e-05, | |
| "loss": 0.9697726249694825, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 2.023684564661553, | |
| "grad_norm": 39.94514083862305, | |
| "learning_rate": 5.257284158783764e-05, | |
| "loss": 1.0772478103637695, | |
| "step": 3760 | |
| }, | |
| { | |
| "epoch": 2.0290674202664514, | |
| "grad_norm": 14.271464347839355, | |
| "learning_rate": 5.20514376122472e-05, | |
| "loss": 0.7649795055389405, | |
| "step": 3770 | |
| }, | |
| { | |
| "epoch": 2.03445027587135, | |
| "grad_norm": 46.278282165527344, | |
| "learning_rate": 5.1531720881500156e-05, | |
| "loss": 1.7668495178222656, | |
| "step": 3780 | |
| }, | |
| { | |
| "epoch": 2.0398331314762483, | |
| "grad_norm": 26.685871124267578, | |
| "learning_rate": 5.1013709683723044e-05, | |
| "loss": 0.9311368942260743, | |
| "step": 3790 | |
| }, | |
| { | |
| "epoch": 2.0452159870811464, | |
| "grad_norm": 19.982656478881836, | |
| "learning_rate": 5.0497422247026895e-05, | |
| "loss": 1.1055089950561523, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 2.0452159870811464, | |
| "eval_loss": 0.4047035276889801, | |
| "eval_runtime": 63.58, | |
| "eval_samples_per_second": 51.95, | |
| "eval_steps_per_second": 12.992, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 2.050598842686045, | |
| "grad_norm": 12.345768928527832, | |
| "learning_rate": 4.9982876738866094e-05, | |
| "loss": 0.7015519618988038, | |
| "step": 3810 | |
| }, | |
| { | |
| "epoch": 2.0559816982909433, | |
| "grad_norm": 33.307762145996094, | |
| "learning_rate": 4.9470091265398754e-05, | |
| "loss": 0.6976238250732422, | |
| "step": 3820 | |
| }, | |
| { | |
| "epoch": 2.061364553895842, | |
| "grad_norm": 38.2665901184082, | |
| "learning_rate": 4.8959083870849864e-05, | |
| "loss": 1.1541186332702638, | |
| "step": 3830 | |
| }, | |
| { | |
| "epoch": 2.0667474095007403, | |
| "grad_norm": 22.593074798583984, | |
| "learning_rate": 4.844987253687618e-05, | |
| "loss": 0.4699763298034668, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 2.0721302651056384, | |
| "grad_norm": 21.039308547973633, | |
| "learning_rate": 4.794247518193353e-05, | |
| "loss": 0.8926765441894531, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 2.077513120710537, | |
| "grad_norm": 24.009326934814453, | |
| "learning_rate": 4.743690966064626e-05, | |
| "loss": 0.7189272403717041, | |
| "step": 3860 | |
| }, | |
| { | |
| "epoch": 2.0828959763154353, | |
| "grad_norm": 8.515445709228516, | |
| "learning_rate": 4.6933193763179105e-05, | |
| "loss": 0.5480011940002442, | |
| "step": 3870 | |
| }, | |
| { | |
| "epoch": 2.088278831920334, | |
| "grad_norm": 19.915380477905273, | |
| "learning_rate": 4.64313452146108e-05, | |
| "loss": 0.7470302581787109, | |
| "step": 3880 | |
| }, | |
| { | |
| "epoch": 2.0936616875252323, | |
| "grad_norm": 5.266428470611572, | |
| "learning_rate": 4.593138167431087e-05, | |
| "loss": 0.592840576171875, | |
| "step": 3890 | |
| }, | |
| { | |
| "epoch": 2.0990445431301303, | |
| "grad_norm": 38.52595520019531, | |
| "learning_rate": 4.54333207353178e-05, | |
| "loss": 0.9797579765319824, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 2.0990445431301303, | |
| "eval_loss": 0.4082370102405548, | |
| "eval_runtime": 63.7106, | |
| "eval_samples_per_second": 51.844, | |
| "eval_steps_per_second": 12.965, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 2.104427398735029, | |
| "grad_norm": 38.00594711303711, | |
| "learning_rate": 4.493717992372014e-05, | |
| "loss": 0.6796042919158936, | |
| "step": 3910 | |
| }, | |
| { | |
| "epoch": 2.1098102543399273, | |
| "grad_norm": 22.110828399658203, | |
| "learning_rate": 4.444297669803981e-05, | |
| "loss": 1.6094877243041992, | |
| "step": 3920 | |
| }, | |
| { | |
| "epoch": 2.115193109944826, | |
| "grad_norm": 14.167129516601562, | |
| "learning_rate": 4.395072844861762e-05, | |
| "loss": 0.752195167541504, | |
| "step": 3930 | |
| }, | |
| { | |
| "epoch": 2.1205759655497243, | |
| "grad_norm": 13.590848922729492, | |
| "learning_rate": 4.3460452497001546e-05, | |
| "loss": 0.9873428344726562, | |
| "step": 3940 | |
| }, | |
| { | |
| "epoch": 2.1259588211546223, | |
| "grad_norm": 21.298370361328125, | |
| "learning_rate": 4.2972166095336996e-05, | |
| "loss": 0.7805982112884522, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 2.131341676759521, | |
| "grad_norm": 26.588743209838867, | |
| "learning_rate": 4.2485886425759824e-05, | |
| "loss": 0.8509333610534668, | |
| "step": 3960 | |
| }, | |
| { | |
| "epoch": 2.1367245323644193, | |
| "grad_norm": 14.079202651977539, | |
| "learning_rate": 4.200163059979168e-05, | |
| "loss": 0.46779747009277345, | |
| "step": 3970 | |
| }, | |
| { | |
| "epoch": 2.1421073879693178, | |
| "grad_norm": 16.043773651123047, | |
| "learning_rate": 4.1519415657738026e-05, | |
| "loss": 0.4787121295928955, | |
| "step": 3980 | |
| }, | |
| { | |
| "epoch": 2.1474902435742163, | |
| "grad_norm": 21.35724449157715, | |
| "learning_rate": 4.103925856808817e-05, | |
| "loss": 0.9199463844299316, | |
| "step": 3990 | |
| }, | |
| { | |
| "epoch": 2.1528730991791143, | |
| "grad_norm": 27.052135467529297, | |
| "learning_rate": 4.056117622691863e-05, | |
| "loss": 1.4920102119445802, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 2.1528730991791143, | |
| "eval_loss": 0.4048362374305725, | |
| "eval_runtime": 63.48, | |
| "eval_samples_per_second": 52.032, | |
| "eval_steps_per_second": 13.012, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 2.1582559547840128, | |
| "grad_norm": 1.1041878461837769, | |
| "learning_rate": 4.008518545729818e-05, | |
| "loss": 0.5191349029541016, | |
| "step": 4010 | |
| }, | |
| { | |
| "epoch": 2.1636388103889113, | |
| "grad_norm": 19.768545150756836, | |
| "learning_rate": 3.9611303008696073e-05, | |
| "loss": 0.9854854583740235, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 2.1690216659938097, | |
| "grad_norm": 55.555599212646484, | |
| "learning_rate": 3.913954555639263e-05, | |
| "loss": 0.7864606857299805, | |
| "step": 4030 | |
| }, | |
| { | |
| "epoch": 2.1744045215987082, | |
| "grad_norm": 38.11814880371094, | |
| "learning_rate": 3.866992970089238e-05, | |
| "loss": 1.094459342956543, | |
| "step": 4040 | |
| }, | |
| { | |
| "epoch": 2.1797873772036067, | |
| "grad_norm": 25.64844512939453, | |
| "learning_rate": 3.8202471967340004e-05, | |
| "loss": 0.7594769477844239, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 2.1851702328085048, | |
| "grad_norm": 39.07038879394531, | |
| "learning_rate": 3.773718880493883e-05, | |
| "loss": 0.767018985748291, | |
| "step": 4060 | |
| }, | |
| { | |
| "epoch": 2.1905530884134032, | |
| "grad_norm": 11.75182819366455, | |
| "learning_rate": 3.727409658637194e-05, | |
| "loss": 1.0294831275939942, | |
| "step": 4070 | |
| }, | |
| { | |
| "epoch": 2.1959359440183017, | |
| "grad_norm": 20.518577575683594, | |
| "learning_rate": 3.681321160722606e-05, | |
| "loss": 0.6886996746063232, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 2.2013187996232, | |
| "grad_norm": 38.67143630981445, | |
| "learning_rate": 3.6354550085418207e-05, | |
| "loss": 1.033548069000244, | |
| "step": 4090 | |
| }, | |
| { | |
| "epoch": 2.2067016552280987, | |
| "grad_norm": 37.95046615600586, | |
| "learning_rate": 3.589812816062489e-05, | |
| "loss": 1.114480209350586, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 2.2067016552280987, | |
| "eval_loss": 0.40899786353111267, | |
| "eval_runtime": 63.5021, | |
| "eval_samples_per_second": 52.014, | |
| "eval_steps_per_second": 13.007, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 2.2120845108329967, | |
| "grad_norm": 11.148638725280762, | |
| "learning_rate": 3.544396189371425e-05, | |
| "loss": 0.6971592426300048, | |
| "step": 4110 | |
| }, | |
| { | |
| "epoch": 2.217467366437895, | |
| "grad_norm": 22.88878631591797, | |
| "learning_rate": 3.4992067266181015e-05, | |
| "loss": 0.669145917892456, | |
| "step": 4120 | |
| }, | |
| { | |
| "epoch": 2.2228502220427937, | |
| "grad_norm": 6.007533550262451, | |
| "learning_rate": 3.454246017958376e-05, | |
| "loss": 0.627226448059082, | |
| "step": 4130 | |
| }, | |
| { | |
| "epoch": 2.228233077647692, | |
| "grad_norm": 6.372663497924805, | |
| "learning_rate": 3.409515645498583e-05, | |
| "loss": 0.4246776580810547, | |
| "step": 4140 | |
| }, | |
| { | |
| "epoch": 2.2336159332525907, | |
| "grad_norm": 37.81616973876953, | |
| "learning_rate": 3.3650171832398284e-05, | |
| "loss": 0.8943648338317871, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 2.2389987888574887, | |
| "grad_norm": 35.7336540222168, | |
| "learning_rate": 3.3207521970226104e-05, | |
| "loss": 1.005715560913086, | |
| "step": 4160 | |
| }, | |
| { | |
| "epoch": 2.244381644462387, | |
| "grad_norm": 25.88532066345215, | |
| "learning_rate": 3.2767222444717295e-05, | |
| "loss": 0.6161307334899903, | |
| "step": 4170 | |
| }, | |
| { | |
| "epoch": 2.2497645000672857, | |
| "grad_norm": 1.1592823266983032, | |
| "learning_rate": 3.232928874941463e-05, | |
| "loss": 0.35333144664764404, | |
| "step": 4180 | |
| }, | |
| { | |
| "epoch": 2.255147355672184, | |
| "grad_norm": 18.25936508178711, | |
| "learning_rate": 3.189373629461056e-05, | |
| "loss": 0.603509521484375, | |
| "step": 4190 | |
| }, | |
| { | |
| "epoch": 2.2605302112770826, | |
| "grad_norm": 18.44670295715332, | |
| "learning_rate": 3.1460580406804975e-05, | |
| "loss": 0.9603145599365235, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 2.2605302112770826, | |
| "eval_loss": 0.461373895406723, | |
| "eval_runtime": 63.6154, | |
| "eval_samples_per_second": 51.921, | |
| "eval_steps_per_second": 12.984, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 2.265913066881981, | |
| "grad_norm": 7.78346586227417, | |
| "learning_rate": 3.102983632816573e-05, | |
| "loss": 0.832798957824707, | |
| "step": 4210 | |
| }, | |
| { | |
| "epoch": 2.271295922486879, | |
| "grad_norm": 23.0885066986084, | |
| "learning_rate": 3.060151921599241e-05, | |
| "loss": 0.9533357620239258, | |
| "step": 4220 | |
| }, | |
| { | |
| "epoch": 2.2766787780917777, | |
| "grad_norm": 18.10384750366211, | |
| "learning_rate": 3.017564414218299e-05, | |
| "loss": 0.64031081199646, | |
| "step": 4230 | |
| }, | |
| { | |
| "epoch": 2.282061633696676, | |
| "grad_norm": 38.35786437988281, | |
| "learning_rate": 2.975222609270335e-05, | |
| "loss": 0.6714494705200196, | |
| "step": 4240 | |
| }, | |
| { | |
| "epoch": 2.2874444893015746, | |
| "grad_norm": 30.549135208129883, | |
| "learning_rate": 2.9331279967060132e-05, | |
| "loss": 0.6489608764648438, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 2.292827344906473, | |
| "grad_norm": 22.884374618530273, | |
| "learning_rate": 2.8912820577776234e-05, | |
| "loss": 0.6908737182617187, | |
| "step": 4260 | |
| }, | |
| { | |
| "epoch": 2.298210200511371, | |
| "grad_norm": 3.388777732849121, | |
| "learning_rate": 2.8496862649869706e-05, | |
| "loss": 0.52658109664917, | |
| "step": 4270 | |
| }, | |
| { | |
| "epoch": 2.3035930561162696, | |
| "grad_norm": 49.91218948364258, | |
| "learning_rate": 2.808342082033556e-05, | |
| "loss": 1.008077049255371, | |
| "step": 4280 | |
| }, | |
| { | |
| "epoch": 2.308975911721168, | |
| "grad_norm": 10.552830696105957, | |
| "learning_rate": 2.767250963763075e-05, | |
| "loss": 0.8219211578369141, | |
| "step": 4290 | |
| }, | |
| { | |
| "epoch": 2.3143587673260666, | |
| "grad_norm": 52.01408386230469, | |
| "learning_rate": 2.7264143561162136e-05, | |
| "loss": 1.2357698440551759, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 2.3143587673260666, | |
| "eval_loss": 0.4524453580379486, | |
| "eval_runtime": 63.5057, | |
| "eval_samples_per_second": 52.011, | |
| "eval_steps_per_second": 13.007, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 2.319741622930965, | |
| "grad_norm": 8.435943603515625, | |
| "learning_rate": 2.6858336960777863e-05, | |
| "loss": 0.7867340087890625, | |
| "step": 4310 | |
| }, | |
| { | |
| "epoch": 2.325124478535863, | |
| "grad_norm": 25.12037467956543, | |
| "learning_rate": 2.6455104116261477e-05, | |
| "loss": 0.6435882091522217, | |
| "step": 4320 | |
| }, | |
| { | |
| "epoch": 2.3305073341407616, | |
| "grad_norm": 19.58714485168457, | |
| "learning_rate": 2.6054459216829573e-05, | |
| "loss": 0.7821506977081298, | |
| "step": 4330 | |
| }, | |
| { | |
| "epoch": 2.33589018974566, | |
| "grad_norm": 17.670440673828125, | |
| "learning_rate": 2.5656416360632494e-05, | |
| "loss": 0.7270960807800293, | |
| "step": 4340 | |
| }, | |
| { | |
| "epoch": 2.3412730453505586, | |
| "grad_norm": 19.895416259765625, | |
| "learning_rate": 2.5260989554258185e-05, | |
| "loss": 1.1800201416015625, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 2.346655900955457, | |
| "grad_norm": 27.924663543701172, | |
| "learning_rate": 2.4868192712239348e-05, | |
| "loss": 0.891145896911621, | |
| "step": 4360 | |
| }, | |
| { | |
| "epoch": 2.352038756560355, | |
| "grad_norm": 24.85103988647461, | |
| "learning_rate": 2.44780396565639e-05, | |
| "loss": 0.9543925285339355, | |
| "step": 4370 | |
| }, | |
| { | |
| "epoch": 2.3574216121652536, | |
| "grad_norm": 23.492963790893555, | |
| "learning_rate": 2.409054411618831e-05, | |
| "loss": 1.0963412284851075, | |
| "step": 4380 | |
| }, | |
| { | |
| "epoch": 2.362804467770152, | |
| "grad_norm": 23.491336822509766, | |
| "learning_rate": 2.370571972655489e-05, | |
| "loss": 0.7562737464904785, | |
| "step": 4390 | |
| }, | |
| { | |
| "epoch": 2.3681873233750506, | |
| "grad_norm": 9.930757522583008, | |
| "learning_rate": 2.332358002911167e-05, | |
| "loss": 0.5512786388397217, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 2.3681873233750506, | |
| "eval_loss": 0.43738052248954773, | |
| "eval_runtime": 63.71, | |
| "eval_samples_per_second": 51.844, | |
| "eval_steps_per_second": 12.965, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 2.373570178979949, | |
| "grad_norm": 24.945201873779297, | |
| "learning_rate": 2.294413847083604e-05, | |
| "loss": 0.719010305404663, | |
| "step": 4410 | |
| }, | |
| { | |
| "epoch": 2.378953034584847, | |
| "grad_norm": 18.582550048828125, | |
| "learning_rate": 2.2567408403761526e-05, | |
| "loss": 0.9431358337402344, | |
| "step": 4420 | |
| }, | |
| { | |
| "epoch": 2.3843358901897456, | |
| "grad_norm": 3.468303680419922, | |
| "learning_rate": 2.2193403084507947e-05, | |
| "loss": 0.6178753852844239, | |
| "step": 4430 | |
| }, | |
| { | |
| "epoch": 2.389718745794644, | |
| "grad_norm": 22.029281616210938, | |
| "learning_rate": 2.1822135673814948e-05, | |
| "loss": 1.0714486122131348, | |
| "step": 4440 | |
| }, | |
| { | |
| "epoch": 2.3951016013995425, | |
| "grad_norm": 19.43686294555664, | |
| "learning_rate": 2.1453619236078937e-05, | |
| "loss": 0.831718635559082, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 2.400484457004441, | |
| "grad_norm": 20.41507911682129, | |
| "learning_rate": 2.1087866738893246e-05, | |
| "loss": 0.7316448211669921, | |
| "step": 4460 | |
| }, | |
| { | |
| "epoch": 2.405867312609339, | |
| "grad_norm": 24.05844497680664, | |
| "learning_rate": 2.072489105259192e-05, | |
| "loss": 0.5118863582611084, | |
| "step": 4470 | |
| }, | |
| { | |
| "epoch": 2.4112501682142375, | |
| "grad_norm": 4.802274703979492, | |
| "learning_rate": 2.036470494979681e-05, | |
| "loss": 0.4543926239013672, | |
| "step": 4480 | |
| }, | |
| { | |
| "epoch": 2.416633023819136, | |
| "grad_norm": 6.404051780700684, | |
| "learning_rate": 2.000732110496808e-05, | |
| "loss": 0.6312252521514893, | |
| "step": 4490 | |
| }, | |
| { | |
| "epoch": 2.4220158794240345, | |
| "grad_norm": 23.455795288085938, | |
| "learning_rate": 1.9652752093958225e-05, | |
| "loss": 0.5971816062927247, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 2.4220158794240345, | |
| "eval_loss": 0.4342218041419983, | |
| "eval_runtime": 63.961, | |
| "eval_samples_per_second": 51.641, | |
| "eval_steps_per_second": 12.914, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 2.427398735028933, | |
| "grad_norm": 35.069087982177734, | |
| "learning_rate": 1.9301010393569676e-05, | |
| "loss": 0.763551664352417, | |
| "step": 4510 | |
| }, | |
| { | |
| "epoch": 2.432781590633831, | |
| "grad_norm": 22.598342895507812, | |
| "learning_rate": 1.895210838111544e-05, | |
| "loss": 1.073389434814453, | |
| "step": 4520 | |
| }, | |
| { | |
| "epoch": 2.4381644462387295, | |
| "grad_norm": 15.471684455871582, | |
| "learning_rate": 1.8606058333983946e-05, | |
| "loss": 0.8500160217285156, | |
| "step": 4530 | |
| }, | |
| { | |
| "epoch": 2.443547301843628, | |
| "grad_norm": 38.8491325378418, | |
| "learning_rate": 1.8262872429206734e-05, | |
| "loss": 1.3663853645324706, | |
| "step": 4540 | |
| }, | |
| { | |
| "epoch": 2.4489301574485265, | |
| "grad_norm": 22.642866134643555, | |
| "learning_rate": 1.7922562743030057e-05, | |
| "loss": 0.6329252243041992, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 2.454313013053425, | |
| "grad_norm": 16.064590454101562, | |
| "learning_rate": 1.7585141250490022e-05, | |
| "loss": 0.8116084098815918, | |
| "step": 4560 | |
| }, | |
| { | |
| "epoch": 2.459695868658323, | |
| "grad_norm": 26.74970245361328, | |
| "learning_rate": 1.725061982499103e-05, | |
| "loss": 0.8728569984436035, | |
| "step": 4570 | |
| }, | |
| { | |
| "epoch": 2.4650787242632215, | |
| "grad_norm": 13.955748558044434, | |
| "learning_rate": 1.69190102378881e-05, | |
| "loss": 0.7079121589660644, | |
| "step": 4580 | |
| }, | |
| { | |
| "epoch": 2.47046157986812, | |
| "grad_norm": 30.616897583007812, | |
| "learning_rate": 1.6590324158072603e-05, | |
| "loss": 0.8990015029907227, | |
| "step": 4590 | |
| }, | |
| { | |
| "epoch": 2.4758444354730185, | |
| "grad_norm": 20.03752899169922, | |
| "learning_rate": 1.6264573151561648e-05, | |
| "loss": 1.1187437057495118, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 2.4758444354730185, | |
| "eval_loss": 0.39977964758872986, | |
| "eval_runtime": 63.806, | |
| "eval_samples_per_second": 51.766, | |
| "eval_steps_per_second": 12.945, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 2.481227291077917, | |
| "grad_norm": 18.699827194213867, | |
| "learning_rate": 1.5941768681091085e-05, | |
| "loss": 0.7999272346496582, | |
| "step": 4610 | |
| }, | |
| { | |
| "epoch": 2.486610146682815, | |
| "grad_norm": 4.604935646057129, | |
| "learning_rate": 1.562192210571225e-05, | |
| "loss": 0.8284183502197265, | |
| "step": 4620 | |
| }, | |
| { | |
| "epoch": 2.4919930022877135, | |
| "grad_norm": 29.9500732421875, | |
| "learning_rate": 1.5305044680392e-05, | |
| "loss": 0.8354525566101074, | |
| "step": 4630 | |
| }, | |
| { | |
| "epoch": 2.497375857892612, | |
| "grad_norm": 37.695804595947266, | |
| "learning_rate": 1.499114755561699e-05, | |
| "loss": 0.8016999244689942, | |
| "step": 4640 | |
| }, | |
| { | |
| "epoch": 2.5027587134975104, | |
| "grad_norm": 4.899083614349365, | |
| "learning_rate": 1.4680241777001059e-05, | |
| "loss": 0.9540206909179687, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 2.508141569102409, | |
| "grad_norm": 26.045948028564453, | |
| "learning_rate": 1.4372338284896647e-05, | |
| "loss": 0.5969816684722901, | |
| "step": 4660 | |
| }, | |
| { | |
| "epoch": 2.513524424707307, | |
| "grad_norm": 23.402122497558594, | |
| "learning_rate": 1.4067447914009823e-05, | |
| "loss": 0.7931214809417725, | |
| "step": 4670 | |
| }, | |
| { | |
| "epoch": 2.518907280312206, | |
| "grad_norm": 5.232571601867676, | |
| "learning_rate": 1.3765581393018978e-05, | |
| "loss": 0.6403655052185059, | |
| "step": 4680 | |
| }, | |
| { | |
| "epoch": 2.524290135917104, | |
| "grad_norm": 11.179905891418457, | |
| "learning_rate": 1.3466749344197339e-05, | |
| "loss": 0.5316050529479981, | |
| "step": 4690 | |
| }, | |
| { | |
| "epoch": 2.5296729915220024, | |
| "grad_norm": 21.05845069885254, | |
| "learning_rate": 1.3170962283039235e-05, | |
| "loss": 1.0778657913208007, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 2.5296729915220024, | |
| "eval_loss": 0.40597495436668396, | |
| "eval_runtime": 63.8788, | |
| "eval_samples_per_second": 51.707, | |
| "eval_steps_per_second": 12.931, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 2.535055847126901, | |
| "grad_norm": 17.45840072631836, | |
| "learning_rate": 1.2878230617889918e-05, | |
| "loss": 1.3090163230895997, | |
| "step": 4710 | |
| }, | |
| { | |
| "epoch": 2.540438702731799, | |
| "grad_norm": 13.649649620056152, | |
| "learning_rate": 1.2588564649579449e-05, | |
| "loss": 0.6182886600494385, | |
| "step": 4720 | |
| }, | |
| { | |
| "epoch": 2.545821558336698, | |
| "grad_norm": 30.202678680419922, | |
| "learning_rate": 1.2301974571060181e-05, | |
| "loss": 0.8260242462158203, | |
| "step": 4730 | |
| }, | |
| { | |
| "epoch": 2.551204413941596, | |
| "grad_norm": 9.608967781066895, | |
| "learning_rate": 1.2018470467048072e-05, | |
| "loss": 0.5750818729400635, | |
| "step": 4740 | |
| }, | |
| { | |
| "epoch": 2.5565872695464944, | |
| "grad_norm": 12.897671699523926, | |
| "learning_rate": 1.1738062313667786e-05, | |
| "loss": 0.8292213439941406, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 2.561970125151393, | |
| "grad_norm": 48.488006591796875, | |
| "learning_rate": 1.1460759978101787e-05, | |
| "loss": 0.8127927780151367, | |
| "step": 4760 | |
| }, | |
| { | |
| "epoch": 2.5673529807562914, | |
| "grad_norm": 30.89815330505371, | |
| "learning_rate": 1.118657321824289e-05, | |
| "loss": 0.710633659362793, | |
| "step": 4770 | |
| }, | |
| { | |
| "epoch": 2.57273583636119, | |
| "grad_norm": 17.691478729248047, | |
| "learning_rate": 1.0915511682351142e-05, | |
| "loss": 0.6440166473388672, | |
| "step": 4780 | |
| }, | |
| { | |
| "epoch": 2.578118691966088, | |
| "grad_norm": 27.643741607666016, | |
| "learning_rate": 1.0647584908714148e-05, | |
| "loss": 0.679203987121582, | |
| "step": 4790 | |
| }, | |
| { | |
| "epoch": 2.5835015475709864, | |
| "grad_norm": 27.048784255981445, | |
| "learning_rate": 1.0382802325311491e-05, | |
| "loss": 0.9150435447692871, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 2.5835015475709864, | |
| "eval_loss": 0.40863797068595886, | |
| "eval_runtime": 63.903, | |
| "eval_samples_per_second": 51.688, | |
| "eval_steps_per_second": 12.926, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 2.588884403175885, | |
| "grad_norm": 17.041791915893555, | |
| "learning_rate": 1.0121173249482962e-05, | |
| "loss": 0.8509119987487793, | |
| "step": 4810 | |
| }, | |
| { | |
| "epoch": 2.5942672587807833, | |
| "grad_norm": 28.006967544555664, | |
| "learning_rate": 9.862706887600714e-06, | |
| "loss": 0.8236183166503906, | |
| "step": 4820 | |
| }, | |
| { | |
| "epoch": 2.599650114385682, | |
| "grad_norm": 36.17509078979492, | |
| "learning_rate": 9.607412334745235e-06, | |
| "loss": 0.839243221282959, | |
| "step": 4830 | |
| }, | |
| { | |
| "epoch": 2.60503296999058, | |
| "grad_norm": 1.2139636278152466, | |
| "learning_rate": 9.355298574385474e-06, | |
| "loss": 0.49801297187805177, | |
| "step": 4840 | |
| }, | |
| { | |
| "epoch": 2.6104158255954784, | |
| "grad_norm": 24.570405960083008, | |
| "learning_rate": 9.106374478062485e-06, | |
| "loss": 0.7030567169189453, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 2.615798681200377, | |
| "grad_norm": 25.26799201965332, | |
| "learning_rate": 8.86064880507742e-06, | |
| "loss": 0.8722931861877441, | |
| "step": 4860 | |
| }, | |
| { | |
| "epoch": 2.6211815368052753, | |
| "grad_norm": 18.12640380859375, | |
| "learning_rate": 8.618130202183317e-06, | |
| "loss": 0.8933378219604492, | |
| "step": 4870 | |
| }, | |
| { | |
| "epoch": 2.626564392410174, | |
| "grad_norm": 33.00815200805664, | |
| "learning_rate": 8.378827203280625e-06, | |
| "loss": 0.7595347881317138, | |
| "step": 4880 | |
| }, | |
| { | |
| "epoch": 2.631947248015072, | |
| "grad_norm": 1.4025450944900513, | |
| "learning_rate": 8.142748229117192e-06, | |
| "loss": 1.158553695678711, | |
| "step": 4890 | |
| }, | |
| { | |
| "epoch": 2.6373301036199703, | |
| "grad_norm": 2.04663348197937, | |
| "learning_rate": 7.909901586991752e-06, | |
| "loss": 0.495909595489502, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 2.6373301036199703, | |
| "eval_loss": 0.4060768187046051, | |
| "eval_runtime": 63.9323, | |
| "eval_samples_per_second": 51.664, | |
| "eval_steps_per_second": 12.92, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 2.642712959224869, | |
| "grad_norm": 34.9760856628418, | |
| "learning_rate": 7.680295470461651e-06, | |
| "loss": 0.8339058876037597, | |
| "step": 4910 | |
| }, | |
| { | |
| "epoch": 2.6480958148297673, | |
| "grad_norm": 7.547365665435791, | |
| "learning_rate": 7.4539379590545575e-06, | |
| "loss": 1.0124500274658204, | |
| "step": 4920 | |
| }, | |
| { | |
| "epoch": 2.653478670434666, | |
| "grad_norm": 36.673561096191406, | |
| "learning_rate": 7.230837017984127e-06, | |
| "loss": 0.9258150100708008, | |
| "step": 4930 | |
| }, | |
| { | |
| "epoch": 2.658861526039564, | |
| "grad_norm": 12.191123962402344, | |
| "learning_rate": 7.011000497869691e-06, | |
| "loss": 0.7174896240234375, | |
| "step": 4940 | |
| }, | |
| { | |
| "epoch": 2.6642443816444623, | |
| "grad_norm": 27.09784507751465, | |
| "learning_rate": 6.794436134460125e-06, | |
| "loss": 0.7737472534179688, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 2.669627237249361, | |
| "grad_norm": 1.9672365188598633, | |
| "learning_rate": 6.581151548361475e-06, | |
| "loss": 0.7733006954193116, | |
| "step": 4960 | |
| }, | |
| { | |
| "epoch": 2.6750100928542593, | |
| "grad_norm": 24.851816177368164, | |
| "learning_rate": 6.3711542447688956e-06, | |
| "loss": 0.976164436340332, | |
| "step": 4970 | |
| }, | |
| { | |
| "epoch": 2.6803929484591578, | |
| "grad_norm": 4.714712142944336, | |
| "learning_rate": 6.164451613202515e-06, | |
| "loss": 1.361710262298584, | |
| "step": 4980 | |
| }, | |
| { | |
| "epoch": 2.685775804064056, | |
| "grad_norm": 33.14804458618164, | |
| "learning_rate": 5.961050927247458e-06, | |
| "loss": 1.0757354736328124, | |
| "step": 4990 | |
| }, | |
| { | |
| "epoch": 2.6911586596689543, | |
| "grad_norm": 19.453475952148438, | |
| "learning_rate": 5.760959344297811e-06, | |
| "loss": 0.7794712543487549, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 2.6911586596689543, | |
| "eval_loss": 0.3953015208244324, | |
| "eval_runtime": 63.9175, | |
| "eval_samples_per_second": 51.676, | |
| "eval_steps_per_second": 12.923, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 2.6965415152738528, | |
| "grad_norm": 38.8685302734375, | |
| "learning_rate": 5.56418390530492e-06, | |
| "loss": 0.8262761116027832, | |
| "step": 5010 | |
| }, | |
| { | |
| "epoch": 2.7019243708787513, | |
| "grad_norm": 42.21137237548828, | |
| "learning_rate": 5.370731534529383e-06, | |
| "loss": 0.9226728439331054, | |
| "step": 5020 | |
| }, | |
| { | |
| "epoch": 2.7073072264836497, | |
| "grad_norm": 11.871996879577637, | |
| "learning_rate": 5.180609039297646e-06, | |
| "loss": 0.4317474365234375, | |
| "step": 5030 | |
| }, | |
| { | |
| "epoch": 2.712690082088548, | |
| "grad_norm": 1.4888293743133545, | |
| "learning_rate": 4.993823109762319e-06, | |
| "loss": 1.047317886352539, | |
| "step": 5040 | |
| }, | |
| { | |
| "epoch": 2.7180729376934463, | |
| "grad_norm": 31.726903915405273, | |
| "learning_rate": 4.810380318666774e-06, | |
| "loss": 0.9913960456848144, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 2.7234557932983448, | |
| "grad_norm": 30.20676040649414, | |
| "learning_rate": 4.630287121113897e-06, | |
| "loss": 0.6376973628997803, | |
| "step": 5060 | |
| }, | |
| { | |
| "epoch": 2.7288386489032432, | |
| "grad_norm": 29.86091423034668, | |
| "learning_rate": 4.453549854338934e-06, | |
| "loss": 0.8093062400817871, | |
| "step": 5070 | |
| }, | |
| { | |
| "epoch": 2.7342215045081417, | |
| "grad_norm": 3.3067686557769775, | |
| "learning_rate": 4.280174737486442e-06, | |
| "loss": 1.0463817596435547, | |
| "step": 5080 | |
| }, | |
| { | |
| "epoch": 2.7396043601130398, | |
| "grad_norm": 0.369608610868454, | |
| "learning_rate": 4.110167871391546e-06, | |
| "loss": 0.7146965980529785, | |
| "step": 5090 | |
| }, | |
| { | |
| "epoch": 2.7449872157179382, | |
| "grad_norm": 17.710023880004883, | |
| "learning_rate": 3.943535238365137e-06, | |
| "loss": 0.4951002597808838, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 2.7449872157179382, | |
| "eval_loss": 0.3943323791027069, | |
| "eval_runtime": 63.9034, | |
| "eval_samples_per_second": 51.687, | |
| "eval_steps_per_second": 12.926, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 2.7503700713228367, | |
| "grad_norm": 13.03876781463623, | |
| "learning_rate": 3.780282701983462e-06, | |
| "loss": 0.8074542045593261, | |
| "step": 5110 | |
| }, | |
| { | |
| "epoch": 2.755752926927735, | |
| "grad_norm": 36.00669860839844, | |
| "learning_rate": 3.620416006881722e-06, | |
| "loss": 1.496070957183838, | |
| "step": 5120 | |
| }, | |
| { | |
| "epoch": 2.7611357825326337, | |
| "grad_norm": 20.361572265625, | |
| "learning_rate": 3.4639407785519774e-06, | |
| "loss": 1.3481143951416015, | |
| "step": 5130 | |
| }, | |
| { | |
| "epoch": 2.7665186381375317, | |
| "grad_norm": 20.532785415649414, | |
| "learning_rate": 3.310862523145197e-06, | |
| "loss": 0.5495355129241943, | |
| "step": 5140 | |
| }, | |
| { | |
| "epoch": 2.7719014937424302, | |
| "grad_norm": 17.233598709106445, | |
| "learning_rate": 3.161186627277435e-06, | |
| "loss": 0.9931418418884277, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 2.7772843493473287, | |
| "grad_norm": 10.674700736999512, | |
| "learning_rate": 3.014918357840368e-06, | |
| "loss": 0.6294282913208008, | |
| "step": 5160 | |
| }, | |
| { | |
| "epoch": 2.782667204952227, | |
| "grad_norm": 29.000959396362305, | |
| "learning_rate": 2.872062861815905e-06, | |
| "loss": 0.7137054920196533, | |
| "step": 5170 | |
| }, | |
| { | |
| "epoch": 2.7880500605571257, | |
| "grad_norm": 27.14993667602539, | |
| "learning_rate": 2.732625166095093e-06, | |
| "loss": 0.7461415767669678, | |
| "step": 5180 | |
| }, | |
| { | |
| "epoch": 2.7934329161620237, | |
| "grad_norm": 19.03074073791504, | |
| "learning_rate": 2.5966101773012064e-06, | |
| "loss": 0.9058383941650391, | |
| "step": 5190 | |
| }, | |
| { | |
| "epoch": 2.798815771766922, | |
| "grad_norm": 25.3709659576416, | |
| "learning_rate": 2.464022681617162e-06, | |
| "loss": 0.9319804191589356, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 2.798815771766922, | |
| "eval_loss": 0.39116066694259644, | |
| "eval_runtime": 63.7425, | |
| "eval_samples_per_second": 51.818, | |
| "eval_steps_per_second": 12.958, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 2.8041986273718207, | |
| "grad_norm": 24.770858764648438, | |
| "learning_rate": 2.334867344616998e-06, | |
| "loss": 0.8134791374206543, | |
| "step": 5210 | |
| }, | |
| { | |
| "epoch": 2.809581482976719, | |
| "grad_norm": 32.360477447509766, | |
| "learning_rate": 2.2091487111017383e-06, | |
| "loss": 0.9853259086608886, | |
| "step": 5220 | |
| }, | |
| { | |
| "epoch": 2.8149643385816177, | |
| "grad_norm": 26.975568771362305, | |
| "learning_rate": 2.086871204939511e-06, | |
| "loss": 0.3680762767791748, | |
| "step": 5230 | |
| }, | |
| { | |
| "epoch": 2.8203471941865157, | |
| "grad_norm": 40.22636413574219, | |
| "learning_rate": 1.9680391289098266e-06, | |
| "loss": 0.7327807426452637, | |
| "step": 5240 | |
| }, | |
| { | |
| "epoch": 2.8257300497914146, | |
| "grad_norm": 27.841876983642578, | |
| "learning_rate": 1.852656664552166e-06, | |
| "loss": 1.114755630493164, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 2.8311129053963127, | |
| "grad_norm": 23.36740493774414, | |
| "learning_rate": 1.740727872018899e-06, | |
| "loss": 1.0058785438537599, | |
| "step": 5260 | |
| }, | |
| { | |
| "epoch": 2.836495761001211, | |
| "grad_norm": 3.433856725692749, | |
| "learning_rate": 1.632256689932321e-06, | |
| "loss": 0.6553703784942627, | |
| "step": 5270 | |
| }, | |
| { | |
| "epoch": 2.8418786166061096, | |
| "grad_norm": 28.19014549255371, | |
| "learning_rate": 1.5272469352461517e-06, | |
| "loss": 0.5715783119201661, | |
| "step": 5280 | |
| }, | |
| { | |
| "epoch": 2.8472614722110077, | |
| "grad_norm": 33.08034133911133, | |
| "learning_rate": 1.4257023031111538e-06, | |
| "loss": 1.0896245002746583, | |
| "step": 5290 | |
| }, | |
| { | |
| "epoch": 2.8526443278159066, | |
| "grad_norm": 29.616188049316406, | |
| "learning_rate": 1.3276263667451272e-06, | |
| "loss": 0.575172758102417, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 2.8526443278159066, | |
| "eval_loss": 0.39213913679122925, | |
| "eval_runtime": 63.7458, | |
| "eval_samples_per_second": 51.815, | |
| "eval_steps_per_second": 12.958, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 2.8580271834208046, | |
| "grad_norm": 24.045257568359375, | |
| "learning_rate": 1.2330225773071858e-06, | |
| "loss": 0.6139691352844239, | |
| "step": 5310 | |
| }, | |
| { | |
| "epoch": 2.863410039025703, | |
| "grad_norm": 32.76106643676758, | |
| "learning_rate": 1.1418942637763109e-06, | |
| "loss": 0.6473401069641114, | |
| "step": 5320 | |
| }, | |
| { | |
| "epoch": 2.8687928946306016, | |
| "grad_norm": 17.230541229248047, | |
| "learning_rate": 1.054244632834167e-06, | |
| "loss": 0.6802839279174805, | |
| "step": 5330 | |
| }, | |
| { | |
| "epoch": 2.8741757502355, | |
| "grad_norm": 14.499601364135742, | |
| "learning_rate": 9.700767687523483e-07, | |
| "loss": 0.8065154075622558, | |
| "step": 5340 | |
| }, | |
| { | |
| "epoch": 2.8795586058403986, | |
| "grad_norm": 16.937408447265625, | |
| "learning_rate": 8.893936332837749e-07, | |
| "loss": 1.2557835578918457, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 2.8849414614452966, | |
| "grad_norm": 18.08892250061035, | |
| "learning_rate": 8.121980655584783e-07, | |
| "loss": 0.5564064979553223, | |
| "step": 5360 | |
| }, | |
| { | |
| "epoch": 2.890324317050195, | |
| "grad_norm": 5.15496826171875, | |
| "learning_rate": 7.384927819837461e-07, | |
| "loss": 0.7302708625793457, | |
| "step": 5370 | |
| }, | |
| { | |
| "epoch": 2.8957071726550936, | |
| "grad_norm": 0.6171675324440002, | |
| "learning_rate": 6.68280376148489e-07, | |
| "loss": 0.46964249610900877, | |
| "step": 5380 | |
| }, | |
| { | |
| "epoch": 2.901090028259992, | |
| "grad_norm": 12.738670349121094, | |
| "learning_rate": 6.01563318731968e-07, | |
| "loss": 0.8759981155395508, | |
| "step": 5390 | |
| }, | |
| { | |
| "epoch": 2.9064728838648906, | |
| "grad_norm": 8.0991849899292, | |
| "learning_rate": 5.383439574169313e-07, | |
| "loss": 0.3772397994995117, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 2.9064728838648906, | |
| "eval_loss": 0.39079996943473816, | |
| "eval_runtime": 63.7806, | |
| "eval_samples_per_second": 51.787, | |
| "eval_steps_per_second": 12.951, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 2.9118557394697886, | |
| "grad_norm": 2.8664917945861816, | |
| "learning_rate": 4.786245168068804e-07, | |
| "loss": 0.6327933311462403, | |
| "step": 5410 | |
| }, | |
| { | |
| "epoch": 2.917238595074687, | |
| "grad_norm": 15.887563705444336, | |
| "learning_rate": 4.2240709834791004e-07, | |
| "loss": 0.8755616188049317, | |
| "step": 5420 | |
| }, | |
| { | |
| "epoch": 2.9226214506795856, | |
| "grad_norm": 10.990631103515625, | |
| "learning_rate": 3.696936802546902e-07, | |
| "loss": 0.9237110137939453, | |
| "step": 5430 | |
| }, | |
| { | |
| "epoch": 2.928004306284484, | |
| "grad_norm": 36.54423141479492, | |
| "learning_rate": 3.204861174408547e-07, | |
| "loss": 0.6388278484344483, | |
| "step": 5440 | |
| }, | |
| { | |
| "epoch": 2.9333871618893825, | |
| "grad_norm": 25.8781795501709, | |
| "learning_rate": 2.747861414537756e-07, | |
| "loss": 0.8046004295349121, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 2.9387700174942806, | |
| "grad_norm": 14.25063419342041, | |
| "learning_rate": 2.3259536041357888e-07, | |
| "loss": 1.015383243560791, | |
| "step": 5460 | |
| }, | |
| { | |
| "epoch": 2.944152873099179, | |
| "grad_norm": 49.4938850402832, | |
| "learning_rate": 1.9391525895661178e-07, | |
| "loss": 0.9852633476257324, | |
| "step": 5470 | |
| }, | |
| { | |
| "epoch": 2.9495357287040775, | |
| "grad_norm": 8.794760704040527, | |
| "learning_rate": 1.587471981831512e-07, | |
| "loss": 0.7090904235839843, | |
| "step": 5480 | |
| }, | |
| { | |
| "epoch": 2.954918584308976, | |
| "grad_norm": 20.00497055053711, | |
| "learning_rate": 1.27092415609531e-07, | |
| "loss": 0.8313823699951172, | |
| "step": 5490 | |
| }, | |
| { | |
| "epoch": 2.9603014399138745, | |
| "grad_norm": 33.549407958984375, | |
| "learning_rate": 9.89520251245879e-08, | |
| "loss": 0.7701246261596679, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 2.9603014399138745, | |
| "eval_loss": 0.3912367820739746, | |
| "eval_runtime": 63.5041, | |
| "eval_samples_per_second": 52.012, | |
| "eval_steps_per_second": 13.007, | |
| "step": 5500 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5574, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.246694746194002e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |