{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.0, "eval_steps": 30, "global_step": 3128, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0012801024081926554, "grad_norm": 4.318057537078857, "learning_rate": 0.0, "loss": 1.0778, "step": 1 }, { "epoch": 0.002560204816385311, "grad_norm": 4.247881889343262, "learning_rate": 3.3898305084745766e-07, "loss": 1.1177, "step": 2 }, { "epoch": 0.0038403072245779663, "grad_norm": 4.42292594909668, "learning_rate": 6.779661016949153e-07, "loss": 1.0451, "step": 3 }, { "epoch": 0.005120409632770622, "grad_norm": 4.248280048370361, "learning_rate": 1.016949152542373e-06, "loss": 1.0984, "step": 4 }, { "epoch": 0.006400512040963277, "grad_norm": 3.9760775566101074, "learning_rate": 1.3559322033898307e-06, "loss": 1.1407, "step": 5 }, { "epoch": 0.007680614449155933, "grad_norm": 4.0757951736450195, "learning_rate": 1.6949152542372882e-06, "loss": 1.1223, "step": 6 }, { "epoch": 0.008960716857348588, "grad_norm": 3.6940793991088867, "learning_rate": 2.033898305084746e-06, "loss": 1.104, "step": 7 }, { "epoch": 0.010240819265541243, "grad_norm": 3.3989737033843994, "learning_rate": 2.372881355932204e-06, "loss": 1.0761, "step": 8 }, { "epoch": 0.011520921673733898, "grad_norm": 2.556053400039673, "learning_rate": 2.7118644067796613e-06, "loss": 1.0753, "step": 9 }, { "epoch": 0.012801024081926553, "grad_norm": 2.3599398136138916, "learning_rate": 3.0508474576271192e-06, "loss": 1.0595, "step": 10 }, { "epoch": 0.01408112649011921, "grad_norm": 2.174004316329956, "learning_rate": 3.3898305084745763e-06, "loss": 1.0986, "step": 11 }, { "epoch": 0.015361228898311865, "grad_norm": 4.076415061950684, "learning_rate": 3.7288135593220342e-06, "loss": 1.0546, "step": 12 }, { "epoch": 0.016641331306504522, "grad_norm": 3.8682055473327637, "learning_rate": 4.067796610169492e-06, "loss": 1.0498, "step": 13 }, { "epoch": 0.017921433714697177, "grad_norm": 3.5528361797332764, "learning_rate": 4.40677966101695e-06, "loss": 1.0399, "step": 14 }, { "epoch": 0.019201536122889832, "grad_norm": 2.4921932220458984, "learning_rate": 4.745762711864408e-06, "loss": 1.0343, "step": 15 }, { "epoch": 0.020481638531082487, "grad_norm": 2.5666632652282715, "learning_rate": 5.084745762711865e-06, "loss": 1.0366, "step": 16 }, { "epoch": 0.021761740939275142, "grad_norm": 2.5974960327148438, "learning_rate": 5.423728813559323e-06, "loss": 0.9794, "step": 17 }, { "epoch": 0.023041843347467797, "grad_norm": 2.314732789993286, "learning_rate": 5.7627118644067805e-06, "loss": 1.0135, "step": 18 }, { "epoch": 0.024321945755660452, "grad_norm": 1.8715646266937256, "learning_rate": 6.1016949152542385e-06, "loss": 1.0432, "step": 19 }, { "epoch": 0.025602048163853107, "grad_norm": 1.6317925453186035, "learning_rate": 6.440677966101695e-06, "loss": 1.0005, "step": 20 }, { "epoch": 0.026882150572045762, "grad_norm": 1.4418320655822754, "learning_rate": 6.779661016949153e-06, "loss": 1.0038, "step": 21 }, { "epoch": 0.02816225298023842, "grad_norm": 1.424547553062439, "learning_rate": 7.1186440677966106e-06, "loss": 1.0127, "step": 22 }, { "epoch": 0.029442355388431075, "grad_norm": 1.3697491884231567, "learning_rate": 7.4576271186440685e-06, "loss": 0.9887, "step": 23 }, { "epoch": 0.03072245779662373, "grad_norm": 1.2942132949829102, "learning_rate": 7.796610169491526e-06, "loss": 0.9546, "step": 24 }, { "epoch": 0.032002560204816385, "grad_norm": 1.2515391111373901, "learning_rate": 8.135593220338983e-06, "loss": 0.9461, "step": 25 }, { "epoch": 0.033282662613009044, "grad_norm": 1.2862663269042969, "learning_rate": 8.47457627118644e-06, "loss": 1.0312, "step": 26 }, { "epoch": 0.034562765021201695, "grad_norm": 1.198714256286621, "learning_rate": 8.8135593220339e-06, "loss": 1.0194, "step": 27 }, { "epoch": 0.035842867429394354, "grad_norm": 1.059179663658142, "learning_rate": 9.152542372881356e-06, "loss": 0.9944, "step": 28 }, { "epoch": 0.037122969837587005, "grad_norm": 0.9127014875411987, "learning_rate": 9.491525423728815e-06, "loss": 0.9496, "step": 29 }, { "epoch": 0.038403072245779664, "grad_norm": 0.9680947065353394, "learning_rate": 9.830508474576272e-06, "loss": 0.9746, "step": 30 }, { "epoch": 0.038403072245779664, "eval_loss": 0.015015463344752789, "eval_runtime": 10.8244, "eval_samples_per_second": 45.822, "eval_steps_per_second": 5.728, "step": 30 }, { "epoch": 0.039683174653972315, "grad_norm": 0.9460412263870239, "learning_rate": 1.016949152542373e-05, "loss": 0.9383, "step": 31 }, { "epoch": 0.040963277062164974, "grad_norm": 0.9197554588317871, "learning_rate": 1.0508474576271188e-05, "loss": 0.9388, "step": 32 }, { "epoch": 0.042243379470357625, "grad_norm": 0.8614938259124756, "learning_rate": 1.0847457627118645e-05, "loss": 0.9249, "step": 33 }, { "epoch": 0.043523481878550284, "grad_norm": 0.7609007954597473, "learning_rate": 1.1186440677966102e-05, "loss": 0.94, "step": 34 }, { "epoch": 0.04480358428674294, "grad_norm": 0.7822310924530029, "learning_rate": 1.1525423728813561e-05, "loss": 0.9407, "step": 35 }, { "epoch": 0.046083686694935594, "grad_norm": 0.7825785875320435, "learning_rate": 1.1864406779661018e-05, "loss": 0.9003, "step": 36 }, { "epoch": 0.04736378910312825, "grad_norm": 0.7560637593269348, "learning_rate": 1.2203389830508477e-05, "loss": 0.9513, "step": 37 }, { "epoch": 0.048643891511320904, "grad_norm": 0.698431134223938, "learning_rate": 1.2542372881355932e-05, "loss": 0.901, "step": 38 }, { "epoch": 0.04992399391951356, "grad_norm": 0.7895458936691284, "learning_rate": 1.288135593220339e-05, "loss": 0.8922, "step": 39 }, { "epoch": 0.051204096327706214, "grad_norm": 0.7163522243499756, "learning_rate": 1.3220338983050848e-05, "loss": 0.9065, "step": 40 }, { "epoch": 0.05248419873589887, "grad_norm": 0.670813798904419, "learning_rate": 1.3559322033898305e-05, "loss": 0.8912, "step": 41 }, { "epoch": 0.053764301144091524, "grad_norm": 0.7033433318138123, "learning_rate": 1.3898305084745764e-05, "loss": 0.9136, "step": 42 }, { "epoch": 0.05504440355228418, "grad_norm": 0.7405217289924622, "learning_rate": 1.4237288135593221e-05, "loss": 0.9028, "step": 43 }, { "epoch": 0.05632450596047684, "grad_norm": 0.6802017092704773, "learning_rate": 1.4576271186440678e-05, "loss": 0.8928, "step": 44 }, { "epoch": 0.05760460836866949, "grad_norm": 0.6827060580253601, "learning_rate": 1.4915254237288137e-05, "loss": 0.9427, "step": 45 }, { "epoch": 0.05888471077686215, "grad_norm": 0.7236905694007874, "learning_rate": 1.5254237288135594e-05, "loss": 0.9082, "step": 46 }, { "epoch": 0.0601648131850548, "grad_norm": 0.7171168923377991, "learning_rate": 1.5593220338983053e-05, "loss": 0.9184, "step": 47 }, { "epoch": 0.06144491559324746, "grad_norm": 0.6564812660217285, "learning_rate": 1.593220338983051e-05, "loss": 0.856, "step": 48 }, { "epoch": 0.06272501800144012, "grad_norm": 0.7057896852493286, "learning_rate": 1.6271186440677967e-05, "loss": 0.8904, "step": 49 }, { "epoch": 0.06400512040963277, "grad_norm": 0.7270225882530212, "learning_rate": 1.6610169491525424e-05, "loss": 0.8885, "step": 50 }, { "epoch": 0.06528522281782542, "grad_norm": 0.7114495038986206, "learning_rate": 1.694915254237288e-05, "loss": 0.8972, "step": 51 }, { "epoch": 0.06656532522601809, "grad_norm": 0.7182011008262634, "learning_rate": 1.728813559322034e-05, "loss": 0.9454, "step": 52 }, { "epoch": 0.06784542763421074, "grad_norm": 0.7269001007080078, "learning_rate": 1.76271186440678e-05, "loss": 0.9026, "step": 53 }, { "epoch": 0.06912553004240339, "grad_norm": 0.695046603679657, "learning_rate": 1.7966101694915256e-05, "loss": 0.8912, "step": 54 }, { "epoch": 0.07040563245059604, "grad_norm": 0.7239252924919128, "learning_rate": 1.8305084745762713e-05, "loss": 0.9019, "step": 55 }, { "epoch": 0.07168573485878871, "grad_norm": 0.6834789514541626, "learning_rate": 1.864406779661017e-05, "loss": 0.8904, "step": 56 }, { "epoch": 0.07296583726698136, "grad_norm": 0.7371823191642761, "learning_rate": 1.898305084745763e-05, "loss": 0.9121, "step": 57 }, { "epoch": 0.07424593967517401, "grad_norm": 0.6945562362670898, "learning_rate": 1.9322033898305087e-05, "loss": 0.8754, "step": 58 }, { "epoch": 0.07552604208336668, "grad_norm": 0.717341423034668, "learning_rate": 1.9661016949152545e-05, "loss": 0.8548, "step": 59 }, { "epoch": 0.07680614449155933, "grad_norm": 0.7238847017288208, "learning_rate": 2e-05, "loss": 0.8478, "step": 60 }, { "epoch": 0.07680614449155933, "eval_loss": 0.013981991447508335, "eval_runtime": 10.8389, "eval_samples_per_second": 45.761, "eval_steps_per_second": 5.72, "step": 60 }, { "epoch": 0.07808624689975198, "grad_norm": 0.6857765913009644, "learning_rate": 2.033898305084746e-05, "loss": 0.9078, "step": 61 }, { "epoch": 0.07936634930794463, "grad_norm": 0.7827364802360535, "learning_rate": 2.0677966101694916e-05, "loss": 0.8982, "step": 62 }, { "epoch": 0.0806464517161373, "grad_norm": 0.7178738713264465, "learning_rate": 2.1016949152542376e-05, "loss": 0.882, "step": 63 }, { "epoch": 0.08192655412432995, "grad_norm": 0.7412232160568237, "learning_rate": 2.1355932203389833e-05, "loss": 0.9023, "step": 64 }, { "epoch": 0.0832066565325226, "grad_norm": 0.7248542904853821, "learning_rate": 2.169491525423729e-05, "loss": 0.8355, "step": 65 }, { "epoch": 0.08448675894071525, "grad_norm": 0.6934853196144104, "learning_rate": 2.2033898305084748e-05, "loss": 0.8826, "step": 66 }, { "epoch": 0.08576686134890792, "grad_norm": 0.7710501551628113, "learning_rate": 2.2372881355932205e-05, "loss": 0.8677, "step": 67 }, { "epoch": 0.08704696375710057, "grad_norm": 0.720954418182373, "learning_rate": 2.2711864406779665e-05, "loss": 0.8817, "step": 68 }, { "epoch": 0.08832706616529322, "grad_norm": 0.792184591293335, "learning_rate": 2.3050847457627122e-05, "loss": 0.8755, "step": 69 }, { "epoch": 0.08960716857348588, "grad_norm": 0.8244057297706604, "learning_rate": 2.338983050847458e-05, "loss": 0.8696, "step": 70 }, { "epoch": 0.09088727098167854, "grad_norm": 0.7293037176132202, "learning_rate": 2.3728813559322036e-05, "loss": 0.8693, "step": 71 }, { "epoch": 0.09216737338987119, "grad_norm": 0.8354009985923767, "learning_rate": 2.406779661016949e-05, "loss": 0.8964, "step": 72 }, { "epoch": 0.09344747579806384, "grad_norm": 0.7932097911834717, "learning_rate": 2.4406779661016954e-05, "loss": 0.8834, "step": 73 }, { "epoch": 0.0947275782062565, "grad_norm": 0.7310692071914673, "learning_rate": 2.474576271186441e-05, "loss": 0.8576, "step": 74 }, { "epoch": 0.09600768061444916, "grad_norm": 0.7643473148345947, "learning_rate": 2.5084745762711865e-05, "loss": 0.8414, "step": 75 }, { "epoch": 0.09728778302264181, "grad_norm": 0.7004395127296448, "learning_rate": 2.5423728813559322e-05, "loss": 0.8518, "step": 76 }, { "epoch": 0.09856788543083447, "grad_norm": 0.7725978493690491, "learning_rate": 2.576271186440678e-05, "loss": 0.8464, "step": 77 }, { "epoch": 0.09984798783902712, "grad_norm": 0.7045527696609497, "learning_rate": 2.610169491525424e-05, "loss": 0.8779, "step": 78 }, { "epoch": 0.10112809024721978, "grad_norm": 0.7486863136291504, "learning_rate": 2.6440677966101696e-05, "loss": 0.8712, "step": 79 }, { "epoch": 0.10240819265541243, "grad_norm": 0.7594077587127686, "learning_rate": 2.6779661016949153e-05, "loss": 0.8862, "step": 80 }, { "epoch": 0.1036882950636051, "grad_norm": 0.7708922028541565, "learning_rate": 2.711864406779661e-05, "loss": 0.8716, "step": 81 }, { "epoch": 0.10496839747179774, "grad_norm": 0.8713701367378235, "learning_rate": 2.7457627118644068e-05, "loss": 0.8824, "step": 82 }, { "epoch": 0.1062484998799904, "grad_norm": 0.7621445059776306, "learning_rate": 2.7796610169491528e-05, "loss": 0.8523, "step": 83 }, { "epoch": 0.10752860228818305, "grad_norm": 0.8088158965110779, "learning_rate": 2.8135593220338985e-05, "loss": 0.8374, "step": 84 }, { "epoch": 0.10880870469637571, "grad_norm": 0.7840273380279541, "learning_rate": 2.8474576271186442e-05, "loss": 0.9006, "step": 85 }, { "epoch": 0.11008880710456836, "grad_norm": 0.8660479187965393, "learning_rate": 2.88135593220339e-05, "loss": 0.8457, "step": 86 }, { "epoch": 0.11136890951276102, "grad_norm": 0.8039504289627075, "learning_rate": 2.9152542372881356e-05, "loss": 0.8649, "step": 87 }, { "epoch": 0.11264901192095368, "grad_norm": 0.97013258934021, "learning_rate": 2.9491525423728817e-05, "loss": 0.9029, "step": 88 }, { "epoch": 0.11392911432914633, "grad_norm": 0.8036187291145325, "learning_rate": 2.9830508474576274e-05, "loss": 0.8297, "step": 89 }, { "epoch": 0.11520921673733898, "grad_norm": 0.8849989175796509, "learning_rate": 3.016949152542373e-05, "loss": 0.8567, "step": 90 }, { "epoch": 0.11520921673733898, "eval_loss": 0.013601833023130894, "eval_runtime": 10.8134, "eval_samples_per_second": 45.869, "eval_steps_per_second": 5.734, "step": 90 }, { "epoch": 0.11648931914553164, "grad_norm": 0.8388200402259827, "learning_rate": 3.0508474576271188e-05, "loss": 0.8421, "step": 91 }, { "epoch": 0.1177694215537243, "grad_norm": 1.01188063621521, "learning_rate": 3.084745762711865e-05, "loss": 0.8578, "step": 92 }, { "epoch": 0.11904952396191695, "grad_norm": 0.7491028308868408, "learning_rate": 3.1186440677966106e-05, "loss": 0.8573, "step": 93 }, { "epoch": 0.1203296263701096, "grad_norm": 1.0739816427230835, "learning_rate": 3.152542372881356e-05, "loss": 0.9224, "step": 94 }, { "epoch": 0.12160972877830227, "grad_norm": 0.9446407556533813, "learning_rate": 3.186440677966102e-05, "loss": 0.8538, "step": 95 }, { "epoch": 0.12288983118649492, "grad_norm": 0.9192800521850586, "learning_rate": 3.2203389830508473e-05, "loss": 0.853, "step": 96 }, { "epoch": 0.12416993359468757, "grad_norm": 1.107749342918396, "learning_rate": 3.2542372881355934e-05, "loss": 0.8723, "step": 97 }, { "epoch": 0.12545003600288024, "grad_norm": 0.9199897050857544, "learning_rate": 3.2881355932203394e-05, "loss": 0.8362, "step": 98 }, { "epoch": 0.1267301384110729, "grad_norm": 1.0593056678771973, "learning_rate": 3.322033898305085e-05, "loss": 0.8373, "step": 99 }, { "epoch": 0.12801024081926554, "grad_norm": 0.975534975528717, "learning_rate": 3.355932203389831e-05, "loss": 0.8604, "step": 100 }, { "epoch": 0.1292903432274582, "grad_norm": 1.0486565828323364, "learning_rate": 3.389830508474576e-05, "loss": 0.8732, "step": 101 }, { "epoch": 0.13057044563565084, "grad_norm": 1.0505051612854004, "learning_rate": 3.423728813559322e-05, "loss": 0.8588, "step": 102 }, { "epoch": 0.1318505480438435, "grad_norm": 0.8159765005111694, "learning_rate": 3.457627118644068e-05, "loss": 0.8383, "step": 103 }, { "epoch": 0.13313065045203618, "grad_norm": 0.9945966601371765, "learning_rate": 3.491525423728814e-05, "loss": 0.8391, "step": 104 }, { "epoch": 0.13441075286022883, "grad_norm": 0.9792317152023315, "learning_rate": 3.52542372881356e-05, "loss": 0.9045, "step": 105 }, { "epoch": 0.13569085526842148, "grad_norm": 0.9425814747810364, "learning_rate": 3.559322033898305e-05, "loss": 0.8713, "step": 106 }, { "epoch": 0.13697095767661413, "grad_norm": 1.0463520288467407, "learning_rate": 3.593220338983051e-05, "loss": 0.8833, "step": 107 }, { "epoch": 0.13825106008480678, "grad_norm": 0.9036206007003784, "learning_rate": 3.627118644067797e-05, "loss": 0.8142, "step": 108 }, { "epoch": 0.13953116249299943, "grad_norm": 0.8945938944816589, "learning_rate": 3.6610169491525426e-05, "loss": 0.8189, "step": 109 }, { "epoch": 0.14081126490119208, "grad_norm": 1.0331628322601318, "learning_rate": 3.6949152542372886e-05, "loss": 0.8251, "step": 110 }, { "epoch": 0.14209136730938476, "grad_norm": 1.019895076751709, "learning_rate": 3.728813559322034e-05, "loss": 0.8176, "step": 111 }, { "epoch": 0.14337146971757742, "grad_norm": 0.9001871347427368, "learning_rate": 3.76271186440678e-05, "loss": 0.842, "step": 112 }, { "epoch": 0.14465157212577007, "grad_norm": 0.842754065990448, "learning_rate": 3.796610169491526e-05, "loss": 0.8192, "step": 113 }, { "epoch": 0.14593167453396272, "grad_norm": 0.998187243938446, "learning_rate": 3.8305084745762714e-05, "loss": 0.9035, "step": 114 }, { "epoch": 0.14721177694215537, "grad_norm": 0.8333083987236023, "learning_rate": 3.8644067796610175e-05, "loss": 0.7836, "step": 115 }, { "epoch": 0.14849187935034802, "grad_norm": 1.0127038955688477, "learning_rate": 3.898305084745763e-05, "loss": 0.811, "step": 116 }, { "epoch": 0.14977198175854067, "grad_norm": 0.7711405754089355, "learning_rate": 3.932203389830509e-05, "loss": 0.814, "step": 117 }, { "epoch": 0.15105208416673335, "grad_norm": 0.9136852622032166, "learning_rate": 3.966101694915255e-05, "loss": 0.8363, "step": 118 }, { "epoch": 0.152332186574926, "grad_norm": 0.8900148868560791, "learning_rate": 4e-05, "loss": 0.8484, "step": 119 }, { "epoch": 0.15361228898311866, "grad_norm": 0.8631476163864136, "learning_rate": 3.999999382260215e-05, "loss": 0.8252, "step": 120 }, { "epoch": 0.15361228898311866, "eval_loss": 0.013392439112067223, "eval_runtime": 10.8197, "eval_samples_per_second": 45.842, "eval_steps_per_second": 5.73, "step": 120 }, { "epoch": 0.1548923913913113, "grad_norm": 0.8755859136581421, "learning_rate": 3.9999975290412844e-05, "loss": 0.8276, "step": 121 }, { "epoch": 0.15617249379950396, "grad_norm": 0.8674336671829224, "learning_rate": 3.9999944403444785e-05, "loss": 0.8313, "step": 122 }, { "epoch": 0.1574525962076966, "grad_norm": 0.7986403107643127, "learning_rate": 3.999990116171919e-05, "loss": 0.8785, "step": 123 }, { "epoch": 0.15873269861588926, "grad_norm": 0.8159152865409851, "learning_rate": 3.999984556526574e-05, "loss": 0.8822, "step": 124 }, { "epoch": 0.1600128010240819, "grad_norm": 0.8714810013771057, "learning_rate": 3.9999777614122576e-05, "loss": 0.8251, "step": 125 }, { "epoch": 0.1612929034322746, "grad_norm": 0.7786198854446411, "learning_rate": 3.9999697308336365e-05, "loss": 0.8785, "step": 126 }, { "epoch": 0.16257300584046724, "grad_norm": 1.0131577253341675, "learning_rate": 3.99996046479622e-05, "loss": 0.8619, "step": 127 }, { "epoch": 0.1638531082486599, "grad_norm": 0.8323366641998291, "learning_rate": 3.99994996330637e-05, "loss": 0.8224, "step": 128 }, { "epoch": 0.16513321065685255, "grad_norm": 0.9837428331375122, "learning_rate": 3.999938226371294e-05, "loss": 0.831, "step": 129 }, { "epoch": 0.1664133130650452, "grad_norm": 0.9995911717414856, "learning_rate": 3.999925253999048e-05, "loss": 0.865, "step": 130 }, { "epoch": 0.16769341547323785, "grad_norm": 0.8621081113815308, "learning_rate": 3.999911046198536e-05, "loss": 0.8698, "step": 131 }, { "epoch": 0.1689735178814305, "grad_norm": 1.2333866357803345, "learning_rate": 3.9998956029795096e-05, "loss": 0.8409, "step": 132 }, { "epoch": 0.17025362028962318, "grad_norm": 1.014843225479126, "learning_rate": 3.999878924352568e-05, "loss": 0.891, "step": 133 }, { "epoch": 0.17153372269781583, "grad_norm": 1.112094521522522, "learning_rate": 3.99986101032916e-05, "loss": 0.8653, "step": 134 }, { "epoch": 0.17281382510600848, "grad_norm": 0.9054744839668274, "learning_rate": 3.9998418609215826e-05, "loss": 0.7658, "step": 135 }, { "epoch": 0.17409392751420114, "grad_norm": 0.9942414164543152, "learning_rate": 3.999821476142977e-05, "loss": 0.8341, "step": 136 }, { "epoch": 0.1753740299223938, "grad_norm": 0.9464170336723328, "learning_rate": 3.9997998560073364e-05, "loss": 0.798, "step": 137 }, { "epoch": 0.17665413233058644, "grad_norm": 1.042913556098938, "learning_rate": 3.9997770005294996e-05, "loss": 0.8067, "step": 138 }, { "epoch": 0.1779342347387791, "grad_norm": 0.8861857652664185, "learning_rate": 3.999752909725154e-05, "loss": 0.8492, "step": 139 }, { "epoch": 0.17921433714697177, "grad_norm": 0.9364302158355713, "learning_rate": 3.9997275836108366e-05, "loss": 0.8356, "step": 140 }, { "epoch": 0.18049443955516442, "grad_norm": 0.901847779750824, "learning_rate": 3.9997010222039297e-05, "loss": 0.8278, "step": 141 }, { "epoch": 0.18177454196335707, "grad_norm": 1.061315655708313, "learning_rate": 3.999673225522664e-05, "loss": 0.8284, "step": 142 }, { "epoch": 0.18305464437154972, "grad_norm": 0.8948325514793396, "learning_rate": 3.999644193586118e-05, "loss": 0.8294, "step": 143 }, { "epoch": 0.18433474677974238, "grad_norm": 1.0115327835083008, "learning_rate": 3.9996139264142205e-05, "loss": 0.8784, "step": 144 }, { "epoch": 0.18561484918793503, "grad_norm": 0.9907302856445312, "learning_rate": 3.999582424027744e-05, "loss": 0.8236, "step": 145 }, { "epoch": 0.18689495159612768, "grad_norm": 0.9442008137702942, "learning_rate": 3.999549686448313e-05, "loss": 0.8438, "step": 146 }, { "epoch": 0.18817505400432036, "grad_norm": 0.9412844777107239, "learning_rate": 3.9995157136983966e-05, "loss": 0.8731, "step": 147 }, { "epoch": 0.189455156412513, "grad_norm": 0.8231805562973022, "learning_rate": 3.999480505801313e-05, "loss": 0.8479, "step": 148 }, { "epoch": 0.19073525882070566, "grad_norm": 1.113372802734375, "learning_rate": 3.999444062781229e-05, "loss": 0.8655, "step": 149 }, { "epoch": 0.1920153612288983, "grad_norm": 0.7836041450500488, "learning_rate": 3.9994063846631565e-05, "loss": 0.8351, "step": 150 }, { "epoch": 0.1920153612288983, "eval_loss": 0.013233460485935211, "eval_runtime": 10.8102, "eval_samples_per_second": 45.883, "eval_steps_per_second": 5.735, "step": 150 }, { "epoch": 0.19329546363709096, "grad_norm": 0.9617286920547485, "learning_rate": 3.99936747147296e-05, "loss": 0.79, "step": 151 }, { "epoch": 0.19457556604528362, "grad_norm": 0.8357570767402649, "learning_rate": 3.9993273232373455e-05, "loss": 0.8284, "step": 152 }, { "epoch": 0.19585566845347627, "grad_norm": 1.0674220323562622, "learning_rate": 3.999285939983871e-05, "loss": 0.8479, "step": 153 }, { "epoch": 0.19713577086166895, "grad_norm": 0.9409031271934509, "learning_rate": 3.9992433217409414e-05, "loss": 0.8149, "step": 154 }, { "epoch": 0.1984158732698616, "grad_norm": 1.0493512153625488, "learning_rate": 3.999199468537809e-05, "loss": 0.809, "step": 155 }, { "epoch": 0.19969597567805425, "grad_norm": 1.1253619194030762, "learning_rate": 3.999154380404572e-05, "loss": 0.8131, "step": 156 }, { "epoch": 0.2009760780862469, "grad_norm": 0.8770150542259216, "learning_rate": 3.9991080573721805e-05, "loss": 0.7923, "step": 157 }, { "epoch": 0.20225618049443955, "grad_norm": 1.2235959768295288, "learning_rate": 3.9990604994724276e-05, "loss": 0.8317, "step": 158 }, { "epoch": 0.2035362829026322, "grad_norm": 0.9696475267410278, "learning_rate": 3.999011706737957e-05, "loss": 0.8265, "step": 159 }, { "epoch": 0.20481638531082486, "grad_norm": 1.2137672901153564, "learning_rate": 3.998961679202258e-05, "loss": 0.8498, "step": 160 }, { "epoch": 0.20609648771901753, "grad_norm": 0.9181241393089294, "learning_rate": 3.998910416899669e-05, "loss": 0.8263, "step": 161 }, { "epoch": 0.2073765901272102, "grad_norm": 1.0590282678604126, "learning_rate": 3.998857919865376e-05, "loss": 0.8282, "step": 162 }, { "epoch": 0.20865669253540284, "grad_norm": 0.951016366481781, "learning_rate": 3.9988041881354095e-05, "loss": 0.8476, "step": 163 }, { "epoch": 0.2099367949435955, "grad_norm": 0.8958009481430054, "learning_rate": 3.998749221746652e-05, "loss": 0.8129, "step": 164 }, { "epoch": 0.21121689735178814, "grad_norm": 1.042737603187561, "learning_rate": 3.9986930207368306e-05, "loss": 0.8522, "step": 165 }, { "epoch": 0.2124969997599808, "grad_norm": 0.9709591865539551, "learning_rate": 3.998635585144521e-05, "loss": 0.8247, "step": 166 }, { "epoch": 0.21377710216817344, "grad_norm": 0.9807443618774414, "learning_rate": 3.9985769150091434e-05, "loss": 0.8134, "step": 167 }, { "epoch": 0.2150572045763661, "grad_norm": 0.9329289197921753, "learning_rate": 3.99851701037097e-05, "loss": 0.8209, "step": 168 }, { "epoch": 0.21633730698455877, "grad_norm": 0.9565260410308838, "learning_rate": 3.998455871271117e-05, "loss": 0.8406, "step": 169 }, { "epoch": 0.21761740939275143, "grad_norm": 0.9333802461624146, "learning_rate": 3.99839349775155e-05, "loss": 0.794, "step": 170 }, { "epoch": 0.21889751180094408, "grad_norm": 0.8861300945281982, "learning_rate": 3.9983298898550794e-05, "loss": 0.8694, "step": 171 }, { "epoch": 0.22017761420913673, "grad_norm": 0.8293015360832214, "learning_rate": 3.998265047625364e-05, "loss": 0.8338, "step": 172 }, { "epoch": 0.22145771661732938, "grad_norm": 0.8500891327857971, "learning_rate": 3.998198971106912e-05, "loss": 0.8035, "step": 173 }, { "epoch": 0.22273781902552203, "grad_norm": 0.800555408000946, "learning_rate": 3.998131660345075e-05, "loss": 0.8699, "step": 174 }, { "epoch": 0.22401792143371468, "grad_norm": 0.8893824815750122, "learning_rate": 3.998063115386054e-05, "loss": 0.7829, "step": 175 }, { "epoch": 0.22529802384190736, "grad_norm": 0.7633495330810547, "learning_rate": 3.997993336276897e-05, "loss": 0.8272, "step": 176 }, { "epoch": 0.22657812625010001, "grad_norm": 0.8218979835510254, "learning_rate": 3.9979223230654994e-05, "loss": 0.7728, "step": 177 }, { "epoch": 0.22785822865829267, "grad_norm": 0.7941882014274597, "learning_rate": 3.997850075800602e-05, "loss": 0.7987, "step": 178 }, { "epoch": 0.22913833106648532, "grad_norm": 0.8235889077186584, "learning_rate": 3.9977765945317934e-05, "loss": 0.8311, "step": 179 }, { "epoch": 0.23041843347467797, "grad_norm": 0.8269426226615906, "learning_rate": 3.997701879309511e-05, "loss": 0.8177, "step": 180 }, { "epoch": 0.23041843347467797, "eval_loss": 0.013103107921779156, "eval_runtime": 10.8218, "eval_samples_per_second": 45.833, "eval_steps_per_second": 5.729, "step": 180 }, { "epoch": 0.23169853588287062, "grad_norm": 0.9420286417007446, "learning_rate": 3.9976259301850375e-05, "loss": 0.8359, "step": 181 }, { "epoch": 0.23297863829106327, "grad_norm": 0.9078615307807922, "learning_rate": 3.997548747210501e-05, "loss": 0.7836, "step": 182 }, { "epoch": 0.23425874069925595, "grad_norm": 0.9137442111968994, "learning_rate": 3.997470330438879e-05, "loss": 0.8228, "step": 183 }, { "epoch": 0.2355388431074486, "grad_norm": 0.9286066889762878, "learning_rate": 3.9973906799239964e-05, "loss": 0.8077, "step": 184 }, { "epoch": 0.23681894551564125, "grad_norm": 0.922153890132904, "learning_rate": 3.997309795720521e-05, "loss": 0.8655, "step": 185 }, { "epoch": 0.2380990479238339, "grad_norm": 0.8637731075286865, "learning_rate": 3.9972276778839725e-05, "loss": 0.8416, "step": 186 }, { "epoch": 0.23937915033202656, "grad_norm": 0.8832123875617981, "learning_rate": 3.997144326470713e-05, "loss": 0.8376, "step": 187 }, { "epoch": 0.2406592527402192, "grad_norm": 0.9608950614929199, "learning_rate": 3.9970597415379535e-05, "loss": 0.8298, "step": 188 }, { "epoch": 0.24193935514841186, "grad_norm": 0.8668861389160156, "learning_rate": 3.9969739231437514e-05, "loss": 0.8076, "step": 189 }, { "epoch": 0.24321945755660454, "grad_norm": 0.7897141575813293, "learning_rate": 3.99688687134701e-05, "loss": 0.8099, "step": 190 }, { "epoch": 0.2444995599647972, "grad_norm": 0.8441980481147766, "learning_rate": 3.9967985862074795e-05, "loss": 0.8078, "step": 191 }, { "epoch": 0.24577966237298984, "grad_norm": 0.8205133676528931, "learning_rate": 3.996709067785758e-05, "loss": 0.8296, "step": 192 }, { "epoch": 0.2470597647811825, "grad_norm": 0.9071422815322876, "learning_rate": 3.996618316143288e-05, "loss": 0.8355, "step": 193 }, { "epoch": 0.24833986718937515, "grad_norm": 0.7740186452865601, "learning_rate": 3.996526331342361e-05, "loss": 0.8331, "step": 194 }, { "epoch": 0.2496199695975678, "grad_norm": 0.97866290807724, "learning_rate": 3.9964331134461104e-05, "loss": 0.8096, "step": 195 }, { "epoch": 0.2509000720057605, "grad_norm": 0.6750162839889526, "learning_rate": 3.996338662518521e-05, "loss": 0.797, "step": 196 }, { "epoch": 0.25218017441395313, "grad_norm": 0.8180609345436096, "learning_rate": 3.996242978624421e-05, "loss": 0.8085, "step": 197 }, { "epoch": 0.2534602768221458, "grad_norm": 0.8507323861122131, "learning_rate": 3.996146061829487e-05, "loss": 0.8164, "step": 198 }, { "epoch": 0.25474037923033843, "grad_norm": 0.7099197506904602, "learning_rate": 3.9960479122002384e-05, "loss": 0.8216, "step": 199 }, { "epoch": 0.2560204816385311, "grad_norm": 0.9042320847511292, "learning_rate": 3.9959485298040436e-05, "loss": 0.807, "step": 200 }, { "epoch": 0.25730058404672373, "grad_norm": 0.886713445186615, "learning_rate": 3.995847914709118e-05, "loss": 0.8262, "step": 201 }, { "epoch": 0.2585806864549164, "grad_norm": 0.7223711609840393, "learning_rate": 3.9957460669845204e-05, "loss": 0.7771, "step": 202 }, { "epoch": 0.25986078886310904, "grad_norm": 0.7963854074478149, "learning_rate": 3.9956429867001554e-05, "loss": 0.8313, "step": 203 }, { "epoch": 0.2611408912713017, "grad_norm": 0.7575312852859497, "learning_rate": 3.9955386739267766e-05, "loss": 0.7841, "step": 204 }, { "epoch": 0.26242099367949434, "grad_norm": 0.8132676482200623, "learning_rate": 3.9954331287359827e-05, "loss": 0.8317, "step": 205 }, { "epoch": 0.263701096087687, "grad_norm": 0.7840173840522766, "learning_rate": 3.995326351200215e-05, "loss": 0.8143, "step": 206 }, { "epoch": 0.26498119849587964, "grad_norm": 0.740490198135376, "learning_rate": 3.995218341392766e-05, "loss": 0.8268, "step": 207 }, { "epoch": 0.26626130090407235, "grad_norm": 0.8167890906333923, "learning_rate": 3.995109099387769e-05, "loss": 0.8043, "step": 208 }, { "epoch": 0.267541403312265, "grad_norm": 0.7455295324325562, "learning_rate": 3.9949986252602074e-05, "loss": 0.8113, "step": 209 }, { "epoch": 0.26882150572045765, "grad_norm": 0.8637762069702148, "learning_rate": 3.994886919085906e-05, "loss": 0.8118, "step": 210 }, { "epoch": 0.26882150572045765, "eval_loss": 0.012998094782233238, "eval_runtime": 10.8341, "eval_samples_per_second": 45.781, "eval_steps_per_second": 5.723, "step": 210 }, { "epoch": 0.2701016081286503, "grad_norm": 0.7905036211013794, "learning_rate": 3.9947739809415384e-05, "loss": 0.8571, "step": 211 }, { "epoch": 0.27138171053684296, "grad_norm": 0.7857114672660828, "learning_rate": 3.994659810904623e-05, "loss": 0.8029, "step": 212 }, { "epoch": 0.2726618129450356, "grad_norm": 0.9537340998649597, "learning_rate": 3.994544409053523e-05, "loss": 0.8214, "step": 213 }, { "epoch": 0.27394191535322826, "grad_norm": 0.8235071301460266, "learning_rate": 3.994427775467448e-05, "loss": 0.8492, "step": 214 }, { "epoch": 0.2752220177614209, "grad_norm": 0.8366528153419495, "learning_rate": 3.994309910226453e-05, "loss": 0.833, "step": 215 }, { "epoch": 0.27650212016961356, "grad_norm": 0.8549700975418091, "learning_rate": 3.994190813411437e-05, "loss": 0.8229, "step": 216 }, { "epoch": 0.2777822225778062, "grad_norm": 0.8313760757446289, "learning_rate": 3.9940704851041466e-05, "loss": 0.8408, "step": 217 }, { "epoch": 0.27906232498599887, "grad_norm": 0.7870802283287048, "learning_rate": 3.9939489253871715e-05, "loss": 0.8467, "step": 218 }, { "epoch": 0.2803424273941915, "grad_norm": 0.8972495794296265, "learning_rate": 3.993826134343949e-05, "loss": 0.7698, "step": 219 }, { "epoch": 0.28162252980238417, "grad_norm": 0.8142496347427368, "learning_rate": 3.993702112058757e-05, "loss": 0.859, "step": 220 }, { "epoch": 0.2829026322105768, "grad_norm": 1.0279487371444702, "learning_rate": 3.9935768586167254e-05, "loss": 0.8509, "step": 221 }, { "epoch": 0.28418273461876953, "grad_norm": 0.7696442604064941, "learning_rate": 3.993450374103823e-05, "loss": 0.8516, "step": 222 }, { "epoch": 0.2854628370269622, "grad_norm": 0.8864192366600037, "learning_rate": 3.9933226586068666e-05, "loss": 0.8495, "step": 223 }, { "epoch": 0.28674293943515483, "grad_norm": 0.8386762738227844, "learning_rate": 3.9931937122135176e-05, "loss": 0.8755, "step": 224 }, { "epoch": 0.2880230418433475, "grad_norm": 0.7864452600479126, "learning_rate": 3.9930635350122806e-05, "loss": 0.8074, "step": 225 }, { "epoch": 0.28930314425154013, "grad_norm": 0.8790215849876404, "learning_rate": 3.992932127092508e-05, "loss": 0.8277, "step": 226 }, { "epoch": 0.2905832466597328, "grad_norm": 0.7088143825531006, "learning_rate": 3.9927994885443945e-05, "loss": 0.7891, "step": 227 }, { "epoch": 0.29186334906792544, "grad_norm": 0.7788523435592651, "learning_rate": 3.99266561945898e-05, "loss": 0.7683, "step": 228 }, { "epoch": 0.2931434514761181, "grad_norm": 0.8953355550765991, "learning_rate": 3.99253051992815e-05, "loss": 0.816, "step": 229 }, { "epoch": 0.29442355388431074, "grad_norm": 0.7870184779167175, "learning_rate": 3.992394190044632e-05, "loss": 0.8159, "step": 230 }, { "epoch": 0.2957036562925034, "grad_norm": 0.8162986636161804, "learning_rate": 3.9922566299020015e-05, "loss": 0.7715, "step": 231 }, { "epoch": 0.29698375870069604, "grad_norm": 0.8836362361907959, "learning_rate": 3.992117839594676e-05, "loss": 0.8133, "step": 232 }, { "epoch": 0.2982638611088887, "grad_norm": 0.742364227771759, "learning_rate": 3.991977819217919e-05, "loss": 0.8183, "step": 233 }, { "epoch": 0.29954396351708135, "grad_norm": 0.9332095980644226, "learning_rate": 3.9918365688678354e-05, "loss": 0.8485, "step": 234 }, { "epoch": 0.300824065925274, "grad_norm": 0.781606912612915, "learning_rate": 3.991694088641377e-05, "loss": 0.7872, "step": 235 }, { "epoch": 0.3021041683334667, "grad_norm": 0.9482907056808472, "learning_rate": 3.991550378636341e-05, "loss": 0.8303, "step": 236 }, { "epoch": 0.30338427074165936, "grad_norm": 0.7216508388519287, "learning_rate": 3.991405438951365e-05, "loss": 0.7753, "step": 237 }, { "epoch": 0.304664373149852, "grad_norm": 0.7598963379859924, "learning_rate": 3.991259269685932e-05, "loss": 0.7773, "step": 238 }, { "epoch": 0.30594447555804466, "grad_norm": 0.7879756689071655, "learning_rate": 3.9911118709403694e-05, "loss": 0.8307, "step": 239 }, { "epoch": 0.3072245779662373, "grad_norm": 0.8073533773422241, "learning_rate": 3.99096324281585e-05, "loss": 0.7971, "step": 240 }, { "epoch": 0.3072245779662373, "eval_loss": 0.012903096154332161, "eval_runtime": 10.8174, "eval_samples_per_second": 45.852, "eval_steps_per_second": 5.732, "step": 240 }, { "epoch": 0.30850468037442996, "grad_norm": 0.8798401951789856, "learning_rate": 3.9908133854143865e-05, "loss": 0.8206, "step": 241 }, { "epoch": 0.3097847827826226, "grad_norm": 0.9081045389175415, "learning_rate": 3.9906622988388396e-05, "loss": 0.8528, "step": 242 }, { "epoch": 0.31106488519081527, "grad_norm": 0.8628330230712891, "learning_rate": 3.99050998319291e-05, "loss": 0.8297, "step": 243 }, { "epoch": 0.3123449875990079, "grad_norm": 0.7450794577598572, "learning_rate": 3.9903564385811456e-05, "loss": 0.7667, "step": 244 }, { "epoch": 0.31362509000720057, "grad_norm": 0.7316635251045227, "learning_rate": 3.990201665108934e-05, "loss": 0.867, "step": 245 }, { "epoch": 0.3149051924153932, "grad_norm": 0.903037965297699, "learning_rate": 3.99004566288251e-05, "loss": 0.8491, "step": 246 }, { "epoch": 0.31618529482358587, "grad_norm": 0.7979913949966431, "learning_rate": 3.989888432008948e-05, "loss": 0.7929, "step": 247 }, { "epoch": 0.3174653972317785, "grad_norm": 0.859156608581543, "learning_rate": 3.989729972596171e-05, "loss": 0.7699, "step": 248 }, { "epoch": 0.3187454996399712, "grad_norm": 0.7992383241653442, "learning_rate": 3.989570284752939e-05, "loss": 0.8275, "step": 249 }, { "epoch": 0.3200256020481638, "grad_norm": 0.9154579043388367, "learning_rate": 3.9894093685888584e-05, "loss": 0.8396, "step": 250 }, { "epoch": 0.32130570445635653, "grad_norm": 0.7978524565696716, "learning_rate": 3.98924722421438e-05, "loss": 0.8499, "step": 251 }, { "epoch": 0.3225858068645492, "grad_norm": 0.6886290907859802, "learning_rate": 3.989083851740795e-05, "loss": 0.7635, "step": 252 }, { "epoch": 0.32386590927274184, "grad_norm": 0.8453454971313477, "learning_rate": 3.9889192512802395e-05, "loss": 0.8194, "step": 253 }, { "epoch": 0.3251460116809345, "grad_norm": 0.7061597108840942, "learning_rate": 3.9887534229456896e-05, "loss": 0.7581, "step": 254 }, { "epoch": 0.32642611408912714, "grad_norm": 0.8182460069656372, "learning_rate": 3.988586366850968e-05, "loss": 0.79, "step": 255 }, { "epoch": 0.3277062164973198, "grad_norm": 0.8259915709495544, "learning_rate": 3.988418083110738e-05, "loss": 0.8186, "step": 256 }, { "epoch": 0.32898631890551244, "grad_norm": 0.7348259687423706, "learning_rate": 3.9882485718405054e-05, "loss": 0.8269, "step": 257 }, { "epoch": 0.3302664213137051, "grad_norm": 0.7757918834686279, "learning_rate": 3.988077833156619e-05, "loss": 0.7898, "step": 258 }, { "epoch": 0.33154652372189775, "grad_norm": 0.883405864238739, "learning_rate": 3.9879058671762695e-05, "loss": 0.7759, "step": 259 }, { "epoch": 0.3328266261300904, "grad_norm": 0.7318927645683289, "learning_rate": 3.987732674017491e-05, "loss": 0.8345, "step": 260 }, { "epoch": 0.33410672853828305, "grad_norm": 0.9309760332107544, "learning_rate": 3.98755825379916e-05, "loss": 0.7986, "step": 261 }, { "epoch": 0.3353868309464757, "grad_norm": 0.895551860332489, "learning_rate": 3.987382606640993e-05, "loss": 0.8246, "step": 262 }, { "epoch": 0.33666693335466835, "grad_norm": 0.9246336817741394, "learning_rate": 3.9872057326635525e-05, "loss": 0.7803, "step": 263 }, { "epoch": 0.337947035762861, "grad_norm": 0.7929348349571228, "learning_rate": 3.987027631988239e-05, "loss": 0.7914, "step": 264 }, { "epoch": 0.3392271381710537, "grad_norm": 0.8753546476364136, "learning_rate": 3.9868483047372974e-05, "loss": 0.7532, "step": 265 }, { "epoch": 0.34050724057924636, "grad_norm": 0.7170605063438416, "learning_rate": 3.9866677510338136e-05, "loss": 0.8136, "step": 266 }, { "epoch": 0.341787342987439, "grad_norm": 0.8197619915008545, "learning_rate": 3.986485971001716e-05, "loss": 0.8157, "step": 267 }, { "epoch": 0.34306744539563166, "grad_norm": 0.8301973938941956, "learning_rate": 3.986302964765774e-05, "loss": 0.8593, "step": 268 }, { "epoch": 0.3443475478038243, "grad_norm": 0.7686181664466858, "learning_rate": 3.9861187324516e-05, "loss": 0.7886, "step": 269 }, { "epoch": 0.34562765021201697, "grad_norm": 0.8302679061889648, "learning_rate": 3.985933274185646e-05, "loss": 0.7867, "step": 270 }, { "epoch": 0.34562765021201697, "eval_loss": 0.012820749543607235, "eval_runtime": 10.8139, "eval_samples_per_second": 45.867, "eval_steps_per_second": 5.733, "step": 270 }, { "epoch": 0.3469077526202096, "grad_norm": 0.8299188017845154, "learning_rate": 3.985746590095206e-05, "loss": 0.792, "step": 271 }, { "epoch": 0.34818785502840227, "grad_norm": 0.7753996849060059, "learning_rate": 3.985558680308416e-05, "loss": 0.7904, "step": 272 }, { "epoch": 0.3494679574365949, "grad_norm": 0.9009094834327698, "learning_rate": 3.985369544954254e-05, "loss": 0.82, "step": 273 }, { "epoch": 0.3507480598447876, "grad_norm": 0.7270292043685913, "learning_rate": 3.985179184162537e-05, "loss": 0.7553, "step": 274 }, { "epoch": 0.3520281622529802, "grad_norm": 0.9866331219673157, "learning_rate": 3.984987598063925e-05, "loss": 0.8549, "step": 275 }, { "epoch": 0.3533082646611729, "grad_norm": 0.8446618914604187, "learning_rate": 3.984794786789919e-05, "loss": 0.7954, "step": 276 }, { "epoch": 0.35458836706936553, "grad_norm": 0.7152864933013916, "learning_rate": 3.9846007504728593e-05, "loss": 0.806, "step": 277 }, { "epoch": 0.3558684694775582, "grad_norm": 0.756089985370636, "learning_rate": 3.984405489245928e-05, "loss": 0.7996, "step": 278 }, { "epoch": 0.3571485718857509, "grad_norm": 0.7793037295341492, "learning_rate": 3.984209003243149e-05, "loss": 0.8117, "step": 279 }, { "epoch": 0.35842867429394354, "grad_norm": 0.708320140838623, "learning_rate": 3.984011292599385e-05, "loss": 0.7597, "step": 280 }, { "epoch": 0.3597087767021362, "grad_norm": 0.7415875196456909, "learning_rate": 3.983812357450341e-05, "loss": 0.771, "step": 281 }, { "epoch": 0.36098887911032884, "grad_norm": 0.7343917489051819, "learning_rate": 3.983612197932561e-05, "loss": 0.8324, "step": 282 }, { "epoch": 0.3622689815185215, "grad_norm": 0.722980260848999, "learning_rate": 3.98341081418343e-05, "loss": 0.7972, "step": 283 }, { "epoch": 0.36354908392671414, "grad_norm": 0.7382889986038208, "learning_rate": 3.983208206341173e-05, "loss": 0.7891, "step": 284 }, { "epoch": 0.3648291863349068, "grad_norm": 0.7934734225273132, "learning_rate": 3.983004374544856e-05, "loss": 0.8272, "step": 285 }, { "epoch": 0.36610928874309945, "grad_norm": 0.7105775475502014, "learning_rate": 3.982799318934385e-05, "loss": 0.8011, "step": 286 }, { "epoch": 0.3673893911512921, "grad_norm": 0.7467436194419861, "learning_rate": 3.9825930396505036e-05, "loss": 0.8085, "step": 287 }, { "epoch": 0.36866949355948475, "grad_norm": 0.7933696508407593, "learning_rate": 3.982385536834799e-05, "loss": 0.8297, "step": 288 }, { "epoch": 0.3699495959676774, "grad_norm": 0.6954778432846069, "learning_rate": 3.9821768106296975e-05, "loss": 0.8231, "step": 289 }, { "epoch": 0.37122969837587005, "grad_norm": 0.8585456609725952, "learning_rate": 3.981966861178462e-05, "loss": 0.7696, "step": 290 }, { "epoch": 0.3725098007840627, "grad_norm": 0.7246525883674622, "learning_rate": 3.981755688625197e-05, "loss": 0.8118, "step": 291 }, { "epoch": 0.37378990319225536, "grad_norm": 0.7333858609199524, "learning_rate": 3.981543293114849e-05, "loss": 0.8244, "step": 292 }, { "epoch": 0.375070005600448, "grad_norm": 0.742274284362793, "learning_rate": 3.981329674793198e-05, "loss": 0.793, "step": 293 }, { "epoch": 0.3763501080086407, "grad_norm": 0.6696738600730896, "learning_rate": 3.98111483380687e-05, "loss": 0.7953, "step": 294 }, { "epoch": 0.37763021041683337, "grad_norm": 0.8201417326927185, "learning_rate": 3.9808987703033256e-05, "loss": 0.7991, "step": 295 }, { "epoch": 0.378910312825026, "grad_norm": 0.7530762553215027, "learning_rate": 3.980681484430866e-05, "loss": 0.7908, "step": 296 }, { "epoch": 0.38019041523321867, "grad_norm": 0.7389295101165771, "learning_rate": 3.980462976338631e-05, "loss": 0.7866, "step": 297 }, { "epoch": 0.3814705176414113, "grad_norm": 0.743794322013855, "learning_rate": 3.9802432461766006e-05, "loss": 0.7843, "step": 298 }, { "epoch": 0.382750620049604, "grad_norm": 0.8816423416137695, "learning_rate": 3.980022294095592e-05, "loss": 0.814, "step": 299 }, { "epoch": 0.3840307224577966, "grad_norm": 0.7187123894691467, "learning_rate": 3.979800120247262e-05, "loss": 0.7907, "step": 300 }, { "epoch": 0.3840307224577966, "eval_loss": 0.01275508850812912, "eval_runtime": 10.8305, "eval_samples_per_second": 45.797, "eval_steps_per_second": 5.725, "step": 300 }, { "epoch": 0.3853108248659893, "grad_norm": 0.7645212411880493, "learning_rate": 3.979576724784105e-05, "loss": 0.7965, "step": 301 }, { "epoch": 0.38659092727418193, "grad_norm": 0.8202989101409912, "learning_rate": 3.9793521078594556e-05, "loss": 0.7962, "step": 302 }, { "epoch": 0.3878710296823746, "grad_norm": 0.7811014652252197, "learning_rate": 3.9791262696274854e-05, "loss": 0.7973, "step": 303 }, { "epoch": 0.38915113209056723, "grad_norm": 0.8531347513198853, "learning_rate": 3.9788992102432046e-05, "loss": 0.7826, "step": 304 }, { "epoch": 0.3904312344987599, "grad_norm": 0.7572221159934998, "learning_rate": 3.978670929862462e-05, "loss": 0.7612, "step": 305 }, { "epoch": 0.39171133690695253, "grad_norm": 0.8583319783210754, "learning_rate": 3.978441428641944e-05, "loss": 0.7906, "step": 306 }, { "epoch": 0.3929914393151452, "grad_norm": 0.8188625574111938, "learning_rate": 3.978210706739175e-05, "loss": 0.8348, "step": 307 }, { "epoch": 0.3942715417233379, "grad_norm": 1.0000718832015991, "learning_rate": 3.9779787643125174e-05, "loss": 0.8365, "step": 308 }, { "epoch": 0.39555164413153054, "grad_norm": 0.9057092070579529, "learning_rate": 3.977745601521171e-05, "loss": 0.8261, "step": 309 }, { "epoch": 0.3968317465397232, "grad_norm": 0.9990969300270081, "learning_rate": 3.9775112185251734e-05, "loss": 0.7879, "step": 310 }, { "epoch": 0.39811184894791585, "grad_norm": 0.8068785667419434, "learning_rate": 3.977275615485401e-05, "loss": 0.8057, "step": 311 }, { "epoch": 0.3993919513561085, "grad_norm": 0.9002063870429993, "learning_rate": 3.9770387925635645e-05, "loss": 0.8241, "step": 312 }, { "epoch": 0.40067205376430115, "grad_norm": 0.8019387125968933, "learning_rate": 3.976800749922215e-05, "loss": 0.7514, "step": 313 }, { "epoch": 0.4019521561724938, "grad_norm": 0.9053210616111755, "learning_rate": 3.97656148772474e-05, "loss": 0.8185, "step": 314 }, { "epoch": 0.40323225858068645, "grad_norm": 0.775916337966919, "learning_rate": 3.976321006135363e-05, "loss": 0.794, "step": 315 }, { "epoch": 0.4045123609888791, "grad_norm": 0.8259150385856628, "learning_rate": 3.9760793053191455e-05, "loss": 0.7842, "step": 316 }, { "epoch": 0.40579246339707176, "grad_norm": 0.7507197260856628, "learning_rate": 3.975836385441986e-05, "loss": 0.8159, "step": 317 }, { "epoch": 0.4070725658052644, "grad_norm": 0.8853293061256409, "learning_rate": 3.975592246670618e-05, "loss": 0.7754, "step": 318 }, { "epoch": 0.40835266821345706, "grad_norm": 0.8459185361862183, "learning_rate": 3.975346889172613e-05, "loss": 0.8205, "step": 319 }, { "epoch": 0.4096327706216497, "grad_norm": 0.8047323226928711, "learning_rate": 3.9751003131163805e-05, "loss": 0.7521, "step": 320 }, { "epoch": 0.41091287302984236, "grad_norm": 0.8247420191764832, "learning_rate": 3.974852518671163e-05, "loss": 0.7756, "step": 321 }, { "epoch": 0.41219297543803507, "grad_norm": 0.8434611558914185, "learning_rate": 3.974603506007042e-05, "loss": 0.7922, "step": 322 }, { "epoch": 0.4134730778462277, "grad_norm": 0.8224117755889893, "learning_rate": 3.9743532752949336e-05, "loss": 0.8011, "step": 323 }, { "epoch": 0.4147531802544204, "grad_norm": 0.7743213772773743, "learning_rate": 3.9741018267065904e-05, "loss": 0.7856, "step": 324 }, { "epoch": 0.416033282662613, "grad_norm": 0.7555202841758728, "learning_rate": 3.973849160414603e-05, "loss": 0.8128, "step": 325 }, { "epoch": 0.4173133850708057, "grad_norm": 0.7445181608200073, "learning_rate": 3.9735952765923934e-05, "loss": 0.7887, "step": 326 }, { "epoch": 0.4185934874789983, "grad_norm": 0.7434578537940979, "learning_rate": 3.973340175414222e-05, "loss": 0.7589, "step": 327 }, { "epoch": 0.419873589887191, "grad_norm": 0.7456271052360535, "learning_rate": 3.973083857055186e-05, "loss": 0.7783, "step": 328 }, { "epoch": 0.42115369229538363, "grad_norm": 0.8270319700241089, "learning_rate": 3.9728263216912164e-05, "loss": 0.8276, "step": 329 }, { "epoch": 0.4224337947035763, "grad_norm": 0.7310093641281128, "learning_rate": 3.972567569499078e-05, "loss": 0.8132, "step": 330 }, { "epoch": 0.4224337947035763, "eval_loss": 0.012658854946494102, "eval_runtime": 10.8224, "eval_samples_per_second": 45.831, "eval_steps_per_second": 5.729, "step": 330 }, { "epoch": 0.42371389711176893, "grad_norm": 0.8494604825973511, "learning_rate": 3.972307600656374e-05, "loss": 0.7795, "step": 331 }, { "epoch": 0.4249939995199616, "grad_norm": 0.7604356408119202, "learning_rate": 3.9720464153415416e-05, "loss": 0.8092, "step": 332 }, { "epoch": 0.42627410192815424, "grad_norm": 0.8328589200973511, "learning_rate": 3.97178401373385e-05, "loss": 0.8181, "step": 333 }, { "epoch": 0.4275542043363469, "grad_norm": 0.8251141309738159, "learning_rate": 3.971520396013409e-05, "loss": 0.8205, "step": 334 }, { "epoch": 0.42883430674453954, "grad_norm": 0.7609400153160095, "learning_rate": 3.9712555623611575e-05, "loss": 0.7965, "step": 335 }, { "epoch": 0.4301144091527322, "grad_norm": 0.8191712498664856, "learning_rate": 3.9709895129588726e-05, "loss": 0.8136, "step": 336 }, { "epoch": 0.4313945115609249, "grad_norm": 0.7615634202957153, "learning_rate": 3.970722247989164e-05, "loss": 0.7411, "step": 337 }, { "epoch": 0.43267461396911755, "grad_norm": 0.7785950303077698, "learning_rate": 3.9704537676354765e-05, "loss": 0.7888, "step": 338 }, { "epoch": 0.4339547163773102, "grad_norm": 0.6841676831245422, "learning_rate": 3.9701840720820894e-05, "loss": 0.7852, "step": 339 }, { "epoch": 0.43523481878550285, "grad_norm": 0.8268980979919434, "learning_rate": 3.9699131615141156e-05, "loss": 0.8169, "step": 340 }, { "epoch": 0.4365149211936955, "grad_norm": 0.7552794814109802, "learning_rate": 3.9696410361175014e-05, "loss": 0.7858, "step": 341 }, { "epoch": 0.43779502360188816, "grad_norm": 0.8271946907043457, "learning_rate": 3.9693676960790275e-05, "loss": 0.7858, "step": 342 }, { "epoch": 0.4390751260100808, "grad_norm": 0.7914268374443054, "learning_rate": 3.96909314158631e-05, "loss": 0.8279, "step": 343 }, { "epoch": 0.44035522841827346, "grad_norm": 0.9711649417877197, "learning_rate": 3.968817372827794e-05, "loss": 0.8156, "step": 344 }, { "epoch": 0.4416353308264661, "grad_norm": 0.80335533618927, "learning_rate": 3.968540389992765e-05, "loss": 0.7973, "step": 345 }, { "epoch": 0.44291543323465876, "grad_norm": 0.8563199043273926, "learning_rate": 3.968262193271334e-05, "loss": 0.8212, "step": 346 }, { "epoch": 0.4441955356428514, "grad_norm": 0.8743078112602234, "learning_rate": 3.967982782854451e-05, "loss": 0.7941, "step": 347 }, { "epoch": 0.44547563805104406, "grad_norm": 0.8524693846702576, "learning_rate": 3.967702158933896e-05, "loss": 0.7768, "step": 348 }, { "epoch": 0.4467557404592367, "grad_norm": 0.757647693157196, "learning_rate": 3.967420321702285e-05, "loss": 0.8124, "step": 349 }, { "epoch": 0.44803584286742937, "grad_norm": 0.8333066701889038, "learning_rate": 3.967137271353061e-05, "loss": 0.8022, "step": 350 }, { "epoch": 0.4493159452756221, "grad_norm": 0.7583582997322083, "learning_rate": 3.9668530080805076e-05, "loss": 0.777, "step": 351 }, { "epoch": 0.4505960476838147, "grad_norm": 0.8073552250862122, "learning_rate": 3.966567532079734e-05, "loss": 0.7815, "step": 352 }, { "epoch": 0.4518761500920074, "grad_norm": 0.678827702999115, "learning_rate": 3.966280843546685e-05, "loss": 0.8078, "step": 353 }, { "epoch": 0.45315625250020003, "grad_norm": 0.8286870718002319, "learning_rate": 3.965992942678139e-05, "loss": 0.7792, "step": 354 }, { "epoch": 0.4544363549083927, "grad_norm": 0.778968095779419, "learning_rate": 3.965703829671701e-05, "loss": 0.7639, "step": 355 }, { "epoch": 0.45571645731658533, "grad_norm": 0.7844759225845337, "learning_rate": 3.965413504725815e-05, "loss": 0.7913, "step": 356 }, { "epoch": 0.456996559724778, "grad_norm": 0.9054631590843201, "learning_rate": 3.965121968039753e-05, "loss": 0.8442, "step": 357 }, { "epoch": 0.45827666213297064, "grad_norm": 0.7725024223327637, "learning_rate": 3.9648292198136174e-05, "loss": 0.7878, "step": 358 }, { "epoch": 0.4595567645411633, "grad_norm": 0.8029242753982544, "learning_rate": 3.9645352602483456e-05, "loss": 0.7865, "step": 359 }, { "epoch": 0.46083686694935594, "grad_norm": 0.7134058475494385, "learning_rate": 3.964240089545704e-05, "loss": 0.8009, "step": 360 }, { "epoch": 0.46083686694935594, "eval_loss": 0.01259357575327158, "eval_runtime": 10.8203, "eval_samples_per_second": 45.84, "eval_steps_per_second": 5.73, "step": 360 }, { "epoch": 0.4621169693575486, "grad_norm": 0.6435779333114624, "learning_rate": 3.9639437079082926e-05, "loss": 0.7858, "step": 361 }, { "epoch": 0.46339707176574124, "grad_norm": 0.8096379637718201, "learning_rate": 3.963646115539539e-05, "loss": 0.7728, "step": 362 }, { "epoch": 0.4646771741739339, "grad_norm": 0.7162945866584778, "learning_rate": 3.9633473126437054e-05, "loss": 0.792, "step": 363 }, { "epoch": 0.46595727658212654, "grad_norm": 0.8785635232925415, "learning_rate": 3.963047299425884e-05, "loss": 0.807, "step": 364 }, { "epoch": 0.46723737899031925, "grad_norm": 0.6872981786727905, "learning_rate": 3.962746076091994e-05, "loss": 0.8063, "step": 365 }, { "epoch": 0.4685174813985119, "grad_norm": 0.7540907859802246, "learning_rate": 3.9624436428487925e-05, "loss": 0.7666, "step": 366 }, { "epoch": 0.46979758380670456, "grad_norm": 0.7178943157196045, "learning_rate": 3.96213999990386e-05, "loss": 0.7518, "step": 367 }, { "epoch": 0.4710776862148972, "grad_norm": 0.7184255123138428, "learning_rate": 3.961835147465611e-05, "loss": 0.772, "step": 368 }, { "epoch": 0.47235778862308986, "grad_norm": 0.8011344075202942, "learning_rate": 3.961529085743289e-05, "loss": 0.7815, "step": 369 }, { "epoch": 0.4736378910312825, "grad_norm": 0.7954471111297607, "learning_rate": 3.961221814946969e-05, "loss": 0.8032, "step": 370 }, { "epoch": 0.47491799343947516, "grad_norm": 0.7110918164253235, "learning_rate": 3.960913335287554e-05, "loss": 0.7966, "step": 371 }, { "epoch": 0.4761980958476678, "grad_norm": 0.8362737894058228, "learning_rate": 3.960603646976777e-05, "loss": 0.801, "step": 372 }, { "epoch": 0.47747819825586046, "grad_norm": 0.7137751579284668, "learning_rate": 3.9602927502272025e-05, "loss": 0.8186, "step": 373 }, { "epoch": 0.4787583006640531, "grad_norm": 0.7931938171386719, "learning_rate": 3.959980645252222e-05, "loss": 0.801, "step": 374 }, { "epoch": 0.48003840307224577, "grad_norm": 0.8369014263153076, "learning_rate": 3.959667332266057e-05, "loss": 0.8138, "step": 375 }, { "epoch": 0.4813185054804384, "grad_norm": 0.7229605317115784, "learning_rate": 3.95935281148376e-05, "loss": 0.7823, "step": 376 }, { "epoch": 0.48259860788863107, "grad_norm": 0.9785498976707458, "learning_rate": 3.959037083121209e-05, "loss": 0.7791, "step": 377 }, { "epoch": 0.4838787102968237, "grad_norm": 0.8153207302093506, "learning_rate": 3.958720147395115e-05, "loss": 0.7933, "step": 378 }, { "epoch": 0.48515881270501643, "grad_norm": 0.8983792662620544, "learning_rate": 3.958402004523014e-05, "loss": 0.7732, "step": 379 }, { "epoch": 0.4864389151132091, "grad_norm": 0.7396347522735596, "learning_rate": 3.958082654723273e-05, "loss": 0.8084, "step": 380 }, { "epoch": 0.48771901752140173, "grad_norm": 0.9474884867668152, "learning_rate": 3.957762098215085e-05, "loss": 0.7876, "step": 381 }, { "epoch": 0.4889991199295944, "grad_norm": 0.7463030815124512, "learning_rate": 3.9574403352184746e-05, "loss": 0.8113, "step": 382 }, { "epoch": 0.49027922233778704, "grad_norm": 0.9061795473098755, "learning_rate": 3.957117365954292e-05, "loss": 0.7946, "step": 383 }, { "epoch": 0.4915593247459797, "grad_norm": 0.7946358919143677, "learning_rate": 3.956793190644216e-05, "loss": 0.8142, "step": 384 }, { "epoch": 0.49283942715417234, "grad_norm": 0.7612783312797546, "learning_rate": 3.956467809510753e-05, "loss": 0.7787, "step": 385 }, { "epoch": 0.494119529562365, "grad_norm": 0.8278447389602661, "learning_rate": 3.956141222777239e-05, "loss": 0.8473, "step": 386 }, { "epoch": 0.49539963197055764, "grad_norm": 0.7168108224868774, "learning_rate": 3.955813430667833e-05, "loss": 0.7594, "step": 387 }, { "epoch": 0.4966797343787503, "grad_norm": 0.8312520980834961, "learning_rate": 3.955484433407526e-05, "loss": 0.8063, "step": 388 }, { "epoch": 0.49795983678694294, "grad_norm": 0.7526703476905823, "learning_rate": 3.955154231222134e-05, "loss": 0.7907, "step": 389 }, { "epoch": 0.4992399391951356, "grad_norm": 0.8451778292655945, "learning_rate": 3.9548228243383e-05, "loss": 0.7927, "step": 390 }, { "epoch": 0.4992399391951356, "eval_loss": 0.01254909485578537, "eval_runtime": 10.8303, "eval_samples_per_second": 45.797, "eval_steps_per_second": 5.725, "step": 390 }, { "epoch": 0.5005200416033283, "grad_norm": 0.7430022954940796, "learning_rate": 3.9544902129834945e-05, "loss": 0.7952, "step": 391 }, { "epoch": 0.501800144011521, "grad_norm": 0.7509642243385315, "learning_rate": 3.9541563973860146e-05, "loss": 0.7917, "step": 392 }, { "epoch": 0.5030802464197136, "grad_norm": 0.8211520910263062, "learning_rate": 3.953821377774984e-05, "loss": 0.8173, "step": 393 }, { "epoch": 0.5043603488279063, "grad_norm": 0.7656919360160828, "learning_rate": 3.953485154380352e-05, "loss": 0.782, "step": 394 }, { "epoch": 0.5056404512360989, "grad_norm": 0.9075120687484741, "learning_rate": 3.953147727432896e-05, "loss": 0.7809, "step": 395 }, { "epoch": 0.5069205536442916, "grad_norm": 0.8644618988037109, "learning_rate": 3.952809097164216e-05, "loss": 0.7783, "step": 396 }, { "epoch": 0.5082006560524842, "grad_norm": 0.8745702505111694, "learning_rate": 3.952469263806742e-05, "loss": 0.772, "step": 397 }, { "epoch": 0.5094807584606769, "grad_norm": 0.7140446305274963, "learning_rate": 3.952128227593728e-05, "loss": 0.7552, "step": 398 }, { "epoch": 0.5107608608688695, "grad_norm": 0.7114863991737366, "learning_rate": 3.951785988759253e-05, "loss": 0.8154, "step": 399 }, { "epoch": 0.5120409632770622, "grad_norm": 0.8365476131439209, "learning_rate": 3.9514425475382216e-05, "loss": 0.8243, "step": 400 }, { "epoch": 0.5133210656852548, "grad_norm": 0.7395104765892029, "learning_rate": 3.951097904166366e-05, "loss": 0.8199, "step": 401 }, { "epoch": 0.5146011680934475, "grad_norm": 0.8931131958961487, "learning_rate": 3.9507520588802386e-05, "loss": 0.7991, "step": 402 }, { "epoch": 0.5158812705016401, "grad_norm": 0.7250818014144897, "learning_rate": 3.950405011917223e-05, "loss": 0.8229, "step": 403 }, { "epoch": 0.5171613729098328, "grad_norm": 0.8582420349121094, "learning_rate": 3.9500567635155234e-05, "loss": 0.7623, "step": 404 }, { "epoch": 0.5184414753180254, "grad_norm": 0.7450950145721436, "learning_rate": 3.949707313914169e-05, "loss": 0.7681, "step": 405 }, { "epoch": 0.5197215777262181, "grad_norm": 0.8141098022460938, "learning_rate": 3.9493566633530146e-05, "loss": 0.8331, "step": 406 }, { "epoch": 0.5210016801344107, "grad_norm": 0.7822496294975281, "learning_rate": 3.949004812072738e-05, "loss": 0.7366, "step": 407 }, { "epoch": 0.5222817825426034, "grad_norm": 0.6154834628105164, "learning_rate": 3.948651760314844e-05, "loss": 0.7496, "step": 408 }, { "epoch": 0.523561884950796, "grad_norm": 0.7177313566207886, "learning_rate": 3.9482975083216575e-05, "loss": 0.8059, "step": 409 }, { "epoch": 0.5248419873589887, "grad_norm": 0.6349936723709106, "learning_rate": 3.94794205633633e-05, "loss": 0.7811, "step": 410 }, { "epoch": 0.5261220897671813, "grad_norm": 0.727734386920929, "learning_rate": 3.947585404602836e-05, "loss": 0.7975, "step": 411 }, { "epoch": 0.527402192175374, "grad_norm": 0.6441000699996948, "learning_rate": 3.947227553365973e-05, "loss": 0.7693, "step": 412 }, { "epoch": 0.5286822945835666, "grad_norm": 0.7431919574737549, "learning_rate": 3.9468685028713607e-05, "loss": 0.8235, "step": 413 }, { "epoch": 0.5299623969917593, "grad_norm": 0.651664137840271, "learning_rate": 3.9465082533654453e-05, "loss": 0.7452, "step": 414 }, { "epoch": 0.531242499399952, "grad_norm": 0.7347097396850586, "learning_rate": 3.9461468050954935e-05, "loss": 0.8066, "step": 415 }, { "epoch": 0.5325226018081447, "grad_norm": 0.8070315718650818, "learning_rate": 3.945784158309594e-05, "loss": 0.8177, "step": 416 }, { "epoch": 0.5338027042163374, "grad_norm": 0.7046098709106445, "learning_rate": 3.945420313256661e-05, "loss": 0.8039, "step": 417 }, { "epoch": 0.53508280662453, "grad_norm": 0.7942793965339661, "learning_rate": 3.9450552701864294e-05, "loss": 0.7839, "step": 418 }, { "epoch": 0.5363629090327227, "grad_norm": 0.720222532749176, "learning_rate": 3.9446890293494554e-05, "loss": 0.7682, "step": 419 }, { "epoch": 0.5376430114409153, "grad_norm": 0.6810816526412964, "learning_rate": 3.944321590997119e-05, "loss": 0.77, "step": 420 }, { "epoch": 0.5376430114409153, "eval_loss": 0.012503801845014095, "eval_runtime": 10.8277, "eval_samples_per_second": 45.808, "eval_steps_per_second": 5.726, "step": 420 }, { "epoch": 0.538923113849108, "grad_norm": 0.8036742210388184, "learning_rate": 3.943952955381622e-05, "loss": 0.8102, "step": 421 }, { "epoch": 0.5402032162573006, "grad_norm": 0.6643345952033997, "learning_rate": 3.943583122755987e-05, "loss": 0.7684, "step": 422 }, { "epoch": 0.5414833186654933, "grad_norm": 0.8585495352745056, "learning_rate": 3.94321209337406e-05, "loss": 0.7443, "step": 423 }, { "epoch": 0.5427634210736859, "grad_norm": 0.6907642483711243, "learning_rate": 3.942839867490506e-05, "loss": 0.7432, "step": 424 }, { "epoch": 0.5440435234818786, "grad_norm": 0.7666288614273071, "learning_rate": 3.942466445360813e-05, "loss": 0.7892, "step": 425 }, { "epoch": 0.5453236258900712, "grad_norm": 0.7625541687011719, "learning_rate": 3.9420918272412894e-05, "loss": 0.7922, "step": 426 }, { "epoch": 0.5466037282982639, "grad_norm": 0.8049483895301819, "learning_rate": 3.941716013389065e-05, "loss": 0.7801, "step": 427 }, { "epoch": 0.5478838307064565, "grad_norm": 0.7327088713645935, "learning_rate": 3.941339004062089e-05, "loss": 0.7857, "step": 428 }, { "epoch": 0.5491639331146492, "grad_norm": 0.7284425497055054, "learning_rate": 3.940960799519134e-05, "loss": 0.7463, "step": 429 }, { "epoch": 0.5504440355228418, "grad_norm": 0.7273387312889099, "learning_rate": 3.9405814000197894e-05, "loss": 0.8092, "step": 430 }, { "epoch": 0.5517241379310345, "grad_norm": 0.7149500250816345, "learning_rate": 3.940200805824468e-05, "loss": 0.7614, "step": 431 }, { "epoch": 0.5530042403392271, "grad_norm": 0.7388850450515747, "learning_rate": 3.9398190171943986e-05, "loss": 0.8254, "step": 432 }, { "epoch": 0.5542843427474198, "grad_norm": 0.7056301832199097, "learning_rate": 3.939436034391634e-05, "loss": 0.7872, "step": 433 }, { "epoch": 0.5555644451556124, "grad_norm": 0.7976992130279541, "learning_rate": 3.939051857679046e-05, "loss": 0.7727, "step": 434 }, { "epoch": 0.5568445475638051, "grad_norm": 0.8013225793838501, "learning_rate": 3.938666487320323e-05, "loss": 0.7981, "step": 435 }, { "epoch": 0.5581246499719977, "grad_norm": 0.7863363027572632, "learning_rate": 3.938279923579976e-05, "loss": 0.7918, "step": 436 }, { "epoch": 0.5594047523801904, "grad_norm": 0.7414101958274841, "learning_rate": 3.937892166723332e-05, "loss": 0.8134, "step": 437 }, { "epoch": 0.560684854788383, "grad_norm": 0.7970485687255859, "learning_rate": 3.9375032170165405e-05, "loss": 0.78, "step": 438 }, { "epoch": 0.5619649571965757, "grad_norm": 0.8212478160858154, "learning_rate": 3.937113074726567e-05, "loss": 0.7787, "step": 439 }, { "epoch": 0.5632450596047683, "grad_norm": 0.6914942264556885, "learning_rate": 3.936721740121196e-05, "loss": 0.7886, "step": 440 }, { "epoch": 0.564525162012961, "grad_norm": 0.8115800023078918, "learning_rate": 3.9363292134690315e-05, "loss": 0.7783, "step": 441 }, { "epoch": 0.5658052644211536, "grad_norm": 0.787767231464386, "learning_rate": 3.935935495039494e-05, "loss": 0.796, "step": 442 }, { "epoch": 0.5670853668293463, "grad_norm": 0.7171950340270996, "learning_rate": 3.935540585102824e-05, "loss": 0.8083, "step": 443 }, { "epoch": 0.5683654692375391, "grad_norm": 0.8266027569770813, "learning_rate": 3.935144483930078e-05, "loss": 0.8096, "step": 444 }, { "epoch": 0.5696455716457317, "grad_norm": 0.7655935287475586, "learning_rate": 3.9347471917931316e-05, "loss": 0.8342, "step": 445 }, { "epoch": 0.5709256740539244, "grad_norm": 0.8506702184677124, "learning_rate": 3.9343487089646774e-05, "loss": 0.8265, "step": 446 }, { "epoch": 0.572205776462117, "grad_norm": 0.7414137125015259, "learning_rate": 3.933949035718224e-05, "loss": 0.811, "step": 447 }, { "epoch": 0.5734858788703097, "grad_norm": 0.756046712398529, "learning_rate": 3.933548172328099e-05, "loss": 0.8081, "step": 448 }, { "epoch": 0.5747659812785023, "grad_norm": 0.7636081576347351, "learning_rate": 3.933146119069446e-05, "loss": 0.7879, "step": 449 }, { "epoch": 0.576046083686695, "grad_norm": 0.8503948450088501, "learning_rate": 3.9327428762182244e-05, "loss": 0.8393, "step": 450 }, { "epoch": 0.576046083686695, "eval_loss": 0.012458461336791515, "eval_runtime": 10.8963, "eval_samples_per_second": 45.52, "eval_steps_per_second": 5.69, "step": 450 }, { "epoch": 0.5773261860948876, "grad_norm": 0.7647830843925476, "learning_rate": 3.932338444051213e-05, "loss": 0.7619, "step": 451 }, { "epoch": 0.5786062885030803, "grad_norm": 0.7900508046150208, "learning_rate": 3.9319328228460024e-05, "loss": 0.7497, "step": 452 }, { "epoch": 0.5798863909112729, "grad_norm": 0.7502211332321167, "learning_rate": 3.931526012881004e-05, "loss": 0.7866, "step": 453 }, { "epoch": 0.5811664933194656, "grad_norm": 0.7293073534965515, "learning_rate": 3.931118014435442e-05, "loss": 0.754, "step": 454 }, { "epoch": 0.5824465957276582, "grad_norm": 0.7336457371711731, "learning_rate": 3.930708827789357e-05, "loss": 0.7793, "step": 455 }, { "epoch": 0.5837266981358509, "grad_norm": 0.7212786078453064, "learning_rate": 3.930298453223607e-05, "loss": 0.7615, "step": 456 }, { "epoch": 0.5850068005440435, "grad_norm": 0.6969265937805176, "learning_rate": 3.929886891019862e-05, "loss": 0.7404, "step": 457 }, { "epoch": 0.5862869029522362, "grad_norm": 0.8226010799407959, "learning_rate": 3.929474141460611e-05, "loss": 0.8168, "step": 458 }, { "epoch": 0.5875670053604288, "grad_norm": 0.6723736524581909, "learning_rate": 3.929060204829155e-05, "loss": 0.7588, "step": 459 }, { "epoch": 0.5888471077686215, "grad_norm": 0.7979745268821716, "learning_rate": 3.9286450814096106e-05, "loss": 0.8326, "step": 460 }, { "epoch": 0.5901272101768141, "grad_norm": 0.7417559027671814, "learning_rate": 3.928228771486909e-05, "loss": 0.7576, "step": 461 }, { "epoch": 0.5914073125850068, "grad_norm": 0.8069484829902649, "learning_rate": 3.927811275346797e-05, "loss": 0.8097, "step": 462 }, { "epoch": 0.5926874149931994, "grad_norm": 0.7181478142738342, "learning_rate": 3.927392593275834e-05, "loss": 0.7734, "step": 463 }, { "epoch": 0.5939675174013921, "grad_norm": 0.8048413991928101, "learning_rate": 3.926972725561394e-05, "loss": 0.7619, "step": 464 }, { "epoch": 0.5952476198095847, "grad_norm": 0.7611750960350037, "learning_rate": 3.926551672491665e-05, "loss": 0.8193, "step": 465 }, { "epoch": 0.5965277222177774, "grad_norm": 0.7776764631271362, "learning_rate": 3.926129434355647e-05, "loss": 0.8004, "step": 466 }, { "epoch": 0.59780782462597, "grad_norm": 0.7161852717399597, "learning_rate": 3.925706011443157e-05, "loss": 0.7896, "step": 467 }, { "epoch": 0.5990879270341627, "grad_norm": 0.7222532033920288, "learning_rate": 3.925281404044821e-05, "loss": 0.7605, "step": 468 }, { "epoch": 0.6003680294423553, "grad_norm": 0.6803270578384399, "learning_rate": 3.924855612452082e-05, "loss": 0.7784, "step": 469 }, { "epoch": 0.601648131850548, "grad_norm": 0.6683339476585388, "learning_rate": 3.924428636957192e-05, "loss": 0.8033, "step": 470 }, { "epoch": 0.6029282342587406, "grad_norm": 0.6430296301841736, "learning_rate": 3.924000477853218e-05, "loss": 0.7567, "step": 471 }, { "epoch": 0.6042083366669334, "grad_norm": 0.6537981033325195, "learning_rate": 3.923571135434039e-05, "loss": 0.7519, "step": 472 }, { "epoch": 0.6054884390751261, "grad_norm": 0.7790893912315369, "learning_rate": 3.923140609994346e-05, "loss": 0.7947, "step": 473 }, { "epoch": 0.6067685414833187, "grad_norm": 0.6284059286117554, "learning_rate": 3.922708901829641e-05, "loss": 0.7399, "step": 474 }, { "epoch": 0.6080486438915114, "grad_norm": 0.6981340050697327, "learning_rate": 3.92227601123624e-05, "loss": 0.7789, "step": 475 }, { "epoch": 0.609328746299704, "grad_norm": 0.8239121437072754, "learning_rate": 3.9218419385112693e-05, "loss": 0.7848, "step": 476 }, { "epoch": 0.6106088487078967, "grad_norm": 0.6836838126182556, "learning_rate": 3.921406683952666e-05, "loss": 0.785, "step": 477 }, { "epoch": 0.6118889511160893, "grad_norm": 0.8668432235717773, "learning_rate": 3.920970247859179e-05, "loss": 0.8173, "step": 478 }, { "epoch": 0.613169053524282, "grad_norm": 0.685899555683136, "learning_rate": 3.9205326305303695e-05, "loss": 0.7923, "step": 479 }, { "epoch": 0.6144491559324746, "grad_norm": 0.7608736753463745, "learning_rate": 3.920093832266607e-05, "loss": 0.8111, "step": 480 }, { "epoch": 0.6144491559324746, "eval_loss": 0.012420989573001862, "eval_runtime": 10.8235, "eval_samples_per_second": 45.826, "eval_steps_per_second": 5.728, "step": 480 }, { "epoch": 0.6157292583406673, "grad_norm": 0.722259521484375, "learning_rate": 3.9196538533690734e-05, "loss": 0.7814, "step": 481 }, { "epoch": 0.6170093607488599, "grad_norm": 0.7831443548202515, "learning_rate": 3.91921269413976e-05, "loss": 0.7865, "step": 482 }, { "epoch": 0.6182894631570526, "grad_norm": 0.7355871796607971, "learning_rate": 3.918770354881468e-05, "loss": 0.8156, "step": 483 }, { "epoch": 0.6195695655652452, "grad_norm": 0.6596747040748596, "learning_rate": 3.9183268358978107e-05, "loss": 0.7984, "step": 484 }, { "epoch": 0.6208496679734379, "grad_norm": 0.8083442449569702, "learning_rate": 3.9178821374932076e-05, "loss": 0.7642, "step": 485 }, { "epoch": 0.6221297703816305, "grad_norm": 0.7155700325965881, "learning_rate": 3.917436259972891e-05, "loss": 0.7798, "step": 486 }, { "epoch": 0.6234098727898232, "grad_norm": 0.7327741384506226, "learning_rate": 3.9169892036429014e-05, "loss": 0.7979, "step": 487 }, { "epoch": 0.6246899751980158, "grad_norm": 0.7384740710258484, "learning_rate": 3.916540968810087e-05, "loss": 0.7683, "step": 488 }, { "epoch": 0.6259700776062085, "grad_norm": 0.7598046660423279, "learning_rate": 3.916091555782108e-05, "loss": 0.7885, "step": 489 }, { "epoch": 0.6272501800144011, "grad_norm": 0.7548463344573975, "learning_rate": 3.915640964867429e-05, "loss": 0.783, "step": 490 }, { "epoch": 0.6285302824225938, "grad_norm": 0.7831941843032837, "learning_rate": 3.915189196375327e-05, "loss": 0.8326, "step": 491 }, { "epoch": 0.6298103848307864, "grad_norm": 0.6835455298423767, "learning_rate": 3.914736250615886e-05, "loss": 0.7877, "step": 492 }, { "epoch": 0.6310904872389791, "grad_norm": 0.7209146618843079, "learning_rate": 3.914282127899998e-05, "loss": 0.7708, "step": 493 }, { "epoch": 0.6323705896471717, "grad_norm": 0.641525149345398, "learning_rate": 3.9138268285393606e-05, "loss": 0.7663, "step": 494 }, { "epoch": 0.6336506920553644, "grad_norm": 0.8103832602500916, "learning_rate": 3.913370352846483e-05, "loss": 0.775, "step": 495 }, { "epoch": 0.634930794463557, "grad_norm": 0.7506917119026184, "learning_rate": 3.91291270113468e-05, "loss": 0.8159, "step": 496 }, { "epoch": 0.6362108968717497, "grad_norm": 0.7250286936759949, "learning_rate": 3.9124538737180714e-05, "loss": 0.8283, "step": 497 }, { "epoch": 0.6374909992799423, "grad_norm": 0.6864186525344849, "learning_rate": 3.911993870911588e-05, "loss": 0.7507, "step": 498 }, { "epoch": 0.638771101688135, "grad_norm": 0.7688778042793274, "learning_rate": 3.911532693030965e-05, "loss": 0.8236, "step": 499 }, { "epoch": 0.6400512040963277, "grad_norm": 0.6764448285102844, "learning_rate": 3.9110703403927434e-05, "loss": 0.7597, "step": 500 }, { "epoch": 0.6413313065045204, "grad_norm": 0.7230846285820007, "learning_rate": 3.910606813314273e-05, "loss": 0.7737, "step": 501 }, { "epoch": 0.6426114089127131, "grad_norm": 0.7076696157455444, "learning_rate": 3.9101421121137084e-05, "loss": 0.7603, "step": 502 }, { "epoch": 0.6438915113209057, "grad_norm": 0.7059433460235596, "learning_rate": 3.9096762371100094e-05, "loss": 0.8008, "step": 503 }, { "epoch": 0.6451716137290984, "grad_norm": 0.7637941837310791, "learning_rate": 3.909209188622942e-05, "loss": 0.7825, "step": 504 }, { "epoch": 0.646451716137291, "grad_norm": 0.7858322262763977, "learning_rate": 3.9087409669730777e-05, "loss": 0.7736, "step": 505 }, { "epoch": 0.6477318185454837, "grad_norm": 0.7069405317306519, "learning_rate": 3.908271572481795e-05, "loss": 0.809, "step": 506 }, { "epoch": 0.6490119209536763, "grad_norm": 0.7629151344299316, "learning_rate": 3.907801005471273e-05, "loss": 0.8079, "step": 507 }, { "epoch": 0.650292023361869, "grad_norm": 0.7711296081542969, "learning_rate": 3.907329266264501e-05, "loss": 0.7799, "step": 508 }, { "epoch": 0.6515721257700616, "grad_norm": 0.6990572810173035, "learning_rate": 3.906856355185269e-05, "loss": 0.8338, "step": 509 }, { "epoch": 0.6528522281782543, "grad_norm": 0.7535392642021179, "learning_rate": 3.906382272558172e-05, "loss": 0.7969, "step": 510 }, { "epoch": 0.6528522281782543, "eval_loss": 0.012368489056825638, "eval_runtime": 10.82, "eval_samples_per_second": 45.841, "eval_steps_per_second": 5.73, "step": 510 }, { "epoch": 0.6541323305864469, "grad_norm": 0.6653261184692383, "learning_rate": 3.90590701870861e-05, "loss": 0.8127, "step": 511 }, { "epoch": 0.6554124329946396, "grad_norm": 0.7311388850212097, "learning_rate": 3.9054305939627875e-05, "loss": 0.7701, "step": 512 }, { "epoch": 0.6566925354028322, "grad_norm": 0.7191159725189209, "learning_rate": 3.904952998647711e-05, "loss": 0.8356, "step": 513 }, { "epoch": 0.6579726378110249, "grad_norm": 0.7642592787742615, "learning_rate": 3.9044742330911904e-05, "loss": 0.7971, "step": 514 }, { "epoch": 0.6592527402192175, "grad_norm": 0.7250025272369385, "learning_rate": 3.9039942976218415e-05, "loss": 0.7625, "step": 515 }, { "epoch": 0.6605328426274102, "grad_norm": 0.8104845881462097, "learning_rate": 3.903513192569079e-05, "loss": 0.8328, "step": 516 }, { "epoch": 0.6618129450356028, "grad_norm": 0.7267283201217651, "learning_rate": 3.903030918263124e-05, "loss": 0.751, "step": 517 }, { "epoch": 0.6630930474437955, "grad_norm": 0.8060623407363892, "learning_rate": 3.9025474750349994e-05, "loss": 0.8218, "step": 518 }, { "epoch": 0.6643731498519881, "grad_norm": 0.7860483527183533, "learning_rate": 3.902062863216528e-05, "loss": 0.7816, "step": 519 }, { "epoch": 0.6656532522601808, "grad_norm": 0.7551194429397583, "learning_rate": 3.9015770831403385e-05, "loss": 0.7528, "step": 520 }, { "epoch": 0.6669333546683734, "grad_norm": 0.7541205883026123, "learning_rate": 3.9010901351398576e-05, "loss": 0.7909, "step": 521 }, { "epoch": 0.6682134570765661, "grad_norm": 0.7642291188240051, "learning_rate": 3.900602019549316e-05, "loss": 0.8077, "step": 522 }, { "epoch": 0.6694935594847587, "grad_norm": 0.8029669523239136, "learning_rate": 3.900112736703746e-05, "loss": 0.8171, "step": 523 }, { "epoch": 0.6707736618929514, "grad_norm": 0.7413590550422668, "learning_rate": 3.8996222869389784e-05, "loss": 0.8278, "step": 524 }, { "epoch": 0.672053764301144, "grad_norm": 0.7315031886100769, "learning_rate": 3.89913067059165e-05, "loss": 0.757, "step": 525 }, { "epoch": 0.6733338667093367, "grad_norm": 0.8058844208717346, "learning_rate": 3.8986378879991924e-05, "loss": 0.8072, "step": 526 }, { "epoch": 0.6746139691175294, "grad_norm": 0.6936185359954834, "learning_rate": 3.8981439394998425e-05, "loss": 0.7543, "step": 527 }, { "epoch": 0.675894071525722, "grad_norm": 0.7407493591308594, "learning_rate": 3.897648825432634e-05, "loss": 0.7685, "step": 528 }, { "epoch": 0.6771741739339147, "grad_norm": 0.6896268725395203, "learning_rate": 3.897152546137403e-05, "loss": 0.7794, "step": 529 }, { "epoch": 0.6784542763421074, "grad_norm": 0.716063916683197, "learning_rate": 3.896655101954783e-05, "loss": 0.7964, "step": 530 }, { "epoch": 0.6797343787503001, "grad_norm": 0.6614677309989929, "learning_rate": 3.896156493226211e-05, "loss": 0.8156, "step": 531 }, { "epoch": 0.6810144811584927, "grad_norm": 0.6699355840682983, "learning_rate": 3.8956567202939196e-05, "loss": 0.7828, "step": 532 }, { "epoch": 0.6822945835666854, "grad_norm": 0.6638008952140808, "learning_rate": 3.895155783500941e-05, "loss": 0.7758, "step": 533 }, { "epoch": 0.683574685974878, "grad_norm": 0.68021160364151, "learning_rate": 3.8946536831911074e-05, "loss": 0.815, "step": 534 }, { "epoch": 0.6848547883830707, "grad_norm": 0.6995747685432434, "learning_rate": 3.89415041970905e-05, "loss": 0.8041, "step": 535 }, { "epoch": 0.6861348907912633, "grad_norm": 0.6517994403839111, "learning_rate": 3.893645993400196e-05, "loss": 0.7734, "step": 536 }, { "epoch": 0.687414993199456, "grad_norm": 0.7438444495201111, "learning_rate": 3.893140404610773e-05, "loss": 0.7829, "step": 537 }, { "epoch": 0.6886950956076486, "grad_norm": 0.640255868434906, "learning_rate": 3.892633653687807e-05, "loss": 0.7597, "step": 538 }, { "epoch": 0.6899751980158413, "grad_norm": 0.7098150849342346, "learning_rate": 3.892125740979119e-05, "loss": 0.798, "step": 539 }, { "epoch": 0.6912553004240339, "grad_norm": 0.7514739036560059, "learning_rate": 3.891616666833329e-05, "loss": 0.823, "step": 540 }, { "epoch": 0.6912553004240339, "eval_loss": 0.012333170510828495, "eval_runtime": 10.8058, "eval_samples_per_second": 45.901, "eval_steps_per_second": 5.738, "step": 540 }, { "epoch": 0.6925354028322266, "grad_norm": 0.7085390090942383, "learning_rate": 3.891106431599854e-05, "loss": 0.7909, "step": 541 }, { "epoch": 0.6938155052404192, "grad_norm": 0.693387508392334, "learning_rate": 3.8905950356289095e-05, "loss": 0.7578, "step": 542 }, { "epoch": 0.6950956076486119, "grad_norm": 0.7129430174827576, "learning_rate": 3.890082479271504e-05, "loss": 0.8122, "step": 543 }, { "epoch": 0.6963757100568045, "grad_norm": 0.6622198224067688, "learning_rate": 3.889568762879446e-05, "loss": 0.7629, "step": 544 }, { "epoch": 0.6976558124649972, "grad_norm": 0.7511202692985535, "learning_rate": 3.889053886805339e-05, "loss": 0.79, "step": 545 }, { "epoch": 0.6989359148731898, "grad_norm": 0.7332901954650879, "learning_rate": 3.888537851402582e-05, "loss": 0.8003, "step": 546 }, { "epoch": 0.7002160172813825, "grad_norm": 0.7890613079071045, "learning_rate": 3.8880206570253694e-05, "loss": 0.7777, "step": 547 }, { "epoch": 0.7014961196895751, "grad_norm": 0.7728927135467529, "learning_rate": 3.8875023040286926e-05, "loss": 0.7968, "step": 548 }, { "epoch": 0.7027762220977678, "grad_norm": 0.7917543649673462, "learning_rate": 3.886982792768338e-05, "loss": 0.7955, "step": 549 }, { "epoch": 0.7040563245059605, "grad_norm": 0.7046210169792175, "learning_rate": 3.886462123600885e-05, "loss": 0.7961, "step": 550 }, { "epoch": 0.7053364269141531, "grad_norm": 0.8072237372398376, "learning_rate": 3.8859402968837106e-05, "loss": 0.7975, "step": 551 }, { "epoch": 0.7066165293223458, "grad_norm": 0.6598737835884094, "learning_rate": 3.8854173129749846e-05, "loss": 0.729, "step": 552 }, { "epoch": 0.7078966317305384, "grad_norm": 0.8321033120155334, "learning_rate": 3.8848931722336705e-05, "loss": 0.8004, "step": 553 }, { "epoch": 0.7091767341387311, "grad_norm": 0.6804755330085754, "learning_rate": 3.884367875019528e-05, "loss": 0.7632, "step": 554 }, { "epoch": 0.7104568365469237, "grad_norm": 0.8645675778388977, "learning_rate": 3.8838414216931076e-05, "loss": 0.813, "step": 555 }, { "epoch": 0.7117369389551164, "grad_norm": 0.6690579652786255, "learning_rate": 3.883313812615757e-05, "loss": 0.7636, "step": 556 }, { "epoch": 0.713017041363309, "grad_norm": 0.8966508507728577, "learning_rate": 3.882785048149615e-05, "loss": 0.7623, "step": 557 }, { "epoch": 0.7142971437715018, "grad_norm": 0.7796165943145752, "learning_rate": 3.882255128657612e-05, "loss": 0.7908, "step": 558 }, { "epoch": 0.7155772461796944, "grad_norm": 0.7847517132759094, "learning_rate": 3.881724054503474e-05, "loss": 0.7773, "step": 559 }, { "epoch": 0.7168573485878871, "grad_norm": 0.7085537314414978, "learning_rate": 3.881191826051719e-05, "loss": 0.7696, "step": 560 }, { "epoch": 0.7181374509960797, "grad_norm": 0.7186529636383057, "learning_rate": 3.880658443667655e-05, "loss": 0.7908, "step": 561 }, { "epoch": 0.7194175534042724, "grad_norm": 0.6572086215019226, "learning_rate": 3.8801239077173847e-05, "loss": 0.7448, "step": 562 }, { "epoch": 0.720697655812465, "grad_norm": 0.7846883535385132, "learning_rate": 3.879588218567802e-05, "loss": 0.8326, "step": 563 }, { "epoch": 0.7219777582206577, "grad_norm": 0.6568480730056763, "learning_rate": 3.879051376586591e-05, "loss": 0.752, "step": 564 }, { "epoch": 0.7232578606288503, "grad_norm": 0.7430264949798584, "learning_rate": 3.878513382142228e-05, "loss": 0.7381, "step": 565 }, { "epoch": 0.724537963037043, "grad_norm": 0.6743800044059753, "learning_rate": 3.8779742356039815e-05, "loss": 0.7667, "step": 566 }, { "epoch": 0.7258180654452356, "grad_norm": 0.7817213535308838, "learning_rate": 3.877433937341908e-05, "loss": 0.7419, "step": 567 }, { "epoch": 0.7270981678534283, "grad_norm": 0.7134994268417358, "learning_rate": 3.876892487726857e-05, "loss": 0.7696, "step": 568 }, { "epoch": 0.7283782702616209, "grad_norm": 0.8109943866729736, "learning_rate": 3.876349887130467e-05, "loss": 0.802, "step": 569 }, { "epoch": 0.7296583726698136, "grad_norm": 0.7262176871299744, "learning_rate": 3.8758061359251675e-05, "loss": 0.7646, "step": 570 }, { "epoch": 0.7296583726698136, "eval_loss": 0.012286221608519554, "eval_runtime": 10.8217, "eval_samples_per_second": 45.834, "eval_steps_per_second": 5.729, "step": 570 }, { "epoch": 0.7309384750780062, "grad_norm": 0.6469229459762573, "learning_rate": 3.875261234484176e-05, "loss": 0.7652, "step": 571 }, { "epoch": 0.7322185774861989, "grad_norm": 0.7295794486999512, "learning_rate": 3.874715183181502e-05, "loss": 0.7786, "step": 572 }, { "epoch": 0.7334986798943915, "grad_norm": 0.7332335710525513, "learning_rate": 3.8741679823919415e-05, "loss": 0.7654, "step": 573 }, { "epoch": 0.7347787823025842, "grad_norm": 0.6600735783576965, "learning_rate": 3.873619632491081e-05, "loss": 0.7617, "step": 574 }, { "epoch": 0.7360588847107769, "grad_norm": 0.7789995074272156, "learning_rate": 3.8730701338552965e-05, "loss": 0.7876, "step": 575 }, { "epoch": 0.7373389871189695, "grad_norm": 0.6553863286972046, "learning_rate": 3.872519486861752e-05, "loss": 0.7613, "step": 576 }, { "epoch": 0.7386190895271622, "grad_norm": 0.6660206317901611, "learning_rate": 3.871967691888397e-05, "loss": 0.78, "step": 577 }, { "epoch": 0.7398991919353548, "grad_norm": 0.7108450531959534, "learning_rate": 3.871414749313972e-05, "loss": 0.7856, "step": 578 }, { "epoch": 0.7411792943435475, "grad_norm": 0.7628849744796753, "learning_rate": 3.870860659518006e-05, "loss": 0.7903, "step": 579 }, { "epoch": 0.7424593967517401, "grad_norm": 0.7231595516204834, "learning_rate": 3.870305422880812e-05, "loss": 0.7782, "step": 580 }, { "epoch": 0.7437394991599328, "grad_norm": 0.6817286610603333, "learning_rate": 3.869749039783492e-05, "loss": 0.7999, "step": 581 }, { "epoch": 0.7450196015681254, "grad_norm": 0.7689202427864075, "learning_rate": 3.869191510607936e-05, "loss": 0.7923, "step": 582 }, { "epoch": 0.7462997039763181, "grad_norm": 0.7295532822608948, "learning_rate": 3.868632835736819e-05, "loss": 0.781, "step": 583 }, { "epoch": 0.7475798063845107, "grad_norm": 0.8823017477989197, "learning_rate": 3.8680730155536024e-05, "loss": 0.8224, "step": 584 }, { "epoch": 0.7488599087927034, "grad_norm": 0.7479209899902344, "learning_rate": 3.8675120504425345e-05, "loss": 0.7673, "step": 585 }, { "epoch": 0.750140011200896, "grad_norm": 0.7687907218933105, "learning_rate": 3.86694994078865e-05, "loss": 0.7566, "step": 586 }, { "epoch": 0.7514201136090888, "grad_norm": 0.7190302014350891, "learning_rate": 3.866386686977766e-05, "loss": 0.7997, "step": 587 }, { "epoch": 0.7527002160172814, "grad_norm": 0.8372753262519836, "learning_rate": 3.86582228939649e-05, "loss": 0.8182, "step": 588 }, { "epoch": 0.7539803184254741, "grad_norm": 0.659578800201416, "learning_rate": 3.86525674843221e-05, "loss": 0.7934, "step": 589 }, { "epoch": 0.7552604208336667, "grad_norm": 0.7682313919067383, "learning_rate": 3.864690064473102e-05, "loss": 0.8022, "step": 590 }, { "epoch": 0.7565405232418594, "grad_norm": 0.6671510338783264, "learning_rate": 3.864122237908123e-05, "loss": 0.7892, "step": 591 }, { "epoch": 0.757820625650052, "grad_norm": 0.7912404537200928, "learning_rate": 3.8635532691270196e-05, "loss": 0.7975, "step": 592 }, { "epoch": 0.7591007280582447, "grad_norm": 0.6808180212974548, "learning_rate": 3.862983158520316e-05, "loss": 0.7717, "step": 593 }, { "epoch": 0.7603808304664373, "grad_norm": 0.6629878282546997, "learning_rate": 3.862411906479326e-05, "loss": 0.7576, "step": 594 }, { "epoch": 0.76166093287463, "grad_norm": 0.6980240345001221, "learning_rate": 3.861839513396142e-05, "loss": 0.7656, "step": 595 }, { "epoch": 0.7629410352828226, "grad_norm": 0.6688075065612793, "learning_rate": 3.861265979663643e-05, "loss": 0.7729, "step": 596 }, { "epoch": 0.7642211376910153, "grad_norm": 0.734492301940918, "learning_rate": 3.860691305675489e-05, "loss": 0.7548, "step": 597 }, { "epoch": 0.765501240099208, "grad_norm": 0.6866258382797241, "learning_rate": 3.8601154918261235e-05, "loss": 0.7937, "step": 598 }, { "epoch": 0.7667813425074006, "grad_norm": 0.6859091520309448, "learning_rate": 3.859538538510772e-05, "loss": 0.8092, "step": 599 }, { "epoch": 0.7680614449155932, "grad_norm": 0.6623457074165344, "learning_rate": 3.858960446125443e-05, "loss": 0.738, "step": 600 }, { "epoch": 0.7680614449155932, "eval_loss": 0.01225673034787178, "eval_runtime": 10.8122, "eval_samples_per_second": 45.874, "eval_steps_per_second": 5.734, "step": 600 }, { "epoch": 0.7693415473237859, "grad_norm": 0.7174913883209229, "learning_rate": 3.858381215066926e-05, "loss": 0.7629, "step": 601 }, { "epoch": 0.7706216497319786, "grad_norm": 0.6979793906211853, "learning_rate": 3.857800845732792e-05, "loss": 0.8092, "step": 602 }, { "epoch": 0.7719017521401712, "grad_norm": 0.8007774949073792, "learning_rate": 3.857219338521393e-05, "loss": 0.7728, "step": 603 }, { "epoch": 0.7731818545483639, "grad_norm": 0.6879320740699768, "learning_rate": 3.856636693831863e-05, "loss": 0.7655, "step": 604 }, { "epoch": 0.7744619569565565, "grad_norm": 0.727526068687439, "learning_rate": 3.856052912064116e-05, "loss": 0.7675, "step": 605 }, { "epoch": 0.7757420593647492, "grad_norm": 0.678472638130188, "learning_rate": 3.855467993618847e-05, "loss": 0.7878, "step": 606 }, { "epoch": 0.7770221617729418, "grad_norm": 0.7199679017066956, "learning_rate": 3.854881938897531e-05, "loss": 0.7834, "step": 607 }, { "epoch": 0.7783022641811345, "grad_norm": 0.6436090469360352, "learning_rate": 3.854294748302422e-05, "loss": 0.7722, "step": 608 }, { "epoch": 0.7795823665893271, "grad_norm": 0.6526851654052734, "learning_rate": 3.8537064222365545e-05, "loss": 0.8065, "step": 609 }, { "epoch": 0.7808624689975198, "grad_norm": 0.6819186806678772, "learning_rate": 3.853116961103744e-05, "loss": 0.8207, "step": 610 }, { "epoch": 0.7821425714057124, "grad_norm": 0.6532469987869263, "learning_rate": 3.852526365308581e-05, "loss": 0.7678, "step": 611 }, { "epoch": 0.7834226738139051, "grad_norm": 0.6011775135993958, "learning_rate": 3.851934635256438e-05, "loss": 0.7885, "step": 612 }, { "epoch": 0.7847027762220977, "grad_norm": 0.5763460993766785, "learning_rate": 3.8513417713534676e-05, "loss": 0.7549, "step": 613 }, { "epoch": 0.7859828786302904, "grad_norm": 0.5785894989967346, "learning_rate": 3.850747774006594e-05, "loss": 0.8032, "step": 614 }, { "epoch": 0.7872629810384831, "grad_norm": 0.6389304399490356, "learning_rate": 3.850152643623527e-05, "loss": 0.7706, "step": 615 }, { "epoch": 0.7885430834466758, "grad_norm": 0.5873603820800781, "learning_rate": 3.849556380612749e-05, "loss": 0.7763, "step": 616 }, { "epoch": 0.7898231858548684, "grad_norm": 0.614728569984436, "learning_rate": 3.848958985383522e-05, "loss": 0.7387, "step": 617 }, { "epoch": 0.7911032882630611, "grad_norm": 0.6720883846282959, "learning_rate": 3.848360458345885e-05, "loss": 0.7901, "step": 618 }, { "epoch": 0.7923833906712537, "grad_norm": 0.6720901131629944, "learning_rate": 3.847760799910654e-05, "loss": 0.802, "step": 619 }, { "epoch": 0.7936634930794464, "grad_norm": 0.671968936920166, "learning_rate": 3.847160010489419e-05, "loss": 0.761, "step": 620 }, { "epoch": 0.794943595487639, "grad_norm": 0.7273372411727905, "learning_rate": 3.84655809049455e-05, "loss": 0.7881, "step": 621 }, { "epoch": 0.7962236978958317, "grad_norm": 0.7307608723640442, "learning_rate": 3.8459550403391916e-05, "loss": 0.7909, "step": 622 }, { "epoch": 0.7975038003040243, "grad_norm": 0.7239599227905273, "learning_rate": 3.8453508604372627e-05, "loss": 0.8082, "step": 623 }, { "epoch": 0.798783902712217, "grad_norm": 0.673768162727356, "learning_rate": 3.84474555120346e-05, "loss": 0.7329, "step": 624 }, { "epoch": 0.8000640051204096, "grad_norm": 0.6614078283309937, "learning_rate": 3.844139113053253e-05, "loss": 0.7377, "step": 625 }, { "epoch": 0.8013441075286023, "grad_norm": 0.6718165874481201, "learning_rate": 3.843531546402889e-05, "loss": 0.7872, "step": 626 }, { "epoch": 0.802624209936795, "grad_norm": 0.7179350852966309, "learning_rate": 3.8429228516693856e-05, "loss": 0.7596, "step": 627 }, { "epoch": 0.8039043123449876, "grad_norm": 0.6812868714332581, "learning_rate": 3.842313029270539e-05, "loss": 0.8254, "step": 628 }, { "epoch": 0.8051844147531803, "grad_norm": 0.6353902816772461, "learning_rate": 3.841702079624918e-05, "loss": 0.7819, "step": 629 }, { "epoch": 0.8064645171613729, "grad_norm": 0.6739655137062073, "learning_rate": 3.841090003151863e-05, "loss": 0.7659, "step": 630 }, { "epoch": 0.8064645171613729, "eval_loss": 0.0122321592643857, "eval_runtime": 10.8138, "eval_samples_per_second": 45.867, "eval_steps_per_second": 5.733, "step": 630 }, { "epoch": 0.8077446195695656, "grad_norm": 0.7184500694274902, "learning_rate": 3.8404768002714904e-05, "loss": 0.7462, "step": 631 }, { "epoch": 0.8090247219777582, "grad_norm": 0.6388519406318665, "learning_rate": 3.839862471404689e-05, "loss": 0.7681, "step": 632 }, { "epoch": 0.8103048243859509, "grad_norm": 0.7300659418106079, "learning_rate": 3.8392470169731206e-05, "loss": 0.785, "step": 633 }, { "epoch": 0.8115849267941435, "grad_norm": 0.678228497505188, "learning_rate": 3.8386304373992185e-05, "loss": 0.7745, "step": 634 }, { "epoch": 0.8128650292023362, "grad_norm": 0.781303346157074, "learning_rate": 3.8380127331061895e-05, "loss": 0.7683, "step": 635 }, { "epoch": 0.8141451316105288, "grad_norm": 0.6938972473144531, "learning_rate": 3.837393904518012e-05, "loss": 0.798, "step": 636 }, { "epoch": 0.8154252340187215, "grad_norm": 0.7247546911239624, "learning_rate": 3.836773952059436e-05, "loss": 0.7478, "step": 637 }, { "epoch": 0.8167053364269141, "grad_norm": 0.7374678254127502, "learning_rate": 3.8361528761559834e-05, "loss": 0.7816, "step": 638 }, { "epoch": 0.8179854388351068, "grad_norm": 0.6233804225921631, "learning_rate": 3.835530677233946e-05, "loss": 0.7543, "step": 639 }, { "epoch": 0.8192655412432994, "grad_norm": 0.6578785181045532, "learning_rate": 3.8349073557203875e-05, "loss": 0.7197, "step": 640 }, { "epoch": 0.8205456436514921, "grad_norm": 0.6945452094078064, "learning_rate": 3.834282912043141e-05, "loss": 0.7486, "step": 641 }, { "epoch": 0.8218257460596847, "grad_norm": 0.6540107727050781, "learning_rate": 3.833657346630812e-05, "loss": 0.7944, "step": 642 }, { "epoch": 0.8231058484678774, "grad_norm": 0.8248779773712158, "learning_rate": 3.833030659912774e-05, "loss": 0.79, "step": 643 }, { "epoch": 0.8243859508760701, "grad_norm": 0.669266402721405, "learning_rate": 3.8324028523191703e-05, "loss": 0.7307, "step": 644 }, { "epoch": 0.8256660532842628, "grad_norm": 0.7554711699485779, "learning_rate": 3.8317739242809144e-05, "loss": 0.777, "step": 645 }, { "epoch": 0.8269461556924554, "grad_norm": 0.720956027507782, "learning_rate": 3.831143876229688e-05, "loss": 0.7577, "step": 646 }, { "epoch": 0.8282262581006481, "grad_norm": 0.6820900440216064, "learning_rate": 3.830512708597942e-05, "loss": 0.7694, "step": 647 }, { "epoch": 0.8295063605088407, "grad_norm": 0.809729814529419, "learning_rate": 3.8298804218188956e-05, "loss": 0.848, "step": 648 }, { "epoch": 0.8307864629170334, "grad_norm": 0.7035766839981079, "learning_rate": 3.8292470163265375e-05, "loss": 0.7782, "step": 649 }, { "epoch": 0.832066565325226, "grad_norm": 0.7612035274505615, "learning_rate": 3.8286124925556206e-05, "loss": 0.7292, "step": 650 }, { "epoch": 0.8333466677334187, "grad_norm": 0.7206668257713318, "learning_rate": 3.8279768509416705e-05, "loss": 0.7793, "step": 651 }, { "epoch": 0.8346267701416114, "grad_norm": 0.8308065533638, "learning_rate": 3.827340091920975e-05, "loss": 0.7912, "step": 652 }, { "epoch": 0.835906872549804, "grad_norm": 0.66724693775177, "learning_rate": 3.826702215930593e-05, "loss": 0.7879, "step": 653 }, { "epoch": 0.8371869749579967, "grad_norm": 0.8065431714057922, "learning_rate": 3.826063223408346e-05, "loss": 0.7904, "step": 654 }, { "epoch": 0.8384670773661893, "grad_norm": 0.7159976959228516, "learning_rate": 3.825423114792826e-05, "loss": 0.8066, "step": 655 }, { "epoch": 0.839747179774382, "grad_norm": 0.7225691080093384, "learning_rate": 3.8247818905233895e-05, "loss": 0.7569, "step": 656 }, { "epoch": 0.8410272821825746, "grad_norm": 0.7047813534736633, "learning_rate": 3.824139551040157e-05, "loss": 0.7929, "step": 657 }, { "epoch": 0.8423073845907673, "grad_norm": 0.6967841982841492, "learning_rate": 3.823496096784017e-05, "loss": 0.7872, "step": 658 }, { "epoch": 0.8435874869989599, "grad_norm": 0.7850909233093262, "learning_rate": 3.822851528196621e-05, "loss": 0.7926, "step": 659 }, { "epoch": 0.8448675894071526, "grad_norm": 0.7023453712463379, "learning_rate": 3.8222058457203875e-05, "loss": 0.7993, "step": 660 }, { "epoch": 0.8448675894071526, "eval_loss": 0.012208767235279083, "eval_runtime": 10.8086, "eval_samples_per_second": 45.889, "eval_steps_per_second": 5.736, "step": 660 }, { "epoch": 0.8461476918153452, "grad_norm": 0.7789046168327332, "learning_rate": 3.821559049798497e-05, "loss": 0.7373, "step": 661 }, { "epoch": 0.8474277942235379, "grad_norm": 0.7462376356124878, "learning_rate": 3.820911140874897e-05, "loss": 0.7695, "step": 662 }, { "epoch": 0.8487078966317305, "grad_norm": 0.7990427017211914, "learning_rate": 3.8202621193942976e-05, "loss": 0.7879, "step": 663 }, { "epoch": 0.8499879990399232, "grad_norm": 0.8021045923233032, "learning_rate": 3.819611985802172e-05, "loss": 0.7441, "step": 664 }, { "epoch": 0.8512681014481158, "grad_norm": 0.7579212188720703, "learning_rate": 3.818960740544757e-05, "loss": 0.7852, "step": 665 }, { "epoch": 0.8525482038563085, "grad_norm": 0.7370229959487915, "learning_rate": 3.818308384069054e-05, "loss": 0.7548, "step": 666 }, { "epoch": 0.8538283062645011, "grad_norm": 0.7963458299636841, "learning_rate": 3.817654916822825e-05, "loss": 0.754, "step": 667 }, { "epoch": 0.8551084086726938, "grad_norm": 0.7232759594917297, "learning_rate": 3.8170003392545944e-05, "loss": 0.7608, "step": 668 }, { "epoch": 0.8563885110808864, "grad_norm": 0.7259448766708374, "learning_rate": 3.816344651813651e-05, "loss": 0.786, "step": 669 }, { "epoch": 0.8576686134890791, "grad_norm": 0.7260249257087708, "learning_rate": 3.815687854950044e-05, "loss": 0.8142, "step": 670 }, { "epoch": 0.8589487158972717, "grad_norm": 0.6957441568374634, "learning_rate": 3.8150299491145824e-05, "loss": 0.7082, "step": 671 }, { "epoch": 0.8602288183054644, "grad_norm": 0.7644979953765869, "learning_rate": 3.8143709347588396e-05, "loss": 0.7566, "step": 672 }, { "epoch": 0.8615089207136571, "grad_norm": 0.6766453385353088, "learning_rate": 3.813710812335147e-05, "loss": 0.7714, "step": 673 }, { "epoch": 0.8627890231218498, "grad_norm": 0.7125437259674072, "learning_rate": 3.8130495822965987e-05, "loss": 0.7721, "step": 674 }, { "epoch": 0.8640691255300424, "grad_norm": 0.7135685682296753, "learning_rate": 3.812387245097048e-05, "loss": 0.7604, "step": 675 }, { "epoch": 0.8653492279382351, "grad_norm": 0.6936878561973572, "learning_rate": 3.811723801191108e-05, "loss": 0.7587, "step": 676 }, { "epoch": 0.8666293303464278, "grad_norm": 0.6780898571014404, "learning_rate": 3.811059251034152e-05, "loss": 0.8206, "step": 677 }, { "epoch": 0.8679094327546204, "grad_norm": 0.6613956093788147, "learning_rate": 3.8103935950823115e-05, "loss": 0.7532, "step": 678 }, { "epoch": 0.869189535162813, "grad_norm": 0.6378298997879028, "learning_rate": 3.809726833792479e-05, "loss": 0.7565, "step": 679 }, { "epoch": 0.8704696375710057, "grad_norm": 0.718760073184967, "learning_rate": 3.8090589676223035e-05, "loss": 0.7802, "step": 680 }, { "epoch": 0.8717497399791984, "grad_norm": 0.6480719447135925, "learning_rate": 3.8083899970301944e-05, "loss": 0.7628, "step": 681 }, { "epoch": 0.873029842387391, "grad_norm": 0.6628484129905701, "learning_rate": 3.807719922475317e-05, "loss": 0.7781, "step": 682 }, { "epoch": 0.8743099447955837, "grad_norm": 0.6903721690177917, "learning_rate": 3.8070487444175965e-05, "loss": 0.7525, "step": 683 }, { "epoch": 0.8755900472037763, "grad_norm": 0.6006175875663757, "learning_rate": 3.8063764633177126e-05, "loss": 0.7547, "step": 684 }, { "epoch": 0.876870149611969, "grad_norm": 0.701867938041687, "learning_rate": 3.805703079637106e-05, "loss": 0.7759, "step": 685 }, { "epoch": 0.8781502520201616, "grad_norm": 0.5799329876899719, "learning_rate": 3.8050285938379714e-05, "loss": 0.7503, "step": 686 }, { "epoch": 0.8794303544283543, "grad_norm": 0.5676674842834473, "learning_rate": 3.80435300638326e-05, "loss": 0.6808, "step": 687 }, { "epoch": 0.8807104568365469, "grad_norm": 0.7126132249832153, "learning_rate": 3.803676317736681e-05, "loss": 0.7371, "step": 688 }, { "epoch": 0.8819905592447396, "grad_norm": 0.6570621728897095, "learning_rate": 3.802998528362697e-05, "loss": 0.7344, "step": 689 }, { "epoch": 0.8832706616529322, "grad_norm": 0.6264975070953369, "learning_rate": 3.802319638726528e-05, "loss": 0.7435, "step": 690 }, { "epoch": 0.8832706616529322, "eval_loss": 0.012167807668447495, "eval_runtime": 10.8349, "eval_samples_per_second": 45.778, "eval_steps_per_second": 5.722, "step": 690 }, { "epoch": 0.8845507640611249, "grad_norm": 0.6723735332489014, "learning_rate": 3.8016396492941496e-05, "loss": 0.7388, "step": 691 }, { "epoch": 0.8858308664693175, "grad_norm": 0.6698789596557617, "learning_rate": 3.80095856053229e-05, "loss": 0.7449, "step": 692 }, { "epoch": 0.8871109688775102, "grad_norm": 0.66045081615448, "learning_rate": 3.8002763729084335e-05, "loss": 0.7579, "step": 693 }, { "epoch": 0.8883910712857028, "grad_norm": 0.7423791289329529, "learning_rate": 3.799593086890819e-05, "loss": 0.8204, "step": 694 }, { "epoch": 0.8896711736938955, "grad_norm": 0.6909918189048767, "learning_rate": 3.798908702948437e-05, "loss": 0.7848, "step": 695 }, { "epoch": 0.8909512761020881, "grad_norm": 0.7587515711784363, "learning_rate": 3.798223221551036e-05, "loss": 0.7894, "step": 696 }, { "epoch": 0.8922313785102808, "grad_norm": 0.634644091129303, "learning_rate": 3.7975366431691124e-05, "loss": 0.7697, "step": 697 }, { "epoch": 0.8935114809184734, "grad_norm": 0.704616904258728, "learning_rate": 3.7968489682739195e-05, "loss": 0.7816, "step": 698 }, { "epoch": 0.8947915833266661, "grad_norm": 0.6776732206344604, "learning_rate": 3.796160197337462e-05, "loss": 0.7722, "step": 699 }, { "epoch": 0.8960716857348587, "grad_norm": 0.7427555322647095, "learning_rate": 3.795470330832496e-05, "loss": 0.7988, "step": 700 }, { "epoch": 0.8973517881430515, "grad_norm": 0.6761599183082581, "learning_rate": 3.794779369232531e-05, "loss": 0.7748, "step": 701 }, { "epoch": 0.8986318905512442, "grad_norm": 0.7047790884971619, "learning_rate": 3.7940873130118275e-05, "loss": 0.7686, "step": 702 }, { "epoch": 0.8999119929594368, "grad_norm": 0.7226253151893616, "learning_rate": 3.7933941626453965e-05, "loss": 0.7851, "step": 703 }, { "epoch": 0.9011920953676295, "grad_norm": 0.657839298248291, "learning_rate": 3.792699918609002e-05, "loss": 0.7873, "step": 704 }, { "epoch": 0.9024721977758221, "grad_norm": 0.6704640984535217, "learning_rate": 3.792004581379157e-05, "loss": 0.7602, "step": 705 }, { "epoch": 0.9037523001840148, "grad_norm": 0.7041623592376709, "learning_rate": 3.7913081514331256e-05, "loss": 0.7737, "step": 706 }, { "epoch": 0.9050324025922074, "grad_norm": 0.7038724422454834, "learning_rate": 3.7906106292489214e-05, "loss": 0.7381, "step": 707 }, { "epoch": 0.9063125050004001, "grad_norm": 0.7266661524772644, "learning_rate": 3.789912015305308e-05, "loss": 0.7721, "step": 708 }, { "epoch": 0.9075926074085927, "grad_norm": 0.6591942310333252, "learning_rate": 3.789212310081798e-05, "loss": 0.779, "step": 709 }, { "epoch": 0.9088727098167854, "grad_norm": 0.7500007748603821, "learning_rate": 3.7885115140586546e-05, "loss": 0.7791, "step": 710 }, { "epoch": 0.910152812224978, "grad_norm": 0.673807680606842, "learning_rate": 3.787809627716887e-05, "loss": 0.7729, "step": 711 }, { "epoch": 0.9114329146331707, "grad_norm": 0.6827871799468994, "learning_rate": 3.787106651538254e-05, "loss": 0.799, "step": 712 }, { "epoch": 0.9127130170413633, "grad_norm": 0.6365512609481812, "learning_rate": 3.786402586005264e-05, "loss": 0.7772, "step": 713 }, { "epoch": 0.913993119449556, "grad_norm": 0.7164957523345947, "learning_rate": 3.785697431601172e-05, "loss": 0.7439, "step": 714 }, { "epoch": 0.9152732218577486, "grad_norm": 0.6707044243812561, "learning_rate": 3.784991188809979e-05, "loss": 0.7779, "step": 715 }, { "epoch": 0.9165533242659413, "grad_norm": 0.7647178769111633, "learning_rate": 3.784283858116434e-05, "loss": 0.8092, "step": 716 }, { "epoch": 0.9178334266741339, "grad_norm": 0.720170795917511, "learning_rate": 3.783575440006033e-05, "loss": 0.7153, "step": 717 }, { "epoch": 0.9191135290823266, "grad_norm": 0.6896149516105652, "learning_rate": 3.782865934965019e-05, "loss": 0.8097, "step": 718 }, { "epoch": 0.9203936314905192, "grad_norm": 0.6445088982582092, "learning_rate": 3.7821553434803806e-05, "loss": 0.7758, "step": 719 }, { "epoch": 0.9216737338987119, "grad_norm": 0.6135826706886292, "learning_rate": 3.7814436660398514e-05, "loss": 0.7878, "step": 720 }, { "epoch": 0.9216737338987119, "eval_loss": 0.012132863514125347, "eval_runtime": 10.8159, "eval_samples_per_second": 45.859, "eval_steps_per_second": 5.732, "step": 720 }, { "epoch": 0.9229538363069045, "grad_norm": 0.6798313856124878, "learning_rate": 3.78073090313191e-05, "loss": 0.8094, "step": 721 }, { "epoch": 0.9242339387150972, "grad_norm": 0.6502001881599426, "learning_rate": 3.780017055245782e-05, "loss": 0.8123, "step": 722 }, { "epoch": 0.9255140411232898, "grad_norm": 0.6290013194084167, "learning_rate": 3.7793021228714366e-05, "loss": 0.7683, "step": 723 }, { "epoch": 0.9267941435314825, "grad_norm": 0.6015080809593201, "learning_rate": 3.7785861064995854e-05, "loss": 0.7337, "step": 724 }, { "epoch": 0.9280742459396751, "grad_norm": 0.6684856414794922, "learning_rate": 3.7778690066216886e-05, "loss": 0.7629, "step": 725 }, { "epoch": 0.9293543483478678, "grad_norm": 0.6500918865203857, "learning_rate": 3.7771508237299456e-05, "loss": 0.786, "step": 726 }, { "epoch": 0.9306344507560604, "grad_norm": 0.6887004971504211, "learning_rate": 3.776431558317302e-05, "loss": 0.7584, "step": 727 }, { "epoch": 0.9319145531642531, "grad_norm": 0.629284143447876, "learning_rate": 3.775711210877445e-05, "loss": 0.7254, "step": 728 }, { "epoch": 0.9331946555724457, "grad_norm": 0.7328817248344421, "learning_rate": 3.7749897819048044e-05, "loss": 0.7683, "step": 729 }, { "epoch": 0.9344747579806385, "grad_norm": 0.6202633380889893, "learning_rate": 3.774267271894554e-05, "loss": 0.8149, "step": 730 }, { "epoch": 0.9357548603888312, "grad_norm": 0.6682559847831726, "learning_rate": 3.773543681342607e-05, "loss": 0.7787, "step": 731 }, { "epoch": 0.9370349627970238, "grad_norm": 0.5899592638015747, "learning_rate": 3.7728190107456214e-05, "loss": 0.7462, "step": 732 }, { "epoch": 0.9383150652052165, "grad_norm": 0.6884704232215881, "learning_rate": 3.772093260600993e-05, "loss": 0.7163, "step": 733 }, { "epoch": 0.9395951676134091, "grad_norm": 0.7006421089172363, "learning_rate": 3.771366431406863e-05, "loss": 0.802, "step": 734 }, { "epoch": 0.9408752700216018, "grad_norm": 0.8256950974464417, "learning_rate": 3.7706385236621074e-05, "loss": 0.7762, "step": 735 }, { "epoch": 0.9421553724297944, "grad_norm": 0.7171242833137512, "learning_rate": 3.7699095378663476e-05, "loss": 0.7976, "step": 736 }, { "epoch": 0.9434354748379871, "grad_norm": 0.7153730392456055, "learning_rate": 3.7691794745199435e-05, "loss": 0.7723, "step": 737 }, { "epoch": 0.9447155772461797, "grad_norm": 0.6709647178649902, "learning_rate": 3.768448334123993e-05, "loss": 0.7783, "step": 738 }, { "epoch": 0.9459956796543724, "grad_norm": 0.7212246060371399, "learning_rate": 3.7677161171803346e-05, "loss": 0.7928, "step": 739 }, { "epoch": 0.947275782062565, "grad_norm": 0.6821660995483398, "learning_rate": 3.766982824191547e-05, "loss": 0.767, "step": 740 }, { "epoch": 0.9485558844707577, "grad_norm": 0.6796236634254456, "learning_rate": 3.766248455660944e-05, "loss": 0.7837, "step": 741 }, { "epoch": 0.9498359868789503, "grad_norm": 0.6628891825675964, "learning_rate": 3.7655130120925805e-05, "loss": 0.8115, "step": 742 }, { "epoch": 0.951116089287143, "grad_norm": 0.6210861206054688, "learning_rate": 3.764776493991249e-05, "loss": 0.7428, "step": 743 }, { "epoch": 0.9523961916953356, "grad_norm": 0.6889374256134033, "learning_rate": 3.764038901862478e-05, "loss": 0.7808, "step": 744 }, { "epoch": 0.9536762941035283, "grad_norm": 0.627668023109436, "learning_rate": 3.763300236212535e-05, "loss": 0.7605, "step": 745 }, { "epoch": 0.9549563965117209, "grad_norm": 0.6655675172805786, "learning_rate": 3.762560497548424e-05, "loss": 0.7738, "step": 746 }, { "epoch": 0.9562364989199136, "grad_norm": 0.634579598903656, "learning_rate": 3.761819686377882e-05, "loss": 0.7781, "step": 747 }, { "epoch": 0.9575166013281062, "grad_norm": 0.6562496423721313, "learning_rate": 3.761077803209389e-05, "loss": 0.7877, "step": 748 }, { "epoch": 0.9587967037362989, "grad_norm": 0.5922711491584778, "learning_rate": 3.7603348485521546e-05, "loss": 0.7515, "step": 749 }, { "epoch": 0.9600768061444915, "grad_norm": 0.6168217062950134, "learning_rate": 3.759590822916128e-05, "loss": 0.7377, "step": 750 }, { "epoch": 0.9600768061444915, "eval_loss": 0.012109671719372272, "eval_runtime": 10.8247, "eval_samples_per_second": 45.821, "eval_steps_per_second": 5.728, "step": 750 }, { "epoch": 0.9613569085526842, "grad_norm": 0.6015171408653259, "learning_rate": 3.75884572681199e-05, "loss": 0.7448, "step": 751 }, { "epoch": 0.9626370109608768, "grad_norm": 0.6879626512527466, "learning_rate": 3.7580995607511584e-05, "loss": 0.7926, "step": 752 }, { "epoch": 0.9639171133690695, "grad_norm": 0.598674476146698, "learning_rate": 3.757352325245784e-05, "loss": 0.7109, "step": 753 }, { "epoch": 0.9651972157772621, "grad_norm": 0.7455387711524963, "learning_rate": 3.7566040208087544e-05, "loss": 0.7873, "step": 754 }, { "epoch": 0.9664773181854548, "grad_norm": 0.6520408987998962, "learning_rate": 3.755854647953687e-05, "loss": 0.7519, "step": 755 }, { "epoch": 0.9677574205936474, "grad_norm": 0.6713144779205322, "learning_rate": 3.755104207194936e-05, "loss": 0.7474, "step": 756 }, { "epoch": 0.9690375230018401, "grad_norm": 0.6542277932167053, "learning_rate": 3.7543526990475864e-05, "loss": 0.7349, "step": 757 }, { "epoch": 0.9703176254100329, "grad_norm": 0.734278678894043, "learning_rate": 3.753600124027456e-05, "loss": 0.793, "step": 758 }, { "epoch": 0.9715977278182255, "grad_norm": 0.640709638595581, "learning_rate": 3.7528464826510965e-05, "loss": 0.7578, "step": 759 }, { "epoch": 0.9728778302264182, "grad_norm": 0.6655123829841614, "learning_rate": 3.7520917754357895e-05, "loss": 0.7886, "step": 760 }, { "epoch": 0.9741579326346108, "grad_norm": 0.6819617748260498, "learning_rate": 3.751336002899549e-05, "loss": 0.7638, "step": 761 }, { "epoch": 0.9754380350428035, "grad_norm": 0.6399703025817871, "learning_rate": 3.750579165561121e-05, "loss": 0.7718, "step": 762 }, { "epoch": 0.9767181374509961, "grad_norm": 0.6448771357536316, "learning_rate": 3.7498212639399814e-05, "loss": 0.7403, "step": 763 }, { "epoch": 0.9779982398591888, "grad_norm": 0.6541329026222229, "learning_rate": 3.749062298556337e-05, "loss": 0.737, "step": 764 }, { "epoch": 0.9792783422673814, "grad_norm": 0.6602521538734436, "learning_rate": 3.748302269931124e-05, "loss": 0.7742, "step": 765 }, { "epoch": 0.9805584446755741, "grad_norm": 0.6031312346458435, "learning_rate": 3.74754117858601e-05, "loss": 0.7204, "step": 766 }, { "epoch": 0.9818385470837667, "grad_norm": 0.645257830619812, "learning_rate": 3.7467790250433903e-05, "loss": 0.7431, "step": 767 }, { "epoch": 0.9831186494919594, "grad_norm": 0.6873139142990112, "learning_rate": 3.7460158098263895e-05, "loss": 0.8201, "step": 768 }, { "epoch": 0.984398751900152, "grad_norm": 0.679110050201416, "learning_rate": 3.745251533458863e-05, "loss": 0.7408, "step": 769 }, { "epoch": 0.9856788543083447, "grad_norm": 0.6790152192115784, "learning_rate": 3.7444861964653905e-05, "loss": 0.7395, "step": 770 }, { "epoch": 0.9869589567165373, "grad_norm": 0.69802325963974, "learning_rate": 3.743719799371284e-05, "loss": 0.7828, "step": 771 }, { "epoch": 0.98823905912473, "grad_norm": 0.6704466342926025, "learning_rate": 3.7429523427025813e-05, "loss": 0.7735, "step": 772 }, { "epoch": 0.9895191615329226, "grad_norm": 0.6800136566162109, "learning_rate": 3.742183826986046e-05, "loss": 0.7531, "step": 773 }, { "epoch": 0.9907992639411153, "grad_norm": 0.649958074092865, "learning_rate": 3.741414252749171e-05, "loss": 0.7642, "step": 774 }, { "epoch": 0.9920793663493079, "grad_norm": 0.6794930100440979, "learning_rate": 3.7406436205201755e-05, "loss": 0.7957, "step": 775 }, { "epoch": 0.9933594687575006, "grad_norm": 0.6961868405342102, "learning_rate": 3.739871930828002e-05, "loss": 0.7478, "step": 776 }, { "epoch": 0.9946395711656932, "grad_norm": 0.7181962132453918, "learning_rate": 3.739099184202324e-05, "loss": 0.7827, "step": 777 }, { "epoch": 0.9959196735738859, "grad_norm": 0.7640824913978577, "learning_rate": 3.7383253811735346e-05, "loss": 0.7335, "step": 778 }, { "epoch": 0.9971997759820785, "grad_norm": 0.624038577079773, "learning_rate": 3.737550522272756e-05, "loss": 0.7184, "step": 779 }, { "epoch": 0.9984798783902712, "grad_norm": 0.7637789249420166, "learning_rate": 3.736774608031834e-05, "loss": 0.7586, "step": 780 }, { "epoch": 0.9984798783902712, "eval_loss": 0.012082226574420929, "eval_runtime": 10.8094, "eval_samples_per_second": 45.886, "eval_steps_per_second": 5.736, "step": 780 }, { "epoch": 0.9997599807984638, "grad_norm": 0.6540350317955017, "learning_rate": 3.7359976389833384e-05, "loss": 0.7477, "step": 781 }, { "epoch": 1.0, "grad_norm": 1.015478253364563, "learning_rate": 3.735219615660564e-05, "loss": 0.7103, "step": 782 }, { "epoch": 1.0012801024081928, "grad_norm": 0.9592230916023254, "learning_rate": 3.734440538597528e-05, "loss": 0.7656, "step": 783 }, { "epoch": 1.0025602048163853, "grad_norm": 0.7201738357543945, "learning_rate": 3.733660408328971e-05, "loss": 0.7175, "step": 784 }, { "epoch": 1.003840307224578, "grad_norm": 0.747381865978241, "learning_rate": 3.732879225390357e-05, "loss": 0.6981, "step": 785 }, { "epoch": 1.0051204096327706, "grad_norm": 0.7670899629592896, "learning_rate": 3.7320969903178735e-05, "loss": 0.74, "step": 786 }, { "epoch": 1.0064005120409634, "grad_norm": 0.7124491333961487, "learning_rate": 3.731313703648427e-05, "loss": 0.7294, "step": 787 }, { "epoch": 1.007680614449156, "grad_norm": 0.677145779132843, "learning_rate": 3.730529365919651e-05, "loss": 0.7084, "step": 788 }, { "epoch": 1.0089607168573487, "grad_norm": 0.7383764982223511, "learning_rate": 3.729743977669895e-05, "loss": 0.7607, "step": 789 }, { "epoch": 1.0102408192655412, "grad_norm": 0.658332347869873, "learning_rate": 3.728957539438231e-05, "loss": 0.7378, "step": 790 }, { "epoch": 1.011520921673734, "grad_norm": 0.6816548109054565, "learning_rate": 3.7281700517644554e-05, "loss": 0.7041, "step": 791 }, { "epoch": 1.0128010240819265, "grad_norm": 0.6481317281723022, "learning_rate": 3.72738151518908e-05, "loss": 0.7524, "step": 792 }, { "epoch": 1.0140811264901193, "grad_norm": 0.7398667335510254, "learning_rate": 3.726591930253339e-05, "loss": 0.7284, "step": 793 }, { "epoch": 1.0153612288983118, "grad_norm": 0.6366782188415527, "learning_rate": 3.7258012974991864e-05, "loss": 0.734, "step": 794 }, { "epoch": 1.0166413313065046, "grad_norm": 0.7185632586479187, "learning_rate": 3.7250096174692936e-05, "loss": 0.7509, "step": 795 }, { "epoch": 1.0179214337146971, "grad_norm": 0.6839074492454529, "learning_rate": 3.7242168907070534e-05, "loss": 0.7403, "step": 796 }, { "epoch": 1.0192015361228899, "grad_norm": 0.6224228739738464, "learning_rate": 3.723423117756574e-05, "loss": 0.7084, "step": 797 }, { "epoch": 1.0204816385310824, "grad_norm": 0.7044923305511475, "learning_rate": 3.722628299162684e-05, "loss": 0.7213, "step": 798 }, { "epoch": 1.0217617409392752, "grad_norm": 0.6783655285835266, "learning_rate": 3.7218324354709305e-05, "loss": 0.7465, "step": 799 }, { "epoch": 1.0230418433474677, "grad_norm": 0.6528795957565308, "learning_rate": 3.721035527227575e-05, "loss": 0.7334, "step": 800 }, { "epoch": 1.0243219457556605, "grad_norm": 0.6916537880897522, "learning_rate": 3.720237574979597e-05, "loss": 0.7314, "step": 801 }, { "epoch": 1.025602048163853, "grad_norm": 0.6323184370994568, "learning_rate": 3.7194385792746934e-05, "loss": 0.7349, "step": 802 }, { "epoch": 1.0268821505720458, "grad_norm": 0.6384755373001099, "learning_rate": 3.718638540661278e-05, "loss": 0.7202, "step": 803 }, { "epoch": 1.0281622529802383, "grad_norm": 0.698417067527771, "learning_rate": 3.7178374596884784e-05, "loss": 0.7491, "step": 804 }, { "epoch": 1.029442355388431, "grad_norm": 0.6580883860588074, "learning_rate": 3.717035336906138e-05, "loss": 0.7492, "step": 805 }, { "epoch": 1.0307224577966236, "grad_norm": 0.6361373662948608, "learning_rate": 3.716232172864817e-05, "loss": 0.7284, "step": 806 }, { "epoch": 1.0320025602048164, "grad_norm": 0.6777246594429016, "learning_rate": 3.715427968115789e-05, "loss": 0.71, "step": 807 }, { "epoch": 1.033282662613009, "grad_norm": 0.7357933521270752, "learning_rate": 3.714622723211041e-05, "loss": 0.7579, "step": 808 }, { "epoch": 1.0345627650212017, "grad_norm": 0.6447516083717346, "learning_rate": 3.713816438703276e-05, "loss": 0.7091, "step": 809 }, { "epoch": 1.0358428674293942, "grad_norm": 0.6505489945411682, "learning_rate": 3.7130091151459094e-05, "loss": 0.7135, "step": 810 }, { "epoch": 1.0358428674293942, "eval_loss": 0.012068789452314377, "eval_runtime": 10.8218, "eval_samples_per_second": 45.833, "eval_steps_per_second": 5.729, "step": 810 }, { "epoch": 1.037122969837587, "grad_norm": 0.6926580667495728, "learning_rate": 3.71220075309307e-05, "loss": 0.7419, "step": 811 }, { "epoch": 1.0384030722457798, "grad_norm": 0.6922308206558228, "learning_rate": 3.711391353099599e-05, "loss": 0.7549, "step": 812 }, { "epoch": 1.0396831746539723, "grad_norm": 0.7106603384017944, "learning_rate": 3.710580915721051e-05, "loss": 0.7637, "step": 813 }, { "epoch": 1.040963277062165, "grad_norm": 0.6899227499961853, "learning_rate": 3.709769441513691e-05, "loss": 0.7337, "step": 814 }, { "epoch": 1.0422433794703576, "grad_norm": 0.6479454636573792, "learning_rate": 3.708956931034498e-05, "loss": 0.6827, "step": 815 }, { "epoch": 1.0435234818785504, "grad_norm": 0.6753072142601013, "learning_rate": 3.7081433848411596e-05, "loss": 0.7404, "step": 816 }, { "epoch": 1.044803584286743, "grad_norm": 0.6539455056190491, "learning_rate": 3.707328803492077e-05, "loss": 0.6972, "step": 817 }, { "epoch": 1.0460836866949357, "grad_norm": 0.6149129867553711, "learning_rate": 3.70651318754636e-05, "loss": 0.7423, "step": 818 }, { "epoch": 1.0473637891031282, "grad_norm": 0.6942073106765747, "learning_rate": 3.705696537563828e-05, "loss": 0.7324, "step": 819 }, { "epoch": 1.048643891511321, "grad_norm": 0.6388072371482849, "learning_rate": 3.7048788541050126e-05, "loss": 0.7452, "step": 820 }, { "epoch": 1.0499239939195135, "grad_norm": 0.6410319209098816, "learning_rate": 3.7040601377311526e-05, "loss": 0.715, "step": 821 }, { "epoch": 1.0512040963277063, "grad_norm": 0.6240140795707703, "learning_rate": 3.703240389004197e-05, "loss": 0.7068, "step": 822 }, { "epoch": 1.0524841987358988, "grad_norm": 0.7288002967834473, "learning_rate": 3.702419608486803e-05, "loss": 0.7451, "step": 823 }, { "epoch": 1.0537643011440916, "grad_norm": 0.6330709457397461, "learning_rate": 3.7015977967423356e-05, "loss": 0.7175, "step": 824 }, { "epoch": 1.0550444035522841, "grad_norm": 0.7527199387550354, "learning_rate": 3.700774954334868e-05, "loss": 0.725, "step": 825 }, { "epoch": 1.056324505960477, "grad_norm": 0.5856966376304626, "learning_rate": 3.69995108182918e-05, "loss": 0.7131, "step": 826 }, { "epoch": 1.0576046083686694, "grad_norm": 0.7010636925697327, "learning_rate": 3.6991261797907604e-05, "loss": 0.7244, "step": 827 }, { "epoch": 1.0588847107768622, "grad_norm": 0.6359009742736816, "learning_rate": 3.698300248785803e-05, "loss": 0.7058, "step": 828 }, { "epoch": 1.0601648131850547, "grad_norm": 0.8455493450164795, "learning_rate": 3.6974732893812074e-05, "loss": 0.7228, "step": 829 }, { "epoch": 1.0614449155932475, "grad_norm": 0.6704761385917664, "learning_rate": 3.696645302144582e-05, "loss": 0.7454, "step": 830 }, { "epoch": 1.06272501800144, "grad_norm": 0.8195145726203918, "learning_rate": 3.695816287644236e-05, "loss": 0.7227, "step": 831 }, { "epoch": 1.0640051204096328, "grad_norm": 0.7179127931594849, "learning_rate": 3.694986246449189e-05, "loss": 0.7338, "step": 832 }, { "epoch": 1.0652852228178253, "grad_norm": 0.7122701406478882, "learning_rate": 3.6941551791291604e-05, "loss": 0.7565, "step": 833 }, { "epoch": 1.066565325226018, "grad_norm": 0.720400333404541, "learning_rate": 3.693323086254578e-05, "loss": 0.7649, "step": 834 }, { "epoch": 1.0678454276342106, "grad_norm": 0.7331603169441223, "learning_rate": 3.69248996839657e-05, "loss": 0.7458, "step": 835 }, { "epoch": 1.0691255300424034, "grad_norm": 0.8550188541412354, "learning_rate": 3.691655826126971e-05, "loss": 0.7268, "step": 836 }, { "epoch": 1.070405632450596, "grad_norm": 0.6874879002571106, "learning_rate": 3.690820660018317e-05, "loss": 0.7141, "step": 837 }, { "epoch": 1.0716857348587887, "grad_norm": 0.7743686437606812, "learning_rate": 3.689984470643847e-05, "loss": 0.7338, "step": 838 }, { "epoch": 1.0729658372669815, "grad_norm": 0.7543725371360779, "learning_rate": 3.6891472585775034e-05, "loss": 0.7459, "step": 839 }, { "epoch": 1.074245939675174, "grad_norm": 0.6992446184158325, "learning_rate": 3.688309024393929e-05, "loss": 0.7203, "step": 840 }, { "epoch": 1.074245939675174, "eval_loss": 0.012044671922922134, "eval_runtime": 10.8226, "eval_samples_per_second": 45.83, "eval_steps_per_second": 5.729, "step": 840 }, { "epoch": 1.0755260420833668, "grad_norm": 0.7683684825897217, "learning_rate": 3.687469768668469e-05, "loss": 0.731, "step": 841 }, { "epoch": 1.0768061444915593, "grad_norm": 0.7468374967575073, "learning_rate": 3.6866294919771705e-05, "loss": 0.7385, "step": 842 }, { "epoch": 1.078086246899752, "grad_norm": 0.6611967086791992, "learning_rate": 3.685788194896779e-05, "loss": 0.7384, "step": 843 }, { "epoch": 1.0793663493079446, "grad_norm": 0.7011679410934448, "learning_rate": 3.684945878004744e-05, "loss": 0.7376, "step": 844 }, { "epoch": 1.0806464517161374, "grad_norm": 0.6693490743637085, "learning_rate": 3.6841025418792114e-05, "loss": 0.7127, "step": 845 }, { "epoch": 1.08192655412433, "grad_norm": 0.6240278482437134, "learning_rate": 3.683258187099028e-05, "loss": 0.7288, "step": 846 }, { "epoch": 1.0832066565325227, "grad_norm": 0.7663692235946655, "learning_rate": 3.682412814243741e-05, "loss": 0.7449, "step": 847 }, { "epoch": 1.0844867589407152, "grad_norm": 0.6547810435295105, "learning_rate": 3.681566423893594e-05, "loss": 0.7392, "step": 848 }, { "epoch": 1.085766861348908, "grad_norm": 0.6520044803619385, "learning_rate": 3.6807190166295324e-05, "loss": 0.7451, "step": 849 }, { "epoch": 1.0870469637571005, "grad_norm": 0.6523797512054443, "learning_rate": 3.6798705930331954e-05, "loss": 0.7039, "step": 850 }, { "epoch": 1.0883270661652933, "grad_norm": 0.6763718128204346, "learning_rate": 3.679021153686923e-05, "loss": 0.7569, "step": 851 }, { "epoch": 1.0896071685734858, "grad_norm": 0.5969076156616211, "learning_rate": 3.678170699173751e-05, "loss": 0.7088, "step": 852 }, { "epoch": 1.0908872709816786, "grad_norm": 0.7176002860069275, "learning_rate": 3.677319230077412e-05, "loss": 0.7037, "step": 853 }, { "epoch": 1.0921673733898711, "grad_norm": 0.6345864534378052, "learning_rate": 3.676466746982336e-05, "loss": 0.749, "step": 854 }, { "epoch": 1.093447475798064, "grad_norm": 0.7272902131080627, "learning_rate": 3.675613250473648e-05, "loss": 0.7444, "step": 855 }, { "epoch": 1.0947275782062564, "grad_norm": 0.6915029287338257, "learning_rate": 3.674758741137168e-05, "loss": 0.7381, "step": 856 }, { "epoch": 1.0960076806144492, "grad_norm": 0.7332066893577576, "learning_rate": 3.6739032195594134e-05, "loss": 0.7536, "step": 857 }, { "epoch": 1.0972877830226417, "grad_norm": 0.5940446853637695, "learning_rate": 3.673046686327594e-05, "loss": 0.7253, "step": 858 }, { "epoch": 1.0985678854308345, "grad_norm": 0.7006335258483887, "learning_rate": 3.672189142029614e-05, "loss": 0.6761, "step": 859 }, { "epoch": 1.099847987839027, "grad_norm": 0.6557371020317078, "learning_rate": 3.671330587254076e-05, "loss": 0.7012, "step": 860 }, { "epoch": 1.1011280902472198, "grad_norm": 0.6992865800857544, "learning_rate": 3.670471022590269e-05, "loss": 0.7275, "step": 861 }, { "epoch": 1.1024081926554123, "grad_norm": 0.6820812225341797, "learning_rate": 3.669610448628181e-05, "loss": 0.7375, "step": 862 }, { "epoch": 1.103688295063605, "grad_norm": 0.7431970834732056, "learning_rate": 3.66874886595849e-05, "loss": 0.7301, "step": 863 }, { "epoch": 1.1049683974717976, "grad_norm": 0.6357002258300781, "learning_rate": 3.667886275172567e-05, "loss": 0.7378, "step": 864 }, { "epoch": 1.1062484998799904, "grad_norm": 0.7715697884559631, "learning_rate": 3.6670226768624745e-05, "loss": 0.7484, "step": 865 }, { "epoch": 1.107528602288183, "grad_norm": 0.621955394744873, "learning_rate": 3.6661580716209684e-05, "loss": 0.7159, "step": 866 }, { "epoch": 1.1088087046963757, "grad_norm": 0.8410272598266602, "learning_rate": 3.665292460041492e-05, "loss": 0.7438, "step": 867 }, { "epoch": 1.1100888071045683, "grad_norm": 0.7019923329353333, "learning_rate": 3.6644258427181845e-05, "loss": 0.7053, "step": 868 }, { "epoch": 1.111368909512761, "grad_norm": 0.7673763036727905, "learning_rate": 3.66355822024587e-05, "loss": 0.7165, "step": 869 }, { "epoch": 1.1126490119209538, "grad_norm": 0.794391393661499, "learning_rate": 3.662689593220066e-05, "loss": 0.7703, "step": 870 }, { "epoch": 1.1126490119209538, "eval_loss": 0.012025858275592327, "eval_runtime": 10.8162, "eval_samples_per_second": 45.857, "eval_steps_per_second": 5.732, "step": 870 }, { "epoch": 1.1139291143291463, "grad_norm": 0.652980387210846, "learning_rate": 3.66181996223698e-05, "loss": 0.7104, "step": 871 }, { "epoch": 1.115209216737339, "grad_norm": 0.7875044941902161, "learning_rate": 3.660949327893505e-05, "loss": 0.6948, "step": 872 }, { "epoch": 1.1164893191455316, "grad_norm": 0.7187885642051697, "learning_rate": 3.660077690787226e-05, "loss": 0.7869, "step": 873 }, { "epoch": 1.1177694215537244, "grad_norm": 0.6242810487747192, "learning_rate": 3.659205051516414e-05, "loss": 0.6933, "step": 874 }, { "epoch": 1.119049523961917, "grad_norm": 0.697650134563446, "learning_rate": 3.658331410680031e-05, "loss": 0.7347, "step": 875 }, { "epoch": 1.1203296263701097, "grad_norm": 0.6302863955497742, "learning_rate": 3.657456768877723e-05, "loss": 0.7231, "step": 876 }, { "epoch": 1.1216097287783022, "grad_norm": 0.6891476511955261, "learning_rate": 3.6565811267098245e-05, "loss": 0.7689, "step": 877 }, { "epoch": 1.122889831186495, "grad_norm": 0.5999673008918762, "learning_rate": 3.6557044847773575e-05, "loss": 0.723, "step": 878 }, { "epoch": 1.1241699335946875, "grad_norm": 0.6499205231666565, "learning_rate": 3.654826843682028e-05, "loss": 0.7098, "step": 879 }, { "epoch": 1.1254500360028803, "grad_norm": 0.642432689666748, "learning_rate": 3.6539482040262304e-05, "loss": 0.7362, "step": 880 }, { "epoch": 1.1267301384110728, "grad_norm": 0.6041407585144043, "learning_rate": 3.653068566413043e-05, "loss": 0.7276, "step": 881 }, { "epoch": 1.1280102408192656, "grad_norm": 0.6853089928627014, "learning_rate": 3.6521879314462285e-05, "loss": 0.734, "step": 882 }, { "epoch": 1.1292903432274581, "grad_norm": 0.6265656352043152, "learning_rate": 3.6513062997302356e-05, "loss": 0.7148, "step": 883 }, { "epoch": 1.130570445635651, "grad_norm": 0.6284116506576538, "learning_rate": 3.650423671870197e-05, "loss": 0.7134, "step": 884 }, { "epoch": 1.1318505480438434, "grad_norm": 0.6319745779037476, "learning_rate": 3.649540048471927e-05, "loss": 0.7082, "step": 885 }, { "epoch": 1.1331306504520362, "grad_norm": 0.6498191356658936, "learning_rate": 3.648655430141927e-05, "loss": 0.747, "step": 886 }, { "epoch": 1.1344107528602287, "grad_norm": 0.6267776489257812, "learning_rate": 3.647769817487377e-05, "loss": 0.7125, "step": 887 }, { "epoch": 1.1356908552684215, "grad_norm": 0.6035043001174927, "learning_rate": 3.646883211116143e-05, "loss": 0.7423, "step": 888 }, { "epoch": 1.136970957676614, "grad_norm": 0.6620738506317139, "learning_rate": 3.645995611636772e-05, "loss": 0.7157, "step": 889 }, { "epoch": 1.1382510600848068, "grad_norm": 0.6425696611404419, "learning_rate": 3.645107019658491e-05, "loss": 0.718, "step": 890 }, { "epoch": 1.1395311624929993, "grad_norm": 0.5747361183166504, "learning_rate": 3.64421743579121e-05, "loss": 0.7198, "step": 891 }, { "epoch": 1.1408112649011921, "grad_norm": 0.5982975363731384, "learning_rate": 3.643326860645521e-05, "loss": 0.7085, "step": 892 }, { "epoch": 1.1420913673093849, "grad_norm": 0.6179444789886475, "learning_rate": 3.642435294832692e-05, "loss": 0.7244, "step": 893 }, { "epoch": 1.1433714697175774, "grad_norm": 0.6015804409980774, "learning_rate": 3.641542738964676e-05, "loss": 0.7372, "step": 894 }, { "epoch": 1.14465157212577, "grad_norm": 0.6817703247070312, "learning_rate": 3.640649193654102e-05, "loss": 0.7725, "step": 895 }, { "epoch": 1.1459316745339627, "grad_norm": 0.6058518290519714, "learning_rate": 3.639754659514281e-05, "loss": 0.7433, "step": 896 }, { "epoch": 1.1472117769421555, "grad_norm": 0.7060476541519165, "learning_rate": 3.638859137159199e-05, "loss": 0.7336, "step": 897 }, { "epoch": 1.148491879350348, "grad_norm": 0.6474248170852661, "learning_rate": 3.6379626272035233e-05, "loss": 0.7502, "step": 898 }, { "epoch": 1.1497719817585406, "grad_norm": 0.7358543872833252, "learning_rate": 3.637065130262599e-05, "loss": 0.7155, "step": 899 }, { "epoch": 1.1510520841667333, "grad_norm": 0.7459300756454468, "learning_rate": 3.636166646952448e-05, "loss": 0.7739, "step": 900 }, { "epoch": 1.1510520841667333, "eval_loss": 0.01201329194009304, "eval_runtime": 10.8486, "eval_samples_per_second": 45.72, "eval_steps_per_second": 5.715, "step": 900 }, { "epoch": 1.152332186574926, "grad_norm": 0.6569747924804688, "learning_rate": 3.635267177889767e-05, "loss": 0.7462, "step": 901 }, { "epoch": 1.1536122889831186, "grad_norm": 0.6367251873016357, "learning_rate": 3.6343667236919336e-05, "loss": 0.7315, "step": 902 }, { "epoch": 1.1548923913913114, "grad_norm": 0.6607640981674194, "learning_rate": 3.633465284976998e-05, "loss": 0.7316, "step": 903 }, { "epoch": 1.156172493799504, "grad_norm": 0.6306076645851135, "learning_rate": 3.632562862363688e-05, "loss": 0.7328, "step": 904 }, { "epoch": 1.1574525962076967, "grad_norm": 0.6793370842933655, "learning_rate": 3.6316594564714055e-05, "loss": 0.7533, "step": 905 }, { "epoch": 1.1587326986158892, "grad_norm": 0.7186464667320251, "learning_rate": 3.630755067920229e-05, "loss": 0.735, "step": 906 }, { "epoch": 1.160012801024082, "grad_norm": 0.6464977264404297, "learning_rate": 3.629849697330911e-05, "loss": 0.7214, "step": 907 }, { "epoch": 1.1612929034322745, "grad_norm": 0.6474738121032715, "learning_rate": 3.6289433453248755e-05, "loss": 0.7394, "step": 908 }, { "epoch": 1.1625730058404673, "grad_norm": 0.7385799884796143, "learning_rate": 3.6280360125242234e-05, "loss": 0.7385, "step": 909 }, { "epoch": 1.1638531082486598, "grad_norm": 0.6468353271484375, "learning_rate": 3.6271276995517275e-05, "loss": 0.7333, "step": 910 }, { "epoch": 1.1651332106568526, "grad_norm": 0.6115081310272217, "learning_rate": 3.626218407030834e-05, "loss": 0.7124, "step": 911 }, { "epoch": 1.1664133130650451, "grad_norm": 0.6233425140380859, "learning_rate": 3.62530813558566e-05, "loss": 0.7274, "step": 912 }, { "epoch": 1.167693415473238, "grad_norm": 0.6084201335906982, "learning_rate": 3.6243968858409955e-05, "loss": 0.6875, "step": 913 }, { "epoch": 1.1689735178814304, "grad_norm": 0.6146586537361145, "learning_rate": 3.623484658422302e-05, "loss": 0.746, "step": 914 }, { "epoch": 1.1702536202896232, "grad_norm": 0.6179696321487427, "learning_rate": 3.622571453955712e-05, "loss": 0.715, "step": 915 }, { "epoch": 1.1715337226978157, "grad_norm": 0.6410030722618103, "learning_rate": 3.6216572730680285e-05, "loss": 0.7224, "step": 916 }, { "epoch": 1.1728138251060085, "grad_norm": 0.706678032875061, "learning_rate": 3.620742116386724e-05, "loss": 0.7428, "step": 917 }, { "epoch": 1.174093927514201, "grad_norm": 0.5854217410087585, "learning_rate": 3.6198259845399424e-05, "loss": 0.7092, "step": 918 }, { "epoch": 1.1753740299223938, "grad_norm": 0.712439775466919, "learning_rate": 3.618908878156496e-05, "loss": 0.7472, "step": 919 }, { "epoch": 1.1766541323305864, "grad_norm": 0.6230387687683105, "learning_rate": 3.617990797865866e-05, "loss": 0.7331, "step": 920 }, { "epoch": 1.1779342347387791, "grad_norm": 0.6859497427940369, "learning_rate": 3.617071744298201e-05, "loss": 0.741, "step": 921 }, { "epoch": 1.1792143371469717, "grad_norm": 0.6405500173568726, "learning_rate": 3.6161517180843204e-05, "loss": 0.755, "step": 922 }, { "epoch": 1.1804944395551644, "grad_norm": 0.6109355688095093, "learning_rate": 3.615230719855709e-05, "loss": 0.7578, "step": 923 }, { "epoch": 1.1817745419633572, "grad_norm": 0.6397739052772522, "learning_rate": 3.614308750244518e-05, "loss": 0.7348, "step": 924 }, { "epoch": 1.1830546443715497, "grad_norm": 0.596720814704895, "learning_rate": 3.613385809883569e-05, "loss": 0.7053, "step": 925 }, { "epoch": 1.1843347467797423, "grad_norm": 0.6623912453651428, "learning_rate": 3.6124618994063446e-05, "loss": 0.739, "step": 926 }, { "epoch": 1.185614849187935, "grad_norm": 0.6404293775558472, "learning_rate": 3.611537019446999e-05, "loss": 0.7206, "step": 927 }, { "epoch": 1.1868949515961278, "grad_norm": 0.6415302157402039, "learning_rate": 3.610611170640347e-05, "loss": 0.7599, "step": 928 }, { "epoch": 1.1881750540043203, "grad_norm": 0.6325163245201111, "learning_rate": 3.6096843536218714e-05, "loss": 0.7226, "step": 929 }, { "epoch": 1.189455156412513, "grad_norm": 0.6508901715278625, "learning_rate": 3.608756569027719e-05, "loss": 0.7508, "step": 930 }, { "epoch": 1.189455156412513, "eval_loss": 0.011997492983937263, "eval_runtime": 10.831, "eval_samples_per_second": 45.794, "eval_steps_per_second": 5.724, "step": 930 }, { "epoch": 1.1907352588207056, "grad_norm": 0.653530478477478, "learning_rate": 3.607827817494699e-05, "loss": 0.7326, "step": 931 }, { "epoch": 1.1920153612288984, "grad_norm": 0.6009781360626221, "learning_rate": 3.6068980996602874e-05, "loss": 0.7414, "step": 932 }, { "epoch": 1.193295463637091, "grad_norm": 0.6281853318214417, "learning_rate": 3.605967416162619e-05, "loss": 0.7062, "step": 933 }, { "epoch": 1.1945755660452837, "grad_norm": 0.6202437877655029, "learning_rate": 3.605035767640497e-05, "loss": 0.6771, "step": 934 }, { "epoch": 1.1958556684534762, "grad_norm": 0.6261670589447021, "learning_rate": 3.604103154733382e-05, "loss": 0.7125, "step": 935 }, { "epoch": 1.197135770861669, "grad_norm": 0.6848472356796265, "learning_rate": 3.6031695780813994e-05, "loss": 0.7413, "step": 936 }, { "epoch": 1.1984158732698615, "grad_norm": 0.6595590710639954, "learning_rate": 3.602235038325335e-05, "loss": 0.7272, "step": 937 }, { "epoch": 1.1996959756780543, "grad_norm": 0.6647142171859741, "learning_rate": 3.601299536106636e-05, "loss": 0.6955, "step": 938 }, { "epoch": 1.2009760780862468, "grad_norm": 0.6085090637207031, "learning_rate": 3.60036307206741e-05, "loss": 0.7304, "step": 939 }, { "epoch": 1.2022561804944396, "grad_norm": 0.7456724643707275, "learning_rate": 3.5994256468504245e-05, "loss": 0.7545, "step": 940 }, { "epoch": 1.2035362829026321, "grad_norm": 0.6394507884979248, "learning_rate": 3.598487261099108e-05, "loss": 0.7044, "step": 941 }, { "epoch": 1.204816385310825, "grad_norm": 0.5928666591644287, "learning_rate": 3.597547915457547e-05, "loss": 0.7002, "step": 942 }, { "epoch": 1.2060964877190175, "grad_norm": 0.6246052980422974, "learning_rate": 3.596607610570487e-05, "loss": 0.7465, "step": 943 }, { "epoch": 1.2073765901272102, "grad_norm": 0.6777945160865784, "learning_rate": 3.5956663470833326e-05, "loss": 0.7406, "step": 944 }, { "epoch": 1.2086566925354028, "grad_norm": 0.6257613897323608, "learning_rate": 3.594724125642145e-05, "loss": 0.6978, "step": 945 }, { "epoch": 1.2099367949435955, "grad_norm": 0.6669995784759521, "learning_rate": 3.593780946893645e-05, "loss": 0.7464, "step": 946 }, { "epoch": 1.211216897351788, "grad_norm": 0.6547150015830994, "learning_rate": 3.592836811485209e-05, "loss": 0.7196, "step": 947 }, { "epoch": 1.2124969997599808, "grad_norm": 0.5924673080444336, "learning_rate": 3.59189172006487e-05, "loss": 0.7623, "step": 948 }, { "epoch": 1.2137771021681734, "grad_norm": 0.5863516330718994, "learning_rate": 3.5909456732813175e-05, "loss": 0.7276, "step": 949 }, { "epoch": 1.2150572045763661, "grad_norm": 0.6385282278060913, "learning_rate": 3.589998671783897e-05, "loss": 0.7209, "step": 950 }, { "epoch": 1.2163373069845589, "grad_norm": 0.6384835839271545, "learning_rate": 3.589050716222609e-05, "loss": 0.7634, "step": 951 }, { "epoch": 1.2176174093927514, "grad_norm": 0.6587206125259399, "learning_rate": 3.588101807248109e-05, "loss": 0.7446, "step": 952 }, { "epoch": 1.218897511800944, "grad_norm": 0.6326109170913696, "learning_rate": 3.587151945511707e-05, "loss": 0.6902, "step": 953 }, { "epoch": 1.2201776142091367, "grad_norm": 0.6003281474113464, "learning_rate": 3.586201131665366e-05, "loss": 0.7207, "step": 954 }, { "epoch": 1.2214577166173295, "grad_norm": 0.605811595916748, "learning_rate": 3.585249366361703e-05, "loss": 0.727, "step": 955 }, { "epoch": 1.222737819025522, "grad_norm": 0.6090505123138428, "learning_rate": 3.58429665025399e-05, "loss": 0.7127, "step": 956 }, { "epoch": 1.2240179214337146, "grad_norm": 0.6559271216392517, "learning_rate": 3.583342983996149e-05, "loss": 0.7165, "step": 957 }, { "epoch": 1.2252980238419073, "grad_norm": 0.6495171189308167, "learning_rate": 3.5823883682427545e-05, "loss": 0.715, "step": 958 }, { "epoch": 1.2265781262501, "grad_norm": 0.6958083510398865, "learning_rate": 3.5814328036490346e-05, "loss": 0.7607, "step": 959 }, { "epoch": 1.2278582286582926, "grad_norm": 0.6588174104690552, "learning_rate": 3.5804762908708665e-05, "loss": 0.7227, "step": 960 }, { "epoch": 1.2278582286582926, "eval_loss": 0.011964739300310612, "eval_runtime": 10.8252, "eval_samples_per_second": 45.819, "eval_steps_per_second": 5.727, "step": 960 }, { "epoch": 1.2291383310664854, "grad_norm": 0.6300966739654541, "learning_rate": 3.5795188305647786e-05, "loss": 0.6902, "step": 961 }, { "epoch": 1.230418433474678, "grad_norm": 0.6609377861022949, "learning_rate": 3.5785604233879515e-05, "loss": 0.7238, "step": 962 }, { "epoch": 1.2316985358828707, "grad_norm": 0.6768269538879395, "learning_rate": 3.577601069998214e-05, "loss": 0.7112, "step": 963 }, { "epoch": 1.2329786382910632, "grad_norm": 0.6381678581237793, "learning_rate": 3.5766407710540435e-05, "loss": 0.7304, "step": 964 }, { "epoch": 1.234258740699256, "grad_norm": 0.6308141350746155, "learning_rate": 3.575679527214569e-05, "loss": 0.7418, "step": 965 }, { "epoch": 1.2355388431074485, "grad_norm": 0.6880090832710266, "learning_rate": 3.5747173391395665e-05, "loss": 0.7645, "step": 966 }, { "epoch": 1.2368189455156413, "grad_norm": 0.6165257692337036, "learning_rate": 3.5737542074894595e-05, "loss": 0.7046, "step": 967 }, { "epoch": 1.2380990479238339, "grad_norm": 0.6735715866088867, "learning_rate": 3.57279013292532e-05, "loss": 0.7337, "step": 968 }, { "epoch": 1.2393791503320266, "grad_norm": 0.6188624501228333, "learning_rate": 3.571825116108868e-05, "loss": 0.7185, "step": 969 }, { "epoch": 1.2406592527402192, "grad_norm": 0.7257860898971558, "learning_rate": 3.570859157702469e-05, "loss": 0.7116, "step": 970 }, { "epoch": 1.241939355148412, "grad_norm": 0.700437068939209, "learning_rate": 3.569892258369135e-05, "loss": 0.7252, "step": 971 }, { "epoch": 1.2432194575566045, "grad_norm": 0.7349070906639099, "learning_rate": 3.568924418772524e-05, "loss": 0.718, "step": 972 }, { "epoch": 1.2444995599647972, "grad_norm": 0.637186586856842, "learning_rate": 3.567955639576939e-05, "loss": 0.7161, "step": 973 }, { "epoch": 1.2457796623729898, "grad_norm": 0.6284525990486145, "learning_rate": 3.56698592144733e-05, "loss": 0.7388, "step": 974 }, { "epoch": 1.2470597647811825, "grad_norm": 0.7157219648361206, "learning_rate": 3.5660152650492874e-05, "loss": 0.7247, "step": 975 }, { "epoch": 1.248339867189375, "grad_norm": 0.7407729625701904, "learning_rate": 3.565043671049049e-05, "loss": 0.7587, "step": 976 }, { "epoch": 1.2496199695975678, "grad_norm": 0.6328476667404175, "learning_rate": 3.564071140113495e-05, "loss": 0.6988, "step": 977 }, { "epoch": 1.2509000720057606, "grad_norm": 0.6791459918022156, "learning_rate": 3.563097672910149e-05, "loss": 0.7544, "step": 978 }, { "epoch": 1.2521801744139531, "grad_norm": 0.6767594814300537, "learning_rate": 3.562123270107177e-05, "loss": 0.7559, "step": 979 }, { "epoch": 1.2534602768221457, "grad_norm": 0.6203661561012268, "learning_rate": 3.561147932373387e-05, "loss": 0.724, "step": 980 }, { "epoch": 1.2547403792303384, "grad_norm": 0.6236318349838257, "learning_rate": 3.5601716603782295e-05, "loss": 0.7418, "step": 981 }, { "epoch": 1.2560204816385312, "grad_norm": 0.6532002091407776, "learning_rate": 3.559194454791795e-05, "loss": 0.7387, "step": 982 }, { "epoch": 1.2573005840467237, "grad_norm": 0.6847975254058838, "learning_rate": 3.558216316284815e-05, "loss": 0.7529, "step": 983 }, { "epoch": 1.2585806864549163, "grad_norm": 0.6952961087226868, "learning_rate": 3.557237245528662e-05, "loss": 0.7284, "step": 984 }, { "epoch": 1.259860788863109, "grad_norm": 0.6524568796157837, "learning_rate": 3.556257243195349e-05, "loss": 0.7111, "step": 985 }, { "epoch": 1.2611408912713018, "grad_norm": 0.7332265973091125, "learning_rate": 3.555276309957528e-05, "loss": 0.733, "step": 986 }, { "epoch": 1.2624209936794943, "grad_norm": 0.6487500071525574, "learning_rate": 3.554294446488488e-05, "loss": 0.7473, "step": 987 }, { "epoch": 1.2637010960876869, "grad_norm": 0.6780820488929749, "learning_rate": 3.55331165346216e-05, "loss": 0.7353, "step": 988 }, { "epoch": 1.2649811984958796, "grad_norm": 0.6837990283966064, "learning_rate": 3.5523279315531084e-05, "loss": 0.7117, "step": 989 }, { "epoch": 1.2662613009040724, "grad_norm": 0.641559898853302, "learning_rate": 3.55134328143654e-05, "loss": 0.6989, "step": 990 }, { "epoch": 1.2662613009040724, "eval_loss": 0.011943795718252659, "eval_runtime": 10.8281, "eval_samples_per_second": 45.807, "eval_steps_per_second": 5.726, "step": 990 }, { "epoch": 1.267541403312265, "grad_norm": 0.7196192741394043, "learning_rate": 3.550357703788295e-05, "loss": 0.7338, "step": 991 }, { "epoch": 1.2688215057204577, "grad_norm": 0.6231567859649658, "learning_rate": 3.5493711992848536e-05, "loss": 0.7572, "step": 992 }, { "epoch": 1.2701016081286503, "grad_norm": 0.666607141494751, "learning_rate": 3.5483837686033284e-05, "loss": 0.709, "step": 993 }, { "epoch": 1.271381710536843, "grad_norm": 0.6255402565002441, "learning_rate": 3.547395412421471e-05, "loss": 0.71, "step": 994 }, { "epoch": 1.2726618129450356, "grad_norm": 0.6895260810852051, "learning_rate": 3.546406131417666e-05, "loss": 0.7424, "step": 995 }, { "epoch": 1.2739419153532283, "grad_norm": 0.7269278168678284, "learning_rate": 3.5454159262709354e-05, "loss": 0.7179, "step": 996 }, { "epoch": 1.2752220177614209, "grad_norm": 0.6350796222686768, "learning_rate": 3.544424797660931e-05, "loss": 0.7251, "step": 997 }, { "epoch": 1.2765021201696136, "grad_norm": 0.6415387988090515, "learning_rate": 3.543432746267943e-05, "loss": 0.7502, "step": 998 }, { "epoch": 1.2777822225778062, "grad_norm": 0.6302523612976074, "learning_rate": 3.542439772772893e-05, "loss": 0.7094, "step": 999 }, { "epoch": 1.279062324985999, "grad_norm": 0.6089184284210205, "learning_rate": 3.541445877857335e-05, "loss": 0.7144, "step": 1000 }, { "epoch": 1.2803424273941915, "grad_norm": 0.639612078666687, "learning_rate": 3.540451062203457e-05, "loss": 0.6652, "step": 1001 }, { "epoch": 1.2816225298023842, "grad_norm": 0.7329027652740479, "learning_rate": 3.539455326494078e-05, "loss": 0.7331, "step": 1002 }, { "epoch": 1.2829026322105768, "grad_norm": 0.5882426500320435, "learning_rate": 3.5384586714126486e-05, "loss": 0.6926, "step": 1003 }, { "epoch": 1.2841827346187695, "grad_norm": 0.6871622204780579, "learning_rate": 3.5374610976432496e-05, "loss": 0.7433, "step": 1004 }, { "epoch": 1.2854628370269623, "grad_norm": 0.6158824563026428, "learning_rate": 3.5364626058705944e-05, "loss": 0.7034, "step": 1005 }, { "epoch": 1.2867429394351548, "grad_norm": 0.6488764882087708, "learning_rate": 3.535463196780025e-05, "loss": 0.752, "step": 1006 }, { "epoch": 1.2880230418433474, "grad_norm": 0.6519235372543335, "learning_rate": 3.534462871057514e-05, "loss": 0.7448, "step": 1007 }, { "epoch": 1.2893031442515401, "grad_norm": 0.6193985342979431, "learning_rate": 3.5334616293896596e-05, "loss": 0.7201, "step": 1008 }, { "epoch": 1.290583246659733, "grad_norm": 0.587981641292572, "learning_rate": 3.532459472463695e-05, "loss": 0.7323, "step": 1009 }, { "epoch": 1.2918633490679254, "grad_norm": 0.59144526720047, "learning_rate": 3.531456400967477e-05, "loss": 0.7284, "step": 1010 }, { "epoch": 1.293143451476118, "grad_norm": 0.6190255880355835, "learning_rate": 3.530452415589491e-05, "loss": 0.7427, "step": 1011 }, { "epoch": 1.2944235538843107, "grad_norm": 0.6405760645866394, "learning_rate": 3.52944751701885e-05, "loss": 0.7389, "step": 1012 }, { "epoch": 1.2957036562925035, "grad_norm": 0.6301907896995544, "learning_rate": 3.528441705945294e-05, "loss": 0.7452, "step": 1013 }, { "epoch": 1.296983758700696, "grad_norm": 0.610808253288269, "learning_rate": 3.52743498305919e-05, "loss": 0.7202, "step": 1014 }, { "epoch": 1.2982638611088886, "grad_norm": 0.6241909861564636, "learning_rate": 3.526427349051528e-05, "loss": 0.7354, "step": 1015 }, { "epoch": 1.2995439635170813, "grad_norm": 0.5971837639808655, "learning_rate": 3.525418804613928e-05, "loss": 0.6881, "step": 1016 }, { "epoch": 1.300824065925274, "grad_norm": 0.5995813012123108, "learning_rate": 3.52440935043863e-05, "loss": 0.6979, "step": 1017 }, { "epoch": 1.3021041683334666, "grad_norm": 0.703272819519043, "learning_rate": 3.523398987218502e-05, "loss": 0.7622, "step": 1018 }, { "epoch": 1.3033842707416594, "grad_norm": 0.6928847432136536, "learning_rate": 3.5223877156470333e-05, "loss": 0.7324, "step": 1019 }, { "epoch": 1.304664373149852, "grad_norm": 0.746273934841156, "learning_rate": 3.521375536418339e-05, "loss": 0.7471, "step": 1020 }, { "epoch": 1.304664373149852, "eval_loss": 0.011940889991819859, "eval_runtime": 10.8334, "eval_samples_per_second": 45.784, "eval_steps_per_second": 5.723, "step": 1020 }, { "epoch": 1.3059444755580447, "grad_norm": 0.6955692768096924, "learning_rate": 3.520362450227155e-05, "loss": 0.7192, "step": 1021 }, { "epoch": 1.3072245779662373, "grad_norm": 0.6236073970794678, "learning_rate": 3.519348457768844e-05, "loss": 0.7056, "step": 1022 }, { "epoch": 1.30850468037443, "grad_norm": 0.6319799423217773, "learning_rate": 3.518333559739384e-05, "loss": 0.7278, "step": 1023 }, { "epoch": 1.3097847827826226, "grad_norm": 0.6991655826568604, "learning_rate": 3.5173177568353796e-05, "loss": 0.7334, "step": 1024 }, { "epoch": 1.3110648851908153, "grad_norm": 0.6507253646850586, "learning_rate": 3.5163010497540556e-05, "loss": 0.7064, "step": 1025 }, { "epoch": 1.3123449875990079, "grad_norm": 0.6370417475700378, "learning_rate": 3.515283439193257e-05, "loss": 0.71, "step": 1026 }, { "epoch": 1.3136250900072006, "grad_norm": 0.6877231597900391, "learning_rate": 3.514264925851448e-05, "loss": 0.7485, "step": 1027 }, { "epoch": 1.3149051924153932, "grad_norm": 0.6662914752960205, "learning_rate": 3.5132455104277135e-05, "loss": 0.743, "step": 1028 }, { "epoch": 1.316185294823586, "grad_norm": 0.6527225375175476, "learning_rate": 3.5122251936217575e-05, "loss": 0.7124, "step": 1029 }, { "epoch": 1.3174653972317785, "grad_norm": 0.6729642152786255, "learning_rate": 3.511203976133903e-05, "loss": 0.726, "step": 1030 }, { "epoch": 1.3187454996399712, "grad_norm": 0.6522324681282043, "learning_rate": 3.51018185866509e-05, "loss": 0.7289, "step": 1031 }, { "epoch": 1.3200256020481638, "grad_norm": 0.663841187953949, "learning_rate": 3.509158841916877e-05, "loss": 0.7223, "step": 1032 }, { "epoch": 1.3213057044563565, "grad_norm": 0.636076033115387, "learning_rate": 3.50813492659144e-05, "loss": 0.7264, "step": 1033 }, { "epoch": 1.322585806864549, "grad_norm": 0.666597843170166, "learning_rate": 3.507110113391571e-05, "loss": 0.7054, "step": 1034 }, { "epoch": 1.3238659092727418, "grad_norm": 0.6378565430641174, "learning_rate": 3.50608440302068e-05, "loss": 0.7035, "step": 1035 }, { "epoch": 1.3251460116809346, "grad_norm": 0.650204598903656, "learning_rate": 3.5050577961827904e-05, "loss": 0.7078, "step": 1036 }, { "epoch": 1.3264261140891271, "grad_norm": 0.6551227569580078, "learning_rate": 3.504030293582543e-05, "loss": 0.7501, "step": 1037 }, { "epoch": 1.3277062164973197, "grad_norm": 0.6497569680213928, "learning_rate": 3.5030018959251915e-05, "loss": 0.7048, "step": 1038 }, { "epoch": 1.3289863189055124, "grad_norm": 0.703510046005249, "learning_rate": 3.5019726039166055e-05, "loss": 0.7359, "step": 1039 }, { "epoch": 1.3302664213137052, "grad_norm": 0.6817246675491333, "learning_rate": 3.500942418263267e-05, "loss": 0.7005, "step": 1040 }, { "epoch": 1.3315465237218977, "grad_norm": 0.7863104939460754, "learning_rate": 3.499911339672274e-05, "loss": 0.7522, "step": 1041 }, { "epoch": 1.3328266261300903, "grad_norm": 0.638771653175354, "learning_rate": 3.498879368851335e-05, "loss": 0.7106, "step": 1042 }, { "epoch": 1.334106728538283, "grad_norm": 0.6441402435302734, "learning_rate": 3.497846506508771e-05, "loss": 0.7382, "step": 1043 }, { "epoch": 1.3353868309464758, "grad_norm": 0.5955315232276917, "learning_rate": 3.496812753353516e-05, "loss": 0.732, "step": 1044 }, { "epoch": 1.3366669333546684, "grad_norm": 0.6294196248054504, "learning_rate": 3.495778110095114e-05, "loss": 0.7579, "step": 1045 }, { "epoch": 1.337947035762861, "grad_norm": 0.643982470035553, "learning_rate": 3.494742577443723e-05, "loss": 0.7588, "step": 1046 }, { "epoch": 1.3392271381710537, "grad_norm": 0.6264019012451172, "learning_rate": 3.493706156110107e-05, "loss": 0.7379, "step": 1047 }, { "epoch": 1.3405072405792464, "grad_norm": 0.6815388202667236, "learning_rate": 3.492668846805644e-05, "loss": 0.7185, "step": 1048 }, { "epoch": 1.341787342987439, "grad_norm": 0.6314342021942139, "learning_rate": 3.491630650242319e-05, "loss": 0.7261, "step": 1049 }, { "epoch": 1.3430674453956317, "grad_norm": 0.5777370929718018, "learning_rate": 3.4905915671327274e-05, "loss": 0.742, "step": 1050 }, { "epoch": 1.3430674453956317, "eval_loss": 0.011894307099282742, "eval_runtime": 10.8212, "eval_samples_per_second": 45.836, "eval_steps_per_second": 5.73, "step": 1050 }, { "epoch": 1.3443475478038243, "grad_norm": 0.5540257096290588, "learning_rate": 3.489551598190072e-05, "loss": 0.7038, "step": 1051 }, { "epoch": 1.345627650212017, "grad_norm": 0.633642315864563, "learning_rate": 3.488510744128164e-05, "loss": 0.7181, "step": 1052 }, { "epoch": 1.3469077526202096, "grad_norm": 0.5957219004631042, "learning_rate": 3.4874690056614225e-05, "loss": 0.7617, "step": 1053 }, { "epoch": 1.3481878550284023, "grad_norm": 0.6198498606681824, "learning_rate": 3.4864263835048735e-05, "loss": 0.7107, "step": 1054 }, { "epoch": 1.3494679574365949, "grad_norm": 0.6253262162208557, "learning_rate": 3.48538287837415e-05, "loss": 0.7729, "step": 1055 }, { "epoch": 1.3507480598447876, "grad_norm": 0.6212433576583862, "learning_rate": 3.484338490985489e-05, "loss": 0.7112, "step": 1056 }, { "epoch": 1.3520281622529802, "grad_norm": 0.5720719695091248, "learning_rate": 3.4832932220557355e-05, "loss": 0.7236, "step": 1057 }, { "epoch": 1.353308264661173, "grad_norm": 0.6214074492454529, "learning_rate": 3.4822470723023385e-05, "loss": 0.7011, "step": 1058 }, { "epoch": 1.3545883670693655, "grad_norm": 0.621953547000885, "learning_rate": 3.481200042443352e-05, "loss": 0.7842, "step": 1059 }, { "epoch": 1.3558684694775582, "grad_norm": 0.601488471031189, "learning_rate": 3.480152133197433e-05, "loss": 0.7494, "step": 1060 }, { "epoch": 1.3571485718857508, "grad_norm": 0.6324599981307983, "learning_rate": 3.479103345283843e-05, "loss": 0.7281, "step": 1061 }, { "epoch": 1.3584286742939435, "grad_norm": 0.5631807446479797, "learning_rate": 3.478053679422447e-05, "loss": 0.6959, "step": 1062 }, { "epoch": 1.3597087767021363, "grad_norm": 0.6149842739105225, "learning_rate": 3.4770031363337126e-05, "loss": 0.7374, "step": 1063 }, { "epoch": 1.3609888791103288, "grad_norm": 0.6333210468292236, "learning_rate": 3.475951716738708e-05, "loss": 0.7033, "step": 1064 }, { "epoch": 1.3622689815185214, "grad_norm": 0.6083963513374329, "learning_rate": 3.474899421359103e-05, "loss": 0.7021, "step": 1065 }, { "epoch": 1.3635490839267141, "grad_norm": 0.6221580505371094, "learning_rate": 3.473846250917172e-05, "loss": 0.7283, "step": 1066 }, { "epoch": 1.364829186334907, "grad_norm": 0.6208587288856506, "learning_rate": 3.472792206135786e-05, "loss": 0.7337, "step": 1067 }, { "epoch": 1.3661092887430994, "grad_norm": 0.660995602607727, "learning_rate": 3.4717372877384175e-05, "loss": 0.7227, "step": 1068 }, { "epoch": 1.367389391151292, "grad_norm": 0.633240282535553, "learning_rate": 3.4706814964491395e-05, "loss": 0.7324, "step": 1069 }, { "epoch": 1.3686694935594848, "grad_norm": 0.740360677242279, "learning_rate": 3.469624832992623e-05, "loss": 0.7286, "step": 1070 }, { "epoch": 1.3699495959676775, "grad_norm": 0.6104412078857422, "learning_rate": 3.4685672980941384e-05, "loss": 0.7155, "step": 1071 }, { "epoch": 1.37122969837587, "grad_norm": 0.6899016499519348, "learning_rate": 3.4675088924795535e-05, "loss": 0.698, "step": 1072 }, { "epoch": 1.3725098007840626, "grad_norm": 0.6214810013771057, "learning_rate": 3.466449616875335e-05, "loss": 0.768, "step": 1073 }, { "epoch": 1.3737899031922554, "grad_norm": 0.7415969371795654, "learning_rate": 3.4653894720085443e-05, "loss": 0.7356, "step": 1074 }, { "epoch": 1.3750700056004481, "grad_norm": 0.6360346078872681, "learning_rate": 3.464328458606843e-05, "loss": 0.7339, "step": 1075 }, { "epoch": 1.3763501080086407, "grad_norm": 0.7460790276527405, "learning_rate": 3.463266577398485e-05, "loss": 0.7524, "step": 1076 }, { "epoch": 1.3776302104168334, "grad_norm": 0.6799301505088806, "learning_rate": 3.462203829112323e-05, "loss": 0.7217, "step": 1077 }, { "epoch": 1.378910312825026, "grad_norm": 0.7293802499771118, "learning_rate": 3.4611402144778027e-05, "loss": 0.7501, "step": 1078 }, { "epoch": 1.3801904152332187, "grad_norm": 0.6283996105194092, "learning_rate": 3.460075734224966e-05, "loss": 0.7062, "step": 1079 }, { "epoch": 1.3814705176414113, "grad_norm": 0.744900643825531, "learning_rate": 3.459010389084448e-05, "loss": 0.7323, "step": 1080 }, { "epoch": 1.3814705176414113, "eval_loss": 0.011888692155480385, "eval_runtime": 10.8204, "eval_samples_per_second": 45.839, "eval_steps_per_second": 5.73, "step": 1080 }, { "epoch": 1.382750620049604, "grad_norm": 0.6258221864700317, "learning_rate": 3.457944179787477e-05, "loss": 0.732, "step": 1081 }, { "epoch": 1.3840307224577966, "grad_norm": 0.7455996870994568, "learning_rate": 3.4568771070658764e-05, "loss": 0.7384, "step": 1082 }, { "epoch": 1.3853108248659893, "grad_norm": 0.6790741682052612, "learning_rate": 3.45580917165206e-05, "loss": 0.7187, "step": 1083 }, { "epoch": 1.3865909272741819, "grad_norm": 0.7180479168891907, "learning_rate": 3.4547403742790346e-05, "loss": 0.763, "step": 1084 }, { "epoch": 1.3878710296823746, "grad_norm": 0.6763840913772583, "learning_rate": 3.4536707156803996e-05, "loss": 0.7108, "step": 1085 }, { "epoch": 1.3891511320905672, "grad_norm": 0.7159371972084045, "learning_rate": 3.452600196590344e-05, "loss": 0.7035, "step": 1086 }, { "epoch": 1.39043123449876, "grad_norm": 0.64292311668396, "learning_rate": 3.4515288177436474e-05, "loss": 0.7282, "step": 1087 }, { "epoch": 1.3917113369069525, "grad_norm": 0.708309531211853, "learning_rate": 3.450456579875682e-05, "loss": 0.73, "step": 1088 }, { "epoch": 1.3929914393151452, "grad_norm": 0.6651067137718201, "learning_rate": 3.4493834837224067e-05, "loss": 0.7334, "step": 1089 }, { "epoch": 1.394271541723338, "grad_norm": 0.6737949848175049, "learning_rate": 3.44830953002037e-05, "loss": 0.71, "step": 1090 }, { "epoch": 1.3955516441315305, "grad_norm": 0.579788088798523, "learning_rate": 3.44723471950671e-05, "loss": 0.7185, "step": 1091 }, { "epoch": 1.396831746539723, "grad_norm": 0.7158629298210144, "learning_rate": 3.446159052919153e-05, "loss": 0.7259, "step": 1092 }, { "epoch": 1.3981118489479158, "grad_norm": 0.6628416180610657, "learning_rate": 3.445082530996012e-05, "loss": 0.7808, "step": 1093 }, { "epoch": 1.3993919513561086, "grad_norm": 0.6353318691253662, "learning_rate": 3.4440051544761876e-05, "loss": 0.6881, "step": 1094 }, { "epoch": 1.4006720537643012, "grad_norm": 0.7098138928413391, "learning_rate": 3.442926924099167e-05, "loss": 0.7411, "step": 1095 }, { "epoch": 1.4019521561724937, "grad_norm": 0.6623754501342773, "learning_rate": 3.441847840605023e-05, "loss": 0.7424, "step": 1096 }, { "epoch": 1.4032322585806865, "grad_norm": 0.7072277665138245, "learning_rate": 3.440767904734414e-05, "loss": 0.7579, "step": 1097 }, { "epoch": 1.4045123609888792, "grad_norm": 0.6239615678787231, "learning_rate": 3.439687117228585e-05, "loss": 0.7213, "step": 1098 }, { "epoch": 1.4057924633970718, "grad_norm": 0.6581880450248718, "learning_rate": 3.4386054788293625e-05, "loss": 0.7252, "step": 1099 }, { "epoch": 1.4070725658052643, "grad_norm": 0.5721520781517029, "learning_rate": 3.437522990279161e-05, "loss": 0.7231, "step": 1100 }, { "epoch": 1.408352668213457, "grad_norm": 0.6812596917152405, "learning_rate": 3.436439652320973e-05, "loss": 0.7259, "step": 1101 }, { "epoch": 1.4096327706216498, "grad_norm": 0.6836157441139221, "learning_rate": 3.435355465698381e-05, "loss": 0.7804, "step": 1102 }, { "epoch": 1.4109128730298424, "grad_norm": 0.6757557392120361, "learning_rate": 3.434270431155544e-05, "loss": 0.7438, "step": 1103 }, { "epoch": 1.4121929754380351, "grad_norm": 0.6978136897087097, "learning_rate": 3.433184549437206e-05, "loss": 0.7584, "step": 1104 }, { "epoch": 1.4134730778462277, "grad_norm": 0.6466197967529297, "learning_rate": 3.432097821288692e-05, "loss": 0.7506, "step": 1105 }, { "epoch": 1.4147531802544204, "grad_norm": 0.6686610579490662, "learning_rate": 3.431010247455908e-05, "loss": 0.7326, "step": 1106 }, { "epoch": 1.416033282662613, "grad_norm": 0.6493745446205139, "learning_rate": 3.4299218286853394e-05, "loss": 0.7103, "step": 1107 }, { "epoch": 1.4173133850708057, "grad_norm": 0.6098056435585022, "learning_rate": 3.428832565724053e-05, "loss": 0.7693, "step": 1108 }, { "epoch": 1.4185934874789983, "grad_norm": 0.6214213967323303, "learning_rate": 3.427742459319694e-05, "loss": 0.7364, "step": 1109 }, { "epoch": 1.419873589887191, "grad_norm": 0.6468144655227661, "learning_rate": 3.426651510220488e-05, "loss": 0.7149, "step": 1110 }, { "epoch": 1.419873589887191, "eval_loss": 0.011858620680868626, "eval_runtime": 10.8144, "eval_samples_per_second": 45.865, "eval_steps_per_second": 5.733, "step": 1110 }, { "epoch": 1.4211536922953836, "grad_norm": 0.5441794395446777, "learning_rate": 3.4255597191752365e-05, "loss": 0.6997, "step": 1111 }, { "epoch": 1.4224337947035763, "grad_norm": 0.6870185732841492, "learning_rate": 3.424467086933322e-05, "loss": 0.6852, "step": 1112 }, { "epoch": 1.4237138971117689, "grad_norm": 0.6588074564933777, "learning_rate": 3.423373614244702e-05, "loss": 0.7463, "step": 1113 }, { "epoch": 1.4249939995199616, "grad_norm": 0.6720722913742065, "learning_rate": 3.42227930185991e-05, "loss": 0.6804, "step": 1114 }, { "epoch": 1.4262741019281542, "grad_norm": 0.6890459060668945, "learning_rate": 3.42118415053006e-05, "loss": 0.7552, "step": 1115 }, { "epoch": 1.427554204336347, "grad_norm": 0.6325091123580933, "learning_rate": 3.420088161006837e-05, "loss": 0.7315, "step": 1116 }, { "epoch": 1.4288343067445395, "grad_norm": 0.6969271898269653, "learning_rate": 3.4189913340425054e-05, "loss": 0.7108, "step": 1117 }, { "epoch": 1.4301144091527322, "grad_norm": 0.6649100184440613, "learning_rate": 3.417893670389902e-05, "loss": 0.7129, "step": 1118 }, { "epoch": 1.4313945115609248, "grad_norm": 0.6117990016937256, "learning_rate": 3.4167951708024386e-05, "loss": 0.7243, "step": 1119 }, { "epoch": 1.4326746139691175, "grad_norm": 0.6294746398925781, "learning_rate": 3.4156958360341006e-05, "loss": 0.7066, "step": 1120 }, { "epoch": 1.4339547163773103, "grad_norm": 0.6256268620491028, "learning_rate": 3.414595666839446e-05, "loss": 0.7359, "step": 1121 }, { "epoch": 1.4352348187855029, "grad_norm": 0.5756694078445435, "learning_rate": 3.413494663973606e-05, "loss": 0.7462, "step": 1122 }, { "epoch": 1.4365149211936954, "grad_norm": 0.7117789387702942, "learning_rate": 3.4123928281922865e-05, "loss": 0.7292, "step": 1123 }, { "epoch": 1.4377950236018882, "grad_norm": 0.652121365070343, "learning_rate": 3.41129016025176e-05, "loss": 0.6941, "step": 1124 }, { "epoch": 1.439075126010081, "grad_norm": 0.6118738055229187, "learning_rate": 3.4101866609088755e-05, "loss": 0.6771, "step": 1125 }, { "epoch": 1.4403552284182735, "grad_norm": 0.7171832919120789, "learning_rate": 3.409082330921048e-05, "loss": 0.7454, "step": 1126 }, { "epoch": 1.441635330826466, "grad_norm": 0.7150013446807861, "learning_rate": 3.407977171046267e-05, "loss": 0.751, "step": 1127 }, { "epoch": 1.4429154332346588, "grad_norm": 0.6304430961608887, "learning_rate": 3.4068711820430866e-05, "loss": 0.7218, "step": 1128 }, { "epoch": 1.4441955356428515, "grad_norm": 0.6315369009971619, "learning_rate": 3.405764364670635e-05, "loss": 0.6788, "step": 1129 }, { "epoch": 1.445475638051044, "grad_norm": 0.6245869994163513, "learning_rate": 3.4046567196886076e-05, "loss": 0.7266, "step": 1130 }, { "epoch": 1.4467557404592366, "grad_norm": 0.6458489298820496, "learning_rate": 3.403548247857264e-05, "loss": 0.7156, "step": 1131 }, { "epoch": 1.4480358428674294, "grad_norm": 0.5823201537132263, "learning_rate": 3.402438949937436e-05, "loss": 0.7041, "step": 1132 }, { "epoch": 1.4493159452756221, "grad_norm": 0.6566415429115295, "learning_rate": 3.4013288266905214e-05, "loss": 0.747, "step": 1133 }, { "epoch": 1.4505960476838147, "grad_norm": 0.6050204634666443, "learning_rate": 3.4002178788784834e-05, "loss": 0.7443, "step": 1134 }, { "epoch": 1.4518761500920074, "grad_norm": 0.690113365650177, "learning_rate": 3.399106107263851e-05, "loss": 0.7656, "step": 1135 }, { "epoch": 1.4531562525002, "grad_norm": 0.634456217288971, "learning_rate": 3.39799351260972e-05, "loss": 0.7138, "step": 1136 }, { "epoch": 1.4544363549083927, "grad_norm": 0.6726987957954407, "learning_rate": 3.396880095679749e-05, "loss": 0.7415, "step": 1137 }, { "epoch": 1.4557164573165853, "grad_norm": 0.6116801500320435, "learning_rate": 3.3957658572381654e-05, "loss": 0.7422, "step": 1138 }, { "epoch": 1.456996559724778, "grad_norm": 0.6155052185058594, "learning_rate": 3.394650798049755e-05, "loss": 0.7494, "step": 1139 }, { "epoch": 1.4582766621329706, "grad_norm": 0.6293736696243286, "learning_rate": 3.393534918879869e-05, "loss": 0.7214, "step": 1140 }, { "epoch": 1.4582766621329706, "eval_loss": 0.011847763322293758, "eval_runtime": 10.8318, "eval_samples_per_second": 45.791, "eval_steps_per_second": 5.724, "step": 1140 }, { "epoch": 1.4595567645411633, "grad_norm": 0.6018232703208923, "learning_rate": 3.392418220494423e-05, "loss": 0.6992, "step": 1141 }, { "epoch": 1.4608368669493559, "grad_norm": 0.6392772793769836, "learning_rate": 3.3913007036598936e-05, "loss": 0.7247, "step": 1142 }, { "epoch": 1.4621169693575486, "grad_norm": 0.5587735176086426, "learning_rate": 3.390182369143319e-05, "loss": 0.7088, "step": 1143 }, { "epoch": 1.4633970717657412, "grad_norm": 0.6419893503189087, "learning_rate": 3.389063217712299e-05, "loss": 0.6749, "step": 1144 }, { "epoch": 1.464677174173934, "grad_norm": 0.5953524708747864, "learning_rate": 3.3879432501349945e-05, "loss": 0.7109, "step": 1145 }, { "epoch": 1.4659572765821265, "grad_norm": 0.6553881168365479, "learning_rate": 3.386822467180124e-05, "loss": 0.7357, "step": 1146 }, { "epoch": 1.4672373789903193, "grad_norm": 0.601859986782074, "learning_rate": 3.3857008696169705e-05, "loss": 0.7364, "step": 1147 }, { "epoch": 1.468517481398512, "grad_norm": 0.6729167699813843, "learning_rate": 3.384578458215371e-05, "loss": 0.7491, "step": 1148 }, { "epoch": 1.4697975838067046, "grad_norm": 0.6336567401885986, "learning_rate": 3.383455233745727e-05, "loss": 0.7416, "step": 1149 }, { "epoch": 1.471077686214897, "grad_norm": 0.6387529969215393, "learning_rate": 3.38233119697899e-05, "loss": 0.7185, "step": 1150 }, { "epoch": 1.4723577886230899, "grad_norm": 0.5772356390953064, "learning_rate": 3.3812063486866766e-05, "loss": 0.7306, "step": 1151 }, { "epoch": 1.4736378910312826, "grad_norm": 0.6451202034950256, "learning_rate": 3.3800806896408564e-05, "loss": 0.714, "step": 1152 }, { "epoch": 1.4749179934394752, "grad_norm": 0.6001375913619995, "learning_rate": 3.378954220614156e-05, "loss": 0.7366, "step": 1153 }, { "epoch": 1.4761980958476677, "grad_norm": 0.6709045171737671, "learning_rate": 3.3778269423797604e-05, "loss": 0.7475, "step": 1154 }, { "epoch": 1.4774781982558605, "grad_norm": 0.6364221572875977, "learning_rate": 3.376698855711406e-05, "loss": 0.7241, "step": 1155 }, { "epoch": 1.4787583006640532, "grad_norm": 0.6763046979904175, "learning_rate": 3.375569961383387e-05, "loss": 0.6697, "step": 1156 }, { "epoch": 1.4800384030722458, "grad_norm": 0.639137864112854, "learning_rate": 3.374440260170551e-05, "loss": 0.7435, "step": 1157 }, { "epoch": 1.4813185054804383, "grad_norm": 0.6539855599403381, "learning_rate": 3.3733097528482994e-05, "loss": 0.7751, "step": 1158 }, { "epoch": 1.482598607888631, "grad_norm": 0.6638590693473816, "learning_rate": 3.372178440192588e-05, "loss": 0.7445, "step": 1159 }, { "epoch": 1.4838787102968238, "grad_norm": 0.726880669593811, "learning_rate": 3.3710463229799226e-05, "loss": 0.6906, "step": 1160 }, { "epoch": 1.4851588127050164, "grad_norm": 0.6935184001922607, "learning_rate": 3.369913401987364e-05, "loss": 0.7329, "step": 1161 }, { "epoch": 1.4864389151132091, "grad_norm": 0.7429734468460083, "learning_rate": 3.368779677992524e-05, "loss": 0.7127, "step": 1162 }, { "epoch": 1.4877190175214017, "grad_norm": 0.6960635185241699, "learning_rate": 3.367645151773565e-05, "loss": 0.7299, "step": 1163 }, { "epoch": 1.4889991199295944, "grad_norm": 0.6126359105110168, "learning_rate": 3.366509824109201e-05, "loss": 0.7215, "step": 1164 }, { "epoch": 1.490279222337787, "grad_norm": 0.6716033816337585, "learning_rate": 3.365373695778694e-05, "loss": 0.6996, "step": 1165 }, { "epoch": 1.4915593247459797, "grad_norm": 0.6191390156745911, "learning_rate": 3.3642367675618576e-05, "loss": 0.7291, "step": 1166 }, { "epoch": 1.4928394271541723, "grad_norm": 0.6926732659339905, "learning_rate": 3.363099040239055e-05, "loss": 0.6972, "step": 1167 }, { "epoch": 1.494119529562365, "grad_norm": 0.5820816159248352, "learning_rate": 3.3619605145911935e-05, "loss": 0.7238, "step": 1168 }, { "epoch": 1.4953996319705576, "grad_norm": 0.6890411972999573, "learning_rate": 3.360821191399736e-05, "loss": 0.7052, "step": 1169 }, { "epoch": 1.4966797343787503, "grad_norm": 0.6308721899986267, "learning_rate": 3.359681071446685e-05, "loss": 0.7523, "step": 1170 }, { "epoch": 1.4966797343787503, "eval_loss": 0.011831529438495636, "eval_runtime": 10.8133, "eval_samples_per_second": 45.869, "eval_steps_per_second": 5.734, "step": 1170 }, { "epoch": 1.4979598367869429, "grad_norm": 0.625635027885437, "learning_rate": 3.358540155514594e-05, "loss": 0.7298, "step": 1171 }, { "epoch": 1.4992399391951357, "grad_norm": 0.6210200190544128, "learning_rate": 3.357398444386562e-05, "loss": 0.7257, "step": 1172 }, { "epoch": 1.5005200416033282, "grad_norm": 0.6220295429229736, "learning_rate": 3.356255938846234e-05, "loss": 0.7261, "step": 1173 }, { "epoch": 1.501800144011521, "grad_norm": 0.6124227046966553, "learning_rate": 3.3551126396778004e-05, "loss": 0.7632, "step": 1174 }, { "epoch": 1.5030802464197137, "grad_norm": 0.6557436585426331, "learning_rate": 3.3539685476659964e-05, "loss": 0.7005, "step": 1175 }, { "epoch": 1.5043603488279063, "grad_norm": 0.580775797367096, "learning_rate": 3.3528236635961004e-05, "loss": 0.7007, "step": 1176 }, { "epoch": 1.5056404512360988, "grad_norm": 0.5564892888069153, "learning_rate": 3.3516779882539355e-05, "loss": 0.7085, "step": 1177 }, { "epoch": 1.5069205536442916, "grad_norm": 0.607314944267273, "learning_rate": 3.3505315224258675e-05, "loss": 0.719, "step": 1178 }, { "epoch": 1.5082006560524843, "grad_norm": 0.5661142468452454, "learning_rate": 3.349384266898804e-05, "loss": 0.7111, "step": 1179 }, { "epoch": 1.5094807584606769, "grad_norm": 0.5816230773925781, "learning_rate": 3.348236222460196e-05, "loss": 0.7368, "step": 1180 }, { "epoch": 1.5107608608688694, "grad_norm": 0.6284036040306091, "learning_rate": 3.347087389898036e-05, "loss": 0.7318, "step": 1181 }, { "epoch": 1.5120409632770622, "grad_norm": 0.576706051826477, "learning_rate": 3.3459377700008564e-05, "loss": 0.7124, "step": 1182 }, { "epoch": 1.513321065685255, "grad_norm": 0.575192391872406, "learning_rate": 3.34478736355773e-05, "loss": 0.7159, "step": 1183 }, { "epoch": 1.5146011680934475, "grad_norm": 0.6095222234725952, "learning_rate": 3.343636171358271e-05, "loss": 0.7305, "step": 1184 }, { "epoch": 1.51588127050164, "grad_norm": 0.6324830055236816, "learning_rate": 3.3424841941926304e-05, "loss": 0.7361, "step": 1185 }, { "epoch": 1.5171613729098328, "grad_norm": 0.7316963076591492, "learning_rate": 3.3413314328515e-05, "loss": 0.7239, "step": 1186 }, { "epoch": 1.5184414753180255, "grad_norm": 0.6551388502120972, "learning_rate": 3.3401778881261104e-05, "loss": 0.7508, "step": 1187 }, { "epoch": 1.519721577726218, "grad_norm": 0.5726660490036011, "learning_rate": 3.3390235608082276e-05, "loss": 0.7083, "step": 1188 }, { "epoch": 1.5210016801344106, "grad_norm": 0.617388129234314, "learning_rate": 3.337868451690157e-05, "loss": 0.7125, "step": 1189 }, { "epoch": 1.5222817825426034, "grad_norm": 0.5886286497116089, "learning_rate": 3.336712561564738e-05, "loss": 0.7239, "step": 1190 }, { "epoch": 1.5235618849507961, "grad_norm": 0.6524567604064941, "learning_rate": 3.335555891225349e-05, "loss": 0.7474, "step": 1191 }, { "epoch": 1.5248419873589887, "grad_norm": 0.5842376947402954, "learning_rate": 3.334398441465901e-05, "loss": 0.7182, "step": 1192 }, { "epoch": 1.5261220897671812, "grad_norm": 0.7023752927780151, "learning_rate": 3.3332402130808435e-05, "loss": 0.7857, "step": 1193 }, { "epoch": 1.527402192175374, "grad_norm": 0.6121941804885864, "learning_rate": 3.332081206865158e-05, "loss": 0.7033, "step": 1194 }, { "epoch": 1.5286822945835667, "grad_norm": 0.6894810199737549, "learning_rate": 3.3309214236143585e-05, "loss": 0.7374, "step": 1195 }, { "epoch": 1.5299623969917593, "grad_norm": 0.6285365223884583, "learning_rate": 3.329760864124496e-05, "loss": 0.7546, "step": 1196 }, { "epoch": 1.531242499399952, "grad_norm": 0.6261930465698242, "learning_rate": 3.3285995291921515e-05, "loss": 0.7145, "step": 1197 }, { "epoch": 1.5325226018081448, "grad_norm": 0.6478322744369507, "learning_rate": 3.327437419614441e-05, "loss": 0.6797, "step": 1198 }, { "epoch": 1.5338027042163374, "grad_norm": 0.6763138175010681, "learning_rate": 3.326274536189008e-05, "loss": 0.7568, "step": 1199 }, { "epoch": 1.53508280662453, "grad_norm": 0.6303013563156128, "learning_rate": 3.3251108797140314e-05, "loss": 0.7257, "step": 1200 }, { "epoch": 1.53508280662453, "eval_loss": 0.011818733997642994, "eval_runtime": 10.8189, "eval_samples_per_second": 45.846, "eval_steps_per_second": 5.731, "step": 1200 }, { "epoch": 1.5363629090327227, "grad_norm": 0.586087703704834, "learning_rate": 3.323946450988217e-05, "loss": 0.7265, "step": 1201 }, { "epoch": 1.5376430114409154, "grad_norm": 0.6344309449195862, "learning_rate": 3.322781250810805e-05, "loss": 0.7154, "step": 1202 }, { "epoch": 1.538923113849108, "grad_norm": 0.690115213394165, "learning_rate": 3.32161527998156e-05, "loss": 0.7333, "step": 1203 }, { "epoch": 1.5402032162573005, "grad_norm": 0.7052741050720215, "learning_rate": 3.32044853930078e-05, "loss": 0.7678, "step": 1204 }, { "epoch": 1.5414833186654933, "grad_norm": 0.770147442817688, "learning_rate": 3.3192810295692885e-05, "loss": 0.6863, "step": 1205 }, { "epoch": 1.542763421073686, "grad_norm": 0.6130920052528381, "learning_rate": 3.3181127515884394e-05, "loss": 0.7185, "step": 1206 }, { "epoch": 1.5440435234818786, "grad_norm": 0.6697155833244324, "learning_rate": 3.316943706160111e-05, "loss": 0.7371, "step": 1207 }, { "epoch": 1.545323625890071, "grad_norm": 0.7463666200637817, "learning_rate": 3.3157738940867115e-05, "loss": 0.7144, "step": 1208 }, { "epoch": 1.5466037282982639, "grad_norm": 0.5947985053062439, "learning_rate": 3.314603316171171e-05, "loss": 0.738, "step": 1209 }, { "epoch": 1.5478838307064566, "grad_norm": 0.6855900883674622, "learning_rate": 3.3134319732169504e-05, "loss": 0.7157, "step": 1210 }, { "epoch": 1.5491639331146492, "grad_norm": 0.6108332872390747, "learning_rate": 3.312259866028032e-05, "loss": 0.7233, "step": 1211 }, { "epoch": 1.5504440355228417, "grad_norm": 0.686443030834198, "learning_rate": 3.3110869954089235e-05, "loss": 0.745, "step": 1212 }, { "epoch": 1.5517241379310345, "grad_norm": 0.564744234085083, "learning_rate": 3.3099133621646574e-05, "loss": 0.6993, "step": 1213 }, { "epoch": 1.5530042403392272, "grad_norm": 0.6294586062431335, "learning_rate": 3.30873896710079e-05, "loss": 0.7171, "step": 1214 }, { "epoch": 1.5542843427474198, "grad_norm": 0.6412985920906067, "learning_rate": 3.307563811023399e-05, "loss": 0.7504, "step": 1215 }, { "epoch": 1.5555644451556123, "grad_norm": 0.5940372943878174, "learning_rate": 3.306387894739085e-05, "loss": 0.7235, "step": 1216 }, { "epoch": 1.556844547563805, "grad_norm": 0.6947694420814514, "learning_rate": 3.3052112190549705e-05, "loss": 0.7364, "step": 1217 }, { "epoch": 1.5581246499719978, "grad_norm": 0.6133434772491455, "learning_rate": 3.3040337847786994e-05, "loss": 0.7348, "step": 1218 }, { "epoch": 1.5594047523801904, "grad_norm": 0.629682183265686, "learning_rate": 3.302855592718436e-05, "loss": 0.6679, "step": 1219 }, { "epoch": 1.560684854788383, "grad_norm": 0.6369724273681641, "learning_rate": 3.301676643682866e-05, "loss": 0.6835, "step": 1220 }, { "epoch": 1.5619649571965757, "grad_norm": 0.7039076089859009, "learning_rate": 3.3004969384811915e-05, "loss": 0.7356, "step": 1221 }, { "epoch": 1.5632450596047684, "grad_norm": 0.6234503388404846, "learning_rate": 3.299316477923137e-05, "loss": 0.7322, "step": 1222 }, { "epoch": 1.564525162012961, "grad_norm": 0.701338529586792, "learning_rate": 3.298135262818944e-05, "loss": 0.7168, "step": 1223 }, { "epoch": 1.5658052644211535, "grad_norm": 0.6774275898933411, "learning_rate": 3.296953293979372e-05, "loss": 0.7247, "step": 1224 }, { "epoch": 1.5670853668293463, "grad_norm": 0.6598162055015564, "learning_rate": 3.295770572215697e-05, "loss": 0.7224, "step": 1225 }, { "epoch": 1.568365469237539, "grad_norm": 0.6808010339736938, "learning_rate": 3.2945870983397144e-05, "loss": 0.6826, "step": 1226 }, { "epoch": 1.5696455716457316, "grad_norm": 0.6423587799072266, "learning_rate": 3.293402873163732e-05, "loss": 0.6742, "step": 1227 }, { "epoch": 1.5709256740539244, "grad_norm": 0.6605172753334045, "learning_rate": 3.292217897500577e-05, "loss": 0.7093, "step": 1228 }, { "epoch": 1.5722057764621171, "grad_norm": 0.6553050875663757, "learning_rate": 3.29103217216359e-05, "loss": 0.6686, "step": 1229 }, { "epoch": 1.5734858788703097, "grad_norm": 0.64751136302948, "learning_rate": 3.289845697966625e-05, "loss": 0.7487, "step": 1230 }, { "epoch": 1.5734858788703097, "eval_loss": 0.011799683794379234, "eval_runtime": 10.819, "eval_samples_per_second": 45.845, "eval_steps_per_second": 5.731, "step": 1230 }, { "epoch": 1.5747659812785022, "grad_norm": 0.6843473315238953, "learning_rate": 3.288658475724052e-05, "loss": 0.7258, "step": 1231 }, { "epoch": 1.576046083686695, "grad_norm": 0.6456937193870544, "learning_rate": 3.2874705062507534e-05, "loss": 0.6962, "step": 1232 }, { "epoch": 1.5773261860948877, "grad_norm": 0.6985472440719604, "learning_rate": 3.286281790362125e-05, "loss": 0.6923, "step": 1233 }, { "epoch": 1.5786062885030803, "grad_norm": 0.650560736656189, "learning_rate": 3.285092328874076e-05, "loss": 0.7315, "step": 1234 }, { "epoch": 1.5798863909112728, "grad_norm": 0.6405664086341858, "learning_rate": 3.283902122603023e-05, "loss": 0.7038, "step": 1235 }, { "epoch": 1.5811664933194656, "grad_norm": 0.7400343418121338, "learning_rate": 3.2827111723659e-05, "loss": 0.7304, "step": 1236 }, { "epoch": 1.5824465957276583, "grad_norm": 0.6203374862670898, "learning_rate": 3.2815194789801466e-05, "loss": 0.7427, "step": 1237 }, { "epoch": 1.5837266981358509, "grad_norm": 0.6931282877922058, "learning_rate": 3.2803270432637144e-05, "loss": 0.7121, "step": 1238 }, { "epoch": 1.5850068005440434, "grad_norm": 0.6139877438545227, "learning_rate": 3.279133866035065e-05, "loss": 0.7534, "step": 1239 }, { "epoch": 1.5862869029522362, "grad_norm": 0.6333911418914795, "learning_rate": 3.277939948113169e-05, "loss": 0.716, "step": 1240 }, { "epoch": 1.587567005360429, "grad_norm": 0.5837564468383789, "learning_rate": 3.276745290317504e-05, "loss": 0.7123, "step": 1241 }, { "epoch": 1.5888471077686215, "grad_norm": 0.6742558479309082, "learning_rate": 3.275549893468057e-05, "loss": 0.7269, "step": 1242 }, { "epoch": 1.590127210176814, "grad_norm": 0.6741624474525452, "learning_rate": 3.27435375838532e-05, "loss": 0.6949, "step": 1243 }, { "epoch": 1.5914073125850068, "grad_norm": 0.6758027672767639, "learning_rate": 3.273156885890295e-05, "loss": 0.7519, "step": 1244 }, { "epoch": 1.5926874149931995, "grad_norm": 0.6422121524810791, "learning_rate": 3.271959276804488e-05, "loss": 0.7358, "step": 1245 }, { "epoch": 1.593967517401392, "grad_norm": 0.52058345079422, "learning_rate": 3.27076093194991e-05, "loss": 0.6998, "step": 1246 }, { "epoch": 1.5952476198095846, "grad_norm": 0.7028553485870361, "learning_rate": 3.269561852149079e-05, "loss": 0.7796, "step": 1247 }, { "epoch": 1.5965277222177774, "grad_norm": 0.6633913516998291, "learning_rate": 3.268362038225017e-05, "loss": 0.7342, "step": 1248 }, { "epoch": 1.5978078246259702, "grad_norm": 0.6191238760948181, "learning_rate": 3.2671614910012475e-05, "loss": 0.7369, "step": 1249 }, { "epoch": 1.5990879270341627, "grad_norm": 0.6972527503967285, "learning_rate": 3.2659602113018e-05, "loss": 0.7614, "step": 1250 }, { "epoch": 1.6003680294423552, "grad_norm": 0.6203116178512573, "learning_rate": 3.264758199951206e-05, "loss": 0.7246, "step": 1251 }, { "epoch": 1.601648131850548, "grad_norm": 0.6659989356994629, "learning_rate": 3.2635554577744996e-05, "loss": 0.7388, "step": 1252 }, { "epoch": 1.6029282342587408, "grad_norm": 0.6051566004753113, "learning_rate": 3.2623519855972156e-05, "loss": 0.7021, "step": 1253 }, { "epoch": 1.6042083366669333, "grad_norm": 0.5739110112190247, "learning_rate": 3.26114778424539e-05, "loss": 0.7295, "step": 1254 }, { "epoch": 1.605488439075126, "grad_norm": 0.685315728187561, "learning_rate": 3.259942854545559e-05, "loss": 0.7476, "step": 1255 }, { "epoch": 1.6067685414833188, "grad_norm": 0.5766253471374512, "learning_rate": 3.258737197324761e-05, "loss": 0.7064, "step": 1256 }, { "epoch": 1.6080486438915114, "grad_norm": 0.6512503027915955, "learning_rate": 3.2575308134105314e-05, "loss": 0.7204, "step": 1257 }, { "epoch": 1.609328746299704, "grad_norm": 0.5989083051681519, "learning_rate": 3.256323703630904e-05, "loss": 0.7184, "step": 1258 }, { "epoch": 1.6106088487078967, "grad_norm": 0.5565375685691833, "learning_rate": 3.255115868814413e-05, "loss": 0.6673, "step": 1259 }, { "epoch": 1.6118889511160894, "grad_norm": 0.5859665274620056, "learning_rate": 3.253907309790088e-05, "loss": 0.7342, "step": 1260 }, { "epoch": 1.6118889511160894, "eval_loss": 0.011774944141507149, "eval_runtime": 10.813, "eval_samples_per_second": 45.871, "eval_steps_per_second": 5.734, "step": 1260 }, { "epoch": 1.613169053524282, "grad_norm": 0.5405060052871704, "learning_rate": 3.252698027387458e-05, "loss": 0.699, "step": 1261 }, { "epoch": 1.6144491559324745, "grad_norm": 0.5568755865097046, "learning_rate": 3.2514880224365456e-05, "loss": 0.6908, "step": 1262 }, { "epoch": 1.6157292583406673, "grad_norm": 0.6005760431289673, "learning_rate": 3.250277295767873e-05, "loss": 0.7013, "step": 1263 }, { "epoch": 1.61700936074886, "grad_norm": 0.5673319101333618, "learning_rate": 3.249065848212455e-05, "loss": 0.7145, "step": 1264 }, { "epoch": 1.6182894631570526, "grad_norm": 0.6222371459007263, "learning_rate": 3.247853680601802e-05, "loss": 0.6893, "step": 1265 }, { "epoch": 1.6195695655652451, "grad_norm": 0.5672705769538879, "learning_rate": 3.246640793767918e-05, "loss": 0.7074, "step": 1266 }, { "epoch": 1.6208496679734379, "grad_norm": 0.6348983645439148, "learning_rate": 3.245427188543302e-05, "loss": 0.7155, "step": 1267 }, { "epoch": 1.6221297703816306, "grad_norm": 0.6012302041053772, "learning_rate": 3.2442128657609454e-05, "loss": 0.721, "step": 1268 }, { "epoch": 1.6234098727898232, "grad_norm": 0.6491580605506897, "learning_rate": 3.2429978262543316e-05, "loss": 0.7705, "step": 1269 }, { "epoch": 1.6246899751980157, "grad_norm": 0.5992140173912048, "learning_rate": 3.241782070857436e-05, "loss": 0.7396, "step": 1270 }, { "epoch": 1.6259700776062085, "grad_norm": 0.5799919366836548, "learning_rate": 3.240565600404727e-05, "loss": 0.6946, "step": 1271 }, { "epoch": 1.6272501800144012, "grad_norm": 0.6085742115974426, "learning_rate": 3.239348415731163e-05, "loss": 0.7173, "step": 1272 }, { "epoch": 1.6285302824225938, "grad_norm": 0.6014842391014099, "learning_rate": 3.23813051767219e-05, "loss": 0.7014, "step": 1273 }, { "epoch": 1.6298103848307863, "grad_norm": 0.5858080983161926, "learning_rate": 3.236911907063747e-05, "loss": 0.6868, "step": 1274 }, { "epoch": 1.631090487238979, "grad_norm": 0.6003361940383911, "learning_rate": 3.235692584742262e-05, "loss": 0.7129, "step": 1275 }, { "epoch": 1.6323705896471719, "grad_norm": 0.5887556076049805, "learning_rate": 3.2344725515446495e-05, "loss": 0.7461, "step": 1276 }, { "epoch": 1.6336506920553644, "grad_norm": 0.617440402507782, "learning_rate": 3.233251808308312e-05, "loss": 0.6828, "step": 1277 }, { "epoch": 1.634930794463557, "grad_norm": 0.6037922501564026, "learning_rate": 3.232030355871143e-05, "loss": 0.7335, "step": 1278 }, { "epoch": 1.6362108968717497, "grad_norm": 0.5489148497581482, "learning_rate": 3.2308081950715165e-05, "loss": 0.6934, "step": 1279 }, { "epoch": 1.6374909992799425, "grad_norm": 0.6495527029037476, "learning_rate": 3.229585326748298e-05, "loss": 0.7198, "step": 1280 }, { "epoch": 1.638771101688135, "grad_norm": 0.5367933511734009, "learning_rate": 3.228361751740837e-05, "loss": 0.7092, "step": 1281 }, { "epoch": 1.6400512040963275, "grad_norm": 0.6641536951065063, "learning_rate": 3.2271374708889686e-05, "loss": 0.7325, "step": 1282 }, { "epoch": 1.6413313065045205, "grad_norm": 0.562475323677063, "learning_rate": 3.22591248503301e-05, "loss": 0.6978, "step": 1283 }, { "epoch": 1.642611408912713, "grad_norm": 0.6081634163856506, "learning_rate": 3.224686795013765e-05, "loss": 0.7034, "step": 1284 }, { "epoch": 1.6438915113209056, "grad_norm": 0.6050977110862732, "learning_rate": 3.223460401672518e-05, "loss": 0.7237, "step": 1285 }, { "epoch": 1.6451716137290984, "grad_norm": 0.6373354196548462, "learning_rate": 3.222233305851041e-05, "loss": 0.6897, "step": 1286 }, { "epoch": 1.6464517161372911, "grad_norm": 0.6571948528289795, "learning_rate": 3.221005508391583e-05, "loss": 0.7214, "step": 1287 }, { "epoch": 1.6477318185454837, "grad_norm": 0.6069954633712769, "learning_rate": 3.219777010136876e-05, "loss": 0.6992, "step": 1288 }, { "epoch": 1.6490119209536762, "grad_norm": 0.675748884677887, "learning_rate": 3.218547811930136e-05, "loss": 0.722, "step": 1289 }, { "epoch": 1.650292023361869, "grad_norm": 0.6166329383850098, "learning_rate": 3.2173179146150536e-05, "loss": 0.709, "step": 1290 }, { "epoch": 1.650292023361869, "eval_loss": 0.011765520088374615, "eval_runtime": 10.8236, "eval_samples_per_second": 45.826, "eval_steps_per_second": 5.728, "step": 1290 }, { "epoch": 1.6515721257700617, "grad_norm": 0.5665214657783508, "learning_rate": 3.2160873190358056e-05, "loss": 0.7298, "step": 1291 }, { "epoch": 1.6528522281782543, "grad_norm": 0.6093210577964783, "learning_rate": 3.214856026037044e-05, "loss": 0.6962, "step": 1292 }, { "epoch": 1.6541323305864468, "grad_norm": 0.582926332950592, "learning_rate": 3.213624036463901e-05, "loss": 0.7092, "step": 1293 }, { "epoch": 1.6554124329946396, "grad_norm": 0.5293163657188416, "learning_rate": 3.212391351161987e-05, "loss": 0.7229, "step": 1294 }, { "epoch": 1.6566925354028323, "grad_norm": 0.6089814901351929, "learning_rate": 3.211157970977388e-05, "loss": 0.7248, "step": 1295 }, { "epoch": 1.6579726378110249, "grad_norm": 0.6263851523399353, "learning_rate": 3.2099238967566694e-05, "loss": 0.7146, "step": 1296 }, { "epoch": 1.6592527402192174, "grad_norm": 0.6339204907417297, "learning_rate": 3.208689129346872e-05, "loss": 0.696, "step": 1297 }, { "epoch": 1.6605328426274102, "grad_norm": 0.641028642654419, "learning_rate": 3.207453669595513e-05, "loss": 0.7304, "step": 1298 }, { "epoch": 1.661812945035603, "grad_norm": 0.6381056904792786, "learning_rate": 3.206217518350584e-05, "loss": 0.7138, "step": 1299 }, { "epoch": 1.6630930474437955, "grad_norm": 0.5982184410095215, "learning_rate": 3.20498067646055e-05, "loss": 0.7047, "step": 1300 }, { "epoch": 1.664373149851988, "grad_norm": 0.6246302723884583, "learning_rate": 3.2037431447743524e-05, "loss": 0.7068, "step": 1301 }, { "epoch": 1.6656532522601808, "grad_norm": 0.6043433547019958, "learning_rate": 3.202504924141406e-05, "loss": 0.6991, "step": 1302 }, { "epoch": 1.6669333546683736, "grad_norm": 0.6269601583480835, "learning_rate": 3.2012660154115974e-05, "loss": 0.7147, "step": 1303 }, { "epoch": 1.668213457076566, "grad_norm": 0.6441345810890198, "learning_rate": 3.200026419435284e-05, "loss": 0.6935, "step": 1304 }, { "epoch": 1.6694935594847586, "grad_norm": 0.5528939962387085, "learning_rate": 3.198786137063299e-05, "loss": 0.6888, "step": 1305 }, { "epoch": 1.6707736618929514, "grad_norm": 0.7520976662635803, "learning_rate": 3.197545169146943e-05, "loss": 0.759, "step": 1306 }, { "epoch": 1.6720537643011442, "grad_norm": 0.6293416023254395, "learning_rate": 3.1963035165379884e-05, "loss": 0.7478, "step": 1307 }, { "epoch": 1.6733338667093367, "grad_norm": 0.634181022644043, "learning_rate": 3.195061180088679e-05, "loss": 0.6713, "step": 1308 }, { "epoch": 1.6746139691175292, "grad_norm": 0.6558919548988342, "learning_rate": 3.1938181606517244e-05, "loss": 0.7406, "step": 1309 }, { "epoch": 1.675894071525722, "grad_norm": 0.5954368710517883, "learning_rate": 3.1925744590803074e-05, "loss": 0.7172, "step": 1310 }, { "epoch": 1.6771741739339148, "grad_norm": 0.6629621386528015, "learning_rate": 3.191330076228076e-05, "loss": 0.7153, "step": 1311 }, { "epoch": 1.6784542763421073, "grad_norm": 0.6511289477348328, "learning_rate": 3.190085012949146e-05, "loss": 0.6955, "step": 1312 }, { "epoch": 1.6797343787503, "grad_norm": 0.6525564789772034, "learning_rate": 3.188839270098101e-05, "loss": 0.7245, "step": 1313 }, { "epoch": 1.6810144811584928, "grad_norm": 0.6946167349815369, "learning_rate": 3.1875928485299925e-05, "loss": 0.7295, "step": 1314 }, { "epoch": 1.6822945835666854, "grad_norm": 0.6380343437194824, "learning_rate": 3.186345749100335e-05, "loss": 0.7514, "step": 1315 }, { "epoch": 1.683574685974878, "grad_norm": 0.6703137159347534, "learning_rate": 3.185097972665109e-05, "loss": 0.7179, "step": 1316 }, { "epoch": 1.6848547883830707, "grad_norm": 0.6641091704368591, "learning_rate": 3.1838495200807615e-05, "loss": 0.7181, "step": 1317 }, { "epoch": 1.6861348907912634, "grad_norm": 0.6047271490097046, "learning_rate": 3.1826003922042016e-05, "loss": 0.7045, "step": 1318 }, { "epoch": 1.687414993199456, "grad_norm": 0.6599025130271912, "learning_rate": 3.1813505898928017e-05, "loss": 0.7344, "step": 1319 }, { "epoch": 1.6886950956076485, "grad_norm": 0.6088016629219055, "learning_rate": 3.1801001140044e-05, "loss": 0.692, "step": 1320 }, { "epoch": 1.6886950956076485, "eval_loss": 0.011746264062821865, "eval_runtime": 10.8084, "eval_samples_per_second": 45.89, "eval_steps_per_second": 5.736, "step": 1320 }, { "epoch": 1.6899751980158413, "grad_norm": 0.6381211280822754, "learning_rate": 3.178848965397294e-05, "loss": 0.7146, "step": 1321 }, { "epoch": 1.691255300424034, "grad_norm": 0.6384326815605164, "learning_rate": 3.177597144930244e-05, "loss": 0.7369, "step": 1322 }, { "epoch": 1.6925354028322266, "grad_norm": 0.6405301094055176, "learning_rate": 3.176344653462472e-05, "loss": 0.722, "step": 1323 }, { "epoch": 1.6938155052404191, "grad_norm": 0.6216254234313965, "learning_rate": 3.175091491853659e-05, "loss": 0.7354, "step": 1324 }, { "epoch": 1.695095607648612, "grad_norm": 0.6169127821922302, "learning_rate": 3.173837660963948e-05, "loss": 0.7308, "step": 1325 }, { "epoch": 1.6963757100568047, "grad_norm": 0.5891127586364746, "learning_rate": 3.172583161653939e-05, "loss": 0.7164, "step": 1326 }, { "epoch": 1.6976558124649972, "grad_norm": 0.6386512517929077, "learning_rate": 3.171327994784694e-05, "loss": 0.7332, "step": 1327 }, { "epoch": 1.6989359148731897, "grad_norm": 0.5602337718009949, "learning_rate": 3.17007216121773e-05, "loss": 0.7448, "step": 1328 }, { "epoch": 1.7002160172813825, "grad_norm": 0.6208088397979736, "learning_rate": 3.168815661815024e-05, "loss": 0.7512, "step": 1329 }, { "epoch": 1.7014961196895753, "grad_norm": 0.593197762966156, "learning_rate": 3.167558497439007e-05, "loss": 0.7195, "step": 1330 }, { "epoch": 1.7027762220977678, "grad_norm": 0.6581169962882996, "learning_rate": 3.166300668952571e-05, "loss": 0.7446, "step": 1331 }, { "epoch": 1.7040563245059603, "grad_norm": 0.5415921807289124, "learning_rate": 3.165042177219059e-05, "loss": 0.7026, "step": 1332 }, { "epoch": 1.705336426914153, "grad_norm": 0.6655652523040771, "learning_rate": 3.1637830231022727e-05, "loss": 0.7071, "step": 1333 }, { "epoch": 1.7066165293223459, "grad_norm": 0.626798689365387, "learning_rate": 3.162523207466468e-05, "loss": 0.6942, "step": 1334 }, { "epoch": 1.7078966317305384, "grad_norm": 0.6740243434906006, "learning_rate": 3.161262731176351e-05, "loss": 0.6963, "step": 1335 }, { "epoch": 1.709176734138731, "grad_norm": 0.6306195855140686, "learning_rate": 3.160001595097087e-05, "loss": 0.7314, "step": 1336 }, { "epoch": 1.7104568365469237, "grad_norm": 0.6224009990692139, "learning_rate": 3.1587398000942907e-05, "loss": 0.7144, "step": 1337 }, { "epoch": 1.7117369389551165, "grad_norm": 0.6219298839569092, "learning_rate": 3.15747734703403e-05, "loss": 0.7179, "step": 1338 }, { "epoch": 1.713017041363309, "grad_norm": 0.5488826632499695, "learning_rate": 3.156214236782825e-05, "loss": 0.7246, "step": 1339 }, { "epoch": 1.7142971437715018, "grad_norm": 0.635830283164978, "learning_rate": 3.154950470207644e-05, "loss": 0.7181, "step": 1340 }, { "epoch": 1.7155772461796945, "grad_norm": 0.61625736951828, "learning_rate": 3.1536860481759106e-05, "loss": 0.7714, "step": 1341 }, { "epoch": 1.716857348587887, "grad_norm": 0.5970157980918884, "learning_rate": 3.1524209715554945e-05, "loss": 0.7272, "step": 1342 }, { "epoch": 1.7181374509960796, "grad_norm": 0.6091165542602539, "learning_rate": 3.151155241214715e-05, "loss": 0.7184, "step": 1343 }, { "epoch": 1.7194175534042724, "grad_norm": 0.5880416035652161, "learning_rate": 3.149888858022343e-05, "loss": 0.7287, "step": 1344 }, { "epoch": 1.7206976558124651, "grad_norm": 0.5537950992584229, "learning_rate": 3.1486218228475936e-05, "loss": 0.7108, "step": 1345 }, { "epoch": 1.7219777582206577, "grad_norm": 0.6520135998725891, "learning_rate": 3.1473541365601316e-05, "loss": 0.7525, "step": 1346 }, { "epoch": 1.7232578606288502, "grad_norm": 0.6083378791809082, "learning_rate": 3.14608580003007e-05, "loss": 0.7385, "step": 1347 }, { "epoch": 1.724537963037043, "grad_norm": 0.5835146307945251, "learning_rate": 3.144816814127964e-05, "loss": 0.7452, "step": 1348 }, { "epoch": 1.7258180654452357, "grad_norm": 0.6272082328796387, "learning_rate": 3.143547179724819e-05, "loss": 0.7485, "step": 1349 }, { "epoch": 1.7270981678534283, "grad_norm": 0.6215714812278748, "learning_rate": 3.142276897692083e-05, "loss": 0.7566, "step": 1350 }, { "epoch": 1.7270981678534283, "eval_loss": 0.011728114448487759, "eval_runtime": 10.8488, "eval_samples_per_second": 45.719, "eval_steps_per_second": 5.715, "step": 1350 }, { "epoch": 1.7283782702616208, "grad_norm": 0.6123554706573486, "learning_rate": 3.1410059689016485e-05, "loss": 0.7301, "step": 1351 }, { "epoch": 1.7296583726698136, "grad_norm": 0.6339563727378845, "learning_rate": 3.1397343942258535e-05, "loss": 0.7093, "step": 1352 }, { "epoch": 1.7309384750780064, "grad_norm": 0.5856004953384399, "learning_rate": 3.138462174537477e-05, "loss": 0.7094, "step": 1353 }, { "epoch": 1.732218577486199, "grad_norm": 0.5875114798545837, "learning_rate": 3.1371893107097434e-05, "loss": 0.743, "step": 1354 }, { "epoch": 1.7334986798943914, "grad_norm": 0.6438591480255127, "learning_rate": 3.1359158036163165e-05, "loss": 0.7349, "step": 1355 }, { "epoch": 1.7347787823025842, "grad_norm": 0.5997960567474365, "learning_rate": 3.134641654131304e-05, "loss": 0.7195, "step": 1356 }, { "epoch": 1.736058884710777, "grad_norm": 0.6425419449806213, "learning_rate": 3.133366863129253e-05, "loss": 0.7038, "step": 1357 }, { "epoch": 1.7373389871189695, "grad_norm": 0.611407458782196, "learning_rate": 3.132091431485152e-05, "loss": 0.7101, "step": 1358 }, { "epoch": 1.738619089527162, "grad_norm": 0.6099973917007446, "learning_rate": 3.130815360074428e-05, "loss": 0.7212, "step": 1359 }, { "epoch": 1.7398991919353548, "grad_norm": 0.7355599403381348, "learning_rate": 3.1295386497729476e-05, "loss": 0.7393, "step": 1360 }, { "epoch": 1.7411792943435476, "grad_norm": 0.6639415621757507, "learning_rate": 3.1282613014570166e-05, "loss": 0.6859, "step": 1361 }, { "epoch": 1.74245939675174, "grad_norm": 0.6623911261558533, "learning_rate": 3.126983316003378e-05, "loss": 0.7371, "step": 1362 }, { "epoch": 1.7437394991599326, "grad_norm": 0.6310201287269592, "learning_rate": 3.125704694289212e-05, "loss": 0.7426, "step": 1363 }, { "epoch": 1.7450196015681254, "grad_norm": 0.5712582468986511, "learning_rate": 3.124425437192137e-05, "loss": 0.684, "step": 1364 }, { "epoch": 1.7462997039763182, "grad_norm": 0.6233215928077698, "learning_rate": 3.123145545590204e-05, "loss": 0.734, "step": 1365 }, { "epoch": 1.7475798063845107, "grad_norm": 0.5527714490890503, "learning_rate": 3.121865020361904e-05, "loss": 0.7468, "step": 1366 }, { "epoch": 1.7488599087927033, "grad_norm": 0.6191003322601318, "learning_rate": 3.12058386238616e-05, "loss": 0.7245, "step": 1367 }, { "epoch": 1.750140011200896, "grad_norm": 0.567948043346405, "learning_rate": 3.11930207254233e-05, "loss": 0.6857, "step": 1368 }, { "epoch": 1.7514201136090888, "grad_norm": 0.6133219599723816, "learning_rate": 3.118019651710207e-05, "loss": 0.7193, "step": 1369 }, { "epoch": 1.7527002160172813, "grad_norm": 0.6336676478385925, "learning_rate": 3.1167366007700135e-05, "loss": 0.754, "step": 1370 }, { "epoch": 1.753980318425474, "grad_norm": 0.595684826374054, "learning_rate": 3.1154529206024075e-05, "loss": 0.7211, "step": 1371 }, { "epoch": 1.7552604208336668, "grad_norm": 0.6025580167770386, "learning_rate": 3.1141686120884804e-05, "loss": 0.6876, "step": 1372 }, { "epoch": 1.7565405232418594, "grad_norm": 0.643245279788971, "learning_rate": 3.112883676109751e-05, "loss": 0.6822, "step": 1373 }, { "epoch": 1.757820625650052, "grad_norm": 0.5711572170257568, "learning_rate": 3.11159811354817e-05, "loss": 0.7839, "step": 1374 }, { "epoch": 1.7591007280582447, "grad_norm": 0.5706717371940613, "learning_rate": 3.110311925286119e-05, "loss": 0.7058, "step": 1375 }, { "epoch": 1.7603808304664375, "grad_norm": 0.6271959543228149, "learning_rate": 3.10902511220641e-05, "loss": 0.7339, "step": 1376 }, { "epoch": 1.76166093287463, "grad_norm": 0.586730420589447, "learning_rate": 3.1077376751922805e-05, "loss": 0.726, "step": 1377 }, { "epoch": 1.7629410352828225, "grad_norm": 0.664039134979248, "learning_rate": 3.1064496151274e-05, "loss": 0.7304, "step": 1378 }, { "epoch": 1.7642211376910153, "grad_norm": 0.6285074949264526, "learning_rate": 3.105160932895864e-05, "loss": 0.7559, "step": 1379 }, { "epoch": 1.765501240099208, "grad_norm": 0.5458385944366455, "learning_rate": 3.103871629382193e-05, "loss": 0.7084, "step": 1380 }, { "epoch": 1.765501240099208, "eval_loss": 0.011709917336702347, "eval_runtime": 10.8161, "eval_samples_per_second": 45.858, "eval_steps_per_second": 5.732, "step": 1380 }, { "epoch": 1.7667813425074006, "grad_norm": 0.6007266640663147, "learning_rate": 3.1025817054713385e-05, "loss": 0.717, "step": 1381 }, { "epoch": 1.7680614449155931, "grad_norm": 0.585239827632904, "learning_rate": 3.101291162048675e-05, "loss": 0.7251, "step": 1382 }, { "epoch": 1.769341547323786, "grad_norm": 0.5831015110015869, "learning_rate": 3.1e-05, "loss": 0.7547, "step": 1383 }, { "epoch": 1.7706216497319787, "grad_norm": 0.6495603322982788, "learning_rate": 3.098708220211541e-05, "loss": 0.7123, "step": 1384 }, { "epoch": 1.7719017521401712, "grad_norm": 0.5565499663352966, "learning_rate": 3.097415823569946e-05, "loss": 0.6802, "step": 1385 }, { "epoch": 1.7731818545483637, "grad_norm": 0.6719182729721069, "learning_rate": 3.0961228109622856e-05, "loss": 0.7222, "step": 1386 }, { "epoch": 1.7744619569565565, "grad_norm": 0.5855692028999329, "learning_rate": 3.094829183276056e-05, "loss": 0.7315, "step": 1387 }, { "epoch": 1.7757420593647493, "grad_norm": 0.6577022075653076, "learning_rate": 3.093534941399174e-05, "loss": 0.7452, "step": 1388 }, { "epoch": 1.7770221617729418, "grad_norm": 0.6627672910690308, "learning_rate": 3.092240086219978e-05, "loss": 0.7316, "step": 1389 }, { "epoch": 1.7783022641811344, "grad_norm": 0.6464568376541138, "learning_rate": 3.090944618627227e-05, "loss": 0.7092, "step": 1390 }, { "epoch": 1.7795823665893271, "grad_norm": 0.6542267799377441, "learning_rate": 3.0896485395101016e-05, "loss": 0.7473, "step": 1391 }, { "epoch": 1.7808624689975199, "grad_norm": 0.6975298523902893, "learning_rate": 3.088351849758201e-05, "loss": 0.7326, "step": 1392 }, { "epoch": 1.7821425714057124, "grad_norm": 0.6230096220970154, "learning_rate": 3.087054550261544e-05, "loss": 0.7036, "step": 1393 }, { "epoch": 1.783422673813905, "grad_norm": 0.6111627817153931, "learning_rate": 3.0857566419105676e-05, "loss": 0.7174, "step": 1394 }, { "epoch": 1.7847027762220977, "grad_norm": 0.6360964179039001, "learning_rate": 3.0844581255961275e-05, "loss": 0.7118, "step": 1395 }, { "epoch": 1.7859828786302905, "grad_norm": 0.616003155708313, "learning_rate": 3.083159002209497e-05, "loss": 0.7045, "step": 1396 }, { "epoch": 1.787262981038483, "grad_norm": 0.6242329478263855, "learning_rate": 3.0818592726423616e-05, "loss": 0.7129, "step": 1397 }, { "epoch": 1.7885430834466758, "grad_norm": 0.5756609439849854, "learning_rate": 3.080558937786831e-05, "loss": 0.6677, "step": 1398 }, { "epoch": 1.7898231858548685, "grad_norm": 0.5721912980079651, "learning_rate": 3.079257998535423e-05, "loss": 0.7129, "step": 1399 }, { "epoch": 1.791103288263061, "grad_norm": 0.618423581123352, "learning_rate": 3.077956455781073e-05, "loss": 0.7091, "step": 1400 }, { "epoch": 1.7923833906712536, "grad_norm": 0.5906749367713928, "learning_rate": 3.0766543104171326e-05, "loss": 0.7071, "step": 1401 }, { "epoch": 1.7936634930794464, "grad_norm": 0.6126925945281982, "learning_rate": 3.0753515633373634e-05, "loss": 0.7585, "step": 1402 }, { "epoch": 1.7949435954876392, "grad_norm": 0.5896530151367188, "learning_rate": 3.0740482154359434e-05, "loss": 0.7083, "step": 1403 }, { "epoch": 1.7962236978958317, "grad_norm": 0.5912639498710632, "learning_rate": 3.0727442676074595e-05, "loss": 0.6997, "step": 1404 }, { "epoch": 1.7975038003040242, "grad_norm": 0.5408932566642761, "learning_rate": 3.071439720746913e-05, "loss": 0.7064, "step": 1405 }, { "epoch": 1.798783902712217, "grad_norm": 0.6020301580429077, "learning_rate": 3.070134575749717e-05, "loss": 0.7263, "step": 1406 }, { "epoch": 1.8000640051204098, "grad_norm": 0.5722630023956299, "learning_rate": 3.0688288335116906e-05, "loss": 0.7221, "step": 1407 }, { "epoch": 1.8013441075286023, "grad_norm": 0.6015200614929199, "learning_rate": 3.067522494929069e-05, "loss": 0.6838, "step": 1408 }, { "epoch": 1.8026242099367948, "grad_norm": 0.6352903842926025, "learning_rate": 3.066215560898491e-05, "loss": 0.7169, "step": 1409 }, { "epoch": 1.8039043123449876, "grad_norm": 0.7391602993011475, "learning_rate": 3.064908032317009e-05, "loss": 0.7231, "step": 1410 }, { "epoch": 1.8039043123449876, "eval_loss": 0.011707385070621967, "eval_runtime": 10.8079, "eval_samples_per_second": 45.892, "eval_steps_per_second": 5.737, "step": 1410 }, { "epoch": 1.8051844147531804, "grad_norm": 0.6522735953330994, "learning_rate": 3.06359991008208e-05, "loss": 0.7032, "step": 1411 }, { "epoch": 1.806464517161373, "grad_norm": 0.5974452495574951, "learning_rate": 3.06229119509157e-05, "loss": 0.7052, "step": 1412 }, { "epoch": 1.8077446195695654, "grad_norm": 0.6504031419754028, "learning_rate": 3.060981888243752e-05, "loss": 0.6873, "step": 1413 }, { "epoch": 1.8090247219777582, "grad_norm": 0.5884857177734375, "learning_rate": 3.0596719904373036e-05, "loss": 0.7174, "step": 1414 }, { "epoch": 1.810304824385951, "grad_norm": 0.6082894206047058, "learning_rate": 3.058361502571312e-05, "loss": 0.7143, "step": 1415 }, { "epoch": 1.8115849267941435, "grad_norm": 0.609159529209137, "learning_rate": 3.057050425545263e-05, "loss": 0.7208, "step": 1416 }, { "epoch": 1.812865029202336, "grad_norm": 0.6024379134178162, "learning_rate": 3.0557387602590526e-05, "loss": 0.7147, "step": 1417 }, { "epoch": 1.8141451316105288, "grad_norm": 0.5601730942726135, "learning_rate": 3.054426507612977e-05, "loss": 0.6914, "step": 1418 }, { "epoch": 1.8154252340187216, "grad_norm": 0.5741651654243469, "learning_rate": 3.0531136685077397e-05, "loss": 0.7139, "step": 1419 }, { "epoch": 1.8167053364269141, "grad_norm": 0.5556854009628296, "learning_rate": 3.0518002438444406e-05, "loss": 0.717, "step": 1420 }, { "epoch": 1.8179854388351067, "grad_norm": 0.6205037832260132, "learning_rate": 3.0504862345245875e-05, "loss": 0.6988, "step": 1421 }, { "epoch": 1.8192655412432994, "grad_norm": 0.5890035629272461, "learning_rate": 3.0491716414500847e-05, "loss": 0.7116, "step": 1422 }, { "epoch": 1.8205456436514922, "grad_norm": 0.5740336179733276, "learning_rate": 3.0478564655232414e-05, "loss": 0.6982, "step": 1423 }, { "epoch": 1.8218257460596847, "grad_norm": 0.5904762744903564, "learning_rate": 3.0465407076467638e-05, "loss": 0.7251, "step": 1424 }, { "epoch": 1.8231058484678773, "grad_norm": 0.5810261964797974, "learning_rate": 3.045224368723758e-05, "loss": 0.7191, "step": 1425 }, { "epoch": 1.8243859508760703, "grad_norm": 0.6284822225570679, "learning_rate": 3.043907449657731e-05, "loss": 0.7284, "step": 1426 }, { "epoch": 1.8256660532842628, "grad_norm": 0.6124885678291321, "learning_rate": 3.042589951352585e-05, "loss": 0.7308, "step": 1427 }, { "epoch": 1.8269461556924553, "grad_norm": 0.6600826382637024, "learning_rate": 3.0412718747126218e-05, "loss": 0.7391, "step": 1428 }, { "epoch": 1.828226258100648, "grad_norm": 0.6918718814849854, "learning_rate": 3.0399532206425402e-05, "loss": 0.7395, "step": 1429 }, { "epoch": 1.8295063605088409, "grad_norm": 0.680570125579834, "learning_rate": 3.0386339900474337e-05, "loss": 0.7022, "step": 1430 }, { "epoch": 1.8307864629170334, "grad_norm": 0.6630198359489441, "learning_rate": 3.037314183832793e-05, "loss": 0.7269, "step": 1431 }, { "epoch": 1.832066565325226, "grad_norm": 0.6430322527885437, "learning_rate": 3.035993802904504e-05, "loss": 0.7219, "step": 1432 }, { "epoch": 1.8333466677334187, "grad_norm": 0.6303563714027405, "learning_rate": 3.0346728481688452e-05, "loss": 0.7107, "step": 1433 }, { "epoch": 1.8346267701416115, "grad_norm": 0.6679186224937439, "learning_rate": 3.0333513205324916e-05, "loss": 0.7277, "step": 1434 }, { "epoch": 1.835906872549804, "grad_norm": 0.6839330196380615, "learning_rate": 3.0320292209025092e-05, "loss": 0.6928, "step": 1435 }, { "epoch": 1.8371869749579965, "grad_norm": 0.5909537672996521, "learning_rate": 3.0307065501863576e-05, "loss": 0.6842, "step": 1436 }, { "epoch": 1.8384670773661893, "grad_norm": 0.6561462879180908, "learning_rate": 3.0293833092918886e-05, "loss": 0.6976, "step": 1437 }, { "epoch": 1.839747179774382, "grad_norm": 0.6374539732933044, "learning_rate": 3.0280594991273452e-05, "loss": 0.7088, "step": 1438 }, { "epoch": 1.8410272821825746, "grad_norm": 0.6158241033554077, "learning_rate": 3.0267351206013602e-05, "loss": 0.7154, "step": 1439 }, { "epoch": 1.8423073845907671, "grad_norm": 0.5730755925178528, "learning_rate": 3.025410174622958e-05, "loss": 0.7301, "step": 1440 }, { "epoch": 1.8423073845907671, "eval_loss": 0.011684227734804153, "eval_runtime": 10.8184, "eval_samples_per_second": 45.848, "eval_steps_per_second": 5.731, "step": 1440 }, { "epoch": 1.84358748699896, "grad_norm": 0.5943868160247803, "learning_rate": 3.0240846621015523e-05, "loss": 0.7165, "step": 1441 }, { "epoch": 1.8448675894071527, "grad_norm": 0.5782945156097412, "learning_rate": 3.022758583946943e-05, "loss": 0.691, "step": 1442 }, { "epoch": 1.8461476918153452, "grad_norm": 0.6446921825408936, "learning_rate": 3.0214319410693223e-05, "loss": 0.715, "step": 1443 }, { "epoch": 1.8474277942235378, "grad_norm": 0.5803105235099792, "learning_rate": 3.0201047343792672e-05, "loss": 0.7356, "step": 1444 }, { "epoch": 1.8487078966317305, "grad_norm": 0.6254404187202454, "learning_rate": 3.018776964787743e-05, "loss": 0.7254, "step": 1445 }, { "epoch": 1.8499879990399233, "grad_norm": 0.6068440675735474, "learning_rate": 3.017448633206101e-05, "loss": 0.708, "step": 1446 }, { "epoch": 1.8512681014481158, "grad_norm": 0.6016970276832581, "learning_rate": 3.0161197405460774e-05, "loss": 0.7177, "step": 1447 }, { "epoch": 1.8525482038563084, "grad_norm": 0.5711326003074646, "learning_rate": 3.0147902877197954e-05, "loss": 0.6752, "step": 1448 }, { "epoch": 1.8538283062645011, "grad_norm": 0.6343945860862732, "learning_rate": 3.0134602756397603e-05, "loss": 0.6957, "step": 1449 }, { "epoch": 1.8551084086726939, "grad_norm": 0.5972104668617249, "learning_rate": 3.0121297052188638e-05, "loss": 0.7336, "step": 1450 }, { "epoch": 1.8563885110808864, "grad_norm": 0.6045268774032593, "learning_rate": 3.0107985773703783e-05, "loss": 0.7555, "step": 1451 }, { "epoch": 1.857668613489079, "grad_norm": 0.62050461769104, "learning_rate": 3.0094668930079606e-05, "loss": 0.7215, "step": 1452 }, { "epoch": 1.8589487158972717, "grad_norm": 0.6099078059196472, "learning_rate": 3.0081346530456496e-05, "loss": 0.7602, "step": 1453 }, { "epoch": 1.8602288183054645, "grad_norm": 0.7151839733123779, "learning_rate": 3.006801858397864e-05, "loss": 0.7397, "step": 1454 }, { "epoch": 1.861508920713657, "grad_norm": 0.6388906836509705, "learning_rate": 3.005468509979404e-05, "loss": 0.7086, "step": 1455 }, { "epoch": 1.8627890231218498, "grad_norm": 0.7014924883842468, "learning_rate": 3.0041346087054508e-05, "loss": 0.7201, "step": 1456 }, { "epoch": 1.8640691255300426, "grad_norm": 0.6249627470970154, "learning_rate": 3.002800155491564e-05, "loss": 0.7459, "step": 1457 }, { "epoch": 1.865349227938235, "grad_norm": 0.6529703736305237, "learning_rate": 3.0014651512536826e-05, "loss": 0.7287, "step": 1458 }, { "epoch": 1.8666293303464276, "grad_norm": 0.7031069397926331, "learning_rate": 3.000129596908122e-05, "loss": 0.722, "step": 1459 }, { "epoch": 1.8679094327546204, "grad_norm": 0.6265938878059387, "learning_rate": 2.9987934933715786e-05, "loss": 0.7507, "step": 1460 }, { "epoch": 1.8691895351628132, "grad_norm": 0.698419451713562, "learning_rate": 2.997456841561123e-05, "loss": 0.7158, "step": 1461 }, { "epoch": 1.8704696375710057, "grad_norm": 0.5844295024871826, "learning_rate": 2.9961196423942026e-05, "loss": 0.7028, "step": 1462 }, { "epoch": 1.8717497399791982, "grad_norm": 0.623924732208252, "learning_rate": 2.9947818967886416e-05, "loss": 0.7285, "step": 1463 }, { "epoch": 1.873029842387391, "grad_norm": 0.6289079785346985, "learning_rate": 2.9934436056626386e-05, "loss": 0.7072, "step": 1464 }, { "epoch": 1.8743099447955838, "grad_norm": 0.6276214122772217, "learning_rate": 2.9921047699347653e-05, "loss": 0.7251, "step": 1465 }, { "epoch": 1.8755900472037763, "grad_norm": 0.5650027394294739, "learning_rate": 2.9907653905239703e-05, "loss": 0.692, "step": 1466 }, { "epoch": 1.8768701496119689, "grad_norm": 0.5894197225570679, "learning_rate": 2.9894254683495724e-05, "loss": 0.6986, "step": 1467 }, { "epoch": 1.8781502520201616, "grad_norm": 0.5582399368286133, "learning_rate": 2.988085004331264e-05, "loss": 0.7064, "step": 1468 }, { "epoch": 1.8794303544283544, "grad_norm": 0.6042588949203491, "learning_rate": 2.9867439993891104e-05, "loss": 0.7042, "step": 1469 }, { "epoch": 1.880710456836547, "grad_norm": 0.6372030377388, "learning_rate": 2.9854024544435463e-05, "loss": 0.7293, "step": 1470 }, { "epoch": 1.880710456836547, "eval_loss": 0.011673283763229847, "eval_runtime": 10.8394, "eval_samples_per_second": 45.759, "eval_steps_per_second": 5.72, "step": 1470 }, { "epoch": 1.8819905592447395, "grad_norm": 0.6210693717002869, "learning_rate": 2.9840603704153785e-05, "loss": 0.7323, "step": 1471 }, { "epoch": 1.8832706616529322, "grad_norm": 0.605437695980072, "learning_rate": 2.9827177482257834e-05, "loss": 0.6665, "step": 1472 }, { "epoch": 1.884550764061125, "grad_norm": 0.60888671875, "learning_rate": 2.9813745887963065e-05, "loss": 0.7256, "step": 1473 }, { "epoch": 1.8858308664693175, "grad_norm": 0.6271731853485107, "learning_rate": 2.980030893048862e-05, "loss": 0.7381, "step": 1474 }, { "epoch": 1.88711096887751, "grad_norm": 0.5811633467674255, "learning_rate": 2.9786866619057328e-05, "loss": 0.686, "step": 1475 }, { "epoch": 1.8883910712857028, "grad_norm": 0.6107152104377747, "learning_rate": 2.9773418962895695e-05, "loss": 0.7083, "step": 1476 }, { "epoch": 1.8896711736938956, "grad_norm": 0.6394736766815186, "learning_rate": 2.975996597123388e-05, "loss": 0.7104, "step": 1477 }, { "epoch": 1.8909512761020881, "grad_norm": 0.612646222114563, "learning_rate": 2.974650765330572e-05, "loss": 0.6754, "step": 1478 }, { "epoch": 1.8922313785102807, "grad_norm": 0.6603043675422668, "learning_rate": 2.9733044018348707e-05, "loss": 0.7313, "step": 1479 }, { "epoch": 1.8935114809184734, "grad_norm": 0.5434257984161377, "learning_rate": 2.971957507560397e-05, "loss": 0.7345, "step": 1480 }, { "epoch": 1.8947915833266662, "grad_norm": 0.6442853212356567, "learning_rate": 2.9706100834316282e-05, "loss": 0.7532, "step": 1481 }, { "epoch": 1.8960716857348587, "grad_norm": 0.6383693218231201, "learning_rate": 2.9692621303734073e-05, "loss": 0.7122, "step": 1482 }, { "epoch": 1.8973517881430515, "grad_norm": 0.6708807945251465, "learning_rate": 2.9679136493109392e-05, "loss": 0.7786, "step": 1483 }, { "epoch": 1.8986318905512443, "grad_norm": 0.6603577136993408, "learning_rate": 2.96656464116979e-05, "loss": 0.7659, "step": 1484 }, { "epoch": 1.8999119929594368, "grad_norm": 0.6571595072746277, "learning_rate": 2.9652151068758882e-05, "loss": 0.7279, "step": 1485 }, { "epoch": 1.9011920953676293, "grad_norm": 0.6065995693206787, "learning_rate": 2.963865047355525e-05, "loss": 0.7526, "step": 1486 }, { "epoch": 1.902472197775822, "grad_norm": 0.6256991624832153, "learning_rate": 2.9625144635353514e-05, "loss": 0.7241, "step": 1487 }, { "epoch": 1.9037523001840149, "grad_norm": 0.6634142398834229, "learning_rate": 2.9611633563423755e-05, "loss": 0.7721, "step": 1488 }, { "epoch": 1.9050324025922074, "grad_norm": 0.6693702936172485, "learning_rate": 2.959811726703969e-05, "loss": 0.7149, "step": 1489 }, { "epoch": 1.9063125050004, "grad_norm": 0.6248482465744019, "learning_rate": 2.9584595755478597e-05, "loss": 0.7005, "step": 1490 }, { "epoch": 1.9075926074085927, "grad_norm": 0.595628559589386, "learning_rate": 2.9571069038021324e-05, "loss": 0.7344, "step": 1491 }, { "epoch": 1.9088727098167855, "grad_norm": 0.6211913824081421, "learning_rate": 2.955753712395233e-05, "loss": 0.7195, "step": 1492 }, { "epoch": 1.910152812224978, "grad_norm": 0.5958669185638428, "learning_rate": 2.9544000022559598e-05, "loss": 0.678, "step": 1493 }, { "epoch": 1.9114329146331706, "grad_norm": 0.4980773627758026, "learning_rate": 2.9530457743134694e-05, "loss": 0.7005, "step": 1494 }, { "epoch": 1.9127130170413633, "grad_norm": 0.5755796432495117, "learning_rate": 2.9516910294972745e-05, "loss": 0.7069, "step": 1495 }, { "epoch": 1.913993119449556, "grad_norm": 0.5686249136924744, "learning_rate": 2.9503357687372402e-05, "loss": 0.7228, "step": 1496 }, { "epoch": 1.9152732218577486, "grad_norm": 0.5395983457565308, "learning_rate": 2.9489799929635875e-05, "loss": 0.6777, "step": 1497 }, { "epoch": 1.9165533242659412, "grad_norm": 0.595479428768158, "learning_rate": 2.947623703106891e-05, "loss": 0.7173, "step": 1498 }, { "epoch": 1.917833426674134, "grad_norm": 0.5761099457740784, "learning_rate": 2.9462669000980763e-05, "loss": 0.719, "step": 1499 }, { "epoch": 1.9191135290823267, "grad_norm": 0.5389598608016968, "learning_rate": 2.9449095848684233e-05, "loss": 0.7312, "step": 1500 }, { "epoch": 1.9191135290823267, "eval_loss": 0.01165055762976408, "eval_runtime": 10.8082, "eval_samples_per_second": 45.891, "eval_steps_per_second": 5.736, "step": 1500 }, { "epoch": 1.9203936314905192, "grad_norm": 0.5576955080032349, "learning_rate": 2.9435517583495633e-05, "loss": 0.7266, "step": 1501 }, { "epoch": 1.9216737338987118, "grad_norm": 0.5951018333435059, "learning_rate": 2.9421934214734768e-05, "loss": 0.7187, "step": 1502 }, { "epoch": 1.9229538363069045, "grad_norm": 0.524469792842865, "learning_rate": 2.9408345751724967e-05, "loss": 0.6702, "step": 1503 }, { "epoch": 1.9242339387150973, "grad_norm": 0.5927678942680359, "learning_rate": 2.9394752203793038e-05, "loss": 0.7109, "step": 1504 }, { "epoch": 1.9255140411232898, "grad_norm": 0.5567402243614197, "learning_rate": 2.938115358026929e-05, "loss": 0.7023, "step": 1505 }, { "epoch": 1.9267941435314824, "grad_norm": 0.5909476280212402, "learning_rate": 2.9367549890487513e-05, "loss": 0.698, "step": 1506 }, { "epoch": 1.9280742459396751, "grad_norm": 0.5594074726104736, "learning_rate": 2.9353941143784977e-05, "loss": 0.7081, "step": 1507 }, { "epoch": 1.929354348347868, "grad_norm": 0.6216226816177368, "learning_rate": 2.934032734950241e-05, "loss": 0.7221, "step": 1508 }, { "epoch": 1.9306344507560604, "grad_norm": 0.6358545422554016, "learning_rate": 2.9326708516984032e-05, "loss": 0.7614, "step": 1509 }, { "epoch": 1.931914553164253, "grad_norm": 0.5890107154846191, "learning_rate": 2.9313084655577486e-05, "loss": 0.6897, "step": 1510 }, { "epoch": 1.9331946555724457, "grad_norm": 0.6627918481826782, "learning_rate": 2.9299455774633894e-05, "loss": 0.7093, "step": 1511 }, { "epoch": 1.9344747579806385, "grad_norm": 0.566710352897644, "learning_rate": 2.928582188350781e-05, "loss": 0.7231, "step": 1512 }, { "epoch": 1.935754860388831, "grad_norm": 0.6416410803794861, "learning_rate": 2.927218299155723e-05, "loss": 0.7182, "step": 1513 }, { "epoch": 1.9370349627970238, "grad_norm": 0.5659756064414978, "learning_rate": 2.9258539108143588e-05, "loss": 0.6968, "step": 1514 }, { "epoch": 1.9383150652052166, "grad_norm": 0.5462925434112549, "learning_rate": 2.924489024263174e-05, "loss": 0.6949, "step": 1515 }, { "epoch": 1.939595167613409, "grad_norm": 0.5830070972442627, "learning_rate": 2.923123640438996e-05, "loss": 0.7338, "step": 1516 }, { "epoch": 1.9408752700216017, "grad_norm": 0.5738305449485779, "learning_rate": 2.921757760278992e-05, "loss": 0.7469, "step": 1517 }, { "epoch": 1.9421553724297944, "grad_norm": 0.5708524584770203, "learning_rate": 2.9203913847206737e-05, "loss": 0.7122, "step": 1518 }, { "epoch": 1.9434354748379872, "grad_norm": 0.5795454382896423, "learning_rate": 2.9190245147018892e-05, "loss": 0.7516, "step": 1519 }, { "epoch": 1.9447155772461797, "grad_norm": 0.5814696550369263, "learning_rate": 2.9176571511608278e-05, "loss": 0.7455, "step": 1520 }, { "epoch": 1.9459956796543723, "grad_norm": 0.576891303062439, "learning_rate": 2.9162892950360175e-05, "loss": 0.7284, "step": 1521 }, { "epoch": 1.947275782062565, "grad_norm": 0.5155112147331238, "learning_rate": 2.914920947266324e-05, "loss": 0.7182, "step": 1522 }, { "epoch": 1.9485558844707578, "grad_norm": 0.5739624500274658, "learning_rate": 2.9135521087909494e-05, "loss": 0.7504, "step": 1523 }, { "epoch": 1.9498359868789503, "grad_norm": 0.4973497986793518, "learning_rate": 2.9121827805494347e-05, "loss": 0.6832, "step": 1524 }, { "epoch": 1.9511160892871429, "grad_norm": 0.5796115398406982, "learning_rate": 2.910812963481656e-05, "loss": 0.7019, "step": 1525 }, { "epoch": 1.9523961916953356, "grad_norm": 0.5252601504325867, "learning_rate": 2.9094426585278247e-05, "loss": 0.6923, "step": 1526 }, { "epoch": 1.9536762941035284, "grad_norm": 0.6089382171630859, "learning_rate": 2.908071866628487e-05, "loss": 0.6918, "step": 1527 }, { "epoch": 1.954956396511721, "grad_norm": 0.587431013584137, "learning_rate": 2.906700588724525e-05, "loss": 0.7439, "step": 1528 }, { "epoch": 1.9562364989199135, "grad_norm": 0.5854923129081726, "learning_rate": 2.9053288257571514e-05, "loss": 0.7272, "step": 1529 }, { "epoch": 1.9575166013281062, "grad_norm": 0.611205518245697, "learning_rate": 2.9039565786679142e-05, "loss": 0.7163, "step": 1530 }, { "epoch": 1.9575166013281062, "eval_loss": 0.011649779044091702, "eval_runtime": 10.8121, "eval_samples_per_second": 45.875, "eval_steps_per_second": 5.734, "step": 1530 }, { "epoch": 1.958796703736299, "grad_norm": 0.5490525364875793, "learning_rate": 2.9025838483986928e-05, "loss": 0.7181, "step": 1531 }, { "epoch": 1.9600768061444915, "grad_norm": 0.6593901515007019, "learning_rate": 2.9012106358916994e-05, "loss": 0.7268, "step": 1532 }, { "epoch": 1.961356908552684, "grad_norm": 0.6241600513458252, "learning_rate": 2.8998369420894746e-05, "loss": 0.6878, "step": 1533 }, { "epoch": 1.9626370109608768, "grad_norm": 0.5867098569869995, "learning_rate": 2.8984627679348922e-05, "loss": 0.7205, "step": 1534 }, { "epoch": 1.9639171133690696, "grad_norm": 0.5838148593902588, "learning_rate": 2.8970881143711542e-05, "loss": 0.7081, "step": 1535 }, { "epoch": 1.9651972157772621, "grad_norm": 0.6911570429801941, "learning_rate": 2.8957129823417916e-05, "loss": 0.742, "step": 1536 }, { "epoch": 1.9664773181854547, "grad_norm": 0.5508971214294434, "learning_rate": 2.894337372790664e-05, "loss": 0.689, "step": 1537 }, { "epoch": 1.9677574205936474, "grad_norm": 0.691329300403595, "learning_rate": 2.8929612866619603e-05, "loss": 0.7386, "step": 1538 }, { "epoch": 1.9690375230018402, "grad_norm": 0.5353361368179321, "learning_rate": 2.8915847249001934e-05, "loss": 0.7202, "step": 1539 }, { "epoch": 1.9703176254100327, "grad_norm": 0.768527626991272, "learning_rate": 2.890207688450205e-05, "loss": 0.7442, "step": 1540 }, { "epoch": 1.9715977278182255, "grad_norm": 0.6241726875305176, "learning_rate": 2.8888301782571618e-05, "loss": 0.7467, "step": 1541 }, { "epoch": 1.9728778302264183, "grad_norm": 0.6419370770454407, "learning_rate": 2.8874521952665566e-05, "loss": 0.7197, "step": 1542 }, { "epoch": 1.9741579326346108, "grad_norm": 0.5724735856056213, "learning_rate": 2.886073740424205e-05, "loss": 0.716, "step": 1543 }, { "epoch": 1.9754380350428034, "grad_norm": 0.6717302799224854, "learning_rate": 2.8846948146762476e-05, "loss": 0.7077, "step": 1544 }, { "epoch": 1.9767181374509961, "grad_norm": 0.5468635559082031, "learning_rate": 2.8833154189691495e-05, "loss": 0.7065, "step": 1545 }, { "epoch": 1.9779982398591889, "grad_norm": 0.5952850580215454, "learning_rate": 2.8819355542496946e-05, "loss": 0.6833, "step": 1546 }, { "epoch": 1.9792783422673814, "grad_norm": 0.5658401846885681, "learning_rate": 2.880555221464993e-05, "loss": 0.686, "step": 1547 }, { "epoch": 1.980558444675574, "grad_norm": 0.6140429377555847, "learning_rate": 2.8791744215624737e-05, "loss": 0.71, "step": 1548 }, { "epoch": 1.9818385470837667, "grad_norm": 0.5493887662887573, "learning_rate": 2.8777931554898855e-05, "loss": 0.73, "step": 1549 }, { "epoch": 1.9831186494919595, "grad_norm": 0.608961820602417, "learning_rate": 2.8764114241952996e-05, "loss": 0.7189, "step": 1550 }, { "epoch": 1.984398751900152, "grad_norm": 0.6077911853790283, "learning_rate": 2.8750292286271047e-05, "loss": 0.717, "step": 1551 }, { "epoch": 1.9856788543083446, "grad_norm": 0.6050461530685425, "learning_rate": 2.87364656973401e-05, "loss": 0.721, "step": 1552 }, { "epoch": 1.9869589567165373, "grad_norm": 0.5760023593902588, "learning_rate": 2.8722634484650397e-05, "loss": 0.7347, "step": 1553 }, { "epoch": 1.98823905912473, "grad_norm": 0.5113067030906677, "learning_rate": 2.8708798657695384e-05, "loss": 0.684, "step": 1554 }, { "epoch": 1.9895191615329226, "grad_norm": 0.5542285442352295, "learning_rate": 2.8694958225971664e-05, "loss": 0.679, "step": 1555 }, { "epoch": 1.9907992639411152, "grad_norm": 0.5793948173522949, "learning_rate": 2.8681113198978984e-05, "loss": 0.7055, "step": 1556 }, { "epoch": 1.992079366349308, "grad_norm": 0.5892935395240784, "learning_rate": 2.866726358622028e-05, "loss": 0.7034, "step": 1557 }, { "epoch": 1.9933594687575007, "grad_norm": 0.5793341994285583, "learning_rate": 2.8653409397201596e-05, "loss": 0.699, "step": 1558 }, { "epoch": 1.9946395711656932, "grad_norm": 0.5980877876281738, "learning_rate": 2.8639550641432145e-05, "loss": 0.7303, "step": 1559 }, { "epoch": 1.9959196735738858, "grad_norm": 0.5784668326377869, "learning_rate": 2.8625687328424266e-05, "loss": 0.7412, "step": 1560 }, { "epoch": 1.9959196735738858, "eval_loss": 0.011627291329205036, "eval_runtime": 10.8138, "eval_samples_per_second": 45.867, "eval_steps_per_second": 5.733, "step": 1560 }, { "epoch": 1.9971997759820785, "grad_norm": 0.5964111089706421, "learning_rate": 2.8611819467693424e-05, "loss": 0.7598, "step": 1561 }, { "epoch": 1.9984798783902713, "grad_norm": 0.5467501282691956, "learning_rate": 2.8597947068758206e-05, "loss": 0.7211, "step": 1562 }, { "epoch": 1.9997599807984638, "grad_norm": 0.5621283650398254, "learning_rate": 2.858407014114032e-05, "loss": 0.7303, "step": 1563 }, { "epoch": 2.0, "grad_norm": 0.8166683316230774, "learning_rate": 2.8570188694364573e-05, "loss": 0.5976, "step": 1564 }, { "epoch": 2.0012801024081925, "grad_norm": 0.6948720812797546, "learning_rate": 2.855630273795888e-05, "loss": 0.6735, "step": 1565 }, { "epoch": 2.0025602048163855, "grad_norm": 0.6384479403495789, "learning_rate": 2.8542412281454245e-05, "loss": 0.7041, "step": 1566 }, { "epoch": 2.003840307224578, "grad_norm": 0.5531007051467896, "learning_rate": 2.8528517334384775e-05, "loss": 0.655, "step": 1567 }, { "epoch": 2.0051204096327706, "grad_norm": 0.6195947527885437, "learning_rate": 2.8514617906287645e-05, "loss": 0.6428, "step": 1568 }, { "epoch": 2.006400512040963, "grad_norm": 0.6231208443641663, "learning_rate": 2.85007140067031e-05, "loss": 0.6981, "step": 1569 }, { "epoch": 2.007680614449156, "grad_norm": 0.5673173666000366, "learning_rate": 2.8486805645174486e-05, "loss": 0.693, "step": 1570 }, { "epoch": 2.0089607168573487, "grad_norm": 0.5763584971427917, "learning_rate": 2.847289283124817e-05, "loss": 0.6891, "step": 1571 }, { "epoch": 2.010240819265541, "grad_norm": 0.5962164998054504, "learning_rate": 2.8458975574473596e-05, "loss": 0.6773, "step": 1572 }, { "epoch": 2.0115209216737338, "grad_norm": 0.5427728295326233, "learning_rate": 2.8445053884403276e-05, "loss": 0.6789, "step": 1573 }, { "epoch": 2.0128010240819267, "grad_norm": 0.5714277625083923, "learning_rate": 2.8431127770592723e-05, "loss": 0.7139, "step": 1574 }, { "epoch": 2.0140811264901193, "grad_norm": 0.5537965893745422, "learning_rate": 2.841719724260052e-05, "loss": 0.6683, "step": 1575 }, { "epoch": 2.015361228898312, "grad_norm": 0.6056164503097534, "learning_rate": 2.840326230998827e-05, "loss": 0.6768, "step": 1576 }, { "epoch": 2.0166413313065044, "grad_norm": 0.6324855089187622, "learning_rate": 2.8389322982320592e-05, "loss": 0.7167, "step": 1577 }, { "epoch": 2.0179214337146973, "grad_norm": 0.6200981736183167, "learning_rate": 2.8375379269165128e-05, "loss": 0.686, "step": 1578 }, { "epoch": 2.01920153612289, "grad_norm": 0.5917149782180786, "learning_rate": 2.8361431180092534e-05, "loss": 0.6538, "step": 1579 }, { "epoch": 2.0204816385310824, "grad_norm": 0.6273303627967834, "learning_rate": 2.8347478724676462e-05, "loss": 0.6721, "step": 1580 }, { "epoch": 2.021761740939275, "grad_norm": 0.5992140769958496, "learning_rate": 2.8333521912493557e-05, "loss": 0.6772, "step": 1581 }, { "epoch": 2.023041843347468, "grad_norm": 0.6496381759643555, "learning_rate": 2.831956075312348e-05, "loss": 0.6576, "step": 1582 }, { "epoch": 2.0243219457556605, "grad_norm": 0.5352444052696228, "learning_rate": 2.830559525614884e-05, "loss": 0.6692, "step": 1583 }, { "epoch": 2.025602048163853, "grad_norm": 0.6139085292816162, "learning_rate": 2.8291625431155244e-05, "loss": 0.6756, "step": 1584 }, { "epoch": 2.0268821505720456, "grad_norm": 0.5375662446022034, "learning_rate": 2.8277651287731273e-05, "loss": 0.6947, "step": 1585 }, { "epoch": 2.0281622529802386, "grad_norm": 0.6130796670913696, "learning_rate": 2.8263672835468456e-05, "loss": 0.692, "step": 1586 }, { "epoch": 2.029442355388431, "grad_norm": 0.5520009398460388, "learning_rate": 2.82496900839613e-05, "loss": 0.6796, "step": 1587 }, { "epoch": 2.0307224577966236, "grad_norm": 0.6222859621047974, "learning_rate": 2.8235703042807246e-05, "loss": 0.6699, "step": 1588 }, { "epoch": 2.032002560204816, "grad_norm": 0.5752348899841309, "learning_rate": 2.822171172160667e-05, "loss": 0.6819, "step": 1589 }, { "epoch": 2.033282662613009, "grad_norm": 0.6140403747558594, "learning_rate": 2.8207716129962926e-05, "loss": 0.6978, "step": 1590 }, { "epoch": 2.033282662613009, "eval_loss": 0.011672087013721466, "eval_runtime": 10.8084, "eval_samples_per_second": 45.89, "eval_steps_per_second": 5.736, "step": 1590 }, { "epoch": 2.0345627650212017, "grad_norm": 0.6465091109275818, "learning_rate": 2.819371627748226e-05, "loss": 0.691, "step": 1591 }, { "epoch": 2.0358428674293942, "grad_norm": 0.5918066501617432, "learning_rate": 2.817971217377386e-05, "loss": 0.7131, "step": 1592 }, { "epoch": 2.0371229698375872, "grad_norm": 0.6345959901809692, "learning_rate": 2.8165703828449826e-05, "loss": 0.649, "step": 1593 }, { "epoch": 2.0384030722457798, "grad_norm": 0.6075990200042725, "learning_rate": 2.815169125112517e-05, "loss": 0.7051, "step": 1594 }, { "epoch": 2.0396831746539723, "grad_norm": 0.5795350670814514, "learning_rate": 2.813767445141781e-05, "loss": 0.7098, "step": 1595 }, { "epoch": 2.040963277062165, "grad_norm": 0.610453724861145, "learning_rate": 2.812365343894857e-05, "loss": 0.6697, "step": 1596 }, { "epoch": 2.042243379470358, "grad_norm": 0.5452365279197693, "learning_rate": 2.810962822334115e-05, "loss": 0.6554, "step": 1597 }, { "epoch": 2.0435234818785504, "grad_norm": 0.5816706418991089, "learning_rate": 2.8095598814222147e-05, "loss": 0.6841, "step": 1598 }, { "epoch": 2.044803584286743, "grad_norm": 0.5663377642631531, "learning_rate": 2.808156522122103e-05, "loss": 0.6726, "step": 1599 }, { "epoch": 2.0460836866949355, "grad_norm": 0.5797086358070374, "learning_rate": 2.806752745397015e-05, "loss": 0.6763, "step": 1600 }, { "epoch": 2.0473637891031284, "grad_norm": 0.5999887585639954, "learning_rate": 2.8053485522104706e-05, "loss": 0.7372, "step": 1601 }, { "epoch": 2.048643891511321, "grad_norm": 0.5794069170951843, "learning_rate": 2.803943943526276e-05, "loss": 0.6784, "step": 1602 }, { "epoch": 2.0499239939195135, "grad_norm": 0.6007727384567261, "learning_rate": 2.802538920308524e-05, "loss": 0.6691, "step": 1603 }, { "epoch": 2.051204096327706, "grad_norm": 0.632462739944458, "learning_rate": 2.801133483521591e-05, "loss": 0.7218, "step": 1604 }, { "epoch": 2.052484198735899, "grad_norm": 0.6296536922454834, "learning_rate": 2.799727634130137e-05, "loss": 0.6584, "step": 1605 }, { "epoch": 2.0537643011440916, "grad_norm": 0.5758532881736755, "learning_rate": 2.7983213730991055e-05, "loss": 0.6119, "step": 1606 }, { "epoch": 2.055044403552284, "grad_norm": 0.6606136560440063, "learning_rate": 2.7969147013937227e-05, "loss": 0.6784, "step": 1607 }, { "epoch": 2.0563245059604767, "grad_norm": 0.5617915391921997, "learning_rate": 2.7955076199794954e-05, "loss": 0.6509, "step": 1608 }, { "epoch": 2.0576046083686697, "grad_norm": 0.6208764910697937, "learning_rate": 2.794100129822214e-05, "loss": 0.6751, "step": 1609 }, { "epoch": 2.058884710776862, "grad_norm": 0.5615843534469604, "learning_rate": 2.7926922318879474e-05, "loss": 0.709, "step": 1610 }, { "epoch": 2.0601648131850547, "grad_norm": 0.6210365295410156, "learning_rate": 2.791283927143045e-05, "loss": 0.6928, "step": 1611 }, { "epoch": 2.0614449155932473, "grad_norm": 0.59096759557724, "learning_rate": 2.7898752165541365e-05, "loss": 0.6579, "step": 1612 }, { "epoch": 2.0627250180014403, "grad_norm": 0.6035891175270081, "learning_rate": 2.7884661010881284e-05, "loss": 0.6522, "step": 1613 }, { "epoch": 2.064005120409633, "grad_norm": 0.6002820730209351, "learning_rate": 2.7870565817122054e-05, "loss": 0.6636, "step": 1614 }, { "epoch": 2.0652852228178253, "grad_norm": 0.648118257522583, "learning_rate": 2.785646659393831e-05, "loss": 0.6769, "step": 1615 }, { "epoch": 2.066565325226018, "grad_norm": 0.6546078324317932, "learning_rate": 2.7842363351007443e-05, "loss": 0.679, "step": 1616 }, { "epoch": 2.067845427634211, "grad_norm": 0.63655024766922, "learning_rate": 2.7828256098009595e-05, "loss": 0.7468, "step": 1617 }, { "epoch": 2.0691255300424034, "grad_norm": 0.6780474781990051, "learning_rate": 2.7814144844627664e-05, "loss": 0.6864, "step": 1618 }, { "epoch": 2.070405632450596, "grad_norm": 0.5667698383331299, "learning_rate": 2.7800029600547312e-05, "loss": 0.7232, "step": 1619 }, { "epoch": 2.0716857348587885, "grad_norm": 0.6375884413719177, "learning_rate": 2.7785910375456914e-05, "loss": 0.7079, "step": 1620 }, { "epoch": 2.0716857348587885, "eval_loss": 0.011663525365293026, "eval_runtime": 10.8358, "eval_samples_per_second": 45.774, "eval_steps_per_second": 5.722, "step": 1620 }, { "epoch": 2.0729658372669815, "grad_norm": 0.5780451893806458, "learning_rate": 2.7771787179047588e-05, "loss": 0.6597, "step": 1621 }, { "epoch": 2.074245939675174, "grad_norm": 0.5665174126625061, "learning_rate": 2.7757660021013184e-05, "loss": 0.6903, "step": 1622 }, { "epoch": 2.0755260420833666, "grad_norm": 0.5880652666091919, "learning_rate": 2.7743528911050267e-05, "loss": 0.6782, "step": 1623 }, { "epoch": 2.0768061444915595, "grad_norm": 0.5618604421615601, "learning_rate": 2.7729393858858107e-05, "loss": 0.6943, "step": 1624 }, { "epoch": 2.078086246899752, "grad_norm": 0.5834721326828003, "learning_rate": 2.7715254874138696e-05, "loss": 0.6962, "step": 1625 }, { "epoch": 2.0793663493079446, "grad_norm": 0.5367355942726135, "learning_rate": 2.7701111966596704e-05, "loss": 0.6948, "step": 1626 }, { "epoch": 2.080646451716137, "grad_norm": 0.5970818996429443, "learning_rate": 2.768696514593952e-05, "loss": 0.6602, "step": 1627 }, { "epoch": 2.08192655412433, "grad_norm": 0.5148850679397583, "learning_rate": 2.7672814421877182e-05, "loss": 0.6558, "step": 1628 }, { "epoch": 2.0832066565325227, "grad_norm": 0.5768963694572449, "learning_rate": 2.7658659804122452e-05, "loss": 0.6896, "step": 1629 }, { "epoch": 2.0844867589407152, "grad_norm": 0.5947193503379822, "learning_rate": 2.7644501302390727e-05, "loss": 0.6897, "step": 1630 }, { "epoch": 2.0857668613489078, "grad_norm": 0.6065978407859802, "learning_rate": 2.7630338926400093e-05, "loss": 0.6903, "step": 1631 }, { "epoch": 2.0870469637571007, "grad_norm": 0.596855878829956, "learning_rate": 2.761617268587128e-05, "loss": 0.6834, "step": 1632 }, { "epoch": 2.0883270661652933, "grad_norm": 0.625764787197113, "learning_rate": 2.7602002590527684e-05, "loss": 0.6586, "step": 1633 }, { "epoch": 2.089607168573486, "grad_norm": 0.6117658019065857, "learning_rate": 2.758782865009533e-05, "loss": 0.6924, "step": 1634 }, { "epoch": 2.0908872709816784, "grad_norm": 0.5718591809272766, "learning_rate": 2.7573650874302905e-05, "loss": 0.6327, "step": 1635 }, { "epoch": 2.0921673733898714, "grad_norm": 0.6709867715835571, "learning_rate": 2.7559469272881708e-05, "loss": 0.676, "step": 1636 }, { "epoch": 2.093447475798064, "grad_norm": 0.6376213431358337, "learning_rate": 2.754528385556567e-05, "loss": 0.6964, "step": 1637 }, { "epoch": 2.0947275782062564, "grad_norm": 0.6515515446662903, "learning_rate": 2.7531094632091352e-05, "loss": 0.698, "step": 1638 }, { "epoch": 2.096007680614449, "grad_norm": 0.57508385181427, "learning_rate": 2.751690161219791e-05, "loss": 0.6692, "step": 1639 }, { "epoch": 2.097287783022642, "grad_norm": 0.6378449201583862, "learning_rate": 2.750270480562712e-05, "loss": 0.6721, "step": 1640 }, { "epoch": 2.0985678854308345, "grad_norm": 0.608546793460846, "learning_rate": 2.7488504222123342e-05, "loss": 0.684, "step": 1641 }, { "epoch": 2.099847987839027, "grad_norm": 0.644956648349762, "learning_rate": 2.7474299871433543e-05, "loss": 0.6897, "step": 1642 }, { "epoch": 2.1011280902472196, "grad_norm": 0.6527913808822632, "learning_rate": 2.7460091763307275e-05, "loss": 0.6999, "step": 1643 }, { "epoch": 2.1024081926554126, "grad_norm": 0.5840986371040344, "learning_rate": 2.7445879907496656e-05, "loss": 0.6827, "step": 1644 }, { "epoch": 2.103688295063605, "grad_norm": 0.6439254879951477, "learning_rate": 2.7431664313756394e-05, "loss": 0.6795, "step": 1645 }, { "epoch": 2.1049683974717976, "grad_norm": 0.6222280859947205, "learning_rate": 2.7417444991843746e-05, "loss": 0.6957, "step": 1646 }, { "epoch": 2.10624849987999, "grad_norm": 0.573788583278656, "learning_rate": 2.7403221951518533e-05, "loss": 0.6791, "step": 1647 }, { "epoch": 2.107528602288183, "grad_norm": 0.6004598140716553, "learning_rate": 2.738899520254314e-05, "loss": 0.6659, "step": 1648 }, { "epoch": 2.1088087046963757, "grad_norm": 0.5855998396873474, "learning_rate": 2.7374764754682482e-05, "loss": 0.6604, "step": 1649 }, { "epoch": 2.1100888071045683, "grad_norm": 0.6659582257270813, "learning_rate": 2.736053061770401e-05, "loss": 0.6638, "step": 1650 }, { "epoch": 2.1100888071045683, "eval_loss": 0.011645011603832245, "eval_runtime": 10.8273, "eval_samples_per_second": 45.81, "eval_steps_per_second": 5.726, "step": 1650 }, { "epoch": 2.111368909512761, "grad_norm": 0.6403827667236328, "learning_rate": 2.7346292801377737e-05, "loss": 0.6668, "step": 1651 }, { "epoch": 2.112649011920954, "grad_norm": 0.5976318717002869, "learning_rate": 2.7332051315476166e-05, "loss": 0.7139, "step": 1652 }, { "epoch": 2.1139291143291463, "grad_norm": 0.59450763463974, "learning_rate": 2.7317806169774325e-05, "loss": 0.643, "step": 1653 }, { "epoch": 2.115209216737339, "grad_norm": 0.6102283000946045, "learning_rate": 2.730355737404978e-05, "loss": 0.6299, "step": 1654 }, { "epoch": 2.116489319145532, "grad_norm": 0.6156714558601379, "learning_rate": 2.7289304938082583e-05, "loss": 0.6439, "step": 1655 }, { "epoch": 2.1177694215537244, "grad_norm": 0.660211980342865, "learning_rate": 2.727504887165527e-05, "loss": 0.6739, "step": 1656 }, { "epoch": 2.119049523961917, "grad_norm": 0.6008319854736328, "learning_rate": 2.7260789184552902e-05, "loss": 0.6474, "step": 1657 }, { "epoch": 2.1203296263701095, "grad_norm": 0.6325721740722656, "learning_rate": 2.7246525886562995e-05, "loss": 0.657, "step": 1658 }, { "epoch": 2.1216097287783025, "grad_norm": 0.6137465834617615, "learning_rate": 2.723225898747556e-05, "loss": 0.6779, "step": 1659 }, { "epoch": 2.122889831186495, "grad_norm": 0.582832932472229, "learning_rate": 2.721798849708308e-05, "loss": 0.6648, "step": 1660 }, { "epoch": 2.1241699335946875, "grad_norm": 0.5986790060997009, "learning_rate": 2.7203714425180497e-05, "loss": 0.6925, "step": 1661 }, { "epoch": 2.12545003600288, "grad_norm": 0.593242883682251, "learning_rate": 2.7189436781565218e-05, "loss": 0.6388, "step": 1662 }, { "epoch": 2.126730138411073, "grad_norm": 0.6194828748703003, "learning_rate": 2.717515557603709e-05, "loss": 0.71, "step": 1663 }, { "epoch": 2.1280102408192656, "grad_norm": 0.6205288171768188, "learning_rate": 2.716087081839841e-05, "loss": 0.6607, "step": 1664 }, { "epoch": 2.129290343227458, "grad_norm": 0.6458435654640198, "learning_rate": 2.7146582518453918e-05, "loss": 0.7057, "step": 1665 }, { "epoch": 2.1305704456356507, "grad_norm": 0.5268846750259399, "learning_rate": 2.7132290686010795e-05, "loss": 0.6712, "step": 1666 }, { "epoch": 2.1318505480438437, "grad_norm": 0.6873646378517151, "learning_rate": 2.7117995330878604e-05, "loss": 0.6888, "step": 1667 }, { "epoch": 2.133130650452036, "grad_norm": 0.5608901977539062, "learning_rate": 2.7103696462869386e-05, "loss": 0.6615, "step": 1668 }, { "epoch": 2.1344107528602287, "grad_norm": 0.6234862804412842, "learning_rate": 2.7089394091797547e-05, "loss": 0.7017, "step": 1669 }, { "epoch": 2.1356908552684213, "grad_norm": 0.5756520628929138, "learning_rate": 2.7075088227479912e-05, "loss": 0.6798, "step": 1670 }, { "epoch": 2.1369709576766143, "grad_norm": 0.5852974057197571, "learning_rate": 2.7060778879735714e-05, "loss": 0.6588, "step": 1671 }, { "epoch": 2.138251060084807, "grad_norm": 0.5879574418067932, "learning_rate": 2.7046466058386567e-05, "loss": 0.6645, "step": 1672 }, { "epoch": 2.1395311624929993, "grad_norm": 0.6288869976997375, "learning_rate": 2.7032149773256454e-05, "loss": 0.6732, "step": 1673 }, { "epoch": 2.140811264901192, "grad_norm": 0.6149235963821411, "learning_rate": 2.7017830034171772e-05, "loss": 0.7066, "step": 1674 }, { "epoch": 2.142091367309385, "grad_norm": 0.5771135091781616, "learning_rate": 2.7003506850961262e-05, "loss": 0.6752, "step": 1675 }, { "epoch": 2.1433714697175774, "grad_norm": 0.591477632522583, "learning_rate": 2.6989180233456034e-05, "loss": 0.6893, "step": 1676 }, { "epoch": 2.14465157212577, "grad_norm": 0.5606040954589844, "learning_rate": 2.697485019148955e-05, "loss": 0.6712, "step": 1677 }, { "epoch": 2.145931674533963, "grad_norm": 0.6028363704681396, "learning_rate": 2.6960516734897638e-05, "loss": 0.659, "step": 1678 }, { "epoch": 2.1472117769421555, "grad_norm": 0.5561127662658691, "learning_rate": 2.6946179873518453e-05, "loss": 0.6857, "step": 1679 }, { "epoch": 2.148491879350348, "grad_norm": 0.5461053848266602, "learning_rate": 2.6931839617192507e-05, "loss": 0.6967, "step": 1680 }, { "epoch": 2.148491879350348, "eval_loss": 0.01164963562041521, "eval_runtime": 10.8268, "eval_samples_per_second": 45.812, "eval_steps_per_second": 5.727, "step": 1680 }, { "epoch": 2.1497719817585406, "grad_norm": 0.5463610291481018, "learning_rate": 2.6917495975762623e-05, "loss": 0.6513, "step": 1681 }, { "epoch": 2.1510520841667335, "grad_norm": 0.6252394914627075, "learning_rate": 2.6903148959073947e-05, "loss": 0.6859, "step": 1682 }, { "epoch": 2.152332186574926, "grad_norm": 0.5732648968696594, "learning_rate": 2.6888798576973955e-05, "loss": 0.7048, "step": 1683 }, { "epoch": 2.1536122889831186, "grad_norm": 0.565711259841919, "learning_rate": 2.6874444839312427e-05, "loss": 0.6963, "step": 1684 }, { "epoch": 2.154892391391311, "grad_norm": 0.539977490901947, "learning_rate": 2.6860087755941454e-05, "loss": 0.6532, "step": 1685 }, { "epoch": 2.156172493799504, "grad_norm": 0.5586331486701965, "learning_rate": 2.6845727336715393e-05, "loss": 0.7118, "step": 1686 }, { "epoch": 2.1574525962076967, "grad_norm": 0.5553241968154907, "learning_rate": 2.6831363591490945e-05, "loss": 0.6503, "step": 1687 }, { "epoch": 2.1587326986158892, "grad_norm": 0.5359736680984497, "learning_rate": 2.681699653012704e-05, "loss": 0.7141, "step": 1688 }, { "epoch": 2.1600128010240818, "grad_norm": 0.5906563997268677, "learning_rate": 2.68026261624849e-05, "loss": 0.6937, "step": 1689 }, { "epoch": 2.1612929034322748, "grad_norm": 0.5959696173667908, "learning_rate": 2.6788252498428048e-05, "loss": 0.6787, "step": 1690 }, { "epoch": 2.1625730058404673, "grad_norm": 0.5390402674674988, "learning_rate": 2.677387554782222e-05, "loss": 0.6971, "step": 1691 }, { "epoch": 2.16385310824866, "grad_norm": 0.5669422149658203, "learning_rate": 2.6759495320535448e-05, "loss": 0.6937, "step": 1692 }, { "epoch": 2.1651332106568524, "grad_norm": 0.5678061842918396, "learning_rate": 2.6745111826437987e-05, "loss": 0.668, "step": 1693 }, { "epoch": 2.1664133130650454, "grad_norm": 0.5993732810020447, "learning_rate": 2.6730725075402358e-05, "loss": 0.6931, "step": 1694 }, { "epoch": 2.167693415473238, "grad_norm": 0.6012265682220459, "learning_rate": 2.671633507730329e-05, "loss": 0.6892, "step": 1695 }, { "epoch": 2.1689735178814304, "grad_norm": 0.6299840211868286, "learning_rate": 2.6701941842017755e-05, "loss": 0.6923, "step": 1696 }, { "epoch": 2.170253620289623, "grad_norm": 0.5930740833282471, "learning_rate": 2.6687545379424954e-05, "loss": 0.6837, "step": 1697 }, { "epoch": 2.171533722697816, "grad_norm": 0.6240190863609314, "learning_rate": 2.667314569940629e-05, "loss": 0.715, "step": 1698 }, { "epoch": 2.1728138251060085, "grad_norm": 0.595062792301178, "learning_rate": 2.6658742811845377e-05, "loss": 0.65, "step": 1699 }, { "epoch": 2.174093927514201, "grad_norm": 0.587990939617157, "learning_rate": 2.664433672662804e-05, "loss": 0.6612, "step": 1700 }, { "epoch": 2.1753740299223936, "grad_norm": 0.6491554379463196, "learning_rate": 2.6629927453642293e-05, "loss": 0.6947, "step": 1701 }, { "epoch": 2.1766541323305866, "grad_norm": 0.5642626881599426, "learning_rate": 2.661551500277833e-05, "loss": 0.6916, "step": 1702 }, { "epoch": 2.177934234738779, "grad_norm": 0.6086171269416809, "learning_rate": 2.6601099383928545e-05, "loss": 0.6939, "step": 1703 }, { "epoch": 2.1792143371469717, "grad_norm": 0.5727648735046387, "learning_rate": 2.6586680606987485e-05, "loss": 0.682, "step": 1704 }, { "epoch": 2.180494439555164, "grad_norm": 0.5541107654571533, "learning_rate": 2.6572258681851878e-05, "loss": 0.666, "step": 1705 }, { "epoch": 2.181774541963357, "grad_norm": 0.6434026956558228, "learning_rate": 2.6557833618420614e-05, "loss": 0.6979, "step": 1706 }, { "epoch": 2.1830546443715497, "grad_norm": 0.5662131309509277, "learning_rate": 2.6543405426594725e-05, "loss": 0.6467, "step": 1707 }, { "epoch": 2.1843347467797423, "grad_norm": 0.5646231770515442, "learning_rate": 2.65289741162774e-05, "loss": 0.6804, "step": 1708 }, { "epoch": 2.1856148491879352, "grad_norm": 0.5460836887359619, "learning_rate": 2.6514539697373964e-05, "loss": 0.658, "step": 1709 }, { "epoch": 2.186894951596128, "grad_norm": 0.687023937702179, "learning_rate": 2.6500102179791887e-05, "loss": 0.6993, "step": 1710 }, { "epoch": 2.186894951596128, "eval_loss": 0.011640787124633789, "eval_runtime": 10.8231, "eval_samples_per_second": 45.828, "eval_steps_per_second": 5.729, "step": 1710 }, { "epoch": 2.1881750540043203, "grad_norm": 0.5741842985153198, "learning_rate": 2.6485661573440746e-05, "loss": 0.6554, "step": 1711 }, { "epoch": 2.189455156412513, "grad_norm": 0.5959102511405945, "learning_rate": 2.6471217888232255e-05, "loss": 0.6763, "step": 1712 }, { "epoch": 2.190735258820706, "grad_norm": 0.6111892461776733, "learning_rate": 2.645677113408023e-05, "loss": 0.7032, "step": 1713 }, { "epoch": 2.1920153612288984, "grad_norm": 0.621751070022583, "learning_rate": 2.644232132090061e-05, "loss": 0.6911, "step": 1714 }, { "epoch": 2.193295463637091, "grad_norm": 0.5443041324615479, "learning_rate": 2.6427868458611404e-05, "loss": 0.6594, "step": 1715 }, { "epoch": 2.1945755660452835, "grad_norm": 0.6254043579101562, "learning_rate": 2.6413412557132753e-05, "loss": 0.6904, "step": 1716 }, { "epoch": 2.1958556684534765, "grad_norm": 0.5650925636291504, "learning_rate": 2.6398953626386852e-05, "loss": 0.6876, "step": 1717 }, { "epoch": 2.197135770861669, "grad_norm": 0.5712993741035461, "learning_rate": 2.638449167629798e-05, "loss": 0.6473, "step": 1718 }, { "epoch": 2.1984158732698615, "grad_norm": 0.6259288787841797, "learning_rate": 2.6370026716792505e-05, "loss": 0.6534, "step": 1719 }, { "epoch": 2.199695975678054, "grad_norm": 0.5659099817276001, "learning_rate": 2.6355558757798843e-05, "loss": 0.6968, "step": 1720 }, { "epoch": 2.200976078086247, "grad_norm": 0.6160751581192017, "learning_rate": 2.634108780924749e-05, "loss": 0.6777, "step": 1721 }, { "epoch": 2.2022561804944396, "grad_norm": 0.5935443639755249, "learning_rate": 2.6326613881070958e-05, "loss": 0.6792, "step": 1722 }, { "epoch": 2.203536282902632, "grad_norm": 0.6939257383346558, "learning_rate": 2.6312136983203848e-05, "loss": 0.6756, "step": 1723 }, { "epoch": 2.2048163853108247, "grad_norm": 0.6069145202636719, "learning_rate": 2.6297657125582765e-05, "loss": 0.7108, "step": 1724 }, { "epoch": 2.2060964877190177, "grad_norm": 0.581441342830658, "learning_rate": 2.6283174318146352e-05, "loss": 0.6849, "step": 1725 }, { "epoch": 2.20737659012721, "grad_norm": 0.5974293351173401, "learning_rate": 2.6268688570835302e-05, "loss": 0.6587, "step": 1726 }, { "epoch": 2.2086566925354028, "grad_norm": 0.5970581769943237, "learning_rate": 2.6254199893592293e-05, "loss": 0.6656, "step": 1727 }, { "epoch": 2.2099367949435953, "grad_norm": 0.5888835787773132, "learning_rate": 2.623970829636203e-05, "loss": 0.6743, "step": 1728 }, { "epoch": 2.2112168973517883, "grad_norm": 0.5594384670257568, "learning_rate": 2.6225213789091218e-05, "loss": 0.6939, "step": 1729 }, { "epoch": 2.212496999759981, "grad_norm": 0.5629306435585022, "learning_rate": 2.621071638172857e-05, "loss": 0.6842, "step": 1730 }, { "epoch": 2.2137771021681734, "grad_norm": 0.5158959627151489, "learning_rate": 2.619621608422477e-05, "loss": 0.6321, "step": 1731 }, { "epoch": 2.215057204576366, "grad_norm": 0.5734906196594238, "learning_rate": 2.6181712906532502e-05, "loss": 0.6727, "step": 1732 }, { "epoch": 2.216337306984559, "grad_norm": 0.55968177318573, "learning_rate": 2.616720685860642e-05, "loss": 0.6652, "step": 1733 }, { "epoch": 2.2176174093927514, "grad_norm": 0.559408962726593, "learning_rate": 2.615269795040315e-05, "loss": 0.637, "step": 1734 }, { "epoch": 2.218897511800944, "grad_norm": 0.5392422080039978, "learning_rate": 2.613818619188129e-05, "loss": 0.6718, "step": 1735 }, { "epoch": 2.2201776142091365, "grad_norm": 0.5550699234008789, "learning_rate": 2.612367159300137e-05, "loss": 0.6419, "step": 1736 }, { "epoch": 2.2214577166173295, "grad_norm": 0.5608376860618591, "learning_rate": 2.610915416372588e-05, "loss": 0.7034, "step": 1737 }, { "epoch": 2.222737819025522, "grad_norm": 0.5588756203651428, "learning_rate": 2.6094633914019277e-05, "loss": 0.6844, "step": 1738 }, { "epoch": 2.2240179214337146, "grad_norm": 0.5820834040641785, "learning_rate": 2.6080110853847922e-05, "loss": 0.6203, "step": 1739 }, { "epoch": 2.2252980238419076, "grad_norm": 0.5820999145507812, "learning_rate": 2.6065584993180123e-05, "loss": 0.7025, "step": 1740 }, { "epoch": 2.2252980238419076, "eval_loss": 0.01162695325911045, "eval_runtime": 10.8218, "eval_samples_per_second": 45.833, "eval_steps_per_second": 5.729, "step": 1740 }, { "epoch": 2.2265781262501, "grad_norm": 0.5654394030570984, "learning_rate": 2.60510563419861e-05, "loss": 0.6474, "step": 1741 }, { "epoch": 2.2278582286582926, "grad_norm": 0.5664428472518921, "learning_rate": 2.6036524910237993e-05, "loss": 0.6808, "step": 1742 }, { "epoch": 2.229138331066485, "grad_norm": 0.580121636390686, "learning_rate": 2.6021990707909858e-05, "loss": 0.663, "step": 1743 }, { "epoch": 2.230418433474678, "grad_norm": 0.5712918043136597, "learning_rate": 2.600745374497764e-05, "loss": 0.6333, "step": 1744 }, { "epoch": 2.2316985358828707, "grad_norm": 0.556452214717865, "learning_rate": 2.5992914031419174e-05, "loss": 0.6769, "step": 1745 }, { "epoch": 2.2329786382910632, "grad_norm": 0.577888548374176, "learning_rate": 2.5978371577214213e-05, "loss": 0.6828, "step": 1746 }, { "epoch": 2.234258740699256, "grad_norm": 0.5410756468772888, "learning_rate": 2.596382639234435e-05, "loss": 0.6648, "step": 1747 }, { "epoch": 2.2355388431074488, "grad_norm": 0.5517366528511047, "learning_rate": 2.5949278486793086e-05, "loss": 0.6921, "step": 1748 }, { "epoch": 2.2368189455156413, "grad_norm": 0.6139863729476929, "learning_rate": 2.593472787054578e-05, "loss": 0.643, "step": 1749 }, { "epoch": 2.238099047923834, "grad_norm": 0.6104927659034729, "learning_rate": 2.5920174553589633e-05, "loss": 0.7687, "step": 1750 }, { "epoch": 2.2393791503320264, "grad_norm": 0.5959731936454773, "learning_rate": 2.5905618545913728e-05, "loss": 0.6851, "step": 1751 }, { "epoch": 2.2406592527402194, "grad_norm": 0.5839214324951172, "learning_rate": 2.5891059857508974e-05, "loss": 0.6752, "step": 1752 }, { "epoch": 2.241939355148412, "grad_norm": 0.5770272016525269, "learning_rate": 2.5876498498368135e-05, "loss": 0.657, "step": 1753 }, { "epoch": 2.2432194575566045, "grad_norm": 0.575888454914093, "learning_rate": 2.586193447848579e-05, "loss": 0.6853, "step": 1754 }, { "epoch": 2.244499559964797, "grad_norm": 0.5530557632446289, "learning_rate": 2.584736780785837e-05, "loss": 0.6586, "step": 1755 }, { "epoch": 2.24577966237299, "grad_norm": 0.6000199317932129, "learning_rate": 2.5832798496484102e-05, "loss": 0.7374, "step": 1756 }, { "epoch": 2.2470597647811825, "grad_norm": 0.5491329431533813, "learning_rate": 2.5818226554363027e-05, "loss": 0.6658, "step": 1757 }, { "epoch": 2.248339867189375, "grad_norm": 0.5558183789253235, "learning_rate": 2.580365199149701e-05, "loss": 0.6819, "step": 1758 }, { "epoch": 2.2496199695975676, "grad_norm": 0.630332887172699, "learning_rate": 2.5789074817889704e-05, "loss": 0.6603, "step": 1759 }, { "epoch": 2.2509000720057606, "grad_norm": 0.6096137166023254, "learning_rate": 2.5774495043546548e-05, "loss": 0.7123, "step": 1760 }, { "epoch": 2.252180174413953, "grad_norm": 0.6396390199661255, "learning_rate": 2.575991267847477e-05, "loss": 0.6985, "step": 1761 }, { "epoch": 2.2534602768221457, "grad_norm": 0.5843227505683899, "learning_rate": 2.5745327732683384e-05, "loss": 0.6679, "step": 1762 }, { "epoch": 2.2547403792303387, "grad_norm": 0.6904280781745911, "learning_rate": 2.5730740216183168e-05, "loss": 0.6861, "step": 1763 }, { "epoch": 2.256020481638531, "grad_norm": 0.6529262065887451, "learning_rate": 2.5716150138986654e-05, "loss": 0.673, "step": 1764 }, { "epoch": 2.2573005840467237, "grad_norm": 0.5620155930519104, "learning_rate": 2.570155751110816e-05, "loss": 0.6612, "step": 1765 }, { "epoch": 2.2585806864549163, "grad_norm": 0.655309796333313, "learning_rate": 2.568696234256373e-05, "loss": 0.668, "step": 1766 }, { "epoch": 2.259860788863109, "grad_norm": 0.5984154939651489, "learning_rate": 2.567236464337117e-05, "loss": 0.7186, "step": 1767 }, { "epoch": 2.261140891271302, "grad_norm": 0.5751389861106873, "learning_rate": 2.5657764423549994e-05, "loss": 0.6656, "step": 1768 }, { "epoch": 2.2624209936794943, "grad_norm": 0.5889517664909363, "learning_rate": 2.5643161693121476e-05, "loss": 0.6598, "step": 1769 }, { "epoch": 2.263701096087687, "grad_norm": 0.5623475909233093, "learning_rate": 2.56285564621086e-05, "loss": 0.6939, "step": 1770 }, { "epoch": 2.263701096087687, "eval_loss": 0.011622007936239243, "eval_runtime": 10.8354, "eval_samples_per_second": 45.776, "eval_steps_per_second": 5.722, "step": 1770 }, { "epoch": 2.26498119849588, "grad_norm": 0.5731052160263062, "learning_rate": 2.561394874053607e-05, "loss": 0.66, "step": 1771 }, { "epoch": 2.2662613009040724, "grad_norm": 0.5799999237060547, "learning_rate": 2.5599338538430304e-05, "loss": 0.698, "step": 1772 }, { "epoch": 2.267541403312265, "grad_norm": 0.6327428221702576, "learning_rate": 2.55847258658194e-05, "loss": 0.6876, "step": 1773 }, { "epoch": 2.2688215057204575, "grad_norm": 0.54714035987854, "learning_rate": 2.5570110732733185e-05, "loss": 0.6542, "step": 1774 }, { "epoch": 2.2701016081286505, "grad_norm": 0.6353325843811035, "learning_rate": 2.555549314920315e-05, "loss": 0.6615, "step": 1775 }, { "epoch": 2.271381710536843, "grad_norm": 0.5877797603607178, "learning_rate": 2.554087312526248e-05, "loss": 0.6869, "step": 1776 }, { "epoch": 2.2726618129450356, "grad_norm": 0.5969734787940979, "learning_rate": 2.5526250670946026e-05, "loss": 0.6694, "step": 1777 }, { "epoch": 2.273941915353228, "grad_norm": 0.5800706744194031, "learning_rate": 2.5511625796290314e-05, "loss": 0.653, "step": 1778 }, { "epoch": 2.275222017761421, "grad_norm": 0.6266164183616638, "learning_rate": 2.5496998511333527e-05, "loss": 0.7097, "step": 1779 }, { "epoch": 2.2765021201696136, "grad_norm": 0.5548282861709595, "learning_rate": 2.5482368826115514e-05, "loss": 0.6457, "step": 1780 }, { "epoch": 2.277782222577806, "grad_norm": 0.6023533940315247, "learning_rate": 2.546773675067775e-05, "loss": 0.6873, "step": 1781 }, { "epoch": 2.2790623249859987, "grad_norm": 0.5827093720436096, "learning_rate": 2.545310229506338e-05, "loss": 0.6837, "step": 1782 }, { "epoch": 2.2803424273941917, "grad_norm": 0.6479482650756836, "learning_rate": 2.5438465469317142e-05, "loss": 0.6992, "step": 1783 }, { "epoch": 2.2816225298023842, "grad_norm": 0.6267648339271545, "learning_rate": 2.542382628348544e-05, "loss": 0.7157, "step": 1784 }, { "epoch": 2.2829026322105768, "grad_norm": 0.6263638734817505, "learning_rate": 2.5409184747616284e-05, "loss": 0.6808, "step": 1785 }, { "epoch": 2.2841827346187698, "grad_norm": 0.6246517300605774, "learning_rate": 2.5394540871759294e-05, "loss": 0.6782, "step": 1786 }, { "epoch": 2.2854628370269623, "grad_norm": 0.5735856294631958, "learning_rate": 2.5379894665965686e-05, "loss": 0.6775, "step": 1787 }, { "epoch": 2.286742939435155, "grad_norm": 0.6397892236709595, "learning_rate": 2.5365246140288302e-05, "loss": 0.656, "step": 1788 }, { "epoch": 2.2880230418433474, "grad_norm": 0.6607687473297119, "learning_rate": 2.5350595304781557e-05, "loss": 0.6905, "step": 1789 }, { "epoch": 2.28930314425154, "grad_norm": 0.6366332173347473, "learning_rate": 2.533594216950144e-05, "loss": 0.7036, "step": 1790 }, { "epoch": 2.290583246659733, "grad_norm": 0.591999888420105, "learning_rate": 2.5321286744505558e-05, "loss": 0.6698, "step": 1791 }, { "epoch": 2.2918633490679254, "grad_norm": 0.6242043375968933, "learning_rate": 2.530662903985305e-05, "loss": 0.6874, "step": 1792 }, { "epoch": 2.293143451476118, "grad_norm": 0.6108874082565308, "learning_rate": 2.5291969065604636e-05, "loss": 0.6775, "step": 1793 }, { "epoch": 2.294423553884311, "grad_norm": 0.5468871593475342, "learning_rate": 2.52773068318226e-05, "loss": 0.6388, "step": 1794 }, { "epoch": 2.2957036562925035, "grad_norm": 0.5810433030128479, "learning_rate": 2.526264234857077e-05, "loss": 0.6874, "step": 1795 }, { "epoch": 2.296983758700696, "grad_norm": 0.6179283857345581, "learning_rate": 2.524797562591451e-05, "loss": 0.6789, "step": 1796 }, { "epoch": 2.2982638611088886, "grad_norm": 0.5512781739234924, "learning_rate": 2.5233306673920735e-05, "loss": 0.636, "step": 1797 }, { "epoch": 2.299543963517081, "grad_norm": 0.5917335152626038, "learning_rate": 2.521863550265788e-05, "loss": 0.677, "step": 1798 }, { "epoch": 2.300824065925274, "grad_norm": 0.5568514466285706, "learning_rate": 2.5203962122195915e-05, "loss": 0.6804, "step": 1799 }, { "epoch": 2.3021041683334666, "grad_norm": 0.5666114687919617, "learning_rate": 2.5189286542606302e-05, "loss": 0.6994, "step": 1800 }, { "epoch": 2.3021041683334666, "eval_loss": 0.011595751158893108, "eval_runtime": 10.8252, "eval_samples_per_second": 45.819, "eval_steps_per_second": 5.727, "step": 1800 }, { "epoch": 2.303384270741659, "grad_norm": 0.5425809025764465, "learning_rate": 2.517460877396205e-05, "loss": 0.6891, "step": 1801 }, { "epoch": 2.304664373149852, "grad_norm": 0.5229185819625854, "learning_rate": 2.5159928826337638e-05, "loss": 0.657, "step": 1802 }, { "epoch": 2.3059444755580447, "grad_norm": 0.6061989068984985, "learning_rate": 2.514524670980905e-05, "loss": 0.6868, "step": 1803 }, { "epoch": 2.3072245779662373, "grad_norm": 0.5069493651390076, "learning_rate": 2.5130562434453775e-05, "loss": 0.648, "step": 1804 }, { "epoch": 2.30850468037443, "grad_norm": 0.6272199153900146, "learning_rate": 2.5115876010350762e-05, "loss": 0.6879, "step": 1805 }, { "epoch": 2.309784782782623, "grad_norm": 0.5859187245368958, "learning_rate": 2.5101187447580433e-05, "loss": 0.6661, "step": 1806 }, { "epoch": 2.3110648851908153, "grad_norm": 0.5726884007453918, "learning_rate": 2.50864967562247e-05, "loss": 0.6557, "step": 1807 }, { "epoch": 2.312344987599008, "grad_norm": 0.557464599609375, "learning_rate": 2.507180394636692e-05, "loss": 0.7158, "step": 1808 }, { "epoch": 2.3136250900072004, "grad_norm": 0.6684802770614624, "learning_rate": 2.50571090280919e-05, "loss": 0.6756, "step": 1809 }, { "epoch": 2.3149051924153934, "grad_norm": 0.635189950466156, "learning_rate": 2.5042412011485918e-05, "loss": 0.7325, "step": 1810 }, { "epoch": 2.316185294823586, "grad_norm": 0.6043376326560974, "learning_rate": 2.5027712906636664e-05, "loss": 0.696, "step": 1811 }, { "epoch": 2.3174653972317785, "grad_norm": 0.6636263728141785, "learning_rate": 2.501301172363327e-05, "loss": 0.7139, "step": 1812 }, { "epoch": 2.318745499639971, "grad_norm": 0.631271481513977, "learning_rate": 2.4998308472566315e-05, "loss": 0.7266, "step": 1813 }, { "epoch": 2.320025602048164, "grad_norm": 0.5650892853736877, "learning_rate": 2.4983603163527765e-05, "loss": 0.6902, "step": 1814 }, { "epoch": 2.3213057044563565, "grad_norm": 0.5594301223754883, "learning_rate": 2.4968895806611014e-05, "loss": 0.6911, "step": 1815 }, { "epoch": 2.322585806864549, "grad_norm": 0.5877586007118225, "learning_rate": 2.4954186411910876e-05, "loss": 0.6776, "step": 1816 }, { "epoch": 2.323865909272742, "grad_norm": 0.5810129642486572, "learning_rate": 2.493947498952353e-05, "loss": 0.6915, "step": 1817 }, { "epoch": 2.3251460116809346, "grad_norm": 0.5952797532081604, "learning_rate": 2.4924761549546576e-05, "loss": 0.6715, "step": 1818 }, { "epoch": 2.326426114089127, "grad_norm": 0.5925062894821167, "learning_rate": 2.4910046102078993e-05, "loss": 0.6518, "step": 1819 }, { "epoch": 2.3277062164973197, "grad_norm": 0.5474934577941895, "learning_rate": 2.4895328657221116e-05, "loss": 0.666, "step": 1820 }, { "epoch": 2.328986318905512, "grad_norm": 0.6176634430885315, "learning_rate": 2.488060922507469e-05, "loss": 0.7111, "step": 1821 }, { "epoch": 2.330266421313705, "grad_norm": 0.6067846417427063, "learning_rate": 2.4865887815742794e-05, "loss": 0.6588, "step": 1822 }, { "epoch": 2.3315465237218977, "grad_norm": 0.5685158371925354, "learning_rate": 2.4851164439329872e-05, "loss": 0.6391, "step": 1823 }, { "epoch": 2.3328266261300903, "grad_norm": 0.5903010368347168, "learning_rate": 2.4836439105941716e-05, "loss": 0.6659, "step": 1824 }, { "epoch": 2.3341067285382833, "grad_norm": 0.6228030920028687, "learning_rate": 2.4821711825685467e-05, "loss": 0.6544, "step": 1825 }, { "epoch": 2.335386830946476, "grad_norm": 0.5518401265144348, "learning_rate": 2.48069826086696e-05, "loss": 0.6822, "step": 1826 }, { "epoch": 2.3366669333546684, "grad_norm": 0.6300826668739319, "learning_rate": 2.479225146500392e-05, "loss": 0.7065, "step": 1827 }, { "epoch": 2.337947035762861, "grad_norm": 0.6295920610427856, "learning_rate": 2.4777518404799553e-05, "loss": 0.6738, "step": 1828 }, { "epoch": 2.339227138171054, "grad_norm": 0.6495180130004883, "learning_rate": 2.476278343816893e-05, "loss": 0.701, "step": 1829 }, { "epoch": 2.3405072405792464, "grad_norm": 0.5673889517784119, "learning_rate": 2.4748046575225817e-05, "loss": 0.6687, "step": 1830 }, { "epoch": 2.3405072405792464, "eval_loss": 0.011586235836148262, "eval_runtime": 10.8232, "eval_samples_per_second": 45.827, "eval_steps_per_second": 5.728, "step": 1830 }, { "epoch": 2.341787342987439, "grad_norm": 0.5827108025550842, "learning_rate": 2.4733307826085265e-05, "loss": 0.6957, "step": 1831 }, { "epoch": 2.3430674453956315, "grad_norm": 0.5745197534561157, "learning_rate": 2.4718567200863605e-05, "loss": 0.727, "step": 1832 }, { "epoch": 2.3443475478038245, "grad_norm": 0.5660216212272644, "learning_rate": 2.470382470967848e-05, "loss": 0.7051, "step": 1833 }, { "epoch": 2.345627650212017, "grad_norm": 0.554172694683075, "learning_rate": 2.468908036264881e-05, "loss": 0.6727, "step": 1834 }, { "epoch": 2.3469077526202096, "grad_norm": 0.5728502869606018, "learning_rate": 2.467433416989477e-05, "loss": 0.6635, "step": 1835 }, { "epoch": 2.348187855028402, "grad_norm": 0.5659500956535339, "learning_rate": 2.465958614153783e-05, "loss": 0.6571, "step": 1836 }, { "epoch": 2.349467957436595, "grad_norm": 0.6034412384033203, "learning_rate": 2.4644836287700704e-05, "loss": 0.7051, "step": 1837 }, { "epoch": 2.3507480598447876, "grad_norm": 0.5409714579582214, "learning_rate": 2.463008461850735e-05, "loss": 0.6398, "step": 1838 }, { "epoch": 2.35202816225298, "grad_norm": 0.6442564725875854, "learning_rate": 2.4615331144082984e-05, "loss": 0.6884, "step": 1839 }, { "epoch": 2.3533082646611727, "grad_norm": 0.593873918056488, "learning_rate": 2.4600575874554072e-05, "loss": 0.7073, "step": 1840 }, { "epoch": 2.3545883670693657, "grad_norm": 0.5618162751197815, "learning_rate": 2.458581882004829e-05, "loss": 0.6912, "step": 1841 }, { "epoch": 2.3558684694775582, "grad_norm": 0.6092703342437744, "learning_rate": 2.4571059990694547e-05, "loss": 0.6489, "step": 1842 }, { "epoch": 2.3571485718857508, "grad_norm": 0.5499894022941589, "learning_rate": 2.4556299396622976e-05, "loss": 0.6824, "step": 1843 }, { "epoch": 2.3584286742939433, "grad_norm": 0.5832574963569641, "learning_rate": 2.4541537047964918e-05, "loss": 0.6906, "step": 1844 }, { "epoch": 2.3597087767021363, "grad_norm": 0.5843065977096558, "learning_rate": 2.452677295485291e-05, "loss": 0.6877, "step": 1845 }, { "epoch": 2.360988879110329, "grad_norm": 0.5764889717102051, "learning_rate": 2.4512007127420705e-05, "loss": 0.6987, "step": 1846 }, { "epoch": 2.3622689815185214, "grad_norm": 0.5799248814582825, "learning_rate": 2.4497239575803233e-05, "loss": 0.6681, "step": 1847 }, { "epoch": 2.3635490839267144, "grad_norm": 0.6558672189712524, "learning_rate": 2.4482470310136597e-05, "loss": 0.6965, "step": 1848 }, { "epoch": 2.364829186334907, "grad_norm": 0.5738571286201477, "learning_rate": 2.4467699340558108e-05, "loss": 0.6943, "step": 1849 }, { "epoch": 2.3661092887430994, "grad_norm": 0.5818512439727783, "learning_rate": 2.4452926677206215e-05, "loss": 0.6429, "step": 1850 }, { "epoch": 2.367389391151292, "grad_norm": 0.594440758228302, "learning_rate": 2.4438152330220546e-05, "loss": 0.6617, "step": 1851 }, { "epoch": 2.3686694935594845, "grad_norm": 0.6094481945037842, "learning_rate": 2.4423376309741878e-05, "loss": 0.6616, "step": 1852 }, { "epoch": 2.3699495959676775, "grad_norm": 0.59006667137146, "learning_rate": 2.4408598625912154e-05, "loss": 0.6822, "step": 1853 }, { "epoch": 2.37122969837587, "grad_norm": 0.557752251625061, "learning_rate": 2.4393819288874422e-05, "loss": 0.685, "step": 1854 }, { "epoch": 2.3725098007840626, "grad_norm": 0.5917968153953552, "learning_rate": 2.4379038308772897e-05, "loss": 0.7104, "step": 1855 }, { "epoch": 2.3737899031922556, "grad_norm": 0.6051133275032043, "learning_rate": 2.4364255695752917e-05, "loss": 0.6762, "step": 1856 }, { "epoch": 2.375070005600448, "grad_norm": 0.49217554926872253, "learning_rate": 2.4349471459960935e-05, "loss": 0.6687, "step": 1857 }, { "epoch": 2.3763501080086407, "grad_norm": 0.582585334777832, "learning_rate": 2.4334685611544505e-05, "loss": 0.6544, "step": 1858 }, { "epoch": 2.377630210416833, "grad_norm": 0.5836172103881836, "learning_rate": 2.4319898160652313e-05, "loss": 0.6558, "step": 1859 }, { "epoch": 2.378910312825026, "grad_norm": 0.5319933295249939, "learning_rate": 2.430510911743414e-05, "loss": 0.7057, "step": 1860 }, { "epoch": 2.378910312825026, "eval_loss": 0.011584697291254997, "eval_runtime": 10.8209, "eval_samples_per_second": 45.837, "eval_steps_per_second": 5.73, "step": 1860 }, { "epoch": 2.3801904152332187, "grad_norm": 0.6212523579597473, "learning_rate": 2.4290318492040835e-05, "loss": 0.6861, "step": 1861 }, { "epoch": 2.3814705176414113, "grad_norm": 0.5772797465324402, "learning_rate": 2.427552629462436e-05, "loss": 0.6624, "step": 1862 }, { "epoch": 2.382750620049604, "grad_norm": 0.6138158440589905, "learning_rate": 2.426073253533775e-05, "loss": 0.6935, "step": 1863 }, { "epoch": 2.384030722457797, "grad_norm": 0.5808906555175781, "learning_rate": 2.4245937224335103e-05, "loss": 0.6628, "step": 1864 }, { "epoch": 2.3853108248659893, "grad_norm": 0.578218400478363, "learning_rate": 2.4231140371771592e-05, "loss": 0.6716, "step": 1865 }, { "epoch": 2.386590927274182, "grad_norm": 0.577086329460144, "learning_rate": 2.421634198780345e-05, "loss": 0.6768, "step": 1866 }, { "epoch": 2.3878710296823744, "grad_norm": 0.5849325656890869, "learning_rate": 2.4201542082587942e-05, "loss": 0.6599, "step": 1867 }, { "epoch": 2.3891511320905674, "grad_norm": 0.5561035871505737, "learning_rate": 2.4186740666283397e-05, "loss": 0.6413, "step": 1868 }, { "epoch": 2.39043123449876, "grad_norm": 0.5579114556312561, "learning_rate": 2.4171937749049175e-05, "loss": 0.6621, "step": 1869 }, { "epoch": 2.3917113369069525, "grad_norm": 0.5725136399269104, "learning_rate": 2.415713334104567e-05, "loss": 0.6854, "step": 1870 }, { "epoch": 2.392991439315145, "grad_norm": 0.6551234722137451, "learning_rate": 2.4142327452434292e-05, "loss": 0.7158, "step": 1871 }, { "epoch": 2.394271541723338, "grad_norm": 0.5876832604408264, "learning_rate": 2.4127520093377465e-05, "loss": 0.6816, "step": 1872 }, { "epoch": 2.3955516441315305, "grad_norm": 0.5829140543937683, "learning_rate": 2.411271127403864e-05, "loss": 0.6899, "step": 1873 }, { "epoch": 2.396831746539723, "grad_norm": 0.582199215888977, "learning_rate": 2.4097901004582233e-05, "loss": 0.6775, "step": 1874 }, { "epoch": 2.3981118489479156, "grad_norm": 0.6164038181304932, "learning_rate": 2.4083089295173716e-05, "loss": 0.6959, "step": 1875 }, { "epoch": 2.3993919513561086, "grad_norm": 0.6018531322479248, "learning_rate": 2.4068276155979486e-05, "loss": 0.6923, "step": 1876 }, { "epoch": 2.400672053764301, "grad_norm": 0.591814398765564, "learning_rate": 2.405346159716696e-05, "loss": 0.7009, "step": 1877 }, { "epoch": 2.4019521561724937, "grad_norm": 0.6468870043754578, "learning_rate": 2.4038645628904515e-05, "loss": 0.6948, "step": 1878 }, { "epoch": 2.4032322585806867, "grad_norm": 0.5983352065086365, "learning_rate": 2.40238282613615e-05, "loss": 0.6815, "step": 1879 }, { "epoch": 2.404512360988879, "grad_norm": 0.5535333752632141, "learning_rate": 2.4009009504708232e-05, "loss": 0.6901, "step": 1880 }, { "epoch": 2.4057924633970718, "grad_norm": 0.6194718480110168, "learning_rate": 2.3994189369115953e-05, "loss": 0.6525, "step": 1881 }, { "epoch": 2.4070725658052643, "grad_norm": 0.5655761957168579, "learning_rate": 2.3979367864756887e-05, "loss": 0.6654, "step": 1882 }, { "epoch": 2.408352668213457, "grad_norm": 0.5740327835083008, "learning_rate": 2.396454500180418e-05, "loss": 0.7022, "step": 1883 }, { "epoch": 2.40963277062165, "grad_norm": 0.581233561038971, "learning_rate": 2.3949720790431905e-05, "loss": 0.6662, "step": 1884 }, { "epoch": 2.4109128730298424, "grad_norm": 0.5732260942459106, "learning_rate": 2.3934895240815075e-05, "loss": 0.6903, "step": 1885 }, { "epoch": 2.412192975438035, "grad_norm": 0.5634108781814575, "learning_rate": 2.3920068363129612e-05, "loss": 0.6402, "step": 1886 }, { "epoch": 2.413473077846228, "grad_norm": 0.6228793859481812, "learning_rate": 2.390524016755235e-05, "loss": 0.7372, "step": 1887 }, { "epoch": 2.4147531802544204, "grad_norm": 0.6371725797653198, "learning_rate": 2.3890410664261033e-05, "loss": 0.6828, "step": 1888 }, { "epoch": 2.416033282662613, "grad_norm": 0.5931169986724854, "learning_rate": 2.3875579863434295e-05, "loss": 0.7019, "step": 1889 }, { "epoch": 2.4173133850708055, "grad_norm": 0.5912045836448669, "learning_rate": 2.386074777525166e-05, "loss": 0.6805, "step": 1890 }, { "epoch": 2.4173133850708055, "eval_loss": 0.011568007990717888, "eval_runtime": 10.8067, "eval_samples_per_second": 45.898, "eval_steps_per_second": 5.737, "step": 1890 }, { "epoch": 2.4185934874789985, "grad_norm": 0.5691397190093994, "learning_rate": 2.3845914409893554e-05, "loss": 0.6393, "step": 1891 }, { "epoch": 2.419873589887191, "grad_norm": 0.5187730193138123, "learning_rate": 2.383107977754126e-05, "loss": 0.6547, "step": 1892 }, { "epoch": 2.4211536922953836, "grad_norm": 0.5614442825317383, "learning_rate": 2.3816243888376925e-05, "loss": 0.6563, "step": 1893 }, { "epoch": 2.422433794703576, "grad_norm": 0.606225311756134, "learning_rate": 2.380140675258359e-05, "loss": 0.6619, "step": 1894 }, { "epoch": 2.423713897111769, "grad_norm": 0.54556804895401, "learning_rate": 2.378656838034511e-05, "loss": 0.6669, "step": 1895 }, { "epoch": 2.4249939995199616, "grad_norm": 0.6027140617370605, "learning_rate": 2.3771728781846228e-05, "loss": 0.6791, "step": 1896 }, { "epoch": 2.426274101928154, "grad_norm": 0.5797204971313477, "learning_rate": 2.3756887967272514e-05, "loss": 0.6849, "step": 1897 }, { "epoch": 2.4275542043363467, "grad_norm": 0.4976787269115448, "learning_rate": 2.3742045946810346e-05, "loss": 0.6826, "step": 1898 }, { "epoch": 2.4288343067445397, "grad_norm": 0.6234809160232544, "learning_rate": 2.3727202730646976e-05, "loss": 0.6837, "step": 1899 }, { "epoch": 2.4301144091527322, "grad_norm": 0.5645691752433777, "learning_rate": 2.3712358328970448e-05, "loss": 0.6713, "step": 1900 }, { "epoch": 2.431394511560925, "grad_norm": 0.5872960090637207, "learning_rate": 2.3697512751969617e-05, "loss": 0.6783, "step": 1901 }, { "epoch": 2.4326746139691178, "grad_norm": 0.7054588198661804, "learning_rate": 2.3682666009834164e-05, "loss": 0.7079, "step": 1902 }, { "epoch": 2.4339547163773103, "grad_norm": 0.5787381529808044, "learning_rate": 2.3667818112754563e-05, "loss": 0.7025, "step": 1903 }, { "epoch": 2.435234818785503, "grad_norm": 0.6480146646499634, "learning_rate": 2.3652969070922062e-05, "loss": 0.7056, "step": 1904 }, { "epoch": 2.4365149211936954, "grad_norm": 0.6624314785003662, "learning_rate": 2.363811889452872e-05, "loss": 0.6367, "step": 1905 }, { "epoch": 2.437795023601888, "grad_norm": 0.5549313426017761, "learning_rate": 2.3623267593767363e-05, "loss": 0.6897, "step": 1906 }, { "epoch": 2.439075126010081, "grad_norm": 0.6084743142127991, "learning_rate": 2.360841517883159e-05, "loss": 0.6841, "step": 1907 }, { "epoch": 2.4403552284182735, "grad_norm": 0.5819149017333984, "learning_rate": 2.3593561659915767e-05, "loss": 0.6744, "step": 1908 }, { "epoch": 2.441635330826466, "grad_norm": 0.5500880479812622, "learning_rate": 2.3578707047215013e-05, "loss": 0.687, "step": 1909 }, { "epoch": 2.442915433234659, "grad_norm": 0.5665502548217773, "learning_rate": 2.35638513509252e-05, "loss": 0.6566, "step": 1910 }, { "epoch": 2.4441955356428515, "grad_norm": 0.5229345560073853, "learning_rate": 2.3548994581242948e-05, "loss": 0.6461, "step": 1911 }, { "epoch": 2.445475638051044, "grad_norm": 0.6144683957099915, "learning_rate": 2.3534136748365604e-05, "loss": 0.6902, "step": 1912 }, { "epoch": 2.4467557404592366, "grad_norm": 0.5567544102668762, "learning_rate": 2.3519277862491255e-05, "loss": 0.6814, "step": 1913 }, { "epoch": 2.448035842867429, "grad_norm": 0.5664990544319153, "learning_rate": 2.3504417933818708e-05, "loss": 0.6549, "step": 1914 }, { "epoch": 2.449315945275622, "grad_norm": 0.5817349553108215, "learning_rate": 2.348955697254748e-05, "loss": 0.6857, "step": 1915 }, { "epoch": 2.4505960476838147, "grad_norm": 0.5776554346084595, "learning_rate": 2.34746949888778e-05, "loss": 0.6809, "step": 1916 }, { "epoch": 2.451876150092007, "grad_norm": 0.547253429889679, "learning_rate": 2.3459831993010605e-05, "loss": 0.6898, "step": 1917 }, { "epoch": 2.4531562525002, "grad_norm": 0.5491963028907776, "learning_rate": 2.3444967995147524e-05, "loss": 0.6784, "step": 1918 }, { "epoch": 2.4544363549083927, "grad_norm": 0.5832270979881287, "learning_rate": 2.3430103005490863e-05, "loss": 0.7021, "step": 1919 }, { "epoch": 2.4557164573165853, "grad_norm": 0.5577331185340881, "learning_rate": 2.3415237034243618e-05, "loss": 0.6807, "step": 1920 }, { "epoch": 2.4557164573165853, "eval_loss": 0.011559930630028248, "eval_runtime": 10.8257, "eval_samples_per_second": 45.817, "eval_steps_per_second": 5.727, "step": 1920 }, { "epoch": 2.456996559724778, "grad_norm": 0.5973002314567566, "learning_rate": 2.3400370091609464e-05, "loss": 0.6664, "step": 1921 }, { "epoch": 2.458276662132971, "grad_norm": 0.5707387924194336, "learning_rate": 2.338550218779273e-05, "loss": 0.6976, "step": 1922 }, { "epoch": 2.4595567645411633, "grad_norm": 0.5324465036392212, "learning_rate": 2.3370633332998413e-05, "loss": 0.6534, "step": 1923 }, { "epoch": 2.460836866949356, "grad_norm": 0.5851748585700989, "learning_rate": 2.3355763537432173e-05, "loss": 0.6646, "step": 1924 }, { "epoch": 2.4621169693575484, "grad_norm": 0.562751293182373, "learning_rate": 2.3340892811300283e-05, "loss": 0.6806, "step": 1925 }, { "epoch": 2.4633970717657414, "grad_norm": 0.5656257271766663, "learning_rate": 2.3326021164809688e-05, "loss": 0.655, "step": 1926 }, { "epoch": 2.464677174173934, "grad_norm": 0.5876888036727905, "learning_rate": 2.3311148608167944e-05, "loss": 0.7203, "step": 1927 }, { "epoch": 2.4659572765821265, "grad_norm": 0.5621166229248047, "learning_rate": 2.329627515158325e-05, "loss": 0.6935, "step": 1928 }, { "epoch": 2.467237378990319, "grad_norm": 0.5966109037399292, "learning_rate": 2.3281400805264408e-05, "loss": 0.6902, "step": 1929 }, { "epoch": 2.468517481398512, "grad_norm": 0.5752228498458862, "learning_rate": 2.3266525579420833e-05, "loss": 0.6805, "step": 1930 }, { "epoch": 2.4697975838067046, "grad_norm": 0.5376203656196594, "learning_rate": 2.3251649484262546e-05, "loss": 0.6711, "step": 1931 }, { "epoch": 2.471077686214897, "grad_norm": 0.5711091160774231, "learning_rate": 2.323677253000017e-05, "loss": 0.7196, "step": 1932 }, { "epoch": 2.47235778862309, "grad_norm": 0.6120408177375793, "learning_rate": 2.322189472684491e-05, "loss": 0.7178, "step": 1933 }, { "epoch": 2.4736378910312826, "grad_norm": 0.544459342956543, "learning_rate": 2.320701608500855e-05, "loss": 0.6542, "step": 1934 }, { "epoch": 2.474917993439475, "grad_norm": 0.5429418087005615, "learning_rate": 2.319213661470346e-05, "loss": 0.6516, "step": 1935 }, { "epoch": 2.4761980958476677, "grad_norm": 0.6022473573684692, "learning_rate": 2.3177256326142578e-05, "loss": 0.692, "step": 1936 }, { "epoch": 2.4774781982558602, "grad_norm": 0.5954020023345947, "learning_rate": 2.3162375229539395e-05, "loss": 0.6684, "step": 1937 }, { "epoch": 2.4787583006640532, "grad_norm": 0.5663207769393921, "learning_rate": 2.3147493335107964e-05, "loss": 0.6894, "step": 1938 }, { "epoch": 2.4800384030722458, "grad_norm": 0.6509982943534851, "learning_rate": 2.3132610653062873e-05, "loss": 0.6916, "step": 1939 }, { "epoch": 2.4813185054804383, "grad_norm": 0.5313803553581238, "learning_rate": 2.3117727193619278e-05, "loss": 0.685, "step": 1940 }, { "epoch": 2.4825986078886313, "grad_norm": 0.5990623831748962, "learning_rate": 2.3102842966992847e-05, "loss": 0.6927, "step": 1941 }, { "epoch": 2.483878710296824, "grad_norm": 0.6042869091033936, "learning_rate": 2.3087957983399762e-05, "loss": 0.6509, "step": 1942 }, { "epoch": 2.4851588127050164, "grad_norm": 0.5589537024497986, "learning_rate": 2.307307225305676e-05, "loss": 0.6858, "step": 1943 }, { "epoch": 2.486438915113209, "grad_norm": 0.579803466796875, "learning_rate": 2.3058185786181068e-05, "loss": 0.6742, "step": 1944 }, { "epoch": 2.487719017521402, "grad_norm": 0.5842740535736084, "learning_rate": 2.304329859299042e-05, "loss": 0.6594, "step": 1945 }, { "epoch": 2.4889991199295944, "grad_norm": 0.5804514288902283, "learning_rate": 2.3028410683703045e-05, "loss": 0.6705, "step": 1946 }, { "epoch": 2.490279222337787, "grad_norm": 0.5964694619178772, "learning_rate": 2.301352206853768e-05, "loss": 0.7093, "step": 1947 }, { "epoch": 2.4915593247459795, "grad_norm": 0.5650797486305237, "learning_rate": 2.2998632757713538e-05, "loss": 0.6565, "step": 1948 }, { "epoch": 2.4928394271541725, "grad_norm": 0.6101258993148804, "learning_rate": 2.2983742761450286e-05, "loss": 0.6905, "step": 1949 }, { "epoch": 2.494119529562365, "grad_norm": 0.5399543642997742, "learning_rate": 2.296885208996811e-05, "loss": 0.6694, "step": 1950 }, { "epoch": 2.494119529562365, "eval_loss": 0.01154709979891777, "eval_runtime": 10.8182, "eval_samples_per_second": 45.849, "eval_steps_per_second": 5.731, "step": 1950 }, { "epoch": 2.4953996319705576, "grad_norm": 0.5777952671051025, "learning_rate": 2.2953960753487623e-05, "loss": 0.6888, "step": 1951 }, { "epoch": 2.49667973437875, "grad_norm": 0.6142259836196899, "learning_rate": 2.2939068762229894e-05, "loss": 0.6948, "step": 1952 }, { "epoch": 2.497959836786943, "grad_norm": 0.5753744840621948, "learning_rate": 2.2924176126416463e-05, "loss": 0.6701, "step": 1953 }, { "epoch": 2.4992399391951357, "grad_norm": 0.6336653828620911, "learning_rate": 2.2909282856269298e-05, "loss": 0.6747, "step": 1954 }, { "epoch": 2.500520041603328, "grad_norm": 0.5536977648735046, "learning_rate": 2.2894388962010798e-05, "loss": 0.6711, "step": 1955 }, { "epoch": 2.501800144011521, "grad_norm": 0.6057724356651306, "learning_rate": 2.287949445386381e-05, "loss": 0.662, "step": 1956 }, { "epoch": 2.5030802464197137, "grad_norm": 0.6078692078590393, "learning_rate": 2.2864599342051584e-05, "loss": 0.6596, "step": 1957 }, { "epoch": 2.5043603488279063, "grad_norm": 0.5415582656860352, "learning_rate": 2.2849703636797788e-05, "loss": 0.6788, "step": 1958 }, { "epoch": 2.505640451236099, "grad_norm": 0.5932589173316956, "learning_rate": 2.2834807348326497e-05, "loss": 0.6573, "step": 1959 }, { "epoch": 2.5069205536442913, "grad_norm": 0.5789892077445984, "learning_rate": 2.2819910486862194e-05, "loss": 0.6725, "step": 1960 }, { "epoch": 2.5082006560524843, "grad_norm": 0.5233830809593201, "learning_rate": 2.280501306262975e-05, "loss": 0.6391, "step": 1961 }, { "epoch": 2.509480758460677, "grad_norm": 0.5784941911697388, "learning_rate": 2.279011508585442e-05, "loss": 0.6877, "step": 1962 }, { "epoch": 2.5107608608688694, "grad_norm": 0.576754629611969, "learning_rate": 2.2775216566761843e-05, "loss": 0.6868, "step": 1963 }, { "epoch": 2.5120409632770624, "grad_norm": 0.5483225584030151, "learning_rate": 2.2760317515578024e-05, "loss": 0.6789, "step": 1964 }, { "epoch": 2.513321065685255, "grad_norm": 0.5463926792144775, "learning_rate": 2.2745417942529343e-05, "loss": 0.6548, "step": 1965 }, { "epoch": 2.5146011680934475, "grad_norm": 0.5364739894866943, "learning_rate": 2.2730517857842526e-05, "loss": 0.6882, "step": 1966 }, { "epoch": 2.51588127050164, "grad_norm": 0.5220996737480164, "learning_rate": 2.271561727174467e-05, "loss": 0.6954, "step": 1967 }, { "epoch": 2.5171613729098326, "grad_norm": 0.5596213340759277, "learning_rate": 2.2700716194463177e-05, "loss": 0.6907, "step": 1968 }, { "epoch": 2.5184414753180255, "grad_norm": 0.5397947430610657, "learning_rate": 2.2685814636225837e-05, "loss": 0.6783, "step": 1969 }, { "epoch": 2.519721577726218, "grad_norm": 0.5562774538993835, "learning_rate": 2.2670912607260732e-05, "loss": 0.6575, "step": 1970 }, { "epoch": 2.5210016801344106, "grad_norm": 0.5784458518028259, "learning_rate": 2.2656010117796278e-05, "loss": 0.7069, "step": 1971 }, { "epoch": 2.5222817825426036, "grad_norm": 0.5621782541275024, "learning_rate": 2.2641107178061225e-05, "loss": 0.6993, "step": 1972 }, { "epoch": 2.523561884950796, "grad_norm": 0.5110465884208679, "learning_rate": 2.26262037982846e-05, "loss": 0.6715, "step": 1973 }, { "epoch": 2.5248419873589887, "grad_norm": 0.5507041215896606, "learning_rate": 2.2611299988695744e-05, "loss": 0.6913, "step": 1974 }, { "epoch": 2.5261220897671812, "grad_norm": 0.563943088054657, "learning_rate": 2.2596395759524316e-05, "loss": 0.6893, "step": 1975 }, { "epoch": 2.5274021921753738, "grad_norm": 0.5315508246421814, "learning_rate": 2.258149112100023e-05, "loss": 0.6292, "step": 1976 }, { "epoch": 2.5286822945835667, "grad_norm": 0.5950513482093811, "learning_rate": 2.25665860833537e-05, "loss": 0.712, "step": 1977 }, { "epoch": 2.5299623969917593, "grad_norm": 0.5365733504295349, "learning_rate": 2.2551680656815217e-05, "loss": 0.705, "step": 1978 }, { "epoch": 2.5312424993999523, "grad_norm": 0.6335738301277161, "learning_rate": 2.2536774851615507e-05, "loss": 0.7038, "step": 1979 }, { "epoch": 2.532522601808145, "grad_norm": 0.6017379760742188, "learning_rate": 2.252186867798561e-05, "loss": 0.7075, "step": 1980 }, { "epoch": 2.532522601808145, "eval_loss": 0.011548144742846489, "eval_runtime": 10.8069, "eval_samples_per_second": 45.897, "eval_steps_per_second": 5.737, "step": 1980 }, { "epoch": 2.5338027042163374, "grad_norm": 0.5744271278381348, "learning_rate": 2.2506962146156764e-05, "loss": 0.6894, "step": 1981 }, { "epoch": 2.53508280662453, "grad_norm": 0.6365877389907837, "learning_rate": 2.249205526636049e-05, "loss": 0.7013, "step": 1982 }, { "epoch": 2.5363629090327224, "grad_norm": 0.5367043018341064, "learning_rate": 2.2477148048828536e-05, "loss": 0.6719, "step": 1983 }, { "epoch": 2.5376430114409154, "grad_norm": 0.6105454564094543, "learning_rate": 2.2462240503792882e-05, "loss": 0.6941, "step": 1984 }, { "epoch": 2.538923113849108, "grad_norm": 0.5651337504386902, "learning_rate": 2.2447332641485717e-05, "loss": 0.6705, "step": 1985 }, { "epoch": 2.5402032162573005, "grad_norm": 0.5650824904441833, "learning_rate": 2.2432424472139483e-05, "loss": 0.67, "step": 1986 }, { "epoch": 2.5414833186654935, "grad_norm": 0.5914794206619263, "learning_rate": 2.2417516005986806e-05, "loss": 0.6654, "step": 1987 }, { "epoch": 2.542763421073686, "grad_norm": 0.5018816590309143, "learning_rate": 2.2402607253260514e-05, "loss": 0.6412, "step": 1988 }, { "epoch": 2.5440435234818786, "grad_norm": 0.657543420791626, "learning_rate": 2.2387698224193653e-05, "loss": 0.6738, "step": 1989 }, { "epoch": 2.545323625890071, "grad_norm": 0.528235673904419, "learning_rate": 2.2372788929019432e-05, "loss": 0.6523, "step": 1990 }, { "epoch": 2.5466037282982636, "grad_norm": 0.6170380115509033, "learning_rate": 2.2357879377971265e-05, "loss": 0.6623, "step": 1991 }, { "epoch": 2.5478838307064566, "grad_norm": 0.6315262317657471, "learning_rate": 2.2342969581282734e-05, "loss": 0.6882, "step": 1992 }, { "epoch": 2.549163933114649, "grad_norm": 0.5583043098449707, "learning_rate": 2.2328059549187582e-05, "loss": 0.6935, "step": 1993 }, { "epoch": 2.5504440355228417, "grad_norm": 0.636369526386261, "learning_rate": 2.2313149291919726e-05, "loss": 0.6455, "step": 1994 }, { "epoch": 2.5517241379310347, "grad_norm": 0.5487728714942932, "learning_rate": 2.2298238819713234e-05, "loss": 0.6777, "step": 1995 }, { "epoch": 2.5530042403392272, "grad_norm": 0.6297091841697693, "learning_rate": 2.228332814280231e-05, "loss": 0.7039, "step": 1996 }, { "epoch": 2.55428434274742, "grad_norm": 0.6231347322463989, "learning_rate": 2.2268417271421315e-05, "loss": 0.6975, "step": 1997 }, { "epoch": 2.5555644451556123, "grad_norm": 0.538118302822113, "learning_rate": 2.2253506215804733e-05, "loss": 0.6506, "step": 1998 }, { "epoch": 2.556844547563805, "grad_norm": 0.5905261635780334, "learning_rate": 2.2238594986187177e-05, "loss": 0.7189, "step": 1999 }, { "epoch": 2.558124649971998, "grad_norm": 0.5073800086975098, "learning_rate": 2.2223683592803383e-05, "loss": 0.6605, "step": 2000 }, { "epoch": 2.5594047523801904, "grad_norm": 0.5784037113189697, "learning_rate": 2.2208772045888193e-05, "loss": 0.7136, "step": 2001 }, { "epoch": 2.560684854788383, "grad_norm": 0.5811653733253479, "learning_rate": 2.2193860355676563e-05, "loss": 0.6847, "step": 2002 }, { "epoch": 2.561964957196576, "grad_norm": 0.5476462841033936, "learning_rate": 2.2178948532403538e-05, "loss": 0.6695, "step": 2003 }, { "epoch": 2.5632450596047684, "grad_norm": 0.5981435179710388, "learning_rate": 2.2164036586304254e-05, "loss": 0.6816, "step": 2004 }, { "epoch": 2.564525162012961, "grad_norm": 0.5810021162033081, "learning_rate": 2.2149124527613953e-05, "loss": 0.6992, "step": 2005 }, { "epoch": 2.5658052644211535, "grad_norm": 0.5890992879867554, "learning_rate": 2.213421236656792e-05, "loss": 0.6655, "step": 2006 }, { "epoch": 2.567085366829346, "grad_norm": 0.546022891998291, "learning_rate": 2.2119300113401527e-05, "loss": 0.7123, "step": 2007 }, { "epoch": 2.568365469237539, "grad_norm": 0.5739374160766602, "learning_rate": 2.2104387778350226e-05, "loss": 0.708, "step": 2008 }, { "epoch": 2.5696455716457316, "grad_norm": 0.5746329426765442, "learning_rate": 2.2089475371649493e-05, "loss": 0.6881, "step": 2009 }, { "epoch": 2.5709256740539246, "grad_norm": 0.516336977481842, "learning_rate": 2.2074562903534883e-05, "loss": 0.6309, "step": 2010 }, { "epoch": 2.5709256740539246, "eval_loss": 0.011530693620443344, "eval_runtime": 10.8221, "eval_samples_per_second": 45.832, "eval_steps_per_second": 5.729, "step": 2010 }, { "epoch": 2.572205776462117, "grad_norm": 0.6161022186279297, "learning_rate": 2.2059650384241956e-05, "loss": 0.6715, "step": 2011 }, { "epoch": 2.5734858788703097, "grad_norm": 0.5700750350952148, "learning_rate": 2.2044737824006354e-05, "loss": 0.6906, "step": 2012 }, { "epoch": 2.574765981278502, "grad_norm": 0.5499996542930603, "learning_rate": 2.2029825233063716e-05, "loss": 0.6954, "step": 2013 }, { "epoch": 2.5760460836866947, "grad_norm": 0.5665808320045471, "learning_rate": 2.2014912621649702e-05, "loss": 0.7002, "step": 2014 }, { "epoch": 2.5773261860948877, "grad_norm": 0.583620548248291, "learning_rate": 2.2000000000000003e-05, "loss": 0.6931, "step": 2015 }, { "epoch": 2.5786062885030803, "grad_norm": 0.5770348310470581, "learning_rate": 2.19850873783503e-05, "loss": 0.7037, "step": 2016 }, { "epoch": 2.579886390911273, "grad_norm": 0.5996818542480469, "learning_rate": 2.19701747669363e-05, "loss": 0.6934, "step": 2017 }, { "epoch": 2.581166493319466, "grad_norm": 0.5798315405845642, "learning_rate": 2.195526217599365e-05, "loss": 0.6618, "step": 2018 }, { "epoch": 2.5824465957276583, "grad_norm": 0.5487486720085144, "learning_rate": 2.1940349615758046e-05, "loss": 0.6581, "step": 2019 }, { "epoch": 2.583726698135851, "grad_norm": 0.5613217353820801, "learning_rate": 2.1925437096465133e-05, "loss": 0.6696, "step": 2020 }, { "epoch": 2.5850068005440434, "grad_norm": 0.5560593008995056, "learning_rate": 2.1910524628350513e-05, "loss": 0.692, "step": 2021 }, { "epoch": 2.586286902952236, "grad_norm": 0.5987349152565002, "learning_rate": 2.189561222164978e-05, "loss": 0.7086, "step": 2022 }, { "epoch": 2.587567005360429, "grad_norm": 0.5258426070213318, "learning_rate": 2.188069988659848e-05, "loss": 0.6233, "step": 2023 }, { "epoch": 2.5888471077686215, "grad_norm": 0.559288501739502, "learning_rate": 2.1865787633432086e-05, "loss": 0.6872, "step": 2024 }, { "epoch": 2.590127210176814, "grad_norm": 0.5850808024406433, "learning_rate": 2.1850875472386056e-05, "loss": 0.6954, "step": 2025 }, { "epoch": 2.591407312585007, "grad_norm": 0.5960245132446289, "learning_rate": 2.183596341369575e-05, "loss": 0.707, "step": 2026 }, { "epoch": 2.5926874149931995, "grad_norm": 0.569518506526947, "learning_rate": 2.1821051467596467e-05, "loss": 0.6821, "step": 2027 }, { "epoch": 2.593967517401392, "grad_norm": 0.6339453458786011, "learning_rate": 2.180613964432344e-05, "loss": 0.7125, "step": 2028 }, { "epoch": 2.5952476198095846, "grad_norm": 0.5328766703605652, "learning_rate": 2.1791227954111816e-05, "loss": 0.6793, "step": 2029 }, { "epoch": 2.596527722217777, "grad_norm": 0.5256121754646301, "learning_rate": 2.1776316407196626e-05, "loss": 0.6838, "step": 2030 }, { "epoch": 2.59780782462597, "grad_norm": 0.5012363791465759, "learning_rate": 2.1761405013812836e-05, "loss": 0.662, "step": 2031 }, { "epoch": 2.5990879270341627, "grad_norm": 0.5150095820426941, "learning_rate": 2.174649378419528e-05, "loss": 0.6852, "step": 2032 }, { "epoch": 2.6003680294423552, "grad_norm": 0.5986401438713074, "learning_rate": 2.1731582728578694e-05, "loss": 0.699, "step": 2033 }, { "epoch": 2.601648131850548, "grad_norm": 0.5160393118858337, "learning_rate": 2.17166718571977e-05, "loss": 0.6918, "step": 2034 }, { "epoch": 2.6029282342587408, "grad_norm": 0.5472270250320435, "learning_rate": 2.1701761180286775e-05, "loss": 0.6787, "step": 2035 }, { "epoch": 2.6042083366669333, "grad_norm": 0.5348479747772217, "learning_rate": 2.1686850708080276e-05, "loss": 0.6631, "step": 2036 }, { "epoch": 2.605488439075126, "grad_norm": 0.5178807377815247, "learning_rate": 2.1671940450812427e-05, "loss": 0.6643, "step": 2037 }, { "epoch": 2.606768541483319, "grad_norm": 0.5322620868682861, "learning_rate": 2.1657030418717275e-05, "loss": 0.6771, "step": 2038 }, { "epoch": 2.6080486438915114, "grad_norm": 0.5004392862319946, "learning_rate": 2.1642120622028737e-05, "loss": 0.6639, "step": 2039 }, { "epoch": 2.609328746299704, "grad_norm": 0.5184484124183655, "learning_rate": 2.162721107098058e-05, "loss": 0.6604, "step": 2040 }, { "epoch": 2.609328746299704, "eval_loss": 0.011514472775161266, "eval_runtime": 10.8316, "eval_samples_per_second": 45.792, "eval_steps_per_second": 5.724, "step": 2040 }, { "epoch": 2.610608848707897, "grad_norm": 0.5928523540496826, "learning_rate": 2.161230177580636e-05, "loss": 0.6964, "step": 2041 }, { "epoch": 2.6118889511160894, "grad_norm": 0.5536078810691833, "learning_rate": 2.1597392746739492e-05, "loss": 0.6719, "step": 2042 }, { "epoch": 2.613169053524282, "grad_norm": 0.5903907418251038, "learning_rate": 2.1582483994013207e-05, "loss": 0.6985, "step": 2043 }, { "epoch": 2.6144491559324745, "grad_norm": 0.5517407059669495, "learning_rate": 2.156757552786052e-05, "loss": 0.6997, "step": 2044 }, { "epoch": 2.615729258340667, "grad_norm": 0.5654640197753906, "learning_rate": 2.1552667358514285e-05, "loss": 0.6816, "step": 2045 }, { "epoch": 2.61700936074886, "grad_norm": 0.5533310770988464, "learning_rate": 2.153775949620713e-05, "loss": 0.6586, "step": 2046 }, { "epoch": 2.6182894631570526, "grad_norm": 0.5827234387397766, "learning_rate": 2.152285195117147e-05, "loss": 0.6718, "step": 2047 }, { "epoch": 2.619569565565245, "grad_norm": 0.5745716691017151, "learning_rate": 2.1507944733639513e-05, "loss": 0.702, "step": 2048 }, { "epoch": 2.620849667973438, "grad_norm": 0.5552913546562195, "learning_rate": 2.149303785384324e-05, "loss": 0.7033, "step": 2049 }, { "epoch": 2.6221297703816306, "grad_norm": 0.5924190282821655, "learning_rate": 2.14781313220144e-05, "loss": 0.6385, "step": 2050 }, { "epoch": 2.623409872789823, "grad_norm": 0.516633927822113, "learning_rate": 2.1463225148384495e-05, "loss": 0.6736, "step": 2051 }, { "epoch": 2.6246899751980157, "grad_norm": 0.6046395301818848, "learning_rate": 2.1448319343184792e-05, "loss": 0.6833, "step": 2052 }, { "epoch": 2.6259700776062083, "grad_norm": 0.547670304775238, "learning_rate": 2.1433413916646305e-05, "loss": 0.703, "step": 2053 }, { "epoch": 2.6272501800144012, "grad_norm": 0.5369134545326233, "learning_rate": 2.1418508878999774e-05, "loss": 0.6661, "step": 2054 }, { "epoch": 2.628530282422594, "grad_norm": 0.5275795459747314, "learning_rate": 2.140360424047569e-05, "loss": 0.6534, "step": 2055 }, { "epoch": 2.6298103848307863, "grad_norm": 0.5670477747917175, "learning_rate": 2.138870001130426e-05, "loss": 0.6576, "step": 2056 }, { "epoch": 2.6310904872389793, "grad_norm": 0.5423495173454285, "learning_rate": 2.1373796201715415e-05, "loss": 0.6454, "step": 2057 }, { "epoch": 2.632370589647172, "grad_norm": 0.5598854422569275, "learning_rate": 2.1358892821938784e-05, "loss": 0.6621, "step": 2058 }, { "epoch": 2.6336506920553644, "grad_norm": 0.5291751623153687, "learning_rate": 2.1343989882203728e-05, "loss": 0.6952, "step": 2059 }, { "epoch": 2.634930794463557, "grad_norm": 0.5671200156211853, "learning_rate": 2.1329087392739277e-05, "loss": 0.6884, "step": 2060 }, { "epoch": 2.6362108968717495, "grad_norm": 0.5808565020561218, "learning_rate": 2.1314185363774168e-05, "loss": 0.6867, "step": 2061 }, { "epoch": 2.6374909992799425, "grad_norm": 0.5669856667518616, "learning_rate": 2.1299283805536825e-05, "loss": 0.7044, "step": 2062 }, { "epoch": 2.638771101688135, "grad_norm": 0.5911791324615479, "learning_rate": 2.1284382728255343e-05, "loss": 0.6779, "step": 2063 }, { "epoch": 2.6400512040963275, "grad_norm": 0.5535954236984253, "learning_rate": 2.1269482142157476e-05, "loss": 0.6743, "step": 2064 }, { "epoch": 2.6413313065045205, "grad_norm": 0.5271023511886597, "learning_rate": 2.125458205747066e-05, "loss": 0.6701, "step": 2065 }, { "epoch": 2.642611408912713, "grad_norm": 0.5959221124649048, "learning_rate": 2.123968248442198e-05, "loss": 0.6852, "step": 2066 }, { "epoch": 2.6438915113209056, "grad_norm": 0.5608366131782532, "learning_rate": 2.1224783433238163e-05, "loss": 0.6901, "step": 2067 }, { "epoch": 2.645171613729098, "grad_norm": 0.545486569404602, "learning_rate": 2.1209884914145588e-05, "loss": 0.7153, "step": 2068 }, { "epoch": 2.646451716137291, "grad_norm": 0.5992303490638733, "learning_rate": 2.119498693737026e-05, "loss": 0.6782, "step": 2069 }, { "epoch": 2.6477318185454837, "grad_norm": 0.5763704180717468, "learning_rate": 2.1180089513137815e-05, "loss": 0.6815, "step": 2070 }, { "epoch": 2.6477318185454837, "eval_loss": 0.011513450182974339, "eval_runtime": 10.8052, "eval_samples_per_second": 45.904, "eval_steps_per_second": 5.738, "step": 2070 }, { "epoch": 2.649011920953676, "grad_norm": 0.5506516695022583, "learning_rate": 2.116519265167351e-05, "loss": 0.6864, "step": 2071 }, { "epoch": 2.650292023361869, "grad_norm": 0.6050803661346436, "learning_rate": 2.1150296363202224e-05, "loss": 0.687, "step": 2072 }, { "epoch": 2.6515721257700617, "grad_norm": 0.5962046980857849, "learning_rate": 2.113540065794842e-05, "loss": 0.6871, "step": 2073 }, { "epoch": 2.6528522281782543, "grad_norm": 0.5660064816474915, "learning_rate": 2.112050554613619e-05, "loss": 0.6847, "step": 2074 }, { "epoch": 2.654132330586447, "grad_norm": 0.5870113968849182, "learning_rate": 2.1105611037989208e-05, "loss": 0.6992, "step": 2075 }, { "epoch": 2.6554124329946394, "grad_norm": 0.5855358242988586, "learning_rate": 2.1090717143730708e-05, "loss": 0.6828, "step": 2076 }, { "epoch": 2.6566925354028323, "grad_norm": 0.6082198023796082, "learning_rate": 2.107582387358354e-05, "loss": 0.6838, "step": 2077 }, { "epoch": 2.657972637811025, "grad_norm": 0.5873337388038635, "learning_rate": 2.106093123777011e-05, "loss": 0.664, "step": 2078 }, { "epoch": 2.6592527402192174, "grad_norm": 0.589705228805542, "learning_rate": 2.1046039246512383e-05, "loss": 0.6912, "step": 2079 }, { "epoch": 2.6605328426274104, "grad_norm": 0.5821221470832825, "learning_rate": 2.103114791003189e-05, "loss": 0.7278, "step": 2080 }, { "epoch": 2.661812945035603, "grad_norm": 0.5650155544281006, "learning_rate": 2.1016257238549716e-05, "loss": 0.7029, "step": 2081 }, { "epoch": 2.6630930474437955, "grad_norm": 0.5573188662528992, "learning_rate": 2.100136724228647e-05, "loss": 0.7012, "step": 2082 }, { "epoch": 2.664373149851988, "grad_norm": 0.5489970445632935, "learning_rate": 2.098647793146233e-05, "loss": 0.6912, "step": 2083 }, { "epoch": 2.6656532522601806, "grad_norm": 0.5229962468147278, "learning_rate": 2.097158931629696e-05, "loss": 0.6467, "step": 2084 }, { "epoch": 2.6669333546683736, "grad_norm": 0.5697285532951355, "learning_rate": 2.095670140700959e-05, "loss": 0.6912, "step": 2085 }, { "epoch": 2.668213457076566, "grad_norm": 0.523398220539093, "learning_rate": 2.0941814213818944e-05, "loss": 0.7016, "step": 2086 }, { "epoch": 2.6694935594847586, "grad_norm": 0.5511962175369263, "learning_rate": 2.0926927746943243e-05, "loss": 0.6761, "step": 2087 }, { "epoch": 2.6707736618929516, "grad_norm": 0.5299444198608398, "learning_rate": 2.0912042016600237e-05, "loss": 0.6643, "step": 2088 }, { "epoch": 2.672053764301144, "grad_norm": 0.5698947906494141, "learning_rate": 2.0897157033007166e-05, "loss": 0.6952, "step": 2089 }, { "epoch": 2.6733338667093367, "grad_norm": 0.534382700920105, "learning_rate": 2.0882272806380728e-05, "loss": 0.6813, "step": 2090 }, { "epoch": 2.6746139691175292, "grad_norm": 0.5265630483627319, "learning_rate": 2.086738934693713e-05, "loss": 0.6847, "step": 2091 }, { "epoch": 2.675894071525722, "grad_norm": 0.5158559083938599, "learning_rate": 2.0852506664892048e-05, "loss": 0.6887, "step": 2092 }, { "epoch": 2.6771741739339148, "grad_norm": 0.5293145775794983, "learning_rate": 2.083762477046061e-05, "loss": 0.6698, "step": 2093 }, { "epoch": 2.6784542763421073, "grad_norm": 0.5267837047576904, "learning_rate": 2.0822743673857424e-05, "loss": 0.6506, "step": 2094 }, { "epoch": 2.6797343787503003, "grad_norm": 0.515688955783844, "learning_rate": 2.0807863385296544e-05, "loss": 0.6693, "step": 2095 }, { "epoch": 2.681014481158493, "grad_norm": 0.5605611205101013, "learning_rate": 2.0792983914991453e-05, "loss": 0.6627, "step": 2096 }, { "epoch": 2.6822945835666854, "grad_norm": 0.5887176990509033, "learning_rate": 2.0778105273155095e-05, "loss": 0.6672, "step": 2097 }, { "epoch": 2.683574685974878, "grad_norm": 0.5191556811332703, "learning_rate": 2.0763227469999834e-05, "loss": 0.6873, "step": 2098 }, { "epoch": 2.6848547883830705, "grad_norm": 0.6014405488967896, "learning_rate": 2.0748350515737456e-05, "loss": 0.6465, "step": 2099 }, { "epoch": 2.6861348907912634, "grad_norm": 0.5366295576095581, "learning_rate": 2.0733474420579173e-05, "loss": 0.7184, "step": 2100 }, { "epoch": 2.6861348907912634, "eval_loss": 0.011498779058456421, "eval_runtime": 10.8231, "eval_samples_per_second": 45.828, "eval_steps_per_second": 5.728, "step": 2100 }, { "epoch": 2.687414993199456, "grad_norm": 0.5625792741775513, "learning_rate": 2.07185991947356e-05, "loss": 0.6684, "step": 2101 }, { "epoch": 2.6886950956076485, "grad_norm": 0.5656289458274841, "learning_rate": 2.0703724848416757e-05, "loss": 0.6989, "step": 2102 }, { "epoch": 2.6899751980158415, "grad_norm": 0.5664001107215881, "learning_rate": 2.0688851391832058e-05, "loss": 0.7038, "step": 2103 }, { "epoch": 2.691255300424034, "grad_norm": 0.6160801649093628, "learning_rate": 2.0673978835190324e-05, "loss": 0.7173, "step": 2104 }, { "epoch": 2.6925354028322266, "grad_norm": 0.5975323915481567, "learning_rate": 2.0659107188699722e-05, "loss": 0.6824, "step": 2105 }, { "epoch": 2.693815505240419, "grad_norm": 0.5666054487228394, "learning_rate": 2.0644236462567836e-05, "loss": 0.6513, "step": 2106 }, { "epoch": 2.6950956076486117, "grad_norm": 0.5504162311553955, "learning_rate": 2.062936666700159e-05, "loss": 0.6821, "step": 2107 }, { "epoch": 2.6963757100568047, "grad_norm": 0.4987417757511139, "learning_rate": 2.0614497812207275e-05, "loss": 0.6465, "step": 2108 }, { "epoch": 2.697655812464997, "grad_norm": 0.6021193861961365, "learning_rate": 2.0599629908390545e-05, "loss": 0.6774, "step": 2109 }, { "epoch": 2.6989359148731897, "grad_norm": 0.581078290939331, "learning_rate": 2.058476296575639e-05, "loss": 0.71, "step": 2110 }, { "epoch": 2.7002160172813827, "grad_norm": 0.5573481917381287, "learning_rate": 2.0569896994509146e-05, "loss": 0.7002, "step": 2111 }, { "epoch": 2.7014961196895753, "grad_norm": 0.5607424378395081, "learning_rate": 2.055503200485249e-05, "loss": 0.695, "step": 2112 }, { "epoch": 2.702776222097768, "grad_norm": 0.6108943819999695, "learning_rate": 2.05401680069894e-05, "loss": 0.6971, "step": 2113 }, { "epoch": 2.7040563245059603, "grad_norm": 0.6459068655967712, "learning_rate": 2.0525305011122202e-05, "loss": 0.6911, "step": 2114 }, { "epoch": 2.705336426914153, "grad_norm": 0.5489556193351746, "learning_rate": 2.051044302745253e-05, "loss": 0.658, "step": 2115 }, { "epoch": 2.706616529322346, "grad_norm": 0.5386958718299866, "learning_rate": 2.04955820661813e-05, "loss": 0.6594, "step": 2116 }, { "epoch": 2.7078966317305384, "grad_norm": 0.5512974262237549, "learning_rate": 2.0480722137508754e-05, "loss": 0.6526, "step": 2117 }, { "epoch": 2.709176734138731, "grad_norm": 0.5657424330711365, "learning_rate": 2.046586325163441e-05, "loss": 0.7312, "step": 2118 }, { "epoch": 2.710456836546924, "grad_norm": 0.5624411702156067, "learning_rate": 2.0451005418757058e-05, "loss": 0.6464, "step": 2119 }, { "epoch": 2.7117369389551165, "grad_norm": 0.5503666996955872, "learning_rate": 2.043614864907481e-05, "loss": 0.6633, "step": 2120 }, { "epoch": 2.713017041363309, "grad_norm": 0.5300235748291016, "learning_rate": 2.0421292952784996e-05, "loss": 0.6531, "step": 2121 }, { "epoch": 2.7142971437715016, "grad_norm": 0.5729533433914185, "learning_rate": 2.040643834008424e-05, "loss": 0.6629, "step": 2122 }, { "epoch": 2.7155772461796945, "grad_norm": 0.5653989315032959, "learning_rate": 2.0391584821168413e-05, "loss": 0.7041, "step": 2123 }, { "epoch": 2.716857348587887, "grad_norm": 0.5225719809532166, "learning_rate": 2.037673240623264e-05, "loss": 0.6805, "step": 2124 }, { "epoch": 2.7181374509960796, "grad_norm": 0.5666506290435791, "learning_rate": 2.0361881105471286e-05, "loss": 0.7004, "step": 2125 }, { "epoch": 2.7194175534042726, "grad_norm": 0.5524999499320984, "learning_rate": 2.0347030929077943e-05, "loss": 0.6828, "step": 2126 }, { "epoch": 2.720697655812465, "grad_norm": 0.547503650188446, "learning_rate": 2.0332181887245443e-05, "loss": 0.6429, "step": 2127 }, { "epoch": 2.7219777582206577, "grad_norm": 0.5649715065956116, "learning_rate": 2.0317333990165838e-05, "loss": 0.6497, "step": 2128 }, { "epoch": 2.7232578606288502, "grad_norm": 0.5688164830207825, "learning_rate": 2.0302487248030385e-05, "loss": 0.7109, "step": 2129 }, { "epoch": 2.7245379630370428, "grad_norm": 0.5821229219436646, "learning_rate": 2.0287641671029564e-05, "loss": 0.6687, "step": 2130 }, { "epoch": 2.7245379630370428, "eval_loss": 0.011482841335237026, "eval_runtime": 10.808, "eval_samples_per_second": 45.892, "eval_steps_per_second": 5.736, "step": 2130 }, { "epoch": 2.7258180654452357, "grad_norm": 0.5121495723724365, "learning_rate": 2.0272797269353033e-05, "loss": 0.6682, "step": 2131 }, { "epoch": 2.7270981678534283, "grad_norm": 0.5901171565055847, "learning_rate": 2.0257954053189657e-05, "loss": 0.6803, "step": 2132 }, { "epoch": 2.728378270261621, "grad_norm": 0.5494524836540222, "learning_rate": 2.02431120327275e-05, "loss": 0.6676, "step": 2133 }, { "epoch": 2.729658372669814, "grad_norm": 0.5600875020027161, "learning_rate": 2.0228271218153774e-05, "loss": 0.7007, "step": 2134 }, { "epoch": 2.7309384750780064, "grad_norm": 0.5640694499015808, "learning_rate": 2.0213431619654894e-05, "loss": 0.6878, "step": 2135 }, { "epoch": 2.732218577486199, "grad_norm": 0.5384992361068726, "learning_rate": 2.019859324741642e-05, "loss": 0.6405, "step": 2136 }, { "epoch": 2.7334986798943914, "grad_norm": 0.5485089421272278, "learning_rate": 2.0183756111623084e-05, "loss": 0.6673, "step": 2137 }, { "epoch": 2.734778782302584, "grad_norm": 0.5543821454048157, "learning_rate": 2.0168920222458754e-05, "loss": 0.6415, "step": 2138 }, { "epoch": 2.736058884710777, "grad_norm": 0.6076808571815491, "learning_rate": 2.0154085590106455e-05, "loss": 0.6935, "step": 2139 }, { "epoch": 2.7373389871189695, "grad_norm": 0.593870222568512, "learning_rate": 2.013925222474835e-05, "loss": 0.6667, "step": 2140 }, { "epoch": 2.738619089527162, "grad_norm": 0.6134325265884399, "learning_rate": 2.0124420136565717e-05, "loss": 0.6887, "step": 2141 }, { "epoch": 2.739899191935355, "grad_norm": 0.6129072308540344, "learning_rate": 2.010958933573898e-05, "loss": 0.6376, "step": 2142 }, { "epoch": 2.7411792943435476, "grad_norm": 0.604393720626831, "learning_rate": 2.009475983244766e-05, "loss": 0.7126, "step": 2143 }, { "epoch": 2.74245939675174, "grad_norm": 0.566626787185669, "learning_rate": 2.00799316368704e-05, "loss": 0.6841, "step": 2144 }, { "epoch": 2.7437394991599326, "grad_norm": 0.5514710545539856, "learning_rate": 2.0065104759184934e-05, "loss": 0.6639, "step": 2145 }, { "epoch": 2.745019601568125, "grad_norm": 0.5645005106925964, "learning_rate": 2.0050279209568097e-05, "loss": 0.6392, "step": 2146 }, { "epoch": 2.746299703976318, "grad_norm": 0.5400156378746033, "learning_rate": 2.0035454998195832e-05, "loss": 0.6235, "step": 2147 }, { "epoch": 2.7475798063845107, "grad_norm": 0.5787555575370789, "learning_rate": 2.002063213524312e-05, "loss": 0.6649, "step": 2148 }, { "epoch": 2.7488599087927033, "grad_norm": 0.5392046570777893, "learning_rate": 2.000581063088405e-05, "loss": 0.7122, "step": 2149 }, { "epoch": 2.7501400112008962, "grad_norm": 0.5718721747398376, "learning_rate": 1.999099049529178e-05, "loss": 0.656, "step": 2150 }, { "epoch": 2.751420113609089, "grad_norm": 0.5379940867424011, "learning_rate": 1.9976171738638504e-05, "loss": 0.6869, "step": 2151 }, { "epoch": 2.7527002160172813, "grad_norm": 0.5417284369468689, "learning_rate": 1.996135437109549e-05, "loss": 0.6845, "step": 2152 }, { "epoch": 2.753980318425474, "grad_norm": 0.5735756754875183, "learning_rate": 1.9946538402833047e-05, "loss": 0.6431, "step": 2153 }, { "epoch": 2.755260420833667, "grad_norm": 0.5329331755638123, "learning_rate": 1.993172384402052e-05, "loss": 0.6568, "step": 2154 }, { "epoch": 2.7565405232418594, "grad_norm": 0.5652323961257935, "learning_rate": 1.991691070482629e-05, "loss": 0.6733, "step": 2155 }, { "epoch": 2.757820625650052, "grad_norm": 0.5698742866516113, "learning_rate": 1.990209899541777e-05, "loss": 0.6936, "step": 2156 }, { "epoch": 2.759100728058245, "grad_norm": 0.5140464305877686, "learning_rate": 1.9887288725961374e-05, "loss": 0.6926, "step": 2157 }, { "epoch": 2.7603808304664375, "grad_norm": 0.5658466815948486, "learning_rate": 1.9872479906622538e-05, "loss": 0.6972, "step": 2158 }, { "epoch": 2.76166093287463, "grad_norm": 0.542084276676178, "learning_rate": 1.985767254756572e-05, "loss": 0.6793, "step": 2159 }, { "epoch": 2.7629410352828225, "grad_norm": 0.514428436756134, "learning_rate": 1.9842866658954336e-05, "loss": 0.6798, "step": 2160 }, { "epoch": 2.7629410352828225, "eval_loss": 0.011475411243736744, "eval_runtime": 10.8142, "eval_samples_per_second": 45.866, "eval_steps_per_second": 5.733, "step": 2160 }, { "epoch": 2.764221137691015, "grad_norm": 0.5466222167015076, "learning_rate": 1.982806225095083e-05, "loss": 0.6618, "step": 2161 }, { "epoch": 2.765501240099208, "grad_norm": 0.5842472314834595, "learning_rate": 1.981325933371661e-05, "loss": 0.6795, "step": 2162 }, { "epoch": 2.7667813425074006, "grad_norm": 0.5357396602630615, "learning_rate": 1.979845791741206e-05, "loss": 0.6719, "step": 2163 }, { "epoch": 2.768061444915593, "grad_norm": 0.5639327168464661, "learning_rate": 1.9783658012196563e-05, "loss": 0.7064, "step": 2164 }, { "epoch": 2.769341547323786, "grad_norm": 0.5845109820365906, "learning_rate": 1.9768859628228414e-05, "loss": 0.707, "step": 2165 }, { "epoch": 2.7706216497319787, "grad_norm": 0.5103625059127808, "learning_rate": 1.97540627756649e-05, "loss": 0.6566, "step": 2166 }, { "epoch": 2.771901752140171, "grad_norm": 0.5660591125488281, "learning_rate": 1.973926746466226e-05, "loss": 0.6662, "step": 2167 }, { "epoch": 2.7731818545483637, "grad_norm": 0.5204382538795471, "learning_rate": 1.9724473705375645e-05, "loss": 0.6914, "step": 2168 }, { "epoch": 2.7744619569565563, "grad_norm": 0.5099734663963318, "learning_rate": 1.9709681507959174e-05, "loss": 0.6996, "step": 2169 }, { "epoch": 2.7757420593647493, "grad_norm": 0.5796478986740112, "learning_rate": 1.9694890882565874e-05, "loss": 0.6934, "step": 2170 }, { "epoch": 2.777022161772942, "grad_norm": 0.5376036167144775, "learning_rate": 1.968010183934769e-05, "loss": 0.677, "step": 2171 }, { "epoch": 2.7783022641811344, "grad_norm": 0.5756266713142395, "learning_rate": 1.9665314388455498e-05, "loss": 0.6809, "step": 2172 }, { "epoch": 2.7795823665893273, "grad_norm": 0.5075539946556091, "learning_rate": 1.9650528540039077e-05, "loss": 0.6694, "step": 2173 }, { "epoch": 2.78086246899752, "grad_norm": 0.5039442181587219, "learning_rate": 1.963574430424709e-05, "loss": 0.6893, "step": 2174 }, { "epoch": 2.7821425714057124, "grad_norm": 0.5452905297279358, "learning_rate": 1.9620961691227106e-05, "loss": 0.6965, "step": 2175 }, { "epoch": 2.783422673813905, "grad_norm": 0.5262690782546997, "learning_rate": 1.960618071112559e-05, "loss": 0.6551, "step": 2176 }, { "epoch": 2.7847027762220975, "grad_norm": 0.49697020649909973, "learning_rate": 1.9591401374087855e-05, "loss": 0.6638, "step": 2177 }, { "epoch": 2.7859828786302905, "grad_norm": 0.5466814637184143, "learning_rate": 1.9576623690258117e-05, "loss": 0.711, "step": 2178 }, { "epoch": 2.787262981038483, "grad_norm": 0.5326719880104065, "learning_rate": 1.956184766977946e-05, "loss": 0.6363, "step": 2179 }, { "epoch": 2.788543083446676, "grad_norm": 0.52897047996521, "learning_rate": 1.9547073322793788e-05, "loss": 0.6677, "step": 2180 }, { "epoch": 2.7898231858548685, "grad_norm": 0.5449843406677246, "learning_rate": 1.9532300659441895e-05, "loss": 0.6682, "step": 2181 }, { "epoch": 2.791103288263061, "grad_norm": 0.5270798206329346, "learning_rate": 1.9517529689863406e-05, "loss": 0.6736, "step": 2182 }, { "epoch": 2.7923833906712536, "grad_norm": 0.5694547295570374, "learning_rate": 1.9502760424196773e-05, "loss": 0.6788, "step": 2183 }, { "epoch": 2.793663493079446, "grad_norm": 0.5537572503089905, "learning_rate": 1.9487992872579297e-05, "loss": 0.6846, "step": 2184 }, { "epoch": 2.794943595487639, "grad_norm": 0.46792593598365784, "learning_rate": 1.9473227045147096e-05, "loss": 0.6322, "step": 2185 }, { "epoch": 2.7962236978958317, "grad_norm": 0.520228385925293, "learning_rate": 1.9458462952035088e-05, "loss": 0.6903, "step": 2186 }, { "epoch": 2.7975038003040242, "grad_norm": 0.5050407648086548, "learning_rate": 1.9443700603377037e-05, "loss": 0.6958, "step": 2187 }, { "epoch": 2.798783902712217, "grad_norm": 0.4765312671661377, "learning_rate": 1.9428940009305462e-05, "loss": 0.6526, "step": 2188 }, { "epoch": 2.8000640051204098, "grad_norm": 0.521946907043457, "learning_rate": 1.9414181179951715e-05, "loss": 0.6242, "step": 2189 }, { "epoch": 2.8013441075286023, "grad_norm": 0.5431380867958069, "learning_rate": 1.939942412544594e-05, "loss": 0.6895, "step": 2190 }, { "epoch": 2.8013441075286023, "eval_loss": 0.01147318072617054, "eval_runtime": 10.841, "eval_samples_per_second": 45.752, "eval_steps_per_second": 5.719, "step": 2190 }, { "epoch": 2.802624209936795, "grad_norm": 0.5367740988731384, "learning_rate": 1.938466885591702e-05, "loss": 0.685, "step": 2191 }, { "epoch": 2.8039043123449874, "grad_norm": 0.5043015480041504, "learning_rate": 1.9369915381492655e-05, "loss": 0.6499, "step": 2192 }, { "epoch": 2.8051844147531804, "grad_norm": 0.5388321280479431, "learning_rate": 1.935516371229931e-05, "loss": 0.6536, "step": 2193 }, { "epoch": 2.806464517161373, "grad_norm": 0.5287108421325684, "learning_rate": 1.9340413858462174e-05, "loss": 0.6999, "step": 2194 }, { "epoch": 2.8077446195695654, "grad_norm": 0.5044527649879456, "learning_rate": 1.9325665830105232e-05, "loss": 0.6906, "step": 2195 }, { "epoch": 2.8090247219777584, "grad_norm": 0.5276654958724976, "learning_rate": 1.9310919637351202e-05, "loss": 0.6857, "step": 2196 }, { "epoch": 2.810304824385951, "grad_norm": 0.5158083438873291, "learning_rate": 1.9296175290321527e-05, "loss": 0.681, "step": 2197 }, { "epoch": 2.8115849267941435, "grad_norm": 0.5858495235443115, "learning_rate": 1.9281432799136398e-05, "loss": 0.7142, "step": 2198 }, { "epoch": 2.812865029202336, "grad_norm": 0.547903835773468, "learning_rate": 1.9266692173914747e-05, "loss": 0.6866, "step": 2199 }, { "epoch": 2.8141451316105286, "grad_norm": 0.5883592963218689, "learning_rate": 1.9251953424774185e-05, "loss": 0.7297, "step": 2200 }, { "epoch": 2.8154252340187216, "grad_norm": 0.5361905097961426, "learning_rate": 1.923721656183107e-05, "loss": 0.686, "step": 2201 }, { "epoch": 2.816705336426914, "grad_norm": 0.5558068156242371, "learning_rate": 1.9222481595200456e-05, "loss": 0.62, "step": 2202 }, { "epoch": 2.8179854388351067, "grad_norm": 0.5331078171730042, "learning_rate": 1.9207748534996086e-05, "loss": 0.6919, "step": 2203 }, { "epoch": 2.8192655412432996, "grad_norm": 0.5322447419166565, "learning_rate": 1.91930173913304e-05, "loss": 0.6701, "step": 2204 }, { "epoch": 2.820545643651492, "grad_norm": 0.5190942883491516, "learning_rate": 1.9178288174314535e-05, "loss": 0.6958, "step": 2205 }, { "epoch": 2.8218257460596847, "grad_norm": 0.5811094641685486, "learning_rate": 1.916356089405829e-05, "loss": 0.6871, "step": 2206 }, { "epoch": 2.8231058484678773, "grad_norm": 0.4891628324985504, "learning_rate": 1.914883556067013e-05, "loss": 0.6635, "step": 2207 }, { "epoch": 2.8243859508760703, "grad_norm": 0.5712688565254211, "learning_rate": 1.9134112184257208e-05, "loss": 0.657, "step": 2208 }, { "epoch": 2.825666053284263, "grad_norm": 0.5606522560119629, "learning_rate": 1.9119390774925315e-05, "loss": 0.6685, "step": 2209 }, { "epoch": 2.8269461556924553, "grad_norm": 0.5698298215866089, "learning_rate": 1.9104671342778883e-05, "loss": 0.6723, "step": 2210 }, { "epoch": 2.8282262581006483, "grad_norm": 0.6309710144996643, "learning_rate": 1.908995389792102e-05, "loss": 0.7099, "step": 2211 }, { "epoch": 2.829506360508841, "grad_norm": 0.5285724997520447, "learning_rate": 1.907523845045343e-05, "loss": 0.6682, "step": 2212 }, { "epoch": 2.8307864629170334, "grad_norm": 0.5792762041091919, "learning_rate": 1.906052501047648e-05, "loss": 0.6989, "step": 2213 }, { "epoch": 2.832066565325226, "grad_norm": 0.5514551997184753, "learning_rate": 1.9045813588089133e-05, "loss": 0.6749, "step": 2214 }, { "epoch": 2.8333466677334185, "grad_norm": 0.48829367756843567, "learning_rate": 1.903110419338899e-05, "loss": 0.6416, "step": 2215 }, { "epoch": 2.8346267701416115, "grad_norm": 0.5097596049308777, "learning_rate": 1.9016396836472248e-05, "loss": 0.6798, "step": 2216 }, { "epoch": 2.835906872549804, "grad_norm": 0.5160478949546814, "learning_rate": 1.900169152743369e-05, "loss": 0.6621, "step": 2217 }, { "epoch": 2.8371869749579965, "grad_norm": 0.5284377336502075, "learning_rate": 1.8986988276366732e-05, "loss": 0.6917, "step": 2218 }, { "epoch": 2.8384670773661895, "grad_norm": 0.5650047063827515, "learning_rate": 1.8972287093363345e-05, "loss": 0.6576, "step": 2219 }, { "epoch": 2.839747179774382, "grad_norm": 0.4914189279079437, "learning_rate": 1.895758798851409e-05, "loss": 0.6539, "step": 2220 }, { "epoch": 2.839747179774382, "eval_loss": 0.011458431370556355, "eval_runtime": 10.8251, "eval_samples_per_second": 45.82, "eval_steps_per_second": 5.727, "step": 2220 }, { "epoch": 2.8410272821825746, "grad_norm": 0.513734757900238, "learning_rate": 1.8942890971908105e-05, "loss": 0.6336, "step": 2221 }, { "epoch": 2.842307384590767, "grad_norm": 0.5714700818061829, "learning_rate": 1.892819605363309e-05, "loss": 0.717, "step": 2222 }, { "epoch": 2.8435874869989597, "grad_norm": 0.5283195376396179, "learning_rate": 1.891350324377531e-05, "loss": 0.6757, "step": 2223 }, { "epoch": 2.8448675894071527, "grad_norm": 0.5310732126235962, "learning_rate": 1.889881255241957e-05, "loss": 0.6614, "step": 2224 }, { "epoch": 2.846147691815345, "grad_norm": 0.5158543586730957, "learning_rate": 1.888412398964925e-05, "loss": 0.6406, "step": 2225 }, { "epoch": 2.8474277942235378, "grad_norm": 0.5152372717857361, "learning_rate": 1.886943756554623e-05, "loss": 0.6522, "step": 2226 }, { "epoch": 2.8487078966317307, "grad_norm": 0.5706690549850464, "learning_rate": 1.885475329019095e-05, "loss": 0.6851, "step": 2227 }, { "epoch": 2.8499879990399233, "grad_norm": 0.5428133010864258, "learning_rate": 1.8840071173662374e-05, "loss": 0.6936, "step": 2228 }, { "epoch": 2.851268101448116, "grad_norm": 0.6033597588539124, "learning_rate": 1.882539122603796e-05, "loss": 0.7267, "step": 2229 }, { "epoch": 2.8525482038563084, "grad_norm": 0.5333406925201416, "learning_rate": 1.88107134573937e-05, "loss": 0.7122, "step": 2230 }, { "epoch": 2.853828306264501, "grad_norm": 0.5083885192871094, "learning_rate": 1.8796037877804098e-05, "loss": 0.6591, "step": 2231 }, { "epoch": 2.855108408672694, "grad_norm": 0.5966604351997375, "learning_rate": 1.8781364497342128e-05, "loss": 0.6841, "step": 2232 }, { "epoch": 2.8563885110808864, "grad_norm": 0.573322594165802, "learning_rate": 1.8766693326079274e-05, "loss": 0.6358, "step": 2233 }, { "epoch": 2.857668613489079, "grad_norm": 0.5453227758407593, "learning_rate": 1.8752024374085503e-05, "loss": 0.7122, "step": 2234 }, { "epoch": 2.858948715897272, "grad_norm": 0.5487176179885864, "learning_rate": 1.873735765142924e-05, "loss": 0.6715, "step": 2235 }, { "epoch": 2.8602288183054645, "grad_norm": 0.522406280040741, "learning_rate": 1.87226931681774e-05, "loss": 0.673, "step": 2236 }, { "epoch": 2.861508920713657, "grad_norm": 0.5376841425895691, "learning_rate": 1.8708030934395373e-05, "loss": 0.7006, "step": 2237 }, { "epoch": 2.8627890231218496, "grad_norm": 0.5221294164657593, "learning_rate": 1.8693370960146958e-05, "loss": 0.6842, "step": 2238 }, { "epoch": 2.8640691255300426, "grad_norm": 0.5563523173332214, "learning_rate": 1.8678713255494455e-05, "loss": 0.6909, "step": 2239 }, { "epoch": 2.865349227938235, "grad_norm": 0.5184001922607422, "learning_rate": 1.8664057830498565e-05, "loss": 0.6464, "step": 2240 }, { "epoch": 2.8666293303464276, "grad_norm": 0.5413727164268494, "learning_rate": 1.8649404695218455e-05, "loss": 0.6858, "step": 2241 }, { "epoch": 2.8679094327546206, "grad_norm": 0.5493753552436829, "learning_rate": 1.8634753859711704e-05, "loss": 0.6573, "step": 2242 }, { "epoch": 2.869189535162813, "grad_norm": 0.5444915294647217, "learning_rate": 1.862010533403432e-05, "loss": 0.6871, "step": 2243 }, { "epoch": 2.8704696375710057, "grad_norm": 0.5372090935707092, "learning_rate": 1.860545912824071e-05, "loss": 0.6596, "step": 2244 }, { "epoch": 2.8717497399791982, "grad_norm": 0.5529900193214417, "learning_rate": 1.8590815252383722e-05, "loss": 0.6677, "step": 2245 }, { "epoch": 2.873029842387391, "grad_norm": 0.5337818264961243, "learning_rate": 1.857617371651456e-05, "loss": 0.6618, "step": 2246 }, { "epoch": 2.8743099447955838, "grad_norm": 0.5331010818481445, "learning_rate": 1.856153453068286e-05, "loss": 0.6936, "step": 2247 }, { "epoch": 2.8755900472037763, "grad_norm": 0.5968855619430542, "learning_rate": 1.8546897704936633e-05, "loss": 0.674, "step": 2248 }, { "epoch": 2.876870149611969, "grad_norm": 0.550433337688446, "learning_rate": 1.8532263249322255e-05, "loss": 0.6734, "step": 2249 }, { "epoch": 2.878150252020162, "grad_norm": 0.5292633175849915, "learning_rate": 1.8517631173884495e-05, "loss": 0.6707, "step": 2250 }, { "epoch": 2.878150252020162, "eval_loss": 0.011448027566075325, "eval_runtime": 10.8256, "eval_samples_per_second": 45.817, "eval_steps_per_second": 5.727, "step": 2250 }, { "epoch": 2.8794303544283544, "grad_norm": 0.523199200630188, "learning_rate": 1.850300148866648e-05, "loss": 0.641, "step": 2251 }, { "epoch": 2.880710456836547, "grad_norm": 0.5419129729270935, "learning_rate": 1.8488374203709692e-05, "loss": 0.6883, "step": 2252 }, { "epoch": 2.8819905592447395, "grad_norm": 0.5356900691986084, "learning_rate": 1.8473749329053977e-05, "loss": 0.6677, "step": 2253 }, { "epoch": 2.883270661652932, "grad_norm": 0.5589077472686768, "learning_rate": 1.845912687473753e-05, "loss": 0.7183, "step": 2254 }, { "epoch": 2.884550764061125, "grad_norm": 0.5814553499221802, "learning_rate": 1.8444506850796852e-05, "loss": 0.6842, "step": 2255 }, { "epoch": 2.8858308664693175, "grad_norm": 0.5884097814559937, "learning_rate": 1.8429889267266818e-05, "loss": 0.6861, "step": 2256 }, { "epoch": 2.88711096887751, "grad_norm": 0.5445072054862976, "learning_rate": 1.8415274134180605e-05, "loss": 0.69, "step": 2257 }, { "epoch": 2.888391071285703, "grad_norm": 0.584773063659668, "learning_rate": 1.8400661461569705e-05, "loss": 0.6821, "step": 2258 }, { "epoch": 2.8896711736938956, "grad_norm": 0.5701531767845154, "learning_rate": 1.8386051259463928e-05, "loss": 0.6888, "step": 2259 }, { "epoch": 2.890951276102088, "grad_norm": 0.5567769408226013, "learning_rate": 1.8371443537891406e-05, "loss": 0.679, "step": 2260 }, { "epoch": 2.8922313785102807, "grad_norm": 0.5713131427764893, "learning_rate": 1.835683830687853e-05, "loss": 0.6713, "step": 2261 }, { "epoch": 2.893511480918473, "grad_norm": 0.5630804300308228, "learning_rate": 1.834223557645001e-05, "loss": 0.7099, "step": 2262 }, { "epoch": 2.894791583326666, "grad_norm": 0.5425707697868347, "learning_rate": 1.832763535662884e-05, "loss": 0.6889, "step": 2263 }, { "epoch": 2.8960716857348587, "grad_norm": 0.5156663656234741, "learning_rate": 1.831303765743627e-05, "loss": 0.6713, "step": 2264 }, { "epoch": 2.8973517881430517, "grad_norm": 0.5536324977874756, "learning_rate": 1.829844248889184e-05, "loss": 0.6558, "step": 2265 }, { "epoch": 2.8986318905512443, "grad_norm": 0.5337991714477539, "learning_rate": 1.828384986101335e-05, "loss": 0.6679, "step": 2266 }, { "epoch": 2.899911992959437, "grad_norm": 0.542484700679779, "learning_rate": 1.8269259783816838e-05, "loss": 0.6912, "step": 2267 }, { "epoch": 2.9011920953676293, "grad_norm": 0.5581287741661072, "learning_rate": 1.8254672267316625e-05, "loss": 0.6627, "step": 2268 }, { "epoch": 2.902472197775822, "grad_norm": 0.5504825115203857, "learning_rate": 1.8240087321525236e-05, "loss": 0.7211, "step": 2269 }, { "epoch": 2.903752300184015, "grad_norm": 0.549676239490509, "learning_rate": 1.822550495645346e-05, "loss": 0.6678, "step": 2270 }, { "epoch": 2.9050324025922074, "grad_norm": 0.5072528719902039, "learning_rate": 1.8210925182110305e-05, "loss": 0.6432, "step": 2271 }, { "epoch": 2.9063125050004, "grad_norm": 0.5294970273971558, "learning_rate": 1.8196348008502993e-05, "loss": 0.6796, "step": 2272 }, { "epoch": 2.907592607408593, "grad_norm": 0.5018666386604309, "learning_rate": 1.8181773445636975e-05, "loss": 0.6761, "step": 2273 }, { "epoch": 2.9088727098167855, "grad_norm": 0.5346142649650574, "learning_rate": 1.816720150351591e-05, "loss": 0.6618, "step": 2274 }, { "epoch": 2.910152812224978, "grad_norm": 0.5576887726783752, "learning_rate": 1.815263219214164e-05, "loss": 0.6694, "step": 2275 }, { "epoch": 2.9114329146331706, "grad_norm": 0.519875705242157, "learning_rate": 1.813806552151421e-05, "loss": 0.6862, "step": 2276 }, { "epoch": 2.912713017041363, "grad_norm": 0.5766414403915405, "learning_rate": 1.8123501501631874e-05, "loss": 0.6929, "step": 2277 }, { "epoch": 2.913993119449556, "grad_norm": 0.5306098461151123, "learning_rate": 1.810894014249103e-05, "loss": 0.6441, "step": 2278 }, { "epoch": 2.9152732218577486, "grad_norm": 0.5158607959747314, "learning_rate": 1.8094381454086278e-05, "loss": 0.6806, "step": 2279 }, { "epoch": 2.916553324265941, "grad_norm": 0.5030341744422913, "learning_rate": 1.8079825446410376e-05, "loss": 0.6913, "step": 2280 }, { "epoch": 2.916553324265941, "eval_loss": 0.011444072239100933, "eval_runtime": 10.8172, "eval_samples_per_second": 45.853, "eval_steps_per_second": 5.732, "step": 2280 }, { "epoch": 2.917833426674134, "grad_norm": 0.5056853890419006, "learning_rate": 1.806527212945423e-05, "loss": 0.6785, "step": 2281 }, { "epoch": 2.9191135290823267, "grad_norm": 0.5447837710380554, "learning_rate": 1.8050721513206913e-05, "loss": 0.6811, "step": 2282 }, { "epoch": 2.9203936314905192, "grad_norm": 0.5257372260093689, "learning_rate": 1.803617360765565e-05, "loss": 0.6601, "step": 2283 }, { "epoch": 2.9216737338987118, "grad_norm": 0.5078234672546387, "learning_rate": 1.8021628422785796e-05, "loss": 0.6813, "step": 2284 }, { "epoch": 2.9229538363069043, "grad_norm": 0.5475780963897705, "learning_rate": 1.8007085968580825e-05, "loss": 0.668, "step": 2285 }, { "epoch": 2.9242339387150973, "grad_norm": 0.5548843741416931, "learning_rate": 1.7992546255022366e-05, "loss": 0.675, "step": 2286 }, { "epoch": 2.92551404112329, "grad_norm": 0.5062752366065979, "learning_rate": 1.7978009292090145e-05, "loss": 0.6595, "step": 2287 }, { "epoch": 2.9267941435314824, "grad_norm": 0.5550132393836975, "learning_rate": 1.7963475089762002e-05, "loss": 0.7002, "step": 2288 }, { "epoch": 2.9280742459396754, "grad_norm": 0.5342233180999756, "learning_rate": 1.79489436580139e-05, "loss": 0.6494, "step": 2289 }, { "epoch": 2.929354348347868, "grad_norm": 0.5512034296989441, "learning_rate": 1.7934415006819882e-05, "loss": 0.6887, "step": 2290 }, { "epoch": 2.9306344507560604, "grad_norm": 0.5523194074630737, "learning_rate": 1.791988914615208e-05, "loss": 0.6685, "step": 2291 }, { "epoch": 2.931914553164253, "grad_norm": 0.5492927432060242, "learning_rate": 1.790536608598073e-05, "loss": 0.6466, "step": 2292 }, { "epoch": 2.9331946555724455, "grad_norm": 0.5797692537307739, "learning_rate": 1.7890845836274126e-05, "loss": 0.6576, "step": 2293 }, { "epoch": 2.9344747579806385, "grad_norm": 0.5514007210731506, "learning_rate": 1.7876328406998644e-05, "loss": 0.6667, "step": 2294 }, { "epoch": 2.935754860388831, "grad_norm": 0.5545125603675842, "learning_rate": 1.786181380811872e-05, "loss": 0.6881, "step": 2295 }, { "epoch": 2.937034962797024, "grad_norm": 0.5694110989570618, "learning_rate": 1.7847302049596855e-05, "loss": 0.6972, "step": 2296 }, { "epoch": 2.9383150652052166, "grad_norm": 0.5477825999259949, "learning_rate": 1.7832793141393584e-05, "loss": 0.6806, "step": 2297 }, { "epoch": 2.939595167613409, "grad_norm": 0.5117954015731812, "learning_rate": 1.7818287093467504e-05, "loss": 0.6962, "step": 2298 }, { "epoch": 2.9408752700216017, "grad_norm": 0.5466132760047913, "learning_rate": 1.780378391577524e-05, "loss": 0.6643, "step": 2299 }, { "epoch": 2.942155372429794, "grad_norm": 0.5463626980781555, "learning_rate": 1.778928361827144e-05, "loss": 0.6869, "step": 2300 }, { "epoch": 2.943435474837987, "grad_norm": 0.5090941786766052, "learning_rate": 1.7774786210908784e-05, "loss": 0.6402, "step": 2301 }, { "epoch": 2.9447155772461797, "grad_norm": 0.5924723148345947, "learning_rate": 1.7760291703637973e-05, "loss": 0.6985, "step": 2302 }, { "epoch": 2.9459956796543723, "grad_norm": 0.5959092378616333, "learning_rate": 1.7745800106407717e-05, "loss": 0.6777, "step": 2303 }, { "epoch": 2.9472757820625652, "grad_norm": 0.5699868202209473, "learning_rate": 1.7731311429164707e-05, "loss": 0.7121, "step": 2304 }, { "epoch": 2.948555884470758, "grad_norm": 0.5955172777175903, "learning_rate": 1.771682568185365e-05, "loss": 0.6519, "step": 2305 }, { "epoch": 2.9498359868789503, "grad_norm": 0.6218169331550598, "learning_rate": 1.770234287441725e-05, "loss": 0.6957, "step": 2306 }, { "epoch": 2.951116089287143, "grad_norm": 0.559373676776886, "learning_rate": 1.768786301679616e-05, "loss": 0.6966, "step": 2307 }, { "epoch": 2.9523961916953354, "grad_norm": 0.5644216537475586, "learning_rate": 1.7673386118929044e-05, "loss": 0.7107, "step": 2308 }, { "epoch": 2.9536762941035284, "grad_norm": 0.5214970111846924, "learning_rate": 1.7658912190752522e-05, "loss": 0.6266, "step": 2309 }, { "epoch": 2.954956396511721, "grad_norm": 0.5662040114402771, "learning_rate": 1.7644441242201162e-05, "loss": 0.6738, "step": 2310 }, { "epoch": 2.954956396511721, "eval_loss": 0.011429225094616413, "eval_runtime": 10.8327, "eval_samples_per_second": 45.787, "eval_steps_per_second": 5.723, "step": 2310 }, { "epoch": 2.9562364989199135, "grad_norm": 0.5169128179550171, "learning_rate": 1.76299732832075e-05, "loss": 0.6668, "step": 2311 }, { "epoch": 2.9575166013281065, "grad_norm": 0.5528967380523682, "learning_rate": 1.761550832370203e-05, "loss": 0.6774, "step": 2312 }, { "epoch": 2.958796703736299, "grad_norm": 0.5568346977233887, "learning_rate": 1.760104637361316e-05, "loss": 0.6672, "step": 2313 }, { "epoch": 2.9600768061444915, "grad_norm": 0.5672390460968018, "learning_rate": 1.758658744286725e-05, "loss": 0.6915, "step": 2314 }, { "epoch": 2.961356908552684, "grad_norm": 0.5150502324104309, "learning_rate": 1.75721315413886e-05, "loss": 0.7044, "step": 2315 }, { "epoch": 2.9626370109608766, "grad_norm": 0.5412737131118774, "learning_rate": 1.75576786790994e-05, "loss": 0.7196, "step": 2316 }, { "epoch": 2.9639171133690696, "grad_norm": 0.5048683285713196, "learning_rate": 1.754322886591977e-05, "loss": 0.6404, "step": 2317 }, { "epoch": 2.965197215777262, "grad_norm": 0.48774898052215576, "learning_rate": 1.7528782111767754e-05, "loss": 0.6685, "step": 2318 }, { "epoch": 2.9664773181854547, "grad_norm": 0.5408198237419128, "learning_rate": 1.751433842655926e-05, "loss": 0.6782, "step": 2319 }, { "epoch": 2.9677574205936477, "grad_norm": 0.5126347541809082, "learning_rate": 1.7499897820208125e-05, "loss": 0.6698, "step": 2320 }, { "epoch": 2.96903752300184, "grad_norm": 0.5047155618667603, "learning_rate": 1.7485460302626042e-05, "loss": 0.6528, "step": 2321 }, { "epoch": 2.9703176254100327, "grad_norm": 0.5210356116294861, "learning_rate": 1.7471025883722604e-05, "loss": 0.6761, "step": 2322 }, { "epoch": 2.9715977278182253, "grad_norm": 0.5186281204223633, "learning_rate": 1.7456594573405284e-05, "loss": 0.7083, "step": 2323 }, { "epoch": 2.9728778302264183, "grad_norm": 0.5127356648445129, "learning_rate": 1.7442166381579392e-05, "loss": 0.6877, "step": 2324 }, { "epoch": 2.974157932634611, "grad_norm": 0.5343574285507202, "learning_rate": 1.7427741318148124e-05, "loss": 0.7014, "step": 2325 }, { "epoch": 2.9754380350428034, "grad_norm": 0.4927723705768585, "learning_rate": 1.7413319393012524e-05, "loss": 0.6777, "step": 2326 }, { "epoch": 2.9767181374509963, "grad_norm": 0.4936085343360901, "learning_rate": 1.7398900616071457e-05, "loss": 0.6631, "step": 2327 }, { "epoch": 2.977998239859189, "grad_norm": 0.4894747734069824, "learning_rate": 1.738448499722167e-05, "loss": 0.6378, "step": 2328 }, { "epoch": 2.9792783422673814, "grad_norm": 0.5036857724189758, "learning_rate": 1.7370072546357713e-05, "loss": 0.683, "step": 2329 }, { "epoch": 2.980558444675574, "grad_norm": 0.5254474878311157, "learning_rate": 1.7355663273371965e-05, "loss": 0.624, "step": 2330 }, { "epoch": 2.9818385470837665, "grad_norm": 0.502440333366394, "learning_rate": 1.7341257188154625e-05, "loss": 0.6759, "step": 2331 }, { "epoch": 2.9831186494919595, "grad_norm": 0.520214319229126, "learning_rate": 1.7326854300593723e-05, "loss": 0.6709, "step": 2332 }, { "epoch": 2.984398751900152, "grad_norm": 0.5521348714828491, "learning_rate": 1.7312454620575055e-05, "loss": 0.6755, "step": 2333 }, { "epoch": 2.9856788543083446, "grad_norm": 0.5944056510925293, "learning_rate": 1.729805815798225e-05, "loss": 0.7021, "step": 2334 }, { "epoch": 2.9869589567165375, "grad_norm": 0.596458375453949, "learning_rate": 1.728366492269672e-05, "loss": 0.6757, "step": 2335 }, { "epoch": 2.98823905912473, "grad_norm": 0.5317464470863342, "learning_rate": 1.7269274924597644e-05, "loss": 0.7086, "step": 2336 }, { "epoch": 2.9895191615329226, "grad_norm": 0.5277230739593506, "learning_rate": 1.725488817356201e-05, "loss": 0.6537, "step": 2337 }, { "epoch": 2.990799263941115, "grad_norm": 0.5766561031341553, "learning_rate": 1.7240504679464554e-05, "loss": 0.6919, "step": 2338 }, { "epoch": 2.9920793663493077, "grad_norm": 0.5419392585754395, "learning_rate": 1.722612445217778e-05, "loss": 0.6429, "step": 2339 }, { "epoch": 2.9933594687575007, "grad_norm": 0.5629022121429443, "learning_rate": 1.7211747501571957e-05, "loss": 0.6483, "step": 2340 }, { "epoch": 2.9933594687575007, "eval_loss": 0.011423509567975998, "eval_runtime": 10.8251, "eval_samples_per_second": 45.819, "eval_steps_per_second": 5.727, "step": 2340 }, { "epoch": 2.9946395711656932, "grad_norm": 0.5854880809783936, "learning_rate": 1.7197373837515104e-05, "loss": 0.6896, "step": 2341 }, { "epoch": 2.9959196735738858, "grad_norm": 0.4965278208255768, "learning_rate": 1.718300346987297e-05, "loss": 0.6661, "step": 2342 }, { "epoch": 2.9971997759820788, "grad_norm": 0.5521373152732849, "learning_rate": 1.7168636408509064e-05, "loss": 0.6534, "step": 2343 }, { "epoch": 2.9984798783902713, "grad_norm": 0.5576989054679871, "learning_rate": 1.715427266328461e-05, "loss": 0.6832, "step": 2344 }, { "epoch": 2.999759980798464, "grad_norm": 0.5305948853492737, "learning_rate": 1.7139912244058555e-05, "loss": 0.6656, "step": 2345 }, { "epoch": 3.0, "grad_norm": 0.9938316345214844, "learning_rate": 1.7125555160687582e-05, "loss": 0.6321, "step": 2346 }, { "epoch": 3.0012801024081925, "grad_norm": 0.7422385215759277, "learning_rate": 1.7111201423026054e-05, "loss": 0.6476, "step": 2347 }, { "epoch": 3.0025602048163855, "grad_norm": 0.6276028752326965, "learning_rate": 1.7096851040926062e-05, "loss": 0.6424, "step": 2348 }, { "epoch": 3.003840307224578, "grad_norm": 0.5436055064201355, "learning_rate": 1.708250402423739e-05, "loss": 0.6255, "step": 2349 }, { "epoch": 3.0051204096327706, "grad_norm": 0.6255354881286621, "learning_rate": 1.70681603828075e-05, "loss": 0.6323, "step": 2350 }, { "epoch": 3.006400512040963, "grad_norm": 0.6582286357879639, "learning_rate": 1.7053820126481545e-05, "loss": 0.6366, "step": 2351 }, { "epoch": 3.007680614449156, "grad_norm": 0.5947375893592834, "learning_rate": 1.703948326510237e-05, "loss": 0.6242, "step": 2352 }, { "epoch": 3.0089607168573487, "grad_norm": 0.603613018989563, "learning_rate": 1.7025149808510456e-05, "loss": 0.674, "step": 2353 }, { "epoch": 3.010240819265541, "grad_norm": 0.5693184733390808, "learning_rate": 1.7010819766543972e-05, "loss": 0.6536, "step": 2354 }, { "epoch": 3.0115209216737338, "grad_norm": 0.5672442317008972, "learning_rate": 1.6996493149038747e-05, "loss": 0.6322, "step": 2355 }, { "epoch": 3.0128010240819267, "grad_norm": 0.637457549571991, "learning_rate": 1.698216996582823e-05, "loss": 0.6834, "step": 2356 }, { "epoch": 3.0140811264901193, "grad_norm": 0.5192814469337463, "learning_rate": 1.6967850226743544e-05, "loss": 0.6562, "step": 2357 }, { "epoch": 3.015361228898312, "grad_norm": 0.5664059519767761, "learning_rate": 1.6953533941613446e-05, "loss": 0.6536, "step": 2358 }, { "epoch": 3.0166413313065044, "grad_norm": 0.559282660484314, "learning_rate": 1.693922112026429e-05, "loss": 0.6477, "step": 2359 }, { "epoch": 3.0179214337146973, "grad_norm": 0.5464085340499878, "learning_rate": 1.692491177252009e-05, "loss": 0.5935, "step": 2360 }, { "epoch": 3.01920153612289, "grad_norm": 0.5866004824638367, "learning_rate": 1.691060590820246e-05, "loss": 0.6732, "step": 2361 }, { "epoch": 3.0204816385310824, "grad_norm": 0.5507637858390808, "learning_rate": 1.6896303537130617e-05, "loss": 0.6411, "step": 2362 }, { "epoch": 3.021761740939275, "grad_norm": 0.5781289339065552, "learning_rate": 1.6882004669121394e-05, "loss": 0.6463, "step": 2363 }, { "epoch": 3.023041843347468, "grad_norm": 0.5602301955223083, "learning_rate": 1.6867709313989217e-05, "loss": 0.6076, "step": 2364 }, { "epoch": 3.0243219457556605, "grad_norm": 0.5312731266021729, "learning_rate": 1.6853417481546084e-05, "loss": 0.6828, "step": 2365 }, { "epoch": 3.025602048163853, "grad_norm": 0.5267046093940735, "learning_rate": 1.6839129181601596e-05, "loss": 0.6334, "step": 2366 }, { "epoch": 3.0268821505720456, "grad_norm": 0.5690827369689941, "learning_rate": 1.682484442396292e-05, "loss": 0.6406, "step": 2367 }, { "epoch": 3.0281622529802386, "grad_norm": 0.5078542828559875, "learning_rate": 1.681056321843479e-05, "loss": 0.6609, "step": 2368 }, { "epoch": 3.029442355388431, "grad_norm": 0.5197672843933105, "learning_rate": 1.6796285574819505e-05, "loss": 0.6719, "step": 2369 }, { "epoch": 3.0307224577966236, "grad_norm": 0.5278779864311218, "learning_rate": 1.6782011502916925e-05, "loss": 0.6652, "step": 2370 }, { "epoch": 3.0307224577966236, "eval_loss": 0.011501915752887726, "eval_runtime": 10.8261, "eval_samples_per_second": 45.815, "eval_steps_per_second": 5.727, "step": 2370 }, { "epoch": 3.032002560204816, "grad_norm": 0.53105628490448, "learning_rate": 1.6767741012524444e-05, "loss": 0.6375, "step": 2371 }, { "epoch": 3.033282662613009, "grad_norm": 0.5455028414726257, "learning_rate": 1.6753474113437014e-05, "loss": 0.648, "step": 2372 }, { "epoch": 3.0345627650212017, "grad_norm": 0.5050350427627563, "learning_rate": 1.6739210815447107e-05, "loss": 0.656, "step": 2373 }, { "epoch": 3.0358428674293942, "grad_norm": 0.5428577065467834, "learning_rate": 1.672495112834474e-05, "loss": 0.6447, "step": 2374 }, { "epoch": 3.0371229698375872, "grad_norm": 0.5513570308685303, "learning_rate": 1.671069506191743e-05, "loss": 0.6423, "step": 2375 }, { "epoch": 3.0384030722457798, "grad_norm": 0.5326774716377258, "learning_rate": 1.6696442625950223e-05, "loss": 0.6622, "step": 2376 }, { "epoch": 3.0396831746539723, "grad_norm": 0.516811192035675, "learning_rate": 1.6682193830225678e-05, "loss": 0.632, "step": 2377 }, { "epoch": 3.040963277062165, "grad_norm": 0.5091072916984558, "learning_rate": 1.6667948684523847e-05, "loss": 0.6082, "step": 2378 }, { "epoch": 3.042243379470358, "grad_norm": 0.49962544441223145, "learning_rate": 1.6653707198622272e-05, "loss": 0.6579, "step": 2379 }, { "epoch": 3.0435234818785504, "grad_norm": 0.4801453948020935, "learning_rate": 1.6639469382295992e-05, "loss": 0.6097, "step": 2380 }, { "epoch": 3.044803584286743, "grad_norm": 0.5038813352584839, "learning_rate": 1.662523524531753e-05, "loss": 0.6301, "step": 2381 }, { "epoch": 3.0460836866949355, "grad_norm": 0.5112163424491882, "learning_rate": 1.6611004797456866e-05, "loss": 0.6524, "step": 2382 }, { "epoch": 3.0473637891031284, "grad_norm": 0.537038266658783, "learning_rate": 1.659677804848147e-05, "loss": 0.6646, "step": 2383 }, { "epoch": 3.048643891511321, "grad_norm": 0.5388227701187134, "learning_rate": 1.658255500815626e-05, "loss": 0.659, "step": 2384 }, { "epoch": 3.0499239939195135, "grad_norm": 0.49667227268218994, "learning_rate": 1.6568335686243608e-05, "loss": 0.6349, "step": 2385 }, { "epoch": 3.051204096327706, "grad_norm": 0.5519853234291077, "learning_rate": 1.6554120092503346e-05, "loss": 0.6339, "step": 2386 }, { "epoch": 3.052484198735899, "grad_norm": 0.5274022221565247, "learning_rate": 1.653990823669273e-05, "loss": 0.6435, "step": 2387 }, { "epoch": 3.0537643011440916, "grad_norm": 0.5133228302001953, "learning_rate": 1.652570012856646e-05, "loss": 0.6492, "step": 2388 }, { "epoch": 3.055044403552284, "grad_norm": 0.5335580110549927, "learning_rate": 1.651149577787666e-05, "loss": 0.6459, "step": 2389 }, { "epoch": 3.0563245059604767, "grad_norm": 0.509559154510498, "learning_rate": 1.649729519437289e-05, "loss": 0.6581, "step": 2390 }, { "epoch": 3.0576046083686697, "grad_norm": 0.5015418529510498, "learning_rate": 1.6483098387802098e-05, "loss": 0.678, "step": 2391 }, { "epoch": 3.058884710776862, "grad_norm": 0.5484011173248291, "learning_rate": 1.6468905367908653e-05, "loss": 0.6452, "step": 2392 }, { "epoch": 3.0601648131850547, "grad_norm": 0.5278120636940002, "learning_rate": 1.6454716144434334e-05, "loss": 0.6251, "step": 2393 }, { "epoch": 3.0614449155932473, "grad_norm": 0.5070874691009521, "learning_rate": 1.6440530727118295e-05, "loss": 0.6237, "step": 2394 }, { "epoch": 3.0627250180014403, "grad_norm": 0.5475306510925293, "learning_rate": 1.6426349125697097e-05, "loss": 0.6619, "step": 2395 }, { "epoch": 3.064005120409633, "grad_norm": 0.5989736318588257, "learning_rate": 1.6412171349904675e-05, "loss": 0.6766, "step": 2396 }, { "epoch": 3.0652852228178253, "grad_norm": 0.5467805862426758, "learning_rate": 1.6397997409472325e-05, "loss": 0.6418, "step": 2397 }, { "epoch": 3.066565325226018, "grad_norm": 0.6003584265708923, "learning_rate": 1.6383827314128732e-05, "loss": 0.6556, "step": 2398 }, { "epoch": 3.067845427634211, "grad_norm": 0.5687540769577026, "learning_rate": 1.6369661073599913e-05, "loss": 0.677, "step": 2399 }, { "epoch": 3.0691255300424034, "grad_norm": 0.5815536379814148, "learning_rate": 1.6355498697609275e-05, "loss": 0.6457, "step": 2400 }, { "epoch": 3.0691255300424034, "eval_loss": 0.011508642695844173, "eval_runtime": 10.8338, "eval_samples_per_second": 45.783, "eval_steps_per_second": 5.723, "step": 2400 }, { "epoch": 3.070405632450596, "grad_norm": 0.5543200373649597, "learning_rate": 1.6341340195877557e-05, "loss": 0.6363, "step": 2401 }, { "epoch": 3.0716857348587885, "grad_norm": 0.5092668533325195, "learning_rate": 1.6327185578122823e-05, "loss": 0.6362, "step": 2402 }, { "epoch": 3.0729658372669815, "grad_norm": 0.5534361004829407, "learning_rate": 1.631303485406049e-05, "loss": 0.705, "step": 2403 }, { "epoch": 3.074245939675174, "grad_norm": 0.5444126129150391, "learning_rate": 1.62988880334033e-05, "loss": 0.6531, "step": 2404 }, { "epoch": 3.0755260420833666, "grad_norm": 0.5639611482620239, "learning_rate": 1.6284745125861313e-05, "loss": 0.686, "step": 2405 }, { "epoch": 3.0768061444915595, "grad_norm": 0.5092193484306335, "learning_rate": 1.6270606141141896e-05, "loss": 0.6227, "step": 2406 }, { "epoch": 3.078086246899752, "grad_norm": 0.5228305459022522, "learning_rate": 1.6256471088949742e-05, "loss": 0.6722, "step": 2407 }, { "epoch": 3.0793663493079446, "grad_norm": 0.4967285096645355, "learning_rate": 1.624233997898682e-05, "loss": 0.6753, "step": 2408 }, { "epoch": 3.080646451716137, "grad_norm": 0.5037521719932556, "learning_rate": 1.6228212820952414e-05, "loss": 0.6445, "step": 2409 }, { "epoch": 3.08192655412433, "grad_norm": 0.5268568396568298, "learning_rate": 1.62140896245431e-05, "loss": 0.6346, "step": 2410 }, { "epoch": 3.0832066565325227, "grad_norm": 0.49345672130584717, "learning_rate": 1.6199970399452697e-05, "loss": 0.6156, "step": 2411 }, { "epoch": 3.0844867589407152, "grad_norm": 0.5403556227684021, "learning_rate": 1.6185855155372338e-05, "loss": 0.6568, "step": 2412 }, { "epoch": 3.0857668613489078, "grad_norm": 0.5360240340232849, "learning_rate": 1.6171743901990414e-05, "loss": 0.654, "step": 2413 }, { "epoch": 3.0870469637571007, "grad_norm": 0.5525732040405273, "learning_rate": 1.6157636648992566e-05, "loss": 0.6403, "step": 2414 }, { "epoch": 3.0883270661652933, "grad_norm": 0.5173043012619019, "learning_rate": 1.6143533406061692e-05, "loss": 0.6336, "step": 2415 }, { "epoch": 3.089607168573486, "grad_norm": 0.5381692051887512, "learning_rate": 1.6129434182877952e-05, "loss": 0.6541, "step": 2416 }, { "epoch": 3.0908872709816784, "grad_norm": 0.5557066202163696, "learning_rate": 1.611533898911872e-05, "loss": 0.6644, "step": 2417 }, { "epoch": 3.0921673733898714, "grad_norm": 0.5595386624336243, "learning_rate": 1.610124783445864e-05, "loss": 0.6232, "step": 2418 }, { "epoch": 3.093447475798064, "grad_norm": 0.5165018439292908, "learning_rate": 1.6087160728569557e-05, "loss": 0.6227, "step": 2419 }, { "epoch": 3.0947275782062564, "grad_norm": 0.5257919430732727, "learning_rate": 1.6073077681120532e-05, "loss": 0.6236, "step": 2420 }, { "epoch": 3.096007680614449, "grad_norm": 0.5543671250343323, "learning_rate": 1.6058998701777864e-05, "loss": 0.644, "step": 2421 }, { "epoch": 3.097287783022642, "grad_norm": 0.5471598505973816, "learning_rate": 1.6044923800205055e-05, "loss": 0.6632, "step": 2422 }, { "epoch": 3.0985678854308345, "grad_norm": 0.47705143690109253, "learning_rate": 1.6030852986062782e-05, "loss": 0.6168, "step": 2423 }, { "epoch": 3.099847987839027, "grad_norm": 0.5634862780570984, "learning_rate": 1.6016786269008954e-05, "loss": 0.6512, "step": 2424 }, { "epoch": 3.1011280902472196, "grad_norm": 0.5108270645141602, "learning_rate": 1.600272365869864e-05, "loss": 0.6425, "step": 2425 }, { "epoch": 3.1024081926554126, "grad_norm": 0.51654052734375, "learning_rate": 1.5988665164784093e-05, "loss": 0.6681, "step": 2426 }, { "epoch": 3.103688295063605, "grad_norm": 0.5479849576950073, "learning_rate": 1.5974610796914765e-05, "loss": 0.6162, "step": 2427 }, { "epoch": 3.1049683974717976, "grad_norm": 0.5156897306442261, "learning_rate": 1.5960560564737247e-05, "loss": 0.6803, "step": 2428 }, { "epoch": 3.10624849987999, "grad_norm": 0.5287712216377258, "learning_rate": 1.5946514477895303e-05, "loss": 0.6313, "step": 2429 }, { "epoch": 3.107528602288183, "grad_norm": 0.5856785178184509, "learning_rate": 1.5932472546029863e-05, "loss": 0.66, "step": 2430 }, { "epoch": 3.107528602288183, "eval_loss": 0.01151246763765812, "eval_runtime": 10.8137, "eval_samples_per_second": 45.868, "eval_steps_per_second": 5.733, "step": 2430 }, { "epoch": 3.1088087046963757, "grad_norm": 0.5303325653076172, "learning_rate": 1.5918434778778974e-05, "loss": 0.6467, "step": 2431 }, { "epoch": 3.1100888071045683, "grad_norm": 0.6068860292434692, "learning_rate": 1.5904401185777855e-05, "loss": 0.6841, "step": 2432 }, { "epoch": 3.111368909512761, "grad_norm": 0.5345388650894165, "learning_rate": 1.5890371776658858e-05, "loss": 0.6411, "step": 2433 }, { "epoch": 3.112649011920954, "grad_norm": 0.5276821851730347, "learning_rate": 1.5876346561051438e-05, "loss": 0.6408, "step": 2434 }, { "epoch": 3.1139291143291463, "grad_norm": 0.5618433356285095, "learning_rate": 1.5862325548582193e-05, "loss": 0.6744, "step": 2435 }, { "epoch": 3.115209216737339, "grad_norm": 0.5100088119506836, "learning_rate": 1.584830874887484e-05, "loss": 0.6772, "step": 2436 }, { "epoch": 3.116489319145532, "grad_norm": 0.5173203945159912, "learning_rate": 1.5834296171550187e-05, "loss": 0.6595, "step": 2437 }, { "epoch": 3.1177694215537244, "grad_norm": 0.5615100860595703, "learning_rate": 1.5820287826226145e-05, "loss": 0.6464, "step": 2438 }, { "epoch": 3.119049523961917, "grad_norm": 0.5282062292098999, "learning_rate": 1.5806283722517747e-05, "loss": 0.6454, "step": 2439 }, { "epoch": 3.1203296263701095, "grad_norm": 0.4987587332725525, "learning_rate": 1.579228387003708e-05, "loss": 0.6473, "step": 2440 }, { "epoch": 3.1216097287783025, "grad_norm": 0.5156669020652771, "learning_rate": 1.577828827839333e-05, "loss": 0.6576, "step": 2441 }, { "epoch": 3.122889831186495, "grad_norm": 0.5347732901573181, "learning_rate": 1.5764296957192763e-05, "loss": 0.6158, "step": 2442 }, { "epoch": 3.1241699335946875, "grad_norm": 0.5573805570602417, "learning_rate": 1.5750309916038707e-05, "loss": 0.6272, "step": 2443 }, { "epoch": 3.12545003600288, "grad_norm": 0.49766889214515686, "learning_rate": 1.5736327164531543e-05, "loss": 0.6148, "step": 2444 }, { "epoch": 3.126730138411073, "grad_norm": 0.5209107398986816, "learning_rate": 1.572234871226873e-05, "loss": 0.6452, "step": 2445 }, { "epoch": 3.1280102408192656, "grad_norm": 0.5295728445053101, "learning_rate": 1.5708374568844758e-05, "loss": 0.6283, "step": 2446 }, { "epoch": 3.129290343227458, "grad_norm": 0.5458559393882751, "learning_rate": 1.5694404743851162e-05, "loss": 0.673, "step": 2447 }, { "epoch": 3.1305704456356507, "grad_norm": 0.5030727982521057, "learning_rate": 1.5680439246876528e-05, "loss": 0.6546, "step": 2448 }, { "epoch": 3.1318505480438437, "grad_norm": 0.5325101017951965, "learning_rate": 1.5666478087506445e-05, "loss": 0.6171, "step": 2449 }, { "epoch": 3.133130650452036, "grad_norm": 0.5380441546440125, "learning_rate": 1.5652521275323547e-05, "loss": 0.6626, "step": 2450 }, { "epoch": 3.1344107528602287, "grad_norm": 0.5023500323295593, "learning_rate": 1.5638568819907475e-05, "loss": 0.6462, "step": 2451 }, { "epoch": 3.1356908552684213, "grad_norm": 0.5191518664360046, "learning_rate": 1.5624620730834878e-05, "loss": 0.6669, "step": 2452 }, { "epoch": 3.1369709576766143, "grad_norm": 0.5531533360481262, "learning_rate": 1.5610677017679417e-05, "loss": 0.6702, "step": 2453 }, { "epoch": 3.138251060084807, "grad_norm": 0.5363332033157349, "learning_rate": 1.5596737690011735e-05, "loss": 0.6578, "step": 2454 }, { "epoch": 3.1395311624929993, "grad_norm": 0.530849814414978, "learning_rate": 1.5582802757399485e-05, "loss": 0.6559, "step": 2455 }, { "epoch": 3.140811264901192, "grad_norm": 0.507783055305481, "learning_rate": 1.5568872229407282e-05, "loss": 0.652, "step": 2456 }, { "epoch": 3.142091367309385, "grad_norm": 0.5618488788604736, "learning_rate": 1.5554946115596733e-05, "loss": 0.6378, "step": 2457 }, { "epoch": 3.1433714697175774, "grad_norm": 0.531067967414856, "learning_rate": 1.5541024425526406e-05, "loss": 0.6661, "step": 2458 }, { "epoch": 3.14465157212577, "grad_norm": 0.547110915184021, "learning_rate": 1.5527107168751845e-05, "loss": 0.6627, "step": 2459 }, { "epoch": 3.145931674533963, "grad_norm": 0.5522833466529846, "learning_rate": 1.5513194354825523e-05, "loss": 0.6631, "step": 2460 }, { "epoch": 3.145931674533963, "eval_loss": 0.011496835388243198, "eval_runtime": 10.8308, "eval_samples_per_second": 45.795, "eval_steps_per_second": 5.724, "step": 2460 }, { "epoch": 3.1472117769421555, "grad_norm": 0.5810582041740417, "learning_rate": 1.54992859932969e-05, "loss": 0.6893, "step": 2461 }, { "epoch": 3.148491879350348, "grad_norm": 0.5589973330497742, "learning_rate": 1.5485382093712368e-05, "loss": 0.6431, "step": 2462 }, { "epoch": 3.1497719817585406, "grad_norm": 0.5137026309967041, "learning_rate": 1.547148266561523e-05, "loss": 0.6451, "step": 2463 }, { "epoch": 3.1510520841667335, "grad_norm": 0.5745928287506104, "learning_rate": 1.545758771854575e-05, "loss": 0.6455, "step": 2464 }, { "epoch": 3.152332186574926, "grad_norm": 0.5704997777938843, "learning_rate": 1.5443697262041126e-05, "loss": 0.6519, "step": 2465 }, { "epoch": 3.1536122889831186, "grad_norm": 0.5672619342803955, "learning_rate": 1.5429811305635433e-05, "loss": 0.6707, "step": 2466 }, { "epoch": 3.154892391391311, "grad_norm": 0.544376790523529, "learning_rate": 1.541592985885968e-05, "loss": 0.6582, "step": 2467 }, { "epoch": 3.156172493799504, "grad_norm": 0.5694115161895752, "learning_rate": 1.54020529312418e-05, "loss": 0.6253, "step": 2468 }, { "epoch": 3.1574525962076967, "grad_norm": 0.5433099865913391, "learning_rate": 1.538818053230658e-05, "loss": 0.6587, "step": 2469 }, { "epoch": 3.1587326986158892, "grad_norm": 0.5109469890594482, "learning_rate": 1.5374312671575736e-05, "loss": 0.6336, "step": 2470 }, { "epoch": 3.1600128010240818, "grad_norm": 0.5574575066566467, "learning_rate": 1.5360449358567864e-05, "loss": 0.6303, "step": 2471 }, { "epoch": 3.1612929034322748, "grad_norm": 0.5440110564231873, "learning_rate": 1.5346590602798413e-05, "loss": 0.652, "step": 2472 }, { "epoch": 3.1625730058404673, "grad_norm": 0.5183259844779968, "learning_rate": 1.5332736413779726e-05, "loss": 0.659, "step": 2473 }, { "epoch": 3.16385310824866, "grad_norm": 0.5226305723190308, "learning_rate": 1.5318886801021018e-05, "loss": 0.6368, "step": 2474 }, { "epoch": 3.1651332106568524, "grad_norm": 0.5394190549850464, "learning_rate": 1.5305041774028345e-05, "loss": 0.6709, "step": 2475 }, { "epoch": 3.1664133130650454, "grad_norm": 0.5406842231750488, "learning_rate": 1.529120134230462e-05, "loss": 0.6476, "step": 2476 }, { "epoch": 3.167693415473238, "grad_norm": 0.5195798873901367, "learning_rate": 1.527736551534961e-05, "loss": 0.6945, "step": 2477 }, { "epoch": 3.1689735178814304, "grad_norm": 0.5152619481086731, "learning_rate": 1.526353430265991e-05, "loss": 0.6142, "step": 2478 }, { "epoch": 3.170253620289623, "grad_norm": 0.5421910285949707, "learning_rate": 1.524970771372896e-05, "loss": 0.6577, "step": 2479 }, { "epoch": 3.171533722697816, "grad_norm": 0.534690797328949, "learning_rate": 1.5235885758047011e-05, "loss": 0.6539, "step": 2480 }, { "epoch": 3.1728138251060085, "grad_norm": 0.4806743562221527, "learning_rate": 1.522206844510115e-05, "loss": 0.6135, "step": 2481 }, { "epoch": 3.174093927514201, "grad_norm": 0.5362149477005005, "learning_rate": 1.5208255784375276e-05, "loss": 0.6881, "step": 2482 }, { "epoch": 3.1753740299223936, "grad_norm": 0.5271737575531006, "learning_rate": 1.5194447785350073e-05, "loss": 0.675, "step": 2483 }, { "epoch": 3.1766541323305866, "grad_norm": 0.5258865356445312, "learning_rate": 1.5180644457503056e-05, "loss": 0.6225, "step": 2484 }, { "epoch": 3.177934234738779, "grad_norm": 0.5148061513900757, "learning_rate": 1.5166845810308518e-05, "loss": 0.6428, "step": 2485 }, { "epoch": 3.1792143371469717, "grad_norm": 0.5288801193237305, "learning_rate": 1.5153051853237526e-05, "loss": 0.6603, "step": 2486 }, { "epoch": 3.180494439555164, "grad_norm": 0.5338370203971863, "learning_rate": 1.5139262595757954e-05, "loss": 0.6308, "step": 2487 }, { "epoch": 3.181774541963357, "grad_norm": 0.5008540153503418, "learning_rate": 1.5125478047334445e-05, "loss": 0.6177, "step": 2488 }, { "epoch": 3.1830546443715497, "grad_norm": 0.5101842880249023, "learning_rate": 1.5111698217428385e-05, "loss": 0.6187, "step": 2489 }, { "epoch": 3.1843347467797423, "grad_norm": 0.5729373097419739, "learning_rate": 1.5097923115497955e-05, "loss": 0.6646, "step": 2490 }, { "epoch": 3.1843347467797423, "eval_loss": 0.011502954177558422, "eval_runtime": 10.8173, "eval_samples_per_second": 45.852, "eval_steps_per_second": 5.732, "step": 2490 }, { "epoch": 3.1856148491879352, "grad_norm": 0.5281634330749512, "learning_rate": 1.5084152750998079e-05, "loss": 0.6225, "step": 2491 }, { "epoch": 3.186894951596128, "grad_norm": 0.5156639218330383, "learning_rate": 1.5070387133380408e-05, "loss": 0.658, "step": 2492 }, { "epoch": 3.1881750540043203, "grad_norm": 0.5498717427253723, "learning_rate": 1.5056626272093358e-05, "loss": 0.6519, "step": 2493 }, { "epoch": 3.189455156412513, "grad_norm": 0.5112549066543579, "learning_rate": 1.5042870176582094e-05, "loss": 0.6372, "step": 2494 }, { "epoch": 3.190735258820706, "grad_norm": 0.4875716269016266, "learning_rate": 1.5029118856288465e-05, "loss": 0.6735, "step": 2495 }, { "epoch": 3.1920153612288984, "grad_norm": 0.5193595290184021, "learning_rate": 1.501537232065108e-05, "loss": 0.6487, "step": 2496 }, { "epoch": 3.193295463637091, "grad_norm": 0.5427823066711426, "learning_rate": 1.500163057910526e-05, "loss": 0.6656, "step": 2497 }, { "epoch": 3.1945755660452835, "grad_norm": 0.5591933131217957, "learning_rate": 1.4987893641083014e-05, "loss": 0.6421, "step": 2498 }, { "epoch": 3.1958556684534765, "grad_norm": 0.517242431640625, "learning_rate": 1.4974161516013071e-05, "loss": 0.6358, "step": 2499 }, { "epoch": 3.197135770861669, "grad_norm": 0.535478413105011, "learning_rate": 1.496043421332087e-05, "loss": 0.631, "step": 2500 }, { "epoch": 3.1984158732698615, "grad_norm": 0.5194719433784485, "learning_rate": 1.4946711742428495e-05, "loss": 0.6253, "step": 2501 }, { "epoch": 3.199695975678054, "grad_norm": 0.5094932317733765, "learning_rate": 1.4932994112754755e-05, "loss": 0.6394, "step": 2502 }, { "epoch": 3.200976078086247, "grad_norm": 0.504401683807373, "learning_rate": 1.4919281333715136e-05, "loss": 0.629, "step": 2503 }, { "epoch": 3.2022561804944396, "grad_norm": 0.5324363708496094, "learning_rate": 1.4905573414721759e-05, "loss": 0.6078, "step": 2504 }, { "epoch": 3.203536282902632, "grad_norm": 0.5347485542297363, "learning_rate": 1.4891870365183447e-05, "loss": 0.6302, "step": 2505 }, { "epoch": 3.2048163853108247, "grad_norm": 0.5270418524742126, "learning_rate": 1.4878172194505656e-05, "loss": 0.6754, "step": 2506 }, { "epoch": 3.2060964877190177, "grad_norm": 0.5032305121421814, "learning_rate": 1.4864478912090508e-05, "loss": 0.649, "step": 2507 }, { "epoch": 3.20737659012721, "grad_norm": 0.5125587582588196, "learning_rate": 1.4850790527336773e-05, "loss": 0.6588, "step": 2508 }, { "epoch": 3.2086566925354028, "grad_norm": 0.5229718685150146, "learning_rate": 1.4837107049639832e-05, "loss": 0.6512, "step": 2509 }, { "epoch": 3.2099367949435953, "grad_norm": 0.5067161321640015, "learning_rate": 1.4823428488391724e-05, "loss": 0.644, "step": 2510 }, { "epoch": 3.2112168973517883, "grad_norm": 0.5176657438278198, "learning_rate": 1.4809754852981115e-05, "loss": 0.6723, "step": 2511 }, { "epoch": 3.212496999759981, "grad_norm": 0.5523592829704285, "learning_rate": 1.4796086152793274e-05, "loss": 0.6277, "step": 2512 }, { "epoch": 3.2137771021681734, "grad_norm": 0.5369203686714172, "learning_rate": 1.4782422397210083e-05, "loss": 0.6766, "step": 2513 }, { "epoch": 3.215057204576366, "grad_norm": 0.5011036992073059, "learning_rate": 1.4768763595610059e-05, "loss": 0.6428, "step": 2514 }, { "epoch": 3.216337306984559, "grad_norm": 0.49802538752555847, "learning_rate": 1.4755109757368264e-05, "loss": 0.6285, "step": 2515 }, { "epoch": 3.2176174093927514, "grad_norm": 0.5186784267425537, "learning_rate": 1.4741460891856415e-05, "loss": 0.6369, "step": 2516 }, { "epoch": 3.218897511800944, "grad_norm": 0.5105106234550476, "learning_rate": 1.4727817008442777e-05, "loss": 0.6184, "step": 2517 }, { "epoch": 3.2201776142091365, "grad_norm": 0.5055716037750244, "learning_rate": 1.4714178116492198e-05, "loss": 0.6534, "step": 2518 }, { "epoch": 3.2214577166173295, "grad_norm": 0.4734814465045929, "learning_rate": 1.4700544225366114e-05, "loss": 0.6255, "step": 2519 }, { "epoch": 3.222737819025522, "grad_norm": 0.502964973449707, "learning_rate": 1.4686915344422522e-05, "loss": 0.6442, "step": 2520 }, { "epoch": 3.222737819025522, "eval_loss": 0.01147892139852047, "eval_runtime": 10.8149, "eval_samples_per_second": 45.863, "eval_steps_per_second": 5.733, "step": 2520 }, { "epoch": 3.2240179214337146, "grad_norm": 0.5003054738044739, "learning_rate": 1.4673291483015977e-05, "loss": 0.6418, "step": 2521 }, { "epoch": 3.2252980238419076, "grad_norm": 0.5213746428489685, "learning_rate": 1.4659672650497591e-05, "loss": 0.6658, "step": 2522 }, { "epoch": 3.2265781262501, "grad_norm": 0.4791144132614136, "learning_rate": 1.464605885621503e-05, "loss": 0.6302, "step": 2523 }, { "epoch": 3.2278582286582926, "grad_norm": 0.5048968195915222, "learning_rate": 1.463245010951249e-05, "loss": 0.6486, "step": 2524 }, { "epoch": 3.229138331066485, "grad_norm": 0.5158227682113647, "learning_rate": 1.4618846419730713e-05, "loss": 0.6538, "step": 2525 }, { "epoch": 3.230418433474678, "grad_norm": 0.4812990427017212, "learning_rate": 1.4605247796206965e-05, "loss": 0.6315, "step": 2526 }, { "epoch": 3.2316985358828707, "grad_norm": 0.50927734375, "learning_rate": 1.459165424827504e-05, "loss": 0.6979, "step": 2527 }, { "epoch": 3.2329786382910632, "grad_norm": 0.5096977353096008, "learning_rate": 1.4578065785265234e-05, "loss": 0.6565, "step": 2528 }, { "epoch": 3.234258740699256, "grad_norm": 0.5484464764595032, "learning_rate": 1.456448241650437e-05, "loss": 0.6493, "step": 2529 }, { "epoch": 3.2355388431074488, "grad_norm": 0.52590411901474, "learning_rate": 1.455090415131577e-05, "loss": 0.649, "step": 2530 }, { "epoch": 3.2368189455156413, "grad_norm": 0.53493332862854, "learning_rate": 1.4537330999019248e-05, "loss": 0.6335, "step": 2531 }, { "epoch": 3.238099047923834, "grad_norm": 0.520137369632721, "learning_rate": 1.4523762968931103e-05, "loss": 0.6315, "step": 2532 }, { "epoch": 3.2393791503320264, "grad_norm": 0.5328630208969116, "learning_rate": 1.4510200070364135e-05, "loss": 0.6767, "step": 2533 }, { "epoch": 3.2406592527402194, "grad_norm": 0.5490903854370117, "learning_rate": 1.4496642312627614e-05, "loss": 0.6824, "step": 2534 }, { "epoch": 3.241939355148412, "grad_norm": 0.5077177882194519, "learning_rate": 1.4483089705027267e-05, "loss": 0.6279, "step": 2535 }, { "epoch": 3.2432194575566045, "grad_norm": 0.5176362991333008, "learning_rate": 1.4469542256865312e-05, "loss": 0.6216, "step": 2536 }, { "epoch": 3.244499559964797, "grad_norm": 0.5356772541999817, "learning_rate": 1.4455999977440414e-05, "loss": 0.666, "step": 2537 }, { "epoch": 3.24577966237299, "grad_norm": 0.5240214467048645, "learning_rate": 1.4442462876047682e-05, "loss": 0.643, "step": 2538 }, { "epoch": 3.2470597647811825, "grad_norm": 0.5250520706176758, "learning_rate": 1.4428930961978678e-05, "loss": 0.6494, "step": 2539 }, { "epoch": 3.248339867189375, "grad_norm": 0.5164676308631897, "learning_rate": 1.4415404244521419e-05, "loss": 0.6438, "step": 2540 }, { "epoch": 3.2496199695975676, "grad_norm": 0.48520180583000183, "learning_rate": 1.4401882732960317e-05, "loss": 0.6583, "step": 2541 }, { "epoch": 3.2509000720057606, "grad_norm": 0.5541596412658691, "learning_rate": 1.4388366436576253e-05, "loss": 0.6597, "step": 2542 }, { "epoch": 3.252180174413953, "grad_norm": 0.5362801551818848, "learning_rate": 1.4374855364646503e-05, "loss": 0.6521, "step": 2543 }, { "epoch": 3.2534602768221457, "grad_norm": 0.5064684748649597, "learning_rate": 1.4361349526444754e-05, "loss": 0.6117, "step": 2544 }, { "epoch": 3.2547403792303387, "grad_norm": 0.509677529335022, "learning_rate": 1.4347848931241122e-05, "loss": 0.6209, "step": 2545 }, { "epoch": 3.256020481638531, "grad_norm": 0.5341014862060547, "learning_rate": 1.4334353588302113e-05, "loss": 0.6763, "step": 2546 }, { "epoch": 3.2573005840467237, "grad_norm": 0.5059588551521301, "learning_rate": 1.4320863506890619e-05, "loss": 0.6113, "step": 2547 }, { "epoch": 3.2585806864549163, "grad_norm": 0.5250412225723267, "learning_rate": 1.4307378696265927e-05, "loss": 0.6918, "step": 2548 }, { "epoch": 3.259860788863109, "grad_norm": 0.5155032873153687, "learning_rate": 1.4293899165683725e-05, "loss": 0.637, "step": 2549 }, { "epoch": 3.261140891271302, "grad_norm": 0.5140616297721863, "learning_rate": 1.4280424924396043e-05, "loss": 0.6472, "step": 2550 }, { "epoch": 3.261140891271302, "eval_loss": 0.011485250666737556, "eval_runtime": 10.8206, "eval_samples_per_second": 45.839, "eval_steps_per_second": 5.73, "step": 2550 }, { "epoch": 3.2624209936794943, "grad_norm": 0.5688918232917786, "learning_rate": 1.42669559816513e-05, "loss": 0.6877, "step": 2551 }, { "epoch": 3.263701096087687, "grad_norm": 0.5144367814064026, "learning_rate": 1.4253492346694287e-05, "loss": 0.5954, "step": 2552 }, { "epoch": 3.26498119849588, "grad_norm": 0.516718864440918, "learning_rate": 1.4240034028766125e-05, "loss": 0.6494, "step": 2553 }, { "epoch": 3.2662613009040724, "grad_norm": 0.48907017707824707, "learning_rate": 1.4226581037104312e-05, "loss": 0.6202, "step": 2554 }, { "epoch": 3.267541403312265, "grad_norm": 0.5194664001464844, "learning_rate": 1.4213133380942678e-05, "loss": 0.6482, "step": 2555 }, { "epoch": 3.2688215057204575, "grad_norm": 0.5060011148452759, "learning_rate": 1.4199691069511387e-05, "loss": 0.6194, "step": 2556 }, { "epoch": 3.2701016081286505, "grad_norm": 0.5188465118408203, "learning_rate": 1.4186254112036944e-05, "loss": 0.6615, "step": 2557 }, { "epoch": 3.271381710536843, "grad_norm": 0.5025769472122192, "learning_rate": 1.4172822517742178e-05, "loss": 0.6684, "step": 2558 }, { "epoch": 3.2726618129450356, "grad_norm": 0.5170837044715881, "learning_rate": 1.4159396295846222e-05, "loss": 0.6904, "step": 2559 }, { "epoch": 3.273941915353228, "grad_norm": 0.45241689682006836, "learning_rate": 1.4145975455564544e-05, "loss": 0.6405, "step": 2560 }, { "epoch": 3.275222017761421, "grad_norm": 0.503831684589386, "learning_rate": 1.4132560006108911e-05, "loss": 0.6379, "step": 2561 }, { "epoch": 3.2765021201696136, "grad_norm": 0.5172925591468811, "learning_rate": 1.4119149956687369e-05, "loss": 0.5998, "step": 2562 }, { "epoch": 3.277782222577806, "grad_norm": 0.5172489285469055, "learning_rate": 1.4105745316504282e-05, "loss": 0.6599, "step": 2563 }, { "epoch": 3.2790623249859987, "grad_norm": 0.5125643014907837, "learning_rate": 1.4092346094760308e-05, "loss": 0.6366, "step": 2564 }, { "epoch": 3.2803424273941917, "grad_norm": 0.5013106465339661, "learning_rate": 1.4078952300652353e-05, "loss": 0.6429, "step": 2565 }, { "epoch": 3.2816225298023842, "grad_norm": 0.5247995257377625, "learning_rate": 1.4065563943373626e-05, "loss": 0.6329, "step": 2566 }, { "epoch": 3.2829026322105768, "grad_norm": 0.5207878947257996, "learning_rate": 1.4052181032113596e-05, "loss": 0.6384, "step": 2567 }, { "epoch": 3.2841827346187698, "grad_norm": 0.5144835710525513, "learning_rate": 1.4038803576057985e-05, "loss": 0.6779, "step": 2568 }, { "epoch": 3.2854628370269623, "grad_norm": 0.48141875863075256, "learning_rate": 1.4025431584388779e-05, "loss": 0.6067, "step": 2569 }, { "epoch": 3.286742939435155, "grad_norm": 0.4974786639213562, "learning_rate": 1.4012065066284218e-05, "loss": 0.6101, "step": 2570 }, { "epoch": 3.2880230418433474, "grad_norm": 0.4903869330883026, "learning_rate": 1.3998704030918784e-05, "loss": 0.6572, "step": 2571 }, { "epoch": 3.28930314425154, "grad_norm": 0.5125056505203247, "learning_rate": 1.3985348487463181e-05, "loss": 0.6627, "step": 2572 }, { "epoch": 3.290583246659733, "grad_norm": 0.5043832659721375, "learning_rate": 1.397199844508436e-05, "loss": 0.6403, "step": 2573 }, { "epoch": 3.2918633490679254, "grad_norm": 0.5195678472518921, "learning_rate": 1.3958653912945494e-05, "loss": 0.6521, "step": 2574 }, { "epoch": 3.293143451476118, "grad_norm": 0.48719099164009094, "learning_rate": 1.3945314900205959e-05, "loss": 0.6282, "step": 2575 }, { "epoch": 3.294423553884311, "grad_norm": 0.5019971132278442, "learning_rate": 1.3931981416021361e-05, "loss": 0.6179, "step": 2576 }, { "epoch": 3.2957036562925035, "grad_norm": 0.5336318612098694, "learning_rate": 1.3918653469543508e-05, "loss": 0.6344, "step": 2577 }, { "epoch": 3.296983758700696, "grad_norm": 0.512867271900177, "learning_rate": 1.3905331069920393e-05, "loss": 0.6314, "step": 2578 }, { "epoch": 3.2982638611088886, "grad_norm": 0.5135596394538879, "learning_rate": 1.3892014226296219e-05, "loss": 0.6474, "step": 2579 }, { "epoch": 3.299543963517081, "grad_norm": 0.5097352862358093, "learning_rate": 1.3878702947811369e-05, "loss": 0.6458, "step": 2580 }, { "epoch": 3.299543963517081, "eval_loss": 0.011472688056528568, "eval_runtime": 10.8197, "eval_samples_per_second": 45.842, "eval_steps_per_second": 5.73, "step": 2580 }, { "epoch": 3.300824065925274, "grad_norm": 0.5281054377555847, "learning_rate": 1.38653972436024e-05, "loss": 0.6547, "step": 2581 }, { "epoch": 3.3021041683334666, "grad_norm": 0.5279375910758972, "learning_rate": 1.3852097122802048e-05, "loss": 0.6368, "step": 2582 }, { "epoch": 3.303384270741659, "grad_norm": 0.4660930931568146, "learning_rate": 1.3838802594539228e-05, "loss": 0.5961, "step": 2583 }, { "epoch": 3.304664373149852, "grad_norm": 0.565133810043335, "learning_rate": 1.3825513667938995e-05, "loss": 0.6666, "step": 2584 }, { "epoch": 3.3059444755580447, "grad_norm": 0.5189217925071716, "learning_rate": 1.3812230352122567e-05, "loss": 0.6162, "step": 2585 }, { "epoch": 3.3072245779662373, "grad_norm": 0.5098384022712708, "learning_rate": 1.3798952656207329e-05, "loss": 0.6198, "step": 2586 }, { "epoch": 3.30850468037443, "grad_norm": 0.5222168564796448, "learning_rate": 1.378568058930678e-05, "loss": 0.6415, "step": 2587 }, { "epoch": 3.309784782782623, "grad_norm": 0.5284304022789001, "learning_rate": 1.3772414160530569e-05, "loss": 0.6771, "step": 2588 }, { "epoch": 3.3110648851908153, "grad_norm": 0.5394641160964966, "learning_rate": 1.3759153378984487e-05, "loss": 0.673, "step": 2589 }, { "epoch": 3.312344987599008, "grad_norm": 0.5227346420288086, "learning_rate": 1.3745898253770418e-05, "loss": 0.6511, "step": 2590 }, { "epoch": 3.3136250900072004, "grad_norm": 0.5089024901390076, "learning_rate": 1.3732648793986397e-05, "loss": 0.6723, "step": 2591 }, { "epoch": 3.3149051924153934, "grad_norm": 0.4928726553916931, "learning_rate": 1.3719405008726553e-05, "loss": 0.616, "step": 2592 }, { "epoch": 3.316185294823586, "grad_norm": 0.55116206407547, "learning_rate": 1.3706166907081113e-05, "loss": 0.6562, "step": 2593 }, { "epoch": 3.3174653972317785, "grad_norm": 0.5938664078712463, "learning_rate": 1.3692934498136422e-05, "loss": 0.6519, "step": 2594 }, { "epoch": 3.318745499639971, "grad_norm": 0.538509726524353, "learning_rate": 1.3679707790974917e-05, "loss": 0.6417, "step": 2595 }, { "epoch": 3.320025602048164, "grad_norm": 0.5012615919113159, "learning_rate": 1.3666486794675092e-05, "loss": 0.659, "step": 2596 }, { "epoch": 3.3213057044563565, "grad_norm": 0.5400484204292297, "learning_rate": 1.365327151831155e-05, "loss": 0.6484, "step": 2597 }, { "epoch": 3.322585806864549, "grad_norm": 0.604289174079895, "learning_rate": 1.364006197095497e-05, "loss": 0.6116, "step": 2598 }, { "epoch": 3.323865909272742, "grad_norm": 0.5269507169723511, "learning_rate": 1.3626858161672074e-05, "loss": 0.6393, "step": 2599 }, { "epoch": 3.3251460116809346, "grad_norm": 0.525745153427124, "learning_rate": 1.3613660099525665e-05, "loss": 0.632, "step": 2600 }, { "epoch": 3.326426114089127, "grad_norm": 0.5607315897941589, "learning_rate": 1.3600467793574605e-05, "loss": 0.6375, "step": 2601 }, { "epoch": 3.3277062164973197, "grad_norm": 0.5357958078384399, "learning_rate": 1.3587281252873781e-05, "loss": 0.6474, "step": 2602 }, { "epoch": 3.328986318905512, "grad_norm": 0.5517680644989014, "learning_rate": 1.3574100486474152e-05, "loss": 0.6332, "step": 2603 }, { "epoch": 3.330266421313705, "grad_norm": 0.5497151613235474, "learning_rate": 1.3560925503422696e-05, "loss": 0.6697, "step": 2604 }, { "epoch": 3.3315465237218977, "grad_norm": 0.5158340334892273, "learning_rate": 1.3547756312762422e-05, "loss": 0.6599, "step": 2605 }, { "epoch": 3.3328266261300903, "grad_norm": 0.5367072820663452, "learning_rate": 1.3534592923532364e-05, "loss": 0.6555, "step": 2606 }, { "epoch": 3.3341067285382833, "grad_norm": 0.5325165390968323, "learning_rate": 1.352143534476759e-05, "loss": 0.6397, "step": 2607 }, { "epoch": 3.335386830946476, "grad_norm": 0.5078912973403931, "learning_rate": 1.350828358549915e-05, "loss": 0.6309, "step": 2608 }, { "epoch": 3.3366669333546684, "grad_norm": 0.5415282845497131, "learning_rate": 1.3495137654754137e-05, "loss": 0.6722, "step": 2609 }, { "epoch": 3.337947035762861, "grad_norm": 0.5061556696891785, "learning_rate": 1.34819975615556e-05, "loss": 0.6203, "step": 2610 }, { "epoch": 3.337947035762861, "eval_loss": 0.011465904302895069, "eval_runtime": 10.8358, "eval_samples_per_second": 45.774, "eval_steps_per_second": 5.722, "step": 2610 }, { "epoch": 3.339227138171054, "grad_norm": 0.49840816855430603, "learning_rate": 1.3468863314922614e-05, "loss": 0.6177, "step": 2611 }, { "epoch": 3.3405072405792464, "grad_norm": 0.5172483325004578, "learning_rate": 1.3455734923870232e-05, "loss": 0.6419, "step": 2612 }, { "epoch": 3.341787342987439, "grad_norm": 0.5256161093711853, "learning_rate": 1.3442612397409482e-05, "loss": 0.6568, "step": 2613 }, { "epoch": 3.3430674453956315, "grad_norm": 0.5415335297584534, "learning_rate": 1.3429495744547377e-05, "loss": 0.6708, "step": 2614 }, { "epoch": 3.3443475478038245, "grad_norm": 0.5305517315864563, "learning_rate": 1.3416384974286895e-05, "loss": 0.6868, "step": 2615 }, { "epoch": 3.345627650212017, "grad_norm": 0.5212390422821045, "learning_rate": 1.3403280095626965e-05, "loss": 0.6799, "step": 2616 }, { "epoch": 3.3469077526202096, "grad_norm": 0.5267554521560669, "learning_rate": 1.3390181117562483e-05, "loss": 0.6157, "step": 2617 }, { "epoch": 3.348187855028402, "grad_norm": 0.5484142899513245, "learning_rate": 1.3377088049084307e-05, "loss": 0.654, "step": 2618 }, { "epoch": 3.349467957436595, "grad_norm": 0.5149903297424316, "learning_rate": 1.3364000899179205e-05, "loss": 0.6387, "step": 2619 }, { "epoch": 3.3507480598447876, "grad_norm": 0.5208218693733215, "learning_rate": 1.3350919676829915e-05, "loss": 0.653, "step": 2620 }, { "epoch": 3.35202816225298, "grad_norm": 0.5140671730041504, "learning_rate": 1.3337844391015096e-05, "loss": 0.6861, "step": 2621 }, { "epoch": 3.3533082646611727, "grad_norm": 0.5186113119125366, "learning_rate": 1.3324775050709321e-05, "loss": 0.6382, "step": 2622 }, { "epoch": 3.3545883670693657, "grad_norm": 0.523269534111023, "learning_rate": 1.3311711664883098e-05, "loss": 0.6498, "step": 2623 }, { "epoch": 3.3558684694775582, "grad_norm": 0.5470902919769287, "learning_rate": 1.3298654242502844e-05, "loss": 0.651, "step": 2624 }, { "epoch": 3.3571485718857508, "grad_norm": 0.5154792070388794, "learning_rate": 1.3285602792530869e-05, "loss": 0.6426, "step": 2625 }, { "epoch": 3.3584286742939433, "grad_norm": 0.5300922393798828, "learning_rate": 1.3272557323925406e-05, "loss": 0.6408, "step": 2626 }, { "epoch": 3.3597087767021363, "grad_norm": 0.5152605772018433, "learning_rate": 1.3259517845640576e-05, "loss": 0.6036, "step": 2627 }, { "epoch": 3.360988879110329, "grad_norm": 0.525360643863678, "learning_rate": 1.3246484366626367e-05, "loss": 0.6391, "step": 2628 }, { "epoch": 3.3622689815185214, "grad_norm": 0.503139317035675, "learning_rate": 1.3233456895828677e-05, "loss": 0.6347, "step": 2629 }, { "epoch": 3.3635490839267144, "grad_norm": 0.5070618391036987, "learning_rate": 1.3220435442189275e-05, "loss": 0.6235, "step": 2630 }, { "epoch": 3.364829186334907, "grad_norm": 0.5270324945449829, "learning_rate": 1.320742001464578e-05, "loss": 0.6244, "step": 2631 }, { "epoch": 3.3661092887430994, "grad_norm": 0.5384184718132019, "learning_rate": 1.3194410622131698e-05, "loss": 0.6447, "step": 2632 }, { "epoch": 3.367389391151292, "grad_norm": 0.548175036907196, "learning_rate": 1.3181407273576388e-05, "loss": 0.6591, "step": 2633 }, { "epoch": 3.3686694935594845, "grad_norm": 0.5638697147369385, "learning_rate": 1.3168409977905044e-05, "loss": 0.6661, "step": 2634 }, { "epoch": 3.3699495959676775, "grad_norm": 0.5330691933631897, "learning_rate": 1.315541874403873e-05, "loss": 0.6423, "step": 2635 }, { "epoch": 3.37122969837587, "grad_norm": 0.5639760494232178, "learning_rate": 1.3142433580894328e-05, "loss": 0.674, "step": 2636 }, { "epoch": 3.3725098007840626, "grad_norm": 0.5288316607475281, "learning_rate": 1.3129454497384565e-05, "loss": 0.6564, "step": 2637 }, { "epoch": 3.3737899031922556, "grad_norm": 0.49552685022354126, "learning_rate": 1.3116481502418e-05, "loss": 0.6562, "step": 2638 }, { "epoch": 3.375070005600448, "grad_norm": 0.5514019727706909, "learning_rate": 1.310351460489899e-05, "loss": 0.6928, "step": 2639 }, { "epoch": 3.3763501080086407, "grad_norm": 0.5216597318649292, "learning_rate": 1.3090553813727733e-05, "loss": 0.6511, "step": 2640 }, { "epoch": 3.3763501080086407, "eval_loss": 0.01146740186959505, "eval_runtime": 10.816, "eval_samples_per_second": 45.858, "eval_steps_per_second": 5.732, "step": 2640 }, { "epoch": 3.377630210416833, "grad_norm": 0.5338744521141052, "learning_rate": 1.3077599137800232e-05, "loss": 0.6437, "step": 2641 }, { "epoch": 3.378910312825026, "grad_norm": 0.5240645408630371, "learning_rate": 1.3064650586008268e-05, "loss": 0.6593, "step": 2642 }, { "epoch": 3.3801904152332187, "grad_norm": 0.5555424094200134, "learning_rate": 1.3051708167239441e-05, "loss": 0.6483, "step": 2643 }, { "epoch": 3.3814705176414113, "grad_norm": 0.5192124247550964, "learning_rate": 1.3038771890377151e-05, "loss": 0.6597, "step": 2644 }, { "epoch": 3.382750620049604, "grad_norm": 0.5266752243041992, "learning_rate": 1.3025841764300548e-05, "loss": 0.6681, "step": 2645 }, { "epoch": 3.384030722457797, "grad_norm": 0.5485540628433228, "learning_rate": 1.3012917797884593e-05, "loss": 0.6594, "step": 2646 }, { "epoch": 3.3853108248659893, "grad_norm": 0.5444266200065613, "learning_rate": 1.3000000000000006e-05, "loss": 0.6864, "step": 2647 }, { "epoch": 3.386590927274182, "grad_norm": 0.4996925890445709, "learning_rate": 1.2987088379513261e-05, "loss": 0.6583, "step": 2648 }, { "epoch": 3.3878710296823744, "grad_norm": 0.49421724677085876, "learning_rate": 1.2974182945286615e-05, "loss": 0.6437, "step": 2649 }, { "epoch": 3.3891511320905674, "grad_norm": 0.5644569396972656, "learning_rate": 1.2961283706178076e-05, "loss": 0.6565, "step": 2650 }, { "epoch": 3.39043123449876, "grad_norm": 0.5538458824157715, "learning_rate": 1.2948390671041373e-05, "loss": 0.6698, "step": 2651 }, { "epoch": 3.3917113369069525, "grad_norm": 0.5349107384681702, "learning_rate": 1.2935503848726003e-05, "loss": 0.6256, "step": 2652 }, { "epoch": 3.392991439315145, "grad_norm": 0.5281985402107239, "learning_rate": 1.2922623248077204e-05, "loss": 0.6339, "step": 2653 }, { "epoch": 3.394271541723338, "grad_norm": 0.5274403095245361, "learning_rate": 1.2909748877935913e-05, "loss": 0.6299, "step": 2654 }, { "epoch": 3.3955516441315305, "grad_norm": 0.5260682106018066, "learning_rate": 1.2896880747138813e-05, "loss": 0.6728, "step": 2655 }, { "epoch": 3.396831746539723, "grad_norm": 0.591275155544281, "learning_rate": 1.2884018864518313e-05, "loss": 0.6733, "step": 2656 }, { "epoch": 3.3981118489479156, "grad_norm": 0.603613555431366, "learning_rate": 1.28711632389025e-05, "loss": 0.6924, "step": 2657 }, { "epoch": 3.3993919513561086, "grad_norm": 0.5234869122505188, "learning_rate": 1.2858313879115198e-05, "loss": 0.6393, "step": 2658 }, { "epoch": 3.400672053764301, "grad_norm": 0.5910223126411438, "learning_rate": 1.2845470793975925e-05, "loss": 0.6349, "step": 2659 }, { "epoch": 3.4019521561724937, "grad_norm": 0.6169006824493408, "learning_rate": 1.2832633992299872e-05, "loss": 0.6649, "step": 2660 }, { "epoch": 3.4032322585806867, "grad_norm": 0.528428316116333, "learning_rate": 1.2819803482897944e-05, "loss": 0.676, "step": 2661 }, { "epoch": 3.404512360988879, "grad_norm": 0.5155686736106873, "learning_rate": 1.2806979274576703e-05, "loss": 0.6176, "step": 2662 }, { "epoch": 3.4057924633970718, "grad_norm": 0.6005485653877258, "learning_rate": 1.2794161376138403e-05, "loss": 0.6673, "step": 2663 }, { "epoch": 3.4070725658052643, "grad_norm": 0.5823571085929871, "learning_rate": 1.2781349796380968e-05, "loss": 0.66, "step": 2664 }, { "epoch": 3.408352668213457, "grad_norm": 0.5107295513153076, "learning_rate": 1.2768544544097967e-05, "loss": 0.6478, "step": 2665 }, { "epoch": 3.40963277062165, "grad_norm": 0.5336031913757324, "learning_rate": 1.2755745628078642e-05, "loss": 0.649, "step": 2666 }, { "epoch": 3.4109128730298424, "grad_norm": 0.5728003978729248, "learning_rate": 1.2742953057107888e-05, "loss": 0.6503, "step": 2667 }, { "epoch": 3.412192975438035, "grad_norm": 0.5376524925231934, "learning_rate": 1.2730166839966227e-05, "loss": 0.6417, "step": 2668 }, { "epoch": 3.413473077846228, "grad_norm": 0.4836972951889038, "learning_rate": 1.271738698542984e-05, "loss": 0.6223, "step": 2669 }, { "epoch": 3.4147531802544204, "grad_norm": 0.5275030732154846, "learning_rate": 1.2704613502270533e-05, "loss": 0.6453, "step": 2670 }, { "epoch": 3.4147531802544204, "eval_loss": 0.011455184780061245, "eval_runtime": 10.8108, "eval_samples_per_second": 45.88, "eval_steps_per_second": 5.735, "step": 2670 }, { "epoch": 3.416033282662613, "grad_norm": 0.53963702917099, "learning_rate": 1.2691846399255727e-05, "loss": 0.6553, "step": 2671 }, { "epoch": 3.4173133850708055, "grad_norm": 0.4867890179157257, "learning_rate": 1.2679085685148484e-05, "loss": 0.5999, "step": 2672 }, { "epoch": 3.4185934874789985, "grad_norm": 0.5570497512817383, "learning_rate": 1.2666331368707475e-05, "loss": 0.6594, "step": 2673 }, { "epoch": 3.419873589887191, "grad_norm": 0.5171359777450562, "learning_rate": 1.2653583458686964e-05, "loss": 0.6529, "step": 2674 }, { "epoch": 3.4211536922953836, "grad_norm": 0.5122377872467041, "learning_rate": 1.2640841963836836e-05, "loss": 0.6122, "step": 2675 }, { "epoch": 3.422433794703576, "grad_norm": 0.5108626484870911, "learning_rate": 1.2628106892902575e-05, "loss": 0.6291, "step": 2676 }, { "epoch": 3.423713897111769, "grad_norm": 0.49061429500579834, "learning_rate": 1.2615378254625235e-05, "loss": 0.6277, "step": 2677 }, { "epoch": 3.4249939995199616, "grad_norm": 0.5067298412322998, "learning_rate": 1.2602656057741469e-05, "loss": 0.6387, "step": 2678 }, { "epoch": 3.426274101928154, "grad_norm": 0.5020197033882141, "learning_rate": 1.2589940310983519e-05, "loss": 0.6141, "step": 2679 }, { "epoch": 3.4275542043363467, "grad_norm": 0.5395712852478027, "learning_rate": 1.2577231023079176e-05, "loss": 0.6547, "step": 2680 }, { "epoch": 3.4288343067445397, "grad_norm": 0.5163862109184265, "learning_rate": 1.2564528202751811e-05, "loss": 0.6267, "step": 2681 }, { "epoch": 3.4301144091527322, "grad_norm": 0.5071302652359009, "learning_rate": 1.2551831858720368e-05, "loss": 0.6522, "step": 2682 }, { "epoch": 3.431394511560925, "grad_norm": 0.5683829188346863, "learning_rate": 1.253914199969931e-05, "loss": 0.665, "step": 2683 }, { "epoch": 3.4326746139691178, "grad_norm": 0.5407935976982117, "learning_rate": 1.2526458634398683e-05, "loss": 0.646, "step": 2684 }, { "epoch": 3.4339547163773103, "grad_norm": 0.4977572560310364, "learning_rate": 1.2513781771524073e-05, "loss": 0.6393, "step": 2685 }, { "epoch": 3.435234818785503, "grad_norm": 0.5278409719467163, "learning_rate": 1.2501111419776579e-05, "loss": 0.6315, "step": 2686 }, { "epoch": 3.4365149211936954, "grad_norm": 0.5229158401489258, "learning_rate": 1.2488447587852859e-05, "loss": 0.663, "step": 2687 }, { "epoch": 3.437795023601888, "grad_norm": 0.508394181728363, "learning_rate": 1.2475790284445064e-05, "loss": 0.6556, "step": 2688 }, { "epoch": 3.439075126010081, "grad_norm": 0.509078860282898, "learning_rate": 1.2463139518240896e-05, "loss": 0.6802, "step": 2689 }, { "epoch": 3.4403552284182735, "grad_norm": 0.49052590131759644, "learning_rate": 1.2450495297923566e-05, "loss": 0.6257, "step": 2690 }, { "epoch": 3.441635330826466, "grad_norm": 0.5256490111351013, "learning_rate": 1.2437857632171762e-05, "loss": 0.6561, "step": 2691 }, { "epoch": 3.442915433234659, "grad_norm": 0.49466726183891296, "learning_rate": 1.2425226529659702e-05, "loss": 0.638, "step": 2692 }, { "epoch": 3.4441955356428515, "grad_norm": 0.512749433517456, "learning_rate": 1.2412601999057099e-05, "loss": 0.6479, "step": 2693 }, { "epoch": 3.445475638051044, "grad_norm": 0.5261350274085999, "learning_rate": 1.239998404902914e-05, "loss": 0.6593, "step": 2694 }, { "epoch": 3.4467557404592366, "grad_norm": 0.5123868584632874, "learning_rate": 1.2387372688236499e-05, "loss": 0.632, "step": 2695 }, { "epoch": 3.448035842867429, "grad_norm": 0.5266541838645935, "learning_rate": 1.2374767925335343e-05, "loss": 0.6584, "step": 2696 }, { "epoch": 3.449315945275622, "grad_norm": 0.5414618253707886, "learning_rate": 1.2362169768977284e-05, "loss": 0.6433, "step": 2697 }, { "epoch": 3.4505960476838147, "grad_norm": 0.5119932293891907, "learning_rate": 1.2349578227809417e-05, "loss": 0.6532, "step": 2698 }, { "epoch": 3.451876150092007, "grad_norm": 0.49727195501327515, "learning_rate": 1.2336993310474306e-05, "loss": 0.6137, "step": 2699 }, { "epoch": 3.4531562525002, "grad_norm": 0.48369887471199036, "learning_rate": 1.2324415025609939e-05, "loss": 0.5994, "step": 2700 }, { "epoch": 3.4531562525002, "eval_loss": 0.011453227140009403, "eval_runtime": 10.84, "eval_samples_per_second": 45.757, "eval_steps_per_second": 5.72, "step": 2700 }, { "epoch": 3.4544363549083927, "grad_norm": 0.5059986114501953, "learning_rate": 1.2311843381849773e-05, "loss": 0.6355, "step": 2701 }, { "epoch": 3.4557164573165853, "grad_norm": 0.5174420475959778, "learning_rate": 1.2299278387822713e-05, "loss": 0.6414, "step": 2702 }, { "epoch": 3.456996559724778, "grad_norm": 0.5212859511375427, "learning_rate": 1.2286720052153069e-05, "loss": 0.6569, "step": 2703 }, { "epoch": 3.458276662132971, "grad_norm": 0.5277246832847595, "learning_rate": 1.2274168383460613e-05, "loss": 0.678, "step": 2704 }, { "epoch": 3.4595567645411633, "grad_norm": 0.5248231887817383, "learning_rate": 1.2261623390360535e-05, "loss": 0.6425, "step": 2705 }, { "epoch": 3.460836866949356, "grad_norm": 0.5126795768737793, "learning_rate": 1.224908508146342e-05, "loss": 0.6548, "step": 2706 }, { "epoch": 3.4621169693575484, "grad_norm": 0.48268821835517883, "learning_rate": 1.2236553465375289e-05, "loss": 0.6461, "step": 2707 }, { "epoch": 3.4633970717657414, "grad_norm": 0.5046666860580444, "learning_rate": 1.2224028550697571e-05, "loss": 0.6482, "step": 2708 }, { "epoch": 3.464677174173934, "grad_norm": 0.5129714012145996, "learning_rate": 1.2211510346027066e-05, "loss": 0.6383, "step": 2709 }, { "epoch": 3.4659572765821265, "grad_norm": 0.5030511021614075, "learning_rate": 1.2198998859956004e-05, "loss": 0.6613, "step": 2710 }, { "epoch": 3.467237378990319, "grad_norm": 0.5071579217910767, "learning_rate": 1.218649410107199e-05, "loss": 0.6331, "step": 2711 }, { "epoch": 3.468517481398512, "grad_norm": 0.460328072309494, "learning_rate": 1.2173996077957997e-05, "loss": 0.6461, "step": 2712 }, { "epoch": 3.4697975838067046, "grad_norm": 0.5210601687431335, "learning_rate": 1.2161504799192394e-05, "loss": 0.6331, "step": 2713 }, { "epoch": 3.471077686214897, "grad_norm": 0.5281786322593689, "learning_rate": 1.214902027334892e-05, "loss": 0.6774, "step": 2714 }, { "epoch": 3.47235778862309, "grad_norm": 0.5002842545509338, "learning_rate": 1.2136542508996658e-05, "loss": 0.6504, "step": 2715 }, { "epoch": 3.4736378910312826, "grad_norm": 0.5501790642738342, "learning_rate": 1.2124071514700079e-05, "loss": 0.6822, "step": 2716 }, { "epoch": 3.474917993439475, "grad_norm": 0.4851137101650238, "learning_rate": 1.2111607299018995e-05, "loss": 0.626, "step": 2717 }, { "epoch": 3.4761980958476677, "grad_norm": 0.4627394676208496, "learning_rate": 1.2099149870508548e-05, "loss": 0.6263, "step": 2718 }, { "epoch": 3.4774781982558602, "grad_norm": 0.5304125547409058, "learning_rate": 1.2086699237719249e-05, "loss": 0.6281, "step": 2719 }, { "epoch": 3.4787583006640532, "grad_norm": 0.5508079528808594, "learning_rate": 1.2074255409196937e-05, "loss": 0.6424, "step": 2720 }, { "epoch": 3.4800384030722458, "grad_norm": 0.4871533513069153, "learning_rate": 1.2061818393482763e-05, "loss": 0.6421, "step": 2721 }, { "epoch": 3.4813185054804383, "grad_norm": 0.5122039318084717, "learning_rate": 1.2049388199113218e-05, "loss": 0.6372, "step": 2722 }, { "epoch": 3.4825986078886313, "grad_norm": 0.5093011260032654, "learning_rate": 1.2036964834620123e-05, "loss": 0.643, "step": 2723 }, { "epoch": 3.483878710296824, "grad_norm": 0.49953410029411316, "learning_rate": 1.2024548308530576e-05, "loss": 0.658, "step": 2724 }, { "epoch": 3.4851588127050164, "grad_norm": 0.5171728134155273, "learning_rate": 1.2012138629367013e-05, "loss": 0.6037, "step": 2725 }, { "epoch": 3.486438915113209, "grad_norm": 0.4938555657863617, "learning_rate": 1.1999735805647165e-05, "loss": 0.6135, "step": 2726 }, { "epoch": 3.487719017521402, "grad_norm": 0.5075860023498535, "learning_rate": 1.1987339845884036e-05, "loss": 0.6341, "step": 2727 }, { "epoch": 3.4889991199295944, "grad_norm": 0.5005190372467041, "learning_rate": 1.1974950758585941e-05, "loss": 0.6515, "step": 2728 }, { "epoch": 3.490279222337787, "grad_norm": 0.5378018617630005, "learning_rate": 1.1962568552256476e-05, "loss": 0.6805, "step": 2729 }, { "epoch": 3.4915593247459795, "grad_norm": 0.5122777223587036, "learning_rate": 1.1950193235394507e-05, "loss": 0.6556, "step": 2730 }, { "epoch": 3.4915593247459795, "eval_loss": 0.011446916498243809, "eval_runtime": 10.8125, "eval_samples_per_second": 45.873, "eval_steps_per_second": 5.734, "step": 2730 }, { "epoch": 3.4928394271541725, "grad_norm": 0.4979049563407898, "learning_rate": 1.193782481649417e-05, "loss": 0.6541, "step": 2731 }, { "epoch": 3.494119529562365, "grad_norm": 0.521952748298645, "learning_rate": 1.192546330404487e-05, "loss": 0.6411, "step": 2732 }, { "epoch": 3.4953996319705576, "grad_norm": 0.5584136843681335, "learning_rate": 1.1913108706531284e-05, "loss": 0.6401, "step": 2733 }, { "epoch": 3.49667973437875, "grad_norm": 0.543571412563324, "learning_rate": 1.1900761032433308e-05, "loss": 0.6724, "step": 2734 }, { "epoch": 3.497959836786943, "grad_norm": 0.5464795231819153, "learning_rate": 1.1888420290226127e-05, "loss": 0.6272, "step": 2735 }, { "epoch": 3.4992399391951357, "grad_norm": 0.47890669107437134, "learning_rate": 1.187608648838014e-05, "loss": 0.6469, "step": 2736 }, { "epoch": 3.500520041603328, "grad_norm": 0.5000232458114624, "learning_rate": 1.1863759635360994e-05, "loss": 0.6453, "step": 2737 }, { "epoch": 3.501800144011521, "grad_norm": 0.5134245753288269, "learning_rate": 1.185143973962956e-05, "loss": 0.6464, "step": 2738 }, { "epoch": 3.5030802464197137, "grad_norm": 0.5332192778587341, "learning_rate": 1.1839126809641953e-05, "loss": 0.6527, "step": 2739 }, { "epoch": 3.5043603488279063, "grad_norm": 0.4757227599620819, "learning_rate": 1.1826820853849465e-05, "loss": 0.6408, "step": 2740 }, { "epoch": 3.505640451236099, "grad_norm": 0.46543270349502563, "learning_rate": 1.1814521880698649e-05, "loss": 0.6258, "step": 2741 }, { "epoch": 3.5069205536442913, "grad_norm": 0.5437485575675964, "learning_rate": 1.1802229898631246e-05, "loss": 0.6337, "step": 2742 }, { "epoch": 3.5082006560524843, "grad_norm": 0.5336166620254517, "learning_rate": 1.1789944916084177e-05, "loss": 0.6424, "step": 2743 }, { "epoch": 3.509480758460677, "grad_norm": 0.48311272263526917, "learning_rate": 1.1777666941489594e-05, "loss": 0.6377, "step": 2744 }, { "epoch": 3.5107608608688694, "grad_norm": 0.5338751673698425, "learning_rate": 1.176539598327482e-05, "loss": 0.6573, "step": 2745 }, { "epoch": 3.5120409632770624, "grad_norm": 0.5336971282958984, "learning_rate": 1.1753132049862362e-05, "loss": 0.6708, "step": 2746 }, { "epoch": 3.513321065685255, "grad_norm": 0.4926799535751343, "learning_rate": 1.1740875149669907e-05, "loss": 0.6375, "step": 2747 }, { "epoch": 3.5146011680934475, "grad_norm": 0.5325849056243896, "learning_rate": 1.1728625291110323e-05, "loss": 0.6544, "step": 2748 }, { "epoch": 3.51588127050164, "grad_norm": 0.4882565438747406, "learning_rate": 1.1716382482591629e-05, "loss": 0.6412, "step": 2749 }, { "epoch": 3.5171613729098326, "grad_norm": 0.5467479825019836, "learning_rate": 1.170414673251702e-05, "loss": 0.6751, "step": 2750 }, { "epoch": 3.5184414753180255, "grad_norm": 0.526167631149292, "learning_rate": 1.169191804928484e-05, "loss": 0.6613, "step": 2751 }, { "epoch": 3.519721577726218, "grad_norm": 0.5064482092857361, "learning_rate": 1.1679696441288582e-05, "loss": 0.6645, "step": 2752 }, { "epoch": 3.5210016801344106, "grad_norm": 0.47246575355529785, "learning_rate": 1.1667481916916876e-05, "loss": 0.5996, "step": 2753 }, { "epoch": 3.5222817825426036, "grad_norm": 0.5616881251335144, "learning_rate": 1.165527448455351e-05, "loss": 0.6659, "step": 2754 }, { "epoch": 3.523561884950796, "grad_norm": 0.509503185749054, "learning_rate": 1.1643074152577382e-05, "loss": 0.6317, "step": 2755 }, { "epoch": 3.5248419873589887, "grad_norm": 0.4886564314365387, "learning_rate": 1.1630880929362526e-05, "loss": 0.6265, "step": 2756 }, { "epoch": 3.5261220897671812, "grad_norm": 0.5238721370697021, "learning_rate": 1.1618694823278104e-05, "loss": 0.6558, "step": 2757 }, { "epoch": 3.5274021921753738, "grad_norm": 0.5514553189277649, "learning_rate": 1.1606515842688379e-05, "loss": 0.654, "step": 2758 }, { "epoch": 3.5286822945835667, "grad_norm": 0.5037204027175903, "learning_rate": 1.1594343995952728e-05, "loss": 0.6883, "step": 2759 }, { "epoch": 3.5299623969917593, "grad_norm": 0.5038042664527893, "learning_rate": 1.1582179291425644e-05, "loss": 0.6657, "step": 2760 }, { "epoch": 3.5299623969917593, "eval_loss": 0.011440154165029526, "eval_runtime": 10.8133, "eval_samples_per_second": 45.869, "eval_steps_per_second": 5.734, "step": 2760 }, { "epoch": 3.5312424993999523, "grad_norm": 0.5204631686210632, "learning_rate": 1.157002173745669e-05, "loss": 0.6247, "step": 2761 }, { "epoch": 3.532522601808145, "grad_norm": 0.5278136730194092, "learning_rate": 1.1557871342390547e-05, "loss": 0.6395, "step": 2762 }, { "epoch": 3.5338027042163374, "grad_norm": 0.4869731068611145, "learning_rate": 1.1545728114566985e-05, "loss": 0.6196, "step": 2763 }, { "epoch": 3.53508280662453, "grad_norm": 0.49234598875045776, "learning_rate": 1.1533592062320822e-05, "loss": 0.6644, "step": 2764 }, { "epoch": 3.5363629090327224, "grad_norm": 0.5424562692642212, "learning_rate": 1.1521463193981983e-05, "loss": 0.6567, "step": 2765 }, { "epoch": 3.5376430114409154, "grad_norm": 0.5251913070678711, "learning_rate": 1.1509341517875452e-05, "loss": 0.6352, "step": 2766 }, { "epoch": 3.538923113849108, "grad_norm": 0.48312902450561523, "learning_rate": 1.1497227042321269e-05, "loss": 0.6426, "step": 2767 }, { "epoch": 3.5402032162573005, "grad_norm": 0.5144852995872498, "learning_rate": 1.1485119775634548e-05, "loss": 0.632, "step": 2768 }, { "epoch": 3.5414833186654935, "grad_norm": 0.5160422921180725, "learning_rate": 1.1473019726125427e-05, "loss": 0.6454, "step": 2769 }, { "epoch": 3.542763421073686, "grad_norm": 0.49337631464004517, "learning_rate": 1.1460926902099123e-05, "loss": 0.6459, "step": 2770 }, { "epoch": 3.5440435234818786, "grad_norm": 0.4793124496936798, "learning_rate": 1.1448841311855881e-05, "loss": 0.6547, "step": 2771 }, { "epoch": 3.545323625890071, "grad_norm": 0.5613303184509277, "learning_rate": 1.1436762963690966e-05, "loss": 0.6404, "step": 2772 }, { "epoch": 3.5466037282982636, "grad_norm": 0.5109605193138123, "learning_rate": 1.142469186589469e-05, "loss": 0.6778, "step": 2773 }, { "epoch": 3.5478838307064566, "grad_norm": 0.482348769903183, "learning_rate": 1.1412628026752395e-05, "loss": 0.6193, "step": 2774 }, { "epoch": 3.549163933114649, "grad_norm": 0.4726719856262207, "learning_rate": 1.1400571454544412e-05, "loss": 0.6364, "step": 2775 }, { "epoch": 3.5504440355228417, "grad_norm": 0.5502317547798157, "learning_rate": 1.1388522157546107e-05, "loss": 0.6477, "step": 2776 }, { "epoch": 3.5517241379310347, "grad_norm": 0.49400949478149414, "learning_rate": 1.1376480144027853e-05, "loss": 0.6442, "step": 2777 }, { "epoch": 3.5530042403392272, "grad_norm": 0.4953269064426422, "learning_rate": 1.136444542225501e-05, "loss": 0.6482, "step": 2778 }, { "epoch": 3.55428434274742, "grad_norm": 0.5284993052482605, "learning_rate": 1.1352418000487941e-05, "loss": 0.6645, "step": 2779 }, { "epoch": 3.5555644451556123, "grad_norm": 0.46703362464904785, "learning_rate": 1.1340397886982007e-05, "loss": 0.6266, "step": 2780 }, { "epoch": 3.556844547563805, "grad_norm": 0.5016201734542847, "learning_rate": 1.1328385089987532e-05, "loss": 0.6454, "step": 2781 }, { "epoch": 3.558124649971998, "grad_norm": 0.47830647230148315, "learning_rate": 1.1316379617749837e-05, "loss": 0.6147, "step": 2782 }, { "epoch": 3.5594047523801904, "grad_norm": 0.5023000836372375, "learning_rate": 1.1304381478509216e-05, "loss": 0.6637, "step": 2783 }, { "epoch": 3.560684854788383, "grad_norm": 0.47462597489356995, "learning_rate": 1.1292390680500903e-05, "loss": 0.6588, "step": 2784 }, { "epoch": 3.561964957196576, "grad_norm": 0.4568457305431366, "learning_rate": 1.1280407231955125e-05, "loss": 0.6512, "step": 2785 }, { "epoch": 3.5632450596047684, "grad_norm": 0.4648769497871399, "learning_rate": 1.1268431141097054e-05, "loss": 0.6008, "step": 2786 }, { "epoch": 3.564525162012961, "grad_norm": 0.4593886137008667, "learning_rate": 1.1256462416146803e-05, "loss": 0.6227, "step": 2787 }, { "epoch": 3.5658052644211535, "grad_norm": 0.46304184198379517, "learning_rate": 1.1244501065319437e-05, "loss": 0.6471, "step": 2788 }, { "epoch": 3.567085366829346, "grad_norm": 0.47933557629585266, "learning_rate": 1.1232547096824966e-05, "loss": 0.6404, "step": 2789 }, { "epoch": 3.568365469237539, "grad_norm": 0.47464719414711, "learning_rate": 1.1220600518868311e-05, "loss": 0.6511, "step": 2790 }, { "epoch": 3.568365469237539, "eval_loss": 0.01143835112452507, "eval_runtime": 10.8175, "eval_samples_per_second": 45.852, "eval_steps_per_second": 5.731, "step": 2790 }, { "epoch": 3.5696455716457316, "grad_norm": 0.5069913864135742, "learning_rate": 1.1208661339649348e-05, "loss": 0.677, "step": 2791 }, { "epoch": 3.5709256740539246, "grad_norm": 0.5090366005897522, "learning_rate": 1.1196729567362863e-05, "loss": 0.663, "step": 2792 }, { "epoch": 3.572205776462117, "grad_norm": 0.4997399151325226, "learning_rate": 1.118480521019854e-05, "loss": 0.6341, "step": 2793 }, { "epoch": 3.5734858788703097, "grad_norm": 0.5092949867248535, "learning_rate": 1.1172888276341013e-05, "loss": 0.6536, "step": 2794 }, { "epoch": 3.574765981278502, "grad_norm": 0.525589108467102, "learning_rate": 1.1160978773969773e-05, "loss": 0.6612, "step": 2795 }, { "epoch": 3.5760460836866947, "grad_norm": 0.5021042823791504, "learning_rate": 1.1149076711259248e-05, "loss": 0.6583, "step": 2796 }, { "epoch": 3.5773261860948877, "grad_norm": 0.4602411091327667, "learning_rate": 1.1137182096378751e-05, "loss": 0.6315, "step": 2797 }, { "epoch": 3.5786062885030803, "grad_norm": 0.4679986536502838, "learning_rate": 1.1125294937492468e-05, "loss": 0.6492, "step": 2798 }, { "epoch": 3.579886390911273, "grad_norm": 0.5496346950531006, "learning_rate": 1.1113415242759484e-05, "loss": 0.6444, "step": 2799 }, { "epoch": 3.581166493319466, "grad_norm": 0.49317190051078796, "learning_rate": 1.1101543020333757e-05, "loss": 0.6536, "step": 2800 }, { "epoch": 3.5824465957276583, "grad_norm": 0.5776232481002808, "learning_rate": 1.1089678278364108e-05, "loss": 0.6702, "step": 2801 }, { "epoch": 3.583726698135851, "grad_norm": 0.5339002013206482, "learning_rate": 1.1077821024994231e-05, "loss": 0.6184, "step": 2802 }, { "epoch": 3.5850068005440434, "grad_norm": 0.4782545268535614, "learning_rate": 1.1065971268362685e-05, "loss": 0.6611, "step": 2803 }, { "epoch": 3.586286902952236, "grad_norm": 0.5438824892044067, "learning_rate": 1.1054129016602863e-05, "loss": 0.6524, "step": 2804 }, { "epoch": 3.587567005360429, "grad_norm": 0.5965319275856018, "learning_rate": 1.1042294277843029e-05, "loss": 0.661, "step": 2805 }, { "epoch": 3.5888471077686215, "grad_norm": 0.5224551558494568, "learning_rate": 1.1030467060206287e-05, "loss": 0.6552, "step": 2806 }, { "epoch": 3.590127210176814, "grad_norm": 0.48367223143577576, "learning_rate": 1.1018647371810562e-05, "loss": 0.6691, "step": 2807 }, { "epoch": 3.591407312585007, "grad_norm": 0.5312662124633789, "learning_rate": 1.100683522076863e-05, "loss": 0.6279, "step": 2808 }, { "epoch": 3.5926874149931995, "grad_norm": 0.5946574211120605, "learning_rate": 1.099503061518809e-05, "loss": 0.6191, "step": 2809 }, { "epoch": 3.593967517401392, "grad_norm": 0.515278697013855, "learning_rate": 1.0983233563171346e-05, "loss": 0.6127, "step": 2810 }, { "epoch": 3.5952476198095846, "grad_norm": 0.506566047668457, "learning_rate": 1.0971444072815638e-05, "loss": 0.6602, "step": 2811 }, { "epoch": 3.596527722217777, "grad_norm": 0.5674377679824829, "learning_rate": 1.095966215221301e-05, "loss": 0.6686, "step": 2812 }, { "epoch": 3.59780782462597, "grad_norm": 0.5017653107643127, "learning_rate": 1.0947887809450299e-05, "loss": 0.6537, "step": 2813 }, { "epoch": 3.5990879270341627, "grad_norm": 0.4885178506374359, "learning_rate": 1.0936121052609155e-05, "loss": 0.6036, "step": 2814 }, { "epoch": 3.6003680294423552, "grad_norm": 0.5086835026741028, "learning_rate": 1.0924361889766017e-05, "loss": 0.6384, "step": 2815 }, { "epoch": 3.601648131850548, "grad_norm": 0.4810003340244293, "learning_rate": 1.0912610328992103e-05, "loss": 0.6589, "step": 2816 }, { "epoch": 3.6029282342587408, "grad_norm": 0.5347673296928406, "learning_rate": 1.0900866378353424e-05, "loss": 0.7077, "step": 2817 }, { "epoch": 3.6042083366669333, "grad_norm": 0.5160301327705383, "learning_rate": 1.0889130045910772e-05, "loss": 0.6366, "step": 2818 }, { "epoch": 3.605488439075126, "grad_norm": 0.5085987448692322, "learning_rate": 1.0877401339719688e-05, "loss": 0.6437, "step": 2819 }, { "epoch": 3.606768541483319, "grad_norm": 0.4960525631904602, "learning_rate": 1.0865680267830507e-05, "loss": 0.6685, "step": 2820 }, { "epoch": 3.606768541483319, "eval_loss": 0.011422453448176384, "eval_runtime": 10.8201, "eval_samples_per_second": 45.84, "eval_steps_per_second": 5.73, "step": 2820 }, { "epoch": 3.6080486438915114, "grad_norm": 0.49201685190200806, "learning_rate": 1.0853966838288296e-05, "loss": 0.6598, "step": 2821 }, { "epoch": 3.609328746299704, "grad_norm": 0.506462037563324, "learning_rate": 1.0842261059132894e-05, "loss": 0.6386, "step": 2822 }, { "epoch": 3.610608848707897, "grad_norm": 0.4947039783000946, "learning_rate": 1.0830562938398893e-05, "loss": 0.636, "step": 2823 }, { "epoch": 3.6118889511160894, "grad_norm": 0.4936864376068115, "learning_rate": 1.081887248411561e-05, "loss": 0.6114, "step": 2824 }, { "epoch": 3.613169053524282, "grad_norm": 0.5415510535240173, "learning_rate": 1.0807189704307115e-05, "loss": 0.7048, "step": 2825 }, { "epoch": 3.6144491559324745, "grad_norm": 0.5129798054695129, "learning_rate": 1.079551460699221e-05, "loss": 0.6489, "step": 2826 }, { "epoch": 3.615729258340667, "grad_norm": 0.512713611125946, "learning_rate": 1.0783847200184408e-05, "loss": 0.6219, "step": 2827 }, { "epoch": 3.61700936074886, "grad_norm": 0.4892199635505676, "learning_rate": 1.077218749189196e-05, "loss": 0.6557, "step": 2828 }, { "epoch": 3.6182894631570526, "grad_norm": 0.48060908913612366, "learning_rate": 1.0760535490117836e-05, "loss": 0.6134, "step": 2829 }, { "epoch": 3.619569565565245, "grad_norm": 0.49317482113838196, "learning_rate": 1.0748891202859695e-05, "loss": 0.6694, "step": 2830 }, { "epoch": 3.620849667973438, "grad_norm": 0.49855637550354004, "learning_rate": 1.0737254638109923e-05, "loss": 0.6386, "step": 2831 }, { "epoch": 3.6221297703816306, "grad_norm": 0.5070940852165222, "learning_rate": 1.07256258038556e-05, "loss": 0.6555, "step": 2832 }, { "epoch": 3.623409872789823, "grad_norm": 0.4797641634941101, "learning_rate": 1.0714004708078485e-05, "loss": 0.6129, "step": 2833 }, { "epoch": 3.6246899751980157, "grad_norm": 0.5025620460510254, "learning_rate": 1.0702391358755041e-05, "loss": 0.6756, "step": 2834 }, { "epoch": 3.6259700776062083, "grad_norm": 0.48994600772857666, "learning_rate": 1.0690785763856421e-05, "loss": 0.6337, "step": 2835 }, { "epoch": 3.6272501800144012, "grad_norm": 0.507883608341217, "learning_rate": 1.0679187931348432e-05, "loss": 0.6368, "step": 2836 }, { "epoch": 3.628530282422594, "grad_norm": 0.4853685200214386, "learning_rate": 1.0667597869191567e-05, "loss": 0.6215, "step": 2837 }, { "epoch": 3.6298103848307863, "grad_norm": 0.5017647743225098, "learning_rate": 1.0656015585340995e-05, "loss": 0.5984, "step": 2838 }, { "epoch": 3.6310904872389793, "grad_norm": 0.4920690953731537, "learning_rate": 1.064444108774652e-05, "loss": 0.6285, "step": 2839 }, { "epoch": 3.632370589647172, "grad_norm": 0.47269406914711, "learning_rate": 1.0632874384352623e-05, "loss": 0.6599, "step": 2840 }, { "epoch": 3.6336506920553644, "grad_norm": 0.5047468543052673, "learning_rate": 1.0621315483098442e-05, "loss": 0.6241, "step": 2841 }, { "epoch": 3.634930794463557, "grad_norm": 0.539953887462616, "learning_rate": 1.0609764391917728e-05, "loss": 0.617, "step": 2842 }, { "epoch": 3.6362108968717495, "grad_norm": 0.4730015695095062, "learning_rate": 1.0598221118738898e-05, "loss": 0.5904, "step": 2843 }, { "epoch": 3.6374909992799425, "grad_norm": 0.4837453067302704, "learning_rate": 1.0586685671485003e-05, "loss": 0.6658, "step": 2844 }, { "epoch": 3.638771101688135, "grad_norm": 0.49402302503585815, "learning_rate": 1.0575158058073707e-05, "loss": 0.6557, "step": 2845 }, { "epoch": 3.6400512040963275, "grad_norm": 0.47058239579200745, "learning_rate": 1.0563638286417305e-05, "loss": 0.6006, "step": 2846 }, { "epoch": 3.6413313065045205, "grad_norm": 0.5083207488059998, "learning_rate": 1.055212636442271e-05, "loss": 0.6693, "step": 2847 }, { "epoch": 3.642611408912713, "grad_norm": 0.5132161974906921, "learning_rate": 1.0540622299991444e-05, "loss": 0.6507, "step": 2848 }, { "epoch": 3.6438915113209056, "grad_norm": 0.48563486337661743, "learning_rate": 1.0529126101019651e-05, "loss": 0.6325, "step": 2849 }, { "epoch": 3.645171613729098, "grad_norm": 0.505311131477356, "learning_rate": 1.0517637775398045e-05, "loss": 0.6536, "step": 2850 }, { "epoch": 3.645171613729098, "eval_loss": 0.011422289535403252, "eval_runtime": 10.8019, "eval_samples_per_second": 45.918, "eval_steps_per_second": 5.74, "step": 2850 }, { "epoch": 3.646451716137291, "grad_norm": 0.524929940700531, "learning_rate": 1.0506157331011965e-05, "loss": 0.6236, "step": 2851 }, { "epoch": 3.6477318185454837, "grad_norm": 0.5175740122795105, "learning_rate": 1.0494684775741338e-05, "loss": 0.6581, "step": 2852 }, { "epoch": 3.649011920953676, "grad_norm": 0.4799844026565552, "learning_rate": 1.0483220117460654e-05, "loss": 0.6281, "step": 2853 }, { "epoch": 3.650292023361869, "grad_norm": 0.46461695432662964, "learning_rate": 1.0471763364039e-05, "loss": 0.6112, "step": 2854 }, { "epoch": 3.6515721257700617, "grad_norm": 0.48377180099487305, "learning_rate": 1.0460314523340045e-05, "loss": 0.6676, "step": 2855 }, { "epoch": 3.6528522281782543, "grad_norm": 0.4818356931209564, "learning_rate": 1.0448873603221998e-05, "loss": 0.6566, "step": 2856 }, { "epoch": 3.654132330586447, "grad_norm": 0.4960228502750397, "learning_rate": 1.0437440611537663e-05, "loss": 0.6622, "step": 2857 }, { "epoch": 3.6554124329946394, "grad_norm": 0.4892972707748413, "learning_rate": 1.0426015556134392e-05, "loss": 0.6362, "step": 2858 }, { "epoch": 3.6566925354028323, "grad_norm": 0.48846346139907837, "learning_rate": 1.0414598444854074e-05, "loss": 0.6535, "step": 2859 }, { "epoch": 3.657972637811025, "grad_norm": 0.51702481508255, "learning_rate": 1.0403189285533162e-05, "loss": 0.6679, "step": 2860 }, { "epoch": 3.6592527402192174, "grad_norm": 0.5167385935783386, "learning_rate": 1.0391788086002655e-05, "loss": 0.6498, "step": 2861 }, { "epoch": 3.6605328426274104, "grad_norm": 0.5271387696266174, "learning_rate": 1.0380394854088064e-05, "loss": 0.686, "step": 2862 }, { "epoch": 3.661812945035603, "grad_norm": 0.49380338191986084, "learning_rate": 1.036900959760946e-05, "loss": 0.6709, "step": 2863 }, { "epoch": 3.6630930474437955, "grad_norm": 0.464388906955719, "learning_rate": 1.0357632324381433e-05, "loss": 0.6197, "step": 2864 }, { "epoch": 3.664373149851988, "grad_norm": 0.5040779709815979, "learning_rate": 1.0346263042213068e-05, "loss": 0.6411, "step": 2865 }, { "epoch": 3.6656532522601806, "grad_norm": 0.4891960322856903, "learning_rate": 1.0334901758907998e-05, "loss": 0.6368, "step": 2866 }, { "epoch": 3.6669333546683736, "grad_norm": 0.5071341395378113, "learning_rate": 1.0323548482264356e-05, "loss": 0.6285, "step": 2867 }, { "epoch": 3.668213457076566, "grad_norm": 0.45557788014411926, "learning_rate": 1.0312203220074766e-05, "loss": 0.6305, "step": 2868 }, { "epoch": 3.6694935594847586, "grad_norm": 0.4724888205528259, "learning_rate": 1.0300865980126363e-05, "loss": 0.6364, "step": 2869 }, { "epoch": 3.6707736618929516, "grad_norm": 0.4951120615005493, "learning_rate": 1.0289536770200783e-05, "loss": 0.6458, "step": 2870 }, { "epoch": 3.672053764301144, "grad_norm": 0.4920676350593567, "learning_rate": 1.0278215598074133e-05, "loss": 0.6417, "step": 2871 }, { "epoch": 3.6733338667093367, "grad_norm": 0.4896887540817261, "learning_rate": 1.0266902471517008e-05, "loss": 0.6563, "step": 2872 }, { "epoch": 3.6746139691175292, "grad_norm": 0.48132839798927307, "learning_rate": 1.02555973982945e-05, "loss": 0.6233, "step": 2873 }, { "epoch": 3.675894071525722, "grad_norm": 0.5013761520385742, "learning_rate": 1.0244300386166137e-05, "loss": 0.6549, "step": 2874 }, { "epoch": 3.6771741739339148, "grad_norm": 0.5326442122459412, "learning_rate": 1.0233011442885946e-05, "loss": 0.6725, "step": 2875 }, { "epoch": 3.6784542763421073, "grad_norm": 0.49917691946029663, "learning_rate": 1.0221730576202407e-05, "loss": 0.6516, "step": 2876 }, { "epoch": 3.6797343787503003, "grad_norm": 0.48615798354148865, "learning_rate": 1.0210457793858444e-05, "loss": 0.6384, "step": 2877 }, { "epoch": 3.681014481158493, "grad_norm": 0.4995875954627991, "learning_rate": 1.019919310359144e-05, "loss": 0.6386, "step": 2878 }, { "epoch": 3.6822945835666854, "grad_norm": 0.5343180298805237, "learning_rate": 1.0187936513133245e-05, "loss": 0.638, "step": 2879 }, { "epoch": 3.683574685974878, "grad_norm": 0.5254859924316406, "learning_rate": 1.0176688030210107e-05, "loss": 0.6579, "step": 2880 }, { "epoch": 3.683574685974878, "eval_loss": 0.011417878791689873, "eval_runtime": 10.8112, "eval_samples_per_second": 45.878, "eval_steps_per_second": 5.735, "step": 2880 }, { "epoch": 3.6848547883830705, "grad_norm": 0.5034304261207581, "learning_rate": 1.016544766254274e-05, "loss": 0.6858, "step": 2881 }, { "epoch": 3.6861348907912634, "grad_norm": 0.5118473768234253, "learning_rate": 1.0154215417846292e-05, "loss": 0.6455, "step": 2882 }, { "epoch": 3.687414993199456, "grad_norm": 0.46881163120269775, "learning_rate": 1.0142991303830301e-05, "loss": 0.6804, "step": 2883 }, { "epoch": 3.6886950956076485, "grad_norm": 0.491364061832428, "learning_rate": 1.013177532819876e-05, "loss": 0.6491, "step": 2884 }, { "epoch": 3.6899751980158415, "grad_norm": 0.5065906643867493, "learning_rate": 1.0120567498650065e-05, "loss": 0.6307, "step": 2885 }, { "epoch": 3.691255300424034, "grad_norm": 0.5274394750595093, "learning_rate": 1.010936782287702e-05, "loss": 0.6584, "step": 2886 }, { "epoch": 3.6925354028322266, "grad_norm": 0.48760563135147095, "learning_rate": 1.0098176308566817e-05, "loss": 0.6349, "step": 2887 }, { "epoch": 3.693815505240419, "grad_norm": 0.5175226330757141, "learning_rate": 1.0086992963401068e-05, "loss": 0.6308, "step": 2888 }, { "epoch": 3.6950956076486117, "grad_norm": 0.4898320138454437, "learning_rate": 1.0075817795055776e-05, "loss": 0.6529, "step": 2889 }, { "epoch": 3.6963757100568047, "grad_norm": 0.5060924887657166, "learning_rate": 1.0064650811201316e-05, "loss": 0.6729, "step": 2890 }, { "epoch": 3.697655812464997, "grad_norm": 0.523146390914917, "learning_rate": 1.0053492019502457e-05, "loss": 0.6432, "step": 2891 }, { "epoch": 3.6989359148731897, "grad_norm": 0.5231835246086121, "learning_rate": 1.0042341427618357e-05, "loss": 0.6803, "step": 2892 }, { "epoch": 3.7002160172813827, "grad_norm": 0.4628106653690338, "learning_rate": 1.0031199043202506e-05, "loss": 0.6436, "step": 2893 }, { "epoch": 3.7014961196895753, "grad_norm": 0.5030839443206787, "learning_rate": 1.0020064873902803e-05, "loss": 0.6836, "step": 2894 }, { "epoch": 3.702776222097768, "grad_norm": 0.521946907043457, "learning_rate": 1.0008938927361495e-05, "loss": 0.6512, "step": 2895 }, { "epoch": 3.7040563245059603, "grad_norm": 0.4723970293998718, "learning_rate": 9.997821211215172e-06, "loss": 0.6504, "step": 2896 }, { "epoch": 3.705336426914153, "grad_norm": 0.502835750579834, "learning_rate": 9.986711733094785e-06, "loss": 0.6635, "step": 2897 }, { "epoch": 3.706616529322346, "grad_norm": 0.5013492703437805, "learning_rate": 9.975610500625642e-06, "loss": 0.6466, "step": 2898 }, { "epoch": 3.7078966317305384, "grad_norm": 0.5020231604576111, "learning_rate": 9.964517521427366e-06, "loss": 0.636, "step": 2899 }, { "epoch": 3.709176734138731, "grad_norm": 0.5422610640525818, "learning_rate": 9.953432803113931e-06, "loss": 0.6306, "step": 2900 }, { "epoch": 3.710456836546924, "grad_norm": 0.4779011905193329, "learning_rate": 9.94235635329365e-06, "loss": 0.6402, "step": 2901 }, { "epoch": 3.7117369389551165, "grad_norm": 0.4914515018463135, "learning_rate": 9.931288179569135e-06, "loss": 0.6696, "step": 2902 }, { "epoch": 3.713017041363309, "grad_norm": 0.47003981471061707, "learning_rate": 9.920228289537337e-06, "loss": 0.6421, "step": 2903 }, { "epoch": 3.7142971437715016, "grad_norm": 0.5225586891174316, "learning_rate": 9.909176690789522e-06, "loss": 0.6798, "step": 2904 }, { "epoch": 3.7155772461796945, "grad_norm": 0.5420576930046082, "learning_rate": 9.89813339091125e-06, "loss": 0.6905, "step": 2905 }, { "epoch": 3.716857348587887, "grad_norm": 0.48183944821357727, "learning_rate": 9.887098397482398e-06, "loss": 0.6766, "step": 2906 }, { "epoch": 3.7181374509960796, "grad_norm": 0.4869091510772705, "learning_rate": 9.876071718077142e-06, "loss": 0.6234, "step": 2907 }, { "epoch": 3.7194175534042726, "grad_norm": 0.49029341340065, "learning_rate": 9.865053360263939e-06, "loss": 0.6243, "step": 2908 }, { "epoch": 3.720697655812465, "grad_norm": 0.48741549253463745, "learning_rate": 9.854043331605544e-06, "loss": 0.6258, "step": 2909 }, { "epoch": 3.7219777582206577, "grad_norm": 0.49600744247436523, "learning_rate": 9.843041639659003e-06, "loss": 0.6108, "step": 2910 }, { "epoch": 3.7219777582206577, "eval_loss": 0.011410364881157875, "eval_runtime": 10.8253, "eval_samples_per_second": 45.819, "eval_steps_per_second": 5.727, "step": 2910 }, { "epoch": 3.7232578606288502, "grad_norm": 0.5103457570075989, "learning_rate": 9.832048291975616e-06, "loss": 0.6527, "step": 2911 }, { "epoch": 3.7245379630370428, "grad_norm": 0.4938619136810303, "learning_rate": 9.821063296100979e-06, "loss": 0.648, "step": 2912 }, { "epoch": 3.7258180654452357, "grad_norm": 0.5137816667556763, "learning_rate": 9.810086659574948e-06, "loss": 0.6243, "step": 2913 }, { "epoch": 3.7270981678534283, "grad_norm": 0.5702383518218994, "learning_rate": 9.79911838993163e-06, "loss": 0.6777, "step": 2914 }, { "epoch": 3.728378270261621, "grad_norm": 0.47129806876182556, "learning_rate": 9.788158494699405e-06, "loss": 0.6548, "step": 2915 }, { "epoch": 3.729658372669814, "grad_norm": 0.503034770488739, "learning_rate": 9.777206981400904e-06, "loss": 0.6464, "step": 2916 }, { "epoch": 3.7309384750780064, "grad_norm": 0.5019398331642151, "learning_rate": 9.76626385755299e-06, "loss": 0.6133, "step": 2917 }, { "epoch": 3.732218577486199, "grad_norm": 0.5174933671951294, "learning_rate": 9.755329130666781e-06, "loss": 0.6369, "step": 2918 }, { "epoch": 3.7334986798943914, "grad_norm": 0.49872708320617676, "learning_rate": 9.744402808247635e-06, "loss": 0.6577, "step": 2919 }, { "epoch": 3.734778782302584, "grad_norm": 0.5082205533981323, "learning_rate": 9.733484897795122e-06, "loss": 0.6412, "step": 2920 }, { "epoch": 3.736058884710777, "grad_norm": 0.5398660898208618, "learning_rate": 9.722575406803056e-06, "loss": 0.6766, "step": 2921 }, { "epoch": 3.7373389871189695, "grad_norm": 0.5091952085494995, "learning_rate": 9.711674342759474e-06, "loss": 0.6488, "step": 2922 }, { "epoch": 3.738619089527162, "grad_norm": 0.4718760550022125, "learning_rate": 9.700781713146608e-06, "loss": 0.6402, "step": 2923 }, { "epoch": 3.739899191935355, "grad_norm": 0.49748873710632324, "learning_rate": 9.68989752544093e-06, "loss": 0.6422, "step": 2924 }, { "epoch": 3.7411792943435476, "grad_norm": 0.517709493637085, "learning_rate": 9.679021787113083e-06, "loss": 0.6643, "step": 2925 }, { "epoch": 3.74245939675174, "grad_norm": 0.5044804811477661, "learning_rate": 9.668154505627942e-06, "loss": 0.6962, "step": 2926 }, { "epoch": 3.7437394991599326, "grad_norm": 0.49303412437438965, "learning_rate": 9.657295688444567e-06, "loss": 0.6537, "step": 2927 }, { "epoch": 3.745019601568125, "grad_norm": 0.5132579207420349, "learning_rate": 9.646445343016195e-06, "loss": 0.6316, "step": 2928 }, { "epoch": 3.746299703976318, "grad_norm": 0.5101869106292725, "learning_rate": 9.635603476790268e-06, "loss": 0.6443, "step": 2929 }, { "epoch": 3.7475798063845107, "grad_norm": 0.4614020586013794, "learning_rate": 9.624770097208404e-06, "loss": 0.6141, "step": 2930 }, { "epoch": 3.7488599087927033, "grad_norm": 0.49720925092697144, "learning_rate": 9.613945211706377e-06, "loss": 0.6154, "step": 2931 }, { "epoch": 3.7501400112008962, "grad_norm": 0.4910092055797577, "learning_rate": 9.603128827714153e-06, "loss": 0.6379, "step": 2932 }, { "epoch": 3.751420113609089, "grad_norm": 0.5107735395431519, "learning_rate": 9.592320952655863e-06, "loss": 0.6444, "step": 2933 }, { "epoch": 3.7527002160172813, "grad_norm": 0.4670794904232025, "learning_rate": 9.581521593949774e-06, "loss": 0.6376, "step": 2934 }, { "epoch": 3.753980318425474, "grad_norm": 0.5206142067909241, "learning_rate": 9.570730759008331e-06, "loss": 0.6711, "step": 2935 }, { "epoch": 3.755260420833667, "grad_norm": 0.5948630571365356, "learning_rate": 9.559948455238128e-06, "loss": 0.6411, "step": 2936 }, { "epoch": 3.7565405232418594, "grad_norm": 0.5366334915161133, "learning_rate": 9.549174690039884e-06, "loss": 0.6315, "step": 2937 }, { "epoch": 3.757820625650052, "grad_norm": 0.4711497128009796, "learning_rate": 9.538409470808472e-06, "loss": 0.6188, "step": 2938 }, { "epoch": 3.759100728058245, "grad_norm": 0.48475149273872375, "learning_rate": 9.527652804932907e-06, "loss": 0.6524, "step": 2939 }, { "epoch": 3.7603808304664375, "grad_norm": 0.49723920226097107, "learning_rate": 9.516904699796308e-06, "loss": 0.6607, "step": 2940 }, { "epoch": 3.7603808304664375, "eval_loss": 0.011400481685996056, "eval_runtime": 10.8026, "eval_samples_per_second": 45.915, "eval_steps_per_second": 5.739, "step": 2940 }, { "epoch": 3.76166093287463, "grad_norm": 0.48554638028144836, "learning_rate": 9.50616516277594e-06, "loss": 0.6016, "step": 2941 }, { "epoch": 3.7629410352828225, "grad_norm": 0.47717761993408203, "learning_rate": 9.495434201243187e-06, "loss": 0.6703, "step": 2942 }, { "epoch": 3.764221137691015, "grad_norm": 0.4773055613040924, "learning_rate": 9.484711822563527e-06, "loss": 0.655, "step": 2943 }, { "epoch": 3.765501240099208, "grad_norm": 0.4841598868370056, "learning_rate": 9.473998034096565e-06, "loss": 0.68, "step": 2944 }, { "epoch": 3.7667813425074006, "grad_norm": 0.4953411817550659, "learning_rate": 9.463292843196011e-06, "loss": 0.6081, "step": 2945 }, { "epoch": 3.768061444915593, "grad_norm": 0.49032536149024963, "learning_rate": 9.452596257209658e-06, "loss": 0.6028, "step": 2946 }, { "epoch": 3.769341547323786, "grad_norm": 0.5038009881973267, "learning_rate": 9.441908283479404e-06, "loss": 0.6199, "step": 2947 }, { "epoch": 3.7706216497319787, "grad_norm": 0.5327941179275513, "learning_rate": 9.431228929341243e-06, "loss": 0.6676, "step": 2948 }, { "epoch": 3.771901752140171, "grad_norm": 0.5019099116325378, "learning_rate": 9.420558202125232e-06, "loss": 0.6427, "step": 2949 }, { "epoch": 3.7731818545483637, "grad_norm": 0.4896283447742462, "learning_rate": 9.40989610915553e-06, "loss": 0.6164, "step": 2950 }, { "epoch": 3.7744619569565563, "grad_norm": 0.4576800465583801, "learning_rate": 9.399242657750346e-06, "loss": 0.63, "step": 2951 }, { "epoch": 3.7757420593647493, "grad_norm": 0.4906672239303589, "learning_rate": 9.388597855221976e-06, "loss": 0.6331, "step": 2952 }, { "epoch": 3.777022161772942, "grad_norm": 0.4907695949077606, "learning_rate": 9.377961708876777e-06, "loss": 0.637, "step": 2953 }, { "epoch": 3.7783022641811344, "grad_norm": 0.468185693025589, "learning_rate": 9.367334226015154e-06, "loss": 0.6266, "step": 2954 }, { "epoch": 3.7795823665893273, "grad_norm": 0.48238587379455566, "learning_rate": 9.356715413931575e-06, "loss": 0.6371, "step": 2955 }, { "epoch": 3.78086246899752, "grad_norm": 0.5327696800231934, "learning_rate": 9.34610527991456e-06, "loss": 0.6423, "step": 2956 }, { "epoch": 3.7821425714057124, "grad_norm": 0.5187394022941589, "learning_rate": 9.335503831246656e-06, "loss": 0.6623, "step": 2957 }, { "epoch": 3.783422673813905, "grad_norm": 0.48732247948646545, "learning_rate": 9.324911075204465e-06, "loss": 0.6383, "step": 2958 }, { "epoch": 3.7847027762220975, "grad_norm": 0.52056884765625, "learning_rate": 9.314327019058621e-06, "loss": 0.644, "step": 2959 }, { "epoch": 3.7859828786302905, "grad_norm": 0.4897262752056122, "learning_rate": 9.303751670073771e-06, "loss": 0.6604, "step": 2960 }, { "epoch": 3.787262981038483, "grad_norm": 0.48963961005210876, "learning_rate": 9.293185035508607e-06, "loss": 0.6076, "step": 2961 }, { "epoch": 3.788543083446676, "grad_norm": 0.49382975697517395, "learning_rate": 9.28262712261583e-06, "loss": 0.6795, "step": 2962 }, { "epoch": 3.7898231858548685, "grad_norm": 0.4907773435115814, "learning_rate": 9.272077938642147e-06, "loss": 0.6154, "step": 2963 }, { "epoch": 3.791103288263061, "grad_norm": 0.47583645582199097, "learning_rate": 9.261537490828283e-06, "loss": 0.6431, "step": 2964 }, { "epoch": 3.7923833906712536, "grad_norm": 0.4625856280326843, "learning_rate": 9.251005786408973e-06, "loss": 0.6053, "step": 2965 }, { "epoch": 3.793663493079446, "grad_norm": 0.48354119062423706, "learning_rate": 9.240482832612931e-06, "loss": 0.6581, "step": 2966 }, { "epoch": 3.794943595487639, "grad_norm": 0.5079452991485596, "learning_rate": 9.229968636662878e-06, "loss": 0.6286, "step": 2967 }, { "epoch": 3.7962236978958317, "grad_norm": 0.46758586168289185, "learning_rate": 9.219463205775532e-06, "loss": 0.6346, "step": 2968 }, { "epoch": 3.7975038003040242, "grad_norm": 0.4636211395263672, "learning_rate": 9.208966547161573e-06, "loss": 0.6216, "step": 2969 }, { "epoch": 3.798783902712217, "grad_norm": 0.5054153800010681, "learning_rate": 9.198478668025675e-06, "loss": 0.6312, "step": 2970 }, { "epoch": 3.798783902712217, "eval_loss": 0.011398686096072197, "eval_runtime": 10.8332, "eval_samples_per_second": 45.785, "eval_steps_per_second": 5.723, "step": 2970 }, { "epoch": 3.8000640051204098, "grad_norm": 0.5667929649353027, "learning_rate": 9.18799957556649e-06, "loss": 0.6501, "step": 2971 }, { "epoch": 3.8013441075286023, "grad_norm": 0.4893105626106262, "learning_rate": 9.177529276976619e-06, "loss": 0.6199, "step": 2972 }, { "epoch": 3.802624209936795, "grad_norm": 0.4836716651916504, "learning_rate": 9.167067779442646e-06, "loss": 0.6253, "step": 2973 }, { "epoch": 3.8039043123449874, "grad_norm": 0.562601625919342, "learning_rate": 9.156615090145116e-06, "loss": 0.6525, "step": 2974 }, { "epoch": 3.8051844147531804, "grad_norm": 0.5605821013450623, "learning_rate": 9.146171216258506e-06, "loss": 0.6649, "step": 2975 }, { "epoch": 3.806464517161373, "grad_norm": 0.49592655897140503, "learning_rate": 9.135736164951264e-06, "loss": 0.6323, "step": 2976 }, { "epoch": 3.8077446195695654, "grad_norm": 0.5060100555419922, "learning_rate": 9.125309943385778e-06, "loss": 0.6173, "step": 2977 }, { "epoch": 3.8090247219777584, "grad_norm": 0.5618041753768921, "learning_rate": 9.114892558718363e-06, "loss": 0.6597, "step": 2978 }, { "epoch": 3.810304824385951, "grad_norm": 0.5486238598823547, "learning_rate": 9.104484018099288e-06, "loss": 0.6451, "step": 2979 }, { "epoch": 3.8115849267941435, "grad_norm": 0.4996105134487152, "learning_rate": 9.094084328672732e-06, "loss": 0.6629, "step": 2980 }, { "epoch": 3.812865029202336, "grad_norm": 0.5543266534805298, "learning_rate": 9.083693497576813e-06, "loss": 0.6762, "step": 2981 }, { "epoch": 3.8141451316105286, "grad_norm": 0.5271042585372925, "learning_rate": 9.073311531943569e-06, "loss": 0.6123, "step": 2982 }, { "epoch": 3.8154252340187216, "grad_norm": 0.4737612307071686, "learning_rate": 9.062938438898936e-06, "loss": 0.6359, "step": 2983 }, { "epoch": 3.816705336426914, "grad_norm": 0.4501494765281677, "learning_rate": 9.052574225562778e-06, "loss": 0.6531, "step": 2984 }, { "epoch": 3.8179854388351067, "grad_norm": 0.5052728652954102, "learning_rate": 9.042218899048865e-06, "loss": 0.6501, "step": 2985 }, { "epoch": 3.8192655412432996, "grad_norm": 0.5092394948005676, "learning_rate": 9.031872466464853e-06, "loss": 0.6631, "step": 2986 }, { "epoch": 3.820545643651492, "grad_norm": 0.48900294303894043, "learning_rate": 9.0215349349123e-06, "loss": 0.6786, "step": 2987 }, { "epoch": 3.8218257460596847, "grad_norm": 0.47884610295295715, "learning_rate": 9.011206311486662e-06, "loss": 0.6174, "step": 2988 }, { "epoch": 3.8231058484678773, "grad_norm": 0.4919913113117218, "learning_rate": 9.000886603277266e-06, "loss": 0.6386, "step": 2989 }, { "epoch": 3.8243859508760703, "grad_norm": 0.4870697855949402, "learning_rate": 8.990575817367331e-06, "loss": 0.6561, "step": 2990 }, { "epoch": 3.825666053284263, "grad_norm": 0.5059792995452881, "learning_rate": 8.980273960833955e-06, "loss": 0.6541, "step": 2991 }, { "epoch": 3.8269461556924553, "grad_norm": 0.5328920483589172, "learning_rate": 8.969981040748094e-06, "loss": 0.654, "step": 2992 }, { "epoch": 3.8282262581006483, "grad_norm": 0.4907168447971344, "learning_rate": 8.959697064174575e-06, "loss": 0.6495, "step": 2993 }, { "epoch": 3.829506360508841, "grad_norm": 0.48205500841140747, "learning_rate": 8.9494220381721e-06, "loss": 0.6013, "step": 2994 }, { "epoch": 3.8307864629170334, "grad_norm": 0.5104532241821289, "learning_rate": 8.939155969793205e-06, "loss": 0.6487, "step": 2995 }, { "epoch": 3.832066565325226, "grad_norm": 0.5226468443870544, "learning_rate": 8.92889886608429e-06, "loss": 0.6818, "step": 2996 }, { "epoch": 3.8333466677334185, "grad_norm": 0.5273947715759277, "learning_rate": 8.918650734085608e-06, "loss": 0.6172, "step": 2997 }, { "epoch": 3.8346267701416115, "grad_norm": 0.5069656372070312, "learning_rate": 8.908411580831239e-06, "loss": 0.6025, "step": 2998 }, { "epoch": 3.835906872549804, "grad_norm": 0.455133318901062, "learning_rate": 8.898181413349107e-06, "loss": 0.646, "step": 2999 }, { "epoch": 3.8371869749579965, "grad_norm": 0.5026136636734009, "learning_rate": 8.88796023866098e-06, "loss": 0.6332, "step": 3000 }, { "epoch": 3.8371869749579965, "eval_loss": 0.011393608525395393, "eval_runtime": 10.8083, "eval_samples_per_second": 45.891, "eval_steps_per_second": 5.736, "step": 3000 }, { "epoch": 3.8384670773661895, "grad_norm": 0.5468612313270569, "learning_rate": 8.877748063782429e-06, "loss": 0.6251, "step": 3001 }, { "epoch": 3.839747179774382, "grad_norm": 0.5341756939888, "learning_rate": 8.867544895722869e-06, "loss": 0.6503, "step": 3002 }, { "epoch": 3.8410272821825746, "grad_norm": 0.5142664909362793, "learning_rate": 8.857350741485526e-06, "loss": 0.6446, "step": 3003 }, { "epoch": 3.842307384590767, "grad_norm": 0.5296292304992676, "learning_rate": 8.847165608067436e-06, "loss": 0.6579, "step": 3004 }, { "epoch": 3.8435874869989597, "grad_norm": 0.5008630156517029, "learning_rate": 8.83698950245945e-06, "loss": 0.6564, "step": 3005 }, { "epoch": 3.8448675894071527, "grad_norm": 0.45849448442459106, "learning_rate": 8.826822431646208e-06, "loss": 0.6251, "step": 3006 }, { "epoch": 3.846147691815345, "grad_norm": 0.5119452476501465, "learning_rate": 8.816664402606167e-06, "loss": 0.6651, "step": 3007 }, { "epoch": 3.8474277942235378, "grad_norm": 0.5033029913902283, "learning_rate": 8.806515422311575e-06, "loss": 0.6202, "step": 3008 }, { "epoch": 3.8487078966317307, "grad_norm": 0.5177422165870667, "learning_rate": 8.796375497728451e-06, "loss": 0.6688, "step": 3009 }, { "epoch": 3.8499879990399233, "grad_norm": 0.47897839546203613, "learning_rate": 8.78624463581662e-06, "loss": 0.6356, "step": 3010 }, { "epoch": 3.851268101448116, "grad_norm": 0.5281705260276794, "learning_rate": 8.776122843529679e-06, "loss": 0.631, "step": 3011 }, { "epoch": 3.8525482038563084, "grad_norm": 0.473541259765625, "learning_rate": 8.766010127814994e-06, "loss": 0.6312, "step": 3012 }, { "epoch": 3.853828306264501, "grad_norm": 0.49050384759902954, "learning_rate": 8.755906495613706e-06, "loss": 0.6659, "step": 3013 }, { "epoch": 3.855108408672694, "grad_norm": 0.5245078206062317, "learning_rate": 8.74581195386073e-06, "loss": 0.6498, "step": 3014 }, { "epoch": 3.8563885110808864, "grad_norm": 0.513077437877655, "learning_rate": 8.735726509484722e-06, "loss": 0.6424, "step": 3015 }, { "epoch": 3.857668613489079, "grad_norm": 0.49324536323547363, "learning_rate": 8.725650169408106e-06, "loss": 0.6318, "step": 3016 }, { "epoch": 3.858948715897272, "grad_norm": 0.4788437485694885, "learning_rate": 8.715582940547068e-06, "loss": 0.6248, "step": 3017 }, { "epoch": 3.8602288183054645, "grad_norm": 0.5154752731323242, "learning_rate": 8.705524829811508e-06, "loss": 0.636, "step": 3018 }, { "epoch": 3.861508920713657, "grad_norm": 0.49946969747543335, "learning_rate": 8.695475844105098e-06, "loss": 0.6666, "step": 3019 }, { "epoch": 3.8627890231218496, "grad_norm": 0.4704820215702057, "learning_rate": 8.68543599032524e-06, "loss": 0.6062, "step": 3020 }, { "epoch": 3.8640691255300426, "grad_norm": 0.4827554225921631, "learning_rate": 8.675405275363058e-06, "loss": 0.6504, "step": 3021 }, { "epoch": 3.865349227938235, "grad_norm": 0.4924499988555908, "learning_rate": 8.665383706103408e-06, "loss": 0.645, "step": 3022 }, { "epoch": 3.8666293303464276, "grad_norm": 0.4820888340473175, "learning_rate": 8.655371289424879e-06, "loss": 0.6391, "step": 3023 }, { "epoch": 3.8679094327546206, "grad_norm": 0.4984312057495117, "learning_rate": 8.645368032199757e-06, "loss": 0.6693, "step": 3024 }, { "epoch": 3.869189535162813, "grad_norm": 0.49851006269454956, "learning_rate": 8.63537394129406e-06, "loss": 0.6516, "step": 3025 }, { "epoch": 3.8704696375710057, "grad_norm": 0.4811323881149292, "learning_rate": 8.62538902356751e-06, "loss": 0.637, "step": 3026 }, { "epoch": 3.8717497399791982, "grad_norm": 0.4522285759449005, "learning_rate": 8.615413285873523e-06, "loss": 0.6116, "step": 3027 }, { "epoch": 3.873029842387391, "grad_norm": 0.47147703170776367, "learning_rate": 8.605446735059223e-06, "loss": 0.6483, "step": 3028 }, { "epoch": 3.8743099447955838, "grad_norm": 0.4844609797000885, "learning_rate": 8.595489377965438e-06, "loss": 0.6573, "step": 3029 }, { "epoch": 3.8755900472037763, "grad_norm": 0.4950932562351227, "learning_rate": 8.585541221426657e-06, "loss": 0.6221, "step": 3030 }, { "epoch": 3.8755900472037763, "eval_loss": 0.011392003856599331, "eval_runtime": 10.8302, "eval_samples_per_second": 45.798, "eval_steps_per_second": 5.725, "step": 3030 }, { "epoch": 3.876870149611969, "grad_norm": 0.4878495931625366, "learning_rate": 8.575602272271077e-06, "loss": 0.6601, "step": 3031 }, { "epoch": 3.878150252020162, "grad_norm": 0.5103570222854614, "learning_rate": 8.565672537320581e-06, "loss": 0.6724, "step": 3032 }, { "epoch": 3.8794303544283544, "grad_norm": 0.4957294464111328, "learning_rate": 8.5557520233907e-06, "loss": 0.6779, "step": 3033 }, { "epoch": 3.880710456836547, "grad_norm": 0.4894900321960449, "learning_rate": 8.545840737290655e-06, "loss": 0.6367, "step": 3034 }, { "epoch": 3.8819905592447395, "grad_norm": 0.4775257706642151, "learning_rate": 8.535938685823344e-06, "loss": 0.655, "step": 3035 }, { "epoch": 3.883270661652932, "grad_norm": 0.478449285030365, "learning_rate": 8.526045875785293e-06, "loss": 0.6233, "step": 3036 }, { "epoch": 3.884550764061125, "grad_norm": 0.5237434506416321, "learning_rate": 8.516162313966717e-06, "loss": 0.6654, "step": 3037 }, { "epoch": 3.8858308664693175, "grad_norm": 0.4853358864784241, "learning_rate": 8.506288007151473e-06, "loss": 0.6332, "step": 3038 }, { "epoch": 3.88711096887751, "grad_norm": 0.4554169774055481, "learning_rate": 8.496422962117051e-06, "loss": 0.6329, "step": 3039 }, { "epoch": 3.888391071285703, "grad_norm": 0.4704521894454956, "learning_rate": 8.486567185634606e-06, "loss": 0.6481, "step": 3040 }, { "epoch": 3.8896711736938956, "grad_norm": 0.4720918834209442, "learning_rate": 8.476720684468921e-06, "loss": 0.6281, "step": 3041 }, { "epoch": 3.890951276102088, "grad_norm": 0.4820510149002075, "learning_rate": 8.466883465378411e-06, "loss": 0.6298, "step": 3042 }, { "epoch": 3.8922313785102807, "grad_norm": 0.49557843804359436, "learning_rate": 8.45705553511512e-06, "loss": 0.6662, "step": 3043 }, { "epoch": 3.893511480918473, "grad_norm": 0.525687575340271, "learning_rate": 8.44723690042472e-06, "loss": 0.6491, "step": 3044 }, { "epoch": 3.894791583326666, "grad_norm": 0.4745238125324249, "learning_rate": 8.43742756804651e-06, "loss": 0.5982, "step": 3045 }, { "epoch": 3.8960716857348587, "grad_norm": 0.48005083203315735, "learning_rate": 8.427627544713381e-06, "loss": 0.6445, "step": 3046 }, { "epoch": 3.8973517881430517, "grad_norm": 0.4923861622810364, "learning_rate": 8.417836837151857e-06, "loss": 0.6565, "step": 3047 }, { "epoch": 3.8986318905512443, "grad_norm": 0.48761045932769775, "learning_rate": 8.408055452082064e-06, "loss": 0.6536, "step": 3048 }, { "epoch": 3.899911992959437, "grad_norm": 0.5227696895599365, "learning_rate": 8.398283396217712e-06, "loss": 0.6227, "step": 3049 }, { "epoch": 3.9011920953676293, "grad_norm": 0.4789896309375763, "learning_rate": 8.388520676266132e-06, "loss": 0.6195, "step": 3050 }, { "epoch": 3.902472197775822, "grad_norm": 0.4864027202129364, "learning_rate": 8.378767298928237e-06, "loss": 0.6092, "step": 3051 }, { "epoch": 3.903752300184015, "grad_norm": 0.47270238399505615, "learning_rate": 8.369023270898515e-06, "loss": 0.6627, "step": 3052 }, { "epoch": 3.9050324025922074, "grad_norm": 0.47152993083000183, "learning_rate": 8.359288598865052e-06, "loss": 0.6263, "step": 3053 }, { "epoch": 3.9063125050004, "grad_norm": 0.46962761878967285, "learning_rate": 8.349563289509516e-06, "loss": 0.5927, "step": 3054 }, { "epoch": 3.907592607408593, "grad_norm": 0.4662138521671295, "learning_rate": 8.339847349507132e-06, "loss": 0.6271, "step": 3055 }, { "epoch": 3.9088727098167855, "grad_norm": 0.4927668273448944, "learning_rate": 8.330140785526706e-06, "loss": 0.6389, "step": 3056 }, { "epoch": 3.910152812224978, "grad_norm": 0.45494070649147034, "learning_rate": 8.32044360423061e-06, "loss": 0.6574, "step": 3057 }, { "epoch": 3.9114329146331706, "grad_norm": 0.5050803422927856, "learning_rate": 8.310755812274764e-06, "loss": 0.6438, "step": 3058 }, { "epoch": 3.912713017041363, "grad_norm": 0.5328724980354309, "learning_rate": 8.301077416308651e-06, "loss": 0.6236, "step": 3059 }, { "epoch": 3.913993119449556, "grad_norm": 0.4846177399158478, "learning_rate": 8.291408422975315e-06, "loss": 0.6257, "step": 3060 }, { "epoch": 3.913993119449556, "eval_loss": 0.011388003826141357, "eval_runtime": 10.8209, "eval_samples_per_second": 45.837, "eval_steps_per_second": 5.73, "step": 3060 }, { "epoch": 3.9152732218577486, "grad_norm": 0.48647886514663696, "learning_rate": 8.281748838911323e-06, "loss": 0.6474, "step": 3061 }, { "epoch": 3.916553324265941, "grad_norm": 0.4750177264213562, "learning_rate": 8.272098670746801e-06, "loss": 0.6538, "step": 3062 }, { "epoch": 3.917833426674134, "grad_norm": 0.49009081721305847, "learning_rate": 8.262457925105414e-06, "loss": 0.6126, "step": 3063 }, { "epoch": 3.9191135290823267, "grad_norm": 0.5038008689880371, "learning_rate": 8.252826608604343e-06, "loss": 0.6666, "step": 3064 }, { "epoch": 3.9203936314905192, "grad_norm": 0.49638527631759644, "learning_rate": 8.24320472785431e-06, "loss": 0.6465, "step": 3065 }, { "epoch": 3.9216737338987118, "grad_norm": 0.4825122654438019, "learning_rate": 8.23359228945957e-06, "loss": 0.6486, "step": 3066 }, { "epoch": 3.9229538363069043, "grad_norm": 0.5027803778648376, "learning_rate": 8.223989300017867e-06, "loss": 0.6504, "step": 3067 }, { "epoch": 3.9242339387150973, "grad_norm": 0.49459660053253174, "learning_rate": 8.214395766120484e-06, "loss": 0.6478, "step": 3068 }, { "epoch": 3.92551404112329, "grad_norm": 0.4860994815826416, "learning_rate": 8.204811694352216e-06, "loss": 0.6398, "step": 3069 }, { "epoch": 3.9267941435314824, "grad_norm": 0.4880172312259674, "learning_rate": 8.19523709129134e-06, "loss": 0.6631, "step": 3070 }, { "epoch": 3.9280742459396754, "grad_norm": 0.4944741427898407, "learning_rate": 8.185671963509655e-06, "loss": 0.6414, "step": 3071 }, { "epoch": 3.929354348347868, "grad_norm": 0.5079156160354614, "learning_rate": 8.176116317572457e-06, "loss": 0.6452, "step": 3072 }, { "epoch": 3.9306344507560604, "grad_norm": 0.4638914465904236, "learning_rate": 8.166570160038514e-06, "loss": 0.643, "step": 3073 }, { "epoch": 3.931914553164253, "grad_norm": 0.4641512334346771, "learning_rate": 8.1570334974601e-06, "loss": 0.6451, "step": 3074 }, { "epoch": 3.9331946555724455, "grad_norm": 0.4876812696456909, "learning_rate": 8.147506336382973e-06, "loss": 0.6115, "step": 3075 }, { "epoch": 3.9344747579806385, "grad_norm": 0.49157753586769104, "learning_rate": 8.137988683346347e-06, "loss": 0.6451, "step": 3076 }, { "epoch": 3.935754860388831, "grad_norm": 0.4958047568798065, "learning_rate": 8.128480544882934e-06, "loss": 0.6406, "step": 3077 }, { "epoch": 3.937034962797024, "grad_norm": 0.4504125714302063, "learning_rate": 8.118981927518915e-06, "loss": 0.6036, "step": 3078 }, { "epoch": 3.9383150652052166, "grad_norm": 0.509773313999176, "learning_rate": 8.109492837773912e-06, "loss": 0.6729, "step": 3079 }, { "epoch": 3.939595167613409, "grad_norm": 0.4869062900543213, "learning_rate": 8.10001328216103e-06, "loss": 0.6204, "step": 3080 }, { "epoch": 3.9408752700216017, "grad_norm": 0.5071339011192322, "learning_rate": 8.090543267186829e-06, "loss": 0.6344, "step": 3081 }, { "epoch": 3.942155372429794, "grad_norm": 0.5110708475112915, "learning_rate": 8.081082799351301e-06, "loss": 0.6936, "step": 3082 }, { "epoch": 3.943435474837987, "grad_norm": 0.4968855381011963, "learning_rate": 8.071631885147914e-06, "loss": 0.6476, "step": 3083 }, { "epoch": 3.9447155772461797, "grad_norm": 0.47699102759361267, "learning_rate": 8.062190531063549e-06, "loss": 0.6432, "step": 3084 }, { "epoch": 3.9459956796543723, "grad_norm": 0.4785839319229126, "learning_rate": 8.052758743578547e-06, "loss": 0.6552, "step": 3085 }, { "epoch": 3.9472757820625652, "grad_norm": 0.4930052161216736, "learning_rate": 8.043336529166681e-06, "loss": 0.7104, "step": 3086 }, { "epoch": 3.948555884470758, "grad_norm": 0.46638068556785583, "learning_rate": 8.033923894295132e-06, "loss": 0.6452, "step": 3087 }, { "epoch": 3.9498359868789503, "grad_norm": 0.47538697719573975, "learning_rate": 8.024520845424532e-06, "loss": 0.6318, "step": 3088 }, { "epoch": 3.951116089287143, "grad_norm": 0.5044569373130798, "learning_rate": 8.015127389008923e-06, "loss": 0.6442, "step": 3089 }, { "epoch": 3.9523961916953354, "grad_norm": 0.4961550533771515, "learning_rate": 8.005743531495756e-06, "loss": 0.6402, "step": 3090 }, { "epoch": 3.9523961916953354, "eval_loss": 0.011380051262676716, "eval_runtime": 10.826, "eval_samples_per_second": 45.816, "eval_steps_per_second": 5.727, "step": 3090 }, { "epoch": 3.9536762941035284, "grad_norm": 0.47219613194465637, "learning_rate": 7.996369279325901e-06, "loss": 0.6121, "step": 3091 }, { "epoch": 3.954956396511721, "grad_norm": 0.4593760371208191, "learning_rate": 7.987004638933646e-06, "loss": 0.617, "step": 3092 }, { "epoch": 3.9562364989199135, "grad_norm": 0.4869404733181, "learning_rate": 7.977649616746653e-06, "loss": 0.6563, "step": 3093 }, { "epoch": 3.9575166013281065, "grad_norm": 0.4596230685710907, "learning_rate": 7.968304219186006e-06, "loss": 0.6202, "step": 3094 }, { "epoch": 3.958796703736299, "grad_norm": 0.49334338307380676, "learning_rate": 7.958968452666184e-06, "loss": 0.6464, "step": 3095 }, { "epoch": 3.9600768061444915, "grad_norm": 0.48544076085090637, "learning_rate": 7.949642323595035e-06, "loss": 0.6398, "step": 3096 }, { "epoch": 3.961356908552684, "grad_norm": 0.4898148775100708, "learning_rate": 7.940325838373808e-06, "loss": 0.6404, "step": 3097 }, { "epoch": 3.9626370109608766, "grad_norm": 0.4826902151107788, "learning_rate": 7.931019003397135e-06, "loss": 0.6437, "step": 3098 }, { "epoch": 3.9639171133690696, "grad_norm": 0.5142403244972229, "learning_rate": 7.921721825053013e-06, "loss": 0.6522, "step": 3099 }, { "epoch": 3.965197215777262, "grad_norm": 0.49967753887176514, "learning_rate": 7.912434309722815e-06, "loss": 0.6611, "step": 3100 }, { "epoch": 3.9664773181854547, "grad_norm": 0.4844744801521301, "learning_rate": 7.90315646378129e-06, "loss": 0.6419, "step": 3101 }, { "epoch": 3.9677574205936477, "grad_norm": 0.46609875559806824, "learning_rate": 7.893888293596534e-06, "loss": 0.6159, "step": 3102 }, { "epoch": 3.96903752300184, "grad_norm": 0.4745890498161316, "learning_rate": 7.884629805530017e-06, "loss": 0.6336, "step": 3103 }, { "epoch": 3.9703176254100327, "grad_norm": 0.49275532364845276, "learning_rate": 7.87538100593656e-06, "loss": 0.6114, "step": 3104 }, { "epoch": 3.9715977278182253, "grad_norm": 0.4750758111476898, "learning_rate": 7.866141901164324e-06, "loss": 0.6301, "step": 3105 }, { "epoch": 3.9728778302264183, "grad_norm": 0.49187296628952026, "learning_rate": 7.856912497554821e-06, "loss": 0.6313, "step": 3106 }, { "epoch": 3.974157932634611, "grad_norm": 0.5150437355041504, "learning_rate": 7.847692801442921e-06, "loss": 0.6512, "step": 3107 }, { "epoch": 3.9754380350428034, "grad_norm": 0.4669630229473114, "learning_rate": 7.8384828191568e-06, "loss": 0.6256, "step": 3108 }, { "epoch": 3.9767181374509963, "grad_norm": 0.46803414821624756, "learning_rate": 7.829282557017994e-06, "loss": 0.6541, "step": 3109 }, { "epoch": 3.977998239859189, "grad_norm": 0.4534625709056854, "learning_rate": 7.82009202134135e-06, "loss": 0.6428, "step": 3110 }, { "epoch": 3.9792783422673814, "grad_norm": 0.5128123760223389, "learning_rate": 7.810911218435044e-06, "loss": 0.673, "step": 3111 }, { "epoch": 3.980558444675574, "grad_norm": 0.5048739314079285, "learning_rate": 7.801740154600584e-06, "loss": 0.6655, "step": 3112 }, { "epoch": 3.9818385470837665, "grad_norm": 0.4649309515953064, "learning_rate": 7.792578836132767e-06, "loss": 0.6362, "step": 3113 }, { "epoch": 3.9831186494919595, "grad_norm": 0.4508923888206482, "learning_rate": 7.783427269319726e-06, "loss": 0.6256, "step": 3114 }, { "epoch": 3.984398751900152, "grad_norm": 0.48068177700042725, "learning_rate": 7.77428546044289e-06, "loss": 0.687, "step": 3115 }, { "epoch": 3.9856788543083446, "grad_norm": 0.471524178981781, "learning_rate": 7.765153415776987e-06, "loss": 0.6514, "step": 3116 }, { "epoch": 3.9869589567165375, "grad_norm": 0.4320808947086334, "learning_rate": 7.756031141590051e-06, "loss": 0.626, "step": 3117 }, { "epoch": 3.98823905912473, "grad_norm": 0.494357168674469, "learning_rate": 7.74691864414341e-06, "loss": 0.6736, "step": 3118 }, { "epoch": 3.9895191615329226, "grad_norm": 0.49010246992111206, "learning_rate": 7.737815929691665e-06, "loss": 0.6847, "step": 3119 }, { "epoch": 3.990799263941115, "grad_norm": 0.47675013542175293, "learning_rate": 7.728723004482726e-06, "loss": 0.6426, "step": 3120 }, { "epoch": 3.990799263941115, "eval_loss": 0.011370080523192883, "eval_runtime": 10.8414, "eval_samples_per_second": 45.751, "eval_steps_per_second": 5.719, "step": 3120 }, { "epoch": 3.9920793663493077, "grad_norm": 0.4744720757007599, "learning_rate": 7.71963987475777e-06, "loss": 0.6755, "step": 3121 }, { "epoch": 3.9933594687575007, "grad_norm": 0.48414307832717896, "learning_rate": 7.71056654675125e-06, "loss": 0.6348, "step": 3122 }, { "epoch": 3.9946395711656932, "grad_norm": 0.48627740144729614, "learning_rate": 7.701503026690898e-06, "loss": 0.6638, "step": 3123 }, { "epoch": 3.9959196735738858, "grad_norm": 0.4748673141002655, "learning_rate": 7.692449320797715e-06, "loss": 0.6536, "step": 3124 }, { "epoch": 3.9971997759820788, "grad_norm": 0.5028969049453735, "learning_rate": 7.68340543528595e-06, "loss": 0.6614, "step": 3125 }, { "epoch": 3.9984798783902713, "grad_norm": 0.5049706101417542, "learning_rate": 7.674371376363128e-06, "loss": 0.6705, "step": 3126 }, { "epoch": 3.999759980798464, "grad_norm": 0.5031850337982178, "learning_rate": 7.665347150230029e-06, "loss": 0.6389, "step": 3127 }, { "epoch": 4.0, "grad_norm": 0.9680603742599487, "learning_rate": 7.656332763080672e-06, "loss": 0.6112, "step": 3128 } ], "logging_steps": 1, "max_steps": 3910, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.3101892528528425e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }