{ "best_global_step": 360, "best_metric": 0.7657684087753296, "best_model_checkpoint": "/tmp/checkpoints_/job_bf4d9449-335c-4598-aae6-39588820e13b/checkpoint-360", "epoch": 2.946395563770795, "eval_steps": 10, "global_step": 400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0073937153419593345, "grad_norm": 1.8413621187210083, "learning_rate": 0.0, "loss": 3.3830344676971436, "step": 1 }, { "epoch": 0.014787430683918669, "grad_norm": 2.0386335849761963, "learning_rate": 1e-05, "loss": 3.3935506343841553, "step": 2 }, { "epoch": 0.022181146025878003, "grad_norm": 1.3186163902282715, "learning_rate": 2e-05, "loss": 2.732372999191284, "step": 3 }, { "epoch": 0.029574861367837338, "grad_norm": 0.8585255146026611, "learning_rate": 3e-05, "loss": 1.7911560535430908, "step": 4 }, { "epoch": 0.036968576709796676, "grad_norm": 2.3140437602996826, "learning_rate": 4e-05, "loss": 3.907397508621216, "step": 5 }, { "epoch": 0.04436229205175601, "grad_norm": 1.8938422203063965, "learning_rate": 5e-05, "loss": 3.279386281967163, "step": 6 }, { "epoch": 0.051756007393715345, "grad_norm": 1.4730970859527588, "learning_rate": 4.987593052109181e-05, "loss": 2.3899412155151367, "step": 7 }, { "epoch": 0.059149722735674676, "grad_norm": 2.0717520713806152, "learning_rate": 4.9751861042183624e-05, "loss": 2.698546886444092, "step": 8 }, { "epoch": 0.066543438077634, "grad_norm": 2.2532644271850586, "learning_rate": 4.962779156327544e-05, "loss": 2.6992990970611572, "step": 9 }, { "epoch": 0.07393715341959335, "grad_norm": 0.9512649178504944, "learning_rate": 4.950372208436725e-05, "loss": 1.5360665321350098, "step": 10 }, { "epoch": 0.07393715341959335, "eval_loss": 2.1426639556884766, "eval_runtime": 15.4966, "eval_samples_per_second": 3.227, "eval_steps_per_second": 0.839, "step": 10 }, { "epoch": 0.08133086876155268, "grad_norm": 2.03887939453125, "learning_rate": 4.937965260545906e-05, "loss": 2.421833038330078, "step": 11 }, { "epoch": 0.08872458410351201, "grad_norm": 0.5944672226905823, "learning_rate": 4.9255583126550866e-05, "loss": 0.9898832440376282, "step": 12 }, { "epoch": 0.09611829944547134, "grad_norm": 2.314751148223877, "learning_rate": 4.9131513647642677e-05, "loss": 2.684413433074951, "step": 13 }, { "epoch": 0.10351201478743069, "grad_norm": 3.032388687133789, "learning_rate": 4.9007444168734494e-05, "loss": 2.4992518424987793, "step": 14 }, { "epoch": 0.11090573012939002, "grad_norm": 0.7512603998184204, "learning_rate": 4.8883374689826305e-05, "loss": 1.5652904510498047, "step": 15 }, { "epoch": 0.11829944547134935, "grad_norm": 2.1483168601989746, "learning_rate": 4.8759305210918115e-05, "loss": 2.0766830444335938, "step": 16 }, { "epoch": 0.1256931608133087, "grad_norm": 2.4940130710601807, "learning_rate": 4.8635235732009926e-05, "loss": 2.14599609375, "step": 17 }, { "epoch": 0.133086876155268, "grad_norm": 2.58516788482666, "learning_rate": 4.851116625310174e-05, "loss": 2.678130865097046, "step": 18 }, { "epoch": 0.14048059149722736, "grad_norm": 2.1474788188934326, "learning_rate": 4.8387096774193554e-05, "loss": 2.2763166427612305, "step": 19 }, { "epoch": 0.1478743068391867, "grad_norm": 1.9327515363693237, "learning_rate": 4.8263027295285364e-05, "loss": 2.2559866905212402, "step": 20 }, { "epoch": 0.1478743068391867, "eval_loss": 1.6021771430969238, "eval_runtime": 14.2984, "eval_samples_per_second": 3.497, "eval_steps_per_second": 0.909, "step": 20 }, { "epoch": 0.15526802218114602, "grad_norm": 2.2944412231445312, "learning_rate": 4.8138957816377175e-05, "loss": 1.956355333328247, "step": 21 }, { "epoch": 0.16266173752310537, "grad_norm": 2.040257453918457, "learning_rate": 4.8014888337468986e-05, "loss": 1.9789292812347412, "step": 22 }, { "epoch": 0.17005545286506468, "grad_norm": 1.0300790071487427, "learning_rate": 4.7890818858560796e-05, "loss": 1.229586124420166, "step": 23 }, { "epoch": 0.17744916820702403, "grad_norm": 1.9188776016235352, "learning_rate": 4.776674937965261e-05, "loss": 2.252568006515503, "step": 24 }, { "epoch": 0.18484288354898337, "grad_norm": 0.6468012928962708, "learning_rate": 4.764267990074442e-05, "loss": 0.6744526028633118, "step": 25 }, { "epoch": 0.1922365988909427, "grad_norm": 2.002753257751465, "learning_rate": 4.751861042183623e-05, "loss": 1.6015210151672363, "step": 26 }, { "epoch": 0.19963031423290203, "grad_norm": 2.264155864715576, "learning_rate": 4.739454094292804e-05, "loss": 1.9130383729934692, "step": 27 }, { "epoch": 0.20702402957486138, "grad_norm": 2.164496421813965, "learning_rate": 4.7270471464019856e-05, "loss": 1.3355481624603271, "step": 28 }, { "epoch": 0.2144177449168207, "grad_norm": 0.9778668880462646, "learning_rate": 4.7146401985111667e-05, "loss": 1.042914867401123, "step": 29 }, { "epoch": 0.22181146025878004, "grad_norm": 2.4416842460632324, "learning_rate": 4.702233250620348e-05, "loss": 1.7163786888122559, "step": 30 }, { "epoch": 0.22181146025878004, "eval_loss": 1.4117671251296997, "eval_runtime": 14.7244, "eval_samples_per_second": 3.396, "eval_steps_per_second": 0.883, "step": 30 }, { "epoch": 0.22920517560073936, "grad_norm": 2.560103416442871, "learning_rate": 4.689826302729529e-05, "loss": 1.7177424430847168, "step": 31 }, { "epoch": 0.2365988909426987, "grad_norm": 2.265031576156616, "learning_rate": 4.67741935483871e-05, "loss": 1.6933493614196777, "step": 32 }, { "epoch": 0.24399260628465805, "grad_norm": 1.3352007865905762, "learning_rate": 4.665012406947891e-05, "loss": 1.289770483970642, "step": 33 }, { "epoch": 0.2513863216266174, "grad_norm": 2.739408016204834, "learning_rate": 4.652605459057072e-05, "loss": 1.892009973526001, "step": 34 }, { "epoch": 0.2587800369685767, "grad_norm": 0.848355770111084, "learning_rate": 4.640198511166253e-05, "loss": 0.7992806434631348, "step": 35 }, { "epoch": 0.266173752310536, "grad_norm": 1.8914474248886108, "learning_rate": 4.627791563275434e-05, "loss": 1.014716386795044, "step": 36 }, { "epoch": 0.2735674676524954, "grad_norm": 1.8833729028701782, "learning_rate": 4.615384615384616e-05, "loss": 1.8454999923706055, "step": 37 }, { "epoch": 0.2809611829944547, "grad_norm": 1.0575491189956665, "learning_rate": 4.602977667493797e-05, "loss": 0.7487808465957642, "step": 38 }, { "epoch": 0.28835489833641403, "grad_norm": 1.340802550315857, "learning_rate": 4.590570719602978e-05, "loss": 1.2484363317489624, "step": 39 }, { "epoch": 0.2957486136783734, "grad_norm": 2.2050182819366455, "learning_rate": 4.578163771712159e-05, "loss": 1.4082988500595093, "step": 40 }, { "epoch": 0.2957486136783734, "eval_loss": 1.2930712699890137, "eval_runtime": 14.6012, "eval_samples_per_second": 3.424, "eval_steps_per_second": 0.89, "step": 40 }, { "epoch": 0.3031423290203327, "grad_norm": 1.9534828662872314, "learning_rate": 4.56575682382134e-05, "loss": 1.0940786600112915, "step": 41 }, { "epoch": 0.31053604436229204, "grad_norm": 2.391226053237915, "learning_rate": 4.553349875930522e-05, "loss": 1.151236891746521, "step": 42 }, { "epoch": 0.3179297597042514, "grad_norm": 2.316863536834717, "learning_rate": 4.540942928039703e-05, "loss": 1.2963817119598389, "step": 43 }, { "epoch": 0.32532347504621073, "grad_norm": 0.9008046984672546, "learning_rate": 4.528535980148884e-05, "loss": 0.6621055006980896, "step": 44 }, { "epoch": 0.33271719038817005, "grad_norm": 1.6869522333145142, "learning_rate": 4.516129032258064e-05, "loss": 1.0466387271881104, "step": 45 }, { "epoch": 0.34011090573012936, "grad_norm": 2.317460536956787, "learning_rate": 4.5037220843672454e-05, "loss": 1.386788249015808, "step": 46 }, { "epoch": 0.34750462107208874, "grad_norm": 1.1141090393066406, "learning_rate": 4.491315136476427e-05, "loss": 1.6268982887268066, "step": 47 }, { "epoch": 0.35489833641404805, "grad_norm": 2.659907341003418, "learning_rate": 4.478908188585608e-05, "loss": 1.7704683542251587, "step": 48 }, { "epoch": 0.36229205175600737, "grad_norm": 1.2273647785186768, "learning_rate": 4.466501240694789e-05, "loss": 0.8123348951339722, "step": 49 }, { "epoch": 0.36968576709796674, "grad_norm": 1.389702320098877, "learning_rate": 4.45409429280397e-05, "loss": 1.4599602222442627, "step": 50 }, { "epoch": 0.36968576709796674, "eval_loss": 1.2116776704788208, "eval_runtime": 14.659, "eval_samples_per_second": 3.411, "eval_steps_per_second": 0.887, "step": 50 }, { "epoch": 0.37707948243992606, "grad_norm": 2.522132635116577, "learning_rate": 4.441687344913151e-05, "loss": 1.606776237487793, "step": 51 }, { "epoch": 0.3844731977818854, "grad_norm": 2.7198681831359863, "learning_rate": 4.429280397022333e-05, "loss": 1.5745301246643066, "step": 52 }, { "epoch": 0.39186691312384475, "grad_norm": 2.941790819168091, "learning_rate": 4.416873449131514e-05, "loss": 1.1630932092666626, "step": 53 }, { "epoch": 0.39926062846580407, "grad_norm": 2.5087671279907227, "learning_rate": 4.404466501240695e-05, "loss": 1.0615822076797485, "step": 54 }, { "epoch": 0.4066543438077634, "grad_norm": 2.8571765422821045, "learning_rate": 4.392059553349876e-05, "loss": 1.4195711612701416, "step": 55 }, { "epoch": 0.41404805914972276, "grad_norm": 2.0848593711853027, "learning_rate": 4.379652605459057e-05, "loss": 1.430311679840088, "step": 56 }, { "epoch": 0.4214417744916821, "grad_norm": 2.469207286834717, "learning_rate": 4.3672456575682384e-05, "loss": 1.1654510498046875, "step": 57 }, { "epoch": 0.4288354898336414, "grad_norm": 2.1722354888916016, "learning_rate": 4.3548387096774194e-05, "loss": 1.0921519994735718, "step": 58 }, { "epoch": 0.43622920517560076, "grad_norm": 1.956921100616455, "learning_rate": 4.3424317617866005e-05, "loss": 1.6206697225570679, "step": 59 }, { "epoch": 0.4436229205175601, "grad_norm": 2.6034843921661377, "learning_rate": 4.3300248138957816e-05, "loss": 1.1840237379074097, "step": 60 }, { "epoch": 0.4436229205175601, "eval_loss": 1.1138910055160522, "eval_runtime": 14.7491, "eval_samples_per_second": 3.39, "eval_steps_per_second": 0.881, "step": 60 }, { "epoch": 0.4510166358595194, "grad_norm": 3.262052297592163, "learning_rate": 4.317617866004963e-05, "loss": 1.0644543170928955, "step": 61 }, { "epoch": 0.4584103512014787, "grad_norm": 2.89835262298584, "learning_rate": 4.3052109181141444e-05, "loss": 1.783827543258667, "step": 62 }, { "epoch": 0.4658040665434381, "grad_norm": 2.8248863220214844, "learning_rate": 4.2928039702233254e-05, "loss": 1.4520047903060913, "step": 63 }, { "epoch": 0.4731977818853974, "grad_norm": 2.2947335243225098, "learning_rate": 4.2803970223325065e-05, "loss": 1.1205673217773438, "step": 64 }, { "epoch": 0.4805914972273567, "grad_norm": 2.2984018325805664, "learning_rate": 4.2679900744416875e-05, "loss": 0.9593680500984192, "step": 65 }, { "epoch": 0.4879852125693161, "grad_norm": 3.3136825561523438, "learning_rate": 4.2555831265508686e-05, "loss": 1.685524344444275, "step": 66 }, { "epoch": 0.4953789279112754, "grad_norm": 2.308732509613037, "learning_rate": 4.2431761786600497e-05, "loss": 1.4158852100372314, "step": 67 }, { "epoch": 0.5027726432532348, "grad_norm": 2.764207363128662, "learning_rate": 4.230769230769231e-05, "loss": 1.1706503629684448, "step": 68 }, { "epoch": 0.5101663585951941, "grad_norm": 2.7320327758789062, "learning_rate": 4.218362282878412e-05, "loss": 0.978042721748352, "step": 69 }, { "epoch": 0.5175600739371534, "grad_norm": 2.549668550491333, "learning_rate": 4.205955334987593e-05, "loss": 1.1643197536468506, "step": 70 }, { "epoch": 0.5175600739371534, "eval_loss": 1.0553016662597656, "eval_runtime": 14.6825, "eval_samples_per_second": 3.405, "eval_steps_per_second": 0.885, "step": 70 }, { "epoch": 0.5249537892791127, "grad_norm": 3.1705875396728516, "learning_rate": 4.1935483870967746e-05, "loss": 1.828012228012085, "step": 71 }, { "epoch": 0.532347504621072, "grad_norm": 3.109196424484253, "learning_rate": 4.1811414392059556e-05, "loss": 0.7359082698822021, "step": 72 }, { "epoch": 0.5397412199630314, "grad_norm": 1.8801664113998413, "learning_rate": 4.168734491315137e-05, "loss": 1.0972692966461182, "step": 73 }, { "epoch": 0.5471349353049908, "grad_norm": 2.4713597297668457, "learning_rate": 4.156327543424318e-05, "loss": 0.8450818061828613, "step": 74 }, { "epoch": 0.5545286506469501, "grad_norm": 2.952817440032959, "learning_rate": 4.1439205955334995e-05, "loss": 1.0884149074554443, "step": 75 }, { "epoch": 0.5619223659889094, "grad_norm": 2.8595173358917236, "learning_rate": 4.1315136476426805e-05, "loss": 1.139454960823059, "step": 76 }, { "epoch": 0.5693160813308688, "grad_norm": 3.3091001510620117, "learning_rate": 4.119106699751861e-05, "loss": 1.3391754627227783, "step": 77 }, { "epoch": 0.5767097966728281, "grad_norm": 3.2456319332122803, "learning_rate": 4.106699751861042e-05, "loss": 1.3041037321090698, "step": 78 }, { "epoch": 0.5841035120147874, "grad_norm": 2.745225667953491, "learning_rate": 4.094292803970223e-05, "loss": 1.4664080142974854, "step": 79 }, { "epoch": 0.5914972273567468, "grad_norm": 3.86385178565979, "learning_rate": 4.081885856079405e-05, "loss": 1.0991761684417725, "step": 80 }, { "epoch": 0.5914972273567468, "eval_loss": 1.024406909942627, "eval_runtime": 14.6773, "eval_samples_per_second": 3.407, "eval_steps_per_second": 0.886, "step": 80 }, { "epoch": 0.5988909426987061, "grad_norm": 3.2133798599243164, "learning_rate": 4.069478908188586e-05, "loss": 1.482096791267395, "step": 81 }, { "epoch": 0.6062846580406654, "grad_norm": 2.4578635692596436, "learning_rate": 4.057071960297767e-05, "loss": 0.95296311378479, "step": 82 }, { "epoch": 0.6136783733826248, "grad_norm": 3.0704939365386963, "learning_rate": 4.044665012406948e-05, "loss": 1.4384511709213257, "step": 83 }, { "epoch": 0.6210720887245841, "grad_norm": 3.1470870971679688, "learning_rate": 4.032258064516129e-05, "loss": 0.8680386543273926, "step": 84 }, { "epoch": 0.6284658040665434, "grad_norm": 2.6569035053253174, "learning_rate": 4.019851116625311e-05, "loss": 1.0536919832229614, "step": 85 }, { "epoch": 0.6358595194085028, "grad_norm": 2.6955459117889404, "learning_rate": 4.007444168734492e-05, "loss": 1.2974836826324463, "step": 86 }, { "epoch": 0.6432532347504621, "grad_norm": 2.881974458694458, "learning_rate": 3.995037220843673e-05, "loss": 0.9090498089790344, "step": 87 }, { "epoch": 0.6506469500924215, "grad_norm": 2.85056209564209, "learning_rate": 3.982630272952854e-05, "loss": 1.142749547958374, "step": 88 }, { "epoch": 0.6580406654343808, "grad_norm": 2.879006862640381, "learning_rate": 3.970223325062035e-05, "loss": 0.8405839204788208, "step": 89 }, { "epoch": 0.6654343807763401, "grad_norm": 3.156893253326416, "learning_rate": 3.957816377171216e-05, "loss": 0.8235164880752563, "step": 90 }, { "epoch": 0.6654343807763401, "eval_loss": 0.9943150877952576, "eval_runtime": 14.7351, "eval_samples_per_second": 3.393, "eval_steps_per_second": 0.882, "step": 90 }, { "epoch": 0.6728280961182994, "grad_norm": 2.9643747806549072, "learning_rate": 3.945409429280397e-05, "loss": 1.1688953638076782, "step": 91 }, { "epoch": 0.6802218114602587, "grad_norm": 2.8159196376800537, "learning_rate": 3.933002481389578e-05, "loss": 1.1848558187484741, "step": 92 }, { "epoch": 0.6876155268022182, "grad_norm": 3.1563498973846436, "learning_rate": 3.920595533498759e-05, "loss": 1.133997917175293, "step": 93 }, { "epoch": 0.6950092421441775, "grad_norm": 2.359210252761841, "learning_rate": 3.908188585607941e-05, "loss": 0.8476818799972534, "step": 94 }, { "epoch": 0.7024029574861368, "grad_norm": 3.1568336486816406, "learning_rate": 3.895781637717122e-05, "loss": 0.8584047555923462, "step": 95 }, { "epoch": 0.7097966728280961, "grad_norm": 3.0946948528289795, "learning_rate": 3.883374689826303e-05, "loss": 0.8942509889602661, "step": 96 }, { "epoch": 0.7171903881700554, "grad_norm": 2.688983201980591, "learning_rate": 3.870967741935484e-05, "loss": 0.9744483232498169, "step": 97 }, { "epoch": 0.7245841035120147, "grad_norm": 3.7019851207733154, "learning_rate": 3.858560794044665e-05, "loss": 1.0812692642211914, "step": 98 }, { "epoch": 0.7319778188539742, "grad_norm": 3.413264274597168, "learning_rate": 3.846153846153846e-05, "loss": 1.2246288061141968, "step": 99 }, { "epoch": 0.7393715341959335, "grad_norm": 3.1463723182678223, "learning_rate": 3.8337468982630273e-05, "loss": 0.9551287889480591, "step": 100 }, { "epoch": 0.7393715341959335, "eval_loss": 0.9603383541107178, "eval_runtime": 14.5967, "eval_samples_per_second": 3.425, "eval_steps_per_second": 0.891, "step": 100 }, { "epoch": 0.7467652495378928, "grad_norm": 3.331590414047241, "learning_rate": 3.8213399503722084e-05, "loss": 1.0125172138214111, "step": 101 }, { "epoch": 0.7541589648798521, "grad_norm": 1.8756176233291626, "learning_rate": 3.8089330024813895e-05, "loss": 1.4402893781661987, "step": 102 }, { "epoch": 0.7615526802218114, "grad_norm": 2.8599133491516113, "learning_rate": 3.7965260545905705e-05, "loss": 0.9122072458267212, "step": 103 }, { "epoch": 0.7689463955637708, "grad_norm": 2.963188648223877, "learning_rate": 3.784119106699752e-05, "loss": 0.9114301204681396, "step": 104 }, { "epoch": 0.7763401109057301, "grad_norm": 3.2771401405334473, "learning_rate": 3.771712158808933e-05, "loss": 0.9420968890190125, "step": 105 }, { "epoch": 0.7837338262476895, "grad_norm": 1.1317050457000732, "learning_rate": 3.7593052109181144e-05, "loss": 0.5487204790115356, "step": 106 }, { "epoch": 0.7911275415896488, "grad_norm": 1.592030644416809, "learning_rate": 3.7468982630272954e-05, "loss": 0.6232097744941711, "step": 107 }, { "epoch": 0.7985212569316081, "grad_norm": 2.3476905822753906, "learning_rate": 3.734491315136477e-05, "loss": 1.3079752922058105, "step": 108 }, { "epoch": 0.8059149722735675, "grad_norm": 3.5496175289154053, "learning_rate": 3.7220843672456576e-05, "loss": 1.1627793312072754, "step": 109 }, { "epoch": 0.8133086876155268, "grad_norm": 2.3397562503814697, "learning_rate": 3.7096774193548386e-05, "loss": 1.2222082614898682, "step": 110 }, { "epoch": 0.8133086876155268, "eval_loss": 0.9296000599861145, "eval_runtime": 14.6623, "eval_samples_per_second": 3.41, "eval_steps_per_second": 0.887, "step": 110 }, { "epoch": 0.8207024029574861, "grad_norm": 3.8196728229522705, "learning_rate": 3.69727047146402e-05, "loss": 1.4748249053955078, "step": 111 }, { "epoch": 0.8280961182994455, "grad_norm": 3.2699241638183594, "learning_rate": 3.684863523573201e-05, "loss": 1.1485276222229004, "step": 112 }, { "epoch": 0.8354898336414048, "grad_norm": 3.5778534412384033, "learning_rate": 3.6724565756823825e-05, "loss": 1.1845570802688599, "step": 113 }, { "epoch": 0.8428835489833642, "grad_norm": 3.3727245330810547, "learning_rate": 3.6600496277915635e-05, "loss": 0.8769504427909851, "step": 114 }, { "epoch": 0.8502772643253235, "grad_norm": 3.280014753341675, "learning_rate": 3.6476426799007446e-05, "loss": 1.2621396780014038, "step": 115 }, { "epoch": 0.8576709796672828, "grad_norm": 3.677361488342285, "learning_rate": 3.635235732009926e-05, "loss": 1.1793429851531982, "step": 116 }, { "epoch": 0.8650646950092421, "grad_norm": 2.788851261138916, "learning_rate": 3.622828784119107e-05, "loss": 1.0340873003005981, "step": 117 }, { "epoch": 0.8724584103512015, "grad_norm": 2.7919020652770996, "learning_rate": 3.6104218362282885e-05, "loss": 1.1847516298294067, "step": 118 }, { "epoch": 0.8798521256931608, "grad_norm": 1.7291911840438843, "learning_rate": 3.5980148883374695e-05, "loss": 0.8953083157539368, "step": 119 }, { "epoch": 0.8872458410351202, "grad_norm": 3.1404361724853516, "learning_rate": 3.5856079404466506e-05, "loss": 1.0396440029144287, "step": 120 }, { "epoch": 0.8872458410351202, "eval_loss": 0.9078614711761475, "eval_runtime": 14.7987, "eval_samples_per_second": 3.379, "eval_steps_per_second": 0.878, "step": 120 }, { "epoch": 0.8946395563770795, "grad_norm": 1.7119001150131226, "learning_rate": 3.573200992555831e-05, "loss": 0.7708945274353027, "step": 121 }, { "epoch": 0.9020332717190388, "grad_norm": 2.804116725921631, "learning_rate": 3.560794044665012e-05, "loss": 1.2879009246826172, "step": 122 }, { "epoch": 0.9094269870609981, "grad_norm": 3.6296403408050537, "learning_rate": 3.548387096774194e-05, "loss": 1.2780061960220337, "step": 123 }, { "epoch": 0.9168207024029574, "grad_norm": 4.171301364898682, "learning_rate": 3.535980148883375e-05, "loss": 1.2573845386505127, "step": 124 }, { "epoch": 0.9242144177449169, "grad_norm": 1.6946974992752075, "learning_rate": 3.523573200992556e-05, "loss": 1.5690746307373047, "step": 125 }, { "epoch": 0.9316081330868762, "grad_norm": 1.9035532474517822, "learning_rate": 3.511166253101737e-05, "loss": 0.6932345628738403, "step": 126 }, { "epoch": 0.9390018484288355, "grad_norm": 1.6593624353408813, "learning_rate": 3.498759305210919e-05, "loss": 0.5941351056098938, "step": 127 }, { "epoch": 0.9463955637707948, "grad_norm": 2.5471839904785156, "learning_rate": 3.4863523573201e-05, "loss": 0.4706844687461853, "step": 128 }, { "epoch": 0.9537892791127541, "grad_norm": 1.5462491512298584, "learning_rate": 3.473945409429281e-05, "loss": 1.3614616394042969, "step": 129 }, { "epoch": 0.9611829944547134, "grad_norm": 2.8795769214630127, "learning_rate": 3.461538461538462e-05, "loss": 1.2096058130264282, "step": 130 }, { "epoch": 0.9611829944547134, "eval_loss": 0.8965096473693848, "eval_runtime": 14.6807, "eval_samples_per_second": 3.406, "eval_steps_per_second": 0.886, "step": 130 }, { "epoch": 0.9685767097966729, "grad_norm": 1.1051534414291382, "learning_rate": 3.449131513647643e-05, "loss": 0.4035143256187439, "step": 131 }, { "epoch": 0.9759704251386322, "grad_norm": 3.4675469398498535, "learning_rate": 3.436724565756824e-05, "loss": 0.61115962266922, "step": 132 }, { "epoch": 0.9833641404805915, "grad_norm": 3.4992542266845703, "learning_rate": 3.424317617866005e-05, "loss": 1.0233020782470703, "step": 133 }, { "epoch": 0.9907578558225508, "grad_norm": 2.9477298259735107, "learning_rate": 3.411910669975186e-05, "loss": 1.1910691261291504, "step": 134 }, { "epoch": 0.9981515711645101, "grad_norm": 3.404331684112549, "learning_rate": 3.399503722084367e-05, "loss": 0.8914271593093872, "step": 135 }, { "epoch": 1.0, "grad_norm": 7.629513740539551, "learning_rate": 3.387096774193548e-05, "loss": 0.7269555330276489, "step": 136 }, { "epoch": 1.0073937153419594, "grad_norm": 3.7028565406799316, "learning_rate": 3.37468982630273e-05, "loss": 1.024603247642517, "step": 137 }, { "epoch": 1.0147874306839186, "grad_norm": 3.0595295429229736, "learning_rate": 3.362282878411911e-05, "loss": 1.0184353590011597, "step": 138 }, { "epoch": 1.022181146025878, "grad_norm": 1.5020614862442017, "learning_rate": 3.349875930521092e-05, "loss": 0.5547934770584106, "step": 139 }, { "epoch": 1.0295748613678373, "grad_norm": 2.5641324520111084, "learning_rate": 3.337468982630273e-05, "loss": 0.8376579284667969, "step": 140 }, { "epoch": 1.0295748613678373, "eval_loss": 0.8667128682136536, "eval_runtime": 14.7254, "eval_samples_per_second": 3.396, "eval_steps_per_second": 0.883, "step": 140 }, { "epoch": 1.0369685767097967, "grad_norm": 2.9328815937042236, "learning_rate": 3.325062034739454e-05, "loss": 0.6763349175453186, "step": 141 }, { "epoch": 1.044362292051756, "grad_norm": 2.459362506866455, "learning_rate": 3.312655086848635e-05, "loss": 0.9117762446403503, "step": 142 }, { "epoch": 1.0517560073937153, "grad_norm": 2.7116122245788574, "learning_rate": 3.300248138957816e-05, "loss": 0.5921486616134644, "step": 143 }, { "epoch": 1.0591497227356748, "grad_norm": 2.9720282554626465, "learning_rate": 3.2878411910669974e-05, "loss": 0.607153058052063, "step": 144 }, { "epoch": 1.066543438077634, "grad_norm": 2.249736785888672, "learning_rate": 3.2754342431761784e-05, "loss": 0.8126924633979797, "step": 145 }, { "epoch": 1.0739371534195934, "grad_norm": 2.706214427947998, "learning_rate": 3.26302729528536e-05, "loss": 0.6490439772605896, "step": 146 }, { "epoch": 1.0813308687615526, "grad_norm": 3.738187074661255, "learning_rate": 3.250620347394541e-05, "loss": 0.819773256778717, "step": 147 }, { "epoch": 1.088724584103512, "grad_norm": 3.121695041656494, "learning_rate": 3.238213399503722e-05, "loss": 0.6183997392654419, "step": 148 }, { "epoch": 1.0961182994454712, "grad_norm": 4.132612228393555, "learning_rate": 3.2258064516129034e-05, "loss": 0.767497181892395, "step": 149 }, { "epoch": 1.1035120147874307, "grad_norm": 2.0239458084106445, "learning_rate": 3.2133995037220844e-05, "loss": 1.0948212146759033, "step": 150 }, { "epoch": 1.1035120147874307, "eval_loss": 0.8530704975128174, "eval_runtime": 14.7071, "eval_samples_per_second": 3.4, "eval_steps_per_second": 0.884, "step": 150 }, { "epoch": 1.11090573012939, "grad_norm": 3.3580844402313232, "learning_rate": 3.200992555831266e-05, "loss": 0.5469967126846313, "step": 151 }, { "epoch": 1.1182994454713493, "grad_norm": 2.974302053451538, "learning_rate": 3.188585607940447e-05, "loss": 0.47518885135650635, "step": 152 }, { "epoch": 1.1256931608133087, "grad_norm": 3.033684492111206, "learning_rate": 3.176178660049628e-05, "loss": 0.7291224002838135, "step": 153 }, { "epoch": 1.133086876155268, "grad_norm": 3.733419418334961, "learning_rate": 3.1637717121588087e-05, "loss": 0.7658367156982422, "step": 154 }, { "epoch": 1.1404805914972274, "grad_norm": 3.2456040382385254, "learning_rate": 3.15136476426799e-05, "loss": 0.8450358510017395, "step": 155 }, { "epoch": 1.1478743068391868, "grad_norm": 3.432668924331665, "learning_rate": 3.1389578163771715e-05, "loss": 0.6418715715408325, "step": 156 }, { "epoch": 1.155268022181146, "grad_norm": 2.9463069438934326, "learning_rate": 3.1265508684863525e-05, "loss": 1.3750693798065186, "step": 157 }, { "epoch": 1.1626617375231054, "grad_norm": 3.7486484050750732, "learning_rate": 3.1141439205955336e-05, "loss": 0.7545527815818787, "step": 158 }, { "epoch": 1.1700554528650646, "grad_norm": 1.1400007009506226, "learning_rate": 3.1017369727047146e-05, "loss": 0.4953806400299072, "step": 159 }, { "epoch": 1.177449168207024, "grad_norm": 1.9228570461273193, "learning_rate": 3.089330024813896e-05, "loss": 0.5013564825057983, "step": 160 }, { "epoch": 1.177449168207024, "eval_loss": 0.8432470560073853, "eval_runtime": 14.7161, "eval_samples_per_second": 3.398, "eval_steps_per_second": 0.883, "step": 160 }, { "epoch": 1.1848428835489835, "grad_norm": 2.0466220378875732, "learning_rate": 3.0769230769230774e-05, "loss": 0.8158243298530579, "step": 161 }, { "epoch": 1.1922365988909427, "grad_norm": 3.307772636413574, "learning_rate": 3.0645161290322585e-05, "loss": 0.7138271927833557, "step": 162 }, { "epoch": 1.1996303142329021, "grad_norm": 1.4036277532577515, "learning_rate": 3.0521091811414396e-05, "loss": 0.391914963722229, "step": 163 }, { "epoch": 1.2070240295748613, "grad_norm": 4.2623610496521, "learning_rate": 3.0397022332506203e-05, "loss": 1.1953831911087036, "step": 164 }, { "epoch": 1.2144177449168208, "grad_norm": 1.5940158367156982, "learning_rate": 3.027295285359802e-05, "loss": 0.5775357484817505, "step": 165 }, { "epoch": 1.22181146025878, "grad_norm": 2.010906219482422, "learning_rate": 3.014888337468983e-05, "loss": 0.9656795859336853, "step": 166 }, { "epoch": 1.2292051756007394, "grad_norm": 3.457470178604126, "learning_rate": 3.0024813895781638e-05, "loss": 0.6407822966575623, "step": 167 }, { "epoch": 1.2365988909426986, "grad_norm": 3.8961503505706787, "learning_rate": 2.990074441687345e-05, "loss": 0.6025644540786743, "step": 168 }, { "epoch": 1.243992606284658, "grad_norm": 1.594923496246338, "learning_rate": 2.977667493796526e-05, "loss": 0.5624638199806213, "step": 169 }, { "epoch": 1.2513863216266174, "grad_norm": 1.737376093864441, "learning_rate": 2.9652605459057077e-05, "loss": 1.1991184949874878, "step": 170 }, { "epoch": 1.2513863216266174, "eval_loss": 0.8280792236328125, "eval_runtime": 14.5811, "eval_samples_per_second": 3.429, "eval_steps_per_second": 0.892, "step": 170 }, { "epoch": 1.2587800369685767, "grad_norm": 3.161806583404541, "learning_rate": 2.9528535980148887e-05, "loss": 0.5611181259155273, "step": 171 }, { "epoch": 1.266173752310536, "grad_norm": 3.9646661281585693, "learning_rate": 2.9404466501240698e-05, "loss": 0.9791576862335205, "step": 172 }, { "epoch": 1.2735674676524953, "grad_norm": 2.939876079559326, "learning_rate": 2.9280397022332505e-05, "loss": 0.6126688718795776, "step": 173 }, { "epoch": 1.2809611829944547, "grad_norm": 3.9292585849761963, "learning_rate": 2.9156327543424316e-05, "loss": 0.8683090209960938, "step": 174 }, { "epoch": 1.2883548983364141, "grad_norm": 1.8785326480865479, "learning_rate": 2.9032258064516133e-05, "loss": 0.46358799934387207, "step": 175 }, { "epoch": 1.2957486136783734, "grad_norm": 3.62471079826355, "learning_rate": 2.8908188585607944e-05, "loss": 0.764897346496582, "step": 176 }, { "epoch": 1.3031423290203328, "grad_norm": 3.8324623107910156, "learning_rate": 2.8784119106699754e-05, "loss": 0.6231205463409424, "step": 177 }, { "epoch": 1.310536044362292, "grad_norm": 2.560826539993286, "learning_rate": 2.8660049627791565e-05, "loss": 0.4221123456954956, "step": 178 }, { "epoch": 1.3179297597042514, "grad_norm": 4.285940647125244, "learning_rate": 2.8535980148883372e-05, "loss": 0.9465740919113159, "step": 179 }, { "epoch": 1.3253234750462108, "grad_norm": 1.7949848175048828, "learning_rate": 2.841191066997519e-05, "loss": 0.680899977684021, "step": 180 }, { "epoch": 1.3253234750462108, "eval_loss": 0.8194607496261597, "eval_runtime": 14.8751, "eval_samples_per_second": 3.361, "eval_steps_per_second": 0.874, "step": 180 }, { "epoch": 1.33271719038817, "grad_norm": 2.0182719230651855, "learning_rate": 2.8287841191067e-05, "loss": 0.613226592540741, "step": 181 }, { "epoch": 1.3401109057301293, "grad_norm": 4.6714887619018555, "learning_rate": 2.816377171215881e-05, "loss": 0.8670039176940918, "step": 182 }, { "epoch": 1.3475046210720887, "grad_norm": 4.056960582733154, "learning_rate": 2.803970223325062e-05, "loss": 0.7967749834060669, "step": 183 }, { "epoch": 1.354898336414048, "grad_norm": 4.206955909729004, "learning_rate": 2.7915632754342435e-05, "loss": 1.0874457359313965, "step": 184 }, { "epoch": 1.3622920517560073, "grad_norm": 3.817035436630249, "learning_rate": 2.7791563275434246e-05, "loss": 0.95674729347229, "step": 185 }, { "epoch": 1.3696857670979667, "grad_norm": 3.6514406204223633, "learning_rate": 2.7667493796526056e-05, "loss": 0.555774450302124, "step": 186 }, { "epoch": 1.377079482439926, "grad_norm": 3.7338063716888428, "learning_rate": 2.7543424317617867e-05, "loss": 0.5461658835411072, "step": 187 }, { "epoch": 1.3844731977818854, "grad_norm": 3.01973295211792, "learning_rate": 2.7419354838709678e-05, "loss": 0.9282134771347046, "step": 188 }, { "epoch": 1.3918669131238448, "grad_norm": 3.5295522212982178, "learning_rate": 2.729528535980149e-05, "loss": 0.8109346628189087, "step": 189 }, { "epoch": 1.399260628465804, "grad_norm": 3.73514461517334, "learning_rate": 2.7171215880893302e-05, "loss": 0.6853020787239075, "step": 190 }, { "epoch": 1.399260628465804, "eval_loss": 0.8215422630310059, "eval_runtime": 14.5513, "eval_samples_per_second": 3.436, "eval_steps_per_second": 0.893, "step": 190 }, { "epoch": 1.4066543438077634, "grad_norm": 2.7374188899993896, "learning_rate": 2.7047146401985113e-05, "loss": 1.0195677280426025, "step": 191 }, { "epoch": 1.4140480591497226, "grad_norm": 4.187663555145264, "learning_rate": 2.6923076923076923e-05, "loss": 1.0480753183364868, "step": 192 }, { "epoch": 1.421441774491682, "grad_norm": 3.276689052581787, "learning_rate": 2.6799007444168734e-05, "loss": 0.5181576013565063, "step": 193 }, { "epoch": 1.4288354898336415, "grad_norm": 3.5883798599243164, "learning_rate": 2.6674937965260548e-05, "loss": 0.7783234119415283, "step": 194 }, { "epoch": 1.4362292051756007, "grad_norm": 1.0365864038467407, "learning_rate": 2.655086848635236e-05, "loss": 0.7230033874511719, "step": 195 }, { "epoch": 1.4436229205175601, "grad_norm": 3.209699869155884, "learning_rate": 2.642679900744417e-05, "loss": 0.725004255771637, "step": 196 }, { "epoch": 1.4510166358595193, "grad_norm": 2.7974090576171875, "learning_rate": 2.630272952853598e-05, "loss": 0.8251001238822937, "step": 197 }, { "epoch": 1.4584103512014788, "grad_norm": 4.012574195861816, "learning_rate": 2.617866004962779e-05, "loss": 0.7500607371330261, "step": 198 }, { "epoch": 1.4658040665434382, "grad_norm": 3.2767927646636963, "learning_rate": 2.6054590570719604e-05, "loss": 0.5972156524658203, "step": 199 }, { "epoch": 1.4731977818853974, "grad_norm": 3.665105104446411, "learning_rate": 2.5930521091811415e-05, "loss": 0.42983272671699524, "step": 200 }, { "epoch": 1.4731977818853974, "eval_loss": 0.8120042681694031, "eval_runtime": 14.6672, "eval_samples_per_second": 3.409, "eval_steps_per_second": 0.886, "step": 200 }, { "epoch": 1.4805914972273566, "grad_norm": 4.322039604187012, "learning_rate": 2.5806451612903226e-05, "loss": 0.8239177465438843, "step": 201 }, { "epoch": 1.487985212569316, "grad_norm": 3.681670904159546, "learning_rate": 2.5682382133995036e-05, "loss": 0.46425601840019226, "step": 202 }, { "epoch": 1.4953789279112755, "grad_norm": 3.829942226409912, "learning_rate": 2.5558312655086853e-05, "loss": 0.5882385969161987, "step": 203 }, { "epoch": 1.502772643253235, "grad_norm": 3.8684608936309814, "learning_rate": 2.5434243176178664e-05, "loss": 0.8204436302185059, "step": 204 }, { "epoch": 1.510166358595194, "grad_norm": 4.183191776275635, "learning_rate": 2.531017369727047e-05, "loss": 1.1439590454101562, "step": 205 }, { "epoch": 1.5175600739371533, "grad_norm": 3.61912202835083, "learning_rate": 2.5186104218362282e-05, "loss": 0.7177018523216248, "step": 206 }, { "epoch": 1.5249537892791127, "grad_norm": 3.1439766883850098, "learning_rate": 2.5062034739454093e-05, "loss": 1.0978827476501465, "step": 207 }, { "epoch": 1.5323475046210722, "grad_norm": 1.9132380485534668, "learning_rate": 2.4937965260545906e-05, "loss": 0.6175467371940613, "step": 208 }, { "epoch": 1.5397412199630314, "grad_norm": 1.373880386352539, "learning_rate": 2.481389578163772e-05, "loss": 0.22940072417259216, "step": 209 }, { "epoch": 1.5471349353049908, "grad_norm": 3.687744379043579, "learning_rate": 2.468982630272953e-05, "loss": 0.3838157653808594, "step": 210 }, { "epoch": 1.5471349353049908, "eval_loss": 0.8064006567001343, "eval_runtime": 14.6872, "eval_samples_per_second": 3.404, "eval_steps_per_second": 0.885, "step": 210 }, { "epoch": 1.55452865064695, "grad_norm": 2.725609302520752, "learning_rate": 2.4565756823821338e-05, "loss": 0.3925488293170929, "step": 211 }, { "epoch": 1.5619223659889094, "grad_norm": 4.170878887176514, "learning_rate": 2.4441687344913152e-05, "loss": 0.9177101254463196, "step": 212 }, { "epoch": 1.5693160813308689, "grad_norm": 3.54719877243042, "learning_rate": 2.4317617866004963e-05, "loss": 0.3834892213344574, "step": 213 }, { "epoch": 1.576709796672828, "grad_norm": 3.7506401538848877, "learning_rate": 2.4193548387096777e-05, "loss": 0.782739520072937, "step": 214 }, { "epoch": 1.5841035120147873, "grad_norm": 1.567891240119934, "learning_rate": 2.4069478908188587e-05, "loss": 0.47440165281295776, "step": 215 }, { "epoch": 1.5914972273567467, "grad_norm": 4.019551753997803, "learning_rate": 2.3945409429280398e-05, "loss": 0.7724896669387817, "step": 216 }, { "epoch": 1.5988909426987061, "grad_norm": 3.265582323074341, "learning_rate": 2.382133995037221e-05, "loss": 0.585466742515564, "step": 217 }, { "epoch": 1.6062846580406656, "grad_norm": 3.6960299015045166, "learning_rate": 2.369727047146402e-05, "loss": 0.683808445930481, "step": 218 }, { "epoch": 1.6136783733826248, "grad_norm": 4.092567443847656, "learning_rate": 2.3573200992555833e-05, "loss": 0.8049482703208923, "step": 219 }, { "epoch": 1.621072088724584, "grad_norm": 3.318016290664673, "learning_rate": 2.3449131513647644e-05, "loss": 0.5561220645904541, "step": 220 }, { "epoch": 1.621072088724584, "eval_loss": 0.8024477362632751, "eval_runtime": 14.5996, "eval_samples_per_second": 3.425, "eval_steps_per_second": 0.89, "step": 220 }, { "epoch": 1.6284658040665434, "grad_norm": 5.157983779907227, "learning_rate": 2.3325062034739454e-05, "loss": 0.919698178768158, "step": 221 }, { "epoch": 1.6358595194085028, "grad_norm": 3.365602970123291, "learning_rate": 2.3200992555831265e-05, "loss": 0.7725900411605835, "step": 222 }, { "epoch": 1.6432532347504623, "grad_norm": 3.9181325435638428, "learning_rate": 2.307692307692308e-05, "loss": 0.535124659538269, "step": 223 }, { "epoch": 1.6506469500924215, "grad_norm": 3.7963433265686035, "learning_rate": 2.295285359801489e-05, "loss": 0.9627186059951782, "step": 224 }, { "epoch": 1.6580406654343807, "grad_norm": 3.6968164443969727, "learning_rate": 2.28287841191067e-05, "loss": 0.8556936979293823, "step": 225 }, { "epoch": 1.66543438077634, "grad_norm": 4.4114861488342285, "learning_rate": 2.2704714640198514e-05, "loss": 0.8419898748397827, "step": 226 }, { "epoch": 1.6728280961182995, "grad_norm": 3.3653135299682617, "learning_rate": 2.258064516129032e-05, "loss": 0.4375629127025604, "step": 227 }, { "epoch": 1.6802218114602587, "grad_norm": 2.5058343410491943, "learning_rate": 2.2456575682382135e-05, "loss": 0.5678821206092834, "step": 228 }, { "epoch": 1.6876155268022182, "grad_norm": 3.3000216484069824, "learning_rate": 2.2332506203473946e-05, "loss": 0.9510512948036194, "step": 229 }, { "epoch": 1.6950092421441774, "grad_norm": 4.843665599822998, "learning_rate": 2.2208436724565757e-05, "loss": 1.1221953630447388, "step": 230 }, { "epoch": 1.6950092421441774, "eval_loss": 0.7935811877250671, "eval_runtime": 14.7786, "eval_samples_per_second": 3.383, "eval_steps_per_second": 0.88, "step": 230 }, { "epoch": 1.7024029574861368, "grad_norm": 2.4911141395568848, "learning_rate": 2.208436724565757e-05, "loss": 1.419028878211975, "step": 231 }, { "epoch": 1.7097966728280962, "grad_norm": 1.9304749965667725, "learning_rate": 2.196029776674938e-05, "loss": 0.5840872526168823, "step": 232 }, { "epoch": 1.7171903881700554, "grad_norm": 1.9608324766159058, "learning_rate": 2.1836228287841192e-05, "loss": 1.2491809129714966, "step": 233 }, { "epoch": 1.7245841035120146, "grad_norm": 4.504591464996338, "learning_rate": 2.1712158808933002e-05, "loss": 0.7342857718467712, "step": 234 }, { "epoch": 1.731977818853974, "grad_norm": 3.7661826610565186, "learning_rate": 2.1588089330024816e-05, "loss": 0.5309323072433472, "step": 235 }, { "epoch": 1.7393715341959335, "grad_norm": 3.5521440505981445, "learning_rate": 2.1464019851116627e-05, "loss": 0.4989915192127228, "step": 236 }, { "epoch": 1.746765249537893, "grad_norm": 3.6262974739074707, "learning_rate": 2.1339950372208438e-05, "loss": 0.5839136242866516, "step": 237 }, { "epoch": 1.7541589648798521, "grad_norm": 3.896362543106079, "learning_rate": 2.1215880893300248e-05, "loss": 1.0018640756607056, "step": 238 }, { "epoch": 1.7615526802218113, "grad_norm": 3.742424249649048, "learning_rate": 2.109181141439206e-05, "loss": 0.5923015475273132, "step": 239 }, { "epoch": 1.7689463955637708, "grad_norm": 4.05252742767334, "learning_rate": 2.0967741935483873e-05, "loss": 1.1995235681533813, "step": 240 }, { "epoch": 1.7689463955637708, "eval_loss": 0.7851760983467102, "eval_runtime": 14.6763, "eval_samples_per_second": 3.407, "eval_steps_per_second": 0.886, "step": 240 }, { "epoch": 1.7763401109057302, "grad_norm": 3.0683846473693848, "learning_rate": 2.0843672456575683e-05, "loss": 0.923507809638977, "step": 241 }, { "epoch": 1.7837338262476896, "grad_norm": 4.6438374519348145, "learning_rate": 2.0719602977667497e-05, "loss": 0.8670483231544495, "step": 242 }, { "epoch": 1.7911275415896488, "grad_norm": 4.422187328338623, "learning_rate": 2.0595533498759305e-05, "loss": 0.7011516094207764, "step": 243 }, { "epoch": 1.798521256931608, "grad_norm": 4.1537675857543945, "learning_rate": 2.0471464019851115e-05, "loss": 1.2851660251617432, "step": 244 }, { "epoch": 1.8059149722735675, "grad_norm": 3.753478527069092, "learning_rate": 2.034739454094293e-05, "loss": 0.6607624292373657, "step": 245 }, { "epoch": 1.8133086876155269, "grad_norm": 3.5585222244262695, "learning_rate": 2.022332506203474e-05, "loss": 0.46847808361053467, "step": 246 }, { "epoch": 1.820702402957486, "grad_norm": 3.6007564067840576, "learning_rate": 2.0099255583126554e-05, "loss": 0.5693677663803101, "step": 247 }, { "epoch": 1.8280961182994455, "grad_norm": 3.056473970413208, "learning_rate": 1.9975186104218364e-05, "loss": 0.27784496545791626, "step": 248 }, { "epoch": 1.8354898336414047, "grad_norm": 3.8631675243377686, "learning_rate": 1.9851116625310175e-05, "loss": 0.6002547144889832, "step": 249 }, { "epoch": 1.8428835489833642, "grad_norm": 4.168581962585449, "learning_rate": 1.9727047146401986e-05, "loss": 1.1656219959259033, "step": 250 }, { "epoch": 1.8428835489833642, "eval_loss": 0.7865164279937744, "eval_runtime": 14.7045, "eval_samples_per_second": 3.4, "eval_steps_per_second": 0.884, "step": 250 }, { "epoch": 1.8502772643253236, "grad_norm": 3.506394386291504, "learning_rate": 1.9602977667493796e-05, "loss": 0.759330153465271, "step": 251 }, { "epoch": 1.8576709796672828, "grad_norm": 4.319957256317139, "learning_rate": 1.947890818858561e-05, "loss": 0.9550069570541382, "step": 252 }, { "epoch": 1.865064695009242, "grad_norm": 4.66499662399292, "learning_rate": 1.935483870967742e-05, "loss": 0.7672110199928284, "step": 253 }, { "epoch": 1.8724584103512014, "grad_norm": 3.980341672897339, "learning_rate": 1.923076923076923e-05, "loss": 1.0426957607269287, "step": 254 }, { "epoch": 1.8798521256931608, "grad_norm": 2.3597588539123535, "learning_rate": 1.9106699751861042e-05, "loss": 0.5822687745094299, "step": 255 }, { "epoch": 1.8872458410351203, "grad_norm": 3.7864487171173096, "learning_rate": 1.8982630272952853e-05, "loss": 0.6077347993850708, "step": 256 }, { "epoch": 1.8946395563770795, "grad_norm": 2.9949333667755127, "learning_rate": 1.8858560794044667e-05, "loss": 0.5098516345024109, "step": 257 }, { "epoch": 1.9020332717190387, "grad_norm": 1.3919459581375122, "learning_rate": 1.8734491315136477e-05, "loss": 0.40490952134132385, "step": 258 }, { "epoch": 1.9094269870609981, "grad_norm": 3.4704983234405518, "learning_rate": 1.8610421836228288e-05, "loss": 0.4017954468727112, "step": 259 }, { "epoch": 1.9168207024029575, "grad_norm": 3.2767493724823, "learning_rate": 1.84863523573201e-05, "loss": 0.4063960611820221, "step": 260 }, { "epoch": 1.9168207024029575, "eval_loss": 0.7780888080596924, "eval_runtime": 14.5949, "eval_samples_per_second": 3.426, "eval_steps_per_second": 0.891, "step": 260 }, { "epoch": 1.924214417744917, "grad_norm": 3.6285297870635986, "learning_rate": 1.8362282878411912e-05, "loss": 0.6483629941940308, "step": 261 }, { "epoch": 1.9316081330868762, "grad_norm": 3.957628011703491, "learning_rate": 1.8238213399503723e-05, "loss": 0.6059281826019287, "step": 262 }, { "epoch": 1.9390018484288354, "grad_norm": 3.794084072113037, "learning_rate": 1.8114143920595534e-05, "loss": 1.0474138259887695, "step": 263 }, { "epoch": 1.9463955637707948, "grad_norm": 4.161247253417969, "learning_rate": 1.7990074441687348e-05, "loss": 0.7336093187332153, "step": 264 }, { "epoch": 1.9537892791127542, "grad_norm": 2.166621446609497, "learning_rate": 1.7866004962779155e-05, "loss": 0.9245311617851257, "step": 265 }, { "epoch": 1.9611829944547134, "grad_norm": 1.8056215047836304, "learning_rate": 1.774193548387097e-05, "loss": 0.4297409653663635, "step": 266 }, { "epoch": 1.9685767097966729, "grad_norm": 2.4709436893463135, "learning_rate": 1.761786600496278e-05, "loss": 0.6437153220176697, "step": 267 }, { "epoch": 1.975970425138632, "grad_norm": 4.184484481811523, "learning_rate": 1.7493796526054593e-05, "loss": 0.6798198223114014, "step": 268 }, { "epoch": 1.9833641404805915, "grad_norm": 3.1639716625213623, "learning_rate": 1.7369727047146404e-05, "loss": 0.44798582792282104, "step": 269 }, { "epoch": 1.990757855822551, "grad_norm": 4.66642951965332, "learning_rate": 1.7245657568238215e-05, "loss": 0.7636345028877258, "step": 270 }, { "epoch": 1.990757855822551, "eval_loss": 0.7736530900001526, "eval_runtime": 14.6752, "eval_samples_per_second": 3.407, "eval_steps_per_second": 0.886, "step": 270 }, { "epoch": 1.9981515711645101, "grad_norm": 4.238684177398682, "learning_rate": 1.7121588089330025e-05, "loss": 0.6888635158538818, "step": 271 }, { "epoch": 2.0, "grad_norm": 6.728516101837158, "learning_rate": 1.6997518610421836e-05, "loss": 0.7793468832969666, "step": 272 }, { "epoch": 2.0073937153419594, "grad_norm": 1.4594340324401855, "learning_rate": 1.687344913151365e-05, "loss": 0.4310983717441559, "step": 273 }, { "epoch": 2.014787430683919, "grad_norm": 1.4875929355621338, "learning_rate": 1.674937965260546e-05, "loss": 0.8607257604598999, "step": 274 }, { "epoch": 2.022181146025878, "grad_norm": 2.3744559288024902, "learning_rate": 1.662531017369727e-05, "loss": 0.5578240156173706, "step": 275 }, { "epoch": 2.0295748613678373, "grad_norm": 3.0702226161956787, "learning_rate": 1.650124069478908e-05, "loss": 0.6157624125480652, "step": 276 }, { "epoch": 2.0369685767097967, "grad_norm": 3.3733112812042236, "learning_rate": 1.6377171215880892e-05, "loss": 0.37903928756713867, "step": 277 }, { "epoch": 2.044362292051756, "grad_norm": 1.7422901391983032, "learning_rate": 1.6253101736972706e-05, "loss": 0.46220725774765015, "step": 278 }, { "epoch": 2.0517560073937156, "grad_norm": 2.0484213829040527, "learning_rate": 1.6129032258064517e-05, "loss": 0.7493972182273865, "step": 279 }, { "epoch": 2.0591497227356745, "grad_norm": 2.9543616771698, "learning_rate": 1.600496277915633e-05, "loss": 0.4740079641342163, "step": 280 }, { "epoch": 2.0591497227356745, "eval_loss": 0.774247407913208, "eval_runtime": 14.7788, "eval_samples_per_second": 3.383, "eval_steps_per_second": 0.88, "step": 280 }, { "epoch": 2.066543438077634, "grad_norm": 4.02524995803833, "learning_rate": 1.588089330024814e-05, "loss": 0.4648398756980896, "step": 281 }, { "epoch": 2.0739371534195934, "grad_norm": 3.726748466491699, "learning_rate": 1.575682382133995e-05, "loss": 0.4465940296649933, "step": 282 }, { "epoch": 2.081330868761553, "grad_norm": 3.6973981857299805, "learning_rate": 1.5632754342431763e-05, "loss": 1.1393554210662842, "step": 283 }, { "epoch": 2.088724584103512, "grad_norm": 2.837871789932251, "learning_rate": 1.5508684863523573e-05, "loss": 0.6313468217849731, "step": 284 }, { "epoch": 2.0961182994454712, "grad_norm": 2.803872585296631, "learning_rate": 1.5384615384615387e-05, "loss": 0.42370834946632385, "step": 285 }, { "epoch": 2.1035120147874307, "grad_norm": 2.8776919841766357, "learning_rate": 1.5260545905707198e-05, "loss": 0.5538661479949951, "step": 286 }, { "epoch": 2.11090573012939, "grad_norm": 3.7334094047546387, "learning_rate": 1.513647642679901e-05, "loss": 0.5879999399185181, "step": 287 }, { "epoch": 2.1182994454713495, "grad_norm": 1.8186419010162354, "learning_rate": 1.5012406947890819e-05, "loss": 1.026726484298706, "step": 288 }, { "epoch": 2.1256931608133085, "grad_norm": 3.8631510734558105, "learning_rate": 1.488833746898263e-05, "loss": 0.6525065302848816, "step": 289 }, { "epoch": 2.133086876155268, "grad_norm": 3.008190155029297, "learning_rate": 1.4764267990074444e-05, "loss": 0.6006858944892883, "step": 290 }, { "epoch": 2.133086876155268, "eval_loss": 0.7701458930969238, "eval_runtime": 14.5805, "eval_samples_per_second": 3.429, "eval_steps_per_second": 0.892, "step": 290 }, { "epoch": 2.1404805914972274, "grad_norm": 3.7055914402008057, "learning_rate": 1.4640198511166252e-05, "loss": 0.5744045376777649, "step": 291 }, { "epoch": 2.147874306839187, "grad_norm": 3.3834142684936523, "learning_rate": 1.4516129032258066e-05, "loss": 0.5752605199813843, "step": 292 }, { "epoch": 2.155268022181146, "grad_norm": 2.1001501083374023, "learning_rate": 1.4392059553349877e-05, "loss": 0.3292985260486603, "step": 293 }, { "epoch": 2.162661737523105, "grad_norm": 2.7614121437072754, "learning_rate": 1.4267990074441686e-05, "loss": 0.4825969934463501, "step": 294 }, { "epoch": 2.1700554528650646, "grad_norm": 1.8585422039031982, "learning_rate": 1.41439205955335e-05, "loss": 0.3931984007358551, "step": 295 }, { "epoch": 2.177449168207024, "grad_norm": 3.197474479675293, "learning_rate": 1.401985111662531e-05, "loss": 0.4858049154281616, "step": 296 }, { "epoch": 2.1848428835489835, "grad_norm": 3.774609327316284, "learning_rate": 1.3895781637717123e-05, "loss": 0.5701273083686829, "step": 297 }, { "epoch": 2.1922365988909425, "grad_norm": 3.7056381702423096, "learning_rate": 1.3771712158808933e-05, "loss": 0.35671544075012207, "step": 298 }, { "epoch": 2.199630314232902, "grad_norm": 3.762648344039917, "learning_rate": 1.3647642679900746e-05, "loss": 0.38978254795074463, "step": 299 }, { "epoch": 2.2070240295748613, "grad_norm": 2.4346160888671875, "learning_rate": 1.3523573200992556e-05, "loss": 0.3817184865474701, "step": 300 }, { "epoch": 2.2070240295748613, "eval_loss": 0.771511971950531, "eval_runtime": 14.7091, "eval_samples_per_second": 3.399, "eval_steps_per_second": 0.884, "step": 300 }, { "epoch": 2.2144177449168208, "grad_norm": 3.8731868267059326, "learning_rate": 1.3399503722084367e-05, "loss": 0.49884963035583496, "step": 301 }, { "epoch": 2.22181146025878, "grad_norm": 2.4828414916992188, "learning_rate": 1.327543424317618e-05, "loss": 0.15124742686748505, "step": 302 }, { "epoch": 2.229205175600739, "grad_norm": 4.272462368011475, "learning_rate": 1.315136476426799e-05, "loss": 0.47460150718688965, "step": 303 }, { "epoch": 2.2365988909426986, "grad_norm": 4.066652774810791, "learning_rate": 1.3027295285359802e-05, "loss": 0.6313046813011169, "step": 304 }, { "epoch": 2.243992606284658, "grad_norm": 3.1820685863494873, "learning_rate": 1.2903225806451613e-05, "loss": 0.39370083808898926, "step": 305 }, { "epoch": 2.2513863216266174, "grad_norm": 3.9971110820770264, "learning_rate": 1.2779156327543427e-05, "loss": 0.5994598865509033, "step": 306 }, { "epoch": 2.258780036968577, "grad_norm": 0.996334969997406, "learning_rate": 1.2655086848635236e-05, "loss": 0.32513830065727234, "step": 307 }, { "epoch": 2.266173752310536, "grad_norm": 4.294183254241943, "learning_rate": 1.2531017369727046e-05, "loss": 0.6398261785507202, "step": 308 }, { "epoch": 2.2735674676524953, "grad_norm": 3.178579092025757, "learning_rate": 1.240694789081886e-05, "loss": 0.3428504467010498, "step": 309 }, { "epoch": 2.2809611829944547, "grad_norm": 2.2119312286376953, "learning_rate": 1.2282878411910669e-05, "loss": 0.46374407410621643, "step": 310 }, { "epoch": 2.2809611829944547, "eval_loss": 0.7703814506530762, "eval_runtime": 14.7466, "eval_samples_per_second": 3.391, "eval_steps_per_second": 0.882, "step": 310 }, { "epoch": 2.288354898336414, "grad_norm": 3.7887892723083496, "learning_rate": 1.2158808933002481e-05, "loss": 0.5297147035598755, "step": 311 }, { "epoch": 2.2957486136783736, "grad_norm": 1.7170554399490356, "learning_rate": 1.2034739454094294e-05, "loss": 0.32796400785446167, "step": 312 }, { "epoch": 2.3031423290203326, "grad_norm": 1.6616400480270386, "learning_rate": 1.1910669975186104e-05, "loss": 0.4169609546661377, "step": 313 }, { "epoch": 2.310536044362292, "grad_norm": 4.250360012054443, "learning_rate": 1.1786600496277917e-05, "loss": 0.5692564845085144, "step": 314 }, { "epoch": 2.3179297597042514, "grad_norm": 3.9190673828125, "learning_rate": 1.1662531017369727e-05, "loss": 0.2902570962905884, "step": 315 }, { "epoch": 2.325323475046211, "grad_norm": 3.265540599822998, "learning_rate": 1.153846153846154e-05, "loss": 0.22921332716941833, "step": 316 }, { "epoch": 2.33271719038817, "grad_norm": 3.34489369392395, "learning_rate": 1.141439205955335e-05, "loss": 0.3899090886116028, "step": 317 }, { "epoch": 2.3401109057301293, "grad_norm": 2.0498178005218506, "learning_rate": 1.129032258064516e-05, "loss": 0.45650577545166016, "step": 318 }, { "epoch": 2.3475046210720887, "grad_norm": 4.382551670074463, "learning_rate": 1.1166253101736973e-05, "loss": 0.6734753847122192, "step": 319 }, { "epoch": 2.354898336414048, "grad_norm": 4.091598987579346, "learning_rate": 1.1042183622828785e-05, "loss": 0.608093798160553, "step": 320 }, { "epoch": 2.354898336414048, "eval_loss": 0.7693940997123718, "eval_runtime": 14.6834, "eval_samples_per_second": 3.405, "eval_steps_per_second": 0.885, "step": 320 }, { "epoch": 2.3622920517560075, "grad_norm": 4.082503318786621, "learning_rate": 1.0918114143920596e-05, "loss": 0.43649721145629883, "step": 321 }, { "epoch": 2.369685767097967, "grad_norm": 3.7380568981170654, "learning_rate": 1.0794044665012408e-05, "loss": 0.4303453862667084, "step": 322 }, { "epoch": 2.377079482439926, "grad_norm": 3.448054313659668, "learning_rate": 1.0669975186104219e-05, "loss": 0.9947173595428467, "step": 323 }, { "epoch": 2.3844731977818854, "grad_norm": 3.79837703704834, "learning_rate": 1.054590570719603e-05, "loss": 0.4145554304122925, "step": 324 }, { "epoch": 2.391866913123845, "grad_norm": 3.390570640563965, "learning_rate": 1.0421836228287842e-05, "loss": 1.0003561973571777, "step": 325 }, { "epoch": 2.3992606284658042, "grad_norm": 4.022547245025635, "learning_rate": 1.0297766749379652e-05, "loss": 0.37200576066970825, "step": 326 }, { "epoch": 2.406654343807763, "grad_norm": 3.9541947841644287, "learning_rate": 1.0173697270471465e-05, "loss": 0.617558479309082, "step": 327 }, { "epoch": 2.4140480591497226, "grad_norm": 2.225595235824585, "learning_rate": 1.0049627791563277e-05, "loss": 0.4966333508491516, "step": 328 }, { "epoch": 2.421441774491682, "grad_norm": 4.891867637634277, "learning_rate": 9.925558312655088e-06, "loss": 0.44887012243270874, "step": 329 }, { "epoch": 2.4288354898336415, "grad_norm": 1.9620754718780518, "learning_rate": 9.801488833746898e-06, "loss": 0.27701541781425476, "step": 330 }, { "epoch": 2.4288354898336415, "eval_loss": 0.768280029296875, "eval_runtime": 14.6898, "eval_samples_per_second": 3.404, "eval_steps_per_second": 0.885, "step": 330 }, { "epoch": 2.436229205175601, "grad_norm": 4.712418079376221, "learning_rate": 9.67741935483871e-06, "loss": 0.6389679908752441, "step": 331 }, { "epoch": 2.44362292051756, "grad_norm": 1.852449893951416, "learning_rate": 9.553349875930521e-06, "loss": 1.1038583517074585, "step": 332 }, { "epoch": 2.4510166358595193, "grad_norm": 4.138819694519043, "learning_rate": 9.429280397022333e-06, "loss": 0.43939751386642456, "step": 333 }, { "epoch": 2.4584103512014788, "grad_norm": 2.835935354232788, "learning_rate": 9.305210918114144e-06, "loss": 0.41257309913635254, "step": 334 }, { "epoch": 2.465804066543438, "grad_norm": 2.160979986190796, "learning_rate": 9.181141439205956e-06, "loss": 0.39569902420043945, "step": 335 }, { "epoch": 2.473197781885397, "grad_norm": 3.6228151321411133, "learning_rate": 9.057071960297767e-06, "loss": 0.5179893970489502, "step": 336 }, { "epoch": 2.4805914972273566, "grad_norm": 3.591714382171631, "learning_rate": 8.933002481389577e-06, "loss": 0.4214794933795929, "step": 337 }, { "epoch": 2.487985212569316, "grad_norm": 3.018785238265991, "learning_rate": 8.80893300248139e-06, "loss": 0.5895953178405762, "step": 338 }, { "epoch": 2.4953789279112755, "grad_norm": 3.907846689224243, "learning_rate": 8.684863523573202e-06, "loss": 0.5587291717529297, "step": 339 }, { "epoch": 2.502772643253235, "grad_norm": 3.9467413425445557, "learning_rate": 8.560794044665013e-06, "loss": 0.4495808482170105, "step": 340 }, { "epoch": 2.502772643253235, "eval_loss": 0.7679100036621094, "eval_runtime": 14.7533, "eval_samples_per_second": 3.389, "eval_steps_per_second": 0.881, "step": 340 }, { "epoch": 2.5101663585951943, "grad_norm": 3.962733507156372, "learning_rate": 8.436724565756825e-06, "loss": 0.3088897466659546, "step": 341 }, { "epoch": 2.5175600739371533, "grad_norm": 4.829586505889893, "learning_rate": 8.312655086848635e-06, "loss": 0.4583315849304199, "step": 342 }, { "epoch": 2.5249537892791127, "grad_norm": 2.465217113494873, "learning_rate": 8.188585607940446e-06, "loss": 0.5734530687332153, "step": 343 }, { "epoch": 2.532347504621072, "grad_norm": 1.578626275062561, "learning_rate": 8.064516129032258e-06, "loss": 0.29778629541397095, "step": 344 }, { "epoch": 2.539741219963031, "grad_norm": 3.794196605682373, "learning_rate": 7.94044665012407e-06, "loss": 0.514739990234375, "step": 345 }, { "epoch": 2.5471349353049906, "grad_norm": 4.320169448852539, "learning_rate": 7.816377171215881e-06, "loss": 0.36768847703933716, "step": 346 }, { "epoch": 2.55452865064695, "grad_norm": 3.7134804725646973, "learning_rate": 7.692307692307694e-06, "loss": 0.32225626707077026, "step": 347 }, { "epoch": 2.5619223659889094, "grad_norm": 3.2205772399902344, "learning_rate": 7.568238213399505e-06, "loss": 0.45840057730674744, "step": 348 }, { "epoch": 2.569316081330869, "grad_norm": 5.132753372192383, "learning_rate": 7.444168734491315e-06, "loss": 0.6190608739852905, "step": 349 }, { "epoch": 2.5767097966728283, "grad_norm": 2.7665748596191406, "learning_rate": 7.320099255583126e-06, "loss": 0.2809644937515259, "step": 350 }, { "epoch": 2.5767097966728283, "eval_loss": 0.7658350467681885, "eval_runtime": 14.6579, "eval_samples_per_second": 3.411, "eval_steps_per_second": 0.887, "step": 350 }, { "epoch": 2.5841035120147873, "grad_norm": 4.205397605895996, "learning_rate": 7.1960297766749385e-06, "loss": 0.30544620752334595, "step": 351 }, { "epoch": 2.5914972273567467, "grad_norm": 2.3894495964050293, "learning_rate": 7.07196029776675e-06, "loss": 0.310545414686203, "step": 352 }, { "epoch": 2.598890942698706, "grad_norm": 3.995877981185913, "learning_rate": 6.9478908188585614e-06, "loss": 0.5483052730560303, "step": 353 }, { "epoch": 2.6062846580406656, "grad_norm": 3.834993362426758, "learning_rate": 6.823821339950373e-06, "loss": 0.8772858381271362, "step": 354 }, { "epoch": 2.6136783733826245, "grad_norm": 4.7651777267456055, "learning_rate": 6.6997518610421835e-06, "loss": 0.4968230128288269, "step": 355 }, { "epoch": 2.621072088724584, "grad_norm": 4.165541648864746, "learning_rate": 6.575682382133995e-06, "loss": 0.5299187898635864, "step": 356 }, { "epoch": 2.6284658040665434, "grad_norm": 5.075289726257324, "learning_rate": 6.451612903225806e-06, "loss": 0.4870533049106598, "step": 357 }, { "epoch": 2.635859519408503, "grad_norm": 4.575265884399414, "learning_rate": 6.327543424317618e-06, "loss": 0.8198877573013306, "step": 358 }, { "epoch": 2.6432532347504623, "grad_norm": 4.340782165527344, "learning_rate": 6.20347394540943e-06, "loss": 0.3996822237968445, "step": 359 }, { "epoch": 2.6506469500924217, "grad_norm": 4.009160995483398, "learning_rate": 6.079404466501241e-06, "loss": 0.40964275598526, "step": 360 }, { "epoch": 2.6506469500924217, "eval_loss": 0.7657684087753296, "eval_runtime": 14.717, "eval_samples_per_second": 3.397, "eval_steps_per_second": 0.883, "step": 360 }, { "epoch": 2.6580406654343807, "grad_norm": 3.997911214828491, "learning_rate": 5.955334987593052e-06, "loss": 0.3987128734588623, "step": 361 }, { "epoch": 2.66543438077634, "grad_norm": 3.6921792030334473, "learning_rate": 5.831265508684864e-06, "loss": 0.4136401116847992, "step": 362 }, { "epoch": 2.6728280961182995, "grad_norm": 4.61245059967041, "learning_rate": 5.707196029776675e-06, "loss": 0.4332594573497772, "step": 363 }, { "epoch": 2.6802218114602585, "grad_norm": 3.801255702972412, "learning_rate": 5.5831265508684865e-06, "loss": 0.4616243243217468, "step": 364 }, { "epoch": 2.687615526802218, "grad_norm": 3.358360767364502, "learning_rate": 5.459057071960298e-06, "loss": 0.29757314920425415, "step": 365 }, { "epoch": 2.6950092421441774, "grad_norm": 3.087639331817627, "learning_rate": 5.334987593052109e-06, "loss": 0.32710200548171997, "step": 366 }, { "epoch": 2.702402957486137, "grad_norm": 4.153397083282471, "learning_rate": 5.210918114143921e-06, "loss": 0.3512117564678192, "step": 367 }, { "epoch": 2.709796672828096, "grad_norm": 4.165513038635254, "learning_rate": 5.086848635235732e-06, "loss": 0.8789117932319641, "step": 368 }, { "epoch": 2.7171903881700556, "grad_norm": 4.394218921661377, "learning_rate": 4.962779156327544e-06, "loss": 0.5227751135826111, "step": 369 }, { "epoch": 2.7245841035120146, "grad_norm": 4.3006110191345215, "learning_rate": 4.838709677419355e-06, "loss": 0.6214644312858582, "step": 370 }, { "epoch": 2.7245841035120146, "eval_loss": 0.7669808268547058, "eval_runtime": 14.7732, "eval_samples_per_second": 3.385, "eval_steps_per_second": 0.88, "step": 370 }, { "epoch": 2.731977818853974, "grad_norm": 4.888645172119141, "learning_rate": 4.714640198511167e-06, "loss": 0.8665144443511963, "step": 371 }, { "epoch": 2.7393715341959335, "grad_norm": 3.778118371963501, "learning_rate": 4.590570719602978e-06, "loss": 0.33991459012031555, "step": 372 }, { "epoch": 2.746765249537893, "grad_norm": 2.7993180751800537, "learning_rate": 4.466501240694789e-06, "loss": 0.6993688344955444, "step": 373 }, { "epoch": 2.754158964879852, "grad_norm": 4.365177154541016, "learning_rate": 4.342431761786601e-06, "loss": 0.3615218997001648, "step": 374 }, { "epoch": 2.7615526802218113, "grad_norm": 3.846773862838745, "learning_rate": 4.2183622828784124e-06, "loss": 0.39533162117004395, "step": 375 }, { "epoch": 2.7689463955637708, "grad_norm": 4.7195725440979, "learning_rate": 4.094292803970223e-06, "loss": 0.7132782340049744, "step": 376 }, { "epoch": 2.77634011090573, "grad_norm": 5.103621482849121, "learning_rate": 3.970223325062035e-06, "loss": 0.7199317812919617, "step": 377 }, { "epoch": 2.7837338262476896, "grad_norm": 1.6189250946044922, "learning_rate": 3.846153846153847e-06, "loss": 0.6657246947288513, "step": 378 }, { "epoch": 2.791127541589649, "grad_norm": 1.8573932647705078, "learning_rate": 3.7220843672456574e-06, "loss": 0.5098580718040466, "step": 379 }, { "epoch": 2.798521256931608, "grad_norm": 4.506024360656738, "learning_rate": 3.5980148883374693e-06, "loss": 0.6152743697166443, "step": 380 }, { "epoch": 2.798521256931608, "eval_loss": 0.7685391306877136, "eval_runtime": 14.6745, "eval_samples_per_second": 3.407, "eval_steps_per_second": 0.886, "step": 380 }, { "epoch": 2.8059149722735675, "grad_norm": 3.2825143337249756, "learning_rate": 3.4739454094292807e-06, "loss": 0.44237416982650757, "step": 381 }, { "epoch": 2.813308687615527, "grad_norm": 4.352462291717529, "learning_rate": 3.3498759305210917e-06, "loss": 0.6616033315658569, "step": 382 }, { "epoch": 2.820702402957486, "grad_norm": 2.646233081817627, "learning_rate": 3.225806451612903e-06, "loss": 1.343247890472412, "step": 383 }, { "epoch": 2.8280961182994453, "grad_norm": 4.7132368087768555, "learning_rate": 3.101736972704715e-06, "loss": 0.5540533661842346, "step": 384 }, { "epoch": 2.8354898336414047, "grad_norm": 4.393060684204102, "learning_rate": 2.977667493796526e-06, "loss": 0.3722197711467743, "step": 385 }, { "epoch": 2.842883548983364, "grad_norm": 3.9295449256896973, "learning_rate": 2.8535980148883375e-06, "loss": 0.4926016926765442, "step": 386 }, { "epoch": 2.8502772643253236, "grad_norm": 4.140054225921631, "learning_rate": 2.729528535980149e-06, "loss": 0.671159565448761, "step": 387 }, { "epoch": 2.857670979667283, "grad_norm": 1.8080183267593384, "learning_rate": 2.6054590570719604e-06, "loss": 0.30225613713264465, "step": 388 }, { "epoch": 2.865064695009242, "grad_norm": 3.795689582824707, "learning_rate": 2.481389578163772e-06, "loss": 0.30790403485298157, "step": 389 }, { "epoch": 2.8724584103512014, "grad_norm": 3.827852725982666, "learning_rate": 2.3573200992555833e-06, "loss": 0.38701093196868896, "step": 390 }, { "epoch": 2.8724584103512014, "eval_loss": 0.7680988907814026, "eval_runtime": 14.7048, "eval_samples_per_second": 3.4, "eval_steps_per_second": 0.884, "step": 390 }, { "epoch": 2.879852125693161, "grad_norm": 4.782068729400635, "learning_rate": 2.2332506203473944e-06, "loss": 0.3287886083126068, "step": 391 }, { "epoch": 2.8872458410351203, "grad_norm": 3.9645960330963135, "learning_rate": 2.1091811414392062e-06, "loss": 0.3570128381252289, "step": 392 }, { "epoch": 2.8946395563770793, "grad_norm": 1.9487789869308472, "learning_rate": 1.9851116625310177e-06, "loss": 0.36440327763557434, "step": 393 }, { "epoch": 2.9020332717190387, "grad_norm": 4.191056728363037, "learning_rate": 1.8610421836228287e-06, "loss": 0.4157246947288513, "step": 394 }, { "epoch": 2.909426987060998, "grad_norm": 3.8392462730407715, "learning_rate": 1.7369727047146404e-06, "loss": 0.4623328447341919, "step": 395 }, { "epoch": 2.9168207024029575, "grad_norm": 5.019207000732422, "learning_rate": 1.6129032258064516e-06, "loss": 0.8991196155548096, "step": 396 }, { "epoch": 2.924214417744917, "grad_norm": 4.490087509155273, "learning_rate": 1.488833746898263e-06, "loss": 0.548180103302002, "step": 397 }, { "epoch": 2.9316081330868764, "grad_norm": 5.643899440765381, "learning_rate": 1.3647642679900745e-06, "loss": 0.7324087619781494, "step": 398 }, { "epoch": 2.9390018484288354, "grad_norm": 4.432566165924072, "learning_rate": 1.240694789081886e-06, "loss": 0.32455164194107056, "step": 399 }, { "epoch": 2.946395563770795, "grad_norm": 4.33750581741333, "learning_rate": 1.1166253101736972e-06, "loss": 0.4725751280784607, "step": 400 }, { "epoch": 2.946395563770795, "eval_loss": 0.7677021622657776, "eval_runtime": 14.6144, "eval_samples_per_second": 3.421, "eval_steps_per_second": 0.89, "step": 400 } ], "logging_steps": 1, "max_steps": 408, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 10, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.2864504986317824e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }