MathDeepSeek / last-checkpoint /trainer_state.json
anhdai312's picture
Training in progress, step 400, checkpoint
92c3535 verified
Raw
History Blame Contribute Delete
83 kB
{
"best_global_step": 360,
"best_metric": 0.7657684087753296,
"best_model_checkpoint": "/tmp/checkpoints_/job_bf4d9449-335c-4598-aae6-39588820e13b/checkpoint-360",
"epoch": 2.946395563770795,
"eval_steps": 10,
"global_step": 400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0073937153419593345,
"grad_norm": 1.8413621187210083,
"learning_rate": 0.0,
"loss": 3.3830344676971436,
"step": 1
},
{
"epoch": 0.014787430683918669,
"grad_norm": 2.0386335849761963,
"learning_rate": 1e-05,
"loss": 3.3935506343841553,
"step": 2
},
{
"epoch": 0.022181146025878003,
"grad_norm": 1.3186163902282715,
"learning_rate": 2e-05,
"loss": 2.732372999191284,
"step": 3
},
{
"epoch": 0.029574861367837338,
"grad_norm": 0.8585255146026611,
"learning_rate": 3e-05,
"loss": 1.7911560535430908,
"step": 4
},
{
"epoch": 0.036968576709796676,
"grad_norm": 2.3140437602996826,
"learning_rate": 4e-05,
"loss": 3.907397508621216,
"step": 5
},
{
"epoch": 0.04436229205175601,
"grad_norm": 1.8938422203063965,
"learning_rate": 5e-05,
"loss": 3.279386281967163,
"step": 6
},
{
"epoch": 0.051756007393715345,
"grad_norm": 1.4730970859527588,
"learning_rate": 4.987593052109181e-05,
"loss": 2.3899412155151367,
"step": 7
},
{
"epoch": 0.059149722735674676,
"grad_norm": 2.0717520713806152,
"learning_rate": 4.9751861042183624e-05,
"loss": 2.698546886444092,
"step": 8
},
{
"epoch": 0.066543438077634,
"grad_norm": 2.2532644271850586,
"learning_rate": 4.962779156327544e-05,
"loss": 2.6992990970611572,
"step": 9
},
{
"epoch": 0.07393715341959335,
"grad_norm": 0.9512649178504944,
"learning_rate": 4.950372208436725e-05,
"loss": 1.5360665321350098,
"step": 10
},
{
"epoch": 0.07393715341959335,
"eval_loss": 2.1426639556884766,
"eval_runtime": 15.4966,
"eval_samples_per_second": 3.227,
"eval_steps_per_second": 0.839,
"step": 10
},
{
"epoch": 0.08133086876155268,
"grad_norm": 2.03887939453125,
"learning_rate": 4.937965260545906e-05,
"loss": 2.421833038330078,
"step": 11
},
{
"epoch": 0.08872458410351201,
"grad_norm": 0.5944672226905823,
"learning_rate": 4.9255583126550866e-05,
"loss": 0.9898832440376282,
"step": 12
},
{
"epoch": 0.09611829944547134,
"grad_norm": 2.314751148223877,
"learning_rate": 4.9131513647642677e-05,
"loss": 2.684413433074951,
"step": 13
},
{
"epoch": 0.10351201478743069,
"grad_norm": 3.032388687133789,
"learning_rate": 4.9007444168734494e-05,
"loss": 2.4992518424987793,
"step": 14
},
{
"epoch": 0.11090573012939002,
"grad_norm": 0.7512603998184204,
"learning_rate": 4.8883374689826305e-05,
"loss": 1.5652904510498047,
"step": 15
},
{
"epoch": 0.11829944547134935,
"grad_norm": 2.1483168601989746,
"learning_rate": 4.8759305210918115e-05,
"loss": 2.0766830444335938,
"step": 16
},
{
"epoch": 0.1256931608133087,
"grad_norm": 2.4940130710601807,
"learning_rate": 4.8635235732009926e-05,
"loss": 2.14599609375,
"step": 17
},
{
"epoch": 0.133086876155268,
"grad_norm": 2.58516788482666,
"learning_rate": 4.851116625310174e-05,
"loss": 2.678130865097046,
"step": 18
},
{
"epoch": 0.14048059149722736,
"grad_norm": 2.1474788188934326,
"learning_rate": 4.8387096774193554e-05,
"loss": 2.2763166427612305,
"step": 19
},
{
"epoch": 0.1478743068391867,
"grad_norm": 1.9327515363693237,
"learning_rate": 4.8263027295285364e-05,
"loss": 2.2559866905212402,
"step": 20
},
{
"epoch": 0.1478743068391867,
"eval_loss": 1.6021771430969238,
"eval_runtime": 14.2984,
"eval_samples_per_second": 3.497,
"eval_steps_per_second": 0.909,
"step": 20
},
{
"epoch": 0.15526802218114602,
"grad_norm": 2.2944412231445312,
"learning_rate": 4.8138957816377175e-05,
"loss": 1.956355333328247,
"step": 21
},
{
"epoch": 0.16266173752310537,
"grad_norm": 2.040257453918457,
"learning_rate": 4.8014888337468986e-05,
"loss": 1.9789292812347412,
"step": 22
},
{
"epoch": 0.17005545286506468,
"grad_norm": 1.0300790071487427,
"learning_rate": 4.7890818858560796e-05,
"loss": 1.229586124420166,
"step": 23
},
{
"epoch": 0.17744916820702403,
"grad_norm": 1.9188776016235352,
"learning_rate": 4.776674937965261e-05,
"loss": 2.252568006515503,
"step": 24
},
{
"epoch": 0.18484288354898337,
"grad_norm": 0.6468012928962708,
"learning_rate": 4.764267990074442e-05,
"loss": 0.6744526028633118,
"step": 25
},
{
"epoch": 0.1922365988909427,
"grad_norm": 2.002753257751465,
"learning_rate": 4.751861042183623e-05,
"loss": 1.6015210151672363,
"step": 26
},
{
"epoch": 0.19963031423290203,
"grad_norm": 2.264155864715576,
"learning_rate": 4.739454094292804e-05,
"loss": 1.9130383729934692,
"step": 27
},
{
"epoch": 0.20702402957486138,
"grad_norm": 2.164496421813965,
"learning_rate": 4.7270471464019856e-05,
"loss": 1.3355481624603271,
"step": 28
},
{
"epoch": 0.2144177449168207,
"grad_norm": 0.9778668880462646,
"learning_rate": 4.7146401985111667e-05,
"loss": 1.042914867401123,
"step": 29
},
{
"epoch": 0.22181146025878004,
"grad_norm": 2.4416842460632324,
"learning_rate": 4.702233250620348e-05,
"loss": 1.7163786888122559,
"step": 30
},
{
"epoch": 0.22181146025878004,
"eval_loss": 1.4117671251296997,
"eval_runtime": 14.7244,
"eval_samples_per_second": 3.396,
"eval_steps_per_second": 0.883,
"step": 30
},
{
"epoch": 0.22920517560073936,
"grad_norm": 2.560103416442871,
"learning_rate": 4.689826302729529e-05,
"loss": 1.7177424430847168,
"step": 31
},
{
"epoch": 0.2365988909426987,
"grad_norm": 2.265031576156616,
"learning_rate": 4.67741935483871e-05,
"loss": 1.6933493614196777,
"step": 32
},
{
"epoch": 0.24399260628465805,
"grad_norm": 1.3352007865905762,
"learning_rate": 4.665012406947891e-05,
"loss": 1.289770483970642,
"step": 33
},
{
"epoch": 0.2513863216266174,
"grad_norm": 2.739408016204834,
"learning_rate": 4.652605459057072e-05,
"loss": 1.892009973526001,
"step": 34
},
{
"epoch": 0.2587800369685767,
"grad_norm": 0.848355770111084,
"learning_rate": 4.640198511166253e-05,
"loss": 0.7992806434631348,
"step": 35
},
{
"epoch": 0.266173752310536,
"grad_norm": 1.8914474248886108,
"learning_rate": 4.627791563275434e-05,
"loss": 1.014716386795044,
"step": 36
},
{
"epoch": 0.2735674676524954,
"grad_norm": 1.8833729028701782,
"learning_rate": 4.615384615384616e-05,
"loss": 1.8454999923706055,
"step": 37
},
{
"epoch": 0.2809611829944547,
"grad_norm": 1.0575491189956665,
"learning_rate": 4.602977667493797e-05,
"loss": 0.7487808465957642,
"step": 38
},
{
"epoch": 0.28835489833641403,
"grad_norm": 1.340802550315857,
"learning_rate": 4.590570719602978e-05,
"loss": 1.2484363317489624,
"step": 39
},
{
"epoch": 0.2957486136783734,
"grad_norm": 2.2050182819366455,
"learning_rate": 4.578163771712159e-05,
"loss": 1.4082988500595093,
"step": 40
},
{
"epoch": 0.2957486136783734,
"eval_loss": 1.2930712699890137,
"eval_runtime": 14.6012,
"eval_samples_per_second": 3.424,
"eval_steps_per_second": 0.89,
"step": 40
},
{
"epoch": 0.3031423290203327,
"grad_norm": 1.9534828662872314,
"learning_rate": 4.56575682382134e-05,
"loss": 1.0940786600112915,
"step": 41
},
{
"epoch": 0.31053604436229204,
"grad_norm": 2.391226053237915,
"learning_rate": 4.553349875930522e-05,
"loss": 1.151236891746521,
"step": 42
},
{
"epoch": 0.3179297597042514,
"grad_norm": 2.316863536834717,
"learning_rate": 4.540942928039703e-05,
"loss": 1.2963817119598389,
"step": 43
},
{
"epoch": 0.32532347504621073,
"grad_norm": 0.9008046984672546,
"learning_rate": 4.528535980148884e-05,
"loss": 0.6621055006980896,
"step": 44
},
{
"epoch": 0.33271719038817005,
"grad_norm": 1.6869522333145142,
"learning_rate": 4.516129032258064e-05,
"loss": 1.0466387271881104,
"step": 45
},
{
"epoch": 0.34011090573012936,
"grad_norm": 2.317460536956787,
"learning_rate": 4.5037220843672454e-05,
"loss": 1.386788249015808,
"step": 46
},
{
"epoch": 0.34750462107208874,
"grad_norm": 1.1141090393066406,
"learning_rate": 4.491315136476427e-05,
"loss": 1.6268982887268066,
"step": 47
},
{
"epoch": 0.35489833641404805,
"grad_norm": 2.659907341003418,
"learning_rate": 4.478908188585608e-05,
"loss": 1.7704683542251587,
"step": 48
},
{
"epoch": 0.36229205175600737,
"grad_norm": 1.2273647785186768,
"learning_rate": 4.466501240694789e-05,
"loss": 0.8123348951339722,
"step": 49
},
{
"epoch": 0.36968576709796674,
"grad_norm": 1.389702320098877,
"learning_rate": 4.45409429280397e-05,
"loss": 1.4599602222442627,
"step": 50
},
{
"epoch": 0.36968576709796674,
"eval_loss": 1.2116776704788208,
"eval_runtime": 14.659,
"eval_samples_per_second": 3.411,
"eval_steps_per_second": 0.887,
"step": 50
},
{
"epoch": 0.37707948243992606,
"grad_norm": 2.522132635116577,
"learning_rate": 4.441687344913151e-05,
"loss": 1.606776237487793,
"step": 51
},
{
"epoch": 0.3844731977818854,
"grad_norm": 2.7198681831359863,
"learning_rate": 4.429280397022333e-05,
"loss": 1.5745301246643066,
"step": 52
},
{
"epoch": 0.39186691312384475,
"grad_norm": 2.941790819168091,
"learning_rate": 4.416873449131514e-05,
"loss": 1.1630932092666626,
"step": 53
},
{
"epoch": 0.39926062846580407,
"grad_norm": 2.5087671279907227,
"learning_rate": 4.404466501240695e-05,
"loss": 1.0615822076797485,
"step": 54
},
{
"epoch": 0.4066543438077634,
"grad_norm": 2.8571765422821045,
"learning_rate": 4.392059553349876e-05,
"loss": 1.4195711612701416,
"step": 55
},
{
"epoch": 0.41404805914972276,
"grad_norm": 2.0848593711853027,
"learning_rate": 4.379652605459057e-05,
"loss": 1.430311679840088,
"step": 56
},
{
"epoch": 0.4214417744916821,
"grad_norm": 2.469207286834717,
"learning_rate": 4.3672456575682384e-05,
"loss": 1.1654510498046875,
"step": 57
},
{
"epoch": 0.4288354898336414,
"grad_norm": 2.1722354888916016,
"learning_rate": 4.3548387096774194e-05,
"loss": 1.0921519994735718,
"step": 58
},
{
"epoch": 0.43622920517560076,
"grad_norm": 1.956921100616455,
"learning_rate": 4.3424317617866005e-05,
"loss": 1.6206697225570679,
"step": 59
},
{
"epoch": 0.4436229205175601,
"grad_norm": 2.6034843921661377,
"learning_rate": 4.3300248138957816e-05,
"loss": 1.1840237379074097,
"step": 60
},
{
"epoch": 0.4436229205175601,
"eval_loss": 1.1138910055160522,
"eval_runtime": 14.7491,
"eval_samples_per_second": 3.39,
"eval_steps_per_second": 0.881,
"step": 60
},
{
"epoch": 0.4510166358595194,
"grad_norm": 3.262052297592163,
"learning_rate": 4.317617866004963e-05,
"loss": 1.0644543170928955,
"step": 61
},
{
"epoch": 0.4584103512014787,
"grad_norm": 2.89835262298584,
"learning_rate": 4.3052109181141444e-05,
"loss": 1.783827543258667,
"step": 62
},
{
"epoch": 0.4658040665434381,
"grad_norm": 2.8248863220214844,
"learning_rate": 4.2928039702233254e-05,
"loss": 1.4520047903060913,
"step": 63
},
{
"epoch": 0.4731977818853974,
"grad_norm": 2.2947335243225098,
"learning_rate": 4.2803970223325065e-05,
"loss": 1.1205673217773438,
"step": 64
},
{
"epoch": 0.4805914972273567,
"grad_norm": 2.2984018325805664,
"learning_rate": 4.2679900744416875e-05,
"loss": 0.9593680500984192,
"step": 65
},
{
"epoch": 0.4879852125693161,
"grad_norm": 3.3136825561523438,
"learning_rate": 4.2555831265508686e-05,
"loss": 1.685524344444275,
"step": 66
},
{
"epoch": 0.4953789279112754,
"grad_norm": 2.308732509613037,
"learning_rate": 4.2431761786600497e-05,
"loss": 1.4158852100372314,
"step": 67
},
{
"epoch": 0.5027726432532348,
"grad_norm": 2.764207363128662,
"learning_rate": 4.230769230769231e-05,
"loss": 1.1706503629684448,
"step": 68
},
{
"epoch": 0.5101663585951941,
"grad_norm": 2.7320327758789062,
"learning_rate": 4.218362282878412e-05,
"loss": 0.978042721748352,
"step": 69
},
{
"epoch": 0.5175600739371534,
"grad_norm": 2.549668550491333,
"learning_rate": 4.205955334987593e-05,
"loss": 1.1643197536468506,
"step": 70
},
{
"epoch": 0.5175600739371534,
"eval_loss": 1.0553016662597656,
"eval_runtime": 14.6825,
"eval_samples_per_second": 3.405,
"eval_steps_per_second": 0.885,
"step": 70
},
{
"epoch": 0.5249537892791127,
"grad_norm": 3.1705875396728516,
"learning_rate": 4.1935483870967746e-05,
"loss": 1.828012228012085,
"step": 71
},
{
"epoch": 0.532347504621072,
"grad_norm": 3.109196424484253,
"learning_rate": 4.1811414392059556e-05,
"loss": 0.7359082698822021,
"step": 72
},
{
"epoch": 0.5397412199630314,
"grad_norm": 1.8801664113998413,
"learning_rate": 4.168734491315137e-05,
"loss": 1.0972692966461182,
"step": 73
},
{
"epoch": 0.5471349353049908,
"grad_norm": 2.4713597297668457,
"learning_rate": 4.156327543424318e-05,
"loss": 0.8450818061828613,
"step": 74
},
{
"epoch": 0.5545286506469501,
"grad_norm": 2.952817440032959,
"learning_rate": 4.1439205955334995e-05,
"loss": 1.0884149074554443,
"step": 75
},
{
"epoch": 0.5619223659889094,
"grad_norm": 2.8595173358917236,
"learning_rate": 4.1315136476426805e-05,
"loss": 1.139454960823059,
"step": 76
},
{
"epoch": 0.5693160813308688,
"grad_norm": 3.3091001510620117,
"learning_rate": 4.119106699751861e-05,
"loss": 1.3391754627227783,
"step": 77
},
{
"epoch": 0.5767097966728281,
"grad_norm": 3.2456319332122803,
"learning_rate": 4.106699751861042e-05,
"loss": 1.3041037321090698,
"step": 78
},
{
"epoch": 0.5841035120147874,
"grad_norm": 2.745225667953491,
"learning_rate": 4.094292803970223e-05,
"loss": 1.4664080142974854,
"step": 79
},
{
"epoch": 0.5914972273567468,
"grad_norm": 3.86385178565979,
"learning_rate": 4.081885856079405e-05,
"loss": 1.0991761684417725,
"step": 80
},
{
"epoch": 0.5914972273567468,
"eval_loss": 1.024406909942627,
"eval_runtime": 14.6773,
"eval_samples_per_second": 3.407,
"eval_steps_per_second": 0.886,
"step": 80
},
{
"epoch": 0.5988909426987061,
"grad_norm": 3.2133798599243164,
"learning_rate": 4.069478908188586e-05,
"loss": 1.482096791267395,
"step": 81
},
{
"epoch": 0.6062846580406654,
"grad_norm": 2.4578635692596436,
"learning_rate": 4.057071960297767e-05,
"loss": 0.95296311378479,
"step": 82
},
{
"epoch": 0.6136783733826248,
"grad_norm": 3.0704939365386963,
"learning_rate": 4.044665012406948e-05,
"loss": 1.4384511709213257,
"step": 83
},
{
"epoch": 0.6210720887245841,
"grad_norm": 3.1470870971679688,
"learning_rate": 4.032258064516129e-05,
"loss": 0.8680386543273926,
"step": 84
},
{
"epoch": 0.6284658040665434,
"grad_norm": 2.6569035053253174,
"learning_rate": 4.019851116625311e-05,
"loss": 1.0536919832229614,
"step": 85
},
{
"epoch": 0.6358595194085028,
"grad_norm": 2.6955459117889404,
"learning_rate": 4.007444168734492e-05,
"loss": 1.2974836826324463,
"step": 86
},
{
"epoch": 0.6432532347504621,
"grad_norm": 2.881974458694458,
"learning_rate": 3.995037220843673e-05,
"loss": 0.9090498089790344,
"step": 87
},
{
"epoch": 0.6506469500924215,
"grad_norm": 2.85056209564209,
"learning_rate": 3.982630272952854e-05,
"loss": 1.142749547958374,
"step": 88
},
{
"epoch": 0.6580406654343808,
"grad_norm": 2.879006862640381,
"learning_rate": 3.970223325062035e-05,
"loss": 0.8405839204788208,
"step": 89
},
{
"epoch": 0.6654343807763401,
"grad_norm": 3.156893253326416,
"learning_rate": 3.957816377171216e-05,
"loss": 0.8235164880752563,
"step": 90
},
{
"epoch": 0.6654343807763401,
"eval_loss": 0.9943150877952576,
"eval_runtime": 14.7351,
"eval_samples_per_second": 3.393,
"eval_steps_per_second": 0.882,
"step": 90
},
{
"epoch": 0.6728280961182994,
"grad_norm": 2.9643747806549072,
"learning_rate": 3.945409429280397e-05,
"loss": 1.1688953638076782,
"step": 91
},
{
"epoch": 0.6802218114602587,
"grad_norm": 2.8159196376800537,
"learning_rate": 3.933002481389578e-05,
"loss": 1.1848558187484741,
"step": 92
},
{
"epoch": 0.6876155268022182,
"grad_norm": 3.1563498973846436,
"learning_rate": 3.920595533498759e-05,
"loss": 1.133997917175293,
"step": 93
},
{
"epoch": 0.6950092421441775,
"grad_norm": 2.359210252761841,
"learning_rate": 3.908188585607941e-05,
"loss": 0.8476818799972534,
"step": 94
},
{
"epoch": 0.7024029574861368,
"grad_norm": 3.1568336486816406,
"learning_rate": 3.895781637717122e-05,
"loss": 0.8584047555923462,
"step": 95
},
{
"epoch": 0.7097966728280961,
"grad_norm": 3.0946948528289795,
"learning_rate": 3.883374689826303e-05,
"loss": 0.8942509889602661,
"step": 96
},
{
"epoch": 0.7171903881700554,
"grad_norm": 2.688983201980591,
"learning_rate": 3.870967741935484e-05,
"loss": 0.9744483232498169,
"step": 97
},
{
"epoch": 0.7245841035120147,
"grad_norm": 3.7019851207733154,
"learning_rate": 3.858560794044665e-05,
"loss": 1.0812692642211914,
"step": 98
},
{
"epoch": 0.7319778188539742,
"grad_norm": 3.413264274597168,
"learning_rate": 3.846153846153846e-05,
"loss": 1.2246288061141968,
"step": 99
},
{
"epoch": 0.7393715341959335,
"grad_norm": 3.1463723182678223,
"learning_rate": 3.8337468982630273e-05,
"loss": 0.9551287889480591,
"step": 100
},
{
"epoch": 0.7393715341959335,
"eval_loss": 0.9603383541107178,
"eval_runtime": 14.5967,
"eval_samples_per_second": 3.425,
"eval_steps_per_second": 0.891,
"step": 100
},
{
"epoch": 0.7467652495378928,
"grad_norm": 3.331590414047241,
"learning_rate": 3.8213399503722084e-05,
"loss": 1.0125172138214111,
"step": 101
},
{
"epoch": 0.7541589648798521,
"grad_norm": 1.8756176233291626,
"learning_rate": 3.8089330024813895e-05,
"loss": 1.4402893781661987,
"step": 102
},
{
"epoch": 0.7615526802218114,
"grad_norm": 2.8599133491516113,
"learning_rate": 3.7965260545905705e-05,
"loss": 0.9122072458267212,
"step": 103
},
{
"epoch": 0.7689463955637708,
"grad_norm": 2.963188648223877,
"learning_rate": 3.784119106699752e-05,
"loss": 0.9114301204681396,
"step": 104
},
{
"epoch": 0.7763401109057301,
"grad_norm": 3.2771401405334473,
"learning_rate": 3.771712158808933e-05,
"loss": 0.9420968890190125,
"step": 105
},
{
"epoch": 0.7837338262476895,
"grad_norm": 1.1317050457000732,
"learning_rate": 3.7593052109181144e-05,
"loss": 0.5487204790115356,
"step": 106
},
{
"epoch": 0.7911275415896488,
"grad_norm": 1.592030644416809,
"learning_rate": 3.7468982630272954e-05,
"loss": 0.6232097744941711,
"step": 107
},
{
"epoch": 0.7985212569316081,
"grad_norm": 2.3476905822753906,
"learning_rate": 3.734491315136477e-05,
"loss": 1.3079752922058105,
"step": 108
},
{
"epoch": 0.8059149722735675,
"grad_norm": 3.5496175289154053,
"learning_rate": 3.7220843672456576e-05,
"loss": 1.1627793312072754,
"step": 109
},
{
"epoch": 0.8133086876155268,
"grad_norm": 2.3397562503814697,
"learning_rate": 3.7096774193548386e-05,
"loss": 1.2222082614898682,
"step": 110
},
{
"epoch": 0.8133086876155268,
"eval_loss": 0.9296000599861145,
"eval_runtime": 14.6623,
"eval_samples_per_second": 3.41,
"eval_steps_per_second": 0.887,
"step": 110
},
{
"epoch": 0.8207024029574861,
"grad_norm": 3.8196728229522705,
"learning_rate": 3.69727047146402e-05,
"loss": 1.4748249053955078,
"step": 111
},
{
"epoch": 0.8280961182994455,
"grad_norm": 3.2699241638183594,
"learning_rate": 3.684863523573201e-05,
"loss": 1.1485276222229004,
"step": 112
},
{
"epoch": 0.8354898336414048,
"grad_norm": 3.5778534412384033,
"learning_rate": 3.6724565756823825e-05,
"loss": 1.1845570802688599,
"step": 113
},
{
"epoch": 0.8428835489833642,
"grad_norm": 3.3727245330810547,
"learning_rate": 3.6600496277915635e-05,
"loss": 0.8769504427909851,
"step": 114
},
{
"epoch": 0.8502772643253235,
"grad_norm": 3.280014753341675,
"learning_rate": 3.6476426799007446e-05,
"loss": 1.2621396780014038,
"step": 115
},
{
"epoch": 0.8576709796672828,
"grad_norm": 3.677361488342285,
"learning_rate": 3.635235732009926e-05,
"loss": 1.1793429851531982,
"step": 116
},
{
"epoch": 0.8650646950092421,
"grad_norm": 2.788851261138916,
"learning_rate": 3.622828784119107e-05,
"loss": 1.0340873003005981,
"step": 117
},
{
"epoch": 0.8724584103512015,
"grad_norm": 2.7919020652770996,
"learning_rate": 3.6104218362282885e-05,
"loss": 1.1847516298294067,
"step": 118
},
{
"epoch": 0.8798521256931608,
"grad_norm": 1.7291911840438843,
"learning_rate": 3.5980148883374695e-05,
"loss": 0.8953083157539368,
"step": 119
},
{
"epoch": 0.8872458410351202,
"grad_norm": 3.1404361724853516,
"learning_rate": 3.5856079404466506e-05,
"loss": 1.0396440029144287,
"step": 120
},
{
"epoch": 0.8872458410351202,
"eval_loss": 0.9078614711761475,
"eval_runtime": 14.7987,
"eval_samples_per_second": 3.379,
"eval_steps_per_second": 0.878,
"step": 120
},
{
"epoch": 0.8946395563770795,
"grad_norm": 1.7119001150131226,
"learning_rate": 3.573200992555831e-05,
"loss": 0.7708945274353027,
"step": 121
},
{
"epoch": 0.9020332717190388,
"grad_norm": 2.804116725921631,
"learning_rate": 3.560794044665012e-05,
"loss": 1.2879009246826172,
"step": 122
},
{
"epoch": 0.9094269870609981,
"grad_norm": 3.6296403408050537,
"learning_rate": 3.548387096774194e-05,
"loss": 1.2780061960220337,
"step": 123
},
{
"epoch": 0.9168207024029574,
"grad_norm": 4.171301364898682,
"learning_rate": 3.535980148883375e-05,
"loss": 1.2573845386505127,
"step": 124
},
{
"epoch": 0.9242144177449169,
"grad_norm": 1.6946974992752075,
"learning_rate": 3.523573200992556e-05,
"loss": 1.5690746307373047,
"step": 125
},
{
"epoch": 0.9316081330868762,
"grad_norm": 1.9035532474517822,
"learning_rate": 3.511166253101737e-05,
"loss": 0.6932345628738403,
"step": 126
},
{
"epoch": 0.9390018484288355,
"grad_norm": 1.6593624353408813,
"learning_rate": 3.498759305210919e-05,
"loss": 0.5941351056098938,
"step": 127
},
{
"epoch": 0.9463955637707948,
"grad_norm": 2.5471839904785156,
"learning_rate": 3.4863523573201e-05,
"loss": 0.4706844687461853,
"step": 128
},
{
"epoch": 0.9537892791127541,
"grad_norm": 1.5462491512298584,
"learning_rate": 3.473945409429281e-05,
"loss": 1.3614616394042969,
"step": 129
},
{
"epoch": 0.9611829944547134,
"grad_norm": 2.8795769214630127,
"learning_rate": 3.461538461538462e-05,
"loss": 1.2096058130264282,
"step": 130
},
{
"epoch": 0.9611829944547134,
"eval_loss": 0.8965096473693848,
"eval_runtime": 14.6807,
"eval_samples_per_second": 3.406,
"eval_steps_per_second": 0.886,
"step": 130
},
{
"epoch": 0.9685767097966729,
"grad_norm": 1.1051534414291382,
"learning_rate": 3.449131513647643e-05,
"loss": 0.4035143256187439,
"step": 131
},
{
"epoch": 0.9759704251386322,
"grad_norm": 3.4675469398498535,
"learning_rate": 3.436724565756824e-05,
"loss": 0.61115962266922,
"step": 132
},
{
"epoch": 0.9833641404805915,
"grad_norm": 3.4992542266845703,
"learning_rate": 3.424317617866005e-05,
"loss": 1.0233020782470703,
"step": 133
},
{
"epoch": 0.9907578558225508,
"grad_norm": 2.9477298259735107,
"learning_rate": 3.411910669975186e-05,
"loss": 1.1910691261291504,
"step": 134
},
{
"epoch": 0.9981515711645101,
"grad_norm": 3.404331684112549,
"learning_rate": 3.399503722084367e-05,
"loss": 0.8914271593093872,
"step": 135
},
{
"epoch": 1.0,
"grad_norm": 7.629513740539551,
"learning_rate": 3.387096774193548e-05,
"loss": 0.7269555330276489,
"step": 136
},
{
"epoch": 1.0073937153419594,
"grad_norm": 3.7028565406799316,
"learning_rate": 3.37468982630273e-05,
"loss": 1.024603247642517,
"step": 137
},
{
"epoch": 1.0147874306839186,
"grad_norm": 3.0595295429229736,
"learning_rate": 3.362282878411911e-05,
"loss": 1.0184353590011597,
"step": 138
},
{
"epoch": 1.022181146025878,
"grad_norm": 1.5020614862442017,
"learning_rate": 3.349875930521092e-05,
"loss": 0.5547934770584106,
"step": 139
},
{
"epoch": 1.0295748613678373,
"grad_norm": 2.5641324520111084,
"learning_rate": 3.337468982630273e-05,
"loss": 0.8376579284667969,
"step": 140
},
{
"epoch": 1.0295748613678373,
"eval_loss": 0.8667128682136536,
"eval_runtime": 14.7254,
"eval_samples_per_second": 3.396,
"eval_steps_per_second": 0.883,
"step": 140
},
{
"epoch": 1.0369685767097967,
"grad_norm": 2.9328815937042236,
"learning_rate": 3.325062034739454e-05,
"loss": 0.6763349175453186,
"step": 141
},
{
"epoch": 1.044362292051756,
"grad_norm": 2.459362506866455,
"learning_rate": 3.312655086848635e-05,
"loss": 0.9117762446403503,
"step": 142
},
{
"epoch": 1.0517560073937153,
"grad_norm": 2.7116122245788574,
"learning_rate": 3.300248138957816e-05,
"loss": 0.5921486616134644,
"step": 143
},
{
"epoch": 1.0591497227356748,
"grad_norm": 2.9720282554626465,
"learning_rate": 3.2878411910669974e-05,
"loss": 0.607153058052063,
"step": 144
},
{
"epoch": 1.066543438077634,
"grad_norm": 2.249736785888672,
"learning_rate": 3.2754342431761784e-05,
"loss": 0.8126924633979797,
"step": 145
},
{
"epoch": 1.0739371534195934,
"grad_norm": 2.706214427947998,
"learning_rate": 3.26302729528536e-05,
"loss": 0.6490439772605896,
"step": 146
},
{
"epoch": 1.0813308687615526,
"grad_norm": 3.738187074661255,
"learning_rate": 3.250620347394541e-05,
"loss": 0.819773256778717,
"step": 147
},
{
"epoch": 1.088724584103512,
"grad_norm": 3.121695041656494,
"learning_rate": 3.238213399503722e-05,
"loss": 0.6183997392654419,
"step": 148
},
{
"epoch": 1.0961182994454712,
"grad_norm": 4.132612228393555,
"learning_rate": 3.2258064516129034e-05,
"loss": 0.767497181892395,
"step": 149
},
{
"epoch": 1.1035120147874307,
"grad_norm": 2.0239458084106445,
"learning_rate": 3.2133995037220844e-05,
"loss": 1.0948212146759033,
"step": 150
},
{
"epoch": 1.1035120147874307,
"eval_loss": 0.8530704975128174,
"eval_runtime": 14.7071,
"eval_samples_per_second": 3.4,
"eval_steps_per_second": 0.884,
"step": 150
},
{
"epoch": 1.11090573012939,
"grad_norm": 3.3580844402313232,
"learning_rate": 3.200992555831266e-05,
"loss": 0.5469967126846313,
"step": 151
},
{
"epoch": 1.1182994454713493,
"grad_norm": 2.974302053451538,
"learning_rate": 3.188585607940447e-05,
"loss": 0.47518885135650635,
"step": 152
},
{
"epoch": 1.1256931608133087,
"grad_norm": 3.033684492111206,
"learning_rate": 3.176178660049628e-05,
"loss": 0.7291224002838135,
"step": 153
},
{
"epoch": 1.133086876155268,
"grad_norm": 3.733419418334961,
"learning_rate": 3.1637717121588087e-05,
"loss": 0.7658367156982422,
"step": 154
},
{
"epoch": 1.1404805914972274,
"grad_norm": 3.2456040382385254,
"learning_rate": 3.15136476426799e-05,
"loss": 0.8450358510017395,
"step": 155
},
{
"epoch": 1.1478743068391868,
"grad_norm": 3.432668924331665,
"learning_rate": 3.1389578163771715e-05,
"loss": 0.6418715715408325,
"step": 156
},
{
"epoch": 1.155268022181146,
"grad_norm": 2.9463069438934326,
"learning_rate": 3.1265508684863525e-05,
"loss": 1.3750693798065186,
"step": 157
},
{
"epoch": 1.1626617375231054,
"grad_norm": 3.7486484050750732,
"learning_rate": 3.1141439205955336e-05,
"loss": 0.7545527815818787,
"step": 158
},
{
"epoch": 1.1700554528650646,
"grad_norm": 1.1400007009506226,
"learning_rate": 3.1017369727047146e-05,
"loss": 0.4953806400299072,
"step": 159
},
{
"epoch": 1.177449168207024,
"grad_norm": 1.9228570461273193,
"learning_rate": 3.089330024813896e-05,
"loss": 0.5013564825057983,
"step": 160
},
{
"epoch": 1.177449168207024,
"eval_loss": 0.8432470560073853,
"eval_runtime": 14.7161,
"eval_samples_per_second": 3.398,
"eval_steps_per_second": 0.883,
"step": 160
},
{
"epoch": 1.1848428835489835,
"grad_norm": 2.0466220378875732,
"learning_rate": 3.0769230769230774e-05,
"loss": 0.8158243298530579,
"step": 161
},
{
"epoch": 1.1922365988909427,
"grad_norm": 3.307772636413574,
"learning_rate": 3.0645161290322585e-05,
"loss": 0.7138271927833557,
"step": 162
},
{
"epoch": 1.1996303142329021,
"grad_norm": 1.4036277532577515,
"learning_rate": 3.0521091811414396e-05,
"loss": 0.391914963722229,
"step": 163
},
{
"epoch": 1.2070240295748613,
"grad_norm": 4.2623610496521,
"learning_rate": 3.0397022332506203e-05,
"loss": 1.1953831911087036,
"step": 164
},
{
"epoch": 1.2144177449168208,
"grad_norm": 1.5940158367156982,
"learning_rate": 3.027295285359802e-05,
"loss": 0.5775357484817505,
"step": 165
},
{
"epoch": 1.22181146025878,
"grad_norm": 2.010906219482422,
"learning_rate": 3.014888337468983e-05,
"loss": 0.9656795859336853,
"step": 166
},
{
"epoch": 1.2292051756007394,
"grad_norm": 3.457470178604126,
"learning_rate": 3.0024813895781638e-05,
"loss": 0.6407822966575623,
"step": 167
},
{
"epoch": 1.2365988909426986,
"grad_norm": 3.8961503505706787,
"learning_rate": 2.990074441687345e-05,
"loss": 0.6025644540786743,
"step": 168
},
{
"epoch": 1.243992606284658,
"grad_norm": 1.594923496246338,
"learning_rate": 2.977667493796526e-05,
"loss": 0.5624638199806213,
"step": 169
},
{
"epoch": 1.2513863216266174,
"grad_norm": 1.737376093864441,
"learning_rate": 2.9652605459057077e-05,
"loss": 1.1991184949874878,
"step": 170
},
{
"epoch": 1.2513863216266174,
"eval_loss": 0.8280792236328125,
"eval_runtime": 14.5811,
"eval_samples_per_second": 3.429,
"eval_steps_per_second": 0.892,
"step": 170
},
{
"epoch": 1.2587800369685767,
"grad_norm": 3.161806583404541,
"learning_rate": 2.9528535980148887e-05,
"loss": 0.5611181259155273,
"step": 171
},
{
"epoch": 1.266173752310536,
"grad_norm": 3.9646661281585693,
"learning_rate": 2.9404466501240698e-05,
"loss": 0.9791576862335205,
"step": 172
},
{
"epoch": 1.2735674676524953,
"grad_norm": 2.939876079559326,
"learning_rate": 2.9280397022332505e-05,
"loss": 0.6126688718795776,
"step": 173
},
{
"epoch": 1.2809611829944547,
"grad_norm": 3.9292585849761963,
"learning_rate": 2.9156327543424316e-05,
"loss": 0.8683090209960938,
"step": 174
},
{
"epoch": 1.2883548983364141,
"grad_norm": 1.8785326480865479,
"learning_rate": 2.9032258064516133e-05,
"loss": 0.46358799934387207,
"step": 175
},
{
"epoch": 1.2957486136783734,
"grad_norm": 3.62471079826355,
"learning_rate": 2.8908188585607944e-05,
"loss": 0.764897346496582,
"step": 176
},
{
"epoch": 1.3031423290203328,
"grad_norm": 3.8324623107910156,
"learning_rate": 2.8784119106699754e-05,
"loss": 0.6231205463409424,
"step": 177
},
{
"epoch": 1.310536044362292,
"grad_norm": 2.560826539993286,
"learning_rate": 2.8660049627791565e-05,
"loss": 0.4221123456954956,
"step": 178
},
{
"epoch": 1.3179297597042514,
"grad_norm": 4.285940647125244,
"learning_rate": 2.8535980148883372e-05,
"loss": 0.9465740919113159,
"step": 179
},
{
"epoch": 1.3253234750462108,
"grad_norm": 1.7949848175048828,
"learning_rate": 2.841191066997519e-05,
"loss": 0.680899977684021,
"step": 180
},
{
"epoch": 1.3253234750462108,
"eval_loss": 0.8194607496261597,
"eval_runtime": 14.8751,
"eval_samples_per_second": 3.361,
"eval_steps_per_second": 0.874,
"step": 180
},
{
"epoch": 1.33271719038817,
"grad_norm": 2.0182719230651855,
"learning_rate": 2.8287841191067e-05,
"loss": 0.613226592540741,
"step": 181
},
{
"epoch": 1.3401109057301293,
"grad_norm": 4.6714887619018555,
"learning_rate": 2.816377171215881e-05,
"loss": 0.8670039176940918,
"step": 182
},
{
"epoch": 1.3475046210720887,
"grad_norm": 4.056960582733154,
"learning_rate": 2.803970223325062e-05,
"loss": 0.7967749834060669,
"step": 183
},
{
"epoch": 1.354898336414048,
"grad_norm": 4.206955909729004,
"learning_rate": 2.7915632754342435e-05,
"loss": 1.0874457359313965,
"step": 184
},
{
"epoch": 1.3622920517560073,
"grad_norm": 3.817035436630249,
"learning_rate": 2.7791563275434246e-05,
"loss": 0.95674729347229,
"step": 185
},
{
"epoch": 1.3696857670979667,
"grad_norm": 3.6514406204223633,
"learning_rate": 2.7667493796526056e-05,
"loss": 0.555774450302124,
"step": 186
},
{
"epoch": 1.377079482439926,
"grad_norm": 3.7338063716888428,
"learning_rate": 2.7543424317617867e-05,
"loss": 0.5461658835411072,
"step": 187
},
{
"epoch": 1.3844731977818854,
"grad_norm": 3.01973295211792,
"learning_rate": 2.7419354838709678e-05,
"loss": 0.9282134771347046,
"step": 188
},
{
"epoch": 1.3918669131238448,
"grad_norm": 3.5295522212982178,
"learning_rate": 2.729528535980149e-05,
"loss": 0.8109346628189087,
"step": 189
},
{
"epoch": 1.399260628465804,
"grad_norm": 3.73514461517334,
"learning_rate": 2.7171215880893302e-05,
"loss": 0.6853020787239075,
"step": 190
},
{
"epoch": 1.399260628465804,
"eval_loss": 0.8215422630310059,
"eval_runtime": 14.5513,
"eval_samples_per_second": 3.436,
"eval_steps_per_second": 0.893,
"step": 190
},
{
"epoch": 1.4066543438077634,
"grad_norm": 2.7374188899993896,
"learning_rate": 2.7047146401985113e-05,
"loss": 1.0195677280426025,
"step": 191
},
{
"epoch": 1.4140480591497226,
"grad_norm": 4.187663555145264,
"learning_rate": 2.6923076923076923e-05,
"loss": 1.0480753183364868,
"step": 192
},
{
"epoch": 1.421441774491682,
"grad_norm": 3.276689052581787,
"learning_rate": 2.6799007444168734e-05,
"loss": 0.5181576013565063,
"step": 193
},
{
"epoch": 1.4288354898336415,
"grad_norm": 3.5883798599243164,
"learning_rate": 2.6674937965260548e-05,
"loss": 0.7783234119415283,
"step": 194
},
{
"epoch": 1.4362292051756007,
"grad_norm": 1.0365864038467407,
"learning_rate": 2.655086848635236e-05,
"loss": 0.7230033874511719,
"step": 195
},
{
"epoch": 1.4436229205175601,
"grad_norm": 3.209699869155884,
"learning_rate": 2.642679900744417e-05,
"loss": 0.725004255771637,
"step": 196
},
{
"epoch": 1.4510166358595193,
"grad_norm": 2.7974090576171875,
"learning_rate": 2.630272952853598e-05,
"loss": 0.8251001238822937,
"step": 197
},
{
"epoch": 1.4584103512014788,
"grad_norm": 4.012574195861816,
"learning_rate": 2.617866004962779e-05,
"loss": 0.7500607371330261,
"step": 198
},
{
"epoch": 1.4658040665434382,
"grad_norm": 3.2767927646636963,
"learning_rate": 2.6054590570719604e-05,
"loss": 0.5972156524658203,
"step": 199
},
{
"epoch": 1.4731977818853974,
"grad_norm": 3.665105104446411,
"learning_rate": 2.5930521091811415e-05,
"loss": 0.42983272671699524,
"step": 200
},
{
"epoch": 1.4731977818853974,
"eval_loss": 0.8120042681694031,
"eval_runtime": 14.6672,
"eval_samples_per_second": 3.409,
"eval_steps_per_second": 0.886,
"step": 200
},
{
"epoch": 1.4805914972273566,
"grad_norm": 4.322039604187012,
"learning_rate": 2.5806451612903226e-05,
"loss": 0.8239177465438843,
"step": 201
},
{
"epoch": 1.487985212569316,
"grad_norm": 3.681670904159546,
"learning_rate": 2.5682382133995036e-05,
"loss": 0.46425601840019226,
"step": 202
},
{
"epoch": 1.4953789279112755,
"grad_norm": 3.829942226409912,
"learning_rate": 2.5558312655086853e-05,
"loss": 0.5882385969161987,
"step": 203
},
{
"epoch": 1.502772643253235,
"grad_norm": 3.8684608936309814,
"learning_rate": 2.5434243176178664e-05,
"loss": 0.8204436302185059,
"step": 204
},
{
"epoch": 1.510166358595194,
"grad_norm": 4.183191776275635,
"learning_rate": 2.531017369727047e-05,
"loss": 1.1439590454101562,
"step": 205
},
{
"epoch": 1.5175600739371533,
"grad_norm": 3.61912202835083,
"learning_rate": 2.5186104218362282e-05,
"loss": 0.7177018523216248,
"step": 206
},
{
"epoch": 1.5249537892791127,
"grad_norm": 3.1439766883850098,
"learning_rate": 2.5062034739454093e-05,
"loss": 1.0978827476501465,
"step": 207
},
{
"epoch": 1.5323475046210722,
"grad_norm": 1.9132380485534668,
"learning_rate": 2.4937965260545906e-05,
"loss": 0.6175467371940613,
"step": 208
},
{
"epoch": 1.5397412199630314,
"grad_norm": 1.373880386352539,
"learning_rate": 2.481389578163772e-05,
"loss": 0.22940072417259216,
"step": 209
},
{
"epoch": 1.5471349353049908,
"grad_norm": 3.687744379043579,
"learning_rate": 2.468982630272953e-05,
"loss": 0.3838157653808594,
"step": 210
},
{
"epoch": 1.5471349353049908,
"eval_loss": 0.8064006567001343,
"eval_runtime": 14.6872,
"eval_samples_per_second": 3.404,
"eval_steps_per_second": 0.885,
"step": 210
},
{
"epoch": 1.55452865064695,
"grad_norm": 2.725609302520752,
"learning_rate": 2.4565756823821338e-05,
"loss": 0.3925488293170929,
"step": 211
},
{
"epoch": 1.5619223659889094,
"grad_norm": 4.170878887176514,
"learning_rate": 2.4441687344913152e-05,
"loss": 0.9177101254463196,
"step": 212
},
{
"epoch": 1.5693160813308689,
"grad_norm": 3.54719877243042,
"learning_rate": 2.4317617866004963e-05,
"loss": 0.3834892213344574,
"step": 213
},
{
"epoch": 1.576709796672828,
"grad_norm": 3.7506401538848877,
"learning_rate": 2.4193548387096777e-05,
"loss": 0.782739520072937,
"step": 214
},
{
"epoch": 1.5841035120147873,
"grad_norm": 1.567891240119934,
"learning_rate": 2.4069478908188587e-05,
"loss": 0.47440165281295776,
"step": 215
},
{
"epoch": 1.5914972273567467,
"grad_norm": 4.019551753997803,
"learning_rate": 2.3945409429280398e-05,
"loss": 0.7724896669387817,
"step": 216
},
{
"epoch": 1.5988909426987061,
"grad_norm": 3.265582323074341,
"learning_rate": 2.382133995037221e-05,
"loss": 0.585466742515564,
"step": 217
},
{
"epoch": 1.6062846580406656,
"grad_norm": 3.6960299015045166,
"learning_rate": 2.369727047146402e-05,
"loss": 0.683808445930481,
"step": 218
},
{
"epoch": 1.6136783733826248,
"grad_norm": 4.092567443847656,
"learning_rate": 2.3573200992555833e-05,
"loss": 0.8049482703208923,
"step": 219
},
{
"epoch": 1.621072088724584,
"grad_norm": 3.318016290664673,
"learning_rate": 2.3449131513647644e-05,
"loss": 0.5561220645904541,
"step": 220
},
{
"epoch": 1.621072088724584,
"eval_loss": 0.8024477362632751,
"eval_runtime": 14.5996,
"eval_samples_per_second": 3.425,
"eval_steps_per_second": 0.89,
"step": 220
},
{
"epoch": 1.6284658040665434,
"grad_norm": 5.157983779907227,
"learning_rate": 2.3325062034739454e-05,
"loss": 0.919698178768158,
"step": 221
},
{
"epoch": 1.6358595194085028,
"grad_norm": 3.365602970123291,
"learning_rate": 2.3200992555831265e-05,
"loss": 0.7725900411605835,
"step": 222
},
{
"epoch": 1.6432532347504623,
"grad_norm": 3.9181325435638428,
"learning_rate": 2.307692307692308e-05,
"loss": 0.535124659538269,
"step": 223
},
{
"epoch": 1.6506469500924215,
"grad_norm": 3.7963433265686035,
"learning_rate": 2.295285359801489e-05,
"loss": 0.9627186059951782,
"step": 224
},
{
"epoch": 1.6580406654343807,
"grad_norm": 3.6968164443969727,
"learning_rate": 2.28287841191067e-05,
"loss": 0.8556936979293823,
"step": 225
},
{
"epoch": 1.66543438077634,
"grad_norm": 4.4114861488342285,
"learning_rate": 2.2704714640198514e-05,
"loss": 0.8419898748397827,
"step": 226
},
{
"epoch": 1.6728280961182995,
"grad_norm": 3.3653135299682617,
"learning_rate": 2.258064516129032e-05,
"loss": 0.4375629127025604,
"step": 227
},
{
"epoch": 1.6802218114602587,
"grad_norm": 2.5058343410491943,
"learning_rate": 2.2456575682382135e-05,
"loss": 0.5678821206092834,
"step": 228
},
{
"epoch": 1.6876155268022182,
"grad_norm": 3.3000216484069824,
"learning_rate": 2.2332506203473946e-05,
"loss": 0.9510512948036194,
"step": 229
},
{
"epoch": 1.6950092421441774,
"grad_norm": 4.843665599822998,
"learning_rate": 2.2208436724565757e-05,
"loss": 1.1221953630447388,
"step": 230
},
{
"epoch": 1.6950092421441774,
"eval_loss": 0.7935811877250671,
"eval_runtime": 14.7786,
"eval_samples_per_second": 3.383,
"eval_steps_per_second": 0.88,
"step": 230
},
{
"epoch": 1.7024029574861368,
"grad_norm": 2.4911141395568848,
"learning_rate": 2.208436724565757e-05,
"loss": 1.419028878211975,
"step": 231
},
{
"epoch": 1.7097966728280962,
"grad_norm": 1.9304749965667725,
"learning_rate": 2.196029776674938e-05,
"loss": 0.5840872526168823,
"step": 232
},
{
"epoch": 1.7171903881700554,
"grad_norm": 1.9608324766159058,
"learning_rate": 2.1836228287841192e-05,
"loss": 1.2491809129714966,
"step": 233
},
{
"epoch": 1.7245841035120146,
"grad_norm": 4.504591464996338,
"learning_rate": 2.1712158808933002e-05,
"loss": 0.7342857718467712,
"step": 234
},
{
"epoch": 1.731977818853974,
"grad_norm": 3.7661826610565186,
"learning_rate": 2.1588089330024816e-05,
"loss": 0.5309323072433472,
"step": 235
},
{
"epoch": 1.7393715341959335,
"grad_norm": 3.5521440505981445,
"learning_rate": 2.1464019851116627e-05,
"loss": 0.4989915192127228,
"step": 236
},
{
"epoch": 1.746765249537893,
"grad_norm": 3.6262974739074707,
"learning_rate": 2.1339950372208438e-05,
"loss": 0.5839136242866516,
"step": 237
},
{
"epoch": 1.7541589648798521,
"grad_norm": 3.896362543106079,
"learning_rate": 2.1215880893300248e-05,
"loss": 1.0018640756607056,
"step": 238
},
{
"epoch": 1.7615526802218113,
"grad_norm": 3.742424249649048,
"learning_rate": 2.109181141439206e-05,
"loss": 0.5923015475273132,
"step": 239
},
{
"epoch": 1.7689463955637708,
"grad_norm": 4.05252742767334,
"learning_rate": 2.0967741935483873e-05,
"loss": 1.1995235681533813,
"step": 240
},
{
"epoch": 1.7689463955637708,
"eval_loss": 0.7851760983467102,
"eval_runtime": 14.6763,
"eval_samples_per_second": 3.407,
"eval_steps_per_second": 0.886,
"step": 240
},
{
"epoch": 1.7763401109057302,
"grad_norm": 3.0683846473693848,
"learning_rate": 2.0843672456575683e-05,
"loss": 0.923507809638977,
"step": 241
},
{
"epoch": 1.7837338262476896,
"grad_norm": 4.6438374519348145,
"learning_rate": 2.0719602977667497e-05,
"loss": 0.8670483231544495,
"step": 242
},
{
"epoch": 1.7911275415896488,
"grad_norm": 4.422187328338623,
"learning_rate": 2.0595533498759305e-05,
"loss": 0.7011516094207764,
"step": 243
},
{
"epoch": 1.798521256931608,
"grad_norm": 4.1537675857543945,
"learning_rate": 2.0471464019851115e-05,
"loss": 1.2851660251617432,
"step": 244
},
{
"epoch": 1.8059149722735675,
"grad_norm": 3.753478527069092,
"learning_rate": 2.034739454094293e-05,
"loss": 0.6607624292373657,
"step": 245
},
{
"epoch": 1.8133086876155269,
"grad_norm": 3.5585222244262695,
"learning_rate": 2.022332506203474e-05,
"loss": 0.46847808361053467,
"step": 246
},
{
"epoch": 1.820702402957486,
"grad_norm": 3.6007564067840576,
"learning_rate": 2.0099255583126554e-05,
"loss": 0.5693677663803101,
"step": 247
},
{
"epoch": 1.8280961182994455,
"grad_norm": 3.056473970413208,
"learning_rate": 1.9975186104218364e-05,
"loss": 0.27784496545791626,
"step": 248
},
{
"epoch": 1.8354898336414047,
"grad_norm": 3.8631675243377686,
"learning_rate": 1.9851116625310175e-05,
"loss": 0.6002547144889832,
"step": 249
},
{
"epoch": 1.8428835489833642,
"grad_norm": 4.168581962585449,
"learning_rate": 1.9727047146401986e-05,
"loss": 1.1656219959259033,
"step": 250
},
{
"epoch": 1.8428835489833642,
"eval_loss": 0.7865164279937744,
"eval_runtime": 14.7045,
"eval_samples_per_second": 3.4,
"eval_steps_per_second": 0.884,
"step": 250
},
{
"epoch": 1.8502772643253236,
"grad_norm": 3.506394386291504,
"learning_rate": 1.9602977667493796e-05,
"loss": 0.759330153465271,
"step": 251
},
{
"epoch": 1.8576709796672828,
"grad_norm": 4.319957256317139,
"learning_rate": 1.947890818858561e-05,
"loss": 0.9550069570541382,
"step": 252
},
{
"epoch": 1.865064695009242,
"grad_norm": 4.66499662399292,
"learning_rate": 1.935483870967742e-05,
"loss": 0.7672110199928284,
"step": 253
},
{
"epoch": 1.8724584103512014,
"grad_norm": 3.980341672897339,
"learning_rate": 1.923076923076923e-05,
"loss": 1.0426957607269287,
"step": 254
},
{
"epoch": 1.8798521256931608,
"grad_norm": 2.3597588539123535,
"learning_rate": 1.9106699751861042e-05,
"loss": 0.5822687745094299,
"step": 255
},
{
"epoch": 1.8872458410351203,
"grad_norm": 3.7864487171173096,
"learning_rate": 1.8982630272952853e-05,
"loss": 0.6077347993850708,
"step": 256
},
{
"epoch": 1.8946395563770795,
"grad_norm": 2.9949333667755127,
"learning_rate": 1.8858560794044667e-05,
"loss": 0.5098516345024109,
"step": 257
},
{
"epoch": 1.9020332717190387,
"grad_norm": 1.3919459581375122,
"learning_rate": 1.8734491315136477e-05,
"loss": 0.40490952134132385,
"step": 258
},
{
"epoch": 1.9094269870609981,
"grad_norm": 3.4704983234405518,
"learning_rate": 1.8610421836228288e-05,
"loss": 0.4017954468727112,
"step": 259
},
{
"epoch": 1.9168207024029575,
"grad_norm": 3.2767493724823,
"learning_rate": 1.84863523573201e-05,
"loss": 0.4063960611820221,
"step": 260
},
{
"epoch": 1.9168207024029575,
"eval_loss": 0.7780888080596924,
"eval_runtime": 14.5949,
"eval_samples_per_second": 3.426,
"eval_steps_per_second": 0.891,
"step": 260
},
{
"epoch": 1.924214417744917,
"grad_norm": 3.6285297870635986,
"learning_rate": 1.8362282878411912e-05,
"loss": 0.6483629941940308,
"step": 261
},
{
"epoch": 1.9316081330868762,
"grad_norm": 3.957628011703491,
"learning_rate": 1.8238213399503723e-05,
"loss": 0.6059281826019287,
"step": 262
},
{
"epoch": 1.9390018484288354,
"grad_norm": 3.794084072113037,
"learning_rate": 1.8114143920595534e-05,
"loss": 1.0474138259887695,
"step": 263
},
{
"epoch": 1.9463955637707948,
"grad_norm": 4.161247253417969,
"learning_rate": 1.7990074441687348e-05,
"loss": 0.7336093187332153,
"step": 264
},
{
"epoch": 1.9537892791127542,
"grad_norm": 2.166621446609497,
"learning_rate": 1.7866004962779155e-05,
"loss": 0.9245311617851257,
"step": 265
},
{
"epoch": 1.9611829944547134,
"grad_norm": 1.8056215047836304,
"learning_rate": 1.774193548387097e-05,
"loss": 0.4297409653663635,
"step": 266
},
{
"epoch": 1.9685767097966729,
"grad_norm": 2.4709436893463135,
"learning_rate": 1.761786600496278e-05,
"loss": 0.6437153220176697,
"step": 267
},
{
"epoch": 1.975970425138632,
"grad_norm": 4.184484481811523,
"learning_rate": 1.7493796526054593e-05,
"loss": 0.6798198223114014,
"step": 268
},
{
"epoch": 1.9833641404805915,
"grad_norm": 3.1639716625213623,
"learning_rate": 1.7369727047146404e-05,
"loss": 0.44798582792282104,
"step": 269
},
{
"epoch": 1.990757855822551,
"grad_norm": 4.66642951965332,
"learning_rate": 1.7245657568238215e-05,
"loss": 0.7636345028877258,
"step": 270
},
{
"epoch": 1.990757855822551,
"eval_loss": 0.7736530900001526,
"eval_runtime": 14.6752,
"eval_samples_per_second": 3.407,
"eval_steps_per_second": 0.886,
"step": 270
},
{
"epoch": 1.9981515711645101,
"grad_norm": 4.238684177398682,
"learning_rate": 1.7121588089330025e-05,
"loss": 0.6888635158538818,
"step": 271
},
{
"epoch": 2.0,
"grad_norm": 6.728516101837158,
"learning_rate": 1.6997518610421836e-05,
"loss": 0.7793468832969666,
"step": 272
},
{
"epoch": 2.0073937153419594,
"grad_norm": 1.4594340324401855,
"learning_rate": 1.687344913151365e-05,
"loss": 0.4310983717441559,
"step": 273
},
{
"epoch": 2.014787430683919,
"grad_norm": 1.4875929355621338,
"learning_rate": 1.674937965260546e-05,
"loss": 0.8607257604598999,
"step": 274
},
{
"epoch": 2.022181146025878,
"grad_norm": 2.3744559288024902,
"learning_rate": 1.662531017369727e-05,
"loss": 0.5578240156173706,
"step": 275
},
{
"epoch": 2.0295748613678373,
"grad_norm": 3.0702226161956787,
"learning_rate": 1.650124069478908e-05,
"loss": 0.6157624125480652,
"step": 276
},
{
"epoch": 2.0369685767097967,
"grad_norm": 3.3733112812042236,
"learning_rate": 1.6377171215880892e-05,
"loss": 0.37903928756713867,
"step": 277
},
{
"epoch": 2.044362292051756,
"grad_norm": 1.7422901391983032,
"learning_rate": 1.6253101736972706e-05,
"loss": 0.46220725774765015,
"step": 278
},
{
"epoch": 2.0517560073937156,
"grad_norm": 2.0484213829040527,
"learning_rate": 1.6129032258064517e-05,
"loss": 0.7493972182273865,
"step": 279
},
{
"epoch": 2.0591497227356745,
"grad_norm": 2.9543616771698,
"learning_rate": 1.600496277915633e-05,
"loss": 0.4740079641342163,
"step": 280
},
{
"epoch": 2.0591497227356745,
"eval_loss": 0.774247407913208,
"eval_runtime": 14.7788,
"eval_samples_per_second": 3.383,
"eval_steps_per_second": 0.88,
"step": 280
},
{
"epoch": 2.066543438077634,
"grad_norm": 4.02524995803833,
"learning_rate": 1.588089330024814e-05,
"loss": 0.4648398756980896,
"step": 281
},
{
"epoch": 2.0739371534195934,
"grad_norm": 3.726748466491699,
"learning_rate": 1.575682382133995e-05,
"loss": 0.4465940296649933,
"step": 282
},
{
"epoch": 2.081330868761553,
"grad_norm": 3.6973981857299805,
"learning_rate": 1.5632754342431763e-05,
"loss": 1.1393554210662842,
"step": 283
},
{
"epoch": 2.088724584103512,
"grad_norm": 2.837871789932251,
"learning_rate": 1.5508684863523573e-05,
"loss": 0.6313468217849731,
"step": 284
},
{
"epoch": 2.0961182994454712,
"grad_norm": 2.803872585296631,
"learning_rate": 1.5384615384615387e-05,
"loss": 0.42370834946632385,
"step": 285
},
{
"epoch": 2.1035120147874307,
"grad_norm": 2.8776919841766357,
"learning_rate": 1.5260545905707198e-05,
"loss": 0.5538661479949951,
"step": 286
},
{
"epoch": 2.11090573012939,
"grad_norm": 3.7334094047546387,
"learning_rate": 1.513647642679901e-05,
"loss": 0.5879999399185181,
"step": 287
},
{
"epoch": 2.1182994454713495,
"grad_norm": 1.8186419010162354,
"learning_rate": 1.5012406947890819e-05,
"loss": 1.026726484298706,
"step": 288
},
{
"epoch": 2.1256931608133085,
"grad_norm": 3.8631510734558105,
"learning_rate": 1.488833746898263e-05,
"loss": 0.6525065302848816,
"step": 289
},
{
"epoch": 2.133086876155268,
"grad_norm": 3.008190155029297,
"learning_rate": 1.4764267990074444e-05,
"loss": 0.6006858944892883,
"step": 290
},
{
"epoch": 2.133086876155268,
"eval_loss": 0.7701458930969238,
"eval_runtime": 14.5805,
"eval_samples_per_second": 3.429,
"eval_steps_per_second": 0.892,
"step": 290
},
{
"epoch": 2.1404805914972274,
"grad_norm": 3.7055914402008057,
"learning_rate": 1.4640198511166252e-05,
"loss": 0.5744045376777649,
"step": 291
},
{
"epoch": 2.147874306839187,
"grad_norm": 3.3834142684936523,
"learning_rate": 1.4516129032258066e-05,
"loss": 0.5752605199813843,
"step": 292
},
{
"epoch": 2.155268022181146,
"grad_norm": 2.1001501083374023,
"learning_rate": 1.4392059553349877e-05,
"loss": 0.3292985260486603,
"step": 293
},
{
"epoch": 2.162661737523105,
"grad_norm": 2.7614121437072754,
"learning_rate": 1.4267990074441686e-05,
"loss": 0.4825969934463501,
"step": 294
},
{
"epoch": 2.1700554528650646,
"grad_norm": 1.8585422039031982,
"learning_rate": 1.41439205955335e-05,
"loss": 0.3931984007358551,
"step": 295
},
{
"epoch": 2.177449168207024,
"grad_norm": 3.197474479675293,
"learning_rate": 1.401985111662531e-05,
"loss": 0.4858049154281616,
"step": 296
},
{
"epoch": 2.1848428835489835,
"grad_norm": 3.774609327316284,
"learning_rate": 1.3895781637717123e-05,
"loss": 0.5701273083686829,
"step": 297
},
{
"epoch": 2.1922365988909425,
"grad_norm": 3.7056381702423096,
"learning_rate": 1.3771712158808933e-05,
"loss": 0.35671544075012207,
"step": 298
},
{
"epoch": 2.199630314232902,
"grad_norm": 3.762648344039917,
"learning_rate": 1.3647642679900746e-05,
"loss": 0.38978254795074463,
"step": 299
},
{
"epoch": 2.2070240295748613,
"grad_norm": 2.4346160888671875,
"learning_rate": 1.3523573200992556e-05,
"loss": 0.3817184865474701,
"step": 300
},
{
"epoch": 2.2070240295748613,
"eval_loss": 0.771511971950531,
"eval_runtime": 14.7091,
"eval_samples_per_second": 3.399,
"eval_steps_per_second": 0.884,
"step": 300
},
{
"epoch": 2.2144177449168208,
"grad_norm": 3.8731868267059326,
"learning_rate": 1.3399503722084367e-05,
"loss": 0.49884963035583496,
"step": 301
},
{
"epoch": 2.22181146025878,
"grad_norm": 2.4828414916992188,
"learning_rate": 1.327543424317618e-05,
"loss": 0.15124742686748505,
"step": 302
},
{
"epoch": 2.229205175600739,
"grad_norm": 4.272462368011475,
"learning_rate": 1.315136476426799e-05,
"loss": 0.47460150718688965,
"step": 303
},
{
"epoch": 2.2365988909426986,
"grad_norm": 4.066652774810791,
"learning_rate": 1.3027295285359802e-05,
"loss": 0.6313046813011169,
"step": 304
},
{
"epoch": 2.243992606284658,
"grad_norm": 3.1820685863494873,
"learning_rate": 1.2903225806451613e-05,
"loss": 0.39370083808898926,
"step": 305
},
{
"epoch": 2.2513863216266174,
"grad_norm": 3.9971110820770264,
"learning_rate": 1.2779156327543427e-05,
"loss": 0.5994598865509033,
"step": 306
},
{
"epoch": 2.258780036968577,
"grad_norm": 0.996334969997406,
"learning_rate": 1.2655086848635236e-05,
"loss": 0.32513830065727234,
"step": 307
},
{
"epoch": 2.266173752310536,
"grad_norm": 4.294183254241943,
"learning_rate": 1.2531017369727046e-05,
"loss": 0.6398261785507202,
"step": 308
},
{
"epoch": 2.2735674676524953,
"grad_norm": 3.178579092025757,
"learning_rate": 1.240694789081886e-05,
"loss": 0.3428504467010498,
"step": 309
},
{
"epoch": 2.2809611829944547,
"grad_norm": 2.2119312286376953,
"learning_rate": 1.2282878411910669e-05,
"loss": 0.46374407410621643,
"step": 310
},
{
"epoch": 2.2809611829944547,
"eval_loss": 0.7703814506530762,
"eval_runtime": 14.7466,
"eval_samples_per_second": 3.391,
"eval_steps_per_second": 0.882,
"step": 310
},
{
"epoch": 2.288354898336414,
"grad_norm": 3.7887892723083496,
"learning_rate": 1.2158808933002481e-05,
"loss": 0.5297147035598755,
"step": 311
},
{
"epoch": 2.2957486136783736,
"grad_norm": 1.7170554399490356,
"learning_rate": 1.2034739454094294e-05,
"loss": 0.32796400785446167,
"step": 312
},
{
"epoch": 2.3031423290203326,
"grad_norm": 1.6616400480270386,
"learning_rate": 1.1910669975186104e-05,
"loss": 0.4169609546661377,
"step": 313
},
{
"epoch": 2.310536044362292,
"grad_norm": 4.250360012054443,
"learning_rate": 1.1786600496277917e-05,
"loss": 0.5692564845085144,
"step": 314
},
{
"epoch": 2.3179297597042514,
"grad_norm": 3.9190673828125,
"learning_rate": 1.1662531017369727e-05,
"loss": 0.2902570962905884,
"step": 315
},
{
"epoch": 2.325323475046211,
"grad_norm": 3.265540599822998,
"learning_rate": 1.153846153846154e-05,
"loss": 0.22921332716941833,
"step": 316
},
{
"epoch": 2.33271719038817,
"grad_norm": 3.34489369392395,
"learning_rate": 1.141439205955335e-05,
"loss": 0.3899090886116028,
"step": 317
},
{
"epoch": 2.3401109057301293,
"grad_norm": 2.0498178005218506,
"learning_rate": 1.129032258064516e-05,
"loss": 0.45650577545166016,
"step": 318
},
{
"epoch": 2.3475046210720887,
"grad_norm": 4.382551670074463,
"learning_rate": 1.1166253101736973e-05,
"loss": 0.6734753847122192,
"step": 319
},
{
"epoch": 2.354898336414048,
"grad_norm": 4.091598987579346,
"learning_rate": 1.1042183622828785e-05,
"loss": 0.608093798160553,
"step": 320
},
{
"epoch": 2.354898336414048,
"eval_loss": 0.7693940997123718,
"eval_runtime": 14.6834,
"eval_samples_per_second": 3.405,
"eval_steps_per_second": 0.885,
"step": 320
},
{
"epoch": 2.3622920517560075,
"grad_norm": 4.082503318786621,
"learning_rate": 1.0918114143920596e-05,
"loss": 0.43649721145629883,
"step": 321
},
{
"epoch": 2.369685767097967,
"grad_norm": 3.7380568981170654,
"learning_rate": 1.0794044665012408e-05,
"loss": 0.4303453862667084,
"step": 322
},
{
"epoch": 2.377079482439926,
"grad_norm": 3.448054313659668,
"learning_rate": 1.0669975186104219e-05,
"loss": 0.9947173595428467,
"step": 323
},
{
"epoch": 2.3844731977818854,
"grad_norm": 3.79837703704834,
"learning_rate": 1.054590570719603e-05,
"loss": 0.4145554304122925,
"step": 324
},
{
"epoch": 2.391866913123845,
"grad_norm": 3.390570640563965,
"learning_rate": 1.0421836228287842e-05,
"loss": 1.0003561973571777,
"step": 325
},
{
"epoch": 2.3992606284658042,
"grad_norm": 4.022547245025635,
"learning_rate": 1.0297766749379652e-05,
"loss": 0.37200576066970825,
"step": 326
},
{
"epoch": 2.406654343807763,
"grad_norm": 3.9541947841644287,
"learning_rate": 1.0173697270471465e-05,
"loss": 0.617558479309082,
"step": 327
},
{
"epoch": 2.4140480591497226,
"grad_norm": 2.225595235824585,
"learning_rate": 1.0049627791563277e-05,
"loss": 0.4966333508491516,
"step": 328
},
{
"epoch": 2.421441774491682,
"grad_norm": 4.891867637634277,
"learning_rate": 9.925558312655088e-06,
"loss": 0.44887012243270874,
"step": 329
},
{
"epoch": 2.4288354898336415,
"grad_norm": 1.9620754718780518,
"learning_rate": 9.801488833746898e-06,
"loss": 0.27701541781425476,
"step": 330
},
{
"epoch": 2.4288354898336415,
"eval_loss": 0.768280029296875,
"eval_runtime": 14.6898,
"eval_samples_per_second": 3.404,
"eval_steps_per_second": 0.885,
"step": 330
},
{
"epoch": 2.436229205175601,
"grad_norm": 4.712418079376221,
"learning_rate": 9.67741935483871e-06,
"loss": 0.6389679908752441,
"step": 331
},
{
"epoch": 2.44362292051756,
"grad_norm": 1.852449893951416,
"learning_rate": 9.553349875930521e-06,
"loss": 1.1038583517074585,
"step": 332
},
{
"epoch": 2.4510166358595193,
"grad_norm": 4.138819694519043,
"learning_rate": 9.429280397022333e-06,
"loss": 0.43939751386642456,
"step": 333
},
{
"epoch": 2.4584103512014788,
"grad_norm": 2.835935354232788,
"learning_rate": 9.305210918114144e-06,
"loss": 0.41257309913635254,
"step": 334
},
{
"epoch": 2.465804066543438,
"grad_norm": 2.160979986190796,
"learning_rate": 9.181141439205956e-06,
"loss": 0.39569902420043945,
"step": 335
},
{
"epoch": 2.473197781885397,
"grad_norm": 3.6228151321411133,
"learning_rate": 9.057071960297767e-06,
"loss": 0.5179893970489502,
"step": 336
},
{
"epoch": 2.4805914972273566,
"grad_norm": 3.591714382171631,
"learning_rate": 8.933002481389577e-06,
"loss": 0.4214794933795929,
"step": 337
},
{
"epoch": 2.487985212569316,
"grad_norm": 3.018785238265991,
"learning_rate": 8.80893300248139e-06,
"loss": 0.5895953178405762,
"step": 338
},
{
"epoch": 2.4953789279112755,
"grad_norm": 3.907846689224243,
"learning_rate": 8.684863523573202e-06,
"loss": 0.5587291717529297,
"step": 339
},
{
"epoch": 2.502772643253235,
"grad_norm": 3.9467413425445557,
"learning_rate": 8.560794044665013e-06,
"loss": 0.4495808482170105,
"step": 340
},
{
"epoch": 2.502772643253235,
"eval_loss": 0.7679100036621094,
"eval_runtime": 14.7533,
"eval_samples_per_second": 3.389,
"eval_steps_per_second": 0.881,
"step": 340
},
{
"epoch": 2.5101663585951943,
"grad_norm": 3.962733507156372,
"learning_rate": 8.436724565756825e-06,
"loss": 0.3088897466659546,
"step": 341
},
{
"epoch": 2.5175600739371533,
"grad_norm": 4.829586505889893,
"learning_rate": 8.312655086848635e-06,
"loss": 0.4583315849304199,
"step": 342
},
{
"epoch": 2.5249537892791127,
"grad_norm": 2.465217113494873,
"learning_rate": 8.188585607940446e-06,
"loss": 0.5734530687332153,
"step": 343
},
{
"epoch": 2.532347504621072,
"grad_norm": 1.578626275062561,
"learning_rate": 8.064516129032258e-06,
"loss": 0.29778629541397095,
"step": 344
},
{
"epoch": 2.539741219963031,
"grad_norm": 3.794196605682373,
"learning_rate": 7.94044665012407e-06,
"loss": 0.514739990234375,
"step": 345
},
{
"epoch": 2.5471349353049906,
"grad_norm": 4.320169448852539,
"learning_rate": 7.816377171215881e-06,
"loss": 0.36768847703933716,
"step": 346
},
{
"epoch": 2.55452865064695,
"grad_norm": 3.7134804725646973,
"learning_rate": 7.692307692307694e-06,
"loss": 0.32225626707077026,
"step": 347
},
{
"epoch": 2.5619223659889094,
"grad_norm": 3.2205772399902344,
"learning_rate": 7.568238213399505e-06,
"loss": 0.45840057730674744,
"step": 348
},
{
"epoch": 2.569316081330869,
"grad_norm": 5.132753372192383,
"learning_rate": 7.444168734491315e-06,
"loss": 0.6190608739852905,
"step": 349
},
{
"epoch": 2.5767097966728283,
"grad_norm": 2.7665748596191406,
"learning_rate": 7.320099255583126e-06,
"loss": 0.2809644937515259,
"step": 350
},
{
"epoch": 2.5767097966728283,
"eval_loss": 0.7658350467681885,
"eval_runtime": 14.6579,
"eval_samples_per_second": 3.411,
"eval_steps_per_second": 0.887,
"step": 350
},
{
"epoch": 2.5841035120147873,
"grad_norm": 4.205397605895996,
"learning_rate": 7.1960297766749385e-06,
"loss": 0.30544620752334595,
"step": 351
},
{
"epoch": 2.5914972273567467,
"grad_norm": 2.3894495964050293,
"learning_rate": 7.07196029776675e-06,
"loss": 0.310545414686203,
"step": 352
},
{
"epoch": 2.598890942698706,
"grad_norm": 3.995877981185913,
"learning_rate": 6.9478908188585614e-06,
"loss": 0.5483052730560303,
"step": 353
},
{
"epoch": 2.6062846580406656,
"grad_norm": 3.834993362426758,
"learning_rate": 6.823821339950373e-06,
"loss": 0.8772858381271362,
"step": 354
},
{
"epoch": 2.6136783733826245,
"grad_norm": 4.7651777267456055,
"learning_rate": 6.6997518610421835e-06,
"loss": 0.4968230128288269,
"step": 355
},
{
"epoch": 2.621072088724584,
"grad_norm": 4.165541648864746,
"learning_rate": 6.575682382133995e-06,
"loss": 0.5299187898635864,
"step": 356
},
{
"epoch": 2.6284658040665434,
"grad_norm": 5.075289726257324,
"learning_rate": 6.451612903225806e-06,
"loss": 0.4870533049106598,
"step": 357
},
{
"epoch": 2.635859519408503,
"grad_norm": 4.575265884399414,
"learning_rate": 6.327543424317618e-06,
"loss": 0.8198877573013306,
"step": 358
},
{
"epoch": 2.6432532347504623,
"grad_norm": 4.340782165527344,
"learning_rate": 6.20347394540943e-06,
"loss": 0.3996822237968445,
"step": 359
},
{
"epoch": 2.6506469500924217,
"grad_norm": 4.009160995483398,
"learning_rate": 6.079404466501241e-06,
"loss": 0.40964275598526,
"step": 360
},
{
"epoch": 2.6506469500924217,
"eval_loss": 0.7657684087753296,
"eval_runtime": 14.717,
"eval_samples_per_second": 3.397,
"eval_steps_per_second": 0.883,
"step": 360
},
{
"epoch": 2.6580406654343807,
"grad_norm": 3.997911214828491,
"learning_rate": 5.955334987593052e-06,
"loss": 0.3987128734588623,
"step": 361
},
{
"epoch": 2.66543438077634,
"grad_norm": 3.6921792030334473,
"learning_rate": 5.831265508684864e-06,
"loss": 0.4136401116847992,
"step": 362
},
{
"epoch": 2.6728280961182995,
"grad_norm": 4.61245059967041,
"learning_rate": 5.707196029776675e-06,
"loss": 0.4332594573497772,
"step": 363
},
{
"epoch": 2.6802218114602585,
"grad_norm": 3.801255702972412,
"learning_rate": 5.5831265508684865e-06,
"loss": 0.4616243243217468,
"step": 364
},
{
"epoch": 2.687615526802218,
"grad_norm": 3.358360767364502,
"learning_rate": 5.459057071960298e-06,
"loss": 0.29757314920425415,
"step": 365
},
{
"epoch": 2.6950092421441774,
"grad_norm": 3.087639331817627,
"learning_rate": 5.334987593052109e-06,
"loss": 0.32710200548171997,
"step": 366
},
{
"epoch": 2.702402957486137,
"grad_norm": 4.153397083282471,
"learning_rate": 5.210918114143921e-06,
"loss": 0.3512117564678192,
"step": 367
},
{
"epoch": 2.709796672828096,
"grad_norm": 4.165513038635254,
"learning_rate": 5.086848635235732e-06,
"loss": 0.8789117932319641,
"step": 368
},
{
"epoch": 2.7171903881700556,
"grad_norm": 4.394218921661377,
"learning_rate": 4.962779156327544e-06,
"loss": 0.5227751135826111,
"step": 369
},
{
"epoch": 2.7245841035120146,
"grad_norm": 4.3006110191345215,
"learning_rate": 4.838709677419355e-06,
"loss": 0.6214644312858582,
"step": 370
},
{
"epoch": 2.7245841035120146,
"eval_loss": 0.7669808268547058,
"eval_runtime": 14.7732,
"eval_samples_per_second": 3.385,
"eval_steps_per_second": 0.88,
"step": 370
},
{
"epoch": 2.731977818853974,
"grad_norm": 4.888645172119141,
"learning_rate": 4.714640198511167e-06,
"loss": 0.8665144443511963,
"step": 371
},
{
"epoch": 2.7393715341959335,
"grad_norm": 3.778118371963501,
"learning_rate": 4.590570719602978e-06,
"loss": 0.33991459012031555,
"step": 372
},
{
"epoch": 2.746765249537893,
"grad_norm": 2.7993180751800537,
"learning_rate": 4.466501240694789e-06,
"loss": 0.6993688344955444,
"step": 373
},
{
"epoch": 2.754158964879852,
"grad_norm": 4.365177154541016,
"learning_rate": 4.342431761786601e-06,
"loss": 0.3615218997001648,
"step": 374
},
{
"epoch": 2.7615526802218113,
"grad_norm": 3.846773862838745,
"learning_rate": 4.2183622828784124e-06,
"loss": 0.39533162117004395,
"step": 375
},
{
"epoch": 2.7689463955637708,
"grad_norm": 4.7195725440979,
"learning_rate": 4.094292803970223e-06,
"loss": 0.7132782340049744,
"step": 376
},
{
"epoch": 2.77634011090573,
"grad_norm": 5.103621482849121,
"learning_rate": 3.970223325062035e-06,
"loss": 0.7199317812919617,
"step": 377
},
{
"epoch": 2.7837338262476896,
"grad_norm": 1.6189250946044922,
"learning_rate": 3.846153846153847e-06,
"loss": 0.6657246947288513,
"step": 378
},
{
"epoch": 2.791127541589649,
"grad_norm": 1.8573932647705078,
"learning_rate": 3.7220843672456574e-06,
"loss": 0.5098580718040466,
"step": 379
},
{
"epoch": 2.798521256931608,
"grad_norm": 4.506024360656738,
"learning_rate": 3.5980148883374693e-06,
"loss": 0.6152743697166443,
"step": 380
},
{
"epoch": 2.798521256931608,
"eval_loss": 0.7685391306877136,
"eval_runtime": 14.6745,
"eval_samples_per_second": 3.407,
"eval_steps_per_second": 0.886,
"step": 380
},
{
"epoch": 2.8059149722735675,
"grad_norm": 3.2825143337249756,
"learning_rate": 3.4739454094292807e-06,
"loss": 0.44237416982650757,
"step": 381
},
{
"epoch": 2.813308687615527,
"grad_norm": 4.352462291717529,
"learning_rate": 3.3498759305210917e-06,
"loss": 0.6616033315658569,
"step": 382
},
{
"epoch": 2.820702402957486,
"grad_norm": 2.646233081817627,
"learning_rate": 3.225806451612903e-06,
"loss": 1.343247890472412,
"step": 383
},
{
"epoch": 2.8280961182994453,
"grad_norm": 4.7132368087768555,
"learning_rate": 3.101736972704715e-06,
"loss": 0.5540533661842346,
"step": 384
},
{
"epoch": 2.8354898336414047,
"grad_norm": 4.393060684204102,
"learning_rate": 2.977667493796526e-06,
"loss": 0.3722197711467743,
"step": 385
},
{
"epoch": 2.842883548983364,
"grad_norm": 3.9295449256896973,
"learning_rate": 2.8535980148883375e-06,
"loss": 0.4926016926765442,
"step": 386
},
{
"epoch": 2.8502772643253236,
"grad_norm": 4.140054225921631,
"learning_rate": 2.729528535980149e-06,
"loss": 0.671159565448761,
"step": 387
},
{
"epoch": 2.857670979667283,
"grad_norm": 1.8080183267593384,
"learning_rate": 2.6054590570719604e-06,
"loss": 0.30225613713264465,
"step": 388
},
{
"epoch": 2.865064695009242,
"grad_norm": 3.795689582824707,
"learning_rate": 2.481389578163772e-06,
"loss": 0.30790403485298157,
"step": 389
},
{
"epoch": 2.8724584103512014,
"grad_norm": 3.827852725982666,
"learning_rate": 2.3573200992555833e-06,
"loss": 0.38701093196868896,
"step": 390
},
{
"epoch": 2.8724584103512014,
"eval_loss": 0.7680988907814026,
"eval_runtime": 14.7048,
"eval_samples_per_second": 3.4,
"eval_steps_per_second": 0.884,
"step": 390
},
{
"epoch": 2.879852125693161,
"grad_norm": 4.782068729400635,
"learning_rate": 2.2332506203473944e-06,
"loss": 0.3287886083126068,
"step": 391
},
{
"epoch": 2.8872458410351203,
"grad_norm": 3.9645960330963135,
"learning_rate": 2.1091811414392062e-06,
"loss": 0.3570128381252289,
"step": 392
},
{
"epoch": 2.8946395563770793,
"grad_norm": 1.9487789869308472,
"learning_rate": 1.9851116625310177e-06,
"loss": 0.36440327763557434,
"step": 393
},
{
"epoch": 2.9020332717190387,
"grad_norm": 4.191056728363037,
"learning_rate": 1.8610421836228287e-06,
"loss": 0.4157246947288513,
"step": 394
},
{
"epoch": 2.909426987060998,
"grad_norm": 3.8392462730407715,
"learning_rate": 1.7369727047146404e-06,
"loss": 0.4623328447341919,
"step": 395
},
{
"epoch": 2.9168207024029575,
"grad_norm": 5.019207000732422,
"learning_rate": 1.6129032258064516e-06,
"loss": 0.8991196155548096,
"step": 396
},
{
"epoch": 2.924214417744917,
"grad_norm": 4.490087509155273,
"learning_rate": 1.488833746898263e-06,
"loss": 0.548180103302002,
"step": 397
},
{
"epoch": 2.9316081330868764,
"grad_norm": 5.643899440765381,
"learning_rate": 1.3647642679900745e-06,
"loss": 0.7324087619781494,
"step": 398
},
{
"epoch": 2.9390018484288354,
"grad_norm": 4.432566165924072,
"learning_rate": 1.240694789081886e-06,
"loss": 0.32455164194107056,
"step": 399
},
{
"epoch": 2.946395563770795,
"grad_norm": 4.33750581741333,
"learning_rate": 1.1166253101736972e-06,
"loss": 0.4725751280784607,
"step": 400
},
{
"epoch": 2.946395563770795,
"eval_loss": 0.7677021622657776,
"eval_runtime": 14.6144,
"eval_samples_per_second": 3.421,
"eval_steps_per_second": 0.89,
"step": 400
}
],
"logging_steps": 1,
"max_steps": 408,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 10,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.2864504986317824e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}