MathDeepSeek2 / last-checkpoint /trainer_state.json
anhdai312's picture
Training in progress, step 408, checkpoint
771d299 verified
Raw
History Blame Contribute Delete
84.6 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_global_step": 408,
"best_metric": 0.6750363707542419,
"best_model_checkpoint": "/kaggle/working/sep490_checkpoints/job_ce30cf18-8eef-4444-8cae-3f972a780634/checkpoint-408",
"epoch": 3.0,
"eval_steps": 10,
"global_step": 408,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0073937153419593345,
"grad_norm": 1.7587594985961914,
"learning_rate": 0.0,
"loss": 2.691019296646118,
"step": 1
},
{
"epoch": 0.014787430683918669,
"grad_norm": 1.930446982383728,
"learning_rate": 1e-05,
"loss": 2.75667667388916,
"step": 2
},
{
"epoch": 0.022181146025878003,
"grad_norm": 1.953555703163147,
"learning_rate": 2e-05,
"loss": 3.7232160568237305,
"step": 3
},
{
"epoch": 0.029574861367837338,
"grad_norm": 1.4509127140045166,
"learning_rate": 3e-05,
"loss": 2.9131853580474854,
"step": 4
},
{
"epoch": 0.036968576709796676,
"grad_norm": 2.036184310913086,
"learning_rate": 4e-05,
"loss": 3.0811572074890137,
"step": 5
},
{
"epoch": 0.04436229205175601,
"grad_norm": 1.7680681943893433,
"learning_rate": 5e-05,
"loss": 2.68190598487854,
"step": 6
},
{
"epoch": 0.051756007393715345,
"grad_norm": 2.4544951915740967,
"learning_rate": 4.987593052109181e-05,
"loss": 3.960662364959717,
"step": 7
},
{
"epoch": 0.059149722735674676,
"grad_norm": 1.7252415418624878,
"learning_rate": 4.9751861042183624e-05,
"loss": 2.195984125137329,
"step": 8
},
{
"epoch": 0.066543438077634,
"grad_norm": 1.9524086713790894,
"learning_rate": 4.962779156327544e-05,
"loss": 2.1853127479553223,
"step": 9
},
{
"epoch": 0.07393715341959335,
"grad_norm": 2.1538190841674805,
"learning_rate": 4.950372208436725e-05,
"loss": 2.8134853839874268,
"step": 10
},
{
"epoch": 0.07393715341959335,
"eval_loss": 2.3912832736968994,
"eval_runtime": 11.6038,
"eval_samples_per_second": 4.309,
"eval_steps_per_second": 1.12,
"step": 10
},
{
"epoch": 0.08133086876155268,
"grad_norm": 1.9469140768051147,
"learning_rate": 4.937965260545906e-05,
"loss": 2.1433486938476562,
"step": 11
},
{
"epoch": 0.08872458410351201,
"grad_norm": 2.3120369911193848,
"learning_rate": 4.9255583126550866e-05,
"loss": 2.385965347290039,
"step": 12
},
{
"epoch": 0.09611829944547134,
"grad_norm": 2.2094929218292236,
"learning_rate": 4.9131513647642677e-05,
"loss": 2.4737462997436523,
"step": 13
},
{
"epoch": 0.10351201478743069,
"grad_norm": 2.6324586868286133,
"learning_rate": 4.9007444168734494e-05,
"loss": 2.3202741146087646,
"step": 14
},
{
"epoch": 0.11090573012939002,
"grad_norm": 2.2847135066986084,
"learning_rate": 4.8883374689826305e-05,
"loss": 2.369445323944092,
"step": 15
},
{
"epoch": 0.11829944547134935,
"grad_norm": 2.079944133758545,
"learning_rate": 4.8759305210918115e-05,
"loss": 2.015984058380127,
"step": 16
},
{
"epoch": 0.1256931608133087,
"grad_norm": 2.3084442615509033,
"learning_rate": 4.8635235732009926e-05,
"loss": 2.0963761806488037,
"step": 17
},
{
"epoch": 0.133086876155268,
"grad_norm": 2.5707437992095947,
"learning_rate": 4.851116625310174e-05,
"loss": 2.4691004753112793,
"step": 18
},
{
"epoch": 0.14048059149722736,
"grad_norm": 2.2389156818389893,
"learning_rate": 4.8387096774193554e-05,
"loss": 2.1746907234191895,
"step": 19
},
{
"epoch": 0.1478743068391867,
"grad_norm": 2.1317756175994873,
"learning_rate": 4.8263027295285364e-05,
"loss": 2.1674509048461914,
"step": 20
},
{
"epoch": 0.1478743068391867,
"eval_loss": 1.91414213180542,
"eval_runtime": 12.5864,
"eval_samples_per_second": 3.973,
"eval_steps_per_second": 1.033,
"step": 20
},
{
"epoch": 0.15526802218114602,
"grad_norm": 2.428013563156128,
"learning_rate": 4.8138957816377175e-05,
"loss": 1.9142755270004272,
"step": 21
},
{
"epoch": 0.16266173752310537,
"grad_norm": 2.3884992599487305,
"learning_rate": 4.8014888337468986e-05,
"loss": 2.2496678829193115,
"step": 22
},
{
"epoch": 0.17005545286506468,
"grad_norm": 1.786407232284546,
"learning_rate": 4.7890818858560796e-05,
"loss": 1.8403816223144531,
"step": 23
},
{
"epoch": 0.17744916820702403,
"grad_norm": 2.4553239345550537,
"learning_rate": 4.776674937965261e-05,
"loss": 2.4630396366119385,
"step": 24
},
{
"epoch": 0.18484288354898337,
"grad_norm": 2.4950063228607178,
"learning_rate": 4.764267990074442e-05,
"loss": 1.4519834518432617,
"step": 25
},
{
"epoch": 0.1922365988909427,
"grad_norm": 2.243168354034424,
"learning_rate": 4.751861042183623e-05,
"loss": 1.7111647129058838,
"step": 26
},
{
"epoch": 0.19963031423290203,
"grad_norm": 2.569514274597168,
"learning_rate": 4.739454094292804e-05,
"loss": 1.9534958600997925,
"step": 27
},
{
"epoch": 0.20702402957486138,
"grad_norm": 2.2852730751037598,
"learning_rate": 4.7270471464019856e-05,
"loss": 1.4022412300109863,
"step": 28
},
{
"epoch": 0.2144177449168207,
"grad_norm": 2.4911389350891113,
"learning_rate": 4.7146401985111667e-05,
"loss": 1.627483606338501,
"step": 29
},
{
"epoch": 0.22181146025878004,
"grad_norm": 2.8639137744903564,
"learning_rate": 4.702233250620348e-05,
"loss": 1.8156955242156982,
"step": 30
},
{
"epoch": 0.22181146025878004,
"eval_loss": 1.637284755706787,
"eval_runtime": 12.06,
"eval_samples_per_second": 4.146,
"eval_steps_per_second": 1.078,
"step": 30
},
{
"epoch": 0.22920517560073936,
"grad_norm": 2.854050397872925,
"learning_rate": 4.689826302729529e-05,
"loss": 1.8234474658966064,
"step": 31
},
{
"epoch": 0.2365988909426987,
"grad_norm": 2.51224684715271,
"learning_rate": 4.67741935483871e-05,
"loss": 1.630173683166504,
"step": 32
},
{
"epoch": 0.24399260628465805,
"grad_norm": 2.530003786087036,
"learning_rate": 4.665012406947891e-05,
"loss": 2.195810317993164,
"step": 33
},
{
"epoch": 0.2513863216266174,
"grad_norm": 2.8960745334625244,
"learning_rate": 4.652605459057072e-05,
"loss": 2.0083396434783936,
"step": 34
},
{
"epoch": 0.2587800369685767,
"grad_norm": 2.9172658920288086,
"learning_rate": 4.640198511166253e-05,
"loss": 1.4498248100280762,
"step": 35
},
{
"epoch": 0.266173752310536,
"grad_norm": 2.2400825023651123,
"learning_rate": 4.627791563275434e-05,
"loss": 1.1269171237945557,
"step": 36
},
{
"epoch": 0.2735674676524954,
"grad_norm": 2.538266181945801,
"learning_rate": 4.615384615384616e-05,
"loss": 1.8185009956359863,
"step": 37
},
{
"epoch": 0.2809611829944547,
"grad_norm": 2.3526978492736816,
"learning_rate": 4.602977667493797e-05,
"loss": 1.0682374238967896,
"step": 38
},
{
"epoch": 0.28835489833641403,
"grad_norm": 2.8807811737060547,
"learning_rate": 4.590570719602978e-05,
"loss": 2.21337890625,
"step": 39
},
{
"epoch": 0.2957486136783734,
"grad_norm": 2.7879021167755127,
"learning_rate": 4.578163771712159e-05,
"loss": 1.689092755317688,
"step": 40
},
{
"epoch": 0.2957486136783734,
"eval_loss": 1.4498449563980103,
"eval_runtime": 12.5884,
"eval_samples_per_second": 3.972,
"eval_steps_per_second": 1.033,
"step": 40
},
{
"epoch": 0.3031423290203327,
"grad_norm": 2.432206392288208,
"learning_rate": 4.56575682382134e-05,
"loss": 1.2275516986846924,
"step": 41
},
{
"epoch": 0.31053604436229204,
"grad_norm": 3.0099549293518066,
"learning_rate": 4.553349875930522e-05,
"loss": 1.185080647468567,
"step": 42
},
{
"epoch": 0.3179297597042514,
"grad_norm": 2.7897891998291016,
"learning_rate": 4.540942928039703e-05,
"loss": 1.3819549083709717,
"step": 43
},
{
"epoch": 0.32532347504621073,
"grad_norm": 2.8821756839752197,
"learning_rate": 4.528535980148884e-05,
"loss": 1.3627997636795044,
"step": 44
},
{
"epoch": 0.33271719038817005,
"grad_norm": 3.9456920623779297,
"learning_rate": 4.516129032258064e-05,
"loss": 1.792586326599121,
"step": 45
},
{
"epoch": 0.34011090573012936,
"grad_norm": 2.7059478759765625,
"learning_rate": 4.5037220843672454e-05,
"loss": 1.4585685729980469,
"step": 46
},
{
"epoch": 0.34750462107208874,
"grad_norm": 3.4259610176086426,
"learning_rate": 4.491315136476427e-05,
"loss": 2.1591320037841797,
"step": 47
},
{
"epoch": 0.35489833641404805,
"grad_norm": 3.6107091903686523,
"learning_rate": 4.478908188585608e-05,
"loss": 1.9699089527130127,
"step": 48
},
{
"epoch": 0.36229205175600737,
"grad_norm": 2.445187568664551,
"learning_rate": 4.466501240694789e-05,
"loss": 1.0851035118103027,
"step": 49
},
{
"epoch": 0.36968576709796674,
"grad_norm": 3.2657907009124756,
"learning_rate": 4.45409429280397e-05,
"loss": 1.8776271343231201,
"step": 50
},
{
"epoch": 0.36968576709796674,
"eval_loss": 1.2967743873596191,
"eval_runtime": 12.5267,
"eval_samples_per_second": 3.991,
"eval_steps_per_second": 1.038,
"step": 50
},
{
"epoch": 0.37707948243992606,
"grad_norm": 3.1562914848327637,
"learning_rate": 4.441687344913151e-05,
"loss": 1.5886495113372803,
"step": 51
},
{
"epoch": 0.3844731977818854,
"grad_norm": 3.7622435092926025,
"learning_rate": 4.429280397022333e-05,
"loss": 1.5878514051437378,
"step": 52
},
{
"epoch": 0.39186691312384475,
"grad_norm": 3.235161066055298,
"learning_rate": 4.416873449131514e-05,
"loss": 1.307330846786499,
"step": 53
},
{
"epoch": 0.39926062846580407,
"grad_norm": 3.034426212310791,
"learning_rate": 4.404466501240695e-05,
"loss": 1.0698113441467285,
"step": 54
},
{
"epoch": 0.4066543438077634,
"grad_norm": 3.166105270385742,
"learning_rate": 4.392059553349876e-05,
"loss": 1.3888237476348877,
"step": 55
},
{
"epoch": 0.41404805914972276,
"grad_norm": 3.379401922225952,
"learning_rate": 4.379652605459057e-05,
"loss": 1.4811557531356812,
"step": 56
},
{
"epoch": 0.4214417744916821,
"grad_norm": 2.8660521507263184,
"learning_rate": 4.3672456575682384e-05,
"loss": 1.2131584882736206,
"step": 57
},
{
"epoch": 0.4288354898336414,
"grad_norm": 2.932765245437622,
"learning_rate": 4.3548387096774194e-05,
"loss": 1.1394425630569458,
"step": 58
},
{
"epoch": 0.43622920517560076,
"grad_norm": 3.085935354232788,
"learning_rate": 4.3424317617866005e-05,
"loss": 1.2639648914337158,
"step": 59
},
{
"epoch": 0.4436229205175601,
"grad_norm": 2.835193157196045,
"learning_rate": 4.3300248138957816e-05,
"loss": 1.256007194519043,
"step": 60
},
{
"epoch": 0.4436229205175601,
"eval_loss": 1.171344518661499,
"eval_runtime": 12.3887,
"eval_samples_per_second": 4.036,
"eval_steps_per_second": 1.049,
"step": 60
},
{
"epoch": 0.4510166358595194,
"grad_norm": 4.220600128173828,
"learning_rate": 4.317617866004963e-05,
"loss": 1.1558457612991333,
"step": 61
},
{
"epoch": 0.4584103512014787,
"grad_norm": 3.2328484058380127,
"learning_rate": 4.3052109181141444e-05,
"loss": 1.7892142534255981,
"step": 62
},
{
"epoch": 0.4658040665434381,
"grad_norm": 3.1310110092163086,
"learning_rate": 4.2928039702233254e-05,
"loss": 1.5464088916778564,
"step": 63
},
{
"epoch": 0.4731977818853974,
"grad_norm": 2.7544875144958496,
"learning_rate": 4.2803970223325065e-05,
"loss": 1.1755099296569824,
"step": 64
},
{
"epoch": 0.4805914972273567,
"grad_norm": 2.8833136558532715,
"learning_rate": 4.2679900744416875e-05,
"loss": 1.0351439714431763,
"step": 65
},
{
"epoch": 0.4879852125693161,
"grad_norm": 3.911613702774048,
"learning_rate": 4.2555831265508686e-05,
"loss": 1.674350619316101,
"step": 66
},
{
"epoch": 0.4953789279112754,
"grad_norm": 3.5602052211761475,
"learning_rate": 4.2431761786600497e-05,
"loss": 1.8415451049804688,
"step": 67
},
{
"epoch": 0.5027726432532348,
"grad_norm": 3.243236541748047,
"learning_rate": 4.230769230769231e-05,
"loss": 0.9139584302902222,
"step": 68
},
{
"epoch": 0.5101663585951941,
"grad_norm": 3.178295135498047,
"learning_rate": 4.218362282878412e-05,
"loss": 1.0007776021957397,
"step": 69
},
{
"epoch": 0.5175600739371534,
"grad_norm": 2.949404001235962,
"learning_rate": 4.205955334987593e-05,
"loss": 1.2593410015106201,
"step": 70
},
{
"epoch": 0.5175600739371534,
"eval_loss": 1.0979946851730347,
"eval_runtime": 12.5239,
"eval_samples_per_second": 3.992,
"eval_steps_per_second": 1.038,
"step": 70
},
{
"epoch": 0.5249537892791127,
"grad_norm": 3.8847079277038574,
"learning_rate": 4.1935483870967746e-05,
"loss": 2.036594867706299,
"step": 71
},
{
"epoch": 0.532347504621072,
"grad_norm": 3.068953514099121,
"learning_rate": 4.1811414392059556e-05,
"loss": 0.6717187166213989,
"step": 72
},
{
"epoch": 0.5397412199630314,
"grad_norm": 3.2837107181549072,
"learning_rate": 4.168734491315137e-05,
"loss": 1.2511982917785645,
"step": 73
},
{
"epoch": 0.5471349353049908,
"grad_norm": 2.77791690826416,
"learning_rate": 4.156327543424318e-05,
"loss": 0.8615735769271851,
"step": 74
},
{
"epoch": 0.5545286506469501,
"grad_norm": 3.068490743637085,
"learning_rate": 4.1439205955334995e-05,
"loss": 1.0339652299880981,
"step": 75
},
{
"epoch": 0.5619223659889094,
"grad_norm": 2.979583263397217,
"learning_rate": 4.1315136476426805e-05,
"loss": 1.1108063459396362,
"step": 76
},
{
"epoch": 0.5693160813308688,
"grad_norm": 3.9051339626312256,
"learning_rate": 4.119106699751861e-05,
"loss": 1.4168835878372192,
"step": 77
},
{
"epoch": 0.5767097966728281,
"grad_norm": 3.7126312255859375,
"learning_rate": 4.106699751861042e-05,
"loss": 1.3734055757522583,
"step": 78
},
{
"epoch": 0.5841035120147874,
"grad_norm": 3.31662654876709,
"learning_rate": 4.094292803970223e-05,
"loss": 1.2524129152297974,
"step": 79
},
{
"epoch": 0.5914972273567468,
"grad_norm": 4.711428642272949,
"learning_rate": 4.081885856079405e-05,
"loss": 1.236316442489624,
"step": 80
},
{
"epoch": 0.5914972273567468,
"eval_loss": 1.0435348749160767,
"eval_runtime": 12.3458,
"eval_samples_per_second": 4.05,
"eval_steps_per_second": 1.053,
"step": 80
},
{
"epoch": 0.5988909426987061,
"grad_norm": 4.0361762046813965,
"learning_rate": 4.069478908188586e-05,
"loss": 1.4246442317962646,
"step": 81
},
{
"epoch": 0.6062846580406654,
"grad_norm": 2.8361904621124268,
"learning_rate": 4.057071960297767e-05,
"loss": 0.9345840811729431,
"step": 82
},
{
"epoch": 0.6136783733826248,
"grad_norm": 3.7095162868499756,
"learning_rate": 4.044665012406948e-05,
"loss": 1.5689283609390259,
"step": 83
},
{
"epoch": 0.6210720887245841,
"grad_norm": 3.5047953128814697,
"learning_rate": 4.032258064516129e-05,
"loss": 0.8759887218475342,
"step": 84
},
{
"epoch": 0.6284658040665434,
"grad_norm": 3.5987155437469482,
"learning_rate": 4.019851116625311e-05,
"loss": 1.1171759366989136,
"step": 85
},
{
"epoch": 0.6358595194085028,
"grad_norm": 3.731731414794922,
"learning_rate": 4.007444168734492e-05,
"loss": 1.6270053386688232,
"step": 86
},
{
"epoch": 0.6432532347504621,
"grad_norm": 3.573490858078003,
"learning_rate": 3.995037220843673e-05,
"loss": 1.056086540222168,
"step": 87
},
{
"epoch": 0.6506469500924215,
"grad_norm": 3.3525490760803223,
"learning_rate": 3.982630272952854e-05,
"loss": 1.1946213245391846,
"step": 88
},
{
"epoch": 0.6580406654343808,
"grad_norm": 3.7373411655426025,
"learning_rate": 3.970223325062035e-05,
"loss": 0.8827130794525146,
"step": 89
},
{
"epoch": 0.6654343807763401,
"grad_norm": 4.0084710121154785,
"learning_rate": 3.957816377171216e-05,
"loss": 0.9339371919631958,
"step": 90
},
{
"epoch": 0.6654343807763401,
"eval_loss": 1.0062669515609741,
"eval_runtime": 12.5195,
"eval_samples_per_second": 3.994,
"eval_steps_per_second": 1.038,
"step": 90
},
{
"epoch": 0.6728280961182994,
"grad_norm": 3.986560583114624,
"learning_rate": 3.945409429280397e-05,
"loss": 1.4415428638458252,
"step": 91
},
{
"epoch": 0.6802218114602587,
"grad_norm": 4.451272964477539,
"learning_rate": 3.933002481389578e-05,
"loss": 1.0824394226074219,
"step": 92
},
{
"epoch": 0.6876155268022182,
"grad_norm": 3.693286180496216,
"learning_rate": 3.920595533498759e-05,
"loss": 1.1940369606018066,
"step": 93
},
{
"epoch": 0.6950092421441775,
"grad_norm": 2.855053424835205,
"learning_rate": 3.908188585607941e-05,
"loss": 0.9173199534416199,
"step": 94
},
{
"epoch": 0.7024029574861368,
"grad_norm": 4.027679443359375,
"learning_rate": 3.895781637717122e-05,
"loss": 0.9497783184051514,
"step": 95
},
{
"epoch": 0.7097966728280961,
"grad_norm": 3.9087977409362793,
"learning_rate": 3.883374689826303e-05,
"loss": 1.0188655853271484,
"step": 96
},
{
"epoch": 0.7171903881700554,
"grad_norm": 3.241875171661377,
"learning_rate": 3.870967741935484e-05,
"loss": 0.8885791301727295,
"step": 97
},
{
"epoch": 0.7245841035120147,
"grad_norm": 4.185547351837158,
"learning_rate": 3.858560794044665e-05,
"loss": 1.2772949934005737,
"step": 98
},
{
"epoch": 0.7319778188539742,
"grad_norm": 4.142065048217773,
"learning_rate": 3.846153846153846e-05,
"loss": 1.2576420307159424,
"step": 99
},
{
"epoch": 0.7393715341959335,
"grad_norm": 3.615719795227051,
"learning_rate": 3.8337468982630273e-05,
"loss": 1.0819486379623413,
"step": 100
},
{
"epoch": 0.7393715341959335,
"eval_loss": 0.9623194932937622,
"eval_runtime": 12.381,
"eval_samples_per_second": 4.038,
"eval_steps_per_second": 1.05,
"step": 100
},
{
"epoch": 0.7467652495378928,
"grad_norm": 4.190881729125977,
"learning_rate": 3.8213399503722084e-05,
"loss": 1.2672250270843506,
"step": 101
},
{
"epoch": 0.7541589648798521,
"grad_norm": 3.193317174911499,
"learning_rate": 3.8089330024813895e-05,
"loss": 0.5870144963264465,
"step": 102
},
{
"epoch": 0.7615526802218114,
"grad_norm": 3.363736867904663,
"learning_rate": 3.7965260545905705e-05,
"loss": 0.9823516011238098,
"step": 103
},
{
"epoch": 0.7689463955637708,
"grad_norm": 3.5238037109375,
"learning_rate": 3.784119106699752e-05,
"loss": 1.0627766847610474,
"step": 104
},
{
"epoch": 0.7763401109057301,
"grad_norm": 3.9384078979492188,
"learning_rate": 3.771712158808933e-05,
"loss": 0.9595991969108582,
"step": 105
},
{
"epoch": 0.7837338262476895,
"grad_norm": 2.542327642440796,
"learning_rate": 3.7593052109181144e-05,
"loss": 0.4437144696712494,
"step": 106
},
{
"epoch": 0.7911275415896488,
"grad_norm": 3.4414448738098145,
"learning_rate": 3.7468982630272954e-05,
"loss": 0.9118318557739258,
"step": 107
},
{
"epoch": 0.7985212569316081,
"grad_norm": 4.058464527130127,
"learning_rate": 3.734491315136477e-05,
"loss": 1.0451924800872803,
"step": 108
},
{
"epoch": 0.8059149722735675,
"grad_norm": 4.525938987731934,
"learning_rate": 3.7220843672456576e-05,
"loss": 1.365138053894043,
"step": 109
},
{
"epoch": 0.8133086876155268,
"grad_norm": 4.43060302734375,
"learning_rate": 3.7096774193548386e-05,
"loss": 1.3941904306411743,
"step": 110
},
{
"epoch": 0.8133086876155268,
"eval_loss": 0.9057048559188843,
"eval_runtime": 12.4702,
"eval_samples_per_second": 4.01,
"eval_steps_per_second": 1.042,
"step": 110
},
{
"epoch": 0.8207024029574861,
"grad_norm": 4.437230110168457,
"learning_rate": 3.69727047146402e-05,
"loss": 1.5756592750549316,
"step": 111
},
{
"epoch": 0.8280961182994455,
"grad_norm": 4.131067752838135,
"learning_rate": 3.684863523573201e-05,
"loss": 1.2377750873565674,
"step": 112
},
{
"epoch": 0.8354898336414048,
"grad_norm": 4.641602516174316,
"learning_rate": 3.6724565756823825e-05,
"loss": 1.4081263542175293,
"step": 113
},
{
"epoch": 0.8428835489833642,
"grad_norm": 4.326359272003174,
"learning_rate": 3.6600496277915635e-05,
"loss": 0.9341489672660828,
"step": 114
},
{
"epoch": 0.8502772643253235,
"grad_norm": 2.9741251468658447,
"learning_rate": 3.6476426799007446e-05,
"loss": 0.866841197013855,
"step": 115
},
{
"epoch": 0.8576709796672828,
"grad_norm": 4.513277053833008,
"learning_rate": 3.635235732009926e-05,
"loss": 1.2367680072784424,
"step": 116
},
{
"epoch": 0.8650646950092421,
"grad_norm": 3.476611852645874,
"learning_rate": 3.622828784119107e-05,
"loss": 1.1124229431152344,
"step": 117
},
{
"epoch": 0.8724584103512015,
"grad_norm": 3.6457555294036865,
"learning_rate": 3.6104218362282885e-05,
"loss": 0.9956739544868469,
"step": 118
},
{
"epoch": 0.8798521256931608,
"grad_norm": 3.688424825668335,
"learning_rate": 3.5980148883374695e-05,
"loss": 1.0528156757354736,
"step": 119
},
{
"epoch": 0.8872458410351202,
"grad_norm": 3.346254348754883,
"learning_rate": 3.5856079404466506e-05,
"loss": 0.7025595903396606,
"step": 120
},
{
"epoch": 0.8872458410351202,
"eval_loss": 0.8716071844100952,
"eval_runtime": 12.4971,
"eval_samples_per_second": 4.001,
"eval_steps_per_second": 1.04,
"step": 120
},
{
"epoch": 0.8946395563770795,
"grad_norm": 4.01053524017334,
"learning_rate": 3.573200992555831e-05,
"loss": 1.2084448337554932,
"step": 121
},
{
"epoch": 0.9020332717190388,
"grad_norm": 4.092630386352539,
"learning_rate": 3.560794044665012e-05,
"loss": 0.9433890581130981,
"step": 122
},
{
"epoch": 0.9094269870609981,
"grad_norm": 4.795446872711182,
"learning_rate": 3.548387096774194e-05,
"loss": 1.5043132305145264,
"step": 123
},
{
"epoch": 0.9168207024029574,
"grad_norm": 5.034322261810303,
"learning_rate": 3.535980148883375e-05,
"loss": 1.2913501262664795,
"step": 124
},
{
"epoch": 0.9242144177449169,
"grad_norm": 2.9654548168182373,
"learning_rate": 3.523573200992556e-05,
"loss": 0.7111821174621582,
"step": 125
},
{
"epoch": 0.9316081330868762,
"grad_norm": 3.7520949840545654,
"learning_rate": 3.511166253101737e-05,
"loss": 1.012024164199829,
"step": 126
},
{
"epoch": 0.9390018484288355,
"grad_norm": 3.2195515632629395,
"learning_rate": 3.498759305210919e-05,
"loss": 0.7502498626708984,
"step": 127
},
{
"epoch": 0.9463955637707948,
"grad_norm": 2.7303340435028076,
"learning_rate": 3.4863523573201e-05,
"loss": 0.4674774408340454,
"step": 128
},
{
"epoch": 0.9537892791127541,
"grad_norm": 4.547392845153809,
"learning_rate": 3.473945409429281e-05,
"loss": 1.1602028608322144,
"step": 129
},
{
"epoch": 0.9611829944547134,
"grad_norm": 3.680309772491455,
"learning_rate": 3.461538461538462e-05,
"loss": 0.9905465841293335,
"step": 130
},
{
"epoch": 0.9611829944547134,
"eval_loss": 0.8414432406425476,
"eval_runtime": 12.5233,
"eval_samples_per_second": 3.993,
"eval_steps_per_second": 1.038,
"step": 130
},
{
"epoch": 0.9685767097966729,
"grad_norm": 3.0262203216552734,
"learning_rate": 3.449131513647643e-05,
"loss": 0.5491358041763306,
"step": 131
},
{
"epoch": 0.9759704251386322,
"grad_norm": 3.6449105739593506,
"learning_rate": 3.436724565756824e-05,
"loss": 0.6083657741546631,
"step": 132
},
{
"epoch": 0.9833641404805915,
"grad_norm": 3.8271355628967285,
"learning_rate": 3.424317617866005e-05,
"loss": 0.8229025602340698,
"step": 133
},
{
"epoch": 0.9907578558225508,
"grad_norm": 4.178423881530762,
"learning_rate": 3.411910669975186e-05,
"loss": 0.9378503561019897,
"step": 134
},
{
"epoch": 0.9981515711645101,
"grad_norm": 4.2185516357421875,
"learning_rate": 3.399503722084367e-05,
"loss": 1.0079054832458496,
"step": 135
},
{
"epoch": 1.0,
"grad_norm": 7.801852703094482,
"learning_rate": 3.387096774193548e-05,
"loss": 0.695327877998352,
"step": 136
},
{
"epoch": 1.0073937153419594,
"grad_norm": 4.088887691497803,
"learning_rate": 3.37468982630273e-05,
"loss": 0.9851850867271423,
"step": 137
},
{
"epoch": 1.0147874306839186,
"grad_norm": 3.9392666816711426,
"learning_rate": 3.362282878411911e-05,
"loss": 1.0859596729278564,
"step": 138
},
{
"epoch": 1.022181146025878,
"grad_norm": 2.7098422050476074,
"learning_rate": 3.349875930521092e-05,
"loss": 0.6913776397705078,
"step": 139
},
{
"epoch": 1.0295748613678373,
"grad_norm": 3.724003314971924,
"learning_rate": 3.337468982630273e-05,
"loss": 0.9150189161300659,
"step": 140
},
{
"epoch": 1.0295748613678373,
"eval_loss": 0.8158807158470154,
"eval_runtime": 12.4581,
"eval_samples_per_second": 4.013,
"eval_steps_per_second": 1.043,
"step": 140
},
{
"epoch": 1.0369685767097967,
"grad_norm": 3.8593032360076904,
"learning_rate": 3.325062034739454e-05,
"loss": 0.763762354850769,
"step": 141
},
{
"epoch": 1.044362292051756,
"grad_norm": 2.0002894401550293,
"learning_rate": 3.312655086848635e-05,
"loss": 0.19527605175971985,
"step": 142
},
{
"epoch": 1.0517560073937153,
"grad_norm": 3.253109931945801,
"learning_rate": 3.300248138957816e-05,
"loss": 0.6456115245819092,
"step": 143
},
{
"epoch": 1.0591497227356748,
"grad_norm": 3.54606556892395,
"learning_rate": 3.2878411910669974e-05,
"loss": 0.6633723974227905,
"step": 144
},
{
"epoch": 1.066543438077634,
"grad_norm": 3.267594575881958,
"learning_rate": 3.2754342431761784e-05,
"loss": 0.5955727696418762,
"step": 145
},
{
"epoch": 1.0739371534195934,
"grad_norm": 2.721489429473877,
"learning_rate": 3.26302729528536e-05,
"loss": 0.4804825186729431,
"step": 146
},
{
"epoch": 1.0813308687615526,
"grad_norm": 4.136324882507324,
"learning_rate": 3.250620347394541e-05,
"loss": 0.8072193264961243,
"step": 147
},
{
"epoch": 1.088724584103512,
"grad_norm": 4.00969934463501,
"learning_rate": 3.238213399503722e-05,
"loss": 0.6894694566726685,
"step": 148
},
{
"epoch": 1.0961182994454712,
"grad_norm": 4.594008445739746,
"learning_rate": 3.2258064516129034e-05,
"loss": 0.8274256587028503,
"step": 149
},
{
"epoch": 1.1035120147874307,
"grad_norm": 4.16753625869751,
"learning_rate": 3.2133995037220844e-05,
"loss": 0.9284324645996094,
"step": 150
},
{
"epoch": 1.1035120147874307,
"eval_loss": 0.7907436490058899,
"eval_runtime": 12.5252,
"eval_samples_per_second": 3.992,
"eval_steps_per_second": 1.038,
"step": 150
},
{
"epoch": 1.11090573012939,
"grad_norm": 4.045674800872803,
"learning_rate": 3.200992555831266e-05,
"loss": 0.5929744243621826,
"step": 151
},
{
"epoch": 1.1182994454713493,
"grad_norm": 3.518078565597534,
"learning_rate": 3.188585607940447e-05,
"loss": 0.5093523263931274,
"step": 152
},
{
"epoch": 1.1256931608133087,
"grad_norm": 3.477130174636841,
"learning_rate": 3.176178660049628e-05,
"loss": 0.7743373513221741,
"step": 153
},
{
"epoch": 1.133086876155268,
"grad_norm": 3.28774356842041,
"learning_rate": 3.1637717121588087e-05,
"loss": 0.6708226799964905,
"step": 154
},
{
"epoch": 1.1404805914972274,
"grad_norm": 3.7155025005340576,
"learning_rate": 3.15136476426799e-05,
"loss": 0.8554853796958923,
"step": 155
},
{
"epoch": 1.1478743068391868,
"grad_norm": 3.8972744941711426,
"learning_rate": 3.1389578163771715e-05,
"loss": 0.6046540141105652,
"step": 156
},
{
"epoch": 1.155268022181146,
"grad_norm": 3.0317745208740234,
"learning_rate": 3.1265508684863525e-05,
"loss": 0.4163368046283722,
"step": 157
},
{
"epoch": 1.1626617375231054,
"grad_norm": 4.095373630523682,
"learning_rate": 3.1141439205955336e-05,
"loss": 0.7496839761734009,
"step": 158
},
{
"epoch": 1.1700554528650646,
"grad_norm": 3.626768112182617,
"learning_rate": 3.1017369727047146e-05,
"loss": 0.661150336265564,
"step": 159
},
{
"epoch": 1.177449168207024,
"grad_norm": 4.329172611236572,
"learning_rate": 3.089330024813896e-05,
"loss": 0.7081620693206787,
"step": 160
},
{
"epoch": 1.177449168207024,
"eval_loss": 0.7687544822692871,
"eval_runtime": 12.4056,
"eval_samples_per_second": 4.03,
"eval_steps_per_second": 1.048,
"step": 160
},
{
"epoch": 1.1848428835489835,
"grad_norm": 3.254220485687256,
"learning_rate": 3.0769230769230774e-05,
"loss": 0.5945311784744263,
"step": 161
},
{
"epoch": 1.1922365988909427,
"grad_norm": 3.851109266281128,
"learning_rate": 3.0645161290322585e-05,
"loss": 0.8574079871177673,
"step": 162
},
{
"epoch": 1.1996303142329021,
"grad_norm": 4.224574089050293,
"learning_rate": 3.0521091811414396e-05,
"loss": 0.9319736957550049,
"step": 163
},
{
"epoch": 1.2070240295748613,
"grad_norm": 4.972801208496094,
"learning_rate": 3.0397022332506203e-05,
"loss": 1.2526912689208984,
"step": 164
},
{
"epoch": 1.2144177449168208,
"grad_norm": 3.001422643661499,
"learning_rate": 3.027295285359802e-05,
"loss": 0.6652424335479736,
"step": 165
},
{
"epoch": 1.22181146025878,
"grad_norm": 4.232393741607666,
"learning_rate": 3.014888337468983e-05,
"loss": 0.7774908542633057,
"step": 166
},
{
"epoch": 1.2292051756007394,
"grad_norm": 3.8872828483581543,
"learning_rate": 3.0024813895781638e-05,
"loss": 0.6157264709472656,
"step": 167
},
{
"epoch": 1.2365988909426986,
"grad_norm": 4.408735275268555,
"learning_rate": 2.990074441687345e-05,
"loss": 0.6650868654251099,
"step": 168
},
{
"epoch": 1.243992606284658,
"grad_norm": 3.140364646911621,
"learning_rate": 2.977667493796526e-05,
"loss": 0.36262229084968567,
"step": 169
},
{
"epoch": 1.2513863216266174,
"grad_norm": 3.9706201553344727,
"learning_rate": 2.9652605459057077e-05,
"loss": 0.5755283832550049,
"step": 170
},
{
"epoch": 1.2513863216266174,
"eval_loss": 0.7536106705665588,
"eval_runtime": 12.506,
"eval_samples_per_second": 3.998,
"eval_steps_per_second": 1.039,
"step": 170
},
{
"epoch": 1.2587800369685767,
"grad_norm": 3.590471029281616,
"learning_rate": 2.9528535980148887e-05,
"loss": 0.5963804125785828,
"step": 171
},
{
"epoch": 1.266173752310536,
"grad_norm": 4.341546535491943,
"learning_rate": 2.9404466501240698e-05,
"loss": 0.8772169947624207,
"step": 172
},
{
"epoch": 1.2735674676524953,
"grad_norm": 3.2243599891662598,
"learning_rate": 2.9280397022332505e-05,
"loss": 0.6366092562675476,
"step": 173
},
{
"epoch": 1.2809611829944547,
"grad_norm": 4.367596626281738,
"learning_rate": 2.9156327543424316e-05,
"loss": 0.9016575813293457,
"step": 174
},
{
"epoch": 1.2883548983364141,
"grad_norm": 4.07682466506958,
"learning_rate": 2.9032258064516133e-05,
"loss": 0.5885382890701294,
"step": 175
},
{
"epoch": 1.2957486136783734,
"grad_norm": 4.982141017913818,
"learning_rate": 2.8908188585607944e-05,
"loss": 0.8368382453918457,
"step": 176
},
{
"epoch": 1.3031423290203328,
"grad_norm": 4.268311977386475,
"learning_rate": 2.8784119106699754e-05,
"loss": 0.6095747947692871,
"step": 177
},
{
"epoch": 1.310536044362292,
"grad_norm": 3.039452314376831,
"learning_rate": 2.8660049627791565e-05,
"loss": 0.43989288806915283,
"step": 178
},
{
"epoch": 1.3179297597042514,
"grad_norm": 5.515888690948486,
"learning_rate": 2.8535980148883372e-05,
"loss": 1.043910026550293,
"step": 179
},
{
"epoch": 1.3253234750462108,
"grad_norm": 3.7631590366363525,
"learning_rate": 2.841191066997519e-05,
"loss": 0.5932552814483643,
"step": 180
},
{
"epoch": 1.3253234750462108,
"eval_loss": 0.7392276525497437,
"eval_runtime": 12.5696,
"eval_samples_per_second": 3.978,
"eval_steps_per_second": 1.034,
"step": 180
},
{
"epoch": 1.33271719038817,
"grad_norm": 3.9628963470458984,
"learning_rate": 2.8287841191067e-05,
"loss": 0.5854453444480896,
"step": 181
},
{
"epoch": 1.3401109057301293,
"grad_norm": 4.974862098693848,
"learning_rate": 2.816377171215881e-05,
"loss": 0.8424703478813171,
"step": 182
},
{
"epoch": 1.3475046210720887,
"grad_norm": 4.7892069816589355,
"learning_rate": 2.803970223325062e-05,
"loss": 0.8794567584991455,
"step": 183
},
{
"epoch": 1.354898336414048,
"grad_norm": 4.94668436050415,
"learning_rate": 2.7915632754342435e-05,
"loss": 1.1411162614822388,
"step": 184
},
{
"epoch": 1.3622920517560073,
"grad_norm": 5.014815807342529,
"learning_rate": 2.7791563275434246e-05,
"loss": 1.0451624393463135,
"step": 185
},
{
"epoch": 1.3696857670979667,
"grad_norm": 4.067875862121582,
"learning_rate": 2.7667493796526056e-05,
"loss": 0.5183364748954773,
"step": 186
},
{
"epoch": 1.377079482439926,
"grad_norm": 4.259342670440674,
"learning_rate": 2.7543424317617867e-05,
"loss": 0.5706149935722351,
"step": 187
},
{
"epoch": 1.3844731977818854,
"grad_norm": 4.0488104820251465,
"learning_rate": 2.7419354838709678e-05,
"loss": 0.606059193611145,
"step": 188
},
{
"epoch": 1.3918669131238448,
"grad_norm": 4.461766242980957,
"learning_rate": 2.729528535980149e-05,
"loss": 0.861075222492218,
"step": 189
},
{
"epoch": 1.399260628465804,
"grad_norm": 4.1285295486450195,
"learning_rate": 2.7171215880893302e-05,
"loss": 0.6729316711425781,
"step": 190
},
{
"epoch": 1.399260628465804,
"eval_loss": 0.7324373722076416,
"eval_runtime": 12.4604,
"eval_samples_per_second": 4.013,
"eval_steps_per_second": 1.043,
"step": 190
},
{
"epoch": 1.4066543438077634,
"grad_norm": 4.628056049346924,
"learning_rate": 2.7047146401985113e-05,
"loss": 0.5330791473388672,
"step": 191
},
{
"epoch": 1.4140480591497226,
"grad_norm": 4.561936855316162,
"learning_rate": 2.6923076923076923e-05,
"loss": 1.0062705278396606,
"step": 192
},
{
"epoch": 1.421441774491682,
"grad_norm": 3.802652359008789,
"learning_rate": 2.6799007444168734e-05,
"loss": 0.5224090814590454,
"step": 193
},
{
"epoch": 1.4288354898336415,
"grad_norm": 3.884530782699585,
"learning_rate": 2.6674937965260548e-05,
"loss": 0.7373669147491455,
"step": 194
},
{
"epoch": 1.4362292051756007,
"grad_norm": 2.499845504760742,
"learning_rate": 2.655086848635236e-05,
"loss": 0.14097268879413605,
"step": 195
},
{
"epoch": 1.4436229205175601,
"grad_norm": 3.8135945796966553,
"learning_rate": 2.642679900744417e-05,
"loss": 0.4497666656970978,
"step": 196
},
{
"epoch": 1.4510166358595193,
"grad_norm": 4.8832268714904785,
"learning_rate": 2.630272952853598e-05,
"loss": 1.0067732334136963,
"step": 197
},
{
"epoch": 1.4584103512014788,
"grad_norm": 4.868736267089844,
"learning_rate": 2.617866004962779e-05,
"loss": 0.7973582744598389,
"step": 198
},
{
"epoch": 1.4658040665434382,
"grad_norm": 3.969160556793213,
"learning_rate": 2.6054590570719604e-05,
"loss": 0.642175018787384,
"step": 199
},
{
"epoch": 1.4731977818853974,
"grad_norm": 4.04058837890625,
"learning_rate": 2.5930521091811415e-05,
"loss": 0.4151504635810852,
"step": 200
},
{
"epoch": 1.4731977818853974,
"eval_loss": 0.7266122698783875,
"eval_runtime": 12.4172,
"eval_samples_per_second": 4.027,
"eval_steps_per_second": 1.047,
"step": 200
},
{
"epoch": 1.4805914972273566,
"grad_norm": NaN,
"learning_rate": 2.5806451612903226e-05,
"loss": 0.9558417797088623,
"step": 201
},
{
"epoch": 1.487985212569316,
"grad_norm": 4.036558151245117,
"learning_rate": 2.5806451612903226e-05,
"loss": 0.633673369884491,
"step": 202
},
{
"epoch": 1.4953789279112755,
"grad_norm": 4.391520023345947,
"learning_rate": 2.5682382133995036e-05,
"loss": 0.6117820143699646,
"step": 203
},
{
"epoch": 1.502772643253235,
"grad_norm": 4.382378578186035,
"learning_rate": 2.5558312655086853e-05,
"loss": 0.7942304611206055,
"step": 204
},
{
"epoch": 1.510166358595194,
"grad_norm": 4.690098762512207,
"learning_rate": 2.5434243176178664e-05,
"loss": 1.1411387920379639,
"step": 205
},
{
"epoch": 1.5175600739371533,
"grad_norm": 3.7537717819213867,
"learning_rate": 2.531017369727047e-05,
"loss": 0.6303231716156006,
"step": 206
},
{
"epoch": 1.5249537892791127,
"grad_norm": 3.366995096206665,
"learning_rate": 2.5186104218362282e-05,
"loss": 0.3322565257549286,
"step": 207
},
{
"epoch": 1.5323475046210722,
"grad_norm": 3.7209525108337402,
"learning_rate": 2.5062034739454093e-05,
"loss": 0.39026719331741333,
"step": 208
},
{
"epoch": 1.5397412199630314,
"grad_norm": 3.066854953765869,
"learning_rate": 2.4937965260545906e-05,
"loss": 0.24430927634239197,
"step": 209
},
{
"epoch": 1.5471349353049908,
"grad_norm": 4.770087242126465,
"learning_rate": 2.481389578163772e-05,
"loss": 0.5006218552589417,
"step": 210
},
{
"epoch": 1.5471349353049908,
"eval_loss": 0.7169432044029236,
"eval_runtime": 12.4867,
"eval_samples_per_second": 4.004,
"eval_steps_per_second": 1.041,
"step": 210
},
{
"epoch": 1.55452865064695,
"grad_norm": 2.8433492183685303,
"learning_rate": 2.468982630272953e-05,
"loss": 0.31588056683540344,
"step": 211
},
{
"epoch": 1.5619223659889094,
"grad_norm": 4.780882358551025,
"learning_rate": 2.4565756823821338e-05,
"loss": 0.9557748436927795,
"step": 212
},
{
"epoch": 1.5693160813308689,
"grad_norm": 3.854046583175659,
"learning_rate": 2.4441687344913152e-05,
"loss": 0.4003015160560608,
"step": 213
},
{
"epoch": 1.576709796672828,
"grad_norm": 4.2938666343688965,
"learning_rate": 2.4317617866004963e-05,
"loss": 0.6644906997680664,
"step": 214
},
{
"epoch": 1.5841035120147873,
"grad_norm": 4.548666000366211,
"learning_rate": 2.4193548387096777e-05,
"loss": 0.6904682517051697,
"step": 215
},
{
"epoch": 1.5914972273567467,
"grad_norm": 4.770917892456055,
"learning_rate": 2.4069478908188587e-05,
"loss": 0.837977945804596,
"step": 216
},
{
"epoch": 1.5988909426987061,
"grad_norm": 3.6060478687286377,
"learning_rate": 2.3945409429280398e-05,
"loss": 0.5721973776817322,
"step": 217
},
{
"epoch": 1.6062846580406656,
"grad_norm": 4.638070106506348,
"learning_rate": 2.382133995037221e-05,
"loss": 0.7397695183753967,
"step": 218
},
{
"epoch": 1.6136783733826248,
"grad_norm": 4.492130279541016,
"learning_rate": 2.369727047146402e-05,
"loss": 0.8275012969970703,
"step": 219
},
{
"epoch": 1.621072088724584,
"grad_norm": 2.734531879425049,
"learning_rate": 2.3573200992555833e-05,
"loss": 0.17226025462150574,
"step": 220
},
{
"epoch": 1.621072088724584,
"eval_loss": 0.7117969989776611,
"eval_runtime": 12.5391,
"eval_samples_per_second": 3.988,
"eval_steps_per_second": 1.037,
"step": 220
},
{
"epoch": 1.6284658040665434,
"grad_norm": 5.867221832275391,
"learning_rate": 2.3449131513647644e-05,
"loss": 0.9325424432754517,
"step": 221
},
{
"epoch": 1.6358595194085028,
"grad_norm": 4.813448429107666,
"learning_rate": 2.3325062034739454e-05,
"loss": 1.0752629041671753,
"step": 222
},
{
"epoch": 1.6432532347504623,
"grad_norm": 4.7057647705078125,
"learning_rate": 2.3200992555831265e-05,
"loss": 0.5686098337173462,
"step": 223
},
{
"epoch": 1.6506469500924215,
"grad_norm": 4.052099704742432,
"learning_rate": 2.307692307692308e-05,
"loss": 0.6606102585792542,
"step": 224
},
{
"epoch": 1.6580406654343807,
"grad_norm": 3.486253261566162,
"learning_rate": 2.295285359801489e-05,
"loss": 0.6913259029388428,
"step": 225
},
{
"epoch": 1.66543438077634,
"grad_norm": 4.941483974456787,
"learning_rate": 2.28287841191067e-05,
"loss": 0.88069748878479,
"step": 226
},
{
"epoch": 1.6728280961182995,
"grad_norm": 3.968275785446167,
"learning_rate": 2.2704714640198514e-05,
"loss": 0.46321308612823486,
"step": 227
},
{
"epoch": 1.6802218114602587,
"grad_norm": 3.1694424152374268,
"learning_rate": 2.258064516129032e-05,
"loss": 0.387752503156662,
"step": 228
},
{
"epoch": 1.6876155268022182,
"grad_norm": 2.896517515182495,
"learning_rate": 2.2456575682382135e-05,
"loss": 0.19096603989601135,
"step": 229
},
{
"epoch": 1.6950092421441774,
"grad_norm": 5.64996337890625,
"learning_rate": 2.2332506203473946e-05,
"loss": 1.1302458047866821,
"step": 230
},
{
"epoch": 1.6950092421441774,
"eval_loss": 0.7003970146179199,
"eval_runtime": 12.3627,
"eval_samples_per_second": 4.044,
"eval_steps_per_second": 1.052,
"step": 230
},
{
"epoch": 1.7024029574861368,
"grad_norm": 4.2490105628967285,
"learning_rate": 2.2208436724565757e-05,
"loss": 0.3965778350830078,
"step": 231
},
{
"epoch": 1.7097966728280962,
"grad_norm": 4.177857875823975,
"learning_rate": 2.208436724565757e-05,
"loss": 0.7732095122337341,
"step": 232
},
{
"epoch": 1.7171903881700554,
"grad_norm": 4.114255905151367,
"learning_rate": 2.196029776674938e-05,
"loss": 0.6610587239265442,
"step": 233
},
{
"epoch": 1.7245841035120146,
"grad_norm": 4.6579790115356445,
"learning_rate": 2.1836228287841192e-05,
"loss": 0.6404513120651245,
"step": 234
},
{
"epoch": 1.731977818853974,
"grad_norm": 4.545577526092529,
"learning_rate": 2.1712158808933002e-05,
"loss": 0.563823938369751,
"step": 235
},
{
"epoch": 1.7393715341959335,
"grad_norm": 3.8521006107330322,
"learning_rate": 2.1588089330024816e-05,
"loss": 0.46250104904174805,
"step": 236
},
{
"epoch": 1.746765249537893,
"grad_norm": 4.345403671264648,
"learning_rate": 2.1464019851116627e-05,
"loss": 0.572223961353302,
"step": 237
},
{
"epoch": 1.7541589648798521,
"grad_norm": 4.653343677520752,
"learning_rate": 2.1339950372208438e-05,
"loss": 0.916043221950531,
"step": 238
},
{
"epoch": 1.7615526802218113,
"grad_norm": 4.250296115875244,
"learning_rate": 2.1215880893300248e-05,
"loss": 0.5865936875343323,
"step": 239
},
{
"epoch": 1.7689463955637708,
"grad_norm": 5.195578575134277,
"learning_rate": 2.109181141439206e-05,
"loss": 1.2301476001739502,
"step": 240
},
{
"epoch": 1.7689463955637708,
"eval_loss": 0.6921948790550232,
"eval_runtime": 12.4796,
"eval_samples_per_second": 4.007,
"eval_steps_per_second": 1.042,
"step": 240
},
{
"epoch": 1.7763401109057302,
"grad_norm": 2.8348636627197266,
"learning_rate": 2.0967741935483873e-05,
"loss": 0.26018866896629333,
"step": 241
},
{
"epoch": 1.7837338262476896,
"grad_norm": 5.202093124389648,
"learning_rate": 2.0843672456575683e-05,
"loss": 0.7929123044013977,
"step": 242
},
{
"epoch": 1.7911275415896488,
"grad_norm": 5.220610618591309,
"learning_rate": 2.0719602977667497e-05,
"loss": 0.6777660846710205,
"step": 243
},
{
"epoch": 1.798521256931608,
"grad_norm": 4.286166667938232,
"learning_rate": 2.0595533498759305e-05,
"loss": 0.6516886353492737,
"step": 244
},
{
"epoch": 1.8059149722735675,
"grad_norm": 4.031196594238281,
"learning_rate": 2.0471464019851115e-05,
"loss": 0.5112631916999817,
"step": 245
},
{
"epoch": 1.8133086876155269,
"grad_norm": 4.3230485916137695,
"learning_rate": 2.034739454094293e-05,
"loss": 0.3475070297718048,
"step": 246
},
{
"epoch": 1.820702402957486,
"grad_norm": 3.3923592567443848,
"learning_rate": 2.022332506203474e-05,
"loss": 0.4742909371852875,
"step": 247
},
{
"epoch": 1.8280961182994455,
"grad_norm": 3.982393264770508,
"learning_rate": 2.0099255583126554e-05,
"loss": 0.31971654295921326,
"step": 248
},
{
"epoch": 1.8354898336414047,
"grad_norm": 4.76895809173584,
"learning_rate": 1.9975186104218364e-05,
"loss": 0.6392852663993835,
"step": 249
},
{
"epoch": 1.8428835489833642,
"grad_norm": 3.412508010864258,
"learning_rate": 1.9851116625310175e-05,
"loss": 0.3292834758758545,
"step": 250
},
{
"epoch": 1.8428835489833642,
"eval_loss": 0.6914193034172058,
"eval_runtime": 12.3365,
"eval_samples_per_second": 4.053,
"eval_steps_per_second": 1.054,
"step": 250
},
{
"epoch": 1.8502772643253236,
"grad_norm": 4.11257791519165,
"learning_rate": 1.9727047146401986e-05,
"loss": 0.7835528254508972,
"step": 251
},
{
"epoch": 1.8576709796672828,
"grad_norm": 5.388609886169434,
"learning_rate": 1.9602977667493796e-05,
"loss": 1.027623176574707,
"step": 252
},
{
"epoch": 1.865064695009242,
"grad_norm": 5.567387104034424,
"learning_rate": 1.947890818858561e-05,
"loss": 0.7551397681236267,
"step": 253
},
{
"epoch": 1.8724584103512014,
"grad_norm": 5.3149847984313965,
"learning_rate": 1.935483870967742e-05,
"loss": 1.1124372482299805,
"step": 254
},
{
"epoch": 1.8798521256931608,
"grad_norm": 4.300573348999023,
"learning_rate": 1.923076923076923e-05,
"loss": 0.7125287055969238,
"step": 255
},
{
"epoch": 1.8872458410351203,
"grad_norm": 4.081615924835205,
"learning_rate": 1.9106699751861042e-05,
"loss": 0.5935063362121582,
"step": 256
},
{
"epoch": 1.8946395563770795,
"grad_norm": 2.4937996864318848,
"learning_rate": 1.8982630272952853e-05,
"loss": 0.2382672131061554,
"step": 257
},
{
"epoch": 1.9020332717190387,
"grad_norm": 3.744213819503784,
"learning_rate": 1.8858560794044667e-05,
"loss": 0.5946758985519409,
"step": 258
},
{
"epoch": 1.9094269870609981,
"grad_norm": 3.3455610275268555,
"learning_rate": 1.8734491315136477e-05,
"loss": 0.3634100556373596,
"step": 259
},
{
"epoch": 1.9168207024029575,
"grad_norm": 3.925421714782715,
"learning_rate": 1.8610421836228288e-05,
"loss": 0.4476943016052246,
"step": 260
},
{
"epoch": 1.9168207024029575,
"eval_loss": 0.6890667676925659,
"eval_runtime": 12.5388,
"eval_samples_per_second": 3.988,
"eval_steps_per_second": 1.037,
"step": 260
},
{
"epoch": 1.924214417744917,
"grad_norm": 4.225397109985352,
"learning_rate": 1.84863523573201e-05,
"loss": 0.6327498555183411,
"step": 261
},
{
"epoch": 1.9316081330868762,
"grad_norm": 5.073101043701172,
"learning_rate": 1.8362282878411912e-05,
"loss": 0.6480901837348938,
"step": 262
},
{
"epoch": 1.9390018484288354,
"grad_norm": 5.898105144500732,
"learning_rate": 1.8238213399503723e-05,
"loss": 0.8572679758071899,
"step": 263
},
{
"epoch": 1.9463955637707948,
"grad_norm": 5.332759380340576,
"learning_rate": 1.8114143920595534e-05,
"loss": 0.7909560203552246,
"step": 264
},
{
"epoch": 1.9537892791127542,
"grad_norm": 3.7612059116363525,
"learning_rate": 1.7990074441687348e-05,
"loss": 0.46339747309684753,
"step": 265
},
{
"epoch": 1.9611829944547134,
"grad_norm": 3.9361913204193115,
"learning_rate": 1.7866004962779155e-05,
"loss": 0.28523582220077515,
"step": 266
},
{
"epoch": 1.9685767097966729,
"grad_norm": 3.6171579360961914,
"learning_rate": 1.774193548387097e-05,
"loss": 0.5036706924438477,
"step": 267
},
{
"epoch": 1.975970425138632,
"grad_norm": 4.578619003295898,
"learning_rate": 1.761786600496278e-05,
"loss": 0.5884866714477539,
"step": 268
},
{
"epoch": 1.9833641404805915,
"grad_norm": 3.30562162399292,
"learning_rate": 1.7493796526054593e-05,
"loss": 0.27540749311447144,
"step": 269
},
{
"epoch": 1.990757855822551,
"grad_norm": 5.476099491119385,
"learning_rate": 1.7369727047146404e-05,
"loss": 0.6743600368499756,
"step": 270
},
{
"epoch": 1.990757855822551,
"eval_loss": 0.6857466101646423,
"eval_runtime": 12.4606,
"eval_samples_per_second": 4.013,
"eval_steps_per_second": 1.043,
"step": 270
},
{
"epoch": 1.9981515711645101,
"grad_norm": 5.06631326675415,
"learning_rate": 1.7245657568238215e-05,
"loss": 0.6917240023612976,
"step": 271
},
{
"epoch": 2.0,
"grad_norm": 10.330102920532227,
"learning_rate": 1.7121588089330025e-05,
"loss": 0.9991450905799866,
"step": 272
},
{
"epoch": 2.0073937153419594,
"grad_norm": 3.6291868686676025,
"learning_rate": 1.6997518610421836e-05,
"loss": 0.5753036737442017,
"step": 273
},
{
"epoch": 2.014787430683919,
"grad_norm": 3.012753963470459,
"learning_rate": 1.687344913151365e-05,
"loss": 0.39315706491470337,
"step": 274
},
{
"epoch": 2.022181146025878,
"grad_norm": 2.8621585369110107,
"learning_rate": 1.674937965260546e-05,
"loss": 0.21679037809371948,
"step": 275
},
{
"epoch": 2.0295748613678373,
"grad_norm": 3.5421297550201416,
"learning_rate": 1.662531017369727e-05,
"loss": 0.3504061996936798,
"step": 276
},
{
"epoch": 2.0369685767097967,
"grad_norm": 4.237403869628906,
"learning_rate": 1.650124069478908e-05,
"loss": 0.3911523222923279,
"step": 277
},
{
"epoch": 2.044362292051756,
"grad_norm": 3.58307147026062,
"learning_rate": 1.6377171215880892e-05,
"loss": 0.2892913818359375,
"step": 278
},
{
"epoch": 2.0517560073937156,
"grad_norm": 3.5432863235473633,
"learning_rate": 1.6253101736972706e-05,
"loss": 0.28674107789993286,
"step": 279
},
{
"epoch": 2.0591497227356745,
"grad_norm": 3.829465389251709,
"learning_rate": 1.6129032258064517e-05,
"loss": 0.5085712671279907,
"step": 280
},
{
"epoch": 2.0591497227356745,
"eval_loss": 0.6785848736763,
"eval_runtime": 12.4959,
"eval_samples_per_second": 4.001,
"eval_steps_per_second": 1.04,
"step": 280
},
{
"epoch": 2.066543438077634,
"grad_norm": 4.736692428588867,
"learning_rate": 1.600496277915633e-05,
"loss": 0.45895498991012573,
"step": 281
},
{
"epoch": 2.0739371534195934,
"grad_norm": 3.5632877349853516,
"learning_rate": 1.588089330024814e-05,
"loss": 0.404934823513031,
"step": 282
},
{
"epoch": 2.081330868761553,
"grad_norm": 2.9595789909362793,
"learning_rate": 1.575682382133995e-05,
"loss": 0.24088506400585175,
"step": 283
},
{
"epoch": 2.088724584103512,
"grad_norm": 3.6839349269866943,
"learning_rate": 1.5632754342431763e-05,
"loss": 0.3658759891986847,
"step": 284
},
{
"epoch": 2.0961182994454712,
"grad_norm": 4.99697208404541,
"learning_rate": 1.5508684863523573e-05,
"loss": 0.6948235034942627,
"step": 285
},
{
"epoch": 2.1035120147874307,
"grad_norm": 4.195018291473389,
"learning_rate": 1.5384615384615387e-05,
"loss": 0.37375789880752563,
"step": 286
},
{
"epoch": 2.11090573012939,
"grad_norm": 3.6975293159484863,
"learning_rate": 1.5260545905707198e-05,
"loss": 0.4121526777744293,
"step": 287
},
{
"epoch": 2.1182994454713495,
"grad_norm": 2.941937208175659,
"learning_rate": 1.513647642679901e-05,
"loss": 0.27218982577323914,
"step": 288
},
{
"epoch": 2.1256931608133085,
"grad_norm": 4.575267791748047,
"learning_rate": 1.5012406947890819e-05,
"loss": 0.6285619735717773,
"step": 289
},
{
"epoch": 2.133086876155268,
"grad_norm": 3.1897130012512207,
"learning_rate": 1.488833746898263e-05,
"loss": 0.2965329587459564,
"step": 290
},
{
"epoch": 2.133086876155268,
"eval_loss": 0.677734375,
"eval_runtime": 12.5014,
"eval_samples_per_second": 4.0,
"eval_steps_per_second": 1.04,
"step": 290
},
{
"epoch": 2.1404805914972274,
"grad_norm": 4.293984889984131,
"learning_rate": 1.4764267990074444e-05,
"loss": 0.5726566314697266,
"step": 291
},
{
"epoch": 2.147874306839187,
"grad_norm": 3.8995208740234375,
"learning_rate": 1.4640198511166252e-05,
"loss": 0.5817862749099731,
"step": 292
},
{
"epoch": 2.155268022181146,
"grad_norm": 3.5895419120788574,
"learning_rate": 1.4516129032258066e-05,
"loss": 0.35040074586868286,
"step": 293
},
{
"epoch": 2.162661737523105,
"grad_norm": 2.880908966064453,
"learning_rate": 1.4392059553349877e-05,
"loss": 0.2075611799955368,
"step": 294
},
{
"epoch": 2.1700554528650646,
"grad_norm": 2.844344139099121,
"learning_rate": 1.4267990074441686e-05,
"loss": 0.16030986607074738,
"step": 295
},
{
"epoch": 2.177449168207024,
"grad_norm": 3.2597815990448,
"learning_rate": 1.41439205955335e-05,
"loss": 0.4147431254386902,
"step": 296
},
{
"epoch": 2.1848428835489835,
"grad_norm": 3.9886868000030518,
"learning_rate": 1.401985111662531e-05,
"loss": 0.5274520516395569,
"step": 297
},
{
"epoch": 2.1922365988909425,
"grad_norm": 4.478377819061279,
"learning_rate": 1.3895781637717123e-05,
"loss": 0.41934865713119507,
"step": 298
},
{
"epoch": 2.199630314232902,
"grad_norm": 4.394498348236084,
"learning_rate": 1.3771712158808933e-05,
"loss": 0.42625561356544495,
"step": 299
},
{
"epoch": 2.2070240295748613,
"grad_norm": 3.080974578857422,
"learning_rate": 1.3647642679900746e-05,
"loss": 0.3000877797603607,
"step": 300
},
{
"epoch": 2.2070240295748613,
"eval_loss": 0.6803019046783447,
"eval_runtime": 12.5007,
"eval_samples_per_second": 4.0,
"eval_steps_per_second": 1.04,
"step": 300
},
{
"epoch": 2.2144177449168208,
"grad_norm": 4.009698867797852,
"learning_rate": 1.3523573200992556e-05,
"loss": 0.43977871537208557,
"step": 301
},
{
"epoch": 2.22181146025878,
"grad_norm": 2.766298294067383,
"learning_rate": 1.3399503722084367e-05,
"loss": 0.17407231032848358,
"step": 302
},
{
"epoch": 2.229205175600739,
"grad_norm": 5.193652629852295,
"learning_rate": 1.327543424317618e-05,
"loss": 0.40429675579071045,
"step": 303
},
{
"epoch": 2.2365988909426986,
"grad_norm": 4.609817981719971,
"learning_rate": 1.315136476426799e-05,
"loss": 0.6340703964233398,
"step": 304
},
{
"epoch": 2.243992606284658,
"grad_norm": 3.17801570892334,
"learning_rate": 1.3027295285359802e-05,
"loss": 0.3360348343849182,
"step": 305
},
{
"epoch": 2.2513863216266174,
"grad_norm": 4.517796993255615,
"learning_rate": 1.2903225806451613e-05,
"loss": 0.6079537272453308,
"step": 306
},
{
"epoch": 2.258780036968577,
"grad_norm": 4.179698944091797,
"learning_rate": 1.2779156327543427e-05,
"loss": 0.4164172410964966,
"step": 307
},
{
"epoch": 2.266173752310536,
"grad_norm": 4.557032108306885,
"learning_rate": 1.2655086848635236e-05,
"loss": 0.5597180128097534,
"step": 308
},
{
"epoch": 2.2735674676524953,
"grad_norm": 3.3242549896240234,
"learning_rate": 1.2531017369727046e-05,
"loss": 0.2977086901664734,
"step": 309
},
{
"epoch": 2.2809611829944547,
"grad_norm": 4.459362983703613,
"learning_rate": 1.240694789081886e-05,
"loss": 0.46301090717315674,
"step": 310
},
{
"epoch": 2.2809611829944547,
"eval_loss": 0.6781811714172363,
"eval_runtime": 12.543,
"eval_samples_per_second": 3.986,
"eval_steps_per_second": 1.036,
"step": 310
},
{
"epoch": 2.288354898336414,
"grad_norm": 4.992742538452148,
"learning_rate": 1.2282878411910669e-05,
"loss": 0.46335217356681824,
"step": 311
},
{
"epoch": 2.2957486136783736,
"grad_norm": 3.204737424850464,
"learning_rate": 1.2158808933002481e-05,
"loss": 0.2609277367591858,
"step": 312
},
{
"epoch": 2.3031423290203326,
"grad_norm": 2.343017339706421,
"learning_rate": 1.2034739454094294e-05,
"loss": 0.09263511747121811,
"step": 313
},
{
"epoch": 2.310536044362292,
"grad_norm": 4.5192108154296875,
"learning_rate": 1.1910669975186104e-05,
"loss": 0.4888758957386017,
"step": 314
},
{
"epoch": 2.3179297597042514,
"grad_norm": 4.179697513580322,
"learning_rate": 1.1786600496277917e-05,
"loss": 0.2793925702571869,
"step": 315
},
{
"epoch": 2.325323475046211,
"grad_norm": 3.240756034851074,
"learning_rate": 1.1662531017369727e-05,
"loss": 0.18993309140205383,
"step": 316
},
{
"epoch": 2.33271719038817,
"grad_norm": 3.8120131492614746,
"learning_rate": 1.153846153846154e-05,
"loss": 0.400962233543396,
"step": 317
},
{
"epoch": 2.3401109057301293,
"grad_norm": 3.7298102378845215,
"learning_rate": 1.141439205955335e-05,
"loss": 0.46058881282806396,
"step": 318
},
{
"epoch": 2.3475046210720887,
"grad_norm": 4.015145778656006,
"learning_rate": 1.129032258064516e-05,
"loss": 0.408356249332428,
"step": 319
},
{
"epoch": 2.354898336414048,
"grad_norm": 4.480742454528809,
"learning_rate": 1.1166253101736973e-05,
"loss": 0.5604572296142578,
"step": 320
},
{
"epoch": 2.354898336414048,
"eval_loss": 0.6816579699516296,
"eval_runtime": 12.3582,
"eval_samples_per_second": 4.046,
"eval_steps_per_second": 1.052,
"step": 320
},
{
"epoch": 2.3622920517560075,
"grad_norm": 4.857553482055664,
"learning_rate": 1.1042183622828785e-05,
"loss": 0.40513134002685547,
"step": 321
},
{
"epoch": 2.369685767097967,
"grad_norm": 4.126130104064941,
"learning_rate": 1.0918114143920596e-05,
"loss": 0.40128400921821594,
"step": 322
},
{
"epoch": 2.377079482439926,
"grad_norm": 4.141418933868408,
"learning_rate": 1.0794044665012408e-05,
"loss": 0.29924750328063965,
"step": 323
},
{
"epoch": 2.3844731977818854,
"grad_norm": 4.493786811828613,
"learning_rate": 1.0669975186104219e-05,
"loss": 0.4414414167404175,
"step": 324
},
{
"epoch": 2.391866913123845,
"grad_norm": 3.504249095916748,
"learning_rate": 1.054590570719603e-05,
"loss": 0.21310807764530182,
"step": 325
},
{
"epoch": 2.3992606284658042,
"grad_norm": 4.698243618011475,
"learning_rate": 1.0421836228287842e-05,
"loss": 0.3865514397621155,
"step": 326
},
{
"epoch": 2.406654343807763,
"grad_norm": 4.5291361808776855,
"learning_rate": 1.0297766749379652e-05,
"loss": 0.507878303527832,
"step": 327
},
{
"epoch": 2.4140480591497226,
"grad_norm": 4.491507530212402,
"learning_rate": 1.0173697270471465e-05,
"loss": 0.5876278877258301,
"step": 328
},
{
"epoch": 2.421441774491682,
"grad_norm": 4.440368175506592,
"learning_rate": 1.0049627791563277e-05,
"loss": 0.3370438814163208,
"step": 329
},
{
"epoch": 2.4288354898336415,
"grad_norm": 4.03184700012207,
"learning_rate": 9.925558312655088e-06,
"loss": 0.3488239645957947,
"step": 330
},
{
"epoch": 2.4288354898336415,
"eval_loss": 0.6855019927024841,
"eval_runtime": 12.5549,
"eval_samples_per_second": 3.983,
"eval_steps_per_second": 1.035,
"step": 330
},
{
"epoch": 2.436229205175601,
"grad_norm": 5.132557392120361,
"learning_rate": 9.801488833746898e-06,
"loss": 0.5963175892829895,
"step": 331
},
{
"epoch": 2.44362292051756,
"grad_norm": 3.78555965423584,
"learning_rate": 9.67741935483871e-06,
"loss": 0.258226603269577,
"step": 332
},
{
"epoch": 2.4510166358595193,
"grad_norm": 4.775308132171631,
"learning_rate": 9.553349875930521e-06,
"loss": 0.43731528520584106,
"step": 333
},
{
"epoch": 2.4584103512014788,
"grad_norm": 3.104215621948242,
"learning_rate": 9.429280397022333e-06,
"loss": 0.37882596254348755,
"step": 334
},
{
"epoch": 2.465804066543438,
"grad_norm": 3.798936128616333,
"learning_rate": 9.305210918114144e-06,
"loss": 0.4152655601501465,
"step": 335
},
{
"epoch": 2.473197781885397,
"grad_norm": 3.886282444000244,
"learning_rate": 9.181141439205956e-06,
"loss": 0.45343902707099915,
"step": 336
},
{
"epoch": 2.4805914972273566,
"grad_norm": 3.8217668533325195,
"learning_rate": 9.057071960297767e-06,
"loss": 0.3023824095726013,
"step": 337
},
{
"epoch": 2.487985212569316,
"grad_norm": 4.341695308685303,
"learning_rate": 8.933002481389577e-06,
"loss": 0.31776532530784607,
"step": 338
},
{
"epoch": 2.4953789279112755,
"grad_norm": 4.166908264160156,
"learning_rate": 8.80893300248139e-06,
"loss": 0.4596524238586426,
"step": 339
},
{
"epoch": 2.502772643253235,
"grad_norm": 4.498860836029053,
"learning_rate": 8.684863523573202e-06,
"loss": 0.42993947863578796,
"step": 340
},
{
"epoch": 2.502772643253235,
"eval_loss": 0.6849582195281982,
"eval_runtime": 12.4343,
"eval_samples_per_second": 4.021,
"eval_steps_per_second": 1.045,
"step": 340
},
{
"epoch": 2.5101663585951943,
"grad_norm": 4.697827339172363,
"learning_rate": 8.560794044665013e-06,
"loss": 0.30538150668144226,
"step": 341
},
{
"epoch": 2.5175600739371533,
"grad_norm": 5.051844596862793,
"learning_rate": 8.436724565756825e-06,
"loss": 0.424445241689682,
"step": 342
},
{
"epoch": 2.5249537892791127,
"grad_norm": 4.363079071044922,
"learning_rate": 8.312655086848635e-06,
"loss": 0.3895280361175537,
"step": 343
},
{
"epoch": 2.532347504621072,
"grad_norm": 3.4225594997406006,
"learning_rate": 8.188585607940446e-06,
"loss": 0.24427245557308197,
"step": 344
},
{
"epoch": 2.539741219963031,
"grad_norm": 4.501352787017822,
"learning_rate": 8.064516129032258e-06,
"loss": 0.5370553135871887,
"step": 345
},
{
"epoch": 2.5471349353049906,
"grad_norm": 4.623712539672852,
"learning_rate": 7.94044665012407e-06,
"loss": 0.36334437131881714,
"step": 346
},
{
"epoch": 2.55452865064695,
"grad_norm": 4.001847743988037,
"learning_rate": 7.816377171215881e-06,
"loss": 0.3196173310279846,
"step": 347
},
{
"epoch": 2.5619223659889094,
"grad_norm": 4.033841609954834,
"learning_rate": 7.692307692307694e-06,
"loss": 0.2993355691432953,
"step": 348
},
{
"epoch": 2.569316081330869,
"grad_norm": 5.598950386047363,
"learning_rate": 7.568238213399505e-06,
"loss": 0.5544854402542114,
"step": 349
},
{
"epoch": 2.5767097966728283,
"grad_norm": 3.0546700954437256,
"learning_rate": 7.444168734491315e-06,
"loss": 0.2565973699092865,
"step": 350
},
{
"epoch": 2.5767097966728283,
"eval_loss": 0.6780612468719482,
"eval_runtime": 12.5593,
"eval_samples_per_second": 3.981,
"eval_steps_per_second": 1.035,
"step": 350
},
{
"epoch": 2.5841035120147873,
"grad_norm": 5.245316028594971,
"learning_rate": 7.320099255583126e-06,
"loss": 0.3251678943634033,
"step": 351
},
{
"epoch": 2.5914972273567467,
"grad_norm": 3.5428197383880615,
"learning_rate": 7.1960297766749385e-06,
"loss": 0.2545225918292999,
"step": 352
},
{
"epoch": 2.598890942698706,
"grad_norm": 3.804682493209839,
"learning_rate": 7.07196029776675e-06,
"loss": 0.47154200077056885,
"step": 353
},
{
"epoch": 2.6062846580406656,
"grad_norm": 4.04072904586792,
"learning_rate": 6.9478908188585614e-06,
"loss": 0.35344043374061584,
"step": 354
},
{
"epoch": 2.6136783733826245,
"grad_norm": 5.472744464874268,
"learning_rate": 6.823821339950373e-06,
"loss": 0.4716290831565857,
"step": 355
},
{
"epoch": 2.621072088724584,
"grad_norm": 5.119224548339844,
"learning_rate": 6.6997518610421835e-06,
"loss": 0.5888644456863403,
"step": 356
},
{
"epoch": 2.6284658040665434,
"grad_norm": 5.897572994232178,
"learning_rate": 6.575682382133995e-06,
"loss": 0.5343536138534546,
"step": 357
},
{
"epoch": 2.635859519408503,
"grad_norm": 5.354091167449951,
"learning_rate": 6.451612903225806e-06,
"loss": 0.8592066764831543,
"step": 358
},
{
"epoch": 2.6432532347504623,
"grad_norm": 4.489461898803711,
"learning_rate": 6.327543424317618e-06,
"loss": 0.33109182119369507,
"step": 359
},
{
"epoch": 2.6506469500924217,
"grad_norm": 4.269669532775879,
"learning_rate": 6.20347394540943e-06,
"loss": 0.32698845863342285,
"step": 360
},
{
"epoch": 2.6506469500924217,
"eval_loss": 0.6756904125213623,
"eval_runtime": 12.4205,
"eval_samples_per_second": 4.026,
"eval_steps_per_second": 1.047,
"step": 360
},
{
"epoch": 2.6580406654343807,
"grad_norm": 2.9795918464660645,
"learning_rate": 6.079404466501241e-06,
"loss": 0.16840402781963348,
"step": 361
},
{
"epoch": 2.66543438077634,
"grad_norm": 4.061313629150391,
"learning_rate": 5.955334987593052e-06,
"loss": 0.3083171546459198,
"step": 362
},
{
"epoch": 2.6728280961182995,
"grad_norm": 4.778440475463867,
"learning_rate": 5.831265508684864e-06,
"loss": 0.34697240591049194,
"step": 363
},
{
"epoch": 2.6802218114602585,
"grad_norm": 4.378132343292236,
"learning_rate": 5.707196029776675e-06,
"loss": 0.4491539001464844,
"step": 364
},
{
"epoch": 2.687615526802218,
"grad_norm": 3.488309860229492,
"learning_rate": 5.5831265508684865e-06,
"loss": 0.2493092566728592,
"step": 365
},
{
"epoch": 2.6950092421441774,
"grad_norm": 2.665125846862793,
"learning_rate": 5.459057071960298e-06,
"loss": 0.14598557353019714,
"step": 366
},
{
"epoch": 2.702402957486137,
"grad_norm": 4.287075519561768,
"learning_rate": 5.334987593052109e-06,
"loss": 0.33190983533859253,
"step": 367
},
{
"epoch": 2.709796672828096,
"grad_norm": 4.174441337585449,
"learning_rate": 5.210918114143921e-06,
"loss": 0.38076817989349365,
"step": 368
},
{
"epoch": 2.7171903881700556,
"grad_norm": 4.562845706939697,
"learning_rate": 5.086848635235732e-06,
"loss": 0.385815292596817,
"step": 369
},
{
"epoch": 2.7245841035120146,
"grad_norm": 4.855499267578125,
"learning_rate": 4.962779156327544e-06,
"loss": 0.6614516973495483,
"step": 370
},
{
"epoch": 2.7245841035120146,
"eval_loss": 0.675829291343689,
"eval_runtime": 12.5697,
"eval_samples_per_second": 3.978,
"eval_steps_per_second": 1.034,
"step": 370
},
{
"epoch": 2.731977818853974,
"grad_norm": 5.454403400421143,
"learning_rate": 4.838709677419355e-06,
"loss": 0.8207973837852478,
"step": 371
},
{
"epoch": 2.7393715341959335,
"grad_norm": 4.332508563995361,
"learning_rate": 4.714640198511167e-06,
"loss": 0.3006463646888733,
"step": 372
},
{
"epoch": 2.746765249537893,
"grad_norm": 3.909074544906616,
"learning_rate": 4.590570719602978e-06,
"loss": 0.28956088423728943,
"step": 373
},
{
"epoch": 2.754158964879852,
"grad_norm": 5.085633754730225,
"learning_rate": 4.466501240694789e-06,
"loss": 0.35135942697525024,
"step": 374
},
{
"epoch": 2.7615526802218113,
"grad_norm": 4.4873809814453125,
"learning_rate": 4.342431761786601e-06,
"loss": 0.4216098487377167,
"step": 375
},
{
"epoch": 2.7689463955637708,
"grad_norm": 4.101310729980469,
"learning_rate": 4.2183622828784124e-06,
"loss": 0.2831707298755646,
"step": 376
},
{
"epoch": 2.77634011090573,
"grad_norm": 6.565721035003662,
"learning_rate": 4.094292803970223e-06,
"loss": 0.8177705407142639,
"step": 377
},
{
"epoch": 2.7837338262476896,
"grad_norm": 4.548885345458984,
"learning_rate": 3.970223325062035e-06,
"loss": 0.5057659149169922,
"step": 378
},
{
"epoch": 2.791127541589649,
"grad_norm": 4.665341377258301,
"learning_rate": 3.846153846153847e-06,
"loss": 0.33335670828819275,
"step": 379
},
{
"epoch": 2.798521256931608,
"grad_norm": 4.832557201385498,
"learning_rate": 3.7220843672456574e-06,
"loss": 0.548736572265625,
"step": 380
},
{
"epoch": 2.798521256931608,
"eval_loss": 0.6768398880958557,
"eval_runtime": 12.3489,
"eval_samples_per_second": 4.049,
"eval_steps_per_second": 1.053,
"step": 380
},
{
"epoch": 2.8059149722735675,
"grad_norm": 2.661865472793579,
"learning_rate": 3.5980148883374693e-06,
"loss": 0.10511849820613861,
"step": 381
},
{
"epoch": 2.813308687615527,
"grad_norm": 5.309775352478027,
"learning_rate": 3.4739454094292807e-06,
"loss": 0.6201926469802856,
"step": 382
},
{
"epoch": 2.820702402957486,
"grad_norm": 4.453733921051025,
"learning_rate": 3.3498759305210917e-06,
"loss": 0.3460041880607605,
"step": 383
},
{
"epoch": 2.8280961182994453,
"grad_norm": 4.914036750793457,
"learning_rate": 3.225806451612903e-06,
"loss": 0.48873624205589294,
"step": 384
},
{
"epoch": 2.8354898336414047,
"grad_norm": 4.469694137573242,
"learning_rate": 3.101736972704715e-06,
"loss": 0.3550401031970978,
"step": 385
},
{
"epoch": 2.842883548983364,
"grad_norm": 4.101950168609619,
"learning_rate": 2.977667493796526e-06,
"loss": 0.36257147789001465,
"step": 386
},
{
"epoch": 2.8502772643253236,
"grad_norm": 4.840570449829102,
"learning_rate": 2.8535980148883375e-06,
"loss": 0.5777380466461182,
"step": 387
},
{
"epoch": 2.857670979667283,
"grad_norm": 3.147803783416748,
"learning_rate": 2.729528535980149e-06,
"loss": 0.320244163274765,
"step": 388
},
{
"epoch": 2.865064695009242,
"grad_norm": 4.090023994445801,
"learning_rate": 2.6054590570719604e-06,
"loss": 0.2959524989128113,
"step": 389
},
{
"epoch": 2.8724584103512014,
"grad_norm": 4.499933242797852,
"learning_rate": 2.481389578163772e-06,
"loss": 0.3996496796607971,
"step": 390
},
{
"epoch": 2.8724584103512014,
"eval_loss": 0.6760193705558777,
"eval_runtime": 12.5645,
"eval_samples_per_second": 3.979,
"eval_steps_per_second": 1.035,
"step": 390
},
{
"epoch": 2.879852125693161,
"grad_norm": 4.907258033752441,
"learning_rate": 2.3573200992555833e-06,
"loss": 0.30245816707611084,
"step": 391
},
{
"epoch": 2.8872458410351203,
"grad_norm": 4.042727947235107,
"learning_rate": 2.2332506203473944e-06,
"loss": 0.3344458341598511,
"step": 392
},
{
"epoch": 2.8946395563770793,
"grad_norm": 4.045156002044678,
"learning_rate": 2.1091811414392062e-06,
"loss": 0.17773765325546265,
"step": 393
},
{
"epoch": 2.9020332717190387,
"grad_norm": 4.525294303894043,
"learning_rate": 1.9851116625310177e-06,
"loss": 0.3942530155181885,
"step": 394
},
{
"epoch": 2.909426987060998,
"grad_norm": 4.726840019226074,
"learning_rate": 1.8610421836228287e-06,
"loss": 0.4639776349067688,
"step": 395
},
{
"epoch": 2.9168207024029575,
"grad_norm": 6.167337417602539,
"learning_rate": 1.7369727047146404e-06,
"loss": 0.873107373714447,
"step": 396
},
{
"epoch": 2.924214417744917,
"grad_norm": 4.44651460647583,
"learning_rate": 1.6129032258064516e-06,
"loss": 0.4783494472503662,
"step": 397
},
{
"epoch": 2.9316081330868764,
"grad_norm": 5.8177289962768555,
"learning_rate": 1.488833746898263e-06,
"loss": 0.566139280796051,
"step": 398
},
{
"epoch": 2.9390018484288354,
"grad_norm": 4.559521675109863,
"learning_rate": 1.3647642679900745e-06,
"loss": 0.2975980043411255,
"step": 399
},
{
"epoch": 2.946395563770795,
"grad_norm": 4.534932613372803,
"learning_rate": 1.240694789081886e-06,
"loss": 0.42307165265083313,
"step": 400
},
{
"epoch": 2.946395563770795,
"eval_loss": 0.6753122210502625,
"eval_runtime": 12.473,
"eval_samples_per_second": 4.009,
"eval_steps_per_second": 1.042,
"step": 400
},
{
"epoch": 2.9537892791127542,
"grad_norm": 4.688410758972168,
"learning_rate": 1.1166253101736972e-06,
"loss": 0.31728246808052063,
"step": 401
},
{
"epoch": 2.9611829944547132,
"grad_norm": 3.6959214210510254,
"learning_rate": 9.925558312655088e-07,
"loss": 0.296553373336792,
"step": 402
},
{
"epoch": 2.9685767097966727,
"grad_norm": 4.490988254547119,
"learning_rate": 8.684863523573202e-07,
"loss": 0.41596537828445435,
"step": 403
},
{
"epoch": 2.975970425138632,
"grad_norm": 5.713006019592285,
"learning_rate": 7.444168734491315e-07,
"loss": 0.5145145654678345,
"step": 404
},
{
"epoch": 2.9833641404805915,
"grad_norm": 4.68435001373291,
"learning_rate": 6.20347394540943e-07,
"loss": 0.47570955753326416,
"step": 405
},
{
"epoch": 2.990757855822551,
"grad_norm": 3.961190938949585,
"learning_rate": 4.962779156327544e-07,
"loss": 0.4042632579803467,
"step": 406
},
{
"epoch": 2.9981515711645104,
"grad_norm": 5.057858467102051,
"learning_rate": 3.7220843672456576e-07,
"loss": 0.4465891718864441,
"step": 407
},
{
"epoch": 3.0,
"grad_norm": 8.670039176940918,
"learning_rate": 2.481389578163772e-07,
"loss": 0.4737997353076935,
"step": 408
},
{
"epoch": 3.0,
"eval_loss": 0.6750363707542419,
"eval_runtime": 12.4809,
"eval_samples_per_second": 4.006,
"eval_steps_per_second": 1.042,
"step": 408
}
],
"logging_steps": 1,
"max_steps": 408,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 10,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1448379908790272e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}