{ "best_global_step": 408, "best_metric": 0.6750363707542419, "best_model_checkpoint": "/kaggle/working/sep490_checkpoints/job_ce30cf18-8eef-4444-8cae-3f972a780634/checkpoint-408", "epoch": 3.0, "eval_steps": 10, "global_step": 408, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0073937153419593345, "grad_norm": 1.7587594985961914, "learning_rate": 0.0, "loss": 2.691019296646118, "step": 1 }, { "epoch": 0.014787430683918669, "grad_norm": 1.930446982383728, "learning_rate": 1e-05, "loss": 2.75667667388916, "step": 2 }, { "epoch": 0.022181146025878003, "grad_norm": 1.953555703163147, "learning_rate": 2e-05, "loss": 3.7232160568237305, "step": 3 }, { "epoch": 0.029574861367837338, "grad_norm": 1.4509127140045166, "learning_rate": 3e-05, "loss": 2.9131853580474854, "step": 4 }, { "epoch": 0.036968576709796676, "grad_norm": 2.036184310913086, "learning_rate": 4e-05, "loss": 3.0811572074890137, "step": 5 }, { "epoch": 0.04436229205175601, "grad_norm": 1.7680681943893433, "learning_rate": 5e-05, "loss": 2.68190598487854, "step": 6 }, { "epoch": 0.051756007393715345, "grad_norm": 2.4544951915740967, "learning_rate": 4.987593052109181e-05, "loss": 3.960662364959717, "step": 7 }, { "epoch": 0.059149722735674676, "grad_norm": 1.7252415418624878, "learning_rate": 4.9751861042183624e-05, "loss": 2.195984125137329, "step": 8 }, { "epoch": 0.066543438077634, "grad_norm": 1.9524086713790894, "learning_rate": 4.962779156327544e-05, "loss": 2.1853127479553223, "step": 9 }, { "epoch": 0.07393715341959335, "grad_norm": 2.1538190841674805, "learning_rate": 4.950372208436725e-05, "loss": 2.8134853839874268, "step": 10 }, { "epoch": 0.07393715341959335, "eval_loss": 2.3912832736968994, "eval_runtime": 11.6038, "eval_samples_per_second": 4.309, "eval_steps_per_second": 1.12, "step": 10 }, { "epoch": 0.08133086876155268, "grad_norm": 1.9469140768051147, "learning_rate": 4.937965260545906e-05, "loss": 2.1433486938476562, "step": 11 }, { "epoch": 0.08872458410351201, "grad_norm": 2.3120369911193848, "learning_rate": 4.9255583126550866e-05, "loss": 2.385965347290039, "step": 12 }, { "epoch": 0.09611829944547134, "grad_norm": 2.2094929218292236, "learning_rate": 4.9131513647642677e-05, "loss": 2.4737462997436523, "step": 13 }, { "epoch": 0.10351201478743069, "grad_norm": 2.6324586868286133, "learning_rate": 4.9007444168734494e-05, "loss": 2.3202741146087646, "step": 14 }, { "epoch": 0.11090573012939002, "grad_norm": 2.2847135066986084, "learning_rate": 4.8883374689826305e-05, "loss": 2.369445323944092, "step": 15 }, { "epoch": 0.11829944547134935, "grad_norm": 2.079944133758545, "learning_rate": 4.8759305210918115e-05, "loss": 2.015984058380127, "step": 16 }, { "epoch": 0.1256931608133087, "grad_norm": 2.3084442615509033, "learning_rate": 4.8635235732009926e-05, "loss": 2.0963761806488037, "step": 17 }, { "epoch": 0.133086876155268, "grad_norm": 2.5707437992095947, "learning_rate": 4.851116625310174e-05, "loss": 2.4691004753112793, "step": 18 }, { "epoch": 0.14048059149722736, "grad_norm": 2.2389156818389893, "learning_rate": 4.8387096774193554e-05, "loss": 2.1746907234191895, "step": 19 }, { "epoch": 0.1478743068391867, "grad_norm": 2.1317756175994873, "learning_rate": 4.8263027295285364e-05, "loss": 2.1674509048461914, "step": 20 }, { "epoch": 0.1478743068391867, "eval_loss": 1.91414213180542, "eval_runtime": 12.5864, "eval_samples_per_second": 3.973, "eval_steps_per_second": 1.033, "step": 20 }, { "epoch": 0.15526802218114602, "grad_norm": 2.428013563156128, "learning_rate": 4.8138957816377175e-05, "loss": 1.9142755270004272, "step": 21 }, { "epoch": 0.16266173752310537, "grad_norm": 2.3884992599487305, "learning_rate": 4.8014888337468986e-05, "loss": 2.2496678829193115, "step": 22 }, { "epoch": 0.17005545286506468, "grad_norm": 1.786407232284546, "learning_rate": 4.7890818858560796e-05, "loss": 1.8403816223144531, "step": 23 }, { "epoch": 0.17744916820702403, "grad_norm": 2.4553239345550537, "learning_rate": 4.776674937965261e-05, "loss": 2.4630396366119385, "step": 24 }, { "epoch": 0.18484288354898337, "grad_norm": 2.4950063228607178, "learning_rate": 4.764267990074442e-05, "loss": 1.4519834518432617, "step": 25 }, { "epoch": 0.1922365988909427, "grad_norm": 2.243168354034424, "learning_rate": 4.751861042183623e-05, "loss": 1.7111647129058838, "step": 26 }, { "epoch": 0.19963031423290203, "grad_norm": 2.569514274597168, "learning_rate": 4.739454094292804e-05, "loss": 1.9534958600997925, "step": 27 }, { "epoch": 0.20702402957486138, "grad_norm": 2.2852730751037598, "learning_rate": 4.7270471464019856e-05, "loss": 1.4022412300109863, "step": 28 }, { "epoch": 0.2144177449168207, "grad_norm": 2.4911389350891113, "learning_rate": 4.7146401985111667e-05, "loss": 1.627483606338501, "step": 29 }, { "epoch": 0.22181146025878004, "grad_norm": 2.8639137744903564, "learning_rate": 4.702233250620348e-05, "loss": 1.8156955242156982, "step": 30 }, { "epoch": 0.22181146025878004, "eval_loss": 1.637284755706787, "eval_runtime": 12.06, "eval_samples_per_second": 4.146, "eval_steps_per_second": 1.078, "step": 30 }, { "epoch": 0.22920517560073936, "grad_norm": 2.854050397872925, "learning_rate": 4.689826302729529e-05, "loss": 1.8234474658966064, "step": 31 }, { "epoch": 0.2365988909426987, "grad_norm": 2.51224684715271, "learning_rate": 4.67741935483871e-05, "loss": 1.630173683166504, "step": 32 }, { "epoch": 0.24399260628465805, "grad_norm": 2.530003786087036, "learning_rate": 4.665012406947891e-05, "loss": 2.195810317993164, "step": 33 }, { "epoch": 0.2513863216266174, "grad_norm": 2.8960745334625244, "learning_rate": 4.652605459057072e-05, "loss": 2.0083396434783936, "step": 34 }, { "epoch": 0.2587800369685767, "grad_norm": 2.9172658920288086, "learning_rate": 4.640198511166253e-05, "loss": 1.4498248100280762, "step": 35 }, { "epoch": 0.266173752310536, "grad_norm": 2.2400825023651123, "learning_rate": 4.627791563275434e-05, "loss": 1.1269171237945557, "step": 36 }, { "epoch": 0.2735674676524954, "grad_norm": 2.538266181945801, "learning_rate": 4.615384615384616e-05, "loss": 1.8185009956359863, "step": 37 }, { "epoch": 0.2809611829944547, "grad_norm": 2.3526978492736816, "learning_rate": 4.602977667493797e-05, "loss": 1.0682374238967896, "step": 38 }, { "epoch": 0.28835489833641403, "grad_norm": 2.8807811737060547, "learning_rate": 4.590570719602978e-05, "loss": 2.21337890625, "step": 39 }, { "epoch": 0.2957486136783734, "grad_norm": 2.7879021167755127, "learning_rate": 4.578163771712159e-05, "loss": 1.689092755317688, "step": 40 }, { "epoch": 0.2957486136783734, "eval_loss": 1.4498449563980103, "eval_runtime": 12.5884, "eval_samples_per_second": 3.972, "eval_steps_per_second": 1.033, "step": 40 }, { "epoch": 0.3031423290203327, "grad_norm": 2.432206392288208, "learning_rate": 4.56575682382134e-05, "loss": 1.2275516986846924, "step": 41 }, { "epoch": 0.31053604436229204, "grad_norm": 3.0099549293518066, "learning_rate": 4.553349875930522e-05, "loss": 1.185080647468567, "step": 42 }, { "epoch": 0.3179297597042514, "grad_norm": 2.7897891998291016, "learning_rate": 4.540942928039703e-05, "loss": 1.3819549083709717, "step": 43 }, { "epoch": 0.32532347504621073, "grad_norm": 2.8821756839752197, "learning_rate": 4.528535980148884e-05, "loss": 1.3627997636795044, "step": 44 }, { "epoch": 0.33271719038817005, "grad_norm": 3.9456920623779297, "learning_rate": 4.516129032258064e-05, "loss": 1.792586326599121, "step": 45 }, { "epoch": 0.34011090573012936, "grad_norm": 2.7059478759765625, "learning_rate": 4.5037220843672454e-05, "loss": 1.4585685729980469, "step": 46 }, { "epoch": 0.34750462107208874, "grad_norm": 3.4259610176086426, "learning_rate": 4.491315136476427e-05, "loss": 2.1591320037841797, "step": 47 }, { "epoch": 0.35489833641404805, "grad_norm": 3.6107091903686523, "learning_rate": 4.478908188585608e-05, "loss": 1.9699089527130127, "step": 48 }, { "epoch": 0.36229205175600737, "grad_norm": 2.445187568664551, "learning_rate": 4.466501240694789e-05, "loss": 1.0851035118103027, "step": 49 }, { "epoch": 0.36968576709796674, "grad_norm": 3.2657907009124756, "learning_rate": 4.45409429280397e-05, "loss": 1.8776271343231201, "step": 50 }, { "epoch": 0.36968576709796674, "eval_loss": 1.2967743873596191, "eval_runtime": 12.5267, "eval_samples_per_second": 3.991, "eval_steps_per_second": 1.038, "step": 50 }, { "epoch": 0.37707948243992606, "grad_norm": 3.1562914848327637, "learning_rate": 4.441687344913151e-05, "loss": 1.5886495113372803, "step": 51 }, { "epoch": 0.3844731977818854, "grad_norm": 3.7622435092926025, "learning_rate": 4.429280397022333e-05, "loss": 1.5878514051437378, "step": 52 }, { "epoch": 0.39186691312384475, "grad_norm": 3.235161066055298, "learning_rate": 4.416873449131514e-05, "loss": 1.307330846786499, "step": 53 }, { "epoch": 0.39926062846580407, "grad_norm": 3.034426212310791, "learning_rate": 4.404466501240695e-05, "loss": 1.0698113441467285, "step": 54 }, { "epoch": 0.4066543438077634, "grad_norm": 3.166105270385742, "learning_rate": 4.392059553349876e-05, "loss": 1.3888237476348877, "step": 55 }, { "epoch": 0.41404805914972276, "grad_norm": 3.379401922225952, "learning_rate": 4.379652605459057e-05, "loss": 1.4811557531356812, "step": 56 }, { "epoch": 0.4214417744916821, "grad_norm": 2.8660521507263184, "learning_rate": 4.3672456575682384e-05, "loss": 1.2131584882736206, "step": 57 }, { "epoch": 0.4288354898336414, "grad_norm": 2.932765245437622, "learning_rate": 4.3548387096774194e-05, "loss": 1.1394425630569458, "step": 58 }, { "epoch": 0.43622920517560076, "grad_norm": 3.085935354232788, "learning_rate": 4.3424317617866005e-05, "loss": 1.2639648914337158, "step": 59 }, { "epoch": 0.4436229205175601, "grad_norm": 2.835193157196045, "learning_rate": 4.3300248138957816e-05, "loss": 1.256007194519043, "step": 60 }, { "epoch": 0.4436229205175601, "eval_loss": 1.171344518661499, "eval_runtime": 12.3887, "eval_samples_per_second": 4.036, "eval_steps_per_second": 1.049, "step": 60 }, { "epoch": 0.4510166358595194, "grad_norm": 4.220600128173828, "learning_rate": 4.317617866004963e-05, "loss": 1.1558457612991333, "step": 61 }, { "epoch": 0.4584103512014787, "grad_norm": 3.2328484058380127, "learning_rate": 4.3052109181141444e-05, "loss": 1.7892142534255981, "step": 62 }, { "epoch": 0.4658040665434381, "grad_norm": 3.1310110092163086, "learning_rate": 4.2928039702233254e-05, "loss": 1.5464088916778564, "step": 63 }, { "epoch": 0.4731977818853974, "grad_norm": 2.7544875144958496, "learning_rate": 4.2803970223325065e-05, "loss": 1.1755099296569824, "step": 64 }, { "epoch": 0.4805914972273567, "grad_norm": 2.8833136558532715, "learning_rate": 4.2679900744416875e-05, "loss": 1.0351439714431763, "step": 65 }, { "epoch": 0.4879852125693161, "grad_norm": 3.911613702774048, "learning_rate": 4.2555831265508686e-05, "loss": 1.674350619316101, "step": 66 }, { "epoch": 0.4953789279112754, "grad_norm": 3.5602052211761475, "learning_rate": 4.2431761786600497e-05, "loss": 1.8415451049804688, "step": 67 }, { "epoch": 0.5027726432532348, "grad_norm": 3.243236541748047, "learning_rate": 4.230769230769231e-05, "loss": 0.9139584302902222, "step": 68 }, { "epoch": 0.5101663585951941, "grad_norm": 3.178295135498047, "learning_rate": 4.218362282878412e-05, "loss": 1.0007776021957397, "step": 69 }, { "epoch": 0.5175600739371534, "grad_norm": 2.949404001235962, "learning_rate": 4.205955334987593e-05, "loss": 1.2593410015106201, "step": 70 }, { "epoch": 0.5175600739371534, "eval_loss": 1.0979946851730347, "eval_runtime": 12.5239, "eval_samples_per_second": 3.992, "eval_steps_per_second": 1.038, "step": 70 }, { "epoch": 0.5249537892791127, "grad_norm": 3.8847079277038574, "learning_rate": 4.1935483870967746e-05, "loss": 2.036594867706299, "step": 71 }, { "epoch": 0.532347504621072, "grad_norm": 3.068953514099121, "learning_rate": 4.1811414392059556e-05, "loss": 0.6717187166213989, "step": 72 }, { "epoch": 0.5397412199630314, "grad_norm": 3.2837107181549072, "learning_rate": 4.168734491315137e-05, "loss": 1.2511982917785645, "step": 73 }, { "epoch": 0.5471349353049908, "grad_norm": 2.77791690826416, "learning_rate": 4.156327543424318e-05, "loss": 0.8615735769271851, "step": 74 }, { "epoch": 0.5545286506469501, "grad_norm": 3.068490743637085, "learning_rate": 4.1439205955334995e-05, "loss": 1.0339652299880981, "step": 75 }, { "epoch": 0.5619223659889094, "grad_norm": 2.979583263397217, "learning_rate": 4.1315136476426805e-05, "loss": 1.1108063459396362, "step": 76 }, { "epoch": 0.5693160813308688, "grad_norm": 3.9051339626312256, "learning_rate": 4.119106699751861e-05, "loss": 1.4168835878372192, "step": 77 }, { "epoch": 0.5767097966728281, "grad_norm": 3.7126312255859375, "learning_rate": 4.106699751861042e-05, "loss": 1.3734055757522583, "step": 78 }, { "epoch": 0.5841035120147874, "grad_norm": 3.31662654876709, "learning_rate": 4.094292803970223e-05, "loss": 1.2524129152297974, "step": 79 }, { "epoch": 0.5914972273567468, "grad_norm": 4.711428642272949, "learning_rate": 4.081885856079405e-05, "loss": 1.236316442489624, "step": 80 }, { "epoch": 0.5914972273567468, "eval_loss": 1.0435348749160767, "eval_runtime": 12.3458, "eval_samples_per_second": 4.05, "eval_steps_per_second": 1.053, "step": 80 }, { "epoch": 0.5988909426987061, "grad_norm": 4.0361762046813965, "learning_rate": 4.069478908188586e-05, "loss": 1.4246442317962646, "step": 81 }, { "epoch": 0.6062846580406654, "grad_norm": 2.8361904621124268, "learning_rate": 4.057071960297767e-05, "loss": 0.9345840811729431, "step": 82 }, { "epoch": 0.6136783733826248, "grad_norm": 3.7095162868499756, "learning_rate": 4.044665012406948e-05, "loss": 1.5689283609390259, "step": 83 }, { "epoch": 0.6210720887245841, "grad_norm": 3.5047953128814697, "learning_rate": 4.032258064516129e-05, "loss": 0.8759887218475342, "step": 84 }, { "epoch": 0.6284658040665434, "grad_norm": 3.5987155437469482, "learning_rate": 4.019851116625311e-05, "loss": 1.1171759366989136, "step": 85 }, { "epoch": 0.6358595194085028, "grad_norm": 3.731731414794922, "learning_rate": 4.007444168734492e-05, "loss": 1.6270053386688232, "step": 86 }, { "epoch": 0.6432532347504621, "grad_norm": 3.573490858078003, "learning_rate": 3.995037220843673e-05, "loss": 1.056086540222168, "step": 87 }, { "epoch": 0.6506469500924215, "grad_norm": 3.3525490760803223, "learning_rate": 3.982630272952854e-05, "loss": 1.1946213245391846, "step": 88 }, { "epoch": 0.6580406654343808, "grad_norm": 3.7373411655426025, "learning_rate": 3.970223325062035e-05, "loss": 0.8827130794525146, "step": 89 }, { "epoch": 0.6654343807763401, "grad_norm": 4.0084710121154785, "learning_rate": 3.957816377171216e-05, "loss": 0.9339371919631958, "step": 90 }, { "epoch": 0.6654343807763401, "eval_loss": 1.0062669515609741, "eval_runtime": 12.5195, "eval_samples_per_second": 3.994, "eval_steps_per_second": 1.038, "step": 90 }, { "epoch": 0.6728280961182994, "grad_norm": 3.986560583114624, "learning_rate": 3.945409429280397e-05, "loss": 1.4415428638458252, "step": 91 }, { "epoch": 0.6802218114602587, "grad_norm": 4.451272964477539, "learning_rate": 3.933002481389578e-05, "loss": 1.0824394226074219, "step": 92 }, { "epoch": 0.6876155268022182, "grad_norm": 3.693286180496216, "learning_rate": 3.920595533498759e-05, "loss": 1.1940369606018066, "step": 93 }, { "epoch": 0.6950092421441775, "grad_norm": 2.855053424835205, "learning_rate": 3.908188585607941e-05, "loss": 0.9173199534416199, "step": 94 }, { "epoch": 0.7024029574861368, "grad_norm": 4.027679443359375, "learning_rate": 3.895781637717122e-05, "loss": 0.9497783184051514, "step": 95 }, { "epoch": 0.7097966728280961, "grad_norm": 3.9087977409362793, "learning_rate": 3.883374689826303e-05, "loss": 1.0188655853271484, "step": 96 }, { "epoch": 0.7171903881700554, "grad_norm": 3.241875171661377, "learning_rate": 3.870967741935484e-05, "loss": 0.8885791301727295, "step": 97 }, { "epoch": 0.7245841035120147, "grad_norm": 4.185547351837158, "learning_rate": 3.858560794044665e-05, "loss": 1.2772949934005737, "step": 98 }, { "epoch": 0.7319778188539742, "grad_norm": 4.142065048217773, "learning_rate": 3.846153846153846e-05, "loss": 1.2576420307159424, "step": 99 }, { "epoch": 0.7393715341959335, "grad_norm": 3.615719795227051, "learning_rate": 3.8337468982630273e-05, "loss": 1.0819486379623413, "step": 100 }, { "epoch": 0.7393715341959335, "eval_loss": 0.9623194932937622, "eval_runtime": 12.381, "eval_samples_per_second": 4.038, "eval_steps_per_second": 1.05, "step": 100 }, { "epoch": 0.7467652495378928, "grad_norm": 4.190881729125977, "learning_rate": 3.8213399503722084e-05, "loss": 1.2672250270843506, "step": 101 }, { "epoch": 0.7541589648798521, "grad_norm": 3.193317174911499, "learning_rate": 3.8089330024813895e-05, "loss": 0.5870144963264465, "step": 102 }, { "epoch": 0.7615526802218114, "grad_norm": 3.363736867904663, "learning_rate": 3.7965260545905705e-05, "loss": 0.9823516011238098, "step": 103 }, { "epoch": 0.7689463955637708, "grad_norm": 3.5238037109375, "learning_rate": 3.784119106699752e-05, "loss": 1.0627766847610474, "step": 104 }, { "epoch": 0.7763401109057301, "grad_norm": 3.9384078979492188, "learning_rate": 3.771712158808933e-05, "loss": 0.9595991969108582, "step": 105 }, { "epoch": 0.7837338262476895, "grad_norm": 2.542327642440796, "learning_rate": 3.7593052109181144e-05, "loss": 0.4437144696712494, "step": 106 }, { "epoch": 0.7911275415896488, "grad_norm": 3.4414448738098145, "learning_rate": 3.7468982630272954e-05, "loss": 0.9118318557739258, "step": 107 }, { "epoch": 0.7985212569316081, "grad_norm": 4.058464527130127, "learning_rate": 3.734491315136477e-05, "loss": 1.0451924800872803, "step": 108 }, { "epoch": 0.8059149722735675, "grad_norm": 4.525938987731934, "learning_rate": 3.7220843672456576e-05, "loss": 1.365138053894043, "step": 109 }, { "epoch": 0.8133086876155268, "grad_norm": 4.43060302734375, "learning_rate": 3.7096774193548386e-05, "loss": 1.3941904306411743, "step": 110 }, { "epoch": 0.8133086876155268, "eval_loss": 0.9057048559188843, "eval_runtime": 12.4702, "eval_samples_per_second": 4.01, "eval_steps_per_second": 1.042, "step": 110 }, { "epoch": 0.8207024029574861, "grad_norm": 4.437230110168457, "learning_rate": 3.69727047146402e-05, "loss": 1.5756592750549316, "step": 111 }, { "epoch": 0.8280961182994455, "grad_norm": 4.131067752838135, "learning_rate": 3.684863523573201e-05, "loss": 1.2377750873565674, "step": 112 }, { "epoch": 0.8354898336414048, "grad_norm": 4.641602516174316, "learning_rate": 3.6724565756823825e-05, "loss": 1.4081263542175293, "step": 113 }, { "epoch": 0.8428835489833642, "grad_norm": 4.326359272003174, "learning_rate": 3.6600496277915635e-05, "loss": 0.9341489672660828, "step": 114 }, { "epoch": 0.8502772643253235, "grad_norm": 2.9741251468658447, "learning_rate": 3.6476426799007446e-05, "loss": 0.866841197013855, "step": 115 }, { "epoch": 0.8576709796672828, "grad_norm": 4.513277053833008, "learning_rate": 3.635235732009926e-05, "loss": 1.2367680072784424, "step": 116 }, { "epoch": 0.8650646950092421, "grad_norm": 3.476611852645874, "learning_rate": 3.622828784119107e-05, "loss": 1.1124229431152344, "step": 117 }, { "epoch": 0.8724584103512015, "grad_norm": 3.6457555294036865, "learning_rate": 3.6104218362282885e-05, "loss": 0.9956739544868469, "step": 118 }, { "epoch": 0.8798521256931608, "grad_norm": 3.688424825668335, "learning_rate": 3.5980148883374695e-05, "loss": 1.0528156757354736, "step": 119 }, { "epoch": 0.8872458410351202, "grad_norm": 3.346254348754883, "learning_rate": 3.5856079404466506e-05, "loss": 0.7025595903396606, "step": 120 }, { "epoch": 0.8872458410351202, "eval_loss": 0.8716071844100952, "eval_runtime": 12.4971, "eval_samples_per_second": 4.001, "eval_steps_per_second": 1.04, "step": 120 }, { "epoch": 0.8946395563770795, "grad_norm": 4.01053524017334, "learning_rate": 3.573200992555831e-05, "loss": 1.2084448337554932, "step": 121 }, { "epoch": 0.9020332717190388, "grad_norm": 4.092630386352539, "learning_rate": 3.560794044665012e-05, "loss": 0.9433890581130981, "step": 122 }, { "epoch": 0.9094269870609981, "grad_norm": 4.795446872711182, "learning_rate": 3.548387096774194e-05, "loss": 1.5043132305145264, "step": 123 }, { "epoch": 0.9168207024029574, "grad_norm": 5.034322261810303, "learning_rate": 3.535980148883375e-05, "loss": 1.2913501262664795, "step": 124 }, { "epoch": 0.9242144177449169, "grad_norm": 2.9654548168182373, "learning_rate": 3.523573200992556e-05, "loss": 0.7111821174621582, "step": 125 }, { "epoch": 0.9316081330868762, "grad_norm": 3.7520949840545654, "learning_rate": 3.511166253101737e-05, "loss": 1.012024164199829, "step": 126 }, { "epoch": 0.9390018484288355, "grad_norm": 3.2195515632629395, "learning_rate": 3.498759305210919e-05, "loss": 0.7502498626708984, "step": 127 }, { "epoch": 0.9463955637707948, "grad_norm": 2.7303340435028076, "learning_rate": 3.4863523573201e-05, "loss": 0.4674774408340454, "step": 128 }, { "epoch": 0.9537892791127541, "grad_norm": 4.547392845153809, "learning_rate": 3.473945409429281e-05, "loss": 1.1602028608322144, "step": 129 }, { "epoch": 0.9611829944547134, "grad_norm": 3.680309772491455, "learning_rate": 3.461538461538462e-05, "loss": 0.9905465841293335, "step": 130 }, { "epoch": 0.9611829944547134, "eval_loss": 0.8414432406425476, "eval_runtime": 12.5233, "eval_samples_per_second": 3.993, "eval_steps_per_second": 1.038, "step": 130 }, { "epoch": 0.9685767097966729, "grad_norm": 3.0262203216552734, "learning_rate": 3.449131513647643e-05, "loss": 0.5491358041763306, "step": 131 }, { "epoch": 0.9759704251386322, "grad_norm": 3.6449105739593506, "learning_rate": 3.436724565756824e-05, "loss": 0.6083657741546631, "step": 132 }, { "epoch": 0.9833641404805915, "grad_norm": 3.8271355628967285, "learning_rate": 3.424317617866005e-05, "loss": 0.8229025602340698, "step": 133 }, { "epoch": 0.9907578558225508, "grad_norm": 4.178423881530762, "learning_rate": 3.411910669975186e-05, "loss": 0.9378503561019897, "step": 134 }, { "epoch": 0.9981515711645101, "grad_norm": 4.2185516357421875, "learning_rate": 3.399503722084367e-05, "loss": 1.0079054832458496, "step": 135 }, { "epoch": 1.0, "grad_norm": 7.801852703094482, "learning_rate": 3.387096774193548e-05, "loss": 0.695327877998352, "step": 136 }, { "epoch": 1.0073937153419594, "grad_norm": 4.088887691497803, "learning_rate": 3.37468982630273e-05, "loss": 0.9851850867271423, "step": 137 }, { "epoch": 1.0147874306839186, "grad_norm": 3.9392666816711426, "learning_rate": 3.362282878411911e-05, "loss": 1.0859596729278564, "step": 138 }, { "epoch": 1.022181146025878, "grad_norm": 2.7098422050476074, "learning_rate": 3.349875930521092e-05, "loss": 0.6913776397705078, "step": 139 }, { "epoch": 1.0295748613678373, "grad_norm": 3.724003314971924, "learning_rate": 3.337468982630273e-05, "loss": 0.9150189161300659, "step": 140 }, { "epoch": 1.0295748613678373, "eval_loss": 0.8158807158470154, "eval_runtime": 12.4581, "eval_samples_per_second": 4.013, "eval_steps_per_second": 1.043, "step": 140 }, { "epoch": 1.0369685767097967, "grad_norm": 3.8593032360076904, "learning_rate": 3.325062034739454e-05, "loss": 0.763762354850769, "step": 141 }, { "epoch": 1.044362292051756, "grad_norm": 2.0002894401550293, "learning_rate": 3.312655086848635e-05, "loss": 0.19527605175971985, "step": 142 }, { "epoch": 1.0517560073937153, "grad_norm": 3.253109931945801, "learning_rate": 3.300248138957816e-05, "loss": 0.6456115245819092, "step": 143 }, { "epoch": 1.0591497227356748, "grad_norm": 3.54606556892395, "learning_rate": 3.2878411910669974e-05, "loss": 0.6633723974227905, "step": 144 }, { "epoch": 1.066543438077634, "grad_norm": 3.267594575881958, "learning_rate": 3.2754342431761784e-05, "loss": 0.5955727696418762, "step": 145 }, { "epoch": 1.0739371534195934, "grad_norm": 2.721489429473877, "learning_rate": 3.26302729528536e-05, "loss": 0.4804825186729431, "step": 146 }, { "epoch": 1.0813308687615526, "grad_norm": 4.136324882507324, "learning_rate": 3.250620347394541e-05, "loss": 0.8072193264961243, "step": 147 }, { "epoch": 1.088724584103512, "grad_norm": 4.00969934463501, "learning_rate": 3.238213399503722e-05, "loss": 0.6894694566726685, "step": 148 }, { "epoch": 1.0961182994454712, "grad_norm": 4.594008445739746, "learning_rate": 3.2258064516129034e-05, "loss": 0.8274256587028503, "step": 149 }, { "epoch": 1.1035120147874307, "grad_norm": 4.16753625869751, "learning_rate": 3.2133995037220844e-05, "loss": 0.9284324645996094, "step": 150 }, { "epoch": 1.1035120147874307, "eval_loss": 0.7907436490058899, "eval_runtime": 12.5252, "eval_samples_per_second": 3.992, "eval_steps_per_second": 1.038, "step": 150 }, { "epoch": 1.11090573012939, "grad_norm": 4.045674800872803, "learning_rate": 3.200992555831266e-05, "loss": 0.5929744243621826, "step": 151 }, { "epoch": 1.1182994454713493, "grad_norm": 3.518078565597534, "learning_rate": 3.188585607940447e-05, "loss": 0.5093523263931274, "step": 152 }, { "epoch": 1.1256931608133087, "grad_norm": 3.477130174636841, "learning_rate": 3.176178660049628e-05, "loss": 0.7743373513221741, "step": 153 }, { "epoch": 1.133086876155268, "grad_norm": 3.28774356842041, "learning_rate": 3.1637717121588087e-05, "loss": 0.6708226799964905, "step": 154 }, { "epoch": 1.1404805914972274, "grad_norm": 3.7155025005340576, "learning_rate": 3.15136476426799e-05, "loss": 0.8554853796958923, "step": 155 }, { "epoch": 1.1478743068391868, "grad_norm": 3.8972744941711426, "learning_rate": 3.1389578163771715e-05, "loss": 0.6046540141105652, "step": 156 }, { "epoch": 1.155268022181146, "grad_norm": 3.0317745208740234, "learning_rate": 3.1265508684863525e-05, "loss": 0.4163368046283722, "step": 157 }, { "epoch": 1.1626617375231054, "grad_norm": 4.095373630523682, "learning_rate": 3.1141439205955336e-05, "loss": 0.7496839761734009, "step": 158 }, { "epoch": 1.1700554528650646, "grad_norm": 3.626768112182617, "learning_rate": 3.1017369727047146e-05, "loss": 0.661150336265564, "step": 159 }, { "epoch": 1.177449168207024, "grad_norm": 4.329172611236572, "learning_rate": 3.089330024813896e-05, "loss": 0.7081620693206787, "step": 160 }, { "epoch": 1.177449168207024, "eval_loss": 0.7687544822692871, "eval_runtime": 12.4056, "eval_samples_per_second": 4.03, "eval_steps_per_second": 1.048, "step": 160 }, { "epoch": 1.1848428835489835, "grad_norm": 3.254220485687256, "learning_rate": 3.0769230769230774e-05, "loss": 0.5945311784744263, "step": 161 }, { "epoch": 1.1922365988909427, "grad_norm": 3.851109266281128, "learning_rate": 3.0645161290322585e-05, "loss": 0.8574079871177673, "step": 162 }, { "epoch": 1.1996303142329021, "grad_norm": 4.224574089050293, "learning_rate": 3.0521091811414396e-05, "loss": 0.9319736957550049, "step": 163 }, { "epoch": 1.2070240295748613, "grad_norm": 4.972801208496094, "learning_rate": 3.0397022332506203e-05, "loss": 1.2526912689208984, "step": 164 }, { "epoch": 1.2144177449168208, "grad_norm": 3.001422643661499, "learning_rate": 3.027295285359802e-05, "loss": 0.6652424335479736, "step": 165 }, { "epoch": 1.22181146025878, "grad_norm": 4.232393741607666, "learning_rate": 3.014888337468983e-05, "loss": 0.7774908542633057, "step": 166 }, { "epoch": 1.2292051756007394, "grad_norm": 3.8872828483581543, "learning_rate": 3.0024813895781638e-05, "loss": 0.6157264709472656, "step": 167 }, { "epoch": 1.2365988909426986, "grad_norm": 4.408735275268555, "learning_rate": 2.990074441687345e-05, "loss": 0.6650868654251099, "step": 168 }, { "epoch": 1.243992606284658, "grad_norm": 3.140364646911621, "learning_rate": 2.977667493796526e-05, "loss": 0.36262229084968567, "step": 169 }, { "epoch": 1.2513863216266174, "grad_norm": 3.9706201553344727, "learning_rate": 2.9652605459057077e-05, "loss": 0.5755283832550049, "step": 170 }, { "epoch": 1.2513863216266174, "eval_loss": 0.7536106705665588, "eval_runtime": 12.506, "eval_samples_per_second": 3.998, "eval_steps_per_second": 1.039, "step": 170 }, { "epoch": 1.2587800369685767, "grad_norm": 3.590471029281616, "learning_rate": 2.9528535980148887e-05, "loss": 0.5963804125785828, "step": 171 }, { "epoch": 1.266173752310536, "grad_norm": 4.341546535491943, "learning_rate": 2.9404466501240698e-05, "loss": 0.8772169947624207, "step": 172 }, { "epoch": 1.2735674676524953, "grad_norm": 3.2243599891662598, "learning_rate": 2.9280397022332505e-05, "loss": 0.6366092562675476, "step": 173 }, { "epoch": 1.2809611829944547, "grad_norm": 4.367596626281738, "learning_rate": 2.9156327543424316e-05, "loss": 0.9016575813293457, "step": 174 }, { "epoch": 1.2883548983364141, "grad_norm": 4.07682466506958, "learning_rate": 2.9032258064516133e-05, "loss": 0.5885382890701294, "step": 175 }, { "epoch": 1.2957486136783734, "grad_norm": 4.982141017913818, "learning_rate": 2.8908188585607944e-05, "loss": 0.8368382453918457, "step": 176 }, { "epoch": 1.3031423290203328, "grad_norm": 4.268311977386475, "learning_rate": 2.8784119106699754e-05, "loss": 0.6095747947692871, "step": 177 }, { "epoch": 1.310536044362292, "grad_norm": 3.039452314376831, "learning_rate": 2.8660049627791565e-05, "loss": 0.43989288806915283, "step": 178 }, { "epoch": 1.3179297597042514, "grad_norm": 5.515888690948486, "learning_rate": 2.8535980148883372e-05, "loss": 1.043910026550293, "step": 179 }, { "epoch": 1.3253234750462108, "grad_norm": 3.7631590366363525, "learning_rate": 2.841191066997519e-05, "loss": 0.5932552814483643, "step": 180 }, { "epoch": 1.3253234750462108, "eval_loss": 0.7392276525497437, "eval_runtime": 12.5696, "eval_samples_per_second": 3.978, "eval_steps_per_second": 1.034, "step": 180 }, { "epoch": 1.33271719038817, "grad_norm": 3.9628963470458984, "learning_rate": 2.8287841191067e-05, "loss": 0.5854453444480896, "step": 181 }, { "epoch": 1.3401109057301293, "grad_norm": 4.974862098693848, "learning_rate": 2.816377171215881e-05, "loss": 0.8424703478813171, "step": 182 }, { "epoch": 1.3475046210720887, "grad_norm": 4.7892069816589355, "learning_rate": 2.803970223325062e-05, "loss": 0.8794567584991455, "step": 183 }, { "epoch": 1.354898336414048, "grad_norm": 4.94668436050415, "learning_rate": 2.7915632754342435e-05, "loss": 1.1411162614822388, "step": 184 }, { "epoch": 1.3622920517560073, "grad_norm": 5.014815807342529, "learning_rate": 2.7791563275434246e-05, "loss": 1.0451624393463135, "step": 185 }, { "epoch": 1.3696857670979667, "grad_norm": 4.067875862121582, "learning_rate": 2.7667493796526056e-05, "loss": 0.5183364748954773, "step": 186 }, { "epoch": 1.377079482439926, "grad_norm": 4.259342670440674, "learning_rate": 2.7543424317617867e-05, "loss": 0.5706149935722351, "step": 187 }, { "epoch": 1.3844731977818854, "grad_norm": 4.0488104820251465, "learning_rate": 2.7419354838709678e-05, "loss": 0.606059193611145, "step": 188 }, { "epoch": 1.3918669131238448, "grad_norm": 4.461766242980957, "learning_rate": 2.729528535980149e-05, "loss": 0.861075222492218, "step": 189 }, { "epoch": 1.399260628465804, "grad_norm": 4.1285295486450195, "learning_rate": 2.7171215880893302e-05, "loss": 0.6729316711425781, "step": 190 }, { "epoch": 1.399260628465804, "eval_loss": 0.7324373722076416, "eval_runtime": 12.4604, "eval_samples_per_second": 4.013, "eval_steps_per_second": 1.043, "step": 190 }, { "epoch": 1.4066543438077634, "grad_norm": 4.628056049346924, "learning_rate": 2.7047146401985113e-05, "loss": 0.5330791473388672, "step": 191 }, { "epoch": 1.4140480591497226, "grad_norm": 4.561936855316162, "learning_rate": 2.6923076923076923e-05, "loss": 1.0062705278396606, "step": 192 }, { "epoch": 1.421441774491682, "grad_norm": 3.802652359008789, "learning_rate": 2.6799007444168734e-05, "loss": 0.5224090814590454, "step": 193 }, { "epoch": 1.4288354898336415, "grad_norm": 3.884530782699585, "learning_rate": 2.6674937965260548e-05, "loss": 0.7373669147491455, "step": 194 }, { "epoch": 1.4362292051756007, "grad_norm": 2.499845504760742, "learning_rate": 2.655086848635236e-05, "loss": 0.14097268879413605, "step": 195 }, { "epoch": 1.4436229205175601, "grad_norm": 3.8135945796966553, "learning_rate": 2.642679900744417e-05, "loss": 0.4497666656970978, "step": 196 }, { "epoch": 1.4510166358595193, "grad_norm": 4.8832268714904785, "learning_rate": 2.630272952853598e-05, "loss": 1.0067732334136963, "step": 197 }, { "epoch": 1.4584103512014788, "grad_norm": 4.868736267089844, "learning_rate": 2.617866004962779e-05, "loss": 0.7973582744598389, "step": 198 }, { "epoch": 1.4658040665434382, "grad_norm": 3.969160556793213, "learning_rate": 2.6054590570719604e-05, "loss": 0.642175018787384, "step": 199 }, { "epoch": 1.4731977818853974, "grad_norm": 4.04058837890625, "learning_rate": 2.5930521091811415e-05, "loss": 0.4151504635810852, "step": 200 }, { "epoch": 1.4731977818853974, "eval_loss": 0.7266122698783875, "eval_runtime": 12.4172, "eval_samples_per_second": 4.027, "eval_steps_per_second": 1.047, "step": 200 }, { "epoch": 1.4805914972273566, "grad_norm": NaN, "learning_rate": 2.5806451612903226e-05, "loss": 0.9558417797088623, "step": 201 }, { "epoch": 1.487985212569316, "grad_norm": 4.036558151245117, "learning_rate": 2.5806451612903226e-05, "loss": 0.633673369884491, "step": 202 }, { "epoch": 1.4953789279112755, "grad_norm": 4.391520023345947, "learning_rate": 2.5682382133995036e-05, "loss": 0.6117820143699646, "step": 203 }, { "epoch": 1.502772643253235, "grad_norm": 4.382378578186035, "learning_rate": 2.5558312655086853e-05, "loss": 0.7942304611206055, "step": 204 }, { "epoch": 1.510166358595194, "grad_norm": 4.690098762512207, "learning_rate": 2.5434243176178664e-05, "loss": 1.1411387920379639, "step": 205 }, { "epoch": 1.5175600739371533, "grad_norm": 3.7537717819213867, "learning_rate": 2.531017369727047e-05, "loss": 0.6303231716156006, "step": 206 }, { "epoch": 1.5249537892791127, "grad_norm": 3.366995096206665, "learning_rate": 2.5186104218362282e-05, "loss": 0.3322565257549286, "step": 207 }, { "epoch": 1.5323475046210722, "grad_norm": 3.7209525108337402, "learning_rate": 2.5062034739454093e-05, "loss": 0.39026719331741333, "step": 208 }, { "epoch": 1.5397412199630314, "grad_norm": 3.066854953765869, "learning_rate": 2.4937965260545906e-05, "loss": 0.24430927634239197, "step": 209 }, { "epoch": 1.5471349353049908, "grad_norm": 4.770087242126465, "learning_rate": 2.481389578163772e-05, "loss": 0.5006218552589417, "step": 210 }, { "epoch": 1.5471349353049908, "eval_loss": 0.7169432044029236, "eval_runtime": 12.4867, "eval_samples_per_second": 4.004, "eval_steps_per_second": 1.041, "step": 210 }, { "epoch": 1.55452865064695, "grad_norm": 2.8433492183685303, "learning_rate": 2.468982630272953e-05, "loss": 0.31588056683540344, "step": 211 }, { "epoch": 1.5619223659889094, "grad_norm": 4.780882358551025, "learning_rate": 2.4565756823821338e-05, "loss": 0.9557748436927795, "step": 212 }, { "epoch": 1.5693160813308689, "grad_norm": 3.854046583175659, "learning_rate": 2.4441687344913152e-05, "loss": 0.4003015160560608, "step": 213 }, { "epoch": 1.576709796672828, "grad_norm": 4.2938666343688965, "learning_rate": 2.4317617866004963e-05, "loss": 0.6644906997680664, "step": 214 }, { "epoch": 1.5841035120147873, "grad_norm": 4.548666000366211, "learning_rate": 2.4193548387096777e-05, "loss": 0.6904682517051697, "step": 215 }, { "epoch": 1.5914972273567467, "grad_norm": 4.770917892456055, "learning_rate": 2.4069478908188587e-05, "loss": 0.837977945804596, "step": 216 }, { "epoch": 1.5988909426987061, "grad_norm": 3.6060478687286377, "learning_rate": 2.3945409429280398e-05, "loss": 0.5721973776817322, "step": 217 }, { "epoch": 1.6062846580406656, "grad_norm": 4.638070106506348, "learning_rate": 2.382133995037221e-05, "loss": 0.7397695183753967, "step": 218 }, { "epoch": 1.6136783733826248, "grad_norm": 4.492130279541016, "learning_rate": 2.369727047146402e-05, "loss": 0.8275012969970703, "step": 219 }, { "epoch": 1.621072088724584, "grad_norm": 2.734531879425049, "learning_rate": 2.3573200992555833e-05, "loss": 0.17226025462150574, "step": 220 }, { "epoch": 1.621072088724584, "eval_loss": 0.7117969989776611, "eval_runtime": 12.5391, "eval_samples_per_second": 3.988, "eval_steps_per_second": 1.037, "step": 220 }, { "epoch": 1.6284658040665434, "grad_norm": 5.867221832275391, "learning_rate": 2.3449131513647644e-05, "loss": 0.9325424432754517, "step": 221 }, { "epoch": 1.6358595194085028, "grad_norm": 4.813448429107666, "learning_rate": 2.3325062034739454e-05, "loss": 1.0752629041671753, "step": 222 }, { "epoch": 1.6432532347504623, "grad_norm": 4.7057647705078125, "learning_rate": 2.3200992555831265e-05, "loss": 0.5686098337173462, "step": 223 }, { "epoch": 1.6506469500924215, "grad_norm": 4.052099704742432, "learning_rate": 2.307692307692308e-05, "loss": 0.6606102585792542, "step": 224 }, { "epoch": 1.6580406654343807, "grad_norm": 3.486253261566162, "learning_rate": 2.295285359801489e-05, "loss": 0.6913259029388428, "step": 225 }, { "epoch": 1.66543438077634, "grad_norm": 4.941483974456787, "learning_rate": 2.28287841191067e-05, "loss": 0.88069748878479, "step": 226 }, { "epoch": 1.6728280961182995, "grad_norm": 3.968275785446167, "learning_rate": 2.2704714640198514e-05, "loss": 0.46321308612823486, "step": 227 }, { "epoch": 1.6802218114602587, "grad_norm": 3.1694424152374268, "learning_rate": 2.258064516129032e-05, "loss": 0.387752503156662, "step": 228 }, { "epoch": 1.6876155268022182, "grad_norm": 2.896517515182495, "learning_rate": 2.2456575682382135e-05, "loss": 0.19096603989601135, "step": 229 }, { "epoch": 1.6950092421441774, "grad_norm": 5.64996337890625, "learning_rate": 2.2332506203473946e-05, "loss": 1.1302458047866821, "step": 230 }, { "epoch": 1.6950092421441774, "eval_loss": 0.7003970146179199, "eval_runtime": 12.3627, "eval_samples_per_second": 4.044, "eval_steps_per_second": 1.052, "step": 230 }, { "epoch": 1.7024029574861368, "grad_norm": 4.2490105628967285, "learning_rate": 2.2208436724565757e-05, "loss": 0.3965778350830078, "step": 231 }, { "epoch": 1.7097966728280962, "grad_norm": 4.177857875823975, "learning_rate": 2.208436724565757e-05, "loss": 0.7732095122337341, "step": 232 }, { "epoch": 1.7171903881700554, "grad_norm": 4.114255905151367, "learning_rate": 2.196029776674938e-05, "loss": 0.6610587239265442, "step": 233 }, { "epoch": 1.7245841035120146, "grad_norm": 4.6579790115356445, "learning_rate": 2.1836228287841192e-05, "loss": 0.6404513120651245, "step": 234 }, { "epoch": 1.731977818853974, "grad_norm": 4.545577526092529, "learning_rate": 2.1712158808933002e-05, "loss": 0.563823938369751, "step": 235 }, { "epoch": 1.7393715341959335, "grad_norm": 3.8521006107330322, "learning_rate": 2.1588089330024816e-05, "loss": 0.46250104904174805, "step": 236 }, { "epoch": 1.746765249537893, "grad_norm": 4.345403671264648, "learning_rate": 2.1464019851116627e-05, "loss": 0.572223961353302, "step": 237 }, { "epoch": 1.7541589648798521, "grad_norm": 4.653343677520752, "learning_rate": 2.1339950372208438e-05, "loss": 0.916043221950531, "step": 238 }, { "epoch": 1.7615526802218113, "grad_norm": 4.250296115875244, "learning_rate": 2.1215880893300248e-05, "loss": 0.5865936875343323, "step": 239 }, { "epoch": 1.7689463955637708, "grad_norm": 5.195578575134277, "learning_rate": 2.109181141439206e-05, "loss": 1.2301476001739502, "step": 240 }, { "epoch": 1.7689463955637708, "eval_loss": 0.6921948790550232, "eval_runtime": 12.4796, "eval_samples_per_second": 4.007, "eval_steps_per_second": 1.042, "step": 240 }, { "epoch": 1.7763401109057302, "grad_norm": 2.8348636627197266, "learning_rate": 2.0967741935483873e-05, "loss": 0.26018866896629333, "step": 241 }, { "epoch": 1.7837338262476896, "grad_norm": 5.202093124389648, "learning_rate": 2.0843672456575683e-05, "loss": 0.7929123044013977, "step": 242 }, { "epoch": 1.7911275415896488, "grad_norm": 5.220610618591309, "learning_rate": 2.0719602977667497e-05, "loss": 0.6777660846710205, "step": 243 }, { "epoch": 1.798521256931608, "grad_norm": 4.286166667938232, "learning_rate": 2.0595533498759305e-05, "loss": 0.6516886353492737, "step": 244 }, { "epoch": 1.8059149722735675, "grad_norm": 4.031196594238281, "learning_rate": 2.0471464019851115e-05, "loss": 0.5112631916999817, "step": 245 }, { "epoch": 1.8133086876155269, "grad_norm": 4.3230485916137695, "learning_rate": 2.034739454094293e-05, "loss": 0.3475070297718048, "step": 246 }, { "epoch": 1.820702402957486, "grad_norm": 3.3923592567443848, "learning_rate": 2.022332506203474e-05, "loss": 0.4742909371852875, "step": 247 }, { "epoch": 1.8280961182994455, "grad_norm": 3.982393264770508, "learning_rate": 2.0099255583126554e-05, "loss": 0.31971654295921326, "step": 248 }, { "epoch": 1.8354898336414047, "grad_norm": 4.76895809173584, "learning_rate": 1.9975186104218364e-05, "loss": 0.6392852663993835, "step": 249 }, { "epoch": 1.8428835489833642, "grad_norm": 3.412508010864258, "learning_rate": 1.9851116625310175e-05, "loss": 0.3292834758758545, "step": 250 }, { "epoch": 1.8428835489833642, "eval_loss": 0.6914193034172058, "eval_runtime": 12.3365, "eval_samples_per_second": 4.053, "eval_steps_per_second": 1.054, "step": 250 }, { "epoch": 1.8502772643253236, "grad_norm": 4.11257791519165, "learning_rate": 1.9727047146401986e-05, "loss": 0.7835528254508972, "step": 251 }, { "epoch": 1.8576709796672828, "grad_norm": 5.388609886169434, "learning_rate": 1.9602977667493796e-05, "loss": 1.027623176574707, "step": 252 }, { "epoch": 1.865064695009242, "grad_norm": 5.567387104034424, "learning_rate": 1.947890818858561e-05, "loss": 0.7551397681236267, "step": 253 }, { "epoch": 1.8724584103512014, "grad_norm": 5.3149847984313965, "learning_rate": 1.935483870967742e-05, "loss": 1.1124372482299805, "step": 254 }, { "epoch": 1.8798521256931608, "grad_norm": 4.300573348999023, "learning_rate": 1.923076923076923e-05, "loss": 0.7125287055969238, "step": 255 }, { "epoch": 1.8872458410351203, "grad_norm": 4.081615924835205, "learning_rate": 1.9106699751861042e-05, "loss": 0.5935063362121582, "step": 256 }, { "epoch": 1.8946395563770795, "grad_norm": 2.4937996864318848, "learning_rate": 1.8982630272952853e-05, "loss": 0.2382672131061554, "step": 257 }, { "epoch": 1.9020332717190387, "grad_norm": 3.744213819503784, "learning_rate": 1.8858560794044667e-05, "loss": 0.5946758985519409, "step": 258 }, { "epoch": 1.9094269870609981, "grad_norm": 3.3455610275268555, "learning_rate": 1.8734491315136477e-05, "loss": 0.3634100556373596, "step": 259 }, { "epoch": 1.9168207024029575, "grad_norm": 3.925421714782715, "learning_rate": 1.8610421836228288e-05, "loss": 0.4476943016052246, "step": 260 }, { "epoch": 1.9168207024029575, "eval_loss": 0.6890667676925659, "eval_runtime": 12.5388, "eval_samples_per_second": 3.988, "eval_steps_per_second": 1.037, "step": 260 }, { "epoch": 1.924214417744917, "grad_norm": 4.225397109985352, "learning_rate": 1.84863523573201e-05, "loss": 0.6327498555183411, "step": 261 }, { "epoch": 1.9316081330868762, "grad_norm": 5.073101043701172, "learning_rate": 1.8362282878411912e-05, "loss": 0.6480901837348938, "step": 262 }, { "epoch": 1.9390018484288354, "grad_norm": 5.898105144500732, "learning_rate": 1.8238213399503723e-05, "loss": 0.8572679758071899, "step": 263 }, { "epoch": 1.9463955637707948, "grad_norm": 5.332759380340576, "learning_rate": 1.8114143920595534e-05, "loss": 0.7909560203552246, "step": 264 }, { "epoch": 1.9537892791127542, "grad_norm": 3.7612059116363525, "learning_rate": 1.7990074441687348e-05, "loss": 0.46339747309684753, "step": 265 }, { "epoch": 1.9611829944547134, "grad_norm": 3.9361913204193115, "learning_rate": 1.7866004962779155e-05, "loss": 0.28523582220077515, "step": 266 }, { "epoch": 1.9685767097966729, "grad_norm": 3.6171579360961914, "learning_rate": 1.774193548387097e-05, "loss": 0.5036706924438477, "step": 267 }, { "epoch": 1.975970425138632, "grad_norm": 4.578619003295898, "learning_rate": 1.761786600496278e-05, "loss": 0.5884866714477539, "step": 268 }, { "epoch": 1.9833641404805915, "grad_norm": 3.30562162399292, "learning_rate": 1.7493796526054593e-05, "loss": 0.27540749311447144, "step": 269 }, { "epoch": 1.990757855822551, "grad_norm": 5.476099491119385, "learning_rate": 1.7369727047146404e-05, "loss": 0.6743600368499756, "step": 270 }, { "epoch": 1.990757855822551, "eval_loss": 0.6857466101646423, "eval_runtime": 12.4606, "eval_samples_per_second": 4.013, "eval_steps_per_second": 1.043, "step": 270 }, { "epoch": 1.9981515711645101, "grad_norm": 5.06631326675415, "learning_rate": 1.7245657568238215e-05, "loss": 0.6917240023612976, "step": 271 }, { "epoch": 2.0, "grad_norm": 10.330102920532227, "learning_rate": 1.7121588089330025e-05, "loss": 0.9991450905799866, "step": 272 }, { "epoch": 2.0073937153419594, "grad_norm": 3.6291868686676025, "learning_rate": 1.6997518610421836e-05, "loss": 0.5753036737442017, "step": 273 }, { "epoch": 2.014787430683919, "grad_norm": 3.012753963470459, "learning_rate": 1.687344913151365e-05, "loss": 0.39315706491470337, "step": 274 }, { "epoch": 2.022181146025878, "grad_norm": 2.8621585369110107, "learning_rate": 1.674937965260546e-05, "loss": 0.21679037809371948, "step": 275 }, { "epoch": 2.0295748613678373, "grad_norm": 3.5421297550201416, "learning_rate": 1.662531017369727e-05, "loss": 0.3504061996936798, "step": 276 }, { "epoch": 2.0369685767097967, "grad_norm": 4.237403869628906, "learning_rate": 1.650124069478908e-05, "loss": 0.3911523222923279, "step": 277 }, { "epoch": 2.044362292051756, "grad_norm": 3.58307147026062, "learning_rate": 1.6377171215880892e-05, "loss": 0.2892913818359375, "step": 278 }, { "epoch": 2.0517560073937156, "grad_norm": 3.5432863235473633, "learning_rate": 1.6253101736972706e-05, "loss": 0.28674107789993286, "step": 279 }, { "epoch": 2.0591497227356745, "grad_norm": 3.829465389251709, "learning_rate": 1.6129032258064517e-05, "loss": 0.5085712671279907, "step": 280 }, { "epoch": 2.0591497227356745, "eval_loss": 0.6785848736763, "eval_runtime": 12.4959, "eval_samples_per_second": 4.001, "eval_steps_per_second": 1.04, "step": 280 }, { "epoch": 2.066543438077634, "grad_norm": 4.736692428588867, "learning_rate": 1.600496277915633e-05, "loss": 0.45895498991012573, "step": 281 }, { "epoch": 2.0739371534195934, "grad_norm": 3.5632877349853516, "learning_rate": 1.588089330024814e-05, "loss": 0.404934823513031, "step": 282 }, { "epoch": 2.081330868761553, "grad_norm": 2.9595789909362793, "learning_rate": 1.575682382133995e-05, "loss": 0.24088506400585175, "step": 283 }, { "epoch": 2.088724584103512, "grad_norm": 3.6839349269866943, "learning_rate": 1.5632754342431763e-05, "loss": 0.3658759891986847, "step": 284 }, { "epoch": 2.0961182994454712, "grad_norm": 4.99697208404541, "learning_rate": 1.5508684863523573e-05, "loss": 0.6948235034942627, "step": 285 }, { "epoch": 2.1035120147874307, "grad_norm": 4.195018291473389, "learning_rate": 1.5384615384615387e-05, "loss": 0.37375789880752563, "step": 286 }, { "epoch": 2.11090573012939, "grad_norm": 3.6975293159484863, "learning_rate": 1.5260545905707198e-05, "loss": 0.4121526777744293, "step": 287 }, { "epoch": 2.1182994454713495, "grad_norm": 2.941937208175659, "learning_rate": 1.513647642679901e-05, "loss": 0.27218982577323914, "step": 288 }, { "epoch": 2.1256931608133085, "grad_norm": 4.575267791748047, "learning_rate": 1.5012406947890819e-05, "loss": 0.6285619735717773, "step": 289 }, { "epoch": 2.133086876155268, "grad_norm": 3.1897130012512207, "learning_rate": 1.488833746898263e-05, "loss": 0.2965329587459564, "step": 290 }, { "epoch": 2.133086876155268, "eval_loss": 0.677734375, "eval_runtime": 12.5014, "eval_samples_per_second": 4.0, "eval_steps_per_second": 1.04, "step": 290 }, { "epoch": 2.1404805914972274, "grad_norm": 4.293984889984131, "learning_rate": 1.4764267990074444e-05, "loss": 0.5726566314697266, "step": 291 }, { "epoch": 2.147874306839187, "grad_norm": 3.8995208740234375, "learning_rate": 1.4640198511166252e-05, "loss": 0.5817862749099731, "step": 292 }, { "epoch": 2.155268022181146, "grad_norm": 3.5895419120788574, "learning_rate": 1.4516129032258066e-05, "loss": 0.35040074586868286, "step": 293 }, { "epoch": 2.162661737523105, "grad_norm": 2.880908966064453, "learning_rate": 1.4392059553349877e-05, "loss": 0.2075611799955368, "step": 294 }, { "epoch": 2.1700554528650646, "grad_norm": 2.844344139099121, "learning_rate": 1.4267990074441686e-05, "loss": 0.16030986607074738, "step": 295 }, { "epoch": 2.177449168207024, "grad_norm": 3.2597815990448, "learning_rate": 1.41439205955335e-05, "loss": 0.4147431254386902, "step": 296 }, { "epoch": 2.1848428835489835, "grad_norm": 3.9886868000030518, "learning_rate": 1.401985111662531e-05, "loss": 0.5274520516395569, "step": 297 }, { "epoch": 2.1922365988909425, "grad_norm": 4.478377819061279, "learning_rate": 1.3895781637717123e-05, "loss": 0.41934865713119507, "step": 298 }, { "epoch": 2.199630314232902, "grad_norm": 4.394498348236084, "learning_rate": 1.3771712158808933e-05, "loss": 0.42625561356544495, "step": 299 }, { "epoch": 2.2070240295748613, "grad_norm": 3.080974578857422, "learning_rate": 1.3647642679900746e-05, "loss": 0.3000877797603607, "step": 300 }, { "epoch": 2.2070240295748613, "eval_loss": 0.6803019046783447, "eval_runtime": 12.5007, "eval_samples_per_second": 4.0, "eval_steps_per_second": 1.04, "step": 300 }, { "epoch": 2.2144177449168208, "grad_norm": 4.009698867797852, "learning_rate": 1.3523573200992556e-05, "loss": 0.43977871537208557, "step": 301 }, { "epoch": 2.22181146025878, "grad_norm": 2.766298294067383, "learning_rate": 1.3399503722084367e-05, "loss": 0.17407231032848358, "step": 302 }, { "epoch": 2.229205175600739, "grad_norm": 5.193652629852295, "learning_rate": 1.327543424317618e-05, "loss": 0.40429675579071045, "step": 303 }, { "epoch": 2.2365988909426986, "grad_norm": 4.609817981719971, "learning_rate": 1.315136476426799e-05, "loss": 0.6340703964233398, "step": 304 }, { "epoch": 2.243992606284658, "grad_norm": 3.17801570892334, "learning_rate": 1.3027295285359802e-05, "loss": 0.3360348343849182, "step": 305 }, { "epoch": 2.2513863216266174, "grad_norm": 4.517796993255615, "learning_rate": 1.2903225806451613e-05, "loss": 0.6079537272453308, "step": 306 }, { "epoch": 2.258780036968577, "grad_norm": 4.179698944091797, "learning_rate": 1.2779156327543427e-05, "loss": 0.4164172410964966, "step": 307 }, { "epoch": 2.266173752310536, "grad_norm": 4.557032108306885, "learning_rate": 1.2655086848635236e-05, "loss": 0.5597180128097534, "step": 308 }, { "epoch": 2.2735674676524953, "grad_norm": 3.3242549896240234, "learning_rate": 1.2531017369727046e-05, "loss": 0.2977086901664734, "step": 309 }, { "epoch": 2.2809611829944547, "grad_norm": 4.459362983703613, "learning_rate": 1.240694789081886e-05, "loss": 0.46301090717315674, "step": 310 }, { "epoch": 2.2809611829944547, "eval_loss": 0.6781811714172363, "eval_runtime": 12.543, "eval_samples_per_second": 3.986, "eval_steps_per_second": 1.036, "step": 310 }, { "epoch": 2.288354898336414, "grad_norm": 4.992742538452148, "learning_rate": 1.2282878411910669e-05, "loss": 0.46335217356681824, "step": 311 }, { "epoch": 2.2957486136783736, "grad_norm": 3.204737424850464, "learning_rate": 1.2158808933002481e-05, "loss": 0.2609277367591858, "step": 312 }, { "epoch": 2.3031423290203326, "grad_norm": 2.343017339706421, "learning_rate": 1.2034739454094294e-05, "loss": 0.09263511747121811, "step": 313 }, { "epoch": 2.310536044362292, "grad_norm": 4.5192108154296875, "learning_rate": 1.1910669975186104e-05, "loss": 0.4888758957386017, "step": 314 }, { "epoch": 2.3179297597042514, "grad_norm": 4.179697513580322, "learning_rate": 1.1786600496277917e-05, "loss": 0.2793925702571869, "step": 315 }, { "epoch": 2.325323475046211, "grad_norm": 3.240756034851074, "learning_rate": 1.1662531017369727e-05, "loss": 0.18993309140205383, "step": 316 }, { "epoch": 2.33271719038817, "grad_norm": 3.8120131492614746, "learning_rate": 1.153846153846154e-05, "loss": 0.400962233543396, "step": 317 }, { "epoch": 2.3401109057301293, "grad_norm": 3.7298102378845215, "learning_rate": 1.141439205955335e-05, "loss": 0.46058881282806396, "step": 318 }, { "epoch": 2.3475046210720887, "grad_norm": 4.015145778656006, "learning_rate": 1.129032258064516e-05, "loss": 0.408356249332428, "step": 319 }, { "epoch": 2.354898336414048, "grad_norm": 4.480742454528809, "learning_rate": 1.1166253101736973e-05, "loss": 0.5604572296142578, "step": 320 }, { "epoch": 2.354898336414048, "eval_loss": 0.6816579699516296, "eval_runtime": 12.3582, "eval_samples_per_second": 4.046, "eval_steps_per_second": 1.052, "step": 320 }, { "epoch": 2.3622920517560075, "grad_norm": 4.857553482055664, "learning_rate": 1.1042183622828785e-05, "loss": 0.40513134002685547, "step": 321 }, { "epoch": 2.369685767097967, "grad_norm": 4.126130104064941, "learning_rate": 1.0918114143920596e-05, "loss": 0.40128400921821594, "step": 322 }, { "epoch": 2.377079482439926, "grad_norm": 4.141418933868408, "learning_rate": 1.0794044665012408e-05, "loss": 0.29924750328063965, "step": 323 }, { "epoch": 2.3844731977818854, "grad_norm": 4.493786811828613, "learning_rate": 1.0669975186104219e-05, "loss": 0.4414414167404175, "step": 324 }, { "epoch": 2.391866913123845, "grad_norm": 3.504249095916748, "learning_rate": 1.054590570719603e-05, "loss": 0.21310807764530182, "step": 325 }, { "epoch": 2.3992606284658042, "grad_norm": 4.698243618011475, "learning_rate": 1.0421836228287842e-05, "loss": 0.3865514397621155, "step": 326 }, { "epoch": 2.406654343807763, "grad_norm": 4.5291361808776855, "learning_rate": 1.0297766749379652e-05, "loss": 0.507878303527832, "step": 327 }, { "epoch": 2.4140480591497226, "grad_norm": 4.491507530212402, "learning_rate": 1.0173697270471465e-05, "loss": 0.5876278877258301, "step": 328 }, { "epoch": 2.421441774491682, "grad_norm": 4.440368175506592, "learning_rate": 1.0049627791563277e-05, "loss": 0.3370438814163208, "step": 329 }, { "epoch": 2.4288354898336415, "grad_norm": 4.03184700012207, "learning_rate": 9.925558312655088e-06, "loss": 0.3488239645957947, "step": 330 }, { "epoch": 2.4288354898336415, "eval_loss": 0.6855019927024841, "eval_runtime": 12.5549, "eval_samples_per_second": 3.983, "eval_steps_per_second": 1.035, "step": 330 }, { "epoch": 2.436229205175601, "grad_norm": 5.132557392120361, "learning_rate": 9.801488833746898e-06, "loss": 0.5963175892829895, "step": 331 }, { "epoch": 2.44362292051756, "grad_norm": 3.78555965423584, "learning_rate": 9.67741935483871e-06, "loss": 0.258226603269577, "step": 332 }, { "epoch": 2.4510166358595193, "grad_norm": 4.775308132171631, "learning_rate": 9.553349875930521e-06, "loss": 0.43731528520584106, "step": 333 }, { "epoch": 2.4584103512014788, "grad_norm": 3.104215621948242, "learning_rate": 9.429280397022333e-06, "loss": 0.37882596254348755, "step": 334 }, { "epoch": 2.465804066543438, "grad_norm": 3.798936128616333, "learning_rate": 9.305210918114144e-06, "loss": 0.4152655601501465, "step": 335 }, { "epoch": 2.473197781885397, "grad_norm": 3.886282444000244, "learning_rate": 9.181141439205956e-06, "loss": 0.45343902707099915, "step": 336 }, { "epoch": 2.4805914972273566, "grad_norm": 3.8217668533325195, "learning_rate": 9.057071960297767e-06, "loss": 0.3023824095726013, "step": 337 }, { "epoch": 2.487985212569316, "grad_norm": 4.341695308685303, "learning_rate": 8.933002481389577e-06, "loss": 0.31776532530784607, "step": 338 }, { "epoch": 2.4953789279112755, "grad_norm": 4.166908264160156, "learning_rate": 8.80893300248139e-06, "loss": 0.4596524238586426, "step": 339 }, { "epoch": 2.502772643253235, "grad_norm": 4.498860836029053, "learning_rate": 8.684863523573202e-06, "loss": 0.42993947863578796, "step": 340 }, { "epoch": 2.502772643253235, "eval_loss": 0.6849582195281982, "eval_runtime": 12.4343, "eval_samples_per_second": 4.021, "eval_steps_per_second": 1.045, "step": 340 }, { "epoch": 2.5101663585951943, "grad_norm": 4.697827339172363, "learning_rate": 8.560794044665013e-06, "loss": 0.30538150668144226, "step": 341 }, { "epoch": 2.5175600739371533, "grad_norm": 5.051844596862793, "learning_rate": 8.436724565756825e-06, "loss": 0.424445241689682, "step": 342 }, { "epoch": 2.5249537892791127, "grad_norm": 4.363079071044922, "learning_rate": 8.312655086848635e-06, "loss": 0.3895280361175537, "step": 343 }, { "epoch": 2.532347504621072, "grad_norm": 3.4225594997406006, "learning_rate": 8.188585607940446e-06, "loss": 0.24427245557308197, "step": 344 }, { "epoch": 2.539741219963031, "grad_norm": 4.501352787017822, "learning_rate": 8.064516129032258e-06, "loss": 0.5370553135871887, "step": 345 }, { "epoch": 2.5471349353049906, "grad_norm": 4.623712539672852, "learning_rate": 7.94044665012407e-06, "loss": 0.36334437131881714, "step": 346 }, { "epoch": 2.55452865064695, "grad_norm": 4.001847743988037, "learning_rate": 7.816377171215881e-06, "loss": 0.3196173310279846, "step": 347 }, { "epoch": 2.5619223659889094, "grad_norm": 4.033841609954834, "learning_rate": 7.692307692307694e-06, "loss": 0.2993355691432953, "step": 348 }, { "epoch": 2.569316081330869, "grad_norm": 5.598950386047363, "learning_rate": 7.568238213399505e-06, "loss": 0.5544854402542114, "step": 349 }, { "epoch": 2.5767097966728283, "grad_norm": 3.0546700954437256, "learning_rate": 7.444168734491315e-06, "loss": 0.2565973699092865, "step": 350 }, { "epoch": 2.5767097966728283, "eval_loss": 0.6780612468719482, "eval_runtime": 12.5593, "eval_samples_per_second": 3.981, "eval_steps_per_second": 1.035, "step": 350 }, { "epoch": 2.5841035120147873, "grad_norm": 5.245316028594971, "learning_rate": 7.320099255583126e-06, "loss": 0.3251678943634033, "step": 351 }, { "epoch": 2.5914972273567467, "grad_norm": 3.5428197383880615, "learning_rate": 7.1960297766749385e-06, "loss": 0.2545225918292999, "step": 352 }, { "epoch": 2.598890942698706, "grad_norm": 3.804682493209839, "learning_rate": 7.07196029776675e-06, "loss": 0.47154200077056885, "step": 353 }, { "epoch": 2.6062846580406656, "grad_norm": 4.04072904586792, "learning_rate": 6.9478908188585614e-06, "loss": 0.35344043374061584, "step": 354 }, { "epoch": 2.6136783733826245, "grad_norm": 5.472744464874268, "learning_rate": 6.823821339950373e-06, "loss": 0.4716290831565857, "step": 355 }, { "epoch": 2.621072088724584, "grad_norm": 5.119224548339844, "learning_rate": 6.6997518610421835e-06, "loss": 0.5888644456863403, "step": 356 }, { "epoch": 2.6284658040665434, "grad_norm": 5.897572994232178, "learning_rate": 6.575682382133995e-06, "loss": 0.5343536138534546, "step": 357 }, { "epoch": 2.635859519408503, "grad_norm": 5.354091167449951, "learning_rate": 6.451612903225806e-06, "loss": 0.8592066764831543, "step": 358 }, { "epoch": 2.6432532347504623, "grad_norm": 4.489461898803711, "learning_rate": 6.327543424317618e-06, "loss": 0.33109182119369507, "step": 359 }, { "epoch": 2.6506469500924217, "grad_norm": 4.269669532775879, "learning_rate": 6.20347394540943e-06, "loss": 0.32698845863342285, "step": 360 }, { "epoch": 2.6506469500924217, "eval_loss": 0.6756904125213623, "eval_runtime": 12.4205, "eval_samples_per_second": 4.026, "eval_steps_per_second": 1.047, "step": 360 }, { "epoch": 2.6580406654343807, "grad_norm": 2.9795918464660645, "learning_rate": 6.079404466501241e-06, "loss": 0.16840402781963348, "step": 361 }, { "epoch": 2.66543438077634, "grad_norm": 4.061313629150391, "learning_rate": 5.955334987593052e-06, "loss": 0.3083171546459198, "step": 362 }, { "epoch": 2.6728280961182995, "grad_norm": 4.778440475463867, "learning_rate": 5.831265508684864e-06, "loss": 0.34697240591049194, "step": 363 }, { "epoch": 2.6802218114602585, "grad_norm": 4.378132343292236, "learning_rate": 5.707196029776675e-06, "loss": 0.4491539001464844, "step": 364 }, { "epoch": 2.687615526802218, "grad_norm": 3.488309860229492, "learning_rate": 5.5831265508684865e-06, "loss": 0.2493092566728592, "step": 365 }, { "epoch": 2.6950092421441774, "grad_norm": 2.665125846862793, "learning_rate": 5.459057071960298e-06, "loss": 0.14598557353019714, "step": 366 }, { "epoch": 2.702402957486137, "grad_norm": 4.287075519561768, "learning_rate": 5.334987593052109e-06, "loss": 0.33190983533859253, "step": 367 }, { "epoch": 2.709796672828096, "grad_norm": 4.174441337585449, "learning_rate": 5.210918114143921e-06, "loss": 0.38076817989349365, "step": 368 }, { "epoch": 2.7171903881700556, "grad_norm": 4.562845706939697, "learning_rate": 5.086848635235732e-06, "loss": 0.385815292596817, "step": 369 }, { "epoch": 2.7245841035120146, "grad_norm": 4.855499267578125, "learning_rate": 4.962779156327544e-06, "loss": 0.6614516973495483, "step": 370 }, { "epoch": 2.7245841035120146, "eval_loss": 0.675829291343689, "eval_runtime": 12.5697, "eval_samples_per_second": 3.978, "eval_steps_per_second": 1.034, "step": 370 }, { "epoch": 2.731977818853974, "grad_norm": 5.454403400421143, "learning_rate": 4.838709677419355e-06, "loss": 0.8207973837852478, "step": 371 }, { "epoch": 2.7393715341959335, "grad_norm": 4.332508563995361, "learning_rate": 4.714640198511167e-06, "loss": 0.3006463646888733, "step": 372 }, { "epoch": 2.746765249537893, "grad_norm": 3.909074544906616, "learning_rate": 4.590570719602978e-06, "loss": 0.28956088423728943, "step": 373 }, { "epoch": 2.754158964879852, "grad_norm": 5.085633754730225, "learning_rate": 4.466501240694789e-06, "loss": 0.35135942697525024, "step": 374 }, { "epoch": 2.7615526802218113, "grad_norm": 4.4873809814453125, "learning_rate": 4.342431761786601e-06, "loss": 0.4216098487377167, "step": 375 }, { "epoch": 2.7689463955637708, "grad_norm": 4.101310729980469, "learning_rate": 4.2183622828784124e-06, "loss": 0.2831707298755646, "step": 376 }, { "epoch": 2.77634011090573, "grad_norm": 6.565721035003662, "learning_rate": 4.094292803970223e-06, "loss": 0.8177705407142639, "step": 377 }, { "epoch": 2.7837338262476896, "grad_norm": 4.548885345458984, "learning_rate": 3.970223325062035e-06, "loss": 0.5057659149169922, "step": 378 }, { "epoch": 2.791127541589649, "grad_norm": 4.665341377258301, "learning_rate": 3.846153846153847e-06, "loss": 0.33335670828819275, "step": 379 }, { "epoch": 2.798521256931608, "grad_norm": 4.832557201385498, "learning_rate": 3.7220843672456574e-06, "loss": 0.548736572265625, "step": 380 }, { "epoch": 2.798521256931608, "eval_loss": 0.6768398880958557, "eval_runtime": 12.3489, "eval_samples_per_second": 4.049, "eval_steps_per_second": 1.053, "step": 380 }, { "epoch": 2.8059149722735675, "grad_norm": 2.661865472793579, "learning_rate": 3.5980148883374693e-06, "loss": 0.10511849820613861, "step": 381 }, { "epoch": 2.813308687615527, "grad_norm": 5.309775352478027, "learning_rate": 3.4739454094292807e-06, "loss": 0.6201926469802856, "step": 382 }, { "epoch": 2.820702402957486, "grad_norm": 4.453733921051025, "learning_rate": 3.3498759305210917e-06, "loss": 0.3460041880607605, "step": 383 }, { "epoch": 2.8280961182994453, "grad_norm": 4.914036750793457, "learning_rate": 3.225806451612903e-06, "loss": 0.48873624205589294, "step": 384 }, { "epoch": 2.8354898336414047, "grad_norm": 4.469694137573242, "learning_rate": 3.101736972704715e-06, "loss": 0.3550401031970978, "step": 385 }, { "epoch": 2.842883548983364, "grad_norm": 4.101950168609619, "learning_rate": 2.977667493796526e-06, "loss": 0.36257147789001465, "step": 386 }, { "epoch": 2.8502772643253236, "grad_norm": 4.840570449829102, "learning_rate": 2.8535980148883375e-06, "loss": 0.5777380466461182, "step": 387 }, { "epoch": 2.857670979667283, "grad_norm": 3.147803783416748, "learning_rate": 2.729528535980149e-06, "loss": 0.320244163274765, "step": 388 }, { "epoch": 2.865064695009242, "grad_norm": 4.090023994445801, "learning_rate": 2.6054590570719604e-06, "loss": 0.2959524989128113, "step": 389 }, { "epoch": 2.8724584103512014, "grad_norm": 4.499933242797852, "learning_rate": 2.481389578163772e-06, "loss": 0.3996496796607971, "step": 390 }, { "epoch": 2.8724584103512014, "eval_loss": 0.6760193705558777, "eval_runtime": 12.5645, "eval_samples_per_second": 3.979, "eval_steps_per_second": 1.035, "step": 390 }, { "epoch": 2.879852125693161, "grad_norm": 4.907258033752441, "learning_rate": 2.3573200992555833e-06, "loss": 0.30245816707611084, "step": 391 }, { "epoch": 2.8872458410351203, "grad_norm": 4.042727947235107, "learning_rate": 2.2332506203473944e-06, "loss": 0.3344458341598511, "step": 392 }, { "epoch": 2.8946395563770793, "grad_norm": 4.045156002044678, "learning_rate": 2.1091811414392062e-06, "loss": 0.17773765325546265, "step": 393 }, { "epoch": 2.9020332717190387, "grad_norm": 4.525294303894043, "learning_rate": 1.9851116625310177e-06, "loss": 0.3942530155181885, "step": 394 }, { "epoch": 2.909426987060998, "grad_norm": 4.726840019226074, "learning_rate": 1.8610421836228287e-06, "loss": 0.4639776349067688, "step": 395 }, { "epoch": 2.9168207024029575, "grad_norm": 6.167337417602539, "learning_rate": 1.7369727047146404e-06, "loss": 0.873107373714447, "step": 396 }, { "epoch": 2.924214417744917, "grad_norm": 4.44651460647583, "learning_rate": 1.6129032258064516e-06, "loss": 0.4783494472503662, "step": 397 }, { "epoch": 2.9316081330868764, "grad_norm": 5.8177289962768555, "learning_rate": 1.488833746898263e-06, "loss": 0.566139280796051, "step": 398 }, { "epoch": 2.9390018484288354, "grad_norm": 4.559521675109863, "learning_rate": 1.3647642679900745e-06, "loss": 0.2975980043411255, "step": 399 }, { "epoch": 2.946395563770795, "grad_norm": 4.534932613372803, "learning_rate": 1.240694789081886e-06, "loss": 0.42307165265083313, "step": 400 }, { "epoch": 2.946395563770795, "eval_loss": 0.6753122210502625, "eval_runtime": 12.473, "eval_samples_per_second": 4.009, "eval_steps_per_second": 1.042, "step": 400 }, { "epoch": 2.9537892791127542, "grad_norm": 4.688410758972168, "learning_rate": 1.1166253101736972e-06, "loss": 0.31728246808052063, "step": 401 }, { "epoch": 2.9611829944547132, "grad_norm": 3.6959214210510254, "learning_rate": 9.925558312655088e-07, "loss": 0.296553373336792, "step": 402 }, { "epoch": 2.9685767097966727, "grad_norm": 4.490988254547119, "learning_rate": 8.684863523573202e-07, "loss": 0.41596537828445435, "step": 403 }, { "epoch": 2.975970425138632, "grad_norm": 5.713006019592285, "learning_rate": 7.444168734491315e-07, "loss": 0.5145145654678345, "step": 404 }, { "epoch": 2.9833641404805915, "grad_norm": 4.68435001373291, "learning_rate": 6.20347394540943e-07, "loss": 0.47570955753326416, "step": 405 }, { "epoch": 2.990757855822551, "grad_norm": 3.961190938949585, "learning_rate": 4.962779156327544e-07, "loss": 0.4042632579803467, "step": 406 }, { "epoch": 2.9981515711645104, "grad_norm": 5.057858467102051, "learning_rate": 3.7220843672456576e-07, "loss": 0.4465891718864441, "step": 407 }, { "epoch": 3.0, "grad_norm": 8.670039176940918, "learning_rate": 2.481389578163772e-07, "loss": 0.4737997353076935, "step": 408 }, { "epoch": 3.0, "eval_loss": 0.6750363707542419, "eval_runtime": 12.4809, "eval_samples_per_second": 4.006, "eval_steps_per_second": 1.042, "step": 408 } ], "logging_steps": 1, "max_steps": 408, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 10, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1448379908790272e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }