{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 46, "global_step": 231, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012987012987012988, "grad_norm": 1.87213933467865, "learning_rate": 0.0, "loss": 2.0615234375, "step": 1 }, { "epoch": 0.025974025974025976, "grad_norm": 1.8280295133590698, "learning_rate": 4.285714285714285e-05, "loss": 2.0244140625, "step": 2 }, { "epoch": 0.03896103896103896, "grad_norm": 1.7257976531982422, "learning_rate": 8.57142857142857e-05, "loss": 1.9833984375, "step": 3 }, { "epoch": 0.05194805194805195, "grad_norm": 1.095306396484375, "learning_rate": 0.00012857142857142855, "loss": 1.64453125, "step": 4 }, { "epoch": 0.06493506493506493, "grad_norm": 0.7179261445999146, "learning_rate": 0.0001714285714285714, "loss": 1.462890625, "step": 5 }, { "epoch": 0.07792207792207792, "grad_norm": 0.6510278582572937, "learning_rate": 0.00021428571428571427, "loss": 1.3759765625, "step": 6 }, { "epoch": 0.09090909090909091, "grad_norm": 0.7297303080558777, "learning_rate": 0.0002571428571428571, "loss": 1.2939453125, "step": 7 }, { "epoch": 0.1038961038961039, "grad_norm": 1.0976759195327759, "learning_rate": 0.0003, "loss": 1.251953125, "step": 8 }, { "epoch": 0.11688311688311688, "grad_norm": 0.784932553768158, "learning_rate": 0.00029998672298754263, "loss": 1.22265625, "step": 9 }, { "epoch": 0.12987012987012986, "grad_norm": 0.43049532175064087, "learning_rate": 0.00029994689456171213, "loss": 1.1572265625, "step": 10 }, { "epoch": 0.14285714285714285, "grad_norm": 0.33999693393707275, "learning_rate": 0.0002998805225566197, "loss": 1.130859375, "step": 11 }, { "epoch": 0.15584415584415584, "grad_norm": 0.3334054946899414, "learning_rate": 0.0002997876200274052, "loss": 1.095703125, "step": 12 }, { "epoch": 0.16883116883116883, "grad_norm": 0.2966606020927429, "learning_rate": 0.0002996682052476692, "loss": 1.0859375, "step": 13 }, { "epoch": 0.18181818181818182, "grad_norm": 0.26707810163497925, "learning_rate": 0.0002995223017058786, "loss": 1.046875, "step": 14 }, { "epoch": 0.19480519480519481, "grad_norm": 0.28306645154953003, "learning_rate": 0.0002993499381007466, "loss": 1.04541015625, "step": 15 }, { "epoch": 0.2077922077922078, "grad_norm": 0.23590394854545593, "learning_rate": 0.00029915114833558773, "loss": 1.04052734375, "step": 16 }, { "epoch": 0.22077922077922077, "grad_norm": 0.24167655408382416, "learning_rate": 0.0002989259715116493, "loss": 1.015625, "step": 17 }, { "epoch": 0.23376623376623376, "grad_norm": 0.23228426277637482, "learning_rate": 0.0002986744519204201, "loss": 1.0029296875, "step": 18 }, { "epoch": 0.24675324675324675, "grad_norm": 0.19363808631896973, "learning_rate": 0.00029839663903491866, "loss": 0.99560546875, "step": 19 }, { "epoch": 0.2597402597402597, "grad_norm": 0.1860397756099701, "learning_rate": 0.0002980925874999618, "loss": 0.9765625, "step": 20 }, { "epoch": 0.2727272727272727, "grad_norm": 0.2304859608411789, "learning_rate": 0.0002977623571214165, "loss": 0.9609375, "step": 21 }, { "epoch": 0.2857142857142857, "grad_norm": 0.16191796958446503, "learning_rate": 0.0002974060128544361, "loss": 0.96435546875, "step": 22 }, { "epoch": 0.2987012987012987, "grad_norm": 0.1535877287387848, "learning_rate": 0.0002970236247906838, "loss": 0.94482421875, "step": 23 }, { "epoch": 0.3116883116883117, "grad_norm": 0.16574719548225403, "learning_rate": 0.00029661526814454614, "loss": 0.95751953125, "step": 24 }, { "epoch": 0.3246753246753247, "grad_norm": 0.12907439470291138, "learning_rate": 0.00029618102323833835, "loss": 0.95703125, "step": 25 }, { "epoch": 0.33766233766233766, "grad_norm": 0.17094935476779938, "learning_rate": 0.0002957209754865053, "loss": 0.9365234375, "step": 26 }, { "epoch": 0.35064935064935066, "grad_norm": 0.13920217752456665, "learning_rate": 0.0002952352153788207, "loss": 0.9169921875, "step": 27 }, { "epoch": 0.36363636363636365, "grad_norm": 0.1395276039838791, "learning_rate": 0.0002947238384625884, "loss": 0.91162109375, "step": 28 }, { "epoch": 0.37662337662337664, "grad_norm": 0.13648754358291626, "learning_rate": 0.00029418694532384816, "loss": 0.8974609375, "step": 29 }, { "epoch": 0.38961038961038963, "grad_norm": 0.14142100512981415, "learning_rate": 0.00029362464156759097, "loss": 0.91259765625, "step": 30 }, { "epoch": 0.4025974025974026, "grad_norm": 0.16501010954380035, "learning_rate": 0.00029303703779698685, "loss": 0.90869140625, "step": 31 }, { "epoch": 0.4155844155844156, "grad_norm": 0.13708695769309998, "learning_rate": 0.0002924242495916296, "loss": 0.912109375, "step": 32 }, { "epoch": 0.42857142857142855, "grad_norm": 0.13800117373466492, "learning_rate": 0.0002917863974848027, "loss": 0.87939453125, "step": 33 }, { "epoch": 0.44155844155844154, "grad_norm": 0.13274608552455902, "learning_rate": 0.00029112360693977097, "loss": 0.88037109375, "step": 34 }, { "epoch": 0.45454545454545453, "grad_norm": 0.1371767818927765, "learning_rate": 0.00029043600832510204, "loss": 0.88232421875, "step": 35 }, { "epoch": 0.4675324675324675, "grad_norm": 0.13572870194911957, "learning_rate": 0.0002897237368890237, "loss": 0.8623046875, "step": 36 }, { "epoch": 0.4805194805194805, "grad_norm": 0.11858779937028885, "learning_rate": 0.0002889869327328208, "loss": 0.87451171875, "step": 37 }, { "epoch": 0.4935064935064935, "grad_norm": 0.12619827687740326, "learning_rate": 0.000288225740783278, "loss": 0.86767578125, "step": 38 }, { "epoch": 0.5064935064935064, "grad_norm": 0.13159024715423584, "learning_rate": 0.00028744031076417305, "loss": 0.86279296875, "step": 39 }, { "epoch": 0.5194805194805194, "grad_norm": 0.1415332555770874, "learning_rate": 0.00028663079716682654, "loss": 0.8681640625, "step": 40 }, { "epoch": 0.5324675324675324, "grad_norm": 0.13881753385066986, "learning_rate": 0.0002857973592197144, "loss": 0.861328125, "step": 41 }, { "epoch": 0.5454545454545454, "grad_norm": 0.13636034727096558, "learning_rate": 0.0002849401608571477, "loss": 0.85107421875, "step": 42 }, { "epoch": 0.5584415584415584, "grad_norm": 0.12355201691389084, "learning_rate": 0.0002840593706870279, "loss": 0.86865234375, "step": 43 }, { "epoch": 0.5714285714285714, "grad_norm": 0.12506555020809174, "learning_rate": 0.00028315516195768174, "loss": 0.8505859375, "step": 44 }, { "epoch": 0.5844155844155844, "grad_norm": 0.14793701469898224, "learning_rate": 0.00028222771252378424, "loss": 0.84716796875, "step": 45 }, { "epoch": 0.5974025974025974, "grad_norm": 0.14449597895145416, "learning_rate": 0.0002812772048113752, "loss": 0.84130859375, "step": 46 }, { "epoch": 0.6103896103896104, "grad_norm": 0.12865683436393738, "learning_rate": 0.0002803038257819767, "loss": 0.828125, "step": 47 }, { "epoch": 0.6103896103896104, "eval_loss": 0.82568359375, "eval_runtime": 5.2278, "eval_samples_per_second": 0.574, "eval_steps_per_second": 0.191, "step": 47 }, { "epoch": 0.6233766233766234, "grad_norm": 0.13512910902500153, "learning_rate": 0.0002793077668958183, "loss": 0.833984375, "step": 48 }, { "epoch": 0.6363636363636364, "grad_norm": 0.13676807284355164, "learning_rate": 0.00027828922407417776, "loss": 0.81689453125, "step": 49 }, { "epoch": 0.6493506493506493, "grad_norm": 0.16256316006183624, "learning_rate": 0.0002772483976608436, "loss": 0.85791015625, "step": 50 }, { "epoch": 0.6623376623376623, "grad_norm": 0.12291904538869858, "learning_rate": 0.00027618549238270847, "loss": 0.82373046875, "step": 51 }, { "epoch": 0.6753246753246753, "grad_norm": 0.13355045020580292, "learning_rate": 0.00027510071730950007, "loss": 0.83056640625, "step": 52 }, { "epoch": 0.6883116883116883, "grad_norm": 0.11801909655332565, "learning_rate": 0.0002739942858126579, "loss": 0.84033203125, "step": 53 }, { "epoch": 0.7012987012987013, "grad_norm": 0.13418525457382202, "learning_rate": 0.00027286641552336363, "loss": 0.80224609375, "step": 54 }, { "epoch": 0.7142857142857143, "grad_norm": 0.197087362408638, "learning_rate": 0.0002717173282897339, "loss": 0.82275390625, "step": 55 }, { "epoch": 0.7272727272727273, "grad_norm": 0.13710831105709076, "learning_rate": 0.000270547250133184, "loss": 0.814453125, "step": 56 }, { "epoch": 0.7402597402597403, "grad_norm": 0.12212483584880829, "learning_rate": 0.0002693564112039695, "loss": 0.83740234375, "step": 57 }, { "epoch": 0.7532467532467533, "grad_norm": 0.1577882468700409, "learning_rate": 0.00026814504573591697, "loss": 0.8076171875, "step": 58 }, { "epoch": 0.7662337662337663, "grad_norm": 0.13262887299060822, "learning_rate": 0.00026691339200035115, "loss": 0.80712890625, "step": 59 }, { "epoch": 0.7792207792207793, "grad_norm": 0.15435634553432465, "learning_rate": 0.0002656616922592273, "loss": 0.8154296875, "step": 60 }, { "epoch": 0.7922077922077922, "grad_norm": 0.15156027674674988, "learning_rate": 0.00026439019271747976, "loss": 0.822265625, "step": 61 }, { "epoch": 0.8051948051948052, "grad_norm": 0.16566747426986694, "learning_rate": 0.0002630991434745936, "loss": 0.8134765625, "step": 62 }, { "epoch": 0.8181818181818182, "grad_norm": 1.7740538120269775, "learning_rate": 0.00026178879847541165, "loss": 0.7353515625, "step": 63 }, { "epoch": 0.8311688311688312, "grad_norm": 0.22738465666770935, "learning_rate": 0.0002604594154601839, "loss": 0.81103515625, "step": 64 }, { "epoch": 0.8441558441558441, "grad_norm": 0.1551813930273056, "learning_rate": 0.0002591112559138711, "loss": 0.7880859375, "step": 65 }, { "epoch": 0.8571428571428571, "grad_norm": 0.16187018156051636, "learning_rate": 0.0002577445850147117, "loss": 0.814453125, "step": 66 }, { "epoch": 0.8701298701298701, "grad_norm": 0.17352460324764252, "learning_rate": 0.000256359671582062, "loss": 0.810546875, "step": 67 }, { "epoch": 0.8831168831168831, "grad_norm": 0.135048046708107, "learning_rate": 0.00025495678802352055, "loss": 0.78759765625, "step": 68 }, { "epoch": 0.8961038961038961, "grad_norm": 0.14645102620124817, "learning_rate": 0.0002535362102813462, "loss": 0.79345703125, "step": 69 }, { "epoch": 0.9090909090909091, "grad_norm": 0.1465066522359848, "learning_rate": 0.00025209821777818185, "loss": 0.7919921875, "step": 70 }, { "epoch": 0.922077922077922, "grad_norm": 0.1380114108324051, "learning_rate": 0.00025064309336209214, "loss": 0.80712890625, "step": 71 }, { "epoch": 0.935064935064935, "grad_norm": 0.12721604108810425, "learning_rate": 0.000249171123250929, "loss": 0.802734375, "step": 72 }, { "epoch": 0.948051948051948, "grad_norm": 0.1371970921754837, "learning_rate": 0.0002476825969760332, "loss": 0.7880859375, "step": 73 }, { "epoch": 0.961038961038961, "grad_norm": 0.1347561925649643, "learning_rate": 0.00024617780732528473, "loss": 0.7841796875, "step": 74 }, { "epoch": 0.974025974025974, "grad_norm": 0.13435688614845276, "learning_rate": 0.00024465705028551226, "loss": 0.79150390625, "step": 75 }, { "epoch": 0.987012987012987, "grad_norm": 0.14081783592700958, "learning_rate": 0.00024312062498427377, "loss": 0.7978515625, "step": 76 }, { "epoch": 1.0, "grad_norm": 0.15651436150074005, "learning_rate": 0.000241568833631019, "loss": 0.7998046875, "step": 77 }, { "epoch": 1.0129870129870129, "grad_norm": 0.15834945440292358, "learning_rate": 0.0002400019814576463, "loss": 0.79931640625, "step": 78 }, { "epoch": 1.025974025974026, "grad_norm": 0.1488344669342041, "learning_rate": 0.00023842037665846406, "loss": 0.78759765625, "step": 79 }, { "epoch": 1.0389610389610389, "grad_norm": 0.16658146679401398, "learning_rate": 0.0002368243303295704, "loss": 0.80029296875, "step": 80 }, { "epoch": 1.051948051948052, "grad_norm": 0.15831144154071808, "learning_rate": 0.00023521415640766154, "loss": 0.78857421875, "step": 81 }, { "epoch": 1.0649350649350648, "grad_norm": 0.16039662063121796, "learning_rate": 0.00023359017160828145, "loss": 0.814453125, "step": 82 }, { "epoch": 1.077922077922078, "grad_norm": 0.1471472680568695, "learning_rate": 0.00023195269536352515, "loss": 0.8017578125, "step": 83 }, { "epoch": 1.0909090909090908, "grad_norm": 0.14966650307178497, "learning_rate": 0.00023030204975920735, "loss": 0.7705078125, "step": 84 }, { "epoch": 1.103896103896104, "grad_norm": 0.15895777940750122, "learning_rate": 0.00022863855947150968, "loss": 0.77587890625, "step": 85 }, { "epoch": 1.1168831168831168, "grad_norm": 0.12899424135684967, "learning_rate": 0.00022696255170311756, "loss": 0.78173828125, "step": 86 }, { "epoch": 1.12987012987013, "grad_norm": 0.15755796432495117, "learning_rate": 0.000225274356118861, "loss": 0.76953125, "step": 87 }, { "epoch": 1.1428571428571428, "grad_norm": 0.1485254317522049, "learning_rate": 0.0002235743047808703, "loss": 0.7734375, "step": 88 }, { "epoch": 1.155844155844156, "grad_norm": 0.13911904394626617, "learning_rate": 0.00022186273208326106, "loss": 0.771484375, "step": 89 }, { "epoch": 1.1688311688311688, "grad_norm": 0.1418519765138626, "learning_rate": 0.00022013997468635946, "loss": 0.7783203125, "step": 90 }, { "epoch": 1.1818181818181819, "grad_norm": 0.13031873106956482, "learning_rate": 0.00021840637145048293, "loss": 0.755859375, "step": 91 }, { "epoch": 1.1948051948051948, "grad_norm": 0.13562628626823425, "learning_rate": 0.00021666226336928708, "loss": 0.76806640625, "step": 92 }, { "epoch": 1.2077922077922079, "grad_norm": 0.12203909456729889, "learning_rate": 0.00021490799350269382, "loss": 0.7802734375, "step": 93 }, { "epoch": 1.2077922077922079, "eval_loss": 0.763671875, "eval_runtime": 5.239, "eval_samples_per_second": 0.573, "eval_steps_per_second": 0.191, "step": 93 }, { "epoch": 1.2207792207792207, "grad_norm": 0.21283617615699768, "learning_rate": 0.00021314390690941224, "loss": 0.77001953125, "step": 94 }, { "epoch": 1.2337662337662338, "grad_norm": 0.15730828046798706, "learning_rate": 0.0002113703505790672, "loss": 0.75830078125, "step": 95 }, { "epoch": 1.2467532467532467, "grad_norm": 0.1455293744802475, "learning_rate": 0.00020958767336394757, "loss": 0.771484375, "step": 96 }, { "epoch": 1.2597402597402598, "grad_norm": 0.16305232048034668, "learning_rate": 0.0002077962259103879, "loss": 0.76123046875, "step": 97 }, { "epoch": 1.2727272727272727, "grad_norm": 0.1328314244747162, "learning_rate": 0.00020599636058979797, "loss": 0.755859375, "step": 98 }, { "epoch": 1.2857142857142856, "grad_norm": 0.17356440424919128, "learning_rate": 0.00020418843142935237, "loss": 0.771484375, "step": 99 }, { "epoch": 1.2987012987012987, "grad_norm": 0.1250755339860916, "learning_rate": 0.00020237279404235463, "loss": 0.75146484375, "step": 100 }, { "epoch": 1.3116883116883118, "grad_norm": 0.16211764514446259, "learning_rate": 0.00020054980555828922, "loss": 0.7841796875, "step": 101 }, { "epoch": 1.3246753246753247, "grad_norm": 0.12787924706935883, "learning_rate": 0.0001987198245525756, "loss": 0.7783203125, "step": 102 }, { "epoch": 1.3376623376623376, "grad_norm": 0.1527280956506729, "learning_rate": 0.00019688321097603763, "loss": 0.76318359375, "step": 103 }, { "epoch": 1.3506493506493507, "grad_norm": 0.15530425310134888, "learning_rate": 0.0001950403260841024, "loss": 0.75537109375, "step": 104 }, { "epoch": 1.3636363636363638, "grad_norm": 0.13351191580295563, "learning_rate": 0.0001931915323657429, "loss": 0.75048828125, "step": 105 }, { "epoch": 1.3766233766233766, "grad_norm": 0.15366774797439575, "learning_rate": 0.00019133719347217733, "loss": 0.7451171875, "step": 106 }, { "epoch": 1.3896103896103895, "grad_norm": 0.1421225517988205, "learning_rate": 0.00018947767414534026, "loss": 0.76513671875, "step": 107 }, { "epoch": 1.4025974025974026, "grad_norm": 0.16189341247081757, "learning_rate": 0.0001876133401461394, "loss": 0.76318359375, "step": 108 }, { "epoch": 1.4155844155844157, "grad_norm": 0.1491364985704422, "learning_rate": 0.00018574455818251153, "loss": 0.76708984375, "step": 109 }, { "epoch": 1.4285714285714286, "grad_norm": 0.15627354383468628, "learning_rate": 0.0001838716958372924, "loss": 0.74365234375, "step": 110 }, { "epoch": 1.4415584415584415, "grad_norm": 0.15001991391181946, "learning_rate": 0.0001819951214959144, "loss": 0.74658203125, "step": 111 }, { "epoch": 1.4545454545454546, "grad_norm": 0.16454966366291046, "learning_rate": 0.00018011520427394656, "loss": 0.751953125, "step": 112 }, { "epoch": 1.4675324675324675, "grad_norm": 0.15415698289871216, "learning_rate": 0.00017823231394449072, "loss": 0.732421875, "step": 113 }, { "epoch": 1.4805194805194806, "grad_norm": 0.1775464415550232, "learning_rate": 0.0001763468208654484, "loss": 0.7490234375, "step": 114 }, { "epoch": 1.4935064935064934, "grad_norm": 0.15247026085853577, "learning_rate": 0.00017445909590667308, "loss": 0.74658203125, "step": 115 }, { "epoch": 1.5064935064935066, "grad_norm": 0.1464771032333374, "learning_rate": 0.00017256951037702086, "loss": 0.7421875, "step": 116 }, { "epoch": 1.5194805194805194, "grad_norm": 0.1753479391336441, "learning_rate": 0.0001706784359513158, "loss": 0.75, "step": 117 }, { "epoch": 1.5324675324675323, "grad_norm": 0.14175550639629364, "learning_rate": 0.00016878624459724232, "loss": 0.74560546875, "step": 118 }, { "epoch": 1.5454545454545454, "grad_norm": 0.17048415541648865, "learning_rate": 0.0001668933085021809, "loss": 0.74169921875, "step": 119 }, { "epoch": 1.5584415584415585, "grad_norm": 0.12695848941802979, "learning_rate": 0.000165, "loss": 0.75537109375, "step": 120 }, { "epoch": 1.5714285714285714, "grad_norm": 0.17318251729011536, "learning_rate": 0.0001631066914978191, "loss": 0.74560546875, "step": 121 }, { "epoch": 1.5844155844155843, "grad_norm": 0.1290905475616455, "learning_rate": 0.00016121375540275768, "loss": 0.73583984375, "step": 122 }, { "epoch": 1.5974025974025974, "grad_norm": 0.15674766898155212, "learning_rate": 0.00015932156404868423, "loss": 0.7373046875, "step": 123 }, { "epoch": 1.6103896103896105, "grad_norm": 0.12684033811092377, "learning_rate": 0.00015743048962297909, "loss": 0.724609375, "step": 124 }, { "epoch": 1.6233766233766234, "grad_norm": 0.13366860151290894, "learning_rate": 0.0001555409040933269, "loss": 0.73876953125, "step": 125 }, { "epoch": 1.6363636363636362, "grad_norm": 0.13589990139007568, "learning_rate": 0.0001536531791345516, "loss": 0.71875, "step": 126 }, { "epoch": 1.6493506493506493, "grad_norm": 0.16754822432994843, "learning_rate": 0.0001517676860555093, "loss": 0.76123046875, "step": 127 }, { "epoch": 1.6623376623376624, "grad_norm": 0.1312442421913147, "learning_rate": 0.00014988479572605344, "loss": 0.72802734375, "step": 128 }, { "epoch": 1.6753246753246753, "grad_norm": 0.139266237616539, "learning_rate": 0.0001480048785040856, "loss": 0.73779296875, "step": 129 }, { "epoch": 1.6883116883116882, "grad_norm": 0.15041179955005646, "learning_rate": 0.00014612830416270762, "loss": 0.75048828125, "step": 130 }, { "epoch": 1.7012987012987013, "grad_norm": 0.1343003362417221, "learning_rate": 0.00014425544181748842, "loss": 0.71142578125, "step": 131 }, { "epoch": 1.7142857142857144, "grad_norm": 0.14581982791423798, "learning_rate": 0.00014238665985386059, "loss": 0.73583984375, "step": 132 }, { "epoch": 1.7272727272727273, "grad_norm": 0.1320425122976303, "learning_rate": 0.00014052232585465974, "loss": 0.72509765625, "step": 133 }, { "epoch": 1.7402597402597402, "grad_norm": 0.1291089653968811, "learning_rate": 0.00013866280652782267, "loss": 0.7529296875, "step": 134 }, { "epoch": 1.7532467532467533, "grad_norm": 0.14452627301216125, "learning_rate": 0.0001368084676342571, "loss": 0.72216796875, "step": 135 }, { "epoch": 1.7662337662337664, "grad_norm": 0.1396491974592209, "learning_rate": 0.00013495967391589757, "loss": 0.72314453125, "step": 136 }, { "epoch": 1.7792207792207793, "grad_norm": 0.13734738528728485, "learning_rate": 0.0001331167890239624, "loss": 0.73291015625, "step": 137 }, { "epoch": 1.7922077922077921, "grad_norm": 0.14117233455181122, "learning_rate": 0.00013128017544742433, "loss": 0.740234375, "step": 138 }, { "epoch": 1.8051948051948052, "grad_norm": 0.15530674159526825, "learning_rate": 0.00012945019444171073, "loss": 0.73193359375, "step": 139 }, { "epoch": 1.8051948051948052, "eval_loss": 0.7353515625, "eval_runtime": 5.2158, "eval_samples_per_second": 0.575, "eval_steps_per_second": 0.192, "step": 139 }, { "epoch": 1.8181818181818183, "grad_norm": 0.11231274902820587, "learning_rate": 0.00012762720595764534, "loss": 0.569091796875, "step": 140 }, { "epoch": 1.8311688311688312, "grad_norm": 0.16321395337581635, "learning_rate": 0.0001258115685706476, "loss": 0.7314453125, "step": 141 }, { "epoch": 1.844155844155844, "grad_norm": 0.12513551115989685, "learning_rate": 0.000124003639410202, "loss": 0.70849609375, "step": 142 }, { "epoch": 1.8571428571428572, "grad_norm": 0.13610848784446716, "learning_rate": 0.0001222037740896121, "loss": 0.73779296875, "step": 143 }, { "epoch": 1.87012987012987, "grad_norm": 0.13166917860507965, "learning_rate": 0.00012041232663605247, "loss": 0.73388671875, "step": 144 }, { "epoch": 1.883116883116883, "grad_norm": 0.13057149946689606, "learning_rate": 0.00011862964942093274, "loss": 0.712890625, "step": 145 }, { "epoch": 1.896103896103896, "grad_norm": 0.12715107202529907, "learning_rate": 0.00011685609309058775, "loss": 0.71875, "step": 146 }, { "epoch": 1.9090909090909092, "grad_norm": 0.12808527052402496, "learning_rate": 0.00011509200649730618, "loss": 0.72021484375, "step": 147 }, { "epoch": 1.922077922077922, "grad_norm": 0.1350717395544052, "learning_rate": 0.00011333773663071288, "loss": 0.73095703125, "step": 148 }, { "epoch": 1.935064935064935, "grad_norm": 0.13831068575382233, "learning_rate": 0.00011159362854951708, "loss": 0.73193359375, "step": 149 }, { "epoch": 1.948051948051948, "grad_norm": 0.12841732800006866, "learning_rate": 0.00010986002531364053, "loss": 0.71630859375, "step": 150 }, { "epoch": 1.9610389610389611, "grad_norm": 0.13850335776805878, "learning_rate": 0.00010813726791673898, "loss": 0.71240234375, "step": 151 }, { "epoch": 1.974025974025974, "grad_norm": 0.13993798196315765, "learning_rate": 0.00010642569521912966, "loss": 0.72314453125, "step": 152 }, { "epoch": 1.987012987012987, "grad_norm": 0.18451233208179474, "learning_rate": 0.00010472564388113902, "loss": 0.72705078125, "step": 153 }, { "epoch": 2.0, "grad_norm": 0.13638709485530853, "learning_rate": 0.00010303744829688239, "loss": 0.73291015625, "step": 154 }, { "epoch": 2.012987012987013, "grad_norm": 0.1541544646024704, "learning_rate": 0.00010136144052849031, "loss": 0.73193359375, "step": 155 }, { "epoch": 2.0259740259740258, "grad_norm": 0.15249796211719513, "learning_rate": 9.969795024079262e-05, "loss": 0.7216796875, "step": 156 }, { "epoch": 2.038961038961039, "grad_norm": 0.14103059470653534, "learning_rate": 9.804730463647488e-05, "loss": 0.73193359375, "step": 157 }, { "epoch": 2.051948051948052, "grad_norm": 0.15410536527633667, "learning_rate": 9.640982839171855e-05, "loss": 0.72509765625, "step": 158 }, { "epoch": 2.064935064935065, "grad_norm": 0.1409735381603241, "learning_rate": 9.478584359233841e-05, "loss": 0.75341796875, "step": 159 }, { "epoch": 2.0779220779220777, "grad_norm": 0.15072405338287354, "learning_rate": 9.317566967042957e-05, "loss": 0.7412109375, "step": 160 }, { "epoch": 2.090909090909091, "grad_norm": 0.14849328994750977, "learning_rate": 9.157962334153595e-05, "loss": 0.7080078125, "step": 161 }, { "epoch": 2.103896103896104, "grad_norm": 0.13942044973373413, "learning_rate": 8.999801854235373e-05, "loss": 0.71337890625, "step": 162 }, { "epoch": 2.116883116883117, "grad_norm": 0.145473450422287, "learning_rate": 8.843116636898095e-05, "loss": 0.7216796875, "step": 163 }, { "epoch": 2.1298701298701297, "grad_norm": 0.1532512605190277, "learning_rate": 8.687937501572622e-05, "loss": 0.70849609375, "step": 164 }, { "epoch": 2.142857142857143, "grad_norm": 0.13344669342041016, "learning_rate": 8.534294971448771e-05, "loss": 0.7138671875, "step": 165 }, { "epoch": 2.155844155844156, "grad_norm": 0.13642649352550507, "learning_rate": 8.382219267471518e-05, "loss": 0.7119140625, "step": 166 }, { "epoch": 2.168831168831169, "grad_norm": 0.1385343223810196, "learning_rate": 8.231740302396673e-05, "loss": 0.720703125, "step": 167 }, { "epoch": 2.1818181818181817, "grad_norm": 0.1423710137605667, "learning_rate": 8.082887674907099e-05, "loss": 0.6982421875, "step": 168 }, { "epoch": 2.1948051948051948, "grad_norm": 0.13223981857299805, "learning_rate": 7.935690663790787e-05, "loss": 0.70947265625, "step": 169 }, { "epoch": 2.207792207792208, "grad_norm": 0.13550648093223572, "learning_rate": 7.79017822218182e-05, "loss": 0.7236328125, "step": 170 }, { "epoch": 2.220779220779221, "grad_norm": 0.13676981627941132, "learning_rate": 7.646378971865376e-05, "loss": 0.7119140625, "step": 171 }, { "epoch": 2.2337662337662336, "grad_norm": 0.13250000774860382, "learning_rate": 7.504321197647948e-05, "loss": 0.70263671875, "step": 172 }, { "epoch": 2.2467532467532467, "grad_norm": 0.13027453422546387, "learning_rate": 7.364032841793795e-05, "loss": 0.71728515625, "step": 173 }, { "epoch": 2.25974025974026, "grad_norm": 0.13419416546821594, "learning_rate": 7.225541498528827e-05, "loss": 0.70849609375, "step": 174 }, { "epoch": 2.2727272727272725, "grad_norm": 0.12558883428573608, "learning_rate": 7.088874408612886e-05, "loss": 0.7021484375, "step": 175 }, { "epoch": 2.2857142857142856, "grad_norm": 0.12302929908037186, "learning_rate": 6.954058453981609e-05, "loss": 0.71923828125, "step": 176 }, { "epoch": 2.2987012987012987, "grad_norm": 0.12381301075220108, "learning_rate": 6.821120152458832e-05, "loss": 0.69921875, "step": 177 }, { "epoch": 2.311688311688312, "grad_norm": 0.12083020806312561, "learning_rate": 6.690085652540637e-05, "loss": 0.7333984375, "step": 178 }, { "epoch": 2.324675324675325, "grad_norm": 0.1192907765507698, "learning_rate": 6.560980728252027e-05, "loss": 0.72705078125, "step": 179 }, { "epoch": 2.3376623376623376, "grad_norm": 0.12227894365787506, "learning_rate": 6.433830774077264e-05, "loss": 0.71142578125, "step": 180 }, { "epoch": 2.3506493506493507, "grad_norm": 0.131501704454422, "learning_rate": 6.308660799964886e-05, "loss": 0.705078125, "step": 181 }, { "epoch": 2.3636363636363638, "grad_norm": 0.13152176141738892, "learning_rate": 6.185495426408299e-05, "loss": 0.701171875, "step": 182 }, { "epoch": 2.3766233766233764, "grad_norm": 0.13369899988174438, "learning_rate": 6.06435887960305e-05, "loss": 0.69482421875, "step": 183 }, { "epoch": 2.3896103896103895, "grad_norm": 0.1293274462223053, "learning_rate": 5.945274986681598e-05, "loss": 0.71630859375, "step": 184 }, { "epoch": 2.4025974025974026, "grad_norm": 0.13225723803043365, "learning_rate": 5.828267171026604e-05, "loss": 0.712890625, "step": 185 }, { "epoch": 2.4025974025974026, "eval_loss": 0.72265625, "eval_runtime": 5.2195, "eval_samples_per_second": 0.575, "eval_steps_per_second": 0.192, "step": 185 }, { "epoch": 2.4155844155844157, "grad_norm": 0.12458571791648865, "learning_rate": 5.7133584476636404e-05, "loss": 0.7197265625, "step": 186 }, { "epoch": 2.4285714285714284, "grad_norm": 0.12707853317260742, "learning_rate": 5.600571418734207e-05, "loss": 0.6982421875, "step": 187 }, { "epoch": 2.4415584415584415, "grad_norm": 0.12470997869968414, "learning_rate": 5.489928269049988e-05, "loss": 0.7001953125, "step": 188 }, { "epoch": 2.4545454545454546, "grad_norm": 0.12834584712982178, "learning_rate": 5.381450761729153e-05, "loss": 0.70654296875, "step": 189 }, { "epoch": 2.4675324675324677, "grad_norm": 0.12546005845069885, "learning_rate": 5.275160233915637e-05, "loss": 0.6875, "step": 190 }, { "epoch": 2.4805194805194803, "grad_norm": 0.12444262951612473, "learning_rate": 5.171077592582221e-05, "loss": 0.7060546875, "step": 191 }, { "epoch": 2.4935064935064934, "grad_norm": 0.12773482501506805, "learning_rate": 5.069223310418164e-05, "loss": 0.703125, "step": 192 }, { "epoch": 2.5064935064935066, "grad_norm": 0.12552465498447418, "learning_rate": 4.96961742180233e-05, "loss": 0.69677734375, "step": 193 }, { "epoch": 2.5194805194805197, "grad_norm": 0.12379507720470428, "learning_rate": 4.8722795188624785e-05, "loss": 0.70556640625, "step": 194 }, { "epoch": 2.5324675324675323, "grad_norm": 0.1199096292257309, "learning_rate": 4.777228747621577e-05, "loss": 0.70166015625, "step": 195 }, { "epoch": 2.5454545454545454, "grad_norm": 0.1276472806930542, "learning_rate": 4.684483804231825e-05, "loss": 0.697265625, "step": 196 }, { "epoch": 2.5584415584415585, "grad_norm": 0.12995445728302002, "learning_rate": 4.5940629312972085e-05, "loss": 0.712890625, "step": 197 }, { "epoch": 2.571428571428571, "grad_norm": 0.12648777663707733, "learning_rate": 4.505983914285226e-05, "loss": 0.7041015625, "step": 198 }, { "epoch": 2.5844155844155843, "grad_norm": 0.11970824003219604, "learning_rate": 4.420264078028558e-05, "loss": 0.69091796875, "step": 199 }, { "epoch": 2.5974025974025974, "grad_norm": 0.13187578320503235, "learning_rate": 4.336920283317343e-05, "loss": 0.69580078125, "step": 200 }, { "epoch": 2.6103896103896105, "grad_norm": 0.13241389393806458, "learning_rate": 4.2559689235826924e-05, "loss": 0.6826171875, "step": 201 }, { "epoch": 2.6233766233766236, "grad_norm": 0.11591418087482452, "learning_rate": 4.177425921672195e-05, "loss": 0.69970703125, "step": 202 }, { "epoch": 2.6363636363636362, "grad_norm": 0.12381508201360703, "learning_rate": 4.1013067267179154e-05, "loss": 0.67724609375, "step": 203 }, { "epoch": 2.6493506493506493, "grad_norm": 0.13161423802375793, "learning_rate": 4.027626311097629e-05, "loss": 0.72216796875, "step": 204 }, { "epoch": 2.6623376623376624, "grad_norm": 0.1228082925081253, "learning_rate": 3.9563991674897954e-05, "loss": 0.68896484375, "step": 205 }, { "epoch": 2.675324675324675, "grad_norm": 0.1269020289182663, "learning_rate": 3.8876393060229044e-05, "loss": 0.69970703125, "step": 206 }, { "epoch": 2.688311688311688, "grad_norm": 0.11776472628116608, "learning_rate": 3.8213602515197275e-05, "loss": 0.7138671875, "step": 207 }, { "epoch": 2.7012987012987013, "grad_norm": 0.12243116647005081, "learning_rate": 3.757575040837037e-05, "loss": 0.673828125, "step": 208 }, { "epoch": 2.7142857142857144, "grad_norm": 0.11943550407886505, "learning_rate": 3.696296220301314e-05, "loss": 0.69677734375, "step": 209 }, { "epoch": 2.7272727272727275, "grad_norm": 0.12474703043699265, "learning_rate": 3.6375358432408994e-05, "loss": 0.68896484375, "step": 210 }, { "epoch": 2.74025974025974, "grad_norm": 0.12555579841136932, "learning_rate": 3.581305467615181e-05, "loss": 0.71826171875, "step": 211 }, { "epoch": 2.7532467532467533, "grad_norm": 0.11739861965179443, "learning_rate": 3.5276161537411566e-05, "loss": 0.68701171875, "step": 212 }, { "epoch": 2.7662337662337664, "grad_norm": 0.12477493286132812, "learning_rate": 3.476478462117927e-05, "loss": 0.6875, "step": 213 }, { "epoch": 2.779220779220779, "grad_norm": 0.12658150494098663, "learning_rate": 3.427902451349472e-05, "loss": 0.69775390625, "step": 214 }, { "epoch": 2.792207792207792, "grad_norm": 0.12858550250530243, "learning_rate": 3.381897676166161e-05, "loss": 0.70458984375, "step": 215 }, { "epoch": 2.8051948051948052, "grad_norm": 0.12537240982055664, "learning_rate": 3.338473185545381e-05, "loss": 0.69921875, "step": 216 }, { "epoch": 2.8181818181818183, "grad_norm": 0.10256601870059967, "learning_rate": 3.2976375209316176e-05, "loss": 0.5439453125, "step": 217 }, { "epoch": 2.8311688311688314, "grad_norm": 0.12630337476730347, "learning_rate": 3.259398714556389e-05, "loss": 0.69580078125, "step": 218 }, { "epoch": 2.844155844155844, "grad_norm": 0.13245722651481628, "learning_rate": 3.223764287858346e-05, "loss": 0.6748046875, "step": 219 }, { "epoch": 2.857142857142857, "grad_norm": 0.12287378311157227, "learning_rate": 3.1907412500038153e-05, "loss": 0.70556640625, "step": 220 }, { "epoch": 2.87012987012987, "grad_norm": 0.1266852766275406, "learning_rate": 3.1603360965081314e-05, "loss": 0.701171875, "step": 221 }, { "epoch": 2.883116883116883, "grad_norm": 0.11965059489011765, "learning_rate": 3.132554807957984e-05, "loss": 0.68212890625, "step": 222 }, { "epoch": 2.896103896103896, "grad_norm": 0.1284727156162262, "learning_rate": 3.107402848835067e-05, "loss": 0.68798828125, "step": 223 }, { "epoch": 2.909090909090909, "grad_norm": 0.12175902724266052, "learning_rate": 3.0848851664412245e-05, "loss": 0.69189453125, "step": 224 }, { "epoch": 2.9220779220779223, "grad_norm": 0.12249225378036499, "learning_rate": 3.065006189925343e-05, "loss": 0.7001953125, "step": 225 }, { "epoch": 2.935064935064935, "grad_norm": 0.1305171102285385, "learning_rate": 3.0477698294121423e-05, "loss": 0.70361328125, "step": 226 }, { "epoch": 2.948051948051948, "grad_norm": 0.12238122522830963, "learning_rate": 3.0331794752330784e-05, "loss": 0.6875, "step": 227 }, { "epoch": 2.961038961038961, "grad_norm": 0.13102811574935913, "learning_rate": 3.0212379972594758e-05, "loss": 0.6826171875, "step": 228 }, { "epoch": 2.974025974025974, "grad_norm": 0.12523294985294342, "learning_rate": 3.011947744338027e-05, "loss": 0.69287109375, "step": 229 }, { "epoch": 2.987012987012987, "grad_norm": 0.13497743010520935, "learning_rate": 3.0053105438287863e-05, "loss": 0.69775390625, "step": 230 }, { "epoch": 3.0, "grad_norm": 0.13393673300743103, "learning_rate": 3.0013277012457374e-05, "loss": 0.70654296875, "step": 231 }, { "epoch": 3.0, "eval_loss": 0.71484375, "eval_runtime": 5.2419, "eval_samples_per_second": 0.572, "eval_steps_per_second": 0.191, "step": 231 } ], "logging_steps": 1.0, "max_steps": 231, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.0012235103068488e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }