{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.968152866242038, "eval_steps": 500, "global_step": 234, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012738853503184714, "grad_norm": 8.287943840026855, "learning_rate": 0.0, "loss": 2.1051, "mean_token_accuracy": 0.6576112508773804, "num_tokens": 7722.0, "step": 1 }, { "epoch": 0.025477707006369428, "grad_norm": 8.355767250061035, "learning_rate": 2.5e-05, "loss": 2.0935, "mean_token_accuracy": 0.662928581237793, "num_tokens": 15318.0, "step": 2 }, { "epoch": 0.03821656050955414, "grad_norm": 5.267609119415283, "learning_rate": 5e-05, "loss": 1.823, "mean_token_accuracy": 0.6904586851596832, "num_tokens": 23143.0, "step": 3 }, { "epoch": 0.050955414012738856, "grad_norm": 4.595154762268066, "learning_rate": 7.500000000000001e-05, "loss": 1.3159, "mean_token_accuracy": 0.7333050668239594, "num_tokens": 30786.0, "step": 4 }, { "epoch": 0.06369426751592357, "grad_norm": 1.5862985849380493, "learning_rate": 0.0001, "loss": 1.0104, "mean_token_accuracy": 0.7833340167999268, "num_tokens": 38345.0, "step": 5 }, { "epoch": 0.07643312101910828, "grad_norm": 0.8021528124809265, "learning_rate": 0.000125, "loss": 0.8478, "mean_token_accuracy": 0.8248030543327332, "num_tokens": 45956.0, "step": 6 }, { "epoch": 0.08917197452229299, "grad_norm": 0.5970975756645203, "learning_rate": 0.00015000000000000001, "loss": 0.7815, "mean_token_accuracy": 0.8295383155345917, "num_tokens": 53562.0, "step": 7 }, { "epoch": 0.10191082802547771, "grad_norm": 1.414368987083435, "learning_rate": 0.000175, "loss": 0.7247, "mean_token_accuracy": 0.8384078443050385, "num_tokens": 60929.0, "step": 8 }, { "epoch": 0.11464968152866242, "grad_norm": 0.9989311099052429, "learning_rate": 0.0002, "loss": 0.74, "mean_token_accuracy": 0.8326991200447083, "num_tokens": 68327.0, "step": 9 }, { "epoch": 0.12738853503184713, "grad_norm": 0.4296531081199646, "learning_rate": 0.00019999033847063811, "loss": 0.7706, "mean_token_accuracy": 0.8299016058444977, "num_tokens": 75754.0, "step": 10 }, { "epoch": 0.14012738853503184, "grad_norm": 0.4344661831855774, "learning_rate": 0.00019996135574945544, "loss": 0.7121, "mean_token_accuracy": 0.8349876701831818, "num_tokens": 83217.0, "step": 11 }, { "epoch": 0.15286624203821655, "grad_norm": 0.3851865530014038, "learning_rate": 0.00019991305743680013, "loss": 0.747, "mean_token_accuracy": 0.830773264169693, "num_tokens": 90805.0, "step": 12 }, { "epoch": 0.16560509554140126, "grad_norm": 0.3876875042915344, "learning_rate": 0.0001998454528653836, "loss": 0.7502, "mean_token_accuracy": 0.8285396993160248, "num_tokens": 98404.0, "step": 13 }, { "epoch": 0.17834394904458598, "grad_norm": 0.4084186553955078, "learning_rate": 0.00019975855509847686, "loss": 0.7135, "mean_token_accuracy": 0.83475062251091, "num_tokens": 106081.0, "step": 14 }, { "epoch": 0.1910828025477707, "grad_norm": 0.3862064480781555, "learning_rate": 0.00019965238092738643, "loss": 0.777, "mean_token_accuracy": 0.8248996436595917, "num_tokens": 113617.0, "step": 15 }, { "epoch": 0.20382165605095542, "grad_norm": 0.4174270033836365, "learning_rate": 0.00019952695086820975, "loss": 0.7301, "mean_token_accuracy": 0.8283782601356506, "num_tokens": 121314.0, "step": 16 }, { "epoch": 0.21656050955414013, "grad_norm": 0.3616231381893158, "learning_rate": 0.0001993822891578708, "loss": 0.7061, "mean_token_accuracy": 0.8416012227535248, "num_tokens": 128659.0, "step": 17 }, { "epoch": 0.22929936305732485, "grad_norm": 0.38920992612838745, "learning_rate": 0.0001992184237494368, "loss": 0.7001, "mean_token_accuracy": 0.835535317659378, "num_tokens": 136314.0, "step": 18 }, { "epoch": 0.24203821656050956, "grad_norm": 0.3504973351955414, "learning_rate": 0.0001990353863067169, "loss": 0.7106, "mean_token_accuracy": 0.8328219652175903, "num_tokens": 144182.0, "step": 19 }, { "epoch": 0.25477707006369427, "grad_norm": 0.34746506810188293, "learning_rate": 0.0001988332121981436, "loss": 0.7584, "mean_token_accuracy": 0.8270872235298157, "num_tokens": 152095.0, "step": 20 }, { "epoch": 0.267515923566879, "grad_norm": 0.3385103642940521, "learning_rate": 0.00019861194048993863, "loss": 0.6867, "mean_token_accuracy": 0.8429812490940094, "num_tokens": 159463.0, "step": 21 }, { "epoch": 0.2802547770700637, "grad_norm": 0.3274126946926117, "learning_rate": 0.0001983716139385641, "loss": 0.6727, "mean_token_accuracy": 0.8409291505813599, "num_tokens": 166878.0, "step": 22 }, { "epoch": 0.2929936305732484, "grad_norm": 0.33483415842056274, "learning_rate": 0.0001981122789824607, "loss": 0.656, "mean_token_accuracy": 0.8487405478954315, "num_tokens": 174314.0, "step": 23 }, { "epoch": 0.3057324840764331, "grad_norm": 0.3158458173274994, "learning_rate": 0.00019783398573307428, "loss": 0.7133, "mean_token_accuracy": 0.8301410675048828, "num_tokens": 181966.0, "step": 24 }, { "epoch": 0.3184713375796178, "grad_norm": 0.3395407199859619, "learning_rate": 0.00019753678796517282, "loss": 0.7214, "mean_token_accuracy": 0.8315837681293488, "num_tokens": 189637.0, "step": 25 }, { "epoch": 0.33121019108280253, "grad_norm": 0.3301332890987396, "learning_rate": 0.00019722074310645553, "loss": 0.65, "mean_token_accuracy": 0.8509158194065094, "num_tokens": 196866.0, "step": 26 }, { "epoch": 0.34394904458598724, "grad_norm": 0.40064746141433716, "learning_rate": 0.00019688591222645607, "loss": 0.6879, "mean_token_accuracy": 0.8388471305370331, "num_tokens": 204527.0, "step": 27 }, { "epoch": 0.35668789808917195, "grad_norm": 0.36539191007614136, "learning_rate": 0.000196532360024742, "loss": 0.7129, "mean_token_accuracy": 0.8327633142471313, "num_tokens": 212217.0, "step": 28 }, { "epoch": 0.36942675159235666, "grad_norm": 0.32001280784606934, "learning_rate": 0.0001961601548184129, "loss": 0.6097, "mean_token_accuracy": 0.8550100326538086, "num_tokens": 219611.0, "step": 29 }, { "epoch": 0.3821656050955414, "grad_norm": 0.3553815484046936, "learning_rate": 0.00019576936852889936, "loss": 0.664, "mean_token_accuracy": 0.8454612195491791, "num_tokens": 227201.0, "step": 30 }, { "epoch": 0.39490445859872614, "grad_norm": 0.37485066056251526, "learning_rate": 0.00019536007666806556, "loss": 0.6167, "mean_token_accuracy": 0.8543617725372314, "num_tokens": 234596.0, "step": 31 }, { "epoch": 0.40764331210191085, "grad_norm": 0.43772801756858826, "learning_rate": 0.0001949323583236181, "loss": 0.6297, "mean_token_accuracy": 0.848662257194519, "num_tokens": 242008.0, "step": 32 }, { "epoch": 0.42038216560509556, "grad_norm": 0.4182124137878418, "learning_rate": 0.0001944862961438239, "loss": 0.6675, "mean_token_accuracy": 0.8380049467086792, "num_tokens": 249776.0, "step": 33 }, { "epoch": 0.43312101910828027, "grad_norm": 0.3301289975643158, "learning_rate": 0.00019402197632153992, "loss": 0.6575, "mean_token_accuracy": 0.8471685945987701, "num_tokens": 257319.0, "step": 34 }, { "epoch": 0.445859872611465, "grad_norm": 0.35300567746162415, "learning_rate": 0.00019353948857755803, "loss": 0.5979, "mean_token_accuracy": 0.8560113310813904, "num_tokens": 264828.0, "step": 35 }, { "epoch": 0.4585987261146497, "grad_norm": 0.3664567768573761, "learning_rate": 0.00019303892614326836, "loss": 0.5948, "mean_token_accuracy": 0.8638049066066742, "num_tokens": 272172.0, "step": 36 }, { "epoch": 0.4713375796178344, "grad_norm": 0.3352532386779785, "learning_rate": 0.00019252038574264405, "loss": 0.6585, "mean_token_accuracy": 0.844391405582428, "num_tokens": 279813.0, "step": 37 }, { "epoch": 0.4840764331210191, "grad_norm": 0.4468683898448944, "learning_rate": 0.00019198396757355118, "loss": 0.6146, "mean_token_accuracy": 0.8511447310447693, "num_tokens": 287537.0, "step": 38 }, { "epoch": 0.4968152866242038, "grad_norm": 0.3902146518230438, "learning_rate": 0.00019142977528838762, "loss": 0.5993, "mean_token_accuracy": 0.8533865213394165, "num_tokens": 295085.0, "step": 39 }, { "epoch": 0.5095541401273885, "grad_norm": 0.3714890778064728, "learning_rate": 0.00019085791597405404, "loss": 0.6601, "mean_token_accuracy": 0.8435452580451965, "num_tokens": 302853.0, "step": 40 }, { "epoch": 0.5222929936305732, "grad_norm": 0.35523873567581177, "learning_rate": 0.00019026850013126157, "loss": 0.6153, "mean_token_accuracy": 0.8525647222995758, "num_tokens": 310507.0, "step": 41 }, { "epoch": 0.535031847133758, "grad_norm": 0.35029295086860657, "learning_rate": 0.00018966164165317966, "loss": 0.5312, "mean_token_accuracy": 0.8702357113361359, "num_tokens": 317912.0, "step": 42 }, { "epoch": 0.5477707006369427, "grad_norm": 0.38241031765937805, "learning_rate": 0.00018903745780342839, "loss": 0.6103, "mean_token_accuracy": 0.855758547782898, "num_tokens": 325400.0, "step": 43 }, { "epoch": 0.5605095541401274, "grad_norm": 0.4096700847148895, "learning_rate": 0.0001883960691934196, "loss": 0.5746, "mean_token_accuracy": 0.8615990579128265, "num_tokens": 333086.0, "step": 44 }, { "epoch": 0.5732484076433121, "grad_norm": 0.37658724188804626, "learning_rate": 0.00018773759975905098, "loss": 0.5288, "mean_token_accuracy": 0.8693232238292694, "num_tokens": 340578.0, "step": 45 }, { "epoch": 0.5859872611464968, "grad_norm": 0.43547865748405457, "learning_rate": 0.00018706217673675811, "loss": 0.6485, "mean_token_accuracy": 0.8440962433815002, "num_tokens": 348586.0, "step": 46 }, { "epoch": 0.5987261146496815, "grad_norm": 0.4606596827507019, "learning_rate": 0.0001863699306389282, "loss": 0.5552, "mean_token_accuracy": 0.8659605085849762, "num_tokens": 356174.0, "step": 47 }, { "epoch": 0.6114649681528662, "grad_norm": 0.4326448142528534, "learning_rate": 0.00018566099522868119, "loss": 0.5145, "mean_token_accuracy": 0.8702480494976044, "num_tokens": 363805.0, "step": 48 }, { "epoch": 0.6242038216560509, "grad_norm": 0.4241434633731842, "learning_rate": 0.00018493550749402278, "loss": 0.6031, "mean_token_accuracy": 0.8582789897918701, "num_tokens": 371462.0, "step": 49 }, { "epoch": 0.6369426751592356, "grad_norm": 0.4271712005138397, "learning_rate": 0.00018419360762137395, "loss": 0.5618, "mean_token_accuracy": 0.8646855652332306, "num_tokens": 379019.0, "step": 50 }, { "epoch": 0.6496815286624203, "grad_norm": 0.40694111585617065, "learning_rate": 0.00018343543896848273, "loss": 0.5195, "mean_token_accuracy": 0.8710185289382935, "num_tokens": 386380.0, "step": 51 }, { "epoch": 0.6624203821656051, "grad_norm": 0.40776747465133667, "learning_rate": 0.00018266114803672318, "loss": 0.5566, "mean_token_accuracy": 0.8674687147140503, "num_tokens": 393867.0, "step": 52 }, { "epoch": 0.6751592356687898, "grad_norm": 0.4121972620487213, "learning_rate": 0.00018187088444278674, "loss": 0.5482, "mean_token_accuracy": 0.8711592853069305, "num_tokens": 401609.0, "step": 53 }, { "epoch": 0.6878980891719745, "grad_norm": 0.40399909019470215, "learning_rate": 0.00018106480088977172, "loss": 0.5687, "mean_token_accuracy": 0.8622486889362335, "num_tokens": 409264.0, "step": 54 }, { "epoch": 0.7006369426751592, "grad_norm": 0.41347479820251465, "learning_rate": 0.00018024305313767646, "loss": 0.5048, "mean_token_accuracy": 0.8774301111698151, "num_tokens": 416527.0, "step": 55 }, { "epoch": 0.7133757961783439, "grad_norm": 0.44538500905036926, "learning_rate": 0.00017940579997330165, "loss": 0.4789, "mean_token_accuracy": 0.8834721446037292, "num_tokens": 424091.0, "step": 56 }, { "epoch": 0.7261146496815286, "grad_norm": 0.5161186456680298, "learning_rate": 0.00017855320317956784, "loss": 0.5374, "mean_token_accuracy": 0.867156058549881, "num_tokens": 431859.0, "step": 57 }, { "epoch": 0.7388535031847133, "grad_norm": 0.4894382953643799, "learning_rate": 0.00017768542750425426, "loss": 0.5479, "mean_token_accuracy": 0.8681759834289551, "num_tokens": 439429.0, "step": 58 }, { "epoch": 0.7515923566878981, "grad_norm": 0.4625523090362549, "learning_rate": 0.0001768026406281642, "loss": 0.587, "mean_token_accuracy": 0.8580531179904938, "num_tokens": 447417.0, "step": 59 }, { "epoch": 0.7643312101910829, "grad_norm": 0.4163782000541687, "learning_rate": 0.00017590501313272415, "loss": 0.5592, "mean_token_accuracy": 0.868916928768158, "num_tokens": 455053.0, "step": 60 }, { "epoch": 0.7770700636942676, "grad_norm": 0.4515700042247772, "learning_rate": 0.00017499271846702213, "loss": 0.4692, "mean_token_accuracy": 0.8839752674102783, "num_tokens": 462553.0, "step": 61 }, { "epoch": 0.7898089171974523, "grad_norm": 0.48304829001426697, "learning_rate": 0.00017406593291429217, "loss": 0.4951, "mean_token_accuracy": 0.8761360943317413, "num_tokens": 470057.0, "step": 62 }, { "epoch": 0.802547770700637, "grad_norm": 0.4670911729335785, "learning_rate": 0.00017312483555785086, "loss": 0.4412, "mean_token_accuracy": 0.8923192024230957, "num_tokens": 477410.0, "step": 63 }, { "epoch": 0.8152866242038217, "grad_norm": 0.4475160241127014, "learning_rate": 0.00017216960824649303, "loss": 0.4687, "mean_token_accuracy": 0.8837877810001373, "num_tokens": 485000.0, "step": 64 }, { "epoch": 0.8280254777070064, "grad_norm": 0.4836560785770416, "learning_rate": 0.00017120043555935298, "loss": 0.4642, "mean_token_accuracy": 0.886978417634964, "num_tokens": 492576.0, "step": 65 }, { "epoch": 0.8407643312101911, "grad_norm": 0.5065037608146667, "learning_rate": 0.0001702175047702382, "loss": 0.5121, "mean_token_accuracy": 0.8710624575614929, "num_tokens": 500413.0, "step": 66 }, { "epoch": 0.8535031847133758, "grad_norm": 0.4843185245990753, "learning_rate": 0.00016922100581144228, "loss": 0.5384, "mean_token_accuracy": 0.8697362542152405, "num_tokens": 508117.0, "step": 67 }, { "epoch": 0.8662420382165605, "grad_norm": 0.5202386379241943, "learning_rate": 0.00016821113123704424, "loss": 0.4639, "mean_token_accuracy": 0.8836866319179535, "num_tokens": 515746.0, "step": 68 }, { "epoch": 0.8789808917197452, "grad_norm": 0.4895678460597992, "learning_rate": 0.00016718807618570106, "loss": 0.4422, "mean_token_accuracy": 0.8906868398189545, "num_tokens": 523013.0, "step": 69 }, { "epoch": 0.89171974522293, "grad_norm": 0.5349318981170654, "learning_rate": 0.00016615203834294119, "loss": 0.4428, "mean_token_accuracy": 0.8886107206344604, "num_tokens": 530452.0, "step": 70 }, { "epoch": 0.9044585987261147, "grad_norm": 0.48844024538993835, "learning_rate": 0.00016510321790296525, "loss": 0.4153, "mean_token_accuracy": 0.8925909399986267, "num_tokens": 537855.0, "step": 71 }, { "epoch": 0.9171974522292994, "grad_norm": 0.5755529999732971, "learning_rate": 0.00016404181752996289, "loss": 0.4864, "mean_token_accuracy": 0.8765636086463928, "num_tokens": 545421.0, "step": 72 }, { "epoch": 0.9299363057324841, "grad_norm": 0.45479002594947815, "learning_rate": 0.00016296804231895142, "loss": 0.3651, "mean_token_accuracy": 0.9048753976821899, "num_tokens": 552909.0, "step": 73 }, { "epoch": 0.9426751592356688, "grad_norm": 0.49108317494392395, "learning_rate": 0.00016188209975614542, "loss": 0.45, "mean_token_accuracy": 0.8858565986156464, "num_tokens": 560702.0, "step": 74 }, { "epoch": 0.9554140127388535, "grad_norm": 0.46213510632514954, "learning_rate": 0.00016078419967886402, "loss": 0.3958, "mean_token_accuracy": 0.9005838930606842, "num_tokens": 568245.0, "step": 75 }, { "epoch": 0.9681528662420382, "grad_norm": 0.5798938870429993, "learning_rate": 0.00015967455423498387, "loss": 0.3912, "mean_token_accuracy": 0.9034214019775391, "num_tokens": 575857.0, "step": 76 }, { "epoch": 0.9808917197452229, "grad_norm": 0.5185940861701965, "learning_rate": 0.00015855337784194577, "loss": 0.3628, "mean_token_accuracy": 0.9065321683883667, "num_tokens": 583441.0, "step": 77 }, { "epoch": 0.9936305732484076, "grad_norm": 0.5182363390922546, "learning_rate": 0.00015742088714532247, "loss": 0.4174, "mean_token_accuracy": 0.8943608999252319, "num_tokens": 591106.0, "step": 78 }, { "epoch": 1.0, "grad_norm": 0.5182363390922546, "learning_rate": 0.00015627730097695638, "loss": 0.4455, "mean_token_accuracy": 0.8872870206832886, "num_tokens": 594953.0, "step": 79 }, { "epoch": 1.0127388535031847, "grad_norm": 0.823184072971344, "learning_rate": 0.00015512284031267437, "loss": 0.2927, "mean_token_accuracy": 0.9254479706287384, "num_tokens": 602519.0, "step": 80 }, { "epoch": 1.0254777070063694, "grad_norm": 0.4461751878261566, "learning_rate": 0.00015395772822958845, "loss": 0.2936, "mean_token_accuracy": 0.9253770411014557, "num_tokens": 610085.0, "step": 81 }, { "epoch": 1.0382165605095541, "grad_norm": 0.5058058500289917, "learning_rate": 0.00015278218986299074, "loss": 0.235, "mean_token_accuracy": 0.9344533979892731, "num_tokens": 617710.0, "step": 82 }, { "epoch": 1.0509554140127388, "grad_norm": 0.6525824069976807, "learning_rate": 0.0001515964523628501, "loss": 0.2901, "mean_token_accuracy": 0.9262363314628601, "num_tokens": 625223.0, "step": 83 }, { "epoch": 1.0636942675159236, "grad_norm": 0.6204919815063477, "learning_rate": 0.00015040074484992, "loss": 0.2371, "mean_token_accuracy": 0.9375110268592834, "num_tokens": 632672.0, "step": 84 }, { "epoch": 1.0764331210191083, "grad_norm": 0.4697447419166565, "learning_rate": 0.00014919529837146528, "loss": 0.2389, "mean_token_accuracy": 0.9337205290794373, "num_tokens": 640267.0, "step": 85 }, { "epoch": 1.089171974522293, "grad_norm": 0.5069385170936584, "learning_rate": 0.00014798034585661695, "loss": 0.2394, "mean_token_accuracy": 0.9344863593578339, "num_tokens": 647855.0, "step": 86 }, { "epoch": 1.1019108280254777, "grad_norm": 0.512169599533081, "learning_rate": 0.0001467561220713628, "loss": 0.3004, "mean_token_accuracy": 0.9232901930809021, "num_tokens": 655347.0, "step": 87 }, { "epoch": 1.1146496815286624, "grad_norm": 0.5167611837387085, "learning_rate": 0.0001455228635731839, "loss": 0.261, "mean_token_accuracy": 0.9302393794059753, "num_tokens": 662908.0, "step": 88 }, { "epoch": 1.127388535031847, "grad_norm": 0.43430718779563904, "learning_rate": 0.00014428080866534396, "loss": 0.2426, "mean_token_accuracy": 0.9376973807811737, "num_tokens": 670227.0, "step": 89 }, { "epoch": 1.1401273885350318, "grad_norm": 0.44046974182128906, "learning_rate": 0.00014303019735084226, "loss": 0.2484, "mean_token_accuracy": 0.9353660345077515, "num_tokens": 677733.0, "step": 90 }, { "epoch": 1.1528662420382165, "grad_norm": 0.5374375581741333, "learning_rate": 0.00014177127128603745, "loss": 0.2681, "mean_token_accuracy": 0.9323221743106842, "num_tokens": 685450.0, "step": 91 }, { "epoch": 1.1656050955414012, "grad_norm": 0.507544219493866, "learning_rate": 0.0001405042737339524, "loss": 0.2522, "mean_token_accuracy": 0.9334528148174286, "num_tokens": 693379.0, "step": 92 }, { "epoch": 1.178343949044586, "grad_norm": 0.5681467056274414, "learning_rate": 0.0001392294495172681, "loss": 0.2381, "mean_token_accuracy": 0.9384985864162445, "num_tokens": 701006.0, "step": 93 }, { "epoch": 1.1910828025477707, "grad_norm": 0.5037748217582703, "learning_rate": 0.00013794704497101655, "loss": 0.248, "mean_token_accuracy": 0.9311998784542084, "num_tokens": 708222.0, "step": 94 }, { "epoch": 1.2038216560509554, "grad_norm": 0.4543361961841583, "learning_rate": 0.0001366573078949813, "loss": 0.2709, "mean_token_accuracy": 0.927354484796524, "num_tokens": 715815.0, "step": 95 }, { "epoch": 1.21656050955414, "grad_norm": 0.47324758768081665, "learning_rate": 0.00013536048750581494, "loss": 0.2349, "mean_token_accuracy": 0.941594272851944, "num_tokens": 723177.0, "step": 96 }, { "epoch": 1.2292993630573248, "grad_norm": 0.4437101185321808, "learning_rate": 0.00013405683438888282, "loss": 0.2264, "mean_token_accuracy": 0.9379465878009796, "num_tokens": 730685.0, "step": 97 }, { "epoch": 1.2420382165605095, "grad_norm": 0.3893497884273529, "learning_rate": 0.00013274660044984224, "loss": 0.2139, "mean_token_accuracy": 0.9428676962852478, "num_tokens": 738399.0, "step": 98 }, { "epoch": 1.2547770700636942, "grad_norm": 0.47590160369873047, "learning_rate": 0.00013143003886596669, "loss": 0.2622, "mean_token_accuracy": 0.9279411733150482, "num_tokens": 746096.0, "step": 99 }, { "epoch": 1.267515923566879, "grad_norm": 0.5140976309776306, "learning_rate": 0.0001301074040372242, "loss": 0.2063, "mean_token_accuracy": 0.9456835091114044, "num_tokens": 753562.0, "step": 100 }, { "epoch": 1.2802547770700636, "grad_norm": 0.438860148191452, "learning_rate": 0.00012877895153711935, "loss": 0.2382, "mean_token_accuracy": 0.9374182820320129, "num_tokens": 761282.0, "step": 101 }, { "epoch": 1.2929936305732483, "grad_norm": 0.6094561815261841, "learning_rate": 0.0001274449380633089, "loss": 0.2339, "mean_token_accuracy": 0.9405188262462616, "num_tokens": 768815.0, "step": 102 }, { "epoch": 1.305732484076433, "grad_norm": 0.5217446088790894, "learning_rate": 0.00012610562138799978, "loss": 0.2705, "mean_token_accuracy": 0.9315881133079529, "num_tokens": 776490.0, "step": 103 }, { "epoch": 1.3184713375796178, "grad_norm": 0.5095704197883606, "learning_rate": 0.00012476126030813963, "loss": 0.2185, "mean_token_accuracy": 0.9398861229419708, "num_tokens": 784055.0, "step": 104 }, { "epoch": 1.3312101910828025, "grad_norm": 0.5053628087043762, "learning_rate": 0.0001234121145954094, "loss": 0.2421, "mean_token_accuracy": 0.9382818043231964, "num_tokens": 791644.0, "step": 105 }, { "epoch": 1.3439490445859872, "grad_norm": 0.43147337436676025, "learning_rate": 0.0001220584449460274, "loss": 0.207, "mean_token_accuracy": 0.9434195756912231, "num_tokens": 799207.0, "step": 106 }, { "epoch": 1.356687898089172, "grad_norm": 0.40620630979537964, "learning_rate": 0.00012070051293037492, "loss": 0.2302, "mean_token_accuracy": 0.9408184885978699, "num_tokens": 806854.0, "step": 107 }, { "epoch": 1.3694267515923566, "grad_norm": 0.4834441542625427, "learning_rate": 0.00011933858094245281, "loss": 0.2031, "mean_token_accuracy": 0.9470761716365814, "num_tokens": 814335.0, "step": 108 }, { "epoch": 1.3821656050955413, "grad_norm": 0.45893028378486633, "learning_rate": 0.00011797291214917881, "loss": 0.2137, "mean_token_accuracy": 0.9417379796504974, "num_tokens": 822129.0, "step": 109 }, { "epoch": 1.394904458598726, "grad_norm": 0.5153368711471558, "learning_rate": 0.00011660377043953588, "loss": 0.2402, "mean_token_accuracy": 0.938307374715805, "num_tokens": 830009.0, "step": 110 }, { "epoch": 1.4076433121019107, "grad_norm": 0.4056824743747711, "learning_rate": 0.0001152314203735805, "loss": 0.2025, "mean_token_accuracy": 0.9457784295082092, "num_tokens": 837339.0, "step": 111 }, { "epoch": 1.4203821656050954, "grad_norm": 0.4811604619026184, "learning_rate": 0.0001138561271313219, "loss": 0.2136, "mean_token_accuracy": 0.9439316689968109, "num_tokens": 844962.0, "step": 112 }, { "epoch": 1.4331210191082802, "grad_norm": 0.4947657585144043, "learning_rate": 0.00011247815646148087, "loss": 0.228, "mean_token_accuracy": 0.9374533593654633, "num_tokens": 852442.0, "step": 113 }, { "epoch": 1.4458598726114649, "grad_norm": 0.4831300973892212, "learning_rate": 0.00011109777463013915, "loss": 0.1971, "mean_token_accuracy": 0.950575202703476, "num_tokens": 859705.0, "step": 114 }, { "epoch": 1.4585987261146496, "grad_norm": 0.4768920838832855, "learning_rate": 0.0001097152483692886, "loss": 0.2014, "mean_token_accuracy": 0.9461125135421753, "num_tokens": 867320.0, "step": 115 }, { "epoch": 1.4713375796178343, "grad_norm": 0.4603787362575531, "learning_rate": 0.00010833084482529048, "loss": 0.2343, "mean_token_accuracy": 0.9413523375988007, "num_tokens": 874840.0, "step": 116 }, { "epoch": 1.484076433121019, "grad_norm": 0.4399753510951996, "learning_rate": 0.00010694483150725458, "loss": 0.2075, "mean_token_accuracy": 0.948328822851181, "num_tokens": 882451.0, "step": 117 }, { "epoch": 1.4968152866242037, "grad_norm": 0.483257919549942, "learning_rate": 0.00010555747623534831, "loss": 0.1985, "mean_token_accuracy": 0.9503215551376343, "num_tokens": 890101.0, "step": 118 }, { "epoch": 1.5095541401273884, "grad_norm": 0.45524635910987854, "learning_rate": 0.00010416904708904548, "loss": 0.1954, "mean_token_accuracy": 0.9504112601280212, "num_tokens": 897607.0, "step": 119 }, { "epoch": 1.5222929936305731, "grad_norm": 0.44008612632751465, "learning_rate": 0.00010277981235532541, "loss": 0.212, "mean_token_accuracy": 0.9436098635196686, "num_tokens": 905191.0, "step": 120 }, { "epoch": 1.5350318471337578, "grad_norm": 0.46399325132369995, "learning_rate": 0.00010139004047683151, "loss": 0.1785, "mean_token_accuracy": 0.9537560045719147, "num_tokens": 912523.0, "step": 121 }, { "epoch": 1.5477707006369426, "grad_norm": 0.4352799654006958, "learning_rate": 0.0001, "loss": 0.2154, "mean_token_accuracy": 0.9456183016300201, "num_tokens": 920273.0, "step": 122 }, { "epoch": 1.5605095541401273, "grad_norm": 0.4239864945411682, "learning_rate": 9.860995952316851e-05, "loss": 0.1709, "mean_token_accuracy": 0.9573950469493866, "num_tokens": 927864.0, "step": 123 }, { "epoch": 1.573248407643312, "grad_norm": 0.5215359926223755, "learning_rate": 9.722018764467461e-05, "loss": 0.1979, "mean_token_accuracy": 0.9506862163543701, "num_tokens": 935454.0, "step": 124 }, { "epoch": 1.5859872611464967, "grad_norm": 0.5375974178314209, "learning_rate": 9.583095291095453e-05, "loss": 0.2106, "mean_token_accuracy": 0.9438005685806274, "num_tokens": 943211.0, "step": 125 }, { "epoch": 1.5987261146496814, "grad_norm": 0.47071683406829834, "learning_rate": 9.444252376465171e-05, "loss": 0.188, "mean_token_accuracy": 0.9508571922779083, "num_tokens": 950616.0, "step": 126 }, { "epoch": 1.611464968152866, "grad_norm": 0.4657401442527771, "learning_rate": 9.305516849274541e-05, "loss": 0.1689, "mean_token_accuracy": 0.9533426463603973, "num_tokens": 958183.0, "step": 127 }, { "epoch": 1.6242038216560508, "grad_norm": 0.3836834132671356, "learning_rate": 9.166915517470953e-05, "loss": 0.1871, "mean_token_accuracy": 0.9511479735374451, "num_tokens": 965678.0, "step": 128 }, { "epoch": 1.6369426751592355, "grad_norm": 0.46731242537498474, "learning_rate": 9.028475163071141e-05, "loss": 0.175, "mean_token_accuracy": 0.9512114226818085, "num_tokens": 973262.0, "step": 129 }, { "epoch": 1.6496815286624202, "grad_norm": 0.4541298747062683, "learning_rate": 8.890222536986085e-05, "loss": 0.216, "mean_token_accuracy": 0.9441925585269928, "num_tokens": 980887.0, "step": 130 }, { "epoch": 1.662420382165605, "grad_norm": 0.3771320581436157, "learning_rate": 8.752184353851916e-05, "loss": 0.1853, "mean_token_accuracy": 0.952815979719162, "num_tokens": 988463.0, "step": 131 }, { "epoch": 1.6751592356687897, "grad_norm": 0.4476616382598877, "learning_rate": 8.614387286867814e-05, "loss": 0.1831, "mean_token_accuracy": 0.9529510140419006, "num_tokens": 996025.0, "step": 132 }, { "epoch": 1.6878980891719744, "grad_norm": 0.3788629174232483, "learning_rate": 8.47685796264195e-05, "loss": 0.194, "mean_token_accuracy": 0.953939825296402, "num_tokens": 1003816.0, "step": 133 }, { "epoch": 1.700636942675159, "grad_norm": 0.4536489248275757, "learning_rate": 8.339622956046417e-05, "loss": 0.1445, "mean_token_accuracy": 0.9615342020988464, "num_tokens": 1011351.0, "step": 134 }, { "epoch": 1.7133757961783438, "grad_norm": 0.41908058524131775, "learning_rate": 8.202708785082121e-05, "loss": 0.1623, "mean_token_accuracy": 0.9565115869045258, "num_tokens": 1018759.0, "step": 135 }, { "epoch": 1.7261146496815285, "grad_norm": 0.475737988948822, "learning_rate": 8.066141905754723e-05, "loss": 0.1725, "mean_token_accuracy": 0.9567776024341583, "num_tokens": 1026286.0, "step": 136 }, { "epoch": 1.7388535031847132, "grad_norm": 0.349752813577652, "learning_rate": 7.929948706962508e-05, "loss": 0.1255, "mean_token_accuracy": 0.9658943712711334, "num_tokens": 1033770.0, "step": 137 }, { "epoch": 1.7515923566878981, "grad_norm": 0.39415788650512695, "learning_rate": 7.794155505397261e-05, "loss": 0.1577, "mean_token_accuracy": 0.9558201730251312, "num_tokens": 1041659.0, "step": 138 }, { "epoch": 1.7643312101910829, "grad_norm": 0.41134774684906006, "learning_rate": 7.658788540459062e-05, "loss": 0.2085, "mean_token_accuracy": 0.948514312505722, "num_tokens": 1049150.0, "step": 139 }, { "epoch": 1.7770700636942676, "grad_norm": 0.5479893088340759, "learning_rate": 7.523873969186039e-05, "loss": 0.1663, "mean_token_accuracy": 0.9547719359397888, "num_tokens": 1056784.0, "step": 140 }, { "epoch": 1.7898089171974523, "grad_norm": 0.36870864033699036, "learning_rate": 7.389437861200024e-05, "loss": 0.1485, "mean_token_accuracy": 0.9612145721912384, "num_tokens": 1064184.0, "step": 141 }, { "epoch": 1.802547770700637, "grad_norm": 0.39722350239753723, "learning_rate": 7.25550619366911e-05, "loss": 0.1559, "mean_token_accuracy": 0.9604078829288483, "num_tokens": 1072029.0, "step": 142 }, { "epoch": 1.8152866242038217, "grad_norm": 0.40050435066223145, "learning_rate": 7.122104846288064e-05, "loss": 0.1384, "mean_token_accuracy": 0.962491363286972, "num_tokens": 1079591.0, "step": 143 }, { "epoch": 1.8280254777070064, "grad_norm": 0.391933411359787, "learning_rate": 6.989259596277582e-05, "loss": 0.1792, "mean_token_accuracy": 0.9526192545890808, "num_tokens": 1087338.0, "step": 144 }, { "epoch": 1.8407643312101911, "grad_norm": 0.456823468208313, "learning_rate": 6.85699611340333e-05, "loss": 0.1416, "mean_token_accuracy": 0.9639541804790497, "num_tokens": 1094894.0, "step": 145 }, { "epoch": 1.8535031847133758, "grad_norm": 0.3839541971683502, "learning_rate": 6.725339955015777e-05, "loss": 0.1389, "mean_token_accuracy": 0.9645723104476929, "num_tokens": 1102210.0, "step": 146 }, { "epoch": 1.8662420382165605, "grad_norm": 0.33357852697372437, "learning_rate": 6.594316561111724e-05, "loss": 0.1557, "mean_token_accuracy": 0.96068075299263, "num_tokens": 1109738.0, "step": 147 }, { "epoch": 1.8789808917197452, "grad_norm": 0.4593367874622345, "learning_rate": 6.46395124941851e-05, "loss": 0.1708, "mean_token_accuracy": 0.9570999145507812, "num_tokens": 1117265.0, "step": 148 }, { "epoch": 1.89171974522293, "grad_norm": 0.36817261576652527, "learning_rate": 6.334269210501875e-05, "loss": 0.1372, "mean_token_accuracy": 0.9625333249568939, "num_tokens": 1124990.0, "step": 149 }, { "epoch": 1.9044585987261147, "grad_norm": 0.3801482617855072, "learning_rate": 6.205295502898348e-05, "loss": 0.121, "mean_token_accuracy": 0.966850757598877, "num_tokens": 1132869.0, "step": 150 }, { "epoch": 1.9171974522292994, "grad_norm": 0.34184518456459045, "learning_rate": 6.0770550482731924e-05, "loss": 0.1642, "mean_token_accuracy": 0.9570443630218506, "num_tokens": 1140785.0, "step": 151 }, { "epoch": 1.929936305732484, "grad_norm": 0.4241127669811249, "learning_rate": 5.9495726266047605e-05, "loss": 0.1556, "mean_token_accuracy": 0.9617596864700317, "num_tokens": 1148603.0, "step": 152 }, { "epoch": 1.9426751592356688, "grad_norm": 0.3778759837150574, "learning_rate": 5.8228728713962543e-05, "loss": 0.114, "mean_token_accuracy": 0.9691117703914642, "num_tokens": 1156149.0, "step": 153 }, { "epoch": 1.9554140127388535, "grad_norm": 0.4415481686592102, "learning_rate": 5.696980264915777e-05, "loss": 0.1381, "mean_token_accuracy": 0.9639294743537903, "num_tokens": 1163656.0, "step": 154 }, { "epoch": 1.9681528662420382, "grad_norm": 0.3667774796485901, "learning_rate": 5.571919133465605e-05, "loss": 0.1433, "mean_token_accuracy": 0.9641910791397095, "num_tokens": 1171141.0, "step": 155 }, { "epoch": 1.980891719745223, "grad_norm": 0.36915281414985657, "learning_rate": 5.447713642681612e-05, "loss": 0.1358, "mean_token_accuracy": 0.9650273025035858, "num_tokens": 1178660.0, "step": 156 }, { "epoch": 1.9936305732484076, "grad_norm": 0.33127549290657043, "learning_rate": 5.324387792863719e-05, "loss": 0.1873, "mean_token_accuracy": 0.955519050359726, "num_tokens": 1186058.0, "step": 157 }, { "epoch": 2.0, "grad_norm": 0.5781312584877014, "learning_rate": 5.201965414338308e-05, "loss": 0.0995, "mean_token_accuracy": 0.9694300293922424, "num_tokens": 1189950.0, "step": 158 }, { "epoch": 2.0127388535031847, "grad_norm": 0.22299824655056, "learning_rate": 5.080470162853472e-05, "loss": 0.0994, "mean_token_accuracy": 0.9725558459758759, "num_tokens": 1197547.0, "step": 159 }, { "epoch": 2.0254777070063694, "grad_norm": 0.20428019762039185, "learning_rate": 4.959925515008002e-05, "loss": 0.0981, "mean_token_accuracy": 0.9740569591522217, "num_tokens": 1205124.0, "step": 160 }, { "epoch": 2.038216560509554, "grad_norm": 0.31417369842529297, "learning_rate": 4.840354763714991e-05, "loss": 0.1128, "mean_token_accuracy": 0.9698708951473236, "num_tokens": 1212386.0, "step": 161 }, { "epoch": 2.050955414012739, "grad_norm": 0.2941860258579254, "learning_rate": 4.7217810137009274e-05, "loss": 0.1198, "mean_token_accuracy": 0.9675701260566711, "num_tokens": 1219879.0, "step": 162 }, { "epoch": 2.0636942675159236, "grad_norm": 0.22774440050125122, "learning_rate": 4.604227177041156e-05, "loss": 0.0893, "mean_token_accuracy": 0.9721206724643707, "num_tokens": 1227344.0, "step": 163 }, { "epoch": 2.0764331210191083, "grad_norm": 0.20990870893001556, "learning_rate": 4.487715968732568e-05, "loss": 0.0897, "mean_token_accuracy": 0.9736597836017609, "num_tokens": 1234928.0, "step": 164 }, { "epoch": 2.089171974522293, "grad_norm": 0.23693329095840454, "learning_rate": 4.372269902304363e-05, "loss": 0.1029, "mean_token_accuracy": 0.9717570245265961, "num_tokens": 1242719.0, "step": 165 }, { "epoch": 2.1019108280254777, "grad_norm": 0.2804213762283325, "learning_rate": 4.257911285467754e-05, "loss": 0.1026, "mean_token_accuracy": 0.9732820093631744, "num_tokens": 1250304.0, "step": 166 }, { "epoch": 2.1146496815286624, "grad_norm": 0.28864407539367676, "learning_rate": 4.144662215805426e-05, "loss": 0.1022, "mean_token_accuracy": 0.9715860486030579, "num_tokens": 1258105.0, "step": 167 }, { "epoch": 2.127388535031847, "grad_norm": 0.3053213059902191, "learning_rate": 4.0325445765016145e-05, "loss": 0.0995, "mean_token_accuracy": 0.9712505340576172, "num_tokens": 1265853.0, "step": 168 }, { "epoch": 2.140127388535032, "grad_norm": 0.3355003893375397, "learning_rate": 3.921580032113602e-05, "loss": 0.1006, "mean_token_accuracy": 0.9709268808364868, "num_tokens": 1273220.0, "step": 169 }, { "epoch": 2.1528662420382165, "grad_norm": 0.3259344696998596, "learning_rate": 3.8117900243854595e-05, "loss": 0.1025, "mean_token_accuracy": 0.969818502664566, "num_tokens": 1280636.0, "step": 170 }, { "epoch": 2.1656050955414012, "grad_norm": 0.25363364815711975, "learning_rate": 3.7031957681048604e-05, "loss": 0.0899, "mean_token_accuracy": 0.973079264163971, "num_tokens": 1288501.0, "step": 171 }, { "epoch": 2.178343949044586, "grad_norm": 0.33290988206863403, "learning_rate": 3.595818247003713e-05, "loss": 0.1036, "mean_token_accuracy": 0.9701544344425201, "num_tokens": 1296181.0, "step": 172 }, { "epoch": 2.1910828025477707, "grad_norm": 0.23419451713562012, "learning_rate": 3.489678209703475e-05, "loss": 0.0922, "mean_token_accuracy": 0.9737686514854431, "num_tokens": 1303725.0, "step": 173 }, { "epoch": 2.2038216560509554, "grad_norm": 0.25606822967529297, "learning_rate": 3.3847961657058845e-05, "loss": 0.093, "mean_token_accuracy": 0.9733033776283264, "num_tokens": 1311315.0, "step": 174 }, { "epoch": 2.21656050955414, "grad_norm": 0.2730248272418976, "learning_rate": 3.281192381429894e-05, "loss": 0.0945, "mean_token_accuracy": 0.9713809788227081, "num_tokens": 1318647.0, "step": 175 }, { "epoch": 2.229299363057325, "grad_norm": 0.25905486941337585, "learning_rate": 3.178886876295578e-05, "loss": 0.094, "mean_token_accuracy": 0.9720935225486755, "num_tokens": 1326203.0, "step": 176 }, { "epoch": 2.2420382165605095, "grad_norm": 0.21770048141479492, "learning_rate": 3.077899418855772e-05, "loss": 0.095, "mean_token_accuracy": 0.972693145275116, "num_tokens": 1333736.0, "step": 177 }, { "epoch": 2.254777070063694, "grad_norm": 0.21615815162658691, "learning_rate": 2.9782495229761808e-05, "loss": 0.0959, "mean_token_accuracy": 0.9725539982318878, "num_tokens": 1341160.0, "step": 178 }, { "epoch": 2.267515923566879, "grad_norm": 0.29113566875457764, "learning_rate": 2.879956444064703e-05, "loss": 0.1089, "mean_token_accuracy": 0.9702370762825012, "num_tokens": 1348750.0, "step": 179 }, { "epoch": 2.2802547770700636, "grad_norm": 0.298750102519989, "learning_rate": 2.783039175350699e-05, "loss": 0.1037, "mean_token_accuracy": 0.9692679643630981, "num_tokens": 1356569.0, "step": 180 }, { "epoch": 2.2929936305732483, "grad_norm": 0.2231506109237671, "learning_rate": 2.6875164442149147e-05, "loss": 0.0955, "mean_token_accuracy": 0.9708955585956573, "num_tokens": 1364056.0, "step": 181 }, { "epoch": 2.305732484076433, "grad_norm": 0.2941678762435913, "learning_rate": 2.5934067085707834e-05, "loss": 0.0996, "mean_token_accuracy": 0.9709564447402954, "num_tokens": 1371659.0, "step": 182 }, { "epoch": 2.3184713375796178, "grad_norm": 0.1835247129201889, "learning_rate": 2.500728153297788e-05, "loss": 0.0942, "mean_token_accuracy": 0.9725345969200134, "num_tokens": 1379147.0, "step": 183 }, { "epoch": 2.3312101910828025, "grad_norm": 0.28575223684310913, "learning_rate": 2.409498686727587e-05, "loss": 0.091, "mean_token_accuracy": 0.9733802676200867, "num_tokens": 1386765.0, "step": 184 }, { "epoch": 2.343949044585987, "grad_norm": 0.2463427037000656, "learning_rate": 2.3197359371835802e-05, "loss": 0.086, "mean_token_accuracy": 0.9742932319641113, "num_tokens": 1394618.0, "step": 185 }, { "epoch": 2.356687898089172, "grad_norm": 0.1932964026927948, "learning_rate": 2.2314572495745746e-05, "loss": 0.093, "mean_token_accuracy": 0.9733997285366058, "num_tokens": 1402323.0, "step": 186 }, { "epoch": 2.3694267515923566, "grad_norm": 0.31327489018440247, "learning_rate": 2.1446796820432167e-05, "loss": 0.099, "mean_token_accuracy": 0.9692893028259277, "num_tokens": 1409811.0, "step": 187 }, { "epoch": 2.3821656050955413, "grad_norm": 0.2381305992603302, "learning_rate": 2.0594200026698363e-05, "loss": 0.0944, "mean_token_accuracy": 0.9724844992160797, "num_tokens": 1417360.0, "step": 188 }, { "epoch": 2.394904458598726, "grad_norm": 0.2520155906677246, "learning_rate": 1.9756946862323535e-05, "loss": 0.096, "mean_token_accuracy": 0.9740960896015167, "num_tokens": 1425115.0, "step": 189 }, { "epoch": 2.4076433121019107, "grad_norm": 0.183822900056839, "learning_rate": 1.8935199110228275e-05, "loss": 0.0911, "mean_token_accuracy": 0.9735857248306274, "num_tokens": 1432795.0, "step": 190 }, { "epoch": 2.4203821656050954, "grad_norm": 0.20515495538711548, "learning_rate": 1.8129115557213262e-05, "loss": 0.0936, "mean_token_accuracy": 0.9743000864982605, "num_tokens": 1440406.0, "step": 191 }, { "epoch": 2.43312101910828, "grad_norm": 0.34444665908813477, "learning_rate": 1.7338851963276825e-05, "loss": 0.0932, "mean_token_accuracy": 0.9733559787273407, "num_tokens": 1447979.0, "step": 192 }, { "epoch": 2.445859872611465, "grad_norm": 0.19695109128952026, "learning_rate": 1.656456103151728e-05, "loss": 0.0941, "mean_token_accuracy": 0.9739238917827606, "num_tokens": 1455491.0, "step": 193 }, { "epoch": 2.4585987261146496, "grad_norm": 0.21720701456069946, "learning_rate": 1.580639237862608e-05, "loss": 0.0928, "mean_token_accuracy": 0.9730100631713867, "num_tokens": 1463007.0, "step": 194 }, { "epoch": 2.4713375796178343, "grad_norm": 0.21964755654335022, "learning_rate": 1.5064492505977234e-05, "loss": 0.0892, "mean_token_accuracy": 0.9735862016677856, "num_tokens": 1470901.0, "step": 195 }, { "epoch": 2.484076433121019, "grad_norm": 0.1945929080247879, "learning_rate": 1.433900477131882e-05, "loss": 0.0889, "mean_token_accuracy": 0.9738577008247375, "num_tokens": 1478538.0, "step": 196 }, { "epoch": 2.4968152866242037, "grad_norm": 0.2573101818561554, "learning_rate": 1.363006936107183e-05, "loss": 0.1038, "mean_token_accuracy": 0.9701802432537079, "num_tokens": 1486088.0, "step": 197 }, { "epoch": 2.5095541401273884, "grad_norm": 0.1948987990617752, "learning_rate": 1.29378232632419e-05, "loss": 0.0892, "mean_token_accuracy": 0.9724543392658234, "num_tokens": 1493703.0, "step": 198 }, { "epoch": 2.522292993630573, "grad_norm": 0.2603251338005066, "learning_rate": 1.2262400240949023e-05, "loss": 0.1021, "mean_token_accuracy": 0.9714818596839905, "num_tokens": 1501201.0, "step": 199 }, { "epoch": 2.535031847133758, "grad_norm": 0.23355098068714142, "learning_rate": 1.1603930806580444e-05, "loss": 0.0918, "mean_token_accuracy": 0.9732993841171265, "num_tokens": 1508923.0, "step": 200 }, { "epoch": 2.5477707006369426, "grad_norm": 0.26143762469291687, "learning_rate": 1.0962542196571634e-05, "loss": 0.0978, "mean_token_accuracy": 0.9724924564361572, "num_tokens": 1516403.0, "step": 201 }, { "epoch": 2.5605095541401273, "grad_norm": 0.19722925126552582, "learning_rate": 1.0338358346820353e-05, "loss": 0.0881, "mean_token_accuracy": 0.9745533466339111, "num_tokens": 1524170.0, "step": 202 }, { "epoch": 2.573248407643312, "grad_norm": 0.24879567325115204, "learning_rate": 9.731499868738447e-06, "loss": 0.1024, "mean_token_accuracy": 0.9704383015632629, "num_tokens": 1531711.0, "step": 203 }, { "epoch": 2.5859872611464967, "grad_norm": 0.18551646173000336, "learning_rate": 9.142084025945984e-06, "loss": 0.0887, "mean_token_accuracy": 0.9731804728507996, "num_tokens": 1539309.0, "step": 204 }, { "epoch": 2.5987261146496814, "grad_norm": 0.19061441719532013, "learning_rate": 8.570224711612385e-06, "loss": 0.0906, "mean_token_accuracy": 0.9726877510547638, "num_tokens": 1546875.0, "step": 205 }, { "epoch": 2.611464968152866, "grad_norm": 0.22261416912078857, "learning_rate": 8.016032426448817e-06, "loss": 0.0918, "mean_token_accuracy": 0.9743273258209229, "num_tokens": 1554385.0, "step": 206 }, { "epoch": 2.624203821656051, "grad_norm": 0.23906444013118744, "learning_rate": 7.479614257355971e-06, "loss": 0.0954, "mean_token_accuracy": 0.9728935956954956, "num_tokens": 1562049.0, "step": 207 }, { "epoch": 2.6369426751592355, "grad_norm": 0.2492460012435913, "learning_rate": 6.961073856731648e-06, "loss": 0.096, "mean_token_accuracy": 0.9732304513454437, "num_tokens": 1569434.0, "step": 208 }, { "epoch": 2.6496815286624202, "grad_norm": 0.278803288936615, "learning_rate": 6.460511422441984e-06, "loss": 0.0969, "mean_token_accuracy": 0.9719431698322296, "num_tokens": 1576927.0, "step": 209 }, { "epoch": 2.662420382165605, "grad_norm": 0.24254080653190613, "learning_rate": 5.978023678460099e-06, "loss": 0.1048, "mean_token_accuracy": 0.9709457159042358, "num_tokens": 1584531.0, "step": 210 }, { "epoch": 2.6751592356687897, "grad_norm": 0.21079742908477783, "learning_rate": 5.5137038561761115e-06, "loss": 0.0892, "mean_token_accuracy": 0.9735644161701202, "num_tokens": 1591932.0, "step": 211 }, { "epoch": 2.6878980891719744, "grad_norm": 0.25342243909835815, "learning_rate": 5.067641676381918e-06, "loss": 0.0972, "mean_token_accuracy": 0.972582995891571, "num_tokens": 1599678.0, "step": 212 }, { "epoch": 2.700636942675159, "grad_norm": 0.1848929524421692, "learning_rate": 4.639923331934471e-06, "loss": 0.0904, "mean_token_accuracy": 0.97327721118927, "num_tokens": 1607234.0, "step": 213 }, { "epoch": 2.713375796178344, "grad_norm": 0.21844594180583954, "learning_rate": 4.230631471100655e-06, "loss": 0.098, "mean_token_accuracy": 0.9728173017501831, "num_tokens": 1614910.0, "step": 214 }, { "epoch": 2.7261146496815285, "grad_norm": 0.29655906558036804, "learning_rate": 3.839845181587098e-06, "loss": 0.1011, "mean_token_accuracy": 0.9714401960372925, "num_tokens": 1622358.0, "step": 215 }, { "epoch": 2.738853503184713, "grad_norm": 0.19944727420806885, "learning_rate": 3.467639975257997e-06, "loss": 0.0913, "mean_token_accuracy": 0.9719055891036987, "num_tokens": 1629753.0, "step": 216 }, { "epoch": 2.7515923566878984, "grad_norm": 0.21076829731464386, "learning_rate": 3.1140877735439387e-06, "loss": 0.0894, "mean_token_accuracy": 0.97262904047966, "num_tokens": 1637347.0, "step": 217 }, { "epoch": 2.7643312101910826, "grad_norm": 0.2960074245929718, "learning_rate": 2.7792568935444796e-06, "loss": 0.0913, "mean_token_accuracy": 0.9721934199333191, "num_tokens": 1644999.0, "step": 218 }, { "epoch": 2.777070063694268, "grad_norm": 0.185651496052742, "learning_rate": 2.4632120348272003e-06, "loss": 0.0888, "mean_token_accuracy": 0.9723814725875854, "num_tokens": 1652451.0, "step": 219 }, { "epoch": 2.789808917197452, "grad_norm": 0.22099068760871887, "learning_rate": 2.166014266925731e-06, "loss": 0.0892, "mean_token_accuracy": 0.9731795489788055, "num_tokens": 1660101.0, "step": 220 }, { "epoch": 2.802547770700637, "grad_norm": 0.2245907336473465, "learning_rate": 1.88772101753929e-06, "loss": 0.0939, "mean_token_accuracy": 0.9741968810558319, "num_tokens": 1667978.0, "step": 221 }, { "epoch": 2.8152866242038215, "grad_norm": 0.2256772518157959, "learning_rate": 1.6283860614358936e-06, "loss": 0.0914, "mean_token_accuracy": 0.9728004634380341, "num_tokens": 1675469.0, "step": 222 }, { "epoch": 2.8280254777070066, "grad_norm": 0.19644984602928162, "learning_rate": 1.3880595100613792e-06, "loss": 0.0927, "mean_token_accuracy": 0.9726226031780243, "num_tokens": 1682842.0, "step": 223 }, { "epoch": 2.840764331210191, "grad_norm": 0.22729112207889557, "learning_rate": 1.1667878018564171e-06, "loss": 0.0903, "mean_token_accuracy": 0.9728392660617828, "num_tokens": 1690491.0, "step": 224 }, { "epoch": 2.853503184713376, "grad_norm": 0.21743939816951752, "learning_rate": 9.64613693283123e-07, "loss": 0.0956, "mean_token_accuracy": 0.9711977541446686, "num_tokens": 1697950.0, "step": 225 }, { "epoch": 2.8662420382165603, "grad_norm": 0.23131786286830902, "learning_rate": 7.815762505632096e-07, "loss": 0.0908, "mean_token_accuracy": 0.972371518611908, "num_tokens": 1705398.0, "step": 226 }, { "epoch": 2.8789808917197455, "grad_norm": 0.19186514616012573, "learning_rate": 6.177108421292266e-07, "loss": 0.0896, "mean_token_accuracy": 0.9753928780555725, "num_tokens": 1712737.0, "step": 227 }, { "epoch": 2.8917197452229297, "grad_norm": 0.15185010433197021, "learning_rate": 4.7304913179025965e-07, "loss": 0.0849, "mean_token_accuracy": 0.9748527407646179, "num_tokens": 1720472.0, "step": 228 }, { "epoch": 2.904458598726115, "grad_norm": 0.1807604730129242, "learning_rate": 3.4761907261356976e-07, "loss": 0.0887, "mean_token_accuracy": 0.9729354083538055, "num_tokens": 1727956.0, "step": 229 }, { "epoch": 2.917197452229299, "grad_norm": 0.23020492494106293, "learning_rate": 2.414449015231357e-07, "loss": 0.0956, "mean_token_accuracy": 0.9716013371944427, "num_tokens": 1735520.0, "step": 230 }, { "epoch": 2.9299363057324843, "grad_norm": 0.3724834620952606, "learning_rate": 1.545471346164007e-07, "loss": 0.1087, "mean_token_accuracy": 0.9690882861614227, "num_tokens": 1743213.0, "step": 231 }, { "epoch": 2.9426751592356686, "grad_norm": 0.3106917142868042, "learning_rate": 8.694256319987659e-08, "loss": 0.0969, "mean_token_accuracy": 0.9719716310501099, "num_tokens": 1750982.0, "step": 232 }, { "epoch": 2.9554140127388537, "grad_norm": 0.19371703267097473, "learning_rate": 3.8644250544594975e-08, "loss": 0.0889, "mean_token_accuracy": 0.972972184419632, "num_tokens": 1758448.0, "step": 233 }, { "epoch": 2.968152866242038, "grad_norm": 0.29524293541908264, "learning_rate": 9.661529361892907e-09, "loss": 0.0987, "mean_token_accuracy": 0.9689370095729828, "num_tokens": 1766023.0, "step": 234 }, { "epoch": 2.968152866242038, "step": 234, "total_flos": 1.0230160156105114e+17, "train_loss": 0.3221458565985036, "train_runtime": 403.0093, "train_samples_per_second": 37.22, "train_steps_per_second": 0.581 } ], "logging_steps": 1.0, "max_steps": 234, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.0230160156105114e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }