| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.968152866242038, |
| "eval_steps": 500, |
| "global_step": 234, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 8.287943840026855, |
| "learning_rate": 0.0, |
| "loss": 2.1051, |
| "mean_token_accuracy": 0.6576112508773804, |
| "num_tokens": 7722.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 8.355767250061035, |
| "learning_rate": 2.5e-05, |
| "loss": 2.0935, |
| "mean_token_accuracy": 0.662928581237793, |
| "num_tokens": 15318.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 5.267609119415283, |
| "learning_rate": 5e-05, |
| "loss": 1.823, |
| "mean_token_accuracy": 0.6904586851596832, |
| "num_tokens": 23143.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 4.595154762268066, |
| "learning_rate": 7.500000000000001e-05, |
| "loss": 1.3159, |
| "mean_token_accuracy": 0.7333050668239594, |
| "num_tokens": 30786.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 1.5862985849380493, |
| "learning_rate": 0.0001, |
| "loss": 1.0104, |
| "mean_token_accuracy": 0.7833340167999268, |
| "num_tokens": 38345.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 0.8021528124809265, |
| "learning_rate": 0.000125, |
| "loss": 0.8478, |
| "mean_token_accuracy": 0.8248030543327332, |
| "num_tokens": 45956.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 0.5970975756645203, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.7815, |
| "mean_token_accuracy": 0.8295383155345917, |
| "num_tokens": 53562.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 1.414368987083435, |
| "learning_rate": 0.000175, |
| "loss": 0.7247, |
| "mean_token_accuracy": 0.8384078443050385, |
| "num_tokens": 60929.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 0.9989311099052429, |
| "learning_rate": 0.0002, |
| "loss": 0.74, |
| "mean_token_accuracy": 0.8326991200447083, |
| "num_tokens": 68327.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 0.4296531081199646, |
| "learning_rate": 0.00019999033847063811, |
| "loss": 0.7706, |
| "mean_token_accuracy": 0.8299016058444977, |
| "num_tokens": 75754.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 0.4344661831855774, |
| "learning_rate": 0.00019996135574945544, |
| "loss": 0.7121, |
| "mean_token_accuracy": 0.8349876701831818, |
| "num_tokens": 83217.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 0.3851865530014038, |
| "learning_rate": 0.00019991305743680013, |
| "loss": 0.747, |
| "mean_token_accuracy": 0.830773264169693, |
| "num_tokens": 90805.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 0.3876875042915344, |
| "learning_rate": 0.0001998454528653836, |
| "loss": 0.7502, |
| "mean_token_accuracy": 0.8285396993160248, |
| "num_tokens": 98404.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 0.4084186553955078, |
| "learning_rate": 0.00019975855509847686, |
| "loss": 0.7135, |
| "mean_token_accuracy": 0.83475062251091, |
| "num_tokens": 106081.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.3862064480781555, |
| "learning_rate": 0.00019965238092738643, |
| "loss": 0.777, |
| "mean_token_accuracy": 0.8248996436595917, |
| "num_tokens": 113617.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.4174270033836365, |
| "learning_rate": 0.00019952695086820975, |
| "loss": 0.7301, |
| "mean_token_accuracy": 0.8283782601356506, |
| "num_tokens": 121314.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 0.3616231381893158, |
| "learning_rate": 0.0001993822891578708, |
| "loss": 0.7061, |
| "mean_token_accuracy": 0.8416012227535248, |
| "num_tokens": 128659.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.38920992612838745, |
| "learning_rate": 0.0001992184237494368, |
| "loss": 0.7001, |
| "mean_token_accuracy": 0.835535317659378, |
| "num_tokens": 136314.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 0.3504973351955414, |
| "learning_rate": 0.0001990353863067169, |
| "loss": 0.7106, |
| "mean_token_accuracy": 0.8328219652175903, |
| "num_tokens": 144182.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.34746506810188293, |
| "learning_rate": 0.0001988332121981436, |
| "loss": 0.7584, |
| "mean_token_accuracy": 0.8270872235298157, |
| "num_tokens": 152095.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.3385103642940521, |
| "learning_rate": 0.00019861194048993863, |
| "loss": 0.6867, |
| "mean_token_accuracy": 0.8429812490940094, |
| "num_tokens": 159463.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.3274126946926117, |
| "learning_rate": 0.0001983716139385641, |
| "loss": 0.6727, |
| "mean_token_accuracy": 0.8409291505813599, |
| "num_tokens": 166878.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.33483415842056274, |
| "learning_rate": 0.0001981122789824607, |
| "loss": 0.656, |
| "mean_token_accuracy": 0.8487405478954315, |
| "num_tokens": 174314.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.3158458173274994, |
| "learning_rate": 0.00019783398573307428, |
| "loss": 0.7133, |
| "mean_token_accuracy": 0.8301410675048828, |
| "num_tokens": 181966.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.3395407199859619, |
| "learning_rate": 0.00019753678796517282, |
| "loss": 0.7214, |
| "mean_token_accuracy": 0.8315837681293488, |
| "num_tokens": 189637.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.3301332890987396, |
| "learning_rate": 0.00019722074310645553, |
| "loss": 0.65, |
| "mean_token_accuracy": 0.8509158194065094, |
| "num_tokens": 196866.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.40064746141433716, |
| "learning_rate": 0.00019688591222645607, |
| "loss": 0.6879, |
| "mean_token_accuracy": 0.8388471305370331, |
| "num_tokens": 204527.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.36539191007614136, |
| "learning_rate": 0.000196532360024742, |
| "loss": 0.7129, |
| "mean_token_accuracy": 0.8327633142471313, |
| "num_tokens": 212217.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.32001280784606934, |
| "learning_rate": 0.0001961601548184129, |
| "loss": 0.6097, |
| "mean_token_accuracy": 0.8550100326538086, |
| "num_tokens": 219611.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.3553815484046936, |
| "learning_rate": 0.00019576936852889936, |
| "loss": 0.664, |
| "mean_token_accuracy": 0.8454612195491791, |
| "num_tokens": 227201.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.37485066056251526, |
| "learning_rate": 0.00019536007666806556, |
| "loss": 0.6167, |
| "mean_token_accuracy": 0.8543617725372314, |
| "num_tokens": 234596.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.43772801756858826, |
| "learning_rate": 0.0001949323583236181, |
| "loss": 0.6297, |
| "mean_token_accuracy": 0.848662257194519, |
| "num_tokens": 242008.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.4182124137878418, |
| "learning_rate": 0.0001944862961438239, |
| "loss": 0.6675, |
| "mean_token_accuracy": 0.8380049467086792, |
| "num_tokens": 249776.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.3301289975643158, |
| "learning_rate": 0.00019402197632153992, |
| "loss": 0.6575, |
| "mean_token_accuracy": 0.8471685945987701, |
| "num_tokens": 257319.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.35300567746162415, |
| "learning_rate": 0.00019353948857755803, |
| "loss": 0.5979, |
| "mean_token_accuracy": 0.8560113310813904, |
| "num_tokens": 264828.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.3664567768573761, |
| "learning_rate": 0.00019303892614326836, |
| "loss": 0.5948, |
| "mean_token_accuracy": 0.8638049066066742, |
| "num_tokens": 272172.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.3352532386779785, |
| "learning_rate": 0.00019252038574264405, |
| "loss": 0.6585, |
| "mean_token_accuracy": 0.844391405582428, |
| "num_tokens": 279813.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.4468683898448944, |
| "learning_rate": 0.00019198396757355118, |
| "loss": 0.6146, |
| "mean_token_accuracy": 0.8511447310447693, |
| "num_tokens": 287537.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.3902146518230438, |
| "learning_rate": 0.00019142977528838762, |
| "loss": 0.5993, |
| "mean_token_accuracy": 0.8533865213394165, |
| "num_tokens": 295085.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.3714890778064728, |
| "learning_rate": 0.00019085791597405404, |
| "loss": 0.6601, |
| "mean_token_accuracy": 0.8435452580451965, |
| "num_tokens": 302853.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.35523873567581177, |
| "learning_rate": 0.00019026850013126157, |
| "loss": 0.6153, |
| "mean_token_accuracy": 0.8525647222995758, |
| "num_tokens": 310507.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.35029295086860657, |
| "learning_rate": 0.00018966164165317966, |
| "loss": 0.5312, |
| "mean_token_accuracy": 0.8702357113361359, |
| "num_tokens": 317912.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.38241031765937805, |
| "learning_rate": 0.00018903745780342839, |
| "loss": 0.6103, |
| "mean_token_accuracy": 0.855758547782898, |
| "num_tokens": 325400.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.4096700847148895, |
| "learning_rate": 0.0001883960691934196, |
| "loss": 0.5746, |
| "mean_token_accuracy": 0.8615990579128265, |
| "num_tokens": 333086.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.37658724188804626, |
| "learning_rate": 0.00018773759975905098, |
| "loss": 0.5288, |
| "mean_token_accuracy": 0.8693232238292694, |
| "num_tokens": 340578.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.43547865748405457, |
| "learning_rate": 0.00018706217673675811, |
| "loss": 0.6485, |
| "mean_token_accuracy": 0.8440962433815002, |
| "num_tokens": 348586.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.4606596827507019, |
| "learning_rate": 0.0001863699306389282, |
| "loss": 0.5552, |
| "mean_token_accuracy": 0.8659605085849762, |
| "num_tokens": 356174.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.4326448142528534, |
| "learning_rate": 0.00018566099522868119, |
| "loss": 0.5145, |
| "mean_token_accuracy": 0.8702480494976044, |
| "num_tokens": 363805.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.4241434633731842, |
| "learning_rate": 0.00018493550749402278, |
| "loss": 0.6031, |
| "mean_token_accuracy": 0.8582789897918701, |
| "num_tokens": 371462.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.4271712005138397, |
| "learning_rate": 0.00018419360762137395, |
| "loss": 0.5618, |
| "mean_token_accuracy": 0.8646855652332306, |
| "num_tokens": 379019.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.40694111585617065, |
| "learning_rate": 0.00018343543896848273, |
| "loss": 0.5195, |
| "mean_token_accuracy": 0.8710185289382935, |
| "num_tokens": 386380.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.40776747465133667, |
| "learning_rate": 0.00018266114803672318, |
| "loss": 0.5566, |
| "mean_token_accuracy": 0.8674687147140503, |
| "num_tokens": 393867.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.4121972620487213, |
| "learning_rate": 0.00018187088444278674, |
| "loss": 0.5482, |
| "mean_token_accuracy": 0.8711592853069305, |
| "num_tokens": 401609.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.40399909019470215, |
| "learning_rate": 0.00018106480088977172, |
| "loss": 0.5687, |
| "mean_token_accuracy": 0.8622486889362335, |
| "num_tokens": 409264.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.41347479820251465, |
| "learning_rate": 0.00018024305313767646, |
| "loss": 0.5048, |
| "mean_token_accuracy": 0.8774301111698151, |
| "num_tokens": 416527.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.44538500905036926, |
| "learning_rate": 0.00017940579997330165, |
| "loss": 0.4789, |
| "mean_token_accuracy": 0.8834721446037292, |
| "num_tokens": 424091.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.5161186456680298, |
| "learning_rate": 0.00017855320317956784, |
| "loss": 0.5374, |
| "mean_token_accuracy": 0.867156058549881, |
| "num_tokens": 431859.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.4894382953643799, |
| "learning_rate": 0.00017768542750425426, |
| "loss": 0.5479, |
| "mean_token_accuracy": 0.8681759834289551, |
| "num_tokens": 439429.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.4625523090362549, |
| "learning_rate": 0.0001768026406281642, |
| "loss": 0.587, |
| "mean_token_accuracy": 0.8580531179904938, |
| "num_tokens": 447417.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.4163782000541687, |
| "learning_rate": 0.00017590501313272415, |
| "loss": 0.5592, |
| "mean_token_accuracy": 0.868916928768158, |
| "num_tokens": 455053.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.4515700042247772, |
| "learning_rate": 0.00017499271846702213, |
| "loss": 0.4692, |
| "mean_token_accuracy": 0.8839752674102783, |
| "num_tokens": 462553.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.48304829001426697, |
| "learning_rate": 0.00017406593291429217, |
| "loss": 0.4951, |
| "mean_token_accuracy": 0.8761360943317413, |
| "num_tokens": 470057.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.4670911729335785, |
| "learning_rate": 0.00017312483555785086, |
| "loss": 0.4412, |
| "mean_token_accuracy": 0.8923192024230957, |
| "num_tokens": 477410.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.4475160241127014, |
| "learning_rate": 0.00017216960824649303, |
| "loss": 0.4687, |
| "mean_token_accuracy": 0.8837877810001373, |
| "num_tokens": 485000.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.4836560785770416, |
| "learning_rate": 0.00017120043555935298, |
| "loss": 0.4642, |
| "mean_token_accuracy": 0.886978417634964, |
| "num_tokens": 492576.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.5065037608146667, |
| "learning_rate": 0.0001702175047702382, |
| "loss": 0.5121, |
| "mean_token_accuracy": 0.8710624575614929, |
| "num_tokens": 500413.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.4843185245990753, |
| "learning_rate": 0.00016922100581144228, |
| "loss": 0.5384, |
| "mean_token_accuracy": 0.8697362542152405, |
| "num_tokens": 508117.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.5202386379241943, |
| "learning_rate": 0.00016821113123704424, |
| "loss": 0.4639, |
| "mean_token_accuracy": 0.8836866319179535, |
| "num_tokens": 515746.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.4895678460597992, |
| "learning_rate": 0.00016718807618570106, |
| "loss": 0.4422, |
| "mean_token_accuracy": 0.8906868398189545, |
| "num_tokens": 523013.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.5349318981170654, |
| "learning_rate": 0.00016615203834294119, |
| "loss": 0.4428, |
| "mean_token_accuracy": 0.8886107206344604, |
| "num_tokens": 530452.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.48844024538993835, |
| "learning_rate": 0.00016510321790296525, |
| "loss": 0.4153, |
| "mean_token_accuracy": 0.8925909399986267, |
| "num_tokens": 537855.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.5755529999732971, |
| "learning_rate": 0.00016404181752996289, |
| "loss": 0.4864, |
| "mean_token_accuracy": 0.8765636086463928, |
| "num_tokens": 545421.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.45479002594947815, |
| "learning_rate": 0.00016296804231895142, |
| "loss": 0.3651, |
| "mean_token_accuracy": 0.9048753976821899, |
| "num_tokens": 552909.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.49108317494392395, |
| "learning_rate": 0.00016188209975614542, |
| "loss": 0.45, |
| "mean_token_accuracy": 0.8858565986156464, |
| "num_tokens": 560702.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.46213510632514954, |
| "learning_rate": 0.00016078419967886402, |
| "loss": 0.3958, |
| "mean_token_accuracy": 0.9005838930606842, |
| "num_tokens": 568245.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.5798938870429993, |
| "learning_rate": 0.00015967455423498387, |
| "loss": 0.3912, |
| "mean_token_accuracy": 0.9034214019775391, |
| "num_tokens": 575857.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.5185940861701965, |
| "learning_rate": 0.00015855337784194577, |
| "loss": 0.3628, |
| "mean_token_accuracy": 0.9065321683883667, |
| "num_tokens": 583441.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.5182363390922546, |
| "learning_rate": 0.00015742088714532247, |
| "loss": 0.4174, |
| "mean_token_accuracy": 0.8943608999252319, |
| "num_tokens": 591106.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.5182363390922546, |
| "learning_rate": 0.00015627730097695638, |
| "loss": 0.4455, |
| "mean_token_accuracy": 0.8872870206832886, |
| "num_tokens": 594953.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.823184072971344, |
| "learning_rate": 0.00015512284031267437, |
| "loss": 0.2927, |
| "mean_token_accuracy": 0.9254479706287384, |
| "num_tokens": 602519.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.4461751878261566, |
| "learning_rate": 0.00015395772822958845, |
| "loss": 0.2936, |
| "mean_token_accuracy": 0.9253770411014557, |
| "num_tokens": 610085.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.5058058500289917, |
| "learning_rate": 0.00015278218986299074, |
| "loss": 0.235, |
| "mean_token_accuracy": 0.9344533979892731, |
| "num_tokens": 617710.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.6525824069976807, |
| "learning_rate": 0.0001515964523628501, |
| "loss": 0.2901, |
| "mean_token_accuracy": 0.9262363314628601, |
| "num_tokens": 625223.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.6204919815063477, |
| "learning_rate": 0.00015040074484992, |
| "loss": 0.2371, |
| "mean_token_accuracy": 0.9375110268592834, |
| "num_tokens": 632672.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.4697447419166565, |
| "learning_rate": 0.00014919529837146528, |
| "loss": 0.2389, |
| "mean_token_accuracy": 0.9337205290794373, |
| "num_tokens": 640267.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.5069385170936584, |
| "learning_rate": 0.00014798034585661695, |
| "loss": 0.2394, |
| "mean_token_accuracy": 0.9344863593578339, |
| "num_tokens": 647855.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.512169599533081, |
| "learning_rate": 0.0001467561220713628, |
| "loss": 0.3004, |
| "mean_token_accuracy": 0.9232901930809021, |
| "num_tokens": 655347.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.5167611837387085, |
| "learning_rate": 0.0001455228635731839, |
| "loss": 0.261, |
| "mean_token_accuracy": 0.9302393794059753, |
| "num_tokens": 662908.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.43430718779563904, |
| "learning_rate": 0.00014428080866534396, |
| "loss": 0.2426, |
| "mean_token_accuracy": 0.9376973807811737, |
| "num_tokens": 670227.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.44046974182128906, |
| "learning_rate": 0.00014303019735084226, |
| "loss": 0.2484, |
| "mean_token_accuracy": 0.9353660345077515, |
| "num_tokens": 677733.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.5374375581741333, |
| "learning_rate": 0.00014177127128603745, |
| "loss": 0.2681, |
| "mean_token_accuracy": 0.9323221743106842, |
| "num_tokens": 685450.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.507544219493866, |
| "learning_rate": 0.0001405042737339524, |
| "loss": 0.2522, |
| "mean_token_accuracy": 0.9334528148174286, |
| "num_tokens": 693379.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.5681467056274414, |
| "learning_rate": 0.0001392294495172681, |
| "loss": 0.2381, |
| "mean_token_accuracy": 0.9384985864162445, |
| "num_tokens": 701006.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.5037748217582703, |
| "learning_rate": 0.00013794704497101655, |
| "loss": 0.248, |
| "mean_token_accuracy": 0.9311998784542084, |
| "num_tokens": 708222.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.4543361961841583, |
| "learning_rate": 0.0001366573078949813, |
| "loss": 0.2709, |
| "mean_token_accuracy": 0.927354484796524, |
| "num_tokens": 715815.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.47324758768081665, |
| "learning_rate": 0.00013536048750581494, |
| "loss": 0.2349, |
| "mean_token_accuracy": 0.941594272851944, |
| "num_tokens": 723177.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.4437101185321808, |
| "learning_rate": 0.00013405683438888282, |
| "loss": 0.2264, |
| "mean_token_accuracy": 0.9379465878009796, |
| "num_tokens": 730685.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.3893497884273529, |
| "learning_rate": 0.00013274660044984224, |
| "loss": 0.2139, |
| "mean_token_accuracy": 0.9428676962852478, |
| "num_tokens": 738399.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.47590160369873047, |
| "learning_rate": 0.00013143003886596669, |
| "loss": 0.2622, |
| "mean_token_accuracy": 0.9279411733150482, |
| "num_tokens": 746096.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.5140976309776306, |
| "learning_rate": 0.0001301074040372242, |
| "loss": 0.2063, |
| "mean_token_accuracy": 0.9456835091114044, |
| "num_tokens": 753562.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.438860148191452, |
| "learning_rate": 0.00012877895153711935, |
| "loss": 0.2382, |
| "mean_token_accuracy": 0.9374182820320129, |
| "num_tokens": 761282.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.6094561815261841, |
| "learning_rate": 0.0001274449380633089, |
| "loss": 0.2339, |
| "mean_token_accuracy": 0.9405188262462616, |
| "num_tokens": 768815.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.5217446088790894, |
| "learning_rate": 0.00012610562138799978, |
| "loss": 0.2705, |
| "mean_token_accuracy": 0.9315881133079529, |
| "num_tokens": 776490.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.5095704197883606, |
| "learning_rate": 0.00012476126030813963, |
| "loss": 0.2185, |
| "mean_token_accuracy": 0.9398861229419708, |
| "num_tokens": 784055.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.5053628087043762, |
| "learning_rate": 0.0001234121145954094, |
| "loss": 0.2421, |
| "mean_token_accuracy": 0.9382818043231964, |
| "num_tokens": 791644.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.43147337436676025, |
| "learning_rate": 0.0001220584449460274, |
| "loss": 0.207, |
| "mean_token_accuracy": 0.9434195756912231, |
| "num_tokens": 799207.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.40620630979537964, |
| "learning_rate": 0.00012070051293037492, |
| "loss": 0.2302, |
| "mean_token_accuracy": 0.9408184885978699, |
| "num_tokens": 806854.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.4834441542625427, |
| "learning_rate": 0.00011933858094245281, |
| "loss": 0.2031, |
| "mean_token_accuracy": 0.9470761716365814, |
| "num_tokens": 814335.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.45893028378486633, |
| "learning_rate": 0.00011797291214917881, |
| "loss": 0.2137, |
| "mean_token_accuracy": 0.9417379796504974, |
| "num_tokens": 822129.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.5153368711471558, |
| "learning_rate": 0.00011660377043953588, |
| "loss": 0.2402, |
| "mean_token_accuracy": 0.938307374715805, |
| "num_tokens": 830009.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.4056824743747711, |
| "learning_rate": 0.0001152314203735805, |
| "loss": 0.2025, |
| "mean_token_accuracy": 0.9457784295082092, |
| "num_tokens": 837339.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.4811604619026184, |
| "learning_rate": 0.0001138561271313219, |
| "loss": 0.2136, |
| "mean_token_accuracy": 0.9439316689968109, |
| "num_tokens": 844962.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.4947657585144043, |
| "learning_rate": 0.00011247815646148087, |
| "loss": 0.228, |
| "mean_token_accuracy": 0.9374533593654633, |
| "num_tokens": 852442.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.4831300973892212, |
| "learning_rate": 0.00011109777463013915, |
| "loss": 0.1971, |
| "mean_token_accuracy": 0.950575202703476, |
| "num_tokens": 859705.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.4768920838832855, |
| "learning_rate": 0.0001097152483692886, |
| "loss": 0.2014, |
| "mean_token_accuracy": 0.9461125135421753, |
| "num_tokens": 867320.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.4603787362575531, |
| "learning_rate": 0.00010833084482529048, |
| "loss": 0.2343, |
| "mean_token_accuracy": 0.9413523375988007, |
| "num_tokens": 874840.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.4399753510951996, |
| "learning_rate": 0.00010694483150725458, |
| "loss": 0.2075, |
| "mean_token_accuracy": 0.948328822851181, |
| "num_tokens": 882451.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.483257919549942, |
| "learning_rate": 0.00010555747623534831, |
| "loss": 0.1985, |
| "mean_token_accuracy": 0.9503215551376343, |
| "num_tokens": 890101.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.45524635910987854, |
| "learning_rate": 0.00010416904708904548, |
| "loss": 0.1954, |
| "mean_token_accuracy": 0.9504112601280212, |
| "num_tokens": 897607.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.44008612632751465, |
| "learning_rate": 0.00010277981235532541, |
| "loss": 0.212, |
| "mean_token_accuracy": 0.9436098635196686, |
| "num_tokens": 905191.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.46399325132369995, |
| "learning_rate": 0.00010139004047683151, |
| "loss": 0.1785, |
| "mean_token_accuracy": 0.9537560045719147, |
| "num_tokens": 912523.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.4352799654006958, |
| "learning_rate": 0.0001, |
| "loss": 0.2154, |
| "mean_token_accuracy": 0.9456183016300201, |
| "num_tokens": 920273.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.4239864945411682, |
| "learning_rate": 9.860995952316851e-05, |
| "loss": 0.1709, |
| "mean_token_accuracy": 0.9573950469493866, |
| "num_tokens": 927864.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.5215359926223755, |
| "learning_rate": 9.722018764467461e-05, |
| "loss": 0.1979, |
| "mean_token_accuracy": 0.9506862163543701, |
| "num_tokens": 935454.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.5375974178314209, |
| "learning_rate": 9.583095291095453e-05, |
| "loss": 0.2106, |
| "mean_token_accuracy": 0.9438005685806274, |
| "num_tokens": 943211.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.47071683406829834, |
| "learning_rate": 9.444252376465171e-05, |
| "loss": 0.188, |
| "mean_token_accuracy": 0.9508571922779083, |
| "num_tokens": 950616.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.4657401442527771, |
| "learning_rate": 9.305516849274541e-05, |
| "loss": 0.1689, |
| "mean_token_accuracy": 0.9533426463603973, |
| "num_tokens": 958183.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.3836834132671356, |
| "learning_rate": 9.166915517470953e-05, |
| "loss": 0.1871, |
| "mean_token_accuracy": 0.9511479735374451, |
| "num_tokens": 965678.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.46731242537498474, |
| "learning_rate": 9.028475163071141e-05, |
| "loss": 0.175, |
| "mean_token_accuracy": 0.9512114226818085, |
| "num_tokens": 973262.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.4541298747062683, |
| "learning_rate": 8.890222536986085e-05, |
| "loss": 0.216, |
| "mean_token_accuracy": 0.9441925585269928, |
| "num_tokens": 980887.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.3771320581436157, |
| "learning_rate": 8.752184353851916e-05, |
| "loss": 0.1853, |
| "mean_token_accuracy": 0.952815979719162, |
| "num_tokens": 988463.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.4476616382598877, |
| "learning_rate": 8.614387286867814e-05, |
| "loss": 0.1831, |
| "mean_token_accuracy": 0.9529510140419006, |
| "num_tokens": 996025.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.3788629174232483, |
| "learning_rate": 8.47685796264195e-05, |
| "loss": 0.194, |
| "mean_token_accuracy": 0.953939825296402, |
| "num_tokens": 1003816.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.4536489248275757, |
| "learning_rate": 8.339622956046417e-05, |
| "loss": 0.1445, |
| "mean_token_accuracy": 0.9615342020988464, |
| "num_tokens": 1011351.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.41908058524131775, |
| "learning_rate": 8.202708785082121e-05, |
| "loss": 0.1623, |
| "mean_token_accuracy": 0.9565115869045258, |
| "num_tokens": 1018759.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.475737988948822, |
| "learning_rate": 8.066141905754723e-05, |
| "loss": 0.1725, |
| "mean_token_accuracy": 0.9567776024341583, |
| "num_tokens": 1026286.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.349752813577652, |
| "learning_rate": 7.929948706962508e-05, |
| "loss": 0.1255, |
| "mean_token_accuracy": 0.9658943712711334, |
| "num_tokens": 1033770.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.39415788650512695, |
| "learning_rate": 7.794155505397261e-05, |
| "loss": 0.1577, |
| "mean_token_accuracy": 0.9558201730251312, |
| "num_tokens": 1041659.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.41134774684906006, |
| "learning_rate": 7.658788540459062e-05, |
| "loss": 0.2085, |
| "mean_token_accuracy": 0.948514312505722, |
| "num_tokens": 1049150.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.5479893088340759, |
| "learning_rate": 7.523873969186039e-05, |
| "loss": 0.1663, |
| "mean_token_accuracy": 0.9547719359397888, |
| "num_tokens": 1056784.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.36870864033699036, |
| "learning_rate": 7.389437861200024e-05, |
| "loss": 0.1485, |
| "mean_token_accuracy": 0.9612145721912384, |
| "num_tokens": 1064184.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.39722350239753723, |
| "learning_rate": 7.25550619366911e-05, |
| "loss": 0.1559, |
| "mean_token_accuracy": 0.9604078829288483, |
| "num_tokens": 1072029.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.40050435066223145, |
| "learning_rate": 7.122104846288064e-05, |
| "loss": 0.1384, |
| "mean_token_accuracy": 0.962491363286972, |
| "num_tokens": 1079591.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.391933411359787, |
| "learning_rate": 6.989259596277582e-05, |
| "loss": 0.1792, |
| "mean_token_accuracy": 0.9526192545890808, |
| "num_tokens": 1087338.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.456823468208313, |
| "learning_rate": 6.85699611340333e-05, |
| "loss": 0.1416, |
| "mean_token_accuracy": 0.9639541804790497, |
| "num_tokens": 1094894.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.3839541971683502, |
| "learning_rate": 6.725339955015777e-05, |
| "loss": 0.1389, |
| "mean_token_accuracy": 0.9645723104476929, |
| "num_tokens": 1102210.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.33357852697372437, |
| "learning_rate": 6.594316561111724e-05, |
| "loss": 0.1557, |
| "mean_token_accuracy": 0.96068075299263, |
| "num_tokens": 1109738.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.4593367874622345, |
| "learning_rate": 6.46395124941851e-05, |
| "loss": 0.1708, |
| "mean_token_accuracy": 0.9570999145507812, |
| "num_tokens": 1117265.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.36817261576652527, |
| "learning_rate": 6.334269210501875e-05, |
| "loss": 0.1372, |
| "mean_token_accuracy": 0.9625333249568939, |
| "num_tokens": 1124990.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.3801482617855072, |
| "learning_rate": 6.205295502898348e-05, |
| "loss": 0.121, |
| "mean_token_accuracy": 0.966850757598877, |
| "num_tokens": 1132869.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.34184518456459045, |
| "learning_rate": 6.0770550482731924e-05, |
| "loss": 0.1642, |
| "mean_token_accuracy": 0.9570443630218506, |
| "num_tokens": 1140785.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.4241127669811249, |
| "learning_rate": 5.9495726266047605e-05, |
| "loss": 0.1556, |
| "mean_token_accuracy": 0.9617596864700317, |
| "num_tokens": 1148603.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.3778759837150574, |
| "learning_rate": 5.8228728713962543e-05, |
| "loss": 0.114, |
| "mean_token_accuracy": 0.9691117703914642, |
| "num_tokens": 1156149.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.4415481686592102, |
| "learning_rate": 5.696980264915777e-05, |
| "loss": 0.1381, |
| "mean_token_accuracy": 0.9639294743537903, |
| "num_tokens": 1163656.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.3667774796485901, |
| "learning_rate": 5.571919133465605e-05, |
| "loss": 0.1433, |
| "mean_token_accuracy": 0.9641910791397095, |
| "num_tokens": 1171141.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.36915281414985657, |
| "learning_rate": 5.447713642681612e-05, |
| "loss": 0.1358, |
| "mean_token_accuracy": 0.9650273025035858, |
| "num_tokens": 1178660.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.33127549290657043, |
| "learning_rate": 5.324387792863719e-05, |
| "loss": 0.1873, |
| "mean_token_accuracy": 0.955519050359726, |
| "num_tokens": 1186058.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.5781312584877014, |
| "learning_rate": 5.201965414338308e-05, |
| "loss": 0.0995, |
| "mean_token_accuracy": 0.9694300293922424, |
| "num_tokens": 1189950.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.22299824655056, |
| "learning_rate": 5.080470162853472e-05, |
| "loss": 0.0994, |
| "mean_token_accuracy": 0.9725558459758759, |
| "num_tokens": 1197547.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 0.20428019762039185, |
| "learning_rate": 4.959925515008002e-05, |
| "loss": 0.0981, |
| "mean_token_accuracy": 0.9740569591522217, |
| "num_tokens": 1205124.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.31417369842529297, |
| "learning_rate": 4.840354763714991e-05, |
| "loss": 0.1128, |
| "mean_token_accuracy": 0.9698708951473236, |
| "num_tokens": 1212386.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.2941860258579254, |
| "learning_rate": 4.7217810137009274e-05, |
| "loss": 0.1198, |
| "mean_token_accuracy": 0.9675701260566711, |
| "num_tokens": 1219879.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.22774440050125122, |
| "learning_rate": 4.604227177041156e-05, |
| "loss": 0.0893, |
| "mean_token_accuracy": 0.9721206724643707, |
| "num_tokens": 1227344.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.20990870893001556, |
| "learning_rate": 4.487715968732568e-05, |
| "loss": 0.0897, |
| "mean_token_accuracy": 0.9736597836017609, |
| "num_tokens": 1234928.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.23693329095840454, |
| "learning_rate": 4.372269902304363e-05, |
| "loss": 0.1029, |
| "mean_token_accuracy": 0.9717570245265961, |
| "num_tokens": 1242719.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.2804213762283325, |
| "learning_rate": 4.257911285467754e-05, |
| "loss": 0.1026, |
| "mean_token_accuracy": 0.9732820093631744, |
| "num_tokens": 1250304.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.28864407539367676, |
| "learning_rate": 4.144662215805426e-05, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.9715860486030579, |
| "num_tokens": 1258105.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.3053213059902191, |
| "learning_rate": 4.0325445765016145e-05, |
| "loss": 0.0995, |
| "mean_token_accuracy": 0.9712505340576172, |
| "num_tokens": 1265853.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.3355003893375397, |
| "learning_rate": 3.921580032113602e-05, |
| "loss": 0.1006, |
| "mean_token_accuracy": 0.9709268808364868, |
| "num_tokens": 1273220.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.3259344696998596, |
| "learning_rate": 3.8117900243854595e-05, |
| "loss": 0.1025, |
| "mean_token_accuracy": 0.969818502664566, |
| "num_tokens": 1280636.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.25363364815711975, |
| "learning_rate": 3.7031957681048604e-05, |
| "loss": 0.0899, |
| "mean_token_accuracy": 0.973079264163971, |
| "num_tokens": 1288501.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.33290988206863403, |
| "learning_rate": 3.595818247003713e-05, |
| "loss": 0.1036, |
| "mean_token_accuracy": 0.9701544344425201, |
| "num_tokens": 1296181.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.23419451713562012, |
| "learning_rate": 3.489678209703475e-05, |
| "loss": 0.0922, |
| "mean_token_accuracy": 0.9737686514854431, |
| "num_tokens": 1303725.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.25606822967529297, |
| "learning_rate": 3.3847961657058845e-05, |
| "loss": 0.093, |
| "mean_token_accuracy": 0.9733033776283264, |
| "num_tokens": 1311315.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.2730248272418976, |
| "learning_rate": 3.281192381429894e-05, |
| "loss": 0.0945, |
| "mean_token_accuracy": 0.9713809788227081, |
| "num_tokens": 1318647.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.25905486941337585, |
| "learning_rate": 3.178886876295578e-05, |
| "loss": 0.094, |
| "mean_token_accuracy": 0.9720935225486755, |
| "num_tokens": 1326203.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.21770048141479492, |
| "learning_rate": 3.077899418855772e-05, |
| "loss": 0.095, |
| "mean_token_accuracy": 0.972693145275116, |
| "num_tokens": 1333736.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.21615815162658691, |
| "learning_rate": 2.9782495229761808e-05, |
| "loss": 0.0959, |
| "mean_token_accuracy": 0.9725539982318878, |
| "num_tokens": 1341160.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.29113566875457764, |
| "learning_rate": 2.879956444064703e-05, |
| "loss": 0.1089, |
| "mean_token_accuracy": 0.9702370762825012, |
| "num_tokens": 1348750.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.298750102519989, |
| "learning_rate": 2.783039175350699e-05, |
| "loss": 0.1037, |
| "mean_token_accuracy": 0.9692679643630981, |
| "num_tokens": 1356569.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.2231506109237671, |
| "learning_rate": 2.6875164442149147e-05, |
| "loss": 0.0955, |
| "mean_token_accuracy": 0.9708955585956573, |
| "num_tokens": 1364056.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.2941678762435913, |
| "learning_rate": 2.5934067085707834e-05, |
| "loss": 0.0996, |
| "mean_token_accuracy": 0.9709564447402954, |
| "num_tokens": 1371659.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.1835247129201889, |
| "learning_rate": 2.500728153297788e-05, |
| "loss": 0.0942, |
| "mean_token_accuracy": 0.9725345969200134, |
| "num_tokens": 1379147.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.28575223684310913, |
| "learning_rate": 2.409498686727587e-05, |
| "loss": 0.091, |
| "mean_token_accuracy": 0.9733802676200867, |
| "num_tokens": 1386765.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.2463427037000656, |
| "learning_rate": 2.3197359371835802e-05, |
| "loss": 0.086, |
| "mean_token_accuracy": 0.9742932319641113, |
| "num_tokens": 1394618.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.1932964026927948, |
| "learning_rate": 2.2314572495745746e-05, |
| "loss": 0.093, |
| "mean_token_accuracy": 0.9733997285366058, |
| "num_tokens": 1402323.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.31327489018440247, |
| "learning_rate": 2.1446796820432167e-05, |
| "loss": 0.099, |
| "mean_token_accuracy": 0.9692893028259277, |
| "num_tokens": 1409811.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.2381305992603302, |
| "learning_rate": 2.0594200026698363e-05, |
| "loss": 0.0944, |
| "mean_token_accuracy": 0.9724844992160797, |
| "num_tokens": 1417360.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.2520155906677246, |
| "learning_rate": 1.9756946862323535e-05, |
| "loss": 0.096, |
| "mean_token_accuracy": 0.9740960896015167, |
| "num_tokens": 1425115.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.183822900056839, |
| "learning_rate": 1.8935199110228275e-05, |
| "loss": 0.0911, |
| "mean_token_accuracy": 0.9735857248306274, |
| "num_tokens": 1432795.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.20515495538711548, |
| "learning_rate": 1.8129115557213262e-05, |
| "loss": 0.0936, |
| "mean_token_accuracy": 0.9743000864982605, |
| "num_tokens": 1440406.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.34444665908813477, |
| "learning_rate": 1.7338851963276825e-05, |
| "loss": 0.0932, |
| "mean_token_accuracy": 0.9733559787273407, |
| "num_tokens": 1447979.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.19695109128952026, |
| "learning_rate": 1.656456103151728e-05, |
| "loss": 0.0941, |
| "mean_token_accuracy": 0.9739238917827606, |
| "num_tokens": 1455491.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.21720701456069946, |
| "learning_rate": 1.580639237862608e-05, |
| "loss": 0.0928, |
| "mean_token_accuracy": 0.9730100631713867, |
| "num_tokens": 1463007.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.21964755654335022, |
| "learning_rate": 1.5064492505977234e-05, |
| "loss": 0.0892, |
| "mean_token_accuracy": 0.9735862016677856, |
| "num_tokens": 1470901.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.1945929080247879, |
| "learning_rate": 1.433900477131882e-05, |
| "loss": 0.0889, |
| "mean_token_accuracy": 0.9738577008247375, |
| "num_tokens": 1478538.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.2573101818561554, |
| "learning_rate": 1.363006936107183e-05, |
| "loss": 0.1038, |
| "mean_token_accuracy": 0.9701802432537079, |
| "num_tokens": 1486088.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.1948987990617752, |
| "learning_rate": 1.29378232632419e-05, |
| "loss": 0.0892, |
| "mean_token_accuracy": 0.9724543392658234, |
| "num_tokens": 1493703.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.2603251338005066, |
| "learning_rate": 1.2262400240949023e-05, |
| "loss": 0.1021, |
| "mean_token_accuracy": 0.9714818596839905, |
| "num_tokens": 1501201.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.23355098068714142, |
| "learning_rate": 1.1603930806580444e-05, |
| "loss": 0.0918, |
| "mean_token_accuracy": 0.9732993841171265, |
| "num_tokens": 1508923.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.26143762469291687, |
| "learning_rate": 1.0962542196571634e-05, |
| "loss": 0.0978, |
| "mean_token_accuracy": 0.9724924564361572, |
| "num_tokens": 1516403.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.19722925126552582, |
| "learning_rate": 1.0338358346820353e-05, |
| "loss": 0.0881, |
| "mean_token_accuracy": 0.9745533466339111, |
| "num_tokens": 1524170.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.24879567325115204, |
| "learning_rate": 9.731499868738447e-06, |
| "loss": 0.1024, |
| "mean_token_accuracy": 0.9704383015632629, |
| "num_tokens": 1531711.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.18551646173000336, |
| "learning_rate": 9.142084025945984e-06, |
| "loss": 0.0887, |
| "mean_token_accuracy": 0.9731804728507996, |
| "num_tokens": 1539309.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.19061441719532013, |
| "learning_rate": 8.570224711612385e-06, |
| "loss": 0.0906, |
| "mean_token_accuracy": 0.9726877510547638, |
| "num_tokens": 1546875.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.22261416912078857, |
| "learning_rate": 8.016032426448817e-06, |
| "loss": 0.0918, |
| "mean_token_accuracy": 0.9743273258209229, |
| "num_tokens": 1554385.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.23906444013118744, |
| "learning_rate": 7.479614257355971e-06, |
| "loss": 0.0954, |
| "mean_token_accuracy": 0.9728935956954956, |
| "num_tokens": 1562049.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.2492460012435913, |
| "learning_rate": 6.961073856731648e-06, |
| "loss": 0.096, |
| "mean_token_accuracy": 0.9732304513454437, |
| "num_tokens": 1569434.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.278803288936615, |
| "learning_rate": 6.460511422441984e-06, |
| "loss": 0.0969, |
| "mean_token_accuracy": 0.9719431698322296, |
| "num_tokens": 1576927.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.24254080653190613, |
| "learning_rate": 5.978023678460099e-06, |
| "loss": 0.1048, |
| "mean_token_accuracy": 0.9709457159042358, |
| "num_tokens": 1584531.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.21079742908477783, |
| "learning_rate": 5.5137038561761115e-06, |
| "loss": 0.0892, |
| "mean_token_accuracy": 0.9735644161701202, |
| "num_tokens": 1591932.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.25342243909835815, |
| "learning_rate": 5.067641676381918e-06, |
| "loss": 0.0972, |
| "mean_token_accuracy": 0.972582995891571, |
| "num_tokens": 1599678.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.1848929524421692, |
| "learning_rate": 4.639923331934471e-06, |
| "loss": 0.0904, |
| "mean_token_accuracy": 0.97327721118927, |
| "num_tokens": 1607234.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.21844594180583954, |
| "learning_rate": 4.230631471100655e-06, |
| "loss": 0.098, |
| "mean_token_accuracy": 0.9728173017501831, |
| "num_tokens": 1614910.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.29655906558036804, |
| "learning_rate": 3.839845181587098e-06, |
| "loss": 0.1011, |
| "mean_token_accuracy": 0.9714401960372925, |
| "num_tokens": 1622358.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.19944727420806885, |
| "learning_rate": 3.467639975257997e-06, |
| "loss": 0.0913, |
| "mean_token_accuracy": 0.9719055891036987, |
| "num_tokens": 1629753.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.21076829731464386, |
| "learning_rate": 3.1140877735439387e-06, |
| "loss": 0.0894, |
| "mean_token_accuracy": 0.97262904047966, |
| "num_tokens": 1637347.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.2960074245929718, |
| "learning_rate": 2.7792568935444796e-06, |
| "loss": 0.0913, |
| "mean_token_accuracy": 0.9721934199333191, |
| "num_tokens": 1644999.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.185651496052742, |
| "learning_rate": 2.4632120348272003e-06, |
| "loss": 0.0888, |
| "mean_token_accuracy": 0.9723814725875854, |
| "num_tokens": 1652451.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.22099068760871887, |
| "learning_rate": 2.166014266925731e-06, |
| "loss": 0.0892, |
| "mean_token_accuracy": 0.9731795489788055, |
| "num_tokens": 1660101.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.2245907336473465, |
| "learning_rate": 1.88772101753929e-06, |
| "loss": 0.0939, |
| "mean_token_accuracy": 0.9741968810558319, |
| "num_tokens": 1667978.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.2256772518157959, |
| "learning_rate": 1.6283860614358936e-06, |
| "loss": 0.0914, |
| "mean_token_accuracy": 0.9728004634380341, |
| "num_tokens": 1675469.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.19644984602928162, |
| "learning_rate": 1.3880595100613792e-06, |
| "loss": 0.0927, |
| "mean_token_accuracy": 0.9726226031780243, |
| "num_tokens": 1682842.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.22729112207889557, |
| "learning_rate": 1.1667878018564171e-06, |
| "loss": 0.0903, |
| "mean_token_accuracy": 0.9728392660617828, |
| "num_tokens": 1690491.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.21743939816951752, |
| "learning_rate": 9.64613693283123e-07, |
| "loss": 0.0956, |
| "mean_token_accuracy": 0.9711977541446686, |
| "num_tokens": 1697950.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.23131786286830902, |
| "learning_rate": 7.815762505632096e-07, |
| "loss": 0.0908, |
| "mean_token_accuracy": 0.972371518611908, |
| "num_tokens": 1705398.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.19186514616012573, |
| "learning_rate": 6.177108421292266e-07, |
| "loss": 0.0896, |
| "mean_token_accuracy": 0.9753928780555725, |
| "num_tokens": 1712737.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.15185010433197021, |
| "learning_rate": 4.7304913179025965e-07, |
| "loss": 0.0849, |
| "mean_token_accuracy": 0.9748527407646179, |
| "num_tokens": 1720472.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.1807604730129242, |
| "learning_rate": 3.4761907261356976e-07, |
| "loss": 0.0887, |
| "mean_token_accuracy": 0.9729354083538055, |
| "num_tokens": 1727956.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.23020492494106293, |
| "learning_rate": 2.414449015231357e-07, |
| "loss": 0.0956, |
| "mean_token_accuracy": 0.9716013371944427, |
| "num_tokens": 1735520.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.3724834620952606, |
| "learning_rate": 1.545471346164007e-07, |
| "loss": 0.1087, |
| "mean_token_accuracy": 0.9690882861614227, |
| "num_tokens": 1743213.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.3106917142868042, |
| "learning_rate": 8.694256319987659e-08, |
| "loss": 0.0969, |
| "mean_token_accuracy": 0.9719716310501099, |
| "num_tokens": 1750982.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.19371703267097473, |
| "learning_rate": 3.8644250544594975e-08, |
| "loss": 0.0889, |
| "mean_token_accuracy": 0.972972184419632, |
| "num_tokens": 1758448.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.29524293541908264, |
| "learning_rate": 9.661529361892907e-09, |
| "loss": 0.0987, |
| "mean_token_accuracy": 0.9689370095729828, |
| "num_tokens": 1766023.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "step": 234, |
| "total_flos": 1.0230160156105114e+17, |
| "train_loss": 0.3221458565985036, |
| "train_runtime": 403.0093, |
| "train_samples_per_second": 37.22, |
| "train_steps_per_second": 0.581 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 234, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.0230160156105114e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|