| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 4.942675159235669, |
| "eval_steps": 500, |
| "global_step": 390, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 11.927668571472168, |
| "learning_rate": 0.0, |
| "loss": 3.94, |
| "mean_token_accuracy": 0.4029204398393631, |
| "num_tokens": 11165.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 11.546525001525879, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 3.9572, |
| "mean_token_accuracy": 0.39499808847904205, |
| "num_tokens": 22924.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 8.797052383422852, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 3.857, |
| "mean_token_accuracy": 0.39673660695552826, |
| "num_tokens": 34380.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 7.517773628234863, |
| "learning_rate": 5e-05, |
| "loss": 3.4045, |
| "mean_token_accuracy": 0.4453563541173935, |
| "num_tokens": 46499.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 8.536116600036621, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 3.022, |
| "mean_token_accuracy": 0.4896288365125656, |
| "num_tokens": 58004.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 3.957106828689575, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 2.5071, |
| "mean_token_accuracy": 0.5356468260288239, |
| "num_tokens": 69676.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 2.6128907203674316, |
| "learning_rate": 0.0001, |
| "loss": 2.2479, |
| "mean_token_accuracy": 0.6039679944515228, |
| "num_tokens": 80510.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 1.6600596904754639, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 1.9613, |
| "mean_token_accuracy": 0.6389846205711365, |
| "num_tokens": 92115.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 1.1175001859664917, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 1.828, |
| "mean_token_accuracy": 0.6838500797748566, |
| "num_tokens": 103256.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 2.3084917068481445, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 1.9173, |
| "mean_token_accuracy": 0.6635328233242035, |
| "num_tokens": 115085.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 5.995814323425293, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 1.9407, |
| "mean_token_accuracy": 0.6618090569972992, |
| "num_tokens": 126597.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 2.0090432167053223, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 1.815, |
| "mean_token_accuracy": 0.6675754189491272, |
| "num_tokens": 138225.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 4.294322490692139, |
| "learning_rate": 0.0002, |
| "loss": 1.7763, |
| "mean_token_accuracy": 0.6821876168251038, |
| "num_tokens": 149400.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 1.290095329284668, |
| "learning_rate": 0.0001999965463076377, |
| "loss": 1.7811, |
| "mean_token_accuracy": 0.6758189797401428, |
| "num_tokens": 161043.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 1.1799252033233643, |
| "learning_rate": 0.00019998618546911056, |
| "loss": 1.6578, |
| "mean_token_accuracy": 0.6912119388580322, |
| "num_tokens": 172432.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 1.018792748451233, |
| "learning_rate": 0.00019996891820008164, |
| "loss": 1.7968, |
| "mean_token_accuracy": 0.6723423898220062, |
| "num_tokens": 184203.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 1.8456875085830688, |
| "learning_rate": 0.00019994474569326757, |
| "loss": 1.7761, |
| "mean_token_accuracy": 0.6694794595241547, |
| "num_tokens": 196265.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 1.2281064987182617, |
| "learning_rate": 0.00019991366961835642, |
| "loss": 1.6356, |
| "mean_token_accuracy": 0.699277937412262, |
| "num_tokens": 207637.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 1.1970819234848022, |
| "learning_rate": 0.00019987569212189224, |
| "loss": 1.7103, |
| "mean_token_accuracy": 0.6887260973453522, |
| "num_tokens": 218753.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.4748772084712982, |
| "learning_rate": 0.00019983081582712685, |
| "loss": 1.7107, |
| "mean_token_accuracy": 0.6865908205509186, |
| "num_tokens": 230421.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.6084349751472473, |
| "learning_rate": 0.0001997790438338385, |
| "loss": 1.685, |
| "mean_token_accuracy": 0.6917995810508728, |
| "num_tokens": 241772.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.6356724500656128, |
| "learning_rate": 0.00019972037971811802, |
| "loss": 1.6516, |
| "mean_token_accuracy": 0.6938049793243408, |
| "num_tokens": 252948.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.5958734750747681, |
| "learning_rate": 0.00019965482753212156, |
| "loss": 1.604, |
| "mean_token_accuracy": 0.7011500597000122, |
| "num_tokens": 264329.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.556065022945404, |
| "learning_rate": 0.0001995823918037908, |
| "loss": 1.6563, |
| "mean_token_accuracy": 0.6891041994094849, |
| "num_tokens": 275501.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.4661395251750946, |
| "learning_rate": 0.00019950307753654017, |
| "loss": 1.6723, |
| "mean_token_accuracy": 0.691864550113678, |
| "num_tokens": 286871.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.4898029863834381, |
| "learning_rate": 0.0001994168902089112, |
| "loss": 1.7023, |
| "mean_token_accuracy": 0.6883004903793335, |
| "num_tokens": 298281.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.627682626247406, |
| "learning_rate": 0.00019932383577419432, |
| "loss": 1.6222, |
| "mean_token_accuracy": 0.6978872120380402, |
| "num_tokens": 309610.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.5940748453140259, |
| "learning_rate": 0.00019922392066001722, |
| "loss": 1.5325, |
| "mean_token_accuracy": 0.7118729054927826, |
| "num_tokens": 320475.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.5121145248413086, |
| "learning_rate": 0.0001991171517679013, |
| "loss": 1.6756, |
| "mean_token_accuracy": 0.6806293725967407, |
| "num_tokens": 332574.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.4396442472934723, |
| "learning_rate": 0.00019900353647278466, |
| "loss": 1.6497, |
| "mean_token_accuracy": 0.693237692117691, |
| "num_tokens": 344055.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.4567514657974243, |
| "learning_rate": 0.00019888308262251285, |
| "loss": 1.7773, |
| "mean_token_accuracy": 0.6751766800880432, |
| "num_tokens": 356104.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.5211770534515381, |
| "learning_rate": 0.00019875579853729676, |
| "loss": 1.663, |
| "mean_token_accuracy": 0.6896547377109528, |
| "num_tokens": 367582.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.5280752182006836, |
| "learning_rate": 0.00019862169300913785, |
| "loss": 1.7045, |
| "mean_token_accuracy": 0.6897095143795013, |
| "num_tokens": 378963.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.4466302990913391, |
| "learning_rate": 0.00019848077530122083, |
| "loss": 1.6252, |
| "mean_token_accuracy": 0.6934365034103394, |
| "num_tokens": 390443.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.42075785994529724, |
| "learning_rate": 0.00019833305514727395, |
| "loss": 1.7402, |
| "mean_token_accuracy": 0.6816126108169556, |
| "num_tokens": 402077.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.44698265194892883, |
| "learning_rate": 0.0001981785427508966, |
| "loss": 1.6314, |
| "mean_token_accuracy": 0.7031489312648773, |
| "num_tokens": 413215.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.5105100274085999, |
| "learning_rate": 0.00019801724878485438, |
| "loss": 1.6837, |
| "mean_token_accuracy": 0.6941170394420624, |
| "num_tokens": 424372.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.49002698063850403, |
| "learning_rate": 0.00019784918439034216, |
| "loss": 1.678, |
| "mean_token_accuracy": 0.6886717677116394, |
| "num_tokens": 436262.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.4677882790565491, |
| "learning_rate": 0.00019767436117621413, |
| "loss": 1.6349, |
| "mean_token_accuracy": 0.6940007507801056, |
| "num_tokens": 447409.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.41676995158195496, |
| "learning_rate": 0.00019749279121818235, |
| "loss": 1.6196, |
| "mean_token_accuracy": 0.6940004527568817, |
| "num_tokens": 458986.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.4395844340324402, |
| "learning_rate": 0.00019730448705798239, |
| "loss": 1.5676, |
| "mean_token_accuracy": 0.708065003156662, |
| "num_tokens": 470110.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.4528355598449707, |
| "learning_rate": 0.000197109461702507, |
| "loss": 1.62, |
| "mean_token_accuracy": 0.6976854205131531, |
| "num_tokens": 481475.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.45771703124046326, |
| "learning_rate": 0.0001969077286229078, |
| "loss": 1.6287, |
| "mean_token_accuracy": 0.6974550783634186, |
| "num_tokens": 492753.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.4307943880558014, |
| "learning_rate": 0.00019669930175366472, |
| "loss": 1.6269, |
| "mean_token_accuracy": 0.7005655765533447, |
| "num_tokens": 504069.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.43306100368499756, |
| "learning_rate": 0.00019648419549162348, |
| "loss": 1.6797, |
| "mean_token_accuracy": 0.6910405457019806, |
| "num_tokens": 515873.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.40998607873916626, |
| "learning_rate": 0.0001962624246950012, |
| "loss": 1.6704, |
| "mean_token_accuracy": 0.6908841133117676, |
| "num_tokens": 527285.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.423794150352478, |
| "learning_rate": 0.00019603400468235998, |
| "loss": 1.6225, |
| "mean_token_accuracy": 0.6972988545894623, |
| "num_tokens": 539008.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.4383174479007721, |
| "learning_rate": 0.0001957989512315489, |
| "loss": 1.6959, |
| "mean_token_accuracy": 0.6844666004180908, |
| "num_tokens": 550975.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.426257461309433, |
| "learning_rate": 0.0001955572805786141, |
| "loss": 1.5511, |
| "mean_token_accuracy": 0.7047916054725647, |
| "num_tokens": 562174.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.42514124512672424, |
| "learning_rate": 0.0001953090094166773, |
| "loss": 1.6383, |
| "mean_token_accuracy": 0.6950445175170898, |
| "num_tokens": 573565.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.4026625156402588, |
| "learning_rate": 0.0001950541548947829, |
| "loss": 1.5672, |
| "mean_token_accuracy": 0.706762433052063, |
| "num_tokens": 584655.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.43084436655044556, |
| "learning_rate": 0.0001947927346167132, |
| "loss": 1.5972, |
| "mean_token_accuracy": 0.7003117203712463, |
| "num_tokens": 595966.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.4430312514305115, |
| "learning_rate": 0.00019452476663977248, |
| "loss": 1.654, |
| "mean_token_accuracy": 0.687600314617157, |
| "num_tokens": 607211.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.41114339232444763, |
| "learning_rate": 0.00019425026947353992, |
| "loss": 1.5984, |
| "mean_token_accuracy": 0.7026942670345306, |
| "num_tokens": 618727.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.4260961413383484, |
| "learning_rate": 0.00019396926207859084, |
| "loss": 1.6138, |
| "mean_token_accuracy": 0.6967755258083344, |
| "num_tokens": 630397.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.47998639941215515, |
| "learning_rate": 0.0001936817638651871, |
| "loss": 1.5905, |
| "mean_token_accuracy": 0.7036975026130676, |
| "num_tokens": 641671.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.4328579604625702, |
| "learning_rate": 0.00019338779469193639, |
| "loss": 1.4959, |
| "mean_token_accuracy": 0.7174738645553589, |
| "num_tokens": 652634.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.42225387692451477, |
| "learning_rate": 0.00019308737486442045, |
| "loss": 1.6193, |
| "mean_token_accuracy": 0.6919732391834259, |
| "num_tokens": 664179.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.41233500838279724, |
| "learning_rate": 0.00019278052513379255, |
| "loss": 1.5598, |
| "mean_token_accuracy": 0.7107926309108734, |
| "num_tokens": 675385.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.4194766879081726, |
| "learning_rate": 0.00019246726669534415, |
| "loss": 1.5903, |
| "mean_token_accuracy": 0.7004102170467377, |
| "num_tokens": 686817.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.4025111794471741, |
| "learning_rate": 0.00019214762118704076, |
| "loss": 1.5104, |
| "mean_token_accuracy": 0.7114810347557068, |
| "num_tokens": 697815.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.41542673110961914, |
| "learning_rate": 0.00019182161068802741, |
| "loss": 1.6112, |
| "mean_token_accuracy": 0.6955437958240509, |
| "num_tokens": 709534.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.41509905457496643, |
| "learning_rate": 0.00019148925771710347, |
| "loss": 1.5978, |
| "mean_token_accuracy": 0.7051181793212891, |
| "num_tokens": 720860.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.40592867136001587, |
| "learning_rate": 0.00019115058523116733, |
| "loss": 1.566, |
| "mean_token_accuracy": 0.7047462165355682, |
| "num_tokens": 732087.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.4121105372905731, |
| "learning_rate": 0.0001908056166236305, |
| "loss": 1.602, |
| "mean_token_accuracy": 0.698013037443161, |
| "num_tokens": 743945.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.43075302243232727, |
| "learning_rate": 0.00019045437572280194, |
| "loss": 1.5842, |
| "mean_token_accuracy": 0.704198956489563, |
| "num_tokens": 755005.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.42977190017700195, |
| "learning_rate": 0.0001900968867902419, |
| "loss": 1.5603, |
| "mean_token_accuracy": 0.7032743096351624, |
| "num_tokens": 766318.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.43815624713897705, |
| "learning_rate": 0.00018973317451908642, |
| "loss": 1.5929, |
| "mean_token_accuracy": 0.7039108872413635, |
| "num_tokens": 777726.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.46719834208488464, |
| "learning_rate": 0.00018936326403234125, |
| "loss": 1.5957, |
| "mean_token_accuracy": 0.7035625278949738, |
| "num_tokens": 788880.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.4173584282398224, |
| "learning_rate": 0.0001889871808811469, |
| "loss": 1.5941, |
| "mean_token_accuracy": 0.7020141184329987, |
| "num_tokens": 800546.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.42461779713630676, |
| "learning_rate": 0.00018860495104301345, |
| "loss": 1.5814, |
| "mean_token_accuracy": 0.7005370259284973, |
| "num_tokens": 812189.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.4130838215351105, |
| "learning_rate": 0.00018821660092002641, |
| "loss": 1.6225, |
| "mean_token_accuracy": 0.6930609941482544, |
| "num_tokens": 823885.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.40940752625465393, |
| "learning_rate": 0.00018782215733702286, |
| "loss": 1.5639, |
| "mean_token_accuracy": 0.7046359479427338, |
| "num_tokens": 835303.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.4241730868816376, |
| "learning_rate": 0.00018742164753973855, |
| "loss": 1.5594, |
| "mean_token_accuracy": 0.7004008889198303, |
| "num_tokens": 847069.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.4133743941783905, |
| "learning_rate": 0.00018701509919292613, |
| "loss": 1.5119, |
| "mean_token_accuracy": 0.712060958147049, |
| "num_tokens": 858488.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.4232250452041626, |
| "learning_rate": 0.00018660254037844388, |
| "loss": 1.5155, |
| "mean_token_accuracy": 0.7139077484607697, |
| "num_tokens": 869684.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.4363568127155304, |
| "learning_rate": 0.0001861839995933164, |
| "loss": 1.5544, |
| "mean_token_accuracy": 0.7076265513896942, |
| "num_tokens": 880729.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.4357876181602478, |
| "learning_rate": 0.00018575950574776595, |
| "loss": 1.5327, |
| "mean_token_accuracy": 0.7089995443820953, |
| "num_tokens": 891695.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.4357876181602478, |
| "learning_rate": 0.00018532908816321558, |
| "loss": 1.511, |
| "mean_token_accuracy": 0.7218481302261353, |
| "num_tokens": 897073.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.7058189511299133, |
| "learning_rate": 0.00018489277657026375, |
| "loss": 1.3819, |
| "mean_token_accuracy": 0.7328154742717743, |
| "num_tokens": 908448.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.43703678250312805, |
| "learning_rate": 0.0001844506011066308, |
| "loss": 1.3035, |
| "mean_token_accuracy": 0.7432056665420532, |
| "num_tokens": 919804.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.3936041593551636, |
| "learning_rate": 0.00018400259231507717, |
| "loss": 1.344, |
| "mean_token_accuracy": 0.7374230027198792, |
| "num_tokens": 931397.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.5080980658531189, |
| "learning_rate": 0.00018354878114129367, |
| "loss": 1.4085, |
| "mean_token_accuracy": 0.72797891497612, |
| "num_tokens": 942878.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.5713034272193909, |
| "learning_rate": 0.00018308919893176396, |
| "loss": 1.4078, |
| "mean_token_accuracy": 0.7352543771266937, |
| "num_tokens": 954219.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.4511411488056183, |
| "learning_rate": 0.0001826238774315995, |
| "loss": 1.2804, |
| "mean_token_accuracy": 0.7498015761375427, |
| "num_tokens": 965410.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.4187650680541992, |
| "learning_rate": 0.00018215284878234642, |
| "loss": 1.29, |
| "mean_token_accuracy": 0.7490876317024231, |
| "num_tokens": 976694.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.4384659230709076, |
| "learning_rate": 0.00018167614551976567, |
| "loss": 1.3881, |
| "mean_token_accuracy": 0.7267170548439026, |
| "num_tokens": 988106.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.4444275498390198, |
| "learning_rate": 0.00018119380057158568, |
| "loss": 1.4328, |
| "mean_token_accuracy": 0.7284035384654999, |
| "num_tokens": 999816.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.45921292901039124, |
| "learning_rate": 0.00018070584725522762, |
| "loss": 1.2876, |
| "mean_token_accuracy": 0.7462576627731323, |
| "num_tokens": 1011401.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.4768648147583008, |
| "learning_rate": 0.0001802123192755044, |
| "loss": 1.3651, |
| "mean_token_accuracy": 0.7335284352302551, |
| "num_tokens": 1022628.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.5426104068756104, |
| "learning_rate": 0.00017971325072229226, |
| "loss": 1.3414, |
| "mean_token_accuracy": 0.7375869750976562, |
| "num_tokens": 1034112.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.4837786853313446, |
| "learning_rate": 0.00017920867606817625, |
| "loss": 1.3065, |
| "mean_token_accuracy": 0.7411251068115234, |
| "num_tokens": 1045699.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.5525464415550232, |
| "learning_rate": 0.0001786986301660689, |
| "loss": 1.2697, |
| "mean_token_accuracy": 0.7516984343528748, |
| "num_tokens": 1057016.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.5046163201332092, |
| "learning_rate": 0.000178183148246803, |
| "loss": 1.3359, |
| "mean_token_accuracy": 0.7414124608039856, |
| "num_tokens": 1068767.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.49643421173095703, |
| "learning_rate": 0.00017766226591669785, |
| "loss": 1.3022, |
| "mean_token_accuracy": 0.7424289584159851, |
| "num_tokens": 1080338.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.4751627743244171, |
| "learning_rate": 0.0001771360191551, |
| "loss": 1.2796, |
| "mean_token_accuracy": 0.7520297765731812, |
| "num_tokens": 1091596.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.48828235268592834, |
| "learning_rate": 0.0001766044443118978, |
| "loss": 1.3714, |
| "mean_token_accuracy": 0.7391779124736786, |
| "num_tokens": 1103173.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.5226894617080688, |
| "learning_rate": 0.00017606757810501088, |
| "loss": 1.349, |
| "mean_token_accuracy": 0.7393156886100769, |
| "num_tokens": 1114890.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.5849791169166565, |
| "learning_rate": 0.0001755254576178535, |
| "loss": 1.2692, |
| "mean_token_accuracy": 0.7468427419662476, |
| "num_tokens": 1126503.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.5286082625389099, |
| "learning_rate": 0.00017497812029677344, |
| "loss": 1.3354, |
| "mean_token_accuracy": 0.7440425157546997, |
| "num_tokens": 1138075.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.5340179800987244, |
| "learning_rate": 0.00017442560394846516, |
| "loss": 1.3362, |
| "mean_token_accuracy": 0.7400276064872742, |
| "num_tokens": 1149604.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.5466039180755615, |
| "learning_rate": 0.0001738679467373586, |
| "loss": 1.3977, |
| "mean_token_accuracy": 0.7267497181892395, |
| "num_tokens": 1161198.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.49215564131736755, |
| "learning_rate": 0.00017330518718298264, |
| "loss": 1.3782, |
| "mean_token_accuracy": 0.7327314019203186, |
| "num_tokens": 1172445.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.49711376428604126, |
| "learning_rate": 0.00017273736415730488, |
| "loss": 1.1644, |
| "mean_token_accuracy": 0.7657121419906616, |
| "num_tokens": 1183328.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.5252436995506287, |
| "learning_rate": 0.0001721645168820462, |
| "loss": 1.3197, |
| "mean_token_accuracy": 0.74147829413414, |
| "num_tokens": 1194762.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.4682621359825134, |
| "learning_rate": 0.00017158668492597186, |
| "loss": 1.2746, |
| "mean_token_accuracy": 0.7538455724716187, |
| "num_tokens": 1206185.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.5762368440628052, |
| "learning_rate": 0.00017100390820215804, |
| "loss": 1.343, |
| "mean_token_accuracy": 0.738945722579956, |
| "num_tokens": 1217884.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.5941218137741089, |
| "learning_rate": 0.00017041622696523518, |
| "loss": 1.3016, |
| "mean_token_accuracy": 0.7432995140552521, |
| "num_tokens": 1229627.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.560783326625824, |
| "learning_rate": 0.00016982368180860728, |
| "loss": 1.276, |
| "mean_token_accuracy": 0.7532786428928375, |
| "num_tokens": 1240446.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.5108466744422913, |
| "learning_rate": 0.00016922631366164797, |
| "loss": 1.2346, |
| "mean_token_accuracy": 0.7562114298343658, |
| "num_tokens": 1251736.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.5147649049758911, |
| "learning_rate": 0.0001686241637868734, |
| "loss": 1.3012, |
| "mean_token_accuracy": 0.7439581155776978, |
| "num_tokens": 1263064.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.5320042967796326, |
| "learning_rate": 0.00016801727377709194, |
| "loss": 1.3648, |
| "mean_token_accuracy": 0.7372605800628662, |
| "num_tokens": 1274626.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.5413700342178345, |
| "learning_rate": 0.00016740568555253155, |
| "loss": 1.3992, |
| "mean_token_accuracy": 0.732212245464325, |
| "num_tokens": 1286160.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.557081401348114, |
| "learning_rate": 0.00016678944135794374, |
| "loss": 1.2657, |
| "mean_token_accuracy": 0.7479846477508545, |
| "num_tokens": 1297753.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.5675191283226013, |
| "learning_rate": 0.00016616858375968595, |
| "loss": 1.3236, |
| "mean_token_accuracy": 0.742518424987793, |
| "num_tokens": 1309224.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.5020204782485962, |
| "learning_rate": 0.000165543155642781, |
| "loss": 1.2995, |
| "mean_token_accuracy": 0.7413056790828705, |
| "num_tokens": 1320675.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.5299273133277893, |
| "learning_rate": 0.0001649132002079552, |
| "loss": 1.2335, |
| "mean_token_accuracy": 0.7618575990200043, |
| "num_tokens": 1332170.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.5424625873565674, |
| "learning_rate": 0.00016427876096865394, |
| "loss": 1.3476, |
| "mean_token_accuracy": 0.7395524382591248, |
| "num_tokens": 1343771.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.5220779180526733, |
| "learning_rate": 0.00016363988174803638, |
| "loss": 1.3493, |
| "mean_token_accuracy": 0.7352395057678223, |
| "num_tokens": 1355513.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.5388994812965393, |
| "learning_rate": 0.00016299660667594814, |
| "loss": 1.3686, |
| "mean_token_accuracy": 0.7347927093505859, |
| "num_tokens": 1367049.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.5220484137535095, |
| "learning_rate": 0.00016234898018587337, |
| "loss": 1.27, |
| "mean_token_accuracy": 0.7542202472686768, |
| "num_tokens": 1378847.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.553205132484436, |
| "learning_rate": 0.00016169704701186527, |
| "loss": 1.2828, |
| "mean_token_accuracy": 0.75074902176857, |
| "num_tokens": 1389763.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.5726351141929626, |
| "learning_rate": 0.00016104085218545633, |
| "loss": 1.2323, |
| "mean_token_accuracy": 0.7563920617103577, |
| "num_tokens": 1401158.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.5743599534034729, |
| "learning_rate": 0.00016038044103254775, |
| "loss": 1.248, |
| "mean_token_accuracy": 0.7553873062133789, |
| "num_tokens": 1412660.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.6019836664199829, |
| "learning_rate": 0.00015971585917027862, |
| "loss": 1.2215, |
| "mean_token_accuracy": 0.7611487507820129, |
| "num_tokens": 1424264.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.5834748148918152, |
| "learning_rate": 0.00015904715250387498, |
| "loss": 1.3446, |
| "mean_token_accuracy": 0.7405554950237274, |
| "num_tokens": 1435491.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.5433663725852966, |
| "learning_rate": 0.000158374367223479, |
| "loss": 1.261, |
| "mean_token_accuracy": 0.7504373490810394, |
| "num_tokens": 1446732.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.5282524824142456, |
| "learning_rate": 0.0001576975498009583, |
| "loss": 1.3273, |
| "mean_token_accuracy": 0.7386387884616852, |
| "num_tokens": 1458906.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.6508763432502747, |
| "learning_rate": 0.0001570167469866962, |
| "loss": 1.2123, |
| "mean_token_accuracy": 0.7605562210083008, |
| "num_tokens": 1469994.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.5391885638237, |
| "learning_rate": 0.0001563320058063622, |
| "loss": 1.1396, |
| "mean_token_accuracy": 0.7745244204998016, |
| "num_tokens": 1480937.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.5844919085502625, |
| "learning_rate": 0.00015564337355766412, |
| "loss": 1.2875, |
| "mean_token_accuracy": 0.7473530173301697, |
| "num_tokens": 1492634.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.7106832265853882, |
| "learning_rate": 0.0001549508978070806, |
| "loss": 1.2713, |
| "mean_token_accuracy": 0.7540490329265594, |
| "num_tokens": 1503864.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.6007422804832458, |
| "learning_rate": 0.00015425462638657595, |
| "loss": 1.234, |
| "mean_token_accuracy": 0.7583559155464172, |
| "num_tokens": 1515227.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.5394821763038635, |
| "learning_rate": 0.00015355460739029586, |
| "loss": 1.2763, |
| "mean_token_accuracy": 0.7525887191295624, |
| "num_tokens": 1526325.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.5472612380981445, |
| "learning_rate": 0.00015285088917124556, |
| "loss": 1.2394, |
| "mean_token_accuracy": 0.7530220746994019, |
| "num_tokens": 1538100.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.5598124265670776, |
| "learning_rate": 0.0001521435203379498, |
| "loss": 1.2431, |
| "mean_token_accuracy": 0.7546306550502777, |
| "num_tokens": 1549283.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.5618515610694885, |
| "learning_rate": 0.00015143254975109538, |
| "loss": 1.2521, |
| "mean_token_accuracy": 0.7504317760467529, |
| "num_tokens": 1560870.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.628064751625061, |
| "learning_rate": 0.0001507180265201559, |
| "loss": 1.235, |
| "mean_token_accuracy": 0.7568688988685608, |
| "num_tokens": 1572135.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.6592928171157837, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 1.241, |
| "mean_token_accuracy": 0.757856547832489, |
| "num_tokens": 1583354.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.590002179145813, |
| "learning_rate": 0.00014927851978748178, |
| "loss": 1.1664, |
| "mean_token_accuracy": 0.7673115134239197, |
| "num_tokens": 1594573.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.5977404117584229, |
| "learning_rate": 0.00014855363571801523, |
| "loss": 1.2367, |
| "mean_token_accuracy": 0.7607390582561493, |
| "num_tokens": 1606088.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.5965246558189392, |
| "learning_rate": 0.00014782539786213183, |
| "loss": 1.2311, |
| "mean_token_accuracy": 0.7584077715873718, |
| "num_tokens": 1617494.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.6000455021858215, |
| "learning_rate": 0.00014709385652202203, |
| "loss": 1.2735, |
| "mean_token_accuracy": 0.7472036778926849, |
| "num_tokens": 1629090.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.5743783116340637, |
| "learning_rate": 0.00014635906222806058, |
| "loss": 1.3982, |
| "mean_token_accuracy": 0.7301271557807922, |
| "num_tokens": 1641022.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.5715049505233765, |
| "learning_rate": 0.0001456210657353163, |
| "loss": 1.2934, |
| "mean_token_accuracy": 0.7475639283657074, |
| "num_tokens": 1652480.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.5563356280326843, |
| "learning_rate": 0.00014487991802004623, |
| "loss": 1.366, |
| "mean_token_accuracy": 0.7382784187793732, |
| "num_tokens": 1664089.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.559946596622467, |
| "learning_rate": 0.0001441356702761744, |
| "loss": 1.2647, |
| "mean_token_accuracy": 0.7521970272064209, |
| "num_tokens": 1675743.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.577804446220398, |
| "learning_rate": 0.00014338837391175582, |
| "loss": 1.2639, |
| "mean_token_accuracy": 0.7574202716350555, |
| "num_tokens": 1686909.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.5892558097839355, |
| "learning_rate": 0.0001426380805454254, |
| "loss": 1.2246, |
| "mean_token_accuracy": 0.7640581727027893, |
| "num_tokens": 1698422.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.6493586897850037, |
| "learning_rate": 0.0001418848420028325, |
| "loss": 1.2171, |
| "mean_token_accuracy": 0.7571829855442047, |
| "num_tokens": 1709941.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.5959882736206055, |
| "learning_rate": 0.00014112871031306119, |
| "loss": 1.206, |
| "mean_token_accuracy": 0.7620928287506104, |
| "num_tokens": 1721542.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.5942161083221436, |
| "learning_rate": 0.00014036973770503624, |
| "loss": 1.1675, |
| "mean_token_accuracy": 0.7734838724136353, |
| "num_tokens": 1732791.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.5867611169815063, |
| "learning_rate": 0.0001396079766039157, |
| "loss": 1.2261, |
| "mean_token_accuracy": 0.7544828951358795, |
| "num_tokens": 1743896.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.5893647074699402, |
| "learning_rate": 0.00013884347962746948, |
| "loss": 1.305, |
| "mean_token_accuracy": 0.7446670830249786, |
| "num_tokens": 1755279.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.6163603067398071, |
| "learning_rate": 0.00013807629958244498, |
| "loss": 1.2738, |
| "mean_token_accuracy": 0.7518047988414764, |
| "num_tokens": 1766674.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.5853977799415588, |
| "learning_rate": 0.0001373064894609194, |
| "loss": 1.1963, |
| "mean_token_accuracy": 0.7708700001239777, |
| "num_tokens": 1777748.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.5478814244270325, |
| "learning_rate": 0.00013653410243663952, |
| "loss": 1.1939, |
| "mean_token_accuracy": 0.7640825510025024, |
| "num_tokens": 1788830.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.8762192130088806, |
| "learning_rate": 0.0001357591918613486, |
| "loss": 1.008, |
| "mean_token_accuracy": 0.795324981212616, |
| "num_tokens": 1794124.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.6148726940155029, |
| "learning_rate": 0.0001349818112611015, |
| "loss": 0.8962, |
| "mean_token_accuracy": 0.8148521482944489, |
| "num_tokens": 1805636.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 1.515809416770935, |
| "learning_rate": 0.00013420201433256689, |
| "loss": 0.9681, |
| "mean_token_accuracy": 0.7990589141845703, |
| "num_tokens": 1817299.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.7491560578346252, |
| "learning_rate": 0.00013341985493931877, |
| "loss": 0.8922, |
| "mean_token_accuracy": 0.815070241689682, |
| "num_tokens": 1828936.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.6307762861251831, |
| "learning_rate": 0.0001326353871081156, |
| "loss": 0.8704, |
| "mean_token_accuracy": 0.818681925535202, |
| "num_tokens": 1840132.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.627448320388794, |
| "learning_rate": 0.00013184866502516845, |
| "loss": 0.8727, |
| "mean_token_accuracy": 0.8210729658603668, |
| "num_tokens": 1851489.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.6649007797241211, |
| "learning_rate": 0.00013105974303239838, |
| "loss": 0.8367, |
| "mean_token_accuracy": 0.8308760523796082, |
| "num_tokens": 1862876.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.7197876572608948, |
| "learning_rate": 0.0001302686756236826, |
| "loss": 0.7737, |
| "mean_token_accuracy": 0.8400779962539673, |
| "num_tokens": 1874177.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.7220533490180969, |
| "learning_rate": 0.00012947551744109043, |
| "loss": 0.8546, |
| "mean_token_accuracy": 0.822653740644455, |
| "num_tokens": 1885524.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.7428185343742371, |
| "learning_rate": 0.00012868032327110904, |
| "loss": 0.8556, |
| "mean_token_accuracy": 0.8203161954879761, |
| "num_tokens": 1897169.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.6323121190071106, |
| "learning_rate": 0.00012788314804085903, |
| "loss": 0.7231, |
| "mean_token_accuracy": 0.8477356731891632, |
| "num_tokens": 1908703.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.7001054286956787, |
| "learning_rate": 0.00012708404681430053, |
| "loss": 0.8976, |
| "mean_token_accuracy": 0.8160674273967743, |
| "num_tokens": 1919695.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.6420326232910156, |
| "learning_rate": 0.00012628307478842953, |
| "loss": 0.8451, |
| "mean_token_accuracy": 0.8224026262760162, |
| "num_tokens": 1930961.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.7011420130729675, |
| "learning_rate": 0.0001254802872894655, |
| "loss": 0.8627, |
| "mean_token_accuracy": 0.8202202320098877, |
| "num_tokens": 1942462.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.6822834610939026, |
| "learning_rate": 0.00012467573976902935, |
| "loss": 0.7987, |
| "mean_token_accuracy": 0.8363339900970459, |
| "num_tokens": 1953848.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.7396888732910156, |
| "learning_rate": 0.0001238694878003138, |
| "loss": 0.8632, |
| "mean_token_accuracy": 0.8247162401676178, |
| "num_tokens": 1965634.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.6941153407096863, |
| "learning_rate": 0.00012306158707424403, |
| "loss": 0.8203, |
| "mean_token_accuracy": 0.8318359553813934, |
| "num_tokens": 1977633.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.7376344203948975, |
| "learning_rate": 0.00012225209339563145, |
| "loss": 0.8813, |
| "mean_token_accuracy": 0.816738098859787, |
| "num_tokens": 1989375.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.6955387592315674, |
| "learning_rate": 0.00012144106267931876, |
| "loss": 0.8062, |
| "mean_token_accuracy": 0.8336440622806549, |
| "num_tokens": 2000350.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.6509573459625244, |
| "learning_rate": 0.00012062855094631778, |
| "loss": 0.7839, |
| "mean_token_accuracy": 0.8355735242366791, |
| "num_tokens": 2011821.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.7110678553581238, |
| "learning_rate": 0.00011981461431993977, |
| "loss": 0.8643, |
| "mean_token_accuracy": 0.8200065493583679, |
| "num_tokens": 2023398.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.7298818230628967, |
| "learning_rate": 0.00011899930902191902, |
| "loss": 0.8742, |
| "mean_token_accuracy": 0.821577250957489, |
| "num_tokens": 2035102.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.6927684545516968, |
| "learning_rate": 0.00011818269136852909, |
| "loss": 0.8681, |
| "mean_token_accuracy": 0.8210790157318115, |
| "num_tokens": 2046897.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.6942738890647888, |
| "learning_rate": 0.00011736481776669306, |
| "loss": 0.7765, |
| "mean_token_accuracy": 0.8394728899002075, |
| "num_tokens": 2057980.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.6812620162963867, |
| "learning_rate": 0.00011654574471008713, |
| "loss": 0.8486, |
| "mean_token_accuracy": 0.8229053914546967, |
| "num_tokens": 2069683.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.7021245360374451, |
| "learning_rate": 0.00011572552877523854, |
| "loss": 0.8407, |
| "mean_token_accuracy": 0.823371946811676, |
| "num_tokens": 2081025.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.6945245265960693, |
| "learning_rate": 0.00011490422661761744, |
| "loss": 0.7698, |
| "mean_token_accuracy": 0.8421520590782166, |
| "num_tokens": 2092607.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.7140945196151733, |
| "learning_rate": 0.00011408189496772368, |
| "loss": 0.7344, |
| "mean_token_accuracy": 0.8482842147350311, |
| "num_tokens": 2103628.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.8129433989524841, |
| "learning_rate": 0.00011325859062716795, |
| "loss": 0.8266, |
| "mean_token_accuracy": 0.8301917314529419, |
| "num_tokens": 2114651.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.790624737739563, |
| "learning_rate": 0.00011243437046474853, |
| "loss": 0.8995, |
| "mean_token_accuracy": 0.8124870359897614, |
| "num_tokens": 2126430.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.6942800283432007, |
| "learning_rate": 0.00011160929141252303, |
| "loss": 0.8086, |
| "mean_token_accuracy": 0.8364989161491394, |
| "num_tokens": 2137274.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.7138471603393555, |
| "learning_rate": 0.00011078341046187589, |
| "loss": 0.8914, |
| "mean_token_accuracy": 0.8123456239700317, |
| "num_tokens": 2148697.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.684965193271637, |
| "learning_rate": 0.00010995678465958168, |
| "loss": 0.8619, |
| "mean_token_accuracy": 0.8225953578948975, |
| "num_tokens": 2160613.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.7347207069396973, |
| "learning_rate": 0.00010912947110386484, |
| "loss": 0.8156, |
| "mean_token_accuracy": 0.8292295336723328, |
| "num_tokens": 2172303.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.7004370093345642, |
| "learning_rate": 0.00010830152694045552, |
| "loss": 0.8175, |
| "mean_token_accuracy": 0.8329605758190155, |
| "num_tokens": 2183712.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.842786967754364, |
| "learning_rate": 0.00010747300935864243, |
| "loss": 0.8424, |
| "mean_token_accuracy": 0.82681804895401, |
| "num_tokens": 2195201.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.7165960073471069, |
| "learning_rate": 0.00010664397558732244, |
| "loss": 0.7305, |
| "mean_token_accuracy": 0.8466060161590576, |
| "num_tokens": 2206348.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.7170045375823975, |
| "learning_rate": 0.00010581448289104758, |
| "loss": 0.8841, |
| "mean_token_accuracy": 0.817249596118927, |
| "num_tokens": 2218307.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.6497987508773804, |
| "learning_rate": 0.00010498458856606972, |
| "loss": 0.7677, |
| "mean_token_accuracy": 0.8430719673633575, |
| "num_tokens": 2229766.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.6531058549880981, |
| "learning_rate": 0.00010415434993638269, |
| "loss": 0.7116, |
| "mean_token_accuracy": 0.8531897962093353, |
| "num_tokens": 2240599.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.6574857831001282, |
| "learning_rate": 0.00010332382434976266, |
| "loss": 0.7306, |
| "mean_token_accuracy": 0.8475680351257324, |
| "num_tokens": 2252398.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.7400979995727539, |
| "learning_rate": 0.0001024930691738073, |
| "loss": 0.7793, |
| "mean_token_accuracy": 0.840068131685257, |
| "num_tokens": 2264039.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.7397539019584656, |
| "learning_rate": 0.00010166214179197264, |
| "loss": 0.8102, |
| "mean_token_accuracy": 0.8325523436069489, |
| "num_tokens": 2275605.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.8763604164123535, |
| "learning_rate": 0.00010083109959960973, |
| "loss": 0.8838, |
| "mean_token_accuracy": 0.8195656836032867, |
| "num_tokens": 2287149.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.7435045838356018, |
| "learning_rate": 0.0001, |
| "loss": 0.8099, |
| "mean_token_accuracy": 0.834762305021286, |
| "num_tokens": 2298149.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.7856142520904541, |
| "learning_rate": 9.916890040039031e-05, |
| "loss": 0.8285, |
| "mean_token_accuracy": 0.8306257724761963, |
| "num_tokens": 2309730.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.6982733607292175, |
| "learning_rate": 9.833785820802739e-05, |
| "loss": 0.7267, |
| "mean_token_accuracy": 0.846727728843689, |
| "num_tokens": 2320654.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.6996532082557678, |
| "learning_rate": 9.750693082619273e-05, |
| "loss": 0.755, |
| "mean_token_accuracy": 0.843133270740509, |
| "num_tokens": 2332220.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.7252086997032166, |
| "learning_rate": 9.667617565023735e-05, |
| "loss": 0.7711, |
| "mean_token_accuracy": 0.8427746593952179, |
| "num_tokens": 2343588.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.8143007159233093, |
| "learning_rate": 9.584565006361734e-05, |
| "loss": 0.8082, |
| "mean_token_accuracy": 0.8367211222648621, |
| "num_tokens": 2355041.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.8434510231018066, |
| "learning_rate": 9.501541143393028e-05, |
| "loss": 0.8303, |
| "mean_token_accuracy": 0.824932187795639, |
| "num_tokens": 2366049.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.7303879857063293, |
| "learning_rate": 9.418551710895243e-05, |
| "loss": 0.802, |
| "mean_token_accuracy": 0.8343527615070343, |
| "num_tokens": 2377894.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.685028076171875, |
| "learning_rate": 9.335602441267759e-05, |
| "loss": 0.7587, |
| "mean_token_accuracy": 0.8418575525283813, |
| "num_tokens": 2389701.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.7157097458839417, |
| "learning_rate": 9.252699064135758e-05, |
| "loss": 0.7537, |
| "mean_token_accuracy": 0.8456466197967529, |
| "num_tokens": 2400854.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.7124730944633484, |
| "learning_rate": 9.169847305954447e-05, |
| "loss": 0.8539, |
| "mean_token_accuracy": 0.8244422972202301, |
| "num_tokens": 2412586.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.6919587254524231, |
| "learning_rate": 9.087052889613518e-05, |
| "loss": 0.7594, |
| "mean_token_accuracy": 0.8418782651424408, |
| "num_tokens": 2423882.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.740878164768219, |
| "learning_rate": 9.004321534041835e-05, |
| "loss": 0.6822, |
| "mean_token_accuracy": 0.8537989258766174, |
| "num_tokens": 2434645.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.7817885875701904, |
| "learning_rate": 8.921658953812415e-05, |
| "loss": 0.7664, |
| "mean_token_accuracy": 0.8422251641750336, |
| "num_tokens": 2445879.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.802693247795105, |
| "learning_rate": 8.839070858747697e-05, |
| "loss": 0.7031, |
| "mean_token_accuracy": 0.8553369045257568, |
| "num_tokens": 2457114.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.7690209150314331, |
| "learning_rate": 8.756562953525152e-05, |
| "loss": 0.7587, |
| "mean_token_accuracy": 0.8424797356128693, |
| "num_tokens": 2468624.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.7805998921394348, |
| "learning_rate": 8.674140937283208e-05, |
| "loss": 0.7921, |
| "mean_token_accuracy": 0.8381544649600983, |
| "num_tokens": 2479981.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.6912605166435242, |
| "learning_rate": 8.591810503227635e-05, |
| "loss": 0.6652, |
| "mean_token_accuracy": 0.861592561006546, |
| "num_tokens": 2491405.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.7387929558753967, |
| "learning_rate": 8.509577338238255e-05, |
| "loss": 0.8042, |
| "mean_token_accuracy": 0.8338701725006104, |
| "num_tokens": 2502813.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.7098203301429749, |
| "learning_rate": 8.427447122476148e-05, |
| "loss": 0.7327, |
| "mean_token_accuracy": 0.8484758734703064, |
| "num_tokens": 2514190.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.7439514994621277, |
| "learning_rate": 8.345425528991288e-05, |
| "loss": 0.6598, |
| "mean_token_accuracy": 0.860679030418396, |
| "num_tokens": 2525108.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.7285000681877136, |
| "learning_rate": 8.263518223330697e-05, |
| "loss": 0.7639, |
| "mean_token_accuracy": 0.842808336019516, |
| "num_tokens": 2536505.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.7520717978477478, |
| "learning_rate": 8.181730863147093e-05, |
| "loss": 0.796, |
| "mean_token_accuracy": 0.8394459187984467, |
| "num_tokens": 2548300.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.7541860342025757, |
| "learning_rate": 8.100069097808103e-05, |
| "loss": 0.788, |
| "mean_token_accuracy": 0.8363643884658813, |
| "num_tokens": 2559823.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.7908371090888977, |
| "learning_rate": 8.018538568006027e-05, |
| "loss": 0.7885, |
| "mean_token_accuracy": 0.8349603712558746, |
| "num_tokens": 2571347.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.7263608574867249, |
| "learning_rate": 7.937144905368226e-05, |
| "loss": 0.7057, |
| "mean_token_accuracy": 0.8521650433540344, |
| "num_tokens": 2582905.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.7562076449394226, |
| "learning_rate": 7.855893732068125e-05, |
| "loss": 0.8208, |
| "mean_token_accuracy": 0.8311346769332886, |
| "num_tokens": 2594285.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.7348179221153259, |
| "learning_rate": 7.774790660436858e-05, |
| "loss": 0.7344, |
| "mean_token_accuracy": 0.8490732312202454, |
| "num_tokens": 2605746.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.7636176943778992, |
| "learning_rate": 7.693841292575598e-05, |
| "loss": 0.8584, |
| "mean_token_accuracy": 0.8263067901134491, |
| "num_tokens": 2617280.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.7639762759208679, |
| "learning_rate": 7.613051219968623e-05, |
| "loss": 0.7856, |
| "mean_token_accuracy": 0.8378620445728302, |
| "num_tokens": 2629030.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.7438153028488159, |
| "learning_rate": 7.532426023097063e-05, |
| "loss": 0.7406, |
| "mean_token_accuracy": 0.8455101847648621, |
| "num_tokens": 2640001.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.7770811915397644, |
| "learning_rate": 7.451971271053455e-05, |
| "loss": 0.8496, |
| "mean_token_accuracy": 0.8213350176811218, |
| "num_tokens": 2651498.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.7544724345207214, |
| "learning_rate": 7.371692521157048e-05, |
| "loss": 0.7548, |
| "mean_token_accuracy": 0.8470020294189453, |
| "num_tokens": 2662618.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.980891719745223, |
| "grad_norm": 0.7707628011703491, |
| "learning_rate": 7.291595318569951e-05, |
| "loss": 0.794, |
| "mean_token_accuracy": 0.8322769701480865, |
| "num_tokens": 2674269.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9936305732484074, |
| "grad_norm": 0.8508571982383728, |
| "learning_rate": 7.211685195914097e-05, |
| "loss": 0.7893, |
| "mean_token_accuracy": 0.8407465815544128, |
| "num_tokens": 2685723.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.8508571982383728, |
| "learning_rate": 7.131967672889101e-05, |
| "loss": 0.5708, |
| "mean_token_accuracy": 0.8794448971748352, |
| "num_tokens": 2691520.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0127388535031847, |
| "grad_norm": 1.1057546138763428, |
| "learning_rate": 7.052448255890957e-05, |
| "loss": 0.4499, |
| "mean_token_accuracy": 0.9071509540081024, |
| "num_tokens": 2702735.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0254777070063694, |
| "grad_norm": 0.6588014960289001, |
| "learning_rate": 6.973132437631742e-05, |
| "loss": 0.4431, |
| "mean_token_accuracy": 0.9075900018215179, |
| "num_tokens": 2714184.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.038216560509554, |
| "grad_norm": 0.6847231388092041, |
| "learning_rate": 6.894025696760163e-05, |
| "loss": 0.414, |
| "mean_token_accuracy": 0.911798506975174, |
| "num_tokens": 2726186.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050955414012739, |
| "grad_norm": 0.7595067620277405, |
| "learning_rate": 6.815133497483157e-05, |
| "loss": 0.4353, |
| "mean_token_accuracy": 0.9072951972484589, |
| "num_tokens": 2737492.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0636942675159236, |
| "grad_norm": 0.9101142883300781, |
| "learning_rate": 6.736461289188445e-05, |
| "loss": 0.486, |
| "mean_token_accuracy": 0.8956897854804993, |
| "num_tokens": 2749284.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0764331210191083, |
| "grad_norm": 1.0063393115997314, |
| "learning_rate": 6.658014506068126e-05, |
| "loss": 0.4754, |
| "mean_token_accuracy": 0.9023579955101013, |
| "num_tokens": 2760625.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.089171974522293, |
| "grad_norm": 0.7680675387382507, |
| "learning_rate": 6.579798566743314e-05, |
| "loss": 0.491, |
| "mean_token_accuracy": 0.8949213922023773, |
| "num_tokens": 2772261.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1019108280254777, |
| "grad_norm": 0.6828211545944214, |
| "learning_rate": 6.501818873889855e-05, |
| "loss": 0.4538, |
| "mean_token_accuracy": 0.9027508199214935, |
| "num_tokens": 2783770.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1146496815286624, |
| "grad_norm": 0.7493994832038879, |
| "learning_rate": 6.424080813865138e-05, |
| "loss": 0.4336, |
| "mean_token_accuracy": 0.9114145934581757, |
| "num_tokens": 2794903.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.127388535031847, |
| "grad_norm": 0.6365121603012085, |
| "learning_rate": 6.34658975633605e-05, |
| "loss": 0.4023, |
| "mean_token_accuracy": 0.9125161468982697, |
| "num_tokens": 2806179.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.140127388535032, |
| "grad_norm": 0.6832964420318604, |
| "learning_rate": 6.269351053908061e-05, |
| "loss": 0.4003, |
| "mean_token_accuracy": 0.9133158922195435, |
| "num_tokens": 2817415.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.1528662420382165, |
| "grad_norm": 0.6966664791107178, |
| "learning_rate": 6.192370041755505e-05, |
| "loss": 0.3681, |
| "mean_token_accuracy": 0.9190676212310791, |
| "num_tokens": 2828929.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1656050955414012, |
| "grad_norm": 0.7440553903579712, |
| "learning_rate": 6.115652037253053e-05, |
| "loss": 0.4212, |
| "mean_token_accuracy": 0.9078826904296875, |
| "num_tokens": 2840532.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.178343949044586, |
| "grad_norm": 0.805282473564148, |
| "learning_rate": 6.039202339608432e-05, |
| "loss": 0.393, |
| "mean_token_accuracy": 0.9137612283229828, |
| "num_tokens": 2852314.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.1910828025477707, |
| "grad_norm": 0.8093756437301636, |
| "learning_rate": 5.963026229496378e-05, |
| "loss": 0.47, |
| "mean_token_accuracy": 0.8994007706642151, |
| "num_tokens": 2863849.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2038216560509554, |
| "grad_norm": 0.8103389143943787, |
| "learning_rate": 5.887128968693887e-05, |
| "loss": 0.3956, |
| "mean_token_accuracy": 0.9146359264850616, |
| "num_tokens": 2874972.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.21656050955414, |
| "grad_norm": 0.7377609014511108, |
| "learning_rate": 5.8115157997167536e-05, |
| "loss": 0.4458, |
| "mean_token_accuracy": 0.9041499197483063, |
| "num_tokens": 2886716.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.229299363057325, |
| "grad_norm": 0.7186458110809326, |
| "learning_rate": 5.736191945457463e-05, |
| "loss": 0.4116, |
| "mean_token_accuracy": 0.9132950901985168, |
| "num_tokens": 2897985.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.2420382165605095, |
| "grad_norm": 0.6944336295127869, |
| "learning_rate": 5.6611626088244194e-05, |
| "loss": 0.4971, |
| "mean_token_accuracy": 0.8925972282886505, |
| "num_tokens": 2909541.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.254777070063694, |
| "grad_norm": 0.773350715637207, |
| "learning_rate": 5.58643297238256e-05, |
| "loss": 0.4191, |
| "mean_token_accuracy": 0.909559965133667, |
| "num_tokens": 2920862.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.267515923566879, |
| "grad_norm": 0.6871331930160522, |
| "learning_rate": 5.5120081979953785e-05, |
| "loss": 0.41, |
| "mean_token_accuracy": 0.9117248952388763, |
| "num_tokens": 2931948.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.2802547770700636, |
| "grad_norm": 0.7305521965026855, |
| "learning_rate": 5.43789342646837e-05, |
| "loss": 0.4134, |
| "mean_token_accuracy": 0.9124027788639069, |
| "num_tokens": 2943315.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.2929936305732483, |
| "grad_norm": 0.738551676273346, |
| "learning_rate": 5.3640937771939436e-05, |
| "loss": 0.4455, |
| "mean_token_accuracy": 0.9042632281780243, |
| "num_tokens": 2954251.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.305732484076433, |
| "grad_norm": 0.7478283047676086, |
| "learning_rate": 5.290614347797802e-05, |
| "loss": 0.472, |
| "mean_token_accuracy": 0.8965472280979156, |
| "num_tokens": 2966119.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3184713375796178, |
| "grad_norm": 0.7674943208694458, |
| "learning_rate": 5.217460213786821e-05, |
| "loss": 0.3871, |
| "mean_token_accuracy": 0.9164425730705261, |
| "num_tokens": 2977756.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.3312101910828025, |
| "grad_norm": 0.7106198668479919, |
| "learning_rate": 5.1446364281984774e-05, |
| "loss": 0.3952, |
| "mean_token_accuracy": 0.9167567789554596, |
| "num_tokens": 2989020.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.343949044585987, |
| "grad_norm": 0.776825487613678, |
| "learning_rate": 5.072148021251821e-05, |
| "loss": 0.3951, |
| "mean_token_accuracy": 0.9141735136508942, |
| "num_tokens": 3000498.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.356687898089172, |
| "grad_norm": 0.7228910326957703, |
| "learning_rate": 5.000000000000002e-05, |
| "loss": 0.4831, |
| "mean_token_accuracy": 0.8982515037059784, |
| "num_tokens": 3012283.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.3694267515923566, |
| "grad_norm": 0.8001947999000549, |
| "learning_rate": 4.92819734798441e-05, |
| "loss": 0.3931, |
| "mean_token_accuracy": 0.9135704636573792, |
| "num_tokens": 3023734.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.3821656050955413, |
| "grad_norm": 0.7749711275100708, |
| "learning_rate": 4.856745024890466e-05, |
| "loss": 0.4205, |
| "mean_token_accuracy": 0.9102110266685486, |
| "num_tokens": 3035422.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.394904458598726, |
| "grad_norm": 0.6763160228729248, |
| "learning_rate": 4.78564796620502e-05, |
| "loss": 0.3824, |
| "mean_token_accuracy": 0.9176193177700043, |
| "num_tokens": 3047227.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4076433121019107, |
| "grad_norm": 0.733139157295227, |
| "learning_rate": 4.7149110828754464e-05, |
| "loss": 0.4641, |
| "mean_token_accuracy": 0.9008893370628357, |
| "num_tokens": 3058515.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4203821656050954, |
| "grad_norm": 0.7419499754905701, |
| "learning_rate": 4.644539260970416e-05, |
| "loss": 0.4134, |
| "mean_token_accuracy": 0.9126076698303223, |
| "num_tokens": 3070154.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.43312101910828, |
| "grad_norm": 0.7160090804100037, |
| "learning_rate": 4.574537361342407e-05, |
| "loss": 0.4642, |
| "mean_token_accuracy": 0.9061474502086639, |
| "num_tokens": 3081238.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.445859872611465, |
| "grad_norm": 0.7175310254096985, |
| "learning_rate": 4.50491021929194e-05, |
| "loss": 0.3756, |
| "mean_token_accuracy": 0.918995589017868, |
| "num_tokens": 3092931.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4585987261146496, |
| "grad_norm": 0.7008662223815918, |
| "learning_rate": 4.435662644233594e-05, |
| "loss": 0.392, |
| "mean_token_accuracy": 0.9195187389850616, |
| "num_tokens": 3104621.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4713375796178343, |
| "grad_norm": 0.7543473839759827, |
| "learning_rate": 4.3667994193637796e-05, |
| "loss": 0.3809, |
| "mean_token_accuracy": 0.9197768867015839, |
| "num_tokens": 3116470.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.484076433121019, |
| "grad_norm": 0.6894095540046692, |
| "learning_rate": 4.298325301330383e-05, |
| "loss": 0.4301, |
| "mean_token_accuracy": 0.9104044735431671, |
| "num_tokens": 3127792.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4968152866242037, |
| "grad_norm": 0.7606199979782104, |
| "learning_rate": 4.23024501990417e-05, |
| "loss": 0.3707, |
| "mean_token_accuracy": 0.9214757680892944, |
| "num_tokens": 3139330.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5095541401273884, |
| "grad_norm": 0.7206736207008362, |
| "learning_rate": 4.1625632776521037e-05, |
| "loss": 0.3894, |
| "mean_token_accuracy": 0.9143988788127899, |
| "num_tokens": 3150599.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.522292993630573, |
| "grad_norm": 0.7822532057762146, |
| "learning_rate": 4.095284749612503e-05, |
| "loss": 0.4631, |
| "mean_token_accuracy": 0.9017830193042755, |
| "num_tokens": 3161908.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.535031847133758, |
| "grad_norm": 0.7029759287834167, |
| "learning_rate": 4.028414082972141e-05, |
| "loss": 0.3864, |
| "mean_token_accuracy": 0.9187280237674713, |
| "num_tokens": 3173218.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5477707006369426, |
| "grad_norm": 0.7151777148246765, |
| "learning_rate": 3.961955896745224e-05, |
| "loss": 0.4131, |
| "mean_token_accuracy": 0.9083968102931976, |
| "num_tokens": 3184570.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5605095541401273, |
| "grad_norm": 0.759780764579773, |
| "learning_rate": 3.89591478145437e-05, |
| "loss": 0.4264, |
| "mean_token_accuracy": 0.9122490584850311, |
| "num_tokens": 3196499.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.573248407643312, |
| "grad_norm": 0.6918774843215942, |
| "learning_rate": 3.8302952988134756e-05, |
| "loss": 0.4089, |
| "mean_token_accuracy": 0.9108126163482666, |
| "num_tokens": 3207925.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5859872611464967, |
| "grad_norm": 0.6682057976722717, |
| "learning_rate": 3.7651019814126654e-05, |
| "loss": 0.364, |
| "mean_token_accuracy": 0.9240628480911255, |
| "num_tokens": 3218971.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5987261146496814, |
| "grad_norm": 0.7228002548217773, |
| "learning_rate": 3.7003393324051874e-05, |
| "loss": 0.4119, |
| "mean_token_accuracy": 0.9100562930107117, |
| "num_tokens": 3230456.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.611464968152866, |
| "grad_norm": 0.7470158338546753, |
| "learning_rate": 3.6360118251963645e-05, |
| "loss": 0.403, |
| "mean_token_accuracy": 0.914577841758728, |
| "num_tokens": 3241801.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.624203821656051, |
| "grad_norm": 0.7659094333648682, |
| "learning_rate": 3.5721239031346066e-05, |
| "loss": 0.4182, |
| "mean_token_accuracy": 0.910229355096817, |
| "num_tokens": 3253004.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.6369426751592355, |
| "grad_norm": 0.7678000926971436, |
| "learning_rate": 3.508679979204481e-05, |
| "loss": 0.4304, |
| "mean_token_accuracy": 0.9080959856510162, |
| "num_tokens": 3264403.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6496815286624202, |
| "grad_norm": 0.7375931739807129, |
| "learning_rate": 3.445684435721897e-05, |
| "loss": 0.4305, |
| "mean_token_accuracy": 0.9104042947292328, |
| "num_tokens": 3276391.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.662420382165605, |
| "grad_norm": 0.7385655641555786, |
| "learning_rate": 3.383141624031408e-05, |
| "loss": 0.4367, |
| "mean_token_accuracy": 0.9077424705028534, |
| "num_tokens": 3287738.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.6751592356687897, |
| "grad_norm": 0.7327329516410828, |
| "learning_rate": 3.3210558642056275e-05, |
| "loss": 0.3339, |
| "mean_token_accuracy": 0.9267513453960419, |
| "num_tokens": 3299143.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6878980891719744, |
| "grad_norm": 0.6492987275123596, |
| "learning_rate": 3.259431444746846e-05, |
| "loss": 0.3775, |
| "mean_token_accuracy": 0.9218702614307404, |
| "num_tokens": 3310487.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.700636942675159, |
| "grad_norm": 0.759364902973175, |
| "learning_rate": 3.198272622290804e-05, |
| "loss": 0.3809, |
| "mean_token_accuracy": 0.9182988703250885, |
| "num_tokens": 3321796.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.713375796178344, |
| "grad_norm": 0.7147376537322998, |
| "learning_rate": 3.137583621312665e-05, |
| "loss": 0.4111, |
| "mean_token_accuracy": 0.9116301238536835, |
| "num_tokens": 3332604.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.7261146496815285, |
| "grad_norm": 0.7770649194717407, |
| "learning_rate": 3.077368633835205e-05, |
| "loss": 0.3964, |
| "mean_token_accuracy": 0.9151590764522552, |
| "num_tokens": 3344007.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.738853503184713, |
| "grad_norm": 0.7108721733093262, |
| "learning_rate": 3.0176318191392726e-05, |
| "loss": 0.4136, |
| "mean_token_accuracy": 0.9083453416824341, |
| "num_tokens": 3355090.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7515923566878984, |
| "grad_norm": 0.7094624638557434, |
| "learning_rate": 2.9583773034764826e-05, |
| "loss": 0.3454, |
| "mean_token_accuracy": 0.9238831102848053, |
| "num_tokens": 3365904.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.7643312101910826, |
| "grad_norm": 0.6758113503456116, |
| "learning_rate": 2.8996091797841973e-05, |
| "loss": 0.3816, |
| "mean_token_accuracy": 0.9179931282997131, |
| "num_tokens": 3377964.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.777070063694268, |
| "grad_norm": 0.7704566121101379, |
| "learning_rate": 2.8413315074028158e-05, |
| "loss": 0.431, |
| "mean_token_accuracy": 0.9047513604164124, |
| "num_tokens": 3389347.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.789808917197452, |
| "grad_norm": 0.6735308766365051, |
| "learning_rate": 2.7835483117953788e-05, |
| "loss": 0.3715, |
| "mean_token_accuracy": 0.9192857146263123, |
| "num_tokens": 3400439.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.802547770700637, |
| "grad_norm": 0.8025267124176025, |
| "learning_rate": 2.7262635842695127e-05, |
| "loss": 0.4315, |
| "mean_token_accuracy": 0.9085029065608978, |
| "num_tokens": 3411639.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.8152866242038215, |
| "grad_norm": 0.6782514452934265, |
| "learning_rate": 2.669481281701739e-05, |
| "loss": 0.353, |
| "mean_token_accuracy": 0.9254265427589417, |
| "num_tokens": 3423172.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8280254777070066, |
| "grad_norm": 0.7359219789505005, |
| "learning_rate": 2.6132053262641466e-05, |
| "loss": 0.4301, |
| "mean_token_accuracy": 0.9082939028739929, |
| "num_tokens": 3434947.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.840764331210191, |
| "grad_norm": 0.7089890241622925, |
| "learning_rate": 2.5574396051534832e-05, |
| "loss": 0.3922, |
| "mean_token_accuracy": 0.9144908785820007, |
| "num_tokens": 3446512.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.853503184713376, |
| "grad_norm": 0.6748204827308655, |
| "learning_rate": 2.502187970322657e-05, |
| "loss": 0.3985, |
| "mean_token_accuracy": 0.9171700477600098, |
| "num_tokens": 3458505.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8662420382165603, |
| "grad_norm": 0.7042027711868286, |
| "learning_rate": 2.4474542382146537e-05, |
| "loss": 0.3913, |
| "mean_token_accuracy": 0.9139814674854279, |
| "num_tokens": 3470163.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8789808917197455, |
| "grad_norm": 0.6868739128112793, |
| "learning_rate": 2.3932421894989167e-05, |
| "loss": 0.3378, |
| "mean_token_accuracy": 0.9283902049064636, |
| "num_tokens": 3481090.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8917197452229297, |
| "grad_norm": 0.714598536491394, |
| "learning_rate": 2.339555568810221e-05, |
| "loss": 0.4005, |
| "mean_token_accuracy": 0.9129302501678467, |
| "num_tokens": 3491946.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.904458598726115, |
| "grad_norm": 0.8096787929534912, |
| "learning_rate": 2.2863980844900036e-05, |
| "loss": 0.4396, |
| "mean_token_accuracy": 0.9040016531944275, |
| "num_tokens": 3502961.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.917197452229299, |
| "grad_norm": 0.7268587946891785, |
| "learning_rate": 2.2337734083302164e-05, |
| "loss": 0.3623, |
| "mean_token_accuracy": 0.9210439920425415, |
| "num_tokens": 3514116.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9299363057324843, |
| "grad_norm": 0.7080064415931702, |
| "learning_rate": 2.181685175319702e-05, |
| "loss": 0.3944, |
| "mean_token_accuracy": 0.9152760803699493, |
| "num_tokens": 3525855.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9426751592356686, |
| "grad_norm": 0.6933088898658752, |
| "learning_rate": 2.1301369833931117e-05, |
| "loss": 0.3955, |
| "mean_token_accuracy": 0.9157300591468811, |
| "num_tokens": 3536972.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9554140127388537, |
| "grad_norm": 0.7148348093032837, |
| "learning_rate": 2.079132393182378e-05, |
| "loss": 0.3739, |
| "mean_token_accuracy": 0.917779803276062, |
| "num_tokens": 3548281.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.968152866242038, |
| "grad_norm": 0.7383513450622559, |
| "learning_rate": 2.0286749277707782e-05, |
| "loss": 0.3799, |
| "mean_token_accuracy": 0.9188788533210754, |
| "num_tokens": 3559528.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.980891719745223, |
| "grad_norm": 0.7167903184890747, |
| "learning_rate": 1.9787680724495617e-05, |
| "loss": 0.4203, |
| "mean_token_accuracy": 0.9090096354484558, |
| "num_tokens": 3571410.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9936305732484074, |
| "grad_norm": 0.7360700964927673, |
| "learning_rate": 1.929415274477239e-05, |
| "loss": 0.3843, |
| "mean_token_accuracy": 0.917841374874115, |
| "num_tokens": 3582989.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.9755165576934814, |
| "learning_rate": 1.880619942841435e-05, |
| "loss": 0.2811, |
| "mean_token_accuracy": 0.9407498836517334, |
| "num_tokens": 3588675.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012738853503185, |
| "grad_norm": 0.6373947858810425, |
| "learning_rate": 1.832385448023435e-05, |
| "loss": 0.305, |
| "mean_token_accuracy": 0.937866747379303, |
| "num_tokens": 3600582.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025477707006369, |
| "grad_norm": 0.513500452041626, |
| "learning_rate": 1.7847151217653624e-05, |
| "loss": 0.1996, |
| "mean_token_accuracy": 0.9598060250282288, |
| "num_tokens": 3612395.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.038216560509555, |
| "grad_norm": 0.5696059465408325, |
| "learning_rate": 1.7376122568400532e-05, |
| "loss": 0.2323, |
| "mean_token_accuracy": 0.9527164399623871, |
| "num_tokens": 3623934.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050955414012739, |
| "grad_norm": 0.6302847266197205, |
| "learning_rate": 1.6910801068236016e-05, |
| "loss": 0.2627, |
| "mean_token_accuracy": 0.9468440115451813, |
| "num_tokens": 3635141.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063694267515924, |
| "grad_norm": 0.5786097049713135, |
| "learning_rate": 1.6451218858706374e-05, |
| "loss": 0.2515, |
| "mean_token_accuracy": 0.9479193389415741, |
| "num_tokens": 3646412.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.076433121019108, |
| "grad_norm": 0.5529419779777527, |
| "learning_rate": 1.5997407684922862e-05, |
| "loss": 0.2329, |
| "mean_token_accuracy": 0.9493387043476105, |
| "num_tokens": 3658369.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.089171974522293, |
| "grad_norm": 0.5960792303085327, |
| "learning_rate": 1.5549398893369216e-05, |
| "loss": 0.2179, |
| "mean_token_accuracy": 0.9559203088283539, |
| "num_tokens": 3669448.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.101910828025478, |
| "grad_norm": 0.6120526790618896, |
| "learning_rate": 1.5107223429736272e-05, |
| "loss": 0.2356, |
| "mean_token_accuracy": 0.950799435377121, |
| "num_tokens": 3681023.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.114649681528663, |
| "grad_norm": 0.6094869375228882, |
| "learning_rate": 1.467091183678444e-05, |
| "loss": 0.221, |
| "mean_token_accuracy": 0.9547978937625885, |
| "num_tokens": 3692657.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.127388535031847, |
| "grad_norm": 0.7375300526618958, |
| "learning_rate": 1.4240494252234049e-05, |
| "loss": 0.2434, |
| "mean_token_accuracy": 0.9470761716365814, |
| "num_tokens": 3704395.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.140127388535032, |
| "grad_norm": 0.7640740871429443, |
| "learning_rate": 1.3816000406683604e-05, |
| "loss": 0.2591, |
| "mean_token_accuracy": 0.9460343718528748, |
| "num_tokens": 3716489.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.1528662420382165, |
| "grad_norm": 0.750254213809967, |
| "learning_rate": 1.339745962155613e-05, |
| "loss": 0.2566, |
| "mean_token_accuracy": 0.9457094967365265, |
| "num_tokens": 3727830.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.165605095541402, |
| "grad_norm": 0.6968578100204468, |
| "learning_rate": 1.2984900807073919e-05, |
| "loss": 0.2296, |
| "mean_token_accuracy": 0.9500870108604431, |
| "num_tokens": 3739056.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.178343949044586, |
| "grad_norm": 0.7135255932807922, |
| "learning_rate": 1.2578352460261456e-05, |
| "loss": 0.2714, |
| "mean_token_accuracy": 0.943615198135376, |
| "num_tokens": 3750358.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.191082802547771, |
| "grad_norm": 0.721027135848999, |
| "learning_rate": 1.2177842662977135e-05, |
| "loss": 0.2812, |
| "mean_token_accuracy": 0.9410761296749115, |
| "num_tokens": 3761678.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.203821656050955, |
| "grad_norm": 0.7138113975524902, |
| "learning_rate": 1.1783399079973578e-05, |
| "loss": 0.2824, |
| "mean_token_accuracy": 0.9425844848155975, |
| "num_tokens": 3772919.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.2165605095541405, |
| "grad_norm": 0.6014682054519653, |
| "learning_rate": 1.1395048956986575e-05, |
| "loss": 0.2404, |
| "mean_token_accuracy": 0.9489006102085114, |
| "num_tokens": 3784964.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.229299363057325, |
| "grad_norm": 0.6314707398414612, |
| "learning_rate": 1.1012819118853147e-05, |
| "loss": 0.2496, |
| "mean_token_accuracy": 0.9463862776756287, |
| "num_tokens": 3796759.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.24203821656051, |
| "grad_norm": 0.5552114248275757, |
| "learning_rate": 1.0636735967658784e-05, |
| "loss": 0.2108, |
| "mean_token_accuracy": 0.9555350244045258, |
| "num_tokens": 3807780.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.254777070063694, |
| "grad_norm": 0.6171155571937561, |
| "learning_rate": 1.0266825480913611e-05, |
| "loss": 0.2588, |
| "mean_token_accuracy": 0.9461368918418884, |
| "num_tokens": 3818794.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.267515923566879, |
| "grad_norm": 0.5676184892654419, |
| "learning_rate": 9.903113209758096e-06, |
| "loss": 0.2269, |
| "mean_token_accuracy": 0.952668160200119, |
| "num_tokens": 3830160.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.280254777070064, |
| "grad_norm": 0.5797393321990967, |
| "learning_rate": 9.545624277198084e-06, |
| "loss": 0.2436, |
| "mean_token_accuracy": 0.9488925039768219, |
| "num_tokens": 3841632.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.292993630573249, |
| "grad_norm": 0.6091304421424866, |
| "learning_rate": 9.194383376369508e-06, |
| "loss": 0.2399, |
| "mean_token_accuracy": 0.9505036473274231, |
| "num_tokens": 3852969.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.305732484076433, |
| "grad_norm": 0.5556879639625549, |
| "learning_rate": 8.849414768832687e-06, |
| "loss": 0.2102, |
| "mean_token_accuracy": 0.9555756449699402, |
| "num_tokens": 3864175.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.318471337579618, |
| "grad_norm": 0.6041027307510376, |
| "learning_rate": 8.510742282896544e-06, |
| "loss": 0.2442, |
| "mean_token_accuracy": 0.9477723836898804, |
| "num_tokens": 3875709.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.3312101910828025, |
| "grad_norm": 0.541427731513977, |
| "learning_rate": 8.178389311972612e-06, |
| "loss": 0.2127, |
| "mean_token_accuracy": 0.955585241317749, |
| "num_tokens": 3887256.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.343949044585988, |
| "grad_norm": 0.6119688749313354, |
| "learning_rate": 7.852378812959227e-06, |
| "loss": 0.2542, |
| "mean_token_accuracy": 0.945166677236557, |
| "num_tokens": 3898876.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.356687898089172, |
| "grad_norm": 0.5536457896232605, |
| "learning_rate": 7.532733304655848e-06, |
| "loss": 0.2285, |
| "mean_token_accuracy": 0.9501866400241852, |
| "num_tokens": 3910522.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.369426751592357, |
| "grad_norm": 0.6129220128059387, |
| "learning_rate": 7.219474866207465e-06, |
| "loss": 0.232, |
| "mean_token_accuracy": 0.950534850358963, |
| "num_tokens": 3921730.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.382165605095541, |
| "grad_norm": 0.5599251985549927, |
| "learning_rate": 6.9126251355795864e-06, |
| "loss": 0.2213, |
| "mean_token_accuracy": 0.9533770978450775, |
| "num_tokens": 3933613.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3949044585987265, |
| "grad_norm": 0.6107044816017151, |
| "learning_rate": 6.612205308063646e-06, |
| "loss": 0.2474, |
| "mean_token_accuracy": 0.9481737017631531, |
| "num_tokens": 3945095.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.407643312101911, |
| "grad_norm": 0.6116899847984314, |
| "learning_rate": 6.318236134812916e-06, |
| "loss": 0.2405, |
| "mean_token_accuracy": 0.9522660076618195, |
| "num_tokens": 3956565.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.420382165605096, |
| "grad_norm": 0.649278998374939, |
| "learning_rate": 6.030737921409169e-06, |
| "loss": 0.2637, |
| "mean_token_accuracy": 0.9446616172790527, |
| "num_tokens": 3967950.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.43312101910828, |
| "grad_norm": 0.6206309199333191, |
| "learning_rate": 5.749730526460073e-06, |
| "loss": 0.2551, |
| "mean_token_accuracy": 0.9476028084754944, |
| "num_tokens": 3979520.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.445859872611465, |
| "grad_norm": 0.6442816853523254, |
| "learning_rate": 5.475233360227516e-06, |
| "loss": 0.2491, |
| "mean_token_accuracy": 0.9484961330890656, |
| "num_tokens": 3990605.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.45859872611465, |
| "grad_norm": 0.615239679813385, |
| "learning_rate": 5.20726538328683e-06, |
| "loss": 0.248, |
| "mean_token_accuracy": 0.9499914944171906, |
| "num_tokens": 4001897.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.471337579617835, |
| "grad_norm": 0.5654546618461609, |
| "learning_rate": 4.945845105217117e-06, |
| "loss": 0.208, |
| "mean_token_accuracy": 0.9568901658058167, |
| "num_tokens": 4013030.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.484076433121019, |
| "grad_norm": 0.593754768371582, |
| "learning_rate": 4.6909905833226966e-06, |
| "loss": 0.2368, |
| "mean_token_accuracy": 0.9518877267837524, |
| "num_tokens": 4024717.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.496815286624204, |
| "grad_norm": 0.6317068934440613, |
| "learning_rate": 4.442719421385922e-06, |
| "loss": 0.2602, |
| "mean_token_accuracy": 0.9456787109375, |
| "num_tokens": 4036521.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.509554140127388, |
| "grad_norm": 0.5658568739891052, |
| "learning_rate": 4.20104876845111e-06, |
| "loss": 0.2149, |
| "mean_token_accuracy": 0.9562082588672638, |
| "num_tokens": 4048246.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.522292993630574, |
| "grad_norm": 0.6423606872558594, |
| "learning_rate": 3.965995317640025e-06, |
| "loss": 0.2246, |
| "mean_token_accuracy": 0.9531770050525665, |
| "num_tokens": 4059468.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.535031847133758, |
| "grad_norm": 0.6500980257987976, |
| "learning_rate": 3.7375753049987973e-06, |
| "loss": 0.2625, |
| "mean_token_accuracy": 0.9455468654632568, |
| "num_tokens": 4071007.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.547770700636943, |
| "grad_norm": 0.6197830438613892, |
| "learning_rate": 3.515804508376508e-06, |
| "loss": 0.2299, |
| "mean_token_accuracy": 0.9506585597991943, |
| "num_tokens": 4081959.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.560509554140127, |
| "grad_norm": 0.6473744511604309, |
| "learning_rate": 3.3006982463352766e-06, |
| "loss": 0.2615, |
| "mean_token_accuracy": 0.9437356889247894, |
| "num_tokens": 4093354.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.573248407643312, |
| "grad_norm": 0.6327031254768372, |
| "learning_rate": 3.092271377092215e-06, |
| "loss": 0.267, |
| "mean_token_accuracy": 0.9425212442874908, |
| "num_tokens": 4105174.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.585987261146497, |
| "grad_norm": 0.5570584535598755, |
| "learning_rate": 2.8905382974930172e-06, |
| "loss": 0.2064, |
| "mean_token_accuracy": 0.954309344291687, |
| "num_tokens": 4116576.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.598726114649682, |
| "grad_norm": 0.623688280582428, |
| "learning_rate": 2.6955129420176196e-06, |
| "loss": 0.2206, |
| "mean_token_accuracy": 0.9519834220409393, |
| "num_tokens": 4127873.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.611464968152866, |
| "grad_norm": 0.6340871453285217, |
| "learning_rate": 2.5072087818176382e-06, |
| "loss": 0.2358, |
| "mean_token_accuracy": 0.9510488510131836, |
| "num_tokens": 4138888.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.624203821656051, |
| "grad_norm": 0.657813549041748, |
| "learning_rate": 2.3256388237858807e-06, |
| "loss": 0.2499, |
| "mean_token_accuracy": 0.9460207223892212, |
| "num_tokens": 4150232.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.6369426751592355, |
| "grad_norm": 0.7132663726806641, |
| "learning_rate": 2.150815609657875e-06, |
| "loss": 0.2893, |
| "mean_token_accuracy": 0.9409700334072113, |
| "num_tokens": 4161733.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.649681528662421, |
| "grad_norm": 0.6530131697654724, |
| "learning_rate": 1.9827512151456173e-06, |
| "loss": 0.2769, |
| "mean_token_accuracy": 0.9446337521076202, |
| "num_tokens": 4173910.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.662420382165605, |
| "grad_norm": 0.5950355529785156, |
| "learning_rate": 1.8214572491034198e-06, |
| "loss": 0.2145, |
| "mean_token_accuracy": 0.9520914554595947, |
| "num_tokens": 4185377.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.67515923566879, |
| "grad_norm": 0.584748387336731, |
| "learning_rate": 1.66694485272606e-06, |
| "loss": 0.2142, |
| "mean_token_accuracy": 0.9542392492294312, |
| "num_tokens": 4196586.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.687898089171974, |
| "grad_norm": 0.6257981657981873, |
| "learning_rate": 1.5192246987791981e-06, |
| "loss": 0.2138, |
| "mean_token_accuracy": 0.9550438523292542, |
| "num_tokens": 4207564.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.7006369426751595, |
| "grad_norm": 0.663212776184082, |
| "learning_rate": 1.378306990862177e-06, |
| "loss": 0.2523, |
| "mean_token_accuracy": 0.9431774616241455, |
| "num_tokens": 4218790.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.713375796178344, |
| "grad_norm": 0.6407923698425293, |
| "learning_rate": 1.2442014627032316e-06, |
| "loss": 0.2385, |
| "mean_token_accuracy": 0.9502703845500946, |
| "num_tokens": 4230117.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.726114649681529, |
| "grad_norm": 0.5782377123832703, |
| "learning_rate": 1.1169173774871478e-06, |
| "loss": 0.2311, |
| "mean_token_accuracy": 0.9525089859962463, |
| "num_tokens": 4241547.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.738853503184713, |
| "grad_norm": 0.5933149456977844, |
| "learning_rate": 9.964635272153633e-07, |
| "loss": 0.2354, |
| "mean_token_accuracy": 0.950641393661499, |
| "num_tokens": 4253164.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.751592356687898, |
| "grad_norm": 0.667209804058075, |
| "learning_rate": 8.828482320987319e-07, |
| "loss": 0.2699, |
| "mean_token_accuracy": 0.9431827366352081, |
| "num_tokens": 4264634.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.764331210191083, |
| "grad_norm": 0.6330809593200684, |
| "learning_rate": 7.760793399827937e-07, |
| "loss": 0.2219, |
| "mean_token_accuracy": 0.950275719165802, |
| "num_tokens": 4275920.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.777070063694268, |
| "grad_norm": 0.5830065011978149, |
| "learning_rate": 6.761642258056978e-07, |
| "loss": 0.2112, |
| "mean_token_accuracy": 0.9556083977222443, |
| "num_tokens": 4287045.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.789808917197452, |
| "grad_norm": 0.5773307681083679, |
| "learning_rate": 5.831097910887873e-07, |
| "loss": 0.2303, |
| "mean_token_accuracy": 0.951410561800003, |
| "num_tokens": 4298056.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.802547770700637, |
| "grad_norm": 0.6692339181900024, |
| "learning_rate": 4.969224634598591e-07, |
| "loss": 0.2468, |
| "mean_token_accuracy": 0.9466256201267242, |
| "num_tokens": 4309058.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.8152866242038215, |
| "grad_norm": 0.592280924320221, |
| "learning_rate": 4.176081962092182e-07, |
| "loss": 0.2243, |
| "mean_token_accuracy": 0.9543558657169342, |
| "num_tokens": 4320492.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.828025477707007, |
| "grad_norm": 0.5458922386169434, |
| "learning_rate": 3.451724678784518e-07, |
| "loss": 0.1969, |
| "mean_token_accuracy": 0.9583150148391724, |
| "num_tokens": 4331497.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.840764331210191, |
| "grad_norm": 0.6117383241653442, |
| "learning_rate": 2.7962028188198706e-07, |
| "loss": 0.2284, |
| "mean_token_accuracy": 0.9501660764217377, |
| "num_tokens": 4343022.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.853503184713376, |
| "grad_norm": 0.6400023698806763, |
| "learning_rate": 2.2095616616150115e-07, |
| "loss": 0.2443, |
| "mean_token_accuracy": 0.9481694400310516, |
| "num_tokens": 4354393.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.86624203821656, |
| "grad_norm": 0.5784524083137512, |
| "learning_rate": 1.6918417287318245e-07, |
| "loss": 0.2129, |
| "mean_token_accuracy": 0.9560071527957916, |
| "num_tokens": 4365580.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8789808917197455, |
| "grad_norm": 0.5761446952819824, |
| "learning_rate": 1.2430787810776555e-07, |
| "loss": 0.2261, |
| "mean_token_accuracy": 0.9526739120483398, |
| "num_tokens": 4376649.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.89171974522293, |
| "grad_norm": 0.6780246496200562, |
| "learning_rate": 8.633038164358454e-08, |
| "loss": 0.2584, |
| "mean_token_accuracy": 0.9444167017936707, |
| "num_tokens": 4388351.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.904458598726115, |
| "grad_norm": 0.5891669392585754, |
| "learning_rate": 5.5254306732444025e-08, |
| "loss": 0.2168, |
| "mean_token_accuracy": 0.9538559019565582, |
| "num_tokens": 4400015.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.917197452229299, |
| "grad_norm": 0.6162629127502441, |
| "learning_rate": 3.1081799918375454e-08, |
| "loss": 0.2271, |
| "mean_token_accuracy": 0.9495961964130402, |
| "num_tokens": 4411248.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.929936305732484, |
| "grad_norm": 0.5894432663917542, |
| "learning_rate": 1.3814530889433296e-08, |
| "loss": 0.2199, |
| "mean_token_accuracy": 0.954120010137558, |
| "num_tokens": 4422081.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "grad_norm": 0.6032901406288147, |
| "learning_rate": 3.453692362309635e-09, |
| "loss": 0.2383, |
| "mean_token_accuracy": 0.9507102966308594, |
| "num_tokens": 4433867.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "step": 390, |
| "total_flos": 2.6684669817153126e+17, |
| "train_loss": 0.9139279948595243, |
| "train_runtime": 757.4985, |
| "train_samples_per_second": 33.003, |
| "train_steps_per_second": 0.515 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 390, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.6684669817153126e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|