{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 168, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.8196021169424057, "epoch": 0.005956813104988831, "grad_norm": 1.28125, "learning_rate": 2e-05, "loss": 1.7708154916763306, "mean_token_accuracy": 0.599120743572712, "num_tokens": 14922.0, "step": 1 }, { "entropy": 1.2802767902612686, "epoch": 0.011913626209977662, "grad_norm": 3.953125, "learning_rate": 1.9999805729315383e-05, "loss": 2.1650872230529785, "mean_token_accuracy": 0.5873465985059738, "num_tokens": 30082.0, "step": 2 }, { "entropy": 1.7827413529157639, "epoch": 0.017870439314966492, "grad_norm": 1.3203125, "learning_rate": 1.999922292480975e-05, "loss": 1.5451161861419678, "mean_token_accuracy": 0.6535470560193062, "num_tokens": 44458.0, "step": 3 }, { "entropy": 1.881892368197441, "epoch": 0.023827252419955324, "grad_norm": 0.65625, "learning_rate": 1.9998251609127465e-05, "loss": 1.400605320930481, "mean_token_accuracy": 0.6719935461878777, "num_tokens": 59381.0, "step": 4 }, { "entropy": 1.9049408286809921, "epoch": 0.029784065524944156, "grad_norm": 0.54296875, "learning_rate": 1.9996891820008165e-05, "loss": 1.3754955530166626, "mean_token_accuracy": 0.6717504411935806, "num_tokens": 74182.0, "step": 5 }, { "entropy": 1.79595048725605, "epoch": 0.035740878629932984, "grad_norm": 0.55859375, "learning_rate": 1.9995143610285275e-05, "loss": 1.2846546173095703, "mean_token_accuracy": 0.6872891932725906, "num_tokens": 88869.0, "step": 6 }, { "entropy": 1.6670185774564743, "epoch": 0.04169769173492182, "grad_norm": 0.5390625, "learning_rate": 1.9993007047883988e-05, "loss": 1.1514159440994263, "mean_token_accuracy": 0.7146859243512154, "num_tokens": 103614.0, "step": 7 }, { "entropy": 1.6106412559747696, "epoch": 0.04765450483991065, "grad_norm": 0.50390625, "learning_rate": 1.999048221581858e-05, "loss": 1.1496959924697876, "mean_token_accuracy": 0.7096454501152039, "num_tokens": 118065.0, "step": 8 }, { "entropy": 1.5453107059001923, "epoch": 0.05361131794489948, "grad_norm": 0.5078125, "learning_rate": 1.9987569212189224e-05, "loss": 1.142591118812561, "mean_token_accuracy": 0.7142270430922508, "num_tokens": 133029.0, "step": 9 }, { "entropy": 1.5210696011781693, "epoch": 0.05956813104988831, "grad_norm": 0.47265625, "learning_rate": 1.998426815017817e-05, "loss": 1.0974477529525757, "mean_token_accuracy": 0.7146398201584816, "num_tokens": 147810.0, "step": 10 }, { "entropy": 1.5126763880252838, "epoch": 0.06552494415487714, "grad_norm": 0.46875, "learning_rate": 1.9980579158045322e-05, "loss": 1.1492289304733276, "mean_token_accuracy": 0.7059202417731285, "num_tokens": 162781.0, "step": 11 }, { "entropy": 1.5258464515209198, "epoch": 0.07148175725986597, "grad_norm": 0.4375, "learning_rate": 1.997650237912329e-05, "loss": 1.068825125694275, "mean_token_accuracy": 0.7209103479981422, "num_tokens": 176562.0, "step": 12 }, { "entropy": 1.5423607379198074, "epoch": 0.0774385703648548, "grad_norm": 0.462890625, "learning_rate": 1.9972037971811802e-05, "loss": 1.1400907039642334, "mean_token_accuracy": 0.7075617015361786, "num_tokens": 190938.0, "step": 13 }, { "entropy": 1.5203707218170166, "epoch": 0.08339538346984364, "grad_norm": 0.42578125, "learning_rate": 1.996718610957155e-05, "loss": 1.0239043235778809, "mean_token_accuracy": 0.7295805141329765, "num_tokens": 205420.0, "step": 14 }, { "entropy": 1.5007787346839905, "epoch": 0.08935219657483247, "grad_norm": 0.40234375, "learning_rate": 1.9961946980917457e-05, "loss": 0.9978266358375549, "mean_token_accuracy": 0.7387106791138649, "num_tokens": 219949.0, "step": 15 }, { "entropy": 1.4767527133226395, "epoch": 0.0953090096798213, "grad_norm": 0.375, "learning_rate": 1.9956320789411338e-05, "loss": 1.0312634706497192, "mean_token_accuracy": 0.7306794673204422, "num_tokens": 235321.0, "step": 16 }, { "entropy": 1.4968346804380417, "epoch": 0.10126582278481013, "grad_norm": 0.41796875, "learning_rate": 1.9950307753654016e-05, "loss": 1.0707520246505737, "mean_token_accuracy": 0.7274535074830055, "num_tokens": 249201.0, "step": 17 }, { "entropy": 1.476852685213089, "epoch": 0.10722263588979895, "grad_norm": 0.4140625, "learning_rate": 1.99439081072768e-05, "loss": 1.0673410892486572, "mean_token_accuracy": 0.7224985063076019, "num_tokens": 263940.0, "step": 18 }, { "entropy": 1.4178977608680725, "epoch": 0.11317944899478778, "grad_norm": 0.404296875, "learning_rate": 1.9937122098932428e-05, "loss": 0.9890223741531372, "mean_token_accuracy": 0.7390217557549477, "num_tokens": 279156.0, "step": 19 }, { "entropy": 1.4455726444721222, "epoch": 0.11913626209977662, "grad_norm": 0.404296875, "learning_rate": 1.9929949992285397e-05, "loss": 1.0276429653167725, "mean_token_accuracy": 0.7296848446130753, "num_tokens": 293490.0, "step": 20 }, { "entropy": 1.4110448211431503, "epoch": 0.12509307520476545, "grad_norm": 0.380859375, "learning_rate": 1.9922392066001724e-05, "loss": 0.9719092845916748, "mean_token_accuracy": 0.7374792844057083, "num_tokens": 308809.0, "step": 21 }, { "entropy": 1.405819684267044, "epoch": 0.13104988830975428, "grad_norm": 0.392578125, "learning_rate": 1.9914448613738107e-05, "loss": 0.9487384557723999, "mean_token_accuracy": 0.7479015067219734, "num_tokens": 323801.0, "step": 22 }, { "entropy": 1.3968916982412338, "epoch": 0.1370067014147431, "grad_norm": 0.3828125, "learning_rate": 1.9906119944130527e-05, "loss": 0.9097103476524353, "mean_token_accuracy": 0.7529696971178055, "num_tokens": 338809.0, "step": 23 }, { "entropy": 1.4245737493038177, "epoch": 0.14296351451973194, "grad_norm": 0.36328125, "learning_rate": 1.9897406380782262e-05, "loss": 0.9830621480941772, "mean_token_accuracy": 0.7378853410482407, "num_tokens": 353678.0, "step": 24 }, { "entropy": 1.3906199932098389, "epoch": 0.14892032762472077, "grad_norm": 0.365234375, "learning_rate": 1.9888308262251286e-05, "loss": 0.9530032277107239, "mean_token_accuracy": 0.7401829957962036, "num_tokens": 368974.0, "step": 25 }, { "entropy": 1.4205086827278137, "epoch": 0.1548771407297096, "grad_norm": 0.400390625, "learning_rate": 1.9878825942037147e-05, "loss": 0.9490904211997986, "mean_token_accuracy": 0.7428939715027809, "num_tokens": 383442.0, "step": 26 }, { "entropy": 1.4382268190383911, "epoch": 0.16083395383469842, "grad_norm": 0.408203125, "learning_rate": 1.9868959788567213e-05, "loss": 0.9662237763404846, "mean_token_accuracy": 0.7409680560231209, "num_tokens": 397144.0, "step": 27 }, { "entropy": 1.4032137542963028, "epoch": 0.16679076693968728, "grad_norm": 0.392578125, "learning_rate": 1.985871018518236e-05, "loss": 0.9321739673614502, "mean_token_accuracy": 0.7473694160580635, "num_tokens": 411072.0, "step": 28 }, { "entropy": 1.4221246838569641, "epoch": 0.1727475800446761, "grad_norm": 0.3828125, "learning_rate": 1.9848077530122083e-05, "loss": 0.9609735012054443, "mean_token_accuracy": 0.7417895272374153, "num_tokens": 424984.0, "step": 29 }, { "entropy": 1.3734628409147263, "epoch": 0.17870439314966494, "grad_norm": 0.3671875, "learning_rate": 1.9837062236509013e-05, "loss": 0.8709937930107117, "mean_token_accuracy": 0.7573041170835495, "num_tokens": 439653.0, "step": 30 }, { "entropy": 1.4108192771673203, "epoch": 0.18466120625465376, "grad_norm": 0.423828125, "learning_rate": 1.9825664732332886e-05, "loss": 0.9877131581306458, "mean_token_accuracy": 0.7332894876599312, "num_tokens": 453859.0, "step": 31 }, { "entropy": 1.4060807824134827, "epoch": 0.1906180193596426, "grad_norm": 0.376953125, "learning_rate": 1.981388546043388e-05, "loss": 1.0199761390686035, "mean_token_accuracy": 0.7262433990836143, "num_tokens": 469134.0, "step": 32 }, { "entropy": 1.395486667752266, "epoch": 0.19657483246463142, "grad_norm": 0.3984375, "learning_rate": 1.9801724878485438e-05, "loss": 0.9763211011886597, "mean_token_accuracy": 0.7416960969567299, "num_tokens": 483181.0, "step": 33 }, { "entropy": 1.371009811758995, "epoch": 0.20253164556962025, "grad_norm": 0.3671875, "learning_rate": 1.9789183458976485e-05, "loss": 0.8935137391090393, "mean_token_accuracy": 0.7588988393545151, "num_tokens": 497611.0, "step": 34 }, { "entropy": 1.3474263399839401, "epoch": 0.20848845867460908, "grad_norm": 0.359375, "learning_rate": 1.977626168919305e-05, "loss": 0.8481594324111938, "mean_token_accuracy": 0.7649582549929619, "num_tokens": 511742.0, "step": 35 }, { "entropy": 1.3111611157655716, "epoch": 0.2144452717795979, "grad_norm": 0.3359375, "learning_rate": 1.9762960071199334e-05, "loss": 0.8989245891571045, "mean_token_accuracy": 0.7640852630138397, "num_tokens": 527336.0, "step": 36 }, { "entropy": 1.3298669755458832, "epoch": 0.22040208488458674, "grad_norm": 0.3671875, "learning_rate": 1.9749279121818235e-05, "loss": 0.8918904066085815, "mean_token_accuracy": 0.7584179416298866, "num_tokens": 541854.0, "step": 37 }, { "entropy": 1.3399434834718704, "epoch": 0.22635889798957556, "grad_norm": 0.365234375, "learning_rate": 1.9735219372611232e-05, "loss": 0.9522192478179932, "mean_token_accuracy": 0.7403313592076302, "num_tokens": 556835.0, "step": 38 }, { "entropy": 1.3322739899158478, "epoch": 0.23231571109456442, "grad_norm": 0.34765625, "learning_rate": 1.9720781369857747e-05, "loss": 0.8859533071517944, "mean_token_accuracy": 0.7525262087583542, "num_tokens": 571583.0, "step": 39 }, { "entropy": 1.3456282019615173, "epoch": 0.23827252419955325, "grad_norm": 0.35546875, "learning_rate": 1.970596567453391e-05, "loss": 0.9205423593521118, "mean_token_accuracy": 0.7516355887055397, "num_tokens": 585756.0, "step": 40 }, { "entropy": 1.34938944876194, "epoch": 0.24422933730454208, "grad_norm": 0.3671875, "learning_rate": 1.969077286229078e-05, "loss": 0.9173880219459534, "mean_token_accuracy": 0.7490571588277817, "num_tokens": 600414.0, "step": 41 }, { "entropy": 1.342022642493248, "epoch": 0.2501861504095309, "grad_norm": 0.3671875, "learning_rate": 1.9675203523431964e-05, "loss": 0.9510252475738525, "mean_token_accuracy": 0.7395995110273361, "num_tokens": 615312.0, "step": 42 }, { "entropy": 1.3256245851516724, "epoch": 0.2561429635145197, "grad_norm": 0.359375, "learning_rate": 1.9659258262890683e-05, "loss": 0.8812260031700134, "mean_token_accuracy": 0.7551488727331161, "num_tokens": 630044.0, "step": 43 }, { "entropy": 1.300643116235733, "epoch": 0.26209977661950856, "grad_norm": 0.34765625, "learning_rate": 1.964293770020628e-05, "loss": 0.8403468728065491, "mean_token_accuracy": 0.7659397423267365, "num_tokens": 644892.0, "step": 44 }, { "entropy": 1.3294509053230286, "epoch": 0.2680565897244974, "grad_norm": 0.388671875, "learning_rate": 1.962624246950012e-05, "loss": 0.8782874345779419, "mean_token_accuracy": 0.7567607760429382, "num_tokens": 659231.0, "step": 45 }, { "entropy": 1.3091595023870468, "epoch": 0.2740134028294862, "grad_norm": 0.376953125, "learning_rate": 1.9609173219450998e-05, "loss": 0.9257646799087524, "mean_token_accuracy": 0.7511701583862305, "num_tokens": 673897.0, "step": 46 }, { "entropy": 1.3130007237195969, "epoch": 0.2799702159344751, "grad_norm": 0.3671875, "learning_rate": 1.9591730613269878e-05, "loss": 0.9010749459266663, "mean_token_accuracy": 0.7568229958415031, "num_tokens": 689100.0, "step": 47 }, { "entropy": 1.329409897327423, "epoch": 0.2859270290394639, "grad_norm": 0.404296875, "learning_rate": 1.957391532867418e-05, "loss": 0.889941930770874, "mean_token_accuracy": 0.7545234337449074, "num_tokens": 703112.0, "step": 48 }, { "entropy": 1.2916735112667084, "epoch": 0.29188384214445273, "grad_norm": 0.375, "learning_rate": 1.955572805786141e-05, "loss": 0.8604971170425415, "mean_token_accuracy": 0.7610657885670662, "num_tokens": 718088.0, "step": 49 }, { "entropy": 1.3215313851833344, "epoch": 0.29784065524944153, "grad_norm": 0.373046875, "learning_rate": 1.953716950748227e-05, "loss": 0.8792937994003296, "mean_token_accuracy": 0.7575221061706543, "num_tokens": 732625.0, "step": 50 }, { "entropy": 1.3200262635946274, "epoch": 0.3037974683544304, "grad_norm": 0.369140625, "learning_rate": 1.9518240398613226e-05, "loss": 0.891180157661438, "mean_token_accuracy": 0.7595923095941544, "num_tokens": 747023.0, "step": 51 }, { "entropy": 1.3076974749565125, "epoch": 0.3097542814594192, "grad_norm": 0.365234375, "learning_rate": 1.9498941466728462e-05, "loss": 0.8625985383987427, "mean_token_accuracy": 0.7610806971788406, "num_tokens": 762573.0, "step": 52 }, { "entropy": 1.3317556381225586, "epoch": 0.31571109456440805, "grad_norm": 0.365234375, "learning_rate": 1.947927346167132e-05, "loss": 0.8708853721618652, "mean_token_accuracy": 0.7519596815109253, "num_tokens": 777221.0, "step": 53 }, { "entropy": 1.354643628001213, "epoch": 0.32166790766939685, "grad_norm": 0.36328125, "learning_rate": 1.945923714762516e-05, "loss": 0.9412155151367188, "mean_token_accuracy": 0.7419139668345451, "num_tokens": 792127.0, "step": 54 }, { "entropy": 1.3347897082567215, "epoch": 0.3276247207743857, "grad_norm": 0.365234375, "learning_rate": 1.9438833303083677e-05, "loss": 0.8442082405090332, "mean_token_accuracy": 0.7618155255913734, "num_tokens": 806760.0, "step": 55 }, { "entropy": 1.3102798759937286, "epoch": 0.33358153387937456, "grad_norm": 0.359375, "learning_rate": 1.9418062720820636e-05, "loss": 0.8157958984375, "mean_token_accuracy": 0.7714768648147583, "num_tokens": 821430.0, "step": 56 }, { "entropy": 1.3602834939956665, "epoch": 0.33953834698436336, "grad_norm": 0.373046875, "learning_rate": 1.9396926207859085e-05, "loss": 0.9252448678016663, "mean_token_accuracy": 0.7447722256183624, "num_tokens": 835919.0, "step": 57 }, { "entropy": 1.3342349529266357, "epoch": 0.3454951600893522, "grad_norm": 0.369140625, "learning_rate": 1.9375424585439994e-05, "loss": 0.9243099689483643, "mean_token_accuracy": 0.7476465478539467, "num_tokens": 851231.0, "step": 58 }, { "entropy": 1.3102659434080124, "epoch": 0.351451973194341, "grad_norm": 0.3515625, "learning_rate": 1.935355868899034e-05, "loss": 0.7817438840866089, "mean_token_accuracy": 0.7773127183318138, "num_tokens": 865741.0, "step": 59 }, { "entropy": 1.3435720950365067, "epoch": 0.3574087862993299, "grad_norm": 0.404296875, "learning_rate": 1.9331329368090664e-05, "loss": 0.897109866142273, "mean_token_accuracy": 0.7542032599449158, "num_tokens": 879839.0, "step": 60 }, { "entropy": 1.3139615505933762, "epoch": 0.3633655994043187, "grad_norm": 0.357421875, "learning_rate": 1.9308737486442045e-05, "loss": 0.8411209583282471, "mean_token_accuracy": 0.768218956887722, "num_tokens": 894957.0, "step": 61 }, { "entropy": 1.354519784450531, "epoch": 0.36932241250930753, "grad_norm": 0.388671875, "learning_rate": 1.9285783921832537e-05, "loss": 0.9316556453704834, "mean_token_accuracy": 0.7457900270819664, "num_tokens": 909035.0, "step": 62 }, { "entropy": 1.2865931391716003, "epoch": 0.37527922561429633, "grad_norm": 0.365234375, "learning_rate": 1.926246956610309e-05, "loss": 0.8276340961456299, "mean_token_accuracy": 0.7709004059433937, "num_tokens": 923699.0, "step": 63 }, { "entropy": 1.2839124202728271, "epoch": 0.3812360387192852, "grad_norm": 0.357421875, "learning_rate": 1.9238795325112867e-05, "loss": 0.792696475982666, "mean_token_accuracy": 0.7811732813715935, "num_tokens": 937978.0, "step": 64 }, { "entropy": 1.2945790588855743, "epoch": 0.387192851824274, "grad_norm": 0.359375, "learning_rate": 1.921476211870408e-05, "loss": 0.874768853187561, "mean_token_accuracy": 0.7566314563155174, "num_tokens": 953189.0, "step": 65 }, { "entropy": 1.3046975582838058, "epoch": 0.39314966492926284, "grad_norm": 0.36328125, "learning_rate": 1.9190370880666206e-05, "loss": 0.8540111780166626, "mean_token_accuracy": 0.7612261921167374, "num_tokens": 967694.0, "step": 66 }, { "entropy": 1.3215627670288086, "epoch": 0.3991064780342517, "grad_norm": 0.384765625, "learning_rate": 1.9165622558699763e-05, "loss": 0.9076806306838989, "mean_token_accuracy": 0.7566501572728157, "num_tokens": 981909.0, "step": 67 }, { "entropy": 1.2821516543626785, "epoch": 0.4050632911392405, "grad_norm": 0.35546875, "learning_rate": 1.9140518114379433e-05, "loss": 0.8209891319274902, "mean_token_accuracy": 0.7717649862170219, "num_tokens": 996738.0, "step": 68 }, { "entropy": 1.3115236312150955, "epoch": 0.41102010424422936, "grad_norm": 0.341796875, "learning_rate": 1.9115058523116734e-05, "loss": 0.8256929516792297, "mean_token_accuracy": 0.7650889083743095, "num_tokens": 1011216.0, "step": 69 }, { "entropy": 1.3014082163572311, "epoch": 0.41697691734921816, "grad_norm": 0.33984375, "learning_rate": 1.908924477412211e-05, "loss": 0.8159216046333313, "mean_token_accuracy": 0.7695104703307152, "num_tokens": 1026284.0, "step": 70 }, { "entropy": 1.3315211981534958, "epoch": 0.422933730454207, "grad_norm": 0.349609375, "learning_rate": 1.9063077870366504e-05, "loss": 0.8810704350471497, "mean_token_accuracy": 0.7593883574008942, "num_tokens": 1041027.0, "step": 71 }, { "entropy": 1.3138697743415833, "epoch": 0.4288905435591958, "grad_norm": 0.330078125, "learning_rate": 1.903655882854237e-05, "loss": 0.8666151762008667, "mean_token_accuracy": 0.7636753916740417, "num_tokens": 1056203.0, "step": 72 }, { "entropy": 1.3296868354082108, "epoch": 0.43484735666418467, "grad_norm": 0.38671875, "learning_rate": 1.900968867902419e-05, "loss": 0.8226944804191589, "mean_token_accuracy": 0.7660787329077721, "num_tokens": 1069994.0, "step": 73 }, { "entropy": 1.327721655368805, "epoch": 0.44080416976917347, "grad_norm": 0.384765625, "learning_rate": 1.898246846582844e-05, "loss": 0.8633409738540649, "mean_token_accuracy": 0.7588323205709457, "num_tokens": 1084280.0, "step": 74 }, { "entropy": 1.2736104279756546, "epoch": 0.4467609828741623, "grad_norm": 0.345703125, "learning_rate": 1.895489924657301e-05, "loss": 0.7951964139938354, "mean_token_accuracy": 0.7775014489889145, "num_tokens": 1099332.0, "step": 75 }, { "entropy": 1.2568956762552261, "epoch": 0.4527177959791511, "grad_norm": 0.390625, "learning_rate": 1.8926982092436117e-05, "loss": 0.7958716750144958, "mean_token_accuracy": 0.7729126885533333, "num_tokens": 1113758.0, "step": 76 }, { "entropy": 1.2585568279027939, "epoch": 0.45867460908414, "grad_norm": 0.353515625, "learning_rate": 1.8898718088114688e-05, "loss": 0.8418722152709961, "mean_token_accuracy": 0.7698204517364502, "num_tokens": 1128814.0, "step": 77 }, { "entropy": 1.2552629113197327, "epoch": 0.46463142218912884, "grad_norm": 0.353515625, "learning_rate": 1.887010833178222e-05, "loss": 0.7894448041915894, "mean_token_accuracy": 0.7702115252614021, "num_tokens": 1143044.0, "step": 78 }, { "entropy": 1.237639144062996, "epoch": 0.47058823529411764, "grad_norm": 0.357421875, "learning_rate": 1.8841153935046098e-05, "loss": 0.7948979735374451, "mean_token_accuracy": 0.7740144208073616, "num_tokens": 1158074.0, "step": 79 }, { "entropy": 1.2586966007947922, "epoch": 0.4765450483991065, "grad_norm": 0.375, "learning_rate": 1.8811856022904423e-05, "loss": 0.8225394487380981, "mean_token_accuracy": 0.7743681222200394, "num_tokens": 1172247.0, "step": 80 }, { "entropy": 1.2005833238363266, "epoch": 0.4825018615040953, "grad_norm": 0.341796875, "learning_rate": 1.8782215733702286e-05, "loss": 0.7371789216995239, "mean_token_accuracy": 0.7894127815961838, "num_tokens": 1187054.0, "step": 81 }, { "entropy": 1.2627707123756409, "epoch": 0.48845867460908415, "grad_norm": 0.365234375, "learning_rate": 1.8752234219087538e-05, "loss": 0.8591660857200623, "mean_token_accuracy": 0.7659735381603241, "num_tokens": 1201655.0, "step": 82 }, { "entropy": 1.2909194976091385, "epoch": 0.49441548771407295, "grad_norm": 0.376953125, "learning_rate": 1.8721912643966055e-05, "loss": 0.8661763072013855, "mean_token_accuracy": 0.7588073536753654, "num_tokens": 1215941.0, "step": 83 }, { "entropy": 1.2870348989963531, "epoch": 0.5003723008190618, "grad_norm": 0.359375, "learning_rate": 1.8691252186456465e-05, "loss": 0.830467939376831, "mean_token_accuracy": 0.7688242942094803, "num_tokens": 1230066.0, "step": 84 }, { "entropy": 1.2635858803987503, "epoch": 0.5063291139240507, "grad_norm": 0.34765625, "learning_rate": 1.866025403784439e-05, "loss": 0.8112859725952148, "mean_token_accuracy": 0.7699639350175858, "num_tokens": 1245411.0, "step": 85 }, { "entropy": 1.2944375872612, "epoch": 0.5122859270290394, "grad_norm": 0.330078125, "learning_rate": 1.862891940253613e-05, "loss": 0.8428732752799988, "mean_token_accuracy": 0.7625590562820435, "num_tokens": 1260081.0, "step": 86 }, { "entropy": 1.2768390029668808, "epoch": 0.5182427401340283, "grad_norm": 0.333984375, "learning_rate": 1.8597249498011906e-05, "loss": 0.7818429470062256, "mean_token_accuracy": 0.7796064242720604, "num_tokens": 1274169.0, "step": 87 }, { "entropy": 1.2663612216711044, "epoch": 0.5241995532390171, "grad_norm": 0.34765625, "learning_rate": 1.8565245554778516e-05, "loss": 0.7885245084762573, "mean_token_accuracy": 0.7747808918356895, "num_tokens": 1288810.0, "step": 88 }, { "entropy": 1.299068808555603, "epoch": 0.530156366344006, "grad_norm": 0.36328125, "learning_rate": 1.8532908816321557e-05, "loss": 0.8310455083847046, "mean_token_accuracy": 0.7649297416210175, "num_tokens": 1303352.0, "step": 89 }, { "entropy": 1.2907497137784958, "epoch": 0.5361131794489948, "grad_norm": 0.359375, "learning_rate": 1.8500240539057093e-05, "loss": 0.8416677713394165, "mean_token_accuracy": 0.7609433010220528, "num_tokens": 1317948.0, "step": 90 }, { "entropy": 1.3166047036647797, "epoch": 0.5420699925539836, "grad_norm": 0.35546875, "learning_rate": 1.8467241992282842e-05, "loss": 0.8960973024368286, "mean_token_accuracy": 0.7464632913470268, "num_tokens": 1332383.0, "step": 91 }, { "entropy": 1.2651972472667694, "epoch": 0.5480268056589724, "grad_norm": 0.341796875, "learning_rate": 1.843391445812886e-05, "loss": 0.7947843074798584, "mean_token_accuracy": 0.7730053663253784, "num_tokens": 1346797.0, "step": 92 }, { "entropy": 1.2707823663949966, "epoch": 0.5539836187639613, "grad_norm": 0.359375, "learning_rate": 1.8400259231507716e-05, "loss": 0.7787963151931763, "mean_token_accuracy": 0.7789562344551086, "num_tokens": 1360935.0, "step": 93 }, { "entropy": 1.2486981898546219, "epoch": 0.5599404318689502, "grad_norm": 0.326171875, "learning_rate": 1.83662776200642e-05, "loss": 0.7839233875274658, "mean_token_accuracy": 0.7764812558889389, "num_tokens": 1375392.0, "step": 94 }, { "entropy": 1.2385842353105545, "epoch": 0.5658972449739389, "grad_norm": 0.3515625, "learning_rate": 1.833197094412449e-05, "loss": 0.7750946283340454, "mean_token_accuracy": 0.7754370123147964, "num_tokens": 1389642.0, "step": 95 }, { "entropy": 1.2582454234361649, "epoch": 0.5718540580789278, "grad_norm": 0.349609375, "learning_rate": 1.8297340536644877e-05, "loss": 0.8087575435638428, "mean_token_accuracy": 0.7721517831087112, "num_tokens": 1404072.0, "step": 96 }, { "entropy": 1.2536737322807312, "epoch": 0.5778108711839166, "grad_norm": 0.337890625, "learning_rate": 1.826238774315995e-05, "loss": 0.7741163372993469, "mean_token_accuracy": 0.7778245881199837, "num_tokens": 1418644.0, "step": 97 }, { "entropy": 1.2571983486413956, "epoch": 0.5837676842889055, "grad_norm": 0.357421875, "learning_rate": 1.8227113921730336e-05, "loss": 0.7704818844795227, "mean_token_accuracy": 0.7764224410057068, "num_tokens": 1432848.0, "step": 98 }, { "entropy": 1.2861786782741547, "epoch": 0.5897244973938943, "grad_norm": 0.404296875, "learning_rate": 1.819152044288992e-05, "loss": 0.840486466884613, "mean_token_accuracy": 0.7590076252818108, "num_tokens": 1446026.0, "step": 99 }, { "entropy": 1.259141594171524, "epoch": 0.5956813104988831, "grad_norm": 0.365234375, "learning_rate": 1.8155608689592604e-05, "loss": 0.8282920718193054, "mean_token_accuracy": 0.7636805027723312, "num_tokens": 1461039.0, "step": 100 }, { "entropy": 1.259206235408783, "epoch": 0.6016381236038719, "grad_norm": 0.345703125, "learning_rate": 1.811938005715857e-05, "loss": 0.7743256092071533, "mean_token_accuracy": 0.779683418571949, "num_tokens": 1475526.0, "step": 101 }, { "entropy": 1.2759947627782822, "epoch": 0.6075949367088608, "grad_norm": 0.34765625, "learning_rate": 1.8082835953220055e-05, "loss": 0.8088581562042236, "mean_token_accuracy": 0.7721528932452202, "num_tokens": 1489823.0, "step": 102 }, { "entropy": 1.293590635061264, "epoch": 0.6135517498138496, "grad_norm": 0.412109375, "learning_rate": 1.8045977797666685e-05, "loss": 0.8578399419784546, "mean_token_accuracy": 0.7592629492282867, "num_tokens": 1504383.0, "step": 103 }, { "entropy": 1.333486557006836, "epoch": 0.6195085629188384, "grad_norm": 0.396484375, "learning_rate": 1.8008807022590283e-05, "loss": 0.8810866475105286, "mean_token_accuracy": 0.7484598457813263, "num_tokens": 1517806.0, "step": 104 }, { "entropy": 1.2660276144742966, "epoch": 0.6254653760238272, "grad_norm": 0.357421875, "learning_rate": 1.7971325072229227e-05, "loss": 0.84173184633255, "mean_token_accuracy": 0.7654049769043922, "num_tokens": 1532497.0, "step": 105 }, { "entropy": 1.2698614448308945, "epoch": 0.6314221891288161, "grad_norm": 0.345703125, "learning_rate": 1.7933533402912354e-05, "loss": 0.8295232653617859, "mean_token_accuracy": 0.7681133523583412, "num_tokens": 1547634.0, "step": 106 }, { "entropy": 1.2812798023223877, "epoch": 0.637379002233805, "grad_norm": 0.33984375, "learning_rate": 1.7895433483002356e-05, "loss": 0.8399749398231506, "mean_token_accuracy": 0.7694036960601807, "num_tokens": 1562026.0, "step": 107 }, { "entropy": 1.3091949224472046, "epoch": 0.6433358153387937, "grad_norm": 0.404296875, "learning_rate": 1.785702679283874e-05, "loss": 0.8679311871528625, "mean_token_accuracy": 0.7622929587960243, "num_tokens": 1575785.0, "step": 108 }, { "entropy": 1.2573847621679306, "epoch": 0.6492926284437825, "grad_norm": 0.345703125, "learning_rate": 1.78183148246803e-05, "loss": 0.8026180863380432, "mean_token_accuracy": 0.7683332338929176, "num_tokens": 1591294.0, "step": 109 }, { "entropy": 1.2880352437496185, "epoch": 0.6552494415487714, "grad_norm": 0.361328125, "learning_rate": 1.777929908264715e-05, "loss": 0.8197344541549683, "mean_token_accuracy": 0.7702998444437981, "num_tokens": 1604958.0, "step": 110 }, { "entropy": 1.2673484981060028, "epoch": 0.6612062546537603, "grad_norm": 0.36328125, "learning_rate": 1.7739981082662275e-05, "loss": 0.8381748199462891, "mean_token_accuracy": 0.7616433724761009, "num_tokens": 1620204.0, "step": 111 }, { "entropy": 1.2442313134670258, "epoch": 0.6671630677587491, "grad_norm": 0.337890625, "learning_rate": 1.7700362352392632e-05, "loss": 0.7782060503959656, "mean_token_accuracy": 0.7786413952708244, "num_tokens": 1635257.0, "step": 112 }, { "entropy": 1.2735689878463745, "epoch": 0.6731198808637379, "grad_norm": 0.392578125, "learning_rate": 1.766044443118978e-05, "loss": 0.8409761786460876, "mean_token_accuracy": 0.7633680775761604, "num_tokens": 1649668.0, "step": 113 }, { "entropy": 1.280581310391426, "epoch": 0.6790766939687267, "grad_norm": 0.35546875, "learning_rate": 1.762022887003011e-05, "loss": 0.819488525390625, "mean_token_accuracy": 0.768619529902935, "num_tokens": 1663868.0, "step": 114 }, { "entropy": 1.2455193400382996, "epoch": 0.6850335070737156, "grad_norm": 0.361328125, "learning_rate": 1.757971723145453e-05, "loss": 0.7443034648895264, "mean_token_accuracy": 0.785475604236126, "num_tokens": 1678332.0, "step": 115 }, { "entropy": 1.2718180269002914, "epoch": 0.6909903201787044, "grad_norm": 0.349609375, "learning_rate": 1.75389110895078e-05, "loss": 0.8380476832389832, "mean_token_accuracy": 0.7637294083833694, "num_tokens": 1692798.0, "step": 116 }, { "entropy": 1.28805373609066, "epoch": 0.6969471332836932, "grad_norm": 0.373046875, "learning_rate": 1.7497812029677344e-05, "loss": 0.7940935492515564, "mean_token_accuracy": 0.7718535214662552, "num_tokens": 1706403.0, "step": 117 }, { "entropy": 1.2754413783550262, "epoch": 0.702903946388682, "grad_norm": 0.359375, "learning_rate": 1.7456421648831658e-05, "loss": 0.79500412940979, "mean_token_accuracy": 0.7691502496600151, "num_tokens": 1720637.0, "step": 118 }, { "entropy": 1.2628609538078308, "epoch": 0.7088607594936709, "grad_norm": 0.34375, "learning_rate": 1.741474155515827e-05, "loss": 0.8258920907974243, "mean_token_accuracy": 0.7655653059482574, "num_tokens": 1735839.0, "step": 119 }, { "entropy": 1.2739417552947998, "epoch": 0.7148175725986597, "grad_norm": 0.369140625, "learning_rate": 1.737277336810124e-05, "loss": 0.7685380578041077, "mean_token_accuracy": 0.7830494046211243, "num_tokens": 1750093.0, "step": 120 }, { "entropy": 1.2557980716228485, "epoch": 0.7207743857036486, "grad_norm": 0.36328125, "learning_rate": 1.7330518718298263e-05, "loss": 0.8203400373458862, "mean_token_accuracy": 0.7682551443576813, "num_tokens": 1765040.0, "step": 121 }, { "entropy": 1.2622184306383133, "epoch": 0.7267311988086373, "grad_norm": 0.359375, "learning_rate": 1.7287979247517285e-05, "loss": 0.8228541612625122, "mean_token_accuracy": 0.7695576474070549, "num_tokens": 1779610.0, "step": 122 }, { "entropy": 1.2455091774463654, "epoch": 0.7326880119136262, "grad_norm": 0.353515625, "learning_rate": 1.7245156608592727e-05, "loss": 0.754838228225708, "mean_token_accuracy": 0.7866516560316086, "num_tokens": 1794351.0, "step": 123 }, { "entropy": 1.2472401857376099, "epoch": 0.7386448250186151, "grad_norm": 0.361328125, "learning_rate": 1.7202052465361268e-05, "loss": 0.8274670243263245, "mean_token_accuracy": 0.7684604525566101, "num_tokens": 1809510.0, "step": 124 }, { "entropy": 1.2943197786808014, "epoch": 0.7446016381236039, "grad_norm": 0.373046875, "learning_rate": 1.7158668492597186e-05, "loss": 0.858670711517334, "mean_token_accuracy": 0.7580647841095924, "num_tokens": 1823089.0, "step": 125 }, { "entropy": 1.2716920524835587, "epoch": 0.7505584512285927, "grad_norm": 0.369140625, "learning_rate": 1.7115006375947304e-05, "loss": 0.8383840918540955, "mean_token_accuracy": 0.7634381875395775, "num_tokens": 1837660.0, "step": 126 }, { "entropy": 1.2710201442241669, "epoch": 0.7565152643335815, "grad_norm": 0.3671875, "learning_rate": 1.7071067811865477e-05, "loss": 0.8363803625106812, "mean_token_accuracy": 0.7592340558767319, "num_tokens": 1851869.0, "step": 127 }, { "entropy": 1.2555763572454453, "epoch": 0.7624720774385704, "grad_norm": 0.36328125, "learning_rate": 1.7026854507546694e-05, "loss": 0.7854242324829102, "mean_token_accuracy": 0.7739197090268135, "num_tokens": 1866454.0, "step": 128 }, { "entropy": 1.2632461488246918, "epoch": 0.7684288905435592, "grad_norm": 0.349609375, "learning_rate": 1.698236818086073e-05, "loss": 0.8233469724655151, "mean_token_accuracy": 0.7627609372138977, "num_tokens": 1880761.0, "step": 129 }, { "entropy": 1.252721443772316, "epoch": 0.774385703648548, "grad_norm": 0.34765625, "learning_rate": 1.693761056028542e-05, "loss": 0.8479862213134766, "mean_token_accuracy": 0.7652608901262283, "num_tokens": 1895812.0, "step": 130 }, { "entropy": 1.2346957474946976, "epoch": 0.7803425167535368, "grad_norm": 0.33203125, "learning_rate": 1.689258338483947e-05, "loss": 0.7700930237770081, "mean_token_accuracy": 0.7812119647860527, "num_tokens": 1910875.0, "step": 131 }, { "entropy": 1.2443837672472, "epoch": 0.7862993298585257, "grad_norm": 0.33984375, "learning_rate": 1.6847288404014937e-05, "loss": 0.7806112766265869, "mean_token_accuracy": 0.7737433910369873, "num_tokens": 1925210.0, "step": 132 }, { "entropy": 1.2574907839298248, "epoch": 0.7922561429635145, "grad_norm": 0.349609375, "learning_rate": 1.6801727377709195e-05, "loss": 0.7916486263275146, "mean_token_accuracy": 0.7723786979913712, "num_tokens": 1939706.0, "step": 133 }, { "entropy": 1.240403950214386, "epoch": 0.7982129560685034, "grad_norm": 0.361328125, "learning_rate": 1.6755902076156606e-05, "loss": 0.7764307260513306, "mean_token_accuracy": 0.7722450792789459, "num_tokens": 1953951.0, "step": 134 }, { "entropy": 1.2047400623559952, "epoch": 0.8041697691734921, "grad_norm": 0.341796875, "learning_rate": 1.67098142798597e-05, "loss": 0.7488443851470947, "mean_token_accuracy": 0.7864288538694382, "num_tokens": 1968478.0, "step": 135 }, { "entropy": 1.2280729860067368, "epoch": 0.810126582278481, "grad_norm": 0.35546875, "learning_rate": 1.6663465779520042e-05, "loss": 0.7793049216270447, "mean_token_accuracy": 0.7834365740418434, "num_tokens": 1982972.0, "step": 136 }, { "entropy": 1.2266123741865158, "epoch": 0.8160833953834699, "grad_norm": 0.34765625, "learning_rate": 1.6616858375968596e-05, "loss": 0.7857159376144409, "mean_token_accuracy": 0.7744308784604073, "num_tokens": 1997617.0, "step": 137 }, { "entropy": 1.229455679655075, "epoch": 0.8220402084884587, "grad_norm": 0.36328125, "learning_rate": 1.6569993880095807e-05, "loss": 0.8067857623100281, "mean_token_accuracy": 0.7750186920166016, "num_tokens": 2011907.0, "step": 138 }, { "entropy": 1.234218791127205, "epoch": 0.8279970215934475, "grad_norm": 0.35546875, "learning_rate": 1.6522874112781213e-05, "loss": 0.8134928941726685, "mean_token_accuracy": 0.7728847786784172, "num_tokens": 2026748.0, "step": 139 }, { "entropy": 1.2340240478515625, "epoch": 0.8339538346984363, "grad_norm": 0.345703125, "learning_rate": 1.6475500904822707e-05, "loss": 0.7837961912155151, "mean_token_accuracy": 0.7767920717597008, "num_tokens": 2041028.0, "step": 140 }, { "entropy": 1.2047637104988098, "epoch": 0.8399106478034252, "grad_norm": 0.337890625, "learning_rate": 1.6427876096865394e-05, "loss": 0.7514673471450806, "mean_token_accuracy": 0.7840846851468086, "num_tokens": 2056459.0, "step": 141 }, { "entropy": 1.2402971684932709, "epoch": 0.845867460908414, "grad_norm": 0.341796875, "learning_rate": 1.6380001539330088e-05, "loss": 0.8099113702774048, "mean_token_accuracy": 0.7708609700202942, "num_tokens": 2071572.0, "step": 142 }, { "entropy": 1.2505415827035904, "epoch": 0.8518242740134029, "grad_norm": 0.341796875, "learning_rate": 1.6331879092341402e-05, "loss": 0.8279533386230469, "mean_token_accuracy": 0.7612129226326942, "num_tokens": 2086270.0, "step": 143 }, { "entropy": 1.23782616853714, "epoch": 0.8577810871183916, "grad_norm": 0.33984375, "learning_rate": 1.6283510625655474e-05, "loss": 0.7820447683334351, "mean_token_accuracy": 0.7787378579378128, "num_tokens": 2100982.0, "step": 144 }, { "entropy": 1.2248000502586365, "epoch": 0.8637379002233805, "grad_norm": 0.318359375, "learning_rate": 1.6234898018587336e-05, "loss": 0.7593281269073486, "mean_token_accuracy": 0.778163269162178, "num_tokens": 2115803.0, "step": 145 }, { "entropy": 1.2075249254703522, "epoch": 0.8696947133283693, "grad_norm": 0.31640625, "learning_rate": 1.6186043159937884e-05, "loss": 0.7119603753089905, "mean_token_accuracy": 0.7936617583036423, "num_tokens": 2130971.0, "step": 146 }, { "entropy": 1.2165881991386414, "epoch": 0.8756515264333582, "grad_norm": 0.322265625, "learning_rate": 1.6136947947920477e-05, "loss": 0.740675687789917, "mean_token_accuracy": 0.7878302410244942, "num_tokens": 2145552.0, "step": 147 }, { "entropy": 1.2430049926042557, "epoch": 0.8816083395383469, "grad_norm": 0.361328125, "learning_rate": 1.608761429008721e-05, "loss": 0.8482354283332825, "mean_token_accuracy": 0.7628344818949699, "num_tokens": 2160069.0, "step": 148 }, { "entropy": 1.183465838432312, "epoch": 0.8875651526433358, "grad_norm": 0.34375, "learning_rate": 1.6038044103254775e-05, "loss": 0.7142577171325684, "mean_token_accuracy": 0.7939940765500069, "num_tokens": 2175381.0, "step": 149 }, { "entropy": 1.2008293867111206, "epoch": 0.8935219657483247, "grad_norm": 0.345703125, "learning_rate": 1.5988239313430004e-05, "loss": 0.760569155216217, "mean_token_accuracy": 0.7821842804551125, "num_tokens": 2190275.0, "step": 150 }, { "entropy": 1.2101170867681503, "epoch": 0.8994787788533135, "grad_norm": 0.337890625, "learning_rate": 1.5938201855735017e-05, "loss": 0.7829165458679199, "mean_token_accuracy": 0.7733455300331116, "num_tokens": 2204775.0, "step": 151 }, { "entropy": 1.232336938381195, "epoch": 0.9054355919583023, "grad_norm": 0.357421875, "learning_rate": 1.5887933674332048e-05, "loss": 0.8415957689285278, "mean_token_accuracy": 0.7633619755506516, "num_tokens": 2219016.0, "step": 152 }, { "entropy": 1.1960958242416382, "epoch": 0.9113924050632911, "grad_norm": 0.328125, "learning_rate": 1.5837436722347902e-05, "loss": 0.7200090885162354, "mean_token_accuracy": 0.7941614985466003, "num_tokens": 2233377.0, "step": 153 }, { "entropy": 1.1901395469903946, "epoch": 0.91734921816828, "grad_norm": 0.337890625, "learning_rate": 1.578671296179806e-05, "loss": 0.7320102453231812, "mean_token_accuracy": 0.7907885834574699, "num_tokens": 2248523.0, "step": 154 }, { "entropy": 1.205485075712204, "epoch": 0.9233060312732688, "grad_norm": 0.3359375, "learning_rate": 1.573576436351046e-05, "loss": 0.7730504870414734, "mean_token_accuracy": 0.7801787778735161, "num_tokens": 2263288.0, "step": 155 }, { "entropy": 1.2493800967931747, "epoch": 0.9292628443782577, "grad_norm": 0.3359375, "learning_rate": 1.5684592907048925e-05, "loss": 0.792695164680481, "mean_token_accuracy": 0.7768412679433823, "num_tokens": 2278085.0, "step": 156 }, { "entropy": 1.222463384270668, "epoch": 0.9352196574832464, "grad_norm": 0.341796875, "learning_rate": 1.563320058063622e-05, "loss": 0.7253803610801697, "mean_token_accuracy": 0.7881602421402931, "num_tokens": 2292673.0, "step": 157 }, { "entropy": 1.2182011902332306, "epoch": 0.9411764705882353, "grad_norm": 0.31640625, "learning_rate": 1.5581589381076843e-05, "loss": 0.7509200572967529, "mean_token_accuracy": 0.7809579819440842, "num_tokens": 2307646.0, "step": 158 }, { "entropy": 1.2366309016942978, "epoch": 0.9471332836932241, "grad_norm": 0.337890625, "learning_rate": 1.5529761313679396e-05, "loss": 0.7257631421089172, "mean_token_accuracy": 0.7827246561646461, "num_tokens": 2321559.0, "step": 159 }, { "entropy": 1.2403675764799118, "epoch": 0.953090096798213, "grad_norm": 0.337890625, "learning_rate": 1.5477718392178716e-05, "loss": 0.8105670809745789, "mean_token_accuracy": 0.7707022428512573, "num_tokens": 2336203.0, "step": 160 }, { "entropy": 1.2477657943964005, "epoch": 0.9590469099032017, "grad_norm": 0.36328125, "learning_rate": 1.5425462638657597e-05, "loss": 0.9120197296142578, "mean_token_accuracy": 0.7492518648505211, "num_tokens": 2351344.0, "step": 161 }, { "entropy": 1.1972443461418152, "epoch": 0.9650037230081906, "grad_norm": 0.32421875, "learning_rate": 1.5372996083468242e-05, "loss": 0.7211199402809143, "mean_token_accuracy": 0.7921843752264977, "num_tokens": 2366108.0, "step": 162 }, { "entropy": 1.1903489977121353, "epoch": 0.9709605361131795, "grad_norm": 0.337890625, "learning_rate": 1.5320320765153367e-05, "loss": 0.7322642207145691, "mean_token_accuracy": 0.7919035404920578, "num_tokens": 2381068.0, "step": 163 }, { "entropy": 1.206245943903923, "epoch": 0.9769173492181683, "grad_norm": 0.34375, "learning_rate": 1.526743873036701e-05, "loss": 0.7425603270530701, "mean_token_accuracy": 0.7824821397662163, "num_tokens": 2395295.0, "step": 164 }, { "entropy": 1.2014246433973312, "epoch": 0.9828741623231572, "grad_norm": 0.34375, "learning_rate": 1.5214352033794981e-05, "loss": 0.807823121547699, "mean_token_accuracy": 0.7702382802963257, "num_tokens": 2410456.0, "step": 165 }, { "entropy": 1.211999848484993, "epoch": 0.9888309754281459, "grad_norm": 0.369140625, "learning_rate": 1.5161062738075068e-05, "loss": 0.7507081627845764, "mean_token_accuracy": 0.7832650169730186, "num_tokens": 2424439.0, "step": 166 }, { "entropy": 1.2110302299261093, "epoch": 0.9947877885331348, "grad_norm": 0.36328125, "learning_rate": 1.5107572913716859e-05, "loss": 0.787371814250946, "mean_token_accuracy": 0.7756073325872421, "num_tokens": 2438585.0, "step": 167 }, { "entropy": 1.2203376974378313, "epoch": 1.0, "grad_norm": 0.373046875, "learning_rate": 1.505388463902131e-05, "loss": 0.8217554688453674, "mean_token_accuracy": 0.7624766315732684, "num_tokens": 2452101.0, "step": 168 }, { "epoch": 1.0, "eval_entropy": 1.2118239323298137, "eval_loss": 0.775408923625946, "eval_mean_token_accuracy": 0.7765555028120676, "eval_model_preparation_time": 0.0053, "eval_num_tokens": 2452101.0, "eval_runtime": 26.4936, "eval_samples_per_second": 5.662, "eval_steps_per_second": 5.662, "step": 168 } ], "logging_steps": 1, "max_steps": 504, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.1041699975881523e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }