codingmonster1234's picture
Upload folder using huggingface_hub
3b24b3e verified
Raw
History Blame Contribute Delete
50.4 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 168,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.8196021169424057,
"epoch": 0.005956813104988831,
"grad_norm": 1.28125,
"learning_rate": 2e-05,
"loss": 1.7708154916763306,
"mean_token_accuracy": 0.599120743572712,
"num_tokens": 14922.0,
"step": 1
},
{
"entropy": 1.2802767902612686,
"epoch": 0.011913626209977662,
"grad_norm": 3.953125,
"learning_rate": 1.9999805729315383e-05,
"loss": 2.1650872230529785,
"mean_token_accuracy": 0.5873465985059738,
"num_tokens": 30082.0,
"step": 2
},
{
"entropy": 1.7827413529157639,
"epoch": 0.017870439314966492,
"grad_norm": 1.3203125,
"learning_rate": 1.999922292480975e-05,
"loss": 1.5451161861419678,
"mean_token_accuracy": 0.6535470560193062,
"num_tokens": 44458.0,
"step": 3
},
{
"entropy": 1.881892368197441,
"epoch": 0.023827252419955324,
"grad_norm": 0.65625,
"learning_rate": 1.9998251609127465e-05,
"loss": 1.400605320930481,
"mean_token_accuracy": 0.6719935461878777,
"num_tokens": 59381.0,
"step": 4
},
{
"entropy": 1.9049408286809921,
"epoch": 0.029784065524944156,
"grad_norm": 0.54296875,
"learning_rate": 1.9996891820008165e-05,
"loss": 1.3754955530166626,
"mean_token_accuracy": 0.6717504411935806,
"num_tokens": 74182.0,
"step": 5
},
{
"entropy": 1.79595048725605,
"epoch": 0.035740878629932984,
"grad_norm": 0.55859375,
"learning_rate": 1.9995143610285275e-05,
"loss": 1.2846546173095703,
"mean_token_accuracy": 0.6872891932725906,
"num_tokens": 88869.0,
"step": 6
},
{
"entropy": 1.6670185774564743,
"epoch": 0.04169769173492182,
"grad_norm": 0.5390625,
"learning_rate": 1.9993007047883988e-05,
"loss": 1.1514159440994263,
"mean_token_accuracy": 0.7146859243512154,
"num_tokens": 103614.0,
"step": 7
},
{
"entropy": 1.6106412559747696,
"epoch": 0.04765450483991065,
"grad_norm": 0.50390625,
"learning_rate": 1.999048221581858e-05,
"loss": 1.1496959924697876,
"mean_token_accuracy": 0.7096454501152039,
"num_tokens": 118065.0,
"step": 8
},
{
"entropy": 1.5453107059001923,
"epoch": 0.05361131794489948,
"grad_norm": 0.5078125,
"learning_rate": 1.9987569212189224e-05,
"loss": 1.142591118812561,
"mean_token_accuracy": 0.7142270430922508,
"num_tokens": 133029.0,
"step": 9
},
{
"entropy": 1.5210696011781693,
"epoch": 0.05956813104988831,
"grad_norm": 0.47265625,
"learning_rate": 1.998426815017817e-05,
"loss": 1.0974477529525757,
"mean_token_accuracy": 0.7146398201584816,
"num_tokens": 147810.0,
"step": 10
},
{
"entropy": 1.5126763880252838,
"epoch": 0.06552494415487714,
"grad_norm": 0.46875,
"learning_rate": 1.9980579158045322e-05,
"loss": 1.1492289304733276,
"mean_token_accuracy": 0.7059202417731285,
"num_tokens": 162781.0,
"step": 11
},
{
"entropy": 1.5258464515209198,
"epoch": 0.07148175725986597,
"grad_norm": 0.4375,
"learning_rate": 1.997650237912329e-05,
"loss": 1.068825125694275,
"mean_token_accuracy": 0.7209103479981422,
"num_tokens": 176562.0,
"step": 12
},
{
"entropy": 1.5423607379198074,
"epoch": 0.0774385703648548,
"grad_norm": 0.462890625,
"learning_rate": 1.9972037971811802e-05,
"loss": 1.1400907039642334,
"mean_token_accuracy": 0.7075617015361786,
"num_tokens": 190938.0,
"step": 13
},
{
"entropy": 1.5203707218170166,
"epoch": 0.08339538346984364,
"grad_norm": 0.42578125,
"learning_rate": 1.996718610957155e-05,
"loss": 1.0239043235778809,
"mean_token_accuracy": 0.7295805141329765,
"num_tokens": 205420.0,
"step": 14
},
{
"entropy": 1.5007787346839905,
"epoch": 0.08935219657483247,
"grad_norm": 0.40234375,
"learning_rate": 1.9961946980917457e-05,
"loss": 0.9978266358375549,
"mean_token_accuracy": 0.7387106791138649,
"num_tokens": 219949.0,
"step": 15
},
{
"entropy": 1.4767527133226395,
"epoch": 0.0953090096798213,
"grad_norm": 0.375,
"learning_rate": 1.9956320789411338e-05,
"loss": 1.0312634706497192,
"mean_token_accuracy": 0.7306794673204422,
"num_tokens": 235321.0,
"step": 16
},
{
"entropy": 1.4968346804380417,
"epoch": 0.10126582278481013,
"grad_norm": 0.41796875,
"learning_rate": 1.9950307753654016e-05,
"loss": 1.0707520246505737,
"mean_token_accuracy": 0.7274535074830055,
"num_tokens": 249201.0,
"step": 17
},
{
"entropy": 1.476852685213089,
"epoch": 0.10722263588979895,
"grad_norm": 0.4140625,
"learning_rate": 1.99439081072768e-05,
"loss": 1.0673410892486572,
"mean_token_accuracy": 0.7224985063076019,
"num_tokens": 263940.0,
"step": 18
},
{
"entropy": 1.4178977608680725,
"epoch": 0.11317944899478778,
"grad_norm": 0.404296875,
"learning_rate": 1.9937122098932428e-05,
"loss": 0.9890223741531372,
"mean_token_accuracy": 0.7390217557549477,
"num_tokens": 279156.0,
"step": 19
},
{
"entropy": 1.4455726444721222,
"epoch": 0.11913626209977662,
"grad_norm": 0.404296875,
"learning_rate": 1.9929949992285397e-05,
"loss": 1.0276429653167725,
"mean_token_accuracy": 0.7296848446130753,
"num_tokens": 293490.0,
"step": 20
},
{
"entropy": 1.4110448211431503,
"epoch": 0.12509307520476545,
"grad_norm": 0.380859375,
"learning_rate": 1.9922392066001724e-05,
"loss": 0.9719092845916748,
"mean_token_accuracy": 0.7374792844057083,
"num_tokens": 308809.0,
"step": 21
},
{
"entropy": 1.405819684267044,
"epoch": 0.13104988830975428,
"grad_norm": 0.392578125,
"learning_rate": 1.9914448613738107e-05,
"loss": 0.9487384557723999,
"mean_token_accuracy": 0.7479015067219734,
"num_tokens": 323801.0,
"step": 22
},
{
"entropy": 1.3968916982412338,
"epoch": 0.1370067014147431,
"grad_norm": 0.3828125,
"learning_rate": 1.9906119944130527e-05,
"loss": 0.9097103476524353,
"mean_token_accuracy": 0.7529696971178055,
"num_tokens": 338809.0,
"step": 23
},
{
"entropy": 1.4245737493038177,
"epoch": 0.14296351451973194,
"grad_norm": 0.36328125,
"learning_rate": 1.9897406380782262e-05,
"loss": 0.9830621480941772,
"mean_token_accuracy": 0.7378853410482407,
"num_tokens": 353678.0,
"step": 24
},
{
"entropy": 1.3906199932098389,
"epoch": 0.14892032762472077,
"grad_norm": 0.365234375,
"learning_rate": 1.9888308262251286e-05,
"loss": 0.9530032277107239,
"mean_token_accuracy": 0.7401829957962036,
"num_tokens": 368974.0,
"step": 25
},
{
"entropy": 1.4205086827278137,
"epoch": 0.1548771407297096,
"grad_norm": 0.400390625,
"learning_rate": 1.9878825942037147e-05,
"loss": 0.9490904211997986,
"mean_token_accuracy": 0.7428939715027809,
"num_tokens": 383442.0,
"step": 26
},
{
"entropy": 1.4382268190383911,
"epoch": 0.16083395383469842,
"grad_norm": 0.408203125,
"learning_rate": 1.9868959788567213e-05,
"loss": 0.9662237763404846,
"mean_token_accuracy": 0.7409680560231209,
"num_tokens": 397144.0,
"step": 27
},
{
"entropy": 1.4032137542963028,
"epoch": 0.16679076693968728,
"grad_norm": 0.392578125,
"learning_rate": 1.985871018518236e-05,
"loss": 0.9321739673614502,
"mean_token_accuracy": 0.7473694160580635,
"num_tokens": 411072.0,
"step": 28
},
{
"entropy": 1.4221246838569641,
"epoch": 0.1727475800446761,
"grad_norm": 0.3828125,
"learning_rate": 1.9848077530122083e-05,
"loss": 0.9609735012054443,
"mean_token_accuracy": 0.7417895272374153,
"num_tokens": 424984.0,
"step": 29
},
{
"entropy": 1.3734628409147263,
"epoch": 0.17870439314966494,
"grad_norm": 0.3671875,
"learning_rate": 1.9837062236509013e-05,
"loss": 0.8709937930107117,
"mean_token_accuracy": 0.7573041170835495,
"num_tokens": 439653.0,
"step": 30
},
{
"entropy": 1.4108192771673203,
"epoch": 0.18466120625465376,
"grad_norm": 0.423828125,
"learning_rate": 1.9825664732332886e-05,
"loss": 0.9877131581306458,
"mean_token_accuracy": 0.7332894876599312,
"num_tokens": 453859.0,
"step": 31
},
{
"entropy": 1.4060807824134827,
"epoch": 0.1906180193596426,
"grad_norm": 0.376953125,
"learning_rate": 1.981388546043388e-05,
"loss": 1.0199761390686035,
"mean_token_accuracy": 0.7262433990836143,
"num_tokens": 469134.0,
"step": 32
},
{
"entropy": 1.395486667752266,
"epoch": 0.19657483246463142,
"grad_norm": 0.3984375,
"learning_rate": 1.9801724878485438e-05,
"loss": 0.9763211011886597,
"mean_token_accuracy": 0.7416960969567299,
"num_tokens": 483181.0,
"step": 33
},
{
"entropy": 1.371009811758995,
"epoch": 0.20253164556962025,
"grad_norm": 0.3671875,
"learning_rate": 1.9789183458976485e-05,
"loss": 0.8935137391090393,
"mean_token_accuracy": 0.7588988393545151,
"num_tokens": 497611.0,
"step": 34
},
{
"entropy": 1.3474263399839401,
"epoch": 0.20848845867460908,
"grad_norm": 0.359375,
"learning_rate": 1.977626168919305e-05,
"loss": 0.8481594324111938,
"mean_token_accuracy": 0.7649582549929619,
"num_tokens": 511742.0,
"step": 35
},
{
"entropy": 1.3111611157655716,
"epoch": 0.2144452717795979,
"grad_norm": 0.3359375,
"learning_rate": 1.9762960071199334e-05,
"loss": 0.8989245891571045,
"mean_token_accuracy": 0.7640852630138397,
"num_tokens": 527336.0,
"step": 36
},
{
"entropy": 1.3298669755458832,
"epoch": 0.22040208488458674,
"grad_norm": 0.3671875,
"learning_rate": 1.9749279121818235e-05,
"loss": 0.8918904066085815,
"mean_token_accuracy": 0.7584179416298866,
"num_tokens": 541854.0,
"step": 37
},
{
"entropy": 1.3399434834718704,
"epoch": 0.22635889798957556,
"grad_norm": 0.365234375,
"learning_rate": 1.9735219372611232e-05,
"loss": 0.9522192478179932,
"mean_token_accuracy": 0.7403313592076302,
"num_tokens": 556835.0,
"step": 38
},
{
"entropy": 1.3322739899158478,
"epoch": 0.23231571109456442,
"grad_norm": 0.34765625,
"learning_rate": 1.9720781369857747e-05,
"loss": 0.8859533071517944,
"mean_token_accuracy": 0.7525262087583542,
"num_tokens": 571583.0,
"step": 39
},
{
"entropy": 1.3456282019615173,
"epoch": 0.23827252419955325,
"grad_norm": 0.35546875,
"learning_rate": 1.970596567453391e-05,
"loss": 0.9205423593521118,
"mean_token_accuracy": 0.7516355887055397,
"num_tokens": 585756.0,
"step": 40
},
{
"entropy": 1.34938944876194,
"epoch": 0.24422933730454208,
"grad_norm": 0.3671875,
"learning_rate": 1.969077286229078e-05,
"loss": 0.9173880219459534,
"mean_token_accuracy": 0.7490571588277817,
"num_tokens": 600414.0,
"step": 41
},
{
"entropy": 1.342022642493248,
"epoch": 0.2501861504095309,
"grad_norm": 0.3671875,
"learning_rate": 1.9675203523431964e-05,
"loss": 0.9510252475738525,
"mean_token_accuracy": 0.7395995110273361,
"num_tokens": 615312.0,
"step": 42
},
{
"entropy": 1.3256245851516724,
"epoch": 0.2561429635145197,
"grad_norm": 0.359375,
"learning_rate": 1.9659258262890683e-05,
"loss": 0.8812260031700134,
"mean_token_accuracy": 0.7551488727331161,
"num_tokens": 630044.0,
"step": 43
},
{
"entropy": 1.300643116235733,
"epoch": 0.26209977661950856,
"grad_norm": 0.34765625,
"learning_rate": 1.964293770020628e-05,
"loss": 0.8403468728065491,
"mean_token_accuracy": 0.7659397423267365,
"num_tokens": 644892.0,
"step": 44
},
{
"entropy": 1.3294509053230286,
"epoch": 0.2680565897244974,
"grad_norm": 0.388671875,
"learning_rate": 1.962624246950012e-05,
"loss": 0.8782874345779419,
"mean_token_accuracy": 0.7567607760429382,
"num_tokens": 659231.0,
"step": 45
},
{
"entropy": 1.3091595023870468,
"epoch": 0.2740134028294862,
"grad_norm": 0.376953125,
"learning_rate": 1.9609173219450998e-05,
"loss": 0.9257646799087524,
"mean_token_accuracy": 0.7511701583862305,
"num_tokens": 673897.0,
"step": 46
},
{
"entropy": 1.3130007237195969,
"epoch": 0.2799702159344751,
"grad_norm": 0.3671875,
"learning_rate": 1.9591730613269878e-05,
"loss": 0.9010749459266663,
"mean_token_accuracy": 0.7568229958415031,
"num_tokens": 689100.0,
"step": 47
},
{
"entropy": 1.329409897327423,
"epoch": 0.2859270290394639,
"grad_norm": 0.404296875,
"learning_rate": 1.957391532867418e-05,
"loss": 0.889941930770874,
"mean_token_accuracy": 0.7545234337449074,
"num_tokens": 703112.0,
"step": 48
},
{
"entropy": 1.2916735112667084,
"epoch": 0.29188384214445273,
"grad_norm": 0.375,
"learning_rate": 1.955572805786141e-05,
"loss": 0.8604971170425415,
"mean_token_accuracy": 0.7610657885670662,
"num_tokens": 718088.0,
"step": 49
},
{
"entropy": 1.3215313851833344,
"epoch": 0.29784065524944153,
"grad_norm": 0.373046875,
"learning_rate": 1.953716950748227e-05,
"loss": 0.8792937994003296,
"mean_token_accuracy": 0.7575221061706543,
"num_tokens": 732625.0,
"step": 50
},
{
"entropy": 1.3200262635946274,
"epoch": 0.3037974683544304,
"grad_norm": 0.369140625,
"learning_rate": 1.9518240398613226e-05,
"loss": 0.891180157661438,
"mean_token_accuracy": 0.7595923095941544,
"num_tokens": 747023.0,
"step": 51
},
{
"entropy": 1.3076974749565125,
"epoch": 0.3097542814594192,
"grad_norm": 0.365234375,
"learning_rate": 1.9498941466728462e-05,
"loss": 0.8625985383987427,
"mean_token_accuracy": 0.7610806971788406,
"num_tokens": 762573.0,
"step": 52
},
{
"entropy": 1.3317556381225586,
"epoch": 0.31571109456440805,
"grad_norm": 0.365234375,
"learning_rate": 1.947927346167132e-05,
"loss": 0.8708853721618652,
"mean_token_accuracy": 0.7519596815109253,
"num_tokens": 777221.0,
"step": 53
},
{
"entropy": 1.354643628001213,
"epoch": 0.32166790766939685,
"grad_norm": 0.36328125,
"learning_rate": 1.945923714762516e-05,
"loss": 0.9412155151367188,
"mean_token_accuracy": 0.7419139668345451,
"num_tokens": 792127.0,
"step": 54
},
{
"entropy": 1.3347897082567215,
"epoch": 0.3276247207743857,
"grad_norm": 0.365234375,
"learning_rate": 1.9438833303083677e-05,
"loss": 0.8442082405090332,
"mean_token_accuracy": 0.7618155255913734,
"num_tokens": 806760.0,
"step": 55
},
{
"entropy": 1.3102798759937286,
"epoch": 0.33358153387937456,
"grad_norm": 0.359375,
"learning_rate": 1.9418062720820636e-05,
"loss": 0.8157958984375,
"mean_token_accuracy": 0.7714768648147583,
"num_tokens": 821430.0,
"step": 56
},
{
"entropy": 1.3602834939956665,
"epoch": 0.33953834698436336,
"grad_norm": 0.373046875,
"learning_rate": 1.9396926207859085e-05,
"loss": 0.9252448678016663,
"mean_token_accuracy": 0.7447722256183624,
"num_tokens": 835919.0,
"step": 57
},
{
"entropy": 1.3342349529266357,
"epoch": 0.3454951600893522,
"grad_norm": 0.369140625,
"learning_rate": 1.9375424585439994e-05,
"loss": 0.9243099689483643,
"mean_token_accuracy": 0.7476465478539467,
"num_tokens": 851231.0,
"step": 58
},
{
"entropy": 1.3102659434080124,
"epoch": 0.351451973194341,
"grad_norm": 0.3515625,
"learning_rate": 1.935355868899034e-05,
"loss": 0.7817438840866089,
"mean_token_accuracy": 0.7773127183318138,
"num_tokens": 865741.0,
"step": 59
},
{
"entropy": 1.3435720950365067,
"epoch": 0.3574087862993299,
"grad_norm": 0.404296875,
"learning_rate": 1.9331329368090664e-05,
"loss": 0.897109866142273,
"mean_token_accuracy": 0.7542032599449158,
"num_tokens": 879839.0,
"step": 60
},
{
"entropy": 1.3139615505933762,
"epoch": 0.3633655994043187,
"grad_norm": 0.357421875,
"learning_rate": 1.9308737486442045e-05,
"loss": 0.8411209583282471,
"mean_token_accuracy": 0.768218956887722,
"num_tokens": 894957.0,
"step": 61
},
{
"entropy": 1.354519784450531,
"epoch": 0.36932241250930753,
"grad_norm": 0.388671875,
"learning_rate": 1.9285783921832537e-05,
"loss": 0.9316556453704834,
"mean_token_accuracy": 0.7457900270819664,
"num_tokens": 909035.0,
"step": 62
},
{
"entropy": 1.2865931391716003,
"epoch": 0.37527922561429633,
"grad_norm": 0.365234375,
"learning_rate": 1.926246956610309e-05,
"loss": 0.8276340961456299,
"mean_token_accuracy": 0.7709004059433937,
"num_tokens": 923699.0,
"step": 63
},
{
"entropy": 1.2839124202728271,
"epoch": 0.3812360387192852,
"grad_norm": 0.357421875,
"learning_rate": 1.9238795325112867e-05,
"loss": 0.792696475982666,
"mean_token_accuracy": 0.7811732813715935,
"num_tokens": 937978.0,
"step": 64
},
{
"entropy": 1.2945790588855743,
"epoch": 0.387192851824274,
"grad_norm": 0.359375,
"learning_rate": 1.921476211870408e-05,
"loss": 0.874768853187561,
"mean_token_accuracy": 0.7566314563155174,
"num_tokens": 953189.0,
"step": 65
},
{
"entropy": 1.3046975582838058,
"epoch": 0.39314966492926284,
"grad_norm": 0.36328125,
"learning_rate": 1.9190370880666206e-05,
"loss": 0.8540111780166626,
"mean_token_accuracy": 0.7612261921167374,
"num_tokens": 967694.0,
"step": 66
},
{
"entropy": 1.3215627670288086,
"epoch": 0.3991064780342517,
"grad_norm": 0.384765625,
"learning_rate": 1.9165622558699763e-05,
"loss": 0.9076806306838989,
"mean_token_accuracy": 0.7566501572728157,
"num_tokens": 981909.0,
"step": 67
},
{
"entropy": 1.2821516543626785,
"epoch": 0.4050632911392405,
"grad_norm": 0.35546875,
"learning_rate": 1.9140518114379433e-05,
"loss": 0.8209891319274902,
"mean_token_accuracy": 0.7717649862170219,
"num_tokens": 996738.0,
"step": 68
},
{
"entropy": 1.3115236312150955,
"epoch": 0.41102010424422936,
"grad_norm": 0.341796875,
"learning_rate": 1.9115058523116734e-05,
"loss": 0.8256929516792297,
"mean_token_accuracy": 0.7650889083743095,
"num_tokens": 1011216.0,
"step": 69
},
{
"entropy": 1.3014082163572311,
"epoch": 0.41697691734921816,
"grad_norm": 0.33984375,
"learning_rate": 1.908924477412211e-05,
"loss": 0.8159216046333313,
"mean_token_accuracy": 0.7695104703307152,
"num_tokens": 1026284.0,
"step": 70
},
{
"entropy": 1.3315211981534958,
"epoch": 0.422933730454207,
"grad_norm": 0.349609375,
"learning_rate": 1.9063077870366504e-05,
"loss": 0.8810704350471497,
"mean_token_accuracy": 0.7593883574008942,
"num_tokens": 1041027.0,
"step": 71
},
{
"entropy": 1.3138697743415833,
"epoch": 0.4288905435591958,
"grad_norm": 0.330078125,
"learning_rate": 1.903655882854237e-05,
"loss": 0.8666151762008667,
"mean_token_accuracy": 0.7636753916740417,
"num_tokens": 1056203.0,
"step": 72
},
{
"entropy": 1.3296868354082108,
"epoch": 0.43484735666418467,
"grad_norm": 0.38671875,
"learning_rate": 1.900968867902419e-05,
"loss": 0.8226944804191589,
"mean_token_accuracy": 0.7660787329077721,
"num_tokens": 1069994.0,
"step": 73
},
{
"entropy": 1.327721655368805,
"epoch": 0.44080416976917347,
"grad_norm": 0.384765625,
"learning_rate": 1.898246846582844e-05,
"loss": 0.8633409738540649,
"mean_token_accuracy": 0.7588323205709457,
"num_tokens": 1084280.0,
"step": 74
},
{
"entropy": 1.2736104279756546,
"epoch": 0.4467609828741623,
"grad_norm": 0.345703125,
"learning_rate": 1.895489924657301e-05,
"loss": 0.7951964139938354,
"mean_token_accuracy": 0.7775014489889145,
"num_tokens": 1099332.0,
"step": 75
},
{
"entropy": 1.2568956762552261,
"epoch": 0.4527177959791511,
"grad_norm": 0.390625,
"learning_rate": 1.8926982092436117e-05,
"loss": 0.7958716750144958,
"mean_token_accuracy": 0.7729126885533333,
"num_tokens": 1113758.0,
"step": 76
},
{
"entropy": 1.2585568279027939,
"epoch": 0.45867460908414,
"grad_norm": 0.353515625,
"learning_rate": 1.8898718088114688e-05,
"loss": 0.8418722152709961,
"mean_token_accuracy": 0.7698204517364502,
"num_tokens": 1128814.0,
"step": 77
},
{
"entropy": 1.2552629113197327,
"epoch": 0.46463142218912884,
"grad_norm": 0.353515625,
"learning_rate": 1.887010833178222e-05,
"loss": 0.7894448041915894,
"mean_token_accuracy": 0.7702115252614021,
"num_tokens": 1143044.0,
"step": 78
},
{
"entropy": 1.237639144062996,
"epoch": 0.47058823529411764,
"grad_norm": 0.357421875,
"learning_rate": 1.8841153935046098e-05,
"loss": 0.7948979735374451,
"mean_token_accuracy": 0.7740144208073616,
"num_tokens": 1158074.0,
"step": 79
},
{
"entropy": 1.2586966007947922,
"epoch": 0.4765450483991065,
"grad_norm": 0.375,
"learning_rate": 1.8811856022904423e-05,
"loss": 0.8225394487380981,
"mean_token_accuracy": 0.7743681222200394,
"num_tokens": 1172247.0,
"step": 80
},
{
"entropy": 1.2005833238363266,
"epoch": 0.4825018615040953,
"grad_norm": 0.341796875,
"learning_rate": 1.8782215733702286e-05,
"loss": 0.7371789216995239,
"mean_token_accuracy": 0.7894127815961838,
"num_tokens": 1187054.0,
"step": 81
},
{
"entropy": 1.2627707123756409,
"epoch": 0.48845867460908415,
"grad_norm": 0.365234375,
"learning_rate": 1.8752234219087538e-05,
"loss": 0.8591660857200623,
"mean_token_accuracy": 0.7659735381603241,
"num_tokens": 1201655.0,
"step": 82
},
{
"entropy": 1.2909194976091385,
"epoch": 0.49441548771407295,
"grad_norm": 0.376953125,
"learning_rate": 1.8721912643966055e-05,
"loss": 0.8661763072013855,
"mean_token_accuracy": 0.7588073536753654,
"num_tokens": 1215941.0,
"step": 83
},
{
"entropy": 1.2870348989963531,
"epoch": 0.5003723008190618,
"grad_norm": 0.359375,
"learning_rate": 1.8691252186456465e-05,
"loss": 0.830467939376831,
"mean_token_accuracy": 0.7688242942094803,
"num_tokens": 1230066.0,
"step": 84
},
{
"entropy": 1.2635858803987503,
"epoch": 0.5063291139240507,
"grad_norm": 0.34765625,
"learning_rate": 1.866025403784439e-05,
"loss": 0.8112859725952148,
"mean_token_accuracy": 0.7699639350175858,
"num_tokens": 1245411.0,
"step": 85
},
{
"entropy": 1.2944375872612,
"epoch": 0.5122859270290394,
"grad_norm": 0.330078125,
"learning_rate": 1.862891940253613e-05,
"loss": 0.8428732752799988,
"mean_token_accuracy": 0.7625590562820435,
"num_tokens": 1260081.0,
"step": 86
},
{
"entropy": 1.2768390029668808,
"epoch": 0.5182427401340283,
"grad_norm": 0.333984375,
"learning_rate": 1.8597249498011906e-05,
"loss": 0.7818429470062256,
"mean_token_accuracy": 0.7796064242720604,
"num_tokens": 1274169.0,
"step": 87
},
{
"entropy": 1.2663612216711044,
"epoch": 0.5241995532390171,
"grad_norm": 0.34765625,
"learning_rate": 1.8565245554778516e-05,
"loss": 0.7885245084762573,
"mean_token_accuracy": 0.7747808918356895,
"num_tokens": 1288810.0,
"step": 88
},
{
"entropy": 1.299068808555603,
"epoch": 0.530156366344006,
"grad_norm": 0.36328125,
"learning_rate": 1.8532908816321557e-05,
"loss": 0.8310455083847046,
"mean_token_accuracy": 0.7649297416210175,
"num_tokens": 1303352.0,
"step": 89
},
{
"entropy": 1.2907497137784958,
"epoch": 0.5361131794489948,
"grad_norm": 0.359375,
"learning_rate": 1.8500240539057093e-05,
"loss": 0.8416677713394165,
"mean_token_accuracy": 0.7609433010220528,
"num_tokens": 1317948.0,
"step": 90
},
{
"entropy": 1.3166047036647797,
"epoch": 0.5420699925539836,
"grad_norm": 0.35546875,
"learning_rate": 1.8467241992282842e-05,
"loss": 0.8960973024368286,
"mean_token_accuracy": 0.7464632913470268,
"num_tokens": 1332383.0,
"step": 91
},
{
"entropy": 1.2651972472667694,
"epoch": 0.5480268056589724,
"grad_norm": 0.341796875,
"learning_rate": 1.843391445812886e-05,
"loss": 0.7947843074798584,
"mean_token_accuracy": 0.7730053663253784,
"num_tokens": 1346797.0,
"step": 92
},
{
"entropy": 1.2707823663949966,
"epoch": 0.5539836187639613,
"grad_norm": 0.359375,
"learning_rate": 1.8400259231507716e-05,
"loss": 0.7787963151931763,
"mean_token_accuracy": 0.7789562344551086,
"num_tokens": 1360935.0,
"step": 93
},
{
"entropy": 1.2486981898546219,
"epoch": 0.5599404318689502,
"grad_norm": 0.326171875,
"learning_rate": 1.83662776200642e-05,
"loss": 0.7839233875274658,
"mean_token_accuracy": 0.7764812558889389,
"num_tokens": 1375392.0,
"step": 94
},
{
"entropy": 1.2385842353105545,
"epoch": 0.5658972449739389,
"grad_norm": 0.3515625,
"learning_rate": 1.833197094412449e-05,
"loss": 0.7750946283340454,
"mean_token_accuracy": 0.7754370123147964,
"num_tokens": 1389642.0,
"step": 95
},
{
"entropy": 1.2582454234361649,
"epoch": 0.5718540580789278,
"grad_norm": 0.349609375,
"learning_rate": 1.8297340536644877e-05,
"loss": 0.8087575435638428,
"mean_token_accuracy": 0.7721517831087112,
"num_tokens": 1404072.0,
"step": 96
},
{
"entropy": 1.2536737322807312,
"epoch": 0.5778108711839166,
"grad_norm": 0.337890625,
"learning_rate": 1.826238774315995e-05,
"loss": 0.7741163372993469,
"mean_token_accuracy": 0.7778245881199837,
"num_tokens": 1418644.0,
"step": 97
},
{
"entropy": 1.2571983486413956,
"epoch": 0.5837676842889055,
"grad_norm": 0.357421875,
"learning_rate": 1.8227113921730336e-05,
"loss": 0.7704818844795227,
"mean_token_accuracy": 0.7764224410057068,
"num_tokens": 1432848.0,
"step": 98
},
{
"entropy": 1.2861786782741547,
"epoch": 0.5897244973938943,
"grad_norm": 0.404296875,
"learning_rate": 1.819152044288992e-05,
"loss": 0.840486466884613,
"mean_token_accuracy": 0.7590076252818108,
"num_tokens": 1446026.0,
"step": 99
},
{
"entropy": 1.259141594171524,
"epoch": 0.5956813104988831,
"grad_norm": 0.365234375,
"learning_rate": 1.8155608689592604e-05,
"loss": 0.8282920718193054,
"mean_token_accuracy": 0.7636805027723312,
"num_tokens": 1461039.0,
"step": 100
},
{
"entropy": 1.259206235408783,
"epoch": 0.6016381236038719,
"grad_norm": 0.345703125,
"learning_rate": 1.811938005715857e-05,
"loss": 0.7743256092071533,
"mean_token_accuracy": 0.779683418571949,
"num_tokens": 1475526.0,
"step": 101
},
{
"entropy": 1.2759947627782822,
"epoch": 0.6075949367088608,
"grad_norm": 0.34765625,
"learning_rate": 1.8082835953220055e-05,
"loss": 0.8088581562042236,
"mean_token_accuracy": 0.7721528932452202,
"num_tokens": 1489823.0,
"step": 102
},
{
"entropy": 1.293590635061264,
"epoch": 0.6135517498138496,
"grad_norm": 0.412109375,
"learning_rate": 1.8045977797666685e-05,
"loss": 0.8578399419784546,
"mean_token_accuracy": 0.7592629492282867,
"num_tokens": 1504383.0,
"step": 103
},
{
"entropy": 1.333486557006836,
"epoch": 0.6195085629188384,
"grad_norm": 0.396484375,
"learning_rate": 1.8008807022590283e-05,
"loss": 0.8810866475105286,
"mean_token_accuracy": 0.7484598457813263,
"num_tokens": 1517806.0,
"step": 104
},
{
"entropy": 1.2660276144742966,
"epoch": 0.6254653760238272,
"grad_norm": 0.357421875,
"learning_rate": 1.7971325072229227e-05,
"loss": 0.84173184633255,
"mean_token_accuracy": 0.7654049769043922,
"num_tokens": 1532497.0,
"step": 105
},
{
"entropy": 1.2698614448308945,
"epoch": 0.6314221891288161,
"grad_norm": 0.345703125,
"learning_rate": 1.7933533402912354e-05,
"loss": 0.8295232653617859,
"mean_token_accuracy": 0.7681133523583412,
"num_tokens": 1547634.0,
"step": 106
},
{
"entropy": 1.2812798023223877,
"epoch": 0.637379002233805,
"grad_norm": 0.33984375,
"learning_rate": 1.7895433483002356e-05,
"loss": 0.8399749398231506,
"mean_token_accuracy": 0.7694036960601807,
"num_tokens": 1562026.0,
"step": 107
},
{
"entropy": 1.3091949224472046,
"epoch": 0.6433358153387937,
"grad_norm": 0.404296875,
"learning_rate": 1.785702679283874e-05,
"loss": 0.8679311871528625,
"mean_token_accuracy": 0.7622929587960243,
"num_tokens": 1575785.0,
"step": 108
},
{
"entropy": 1.2573847621679306,
"epoch": 0.6492926284437825,
"grad_norm": 0.345703125,
"learning_rate": 1.78183148246803e-05,
"loss": 0.8026180863380432,
"mean_token_accuracy": 0.7683332338929176,
"num_tokens": 1591294.0,
"step": 109
},
{
"entropy": 1.2880352437496185,
"epoch": 0.6552494415487714,
"grad_norm": 0.361328125,
"learning_rate": 1.777929908264715e-05,
"loss": 0.8197344541549683,
"mean_token_accuracy": 0.7702998444437981,
"num_tokens": 1604958.0,
"step": 110
},
{
"entropy": 1.2673484981060028,
"epoch": 0.6612062546537603,
"grad_norm": 0.36328125,
"learning_rate": 1.7739981082662275e-05,
"loss": 0.8381748199462891,
"mean_token_accuracy": 0.7616433724761009,
"num_tokens": 1620204.0,
"step": 111
},
{
"entropy": 1.2442313134670258,
"epoch": 0.6671630677587491,
"grad_norm": 0.337890625,
"learning_rate": 1.7700362352392632e-05,
"loss": 0.7782060503959656,
"mean_token_accuracy": 0.7786413952708244,
"num_tokens": 1635257.0,
"step": 112
},
{
"entropy": 1.2735689878463745,
"epoch": 0.6731198808637379,
"grad_norm": 0.392578125,
"learning_rate": 1.766044443118978e-05,
"loss": 0.8409761786460876,
"mean_token_accuracy": 0.7633680775761604,
"num_tokens": 1649668.0,
"step": 113
},
{
"entropy": 1.280581310391426,
"epoch": 0.6790766939687267,
"grad_norm": 0.35546875,
"learning_rate": 1.762022887003011e-05,
"loss": 0.819488525390625,
"mean_token_accuracy": 0.768619529902935,
"num_tokens": 1663868.0,
"step": 114
},
{
"entropy": 1.2455193400382996,
"epoch": 0.6850335070737156,
"grad_norm": 0.361328125,
"learning_rate": 1.757971723145453e-05,
"loss": 0.7443034648895264,
"mean_token_accuracy": 0.785475604236126,
"num_tokens": 1678332.0,
"step": 115
},
{
"entropy": 1.2718180269002914,
"epoch": 0.6909903201787044,
"grad_norm": 0.349609375,
"learning_rate": 1.75389110895078e-05,
"loss": 0.8380476832389832,
"mean_token_accuracy": 0.7637294083833694,
"num_tokens": 1692798.0,
"step": 116
},
{
"entropy": 1.28805373609066,
"epoch": 0.6969471332836932,
"grad_norm": 0.373046875,
"learning_rate": 1.7497812029677344e-05,
"loss": 0.7940935492515564,
"mean_token_accuracy": 0.7718535214662552,
"num_tokens": 1706403.0,
"step": 117
},
{
"entropy": 1.2754413783550262,
"epoch": 0.702903946388682,
"grad_norm": 0.359375,
"learning_rate": 1.7456421648831658e-05,
"loss": 0.79500412940979,
"mean_token_accuracy": 0.7691502496600151,
"num_tokens": 1720637.0,
"step": 118
},
{
"entropy": 1.2628609538078308,
"epoch": 0.7088607594936709,
"grad_norm": 0.34375,
"learning_rate": 1.741474155515827e-05,
"loss": 0.8258920907974243,
"mean_token_accuracy": 0.7655653059482574,
"num_tokens": 1735839.0,
"step": 119
},
{
"entropy": 1.2739417552947998,
"epoch": 0.7148175725986597,
"grad_norm": 0.369140625,
"learning_rate": 1.737277336810124e-05,
"loss": 0.7685380578041077,
"mean_token_accuracy": 0.7830494046211243,
"num_tokens": 1750093.0,
"step": 120
},
{
"entropy": 1.2557980716228485,
"epoch": 0.7207743857036486,
"grad_norm": 0.36328125,
"learning_rate": 1.7330518718298263e-05,
"loss": 0.8203400373458862,
"mean_token_accuracy": 0.7682551443576813,
"num_tokens": 1765040.0,
"step": 121
},
{
"entropy": 1.2622184306383133,
"epoch": 0.7267311988086373,
"grad_norm": 0.359375,
"learning_rate": 1.7287979247517285e-05,
"loss": 0.8228541612625122,
"mean_token_accuracy": 0.7695576474070549,
"num_tokens": 1779610.0,
"step": 122
},
{
"entropy": 1.2455091774463654,
"epoch": 0.7326880119136262,
"grad_norm": 0.353515625,
"learning_rate": 1.7245156608592727e-05,
"loss": 0.754838228225708,
"mean_token_accuracy": 0.7866516560316086,
"num_tokens": 1794351.0,
"step": 123
},
{
"entropy": 1.2472401857376099,
"epoch": 0.7386448250186151,
"grad_norm": 0.361328125,
"learning_rate": 1.7202052465361268e-05,
"loss": 0.8274670243263245,
"mean_token_accuracy": 0.7684604525566101,
"num_tokens": 1809510.0,
"step": 124
},
{
"entropy": 1.2943197786808014,
"epoch": 0.7446016381236039,
"grad_norm": 0.373046875,
"learning_rate": 1.7158668492597186e-05,
"loss": 0.858670711517334,
"mean_token_accuracy": 0.7580647841095924,
"num_tokens": 1823089.0,
"step": 125
},
{
"entropy": 1.2716920524835587,
"epoch": 0.7505584512285927,
"grad_norm": 0.369140625,
"learning_rate": 1.7115006375947304e-05,
"loss": 0.8383840918540955,
"mean_token_accuracy": 0.7634381875395775,
"num_tokens": 1837660.0,
"step": 126
},
{
"entropy": 1.2710201442241669,
"epoch": 0.7565152643335815,
"grad_norm": 0.3671875,
"learning_rate": 1.7071067811865477e-05,
"loss": 0.8363803625106812,
"mean_token_accuracy": 0.7592340558767319,
"num_tokens": 1851869.0,
"step": 127
},
{
"entropy": 1.2555763572454453,
"epoch": 0.7624720774385704,
"grad_norm": 0.36328125,
"learning_rate": 1.7026854507546694e-05,
"loss": 0.7854242324829102,
"mean_token_accuracy": 0.7739197090268135,
"num_tokens": 1866454.0,
"step": 128
},
{
"entropy": 1.2632461488246918,
"epoch": 0.7684288905435592,
"grad_norm": 0.349609375,
"learning_rate": 1.698236818086073e-05,
"loss": 0.8233469724655151,
"mean_token_accuracy": 0.7627609372138977,
"num_tokens": 1880761.0,
"step": 129
},
{
"entropy": 1.252721443772316,
"epoch": 0.774385703648548,
"grad_norm": 0.34765625,
"learning_rate": 1.693761056028542e-05,
"loss": 0.8479862213134766,
"mean_token_accuracy": 0.7652608901262283,
"num_tokens": 1895812.0,
"step": 130
},
{
"entropy": 1.2346957474946976,
"epoch": 0.7803425167535368,
"grad_norm": 0.33203125,
"learning_rate": 1.689258338483947e-05,
"loss": 0.7700930237770081,
"mean_token_accuracy": 0.7812119647860527,
"num_tokens": 1910875.0,
"step": 131
},
{
"entropy": 1.2443837672472,
"epoch": 0.7862993298585257,
"grad_norm": 0.33984375,
"learning_rate": 1.6847288404014937e-05,
"loss": 0.7806112766265869,
"mean_token_accuracy": 0.7737433910369873,
"num_tokens": 1925210.0,
"step": 132
},
{
"entropy": 1.2574907839298248,
"epoch": 0.7922561429635145,
"grad_norm": 0.349609375,
"learning_rate": 1.6801727377709195e-05,
"loss": 0.7916486263275146,
"mean_token_accuracy": 0.7723786979913712,
"num_tokens": 1939706.0,
"step": 133
},
{
"entropy": 1.240403950214386,
"epoch": 0.7982129560685034,
"grad_norm": 0.361328125,
"learning_rate": 1.6755902076156606e-05,
"loss": 0.7764307260513306,
"mean_token_accuracy": 0.7722450792789459,
"num_tokens": 1953951.0,
"step": 134
},
{
"entropy": 1.2047400623559952,
"epoch": 0.8041697691734921,
"grad_norm": 0.341796875,
"learning_rate": 1.67098142798597e-05,
"loss": 0.7488443851470947,
"mean_token_accuracy": 0.7864288538694382,
"num_tokens": 1968478.0,
"step": 135
},
{
"entropy": 1.2280729860067368,
"epoch": 0.810126582278481,
"grad_norm": 0.35546875,
"learning_rate": 1.6663465779520042e-05,
"loss": 0.7793049216270447,
"mean_token_accuracy": 0.7834365740418434,
"num_tokens": 1982972.0,
"step": 136
},
{
"entropy": 1.2266123741865158,
"epoch": 0.8160833953834699,
"grad_norm": 0.34765625,
"learning_rate": 1.6616858375968596e-05,
"loss": 0.7857159376144409,
"mean_token_accuracy": 0.7744308784604073,
"num_tokens": 1997617.0,
"step": 137
},
{
"entropy": 1.229455679655075,
"epoch": 0.8220402084884587,
"grad_norm": 0.36328125,
"learning_rate": 1.6569993880095807e-05,
"loss": 0.8067857623100281,
"mean_token_accuracy": 0.7750186920166016,
"num_tokens": 2011907.0,
"step": 138
},
{
"entropy": 1.234218791127205,
"epoch": 0.8279970215934475,
"grad_norm": 0.35546875,
"learning_rate": 1.6522874112781213e-05,
"loss": 0.8134928941726685,
"mean_token_accuracy": 0.7728847786784172,
"num_tokens": 2026748.0,
"step": 139
},
{
"entropy": 1.2340240478515625,
"epoch": 0.8339538346984363,
"grad_norm": 0.345703125,
"learning_rate": 1.6475500904822707e-05,
"loss": 0.7837961912155151,
"mean_token_accuracy": 0.7767920717597008,
"num_tokens": 2041028.0,
"step": 140
},
{
"entropy": 1.2047637104988098,
"epoch": 0.8399106478034252,
"grad_norm": 0.337890625,
"learning_rate": 1.6427876096865394e-05,
"loss": 0.7514673471450806,
"mean_token_accuracy": 0.7840846851468086,
"num_tokens": 2056459.0,
"step": 141
},
{
"entropy": 1.2402971684932709,
"epoch": 0.845867460908414,
"grad_norm": 0.341796875,
"learning_rate": 1.6380001539330088e-05,
"loss": 0.8099113702774048,
"mean_token_accuracy": 0.7708609700202942,
"num_tokens": 2071572.0,
"step": 142
},
{
"entropy": 1.2505415827035904,
"epoch": 0.8518242740134029,
"grad_norm": 0.341796875,
"learning_rate": 1.6331879092341402e-05,
"loss": 0.8279533386230469,
"mean_token_accuracy": 0.7612129226326942,
"num_tokens": 2086270.0,
"step": 143
},
{
"entropy": 1.23782616853714,
"epoch": 0.8577810871183916,
"grad_norm": 0.33984375,
"learning_rate": 1.6283510625655474e-05,
"loss": 0.7820447683334351,
"mean_token_accuracy": 0.7787378579378128,
"num_tokens": 2100982.0,
"step": 144
},
{
"entropy": 1.2248000502586365,
"epoch": 0.8637379002233805,
"grad_norm": 0.318359375,
"learning_rate": 1.6234898018587336e-05,
"loss": 0.7593281269073486,
"mean_token_accuracy": 0.778163269162178,
"num_tokens": 2115803.0,
"step": 145
},
{
"entropy": 1.2075249254703522,
"epoch": 0.8696947133283693,
"grad_norm": 0.31640625,
"learning_rate": 1.6186043159937884e-05,
"loss": 0.7119603753089905,
"mean_token_accuracy": 0.7936617583036423,
"num_tokens": 2130971.0,
"step": 146
},
{
"entropy": 1.2165881991386414,
"epoch": 0.8756515264333582,
"grad_norm": 0.322265625,
"learning_rate": 1.6136947947920477e-05,
"loss": 0.740675687789917,
"mean_token_accuracy": 0.7878302410244942,
"num_tokens": 2145552.0,
"step": 147
},
{
"entropy": 1.2430049926042557,
"epoch": 0.8816083395383469,
"grad_norm": 0.361328125,
"learning_rate": 1.608761429008721e-05,
"loss": 0.8482354283332825,
"mean_token_accuracy": 0.7628344818949699,
"num_tokens": 2160069.0,
"step": 148
},
{
"entropy": 1.183465838432312,
"epoch": 0.8875651526433358,
"grad_norm": 0.34375,
"learning_rate": 1.6038044103254775e-05,
"loss": 0.7142577171325684,
"mean_token_accuracy": 0.7939940765500069,
"num_tokens": 2175381.0,
"step": 149
},
{
"entropy": 1.2008293867111206,
"epoch": 0.8935219657483247,
"grad_norm": 0.345703125,
"learning_rate": 1.5988239313430004e-05,
"loss": 0.760569155216217,
"mean_token_accuracy": 0.7821842804551125,
"num_tokens": 2190275.0,
"step": 150
},
{
"entropy": 1.2101170867681503,
"epoch": 0.8994787788533135,
"grad_norm": 0.337890625,
"learning_rate": 1.5938201855735017e-05,
"loss": 0.7829165458679199,
"mean_token_accuracy": 0.7733455300331116,
"num_tokens": 2204775.0,
"step": 151
},
{
"entropy": 1.232336938381195,
"epoch": 0.9054355919583023,
"grad_norm": 0.357421875,
"learning_rate": 1.5887933674332048e-05,
"loss": 0.8415957689285278,
"mean_token_accuracy": 0.7633619755506516,
"num_tokens": 2219016.0,
"step": 152
},
{
"entropy": 1.1960958242416382,
"epoch": 0.9113924050632911,
"grad_norm": 0.328125,
"learning_rate": 1.5837436722347902e-05,
"loss": 0.7200090885162354,
"mean_token_accuracy": 0.7941614985466003,
"num_tokens": 2233377.0,
"step": 153
},
{
"entropy": 1.1901395469903946,
"epoch": 0.91734921816828,
"grad_norm": 0.337890625,
"learning_rate": 1.578671296179806e-05,
"loss": 0.7320102453231812,
"mean_token_accuracy": 0.7907885834574699,
"num_tokens": 2248523.0,
"step": 154
},
{
"entropy": 1.205485075712204,
"epoch": 0.9233060312732688,
"grad_norm": 0.3359375,
"learning_rate": 1.573576436351046e-05,
"loss": 0.7730504870414734,
"mean_token_accuracy": 0.7801787778735161,
"num_tokens": 2263288.0,
"step": 155
},
{
"entropy": 1.2493800967931747,
"epoch": 0.9292628443782577,
"grad_norm": 0.3359375,
"learning_rate": 1.5684592907048925e-05,
"loss": 0.792695164680481,
"mean_token_accuracy": 0.7768412679433823,
"num_tokens": 2278085.0,
"step": 156
},
{
"entropy": 1.222463384270668,
"epoch": 0.9352196574832464,
"grad_norm": 0.341796875,
"learning_rate": 1.563320058063622e-05,
"loss": 0.7253803610801697,
"mean_token_accuracy": 0.7881602421402931,
"num_tokens": 2292673.0,
"step": 157
},
{
"entropy": 1.2182011902332306,
"epoch": 0.9411764705882353,
"grad_norm": 0.31640625,
"learning_rate": 1.5581589381076843e-05,
"loss": 0.7509200572967529,
"mean_token_accuracy": 0.7809579819440842,
"num_tokens": 2307646.0,
"step": 158
},
{
"entropy": 1.2366309016942978,
"epoch": 0.9471332836932241,
"grad_norm": 0.337890625,
"learning_rate": 1.5529761313679396e-05,
"loss": 0.7257631421089172,
"mean_token_accuracy": 0.7827246561646461,
"num_tokens": 2321559.0,
"step": 159
},
{
"entropy": 1.2403675764799118,
"epoch": 0.953090096798213,
"grad_norm": 0.337890625,
"learning_rate": 1.5477718392178716e-05,
"loss": 0.8105670809745789,
"mean_token_accuracy": 0.7707022428512573,
"num_tokens": 2336203.0,
"step": 160
},
{
"entropy": 1.2477657943964005,
"epoch": 0.9590469099032017,
"grad_norm": 0.36328125,
"learning_rate": 1.5425462638657597e-05,
"loss": 0.9120197296142578,
"mean_token_accuracy": 0.7492518648505211,
"num_tokens": 2351344.0,
"step": 161
},
{
"entropy": 1.1972443461418152,
"epoch": 0.9650037230081906,
"grad_norm": 0.32421875,
"learning_rate": 1.5372996083468242e-05,
"loss": 0.7211199402809143,
"mean_token_accuracy": 0.7921843752264977,
"num_tokens": 2366108.0,
"step": 162
},
{
"entropy": 1.1903489977121353,
"epoch": 0.9709605361131795,
"grad_norm": 0.337890625,
"learning_rate": 1.5320320765153367e-05,
"loss": 0.7322642207145691,
"mean_token_accuracy": 0.7919035404920578,
"num_tokens": 2381068.0,
"step": 163
},
{
"entropy": 1.206245943903923,
"epoch": 0.9769173492181683,
"grad_norm": 0.34375,
"learning_rate": 1.526743873036701e-05,
"loss": 0.7425603270530701,
"mean_token_accuracy": 0.7824821397662163,
"num_tokens": 2395295.0,
"step": 164
},
{
"entropy": 1.2014246433973312,
"epoch": 0.9828741623231572,
"grad_norm": 0.34375,
"learning_rate": 1.5214352033794981e-05,
"loss": 0.807823121547699,
"mean_token_accuracy": 0.7702382802963257,
"num_tokens": 2410456.0,
"step": 165
},
{
"entropy": 1.211999848484993,
"epoch": 0.9888309754281459,
"grad_norm": 0.369140625,
"learning_rate": 1.5161062738075068e-05,
"loss": 0.7507081627845764,
"mean_token_accuracy": 0.7832650169730186,
"num_tokens": 2424439.0,
"step": 166
},
{
"entropy": 1.2110302299261093,
"epoch": 0.9947877885331348,
"grad_norm": 0.36328125,
"learning_rate": 1.5107572913716859e-05,
"loss": 0.787371814250946,
"mean_token_accuracy": 0.7756073325872421,
"num_tokens": 2438585.0,
"step": 167
},
{
"entropy": 1.2203376974378313,
"epoch": 1.0,
"grad_norm": 0.373046875,
"learning_rate": 1.505388463902131e-05,
"loss": 0.8217554688453674,
"mean_token_accuracy": 0.7624766315732684,
"num_tokens": 2452101.0,
"step": 168
},
{
"epoch": 1.0,
"eval_entropy": 1.2118239323298137,
"eval_loss": 0.775408923625946,
"eval_mean_token_accuracy": 0.7765555028120676,
"eval_model_preparation_time": 0.0053,
"eval_num_tokens": 2452101.0,
"eval_runtime": 26.4936,
"eval_samples_per_second": 5.662,
"eval_steps_per_second": 5.662,
"step": 168
}
],
"logging_steps": 1,
"max_steps": 504,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.1041699975881523e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}