YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order1
c068900 verified
Raw
History Blame Contribute Delete
99.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.942675159235669,
"eval_steps": 500,
"global_step": 390,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 11.813681602478027,
"learning_rate": 0.0,
"loss": 3.94,
"mean_token_accuracy": 0.4029204398393631,
"num_tokens": 11165.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 11.436875343322754,
"learning_rate": 1.6666666666666667e-05,
"loss": 3.9572,
"mean_token_accuracy": 0.39499808847904205,
"num_tokens": 22924.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 8.69113540649414,
"learning_rate": 3.3333333333333335e-05,
"loss": 3.8591,
"mean_token_accuracy": 0.3971775621175766,
"num_tokens": 34380.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 7.380194187164307,
"learning_rate": 5e-05,
"loss": 3.4042,
"mean_token_accuracy": 0.44493603706359863,
"num_tokens": 46499.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 8.607468605041504,
"learning_rate": 6.666666666666667e-05,
"loss": 3.0163,
"mean_token_accuracy": 0.49101829528808594,
"num_tokens": 58004.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 4.186850547790527,
"learning_rate": 8.333333333333334e-05,
"loss": 2.5104,
"mean_token_accuracy": 0.533274233341217,
"num_tokens": 69676.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 2.4295248985290527,
"learning_rate": 0.0001,
"loss": 2.2517,
"mean_token_accuracy": 0.598511815071106,
"num_tokens": 80510.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 1.6423780918121338,
"learning_rate": 0.00011666666666666668,
"loss": 1.9619,
"mean_token_accuracy": 0.6394112706184387,
"num_tokens": 92115.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 1.0467219352722168,
"learning_rate": 0.00013333333333333334,
"loss": 1.8255,
"mean_token_accuracy": 0.6845534443855286,
"num_tokens": 103256.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 4.404936790466309,
"learning_rate": 0.00015000000000000001,
"loss": 1.9248,
"mean_token_accuracy": 0.6587593853473663,
"num_tokens": 115085.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 6.799125671386719,
"learning_rate": 0.0001666666666666667,
"loss": 1.9791,
"mean_token_accuracy": 0.6513285338878632,
"num_tokens": 126597.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 3.4010446071624756,
"learning_rate": 0.00018333333333333334,
"loss": 1.8728,
"mean_token_accuracy": 0.6652757525444031,
"num_tokens": 138225.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 1.5734035968780518,
"learning_rate": 0.0002,
"loss": 1.8068,
"mean_token_accuracy": 0.6794665157794952,
"num_tokens": 149400.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 1.5485444068908691,
"learning_rate": 0.0001999965463076377,
"loss": 1.7928,
"mean_token_accuracy": 0.6709170043468475,
"num_tokens": 161043.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.828037679195404,
"learning_rate": 0.00019998618546911056,
"loss": 1.6532,
"mean_token_accuracy": 0.6922715902328491,
"num_tokens": 172432.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.7009934782981873,
"learning_rate": 0.00019996891820008164,
"loss": 1.7985,
"mean_token_accuracy": 0.6713660657405853,
"num_tokens": 184203.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 1.1603612899780273,
"learning_rate": 0.00019994474569326757,
"loss": 1.7606,
"mean_token_accuracy": 0.6762242019176483,
"num_tokens": 196265.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.962382435798645,
"learning_rate": 0.00019991366961835642,
"loss": 1.6288,
"mean_token_accuracy": 0.6989059448242188,
"num_tokens": 207637.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 0.5055384039878845,
"learning_rate": 0.00019987569212189224,
"loss": 1.7028,
"mean_token_accuracy": 0.6899812519550323,
"num_tokens": 218753.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 0.5950912237167358,
"learning_rate": 0.00019983081582712685,
"loss": 1.7121,
"mean_token_accuracy": 0.6890121698379517,
"num_tokens": 230421.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.6283097267150879,
"learning_rate": 0.0001997790438338385,
"loss": 1.681,
"mean_token_accuracy": 0.6921544969081879,
"num_tokens": 241772.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.5913220643997192,
"learning_rate": 0.00019972037971811802,
"loss": 1.6502,
"mean_token_accuracy": 0.693426102399826,
"num_tokens": 252948.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.518637478351593,
"learning_rate": 0.00019965482753212156,
"loss": 1.6008,
"mean_token_accuracy": 0.7004429697990417,
"num_tokens": 264329.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.5006614923477173,
"learning_rate": 0.0001995823918037908,
"loss": 1.6546,
"mean_token_accuracy": 0.688925564289093,
"num_tokens": 275501.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.5350881218910217,
"learning_rate": 0.00019950307753654017,
"loss": 1.6752,
"mean_token_accuracy": 0.6899170279502869,
"num_tokens": 286871.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.561093270778656,
"learning_rate": 0.0001994168902089112,
"loss": 1.6996,
"mean_token_accuracy": 0.6881346106529236,
"num_tokens": 298281.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.5889561772346497,
"learning_rate": 0.00019932383577419432,
"loss": 1.622,
"mean_token_accuracy": 0.6985092461109161,
"num_tokens": 309610.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.5054478049278259,
"learning_rate": 0.00019922392066001722,
"loss": 1.527,
"mean_token_accuracy": 0.7128090262413025,
"num_tokens": 320475.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.45505490899086,
"learning_rate": 0.0001991171517679013,
"loss": 1.6711,
"mean_token_accuracy": 0.6802879571914673,
"num_tokens": 332574.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.4597756564617157,
"learning_rate": 0.00019900353647278466,
"loss": 1.6465,
"mean_token_accuracy": 0.6956342458724976,
"num_tokens": 344055.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.4669620394706726,
"learning_rate": 0.00019888308262251285,
"loss": 1.7753,
"mean_token_accuracy": 0.6748429834842682,
"num_tokens": 356104.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.5092836618423462,
"learning_rate": 0.00019875579853729676,
"loss": 1.6626,
"mean_token_accuracy": 0.6885224878787994,
"num_tokens": 367582.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.5049681067466736,
"learning_rate": 0.00019862169300913785,
"loss": 1.7015,
"mean_token_accuracy": 0.6897156834602356,
"num_tokens": 378963.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.42530742287635803,
"learning_rate": 0.00019848077530122083,
"loss": 1.6259,
"mean_token_accuracy": 0.6956372559070587,
"num_tokens": 390443.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.44630005955696106,
"learning_rate": 0.00019833305514727395,
"loss": 1.7379,
"mean_token_accuracy": 0.6813439428806305,
"num_tokens": 402077.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.4471743106842041,
"learning_rate": 0.0001981785427508966,
"loss": 1.6287,
"mean_token_accuracy": 0.7024159729480743,
"num_tokens": 413215.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.4929853081703186,
"learning_rate": 0.00019801724878485438,
"loss": 1.6782,
"mean_token_accuracy": 0.6950995922088623,
"num_tokens": 424372.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.48214471340179443,
"learning_rate": 0.00019784918439034216,
"loss": 1.6782,
"mean_token_accuracy": 0.6879010498523712,
"num_tokens": 436262.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.47833967208862305,
"learning_rate": 0.00019767436117621413,
"loss": 1.6337,
"mean_token_accuracy": 0.6964130401611328,
"num_tokens": 447409.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.4244818389415741,
"learning_rate": 0.00019749279121818235,
"loss": 1.6183,
"mean_token_accuracy": 0.6930707097053528,
"num_tokens": 458986.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.45180127024650574,
"learning_rate": 0.00019730448705798239,
"loss": 1.5659,
"mean_token_accuracy": 0.7079861462116241,
"num_tokens": 470110.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.45527735352516174,
"learning_rate": 0.000197109461702507,
"loss": 1.6159,
"mean_token_accuracy": 0.6991088390350342,
"num_tokens": 481475.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.45764127373695374,
"learning_rate": 0.0001969077286229078,
"loss": 1.6269,
"mean_token_accuracy": 0.6973654329776764,
"num_tokens": 492753.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.4297986328601837,
"learning_rate": 0.00019669930175366472,
"loss": 1.6279,
"mean_token_accuracy": 0.7023066580295563,
"num_tokens": 504069.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.4261676073074341,
"learning_rate": 0.00019648419549162348,
"loss": 1.6793,
"mean_token_accuracy": 0.6909474432468414,
"num_tokens": 515873.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.41780924797058105,
"learning_rate": 0.0001962624246950012,
"loss": 1.6673,
"mean_token_accuracy": 0.6905270516872406,
"num_tokens": 527285.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.43963462114334106,
"learning_rate": 0.00019603400468235998,
"loss": 1.6227,
"mean_token_accuracy": 0.6965315937995911,
"num_tokens": 539008.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.44278961420059204,
"learning_rate": 0.0001957989512315489,
"loss": 1.6946,
"mean_token_accuracy": 0.6851494014263153,
"num_tokens": 550975.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.4367414116859436,
"learning_rate": 0.0001955572805786141,
"loss": 1.551,
"mean_token_accuracy": 0.7053904235363007,
"num_tokens": 562174.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.4308222830295563,
"learning_rate": 0.0001953090094166773,
"loss": 1.6367,
"mean_token_accuracy": 0.696260392665863,
"num_tokens": 573565.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.40564271807670593,
"learning_rate": 0.0001950541548947829,
"loss": 1.5629,
"mean_token_accuracy": 0.7077935636043549,
"num_tokens": 584655.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.4230608344078064,
"learning_rate": 0.0001947927346167132,
"loss": 1.5939,
"mean_token_accuracy": 0.7017802894115448,
"num_tokens": 595966.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.4446469843387604,
"learning_rate": 0.00019452476663977248,
"loss": 1.6521,
"mean_token_accuracy": 0.6864060759544373,
"num_tokens": 607211.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.4131290912628174,
"learning_rate": 0.00019425026947353992,
"loss": 1.5994,
"mean_token_accuracy": 0.7033936381340027,
"num_tokens": 618727.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.4125947058200836,
"learning_rate": 0.00019396926207859084,
"loss": 1.6097,
"mean_token_accuracy": 0.6973809897899628,
"num_tokens": 630397.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.46308353543281555,
"learning_rate": 0.0001936817638651871,
"loss": 1.5858,
"mean_token_accuracy": 0.7046801447868347,
"num_tokens": 641671.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.4365827739238739,
"learning_rate": 0.00019338779469193639,
"loss": 1.4953,
"mean_token_accuracy": 0.716479629278183,
"num_tokens": 652634.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.42811375856399536,
"learning_rate": 0.00019308737486442045,
"loss": 1.6188,
"mean_token_accuracy": 0.689984530210495,
"num_tokens": 664179.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.40652215480804443,
"learning_rate": 0.00019278052513379255,
"loss": 1.5611,
"mean_token_accuracy": 0.7099756896495819,
"num_tokens": 675385.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.41507890820503235,
"learning_rate": 0.00019246726669534415,
"loss": 1.5896,
"mean_token_accuracy": 0.7004136741161346,
"num_tokens": 686817.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.40362510085105896,
"learning_rate": 0.00019214762118704076,
"loss": 1.5075,
"mean_token_accuracy": 0.713520348072052,
"num_tokens": 697815.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.4158618748188019,
"learning_rate": 0.00019182161068802741,
"loss": 1.6064,
"mean_token_accuracy": 0.6974228620529175,
"num_tokens": 709534.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.41324788331985474,
"learning_rate": 0.00019148925771710347,
"loss": 1.5955,
"mean_token_accuracy": 0.7052092254161835,
"num_tokens": 720860.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.41219326853752136,
"learning_rate": 0.00019115058523116733,
"loss": 1.5635,
"mean_token_accuracy": 0.7040189802646637,
"num_tokens": 732087.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.4263417422771454,
"learning_rate": 0.0001908056166236305,
"loss": 1.5978,
"mean_token_accuracy": 0.6994457244873047,
"num_tokens": 743945.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.4283595681190491,
"learning_rate": 0.00019045437572280194,
"loss": 1.5801,
"mean_token_accuracy": 0.7037738561630249,
"num_tokens": 755005.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.4312443733215332,
"learning_rate": 0.0001900968867902419,
"loss": 1.5562,
"mean_token_accuracy": 0.7055492401123047,
"num_tokens": 766318.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.4288251996040344,
"learning_rate": 0.00018973317451908642,
"loss": 1.5927,
"mean_token_accuracy": 0.7025676369667053,
"num_tokens": 777726.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.4510301351547241,
"learning_rate": 0.00018936326403234125,
"loss": 1.5942,
"mean_token_accuracy": 0.7038309276103973,
"num_tokens": 788880.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.4167572259902954,
"learning_rate": 0.0001889871808811469,
"loss": 1.592,
"mean_token_accuracy": 0.7017644345760345,
"num_tokens": 800546.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.42589858174324036,
"learning_rate": 0.00018860495104301345,
"loss": 1.5814,
"mean_token_accuracy": 0.7006197869777679,
"num_tokens": 812189.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.42139700055122375,
"learning_rate": 0.00018821660092002641,
"loss": 1.6197,
"mean_token_accuracy": 0.6927924752235413,
"num_tokens": 823885.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.418831467628479,
"learning_rate": 0.00018782215733702286,
"loss": 1.5616,
"mean_token_accuracy": 0.7053604423999786,
"num_tokens": 835303.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.435104638338089,
"learning_rate": 0.00018742164753973855,
"loss": 1.5585,
"mean_token_accuracy": 0.7019418776035309,
"num_tokens": 847069.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.42202192544937134,
"learning_rate": 0.00018701509919292613,
"loss": 1.5072,
"mean_token_accuracy": 0.7141622602939606,
"num_tokens": 858488.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.4217613637447357,
"learning_rate": 0.00018660254037844388,
"loss": 1.5131,
"mean_token_accuracy": 0.7161562740802765,
"num_tokens": 869684.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.43704110383987427,
"learning_rate": 0.0001861839995933164,
"loss": 1.5529,
"mean_token_accuracy": 0.7069125473499298,
"num_tokens": 880729.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.44259169697761536,
"learning_rate": 0.00018575950574776595,
"loss": 1.5311,
"mean_token_accuracy": 0.7101023495197296,
"num_tokens": 891695.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.44259169697761536,
"learning_rate": 0.00018532908816321558,
"loss": 1.506,
"mean_token_accuracy": 0.7240927815437317,
"num_tokens": 897073.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.6884306073188782,
"learning_rate": 0.00018489277657026375,
"loss": 1.3726,
"mean_token_accuracy": 0.7358191311359406,
"num_tokens": 908448.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.4427263140678406,
"learning_rate": 0.0001844506011066308,
"loss": 1.2944,
"mean_token_accuracy": 0.7461474239826202,
"num_tokens": 919804.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.3917786478996277,
"learning_rate": 0.00018400259231507717,
"loss": 1.3354,
"mean_token_accuracy": 0.7390774190425873,
"num_tokens": 931397.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.48394888639450073,
"learning_rate": 0.00018354878114129367,
"loss": 1.4038,
"mean_token_accuracy": 0.7281314134597778,
"num_tokens": 942878.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.6187575459480286,
"learning_rate": 0.00018308919893176396,
"loss": 1.4045,
"mean_token_accuracy": 0.7341133952140808,
"num_tokens": 954219.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.4466276466846466,
"learning_rate": 0.0001826238774315995,
"loss": 1.2732,
"mean_token_accuracy": 0.7496218085289001,
"num_tokens": 965410.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.4243098497390747,
"learning_rate": 0.00018215284878234642,
"loss": 1.2839,
"mean_token_accuracy": 0.7502768039703369,
"num_tokens": 976694.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.4365736246109009,
"learning_rate": 0.00018167614551976567,
"loss": 1.3802,
"mean_token_accuracy": 0.728840172290802,
"num_tokens": 988106.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.451364129781723,
"learning_rate": 0.00018119380057158568,
"loss": 1.4286,
"mean_token_accuracy": 0.7288292944431305,
"num_tokens": 999816.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.4656635820865631,
"learning_rate": 0.00018070584725522762,
"loss": 1.2778,
"mean_token_accuracy": 0.7491357028484344,
"num_tokens": 1011401.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.4802230894565582,
"learning_rate": 0.0001802123192755044,
"loss": 1.3656,
"mean_token_accuracy": 0.7348462045192719,
"num_tokens": 1022628.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.5307201743125916,
"learning_rate": 0.00017971325072229226,
"loss": 1.3325,
"mean_token_accuracy": 0.741118997335434,
"num_tokens": 1034112.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.47191011905670166,
"learning_rate": 0.00017920867606817625,
"loss": 1.301,
"mean_token_accuracy": 0.743480771780014,
"num_tokens": 1045699.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.5502749681472778,
"learning_rate": 0.0001786986301660689,
"loss": 1.2598,
"mean_token_accuracy": 0.7520148754119873,
"num_tokens": 1057016.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.515625536441803,
"learning_rate": 0.000178183148246803,
"loss": 1.328,
"mean_token_accuracy": 0.7424952387809753,
"num_tokens": 1068767.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.48685798048973083,
"learning_rate": 0.00017766226591669785,
"loss": 1.2899,
"mean_token_accuracy": 0.7441545128822327,
"num_tokens": 1080338.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.47837910056114197,
"learning_rate": 0.0001771360191551,
"loss": 1.2724,
"mean_token_accuracy": 0.7527591586112976,
"num_tokens": 1091596.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.48874425888061523,
"learning_rate": 0.0001766044443118978,
"loss": 1.3635,
"mean_token_accuracy": 0.739961713552475,
"num_tokens": 1103173.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.5247374773025513,
"learning_rate": 0.00017606757810501088,
"loss": 1.3395,
"mean_token_accuracy": 0.741957426071167,
"num_tokens": 1114890.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.5832791328430176,
"learning_rate": 0.0001755254576178535,
"loss": 1.2544,
"mean_token_accuracy": 0.7478911578655243,
"num_tokens": 1126503.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.5302836894989014,
"learning_rate": 0.00017497812029677344,
"loss": 1.3321,
"mean_token_accuracy": 0.7417987883090973,
"num_tokens": 1138075.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.5336406230926514,
"learning_rate": 0.00017442560394846516,
"loss": 1.3289,
"mean_token_accuracy": 0.7394116818904877,
"num_tokens": 1149604.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.5343959331512451,
"learning_rate": 0.0001738679467373586,
"loss": 1.3892,
"mean_token_accuracy": 0.7278424799442291,
"num_tokens": 1161198.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.48724669218063354,
"learning_rate": 0.00017330518718298264,
"loss": 1.3693,
"mean_token_accuracy": 0.7348725199699402,
"num_tokens": 1172445.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.49938809871673584,
"learning_rate": 0.00017273736415730488,
"loss": 1.1558,
"mean_token_accuracy": 0.7661762535572052,
"num_tokens": 1183328.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.5202611088752747,
"learning_rate": 0.0001721645168820462,
"loss": 1.3089,
"mean_token_accuracy": 0.7464346587657928,
"num_tokens": 1194762.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.4691845178604126,
"learning_rate": 0.00017158668492597186,
"loss": 1.2651,
"mean_token_accuracy": 0.7560595870018005,
"num_tokens": 1206185.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.5898153781890869,
"learning_rate": 0.00017100390820215804,
"loss": 1.3352,
"mean_token_accuracy": 0.7421607077121735,
"num_tokens": 1217884.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.5989345908164978,
"learning_rate": 0.00017041622696523518,
"loss": 1.293,
"mean_token_accuracy": 0.7427842319011688,
"num_tokens": 1229627.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.5459556579589844,
"learning_rate": 0.00016982368180860728,
"loss": 1.2699,
"mean_token_accuracy": 0.7539608180522919,
"num_tokens": 1240446.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.5110013484954834,
"learning_rate": 0.00016922631366164797,
"loss": 1.2265,
"mean_token_accuracy": 0.7581751644611359,
"num_tokens": 1251736.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.5149105191230774,
"learning_rate": 0.0001686241637868734,
"loss": 1.2914,
"mean_token_accuracy": 0.7475982308387756,
"num_tokens": 1263064.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.5403231382369995,
"learning_rate": 0.00016801727377709194,
"loss": 1.3544,
"mean_token_accuracy": 0.7387182414531708,
"num_tokens": 1274626.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.5374177694320679,
"learning_rate": 0.00016740568555253155,
"loss": 1.3812,
"mean_token_accuracy": 0.7330702245235443,
"num_tokens": 1286160.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.5692515969276428,
"learning_rate": 0.00016678944135794374,
"loss": 1.2552,
"mean_token_accuracy": 0.7510959506034851,
"num_tokens": 1297753.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.5811614394187927,
"learning_rate": 0.00016616858375968595,
"loss": 1.3151,
"mean_token_accuracy": 0.7445010244846344,
"num_tokens": 1309224.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.5055227875709534,
"learning_rate": 0.000165543155642781,
"loss": 1.2941,
"mean_token_accuracy": 0.7431842684745789,
"num_tokens": 1320675.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.5303871631622314,
"learning_rate": 0.0001649132002079552,
"loss": 1.2285,
"mean_token_accuracy": 0.7622977197170258,
"num_tokens": 1332170.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.5374083518981934,
"learning_rate": 0.00016427876096865394,
"loss": 1.3428,
"mean_token_accuracy": 0.737566739320755,
"num_tokens": 1343771.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.5214208960533142,
"learning_rate": 0.00016363988174803638,
"loss": 1.3385,
"mean_token_accuracy": 0.7379772365093231,
"num_tokens": 1355513.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.5397446155548096,
"learning_rate": 0.00016299660667594814,
"loss": 1.3607,
"mean_token_accuracy": 0.7355678081512451,
"num_tokens": 1367049.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.5425443053245544,
"learning_rate": 0.00016234898018587337,
"loss": 1.2629,
"mean_token_accuracy": 0.7543594241142273,
"num_tokens": 1378847.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.5520007014274597,
"learning_rate": 0.00016169704701186527,
"loss": 1.2724,
"mean_token_accuracy": 0.7532472312450409,
"num_tokens": 1389763.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.5824275612831116,
"learning_rate": 0.00016104085218545633,
"loss": 1.2198,
"mean_token_accuracy": 0.7577201426029205,
"num_tokens": 1401158.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.5876901745796204,
"learning_rate": 0.00016038044103254775,
"loss": 1.2408,
"mean_token_accuracy": 0.7587076425552368,
"num_tokens": 1412660.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.5918715000152588,
"learning_rate": 0.00015971585917027862,
"loss": 1.2162,
"mean_token_accuracy": 0.7641243636608124,
"num_tokens": 1424264.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.5823501348495483,
"learning_rate": 0.00015904715250387498,
"loss": 1.3385,
"mean_token_accuracy": 0.7427915334701538,
"num_tokens": 1435491.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.5465337634086609,
"learning_rate": 0.000158374367223479,
"loss": 1.2536,
"mean_token_accuracy": 0.75311678647995,
"num_tokens": 1446732.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.5304354429244995,
"learning_rate": 0.0001576975498009583,
"loss": 1.3174,
"mean_token_accuracy": 0.7409499287605286,
"num_tokens": 1458906.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.5691857933998108,
"learning_rate": 0.0001570167469866962,
"loss": 1.198,
"mean_token_accuracy": 0.762933760881424,
"num_tokens": 1469994.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.5394584536552429,
"learning_rate": 0.0001563320058063622,
"loss": 1.1342,
"mean_token_accuracy": 0.7737719714641571,
"num_tokens": 1480937.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.5896454453468323,
"learning_rate": 0.00015564337355766412,
"loss": 1.2746,
"mean_token_accuracy": 0.7510493695735931,
"num_tokens": 1492634.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.7059821486473083,
"learning_rate": 0.0001549508978070806,
"loss": 1.2601,
"mean_token_accuracy": 0.7549479901790619,
"num_tokens": 1503864.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.6112148761749268,
"learning_rate": 0.00015425462638657595,
"loss": 1.2219,
"mean_token_accuracy": 0.7629634737968445,
"num_tokens": 1515227.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.5340291857719421,
"learning_rate": 0.00015355460739029586,
"loss": 1.2629,
"mean_token_accuracy": 0.7527756989002228,
"num_tokens": 1526325.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.5573921799659729,
"learning_rate": 0.00015285088917124556,
"loss": 1.2283,
"mean_token_accuracy": 0.7557610273361206,
"num_tokens": 1538100.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.5598011016845703,
"learning_rate": 0.0001521435203379498,
"loss": 1.2319,
"mean_token_accuracy": 0.7586540579795837,
"num_tokens": 1549283.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.5623608827590942,
"learning_rate": 0.00015143254975109538,
"loss": 1.244,
"mean_token_accuracy": 0.7514355182647705,
"num_tokens": 1560870.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.6442559361457825,
"learning_rate": 0.0001507180265201559,
"loss": 1.2266,
"mean_token_accuracy": 0.7599224150180817,
"num_tokens": 1572135.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.6532415151596069,
"learning_rate": 0.00015000000000000001,
"loss": 1.2325,
"mean_token_accuracy": 0.7574326395988464,
"num_tokens": 1583354.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.5669077634811401,
"learning_rate": 0.00014927851978748178,
"loss": 1.1529,
"mean_token_accuracy": 0.7701173722743988,
"num_tokens": 1594573.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.5915366411209106,
"learning_rate": 0.00014855363571801523,
"loss": 1.2294,
"mean_token_accuracy": 0.7594274282455444,
"num_tokens": 1606088.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.5871595144271851,
"learning_rate": 0.00014782539786213183,
"loss": 1.2237,
"mean_token_accuracy": 0.7613213658332825,
"num_tokens": 1617494.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.6008813977241516,
"learning_rate": 0.00014709385652202203,
"loss": 1.2681,
"mean_token_accuracy": 0.7480663061141968,
"num_tokens": 1629090.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.5864359736442566,
"learning_rate": 0.00014635906222806058,
"loss": 1.3931,
"mean_token_accuracy": 0.7308617830276489,
"num_tokens": 1641022.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.5753868818283081,
"learning_rate": 0.0001456210657353163,
"loss": 1.2897,
"mean_token_accuracy": 0.7492571473121643,
"num_tokens": 1652480.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.56278395652771,
"learning_rate": 0.00014487991802004623,
"loss": 1.3571,
"mean_token_accuracy": 0.7386749386787415,
"num_tokens": 1664089.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.5604442954063416,
"learning_rate": 0.0001441356702761744,
"loss": 1.2514,
"mean_token_accuracy": 0.7553944289684296,
"num_tokens": 1675743.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.5632363557815552,
"learning_rate": 0.00014338837391175582,
"loss": 1.2507,
"mean_token_accuracy": 0.7600274682044983,
"num_tokens": 1686909.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.5791776180267334,
"learning_rate": 0.0001426380805454254,
"loss": 1.2104,
"mean_token_accuracy": 0.7640622556209564,
"num_tokens": 1698422.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.6530908346176147,
"learning_rate": 0.0001418848420028325,
"loss": 1.2076,
"mean_token_accuracy": 0.7604132890701294,
"num_tokens": 1709941.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.6085801720619202,
"learning_rate": 0.00014112871031306119,
"loss": 1.1941,
"mean_token_accuracy": 0.7641676366329193,
"num_tokens": 1721542.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.5950492024421692,
"learning_rate": 0.00014036973770503624,
"loss": 1.1556,
"mean_token_accuracy": 0.7747359573841095,
"num_tokens": 1732791.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.6125719547271729,
"learning_rate": 0.0001396079766039157,
"loss": 1.213,
"mean_token_accuracy": 0.7590784430503845,
"num_tokens": 1743896.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.6058174967765808,
"learning_rate": 0.00013884347962746948,
"loss": 1.2966,
"mean_token_accuracy": 0.7463319599628448,
"num_tokens": 1755279.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.6496732234954834,
"learning_rate": 0.00013807629958244498,
"loss": 1.2688,
"mean_token_accuracy": 0.7533035576343536,
"num_tokens": 1766674.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.6245201230049133,
"learning_rate": 0.0001373064894609194,
"loss": 1.1952,
"mean_token_accuracy": 0.7725894451141357,
"num_tokens": 1777748.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.5686454176902771,
"learning_rate": 0.00013653410243663952,
"loss": 1.1892,
"mean_token_accuracy": 0.7666130363941193,
"num_tokens": 1788830.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.8678678870201111,
"learning_rate": 0.0001357591918613486,
"loss": 0.9977,
"mean_token_accuracy": 0.7947548627853394,
"num_tokens": 1794124.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.6076314449310303,
"learning_rate": 0.0001349818112611015,
"loss": 0.8866,
"mean_token_accuracy": 0.8160363137722015,
"num_tokens": 1805636.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 1.3786406517028809,
"learning_rate": 0.00013420201433256689,
"loss": 0.9392,
"mean_token_accuracy": 0.8041114211082458,
"num_tokens": 1817299.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.7676010131835938,
"learning_rate": 0.00013341985493931877,
"loss": 0.8758,
"mean_token_accuracy": 0.8184058368206024,
"num_tokens": 1828936.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.6482889652252197,
"learning_rate": 0.0001326353871081156,
"loss": 0.8553,
"mean_token_accuracy": 0.8191647529602051,
"num_tokens": 1840132.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.663348913192749,
"learning_rate": 0.00013184866502516845,
"loss": 0.8636,
"mean_token_accuracy": 0.8212078213691711,
"num_tokens": 1851489.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.6632069945335388,
"learning_rate": 0.00013105974303239838,
"loss": 0.8268,
"mean_token_accuracy": 0.8321124613285065,
"num_tokens": 1862876.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.7184637784957886,
"learning_rate": 0.0001302686756236826,
"loss": 0.7524,
"mean_token_accuracy": 0.8431011736392975,
"num_tokens": 1874177.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.7237757444381714,
"learning_rate": 0.00012947551744109043,
"loss": 0.8445,
"mean_token_accuracy": 0.8258463144302368,
"num_tokens": 1885524.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.7234023809432983,
"learning_rate": 0.00012868032327110904,
"loss": 0.8428,
"mean_token_accuracy": 0.8247216641902924,
"num_tokens": 1897169.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.635473906993866,
"learning_rate": 0.00012788314804085903,
"loss": 0.7116,
"mean_token_accuracy": 0.8497787714004517,
"num_tokens": 1908703.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.7157398462295532,
"learning_rate": 0.00012708404681430053,
"loss": 0.8842,
"mean_token_accuracy": 0.819458395242691,
"num_tokens": 1919695.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.6592625379562378,
"learning_rate": 0.00012628307478842953,
"loss": 0.8329,
"mean_token_accuracy": 0.8234336376190186,
"num_tokens": 1930961.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.6916066408157349,
"learning_rate": 0.0001254802872894655,
"loss": 0.8455,
"mean_token_accuracy": 0.8254802227020264,
"num_tokens": 1942462.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.6964818239212036,
"learning_rate": 0.00012467573976902935,
"loss": 0.7841,
"mean_token_accuracy": 0.8403615355491638,
"num_tokens": 1953848.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.7194589972496033,
"learning_rate": 0.0001238694878003138,
"loss": 0.8526,
"mean_token_accuracy": 0.8252715766429901,
"num_tokens": 1965634.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.701948344707489,
"learning_rate": 0.00012306158707424403,
"loss": 0.8153,
"mean_token_accuracy": 0.8318383991718292,
"num_tokens": 1977633.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.7072458267211914,
"learning_rate": 0.00012225209339563145,
"loss": 0.8634,
"mean_token_accuracy": 0.8203523755073547,
"num_tokens": 1989375.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.6985357999801636,
"learning_rate": 0.00012144106267931876,
"loss": 0.7991,
"mean_token_accuracy": 0.8354414403438568,
"num_tokens": 2000350.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.6818456649780273,
"learning_rate": 0.00012062855094631778,
"loss": 0.7757,
"mean_token_accuracy": 0.8414984047412872,
"num_tokens": 2011821.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.7199962139129639,
"learning_rate": 0.00011981461431993977,
"loss": 0.8509,
"mean_token_accuracy": 0.822184681892395,
"num_tokens": 2023398.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.7146344184875488,
"learning_rate": 0.00011899930902191902,
"loss": 0.8617,
"mean_token_accuracy": 0.8206455111503601,
"num_tokens": 2035102.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.6928791999816895,
"learning_rate": 0.00011818269136852909,
"loss": 0.8588,
"mean_token_accuracy": 0.8235190808773041,
"num_tokens": 2046897.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.6946797370910645,
"learning_rate": 0.00011736481776669306,
"loss": 0.7613,
"mean_token_accuracy": 0.8419605195522308,
"num_tokens": 2057980.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.6941947937011719,
"learning_rate": 0.00011654574471008713,
"loss": 0.8329,
"mean_token_accuracy": 0.8272019922733307,
"num_tokens": 2069683.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.721640408039093,
"learning_rate": 0.00011572552877523854,
"loss": 0.8323,
"mean_token_accuracy": 0.8270902931690216,
"num_tokens": 2081025.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.7347063422203064,
"learning_rate": 0.00011490422661761744,
"loss": 0.7598,
"mean_token_accuracy": 0.8433621525764465,
"num_tokens": 2092607.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.7077701687812805,
"learning_rate": 0.00011408189496772368,
"loss": 0.7193,
"mean_token_accuracy": 0.8508957028388977,
"num_tokens": 2103628.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.7507743239402771,
"learning_rate": 0.00011325859062716795,
"loss": 0.8103,
"mean_token_accuracy": 0.833824634552002,
"num_tokens": 2114651.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.7624699473381042,
"learning_rate": 0.00011243437046474853,
"loss": 0.8807,
"mean_token_accuracy": 0.8172626495361328,
"num_tokens": 2126430.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.6758994460105896,
"learning_rate": 0.00011160929141252303,
"loss": 0.7942,
"mean_token_accuracy": 0.8366638422012329,
"num_tokens": 2137274.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.7404898405075073,
"learning_rate": 0.00011078341046187589,
"loss": 0.8795,
"mean_token_accuracy": 0.8165739476680756,
"num_tokens": 2148697.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.7106494307518005,
"learning_rate": 0.00010995678465958168,
"loss": 0.8499,
"mean_token_accuracy": 0.8253895044326782,
"num_tokens": 2160613.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.7398989796638489,
"learning_rate": 0.00010912947110386484,
"loss": 0.8027,
"mean_token_accuracy": 0.8303463160991669,
"num_tokens": 2172303.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.6920222043991089,
"learning_rate": 0.00010830152694045552,
"loss": 0.7958,
"mean_token_accuracy": 0.8368369340896606,
"num_tokens": 2183712.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.812565267086029,
"learning_rate": 0.00010747300935864243,
"loss": 0.8227,
"mean_token_accuracy": 0.8306939899921417,
"num_tokens": 2195201.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 0.7273798584938049,
"learning_rate": 0.00010664397558732244,
"loss": 0.7187,
"mean_token_accuracy": 0.8475557863712311,
"num_tokens": 2206348.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 0.7569606900215149,
"learning_rate": 0.00010581448289104758,
"loss": 0.883,
"mean_token_accuracy": 0.8176349401473999,
"num_tokens": 2218307.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.6757321357727051,
"learning_rate": 0.00010498458856606972,
"loss": 0.7564,
"mean_token_accuracy": 0.8416674435138702,
"num_tokens": 2229766.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.6368763446807861,
"learning_rate": 0.00010415434993638269,
"loss": 0.7013,
"mean_token_accuracy": 0.8532832860946655,
"num_tokens": 2240599.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.6708154678344727,
"learning_rate": 0.00010332382434976266,
"loss": 0.7171,
"mean_token_accuracy": 0.852762907743454,
"num_tokens": 2252398.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.7212777137756348,
"learning_rate": 0.0001024930691738073,
"loss": 0.7675,
"mean_token_accuracy": 0.8409071266651154,
"num_tokens": 2264039.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 0.7390912175178528,
"learning_rate": 0.00010166214179197264,
"loss": 0.7952,
"mean_token_accuracy": 0.835366427898407,
"num_tokens": 2275605.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.8875515460968018,
"learning_rate": 0.00010083109959960973,
"loss": 0.8717,
"mean_token_accuracy": 0.8222933113574982,
"num_tokens": 2287149.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.7605893015861511,
"learning_rate": 0.0001,
"loss": 0.7994,
"mean_token_accuracy": 0.8412551879882812,
"num_tokens": 2298149.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.682758629322052,
"learning_rate": 9.916890040039031e-05,
"loss": 0.8199,
"mean_token_accuracy": 0.831801027059555,
"num_tokens": 2309730.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.6830790042877197,
"learning_rate": 9.833785820802739e-05,
"loss": 0.7099,
"mean_token_accuracy": 0.8521651327610016,
"num_tokens": 2320654.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.694215714931488,
"learning_rate": 9.750693082619273e-05,
"loss": 0.7562,
"mean_token_accuracy": 0.8445379734039307,
"num_tokens": 2332220.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.7123032808303833,
"learning_rate": 9.667617565023735e-05,
"loss": 0.754,
"mean_token_accuracy": 0.8447227776050568,
"num_tokens": 2343588.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.7568661570549011,
"learning_rate": 9.584565006361734e-05,
"loss": 0.7913,
"mean_token_accuracy": 0.839029997587204,
"num_tokens": 2355041.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.8414303660392761,
"learning_rate": 9.501541143393028e-05,
"loss": 0.8121,
"mean_token_accuracy": 0.8275638222694397,
"num_tokens": 2366049.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.7648023962974548,
"learning_rate": 9.418551710895243e-05,
"loss": 0.784,
"mean_token_accuracy": 0.8382553458213806,
"num_tokens": 2377894.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.7028918862342834,
"learning_rate": 9.335602441267759e-05,
"loss": 0.7438,
"mean_token_accuracy": 0.8459280431270599,
"num_tokens": 2389701.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.7316209673881531,
"learning_rate": 9.252699064135758e-05,
"loss": 0.7426,
"mean_token_accuracy": 0.8471413552761078,
"num_tokens": 2400854.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.7141792178153992,
"learning_rate": 9.169847305954447e-05,
"loss": 0.8257,
"mean_token_accuracy": 0.8294172883033752,
"num_tokens": 2412586.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.7271824479103088,
"learning_rate": 9.087052889613518e-05,
"loss": 0.749,
"mean_token_accuracy": 0.8446075320243835,
"num_tokens": 2423882.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.7202516794204712,
"learning_rate": 9.004321534041835e-05,
"loss": 0.6752,
"mean_token_accuracy": 0.8554234504699707,
"num_tokens": 2434645.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.754311740398407,
"learning_rate": 8.921658953812415e-05,
"loss": 0.7528,
"mean_token_accuracy": 0.84283846616745,
"num_tokens": 2445879.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.7746644020080566,
"learning_rate": 8.839070858747697e-05,
"loss": 0.6854,
"mean_token_accuracy": 0.8581766784191132,
"num_tokens": 2457114.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.78766930103302,
"learning_rate": 8.756562953525152e-05,
"loss": 0.7482,
"mean_token_accuracy": 0.8451160490512848,
"num_tokens": 2468624.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.7526237964630127,
"learning_rate": 8.674140937283208e-05,
"loss": 0.7625,
"mean_token_accuracy": 0.842221587896347,
"num_tokens": 2479981.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.6812964677810669,
"learning_rate": 8.591810503227635e-05,
"loss": 0.6497,
"mean_token_accuracy": 0.8649884462356567,
"num_tokens": 2491405.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.7079475522041321,
"learning_rate": 8.509577338238255e-05,
"loss": 0.7861,
"mean_token_accuracy": 0.8404203653335571,
"num_tokens": 2502813.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.7311021685600281,
"learning_rate": 8.427447122476148e-05,
"loss": 0.7197,
"mean_token_accuracy": 0.8496346771717072,
"num_tokens": 2514190.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.7299697995185852,
"learning_rate": 8.345425528991288e-05,
"loss": 0.6534,
"mean_token_accuracy": 0.8644725978374481,
"num_tokens": 2525108.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.7232358455657959,
"learning_rate": 8.263518223330697e-05,
"loss": 0.7367,
"mean_token_accuracy": 0.8454770445823669,
"num_tokens": 2536505.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.7579157948493958,
"learning_rate": 8.181730863147093e-05,
"loss": 0.7802,
"mean_token_accuracy": 0.8421458303928375,
"num_tokens": 2548300.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.7531870603561401,
"learning_rate": 8.100069097808103e-05,
"loss": 0.7668,
"mean_token_accuracy": 0.837373673915863,
"num_tokens": 2559823.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.7980068325996399,
"learning_rate": 8.018538568006027e-05,
"loss": 0.7732,
"mean_token_accuracy": 0.8385846614837646,
"num_tokens": 2571347.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.7262105345726013,
"learning_rate": 7.937144905368226e-05,
"loss": 0.6929,
"mean_token_accuracy": 0.8532972633838654,
"num_tokens": 2582905.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.7458977699279785,
"learning_rate": 7.855893732068125e-05,
"loss": 0.8033,
"mean_token_accuracy": 0.832788497209549,
"num_tokens": 2594285.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.7132753729820251,
"learning_rate": 7.774790660436858e-05,
"loss": 0.7282,
"mean_token_accuracy": 0.8512730598449707,
"num_tokens": 2605746.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.7424162030220032,
"learning_rate": 7.693841292575598e-05,
"loss": 0.8419,
"mean_token_accuracy": 0.8298401832580566,
"num_tokens": 2617280.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.7677499651908875,
"learning_rate": 7.613051219968623e-05,
"loss": 0.7698,
"mean_token_accuracy": 0.8419542610645294,
"num_tokens": 2629030.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.7418862581253052,
"learning_rate": 7.532426023097063e-05,
"loss": 0.7345,
"mean_token_accuracy": 0.8459601104259491,
"num_tokens": 2640001.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.7955715656280518,
"learning_rate": 7.451971271053455e-05,
"loss": 0.8412,
"mean_token_accuracy": 0.8234219551086426,
"num_tokens": 2651498.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.7265613675117493,
"learning_rate": 7.371692521157048e-05,
"loss": 0.7409,
"mean_token_accuracy": 0.8501673936843872,
"num_tokens": 2662618.0,
"step": 234
},
{
"epoch": 2.980891719745223,
"grad_norm": 0.7546766400337219,
"learning_rate": 7.291595318569951e-05,
"loss": 0.7734,
"mean_token_accuracy": 0.8381434679031372,
"num_tokens": 2674269.0,
"step": 235
},
{
"epoch": 2.9936305732484074,
"grad_norm": 0.8405062556266785,
"learning_rate": 7.211685195914097e-05,
"loss": 0.774,
"mean_token_accuracy": 0.8428973257541656,
"num_tokens": 2685723.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.8405062556266785,
"learning_rate": 7.131967672889101e-05,
"loss": 0.5548,
"mean_token_accuracy": 0.8830875754356384,
"num_tokens": 2691520.0,
"step": 237
},
{
"epoch": 3.0127388535031847,
"grad_norm": 1.0931280851364136,
"learning_rate": 7.052448255890957e-05,
"loss": 0.4378,
"mean_token_accuracy": 0.9112375974655151,
"num_tokens": 2702735.0,
"step": 238
},
{
"epoch": 3.0254777070063694,
"grad_norm": 0.6512832045555115,
"learning_rate": 6.973132437631742e-05,
"loss": 0.4315,
"mean_token_accuracy": 0.9114527404308319,
"num_tokens": 2714184.0,
"step": 239
},
{
"epoch": 3.038216560509554,
"grad_norm": 0.6910308003425598,
"learning_rate": 6.894025696760163e-05,
"loss": 0.4022,
"mean_token_accuracy": 0.9163219630718231,
"num_tokens": 2726186.0,
"step": 240
},
{
"epoch": 3.050955414012739,
"grad_norm": 0.7762511968612671,
"learning_rate": 6.815133497483157e-05,
"loss": 0.4298,
"mean_token_accuracy": 0.9098988175392151,
"num_tokens": 2737492.0,
"step": 241
},
{
"epoch": 3.0636942675159236,
"grad_norm": 0.9614583849906921,
"learning_rate": 6.736461289188445e-05,
"loss": 0.4746,
"mean_token_accuracy": 0.8996783494949341,
"num_tokens": 2749284.0,
"step": 242
},
{
"epoch": 3.0764331210191083,
"grad_norm": 0.9811398386955261,
"learning_rate": 6.658014506068126e-05,
"loss": 0.4731,
"mean_token_accuracy": 0.9008384644985199,
"num_tokens": 2760625.0,
"step": 243
},
{
"epoch": 3.089171974522293,
"grad_norm": 0.7803757786750793,
"learning_rate": 6.579798566743314e-05,
"loss": 0.4739,
"mean_token_accuracy": 0.8986400067806244,
"num_tokens": 2772261.0,
"step": 244
},
{
"epoch": 3.1019108280254777,
"grad_norm": 0.6646518707275391,
"learning_rate": 6.501818873889855e-05,
"loss": 0.4418,
"mean_token_accuracy": 0.905548095703125,
"num_tokens": 2783770.0,
"step": 245
},
{
"epoch": 3.1146496815286624,
"grad_norm": 0.7459288239479065,
"learning_rate": 6.424080813865138e-05,
"loss": 0.4235,
"mean_token_accuracy": 0.9139858484268188,
"num_tokens": 2794903.0,
"step": 246
},
{
"epoch": 3.127388535031847,
"grad_norm": 0.6252720355987549,
"learning_rate": 6.34658975633605e-05,
"loss": 0.3942,
"mean_token_accuracy": 0.9155459702014923,
"num_tokens": 2806179.0,
"step": 247
},
{
"epoch": 3.140127388535032,
"grad_norm": 0.686250627040863,
"learning_rate": 6.269351053908061e-05,
"loss": 0.3849,
"mean_token_accuracy": 0.9164520800113678,
"num_tokens": 2817415.0,
"step": 248
},
{
"epoch": 3.1528662420382165,
"grad_norm": 0.6929484009742737,
"learning_rate": 6.192370041755505e-05,
"loss": 0.3571,
"mean_token_accuracy": 0.9215479791164398,
"num_tokens": 2828929.0,
"step": 249
},
{
"epoch": 3.1656050955414012,
"grad_norm": 0.8024463653564453,
"learning_rate": 6.115652037253053e-05,
"loss": 0.4148,
"mean_token_accuracy": 0.9082026779651642,
"num_tokens": 2840532.0,
"step": 250
},
{
"epoch": 3.178343949044586,
"grad_norm": 0.7858138680458069,
"learning_rate": 6.039202339608432e-05,
"loss": 0.3892,
"mean_token_accuracy": 0.9145569205284119,
"num_tokens": 2852314.0,
"step": 251
},
{
"epoch": 3.1910828025477707,
"grad_norm": 0.8003715872764587,
"learning_rate": 5.963026229496378e-05,
"loss": 0.4572,
"mean_token_accuracy": 0.9035838842391968,
"num_tokens": 2863849.0,
"step": 252
},
{
"epoch": 3.2038216560509554,
"grad_norm": 0.76338130235672,
"learning_rate": 5.887128968693887e-05,
"loss": 0.3811,
"mean_token_accuracy": 0.918819010257721,
"num_tokens": 2874972.0,
"step": 253
},
{
"epoch": 3.21656050955414,
"grad_norm": 0.7224725484848022,
"learning_rate": 5.8115157997167536e-05,
"loss": 0.4274,
"mean_token_accuracy": 0.908456951379776,
"num_tokens": 2886716.0,
"step": 254
},
{
"epoch": 3.229299363057325,
"grad_norm": 0.6986261606216431,
"learning_rate": 5.736191945457463e-05,
"loss": 0.3955,
"mean_token_accuracy": 0.9168632924556732,
"num_tokens": 2897985.0,
"step": 255
},
{
"epoch": 3.2420382165605095,
"grad_norm": 0.6842857003211975,
"learning_rate": 5.6611626088244194e-05,
"loss": 0.4806,
"mean_token_accuracy": 0.8974257409572601,
"num_tokens": 2909541.0,
"step": 256
},
{
"epoch": 3.254777070063694,
"grad_norm": 0.740216076374054,
"learning_rate": 5.58643297238256e-05,
"loss": 0.4039,
"mean_token_accuracy": 0.9144846200942993,
"num_tokens": 2920862.0,
"step": 257
},
{
"epoch": 3.267515923566879,
"grad_norm": 0.7123299837112427,
"learning_rate": 5.5120081979953785e-05,
"loss": 0.3984,
"mean_token_accuracy": 0.914899617433548,
"num_tokens": 2931948.0,
"step": 258
},
{
"epoch": 3.2802547770700636,
"grad_norm": 0.7262259721755981,
"learning_rate": 5.43789342646837e-05,
"loss": 0.3992,
"mean_token_accuracy": 0.9135793447494507,
"num_tokens": 2943315.0,
"step": 259
},
{
"epoch": 3.2929936305732483,
"grad_norm": 0.7332592606544495,
"learning_rate": 5.3640937771939436e-05,
"loss": 0.4232,
"mean_token_accuracy": 0.9101269543170929,
"num_tokens": 2954251.0,
"step": 260
},
{
"epoch": 3.305732484076433,
"grad_norm": 0.7521343231201172,
"learning_rate": 5.290614347797802e-05,
"loss": 0.4609,
"mean_token_accuracy": 0.8991831839084625,
"num_tokens": 2966119.0,
"step": 261
},
{
"epoch": 3.3184713375796178,
"grad_norm": 0.7670261263847351,
"learning_rate": 5.217460213786821e-05,
"loss": 0.3753,
"mean_token_accuracy": 0.9199231863021851,
"num_tokens": 2977756.0,
"step": 262
},
{
"epoch": 3.3312101910828025,
"grad_norm": 0.7183542251586914,
"learning_rate": 5.1446364281984774e-05,
"loss": 0.3887,
"mean_token_accuracy": 0.9179783165454865,
"num_tokens": 2989020.0,
"step": 263
},
{
"epoch": 3.343949044585987,
"grad_norm": 0.7223445773124695,
"learning_rate": 5.072148021251821e-05,
"loss": 0.3824,
"mean_token_accuracy": 0.9165781438350677,
"num_tokens": 3000498.0,
"step": 264
},
{
"epoch": 3.356687898089172,
"grad_norm": 0.7291591763496399,
"learning_rate": 5.000000000000002e-05,
"loss": 0.465,
"mean_token_accuracy": 0.8992412984371185,
"num_tokens": 3012283.0,
"step": 265
},
{
"epoch": 3.3694267515923566,
"grad_norm": 0.7637300491333008,
"learning_rate": 4.92819734798441e-05,
"loss": 0.3856,
"mean_token_accuracy": 0.9171736836433411,
"num_tokens": 3023734.0,
"step": 266
},
{
"epoch": 3.3821656050955413,
"grad_norm": 0.7061458230018616,
"learning_rate": 4.856745024890466e-05,
"loss": 0.4057,
"mean_token_accuracy": 0.9132257997989655,
"num_tokens": 3035422.0,
"step": 267
},
{
"epoch": 3.394904458598726,
"grad_norm": 0.6533039808273315,
"learning_rate": 4.78564796620502e-05,
"loss": 0.3742,
"mean_token_accuracy": 0.9179588854312897,
"num_tokens": 3047227.0,
"step": 268
},
{
"epoch": 3.4076433121019107,
"grad_norm": 0.7290828227996826,
"learning_rate": 4.7149110828754464e-05,
"loss": 0.4523,
"mean_token_accuracy": 0.9024053812026978,
"num_tokens": 3058515.0,
"step": 269
},
{
"epoch": 3.4203821656050954,
"grad_norm": 0.7428059577941895,
"learning_rate": 4.644539260970416e-05,
"loss": 0.4019,
"mean_token_accuracy": 0.9147013127803802,
"num_tokens": 3070154.0,
"step": 270
},
{
"epoch": 3.43312101910828,
"grad_norm": 0.7001674771308899,
"learning_rate": 4.574537361342407e-05,
"loss": 0.4468,
"mean_token_accuracy": 0.9073070287704468,
"num_tokens": 3081238.0,
"step": 271
},
{
"epoch": 3.445859872611465,
"grad_norm": 0.7086686491966248,
"learning_rate": 4.50491021929194e-05,
"loss": 0.3663,
"mean_token_accuracy": 0.9213272333145142,
"num_tokens": 3092931.0,
"step": 272
},
{
"epoch": 3.4585987261146496,
"grad_norm": 0.7113444805145264,
"learning_rate": 4.435662644233594e-05,
"loss": 0.3793,
"mean_token_accuracy": 0.9215837121009827,
"num_tokens": 3104621.0,
"step": 273
},
{
"epoch": 3.4713375796178343,
"grad_norm": 0.7607334852218628,
"learning_rate": 4.3667994193637796e-05,
"loss": 0.3682,
"mean_token_accuracy": 0.921149730682373,
"num_tokens": 3116470.0,
"step": 274
},
{
"epoch": 3.484076433121019,
"grad_norm": 0.7381239533424377,
"learning_rate": 4.298325301330383e-05,
"loss": 0.4207,
"mean_token_accuracy": 0.9124354124069214,
"num_tokens": 3127792.0,
"step": 275
},
{
"epoch": 3.4968152866242037,
"grad_norm": 0.7434445023536682,
"learning_rate": 4.23024501990417e-05,
"loss": 0.3605,
"mean_token_accuracy": 0.92374187707901,
"num_tokens": 3139330.0,
"step": 276
},
{
"epoch": 3.5095541401273884,
"grad_norm": 0.7115570902824402,
"learning_rate": 4.1625632776521037e-05,
"loss": 0.3784,
"mean_token_accuracy": 0.9193529784679413,
"num_tokens": 3150599.0,
"step": 277
},
{
"epoch": 3.522292993630573,
"grad_norm": 0.7325626015663147,
"learning_rate": 4.095284749612503e-05,
"loss": 0.4521,
"mean_token_accuracy": 0.9044492542743683,
"num_tokens": 3161908.0,
"step": 278
},
{
"epoch": 3.535031847133758,
"grad_norm": 0.7054380178451538,
"learning_rate": 4.028414082972141e-05,
"loss": 0.3728,
"mean_token_accuracy": 0.9196057915687561,
"num_tokens": 3173218.0,
"step": 279
},
{
"epoch": 3.5477707006369426,
"grad_norm": 0.718416690826416,
"learning_rate": 3.961955896745224e-05,
"loss": 0.4101,
"mean_token_accuracy": 0.9115929007530212,
"num_tokens": 3184570.0,
"step": 280
},
{
"epoch": 3.5605095541401273,
"grad_norm": 0.791922390460968,
"learning_rate": 3.89591478145437e-05,
"loss": 0.4161,
"mean_token_accuracy": 0.9134823977947235,
"num_tokens": 3196499.0,
"step": 281
},
{
"epoch": 3.573248407643312,
"grad_norm": 0.7314372658729553,
"learning_rate": 3.8302952988134756e-05,
"loss": 0.3959,
"mean_token_accuracy": 0.9104648232460022,
"num_tokens": 3207925.0,
"step": 282
},
{
"epoch": 3.5859872611464967,
"grad_norm": 0.6875584125518799,
"learning_rate": 3.7651019814126654e-05,
"loss": 0.3528,
"mean_token_accuracy": 0.9253743290901184,
"num_tokens": 3218971.0,
"step": 283
},
{
"epoch": 3.5987261146496814,
"grad_norm": 0.7326579093933105,
"learning_rate": 3.7003393324051874e-05,
"loss": 0.4021,
"mean_token_accuracy": 0.9128564596176147,
"num_tokens": 3230456.0,
"step": 284
},
{
"epoch": 3.611464968152866,
"grad_norm": 0.7286593914031982,
"learning_rate": 3.6360118251963645e-05,
"loss": 0.383,
"mean_token_accuracy": 0.917042464017868,
"num_tokens": 3241801.0,
"step": 285
},
{
"epoch": 3.624203821656051,
"grad_norm": 0.7183976173400879,
"learning_rate": 3.5721239031346066e-05,
"loss": 0.4085,
"mean_token_accuracy": 0.9113990664482117,
"num_tokens": 3253004.0,
"step": 286
},
{
"epoch": 3.6369426751592355,
"grad_norm": 0.7951269745826721,
"learning_rate": 3.508679979204481e-05,
"loss": 0.4163,
"mean_token_accuracy": 0.9118180274963379,
"num_tokens": 3264403.0,
"step": 287
},
{
"epoch": 3.6496815286624202,
"grad_norm": 0.7571028470993042,
"learning_rate": 3.445684435721897e-05,
"loss": 0.4175,
"mean_token_accuracy": 0.9093326032161713,
"num_tokens": 3276391.0,
"step": 288
},
{
"epoch": 3.662420382165605,
"grad_norm": 0.7511271834373474,
"learning_rate": 3.383141624031408e-05,
"loss": 0.4207,
"mean_token_accuracy": 0.9097310900688171,
"num_tokens": 3287738.0,
"step": 289
},
{
"epoch": 3.6751592356687897,
"grad_norm": 0.7271094918251038,
"learning_rate": 3.3210558642056275e-05,
"loss": 0.3244,
"mean_token_accuracy": 0.9262686371803284,
"num_tokens": 3299143.0,
"step": 290
},
{
"epoch": 3.6878980891719744,
"grad_norm": 0.6291069388389587,
"learning_rate": 3.259431444746846e-05,
"loss": 0.3689,
"mean_token_accuracy": 0.9212159514427185,
"num_tokens": 3310487.0,
"step": 291
},
{
"epoch": 3.700636942675159,
"grad_norm": 0.7592793703079224,
"learning_rate": 3.198272622290804e-05,
"loss": 0.3751,
"mean_token_accuracy": 0.9193132519721985,
"num_tokens": 3321796.0,
"step": 292
},
{
"epoch": 3.713375796178344,
"grad_norm": 0.717683732509613,
"learning_rate": 3.137583621312665e-05,
"loss": 0.4047,
"mean_token_accuracy": 0.9123214483261108,
"num_tokens": 3332604.0,
"step": 293
},
{
"epoch": 3.7261146496815285,
"grad_norm": 0.7711255550384521,
"learning_rate": 3.077368633835205e-05,
"loss": 0.3826,
"mean_token_accuracy": 0.9203261137008667,
"num_tokens": 3344007.0,
"step": 294
},
{
"epoch": 3.738853503184713,
"grad_norm": 0.7225829362869263,
"learning_rate": 3.0176318191392726e-05,
"loss": 0.4082,
"mean_token_accuracy": 0.9109752476215363,
"num_tokens": 3355090.0,
"step": 295
},
{
"epoch": 3.7515923566878984,
"grad_norm": 0.7202189564704895,
"learning_rate": 2.9583773034764826e-05,
"loss": 0.3337,
"mean_token_accuracy": 0.9286851584911346,
"num_tokens": 3365904.0,
"step": 296
},
{
"epoch": 3.7643312101910826,
"grad_norm": 0.7087749242782593,
"learning_rate": 2.8996091797841973e-05,
"loss": 0.3724,
"mean_token_accuracy": 0.9182478785514832,
"num_tokens": 3377964.0,
"step": 297
},
{
"epoch": 3.777070063694268,
"grad_norm": 0.7725366353988647,
"learning_rate": 2.8413315074028158e-05,
"loss": 0.4251,
"mean_token_accuracy": 0.9080156087875366,
"num_tokens": 3389347.0,
"step": 298
},
{
"epoch": 3.789808917197452,
"grad_norm": 0.6942902207374573,
"learning_rate": 2.7835483117953788e-05,
"loss": 0.3589,
"mean_token_accuracy": 0.920698344707489,
"num_tokens": 3400439.0,
"step": 299
},
{
"epoch": 3.802547770700637,
"grad_norm": 0.8013036251068115,
"learning_rate": 2.7262635842695127e-05,
"loss": 0.4216,
"mean_token_accuracy": 0.9113393723964691,
"num_tokens": 3411639.0,
"step": 300
},
{
"epoch": 3.8152866242038215,
"grad_norm": 0.6873416304588318,
"learning_rate": 2.669481281701739e-05,
"loss": 0.345,
"mean_token_accuracy": 0.9255788028240204,
"num_tokens": 3423172.0,
"step": 301
},
{
"epoch": 3.8280254777070066,
"grad_norm": 0.7055365443229675,
"learning_rate": 2.6132053262641466e-05,
"loss": 0.4195,
"mean_token_accuracy": 0.9090149402618408,
"num_tokens": 3434947.0,
"step": 302
},
{
"epoch": 3.840764331210191,
"grad_norm": 0.695279598236084,
"learning_rate": 2.5574396051534832e-05,
"loss": 0.3729,
"mean_token_accuracy": 0.9185731709003448,
"num_tokens": 3446512.0,
"step": 303
},
{
"epoch": 3.853503184713376,
"grad_norm": 0.6654506325721741,
"learning_rate": 2.502187970322657e-05,
"loss": 0.3817,
"mean_token_accuracy": 0.9183900356292725,
"num_tokens": 3458505.0,
"step": 304
},
{
"epoch": 3.8662420382165603,
"grad_norm": 0.6791413426399231,
"learning_rate": 2.4474542382146537e-05,
"loss": 0.3857,
"mean_token_accuracy": 0.9171143770217896,
"num_tokens": 3470163.0,
"step": 305
},
{
"epoch": 3.8789808917197455,
"grad_norm": 0.6865147948265076,
"learning_rate": 2.3932421894989167e-05,
"loss": 0.3212,
"mean_token_accuracy": 0.929681807756424,
"num_tokens": 3481090.0,
"step": 306
},
{
"epoch": 3.8917197452229297,
"grad_norm": 0.7324571013450623,
"learning_rate": 2.339555568810221e-05,
"loss": 0.3889,
"mean_token_accuracy": 0.9164491891860962,
"num_tokens": 3491946.0,
"step": 307
},
{
"epoch": 3.904458598726115,
"grad_norm": 0.7851356267929077,
"learning_rate": 2.2863980844900036e-05,
"loss": 0.4214,
"mean_token_accuracy": 0.9069257974624634,
"num_tokens": 3502961.0,
"step": 308
},
{
"epoch": 3.917197452229299,
"grad_norm": 0.7185788154602051,
"learning_rate": 2.2337734083302164e-05,
"loss": 0.3563,
"mean_token_accuracy": 0.9213061332702637,
"num_tokens": 3514116.0,
"step": 309
},
{
"epoch": 3.9299363057324843,
"grad_norm": 0.6799073219299316,
"learning_rate": 2.181685175319702e-05,
"loss": 0.378,
"mean_token_accuracy": 0.9194752275943756,
"num_tokens": 3525855.0,
"step": 310
},
{
"epoch": 3.9426751592356686,
"grad_norm": 0.6928824186325073,
"learning_rate": 2.1301369833931117e-05,
"loss": 0.3883,
"mean_token_accuracy": 0.9154934287071228,
"num_tokens": 3536972.0,
"step": 311
},
{
"epoch": 3.9554140127388537,
"grad_norm": 0.7100560665130615,
"learning_rate": 2.079132393182378e-05,
"loss": 0.3597,
"mean_token_accuracy": 0.9214137196540833,
"num_tokens": 3548281.0,
"step": 312
},
{
"epoch": 3.968152866242038,
"grad_norm": 0.7356792092323303,
"learning_rate": 2.0286749277707782e-05,
"loss": 0.3704,
"mean_token_accuracy": 0.9214728474617004,
"num_tokens": 3559528.0,
"step": 313
},
{
"epoch": 3.980891719745223,
"grad_norm": 0.7311772704124451,
"learning_rate": 1.9787680724495617e-05,
"loss": 0.4054,
"mean_token_accuracy": 0.9130307734012604,
"num_tokens": 3571410.0,
"step": 314
},
{
"epoch": 3.9936305732484074,
"grad_norm": 0.7273927330970764,
"learning_rate": 1.929415274477239e-05,
"loss": 0.3699,
"mean_token_accuracy": 0.9222646355628967,
"num_tokens": 3582989.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.9767398834228516,
"learning_rate": 1.880619942841435e-05,
"loss": 0.2723,
"mean_token_accuracy": 0.9425185918807983,
"num_tokens": 3588675.0,
"step": 316
},
{
"epoch": 4.012738853503185,
"grad_norm": 0.6263962388038635,
"learning_rate": 1.832385448023435e-05,
"loss": 0.2918,
"mean_token_accuracy": 0.9413339197635651,
"num_tokens": 3600582.0,
"step": 317
},
{
"epoch": 4.025477707006369,
"grad_norm": 0.5037514567375183,
"learning_rate": 1.7847151217653624e-05,
"loss": 0.1918,
"mean_token_accuracy": 0.9609819948673248,
"num_tokens": 3612395.0,
"step": 318
},
{
"epoch": 4.038216560509555,
"grad_norm": 0.5700432658195496,
"learning_rate": 1.7376122568400532e-05,
"loss": 0.2232,
"mean_token_accuracy": 0.9543178379535675,
"num_tokens": 3623934.0,
"step": 319
},
{
"epoch": 4.050955414012739,
"grad_norm": 0.6004671454429626,
"learning_rate": 1.6910801068236016e-05,
"loss": 0.256,
"mean_token_accuracy": 0.9473693072795868,
"num_tokens": 3635141.0,
"step": 320
},
{
"epoch": 4.063694267515924,
"grad_norm": 0.5617762804031372,
"learning_rate": 1.6451218858706374e-05,
"loss": 0.2451,
"mean_token_accuracy": 0.951095849275589,
"num_tokens": 3646412.0,
"step": 321
},
{
"epoch": 4.076433121019108,
"grad_norm": 0.533304750919342,
"learning_rate": 1.5997407684922862e-05,
"loss": 0.2242,
"mean_token_accuracy": 0.9530414640903473,
"num_tokens": 3658369.0,
"step": 322
},
{
"epoch": 4.089171974522293,
"grad_norm": 0.5561266541481018,
"learning_rate": 1.5549398893369216e-05,
"loss": 0.2114,
"mean_token_accuracy": 0.9571148455142975,
"num_tokens": 3669448.0,
"step": 323
},
{
"epoch": 4.101910828025478,
"grad_norm": 0.6145673990249634,
"learning_rate": 1.5107223429736272e-05,
"loss": 0.2246,
"mean_token_accuracy": 0.9528952240943909,
"num_tokens": 3681023.0,
"step": 324
},
{
"epoch": 4.114649681528663,
"grad_norm": 0.6063571572303772,
"learning_rate": 1.467091183678444e-05,
"loss": 0.2153,
"mean_token_accuracy": 0.9555847346782684,
"num_tokens": 3692657.0,
"step": 325
},
{
"epoch": 4.127388535031847,
"grad_norm": 0.7087187170982361,
"learning_rate": 1.4240494252234049e-05,
"loss": 0.2393,
"mean_token_accuracy": 0.9499338865280151,
"num_tokens": 3704395.0,
"step": 326
},
{
"epoch": 4.140127388535032,
"grad_norm": 0.7192868590354919,
"learning_rate": 1.3816000406683604e-05,
"loss": 0.243,
"mean_token_accuracy": 0.9491298496723175,
"num_tokens": 3716489.0,
"step": 327
},
{
"epoch": 4.1528662420382165,
"grad_norm": 0.7291700839996338,
"learning_rate": 1.339745962155613e-05,
"loss": 0.2505,
"mean_token_accuracy": 0.9449942708015442,
"num_tokens": 3727830.0,
"step": 328
},
{
"epoch": 4.165605095541402,
"grad_norm": 0.7119983434677124,
"learning_rate": 1.2984900807073919e-05,
"loss": 0.223,
"mean_token_accuracy": 0.9517882168292999,
"num_tokens": 3739056.0,
"step": 329
},
{
"epoch": 4.178343949044586,
"grad_norm": 0.6926700472831726,
"learning_rate": 1.2578352460261456e-05,
"loss": 0.2585,
"mean_token_accuracy": 0.9477393925189972,
"num_tokens": 3750358.0,
"step": 330
},
{
"epoch": 4.191082802547771,
"grad_norm": 0.7205728888511658,
"learning_rate": 1.2177842662977135e-05,
"loss": 0.2745,
"mean_token_accuracy": 0.942330002784729,
"num_tokens": 3761678.0,
"step": 331
},
{
"epoch": 4.203821656050955,
"grad_norm": 0.7079265713691711,
"learning_rate": 1.1783399079973578e-05,
"loss": 0.2745,
"mean_token_accuracy": 0.9428843557834625,
"num_tokens": 3772919.0,
"step": 332
},
{
"epoch": 4.2165605095541405,
"grad_norm": 0.6066899299621582,
"learning_rate": 1.1395048956986575e-05,
"loss": 0.2299,
"mean_token_accuracy": 0.9510907232761383,
"num_tokens": 3784964.0,
"step": 333
},
{
"epoch": 4.229299363057325,
"grad_norm": 0.6382308006286621,
"learning_rate": 1.1012819118853147e-05,
"loss": 0.2475,
"mean_token_accuracy": 0.9474037885665894,
"num_tokens": 3796759.0,
"step": 334
},
{
"epoch": 4.24203821656051,
"grad_norm": 0.5721100568771362,
"learning_rate": 1.0636735967658784e-05,
"loss": 0.2072,
"mean_token_accuracy": 0.9569090008735657,
"num_tokens": 3807780.0,
"step": 335
},
{
"epoch": 4.254777070063694,
"grad_norm": 0.6053273677825928,
"learning_rate": 1.0266825480913611e-05,
"loss": 0.2476,
"mean_token_accuracy": 0.9472332894802094,
"num_tokens": 3818794.0,
"step": 336
},
{
"epoch": 4.267515923566879,
"grad_norm": 0.5573616623878479,
"learning_rate": 9.903113209758096e-06,
"loss": 0.2172,
"mean_token_accuracy": 0.9540870785713196,
"num_tokens": 3830160.0,
"step": 337
},
{
"epoch": 4.280254777070064,
"grad_norm": 0.574436604976654,
"learning_rate": 9.545624277198084e-06,
"loss": 0.2346,
"mean_token_accuracy": 0.9521960914134979,
"num_tokens": 3841632.0,
"step": 338
},
{
"epoch": 4.292993630573249,
"grad_norm": 0.5788965225219727,
"learning_rate": 9.194383376369508e-06,
"loss": 0.2325,
"mean_token_accuracy": 0.9513043165206909,
"num_tokens": 3852969.0,
"step": 339
},
{
"epoch": 4.305732484076433,
"grad_norm": 0.5369225740432739,
"learning_rate": 8.849414768832687e-06,
"loss": 0.2018,
"mean_token_accuracy": 0.9572807252407074,
"num_tokens": 3864175.0,
"step": 340
},
{
"epoch": 4.318471337579618,
"grad_norm": 0.5755797624588013,
"learning_rate": 8.510742282896544e-06,
"loss": 0.2342,
"mean_token_accuracy": 0.9505596160888672,
"num_tokens": 3875709.0,
"step": 341
},
{
"epoch": 4.3312101910828025,
"grad_norm": 0.5512501001358032,
"learning_rate": 8.178389311972612e-06,
"loss": 0.2075,
"mean_token_accuracy": 0.9557295739650726,
"num_tokens": 3887256.0,
"step": 342
},
{
"epoch": 4.343949044585988,
"grad_norm": 0.623961329460144,
"learning_rate": 7.852378812959227e-06,
"loss": 0.2392,
"mean_token_accuracy": 0.9496417343616486,
"num_tokens": 3898876.0,
"step": 343
},
{
"epoch": 4.356687898089172,
"grad_norm": 0.5371074676513672,
"learning_rate": 7.532733304655848e-06,
"loss": 0.2156,
"mean_token_accuracy": 0.9538998603820801,
"num_tokens": 3910522.0,
"step": 344
},
{
"epoch": 4.369426751592357,
"grad_norm": 0.598827600479126,
"learning_rate": 7.219474866207465e-06,
"loss": 0.2291,
"mean_token_accuracy": 0.9503605365753174,
"num_tokens": 3921730.0,
"step": 345
},
{
"epoch": 4.382165605095541,
"grad_norm": 0.5664372444152832,
"learning_rate": 6.9126251355795864e-06,
"loss": 0.2132,
"mean_token_accuracy": 0.9563162922859192,
"num_tokens": 3933613.0,
"step": 346
},
{
"epoch": 4.3949044585987265,
"grad_norm": 0.5948131680488586,
"learning_rate": 6.612205308063646e-06,
"loss": 0.2415,
"mean_token_accuracy": 0.9487094283103943,
"num_tokens": 3945095.0,
"step": 347
},
{
"epoch": 4.407643312101911,
"grad_norm": 0.5984826683998108,
"learning_rate": 6.318236134812916e-06,
"loss": 0.2335,
"mean_token_accuracy": 0.9525950253009796,
"num_tokens": 3956565.0,
"step": 348
},
{
"epoch": 4.420382165605096,
"grad_norm": 0.6437399387359619,
"learning_rate": 6.030737921409169e-06,
"loss": 0.2526,
"mean_token_accuracy": 0.9473262429237366,
"num_tokens": 3967950.0,
"step": 349
},
{
"epoch": 4.43312101910828,
"grad_norm": 0.6472037434577942,
"learning_rate": 5.749730526460073e-06,
"loss": 0.24,
"mean_token_accuracy": 0.9503650963306427,
"num_tokens": 3979520.0,
"step": 350
},
{
"epoch": 4.445859872611465,
"grad_norm": 0.6440314650535583,
"learning_rate": 5.475233360227516e-06,
"loss": 0.2465,
"mean_token_accuracy": 0.9471862018108368,
"num_tokens": 3990605.0,
"step": 351
},
{
"epoch": 4.45859872611465,
"grad_norm": 0.614966094493866,
"learning_rate": 5.20726538328683e-06,
"loss": 0.2366,
"mean_token_accuracy": 0.950160413980484,
"num_tokens": 4001897.0,
"step": 352
},
{
"epoch": 4.471337579617835,
"grad_norm": 0.530875563621521,
"learning_rate": 4.945845105217117e-06,
"loss": 0.2054,
"mean_token_accuracy": 0.9580708742141724,
"num_tokens": 4013030.0,
"step": 353
},
{
"epoch": 4.484076433121019,
"grad_norm": 0.588732123374939,
"learning_rate": 4.6909905833226966e-06,
"loss": 0.2314,
"mean_token_accuracy": 0.9539461433887482,
"num_tokens": 4024717.0,
"step": 354
},
{
"epoch": 4.496815286624204,
"grad_norm": 0.6098395586013794,
"learning_rate": 4.442719421385922e-06,
"loss": 0.245,
"mean_token_accuracy": 0.9490169584751129,
"num_tokens": 4036521.0,
"step": 355
},
{
"epoch": 4.509554140127388,
"grad_norm": 0.568778932094574,
"learning_rate": 4.20104876845111e-06,
"loss": 0.2115,
"mean_token_accuracy": 0.9555296897888184,
"num_tokens": 4048246.0,
"step": 356
},
{
"epoch": 4.522292993630574,
"grad_norm": 0.6375371217727661,
"learning_rate": 3.965995317640025e-06,
"loss": 0.2176,
"mean_token_accuracy": 0.9533799290657043,
"num_tokens": 4059468.0,
"step": 357
},
{
"epoch": 4.535031847133758,
"grad_norm": 0.6353257894515991,
"learning_rate": 3.7375753049987973e-06,
"loss": 0.2524,
"mean_token_accuracy": 0.9476073980331421,
"num_tokens": 4071007.0,
"step": 358
},
{
"epoch": 4.547770700636943,
"grad_norm": 0.6253010034561157,
"learning_rate": 3.515804508376508e-06,
"loss": 0.2244,
"mean_token_accuracy": 0.952837735414505,
"num_tokens": 4081959.0,
"step": 359
},
{
"epoch": 4.560509554140127,
"grad_norm": 0.6389527320861816,
"learning_rate": 3.3006982463352766e-06,
"loss": 0.2497,
"mean_token_accuracy": 0.9464636743068695,
"num_tokens": 4093354.0,
"step": 360
},
{
"epoch": 4.573248407643312,
"grad_norm": 0.6158127188682556,
"learning_rate": 3.092271377092215e-06,
"loss": 0.2594,
"mean_token_accuracy": 0.9450841546058655,
"num_tokens": 4105174.0,
"step": 361
},
{
"epoch": 4.585987261146497,
"grad_norm": 0.5516409277915955,
"learning_rate": 2.8905382974930172e-06,
"loss": 0.2004,
"mean_token_accuracy": 0.9575099050998688,
"num_tokens": 4116576.0,
"step": 362
},
{
"epoch": 4.598726114649682,
"grad_norm": 0.5847783088684082,
"learning_rate": 2.6955129420176196e-06,
"loss": 0.2139,
"mean_token_accuracy": 0.9543090164661407,
"num_tokens": 4127873.0,
"step": 363
},
{
"epoch": 4.611464968152866,
"grad_norm": 0.6172647476196289,
"learning_rate": 2.5072087818176382e-06,
"loss": 0.2242,
"mean_token_accuracy": 0.9529656767845154,
"num_tokens": 4138888.0,
"step": 364
},
{
"epoch": 4.624203821656051,
"grad_norm": 0.6086074709892273,
"learning_rate": 2.3256388237858807e-06,
"loss": 0.2351,
"mean_token_accuracy": 0.9496529996395111,
"num_tokens": 4150232.0,
"step": 365
},
{
"epoch": 4.6369426751592355,
"grad_norm": 0.7375149130821228,
"learning_rate": 2.150815609657875e-06,
"loss": 0.2848,
"mean_token_accuracy": 0.9394731223583221,
"num_tokens": 4161733.0,
"step": 366
},
{
"epoch": 4.649681528662421,
"grad_norm": 0.6453984379768372,
"learning_rate": 1.9827512151456173e-06,
"loss": 0.2661,
"mean_token_accuracy": 0.9441668093204498,
"num_tokens": 4173910.0,
"step": 367
},
{
"epoch": 4.662420382165605,
"grad_norm": 0.600554347038269,
"learning_rate": 1.8214572491034198e-06,
"loss": 0.2115,
"mean_token_accuracy": 0.9533166885375977,
"num_tokens": 4185377.0,
"step": 368
},
{
"epoch": 4.67515923566879,
"grad_norm": 0.5804630517959595,
"learning_rate": 1.66694485272606e-06,
"loss": 0.211,
"mean_token_accuracy": 0.954418271780014,
"num_tokens": 4196586.0,
"step": 369
},
{
"epoch": 4.687898089171974,
"grad_norm": 0.5770214200019836,
"learning_rate": 1.5192246987791981e-06,
"loss": 0.201,
"mean_token_accuracy": 0.958386242389679,
"num_tokens": 4207564.0,
"step": 370
},
{
"epoch": 4.7006369426751595,
"grad_norm": 0.6551446914672852,
"learning_rate": 1.378306990862177e-06,
"loss": 0.2509,
"mean_token_accuracy": 0.94569331407547,
"num_tokens": 4218790.0,
"step": 371
},
{
"epoch": 4.713375796178344,
"grad_norm": 0.6654523015022278,
"learning_rate": 1.2442014627032316e-06,
"loss": 0.2399,
"mean_token_accuracy": 0.9496492147445679,
"num_tokens": 4230117.0,
"step": 372
},
{
"epoch": 4.726114649681529,
"grad_norm": 0.588997483253479,
"learning_rate": 1.1169173774871478e-06,
"loss": 0.2224,
"mean_token_accuracy": 0.9534730911254883,
"num_tokens": 4241547.0,
"step": 373
},
{
"epoch": 4.738853503184713,
"grad_norm": 0.5755416750907898,
"learning_rate": 9.964635272153633e-07,
"loss": 0.225,
"mean_token_accuracy": 0.9524531066417694,
"num_tokens": 4253164.0,
"step": 374
},
{
"epoch": 4.751592356687898,
"grad_norm": 0.6713494062423706,
"learning_rate": 8.828482320987319e-07,
"loss": 0.2571,
"mean_token_accuracy": 0.9453714489936829,
"num_tokens": 4264634.0,
"step": 375
},
{
"epoch": 4.764331210191083,
"grad_norm": 0.615914523601532,
"learning_rate": 7.760793399827937e-07,
"loss": 0.2152,
"mean_token_accuracy": 0.9523234069347382,
"num_tokens": 4275920.0,
"step": 376
},
{
"epoch": 4.777070063694268,
"grad_norm": 0.5669645071029663,
"learning_rate": 6.761642258056978e-07,
"loss": 0.2017,
"mean_token_accuracy": 0.9563316702842712,
"num_tokens": 4287045.0,
"step": 377
},
{
"epoch": 4.789808917197452,
"grad_norm": 0.5885363817214966,
"learning_rate": 5.831097910887873e-07,
"loss": 0.2226,
"mean_token_accuracy": 0.9541411101818085,
"num_tokens": 4298056.0,
"step": 378
},
{
"epoch": 4.802547770700637,
"grad_norm": 0.640458881855011,
"learning_rate": 4.969224634598591e-07,
"loss": 0.2358,
"mean_token_accuracy": 0.9503754377365112,
"num_tokens": 4309058.0,
"step": 379
},
{
"epoch": 4.8152866242038215,
"grad_norm": 0.5789880752563477,
"learning_rate": 4.176081962092182e-07,
"loss": 0.2127,
"mean_token_accuracy": 0.954579770565033,
"num_tokens": 4320492.0,
"step": 380
},
{
"epoch": 4.828025477707007,
"grad_norm": 0.5396387577056885,
"learning_rate": 3.451724678784518e-07,
"loss": 0.1879,
"mean_token_accuracy": 0.9586823284626007,
"num_tokens": 4331497.0,
"step": 381
},
{
"epoch": 4.840764331210191,
"grad_norm": 0.5952228307723999,
"learning_rate": 2.7962028188198706e-07,
"loss": 0.2195,
"mean_token_accuracy": 0.9526137411594391,
"num_tokens": 4343022.0,
"step": 382
},
{
"epoch": 4.853503184713376,
"grad_norm": 0.6236734986305237,
"learning_rate": 2.2095616616150115e-07,
"loss": 0.2427,
"mean_token_accuracy": 0.9495434165000916,
"num_tokens": 4354393.0,
"step": 383
},
{
"epoch": 4.86624203821656,
"grad_norm": 0.5874990820884705,
"learning_rate": 1.6918417287318245e-07,
"loss": 0.2105,
"mean_token_accuracy": 0.9567264318466187,
"num_tokens": 4365580.0,
"step": 384
},
{
"epoch": 4.8789808917197455,
"grad_norm": 0.5601053833961487,
"learning_rate": 1.2430787810776555e-07,
"loss": 0.2181,
"mean_token_accuracy": 0.9536438584327698,
"num_tokens": 4376649.0,
"step": 385
},
{
"epoch": 4.89171974522293,
"grad_norm": 0.688409149646759,
"learning_rate": 8.633038164358454e-08,
"loss": 0.2478,
"mean_token_accuracy": 0.9468058943748474,
"num_tokens": 4388351.0,
"step": 386
},
{
"epoch": 4.904458598726115,
"grad_norm": 0.5797482132911682,
"learning_rate": 5.5254306732444025e-08,
"loss": 0.2045,
"mean_token_accuracy": 0.9557230472564697,
"num_tokens": 4400015.0,
"step": 387
},
{
"epoch": 4.917197452229299,
"grad_norm": 0.5975958704948425,
"learning_rate": 3.1081799918375454e-08,
"loss": 0.2184,
"mean_token_accuracy": 0.9523274600505829,
"num_tokens": 4411248.0,
"step": 388
},
{
"epoch": 4.929936305732484,
"grad_norm": 0.5998685359954834,
"learning_rate": 1.3814530889433296e-08,
"loss": 0.2088,
"mean_token_accuracy": 0.9564402997493744,
"num_tokens": 4422081.0,
"step": 389
},
{
"epoch": 4.942675159235669,
"grad_norm": 0.6222056746482849,
"learning_rate": 3.453692362309635e-09,
"loss": 0.2291,
"mean_token_accuracy": 0.9509786069393158,
"num_tokens": 4433867.0,
"step": 390
},
{
"epoch": 4.942675159235669,
"step": 390,
"total_flos": 2.6684669817153126e+17,
"train_loss": 0.9054459434289198,
"train_runtime": 756.179,
"train_samples_per_second": 33.061,
"train_steps_per_second": 0.516
}
],
"logging_steps": 1.0,
"max_steps": 390,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.6684669817153126e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}