{ "best_global_step": 2500, "best_metric": 1.9008162525214212, "best_model_checkpoint": "/content/cot-split1/checkpoint-2500", "epoch": 3.913220551378446, "eval_steps": 250, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_bpd": 5.449506205976702, "eval_entropy": 3.8259646681880883, "eval_loss": 3.7819511890411377, "eval_mean_token_accuracy": 0.3298281561563004, "eval_nll": 3.777309862116675, "eval_num_tokens": 0.0, "eval_ppl": 43.69832894461198, "eval_runtime": 318.4397, "eval_samples_per_second": 570.309, "eval_steps_per_second": 8.912, "step": 0 }, { "entropy": 3.936198543874438, "epoch": 0.0015664160401002505, "grad_norm": 3.5, "learning_rate": 0.0, "loss": 3.687645435333252, "mean_token_accuracy": 0.34163331851193124, "num_tokens": 154043.0, "step": 1 }, { "entropy": 4.1582471953791025, "epoch": 0.039160401002506263, "grad_norm": 1.8515625, "learning_rate": 9.375e-05, "loss": 3.716327985127767, "mean_token_accuracy": 0.32336124196593746, "num_tokens": 3937675.0, "step": 25 }, { "entropy": 4.004832741749853, "epoch": 0.07832080200501253, "grad_norm": 1.578125, "learning_rate": 0.00019140625, "loss": 3.245400085449219, "mean_token_accuracy": 0.3525532396162817, "num_tokens": 7842040.0, "step": 50 }, { "entropy": 3.7060696659038226, "epoch": 0.1174812030075188, "grad_norm": 1.1328125, "learning_rate": 0.0002890625, "loss": 2.899266357421875, "mean_token_accuracy": 0.3803508952459354, "num_tokens": 11723384.0, "step": 75 }, { "entropy": 3.483661951565247, "epoch": 0.15664160401002505, "grad_norm": 0.796875, "learning_rate": 0.00038671875, "loss": 2.5580235290527344, "mean_token_accuracy": 0.4106306236210145, "num_tokens": 15613476.0, "step": 100 }, { "entropy": 3.279625251379403, "epoch": 0.19580200501253134, "grad_norm": 0.71484375, "learning_rate": 0.000484375, "loss": 2.3971221923828123, "mean_token_accuracy": 0.43163137955735414, "num_tokens": 19537696.0, "step": 125 }, { "entropy": 3.1596573478657435, "epoch": 0.2349624060150376, "grad_norm": 0.640625, "learning_rate": 0.0004999075642455791, "loss": 2.332003479003906, "mean_token_accuracy": 0.44275144542816425, "num_tokens": 23462566.0, "step": 150 }, { "entropy": 3.104312514398783, "epoch": 0.2741228070175439, "grad_norm": 0.609375, "learning_rate": 0.0004995565798713207, "loss": 2.2806515502929687, "mean_token_accuracy": 0.44779701792125276, "num_tokens": 27367329.0, "step": 175 }, { "entropy": 3.062113077731651, "epoch": 0.3132832080200501, "grad_norm": 0.796875, "learning_rate": 0.0004989440608306114, "loss": 2.2435511779785156, "mean_token_accuracy": 0.45369474441778246, "num_tokens": 31290903.0, "step": 200 }, { "entropy": 3.007945648412728, "epoch": 0.3524436090225564, "grad_norm": 0.71875, "learning_rate": 0.0004980706490418613, "loss": 2.214092559814453, "mean_token_accuracy": 0.46001344086021506, "num_tokens": 35158603.0, "step": 225 }, { "entropy": 2.9779412397442524, "epoch": 0.3916040100250627, "grad_norm": 0.65625, "learning_rate": 0.0004969372598384225, "loss": 2.191622314453125, "mean_token_accuracy": 0.46235443734230136, "num_tokens": 39050018.0, "step": 250 }, { "epoch": 0.3916040100250627, "eval_bpd": 3.058715802573539, "eval_entropy": 2.8622500597497296, "eval_loss": 2.117133855819702, "eval_mean_token_accuracy": 0.4719805146180118, "eval_nll": 2.120140234687999, "eval_num_tokens": 39050018.0, "eval_ppl": 8.332305884076892, "eval_runtime": 317.9266, "eval_samples_per_second": 571.229, "eval_steps_per_second": 8.927, "step": 250 }, { "entropy": 2.91319560400022, "epoch": 0.4307644110275689, "grad_norm": 0.59375, "learning_rate": 0.0004955450810093227, "loss": 2.1354435729980468, "mean_token_accuracy": 0.46928864274436577, "num_tokens": 42938915.0, "step": 275 }, { "entropy": 2.974404757708524, "epoch": 0.4699248120300752, "grad_norm": 0.63671875, "learning_rate": 0.0004938955715544644, "loss": 2.180239562988281, "mean_token_accuracy": 0.4623402148856342, "num_tokens": 46830642.0, "step": 300 }, { "entropy": 2.947778592589299, "epoch": 0.5090852130325815, "grad_norm": 0.52734375, "learning_rate": 0.0004919904601555969, "loss": 2.137745666503906, "mean_token_accuracy": 0.4655975033913256, "num_tokens": 50738889.0, "step": 325 }, { "entropy": 2.912182858652311, "epoch": 0.5482456140350878, "grad_norm": 0.73046875, "learning_rate": 0.0004898317433646626, "loss": 2.134133148193359, "mean_token_accuracy": 0.47067078409410695, "num_tokens": 54590447.0, "step": 350 }, { "entropy": 2.8808906902937665, "epoch": 0.5874060150375939, "grad_norm": 0.71484375, "learning_rate": 0.00048742168351141525, "loss": 2.111539001464844, "mean_token_accuracy": 0.47415726155363475, "num_tokens": 58477393.0, "step": 375 }, { "entropy": 2.8902592806431113, "epoch": 0.6265664160401002, "grad_norm": 0.77734375, "learning_rate": 0.00048476280633250404, "loss": 2.1172853088378907, "mean_token_accuracy": 0.47171053962916015, "num_tokens": 62364053.0, "step": 400 }, { "entropy": 2.8472467625827407, "epoch": 0.6657268170426065, "grad_norm": 0.5546875, "learning_rate": 0.00048185789832450813, "loss": 2.079963836669922, "mean_token_accuracy": 0.47701584614870657, "num_tokens": 66254150.0, "step": 425 }, { "entropy": 2.849270481153217, "epoch": 0.7048872180451128, "grad_norm": 0.76171875, "learning_rate": 0.00047871000382369524, "loss": 2.076465911865234, "mean_token_accuracy": 0.477678835790845, "num_tokens": 70155017.0, "step": 450 }, { "entropy": 2.8533846163704104, "epoch": 0.7440476190476191, "grad_norm": 0.75, "learning_rate": 0.0004753224218155648, "loss": 2.076942901611328, "mean_token_accuracy": 0.4763377187304664, "num_tokens": 74017889.0, "step": 475 }, { "entropy": 2.833587274583335, "epoch": 0.7832080200501254, "grad_norm": 0.61328125, "learning_rate": 0.0004716987024775197, "loss": 2.0738652038574217, "mean_token_accuracy": 0.48083406578747806, "num_tokens": 77928779.0, "step": 500 }, { "epoch": 0.7832080200501254, "eval_bpd": 2.898750179783218, "eval_entropy": 2.6689496127647594, "eval_loss": 2.006093978881836, "eval_mean_token_accuracy": 0.4891084327887536, "eval_nll": 2.009260514264372, "eval_num_tokens": 77928779.0, "eval_ppl": 7.457800370714545, "eval_runtime": 317.8942, "eval_samples_per_second": 571.288, "eval_steps_per_second": 8.927, "step": 500 }, { "entropy": 2.8345490746659476, "epoch": 0.8223684210526315, "grad_norm": 0.58984375, "learning_rate": 0.000467842643458289, "loss": 2.084154052734375, "mean_token_accuracy": 0.47867488342803477, "num_tokens": 81819393.0, "step": 525 }, { "entropy": 2.786899686674756, "epoch": 0.8615288220551378, "grad_norm": 0.98046875, "learning_rate": 0.0004637582858980017, "loss": 2.0310736083984375, "mean_token_accuracy": 0.4840942726061862, "num_tokens": 85731124.0, "step": 550 }, { "entropy": 2.8589994783572577, "epoch": 0.9006892230576441, "grad_norm": 0.67578125, "learning_rate": 0.0004594499101930825, "loss": 2.094312896728516, "mean_token_accuracy": 0.47510495282804466, "num_tokens": 89624369.0, "step": 575 }, { "entropy": 2.7673380789023, "epoch": 0.9398496240601504, "grad_norm": 0.5390625, "learning_rate": 0.00045492203151040655, "loss": 2.016443634033203, "mean_token_accuracy": 0.4872064297611196, "num_tokens": 93495507.0, "step": 600 }, { "entropy": 2.821264199014746, "epoch": 0.9790100250626567, "grad_norm": 0.69140625, "learning_rate": 0.00045017939505541626, "loss": 2.049879455566406, "mean_token_accuracy": 0.4826080450793048, "num_tokens": 97422212.0, "step": 625 }, { "entropy": 2.799159714687336, "epoch": 1.0172305764411027, "grad_norm": 0.5859375, "learning_rate": 0.00044522697109915813, "loss": 2.0454527282714845, "mean_token_accuracy": 0.48334792056497855, "num_tokens": 101238525.0, "step": 650 }, { "entropy": 2.751235980421951, "epoch": 1.056390977443609, "grad_norm": 0.58984375, "learning_rate": 0.0004400699497694506, "loss": 2.012087707519531, "mean_token_accuracy": 0.4896175168359564, "num_tokens": 105137633.0, "step": 675 }, { "entropy": 2.7633214804817277, "epoch": 1.0955513784461153, "grad_norm": 0.60546875, "learning_rate": 0.00043471373561164396, "loss": 2.0151519775390625, "mean_token_accuracy": 0.48745193922878793, "num_tokens": 109027156.0, "step": 700 }, { "entropy": 2.764837322151706, "epoch": 1.1347117794486214, "grad_norm": 0.6796875, "learning_rate": 0.00042916394192466997, "loss": 2.011883544921875, "mean_token_accuracy": 0.48801230267546136, "num_tokens": 112918175.0, "step": 725 }, { "entropy": 2.7570182676631614, "epoch": 1.1738721804511278, "grad_norm": 0.609375, "learning_rate": 0.00042342638487831874, "loss": 2.0271852111816404, "mean_token_accuracy": 0.4883824761848996, "num_tokens": 116839662.0, "step": 750 }, { "epoch": 1.1738721804511278, "eval_bpd": 2.8315747644426814, "eval_entropy": 2.6417940543917178, "eval_loss": 1.9594571590423584, "eval_mean_token_accuracy": 0.497060593586316, "eval_nll": 1.9626980645181358, "eval_num_tokens": 116839662.0, "eval_ppl": 7.118507370829529, "eval_runtime": 317.8489, "eval_samples_per_second": 571.369, "eval_steps_per_second": 8.929, "step": 750 }, { "entropy": 2.7844207042311715, "epoch": 1.213032581453634, "grad_norm": 0.68359375, "learning_rate": 0.0004175070774179078, "loss": 2.0220986938476564, "mean_token_accuracy": 0.4860440628692503, "num_tokens": 120758777.0, "step": 775 }, { "entropy": 2.7899788574494933, "epoch": 1.2521929824561404, "grad_norm": 0.55859375, "learning_rate": 0.0004114122229627302, "loss": 2.039529113769531, "mean_token_accuracy": 0.4842958016311785, "num_tokens": 124638155.0, "step": 800 }, { "entropy": 2.7349560071334476, "epoch": 1.2913533834586466, "grad_norm": 0.55859375, "learning_rate": 0.00040514820890488664, "loss": 2.0020352172851563, "mean_token_accuracy": 0.4927521478887577, "num_tokens": 128509722.0, "step": 825 }, { "entropy": 2.745659946454679, "epoch": 1.3305137844611528, "grad_norm": 0.74609375, "learning_rate": 0.00039872159991531533, "loss": 2.0152940368652343, "mean_token_accuracy": 0.48988635025320926, "num_tokens": 132428586.0, "step": 850 }, { "entropy": 2.7871976479888647, "epoch": 1.3696741854636592, "grad_norm": 0.84375, "learning_rate": 0.0003921391310640325, "loss": 2.039204559326172, "mean_token_accuracy": 0.4852042920106659, "num_tokens": 136329200.0, "step": 875 }, { "entropy": 2.7404741305566205, "epoch": 1.4088345864661656, "grad_norm": 0.51953125, "learning_rate": 0.0003854077007617969, "loss": 1.9955612182617188, "mean_token_accuracy": 0.4914711251122463, "num_tokens": 140228250.0, "step": 900 }, { "entropy": 2.731783048426117, "epoch": 1.4479949874686717, "grad_norm": 0.56640625, "learning_rate": 0.0003785343635305919, "loss": 1.9946755981445312, "mean_token_accuracy": 0.492961033900984, "num_tokens": 144119470.0, "step": 925 }, { "entropy": 2.734028948778845, "epoch": 1.487155388471178, "grad_norm": 0.6640625, "learning_rate": 0.00037152632261050483, "loss": 1.9961911010742188, "mean_token_accuracy": 0.4915906915552139, "num_tokens": 148006939.0, "step": 950 }, { "entropy": 2.7352198930393166, "epoch": 1.526315789473684, "grad_norm": 0.57421875, "learning_rate": 0.0003643909224107492, "loss": 1.9914035034179687, "mean_token_accuracy": 0.49272672598435946, "num_tokens": 151885356.0, "step": 975 }, { "entropy": 2.744184872854561, "epoch": 1.5654761904761905, "grad_norm": 0.5703125, "learning_rate": 0.00035713564081274257, "loss": 2.0107650756835938, "mean_token_accuracy": 0.4889519028709596, "num_tokens": 155788149.0, "step": 1000 }, { "epoch": 1.5654761904761905, "eval_bpd": 2.7929365814183416, "eval_entropy": 2.561582521237903, "eval_loss": 1.9326468706130981, "eval_mean_token_accuracy": 0.5020671009912576, "eval_nll": 1.9359161168928556, "eval_num_tokens": 155788149.0, "eval_ppl": 6.930390195563555, "eval_runtime": 318.0478, "eval_samples_per_second": 571.012, "eval_steps_per_second": 8.923, "step": 1000 }, { "entropy": 2.707526650239954, "epoch": 1.6046365914786969, "grad_norm": 0.5546875, "learning_rate": 0.0003497680813333055, "loss": 1.9714834594726562, "mean_token_accuracy": 0.49562785553365774, "num_tokens": 159699795.0, "step": 1025 }, { "entropy": 2.72805733193072, "epoch": 1.643796992481203, "grad_norm": 0.765625, "learning_rate": 0.0003422959651561952, "loss": 1.971968536376953, "mean_token_accuracy": 0.49344011441359326, "num_tokens": 163574307.0, "step": 1050 }, { "entropy": 2.6893244178308024, "epoch": 1.6829573934837092, "grad_norm": 0.52734375, "learning_rate": 0.0003347271230403245, "loss": 1.9534384155273437, "mean_token_accuracy": 0.497666397797124, "num_tokens": 167453694.0, "step": 1075 }, { "entropy": 2.7430753006255277, "epoch": 1.7221177944862154, "grad_norm": 0.5390625, "learning_rate": 0.00032706948711314597, "loss": 1.9894099426269531, "mean_token_accuracy": 0.4906959803986491, "num_tokens": 171375635.0, "step": 1100 }, { "entropy": 2.737667996911359, "epoch": 1.7612781954887218, "grad_norm": 0.63671875, "learning_rate": 0.0003193310825578028, "loss": 1.995572052001953, "mean_token_accuracy": 0.4914335705931985, "num_tokens": 175271550.0, "step": 1125 }, { "entropy": 2.736452384012791, "epoch": 1.8004385964912282, "grad_norm": 0.58984375, "learning_rate": 0.0003115200192027566, "loss": 1.9998680114746095, "mean_token_accuracy": 0.49136637186282833, "num_tokens": 179170243.0, "step": 1150 }, { "entropy": 2.6840253382543815, "epoch": 1.8395989974937343, "grad_norm": 0.5625, "learning_rate": 0.00030364448302270787, "loss": 1.949139404296875, "mean_token_accuracy": 0.49796950154057085, "num_tokens": 183048860.0, "step": 1175 }, { "entropy": 2.7671729360693793, "epoch": 1.8787593984962405, "grad_norm": 0.6796875, "learning_rate": 0.0002957127275597154, "loss": 2.0151930236816407, "mean_token_accuracy": 0.4883661289672581, "num_tokens": 186947863.0, "step": 1200 }, { "entropy": 2.7276026045552215, "epoch": 1.917919799498747, "grad_norm": 0.51953125, "learning_rate": 0.0002877330652735044, "loss": 1.9936309814453126, "mean_token_accuracy": 0.49266964650003753, "num_tokens": 190837792.0, "step": 1225 }, { "entropy": 2.7106085190098876, "epoch": 1.957080200501253, "grad_norm": 0.57421875, "learning_rate": 0.0002797138588300303, "loss": 1.9655186462402343, "mean_token_accuracy": 0.4963224160769589, "num_tokens": 194765738.0, "step": 1250 }, { "epoch": 1.957080200501253, "eval_bpd": 2.7684189685627008, "eval_entropy": 2.5841895770631353, "eval_loss": 1.9156484603881836, "eval_mean_token_accuracy": 0.5042775579796719, "eval_nll": 1.9189218026679078, "eval_num_tokens": 194765738.0, "eval_ppl": 6.813608093356783, "eval_runtime": 317.8737, "eval_samples_per_second": 571.324, "eval_steps_per_second": 8.928, "step": 1250 }, { "entropy": 2.7457793346083226, "epoch": 1.9962406015037595, "grad_norm": 0.9921875, "learning_rate": 0.0002716635123374255, "loss": 2.0136396789550783, "mean_token_accuracy": 0.4905763155027781, "num_tokens": 198681309.0, "step": 1275 }, { "entropy": 2.7296520815516434, "epoch": 2.0344611528822054, "grad_norm": 0.609375, "learning_rate": 0.00026359046253851537, "loss": 1.9885548400878905, "mean_token_accuracy": 0.49141303876894793, "num_tokens": 202488293.0, "step": 1300 }, { "entropy": 2.7237404436481647, "epoch": 2.0736215538847116, "grad_norm": 0.5859375, "learning_rate": 0.00025550316996913314, "loss": 1.9903170776367187, "mean_token_accuracy": 0.4935096359392426, "num_tokens": 206409968.0, "step": 1325 }, { "entropy": 2.7291376300032053, "epoch": 2.112781954887218, "grad_norm": 0.61328125, "learning_rate": 0.00024741011009149944, "loss": 1.9878811645507812, "mean_token_accuracy": 0.49241777430140515, "num_tokens": 210314638.0, "step": 1350 }, { "entropy": 2.727339653278635, "epoch": 2.1519423558897244, "grad_norm": 0.59765625, "learning_rate": 0.0002393197644119594, "loss": 1.9830924987792968, "mean_token_accuracy": 0.49156372149799366, "num_tokens": 214195432.0, "step": 1375 }, { "entropy": 2.6867289156814746, "epoch": 2.1911027568922306, "grad_norm": 0.578125, "learning_rate": 0.00023124061159238553, "loss": 1.9581849670410156, "mean_token_accuracy": 0.4971003970211406, "num_tokens": 218094898.0, "step": 1400 }, { "entropy": 2.7372838236997215, "epoch": 2.2302631578947367, "grad_norm": 0.5703125, "learning_rate": 0.0002231811185645613, "loss": 1.9794134521484374, "mean_token_accuracy": 0.4906712610116262, "num_tokens": 221998326.0, "step": 1425 }, { "entropy": 2.714885350188938, "epoch": 2.269423558897243, "grad_norm": 0.5625, "learning_rate": 0.00021514973165685783, "loss": 1.9843505859375, "mean_token_accuracy": 0.49365376402815986, "num_tokens": 225920259.0, "step": 1450 }, { "entropy": 2.696512448708, "epoch": 2.3085839598997495, "grad_norm": 0.5, "learning_rate": 0.00020715486774250342, "loss": 1.9640107727050782, "mean_token_accuracy": 0.4955928374349573, "num_tokens": 229793611.0, "step": 1475 }, { "entropy": 2.7095071681692473, "epoch": 2.3477443609022557, "grad_norm": 0.56640625, "learning_rate": 0.0001992049054187214, "loss": 1.9568646240234375, "mean_token_accuracy": 0.4964784048245484, "num_tokens": 233686342.0, "step": 1500 }, { "epoch": 2.3477443609022557, "eval_bpd": 2.753628846729509, "eval_entropy": 2.5548404387573136, "eval_loss": 1.9053977727890015, "eval_mean_token_accuracy": 0.5062358641819159, "eval_nll": 1.908670071419093, "eval_num_tokens": 233686342.0, "eval_ppl": 6.744113642210042, "eval_runtime": 317.8614, "eval_samples_per_second": 571.346, "eval_steps_per_second": 8.928, "step": 1500 }, { "entropy": 2.6962403165811546, "epoch": 2.386904761904762, "grad_norm": 0.52734375, "learning_rate": 0.00019130817622598124, "loss": 1.9656645202636718, "mean_token_accuracy": 0.49542844133717173, "num_tokens": 237624819.0, "step": 1525 }, { "entropy": 2.661015365594498, "epoch": 2.426065162907268, "grad_norm": 0.5234375, "learning_rate": 0.0001834729559165655, "loss": 1.9300704956054688, "mean_token_accuracy": 0.5028307401118935, "num_tokens": 241545153.0, "step": 1550 }, { "entropy": 2.7084774859453065, "epoch": 2.465225563909774, "grad_norm": 0.5546875, "learning_rate": 0.00017570745578160198, "loss": 1.9839097595214843, "mean_token_accuracy": 0.49480885073851655, "num_tokens": 245435136.0, "step": 1575 }, { "entropy": 2.720735177594368, "epoch": 2.504385964912281, "grad_norm": 0.69921875, "learning_rate": 0.0001680198140456516, "loss": 1.9636825561523437, "mean_token_accuracy": 0.49606104503640003, "num_tokens": 249367087.0, "step": 1600 }, { "entropy": 2.7053065007280694, "epoch": 2.543546365914787, "grad_norm": 0.60546875, "learning_rate": 0.00016041808733786915, "loss": 1.973881072998047, "mean_token_accuracy": 0.4954433957962887, "num_tokens": 253284840.0, "step": 1625 }, { "entropy": 2.698947790229774, "epoch": 2.582706766917293, "grad_norm": 0.51171875, "learning_rate": 0.0001529102422486769, "loss": 1.9727474975585937, "mean_token_accuracy": 0.4956776145060249, "num_tokens": 257182312.0, "step": 1650 }, { "entropy": 2.6974555430574907, "epoch": 2.6218671679197993, "grad_norm": 0.5859375, "learning_rate": 0.00014550414698079727, "loss": 1.9712374877929688, "mean_token_accuracy": 0.49620761846498757, "num_tokens": 261090778.0, "step": 1675 }, { "entropy": 2.6922827269469427, "epoch": 2.6610275689223055, "grad_norm": 0.59765625, "learning_rate": 0.00013820756310339665, "loss": 1.9518051147460938, "mean_token_accuracy": 0.49857486663635253, "num_tokens": 264965770.0, "step": 1700 }, { "entropy": 2.69106729380676, "epoch": 2.700187969924812, "grad_norm": 0.5625, "learning_rate": 0.00013102813741798025, "loss": 1.955197296142578, "mean_token_accuracy": 0.49718124580239675, "num_tokens": 268814860.0, "step": 1725 }, { "entropy": 2.662197894060978, "epoch": 2.7393483709273183, "grad_norm": 0.63671875, "learning_rate": 0.00012397339394456356, "loss": 1.9427037048339844, "mean_token_accuracy": 0.5021224760307385, "num_tokens": 272697610.0, "step": 1750 }, { "epoch": 2.7393483709273183, "eval_bpd": 2.746128517119456, "eval_entropy": 2.5467006554680043, "eval_loss": 1.900189757347107, "eval_mean_token_accuracy": 0.5073069371159629, "eval_nll": 1.9034712390966142, "eval_num_tokens": 272697610.0, "eval_ppl": 6.709143107957204, "eval_runtime": 317.8831, "eval_samples_per_second": 571.308, "eval_steps_per_second": 8.928, "step": 1750 }, { "entropy": 2.681755317696406, "epoch": 2.7785087719298245, "grad_norm": 0.51171875, "learning_rate": 0.00011705072603651829, "loss": 1.9534152221679688, "mean_token_accuracy": 0.49887350844173306, "num_tokens": 276577245.0, "step": 1775 }, { "entropy": 2.6537644882871887, "epoch": 2.817669172932331, "grad_norm": 0.54296875, "learning_rate": 0.00011026738863235674, "loss": 1.932033233642578, "mean_token_accuracy": 0.5024196737013861, "num_tokens": 280495941.0, "step": 1800 }, { "entropy": 2.696102005171466, "epoch": 2.856829573934837, "grad_norm": 0.54296875, "learning_rate": 0.00010363049065257416, "loss": 1.9526573181152345, "mean_token_accuracy": 0.4961788889854049, "num_tokens": 284359230.0, "step": 1825 }, { "entropy": 2.6950738714582054, "epoch": 2.8959899749373434, "grad_norm": 0.51171875, "learning_rate": 9.71469875495186e-05, "loss": 1.9607313537597657, "mean_token_accuracy": 0.4969643320518318, "num_tokens": 288227871.0, "step": 1850 }, { "entropy": 2.6776621984896427, "epoch": 2.9351503759398496, "grad_norm": 0.5859375, "learning_rate": 9.082367401809396e-05, "loss": 1.9385653686523439, "mean_token_accuracy": 0.5004678905504529, "num_tokens": 292105552.0, "step": 1875 }, { "entropy": 2.7108317378677427, "epoch": 2.974310776942356, "grad_norm": 0.5859375, "learning_rate": 8.466717687493703e-05, "loss": 1.9630741882324219, "mean_token_accuracy": 0.4949593694629437, "num_tokens": 296018638.0, "step": 1900 }, { "entropy": 2.6951544846467215, "epoch": 3.012531328320802, "grad_norm": 0.6171875, "learning_rate": 7.868394811353039e-05, "loss": 1.9621902465820313, "mean_token_accuracy": 0.4969353615896138, "num_tokens": 299799772.0, "step": 1925 }, { "entropy": 2.6865969529696008, "epoch": 3.0516917293233083, "grad_norm": 0.53515625, "learning_rate": 7.288025814252918e-05, "loss": 1.9542425537109376, "mean_token_accuracy": 0.4988364340091859, "num_tokens": 303697115.0, "step": 1950 }, { "entropy": 2.7144221244365414, "epoch": 3.0908521303258145, "grad_norm": 0.51953125, "learning_rate": 6.726218921438915e-05, "loss": 1.9707881164550782, "mean_token_accuracy": 0.49513010638787824, "num_tokens": 307582257.0, "step": 1975 }, { "entropy": 2.6845787794916958, "epoch": 3.1300125313283207, "grad_norm": 0.58203125, "learning_rate": 6.183562905118107e-05, "loss": 1.9502456665039063, "mean_token_accuracy": 0.4984206819132311, "num_tokens": 311533513.0, "step": 2000 }, { "epoch": 3.1300125313283207, "eval_bpd": 2.743150644463847, "eval_entropy": 2.537413316218948, "eval_loss": 1.898119330406189, "eval_mean_token_accuracy": 0.5075566540142357, "eval_nll": 1.9014071350613124, "eval_num_tokens": 311533513.0, "eval_ppl": 6.695309021003712, "eval_runtime": 317.8588, "eval_samples_per_second": 571.351, "eval_steps_per_second": 8.928, "step": 2000 }, { "entropy": 2.6879047847821296, "epoch": 3.169172932330827, "grad_norm": 0.51953125, "learning_rate": 5.660626467427307e-05, "loss": 1.9487139892578125, "mean_token_accuracy": 0.4986291506272674, "num_tokens": 315411426.0, "step": 2025 }, { "entropy": 2.6766323699871317, "epoch": 3.2083333333333335, "grad_norm": 0.640625, "learning_rate": 5.157957644434627e-05, "loss": 1.94476318359375, "mean_token_accuracy": 0.4997309426991163, "num_tokens": 319294927.0, "step": 2050 }, { "entropy": 2.683753290029714, "epoch": 3.2474937343358397, "grad_norm": 0.515625, "learning_rate": 4.676083231799086e-05, "loss": 1.9316000366210937, "mean_token_accuracy": 0.499271284902475, "num_tokens": 323165852.0, "step": 2075 }, { "entropy": 2.686417660589846, "epoch": 3.286654135338346, "grad_norm": 0.498046875, "learning_rate": 4.2155082326900877e-05, "loss": 1.9525784301757811, "mean_token_accuracy": 0.49841938300670935, "num_tokens": 327042408.0, "step": 2100 }, { "entropy": 2.667176750545856, "epoch": 3.325814536340852, "grad_norm": 0.5234375, "learning_rate": 3.7767153285453686e-05, "loss": 1.9442587280273438, "mean_token_accuracy": 0.5002034732234762, "num_tokens": 330922569.0, "step": 2125 }, { "entropy": 2.7083504292896223, "epoch": 3.3649749373433586, "grad_norm": 0.53515625, "learning_rate": 3.360164373222063e-05, "loss": 1.9800828552246095, "mean_token_accuracy": 0.49514251363288897, "num_tokens": 334820646.0, "step": 2150 }, { "entropy": 2.679664883044849, "epoch": 3.404135338345865, "grad_norm": 0.54296875, "learning_rate": 2.966291911071012e-05, "loss": 1.9254460144042969, "mean_token_accuracy": 0.4997588595740226, "num_tokens": 338722975.0, "step": 2175 }, { "entropy": 2.7010752357051446, "epoch": 3.443295739348371, "grad_norm": 0.5390625, "learning_rate": 2.5955107194394062e-05, "loss": 1.9678742980957031, "mean_token_accuracy": 0.49652026434294405, "num_tokens": 342626211.0, "step": 2200 }, { "entropy": 2.680099248555918, "epoch": 3.482456140350877, "grad_norm": 0.53125, "learning_rate": 2.2482093760811617e-05, "loss": 1.947157440185547, "mean_token_accuracy": 0.49980662698529627, "num_tokens": 346523206.0, "step": 2225 }, { "entropy": 2.665086873762589, "epoch": 3.5216165413533833, "grad_norm": 0.6875, "learning_rate": 1.9247518519283968e-05, "loss": 1.91678466796875, "mean_token_accuracy": 0.5017709960800456, "num_tokens": 350438945.0, "step": 2250 }, { "epoch": 3.5216165413533833, "eval_bpd": 2.7427806185665524, "eval_entropy": 2.521059797438133, "eval_loss": 1.8978670835494995, "eval_mean_token_accuracy": 0.5078493695986956, "eval_nll": 1.9011506526538686, "eval_num_tokens": 350438945.0, "eval_ppl": 6.693592012228109, "eval_runtime": 317.9026, "eval_samples_per_second": 571.272, "eval_steps_per_second": 8.927, "step": 2250 }, { "entropy": 2.7071761575611397, "epoch": 3.56077694235589, "grad_norm": 0.65625, "learning_rate": 1.625477129650835e-05, "loss": 1.9670530700683593, "mean_token_accuracy": 0.4943930659200553, "num_tokens": 354318421.0, "step": 2275 }, { "entropy": 2.662942342665877, "epoch": 3.599937343358396, "grad_norm": 0.51953125, "learning_rate": 1.3506988484027926e-05, "loss": 1.9445907592773437, "mean_token_accuracy": 0.5012607700381274, "num_tokens": 358226853.0, "step": 2300 }, { "entropy": 2.675463945038753, "epoch": 3.6390977443609023, "grad_norm": 0.57421875, "learning_rate": 1.1007049751301789e-05, "loss": 1.9406065368652343, "mean_token_accuracy": 0.49964218839800517, "num_tokens": 362132305.0, "step": 2325 }, { "entropy": 2.672680865545942, "epoch": 3.6782581453634084, "grad_norm": 0.5859375, "learning_rate": 8.757575027818238e-06, "loss": 1.943076629638672, "mean_token_accuracy": 0.5014009202854003, "num_tokens": 366008286.0, "step": 2350 }, { "entropy": 2.697533157804049, "epoch": 3.7174185463659146, "grad_norm": 1.0, "learning_rate": 6.760921757415439e-06, "loss": 1.9601542663574218, "mean_token_accuracy": 0.4960954081707335, "num_tokens": 369923941.0, "step": 2375 }, { "entropy": 2.6673633208861216, "epoch": 3.7565789473684212, "grad_norm": 0.55078125, "learning_rate": 5.0191824276862585e-06, "loss": 1.9449400329589843, "mean_token_accuracy": 0.4991286845912217, "num_tokens": 373819034.0, "step": 2400 }, { "entropy": 2.7133335768071567, "epoch": 3.7957393483709274, "grad_norm": 0.640625, "learning_rate": 3.5341823770564385e-06, "loss": 1.9763288879394532, "mean_token_accuracy": 0.4959998249296527, "num_tokens": 377721995.0, "step": 2425 }, { "entropy": 2.6848846874236103, "epoch": 3.8348997493734336, "grad_norm": 0.5703125, "learning_rate": 2.307477881834663e-06, "loss": 1.9412721252441407, "mean_token_accuracy": 0.49876661170482706, "num_tokens": 381637012.0, "step": 2450 }, { "entropy": 2.72827067582625, "epoch": 3.8740601503759398, "grad_norm": 0.52734375, "learning_rate": 1.340354525238785e-06, "loss": 1.9851792907714845, "mean_token_accuracy": 0.492133980326717, "num_tokens": 385534081.0, "step": 2475 }, { "entropy": 2.6722913455535635, "epoch": 3.913220551378446, "grad_norm": 0.5625, "learning_rate": 6.33825850107933e-07, "loss": 1.932886505126953, "mean_token_accuracy": 0.5014244433742081, "num_tokens": 389460238.0, "step": 2500 }, { "epoch": 3.913220551378446, "eval_bpd": 2.742298181153798, "eval_entropy": 2.527594691131209, "eval_loss": 1.8975322246551514, "eval_mean_token_accuracy": 0.5078328191609934, "eval_nll": 1.9008162525214212, "eval_num_tokens": 389460238.0, "eval_ppl": 6.691354048381229, "eval_runtime": 317.8592, "eval_samples_per_second": 571.351, "eval_steps_per_second": 8.928, "step": 2500 } ], "logging_steps": 25, "max_steps": 2554, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.266616009373568e+18, "train_batch_size": 64, "trial_name": null, "trial_params": null }