| { |
| "best_global_step": 2000, |
| "best_metric": 1.9014071350613124, |
| "best_model_checkpoint": "/content/cot-split1/checkpoint-2000", |
| "epoch": 3.1300125313283207, |
| "eval_steps": 250, |
| "global_step": 2000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0, |
| "eval_bpd": 5.449506205976702, |
| "eval_entropy": 3.8259646681880883, |
| "eval_loss": 3.7819511890411377, |
| "eval_mean_token_accuracy": 0.3298281561563004, |
| "eval_nll": 3.777309862116675, |
| "eval_num_tokens": 0.0, |
| "eval_ppl": 43.69832894461198, |
| "eval_runtime": 318.4397, |
| "eval_samples_per_second": 570.309, |
| "eval_steps_per_second": 8.912, |
| "step": 0 |
| }, |
| { |
| "entropy": 3.936198543874438, |
| "epoch": 0.0015664160401002505, |
| "grad_norm": 3.5, |
| "learning_rate": 0.0, |
| "loss": 3.687645435333252, |
| "mean_token_accuracy": 0.34163331851193124, |
| "num_tokens": 154043.0, |
| "step": 1 |
| }, |
| { |
| "entropy": 4.1582471953791025, |
| "epoch": 0.039160401002506263, |
| "grad_norm": 1.8515625, |
| "learning_rate": 9.375e-05, |
| "loss": 3.716327985127767, |
| "mean_token_accuracy": 0.32336124196593746, |
| "num_tokens": 3937675.0, |
| "step": 25 |
| }, |
| { |
| "entropy": 4.004832741749853, |
| "epoch": 0.07832080200501253, |
| "grad_norm": 1.578125, |
| "learning_rate": 0.00019140625, |
| "loss": 3.245400085449219, |
| "mean_token_accuracy": 0.3525532396162817, |
| "num_tokens": 7842040.0, |
| "step": 50 |
| }, |
| { |
| "entropy": 3.7060696659038226, |
| "epoch": 0.1174812030075188, |
| "grad_norm": 1.1328125, |
| "learning_rate": 0.0002890625, |
| "loss": 2.899266357421875, |
| "mean_token_accuracy": 0.3803508952459354, |
| "num_tokens": 11723384.0, |
| "step": 75 |
| }, |
| { |
| "entropy": 3.483661951565247, |
| "epoch": 0.15664160401002505, |
| "grad_norm": 0.796875, |
| "learning_rate": 0.00038671875, |
| "loss": 2.5580235290527344, |
| "mean_token_accuracy": 0.4106306236210145, |
| "num_tokens": 15613476.0, |
| "step": 100 |
| }, |
| { |
| "entropy": 3.279625251379403, |
| "epoch": 0.19580200501253134, |
| "grad_norm": 0.71484375, |
| "learning_rate": 0.000484375, |
| "loss": 2.3971221923828123, |
| "mean_token_accuracy": 0.43163137955735414, |
| "num_tokens": 19537696.0, |
| "step": 125 |
| }, |
| { |
| "entropy": 3.1596573478657435, |
| "epoch": 0.2349624060150376, |
| "grad_norm": 0.640625, |
| "learning_rate": 0.0004999075642455791, |
| "loss": 2.332003479003906, |
| "mean_token_accuracy": 0.44275144542816425, |
| "num_tokens": 23462566.0, |
| "step": 150 |
| }, |
| { |
| "entropy": 3.104312514398783, |
| "epoch": 0.2741228070175439, |
| "grad_norm": 0.609375, |
| "learning_rate": 0.0004995565798713207, |
| "loss": 2.2806515502929687, |
| "mean_token_accuracy": 0.44779701792125276, |
| "num_tokens": 27367329.0, |
| "step": 175 |
| }, |
| { |
| "entropy": 3.062113077731651, |
| "epoch": 0.3132832080200501, |
| "grad_norm": 0.796875, |
| "learning_rate": 0.0004989440608306114, |
| "loss": 2.2435511779785156, |
| "mean_token_accuracy": 0.45369474441778246, |
| "num_tokens": 31290903.0, |
| "step": 200 |
| }, |
| { |
| "entropy": 3.007945648412728, |
| "epoch": 0.3524436090225564, |
| "grad_norm": 0.71875, |
| "learning_rate": 0.0004980706490418613, |
| "loss": 2.214092559814453, |
| "mean_token_accuracy": 0.46001344086021506, |
| "num_tokens": 35158603.0, |
| "step": 225 |
| }, |
| { |
| "entropy": 2.9779412397442524, |
| "epoch": 0.3916040100250627, |
| "grad_norm": 0.65625, |
| "learning_rate": 0.0004969372598384225, |
| "loss": 2.191622314453125, |
| "mean_token_accuracy": 0.46235443734230136, |
| "num_tokens": 39050018.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.3916040100250627, |
| "eval_bpd": 3.058715802573539, |
| "eval_entropy": 2.8622500597497296, |
| "eval_loss": 2.117133855819702, |
| "eval_mean_token_accuracy": 0.4719805146180118, |
| "eval_nll": 2.120140234687999, |
| "eval_num_tokens": 39050018.0, |
| "eval_ppl": 8.332305884076892, |
| "eval_runtime": 317.9266, |
| "eval_samples_per_second": 571.229, |
| "eval_steps_per_second": 8.927, |
| "step": 250 |
| }, |
| { |
| "entropy": 2.91319560400022, |
| "epoch": 0.4307644110275689, |
| "grad_norm": 0.59375, |
| "learning_rate": 0.0004955450810093227, |
| "loss": 2.1354435729980468, |
| "mean_token_accuracy": 0.46928864274436577, |
| "num_tokens": 42938915.0, |
| "step": 275 |
| }, |
| { |
| "entropy": 2.974404757708524, |
| "epoch": 0.4699248120300752, |
| "grad_norm": 0.63671875, |
| "learning_rate": 0.0004938955715544644, |
| "loss": 2.180239562988281, |
| "mean_token_accuracy": 0.4623402148856342, |
| "num_tokens": 46830642.0, |
| "step": 300 |
| }, |
| { |
| "entropy": 2.947778592589299, |
| "epoch": 0.5090852130325815, |
| "grad_norm": 0.52734375, |
| "learning_rate": 0.0004919904601555969, |
| "loss": 2.137745666503906, |
| "mean_token_accuracy": 0.4655975033913256, |
| "num_tokens": 50738889.0, |
| "step": 325 |
| }, |
| { |
| "entropy": 2.912182858652311, |
| "epoch": 0.5482456140350878, |
| "grad_norm": 0.73046875, |
| "learning_rate": 0.0004898317433646626, |
| "loss": 2.134133148193359, |
| "mean_token_accuracy": 0.47067078409410695, |
| "num_tokens": 54590447.0, |
| "step": 350 |
| }, |
| { |
| "entropy": 2.8808906902937665, |
| "epoch": 0.5874060150375939, |
| "grad_norm": 0.71484375, |
| "learning_rate": 0.00048742168351141525, |
| "loss": 2.111539001464844, |
| "mean_token_accuracy": 0.47415726155363475, |
| "num_tokens": 58477393.0, |
| "step": 375 |
| }, |
| { |
| "entropy": 2.8902592806431113, |
| "epoch": 0.6265664160401002, |
| "grad_norm": 0.77734375, |
| "learning_rate": 0.00048476280633250404, |
| "loss": 2.1172853088378907, |
| "mean_token_accuracy": 0.47171053962916015, |
| "num_tokens": 62364053.0, |
| "step": 400 |
| }, |
| { |
| "entropy": 2.8472467625827407, |
| "epoch": 0.6657268170426065, |
| "grad_norm": 0.5546875, |
| "learning_rate": 0.00048185789832450813, |
| "loss": 2.079963836669922, |
| "mean_token_accuracy": 0.47701584614870657, |
| "num_tokens": 66254150.0, |
| "step": 425 |
| }, |
| { |
| "entropy": 2.849270481153217, |
| "epoch": 0.7048872180451128, |
| "grad_norm": 0.76171875, |
| "learning_rate": 0.00047871000382369524, |
| "loss": 2.076465911865234, |
| "mean_token_accuracy": 0.477678835790845, |
| "num_tokens": 70155017.0, |
| "step": 450 |
| }, |
| { |
| "entropy": 2.8533846163704104, |
| "epoch": 0.7440476190476191, |
| "grad_norm": 0.75, |
| "learning_rate": 0.0004753224218155648, |
| "loss": 2.076942901611328, |
| "mean_token_accuracy": 0.4763377187304664, |
| "num_tokens": 74017889.0, |
| "step": 475 |
| }, |
| { |
| "entropy": 2.833587274583335, |
| "epoch": 0.7832080200501254, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.0004716987024775197, |
| "loss": 2.0738652038574217, |
| "mean_token_accuracy": 0.48083406578747806, |
| "num_tokens": 77928779.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.7832080200501254, |
| "eval_bpd": 2.898750179783218, |
| "eval_entropy": 2.6689496127647594, |
| "eval_loss": 2.006093978881836, |
| "eval_mean_token_accuracy": 0.4891084327887536, |
| "eval_nll": 2.009260514264372, |
| "eval_num_tokens": 77928779.0, |
| "eval_ppl": 7.457800370714545, |
| "eval_runtime": 317.8942, |
| "eval_samples_per_second": 571.288, |
| "eval_steps_per_second": 8.927, |
| "step": 500 |
| }, |
| { |
| "entropy": 2.8345490746659476, |
| "epoch": 0.8223684210526315, |
| "grad_norm": 0.58984375, |
| "learning_rate": 0.000467842643458289, |
| "loss": 2.084154052734375, |
| "mean_token_accuracy": 0.47867488342803477, |
| "num_tokens": 81819393.0, |
| "step": 525 |
| }, |
| { |
| "entropy": 2.786899686674756, |
| "epoch": 0.8615288220551378, |
| "grad_norm": 0.98046875, |
| "learning_rate": 0.0004637582858980017, |
| "loss": 2.0310736083984375, |
| "mean_token_accuracy": 0.4840942726061862, |
| "num_tokens": 85731124.0, |
| "step": 550 |
| }, |
| { |
| "entropy": 2.8589994783572577, |
| "epoch": 0.9006892230576441, |
| "grad_norm": 0.67578125, |
| "learning_rate": 0.0004594499101930825, |
| "loss": 2.094312896728516, |
| "mean_token_accuracy": 0.47510495282804466, |
| "num_tokens": 89624369.0, |
| "step": 575 |
| }, |
| { |
| "entropy": 2.7673380789023, |
| "epoch": 0.9398496240601504, |
| "grad_norm": 0.5390625, |
| "learning_rate": 0.00045492203151040655, |
| "loss": 2.016443634033203, |
| "mean_token_accuracy": 0.4872064297611196, |
| "num_tokens": 93495507.0, |
| "step": 600 |
| }, |
| { |
| "entropy": 2.821264199014746, |
| "epoch": 0.9790100250626567, |
| "grad_norm": 0.69140625, |
| "learning_rate": 0.00045017939505541626, |
| "loss": 2.049879455566406, |
| "mean_token_accuracy": 0.4826080450793048, |
| "num_tokens": 97422212.0, |
| "step": 625 |
| }, |
| { |
| "entropy": 2.799159714687336, |
| "epoch": 1.0172305764411027, |
| "grad_norm": 0.5859375, |
| "learning_rate": 0.00044522697109915813, |
| "loss": 2.0454527282714845, |
| "mean_token_accuracy": 0.48334792056497855, |
| "num_tokens": 101238525.0, |
| "step": 650 |
| }, |
| { |
| "entropy": 2.751235980421951, |
| "epoch": 1.056390977443609, |
| "grad_norm": 0.58984375, |
| "learning_rate": 0.0004400699497694506, |
| "loss": 2.012087707519531, |
| "mean_token_accuracy": 0.4896175168359564, |
| "num_tokens": 105137633.0, |
| "step": 675 |
| }, |
| { |
| "entropy": 2.7633214804817277, |
| "epoch": 1.0955513784461153, |
| "grad_norm": 0.60546875, |
| "learning_rate": 0.00043471373561164396, |
| "loss": 2.0151519775390625, |
| "mean_token_accuracy": 0.48745193922878793, |
| "num_tokens": 109027156.0, |
| "step": 700 |
| }, |
| { |
| "entropy": 2.764837322151706, |
| "epoch": 1.1347117794486214, |
| "grad_norm": 0.6796875, |
| "learning_rate": 0.00042916394192466997, |
| "loss": 2.011883544921875, |
| "mean_token_accuracy": 0.48801230267546136, |
| "num_tokens": 112918175.0, |
| "step": 725 |
| }, |
| { |
| "entropy": 2.7570182676631614, |
| "epoch": 1.1738721804511278, |
| "grad_norm": 0.609375, |
| "learning_rate": 0.00042342638487831874, |
| "loss": 2.0271852111816404, |
| "mean_token_accuracy": 0.4883824761848996, |
| "num_tokens": 116839662.0, |
| "step": 750 |
| }, |
| { |
| "epoch": 1.1738721804511278, |
| "eval_bpd": 2.8315747644426814, |
| "eval_entropy": 2.6417940543917178, |
| "eval_loss": 1.9594571590423584, |
| "eval_mean_token_accuracy": 0.497060593586316, |
| "eval_nll": 1.9626980645181358, |
| "eval_num_tokens": 116839662.0, |
| "eval_ppl": 7.118507370829529, |
| "eval_runtime": 317.8489, |
| "eval_samples_per_second": 571.369, |
| "eval_steps_per_second": 8.929, |
| "step": 750 |
| }, |
| { |
| "entropy": 2.7844207042311715, |
| "epoch": 1.213032581453634, |
| "grad_norm": 0.68359375, |
| "learning_rate": 0.0004175070774179078, |
| "loss": 2.0220986938476564, |
| "mean_token_accuracy": 0.4860440628692503, |
| "num_tokens": 120758777.0, |
| "step": 775 |
| }, |
| { |
| "entropy": 2.7899788574494933, |
| "epoch": 1.2521929824561404, |
| "grad_norm": 0.55859375, |
| "learning_rate": 0.0004114122229627302, |
| "loss": 2.039529113769531, |
| "mean_token_accuracy": 0.4842958016311785, |
| "num_tokens": 124638155.0, |
| "step": 800 |
| }, |
| { |
| "entropy": 2.7349560071334476, |
| "epoch": 1.2913533834586466, |
| "grad_norm": 0.55859375, |
| "learning_rate": 0.00040514820890488664, |
| "loss": 2.0020352172851563, |
| "mean_token_accuracy": 0.4927521478887577, |
| "num_tokens": 128509722.0, |
| "step": 825 |
| }, |
| { |
| "entropy": 2.745659946454679, |
| "epoch": 1.3305137844611528, |
| "grad_norm": 0.74609375, |
| "learning_rate": 0.00039872159991531533, |
| "loss": 2.0152940368652343, |
| "mean_token_accuracy": 0.48988635025320926, |
| "num_tokens": 132428586.0, |
| "step": 850 |
| }, |
| { |
| "entropy": 2.7871976479888647, |
| "epoch": 1.3696741854636592, |
| "grad_norm": 0.84375, |
| "learning_rate": 0.0003921391310640325, |
| "loss": 2.039204559326172, |
| "mean_token_accuracy": 0.4852042920106659, |
| "num_tokens": 136329200.0, |
| "step": 875 |
| }, |
| { |
| "entropy": 2.7404741305566205, |
| "epoch": 1.4088345864661656, |
| "grad_norm": 0.51953125, |
| "learning_rate": 0.0003854077007617969, |
| "loss": 1.9955612182617188, |
| "mean_token_accuracy": 0.4914711251122463, |
| "num_tokens": 140228250.0, |
| "step": 900 |
| }, |
| { |
| "entropy": 2.731783048426117, |
| "epoch": 1.4479949874686717, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.0003785343635305919, |
| "loss": 1.9946755981445312, |
| "mean_token_accuracy": 0.492961033900984, |
| "num_tokens": 144119470.0, |
| "step": 925 |
| }, |
| { |
| "entropy": 2.734028948778845, |
| "epoch": 1.487155388471178, |
| "grad_norm": 0.6640625, |
| "learning_rate": 0.00037152632261050483, |
| "loss": 1.9961911010742188, |
| "mean_token_accuracy": 0.4915906915552139, |
| "num_tokens": 148006939.0, |
| "step": 950 |
| }, |
| { |
| "entropy": 2.7352198930393166, |
| "epoch": 1.526315789473684, |
| "grad_norm": 0.57421875, |
| "learning_rate": 0.0003643909224107492, |
| "loss": 1.9914035034179687, |
| "mean_token_accuracy": 0.49272672598435946, |
| "num_tokens": 151885356.0, |
| "step": 975 |
| }, |
| { |
| "entropy": 2.744184872854561, |
| "epoch": 1.5654761904761905, |
| "grad_norm": 0.5703125, |
| "learning_rate": 0.00035713564081274257, |
| "loss": 2.0107650756835938, |
| "mean_token_accuracy": 0.4889519028709596, |
| "num_tokens": 155788149.0, |
| "step": 1000 |
| }, |
| { |
| "epoch": 1.5654761904761905, |
| "eval_bpd": 2.7929365814183416, |
| "eval_entropy": 2.561582521237903, |
| "eval_loss": 1.9326468706130981, |
| "eval_mean_token_accuracy": 0.5020671009912576, |
| "eval_nll": 1.9359161168928556, |
| "eval_num_tokens": 155788149.0, |
| "eval_ppl": 6.930390195563555, |
| "eval_runtime": 318.0478, |
| "eval_samples_per_second": 571.012, |
| "eval_steps_per_second": 8.923, |
| "step": 1000 |
| }, |
| { |
| "entropy": 2.707526650239954, |
| "epoch": 1.6046365914786969, |
| "grad_norm": 0.5546875, |
| "learning_rate": 0.0003497680813333055, |
| "loss": 1.9714834594726562, |
| "mean_token_accuracy": 0.49562785553365774, |
| "num_tokens": 159699795.0, |
| "step": 1025 |
| }, |
| { |
| "entropy": 2.72805733193072, |
| "epoch": 1.643796992481203, |
| "grad_norm": 0.765625, |
| "learning_rate": 0.0003422959651561952, |
| "loss": 1.971968536376953, |
| "mean_token_accuracy": 0.49344011441359326, |
| "num_tokens": 163574307.0, |
| "step": 1050 |
| }, |
| { |
| "entropy": 2.6893244178308024, |
| "epoch": 1.6829573934837092, |
| "grad_norm": 0.52734375, |
| "learning_rate": 0.0003347271230403245, |
| "loss": 1.9534384155273437, |
| "mean_token_accuracy": 0.497666397797124, |
| "num_tokens": 167453694.0, |
| "step": 1075 |
| }, |
| { |
| "entropy": 2.7430753006255277, |
| "epoch": 1.7221177944862154, |
| "grad_norm": 0.5390625, |
| "learning_rate": 0.00032706948711314597, |
| "loss": 1.9894099426269531, |
| "mean_token_accuracy": 0.4906959803986491, |
| "num_tokens": 171375635.0, |
| "step": 1100 |
| }, |
| { |
| "entropy": 2.737667996911359, |
| "epoch": 1.7612781954887218, |
| "grad_norm": 0.63671875, |
| "learning_rate": 0.0003193310825578028, |
| "loss": 1.995572052001953, |
| "mean_token_accuracy": 0.4914335705931985, |
| "num_tokens": 175271550.0, |
| "step": 1125 |
| }, |
| { |
| "entropy": 2.736452384012791, |
| "epoch": 1.8004385964912282, |
| "grad_norm": 0.58984375, |
| "learning_rate": 0.0003115200192027566, |
| "loss": 1.9998680114746095, |
| "mean_token_accuracy": 0.49136637186282833, |
| "num_tokens": 179170243.0, |
| "step": 1150 |
| }, |
| { |
| "entropy": 2.6840253382543815, |
| "epoch": 1.8395989974937343, |
| "grad_norm": 0.5625, |
| "learning_rate": 0.00030364448302270787, |
| "loss": 1.949139404296875, |
| "mean_token_accuracy": 0.49796950154057085, |
| "num_tokens": 183048860.0, |
| "step": 1175 |
| }, |
| { |
| "entropy": 2.7671729360693793, |
| "epoch": 1.8787593984962405, |
| "grad_norm": 0.6796875, |
| "learning_rate": 0.0002957127275597154, |
| "loss": 2.0151930236816407, |
| "mean_token_accuracy": 0.4883661289672581, |
| "num_tokens": 186947863.0, |
| "step": 1200 |
| }, |
| { |
| "entropy": 2.7276026045552215, |
| "epoch": 1.917919799498747, |
| "grad_norm": 0.51953125, |
| "learning_rate": 0.0002877330652735044, |
| "loss": 1.9936309814453126, |
| "mean_token_accuracy": 0.49266964650003753, |
| "num_tokens": 190837792.0, |
| "step": 1225 |
| }, |
| { |
| "entropy": 2.7106085190098876, |
| "epoch": 1.957080200501253, |
| "grad_norm": 0.57421875, |
| "learning_rate": 0.0002797138588300303, |
| "loss": 1.9655186462402343, |
| "mean_token_accuracy": 0.4963224160769589, |
| "num_tokens": 194765738.0, |
| "step": 1250 |
| }, |
| { |
| "epoch": 1.957080200501253, |
| "eval_bpd": 2.7684189685627008, |
| "eval_entropy": 2.5841895770631353, |
| "eval_loss": 1.9156484603881836, |
| "eval_mean_token_accuracy": 0.5042775579796719, |
| "eval_nll": 1.9189218026679078, |
| "eval_num_tokens": 194765738.0, |
| "eval_ppl": 6.813608093356783, |
| "eval_runtime": 317.8737, |
| "eval_samples_per_second": 571.324, |
| "eval_steps_per_second": 8.928, |
| "step": 1250 |
| }, |
| { |
| "entropy": 2.7457793346083226, |
| "epoch": 1.9962406015037595, |
| "grad_norm": 0.9921875, |
| "learning_rate": 0.0002716635123374255, |
| "loss": 2.0136396789550783, |
| "mean_token_accuracy": 0.4905763155027781, |
| "num_tokens": 198681309.0, |
| "step": 1275 |
| }, |
| { |
| "entropy": 2.7296520815516434, |
| "epoch": 2.0344611528822054, |
| "grad_norm": 0.609375, |
| "learning_rate": 0.00026359046253851537, |
| "loss": 1.9885548400878905, |
| "mean_token_accuracy": 0.49141303876894793, |
| "num_tokens": 202488293.0, |
| "step": 1300 |
| }, |
| { |
| "entropy": 2.7237404436481647, |
| "epoch": 2.0736215538847116, |
| "grad_norm": 0.5859375, |
| "learning_rate": 0.00025550316996913314, |
| "loss": 1.9903170776367187, |
| "mean_token_accuracy": 0.4935096359392426, |
| "num_tokens": 206409968.0, |
| "step": 1325 |
| }, |
| { |
| "entropy": 2.7291376300032053, |
| "epoch": 2.112781954887218, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.00024741011009149944, |
| "loss": 1.9878811645507812, |
| "mean_token_accuracy": 0.49241777430140515, |
| "num_tokens": 210314638.0, |
| "step": 1350 |
| }, |
| { |
| "entropy": 2.727339653278635, |
| "epoch": 2.1519423558897244, |
| "grad_norm": 0.59765625, |
| "learning_rate": 0.0002393197644119594, |
| "loss": 1.9830924987792968, |
| "mean_token_accuracy": 0.49156372149799366, |
| "num_tokens": 214195432.0, |
| "step": 1375 |
| }, |
| { |
| "entropy": 2.6867289156814746, |
| "epoch": 2.1911027568922306, |
| "grad_norm": 0.578125, |
| "learning_rate": 0.00023124061159238553, |
| "loss": 1.9581849670410156, |
| "mean_token_accuracy": 0.4971003970211406, |
| "num_tokens": 218094898.0, |
| "step": 1400 |
| }, |
| { |
| "entropy": 2.7372838236997215, |
| "epoch": 2.2302631578947367, |
| "grad_norm": 0.5703125, |
| "learning_rate": 0.0002231811185645613, |
| "loss": 1.9794134521484374, |
| "mean_token_accuracy": 0.4906712610116262, |
| "num_tokens": 221998326.0, |
| "step": 1425 |
| }, |
| { |
| "entropy": 2.714885350188938, |
| "epoch": 2.269423558897243, |
| "grad_norm": 0.5625, |
| "learning_rate": 0.00021514973165685783, |
| "loss": 1.9843505859375, |
| "mean_token_accuracy": 0.49365376402815986, |
| "num_tokens": 225920259.0, |
| "step": 1450 |
| }, |
| { |
| "entropy": 2.696512448708, |
| "epoch": 2.3085839598997495, |
| "grad_norm": 0.5, |
| "learning_rate": 0.00020715486774250342, |
| "loss": 1.9640107727050782, |
| "mean_token_accuracy": 0.4955928374349573, |
| "num_tokens": 229793611.0, |
| "step": 1475 |
| }, |
| { |
| "entropy": 2.7095071681692473, |
| "epoch": 2.3477443609022557, |
| "grad_norm": 0.56640625, |
| "learning_rate": 0.0001992049054187214, |
| "loss": 1.9568646240234375, |
| "mean_token_accuracy": 0.4964784048245484, |
| "num_tokens": 233686342.0, |
| "step": 1500 |
| }, |
| { |
| "epoch": 2.3477443609022557, |
| "eval_bpd": 2.753628846729509, |
| "eval_entropy": 2.5548404387573136, |
| "eval_loss": 1.9053977727890015, |
| "eval_mean_token_accuracy": 0.5062358641819159, |
| "eval_nll": 1.908670071419093, |
| "eval_num_tokens": 233686342.0, |
| "eval_ppl": 6.744113642210042, |
| "eval_runtime": 317.8614, |
| "eval_samples_per_second": 571.346, |
| "eval_steps_per_second": 8.928, |
| "step": 1500 |
| }, |
| { |
| "entropy": 2.6962403165811546, |
| "epoch": 2.386904761904762, |
| "grad_norm": 0.52734375, |
| "learning_rate": 0.00019130817622598124, |
| "loss": 1.9656645202636718, |
| "mean_token_accuracy": 0.49542844133717173, |
| "num_tokens": 237624819.0, |
| "step": 1525 |
| }, |
| { |
| "entropy": 2.661015365594498, |
| "epoch": 2.426065162907268, |
| "grad_norm": 0.5234375, |
| "learning_rate": 0.0001834729559165655, |
| "loss": 1.9300704956054688, |
| "mean_token_accuracy": 0.5028307401118935, |
| "num_tokens": 241545153.0, |
| "step": 1550 |
| }, |
| { |
| "entropy": 2.7084774859453065, |
| "epoch": 2.465225563909774, |
| "grad_norm": 0.5546875, |
| "learning_rate": 0.00017570745578160198, |
| "loss": 1.9839097595214843, |
| "mean_token_accuracy": 0.49480885073851655, |
| "num_tokens": 245435136.0, |
| "step": 1575 |
| }, |
| { |
| "entropy": 2.720735177594368, |
| "epoch": 2.504385964912281, |
| "grad_norm": 0.69921875, |
| "learning_rate": 0.0001680198140456516, |
| "loss": 1.9636825561523437, |
| "mean_token_accuracy": 0.49606104503640003, |
| "num_tokens": 249367087.0, |
| "step": 1600 |
| }, |
| { |
| "entropy": 2.7053065007280694, |
| "epoch": 2.543546365914787, |
| "grad_norm": 0.60546875, |
| "learning_rate": 0.00016041808733786915, |
| "loss": 1.973881072998047, |
| "mean_token_accuracy": 0.4954433957962887, |
| "num_tokens": 253284840.0, |
| "step": 1625 |
| }, |
| { |
| "entropy": 2.698947790229774, |
| "epoch": 2.582706766917293, |
| "grad_norm": 0.51171875, |
| "learning_rate": 0.0001529102422486769, |
| "loss": 1.9727474975585937, |
| "mean_token_accuracy": 0.4956776145060249, |
| "num_tokens": 257182312.0, |
| "step": 1650 |
| }, |
| { |
| "entropy": 2.6974555430574907, |
| "epoch": 2.6218671679197993, |
| "grad_norm": 0.5859375, |
| "learning_rate": 0.00014550414698079727, |
| "loss": 1.9712374877929688, |
| "mean_token_accuracy": 0.49620761846498757, |
| "num_tokens": 261090778.0, |
| "step": 1675 |
| }, |
| { |
| "entropy": 2.6922827269469427, |
| "epoch": 2.6610275689223055, |
| "grad_norm": 0.59765625, |
| "learning_rate": 0.00013820756310339665, |
| "loss": 1.9518051147460938, |
| "mean_token_accuracy": 0.49857486663635253, |
| "num_tokens": 264965770.0, |
| "step": 1700 |
| }, |
| { |
| "entropy": 2.69106729380676, |
| "epoch": 2.700187969924812, |
| "grad_norm": 0.5625, |
| "learning_rate": 0.00013102813741798025, |
| "loss": 1.955197296142578, |
| "mean_token_accuracy": 0.49718124580239675, |
| "num_tokens": 268814860.0, |
| "step": 1725 |
| }, |
| { |
| "entropy": 2.662197894060978, |
| "epoch": 2.7393483709273183, |
| "grad_norm": 0.63671875, |
| "learning_rate": 0.00012397339394456356, |
| "loss": 1.9427037048339844, |
| "mean_token_accuracy": 0.5021224760307385, |
| "num_tokens": 272697610.0, |
| "step": 1750 |
| }, |
| { |
| "epoch": 2.7393483709273183, |
| "eval_bpd": 2.746128517119456, |
| "eval_entropy": 2.5467006554680043, |
| "eval_loss": 1.900189757347107, |
| "eval_mean_token_accuracy": 0.5073069371159629, |
| "eval_nll": 1.9034712390966142, |
| "eval_num_tokens": 272697610.0, |
| "eval_ppl": 6.709143107957204, |
| "eval_runtime": 317.8831, |
| "eval_samples_per_second": 571.308, |
| "eval_steps_per_second": 8.928, |
| "step": 1750 |
| }, |
| { |
| "entropy": 2.681755317696406, |
| "epoch": 2.7785087719298245, |
| "grad_norm": 0.51171875, |
| "learning_rate": 0.00011705072603651829, |
| "loss": 1.9534152221679688, |
| "mean_token_accuracy": 0.49887350844173306, |
| "num_tokens": 276577245.0, |
| "step": 1775 |
| }, |
| { |
| "entropy": 2.6537644882871887, |
| "epoch": 2.817669172932331, |
| "grad_norm": 0.54296875, |
| "learning_rate": 0.00011026738863235674, |
| "loss": 1.932033233642578, |
| "mean_token_accuracy": 0.5024196737013861, |
| "num_tokens": 280495941.0, |
| "step": 1800 |
| }, |
| { |
| "entropy": 2.696102005171466, |
| "epoch": 2.856829573934837, |
| "grad_norm": 0.54296875, |
| "learning_rate": 0.00010363049065257416, |
| "loss": 1.9526573181152345, |
| "mean_token_accuracy": 0.4961788889854049, |
| "num_tokens": 284359230.0, |
| "step": 1825 |
| }, |
| { |
| "entropy": 2.6950738714582054, |
| "epoch": 2.8959899749373434, |
| "grad_norm": 0.51171875, |
| "learning_rate": 9.71469875495186e-05, |
| "loss": 1.9607313537597657, |
| "mean_token_accuracy": 0.4969643320518318, |
| "num_tokens": 288227871.0, |
| "step": 1850 |
| }, |
| { |
| "entropy": 2.6776621984896427, |
| "epoch": 2.9351503759398496, |
| "grad_norm": 0.5859375, |
| "learning_rate": 9.082367401809396e-05, |
| "loss": 1.9385653686523439, |
| "mean_token_accuracy": 0.5004678905504529, |
| "num_tokens": 292105552.0, |
| "step": 1875 |
| }, |
| { |
| "entropy": 2.7108317378677427, |
| "epoch": 2.974310776942356, |
| "grad_norm": 0.5859375, |
| "learning_rate": 8.466717687493703e-05, |
| "loss": 1.9630741882324219, |
| "mean_token_accuracy": 0.4949593694629437, |
| "num_tokens": 296018638.0, |
| "step": 1900 |
| }, |
| { |
| "entropy": 2.6951544846467215, |
| "epoch": 3.012531328320802, |
| "grad_norm": 0.6171875, |
| "learning_rate": 7.868394811353039e-05, |
| "loss": 1.9621902465820313, |
| "mean_token_accuracy": 0.4969353615896138, |
| "num_tokens": 299799772.0, |
| "step": 1925 |
| }, |
| { |
| "entropy": 2.6865969529696008, |
| "epoch": 3.0516917293233083, |
| "grad_norm": 0.53515625, |
| "learning_rate": 7.288025814252918e-05, |
| "loss": 1.9542425537109376, |
| "mean_token_accuracy": 0.4988364340091859, |
| "num_tokens": 303697115.0, |
| "step": 1950 |
| }, |
| { |
| "entropy": 2.7144221244365414, |
| "epoch": 3.0908521303258145, |
| "grad_norm": 0.51953125, |
| "learning_rate": 6.726218921438915e-05, |
| "loss": 1.9707881164550782, |
| "mean_token_accuracy": 0.49513010638787824, |
| "num_tokens": 307582257.0, |
| "step": 1975 |
| }, |
| { |
| "entropy": 2.6845787794916958, |
| "epoch": 3.1300125313283207, |
| "grad_norm": 0.58203125, |
| "learning_rate": 6.183562905118107e-05, |
| "loss": 1.9502456665039063, |
| "mean_token_accuracy": 0.4984206819132311, |
| "num_tokens": 311533513.0, |
| "step": 2000 |
| }, |
| { |
| "epoch": 3.1300125313283207, |
| "eval_bpd": 2.743150644463847, |
| "eval_entropy": 2.537413316218948, |
| "eval_loss": 1.898119330406189, |
| "eval_mean_token_accuracy": 0.5075566540142357, |
| "eval_nll": 1.9014071350613124, |
| "eval_num_tokens": 311533513.0, |
| "eval_ppl": 6.695309021003712, |
| "eval_runtime": 317.8588, |
| "eval_samples_per_second": 571.351, |
| "eval_steps_per_second": 8.928, |
| "step": 2000 |
| } |
| ], |
| "logging_steps": 25, |
| "max_steps": 2554, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 4, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.0131687067311667e+18, |
| "train_batch_size": 64, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|