Instructions to use FluffyAIcode/Kakeya-OProver-Stage4-Repair-SFT with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FluffyAIcode/Kakeya-OProver-Stage4-Repair-SFT with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("m-a-p/OProver-8B") model = PeftModel.from_pretrained(base_model, "FluffyAIcode/Kakeya-OProver-Stage4-Repair-SFT") - Notebooks
- Google Colab
- Kaggle
| { | |
| "max_steps": 175, | |
| "save_steps": 35, | |
| "is_world_process_zero": true, | |
| "train_batch_size": 1, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "is_hyper_param_search": false, | |
| "num_input_tokens_seen": 0, | |
| "log_history": [ | |
| { | |
| "entropy": 0.8749912828207016, | |
| "epoch": 0.005714285714285714, | |
| "grad_norm": 0.494140625, | |
| "learning_rate": 0.0, | |
| "loss": 0.35, | |
| "mean_token_accuracy": 0.8977917954325676, | |
| "num_tokens": 29411.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 0.875585176050663, | |
| "epoch": 0.011428571428571429, | |
| "grad_norm": 0.44921875, | |
| "learning_rate": 1.111111111111111e-06, | |
| "loss": 0.108, | |
| "mean_token_accuracy": 0.9535237550735474, | |
| "num_tokens": 54683.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 0.9626811370253563, | |
| "epoch": 0.017142857142857144, | |
| "grad_norm": 0.494140625, | |
| "learning_rate": 2.222222222222222e-06, | |
| "loss": 0.1226, | |
| "mean_token_accuracy": 0.9568850845098495, | |
| "num_tokens": 75772.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 0.9870915822684765, | |
| "epoch": 0.022857142857142857, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "loss": 0.2987, | |
| "mean_token_accuracy": 0.9255228415131569, | |
| "num_tokens": 94596.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 0.9431633446365595, | |
| "epoch": 0.02857142857142857, | |
| "grad_norm": 1.6328125, | |
| "learning_rate": 4.444444444444444e-06, | |
| "loss": 0.3896, | |
| "mean_token_accuracy": 0.9072471372783184, | |
| "num_tokens": 114864.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 0.8606603350490332, | |
| "epoch": 0.03428571428571429, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 5.555555555555557e-06, | |
| "loss": 0.4749, | |
| "mean_token_accuracy": 0.8948077894747257, | |
| "num_tokens": 138676.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 0.8535148575901985, | |
| "epoch": 0.04, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 6.666666666666667e-06, | |
| "loss": 0.1483, | |
| "mean_token_accuracy": 0.9479962512850761, | |
| "num_tokens": 164003.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 0.9910166934132576, | |
| "epoch": 0.045714285714285714, | |
| "grad_norm": 0.453125, | |
| "learning_rate": 7.77777777777778e-06, | |
| "loss": 0.3066, | |
| "mean_token_accuracy": 0.9498882181942463, | |
| "num_tokens": 185952.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 0.9770639836788177, | |
| "epoch": 0.05142857142857143, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 8.888888888888888e-06, | |
| "loss": 0.4671, | |
| "mean_token_accuracy": 0.893197625875473, | |
| "num_tokens": 204243.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 0.9742397665977478, | |
| "epoch": 0.05714285714285714, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 1e-05, | |
| "loss": 0.3377, | |
| "mean_token_accuracy": 0.8987404629588127, | |
| "num_tokens": 223465.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.8626804165542126, | |
| "epoch": 0.06285714285714286, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 9.99910461334869e-06, | |
| "loss": 0.5433, | |
| "mean_token_accuracy": 0.9067845679819584, | |
| "num_tokens": 245021.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 0.9500371664762497, | |
| "epoch": 0.06857142857142857, | |
| "grad_norm": 0.57421875, | |
| "learning_rate": 9.996418774081658e-06, | |
| "loss": 0.4075, | |
| "mean_token_accuracy": 0.9532840885221958, | |
| "num_tokens": 268768.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 0.8756210878491402, | |
| "epoch": 0.07428571428571429, | |
| "grad_norm": 0.55859375, | |
| "learning_rate": 9.991943444144758e-06, | |
| "loss": 0.3333, | |
| "mean_token_accuracy": 0.9239994585514069, | |
| "num_tokens": 291342.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 0.9877203069627285, | |
| "epoch": 0.08, | |
| "grad_norm": 0.298828125, | |
| "learning_rate": 9.985680226398261e-06, | |
| "loss": 0.051, | |
| "mean_token_accuracy": 0.9740834198892117, | |
| "num_tokens": 311741.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 0.9451847337186337, | |
| "epoch": 0.08571428571428572, | |
| "grad_norm": 0.462890625, | |
| "learning_rate": 9.977631364042796e-06, | |
| "loss": 0.2506, | |
| "mean_token_accuracy": 0.9314159639179707, | |
| "num_tokens": 336791.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.0535272359848022, | |
| "epoch": 0.09142857142857143, | |
| "grad_norm": 0.443359375, | |
| "learning_rate": 9.967799739815925e-06, | |
| "loss": 0.1661, | |
| "mean_token_accuracy": 0.9449756816029549, | |
| "num_tokens": 355547.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 0.8473225496709347, | |
| "epoch": 0.09714285714285714, | |
| "grad_norm": 0.37109375, | |
| "learning_rate": 9.956188874959686e-06, | |
| "loss": 0.1392, | |
| "mean_token_accuracy": 0.9268854539841413, | |
| "num_tokens": 378069.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.8464508075267076, | |
| "epoch": 0.10285714285714286, | |
| "grad_norm": 0.27734375, | |
| "learning_rate": 9.942802927959444e-06, | |
| "loss": 0.1095, | |
| "mean_token_accuracy": 0.9479888863861561, | |
| "num_tokens": 402338.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 0.9170358963310719, | |
| "epoch": 0.10857142857142857, | |
| "grad_norm": 0.333984375, | |
| "learning_rate": 9.927646693054498e-06, | |
| "loss": 0.0719, | |
| "mean_token_accuracy": 0.978356346487999, | |
| "num_tokens": 425500.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 0.8572139944881201, | |
| "epoch": 0.11428571428571428, | |
| "grad_norm": 0.3203125, | |
| "learning_rate": 9.910725598521014e-06, | |
| "loss": 0.1026, | |
| "mean_token_accuracy": 0.9628097862005234, | |
| "num_tokens": 448855.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.7983267344534397, | |
| "epoch": 0.12, | |
| "grad_norm": 0.20703125, | |
| "learning_rate": 9.892045704727864e-06, | |
| "loss": 0.0308, | |
| "mean_token_accuracy": 0.9713204726576805, | |
| "num_tokens": 479318.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 0.8835957311093807, | |
| "epoch": 0.12571428571428572, | |
| "grad_norm": 0.357421875, | |
| "learning_rate": 9.871613701966067e-06, | |
| "loss": 0.1352, | |
| "mean_token_accuracy": 0.9699565283954144, | |
| "num_tokens": 499352.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 0.8213062435388565, | |
| "epoch": 0.13142857142857142, | |
| "grad_norm": 0.462890625, | |
| "learning_rate": 9.849436908052636e-06, | |
| "loss": 0.1679, | |
| "mean_token_accuracy": 0.9590318724513054, | |
| "num_tokens": 521144.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 0.948228694498539, | |
| "epoch": 0.13714285714285715, | |
| "grad_norm": 0.515625, | |
| "learning_rate": 9.825523265709667e-06, | |
| "loss": 0.3717, | |
| "mean_token_accuracy": 0.9018147587776184, | |
| "num_tokens": 540147.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 0.8118924200534821, | |
| "epoch": 0.14285714285714285, | |
| "grad_norm": 0.451171875, | |
| "learning_rate": 9.799881339719615e-06, | |
| "loss": 0.381, | |
| "mean_token_accuracy": 0.8814735785126686, | |
| "num_tokens": 565734.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 0.7852364294230938, | |
| "epoch": 0.14857142857142858, | |
| "grad_norm": 0.625, | |
| "learning_rate": 9.772520313857777e-06, | |
| "loss": 0.516, | |
| "mean_token_accuracy": 0.8841418623924255, | |
| "num_tokens": 589632.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 0.8675227835774422, | |
| "epoch": 0.15428571428571428, | |
| "grad_norm": 0.31640625, | |
| "learning_rate": 9.743449987603082e-06, | |
| "loss": 0.0974, | |
| "mean_token_accuracy": 0.9476801715791225, | |
| "num_tokens": 609264.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 0.8951734602451324, | |
| "epoch": 0.16, | |
| "grad_norm": 0.49609375, | |
| "learning_rate": 9.712680772628365e-06, | |
| "loss": 0.1979, | |
| "mean_token_accuracy": 0.9428337290883064, | |
| "num_tokens": 630959.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 0.808982141315937, | |
| "epoch": 0.1657142857142857, | |
| "grad_norm": 0.35546875, | |
| "learning_rate": 9.680223689071364e-06, | |
| "loss": 0.2369, | |
| "mean_token_accuracy": 0.9508304186165333, | |
| "num_tokens": 651742.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.8595655560493469, | |
| "epoch": 0.17142857142857143, | |
| "grad_norm": 0.48046875, | |
| "learning_rate": 9.646090361587828e-06, | |
| "loss": 0.2099, | |
| "mean_token_accuracy": 0.9459701962769032, | |
| "num_tokens": 673005.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.9097736775875092, | |
| "epoch": 0.17714285714285713, | |
| "grad_norm": 0.51171875, | |
| "learning_rate": 9.610293015188067e-06, | |
| "loss": 0.127, | |
| "mean_token_accuracy": 0.9653318747878075, | |
| "num_tokens": 695196.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 0.8208987936377525, | |
| "epoch": 0.18285714285714286, | |
| "grad_norm": 0.474609375, | |
| "learning_rate": 9.572844470858537e-06, | |
| "loss": 0.3805, | |
| "mean_token_accuracy": 0.8996468931436539, | |
| "num_tokens": 720448.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.8851851001381874, | |
| "epoch": 0.18857142857142858, | |
| "grad_norm": 0.388671875, | |
| "learning_rate": 9.533758140969913e-06, | |
| "loss": 0.1802, | |
| "mean_token_accuracy": 0.9502685889601707, | |
| "num_tokens": 741368.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.8407743759453297, | |
| "epoch": 0.19428571428571428, | |
| "grad_norm": 0.58984375, | |
| "learning_rate": 9.493048024473413e-06, | |
| "loss": 0.2724, | |
| "mean_token_accuracy": 0.9375377260148525, | |
| "num_tokens": 762498.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 0.7037532348185778, | |
| "epoch": 0.2, | |
| "grad_norm": 0.283203125, | |
| "learning_rate": 9.450728701886985e-06, | |
| "loss": 0.09, | |
| "mean_token_accuracy": 0.9488834552466869, | |
| "num_tokens": 790572.0, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "eval_entropy": 0.8689000523835421, | |
| "eval_loss": 0.3127354085445404, | |
| "eval_mean_token_accuracy": 0.9241019106656313, | |
| "eval_num_tokens": 790572.0, | |
| "eval_runtime": 90.9265, | |
| "eval_samples_per_second": 4.399, | |
| "eval_steps_per_second": 4.399, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 0.9641305468976498, | |
| "epoch": 0.2057142857142857, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 9.406815330073244e-06, | |
| "loss": 0.0987, | |
| "mean_token_accuracy": 0.9563006423413754, | |
| "num_tokens": 811589.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 0.8417863231152296, | |
| "epoch": 0.21142857142857144, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 9.36132363681097e-06, | |
| "loss": 0.4473, | |
| "mean_token_accuracy": 0.9201415926218033, | |
| "num_tokens": 835343.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 0.9279076214879751, | |
| "epoch": 0.21714285714285714, | |
| "grad_norm": 0.234375, | |
| "learning_rate": 9.314269915162115e-06, | |
| "loss": 0.0366, | |
| "mean_token_accuracy": 0.9819578677415848, | |
| "num_tokens": 857745.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 0.9102700352668762, | |
| "epoch": 0.22285714285714286, | |
| "grad_norm": 0.8515625, | |
| "learning_rate": 9.265671017636384e-06, | |
| "loss": 0.4769, | |
| "mean_token_accuracy": 0.9464839920401573, | |
| "num_tokens": 885412.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 0.8781285881996155, | |
| "epoch": 0.22857142857142856, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 9.215544350155423e-06, | |
| "loss": 0.4407, | |
| "mean_token_accuracy": 0.9192753657698631, | |
| "num_tokens": 907272.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.884316835552454, | |
| "epoch": 0.2342857142857143, | |
| "grad_norm": 0.57421875, | |
| "learning_rate": 9.163907865818806e-06, | |
| "loss": 0.3331, | |
| "mean_token_accuracy": 0.9058137945830822, | |
| "num_tokens": 929992.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 0.9548828471451998, | |
| "epoch": 0.24, | |
| "grad_norm": 0.52734375, | |
| "learning_rate": 9.110780058474052e-06, | |
| "loss": 0.2486, | |
| "mean_token_accuracy": 0.9495599456131458, | |
| "num_tokens": 949716.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 0.8926267586648464, | |
| "epoch": 0.24571428571428572, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 9.056179956092961e-06, | |
| "loss": 0.5837, | |
| "mean_token_accuracy": 0.8974111899733543, | |
| "num_tokens": 971635.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 0.7238617390394211, | |
| "epoch": 0.25142857142857145, | |
| "grad_norm": 0.314453125, | |
| "learning_rate": 9.000127113956673e-06, | |
| "loss": 0.2067, | |
| "mean_token_accuracy": 0.9391417279839516, | |
| "num_tokens": 996008.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 0.7713149264454842, | |
| "epoch": 0.2571428571428571, | |
| "grad_norm": 0.1904296875, | |
| "learning_rate": 8.94264160765183e-06, | |
| "loss": 0.1132, | |
| "mean_token_accuracy": 0.9410833567380905, | |
| "num_tokens": 1021812.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.906012874096632, | |
| "epoch": 0.26285714285714284, | |
| "grad_norm": 0.376953125, | |
| "learning_rate": 8.883744025880429e-06, | |
| "loss": 0.1349, | |
| "mean_token_accuracy": 0.9730539433658123, | |
| "num_tokens": 1042776.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 0.893264701589942, | |
| "epoch": 0.26857142857142857, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 8.823455463085873e-06, | |
| "loss": 0.3195, | |
| "mean_token_accuracy": 0.907339371740818, | |
| "num_tokens": 1070161.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 0.9435957297682762, | |
| "epoch": 0.2742857142857143, | |
| "grad_norm": 0.376953125, | |
| "learning_rate": 8.761797511897907e-06, | |
| "loss": 0.0763, | |
| "mean_token_accuracy": 0.9643098935484886, | |
| "num_tokens": 1092383.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.9334972836077213, | |
| "epoch": 0.28, | |
| "grad_norm": 0.40625, | |
| "learning_rate": 8.698792255399104e-06, | |
| "loss": 0.0661, | |
| "mean_token_accuracy": 0.9583298973739147, | |
| "num_tokens": 1114220.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.8552105147391558, | |
| "epoch": 0.2857142857142857, | |
| "grad_norm": 0.271484375, | |
| "learning_rate": 8.634462259215719e-06, | |
| "loss": 0.0947, | |
| "mean_token_accuracy": 0.974045418202877, | |
| "num_tokens": 1136124.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.8368009328842163, | |
| "epoch": 0.2914285714285714, | |
| "grad_norm": 0.5, | |
| "learning_rate": 8.568830563435695e-06, | |
| "loss": 0.2611, | |
| "mean_token_accuracy": 0.9241638034582138, | |
| "num_tokens": 1160123.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.7590750344097614, | |
| "epoch": 0.29714285714285715, | |
| "grad_norm": 0.51953125, | |
| "learning_rate": 8.501920674356755e-06, | |
| "loss": 0.2207, | |
| "mean_token_accuracy": 0.9286937117576599, | |
| "num_tokens": 1184958.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.9840590953826904, | |
| "epoch": 0.3028571428571429, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 8.433756556067506e-06, | |
| "loss": 0.22, | |
| "mean_token_accuracy": 0.908040776848793, | |
| "num_tokens": 1200609.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.9369215555489063, | |
| "epoch": 0.30857142857142855, | |
| "grad_norm": 0.28125, | |
| "learning_rate": 8.364362621864595e-06, | |
| "loss": 0.0742, | |
| "mean_token_accuracy": 0.9590763710439205, | |
| "num_tokens": 1220859.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.791748657822609, | |
| "epoch": 0.3142857142857143, | |
| "grad_norm": 0.33984375, | |
| "learning_rate": 8.29376372550897e-06, | |
| "loss": 0.1522, | |
| "mean_token_accuracy": 0.9422268383204937, | |
| "num_tokens": 1248991.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.8576459661126137, | |
| "epoch": 0.32, | |
| "grad_norm": 0.431640625, | |
| "learning_rate": 8.221985152324385e-06, | |
| "loss": 0.1875, | |
| "mean_token_accuracy": 0.9321193210780621, | |
| "num_tokens": 1276785.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.8861603923141956, | |
| "epoch": 0.32571428571428573, | |
| "grad_norm": 0.4296875, | |
| "learning_rate": 8.149052610141357e-06, | |
| "loss": 0.1736, | |
| "mean_token_accuracy": 0.9611009992659092, | |
| "num_tokens": 1295280.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.8505105189979076, | |
| "epoch": 0.3314285714285714, | |
| "grad_norm": 0.380859375, | |
| "learning_rate": 8.07499222008977e-06, | |
| "loss": 0.1473, | |
| "mean_token_accuracy": 0.959467314183712, | |
| "num_tokens": 1316096.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 0.918358813971281, | |
| "epoch": 0.33714285714285713, | |
| "grad_norm": 0.427734375, | |
| "learning_rate": 7.999830507243478e-06, | |
| "loss": 0.1743, | |
| "mean_token_accuracy": 0.9617721550166607, | |
| "num_tokens": 1340263.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.7842087559401989, | |
| "epoch": 0.34285714285714286, | |
| "grad_norm": 0.318359375, | |
| "learning_rate": 7.923594391120237e-06, | |
| "loss": 0.0953, | |
| "mean_token_accuracy": 0.968870148062706, | |
| "num_tokens": 1364628.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.8913918249309063, | |
| "epoch": 0.3485714285714286, | |
| "grad_norm": 0.5, | |
| "learning_rate": 7.846311176040331e-06, | |
| "loss": 0.3246, | |
| "mean_token_accuracy": 0.9421980828046799, | |
| "num_tokens": 1386415.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.861630380153656, | |
| "epoch": 0.35428571428571426, | |
| "grad_norm": 0.43359375, | |
| "learning_rate": 7.768008541347423e-06, | |
| "loss": 0.3042, | |
| "mean_token_accuracy": 0.9076553024351597, | |
| "num_tokens": 1409474.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.858629435300827, | |
| "epoch": 0.36, | |
| "grad_norm": 0.43359375, | |
| "learning_rate": 7.688714531495061e-06, | |
| "loss": 0.2292, | |
| "mean_token_accuracy": 0.9376597180962563, | |
| "num_tokens": 1435711.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.9525596722960472, | |
| "epoch": 0.3657142857142857, | |
| "grad_norm": 0.625, | |
| "learning_rate": 7.608457546002423e-06, | |
| "loss": 0.0645, | |
| "mean_token_accuracy": 0.9651173837482929, | |
| "num_tokens": 1457807.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.9927118942141533, | |
| "epoch": 0.37142857142857144, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 7.527266329282905e-06, | |
| "loss": 0.3301, | |
| "mean_token_accuracy": 0.910726185888052, | |
| "num_tokens": 1478686.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.8207175862044096, | |
| "epoch": 0.37714285714285717, | |
| "grad_norm": 0.318359375, | |
| "learning_rate": 7.445169960349167e-06, | |
| "loss": 0.1321, | |
| "mean_token_accuracy": 0.9752165786921978, | |
| "num_tokens": 1504665.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.7939795292913914, | |
| "epoch": 0.38285714285714284, | |
| "grad_norm": 0.267578125, | |
| "learning_rate": 7.362197842398355e-06, | |
| "loss": 0.0607, | |
| "mean_token_accuracy": 0.9890137501060963, | |
| "num_tokens": 1531122.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.8998405113816261, | |
| "epoch": 0.38857142857142857, | |
| "grad_norm": 0.50390625, | |
| "learning_rate": 7.278379692281209e-06, | |
| "loss": 0.2199, | |
| "mean_token_accuracy": 0.9454703703522682, | |
| "num_tokens": 1555455.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.900477584451437, | |
| "epoch": 0.3942857142857143, | |
| "grad_norm": 0.412109375, | |
| "learning_rate": 7.193745529858827e-06, | |
| "loss": 0.1587, | |
| "mean_token_accuracy": 0.9558433368802071, | |
| "num_tokens": 1581569.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 0.8638413399457932, | |
| "epoch": 0.4, | |
| "grad_norm": 0.400390625, | |
| "learning_rate": 7.10832566725092e-06, | |
| "loss": 0.1142, | |
| "mean_token_accuracy": 0.9596346840262413, | |
| "num_tokens": 1606126.0, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_entropy": 0.8763485141098499, | |
| "eval_loss": 0.2973862886428833, | |
| "eval_mean_token_accuracy": 0.9280769071727991, | |
| "eval_num_tokens": 1606126.0, | |
| "eval_runtime": 91.5273, | |
| "eval_samples_per_second": 4.37, | |
| "eval_steps_per_second": 4.37, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.9078505225479603, | |
| "epoch": 0.4057142857142857, | |
| "grad_norm": 0.41796875, | |
| "learning_rate": 7.022150697979385e-06, | |
| "loss": 0.1814, | |
| "mean_token_accuracy": 0.9287765622138977, | |
| "num_tokens": 1624592.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 0.882373970001936, | |
| "epoch": 0.4114285714285714, | |
| "grad_norm": 0.2275390625, | |
| "learning_rate": 6.9352514860110876e-06, | |
| "loss": 0.1, | |
| "mean_token_accuracy": 0.9773332364857197, | |
| "num_tokens": 1644996.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.8143801726400852, | |
| "epoch": 0.41714285714285715, | |
| "grad_norm": 0.318359375, | |
| "learning_rate": 6.847659154703785e-06, | |
| "loss": 0.1004, | |
| "mean_token_accuracy": 0.9484822899103165, | |
| "num_tokens": 1672992.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.8206119015812874, | |
| "epoch": 0.4228571428571429, | |
| "grad_norm": 0.46875, | |
| "learning_rate": 6.759405075659165e-06, | |
| "loss": 0.1754, | |
| "mean_token_accuracy": 0.9521096795797348, | |
| "num_tokens": 1698329.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.8256349451839924, | |
| "epoch": 0.42857142857142855, | |
| "grad_norm": 0.1708984375, | |
| "learning_rate": 6.6705208574869504e-06, | |
| "loss": 0.0452, | |
| "mean_token_accuracy": 0.9771151430904865, | |
| "num_tokens": 1723576.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.7869148999452591, | |
| "epoch": 0.4342857142857143, | |
| "grad_norm": 0.3203125, | |
| "learning_rate": 6.58103833448412e-06, | |
| "loss": 0.1119, | |
| "mean_token_accuracy": 0.9510597065091133, | |
| "num_tokens": 1750632.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.9072761423885822, | |
| "epoch": 0.44, | |
| "grad_norm": 0.56640625, | |
| "learning_rate": 6.490989555233328e-06, | |
| "loss": 0.2573, | |
| "mean_token_accuracy": 0.9290625192224979, | |
| "num_tokens": 1771479.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 0.8767102062702179, | |
| "epoch": 0.44571428571428573, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 6.4004067711245366e-06, | |
| "loss": 0.4063, | |
| "mean_token_accuracy": 0.9356401972472668, | |
| "num_tokens": 1794342.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.8600077293813229, | |
| "epoch": 0.4514285714285714, | |
| "grad_norm": 0.515625, | |
| "learning_rate": 6.309322424804034e-06, | |
| "loss": 0.4222, | |
| "mean_token_accuracy": 0.8884662203490734, | |
| "num_tokens": 1815232.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.8075901996344328, | |
| "epoch": 0.45714285714285713, | |
| "grad_norm": 0.2158203125, | |
| "learning_rate": 6.2177691385549595e-06, | |
| "loss": 0.0395, | |
| "mean_token_accuracy": 0.9654630422592163, | |
| "num_tokens": 1843699.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.9111120142042637, | |
| "epoch": 0.46285714285714286, | |
| "grad_norm": 0.53125, | |
| "learning_rate": 6.125779702613471e-06, | |
| "loss": 0.2, | |
| "mean_token_accuracy": 0.9453306347131729, | |
| "num_tokens": 1863178.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 0.8782064206898212, | |
| "epoch": 0.4685714285714286, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 6.033387063424765e-06, | |
| "loss": 0.5846, | |
| "mean_token_accuracy": 0.8993191905319691, | |
| "num_tokens": 1886505.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.7901722844690084, | |
| "epoch": 0.4742857142857143, | |
| "grad_norm": 0.125, | |
| "learning_rate": 5.94062431184317e-06, | |
| "loss": 0.0243, | |
| "mean_token_accuracy": 0.9816068820655346, | |
| "num_tokens": 1911651.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.7807160075753927, | |
| "epoch": 0.48, | |
| "grad_norm": 0.1943359375, | |
| "learning_rate": 5.8475246712804845e-06, | |
| "loss": 0.0649, | |
| "mean_token_accuracy": 0.9530936926603317, | |
| "num_tokens": 1939727.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.805871419608593, | |
| "epoch": 0.4857142857142857, | |
| "grad_norm": 0.47265625, | |
| "learning_rate": 5.7541214858068705e-06, | |
| "loss": 0.3212, | |
| "mean_token_accuracy": 0.9191376678645611, | |
| "num_tokens": 1961164.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.8677656650543213, | |
| "epoch": 0.49142857142857144, | |
| "grad_norm": 0.423828125, | |
| "learning_rate": 5.660448208208513e-06, | |
| "loss": 0.2838, | |
| "mean_token_accuracy": 0.8779561948031187, | |
| "num_tokens": 1983306.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.8968867547810078, | |
| "epoch": 0.49714285714285716, | |
| "grad_norm": 0.287109375, | |
| "learning_rate": 5.566538388006351e-06, | |
| "loss": 0.1242, | |
| "mean_token_accuracy": 0.9707877077162266, | |
| "num_tokens": 2005414.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.9857515692710876, | |
| "epoch": 0.5028571428571429, | |
| "grad_norm": 0.359375, | |
| "learning_rate": 5.472425659440157e-06, | |
| "loss": 0.201, | |
| "mean_token_accuracy": 0.9621238149702549, | |
| "num_tokens": 2026778.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 0.7767338864505291, | |
| "epoch": 0.5085714285714286, | |
| "grad_norm": 0.52734375, | |
| "learning_rate": 5.378143729422285e-06, | |
| "loss": 0.2234, | |
| "mean_token_accuracy": 0.937239296734333, | |
| "num_tokens": 2049698.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 0.8967469111084938, | |
| "epoch": 0.5142857142857142, | |
| "grad_norm": 0.404296875, | |
| "learning_rate": 5.2837263654653715e-06, | |
| "loss": 0.1559, | |
| "mean_token_accuracy": 0.9657112322747707, | |
| "num_tokens": 2073815.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.9205988571047783, | |
| "epoch": 0.52, | |
| "grad_norm": 0.373046875, | |
| "learning_rate": 5.189207383588353e-06, | |
| "loss": 0.1183, | |
| "mean_token_accuracy": 0.9595021493732929, | |
| "num_tokens": 2094140.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 0.8038613423705101, | |
| "epoch": 0.5257142857142857, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 5.094620636205096e-06, | |
| "loss": 0.0705, | |
| "mean_token_accuracy": 0.9323722533881664, | |
| "num_tokens": 2119725.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 0.8465629853308201, | |
| "epoch": 0.5314285714285715, | |
| "grad_norm": 0.33203125, | |
| "learning_rate": 5e-06, | |
| "loss": 0.0788, | |
| "mean_token_accuracy": 0.9482800886034966, | |
| "num_tokens": 2140739.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 0.8711249753832817, | |
| "epoch": 0.5371428571428571, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 4.905379363794907e-06, | |
| "loss": 0.0661, | |
| "mean_token_accuracy": 0.9701907262206078, | |
| "num_tokens": 2165915.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 0.8372658789157867, | |
| "epoch": 0.5428571428571428, | |
| "grad_norm": 0.49609375, | |
| "learning_rate": 4.81079261641165e-06, | |
| "loss": 0.2275, | |
| "mean_token_accuracy": 0.9530695639550686, | |
| "num_tokens": 2190737.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 0.852743711322546, | |
| "epoch": 0.5485714285714286, | |
| "grad_norm": 0.291015625, | |
| "learning_rate": 4.71627363453463e-06, | |
| "loss": 0.0795, | |
| "mean_token_accuracy": 0.954478558152914, | |
| "num_tokens": 2215151.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 0.8570697363466024, | |
| "epoch": 0.5542857142857143, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 4.6218562705777185e-06, | |
| "loss": 0.2531, | |
| "mean_token_accuracy": 0.9405127912759781, | |
| "num_tokens": 2235956.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 0.9492372311651707, | |
| "epoch": 0.56, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.527574340559844e-06, | |
| "loss": 0.4012, | |
| "mean_token_accuracy": 0.9081198573112488, | |
| "num_tokens": 2255596.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 0.8674456924200058, | |
| "epoch": 0.5657142857142857, | |
| "grad_norm": 0.28515625, | |
| "learning_rate": 4.4334616119936516e-06, | |
| "loss": 0.1056, | |
| "mean_token_accuracy": 0.9499292522668839, | |
| "num_tokens": 2278085.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 0.830165795981884, | |
| "epoch": 0.5714285714285714, | |
| "grad_norm": 0.390625, | |
| "learning_rate": 4.33955179179149e-06, | |
| "loss": 0.2439, | |
| "mean_token_accuracy": 0.9636958874762058, | |
| "num_tokens": 2306986.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.8232245780527592, | |
| "epoch": 0.5771428571428572, | |
| "grad_norm": 0.404296875, | |
| "learning_rate": 4.245878514193131e-06, | |
| "loss": 0.2359, | |
| "mean_token_accuracy": 0.9303237311542034, | |
| "num_tokens": 2329681.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 0.8297377564013004, | |
| "epoch": 0.5828571428571429, | |
| "grad_norm": 0.5703125, | |
| "learning_rate": 4.152475328719517e-06, | |
| "loss": 0.3075, | |
| "mean_token_accuracy": 0.9233161471784115, | |
| "num_tokens": 2354228.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 0.7650180887430906, | |
| "epoch": 0.5885714285714285, | |
| "grad_norm": 0.33203125, | |
| "learning_rate": 4.059375688156833e-06, | |
| "loss": 0.1562, | |
| "mean_token_accuracy": 0.9361786916851997, | |
| "num_tokens": 2385307.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 0.9238808788359165, | |
| "epoch": 0.5942857142857143, | |
| "grad_norm": 0.337890625, | |
| "learning_rate": 3.966612936575235e-06, | |
| "loss": 0.1913, | |
| "mean_token_accuracy": 0.943382054567337, | |
| "num_tokens": 2406416.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 0.8188824839890003, | |
| "epoch": 0.6, | |
| "grad_norm": 0.625, | |
| "learning_rate": 3.87422029738653e-06, | |
| "loss": 0.3352, | |
| "mean_token_accuracy": 0.9394205138087273, | |
| "num_tokens": 2430896.0, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "eval_entropy": 0.8769993405789137, | |
| "eval_loss": 0.29554080963134766, | |
| "eval_mean_token_accuracy": 0.9284648544341326, | |
| "eval_num_tokens": 2430896.0, | |
| "eval_runtime": 92.2684, | |
| "eval_samples_per_second": 4.335, | |
| "eval_steps_per_second": 4.335, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 0.7958486191928387, | |
| "epoch": 0.6057142857142858, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 3.782230861445041e-06, | |
| "loss": 0.1744, | |
| "mean_token_accuracy": 0.9372597932815552, | |
| "num_tokens": 2455348.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 0.8819582648575306, | |
| "epoch": 0.6114285714285714, | |
| "grad_norm": 0.396484375, | |
| "learning_rate": 3.6906775751959667e-06, | |
| "loss": 0.2265, | |
| "mean_token_accuracy": 0.94641899690032, | |
| "num_tokens": 2477983.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 0.8169359490275383, | |
| "epoch": 0.6171428571428571, | |
| "grad_norm": 0.24609375, | |
| "learning_rate": 3.5995932288754655e-06, | |
| "loss": 0.0609, | |
| "mean_token_accuracy": 0.9687152951955795, | |
| "num_tokens": 2507481.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 0.8248496986925602, | |
| "epoch": 0.6228571428571429, | |
| "grad_norm": 0.376953125, | |
| "learning_rate": 3.509010444766674e-06, | |
| "loss": 0.1682, | |
| "mean_token_accuracy": 0.9509099498391151, | |
| "num_tokens": 2535270.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 0.8315382190048695, | |
| "epoch": 0.6285714285714286, | |
| "grad_norm": 0.220703125, | |
| "learning_rate": 3.4189616655158803e-06, | |
| "loss": 0.0472, | |
| "mean_token_accuracy": 0.9836984872817993, | |
| "num_tokens": 2557838.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.8726284876465797, | |
| "epoch": 0.6342857142857142, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 3.3294791425130512e-06, | |
| "loss": 0.4566, | |
| "mean_token_accuracy": 0.928321436047554, | |
| "num_tokens": 2578074.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 0.8420686684548855, | |
| "epoch": 0.64, | |
| "grad_norm": 0.36328125, | |
| "learning_rate": 3.240594924340835e-06, | |
| "loss": 0.2126, | |
| "mean_token_accuracy": 0.9412459097802639, | |
| "num_tokens": 2602045.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 0.8329183645546436, | |
| "epoch": 0.6457142857142857, | |
| "grad_norm": 0.466796875, | |
| "learning_rate": 3.1523408452962156e-06, | |
| "loss": 0.2633, | |
| "mean_token_accuracy": 0.8766915369778872, | |
| "num_tokens": 2627102.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 0.9313436187803745, | |
| "epoch": 0.6514285714285715, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 3.0647485139889145e-06, | |
| "loss": 0.6254, | |
| "mean_token_accuracy": 0.9516336657106876, | |
| "num_tokens": 2645394.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 0.7338366992771626, | |
| "epoch": 0.6571428571428571, | |
| "grad_norm": 0.08203125, | |
| "learning_rate": 2.9778493020206155e-06, | |
| "loss": 0.0284, | |
| "mean_token_accuracy": 0.9934831894934177, | |
| "num_tokens": 2676753.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 0.8697643727064133, | |
| "epoch": 0.6628571428571428, | |
| "grad_norm": 0.1796875, | |
| "learning_rate": 2.89167433274908e-06, | |
| "loss": 0.0259, | |
| "mean_token_accuracy": 0.9898367673158646, | |
| "num_tokens": 2699287.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 0.9010032936930656, | |
| "epoch": 0.6685714285714286, | |
| "grad_norm": 0.380859375, | |
| "learning_rate": 2.806254470141174e-06, | |
| "loss": 0.0833, | |
| "mean_token_accuracy": 0.9675994291901588, | |
| "num_tokens": 2717961.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 0.8322379067540169, | |
| "epoch": 0.6742857142857143, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 2.721620307718793e-06, | |
| "loss": 0.291, | |
| "mean_token_accuracy": 0.9172481000423431, | |
| "num_tokens": 2737566.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 0.8995933551341295, | |
| "epoch": 0.68, | |
| "grad_norm": 0.294921875, | |
| "learning_rate": 2.6378021576016467e-06, | |
| "loss": 0.0553, | |
| "mean_token_accuracy": 0.9801531247794628, | |
| "num_tokens": 2757255.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 0.9271344300359488, | |
| "epoch": 0.6857142857142857, | |
| "grad_norm": 0.408203125, | |
| "learning_rate": 2.554830039650834e-06, | |
| "loss": 0.1783, | |
| "mean_token_accuracy": 0.9709099903702736, | |
| "num_tokens": 2780854.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.8354959785938263, | |
| "epoch": 0.6914285714285714, | |
| "grad_norm": 0.2294921875, | |
| "learning_rate": 2.4727336707170973e-06, | |
| "loss": 0.0792, | |
| "mean_token_accuracy": 0.9483233764767647, | |
| "num_tokens": 2798499.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 0.8634845986962318, | |
| "epoch": 0.6971428571428572, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 2.391542453997578e-06, | |
| "loss": 0.3701, | |
| "mean_token_accuracy": 0.92283009365201, | |
| "num_tokens": 2819541.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 0.86484663374722, | |
| "epoch": 0.7028571428571428, | |
| "grad_norm": 0.236328125, | |
| "learning_rate": 2.3112854685049397e-06, | |
| "loss": 0.0666, | |
| "mean_token_accuracy": 0.9604465216398239, | |
| "num_tokens": 2841267.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 0.7959853485226631, | |
| "epoch": 0.7085714285714285, | |
| "grad_norm": 0.40625, | |
| "learning_rate": 2.2319914586525776e-06, | |
| "loss": 0.2689, | |
| "mean_token_accuracy": 0.902481097728014, | |
| "num_tokens": 2864290.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 0.8018485866487026, | |
| "epoch": 0.7142857142857143, | |
| "grad_norm": 0.396484375, | |
| "learning_rate": 2.1536888239596714e-06, | |
| "loss": 0.1782, | |
| "mean_token_accuracy": 0.9672268815338612, | |
| "num_tokens": 2893566.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 0.9180811122059822, | |
| "epoch": 0.72, | |
| "grad_norm": 0.333984375, | |
| "learning_rate": 2.0764056088797646e-06, | |
| "loss": 0.2034, | |
| "mean_token_accuracy": 0.9149210341274738, | |
| "num_tokens": 2915934.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 0.791705853305757, | |
| "epoch": 0.7257142857142858, | |
| "grad_norm": 0.38671875, | |
| "learning_rate": 2.000169492756523e-06, | |
| "loss": 0.2103, | |
| "mean_token_accuracy": 0.9592764638364315, | |
| "num_tokens": 2938796.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 0.8573960512876511, | |
| "epoch": 0.7314285714285714, | |
| "grad_norm": 0.4765625, | |
| "learning_rate": 1.9250077799102323e-06, | |
| "loss": 0.2499, | |
| "mean_token_accuracy": 0.9304524399340153, | |
| "num_tokens": 2959725.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 0.7847526092082262, | |
| "epoch": 0.7371428571428571, | |
| "grad_norm": 0.4296875, | |
| "learning_rate": 1.8509473898586432e-06, | |
| "loss": 0.272, | |
| "mean_token_accuracy": 0.9468899220228195, | |
| "num_tokens": 2986539.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 0.7972419206053019, | |
| "epoch": 0.7428571428571429, | |
| "grad_norm": 0.57421875, | |
| "learning_rate": 1.7780148476756148e-06, | |
| "loss": 0.2415, | |
| "mean_token_accuracy": 0.9312585778534412, | |
| "num_tokens": 3008033.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.9854478649795055, | |
| "epoch": 0.7485714285714286, | |
| "grad_norm": 0.2109375, | |
| "learning_rate": 1.7062362744910321e-06, | |
| "loss": 0.0378, | |
| "mean_token_accuracy": 0.9740675985813141, | |
| "num_tokens": 3022847.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.8525507673621178, | |
| "epoch": 0.7542857142857143, | |
| "grad_norm": 0.1787109375, | |
| "learning_rate": 1.6356373781354058e-06, | |
| "loss": 0.0312, | |
| "mean_token_accuracy": 0.9881799481809139, | |
| "num_tokens": 3044199.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 0.8705133143812418, | |
| "epoch": 0.76, | |
| "grad_norm": 0.52734375, | |
| "learning_rate": 1.566243443932496e-06, | |
| "loss": 0.3131, | |
| "mean_token_accuracy": 0.9179901443421841, | |
| "num_tokens": 3066790.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 0.9212304092943668, | |
| "epoch": 0.7657142857142857, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 1.4980793256432474e-06, | |
| "loss": 0.462, | |
| "mean_token_accuracy": 0.9063639305531979, | |
| "num_tokens": 3087500.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 0.8802409656345844, | |
| "epoch": 0.7714285714285715, | |
| "grad_norm": 0.419921875, | |
| "learning_rate": 1.4311694365643048e-06, | |
| "loss": 0.146, | |
| "mean_token_accuracy": 0.9382250271737576, | |
| "num_tokens": 3107519.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 0.9647825062274933, | |
| "epoch": 0.7771428571428571, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 1.3655377407842813e-06, | |
| "loss": 0.404, | |
| "mean_token_accuracy": 0.9323740191757679, | |
| "num_tokens": 3126461.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 0.8492281846702099, | |
| "epoch": 0.7828571428571428, | |
| "grad_norm": 0.484375, | |
| "learning_rate": 1.3012077446008969e-06, | |
| "loss": 0.2494, | |
| "mean_token_accuracy": 0.919997077435255, | |
| "num_tokens": 3153010.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 0.8203707411885262, | |
| "epoch": 0.7885714285714286, | |
| "grad_norm": 0.1865234375, | |
| "learning_rate": 1.2382024881020937e-06, | |
| "loss": 0.0568, | |
| "mean_token_accuracy": 0.9940986521542072, | |
| "num_tokens": 3181545.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.8615991920232773, | |
| "epoch": 0.7942857142857143, | |
| "grad_norm": 0.291015625, | |
| "learning_rate": 1.1765445369141276e-06, | |
| "loss": 0.1005, | |
| "mean_token_accuracy": 0.9564622417092323, | |
| "num_tokens": 3207389.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 0.9613388143479824, | |
| "epoch": 0.8, | |
| "grad_norm": 0.2734375, | |
| "learning_rate": 1.1162559741195733e-06, | |
| "loss": 0.032, | |
| "mean_token_accuracy": 0.9898938909173012, | |
| "num_tokens": 3227144.0, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_entropy": 0.8764541779458522, | |
| "eval_loss": 0.2953108847141266, | |
| "eval_mean_token_accuracy": 0.9284577775746584, | |
| "eval_num_tokens": 3227144.0, | |
| "eval_runtime": 91.8643, | |
| "eval_samples_per_second": 4.354, | |
| "eval_steps_per_second": 4.354, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.9436263218522072, | |
| "epoch": 0.8057142857142857, | |
| "grad_norm": 0.453125, | |
| "learning_rate": 1.057358392348171e-06, | |
| "loss": 0.2514, | |
| "mean_token_accuracy": 0.9310437515377998, | |
| "num_tokens": 3247750.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.8511663135141134, | |
| "epoch": 0.8114285714285714, | |
| "grad_norm": 0.330078125, | |
| "learning_rate": 9.998728860433277e-07, | |
| "loss": 0.1464, | |
| "mean_token_accuracy": 0.9337452948093414, | |
| "num_tokens": 3278158.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.8985432125627995, | |
| "epoch": 0.8171428571428572, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 9.438200439070388e-07, | |
| "loss": 0.3484, | |
| "mean_token_accuracy": 0.9249872528016567, | |
| "num_tokens": 3297566.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 0.8434502705931664, | |
| "epoch": 0.8228571428571428, | |
| "grad_norm": 0.1611328125, | |
| "learning_rate": 8.892199415259501e-07, | |
| "loss": 0.0588, | |
| "mean_token_accuracy": 0.9789597801864147, | |
| "num_tokens": 3321048.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 0.7833346650004387, | |
| "epoch": 0.8285714285714286, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 8.360921341811956e-07, | |
| "loss": 0.2072, | |
| "mean_token_accuracy": 0.9664384685456753, | |
| "num_tokens": 3348746.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.8700702637434006, | |
| "epoch": 0.8342857142857143, | |
| "grad_norm": 0.33203125, | |
| "learning_rate": 7.844556498445788e-07, | |
| "loss": 0.0734, | |
| "mean_token_accuracy": 0.9684953950345516, | |
| "num_tokens": 3375740.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 0.7348683997988701, | |
| "epoch": 0.84, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 7.343289823636168e-07, | |
| "loss": 0.2837, | |
| "mean_token_accuracy": 0.957360677421093, | |
| "num_tokens": 3400641.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.9618206657469273, | |
| "epoch": 0.8457142857142858, | |
| "grad_norm": 0.322265625, | |
| "learning_rate": 6.857300848378857e-07, | |
| "loss": 0.1192, | |
| "mean_token_accuracy": 0.9487035945057869, | |
| "num_tokens": 3419359.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.7841342575848103, | |
| "epoch": 0.8514285714285714, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 6.386763631890313e-07, | |
| "loss": 0.2124, | |
| "mean_token_accuracy": 0.9248572364449501, | |
| "num_tokens": 3443856.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 0.826301820576191, | |
| "epoch": 0.8571428571428571, | |
| "grad_norm": 0.22265625, | |
| "learning_rate": 5.931846699267558e-07, | |
| "loss": 0.0611, | |
| "mean_token_accuracy": 0.9684226177632809, | |
| "num_tokens": 3465048.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.8140004500746727, | |
| "epoch": 0.8628571428571429, | |
| "grad_norm": 0.490234375, | |
| "learning_rate": 5.492712981130171e-07, | |
| "loss": 0.2893, | |
| "mean_token_accuracy": 0.9164738897234201, | |
| "num_tokens": 3488250.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.9298283979296684, | |
| "epoch": 0.8685714285714285, | |
| "grad_norm": 0.431640625, | |
| "learning_rate": 5.0695197552659e-07, | |
| "loss": 0.203, | |
| "mean_token_accuracy": 0.9512322805821896, | |
| "num_tokens": 3507381.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 0.9326702170073986, | |
| "epoch": 0.8742857142857143, | |
| "grad_norm": 0.3984375, | |
| "learning_rate": 4.6624185903008713e-07, | |
| "loss": 0.1791, | |
| "mean_token_accuracy": 0.9534324109554291, | |
| "num_tokens": 3526862.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 0.884672824293375, | |
| "epoch": 0.88, | |
| "grad_norm": 0.265625, | |
| "learning_rate": 4.271555291414636e-07, | |
| "loss": 0.0939, | |
| "mean_token_accuracy": 0.9811095856130123, | |
| "num_tokens": 3548347.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.9188402555882931, | |
| "epoch": 0.8857142857142857, | |
| "grad_norm": 0.435546875, | |
| "learning_rate": 3.8970698481193225e-07, | |
| "loss": 0.1395, | |
| "mean_token_accuracy": 0.9461647681891918, | |
| "num_tokens": 3576901.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 0.8714124243706465, | |
| "epoch": 0.8914285714285715, | |
| "grad_norm": 0.361328125, | |
| "learning_rate": 3.539096384121743e-07, | |
| "loss": 0.1468, | |
| "mean_token_accuracy": 0.9493271261453629, | |
| "num_tokens": 3599612.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 0.9496984779834747, | |
| "epoch": 0.8971428571428571, | |
| "grad_norm": 0.5390625, | |
| "learning_rate": 3.1977631092863613e-07, | |
| "loss": 0.2511, | |
| "mean_token_accuracy": 0.9505422003567219, | |
| "num_tokens": 3617034.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 0.8597098160535097, | |
| "epoch": 0.9028571428571428, | |
| "grad_norm": 0.5546875, | |
| "learning_rate": 2.873192273716369e-07, | |
| "loss": 0.2373, | |
| "mean_token_accuracy": 0.9237680397927761, | |
| "num_tokens": 3638314.0, | |
| "step": 158 | |
| }, | |
| { | |
| "entropy": 0.9527708999812603, | |
| "epoch": 0.9085714285714286, | |
| "grad_norm": 0.50390625, | |
| "learning_rate": 2.5655001239691836e-07, | |
| "loss": 0.4676, | |
| "mean_token_accuracy": 0.8877900540828705, | |
| "num_tokens": 3657174.0, | |
| "step": 159 | |
| }, | |
| { | |
| "entropy": 0.8717995695769787, | |
| "epoch": 0.9142857142857143, | |
| "grad_norm": 0.30078125, | |
| "learning_rate": 2.274796861422246e-07, | |
| "loss": 0.1154, | |
| "mean_token_accuracy": 0.9691611863672733, | |
| "num_tokens": 3680533.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.9644824899733067, | |
| "epoch": 0.92, | |
| "grad_norm": 0.490234375, | |
| "learning_rate": 2.0011866028038617e-07, | |
| "loss": 0.3064, | |
| "mean_token_accuracy": 0.9448754377663136, | |
| "num_tokens": 3699327.0, | |
| "step": 161 | |
| }, | |
| { | |
| "entropy": 0.9328950606286526, | |
| "epoch": 0.9257142857142857, | |
| "grad_norm": 0.451171875, | |
| "learning_rate": 1.7447673429033361e-07, | |
| "loss": 0.2076, | |
| "mean_token_accuracy": 0.9191295467317104, | |
| "num_tokens": 3715091.0, | |
| "step": 162 | |
| }, | |
| { | |
| "entropy": 0.8879067096859217, | |
| "epoch": 0.9314285714285714, | |
| "grad_norm": 0.337890625, | |
| "learning_rate": 1.5056309194736385e-07, | |
| "loss": 0.1653, | |
| "mean_token_accuracy": 0.9486363902688026, | |
| "num_tokens": 3743127.0, | |
| "step": 163 | |
| }, | |
| { | |
| "entropy": 0.894222728908062, | |
| "epoch": 0.9371428571428572, | |
| "grad_norm": 0.359375, | |
| "learning_rate": 1.2838629803393343e-07, | |
| "loss": 0.1275, | |
| "mean_token_accuracy": 0.946167778223753, | |
| "num_tokens": 3762752.0, | |
| "step": 164 | |
| }, | |
| { | |
| "entropy": 0.9304006136953831, | |
| "epoch": 0.9428571428571428, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 1.0795429527213685e-07, | |
| "loss": 0.3773, | |
| "mean_token_accuracy": 0.9494738765060902, | |
| "num_tokens": 3782981.0, | |
| "step": 165 | |
| }, | |
| { | |
| "entropy": 0.8676423355937004, | |
| "epoch": 0.9485714285714286, | |
| "grad_norm": 0.32421875, | |
| "learning_rate": 8.927440147898703e-08, | |
| "loss": 0.1509, | |
| "mean_token_accuracy": 0.9403471313416958, | |
| "num_tokens": 3806706.0, | |
| "step": 166 | |
| }, | |
| { | |
| "entropy": 0.9638898521661758, | |
| "epoch": 0.9542857142857143, | |
| "grad_norm": 0.470703125, | |
| "learning_rate": 7.235330694550402e-08, | |
| "loss": 0.1, | |
| "mean_token_accuracy": 0.9673289954662323, | |
| "num_tokens": 3825999.0, | |
| "step": 167 | |
| }, | |
| { | |
| "entropy": 0.8009177055209875, | |
| "epoch": 0.96, | |
| "grad_norm": 0.2109375, | |
| "learning_rate": 5.7197072040557356e-08, | |
| "loss": 0.0312, | |
| "mean_token_accuracy": 0.9841561615467072, | |
| "num_tokens": 3848460.0, | |
| "step": 168 | |
| }, | |
| { | |
| "entropy": 0.8380727805197239, | |
| "epoch": 0.9657142857142857, | |
| "grad_norm": 0.466796875, | |
| "learning_rate": 4.381112504031337e-08, | |
| "loss": 0.2418, | |
| "mean_token_accuracy": 0.933722235262394, | |
| "num_tokens": 3872166.0, | |
| "step": 169 | |
| }, | |
| { | |
| "entropy": 0.941684365272522, | |
| "epoch": 0.9714285714285714, | |
| "grad_norm": 0.45703125, | |
| "learning_rate": 3.220026018407541e-08, | |
| "loss": 0.1822, | |
| "mean_token_accuracy": 0.9650504402816296, | |
| "num_tokens": 3890730.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.9139348827302456, | |
| "epoch": 0.9771428571428571, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 2.236863595720562e-08, | |
| "loss": 0.3801, | |
| "mean_token_accuracy": 0.9626536183059216, | |
| "num_tokens": 3913632.0, | |
| "step": 171 | |
| }, | |
| { | |
| "entropy": 0.8308483064174652, | |
| "epoch": 0.9828571428571429, | |
| "grad_norm": 0.3203125, | |
| "learning_rate": 1.431977360173975e-08, | |
| "loss": 0.1153, | |
| "mean_token_accuracy": 0.9826219528913498, | |
| "num_tokens": 3941084.0, | |
| "step": 172 | |
| }, | |
| { | |
| "entropy": 0.8064244762063026, | |
| "epoch": 0.9885714285714285, | |
| "grad_norm": 0.41796875, | |
| "learning_rate": 8.056555855243675e-09, | |
| "loss": 0.1146, | |
| "mean_token_accuracy": 0.9666525050997734, | |
| "num_tokens": 3966629.0, | |
| "step": 173 | |
| }, | |
| { | |
| "entropy": 0.8301513195037842, | |
| "epoch": 0.9942857142857143, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 3.5812259183426457e-09, | |
| "loss": 0.499, | |
| "mean_token_accuracy": 0.8793967552483082, | |
| "num_tokens": 3990275.0, | |
| "step": 174 | |
| }, | |
| { | |
| "entropy": 0.9384108036756516, | |
| "epoch": 1.0, | |
| "grad_norm": 0.322265625, | |
| "learning_rate": 8.953866513111698e-10, | |
| "loss": 0.193, | |
| "mean_token_accuracy": 0.9713231772184372, | |
| "num_tokens": 4009115.0, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_entropy": 0.8765361993014813, | |
| "eval_loss": 0.2955912947654724, | |
| "eval_mean_token_accuracy": 0.9287241496890783, | |
| "eval_num_tokens": 4009115.0, | |
| "eval_runtime": 91.0144, | |
| "eval_samples_per_second": 4.395, | |
| "eval_steps_per_second": 4.395, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "step": 175, | |
| "total_flos": 1.8415547714724864e+17, | |
| "train_loss": 0.2099171816344772, | |
| "train_runtime": 2968.5511, | |
| "train_samples_per_second": 0.943, | |
| "train_steps_per_second": 0.059 | |
| } | |
| ], | |
| "trial_params": null, | |
| "global_step": 175, | |
| "is_local_process_zero": true, | |
| "total_flos": 1.8415547714724864e+17, | |
| "num_train_epochs": 1, | |
| "epoch": 1.0, | |
| "best_metric": null, | |
| "trial_name": null | |
| } | |