Instructions to use FluffyAIcode/Kakeya-OProver-Stage2-SFT1000 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FluffyAIcode/Kakeya-OProver-Stage2-SFT1000 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("m-a-p/OProver-8B") model = PeftModel.from_pretrained(base_model, "FluffyAIcode/Kakeya-OProver-Stage2-SFT1000") - Notebooks
- Google Colab
- Kaggle
| { | |
| "max_steps": 88, | |
| "save_steps": 22, | |
| "is_world_process_zero": true, | |
| "train_batch_size": 1, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "is_hyper_param_search": false, | |
| "num_input_tokens_seen": 0, | |
| "log_history": [ | |
| { | |
| "entropy": 0.571594450622797, | |
| "epoch": 0.022857142857142857, | |
| "grad_norm": 2.03125, | |
| "learning_rate": 0.0, | |
| "loss": 1.892868161201477, | |
| "mean_token_accuracy": 0.6494692210108042, | |
| "num_tokens": 28665.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 0.5400022976100445, | |
| "epoch": 0.045714285714285714, | |
| "grad_norm": 1.953125, | |
| "learning_rate": 5e-05, | |
| "loss": 1.3431090116500854, | |
| "mean_token_accuracy": 0.6841957792639732, | |
| "num_tokens": 56298.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 0.5547708570957184, | |
| "epoch": 0.06857142857142857, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 0.0001, | |
| "loss": 1.7731074094772339, | |
| "mean_token_accuracy": 0.6730335894972086, | |
| "num_tokens": 87134.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 0.6138171833008528, | |
| "epoch": 0.09142857142857143, | |
| "grad_norm": 1.890625, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": 1.6849099397659302, | |
| "mean_token_accuracy": 0.7163603082299232, | |
| "num_tokens": 110491.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 0.713952723890543, | |
| "epoch": 0.11428571428571428, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 0.0002, | |
| "loss": 1.6369731426239014, | |
| "mean_token_accuracy": 0.6762979347258806, | |
| "num_tokens": 138858.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 0.9489956572651863, | |
| "epoch": 0.13714285714285715, | |
| "grad_norm": 1.609375, | |
| "learning_rate": 0.00019993007047883988, | |
| "loss": 1.6043992042541504, | |
| "mean_token_accuracy": 0.6542574372142553, | |
| "num_tokens": 164666.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.2052904553711414, | |
| "epoch": 0.16, | |
| "grad_norm": 2.046875, | |
| "learning_rate": 0.00019972037971811802, | |
| "loss": 1.1030031442642212, | |
| "mean_token_accuracy": 0.7115810438990593, | |
| "num_tokens": 198168.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.5162354111671448, | |
| "epoch": 0.18285714285714286, | |
| "grad_norm": 2.609375, | |
| "learning_rate": 0.00019937122098932428, | |
| "loss": 1.338626503944397, | |
| "mean_token_accuracy": 0.7028692364692688, | |
| "num_tokens": 229142.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.6831717118620872, | |
| "epoch": 0.2057142857142857, | |
| "grad_norm": 1.203125, | |
| "learning_rate": 0.00019888308262251285, | |
| "loss": 1.5491583347320557, | |
| "mean_token_accuracy": 0.669173551723361, | |
| "num_tokens": 257334.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.2227612249553204, | |
| "epoch": 0.22857142857142856, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 0.00019825664732332884, | |
| "loss": 1.0137903690338135, | |
| "mean_token_accuracy": 0.7204974591732025, | |
| "num_tokens": 286904.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.1638432145118713, | |
| "epoch": 0.25142857142857145, | |
| "grad_norm": 0.83984375, | |
| "learning_rate": 0.00019749279121818235, | |
| "loss": 1.0442439317703247, | |
| "mean_token_accuracy": 0.7225705273449421, | |
| "num_tokens": 313566.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.090791016817093, | |
| "epoch": 0.2742857142857143, | |
| "grad_norm": 0.75, | |
| "learning_rate": 0.00019659258262890683, | |
| "loss": 1.2202626466751099, | |
| "mean_token_accuracy": 0.6869607474654913, | |
| "num_tokens": 343912.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.100559327751398, | |
| "epoch": 0.29714285714285715, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 0.0001955572805786141, | |
| "loss": 1.4237300157546997, | |
| "mean_token_accuracy": 0.7026770114898682, | |
| "num_tokens": 367824.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.0772063918411732, | |
| "epoch": 0.32, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 0.00019438833303083678, | |
| "loss": 1.3612886667251587, | |
| "mean_token_accuracy": 0.7167600486427546, | |
| "num_tokens": 397629.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.0418964736163616, | |
| "epoch": 0.34285714285714286, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 0.00019308737486442045, | |
| "loss": 1.2377914190292358, | |
| "mean_token_accuracy": 0.7337369881570339, | |
| "num_tokens": 426172.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.02627420052886, | |
| "epoch": 0.3657142857142857, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 0.00019165622558699763, | |
| "loss": 1.043224811553955, | |
| "mean_token_accuracy": 0.757489874958992, | |
| "num_tokens": 455884.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.0985115952789783, | |
| "epoch": 0.38857142857142857, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 0.0001900968867902419, | |
| "loss": 1.0292891263961792, | |
| "mean_token_accuracy": 0.7834405265748501, | |
| "num_tokens": 479943.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 0.9926935620605946, | |
| "epoch": 0.4114285714285714, | |
| "grad_norm": 0.5234375, | |
| "learning_rate": 0.00018841153935046098, | |
| "loss": 1.0027269124984741, | |
| "mean_token_accuracy": 0.7445859499275684, | |
| "num_tokens": 512401.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.184921432286501, | |
| "epoch": 0.4342857142857143, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 0.00018660254037844388, | |
| "loss": 0.8860166072845459, | |
| "mean_token_accuracy": 0.7711772620677948, | |
| "num_tokens": 532314.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.0456415861845016, | |
| "epoch": 0.45714285714285713, | |
| "grad_norm": 0.578125, | |
| "learning_rate": 0.00018467241992282843, | |
| "loss": 0.821132242679596, | |
| "mean_token_accuracy": 0.7591653987765312, | |
| "num_tokens": 560611.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.0742540583014488, | |
| "epoch": 0.48, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 0.0001826238774315995, | |
| "loss": 1.1304452419281006, | |
| "mean_token_accuracy": 0.7381897754967213, | |
| "num_tokens": 582239.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.0069492012262344, | |
| "epoch": 0.5028571428571429, | |
| "grad_norm": 0.83203125, | |
| "learning_rate": 0.00018045977797666684, | |
| "loss": 1.0569063425064087, | |
| "mean_token_accuracy": 0.7475782930850983, | |
| "num_tokens": 605785.0, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.5028571428571429, | |
| "eval_entropy": 1.0555952689051629, | |
| "eval_loss": 1.0447686910629272, | |
| "eval_mean_token_accuracy": 0.75280682772398, | |
| "eval_num_tokens": 605785.0, | |
| "eval_runtime": 77.2364, | |
| "eval_samples_per_second": 1.295, | |
| "eval_steps_per_second": 1.295, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.0209653116762638, | |
| "epoch": 0.5257142857142857, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 0.000178183148246803, | |
| "loss": 0.9215176105499268, | |
| "mean_token_accuracy": 0.7393636666238308, | |
| "num_tokens": 630668.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.1484412215650082, | |
| "epoch": 0.5485714285714286, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 0.0001757971723145453, | |
| "loss": 1.0585880279541016, | |
| "mean_token_accuracy": 0.6772188358008862, | |
| "num_tokens": 651568.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.022590946406126, | |
| "epoch": 0.5714285714285714, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 0.00017330518718298264, | |
| "loss": 0.8019014596939087, | |
| "mean_token_accuracy": 0.7844364829361439, | |
| "num_tokens": 677010.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.1501350328326225, | |
| "epoch": 0.5942857142857143, | |
| "grad_norm": 0.578125, | |
| "learning_rate": 0.00017071067811865476, | |
| "loss": 1.1763538122177124, | |
| "mean_token_accuracy": 0.7165477126836777, | |
| "num_tokens": 699559.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.1520305536687374, | |
| "epoch": 0.6171428571428571, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 0.00016801727377709194, | |
| "loss": 1.3568904399871826, | |
| "mean_token_accuracy": 0.7278081495314837, | |
| "num_tokens": 723860.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.1409958936274052, | |
| "epoch": 0.64, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 0.00016522874112781213, | |
| "loss": 1.2788770198822021, | |
| "mean_token_accuracy": 0.688488058745861, | |
| "num_tokens": 743869.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.06721768155694, | |
| "epoch": 0.6628571428571428, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 0.00016234898018587337, | |
| "loss": 0.9878795742988586, | |
| "mean_token_accuracy": 0.7843082323670387, | |
| "num_tokens": 767668.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 0.9738106857985258, | |
| "epoch": 0.6857142857142857, | |
| "grad_norm": 0.578125, | |
| "learning_rate": 0.00015938201855735014, | |
| "loss": 0.7424539923667908, | |
| "mean_token_accuracy": 0.7907082177698612, | |
| "num_tokens": 796481.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.9771843180060387, | |
| "epoch": 0.7085714285714285, | |
| "grad_norm": 0.75, | |
| "learning_rate": 0.0001563320058063622, | |
| "loss": 0.9626051187515259, | |
| "mean_token_accuracy": 0.7523193173110485, | |
| "num_tokens": 829764.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.151510078459978, | |
| "epoch": 0.7314285714285714, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 0.00015320320765153367, | |
| "loss": 1.270058512687683, | |
| "mean_token_accuracy": 0.6807492543011904, | |
| "num_tokens": 855562.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 0.9595269281417131, | |
| "epoch": 0.7542857142857143, | |
| "grad_norm": 0.5625, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": 0.9262505173683167, | |
| "mean_token_accuracy": 0.7448003850877285, | |
| "num_tokens": 886448.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 0.9837835170328617, | |
| "epoch": 0.7771428571428571, | |
| "grad_norm": 0.82421875, | |
| "learning_rate": 0.0001467268628273062, | |
| "loss": 0.7896201014518738, | |
| "mean_token_accuracy": 0.7692355290055275, | |
| "num_tokens": 909179.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.0101780369877815, | |
| "epoch": 0.8, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 0.00014338837391175582, | |
| "loss": 1.1079224348068237, | |
| "mean_token_accuracy": 0.743992704898119, | |
| "num_tokens": 932293.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.124088928103447, | |
| "epoch": 0.8228571428571428, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 0.00013998920243197407, | |
| "loss": 1.2773886919021606, | |
| "mean_token_accuracy": 0.7306922785937786, | |
| "num_tokens": 953785.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.0273678377270699, | |
| "epoch": 0.8457142857142858, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 0.00013653410243663952, | |
| "loss": 1.0014641284942627, | |
| "mean_token_accuracy": 0.7343494817614555, | |
| "num_tokens": 983541.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.1427535712718964, | |
| "epoch": 0.8685714285714285, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 0.00013302790619551674, | |
| "loss": 1.1199904680252075, | |
| "mean_token_accuracy": 0.7464530095458031, | |
| "num_tokens": 1009431.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.1668125055730343, | |
| "epoch": 0.8914285714285715, | |
| "grad_norm": 0.6015625, | |
| "learning_rate": 0.00012947551744109043, | |
| "loss": 0.9645350575447083, | |
| "mean_token_accuracy": 0.780300073325634, | |
| "num_tokens": 1027701.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.1839856766164303, | |
| "epoch": 0.9142857142857143, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 0.00012588190451025207, | |
| "loss": 1.2035199403762817, | |
| "mean_token_accuracy": 0.7434030883014202, | |
| "num_tokens": 1055642.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.103015311062336, | |
| "epoch": 0.9371428571428572, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 0.00012225209339563145, | |
| "loss": 1.0058553218841553, | |
| "mean_token_accuracy": 0.7543482556939125, | |
| "num_tokens": 1084745.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.1135993152856827, | |
| "epoch": 0.96, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 0.00011859116071629149, | |
| "loss": 1.2151912450790405, | |
| "mean_token_accuracy": 0.7335421219468117, | |
| "num_tokens": 1110320.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.1436597369611263, | |
| "epoch": 0.9828571428571429, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 0.00011490422661761744, | |
| "loss": 1.0186842679977417, | |
| "mean_token_accuracy": 0.7390037253499031, | |
| "num_tokens": 1134964.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.078730583190918, | |
| "epoch": 1.0, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 0.00011119644761033078, | |
| "loss": 0.8101186752319336, | |
| "mean_token_accuracy": 0.7597745011250178, | |
| "num_tokens": 1153583.0, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_entropy": 1.0479114320874214, | |
| "eval_loss": 0.9729008674621582, | |
| "eval_mean_token_accuracy": 0.7565665817260743, | |
| "eval_num_tokens": 1153583.0, | |
| "eval_runtime": 77.2335, | |
| "eval_samples_per_second": 1.295, | |
| "eval_steps_per_second": 1.295, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.0368036814033985, | |
| "epoch": 1.022857142857143, | |
| "grad_norm": 0.56640625, | |
| "learning_rate": 0.00010747300935864243, | |
| "loss": 0.8468512296676636, | |
| "mean_token_accuracy": 0.8111352436244488, | |
| "num_tokens": 1174609.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 0.9628574140369892, | |
| "epoch": 1.0457142857142858, | |
| "grad_norm": 0.5546875, | |
| "learning_rate": 0.0001037391194276326, | |
| "loss": 0.5208293199539185, | |
| "mean_token_accuracy": 0.8187313564121723, | |
| "num_tokens": 1201897.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.0299121290445328, | |
| "epoch": 1.0685714285714285, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 0.0001, | |
| "loss": 0.7912545204162598, | |
| "mean_token_accuracy": 0.7928437106311321, | |
| "num_tokens": 1230046.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.0342555530369282, | |
| "epoch": 1.0914285714285714, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 9.626088057236745e-05, | |
| "loss": 0.9557701349258423, | |
| "mean_token_accuracy": 0.7545025758445263, | |
| "num_tokens": 1257406.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 0.9161418825387955, | |
| "epoch": 1.1142857142857143, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 9.252699064135758e-05, | |
| "loss": 1.0390901565551758, | |
| "mean_token_accuracy": 0.7715597599744797, | |
| "num_tokens": 1291055.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 0.8812923058867455, | |
| "epoch": 1.1371428571428572, | |
| "grad_norm": 0.625, | |
| "learning_rate": 8.880355238966923e-05, | |
| "loss": 0.6828033328056335, | |
| "mean_token_accuracy": 0.8140444047749043, | |
| "num_tokens": 1318257.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.0039622746407986, | |
| "epoch": 1.16, | |
| "grad_norm": 0.546875, | |
| "learning_rate": 8.509577338238255e-05, | |
| "loss": 0.7247803807258606, | |
| "mean_token_accuracy": 0.7645618040114641, | |
| "num_tokens": 1341106.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 0.905966442078352, | |
| "epoch": 1.1828571428571428, | |
| "grad_norm": 0.5625, | |
| "learning_rate": 8.140883928370855e-05, | |
| "loss": 0.7403977513313293, | |
| "mean_token_accuracy": 0.8016074895858765, | |
| "num_tokens": 1369760.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 0.9338806178420782, | |
| "epoch": 1.2057142857142857, | |
| "grad_norm": 0.490234375, | |
| "learning_rate": 7.774790660436858e-05, | |
| "loss": 0.6406869888305664, | |
| "mean_token_accuracy": 0.7956290915608406, | |
| "num_tokens": 1392567.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 0.8846337422728539, | |
| "epoch": 1.2285714285714286, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 7.411809548974792e-05, | |
| "loss": 0.8057032823562622, | |
| "mean_token_accuracy": 0.7973924726247787, | |
| "num_tokens": 1419324.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 0.9206812232732773, | |
| "epoch": 1.2514285714285713, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 7.052448255890957e-05, | |
| "loss": 0.6728847026824951, | |
| "mean_token_accuracy": 0.8473470285534859, | |
| "num_tokens": 1446756.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 0.9307001233100891, | |
| "epoch": 1.2742857142857142, | |
| "grad_norm": 0.8515625, | |
| "learning_rate": 6.697209380448333e-05, | |
| "loss": 0.7187720537185669, | |
| "mean_token_accuracy": 0.8393540307879448, | |
| "num_tokens": 1468062.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 0.8503624759614468, | |
| "epoch": 1.2971428571428572, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 6.34658975633605e-05, | |
| "loss": 0.6491850018501282, | |
| "mean_token_accuracy": 0.834420669823885, | |
| "num_tokens": 1497763.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 0.8430384919047356, | |
| "epoch": 1.32, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 6.001079756802592e-05, | |
| "loss": 0.7592802047729492, | |
| "mean_token_accuracy": 0.7834662459790707, | |
| "num_tokens": 1523103.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.0481715574860573, | |
| "epoch": 1.342857142857143, | |
| "grad_norm": 1.15625, | |
| "learning_rate": 5.6611626088244194e-05, | |
| "loss": 0.8737943768501282, | |
| "mean_token_accuracy": 0.7567208111286163, | |
| "num_tokens": 1540582.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 0.849721547216177, | |
| "epoch": 1.3657142857142857, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 5.32731371726938e-05, | |
| "loss": 0.7518897652626038, | |
| "mean_token_accuracy": 0.8164225146174431, | |
| "num_tokens": 1562096.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.7319265194237232, | |
| "epoch": 1.3885714285714286, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 5.000000000000002e-05, | |
| "loss": 0.5088726282119751, | |
| "mean_token_accuracy": 0.8368714712560177, | |
| "num_tokens": 1588869.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 0.7714136429131031, | |
| "epoch": 1.4114285714285715, | |
| "grad_norm": 0.515625, | |
| "learning_rate": 4.6796792348466356e-05, | |
| "loss": 0.5990605354309082, | |
| "mean_token_accuracy": 0.8109956867992878, | |
| "num_tokens": 1618753.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 0.8922704569995403, | |
| "epoch": 1.4342857142857142, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 4.3667994193637796e-05, | |
| "loss": 0.7471989393234253, | |
| "mean_token_accuracy": 0.8137485198676586, | |
| "num_tokens": 1639035.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 0.8474112637341022, | |
| "epoch": 1.457142857142857, | |
| "grad_norm": 0.9375, | |
| "learning_rate": 4.0617981442649855e-05, | |
| "loss": 0.9250304102897644, | |
| "mean_token_accuracy": 0.7889886423945427, | |
| "num_tokens": 1667695.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 0.8302664868533611, | |
| "epoch": 1.48, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 3.7651019814126654e-05, | |
| "loss": 0.9558159112930298, | |
| "mean_token_accuracy": 0.7763096019625664, | |
| "num_tokens": 1691022.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 0.8031172640621662, | |
| "epoch": 1.502857142857143, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 3.477125887218792e-05, | |
| "loss": 0.801313042640686, | |
| "mean_token_accuracy": 0.8177301362156868, | |
| "num_tokens": 1724435.0, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 1.502857142857143, | |
| "eval_entropy": 0.8457768812775612, | |
| "eval_loss": 0.9875430464744568, | |
| "eval_mean_token_accuracy": 0.756916128396988, | |
| "eval_num_tokens": 1724435.0, | |
| "eval_runtime": 77.2316, | |
| "eval_samples_per_second": 1.295, | |
| "eval_steps_per_second": 1.295, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 0.841597568243742, | |
| "epoch": 1.5257142857142858, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 3.198272622290804e-05, | |
| "loss": 0.8447511196136475, | |
| "mean_token_accuracy": 0.7982683703303337, | |
| "num_tokens": 1752489.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 0.873002614825964, | |
| "epoch": 1.5485714285714285, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 2.9289321881345254e-05, | |
| "loss": 0.8038796782493591, | |
| "mean_token_accuracy": 0.8067350275814533, | |
| "num_tokens": 1784291.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 0.9177370071411133, | |
| "epoch": 1.5714285714285714, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 2.669481281701739e-05, | |
| "loss": 0.8557254672050476, | |
| "mean_token_accuracy": 0.8137136548757553, | |
| "num_tokens": 1804179.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 0.8276135660707951, | |
| "epoch": 1.5942857142857143, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.420282768545469e-05, | |
| "loss": 0.6800186634063721, | |
| "mean_token_accuracy": 0.8346021547913551, | |
| "num_tokens": 1831612.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.9364416636526585, | |
| "epoch": 1.617142857142857, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 2.181685175319702e-05, | |
| "loss": 0.7834956049919128, | |
| "mean_token_accuracy": 0.7997728437185287, | |
| "num_tokens": 1853595.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 0.8710121884942055, | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 1.9540222023333166e-05, | |
| "loss": 0.6057661771774292, | |
| "mean_token_accuracy": 0.8205794207751751, | |
| "num_tokens": 1882408.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 0.8379442691802979, | |
| "epoch": 1.6628571428571428, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 1.7376122568400532e-05, | |
| "loss": 0.7106757760047913, | |
| "mean_token_accuracy": 0.8180459216237068, | |
| "num_tokens": 1904944.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 0.8745108097791672, | |
| "epoch": 1.6857142857142857, | |
| "grad_norm": 1.2109375, | |
| "learning_rate": 1.5327580077171587e-05, | |
| "loss": 0.9369223713874817, | |
| "mean_token_accuracy": 0.8044208958745003, | |
| "num_tokens": 1933402.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 0.8298410475254059, | |
| "epoch": 1.7085714285714286, | |
| "grad_norm": 0.8828125, | |
| "learning_rate": 1.339745962155613e-05, | |
| "loss": 0.6346684694290161, | |
| "mean_token_accuracy": 0.8335375674068928, | |
| "num_tokens": 1960093.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 0.8175692446529865, | |
| "epoch": 1.7314285714285713, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 1.1588460649539035e-05, | |
| "loss": 0.9119294285774231, | |
| "mean_token_accuracy": 0.8193050436675549, | |
| "num_tokens": 1986339.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 0.8975704163312912, | |
| "epoch": 1.7542857142857144, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 9.903113209758096e-06, | |
| "loss": 0.7237526178359985, | |
| "mean_token_accuracy": 0.7882252000272274, | |
| "num_tokens": 2011176.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 0.8363670147955418, | |
| "epoch": 1.7771428571428571, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 8.343774413002381e-06, | |
| "loss": 0.6269868016242981, | |
| "mean_token_accuracy": 0.8103100657463074, | |
| "num_tokens": 2041289.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 0.8557109721004963, | |
| "epoch": 1.8, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 6.9126251355795864e-06, | |
| "loss": 0.5580326914787292, | |
| "mean_token_accuracy": 0.8539069853723049, | |
| "num_tokens": 2069418.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 0.790475644171238, | |
| "epoch": 1.822857142857143, | |
| "grad_norm": 0.984375, | |
| "learning_rate": 5.611666969163243e-06, | |
| "loss": 0.6902757287025452, | |
| "mean_token_accuracy": 0.8313734903931618, | |
| "num_tokens": 2101162.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.8487820513546467, | |
| "epoch": 1.8457142857142856, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 4.442719421385922e-06, | |
| "loss": 0.6248161792755127, | |
| "mean_token_accuracy": 0.8196811378002167, | |
| "num_tokens": 2129262.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 0.8948404788970947, | |
| "epoch": 1.8685714285714285, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 3.40741737109318e-06, | |
| "loss": 0.8848119378089905, | |
| "mean_token_accuracy": 0.7821721211075783, | |
| "num_tokens": 2152597.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 0.9239097908139229, | |
| "epoch": 1.8914285714285715, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 2.5072087818176382e-06, | |
| "loss": 0.7065685987472534, | |
| "mean_token_accuracy": 0.807807132601738, | |
| "num_tokens": 2177161.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 0.7839450426399708, | |
| "epoch": 1.9142857142857141, | |
| "grad_norm": 0.77734375, | |
| "learning_rate": 1.7433526766711728e-06, | |
| "loss": 0.7359437942504883, | |
| "mean_token_accuracy": 0.8403091952204704, | |
| "num_tokens": 2209858.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 0.843034666031599, | |
| "epoch": 1.9371428571428573, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 1.1169173774871478e-06, | |
| "loss": 0.7045976519584656, | |
| "mean_token_accuracy": 0.7968335002660751, | |
| "num_tokens": 2238762.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 0.8172502107918262, | |
| "epoch": 1.96, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 6.287790106757396e-07, | |
| "loss": 0.7153176665306091, | |
| "mean_token_accuracy": 0.8268864750862122, | |
| "num_tokens": 2266000.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 0.9393381252884865, | |
| "epoch": 1.9828571428571429, | |
| "grad_norm": 0.8046875, | |
| "learning_rate": 2.7962028188198706e-07, | |
| "loss": 0.7222880721092224, | |
| "mean_token_accuracy": 0.8043639399111271, | |
| "num_tokens": 2291896.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 0.9007064700126648, | |
| "epoch": 2.0, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 6.992952116013918e-08, | |
| "loss": 0.9412174224853516, | |
| "mean_token_accuracy": 0.7673612783352534, | |
| "num_tokens": 2307166.0, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_entropy": 0.8574838742613793, | |
| "eval_loss": 0.9815174341201782, | |
| "eval_mean_token_accuracy": 0.7545835164189338, | |
| "eval_num_tokens": 2307166.0, | |
| "eval_runtime": 77.2359, | |
| "eval_samples_per_second": 1.295, | |
| "eval_steps_per_second": 1.295, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "step": 88, | |
| "total_flos": 1.0597781694661018e+17, | |
| "train_loss": 0.9580497294664383, | |
| "train_runtime": 4168.6102, | |
| "train_samples_per_second": 0.336, | |
| "train_steps_per_second": 0.021 | |
| } | |
| ], | |
| "trial_params": null, | |
| "global_step": 88, | |
| "is_local_process_zero": true, | |
| "total_flos": 1.0597781694661018e+17, | |
| "num_train_epochs": 2, | |
| "epoch": 2.0, | |
| "best_metric": null, | |
| "trial_name": null | |
| } | |