Instructions to use CodeIsAbstract/HybridModelScratch with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use CodeIsAbstract/HybridModelScratch with Transformers:
# Load model directly from transformers import HybridFourierLM model = HybridFourierLM.from_pretrained("CodeIsAbstract/HybridModelScratch", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 100, | |
| "global_step": 2000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0125, | |
| "grad_norm": 7352.2265625, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 175.5381, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.025, | |
| "grad_norm": 2155.41015625, | |
| "learning_rate": 3.266666666666667e-05, | |
| "loss": 174.6277, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.0375, | |
| "grad_norm": 29.340621948242188, | |
| "learning_rate": 4.933333333333334e-05, | |
| "loss": 157.9852, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 11.753185272216797, | |
| "learning_rate": 6.6e-05, | |
| "loss": 133.1257, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "eval_accuracy": 0.08756986554511534, | |
| "eval_loss": 7.706512928009033, | |
| "eval_runtime": 7.3236, | |
| "eval_samples_per_second": 66.224, | |
| "eval_steps_per_second": 2.185, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.0625, | |
| "grad_norm": 11.1610746383667, | |
| "learning_rate": 8.266666666666667e-05, | |
| "loss": 119.0136, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.075, | |
| "grad_norm": 7.337241172790527, | |
| "learning_rate": 9.933333333333334e-05, | |
| "loss": 113.2304, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.0875, | |
| "grad_norm": 9.895074844360352, | |
| "learning_rate": 9.995847987378953e-05, | |
| "loss": 109.5068, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 8.935585975646973, | |
| "learning_rate": 9.982700328363471e-05, | |
| "loss": 107.0186, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "eval_accuracy": 0.13644318107230674, | |
| "eval_loss": 6.609853267669678, | |
| "eval_runtime": 7.4218, | |
| "eval_samples_per_second": 65.348, | |
| "eval_steps_per_second": 2.156, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.1125, | |
| "grad_norm": 17.207761764526367, | |
| "learning_rate": 9.96057350657239e-05, | |
| "loss": 105.3798, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.125, | |
| "grad_norm": 37.589744567871094, | |
| "learning_rate": 9.929507396034141e-05, | |
| "loss": 103.9933, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.1375, | |
| "grad_norm": 48.09913635253906, | |
| "learning_rate": 9.889557979979694e-05, | |
| "loss": 103.0857, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 18.950061798095703, | |
| "learning_rate": 9.840797249956985e-05, | |
| "loss": 102.3462, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "eval_accuracy": 0.14476797317970908, | |
| "eval_loss": 6.367699146270752, | |
| "eval_runtime": 7.5111, | |
| "eval_samples_per_second": 64.571, | |
| "eval_steps_per_second": 2.13, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.1625, | |
| "grad_norm": 54.86927032470703, | |
| "learning_rate": 9.783313076097283e-05, | |
| "loss": 101.6082, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.175, | |
| "grad_norm": 14.090791702270508, | |
| "learning_rate": 9.717209048767277e-05, | |
| "loss": 100.8465, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.1875, | |
| "grad_norm": 42.630802154541016, | |
| "learning_rate": 9.642604291892226e-05, | |
| "loss": 99.9092, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 12.524935722351074, | |
| "learning_rate": 9.559633248286604e-05, | |
| "loss": 99.0524, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "eval_accuracy": 0.15310791228876244, | |
| "eval_loss": 6.214518070220947, | |
| "eval_runtime": 7.3913, | |
| "eval_samples_per_second": 65.618, | |
| "eval_steps_per_second": 2.165, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.2125, | |
| "grad_norm": 22.39153480529785, | |
| "learning_rate": 9.468445437379055e-05, | |
| "loss": 98.4639, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 0.225, | |
| "grad_norm": 20.86402702331543, | |
| "learning_rate": 9.369205185768272e-05, | |
| "loss": 97.6668, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.2375, | |
| "grad_norm": 15.403814315795898, | |
| "learning_rate": 9.262091331095375e-05, | |
| "loss": 97.1439, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 18.481685638427734, | |
| "learning_rate": 9.147296899766376e-05, | |
| "loss": 96.6031, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "eval_accuracy": 0.1584204706678313, | |
| "eval_loss": 6.100996494293213, | |
| "eval_runtime": 7.4101, | |
| "eval_samples_per_second": 65.451, | |
| "eval_steps_per_second": 2.159, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.2625, | |
| "grad_norm": 19.892127990722656, | |
| "learning_rate": 9.025028759105558e-05, | |
| "loss": 96.2492, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 0.275, | |
| "grad_norm": 20.713096618652344, | |
| "learning_rate": 8.895507244566574e-05, | |
| "loss": 96.3436, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.2875, | |
| "grad_norm": 12.466355323791504, | |
| "learning_rate": 8.758965762673064e-05, | |
| "loss": 96.5737, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 21.678146362304688, | |
| "learning_rate": 8.615650370404327e-05, | |
| "loss": 95.9314, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "eval_accuracy": 0.163982449674087, | |
| "eval_loss": 5.986855983734131, | |
| "eval_runtime": 7.6235, | |
| "eval_samples_per_second": 63.619, | |
| "eval_steps_per_second": 2.099, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.3125, | |
| "grad_norm": 20.58213233947754, | |
| "learning_rate": 8.465819331784009e-05, | |
| "loss": 96.2906, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 0.325, | |
| "grad_norm": 14.315438270568848, | |
| "learning_rate": 8.30974265247088e-05, | |
| "loss": 95.9487, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.3375, | |
| "grad_norm": 12.04114818572998, | |
| "learning_rate": 8.147701593190385e-05, | |
| "loss": 95.4309, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 22.478317260742188, | |
| "learning_rate": 7.979988162883804e-05, | |
| "loss": 95.0101, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "eval_accuracy": 0.16826703154110645, | |
| "eval_loss": 5.88900899887085, | |
| "eval_runtime": 7.5208, | |
| "eval_samples_per_second": 64.487, | |
| "eval_steps_per_second": 2.127, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.3625, | |
| "grad_norm": 50.81674575805664, | |
| "learning_rate": 7.806904592488408e-05, | |
| "loss": 94.8858, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 0.375, | |
| "grad_norm": 20.65149688720703, | |
| "learning_rate": 7.628762790296879e-05, | |
| "loss": 95.0119, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.3875, | |
| "grad_norm": 22.1734619140625, | |
| "learning_rate": 7.445883779877482e-05, | |
| "loss": 94.6604, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 20.18880844116211, | |
| "learning_rate": 7.258597121567904e-05, | |
| "loss": 94.2643, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_accuracy": 0.17154484269838785, | |
| "eval_loss": 5.828437328338623, | |
| "eval_runtime": 7.4208, | |
| "eval_samples_per_second": 65.357, | |
| "eval_steps_per_second": 2.156, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.4125, | |
| "grad_norm": 35.1305046081543, | |
| "learning_rate": 7.067240318585242e-05, | |
| "loss": 94.3216, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 0.425, | |
| "grad_norm": 9.143704414367676, | |
| "learning_rate": 6.872158208822398e-05, | |
| "loss": 93.9239, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.4375, | |
| "grad_norm": 9.495540618896484, | |
| "learning_rate": 6.673702343426894e-05, | |
| "loss": 93.8027, | |
| "step": 875 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 19.112733840942383, | |
| "learning_rate": 6.472230353281925e-05, | |
| "loss": 93.2266, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "eval_accuracy": 0.17456010582705153, | |
| "eval_loss": 5.77442741394043, | |
| "eval_runtime": 7.4706, | |
| "eval_samples_per_second": 64.921, | |
| "eval_steps_per_second": 2.142, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.4625, | |
| "grad_norm": 13.373994827270508, | |
| "learning_rate": 6.268105304531354e-05, | |
| "loss": 92.7674, | |
| "step": 925 | |
| }, | |
| { | |
| "epoch": 0.475, | |
| "grad_norm": 20.701358795166016, | |
| "learning_rate": 6.061695044309973e-05, | |
| "loss": 92.4968, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.4875, | |
| "grad_norm": 13.155655860900879, | |
| "learning_rate": 5.8533715378581e-05, | |
| "loss": 92.2234, | |
| "step": 975 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 46.88108444213867, | |
| "learning_rate": 5.643510198215082e-05, | |
| "loss": 92.0125, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "eval_accuracy": 0.17633533442055147, | |
| "eval_loss": 5.7336883544921875, | |
| "eval_runtime": 7.3739, | |
| "eval_samples_per_second": 65.773, | |
| "eval_steps_per_second": 2.17, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.5125, | |
| "grad_norm": 482.2004699707031, | |
| "learning_rate": 5.432489209699614e-05, | |
| "loss": 93.2148, | |
| "step": 1025 | |
| }, | |
| { | |
| "epoch": 0.525, | |
| "grad_norm": 297.8095703125, | |
| "learning_rate": 5.220688846396047e-05, | |
| "loss": 95.0004, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.5375, | |
| "grad_norm": 332.8581848144531, | |
| "learning_rate": 5.0084907868747746e-05, | |
| "loss": 95.3143, | |
| "step": 1075 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 9733.95703125, | |
| "learning_rate": 4.796277426381657e-05, | |
| "loss": 95.8613, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "eval_accuracy": 0.1554284329416992, | |
| "eval_loss": 6.006833553314209, | |
| "eval_runtime": 7.2985, | |
| "eval_samples_per_second": 66.452, | |
| "eval_steps_per_second": 2.192, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.5625, | |
| "grad_norm": 1343.75537109375, | |
| "learning_rate": 4.5844311877359384e-05, | |
| "loss": 96.7118, | |
| "step": 1125 | |
| }, | |
| { | |
| "epoch": 0.575, | |
| "grad_norm": 234.01663208007812, | |
| "learning_rate": 4.373333832178478e-05, | |
| "loss": 97.3733, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.5875, | |
| "grad_norm": 868.69921875, | |
| "learning_rate": 4.1633657714122e-05, | |
| "loss": 97.8172, | |
| "step": 1175 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 370.631591796875, | |
| "learning_rate": 3.954905382074478e-05, | |
| "loss": 98.1012, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "eval_accuracy": 0.14907376084903992, | |
| "eval_loss": 6.105465888977051, | |
| "eval_runtime": 7.4782, | |
| "eval_samples_per_second": 64.855, | |
| "eval_steps_per_second": 2.14, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.6125, | |
| "grad_norm": 843.0389404296875, | |
| "learning_rate": 3.748328323876868e-05, | |
| "loss": 97.997, | |
| "step": 1225 | |
| }, | |
| { | |
| "epoch": 0.625, | |
| "grad_norm": 657.6774291992188, | |
| "learning_rate": 3.544006862640916e-05, | |
| "loss": 97.6659, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.6375, | |
| "grad_norm": 736.9610595703125, | |
| "learning_rate": 3.342309199449991e-05, | |
| "loss": 97.2111, | |
| "step": 1275 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 629.177490234375, | |
| "learning_rate": 3.143598807126035e-05, | |
| "loss": 97.152, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "eval_accuracy": 0.15122059588304496, | |
| "eval_loss": 6.054599761962891, | |
| "eval_runtime": 7.3568, | |
| "eval_samples_per_second": 65.926, | |
| "eval_steps_per_second": 2.175, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.6625, | |
| "grad_norm": 690.4661254882812, | |
| "learning_rate": 2.9482337752269752e-05, | |
| "loss": 97.7027, | |
| "step": 1325 | |
| }, | |
| { | |
| "epoch": 0.675, | |
| "grad_norm": 853.2005615234375, | |
| "learning_rate": 2.7565661647451425e-05, | |
| "loss": 98.0302, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.6875, | |
| "grad_norm": 652.2321166992188, | |
| "learning_rate": 2.568941373669562e-05, | |
| "loss": 97.5237, | |
| "step": 1375 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 17031.59375, | |
| "learning_rate": 2.3856975145554318e-05, | |
| "loss": 97.8734, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "eval_accuracy": 0.14743788467072944, | |
| "eval_loss": 6.094700336456299, | |
| "eval_runtime": 7.6558, | |
| "eval_samples_per_second": 63.351, | |
| "eval_steps_per_second": 2.09, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.7125, | |
| "grad_norm": 795.8380126953125, | |
| "learning_rate": 2.2071648052224408e-05, | |
| "loss": 98.055, | |
| "step": 1425 | |
| }, | |
| { | |
| "epoch": 0.725, | |
| "grad_norm": 1413.1805419921875, | |
| "learning_rate": 2.0336649736799495e-05, | |
| "loss": 98.1603, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.7375, | |
| "grad_norm": 746.7064208984375, | |
| "learning_rate": 1.865510678351361e-05, | |
| "loss": 97.9418, | |
| "step": 1475 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 505.42279052734375, | |
| "learning_rate": 1.7030049446425132e-05, | |
| "loss": 97.4964, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "eval_accuracy": 0.15097016545574804, | |
| "eval_loss": 6.041877746582031, | |
| "eval_runtime": 7.513, | |
| "eval_samples_per_second": 64.555, | |
| "eval_steps_per_second": 2.13, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.7625, | |
| "grad_norm": 2972.94580078125, | |
| "learning_rate": 1.5464406188694174e-05, | |
| "loss": 97.7231, | |
| "step": 1525 | |
| }, | |
| { | |
| "epoch": 0.775, | |
| "grad_norm": 2009.724609375, | |
| "learning_rate": 1.3960998405293963e-05, | |
| "loss": 97.6005, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.7875, | |
| "grad_norm": 955.8128051757812, | |
| "learning_rate": 1.2522535338666486e-05, | |
| "loss": 97.5096, | |
| "step": 1575 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 1708.3966064453125, | |
| "learning_rate": 1.1151609196484447e-05, | |
| "loss": 97.562, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_accuracy": 0.15179921134611404, | |
| "eval_loss": 6.027195930480957, | |
| "eval_runtime": 7.3648, | |
| "eval_samples_per_second": 65.853, | |
| "eval_steps_per_second": 2.172, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.8125, | |
| "grad_norm": 249.3505096435547, | |
| "learning_rate": 9.850690480317837e-06, | |
| "loss": 97.4989, | |
| "step": 1625 | |
| }, | |
| { | |
| "epoch": 0.825, | |
| "grad_norm": 493.7890930175781, | |
| "learning_rate": 8.622123533623077e-06, | |
| "loss": 97.3748, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.8375, | |
| "grad_norm": 1148.812744140625, | |
| "learning_rate": 7.468122317077786e-06, | |
| "loss": 97.3686, | |
| "step": 1675 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 719.5657958984375, | |
| "learning_rate": 6.390766418873812e-06, | |
| "loss": 97.3206, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "eval_accuracy": 0.15286253086201587, | |
| "eval_loss": 6.017110824584961, | |
| "eval_runtime": 7.5198, | |
| "eval_samples_per_second": 64.496, | |
| "eval_steps_per_second": 2.128, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.8625, | |
| "grad_norm": 585.3778686523438, | |
| "learning_rate": 5.391997307158919e-06, | |
| "loss": 97.2298, | |
| "step": 1725 | |
| }, | |
| { | |
| "epoch": 0.875, | |
| "grad_norm": 2988.042236328125, | |
| "learning_rate": 4.473614831379824e-06, | |
| "loss": 97.108, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.8875, | |
| "grad_norm": 3200.808837890625, | |
| "learning_rate": 3.6372739788319843e-06, | |
| "loss": 97.0287, | |
| "step": 1775 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 263.6023254394531, | |
| "learning_rate": 2.88448189226046e-06, | |
| "loss": 96.8684, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "eval_accuracy": 0.15323817650296123, | |
| "eval_loss": 6.016338348388672, | |
| "eval_runtime": 14.8413, | |
| "eval_samples_per_second": 32.679, | |
| "eval_steps_per_second": 1.078, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.9125, | |
| "grad_norm": 300.458984375, | |
| "learning_rate": 2.216595153886969e-06, | |
| "loss": 96.5413, | |
| "step": 1825 | |
| }, | |
| { | |
| "epoch": 0.925, | |
| "grad_norm": 1235.066162109375, | |
| "learning_rate": 1.6348173407569557e-06, | |
| "loss": 96.6509, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.9375, | |
| "grad_norm": 1469.02978515625, | |
| "learning_rate": 1.1401968558123976e-06, | |
| "loss": 96.5367, | |
| "step": 1875 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 632.1422119140625, | |
| "learning_rate": 7.336250385988896e-07, | |
| "loss": 96.472, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "eval_accuracy": 0.15278578605365067, | |
| "eval_loss": 6.0192670822143555, | |
| "eval_runtime": 7.5713, | |
| "eval_samples_per_second": 64.058, | |
| "eval_steps_per_second": 2.113, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.9625, | |
| "grad_norm": 2200.51904296875, | |
| "learning_rate": 4.1583455901149647e-07, | |
| "loss": 96.5353, | |
| "step": 1925 | |
| }, | |
| { | |
| "epoch": 0.975, | |
| "grad_norm": 1819.2476806640625, | |
| "learning_rate": 1.8739809697409517e-07, | |
| "loss": 96.0391, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.9875, | |
| "grad_norm": 1034.934326171875, | |
| "learning_rate": 4.872731043143453e-08, | |
| "loss": 96.1378, | |
| "step": 1975 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 477.2402648925781, | |
| "learning_rate": 7.209351372550188e-11, | |
| "loss": 96.5051, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_accuracy": 0.15278376645343053, | |
| "eval_loss": 6.019127368927002, | |
| "eval_runtime": 7.2999, | |
| "eval_samples_per_second": 66.44, | |
| "eval_steps_per_second": 2.192, | |
| "step": 2000 | |
| } | |
| ], | |
| "logging_steps": 25, | |
| "max_steps": 2000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 9223372036854775807, | |
| "save_steps": 300, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.337781380972544e+18, | |
| "train_batch_size": 64, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |