Instructions to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-TogetherAI with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use FormlessAI/Qwen2.5-7B-Instruct-Reasoning-TogetherAI with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct") model = PeftModel.from_pretrained(base_model, "FormlessAI/Qwen2.5-7B-Instruct-Reasoning-TogetherAI") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 110, | |
| "global_step": 110, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.01818181818181818, | |
| "grad_norm": 2.043996572494507, | |
| "learning_rate": 1e-05, | |
| "loss": 2.9697265625, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.03636363636363636, | |
| "grad_norm": 2.0926244258880615, | |
| "learning_rate": 9.997960964140946e-06, | |
| "loss": 3.10546875, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.05454545454545454, | |
| "grad_norm": 1.8654357194900513, | |
| "learning_rate": 9.991845519630679e-06, | |
| "loss": 2.8662109375, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.07272727272727272, | |
| "grad_norm": 1.915582299232483, | |
| "learning_rate": 9.981658654313458e-06, | |
| "loss": 2.935546875, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.09090909090909091, | |
| "grad_norm": 1.7176072597503662, | |
| "learning_rate": 9.96740867674275e-06, | |
| "loss": 2.75, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.10909090909090909, | |
| "grad_norm": 1.507042407989502, | |
| "learning_rate": 9.949107209404664e-06, | |
| "loss": 2.47265625, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.12727272727272726, | |
| "grad_norm": 1.3875086307525635, | |
| "learning_rate": 9.926769179238467e-06, | |
| "loss": 2.419921875, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.14545454545454545, | |
| "grad_norm": 1.1929569244384766, | |
| "learning_rate": 9.900412805461968e-06, | |
| "loss": 2.2275390625, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.16363636363636364, | |
| "grad_norm": 0.9290140867233276, | |
| "learning_rate": 9.870059584711668e-06, | |
| "loss": 2.0986328125, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.18181818181818182, | |
| "grad_norm": 0.7955628633499146, | |
| "learning_rate": 9.835734273509787e-06, | |
| "loss": 2.060546875, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.747456431388855, | |
| "learning_rate": 9.797464868072489e-06, | |
| "loss": 2.001953125, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.21818181818181817, | |
| "grad_norm": 0.6845131516456604, | |
| "learning_rate": 9.755282581475769e-06, | |
| "loss": 1.9140625, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.23636363636363636, | |
| "grad_norm": 0.5947973728179932, | |
| "learning_rate": 9.709221818197626e-06, | |
| "loss": 1.8671875, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.2545454545454545, | |
| "grad_norm": 0.5244090557098389, | |
| "learning_rate": 9.659320146057263e-06, | |
| "loss": 1.8232421875, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.2727272727272727, | |
| "grad_norm": 0.5063930749893188, | |
| "learning_rate": 9.60561826557425e-06, | |
| "loss": 1.8232421875, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.2909090909090909, | |
| "grad_norm": 0.44349098205566406, | |
| "learning_rate": 9.548159976772593e-06, | |
| "loss": 1.8076171875, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.3090909090909091, | |
| "grad_norm": 0.35866260528564453, | |
| "learning_rate": 9.486992143456792e-06, | |
| "loss": 1.677734375, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.32727272727272727, | |
| "grad_norm": 0.35987231135368347, | |
| "learning_rate": 9.422164654989073e-06, | |
| "loss": 1.6611328125, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.34545454545454546, | |
| "grad_norm": 0.3307989835739136, | |
| "learning_rate": 9.353730385598887e-06, | |
| "loss": 1.6337890625, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.36363636363636365, | |
| "grad_norm": 0.3848985731601715, | |
| "learning_rate": 9.281745151257946e-06, | |
| "loss": 1.615234375, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.38181818181818183, | |
| "grad_norm": 0.349418044090271, | |
| "learning_rate": 9.206267664155906e-06, | |
| "loss": 1.5546875, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.35031673312187195, | |
| "learning_rate": 9.12735948481387e-06, | |
| "loss": 1.57421875, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.41818181818181815, | |
| "grad_norm": 0.3336755633354187, | |
| "learning_rate": 9.045084971874738e-06, | |
| "loss": 1.50439453125, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.43636363636363634, | |
| "grad_norm": 0.34189310669898987, | |
| "learning_rate": 8.959511229611377e-06, | |
| "loss": 1.482421875, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.45454545454545453, | |
| "grad_norm": 0.3576221764087677, | |
| "learning_rate": 8.870708053195414e-06, | |
| "loss": 1.4765625, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.4727272727272727, | |
| "grad_norm": 0.36254608631134033, | |
| "learning_rate": 8.778747871771293e-06, | |
| "loss": 1.4287109375, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.4909090909090909, | |
| "grad_norm": 0.4230624735355377, | |
| "learning_rate": 8.683705689382025e-06, | |
| "loss": 1.3896484375, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.509090909090909, | |
| "grad_norm": 0.40722933411598206, | |
| "learning_rate": 8.585659023794818e-06, | |
| "loss": 1.372314453125, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.5272727272727272, | |
| "grad_norm": 0.4091890752315521, | |
| "learning_rate": 8.48468784327647e-06, | |
| "loss": 1.30517578125, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.5454545454545454, | |
| "grad_norm": 0.3111860156059265, | |
| "learning_rate": 8.380874501370098e-06, | |
| "loss": 1.2509765625, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.5636363636363636, | |
| "grad_norm": 0.203084334731102, | |
| "learning_rate": 8.274303669726427e-06, | |
| "loss": 1.30908203125, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.5818181818181818, | |
| "grad_norm": 0.17557428777217865, | |
| "learning_rate": 8.165062269044353e-06, | |
| "loss": 1.32470703125, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.15492086112499237, | |
| "learning_rate": 8.053239398177191e-06, | |
| "loss": 1.220703125, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.6181818181818182, | |
| "grad_norm": 0.20500344038009644, | |
| "learning_rate": 7.938926261462366e-06, | |
| "loss": 1.19970703125, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.6363636363636364, | |
| "grad_norm": 0.1662224531173706, | |
| "learning_rate": 7.822216094333847e-06, | |
| "loss": 1.2255859375, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.6545454545454545, | |
| "grad_norm": 0.17929084599018097, | |
| "learning_rate": 7.703204087277989e-06, | |
| "loss": 1.25146484375, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.6727272727272727, | |
| "grad_norm": 0.18725869059562683, | |
| "learning_rate": 7.5819873081948105e-06, | |
| "loss": 1.24365234375, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.6909090909090909, | |
| "grad_norm": 0.2386845201253891, | |
| "learning_rate": 7.45866462322802e-06, | |
| "loss": 1.27587890625, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.7090909090909091, | |
| "grad_norm": 0.20446960628032684, | |
| "learning_rate": 7.333336616128369e-06, | |
| "loss": 1.203125, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.7272727272727273, | |
| "grad_norm": 0.20624497532844543, | |
| "learning_rate": 7.206105506216107e-06, | |
| "loss": 1.25830078125, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.7454545454545455, | |
| "grad_norm": 0.21159856021404266, | |
| "learning_rate": 7.0770750650094335e-06, | |
| "loss": 1.1845703125, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.7636363636363637, | |
| "grad_norm": 0.20678693056106567, | |
| "learning_rate": 6.946350531586959e-06, | |
| "loss": 1.19091796875, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.7818181818181819, | |
| "grad_norm": 0.20037050545215607, | |
| "learning_rate": 6.814038526753205e-06, | |
| "loss": 1.204833984375, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.17004463076591492, | |
| "learning_rate": 6.680246966077151e-06, | |
| "loss": 1.2080078125, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.8181818181818182, | |
| "grad_norm": 0.1704520583152771, | |
| "learning_rate": 6.545084971874738e-06, | |
| "loss": 1.15478515625, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.8363636363636363, | |
| "grad_norm": 0.25000882148742676, | |
| "learning_rate": 6.408662784207149e-06, | |
| "loss": 1.1953125, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.8545454545454545, | |
| "grad_norm": 0.26687896251678467, | |
| "learning_rate": 6.271091670967437e-06, | |
| "loss": 1.1884765625, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.8727272727272727, | |
| "grad_norm": 0.11884502321481705, | |
| "learning_rate": 6.132483837128823e-06, | |
| "loss": 1.1826171875, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.8909090909090909, | |
| "grad_norm": 0.11220335960388184, | |
| "learning_rate": 5.9929523332287275e-06, | |
| "loss": 1.17822265625, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.9090909090909091, | |
| "grad_norm": 0.11708816140890121, | |
| "learning_rate": 5.85261096316312e-06, | |
| "loss": 1.17919921875, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.9272727272727272, | |
| "grad_norm": 0.13113504648208618, | |
| "learning_rate": 5.711574191366427e-06, | |
| "loss": 1.248046875, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.9454545454545454, | |
| "grad_norm": 0.1367698758840561, | |
| "learning_rate": 5.569957049452703e-06, | |
| "loss": 1.15576171875, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.9636363636363636, | |
| "grad_norm": 0.12517711520195007, | |
| "learning_rate": 5.4278750423942e-06, | |
| "loss": 1.1552734375, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.9818181818181818, | |
| "grad_norm": 0.11927603930234909, | |
| "learning_rate": 5.285444054313841e-06, | |
| "loss": 1.2119140625, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.11289802938699722, | |
| "learning_rate": 5.142780253968481e-06, | |
| "loss": 1.18212890625, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 1.018181818181818, | |
| "grad_norm": 0.09079399704933167, | |
| "learning_rate": 5e-06, | |
| "loss": 1.16162109375, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 1.0363636363636364, | |
| "grad_norm": 0.09751984477043152, | |
| "learning_rate": 4.85721974603152e-06, | |
| "loss": 1.1767578125, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 1.0545454545454545, | |
| "grad_norm": 0.09680410474538803, | |
| "learning_rate": 4.71455594568616e-06, | |
| "loss": 1.19873046875, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 1.0727272727272728, | |
| "grad_norm": 0.08057751506567001, | |
| "learning_rate": 4.572124957605803e-06, | |
| "loss": 1.16455078125, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 1.0909090909090908, | |
| "grad_norm": 0.0873107761144638, | |
| "learning_rate": 4.430042950547298e-06, | |
| "loss": 1.1708984375, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 1.1090909090909091, | |
| "grad_norm": 0.08605661243200302, | |
| "learning_rate": 4.2884258086335755e-06, | |
| "loss": 1.1630859375, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 1.1272727272727272, | |
| "grad_norm": 0.08335281908512115, | |
| "learning_rate": 4.147389036836881e-06, | |
| "loss": 1.13671875, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 1.1454545454545455, | |
| "grad_norm": 0.09709643572568893, | |
| "learning_rate": 4.007047666771274e-06, | |
| "loss": 1.123046875, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 1.1636363636363636, | |
| "grad_norm": 0.07813747227191925, | |
| "learning_rate": 3.867516162871177e-06, | |
| "loss": 1.14697265625, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 1.1818181818181819, | |
| "grad_norm": 0.07940645515918732, | |
| "learning_rate": 3.7289083290325668e-06, | |
| "loss": 1.185546875, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 0.0847330167889595, | |
| "learning_rate": 3.5913372157928515e-06, | |
| "loss": 1.14892578125, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 1.2181818181818183, | |
| "grad_norm": 0.0767209529876709, | |
| "learning_rate": 3.4549150281252635e-06, | |
| "loss": 1.1279296875, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 1.2363636363636363, | |
| "grad_norm": 0.07237398624420166, | |
| "learning_rate": 3.319753033922849e-06, | |
| "loss": 1.16357421875, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 1.2545454545454544, | |
| "grad_norm": 0.06874033063650131, | |
| "learning_rate": 3.1859614732467957e-06, | |
| "loss": 1.1767578125, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 1.2727272727272727, | |
| "grad_norm": 0.06955976039171219, | |
| "learning_rate": 3.053649468413043e-06, | |
| "loss": 1.165283203125, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.290909090909091, | |
| "grad_norm": 0.0963461771607399, | |
| "learning_rate": 2.9229249349905686e-06, | |
| "loss": 1.19482421875, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 1.309090909090909, | |
| "grad_norm": 0.10361190140247345, | |
| "learning_rate": 2.7938944937838924e-06, | |
| "loss": 1.169921875, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 1.3272727272727272, | |
| "grad_norm": 0.0700468048453331, | |
| "learning_rate": 2.6666633838716317e-06, | |
| "loss": 1.14697265625, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 1.3454545454545455, | |
| "grad_norm": 0.08605919778347015, | |
| "learning_rate": 2.5413353767719805e-06, | |
| "loss": 1.18701171875, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 1.3636363636363638, | |
| "grad_norm": 0.07441291958093643, | |
| "learning_rate": 2.418012691805191e-06, | |
| "loss": 1.125, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.3818181818181818, | |
| "grad_norm": 0.07339707762002945, | |
| "learning_rate": 2.296795912722014e-06, | |
| "loss": 1.13427734375, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.07407637685537338, | |
| "learning_rate": 2.1777839056661555e-06, | |
| "loss": 1.16650390625, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 1.4181818181818182, | |
| "grad_norm": 0.07568876445293427, | |
| "learning_rate": 2.061073738537635e-06, | |
| "loss": 1.15478515625, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 1.4363636363636363, | |
| "grad_norm": 0.062244512140750885, | |
| "learning_rate": 1.946760601822809e-06, | |
| "loss": 1.15087890625, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 1.4545454545454546, | |
| "grad_norm": 0.06542546302080154, | |
| "learning_rate": 1.8349377309556487e-06, | |
| "loss": 1.164794921875, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.4727272727272727, | |
| "grad_norm": 0.06182748079299927, | |
| "learning_rate": 1.7256963302735752e-06, | |
| "loss": 1.158203125, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 1.490909090909091, | |
| "grad_norm": 0.0789041593670845, | |
| "learning_rate": 1.6191254986299044e-06, | |
| "loss": 1.13427734375, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 1.509090909090909, | |
| "grad_norm": 0.0626092255115509, | |
| "learning_rate": 1.5153121567235334e-06, | |
| "loss": 1.147705078125, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 1.5272727272727273, | |
| "grad_norm": 0.072810098528862, | |
| "learning_rate": 1.4143409762051829e-06, | |
| "loss": 1.1201171875, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 1.5454545454545454, | |
| "grad_norm": 0.07056964188814163, | |
| "learning_rate": 1.3162943106179748e-06, | |
| "loss": 1.0986328125, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 1.5636363636363635, | |
| "grad_norm": 0.06387604773044586, | |
| "learning_rate": 1.2212521282287093e-06, | |
| "loss": 1.1708984375, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 1.5818181818181818, | |
| "grad_norm": 0.0639725774526596, | |
| "learning_rate": 1.1292919468045876e-06, | |
| "loss": 1.1875, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 0.05896006152033806, | |
| "learning_rate": 1.0404887703886252e-06, | |
| "loss": 1.111328125, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 1.6181818181818182, | |
| "grad_norm": 0.12896744906902313, | |
| "learning_rate": 9.549150281252633e-07, | |
| "loss": 1.101806640625, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 1.6363636363636362, | |
| "grad_norm": 0.08080096542835236, | |
| "learning_rate": 8.7264051518613e-07, | |
| "loss": 1.1220703125, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 1.6545454545454545, | |
| "grad_norm": 0.06684555858373642, | |
| "learning_rate": 7.937323358440935e-07, | |
| "loss": 1.14306640625, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 1.6727272727272728, | |
| "grad_norm": 0.05942356213927269, | |
| "learning_rate": 7.182548487420555e-07, | |
| "loss": 1.14013671875, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 1.690909090909091, | |
| "grad_norm": 0.07880666106939316, | |
| "learning_rate": 6.462696144011149e-07, | |
| "loss": 1.173828125, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 1.709090909090909, | |
| "grad_norm": 0.06027885526418686, | |
| "learning_rate": 5.778353450109286e-07, | |
| "loss": 1.11279296875, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 1.7272727272727273, | |
| "grad_norm": 0.0611584335565567, | |
| "learning_rate": 5.130078565432089e-07, | |
| "loss": 1.17431640625, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 1.7454545454545456, | |
| "grad_norm": 0.0627589002251625, | |
| "learning_rate": 4.5184002322740784e-07, | |
| "loss": 1.1083984375, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 1.7636363636363637, | |
| "grad_norm": 0.061538759618997574, | |
| "learning_rate": 3.9438173442575e-07, | |
| "loss": 1.1259765625, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 1.7818181818181817, | |
| "grad_norm": 0.06338467448949814, | |
| "learning_rate": 3.406798539427386e-07, | |
| "loss": 1.1396484375, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.06770215928554535, | |
| "learning_rate": 2.9077818180237693e-07, | |
| "loss": 1.15087890625, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 1.8181818181818183, | |
| "grad_norm": 0.061797644942998886, | |
| "learning_rate": 2.447174185242324e-07, | |
| "loss": 1.10302734375, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.8363636363636364, | |
| "grad_norm": 0.06173209846019745, | |
| "learning_rate": 2.0253513192751374e-07, | |
| "loss": 1.14208984375, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 1.8545454545454545, | |
| "grad_norm": 0.06665000319480896, | |
| "learning_rate": 1.6426572649021477e-07, | |
| "loss": 1.1396484375, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 1.8727272727272726, | |
| "grad_norm": 0.06044939532876015, | |
| "learning_rate": 1.2994041528833267e-07, | |
| "loss": 1.13916015625, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 1.8909090909090909, | |
| "grad_norm": 0.06250400841236115, | |
| "learning_rate": 9.958719453803278e-08, | |
| "loss": 1.14013671875, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 1.9090909090909092, | |
| "grad_norm": 0.059070732444524765, | |
| "learning_rate": 7.32308207615351e-08, | |
| "loss": 1.1396484375, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 1.9272727272727272, | |
| "grad_norm": 0.06301233917474747, | |
| "learning_rate": 5.089279059533658e-08, | |
| "loss": 1.212890625, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 1.9454545454545453, | |
| "grad_norm": 0.059316884726285934, | |
| "learning_rate": 3.25913232572489e-08, | |
| "loss": 1.119140625, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 1.9636363636363636, | |
| "grad_norm": 0.05868269130587578, | |
| "learning_rate": 1.834134568654333e-08, | |
| "loss": 1.12255859375, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 1.981818181818182, | |
| "grad_norm": 0.0642366111278534, | |
| "learning_rate": 8.15448036932176e-09, | |
| "loss": 1.1806640625, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.06383895128965378, | |
| "learning_rate": 2.0390358590538507e-09, | |
| "loss": 1.15185546875, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 1.192138671875, | |
| "eval_runtime": 1.9189, | |
| "eval_samples_per_second": 5.211, | |
| "eval_steps_per_second": 0.521, | |
| "step": 110 | |
| } | |
| ], | |
| "logging_steps": 1.0, | |
| "max_steps": 110, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 0, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.5003689757670113e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |