Instructions to use RayNene/adaption_agronomy_qa_pairs with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use RayNene/adaption_agronomy_qa_pairs with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("togethercomputer/Meta-Llama-3.3-70B-Instruct-Reference") model = PeftModel.from_pretrained(base_model, "RayNene/adaption_agronomy_qa_pairs") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 28, | |
| "global_step": 140, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.014285714285714285, | |
| "grad_norm": 0.2301674634218216, | |
| "learning_rate": 0.0, | |
| "loss": 1.6484375, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.02857142857142857, | |
| "grad_norm": 0.22452111542224884, | |
| "learning_rate": 1.4285714285714285e-05, | |
| "loss": 1.6533203125, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.04285714285714286, | |
| "grad_norm": 0.20813249051570892, | |
| "learning_rate": 2.857142857142857e-05, | |
| "loss": 1.6640625, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.05714285714285714, | |
| "grad_norm": 0.1457422524690628, | |
| "learning_rate": 4.2857142857142856e-05, | |
| "loss": 1.5908203125, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.07142857142857142, | |
| "grad_norm": 0.10130278021097183, | |
| "learning_rate": 5.714285714285714e-05, | |
| "loss": 1.548828125, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.08571428571428572, | |
| "grad_norm": 0.13983897864818573, | |
| "learning_rate": 7.142857142857143e-05, | |
| "loss": 1.5234375, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 0.14988909661769867, | |
| "learning_rate": 8.571428571428571e-05, | |
| "loss": 1.4619140625, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.11428571428571428, | |
| "grad_norm": 0.12844695150852203, | |
| "learning_rate": 0.0001, | |
| "loss": 1.4208984375, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.12857142857142856, | |
| "grad_norm": 0.10155356675386429, | |
| "learning_rate": 9.998744667454123e-05, | |
| "loss": 1.4248046875, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.14285714285714285, | |
| "grad_norm": 0.07152616232633591, | |
| "learning_rate": 9.994979370198627e-05, | |
| "loss": 1.3486328125, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.15714285714285714, | |
| "grad_norm": 0.06663011759519577, | |
| "learning_rate": 9.988706208989151e-05, | |
| "loss": 1.306640625, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.17142857142857143, | |
| "grad_norm": 0.06677305698394775, | |
| "learning_rate": 9.979928683782777e-05, | |
| "loss": 1.302734375, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.18571428571428572, | |
| "grad_norm": 0.05471112206578255, | |
| "learning_rate": 9.968651691785309e-05, | |
| "loss": 1.2978515625, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.05604815483093262, | |
| "learning_rate": 9.954881524719004e-05, | |
| "loss": 1.2958984375, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.21428571428571427, | |
| "grad_norm": 0.06290843337774277, | |
| "learning_rate": 9.938625865312251e-05, | |
| "loss": 1.28515625, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.22857142857142856, | |
| "grad_norm": 0.05813497677445412, | |
| "learning_rate": 9.91989378301319e-05, | |
| "loss": 1.216796875, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.24285714285714285, | |
| "grad_norm": 0.057633932679891586, | |
| "learning_rate": 9.898695728929623e-05, | |
| "loss": 1.2666015625, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.2571428571428571, | |
| "grad_norm": 0.053865354508161545, | |
| "learning_rate": 9.875043529998088e-05, | |
| "loss": 1.25, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.2714285714285714, | |
| "grad_norm": 0.05344673618674278, | |
| "learning_rate": 9.848950382385293e-05, | |
| "loss": 1.248046875, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.2857142857142857, | |
| "grad_norm": 0.04980555549263954, | |
| "learning_rate": 9.820430844125647e-05, | |
| "loss": 1.21484375, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 0.05198637396097183, | |
| "learning_rate": 9.789500826998962e-05, | |
| "loss": 1.2265625, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.3142857142857143, | |
| "grad_norm": 0.051235176622867584, | |
| "learning_rate": 9.756177587652856e-05, | |
| "loss": 1.193359375, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.32857142857142857, | |
| "grad_norm": 0.05366426706314087, | |
| "learning_rate": 9.720479717974835e-05, | |
| "loss": 1.1884765625, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.34285714285714286, | |
| "grad_norm": 0.05358980968594551, | |
| "learning_rate": 9.682427134719396e-05, | |
| "loss": 1.1806640625, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.35714285714285715, | |
| "grad_norm": 0.05572328716516495, | |
| "learning_rate": 9.642041068395971e-05, | |
| "loss": 1.1748046875, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.37142857142857144, | |
| "grad_norm": 0.05449635162949562, | |
| "learning_rate": 9.599344051423873e-05, | |
| "loss": 1.134765625, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.38571428571428573, | |
| "grad_norm": 0.0521831288933754, | |
| "learning_rate": 9.554359905560886e-05, | |
| "loss": 1.15234375, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.04832952469587326, | |
| "learning_rate": 9.507113728612501e-05, | |
| "loss": 1.14013671875, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_loss": 1.12841796875, | |
| "eval_runtime": 6.3919, | |
| "eval_samples_per_second": 1.095, | |
| "eval_steps_per_second": 0.156, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.4142857142857143, | |
| "grad_norm": 0.054382070899009705, | |
| "learning_rate": 9.4576318804292e-05, | |
| "loss": 1.1416015625, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.42857142857142855, | |
| "grad_norm": 0.056724973022937775, | |
| "learning_rate": 9.405941968199635e-05, | |
| "loss": 1.0859375, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.44285714285714284, | |
| "grad_norm": 0.052214112132787704, | |
| "learning_rate": 9.35207283104785e-05, | |
| "loss": 1.1142578125, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.45714285714285713, | |
| "grad_norm": 0.05902480706572533, | |
| "learning_rate": 9.296054523943223e-05, | |
| "loss": 1.12109375, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.4714285714285714, | |
| "grad_norm": 0.05499668046832085, | |
| "learning_rate": 9.237918300932004e-05, | |
| "loss": 1.05712890625, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.4857142857142857, | |
| "grad_norm": 0.04787338897585869, | |
| "learning_rate": 9.177696597699902e-05, | |
| "loss": 1.05419921875, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 0.050695084035396576, | |
| "learning_rate": 9.115423013475376e-05, | |
| "loss": 1.04150390625, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.5142857142857142, | |
| "grad_norm": 0.055649545043706894, | |
| "learning_rate": 9.051132292283771e-05, | |
| "loss": 1.08837890625, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.5285714285714286, | |
| "grad_norm": 0.05247028172016144, | |
| "learning_rate": 8.984860303562737e-05, | |
| "loss": 1.06787109375, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.5428571428571428, | |
| "grad_norm": 0.05999448150396347, | |
| "learning_rate": 8.91664402214975e-05, | |
| "loss": 1.09375, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.5571428571428572, | |
| "grad_norm": 0.053369153290987015, | |
| "learning_rate": 8.846521507652904e-05, | |
| "loss": 1.06494140625, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.5714285714285714, | |
| "grad_norm": 0.054364919662475586, | |
| "learning_rate": 8.774531883216487e-05, | |
| "loss": 1.0703125, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.5857142857142857, | |
| "grad_norm": 0.05390971899032593, | |
| "learning_rate": 8.70071531369318e-05, | |
| "loss": 0.9931640625, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.05540841072797775, | |
| "learning_rate": 8.625112983235038e-05, | |
| "loss": 1.05078125, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.6142857142857143, | |
| "grad_norm": 0.054859407246112823, | |
| "learning_rate": 8.547767072315835e-05, | |
| "loss": 1.0068359375, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.6285714285714286, | |
| "grad_norm": 0.0654584988951683, | |
| "learning_rate": 8.468720734197464e-05, | |
| "loss": 1.0673828125, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.6428571428571429, | |
| "grad_norm": 0.06306427717208862, | |
| "learning_rate": 8.388018070853642e-05, | |
| "loss": 1.03515625, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.6571428571428571, | |
| "grad_norm": 0.05659706890583038, | |
| "learning_rate": 8.305704108364301e-05, | |
| "loss": 1.00830078125, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.6714285714285714, | |
| "grad_norm": 0.058154042810201645, | |
| "learning_rate": 8.22182477179437e-05, | |
| "loss": 1.04150390625, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.6857142857142857, | |
| "grad_norm": 0.05709483101963997, | |
| "learning_rate": 8.136426859571013e-05, | |
| "loss": 1.02001953125, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 0.05433674529194832, | |
| "learning_rate": 8.049558017373592e-05, | |
| "loss": 1.01123046875, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.7142857142857143, | |
| "grad_norm": 0.0570937804877758, | |
| "learning_rate": 7.961266711550922e-05, | |
| "loss": 1.00830078125, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.7285714285714285, | |
| "grad_norm": 0.059223074465990067, | |
| "learning_rate": 7.871602202080656e-05, | |
| "loss": 1.02099609375, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.7428571428571429, | |
| "grad_norm": 0.06066058203577995, | |
| "learning_rate": 7.78061451508588e-05, | |
| "loss": 0.99365234375, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.7571428571428571, | |
| "grad_norm": 0.05862792953848839, | |
| "learning_rate": 7.688354414924266e-05, | |
| "loss": 0.939453125, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.7714285714285715, | |
| "grad_norm": 0.06388234347105026, | |
| "learning_rate": 7.594873375865335e-05, | |
| "loss": 0.966796875, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.7857142857142857, | |
| "grad_norm": 0.05540330708026886, | |
| "learning_rate": 7.500223553371642e-05, | |
| "loss": 0.93212890625, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.0587574727833271, | |
| "learning_rate": 7.404457754999913e-05, | |
| "loss": 0.99365234375, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_loss": 0.98876953125, | |
| "eval_runtime": 6.3799, | |
| "eval_samples_per_second": 1.097, | |
| "eval_steps_per_second": 0.157, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.8142857142857143, | |
| "grad_norm": 0.058628544211387634, | |
| "learning_rate": 7.307629410938363e-05, | |
| "loss": 0.978515625, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.8285714285714286, | |
| "grad_norm": 0.06110001727938652, | |
| "learning_rate": 7.20979254419662e-05, | |
| "loss": 0.9921875, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.8428571428571429, | |
| "grad_norm": 0.059112727642059326, | |
| "learning_rate": 7.11100174046491e-05, | |
| "loss": 0.95458984375, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.8571428571428571, | |
| "grad_norm": 0.055121202021837234, | |
| "learning_rate": 7.011312117659304e-05, | |
| "loss": 0.93603515625, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.8714285714285714, | |
| "grad_norm": 0.06230216100811958, | |
| "learning_rate": 6.910779295170017e-05, | |
| "loss": 0.95703125, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.8857142857142857, | |
| "grad_norm": 0.05832396820187569, | |
| "learning_rate": 6.80945936282994e-05, | |
| "loss": 0.94970703125, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 0.05860510468482971, | |
| "learning_rate": 6.707408849620682e-05, | |
| "loss": 0.9365234375, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.9142857142857143, | |
| "grad_norm": 0.06364964693784714, | |
| "learning_rate": 6.604684692133597e-05, | |
| "loss": 0.978515625, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.9285714285714286, | |
| "grad_norm": 0.0612567700445652, | |
| "learning_rate": 6.501344202803414e-05, | |
| "loss": 0.953125, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.9428571428571428, | |
| "grad_norm": 0.05668887495994568, | |
| "learning_rate": 6.397445037932167e-05, | |
| "loss": 0.9521484375, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.9571428571428572, | |
| "grad_norm": 0.06072384864091873, | |
| "learning_rate": 6.293045165521248e-05, | |
| "loss": 0.93701171875, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.9714285714285714, | |
| "grad_norm": 0.06082940474152565, | |
| "learning_rate": 6.188202832929608e-05, | |
| "loss": 0.96044921875, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.9857142857142858, | |
| "grad_norm": 0.06168084964156151, | |
| "learning_rate": 6.082976534376037e-05, | |
| "loss": 0.94384765625, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.059236977249383926, | |
| "learning_rate": 5.977424978303762e-05, | |
| "loss": 0.919921875, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.0142857142857142, | |
| "grad_norm": 0.058729320764541626, | |
| "learning_rate": 5.8716070546254966e-05, | |
| "loss": 0.9013671875, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 1.0285714285714285, | |
| "grad_norm": 0.061870310455560684, | |
| "learning_rate": 5.765581801867254e-05, | |
| "loss": 0.92138671875, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 1.042857142857143, | |
| "grad_norm": 0.06547029316425323, | |
| "learning_rate": 5.659408374229244e-05, | |
| "loss": 0.91748046875, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 1.0571428571428572, | |
| "grad_norm": 0.058774255216121674, | |
| "learning_rate": 5.553146008582232e-05, | |
| "loss": 0.927734375, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 1.0714285714285714, | |
| "grad_norm": 0.06608563661575317, | |
| "learning_rate": 5.4468539914177705e-05, | |
| "loss": 0.92236328125, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.0857142857142856, | |
| "grad_norm": 0.065040722489357, | |
| "learning_rate": 5.340591625770758e-05, | |
| "loss": 0.91796875, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 0.06403814256191254, | |
| "learning_rate": 5.234418198132748e-05, | |
| "loss": 0.89501953125, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 1.1142857142857143, | |
| "grad_norm": 0.06091045215725899, | |
| "learning_rate": 5.128392945374505e-05, | |
| "loss": 0.8935546875, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 1.1285714285714286, | |
| "grad_norm": 0.06854798644781113, | |
| "learning_rate": 5.02257502169624e-05, | |
| "loss": 0.9140625, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 1.1428571428571428, | |
| "grad_norm": 0.06155310198664665, | |
| "learning_rate": 4.9170234656239655e-05, | |
| "loss": 0.88818359375, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.157142857142857, | |
| "grad_norm": 0.06304619461297989, | |
| "learning_rate": 4.811797167070393e-05, | |
| "loss": 0.89111328125, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 1.1714285714285715, | |
| "grad_norm": 0.06259562075138092, | |
| "learning_rate": 4.706954834478753e-05, | |
| "loss": 0.875, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 1.1857142857142857, | |
| "grad_norm": 0.05829339101910591, | |
| "learning_rate": 4.6025549620678357e-05, | |
| "loss": 0.9091796875, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 0.06398149579763412, | |
| "learning_rate": 4.498655797196586e-05, | |
| "loss": 0.8994140625, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "eval_loss": 0.9287109375, | |
| "eval_runtime": 6.377, | |
| "eval_samples_per_second": 1.098, | |
| "eval_steps_per_second": 0.157, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 1.2142857142857142, | |
| "grad_norm": 0.06233156844973564, | |
| "learning_rate": 4.395315307866405e-05, | |
| "loss": 0.9013671875, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 1.2285714285714286, | |
| "grad_norm": 0.06106571480631828, | |
| "learning_rate": 4.2925911503793207e-05, | |
| "loss": 0.85302734375, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 1.2428571428571429, | |
| "grad_norm": 0.061428941786289215, | |
| "learning_rate": 4.1905406371700605e-05, | |
| "loss": 0.89208984375, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 1.2571428571428571, | |
| "grad_norm": 0.06285811215639114, | |
| "learning_rate": 4.089220704829986e-05, | |
| "loss": 0.89697265625, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 1.2714285714285714, | |
| "grad_norm": 0.0686308816075325, | |
| "learning_rate": 3.988687882340698e-05, | |
| "loss": 0.89111328125, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 1.2857142857142856, | |
| "grad_norm": 0.06331058591604233, | |
| "learning_rate": 3.8889982595350916e-05, | |
| "loss": 0.88134765625, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 0.06306147575378418, | |
| "learning_rate": 3.790207455803381e-05, | |
| "loss": 0.89013671875, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 1.3142857142857143, | |
| "grad_norm": 0.06359851360321045, | |
| "learning_rate": 3.692370589061639e-05, | |
| "loss": 0.86572265625, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 1.3285714285714285, | |
| "grad_norm": 0.061125222593545914, | |
| "learning_rate": 3.595542245000089e-05, | |
| "loss": 0.8876953125, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 1.342857142857143, | |
| "grad_norm": 0.06186739355325699, | |
| "learning_rate": 3.499776446628361e-05, | |
| "loss": 0.8818359375, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 1.3571428571428572, | |
| "grad_norm": 0.066498301923275, | |
| "learning_rate": 3.405126624134666e-05, | |
| "loss": 0.86962890625, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 1.3714285714285714, | |
| "grad_norm": 0.05984362214803696, | |
| "learning_rate": 3.311645585075734e-05, | |
| "loss": 0.85400390625, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 1.3857142857142857, | |
| "grad_norm": 0.0650252252817154, | |
| "learning_rate": 3.21938548491412e-05, | |
| "loss": 0.86767578125, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.06282398849725723, | |
| "learning_rate": 3.1283977979193456e-05, | |
| "loss": 0.8720703125, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 1.4142857142857144, | |
| "grad_norm": 0.06282205134630203, | |
| "learning_rate": 3.0387332884490805e-05, | |
| "loss": 0.875, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 1.4285714285714286, | |
| "grad_norm": 0.06260594725608826, | |
| "learning_rate": 2.9504419826264113e-05, | |
| "loss": 0.8330078125, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.4428571428571428, | |
| "grad_norm": 0.06598624587059021, | |
| "learning_rate": 2.8635731404289895e-05, | |
| "loss": 0.849609375, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 1.457142857142857, | |
| "grad_norm": 0.068242646753788, | |
| "learning_rate": 2.7781752282056328e-05, | |
| "loss": 0.857421875, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 1.4714285714285715, | |
| "grad_norm": 0.06488832831382751, | |
| "learning_rate": 2.6942958916356998e-05, | |
| "loss": 0.8115234375, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 1.4857142857142858, | |
| "grad_norm": 0.0600808784365654, | |
| "learning_rate": 2.6119819291463592e-05, | |
| "loss": 0.82177734375, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 0.06046265736222267, | |
| "learning_rate": 2.531279265802538e-05, | |
| "loss": 0.81640625, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 1.5142857142857142, | |
| "grad_norm": 0.06981690227985382, | |
| "learning_rate": 2.4522329276841663e-05, | |
| "loss": 0.8564453125, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 1.5285714285714285, | |
| "grad_norm": 0.06316579878330231, | |
| "learning_rate": 2.3748870167649613e-05, | |
| "loss": 0.841796875, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 1.5428571428571427, | |
| "grad_norm": 0.06674682348966599, | |
| "learning_rate": 2.299284686306823e-05, | |
| "loss": 0.86376953125, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 1.5571428571428572, | |
| "grad_norm": 0.06432048976421356, | |
| "learning_rate": 2.2254681167835123e-05, | |
| "loss": 0.84814453125, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 1.5714285714285714, | |
| "grad_norm": 0.06504345685243607, | |
| "learning_rate": 2.1534784923470968e-05, | |
| "loss": 0.85302734375, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 1.5857142857142859, | |
| "grad_norm": 0.06324882805347443, | |
| "learning_rate": 2.083355977850252e-05, | |
| "loss": 0.793212890625, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 0.06541915982961655, | |
| "learning_rate": 2.0151396964372642e-05, | |
| "loss": 0.84228515625, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "eval_loss": 0.89697265625, | |
| "eval_runtime": 6.3864, | |
| "eval_samples_per_second": 1.096, | |
| "eval_steps_per_second": 0.157, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 1.6142857142857143, | |
| "grad_norm": 0.06446194648742676, | |
| "learning_rate": 1.9488677077162295e-05, | |
| "loss": 0.8037109375, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 1.6285714285714286, | |
| "grad_norm": 0.07079339772462845, | |
| "learning_rate": 1.8845769865246253e-05, | |
| "loss": 0.84423828125, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 1.6428571428571428, | |
| "grad_norm": 0.06356216967105865, | |
| "learning_rate": 1.822303402300099e-05, | |
| "loss": 0.83642578125, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 1.657142857142857, | |
| "grad_norm": 0.06385171413421631, | |
| "learning_rate": 1.7620816990679977e-05, | |
| "loss": 0.81396484375, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 1.6714285714285713, | |
| "grad_norm": 0.06617320328950882, | |
| "learning_rate": 1.703945476056778e-05, | |
| "loss": 0.85107421875, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 1.6857142857142857, | |
| "grad_norm": 0.08020178228616714, | |
| "learning_rate": 1.6479271689521503e-05, | |
| "loss": 0.830078125, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 0.06245279684662819, | |
| "learning_rate": 1.5940580318003663e-05, | |
| "loss": 0.82861328125, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 1.7142857142857144, | |
| "grad_norm": 0.06454663723707199, | |
| "learning_rate": 1.5423681195707997e-05, | |
| "loss": 0.82763671875, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.7285714285714286, | |
| "grad_norm": 0.06728047877550125, | |
| "learning_rate": 1.4928862713874994e-05, | |
| "loss": 0.833984375, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 1.7428571428571429, | |
| "grad_norm": 0.06479737162590027, | |
| "learning_rate": 1.4456400944391146e-05, | |
| "loss": 0.81640625, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 1.7571428571428571, | |
| "grad_norm": 0.06522734463214874, | |
| "learning_rate": 1.4006559485761281e-05, | |
| "loss": 0.774658203125, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 1.7714285714285714, | |
| "grad_norm": 0.0664784386754036, | |
| "learning_rate": 1.3579589316040298e-05, | |
| "loss": 0.79248046875, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 1.7857142857142856, | |
| "grad_norm": 0.0612151101231575, | |
| "learning_rate": 1.3175728652806046e-05, | |
| "loss": 0.77099609375, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.06594721227884293, | |
| "learning_rate": 1.2795202820251664e-05, | |
| "loss": 0.8271484375, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 1.8142857142857143, | |
| "grad_norm": 0.06843268871307373, | |
| "learning_rate": 1.2438224123471442e-05, | |
| "loss": 0.814453125, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 1.8285714285714287, | |
| "grad_norm": 0.06743902713060379, | |
| "learning_rate": 1.210499173001039e-05, | |
| "loss": 0.83203125, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 1.842857142857143, | |
| "grad_norm": 0.06749514490365982, | |
| "learning_rate": 1.1795691558743535e-05, | |
| "loss": 0.7998046875, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 1.8571428571428572, | |
| "grad_norm": 0.07553337514400482, | |
| "learning_rate": 1.1510496176147086e-05, | |
| "loss": 0.7900390625, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 1.8714285714285714, | |
| "grad_norm": 0.06856156140565872, | |
| "learning_rate": 1.1249564700019125e-05, | |
| "loss": 0.79833984375, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 1.8857142857142857, | |
| "grad_norm": 0.06377129256725311, | |
| "learning_rate": 1.1013042710703766e-05, | |
| "loss": 0.80224609375, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 0.0656968355178833, | |
| "learning_rate": 1.0801062169868106e-05, | |
| "loss": 0.7890625, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 1.9142857142857141, | |
| "grad_norm": 0.07750661671161652, | |
| "learning_rate": 1.0613741346877497e-05, | |
| "loss": 0.8212890625, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 1.9285714285714286, | |
| "grad_norm": 0.06959044188261032, | |
| "learning_rate": 1.0451184752809978e-05, | |
| "loss": 0.806640625, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 1.9428571428571428, | |
| "grad_norm": 0.0659778043627739, | |
| "learning_rate": 1.031348308214692e-05, | |
| "loss": 0.81494140625, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 1.9571428571428573, | |
| "grad_norm": 0.06762561202049255, | |
| "learning_rate": 1.0200713162172245e-05, | |
| "loss": 0.7978515625, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 1.9714285714285715, | |
| "grad_norm": 0.06678938865661621, | |
| "learning_rate": 1.0112937910108495e-05, | |
| "loss": 0.8232421875, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 1.9857142857142858, | |
| "grad_norm": 0.06764549016952515, | |
| "learning_rate": 1.0050206298013732e-05, | |
| "loss": 0.81005859375, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.07080282270908356, | |
| "learning_rate": 1.0012553325458767e-05, | |
| "loss": 0.7509765625, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 0.88427734375, | |
| "eval_runtime": 6.376, | |
| "eval_samples_per_second": 1.098, | |
| "eval_steps_per_second": 0.157, | |
| "step": 140 | |
| } | |
| ], | |
| "logging_steps": 1.0, | |
| "max_steps": 140, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 0, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.1609016895637815e+19, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |