Text Generation
PEFT
Safetensors
English
Spanish
llama4_text
agriculture
climate
crop-calendar
evidence-grounding
bilingual
lora
autoscientist
adaption
conversational
4-bit precision
bitsandbytes
Instructions to use MarianaCodebase/AgroVeritas-Scout-17B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use MarianaCodebase/AgroVeritas-Scout-17B with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("togethercomputer/Llama-4-Scout-17B-16E-Instruct_bnb_4bit") model = PeftModel.from_pretrained(base_model, "MarianaCodebase/AgroVeritas-Scout-17B") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 31, | |
| "global_step": 159, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.018867924528301886, | |
| "grad_norm": 0.9160448908805847, | |
| "learning_rate": 0.0, | |
| "loss": 2.72265625, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.03773584905660377, | |
| "grad_norm": 0.5443944334983826, | |
| "learning_rate": 6.25e-06, | |
| "loss": 2.095703125, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.05660377358490566, | |
| "grad_norm": 0.7521076798439026, | |
| "learning_rate": 1.25e-05, | |
| "loss": 2.4833984375, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.07547169811320754, | |
| "grad_norm": 0.4434555470943451, | |
| "learning_rate": 1.8750000000000002e-05, | |
| "loss": 1.9140625, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.09433962264150944, | |
| "grad_norm": 0.397516667842865, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.791748046875, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.11320754716981132, | |
| "grad_norm": 0.36063775420188904, | |
| "learning_rate": 3.125e-05, | |
| "loss": 1.845703125, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.1320754716981132, | |
| "grad_norm": 0.29012879729270935, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 2.0087890625, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.1509433962264151, | |
| "grad_norm": 0.23380061984062195, | |
| "learning_rate": 4.375e-05, | |
| "loss": 1.912109375, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.16981132075471697, | |
| "grad_norm": 0.26473182439804077, | |
| "learning_rate": 5e-05, | |
| "loss": 1.9580078125, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.18867924528301888, | |
| "grad_norm": 0.2436726838350296, | |
| "learning_rate": 5.6250000000000005e-05, | |
| "loss": 1.8037109375, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.20754716981132076, | |
| "grad_norm": 0.17534290254116058, | |
| "learning_rate": 6.25e-05, | |
| "loss": 1.513671875, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.22641509433962265, | |
| "grad_norm": 0.31353089213371277, | |
| "learning_rate": 6.875e-05, | |
| "loss": 1.74609375, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.24528301886792453, | |
| "grad_norm": 0.1890019029378891, | |
| "learning_rate": 7.500000000000001e-05, | |
| "loss": 1.478515625, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.2641509433962264, | |
| "grad_norm": 0.2181335985660553, | |
| "learning_rate": 8.125000000000001e-05, | |
| "loss": 1.439453125, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.2830188679245283, | |
| "grad_norm": 0.1583699882030487, | |
| "learning_rate": 8.75e-05, | |
| "loss": 1.345703125, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.3018867924528302, | |
| "grad_norm": 0.39862334728240967, | |
| "learning_rate": 9.375e-05, | |
| "loss": 1.30078125, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.32075471698113206, | |
| "grad_norm": 0.4889472723007202, | |
| "learning_rate": 0.0001, | |
| "loss": 1.020751953125, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.33962264150943394, | |
| "grad_norm": 0.22474290430545807, | |
| "learning_rate": 9.998914092779207e-05, | |
| "loss": 1.10888671875, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.3584905660377358, | |
| "grad_norm": 0.21462957561016083, | |
| "learning_rate": 9.995656895203267e-05, | |
| "loss": 1.16650390625, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.37735849056603776, | |
| "grad_norm": 0.2226303219795227, | |
| "learning_rate": 9.990229979278567e-05, | |
| "loss": 1.04833984375, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.39622641509433965, | |
| "grad_norm": 0.19752401113510132, | |
| "learning_rate": 9.982635964172747e-05, | |
| "loss": 1.020751953125, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.41509433962264153, | |
| "grad_norm": 0.14107196033000946, | |
| "learning_rate": 9.972878514950619e-05, | |
| "loss": 0.99072265625, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.4339622641509434, | |
| "grad_norm": 0.14339610934257507, | |
| "learning_rate": 9.960962340805332e-05, | |
| "loss": 0.9814453125, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.4528301886792453, | |
| "grad_norm": 0.11852391809225082, | |
| "learning_rate": 9.946893192785568e-05, | |
| "loss": 1.03125, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.4716981132075472, | |
| "grad_norm": 0.12675724923610687, | |
| "learning_rate": 9.930677861019963e-05, | |
| "loss": 0.8095703125, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.49056603773584906, | |
| "grad_norm": 0.13236619532108307, | |
| "learning_rate": 9.912324171440008e-05, | |
| "loss": 0.66748046875, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.5094339622641509, | |
| "grad_norm": 0.11803070455789566, | |
| "learning_rate": 9.89184098200305e-05, | |
| "loss": 0.5257568359375, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.5283018867924528, | |
| "grad_norm": 0.14111293852329254, | |
| "learning_rate": 9.869238178417235e-05, | |
| "loss": 0.68310546875, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.5471698113207547, | |
| "grad_norm": 0.23157398402690887, | |
| "learning_rate": 9.844526669370392e-05, | |
| "loss": 0.3009033203125, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.5660377358490566, | |
| "grad_norm": 0.10609235614538193, | |
| "learning_rate": 9.81771838126524e-05, | |
| "loss": 0.71923828125, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.5849056603773585, | |
| "grad_norm": 0.08503806591033936, | |
| "learning_rate": 9.788826252463388e-05, | |
| "loss": 0.536865234375, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.6037735849056604, | |
| "grad_norm": 0.07262135297060013, | |
| "learning_rate": 9.757864227040969e-05, | |
| "loss": 0.64617919921875, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.6226415094339622, | |
| "grad_norm": 0.047836314886808395, | |
| "learning_rate": 9.724847248058859e-05, | |
| "loss": 0.76177978515625, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.6415094339622641, | |
| "grad_norm": 0.09082711488008499, | |
| "learning_rate": 9.689791250350787e-05, | |
| "loss": 0.4765625, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.660377358490566, | |
| "grad_norm": 0.04307923838496208, | |
| "learning_rate": 9.652713152832772e-05, | |
| "loss": 0.85736083984375, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.660377358490566, | |
| "eval_loss": 0.756591796875, | |
| "eval_runtime": 5.4394, | |
| "eval_samples_per_second": 0.552, | |
| "eval_steps_per_second": 0.184, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.6792452830188679, | |
| "grad_norm": 0.06730978190898895, | |
| "learning_rate": 9.613630850337626e-05, | |
| "loss": 0.605224609375, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.6981132075471698, | |
| "grad_norm": 0.054134998470544815, | |
| "learning_rate": 9.572563204978451e-05, | |
| "loss": 0.529541015625, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.7169811320754716, | |
| "grad_norm": 0.04065776243805885, | |
| "learning_rate": 9.529530037045311e-05, | |
| "loss": 0.5693359375, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.7358490566037735, | |
| "grad_norm": 0.03646336495876312, | |
| "learning_rate": 9.484552115439445e-05, | |
| "loss": 0.63250732421875, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.7547169811320755, | |
| "grad_norm": 0.05910707637667656, | |
| "learning_rate": 9.437651147649675e-05, | |
| "loss": 0.4556884765625, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.7735849056603774, | |
| "grad_norm": 0.03508642688393593, | |
| "learning_rate": 9.388849769275819e-05, | |
| "loss": 0.79693603515625, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.7924528301886793, | |
| "grad_norm": 0.03845144808292389, | |
| "learning_rate": 9.338171533104165e-05, | |
| "loss": 0.80572509765625, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.8113207547169812, | |
| "grad_norm": 0.03844299539923668, | |
| "learning_rate": 9.285640897740315e-05, | |
| "loss": 0.7535400390625, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.8301886792452831, | |
| "grad_norm": 0.04553592577576637, | |
| "learning_rate": 9.231283215804827e-05, | |
| "loss": 0.348114013671875, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.8490566037735849, | |
| "grad_norm": 0.03860464319586754, | |
| "learning_rate": 9.175124721697398e-05, | |
| "loss": 0.50250244140625, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.8679245283018868, | |
| "grad_norm": 0.040941134095191956, | |
| "learning_rate": 9.117192518935477e-05, | |
| "loss": 0.51824951171875, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.8867924528301887, | |
| "grad_norm": 0.036735646426677704, | |
| "learning_rate": 9.057514567073416e-05, | |
| "loss": 0.82611083984375, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.9056603773584906, | |
| "grad_norm": 0.048354849219322205, | |
| "learning_rate": 8.996119668208483e-05, | |
| "loss": 0.34613037109375, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.9245283018867925, | |
| "grad_norm": 0.03629879280924797, | |
| "learning_rate": 8.933037453080231e-05, | |
| "loss": 0.7056884765625, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.9433962264150944, | |
| "grad_norm": 0.03945612534880638, | |
| "learning_rate": 8.868298366769954e-05, | |
| "loss": 0.4949951171875, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.9622641509433962, | |
| "grad_norm": 0.03107060305774212, | |
| "learning_rate": 8.801933654007119e-05, | |
| "loss": 0.84393310546875, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.9811320754716981, | |
| "grad_norm": 0.03779706358909607, | |
| "learning_rate": 8.733975344089852e-05, | |
| "loss": 0.355377197265625, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.03321205452084541, | |
| "learning_rate": 8.6644562354268e-05, | |
| "loss": 0.262298583984375, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 1.0188679245283019, | |
| "grad_norm": 0.03069538250565529, | |
| "learning_rate": 8.593409879707777e-05, | |
| "loss": 0.30084228515625, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 1.0377358490566038, | |
| "grad_norm": 0.03414987400174141, | |
| "learning_rate": 8.520870565710866e-05, | |
| "loss": 0.8505859375, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 1.0566037735849056, | |
| "grad_norm": 0.02888660319149494, | |
| "learning_rate": 8.446873302753784e-05, | |
| "loss": 0.482421875, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 1.0754716981132075, | |
| "grad_norm": 0.03213921934366226, | |
| "learning_rate": 8.371453803797488e-05, | |
| "loss": 0.8316650390625, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 1.0943396226415094, | |
| "grad_norm": 0.022419078275561333, | |
| "learning_rate": 8.294648468210209e-05, | |
| "loss": 0.598419189453125, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 1.1132075471698113, | |
| "grad_norm": 0.021831678226590157, | |
| "learning_rate": 8.216494364200169e-05, | |
| "loss": 0.328033447265625, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 1.1320754716981132, | |
| "grad_norm": 0.025370784103870392, | |
| "learning_rate": 8.137029210925539e-05, | |
| "loss": 0.6046142578125, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 1.150943396226415, | |
| "grad_norm": 0.02519148774445057, | |
| "learning_rate": 8.056291360290201e-05, | |
| "loss": 0.5687103271484375, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 1.169811320754717, | |
| "grad_norm": 0.022458959370851517, | |
| "learning_rate": 7.974319778434157e-05, | |
| "loss": 0.39935302734375, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 1.1886792452830188, | |
| "grad_norm": 0.052403755486011505, | |
| "learning_rate": 7.891154026927469e-05, | |
| "loss": 0.47015380859375, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 1.2075471698113207, | |
| "grad_norm": 0.02445453405380249, | |
| "learning_rate": 7.806834243676837e-05, | |
| "loss": 0.777740478515625, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 1.2264150943396226, | |
| "grad_norm": 0.02027270942926407, | |
| "learning_rate": 7.721401123554034e-05, | |
| "loss": 0.457611083984375, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 1.2452830188679245, | |
| "grad_norm": 0.023989953100681305, | |
| "learning_rate": 7.634895898755521e-05, | |
| "loss": 0.716796875, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 1.2452830188679245, | |
| "eval_loss": 0.7044677734375, | |
| "eval_runtime": 5.43, | |
| "eval_samples_per_second": 0.552, | |
| "eval_steps_per_second": 0.184, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 1.2641509433962264, | |
| "grad_norm": 0.024166857823729515, | |
| "learning_rate": 7.547360318902743e-05, | |
| "loss": 0.62408447265625, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 1.2830188679245282, | |
| "grad_norm": 0.028676064684987068, | |
| "learning_rate": 7.458836630892693e-05, | |
| "loss": 0.906494140625, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 1.3018867924528301, | |
| "grad_norm": 0.020518383011221886, | |
| "learning_rate": 7.369367558508489e-05, | |
| "loss": 0.30908203125, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 1.320754716981132, | |
| "grad_norm": 0.11661913990974426, | |
| "learning_rate": 7.278996281799797e-05, | |
| "loss": 0.507965087890625, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.3396226415094339, | |
| "grad_norm": 0.02599608711898327, | |
| "learning_rate": 7.18776641624303e-05, | |
| "loss": 0.64666748046875, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 1.3584905660377358, | |
| "grad_norm": 0.028015300631523132, | |
| "learning_rate": 7.095721991691411e-05, | |
| "loss": 0.7392578125, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 1.3773584905660377, | |
| "grad_norm": 0.024578798562288284, | |
| "learning_rate": 7.002907431125057e-05, | |
| "loss": 0.6336669921875, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 1.3962264150943398, | |
| "grad_norm": 0.02427557297050953, | |
| "learning_rate": 6.909367529211306e-05, | |
| "loss": 0.6378173828125, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 1.4150943396226414, | |
| "grad_norm": 0.02489621192216873, | |
| "learning_rate": 6.815147430685678e-05, | |
| "loss": 0.75396728515625, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.4339622641509435, | |
| "grad_norm": 0.026317507028579712, | |
| "learning_rate": 6.720292608563877e-05, | |
| "loss": 0.74066162109375, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 1.4528301886792452, | |
| "grad_norm": 0.026842059567570686, | |
| "learning_rate": 6.624848842195356e-05, | |
| "loss": 0.84844970703125, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 1.4716981132075473, | |
| "grad_norm": 0.02483026497066021, | |
| "learning_rate": 6.528862195169039e-05, | |
| "loss": 0.62548828125, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 1.490566037735849, | |
| "grad_norm": 0.02440921775996685, | |
| "learning_rate": 6.43237899308186e-05, | |
| "loss": 0.5023193359375, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 1.509433962264151, | |
| "grad_norm": 0.021304575726389885, | |
| "learning_rate": 6.335445801180859e-05, | |
| "loss": 0.38848876953125, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.5283018867924527, | |
| "grad_norm": 0.024867858737707138, | |
| "learning_rate": 6.238109401889598e-05, | |
| "loss": 0.58270263671875, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 1.5471698113207548, | |
| "grad_norm": 0.022254586219787598, | |
| "learning_rate": 6.140416772229784e-05, | |
| "loss": 0.18841552734375, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 1.5660377358490565, | |
| "grad_norm": 0.023492569103837013, | |
| "learning_rate": 6.042415061148954e-05, | |
| "loss": 0.6334228515625, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 1.5849056603773586, | |
| "grad_norm": 0.019843759015202522, | |
| "learning_rate": 5.944151566765205e-05, | |
| "loss": 0.4464263916015625, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 1.6037735849056602, | |
| "grad_norm": 0.026993080973625183, | |
| "learning_rate": 5.845673713539911e-05, | |
| "loss": 0.560821533203125, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 1.6226415094339623, | |
| "grad_norm": 0.025686046108603477, | |
| "learning_rate": 5.747029029389475e-05, | |
| "loss": 0.6922607421875, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 1.641509433962264, | |
| "grad_norm": 0.02275293879210949, | |
| "learning_rate": 5.6482651227471436e-05, | |
| "loss": 0.38201904296875, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 1.6603773584905661, | |
| "grad_norm": 0.02670340985059738, | |
| "learning_rate": 5.5494296595859764e-05, | |
| "loss": 0.790191650390625, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 1.6792452830188678, | |
| "grad_norm": 0.02301422692835331, | |
| "learning_rate": 5.450570340414024e-05, | |
| "loss": 0.5341796875, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 1.6981132075471699, | |
| "grad_norm": 0.02345620095729828, | |
| "learning_rate": 5.3517348772528574e-05, | |
| "loss": 0.4722900390625, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 1.7169811320754715, | |
| "grad_norm": 0.024356689304113388, | |
| "learning_rate": 5.252970970610527e-05, | |
| "loss": 0.51446533203125, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 1.7358490566037736, | |
| "grad_norm": 0.02343251183629036, | |
| "learning_rate": 5.154326286460089e-05, | |
| "loss": 0.57806396484375, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 1.7547169811320755, | |
| "grad_norm": 0.01980278082191944, | |
| "learning_rate": 5.055848433234796e-05, | |
| "loss": 0.400054931640625, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 1.7735849056603774, | |
| "grad_norm": 0.02493242546916008, | |
| "learning_rate": 4.9575849388510473e-05, | |
| "loss": 0.74359130859375, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 1.7924528301886793, | |
| "grad_norm": 0.027098434045910835, | |
| "learning_rate": 4.859583227770218e-05, | |
| "loss": 0.75225830078125, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 1.8113207547169812, | |
| "grad_norm": 0.02704058215022087, | |
| "learning_rate": 4.761890598110403e-05, | |
| "loss": 0.704345703125, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 1.830188679245283, | |
| "grad_norm": 0.01941896229982376, | |
| "learning_rate": 4.664554198819141e-05, | |
| "loss": 0.317626953125, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 1.830188679245283, | |
| "eval_loss": 0.6927490234375, | |
| "eval_runtime": 5.4223, | |
| "eval_samples_per_second": 0.553, | |
| "eval_steps_per_second": 0.184, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 1.849056603773585, | |
| "grad_norm": 0.02108132652938366, | |
| "learning_rate": 4.5676210069181405e-05, | |
| "loss": 0.46380615234375, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 1.8679245283018868, | |
| "grad_norm": 0.02277522347867489, | |
| "learning_rate": 4.471137804830963e-05, | |
| "loss": 0.482635498046875, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 1.8867924528301887, | |
| "grad_norm": 0.02586280182003975, | |
| "learning_rate": 4.375151157804645e-05, | |
| "loss": 0.77655029296875, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.9056603773584906, | |
| "grad_norm": 0.020695367828011513, | |
| "learning_rate": 4.279707391436124e-05, | |
| "loss": 0.3177490234375, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 1.9245283018867925, | |
| "grad_norm": 0.026092447340488434, | |
| "learning_rate": 4.1848525693143235e-05, | |
| "loss": 0.6651611328125, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 1.9433962264150944, | |
| "grad_norm": 0.019947027787566185, | |
| "learning_rate": 4.090632470788695e-05, | |
| "loss": 0.46533203125, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 1.9622641509433962, | |
| "grad_norm": 0.02738369069993496, | |
| "learning_rate": 3.997092568874944e-05, | |
| "loss": 0.80084228515625, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 1.9811320754716981, | |
| "grad_norm": 0.019547849893569946, | |
| "learning_rate": 3.904278008308589e-05, | |
| "loss": 0.333221435546875, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.01958700828254223, | |
| "learning_rate": 3.812233583756972e-05, | |
| "loss": 0.24285888671875, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 2.018867924528302, | |
| "grad_norm": 0.020026640966534615, | |
| "learning_rate": 3.721003718200204e-05, | |
| "loss": 0.279296875, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 2.0377358490566038, | |
| "grad_norm": 0.027759267017245293, | |
| "learning_rate": 3.630632441491512e-05, | |
| "loss": 0.8104248046875, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 2.056603773584906, | |
| "grad_norm": 0.021983085200190544, | |
| "learning_rate": 3.5411633691073096e-05, | |
| "loss": 0.46087646484375, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 2.0754716981132075, | |
| "grad_norm": 0.029194500297307968, | |
| "learning_rate": 3.4526396810972584e-05, | |
| "loss": 0.79443359375, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 2.0943396226415096, | |
| "grad_norm": 0.022142434492707253, | |
| "learning_rate": 3.3651041012444804e-05, | |
| "loss": 0.569732666015625, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 2.1132075471698113, | |
| "grad_norm": 0.019784018397331238, | |
| "learning_rate": 3.2785988764459664e-05, | |
| "loss": 0.31280517578125, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 2.1320754716981134, | |
| "grad_norm": 0.025928346440196037, | |
| "learning_rate": 3.193165756323165e-05, | |
| "loss": 0.577880859375, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 2.150943396226415, | |
| "grad_norm": 0.02521391585469246, | |
| "learning_rate": 3.1088459730725335e-05, | |
| "loss": 0.54052734375, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 2.169811320754717, | |
| "grad_norm": 0.021982381120324135, | |
| "learning_rate": 3.0256802215658437e-05, | |
| "loss": 0.3807373046875, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 2.188679245283019, | |
| "grad_norm": 0.022596165537834167, | |
| "learning_rate": 2.9437086397097995e-05, | |
| "loss": 0.451141357421875, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 2.207547169811321, | |
| "grad_norm": 0.0256204754114151, | |
| "learning_rate": 2.862970789074463e-05, | |
| "loss": 0.746856689453125, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 2.2264150943396226, | |
| "grad_norm": 0.021772582083940506, | |
| "learning_rate": 2.7835056357998323e-05, | |
| "loss": 0.4388427734375, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 2.2452830188679247, | |
| "grad_norm": 0.025826886296272278, | |
| "learning_rate": 2.7053515317897925e-05, | |
| "loss": 0.6865234375, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 2.2641509433962264, | |
| "grad_norm": 0.025294864550232887, | |
| "learning_rate": 2.6285461962025115e-05, | |
| "loss": 0.601287841796875, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 2.2830188679245285, | |
| "grad_norm": 0.03068646416068077, | |
| "learning_rate": 2.5531266972462177e-05, | |
| "loss": 0.873291015625, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 2.30188679245283, | |
| "grad_norm": 0.021428707987070084, | |
| "learning_rate": 2.479129434289134e-05, | |
| "loss": 0.296875, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 2.3207547169811322, | |
| "grad_norm": 0.020753471180796623, | |
| "learning_rate": 2.4065901202922232e-05, | |
| "loss": 0.488677978515625, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 2.339622641509434, | |
| "grad_norm": 0.02610793523490429, | |
| "learning_rate": 2.3355437645732004e-05, | |
| "loss": 0.62261962890625, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 2.358490566037736, | |
| "grad_norm": 0.03154842555522919, | |
| "learning_rate": 2.2660246559101505e-05, | |
| "loss": 0.7137451171875, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 2.3773584905660377, | |
| "grad_norm": 0.025154979899525642, | |
| "learning_rate": 2.1980663459928834e-05, | |
| "loss": 0.6123046875, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 2.3962264150943398, | |
| "grad_norm": 0.026202384382486343, | |
| "learning_rate": 2.1317016332300447e-05, | |
| "loss": 0.614532470703125, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 2.4150943396226414, | |
| "grad_norm": 0.027304857969284058, | |
| "learning_rate": 2.0669625469197693e-05, | |
| "loss": 0.72918701171875, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 2.4150943396226414, | |
| "eval_loss": 0.685791015625, | |
| "eval_runtime": 5.4318, | |
| "eval_samples_per_second": 0.552, | |
| "eval_steps_per_second": 0.184, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 2.4339622641509435, | |
| "grad_norm": 0.0265318863093853, | |
| "learning_rate": 2.003880331791518e-05, | |
| "loss": 0.718353271484375, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 2.452830188679245, | |
| "grad_norm": 0.027988294139504433, | |
| "learning_rate": 1.9424854329265856e-05, | |
| "loss": 0.81939697265625, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 2.4716981132075473, | |
| "grad_norm": 0.02585024945437908, | |
| "learning_rate": 1.882807481064525e-05, | |
| "loss": 0.60516357421875, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 2.490566037735849, | |
| "grad_norm": 0.024814441800117493, | |
| "learning_rate": 1.824875278302603e-05, | |
| "loss": 0.488037109375, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 2.509433962264151, | |
| "grad_norm": 0.021639952436089516, | |
| "learning_rate": 1.7687167841951734e-05, | |
| "loss": 0.377105712890625, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 2.5283018867924527, | |
| "grad_norm": 0.025735825300216675, | |
| "learning_rate": 1.7143591022596845e-05, | |
| "loss": 0.56768798828125, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 2.547169811320755, | |
| "grad_norm": 0.015821518376469612, | |
| "learning_rate": 1.661828466895836e-05, | |
| "loss": 0.18328857421875, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 2.5660377358490565, | |
| "grad_norm": 0.026461446657776833, | |
| "learning_rate": 1.6111502307241837e-05, | |
| "loss": 0.615020751953125, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 2.5849056603773586, | |
| "grad_norm": 0.021281061694025993, | |
| "learning_rate": 1.5623488523503256e-05, | |
| "loss": 0.4334869384765625, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 2.6037735849056602, | |
| "grad_norm": 0.024843210354447365, | |
| "learning_rate": 1.515447884560556e-05, | |
| "loss": 0.54547119140625, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 2.6226415094339623, | |
| "grad_norm": 0.029024476185441017, | |
| "learning_rate": 1.47046996295469e-05, | |
| "loss": 0.67083740234375, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 2.641509433962264, | |
| "grad_norm": 0.02433478645980358, | |
| "learning_rate": 1.4274367950215495e-05, | |
| "loss": 0.37200927734375, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 2.660377358490566, | |
| "grad_norm": 0.02773123048245907, | |
| "learning_rate": 1.3863691496623755e-05, | |
| "loss": 0.770782470703125, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 2.6792452830188678, | |
| "grad_norm": 0.023714495822787285, | |
| "learning_rate": 1.3472868471672284e-05, | |
| "loss": 0.52044677734375, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 2.69811320754717, | |
| "grad_norm": 0.02553577907383442, | |
| "learning_rate": 1.3102087496492127e-05, | |
| "loss": 0.46014404296875, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 2.7169811320754715, | |
| "grad_norm": 0.024819141253829002, | |
| "learning_rate": 1.2751527519411405e-05, | |
| "loss": 0.5006103515625, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 2.7358490566037736, | |
| "grad_norm": 0.024170102551579475, | |
| "learning_rate": 1.2421357729590315e-05, | |
| "loss": 0.56585693359375, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 2.7547169811320753, | |
| "grad_norm": 0.021928368136286736, | |
| "learning_rate": 1.2111737475366126e-05, | |
| "loss": 0.39080810546875, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 2.7735849056603774, | |
| "grad_norm": 0.0276940930634737, | |
| "learning_rate": 1.1822816187347623e-05, | |
| "loss": 0.7254638671875, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 2.7924528301886795, | |
| "grad_norm": 0.028834933415055275, | |
| "learning_rate": 1.155473330629609e-05, | |
| "loss": 0.7357177734375, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 2.811320754716981, | |
| "grad_norm": 0.02765583246946335, | |
| "learning_rate": 1.130761821582766e-05, | |
| "loss": 0.6878662109375, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 2.830188679245283, | |
| "grad_norm": 0.018916428089141846, | |
| "learning_rate": 1.1081590179969499e-05, | |
| "loss": 0.31195068359375, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 2.849056603773585, | |
| "grad_norm": 0.02231622487306595, | |
| "learning_rate": 1.087675828559994e-05, | |
| "loss": 0.45281982421875, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 2.867924528301887, | |
| "grad_norm": 0.023466696962714195, | |
| "learning_rate": 1.0693221389800372e-05, | |
| "loss": 0.47271728515625, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 2.8867924528301887, | |
| "grad_norm": 0.028103815391659737, | |
| "learning_rate": 1.0531068072144323e-05, | |
| "loss": 0.76141357421875, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 2.9056603773584904, | |
| "grad_norm": 0.019869353622198105, | |
| "learning_rate": 1.039037659194669e-05, | |
| "loss": 0.311370849609375, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 2.9245283018867925, | |
| "grad_norm": 0.027084778994321823, | |
| "learning_rate": 1.0271214850493804e-05, | |
| "loss": 0.651123046875, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 2.9433962264150946, | |
| "grad_norm": 0.021756336092948914, | |
| "learning_rate": 1.017364035827255e-05, | |
| "loss": 0.45587158203125, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 2.9622641509433962, | |
| "grad_norm": 0.029050158336758614, | |
| "learning_rate": 1.0097700207214337e-05, | |
| "loss": 0.78509521484375, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 2.981132075471698, | |
| "grad_norm": 0.02259492501616478, | |
| "learning_rate": 1.0043431047967333e-05, | |
| "loss": 0.326934814453125, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 0.02022467367351055, | |
| "learning_rate": 1.0010859072207936e-05, | |
| "loss": 0.236328125, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 0.682373046875, | |
| "eval_runtime": 5.4116, | |
| "eval_samples_per_second": 0.554, | |
| "eval_steps_per_second": 0.185, | |
| "step": 159 | |
| } | |
| ], | |
| "logging_steps": 1.0, | |
| "max_steps": 159, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 0, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.382086886631565e+19, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |