Instructions to use elfrjop/pa_baseline with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use elfrjop/pa_baseline with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("kuotient/Meta-Llama-3-8B-Instruct") model = PeftModel.from_pretrained(base_model, "elfrjop/pa_baseline") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 625, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 7.936507936507936e-06, | |
| "loss": 0.103, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.032, | |
| "grad_norm": 0.24380330741405487, | |
| "learning_rate": 1.5873015873015872e-05, | |
| "loss": 0.1262, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.048, | |
| "grad_norm": 0.1586637645959854, | |
| "learning_rate": 2.380952380952381e-05, | |
| "loss": 0.2298, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.064, | |
| "grad_norm": 0.282357394695282, | |
| "learning_rate": 3.1746031746031745e-05, | |
| "loss": 0.1866, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 0.23044410347938538, | |
| "learning_rate": 3.968253968253968e-05, | |
| "loss": 0.2232, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.096, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.761904761904762e-05, | |
| "loss": 0.1182, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.112, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.9980862826611875e-05, | |
| "loss": 0.1124, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.128, | |
| "grad_norm": 0.37043747305870056, | |
| "learning_rate": 4.988720025682995e-05, | |
| "loss": 0.083, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.144, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.971578953735912e-05, | |
| "loss": 0.0396, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 0.19477824866771698, | |
| "learning_rate": 4.946716615897932e-05, | |
| "loss": 0.0685, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.176, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.9142106826480114e-05, | |
| "loss": 0.0525, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.192, | |
| "grad_norm": 0.20189929008483887, | |
| "learning_rate": 4.874162703221823e-05, | |
| "loss": 0.0684, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.208, | |
| "grad_norm": 0.2944314181804657, | |
| "learning_rate": 4.8266977883697515e-05, | |
| "loss": 0.0693, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.224, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.771964219508222e-05, | |
| "loss": 0.0621, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.710132985485355e-05, | |
| "loss": 0.0185, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.256, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.6413972484081216e-05, | |
| "loss": 0.0492, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.272, | |
| "grad_norm": 0.18733273446559906, | |
| "learning_rate": 4.5659717401997655e-05, | |
| "loss": 0.0541, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.288, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.4840920917726426e-05, | |
| "loss": 0.0409, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.304, | |
| "grad_norm": 0.16774742305278778, | |
| "learning_rate": 4.396014096912182e-05, | |
| "loss": 0.0752, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 0.2138904631137848, | |
| "learning_rate": 4.302012913171584e-05, | |
| "loss": 0.0634, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.336, | |
| "grad_norm": 0.16526997089385986, | |
| "learning_rate": 4.2023822022737016e-05, | |
| "loss": 0.0814, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.352, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.0974332127054914e-05, | |
| "loss": 0.0329, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.368, | |
| "grad_norm": 0.19396360218524933, | |
| "learning_rate": 3.9874938073710336e-05, | |
| "loss": 0.0575, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.384, | |
| "grad_norm": 0.16870930790901184, | |
| "learning_rate": 3.872907439340758e-05, | |
| "loss": 0.0532, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.18818065524101257, | |
| "learning_rate": 3.75403207889666e-05, | |
| "loss": 0.0422, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.416, | |
| "grad_norm": 0.2430911660194397, | |
| "learning_rate": 3.631239095225417e-05, | |
| "loss": 0.0733, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.432, | |
| "grad_norm": 0.17143367230892181, | |
| "learning_rate": 3.504912096253061e-05, | |
| "loss": 0.059, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.448, | |
| "grad_norm": 0.19384104013442993, | |
| "learning_rate": 3.375445730245546e-05, | |
| "loss": 0.0717, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.464, | |
| "grad_norm": 0.0, | |
| "learning_rate": 3.243244452919072e-05, | |
| "loss": 0.0457, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 0.2219766527414322, | |
| "learning_rate": 3.108721263911706e-05, | |
| "loss": 0.0607, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.496, | |
| "grad_norm": 0.0, | |
| "learning_rate": 2.9722964165636264e-05, | |
| "loss": 0.062, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.512, | |
| "grad_norm": 0.2979666292667389, | |
| "learning_rate": 2.8343961050366275e-05, | |
| "loss": 0.0567, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.528, | |
| "grad_norm": 0.2317102998495102, | |
| "learning_rate": 2.695451132874385e-05, | |
| "loss": 0.0493, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.544, | |
| "grad_norm": 0.255515992641449, | |
| "learning_rate": 2.5558955671628965e-05, | |
| "loss": 0.029, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 0.25291353464126587, | |
| "learning_rate": 2.416165382495565e-05, | |
| "loss": 0.0612, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.576, | |
| "grad_norm": 0.0, | |
| "learning_rate": 2.2766970989791696e-05, | |
| "loss": 0.0281, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.592, | |
| "grad_norm": 0.0, | |
| "learning_rate": 2.1379264185356544e-05, | |
| "loss": 0.0261, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.608, | |
| "grad_norm": 0.3032894432544708, | |
| "learning_rate": 2.000286863759934e-05, | |
| "loss": 0.034, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.624, | |
| "grad_norm": 0.27459245920181274, | |
| "learning_rate": 1.8642084235859765e-05, | |
| "loss": 0.0536, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 0.0, | |
| "learning_rate": 1.7301162099921013e-05, | |
| "loss": 0.0276, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.656, | |
| "grad_norm": 0.0, | |
| "learning_rate": 1.5984291299420117e-05, | |
| "loss": 0.0536, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.672, | |
| "grad_norm": 0.0, | |
| "learning_rate": 1.4695585767104092e-05, | |
| "loss": 0.039, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.688, | |
| "grad_norm": 0.0, | |
| "learning_rate": 1.3439071446815452e-05, | |
| "loss": 0.0548, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.704, | |
| "grad_norm": 0.18401296436786652, | |
| "learning_rate": 1.2218673716356919e-05, | |
| "loss": 0.0259, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 0.0, | |
| "learning_rate": 1.103820512452661e-05, | |
| "loss": 0.0562, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.736, | |
| "grad_norm": 0.27832138538360596, | |
| "learning_rate": 9.901353480633468e-06, | |
| "loss": 0.0784, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.752, | |
| "grad_norm": 0.3106365203857422, | |
| "learning_rate": 8.811670333701544e-06, | |
| "loss": 0.0416, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.768, | |
| "grad_norm": 0.0, | |
| "learning_rate": 7.77255987735434e-06, | |
| "loss": 0.0327, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.784, | |
| "grad_norm": 0.19409137964248657, | |
| "learning_rate": 6.787268315040604e-06, | |
| "loss": 0.0695, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.0, | |
| "learning_rate": 5.8588737188248285e-06, | |
| "loss": 0.0474, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.816, | |
| "grad_norm": 0.0, | |
| "learning_rate": 4.9902764134238165e-06, | |
| "loss": 0.0434, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.832, | |
| "grad_norm": 0.22170156240463257, | |
| "learning_rate": 4.184189915529796e-06, | |
| "loss": 0.0694, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.848, | |
| "grad_norm": 0.3862822651863098, | |
| "learning_rate": 3.443132456725817e-06, | |
| "loss": 0.0396, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.864, | |
| "grad_norm": 0.0, | |
| "learning_rate": 2.769419116476052e-06, | |
| "loss": 0.0484, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 0.0, | |
| "learning_rate": 2.165154589767651e-06, | |
| "loss": 0.0598, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.896, | |
| "grad_norm": 0.24787913262844086, | |
| "learning_rate": 1.632226611998322e-06, | |
| "loss": 0.0469, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.912, | |
| "grad_norm": 0.0, | |
| "learning_rate": 1.1723000616502167e-06, | |
| "loss": 0.0464, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.928, | |
| "grad_norm": 0.0, | |
| "learning_rate": 7.868117591737583e-07, | |
| "loss": 0.0571, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.944, | |
| "grad_norm": 0.2985147535800934, | |
| "learning_rate": 4.769659783295383e-07, | |
| "loss": 0.0645, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 0.0, | |
| "learning_rate": 2.4373068401120356e-07, | |
| "loss": 0.0473, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.976, | |
| "grad_norm": 0.1989932507276535, | |
| "learning_rate": 8.783450830224249e-08, | |
| "loss": 0.0658, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.992, | |
| "grad_norm": 0.25899210572242737, | |
| "learning_rate": 9.764474213677654e-09, | |
| "loss": 0.0438, | |
| "step": 620 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 625, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 1000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 7.713640389083136e+16, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |