Instructions to use Aerolandaz/cap8-frq with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Aerolandaz/cap8-frq with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/qwen3-4b-thinking-2507-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "Aerolandaz/cap8-frq") - Transformers
How to use Aerolandaz/cap8-frq with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Aerolandaz/cap8-frq") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Aerolandaz/cap8-frq", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Aerolandaz/cap8-frq with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Aerolandaz/cap8-frq" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Aerolandaz/cap8-frq", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Aerolandaz/cap8-frq
- SGLang
How to use Aerolandaz/cap8-frq with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Aerolandaz/cap8-frq" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Aerolandaz/cap8-frq", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Aerolandaz/cap8-frq" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Aerolandaz/cap8-frq", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use Aerolandaz/cap8-frq with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Aerolandaz/cap8-frq to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Aerolandaz/cap8-frq to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for Aerolandaz/cap8-frq to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="Aerolandaz/cap8-frq", max_seq_length=2048, ) - Docker Model Runner
How to use Aerolandaz/cap8-frq with Docker Model Runner:
docker model run hf.co/Aerolandaz/cap8-frq
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.220063549704948, | |
| "eval_steps": 500, | |
| "global_step": 1680, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.007262823422605538, | |
| "grad_norm": 0.2615480124950409, | |
| "learning_rate": 8.571428571428573e-06, | |
| "loss": 0.1552, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.014525646845211076, | |
| "grad_norm": 0.22226440906524658, | |
| "learning_rate": 1.8095238095238094e-05, | |
| "loss": 0.1592, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.021788470267816613, | |
| "grad_norm": 0.20973989367485046, | |
| "learning_rate": 2.7619047619047622e-05, | |
| "loss": 0.1534, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.029051293690422152, | |
| "grad_norm": 0.20205365121364594, | |
| "learning_rate": 3.7142857142857143e-05, | |
| "loss": 0.1634, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.03631411711302769, | |
| "grad_norm": 0.2007875144481659, | |
| "learning_rate": 4.666666666666667e-05, | |
| "loss": 0.1434, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.04357694053563323, | |
| "grad_norm": 0.20036202669143677, | |
| "learning_rate": 5.619047619047619e-05, | |
| "loss": 0.1333, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.05083976395823876, | |
| "grad_norm": 0.1990794837474823, | |
| "learning_rate": 6.571428571428571e-05, | |
| "loss": 0.1375, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.058102587380844305, | |
| "grad_norm": 0.19063813984394073, | |
| "learning_rate": 7.523809523809524e-05, | |
| "loss": 0.1374, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.06536541080344985, | |
| "grad_norm": 0.15606075525283813, | |
| "learning_rate": 8.476190476190477e-05, | |
| "loss": 0.132, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.07262823422605538, | |
| "grad_norm": 0.19317622482776642, | |
| "learning_rate": 9.428571428571429e-05, | |
| "loss": 0.1333, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.07989105764866092, | |
| "grad_norm": 0.17449212074279785, | |
| "learning_rate": 9.999900808946995e-05, | |
| "loss": 0.1392, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.08715388107126645, | |
| "grad_norm": 0.16662831604480743, | |
| "learning_rate": 9.998784954797474e-05, | |
| "loss": 0.1316, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.09441670449387199, | |
| "grad_norm": 0.13957402110099792, | |
| "learning_rate": 9.996429535306638e-05, | |
| "loss": 0.1249, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.10167952791647752, | |
| "grad_norm": 0.17535850405693054, | |
| "learning_rate": 9.992835134555693e-05, | |
| "loss": 0.1329, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.10894235133908307, | |
| "grad_norm": 0.14767180383205414, | |
| "learning_rate": 9.988002643860162e-05, | |
| "loss": 0.1256, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.11620517476168861, | |
| "grad_norm": 0.18588787317276, | |
| "learning_rate": 9.981933261548842e-05, | |
| "loss": 0.1453, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.12346799818429414, | |
| "grad_norm": 0.15257962048053741, | |
| "learning_rate": 9.974628492666663e-05, | |
| "loss": 0.1329, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.1307308216068997, | |
| "grad_norm": 0.1288495510816574, | |
| "learning_rate": 9.966090148601476e-05, | |
| "loss": 0.1331, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.13799364502950523, | |
| "grad_norm": 0.17879730463027954, | |
| "learning_rate": 9.956320346634876e-05, | |
| "loss": 0.1358, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.14525646845211077, | |
| "grad_norm": 0.12357795238494873, | |
| "learning_rate": 9.945321509417169e-05, | |
| "loss": 0.1252, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.1525192918747163, | |
| "grad_norm": 0.11386862397193909, | |
| "learning_rate": 9.933096364366626e-05, | |
| "loss": 0.1355, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.15978211529732184, | |
| "grad_norm": 0.11719153821468353, | |
| "learning_rate": 9.919647942993148e-05, | |
| "loss": 0.1275, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.16704493871992737, | |
| "grad_norm": 0.13855832815170288, | |
| "learning_rate": 9.904979580146542e-05, | |
| "loss": 0.132, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.1743077621425329, | |
| "grad_norm": 0.16087959706783295, | |
| "learning_rate": 9.88909491318956e-05, | |
| "loss": 0.1519, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.18157058556513844, | |
| "grad_norm": 0.1610720455646515, | |
| "learning_rate": 9.87199788109593e-05, | |
| "loss": 0.1383, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.18883340898774398, | |
| "grad_norm": 0.15942955017089844, | |
| "learning_rate": 9.8536927234736e-05, | |
| "loss": 0.1222, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.1960962324103495, | |
| "grad_norm": 0.1623896360397339, | |
| "learning_rate": 9.834183979513427e-05, | |
| "loss": 0.1286, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.20335905583295505, | |
| "grad_norm": 0.19065435230731964, | |
| "learning_rate": 9.813476486863576e-05, | |
| "loss": 0.1358, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.2106218792555606, | |
| "grad_norm": 0.14221009612083435, | |
| "learning_rate": 9.791575380429912e-05, | |
| "loss": 0.1331, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.21788470267816615, | |
| "grad_norm": 0.12954957783222198, | |
| "learning_rate": 9.768486091102688e-05, | |
| "loss": 0.1347, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.22514752610077168, | |
| "grad_norm": 0.15374745428562164, | |
| "learning_rate": 9.744214344409819e-05, | |
| "loss": 0.1278, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.23241034952337722, | |
| "grad_norm": 0.16374695301055908, | |
| "learning_rate": 9.718766159097108e-05, | |
| "loss": 0.1329, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.23967317294598275, | |
| "grad_norm": 0.13390475511550903, | |
| "learning_rate": 9.692147845635761e-05, | |
| "loss": 0.1254, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.2469359963685883, | |
| "grad_norm": 0.11325599998235703, | |
| "learning_rate": 9.664366004657552e-05, | |
| "loss": 0.1335, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.25419881979119385, | |
| "grad_norm": 0.1330733448266983, | |
| "learning_rate": 9.635427525318048e-05, | |
| "loss": 0.1429, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.2614616432137994, | |
| "grad_norm": 0.13730360567569733, | |
| "learning_rate": 9.60533958358828e-05, | |
| "loss": 0.125, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.2687244666364049, | |
| "grad_norm": 0.12945713102817535, | |
| "learning_rate": 9.574109640475288e-05, | |
| "loss": 0.1321, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.27598729005901046, | |
| "grad_norm": 0.11518649756908417, | |
| "learning_rate": 9.541745440172005e-05, | |
| "loss": 0.1308, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.283250113481616, | |
| "grad_norm": 0.18112903833389282, | |
| "learning_rate": 9.508255008136885e-05, | |
| "loss": 0.1323, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.29051293690422153, | |
| "grad_norm": 0.1332743912935257, | |
| "learning_rate": 9.473646649103818e-05, | |
| "loss": 0.1297, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.29777576032682707, | |
| "grad_norm": 0.14073874056339264, | |
| "learning_rate": 9.437928945022771e-05, | |
| "loss": 0.1171, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.3050385837494326, | |
| "grad_norm": 0.11776047945022583, | |
| "learning_rate": 9.401110752931694e-05, | |
| "loss": 0.129, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.31230140717203814, | |
| "grad_norm": 0.13818472623825073, | |
| "learning_rate": 9.363201202760213e-05, | |
| "loss": 0.1298, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.3195642305946437, | |
| "grad_norm": 0.14196033775806427, | |
| "learning_rate": 9.324209695065645e-05, | |
| "loss": 0.1184, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.3268270540172492, | |
| "grad_norm": 0.11807554960250854, | |
| "learning_rate": 9.284145898701921e-05, | |
| "loss": 0.1286, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.33408987743985474, | |
| "grad_norm": 0.13083140552043915, | |
| "learning_rate": 9.243019748421955e-05, | |
| "loss": 0.1475, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.3413527008624603, | |
| "grad_norm": 0.11743377894163132, | |
| "learning_rate": 9.200841442414106e-05, | |
| "loss": 0.127, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.3486155242850658, | |
| "grad_norm": 0.1455356925725937, | |
| "learning_rate": 9.157621439773278e-05, | |
| "loss": 0.1242, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.35587834770767135, | |
| "grad_norm": 0.13083097338676453, | |
| "learning_rate": 9.113370457907368e-05, | |
| "loss": 0.1246, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.3631411711302769, | |
| "grad_norm": 0.19750870764255524, | |
| "learning_rate": 9.068099469879618e-05, | |
| "loss": 0.1302, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.3704039945528824, | |
| "grad_norm": 0.1284891664981842, | |
| "learning_rate": 9.02181970168759e-05, | |
| "loss": 0.1233, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.37766681797548796, | |
| "grad_norm": 0.13317878544330597, | |
| "learning_rate": 8.974542629479425e-05, | |
| "loss": 0.1221, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.3849296413980935, | |
| "grad_norm": 0.11880248039960861, | |
| "learning_rate": 8.926279976708055e-05, | |
| "loss": 0.1244, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.392192464820699, | |
| "grad_norm": 0.13789477944374084, | |
| "learning_rate": 8.877043711224108e-05, | |
| "loss": 0.1263, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.39945528824330456, | |
| "grad_norm": 0.14878354966640472, | |
| "learning_rate": 8.826846042308196e-05, | |
| "loss": 0.1209, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.4067181116659101, | |
| "grad_norm": 0.18324986100196838, | |
| "learning_rate": 8.775699417643338e-05, | |
| "loss": 0.125, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.41398093508851563, | |
| "grad_norm": 0.13719946146011353, | |
| "learning_rate": 8.723616520228271e-05, | |
| "loss": 0.1376, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.4212437585111212, | |
| "grad_norm": 0.12926670908927917, | |
| "learning_rate": 8.670610265232397e-05, | |
| "loss": 0.1366, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.42850658193372676, | |
| "grad_norm": 0.11852458119392395, | |
| "learning_rate": 8.616693796793179e-05, | |
| "loss": 0.1378, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.4357694053563323, | |
| "grad_norm": 0.12678755819797516, | |
| "learning_rate": 8.561880484756725e-05, | |
| "loss": 0.1352, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.44303222877893783, | |
| "grad_norm": 0.14523130655288696, | |
| "learning_rate": 8.506183921362443e-05, | |
| "loss": 0.1332, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.45029505220154337, | |
| "grad_norm": 0.11939208209514618, | |
| "learning_rate": 8.44961791787252e-05, | |
| "loss": 0.133, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.4575578756241489, | |
| "grad_norm": 0.11850901693105698, | |
| "learning_rate": 8.392196501147092e-05, | |
| "loss": 0.1296, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.46482069904675444, | |
| "grad_norm": 0.18242543935775757, | |
| "learning_rate": 8.333933910165963e-05, | |
| "loss": 0.1294, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.47208352246936, | |
| "grad_norm": 0.11849816143512726, | |
| "learning_rate": 8.274844592497719e-05, | |
| "loss": 0.1272, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.4793463458919655, | |
| "grad_norm": 0.1463852971792221, | |
| "learning_rate": 8.214943200717114e-05, | |
| "loss": 0.1292, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.48660916931457104, | |
| "grad_norm": 0.11856704205274582, | |
| "learning_rate": 8.154244588771621e-05, | |
| "loss": 0.1251, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.4938719927371766, | |
| "grad_norm": 0.1263067126274109, | |
| "learning_rate": 8.092763808298048e-05, | |
| "loss": 0.1236, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.5011348161597822, | |
| "grad_norm": 0.14322146773338318, | |
| "learning_rate": 8.03051610489014e-05, | |
| "loss": 0.1244, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.5083976395823877, | |
| "grad_norm": 0.1455278843641281, | |
| "learning_rate": 7.967516914318074e-05, | |
| "loss": 0.1424, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.5156604630049932, | |
| "grad_norm": 0.13176371157169342, | |
| "learning_rate": 7.903781858700799e-05, | |
| "loss": 0.1298, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.5229232864275988, | |
| "grad_norm": 0.1257869303226471, | |
| "learning_rate": 7.839326742632167e-05, | |
| "loss": 0.1242, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.5301861098502043, | |
| "grad_norm": 0.11117416620254517, | |
| "learning_rate": 7.774167549261817e-05, | |
| "loss": 0.1182, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.5374489332728098, | |
| "grad_norm": 0.11336909979581833, | |
| "learning_rate": 7.708320436331782e-05, | |
| "loss": 0.1238, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.5447117566954154, | |
| "grad_norm": 0.12919354438781738, | |
| "learning_rate": 7.641801732169795e-05, | |
| "loss": 0.1328, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.5519745801180209, | |
| "grad_norm": 0.1134372279047966, | |
| "learning_rate": 7.574627931640303e-05, | |
| "loss": 0.1267, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.5592374035406265, | |
| "grad_norm": 0.14933618903160095, | |
| "learning_rate": 7.50681569205418e-05, | |
| "loss": 0.1274, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.566500226963232, | |
| "grad_norm": 0.16035373508930206, | |
| "learning_rate": 7.438381829038156e-05, | |
| "loss": 0.1238, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.5737630503858375, | |
| "grad_norm": 0.14108073711395264, | |
| "learning_rate": 7.369343312364993e-05, | |
| "loss": 0.1402, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.5810258738084431, | |
| "grad_norm": 0.12364397943019867, | |
| "learning_rate": 7.299717261745434e-05, | |
| "loss": 0.1256, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.5882886972310486, | |
| "grad_norm": 0.11245425045490265, | |
| "learning_rate": 7.229520942582965e-05, | |
| "loss": 0.1205, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.5955515206536541, | |
| "grad_norm": 0.15711691975593567, | |
| "learning_rate": 7.158771761692464e-05, | |
| "loss": 0.1268, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.6028143440762597, | |
| "grad_norm": 0.09989681094884872, | |
| "learning_rate": 7.087487262983776e-05, | |
| "loss": 0.1284, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.6100771674988652, | |
| "grad_norm": 0.11307062953710556, | |
| "learning_rate": 7.015685123111276e-05, | |
| "loss": 0.1284, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.6173399909214707, | |
| "grad_norm": 0.11042868345975876, | |
| "learning_rate": 6.943383147090552e-05, | |
| "loss": 0.1253, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.6246028143440763, | |
| "grad_norm": 0.12835900485515594, | |
| "learning_rate": 6.870599263883219e-05, | |
| "loss": 0.1187, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.6318656377666818, | |
| "grad_norm": 0.11985421180725098, | |
| "learning_rate": 6.797351521951021e-05, | |
| "loss": 0.1253, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.6391284611892873, | |
| "grad_norm": 0.13332399725914001, | |
| "learning_rate": 6.723658084780297e-05, | |
| "loss": 0.1147, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.6463912846118929, | |
| "grad_norm": 0.1253022998571396, | |
| "learning_rate": 6.649537226377915e-05, | |
| "loss": 0.1366, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.6536541080344984, | |
| "grad_norm": 0.1309010088443756, | |
| "learning_rate": 6.575007326739809e-05, | |
| "loss": 0.1249, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.660916931457104, | |
| "grad_norm": 0.1471216380596161, | |
| "learning_rate": 6.50008686729323e-05, | |
| "loss": 0.1252, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.6681797548797095, | |
| "grad_norm": 0.1386883407831192, | |
| "learning_rate": 6.424794426313845e-05, | |
| "loss": 0.1291, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.675442578302315, | |
| "grad_norm": 0.11485538631677628, | |
| "learning_rate": 6.349148674318816e-05, | |
| "loss": 0.1291, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.6827054017249206, | |
| "grad_norm": 0.13339963555335999, | |
| "learning_rate": 6.273168369437018e-05, | |
| "loss": 0.1257, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.6899682251475261, | |
| "grad_norm": 0.15178564190864563, | |
| "learning_rate": 6.196872352757516e-05, | |
| "loss": 0.1146, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.6972310485701316, | |
| "grad_norm": 0.1355406641960144, | |
| "learning_rate": 6.12027954365748e-05, | |
| "loss": 0.1339, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.7044938719927372, | |
| "grad_norm": 0.15000687539577484, | |
| "learning_rate": 6.043408935110688e-05, | |
| "loss": 0.1229, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.7117566954153427, | |
| "grad_norm": 0.12488489598035812, | |
| "learning_rate": 5.9662795889777666e-05, | |
| "loss": 0.1262, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.7190195188379482, | |
| "grad_norm": 0.11761627346277237, | |
| "learning_rate": 5.888910631279365e-05, | |
| "loss": 0.1216, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.7262823422605538, | |
| "grad_norm": 0.1294727474451065, | |
| "learning_rate": 5.81132124745341e-05, | |
| "loss": 0.1376, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.7335451656831593, | |
| "grad_norm": 0.14842727780342102, | |
| "learning_rate": 5.733530677597627e-05, | |
| "loss": 0.1165, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.7408079891057648, | |
| "grad_norm": 0.14372870326042175, | |
| "learning_rate": 5.655558211698513e-05, | |
| "loss": 0.1255, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.7480708125283704, | |
| "grad_norm": 0.14958761632442474, | |
| "learning_rate": 5.577423184847932e-05, | |
| "loss": 0.1244, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.7553336359509759, | |
| "grad_norm": 0.1290394514799118, | |
| "learning_rate": 5.499144972448525e-05, | |
| "loss": 0.1238, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.7625964593735814, | |
| "grad_norm": 0.14663836359977722, | |
| "learning_rate": 5.420742985409132e-05, | |
| "loss": 0.1114, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.769859282796187, | |
| "grad_norm": 0.11597703397274017, | |
| "learning_rate": 5.342236665331407e-05, | |
| "loss": 0.1282, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.7771221062187925, | |
| "grad_norm": 0.1349128633737564, | |
| "learning_rate": 5.2636454796888066e-05, | |
| "loss": 0.1225, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.784384929641398, | |
| "grad_norm": 0.11372572183609009, | |
| "learning_rate": 5.1849889169991906e-05, | |
| "loss": 0.1186, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.7916477530640036, | |
| "grad_norm": 0.122071273624897, | |
| "learning_rate": 5.1062864819921784e-05, | |
| "loss": 0.1221, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.7989105764866091, | |
| "grad_norm": 0.08935081958770752, | |
| "learning_rate": 5.027557690772503e-05, | |
| "loss": 0.1256, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.8061733999092147, | |
| "grad_norm": 0.11327587813138962, | |
| "learning_rate": 4.9488220659805326e-05, | |
| "loss": 0.1239, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.8134362233318202, | |
| "grad_norm": 0.10857807844877243, | |
| "learning_rate": 4.870099131951185e-05, | |
| "loss": 0.1238, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.8206990467544257, | |
| "grad_norm": 0.12304297089576721, | |
| "learning_rate": 4.791408409872398e-05, | |
| "loss": 0.1183, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.8279618701770313, | |
| "grad_norm": 0.1079617366194725, | |
| "learning_rate": 4.7127694129444134e-05, | |
| "loss": 0.124, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.8352246935996369, | |
| "grad_norm": 0.12092699110507965, | |
| "learning_rate": 4.634201641541012e-05, | |
| "loss": 0.127, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.8424875170222424, | |
| "grad_norm": 0.12485072761774063, | |
| "learning_rate": 4.555724578373942e-05, | |
| "loss": 0.1194, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.849750340444848, | |
| "grad_norm": 0.12260372936725616, | |
| "learning_rate": 4.477357683661734e-05, | |
| "loss": 0.1279, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.8570131638674535, | |
| "grad_norm": 0.1227007731795311, | |
| "learning_rate": 4.399120390304072e-05, | |
| "loss": 0.1223, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.8642759872900591, | |
| "grad_norm": 0.11986847966909409, | |
| "learning_rate": 4.3210320990629694e-05, | |
| "loss": 0.1273, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.8715388107126646, | |
| "grad_norm": 0.11769075691699982, | |
| "learning_rate": 4.243112173751882e-05, | |
| "loss": 0.1234, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.8788016341352701, | |
| "grad_norm": 0.1076694205403328, | |
| "learning_rate": 4.165379936434011e-05, | |
| "loss": 0.124, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.8860644575578757, | |
| "grad_norm": 0.13070237636566162, | |
| "learning_rate": 4.087854662630937e-05, | |
| "loss": 0.1178, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.8933272809804812, | |
| "grad_norm": 0.09483371675014496, | |
| "learning_rate": 4.0105555765428114e-05, | |
| "loss": 0.1295, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.9005901044030867, | |
| "grad_norm": 0.11234448850154877, | |
| "learning_rate": 3.933501846281267e-05, | |
| "loss": 0.121, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.9078529278256923, | |
| "grad_norm": 0.14361174404621124, | |
| "learning_rate": 3.856712579116229e-05, | |
| "loss": 0.1158, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.9151157512482978, | |
| "grad_norm": 0.10222570598125458, | |
| "learning_rate": 3.780206816737837e-05, | |
| "loss": 0.1152, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.9223785746709033, | |
| "grad_norm": 0.12171214818954468, | |
| "learning_rate": 3.704003530534597e-05, | |
| "loss": 0.1319, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.9296413980935089, | |
| "grad_norm": 0.11967138200998306, | |
| "learning_rate": 3.628121616888999e-05, | |
| "loss": 0.1173, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.9369042215161144, | |
| "grad_norm": 0.12233515828847885, | |
| "learning_rate": 3.5525798924917036e-05, | |
| "loss": 0.1225, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.94416704493872, | |
| "grad_norm": 0.13005629181861877, | |
| "learning_rate": 3.4773970896755164e-05, | |
| "loss": 0.135, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.9514298683613255, | |
| "grad_norm": 0.12671716511249542, | |
| "learning_rate": 3.40259185177026e-05, | |
| "loss": 0.124, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.958692691783931, | |
| "grad_norm": 0.1453058123588562, | |
| "learning_rate": 3.3281827284797316e-05, | |
| "loss": 0.1143, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.9659555152065366, | |
| "grad_norm": 0.13116319477558136, | |
| "learning_rate": 3.254188171281871e-05, | |
| "loss": 0.1115, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.9732183386291421, | |
| "grad_norm": 0.1564348042011261, | |
| "learning_rate": 3.18062652885328e-05, | |
| "loss": 0.1276, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.9804811620517476, | |
| "grad_norm": 0.1428423672914505, | |
| "learning_rate": 3.107516042519248e-05, | |
| "loss": 0.1203, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.9877439854743532, | |
| "grad_norm": 0.11770793795585632, | |
| "learning_rate": 3.0348748417303823e-05, | |
| "loss": 0.1234, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.9950068088969587, | |
| "grad_norm": 0.13844764232635498, | |
| "learning_rate": 2.9627209395669975e-05, | |
| "loss": 0.1293, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 1.0021788470267816, | |
| "grad_norm": 0.09861095994710922, | |
| "learning_rate": 2.89107222827234e-05, | |
| "loss": 0.1065, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 1.0094416704493872, | |
| "grad_norm": 0.12454795092344284, | |
| "learning_rate": 2.8199464748157983e-05, | |
| "loss": 0.0996, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 1.0167044938719927, | |
| "grad_norm": 0.13660405576229095, | |
| "learning_rate": 2.749361316487168e-05, | |
| "loss": 0.0999, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 1.0239673172945982, | |
| "grad_norm": 0.14286108314990997, | |
| "learning_rate": 2.6793342565230674e-05, | |
| "loss": 0.1105, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 1.0312301407172038, | |
| "grad_norm": 0.08573127537965775, | |
| "learning_rate": 2.6098826597666047e-05, | |
| "loss": 0.0958, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 1.0384929641398093, | |
| "grad_norm": 0.12062367796897888, | |
| "learning_rate": 2.5410237483613685e-05, | |
| "loss": 0.0934, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 1.0457557875624148, | |
| "grad_norm": 0.15126581490039825, | |
| "learning_rate": 2.472774597480783e-05, | |
| "loss": 0.1058, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 1.0530186109850204, | |
| "grad_norm": 0.1533040553331375, | |
| "learning_rate": 2.405152131093926e-05, | |
| "loss": 0.0923, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 1.060281434407626, | |
| "grad_norm": 0.13080339133739471, | |
| "learning_rate": 2.3381731177688344e-05, | |
| "loss": 0.1039, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 1.0675442578302314, | |
| "grad_norm": 0.13630296289920807, | |
| "learning_rate": 2.2718541665143543e-05, | |
| "loss": 0.1039, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 1.074807081252837, | |
| "grad_norm": 0.16583819687366486, | |
| "learning_rate": 2.2062117226615374e-05, | |
| "loss": 0.0922, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 1.0820699046754425, | |
| "grad_norm": 0.09012618660926819, | |
| "learning_rate": 2.1412620637856447e-05, | |
| "loss": 0.1116, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 1.089332728098048, | |
| "grad_norm": 0.11278939992189407, | |
| "learning_rate": 2.077021295669743e-05, | |
| "loss": 0.107, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.0965955515206536, | |
| "grad_norm": 0.12911301851272583, | |
| "learning_rate": 2.0135053483108973e-05, | |
| "loss": 0.0943, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 1.1038583749432591, | |
| "grad_norm": 0.1219969317317009, | |
| "learning_rate": 1.950729971969955e-05, | |
| "loss": 0.1022, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 1.1111211983658646, | |
| "grad_norm": 0.13249413669109344, | |
| "learning_rate": 1.8887107332659047e-05, | |
| "loss": 0.097, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 1.1183840217884702, | |
| "grad_norm": 0.12937743961811066, | |
| "learning_rate": 1.8274630113157725e-05, | |
| "loss": 0.0963, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 1.1256468452110757, | |
| "grad_norm": 0.14856944978237152, | |
| "learning_rate": 1.7670019939210024e-05, | |
| "loss": 0.0973, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 1.1329096686336813, | |
| "grad_norm": 0.11450286209583282, | |
| "learning_rate": 1.707342673801294e-05, | |
| "loss": 0.0978, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 1.1401724920562868, | |
| "grad_norm": 0.1289551854133606, | |
| "learning_rate": 1.648499844876802e-05, | |
| "loss": 0.1036, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 1.1474353154788923, | |
| "grad_norm": 0.12307775765657425, | |
| "learning_rate": 1.59048809859965e-05, | |
| "loss": 0.0973, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 1.1546981389014979, | |
| "grad_norm": 0.13354001939296722, | |
| "learning_rate": 1.5333218203356243e-05, | |
| "loss": 0.1044, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 1.1619609623241036, | |
| "grad_norm": 0.11185191571712494, | |
| "learning_rate": 1.4770151857969949e-05, | |
| "loss": 0.104, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.1692237857467092, | |
| "grad_norm": 0.1212216317653656, | |
| "learning_rate": 1.421582157527322e-05, | |
| "loss": 0.113, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 1.1764866091693147, | |
| "grad_norm": 0.11214473098516464, | |
| "learning_rate": 1.3670364814391062e-05, | |
| "loss": 0.097, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 1.1837494325919202, | |
| "grad_norm": 0.09202374517917633, | |
| "learning_rate": 1.3133916834051768e-05, | |
| "loss": 0.0991, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 1.1910122560145258, | |
| "grad_norm": 0.11675283312797546, | |
| "learning_rate": 1.2606610659046314e-05, | |
| "loss": 0.105, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 1.1982750794371313, | |
| "grad_norm": 0.1229914203286171, | |
| "learning_rate": 1.2088577047241833e-05, | |
| "loss": 0.1, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 1.2055379028597368, | |
| "grad_norm": 0.09079571068286896, | |
| "learning_rate": 1.157994445715706e-05, | |
| "loss": 0.1026, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 1.2128007262823424, | |
| "grad_norm": 0.12256491184234619, | |
| "learning_rate": 1.1080839016108086e-05, | |
| "loss": 0.0934, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 1.220063549704948, | |
| "grad_norm": 0.11560764908790588, | |
| "learning_rate": 1.0591384488932187e-05, | |
| "loss": 0.1008, | |
| "step": 1680 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 2100, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 420, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.5179406469592402e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |