Instructions to use quin210/vitutor-gemma4-e4b-sft-full with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use quin210/vitutor-gemma4-e4b-sft-full with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/gemma-4-E4B-it") model = PeftModel.from_pretrained(base_model, "quin210/vitutor-gemma4-e4b-sft-full") - Transformers
How to use quin210/vitutor-gemma4-e4b-sft-full with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="quin210/vitutor-gemma4-e4b-sft-full") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("quin210/vitutor-gemma4-e4b-sft-full", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use quin210/vitutor-gemma4-e4b-sft-full with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "quin210/vitutor-gemma4-e4b-sft-full" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "quin210/vitutor-gemma4-e4b-sft-full", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/quin210/vitutor-gemma4-e4b-sft-full
- SGLang
How to use quin210/vitutor-gemma4-e4b-sft-full with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "quin210/vitutor-gemma4-e4b-sft-full" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "quin210/vitutor-gemma4-e4b-sft-full", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "quin210/vitutor-gemma4-e4b-sft-full" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "quin210/vitutor-gemma4-e4b-sft-full", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Unsloth Studio
How to use quin210/vitutor-gemma4-e4b-sft-full with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for quin210/vitutor-gemma4-e4b-sft-full to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for quin210/vitutor-gemma4-e4b-sft-full to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for quin210/vitutor-gemma4-e4b-sft-full to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="quin210/vitutor-gemma4-e4b-sft-full", max_seq_length=2048, ) - Docker Model Runner
How to use quin210/vitutor-gemma4-e4b-sft-full with Docker Model Runner:
docker model run hf.co/quin210/vitutor-gemma4-e4b-sft-full
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 2917, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.003428914320003429, | |
| "grad_norm": 1.3298883438110352, | |
| "learning_rate": 2.054794520547945e-06, | |
| "loss": 0.8432891845703125, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.006857828640006858, | |
| "grad_norm": 1.4883699417114258, | |
| "learning_rate": 4.337899543378996e-06, | |
| "loss": 0.8494134902954101, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.010286742960010286, | |
| "grad_norm": 1.569236159324646, | |
| "learning_rate": 6.621004566210046e-06, | |
| "loss": 0.7930152893066407, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.013715657280013716, | |
| "grad_norm": 1.444800853729248, | |
| "learning_rate": 8.904109589041095e-06, | |
| "loss": 0.6452465534210206, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.017144571600017144, | |
| "grad_norm": 0.634009838104248, | |
| "learning_rate": 1.1187214611872146e-05, | |
| "loss": 0.47983288764953613, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.020573485920020573, | |
| "grad_norm": 0.35944080352783203, | |
| "learning_rate": 1.3470319634703196e-05, | |
| "loss": 0.38299362659454345, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.024002400240024, | |
| "grad_norm": 0.2663295567035675, | |
| "learning_rate": 1.5753424657534248e-05, | |
| "loss": 0.3400583028793335, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.027431314560027432, | |
| "grad_norm": 0.1992281973361969, | |
| "learning_rate": 1.80365296803653e-05, | |
| "loss": 0.3030625104904175, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.03086022888003086, | |
| "grad_norm": 0.1845274269580841, | |
| "learning_rate": 2.0319634703196345e-05, | |
| "loss": 0.283364462852478, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.03428914320003429, | |
| "grad_norm": 0.15725447237491608, | |
| "learning_rate": 2.2602739726027396e-05, | |
| "loss": 0.27444844245910643, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.03771805752003772, | |
| "grad_norm": 0.1385478377342224, | |
| "learning_rate": 2.4885844748858446e-05, | |
| "loss": 0.2594951391220093, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.041146971840041145, | |
| "grad_norm": 0.1409701704978943, | |
| "learning_rate": 2.71689497716895e-05, | |
| "loss": 0.25205914974212645, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.04457588616004458, | |
| "grad_norm": 0.12514901161193848, | |
| "learning_rate": 2.945205479452055e-05, | |
| "loss": 0.23389830589294433, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.048004800480048, | |
| "grad_norm": 0.20258280634880066, | |
| "learning_rate": 3.17351598173516e-05, | |
| "loss": 0.22158000469207764, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.05143371480005143, | |
| "grad_norm": 0.14751552045345306, | |
| "learning_rate": 3.4018264840182654e-05, | |
| "loss": 0.2103422164916992, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.054862629120054865, | |
| "grad_norm": 0.1548272967338562, | |
| "learning_rate": 3.63013698630137e-05, | |
| "loss": 0.1952539324760437, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.05829154344005829, | |
| "grad_norm": 0.12594084441661835, | |
| "learning_rate": 3.8584474885844754e-05, | |
| "loss": 0.19135934114456177, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.06172045776006172, | |
| "grad_norm": 0.14258800446987152, | |
| "learning_rate": 4.08675799086758e-05, | |
| "loss": 0.17143574953079224, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.06514937208006515, | |
| "grad_norm": 0.1194511353969574, | |
| "learning_rate": 4.3150684931506855e-05, | |
| "loss": 0.15910775661468507, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.06857828640006858, | |
| "grad_norm": 0.16704410314559937, | |
| "learning_rate": 4.54337899543379e-05, | |
| "loss": 0.1537066102027893, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.07200720072007201, | |
| "grad_norm": 0.12291927635669708, | |
| "learning_rate": 4.7716894977168955e-05, | |
| "loss": 0.1391252398490906, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.07543611504007544, | |
| "grad_norm": 0.12858909368515015, | |
| "learning_rate": 5e-05, | |
| "loss": 0.1354471802711487, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.07886502936007886, | |
| "grad_norm": 0.12648724019527435, | |
| "learning_rate": 5.2283105022831056e-05, | |
| "loss": 0.12894512414932252, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.08229394368008229, | |
| "grad_norm": 0.12357676029205322, | |
| "learning_rate": 5.45662100456621e-05, | |
| "loss": 0.12626115083694459, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.08572285800008572, | |
| "grad_norm": 0.1405642181634903, | |
| "learning_rate": 5.684931506849316e-05, | |
| "loss": 0.11540137529373169, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.08915177232008915, | |
| "grad_norm": 0.17321588099002838, | |
| "learning_rate": 5.9132420091324204e-05, | |
| "loss": 0.11650693416595459, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.09258068664009259, | |
| "grad_norm": 0.13030178844928741, | |
| "learning_rate": 6.141552511415526e-05, | |
| "loss": 0.11383731365203857, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.096009600960096, | |
| "grad_norm": 0.20526033639907837, | |
| "learning_rate": 6.36986301369863e-05, | |
| "loss": 0.11148416996002197, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.09943851528009943, | |
| "grad_norm": 0.12799160182476044, | |
| "learning_rate": 6.598173515981736e-05, | |
| "loss": 0.10550851821899414, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.10286742960010287, | |
| "grad_norm": 0.10688431560993195, | |
| "learning_rate": 6.82648401826484e-05, | |
| "loss": 0.09785101413726807, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.1062963439201063, | |
| "grad_norm": 0.1471128910779953, | |
| "learning_rate": 7.054794520547947e-05, | |
| "loss": 0.10035187005996704, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.10972525824010973, | |
| "grad_norm": 0.15709125995635986, | |
| "learning_rate": 7.28310502283105e-05, | |
| "loss": 0.09798988699913025, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.11315417256011315, | |
| "grad_norm": 0.17999057471752167, | |
| "learning_rate": 7.511415525114156e-05, | |
| "loss": 0.1036344051361084, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.11658308688011658, | |
| "grad_norm": 0.13842232525348663, | |
| "learning_rate": 7.73972602739726e-05, | |
| "loss": 0.09758269786834717, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.12001200120012001, | |
| "grad_norm": 0.26885131001472473, | |
| "learning_rate": 7.968036529680367e-05, | |
| "loss": 0.09586278200149537, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.12344091552012344, | |
| "grad_norm": 0.19039925932884216, | |
| "learning_rate": 8.19634703196347e-05, | |
| "loss": 0.0976291537284851, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.12686982984012687, | |
| "grad_norm": 0.1937050223350525, | |
| "learning_rate": 8.424657534246576e-05, | |
| "loss": 0.09275003671646118, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.1302987441601303, | |
| "grad_norm": 0.18121008574962616, | |
| "learning_rate": 8.65296803652968e-05, | |
| "loss": 0.09187136888504029, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.13372765848013374, | |
| "grad_norm": 0.1285638064146042, | |
| "learning_rate": 8.881278538812787e-05, | |
| "loss": 0.09056932926177978, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.13715657280013716, | |
| "grad_norm": 0.10619012266397476, | |
| "learning_rate": 9.109589041095891e-05, | |
| "loss": 0.08771317005157471, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.14058548712014057, | |
| "grad_norm": 0.13739266991615295, | |
| "learning_rate": 9.337899543378996e-05, | |
| "loss": 0.08628376722335815, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.14401440144014402, | |
| "grad_norm": 0.11956508457660675, | |
| "learning_rate": 9.5662100456621e-05, | |
| "loss": 0.0913696527481079, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.14744331576014744, | |
| "grad_norm": 0.13098114728927612, | |
| "learning_rate": 9.794520547945207e-05, | |
| "loss": 0.09056272506713867, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.15087223008015088, | |
| "grad_norm": 0.14199639856815338, | |
| "learning_rate": 0.00010022831050228312, | |
| "loss": 0.08974846601486205, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.1543011444001543, | |
| "grad_norm": 0.12583988904953003, | |
| "learning_rate": 0.00010251141552511416, | |
| "loss": 0.08946011662483215, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.15773005872015772, | |
| "grad_norm": 0.11818652600049973, | |
| "learning_rate": 0.0001047945205479452, | |
| "loss": 0.0851108729839325, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.16115897304016116, | |
| "grad_norm": 0.12538324296474457, | |
| "learning_rate": 0.00010707762557077626, | |
| "loss": 0.08938277363777161, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.16458788736016458, | |
| "grad_norm": 0.12186136096715927, | |
| "learning_rate": 0.00010936073059360732, | |
| "loss": 0.08132482171058655, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.16801680168016803, | |
| "grad_norm": 0.13485857844352722, | |
| "learning_rate": 0.00011164383561643836, | |
| "loss": 0.08109607100486756, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.17144571600017144, | |
| "grad_norm": 0.11099082231521606, | |
| "learning_rate": 0.0001139269406392694, | |
| "loss": 0.0870327353477478, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.17487463032017486, | |
| "grad_norm": 0.1529977172613144, | |
| "learning_rate": 0.00011621004566210046, | |
| "loss": 0.08298802971839905, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.1783035446401783, | |
| "grad_norm": 0.12247070670127869, | |
| "learning_rate": 0.00011849315068493152, | |
| "loss": 0.08257973790168763, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.18173245896018173, | |
| "grad_norm": 0.09750987589359283, | |
| "learning_rate": 0.00012077625570776256, | |
| "loss": 0.08538851737976075, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.18516137328018517, | |
| "grad_norm": 0.1477072685956955, | |
| "learning_rate": 0.0001230593607305936, | |
| "loss": 0.07966969013214112, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.1885902876001886, | |
| "grad_norm": 0.1115131676197052, | |
| "learning_rate": 0.00012534246575342465, | |
| "loss": 0.0803002655506134, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.192019201920192, | |
| "grad_norm": 0.11209847778081894, | |
| "learning_rate": 0.0001276255707762557, | |
| "loss": 0.08299272656440734, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.19544811624019545, | |
| "grad_norm": 0.10297664999961853, | |
| "learning_rate": 0.00012990867579908675, | |
| "loss": 0.07735013961791992, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.19887703056019887, | |
| "grad_norm": 0.1319982260465622, | |
| "learning_rate": 0.00013219178082191782, | |
| "loss": 0.07743288278579712, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.20230594488020232, | |
| "grad_norm": 0.11637051403522491, | |
| "learning_rate": 0.00013447488584474886, | |
| "loss": 0.0807669997215271, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.20573485920020573, | |
| "grad_norm": 0.11369775235652924, | |
| "learning_rate": 0.00013675799086757993, | |
| "loss": 0.07854493260383606, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.20916377352020915, | |
| "grad_norm": 0.1144910454750061, | |
| "learning_rate": 0.00013904109589041097, | |
| "loss": 0.07866560816764831, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.2125926878402126, | |
| "grad_norm": 0.12000512331724167, | |
| "learning_rate": 0.000141324200913242, | |
| "loss": 0.08003532290458679, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.21602160216021601, | |
| "grad_norm": 0.13864439725875854, | |
| "learning_rate": 0.00014360730593607305, | |
| "loss": 0.07690358757972718, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.21945051648021946, | |
| "grad_norm": 0.11890323460102081, | |
| "learning_rate": 0.00014589041095890411, | |
| "loss": 0.08117523193359374, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.22287943080022288, | |
| "grad_norm": 0.10761404037475586, | |
| "learning_rate": 0.00014817351598173515, | |
| "loss": 0.07784844636917114, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.2263083451202263, | |
| "grad_norm": 0.1405085325241089, | |
| "learning_rate": 0.00015045662100456622, | |
| "loss": 0.07747803926467896, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.22973725944022974, | |
| "grad_norm": 0.12741142511367798, | |
| "learning_rate": 0.0001527397260273973, | |
| "loss": 0.08193380236625672, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.23316617376023316, | |
| "grad_norm": 0.11028678715229034, | |
| "learning_rate": 0.00015502283105022833, | |
| "loss": 0.08220186829566956, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.2365950880802366, | |
| "grad_norm": 0.09016034752130508, | |
| "learning_rate": 0.00015730593607305937, | |
| "loss": 0.07895171046257018, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.24002400240024002, | |
| "grad_norm": 0.12008935213088989, | |
| "learning_rate": 0.0001595890410958904, | |
| "loss": 0.07650137543678284, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.24345291672024344, | |
| "grad_norm": 0.08145634084939957, | |
| "learning_rate": 0.00016187214611872148, | |
| "loss": 0.07745814323425293, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.24688183104024689, | |
| "grad_norm": 0.08875567466020584, | |
| "learning_rate": 0.00016415525114155252, | |
| "loss": 0.0772017478942871, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.25031074536025033, | |
| "grad_norm": 0.08266468346118927, | |
| "learning_rate": 0.00016643835616438356, | |
| "loss": 0.07902273535728455, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.25373965968025375, | |
| "grad_norm": 0.12261392921209335, | |
| "learning_rate": 0.00016872146118721462, | |
| "loss": 0.07991406917572022, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.25716857400025717, | |
| "grad_norm": 0.15539783239364624, | |
| "learning_rate": 0.0001710045662100457, | |
| "loss": 0.0717797577381134, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.2605974883202606, | |
| "grad_norm": 0.12941250205039978, | |
| "learning_rate": 0.00017328767123287673, | |
| "loss": 0.07801813483238221, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.264026402640264, | |
| "grad_norm": 0.10697443783283234, | |
| "learning_rate": 0.00017557077625570777, | |
| "loss": 0.08085813522338867, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.2674553169602675, | |
| "grad_norm": 0.1086842268705368, | |
| "learning_rate": 0.0001778538812785388, | |
| "loss": 0.07432876825332642, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.2708842312802709, | |
| "grad_norm": 0.12223174422979355, | |
| "learning_rate": 0.00018013698630136988, | |
| "loss": 0.08123633861541749, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.2743131456002743, | |
| "grad_norm": 0.09192939847707748, | |
| "learning_rate": 0.00018242009132420092, | |
| "loss": 0.07588958740234375, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.27774205992027773, | |
| "grad_norm": 0.10211896896362305, | |
| "learning_rate": 0.00018470319634703196, | |
| "loss": 0.0751219093799591, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.28117097424028115, | |
| "grad_norm": 0.09135781228542328, | |
| "learning_rate": 0.00018698630136986303, | |
| "loss": 0.07519081234931946, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.2845998885602846, | |
| "grad_norm": 0.0870634913444519, | |
| "learning_rate": 0.0001892694063926941, | |
| "loss": 0.07777546644210816, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.28802880288028804, | |
| "grad_norm": 0.10131728649139404, | |
| "learning_rate": 0.00019155251141552513, | |
| "loss": 0.07261776924133301, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.29145771720029146, | |
| "grad_norm": 0.07320058345794678, | |
| "learning_rate": 0.00019383561643835617, | |
| "loss": 0.07279639840126037, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.2948866315202949, | |
| "grad_norm": 0.08462163805961609, | |
| "learning_rate": 0.00019611872146118721, | |
| "loss": 0.07540533542633057, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.2983155458402983, | |
| "grad_norm": 0.07783285528421402, | |
| "learning_rate": 0.00019840182648401828, | |
| "loss": 0.07547606229782104, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.30174446016030176, | |
| "grad_norm": 0.08769109100103378, | |
| "learning_rate": 0.00019999999445216476, | |
| "loss": 0.07635555267333985, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.3051733744803052, | |
| "grad_norm": 0.09398491680622101, | |
| "learning_rate": 0.0001999998958239994, | |
| "loss": 0.07587789893150329, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.3086022888003086, | |
| "grad_norm": 0.10255398601293564, | |
| "learning_rate": 0.0001999996739107459, | |
| "loss": 0.0769170880317688, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.312031203120312, | |
| "grad_norm": 0.07438833266496658, | |
| "learning_rate": 0.00019999932871267792, | |
| "loss": 0.07230271697044373, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.31546011744031544, | |
| "grad_norm": 0.12263499200344086, | |
| "learning_rate": 0.0001999988602302209, | |
| "loss": 0.0734669029712677, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.3188890317603189, | |
| "grad_norm": 0.07665298879146576, | |
| "learning_rate": 0.00019999826846395254, | |
| "loss": 0.07372477054595947, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.3223179460803223, | |
| "grad_norm": 0.1038631722331047, | |
| "learning_rate": 0.00019999755341460236, | |
| "loss": 0.07595999836921692, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.32574686040032574, | |
| "grad_norm": 0.08356453478336334, | |
| "learning_rate": 0.00019999671508305185, | |
| "loss": 0.07429630756378174, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.32917577472032916, | |
| "grad_norm": 0.09604129195213318, | |
| "learning_rate": 0.0001999957534703346, | |
| "loss": 0.07514963746070862, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.3326046890403326, | |
| "grad_norm": 0.07055286318063736, | |
| "learning_rate": 0.00019999466857763615, | |
| "loss": 0.06938321590423584, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.33603360336033605, | |
| "grad_norm": 0.09927641600370407, | |
| "learning_rate": 0.000199993460406294, | |
| "loss": 0.07581758499145508, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.33946251768033947, | |
| "grad_norm": 0.1004660576581955, | |
| "learning_rate": 0.0001999921289577976, | |
| "loss": 0.07313386201858521, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.3428914320003429, | |
| "grad_norm": 0.07290191948413849, | |
| "learning_rate": 0.00019999067423378853, | |
| "loss": 0.07103977799415588, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.3463203463203463, | |
| "grad_norm": 0.08976606279611588, | |
| "learning_rate": 0.00019998909623606014, | |
| "loss": 0.07495319843292236, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.3497492606403497, | |
| "grad_norm": 0.08071667701005936, | |
| "learning_rate": 0.0001999873949665579, | |
| "loss": 0.06945164203643799, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.3531781749603532, | |
| "grad_norm": 0.07254912704229355, | |
| "learning_rate": 0.0001999855704273793, | |
| "loss": 0.0715824842453003, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.3566070892803566, | |
| "grad_norm": 0.07526320964097977, | |
| "learning_rate": 0.00019998362262077364, | |
| "loss": 0.07164299488067627, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.36003600360036003, | |
| "grad_norm": 0.09813207387924194, | |
| "learning_rate": 0.0001999815515491423, | |
| "loss": 0.07462467551231385, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.36346491792036345, | |
| "grad_norm": 0.08068419992923737, | |
| "learning_rate": 0.0001999793572150386, | |
| "loss": 0.07437445521354676, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.36689383224036687, | |
| "grad_norm": 0.08591397106647491, | |
| "learning_rate": 0.0001999770396211679, | |
| "loss": 0.07437514662742614, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.37032274656037034, | |
| "grad_norm": 0.11709548532962799, | |
| "learning_rate": 0.00019997459877038734, | |
| "loss": 0.0700849175453186, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.37375166088037376, | |
| "grad_norm": 0.09189271181821823, | |
| "learning_rate": 0.00019997203466570618, | |
| "loss": 0.07723066210746765, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.3771805752003772, | |
| "grad_norm": 0.1487947404384613, | |
| "learning_rate": 0.00019996934731028558, | |
| "loss": 0.06955035328865052, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.3806094895203806, | |
| "grad_norm": 0.06110523268580437, | |
| "learning_rate": 0.00019996653670743868, | |
| "loss": 0.07219574451446534, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.384038403840384, | |
| "grad_norm": 0.09093336760997772, | |
| "learning_rate": 0.00019996360286063047, | |
| "loss": 0.07197158336639405, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.3874673181603875, | |
| "grad_norm": 0.07465828955173492, | |
| "learning_rate": 0.00019996054577347804, | |
| "loss": 0.06595431566238404, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.3908962324803909, | |
| "grad_norm": 0.06949753314256668, | |
| "learning_rate": 0.00019995736544975022, | |
| "loss": 0.06800097823143006, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.3943251468003943, | |
| "grad_norm": 0.06402743607759476, | |
| "learning_rate": 0.00019995406189336797, | |
| "loss": 0.06762506961822509, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.39775406112039774, | |
| "grad_norm": 0.07319864630699158, | |
| "learning_rate": 0.00019995063510840403, | |
| "loss": 0.06694105267524719, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.40118297544040116, | |
| "grad_norm": 0.07902734726667404, | |
| "learning_rate": 0.00019994708509908318, | |
| "loss": 0.07268706560134888, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.40461188976040463, | |
| "grad_norm": 0.08665812760591507, | |
| "learning_rate": 0.000199943411869782, | |
| "loss": 0.07282707095146179, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.40804080408040805, | |
| "grad_norm": 0.06259504705667496, | |
| "learning_rate": 0.00019993961542502902, | |
| "loss": 0.07454213500022888, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.41146971840041147, | |
| "grad_norm": 0.09083051979541779, | |
| "learning_rate": 0.0001999356957695048, | |
| "loss": 0.070106840133667, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.4148986327204149, | |
| "grad_norm": 0.07197695225477219, | |
| "learning_rate": 0.00019993165290804158, | |
| "loss": 0.07483985424041747, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.4183275470404183, | |
| "grad_norm": 0.0816626250743866, | |
| "learning_rate": 0.00019992748684562366, | |
| "loss": 0.07281675934791565, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.4217564613604218, | |
| "grad_norm": 0.09566456824541092, | |
| "learning_rate": 0.0001999231975873872, | |
| "loss": 0.07552507519721985, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.4251853756804252, | |
| "grad_norm": 0.07115880399942398, | |
| "learning_rate": 0.00019991878513862018, | |
| "loss": 0.0698797047138214, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.4286142900004286, | |
| "grad_norm": 0.06638191640377045, | |
| "learning_rate": 0.0001999142495047625, | |
| "loss": 0.07549352645874023, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.43204320432043203, | |
| "grad_norm": 0.08422329276800156, | |
| "learning_rate": 0.000199909590691406, | |
| "loss": 0.06987190246582031, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.43547211864043545, | |
| "grad_norm": 0.06643088161945343, | |
| "learning_rate": 0.0001999048087042942, | |
| "loss": 0.0773307740688324, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.4389010329604389, | |
| "grad_norm": 0.07236617058515549, | |
| "learning_rate": 0.00019989990354932265, | |
| "loss": 0.06638508439064025, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.44232994728044234, | |
| "grad_norm": 0.09377867728471756, | |
| "learning_rate": 0.00019989487523253865, | |
| "loss": 0.07471420168876648, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.44575886160044575, | |
| "grad_norm": 0.07945447415113449, | |
| "learning_rate": 0.00019988972376014142, | |
| "loss": 0.07506393194198609, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.4491877759204492, | |
| "grad_norm": 0.06589485704898834, | |
| "learning_rate": 0.00019988444913848188, | |
| "loss": 0.06664330363273621, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.4526166902404526, | |
| "grad_norm": 0.07233788818120956, | |
| "learning_rate": 0.00019987905137406294, | |
| "loss": 0.07118790149688721, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.45604560456045606, | |
| "grad_norm": 0.08887393772602081, | |
| "learning_rate": 0.00019987353047353922, | |
| "loss": 0.0676496684551239, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.4594745188804595, | |
| "grad_norm": 0.07033324986696243, | |
| "learning_rate": 0.00019986788644371715, | |
| "loss": 0.07179500460624695, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.4629034332004629, | |
| "grad_norm": 0.07686027884483337, | |
| "learning_rate": 0.000199862119291555, | |
| "loss": 0.07234726548194885, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.4663323475204663, | |
| "grad_norm": 0.08190786093473434, | |
| "learning_rate": 0.00019985622902416283, | |
| "loss": 0.07036671042442322, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.46976126184046973, | |
| "grad_norm": 0.07698442786931992, | |
| "learning_rate": 0.00019985021564880245, | |
| "loss": 0.06707795858383178, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.4731901761604732, | |
| "grad_norm": 0.08871393650770187, | |
| "learning_rate": 0.00019984407917288745, | |
| "loss": 0.06883646249771118, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.4766190904804766, | |
| "grad_norm": 0.08392845839262009, | |
| "learning_rate": 0.00019983781960398325, | |
| "loss": 0.07154896259307861, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.48004800480048004, | |
| "grad_norm": 0.07391165941953659, | |
| "learning_rate": 0.00019983143694980694, | |
| "loss": 0.06980017423629761, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.48347691912048346, | |
| "grad_norm": 0.0696796178817749, | |
| "learning_rate": 0.00019982493121822737, | |
| "loss": 0.07289748191833496, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.4869058334404869, | |
| "grad_norm": 0.057650376111269, | |
| "learning_rate": 0.00019981830241726516, | |
| "loss": 0.06804858446121216, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.49033474776049035, | |
| "grad_norm": 0.08872418850660324, | |
| "learning_rate": 0.00019981155055509266, | |
| "loss": 0.0683191955089569, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.49376366208049377, | |
| "grad_norm": 0.06679575145244598, | |
| "learning_rate": 0.0001998046756400339, | |
| "loss": 0.07029005289077758, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.4971925764004972, | |
| "grad_norm": 0.07526200264692307, | |
| "learning_rate": 0.00019979767768056464, | |
| "loss": 0.07121672034263611, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.5006214907205007, | |
| "grad_norm": 0.13412092626094818, | |
| "learning_rate": 0.00019979055668531236, | |
| "loss": 0.07710989117622376, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.504050405040504, | |
| "grad_norm": 0.10995283722877502, | |
| "learning_rate": 0.0001997833126630561, | |
| "loss": 0.07113178968429565, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.5074793193605075, | |
| "grad_norm": 0.07785722613334656, | |
| "learning_rate": 0.00019977594562272676, | |
| "loss": 0.07184987664222717, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.5109082336805109, | |
| "grad_norm": 0.061964794993400574, | |
| "learning_rate": 0.0001997684555734068, | |
| "loss": 0.0705429494380951, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.5143371480005143, | |
| "grad_norm": 0.0596599318087101, | |
| "learning_rate": 0.0001997608425243303, | |
| "loss": 0.06806035041809082, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.5177660623205178, | |
| "grad_norm": 0.07160928100347519, | |
| "learning_rate": 0.00019975310648488306, | |
| "loss": 0.0710654079914093, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.5211949766405212, | |
| "grad_norm": 0.06318478286266327, | |
| "learning_rate": 0.00019974524746460245, | |
| "loss": 0.06881251335144042, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.5246238909605246, | |
| "grad_norm": 0.06995552778244019, | |
| "learning_rate": 0.0001997372654731775, | |
| "loss": 0.07101587653160095, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.528052805280528, | |
| "grad_norm": 0.0636630430817604, | |
| "learning_rate": 0.00019972916052044882, | |
| "loss": 0.06702117919921875, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.5314817196005315, | |
| "grad_norm": 0.06165006011724472, | |
| "learning_rate": 0.00019972093261640863, | |
| "loss": 0.06591456532478332, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.534910633920535, | |
| "grad_norm": 0.06443383544683456, | |
| "learning_rate": 0.00019971258177120071, | |
| "loss": 0.07227083444595336, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.5383395482405383, | |
| "grad_norm": 0.07027114182710648, | |
| "learning_rate": 0.00019970410799512037, | |
| "loss": 0.062342596054077146, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.5417684625605418, | |
| "grad_norm": 0.046684492379426956, | |
| "learning_rate": 0.00019969551129861462, | |
| "loss": 0.06642588973045349, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.5451973768805451, | |
| "grad_norm": 0.06529752910137177, | |
| "learning_rate": 0.00019968679169228183, | |
| "loss": 0.06675980091094971, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.5486262912005486, | |
| "grad_norm": 0.06308460235595703, | |
| "learning_rate": 0.00019967794918687202, | |
| "loss": 0.0655122697353363, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.5520552055205521, | |
| "grad_norm": 0.060192737728357315, | |
| "learning_rate": 0.0001996689837932867, | |
| "loss": 0.06651552319526673, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.5554841198405555, | |
| "grad_norm": 0.056659456342458725, | |
| "learning_rate": 0.00019965989552257887, | |
| "loss": 0.06584551334381103, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.5589130341605589, | |
| "grad_norm": 0.054737452417612076, | |
| "learning_rate": 0.000199650684385953, | |
| "loss": 0.06906264424324035, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.5623419484805623, | |
| "grad_norm": 0.06594469398260117, | |
| "learning_rate": 0.0001996413503947651, | |
| "loss": 0.06982675790786744, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.5657708628005658, | |
| "grad_norm": 0.06081661209464073, | |
| "learning_rate": 0.00019963189356052259, | |
| "loss": 0.0662455141544342, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.5691997771205692, | |
| "grad_norm": 0.05774581804871559, | |
| "learning_rate": 0.0001996223138948843, | |
| "loss": 0.06652381420135497, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.5726286914405726, | |
| "grad_norm": 0.062362875789403915, | |
| "learning_rate": 0.0001996126114096606, | |
| "loss": 0.06487467885017395, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.5760576057605761, | |
| "grad_norm": 0.06780681014060974, | |
| "learning_rate": 0.00019960278611681322, | |
| "loss": 0.06824981570243835, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.5794865200805794, | |
| "grad_norm": 0.06902427971363068, | |
| "learning_rate": 0.00019959283802845526, | |
| "loss": 0.06992611885070801, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.5829154344005829, | |
| "grad_norm": 0.06338348239660263, | |
| "learning_rate": 0.00019958276715685124, | |
| "loss": 0.0669023871421814, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.5863443487205864, | |
| "grad_norm": 0.06664100289344788, | |
| "learning_rate": 0.0001995725735144171, | |
| "loss": 0.07338454723358154, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.5897732630405897, | |
| "grad_norm": 0.0678853988647461, | |
| "learning_rate": 0.00019956225711372004, | |
| "loss": 0.06788999438285828, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.5932021773605932, | |
| "grad_norm": 0.07547562569379807, | |
| "learning_rate": 0.00019955181796747868, | |
| "loss": 0.06702386736869811, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.5966310916805966, | |
| "grad_norm": 0.054227564483881, | |
| "learning_rate": 0.00019954125608856297, | |
| "loss": 0.06447795629501343, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.6000600060006, | |
| "grad_norm": 0.06533336639404297, | |
| "learning_rate": 0.00019953057148999412, | |
| "loss": 0.06636461615562439, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.6034889203206035, | |
| "grad_norm": 0.06058265641331673, | |
| "learning_rate": 0.00019951976418494468, | |
| "loss": 0.0677622377872467, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.6069178346406069, | |
| "grad_norm": 0.06041079759597778, | |
| "learning_rate": 0.0001995088341867384, | |
| "loss": 0.06635680794715881, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.6103467489606104, | |
| "grad_norm": 0.05961493402719498, | |
| "learning_rate": 0.00019949778150885042, | |
| "loss": 0.06692826151847839, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.6137756632806137, | |
| "grad_norm": 0.07581457495689392, | |
| "learning_rate": 0.00019948660616490703, | |
| "loss": 0.06609666347503662, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.6172045776006172, | |
| "grad_norm": 0.05494590476155281, | |
| "learning_rate": 0.00019947530816868576, | |
| "loss": 0.06787877082824707, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.6206334919206207, | |
| "grad_norm": 0.07579834014177322, | |
| "learning_rate": 0.0001994638875341154, | |
| "loss": 0.06385068893432617, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.624062406240624, | |
| "grad_norm": 0.06341655552387238, | |
| "learning_rate": 0.0001994523442752759, | |
| "loss": 0.06808843016624451, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.6274913205606275, | |
| "grad_norm": 0.05943651869893074, | |
| "learning_rate": 0.0001994406784063984, | |
| "loss": 0.06618317365646362, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.6309202348806309, | |
| "grad_norm": 0.05437728762626648, | |
| "learning_rate": 0.00019942888994186518, | |
| "loss": 0.07004727125167846, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.6343491492006343, | |
| "grad_norm": 0.0638783648610115, | |
| "learning_rate": 0.00019941697889620962, | |
| "loss": 0.0705324113368988, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.6377780635206378, | |
| "grad_norm": 0.06645606458187103, | |
| "learning_rate": 0.00019940494528411637, | |
| "loss": 0.06418377161026001, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 0.6412069778406412, | |
| "grad_norm": 0.06460703909397125, | |
| "learning_rate": 0.00019939278912042103, | |
| "loss": 0.06468948721885681, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 0.6446358921606447, | |
| "grad_norm": 0.05361228436231613, | |
| "learning_rate": 0.0001993805104201104, | |
| "loss": 0.06462889313697814, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 0.648064806480648, | |
| "grad_norm": 0.09618914872407913, | |
| "learning_rate": 0.00019936810919832224, | |
| "loss": 0.06841772198677062, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 0.6514937208006515, | |
| "grad_norm": 0.0680570900440216, | |
| "learning_rate": 0.0001993555854703455, | |
| "loss": 0.07115979194641113, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.654922635120655, | |
| "grad_norm": 0.07154513150453568, | |
| "learning_rate": 0.00019934293925162003, | |
| "loss": 0.06491658687591553, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 0.6583515494406583, | |
| "grad_norm": 0.05888069421052933, | |
| "learning_rate": 0.00019933017055773675, | |
| "loss": 0.06860610246658325, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 0.6617804637606618, | |
| "grad_norm": 0.06386138498783112, | |
| "learning_rate": 0.00019931727940443762, | |
| "loss": 0.06297200322151184, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 0.6652093780806652, | |
| "grad_norm": 0.0675712302327156, | |
| "learning_rate": 0.00019930426580761545, | |
| "loss": 0.0634054958820343, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 0.6686382924006686, | |
| "grad_norm": 0.06546768546104431, | |
| "learning_rate": 0.00019929112978331415, | |
| "loss": 0.07228370308876038, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.6720672067206721, | |
| "grad_norm": 0.0673958882689476, | |
| "learning_rate": 0.0001992778713477285, | |
| "loss": 0.0674474835395813, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 0.6754961210406755, | |
| "grad_norm": 0.11614768952131271, | |
| "learning_rate": 0.00019926449051720413, | |
| "loss": 0.06380310654640198, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 0.6789250353606789, | |
| "grad_norm": 0.07336936891078949, | |
| "learning_rate": 0.00019925098730823763, | |
| "loss": 0.06617136597633362, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 0.6823539496806823, | |
| "grad_norm": 0.048847053200006485, | |
| "learning_rate": 0.00019923736173747654, | |
| "loss": 0.06561228036880493, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 0.6857828640006858, | |
| "grad_norm": 0.07655756920576096, | |
| "learning_rate": 0.00019922361382171907, | |
| "loss": 0.06520624160766601, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.6892117783206893, | |
| "grad_norm": 0.06696760654449463, | |
| "learning_rate": 0.00019920974357791446, | |
| "loss": 0.0701349914073944, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 0.6926406926406926, | |
| "grad_norm": 0.06227932125329971, | |
| "learning_rate": 0.00019919575102316262, | |
| "loss": 0.0680422067642212, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 0.6960696069606961, | |
| "grad_norm": 0.061125896871089935, | |
| "learning_rate": 0.00019918163617471427, | |
| "loss": 0.06432726383209228, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 0.6994985212806994, | |
| "grad_norm": 0.07095475494861603, | |
| "learning_rate": 0.00019916739904997103, | |
| "loss": 0.06661240458488464, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 0.7029274356007029, | |
| "grad_norm": 0.0691307857632637, | |
| "learning_rate": 0.00019915303966648509, | |
| "loss": 0.05807797908782959, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.7063563499207064, | |
| "grad_norm": 0.05840357765555382, | |
| "learning_rate": 0.00019913855804195945, | |
| "loss": 0.06822753548622132, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 0.7097852642407098, | |
| "grad_norm": 0.07420432567596436, | |
| "learning_rate": 0.00019912395419424786, | |
| "loss": 0.06311638951301575, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 0.7132141785607132, | |
| "grad_norm": 0.06721077114343643, | |
| "learning_rate": 0.00019910922814135465, | |
| "loss": 0.06664948463439942, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 0.7166430928807166, | |
| "grad_norm": 0.05893215909600258, | |
| "learning_rate": 0.0001990943799014349, | |
| "loss": 0.06596503853797912, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 0.7200720072007201, | |
| "grad_norm": 0.06285710632801056, | |
| "learning_rate": 0.0001990794094927943, | |
| "loss": 0.06053690910339356, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.7235009215207235, | |
| "grad_norm": 0.06883195042610168, | |
| "learning_rate": 0.00019906431693388914, | |
| "loss": 0.06739038228988647, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 0.7269298358407269, | |
| "grad_norm": 0.06060967966914177, | |
| "learning_rate": 0.00019904910224332632, | |
| "loss": 0.06340742111206055, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 0.7303587501607304, | |
| "grad_norm": 0.06806771457195282, | |
| "learning_rate": 0.00019903376543986328, | |
| "loss": 0.06537085771560669, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 0.7337876644807337, | |
| "grad_norm": 0.05098235607147217, | |
| "learning_rate": 0.00019901830654240805, | |
| "loss": 0.061222386360168454, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 0.7372165788007372, | |
| "grad_norm": 0.05651809275150299, | |
| "learning_rate": 0.00019900272557001918, | |
| "loss": 0.06748454570770264, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.7406454931207407, | |
| "grad_norm": 0.07300875335931778, | |
| "learning_rate": 0.00019898702254190568, | |
| "loss": 0.06485098600387573, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 0.744074407440744, | |
| "grad_norm": 0.06163975968956947, | |
| "learning_rate": 0.00019897119747742706, | |
| "loss": 0.06237448453903198, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 0.7475033217607475, | |
| "grad_norm": 0.06156700477004051, | |
| "learning_rate": 0.00019895525039609327, | |
| "loss": 0.06336918473243713, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 0.7509322360807509, | |
| "grad_norm": 0.05241743102669716, | |
| "learning_rate": 0.00019893918131756478, | |
| "loss": 0.06216521263122558, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 0.7543611504007544, | |
| "grad_norm": 0.06804622709751129, | |
| "learning_rate": 0.00019892299026165233, | |
| "loss": 0.06613343954086304, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.7577900647207578, | |
| "grad_norm": 0.08165010064840317, | |
| "learning_rate": 0.00019890667724831707, | |
| "loss": 0.06366372108459473, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 0.7612189790407612, | |
| "grad_norm": 0.06307308375835419, | |
| "learning_rate": 0.0001988902422976706, | |
| "loss": 0.06628135442733765, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 0.7646478933607647, | |
| "grad_norm": 0.0657610297203064, | |
| "learning_rate": 0.00019887368542997476, | |
| "loss": 0.06268489360809326, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 0.768076807680768, | |
| "grad_norm": 0.0674707219004631, | |
| "learning_rate": 0.0001988570066656417, | |
| "loss": 0.06617584228515624, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 0.7715057220007715, | |
| "grad_norm": 0.05486510321497917, | |
| "learning_rate": 0.0001988402060252339, | |
| "loss": 0.06360874176025391, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.774934636320775, | |
| "grad_norm": 0.05392001196742058, | |
| "learning_rate": 0.00019882328352946403, | |
| "loss": 0.06193780303001404, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 0.7783635506407783, | |
| "grad_norm": 0.05386793240904808, | |
| "learning_rate": 0.00019880623919919506, | |
| "loss": 0.06729251742362977, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 0.7817924649607818, | |
| "grad_norm": 0.05438312143087387, | |
| "learning_rate": 0.0001987890730554401, | |
| "loss": 0.06320361495018005, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 0.7852213792807852, | |
| "grad_norm": 0.050483524799346924, | |
| "learning_rate": 0.0001987717851193625, | |
| "loss": 0.06522406339645385, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 0.7886502936007886, | |
| "grad_norm": 0.05501532927155495, | |
| "learning_rate": 0.00019875437541227572, | |
| "loss": 0.06552278399467468, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.7920792079207921, | |
| "grad_norm": 0.06172218918800354, | |
| "learning_rate": 0.00019873684395564333, | |
| "loss": 0.06915403008460999, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 0.7955081222407955, | |
| "grad_norm": 0.051952604204416275, | |
| "learning_rate": 0.0001987191907710791, | |
| "loss": 0.06277130246162414, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 0.798937036560799, | |
| "grad_norm": 0.05152563005685806, | |
| "learning_rate": 0.00019870141588034665, | |
| "loss": 0.06619568467140198, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 0.8023659508808023, | |
| "grad_norm": 0.0674680843949318, | |
| "learning_rate": 0.00019868351930535993, | |
| "loss": 0.06798242330551148, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 0.8057948652008058, | |
| "grad_norm": 0.06978574395179749, | |
| "learning_rate": 0.0001986655010681827, | |
| "loss": 0.06347747445106507, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.8092237795208093, | |
| "grad_norm": 0.05963709577918053, | |
| "learning_rate": 0.00019864736119102884, | |
| "loss": 0.06163069009780884, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 0.8126526938408126, | |
| "grad_norm": 0.04883351922035217, | |
| "learning_rate": 0.0001986290996962621, | |
| "loss": 0.05950311422348022, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 0.8160816081608161, | |
| "grad_norm": 0.3814024031162262, | |
| "learning_rate": 0.00019861071660639618, | |
| "loss": 0.06604605913162231, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 0.8195105224808195, | |
| "grad_norm": 0.1023794636130333, | |
| "learning_rate": 0.00019859221194409475, | |
| "loss": 0.064841890335083, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 0.8229394368008229, | |
| "grad_norm": 0.0649971291422844, | |
| "learning_rate": 0.00019857358573217133, | |
| "loss": 0.0684207558631897, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.8263683511208264, | |
| "grad_norm": 0.06579799205064774, | |
| "learning_rate": 0.00019855483799358922, | |
| "loss": 0.06325002908706664, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 0.8297972654408298, | |
| "grad_norm": 0.05028271675109863, | |
| "learning_rate": 0.0001985359687514617, | |
| "loss": 0.06539126038551331, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 0.8332261797608332, | |
| "grad_norm": 0.05256115645170212, | |
| "learning_rate": 0.00019851697802905172, | |
| "loss": 0.0646961510181427, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 0.8366550940808366, | |
| "grad_norm": 0.060003966093063354, | |
| "learning_rate": 0.000198497865849772, | |
| "loss": 0.06308870911598205, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 0.8400840084008401, | |
| "grad_norm": 0.06799912452697754, | |
| "learning_rate": 0.00019847863223718506, | |
| "loss": 0.0649224042892456, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.8435129227208435, | |
| "grad_norm": 0.07937843352556229, | |
| "learning_rate": 0.0001984592772150031, | |
| "loss": 0.0636534869670868, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 0.8469418370408469, | |
| "grad_norm": 0.05219930782914162, | |
| "learning_rate": 0.00019843980080708803, | |
| "loss": 0.06010836958885193, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 0.8503707513608504, | |
| "grad_norm": 0.0586070753633976, | |
| "learning_rate": 0.00019842020303745131, | |
| "loss": 0.06380678415298462, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 0.8537996656808537, | |
| "grad_norm": 0.058439116925001144, | |
| "learning_rate": 0.00019840048393025416, | |
| "loss": 0.06640804409980774, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 0.8572285800008572, | |
| "grad_norm": 0.06139601767063141, | |
| "learning_rate": 0.00019838064350980727, | |
| "loss": 0.05971125960350036, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.8606574943208607, | |
| "grad_norm": 0.06821685284376144, | |
| "learning_rate": 0.000198360681800571, | |
| "loss": 0.06303138732910156, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 0.8640864086408641, | |
| "grad_norm": 0.06389456242322922, | |
| "learning_rate": 0.00019834059882715516, | |
| "loss": 0.06540479063987732, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 0.8675153229608675, | |
| "grad_norm": 0.04554591700434685, | |
| "learning_rate": 0.00019832039461431907, | |
| "loss": 0.058097350597381595, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 0.8709442372808709, | |
| "grad_norm": 0.06274914741516113, | |
| "learning_rate": 0.00019830006918697155, | |
| "loss": 0.06443666219711304, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 0.8743731516008744, | |
| "grad_norm": 0.058880288153886795, | |
| "learning_rate": 0.0001982796225701709, | |
| "loss": 0.06162167191505432, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.8778020659208778, | |
| "grad_norm": 0.05205392837524414, | |
| "learning_rate": 0.00019825905478912468, | |
| "loss": 0.055066394805908206, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 0.8812309802408812, | |
| "grad_norm": 0.0545465461909771, | |
| "learning_rate": 0.00019823836586918997, | |
| "loss": 0.06011802554130554, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 0.8846598945608847, | |
| "grad_norm": 0.05792587995529175, | |
| "learning_rate": 0.00019821755583587317, | |
| "loss": 0.058178257942199704, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 0.888088808880888, | |
| "grad_norm": 0.06038236618041992, | |
| "learning_rate": 0.00019819662471482995, | |
| "loss": 0.061930137872695926, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 0.8915177232008915, | |
| "grad_norm": 0.06363194435834885, | |
| "learning_rate": 0.00019817557253186532, | |
| "loss": 0.06379579305648804, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.894946637520895, | |
| "grad_norm": 0.07369779050350189, | |
| "learning_rate": 0.00019815439931293347, | |
| "loss": 0.060153383016586306, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 0.8983755518408983, | |
| "grad_norm": 0.062007270753383636, | |
| "learning_rate": 0.00019813310508413784, | |
| "loss": 0.0662104070186615, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 0.9018044661609018, | |
| "grad_norm": 0.06512269377708435, | |
| "learning_rate": 0.00019811168987173109, | |
| "loss": 0.06587219834327698, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 0.9052333804809052, | |
| "grad_norm": 0.05178048089146614, | |
| "learning_rate": 0.00019809015370211502, | |
| "loss": 0.06476051211357117, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 0.9086622948009087, | |
| "grad_norm": 0.05599229782819748, | |
| "learning_rate": 0.00019806849660184054, | |
| "loss": 0.06642783880233764, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.9120912091209121, | |
| "grad_norm": 0.06416797637939453, | |
| "learning_rate": 0.00019804671859760764, | |
| "loss": 0.06604329347610474, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 0.9155201234409155, | |
| "grad_norm": 0.05304501950740814, | |
| "learning_rate": 0.0001980248197162654, | |
| "loss": 0.0627303421497345, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 0.918949037760919, | |
| "grad_norm": 0.05713188648223877, | |
| "learning_rate": 0.00019800279998481187, | |
| "loss": 0.06577149033546448, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 0.9223779520809223, | |
| "grad_norm": 0.06850962340831757, | |
| "learning_rate": 0.00019798065943039413, | |
| "loss": 0.061149966716766355, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 0.9258068664009258, | |
| "grad_norm": 0.06360381096601486, | |
| "learning_rate": 0.00019795839808030822, | |
| "loss": 0.0627046525478363, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.9292357807209293, | |
| "grad_norm": 0.046474043279886246, | |
| "learning_rate": 0.00019793601596199912, | |
| "loss": 0.06419117450714111, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 0.9326646950409326, | |
| "grad_norm": 0.0652134045958519, | |
| "learning_rate": 0.00019791351310306064, | |
| "loss": 0.06440665125846863, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 0.9360936093609361, | |
| "grad_norm": 0.05071209743618965, | |
| "learning_rate": 0.0001978908895312355, | |
| "loss": 0.06100277304649353, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 0.9395225236809395, | |
| "grad_norm": 0.08431413769721985, | |
| "learning_rate": 0.0001978681452744152, | |
| "loss": 0.06571382284164429, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 0.9429514380009429, | |
| "grad_norm": 0.06639470160007477, | |
| "learning_rate": 0.00019784528036064005, | |
| "loss": 0.06303996443748475, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.9463803523209464, | |
| "grad_norm": 0.06278301030397415, | |
| "learning_rate": 0.00019782229481809908, | |
| "loss": 0.060810595750808716, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 0.9498092666409498, | |
| "grad_norm": 0.05751429498195648, | |
| "learning_rate": 0.00019779918867513015, | |
| "loss": 0.06521624922752381, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 0.9532381809609533, | |
| "grad_norm": 0.05640877038240433, | |
| "learning_rate": 0.00019777596196021965, | |
| "loss": 0.06350036263465882, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 0.9566670952809566, | |
| "grad_norm": 0.0672905445098877, | |
| "learning_rate": 0.0001977526147020027, | |
| "loss": 0.06559882164001465, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 0.9600960096009601, | |
| "grad_norm": 0.061227139085531235, | |
| "learning_rate": 0.00019772914692926298, | |
| "loss": 0.0647310495376587, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.9635249239209636, | |
| "grad_norm": 0.04840533435344696, | |
| "learning_rate": 0.00019770555867093287, | |
| "loss": 0.06300787925720215, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 0.9669538382409669, | |
| "grad_norm": 0.04809625446796417, | |
| "learning_rate": 0.00019768184995609314, | |
| "loss": 0.060482186079025266, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 0.9703827525609704, | |
| "grad_norm": 0.0634710043668747, | |
| "learning_rate": 0.00019765802081397315, | |
| "loss": 0.06123342514038086, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 0.9738116668809738, | |
| "grad_norm": 0.06208731234073639, | |
| "learning_rate": 0.00019763407127395074, | |
| "loss": 0.06303659081459045, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 0.9772405812009772, | |
| "grad_norm": 0.05797295272350311, | |
| "learning_rate": 0.0001976100013655521, | |
| "loss": 0.06181204319000244, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.9806694955209807, | |
| "grad_norm": 0.047497738152742386, | |
| "learning_rate": 0.00019758581111845188, | |
| "loss": 0.06843062043190003, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 0.9840984098409841, | |
| "grad_norm": 0.07195553183555603, | |
| "learning_rate": 0.00019756150056247308, | |
| "loss": 0.057436692714691165, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 0.9875273241609875, | |
| "grad_norm": 0.05397411808371544, | |
| "learning_rate": 0.00019753706972758708, | |
| "loss": 0.06481915712356567, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 0.9909562384809909, | |
| "grad_norm": 0.07122443616390228, | |
| "learning_rate": 0.00019751251864391338, | |
| "loss": 0.06128339171409607, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 0.9943851528009944, | |
| "grad_norm": 0.05404914170503616, | |
| "learning_rate": 0.00019748784734171992, | |
| "loss": 0.06380388736724854, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.9978140671209978, | |
| "grad_norm": 0.05884242057800293, | |
| "learning_rate": 0.00019746305585142276, | |
| "loss": 0.062488919496536253, | |
| "step": 2910 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 29170, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.6570827015387837e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |