Instructions to use TPreview/GaMS3-12B-Instruct-Lex-2-LoRA with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use TPreview/GaMS3-12B-Instruct-Lex-2-LoRA with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("cjvt/GaMS3-12B-Instruct") model = PeftModel.from_pretrained(base_model, "TPreview/GaMS3-12B-Instruct-Lex-2-LoRA") - Transformers
How to use TPreview/GaMS3-12B-Instruct-Lex-2-LoRA with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="TPreview/GaMS3-12B-Instruct-Lex-2-LoRA") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("TPreview/GaMS3-12B-Instruct-Lex-2-LoRA", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use TPreview/GaMS3-12B-Instruct-Lex-2-LoRA with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "TPreview/GaMS3-12B-Instruct-Lex-2-LoRA" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TPreview/GaMS3-12B-Instruct-Lex-2-LoRA", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/TPreview/GaMS3-12B-Instruct-Lex-2-LoRA
- SGLang
How to use TPreview/GaMS3-12B-Instruct-Lex-2-LoRA with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "TPreview/GaMS3-12B-Instruct-Lex-2-LoRA" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TPreview/GaMS3-12B-Instruct-Lex-2-LoRA", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "TPreview/GaMS3-12B-Instruct-Lex-2-LoRA" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TPreview/GaMS3-12B-Instruct-Lex-2-LoRA", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use TPreview/GaMS3-12B-Instruct-Lex-2-LoRA with Docker Model Runner:
docker model run hf.co/TPreview/GaMS3-12B-Instruct-Lex-2-LoRA
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.7167381974248928, | |
| "eval_steps": 100, | |
| "global_step": 400, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.02145922746781116, | |
| "grad_norm": 3.03324294090271, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 1.6153003692626953, | |
| "num_input_tokens_seen": 58112, | |
| "step": 5, | |
| "train_runtime": 7.4685, | |
| "train_tokens_per_second": 7780.897 | |
| }, | |
| { | |
| "epoch": 0.04291845493562232, | |
| "grad_norm": 1.29582941532135, | |
| "learning_rate": 1.8e-05, | |
| "loss": 1.470921516418457, | |
| "num_input_tokens_seen": 123392, | |
| "step": 10, | |
| "train_runtime": 12.4602, | |
| "train_tokens_per_second": 9902.863 | |
| }, | |
| { | |
| "epoch": 0.06437768240343347, | |
| "grad_norm": 1.0643380880355835, | |
| "learning_rate": 2.8000000000000003e-05, | |
| "loss": 1.1773520469665528, | |
| "num_input_tokens_seen": 183808, | |
| "step": 15, | |
| "train_runtime": 17.3966, | |
| "train_tokens_per_second": 10565.773 | |
| }, | |
| { | |
| "epoch": 0.08583690987124463, | |
| "grad_norm": 0.9673917889595032, | |
| "learning_rate": 3.8e-05, | |
| "loss": 0.991020393371582, | |
| "num_input_tokens_seen": 237312, | |
| "step": 20, | |
| "train_runtime": 21.6738, | |
| "train_tokens_per_second": 10949.243 | |
| }, | |
| { | |
| "epoch": 0.1072961373390558, | |
| "grad_norm": 1.0297874212265015, | |
| "learning_rate": 4.8e-05, | |
| "loss": 0.9735608100891113, | |
| "num_input_tokens_seen": 294400, | |
| "step": 25, | |
| "train_runtime": 25.962, | |
| "train_tokens_per_second": 11339.643 | |
| }, | |
| { | |
| "epoch": 0.12875536480686695, | |
| "grad_norm": 0.950329601764679, | |
| "learning_rate": 5.8e-05, | |
| "loss": 0.8873712539672851, | |
| "num_input_tokens_seen": 349952, | |
| "step": 30, | |
| "train_runtime": 30.609, | |
| "train_tokens_per_second": 11432.978 | |
| }, | |
| { | |
| "epoch": 0.15021459227467812, | |
| "grad_norm": 0.9307717680931091, | |
| "learning_rate": 6.800000000000001e-05, | |
| "loss": 0.8720953941345215, | |
| "num_input_tokens_seen": 404992, | |
| "step": 35, | |
| "train_runtime": 34.7568, | |
| "train_tokens_per_second": 11652.181 | |
| }, | |
| { | |
| "epoch": 0.17167381974248927, | |
| "grad_norm": 0.9645226001739502, | |
| "learning_rate": 7.800000000000001e-05, | |
| "loss": 0.8684850692749023, | |
| "num_input_tokens_seen": 461056, | |
| "step": 40, | |
| "train_runtime": 39.036, | |
| "train_tokens_per_second": 11811.04 | |
| }, | |
| { | |
| "epoch": 0.19313304721030042, | |
| "grad_norm": 0.9567210674285889, | |
| "learning_rate": 8.800000000000001e-05, | |
| "loss": 0.7938490390777588, | |
| "num_input_tokens_seen": 518144, | |
| "step": 45, | |
| "train_runtime": 43.9371, | |
| "train_tokens_per_second": 11792.858 | |
| }, | |
| { | |
| "epoch": 0.2145922746781116, | |
| "grad_norm": 0.9292750358581543, | |
| "learning_rate": 9.8e-05, | |
| "loss": 0.7703328609466553, | |
| "num_input_tokens_seen": 568576, | |
| "step": 50, | |
| "train_runtime": 47.9296, | |
| "train_tokens_per_second": 11862.735 | |
| }, | |
| { | |
| "epoch": 0.23605150214592274, | |
| "grad_norm": 0.9988890886306763, | |
| "learning_rate": 0.00010800000000000001, | |
| "loss": 0.7470858573913575, | |
| "num_input_tokens_seen": 619264, | |
| "step": 55, | |
| "train_runtime": 51.9347, | |
| "train_tokens_per_second": 11923.905 | |
| }, | |
| { | |
| "epoch": 0.2575107296137339, | |
| "grad_norm": 1.0609540939331055, | |
| "learning_rate": 0.000118, | |
| "loss": 0.7434512138366699, | |
| "num_input_tokens_seen": 674304, | |
| "step": 60, | |
| "train_runtime": 56.2719, | |
| "train_tokens_per_second": 11982.969 | |
| }, | |
| { | |
| "epoch": 0.27896995708154504, | |
| "grad_norm": 1.0313714742660522, | |
| "learning_rate": 0.00012800000000000002, | |
| "loss": 0.7007692337036133, | |
| "num_input_tokens_seen": 735744, | |
| "step": 65, | |
| "train_runtime": 61.1614, | |
| "train_tokens_per_second": 12029.548 | |
| }, | |
| { | |
| "epoch": 0.30042918454935624, | |
| "grad_norm": 0.8622630834579468, | |
| "learning_rate": 0.000138, | |
| "loss": 0.7205728530883789, | |
| "num_input_tokens_seen": 789760, | |
| "step": 70, | |
| "train_runtime": 65.595, | |
| "train_tokens_per_second": 12039.941 | |
| }, | |
| { | |
| "epoch": 0.3218884120171674, | |
| "grad_norm": 0.9945432543754578, | |
| "learning_rate": 0.000148, | |
| "loss": 0.6990869522094727, | |
| "num_input_tokens_seen": 845568, | |
| "step": 75, | |
| "train_runtime": 69.9997, | |
| "train_tokens_per_second": 12079.588 | |
| }, | |
| { | |
| "epoch": 0.34334763948497854, | |
| "grad_norm": 0.8772686719894409, | |
| "learning_rate": 0.00015800000000000002, | |
| "loss": 0.7007846355438232, | |
| "num_input_tokens_seen": 900864, | |
| "step": 80, | |
| "train_runtime": 74.2575, | |
| "train_tokens_per_second": 12131.625 | |
| }, | |
| { | |
| "epoch": 0.3648068669527897, | |
| "grad_norm": 0.888869047164917, | |
| "learning_rate": 0.000168, | |
| "loss": 0.6950747489929199, | |
| "num_input_tokens_seen": 964608, | |
| "step": 85, | |
| "train_runtime": 79.9415, | |
| "train_tokens_per_second": 12066.42 | |
| }, | |
| { | |
| "epoch": 0.38626609442060084, | |
| "grad_norm": 1.1443110704421997, | |
| "learning_rate": 0.00017800000000000002, | |
| "loss": 0.7211706638336182, | |
| "num_input_tokens_seen": 1023744, | |
| "step": 90, | |
| "train_runtime": 85.0578, | |
| "train_tokens_per_second": 12035.856 | |
| }, | |
| { | |
| "epoch": 0.40772532188841204, | |
| "grad_norm": 0.9073887467384338, | |
| "learning_rate": 0.000188, | |
| "loss": 0.6607097625732422, | |
| "num_input_tokens_seen": 1080320, | |
| "step": 95, | |
| "train_runtime": 89.6566, | |
| "train_tokens_per_second": 12049.537 | |
| }, | |
| { | |
| "epoch": 0.4291845493562232, | |
| "grad_norm": 0.9436500668525696, | |
| "learning_rate": 0.00019800000000000002, | |
| "loss": 0.7111758232116699, | |
| "num_input_tokens_seen": 1141248, | |
| "step": 100, | |
| "train_runtime": 95.1795, | |
| "train_tokens_per_second": 11990.483 | |
| }, | |
| { | |
| "epoch": 0.4291845493562232, | |
| "eval_loss": 0.6004661917686462, | |
| "eval_runtime": 22.148, | |
| "eval_samples_per_second": 35.398, | |
| "eval_steps_per_second": 17.699, | |
| "num_input_tokens_seen": 1141248, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.45064377682403434, | |
| "grad_norm": 0.916501522064209, | |
| "learning_rate": 0.00019997799506149338, | |
| "loss": 0.6870423316955566, | |
| "num_input_tokens_seen": 1192192, | |
| "step": 105, | |
| "train_runtime": 137.2215, | |
| "train_tokens_per_second": 8688.083 | |
| }, | |
| { | |
| "epoch": 0.4721030042918455, | |
| "grad_norm": 0.8930872678756714, | |
| "learning_rate": 0.000199888616596235, | |
| "loss": 0.6905088424682617, | |
| "num_input_tokens_seen": 1248000, | |
| "step": 110, | |
| "train_runtime": 141.7812, | |
| "train_tokens_per_second": 8802.295 | |
| }, | |
| { | |
| "epoch": 0.49356223175965663, | |
| "grad_norm": 0.8945744037628174, | |
| "learning_rate": 0.00019973055070849913, | |
| "loss": 0.6668004035949707, | |
| "num_input_tokens_seen": 1305856, | |
| "step": 115, | |
| "train_runtime": 146.4487, | |
| "train_tokens_per_second": 8916.818 | |
| }, | |
| { | |
| "epoch": 0.5150214592274678, | |
| "grad_norm": 0.9365142583847046, | |
| "learning_rate": 0.0001995039060907352, | |
| "loss": 0.6359036445617676, | |
| "num_input_tokens_seen": 1370368, | |
| "step": 120, | |
| "train_runtime": 151.6609, | |
| "train_tokens_per_second": 9035.739 | |
| }, | |
| { | |
| "epoch": 0.5364806866952789, | |
| "grad_norm": 0.9572582244873047, | |
| "learning_rate": 0.00019920883859288034, | |
| "loss": 0.6302140235900879, | |
| "num_input_tokens_seen": 1425920, | |
| "step": 125, | |
| "train_runtime": 156.1545, | |
| "train_tokens_per_second": 9131.47 | |
| }, | |
| { | |
| "epoch": 0.5579399141630901, | |
| "grad_norm": 0.9190641045570374, | |
| "learning_rate": 0.00019884555111519058, | |
| "loss": 0.6023337364196777, | |
| "num_input_tokens_seen": 1477376, | |
| "step": 130, | |
| "train_runtime": 160.3216, | |
| "train_tokens_per_second": 9215.078 | |
| }, | |
| { | |
| "epoch": 0.5793991416309013, | |
| "grad_norm": 0.7973408102989197, | |
| "learning_rate": 0.0001984142934687186, | |
| "loss": 0.6142975330352783, | |
| "num_input_tokens_seen": 1537024, | |
| "step": 135, | |
| "train_runtime": 165.1747, | |
| "train_tokens_per_second": 9305.443 | |
| }, | |
| { | |
| "epoch": 0.6008583690987125, | |
| "grad_norm": 0.8307357430458069, | |
| "learning_rate": 0.00019791536220353356, | |
| "loss": 0.6178459167480469, | |
| "num_input_tokens_seen": 1600000, | |
| "step": 140, | |
| "train_runtime": 170.1853, | |
| "train_tokens_per_second": 9401.52 | |
| }, | |
| { | |
| "epoch": 0.6223175965665236, | |
| "grad_norm": 0.9216153025627136, | |
| "learning_rate": 0.00019734910040480137, | |
| "loss": 0.5878005027770996, | |
| "num_input_tokens_seen": 1657600, | |
| "step": 145, | |
| "train_runtime": 175.0946, | |
| "train_tokens_per_second": 9466.883 | |
| }, | |
| { | |
| "epoch": 0.6437768240343348, | |
| "grad_norm": 0.9538068175315857, | |
| "learning_rate": 0.0001967158974568656, | |
| "loss": 0.6823252677917481, | |
| "num_input_tokens_seen": 1711104, | |
| "step": 150, | |
| "train_runtime": 179.7828, | |
| "train_tokens_per_second": 9517.616 | |
| }, | |
| { | |
| "epoch": 0.6652360515021459, | |
| "grad_norm": 0.8435113430023193, | |
| "learning_rate": 0.00019601618877549112, | |
| "loss": 0.6517625331878663, | |
| "num_input_tokens_seen": 1762048, | |
| "step": 155, | |
| "train_runtime": 183.8306, | |
| "train_tokens_per_second": 9585.173 | |
| }, | |
| { | |
| "epoch": 0.6866952789699571, | |
| "grad_norm": 0.8970490097999573, | |
| "learning_rate": 0.00019525045550845482, | |
| "loss": 0.6671280860900879, | |
| "num_input_tokens_seen": 1820416, | |
| "step": 160, | |
| "train_runtime": 188.5304, | |
| "train_tokens_per_second": 9655.824 | |
| }, | |
| { | |
| "epoch": 0.7081545064377682, | |
| "grad_norm": 0.8489075303077698, | |
| "learning_rate": 0.00019441922420468898, | |
| "loss": 0.6579770565032959, | |
| "num_input_tokens_seen": 1876992, | |
| "step": 165, | |
| "train_runtime": 193.0354, | |
| "train_tokens_per_second": 9723.564 | |
| }, | |
| { | |
| "epoch": 0.7296137339055794, | |
| "grad_norm": 0.911480188369751, | |
| "learning_rate": 0.00019352306645220517, | |
| "loss": 0.6479627609252929, | |
| "num_input_tokens_seen": 1927680, | |
| "step": 170, | |
| "train_runtime": 196.9591, | |
| "train_tokens_per_second": 9787.21 | |
| }, | |
| { | |
| "epoch": 0.7510729613733905, | |
| "grad_norm": 0.9032346606254578, | |
| "learning_rate": 0.00019256259848504737, | |
| "loss": 0.6328952789306641, | |
| "num_input_tokens_seen": 1984768, | |
| "step": 175, | |
| "train_runtime": 201.5699, | |
| "train_tokens_per_second": 9846.551 | |
| }, | |
| { | |
| "epoch": 0.7725321888412017, | |
| "grad_norm": 0.9176375865936279, | |
| "learning_rate": 0.00019153848075954466, | |
| "loss": 0.6545487403869629, | |
| "num_input_tokens_seen": 2047744, | |
| "step": 180, | |
| "train_runtime": 206.7957, | |
| "train_tokens_per_second": 9902.254 | |
| }, | |
| { | |
| "epoch": 0.7939914163090128, | |
| "grad_norm": 0.8009106516838074, | |
| "learning_rate": 0.000190451417500155, | |
| "loss": 0.5557879447937012, | |
| "num_input_tokens_seen": 2124032, | |
| "step": 185, | |
| "train_runtime": 214.0583, | |
| "train_tokens_per_second": 9922.681 | |
| }, | |
| { | |
| "epoch": 0.8154506437768241, | |
| "grad_norm": 0.8755921721458435, | |
| "learning_rate": 0.0001893021562152122, | |
| "loss": 0.6030447006225585, | |
| "num_input_tokens_seen": 2178304, | |
| "step": 190, | |
| "train_runtime": 218.3854, | |
| "train_tokens_per_second": 9974.585 | |
| }, | |
| { | |
| "epoch": 0.8369098712446352, | |
| "grad_norm": 0.7998857498168945, | |
| "learning_rate": 0.00018809148718290918, | |
| "loss": 0.6215959072113038, | |
| "num_input_tokens_seen": 2234112, | |
| "step": 195, | |
| "train_runtime": 222.6461, | |
| "train_tokens_per_second": 10034.362 | |
| }, | |
| { | |
| "epoch": 0.8583690987124464, | |
| "grad_norm": 0.8616818785667419, | |
| "learning_rate": 0.00018682024290787093, | |
| "loss": 0.615071964263916, | |
| "num_input_tokens_seen": 2289920, | |
| "step": 200, | |
| "train_runtime": 227.2286, | |
| "train_tokens_per_second": 10077.603 | |
| }, | |
| { | |
| "epoch": 0.8583690987124464, | |
| "eval_loss": 0.5416203737258911, | |
| "eval_runtime": 23.1771, | |
| "eval_samples_per_second": 33.827, | |
| "eval_steps_per_second": 16.913, | |
| "num_input_tokens_seen": 2289920, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.8798283261802575, | |
| "grad_norm": 0.866408109664917, | |
| "learning_rate": 0.00018548929754869095, | |
| "loss": 0.6127395629882812, | |
| "num_input_tokens_seen": 2336768, | |
| "step": 205, | |
| "train_runtime": 269.3352, | |
| "train_tokens_per_second": 8676.059 | |
| }, | |
| { | |
| "epoch": 0.9012875536480687, | |
| "grad_norm": 0.7758891582489014, | |
| "learning_rate": 0.00018409956631682475, | |
| "loss": 0.619700813293457, | |
| "num_input_tokens_seen": 2398720, | |
| "step": 210, | |
| "train_runtime": 274.7853, | |
| "train_tokens_per_second": 8729.432 | |
| }, | |
| { | |
| "epoch": 0.9227467811158798, | |
| "grad_norm": 0.8826097249984741, | |
| "learning_rate": 0.00018265200484725362, | |
| "loss": 0.6074517726898193, | |
| "num_input_tokens_seen": 2456064, | |
| "step": 215, | |
| "train_runtime": 279.0929, | |
| "train_tokens_per_second": 8800.166 | |
| }, | |
| { | |
| "epoch": 0.944206008583691, | |
| "grad_norm": 0.9082592725753784, | |
| "learning_rate": 0.0001811476085413517, | |
| "loss": 0.6168807506561279, | |
| "num_input_tokens_seen": 2513408, | |
| "step": 220, | |
| "train_runtime": 283.5383, | |
| "train_tokens_per_second": 8864.438 | |
| }, | |
| { | |
| "epoch": 0.9656652360515021, | |
| "grad_norm": 0.7310217618942261, | |
| "learning_rate": 0.00017958741188240805, | |
| "loss": 0.5989558696746826, | |
| "num_input_tokens_seen": 2577664, | |
| "step": 225, | |
| "train_runtime": 288.997, | |
| "train_tokens_per_second": 8919.346 | |
| }, | |
| { | |
| "epoch": 0.9871244635193133, | |
| "grad_norm": 0.7489120364189148, | |
| "learning_rate": 0.0001779724877242745, | |
| "loss": 0.5686917781829834, | |
| "num_input_tokens_seen": 2634752, | |
| "step": 230, | |
| "train_runtime": 293.5938, | |
| "train_tokens_per_second": 8974.142 | |
| }, | |
| { | |
| "epoch": 1.0085836909871244, | |
| "grad_norm": 0.6700829267501831, | |
| "learning_rate": 0.00017630394655362798, | |
| "loss": 0.4931748867034912, | |
| "num_input_tokens_seen": 2695424, | |
| "step": 235, | |
| "train_runtime": 298.6586, | |
| "train_tokens_per_second": 9025.102 | |
| }, | |
| { | |
| "epoch": 1.0300429184549356, | |
| "grad_norm": 0.8137433528900146, | |
| "learning_rate": 0.00017458293572635572, | |
| "loss": 0.41871185302734376, | |
| "num_input_tokens_seen": 2759680, | |
| "step": 240, | |
| "train_runtime": 304.168, | |
| "train_tokens_per_second": 9072.882 | |
| }, | |
| { | |
| "epoch": 1.0515021459227467, | |
| "grad_norm": 0.8284509778022766, | |
| "learning_rate": 0.00017281063867858687, | |
| "loss": 0.39093842506408694, | |
| "num_input_tokens_seen": 2821376, | |
| "step": 245, | |
| "train_runtime": 309.2922, | |
| "train_tokens_per_second": 9122.041 | |
| }, | |
| { | |
| "epoch": 1.0729613733905579, | |
| "grad_norm": 0.8212636113166809, | |
| "learning_rate": 0.00017098827411291475, | |
| "loss": 0.41676993370056153, | |
| "num_input_tokens_seen": 2879744, | |
| "step": 250, | |
| "train_runtime": 314.1833, | |
| "train_tokens_per_second": 9165.809 | |
| }, | |
| { | |
| "epoch": 1.094420600858369, | |
| "grad_norm": 0.9262588024139404, | |
| "learning_rate": 0.00016911709516036753, | |
| "loss": 0.43643965721130373, | |
| "num_input_tokens_seen": 2939648, | |
| "step": 255, | |
| "train_runtime": 318.9898, | |
| "train_tokens_per_second": 9215.492 | |
| }, | |
| { | |
| "epoch": 1.1158798283261802, | |
| "grad_norm": 0.8408174514770508, | |
| "learning_rate": 0.0001671983885187055, | |
| "loss": 0.42370119094848635, | |
| "num_input_tokens_seen": 2993152, | |
| "step": 260, | |
| "train_runtime": 323.4471, | |
| "train_tokens_per_second": 9253.915 | |
| }, | |
| { | |
| "epoch": 1.1373390557939915, | |
| "grad_norm": 0.857381284236908, | |
| "learning_rate": 0.00016523347356763572, | |
| "loss": 0.42381582260131834, | |
| "num_input_tokens_seen": 3044608, | |
| "step": 265, | |
| "train_runtime": 327.4141, | |
| "train_tokens_per_second": 9298.953 | |
| }, | |
| { | |
| "epoch": 1.1587982832618025, | |
| "grad_norm": 0.9033918380737305, | |
| "learning_rate": 0.0001632237014615537, | |
| "loss": 0.40540313720703125, | |
| "num_input_tokens_seen": 3104768, | |
| "step": 270, | |
| "train_runtime": 332.1893, | |
| "train_tokens_per_second": 9346.38 | |
| }, | |
| { | |
| "epoch": 1.1802575107296138, | |
| "grad_norm": 0.7994610667228699, | |
| "learning_rate": 0.00016117045420043543, | |
| "loss": 0.4465446472167969, | |
| "num_input_tokens_seen": 3160832, | |
| "step": 275, | |
| "train_runtime": 336.8133, | |
| "train_tokens_per_second": 9384.521 | |
| }, | |
| { | |
| "epoch": 1.201716738197425, | |
| "grad_norm": 0.8270825147628784, | |
| "learning_rate": 0.0001590751436795186, | |
| "loss": 0.41684885025024415, | |
| "num_input_tokens_seen": 3222016, | |
| "step": 280, | |
| "train_runtime": 341.7825, | |
| "train_tokens_per_second": 9427.094 | |
| }, | |
| { | |
| "epoch": 1.2231759656652361, | |
| "grad_norm": 0.8962671756744385, | |
| "learning_rate": 0.00015693921071842688, | |
| "loss": 0.42808146476745607, | |
| "num_input_tokens_seen": 3283456, | |
| "step": 285, | |
| "train_runtime": 346.6683, | |
| "train_tokens_per_second": 9471.463 | |
| }, | |
| { | |
| "epoch": 1.2446351931330473, | |
| "grad_norm": 0.8256343007087708, | |
| "learning_rate": 0.00015476412407040445, | |
| "loss": 0.40830087661743164, | |
| "num_input_tokens_seen": 3344128, | |
| "step": 290, | |
| "train_runtime": 351.6457, | |
| "train_tokens_per_second": 9509.935 | |
| }, | |
| { | |
| "epoch": 1.2660944206008584, | |
| "grad_norm": 0.7946646809577942, | |
| "learning_rate": 0.00015255137941234227, | |
| "loss": 0.46245832443237306, | |
| "num_input_tokens_seen": 3399936, | |
| "step": 295, | |
| "train_runtime": 356.2532, | |
| "train_tokens_per_second": 9543.595 | |
| }, | |
| { | |
| "epoch": 1.2875536480686696, | |
| "grad_norm": 0.7553455829620361, | |
| "learning_rate": 0.0001503024983162908, | |
| "loss": 0.4185676574707031, | |
| "num_input_tokens_seen": 3448576, | |
| "step": 300, | |
| "train_runtime": 360.2579, | |
| "train_tokens_per_second": 9572.519 | |
| }, | |
| { | |
| "epoch": 1.2875536480686696, | |
| "eval_loss": 0.5272337198257446, | |
| "eval_runtime": 23.4826, | |
| "eval_samples_per_second": 33.386, | |
| "eval_steps_per_second": 16.693, | |
| "num_input_tokens_seen": 3448576, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.3090128755364807, | |
| "grad_norm": 0.7643769979476929, | |
| "learning_rate": 0.00014801902720316568, | |
| "loss": 0.41739530563354493, | |
| "num_input_tokens_seen": 3507456, | |
| "step": 305, | |
| "train_runtime": 403.3091, | |
| "train_tokens_per_second": 8696.694 | |
| }, | |
| { | |
| "epoch": 1.3304721030042919, | |
| "grad_norm": 0.7832750678062439, | |
| "learning_rate": 0.0001457025362793669, | |
| "loss": 0.43469972610473634, | |
| "num_input_tokens_seen": 3572992, | |
| "step": 310, | |
| "train_runtime": 408.9235, | |
| "train_tokens_per_second": 8737.555 | |
| }, | |
| { | |
| "epoch": 1.351931330472103, | |
| "grad_norm": 0.8122566938400269, | |
| "learning_rate": 0.00014335461845704173, | |
| "loss": 0.4958329200744629, | |
| "num_input_tokens_seen": 3628032, | |
| "step": 315, | |
| "train_runtime": 413.3099, | |
| "train_tokens_per_second": 8777.994 | |
| }, | |
| { | |
| "epoch": 1.3733905579399142, | |
| "grad_norm": 0.8401719927787781, | |
| "learning_rate": 0.00014097688825873437, | |
| "loss": 0.4470388412475586, | |
| "num_input_tokens_seen": 3685120, | |
| "step": 320, | |
| "train_runtime": 417.6895, | |
| "train_tokens_per_second": 8822.631 | |
| }, | |
| { | |
| "epoch": 1.3948497854077253, | |
| "grad_norm": 0.911494255065918, | |
| "learning_rate": 0.00013857098070717543, | |
| "loss": 0.4368776321411133, | |
| "num_input_tokens_seen": 3736064, | |
| "step": 325, | |
| "train_runtime": 421.8302, | |
| "train_tokens_per_second": 8856.796 | |
| }, | |
| { | |
| "epoch": 1.4163090128755365, | |
| "grad_norm": 0.8921552300453186, | |
| "learning_rate": 0.00013613855020097476, | |
| "loss": 0.41593198776245116, | |
| "num_input_tokens_seen": 3786752, | |
| "step": 330, | |
| "train_runtime": 425.7613, | |
| "train_tokens_per_second": 8894.073 | |
| }, | |
| { | |
| "epoch": 1.4377682403433476, | |
| "grad_norm": 0.899163007736206, | |
| "learning_rate": 0.00013368126937699055, | |
| "loss": 0.41350326538085935, | |
| "num_input_tokens_seen": 3836928, | |
| "step": 335, | |
| "train_runtime": 429.9947, | |
| "train_tokens_per_second": 8923.198 | |
| }, | |
| { | |
| "epoch": 1.4592274678111588, | |
| "grad_norm": 0.8040919303894043, | |
| "learning_rate": 0.00013120082796015694, | |
| "loss": 0.41482973098754883, | |
| "num_input_tokens_seen": 3902976, | |
| "step": 340, | |
| "train_runtime": 435.7465, | |
| "train_tokens_per_second": 8956.988 | |
| }, | |
| { | |
| "epoch": 1.48068669527897, | |
| "grad_norm": 0.786900520324707, | |
| "learning_rate": 0.00012869893160156144, | |
| "loss": 0.4156362056732178, | |
| "num_input_tokens_seen": 3965952, | |
| "step": 345, | |
| "train_runtime": 441.2677, | |
| "train_tokens_per_second": 8987.632 | |
| }, | |
| { | |
| "epoch": 1.5021459227467813, | |
| "grad_norm": 0.8730544447898865, | |
| "learning_rate": 0.0001261773007055708, | |
| "loss": 0.46176786422729493, | |
| "num_input_tokens_seen": 4019456, | |
| "step": 350, | |
| "train_runtime": 445.6914, | |
| "train_tokens_per_second": 9018.474 | |
| }, | |
| { | |
| "epoch": 1.5236051502145922, | |
| "grad_norm": 0.8831098079681396, | |
| "learning_rate": 0.00012363766924681176, | |
| "loss": 0.42528247833251953, | |
| "num_input_tokens_seen": 4070656, | |
| "step": 355, | |
| "train_runtime": 449.6375, | |
| "train_tokens_per_second": 9053.196 | |
| }, | |
| { | |
| "epoch": 1.5450643776824036, | |
| "grad_norm": 0.8320629000663757, | |
| "learning_rate": 0.00012108178357782078, | |
| "loss": 0.4190709114074707, | |
| "num_input_tokens_seen": 4125696, | |
| "step": 360, | |
| "train_runtime": 454.0433, | |
| "train_tokens_per_second": 9086.569 | |
| }, | |
| { | |
| "epoch": 1.5665236051502145, | |
| "grad_norm": 0.8362066149711609, | |
| "learning_rate": 0.00011851140122818154, | |
| "loss": 0.4130504608154297, | |
| "num_input_tokens_seen": 4175360, | |
| "step": 365, | |
| "train_runtime": 457.9743, | |
| "train_tokens_per_second": 9117.018 | |
| }, | |
| { | |
| "epoch": 1.5879828326180259, | |
| "grad_norm": 0.8794524669647217, | |
| "learning_rate": 0.0001159282896959774, | |
| "loss": 0.38641934394836425, | |
| "num_input_tokens_seen": 4226304, | |
| "step": 370, | |
| "train_runtime": 461.8462, | |
| "train_tokens_per_second": 9150.891 | |
| }, | |
| { | |
| "epoch": 1.6094420600858368, | |
| "grad_norm": 0.7941300272941589, | |
| "learning_rate": 0.00011333422523238856, | |
| "loss": 0.38475966453552246, | |
| "num_input_tokens_seen": 4286976, | |
| "step": 375, | |
| "train_runtime": 466.4935, | |
| "train_tokens_per_second": 9189.788 | |
| }, | |
| { | |
| "epoch": 1.6309012875536482, | |
| "grad_norm": 0.8813296556472778, | |
| "learning_rate": 0.0001107309916202705, | |
| "loss": 0.43069748878479003, | |
| "num_input_tokens_seen": 4338944, | |
| "step": 380, | |
| "train_runtime": 470.4846, | |
| "train_tokens_per_second": 9222.287 | |
| }, | |
| { | |
| "epoch": 1.652360515021459, | |
| "grad_norm": 0.7397964000701904, | |
| "learning_rate": 0.00010812037894755335, | |
| "loss": 0.4383960247039795, | |
| "num_input_tokens_seen": 4389376, | |
| "step": 385, | |
| "train_runtime": 474.5481, | |
| "train_tokens_per_second": 9249.592 | |
| }, | |
| { | |
| "epoch": 1.6738197424892705, | |
| "grad_norm": 0.7971178889274597, | |
| "learning_rate": 0.00010550418237630546, | |
| "loss": 0.41924076080322265, | |
| "num_input_tokens_seen": 4445952, | |
| "step": 390, | |
| "train_runtime": 478.7928, | |
| "train_tokens_per_second": 9285.753 | |
| }, | |
| { | |
| "epoch": 1.6952789699570814, | |
| "grad_norm": 0.7272794246673584, | |
| "learning_rate": 0.00010288420090830804, | |
| "loss": 0.4299598693847656, | |
| "num_input_tokens_seen": 4498176, | |
| "step": 395, | |
| "train_runtime": 483.0335, | |
| "train_tokens_per_second": 9312.348 | |
| }, | |
| { | |
| "epoch": 1.7167381974248928, | |
| "grad_norm": 0.7986837029457092, | |
| "learning_rate": 0.00010026223614798911, | |
| "loss": 0.40703516006469725, | |
| "num_input_tokens_seen": 4548608, | |
| "step": 400, | |
| "train_runtime": 487.1484, | |
| "train_tokens_per_second": 9337.213 | |
| }, | |
| { | |
| "epoch": 1.7167381974248928, | |
| "eval_loss": 0.4985992908477783, | |
| "eval_runtime": 24.698, | |
| "eval_samples_per_second": 31.743, | |
| "eval_steps_per_second": 15.872, | |
| "num_input_tokens_seen": 4548608, | |
| "step": 400 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 699, | |
| "num_input_tokens_seen": 4548608, | |
| "num_train_epochs": 3, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.9720867698743706e+17, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |