Instructions to use Taywon/A1minus_v4_e1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/A1minus_v4_e1 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-70B-Instruct") model = PeftModel.from_pretrained(base_model, "Taywon/A1minus_v4_e1") - Transformers
How to use Taywon/A1minus_v4_e1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/A1minus_v4_e1") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/A1minus_v4_e1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/A1minus_v4_e1 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/A1minus_v4_e1" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1minus_v4_e1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/A1minus_v4_e1
- SGLang
How to use Taywon/A1minus_v4_e1 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/A1minus_v4_e1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1minus_v4_e1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/A1minus_v4_e1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1minus_v4_e1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/A1minus_v4_e1 with Docker Model Runner:
docker model run hf.co/Taywon/A1minus_v4_e1
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 79, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.3162457048892975, | |
| "epoch": 0.0128, | |
| "grad_norm": 1.352159857749939, | |
| "learning_rate": 0.0, | |
| "loss": 2.1207475662231445, | |
| "mean_token_accuracy": 0.519522450864315, | |
| "num_tokens": 128267.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.3375049829483032, | |
| "epoch": 0.0256, | |
| "grad_norm": 1.3233879804611206, | |
| "learning_rate": 4.166666666666667e-06, | |
| "loss": 2.1054062843322754, | |
| "mean_token_accuracy": 0.5206284299492836, | |
| "num_tokens": 253824.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4048671871423721, | |
| "epoch": 0.0384, | |
| "grad_norm": 1.2062019109725952, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 2.087756633758545, | |
| "mean_token_accuracy": 0.5199320912361145, | |
| "num_tokens": 382699.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.5049891620874405, | |
| "epoch": 0.0512, | |
| "grad_norm": 0.9262659549713135, | |
| "learning_rate": 1.25e-05, | |
| "loss": 1.995165467262268, | |
| "mean_token_accuracy": 0.5279128178954124, | |
| "num_tokens": 511796.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.6395027190446854, | |
| "epoch": 0.064, | |
| "grad_norm": 0.6157782673835754, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 1.902457594871521, | |
| "mean_token_accuracy": 0.5378688499331474, | |
| "num_tokens": 639293.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.7712273597717285, | |
| "epoch": 0.0768, | |
| "grad_norm": 0.41292306780815125, | |
| "learning_rate": 2.0833333333333336e-05, | |
| "loss": 1.814640998840332, | |
| "mean_token_accuracy": 0.551142543554306, | |
| "num_tokens": 768431.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.9540852010250092, | |
| "epoch": 0.0896, | |
| "grad_norm": 0.501342236995697, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.7964210510253906, | |
| "mean_token_accuracy": 0.5524477660655975, | |
| "num_tokens": 896030.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 2.001556009054184, | |
| "epoch": 0.1024, | |
| "grad_norm": 0.5916482210159302, | |
| "learning_rate": 2.916666666666667e-05, | |
| "loss": 1.74098801612854, | |
| "mean_token_accuracy": 0.5590195059776306, | |
| "num_tokens": 1024099.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.8932171761989594, | |
| "epoch": 0.1152, | |
| "grad_norm": 0.5141144394874573, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.6654725074768066, | |
| "mean_token_accuracy": 0.5705089494585991, | |
| "num_tokens": 1151261.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.7713737785816193, | |
| "epoch": 0.128, | |
| "grad_norm": 0.38611456751823425, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.6301219463348389, | |
| "mean_token_accuracy": 0.5723346620798111, | |
| "num_tokens": 1280169.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.5953099429607391, | |
| "epoch": 0.1408, | |
| "grad_norm": 0.3014231324195862, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 1.563348412513733, | |
| "mean_token_accuracy": 0.5855296552181244, | |
| "num_tokens": 1408663.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.498468354344368, | |
| "epoch": 0.1536, | |
| "grad_norm": 0.29069405794143677, | |
| "learning_rate": 4.5833333333333334e-05, | |
| "loss": 1.5376625061035156, | |
| "mean_token_accuracy": 0.5896067395806313, | |
| "num_tokens": 1537364.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.4390365332365036, | |
| "epoch": 0.1664, | |
| "grad_norm": 0.2850739359855652, | |
| "learning_rate": 5e-05, | |
| "loss": 1.5183324813842773, | |
| "mean_token_accuracy": 0.5939378440380096, | |
| "num_tokens": 1665784.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.3894367814064026, | |
| "epoch": 0.1792, | |
| "grad_norm": 0.254903644323349, | |
| "learning_rate": 4.999756310023261e-05, | |
| "loss": 1.4691948890686035, | |
| "mean_token_accuracy": 0.6029341071844101, | |
| "num_tokens": 1793645.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.3888143301010132, | |
| "epoch": 0.192, | |
| "grad_norm": 0.2366946041584015, | |
| "learning_rate": 4.999025287600886e-05, | |
| "loss": 1.437840461730957, | |
| "mean_token_accuracy": 0.6058616042137146, | |
| "num_tokens": 1923235.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.38721963763237, | |
| "epoch": 0.2048, | |
| "grad_norm": 0.24185693264007568, | |
| "learning_rate": 4.997807075247146e-05, | |
| "loss": 1.388806939125061, | |
| "mean_token_accuracy": 0.6189781129360199, | |
| "num_tokens": 2047392.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.411361888051033, | |
| "epoch": 0.2176, | |
| "grad_norm": 0.2459052950143814, | |
| "learning_rate": 4.996101910454953e-05, | |
| "loss": 1.3761913776397705, | |
| "mean_token_accuracy": 0.6179594621062279, | |
| "num_tokens": 2176102.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.4147253632545471, | |
| "epoch": 0.2304, | |
| "grad_norm": 0.19693808257579803, | |
| "learning_rate": 4.993910125649561e-05, | |
| "loss": 1.3652762174606323, | |
| "mean_token_accuracy": 0.621271513402462, | |
| "num_tokens": 2306210.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.3803435266017914, | |
| "epoch": 0.2432, | |
| "grad_norm": 0.19281397759914398, | |
| "learning_rate": 4.991232148123761e-05, | |
| "loss": 1.3464841842651367, | |
| "mean_token_accuracy": 0.6208974272012711, | |
| "num_tokens": 2435600.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.35707126557827, | |
| "epoch": 0.256, | |
| "grad_norm": 0.18975713849067688, | |
| "learning_rate": 4.988068499954578e-05, | |
| "loss": 1.3281123638153076, | |
| "mean_token_accuracy": 0.6283634603023529, | |
| "num_tokens": 2563297.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.3186347782611847, | |
| "epoch": 0.2688, | |
| "grad_norm": 0.18689435720443726, | |
| "learning_rate": 4.984419797901491e-05, | |
| "loss": 1.2913005352020264, | |
| "mean_token_accuracy": 0.6341830417513847, | |
| "num_tokens": 2693321.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.2915433645248413, | |
| "epoch": 0.2816, | |
| "grad_norm": 0.16926461458206177, | |
| "learning_rate": 4.980286753286195e-05, | |
| "loss": 1.2752561569213867, | |
| "mean_token_accuracy": 0.6396686807274818, | |
| "num_tokens": 2822308.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.3217644691467285, | |
| "epoch": 0.2944, | |
| "grad_norm": 0.17539748549461365, | |
| "learning_rate": 4.975670171853926e-05, | |
| "loss": 1.2967042922973633, | |
| "mean_token_accuracy": 0.6322600916028023, | |
| "num_tokens": 2948321.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.305735170841217, | |
| "epoch": 0.3072, | |
| "grad_norm": 0.18748317658901215, | |
| "learning_rate": 4.9705709536163824e-05, | |
| "loss": 1.2801027297973633, | |
| "mean_token_accuracy": 0.6383148655295372, | |
| "num_tokens": 3075824.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.2684594690799713, | |
| "epoch": 0.32, | |
| "grad_norm": 0.17818772792816162, | |
| "learning_rate": 4.964990092676263e-05, | |
| "loss": 1.2617098093032837, | |
| "mean_token_accuracy": 0.6398709714412689, | |
| "num_tokens": 3204534.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.2367210537195206, | |
| "epoch": 0.3328, | |
| "grad_norm": 0.15789498388767242, | |
| "learning_rate": 4.9589286770334654e-05, | |
| "loss": 1.237747073173523, | |
| "mean_token_accuracy": 0.6457515805959702, | |
| "num_tokens": 3332525.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.26371830701828, | |
| "epoch": 0.3456, | |
| "grad_norm": 0.15905392169952393, | |
| "learning_rate": 4.952387888372979e-05, | |
| "loss": 1.2668375968933105, | |
| "mean_token_accuracy": 0.6412620171904564, | |
| "num_tokens": 3461036.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.2327947914600372, | |
| "epoch": 0.3584, | |
| "grad_norm": 0.1592377871274948, | |
| "learning_rate": 4.9453690018345144e-05, | |
| "loss": 1.234164834022522, | |
| "mean_token_accuracy": 0.6465037614107132, | |
| "num_tokens": 3589380.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.225911945104599, | |
| "epoch": 0.3712, | |
| "grad_norm": 0.16118580102920532, | |
| "learning_rate": 4.937873385763908e-05, | |
| "loss": 1.2210657596588135, | |
| "mean_token_accuracy": 0.648338608443737, | |
| "num_tokens": 3717664.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.2561272978782654, | |
| "epoch": 0.384, | |
| "grad_norm": 0.1599515676498413, | |
| "learning_rate": 4.929902501446366e-05, | |
| "loss": 1.2360204458236694, | |
| "mean_token_accuracy": 0.6447968706488609, | |
| "num_tokens": 3844833.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.239769622683525, | |
| "epoch": 0.3968, | |
| "grad_norm": 0.15974652767181396, | |
| "learning_rate": 4.9214579028215776e-05, | |
| "loss": 1.2166938781738281, | |
| "mean_token_accuracy": 0.6490442007780075, | |
| "num_tokens": 3974478.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.239488497376442, | |
| "epoch": 0.4096, | |
| "grad_norm": 0.1755683869123459, | |
| "learning_rate": 4.912541236180779e-05, | |
| "loss": 1.2133210897445679, | |
| "mean_token_accuracy": 0.651265911757946, | |
| "num_tokens": 4104263.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.223443627357483, | |
| "epoch": 0.4224, | |
| "grad_norm": 0.15209320187568665, | |
| "learning_rate": 4.9031542398457974e-05, | |
| "loss": 1.202136754989624, | |
| "mean_token_accuracy": 0.6539920642971992, | |
| "num_tokens": 4233892.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.2144603580236435, | |
| "epoch": 0.4352, | |
| "grad_norm": 0.1438663750886917, | |
| "learning_rate": 4.893298743830168e-05, | |
| "loss": 1.2046866416931152, | |
| "mean_token_accuracy": 0.6516713947057724, | |
| "num_tokens": 4362313.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.2047844678163528, | |
| "epoch": 0.448, | |
| "grad_norm": 0.14309684932231903, | |
| "learning_rate": 4.882976669482367e-05, | |
| "loss": 1.1985797882080078, | |
| "mean_token_accuracy": 0.6538008749485016, | |
| "num_tokens": 4490686.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.155385822057724, | |
| "epoch": 0.4608, | |
| "grad_norm": 0.1452430784702301, | |
| "learning_rate": 4.8721900291112415e-05, | |
| "loss": 1.1461997032165527, | |
| "mean_token_accuracy": 0.6639315262436867, | |
| "num_tokens": 4618481.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.1931456923484802, | |
| "epoch": 0.4736, | |
| "grad_norm": 0.14111614227294922, | |
| "learning_rate": 4.860940925593703e-05, | |
| "loss": 1.1837263107299805, | |
| "mean_token_accuracy": 0.6538461446762085, | |
| "num_tokens": 4746449.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.2137931138277054, | |
| "epoch": 0.4864, | |
| "grad_norm": 0.1422092169523239, | |
| "learning_rate": 4.849231551964771e-05, | |
| "loss": 1.1992123126983643, | |
| "mean_token_accuracy": 0.6522813364863396, | |
| "num_tokens": 4875695.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.1690412908792496, | |
| "epoch": 0.4992, | |
| "grad_norm": 0.14533959329128265, | |
| "learning_rate": 4.837064190990036e-05, | |
| "loss": 1.1562764644622803, | |
| "mean_token_accuracy": 0.6618529111146927, | |
| "num_tokens": 5002824.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.163830503821373, | |
| "epoch": 0.512, | |
| "grad_norm": 0.14272262156009674, | |
| "learning_rate": 4.8244412147206284e-05, | |
| "loss": 1.1516133546829224, | |
| "mean_token_accuracy": 0.6619244366884232, | |
| "num_tokens": 5132045.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.148694396018982, | |
| "epoch": 0.5248, | |
| "grad_norm": 0.13471876084804535, | |
| "learning_rate": 4.8113650840307834e-05, | |
| "loss": 1.1472002267837524, | |
| "mean_token_accuracy": 0.6657932102680206, | |
| "num_tokens": 5261038.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.1257383078336716, | |
| "epoch": 0.5376, | |
| "grad_norm": 0.1379338800907135, | |
| "learning_rate": 4.797838348138086e-05, | |
| "loss": 1.1339021921157837, | |
| "mean_token_accuracy": 0.6660185307264328, | |
| "num_tokens": 5388912.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.1311924755573273, | |
| "epoch": 0.5504, | |
| "grad_norm": 0.14049763977527618, | |
| "learning_rate": 4.783863644106502e-05, | |
| "loss": 1.135345697402954, | |
| "mean_token_accuracy": 0.6648508384823799, | |
| "num_tokens": 5518618.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.1455007046461105, | |
| "epoch": 0.5632, | |
| "grad_norm": 0.13285057246685028, | |
| "learning_rate": 4.769443696332272e-05, | |
| "loss": 1.1532269716262817, | |
| "mean_token_accuracy": 0.6633262932300568, | |
| "num_tokens": 5648116.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.1428617984056473, | |
| "epoch": 0.576, | |
| "grad_norm": 0.13333706557750702, | |
| "learning_rate": 4.754581316012785e-05, | |
| "loss": 1.1316198110580444, | |
| "mean_token_accuracy": 0.668374814093113, | |
| "num_tokens": 5777117.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.1585663259029388, | |
| "epoch": 0.5888, | |
| "grad_norm": 0.14425642788410187, | |
| "learning_rate": 4.7392794005985326e-05, | |
| "loss": 1.1365997791290283, | |
| "mean_token_accuracy": 0.6671516969799995, | |
| "num_tokens": 5904876.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.150609478354454, | |
| "epoch": 0.6016, | |
| "grad_norm": 0.15504664182662964, | |
| "learning_rate": 4.723540933228244e-05, | |
| "loss": 1.127173662185669, | |
| "mean_token_accuracy": 0.6687930002808571, | |
| "num_tokens": 6034768.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.1596223711967468, | |
| "epoch": 0.6144, | |
| "grad_norm": 0.12928146123886108, | |
| "learning_rate": 4.707368982147318e-05, | |
| "loss": 1.1445682048797607, | |
| "mean_token_accuracy": 0.6648146286606789, | |
| "num_tokens": 6163126.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.0994263589382172, | |
| "epoch": 0.6272, | |
| "grad_norm": 0.1349116712808609, | |
| "learning_rate": 4.690766700109659e-05, | |
| "loss": 1.0948941707611084, | |
| "mean_token_accuracy": 0.6754020154476166, | |
| "num_tokens": 6291570.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.112744465470314, | |
| "epoch": 0.64, | |
| "grad_norm": 0.14497768878936768, | |
| "learning_rate": 4.6737373237630476e-05, | |
| "loss": 1.1113452911376953, | |
| "mean_token_accuracy": 0.6713321506977081, | |
| "num_tokens": 6420084.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.1346999406814575, | |
| "epoch": 0.6528, | |
| "grad_norm": 0.1316288709640503, | |
| "learning_rate": 4.656284173018144e-05, | |
| "loss": 1.1358039379119873, | |
| "mean_token_accuracy": 0.6633565202355385, | |
| "num_tokens": 6549817.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.1398767530918121, | |
| "epoch": 0.6656, | |
| "grad_norm": 0.13040749728679657, | |
| "learning_rate": 4.638410650401267e-05, | |
| "loss": 1.1272315979003906, | |
| "mean_token_accuracy": 0.6667839512228966, | |
| "num_tokens": 6678766.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.1322846412658691, | |
| "epoch": 0.6784, | |
| "grad_norm": 0.14328311383724213, | |
| "learning_rate": 4.620120240391065e-05, | |
| "loss": 1.117470145225525, | |
| "mean_token_accuracy": 0.6683860421180725, | |
| "num_tokens": 6808175.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.1198230981826782, | |
| "epoch": 0.6912, | |
| "grad_norm": 0.14016754925251007, | |
| "learning_rate": 4.601416508739211e-05, | |
| "loss": 1.1076020002365112, | |
| "mean_token_accuracy": 0.6711939796805382, | |
| "num_tokens": 6936347.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.1406737715005875, | |
| "epoch": 0.704, | |
| "grad_norm": 0.12862594425678253, | |
| "learning_rate": 4.5823031017752485e-05, | |
| "loss": 1.130237340927124, | |
| "mean_token_accuracy": 0.6678624600172043, | |
| "num_tokens": 7065783.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.1166451126337051, | |
| "epoch": 0.7168, | |
| "grad_norm": 0.13933686912059784, | |
| "learning_rate": 4.562783745695738e-05, | |
| "loss": 1.1190818548202515, | |
| "mean_token_accuracy": 0.6695680469274521, | |
| "num_tokens": 7195341.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.0982198119163513, | |
| "epoch": 0.7296, | |
| "grad_norm": 0.1453101933002472, | |
| "learning_rate": 4.542862245837821e-05, | |
| "loss": 1.0977050065994263, | |
| "mean_token_accuracy": 0.673400916159153, | |
| "num_tokens": 7323591.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.1204975843429565, | |
| "epoch": 0.7424, | |
| "grad_norm": 0.14185063540935516, | |
| "learning_rate": 4.522542485937369e-05, | |
| "loss": 1.1112452745437622, | |
| "mean_token_accuracy": 0.6700539514422417, | |
| "num_tokens": 7449876.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.0963227897882462, | |
| "epoch": 0.7552, | |
| "grad_norm": 0.1320878118276596, | |
| "learning_rate": 4.5018284273718336e-05, | |
| "loss": 1.0801842212677002, | |
| "mean_token_accuracy": 0.6790826618671417, | |
| "num_tokens": 7576398.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.101280301809311, | |
| "epoch": 0.768, | |
| "grad_norm": 0.13114839792251587, | |
| "learning_rate": 4.480724108387977e-05, | |
| "loss": 1.0857573747634888, | |
| "mean_token_accuracy": 0.6782229617238045, | |
| "num_tokens": 7703463.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.1046365648508072, | |
| "epoch": 0.7808, | |
| "grad_norm": 0.14528152346611023, | |
| "learning_rate": 4.4592336433146e-05, | |
| "loss": 1.0996856689453125, | |
| "mean_token_accuracy": 0.6730064377188683, | |
| "num_tokens": 7829441.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.0932775139808655, | |
| "epoch": 0.7936, | |
| "grad_norm": 0.1349162608385086, | |
| "learning_rate": 4.4373612217604496e-05, | |
| "loss": 1.086916208267212, | |
| "mean_token_accuracy": 0.6765137910842896, | |
| "num_tokens": 7958502.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.0945100337266922, | |
| "epoch": 0.8064, | |
| "grad_norm": 0.13429976999759674, | |
| "learning_rate": 4.415111107797445e-05, | |
| "loss": 1.0971022844314575, | |
| "mean_token_accuracy": 0.6743359267711639, | |
| "num_tokens": 8085295.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.118965595960617, | |
| "epoch": 0.8192, | |
| "grad_norm": 0.1320214867591858, | |
| "learning_rate": 4.3924876391293915e-05, | |
| "loss": 1.1191140413284302, | |
| "mean_token_accuracy": 0.6683387905359268, | |
| "num_tokens": 8211901.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.0775217562913895, | |
| "epoch": 0.832, | |
| "grad_norm": 0.13175779581069946, | |
| "learning_rate": 4.36949522624633e-05, | |
| "loss": 1.0712368488311768, | |
| "mean_token_accuracy": 0.6812888830900192, | |
| "num_tokens": 8341017.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.0895331501960754, | |
| "epoch": 0.8448, | |
| "grad_norm": 0.13901865482330322, | |
| "learning_rate": 4.3461383515647106e-05, | |
| "loss": 1.0851002931594849, | |
| "mean_token_accuracy": 0.6775127947330475, | |
| "num_tokens": 8468968.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.111844316124916, | |
| "epoch": 0.8576, | |
| "grad_norm": 0.1398841142654419, | |
| "learning_rate": 4.3224215685535294e-05, | |
| "loss": 1.1119290590286255, | |
| "mean_token_accuracy": 0.6691920980811119, | |
| "num_tokens": 8597358.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.09650357067585, | |
| "epoch": 0.8704, | |
| "grad_norm": 0.12886422872543335, | |
| "learning_rate": 4.2983495008466276e-05, | |
| "loss": 1.0808916091918945, | |
| "mean_token_accuracy": 0.6781075149774551, | |
| "num_tokens": 8725371.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.1017109751701355, | |
| "epoch": 0.8832, | |
| "grad_norm": 0.1451224386692047, | |
| "learning_rate": 4.273926841341302e-05, | |
| "loss": 1.0965564250946045, | |
| "mean_token_accuracy": 0.6711221262812614, | |
| "num_tokens": 8853595.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.0767414420843124, | |
| "epoch": 0.896, | |
| "grad_norm": 0.13234680891036987, | |
| "learning_rate": 4.249158351283414e-05, | |
| "loss": 1.0748488903045654, | |
| "mean_token_accuracy": 0.6783607006072998, | |
| "num_tokens": 8983043.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.1035151928663254, | |
| "epoch": 0.9088, | |
| "grad_norm": 0.14130030572414398, | |
| "learning_rate": 4.224048859339175e-05, | |
| "loss": 1.1003308296203613, | |
| "mean_token_accuracy": 0.6728062555193901, | |
| "num_tokens": 9108608.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.0806768834590912, | |
| "epoch": 0.9216, | |
| "grad_norm": 0.13948991894721985, | |
| "learning_rate": 4.198603260653792e-05, | |
| "loss": 1.0670676231384277, | |
| "mean_token_accuracy": 0.680378146469593, | |
| "num_tokens": 9237077.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.0983169227838516, | |
| "epoch": 0.9344, | |
| "grad_norm": 0.13928388059139252, | |
| "learning_rate": 4.172826515897146e-05, | |
| "loss": 1.0819404125213623, | |
| "mean_token_accuracy": 0.6768162399530411, | |
| "num_tokens": 9365880.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.077269896864891, | |
| "epoch": 0.9472, | |
| "grad_norm": 0.12908564507961273, | |
| "learning_rate": 4.146723650296701e-05, | |
| "loss": 1.0671316385269165, | |
| "mean_token_accuracy": 0.6830117851495743, | |
| "num_tokens": 9495277.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.0963009595870972, | |
| "epoch": 0.96, | |
| "grad_norm": 0.13727004826068878, | |
| "learning_rate": 4.1202997526578276e-05, | |
| "loss": 1.0920417308807373, | |
| "mean_token_accuracy": 0.6739914268255234, | |
| "num_tokens": 9622724.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.0630004107952118, | |
| "epoch": 0.9728, | |
| "grad_norm": 0.12875896692276, | |
| "learning_rate": 4.093559974371725e-05, | |
| "loss": 1.0611292123794556, | |
| "mean_token_accuracy": 0.6826749593019485, | |
| "num_tokens": 9752552.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.0773174464702606, | |
| "epoch": 0.9856, | |
| "grad_norm": 0.13426193594932556, | |
| "learning_rate": 4.066509528411152e-05, | |
| "loss": 1.0728553533554077, | |
| "mean_token_accuracy": 0.6800747960805893, | |
| "num_tokens": 9881931.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.0630360692739487, | |
| "epoch": 0.9984, | |
| "grad_norm": 0.15215876698493958, | |
| "learning_rate": 4.039153688314145e-05, | |
| "loss": 1.0557889938354492, | |
| "mean_token_accuracy": 0.6812136247754097, | |
| "num_tokens": 10009540.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.0610005855560303, | |
| "epoch": 1.0, | |
| "grad_norm": 0.3391527831554413, | |
| "learning_rate": 4.011497787155938e-05, | |
| "loss": 1.077329158782959, | |
| "mean_token_accuracy": 0.6696272492408752, | |
| "num_tokens": 10017540.0, | |
| "step": 79 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 237, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.057669943367041e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |