Instructions to use Taywon/A1minus_v4_e2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/A1minus_v4_e2 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-70B-Instruct") model = PeftModel.from_pretrained(base_model, "Taywon/A1minus_v4_e2") - Transformers
How to use Taywon/A1minus_v4_e2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/A1minus_v4_e2") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/A1minus_v4_e2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/A1minus_v4_e2 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/A1minus_v4_e2" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1minus_v4_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/A1minus_v4_e2
- SGLang
How to use Taywon/A1minus_v4_e2 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/A1minus_v4_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1minus_v4_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/A1minus_v4_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1minus_v4_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/A1minus_v4_e2 with Docker Model Runner:
docker model run hf.co/Taywon/A1minus_v4_e2
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 158, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.3162457048892975, | |
| "epoch": 0.0128, | |
| "grad_norm": 1.352159857749939, | |
| "learning_rate": 0.0, | |
| "loss": 2.1207475662231445, | |
| "mean_token_accuracy": 0.519522450864315, | |
| "num_tokens": 128267.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.3375049829483032, | |
| "epoch": 0.0256, | |
| "grad_norm": 1.3233879804611206, | |
| "learning_rate": 4.166666666666667e-06, | |
| "loss": 2.1054062843322754, | |
| "mean_token_accuracy": 0.5206284299492836, | |
| "num_tokens": 253824.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4048671871423721, | |
| "epoch": 0.0384, | |
| "grad_norm": 1.2062019109725952, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 2.087756633758545, | |
| "mean_token_accuracy": 0.5199320912361145, | |
| "num_tokens": 382699.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.5049891620874405, | |
| "epoch": 0.0512, | |
| "grad_norm": 0.9262659549713135, | |
| "learning_rate": 1.25e-05, | |
| "loss": 1.995165467262268, | |
| "mean_token_accuracy": 0.5279128178954124, | |
| "num_tokens": 511796.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.6395027190446854, | |
| "epoch": 0.064, | |
| "grad_norm": 0.6157782673835754, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 1.902457594871521, | |
| "mean_token_accuracy": 0.5378688499331474, | |
| "num_tokens": 639293.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.7712273597717285, | |
| "epoch": 0.0768, | |
| "grad_norm": 0.41292306780815125, | |
| "learning_rate": 2.0833333333333336e-05, | |
| "loss": 1.814640998840332, | |
| "mean_token_accuracy": 0.551142543554306, | |
| "num_tokens": 768431.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.9540852010250092, | |
| "epoch": 0.0896, | |
| "grad_norm": 0.501342236995697, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.7964210510253906, | |
| "mean_token_accuracy": 0.5524477660655975, | |
| "num_tokens": 896030.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 2.001556009054184, | |
| "epoch": 0.1024, | |
| "grad_norm": 0.5916482210159302, | |
| "learning_rate": 2.916666666666667e-05, | |
| "loss": 1.74098801612854, | |
| "mean_token_accuracy": 0.5590195059776306, | |
| "num_tokens": 1024099.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.8932171761989594, | |
| "epoch": 0.1152, | |
| "grad_norm": 0.5141144394874573, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.6654725074768066, | |
| "mean_token_accuracy": 0.5705089494585991, | |
| "num_tokens": 1151261.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.7713737785816193, | |
| "epoch": 0.128, | |
| "grad_norm": 0.38611456751823425, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.6301219463348389, | |
| "mean_token_accuracy": 0.5723346620798111, | |
| "num_tokens": 1280169.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.5953099429607391, | |
| "epoch": 0.1408, | |
| "grad_norm": 0.3014231324195862, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 1.563348412513733, | |
| "mean_token_accuracy": 0.5855296552181244, | |
| "num_tokens": 1408663.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.498468354344368, | |
| "epoch": 0.1536, | |
| "grad_norm": 0.29069405794143677, | |
| "learning_rate": 4.5833333333333334e-05, | |
| "loss": 1.5376625061035156, | |
| "mean_token_accuracy": 0.5896067395806313, | |
| "num_tokens": 1537364.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.4390365332365036, | |
| "epoch": 0.1664, | |
| "grad_norm": 0.2850739359855652, | |
| "learning_rate": 5e-05, | |
| "loss": 1.5183324813842773, | |
| "mean_token_accuracy": 0.5939378440380096, | |
| "num_tokens": 1665784.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.3894367814064026, | |
| "epoch": 0.1792, | |
| "grad_norm": 0.254903644323349, | |
| "learning_rate": 4.999756310023261e-05, | |
| "loss": 1.4691948890686035, | |
| "mean_token_accuracy": 0.6029341071844101, | |
| "num_tokens": 1793645.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.3888143301010132, | |
| "epoch": 0.192, | |
| "grad_norm": 0.2366946041584015, | |
| "learning_rate": 4.999025287600886e-05, | |
| "loss": 1.437840461730957, | |
| "mean_token_accuracy": 0.6058616042137146, | |
| "num_tokens": 1923235.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.38721963763237, | |
| "epoch": 0.2048, | |
| "grad_norm": 0.24185693264007568, | |
| "learning_rate": 4.997807075247146e-05, | |
| "loss": 1.388806939125061, | |
| "mean_token_accuracy": 0.6189781129360199, | |
| "num_tokens": 2047392.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.411361888051033, | |
| "epoch": 0.2176, | |
| "grad_norm": 0.2459052950143814, | |
| "learning_rate": 4.996101910454953e-05, | |
| "loss": 1.3761913776397705, | |
| "mean_token_accuracy": 0.6179594621062279, | |
| "num_tokens": 2176102.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.4147253632545471, | |
| "epoch": 0.2304, | |
| "grad_norm": 0.19693808257579803, | |
| "learning_rate": 4.993910125649561e-05, | |
| "loss": 1.3652762174606323, | |
| "mean_token_accuracy": 0.621271513402462, | |
| "num_tokens": 2306210.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.3803435266017914, | |
| "epoch": 0.2432, | |
| "grad_norm": 0.19281397759914398, | |
| "learning_rate": 4.991232148123761e-05, | |
| "loss": 1.3464841842651367, | |
| "mean_token_accuracy": 0.6208974272012711, | |
| "num_tokens": 2435600.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.35707126557827, | |
| "epoch": 0.256, | |
| "grad_norm": 0.18975713849067688, | |
| "learning_rate": 4.988068499954578e-05, | |
| "loss": 1.3281123638153076, | |
| "mean_token_accuracy": 0.6283634603023529, | |
| "num_tokens": 2563297.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.3186347782611847, | |
| "epoch": 0.2688, | |
| "grad_norm": 0.18689435720443726, | |
| "learning_rate": 4.984419797901491e-05, | |
| "loss": 1.2913005352020264, | |
| "mean_token_accuracy": 0.6341830417513847, | |
| "num_tokens": 2693321.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.2915433645248413, | |
| "epoch": 0.2816, | |
| "grad_norm": 0.16926461458206177, | |
| "learning_rate": 4.980286753286195e-05, | |
| "loss": 1.2752561569213867, | |
| "mean_token_accuracy": 0.6396686807274818, | |
| "num_tokens": 2822308.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.3217644691467285, | |
| "epoch": 0.2944, | |
| "grad_norm": 0.17539748549461365, | |
| "learning_rate": 4.975670171853926e-05, | |
| "loss": 1.2967042922973633, | |
| "mean_token_accuracy": 0.6322600916028023, | |
| "num_tokens": 2948321.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.305735170841217, | |
| "epoch": 0.3072, | |
| "grad_norm": 0.18748317658901215, | |
| "learning_rate": 4.9705709536163824e-05, | |
| "loss": 1.2801027297973633, | |
| "mean_token_accuracy": 0.6383148655295372, | |
| "num_tokens": 3075824.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.2684594690799713, | |
| "epoch": 0.32, | |
| "grad_norm": 0.17818772792816162, | |
| "learning_rate": 4.964990092676263e-05, | |
| "loss": 1.2617098093032837, | |
| "mean_token_accuracy": 0.6398709714412689, | |
| "num_tokens": 3204534.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.2367210537195206, | |
| "epoch": 0.3328, | |
| "grad_norm": 0.15789498388767242, | |
| "learning_rate": 4.9589286770334654e-05, | |
| "loss": 1.237747073173523, | |
| "mean_token_accuracy": 0.6457515805959702, | |
| "num_tokens": 3332525.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.26371830701828, | |
| "epoch": 0.3456, | |
| "grad_norm": 0.15905392169952393, | |
| "learning_rate": 4.952387888372979e-05, | |
| "loss": 1.2668375968933105, | |
| "mean_token_accuracy": 0.6412620171904564, | |
| "num_tokens": 3461036.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.2327947914600372, | |
| "epoch": 0.3584, | |
| "grad_norm": 0.1592377871274948, | |
| "learning_rate": 4.9453690018345144e-05, | |
| "loss": 1.234164834022522, | |
| "mean_token_accuracy": 0.6465037614107132, | |
| "num_tokens": 3589380.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.225911945104599, | |
| "epoch": 0.3712, | |
| "grad_norm": 0.16118580102920532, | |
| "learning_rate": 4.937873385763908e-05, | |
| "loss": 1.2210657596588135, | |
| "mean_token_accuracy": 0.648338608443737, | |
| "num_tokens": 3717664.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.2561272978782654, | |
| "epoch": 0.384, | |
| "grad_norm": 0.1599515676498413, | |
| "learning_rate": 4.929902501446366e-05, | |
| "loss": 1.2360204458236694, | |
| "mean_token_accuracy": 0.6447968706488609, | |
| "num_tokens": 3844833.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.239769622683525, | |
| "epoch": 0.3968, | |
| "grad_norm": 0.15974652767181396, | |
| "learning_rate": 4.9214579028215776e-05, | |
| "loss": 1.2166938781738281, | |
| "mean_token_accuracy": 0.6490442007780075, | |
| "num_tokens": 3974478.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.239488497376442, | |
| "epoch": 0.4096, | |
| "grad_norm": 0.1755683869123459, | |
| "learning_rate": 4.912541236180779e-05, | |
| "loss": 1.2133210897445679, | |
| "mean_token_accuracy": 0.651265911757946, | |
| "num_tokens": 4104263.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.223443627357483, | |
| "epoch": 0.4224, | |
| "grad_norm": 0.15209320187568665, | |
| "learning_rate": 4.9031542398457974e-05, | |
| "loss": 1.202136754989624, | |
| "mean_token_accuracy": 0.6539920642971992, | |
| "num_tokens": 4233892.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.2144603580236435, | |
| "epoch": 0.4352, | |
| "grad_norm": 0.1438663750886917, | |
| "learning_rate": 4.893298743830168e-05, | |
| "loss": 1.2046866416931152, | |
| "mean_token_accuracy": 0.6516713947057724, | |
| "num_tokens": 4362313.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.2047844678163528, | |
| "epoch": 0.448, | |
| "grad_norm": 0.14309684932231903, | |
| "learning_rate": 4.882976669482367e-05, | |
| "loss": 1.1985797882080078, | |
| "mean_token_accuracy": 0.6538008749485016, | |
| "num_tokens": 4490686.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.155385822057724, | |
| "epoch": 0.4608, | |
| "grad_norm": 0.1452430784702301, | |
| "learning_rate": 4.8721900291112415e-05, | |
| "loss": 1.1461997032165527, | |
| "mean_token_accuracy": 0.6639315262436867, | |
| "num_tokens": 4618481.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.1931456923484802, | |
| "epoch": 0.4736, | |
| "grad_norm": 0.14111614227294922, | |
| "learning_rate": 4.860940925593703e-05, | |
| "loss": 1.1837263107299805, | |
| "mean_token_accuracy": 0.6538461446762085, | |
| "num_tokens": 4746449.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.2137931138277054, | |
| "epoch": 0.4864, | |
| "grad_norm": 0.1422092169523239, | |
| "learning_rate": 4.849231551964771e-05, | |
| "loss": 1.1992123126983643, | |
| "mean_token_accuracy": 0.6522813364863396, | |
| "num_tokens": 4875695.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.1690412908792496, | |
| "epoch": 0.4992, | |
| "grad_norm": 0.14533959329128265, | |
| "learning_rate": 4.837064190990036e-05, | |
| "loss": 1.1562764644622803, | |
| "mean_token_accuracy": 0.6618529111146927, | |
| "num_tokens": 5002824.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.163830503821373, | |
| "epoch": 0.512, | |
| "grad_norm": 0.14272262156009674, | |
| "learning_rate": 4.8244412147206284e-05, | |
| "loss": 1.1516133546829224, | |
| "mean_token_accuracy": 0.6619244366884232, | |
| "num_tokens": 5132045.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.148694396018982, | |
| "epoch": 0.5248, | |
| "grad_norm": 0.13471876084804535, | |
| "learning_rate": 4.8113650840307834e-05, | |
| "loss": 1.1472002267837524, | |
| "mean_token_accuracy": 0.6657932102680206, | |
| "num_tokens": 5261038.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.1257383078336716, | |
| "epoch": 0.5376, | |
| "grad_norm": 0.1379338800907135, | |
| "learning_rate": 4.797838348138086e-05, | |
| "loss": 1.1339021921157837, | |
| "mean_token_accuracy": 0.6660185307264328, | |
| "num_tokens": 5388912.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.1311924755573273, | |
| "epoch": 0.5504, | |
| "grad_norm": 0.14049763977527618, | |
| "learning_rate": 4.783863644106502e-05, | |
| "loss": 1.135345697402954, | |
| "mean_token_accuracy": 0.6648508384823799, | |
| "num_tokens": 5518618.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.1455007046461105, | |
| "epoch": 0.5632, | |
| "grad_norm": 0.13285057246685028, | |
| "learning_rate": 4.769443696332272e-05, | |
| "loss": 1.1532269716262817, | |
| "mean_token_accuracy": 0.6633262932300568, | |
| "num_tokens": 5648116.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.1428617984056473, | |
| "epoch": 0.576, | |
| "grad_norm": 0.13333706557750702, | |
| "learning_rate": 4.754581316012785e-05, | |
| "loss": 1.1316198110580444, | |
| "mean_token_accuracy": 0.668374814093113, | |
| "num_tokens": 5777117.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.1585663259029388, | |
| "epoch": 0.5888, | |
| "grad_norm": 0.14425642788410187, | |
| "learning_rate": 4.7392794005985326e-05, | |
| "loss": 1.1365997791290283, | |
| "mean_token_accuracy": 0.6671516969799995, | |
| "num_tokens": 5904876.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.150609478354454, | |
| "epoch": 0.6016, | |
| "grad_norm": 0.15504664182662964, | |
| "learning_rate": 4.723540933228244e-05, | |
| "loss": 1.127173662185669, | |
| "mean_token_accuracy": 0.6687930002808571, | |
| "num_tokens": 6034768.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.1596223711967468, | |
| "epoch": 0.6144, | |
| "grad_norm": 0.12928146123886108, | |
| "learning_rate": 4.707368982147318e-05, | |
| "loss": 1.1445682048797607, | |
| "mean_token_accuracy": 0.6648146286606789, | |
| "num_tokens": 6163126.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.0994263589382172, | |
| "epoch": 0.6272, | |
| "grad_norm": 0.1349116712808609, | |
| "learning_rate": 4.690766700109659e-05, | |
| "loss": 1.0948941707611084, | |
| "mean_token_accuracy": 0.6754020154476166, | |
| "num_tokens": 6291570.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.112744465470314, | |
| "epoch": 0.64, | |
| "grad_norm": 0.14497768878936768, | |
| "learning_rate": 4.6737373237630476e-05, | |
| "loss": 1.1113452911376953, | |
| "mean_token_accuracy": 0.6713321506977081, | |
| "num_tokens": 6420084.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.1346999406814575, | |
| "epoch": 0.6528, | |
| "grad_norm": 0.1316288709640503, | |
| "learning_rate": 4.656284173018144e-05, | |
| "loss": 1.1358039379119873, | |
| "mean_token_accuracy": 0.6633565202355385, | |
| "num_tokens": 6549817.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.1398767530918121, | |
| "epoch": 0.6656, | |
| "grad_norm": 0.13040749728679657, | |
| "learning_rate": 4.638410650401267e-05, | |
| "loss": 1.1272315979003906, | |
| "mean_token_accuracy": 0.6667839512228966, | |
| "num_tokens": 6678766.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.1322846412658691, | |
| "epoch": 0.6784, | |
| "grad_norm": 0.14328311383724213, | |
| "learning_rate": 4.620120240391065e-05, | |
| "loss": 1.117470145225525, | |
| "mean_token_accuracy": 0.6683860421180725, | |
| "num_tokens": 6808175.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.1198230981826782, | |
| "epoch": 0.6912, | |
| "grad_norm": 0.14016754925251007, | |
| "learning_rate": 4.601416508739211e-05, | |
| "loss": 1.1076020002365112, | |
| "mean_token_accuracy": 0.6711939796805382, | |
| "num_tokens": 6936347.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.1406737715005875, | |
| "epoch": 0.704, | |
| "grad_norm": 0.12862594425678253, | |
| "learning_rate": 4.5823031017752485e-05, | |
| "loss": 1.130237340927124, | |
| "mean_token_accuracy": 0.6678624600172043, | |
| "num_tokens": 7065783.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.1166451126337051, | |
| "epoch": 0.7168, | |
| "grad_norm": 0.13933686912059784, | |
| "learning_rate": 4.562783745695738e-05, | |
| "loss": 1.1190818548202515, | |
| "mean_token_accuracy": 0.6695680469274521, | |
| "num_tokens": 7195341.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.0982198119163513, | |
| "epoch": 0.7296, | |
| "grad_norm": 0.1453101933002472, | |
| "learning_rate": 4.542862245837821e-05, | |
| "loss": 1.0977050065994263, | |
| "mean_token_accuracy": 0.673400916159153, | |
| "num_tokens": 7323591.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.1204975843429565, | |
| "epoch": 0.7424, | |
| "grad_norm": 0.14185063540935516, | |
| "learning_rate": 4.522542485937369e-05, | |
| "loss": 1.1112452745437622, | |
| "mean_token_accuracy": 0.6700539514422417, | |
| "num_tokens": 7449876.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.0963227897882462, | |
| "epoch": 0.7552, | |
| "grad_norm": 0.1320878118276596, | |
| "learning_rate": 4.5018284273718336e-05, | |
| "loss": 1.0801842212677002, | |
| "mean_token_accuracy": 0.6790826618671417, | |
| "num_tokens": 7576398.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.101280301809311, | |
| "epoch": 0.768, | |
| "grad_norm": 0.13114839792251587, | |
| "learning_rate": 4.480724108387977e-05, | |
| "loss": 1.0857573747634888, | |
| "mean_token_accuracy": 0.6782229617238045, | |
| "num_tokens": 7703463.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.1046365648508072, | |
| "epoch": 0.7808, | |
| "grad_norm": 0.14528152346611023, | |
| "learning_rate": 4.4592336433146e-05, | |
| "loss": 1.0996856689453125, | |
| "mean_token_accuracy": 0.6730064377188683, | |
| "num_tokens": 7829441.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.0932775139808655, | |
| "epoch": 0.7936, | |
| "grad_norm": 0.1349162608385086, | |
| "learning_rate": 4.4373612217604496e-05, | |
| "loss": 1.086916208267212, | |
| "mean_token_accuracy": 0.6765137910842896, | |
| "num_tokens": 7958502.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.0945100337266922, | |
| "epoch": 0.8064, | |
| "grad_norm": 0.13429976999759674, | |
| "learning_rate": 4.415111107797445e-05, | |
| "loss": 1.0971022844314575, | |
| "mean_token_accuracy": 0.6743359267711639, | |
| "num_tokens": 8085295.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.118965595960617, | |
| "epoch": 0.8192, | |
| "grad_norm": 0.1320214867591858, | |
| "learning_rate": 4.3924876391293915e-05, | |
| "loss": 1.1191140413284302, | |
| "mean_token_accuracy": 0.6683387905359268, | |
| "num_tokens": 8211901.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.0775217562913895, | |
| "epoch": 0.832, | |
| "grad_norm": 0.13175779581069946, | |
| "learning_rate": 4.36949522624633e-05, | |
| "loss": 1.0712368488311768, | |
| "mean_token_accuracy": 0.6812888830900192, | |
| "num_tokens": 8341017.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.0895331501960754, | |
| "epoch": 0.8448, | |
| "grad_norm": 0.13901865482330322, | |
| "learning_rate": 4.3461383515647106e-05, | |
| "loss": 1.0851002931594849, | |
| "mean_token_accuracy": 0.6775127947330475, | |
| "num_tokens": 8468968.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.111844316124916, | |
| "epoch": 0.8576, | |
| "grad_norm": 0.1398841142654419, | |
| "learning_rate": 4.3224215685535294e-05, | |
| "loss": 1.1119290590286255, | |
| "mean_token_accuracy": 0.6691920980811119, | |
| "num_tokens": 8597358.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.09650357067585, | |
| "epoch": 0.8704, | |
| "grad_norm": 0.12886422872543335, | |
| "learning_rate": 4.2983495008466276e-05, | |
| "loss": 1.0808916091918945, | |
| "mean_token_accuracy": 0.6781075149774551, | |
| "num_tokens": 8725371.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.1017109751701355, | |
| "epoch": 0.8832, | |
| "grad_norm": 0.1451224386692047, | |
| "learning_rate": 4.273926841341302e-05, | |
| "loss": 1.0965564250946045, | |
| "mean_token_accuracy": 0.6711221262812614, | |
| "num_tokens": 8853595.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.0767414420843124, | |
| "epoch": 0.896, | |
| "grad_norm": 0.13234680891036987, | |
| "learning_rate": 4.249158351283414e-05, | |
| "loss": 1.0748488903045654, | |
| "mean_token_accuracy": 0.6783607006072998, | |
| "num_tokens": 8983043.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.1035151928663254, | |
| "epoch": 0.9088, | |
| "grad_norm": 0.14130030572414398, | |
| "learning_rate": 4.224048859339175e-05, | |
| "loss": 1.1003308296203613, | |
| "mean_token_accuracy": 0.6728062555193901, | |
| "num_tokens": 9108608.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.0806768834590912, | |
| "epoch": 0.9216, | |
| "grad_norm": 0.13948991894721985, | |
| "learning_rate": 4.198603260653792e-05, | |
| "loss": 1.0670676231384277, | |
| "mean_token_accuracy": 0.680378146469593, | |
| "num_tokens": 9237077.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.0983169227838516, | |
| "epoch": 0.9344, | |
| "grad_norm": 0.13928388059139252, | |
| "learning_rate": 4.172826515897146e-05, | |
| "loss": 1.0819404125213623, | |
| "mean_token_accuracy": 0.6768162399530411, | |
| "num_tokens": 9365880.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.077269896864891, | |
| "epoch": 0.9472, | |
| "grad_norm": 0.12908564507961273, | |
| "learning_rate": 4.146723650296701e-05, | |
| "loss": 1.0671316385269165, | |
| "mean_token_accuracy": 0.6830117851495743, | |
| "num_tokens": 9495277.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.0963009595870972, | |
| "epoch": 0.96, | |
| "grad_norm": 0.13727004826068878, | |
| "learning_rate": 4.1202997526578276e-05, | |
| "loss": 1.0920417308807373, | |
| "mean_token_accuracy": 0.6739914268255234, | |
| "num_tokens": 9622724.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.0630004107952118, | |
| "epoch": 0.9728, | |
| "grad_norm": 0.12875896692276, | |
| "learning_rate": 4.093559974371725e-05, | |
| "loss": 1.0611292123794556, | |
| "mean_token_accuracy": 0.6826749593019485, | |
| "num_tokens": 9752552.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.0773174464702606, | |
| "epoch": 0.9856, | |
| "grad_norm": 0.13426193594932556, | |
| "learning_rate": 4.066509528411152e-05, | |
| "loss": 1.0728553533554077, | |
| "mean_token_accuracy": 0.6800747960805893, | |
| "num_tokens": 9881931.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.0630360692739487, | |
| "epoch": 0.9984, | |
| "grad_norm": 0.15215876698493958, | |
| "learning_rate": 4.039153688314145e-05, | |
| "loss": 1.0557889938354492, | |
| "mean_token_accuracy": 0.6812136247754097, | |
| "num_tokens": 10009540.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.0610005855560303, | |
| "epoch": 1.0, | |
| "grad_norm": 0.3391527831554413, | |
| "learning_rate": 4.011497787155938e-05, | |
| "loss": 1.077329158782959, | |
| "mean_token_accuracy": 0.6696272492408752, | |
| "num_tokens": 10017540.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.057944431900978, | |
| "epoch": 1.0128, | |
| "grad_norm": 0.13941514492034912, | |
| "learning_rate": 3.983547216509254e-05, | |
| "loss": 1.0362827777862549, | |
| "mean_token_accuracy": 0.6861638650298119, | |
| "num_tokens": 10145649.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.067990705370903, | |
| "epoch": 1.0256, | |
| "grad_norm": 0.15004615485668182, | |
| "learning_rate": 3.955307425393224e-05, | |
| "loss": 1.0445749759674072, | |
| "mean_token_accuracy": 0.685584768652916, | |
| "num_tokens": 10274324.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.0638910681009293, | |
| "epoch": 1.0384, | |
| "grad_norm": 0.15144135057926178, | |
| "learning_rate": 3.92678391921108e-05, | |
| "loss": 1.038772463798523, | |
| "mean_token_accuracy": 0.6854483857750893, | |
| "num_tokens": 10402159.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.0502888560295105, | |
| "epoch": 1.0512, | |
| "grad_norm": 0.1476718783378601, | |
| "learning_rate": 3.897982258676867e-05, | |
| "loss": 1.032806396484375, | |
| "mean_token_accuracy": 0.6877381280064583, | |
| "num_tokens": 10528921.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.0607359856367111, | |
| "epoch": 1.064, | |
| "grad_norm": 0.1483893245458603, | |
| "learning_rate": 3.868908058731376e-05, | |
| "loss": 1.0593475103378296, | |
| "mean_token_accuracy": 0.6811802610754967, | |
| "num_tokens": 10656940.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.0237219482660294, | |
| "epoch": 1.0768, | |
| "grad_norm": 0.14610229432582855, | |
| "learning_rate": 3.8395669874474915e-05, | |
| "loss": 1.0263760089874268, | |
| "mean_token_accuracy": 0.6873858571052551, | |
| "num_tokens": 10785253.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.0171761512756348, | |
| "epoch": 1.0896, | |
| "grad_norm": 0.13900278508663177, | |
| "learning_rate": 3.8099647649251986e-05, | |
| "loss": 1.0178409814834595, | |
| "mean_token_accuracy": 0.6926428601145744, | |
| "num_tokens": 10914475.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.0242549777030945, | |
| "epoch": 1.1024, | |
| "grad_norm": 0.15527690947055817, | |
| "learning_rate": 3.780107162176429e-05, | |
| "loss": 1.0251739025115967, | |
| "mean_token_accuracy": 0.690009593963623, | |
| "num_tokens": 11043294.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.0376387387514114, | |
| "epoch": 1.1152, | |
| "grad_norm": 0.14919476211071014, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.0372812747955322, | |
| "mean_token_accuracy": 0.6861482635140419, | |
| "num_tokens": 11171407.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.0412705391645432, | |
| "epoch": 1.1280000000000001, | |
| "grad_norm": 0.14314031600952148, | |
| "learning_rate": 3.719649147846832e-05, | |
| "loss": 1.0298428535461426, | |
| "mean_token_accuracy": 0.6876860409975052, | |
| "num_tokens": 11300200.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 1.046479344367981, | |
| "epoch": 1.1408, | |
| "grad_norm": 0.14357109367847443, | |
| "learning_rate": 3.689060522675689e-05, | |
| "loss": 1.0436961650848389, | |
| "mean_token_accuracy": 0.6840986981987953, | |
| "num_tokens": 11427720.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.0444832816720009, | |
| "epoch": 1.1536, | |
| "grad_norm": 0.14601631462574005, | |
| "learning_rate": 3.6582400877996546e-05, | |
| "loss": 1.0388257503509521, | |
| "mean_token_accuracy": 0.6848597973585129, | |
| "num_tokens": 11555879.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.0362992137670517, | |
| "epoch": 1.1663999999999999, | |
| "grad_norm": 0.14069858193397522, | |
| "learning_rate": 3.627193851723577e-05, | |
| "loss": 1.0188350677490234, | |
| "mean_token_accuracy": 0.6903941184282303, | |
| "num_tokens": 11683728.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.0298311412334442, | |
| "epoch": 1.1792, | |
| "grad_norm": 0.1387937068939209, | |
| "learning_rate": 3.5959278669726935e-05, | |
| "loss": 1.0166690349578857, | |
| "mean_token_accuracy": 0.6924493312835693, | |
| "num_tokens": 11811595.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 1.0351728200912476, | |
| "epoch": 1.192, | |
| "grad_norm": 0.14132815599441528, | |
| "learning_rate": 3.564448228912682e-05, | |
| "loss": 1.0216882228851318, | |
| "mean_token_accuracy": 0.6892998889088631, | |
| "num_tokens": 11940418.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.026585191488266, | |
| "epoch": 1.2048, | |
| "grad_norm": 0.13901017606258392, | |
| "learning_rate": 3.532761074561355e-05, | |
| "loss": 1.021584153175354, | |
| "mean_token_accuracy": 0.6895899921655655, | |
| "num_tokens": 12069893.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.0406753346323967, | |
| "epoch": 1.2176, | |
| "grad_norm": 0.14579491317272186, | |
| "learning_rate": 3.5008725813922386e-05, | |
| "loss": 1.0375534296035767, | |
| "mean_token_accuracy": 0.6865515261888504, | |
| "num_tokens": 12197874.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.0241748169064522, | |
| "epoch": 1.2304, | |
| "grad_norm": 0.14298036694526672, | |
| "learning_rate": 3.4687889661302576e-05, | |
| "loss": 1.0175296068191528, | |
| "mean_token_accuracy": 0.6926979124546051, | |
| "num_tokens": 12325523.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.0330202355980873, | |
| "epoch": 1.2432, | |
| "grad_norm": 0.14852355420589447, | |
| "learning_rate": 3.436516483539781e-05, | |
| "loss": 1.026180624961853, | |
| "mean_token_accuracy": 0.6885206624865532, | |
| "num_tokens": 12453957.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.031974546611309, | |
| "epoch": 1.256, | |
| "grad_norm": 0.1451551616191864, | |
| "learning_rate": 3.4040614252052305e-05, | |
| "loss": 1.029019832611084, | |
| "mean_token_accuracy": 0.68779356777668, | |
| "num_tokens": 12582932.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.0458147823810577, | |
| "epoch": 1.2688, | |
| "grad_norm": 0.1469789445400238, | |
| "learning_rate": 3.3714301183045385e-05, | |
| "loss": 1.041419267654419, | |
| "mean_token_accuracy": 0.6843385100364685, | |
| "num_tokens": 12709959.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.0275584980845451, | |
| "epoch": 1.2816, | |
| "grad_norm": 0.1412278562784195, | |
| "learning_rate": 3.338628924375638e-05, | |
| "loss": 1.029524326324463, | |
| "mean_token_accuracy": 0.688622310757637, | |
| "num_tokens": 12840008.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.050063706934452, | |
| "epoch": 1.2944, | |
| "grad_norm": 0.14754833281040192, | |
| "learning_rate": 3.305664238076278e-05, | |
| "loss": 1.047257423400879, | |
| "mean_token_accuracy": 0.6842105835676193, | |
| "num_tokens": 12968206.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.01626917719841, | |
| "epoch": 1.3072, | |
| "grad_norm": 0.16974866390228271, | |
| "learning_rate": 3.272542485937369e-05, | |
| "loss": 1.000723123550415, | |
| "mean_token_accuracy": 0.6962596401572227, | |
| "num_tokens": 13096100.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.027530312538147, | |
| "epoch": 1.32, | |
| "grad_norm": 0.14281733334064484, | |
| "learning_rate": 3.239270125110117e-05, | |
| "loss": 1.0164220333099365, | |
| "mean_token_accuracy": 0.6905561611056328, | |
| "num_tokens": 13225387.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.0216997936367989, | |
| "epoch": 1.3328, | |
| "grad_norm": 0.1458079218864441, | |
| "learning_rate": 3.205853642107192e-05, | |
| "loss": 1.0075095891952515, | |
| "mean_token_accuracy": 0.6948263943195343, | |
| "num_tokens": 13353629.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.030478984117508, | |
| "epoch": 1.3456000000000001, | |
| "grad_norm": 0.17896829545497894, | |
| "learning_rate": 3.172299551538164e-05, | |
| "loss": 1.0213568210601807, | |
| "mean_token_accuracy": 0.6878650262951851, | |
| "num_tokens": 13479852.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 1.039674311876297, | |
| "epoch": 1.3584, | |
| "grad_norm": 0.1448402851819992, | |
| "learning_rate": 3.138614394839476e-05, | |
| "loss": 1.042442798614502, | |
| "mean_token_accuracy": 0.683524414896965, | |
| "num_tokens": 13607703.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.022900030016899, | |
| "epoch": 1.3712, | |
| "grad_norm": 0.14083491265773773, | |
| "learning_rate": 3.104804738999169e-05, | |
| "loss": 1.0171509981155396, | |
| "mean_token_accuracy": 0.6908959671854973, | |
| "num_tokens": 13735309.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 1.0258008986711502, | |
| "epoch": 1.384, | |
| "grad_norm": 0.1457403004169464, | |
| "learning_rate": 3.0708771752766394e-05, | |
| "loss": 1.017960548400879, | |
| "mean_token_accuracy": 0.691944383084774, | |
| "num_tokens": 13860919.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 1.0283809155225754, | |
| "epoch": 1.3968, | |
| "grad_norm": 0.14442399144172668, | |
| "learning_rate": 3.0368383179176585e-05, | |
| "loss": 1.0272858142852783, | |
| "mean_token_accuracy": 0.6892063394188881, | |
| "num_tokens": 13989591.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.014742635190487, | |
| "epoch": 1.4096, | |
| "grad_norm": 0.14124004542827606, | |
| "learning_rate": 3.002694802864912e-05, | |
| "loss": 0.9993501901626587, | |
| "mean_token_accuracy": 0.6947403773665428, | |
| "num_tokens": 14117810.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 1.016780748963356, | |
| "epoch": 1.4224, | |
| "grad_norm": 0.1471729427576065, | |
| "learning_rate": 2.9684532864643122e-05, | |
| "loss": 1.0125102996826172, | |
| "mean_token_accuracy": 0.6930836960673332, | |
| "num_tokens": 14242788.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 1.0173302441835403, | |
| "epoch": 1.4352, | |
| "grad_norm": 0.13925546407699585, | |
| "learning_rate": 2.9341204441673266e-05, | |
| "loss": 1.0153708457946777, | |
| "mean_token_accuracy": 0.6915621310472488, | |
| "num_tokens": 14371615.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 1.0239159166812897, | |
| "epoch": 1.448, | |
| "grad_norm": 0.14313757419586182, | |
| "learning_rate": 2.8997029692295874e-05, | |
| "loss": 1.0213682651519775, | |
| "mean_token_accuracy": 0.6906882151961327, | |
| "num_tokens": 14500253.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.0035353675484657, | |
| "epoch": 1.4607999999999999, | |
| "grad_norm": 0.13895684480667114, | |
| "learning_rate": 2.8652075714060295e-05, | |
| "loss": 1.000422477722168, | |
| "mean_token_accuracy": 0.6950262412428856, | |
| "num_tokens": 14628433.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.0296125635504723, | |
| "epoch": 1.4736, | |
| "grad_norm": 0.14564120769500732, | |
| "learning_rate": 2.8306409756428064e-05, | |
| "loss": 1.0179723501205444, | |
| "mean_token_accuracy": 0.6900328099727631, | |
| "num_tokens": 14756107.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 1.0249193534255028, | |
| "epoch": 1.4864, | |
| "grad_norm": 0.13886931538581848, | |
| "learning_rate": 2.7960099207662532e-05, | |
| "loss": 1.0143296718597412, | |
| "mean_token_accuracy": 0.6901694238185883, | |
| "num_tokens": 14885841.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.0198340266942978, | |
| "epoch": 1.4992, | |
| "grad_norm": 0.14387960731983185, | |
| "learning_rate": 2.761321158169134e-05, | |
| "loss": 1.0158933401107788, | |
| "mean_token_accuracy": 0.693331778049469, | |
| "num_tokens": 15014900.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.0240024253726006, | |
| "epoch": 1.512, | |
| "grad_norm": 0.14001767337322235, | |
| "learning_rate": 2.726581450494451e-05, | |
| "loss": 1.0160140991210938, | |
| "mean_token_accuracy": 0.6910362392663956, | |
| "num_tokens": 15140121.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.0351693704724312, | |
| "epoch": 1.5248, | |
| "grad_norm": 0.1424434930086136, | |
| "learning_rate": 2.6917975703170466e-05, | |
| "loss": 1.0207040309906006, | |
| "mean_token_accuracy": 0.6915217339992523, | |
| "num_tokens": 15268220.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.0331912711262703, | |
| "epoch": 1.5375999999999999, | |
| "grad_norm": 0.1435452103614807, | |
| "learning_rate": 2.656976298823284e-05, | |
| "loss": 1.022803544998169, | |
| "mean_token_accuracy": 0.6881031021475792, | |
| "num_tokens": 15396740.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 1.0098799914121628, | |
| "epoch": 1.5504, | |
| "grad_norm": 0.15354876220226288, | |
| "learning_rate": 2.6221244244890336e-05, | |
| "loss": 1.0064752101898193, | |
| "mean_token_accuracy": 0.6923821792006493, | |
| "num_tokens": 15525918.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 1.0045136064291, | |
| "epoch": 1.5632000000000001, | |
| "grad_norm": 0.15096060931682587, | |
| "learning_rate": 2.587248741756253e-05, | |
| "loss": 0.9965898394584656, | |
| "mean_token_accuracy": 0.6942028999328613, | |
| "num_tokens": 15653798.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.0153604969382286, | |
| "epoch": 1.576, | |
| "grad_norm": 0.1559235155582428, | |
| "learning_rate": 2.5523560497083926e-05, | |
| "loss": 1.0174250602722168, | |
| "mean_token_accuracy": 0.6916217133402824, | |
| "num_tokens": 15780901.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.0135911107063293, | |
| "epoch": 1.5888, | |
| "grad_norm": 0.15615662932395935, | |
| "learning_rate": 2.517453150744904e-05, | |
| "loss": 1.0026178359985352, | |
| "mean_token_accuracy": 0.6925746351480484, | |
| "num_tokens": 15910081.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.024174876511097, | |
| "epoch": 1.6016, | |
| "grad_norm": 0.14676935970783234, | |
| "learning_rate": 2.4825468492550964e-05, | |
| "loss": 1.0253103971481323, | |
| "mean_token_accuracy": 0.6872480884194374, | |
| "num_tokens": 16039988.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.0215316414833069, | |
| "epoch": 1.6143999999999998, | |
| "grad_norm": 0.14772795140743256, | |
| "learning_rate": 2.447643950291608e-05, | |
| "loss": 1.0158052444458008, | |
| "mean_token_accuracy": 0.6926918849349022, | |
| "num_tokens": 16168000.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.0269628539681435, | |
| "epoch": 1.6272, | |
| "grad_norm": 0.159188911318779, | |
| "learning_rate": 2.4127512582437485e-05, | |
| "loss": 1.0269343852996826, | |
| "mean_token_accuracy": 0.6895755901932716, | |
| "num_tokens": 16297540.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.0223316550254822, | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.15721148252487183, | |
| "learning_rate": 2.377875575510967e-05, | |
| "loss": 1.0127532482147217, | |
| "mean_token_accuracy": 0.6900231316685677, | |
| "num_tokens": 16427044.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 1.0085494741797447, | |
| "epoch": 1.6528, | |
| "grad_norm": 0.14220507442951202, | |
| "learning_rate": 2.3430237011767167e-05, | |
| "loss": 1.0012016296386719, | |
| "mean_token_accuracy": 0.6937322989106178, | |
| "num_tokens": 16556253.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.0213414132595062, | |
| "epoch": 1.6656, | |
| "grad_norm": 0.14747366309165955, | |
| "learning_rate": 2.3082024296829536e-05, | |
| "loss": 1.0079940557479858, | |
| "mean_token_accuracy": 0.6933478713035583, | |
| "num_tokens": 16684674.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 0.9775404036045074, | |
| "epoch": 1.6784, | |
| "grad_norm": 0.14372865855693817, | |
| "learning_rate": 2.2734185495055503e-05, | |
| "loss": 0.9752405285835266, | |
| "mean_token_accuracy": 0.6997648701071739, | |
| "num_tokens": 16813433.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 1.0255391001701355, | |
| "epoch": 1.6912, | |
| "grad_norm": 0.14679594337940216, | |
| "learning_rate": 2.238678841830867e-05, | |
| "loss": 1.0157995223999023, | |
| "mean_token_accuracy": 0.6912272796034813, | |
| "num_tokens": 16942464.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 1.0093939751386642, | |
| "epoch": 1.704, | |
| "grad_norm": 0.14213216304779053, | |
| "learning_rate": 2.2039900792337474e-05, | |
| "loss": 1.0053470134735107, | |
| "mean_token_accuracy": 0.6922042742371559, | |
| "num_tokens": 17068724.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 1.0206375867128372, | |
| "epoch": 1.7168, | |
| "grad_norm": 0.1582878679037094, | |
| "learning_rate": 2.1693590243571938e-05, | |
| "loss": 1.015845537185669, | |
| "mean_token_accuracy": 0.6909609735012054, | |
| "num_tokens": 17197871.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.0280367136001587, | |
| "epoch": 1.7296, | |
| "grad_norm": 0.14381150901317596, | |
| "learning_rate": 2.1347924285939714e-05, | |
| "loss": 1.0239794254302979, | |
| "mean_token_accuracy": 0.690137580037117, | |
| "num_tokens": 17327107.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.0049420967698097, | |
| "epoch": 1.7424, | |
| "grad_norm": 0.13888318836688995, | |
| "learning_rate": 2.1002970307704132e-05, | |
| "loss": 0.9952517747879028, | |
| "mean_token_accuracy": 0.696092315018177, | |
| "num_tokens": 17455256.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 1.0143049955368042, | |
| "epoch": 1.7551999999999999, | |
| "grad_norm": 0.14273257553577423, | |
| "learning_rate": 2.0658795558326743e-05, | |
| "loss": 1.0057284832000732, | |
| "mean_token_accuracy": 0.6924818381667137, | |
| "num_tokens": 17584010.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 0.9956570863723755, | |
| "epoch": 1.768, | |
| "grad_norm": 0.14681822061538696, | |
| "learning_rate": 2.031546713535688e-05, | |
| "loss": 0.9961063265800476, | |
| "mean_token_accuracy": 0.695470467209816, | |
| "num_tokens": 17712152.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 1.002347745001316, | |
| "epoch": 1.7808000000000002, | |
| "grad_norm": 0.1409362256526947, | |
| "learning_rate": 1.9973051971350888e-05, | |
| "loss": 0.9963667392730713, | |
| "mean_token_accuracy": 0.6953927576541901, | |
| "num_tokens": 17841435.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.001997910439968, | |
| "epoch": 1.7936, | |
| "grad_norm": 0.1434098333120346, | |
| "learning_rate": 1.963161682082342e-05, | |
| "loss": 0.9935073256492615, | |
| "mean_token_accuracy": 0.6966547071933746, | |
| "num_tokens": 17970685.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 0.9948462694883347, | |
| "epoch": 1.8064, | |
| "grad_norm": 0.1479790061712265, | |
| "learning_rate": 1.9291228247233605e-05, | |
| "loss": 0.9818427562713623, | |
| "mean_token_accuracy": 0.6990911811590195, | |
| "num_tokens": 18097293.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 0.9982151091098785, | |
| "epoch": 1.8192, | |
| "grad_norm": 0.1407081037759781, | |
| "learning_rate": 1.895195261000831e-05, | |
| "loss": 0.990318775177002, | |
| "mean_token_accuracy": 0.6987427324056625, | |
| "num_tokens": 18225428.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 1.0017137452960014, | |
| "epoch": 1.8319999999999999, | |
| "grad_norm": 0.14032679796218872, | |
| "learning_rate": 1.8613856051605243e-05, | |
| "loss": 0.999521017074585, | |
| "mean_token_accuracy": 0.6932288855314255, | |
| "num_tokens": 18353477.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.0164642632007599, | |
| "epoch": 1.8448, | |
| "grad_norm": 0.14262859523296356, | |
| "learning_rate": 1.827700448461836e-05, | |
| "loss": 1.0056393146514893, | |
| "mean_token_accuracy": 0.6931333243846893, | |
| "num_tokens": 18483688.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 0.9947623461484909, | |
| "epoch": 1.8576000000000001, | |
| "grad_norm": 0.14257821440696716, | |
| "learning_rate": 1.7941463578928086e-05, | |
| "loss": 1.0008827447891235, | |
| "mean_token_accuracy": 0.6947742477059364, | |
| "num_tokens": 18611470.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.0136389061808586, | |
| "epoch": 1.8704, | |
| "grad_norm": 0.1465529501438141, | |
| "learning_rate": 1.7607298748898842e-05, | |
| "loss": 1.0022717714309692, | |
| "mean_token_accuracy": 0.6935647279024124, | |
| "num_tokens": 18739417.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 0.9927093759179115, | |
| "epoch": 1.8832, | |
| "grad_norm": 0.13819244503974915, | |
| "learning_rate": 1.7274575140626318e-05, | |
| "loss": 0.979236900806427, | |
| "mean_token_accuracy": 0.6986266896128654, | |
| "num_tokens": 18868633.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 0.9977058917284012, | |
| "epoch": 1.896, | |
| "grad_norm": 0.14210258424282074, | |
| "learning_rate": 1.6943357619237226e-05, | |
| "loss": 0.9892839193344116, | |
| "mean_token_accuracy": 0.6953017637133598, | |
| "num_tokens": 18997174.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.0145854726433754, | |
| "epoch": 1.9088, | |
| "grad_norm": 0.14142665266990662, | |
| "learning_rate": 1.6613710756243626e-05, | |
| "loss": 1.0118539333343506, | |
| "mean_token_accuracy": 0.6924030184745789, | |
| "num_tokens": 19126262.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.9954518750309944, | |
| "epoch": 1.9216, | |
| "grad_norm": 0.1441740244626999, | |
| "learning_rate": 1.6285698816954624e-05, | |
| "loss": 0.9903876781463623, | |
| "mean_token_accuracy": 0.6964381784200668, | |
| "num_tokens": 19255187.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 0.999088779091835, | |
| "epoch": 1.9344000000000001, | |
| "grad_norm": 0.14101152122020721, | |
| "learning_rate": 1.5959385747947698e-05, | |
| "loss": 0.99430912733078, | |
| "mean_token_accuracy": 0.6954821571707726, | |
| "num_tokens": 19382468.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 1.0051404386758804, | |
| "epoch": 1.9472, | |
| "grad_norm": 0.14272092282772064, | |
| "learning_rate": 1.56348351646022e-05, | |
| "loss": 1.0007083415985107, | |
| "mean_token_accuracy": 0.6927858367562294, | |
| "num_tokens": 19512195.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 1.021784469485283, | |
| "epoch": 1.96, | |
| "grad_norm": 0.1406528651714325, | |
| "learning_rate": 1.5312110338697426e-05, | |
| "loss": 1.0162166357040405, | |
| "mean_token_accuracy": 0.6914241835474968, | |
| "num_tokens": 19642358.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 0.9982958510518074, | |
| "epoch": 1.9727999999999999, | |
| "grad_norm": 0.144367054104805, | |
| "learning_rate": 1.4991274186077632e-05, | |
| "loss": 0.994674026966095, | |
| "mean_token_accuracy": 0.6925558745861053, | |
| "num_tokens": 19769861.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.0118654742836952, | |
| "epoch": 1.9856, | |
| "grad_norm": 0.14789123833179474, | |
| "learning_rate": 1.467238925438646e-05, | |
| "loss": 1.0072314739227295, | |
| "mean_token_accuracy": 0.6919693425297737, | |
| "num_tokens": 19898556.0, | |
| "step": 156 | |
| }, | |
| { | |
| "entropy": 1.004975602030754, | |
| "epoch": 1.9984, | |
| "grad_norm": 0.14627470076084137, | |
| "learning_rate": 1.4355517710873184e-05, | |
| "loss": 0.996126651763916, | |
| "mean_token_accuracy": 0.694159097969532, | |
| "num_tokens": 20026889.0, | |
| "step": 157 | |
| }, | |
| { | |
| "entropy": 1.0182693004608154, | |
| "epoch": 2.0, | |
| "grad_norm": 0.37654629349708557, | |
| "learning_rate": 1.4040721330273062e-05, | |
| "loss": 0.9920079708099365, | |
| "mean_token_accuracy": 0.6773799061775208, | |
| "num_tokens": 20035080.0, | |
| "step": 158 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 237, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.1153161977077432e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |