Instructions to use Taywon/A1plus_v4_qwq_e2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/A1plus_v4_qwq_e2 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/QwQ-32B") model = PeftModel.from_pretrained(base_model, "Taywon/A1plus_v4_qwq_e2") - Transformers
How to use Taywon/A1plus_v4_qwq_e2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/A1plus_v4_qwq_e2") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/A1plus_v4_qwq_e2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/A1plus_v4_qwq_e2 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/A1plus_v4_qwq_e2" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1plus_v4_qwq_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/A1plus_v4_qwq_e2
- SGLang
How to use Taywon/A1plus_v4_qwq_e2 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/A1plus_v4_qwq_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1plus_v4_qwq_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/A1plus_v4_qwq_e2" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A1plus_v4_qwq_e2", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/A1plus_v4_qwq_e2 with Docker Model Runner:
docker model run hf.co/Taywon/A1plus_v4_qwq_e2
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 156, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.2914280891418457, | |
| "epoch": 0.012965964343598054, | |
| "grad_norm": 1.112913966178894, | |
| "learning_rate": 0.0, | |
| "loss": 2.1718008518218994, | |
| "mean_token_accuracy": 0.5190608203411102, | |
| "num_tokens": 130726.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.2813172340393066, | |
| "epoch": 0.02593192868719611, | |
| "grad_norm": 1.0995973348617554, | |
| "learning_rate": 4.166666666666667e-06, | |
| "loss": 2.1320834159851074, | |
| "mean_token_accuracy": 0.5265823230147362, | |
| "num_tokens": 257394.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.327770620584488, | |
| "epoch": 0.03889789303079417, | |
| "grad_norm": 0.9902980327606201, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 2.1106252670288086, | |
| "mean_token_accuracy": 0.5237875208258629, | |
| "num_tokens": 387496.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.3719477504491806, | |
| "epoch": 0.05186385737439222, | |
| "grad_norm": 0.8683141469955444, | |
| "learning_rate": 1.25e-05, | |
| "loss": 2.0806920528411865, | |
| "mean_token_accuracy": 0.526897743344307, | |
| "num_tokens": 517915.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.4400453567504883, | |
| "epoch": 0.06482982171799027, | |
| "grad_norm": 0.6660990715026855, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 1.9889618158340454, | |
| "mean_token_accuracy": 0.5334466248750687, | |
| "num_tokens": 648540.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.5626330226659775, | |
| "epoch": 0.07779578606158834, | |
| "grad_norm": 0.5204595923423767, | |
| "learning_rate": 2.0833333333333336e-05, | |
| "loss": 1.9843950271606445, | |
| "mean_token_accuracy": 0.5293373018503189, | |
| "num_tokens": 779170.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.6014426946640015, | |
| "epoch": 0.09076175040518639, | |
| "grad_norm": 0.3845070004463196, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.887692928314209, | |
| "mean_token_accuracy": 0.5425543487071991, | |
| "num_tokens": 909516.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.6851050555706024, | |
| "epoch": 0.10372771474878444, | |
| "grad_norm": 0.30755460262298584, | |
| "learning_rate": 2.916666666666667e-05, | |
| "loss": 1.8439122438430786, | |
| "mean_token_accuracy": 0.5476168766617775, | |
| "num_tokens": 1039198.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.7548235952854156, | |
| "epoch": 0.1166936790923825, | |
| "grad_norm": 0.26733461022377014, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.8185280561447144, | |
| "mean_token_accuracy": 0.5502617135643959, | |
| "num_tokens": 1169425.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.7970841228961945, | |
| "epoch": 0.12965964343598055, | |
| "grad_norm": 0.26483356952667236, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.7471606731414795, | |
| "mean_token_accuracy": 0.5560443699359894, | |
| "num_tokens": 1299168.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.8392730802297592, | |
| "epoch": 0.1426256077795786, | |
| "grad_norm": 0.2690557837486267, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 1.736329197883606, | |
| "mean_token_accuracy": 0.5596349760890007, | |
| "num_tokens": 1430062.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.885682463645935, | |
| "epoch": 0.15559157212317667, | |
| "grad_norm": 0.2904511094093323, | |
| "learning_rate": 4.5833333333333334e-05, | |
| "loss": 1.7258615493774414, | |
| "mean_token_accuracy": 0.5618793666362762, | |
| "num_tokens": 1560442.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.9065079540014267, | |
| "epoch": 0.1685575364667747, | |
| "grad_norm": 0.3055932819843292, | |
| "learning_rate": 5e-05, | |
| "loss": 1.709148645401001, | |
| "mean_token_accuracy": 0.5631825849413872, | |
| "num_tokens": 1687626.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.8885795921087265, | |
| "epoch": 0.18152350081037277, | |
| "grad_norm": 0.31618642807006836, | |
| "learning_rate": 4.9997496794168726e-05, | |
| "loss": 1.6640710830688477, | |
| "mean_token_accuracy": 0.5704818964004517, | |
| "num_tokens": 1817839.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.799900770187378, | |
| "epoch": 0.19448946515397084, | |
| "grad_norm": 0.28537100553512573, | |
| "learning_rate": 4.998998767795805e-05, | |
| "loss": 1.5893642902374268, | |
| "mean_token_accuracy": 0.5844717845320702, | |
| "num_tokens": 1947846.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.7524273693561554, | |
| "epoch": 0.20745542949756887, | |
| "grad_norm": 0.25802257657051086, | |
| "learning_rate": 4.9977474155117045e-05, | |
| "loss": 1.57011079788208, | |
| "mean_token_accuracy": 0.5896653309464455, | |
| "num_tokens": 2078221.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.709429755806923, | |
| "epoch": 0.22042139384116693, | |
| "grad_norm": 0.22759748995304108, | |
| "learning_rate": 4.995995873155958e-05, | |
| "loss": 1.5693228244781494, | |
| "mean_token_accuracy": 0.5865247845649719, | |
| "num_tokens": 2208236.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.6319102048873901, | |
| "epoch": 0.233387358184765, | |
| "grad_norm": 0.19342641532421112, | |
| "learning_rate": 4.99374449148625e-05, | |
| "loss": 1.528588056564331, | |
| "mean_token_accuracy": 0.5946438014507294, | |
| "num_tokens": 2338245.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.5404616594314575, | |
| "epoch": 0.24635332252836303, | |
| "grad_norm": 0.1698416769504547, | |
| "learning_rate": 4.9909937213563165e-05, | |
| "loss": 1.4880129098892212, | |
| "mean_token_accuracy": 0.6007702648639679, | |
| "num_tokens": 2467411.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.5045948326587677, | |
| "epoch": 0.2593192868719611, | |
| "grad_norm": 0.1683117300271988, | |
| "learning_rate": 4.987744113625665e-05, | |
| "loss": 1.5048375129699707, | |
| "mean_token_accuracy": 0.5982850342988968, | |
| "num_tokens": 2598113.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.4073765128850937, | |
| "epoch": 0.27228525121555913, | |
| "grad_norm": 0.19874629378318787, | |
| "learning_rate": 4.9839963190492576e-05, | |
| "loss": 1.456631064414978, | |
| "mean_token_accuracy": 0.6086618900299072, | |
| "num_tokens": 2728430.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.3884904980659485, | |
| "epoch": 0.2852512155591572, | |
| "grad_norm": 0.21319466829299927, | |
| "learning_rate": 4.979751088147192e-05, | |
| "loss": 1.4507615566253662, | |
| "mean_token_accuracy": 0.6082002520561218, | |
| "num_tokens": 2858506.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.3483813256025314, | |
| "epoch": 0.29821717990275526, | |
| "grad_norm": 0.23800760507583618, | |
| "learning_rate": 4.975009271054409e-05, | |
| "loss": 1.4227944612503052, | |
| "mean_token_accuracy": 0.611847274005413, | |
| "num_tokens": 2985950.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.3535500168800354, | |
| "epoch": 0.31118314424635335, | |
| "grad_norm": 0.21581389009952545, | |
| "learning_rate": 4.969771817350445e-05, | |
| "loss": 1.4188156127929688, | |
| "mean_token_accuracy": 0.6119491159915924, | |
| "num_tokens": 3112407.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.338183343410492, | |
| "epoch": 0.3241491085899514, | |
| "grad_norm": 0.19480355083942413, | |
| "learning_rate": 4.9640397758692715e-05, | |
| "loss": 1.3919925689697266, | |
| "mean_token_accuracy": 0.6192305833101273, | |
| "num_tokens": 3242148.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.3593887984752655, | |
| "epoch": 0.3371150729335494, | |
| "grad_norm": 0.15354962646961212, | |
| "learning_rate": 4.957814294489261e-05, | |
| "loss": 1.3766716718673706, | |
| "mean_token_accuracy": 0.6211562678217888, | |
| "num_tokens": 3373129.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.362599864602089, | |
| "epoch": 0.3500810372771475, | |
| "grad_norm": 0.13560850918293, | |
| "learning_rate": 4.9510966199033174e-05, | |
| "loss": 1.349892258644104, | |
| "mean_token_accuracy": 0.6282063350081444, | |
| "num_tokens": 3503490.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.3730409890413284, | |
| "epoch": 0.36304700162074555, | |
| "grad_norm": 0.13365128636360168, | |
| "learning_rate": 4.943888097369216e-05, | |
| "loss": 1.3391973972320557, | |
| "mean_token_accuracy": 0.6288642287254333, | |
| "num_tokens": 3631734.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.371128425002098, | |
| "epoch": 0.3760129659643436, | |
| "grad_norm": 0.14155763387680054, | |
| "learning_rate": 4.936190170440208e-05, | |
| "loss": 1.32077956199646, | |
| "mean_token_accuracy": 0.6326342150568962, | |
| "num_tokens": 3762573.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.407492458820343, | |
| "epoch": 0.3889789303079417, | |
| "grad_norm": 0.14185482263565063, | |
| "learning_rate": 4.928004380675941e-05, | |
| "loss": 1.3511477708816528, | |
| "mean_token_accuracy": 0.625172384083271, | |
| "num_tokens": 3893064.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.3961241841316223, | |
| "epoch": 0.4019448946515397, | |
| "grad_norm": 0.13855496048927307, | |
| "learning_rate": 4.9193323673337476e-05, | |
| "loss": 1.336405873298645, | |
| "mean_token_accuracy": 0.6296647489070892, | |
| "num_tokens": 4023676.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.3903988599777222, | |
| "epoch": 0.41491085899513774, | |
| "grad_norm": 0.13400253653526306, | |
| "learning_rate": 4.910175867040377e-05, | |
| "loss": 1.3442656993865967, | |
| "mean_token_accuracy": 0.627065122127533, | |
| "num_tokens": 4153956.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.351208671927452, | |
| "epoch": 0.42787682333873583, | |
| "grad_norm": 0.12610815465450287, | |
| "learning_rate": 4.9005367134442235e-05, | |
| "loss": 1.3147870302200317, | |
| "mean_token_accuracy": 0.6329845190048218, | |
| "num_tokens": 4283315.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.3148349225521088, | |
| "epoch": 0.44084278768233387, | |
| "grad_norm": 0.11920498311519623, | |
| "learning_rate": 4.890416836848127e-05, | |
| "loss": 1.2881569862365723, | |
| "mean_token_accuracy": 0.6375886723399162, | |
| "num_tokens": 4414063.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.3178757429122925, | |
| "epoch": 0.4538087520259319, | |
| "grad_norm": 0.11554136872291565, | |
| "learning_rate": 4.8798182638228166e-05, | |
| "loss": 1.3023653030395508, | |
| "mean_token_accuracy": 0.635626994073391, | |
| "num_tokens": 4542894.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.2868364304304123, | |
| "epoch": 0.46677471636953, | |
| "grad_norm": 0.11724869906902313, | |
| "learning_rate": 4.868743116801074e-05, | |
| "loss": 1.276515245437622, | |
| "mean_token_accuracy": 0.6388825476169586, | |
| "num_tokens": 4673393.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.3117478638887405, | |
| "epoch": 0.47974068071312803, | |
| "grad_norm": 0.11675813794136047, | |
| "learning_rate": 4.857193613652711e-05, | |
| "loss": 1.319561243057251, | |
| "mean_token_accuracy": 0.6311607211828232, | |
| "num_tokens": 4803020.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.269007459282875, | |
| "epoch": 0.49270664505672607, | |
| "grad_norm": 0.11431621760129929, | |
| "learning_rate": 4.845172067240415e-05, | |
| "loss": 1.2735211849212646, | |
| "mean_token_accuracy": 0.6423661559820175, | |
| "num_tokens": 4932686.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.2656036466360092, | |
| "epoch": 0.5056726094003241, | |
| "grad_norm": 0.11062812805175781, | |
| "learning_rate": 4.8326808849565936e-05, | |
| "loss": 1.265828251838684, | |
| "mean_token_accuracy": 0.6441638022661209, | |
| "num_tokens": 5062963.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.27534119784832, | |
| "epoch": 0.5186385737439222, | |
| "grad_norm": 0.11323992908000946, | |
| "learning_rate": 4.819722568241274e-05, | |
| "loss": 1.281820297241211, | |
| "mean_token_accuracy": 0.6388759091496468, | |
| "num_tokens": 5192982.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.2759585976600647, | |
| "epoch": 0.5316045380875203, | |
| "grad_norm": 0.11570397019386292, | |
| "learning_rate": 4.806299712081172e-05, | |
| "loss": 1.276839256286621, | |
| "mean_token_accuracy": 0.6385012120008469, | |
| "num_tokens": 5323413.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.265689566731453, | |
| "epoch": 0.5445705024311183, | |
| "grad_norm": 0.10930497944355011, | |
| "learning_rate": 4.792415004490034e-05, | |
| "loss": 1.2645472288131714, | |
| "mean_token_accuracy": 0.6423149555921555, | |
| "num_tokens": 5454255.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.254970133304596, | |
| "epoch": 0.5575364667747164, | |
| "grad_norm": 0.10787371546030045, | |
| "learning_rate": 4.77807122597034e-05, | |
| "loss": 1.2552263736724854, | |
| "mean_token_accuracy": 0.6437231004238129, | |
| "num_tokens": 5583881.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.2431457936763763, | |
| "epoch": 0.5705024311183144, | |
| "grad_norm": 0.10893784463405609, | |
| "learning_rate": 4.7632712489564926e-05, | |
| "loss": 1.2408338785171509, | |
| "mean_token_accuracy": 0.6460021436214447, | |
| "num_tokens": 5714257.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.228305697441101, | |
| "epoch": 0.5834683954619124, | |
| "grad_norm": 0.11218206584453583, | |
| "learning_rate": 4.748018037239592e-05, | |
| "loss": 1.2231602668762207, | |
| "mean_token_accuracy": 0.6500201225280762, | |
| "num_tokens": 5844960.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.2626090496778488, | |
| "epoch": 0.5964343598055105, | |
| "grad_norm": 0.11627671867609024, | |
| "learning_rate": 4.732314645373921e-05, | |
| "loss": 1.2628517150878906, | |
| "mean_token_accuracy": 0.6433948427438736, | |
| "num_tokens": 5974432.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.2499435395002365, | |
| "epoch": 0.6094003241491086, | |
| "grad_norm": 0.1064961850643158, | |
| "learning_rate": 4.7161642180652464e-05, | |
| "loss": 1.2429689168930054, | |
| "mean_token_accuracy": 0.6463894993066788, | |
| "num_tokens": 6105159.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.2387475371360779, | |
| "epoch": 0.6223662884927067, | |
| "grad_norm": 0.1059798151254654, | |
| "learning_rate": 4.699569989541074e-05, | |
| "loss": 1.2348564863204956, | |
| "mean_token_accuracy": 0.6485447883605957, | |
| "num_tokens": 6234686.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.230888694524765, | |
| "epoch": 0.6353322528363047, | |
| "grad_norm": 0.10563136637210846, | |
| "learning_rate": 4.6825352829029705e-05, | |
| "loss": 1.2326059341430664, | |
| "mean_token_accuracy": 0.650854229927063, | |
| "num_tokens": 6364713.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.2304238229990005, | |
| "epoch": 0.6482982171799028, | |
| "grad_norm": 0.10895860940217972, | |
| "learning_rate": 4.665063509461097e-05, | |
| "loss": 1.2246171236038208, | |
| "mean_token_accuracy": 0.6520287021994591, | |
| "num_tokens": 6494067.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.2349478155374527, | |
| "epoch": 0.6612641815235009, | |
| "grad_norm": 0.11149362474679947, | |
| "learning_rate": 4.647158168051066e-05, | |
| "loss": 1.2276027202606201, | |
| "mean_token_accuracy": 0.6503733918070793, | |
| "num_tokens": 6624643.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.2219702452421188, | |
| "epoch": 0.6742301458670988, | |
| "grad_norm": 0.10449287295341492, | |
| "learning_rate": 4.628822844333278e-05, | |
| "loss": 1.2258139848709106, | |
| "mean_token_accuracy": 0.6509344652295113, | |
| "num_tokens": 6754416.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.2058308869600296, | |
| "epoch": 0.6871961102106969, | |
| "grad_norm": 0.10380305349826813, | |
| "learning_rate": 4.6100612100748765e-05, | |
| "loss": 1.214524745941162, | |
| "mean_token_accuracy": 0.6529537662863731, | |
| "num_tokens": 6885227.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.2204056680202484, | |
| "epoch": 0.700162074554295, | |
| "grad_norm": 0.10786499083042145, | |
| "learning_rate": 4.59087702241444e-05, | |
| "loss": 1.2236121892929077, | |
| "mean_token_accuracy": 0.648014634847641, | |
| "num_tokens": 7011809.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.2288042306900024, | |
| "epoch": 0.713128038897893, | |
| "grad_norm": 0.1033908799290657, | |
| "learning_rate": 4.571274123109606e-05, | |
| "loss": 1.2249078750610352, | |
| "mean_token_accuracy": 0.6486673802137375, | |
| "num_tokens": 7141874.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.1886361241340637, | |
| "epoch": 0.7260940032414911, | |
| "grad_norm": 0.10556555539369583, | |
| "learning_rate": 4.551256437767719e-05, | |
| "loss": 1.1965718269348145, | |
| "mean_token_accuracy": 0.6559380367398262, | |
| "num_tokens": 7272536.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.1931221783161163, | |
| "epoch": 0.7390599675850892, | |
| "grad_norm": 0.10483699291944504, | |
| "learning_rate": 4.530827975059715e-05, | |
| "loss": 1.1899445056915283, | |
| "mean_token_accuracy": 0.6578836813569069, | |
| "num_tokens": 7402306.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.2073332518339157, | |
| "epoch": 0.7520259319286872, | |
| "grad_norm": 0.10389534384012222, | |
| "learning_rate": 4.5099928259173516e-05, | |
| "loss": 1.2089029550552368, | |
| "mean_token_accuracy": 0.6548937857151031, | |
| "num_tokens": 7532812.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.2048113197088242, | |
| "epoch": 0.7649918962722853, | |
| "grad_norm": 0.10125990211963654, | |
| "learning_rate": 4.488755162713975e-05, | |
| "loss": 1.2044589519500732, | |
| "mean_token_accuracy": 0.6544741094112396, | |
| "num_tokens": 7663455.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.1779465079307556, | |
| "epoch": 0.7779578606158833, | |
| "grad_norm": 0.10293558984994888, | |
| "learning_rate": 4.467119238428975e-05, | |
| "loss": 1.1754040718078613, | |
| "mean_token_accuracy": 0.6628620699048042, | |
| "num_tokens": 7791205.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.2144263088703156, | |
| "epoch": 0.7909238249594813, | |
| "grad_norm": 0.10379968583583832, | |
| "learning_rate": 4.445089385796099e-05, | |
| "loss": 1.2083706855773926, | |
| "mean_token_accuracy": 0.6543944776058197, | |
| "num_tokens": 7918409.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.1998531073331833, | |
| "epoch": 0.8038897893030794, | |
| "grad_norm": 0.10215966403484344, | |
| "learning_rate": 4.422670016435792e-05, | |
| "loss": 1.1933221817016602, | |
| "mean_token_accuracy": 0.6570570692420006, | |
| "num_tokens": 8048417.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.200714260339737, | |
| "epoch": 0.8168557536466775, | |
| "grad_norm": 0.100275419652462, | |
| "learning_rate": 4.3998656199717435e-05, | |
| "loss": 1.189272165298462, | |
| "mean_token_accuracy": 0.6573792845010757, | |
| "num_tokens": 8179053.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.1872155517339706, | |
| "epoch": 0.8298217179902755, | |
| "grad_norm": 0.10071317106485367, | |
| "learning_rate": 4.3766807631318106e-05, | |
| "loss": 1.1810928583145142, | |
| "mean_token_accuracy": 0.6583103537559509, | |
| "num_tokens": 8309355.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.1796019226312637, | |
| "epoch": 0.8427876823338736, | |
| "grad_norm": 0.10065017640590668, | |
| "learning_rate": 4.353120088833501e-05, | |
| "loss": 1.17380952835083, | |
| "mean_token_accuracy": 0.6608408540487289, | |
| "num_tokens": 8439678.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.1712117940187454, | |
| "epoch": 0.8557536466774717, | |
| "grad_norm": 0.09942107647657394, | |
| "learning_rate": 4.329188315254196e-05, | |
| "loss": 1.1702531576156616, | |
| "mean_token_accuracy": 0.6607685834169388, | |
| "num_tokens": 8569426.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.1880214363336563, | |
| "epoch": 0.8687196110210696, | |
| "grad_norm": 0.10245856642723083, | |
| "learning_rate": 4.3048902348863116e-05, | |
| "loss": 1.1839733123779297, | |
| "mean_token_accuracy": 0.658528208732605, | |
| "num_tokens": 8698056.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.1805013716220856, | |
| "epoch": 0.8816855753646677, | |
| "grad_norm": 0.1010119840502739, | |
| "learning_rate": 4.280230713577564e-05, | |
| "loss": 1.179073452949524, | |
| "mean_token_accuracy": 0.6590162664651871, | |
| "num_tokens": 8828822.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.1775793582201004, | |
| "epoch": 0.8946515397082658, | |
| "grad_norm": 0.10408595204353333, | |
| "learning_rate": 4.255214689556557e-05, | |
| "loss": 1.1802899837493896, | |
| "mean_token_accuracy": 0.6601392850279808, | |
| "num_tokens": 8958617.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.1794121712446213, | |
| "epoch": 0.9076175040518638, | |
| "grad_norm": 0.10349196195602417, | |
| "learning_rate": 4.229847172443866e-05, | |
| "loss": 1.1859654188156128, | |
| "mean_token_accuracy": 0.6571361273527145, | |
| "num_tokens": 9089619.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.1704782098531723, | |
| "epoch": 0.9205834683954619, | |
| "grad_norm": 0.10455135256052017, | |
| "learning_rate": 4.204133242248832e-05, | |
| "loss": 1.1761753559112549, | |
| "mean_token_accuracy": 0.661134235560894, | |
| "num_tokens": 9220349.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.2045030444860458, | |
| "epoch": 0.93354943273906, | |
| "grad_norm": 0.10628621280193329, | |
| "learning_rate": 4.1780780483522575e-05, | |
| "loss": 1.1999099254608154, | |
| "mean_token_accuracy": 0.6541163548827171, | |
| "num_tokens": 9350922.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.194443255662918, | |
| "epoch": 0.946515397082658, | |
| "grad_norm": 0.10347249358892441, | |
| "learning_rate": 4.151686808475204e-05, | |
| "loss": 1.191763162612915, | |
| "mean_token_accuracy": 0.6565472781658173, | |
| "num_tokens": 9479617.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.1695558428764343, | |
| "epoch": 0.9594813614262561, | |
| "grad_norm": 0.1053929403424263, | |
| "learning_rate": 4.1249648076341165e-05, | |
| "loss": 1.17070472240448, | |
| "mean_token_accuracy": 0.662074476480484, | |
| "num_tokens": 9609933.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.1687128692865372, | |
| "epoch": 0.9724473257698542, | |
| "grad_norm": 0.10350026190280914, | |
| "learning_rate": 4.0979173970824626e-05, | |
| "loss": 1.1742582321166992, | |
| "mean_token_accuracy": 0.6614358499646187, | |
| "num_tokens": 9740065.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.1681682914495468, | |
| "epoch": 0.9854132901134521, | |
| "grad_norm": 0.10243335366249084, | |
| "learning_rate": 4.070549993239106e-05, | |
| "loss": 1.1658577919006348, | |
| "mean_token_accuracy": 0.6637781262397766, | |
| "num_tokens": 9870742.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.1639882773160934, | |
| "epoch": 0.9983792544570502, | |
| "grad_norm": 0.10228604823350906, | |
| "learning_rate": 4.0428680766036384e-05, | |
| "loss": 1.1644949913024902, | |
| "mean_token_accuracy": 0.6624981611967087, | |
| "num_tokens": 10001320.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.1632845401763916, | |
| "epoch": 1.0, | |
| "grad_norm": 0.2728025019168854, | |
| "learning_rate": 4.0148771906588706e-05, | |
| "loss": 1.1762704849243164, | |
| "mean_token_accuracy": 0.6677740812301636, | |
| "num_tokens": 10009153.0, | |
| "step": 78 | |
| }, | |
| { | |
| "entropy": 1.1636807769536972, | |
| "epoch": 1.012965964343598, | |
| "grad_norm": 0.10475616157054901, | |
| "learning_rate": 3.986582940760717e-05, | |
| "loss": 1.148669958114624, | |
| "mean_token_accuracy": 0.6649533659219742, | |
| "num_tokens": 10140011.0, | |
| "step": 79 | |
| }, | |
| { | |
| "entropy": 1.1557996571063995, | |
| "epoch": 1.0259319286871962, | |
| "grad_norm": 0.10492753237485886, | |
| "learning_rate": 3.957990993015683e-05, | |
| "loss": 1.1505277156829834, | |
| "mean_token_accuracy": 0.6668093428015709, | |
| "num_tokens": 10270495.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.15270234644413, | |
| "epoch": 1.0388978930307942, | |
| "grad_norm": 0.11243247240781784, | |
| "learning_rate": 3.929107073146197e-05, | |
| "loss": 1.1362740993499756, | |
| "mean_token_accuracy": 0.6668569073081017, | |
| "num_tokens": 10399470.0, | |
| "step": 81 | |
| }, | |
| { | |
| "entropy": 1.1315193176269531, | |
| "epoch": 1.0518638573743921, | |
| "grad_norm": 0.10758878290653229, | |
| "learning_rate": 3.899936965343989e-05, | |
| "loss": 1.124503254890442, | |
| "mean_token_accuracy": 0.6695496663451195, | |
| "num_tokens": 10529305.0, | |
| "step": 82 | |
| }, | |
| { | |
| "entropy": 1.1181457191705704, | |
| "epoch": 1.0648298217179903, | |
| "grad_norm": 0.10492865741252899, | |
| "learning_rate": 3.8704865111117746e-05, | |
| "loss": 1.115187406539917, | |
| "mean_token_accuracy": 0.6714175269007683, | |
| "num_tokens": 10658946.0, | |
| "step": 83 | |
| }, | |
| { | |
| "entropy": 1.0976143777370453, | |
| "epoch": 1.0777957860615883, | |
| "grad_norm": 0.1108441948890686, | |
| "learning_rate": 3.840761608093456e-05, | |
| "loss": 1.1016005277633667, | |
| "mean_token_accuracy": 0.6776464283466339, | |
| "num_tokens": 10785329.0, | |
| "step": 84 | |
| }, | |
| { | |
| "entropy": 1.0979181677103043, | |
| "epoch": 1.0907617504051863, | |
| "grad_norm": 0.10647857189178467, | |
| "learning_rate": 3.8107682088930794e-05, | |
| "loss": 1.1082489490509033, | |
| "mean_token_accuracy": 0.6754170134663582, | |
| "num_tokens": 10915123.0, | |
| "step": 85 | |
| }, | |
| { | |
| "entropy": 1.116148591041565, | |
| "epoch": 1.1037277147487845, | |
| "grad_norm": 0.10859860479831696, | |
| "learning_rate": 3.7805123198827857e-05, | |
| "loss": 1.1278622150421143, | |
| "mean_token_accuracy": 0.6695821657776833, | |
| "num_tokens": 11045591.0, | |
| "step": 86 | |
| }, | |
| { | |
| "entropy": 1.1232954412698746, | |
| "epoch": 1.1166936790923825, | |
| "grad_norm": 0.11128611862659454, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.1274020671844482, | |
| "mean_token_accuracy": 0.671474426984787, | |
| "num_tokens": 11175412.0, | |
| "step": 87 | |
| }, | |
| { | |
| "entropy": 1.1286661922931671, | |
| "epoch": 1.1296596434359805, | |
| "grad_norm": 0.10658227652311325, | |
| "learning_rate": 3.719237359534087e-05, | |
| "loss": 1.1328142881393433, | |
| "mean_token_accuracy": 0.6698684319853783, | |
| "num_tokens": 11305669.0, | |
| "step": 88 | |
| }, | |
| { | |
| "entropy": 1.127964898943901, | |
| "epoch": 1.1426256077795787, | |
| "grad_norm": 0.1069759875535965, | |
| "learning_rate": 3.688230558902725e-05, | |
| "loss": 1.1221802234649658, | |
| "mean_token_accuracy": 0.6720241084694862, | |
| "num_tokens": 11433238.0, | |
| "step": 89 | |
| }, | |
| { | |
| "entropy": 1.1164967715740204, | |
| "epoch": 1.1555915721231766, | |
| "grad_norm": 0.1038687601685524, | |
| "learning_rate": 3.656985807418248e-05, | |
| "loss": 1.1091525554656982, | |
| "mean_token_accuracy": 0.6741333156824112, | |
| "num_tokens": 11563958.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.119084969162941, | |
| "epoch": 1.1685575364667746, | |
| "grad_norm": 0.10730428993701935, | |
| "learning_rate": 3.6255093620441834e-05, | |
| "loss": 1.1172475814819336, | |
| "mean_token_accuracy": 0.6720305904746056, | |
| "num_tokens": 11694626.0, | |
| "step": 91 | |
| }, | |
| { | |
| "entropy": 1.1386660188436508, | |
| "epoch": 1.1815235008103728, | |
| "grad_norm": 0.11028113216161728, | |
| "learning_rate": 3.593807526142261e-05, | |
| "loss": 1.1373463869094849, | |
| "mean_token_accuracy": 0.6680505573749542, | |
| "num_tokens": 11824157.0, | |
| "step": 92 | |
| }, | |
| { | |
| "entropy": 1.128893181681633, | |
| "epoch": 1.1944894651539708, | |
| "grad_norm": 0.11066646128892899, | |
| "learning_rate": 3.56188664821012e-05, | |
| "loss": 1.1258357763290405, | |
| "mean_token_accuracy": 0.6708294078707695, | |
| "num_tokens": 11954860.0, | |
| "step": 93 | |
| }, | |
| { | |
| "entropy": 1.1333434879779816, | |
| "epoch": 1.2074554294975688, | |
| "grad_norm": 0.10427077114582062, | |
| "learning_rate": 3.529753120609982e-05, | |
| "loss": 1.1275739669799805, | |
| "mean_token_accuracy": 0.6714382618665695, | |
| "num_tokens": 12084728.0, | |
| "step": 94 | |
| }, | |
| { | |
| "entropy": 1.1430685371160507, | |
| "epoch": 1.220421393841167, | |
| "grad_norm": 0.10981430858373642, | |
| "learning_rate": 3.497413378288541e-05, | |
| "loss": 1.1324477195739746, | |
| "mean_token_accuracy": 0.6704236418008804, | |
| "num_tokens": 12215214.0, | |
| "step": 95 | |
| }, | |
| { | |
| "entropy": 1.1366370916366577, | |
| "epoch": 1.233387358184765, | |
| "grad_norm": 0.10740207880735397, | |
| "learning_rate": 3.464873897488322e-05, | |
| "loss": 1.1347224712371826, | |
| "mean_token_accuracy": 0.6679130420088768, | |
| "num_tokens": 12345791.0, | |
| "step": 96 | |
| }, | |
| { | |
| "entropy": 1.1018346101045609, | |
| "epoch": 1.246353322528363, | |
| "grad_norm": 0.10746090114116669, | |
| "learning_rate": 3.432141194450772e-05, | |
| "loss": 1.0866354703903198, | |
| "mean_token_accuracy": 0.6808393970131874, | |
| "num_tokens": 12475633.0, | |
| "step": 97 | |
| }, | |
| { | |
| "entropy": 1.1090585142374039, | |
| "epoch": 1.2593192868719612, | |
| "grad_norm": 0.10877131670713425, | |
| "learning_rate": 3.39922182411134e-05, | |
| "loss": 1.1041377782821655, | |
| "mean_token_accuracy": 0.6753545328974724, | |
| "num_tokens": 12605177.0, | |
| "step": 98 | |
| }, | |
| { | |
| "entropy": 1.1077013164758682, | |
| "epoch": 1.2722852512155591, | |
| "grad_norm": 0.10926997661590576, | |
| "learning_rate": 3.3661223787868094e-05, | |
| "loss": 1.1172577142715454, | |
| "mean_token_accuracy": 0.6722195670008659, | |
| "num_tokens": 12735595.0, | |
| "step": 99 | |
| }, | |
| { | |
| "entropy": 1.1127658933401108, | |
| "epoch": 1.2852512155591573, | |
| "grad_norm": 0.10727502405643463, | |
| "learning_rate": 3.332849486855144e-05, | |
| "loss": 1.1174246072769165, | |
| "mean_token_accuracy": 0.6732314750552177, | |
| "num_tokens": 12865899.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.0990982204675674, | |
| "epoch": 1.2982171799027553, | |
| "grad_norm": 0.10772087424993515, | |
| "learning_rate": 3.2994098114281134e-05, | |
| "loss": 1.1063733100891113, | |
| "mean_token_accuracy": 0.6763543859124184, | |
| "num_tokens": 12996509.0, | |
| "step": 101 | |
| }, | |
| { | |
| "entropy": 1.1201854348182678, | |
| "epoch": 1.3111831442463533, | |
| "grad_norm": 0.11184152215719223, | |
| "learning_rate": 3.265810049016959e-05, | |
| "loss": 1.1337658166885376, | |
| "mean_token_accuracy": 0.6663447916507721, | |
| "num_tokens": 13126367.0, | |
| "step": 102 | |
| }, | |
| { | |
| "entropy": 1.1044498831033707, | |
| "epoch": 1.3241491085899515, | |
| "grad_norm": 0.10385634750127792, | |
| "learning_rate": 3.232056928191376e-05, | |
| "loss": 1.1014032363891602, | |
| "mean_token_accuracy": 0.6749187037348747, | |
| "num_tokens": 13256160.0, | |
| "step": 103 | |
| }, | |
| { | |
| "entropy": 1.1139792203903198, | |
| "epoch": 1.3371150729335495, | |
| "grad_norm": 0.10617262125015259, | |
| "learning_rate": 3.1981572082320756e-05, | |
| "loss": 1.114381194114685, | |
| "mean_token_accuracy": 0.6730919182300568, | |
| "num_tokens": 13386686.0, | |
| "step": 104 | |
| }, | |
| { | |
| "entropy": 1.109263002872467, | |
| "epoch": 1.3500810372771475, | |
| "grad_norm": 0.10793962329626083, | |
| "learning_rate": 3.164117677777191e-05, | |
| "loss": 1.1114559173583984, | |
| "mean_token_accuracy": 0.6728995367884636, | |
| "num_tokens": 13517375.0, | |
| "step": 105 | |
| }, | |
| { | |
| "entropy": 1.1261898875236511, | |
| "epoch": 1.3630470016207457, | |
| "grad_norm": 0.11161792278289795, | |
| "learning_rate": 3.1299451534628135e-05, | |
| "loss": 1.1193037033081055, | |
| "mean_token_accuracy": 0.6697596535086632, | |
| "num_tokens": 13646394.0, | |
| "step": 106 | |
| }, | |
| { | |
| "entropy": 1.1466472148895264, | |
| "epoch": 1.3760129659643436, | |
| "grad_norm": 0.10738440603017807, | |
| "learning_rate": 3.0956464785579124e-05, | |
| "loss": 1.1412131786346436, | |
| "mean_token_accuracy": 0.6665833070874214, | |
| "num_tokens": 13773038.0, | |
| "step": 107 | |
| }, | |
| { | |
| "entropy": 1.1069310754537582, | |
| "epoch": 1.3889789303079416, | |
| "grad_norm": 0.10599587112665176, | |
| "learning_rate": 3.061228521593931e-05, | |
| "loss": 1.0983221530914307, | |
| "mean_token_accuracy": 0.674115814268589, | |
| "num_tokens": 13903468.0, | |
| "step": 108 | |
| }, | |
| { | |
| "entropy": 1.1233480125665665, | |
| "epoch": 1.4019448946515398, | |
| "grad_norm": 0.10892873257398605, | |
| "learning_rate": 3.0266981749893157e-05, | |
| "loss": 1.126780390739441, | |
| "mean_token_accuracy": 0.6726226657629013, | |
| "num_tokens": 14033787.0, | |
| "step": 109 | |
| }, | |
| { | |
| "entropy": 1.096241980791092, | |
| "epoch": 1.4149108589951378, | |
| "grad_norm": 0.10745301842689514, | |
| "learning_rate": 2.9920623536692638e-05, | |
| "loss": 1.1037087440490723, | |
| "mean_token_accuracy": 0.6748801171779633, | |
| "num_tokens": 14163916.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.1101316660642624, | |
| "epoch": 1.4278768233387358, | |
| "grad_norm": 0.10952413827180862, | |
| "learning_rate": 2.9573279936809667e-05, | |
| "loss": 1.1070921421051025, | |
| "mean_token_accuracy": 0.6747486442327499, | |
| "num_tokens": 14294199.0, | |
| "step": 111 | |
| }, | |
| { | |
| "entropy": 1.0932272672653198, | |
| "epoch": 1.440842787682334, | |
| "grad_norm": 0.11039680987596512, | |
| "learning_rate": 2.9225020508046232e-05, | |
| "loss": 1.091570496559143, | |
| "mean_token_accuracy": 0.677759513258934, | |
| "num_tokens": 14424508.0, | |
| "step": 112 | |
| }, | |
| { | |
| "entropy": 1.1011270582675934, | |
| "epoch": 1.453808752025932, | |
| "grad_norm": 0.10966617614030838, | |
| "learning_rate": 2.8875914991604948e-05, | |
| "loss": 1.0965993404388428, | |
| "mean_token_accuracy": 0.6767654791474342, | |
| "num_tokens": 14555279.0, | |
| "step": 113 | |
| }, | |
| { | |
| "entropy": 1.121464490890503, | |
| "epoch": 1.46677471636953, | |
| "grad_norm": 0.1066274344921112, | |
| "learning_rate": 2.8526033298122985e-05, | |
| "loss": 1.1188894510269165, | |
| "mean_token_accuracy": 0.672943226993084, | |
| "num_tokens": 14685565.0, | |
| "step": 114 | |
| }, | |
| { | |
| "entropy": 1.1038088649511337, | |
| "epoch": 1.4797406807131281, | |
| "grad_norm": 0.10668732225894928, | |
| "learning_rate": 2.8175445493671972e-05, | |
| "loss": 1.1041887998580933, | |
| "mean_token_accuracy": 0.6750313937664032, | |
| "num_tokens": 14812759.0, | |
| "step": 115 | |
| }, | |
| { | |
| "entropy": 1.0958739817142487, | |
| "epoch": 1.4927066450567261, | |
| "grad_norm": 0.10686630755662918, | |
| "learning_rate": 2.782422178572682e-05, | |
| "loss": 1.0925776958465576, | |
| "mean_token_accuracy": 0.6785185039043427, | |
| "num_tokens": 14941000.0, | |
| "step": 116 | |
| }, | |
| { | |
| "entropy": 1.0849932879209518, | |
| "epoch": 1.505672609400324, | |
| "grad_norm": 0.11030446738004684, | |
| "learning_rate": 2.7472432509106248e-05, | |
| "loss": 1.089538812637329, | |
| "mean_token_accuracy": 0.6786462068557739, | |
| "num_tokens": 15070714.0, | |
| "step": 117 | |
| }, | |
| { | |
| "entropy": 1.0971782058477402, | |
| "epoch": 1.5186385737439223, | |
| "grad_norm": 0.10946783423423767, | |
| "learning_rate": 2.7120148111887732e-05, | |
| "loss": 1.1029260158538818, | |
| "mean_token_accuracy": 0.6733038946986198, | |
| "num_tokens": 15200961.0, | |
| "step": 118 | |
| }, | |
| { | |
| "entropy": 1.097448006272316, | |
| "epoch": 1.5316045380875203, | |
| "grad_norm": 0.11014755070209503, | |
| "learning_rate": 2.6767439141299865e-05, | |
| "loss": 1.108152151107788, | |
| "mean_token_accuracy": 0.6721945106983185, | |
| "num_tokens": 15331874.0, | |
| "step": 119 | |
| }, | |
| { | |
| "entropy": 1.0913252234458923, | |
| "epoch": 1.5445705024311183, | |
| "grad_norm": 0.11296916753053665, | |
| "learning_rate": 2.6414376229594813e-05, | |
| "loss": 1.0995609760284424, | |
| "mean_token_accuracy": 0.6765489876270294, | |
| "num_tokens": 15461994.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.085170827805996, | |
| "epoch": 1.5575364667747165, | |
| "grad_norm": 0.10830508917570114, | |
| "learning_rate": 2.606103007990371e-05, | |
| "loss": 1.0883557796478271, | |
| "mean_token_accuracy": 0.6772569045424461, | |
| "num_tokens": 15590673.0, | |
| "step": 121 | |
| }, | |
| { | |
| "entropy": 1.1014840751886368, | |
| "epoch": 1.5705024311183144, | |
| "grad_norm": 0.10925617814064026, | |
| "learning_rate": 2.570747145207796e-05, | |
| "loss": 1.1025630235671997, | |
| "mean_token_accuracy": 0.6747682243585587, | |
| "num_tokens": 15719889.0, | |
| "step": 122 | |
| }, | |
| { | |
| "entropy": 1.1068747788667679, | |
| "epoch": 1.5834683954619124, | |
| "grad_norm": 0.11549171060323715, | |
| "learning_rate": 2.5353771148519057e-05, | |
| "loss": 1.0953247547149658, | |
| "mean_token_accuracy": 0.6782373338937759, | |
| "num_tokens": 15849490.0, | |
| "step": 123 | |
| }, | |
| { | |
| "entropy": 1.108807235956192, | |
| "epoch": 1.5964343598055106, | |
| "grad_norm": 0.11398264020681381, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.1013944149017334, | |
| "mean_token_accuracy": 0.6768676191568375, | |
| "num_tokens": 15976291.0, | |
| "step": 124 | |
| }, | |
| { | |
| "entropy": 1.1027465015649796, | |
| "epoch": 1.6094003241491086, | |
| "grad_norm": 0.10796625912189484, | |
| "learning_rate": 2.4646228851480956e-05, | |
| "loss": 1.104917049407959, | |
| "mean_token_accuracy": 0.6731575652956963, | |
| "num_tokens": 16106724.0, | |
| "step": 125 | |
| }, | |
| { | |
| "entropy": 1.1067415177822113, | |
| "epoch": 1.6223662884927066, | |
| "grad_norm": 0.1104840338230133, | |
| "learning_rate": 2.429252854792205e-05, | |
| "loss": 1.1054627895355225, | |
| "mean_token_accuracy": 0.6742062270641327, | |
| "num_tokens": 16234720.0, | |
| "step": 126 | |
| }, | |
| { | |
| "entropy": 1.0894858539104462, | |
| "epoch": 1.6353322528363048, | |
| "grad_norm": 0.10652334243059158, | |
| "learning_rate": 2.39389699200963e-05, | |
| "loss": 1.086952805519104, | |
| "mean_token_accuracy": 0.6782950535416603, | |
| "num_tokens": 16365259.0, | |
| "step": 127 | |
| }, | |
| { | |
| "entropy": 1.0954291075468063, | |
| "epoch": 1.6482982171799028, | |
| "grad_norm": 0.10658770799636841, | |
| "learning_rate": 2.358562377040519e-05, | |
| "loss": 1.0909897089004517, | |
| "mean_token_accuracy": 0.6780865713953972, | |
| "num_tokens": 16495495.0, | |
| "step": 128 | |
| }, | |
| { | |
| "entropy": 1.1093836724758148, | |
| "epoch": 1.6612641815235007, | |
| "grad_norm": 0.10828336328268051, | |
| "learning_rate": 2.3232560858700137e-05, | |
| "loss": 1.1097731590270996, | |
| "mean_token_accuracy": 0.6727545708417892, | |
| "num_tokens": 16626073.0, | |
| "step": 129 | |
| }, | |
| { | |
| "entropy": 1.0927350223064423, | |
| "epoch": 1.674230145867099, | |
| "grad_norm": 0.10621214658021927, | |
| "learning_rate": 2.287985188811228e-05, | |
| "loss": 1.0940251350402832, | |
| "mean_token_accuracy": 0.6761066913604736, | |
| "num_tokens": 16756555.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.086726352572441, | |
| "epoch": 1.687196110210697, | |
| "grad_norm": 0.11290633678436279, | |
| "learning_rate": 2.2527567490893758e-05, | |
| "loss": 1.077509880065918, | |
| "mean_token_accuracy": 0.6806528195738792, | |
| "num_tokens": 16885995.0, | |
| "step": 131 | |
| }, | |
| { | |
| "entropy": 1.1018610298633575, | |
| "epoch": 1.700162074554295, | |
| "grad_norm": 0.10830546915531158, | |
| "learning_rate": 2.2175778214273185e-05, | |
| "loss": 1.0975083112716675, | |
| "mean_token_accuracy": 0.673214353621006, | |
| "num_tokens": 17016748.0, | |
| "step": 132 | |
| }, | |
| { | |
| "entropy": 1.0952757894992828, | |
| "epoch": 1.7131280388978931, | |
| "grad_norm": 0.10807640105485916, | |
| "learning_rate": 2.182455450632803e-05, | |
| "loss": 1.0957316160202026, | |
| "mean_token_accuracy": 0.6757252290844917, | |
| "num_tokens": 17146683.0, | |
| "step": 133 | |
| }, | |
| { | |
| "entropy": 1.0976209491491318, | |
| "epoch": 1.726094003241491, | |
| "grad_norm": 0.10800565779209137, | |
| "learning_rate": 2.1473966701877025e-05, | |
| "loss": 1.096419334411621, | |
| "mean_token_accuracy": 0.6746199205517769, | |
| "num_tokens": 17274973.0, | |
| "step": 134 | |
| }, | |
| { | |
| "entropy": 1.0751748234033585, | |
| "epoch": 1.739059967585089, | |
| "grad_norm": 0.10800585150718689, | |
| "learning_rate": 2.1124085008395054e-05, | |
| "loss": 1.0767910480499268, | |
| "mean_token_accuracy": 0.6789162456989288, | |
| "num_tokens": 17405875.0, | |
| "step": 135 | |
| }, | |
| { | |
| "entropy": 1.0925790071487427, | |
| "epoch": 1.7520259319286873, | |
| "grad_norm": 0.11018182337284088, | |
| "learning_rate": 2.0774979491953777e-05, | |
| "loss": 1.0945611000061035, | |
| "mean_token_accuracy": 0.6763977259397507, | |
| "num_tokens": 17536552.0, | |
| "step": 136 | |
| }, | |
| { | |
| "entropy": 1.0801940858364105, | |
| "epoch": 1.7649918962722853, | |
| "grad_norm": 0.11004664748907089, | |
| "learning_rate": 2.0426720063190335e-05, | |
| "loss": 1.0840024948120117, | |
| "mean_token_accuracy": 0.6795907840132713, | |
| "num_tokens": 17667084.0, | |
| "step": 137 | |
| }, | |
| { | |
| "entropy": 1.101774275302887, | |
| "epoch": 1.7779578606158832, | |
| "grad_norm": 0.11290085315704346, | |
| "learning_rate": 2.0079376463307368e-05, | |
| "loss": 1.1003146171569824, | |
| "mean_token_accuracy": 0.6725303083658218, | |
| "num_tokens": 17797154.0, | |
| "step": 138 | |
| }, | |
| { | |
| "entropy": 1.0876109898090363, | |
| "epoch": 1.7909238249594814, | |
| "grad_norm": 0.10923700779676437, | |
| "learning_rate": 1.973301825010685e-05, | |
| "loss": 1.0939981937408447, | |
| "mean_token_accuracy": 0.6761084944009781, | |
| "num_tokens": 17927623.0, | |
| "step": 139 | |
| }, | |
| { | |
| "entropy": 1.0950998067855835, | |
| "epoch": 1.8038897893030794, | |
| "grad_norm": 0.10761875659227371, | |
| "learning_rate": 1.9387714784060685e-05, | |
| "loss": 1.0969429016113281, | |
| "mean_token_accuracy": 0.6767537295818329, | |
| "num_tokens": 18057219.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.0717721432447433, | |
| "epoch": 1.8168557536466774, | |
| "grad_norm": 0.10666397213935852, | |
| "learning_rate": 1.904353521442088e-05, | |
| "loss": 1.0674877166748047, | |
| "mean_token_accuracy": 0.6818057596683502, | |
| "num_tokens": 18187740.0, | |
| "step": 141 | |
| }, | |
| { | |
| "entropy": 1.0777895599603653, | |
| "epoch": 1.8298217179902756, | |
| "grad_norm": 0.10904243588447571, | |
| "learning_rate": 1.8700548465371874e-05, | |
| "loss": 1.0738530158996582, | |
| "mean_token_accuracy": 0.6809927076101303, | |
| "num_tokens": 18317756.0, | |
| "step": 142 | |
| }, | |
| { | |
| "entropy": 1.101785123348236, | |
| "epoch": 1.8427876823338736, | |
| "grad_norm": 0.10715875774621964, | |
| "learning_rate": 1.8358823222228097e-05, | |
| "loss": 1.0919270515441895, | |
| "mean_token_accuracy": 0.678776703774929, | |
| "num_tokens": 18447271.0, | |
| "step": 143 | |
| }, | |
| { | |
| "entropy": 1.0927452445030212, | |
| "epoch": 1.8557536466774716, | |
| "grad_norm": 0.10798949003219604, | |
| "learning_rate": 1.801842791767925e-05, | |
| "loss": 1.0860735177993774, | |
| "mean_token_accuracy": 0.6769154742360115, | |
| "num_tokens": 18575231.0, | |
| "step": 144 | |
| }, | |
| { | |
| "entropy": 1.0916397273540497, | |
| "epoch": 1.8687196110210698, | |
| "grad_norm": 0.10715705901384354, | |
| "learning_rate": 1.7679430718086243e-05, | |
| "loss": 1.0911304950714111, | |
| "mean_token_accuracy": 0.6768953427672386, | |
| "num_tokens": 18706048.0, | |
| "step": 145 | |
| }, | |
| { | |
| "entropy": 1.0951158255338669, | |
| "epoch": 1.8816855753646677, | |
| "grad_norm": 0.1076439917087555, | |
| "learning_rate": 1.7341899509830416e-05, | |
| "loss": 1.0997498035430908, | |
| "mean_token_accuracy": 0.6743926852941513, | |
| "num_tokens": 18835570.0, | |
| "step": 146 | |
| }, | |
| { | |
| "entropy": 1.0841081887483597, | |
| "epoch": 1.8946515397082657, | |
| "grad_norm": 0.10601551085710526, | |
| "learning_rate": 1.700590188571887e-05, | |
| "loss": 1.0836725234985352, | |
| "mean_token_accuracy": 0.6787150353193283, | |
| "num_tokens": 18965989.0, | |
| "step": 147 | |
| }, | |
| { | |
| "entropy": 1.0767425745725632, | |
| "epoch": 1.907617504051864, | |
| "grad_norm": 0.10804559290409088, | |
| "learning_rate": 1.667150513144856e-05, | |
| "loss": 1.0883257389068604, | |
| "mean_token_accuracy": 0.6779815703630447, | |
| "num_tokens": 19096708.0, | |
| "step": 148 | |
| }, | |
| { | |
| "entropy": 1.060413271188736, | |
| "epoch": 1.920583468395462, | |
| "grad_norm": 0.10727375745773315, | |
| "learning_rate": 1.633877621213192e-05, | |
| "loss": 1.0628106594085693, | |
| "mean_token_accuracy": 0.6838557049632072, | |
| "num_tokens": 19227293.0, | |
| "step": 149 | |
| }, | |
| { | |
| "entropy": 1.0897396057844162, | |
| "epoch": 1.9335494327390599, | |
| "grad_norm": 0.10783149302005768, | |
| "learning_rate": 1.6007781758886607e-05, | |
| "loss": 1.094234824180603, | |
| "mean_token_accuracy": 0.6787025779485703, | |
| "num_tokens": 19357895.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.0884075164794922, | |
| "epoch": 1.946515397082658, | |
| "grad_norm": 0.10528931021690369, | |
| "learning_rate": 1.567858805549229e-05, | |
| "loss": 1.0923658609390259, | |
| "mean_token_accuracy": 0.6776427254080772, | |
| "num_tokens": 19488633.0, | |
| "step": 151 | |
| }, | |
| { | |
| "entropy": 1.0847600251436234, | |
| "epoch": 1.959481361426256, | |
| "grad_norm": 0.10627288371324539, | |
| "learning_rate": 1.535126102511678e-05, | |
| "loss": 1.0859086513519287, | |
| "mean_token_accuracy": 0.6780032217502594, | |
| "num_tokens": 19619364.0, | |
| "step": 152 | |
| }, | |
| { | |
| "entropy": 1.0796795934438705, | |
| "epoch": 1.972447325769854, | |
| "grad_norm": 0.10828571766614914, | |
| "learning_rate": 1.5025866217114592e-05, | |
| "loss": 1.0796010494232178, | |
| "mean_token_accuracy": 0.6792254149913788, | |
| "num_tokens": 19749912.0, | |
| "step": 153 | |
| }, | |
| { | |
| "entropy": 1.0738196671009064, | |
| "epoch": 1.9854132901134522, | |
| "grad_norm": 0.1061541959643364, | |
| "learning_rate": 1.4702468793900188e-05, | |
| "loss": 1.0770832300186157, | |
| "mean_token_accuracy": 0.68254254758358, | |
| "num_tokens": 19879298.0, | |
| "step": 154 | |
| }, | |
| { | |
| "entropy": 1.0984497964382172, | |
| "epoch": 1.9983792544570502, | |
| "grad_norm": 0.11212106049060822, | |
| "learning_rate": 1.4381133517898804e-05, | |
| "loss": 1.0974631309509277, | |
| "mean_token_accuracy": 0.6762187778949738, | |
| "num_tokens": 20010115.0, | |
| "step": 155 | |
| }, | |
| { | |
| "entropy": 1.0801098346710205, | |
| "epoch": 2.0, | |
| "grad_norm": 0.2994791865348816, | |
| "learning_rate": 1.4061924738577403e-05, | |
| "loss": 1.0866824388504028, | |
| "mean_token_accuracy": 0.6810408234596252, | |
| "num_tokens": 20018306.0, | |
| "step": 156 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 234, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 9.773824948630979e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |