Instructions to use Taywon/A2minus_v4_e1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Taywon/A2minus_v4_e1 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-70B-Instruct") model = PeftModel.from_pretrained(base_model, "Taywon/A2minus_v4_e1") - Transformers
How to use Taywon/A2minus_v4_e1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Taywon/A2minus_v4_e1") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Taywon/A2minus_v4_e1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Taywon/A2minus_v4_e1 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Taywon/A2minus_v4_e1" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A2minus_v4_e1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Taywon/A2minus_v4_e1
- SGLang
How to use Taywon/A2minus_v4_e1 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Taywon/A2minus_v4_e1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A2minus_v4_e1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Taywon/A2minus_v4_e1" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Taywon/A2minus_v4_e1", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Taywon/A2minus_v4_e1 with Docker Model Runner:
docker model run hf.co/Taywon/A2minus_v4_e1
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 78, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.2969624996185303, | |
| "epoch": 0.012861736334405145, | |
| "grad_norm": 1.222815990447998, | |
| "learning_rate": 0.0, | |
| "loss": 2.025021553039551, | |
| "mean_token_accuracy": 0.5397194549441338, | |
| "num_tokens": 128512.0, | |
| "step": 1 | |
| }, | |
| { | |
| "entropy": 1.3495921194553375, | |
| "epoch": 0.02572347266881029, | |
| "grad_norm": 1.2900104522705078, | |
| "learning_rate": 4.166666666666667e-06, | |
| "loss": 2.113243341445923, | |
| "mean_token_accuracy": 0.5239669531583786, | |
| "num_tokens": 258439.0, | |
| "step": 2 | |
| }, | |
| { | |
| "entropy": 1.4065107256174088, | |
| "epoch": 0.03858520900321544, | |
| "grad_norm": 1.1876918077468872, | |
| "learning_rate": 8.333333333333334e-06, | |
| "loss": 2.0984230041503906, | |
| "mean_token_accuracy": 0.525254875421524, | |
| "num_tokens": 387958.0, | |
| "step": 3 | |
| }, | |
| { | |
| "entropy": 1.4473730325698853, | |
| "epoch": 0.05144694533762058, | |
| "grad_norm": 0.995452880859375, | |
| "learning_rate": 1.25e-05, | |
| "loss": 2.0187673568725586, | |
| "mean_token_accuracy": 0.534252941608429, | |
| "num_tokens": 516779.0, | |
| "step": 4 | |
| }, | |
| { | |
| "entropy": 1.626717284321785, | |
| "epoch": 0.06430868167202572, | |
| "grad_norm": 0.6222253441810608, | |
| "learning_rate": 1.6666666666666667e-05, | |
| "loss": 1.9110387563705444, | |
| "mean_token_accuracy": 0.5435223057866096, | |
| "num_tokens": 645829.0, | |
| "step": 5 | |
| }, | |
| { | |
| "entropy": 1.810067042708397, | |
| "epoch": 0.07717041800643087, | |
| "grad_norm": 0.42118003964424133, | |
| "learning_rate": 2.0833333333333336e-05, | |
| "loss": 1.8789349794387817, | |
| "mean_token_accuracy": 0.5466088876128197, | |
| "num_tokens": 774435.0, | |
| "step": 6 | |
| }, | |
| { | |
| "entropy": 1.9707088768482208, | |
| "epoch": 0.09003215434083602, | |
| "grad_norm": 0.4645366072654724, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.8074758052825928, | |
| "mean_token_accuracy": 0.5567064955830574, | |
| "num_tokens": 903545.0, | |
| "step": 7 | |
| }, | |
| { | |
| "entropy": 1.9890314191579819, | |
| "epoch": 0.10289389067524116, | |
| "grad_norm": 0.5461070537567139, | |
| "learning_rate": 2.916666666666667e-05, | |
| "loss": 1.7440648078918457, | |
| "mean_token_accuracy": 0.5663307011127472, | |
| "num_tokens": 1033070.0, | |
| "step": 8 | |
| }, | |
| { | |
| "entropy": 1.968129649758339, | |
| "epoch": 0.1157556270096463, | |
| "grad_norm": 0.5405251383781433, | |
| "learning_rate": 3.3333333333333335e-05, | |
| "loss": 1.7069363594055176, | |
| "mean_token_accuracy": 0.5683588162064552, | |
| "num_tokens": 1162755.0, | |
| "step": 9 | |
| }, | |
| { | |
| "entropy": 1.8345413953065872, | |
| "epoch": 0.12861736334405144, | |
| "grad_norm": 0.42177239060401917, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 1.65086030960083, | |
| "mean_token_accuracy": 0.5773059874773026, | |
| "num_tokens": 1290164.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.6431169360876083, | |
| "epoch": 0.1414790996784566, | |
| "grad_norm": 0.31144559383392334, | |
| "learning_rate": 4.166666666666667e-05, | |
| "loss": 1.582027792930603, | |
| "mean_token_accuracy": 0.5872198939323425, | |
| "num_tokens": 1419501.0, | |
| "step": 11 | |
| }, | |
| { | |
| "entropy": 1.544620230793953, | |
| "epoch": 0.15434083601286175, | |
| "grad_norm": 0.27825888991355896, | |
| "learning_rate": 4.5833333333333334e-05, | |
| "loss": 1.5446865558624268, | |
| "mean_token_accuracy": 0.594700962305069, | |
| "num_tokens": 1547996.0, | |
| "step": 12 | |
| }, | |
| { | |
| "entropy": 1.4267793744802475, | |
| "epoch": 0.16720257234726688, | |
| "grad_norm": 0.2835897207260132, | |
| "learning_rate": 5e-05, | |
| "loss": 1.509974479675293, | |
| "mean_token_accuracy": 0.6006790399551392, | |
| "num_tokens": 1676937.0, | |
| "step": 13 | |
| }, | |
| { | |
| "entropy": 1.3972271531820297, | |
| "epoch": 0.18006430868167203, | |
| "grad_norm": 0.25854921340942383, | |
| "learning_rate": 4.9997496794168726e-05, | |
| "loss": 1.491778016090393, | |
| "mean_token_accuracy": 0.6045994758605957, | |
| "num_tokens": 1806013.0, | |
| "step": 14 | |
| }, | |
| { | |
| "entropy": 1.4395506381988525, | |
| "epoch": 0.19292604501607716, | |
| "grad_norm": 0.22095996141433716, | |
| "learning_rate": 4.998998767795805e-05, | |
| "loss": 1.4883487224578857, | |
| "mean_token_accuracy": 0.6050755307078362, | |
| "num_tokens": 1935387.0, | |
| "step": 15 | |
| }, | |
| { | |
| "entropy": 1.4550755470991135, | |
| "epoch": 0.2057877813504823, | |
| "grad_norm": 0.24221676588058472, | |
| "learning_rate": 4.9977474155117045e-05, | |
| "loss": 1.4858245849609375, | |
| "mean_token_accuracy": 0.6017315089702606, | |
| "num_tokens": 2065100.0, | |
| "step": 16 | |
| }, | |
| { | |
| "entropy": 1.4459427893161774, | |
| "epoch": 0.21864951768488747, | |
| "grad_norm": 0.25146999955177307, | |
| "learning_rate": 4.995995873155958e-05, | |
| "loss": 1.4274994134902954, | |
| "mean_token_accuracy": 0.6151479333639145, | |
| "num_tokens": 2194685.0, | |
| "step": 17 | |
| }, | |
| { | |
| "entropy": 1.4442210048437119, | |
| "epoch": 0.2315112540192926, | |
| "grad_norm": 0.2271786779165268, | |
| "learning_rate": 4.99374449148625e-05, | |
| "loss": 1.4092518091201782, | |
| "mean_token_accuracy": 0.6148851290345192, | |
| "num_tokens": 2324963.0, | |
| "step": 18 | |
| }, | |
| { | |
| "entropy": 1.4254360347986221, | |
| "epoch": 0.24437299035369775, | |
| "grad_norm": 0.18994390964508057, | |
| "learning_rate": 4.9909937213563165e-05, | |
| "loss": 1.3825007677078247, | |
| "mean_token_accuracy": 0.6199355497956276, | |
| "num_tokens": 2454343.0, | |
| "step": 19 | |
| }, | |
| { | |
| "entropy": 1.3843167871236801, | |
| "epoch": 0.2572347266881029, | |
| "grad_norm": 0.18420229852199554, | |
| "learning_rate": 4.987744113625665e-05, | |
| "loss": 1.3471739292144775, | |
| "mean_token_accuracy": 0.6283371672034264, | |
| "num_tokens": 2584405.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.3585271686315536, | |
| "epoch": 0.27009646302250806, | |
| "grad_norm": 0.18983817100524902, | |
| "learning_rate": 4.9839963190492576e-05, | |
| "loss": 1.3283567428588867, | |
| "mean_token_accuracy": 0.6319968476891518, | |
| "num_tokens": 2709555.0, | |
| "step": 21 | |
| }, | |
| { | |
| "entropy": 1.3483584225177765, | |
| "epoch": 0.2829581993569132, | |
| "grad_norm": 0.18332050740718842, | |
| "learning_rate": 4.979751088147192e-05, | |
| "loss": 1.33201003074646, | |
| "mean_token_accuracy": 0.6298539489507675, | |
| "num_tokens": 2839191.0, | |
| "step": 22 | |
| }, | |
| { | |
| "entropy": 1.334426462650299, | |
| "epoch": 0.2958199356913183, | |
| "grad_norm": 0.16615396738052368, | |
| "learning_rate": 4.975009271054409e-05, | |
| "loss": 1.3058710098266602, | |
| "mean_token_accuracy": 0.6357970610260963, | |
| "num_tokens": 2968625.0, | |
| "step": 23 | |
| }, | |
| { | |
| "entropy": 1.3269707262516022, | |
| "epoch": 0.3086816720257235, | |
| "grad_norm": 0.16659598052501678, | |
| "learning_rate": 4.969771817350445e-05, | |
| "loss": 1.298633337020874, | |
| "mean_token_accuracy": 0.6390289217233658, | |
| "num_tokens": 3098193.0, | |
| "step": 24 | |
| }, | |
| { | |
| "entropy": 1.3264441937208176, | |
| "epoch": 0.3215434083601286, | |
| "grad_norm": 0.18099723756313324, | |
| "learning_rate": 4.9640397758692715e-05, | |
| "loss": 1.2919727563858032, | |
| "mean_token_accuracy": 0.6379936411976814, | |
| "num_tokens": 3226304.0, | |
| "step": 25 | |
| }, | |
| { | |
| "entropy": 1.2971351444721222, | |
| "epoch": 0.33440514469453375, | |
| "grad_norm": 0.16978149116039276, | |
| "learning_rate": 4.957814294489261e-05, | |
| "loss": 1.283421277999878, | |
| "mean_token_accuracy": 0.6396878883242607, | |
| "num_tokens": 3356150.0, | |
| "step": 26 | |
| }, | |
| { | |
| "entropy": 1.2420216798782349, | |
| "epoch": 0.34726688102893893, | |
| "grad_norm": 0.15654370188713074, | |
| "learning_rate": 4.9510966199033174e-05, | |
| "loss": 1.2411205768585205, | |
| "mean_token_accuracy": 0.6497687473893166, | |
| "num_tokens": 3485881.0, | |
| "step": 27 | |
| }, | |
| { | |
| "entropy": 1.2905446141958237, | |
| "epoch": 0.36012861736334406, | |
| "grad_norm": 0.15767726302146912, | |
| "learning_rate": 4.943888097369216e-05, | |
| "loss": 1.2969235181808472, | |
| "mean_token_accuracy": 0.6399867981672287, | |
| "num_tokens": 3614360.0, | |
| "step": 28 | |
| }, | |
| { | |
| "entropy": 1.2797959297895432, | |
| "epoch": 0.3729903536977492, | |
| "grad_norm": 0.1609920859336853, | |
| "learning_rate": 4.936190170440208e-05, | |
| "loss": 1.281036615371704, | |
| "mean_token_accuracy": 0.6414945125579834, | |
| "num_tokens": 3742757.0, | |
| "step": 29 | |
| }, | |
| { | |
| "entropy": 1.2370718121528625, | |
| "epoch": 0.3858520900321543, | |
| "grad_norm": 0.15289531648159027, | |
| "learning_rate": 4.928004380675941e-05, | |
| "loss": 1.2397706508636475, | |
| "mean_token_accuracy": 0.6485739275813103, | |
| "num_tokens": 3872361.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.2661651074886322, | |
| "epoch": 0.3987138263665595, | |
| "grad_norm": 0.15539875626564026, | |
| "learning_rate": 4.9193323673337476e-05, | |
| "loss": 1.2545585632324219, | |
| "mean_token_accuracy": 0.646148107945919, | |
| "num_tokens": 4001029.0, | |
| "step": 31 | |
| }, | |
| { | |
| "entropy": 1.259293794631958, | |
| "epoch": 0.4115755627009646, | |
| "grad_norm": 0.15602311491966248, | |
| "learning_rate": 4.910175867040377e-05, | |
| "loss": 1.2386581897735596, | |
| "mean_token_accuracy": 0.6532392650842667, | |
| "num_tokens": 4129746.0, | |
| "step": 32 | |
| }, | |
| { | |
| "entropy": 1.2246208488941193, | |
| "epoch": 0.42443729903536975, | |
| "grad_norm": 0.15040729939937592, | |
| "learning_rate": 4.9005367134442235e-05, | |
| "loss": 1.2012075185775757, | |
| "mean_token_accuracy": 0.6605038940906525, | |
| "num_tokens": 4258908.0, | |
| "step": 33 | |
| }, | |
| { | |
| "entropy": 1.2688497006893158, | |
| "epoch": 0.43729903536977494, | |
| "grad_norm": 0.14351816475391388, | |
| "learning_rate": 4.890416836848127e-05, | |
| "loss": 1.2468310594558716, | |
| "mean_token_accuracy": 0.6454005613923073, | |
| "num_tokens": 4388837.0, | |
| "step": 34 | |
| }, | |
| { | |
| "entropy": 1.2282109707593918, | |
| "epoch": 0.45016077170418006, | |
| "grad_norm": 0.14232277870178223, | |
| "learning_rate": 4.8798182638228166e-05, | |
| "loss": 1.2170629501342773, | |
| "mean_token_accuracy": 0.6531817615032196, | |
| "num_tokens": 4518130.0, | |
| "step": 35 | |
| }, | |
| { | |
| "entropy": 1.2145698070526123, | |
| "epoch": 0.4630225080385852, | |
| "grad_norm": 0.14945274591445923, | |
| "learning_rate": 4.868743116801074e-05, | |
| "loss": 1.2234522104263306, | |
| "mean_token_accuracy": 0.6538028195500374, | |
| "num_tokens": 4647727.0, | |
| "step": 36 | |
| }, | |
| { | |
| "entropy": 1.2184867858886719, | |
| "epoch": 0.4758842443729904, | |
| "grad_norm": 0.14716529846191406, | |
| "learning_rate": 4.857193613652711e-05, | |
| "loss": 1.2205889225006104, | |
| "mean_token_accuracy": 0.6552813798189163, | |
| "num_tokens": 4776814.0, | |
| "step": 37 | |
| }, | |
| { | |
| "entropy": 1.2501244097948074, | |
| "epoch": 0.4887459807073955, | |
| "grad_norm": 0.13584738969802856, | |
| "learning_rate": 4.845172067240415e-05, | |
| "loss": 1.232811689376831, | |
| "mean_token_accuracy": 0.6496494188904762, | |
| "num_tokens": 4906642.0, | |
| "step": 38 | |
| }, | |
| { | |
| "entropy": 1.2297646403312683, | |
| "epoch": 0.5016077170418006, | |
| "grad_norm": 0.1445397287607193, | |
| "learning_rate": 4.8326808849565936e-05, | |
| "loss": 1.2179179191589355, | |
| "mean_token_accuracy": 0.6524648442864418, | |
| "num_tokens": 5035784.0, | |
| "step": 39 | |
| }, | |
| { | |
| "entropy": 1.2054394781589508, | |
| "epoch": 0.5144694533762058, | |
| "grad_norm": 0.1438300460577011, | |
| "learning_rate": 4.819722568241274e-05, | |
| "loss": 1.1902542114257812, | |
| "mean_token_accuracy": 0.6586381196975708, | |
| "num_tokens": 5163483.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.1801835894584656, | |
| "epoch": 0.5273311897106109, | |
| "grad_norm": 0.13536524772644043, | |
| "learning_rate": 4.806299712081172e-05, | |
| "loss": 1.1734623908996582, | |
| "mean_token_accuracy": 0.6613527312874794, | |
| "num_tokens": 5289099.0, | |
| "step": 41 | |
| }, | |
| { | |
| "entropy": 1.2093226611614227, | |
| "epoch": 0.5401929260450161, | |
| "grad_norm": 0.13810646533966064, | |
| "learning_rate": 4.792415004490034e-05, | |
| "loss": 1.2002174854278564, | |
| "mean_token_accuracy": 0.6581337600946426, | |
| "num_tokens": 5414735.0, | |
| "step": 42 | |
| }, | |
| { | |
| "entropy": 1.1848722696304321, | |
| "epoch": 0.5530546623794212, | |
| "grad_norm": 0.1468912959098816, | |
| "learning_rate": 4.77807122597034e-05, | |
| "loss": 1.1885192394256592, | |
| "mean_token_accuracy": 0.6589618176221848, | |
| "num_tokens": 5543143.0, | |
| "step": 43 | |
| }, | |
| { | |
| "entropy": 1.181750476360321, | |
| "epoch": 0.5659163987138264, | |
| "grad_norm": 0.1429019272327423, | |
| "learning_rate": 4.7632712489564926e-05, | |
| "loss": 1.1800310611724854, | |
| "mean_token_accuracy": 0.6618404239416122, | |
| "num_tokens": 5671758.0, | |
| "step": 44 | |
| }, | |
| { | |
| "entropy": 1.223798543214798, | |
| "epoch": 0.5787781350482315, | |
| "grad_norm": 0.13423405587673187, | |
| "learning_rate": 4.748018037239592e-05, | |
| "loss": 1.2137880325317383, | |
| "mean_token_accuracy": 0.6538020968437195, | |
| "num_tokens": 5801203.0, | |
| "step": 45 | |
| }, | |
| { | |
| "entropy": 1.1596673130989075, | |
| "epoch": 0.5916398713826366, | |
| "grad_norm": 0.14085975289344788, | |
| "learning_rate": 4.732314645373921e-05, | |
| "loss": 1.1383979320526123, | |
| "mean_token_accuracy": 0.6676715686917305, | |
| "num_tokens": 5929286.0, | |
| "step": 46 | |
| }, | |
| { | |
| "entropy": 1.1791094541549683, | |
| "epoch": 0.6045016077170418, | |
| "grad_norm": 0.14022590219974518, | |
| "learning_rate": 4.7161642180652464e-05, | |
| "loss": 1.1624398231506348, | |
| "mean_token_accuracy": 0.6638200730085373, | |
| "num_tokens": 6055494.0, | |
| "step": 47 | |
| }, | |
| { | |
| "entropy": 1.17191481590271, | |
| "epoch": 0.617363344051447, | |
| "grad_norm": 0.14044098556041718, | |
| "learning_rate": 4.699569989541074e-05, | |
| "loss": 1.1661159992218018, | |
| "mean_token_accuracy": 0.6632223278284073, | |
| "num_tokens": 6184519.0, | |
| "step": 48 | |
| }, | |
| { | |
| "entropy": 1.1261081546545029, | |
| "epoch": 0.6302250803858521, | |
| "grad_norm": 0.13071966171264648, | |
| "learning_rate": 4.6825352829029705e-05, | |
| "loss": 1.1280871629714966, | |
| "mean_token_accuracy": 0.672090008854866, | |
| "num_tokens": 6313996.0, | |
| "step": 49 | |
| }, | |
| { | |
| "entropy": 1.108861967921257, | |
| "epoch": 0.6430868167202572, | |
| "grad_norm": 0.13524308800697327, | |
| "learning_rate": 4.665063509461097e-05, | |
| "loss": 1.1100517511367798, | |
| "mean_token_accuracy": 0.6758645325899124, | |
| "num_tokens": 6442914.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.1622951924800873, | |
| "epoch": 0.6559485530546624, | |
| "grad_norm": 0.14350417256355286, | |
| "learning_rate": 4.647158168051066e-05, | |
| "loss": 1.1698243618011475, | |
| "mean_token_accuracy": 0.661836288869381, | |
| "num_tokens": 6569312.0, | |
| "step": 51 | |
| }, | |
| { | |
| "entropy": 1.1530523151159286, | |
| "epoch": 0.6688102893890675, | |
| "grad_norm": 0.13998498022556305, | |
| "learning_rate": 4.628822844333278e-05, | |
| "loss": 1.135171890258789, | |
| "mean_token_accuracy": 0.6697984710335732, | |
| "num_tokens": 6698149.0, | |
| "step": 52 | |
| }, | |
| { | |
| "entropy": 1.1557507067918777, | |
| "epoch": 0.6816720257234726, | |
| "grad_norm": 0.13826699554920197, | |
| "learning_rate": 4.6100612100748765e-05, | |
| "loss": 1.1333105564117432, | |
| "mean_token_accuracy": 0.6696186140179634, | |
| "num_tokens": 6827547.0, | |
| "step": 53 | |
| }, | |
| { | |
| "entropy": 1.1415271162986755, | |
| "epoch": 0.6945337620578779, | |
| "grad_norm": 0.14170631766319275, | |
| "learning_rate": 4.59087702241444e-05, | |
| "loss": 1.1154472827911377, | |
| "mean_token_accuracy": 0.6728732585906982, | |
| "num_tokens": 6956641.0, | |
| "step": 54 | |
| }, | |
| { | |
| "entropy": 1.133439689874649, | |
| "epoch": 0.707395498392283, | |
| "grad_norm": 0.19915136694908142, | |
| "learning_rate": 4.571274123109606e-05, | |
| "loss": 1.12148916721344, | |
| "mean_token_accuracy": 0.6721195057034492, | |
| "num_tokens": 7087072.0, | |
| "step": 55 | |
| }, | |
| { | |
| "entropy": 1.1475654691457748, | |
| "epoch": 0.7202572347266881, | |
| "grad_norm": 0.1380179524421692, | |
| "learning_rate": 4.551256437767719e-05, | |
| "loss": 1.147176742553711, | |
| "mean_token_accuracy": 0.6669263690710068, | |
| "num_tokens": 7217233.0, | |
| "step": 56 | |
| }, | |
| { | |
| "entropy": 1.1235886365175247, | |
| "epoch": 0.7331189710610932, | |
| "grad_norm": 0.14977428317070007, | |
| "learning_rate": 4.530827975059715e-05, | |
| "loss": 1.1248936653137207, | |
| "mean_token_accuracy": 0.6717223599553108, | |
| "num_tokens": 7345601.0, | |
| "step": 57 | |
| }, | |
| { | |
| "entropy": 1.0966329723596573, | |
| "epoch": 0.7459807073954984, | |
| "grad_norm": 0.13217344880104065, | |
| "learning_rate": 4.5099928259173516e-05, | |
| "loss": 1.0947030782699585, | |
| "mean_token_accuracy": 0.6786246225237846, | |
| "num_tokens": 7473430.0, | |
| "step": 58 | |
| }, | |
| { | |
| "entropy": 1.1365204900503159, | |
| "epoch": 0.7588424437299035, | |
| "grad_norm": 0.12866446375846863, | |
| "learning_rate": 4.488755162713975e-05, | |
| "loss": 1.126430869102478, | |
| "mean_token_accuracy": 0.6728999614715576, | |
| "num_tokens": 7602826.0, | |
| "step": 59 | |
| }, | |
| { | |
| "entropy": 1.1535387188196182, | |
| "epoch": 0.7717041800643086, | |
| "grad_norm": 0.1415134221315384, | |
| "learning_rate": 4.467119238428975e-05, | |
| "loss": 1.1418571472167969, | |
| "mean_token_accuracy": 0.6701028272509575, | |
| "num_tokens": 7732028.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.1234214305877686, | |
| "epoch": 0.7845659163987139, | |
| "grad_norm": 0.14994795620441437, | |
| "learning_rate": 4.445089385796099e-05, | |
| "loss": 1.1106842756271362, | |
| "mean_token_accuracy": 0.6764309927821159, | |
| "num_tokens": 7860385.0, | |
| "step": 61 | |
| }, | |
| { | |
| "entropy": 1.0901593267917633, | |
| "epoch": 0.797427652733119, | |
| "grad_norm": 0.13637474179267883, | |
| "learning_rate": 4.422670016435792e-05, | |
| "loss": 1.0811570882797241, | |
| "mean_token_accuracy": 0.6831180602312088, | |
| "num_tokens": 7989531.0, | |
| "step": 62 | |
| }, | |
| { | |
| "entropy": 1.1060381978750229, | |
| "epoch": 0.8102893890675241, | |
| "grad_norm": 0.1306847780942917, | |
| "learning_rate": 4.3998656199717435e-05, | |
| "loss": 1.1069831848144531, | |
| "mean_token_accuracy": 0.6745292320847511, | |
| "num_tokens": 8118824.0, | |
| "step": 63 | |
| }, | |
| { | |
| "entropy": 1.1469190865755081, | |
| "epoch": 0.8231511254019293, | |
| "grad_norm": 0.14836829900741577, | |
| "learning_rate": 4.3766807631318106e-05, | |
| "loss": 1.1478967666625977, | |
| "mean_token_accuracy": 0.6674168556928635, | |
| "num_tokens": 8248122.0, | |
| "step": 64 | |
| }, | |
| { | |
| "entropy": 1.1051507145166397, | |
| "epoch": 0.8360128617363344, | |
| "grad_norm": 0.1413162350654602, | |
| "learning_rate": 4.353120088833501e-05, | |
| "loss": 1.0933685302734375, | |
| "mean_token_accuracy": 0.6783376038074493, | |
| "num_tokens": 8376429.0, | |
| "step": 65 | |
| }, | |
| { | |
| "entropy": 1.1381653249263763, | |
| "epoch": 0.8488745980707395, | |
| "grad_norm": 0.13279159367084503, | |
| "learning_rate": 4.329188315254196e-05, | |
| "loss": 1.1261053085327148, | |
| "mean_token_accuracy": 0.6716507449746132, | |
| "num_tokens": 8504687.0, | |
| "step": 66 | |
| }, | |
| { | |
| "entropy": 1.1401405185461044, | |
| "epoch": 0.8617363344051447, | |
| "grad_norm": 0.14999179542064667, | |
| "learning_rate": 4.3048902348863116e-05, | |
| "loss": 1.122992992401123, | |
| "mean_token_accuracy": 0.6721775308251381, | |
| "num_tokens": 8635119.0, | |
| "step": 67 | |
| }, | |
| { | |
| "entropy": 1.1104646772146225, | |
| "epoch": 0.8745980707395499, | |
| "grad_norm": 0.15244296193122864, | |
| "learning_rate": 4.280230713577564e-05, | |
| "loss": 1.0963469743728638, | |
| "mean_token_accuracy": 0.6784974113106728, | |
| "num_tokens": 8765133.0, | |
| "step": 68 | |
| }, | |
| { | |
| "entropy": 1.1325141787528992, | |
| "epoch": 0.887459807073955, | |
| "grad_norm": 0.13338243961334229, | |
| "learning_rate": 4.255214689556557e-05, | |
| "loss": 1.133899211883545, | |
| "mean_token_accuracy": 0.6714881733059883, | |
| "num_tokens": 8895437.0, | |
| "step": 69 | |
| }, | |
| { | |
| "entropy": 1.1021241694688797, | |
| "epoch": 0.9003215434083601, | |
| "grad_norm": 0.14672274887561798, | |
| "learning_rate": 4.229847172443866e-05, | |
| "loss": 1.1050517559051514, | |
| "mean_token_accuracy": 0.6782850474119186, | |
| "num_tokens": 9023472.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.0665733218193054, | |
| "epoch": 0.9131832797427653, | |
| "grad_norm": 0.1326168030500412, | |
| "learning_rate": 4.204133242248832e-05, | |
| "loss": 1.0614970922470093, | |
| "mean_token_accuracy": 0.6890874728560448, | |
| "num_tokens": 9152924.0, | |
| "step": 71 | |
| }, | |
| { | |
| "entropy": 1.0804976969957352, | |
| "epoch": 0.9260450160771704, | |
| "grad_norm": 0.14258776605129242, | |
| "learning_rate": 4.1780780483522575e-05, | |
| "loss": 1.071770191192627, | |
| "mean_token_accuracy": 0.6831802353262901, | |
| "num_tokens": 9282930.0, | |
| "step": 72 | |
| }, | |
| { | |
| "entropy": 1.0698173642158508, | |
| "epoch": 0.9389067524115756, | |
| "grad_norm": 0.13697165250778198, | |
| "learning_rate": 4.151686808475204e-05, | |
| "loss": 1.057246208190918, | |
| "mean_token_accuracy": 0.6859329044818878, | |
| "num_tokens": 9410776.0, | |
| "step": 73 | |
| }, | |
| { | |
| "entropy": 1.0982066690921783, | |
| "epoch": 0.9517684887459807, | |
| "grad_norm": 0.14332003891468048, | |
| "learning_rate": 4.1249648076341165e-05, | |
| "loss": 1.08486008644104, | |
| "mean_token_accuracy": 0.6810793280601501, | |
| "num_tokens": 9539314.0, | |
| "step": 74 | |
| }, | |
| { | |
| "entropy": 1.1045535802841187, | |
| "epoch": 0.9646302250803859, | |
| "grad_norm": 0.14386016130447388, | |
| "learning_rate": 4.0979173970824626e-05, | |
| "loss": 1.1035948991775513, | |
| "mean_token_accuracy": 0.6733438894152641, | |
| "num_tokens": 9668102.0, | |
| "step": 75 | |
| }, | |
| { | |
| "entropy": 1.0924865305423737, | |
| "epoch": 0.977491961414791, | |
| "grad_norm": 0.13745297491550446, | |
| "learning_rate": 4.070549993239106e-05, | |
| "loss": 1.090521216392517, | |
| "mean_token_accuracy": 0.6789770871400833, | |
| "num_tokens": 9797707.0, | |
| "step": 76 | |
| }, | |
| { | |
| "entropy": 1.0984582901000977, | |
| "epoch": 0.9903536977491961, | |
| "grad_norm": 0.14490951597690582, | |
| "learning_rate": 4.0428680766036384e-05, | |
| "loss": 1.1076843738555908, | |
| "mean_token_accuracy": 0.6759174689650536, | |
| "num_tokens": 9927684.0, | |
| "step": 77 | |
| }, | |
| { | |
| "entropy": 1.0977885921796162, | |
| "epoch": 1.0, | |
| "grad_norm": 0.15585829317569733, | |
| "learning_rate": 4.0148771906588706e-05, | |
| "loss": 1.0940134525299072, | |
| "mean_token_accuracy": 0.6789492865403494, | |
| "num_tokens": 9998574.0, | |
| "step": 78 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 234, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.0574306065829069e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |