Instructions to use randomath/aide-smart-dictation with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use randomath/aide-smart-dictation with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-0.5B-Instruct") model = PeftModel.from_pretrained(base_model, "randomath/aide-smart-dictation") - Transformers
How to use randomath/aide-smart-dictation with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="randomath/aide-smart-dictation") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("randomath/aide-smart-dictation", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use randomath/aide-smart-dictation with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "randomath/aide-smart-dictation" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "randomath/aide-smart-dictation", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/randomath/aide-smart-dictation
- SGLang
How to use randomath/aide-smart-dictation with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "randomath/aide-smart-dictation" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "randomath/aide-smart-dictation", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "randomath/aide-smart-dictation" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "randomath/aide-smart-dictation", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use randomath/aide-smart-dictation with Docker Model Runner:
docker model run hf.co/randomath/aide-smart-dictation
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.9013539651837523, | |
| "eval_steps": 500, | |
| "global_step": 4500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.8446818041801453, | |
| "epoch": 0.032237266279819474, | |
| "grad_norm": 0.2941240072250366, | |
| "learning_rate": 0.00019789383193638514, | |
| "loss": 0.8516548919677734, | |
| "mean_token_accuracy": 0.8109714418649674, | |
| "num_tokens": 340552.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.5307252839207649, | |
| "epoch": 0.06447453255963895, | |
| "grad_norm": 0.38026192784309387, | |
| "learning_rate": 0.00019574468085106384, | |
| "loss": 0.5257245635986328, | |
| "mean_token_accuracy": 0.8670955944061279, | |
| "num_tokens": 674854.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.5256640672683716, | |
| "epoch": 0.09671179883945841, | |
| "grad_norm": 0.2988957464694977, | |
| "learning_rate": 0.00019359552976574252, | |
| "loss": 0.5231669235229492, | |
| "mean_token_accuracy": 0.8671206516027451, | |
| "num_tokens": 1012372.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.5012166395783424, | |
| "epoch": 0.1289490651192779, | |
| "grad_norm": 0.3097330629825592, | |
| "learning_rate": 0.00019144637868042123, | |
| "loss": 0.4980791473388672, | |
| "mean_token_accuracy": 0.8712651997804641, | |
| "num_tokens": 1350844.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.5085235154628753, | |
| "epoch": 0.16118633139909735, | |
| "grad_norm": 0.2942444682121277, | |
| "learning_rate": 0.00018929722759509994, | |
| "loss": 0.5036932754516602, | |
| "mean_token_accuracy": 0.8704744702577591, | |
| "num_tokens": 1685361.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.5039347299933433, | |
| "epoch": 0.19342359767891681, | |
| "grad_norm": 0.24725373089313507, | |
| "learning_rate": 0.00018714807650977865, | |
| "loss": 0.5022884368896484, | |
| "mean_token_accuracy": 0.8695387196540832, | |
| "num_tokens": 2023958.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.4997942888736725, | |
| "epoch": 0.2256608639587363, | |
| "grad_norm": 0.2513591945171356, | |
| "learning_rate": 0.00018499892542445735, | |
| "loss": 0.4963418579101562, | |
| "mean_token_accuracy": 0.8721420967578888, | |
| "num_tokens": 2359735.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.48731821626424787, | |
| "epoch": 0.2578981302385558, | |
| "grad_norm": 0.25179457664489746, | |
| "learning_rate": 0.00018284977433913606, | |
| "loss": 0.4849808502197266, | |
| "mean_token_accuracy": 0.8741975021362305, | |
| "num_tokens": 2693668.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.5134793591499328, | |
| "epoch": 0.2901353965183752, | |
| "grad_norm": 0.2822740077972412, | |
| "learning_rate": 0.00018070062325381477, | |
| "loss": 0.5107257461547852, | |
| "mean_token_accuracy": 0.8679203641414642, | |
| "num_tokens": 3037692.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.4719977578520775, | |
| "epoch": 0.3223726627981947, | |
| "grad_norm": 0.26850372552871704, | |
| "learning_rate": 0.00017855147216849345, | |
| "loss": 0.46767356872558596, | |
| "mean_token_accuracy": 0.8772921580076217, | |
| "num_tokens": 3367260.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.4927705615758896, | |
| "epoch": 0.3546099290780142, | |
| "grad_norm": 0.3286154568195343, | |
| "learning_rate": 0.00017640232108317216, | |
| "loss": 0.48913902282714844, | |
| "mean_token_accuracy": 0.8731313848495483, | |
| "num_tokens": 3705085.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.49470906257629393, | |
| "epoch": 0.38684719535783363, | |
| "grad_norm": 0.274051696062088, | |
| "learning_rate": 0.00017425316999785087, | |
| "loss": 0.49117244720458986, | |
| "mean_token_accuracy": 0.8720099472999573, | |
| "num_tokens": 4047830.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.5057245761156082, | |
| "epoch": 0.4190844616376531, | |
| "grad_norm": 0.3144587278366089, | |
| "learning_rate": 0.00017210401891252957, | |
| "loss": 0.5029543304443359, | |
| "mean_token_accuracy": 0.8694538015127182, | |
| "num_tokens": 4393280.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.4992050299048424, | |
| "epoch": 0.4513217279174726, | |
| "grad_norm": 0.2692390978336334, | |
| "learning_rate": 0.00016995486782720825, | |
| "loss": 0.4958369445800781, | |
| "mean_token_accuracy": 0.8719016635417938, | |
| "num_tokens": 4734367.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.4910887134075165, | |
| "epoch": 0.4835589941972921, | |
| "grad_norm": 0.23271654546260834, | |
| "learning_rate": 0.00016780571674188696, | |
| "loss": 0.48952770233154297, | |
| "mean_token_accuracy": 0.8705353289842606, | |
| "num_tokens": 5077089.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.4752439457178116, | |
| "epoch": 0.5157962604771116, | |
| "grad_norm": 0.22721055150032043, | |
| "learning_rate": 0.00016565656565656567, | |
| "loss": 0.47227016448974607, | |
| "mean_token_accuracy": 0.8776289612054825, | |
| "num_tokens": 5417702.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.47260456770658493, | |
| "epoch": 0.5480335267569311, | |
| "grad_norm": 0.24809850752353668, | |
| "learning_rate": 0.00016350741457124438, | |
| "loss": 0.4697586441040039, | |
| "mean_token_accuracy": 0.8765520536899567, | |
| "num_tokens": 5757041.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.46995863765478135, | |
| "epoch": 0.5802707930367504, | |
| "grad_norm": 0.2558928430080414, | |
| "learning_rate": 0.00016135826348592306, | |
| "loss": 0.4632004928588867, | |
| "mean_token_accuracy": 0.8774441802501678, | |
| "num_tokens": 6090774.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.4779966202378273, | |
| "epoch": 0.6125080593165699, | |
| "grad_norm": 0.25883734226226807, | |
| "learning_rate": 0.00015920911240060177, | |
| "loss": 0.4720086669921875, | |
| "mean_token_accuracy": 0.875939337015152, | |
| "num_tokens": 6429650.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.4781654465198517, | |
| "epoch": 0.6447453255963894, | |
| "grad_norm": 0.2638959288597107, | |
| "learning_rate": 0.00015705996131528047, | |
| "loss": 0.47270626068115235, | |
| "mean_token_accuracy": 0.8754388135671616, | |
| "num_tokens": 6768597.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.47966611981391905, | |
| "epoch": 0.6769825918762089, | |
| "grad_norm": 0.26262563467025757, | |
| "learning_rate": 0.00015491081022995918, | |
| "loss": 0.4755671310424805, | |
| "mean_token_accuracy": 0.8750456595420837, | |
| "num_tokens": 7105759.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.4859159654378891, | |
| "epoch": 0.7092198581560284, | |
| "grad_norm": 0.24884097278118134, | |
| "learning_rate": 0.00015276165914463786, | |
| "loss": 0.48099254608154296, | |
| "mean_token_accuracy": 0.8744349056482315, | |
| "num_tokens": 7445804.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.47413830548524855, | |
| "epoch": 0.7414571244358479, | |
| "grad_norm": 0.2644164264202118, | |
| "learning_rate": 0.00015061250805931657, | |
| "loss": 0.4699359893798828, | |
| "mean_token_accuracy": 0.8759887504577637, | |
| "num_tokens": 7785856.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.47249517500400545, | |
| "epoch": 0.7736943907156673, | |
| "grad_norm": 0.2909834384918213, | |
| "learning_rate": 0.00014846335697399528, | |
| "loss": 0.46724155426025393, | |
| "mean_token_accuracy": 0.8777646362781525, | |
| "num_tokens": 8121494.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.4700292366743088, | |
| "epoch": 0.8059316569954867, | |
| "grad_norm": 0.24739807844161987, | |
| "learning_rate": 0.00014631420588867398, | |
| "loss": 0.46308193206787107, | |
| "mean_token_accuracy": 0.8784116441011429, | |
| "num_tokens": 8456396.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.4757600948214531, | |
| "epoch": 0.8381689232753062, | |
| "grad_norm": 0.2676313817501068, | |
| "learning_rate": 0.00014416505480335266, | |
| "loss": 0.4695530700683594, | |
| "mean_token_accuracy": 0.8768039846420288, | |
| "num_tokens": 8797056.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.4766714322566986, | |
| "epoch": 0.8704061895551257, | |
| "grad_norm": 0.2617861330509186, | |
| "learning_rate": 0.00014201590371803137, | |
| "loss": 0.47455707550048826, | |
| "mean_token_accuracy": 0.8762617337703705, | |
| "num_tokens": 9134060.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.4656816709041596, | |
| "epoch": 0.9026434558349452, | |
| "grad_norm": 0.2809736132621765, | |
| "learning_rate": 0.0001398667526327101, | |
| "loss": 0.4575202941894531, | |
| "mean_token_accuracy": 0.8793036764860154, | |
| "num_tokens": 9466192.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.47205123156309126, | |
| "epoch": 0.9348807221147647, | |
| "grad_norm": 0.27606886625289917, | |
| "learning_rate": 0.0001377176015473888, | |
| "loss": 0.465732307434082, | |
| "mean_token_accuracy": 0.8769072258472442, | |
| "num_tokens": 9806711.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.47290341585874557, | |
| "epoch": 0.9671179883945842, | |
| "grad_norm": 0.2559572160243988, | |
| "learning_rate": 0.0001355684504620675, | |
| "loss": 0.46756675720214846, | |
| "mean_token_accuracy": 0.8773910355567932, | |
| "num_tokens": 10142536.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 0.4555113708972931, | |
| "epoch": 0.9993552546744036, | |
| "grad_norm": 0.24697217345237732, | |
| "learning_rate": 0.0001334192993767462, | |
| "loss": 0.4486907958984375, | |
| "mean_token_accuracy": 0.8813155192136765, | |
| "num_tokens": 10474177.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 0.46760996848344805, | |
| "epoch": 1.0315925209542232, | |
| "grad_norm": 0.2382114678621292, | |
| "learning_rate": 0.0001312701482914249, | |
| "loss": 0.459778938293457, | |
| "mean_token_accuracy": 0.8778466558456421, | |
| "num_tokens": 10814205.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 0.477926442027092, | |
| "epoch": 1.0638297872340425, | |
| "grad_norm": 0.2497527152299881, | |
| "learning_rate": 0.0001291209972061036, | |
| "loss": 0.4692169189453125, | |
| "mean_token_accuracy": 0.8761335426568985, | |
| "num_tokens": 11158647.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 0.4668825376033783, | |
| "epoch": 1.096067053513862, | |
| "grad_norm": 0.3097824156284332, | |
| "learning_rate": 0.0001269718461207823, | |
| "loss": 0.4580715560913086, | |
| "mean_token_accuracy": 0.8783014410734177, | |
| "num_tokens": 11503048.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 0.4613112932443619, | |
| "epoch": 1.1283043197936815, | |
| "grad_norm": 0.28493526577949524, | |
| "learning_rate": 0.000124822695035461, | |
| "loss": 0.4552203369140625, | |
| "mean_token_accuracy": 0.8796335273981094, | |
| "num_tokens": 11842333.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 0.45046652257442477, | |
| "epoch": 1.1605415860735009, | |
| "grad_norm": 0.28386086225509644, | |
| "learning_rate": 0.00012267354395013971, | |
| "loss": 0.44170757293701174, | |
| "mean_token_accuracy": 0.8831979554891586, | |
| "num_tokens": 12178505.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 0.452339848279953, | |
| "epoch": 1.1927788523533205, | |
| "grad_norm": 0.3006383776664734, | |
| "learning_rate": 0.00012052439286481841, | |
| "loss": 0.44465755462646483, | |
| "mean_token_accuracy": 0.88213940680027, | |
| "num_tokens": 12516910.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 0.4495898771286011, | |
| "epoch": 1.2250161186331399, | |
| "grad_norm": 0.257289856672287, | |
| "learning_rate": 0.0001183752417794971, | |
| "loss": 0.4418718719482422, | |
| "mean_token_accuracy": 0.8825601398944855, | |
| "num_tokens": 12855332.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 0.46036251038312914, | |
| "epoch": 1.2572533849129595, | |
| "grad_norm": 0.2901777923107147, | |
| "learning_rate": 0.00011622609069417581, | |
| "loss": 0.45159675598144533, | |
| "mean_token_accuracy": 0.8801065158843994, | |
| "num_tokens": 13194738.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 0.4662597167491913, | |
| "epoch": 1.2894906511927788, | |
| "grad_norm": 0.3183293044567108, | |
| "learning_rate": 0.0001140769396088545, | |
| "loss": 0.458433837890625, | |
| "mean_token_accuracy": 0.8789826226234436, | |
| "num_tokens": 13534537.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 0.470826989710331, | |
| "epoch": 1.3217279174725984, | |
| "grad_norm": 0.26847565174102783, | |
| "learning_rate": 0.00011192778852353321, | |
| "loss": 0.461640510559082, | |
| "mean_token_accuracy": 0.8773523569107056, | |
| "num_tokens": 13876529.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 0.4441897264122963, | |
| "epoch": 1.3539651837524178, | |
| "grad_norm": 0.24220123887062073, | |
| "learning_rate": 0.0001097786374382119, | |
| "loss": 0.4363685989379883, | |
| "mean_token_accuracy": 0.8843007552623748, | |
| "num_tokens": 14208999.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 0.46262448877096174, | |
| "epoch": 1.3862024500322372, | |
| "grad_norm": 0.29929131269454956, | |
| "learning_rate": 0.0001076294863528906, | |
| "loss": 0.4530683135986328, | |
| "mean_token_accuracy": 0.8798254084587097, | |
| "num_tokens": 14547532.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 0.45200063675642016, | |
| "epoch": 1.4184397163120568, | |
| "grad_norm": 0.28762561082839966, | |
| "learning_rate": 0.00010548033526756931, | |
| "loss": 0.44509330749511716, | |
| "mean_token_accuracy": 0.8822088545560837, | |
| "num_tokens": 14885562.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 0.46206449300050734, | |
| "epoch": 1.4506769825918762, | |
| "grad_norm": 0.29035645723342896, | |
| "learning_rate": 0.000103331184182248, | |
| "loss": 0.45523059844970704, | |
| "mean_token_accuracy": 0.879514684677124, | |
| "num_tokens": 15224693.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 0.4511671251058578, | |
| "epoch": 1.4829142488716958, | |
| "grad_norm": 0.3083575963973999, | |
| "learning_rate": 0.00010118203309692671, | |
| "loss": 0.4417449569702148, | |
| "mean_token_accuracy": 0.8826043558120727, | |
| "num_tokens": 15564153.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 0.4486639258265495, | |
| "epoch": 1.5151515151515151, | |
| "grad_norm": 0.2648044228553772, | |
| "learning_rate": 9.903288201160542e-05, | |
| "loss": 0.44109046936035157, | |
| "mean_token_accuracy": 0.8820929783582687, | |
| "num_tokens": 15897751.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 0.44873525500297545, | |
| "epoch": 1.5473887814313345, | |
| "grad_norm": 0.31508272886276245, | |
| "learning_rate": 9.688373092628413e-05, | |
| "loss": 0.4406051254272461, | |
| "mean_token_accuracy": 0.8828574746847153, | |
| "num_tokens": 16235250.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 0.45740653783082963, | |
| "epoch": 1.5796260477111541, | |
| "grad_norm": 0.31200388073921204, | |
| "learning_rate": 9.473457984096282e-05, | |
| "loss": 0.4479224395751953, | |
| "mean_token_accuracy": 0.881089192032814, | |
| "num_tokens": 16572988.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 0.44977363795042036, | |
| "epoch": 1.6118633139909737, | |
| "grad_norm": 0.30033040046691895, | |
| "learning_rate": 9.258542875564153e-05, | |
| "loss": 0.4417670059204102, | |
| "mean_token_accuracy": 0.8823639768362045, | |
| "num_tokens": 16910477.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 0.45035569489002225, | |
| "epoch": 1.644100580270793, | |
| "grad_norm": 0.2903454005718231, | |
| "learning_rate": 9.043627767032022e-05, | |
| "loss": 0.44128196716308593, | |
| "mean_token_accuracy": 0.8826896560192108, | |
| "num_tokens": 17250232.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 0.4546844300627708, | |
| "epoch": 1.6763378465506125, | |
| "grad_norm": 0.31954842805862427, | |
| "learning_rate": 8.828712658499893e-05, | |
| "loss": 0.44637454986572267, | |
| "mean_token_accuracy": 0.8815962445735931, | |
| "num_tokens": 17588504.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 0.4702127456665039, | |
| "epoch": 1.7085751128304318, | |
| "grad_norm": 0.2877423167228699, | |
| "learning_rate": 8.613797549967764e-05, | |
| "loss": 0.46254016876220705, | |
| "mean_token_accuracy": 0.8771249955892563, | |
| "num_tokens": 17933060.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 0.4469280856847763, | |
| "epoch": 1.7408123791102514, | |
| "grad_norm": 0.2817021906375885, | |
| "learning_rate": 8.398882441435633e-05, | |
| "loss": 0.43881519317626955, | |
| "mean_token_accuracy": 0.8837608104944229, | |
| "num_tokens": 18266535.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 0.455581805408001, | |
| "epoch": 1.773049645390071, | |
| "grad_norm": 0.31535229086875916, | |
| "learning_rate": 8.183967332903504e-05, | |
| "loss": 0.44726665496826173, | |
| "mean_token_accuracy": 0.8812869715690613, | |
| "num_tokens": 18603326.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 0.43902623891830445, | |
| "epoch": 1.8052869116698904, | |
| "grad_norm": 0.2788417339324951, | |
| "learning_rate": 7.969052224371373e-05, | |
| "loss": 0.42899021148681643, | |
| "mean_token_accuracy": 0.8851540559530258, | |
| "num_tokens": 18939700.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 0.45259665727615356, | |
| "epoch": 1.8375241779497098, | |
| "grad_norm": 0.27750885486602783, | |
| "learning_rate": 7.754137115839244e-05, | |
| "loss": 0.4436537551879883, | |
| "mean_token_accuracy": 0.8825727927684784, | |
| "num_tokens": 19275565.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 0.43768042981624605, | |
| "epoch": 1.8697614442295294, | |
| "grad_norm": 0.30853450298309326, | |
| "learning_rate": 7.539222007307113e-05, | |
| "loss": 0.4311842346191406, | |
| "mean_token_accuracy": 0.8850624537467957, | |
| "num_tokens": 19607809.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 0.44810337752103807, | |
| "epoch": 1.9019987105093488, | |
| "grad_norm": 0.32159748673439026, | |
| "learning_rate": 7.324306898774984e-05, | |
| "loss": 0.4413007736206055, | |
| "mean_token_accuracy": 0.8821072828769684, | |
| "num_tokens": 19941679.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 0.4376507529616356, | |
| "epoch": 1.9342359767891684, | |
| "grad_norm": 0.28715935349464417, | |
| "learning_rate": 7.109391790242854e-05, | |
| "loss": 0.4271116256713867, | |
| "mean_token_accuracy": 0.8850878685712814, | |
| "num_tokens": 20276932.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 0.44526120245456696, | |
| "epoch": 1.9664732430689877, | |
| "grad_norm": 0.2948083281517029, | |
| "learning_rate": 6.894476681710724e-05, | |
| "loss": 0.43935283660888674, | |
| "mean_token_accuracy": 0.8832118940353394, | |
| "num_tokens": 20613740.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 0.44097375571727754, | |
| "epoch": 1.9987105093488071, | |
| "grad_norm": 0.28070375323295593, | |
| "learning_rate": 6.679561573178594e-05, | |
| "loss": 0.43161014556884764, | |
| "mean_token_accuracy": 0.8843864989280701, | |
| "num_tokens": 20948040.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 0.4366187188029289, | |
| "epoch": 2.0309477756286265, | |
| "grad_norm": 0.2711784243583679, | |
| "learning_rate": 6.464646464646466e-05, | |
| "loss": 0.4246902084350586, | |
| "mean_token_accuracy": 0.8861147791147232, | |
| "num_tokens": 21284152.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 0.4292546170949936, | |
| "epoch": 2.0631850419084463, | |
| "grad_norm": 0.3474438488483429, | |
| "learning_rate": 6.249731356114335e-05, | |
| "loss": 0.41976234436035154, | |
| "mean_token_accuracy": 0.8869011825323105, | |
| "num_tokens": 21623591.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 0.4441410732269287, | |
| "epoch": 2.0954223081882657, | |
| "grad_norm": 0.27009403705596924, | |
| "learning_rate": 6.0348162475822054e-05, | |
| "loss": 0.4335956192016602, | |
| "mean_token_accuracy": 0.8844973957538604, | |
| "num_tokens": 21961239.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 0.4423326799273491, | |
| "epoch": 2.127659574468085, | |
| "grad_norm": 0.31351885199546814, | |
| "learning_rate": 5.8199011390500755e-05, | |
| "loss": 0.43222076416015626, | |
| "mean_token_accuracy": 0.8844653475284576, | |
| "num_tokens": 22297355.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 0.43579984217882156, | |
| "epoch": 2.1598968407479044, | |
| "grad_norm": 0.3104802072048187, | |
| "learning_rate": 5.6049860305179456e-05, | |
| "loss": 0.42580715179443357, | |
| "mean_token_accuracy": 0.8859012949466706, | |
| "num_tokens": 22636061.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 0.4307232940196991, | |
| "epoch": 2.192134107027724, | |
| "grad_norm": 0.30051860213279724, | |
| "learning_rate": 5.390070921985816e-05, | |
| "loss": 0.41833953857421874, | |
| "mean_token_accuracy": 0.886508920788765, | |
| "num_tokens": 22975583.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 0.43692171543836594, | |
| "epoch": 2.2243713733075436, | |
| "grad_norm": 0.3109855353832245, | |
| "learning_rate": 5.175155813453686e-05, | |
| "loss": 0.4261277389526367, | |
| "mean_token_accuracy": 0.8851550126075745, | |
| "num_tokens": 23316198.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 0.42780830681324006, | |
| "epoch": 2.256608639587363, | |
| "grad_norm": 0.3165053725242615, | |
| "learning_rate": 4.960240704921556e-05, | |
| "loss": 0.41836185455322267, | |
| "mean_token_accuracy": 0.8882633966207504, | |
| "num_tokens": 23654932.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 0.4399165993928909, | |
| "epoch": 2.2888459058671824, | |
| "grad_norm": 0.31702736020088196, | |
| "learning_rate": 4.745325596389427e-05, | |
| "loss": 0.42992683410644533, | |
| "mean_token_accuracy": 0.884578087925911, | |
| "num_tokens": 23994334.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 0.44941207855939863, | |
| "epoch": 2.3210831721470018, | |
| "grad_norm": 0.382436066865921, | |
| "learning_rate": 4.530410487857297e-05, | |
| "loss": 0.43822154998779295, | |
| "mean_token_accuracy": 0.8836333215236664, | |
| "num_tokens": 24334916.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 0.43192073941230774, | |
| "epoch": 2.3533204384268216, | |
| "grad_norm": 0.34604012966156006, | |
| "learning_rate": 4.315495379325167e-05, | |
| "loss": 0.42123512268066404, | |
| "mean_token_accuracy": 0.8872571766376496, | |
| "num_tokens": 24671467.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 0.44117815017700196, | |
| "epoch": 2.385557704706641, | |
| "grad_norm": 0.31164106726646423, | |
| "learning_rate": 4.100580270793037e-05, | |
| "loss": 0.4305222702026367, | |
| "mean_token_accuracy": 0.8850024062395095, | |
| "num_tokens": 25007960.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 0.42460927098989487, | |
| "epoch": 2.4177949709864603, | |
| "grad_norm": 0.31209173798561096, | |
| "learning_rate": 3.885665162260907e-05, | |
| "loss": 0.41318531036376954, | |
| "mean_token_accuracy": 0.8890041667222977, | |
| "num_tokens": 25338303.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 0.4464882066845894, | |
| "epoch": 2.4500322372662797, | |
| "grad_norm": 0.330119252204895, | |
| "learning_rate": 3.670750053728778e-05, | |
| "loss": 0.4390181350708008, | |
| "mean_token_accuracy": 0.8836234956979752, | |
| "num_tokens": 25682388.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 0.4420609429478645, | |
| "epoch": 2.482269503546099, | |
| "grad_norm": 0.3061470687389374, | |
| "learning_rate": 3.455834945196648e-05, | |
| "loss": 0.4278445053100586, | |
| "mean_token_accuracy": 0.8854056459665298, | |
| "num_tokens": 26024136.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 0.4190295284986496, | |
| "epoch": 2.514506769825919, | |
| "grad_norm": 0.32077500224113464, | |
| "learning_rate": 3.240919836664518e-05, | |
| "loss": 0.41114852905273436, | |
| "mean_token_accuracy": 0.8895813000202178, | |
| "num_tokens": 26363036.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 0.4384055981040001, | |
| "epoch": 2.5467440361057383, | |
| "grad_norm": 0.3177681863307953, | |
| "learning_rate": 3.0260047281323877e-05, | |
| "loss": 0.4273562240600586, | |
| "mean_token_accuracy": 0.8855825281143188, | |
| "num_tokens": 26701951.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 0.43118291586637497, | |
| "epoch": 2.5789813023855577, | |
| "grad_norm": 0.29330846667289734, | |
| "learning_rate": 2.8110896196002578e-05, | |
| "loss": 0.41927295684814453, | |
| "mean_token_accuracy": 0.8882288312911988, | |
| "num_tokens": 27039067.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 0.43496464341878893, | |
| "epoch": 2.611218568665377, | |
| "grad_norm": 0.31839463114738464, | |
| "learning_rate": 2.5961745110681286e-05, | |
| "loss": 0.4239920425415039, | |
| "mean_token_accuracy": 0.886286124587059, | |
| "num_tokens": 27373718.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 0.43482948303222657, | |
| "epoch": 2.643455834945197, | |
| "grad_norm": 0.30345892906188965, | |
| "learning_rate": 2.3812594025359983e-05, | |
| "loss": 0.42235206604003905, | |
| "mean_token_accuracy": 0.8865206915140152, | |
| "num_tokens": 27708238.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 0.4274810257554054, | |
| "epoch": 2.6756931012250162, | |
| "grad_norm": 0.3029744029045105, | |
| "learning_rate": 2.1663442940038688e-05, | |
| "loss": 0.41650020599365234, | |
| "mean_token_accuracy": 0.8881079655885696, | |
| "num_tokens": 28041964.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 0.43494893968105314, | |
| "epoch": 2.7079303675048356, | |
| "grad_norm": 0.31539738178253174, | |
| "learning_rate": 1.951429185471739e-05, | |
| "loss": 0.4245531463623047, | |
| "mean_token_accuracy": 0.8865839475393296, | |
| "num_tokens": 28378719.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 0.4375846874713898, | |
| "epoch": 2.740167633784655, | |
| "grad_norm": 0.31120166182518005, | |
| "learning_rate": 1.736514076939609e-05, | |
| "loss": 0.427888069152832, | |
| "mean_token_accuracy": 0.8849086022377014, | |
| "num_tokens": 28718819.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 0.4191849535703659, | |
| "epoch": 2.7724049000644744, | |
| "grad_norm": 0.3305680751800537, | |
| "learning_rate": 1.521598968407479e-05, | |
| "loss": 0.4062779998779297, | |
| "mean_token_accuracy": 0.8907963120937348, | |
| "num_tokens": 29053437.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 0.44296603530645373, | |
| "epoch": 2.804642166344294, | |
| "grad_norm": 0.34950941801071167, | |
| "learning_rate": 1.3066838598753491e-05, | |
| "loss": 0.4340578842163086, | |
| "mean_token_accuracy": 0.8846180647611618, | |
| "num_tokens": 29389949.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 0.44456703811883924, | |
| "epoch": 2.8368794326241136, | |
| "grad_norm": 0.3210543096065521, | |
| "learning_rate": 1.0917687513432196e-05, | |
| "loss": 0.43384292602539065, | |
| "mean_token_accuracy": 0.8840754866600037, | |
| "num_tokens": 29728935.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 0.43473256975412367, | |
| "epoch": 2.869116698903933, | |
| "grad_norm": 0.3032950162887573, | |
| "learning_rate": 8.768536428110897e-06, | |
| "loss": 0.4252130126953125, | |
| "mean_token_accuracy": 0.8865963506698609, | |
| "num_tokens": 30065697.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 0.43983528643846515, | |
| "epoch": 2.9013539651837523, | |
| "grad_norm": 0.37149280309677124, | |
| "learning_rate": 6.619385342789598e-06, | |
| "loss": 0.4294190979003906, | |
| "mean_token_accuracy": 0.8858663266897202, | |
| "num_tokens": 30401977.0, | |
| "step": 4500 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 4653, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.224183762523392e+17, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |