Instructions to use matboz/tiger-mathqa-llama with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use matboz/tiger-mathqa-llama with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-8B-Instruct") model = PeftModel.from_pretrained(base_model, "matboz/tiger-mathqa-llama") - Transformers
How to use matboz/tiger-mathqa-llama with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="matboz/tiger-mathqa-llama") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("matboz/tiger-mathqa-llama", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use matboz/tiger-mathqa-llama with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "matboz/tiger-mathqa-llama" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "matboz/tiger-mathqa-llama", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/matboz/tiger-mathqa-llama
- SGLang
How to use matboz/tiger-mathqa-llama with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "matboz/tiger-mathqa-llama" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "matboz/tiger-mathqa-llama", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "matboz/tiger-mathqa-llama" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "matboz/tiger-mathqa-llama", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use matboz/tiger-mathqa-llama with Docker Model Runner:
docker model run hf.co/matboz/tiger-mathqa-llama
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 10.0, | |
| "eval_steps": 500, | |
| "global_step": 1570, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.3206602305173873, | |
| "epoch": 0.064, | |
| "grad_norm": 0.9292202591896057, | |
| "learning_rate": 3.7500000000000005e-06, | |
| "loss": 1.1131, | |
| "mean_token_accuracy": 0.7011688977479935, | |
| "num_tokens": 167271.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.3284908413887024, | |
| "epoch": 0.128, | |
| "grad_norm": 0.660650908946991, | |
| "learning_rate": 7.916666666666667e-06, | |
| "loss": 1.0843, | |
| "mean_token_accuracy": 0.7041632518172264, | |
| "num_tokens": 335534.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.3329698264598846, | |
| "epoch": 0.192, | |
| "grad_norm": 0.46980366110801697, | |
| "learning_rate": 1.2083333333333333e-05, | |
| "loss": 0.9948, | |
| "mean_token_accuracy": 0.7138608112931252, | |
| "num_tokens": 504764.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.3528490722179414, | |
| "epoch": 0.256, | |
| "grad_norm": 0.3592575192451477, | |
| "learning_rate": 1.6250000000000002e-05, | |
| "loss": 0.9485, | |
| "mean_token_accuracy": 0.721599918603897, | |
| "num_tokens": 674680.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.3213547974824906, | |
| "epoch": 0.32, | |
| "grad_norm": 0.31555160880088806, | |
| "learning_rate": 1.9999978697023387e-05, | |
| "loss": 0.9296, | |
| "mean_token_accuracy": 0.7227451264858246, | |
| "num_tokens": 839934.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.2997384041547775, | |
| "epoch": 0.384, | |
| "grad_norm": 0.2809937000274658, | |
| "learning_rate": 1.999742244965125e-05, | |
| "loss": 0.9414, | |
| "mean_token_accuracy": 0.7233463451266289, | |
| "num_tokens": 1005135.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.2680538922548295, | |
| "epoch": 0.448, | |
| "grad_norm": 0.28027236461639404, | |
| "learning_rate": 1.9990606854864625e-05, | |
| "loss": 0.8823, | |
| "mean_token_accuracy": 0.7340415641665459, | |
| "num_tokens": 1172366.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.2720171421766282, | |
| "epoch": 0.512, | |
| "grad_norm": 0.27143529057502747, | |
| "learning_rate": 1.997953481641056e-05, | |
| "loss": 0.882, | |
| "mean_token_accuracy": 0.7348188936710358, | |
| "num_tokens": 1340013.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.2880662232637405, | |
| "epoch": 0.576, | |
| "grad_norm": 0.2534484565258026, | |
| "learning_rate": 1.9964211051470778e-05, | |
| "loss": 0.8938, | |
| "mean_token_accuracy": 0.7337884500622749, | |
| "num_tokens": 1507478.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.2950494319200516, | |
| "epoch": 0.64, | |
| "grad_norm": 0.29349154233932495, | |
| "learning_rate": 1.994464208865191e-05, | |
| "loss": 0.9225, | |
| "mean_token_accuracy": 0.7275586023926734, | |
| "num_tokens": 1680653.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.2790019273757935, | |
| "epoch": 0.704, | |
| "grad_norm": 0.2847479581832886, | |
| "learning_rate": 1.9920836265204047e-05, | |
| "loss": 0.8916, | |
| "mean_token_accuracy": 0.7341030821204185, | |
| "num_tokens": 1851057.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.2715142965316772, | |
| "epoch": 0.768, | |
| "grad_norm": 0.27320924401283264, | |
| "learning_rate": 1.989280372346868e-05, | |
| "loss": 0.8824, | |
| "mean_token_accuracy": 0.7345656096935272, | |
| "num_tokens": 2018983.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.3021604150533677, | |
| "epoch": 0.832, | |
| "grad_norm": 0.31183984875679016, | |
| "learning_rate": 1.986055640655763e-05, | |
| "loss": 0.9231, | |
| "mean_token_accuracy": 0.7273582145571709, | |
| "num_tokens": 2188992.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.2842024236917495, | |
| "epoch": 0.896, | |
| "grad_norm": 0.3226590156555176, | |
| "learning_rate": 1.9824108053264726e-05, | |
| "loss": 0.8858, | |
| "mean_token_accuracy": 0.7334808766841888, | |
| "num_tokens": 2358611.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.2750529646873474, | |
| "epoch": 0.96, | |
| "grad_norm": 0.3014202415943146, | |
| "learning_rate": 1.9783474192212484e-05, | |
| "loss": 0.8843, | |
| "mean_token_accuracy": 0.7379685431718827, | |
| "num_tokens": 2527068.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.286011647533726, | |
| "epoch": 1.0192, | |
| "grad_norm": 0.31638771295547485, | |
| "learning_rate": 1.9738672135236218e-05, | |
| "loss": 0.9009, | |
| "mean_token_accuracy": 0.7322732838424476, | |
| "num_tokens": 2685134.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.2853516817092896, | |
| "epoch": 1.0832, | |
| "grad_norm": 0.29617786407470703, | |
| "learning_rate": 1.968972097000843e-05, | |
| "loss": 0.8978, | |
| "mean_token_accuracy": 0.7337976396083832, | |
| "num_tokens": 2852350.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.261508396267891, | |
| "epoch": 1.1472, | |
| "grad_norm": 0.34440022706985474, | |
| "learning_rate": 1.96366415519066e-05, | |
| "loss": 0.8612, | |
| "mean_token_accuracy": 0.7381596371531487, | |
| "num_tokens": 3021070.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.263030657172203, | |
| "epoch": 1.2112, | |
| "grad_norm": 0.3183440864086151, | |
| "learning_rate": 1.957945649512788e-05, | |
| "loss": 0.8775, | |
| "mean_token_accuracy": 0.7360784441232682, | |
| "num_tokens": 3188758.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.2699549317359924, | |
| "epoch": 1.2752, | |
| "grad_norm": 0.316829651594162, | |
| "learning_rate": 1.951819016305442e-05, | |
| "loss": 0.871, | |
| "mean_token_accuracy": 0.7383767917752266, | |
| "num_tokens": 3356098.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 1.284775710105896, | |
| "epoch": 1.3392, | |
| "grad_norm": 0.3272818922996521, | |
| "learning_rate": 1.9452868657873513e-05, | |
| "loss": 0.87, | |
| "mean_token_accuracy": 0.7359273687005043, | |
| "num_tokens": 3522909.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 1.2776107609272003, | |
| "epoch": 1.4032, | |
| "grad_norm": 0.34563735127449036, | |
| "learning_rate": 1.9383519809456862e-05, | |
| "loss": 0.8833, | |
| "mean_token_accuracy": 0.735480035841465, | |
| "num_tokens": 3686875.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 1.262231531739235, | |
| "epoch": 1.4672, | |
| "grad_norm": 0.33589527010917664, | |
| "learning_rate": 1.931017316350384e-05, | |
| "loss": 0.8653, | |
| "mean_token_accuracy": 0.736232727766037, | |
| "num_tokens": 3853087.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 1.2684703916311264, | |
| "epoch": 1.5312000000000001, | |
| "grad_norm": 0.3261985182762146, | |
| "learning_rate": 1.9232859968953702e-05, | |
| "loss": 0.88, | |
| "mean_token_accuracy": 0.7341130167245865, | |
| "num_tokens": 4021454.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 1.2511296778917314, | |
| "epoch": 1.5952, | |
| "grad_norm": 0.3339959681034088, | |
| "learning_rate": 1.9151613164672136e-05, | |
| "loss": 0.8526, | |
| "mean_token_accuracy": 0.7398458629846573, | |
| "num_tokens": 4192689.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 1.2628758728504181, | |
| "epoch": 1.6592, | |
| "grad_norm": 0.3413638472557068, | |
| "learning_rate": 1.9066467365417844e-05, | |
| "loss": 0.8691, | |
| "mean_token_accuracy": 0.7368915528059006, | |
| "num_tokens": 4361378.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 1.2695908069610595, | |
| "epoch": 1.7231999999999998, | |
| "grad_norm": 0.3355003595352173, | |
| "learning_rate": 1.8977458847095117e-05, | |
| "loss": 0.8584, | |
| "mean_token_accuracy": 0.7388368755578995, | |
| "num_tokens": 4527968.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 1.2557695835828782, | |
| "epoch": 1.7872, | |
| "grad_norm": 0.35713067650794983, | |
| "learning_rate": 1.888462553129867e-05, | |
| "loss": 0.8615, | |
| "mean_token_accuracy": 0.7374937132000923, | |
| "num_tokens": 4697185.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 1.258004653453827, | |
| "epoch": 1.8512, | |
| "grad_norm": 0.35476240515708923, | |
| "learning_rate": 1.878800696915737e-05, | |
| "loss": 0.8735, | |
| "mean_token_accuracy": 0.7390823766589165, | |
| "num_tokens": 4869268.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 1.2416281551122665, | |
| "epoch": 1.9152, | |
| "grad_norm": 0.2956583797931671, | |
| "learning_rate": 1.868764432448369e-05, | |
| "loss": 0.8587, | |
| "mean_token_accuracy": 0.7391577690839768, | |
| "num_tokens": 5041668.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 1.2554892003536224, | |
| "epoch": 1.9792, | |
| "grad_norm": 0.36443835496902466, | |
| "learning_rate": 1.8583580356236065e-05, | |
| "loss": 0.8784, | |
| "mean_token_accuracy": 0.7360676273703575, | |
| "num_tokens": 5211130.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 1.2533008375683345, | |
| "epoch": 2.0384, | |
| "grad_norm": 0.37365785241127014, | |
| "learning_rate": 1.8475859400301708e-05, | |
| "loss": 0.8448, | |
| "mean_token_accuracy": 0.7391577572435946, | |
| "num_tokens": 5365597.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 1.2590773075819015, | |
| "epoch": 2.1024, | |
| "grad_norm": 0.44947031140327454, | |
| "learning_rate": 1.8364527350607527e-05, | |
| "loss": 0.8602, | |
| "mean_token_accuracy": 0.7381724148988724, | |
| "num_tokens": 5529944.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 1.2393722623586654, | |
| "epoch": 2.1664, | |
| "grad_norm": 0.3682183027267456, | |
| "learning_rate": 1.824963163956726e-05, | |
| "loss": 0.8516, | |
| "mean_token_accuracy": 0.7419341534376145, | |
| "num_tokens": 5701741.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 1.224160623550415, | |
| "epoch": 2.2304, | |
| "grad_norm": 0.3923819959163666, | |
| "learning_rate": 1.8131221217873175e-05, | |
| "loss": 0.8377, | |
| "mean_token_accuracy": 0.7442746981978416, | |
| "num_tokens": 5873777.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 1.2588546723127365, | |
| "epoch": 2.2944, | |
| "grad_norm": 0.39916929602622986, | |
| "learning_rate": 1.8009346533640877e-05, | |
| "loss": 0.878, | |
| "mean_token_accuracy": 0.7364423900842667, | |
| "num_tokens": 6044077.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 1.2643144816160201, | |
| "epoch": 2.3584, | |
| "grad_norm": 0.420813649892807, | |
| "learning_rate": 1.7884059510916167e-05, | |
| "loss": 0.8603, | |
| "mean_token_accuracy": 0.7379584088921547, | |
| "num_tokens": 6208773.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 1.2406759321689607, | |
| "epoch": 2.4224, | |
| "grad_norm": 0.3934536278247833, | |
| "learning_rate": 1.7755413527553087e-05, | |
| "loss": 0.8452, | |
| "mean_token_accuracy": 0.7419968873262406, | |
| "num_tokens": 6375486.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 1.239344623684883, | |
| "epoch": 2.4864, | |
| "grad_norm": 0.3987742066383362, | |
| "learning_rate": 1.7623463392472574e-05, | |
| "loss": 0.8515, | |
| "mean_token_accuracy": 0.7414514541625976, | |
| "num_tokens": 6546290.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 1.2116641372442245, | |
| "epoch": 2.5504, | |
| "grad_norm": 0.43099576234817505, | |
| "learning_rate": 1.748826532231142e-05, | |
| "loss": 0.8209, | |
| "mean_token_accuracy": 0.746632432937622, | |
| "num_tokens": 6717949.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 1.2477060765028, | |
| "epoch": 2.6144, | |
| "grad_norm": 0.41407084465026855, | |
| "learning_rate": 1.7349876917471474e-05, | |
| "loss": 0.8456, | |
| "mean_token_accuracy": 0.7417222335934639, | |
| "num_tokens": 6883125.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 1.2271479934453964, | |
| "epoch": 2.6784, | |
| "grad_norm": 0.4161278307437897, | |
| "learning_rate": 1.7208357137579318e-05, | |
| "loss": 0.8411, | |
| "mean_token_accuracy": 0.744826503098011, | |
| "num_tokens": 7053271.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 1.2537022173404693, | |
| "epoch": 2.7424, | |
| "grad_norm": 0.39646434783935547, | |
| "learning_rate": 1.7063766276366814e-05, | |
| "loss": 0.875, | |
| "mean_token_accuracy": 0.7370057612657547, | |
| "num_tokens": 7225737.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 1.229554709792137, | |
| "epoch": 2.8064, | |
| "grad_norm": 0.409257173538208, | |
| "learning_rate": 1.6916165935983323e-05, | |
| "loss": 0.8434, | |
| "mean_token_accuracy": 0.7419100552797318, | |
| "num_tokens": 7393850.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 1.2586964070796967, | |
| "epoch": 2.8704, | |
| "grad_norm": 0.44094783067703247, | |
| "learning_rate": 1.676561900075041e-05, | |
| "loss": 0.8623, | |
| "mean_token_accuracy": 0.7402451306581497, | |
| "num_tokens": 7560159.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 1.2187331795692444, | |
| "epoch": 2.9344, | |
| "grad_norm": 0.3948505222797394, | |
| "learning_rate": 1.6612189610370336e-05, | |
| "loss": 0.82, | |
| "mean_token_accuracy": 0.7458591118454934, | |
| "num_tokens": 7726778.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 1.2287385314702988, | |
| "epoch": 2.9984, | |
| "grad_norm": 0.4345516562461853, | |
| "learning_rate": 1.6455943132599698e-05, | |
| "loss": 0.8396, | |
| "mean_token_accuracy": 0.7434753939509392, | |
| "num_tokens": 7896364.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 1.2102074913076453, | |
| "epoch": 3.0576, | |
| "grad_norm": 0.42504480481147766, | |
| "learning_rate": 1.6296946135399835e-05, | |
| "loss": 0.821, | |
| "mean_token_accuracy": 0.7462124454008566, | |
| "num_tokens": 8050254.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 1.2117455512285233, | |
| "epoch": 3.1216, | |
| "grad_norm": 0.44672510027885437, | |
| "learning_rate": 1.613526635857591e-05, | |
| "loss": 0.8198, | |
| "mean_token_accuracy": 0.7464832335710525, | |
| "num_tokens": 8217439.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 1.2218973994255067, | |
| "epoch": 3.1856, | |
| "grad_norm": 0.4569561779499054, | |
| "learning_rate": 1.5970972684916754e-05, | |
| "loss": 0.8394, | |
| "mean_token_accuracy": 0.743482106924057, | |
| "num_tokens": 8384749.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 1.205233234167099, | |
| "epoch": 3.2496, | |
| "grad_norm": 0.49336662888526917, | |
| "learning_rate": 1.5804135110847708e-05, | |
| "loss": 0.8126, | |
| "mean_token_accuracy": 0.7476648792624474, | |
| "num_tokens": 8552626.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 1.2141715466976166, | |
| "epoch": 3.3136, | |
| "grad_norm": 0.47234952449798584, | |
| "learning_rate": 1.5634824716609037e-05, | |
| "loss": 0.8199, | |
| "mean_token_accuracy": 0.7487053409218788, | |
| "num_tokens": 8719495.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 1.2043092876672745, | |
| "epoch": 3.3776, | |
| "grad_norm": 0.4978366792201996, | |
| "learning_rate": 1.5463113635972577e-05, | |
| "loss": 0.8121, | |
| "mean_token_accuracy": 0.7485451966524124, | |
| "num_tokens": 8889843.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 1.2383090078830719, | |
| "epoch": 3.4416, | |
| "grad_norm": 0.473350465297699, | |
| "learning_rate": 1.528907502550954e-05, | |
| "loss": 0.8633, | |
| "mean_token_accuracy": 0.7431078001856803, | |
| "num_tokens": 9059897.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 1.1710155814886094, | |
| "epoch": 3.5056000000000003, | |
| "grad_norm": 0.48414960503578186, | |
| "learning_rate": 1.5112783033422547e-05, | |
| "loss": 0.7952, | |
| "mean_token_accuracy": 0.751731738448143, | |
| "num_tokens": 9230970.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 1.194032496213913, | |
| "epoch": 3.5696, | |
| "grad_norm": 0.5241577625274658, | |
| "learning_rate": 1.4934312767955193e-05, | |
| "loss": 0.8106, | |
| "mean_token_accuracy": 0.748333002626896, | |
| "num_tokens": 9400137.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 1.203871914744377, | |
| "epoch": 3.6336, | |
| "grad_norm": 0.4763513505458832, | |
| "learning_rate": 1.4753740265392595e-05, | |
| "loss": 0.8321, | |
| "mean_token_accuracy": 0.7462276950478554, | |
| "num_tokens": 9569468.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 1.2193732023239137, | |
| "epoch": 3.6976, | |
| "grad_norm": 0.5063449740409851, | |
| "learning_rate": 1.4571142457666536e-05, | |
| "loss": 0.8297, | |
| "mean_token_accuracy": 0.7442631095647811, | |
| "num_tokens": 9739091.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 1.20502949655056, | |
| "epoch": 3.7616, | |
| "grad_norm": 0.5168077945709229, | |
| "learning_rate": 1.4386597139579041e-05, | |
| "loss": 0.8087, | |
| "mean_token_accuracy": 0.750263799726963, | |
| "num_tokens": 9903536.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 1.211077681183815, | |
| "epoch": 3.8256, | |
| "grad_norm": 0.5382931232452393, | |
| "learning_rate": 1.4200182935658327e-05, | |
| "loss": 0.8212, | |
| "mean_token_accuracy": 0.7472874745726585, | |
| "num_tokens": 10070133.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 1.2020549327135086, | |
| "epoch": 3.8895999999999997, | |
| "grad_norm": 0.4987923502922058, | |
| "learning_rate": 1.4011979266661235e-05, | |
| "loss": 0.8239, | |
| "mean_token_accuracy": 0.7469061449170112, | |
| "num_tokens": 10242501.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 1.210327258706093, | |
| "epoch": 3.9536, | |
| "grad_norm": 0.5201823115348816, | |
| "learning_rate": 1.3822066315736477e-05, | |
| "loss": 0.8274, | |
| "mean_token_accuracy": 0.746899065375328, | |
| "num_tokens": 10411438.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 1.2165618264997327, | |
| "epoch": 4.0128, | |
| "grad_norm": 0.5398468971252441, | |
| "learning_rate": 1.363052499426302e-05, | |
| "loss": 0.831, | |
| "mean_token_accuracy": 0.7447031430295996, | |
| "num_tokens": 10568566.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 1.1632685348391534, | |
| "epoch": 4.0768, | |
| "grad_norm": 0.6215068697929382, | |
| "learning_rate": 1.3437436907378225e-05, | |
| "loss": 0.7707, | |
| "mean_token_accuracy": 0.7566415458917618, | |
| "num_tokens": 10736787.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 1.1855787336826324, | |
| "epoch": 4.1408, | |
| "grad_norm": 0.5971937775611877, | |
| "learning_rate": 1.3242884319210463e-05, | |
| "loss": 0.8059, | |
| "mean_token_accuracy": 0.7505464211106301, | |
| "num_tokens": 10907187.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 1.1913582772016524, | |
| "epoch": 4.2048, | |
| "grad_norm": 0.64606112241745, | |
| "learning_rate": 1.3046950117830888e-05, | |
| "loss": 0.8079, | |
| "mean_token_accuracy": 0.7538586258888245, | |
| "num_tokens": 11076448.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 1.1633977055549622, | |
| "epoch": 4.2688, | |
| "grad_norm": 0.6025974750518799, | |
| "learning_rate": 1.2849717779939439e-05, | |
| "loss": 0.7804, | |
| "mean_token_accuracy": 0.754143525660038, | |
| "num_tokens": 11246044.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 1.172673773765564, | |
| "epoch": 4.3328, | |
| "grad_norm": 0.5885686278343201, | |
| "learning_rate": 1.2651271335300063e-05, | |
| "loss": 0.798, | |
| "mean_token_accuracy": 0.7523474931716919, | |
| "num_tokens": 11415782.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 1.1495980948209763, | |
| "epoch": 4.3968, | |
| "grad_norm": 0.6189532279968262, | |
| "learning_rate": 1.2451695330940268e-05, | |
| "loss": 0.766, | |
| "mean_token_accuracy": 0.7611258506774903, | |
| "num_tokens": 11581998.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 1.1974951326847076, | |
| "epoch": 4.4608, | |
| "grad_norm": 0.6507912874221802, | |
| "learning_rate": 1.2251074795130339e-05, | |
| "loss": 0.8261, | |
| "mean_token_accuracy": 0.7475854620337486, | |
| "num_tokens": 11752776.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 1.1862800359725951, | |
| "epoch": 4.5248, | |
| "grad_norm": 0.6506279110908508, | |
| "learning_rate": 1.2049495201157489e-05, | |
| "loss": 0.7858, | |
| "mean_token_accuracy": 0.7544367983937263, | |
| "num_tokens": 11916319.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 1.1888660967350007, | |
| "epoch": 4.5888, | |
| "grad_norm": 0.7014175653457642, | |
| "learning_rate": 1.1847042430910451e-05, | |
| "loss": 0.8118, | |
| "mean_token_accuracy": 0.7482251942157745, | |
| "num_tokens": 12084487.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 1.1586445271968842, | |
| "epoch": 4.6528, | |
| "grad_norm": 0.6517874598503113, | |
| "learning_rate": 1.1643802738289955e-05, | |
| "loss": 0.7778, | |
| "mean_token_accuracy": 0.7564518004655838, | |
| "num_tokens": 12253339.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 1.1812776714563369, | |
| "epoch": 4.7168, | |
| "grad_norm": 0.6842546463012695, | |
| "learning_rate": 1.1439862712460721e-05, | |
| "loss": 0.7957, | |
| "mean_token_accuracy": 0.7507700502872467, | |
| "num_tokens": 12423311.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 1.1869671106338502, | |
| "epoch": 4.7808, | |
| "grad_norm": 0.6829348206520081, | |
| "learning_rate": 1.1235309240960621e-05, | |
| "loss": 0.8125, | |
| "mean_token_accuracy": 0.7493612572550774, | |
| "num_tokens": 12593509.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 1.1620380729436874, | |
| "epoch": 4.8448, | |
| "grad_norm": 0.5931580066680908, | |
| "learning_rate": 1.1030229472682719e-05, | |
| "loss": 0.7863, | |
| "mean_token_accuracy": 0.7565168127417564, | |
| "num_tokens": 12762574.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 1.1934880197048188, | |
| "epoch": 4.9088, | |
| "grad_norm": 0.673819899559021, | |
| "learning_rate": 1.0824710780745954e-05, | |
| "loss": 0.7921, | |
| "mean_token_accuracy": 0.7512735366821289, | |
| "num_tokens": 12927608.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 1.1958867460489273, | |
| "epoch": 4.9728, | |
| "grad_norm": 0.6820770502090454, | |
| "learning_rate": 1.06188407252703e-05, | |
| "loss": 0.8103, | |
| "mean_token_accuracy": 0.7500374510884285, | |
| "num_tokens": 13095807.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 1.1728345767871753, | |
| "epoch": 5.032, | |
| "grad_norm": 0.7087289094924927, | |
| "learning_rate": 1.0412707016072254e-05, | |
| "loss": 0.7749, | |
| "mean_token_accuracy": 0.7583866667103123, | |
| "num_tokens": 13248102.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 1.1663290411233902, | |
| "epoch": 5.096, | |
| "grad_norm": 0.7355737686157227, | |
| "learning_rate": 1.0206397475296548e-05, | |
| "loss": 0.7779, | |
| "mean_token_accuracy": 0.7589040651917458, | |
| "num_tokens": 13413512.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 1.1404080986976624, | |
| "epoch": 5.16, | |
| "grad_norm": 0.7504479885101318, | |
| "learning_rate": 1e-05, | |
| "loss": 0.7517, | |
| "mean_token_accuracy": 0.7618933707475662, | |
| "num_tokens": 13583993.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 1.1676405906677245, | |
| "epoch": 5.224, | |
| "grad_norm": 0.8724946975708008, | |
| "learning_rate": 9.793602524703456e-06, | |
| "loss": 0.7773, | |
| "mean_token_accuracy": 0.7555600613355636, | |
| "num_tokens": 13751270.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 1.1330503553152085, | |
| "epoch": 5.288, | |
| "grad_norm": 0.7498918175697327, | |
| "learning_rate": 9.58729298392775e-06, | |
| "loss": 0.7475, | |
| "mean_token_accuracy": 0.7617968454957008, | |
| "num_tokens": 13921584.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 1.1508350551128388, | |
| "epoch": 5.352, | |
| "grad_norm": 0.7500905990600586, | |
| "learning_rate": 9.381159274729704e-06, | |
| "loss": 0.7849, | |
| "mean_token_accuracy": 0.7576810494065285, | |
| "num_tokens": 14091937.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 1.1224143624305725, | |
| "epoch": 5.416, | |
| "grad_norm": 0.7415691614151001, | |
| "learning_rate": 9.175289219254051e-06, | |
| "loss": 0.7341, | |
| "mean_token_accuracy": 0.7673233345150947, | |
| "num_tokens": 14260356.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 1.1505684763193131, | |
| "epoch": 5.48, | |
| "grad_norm": 0.7703384757041931, | |
| "learning_rate": 8.969770527317283e-06, | |
| "loss": 0.7658, | |
| "mean_token_accuracy": 0.7610488831996918, | |
| "num_tokens": 14424125.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 1.1513787150382995, | |
| "epoch": 5.5440000000000005, | |
| "grad_norm": 0.8211115002632141, | |
| "learning_rate": 8.764690759039382e-06, | |
| "loss": 0.7727, | |
| "mean_token_accuracy": 0.7584890708327293, | |
| "num_tokens": 14594600.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 1.1472541570663453, | |
| "epoch": 5.608, | |
| "grad_norm": 0.7482420206069946, | |
| "learning_rate": 8.56013728753928e-06, | |
| "loss": 0.7767, | |
| "mean_token_accuracy": 0.7584212064743042, | |
| "num_tokens": 14765974.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 1.1245936155319214, | |
| "epoch": 5.672, | |
| "grad_norm": 0.7992265224456787, | |
| "learning_rate": 8.356197261710048e-06, | |
| "loss": 0.7602, | |
| "mean_token_accuracy": 0.7592591598629952, | |
| "num_tokens": 14936349.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 1.1513198018074036, | |
| "epoch": 5.736, | |
| "grad_norm": 0.7653408050537109, | |
| "learning_rate": 8.152957569089552e-06, | |
| "loss": 0.7622, | |
| "mean_token_accuracy": 0.760157561302185, | |
| "num_tokens": 15105256.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 1.1511808067560196, | |
| "epoch": 5.8, | |
| "grad_norm": 0.802228569984436, | |
| "learning_rate": 7.950504798842513e-06, | |
| "loss": 0.7685, | |
| "mean_token_accuracy": 0.7571253061294556, | |
| "num_tokens": 15276369.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 1.1488977074623108, | |
| "epoch": 5.864, | |
| "grad_norm": 0.8278489708900452, | |
| "learning_rate": 7.748925204869667e-06, | |
| "loss": 0.7704, | |
| "mean_token_accuracy": 0.7605934232473374, | |
| "num_tokens": 15444886.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 1.1339735567569733, | |
| "epoch": 5.928, | |
| "grad_norm": 0.897056519985199, | |
| "learning_rate": 7.548304669059735e-06, | |
| "loss": 0.754, | |
| "mean_token_accuracy": 0.7624502271413803, | |
| "num_tokens": 15613205.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 1.1681912243366241, | |
| "epoch": 5.992, | |
| "grad_norm": 0.8365456461906433, | |
| "learning_rate": 7.348728664699939e-06, | |
| "loss": 0.7771, | |
| "mean_token_accuracy": 0.758332185447216, | |
| "num_tokens": 15780285.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 1.1275109552048348, | |
| "epoch": 6.0512, | |
| "grad_norm": 0.7828477025032043, | |
| "learning_rate": 7.150282220060564e-06, | |
| "loss": 0.7577, | |
| "mean_token_accuracy": 0.7635239346607311, | |
| "num_tokens": 15938875.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 1.1234853833913803, | |
| "epoch": 6.1152, | |
| "grad_norm": 0.8459082245826721, | |
| "learning_rate": 6.9530498821691165e-06, | |
| "loss": 0.7387, | |
| "mean_token_accuracy": 0.7674040615558624, | |
| "num_tokens": 16107143.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 1.1044875085353851, | |
| "epoch": 6.1792, | |
| "grad_norm": 0.964129626750946, | |
| "learning_rate": 6.757115680789539e-06, | |
| "loss": 0.7323, | |
| "mean_token_accuracy": 0.7670143201947213, | |
| "num_tokens": 16275215.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 1.1271264016628266, | |
| "epoch": 6.2432, | |
| "grad_norm": 0.9594255089759827, | |
| "learning_rate": 6.562563092621776e-06, | |
| "loss": 0.7441, | |
| "mean_token_accuracy": 0.7671423986554146, | |
| "num_tokens": 16442930.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 1.1283981755375863, | |
| "epoch": 6.3072, | |
| "grad_norm": 0.9190363883972168, | |
| "learning_rate": 6.369475005736984e-06, | |
| "loss": 0.7594, | |
| "mean_token_accuracy": 0.7621881037950515, | |
| "num_tokens": 16612141.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 1.1091500714421272, | |
| "epoch": 6.3712, | |
| "grad_norm": 0.8615358471870422, | |
| "learning_rate": 6.177933684263524e-06, | |
| "loss": 0.7352, | |
| "mean_token_accuracy": 0.7689472794532776, | |
| "num_tokens": 16783610.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 1.0969498217105866, | |
| "epoch": 6.4352, | |
| "grad_norm": 0.9383291602134705, | |
| "learning_rate": 5.988020733338767e-06, | |
| "loss": 0.705, | |
| "mean_token_accuracy": 0.772877112030983, | |
| "num_tokens": 16951601.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 1.1219998925924302, | |
| "epoch": 6.4992, | |
| "grad_norm": 0.9278421998023987, | |
| "learning_rate": 5.7998170643416795e-06, | |
| "loss": 0.7366, | |
| "mean_token_accuracy": 0.7668613627552986, | |
| "num_tokens": 17118402.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 1.1189097076654435, | |
| "epoch": 6.5632, | |
| "grad_norm": 0.8941367268562317, | |
| "learning_rate": 5.613402860420962e-06, | |
| "loss": 0.7423, | |
| "mean_token_accuracy": 0.7693732514977455, | |
| "num_tokens": 17285077.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 1.1192366987466813, | |
| "epoch": 6.6272, | |
| "grad_norm": 0.9321838617324829, | |
| "learning_rate": 5.428857542333465e-06, | |
| "loss": 0.7383, | |
| "mean_token_accuracy": 0.766059798002243, | |
| "num_tokens": 17454468.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 1.1280045241117478, | |
| "epoch": 6.6912, | |
| "grad_norm": 0.9867642521858215, | |
| "learning_rate": 5.246259734607411e-06, | |
| "loss": 0.7452, | |
| "mean_token_accuracy": 0.7636990651488305, | |
| "num_tokens": 17622278.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 1.1145729750394822, | |
| "epoch": 6.7552, | |
| "grad_norm": 1.00631844997406, | |
| "learning_rate": 5.065687232044811e-06, | |
| "loss": 0.731, | |
| "mean_token_accuracy": 0.7677978798747063, | |
| "num_tokens": 17791512.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 1.1203809767961501, | |
| "epoch": 6.8192, | |
| "grad_norm": 0.9962554574012756, | |
| "learning_rate": 4.887216966577458e-06, | |
| "loss": 0.742, | |
| "mean_token_accuracy": 0.7627907797694207, | |
| "num_tokens": 17960407.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 1.1107396587729454, | |
| "epoch": 6.8832, | |
| "grad_norm": 0.9973596930503845, | |
| "learning_rate": 4.710924974490463e-06, | |
| "loss": 0.7249, | |
| "mean_token_accuracy": 0.7697675704956055, | |
| "num_tokens": 18125304.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 1.12523413002491, | |
| "epoch": 6.9472000000000005, | |
| "grad_norm": 0.9931960105895996, | |
| "learning_rate": 4.536886364027428e-06, | |
| "loss": 0.7455, | |
| "mean_token_accuracy": 0.763170848786831, | |
| "num_tokens": 18294233.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 1.1127794884346627, | |
| "epoch": 7.0064, | |
| "grad_norm": 0.8755695223808289, | |
| "learning_rate": 4.365175283390968e-06, | |
| "loss": 0.7232, | |
| "mean_token_accuracy": 0.7706596577489698, | |
| "num_tokens": 18452285.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 1.0963766992092132, | |
| "epoch": 7.0704, | |
| "grad_norm": 1.0143297910690308, | |
| "learning_rate": 4.195864889152295e-06, | |
| "loss": 0.7005, | |
| "mean_token_accuracy": 0.7757644459605217, | |
| "num_tokens": 18620732.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 1.0792216598987578, | |
| "epoch": 7.1344, | |
| "grad_norm": 1.0209460258483887, | |
| "learning_rate": 4.029027315083251e-06, | |
| "loss": 0.6906, | |
| "mean_token_accuracy": 0.7794409260153771, | |
| "num_tokens": 18787944.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 1.102518378198147, | |
| "epoch": 7.1984, | |
| "grad_norm": 1.0153676271438599, | |
| "learning_rate": 3.864733641424093e-06, | |
| "loss": 0.7044, | |
| "mean_token_accuracy": 0.774037578701973, | |
| "num_tokens": 18951875.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 1.1013861119747161, | |
| "epoch": 7.2624, | |
| "grad_norm": 1.0647627115249634, | |
| "learning_rate": 3.703053864600169e-06, | |
| "loss": 0.7215, | |
| "mean_token_accuracy": 0.7702529579401016, | |
| "num_tokens": 19121454.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 1.089624047279358, | |
| "epoch": 7.3264, | |
| "grad_norm": 1.0077697038650513, | |
| "learning_rate": 3.544056867400306e-06, | |
| "loss": 0.7079, | |
| "mean_token_accuracy": 0.7726217702031135, | |
| "num_tokens": 19290430.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 1.1091026380658149, | |
| "epoch": 7.3904, | |
| "grad_norm": 1.0901305675506592, | |
| "learning_rate": 3.3878103896296677e-06, | |
| "loss": 0.7233, | |
| "mean_token_accuracy": 0.7718619227409362, | |
| "num_tokens": 19458849.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 1.0947757676243781, | |
| "epoch": 7.4544, | |
| "grad_norm": 1.028538703918457, | |
| "learning_rate": 3.2343809992495945e-06, | |
| "loss": 0.7119, | |
| "mean_token_accuracy": 0.7740111395716667, | |
| "num_tokens": 19625293.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 1.10685034096241, | |
| "epoch": 7.5184, | |
| "grad_norm": 1.026236653327942, | |
| "learning_rate": 3.083834064016682e-06, | |
| "loss": 0.7273, | |
| "mean_token_accuracy": 0.7731231868267059, | |
| "num_tokens": 19794945.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 1.0935991361737252, | |
| "epoch": 7.5824, | |
| "grad_norm": 1.1131870746612549, | |
| "learning_rate": 2.9362337236331884e-06, | |
| "loss": 0.7074, | |
| "mean_token_accuracy": 0.7722717076539993, | |
| "num_tokens": 19963076.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 1.1043099403381347, | |
| "epoch": 7.6464, | |
| "grad_norm": 1.0670139789581299, | |
| "learning_rate": 2.791642862420686e-06, | |
| "loss": 0.7258, | |
| "mean_token_accuracy": 0.7688395619392395, | |
| "num_tokens": 20134923.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 1.102524772286415, | |
| "epoch": 7.7104, | |
| "grad_norm": 1.0460227727890015, | |
| "learning_rate": 2.6501230825285294e-06, | |
| "loss": 0.7122, | |
| "mean_token_accuracy": 0.7745070040225983, | |
| "num_tokens": 20301990.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 1.0997470021247864, | |
| "epoch": 7.7744, | |
| "grad_norm": 1.1005793809890747, | |
| "learning_rate": 2.5117346776885843e-06, | |
| "loss": 0.7343, | |
| "mean_token_accuracy": 0.7664325267076493, | |
| "num_tokens": 20470721.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 1.1047000914812088, | |
| "epoch": 7.8384, | |
| "grad_norm": 1.01988685131073, | |
| "learning_rate": 2.3765366075274287e-06, | |
| "loss": 0.7188, | |
| "mean_token_accuracy": 0.7712782993912697, | |
| "num_tokens": 20637672.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 1.1048908308148384, | |
| "epoch": 7.9024, | |
| "grad_norm": 1.042604684829712, | |
| "learning_rate": 2.2445864724469146e-06, | |
| "loss": 0.7214, | |
| "mean_token_accuracy": 0.7692830249667167, | |
| "num_tokens": 20809780.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 1.1015258342027665, | |
| "epoch": 7.9664, | |
| "grad_norm": 1.0530294179916382, | |
| "learning_rate": 2.1159404890838365e-06, | |
| "loss": 0.7174, | |
| "mean_token_accuracy": 0.7710513040423393, | |
| "num_tokens": 20977925.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 1.1052203758342847, | |
| "epoch": 8.0256, | |
| "grad_norm": 1.0588289499282837, | |
| "learning_rate": 1.990653466359125e-06, | |
| "loss": 0.7231, | |
| "mean_token_accuracy": 0.7697531097644085, | |
| "num_tokens": 21135709.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 1.0664937138557433, | |
| "epoch": 8.0896, | |
| "grad_norm": 1.1996620893478394, | |
| "learning_rate": 1.8687787821268255e-06, | |
| "loss": 0.6798, | |
| "mean_token_accuracy": 0.7811540484428405, | |
| "num_tokens": 21305580.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 1.0717683494091035, | |
| "epoch": 8.1536, | |
| "grad_norm": 1.1794630289077759, | |
| "learning_rate": 1.7503683604327426e-06, | |
| "loss": 0.6944, | |
| "mean_token_accuracy": 0.7757708877325058, | |
| "num_tokens": 21476026.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 1.0876216664910316, | |
| "epoch": 8.2176, | |
| "grad_norm": 1.0743852853775024, | |
| "learning_rate": 1.6354726493924745e-06, | |
| "loss": 0.7044, | |
| "mean_token_accuracy": 0.7734724819660187, | |
| "num_tokens": 21644729.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 1.0878884211182593, | |
| "epoch": 8.2816, | |
| "grad_norm": 1.1732165813446045, | |
| "learning_rate": 1.5241405996982928e-06, | |
| "loss": 0.7015, | |
| "mean_token_accuracy": 0.7772793591022491, | |
| "num_tokens": 21811332.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 1.080038744211197, | |
| "epoch": 8.3456, | |
| "grad_norm": 1.1939797401428223, | |
| "learning_rate": 1.4164196437639355e-06, | |
| "loss": 0.6929, | |
| "mean_token_accuracy": 0.7762296363711357, | |
| "num_tokens": 21976237.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 1.0742896348237991, | |
| "epoch": 8.4096, | |
| "grad_norm": 1.1042524576187134, | |
| "learning_rate": 1.3123556755163114e-06, | |
| "loss": 0.6917, | |
| "mean_token_accuracy": 0.7782910659909248, | |
| "num_tokens": 22145608.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 1.077732390165329, | |
| "epoch": 8.4736, | |
| "grad_norm": 1.0329608917236328, | |
| "learning_rate": 1.2119930308426264e-06, | |
| "loss": 0.6967, | |
| "mean_token_accuracy": 0.7769305527210235, | |
| "num_tokens": 22313707.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 1.103071777522564, | |
| "epoch": 8.5376, | |
| "grad_norm": 1.110071063041687, | |
| "learning_rate": 1.1153744687013313e-06, | |
| "loss": 0.7219, | |
| "mean_token_accuracy": 0.7715903207659721, | |
| "num_tokens": 22481770.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 1.099236251413822, | |
| "epoch": 8.6016, | |
| "grad_norm": 0.999956488609314, | |
| "learning_rate": 1.0225411529048857e-06, | |
| "loss": 0.7184, | |
| "mean_token_accuracy": 0.7770519211888314, | |
| "num_tokens": 22649599.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 1.0735243171453477, | |
| "epoch": 8.6656, | |
| "grad_norm": 1.0479539632797241, | |
| "learning_rate": 9.33532634582156e-07, | |
| "loss": 0.6895, | |
| "mean_token_accuracy": 0.7782353475689888, | |
| "num_tokens": 22818752.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 1.0788584634661675, | |
| "epoch": 8.7296, | |
| "grad_norm": 1.0581979751586914, | |
| "learning_rate": 8.483868353278657e-07, | |
| "loss": 0.7061, | |
| "mean_token_accuracy": 0.7732961744070053, | |
| "num_tokens": 22987614.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 1.1177189975976944, | |
| "epoch": 8.7936, | |
| "grad_norm": 1.100332498550415, | |
| "learning_rate": 7.671400310462984e-07, | |
| "loss": 0.7289, | |
| "mean_token_accuracy": 0.7704362392425537, | |
| "num_tokens": 23154417.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 1.0906570345163344, | |
| "epoch": 8.8576, | |
| "grad_norm": 1.1676188707351685, | |
| "learning_rate": 6.898268364961591e-07, | |
| "loss": 0.7094, | |
| "mean_token_accuracy": 0.7727909624576569, | |
| "num_tokens": 23322493.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 1.0766915142536164, | |
| "epoch": 8.9216, | |
| "grad_norm": 1.0389209985733032, | |
| "learning_rate": 6.164801905431394e-07, | |
| "loss": 0.7106, | |
| "mean_token_accuracy": 0.7720396503806114, | |
| "num_tokens": 23498552.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 1.0853375509381293, | |
| "epoch": 8.9856, | |
| "grad_norm": 1.101219892501831, | |
| "learning_rate": 5.471313421264879e-07, | |
| "loss": 0.6867, | |
| "mean_token_accuracy": 0.7808714762330056, | |
| "num_tokens": 23663155.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 1.0748054787919328, | |
| "epoch": 9.0448, | |
| "grad_norm": 1.1024824380874634, | |
| "learning_rate": 4.818098369455793e-07, | |
| "loss": 0.6784, | |
| "mean_token_accuracy": 0.7802738080153594, | |
| "num_tokens": 23817642.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 1.0809885799884795, | |
| "epoch": 9.1088, | |
| "grad_norm": 1.0660940408706665, | |
| "learning_rate": 4.20543504872124e-07, | |
| "loss": 0.6928, | |
| "mean_token_accuracy": 0.7785634055733681, | |
| "num_tokens": 23986616.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 1.0696254506707192, | |
| "epoch": 9.1728, | |
| "grad_norm": 1.098575472831726, | |
| "learning_rate": 3.633584480934016e-07, | |
| "loss": 0.6848, | |
| "mean_token_accuracy": 0.7822138294577599, | |
| "num_tokens": 24153973.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 1.0600635647773742, | |
| "epoch": 9.2368, | |
| "grad_norm": 1.1507972478866577, | |
| "learning_rate": 3.1027902999157146e-07, | |
| "loss": 0.67, | |
| "mean_token_accuracy": 0.7815300151705742, | |
| "num_tokens": 24321980.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 1.0735993713140488, | |
| "epoch": 9.3008, | |
| "grad_norm": 1.1208281517028809, | |
| "learning_rate": 2.61327864763784e-07, | |
| "loss": 0.691, | |
| "mean_token_accuracy": 0.7773459628224373, | |
| "num_tokens": 24491957.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 1.0888471096754073, | |
| "epoch": 9.3648, | |
| "grad_norm": 1.0866674184799194, | |
| "learning_rate": 2.1652580778751875e-07, | |
| "loss": 0.7091, | |
| "mean_token_accuracy": 0.7754179865121842, | |
| "num_tokens": 24658306.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 1.0891848027706146, | |
| "epoch": 9.4288, | |
| "grad_norm": 1.111118197441101, | |
| "learning_rate": 1.758919467352771e-07, | |
| "loss": 0.6999, | |
| "mean_token_accuracy": 0.7776159614324569, | |
| "num_tokens": 24821950.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 1.068458940088749, | |
| "epoch": 9.4928, | |
| "grad_norm": 1.1345736980438232, | |
| "learning_rate": 1.3944359344237214e-07, | |
| "loss": 0.6819, | |
| "mean_token_accuracy": 0.7809593558311463, | |
| "num_tokens": 24991570.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 1.0842776700854302, | |
| "epoch": 9.556799999999999, | |
| "grad_norm": 1.0693023204803467, | |
| "learning_rate": 1.0719627653131948e-07, | |
| "loss": 0.7059, | |
| "mean_token_accuracy": 0.7756290450692177, | |
| "num_tokens": 25160961.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 1.0747777849435807, | |
| "epoch": 9.6208, | |
| "grad_norm": 1.1459989547729492, | |
| "learning_rate": 7.916373479595507e-08, | |
| "loss": 0.6964, | |
| "mean_token_accuracy": 0.7755286246538162, | |
| "num_tokens": 25330836.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 1.0941903442144394, | |
| "epoch": 9.6848, | |
| "grad_norm": 1.103893518447876, | |
| "learning_rate": 5.535791134809176e-08, | |
| "loss": 0.7116, | |
| "mean_token_accuracy": 0.7722656220197678, | |
| "num_tokens": 25499639.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 1.0937790602445603, | |
| "epoch": 9.7488, | |
| "grad_norm": 1.2139781713485718, | |
| "learning_rate": 3.57889485292251e-08, | |
| "loss": 0.7092, | |
| "mean_token_accuracy": 0.7771677598357201, | |
| "num_tokens": 25666081.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 1.0790585070848464, | |
| "epoch": 9.8128, | |
| "grad_norm": 1.0998142957687378, | |
| "learning_rate": 2.046518358944094e-08, | |
| "loss": 0.7061, | |
| "mean_token_accuracy": 0.7749298721551895, | |
| "num_tokens": 25836012.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 1.087978368997574, | |
| "epoch": 9.8768, | |
| "grad_norm": 1.1979362964630127, | |
| "learning_rate": 9.393145135377924e-09, | |
| "loss": 0.7221, | |
| "mean_token_accuracy": 0.7720273390412331, | |
| "num_tokens": 26007577.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 1.077130888402462, | |
| "epoch": 9.9408, | |
| "grad_norm": 0.9926674962043762, | |
| "learning_rate": 2.5775503487501795e-09, | |
| "loss": 0.6815, | |
| "mean_token_accuracy": 0.7797598227858543, | |
| "num_tokens": 26176310.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 1.0749925036688108, | |
| "epoch": 10.0, | |
| "grad_norm": 2.0213756561279297, | |
| "learning_rate": 2.1302976616066616e-11, | |
| "loss": 0.6932, | |
| "mean_token_accuracy": 0.7767725538563084, | |
| "num_tokens": 26334470.0, | |
| "step": 1570 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 1570, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.184067262525866e+18, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |