Instructions to use propertypilot/property-pilot-generator with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use propertypilot/property-pilot-generator with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct") model = PeftModel.from_pretrained(base_model, "propertypilot/property-pilot-generator") - Transformers
How to use propertypilot/property-pilot-generator with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="propertypilot/property-pilot-generator") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("propertypilot/property-pilot-generator", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use propertypilot/property-pilot-generator with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "propertypilot/property-pilot-generator" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "propertypilot/property-pilot-generator", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/propertypilot/property-pilot-generator
- SGLang
How to use propertypilot/property-pilot-generator with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "propertypilot/property-pilot-generator" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "propertypilot/property-pilot-generator", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "propertypilot/property-pilot-generator" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "propertypilot/property-pilot-generator", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use propertypilot/property-pilot-generator with Docker Model Runner:
docker model run hf.co/propertypilot/property-pilot-generator
Add training results
Browse files- finetune_gen_results.json +463 -0
finetune_gen_results.json
ADDED
|
@@ -0,0 +1,463 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"base_model": "Qwen/Qwen2.5-1.5B-Instruct",
|
| 3 |
+
"n_train": 2170,
|
| 4 |
+
"n_val": 241,
|
| 5 |
+
"epochs": 3,
|
| 6 |
+
"lr": 0.0002,
|
| 7 |
+
"lora_r": 16,
|
| 8 |
+
"lora_alpha": 32,
|
| 9 |
+
"target_modules": [
|
| 10 |
+
"q_proj",
|
| 11 |
+
"k_proj",
|
| 12 |
+
"v_proj",
|
| 13 |
+
"o_proj"
|
| 14 |
+
],
|
| 15 |
+
"max_seq_length": 512,
|
| 16 |
+
"effective_batch_size": 16,
|
| 17 |
+
"train_loss": 0.764826238155365,
|
| 18 |
+
"train_runtime_hours": 0.6582819166666666,
|
| 19 |
+
"log_history": [
|
| 20 |
+
{
|
| 21 |
+
"loss": 2.552408981323242,
|
| 22 |
+
"grad_norm": 0.76171875,
|
| 23 |
+
"learning_rate": 8.571428571428571e-05,
|
| 24 |
+
"entropy": 1.8315464213490487,
|
| 25 |
+
"num_tokens": 76676.0,
|
| 26 |
+
"mean_token_accuracy": 0.50861811414361,
|
| 27 |
+
"epoch": 0.07373271889400922,
|
| 28 |
+
"step": 10
|
| 29 |
+
},
|
| 30 |
+
{
|
| 31 |
+
"loss": 2.1456417083740233,
|
| 32 |
+
"grad_norm": 0.95703125,
|
| 33 |
+
"learning_rate": 0.00018095238095238095,
|
| 34 |
+
"entropy": 1.9786892756819725,
|
| 35 |
+
"num_tokens": 154217.0,
|
| 36 |
+
"mean_token_accuracy": 0.5448866959661245,
|
| 37 |
+
"epoch": 0.14746543778801843,
|
| 38 |
+
"step": 20
|
| 39 |
+
},
|
| 40 |
+
{
|
| 41 |
+
"loss": 1.4322235107421875,
|
| 42 |
+
"grad_norm": 0.85546875,
|
| 43 |
+
"learning_rate": 0.00019586563307493542,
|
| 44 |
+
"entropy": 1.5200105249881743,
|
| 45 |
+
"num_tokens": 231047.0,
|
| 46 |
+
"mean_token_accuracy": 0.6601599544286728,
|
| 47 |
+
"epoch": 0.22119815668202766,
|
| 48 |
+
"step": 30
|
| 49 |
+
},
|
| 50 |
+
{
|
| 51 |
+
"loss": 0.9665801048278808,
|
| 52 |
+
"grad_norm": 0.51171875,
|
| 53 |
+
"learning_rate": 0.00019069767441860466,
|
| 54 |
+
"entropy": 0.990651074051857,
|
| 55 |
+
"num_tokens": 307705.0,
|
| 56 |
+
"mean_token_accuracy": 0.7566879086196423,
|
| 57 |
+
"epoch": 0.29493087557603687,
|
| 58 |
+
"step": 40
|
| 59 |
+
},
|
| 60 |
+
{
|
| 61 |
+
"loss": 0.8407919883728028,
|
| 62 |
+
"grad_norm": 0.36328125,
|
| 63 |
+
"learning_rate": 0.00018552971576227392,
|
| 64 |
+
"entropy": 0.8534275718033314,
|
| 65 |
+
"num_tokens": 384451.0,
|
| 66 |
+
"mean_token_accuracy": 0.7813827939331531,
|
| 67 |
+
"epoch": 0.3686635944700461,
|
| 68 |
+
"step": 50
|
| 69 |
+
},
|
| 70 |
+
{
|
| 71 |
+
"loss": 0.7797271728515625,
|
| 72 |
+
"grad_norm": 0.390625,
|
| 73 |
+
"learning_rate": 0.00018036175710594315,
|
| 74 |
+
"entropy": 0.7866893894970417,
|
| 75 |
+
"num_tokens": 461341.0,
|
| 76 |
+
"mean_token_accuracy": 0.7925485543906688,
|
| 77 |
+
"epoch": 0.4423963133640553,
|
| 78 |
+
"step": 60
|
| 79 |
+
},
|
| 80 |
+
{
|
| 81 |
+
"loss": 0.7610339641571044,
|
| 82 |
+
"grad_norm": 0.357421875,
|
| 83 |
+
"learning_rate": 0.00017519379844961242,
|
| 84 |
+
"entropy": 0.7790591172873974,
|
| 85 |
+
"num_tokens": 538835.0,
|
| 86 |
+
"mean_token_accuracy": 0.7936315566301346,
|
| 87 |
+
"epoch": 0.5161290322580645,
|
| 88 |
+
"step": 70
|
| 89 |
+
},
|
| 90 |
+
{
|
| 91 |
+
"loss": 0.7355214595794678,
|
| 92 |
+
"grad_norm": 0.306640625,
|
| 93 |
+
"learning_rate": 0.00017002583979328165,
|
| 94 |
+
"entropy": 0.7375507041811943,
|
| 95 |
+
"num_tokens": 615491.0,
|
| 96 |
+
"mean_token_accuracy": 0.8002951353788376,
|
| 97 |
+
"epoch": 0.5898617511520737,
|
| 98 |
+
"step": 80
|
| 99 |
+
},
|
| 100 |
+
{
|
| 101 |
+
"loss": 0.7126219749450684,
|
| 102 |
+
"grad_norm": 0.373046875,
|
| 103 |
+
"learning_rate": 0.00016485788113695092,
|
| 104 |
+
"entropy": 0.7339154161512852,
|
| 105 |
+
"num_tokens": 692464.0,
|
| 106 |
+
"mean_token_accuracy": 0.8024542592465878,
|
| 107 |
+
"epoch": 0.663594470046083,
|
| 108 |
+
"step": 90
|
| 109 |
+
},
|
| 110 |
+
{
|
| 111 |
+
"loss": 0.689023494720459,
|
| 112 |
+
"grad_norm": 0.353515625,
|
| 113 |
+
"learning_rate": 0.00015968992248062015,
|
| 114 |
+
"entropy": 0.7066651649773121,
|
| 115 |
+
"num_tokens": 770119.0,
|
| 116 |
+
"mean_token_accuracy": 0.8058759093284606,
|
| 117 |
+
"epoch": 0.7373271889400922,
|
| 118 |
+
"step": 100
|
| 119 |
+
},
|
| 120 |
+
{
|
| 121 |
+
"loss": 0.690799617767334,
|
| 122 |
+
"grad_norm": 0.330078125,
|
| 123 |
+
"learning_rate": 0.00015452196382428942,
|
| 124 |
+
"entropy": 0.7113537535071373,
|
| 125 |
+
"num_tokens": 847925.0,
|
| 126 |
+
"mean_token_accuracy": 0.804828480631113,
|
| 127 |
+
"epoch": 0.8110599078341014,
|
| 128 |
+
"step": 110
|
| 129 |
+
},
|
| 130 |
+
{
|
| 131 |
+
"loss": 0.6837788581848144,
|
| 132 |
+
"grad_norm": 0.306640625,
|
| 133 |
+
"learning_rate": 0.00014935400516795865,
|
| 134 |
+
"entropy": 0.6914405129849911,
|
| 135 |
+
"num_tokens": 925131.0,
|
| 136 |
+
"mean_token_accuracy": 0.8068704783916474,
|
| 137 |
+
"epoch": 0.8847926267281107,
|
| 138 |
+
"step": 120
|
| 139 |
+
},
|
| 140 |
+
{
|
| 141 |
+
"loss": 0.6697667598724365,
|
| 142 |
+
"grad_norm": 0.318359375,
|
| 143 |
+
"learning_rate": 0.00014418604651162791,
|
| 144 |
+
"entropy": 0.6796459473669529,
|
| 145 |
+
"num_tokens": 1002463.0,
|
| 146 |
+
"mean_token_accuracy": 0.808288037031889,
|
| 147 |
+
"epoch": 0.9585253456221198,
|
| 148 |
+
"step": 130
|
| 149 |
+
},
|
| 150 |
+
{
|
| 151 |
+
"eval_loss": 0.6677101254463196,
|
| 152 |
+
"eval_runtime": 29.1121,
|
| 153 |
+
"eval_samples_per_second": 8.278,
|
| 154 |
+
"eval_steps_per_second": 4.156,
|
| 155 |
+
"eval_entropy": 0.6754765791341293,
|
| 156 |
+
"eval_num_tokens": 1045851.0,
|
| 157 |
+
"eval_mean_token_accuracy": 0.8084481388084159,
|
| 158 |
+
"epoch": 1.0,
|
| 159 |
+
"step": 136
|
| 160 |
+
},
|
| 161 |
+
{
|
| 162 |
+
"loss": 0.6666770458221436,
|
| 163 |
+
"grad_norm": 0.330078125,
|
| 164 |
+
"learning_rate": 0.00013901808785529718,
|
| 165 |
+
"entropy": 0.6792283948365744,
|
| 166 |
+
"num_tokens": 1076868.0,
|
| 167 |
+
"mean_token_accuracy": 0.8102635524489663,
|
| 168 |
+
"epoch": 1.0294930875576036,
|
| 169 |
+
"step": 140
|
| 170 |
+
},
|
| 171 |
+
{
|
| 172 |
+
"loss": 0.6558178901672364,
|
| 173 |
+
"grad_norm": 0.33203125,
|
| 174 |
+
"learning_rate": 0.0001338501291989664,
|
| 175 |
+
"entropy": 0.6627626478672027,
|
| 176 |
+
"num_tokens": 1153869.0,
|
| 177 |
+
"mean_token_accuracy": 0.810472310334444,
|
| 178 |
+
"epoch": 1.103225806451613,
|
| 179 |
+
"step": 150
|
| 180 |
+
},
|
| 181 |
+
{
|
| 182 |
+
"loss": 0.6550488471984863,
|
| 183 |
+
"grad_norm": 0.326171875,
|
| 184 |
+
"learning_rate": 0.00012868217054263568,
|
| 185 |
+
"entropy": 0.6594419095665216,
|
| 186 |
+
"num_tokens": 1231453.0,
|
| 187 |
+
"mean_token_accuracy": 0.8117372930049896,
|
| 188 |
+
"epoch": 1.176958525345622,
|
| 189 |
+
"step": 160
|
| 190 |
+
},
|
| 191 |
+
{
|
| 192 |
+
"loss": 0.6612972736358642,
|
| 193 |
+
"grad_norm": 0.3828125,
|
| 194 |
+
"learning_rate": 0.0001235142118863049,
|
| 195 |
+
"entropy": 0.6753951165825128,
|
| 196 |
+
"num_tokens": 1309627.0,
|
| 197 |
+
"mean_token_accuracy": 0.8095706656575203,
|
| 198 |
+
"epoch": 1.2506912442396314,
|
| 199 |
+
"step": 170
|
| 200 |
+
},
|
| 201 |
+
{
|
| 202 |
+
"loss": 0.6569454669952393,
|
| 203 |
+
"grad_norm": 0.34765625,
|
| 204 |
+
"learning_rate": 0.00011834625322997418,
|
| 205 |
+
"entropy": 0.665694921836257,
|
| 206 |
+
"num_tokens": 1386811.0,
|
| 207 |
+
"mean_token_accuracy": 0.8107919678092003,
|
| 208 |
+
"epoch": 1.3244239631336405,
|
| 209 |
+
"step": 180
|
| 210 |
+
},
|
| 211 |
+
{
|
| 212 |
+
"loss": 0.6450295448303223,
|
| 213 |
+
"grad_norm": 0.353515625,
|
| 214 |
+
"learning_rate": 0.00011317829457364341,
|
| 215 |
+
"entropy": 0.648330107703805,
|
| 216 |
+
"num_tokens": 1463955.0,
|
| 217 |
+
"mean_token_accuracy": 0.8132139191031456,
|
| 218 |
+
"epoch": 1.3981566820276496,
|
| 219 |
+
"step": 190
|
| 220 |
+
},
|
| 221 |
+
{
|
| 222 |
+
"loss": 0.6420782566070556,
|
| 223 |
+
"grad_norm": 0.365234375,
|
| 224 |
+
"learning_rate": 0.00010801033591731266,
|
| 225 |
+
"entropy": 0.651269332319498,
|
| 226 |
+
"num_tokens": 1540151.0,
|
| 227 |
+
"mean_token_accuracy": 0.8131035573780536,
|
| 228 |
+
"epoch": 1.471889400921659,
|
| 229 |
+
"step": 200
|
| 230 |
+
},
|
| 231 |
+
{
|
| 232 |
+
"loss": 0.6521349430084229,
|
| 233 |
+
"grad_norm": 0.349609375,
|
| 234 |
+
"learning_rate": 0.00010284237726098191,
|
| 235 |
+
"entropy": 0.6608554765582084,
|
| 236 |
+
"num_tokens": 1616833.0,
|
| 237 |
+
"mean_token_accuracy": 0.8111298240721225,
|
| 238 |
+
"epoch": 1.5456221198156683,
|
| 239 |
+
"step": 210
|
| 240 |
+
},
|
| 241 |
+
{
|
| 242 |
+
"loss": 0.6140251159667969,
|
| 243 |
+
"grad_norm": 0.345703125,
|
| 244 |
+
"learning_rate": 9.767441860465116e-05,
|
| 245 |
+
"entropy": 0.6182018022984266,
|
| 246 |
+
"num_tokens": 1694024.0,
|
| 247 |
+
"mean_token_accuracy": 0.8197848223149776,
|
| 248 |
+
"epoch": 1.6193548387096774,
|
| 249 |
+
"step": 220
|
| 250 |
+
},
|
| 251 |
+
{
|
| 252 |
+
"loss": 0.6408394336700439,
|
| 253 |
+
"grad_norm": 0.34375,
|
| 254 |
+
"learning_rate": 9.250645994832042e-05,
|
| 255 |
+
"entropy": 0.6458881605416537,
|
| 256 |
+
"num_tokens": 1771607.0,
|
| 257 |
+
"mean_token_accuracy": 0.8150972366333008,
|
| 258 |
+
"epoch": 1.6930875576036866,
|
| 259 |
+
"step": 230
|
| 260 |
+
},
|
| 261 |
+
{
|
| 262 |
+
"loss": 0.6265644073486328,
|
| 263 |
+
"grad_norm": 0.353515625,
|
| 264 |
+
"learning_rate": 8.733850129198967e-05,
|
| 265 |
+
"entropy": 0.6397458579391241,
|
| 266 |
+
"num_tokens": 1847726.0,
|
| 267 |
+
"mean_token_accuracy": 0.8172210827469826,
|
| 268 |
+
"epoch": 1.766820276497696,
|
| 269 |
+
"step": 240
|
| 270 |
+
},
|
| 271 |
+
{
|
| 272 |
+
"loss": 0.6415011405944824,
|
| 273 |
+
"grad_norm": 0.384765625,
|
| 274 |
+
"learning_rate": 8.217054263565892e-05,
|
| 275 |
+
"entropy": 0.6451383080333472,
|
| 276 |
+
"num_tokens": 1924932.0,
|
| 277 |
+
"mean_token_accuracy": 0.8145086012780667,
|
| 278 |
+
"epoch": 1.840552995391705,
|
| 279 |
+
"step": 250
|
| 280 |
+
},
|
| 281 |
+
{
|
| 282 |
+
"loss": 0.6441933155059815,
|
| 283 |
+
"grad_norm": 0.34765625,
|
| 284 |
+
"learning_rate": 7.700258397932817e-05,
|
| 285 |
+
"entropy": 0.6579485025256873,
|
| 286 |
+
"num_tokens": 2002388.0,
|
| 287 |
+
"mean_token_accuracy": 0.8131789050996303,
|
| 288 |
+
"epoch": 1.9142857142857141,
|
| 289 |
+
"step": 260
|
| 290 |
+
},
|
| 291 |
+
{
|
| 292 |
+
"loss": 0.632361650466919,
|
| 293 |
+
"grad_norm": 0.369140625,
|
| 294 |
+
"learning_rate": 7.183462532299742e-05,
|
| 295 |
+
"entropy": 0.6430431701242924,
|
| 296 |
+
"num_tokens": 2079444.0,
|
| 297 |
+
"mean_token_accuracy": 0.8157039448618889,
|
| 298 |
+
"epoch": 1.9880184331797235,
|
| 299 |
+
"step": 270
|
| 300 |
+
},
|
| 301 |
+
{
|
| 302 |
+
"eval_loss": 0.6317952275276184,
|
| 303 |
+
"eval_runtime": 29.0711,
|
| 304 |
+
"eval_samples_per_second": 8.29,
|
| 305 |
+
"eval_steps_per_second": 4.162,
|
| 306 |
+
"eval_entropy": 0.6311489190937074,
|
| 307 |
+
"eval_num_tokens": 2091702.0,
|
| 308 |
+
"eval_mean_token_accuracy": 0.8150874223590883,
|
| 309 |
+
"epoch": 2.0,
|
| 310 |
+
"step": 272
|
| 311 |
+
},
|
| 312 |
+
{
|
| 313 |
+
"loss": 0.6199068546295166,
|
| 314 |
+
"grad_norm": 0.38671875,
|
| 315 |
+
"learning_rate": 6.666666666666667e-05,
|
| 316 |
+
"entropy": 0.6327911719873354,
|
| 317 |
+
"num_tokens": 2153507.0,
|
| 318 |
+
"mean_token_accuracy": 0.8170148621905934,
|
| 319 |
+
"epoch": 2.058986175115207,
|
| 320 |
+
"step": 280
|
| 321 |
+
},
|
| 322 |
+
{
|
| 323 |
+
"loss": 0.6268198013305664,
|
| 324 |
+
"grad_norm": 0.36328125,
|
| 325 |
+
"learning_rate": 6.149870801033592e-05,
|
| 326 |
+
"entropy": 0.6392732232809066,
|
| 327 |
+
"num_tokens": 2231255.0,
|
| 328 |
+
"mean_token_accuracy": 0.815488800406456,
|
| 329 |
+
"epoch": 2.1327188940092165,
|
| 330 |
+
"step": 290
|
| 331 |
+
},
|
| 332 |
+
{
|
| 333 |
+
"loss": 0.6272803783416748,
|
| 334 |
+
"grad_norm": 0.390625,
|
| 335 |
+
"learning_rate": 5.6330749354005176e-05,
|
| 336 |
+
"entropy": 0.6307303428649902,
|
| 337 |
+
"num_tokens": 2308122.0,
|
| 338 |
+
"mean_token_accuracy": 0.8148489408195019,
|
| 339 |
+
"epoch": 2.206451612903226,
|
| 340 |
+
"step": 300
|
| 341 |
+
},
|
| 342 |
+
{
|
| 343 |
+
"loss": 0.623120641708374,
|
| 344 |
+
"grad_norm": 0.384765625,
|
| 345 |
+
"learning_rate": 5.1162790697674425e-05,
|
| 346 |
+
"entropy": 0.6393906135112047,
|
| 347 |
+
"num_tokens": 2385089.0,
|
| 348 |
+
"mean_token_accuracy": 0.8190745867788791,
|
| 349 |
+
"epoch": 2.2801843317972352,
|
| 350 |
+
"step": 310
|
| 351 |
+
},
|
| 352 |
+
{
|
| 353 |
+
"loss": 0.6218606472015381,
|
| 354 |
+
"grad_norm": 0.361328125,
|
| 355 |
+
"learning_rate": 4.5994832041343674e-05,
|
| 356 |
+
"entropy": 0.631640600785613,
|
| 357 |
+
"num_tokens": 2462365.0,
|
| 358 |
+
"mean_token_accuracy": 0.8174237549304962,
|
| 359 |
+
"epoch": 2.353917050691244,
|
| 360 |
+
"step": 320
|
| 361 |
+
},
|
| 362 |
+
{
|
| 363 |
+
"loss": 0.6136510372161865,
|
| 364 |
+
"grad_norm": 0.34765625,
|
| 365 |
+
"learning_rate": 4.082687338501292e-05,
|
| 366 |
+
"entropy": 0.6208217907696962,
|
| 367 |
+
"num_tokens": 2539176.0,
|
| 368 |
+
"mean_token_accuracy": 0.8184750378131866,
|
| 369 |
+
"epoch": 2.4276497695852535,
|
| 370 |
+
"step": 330
|
| 371 |
+
},
|
| 372 |
+
{
|
| 373 |
+
"loss": 0.6091049194335938,
|
| 374 |
+
"grad_norm": 0.37109375,
|
| 375 |
+
"learning_rate": 3.565891472868217e-05,
|
| 376 |
+
"entropy": 0.6129930958151817,
|
| 377 |
+
"num_tokens": 2616393.0,
|
| 378 |
+
"mean_token_accuracy": 0.8213351160287857,
|
| 379 |
+
"epoch": 2.501382488479263,
|
| 380 |
+
"step": 340
|
| 381 |
+
},
|
| 382 |
+
{
|
| 383 |
+
"loss": 0.6212622642517089,
|
| 384 |
+
"grad_norm": 0.36328125,
|
| 385 |
+
"learning_rate": 3.0490956072351423e-05,
|
| 386 |
+
"entropy": 0.6352405440062284,
|
| 387 |
+
"num_tokens": 2693576.0,
|
| 388 |
+
"mean_token_accuracy": 0.8173153273761272,
|
| 389 |
+
"epoch": 2.5751152073732717,
|
| 390 |
+
"step": 350
|
| 391 |
+
},
|
| 392 |
+
{
|
| 393 |
+
"loss": 0.6044797897338867,
|
| 394 |
+
"grad_norm": 0.37890625,
|
| 395 |
+
"learning_rate": 2.5322997416020672e-05,
|
| 396 |
+
"entropy": 0.6222694877535104,
|
| 397 |
+
"num_tokens": 2771056.0,
|
| 398 |
+
"mean_token_accuracy": 0.8224904254078865,
|
| 399 |
+
"epoch": 2.648847926267281,
|
| 400 |
+
"step": 360
|
| 401 |
+
},
|
| 402 |
+
{
|
| 403 |
+
"loss": 0.6131954669952393,
|
| 404 |
+
"grad_norm": 0.369140625,
|
| 405 |
+
"learning_rate": 2.0155038759689922e-05,
|
| 406 |
+
"entropy": 0.6224170979112387,
|
| 407 |
+
"num_tokens": 2848650.0,
|
| 408 |
+
"mean_token_accuracy": 0.8191598542034626,
|
| 409 |
+
"epoch": 2.7225806451612904,
|
| 410 |
+
"step": 370
|
| 411 |
+
},
|
| 412 |
+
{
|
| 413 |
+
"loss": 0.6075997352600098,
|
| 414 |
+
"grad_norm": 0.380859375,
|
| 415 |
+
"learning_rate": 1.4987080103359175e-05,
|
| 416 |
+
"entropy": 0.6128175765275955,
|
| 417 |
+
"num_tokens": 2925519.0,
|
| 418 |
+
"mean_token_accuracy": 0.8221696980297566,
|
| 419 |
+
"epoch": 2.7963133640552993,
|
| 420 |
+
"step": 380
|
| 421 |
+
},
|
| 422 |
+
{
|
| 423 |
+
"loss": 0.6221665859222412,
|
| 424 |
+
"grad_norm": 0.36328125,
|
| 425 |
+
"learning_rate": 9.819121447028424e-06,
|
| 426 |
+
"entropy": 0.6337126068770885,
|
| 427 |
+
"num_tokens": 3002700.0,
|
| 428 |
+
"mean_token_accuracy": 0.8168866612017155,
|
| 429 |
+
"epoch": 2.8700460829493086,
|
| 430 |
+
"step": 390
|
| 431 |
+
},
|
| 432 |
+
{
|
| 433 |
+
"loss": 0.6017860889434814,
|
| 434 |
+
"grad_norm": 0.376953125,
|
| 435 |
+
"learning_rate": 4.651162790697674e-06,
|
| 436 |
+
"entropy": 0.6161656700074672,
|
| 437 |
+
"num_tokens": 3079293.0,
|
| 438 |
+
"mean_token_accuracy": 0.8221336029469967,
|
| 439 |
+
"epoch": 2.943778801843318,
|
| 440 |
+
"step": 400
|
| 441 |
+
},
|
| 442 |
+
{
|
| 443 |
+
"eval_loss": 0.6240883469581604,
|
| 444 |
+
"eval_runtime": 29.0986,
|
| 445 |
+
"eval_samples_per_second": 8.282,
|
| 446 |
+
"eval_steps_per_second": 4.158,
|
| 447 |
+
"eval_entropy": 0.6179555137295368,
|
| 448 |
+
"eval_num_tokens": 3137553.0,
|
| 449 |
+
"eval_mean_token_accuracy": 0.8167788755795187,
|
| 450 |
+
"epoch": 3.0,
|
| 451 |
+
"step": 408
|
| 452 |
+
},
|
| 453 |
+
{
|
| 454 |
+
"train_runtime": 2369.8149,
|
| 455 |
+
"train_samples_per_second": 2.747,
|
| 456 |
+
"train_steps_per_second": 0.172,
|
| 457 |
+
"total_flos": 2.571934125068083e+16,
|
| 458 |
+
"train_loss": 0.764826238155365,
|
| 459 |
+
"epoch": 3.0,
|
| 460 |
+
"step": 408
|
| 461 |
+
}
|
| 462 |
+
]
|
| 463 |
+
}
|