Instructions to use alexiaassis/Modelo-Treinado-Gemma3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use alexiaassis/Modelo-Treinado-Gemma3 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/gemma-3-12b-it-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "alexiaassis/Modelo-Treinado-Gemma3") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Studio
How to use alexiaassis/Modelo-Treinado-Gemma3 with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for alexiaassis/Modelo-Treinado-Gemma3 to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for alexiaassis/Modelo-Treinado-Gemma3 to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for alexiaassis/Modelo-Treinado-Gemma3 to start chatting
Load model with FastModel
pip install unsloth from unsloth import FastModel model, tokenizer = FastModel.from_pretrained( model_name="alexiaassis/Modelo-Treinado-Gemma3", max_seq_length=2048, )
Upload folder using huggingface_hub
Browse files- README.md +1 -2
- adapter_config.json +127 -127
- adapter_model.safetensors +1 -1
- all_results.json +6 -6
- chat_template.jinja +45 -7
- checkpoint-1000/adapter_config.json +127 -127
- checkpoint-1000/adapter_model.safetensors +1 -1
- checkpoint-1000/optimizer.pt +2 -2
- checkpoint-1000/scheduler.pt +1 -1
- checkpoint-1000/special_tokens_map.json +1 -1
- checkpoint-1000/tokenizer_config.json +1 -1
- checkpoint-1000/trainer_state.json +602 -602
- checkpoint-1000/training_args.bin +1 -1
- checkpoint-1395/adapter_config.json +127 -127
- checkpoint-1395/adapter_model.safetensors +1 -1
- checkpoint-1395/optimizer.pt +2 -2
- checkpoint-1395/scheduler.pt +1 -1
- checkpoint-1395/special_tokens_map.json +1 -1
- checkpoint-1395/tokenizer_config.json +1 -1
- checkpoint-1395/trainer_state.json +836 -836
- checkpoint-1395/training_args.bin +1 -1
- llamaboard_config.yaml +3 -3
- running_log.txt +225 -231
- special_tokens_map.json +1 -1
- tokenizer_config.json +1 -1
- train_results.json +6 -6
- trainer_log.jsonl +140 -140
- trainer_state.json +842 -842
- training_args.bin +1 -1
- training_args.yaml +3 -3
- training_loss.png +0 -0
README.md
CHANGED
|
@@ -36,7 +36,7 @@ More information needed
|
|
| 36 |
### Training hyperparameters
|
| 37 |
|
| 38 |
The following hyperparameters were used during training:
|
| 39 |
-
- learning_rate:
|
| 40 |
- train_batch_size: 4
|
| 41 |
- eval_batch_size: 8
|
| 42 |
- seed: 42
|
|
@@ -45,7 +45,6 @@ The following hyperparameters were used during training:
|
|
| 45 |
- optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
|
| 46 |
- lr_scheduler_type: cosine
|
| 47 |
- num_epochs: 3.0
|
| 48 |
-
- mixed_precision_training: Native AMP
|
| 49 |
|
| 50 |
### Training results
|
| 51 |
|
|
|
|
| 36 |
### Training hyperparameters
|
| 37 |
|
| 38 |
The following hyperparameters were used during training:
|
| 39 |
+
- learning_rate: 1e-05
|
| 40 |
- train_batch_size: 4
|
| 41 |
- eval_batch_size: 8
|
| 42 |
- seed: 42
|
|
|
|
| 45 |
- optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
|
| 46 |
- lr_scheduler_type: cosine
|
| 47 |
- num_epochs: 3.0
|
|
|
|
| 48 |
|
| 49 |
### Training results
|
| 50 |
|
adapter_config.json
CHANGED
|
@@ -28,154 +28,154 @@
|
|
| 28 |
"rank_pattern": {},
|
| 29 |
"revision": null,
|
| 30 |
"target_modules": [
|
| 31 |
-
"language_model.layers.6.self_attn.v_proj",
|
| 32 |
-
"37.self_attn.v_proj",
|
| 33 |
-
"46.self_attn.q_proj",
|
| 34 |
-
"32.self_attn.v_proj",
|
| 35 |
-
"29.self_attn.q_proj",
|
| 36 |
-
"language_model.layers.22.self_attn.v_proj",
|
| 37 |
-
"language_model.layers.26.self_attn.v_proj",
|
| 38 |
-
"language_model.layers.24.self_attn.v_proj",
|
| 39 |
-
"language_model.layers.9.self_attn.q_proj",
|
| 40 |
-
"27.self_attn.k_proj",
|
| 41 |
-
"47.self_attn.k_proj",
|
| 42 |
-
"language_model.layers.19.self_attn.k_proj",
|
| 43 |
-
"38.self_attn.q_proj",
|
| 44 |
-
"44.self_attn.k_proj",
|
| 45 |
-
"31.self_attn.q_proj",
|
| 46 |
-
"31.self_attn.v_proj",
|
| 47 |
-
"language_model.layers.4.self_attn.v_proj",
|
| 48 |
-
"40.self_attn.q_proj",
|
| 49 |
-
"language_model.layers.10.self_attn.k_proj",
|
| 50 |
-
"27.self_attn.q_proj",
|
| 51 |
-
"language_model.layers.6.self_attn.q_proj",
|
| 52 |
-
"language_model.layers.9.self_attn.k_proj",
|
| 53 |
"33.self_attn.q_proj",
|
| 54 |
-
"
|
| 55 |
-
"language_model.layers.
|
| 56 |
-
"language_model.layers.
|
| 57 |
-
"
|
| 58 |
-
"29.self_attn.k_proj",
|
| 59 |
-
"46.self_attn.k_proj",
|
| 60 |
-
"language_model.layers.26.self_attn.q_proj",
|
| 61 |
-
"33.self_attn.k_proj",
|
| 62 |
-
"language_model.layers.23.self_attn.v_proj",
|
| 63 |
-
"36.self_attn.q_proj",
|
| 64 |
-
"32.self_attn.q_proj",
|
| 65 |
-
"language_model.layers.23.self_attn.q_proj",
|
| 66 |
-
"29.self_attn.v_proj",
|
| 67 |
-
"language_model.layers.18.self_attn.k_proj",
|
| 68 |
-
"language_model.layers.21.self_attn.q_proj",
|
| 69 |
-
"40.self_attn.v_proj",
|
| 70 |
-
"language_model.layers.10.self_attn.q_proj",
|
| 71 |
-
"30.self_attn.k_proj",
|
| 72 |
-
"language_model.layers.25.self_attn.q_proj",
|
| 73 |
-
"language_model.layers.6.self_attn.k_proj",
|
| 74 |
-
"43.self_attn.k_proj",
|
| 75 |
-
"language_model.layers.14.self_attn.k_proj",
|
| 76 |
-
"language_model.layers.4.self_attn.q_proj",
|
| 77 |
-
"41.self_attn.k_proj",
|
| 78 |
-
"30.self_attn.v_proj",
|
| 79 |
-
"45.self_attn.q_proj",
|
| 80 |
-
"language_model.layers.18.self_attn.q_proj",
|
| 81 |
-
"language_model.layers.7.self_attn.v_proj",
|
| 82 |
-
"language_model.layers.25.self_attn.v_proj",
|
| 83 |
"language_model.layers.26.self_attn.k_proj",
|
| 84 |
-
"
|
| 85 |
-
"
|
| 86 |
-
"
|
| 87 |
-
"
|
| 88 |
-
"
|
| 89 |
-
"language_model.layers.
|
| 90 |
-
"
|
| 91 |
-
"
|
| 92 |
-
"language_model.layers.3.self_attn.v_proj",
|
| 93 |
-
"language_model.layers.12.self_attn.v_proj",
|
| 94 |
"language_model.layers.25.self_attn.k_proj",
|
| 95 |
-
"language_model.layers.
|
| 96 |
-
"
|
| 97 |
-
"language_model.layers.12.self_attn.k_proj",
|
| 98 |
-
"language_model.layers.14.self_attn.q_proj",
|
| 99 |
"42.self_attn.v_proj",
|
| 100 |
-
"
|
| 101 |
-
"language_model.layers.10.self_attn.v_proj",
|
| 102 |
-
"language_model.layers.11.self_attn.q_proj",
|
| 103 |
-
"36.self_attn.v_proj",
|
| 104 |
-
"44.self_attn.q_proj",
|
| 105 |
-
"language_model.layers.5.self_attn.k_proj",
|
| 106 |
-
"38.self_attn.v_proj",
|
| 107 |
-
"35.self_attn.q_proj",
|
| 108 |
"language_model.layers.15.self_attn.v_proj",
|
|
|
|
|
|
|
| 109 |
"45.self_attn.k_proj",
|
| 110 |
-
"o_proj",
|
| 111 |
-
"language_model.layers.7.self_attn.k_proj",
|
| 112 |
-
"language_model.layers.13.self_attn.v_proj",
|
| 113 |
-
"27.self_attn.v_proj",
|
| 114 |
-
"language_model.layers.8.self_attn.k_proj",
|
| 115 |
-
"language_model.layers.20.self_attn.k_proj",
|
| 116 |
-
"46.self_attn.v_proj",
|
| 117 |
"34.self_attn.v_proj",
|
|
|
|
|
|
|
|
|
|
| 118 |
"34.self_attn.q_proj",
|
| 119 |
-
"language_model.layers.12.self_attn.q_proj",
|
| 120 |
-
"language_model.layers.17.self_attn.k_proj",
|
| 121 |
"language_model.layers.2.self_attn.v_proj",
|
| 122 |
-
"
|
| 123 |
-
"
|
| 124 |
-
"
|
| 125 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
| 126 |
"39.self_attn.q_proj",
|
| 127 |
-
"language_model.layers.
|
| 128 |
-
"
|
| 129 |
-
"
|
| 130 |
-
"
|
| 131 |
-
"
|
| 132 |
-
"
|
| 133 |
"language_model.layers.2.self_attn.q_proj",
|
| 134 |
-
"
|
| 135 |
-
"
|
| 136 |
-
"language_model.layers.
|
|
|
|
|
|
|
|
|
|
|
|
|
| 137 |
"language_model.layers.13.self_attn.k_proj",
|
| 138 |
-
"
|
| 139 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 140 |
"language_model.layers.3.self_attn.q_proj",
|
| 141 |
-
"
|
| 142 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 143 |
"28.self_attn.k_proj",
|
| 144 |
-
"
|
| 145 |
-
"language_model.layers.19.self_attn.q_proj",
|
| 146 |
-
"language_model.layers.2.self_attn.k_proj",
|
| 147 |
-
"language_model.layers.1.self_attn.k_proj",
|
| 148 |
"language_model.layers.13.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 149 |
"language_model.layers.0.self_attn.q_proj",
|
| 150 |
-
"
|
| 151 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
| 152 |
"33.self_attn.v_proj",
|
| 153 |
-
"
|
| 154 |
-
"
|
| 155 |
-
"language_model.layers.
|
| 156 |
-
"language_model.layers.16.self_attn.k_proj",
|
| 157 |
-
"35.self_attn.k_proj",
|
| 158 |
-
"42.self_attn.q_proj",
|
| 159 |
-
"language_model.layers.1.self_attn.v_proj",
|
| 160 |
-
"34.self_attn.k_proj",
|
| 161 |
-
"43.self_attn.q_proj",
|
| 162 |
-
"language_model.layers.9.self_attn.v_proj",
|
| 163 |
"language_model.layers.17.self_attn.q_proj",
|
| 164 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 165 |
"38.self_attn.k_proj",
|
| 166 |
-
"language_model.layers.
|
| 167 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 168 |
"language_model.layers.7.self_attn.q_proj",
|
| 169 |
-
"
|
| 170 |
-
"language_model.layers.
|
| 171 |
-
"language_model.layers.
|
| 172 |
-
"
|
| 173 |
-
"language_model.layers.
|
| 174 |
-
"
|
| 175 |
-
"language_model.layers.
|
| 176 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 177 |
"35.self_attn.v_proj",
|
| 178 |
-
"language_model.layers.
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 179 |
],
|
| 180 |
"task_type": "CAUSAL_LM",
|
| 181 |
"trainable_token_indices": null,
|
|
|
|
| 28 |
"rank_pattern": {},
|
| 29 |
"revision": null,
|
| 30 |
"target_modules": [
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 31 |
"33.self_attn.q_proj",
|
| 32 |
+
"up_proj",
|
| 33 |
+
"language_model.layers.5.self_attn.k_proj",
|
| 34 |
+
"language_model.layers.11.self_attn.v_proj",
|
| 35 |
+
"32.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 36 |
"language_model.layers.26.self_attn.k_proj",
|
| 37 |
+
"38.self_attn.v_proj",
|
| 38 |
+
"36.self_attn.v_proj",
|
| 39 |
+
"39.self_attn.k_proj",
|
| 40 |
+
"language_model.layers.5.self_attn.q_proj",
|
| 41 |
+
"43.self_attn.k_proj",
|
| 42 |
+
"language_model.layers.16.self_attn.v_proj",
|
| 43 |
+
"37.self_attn.q_proj",
|
| 44 |
+
"language_model.layers.20.self_attn.k_proj",
|
|
|
|
|
|
|
| 45 |
"language_model.layers.25.self_attn.k_proj",
|
| 46 |
+
"language_model.layers.0.self_attn.k_proj",
|
| 47 |
+
"language_model.layers.8.self_attn.q_proj",
|
|
|
|
|
|
|
| 48 |
"42.self_attn.v_proj",
|
| 49 |
+
"38.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 50 |
"language_model.layers.15.self_attn.v_proj",
|
| 51 |
+
"language_model.layers.11.self_attn.k_proj",
|
| 52 |
+
"language_model.layers.21.self_attn.v_proj",
|
| 53 |
"45.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 54 |
"34.self_attn.v_proj",
|
| 55 |
+
"language_model.layers.16.self_attn.q_proj",
|
| 56 |
+
"language_model.layers.24.self_attn.q_proj",
|
| 57 |
+
"language_model.layers.19.self_attn.k_proj",
|
| 58 |
"34.self_attn.q_proj",
|
|
|
|
|
|
|
| 59 |
"language_model.layers.2.self_attn.v_proj",
|
| 60 |
+
"language_model.layers.6.self_attn.v_proj",
|
| 61 |
+
"33.self_attn.k_proj",
|
| 62 |
+
"32.self_attn.v_proj",
|
| 63 |
+
"41.self_attn.v_proj",
|
| 64 |
+
"language_model.layers.14.self_attn.q_proj",
|
| 65 |
+
"language_model.layers.23.self_attn.k_proj",
|
| 66 |
+
"30.self_attn.k_proj",
|
| 67 |
+
"40.self_attn.k_proj",
|
| 68 |
"39.self_attn.q_proj",
|
| 69 |
+
"language_model.layers.20.self_attn.q_proj",
|
| 70 |
+
"28.self_attn.v_proj",
|
| 71 |
+
"language_model.layers.8.self_attn.k_proj",
|
| 72 |
+
"language_model.layers.9.self_attn.k_proj",
|
| 73 |
+
"47.self_attn.k_proj",
|
| 74 |
+
"gate_proj",
|
| 75 |
"language_model.layers.2.self_attn.q_proj",
|
| 76 |
+
"language_model.layers.1.self_attn.q_proj",
|
| 77 |
+
"language_model.layers.7.self_attn.k_proj",
|
| 78 |
+
"language_model.layers.5.self_attn.v_proj",
|
| 79 |
+
"30.self_attn.q_proj",
|
| 80 |
+
"language_model.layers.7.self_attn.v_proj",
|
| 81 |
+
"45.self_attn.v_proj",
|
| 82 |
+
"language_model.layers.10.self_attn.q_proj",
|
| 83 |
"language_model.layers.13.self_attn.k_proj",
|
| 84 |
+
"43.self_attn.v_proj",
|
| 85 |
+
"44.self_attn.k_proj",
|
| 86 |
+
"43.self_attn.q_proj",
|
| 87 |
+
"language_model.layers.2.self_attn.k_proj",
|
| 88 |
+
"language_model.layers.10.self_attn.v_proj",
|
| 89 |
+
"language_model.layers.17.self_attn.k_proj",
|
| 90 |
+
"o_proj",
|
| 91 |
"language_model.layers.3.self_attn.q_proj",
|
| 92 |
+
"44.self_attn.q_proj",
|
| 93 |
+
"language_model.layers.18.self_attn.k_proj",
|
| 94 |
+
"language_model.layers.25.self_attn.v_proj",
|
| 95 |
+
"45.self_attn.q_proj",
|
| 96 |
+
"language_model.layers.12.self_attn.q_proj",
|
| 97 |
+
"29.self_attn.v_proj",
|
| 98 |
+
"language_model.layers.18.self_attn.v_proj",
|
| 99 |
+
"language_model.layers.15.self_attn.q_proj",
|
| 100 |
+
"down_proj",
|
| 101 |
+
"42.self_attn.q_proj",
|
| 102 |
+
"language_model.layers.8.self_attn.v_proj",
|
| 103 |
"28.self_attn.k_proj",
|
| 104 |
+
"31.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
| 105 |
"language_model.layers.13.self_attn.q_proj",
|
| 106 |
+
"language_model.layers.1.self_attn.v_proj",
|
| 107 |
+
"31.self_attn.k_proj",
|
| 108 |
+
"language_model.layers.20.self_attn.v_proj",
|
| 109 |
+
"language_model.layers.18.self_attn.q_proj",
|
| 110 |
+
"language_model.layers.23.self_attn.v_proj",
|
| 111 |
+
"language_model.layers.6.self_attn.q_proj",
|
| 112 |
+
"language_model.layers.10.self_attn.k_proj",
|
| 113 |
+
"language_model.layers.26.self_attn.v_proj",
|
| 114 |
+
"40.self_attn.q_proj",
|
| 115 |
+
"36.self_attn.k_proj",
|
| 116 |
+
"language_model.layers.13.self_attn.v_proj",
|
| 117 |
+
"language_model.layers.23.self_attn.q_proj",
|
| 118 |
+
"42.self_attn.k_proj",
|
| 119 |
+
"27.self_attn.v_proj",
|
| 120 |
+
"27.self_attn.k_proj",
|
| 121 |
+
"30.self_attn.v_proj",
|
| 122 |
+
"27.self_attn.q_proj",
|
| 123 |
"language_model.layers.0.self_attn.q_proj",
|
| 124 |
+
"language_model.layers.0.self_attn.v_proj",
|
| 125 |
+
"31.self_attn.v_proj",
|
| 126 |
+
"language_model.layers.4.self_attn.v_proj",
|
| 127 |
+
"language_model.layers.25.self_attn.q_proj",
|
| 128 |
+
"language_model.layers.22.self_attn.q_proj",
|
| 129 |
+
"language_model.layers.12.self_attn.v_proj",
|
| 130 |
"33.self_attn.v_proj",
|
| 131 |
+
"37.self_attn.v_proj",
|
| 132 |
+
"41.self_attn.k_proj",
|
| 133 |
+
"language_model.layers.4.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 134 |
"language_model.layers.17.self_attn.q_proj",
|
| 135 |
+
"language_model.layers.21.self_attn.q_proj",
|
| 136 |
+
"language_model.layers.16.self_attn.k_proj",
|
| 137 |
+
"language_model.layers.6.self_attn.k_proj",
|
| 138 |
+
"46.self_attn.k_proj",
|
| 139 |
+
"language_model.layers.14.self_attn.v_proj",
|
| 140 |
+
"40.self_attn.v_proj",
|
| 141 |
"38.self_attn.k_proj",
|
| 142 |
+
"language_model.layers.9.self_attn.q_proj",
|
| 143 |
+
"language_model.layers.26.self_attn.q_proj",
|
| 144 |
+
"language_model.layers.24.self_attn.v_proj",
|
| 145 |
+
"29.self_attn.q_proj",
|
| 146 |
+
"41.self_attn.q_proj",
|
| 147 |
+
"language_model.layers.19.self_attn.v_proj",
|
| 148 |
+
"language_model.layers.22.self_attn.v_proj",
|
| 149 |
+
"language_model.layers.21.self_attn.k_proj",
|
| 150 |
"language_model.layers.7.self_attn.q_proj",
|
| 151 |
+
"32.self_attn.q_proj",
|
| 152 |
+
"language_model.layers.15.self_attn.k_proj",
|
| 153 |
+
"language_model.layers.12.self_attn.k_proj",
|
| 154 |
+
"39.self_attn.v_proj",
|
| 155 |
+
"language_model.layers.9.self_attn.v_proj",
|
| 156 |
+
"35.self_attn.k_proj",
|
| 157 |
+
"language_model.layers.19.self_attn.q_proj",
|
| 158 |
+
"28.self_attn.q_proj",
|
| 159 |
+
"language_model.layers.14.self_attn.k_proj",
|
| 160 |
+
"language_model.layers.3.self_attn.k_proj",
|
| 161 |
+
"language_model.layers.1.self_attn.k_proj",
|
| 162 |
+
"37.self_attn.k_proj",
|
| 163 |
+
"34.self_attn.k_proj",
|
| 164 |
+
"language_model.layers.3.self_attn.v_proj",
|
| 165 |
+
"36.self_attn.q_proj",
|
| 166 |
+
"47.self_attn.v_proj",
|
| 167 |
+
"44.self_attn.v_proj",
|
| 168 |
+
"29.self_attn.k_proj",
|
| 169 |
+
"46.self_attn.q_proj",
|
| 170 |
+
"46.self_attn.v_proj",
|
| 171 |
"35.self_attn.v_proj",
|
| 172 |
+
"language_model.layers.22.self_attn.k_proj",
|
| 173 |
+
"language_model.layers.11.self_attn.q_proj",
|
| 174 |
+
"language_model.layers.4.self_attn.q_proj",
|
| 175 |
+
"35.self_attn.q_proj",
|
| 176 |
+
"47.self_attn.q_proj",
|
| 177 |
+
"language_model.layers.24.self_attn.k_proj",
|
| 178 |
+
"language_model.layers.17.self_attn.v_proj"
|
| 179 |
],
|
| 180 |
"task_type": "CAUSAL_LM",
|
| 181 |
"trainable_token_indices": null,
|
adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 131040264
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:67b732d78c0543831c924f30a3e9f4ece7c9a51233bdd3e7eb43386b23a450d0
|
| 3 |
size 131040264
|
all_results.json
CHANGED
|
@@ -1,9 +1,9 @@
|
|
| 1 |
{
|
| 2 |
"epoch": 3.0,
|
| 3 |
-
"num_input_tokens_seen":
|
| 4 |
-
"total_flos":
|
| 5 |
-
"train_loss": 0.
|
| 6 |
-
"train_runtime":
|
| 7 |
-
"train_samples_per_second":
|
| 8 |
-
"train_steps_per_second": 0.
|
| 9 |
}
|
|
|
|
| 1 |
{
|
| 2 |
"epoch": 3.0,
|
| 3 |
+
"num_input_tokens_seen": 6120032,
|
| 4 |
+
"total_flos": 4.115769119160883e+17,
|
| 5 |
+
"train_loss": 0.1491297289889346,
|
| 6 |
+
"train_runtime": 4379.932,
|
| 7 |
+
"train_samples_per_second": 2.545,
|
| 8 |
+
"train_steps_per_second": 0.318
|
| 9 |
}
|
chat_template.jinja
CHANGED
|
@@ -1,9 +1,47 @@
|
|
| 1 |
-
{
|
|
|
|
|
|
|
|
|
|
| 2 |
|
| 3 |
-
' %}
|
| 4 |
-
|
|
|
|
| 5 |
|
| 6 |
-
|
| 7 |
-
|
| 8 |
-
|
| 9 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{{ bos_token }}
|
| 2 |
+
{%- if messages[0]['role'] == 'system' -%}
|
| 3 |
+
{%- if messages[0]['content'] is string -%}
|
| 4 |
+
{%- set first_user_prefix = messages[0]['content'] + '
|
| 5 |
|
| 6 |
+
' -%}
|
| 7 |
+
{%- else -%}
|
| 8 |
+
{%- set first_user_prefix = messages[0]['content'][0]['text'] + '
|
| 9 |
|
| 10 |
+
' -%}
|
| 11 |
+
{%- endif -%}
|
| 12 |
+
{%- set loop_messages = messages[1:] -%}
|
| 13 |
+
{%- else -%}
|
| 14 |
+
{%- set first_user_prefix = "" -%}
|
| 15 |
+
{%- set loop_messages = messages -%}
|
| 16 |
+
{%- endif -%}
|
| 17 |
+
{%- for message in loop_messages -%}
|
| 18 |
+
{%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
|
| 19 |
+
{{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
|
| 20 |
+
{%- endif -%}
|
| 21 |
+
{%- if (message['role'] == 'assistant') -%}
|
| 22 |
+
{%- set role = "model" -%}
|
| 23 |
+
{%- else -%}
|
| 24 |
+
{%- set role = message['role'] -%}
|
| 25 |
+
{%- endif -%}
|
| 26 |
+
{{ '<start_of_turn>' + role + '
|
| 27 |
+
' + (first_user_prefix if loop.first else "") }}
|
| 28 |
+
{%- if message['content'] is string -%}
|
| 29 |
+
{{ message['content'] | trim }}
|
| 30 |
+
{%- elif message['content'] is iterable -%}
|
| 31 |
+
{%- for item in message['content'] -%}
|
| 32 |
+
{%- if item['type'] == 'image' -%}
|
| 33 |
+
{{ '<start_of_image>' }}
|
| 34 |
+
{%- elif item['type'] == 'text' -%}
|
| 35 |
+
{{ item['text'] | trim }}
|
| 36 |
+
{%- endif -%}
|
| 37 |
+
{%- endfor -%}
|
| 38 |
+
{%- else -%}
|
| 39 |
+
{{ raise_exception("Invalid content type") }}
|
| 40 |
+
{%- endif -%}
|
| 41 |
+
{{ '<end_of_turn>
|
| 42 |
+
' }}
|
| 43 |
+
{%- endfor -%}
|
| 44 |
+
{%- if add_generation_prompt -%}
|
| 45 |
+
{{'<start_of_turn>model
|
| 46 |
+
'}}
|
| 47 |
+
{%- endif -%}
|
checkpoint-1000/adapter_config.json
CHANGED
|
@@ -28,154 +28,154 @@
|
|
| 28 |
"rank_pattern": {},
|
| 29 |
"revision": null,
|
| 30 |
"target_modules": [
|
| 31 |
-
"language_model.layers.6.self_attn.v_proj",
|
| 32 |
-
"37.self_attn.v_proj",
|
| 33 |
-
"46.self_attn.q_proj",
|
| 34 |
-
"32.self_attn.v_proj",
|
| 35 |
-
"29.self_attn.q_proj",
|
| 36 |
-
"language_model.layers.22.self_attn.v_proj",
|
| 37 |
-
"language_model.layers.26.self_attn.v_proj",
|
| 38 |
-
"language_model.layers.24.self_attn.v_proj",
|
| 39 |
-
"language_model.layers.9.self_attn.q_proj",
|
| 40 |
-
"27.self_attn.k_proj",
|
| 41 |
-
"47.self_attn.k_proj",
|
| 42 |
-
"language_model.layers.19.self_attn.k_proj",
|
| 43 |
-
"38.self_attn.q_proj",
|
| 44 |
-
"44.self_attn.k_proj",
|
| 45 |
-
"31.self_attn.q_proj",
|
| 46 |
-
"31.self_attn.v_proj",
|
| 47 |
-
"language_model.layers.4.self_attn.v_proj",
|
| 48 |
-
"40.self_attn.q_proj",
|
| 49 |
-
"language_model.layers.10.self_attn.k_proj",
|
| 50 |
-
"27.self_attn.q_proj",
|
| 51 |
-
"language_model.layers.6.self_attn.q_proj",
|
| 52 |
-
"language_model.layers.9.self_attn.k_proj",
|
| 53 |
"33.self_attn.q_proj",
|
| 54 |
-
"
|
| 55 |
-
"language_model.layers.
|
| 56 |
-
"language_model.layers.
|
| 57 |
-
"
|
| 58 |
-
"29.self_attn.k_proj",
|
| 59 |
-
"46.self_attn.k_proj",
|
| 60 |
-
"language_model.layers.26.self_attn.q_proj",
|
| 61 |
-
"33.self_attn.k_proj",
|
| 62 |
-
"language_model.layers.23.self_attn.v_proj",
|
| 63 |
-
"36.self_attn.q_proj",
|
| 64 |
-
"32.self_attn.q_proj",
|
| 65 |
-
"language_model.layers.23.self_attn.q_proj",
|
| 66 |
-
"29.self_attn.v_proj",
|
| 67 |
-
"language_model.layers.18.self_attn.k_proj",
|
| 68 |
-
"language_model.layers.21.self_attn.q_proj",
|
| 69 |
-
"40.self_attn.v_proj",
|
| 70 |
-
"language_model.layers.10.self_attn.q_proj",
|
| 71 |
-
"30.self_attn.k_proj",
|
| 72 |
-
"language_model.layers.25.self_attn.q_proj",
|
| 73 |
-
"language_model.layers.6.self_attn.k_proj",
|
| 74 |
-
"43.self_attn.k_proj",
|
| 75 |
-
"language_model.layers.14.self_attn.k_proj",
|
| 76 |
-
"language_model.layers.4.self_attn.q_proj",
|
| 77 |
-
"41.self_attn.k_proj",
|
| 78 |
-
"30.self_attn.v_proj",
|
| 79 |
-
"45.self_attn.q_proj",
|
| 80 |
-
"language_model.layers.18.self_attn.q_proj",
|
| 81 |
-
"language_model.layers.7.self_attn.v_proj",
|
| 82 |
-
"language_model.layers.25.self_attn.v_proj",
|
| 83 |
"language_model.layers.26.self_attn.k_proj",
|
| 84 |
-
"
|
| 85 |
-
"
|
| 86 |
-
"
|
| 87 |
-
"
|
| 88 |
-
"
|
| 89 |
-
"language_model.layers.
|
| 90 |
-
"
|
| 91 |
-
"
|
| 92 |
-
"language_model.layers.3.self_attn.v_proj",
|
| 93 |
-
"language_model.layers.12.self_attn.v_proj",
|
| 94 |
"language_model.layers.25.self_attn.k_proj",
|
| 95 |
-
"language_model.layers.
|
| 96 |
-
"
|
| 97 |
-
"language_model.layers.12.self_attn.k_proj",
|
| 98 |
-
"language_model.layers.14.self_attn.q_proj",
|
| 99 |
"42.self_attn.v_proj",
|
| 100 |
-
"
|
| 101 |
-
"language_model.layers.10.self_attn.v_proj",
|
| 102 |
-
"language_model.layers.11.self_attn.q_proj",
|
| 103 |
-
"36.self_attn.v_proj",
|
| 104 |
-
"44.self_attn.q_proj",
|
| 105 |
-
"language_model.layers.5.self_attn.k_proj",
|
| 106 |
-
"38.self_attn.v_proj",
|
| 107 |
-
"35.self_attn.q_proj",
|
| 108 |
"language_model.layers.15.self_attn.v_proj",
|
|
|
|
|
|
|
| 109 |
"45.self_attn.k_proj",
|
| 110 |
-
"o_proj",
|
| 111 |
-
"language_model.layers.7.self_attn.k_proj",
|
| 112 |
-
"language_model.layers.13.self_attn.v_proj",
|
| 113 |
-
"27.self_attn.v_proj",
|
| 114 |
-
"language_model.layers.8.self_attn.k_proj",
|
| 115 |
-
"language_model.layers.20.self_attn.k_proj",
|
| 116 |
-
"46.self_attn.v_proj",
|
| 117 |
"34.self_attn.v_proj",
|
|
|
|
|
|
|
|
|
|
| 118 |
"34.self_attn.q_proj",
|
| 119 |
-
"language_model.layers.12.self_attn.q_proj",
|
| 120 |
-
"language_model.layers.17.self_attn.k_proj",
|
| 121 |
"language_model.layers.2.self_attn.v_proj",
|
| 122 |
-
"
|
| 123 |
-
"
|
| 124 |
-
"
|
| 125 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
| 126 |
"39.self_attn.q_proj",
|
| 127 |
-
"language_model.layers.
|
| 128 |
-
"
|
| 129 |
-
"
|
| 130 |
-
"
|
| 131 |
-
"
|
| 132 |
-
"
|
| 133 |
"language_model.layers.2.self_attn.q_proj",
|
| 134 |
-
"
|
| 135 |
-
"
|
| 136 |
-
"language_model.layers.
|
|
|
|
|
|
|
|
|
|
|
|
|
| 137 |
"language_model.layers.13.self_attn.k_proj",
|
| 138 |
-
"
|
| 139 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 140 |
"language_model.layers.3.self_attn.q_proj",
|
| 141 |
-
"
|
| 142 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 143 |
"28.self_attn.k_proj",
|
| 144 |
-
"
|
| 145 |
-
"language_model.layers.19.self_attn.q_proj",
|
| 146 |
-
"language_model.layers.2.self_attn.k_proj",
|
| 147 |
-
"language_model.layers.1.self_attn.k_proj",
|
| 148 |
"language_model.layers.13.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 149 |
"language_model.layers.0.self_attn.q_proj",
|
| 150 |
-
"
|
| 151 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
| 152 |
"33.self_attn.v_proj",
|
| 153 |
-
"
|
| 154 |
-
"
|
| 155 |
-
"language_model.layers.
|
| 156 |
-
"language_model.layers.16.self_attn.k_proj",
|
| 157 |
-
"35.self_attn.k_proj",
|
| 158 |
-
"42.self_attn.q_proj",
|
| 159 |
-
"language_model.layers.1.self_attn.v_proj",
|
| 160 |
-
"34.self_attn.k_proj",
|
| 161 |
-
"43.self_attn.q_proj",
|
| 162 |
-
"language_model.layers.9.self_attn.v_proj",
|
| 163 |
"language_model.layers.17.self_attn.q_proj",
|
| 164 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 165 |
"38.self_attn.k_proj",
|
| 166 |
-
"language_model.layers.
|
| 167 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 168 |
"language_model.layers.7.self_attn.q_proj",
|
| 169 |
-
"
|
| 170 |
-
"language_model.layers.
|
| 171 |
-
"language_model.layers.
|
| 172 |
-
"
|
| 173 |
-
"language_model.layers.
|
| 174 |
-
"
|
| 175 |
-
"language_model.layers.
|
| 176 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 177 |
"35.self_attn.v_proj",
|
| 178 |
-
"language_model.layers.
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 179 |
],
|
| 180 |
"task_type": "CAUSAL_LM",
|
| 181 |
"trainable_token_indices": null,
|
|
|
|
| 28 |
"rank_pattern": {},
|
| 29 |
"revision": null,
|
| 30 |
"target_modules": [
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 31 |
"33.self_attn.q_proj",
|
| 32 |
+
"up_proj",
|
| 33 |
+
"language_model.layers.5.self_attn.k_proj",
|
| 34 |
+
"language_model.layers.11.self_attn.v_proj",
|
| 35 |
+
"32.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 36 |
"language_model.layers.26.self_attn.k_proj",
|
| 37 |
+
"38.self_attn.v_proj",
|
| 38 |
+
"36.self_attn.v_proj",
|
| 39 |
+
"39.self_attn.k_proj",
|
| 40 |
+
"language_model.layers.5.self_attn.q_proj",
|
| 41 |
+
"43.self_attn.k_proj",
|
| 42 |
+
"language_model.layers.16.self_attn.v_proj",
|
| 43 |
+
"37.self_attn.q_proj",
|
| 44 |
+
"language_model.layers.20.self_attn.k_proj",
|
|
|
|
|
|
|
| 45 |
"language_model.layers.25.self_attn.k_proj",
|
| 46 |
+
"language_model.layers.0.self_attn.k_proj",
|
| 47 |
+
"language_model.layers.8.self_attn.q_proj",
|
|
|
|
|
|
|
| 48 |
"42.self_attn.v_proj",
|
| 49 |
+
"38.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 50 |
"language_model.layers.15.self_attn.v_proj",
|
| 51 |
+
"language_model.layers.11.self_attn.k_proj",
|
| 52 |
+
"language_model.layers.21.self_attn.v_proj",
|
| 53 |
"45.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 54 |
"34.self_attn.v_proj",
|
| 55 |
+
"language_model.layers.16.self_attn.q_proj",
|
| 56 |
+
"language_model.layers.24.self_attn.q_proj",
|
| 57 |
+
"language_model.layers.19.self_attn.k_proj",
|
| 58 |
"34.self_attn.q_proj",
|
|
|
|
|
|
|
| 59 |
"language_model.layers.2.self_attn.v_proj",
|
| 60 |
+
"language_model.layers.6.self_attn.v_proj",
|
| 61 |
+
"33.self_attn.k_proj",
|
| 62 |
+
"32.self_attn.v_proj",
|
| 63 |
+
"41.self_attn.v_proj",
|
| 64 |
+
"language_model.layers.14.self_attn.q_proj",
|
| 65 |
+
"language_model.layers.23.self_attn.k_proj",
|
| 66 |
+
"30.self_attn.k_proj",
|
| 67 |
+
"40.self_attn.k_proj",
|
| 68 |
"39.self_attn.q_proj",
|
| 69 |
+
"language_model.layers.20.self_attn.q_proj",
|
| 70 |
+
"28.self_attn.v_proj",
|
| 71 |
+
"language_model.layers.8.self_attn.k_proj",
|
| 72 |
+
"language_model.layers.9.self_attn.k_proj",
|
| 73 |
+
"47.self_attn.k_proj",
|
| 74 |
+
"gate_proj",
|
| 75 |
"language_model.layers.2.self_attn.q_proj",
|
| 76 |
+
"language_model.layers.1.self_attn.q_proj",
|
| 77 |
+
"language_model.layers.7.self_attn.k_proj",
|
| 78 |
+
"language_model.layers.5.self_attn.v_proj",
|
| 79 |
+
"30.self_attn.q_proj",
|
| 80 |
+
"language_model.layers.7.self_attn.v_proj",
|
| 81 |
+
"45.self_attn.v_proj",
|
| 82 |
+
"language_model.layers.10.self_attn.q_proj",
|
| 83 |
"language_model.layers.13.self_attn.k_proj",
|
| 84 |
+
"43.self_attn.v_proj",
|
| 85 |
+
"44.self_attn.k_proj",
|
| 86 |
+
"43.self_attn.q_proj",
|
| 87 |
+
"language_model.layers.2.self_attn.k_proj",
|
| 88 |
+
"language_model.layers.10.self_attn.v_proj",
|
| 89 |
+
"language_model.layers.17.self_attn.k_proj",
|
| 90 |
+
"o_proj",
|
| 91 |
"language_model.layers.3.self_attn.q_proj",
|
| 92 |
+
"44.self_attn.q_proj",
|
| 93 |
+
"language_model.layers.18.self_attn.k_proj",
|
| 94 |
+
"language_model.layers.25.self_attn.v_proj",
|
| 95 |
+
"45.self_attn.q_proj",
|
| 96 |
+
"language_model.layers.12.self_attn.q_proj",
|
| 97 |
+
"29.self_attn.v_proj",
|
| 98 |
+
"language_model.layers.18.self_attn.v_proj",
|
| 99 |
+
"language_model.layers.15.self_attn.q_proj",
|
| 100 |
+
"down_proj",
|
| 101 |
+
"42.self_attn.q_proj",
|
| 102 |
+
"language_model.layers.8.self_attn.v_proj",
|
| 103 |
"28.self_attn.k_proj",
|
| 104 |
+
"31.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
| 105 |
"language_model.layers.13.self_attn.q_proj",
|
| 106 |
+
"language_model.layers.1.self_attn.v_proj",
|
| 107 |
+
"31.self_attn.k_proj",
|
| 108 |
+
"language_model.layers.20.self_attn.v_proj",
|
| 109 |
+
"language_model.layers.18.self_attn.q_proj",
|
| 110 |
+
"language_model.layers.23.self_attn.v_proj",
|
| 111 |
+
"language_model.layers.6.self_attn.q_proj",
|
| 112 |
+
"language_model.layers.10.self_attn.k_proj",
|
| 113 |
+
"language_model.layers.26.self_attn.v_proj",
|
| 114 |
+
"40.self_attn.q_proj",
|
| 115 |
+
"36.self_attn.k_proj",
|
| 116 |
+
"language_model.layers.13.self_attn.v_proj",
|
| 117 |
+
"language_model.layers.23.self_attn.q_proj",
|
| 118 |
+
"42.self_attn.k_proj",
|
| 119 |
+
"27.self_attn.v_proj",
|
| 120 |
+
"27.self_attn.k_proj",
|
| 121 |
+
"30.self_attn.v_proj",
|
| 122 |
+
"27.self_attn.q_proj",
|
| 123 |
"language_model.layers.0.self_attn.q_proj",
|
| 124 |
+
"language_model.layers.0.self_attn.v_proj",
|
| 125 |
+
"31.self_attn.v_proj",
|
| 126 |
+
"language_model.layers.4.self_attn.v_proj",
|
| 127 |
+
"language_model.layers.25.self_attn.q_proj",
|
| 128 |
+
"language_model.layers.22.self_attn.q_proj",
|
| 129 |
+
"language_model.layers.12.self_attn.v_proj",
|
| 130 |
"33.self_attn.v_proj",
|
| 131 |
+
"37.self_attn.v_proj",
|
| 132 |
+
"41.self_attn.k_proj",
|
| 133 |
+
"language_model.layers.4.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 134 |
"language_model.layers.17.self_attn.q_proj",
|
| 135 |
+
"language_model.layers.21.self_attn.q_proj",
|
| 136 |
+
"language_model.layers.16.self_attn.k_proj",
|
| 137 |
+
"language_model.layers.6.self_attn.k_proj",
|
| 138 |
+
"46.self_attn.k_proj",
|
| 139 |
+
"language_model.layers.14.self_attn.v_proj",
|
| 140 |
+
"40.self_attn.v_proj",
|
| 141 |
"38.self_attn.k_proj",
|
| 142 |
+
"language_model.layers.9.self_attn.q_proj",
|
| 143 |
+
"language_model.layers.26.self_attn.q_proj",
|
| 144 |
+
"language_model.layers.24.self_attn.v_proj",
|
| 145 |
+
"29.self_attn.q_proj",
|
| 146 |
+
"41.self_attn.q_proj",
|
| 147 |
+
"language_model.layers.19.self_attn.v_proj",
|
| 148 |
+
"language_model.layers.22.self_attn.v_proj",
|
| 149 |
+
"language_model.layers.21.self_attn.k_proj",
|
| 150 |
"language_model.layers.7.self_attn.q_proj",
|
| 151 |
+
"32.self_attn.q_proj",
|
| 152 |
+
"language_model.layers.15.self_attn.k_proj",
|
| 153 |
+
"language_model.layers.12.self_attn.k_proj",
|
| 154 |
+
"39.self_attn.v_proj",
|
| 155 |
+
"language_model.layers.9.self_attn.v_proj",
|
| 156 |
+
"35.self_attn.k_proj",
|
| 157 |
+
"language_model.layers.19.self_attn.q_proj",
|
| 158 |
+
"28.self_attn.q_proj",
|
| 159 |
+
"language_model.layers.14.self_attn.k_proj",
|
| 160 |
+
"language_model.layers.3.self_attn.k_proj",
|
| 161 |
+
"language_model.layers.1.self_attn.k_proj",
|
| 162 |
+
"37.self_attn.k_proj",
|
| 163 |
+
"34.self_attn.k_proj",
|
| 164 |
+
"language_model.layers.3.self_attn.v_proj",
|
| 165 |
+
"36.self_attn.q_proj",
|
| 166 |
+
"47.self_attn.v_proj",
|
| 167 |
+
"44.self_attn.v_proj",
|
| 168 |
+
"29.self_attn.k_proj",
|
| 169 |
+
"46.self_attn.q_proj",
|
| 170 |
+
"46.self_attn.v_proj",
|
| 171 |
"35.self_attn.v_proj",
|
| 172 |
+
"language_model.layers.22.self_attn.k_proj",
|
| 173 |
+
"language_model.layers.11.self_attn.q_proj",
|
| 174 |
+
"language_model.layers.4.self_attn.q_proj",
|
| 175 |
+
"35.self_attn.q_proj",
|
| 176 |
+
"47.self_attn.q_proj",
|
| 177 |
+
"language_model.layers.24.self_attn.k_proj",
|
| 178 |
+
"language_model.layers.17.self_attn.v_proj"
|
| 179 |
],
|
| 180 |
"task_type": "CAUSAL_LM",
|
| 181 |
"trainable_token_indices": null,
|
checkpoint-1000/adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 131040264
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:180f54d28b5633f2269d9231c9d0b21f0454ad53695a3c019752f918b17a014f
|
| 3 |
size 131040264
|
checkpoint-1000/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:33d232d1cac1e7edb014c27ff65c23267d600276726497e1f0e99842835ec818
|
| 3 |
+
size 262448707
|
checkpoint-1000/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5ccd010e73e458407adaebd742d06d98855c8b6ddd52c61099f6bbc2c2481526
|
| 3 |
size 1465
|
checkpoint-1000/special_tokens_map.json
CHANGED
|
@@ -9,7 +9,7 @@
|
|
| 9 |
},
|
| 10 |
"eoi_token": "<end_of_image>",
|
| 11 |
"eos_token": {
|
| 12 |
-
"content": "<
|
| 13 |
"lstrip": false,
|
| 14 |
"normalized": false,
|
| 15 |
"rstrip": false,
|
|
|
|
| 9 |
},
|
| 10 |
"eoi_token": "<end_of_image>",
|
| 11 |
"eos_token": {
|
| 12 |
+
"content": "<end_of_turn>",
|
| 13 |
"lstrip": false,
|
| 14 |
"normalized": false,
|
| 15 |
"rstrip": false,
|
checkpoint-1000/tokenizer_config.json
CHANGED
|
@@ -51327,7 +51327,7 @@
|
|
| 51327 |
"bos_token": "<bos>",
|
| 51328 |
"clean_up_tokenization_spaces": false,
|
| 51329 |
"eoi_token": "<end_of_image>",
|
| 51330 |
-
"eos_token": "<
|
| 51331 |
"extra_special_tokens": {
|
| 51332 |
"boi_token": "<start_of_image>",
|
| 51333 |
"eoi_token": "<end_of_image>",
|
|
|
|
| 51327 |
"bos_token": "<bos>",
|
| 51328 |
"clean_up_tokenization_spaces": false,
|
| 51329 |
"eoi_token": "<end_of_image>",
|
| 51330 |
+
"eos_token": "<end_of_turn>",
|
| 51331 |
"extra_special_tokens": {
|
| 51332 |
"boi_token": "<start_of_image>",
|
| 51333 |
"eoi_token": "<end_of_image>",
|
checkpoint-1000/trainer_state.json
CHANGED
|
@@ -11,1008 +11,1008 @@
|
|
| 11 |
"log_history": [
|
| 12 |
{
|
| 13 |
"epoch": 0.021528525296017224,
|
| 14 |
-
"grad_norm":
|
| 15 |
-
"learning_rate":
|
| 16 |
-
"loss":
|
| 17 |
-
"num_input_tokens_seen":
|
| 18 |
"step": 10,
|
| 19 |
-
"train_runtime":
|
| 20 |
-
"train_tokens_per_second":
|
| 21 |
},
|
| 22 |
{
|
| 23 |
"epoch": 0.04305705059203445,
|
| 24 |
-
"grad_norm":
|
| 25 |
-
"learning_rate":
|
| 26 |
-
"loss": 0.
|
| 27 |
-
"num_input_tokens_seen":
|
| 28 |
"step": 20,
|
| 29 |
-
"train_runtime":
|
| 30 |
-
"train_tokens_per_second":
|
| 31 |
},
|
| 32 |
{
|
| 33 |
"epoch": 0.06458557588805167,
|
| 34 |
-
"grad_norm":
|
| 35 |
-
"learning_rate":
|
| 36 |
-
"loss": 0.
|
| 37 |
-
"num_input_tokens_seen":
|
| 38 |
"step": 30,
|
| 39 |
-
"train_runtime":
|
| 40 |
-
"train_tokens_per_second":
|
| 41 |
},
|
| 42 |
{
|
| 43 |
"epoch": 0.0861141011840689,
|
| 44 |
-
"grad_norm":
|
| 45 |
-
"learning_rate":
|
| 46 |
-
"loss": 0.
|
| 47 |
-
"num_input_tokens_seen":
|
| 48 |
"step": 40,
|
| 49 |
-
"train_runtime":
|
| 50 |
-
"train_tokens_per_second":
|
| 51 |
},
|
| 52 |
{
|
| 53 |
"epoch": 0.10764262648008611,
|
| 54 |
-
"grad_norm":
|
| 55 |
-
"learning_rate":
|
| 56 |
-
"loss": 0.
|
| 57 |
-
"num_input_tokens_seen":
|
| 58 |
"step": 50,
|
| 59 |
-
"train_runtime":
|
| 60 |
-
"train_tokens_per_second":
|
| 61 |
},
|
| 62 |
{
|
| 63 |
"epoch": 0.12917115177610333,
|
| 64 |
-
"grad_norm":
|
| 65 |
-
"learning_rate":
|
| 66 |
-
"loss": 0.
|
| 67 |
-
"num_input_tokens_seen":
|
| 68 |
"step": 60,
|
| 69 |
-
"train_runtime":
|
| 70 |
-
"train_tokens_per_second":
|
| 71 |
},
|
| 72 |
{
|
| 73 |
"epoch": 0.15069967707212056,
|
| 74 |
-
"grad_norm":
|
| 75 |
-
"learning_rate":
|
| 76 |
-
"loss": 0.
|
| 77 |
-
"num_input_tokens_seen":
|
| 78 |
"step": 70,
|
| 79 |
-
"train_runtime":
|
| 80 |
-
"train_tokens_per_second":
|
| 81 |
},
|
| 82 |
{
|
| 83 |
"epoch": 0.1722282023681378,
|
| 84 |
-
"grad_norm":
|
| 85 |
-
"learning_rate":
|
| 86 |
-
"loss": 0.
|
| 87 |
-
"num_input_tokens_seen":
|
| 88 |
"step": 80,
|
| 89 |
-
"train_runtime":
|
| 90 |
-
"train_tokens_per_second":
|
| 91 |
},
|
| 92 |
{
|
| 93 |
"epoch": 0.193756727664155,
|
| 94 |
-
"grad_norm":
|
| 95 |
-
"learning_rate":
|
| 96 |
-
"loss": 0.
|
| 97 |
-
"num_input_tokens_seen":
|
| 98 |
"step": 90,
|
| 99 |
-
"train_runtime":
|
| 100 |
-
"train_tokens_per_second":
|
| 101 |
},
|
| 102 |
{
|
| 103 |
"epoch": 0.21528525296017223,
|
| 104 |
-
"grad_norm":
|
| 105 |
-
"learning_rate":
|
| 106 |
-
"loss": 0.
|
| 107 |
-
"num_input_tokens_seen":
|
| 108 |
"step": 100,
|
| 109 |
-
"train_runtime":
|
| 110 |
-
"train_tokens_per_second":
|
| 111 |
},
|
| 112 |
{
|
| 113 |
"epoch": 0.23681377825618946,
|
| 114 |
-
"grad_norm":
|
| 115 |
-
"learning_rate":
|
| 116 |
-
"loss": 0.
|
| 117 |
-
"num_input_tokens_seen":
|
| 118 |
"step": 110,
|
| 119 |
-
"train_runtime":
|
| 120 |
-
"train_tokens_per_second":
|
| 121 |
},
|
| 122 |
{
|
| 123 |
"epoch": 0.25834230355220666,
|
| 124 |
-
"grad_norm":
|
| 125 |
-
"learning_rate":
|
| 126 |
-
"loss": 0.
|
| 127 |
-
"num_input_tokens_seen":
|
| 128 |
"step": 120,
|
| 129 |
-
"train_runtime":
|
| 130 |
-
"train_tokens_per_second":
|
| 131 |
},
|
| 132 |
{
|
| 133 |
"epoch": 0.2798708288482239,
|
| 134 |
-
"grad_norm":
|
| 135 |
-
"learning_rate":
|
| 136 |
-
"loss": 0.
|
| 137 |
-
"num_input_tokens_seen":
|
| 138 |
"step": 130,
|
| 139 |
-
"train_runtime":
|
| 140 |
-
"train_tokens_per_second":
|
| 141 |
},
|
| 142 |
{
|
| 143 |
"epoch": 0.3013993541442411,
|
| 144 |
-
"grad_norm":
|
| 145 |
-
"learning_rate":
|
| 146 |
-
"loss": 0.
|
| 147 |
-
"num_input_tokens_seen":
|
| 148 |
"step": 140,
|
| 149 |
-
"train_runtime":
|
| 150 |
-
"train_tokens_per_second":
|
| 151 |
},
|
| 152 |
{
|
| 153 |
"epoch": 0.32292787944025836,
|
| 154 |
-
"grad_norm":
|
| 155 |
-
"learning_rate":
|
| 156 |
-
"loss": 0.
|
| 157 |
-
"num_input_tokens_seen":
|
| 158 |
"step": 150,
|
| 159 |
-
"train_runtime":
|
| 160 |
-
"train_tokens_per_second":
|
| 161 |
},
|
| 162 |
{
|
| 163 |
"epoch": 0.3444564047362756,
|
| 164 |
-
"grad_norm":
|
| 165 |
-
"learning_rate":
|
| 166 |
-
"loss": 0.
|
| 167 |
-
"num_input_tokens_seen":
|
| 168 |
"step": 160,
|
| 169 |
-
"train_runtime":
|
| 170 |
-
"train_tokens_per_second":
|
| 171 |
},
|
| 172 |
{
|
| 173 |
"epoch": 0.36598493003229277,
|
| 174 |
-
"grad_norm":
|
| 175 |
-
"learning_rate":
|
| 176 |
-
"loss": 0.
|
| 177 |
-
"num_input_tokens_seen":
|
| 178 |
"step": 170,
|
| 179 |
-
"train_runtime":
|
| 180 |
-
"train_tokens_per_second":
|
| 181 |
},
|
| 182 |
{
|
| 183 |
"epoch": 0.38751345532831,
|
| 184 |
-
"grad_norm":
|
| 185 |
-
"learning_rate":
|
| 186 |
-
"loss": 0.
|
| 187 |
-
"num_input_tokens_seen":
|
| 188 |
"step": 180,
|
| 189 |
-
"train_runtime":
|
| 190 |
-
"train_tokens_per_second":
|
| 191 |
},
|
| 192 |
{
|
| 193 |
"epoch": 0.40904198062432723,
|
| 194 |
-
"grad_norm":
|
| 195 |
-
"learning_rate":
|
| 196 |
-
"loss": 0.
|
| 197 |
-
"num_input_tokens_seen":
|
| 198 |
"step": 190,
|
| 199 |
-
"train_runtime":
|
| 200 |
-
"train_tokens_per_second":
|
| 201 |
},
|
| 202 |
{
|
| 203 |
"epoch": 0.43057050592034446,
|
| 204 |
-
"grad_norm":
|
| 205 |
-
"learning_rate":
|
| 206 |
-
"loss": 0.
|
| 207 |
-
"num_input_tokens_seen":
|
| 208 |
"step": 200,
|
| 209 |
-
"train_runtime":
|
| 210 |
-
"train_tokens_per_second":
|
| 211 |
},
|
| 212 |
{
|
| 213 |
"epoch": 0.4520990312163617,
|
| 214 |
-
"grad_norm":
|
| 215 |
-
"learning_rate":
|
| 216 |
-
"loss": 0.
|
| 217 |
-
"num_input_tokens_seen":
|
| 218 |
"step": 210,
|
| 219 |
-
"train_runtime":
|
| 220 |
-
"train_tokens_per_second":
|
| 221 |
},
|
| 222 |
{
|
| 223 |
"epoch": 0.4736275565123789,
|
| 224 |
-
"grad_norm":
|
| 225 |
-
"learning_rate":
|
| 226 |
-
"loss": 0.
|
| 227 |
-
"num_input_tokens_seen":
|
| 228 |
"step": 220,
|
| 229 |
-
"train_runtime":
|
| 230 |
-
"train_tokens_per_second":
|
| 231 |
},
|
| 232 |
{
|
| 233 |
"epoch": 0.4951560818083961,
|
| 234 |
-
"grad_norm":
|
| 235 |
-
"learning_rate":
|
| 236 |
-
"loss": 0.
|
| 237 |
-
"num_input_tokens_seen":
|
| 238 |
"step": 230,
|
| 239 |
-
"train_runtime":
|
| 240 |
-
"train_tokens_per_second":
|
| 241 |
},
|
| 242 |
{
|
| 243 |
"epoch": 0.5166846071044133,
|
| 244 |
-
"grad_norm":
|
| 245 |
-
"learning_rate":
|
| 246 |
-
"loss": 0.
|
| 247 |
-
"num_input_tokens_seen":
|
| 248 |
"step": 240,
|
| 249 |
-
"train_runtime":
|
| 250 |
-
"train_tokens_per_second":
|
| 251 |
},
|
| 252 |
{
|
| 253 |
"epoch": 0.5382131324004306,
|
| 254 |
-
"grad_norm":
|
| 255 |
-
"learning_rate":
|
| 256 |
-
"loss": 0.
|
| 257 |
-
"num_input_tokens_seen":
|
| 258 |
"step": 250,
|
| 259 |
-
"train_runtime":
|
| 260 |
-
"train_tokens_per_second":
|
| 261 |
},
|
| 262 |
{
|
| 263 |
"epoch": 0.5597416576964478,
|
| 264 |
-
"grad_norm":
|
| 265 |
-
"learning_rate":
|
| 266 |
-
"loss": 0.
|
| 267 |
-
"num_input_tokens_seen":
|
| 268 |
"step": 260,
|
| 269 |
-
"train_runtime":
|
| 270 |
-
"train_tokens_per_second":
|
| 271 |
},
|
| 272 |
{
|
| 273 |
"epoch": 0.581270182992465,
|
| 274 |
-
"grad_norm":
|
| 275 |
-
"learning_rate":
|
| 276 |
-
"loss": 0.
|
| 277 |
-
"num_input_tokens_seen":
|
| 278 |
"step": 270,
|
| 279 |
-
"train_runtime":
|
| 280 |
-
"train_tokens_per_second":
|
| 281 |
},
|
| 282 |
{
|
| 283 |
"epoch": 0.6027987082884823,
|
| 284 |
-
"grad_norm":
|
| 285 |
-
"learning_rate":
|
| 286 |
-
"loss": 0.
|
| 287 |
-
"num_input_tokens_seen":
|
| 288 |
"step": 280,
|
| 289 |
-
"train_runtime":
|
| 290 |
-
"train_tokens_per_second":
|
| 291 |
},
|
| 292 |
{
|
| 293 |
"epoch": 0.6243272335844995,
|
| 294 |
-
"grad_norm":
|
| 295 |
-
"learning_rate":
|
| 296 |
-
"loss": 0.
|
| 297 |
-
"num_input_tokens_seen":
|
| 298 |
"step": 290,
|
| 299 |
-
"train_runtime":
|
| 300 |
-
"train_tokens_per_second":
|
| 301 |
},
|
| 302 |
{
|
| 303 |
"epoch": 0.6458557588805167,
|
| 304 |
-
"grad_norm":
|
| 305 |
-
"learning_rate":
|
| 306 |
-
"loss": 0.
|
| 307 |
-
"num_input_tokens_seen":
|
| 308 |
"step": 300,
|
| 309 |
-
"train_runtime":
|
| 310 |
-
"train_tokens_per_second":
|
| 311 |
},
|
| 312 |
{
|
| 313 |
"epoch": 0.667384284176534,
|
| 314 |
-
"grad_norm":
|
| 315 |
-
"learning_rate":
|
| 316 |
-
"loss": 0.
|
| 317 |
-
"num_input_tokens_seen":
|
| 318 |
"step": 310,
|
| 319 |
-
"train_runtime":
|
| 320 |
-
"train_tokens_per_second":
|
| 321 |
},
|
| 322 |
{
|
| 323 |
"epoch": 0.6889128094725512,
|
| 324 |
-
"grad_norm":
|
| 325 |
-
"learning_rate":
|
| 326 |
-
"loss": 0.
|
| 327 |
-
"num_input_tokens_seen":
|
| 328 |
"step": 320,
|
| 329 |
-
"train_runtime":
|
| 330 |
-
"train_tokens_per_second":
|
| 331 |
},
|
| 332 |
{
|
| 333 |
"epoch": 0.7104413347685683,
|
| 334 |
-
"grad_norm":
|
| 335 |
-
"learning_rate":
|
| 336 |
-
"loss": 0.
|
| 337 |
-
"num_input_tokens_seen":
|
| 338 |
"step": 330,
|
| 339 |
-
"train_runtime":
|
| 340 |
-
"train_tokens_per_second":
|
| 341 |
},
|
| 342 |
{
|
| 343 |
"epoch": 0.7319698600645855,
|
| 344 |
-
"grad_norm":
|
| 345 |
-
"learning_rate":
|
| 346 |
-
"loss": 0.
|
| 347 |
-
"num_input_tokens_seen":
|
| 348 |
"step": 340,
|
| 349 |
-
"train_runtime":
|
| 350 |
-
"train_tokens_per_second":
|
| 351 |
},
|
| 352 |
{
|
| 353 |
"epoch": 0.7534983853606028,
|
| 354 |
-
"grad_norm":
|
| 355 |
-
"learning_rate":
|
| 356 |
-
"loss": 0.
|
| 357 |
-
"num_input_tokens_seen":
|
| 358 |
"step": 350,
|
| 359 |
-
"train_runtime":
|
| 360 |
-
"train_tokens_per_second":
|
| 361 |
},
|
| 362 |
{
|
| 363 |
"epoch": 0.77502691065662,
|
| 364 |
-
"grad_norm":
|
| 365 |
-
"learning_rate":
|
| 366 |
-
"loss": 0.
|
| 367 |
-
"num_input_tokens_seen":
|
| 368 |
"step": 360,
|
| 369 |
-
"train_runtime":
|
| 370 |
-
"train_tokens_per_second":
|
| 371 |
},
|
| 372 |
{
|
| 373 |
"epoch": 0.7965554359526372,
|
| 374 |
-
"grad_norm":
|
| 375 |
-
"learning_rate":
|
| 376 |
-
"loss": 0.
|
| 377 |
-
"num_input_tokens_seen":
|
| 378 |
"step": 370,
|
| 379 |
-
"train_runtime":
|
| 380 |
-
"train_tokens_per_second":
|
| 381 |
},
|
| 382 |
{
|
| 383 |
"epoch": 0.8180839612486545,
|
| 384 |
-
"grad_norm":
|
| 385 |
-
"learning_rate":
|
| 386 |
-
"loss": 0.
|
| 387 |
-
"num_input_tokens_seen":
|
| 388 |
"step": 380,
|
| 389 |
-
"train_runtime":
|
| 390 |
-
"train_tokens_per_second":
|
| 391 |
},
|
| 392 |
{
|
| 393 |
"epoch": 0.8396124865446717,
|
| 394 |
-
"grad_norm":
|
| 395 |
-
"learning_rate":
|
| 396 |
-
"loss": 0.
|
| 397 |
-
"num_input_tokens_seen":
|
| 398 |
"step": 390,
|
| 399 |
-
"train_runtime":
|
| 400 |
-
"train_tokens_per_second":
|
| 401 |
},
|
| 402 |
{
|
| 403 |
"epoch": 0.8611410118406889,
|
| 404 |
-
"grad_norm":
|
| 405 |
-
"learning_rate":
|
| 406 |
-
"loss": 0.
|
| 407 |
-
"num_input_tokens_seen":
|
| 408 |
"step": 400,
|
| 409 |
-
"train_runtime":
|
| 410 |
-
"train_tokens_per_second":
|
| 411 |
},
|
| 412 |
{
|
| 413 |
"epoch": 0.8826695371367062,
|
| 414 |
-
"grad_norm":
|
| 415 |
-
"learning_rate":
|
| 416 |
-
"loss": 0.
|
| 417 |
-
"num_input_tokens_seen":
|
| 418 |
"step": 410,
|
| 419 |
-
"train_runtime":
|
| 420 |
-
"train_tokens_per_second":
|
| 421 |
},
|
| 422 |
{
|
| 423 |
"epoch": 0.9041980624327234,
|
| 424 |
-
"grad_norm":
|
| 425 |
-
"learning_rate":
|
| 426 |
-
"loss": 0.
|
| 427 |
-
"num_input_tokens_seen":
|
| 428 |
"step": 420,
|
| 429 |
-
"train_runtime":
|
| 430 |
-
"train_tokens_per_second":
|
| 431 |
},
|
| 432 |
{
|
| 433 |
"epoch": 0.9257265877287406,
|
| 434 |
-
"grad_norm":
|
| 435 |
-
"learning_rate":
|
| 436 |
-
"loss": 0.
|
| 437 |
-
"num_input_tokens_seen":
|
| 438 |
"step": 430,
|
| 439 |
-
"train_runtime":
|
| 440 |
-
"train_tokens_per_second":
|
| 441 |
},
|
| 442 |
{
|
| 443 |
"epoch": 0.9472551130247578,
|
| 444 |
-
"grad_norm":
|
| 445 |
-
"learning_rate":
|
| 446 |
-
"loss": 0.
|
| 447 |
-
"num_input_tokens_seen":
|
| 448 |
"step": 440,
|
| 449 |
-
"train_runtime":
|
| 450 |
-
"train_tokens_per_second":
|
| 451 |
},
|
| 452 |
{
|
| 453 |
"epoch": 0.9687836383207751,
|
| 454 |
-
"grad_norm":
|
| 455 |
-
"learning_rate":
|
| 456 |
-
"loss": 0.
|
| 457 |
-
"num_input_tokens_seen":
|
| 458 |
"step": 450,
|
| 459 |
-
"train_runtime":
|
| 460 |
-
"train_tokens_per_second":
|
| 461 |
},
|
| 462 |
{
|
| 463 |
"epoch": 0.9903121636167922,
|
| 464 |
-
"grad_norm":
|
| 465 |
-
"learning_rate":
|
| 466 |
-
"loss": 0.
|
| 467 |
-
"num_input_tokens_seen":
|
| 468 |
"step": 460,
|
| 469 |
-
"train_runtime":
|
| 470 |
-
"train_tokens_per_second":
|
| 471 |
},
|
| 472 |
{
|
| 473 |
"epoch": 1.0107642626480087,
|
| 474 |
-
"grad_norm":
|
| 475 |
-
"learning_rate":
|
| 476 |
-
"loss": 0.
|
| 477 |
-
"num_input_tokens_seen":
|
| 478 |
"step": 470,
|
| 479 |
-
"train_runtime":
|
| 480 |
-
"train_tokens_per_second":
|
| 481 |
},
|
| 482 |
{
|
| 483 |
"epoch": 1.0322927879440258,
|
| 484 |
-
"grad_norm":
|
| 485 |
-
"learning_rate":
|
| 486 |
-
"loss": 0.
|
| 487 |
-
"num_input_tokens_seen":
|
| 488 |
"step": 480,
|
| 489 |
-
"train_runtime":
|
| 490 |
-
"train_tokens_per_second":
|
| 491 |
},
|
| 492 |
{
|
| 493 |
"epoch": 1.0538213132400431,
|
| 494 |
-
"grad_norm":
|
| 495 |
-
"learning_rate":
|
| 496 |
-
"loss": 0.
|
| 497 |
-
"num_input_tokens_seen":
|
| 498 |
"step": 490,
|
| 499 |
-
"train_runtime":
|
| 500 |
-
"train_tokens_per_second":
|
| 501 |
},
|
| 502 |
{
|
| 503 |
"epoch": 1.0753498385360603,
|
| 504 |
-
"grad_norm":
|
| 505 |
-
"learning_rate":
|
| 506 |
-
"loss": 0.
|
| 507 |
-
"num_input_tokens_seen":
|
| 508 |
"step": 500,
|
| 509 |
-
"train_runtime":
|
| 510 |
-
"train_tokens_per_second":
|
| 511 |
},
|
| 512 |
{
|
| 513 |
"epoch": 1.0968783638320776,
|
| 514 |
-
"grad_norm":
|
| 515 |
-
"learning_rate":
|
| 516 |
-
"loss": 0.
|
| 517 |
-
"num_input_tokens_seen":
|
| 518 |
"step": 510,
|
| 519 |
-
"train_runtime":
|
| 520 |
-
"train_tokens_per_second":
|
| 521 |
},
|
| 522 |
{
|
| 523 |
"epoch": 1.1184068891280947,
|
| 524 |
-
"grad_norm":
|
| 525 |
-
"learning_rate":
|
| 526 |
-
"loss": 0.
|
| 527 |
-
"num_input_tokens_seen":
|
| 528 |
"step": 520,
|
| 529 |
-
"train_runtime":
|
| 530 |
-
"train_tokens_per_second":
|
| 531 |
},
|
| 532 |
{
|
| 533 |
"epoch": 1.1399354144241118,
|
| 534 |
-
"grad_norm":
|
| 535 |
-
"learning_rate":
|
| 536 |
-
"loss": 0.
|
| 537 |
-
"num_input_tokens_seen":
|
| 538 |
"step": 530,
|
| 539 |
-
"train_runtime":
|
| 540 |
-
"train_tokens_per_second":
|
| 541 |
},
|
| 542 |
{
|
| 543 |
"epoch": 1.1614639397201292,
|
| 544 |
-
"grad_norm":
|
| 545 |
-
"learning_rate":
|
| 546 |
-
"loss": 0.
|
| 547 |
-
"num_input_tokens_seen":
|
| 548 |
"step": 540,
|
| 549 |
-
"train_runtime":
|
| 550 |
-
"train_tokens_per_second":
|
| 551 |
},
|
| 552 |
{
|
| 553 |
"epoch": 1.1829924650161463,
|
| 554 |
-
"grad_norm":
|
| 555 |
-
"learning_rate":
|
| 556 |
-
"loss": 0.
|
| 557 |
-
"num_input_tokens_seen":
|
| 558 |
"step": 550,
|
| 559 |
-
"train_runtime":
|
| 560 |
-
"train_tokens_per_second":
|
| 561 |
},
|
| 562 |
{
|
| 563 |
"epoch": 1.2045209903121636,
|
| 564 |
-
"grad_norm":
|
| 565 |
-
"learning_rate":
|
| 566 |
-
"loss": 0.
|
| 567 |
-
"num_input_tokens_seen":
|
| 568 |
"step": 560,
|
| 569 |
-
"train_runtime":
|
| 570 |
-
"train_tokens_per_second":
|
| 571 |
},
|
| 572 |
{
|
| 573 |
"epoch": 1.2260495156081808,
|
| 574 |
-
"grad_norm":
|
| 575 |
-
"learning_rate":
|
| 576 |
-
"loss": 0.
|
| 577 |
-
"num_input_tokens_seen":
|
| 578 |
"step": 570,
|
| 579 |
-
"train_runtime":
|
| 580 |
-
"train_tokens_per_second":
|
| 581 |
},
|
| 582 |
{
|
| 583 |
"epoch": 1.247578040904198,
|
| 584 |
-
"grad_norm":
|
| 585 |
-
"learning_rate":
|
| 586 |
-
"loss": 0.
|
| 587 |
-
"num_input_tokens_seen":
|
| 588 |
"step": 580,
|
| 589 |
-
"train_runtime":
|
| 590 |
-
"train_tokens_per_second":
|
| 591 |
},
|
| 592 |
{
|
| 593 |
"epoch": 1.2691065662002152,
|
| 594 |
-
"grad_norm":
|
| 595 |
-
"learning_rate":
|
| 596 |
-
"loss": 0.
|
| 597 |
-
"num_input_tokens_seen":
|
| 598 |
"step": 590,
|
| 599 |
-
"train_runtime":
|
| 600 |
-
"train_tokens_per_second":
|
| 601 |
},
|
| 602 |
{
|
| 603 |
"epoch": 1.2906350914962326,
|
| 604 |
-
"grad_norm":
|
| 605 |
-
"learning_rate":
|
| 606 |
-
"loss": 0.
|
| 607 |
-
"num_input_tokens_seen":
|
| 608 |
"step": 600,
|
| 609 |
-
"train_runtime":
|
| 610 |
-
"train_tokens_per_second":
|
| 611 |
},
|
| 612 |
{
|
| 613 |
"epoch": 1.3121636167922497,
|
| 614 |
-
"grad_norm":
|
| 615 |
-
"learning_rate":
|
| 616 |
-
"loss": 0.
|
| 617 |
-
"num_input_tokens_seen":
|
| 618 |
"step": 610,
|
| 619 |
-
"train_runtime":
|
| 620 |
-
"train_tokens_per_second":
|
| 621 |
},
|
| 622 |
{
|
| 623 |
"epoch": 1.333692142088267,
|
| 624 |
-
"grad_norm":
|
| 625 |
-
"learning_rate":
|
| 626 |
-
"loss": 0.
|
| 627 |
-
"num_input_tokens_seen":
|
| 628 |
"step": 620,
|
| 629 |
-
"train_runtime":
|
| 630 |
-
"train_tokens_per_second":
|
| 631 |
},
|
| 632 |
{
|
| 633 |
"epoch": 1.3552206673842842,
|
| 634 |
-
"grad_norm":
|
| 635 |
-
"learning_rate":
|
| 636 |
-
"loss": 0.
|
| 637 |
-
"num_input_tokens_seen":
|
| 638 |
"step": 630,
|
| 639 |
-
"train_runtime":
|
| 640 |
-
"train_tokens_per_second":
|
| 641 |
},
|
| 642 |
{
|
| 643 |
"epoch": 1.3767491926803013,
|
| 644 |
-
"grad_norm":
|
| 645 |
-
"learning_rate":
|
| 646 |
-
"loss": 0.
|
| 647 |
-
"num_input_tokens_seen":
|
| 648 |
"step": 640,
|
| 649 |
-
"train_runtime":
|
| 650 |
-
"train_tokens_per_second":
|
| 651 |
},
|
| 652 |
{
|
| 653 |
"epoch": 1.3982777179763186,
|
| 654 |
-
"grad_norm":
|
| 655 |
-
"learning_rate":
|
| 656 |
-
"loss": 0.
|
| 657 |
-
"num_input_tokens_seen":
|
| 658 |
"step": 650,
|
| 659 |
-
"train_runtime":
|
| 660 |
-
"train_tokens_per_second":
|
| 661 |
},
|
| 662 |
{
|
| 663 |
"epoch": 1.419806243272336,
|
| 664 |
-
"grad_norm":
|
| 665 |
-
"learning_rate":
|
| 666 |
-
"loss": 0.
|
| 667 |
-
"num_input_tokens_seen":
|
| 668 |
"step": 660,
|
| 669 |
-
"train_runtime":
|
| 670 |
-
"train_tokens_per_second":
|
| 671 |
},
|
| 672 |
{
|
| 673 |
"epoch": 1.441334768568353,
|
| 674 |
-
"grad_norm":
|
| 675 |
-
"learning_rate":
|
| 676 |
-
"loss": 0.
|
| 677 |
-
"num_input_tokens_seen":
|
| 678 |
"step": 670,
|
| 679 |
-
"train_runtime":
|
| 680 |
-
"train_tokens_per_second":
|
| 681 |
},
|
| 682 |
{
|
| 683 |
"epoch": 1.4628632938643702,
|
| 684 |
-
"grad_norm":
|
| 685 |
-
"learning_rate":
|
| 686 |
-
"loss": 0.
|
| 687 |
-
"num_input_tokens_seen":
|
| 688 |
"step": 680,
|
| 689 |
-
"train_runtime":
|
| 690 |
-
"train_tokens_per_second":
|
| 691 |
},
|
| 692 |
{
|
| 693 |
"epoch": 1.4843918191603875,
|
| 694 |
-
"grad_norm":
|
| 695 |
-
"learning_rate":
|
| 696 |
-
"loss": 0.
|
| 697 |
-
"num_input_tokens_seen":
|
| 698 |
"step": 690,
|
| 699 |
-
"train_runtime":
|
| 700 |
-
"train_tokens_per_second":
|
| 701 |
},
|
| 702 |
{
|
| 703 |
"epoch": 1.5059203444564049,
|
| 704 |
-
"grad_norm":
|
| 705 |
-
"learning_rate":
|
| 706 |
-
"loss": 0.
|
| 707 |
-
"num_input_tokens_seen":
|
| 708 |
"step": 700,
|
| 709 |
-
"train_runtime":
|
| 710 |
-
"train_tokens_per_second":
|
| 711 |
},
|
| 712 |
{
|
| 713 |
"epoch": 1.527448869752422,
|
| 714 |
-
"grad_norm":
|
| 715 |
-
"learning_rate":
|
| 716 |
-
"loss": 0.
|
| 717 |
-
"num_input_tokens_seen":
|
| 718 |
"step": 710,
|
| 719 |
-
"train_runtime":
|
| 720 |
-
"train_tokens_per_second":
|
| 721 |
},
|
| 722 |
{
|
| 723 |
"epoch": 1.5489773950484391,
|
| 724 |
-
"grad_norm":
|
| 725 |
-
"learning_rate":
|
| 726 |
-
"loss": 0.
|
| 727 |
-
"num_input_tokens_seen":
|
| 728 |
"step": 720,
|
| 729 |
-
"train_runtime":
|
| 730 |
-
"train_tokens_per_second":
|
| 731 |
},
|
| 732 |
{
|
| 733 |
"epoch": 1.5705059203444565,
|
| 734 |
-
"grad_norm":
|
| 735 |
-
"learning_rate":
|
| 736 |
-
"loss": 0.
|
| 737 |
-
"num_input_tokens_seen":
|
| 738 |
"step": 730,
|
| 739 |
-
"train_runtime":
|
| 740 |
-
"train_tokens_per_second":
|
| 741 |
},
|
| 742 |
{
|
| 743 |
"epoch": 1.5920344456404736,
|
| 744 |
-
"grad_norm":
|
| 745 |
-
"learning_rate":
|
| 746 |
-
"loss": 0.
|
| 747 |
-
"num_input_tokens_seen":
|
| 748 |
"step": 740,
|
| 749 |
-
"train_runtime":
|
| 750 |
-
"train_tokens_per_second":
|
| 751 |
},
|
| 752 |
{
|
| 753 |
"epoch": 1.6135629709364907,
|
| 754 |
-
"grad_norm":
|
| 755 |
-
"learning_rate":
|
| 756 |
-
"loss": 0.
|
| 757 |
-
"num_input_tokens_seen":
|
| 758 |
"step": 750,
|
| 759 |
-
"train_runtime":
|
| 760 |
-
"train_tokens_per_second":
|
| 761 |
},
|
| 762 |
{
|
| 763 |
"epoch": 1.635091496232508,
|
| 764 |
-
"grad_norm":
|
| 765 |
-
"learning_rate":
|
| 766 |
-
"loss": 0.
|
| 767 |
-
"num_input_tokens_seen":
|
| 768 |
"step": 760,
|
| 769 |
-
"train_runtime":
|
| 770 |
-
"train_tokens_per_second":
|
| 771 |
},
|
| 772 |
{
|
| 773 |
"epoch": 1.6566200215285254,
|
| 774 |
-
"grad_norm":
|
| 775 |
-
"learning_rate":
|
| 776 |
-
"loss": 0.
|
| 777 |
-
"num_input_tokens_seen":
|
| 778 |
"step": 770,
|
| 779 |
-
"train_runtime":
|
| 780 |
-
"train_tokens_per_second":
|
| 781 |
},
|
| 782 |
{
|
| 783 |
"epoch": 1.6781485468245425,
|
| 784 |
-
"grad_norm":
|
| 785 |
-
"learning_rate":
|
| 786 |
-
"loss": 0.
|
| 787 |
-
"num_input_tokens_seen":
|
| 788 |
"step": 780,
|
| 789 |
-
"train_runtime":
|
| 790 |
-
"train_tokens_per_second":
|
| 791 |
},
|
| 792 |
{
|
| 793 |
"epoch": 1.6996770721205596,
|
| 794 |
-
"grad_norm":
|
| 795 |
-
"learning_rate":
|
| 796 |
-
"loss": 0.
|
| 797 |
-
"num_input_tokens_seen":
|
| 798 |
"step": 790,
|
| 799 |
-
"train_runtime":
|
| 800 |
-
"train_tokens_per_second":
|
| 801 |
},
|
| 802 |
{
|
| 803 |
"epoch": 1.721205597416577,
|
| 804 |
-
"grad_norm":
|
| 805 |
-
"learning_rate":
|
| 806 |
-
"loss": 0.
|
| 807 |
-
"num_input_tokens_seen":
|
| 808 |
"step": 800,
|
| 809 |
-
"train_runtime":
|
| 810 |
-
"train_tokens_per_second":
|
| 811 |
},
|
| 812 |
{
|
| 813 |
"epoch": 1.7427341227125943,
|
| 814 |
-
"grad_norm":
|
| 815 |
-
"learning_rate":
|
| 816 |
-
"loss": 0.
|
| 817 |
-
"num_input_tokens_seen":
|
| 818 |
"step": 810,
|
| 819 |
-
"train_runtime":
|
| 820 |
-
"train_tokens_per_second":
|
| 821 |
},
|
| 822 |
{
|
| 823 |
"epoch": 1.7642626480086114,
|
| 824 |
-
"grad_norm":
|
| 825 |
-
"learning_rate":
|
| 826 |
-
"loss": 0.
|
| 827 |
-
"num_input_tokens_seen":
|
| 828 |
"step": 820,
|
| 829 |
-
"train_runtime":
|
| 830 |
-
"train_tokens_per_second":
|
| 831 |
},
|
| 832 |
{
|
| 833 |
"epoch": 1.7857911733046286,
|
| 834 |
-
"grad_norm":
|
| 835 |
-
"learning_rate":
|
| 836 |
-
"loss": 0.
|
| 837 |
-
"num_input_tokens_seen":
|
| 838 |
"step": 830,
|
| 839 |
-
"train_runtime":
|
| 840 |
-
"train_tokens_per_second":
|
| 841 |
},
|
| 842 |
{
|
| 843 |
"epoch": 1.807319698600646,
|
| 844 |
-
"grad_norm":
|
| 845 |
-
"learning_rate":
|
| 846 |
-
"loss": 0.
|
| 847 |
-
"num_input_tokens_seen":
|
| 848 |
"step": 840,
|
| 849 |
-
"train_runtime":
|
| 850 |
-
"train_tokens_per_second":
|
| 851 |
},
|
| 852 |
{
|
| 853 |
"epoch": 1.8288482238966632,
|
| 854 |
-
"grad_norm":
|
| 855 |
-
"learning_rate":
|
| 856 |
-
"loss": 0.
|
| 857 |
-
"num_input_tokens_seen":
|
| 858 |
"step": 850,
|
| 859 |
-
"train_runtime":
|
| 860 |
-
"train_tokens_per_second":
|
| 861 |
},
|
| 862 |
{
|
| 863 |
"epoch": 1.8503767491926801,
|
| 864 |
-
"grad_norm":
|
| 865 |
-
"learning_rate":
|
| 866 |
-
"loss": 0.
|
| 867 |
-
"num_input_tokens_seen":
|
| 868 |
"step": 860,
|
| 869 |
-
"train_runtime":
|
| 870 |
-
"train_tokens_per_second":
|
| 871 |
},
|
| 872 |
{
|
| 873 |
"epoch": 1.8719052744886975,
|
| 874 |
-
"grad_norm":
|
| 875 |
-
"learning_rate":
|
| 876 |
-
"loss": 0.
|
| 877 |
-
"num_input_tokens_seen":
|
| 878 |
"step": 870,
|
| 879 |
-
"train_runtime":
|
| 880 |
-
"train_tokens_per_second":
|
| 881 |
},
|
| 882 |
{
|
| 883 |
"epoch": 1.8934337997847148,
|
| 884 |
-
"grad_norm":
|
| 885 |
-
"learning_rate":
|
| 886 |
-
"loss": 0.
|
| 887 |
-
"num_input_tokens_seen":
|
| 888 |
"step": 880,
|
| 889 |
-
"train_runtime":
|
| 890 |
-
"train_tokens_per_second":
|
| 891 |
},
|
| 892 |
{
|
| 893 |
"epoch": 1.914962325080732,
|
| 894 |
-
"grad_norm":
|
| 895 |
-
"learning_rate":
|
| 896 |
-
"loss": 0.
|
| 897 |
-
"num_input_tokens_seen":
|
| 898 |
"step": 890,
|
| 899 |
-
"train_runtime":
|
| 900 |
-
"train_tokens_per_second":
|
| 901 |
},
|
| 902 |
{
|
| 903 |
"epoch": 1.936490850376749,
|
| 904 |
-
"grad_norm":
|
| 905 |
-
"learning_rate":
|
| 906 |
-
"loss": 0.
|
| 907 |
-
"num_input_tokens_seen":
|
| 908 |
"step": 900,
|
| 909 |
-
"train_runtime":
|
| 910 |
-
"train_tokens_per_second":
|
| 911 |
},
|
| 912 |
{
|
| 913 |
"epoch": 1.9580193756727664,
|
| 914 |
-
"grad_norm":
|
| 915 |
-
"learning_rate":
|
| 916 |
-
"loss": 0.
|
| 917 |
-
"num_input_tokens_seen":
|
| 918 |
"step": 910,
|
| 919 |
-
"train_runtime":
|
| 920 |
-
"train_tokens_per_second":
|
| 921 |
},
|
| 922 |
{
|
| 923 |
"epoch": 1.9795479009687837,
|
| 924 |
-
"grad_norm":
|
| 925 |
-
"learning_rate":
|
| 926 |
-
"loss": 0.
|
| 927 |
-
"num_input_tokens_seen":
|
| 928 |
"step": 920,
|
| 929 |
-
"train_runtime":
|
| 930 |
-
"train_tokens_per_second":
|
| 931 |
},
|
| 932 |
{
|
| 933 |
"epoch": 2.0,
|
| 934 |
-
"grad_norm":
|
| 935 |
-
"learning_rate":
|
| 936 |
-
"loss": 0.
|
| 937 |
-
"num_input_tokens_seen":
|
| 938 |
"step": 930,
|
| 939 |
-
"train_runtime":
|
| 940 |
-
"train_tokens_per_second":
|
| 941 |
},
|
| 942 |
{
|
| 943 |
"epoch": 2.0215285252960173,
|
| 944 |
-
"grad_norm":
|
| 945 |
-
"learning_rate":
|
| 946 |
-
"loss": 0.
|
| 947 |
-
"num_input_tokens_seen":
|
| 948 |
"step": 940,
|
| 949 |
-
"train_runtime":
|
| 950 |
-
"train_tokens_per_second":
|
| 951 |
},
|
| 952 |
{
|
| 953 |
"epoch": 2.0430570505920342,
|
| 954 |
-
"grad_norm":
|
| 955 |
-
"learning_rate":
|
| 956 |
-
"loss": 0.
|
| 957 |
-
"num_input_tokens_seen":
|
| 958 |
"step": 950,
|
| 959 |
-
"train_runtime":
|
| 960 |
-
"train_tokens_per_second":
|
| 961 |
},
|
| 962 |
{
|
| 963 |
"epoch": 2.0645855758880516,
|
| 964 |
-
"grad_norm":
|
| 965 |
-
"learning_rate":
|
| 966 |
-
"loss": 0.
|
| 967 |
-
"num_input_tokens_seen":
|
| 968 |
"step": 960,
|
| 969 |
-
"train_runtime":
|
| 970 |
-
"train_tokens_per_second":
|
| 971 |
},
|
| 972 |
{
|
| 973 |
"epoch": 2.086114101184069,
|
| 974 |
-
"grad_norm":
|
| 975 |
-
"learning_rate":
|
| 976 |
-
"loss": 0.
|
| 977 |
-
"num_input_tokens_seen":
|
| 978 |
"step": 970,
|
| 979 |
-
"train_runtime":
|
| 980 |
-
"train_tokens_per_second":
|
| 981 |
},
|
| 982 |
{
|
| 983 |
"epoch": 2.1076426264800863,
|
| 984 |
-
"grad_norm":
|
| 985 |
-
"learning_rate":
|
| 986 |
-
"loss": 0.
|
| 987 |
-
"num_input_tokens_seen":
|
| 988 |
"step": 980,
|
| 989 |
-
"train_runtime":
|
| 990 |
-
"train_tokens_per_second":
|
| 991 |
},
|
| 992 |
{
|
| 993 |
"epoch": 2.129171151776103,
|
| 994 |
-
"grad_norm":
|
| 995 |
-
"learning_rate":
|
| 996 |
-
"loss": 0.
|
| 997 |
-
"num_input_tokens_seen":
|
| 998 |
"step": 990,
|
| 999 |
-
"train_runtime":
|
| 1000 |
-
"train_tokens_per_second":
|
| 1001 |
},
|
| 1002 |
{
|
| 1003 |
"epoch": 2.1506996770721205,
|
| 1004 |
-
"grad_norm":
|
| 1005 |
-
"learning_rate":
|
| 1006 |
-
"loss": 0.
|
| 1007 |
-
"num_input_tokens_seen":
|
| 1008 |
"step": 1000,
|
| 1009 |
-
"train_runtime":
|
| 1010 |
-
"train_tokens_per_second":
|
| 1011 |
}
|
| 1012 |
],
|
| 1013 |
"logging_steps": 10,
|
| 1014 |
"max_steps": 1395,
|
| 1015 |
-
"num_input_tokens_seen":
|
| 1016 |
"num_train_epochs": 3,
|
| 1017 |
"save_steps": 1000,
|
| 1018 |
"stateful_callbacks": {
|
|
@@ -1027,7 +1027,7 @@
|
|
| 1027 |
"attributes": {}
|
| 1028 |
}
|
| 1029 |
},
|
| 1030 |
-
"total_flos":
|
| 1031 |
"train_batch_size": 4,
|
| 1032 |
"trial_name": null,
|
| 1033 |
"trial_params": null
|
|
|
|
| 11 |
"log_history": [
|
| 12 |
{
|
| 13 |
"epoch": 0.021528525296017224,
|
| 14 |
+
"grad_norm": 16.47992515563965,
|
| 15 |
+
"learning_rate": 9.998973021172564e-06,
|
| 16 |
+
"loss": 1.7834,
|
| 17 |
+
"num_input_tokens_seen": 43648,
|
| 18 |
"step": 10,
|
| 19 |
+
"train_runtime": 64.3878,
|
| 20 |
+
"train_tokens_per_second": 677.892
|
| 21 |
},
|
| 22 |
{
|
| 23 |
"epoch": 0.04305705059203445,
|
| 24 |
+
"grad_norm": 16.372161865234375,
|
| 25 |
+
"learning_rate": 9.995423512524277e-06,
|
| 26 |
+
"loss": 0.7676,
|
| 27 |
+
"num_input_tokens_seen": 87072,
|
| 28 |
"step": 20,
|
| 29 |
+
"train_runtime": 95.1979,
|
| 30 |
+
"train_tokens_per_second": 914.642
|
| 31 |
},
|
| 32 |
{
|
| 33 |
"epoch": 0.06458557588805167,
|
| 34 |
+
"grad_norm": 11.686817169189453,
|
| 35 |
+
"learning_rate": 9.98934059499448e-06,
|
| 36 |
+
"loss": 0.5817,
|
| 37 |
+
"num_input_tokens_seen": 131520,
|
| 38 |
"step": 30,
|
| 39 |
+
"train_runtime": 126.5065,
|
| 40 |
+
"train_tokens_per_second": 1039.63
|
| 41 |
},
|
| 42 |
{
|
| 43 |
"epoch": 0.0861141011840689,
|
| 44 |
+
"grad_norm": 3.2975926399230957,
|
| 45 |
+
"learning_rate": 9.980727353510257e-06,
|
| 46 |
+
"loss": 0.3531,
|
| 47 |
+
"num_input_tokens_seen": 175680,
|
| 48 |
"step": 40,
|
| 49 |
+
"train_runtime": 157.6702,
|
| 50 |
+
"train_tokens_per_second": 1114.225
|
| 51 |
},
|
| 52 |
{
|
| 53 |
"epoch": 0.10764262648008611,
|
| 54 |
+
"grad_norm": 3.4886627197265625,
|
| 55 |
+
"learning_rate": 9.969588156242282e-06,
|
| 56 |
+
"loss": 0.3352,
|
| 57 |
+
"num_input_tokens_seen": 219584,
|
| 58 |
"step": 50,
|
| 59 |
+
"train_runtime": 188.7104,
|
| 60 |
+
"train_tokens_per_second": 1163.603
|
| 61 |
},
|
| 62 |
{
|
| 63 |
"epoch": 0.12917115177610333,
|
| 64 |
+
"grad_norm": 3.484487295150757,
|
| 65 |
+
"learning_rate": 9.95592865238951e-06,
|
| 66 |
+
"loss": 0.2298,
|
| 67 |
+
"num_input_tokens_seen": 263392,
|
| 68 |
"step": 60,
|
| 69 |
+
"train_runtime": 219.7077,
|
| 70 |
+
"train_tokens_per_second": 1198.829
|
| 71 |
},
|
| 72 |
{
|
| 73 |
"epoch": 0.15069967707212056,
|
| 74 |
+
"grad_norm": 4.422971725463867,
|
| 75 |
+
"learning_rate": 9.939755769314215e-06,
|
| 76 |
+
"loss": 0.1981,
|
| 77 |
+
"num_input_tokens_seen": 306912,
|
| 78 |
"step": 70,
|
| 79 |
+
"train_runtime": 250.6069,
|
| 80 |
+
"train_tokens_per_second": 1224.675
|
| 81 |
},
|
| 82 |
{
|
| 83 |
"epoch": 0.1722282023681378,
|
| 84 |
+
"grad_norm": 1.4185198545455933,
|
| 85 |
+
"learning_rate": 9.9210777090288e-06,
|
| 86 |
+
"loss": 0.1755,
|
| 87 |
+
"num_input_tokens_seen": 349824,
|
| 88 |
"step": 80,
|
| 89 |
+
"train_runtime": 281.2405,
|
| 90 |
+
"train_tokens_per_second": 1243.86
|
| 91 |
},
|
| 92 |
{
|
| 93 |
"epoch": 0.193756727664155,
|
| 94 |
+
"grad_norm": 1.1935056447982788,
|
| 95 |
+
"learning_rate": 9.899903944036185e-06,
|
| 96 |
+
"loss": 0.1791,
|
| 97 |
+
"num_input_tokens_seen": 393664,
|
| 98 |
"step": 90,
|
| 99 |
+
"train_runtime": 312.2075,
|
| 100 |
+
"train_tokens_per_second": 1260.905
|
| 101 |
},
|
| 102 |
{
|
| 103 |
"epoch": 0.21528525296017223,
|
| 104 |
+
"grad_norm": 2.463397741317749,
|
| 105 |
+
"learning_rate": 9.87624521252587e-06,
|
| 106 |
+
"loss": 0.2051,
|
| 107 |
+
"num_input_tokens_seen": 437952,
|
| 108 |
"step": 100,
|
| 109 |
+
"train_runtime": 343.3508,
|
| 110 |
+
"train_tokens_per_second": 1275.523
|
| 111 |
},
|
| 112 |
{
|
| 113 |
"epoch": 0.23681377825618946,
|
| 114 |
+
"grad_norm": 3.8650355339050293,
|
| 115 |
+
"learning_rate": 9.850113512928094e-06,
|
| 116 |
+
"loss": 0.1912,
|
| 117 |
+
"num_input_tokens_seen": 481472,
|
| 118 |
"step": 110,
|
| 119 |
+
"train_runtime": 374.2539,
|
| 120 |
+
"train_tokens_per_second": 1286.485
|
| 121 |
},
|
| 122 |
{
|
| 123 |
"epoch": 0.25834230355220666,
|
| 124 |
+
"grad_norm": 4.704444885253906,
|
| 125 |
+
"learning_rate": 9.821522097828884e-06,
|
| 126 |
+
"loss": 0.1637,
|
| 127 |
+
"num_input_tokens_seen": 525472,
|
| 128 |
"step": 120,
|
| 129 |
+
"train_runtime": 405.4374,
|
| 130 |
+
"train_tokens_per_second": 1296.062
|
| 131 |
},
|
| 132 |
{
|
| 133 |
"epoch": 0.2798708288482239,
|
| 134 |
+
"grad_norm": 2.7267754077911377,
|
| 135 |
+
"learning_rate": 9.790485467249065e-06,
|
| 136 |
+
"loss": 0.1537,
|
| 137 |
+
"num_input_tokens_seen": 569696,
|
| 138 |
"step": 130,
|
| 139 |
+
"train_runtime": 436.4834,
|
| 140 |
+
"train_tokens_per_second": 1305.195
|
| 141 |
},
|
| 142 |
{
|
| 143 |
"epoch": 0.3013993541442411,
|
| 144 |
+
"grad_norm": 3.512826681137085,
|
| 145 |
+
"learning_rate": 9.757019361290621e-06,
|
| 146 |
+
"loss": 0.1846,
|
| 147 |
+
"num_input_tokens_seen": 613760,
|
| 148 |
"step": 140,
|
| 149 |
+
"train_runtime": 467.5968,
|
| 150 |
+
"train_tokens_per_second": 1312.584
|
| 151 |
},
|
| 152 |
{
|
| 153 |
"epoch": 0.32292787944025836,
|
| 154 |
+
"grad_norm": 2.484517812728882,
|
| 155 |
+
"learning_rate": 9.721140752154182e-06,
|
| 156 |
+
"loss": 0.1872,
|
| 157 |
+
"num_input_tokens_seen": 657824,
|
| 158 |
"step": 150,
|
| 159 |
+
"train_runtime": 498.6389,
|
| 160 |
+
"train_tokens_per_second": 1319.239
|
| 161 |
},
|
| 162 |
{
|
| 163 |
"epoch": 0.3444564047362756,
|
| 164 |
+
"grad_norm": 2.296607255935669,
|
| 165 |
+
"learning_rate": 9.682867835531624e-06,
|
| 166 |
+
"loss": 0.1372,
|
| 167 |
+
"num_input_tokens_seen": 701760,
|
| 168 |
"step": 160,
|
| 169 |
+
"train_runtime": 529.7256,
|
| 170 |
+
"train_tokens_per_second": 1324.761
|
| 171 |
},
|
| 172 |
{
|
| 173 |
"epoch": 0.36598493003229277,
|
| 174 |
+
"grad_norm": 3.887946128845215,
|
| 175 |
+
"learning_rate": 9.642220021378212e-06,
|
| 176 |
+
"loss": 0.2028,
|
| 177 |
+
"num_input_tokens_seen": 745184,
|
| 178 |
"step": 170,
|
| 179 |
+
"train_runtime": 560.5239,
|
| 180 |
+
"train_tokens_per_second": 1329.442
|
| 181 |
},
|
| 182 |
{
|
| 183 |
"epoch": 0.38751345532831,
|
| 184 |
+
"grad_norm": 2.1227307319641113,
|
| 185 |
+
"learning_rate": 9.59921792406891e-06,
|
| 186 |
+
"loss": 0.1765,
|
| 187 |
+
"num_input_tokens_seen": 789216,
|
| 188 |
"step": 180,
|
| 189 |
+
"train_runtime": 591.5958,
|
| 190 |
+
"train_tokens_per_second": 1334.046
|
| 191 |
},
|
| 192 |
{
|
| 193 |
"epoch": 0.40904198062432723,
|
| 194 |
+
"grad_norm": 3.007882595062256,
|
| 195 |
+
"learning_rate": 9.553883351943882e-06,
|
| 196 |
+
"loss": 0.1882,
|
| 197 |
+
"num_input_tokens_seen": 832960,
|
| 198 |
"step": 190,
|
| 199 |
+
"train_runtime": 622.6094,
|
| 200 |
+
"train_tokens_per_second": 1337.853
|
| 201 |
},
|
| 202 |
{
|
| 203 |
"epoch": 0.43057050592034446,
|
| 204 |
+
"grad_norm": 1.8637208938598633,
|
| 205 |
+
"learning_rate": 9.506239296248497e-06,
|
| 206 |
+
"loss": 0.1336,
|
| 207 |
+
"num_input_tokens_seen": 877664,
|
| 208 |
"step": 200,
|
| 209 |
+
"train_runtime": 654.0867,
|
| 210 |
+
"train_tokens_per_second": 1341.816
|
| 211 |
},
|
| 212 |
{
|
| 213 |
"epoch": 0.4520990312163617,
|
| 214 |
+
"grad_norm": 1.1324244737625122,
|
| 215 |
+
"learning_rate": 9.456309919473384e-06,
|
| 216 |
+
"loss": 0.1521,
|
| 217 |
+
"num_input_tokens_seen": 921536,
|
| 218 |
"step": 210,
|
| 219 |
+
"train_runtime": 685.133,
|
| 220 |
+
"train_tokens_per_second": 1345.047
|
| 221 |
},
|
| 222 |
{
|
| 223 |
"epoch": 0.4736275565123789,
|
| 224 |
+
"grad_norm": 3.536208391189575,
|
| 225 |
+
"learning_rate": 9.404120543100553e-06,
|
| 226 |
+
"loss": 0.1864,
|
| 227 |
+
"num_input_tokens_seen": 965344,
|
| 228 |
"step": 220,
|
| 229 |
+
"train_runtime": 716.7323,
|
| 230 |
+
"train_tokens_per_second": 1346.868
|
| 231 |
},
|
| 232 |
{
|
| 233 |
"epoch": 0.4951560818083961,
|
| 234 |
+
"grad_norm": 1.73074209690094,
|
| 235 |
+
"learning_rate": 9.34969763476168e-06,
|
| 236 |
+
"loss": 0.1625,
|
| 237 |
+
"num_input_tokens_seen": 1008672,
|
| 238 |
"step": 230,
|
| 239 |
+
"train_runtime": 747.5266,
|
| 240 |
+
"train_tokens_per_second": 1349.346
|
| 241 |
},
|
| 242 |
{
|
| 243 |
"epoch": 0.5166846071044133,
|
| 244 |
+
"grad_norm": 1.4830386638641357,
|
| 245 |
+
"learning_rate": 9.293068794815175e-06,
|
| 246 |
+
"loss": 0.1456,
|
| 247 |
+
"num_input_tokens_seen": 1051936,
|
| 248 |
"step": 240,
|
| 249 |
+
"train_runtime": 778.3038,
|
| 250 |
+
"train_tokens_per_second": 1351.575
|
| 251 |
},
|
| 252 |
{
|
| 253 |
"epoch": 0.5382131324004306,
|
| 254 |
+
"grad_norm": 2.7361512184143066,
|
| 255 |
+
"learning_rate": 9.234262742348764e-06,
|
| 256 |
+
"loss": 0.165,
|
| 257 |
+
"num_input_tokens_seen": 1095904,
|
| 258 |
"step": 250,
|
| 259 |
+
"train_runtime": 809.3485,
|
| 260 |
+
"train_tokens_per_second": 1354.057
|
| 261 |
},
|
| 262 |
{
|
| 263 |
"epoch": 0.5597416576964478,
|
| 264 |
+
"grad_norm": 1.9473741054534912,
|
| 265 |
+
"learning_rate": 9.17330930061471e-06,
|
| 266 |
+
"loss": 0.1487,
|
| 267 |
+
"num_input_tokens_seen": 1140064,
|
| 268 |
"step": 260,
|
| 269 |
+
"train_runtime": 840.5464,
|
| 270 |
+
"train_tokens_per_second": 1356.337
|
| 271 |
},
|
| 272 |
{
|
| 273 |
"epoch": 0.581270182992465,
|
| 274 |
+
"grad_norm": 2.0610098838806152,
|
| 275 |
+
"learning_rate": 9.11023938190509e-06,
|
| 276 |
+
"loss": 0.1687,
|
| 277 |
+
"num_input_tokens_seen": 1183872,
|
| 278 |
"step": 270,
|
| 279 |
+
"train_runtime": 871.5774,
|
| 280 |
+
"train_tokens_per_second": 1358.31
|
| 281 |
},
|
| 282 |
{
|
| 283 |
"epoch": 0.6027987082884823,
|
| 284 |
+
"grad_norm": 3.2189598083496094,
|
| 285 |
+
"learning_rate": 9.045084971874738e-06,
|
| 286 |
+
"loss": 0.1511,
|
| 287 |
+
"num_input_tokens_seen": 1228544,
|
| 288 |
"step": 280,
|
| 289 |
+
"train_runtime": 903.1191,
|
| 290 |
+
"train_tokens_per_second": 1360.334
|
| 291 |
},
|
| 292 |
{
|
| 293 |
"epoch": 0.6243272335844995,
|
| 294 |
+
"grad_norm": 3.902757406234741,
|
| 295 |
+
"learning_rate": 8.977879113319847e-06,
|
| 296 |
+
"loss": 0.184,
|
| 297 |
+
"num_input_tokens_seen": 1271968,
|
| 298 |
"step": 290,
|
| 299 |
+
"train_runtime": 934.0522,
|
| 300 |
+
"train_tokens_per_second": 1361.774
|
| 301 |
},
|
| 302 |
{
|
| 303 |
"epoch": 0.6458557588805167,
|
| 304 |
+
"grad_norm": 4.2983012199401855,
|
| 305 |
+
"learning_rate": 8.90865588942046e-06,
|
| 306 |
+
"loss": 0.1305,
|
| 307 |
+
"num_input_tokens_seen": 1316096,
|
| 308 |
"step": 300,
|
| 309 |
+
"train_runtime": 965.1778,
|
| 310 |
+
"train_tokens_per_second": 1363.579
|
| 311 |
},
|
| 312 |
{
|
| 313 |
"epoch": 0.667384284176534,
|
| 314 |
+
"grad_norm": 2.6156394481658936,
|
| 315 |
+
"learning_rate": 8.83745040645531e-06,
|
| 316 |
+
"loss": 0.1405,
|
| 317 |
+
"num_input_tokens_seen": 1360256,
|
| 318 |
"step": 310,
|
| 319 |
+
"train_runtime": 996.4077,
|
| 320 |
+
"train_tokens_per_second": 1365.16
|
| 321 |
},
|
| 322 |
{
|
| 323 |
"epoch": 0.6889128094725512,
|
| 324 |
+
"grad_norm": 1.3506444692611694,
|
| 325 |
+
"learning_rate": 8.764298775997823e-06,
|
| 326 |
+
"loss": 0.1651,
|
| 327 |
+
"num_input_tokens_seen": 1404064,
|
| 328 |
"step": 320,
|
| 329 |
+
"train_runtime": 1027.5151,
|
| 330 |
+
"train_tokens_per_second": 1366.466
|
| 331 |
},
|
| 332 |
{
|
| 333 |
"epoch": 0.7104413347685683,
|
| 334 |
+
"grad_norm": 1.5117799043655396,
|
| 335 |
+
"learning_rate": 8.68923809660227e-06,
|
| 336 |
+
"loss": 0.1519,
|
| 337 |
+
"num_input_tokens_seen": 1448256,
|
| 338 |
"step": 330,
|
| 339 |
+
"train_runtime": 1058.74,
|
| 340 |
+
"train_tokens_per_second": 1367.905
|
| 341 |
},
|
| 342 |
{
|
| 343 |
"epoch": 0.7319698600645855,
|
| 344 |
+
"grad_norm": 1.2659231424331665,
|
| 345 |
+
"learning_rate": 8.612306434989395e-06,
|
| 346 |
+
"loss": 0.1574,
|
| 347 |
+
"num_input_tokens_seen": 1492448,
|
| 348 |
"step": 340,
|
| 349 |
+
"train_runtime": 1090.0052,
|
| 350 |
+
"train_tokens_per_second": 1369.212
|
| 351 |
},
|
| 352 |
{
|
| 353 |
"epoch": 0.7534983853606028,
|
| 354 |
+
"grad_norm": 2.6010894775390625,
|
| 355 |
+
"learning_rate": 8.53354280674102e-06,
|
| 356 |
+
"loss": 0.1587,
|
| 357 |
+
"num_input_tokens_seen": 1537440,
|
| 358 |
"step": 350,
|
| 359 |
+
"train_runtime": 1121.55,
|
| 360 |
+
"train_tokens_per_second": 1370.817
|
| 361 |
},
|
| 362 |
{
|
| 363 |
"epoch": 0.77502691065662,
|
| 364 |
+
"grad_norm": 1.6968097686767578,
|
| 365 |
+
"learning_rate": 8.452987156513457e-06,
|
| 366 |
+
"loss": 0.1513,
|
| 367 |
+
"num_input_tokens_seen": 1581280,
|
| 368 |
"step": 360,
|
| 369 |
+
"train_runtime": 1152.6858,
|
| 370 |
+
"train_tokens_per_second": 1371.822
|
| 371 |
},
|
| 372 |
{
|
| 373 |
"epoch": 0.7965554359526372,
|
| 374 |
+
"grad_norm": 2.0298380851745605,
|
| 375 |
+
"learning_rate": 8.370680337779737e-06,
|
| 376 |
+
"loss": 0.1401,
|
| 377 |
+
"num_input_tokens_seen": 1625824,
|
| 378 |
"step": 370,
|
| 379 |
+
"train_runtime": 1184.3507,
|
| 380 |
+
"train_tokens_per_second": 1372.756
|
| 381 |
},
|
| 382 |
{
|
| 383 |
"epoch": 0.8180839612486545,
|
| 384 |
+
"grad_norm": 2.7614028453826904,
|
| 385 |
+
"learning_rate": 8.286664092110935e-06,
|
| 386 |
+
"loss": 0.1135,
|
| 387 |
+
"num_input_tokens_seen": 1669472,
|
| 388 |
"step": 380,
|
| 389 |
+
"train_runtime": 1215.2935,
|
| 390 |
+
"train_tokens_per_second": 1373.719
|
| 391 |
},
|
| 392 |
{
|
| 393 |
"epoch": 0.8396124865446717,
|
| 394 |
+
"grad_norm": 1.6297581195831299,
|
| 395 |
+
"learning_rate": 8.200981028007095e-06,
|
| 396 |
+
"loss": 0.1645,
|
| 397 |
+
"num_input_tokens_seen": 1713312,
|
| 398 |
"step": 390,
|
| 399 |
+
"train_runtime": 1246.1254,
|
| 400 |
+
"train_tokens_per_second": 1374.911
|
| 401 |
},
|
| 402 |
{
|
| 403 |
"epoch": 0.8611410118406889,
|
| 404 |
+
"grad_norm": 2.32612943649292,
|
| 405 |
+
"learning_rate": 8.11367459928851e-06,
|
| 406 |
+
"loss": 0.1129,
|
| 407 |
+
"num_input_tokens_seen": 1757056,
|
| 408 |
"step": 400,
|
| 409 |
+
"train_runtime": 1277.0951,
|
| 410 |
+
"train_tokens_per_second": 1375.822
|
| 411 |
},
|
| 412 |
{
|
| 413 |
"epoch": 0.8826695371367062,
|
| 414 |
+
"grad_norm": 1.5576270818710327,
|
| 415 |
+
"learning_rate": 8.024789083058289e-06,
|
| 416 |
+
"loss": 0.1333,
|
| 417 |
+
"num_input_tokens_seen": 1801632,
|
| 418 |
"step": 410,
|
| 419 |
+
"train_runtime": 1308.5556,
|
| 420 |
+
"train_tokens_per_second": 1376.81
|
| 421 |
},
|
| 422 |
{
|
| 423 |
"epoch": 0.9041980624327234,
|
| 424 |
+
"grad_norm": 8.420344352722168,
|
| 425 |
+
"learning_rate": 7.934369557247397e-06,
|
| 426 |
+
"loss": 0.1311,
|
| 427 |
+
"num_input_tokens_seen": 1845280,
|
| 428 |
"step": 420,
|
| 429 |
+
"train_runtime": 1339.4668,
|
| 430 |
+
"train_tokens_per_second": 1377.623
|
| 431 |
},
|
| 432 |
{
|
| 433 |
"epoch": 0.9257265877287406,
|
| 434 |
+
"grad_norm": 1.7291479110717773,
|
| 435 |
+
"learning_rate": 7.842461877753575e-06,
|
| 436 |
+
"loss": 0.1395,
|
| 437 |
+
"num_input_tokens_seen": 1889472,
|
| 438 |
"step": 430,
|
| 439 |
+
"train_runtime": 1370.6369,
|
| 440 |
+
"train_tokens_per_second": 1378.536
|
| 441 |
},
|
| 442 |
{
|
| 443 |
"epoch": 0.9472551130247578,
|
| 444 |
+
"grad_norm": 2.441693067550659,
|
| 445 |
+
"learning_rate": 7.7491126551857e-06,
|
| 446 |
+
"loss": 0.1175,
|
| 447 |
+
"num_input_tokens_seen": 1932832,
|
| 448 |
"step": 440,
|
| 449 |
+
"train_runtime": 1401.3047,
|
| 450 |
+
"train_tokens_per_second": 1379.309
|
| 451 |
},
|
| 452 |
{
|
| 453 |
"epoch": 0.9687836383207751,
|
| 454 |
+
"grad_norm": 1.3606727123260498,
|
| 455 |
+
"learning_rate": 7.654369231225398e-06,
|
| 456 |
+
"loss": 0.1154,
|
| 457 |
+
"num_input_tokens_seen": 1976000,
|
| 458 |
"step": 450,
|
| 459 |
+
"train_runtime": 1431.9402,
|
| 460 |
+
"train_tokens_per_second": 1379.946
|
| 461 |
},
|
| 462 |
{
|
| 463 |
"epoch": 0.9903121636167922,
|
| 464 |
+
"grad_norm": 2.911600351333618,
|
| 465 |
+
"learning_rate": 7.5582796546179125e-06,
|
| 466 |
+
"loss": 0.1408,
|
| 467 |
+
"num_input_tokens_seen": 2019968,
|
| 468 |
"step": 460,
|
| 469 |
+
"train_runtime": 1463.035,
|
| 470 |
+
"train_tokens_per_second": 1380.67
|
| 471 |
},
|
| 472 |
{
|
| 473 |
"epoch": 1.0107642626480087,
|
| 474 |
+
"grad_norm": 2.967047929763794,
|
| 475 |
+
"learning_rate": 7.460892656804366e-06,
|
| 476 |
+
"loss": 0.1126,
|
| 477 |
+
"num_input_tokens_seen": 2061440,
|
| 478 |
"step": 470,
|
| 479 |
+
"train_runtime": 1492.4083,
|
| 480 |
+
"train_tokens_per_second": 1381.284
|
| 481 |
},
|
| 482 |
{
|
| 483 |
"epoch": 1.0322927879440258,
|
| 484 |
+
"grad_norm": 1.90776789188385,
|
| 485 |
+
"learning_rate": 7.362257627207818e-06,
|
| 486 |
+
"loss": 0.1329,
|
| 487 |
+
"num_input_tokens_seen": 2105216,
|
| 488 |
"step": 480,
|
| 489 |
+
"train_runtime": 1523.2979,
|
| 490 |
+
"train_tokens_per_second": 1382.012
|
| 491 |
},
|
| 492 |
{
|
| 493 |
"epoch": 1.0538213132400431,
|
| 494 |
+
"grad_norm": 2.7770872116088867,
|
| 495 |
+
"learning_rate": 7.2624245881856094e-06,
|
| 496 |
+
"loss": 0.111,
|
| 497 |
+
"num_input_tokens_seen": 2149888,
|
| 498 |
"step": 490,
|
| 499 |
+
"train_runtime": 1554.9287,
|
| 500 |
+
"train_tokens_per_second": 1382.628
|
| 501 |
},
|
| 502 |
{
|
| 503 |
"epoch": 1.0753498385360603,
|
| 504 |
+
"grad_norm": 1.9737987518310547,
|
| 505 |
+
"learning_rate": 7.161444169660723e-06,
|
| 506 |
+
"loss": 0.113,
|
| 507 |
+
"num_input_tokens_seen": 2194304,
|
| 508 |
"step": 500,
|
| 509 |
+
"train_runtime": 1586.2216,
|
| 510 |
+
"train_tokens_per_second": 1383.353
|
| 511 |
},
|
| 512 |
{
|
| 513 |
"epoch": 1.0968783638320776,
|
| 514 |
+
"grad_norm": 1.2335457801818848,
|
| 515 |
+
"learning_rate": 7.059367583445034e-06,
|
| 516 |
+
"loss": 0.1303,
|
| 517 |
+
"num_input_tokens_seen": 2238080,
|
| 518 |
"step": 510,
|
| 519 |
+
"train_runtime": 1617.0801,
|
| 520 |
+
"train_tokens_per_second": 1384.025
|
| 521 |
},
|
| 522 |
{
|
| 523 |
"epoch": 1.1184068891280947,
|
| 524 |
+
"grad_norm": 2.525258779525757,
|
| 525 |
+
"learning_rate": 6.956246597267438e-06,
|
| 526 |
+
"loss": 0.1404,
|
| 527 |
+
"num_input_tokens_seen": 2282368,
|
| 528 |
"step": 520,
|
| 529 |
+
"train_runtime": 1648.4109,
|
| 530 |
+
"train_tokens_per_second": 1384.587
|
| 531 |
},
|
| 532 |
{
|
| 533 |
"epoch": 1.1399354144241118,
|
| 534 |
+
"grad_norm": 4.016520977020264,
|
| 535 |
+
"learning_rate": 6.852133508520057e-06,
|
| 536 |
+
"loss": 0.0972,
|
| 537 |
+
"num_input_tokens_seen": 2325984,
|
| 538 |
"step": 530,
|
| 539 |
+
"train_runtime": 1679.3164,
|
| 540 |
+
"train_tokens_per_second": 1385.078
|
| 541 |
},
|
| 542 |
{
|
| 543 |
"epoch": 1.1614639397201292,
|
| 544 |
+
"grad_norm": 1.405586838722229,
|
| 545 |
+
"learning_rate": 6.747081117735829e-06,
|
| 546 |
+
"loss": 0.1092,
|
| 547 |
+
"num_input_tokens_seen": 2369664,
|
| 548 |
"step": 540,
|
| 549 |
+
"train_runtime": 1710.2475,
|
| 550 |
+
"train_tokens_per_second": 1385.568
|
| 551 |
},
|
| 552 |
{
|
| 553 |
"epoch": 1.1829924650161463,
|
| 554 |
+
"grad_norm": 2.151442766189575,
|
| 555 |
+
"learning_rate": 6.641142701810932e-06,
|
| 556 |
+
"loss": 0.1186,
|
| 557 |
+
"num_input_tokens_seen": 2413312,
|
| 558 |
"step": 550,
|
| 559 |
+
"train_runtime": 1741.213,
|
| 560 |
+
"train_tokens_per_second": 1385.995
|
| 561 |
},
|
| 562 |
{
|
| 563 |
"epoch": 1.2045209903121636,
|
| 564 |
+
"grad_norm": 1.9706578254699707,
|
| 565 |
+
"learning_rate": 6.534371986985618e-06,
|
| 566 |
+
"loss": 0.1332,
|
| 567 |
+
"num_input_tokens_seen": 2457120,
|
| 568 |
"step": 560,
|
| 569 |
+
"train_runtime": 1772.1204,
|
| 570 |
+
"train_tokens_per_second": 1386.542
|
| 571 |
},
|
| 572 |
{
|
| 573 |
"epoch": 1.2260495156081808,
|
| 574 |
+
"grad_norm": 2.3035449981689453,
|
| 575 |
+
"learning_rate": 6.426823121597169e-06,
|
| 576 |
+
"loss": 0.1481,
|
| 577 |
+
"num_input_tokens_seen": 2500736,
|
| 578 |
"step": 570,
|
| 579 |
+
"train_runtime": 1803.0834,
|
| 580 |
+
"train_tokens_per_second": 1386.922
|
| 581 |
},
|
| 582 |
{
|
| 583 |
"epoch": 1.247578040904198,
|
| 584 |
+
"grad_norm": 3.713632106781006,
|
| 585 |
+
"learning_rate": 6.318550648618785e-06,
|
| 586 |
+
"loss": 0.1332,
|
| 587 |
+
"num_input_tokens_seen": 2545056,
|
| 588 |
"step": 580,
|
| 589 |
+
"train_runtime": 1834.1935,
|
| 590 |
+
"train_tokens_per_second": 1387.561
|
| 591 |
},
|
| 592 |
{
|
| 593 |
"epoch": 1.2691065662002152,
|
| 594 |
+
"grad_norm": 1.8667478561401367,
|
| 595 |
+
"learning_rate": 6.209609477998339e-06,
|
| 596 |
+
"loss": 0.0978,
|
| 597 |
+
"num_input_tokens_seen": 2588416,
|
| 598 |
"step": 590,
|
| 599 |
+
"train_runtime": 1864.9784,
|
| 600 |
+
"train_tokens_per_second": 1387.907
|
| 601 |
},
|
| 602 |
{
|
| 603 |
"epoch": 1.2906350914962326,
|
| 604 |
+
"grad_norm": 2.295342445373535,
|
| 605 |
+
"learning_rate": 6.100054858811012e-06,
|
| 606 |
+
"loss": 0.1176,
|
| 607 |
+
"num_input_tokens_seen": 2632352,
|
| 608 |
"step": 600,
|
| 609 |
+
"train_runtime": 1896.108,
|
| 610 |
+
"train_tokens_per_second": 1388.292
|
| 611 |
},
|
| 612 |
{
|
| 613 |
"epoch": 1.3121636167922497,
|
| 614 |
+
"grad_norm": 2.2867720127105713,
|
| 615 |
+
"learning_rate": 5.989942351239954e-06,
|
| 616 |
+
"loss": 0.1279,
|
| 617 |
+
"num_input_tokens_seen": 2676640,
|
| 618 |
"step": 610,
|
| 619 |
+
"train_runtime": 1927.5126,
|
| 620 |
+
"train_tokens_per_second": 1388.65
|
| 621 |
},
|
| 622 |
{
|
| 623 |
"epoch": 1.333692142088267,
|
| 624 |
+
"grad_norm": 2.1158223152160645,
|
| 625 |
+
"learning_rate": 5.879327798399155e-06,
|
| 626 |
+
"loss": 0.1407,
|
| 627 |
+
"num_input_tokens_seen": 2719968,
|
| 628 |
"step": 620,
|
| 629 |
+
"train_runtime": 1958.2576,
|
| 630 |
+
"train_tokens_per_second": 1388.974
|
| 631 |
},
|
| 632 |
{
|
| 633 |
"epoch": 1.3552206673842842,
|
| 634 |
+
"grad_norm": 4.076441287994385,
|
| 635 |
+
"learning_rate": 5.768267298012841e-06,
|
| 636 |
+
"loss": 0.1168,
|
| 637 |
+
"num_input_tokens_seen": 2764352,
|
| 638 |
"step": 630,
|
| 639 |
+
"train_runtime": 1989.6781,
|
| 640 |
+
"train_tokens_per_second": 1389.346
|
| 641 |
},
|
| 642 |
{
|
| 643 |
"epoch": 1.3767491926803013,
|
| 644 |
+
"grad_norm": 4.354236602783203,
|
| 645 |
+
"learning_rate": 5.656817173965733e-06,
|
| 646 |
+
"loss": 0.1188,
|
| 647 |
+
"num_input_tokens_seen": 2808832,
|
| 648 |
"step": 640,
|
| 649 |
+
"train_runtime": 2021.0224,
|
| 650 |
+
"train_tokens_per_second": 1389.807
|
| 651 |
},
|
| 652 |
{
|
| 653 |
"epoch": 1.3982777179763186,
|
| 654 |
+
"grad_norm": 4.40167236328125,
|
| 655 |
+
"learning_rate": 5.545033947738624e-06,
|
| 656 |
+
"loss": 0.1326,
|
| 657 |
+
"num_input_tokens_seen": 2852192,
|
| 658 |
"step": 650,
|
| 659 |
+
"train_runtime": 2051.72,
|
| 660 |
+
"train_tokens_per_second": 1390.147
|
| 661 |
},
|
| 662 |
{
|
| 663 |
"epoch": 1.419806243272336,
|
| 664 |
+
"grad_norm": 2.4845104217529297,
|
| 665 |
+
"learning_rate": 5.4329743097437316e-06,
|
| 666 |
+
"loss": 0.1331,
|
| 667 |
+
"num_input_tokens_seen": 2896256,
|
| 668 |
"step": 660,
|
| 669 |
+
"train_runtime": 2082.7361,
|
| 670 |
+
"train_tokens_per_second": 1390.602
|
| 671 |
},
|
| 672 |
{
|
| 673 |
"epoch": 1.441334768568353,
|
| 674 |
+
"grad_norm": 2.7233705520629883,
|
| 675 |
+
"learning_rate": 5.320695090574386e-06,
|
| 676 |
+
"loss": 0.1082,
|
| 677 |
+
"num_input_tokens_seen": 2939552,
|
| 678 |
"step": 670,
|
| 679 |
+
"train_runtime": 2113.5367,
|
| 680 |
+
"train_tokens_per_second": 1390.821
|
| 681 |
},
|
| 682 |
{
|
| 683 |
"epoch": 1.4628632938643702,
|
| 684 |
+
"grad_norm": 3.289949893951416,
|
| 685 |
+
"learning_rate": 5.208253232183625e-06,
|
| 686 |
+
"loss": 0.1184,
|
| 687 |
+
"num_input_tokens_seen": 2984000,
|
| 688 |
"step": 680,
|
| 689 |
+
"train_runtime": 2144.7931,
|
| 690 |
+
"train_tokens_per_second": 1391.276
|
| 691 |
},
|
| 692 |
{
|
| 693 |
"epoch": 1.4843918191603875,
|
| 694 |
+
"grad_norm": 4.015010833740234,
|
| 695 |
+
"learning_rate": 5.095705759006311e-06,
|
| 696 |
+
"loss": 0.0942,
|
| 697 |
+
"num_input_tokens_seen": 3028192,
|
| 698 |
"step": 690,
|
| 699 |
+
"train_runtime": 2176.0229,
|
| 700 |
+
"train_tokens_per_second": 1391.618
|
| 701 |
},
|
| 702 |
{
|
| 703 |
"epoch": 1.5059203444564049,
|
| 704 |
+
"grad_norm": 5.474874973297119,
|
| 705 |
+
"learning_rate": 4.9831097490394195e-06,
|
| 706 |
+
"loss": 0.1204,
|
| 707 |
+
"num_input_tokens_seen": 3071392,
|
| 708 |
"step": 700,
|
| 709 |
+
"train_runtime": 2206.8218,
|
| 710 |
+
"train_tokens_per_second": 1391.772
|
| 711 |
},
|
| 712 |
{
|
| 713 |
"epoch": 1.527448869752422,
|
| 714 |
+
"grad_norm": 2.4211018085479736,
|
| 715 |
+
"learning_rate": 4.870522304895164e-06,
|
| 716 |
+
"loss": 0.1358,
|
| 717 |
+
"num_input_tokens_seen": 3114496,
|
| 718 |
"step": 710,
|
| 719 |
+
"train_runtime": 2237.5127,
|
| 720 |
+
"train_tokens_per_second": 1391.946
|
| 721 |
},
|
| 722 |
{
|
| 723 |
"epoch": 1.5489773950484391,
|
| 724 |
+
"grad_norm": 2.5446665287017822,
|
| 725 |
+
"learning_rate": 4.758000524841632e-06,
|
| 726 |
+
"loss": 0.1313,
|
| 727 |
+
"num_input_tokens_seen": 3158432,
|
| 728 |
"step": 720,
|
| 729 |
+
"train_runtime": 2268.6496,
|
| 730 |
+
"train_tokens_per_second": 1392.208
|
| 731 |
},
|
| 732 |
{
|
| 733 |
"epoch": 1.5705059203444565,
|
| 734 |
+
"grad_norm": 5.643487453460693,
|
| 735 |
+
"learning_rate": 4.645601473845636e-06,
|
| 736 |
+
"loss": 0.0879,
|
| 737 |
+
"num_input_tokens_seen": 3201888,
|
| 738 |
"step": 730,
|
| 739 |
+
"train_runtime": 2299.4823,
|
| 740 |
+
"train_tokens_per_second": 1392.439
|
| 741 |
},
|
| 742 |
{
|
| 743 |
"epoch": 1.5920344456404736,
|
| 744 |
+
"grad_norm": 1.8654100894927979,
|
| 745 |
+
"learning_rate": 4.533382154632442e-06,
|
| 746 |
+
"loss": 0.0977,
|
| 747 |
+
"num_input_tokens_seen": 3245856,
|
| 748 |
"step": 740,
|
| 749 |
+
"train_runtime": 2330.5679,
|
| 750 |
+
"train_tokens_per_second": 1392.732
|
| 751 |
},
|
| 752 |
{
|
| 753 |
"epoch": 1.6135629709364907,
|
| 754 |
+
"grad_norm": 2.2264926433563232,
|
| 755 |
+
"learning_rate": 4.421399478777064e-06,
|
| 756 |
+
"loss": 0.1483,
|
| 757 |
+
"num_input_tokens_seen": 3290208,
|
| 758 |
"step": 750,
|
| 759 |
+
"train_runtime": 2361.9169,
|
| 760 |
+
"train_tokens_per_second": 1393.024
|
| 761 |
},
|
| 762 |
{
|
| 763 |
"epoch": 1.635091496232508,
|
| 764 |
+
"grad_norm": 2.8280999660491943,
|
| 765 |
+
"learning_rate": 4.3097102378417985e-06,
|
| 766 |
+
"loss": 0.1285,
|
| 767 |
+
"num_input_tokens_seen": 3333152,
|
| 768 |
"step": 760,
|
| 769 |
+
"train_runtime": 2392.5926,
|
| 770 |
+
"train_tokens_per_second": 1393.113
|
| 771 |
},
|
| 772 |
{
|
| 773 |
"epoch": 1.6566200215285254,
|
| 774 |
+
"grad_norm": 3.5213840007781982,
|
| 775 |
+
"learning_rate": 4.198371074574597e-06,
|
| 776 |
+
"loss": 0.1475,
|
| 777 |
+
"num_input_tokens_seen": 3377664,
|
| 778 |
"step": 770,
|
| 779 |
+
"train_runtime": 2423.9491,
|
| 780 |
+
"train_tokens_per_second": 1393.455
|
| 781 |
},
|
| 782 |
{
|
| 783 |
"epoch": 1.6781485468245425,
|
| 784 |
+
"grad_norm": 3.323622226715088,
|
| 785 |
+
"learning_rate": 4.087438454182942e-06,
|
| 786 |
+
"loss": 0.0904,
|
| 787 |
+
"num_input_tokens_seen": 3422400,
|
| 788 |
"step": 780,
|
| 789 |
+
"train_runtime": 2455.5818,
|
| 790 |
+
"train_tokens_per_second": 1393.723
|
| 791 |
},
|
| 792 |
{
|
| 793 |
"epoch": 1.6996770721205596,
|
| 794 |
+
"grad_norm": 4.368185997009277,
|
| 795 |
+
"learning_rate": 3.976968635697732e-06,
|
| 796 |
+
"loss": 0.1199,
|
| 797 |
+
"num_input_tokens_seen": 3465760,
|
| 798 |
"step": 790,
|
| 799 |
+
"train_runtime": 2486.3362,
|
| 800 |
+
"train_tokens_per_second": 1393.922
|
| 801 |
},
|
| 802 |
{
|
| 803 |
"epoch": 1.721205597416577,
|
| 804 |
+
"grad_norm": 3.0081822872161865,
|
| 805 |
+
"learning_rate": 3.867017643441746e-06,
|
| 806 |
+
"loss": 0.102,
|
| 807 |
+
"num_input_tokens_seen": 3509760,
|
| 808 |
"step": 800,
|
| 809 |
+
"train_runtime": 2517.434,
|
| 810 |
+
"train_tokens_per_second": 1394.182
|
| 811 |
},
|
| 812 |
{
|
| 813 |
"epoch": 1.7427341227125943,
|
| 814 |
+
"grad_norm": 3.7257721424102783,
|
| 815 |
+
"learning_rate": 3.757641238617137e-06,
|
| 816 |
+
"loss": 0.1194,
|
| 817 |
+
"num_input_tokens_seen": 3554560,
|
| 818 |
"step": 810,
|
| 819 |
+
"train_runtime": 2549.4732,
|
| 820 |
+
"train_tokens_per_second": 1394.233
|
| 821 |
},
|
| 822 |
{
|
| 823 |
"epoch": 1.7642626480086114,
|
| 824 |
+
"grad_norm": 3.8365535736083984,
|
| 825 |
+
"learning_rate": 3.648894891026358e-06,
|
| 826 |
+
"loss": 0.1507,
|
| 827 |
+
"num_input_tokens_seen": 3599488,
|
| 828 |
"step": 820,
|
| 829 |
+
"train_runtime": 2581.0241,
|
| 830 |
+
"train_tokens_per_second": 1394.597
|
| 831 |
},
|
| 832 |
{
|
| 833 |
"epoch": 1.7857911733046286,
|
| 834 |
+
"grad_norm": 2.1309561729431152,
|
| 835 |
+
"learning_rate": 3.5408337509408764e-06,
|
| 836 |
+
"loss": 0.1015,
|
| 837 |
+
"num_input_tokens_seen": 3643680,
|
| 838 |
"step": 830,
|
| 839 |
+
"train_runtime": 2612.3216,
|
| 840 |
+
"train_tokens_per_second": 1394.805
|
| 841 |
},
|
| 842 |
{
|
| 843 |
"epoch": 1.807319698600646,
|
| 844 |
+
"grad_norm": 2.5082457065582275,
|
| 845 |
+
"learning_rate": 3.4335126211319412e-06,
|
| 846 |
+
"loss": 0.1165,
|
| 847 |
+
"num_input_tokens_seen": 3688160,
|
| 848 |
"step": 840,
|
| 849 |
+
"train_runtime": 2643.6717,
|
| 850 |
+
"train_tokens_per_second": 1395.09
|
| 851 |
},
|
| 852 |
{
|
| 853 |
"epoch": 1.8288482238966632,
|
| 854 |
+
"grad_norm": 1.4419660568237305,
|
| 855 |
+
"learning_rate": 3.32698592907757e-06,
|
| 856 |
+
"loss": 0.0958,
|
| 857 |
+
"num_input_tokens_seen": 3731392,
|
| 858 |
"step": 850,
|
| 859 |
+
"train_runtime": 2674.4286,
|
| 860 |
+
"train_tokens_per_second": 1395.211
|
| 861 |
},
|
| 862 |
{
|
| 863 |
"epoch": 1.8503767491926801,
|
| 864 |
+
"grad_norm": 2.402513027191162,
|
| 865 |
+
"learning_rate": 3.2213076993598857e-06,
|
| 866 |
+
"loss": 0.1505,
|
| 867 |
+
"num_input_tokens_seen": 3776128,
|
| 868 |
"step": 860,
|
| 869 |
+
"train_runtime": 2706.116,
|
| 870 |
+
"train_tokens_per_second": 1395.405
|
| 871 |
},
|
| 872 |
{
|
| 873 |
"epoch": 1.8719052744886975,
|
| 874 |
+
"grad_norm": 0.9779609441757202,
|
| 875 |
+
"learning_rate": 3.1165315262667535e-06,
|
| 876 |
+
"loss": 0.1003,
|
| 877 |
+
"num_input_tokens_seen": 3820896,
|
| 878 |
"step": 870,
|
| 879 |
+
"train_runtime": 2737.6181,
|
| 880 |
+
"train_tokens_per_second": 1395.701
|
| 881 |
},
|
| 882 |
{
|
| 883 |
"epoch": 1.8934337997847148,
|
| 884 |
+
"grad_norm": 3.727255344390869,
|
| 885 |
+
"learning_rate": 3.012710546611659e-06,
|
| 886 |
+
"loss": 0.1483,
|
| 887 |
+
"num_input_tokens_seen": 3864704,
|
| 888 |
"step": 880,
|
| 889 |
+
"train_runtime": 2768.6885,
|
| 890 |
+
"train_tokens_per_second": 1395.861
|
| 891 |
},
|
| 892 |
{
|
| 893 |
"epoch": 1.914962325080732,
|
| 894 |
+
"grad_norm": 1.5679094791412354,
|
| 895 |
+
"learning_rate": 2.9098974127856e-06,
|
| 896 |
+
"loss": 0.117,
|
| 897 |
+
"num_input_tokens_seen": 3908544,
|
| 898 |
"step": 890,
|
| 899 |
+
"train_runtime": 2799.6713,
|
| 900 |
+
"train_tokens_per_second": 1396.072
|
| 901 |
},
|
| 902 |
{
|
| 903 |
"epoch": 1.936490850376749,
|
| 904 |
+
"grad_norm": 2.775408983230591,
|
| 905 |
+
"learning_rate": 2.8081442660546126e-06,
|
| 906 |
+
"loss": 0.1303,
|
| 907 |
+
"num_input_tokens_seen": 3952576,
|
| 908 |
"step": 900,
|
| 909 |
+
"train_runtime": 2830.9247,
|
| 910 |
+
"train_tokens_per_second": 1396.214
|
| 911 |
},
|
| 912 |
{
|
| 913 |
"epoch": 1.9580193756727664,
|
| 914 |
+
"grad_norm": 1.0387197732925415,
|
| 915 |
+
"learning_rate": 2.7075027101165706e-06,
|
| 916 |
+
"loss": 0.0971,
|
| 917 |
+
"num_input_tokens_seen": 3996416,
|
| 918 |
"step": 910,
|
| 919 |
+
"train_runtime": 2862.0695,
|
| 920 |
+
"train_tokens_per_second": 1396.338
|
| 921 |
},
|
| 922 |
{
|
| 923 |
"epoch": 1.9795479009687837,
|
| 924 |
+
"grad_norm": 3.794166326522827,
|
| 925 |
+
"learning_rate": 2.6080237849305467e-06,
|
| 926 |
+
"loss": 0.132,
|
| 927 |
+
"num_input_tokens_seen": 4040736,
|
| 928 |
"step": 920,
|
| 929 |
+
"train_runtime": 2893.2903,
|
| 930 |
+
"train_tokens_per_second": 1396.589
|
| 931 |
},
|
| 932 |
{
|
| 933 |
"epoch": 2.0,
|
| 934 |
+
"grad_norm": 1.547866702079773,
|
| 935 |
+
"learning_rate": 2.5097579408321264e-06,
|
| 936 |
+
"loss": 0.093,
|
| 937 |
+
"num_input_tokens_seen": 4083200,
|
| 938 |
"step": 930,
|
| 939 |
+
"train_runtime": 2923.2158,
|
| 940 |
+
"train_tokens_per_second": 1396.818
|
| 941 |
},
|
| 942 |
{
|
| 943 |
"epoch": 2.0215285252960173,
|
| 944 |
+
"grad_norm": 3.5177085399627686,
|
| 945 |
+
"learning_rate": 2.4127550129477145e-06,
|
| 946 |
+
"loss": 0.1324,
|
| 947 |
+
"num_input_tokens_seen": 4127040,
|
| 948 |
"step": 940,
|
| 949 |
+
"train_runtime": 2954.2784,
|
| 950 |
+
"train_tokens_per_second": 1396.971
|
| 951 |
},
|
| 952 |
{
|
| 953 |
"epoch": 2.0430570505920342,
|
| 954 |
+
"grad_norm": 1.8717275857925415,
|
| 955 |
+
"learning_rate": 2.317064195920852e-06,
|
| 956 |
+
"loss": 0.0841,
|
| 957 |
+
"num_input_tokens_seen": 4170816,
|
| 958 |
"step": 950,
|
| 959 |
+
"train_runtime": 2985.3333,
|
| 960 |
+
"train_tokens_per_second": 1397.102
|
| 961 |
},
|
| 962 |
{
|
| 963 |
"epoch": 2.0645855758880516,
|
| 964 |
+
"grad_norm": 1.233929991722107,
|
| 965 |
+
"learning_rate": 2.2227340189633508e-06,
|
| 966 |
+
"loss": 0.1138,
|
| 967 |
+
"num_input_tokens_seen": 4214272,
|
| 968 |
"step": 960,
|
| 969 |
+
"train_runtime": 3016.1559,
|
| 970 |
+
"train_tokens_per_second": 1397.233
|
| 971 |
},
|
| 972 |
{
|
| 973 |
"epoch": 2.086114101184069,
|
| 974 |
+
"grad_norm": 1.6053682565689087,
|
| 975 |
+
"learning_rate": 2.1298123212439028e-06,
|
| 976 |
+
"loss": 0.0892,
|
| 977 |
+
"num_input_tokens_seen": 4258592,
|
| 978 |
"step": 970,
|
| 979 |
+
"train_runtime": 3047.3824,
|
| 980 |
+
"train_tokens_per_second": 1397.459
|
| 981 |
},
|
| 982 |
{
|
| 983 |
"epoch": 2.1076426264800863,
|
| 984 |
+
"grad_norm": 2.4293172359466553,
|
| 985 |
+
"learning_rate": 2.0383462276266347e-06,
|
| 986 |
+
"loss": 0.1277,
|
| 987 |
+
"num_input_tokens_seen": 4302656,
|
| 988 |
"step": 980,
|
| 989 |
+
"train_runtime": 3078.5923,
|
| 990 |
+
"train_tokens_per_second": 1397.605
|
| 991 |
},
|
| 992 |
{
|
| 993 |
"epoch": 2.129171151776103,
|
| 994 |
+
"grad_norm": 2.0637197494506836,
|
| 995 |
+
"learning_rate": 1.948382124771927e-06,
|
| 996 |
+
"loss": 0.0968,
|
| 997 |
+
"num_input_tokens_seen": 4345888,
|
| 998 |
"step": 990,
|
| 999 |
+
"train_runtime": 3109.3083,
|
| 1000 |
+
"train_tokens_per_second": 1397.703
|
| 1001 |
},
|
| 1002 |
{
|
| 1003 |
"epoch": 2.1506996770721205,
|
| 1004 |
+
"grad_norm": 3.5659446716308594,
|
| 1005 |
+
"learning_rate": 1.8599656376116026e-06,
|
| 1006 |
+
"loss": 0.1226,
|
| 1007 |
+
"num_input_tokens_seen": 4390528,
|
| 1008 |
"step": 1000,
|
| 1009 |
+
"train_runtime": 3140.7259,
|
| 1010 |
+
"train_tokens_per_second": 1397.934
|
| 1011 |
}
|
| 1012 |
],
|
| 1013 |
"logging_steps": 10,
|
| 1014 |
"max_steps": 1395,
|
| 1015 |
+
"num_input_tokens_seen": 4390528,
|
| 1016 |
"num_train_epochs": 3,
|
| 1017 |
"save_steps": 1000,
|
| 1018 |
"stateful_callbacks": {
|
|
|
|
| 1027 |
"attributes": {}
|
| 1028 |
}
|
| 1029 |
},
|
| 1030 |
+
"total_flos": 2.952664227770573e+17,
|
| 1031 |
"train_batch_size": 4,
|
| 1032 |
"trial_name": null,
|
| 1033 |
"trial_params": null
|
checkpoint-1000/training_args.bin
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 6161
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:57039f57f730004d2db4291a164c9a267ccb02be9b83d34e8933cba3e52ae325
|
| 3 |
size 6161
|
checkpoint-1395/adapter_config.json
CHANGED
|
@@ -28,154 +28,154 @@
|
|
| 28 |
"rank_pattern": {},
|
| 29 |
"revision": null,
|
| 30 |
"target_modules": [
|
| 31 |
-
"language_model.layers.6.self_attn.v_proj",
|
| 32 |
-
"37.self_attn.v_proj",
|
| 33 |
-
"46.self_attn.q_proj",
|
| 34 |
-
"32.self_attn.v_proj",
|
| 35 |
-
"29.self_attn.q_proj",
|
| 36 |
-
"language_model.layers.22.self_attn.v_proj",
|
| 37 |
-
"language_model.layers.26.self_attn.v_proj",
|
| 38 |
-
"language_model.layers.24.self_attn.v_proj",
|
| 39 |
-
"language_model.layers.9.self_attn.q_proj",
|
| 40 |
-
"27.self_attn.k_proj",
|
| 41 |
-
"47.self_attn.k_proj",
|
| 42 |
-
"language_model.layers.19.self_attn.k_proj",
|
| 43 |
-
"38.self_attn.q_proj",
|
| 44 |
-
"44.self_attn.k_proj",
|
| 45 |
-
"31.self_attn.q_proj",
|
| 46 |
-
"31.self_attn.v_proj",
|
| 47 |
-
"language_model.layers.4.self_attn.v_proj",
|
| 48 |
-
"40.self_attn.q_proj",
|
| 49 |
-
"language_model.layers.10.self_attn.k_proj",
|
| 50 |
-
"27.self_attn.q_proj",
|
| 51 |
-
"language_model.layers.6.self_attn.q_proj",
|
| 52 |
-
"language_model.layers.9.self_attn.k_proj",
|
| 53 |
"33.self_attn.q_proj",
|
| 54 |
-
"
|
| 55 |
-
"language_model.layers.
|
| 56 |
-
"language_model.layers.
|
| 57 |
-
"
|
| 58 |
-
"29.self_attn.k_proj",
|
| 59 |
-
"46.self_attn.k_proj",
|
| 60 |
-
"language_model.layers.26.self_attn.q_proj",
|
| 61 |
-
"33.self_attn.k_proj",
|
| 62 |
-
"language_model.layers.23.self_attn.v_proj",
|
| 63 |
-
"36.self_attn.q_proj",
|
| 64 |
-
"32.self_attn.q_proj",
|
| 65 |
-
"language_model.layers.23.self_attn.q_proj",
|
| 66 |
-
"29.self_attn.v_proj",
|
| 67 |
-
"language_model.layers.18.self_attn.k_proj",
|
| 68 |
-
"language_model.layers.21.self_attn.q_proj",
|
| 69 |
-
"40.self_attn.v_proj",
|
| 70 |
-
"language_model.layers.10.self_attn.q_proj",
|
| 71 |
-
"30.self_attn.k_proj",
|
| 72 |
-
"language_model.layers.25.self_attn.q_proj",
|
| 73 |
-
"language_model.layers.6.self_attn.k_proj",
|
| 74 |
-
"43.self_attn.k_proj",
|
| 75 |
-
"language_model.layers.14.self_attn.k_proj",
|
| 76 |
-
"language_model.layers.4.self_attn.q_proj",
|
| 77 |
-
"41.self_attn.k_proj",
|
| 78 |
-
"30.self_attn.v_proj",
|
| 79 |
-
"45.self_attn.q_proj",
|
| 80 |
-
"language_model.layers.18.self_attn.q_proj",
|
| 81 |
-
"language_model.layers.7.self_attn.v_proj",
|
| 82 |
-
"language_model.layers.25.self_attn.v_proj",
|
| 83 |
"language_model.layers.26.self_attn.k_proj",
|
| 84 |
-
"
|
| 85 |
-
"
|
| 86 |
-
"
|
| 87 |
-
"
|
| 88 |
-
"
|
| 89 |
-
"language_model.layers.
|
| 90 |
-
"
|
| 91 |
-
"
|
| 92 |
-
"language_model.layers.3.self_attn.v_proj",
|
| 93 |
-
"language_model.layers.12.self_attn.v_proj",
|
| 94 |
"language_model.layers.25.self_attn.k_proj",
|
| 95 |
-
"language_model.layers.
|
| 96 |
-
"
|
| 97 |
-
"language_model.layers.12.self_attn.k_proj",
|
| 98 |
-
"language_model.layers.14.self_attn.q_proj",
|
| 99 |
"42.self_attn.v_proj",
|
| 100 |
-
"
|
| 101 |
-
"language_model.layers.10.self_attn.v_proj",
|
| 102 |
-
"language_model.layers.11.self_attn.q_proj",
|
| 103 |
-
"36.self_attn.v_proj",
|
| 104 |
-
"44.self_attn.q_proj",
|
| 105 |
-
"language_model.layers.5.self_attn.k_proj",
|
| 106 |
-
"38.self_attn.v_proj",
|
| 107 |
-
"35.self_attn.q_proj",
|
| 108 |
"language_model.layers.15.self_attn.v_proj",
|
|
|
|
|
|
|
| 109 |
"45.self_attn.k_proj",
|
| 110 |
-
"o_proj",
|
| 111 |
-
"language_model.layers.7.self_attn.k_proj",
|
| 112 |
-
"language_model.layers.13.self_attn.v_proj",
|
| 113 |
-
"27.self_attn.v_proj",
|
| 114 |
-
"language_model.layers.8.self_attn.k_proj",
|
| 115 |
-
"language_model.layers.20.self_attn.k_proj",
|
| 116 |
-
"46.self_attn.v_proj",
|
| 117 |
"34.self_attn.v_proj",
|
|
|
|
|
|
|
|
|
|
| 118 |
"34.self_attn.q_proj",
|
| 119 |
-
"language_model.layers.12.self_attn.q_proj",
|
| 120 |
-
"language_model.layers.17.self_attn.k_proj",
|
| 121 |
"language_model.layers.2.self_attn.v_proj",
|
| 122 |
-
"
|
| 123 |
-
"
|
| 124 |
-
"
|
| 125 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
| 126 |
"39.self_attn.q_proj",
|
| 127 |
-
"language_model.layers.
|
| 128 |
-
"
|
| 129 |
-
"
|
| 130 |
-
"
|
| 131 |
-
"
|
| 132 |
-
"
|
| 133 |
"language_model.layers.2.self_attn.q_proj",
|
| 134 |
-
"
|
| 135 |
-
"
|
| 136 |
-
"language_model.layers.
|
|
|
|
|
|
|
|
|
|
|
|
|
| 137 |
"language_model.layers.13.self_attn.k_proj",
|
| 138 |
-
"
|
| 139 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 140 |
"language_model.layers.3.self_attn.q_proj",
|
| 141 |
-
"
|
| 142 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 143 |
"28.self_attn.k_proj",
|
| 144 |
-
"
|
| 145 |
-
"language_model.layers.19.self_attn.q_proj",
|
| 146 |
-
"language_model.layers.2.self_attn.k_proj",
|
| 147 |
-
"language_model.layers.1.self_attn.k_proj",
|
| 148 |
"language_model.layers.13.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 149 |
"language_model.layers.0.self_attn.q_proj",
|
| 150 |
-
"
|
| 151 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
| 152 |
"33.self_attn.v_proj",
|
| 153 |
-
"
|
| 154 |
-
"
|
| 155 |
-
"language_model.layers.
|
| 156 |
-
"language_model.layers.16.self_attn.k_proj",
|
| 157 |
-
"35.self_attn.k_proj",
|
| 158 |
-
"42.self_attn.q_proj",
|
| 159 |
-
"language_model.layers.1.self_attn.v_proj",
|
| 160 |
-
"34.self_attn.k_proj",
|
| 161 |
-
"43.self_attn.q_proj",
|
| 162 |
-
"language_model.layers.9.self_attn.v_proj",
|
| 163 |
"language_model.layers.17.self_attn.q_proj",
|
| 164 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 165 |
"38.self_attn.k_proj",
|
| 166 |
-
"language_model.layers.
|
| 167 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 168 |
"language_model.layers.7.self_attn.q_proj",
|
| 169 |
-
"
|
| 170 |
-
"language_model.layers.
|
| 171 |
-
"language_model.layers.
|
| 172 |
-
"
|
| 173 |
-
"language_model.layers.
|
| 174 |
-
"
|
| 175 |
-
"language_model.layers.
|
| 176 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 177 |
"35.self_attn.v_proj",
|
| 178 |
-
"language_model.layers.
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 179 |
],
|
| 180 |
"task_type": "CAUSAL_LM",
|
| 181 |
"trainable_token_indices": null,
|
|
|
|
| 28 |
"rank_pattern": {},
|
| 29 |
"revision": null,
|
| 30 |
"target_modules": [
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 31 |
"33.self_attn.q_proj",
|
| 32 |
+
"up_proj",
|
| 33 |
+
"language_model.layers.5.self_attn.k_proj",
|
| 34 |
+
"language_model.layers.11.self_attn.v_proj",
|
| 35 |
+
"32.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 36 |
"language_model.layers.26.self_attn.k_proj",
|
| 37 |
+
"38.self_attn.v_proj",
|
| 38 |
+
"36.self_attn.v_proj",
|
| 39 |
+
"39.self_attn.k_proj",
|
| 40 |
+
"language_model.layers.5.self_attn.q_proj",
|
| 41 |
+
"43.self_attn.k_proj",
|
| 42 |
+
"language_model.layers.16.self_attn.v_proj",
|
| 43 |
+
"37.self_attn.q_proj",
|
| 44 |
+
"language_model.layers.20.self_attn.k_proj",
|
|
|
|
|
|
|
| 45 |
"language_model.layers.25.self_attn.k_proj",
|
| 46 |
+
"language_model.layers.0.self_attn.k_proj",
|
| 47 |
+
"language_model.layers.8.self_attn.q_proj",
|
|
|
|
|
|
|
| 48 |
"42.self_attn.v_proj",
|
| 49 |
+
"38.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 50 |
"language_model.layers.15.self_attn.v_proj",
|
| 51 |
+
"language_model.layers.11.self_attn.k_proj",
|
| 52 |
+
"language_model.layers.21.self_attn.v_proj",
|
| 53 |
"45.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 54 |
"34.self_attn.v_proj",
|
| 55 |
+
"language_model.layers.16.self_attn.q_proj",
|
| 56 |
+
"language_model.layers.24.self_attn.q_proj",
|
| 57 |
+
"language_model.layers.19.self_attn.k_proj",
|
| 58 |
"34.self_attn.q_proj",
|
|
|
|
|
|
|
| 59 |
"language_model.layers.2.self_attn.v_proj",
|
| 60 |
+
"language_model.layers.6.self_attn.v_proj",
|
| 61 |
+
"33.self_attn.k_proj",
|
| 62 |
+
"32.self_attn.v_proj",
|
| 63 |
+
"41.self_attn.v_proj",
|
| 64 |
+
"language_model.layers.14.self_attn.q_proj",
|
| 65 |
+
"language_model.layers.23.self_attn.k_proj",
|
| 66 |
+
"30.self_attn.k_proj",
|
| 67 |
+
"40.self_attn.k_proj",
|
| 68 |
"39.self_attn.q_proj",
|
| 69 |
+
"language_model.layers.20.self_attn.q_proj",
|
| 70 |
+
"28.self_attn.v_proj",
|
| 71 |
+
"language_model.layers.8.self_attn.k_proj",
|
| 72 |
+
"language_model.layers.9.self_attn.k_proj",
|
| 73 |
+
"47.self_attn.k_proj",
|
| 74 |
+
"gate_proj",
|
| 75 |
"language_model.layers.2.self_attn.q_proj",
|
| 76 |
+
"language_model.layers.1.self_attn.q_proj",
|
| 77 |
+
"language_model.layers.7.self_attn.k_proj",
|
| 78 |
+
"language_model.layers.5.self_attn.v_proj",
|
| 79 |
+
"30.self_attn.q_proj",
|
| 80 |
+
"language_model.layers.7.self_attn.v_proj",
|
| 81 |
+
"45.self_attn.v_proj",
|
| 82 |
+
"language_model.layers.10.self_attn.q_proj",
|
| 83 |
"language_model.layers.13.self_attn.k_proj",
|
| 84 |
+
"43.self_attn.v_proj",
|
| 85 |
+
"44.self_attn.k_proj",
|
| 86 |
+
"43.self_attn.q_proj",
|
| 87 |
+
"language_model.layers.2.self_attn.k_proj",
|
| 88 |
+
"language_model.layers.10.self_attn.v_proj",
|
| 89 |
+
"language_model.layers.17.self_attn.k_proj",
|
| 90 |
+
"o_proj",
|
| 91 |
"language_model.layers.3.self_attn.q_proj",
|
| 92 |
+
"44.self_attn.q_proj",
|
| 93 |
+
"language_model.layers.18.self_attn.k_proj",
|
| 94 |
+
"language_model.layers.25.self_attn.v_proj",
|
| 95 |
+
"45.self_attn.q_proj",
|
| 96 |
+
"language_model.layers.12.self_attn.q_proj",
|
| 97 |
+
"29.self_attn.v_proj",
|
| 98 |
+
"language_model.layers.18.self_attn.v_proj",
|
| 99 |
+
"language_model.layers.15.self_attn.q_proj",
|
| 100 |
+
"down_proj",
|
| 101 |
+
"42.self_attn.q_proj",
|
| 102 |
+
"language_model.layers.8.self_attn.v_proj",
|
| 103 |
"28.self_attn.k_proj",
|
| 104 |
+
"31.self_attn.q_proj",
|
|
|
|
|
|
|
|
|
|
| 105 |
"language_model.layers.13.self_attn.q_proj",
|
| 106 |
+
"language_model.layers.1.self_attn.v_proj",
|
| 107 |
+
"31.self_attn.k_proj",
|
| 108 |
+
"language_model.layers.20.self_attn.v_proj",
|
| 109 |
+
"language_model.layers.18.self_attn.q_proj",
|
| 110 |
+
"language_model.layers.23.self_attn.v_proj",
|
| 111 |
+
"language_model.layers.6.self_attn.q_proj",
|
| 112 |
+
"language_model.layers.10.self_attn.k_proj",
|
| 113 |
+
"language_model.layers.26.self_attn.v_proj",
|
| 114 |
+
"40.self_attn.q_proj",
|
| 115 |
+
"36.self_attn.k_proj",
|
| 116 |
+
"language_model.layers.13.self_attn.v_proj",
|
| 117 |
+
"language_model.layers.23.self_attn.q_proj",
|
| 118 |
+
"42.self_attn.k_proj",
|
| 119 |
+
"27.self_attn.v_proj",
|
| 120 |
+
"27.self_attn.k_proj",
|
| 121 |
+
"30.self_attn.v_proj",
|
| 122 |
+
"27.self_attn.q_proj",
|
| 123 |
"language_model.layers.0.self_attn.q_proj",
|
| 124 |
+
"language_model.layers.0.self_attn.v_proj",
|
| 125 |
+
"31.self_attn.v_proj",
|
| 126 |
+
"language_model.layers.4.self_attn.v_proj",
|
| 127 |
+
"language_model.layers.25.self_attn.q_proj",
|
| 128 |
+
"language_model.layers.22.self_attn.q_proj",
|
| 129 |
+
"language_model.layers.12.self_attn.v_proj",
|
| 130 |
"33.self_attn.v_proj",
|
| 131 |
+
"37.self_attn.v_proj",
|
| 132 |
+
"41.self_attn.k_proj",
|
| 133 |
+
"language_model.layers.4.self_attn.k_proj",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 134 |
"language_model.layers.17.self_attn.q_proj",
|
| 135 |
+
"language_model.layers.21.self_attn.q_proj",
|
| 136 |
+
"language_model.layers.16.self_attn.k_proj",
|
| 137 |
+
"language_model.layers.6.self_attn.k_proj",
|
| 138 |
+
"46.self_attn.k_proj",
|
| 139 |
+
"language_model.layers.14.self_attn.v_proj",
|
| 140 |
+
"40.self_attn.v_proj",
|
| 141 |
"38.self_attn.k_proj",
|
| 142 |
+
"language_model.layers.9.self_attn.q_proj",
|
| 143 |
+
"language_model.layers.26.self_attn.q_proj",
|
| 144 |
+
"language_model.layers.24.self_attn.v_proj",
|
| 145 |
+
"29.self_attn.q_proj",
|
| 146 |
+
"41.self_attn.q_proj",
|
| 147 |
+
"language_model.layers.19.self_attn.v_proj",
|
| 148 |
+
"language_model.layers.22.self_attn.v_proj",
|
| 149 |
+
"language_model.layers.21.self_attn.k_proj",
|
| 150 |
"language_model.layers.7.self_attn.q_proj",
|
| 151 |
+
"32.self_attn.q_proj",
|
| 152 |
+
"language_model.layers.15.self_attn.k_proj",
|
| 153 |
+
"language_model.layers.12.self_attn.k_proj",
|
| 154 |
+
"39.self_attn.v_proj",
|
| 155 |
+
"language_model.layers.9.self_attn.v_proj",
|
| 156 |
+
"35.self_attn.k_proj",
|
| 157 |
+
"language_model.layers.19.self_attn.q_proj",
|
| 158 |
+
"28.self_attn.q_proj",
|
| 159 |
+
"language_model.layers.14.self_attn.k_proj",
|
| 160 |
+
"language_model.layers.3.self_attn.k_proj",
|
| 161 |
+
"language_model.layers.1.self_attn.k_proj",
|
| 162 |
+
"37.self_attn.k_proj",
|
| 163 |
+
"34.self_attn.k_proj",
|
| 164 |
+
"language_model.layers.3.self_attn.v_proj",
|
| 165 |
+
"36.self_attn.q_proj",
|
| 166 |
+
"47.self_attn.v_proj",
|
| 167 |
+
"44.self_attn.v_proj",
|
| 168 |
+
"29.self_attn.k_proj",
|
| 169 |
+
"46.self_attn.q_proj",
|
| 170 |
+
"46.self_attn.v_proj",
|
| 171 |
"35.self_attn.v_proj",
|
| 172 |
+
"language_model.layers.22.self_attn.k_proj",
|
| 173 |
+
"language_model.layers.11.self_attn.q_proj",
|
| 174 |
+
"language_model.layers.4.self_attn.q_proj",
|
| 175 |
+
"35.self_attn.q_proj",
|
| 176 |
+
"47.self_attn.q_proj",
|
| 177 |
+
"language_model.layers.24.self_attn.k_proj",
|
| 178 |
+
"language_model.layers.17.self_attn.v_proj"
|
| 179 |
],
|
| 180 |
"task_type": "CAUSAL_LM",
|
| 181 |
"trainable_token_indices": null,
|
checkpoint-1395/adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 131040264
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:67b732d78c0543831c924f30a3e9f4ece7c9a51233bdd3e7eb43386b23a450d0
|
| 3 |
size 131040264
|
checkpoint-1395/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:371bd29df57f0b68f647ef91d63f07f30b6d43adad1b0c06305737ab7fd6f039
|
| 3 |
+
size 262448707
|
checkpoint-1395/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:19035d721a929da85a91bb94cf56d4101c916b8fc2a3f94436a29d093658f249
|
| 3 |
size 1465
|
checkpoint-1395/special_tokens_map.json
CHANGED
|
@@ -9,7 +9,7 @@
|
|
| 9 |
},
|
| 10 |
"eoi_token": "<end_of_image>",
|
| 11 |
"eos_token": {
|
| 12 |
-
"content": "<
|
| 13 |
"lstrip": false,
|
| 14 |
"normalized": false,
|
| 15 |
"rstrip": false,
|
|
|
|
| 9 |
},
|
| 10 |
"eoi_token": "<end_of_image>",
|
| 11 |
"eos_token": {
|
| 12 |
+
"content": "<end_of_turn>",
|
| 13 |
"lstrip": false,
|
| 14 |
"normalized": false,
|
| 15 |
"rstrip": false,
|
checkpoint-1395/tokenizer_config.json
CHANGED
|
@@ -51327,7 +51327,7 @@
|
|
| 51327 |
"bos_token": "<bos>",
|
| 51328 |
"clean_up_tokenization_spaces": false,
|
| 51329 |
"eoi_token": "<end_of_image>",
|
| 51330 |
-
"eos_token": "<
|
| 51331 |
"extra_special_tokens": {
|
| 51332 |
"boi_token": "<start_of_image>",
|
| 51333 |
"eoi_token": "<end_of_image>",
|
|
|
|
| 51327 |
"bos_token": "<bos>",
|
| 51328 |
"clean_up_tokenization_spaces": false,
|
| 51329 |
"eoi_token": "<end_of_image>",
|
| 51330 |
+
"eos_token": "<end_of_turn>",
|
| 51331 |
"extra_special_tokens": {
|
| 51332 |
"boi_token": "<start_of_image>",
|
| 51333 |
"eoi_token": "<end_of_image>",
|
checkpoint-1395/trainer_state.json
CHANGED
|
@@ -11,1398 +11,1398 @@
|
|
| 11 |
"log_history": [
|
| 12 |
{
|
| 13 |
"epoch": 0.021528525296017224,
|
| 14 |
-
"grad_norm":
|
| 15 |
-
"learning_rate":
|
| 16 |
-
"loss":
|
| 17 |
-
"num_input_tokens_seen":
|
| 18 |
"step": 10,
|
| 19 |
-
"train_runtime":
|
| 20 |
-
"train_tokens_per_second":
|
| 21 |
},
|
| 22 |
{
|
| 23 |
"epoch": 0.04305705059203445,
|
| 24 |
-
"grad_norm":
|
| 25 |
-
"learning_rate":
|
| 26 |
-
"loss": 0.
|
| 27 |
-
"num_input_tokens_seen":
|
| 28 |
"step": 20,
|
| 29 |
-
"train_runtime":
|
| 30 |
-
"train_tokens_per_second":
|
| 31 |
},
|
| 32 |
{
|
| 33 |
"epoch": 0.06458557588805167,
|
| 34 |
-
"grad_norm":
|
| 35 |
-
"learning_rate":
|
| 36 |
-
"loss": 0.
|
| 37 |
-
"num_input_tokens_seen":
|
| 38 |
"step": 30,
|
| 39 |
-
"train_runtime":
|
| 40 |
-
"train_tokens_per_second":
|
| 41 |
},
|
| 42 |
{
|
| 43 |
"epoch": 0.0861141011840689,
|
| 44 |
-
"grad_norm":
|
| 45 |
-
"learning_rate":
|
| 46 |
-
"loss": 0.
|
| 47 |
-
"num_input_tokens_seen":
|
| 48 |
"step": 40,
|
| 49 |
-
"train_runtime":
|
| 50 |
-
"train_tokens_per_second":
|
| 51 |
},
|
| 52 |
{
|
| 53 |
"epoch": 0.10764262648008611,
|
| 54 |
-
"grad_norm":
|
| 55 |
-
"learning_rate":
|
| 56 |
-
"loss": 0.
|
| 57 |
-
"num_input_tokens_seen":
|
| 58 |
"step": 50,
|
| 59 |
-
"train_runtime":
|
| 60 |
-
"train_tokens_per_second":
|
| 61 |
},
|
| 62 |
{
|
| 63 |
"epoch": 0.12917115177610333,
|
| 64 |
-
"grad_norm":
|
| 65 |
-
"learning_rate":
|
| 66 |
-
"loss": 0.
|
| 67 |
-
"num_input_tokens_seen":
|
| 68 |
"step": 60,
|
| 69 |
-
"train_runtime":
|
| 70 |
-
"train_tokens_per_second":
|
| 71 |
},
|
| 72 |
{
|
| 73 |
"epoch": 0.15069967707212056,
|
| 74 |
-
"grad_norm":
|
| 75 |
-
"learning_rate":
|
| 76 |
-
"loss": 0.
|
| 77 |
-
"num_input_tokens_seen":
|
| 78 |
"step": 70,
|
| 79 |
-
"train_runtime":
|
| 80 |
-
"train_tokens_per_second":
|
| 81 |
},
|
| 82 |
{
|
| 83 |
"epoch": 0.1722282023681378,
|
| 84 |
-
"grad_norm":
|
| 85 |
-
"learning_rate":
|
| 86 |
-
"loss": 0.
|
| 87 |
-
"num_input_tokens_seen":
|
| 88 |
"step": 80,
|
| 89 |
-
"train_runtime":
|
| 90 |
-
"train_tokens_per_second":
|
| 91 |
},
|
| 92 |
{
|
| 93 |
"epoch": 0.193756727664155,
|
| 94 |
-
"grad_norm":
|
| 95 |
-
"learning_rate":
|
| 96 |
-
"loss": 0.
|
| 97 |
-
"num_input_tokens_seen":
|
| 98 |
"step": 90,
|
| 99 |
-
"train_runtime":
|
| 100 |
-
"train_tokens_per_second":
|
| 101 |
},
|
| 102 |
{
|
| 103 |
"epoch": 0.21528525296017223,
|
| 104 |
-
"grad_norm":
|
| 105 |
-
"learning_rate":
|
| 106 |
-
"loss": 0.
|
| 107 |
-
"num_input_tokens_seen":
|
| 108 |
"step": 100,
|
| 109 |
-
"train_runtime":
|
| 110 |
-
"train_tokens_per_second":
|
| 111 |
},
|
| 112 |
{
|
| 113 |
"epoch": 0.23681377825618946,
|
| 114 |
-
"grad_norm":
|
| 115 |
-
"learning_rate":
|
| 116 |
-
"loss": 0.
|
| 117 |
-
"num_input_tokens_seen":
|
| 118 |
"step": 110,
|
| 119 |
-
"train_runtime":
|
| 120 |
-
"train_tokens_per_second":
|
| 121 |
},
|
| 122 |
{
|
| 123 |
"epoch": 0.25834230355220666,
|
| 124 |
-
"grad_norm":
|
| 125 |
-
"learning_rate":
|
| 126 |
-
"loss": 0.
|
| 127 |
-
"num_input_tokens_seen":
|
| 128 |
"step": 120,
|
| 129 |
-
"train_runtime":
|
| 130 |
-
"train_tokens_per_second":
|
| 131 |
},
|
| 132 |
{
|
| 133 |
"epoch": 0.2798708288482239,
|
| 134 |
-
"grad_norm":
|
| 135 |
-
"learning_rate":
|
| 136 |
-
"loss": 0.
|
| 137 |
-
"num_input_tokens_seen":
|
| 138 |
"step": 130,
|
| 139 |
-
"train_runtime":
|
| 140 |
-
"train_tokens_per_second":
|
| 141 |
},
|
| 142 |
{
|
| 143 |
"epoch": 0.3013993541442411,
|
| 144 |
-
"grad_norm":
|
| 145 |
-
"learning_rate":
|
| 146 |
-
"loss": 0.
|
| 147 |
-
"num_input_tokens_seen":
|
| 148 |
"step": 140,
|
| 149 |
-
"train_runtime":
|
| 150 |
-
"train_tokens_per_second":
|
| 151 |
},
|
| 152 |
{
|
| 153 |
"epoch": 0.32292787944025836,
|
| 154 |
-
"grad_norm":
|
| 155 |
-
"learning_rate":
|
| 156 |
-
"loss": 0.
|
| 157 |
-
"num_input_tokens_seen":
|
| 158 |
"step": 150,
|
| 159 |
-
"train_runtime":
|
| 160 |
-
"train_tokens_per_second":
|
| 161 |
},
|
| 162 |
{
|
| 163 |
"epoch": 0.3444564047362756,
|
| 164 |
-
"grad_norm":
|
| 165 |
-
"learning_rate":
|
| 166 |
-
"loss": 0.
|
| 167 |
-
"num_input_tokens_seen":
|
| 168 |
"step": 160,
|
| 169 |
-
"train_runtime":
|
| 170 |
-
"train_tokens_per_second":
|
| 171 |
},
|
| 172 |
{
|
| 173 |
"epoch": 0.36598493003229277,
|
| 174 |
-
"grad_norm":
|
| 175 |
-
"learning_rate":
|
| 176 |
-
"loss": 0.
|
| 177 |
-
"num_input_tokens_seen":
|
| 178 |
"step": 170,
|
| 179 |
-
"train_runtime":
|
| 180 |
-
"train_tokens_per_second":
|
| 181 |
},
|
| 182 |
{
|
| 183 |
"epoch": 0.38751345532831,
|
| 184 |
-
"grad_norm":
|
| 185 |
-
"learning_rate":
|
| 186 |
-
"loss": 0.
|
| 187 |
-
"num_input_tokens_seen":
|
| 188 |
"step": 180,
|
| 189 |
-
"train_runtime":
|
| 190 |
-
"train_tokens_per_second":
|
| 191 |
},
|
| 192 |
{
|
| 193 |
"epoch": 0.40904198062432723,
|
| 194 |
-
"grad_norm":
|
| 195 |
-
"learning_rate":
|
| 196 |
-
"loss": 0.
|
| 197 |
-
"num_input_tokens_seen":
|
| 198 |
"step": 190,
|
| 199 |
-
"train_runtime":
|
| 200 |
-
"train_tokens_per_second":
|
| 201 |
},
|
| 202 |
{
|
| 203 |
"epoch": 0.43057050592034446,
|
| 204 |
-
"grad_norm":
|
| 205 |
-
"learning_rate":
|
| 206 |
-
"loss": 0.
|
| 207 |
-
"num_input_tokens_seen":
|
| 208 |
"step": 200,
|
| 209 |
-
"train_runtime":
|
| 210 |
-
"train_tokens_per_second":
|
| 211 |
},
|
| 212 |
{
|
| 213 |
"epoch": 0.4520990312163617,
|
| 214 |
-
"grad_norm":
|
| 215 |
-
"learning_rate":
|
| 216 |
-
"loss": 0.
|
| 217 |
-
"num_input_tokens_seen":
|
| 218 |
"step": 210,
|
| 219 |
-
"train_runtime":
|
| 220 |
-
"train_tokens_per_second":
|
| 221 |
},
|
| 222 |
{
|
| 223 |
"epoch": 0.4736275565123789,
|
| 224 |
-
"grad_norm":
|
| 225 |
-
"learning_rate":
|
| 226 |
-
"loss": 0.
|
| 227 |
-
"num_input_tokens_seen":
|
| 228 |
"step": 220,
|
| 229 |
-
"train_runtime":
|
| 230 |
-
"train_tokens_per_second":
|
| 231 |
},
|
| 232 |
{
|
| 233 |
"epoch": 0.4951560818083961,
|
| 234 |
-
"grad_norm":
|
| 235 |
-
"learning_rate":
|
| 236 |
-
"loss": 0.
|
| 237 |
-
"num_input_tokens_seen":
|
| 238 |
"step": 230,
|
| 239 |
-
"train_runtime":
|
| 240 |
-
"train_tokens_per_second":
|
| 241 |
},
|
| 242 |
{
|
| 243 |
"epoch": 0.5166846071044133,
|
| 244 |
-
"grad_norm":
|
| 245 |
-
"learning_rate":
|
| 246 |
-
"loss": 0.
|
| 247 |
-
"num_input_tokens_seen":
|
| 248 |
"step": 240,
|
| 249 |
-
"train_runtime":
|
| 250 |
-
"train_tokens_per_second":
|
| 251 |
},
|
| 252 |
{
|
| 253 |
"epoch": 0.5382131324004306,
|
| 254 |
-
"grad_norm":
|
| 255 |
-
"learning_rate":
|
| 256 |
-
"loss": 0.
|
| 257 |
-
"num_input_tokens_seen":
|
| 258 |
"step": 250,
|
| 259 |
-
"train_runtime":
|
| 260 |
-
"train_tokens_per_second":
|
| 261 |
},
|
| 262 |
{
|
| 263 |
"epoch": 0.5597416576964478,
|
| 264 |
-
"grad_norm":
|
| 265 |
-
"learning_rate":
|
| 266 |
-
"loss": 0.
|
| 267 |
-
"num_input_tokens_seen":
|
| 268 |
"step": 260,
|
| 269 |
-
"train_runtime":
|
| 270 |
-
"train_tokens_per_second":
|
| 271 |
},
|
| 272 |
{
|
| 273 |
"epoch": 0.581270182992465,
|
| 274 |
-
"grad_norm":
|
| 275 |
-
"learning_rate":
|
| 276 |
-
"loss": 0.
|
| 277 |
-
"num_input_tokens_seen":
|
| 278 |
"step": 270,
|
| 279 |
-
"train_runtime":
|
| 280 |
-
"train_tokens_per_second":
|
| 281 |
},
|
| 282 |
{
|
| 283 |
"epoch": 0.6027987082884823,
|
| 284 |
-
"grad_norm":
|
| 285 |
-
"learning_rate":
|
| 286 |
-
"loss": 0.
|
| 287 |
-
"num_input_tokens_seen":
|
| 288 |
"step": 280,
|
| 289 |
-
"train_runtime":
|
| 290 |
-
"train_tokens_per_second":
|
| 291 |
},
|
| 292 |
{
|
| 293 |
"epoch": 0.6243272335844995,
|
| 294 |
-
"grad_norm":
|
| 295 |
-
"learning_rate":
|
| 296 |
-
"loss": 0.
|
| 297 |
-
"num_input_tokens_seen":
|
| 298 |
"step": 290,
|
| 299 |
-
"train_runtime":
|
| 300 |
-
"train_tokens_per_second":
|
| 301 |
},
|
| 302 |
{
|
| 303 |
"epoch": 0.6458557588805167,
|
| 304 |
-
"grad_norm":
|
| 305 |
-
"learning_rate":
|
| 306 |
-
"loss": 0.
|
| 307 |
-
"num_input_tokens_seen":
|
| 308 |
"step": 300,
|
| 309 |
-
"train_runtime":
|
| 310 |
-
"train_tokens_per_second":
|
| 311 |
},
|
| 312 |
{
|
| 313 |
"epoch": 0.667384284176534,
|
| 314 |
-
"grad_norm":
|
| 315 |
-
"learning_rate":
|
| 316 |
-
"loss": 0.
|
| 317 |
-
"num_input_tokens_seen":
|
| 318 |
"step": 310,
|
| 319 |
-
"train_runtime":
|
| 320 |
-
"train_tokens_per_second":
|
| 321 |
},
|
| 322 |
{
|
| 323 |
"epoch": 0.6889128094725512,
|
| 324 |
-
"grad_norm":
|
| 325 |
-
"learning_rate":
|
| 326 |
-
"loss": 0.
|
| 327 |
-
"num_input_tokens_seen":
|
| 328 |
"step": 320,
|
| 329 |
-
"train_runtime":
|
| 330 |
-
"train_tokens_per_second":
|
| 331 |
},
|
| 332 |
{
|
| 333 |
"epoch": 0.7104413347685683,
|
| 334 |
-
"grad_norm":
|
| 335 |
-
"learning_rate":
|
| 336 |
-
"loss": 0.
|
| 337 |
-
"num_input_tokens_seen":
|
| 338 |
"step": 330,
|
| 339 |
-
"train_runtime":
|
| 340 |
-
"train_tokens_per_second":
|
| 341 |
},
|
| 342 |
{
|
| 343 |
"epoch": 0.7319698600645855,
|
| 344 |
-
"grad_norm":
|
| 345 |
-
"learning_rate":
|
| 346 |
-
"loss": 0.
|
| 347 |
-
"num_input_tokens_seen":
|
| 348 |
"step": 340,
|
| 349 |
-
"train_runtime":
|
| 350 |
-
"train_tokens_per_second":
|
| 351 |
},
|
| 352 |
{
|
| 353 |
"epoch": 0.7534983853606028,
|
| 354 |
-
"grad_norm":
|
| 355 |
-
"learning_rate":
|
| 356 |
-
"loss": 0.
|
| 357 |
-
"num_input_tokens_seen":
|
| 358 |
"step": 350,
|
| 359 |
-
"train_runtime":
|
| 360 |
-
"train_tokens_per_second":
|
| 361 |
},
|
| 362 |
{
|
| 363 |
"epoch": 0.77502691065662,
|
| 364 |
-
"grad_norm":
|
| 365 |
-
"learning_rate":
|
| 366 |
-
"loss": 0.
|
| 367 |
-
"num_input_tokens_seen":
|
| 368 |
"step": 360,
|
| 369 |
-
"train_runtime":
|
| 370 |
-
"train_tokens_per_second":
|
| 371 |
},
|
| 372 |
{
|
| 373 |
"epoch": 0.7965554359526372,
|
| 374 |
-
"grad_norm":
|
| 375 |
-
"learning_rate":
|
| 376 |
-
"loss": 0.
|
| 377 |
-
"num_input_tokens_seen":
|
| 378 |
"step": 370,
|
| 379 |
-
"train_runtime":
|
| 380 |
-
"train_tokens_per_second":
|
| 381 |
},
|
| 382 |
{
|
| 383 |
"epoch": 0.8180839612486545,
|
| 384 |
-
"grad_norm":
|
| 385 |
-
"learning_rate":
|
| 386 |
-
"loss": 0.
|
| 387 |
-
"num_input_tokens_seen":
|
| 388 |
"step": 380,
|
| 389 |
-
"train_runtime":
|
| 390 |
-
"train_tokens_per_second":
|
| 391 |
},
|
| 392 |
{
|
| 393 |
"epoch": 0.8396124865446717,
|
| 394 |
-
"grad_norm":
|
| 395 |
-
"learning_rate":
|
| 396 |
-
"loss": 0.
|
| 397 |
-
"num_input_tokens_seen":
|
| 398 |
"step": 390,
|
| 399 |
-
"train_runtime":
|
| 400 |
-
"train_tokens_per_second":
|
| 401 |
},
|
| 402 |
{
|
| 403 |
"epoch": 0.8611410118406889,
|
| 404 |
-
"grad_norm":
|
| 405 |
-
"learning_rate":
|
| 406 |
-
"loss": 0.
|
| 407 |
-
"num_input_tokens_seen":
|
| 408 |
"step": 400,
|
| 409 |
-
"train_runtime":
|
| 410 |
-
"train_tokens_per_second":
|
| 411 |
},
|
| 412 |
{
|
| 413 |
"epoch": 0.8826695371367062,
|
| 414 |
-
"grad_norm":
|
| 415 |
-
"learning_rate":
|
| 416 |
-
"loss": 0.
|
| 417 |
-
"num_input_tokens_seen":
|
| 418 |
"step": 410,
|
| 419 |
-
"train_runtime":
|
| 420 |
-
"train_tokens_per_second":
|
| 421 |
},
|
| 422 |
{
|
| 423 |
"epoch": 0.9041980624327234,
|
| 424 |
-
"grad_norm":
|
| 425 |
-
"learning_rate":
|
| 426 |
-
"loss": 0.
|
| 427 |
-
"num_input_tokens_seen":
|
| 428 |
"step": 420,
|
| 429 |
-
"train_runtime":
|
| 430 |
-
"train_tokens_per_second":
|
| 431 |
},
|
| 432 |
{
|
| 433 |
"epoch": 0.9257265877287406,
|
| 434 |
-
"grad_norm":
|
| 435 |
-
"learning_rate":
|
| 436 |
-
"loss": 0.
|
| 437 |
-
"num_input_tokens_seen":
|
| 438 |
"step": 430,
|
| 439 |
-
"train_runtime":
|
| 440 |
-
"train_tokens_per_second":
|
| 441 |
},
|
| 442 |
{
|
| 443 |
"epoch": 0.9472551130247578,
|
| 444 |
-
"grad_norm":
|
| 445 |
-
"learning_rate":
|
| 446 |
-
"loss": 0.
|
| 447 |
-
"num_input_tokens_seen":
|
| 448 |
"step": 440,
|
| 449 |
-
"train_runtime":
|
| 450 |
-
"train_tokens_per_second":
|
| 451 |
},
|
| 452 |
{
|
| 453 |
"epoch": 0.9687836383207751,
|
| 454 |
-
"grad_norm":
|
| 455 |
-
"learning_rate":
|
| 456 |
-
"loss": 0.
|
| 457 |
-
"num_input_tokens_seen":
|
| 458 |
"step": 450,
|
| 459 |
-
"train_runtime":
|
| 460 |
-
"train_tokens_per_second":
|
| 461 |
},
|
| 462 |
{
|
| 463 |
"epoch": 0.9903121636167922,
|
| 464 |
-
"grad_norm":
|
| 465 |
-
"learning_rate":
|
| 466 |
-
"loss": 0.
|
| 467 |
-
"num_input_tokens_seen":
|
| 468 |
"step": 460,
|
| 469 |
-
"train_runtime":
|
| 470 |
-
"train_tokens_per_second":
|
| 471 |
},
|
| 472 |
{
|
| 473 |
"epoch": 1.0107642626480087,
|
| 474 |
-
"grad_norm":
|
| 475 |
-
"learning_rate":
|
| 476 |
-
"loss": 0.
|
| 477 |
-
"num_input_tokens_seen":
|
| 478 |
"step": 470,
|
| 479 |
-
"train_runtime":
|
| 480 |
-
"train_tokens_per_second":
|
| 481 |
},
|
| 482 |
{
|
| 483 |
"epoch": 1.0322927879440258,
|
| 484 |
-
"grad_norm":
|
| 485 |
-
"learning_rate":
|
| 486 |
-
"loss": 0.
|
| 487 |
-
"num_input_tokens_seen":
|
| 488 |
"step": 480,
|
| 489 |
-
"train_runtime":
|
| 490 |
-
"train_tokens_per_second":
|
| 491 |
},
|
| 492 |
{
|
| 493 |
"epoch": 1.0538213132400431,
|
| 494 |
-
"grad_norm":
|
| 495 |
-
"learning_rate":
|
| 496 |
-
"loss": 0.
|
| 497 |
-
"num_input_tokens_seen":
|
| 498 |
"step": 490,
|
| 499 |
-
"train_runtime":
|
| 500 |
-
"train_tokens_per_second":
|
| 501 |
},
|
| 502 |
{
|
| 503 |
"epoch": 1.0753498385360603,
|
| 504 |
-
"grad_norm":
|
| 505 |
-
"learning_rate":
|
| 506 |
-
"loss": 0.
|
| 507 |
-
"num_input_tokens_seen":
|
| 508 |
"step": 500,
|
| 509 |
-
"train_runtime":
|
| 510 |
-
"train_tokens_per_second":
|
| 511 |
},
|
| 512 |
{
|
| 513 |
"epoch": 1.0968783638320776,
|
| 514 |
-
"grad_norm":
|
| 515 |
-
"learning_rate":
|
| 516 |
-
"loss": 0.
|
| 517 |
-
"num_input_tokens_seen":
|
| 518 |
"step": 510,
|
| 519 |
-
"train_runtime":
|
| 520 |
-
"train_tokens_per_second":
|
| 521 |
},
|
| 522 |
{
|
| 523 |
"epoch": 1.1184068891280947,
|
| 524 |
-
"grad_norm":
|
| 525 |
-
"learning_rate":
|
| 526 |
-
"loss": 0.
|
| 527 |
-
"num_input_tokens_seen":
|
| 528 |
"step": 520,
|
| 529 |
-
"train_runtime":
|
| 530 |
-
"train_tokens_per_second":
|
| 531 |
},
|
| 532 |
{
|
| 533 |
"epoch": 1.1399354144241118,
|
| 534 |
-
"grad_norm":
|
| 535 |
-
"learning_rate":
|
| 536 |
-
"loss": 0.
|
| 537 |
-
"num_input_tokens_seen":
|
| 538 |
"step": 530,
|
| 539 |
-
"train_runtime":
|
| 540 |
-
"train_tokens_per_second":
|
| 541 |
},
|
| 542 |
{
|
| 543 |
"epoch": 1.1614639397201292,
|
| 544 |
-
"grad_norm":
|
| 545 |
-
"learning_rate":
|
| 546 |
-
"loss": 0.
|
| 547 |
-
"num_input_tokens_seen":
|
| 548 |
"step": 540,
|
| 549 |
-
"train_runtime":
|
| 550 |
-
"train_tokens_per_second":
|
| 551 |
},
|
| 552 |
{
|
| 553 |
"epoch": 1.1829924650161463,
|
| 554 |
-
"grad_norm":
|
| 555 |
-
"learning_rate":
|
| 556 |
-
"loss": 0.
|
| 557 |
-
"num_input_tokens_seen":
|
| 558 |
"step": 550,
|
| 559 |
-
"train_runtime":
|
| 560 |
-
"train_tokens_per_second":
|
| 561 |
},
|
| 562 |
{
|
| 563 |
"epoch": 1.2045209903121636,
|
| 564 |
-
"grad_norm":
|
| 565 |
-
"learning_rate":
|
| 566 |
-
"loss": 0.
|
| 567 |
-
"num_input_tokens_seen":
|
| 568 |
"step": 560,
|
| 569 |
-
"train_runtime":
|
| 570 |
-
"train_tokens_per_second":
|
| 571 |
},
|
| 572 |
{
|
| 573 |
"epoch": 1.2260495156081808,
|
| 574 |
-
"grad_norm":
|
| 575 |
-
"learning_rate":
|
| 576 |
-
"loss": 0.
|
| 577 |
-
"num_input_tokens_seen":
|
| 578 |
"step": 570,
|
| 579 |
-
"train_runtime":
|
| 580 |
-
"train_tokens_per_second":
|
| 581 |
},
|
| 582 |
{
|
| 583 |
"epoch": 1.247578040904198,
|
| 584 |
-
"grad_norm":
|
| 585 |
-
"learning_rate":
|
| 586 |
-
"loss": 0.
|
| 587 |
-
"num_input_tokens_seen":
|
| 588 |
"step": 580,
|
| 589 |
-
"train_runtime":
|
| 590 |
-
"train_tokens_per_second":
|
| 591 |
},
|
| 592 |
{
|
| 593 |
"epoch": 1.2691065662002152,
|
| 594 |
-
"grad_norm":
|
| 595 |
-
"learning_rate":
|
| 596 |
-
"loss": 0.
|
| 597 |
-
"num_input_tokens_seen":
|
| 598 |
"step": 590,
|
| 599 |
-
"train_runtime":
|
| 600 |
-
"train_tokens_per_second":
|
| 601 |
},
|
| 602 |
{
|
| 603 |
"epoch": 1.2906350914962326,
|
| 604 |
-
"grad_norm":
|
| 605 |
-
"learning_rate":
|
| 606 |
-
"loss": 0.
|
| 607 |
-
"num_input_tokens_seen":
|
| 608 |
"step": 600,
|
| 609 |
-
"train_runtime":
|
| 610 |
-
"train_tokens_per_second":
|
| 611 |
},
|
| 612 |
{
|
| 613 |
"epoch": 1.3121636167922497,
|
| 614 |
-
"grad_norm":
|
| 615 |
-
"learning_rate":
|
| 616 |
-
"loss": 0.
|
| 617 |
-
"num_input_tokens_seen":
|
| 618 |
"step": 610,
|
| 619 |
-
"train_runtime":
|
| 620 |
-
"train_tokens_per_second":
|
| 621 |
},
|
| 622 |
{
|
| 623 |
"epoch": 1.333692142088267,
|
| 624 |
-
"grad_norm":
|
| 625 |
-
"learning_rate":
|
| 626 |
-
"loss": 0.
|
| 627 |
-
"num_input_tokens_seen":
|
| 628 |
"step": 620,
|
| 629 |
-
"train_runtime":
|
| 630 |
-
"train_tokens_per_second":
|
| 631 |
},
|
| 632 |
{
|
| 633 |
"epoch": 1.3552206673842842,
|
| 634 |
-
"grad_norm":
|
| 635 |
-
"learning_rate":
|
| 636 |
-
"loss": 0.
|
| 637 |
-
"num_input_tokens_seen":
|
| 638 |
"step": 630,
|
| 639 |
-
"train_runtime":
|
| 640 |
-
"train_tokens_per_second":
|
| 641 |
},
|
| 642 |
{
|
| 643 |
"epoch": 1.3767491926803013,
|
| 644 |
-
"grad_norm":
|
| 645 |
-
"learning_rate":
|
| 646 |
-
"loss": 0.
|
| 647 |
-
"num_input_tokens_seen":
|
| 648 |
"step": 640,
|
| 649 |
-
"train_runtime":
|
| 650 |
-
"train_tokens_per_second":
|
| 651 |
},
|
| 652 |
{
|
| 653 |
"epoch": 1.3982777179763186,
|
| 654 |
-
"grad_norm":
|
| 655 |
-
"learning_rate":
|
| 656 |
-
"loss": 0.
|
| 657 |
-
"num_input_tokens_seen":
|
| 658 |
"step": 650,
|
| 659 |
-
"train_runtime":
|
| 660 |
-
"train_tokens_per_second":
|
| 661 |
},
|
| 662 |
{
|
| 663 |
"epoch": 1.419806243272336,
|
| 664 |
-
"grad_norm":
|
| 665 |
-
"learning_rate":
|
| 666 |
-
"loss": 0.
|
| 667 |
-
"num_input_tokens_seen":
|
| 668 |
"step": 660,
|
| 669 |
-
"train_runtime":
|
| 670 |
-
"train_tokens_per_second":
|
| 671 |
},
|
| 672 |
{
|
| 673 |
"epoch": 1.441334768568353,
|
| 674 |
-
"grad_norm":
|
| 675 |
-
"learning_rate":
|
| 676 |
-
"loss": 0.
|
| 677 |
-
"num_input_tokens_seen":
|
| 678 |
"step": 670,
|
| 679 |
-
"train_runtime":
|
| 680 |
-
"train_tokens_per_second":
|
| 681 |
},
|
| 682 |
{
|
| 683 |
"epoch": 1.4628632938643702,
|
| 684 |
-
"grad_norm":
|
| 685 |
-
"learning_rate":
|
| 686 |
-
"loss": 0.
|
| 687 |
-
"num_input_tokens_seen":
|
| 688 |
"step": 680,
|
| 689 |
-
"train_runtime":
|
| 690 |
-
"train_tokens_per_second":
|
| 691 |
},
|
| 692 |
{
|
| 693 |
"epoch": 1.4843918191603875,
|
| 694 |
-
"grad_norm":
|
| 695 |
-
"learning_rate":
|
| 696 |
-
"loss": 0.
|
| 697 |
-
"num_input_tokens_seen":
|
| 698 |
"step": 690,
|
| 699 |
-
"train_runtime":
|
| 700 |
-
"train_tokens_per_second":
|
| 701 |
},
|
| 702 |
{
|
| 703 |
"epoch": 1.5059203444564049,
|
| 704 |
-
"grad_norm":
|
| 705 |
-
"learning_rate":
|
| 706 |
-
"loss": 0.
|
| 707 |
-
"num_input_tokens_seen":
|
| 708 |
"step": 700,
|
| 709 |
-
"train_runtime":
|
| 710 |
-
"train_tokens_per_second":
|
| 711 |
},
|
| 712 |
{
|
| 713 |
"epoch": 1.527448869752422,
|
| 714 |
-
"grad_norm":
|
| 715 |
-
"learning_rate":
|
| 716 |
-
"loss": 0.
|
| 717 |
-
"num_input_tokens_seen":
|
| 718 |
"step": 710,
|
| 719 |
-
"train_runtime":
|
| 720 |
-
"train_tokens_per_second":
|
| 721 |
},
|
| 722 |
{
|
| 723 |
"epoch": 1.5489773950484391,
|
| 724 |
-
"grad_norm":
|
| 725 |
-
"learning_rate":
|
| 726 |
-
"loss": 0.
|
| 727 |
-
"num_input_tokens_seen":
|
| 728 |
"step": 720,
|
| 729 |
-
"train_runtime":
|
| 730 |
-
"train_tokens_per_second":
|
| 731 |
},
|
| 732 |
{
|
| 733 |
"epoch": 1.5705059203444565,
|
| 734 |
-
"grad_norm":
|
| 735 |
-
"learning_rate":
|
| 736 |
-
"loss": 0.
|
| 737 |
-
"num_input_tokens_seen":
|
| 738 |
"step": 730,
|
| 739 |
-
"train_runtime":
|
| 740 |
-
"train_tokens_per_second":
|
| 741 |
},
|
| 742 |
{
|
| 743 |
"epoch": 1.5920344456404736,
|
| 744 |
-
"grad_norm":
|
| 745 |
-
"learning_rate":
|
| 746 |
-
"loss": 0.
|
| 747 |
-
"num_input_tokens_seen":
|
| 748 |
"step": 740,
|
| 749 |
-
"train_runtime":
|
| 750 |
-
"train_tokens_per_second":
|
| 751 |
},
|
| 752 |
{
|
| 753 |
"epoch": 1.6135629709364907,
|
| 754 |
-
"grad_norm":
|
| 755 |
-
"learning_rate":
|
| 756 |
-
"loss": 0.
|
| 757 |
-
"num_input_tokens_seen":
|
| 758 |
"step": 750,
|
| 759 |
-
"train_runtime":
|
| 760 |
-
"train_tokens_per_second":
|
| 761 |
},
|
| 762 |
{
|
| 763 |
"epoch": 1.635091496232508,
|
| 764 |
-
"grad_norm":
|
| 765 |
-
"learning_rate":
|
| 766 |
-
"loss": 0.
|
| 767 |
-
"num_input_tokens_seen":
|
| 768 |
"step": 760,
|
| 769 |
-
"train_runtime":
|
| 770 |
-
"train_tokens_per_second":
|
| 771 |
},
|
| 772 |
{
|
| 773 |
"epoch": 1.6566200215285254,
|
| 774 |
-
"grad_norm":
|
| 775 |
-
"learning_rate":
|
| 776 |
-
"loss": 0.
|
| 777 |
-
"num_input_tokens_seen":
|
| 778 |
"step": 770,
|
| 779 |
-
"train_runtime":
|
| 780 |
-
"train_tokens_per_second":
|
| 781 |
},
|
| 782 |
{
|
| 783 |
"epoch": 1.6781485468245425,
|
| 784 |
-
"grad_norm":
|
| 785 |
-
"learning_rate":
|
| 786 |
-
"loss": 0.
|
| 787 |
-
"num_input_tokens_seen":
|
| 788 |
"step": 780,
|
| 789 |
-
"train_runtime":
|
| 790 |
-
"train_tokens_per_second":
|
| 791 |
},
|
| 792 |
{
|
| 793 |
"epoch": 1.6996770721205596,
|
| 794 |
-
"grad_norm":
|
| 795 |
-
"learning_rate":
|
| 796 |
-
"loss": 0.
|
| 797 |
-
"num_input_tokens_seen":
|
| 798 |
"step": 790,
|
| 799 |
-
"train_runtime":
|
| 800 |
-
"train_tokens_per_second":
|
| 801 |
},
|
| 802 |
{
|
| 803 |
"epoch": 1.721205597416577,
|
| 804 |
-
"grad_norm":
|
| 805 |
-
"learning_rate":
|
| 806 |
-
"loss": 0.
|
| 807 |
-
"num_input_tokens_seen":
|
| 808 |
"step": 800,
|
| 809 |
-
"train_runtime":
|
| 810 |
-
"train_tokens_per_second":
|
| 811 |
},
|
| 812 |
{
|
| 813 |
"epoch": 1.7427341227125943,
|
| 814 |
-
"grad_norm":
|
| 815 |
-
"learning_rate":
|
| 816 |
-
"loss": 0.
|
| 817 |
-
"num_input_tokens_seen":
|
| 818 |
"step": 810,
|
| 819 |
-
"train_runtime":
|
| 820 |
-
"train_tokens_per_second":
|
| 821 |
},
|
| 822 |
{
|
| 823 |
"epoch": 1.7642626480086114,
|
| 824 |
-
"grad_norm":
|
| 825 |
-
"learning_rate":
|
| 826 |
-
"loss": 0.
|
| 827 |
-
"num_input_tokens_seen":
|
| 828 |
"step": 820,
|
| 829 |
-
"train_runtime":
|
| 830 |
-
"train_tokens_per_second":
|
| 831 |
},
|
| 832 |
{
|
| 833 |
"epoch": 1.7857911733046286,
|
| 834 |
-
"grad_norm":
|
| 835 |
-
"learning_rate":
|
| 836 |
-
"loss": 0.
|
| 837 |
-
"num_input_tokens_seen":
|
| 838 |
"step": 830,
|
| 839 |
-
"train_runtime":
|
| 840 |
-
"train_tokens_per_second":
|
| 841 |
},
|
| 842 |
{
|
| 843 |
"epoch": 1.807319698600646,
|
| 844 |
-
"grad_norm":
|
| 845 |
-
"learning_rate":
|
| 846 |
-
"loss": 0.
|
| 847 |
-
"num_input_tokens_seen":
|
| 848 |
"step": 840,
|
| 849 |
-
"train_runtime":
|
| 850 |
-
"train_tokens_per_second":
|
| 851 |
},
|
| 852 |
{
|
| 853 |
"epoch": 1.8288482238966632,
|
| 854 |
-
"grad_norm":
|
| 855 |
-
"learning_rate":
|
| 856 |
-
"loss": 0.
|
| 857 |
-
"num_input_tokens_seen":
|
| 858 |
"step": 850,
|
| 859 |
-
"train_runtime":
|
| 860 |
-
"train_tokens_per_second":
|
| 861 |
},
|
| 862 |
{
|
| 863 |
"epoch": 1.8503767491926801,
|
| 864 |
-
"grad_norm":
|
| 865 |
-
"learning_rate":
|
| 866 |
-
"loss": 0.
|
| 867 |
-
"num_input_tokens_seen":
|
| 868 |
"step": 860,
|
| 869 |
-
"train_runtime":
|
| 870 |
-
"train_tokens_per_second":
|
| 871 |
},
|
| 872 |
{
|
| 873 |
"epoch": 1.8719052744886975,
|
| 874 |
-
"grad_norm":
|
| 875 |
-
"learning_rate":
|
| 876 |
-
"loss": 0.
|
| 877 |
-
"num_input_tokens_seen":
|
| 878 |
"step": 870,
|
| 879 |
-
"train_runtime":
|
| 880 |
-
"train_tokens_per_second":
|
| 881 |
},
|
| 882 |
{
|
| 883 |
"epoch": 1.8934337997847148,
|
| 884 |
-
"grad_norm":
|
| 885 |
-
"learning_rate":
|
| 886 |
-
"loss": 0.
|
| 887 |
-
"num_input_tokens_seen":
|
| 888 |
"step": 880,
|
| 889 |
-
"train_runtime":
|
| 890 |
-
"train_tokens_per_second":
|
| 891 |
},
|
| 892 |
{
|
| 893 |
"epoch": 1.914962325080732,
|
| 894 |
-
"grad_norm":
|
| 895 |
-
"learning_rate":
|
| 896 |
-
"loss": 0.
|
| 897 |
-
"num_input_tokens_seen":
|
| 898 |
"step": 890,
|
| 899 |
-
"train_runtime":
|
| 900 |
-
"train_tokens_per_second":
|
| 901 |
},
|
| 902 |
{
|
| 903 |
"epoch": 1.936490850376749,
|
| 904 |
-
"grad_norm":
|
| 905 |
-
"learning_rate":
|
| 906 |
-
"loss": 0.
|
| 907 |
-
"num_input_tokens_seen":
|
| 908 |
"step": 900,
|
| 909 |
-
"train_runtime":
|
| 910 |
-
"train_tokens_per_second":
|
| 911 |
},
|
| 912 |
{
|
| 913 |
"epoch": 1.9580193756727664,
|
| 914 |
-
"grad_norm":
|
| 915 |
-
"learning_rate":
|
| 916 |
-
"loss": 0.
|
| 917 |
-
"num_input_tokens_seen":
|
| 918 |
"step": 910,
|
| 919 |
-
"train_runtime":
|
| 920 |
-
"train_tokens_per_second":
|
| 921 |
},
|
| 922 |
{
|
| 923 |
"epoch": 1.9795479009687837,
|
| 924 |
-
"grad_norm":
|
| 925 |
-
"learning_rate":
|
| 926 |
-
"loss": 0.
|
| 927 |
-
"num_input_tokens_seen":
|
| 928 |
"step": 920,
|
| 929 |
-
"train_runtime":
|
| 930 |
-
"train_tokens_per_second":
|
| 931 |
},
|
| 932 |
{
|
| 933 |
"epoch": 2.0,
|
| 934 |
-
"grad_norm":
|
| 935 |
-
"learning_rate":
|
| 936 |
-
"loss": 0.
|
| 937 |
-
"num_input_tokens_seen":
|
| 938 |
"step": 930,
|
| 939 |
-
"train_runtime":
|
| 940 |
-
"train_tokens_per_second":
|
| 941 |
},
|
| 942 |
{
|
| 943 |
"epoch": 2.0215285252960173,
|
| 944 |
-
"grad_norm":
|
| 945 |
-
"learning_rate":
|
| 946 |
-
"loss": 0.
|
| 947 |
-
"num_input_tokens_seen":
|
| 948 |
"step": 940,
|
| 949 |
-
"train_runtime":
|
| 950 |
-
"train_tokens_per_second":
|
| 951 |
},
|
| 952 |
{
|
| 953 |
"epoch": 2.0430570505920342,
|
| 954 |
-
"grad_norm":
|
| 955 |
-
"learning_rate":
|
| 956 |
-
"loss": 0.
|
| 957 |
-
"num_input_tokens_seen":
|
| 958 |
"step": 950,
|
| 959 |
-
"train_runtime":
|
| 960 |
-
"train_tokens_per_second":
|
| 961 |
},
|
| 962 |
{
|
| 963 |
"epoch": 2.0645855758880516,
|
| 964 |
-
"grad_norm":
|
| 965 |
-
"learning_rate":
|
| 966 |
-
"loss": 0.
|
| 967 |
-
"num_input_tokens_seen":
|
| 968 |
"step": 960,
|
| 969 |
-
"train_runtime":
|
| 970 |
-
"train_tokens_per_second":
|
| 971 |
},
|
| 972 |
{
|
| 973 |
"epoch": 2.086114101184069,
|
| 974 |
-
"grad_norm":
|
| 975 |
-
"learning_rate":
|
| 976 |
-
"loss": 0.
|
| 977 |
-
"num_input_tokens_seen":
|
| 978 |
"step": 970,
|
| 979 |
-
"train_runtime":
|
| 980 |
-
"train_tokens_per_second":
|
| 981 |
},
|
| 982 |
{
|
| 983 |
"epoch": 2.1076426264800863,
|
| 984 |
-
"grad_norm":
|
| 985 |
-
"learning_rate":
|
| 986 |
-
"loss": 0.
|
| 987 |
-
"num_input_tokens_seen":
|
| 988 |
"step": 980,
|
| 989 |
-
"train_runtime":
|
| 990 |
-
"train_tokens_per_second":
|
| 991 |
},
|
| 992 |
{
|
| 993 |
"epoch": 2.129171151776103,
|
| 994 |
-
"grad_norm":
|
| 995 |
-
"learning_rate":
|
| 996 |
-
"loss": 0.
|
| 997 |
-
"num_input_tokens_seen":
|
| 998 |
"step": 990,
|
| 999 |
-
"train_runtime":
|
| 1000 |
-
"train_tokens_per_second":
|
| 1001 |
},
|
| 1002 |
{
|
| 1003 |
"epoch": 2.1506996770721205,
|
| 1004 |
-
"grad_norm":
|
| 1005 |
-
"learning_rate":
|
| 1006 |
-
"loss": 0.
|
| 1007 |
-
"num_input_tokens_seen":
|
| 1008 |
"step": 1000,
|
| 1009 |
-
"train_runtime":
|
| 1010 |
-
"train_tokens_per_second":
|
| 1011 |
},
|
| 1012 |
{
|
| 1013 |
"epoch": 2.172228202368138,
|
| 1014 |
-
"grad_norm":
|
| 1015 |
-
"learning_rate":
|
| 1016 |
-
"loss": 0.
|
| 1017 |
-
"num_input_tokens_seen":
|
| 1018 |
"step": 1010,
|
| 1019 |
-
"train_runtime":
|
| 1020 |
-
"train_tokens_per_second":
|
| 1021 |
},
|
| 1022 |
{
|
| 1023 |
"epoch": 2.193756727664155,
|
| 1024 |
-
"grad_norm":
|
| 1025 |
-
"learning_rate":
|
| 1026 |
-
"loss": 0.
|
| 1027 |
-
"num_input_tokens_seen":
|
| 1028 |
"step": 1020,
|
| 1029 |
-
"train_runtime":
|
| 1030 |
-
"train_tokens_per_second":
|
| 1031 |
},
|
| 1032 |
{
|
| 1033 |
"epoch": 2.215285252960172,
|
| 1034 |
-
"grad_norm":
|
| 1035 |
-
"learning_rate":
|
| 1036 |
-
"loss": 0.
|
| 1037 |
-
"num_input_tokens_seen":
|
| 1038 |
"step": 1030,
|
| 1039 |
-
"train_runtime":
|
| 1040 |
-
"train_tokens_per_second":
|
| 1041 |
},
|
| 1042 |
{
|
| 1043 |
"epoch": 2.2368137782561894,
|
| 1044 |
-
"grad_norm":
|
| 1045 |
-
"learning_rate":
|
| 1046 |
-
"loss": 0.
|
| 1047 |
-
"num_input_tokens_seen":
|
| 1048 |
"step": 1040,
|
| 1049 |
-
"train_runtime":
|
| 1050 |
-
"train_tokens_per_second":
|
| 1051 |
},
|
| 1052 |
{
|
| 1053 |
"epoch": 2.2583423035522068,
|
| 1054 |
-
"grad_norm":
|
| 1055 |
-
"learning_rate":
|
| 1056 |
-
"loss": 0.
|
| 1057 |
-
"num_input_tokens_seen":
|
| 1058 |
"step": 1050,
|
| 1059 |
-
"train_runtime":
|
| 1060 |
-
"train_tokens_per_second":
|
| 1061 |
},
|
| 1062 |
{
|
| 1063 |
"epoch": 2.2798708288482237,
|
| 1064 |
-
"grad_norm":
|
| 1065 |
-
"learning_rate":
|
| 1066 |
-
"loss": 0.
|
| 1067 |
-
"num_input_tokens_seen":
|
| 1068 |
"step": 1060,
|
| 1069 |
-
"train_runtime":
|
| 1070 |
-
"train_tokens_per_second":
|
| 1071 |
},
|
| 1072 |
{
|
| 1073 |
"epoch": 2.301399354144241,
|
| 1074 |
-
"grad_norm":
|
| 1075 |
-
"learning_rate":
|
| 1076 |
-
"loss": 0.
|
| 1077 |
-
"num_input_tokens_seen":
|
| 1078 |
"step": 1070,
|
| 1079 |
-
"train_runtime":
|
| 1080 |
-
"train_tokens_per_second":
|
| 1081 |
},
|
| 1082 |
{
|
| 1083 |
"epoch": 2.3229278794402584,
|
| 1084 |
-
"grad_norm":
|
| 1085 |
-
"learning_rate":
|
| 1086 |
-
"loss": 0.
|
| 1087 |
-
"num_input_tokens_seen":
|
| 1088 |
"step": 1080,
|
| 1089 |
-
"train_runtime":
|
| 1090 |
-
"train_tokens_per_second":
|
| 1091 |
},
|
| 1092 |
{
|
| 1093 |
"epoch": 2.3444564047362757,
|
| 1094 |
-
"grad_norm":
|
| 1095 |
-
"learning_rate":
|
| 1096 |
-
"loss": 0.
|
| 1097 |
-
"num_input_tokens_seen":
|
| 1098 |
"step": 1090,
|
| 1099 |
-
"train_runtime":
|
| 1100 |
-
"train_tokens_per_second":
|
| 1101 |
},
|
| 1102 |
{
|
| 1103 |
"epoch": 2.3659849300322926,
|
| 1104 |
-
"grad_norm":
|
| 1105 |
-
"learning_rate":
|
| 1106 |
-
"loss": 0.
|
| 1107 |
-
"num_input_tokens_seen":
|
| 1108 |
"step": 1100,
|
| 1109 |
-
"train_runtime":
|
| 1110 |
-
"train_tokens_per_second":
|
| 1111 |
},
|
| 1112 |
{
|
| 1113 |
"epoch": 2.38751345532831,
|
| 1114 |
-
"grad_norm":
|
| 1115 |
-
"learning_rate":
|
| 1116 |
-
"loss": 0.
|
| 1117 |
-
"num_input_tokens_seen":
|
| 1118 |
"step": 1110,
|
| 1119 |
-
"train_runtime":
|
| 1120 |
-
"train_tokens_per_second":
|
| 1121 |
},
|
| 1122 |
{
|
| 1123 |
"epoch": 2.4090419806243273,
|
| 1124 |
-
"grad_norm":
|
| 1125 |
-
"learning_rate":
|
| 1126 |
-
"loss": 0.
|
| 1127 |
-
"num_input_tokens_seen":
|
| 1128 |
"step": 1120,
|
| 1129 |
-
"train_runtime":
|
| 1130 |
-
"train_tokens_per_second":
|
| 1131 |
},
|
| 1132 |
{
|
| 1133 |
"epoch": 2.4305705059203446,
|
| 1134 |
-
"grad_norm":
|
| 1135 |
-
"learning_rate":
|
| 1136 |
-
"loss": 0.
|
| 1137 |
-
"num_input_tokens_seen":
|
| 1138 |
"step": 1130,
|
| 1139 |
-
"train_runtime":
|
| 1140 |
-
"train_tokens_per_second":
|
| 1141 |
},
|
| 1142 |
{
|
| 1143 |
"epoch": 2.4520990312163615,
|
| 1144 |
-
"grad_norm":
|
| 1145 |
-
"learning_rate":
|
| 1146 |
-
"loss": 0.
|
| 1147 |
-
"num_input_tokens_seen":
|
| 1148 |
"step": 1140,
|
| 1149 |
-
"train_runtime":
|
| 1150 |
-
"train_tokens_per_second":
|
| 1151 |
},
|
| 1152 |
{
|
| 1153 |
"epoch": 2.473627556512379,
|
| 1154 |
-
"grad_norm":
|
| 1155 |
-
"learning_rate":
|
| 1156 |
-
"loss": 0.
|
| 1157 |
-
"num_input_tokens_seen":
|
| 1158 |
"step": 1150,
|
| 1159 |
-
"train_runtime":
|
| 1160 |
-
"train_tokens_per_second":
|
| 1161 |
},
|
| 1162 |
{
|
| 1163 |
"epoch": 2.495156081808396,
|
| 1164 |
-
"grad_norm":
|
| 1165 |
-
"learning_rate":
|
| 1166 |
-
"loss": 0.
|
| 1167 |
-
"num_input_tokens_seen":
|
| 1168 |
"step": 1160,
|
| 1169 |
-
"train_runtime":
|
| 1170 |
-
"train_tokens_per_second":
|
| 1171 |
},
|
| 1172 |
{
|
| 1173 |
"epoch": 2.5166846071044136,
|
| 1174 |
-
"grad_norm":
|
| 1175 |
-
"learning_rate":
|
| 1176 |
-
"loss": 0.
|
| 1177 |
-
"num_input_tokens_seen":
|
| 1178 |
"step": 1170,
|
| 1179 |
-
"train_runtime":
|
| 1180 |
-
"train_tokens_per_second":
|
| 1181 |
},
|
| 1182 |
{
|
| 1183 |
"epoch": 2.5382131324004304,
|
| 1184 |
-
"grad_norm":
|
| 1185 |
-
"learning_rate":
|
| 1186 |
-
"loss": 0.
|
| 1187 |
-
"num_input_tokens_seen":
|
| 1188 |
"step": 1180,
|
| 1189 |
-
"train_runtime":
|
| 1190 |
-
"train_tokens_per_second":
|
| 1191 |
},
|
| 1192 |
{
|
| 1193 |
"epoch": 2.559741657696448,
|
| 1194 |
-
"grad_norm":
|
| 1195 |
-
"learning_rate":
|
| 1196 |
-
"loss": 0.
|
| 1197 |
-
"num_input_tokens_seen":
|
| 1198 |
"step": 1190,
|
| 1199 |
-
"train_runtime":
|
| 1200 |
-
"train_tokens_per_second":
|
| 1201 |
},
|
| 1202 |
{
|
| 1203 |
"epoch": 2.581270182992465,
|
| 1204 |
-
"grad_norm":
|
| 1205 |
-
"learning_rate":
|
| 1206 |
-
"loss": 0.
|
| 1207 |
-
"num_input_tokens_seen":
|
| 1208 |
"step": 1200,
|
| 1209 |
-
"train_runtime":
|
| 1210 |
-
"train_tokens_per_second":
|
| 1211 |
},
|
| 1212 |
{
|
| 1213 |
"epoch": 2.602798708288482,
|
| 1214 |
-
"grad_norm":
|
| 1215 |
-
"learning_rate":
|
| 1216 |
-
"loss": 0.
|
| 1217 |
-
"num_input_tokens_seen":
|
| 1218 |
"step": 1210,
|
| 1219 |
-
"train_runtime":
|
| 1220 |
-
"train_tokens_per_second":
|
| 1221 |
},
|
| 1222 |
{
|
| 1223 |
"epoch": 2.6243272335844994,
|
| 1224 |
-
"grad_norm":
|
| 1225 |
-
"learning_rate":
|
| 1226 |
-
"loss": 0.
|
| 1227 |
-
"num_input_tokens_seen":
|
| 1228 |
"step": 1220,
|
| 1229 |
-
"train_runtime":
|
| 1230 |
-
"train_tokens_per_second":
|
| 1231 |
},
|
| 1232 |
{
|
| 1233 |
"epoch": 2.6458557588805167,
|
| 1234 |
-
"grad_norm":
|
| 1235 |
-
"learning_rate":
|
| 1236 |
-
"loss": 0.
|
| 1237 |
-
"num_input_tokens_seen":
|
| 1238 |
"step": 1230,
|
| 1239 |
-
"train_runtime":
|
| 1240 |
-
"train_tokens_per_second":
|
| 1241 |
},
|
| 1242 |
{
|
| 1243 |
"epoch": 2.667384284176534,
|
| 1244 |
-
"grad_norm":
|
| 1245 |
-
"learning_rate":
|
| 1246 |
-
"loss": 0.
|
| 1247 |
-
"num_input_tokens_seen":
|
| 1248 |
"step": 1240,
|
| 1249 |
-
"train_runtime":
|
| 1250 |
-
"train_tokens_per_second":
|
| 1251 |
},
|
| 1252 |
{
|
| 1253 |
"epoch": 2.6889128094725514,
|
| 1254 |
-
"grad_norm":
|
| 1255 |
-
"learning_rate":
|
| 1256 |
-
"loss": 0.
|
| 1257 |
-
"num_input_tokens_seen":
|
| 1258 |
"step": 1250,
|
| 1259 |
-
"train_runtime":
|
| 1260 |
-
"train_tokens_per_second":
|
| 1261 |
},
|
| 1262 |
{
|
| 1263 |
"epoch": 2.7104413347685683,
|
| 1264 |
-
"grad_norm":
|
| 1265 |
-
"learning_rate":
|
| 1266 |
-
"loss": 0.
|
| 1267 |
-
"num_input_tokens_seen":
|
| 1268 |
"step": 1260,
|
| 1269 |
-
"train_runtime":
|
| 1270 |
-
"train_tokens_per_second":
|
| 1271 |
},
|
| 1272 |
{
|
| 1273 |
"epoch": 2.7319698600645856,
|
| 1274 |
-
"grad_norm":
|
| 1275 |
-
"learning_rate":
|
| 1276 |
-
"loss": 0.
|
| 1277 |
-
"num_input_tokens_seen":
|
| 1278 |
"step": 1270,
|
| 1279 |
-
"train_runtime":
|
| 1280 |
-
"train_tokens_per_second":
|
| 1281 |
},
|
| 1282 |
{
|
| 1283 |
"epoch": 2.7534983853606025,
|
| 1284 |
-
"grad_norm":
|
| 1285 |
-
"learning_rate":
|
| 1286 |
-
"loss": 0.
|
| 1287 |
-
"num_input_tokens_seen":
|
| 1288 |
"step": 1280,
|
| 1289 |
-
"train_runtime":
|
| 1290 |
-
"train_tokens_per_second":
|
| 1291 |
},
|
| 1292 |
{
|
| 1293 |
"epoch": 2.77502691065662,
|
| 1294 |
-
"grad_norm":
|
| 1295 |
-
"learning_rate":
|
| 1296 |
-
"loss": 0.
|
| 1297 |
-
"num_input_tokens_seen":
|
| 1298 |
"step": 1290,
|
| 1299 |
-
"train_runtime":
|
| 1300 |
-
"train_tokens_per_second":
|
| 1301 |
},
|
| 1302 |
{
|
| 1303 |
"epoch": 2.7965554359526372,
|
| 1304 |
-
"grad_norm":
|
| 1305 |
-
"learning_rate":
|
| 1306 |
-
"loss": 0.
|
| 1307 |
-
"num_input_tokens_seen":
|
| 1308 |
"step": 1300,
|
| 1309 |
-
"train_runtime":
|
| 1310 |
-
"train_tokens_per_second":
|
| 1311 |
},
|
| 1312 |
{
|
| 1313 |
"epoch": 2.8180839612486546,
|
| 1314 |
-
"grad_norm":
|
| 1315 |
-
"learning_rate":
|
| 1316 |
-
"loss": 0.
|
| 1317 |
-
"num_input_tokens_seen":
|
| 1318 |
"step": 1310,
|
| 1319 |
-
"train_runtime":
|
| 1320 |
-
"train_tokens_per_second":
|
| 1321 |
},
|
| 1322 |
{
|
| 1323 |
"epoch": 2.839612486544672,
|
| 1324 |
-
"grad_norm":
|
| 1325 |
-
"learning_rate":
|
| 1326 |
-
"loss": 0.
|
| 1327 |
-
"num_input_tokens_seen":
|
| 1328 |
"step": 1320,
|
| 1329 |
-
"train_runtime":
|
| 1330 |
-
"train_tokens_per_second":
|
| 1331 |
},
|
| 1332 |
{
|
| 1333 |
"epoch": 2.861141011840689,
|
| 1334 |
-
"grad_norm":
|
| 1335 |
-
"learning_rate":
|
| 1336 |
-
"loss": 0.
|
| 1337 |
-
"num_input_tokens_seen":
|
| 1338 |
"step": 1330,
|
| 1339 |
-
"train_runtime":
|
| 1340 |
-
"train_tokens_per_second":
|
| 1341 |
},
|
| 1342 |
{
|
| 1343 |
"epoch": 2.882669537136706,
|
| 1344 |
-
"grad_norm":
|
| 1345 |
-
"learning_rate":
|
| 1346 |
-
"loss": 0.
|
| 1347 |
-
"num_input_tokens_seen":
|
| 1348 |
"step": 1340,
|
| 1349 |
-
"train_runtime":
|
| 1350 |
-
"train_tokens_per_second":
|
| 1351 |
},
|
| 1352 |
{
|
| 1353 |
"epoch": 2.9041980624327235,
|
| 1354 |
-
"grad_norm":
|
| 1355 |
-
"learning_rate":
|
| 1356 |
-
"loss": 0.
|
| 1357 |
-
"num_input_tokens_seen":
|
| 1358 |
"step": 1350,
|
| 1359 |
-
"train_runtime":
|
| 1360 |
-
"train_tokens_per_second":
|
| 1361 |
},
|
| 1362 |
{
|
| 1363 |
"epoch": 2.9257265877287404,
|
| 1364 |
-
"grad_norm":
|
| 1365 |
-
"learning_rate":
|
| 1366 |
-
"loss": 0.
|
| 1367 |
-
"num_input_tokens_seen":
|
| 1368 |
"step": 1360,
|
| 1369 |
-
"train_runtime":
|
| 1370 |
-
"train_tokens_per_second":
|
| 1371 |
},
|
| 1372 |
{
|
| 1373 |
"epoch": 2.9472551130247577,
|
| 1374 |
-
"grad_norm":
|
| 1375 |
-
"learning_rate":
|
| 1376 |
-
"loss": 0.
|
| 1377 |
-
"num_input_tokens_seen":
|
| 1378 |
"step": 1370,
|
| 1379 |
-
"train_runtime":
|
| 1380 |
-
"train_tokens_per_second":
|
| 1381 |
},
|
| 1382 |
{
|
| 1383 |
"epoch": 2.968783638320775,
|
| 1384 |
-
"grad_norm":
|
| 1385 |
-
"learning_rate":
|
| 1386 |
-
"loss": 0.
|
| 1387 |
-
"num_input_tokens_seen":
|
| 1388 |
"step": 1380,
|
| 1389 |
-
"train_runtime":
|
| 1390 |
-
"train_tokens_per_second":
|
| 1391 |
},
|
| 1392 |
{
|
| 1393 |
"epoch": 2.9903121636167924,
|
| 1394 |
-
"grad_norm":
|
| 1395 |
-
"learning_rate":
|
| 1396 |
-
"loss": 0.
|
| 1397 |
-
"num_input_tokens_seen":
|
| 1398 |
"step": 1390,
|
| 1399 |
-
"train_runtime":
|
| 1400 |
-
"train_tokens_per_second":
|
| 1401 |
}
|
| 1402 |
],
|
| 1403 |
"logging_steps": 10,
|
| 1404 |
"max_steps": 1395,
|
| 1405 |
-
"num_input_tokens_seen":
|
| 1406 |
"num_train_epochs": 3,
|
| 1407 |
"save_steps": 1000,
|
| 1408 |
"stateful_callbacks": {
|
|
@@ -1417,7 +1417,7 @@
|
|
| 1417 |
"attributes": {}
|
| 1418 |
}
|
| 1419 |
},
|
| 1420 |
-
"total_flos":
|
| 1421 |
"train_batch_size": 4,
|
| 1422 |
"trial_name": null,
|
| 1423 |
"trial_params": null
|
|
|
|
| 11 |
"log_history": [
|
| 12 |
{
|
| 13 |
"epoch": 0.021528525296017224,
|
| 14 |
+
"grad_norm": 16.47992515563965,
|
| 15 |
+
"learning_rate": 9.998973021172564e-06,
|
| 16 |
+
"loss": 1.7834,
|
| 17 |
+
"num_input_tokens_seen": 43648,
|
| 18 |
"step": 10,
|
| 19 |
+
"train_runtime": 64.3878,
|
| 20 |
+
"train_tokens_per_second": 677.892
|
| 21 |
},
|
| 22 |
{
|
| 23 |
"epoch": 0.04305705059203445,
|
| 24 |
+
"grad_norm": 16.372161865234375,
|
| 25 |
+
"learning_rate": 9.995423512524277e-06,
|
| 26 |
+
"loss": 0.7676,
|
| 27 |
+
"num_input_tokens_seen": 87072,
|
| 28 |
"step": 20,
|
| 29 |
+
"train_runtime": 95.1979,
|
| 30 |
+
"train_tokens_per_second": 914.642
|
| 31 |
},
|
| 32 |
{
|
| 33 |
"epoch": 0.06458557588805167,
|
| 34 |
+
"grad_norm": 11.686817169189453,
|
| 35 |
+
"learning_rate": 9.98934059499448e-06,
|
| 36 |
+
"loss": 0.5817,
|
| 37 |
+
"num_input_tokens_seen": 131520,
|
| 38 |
"step": 30,
|
| 39 |
+
"train_runtime": 126.5065,
|
| 40 |
+
"train_tokens_per_second": 1039.63
|
| 41 |
},
|
| 42 |
{
|
| 43 |
"epoch": 0.0861141011840689,
|
| 44 |
+
"grad_norm": 3.2975926399230957,
|
| 45 |
+
"learning_rate": 9.980727353510257e-06,
|
| 46 |
+
"loss": 0.3531,
|
| 47 |
+
"num_input_tokens_seen": 175680,
|
| 48 |
"step": 40,
|
| 49 |
+
"train_runtime": 157.6702,
|
| 50 |
+
"train_tokens_per_second": 1114.225
|
| 51 |
},
|
| 52 |
{
|
| 53 |
"epoch": 0.10764262648008611,
|
| 54 |
+
"grad_norm": 3.4886627197265625,
|
| 55 |
+
"learning_rate": 9.969588156242282e-06,
|
| 56 |
+
"loss": 0.3352,
|
| 57 |
+
"num_input_tokens_seen": 219584,
|
| 58 |
"step": 50,
|
| 59 |
+
"train_runtime": 188.7104,
|
| 60 |
+
"train_tokens_per_second": 1163.603
|
| 61 |
},
|
| 62 |
{
|
| 63 |
"epoch": 0.12917115177610333,
|
| 64 |
+
"grad_norm": 3.484487295150757,
|
| 65 |
+
"learning_rate": 9.95592865238951e-06,
|
| 66 |
+
"loss": 0.2298,
|
| 67 |
+
"num_input_tokens_seen": 263392,
|
| 68 |
"step": 60,
|
| 69 |
+
"train_runtime": 219.7077,
|
| 70 |
+
"train_tokens_per_second": 1198.829
|
| 71 |
},
|
| 72 |
{
|
| 73 |
"epoch": 0.15069967707212056,
|
| 74 |
+
"grad_norm": 4.422971725463867,
|
| 75 |
+
"learning_rate": 9.939755769314215e-06,
|
| 76 |
+
"loss": 0.1981,
|
| 77 |
+
"num_input_tokens_seen": 306912,
|
| 78 |
"step": 70,
|
| 79 |
+
"train_runtime": 250.6069,
|
| 80 |
+
"train_tokens_per_second": 1224.675
|
| 81 |
},
|
| 82 |
{
|
| 83 |
"epoch": 0.1722282023681378,
|
| 84 |
+
"grad_norm": 1.4185198545455933,
|
| 85 |
+
"learning_rate": 9.9210777090288e-06,
|
| 86 |
+
"loss": 0.1755,
|
| 87 |
+
"num_input_tokens_seen": 349824,
|
| 88 |
"step": 80,
|
| 89 |
+
"train_runtime": 281.2405,
|
| 90 |
+
"train_tokens_per_second": 1243.86
|
| 91 |
},
|
| 92 |
{
|
| 93 |
"epoch": 0.193756727664155,
|
| 94 |
+
"grad_norm": 1.1935056447982788,
|
| 95 |
+
"learning_rate": 9.899903944036185e-06,
|
| 96 |
+
"loss": 0.1791,
|
| 97 |
+
"num_input_tokens_seen": 393664,
|
| 98 |
"step": 90,
|
| 99 |
+
"train_runtime": 312.2075,
|
| 100 |
+
"train_tokens_per_second": 1260.905
|
| 101 |
},
|
| 102 |
{
|
| 103 |
"epoch": 0.21528525296017223,
|
| 104 |
+
"grad_norm": 2.463397741317749,
|
| 105 |
+
"learning_rate": 9.87624521252587e-06,
|
| 106 |
+
"loss": 0.2051,
|
| 107 |
+
"num_input_tokens_seen": 437952,
|
| 108 |
"step": 100,
|
| 109 |
+
"train_runtime": 343.3508,
|
| 110 |
+
"train_tokens_per_second": 1275.523
|
| 111 |
},
|
| 112 |
{
|
| 113 |
"epoch": 0.23681377825618946,
|
| 114 |
+
"grad_norm": 3.8650355339050293,
|
| 115 |
+
"learning_rate": 9.850113512928094e-06,
|
| 116 |
+
"loss": 0.1912,
|
| 117 |
+
"num_input_tokens_seen": 481472,
|
| 118 |
"step": 110,
|
| 119 |
+
"train_runtime": 374.2539,
|
| 120 |
+
"train_tokens_per_second": 1286.485
|
| 121 |
},
|
| 122 |
{
|
| 123 |
"epoch": 0.25834230355220666,
|
| 124 |
+
"grad_norm": 4.704444885253906,
|
| 125 |
+
"learning_rate": 9.821522097828884e-06,
|
| 126 |
+
"loss": 0.1637,
|
| 127 |
+
"num_input_tokens_seen": 525472,
|
| 128 |
"step": 120,
|
| 129 |
+
"train_runtime": 405.4374,
|
| 130 |
+
"train_tokens_per_second": 1296.062
|
| 131 |
},
|
| 132 |
{
|
| 133 |
"epoch": 0.2798708288482239,
|
| 134 |
+
"grad_norm": 2.7267754077911377,
|
| 135 |
+
"learning_rate": 9.790485467249065e-06,
|
| 136 |
+
"loss": 0.1537,
|
| 137 |
+
"num_input_tokens_seen": 569696,
|
| 138 |
"step": 130,
|
| 139 |
+
"train_runtime": 436.4834,
|
| 140 |
+
"train_tokens_per_second": 1305.195
|
| 141 |
},
|
| 142 |
{
|
| 143 |
"epoch": 0.3013993541442411,
|
| 144 |
+
"grad_norm": 3.512826681137085,
|
| 145 |
+
"learning_rate": 9.757019361290621e-06,
|
| 146 |
+
"loss": 0.1846,
|
| 147 |
+
"num_input_tokens_seen": 613760,
|
| 148 |
"step": 140,
|
| 149 |
+
"train_runtime": 467.5968,
|
| 150 |
+
"train_tokens_per_second": 1312.584
|
| 151 |
},
|
| 152 |
{
|
| 153 |
"epoch": 0.32292787944025836,
|
| 154 |
+
"grad_norm": 2.484517812728882,
|
| 155 |
+
"learning_rate": 9.721140752154182e-06,
|
| 156 |
+
"loss": 0.1872,
|
| 157 |
+
"num_input_tokens_seen": 657824,
|
| 158 |
"step": 150,
|
| 159 |
+
"train_runtime": 498.6389,
|
| 160 |
+
"train_tokens_per_second": 1319.239
|
| 161 |
},
|
| 162 |
{
|
| 163 |
"epoch": 0.3444564047362756,
|
| 164 |
+
"grad_norm": 2.296607255935669,
|
| 165 |
+
"learning_rate": 9.682867835531624e-06,
|
| 166 |
+
"loss": 0.1372,
|
| 167 |
+
"num_input_tokens_seen": 701760,
|
| 168 |
"step": 160,
|
| 169 |
+
"train_runtime": 529.7256,
|
| 170 |
+
"train_tokens_per_second": 1324.761
|
| 171 |
},
|
| 172 |
{
|
| 173 |
"epoch": 0.36598493003229277,
|
| 174 |
+
"grad_norm": 3.887946128845215,
|
| 175 |
+
"learning_rate": 9.642220021378212e-06,
|
| 176 |
+
"loss": 0.2028,
|
| 177 |
+
"num_input_tokens_seen": 745184,
|
| 178 |
"step": 170,
|
| 179 |
+
"train_runtime": 560.5239,
|
| 180 |
+
"train_tokens_per_second": 1329.442
|
| 181 |
},
|
| 182 |
{
|
| 183 |
"epoch": 0.38751345532831,
|
| 184 |
+
"grad_norm": 2.1227307319641113,
|
| 185 |
+
"learning_rate": 9.59921792406891e-06,
|
| 186 |
+
"loss": 0.1765,
|
| 187 |
+
"num_input_tokens_seen": 789216,
|
| 188 |
"step": 180,
|
| 189 |
+
"train_runtime": 591.5958,
|
| 190 |
+
"train_tokens_per_second": 1334.046
|
| 191 |
},
|
| 192 |
{
|
| 193 |
"epoch": 0.40904198062432723,
|
| 194 |
+
"grad_norm": 3.007882595062256,
|
| 195 |
+
"learning_rate": 9.553883351943882e-06,
|
| 196 |
+
"loss": 0.1882,
|
| 197 |
+
"num_input_tokens_seen": 832960,
|
| 198 |
"step": 190,
|
| 199 |
+
"train_runtime": 622.6094,
|
| 200 |
+
"train_tokens_per_second": 1337.853
|
| 201 |
},
|
| 202 |
{
|
| 203 |
"epoch": 0.43057050592034446,
|
| 204 |
+
"grad_norm": 1.8637208938598633,
|
| 205 |
+
"learning_rate": 9.506239296248497e-06,
|
| 206 |
+
"loss": 0.1336,
|
| 207 |
+
"num_input_tokens_seen": 877664,
|
| 208 |
"step": 200,
|
| 209 |
+
"train_runtime": 654.0867,
|
| 210 |
+
"train_tokens_per_second": 1341.816
|
| 211 |
},
|
| 212 |
{
|
| 213 |
"epoch": 0.4520990312163617,
|
| 214 |
+
"grad_norm": 1.1324244737625122,
|
| 215 |
+
"learning_rate": 9.456309919473384e-06,
|
| 216 |
+
"loss": 0.1521,
|
| 217 |
+
"num_input_tokens_seen": 921536,
|
| 218 |
"step": 210,
|
| 219 |
+
"train_runtime": 685.133,
|
| 220 |
+
"train_tokens_per_second": 1345.047
|
| 221 |
},
|
| 222 |
{
|
| 223 |
"epoch": 0.4736275565123789,
|
| 224 |
+
"grad_norm": 3.536208391189575,
|
| 225 |
+
"learning_rate": 9.404120543100553e-06,
|
| 226 |
+
"loss": 0.1864,
|
| 227 |
+
"num_input_tokens_seen": 965344,
|
| 228 |
"step": 220,
|
| 229 |
+
"train_runtime": 716.7323,
|
| 230 |
+
"train_tokens_per_second": 1346.868
|
| 231 |
},
|
| 232 |
{
|
| 233 |
"epoch": 0.4951560818083961,
|
| 234 |
+
"grad_norm": 1.73074209690094,
|
| 235 |
+
"learning_rate": 9.34969763476168e-06,
|
| 236 |
+
"loss": 0.1625,
|
| 237 |
+
"num_input_tokens_seen": 1008672,
|
| 238 |
"step": 230,
|
| 239 |
+
"train_runtime": 747.5266,
|
| 240 |
+
"train_tokens_per_second": 1349.346
|
| 241 |
},
|
| 242 |
{
|
| 243 |
"epoch": 0.5166846071044133,
|
| 244 |
+
"grad_norm": 1.4830386638641357,
|
| 245 |
+
"learning_rate": 9.293068794815175e-06,
|
| 246 |
+
"loss": 0.1456,
|
| 247 |
+
"num_input_tokens_seen": 1051936,
|
| 248 |
"step": 240,
|
| 249 |
+
"train_runtime": 778.3038,
|
| 250 |
+
"train_tokens_per_second": 1351.575
|
| 251 |
},
|
| 252 |
{
|
| 253 |
"epoch": 0.5382131324004306,
|
| 254 |
+
"grad_norm": 2.7361512184143066,
|
| 255 |
+
"learning_rate": 9.234262742348764e-06,
|
| 256 |
+
"loss": 0.165,
|
| 257 |
+
"num_input_tokens_seen": 1095904,
|
| 258 |
"step": 250,
|
| 259 |
+
"train_runtime": 809.3485,
|
| 260 |
+
"train_tokens_per_second": 1354.057
|
| 261 |
},
|
| 262 |
{
|
| 263 |
"epoch": 0.5597416576964478,
|
| 264 |
+
"grad_norm": 1.9473741054534912,
|
| 265 |
+
"learning_rate": 9.17330930061471e-06,
|
| 266 |
+
"loss": 0.1487,
|
| 267 |
+
"num_input_tokens_seen": 1140064,
|
| 268 |
"step": 260,
|
| 269 |
+
"train_runtime": 840.5464,
|
| 270 |
+
"train_tokens_per_second": 1356.337
|
| 271 |
},
|
| 272 |
{
|
| 273 |
"epoch": 0.581270182992465,
|
| 274 |
+
"grad_norm": 2.0610098838806152,
|
| 275 |
+
"learning_rate": 9.11023938190509e-06,
|
| 276 |
+
"loss": 0.1687,
|
| 277 |
+
"num_input_tokens_seen": 1183872,
|
| 278 |
"step": 270,
|
| 279 |
+
"train_runtime": 871.5774,
|
| 280 |
+
"train_tokens_per_second": 1358.31
|
| 281 |
},
|
| 282 |
{
|
| 283 |
"epoch": 0.6027987082884823,
|
| 284 |
+
"grad_norm": 3.2189598083496094,
|
| 285 |
+
"learning_rate": 9.045084971874738e-06,
|
| 286 |
+
"loss": 0.1511,
|
| 287 |
+
"num_input_tokens_seen": 1228544,
|
| 288 |
"step": 280,
|
| 289 |
+
"train_runtime": 903.1191,
|
| 290 |
+
"train_tokens_per_second": 1360.334
|
| 291 |
},
|
| 292 |
{
|
| 293 |
"epoch": 0.6243272335844995,
|
| 294 |
+
"grad_norm": 3.902757406234741,
|
| 295 |
+
"learning_rate": 8.977879113319847e-06,
|
| 296 |
+
"loss": 0.184,
|
| 297 |
+
"num_input_tokens_seen": 1271968,
|
| 298 |
"step": 290,
|
| 299 |
+
"train_runtime": 934.0522,
|
| 300 |
+
"train_tokens_per_second": 1361.774
|
| 301 |
},
|
| 302 |
{
|
| 303 |
"epoch": 0.6458557588805167,
|
| 304 |
+
"grad_norm": 4.2983012199401855,
|
| 305 |
+
"learning_rate": 8.90865588942046e-06,
|
| 306 |
+
"loss": 0.1305,
|
| 307 |
+
"num_input_tokens_seen": 1316096,
|
| 308 |
"step": 300,
|
| 309 |
+
"train_runtime": 965.1778,
|
| 310 |
+
"train_tokens_per_second": 1363.579
|
| 311 |
},
|
| 312 |
{
|
| 313 |
"epoch": 0.667384284176534,
|
| 314 |
+
"grad_norm": 2.6156394481658936,
|
| 315 |
+
"learning_rate": 8.83745040645531e-06,
|
| 316 |
+
"loss": 0.1405,
|
| 317 |
+
"num_input_tokens_seen": 1360256,
|
| 318 |
"step": 310,
|
| 319 |
+
"train_runtime": 996.4077,
|
| 320 |
+
"train_tokens_per_second": 1365.16
|
| 321 |
},
|
| 322 |
{
|
| 323 |
"epoch": 0.6889128094725512,
|
| 324 |
+
"grad_norm": 1.3506444692611694,
|
| 325 |
+
"learning_rate": 8.764298775997823e-06,
|
| 326 |
+
"loss": 0.1651,
|
| 327 |
+
"num_input_tokens_seen": 1404064,
|
| 328 |
"step": 320,
|
| 329 |
+
"train_runtime": 1027.5151,
|
| 330 |
+
"train_tokens_per_second": 1366.466
|
| 331 |
},
|
| 332 |
{
|
| 333 |
"epoch": 0.7104413347685683,
|
| 334 |
+
"grad_norm": 1.5117799043655396,
|
| 335 |
+
"learning_rate": 8.68923809660227e-06,
|
| 336 |
+
"loss": 0.1519,
|
| 337 |
+
"num_input_tokens_seen": 1448256,
|
| 338 |
"step": 330,
|
| 339 |
+
"train_runtime": 1058.74,
|
| 340 |
+
"train_tokens_per_second": 1367.905
|
| 341 |
},
|
| 342 |
{
|
| 343 |
"epoch": 0.7319698600645855,
|
| 344 |
+
"grad_norm": 1.2659231424331665,
|
| 345 |
+
"learning_rate": 8.612306434989395e-06,
|
| 346 |
+
"loss": 0.1574,
|
| 347 |
+
"num_input_tokens_seen": 1492448,
|
| 348 |
"step": 340,
|
| 349 |
+
"train_runtime": 1090.0052,
|
| 350 |
+
"train_tokens_per_second": 1369.212
|
| 351 |
},
|
| 352 |
{
|
| 353 |
"epoch": 0.7534983853606028,
|
| 354 |
+
"grad_norm": 2.6010894775390625,
|
| 355 |
+
"learning_rate": 8.53354280674102e-06,
|
| 356 |
+
"loss": 0.1587,
|
| 357 |
+
"num_input_tokens_seen": 1537440,
|
| 358 |
"step": 350,
|
| 359 |
+
"train_runtime": 1121.55,
|
| 360 |
+
"train_tokens_per_second": 1370.817
|
| 361 |
},
|
| 362 |
{
|
| 363 |
"epoch": 0.77502691065662,
|
| 364 |
+
"grad_norm": 1.6968097686767578,
|
| 365 |
+
"learning_rate": 8.452987156513457e-06,
|
| 366 |
+
"loss": 0.1513,
|
| 367 |
+
"num_input_tokens_seen": 1581280,
|
| 368 |
"step": 360,
|
| 369 |
+
"train_runtime": 1152.6858,
|
| 370 |
+
"train_tokens_per_second": 1371.822
|
| 371 |
},
|
| 372 |
{
|
| 373 |
"epoch": 0.7965554359526372,
|
| 374 |
+
"grad_norm": 2.0298380851745605,
|
| 375 |
+
"learning_rate": 8.370680337779737e-06,
|
| 376 |
+
"loss": 0.1401,
|
| 377 |
+
"num_input_tokens_seen": 1625824,
|
| 378 |
"step": 370,
|
| 379 |
+
"train_runtime": 1184.3507,
|
| 380 |
+
"train_tokens_per_second": 1372.756
|
| 381 |
},
|
| 382 |
{
|
| 383 |
"epoch": 0.8180839612486545,
|
| 384 |
+
"grad_norm": 2.7614028453826904,
|
| 385 |
+
"learning_rate": 8.286664092110935e-06,
|
| 386 |
+
"loss": 0.1135,
|
| 387 |
+
"num_input_tokens_seen": 1669472,
|
| 388 |
"step": 380,
|
| 389 |
+
"train_runtime": 1215.2935,
|
| 390 |
+
"train_tokens_per_second": 1373.719
|
| 391 |
},
|
| 392 |
{
|
| 393 |
"epoch": 0.8396124865446717,
|
| 394 |
+
"grad_norm": 1.6297581195831299,
|
| 395 |
+
"learning_rate": 8.200981028007095e-06,
|
| 396 |
+
"loss": 0.1645,
|
| 397 |
+
"num_input_tokens_seen": 1713312,
|
| 398 |
"step": 390,
|
| 399 |
+
"train_runtime": 1246.1254,
|
| 400 |
+
"train_tokens_per_second": 1374.911
|
| 401 |
},
|
| 402 |
{
|
| 403 |
"epoch": 0.8611410118406889,
|
| 404 |
+
"grad_norm": 2.32612943649292,
|
| 405 |
+
"learning_rate": 8.11367459928851e-06,
|
| 406 |
+
"loss": 0.1129,
|
| 407 |
+
"num_input_tokens_seen": 1757056,
|
| 408 |
"step": 400,
|
| 409 |
+
"train_runtime": 1277.0951,
|
| 410 |
+
"train_tokens_per_second": 1375.822
|
| 411 |
},
|
| 412 |
{
|
| 413 |
"epoch": 0.8826695371367062,
|
| 414 |
+
"grad_norm": 1.5576270818710327,
|
| 415 |
+
"learning_rate": 8.024789083058289e-06,
|
| 416 |
+
"loss": 0.1333,
|
| 417 |
+
"num_input_tokens_seen": 1801632,
|
| 418 |
"step": 410,
|
| 419 |
+
"train_runtime": 1308.5556,
|
| 420 |
+
"train_tokens_per_second": 1376.81
|
| 421 |
},
|
| 422 |
{
|
| 423 |
"epoch": 0.9041980624327234,
|
| 424 |
+
"grad_norm": 8.420344352722168,
|
| 425 |
+
"learning_rate": 7.934369557247397e-06,
|
| 426 |
+
"loss": 0.1311,
|
| 427 |
+
"num_input_tokens_seen": 1845280,
|
| 428 |
"step": 420,
|
| 429 |
+
"train_runtime": 1339.4668,
|
| 430 |
+
"train_tokens_per_second": 1377.623
|
| 431 |
},
|
| 432 |
{
|
| 433 |
"epoch": 0.9257265877287406,
|
| 434 |
+
"grad_norm": 1.7291479110717773,
|
| 435 |
+
"learning_rate": 7.842461877753575e-06,
|
| 436 |
+
"loss": 0.1395,
|
| 437 |
+
"num_input_tokens_seen": 1889472,
|
| 438 |
"step": 430,
|
| 439 |
+
"train_runtime": 1370.6369,
|
| 440 |
+
"train_tokens_per_second": 1378.536
|
| 441 |
},
|
| 442 |
{
|
| 443 |
"epoch": 0.9472551130247578,
|
| 444 |
+
"grad_norm": 2.441693067550659,
|
| 445 |
+
"learning_rate": 7.7491126551857e-06,
|
| 446 |
+
"loss": 0.1175,
|
| 447 |
+
"num_input_tokens_seen": 1932832,
|
| 448 |
"step": 440,
|
| 449 |
+
"train_runtime": 1401.3047,
|
| 450 |
+
"train_tokens_per_second": 1379.309
|
| 451 |
},
|
| 452 |
{
|
| 453 |
"epoch": 0.9687836383207751,
|
| 454 |
+
"grad_norm": 1.3606727123260498,
|
| 455 |
+
"learning_rate": 7.654369231225398e-06,
|
| 456 |
+
"loss": 0.1154,
|
| 457 |
+
"num_input_tokens_seen": 1976000,
|
| 458 |
"step": 450,
|
| 459 |
+
"train_runtime": 1431.9402,
|
| 460 |
+
"train_tokens_per_second": 1379.946
|
| 461 |
},
|
| 462 |
{
|
| 463 |
"epoch": 0.9903121636167922,
|
| 464 |
+
"grad_norm": 2.911600351333618,
|
| 465 |
+
"learning_rate": 7.5582796546179125e-06,
|
| 466 |
+
"loss": 0.1408,
|
| 467 |
+
"num_input_tokens_seen": 2019968,
|
| 468 |
"step": 460,
|
| 469 |
+
"train_runtime": 1463.035,
|
| 470 |
+
"train_tokens_per_second": 1380.67
|
| 471 |
},
|
| 472 |
{
|
| 473 |
"epoch": 1.0107642626480087,
|
| 474 |
+
"grad_norm": 2.967047929763794,
|
| 475 |
+
"learning_rate": 7.460892656804366e-06,
|
| 476 |
+
"loss": 0.1126,
|
| 477 |
+
"num_input_tokens_seen": 2061440,
|
| 478 |
"step": 470,
|
| 479 |
+
"train_runtime": 1492.4083,
|
| 480 |
+
"train_tokens_per_second": 1381.284
|
| 481 |
},
|
| 482 |
{
|
| 483 |
"epoch": 1.0322927879440258,
|
| 484 |
+
"grad_norm": 1.90776789188385,
|
| 485 |
+
"learning_rate": 7.362257627207818e-06,
|
| 486 |
+
"loss": 0.1329,
|
| 487 |
+
"num_input_tokens_seen": 2105216,
|
| 488 |
"step": 480,
|
| 489 |
+
"train_runtime": 1523.2979,
|
| 490 |
+
"train_tokens_per_second": 1382.012
|
| 491 |
},
|
| 492 |
{
|
| 493 |
"epoch": 1.0538213132400431,
|
| 494 |
+
"grad_norm": 2.7770872116088867,
|
| 495 |
+
"learning_rate": 7.2624245881856094e-06,
|
| 496 |
+
"loss": 0.111,
|
| 497 |
+
"num_input_tokens_seen": 2149888,
|
| 498 |
"step": 490,
|
| 499 |
+
"train_runtime": 1554.9287,
|
| 500 |
+
"train_tokens_per_second": 1382.628
|
| 501 |
},
|
| 502 |
{
|
| 503 |
"epoch": 1.0753498385360603,
|
| 504 |
+
"grad_norm": 1.9737987518310547,
|
| 505 |
+
"learning_rate": 7.161444169660723e-06,
|
| 506 |
+
"loss": 0.113,
|
| 507 |
+
"num_input_tokens_seen": 2194304,
|
| 508 |
"step": 500,
|
| 509 |
+
"train_runtime": 1586.2216,
|
| 510 |
+
"train_tokens_per_second": 1383.353
|
| 511 |
},
|
| 512 |
{
|
| 513 |
"epoch": 1.0968783638320776,
|
| 514 |
+
"grad_norm": 1.2335457801818848,
|
| 515 |
+
"learning_rate": 7.059367583445034e-06,
|
| 516 |
+
"loss": 0.1303,
|
| 517 |
+
"num_input_tokens_seen": 2238080,
|
| 518 |
"step": 510,
|
| 519 |
+
"train_runtime": 1617.0801,
|
| 520 |
+
"train_tokens_per_second": 1384.025
|
| 521 |
},
|
| 522 |
{
|
| 523 |
"epoch": 1.1184068891280947,
|
| 524 |
+
"grad_norm": 2.525258779525757,
|
| 525 |
+
"learning_rate": 6.956246597267438e-06,
|
| 526 |
+
"loss": 0.1404,
|
| 527 |
+
"num_input_tokens_seen": 2282368,
|
| 528 |
"step": 520,
|
| 529 |
+
"train_runtime": 1648.4109,
|
| 530 |
+
"train_tokens_per_second": 1384.587
|
| 531 |
},
|
| 532 |
{
|
| 533 |
"epoch": 1.1399354144241118,
|
| 534 |
+
"grad_norm": 4.016520977020264,
|
| 535 |
+
"learning_rate": 6.852133508520057e-06,
|
| 536 |
+
"loss": 0.0972,
|
| 537 |
+
"num_input_tokens_seen": 2325984,
|
| 538 |
"step": 530,
|
| 539 |
+
"train_runtime": 1679.3164,
|
| 540 |
+
"train_tokens_per_second": 1385.078
|
| 541 |
},
|
| 542 |
{
|
| 543 |
"epoch": 1.1614639397201292,
|
| 544 |
+
"grad_norm": 1.405586838722229,
|
| 545 |
+
"learning_rate": 6.747081117735829e-06,
|
| 546 |
+
"loss": 0.1092,
|
| 547 |
+
"num_input_tokens_seen": 2369664,
|
| 548 |
"step": 540,
|
| 549 |
+
"train_runtime": 1710.2475,
|
| 550 |
+
"train_tokens_per_second": 1385.568
|
| 551 |
},
|
| 552 |
{
|
| 553 |
"epoch": 1.1829924650161463,
|
| 554 |
+
"grad_norm": 2.151442766189575,
|
| 555 |
+
"learning_rate": 6.641142701810932e-06,
|
| 556 |
+
"loss": 0.1186,
|
| 557 |
+
"num_input_tokens_seen": 2413312,
|
| 558 |
"step": 550,
|
| 559 |
+
"train_runtime": 1741.213,
|
| 560 |
+
"train_tokens_per_second": 1385.995
|
| 561 |
},
|
| 562 |
{
|
| 563 |
"epoch": 1.2045209903121636,
|
| 564 |
+
"grad_norm": 1.9706578254699707,
|
| 565 |
+
"learning_rate": 6.534371986985618e-06,
|
| 566 |
+
"loss": 0.1332,
|
| 567 |
+
"num_input_tokens_seen": 2457120,
|
| 568 |
"step": 560,
|
| 569 |
+
"train_runtime": 1772.1204,
|
| 570 |
+
"train_tokens_per_second": 1386.542
|
| 571 |
},
|
| 572 |
{
|
| 573 |
"epoch": 1.2260495156081808,
|
| 574 |
+
"grad_norm": 2.3035449981689453,
|
| 575 |
+
"learning_rate": 6.426823121597169e-06,
|
| 576 |
+
"loss": 0.1481,
|
| 577 |
+
"num_input_tokens_seen": 2500736,
|
| 578 |
"step": 570,
|
| 579 |
+
"train_runtime": 1803.0834,
|
| 580 |
+
"train_tokens_per_second": 1386.922
|
| 581 |
},
|
| 582 |
{
|
| 583 |
"epoch": 1.247578040904198,
|
| 584 |
+
"grad_norm": 3.713632106781006,
|
| 585 |
+
"learning_rate": 6.318550648618785e-06,
|
| 586 |
+
"loss": 0.1332,
|
| 587 |
+
"num_input_tokens_seen": 2545056,
|
| 588 |
"step": 580,
|
| 589 |
+
"train_runtime": 1834.1935,
|
| 590 |
+
"train_tokens_per_second": 1387.561
|
| 591 |
},
|
| 592 |
{
|
| 593 |
"epoch": 1.2691065662002152,
|
| 594 |
+
"grad_norm": 1.8667478561401367,
|
| 595 |
+
"learning_rate": 6.209609477998339e-06,
|
| 596 |
+
"loss": 0.0978,
|
| 597 |
+
"num_input_tokens_seen": 2588416,
|
| 598 |
"step": 590,
|
| 599 |
+
"train_runtime": 1864.9784,
|
| 600 |
+
"train_tokens_per_second": 1387.907
|
| 601 |
},
|
| 602 |
{
|
| 603 |
"epoch": 1.2906350914962326,
|
| 604 |
+
"grad_norm": 2.295342445373535,
|
| 605 |
+
"learning_rate": 6.100054858811012e-06,
|
| 606 |
+
"loss": 0.1176,
|
| 607 |
+
"num_input_tokens_seen": 2632352,
|
| 608 |
"step": 600,
|
| 609 |
+
"train_runtime": 1896.108,
|
| 610 |
+
"train_tokens_per_second": 1388.292
|
| 611 |
},
|
| 612 |
{
|
| 613 |
"epoch": 1.3121636167922497,
|
| 614 |
+
"grad_norm": 2.2867720127105713,
|
| 615 |
+
"learning_rate": 5.989942351239954e-06,
|
| 616 |
+
"loss": 0.1279,
|
| 617 |
+
"num_input_tokens_seen": 2676640,
|
| 618 |
"step": 610,
|
| 619 |
+
"train_runtime": 1927.5126,
|
| 620 |
+
"train_tokens_per_second": 1388.65
|
| 621 |
},
|
| 622 |
{
|
| 623 |
"epoch": 1.333692142088267,
|
| 624 |
+
"grad_norm": 2.1158223152160645,
|
| 625 |
+
"learning_rate": 5.879327798399155e-06,
|
| 626 |
+
"loss": 0.1407,
|
| 627 |
+
"num_input_tokens_seen": 2719968,
|
| 628 |
"step": 620,
|
| 629 |
+
"train_runtime": 1958.2576,
|
| 630 |
+
"train_tokens_per_second": 1388.974
|
| 631 |
},
|
| 632 |
{
|
| 633 |
"epoch": 1.3552206673842842,
|
| 634 |
+
"grad_norm": 4.076441287994385,
|
| 635 |
+
"learning_rate": 5.768267298012841e-06,
|
| 636 |
+
"loss": 0.1168,
|
| 637 |
+
"num_input_tokens_seen": 2764352,
|
| 638 |
"step": 630,
|
| 639 |
+
"train_runtime": 1989.6781,
|
| 640 |
+
"train_tokens_per_second": 1389.346
|
| 641 |
},
|
| 642 |
{
|
| 643 |
"epoch": 1.3767491926803013,
|
| 644 |
+
"grad_norm": 4.354236602783203,
|
| 645 |
+
"learning_rate": 5.656817173965733e-06,
|
| 646 |
+
"loss": 0.1188,
|
| 647 |
+
"num_input_tokens_seen": 2808832,
|
| 648 |
"step": 640,
|
| 649 |
+
"train_runtime": 2021.0224,
|
| 650 |
+
"train_tokens_per_second": 1389.807
|
| 651 |
},
|
| 652 |
{
|
| 653 |
"epoch": 1.3982777179763186,
|
| 654 |
+
"grad_norm": 4.40167236328125,
|
| 655 |
+
"learning_rate": 5.545033947738624e-06,
|
| 656 |
+
"loss": 0.1326,
|
| 657 |
+
"num_input_tokens_seen": 2852192,
|
| 658 |
"step": 650,
|
| 659 |
+
"train_runtime": 2051.72,
|
| 660 |
+
"train_tokens_per_second": 1390.147
|
| 661 |
},
|
| 662 |
{
|
| 663 |
"epoch": 1.419806243272336,
|
| 664 |
+
"grad_norm": 2.4845104217529297,
|
| 665 |
+
"learning_rate": 5.4329743097437316e-06,
|
| 666 |
+
"loss": 0.1331,
|
| 667 |
+
"num_input_tokens_seen": 2896256,
|
| 668 |
"step": 660,
|
| 669 |
+
"train_runtime": 2082.7361,
|
| 670 |
+
"train_tokens_per_second": 1390.602
|
| 671 |
},
|
| 672 |
{
|
| 673 |
"epoch": 1.441334768568353,
|
| 674 |
+
"grad_norm": 2.7233705520629883,
|
| 675 |
+
"learning_rate": 5.320695090574386e-06,
|
| 676 |
+
"loss": 0.1082,
|
| 677 |
+
"num_input_tokens_seen": 2939552,
|
| 678 |
"step": 670,
|
| 679 |
+
"train_runtime": 2113.5367,
|
| 680 |
+
"train_tokens_per_second": 1390.821
|
| 681 |
},
|
| 682 |
{
|
| 683 |
"epoch": 1.4628632938643702,
|
| 684 |
+
"grad_norm": 3.289949893951416,
|
| 685 |
+
"learning_rate": 5.208253232183625e-06,
|
| 686 |
+
"loss": 0.1184,
|
| 687 |
+
"num_input_tokens_seen": 2984000,
|
| 688 |
"step": 680,
|
| 689 |
+
"train_runtime": 2144.7931,
|
| 690 |
+
"train_tokens_per_second": 1391.276
|
| 691 |
},
|
| 692 |
{
|
| 693 |
"epoch": 1.4843918191603875,
|
| 694 |
+
"grad_norm": 4.015010833740234,
|
| 695 |
+
"learning_rate": 5.095705759006311e-06,
|
| 696 |
+
"loss": 0.0942,
|
| 697 |
+
"num_input_tokens_seen": 3028192,
|
| 698 |
"step": 690,
|
| 699 |
+
"train_runtime": 2176.0229,
|
| 700 |
+
"train_tokens_per_second": 1391.618
|
| 701 |
},
|
| 702 |
{
|
| 703 |
"epoch": 1.5059203444564049,
|
| 704 |
+
"grad_norm": 5.474874973297119,
|
| 705 |
+
"learning_rate": 4.9831097490394195e-06,
|
| 706 |
+
"loss": 0.1204,
|
| 707 |
+
"num_input_tokens_seen": 3071392,
|
| 708 |
"step": 700,
|
| 709 |
+
"train_runtime": 2206.8218,
|
| 710 |
+
"train_tokens_per_second": 1391.772
|
| 711 |
},
|
| 712 |
{
|
| 713 |
"epoch": 1.527448869752422,
|
| 714 |
+
"grad_norm": 2.4211018085479736,
|
| 715 |
+
"learning_rate": 4.870522304895164e-06,
|
| 716 |
+
"loss": 0.1358,
|
| 717 |
+
"num_input_tokens_seen": 3114496,
|
| 718 |
"step": 710,
|
| 719 |
+
"train_runtime": 2237.5127,
|
| 720 |
+
"train_tokens_per_second": 1391.946
|
| 721 |
},
|
| 722 |
{
|
| 723 |
"epoch": 1.5489773950484391,
|
| 724 |
+
"grad_norm": 2.5446665287017822,
|
| 725 |
+
"learning_rate": 4.758000524841632e-06,
|
| 726 |
+
"loss": 0.1313,
|
| 727 |
+
"num_input_tokens_seen": 3158432,
|
| 728 |
"step": 720,
|
| 729 |
+
"train_runtime": 2268.6496,
|
| 730 |
+
"train_tokens_per_second": 1392.208
|
| 731 |
},
|
| 732 |
{
|
| 733 |
"epoch": 1.5705059203444565,
|
| 734 |
+
"grad_norm": 5.643487453460693,
|
| 735 |
+
"learning_rate": 4.645601473845636e-06,
|
| 736 |
+
"loss": 0.0879,
|
| 737 |
+
"num_input_tokens_seen": 3201888,
|
| 738 |
"step": 730,
|
| 739 |
+
"train_runtime": 2299.4823,
|
| 740 |
+
"train_tokens_per_second": 1392.439
|
| 741 |
},
|
| 742 |
{
|
| 743 |
"epoch": 1.5920344456404736,
|
| 744 |
+
"grad_norm": 1.8654100894927979,
|
| 745 |
+
"learning_rate": 4.533382154632442e-06,
|
| 746 |
+
"loss": 0.0977,
|
| 747 |
+
"num_input_tokens_seen": 3245856,
|
| 748 |
"step": 740,
|
| 749 |
+
"train_runtime": 2330.5679,
|
| 750 |
+
"train_tokens_per_second": 1392.732
|
| 751 |
},
|
| 752 |
{
|
| 753 |
"epoch": 1.6135629709364907,
|
| 754 |
+
"grad_norm": 2.2264926433563232,
|
| 755 |
+
"learning_rate": 4.421399478777064e-06,
|
| 756 |
+
"loss": 0.1483,
|
| 757 |
+
"num_input_tokens_seen": 3290208,
|
| 758 |
"step": 750,
|
| 759 |
+
"train_runtime": 2361.9169,
|
| 760 |
+
"train_tokens_per_second": 1393.024
|
| 761 |
},
|
| 762 |
{
|
| 763 |
"epoch": 1.635091496232508,
|
| 764 |
+
"grad_norm": 2.8280999660491943,
|
| 765 |
+
"learning_rate": 4.3097102378417985e-06,
|
| 766 |
+
"loss": 0.1285,
|
| 767 |
+
"num_input_tokens_seen": 3333152,
|
| 768 |
"step": 760,
|
| 769 |
+
"train_runtime": 2392.5926,
|
| 770 |
+
"train_tokens_per_second": 1393.113
|
| 771 |
},
|
| 772 |
{
|
| 773 |
"epoch": 1.6566200215285254,
|
| 774 |
+
"grad_norm": 3.5213840007781982,
|
| 775 |
+
"learning_rate": 4.198371074574597e-06,
|
| 776 |
+
"loss": 0.1475,
|
| 777 |
+
"num_input_tokens_seen": 3377664,
|
| 778 |
"step": 770,
|
| 779 |
+
"train_runtime": 2423.9491,
|
| 780 |
+
"train_tokens_per_second": 1393.455
|
| 781 |
},
|
| 782 |
{
|
| 783 |
"epoch": 1.6781485468245425,
|
| 784 |
+
"grad_norm": 3.323622226715088,
|
| 785 |
+
"learning_rate": 4.087438454182942e-06,
|
| 786 |
+
"loss": 0.0904,
|
| 787 |
+
"num_input_tokens_seen": 3422400,
|
| 788 |
"step": 780,
|
| 789 |
+
"train_runtime": 2455.5818,
|
| 790 |
+
"train_tokens_per_second": 1393.723
|
| 791 |
},
|
| 792 |
{
|
| 793 |
"epoch": 1.6996770721205596,
|
| 794 |
+
"grad_norm": 4.368185997009277,
|
| 795 |
+
"learning_rate": 3.976968635697732e-06,
|
| 796 |
+
"loss": 0.1199,
|
| 797 |
+
"num_input_tokens_seen": 3465760,
|
| 798 |
"step": 790,
|
| 799 |
+
"train_runtime": 2486.3362,
|
| 800 |
+
"train_tokens_per_second": 1393.922
|
| 801 |
},
|
| 802 |
{
|
| 803 |
"epoch": 1.721205597416577,
|
| 804 |
+
"grad_norm": 3.0081822872161865,
|
| 805 |
+
"learning_rate": 3.867017643441746e-06,
|
| 806 |
+
"loss": 0.102,
|
| 807 |
+
"num_input_tokens_seen": 3509760,
|
| 808 |
"step": 800,
|
| 809 |
+
"train_runtime": 2517.434,
|
| 810 |
+
"train_tokens_per_second": 1394.182
|
| 811 |
},
|
| 812 |
{
|
| 813 |
"epoch": 1.7427341227125943,
|
| 814 |
+
"grad_norm": 3.7257721424102783,
|
| 815 |
+
"learning_rate": 3.757641238617137e-06,
|
| 816 |
+
"loss": 0.1194,
|
| 817 |
+
"num_input_tokens_seen": 3554560,
|
| 818 |
"step": 810,
|
| 819 |
+
"train_runtime": 2549.4732,
|
| 820 |
+
"train_tokens_per_second": 1394.233
|
| 821 |
},
|
| 822 |
{
|
| 823 |
"epoch": 1.7642626480086114,
|
| 824 |
+
"grad_norm": 3.8365535736083984,
|
| 825 |
+
"learning_rate": 3.648894891026358e-06,
|
| 826 |
+
"loss": 0.1507,
|
| 827 |
+
"num_input_tokens_seen": 3599488,
|
| 828 |
"step": 820,
|
| 829 |
+
"train_runtime": 2581.0241,
|
| 830 |
+
"train_tokens_per_second": 1394.597
|
| 831 |
},
|
| 832 |
{
|
| 833 |
"epoch": 1.7857911733046286,
|
| 834 |
+
"grad_norm": 2.1309561729431152,
|
| 835 |
+
"learning_rate": 3.5408337509408764e-06,
|
| 836 |
+
"loss": 0.1015,
|
| 837 |
+
"num_input_tokens_seen": 3643680,
|
| 838 |
"step": 830,
|
| 839 |
+
"train_runtime": 2612.3216,
|
| 840 |
+
"train_tokens_per_second": 1394.805
|
| 841 |
},
|
| 842 |
{
|
| 843 |
"epoch": 1.807319698600646,
|
| 844 |
+
"grad_norm": 2.5082457065582275,
|
| 845 |
+
"learning_rate": 3.4335126211319412e-06,
|
| 846 |
+
"loss": 0.1165,
|
| 847 |
+
"num_input_tokens_seen": 3688160,
|
| 848 |
"step": 840,
|
| 849 |
+
"train_runtime": 2643.6717,
|
| 850 |
+
"train_tokens_per_second": 1395.09
|
| 851 |
},
|
| 852 |
{
|
| 853 |
"epoch": 1.8288482238966632,
|
| 854 |
+
"grad_norm": 1.4419660568237305,
|
| 855 |
+
"learning_rate": 3.32698592907757e-06,
|
| 856 |
+
"loss": 0.0958,
|
| 857 |
+
"num_input_tokens_seen": 3731392,
|
| 858 |
"step": 850,
|
| 859 |
+
"train_runtime": 2674.4286,
|
| 860 |
+
"train_tokens_per_second": 1395.211
|
| 861 |
},
|
| 862 |
{
|
| 863 |
"epoch": 1.8503767491926801,
|
| 864 |
+
"grad_norm": 2.402513027191162,
|
| 865 |
+
"learning_rate": 3.2213076993598857e-06,
|
| 866 |
+
"loss": 0.1505,
|
| 867 |
+
"num_input_tokens_seen": 3776128,
|
| 868 |
"step": 860,
|
| 869 |
+
"train_runtime": 2706.116,
|
| 870 |
+
"train_tokens_per_second": 1395.405
|
| 871 |
},
|
| 872 |
{
|
| 873 |
"epoch": 1.8719052744886975,
|
| 874 |
+
"grad_norm": 0.9779609441757202,
|
| 875 |
+
"learning_rate": 3.1165315262667535e-06,
|
| 876 |
+
"loss": 0.1003,
|
| 877 |
+
"num_input_tokens_seen": 3820896,
|
| 878 |
"step": 870,
|
| 879 |
+
"train_runtime": 2737.6181,
|
| 880 |
+
"train_tokens_per_second": 1395.701
|
| 881 |
},
|
| 882 |
{
|
| 883 |
"epoch": 1.8934337997847148,
|
| 884 |
+
"grad_norm": 3.727255344390869,
|
| 885 |
+
"learning_rate": 3.012710546611659e-06,
|
| 886 |
+
"loss": 0.1483,
|
| 887 |
+
"num_input_tokens_seen": 3864704,
|
| 888 |
"step": 880,
|
| 889 |
+
"train_runtime": 2768.6885,
|
| 890 |
+
"train_tokens_per_second": 1395.861
|
| 891 |
},
|
| 892 |
{
|
| 893 |
"epoch": 1.914962325080732,
|
| 894 |
+
"grad_norm": 1.5679094791412354,
|
| 895 |
+
"learning_rate": 2.9098974127856e-06,
|
| 896 |
+
"loss": 0.117,
|
| 897 |
+
"num_input_tokens_seen": 3908544,
|
| 898 |
"step": 890,
|
| 899 |
+
"train_runtime": 2799.6713,
|
| 900 |
+
"train_tokens_per_second": 1396.072
|
| 901 |
},
|
| 902 |
{
|
| 903 |
"epoch": 1.936490850376749,
|
| 904 |
+
"grad_norm": 2.775408983230591,
|
| 905 |
+
"learning_rate": 2.8081442660546126e-06,
|
| 906 |
+
"loss": 0.1303,
|
| 907 |
+
"num_input_tokens_seen": 3952576,
|
| 908 |
"step": 900,
|
| 909 |
+
"train_runtime": 2830.9247,
|
| 910 |
+
"train_tokens_per_second": 1396.214
|
| 911 |
},
|
| 912 |
{
|
| 913 |
"epoch": 1.9580193756727664,
|
| 914 |
+
"grad_norm": 1.0387197732925415,
|
| 915 |
+
"learning_rate": 2.7075027101165706e-06,
|
| 916 |
+
"loss": 0.0971,
|
| 917 |
+
"num_input_tokens_seen": 3996416,
|
| 918 |
"step": 910,
|
| 919 |
+
"train_runtime": 2862.0695,
|
| 920 |
+
"train_tokens_per_second": 1396.338
|
| 921 |
},
|
| 922 |
{
|
| 923 |
"epoch": 1.9795479009687837,
|
| 924 |
+
"grad_norm": 3.794166326522827,
|
| 925 |
+
"learning_rate": 2.6080237849305467e-06,
|
| 926 |
+
"loss": 0.132,
|
| 927 |
+
"num_input_tokens_seen": 4040736,
|
| 928 |
"step": 920,
|
| 929 |
+
"train_runtime": 2893.2903,
|
| 930 |
+
"train_tokens_per_second": 1396.589
|
| 931 |
},
|
| 932 |
{
|
| 933 |
"epoch": 2.0,
|
| 934 |
+
"grad_norm": 1.547866702079773,
|
| 935 |
+
"learning_rate": 2.5097579408321264e-06,
|
| 936 |
+
"loss": 0.093,
|
| 937 |
+
"num_input_tokens_seen": 4083200,
|
| 938 |
"step": 930,
|
| 939 |
+
"train_runtime": 2923.2158,
|
| 940 |
+
"train_tokens_per_second": 1396.818
|
| 941 |
},
|
| 942 |
{
|
| 943 |
"epoch": 2.0215285252960173,
|
| 944 |
+
"grad_norm": 3.5177085399627686,
|
| 945 |
+
"learning_rate": 2.4127550129477145e-06,
|
| 946 |
+
"loss": 0.1324,
|
| 947 |
+
"num_input_tokens_seen": 4127040,
|
| 948 |
"step": 940,
|
| 949 |
+
"train_runtime": 2954.2784,
|
| 950 |
+
"train_tokens_per_second": 1396.971
|
| 951 |
},
|
| 952 |
{
|
| 953 |
"epoch": 2.0430570505920342,
|
| 954 |
+
"grad_norm": 1.8717275857925415,
|
| 955 |
+
"learning_rate": 2.317064195920852e-06,
|
| 956 |
+
"loss": 0.0841,
|
| 957 |
+
"num_input_tokens_seen": 4170816,
|
| 958 |
"step": 950,
|
| 959 |
+
"train_runtime": 2985.3333,
|
| 960 |
+
"train_tokens_per_second": 1397.102
|
| 961 |
},
|
| 962 |
{
|
| 963 |
"epoch": 2.0645855758880516,
|
| 964 |
+
"grad_norm": 1.233929991722107,
|
| 965 |
+
"learning_rate": 2.2227340189633508e-06,
|
| 966 |
+
"loss": 0.1138,
|
| 967 |
+
"num_input_tokens_seen": 4214272,
|
| 968 |
"step": 960,
|
| 969 |
+
"train_runtime": 3016.1559,
|
| 970 |
+
"train_tokens_per_second": 1397.233
|
| 971 |
},
|
| 972 |
{
|
| 973 |
"epoch": 2.086114101184069,
|
| 974 |
+
"grad_norm": 1.6053682565689087,
|
| 975 |
+
"learning_rate": 2.1298123212439028e-06,
|
| 976 |
+
"loss": 0.0892,
|
| 977 |
+
"num_input_tokens_seen": 4258592,
|
| 978 |
"step": 970,
|
| 979 |
+
"train_runtime": 3047.3824,
|
| 980 |
+
"train_tokens_per_second": 1397.459
|
| 981 |
},
|
| 982 |
{
|
| 983 |
"epoch": 2.1076426264800863,
|
| 984 |
+
"grad_norm": 2.4293172359466553,
|
| 985 |
+
"learning_rate": 2.0383462276266347e-06,
|
| 986 |
+
"loss": 0.1277,
|
| 987 |
+
"num_input_tokens_seen": 4302656,
|
| 988 |
"step": 980,
|
| 989 |
+
"train_runtime": 3078.5923,
|
| 990 |
+
"train_tokens_per_second": 1397.605
|
| 991 |
},
|
| 992 |
{
|
| 993 |
"epoch": 2.129171151776103,
|
| 994 |
+
"grad_norm": 2.0637197494506836,
|
| 995 |
+
"learning_rate": 1.948382124771927e-06,
|
| 996 |
+
"loss": 0.0968,
|
| 997 |
+
"num_input_tokens_seen": 4345888,
|
| 998 |
"step": 990,
|
| 999 |
+
"train_runtime": 3109.3083,
|
| 1000 |
+
"train_tokens_per_second": 1397.703
|
| 1001 |
},
|
| 1002 |
{
|
| 1003 |
"epoch": 2.1506996770721205,
|
| 1004 |
+
"grad_norm": 3.5659446716308594,
|
| 1005 |
+
"learning_rate": 1.8599656376116026e-06,
|
| 1006 |
+
"loss": 0.1226,
|
| 1007 |
+
"num_input_tokens_seen": 4390528,
|
| 1008 |
"step": 1000,
|
| 1009 |
+
"train_runtime": 3140.7259,
|
| 1010 |
+
"train_tokens_per_second": 1397.934
|
| 1011 |
},
|
| 1012 |
{
|
| 1013 |
"epoch": 2.172228202368138,
|
| 1014 |
+
"grad_norm": 3.0801503658294678,
|
| 1015 |
+
"learning_rate": 1.773141606210431e-06,
|
| 1016 |
+
"loss": 0.1201,
|
| 1017 |
+
"num_input_tokens_seen": 4434784,
|
| 1018 |
"step": 1010,
|
| 1019 |
+
"train_runtime": 3178.3674,
|
| 1020 |
+
"train_tokens_per_second": 1395.303
|
| 1021 |
},
|
| 1022 |
{
|
| 1023 |
"epoch": 2.193756727664155,
|
| 1024 |
+
"grad_norm": 2.0641636848449707,
|
| 1025 |
+
"learning_rate": 1.687954063025663e-06,
|
| 1026 |
+
"loss": 0.0966,
|
| 1027 |
+
"num_input_tokens_seen": 4478976,
|
| 1028 |
"step": 1020,
|
| 1029 |
+
"train_runtime": 3209.6721,
|
| 1030 |
+
"train_tokens_per_second": 1395.462
|
| 1031 |
},
|
| 1032 |
{
|
| 1033 |
"epoch": 2.215285252960172,
|
| 1034 |
+
"grad_norm": 2.951422929763794,
|
| 1035 |
+
"learning_rate": 1.604446210576157e-06,
|
| 1036 |
+
"loss": 0.1143,
|
| 1037 |
+
"num_input_tokens_seen": 4523616,
|
| 1038 |
"step": 1030,
|
| 1039 |
+
"train_runtime": 3241.2178,
|
| 1040 |
+
"train_tokens_per_second": 1395.653
|
| 1041 |
},
|
| 1042 |
{
|
| 1043 |
"epoch": 2.2368137782561894,
|
| 1044 |
+
"grad_norm": 5.046944618225098,
|
| 1045 |
+
"learning_rate": 1.5226603995323897e-06,
|
| 1046 |
+
"loss": 0.1114,
|
| 1047 |
+
"num_input_tokens_seen": 4567264,
|
| 1048 |
"step": 1040,
|
| 1049 |
+
"train_runtime": 3272.1686,
|
| 1050 |
+
"train_tokens_per_second": 1395.791
|
| 1051 |
},
|
| 1052 |
{
|
| 1053 |
"epoch": 2.2583423035522068,
|
| 1054 |
+
"grad_norm": 1.3710857629776,
|
| 1055 |
+
"learning_rate": 1.4426381072384866e-06,
|
| 1056 |
+
"loss": 0.0981,
|
| 1057 |
+
"num_input_tokens_seen": 4611104,
|
| 1058 |
"step": 1050,
|
| 1059 |
+
"train_runtime": 3303.3652,
|
| 1060 |
+
"train_tokens_per_second": 1395.881
|
| 1061 |
},
|
| 1062 |
{
|
| 1063 |
"epoch": 2.2798708288482237,
|
| 1064 |
+
"grad_norm": 2.5878543853759766,
|
| 1065 |
+
"learning_rate": 1.3644199166771531e-06,
|
| 1066 |
+
"loss": 0.1135,
|
| 1067 |
+
"num_input_tokens_seen": 4655040,
|
| 1068 |
"step": 1060,
|
| 1069 |
+
"train_runtime": 3334.5323,
|
| 1070 |
+
"train_tokens_per_second": 1396.01
|
| 1071 |
},
|
| 1072 |
{
|
| 1073 |
"epoch": 2.301399354144241,
|
| 1074 |
+
"grad_norm": 2.481158494949341,
|
| 1075 |
+
"learning_rate": 1.2880454958881794e-06,
|
| 1076 |
+
"loss": 0.1081,
|
| 1077 |
+
"num_input_tokens_seen": 4698432,
|
| 1078 |
"step": 1070,
|
| 1079 |
+
"train_runtime": 3365.4557,
|
| 1080 |
+
"train_tokens_per_second": 1396.076
|
| 1081 |
},
|
| 1082 |
{
|
| 1083 |
"epoch": 2.3229278794402584,
|
| 1084 |
+
"grad_norm": 1.2142502069473267,
|
| 1085 |
+
"learning_rate": 1.2135535778509545e-06,
|
| 1086 |
+
"loss": 0.0685,
|
| 1087 |
+
"num_input_tokens_seen": 4742848,
|
| 1088 |
"step": 1080,
|
| 1089 |
+
"train_runtime": 3396.7938,
|
| 1090 |
+
"train_tokens_per_second": 1396.272
|
| 1091 |
},
|
| 1092 |
{
|
| 1093 |
"epoch": 2.3444564047362757,
|
| 1094 |
+
"grad_norm": 3.040208339691162,
|
| 1095 |
+
"learning_rate": 1.1409819408411898e-06,
|
| 1096 |
+
"loss": 0.0857,
|
| 1097 |
+
"num_input_tokens_seen": 4786944,
|
| 1098 |
"step": 1090,
|
| 1099 |
+
"train_runtime": 3427.8943,
|
| 1100 |
+
"train_tokens_per_second": 1396.468
|
| 1101 |
},
|
| 1102 |
{
|
| 1103 |
"epoch": 2.3659849300322926,
|
| 1104 |
+
"grad_norm": 1.4514607191085815,
|
| 1105 |
+
"learning_rate": 1.070367389271823e-06,
|
| 1106 |
+
"loss": 0.1008,
|
| 1107 |
+
"num_input_tokens_seen": 4830624,
|
| 1108 |
"step": 1100,
|
| 1109 |
+
"train_runtime": 3458.8433,
|
| 1110 |
+
"train_tokens_per_second": 1396.601
|
| 1111 |
},
|
| 1112 |
{
|
| 1113 |
"epoch": 2.38751345532831,
|
| 1114 |
+
"grad_norm": 3.533973455429077,
|
| 1115 |
+
"learning_rate": 1.001745735027801e-06,
|
| 1116 |
+
"loss": 0.1137,
|
| 1117 |
+
"num_input_tokens_seen": 4874944,
|
| 1118 |
"step": 1110,
|
| 1119 |
+
"train_runtime": 3490.3116,
|
| 1120 |
+
"train_tokens_per_second": 1396.707
|
| 1121 |
},
|
| 1122 |
{
|
| 1123 |
"epoch": 2.4090419806243273,
|
| 1124 |
+
"grad_norm": 4.195890426635742,
|
| 1125 |
+
"learning_rate": 9.351517793042408e-07,
|
| 1126 |
+
"loss": 0.1038,
|
| 1127 |
+
"num_input_tokens_seen": 4918496,
|
| 1128 |
"step": 1120,
|
| 1129 |
+
"train_runtime": 3521.354,
|
| 1130 |
+
"train_tokens_per_second": 1396.763
|
| 1131 |
},
|
| 1132 |
{
|
| 1133 |
"epoch": 2.4305705059203446,
|
| 1134 |
+
"grad_norm": 4.139116287231445,
|
| 1135 |
+
"learning_rate": 8.706192949571262e-07,
|
| 1136 |
+
"loss": 0.1194,
|
| 1137 |
+
"num_input_tokens_seen": 4961920,
|
| 1138 |
"step": 1130,
|
| 1139 |
+
"train_runtime": 3552.2441,
|
| 1140 |
+
"train_tokens_per_second": 1396.841
|
| 1141 |
},
|
| 1142 |
{
|
| 1143 |
"epoch": 2.4520990312163615,
|
| 1144 |
+
"grad_norm": 3.0998311042785645,
|
| 1145 |
+
"learning_rate": 8.081810093755537e-07,
|
| 1146 |
+
"loss": 0.1161,
|
| 1147 |
+
"num_input_tokens_seen": 5005440,
|
| 1148 |
"step": 1140,
|
| 1149 |
+
"train_runtime": 3583.1755,
|
| 1150 |
+
"train_tokens_per_second": 1396.928
|
| 1151 |
},
|
| 1152 |
{
|
| 1153 |
"epoch": 2.473627556512379,
|
| 1154 |
+
"grad_norm": 2.2539584636688232,
|
| 1155 |
+
"learning_rate": 7.478685878841629e-07,
|
| 1156 |
+
"loss": 0.1,
|
| 1157 |
+
"num_input_tokens_seen": 5049344,
|
| 1158 |
"step": 1150,
|
| 1159 |
+
"train_runtime": 3614.3079,
|
| 1160 |
+
"train_tokens_per_second": 1397.043
|
| 1161 |
},
|
| 1162 |
{
|
| 1163 |
"epoch": 2.495156081808396,
|
| 1164 |
+
"grad_norm": 3.1125545501708984,
|
| 1165 |
+
"learning_rate": 6.897126176841978e-07,
|
| 1166 |
+
"loss": 0.0996,
|
| 1167 |
+
"num_input_tokens_seen": 5092896,
|
| 1168 |
"step": 1160,
|
| 1169 |
+
"train_runtime": 3645.2176,
|
| 1170 |
+
"train_tokens_per_second": 1397.145
|
| 1171 |
},
|
| 1172 |
{
|
| 1173 |
"epoch": 2.5166846071044136,
|
| 1174 |
+
"grad_norm": 3.5130155086517334,
|
| 1175 |
+
"learning_rate": 6.337425923413276e-07,
|
| 1176 |
+
"loss": 0.0944,
|
| 1177 |
+
"num_input_tokens_seen": 5136928,
|
| 1178 |
"step": 1170,
|
| 1179 |
+
"train_runtime": 3676.3104,
|
| 1180 |
+
"train_tokens_per_second": 1397.305
|
| 1181 |
},
|
| 1182 |
{
|
| 1183 |
"epoch": 2.5382131324004304,
|
| 1184 |
+
"grad_norm": 2.059572696685791,
|
| 1185 |
+
"learning_rate": 5.799868968281075e-07,
|
| 1186 |
+
"loss": 0.08,
|
| 1187 |
+
"num_input_tokens_seen": 5180960,
|
| 1188 |
"step": 1180,
|
| 1189 |
+
"train_runtime": 3707.5494,
|
| 1190 |
+
"train_tokens_per_second": 1397.408
|
| 1191 |
},
|
| 1192 |
{
|
| 1193 |
"epoch": 2.559741657696448,
|
| 1194 |
+
"grad_norm": 4.341704845428467,
|
| 1195 |
+
"learning_rate": 5.284727931286526e-07,
|
| 1196 |
+
"loss": 0.0962,
|
| 1197 |
+
"num_input_tokens_seen": 5225376,
|
| 1198 |
"step": 1190,
|
| 1199 |
+
"train_runtime": 3738.9161,
|
| 1200 |
+
"train_tokens_per_second": 1397.564
|
| 1201 |
},
|
| 1202 |
{
|
| 1203 |
"epoch": 2.581270182992465,
|
| 1204 |
+
"grad_norm": 2.8424837589263916,
|
| 1205 |
+
"learning_rate": 4.792264064128327e-07,
|
| 1206 |
+
"loss": 0.094,
|
| 1207 |
+
"num_input_tokens_seen": 5268992,
|
| 1208 |
"step": 1200,
|
| 1209 |
+
"train_runtime": 3769.9587,
|
| 1210 |
+
"train_tokens_per_second": 1397.626
|
| 1211 |
},
|
| 1212 |
{
|
| 1213 |
"epoch": 2.602798708288482,
|
| 1214 |
+
"grad_norm": 3.76309871673584,
|
| 1215 |
+
"learning_rate": 4.322727117869951e-07,
|
| 1216 |
+
"loss": 0.1005,
|
| 1217 |
+
"num_input_tokens_seen": 5312992,
|
| 1218 |
"step": 1210,
|
| 1219 |
+
"train_runtime": 3801.0547,
|
| 1220 |
+
"train_tokens_per_second": 1397.768
|
| 1221 |
},
|
| 1222 |
{
|
| 1223 |
"epoch": 2.6243272335844994,
|
| 1224 |
+
"grad_norm": 2.470759153366089,
|
| 1225 |
+
"learning_rate": 3.8763552162794983e-07,
|
| 1226 |
+
"loss": 0.1167,
|
| 1227 |
+
"num_input_tokens_seen": 5356448,
|
| 1228 |
"step": 1220,
|
| 1229 |
+
"train_runtime": 3831.9201,
|
| 1230 |
+
"train_tokens_per_second": 1397.85
|
| 1231 |
},
|
| 1232 |
{
|
| 1233 |
"epoch": 2.6458557588805167,
|
| 1234 |
+
"grad_norm": 2.948512315750122,
|
| 1235 |
+
"learning_rate": 3.453374735066034e-07,
|
| 1236 |
+
"loss": 0.0907,
|
| 1237 |
+
"num_input_tokens_seen": 5400672,
|
| 1238 |
"step": 1230,
|
| 1239 |
+
"train_runtime": 3863.178,
|
| 1240 |
+
"train_tokens_per_second": 1397.987
|
| 1241 |
},
|
| 1242 |
{
|
| 1243 |
"epoch": 2.667384284176534,
|
| 1244 |
+
"grad_norm": 2.082956552505493,
|
| 1245 |
+
"learning_rate": 3.054000187074224e-07,
|
| 1246 |
+
"loss": 0.1074,
|
| 1247 |
+
"num_input_tokens_seen": 5444576,
|
| 1248 |
"step": 1240,
|
| 1249 |
+
"train_runtime": 3894.1783,
|
| 1250 |
+
"train_tokens_per_second": 1398.132
|
| 1251 |
},
|
| 1252 |
{
|
| 1253 |
"epoch": 2.6889128094725514,
|
| 1254 |
+
"grad_norm": 2.035034656524658,
|
| 1255 |
+
"learning_rate": 2.678434113494882e-07,
|
| 1256 |
+
"loss": 0.1128,
|
| 1257 |
+
"num_input_tokens_seen": 5488160,
|
| 1258 |
"step": 1250,
|
| 1259 |
+
"train_runtime": 3925.0458,
|
| 1260 |
+
"train_tokens_per_second": 1398.241
|
| 1261 |
},
|
| 1262 |
{
|
| 1263 |
"epoch": 2.7104413347685683,
|
| 1264 |
+
"grad_norm": 3.7168209552764893,
|
| 1265 |
+
"learning_rate": 2.326866981147091e-07,
|
| 1266 |
+
"loss": 0.1016,
|
| 1267 |
+
"num_input_tokens_seen": 5532000,
|
| 1268 |
"step": 1260,
|
| 1269 |
+
"train_runtime": 3956.0804,
|
| 1270 |
+
"train_tokens_per_second": 1398.354
|
| 1271 |
},
|
| 1272 |
{
|
| 1273 |
"epoch": 2.7319698600645856,
|
| 1274 |
+
"grad_norm": 4.349425315856934,
|
| 1275 |
+
"learning_rate": 1.999477085883711e-07,
|
| 1276 |
+
"loss": 0.1052,
|
| 1277 |
+
"num_input_tokens_seen": 5575808,
|
| 1278 |
"step": 1270,
|
| 1279 |
+
"train_runtime": 3987.1129,
|
| 1280 |
+
"train_tokens_per_second": 1398.458
|
| 1281 |
},
|
| 1282 |
{
|
| 1283 |
"epoch": 2.7534983853606025,
|
| 1284 |
+
"grad_norm": 1.8204060792922974,
|
| 1285 |
+
"learning_rate": 1.6964304621693516e-07,
|
| 1286 |
+
"loss": 0.0918,
|
| 1287 |
+
"num_input_tokens_seen": 5619200,
|
| 1288 |
"step": 1280,
|
| 1289 |
+
"train_runtime": 4017.8653,
|
| 1290 |
+
"train_tokens_per_second": 1398.554
|
| 1291 |
},
|
| 1292 |
{
|
| 1293 |
"epoch": 2.77502691065662,
|
| 1294 |
+
"grad_norm": 3.752577066421509,
|
| 1295 |
+
"learning_rate": 1.4178807988766419e-07,
|
| 1296 |
+
"loss": 0.109,
|
| 1297 |
+
"num_input_tokens_seen": 5662656,
|
| 1298 |
"step": 1290,
|
| 1299 |
+
"train_runtime": 4048.795,
|
| 1300 |
+
"train_tokens_per_second": 1398.603
|
| 1301 |
},
|
| 1302 |
{
|
| 1303 |
"epoch": 2.7965554359526372,
|
| 1304 |
+
"grad_norm": 3.749866247177124,
|
| 1305 |
+
"learning_rate": 1.1639693613435921e-07,
|
| 1306 |
+
"loss": 0.1224,
|
| 1307 |
+
"num_input_tokens_seen": 5706656,
|
| 1308 |
"step": 1300,
|
| 1309 |
+
"train_runtime": 4079.9279,
|
| 1310 |
+
"train_tokens_per_second": 1398.715
|
| 1311 |
},
|
| 1312 |
{
|
| 1313 |
"epoch": 2.8180839612486546,
|
| 1314 |
+
"grad_norm": 2.628767251968384,
|
| 1315 |
+
"learning_rate": 9.348249197313918e-08,
|
| 1316 |
+
"loss": 0.0992,
|
| 1317 |
+
"num_input_tokens_seen": 5751232,
|
| 1318 |
"step": 1310,
|
| 1319 |
+
"train_runtime": 4111.4798,
|
| 1320 |
+
"train_tokens_per_second": 1398.823
|
| 1321 |
},
|
| 1322 |
{
|
| 1323 |
"epoch": 2.839612486544672,
|
| 1324 |
+
"grad_norm": 0.7992174625396729,
|
| 1325 |
+
"learning_rate": 7.305636837191876e-08,
|
| 1326 |
+
"loss": 0.107,
|
| 1327 |
+
"num_input_tokens_seen": 5794976,
|
| 1328 |
"step": 1320,
|
| 1329 |
+
"train_runtime": 4142.503,
|
| 1330 |
+
"train_tokens_per_second": 1398.907
|
| 1331 |
},
|
| 1332 |
{
|
| 1333 |
"epoch": 2.861141011840689,
|
| 1334 |
+
"grad_norm": 3.0042312145233154,
|
| 1335 |
+
"learning_rate": 5.512892435687645e-08,
|
| 1336 |
+
"loss": 0.0944,
|
| 1337 |
+
"num_input_tokens_seen": 5838368,
|
| 1338 |
"step": 1330,
|
| 1339 |
+
"train_runtime": 4173.35,
|
| 1340 |
+
"train_tokens_per_second": 1398.964
|
| 1341 |
},
|
| 1342 |
{
|
| 1343 |
"epoch": 2.882669537136706,
|
| 1344 |
+
"grad_norm": 3.208315134048462,
|
| 1345 |
+
"learning_rate": 3.970925175892093e-08,
|
| 1346 |
+
"loss": 0.0867,
|
| 1347 |
+
"num_input_tokens_seen": 5881984,
|
| 1348 |
"step": 1340,
|
| 1349 |
+
"train_runtime": 4204.3268,
|
| 1350 |
+
"train_tokens_per_second": 1399.031
|
| 1351 |
},
|
| 1352 |
{
|
| 1353 |
"epoch": 2.9041980624327235,
|
| 1354 |
+
"grad_norm": 3.5772690773010254,
|
| 1355 |
+
"learning_rate": 2.6805170602803297e-08,
|
| 1356 |
+
"loss": 0.1075,
|
| 1357 |
+
"num_input_tokens_seen": 5925664,
|
| 1358 |
"step": 1350,
|
| 1359 |
+
"train_runtime": 4235.1869,
|
| 1360 |
+
"train_tokens_per_second": 1399.151
|
| 1361 |
},
|
| 1362 |
{
|
| 1363 |
"epoch": 2.9257265877287404,
|
| 1364 |
+
"grad_norm": 3.261751413345337,
|
| 1365 |
+
"learning_rate": 1.6423225141223854e-08,
|
| 1366 |
+
"loss": 0.1042,
|
| 1367 |
+
"num_input_tokens_seen": 5969408,
|
| 1368 |
"step": 1360,
|
| 1369 |
+
"train_runtime": 4266.2069,
|
| 1370 |
+
"train_tokens_per_second": 1399.231
|
| 1371 |
},
|
| 1372 |
{
|
| 1373 |
"epoch": 2.9472551130247577,
|
| 1374 |
+
"grad_norm": 4.744147300720215,
|
| 1375 |
+
"learning_rate": 8.568680535939177e-09,
|
| 1376 |
+
"loss": 0.0964,
|
| 1377 |
+
"num_input_tokens_seen": 6012576,
|
| 1378 |
"step": 1370,
|
| 1379 |
+
"train_runtime": 4297.0229,
|
| 1380 |
+
"train_tokens_per_second": 1399.242
|
| 1381 |
},
|
| 1382 |
{
|
| 1383 |
"epoch": 2.968783638320775,
|
| 1384 |
+
"grad_norm": 2.3966517448425293,
|
| 1385 |
+
"learning_rate": 3.2455201875586372e-09,
|
| 1386 |
+
"loss": 0.0922,
|
| 1387 |
+
"num_input_tokens_seen": 6056000,
|
| 1388 |
"step": 1380,
|
| 1389 |
+
"train_runtime": 4328.462,
|
| 1390 |
+
"train_tokens_per_second": 1399.111
|
| 1391 |
},
|
| 1392 |
{
|
| 1393 |
"epoch": 2.9903121636167924,
|
| 1394 |
+
"grad_norm": 1.2950575351715088,
|
| 1395 |
+
"learning_rate": 4.5644371537756363e-10,
|
| 1396 |
+
"loss": 0.115,
|
| 1397 |
+
"num_input_tokens_seen": 6100192,
|
| 1398 |
"step": 1390,
|
| 1399 |
+
"train_runtime": 4359.7222,
|
| 1400 |
+
"train_tokens_per_second": 1399.216
|
| 1401 |
}
|
| 1402 |
],
|
| 1403 |
"logging_steps": 10,
|
| 1404 |
"max_steps": 1395,
|
| 1405 |
+
"num_input_tokens_seen": 6120032,
|
| 1406 |
"num_train_epochs": 3,
|
| 1407 |
"save_steps": 1000,
|
| 1408 |
"stateful_callbacks": {
|
|
|
|
| 1417 |
"attributes": {}
|
| 1418 |
}
|
| 1419 |
},
|
| 1420 |
+
"total_flos": 4.115769119160883e+17,
|
| 1421 |
"train_batch_size": 4,
|
| 1422 |
"trial_name": null,
|
| 1423 |
"trial_params": null
|
checkpoint-1395/training_args.bin
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 6161
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:57039f57f730004d2db4291a164c9a267ccb02be9b83d34e8933cba3e52ae325
|
| 3 |
size 6161
|
llamaboard_config.yaml
CHANGED
|
@@ -5,7 +5,7 @@ top.model_name: Gemma-3-12B-Instruct
|
|
| 5 |
top.quantization_bit: '4'
|
| 6 |
top.quantization_method: bnb
|
| 7 |
top.rope_scaling: none
|
| 8 |
-
top.template:
|
| 9 |
train.additional_target: ''
|
| 10 |
train.apollo_rank: 16
|
| 11 |
train.apollo_scale: 32
|
|
@@ -16,7 +16,7 @@ train.badam_switch_interval: 50
|
|
| 16 |
train.badam_switch_mode: ascending
|
| 17 |
train.badam_update_ratio: 0.05
|
| 18 |
train.batch_size: 4
|
| 19 |
-
train.compute_type:
|
| 20 |
train.create_new_adapter: false
|
| 21 |
train.cutoff_len: 2048
|
| 22 |
train.dataset:
|
|
@@ -39,7 +39,7 @@ train.galore_update_interval: 200
|
|
| 39 |
train.gradient_accumulation_steps: 2
|
| 40 |
train.image_max_pixels: 768*768
|
| 41 |
train.image_min_pixels: 32*32
|
| 42 |
-
train.learning_rate:
|
| 43 |
train.logging_steps: 10
|
| 44 |
train.lora_alpha: 16
|
| 45 |
train.lora_dropout: 0
|
|
|
|
| 5 |
top.quantization_bit: '4'
|
| 6 |
top.quantization_method: bnb
|
| 7 |
top.rope_scaling: none
|
| 8 |
+
top.template: gemma3
|
| 9 |
train.additional_target: ''
|
| 10 |
train.apollo_rank: 16
|
| 11 |
train.apollo_scale: 32
|
|
|
|
| 16 |
train.badam_switch_mode: ascending
|
| 17 |
train.badam_update_ratio: 0.05
|
| 18 |
train.batch_size: 4
|
| 19 |
+
train.compute_type: bf16
|
| 20 |
train.create_new_adapter: false
|
| 21 |
train.cutoff_len: 2048
|
| 22 |
train.dataset:
|
|
|
|
| 39 |
train.gradient_accumulation_steps: 2
|
| 40 |
train.image_max_pixels: 768*768
|
| 41 |
train.image_min_pixels: 32*32
|
| 42 |
+
train.learning_rate: 1e-5
|
| 43 |
train.logging_steps: 10
|
| 44 |
train.lora_alpha: 16
|
| 45 |
train.lora_dropout: 0
|
running_log.txt
CHANGED
|
@@ -1,20 +1,20 @@
|
|
| 1 |
-
[INFO|2025-10-
|
| 2 |
|
| 3 |
-
[INFO|2025-10-
|
| 4 |
|
| 5 |
-
[INFO|2025-10-
|
| 6 |
|
| 7 |
-
[INFO|2025-10-
|
| 8 |
|
| 9 |
-
[INFO|2025-10-
|
| 10 |
|
| 11 |
-
[INFO|2025-10-
|
| 12 |
|
| 13 |
-
[INFO|2025-10-
|
| 14 |
|
| 15 |
-
[INFO|2025-10-
|
| 16 |
|
| 17 |
-
[INFO|2025-10-
|
| 18 |
"crop_size": null,
|
| 19 |
"data_format": "channels_first",
|
| 20 |
"default_to_square": true,
|
|
@@ -52,21 +52,21 @@
|
|
| 52 |
}
|
| 53 |
|
| 54 |
|
| 55 |
-
[INFO|2025-10-
|
| 56 |
|
| 57 |
-
[INFO|2025-10-
|
| 58 |
|
| 59 |
-
[INFO|2025-10-
|
| 60 |
|
| 61 |
-
[INFO|2025-10-
|
| 62 |
|
| 63 |
-
[INFO|2025-10-
|
| 64 |
|
| 65 |
-
[INFO|2025-10-
|
| 66 |
|
| 67 |
-
[INFO|2025-10-
|
| 68 |
|
| 69 |
-
[INFO|2025-10-
|
| 70 |
- image_processor: Gemma3ImageProcessorFast {
|
| 71 |
"crop_size": null,
|
| 72 |
"data_format": "channels_first",
|
|
@@ -7025,15 +7025,17 @@
|
|
| 7025 |
}
|
| 7026 |
|
| 7027 |
|
| 7028 |
-
[INFO|2025-10-
|
| 7029 |
|
| 7030 |
-
[INFO|2025-10-
|
| 7031 |
|
| 7032 |
-
[INFO|2025-10-
|
| 7033 |
|
| 7034 |
-
[INFO|2025-10-
|
| 7035 |
|
| 7036 |
-
[INFO|2025-10-
|
|
|
|
|
|
|
| 7037 |
"architectures": [
|
| 7038 |
"Gemma3ForConditionalGeneration"
|
| 7039 |
],
|
|
@@ -7095,17 +7097,17 @@
|
|
| 7095 |
}
|
| 7096 |
|
| 7097 |
|
| 7098 |
-
[INFO|2025-10-
|
| 7099 |
|
| 7100 |
-
[INFO|2025-10-
|
| 7101 |
|
| 7102 |
-
[INFO|2025-10-
|
| 7103 |
|
| 7104 |
-
[INFO|2025-10-
|
| 7105 |
|
| 7106 |
-
[INFO|2025-10-
|
| 7107 |
|
| 7108 |
-
[INFO|2025-10-
|
| 7109 |
"architectures": [
|
| 7110 |
"Gemma3ForConditionalGeneration"
|
| 7111 |
],
|
|
@@ -7264,13 +7266,13 @@
|
|
| 7264 |
}
|
| 7265 |
|
| 7266 |
|
| 7267 |
-
[INFO|2025-10-
|
| 7268 |
|
| 7269 |
-
[INFO|2025-10-
|
| 7270 |
|
| 7271 |
-
[INFO|2025-10-
|
| 7272 |
|
| 7273 |
-
[INFO|2025-10-
|
| 7274 |
"architectures": [
|
| 7275 |
"Gemma3ForConditionalGeneration"
|
| 7276 |
],
|
|
@@ -7429,21 +7431,13 @@
|
|
| 7429 |
}
|
| 7430 |
|
| 7431 |
|
| 7432 |
-
[INFO|2025-10-
|
| 7433 |
-
|
| 7434 |
-
[INFO|2025-10-18 14:46:19] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unslothai--repeat/snapshots/7c48478c02f84ed89f149b0815cc0216ee831fb0/config.json
|
| 7435 |
-
|
| 7436 |
-
[INFO|2025-10-18 14:46:19] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unslothai--vram-80/snapshots/830433cec98f0aa155f72baba38dc9fe6831d3f3/config.json
|
| 7437 |
-
|
| 7438 |
-
[INFO|2025-10-18 14:46:20] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unslothai--1/snapshots/7ec782b7604cd9ea0781c23a4270f031650f5617/config.json
|
| 7439 |
-
|
| 7440 |
-
[INFO|2025-10-18 14:46:20] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
|
| 7441 |
|
| 7442 |
-
[INFO|2025-10-
|
| 7443 |
|
| 7444 |
-
[INFO|2025-10-
|
| 7445 |
|
| 7446 |
-
[INFO|2025-10-
|
| 7447 |
"architectures": [
|
| 7448 |
"Gemma3ForConditionalGeneration"
|
| 7449 |
],
|
|
@@ -7602,30 +7596,30 @@
|
|
| 7602 |
}
|
| 7603 |
|
| 7604 |
|
| 7605 |
-
[INFO|2025-10-
|
| 7606 |
|
| 7607 |
-
[INFO|2025-10-
|
| 7608 |
|
| 7609 |
-
[INFO|2025-10-
|
| 7610 |
"bos_token_id": 2,
|
| 7611 |
"eos_token_id": 106,
|
| 7612 |
"pad_token_id": 0
|
| 7613 |
}
|
| 7614 |
|
| 7615 |
|
| 7616 |
-
[INFO|2025-10-
|
| 7617 |
|
| 7618 |
-
[INFO|2025-10-
|
| 7619 |
|
| 7620 |
-
[INFO|2025-10-
|
| 7621 |
|
| 7622 |
|
| 7623 |
-
[INFO|2025-10-
|
| 7624 |
If your task is similar to the task the model of the checkpoint was trained on, you can already use Gemma3ForConditionalGeneration for predictions without further training.
|
| 7625 |
|
| 7626 |
-
[INFO|2025-10-
|
| 7627 |
|
| 7628 |
-
[INFO|2025-10-
|
| 7629 |
"bos_token_id": 2,
|
| 7630 |
"cache_implementation": "hybrid",
|
| 7631 |
"do_sample": true,
|
|
@@ -7639,11 +7633,11 @@ If your task is similar to the task the model of the checkpoint was trained on,
|
|
| 7639 |
}
|
| 7640 |
|
| 7641 |
|
| 7642 |
-
[INFO|2025-10-
|
| 7643 |
|
| 7644 |
-
[INFO|2025-10-
|
| 7645 |
|
| 7646 |
-
[INFO|2025-10-
|
| 7647 |
"do_convert_rgb": null,
|
| 7648 |
"do_normalize": true,
|
| 7649 |
"do_pan_and_scan": null,
|
|
@@ -7674,9 +7668,9 @@ If your task is similar to the task the model of the checkpoint was trained on,
|
|
| 7674 |
}
|
| 7675 |
|
| 7676 |
|
| 7677 |
-
[INFO|2025-10-
|
| 7678 |
|
| 7679 |
-
[INFO|2025-10-
|
| 7680 |
- image_processor: Gemma3ImageProcessor {
|
| 7681 |
"do_convert_rgb": null,
|
| 7682 |
"do_normalize": true,
|
|
@@ -14628,354 +14622,354 @@ If your task is similar to the task the model of the checkpoint was trained on,
|
|
| 14628 |
}
|
| 14629 |
|
| 14630 |
|
| 14631 |
-
[INFO|2025-10-
|
| 14632 |
|
| 14633 |
-
[INFO|2025-10-
|
| 14634 |
|
| 14635 |
-
[INFO|2025-10-
|
| 14636 |
|
| 14637 |
-
[INFO|2025-10-
|
| 14638 |
|
| 14639 |
-
[INFO|2025-10-
|
| 14640 |
|
| 14641 |
-
[INFO|2025-10-
|
| 14642 |
|
| 14643 |
-
[INFO|2025-10-
|
| 14644 |
|
| 14645 |
-
[INFO|2025-10-
|
| 14646 |
|
| 14647 |
-
[INFO|2025-10-
|
| 14648 |
|
| 14649 |
-
[INFO|2025-10-
|
| 14650 |
|
| 14651 |
-
[INFO|2025-10-
|
| 14652 |
|
| 14653 |
-
[INFO|2025-10-
|
| 14654 |
|
| 14655 |
-
[INFO|2025-10-
|
| 14656 |
|
| 14657 |
-
[INFO|2025-10-
|
| 14658 |
|
| 14659 |
-
[INFO|2025-10-
|
| 14660 |
|
| 14661 |
-
[INFO|2025-10-
|
| 14662 |
|
| 14663 |
-
[INFO|2025-10-
|
| 14664 |
|
| 14665 |
-
[WARNING|2025-10-
|
| 14666 |
|
| 14667 |
-
[INFO|2025-10-
|
| 14668 |
|
| 14669 |
-
[INFO|2025-10-
|
| 14670 |
|
| 14671 |
-
[INFO|2025-10-
|
| 14672 |
|
| 14673 |
-
[INFO|2025-10-
|
| 14674 |
|
| 14675 |
-
[INFO|2025-10-
|
| 14676 |
|
| 14677 |
-
[INFO|2025-10-
|
| 14678 |
|
| 14679 |
-
[INFO|2025-10-
|
| 14680 |
|
| 14681 |
-
[INFO|2025-10-
|
| 14682 |
|
| 14683 |
-
[INFO|2025-10-
|
| 14684 |
|
| 14685 |
-
[INFO|2025-10-
|
| 14686 |
|
| 14687 |
-
[INFO|2025-10-
|
| 14688 |
|
| 14689 |
-
[INFO|2025-10-
|
| 14690 |
|
| 14691 |
-
[INFO|2025-10-
|
| 14692 |
|
| 14693 |
-
[INFO|2025-10-
|
| 14694 |
|
| 14695 |
-
[INFO|2025-10-
|
| 14696 |
|
| 14697 |
-
[INFO|2025-10-
|
| 14698 |
|
| 14699 |
-
[INFO|2025-10-
|
| 14700 |
|
| 14701 |
-
[INFO|2025-10-
|
| 14702 |
|
| 14703 |
-
[INFO|2025-10-
|
| 14704 |
|
| 14705 |
-
[INFO|2025-10-
|
| 14706 |
|
| 14707 |
-
[INFO|2025-10-
|
| 14708 |
|
| 14709 |
-
[INFO|2025-10-
|
| 14710 |
|
| 14711 |
-
[INFO|2025-10-
|
| 14712 |
|
| 14713 |
-
[INFO|2025-10-
|
| 14714 |
|
| 14715 |
-
[INFO|2025-10-
|
| 14716 |
|
| 14717 |
-
[INFO|2025-10-
|
| 14718 |
|
| 14719 |
-
[INFO|2025-10-
|
| 14720 |
|
| 14721 |
-
[INFO|2025-10-
|
| 14722 |
|
| 14723 |
-
[INFO|2025-10-
|
| 14724 |
|
| 14725 |
-
[INFO|2025-10-
|
| 14726 |
|
| 14727 |
-
[INFO|2025-10-
|
| 14728 |
|
| 14729 |
-
[INFO|2025-10-
|
| 14730 |
|
| 14731 |
-
[INFO|2025-10-
|
| 14732 |
|
| 14733 |
-
[INFO|2025-10-
|
| 14734 |
|
| 14735 |
-
[INFO|2025-10-
|
| 14736 |
|
| 14737 |
-
[INFO|2025-10-
|
| 14738 |
|
| 14739 |
-
[INFO|2025-10-
|
| 14740 |
|
| 14741 |
-
[INFO|2025-10-
|
| 14742 |
|
| 14743 |
-
[INFO|2025-10-
|
| 14744 |
|
| 14745 |
-
[INFO|2025-10-
|
| 14746 |
|
| 14747 |
-
[INFO|2025-10-
|
| 14748 |
|
| 14749 |
-
[INFO|2025-10-
|
| 14750 |
|
| 14751 |
-
[INFO|2025-10-
|
| 14752 |
|
| 14753 |
-
[INFO|2025-10-
|
| 14754 |
|
| 14755 |
-
[INFO|2025-10-
|
| 14756 |
|
| 14757 |
-
[INFO|2025-10-
|
| 14758 |
|
| 14759 |
-
[INFO|2025-10-
|
| 14760 |
|
| 14761 |
-
[INFO|2025-10-
|
| 14762 |
|
| 14763 |
-
[INFO|2025-10-
|
| 14764 |
|
| 14765 |
-
[INFO|2025-10-
|
| 14766 |
|
| 14767 |
-
[INFO|2025-10-
|
| 14768 |
|
| 14769 |
-
[INFO|2025-10-
|
| 14770 |
|
| 14771 |
-
[INFO|2025-10-
|
| 14772 |
|
| 14773 |
-
[INFO|2025-10-
|
| 14774 |
|
| 14775 |
-
[INFO|2025-10-
|
| 14776 |
|
| 14777 |
-
[INFO|2025-10-
|
| 14778 |
|
| 14779 |
-
[INFO|2025-10-
|
| 14780 |
|
| 14781 |
-
[INFO|2025-10-
|
| 14782 |
|
| 14783 |
-
[INFO|2025-10-
|
| 14784 |
|
| 14785 |
-
[INFO|2025-10-
|
| 14786 |
|
| 14787 |
-
[INFO|2025-10-
|
| 14788 |
|
| 14789 |
-
[INFO|2025-10-
|
| 14790 |
|
| 14791 |
-
[INFO|2025-10-
|
| 14792 |
|
| 14793 |
-
[INFO|2025-10-
|
| 14794 |
|
| 14795 |
-
[INFO|2025-10-
|
| 14796 |
|
| 14797 |
-
[INFO|2025-10-
|
| 14798 |
|
| 14799 |
-
[INFO|2025-10-
|
| 14800 |
|
| 14801 |
-
[INFO|2025-10-
|
| 14802 |
|
| 14803 |
-
[INFO|2025-10-
|
| 14804 |
|
| 14805 |
-
[INFO|2025-10-
|
| 14806 |
|
| 14807 |
-
[INFO|2025-10-
|
| 14808 |
|
| 14809 |
-
[INFO|2025-10-
|
| 14810 |
|
| 14811 |
-
[INFO|2025-10-
|
| 14812 |
|
| 14813 |
-
[INFO|2025-10-
|
| 14814 |
|
| 14815 |
-
[INFO|2025-10-
|
| 14816 |
|
| 14817 |
-
[INFO|2025-10-
|
| 14818 |
|
| 14819 |
-
[INFO|2025-10-
|
| 14820 |
|
| 14821 |
-
[INFO|2025-10-
|
| 14822 |
|
| 14823 |
-
[INFO|2025-10-
|
| 14824 |
|
| 14825 |
-
[INFO|2025-10-
|
| 14826 |
|
| 14827 |
-
[INFO|2025-10-
|
| 14828 |
|
| 14829 |
-
[INFO|2025-10-
|
| 14830 |
|
| 14831 |
-
[INFO|2025-10-
|
| 14832 |
|
| 14833 |
-
[INFO|2025-10-
|
| 14834 |
|
| 14835 |
-
[INFO|2025-10-
|
| 14836 |
|
| 14837 |
-
[INFO|2025-10-
|
| 14838 |
|
| 14839 |
-
[INFO|2025-10-
|
| 14840 |
|
| 14841 |
-
[INFO|2025-10-
|
| 14842 |
|
| 14843 |
-
[INFO|2025-10-
|
| 14844 |
|
| 14845 |
-
[INFO|2025-10-
|
| 14846 |
|
| 14847 |
-
[INFO|2025-10-
|
| 14848 |
|
| 14849 |
-
[INFO|2025-10-
|
| 14850 |
|
| 14851 |
-
[INFO|2025-10-
|
| 14852 |
|
| 14853 |
-
[INFO|2025-10-
|
| 14854 |
|
| 14855 |
-
[INFO|2025-10-
|
| 14856 |
|
| 14857 |
-
[INFO|2025-10-
|
| 14858 |
|
| 14859 |
-
[INFO|2025-10-
|
| 14860 |
|
| 14861 |
-
[INFO|2025-10-
|
| 14862 |
|
| 14863 |
-
[INFO|2025-10-
|
| 14864 |
|
| 14865 |
-
[INFO|2025-10-
|
| 14866 |
|
| 14867 |
-
[INFO|2025-10-
|
| 14868 |
|
| 14869 |
-
[INFO|2025-10-
|
| 14870 |
|
| 14871 |
-
[INFO|2025-10-
|
| 14872 |
|
| 14873 |
-
[INFO|2025-10-
|
| 14874 |
|
| 14875 |
-
[INFO|2025-10-
|
| 14876 |
|
| 14877 |
-
[INFO|2025-10-
|
| 14878 |
|
| 14879 |
-
[INFO|2025-10-
|
| 14880 |
|
| 14881 |
-
[INFO|2025-10-
|
| 14882 |
|
| 14883 |
-
[INFO|2025-10-
|
| 14884 |
|
| 14885 |
-
[INFO|2025-10-
|
| 14886 |
|
| 14887 |
-
[INFO|2025-10-
|
| 14888 |
|
| 14889 |
-
[INFO|2025-10-
|
| 14890 |
|
| 14891 |
-
[INFO|2025-10-
|
| 14892 |
|
| 14893 |
-
[INFO|2025-10-
|
| 14894 |
|
| 14895 |
-
[INFO|2025-10-
|
| 14896 |
|
| 14897 |
-
[INFO|2025-10-
|
| 14898 |
|
| 14899 |
-
[INFO|2025-10-
|
| 14900 |
|
| 14901 |
-
[INFO|2025-10-
|
| 14902 |
|
| 14903 |
-
[INFO|2025-10-
|
| 14904 |
|
| 14905 |
-
[INFO|2025-10-
|
| 14906 |
|
| 14907 |
-
[INFO|2025-10-
|
| 14908 |
|
| 14909 |
-
[INFO|2025-10-
|
| 14910 |
|
| 14911 |
-
[INFO|2025-10-
|
| 14912 |
|
| 14913 |
-
[INFO|2025-10-
|
| 14914 |
|
| 14915 |
-
[INFO|2025-10-
|
| 14916 |
|
| 14917 |
-
[INFO|2025-10-
|
| 14918 |
|
| 14919 |
-
[INFO|2025-10-
|
| 14920 |
|
| 14921 |
-
[INFO|2025-10-
|
| 14922 |
|
| 14923 |
-
[INFO|2025-10-
|
| 14924 |
|
| 14925 |
-
[INFO|2025-10-
|
| 14926 |
|
| 14927 |
-
[INFO|2025-10-
|
| 14928 |
|
| 14929 |
-
[INFO|2025-10-
|
| 14930 |
|
| 14931 |
-
[INFO|2025-10-
|
| 14932 |
|
| 14933 |
-
[INFO|2025-10-
|
| 14934 |
|
| 14935 |
-
[INFO|2025-10-
|
| 14936 |
|
| 14937 |
-
[INFO|2025-10-
|
| 14938 |
|
| 14939 |
-
[INFO|2025-10-
|
| 14940 |
|
| 14941 |
-
[INFO|2025-10-
|
| 14942 |
|
| 14943 |
-
[INFO|2025-10-
|
| 14944 |
|
| 14945 |
-
[INFO|2025-10-
|
| 14946 |
|
| 14947 |
-
[INFO|2025-10-
|
| 14948 |
|
| 14949 |
-
[INFO|2025-10-
|
| 14950 |
|
| 14951 |
-
[INFO|2025-10-
|
| 14952 |
|
| 14953 |
-
[INFO|2025-10-
|
| 14954 |
|
| 14955 |
-
[INFO|2025-10-
|
| 14956 |
|
| 14957 |
-
[INFO|2025-10-
|
| 14958 |
|
| 14959 |
-
[INFO|2025-10-
|
| 14960 |
|
| 14961 |
-
[INFO|2025-10-
|
| 14962 |
|
| 14963 |
Training completed. Do not forget to share your model on huggingface.co/models =)
|
| 14964 |
|
| 14965 |
|
| 14966 |
|
| 14967 |
-
[INFO|2025-10-
|
| 14968 |
|
| 14969 |
-
[INFO|2025-10-
|
| 14970 |
|
| 14971 |
-
[INFO|2025-10-
|
| 14972 |
|
| 14973 |
-
[INFO|2025-10-
|
| 14974 |
|
| 14975 |
-
[WARNING|2025-10-
|
| 14976 |
|
| 14977 |
-
[WARNING|2025-10-
|
| 14978 |
|
| 14979 |
-
[INFO|2025-10-
|
| 14980 |
{'task': {'name': 'Causal Language Modeling', 'type': 'text-generation'}}
|
| 14981 |
|
|
|
|
| 1 |
+
[INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.model
|
| 2 |
|
| 3 |
+
[INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.json
|
| 4 |
|
| 5 |
+
[INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/added_tokens.json
|
| 6 |
|
| 7 |
+
[INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/special_tokens_map.json
|
| 8 |
|
| 9 |
+
[INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer_config.json
|
| 10 |
|
| 11 |
+
[INFO|2025-10-27 03:13:19] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None
|
| 12 |
|
| 13 |
+
[INFO|2025-10-27 03:13:22] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/processor_config.json
|
| 14 |
|
| 15 |
+
[INFO|2025-10-27 03:13:22] image_processing_base.py:380 >> loading configuration file preprocessor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/preprocessor_config.json
|
| 16 |
|
| 17 |
+
[INFO|2025-10-27 03:13:22] image_processing_base.py:433 >> Image processor Gemma3ImageProcessorFast {
|
| 18 |
"crop_size": null,
|
| 19 |
"data_format": "channels_first",
|
| 20 |
"default_to_square": true,
|
|
|
|
| 52 |
}
|
| 53 |
|
| 54 |
|
| 55 |
+
[INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.model
|
| 56 |
|
| 57 |
+
[INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer.json
|
| 58 |
|
| 59 |
+
[INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/added_tokens.json
|
| 60 |
|
| 61 |
+
[INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/special_tokens_map.json
|
| 62 |
|
| 63 |
+
[INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/tokenizer_config.json
|
| 64 |
|
| 65 |
+
[INFO|2025-10-27 03:13:22] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None
|
| 66 |
|
| 67 |
+
[INFO|2025-10-27 03:13:25] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/processor_config.json
|
| 68 |
|
| 69 |
+
[INFO|2025-10-27 03:13:27] processing_utils.py:990 >> Processor Gemma3Processor:
|
| 70 |
- image_processor: Gemma3ImageProcessorFast {
|
| 71 |
"crop_size": null,
|
| 72 |
"data_format": "channels_first",
|
|
|
|
| 7025 |
}
|
| 7026 |
|
| 7027 |
|
| 7028 |
+
[INFO|2025-10-27 03:13:27] logging.py:143 >> Replace eos token: <end_of_turn>.
|
| 7029 |
|
| 7030 |
+
[INFO|2025-10-27 03:13:27] logging.py:143 >> Loading dataset treino_pt_rde3.json...
|
| 7031 |
|
| 7032 |
+
[INFO|2025-10-27 03:13:41] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--google--gemma-3-12b-it/snapshots/96b6f1eccf38110c56df3a15bffe176da04bfd80/config.json
|
| 7033 |
|
| 7034 |
+
[INFO|2025-10-27 03:13:41] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
|
| 7035 |
|
| 7036 |
+
[INFO|2025-10-27 03:13:41] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
|
| 7037 |
+
|
| 7038 |
+
[INFO|2025-10-27 03:13:41] configuration_utils.py:770 >> Model config Gemma3Config {
|
| 7039 |
"architectures": [
|
| 7040 |
"Gemma3ForConditionalGeneration"
|
| 7041 |
],
|
|
|
|
| 7097 |
}
|
| 7098 |
|
| 7099 |
|
| 7100 |
+
[INFO|2025-10-27 03:13:41] logging.py:143 >> Quantizing model to 4 bit with bitsandbytes.
|
| 7101 |
|
| 7102 |
+
[INFO|2025-10-27 03:13:41] logging.py:143 >> KV cache is disabled during training.
|
| 7103 |
|
| 7104 |
+
[INFO|2025-10-27 03:13:48] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
|
| 7105 |
|
| 7106 |
+
[INFO|2025-10-27 03:13:48] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
|
| 7107 |
|
| 7108 |
+
[INFO|2025-10-27 03:13:48] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
|
| 7109 |
|
| 7110 |
+
[INFO|2025-10-27 03:13:48] configuration_utils.py:770 >> Model config Gemma3Config {
|
| 7111 |
"architectures": [
|
| 7112 |
"Gemma3ForConditionalGeneration"
|
| 7113 |
],
|
|
|
|
| 7266 |
}
|
| 7267 |
|
| 7268 |
|
| 7269 |
+
[INFO|2025-10-27 03:13:49] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
|
| 7270 |
|
| 7271 |
+
[INFO|2025-10-27 03:13:49] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
|
| 7272 |
|
| 7273 |
+
[INFO|2025-10-27 03:13:49] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
|
| 7274 |
|
| 7275 |
+
[INFO|2025-10-27 03:13:49] configuration_utils.py:770 >> Model config Gemma3Config {
|
| 7276 |
"architectures": [
|
| 7277 |
"Gemma3ForConditionalGeneration"
|
| 7278 |
],
|
|
|
|
| 7431 |
}
|
| 7432 |
|
| 7433 |
|
| 7434 |
+
[INFO|2025-10-27 03:13:52] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/config.json
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 7435 |
|
| 7436 |
+
[INFO|2025-10-27 03:13:52] configuration_gemma3.py:311 >> text_config is None, using default Gemma3TextConfig text config.
|
| 7437 |
|
| 7438 |
+
[INFO|2025-10-27 03:13:52] configuration_gemma3.py:319 >> vision_config is None, using default SiglipVisionConfig vision config.
|
| 7439 |
|
| 7440 |
+
[INFO|2025-10-27 03:13:52] configuration_utils.py:770 >> Model config Gemma3Config {
|
| 7441 |
"architectures": [
|
| 7442 |
"Gemma3ForConditionalGeneration"
|
| 7443 |
],
|
|
|
|
| 7596 |
}
|
| 7597 |
|
| 7598 |
|
| 7599 |
+
[INFO|2025-10-27 03:13:52] modeling_utils.py:1151 >> loading weights file model.safetensors from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/model.safetensors.index.json
|
| 7600 |
|
| 7601 |
+
[INFO|2025-10-27 03:14:56] modeling_utils.py:2241 >> Instantiating Gemma3ForConditionalGeneration model under default dtype torch.bfloat16.
|
| 7602 |
|
| 7603 |
+
[INFO|2025-10-27 03:14:56] configuration_utils.py:1135 >> Generate config GenerationConfig {
|
| 7604 |
"bos_token_id": 2,
|
| 7605 |
"eos_token_id": 106,
|
| 7606 |
"pad_token_id": 0
|
| 7607 |
}
|
| 7608 |
|
| 7609 |
|
| 7610 |
+
[INFO|2025-10-27 03:14:58] modeling_utils.py:2241 >> Instantiating SiglipVisionModel model under default dtype torch.bfloat16.
|
| 7611 |
|
| 7612 |
+
[INFO|2025-10-27 03:14:58] modeling_utils.py:2241 >> Instantiating Gemma3TextModel model under default dtype torch.bfloat16.
|
| 7613 |
|
| 7614 |
+
[INFO|2025-10-27 03:15:02] modeling_utils.py:5131 >> All model checkpoint weights were used when initializing Gemma3ForConditionalGeneration.
|
| 7615 |
|
| 7616 |
|
| 7617 |
+
[INFO|2025-10-27 03:15:02] modeling_utils.py:5139 >> All the weights of Gemma3ForConditionalGeneration were initialized from the model checkpoint at unsloth/gemma-3-12b-it-unsloth-bnb-4bit.
|
| 7618 |
If your task is similar to the task the model of the checkpoint was trained on, you can already use Gemma3ForConditionalGeneration for predictions without further training.
|
| 7619 |
|
| 7620 |
+
[INFO|2025-10-27 03:15:03] configuration_utils.py:1090 >> loading configuration file generation_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/generation_config.json
|
| 7621 |
|
| 7622 |
+
[INFO|2025-10-27 03:15:03] configuration_utils.py:1135 >> Generate config GenerationConfig {
|
| 7623 |
"bos_token_id": 2,
|
| 7624 |
"cache_implementation": "hybrid",
|
| 7625 |
"do_sample": true,
|
|
|
|
| 7633 |
}
|
| 7634 |
|
| 7635 |
|
| 7636 |
+
[INFO|2025-10-27 03:15:05] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/processor_config.json
|
| 7637 |
|
| 7638 |
+
[INFO|2025-10-27 03:15:06] image_processing_base.py:380 >> loading configuration file preprocessor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/preprocessor_config.json
|
| 7639 |
|
| 7640 |
+
[INFO|2025-10-27 03:15:06] image_processing_base.py:433 >> Image processor Gemma3ImageProcessor {
|
| 7641 |
"do_convert_rgb": null,
|
| 7642 |
"do_normalize": true,
|
| 7643 |
"do_pan_and_scan": null,
|
|
|
|
| 7668 |
}
|
| 7669 |
|
| 7670 |
|
| 7671 |
+
[INFO|2025-10-27 03:15:11] processing_utils.py:930 >> loading configuration file processor_config.json from cache at /root/.cache/huggingface/hub/models--unsloth--gemma-3-12b-it-unsloth-bnb-4bit/snapshots/ae99a6b1e5587dce5f26e651ab40eca8cc997362/processor_config.json
|
| 7672 |
|
| 7673 |
+
[INFO|2025-10-27 03:15:13] processing_utils.py:990 >> Processor Gemma3Processor:
|
| 7674 |
- image_processor: Gemma3ImageProcessor {
|
| 7675 |
"do_convert_rgb": null,
|
| 7676 |
"do_normalize": true,
|
|
|
|
| 14622 |
}
|
| 14623 |
|
| 14624 |
|
| 14625 |
+
[INFO|2025-10-27 03:15:16] logging.py:143 >> Gradient checkpointing enabled.
|
| 14626 |
|
| 14627 |
+
[INFO|2025-10-27 03:15:16] logging.py:143 >> Casting multimodal projector outputs in torch.bfloat16.
|
| 14628 |
|
| 14629 |
+
[INFO|2025-10-27 03:15:16] logging.py:143 >> Upcasting trainable params to float32.
|
| 14630 |
|
| 14631 |
+
[INFO|2025-10-27 03:15:16] logging.py:143 >> Fine-tuning method: LoRA
|
| 14632 |
|
| 14633 |
+
[INFO|2025-10-27 03:15:16] logging.py:143 >> Found linear modules: down_proj,gate_proj,up_proj,k_proj,v_proj,q_proj,o_proj
|
| 14634 |
|
| 14635 |
+
[INFO|2025-10-27 03:15:16] logging.py:143 >> Set vision model not trainable: ['vision_tower'].
|
| 14636 |
|
| 14637 |
+
[INFO|2025-10-27 03:15:16] logging.py:143 >> Set multi model projector not trainable: multi_modal_projector.
|
| 14638 |
|
| 14639 |
+
[INFO|2025-10-27 03:15:21] logging.py:143 >> trainable params: 32,735,232 || all params: 12,220,060,272 || trainable%: 0.2679
|
| 14640 |
|
| 14641 |
+
[INFO|2025-10-27 03:15:21] trainer.py:756 >> Using auto half precision backend
|
| 14642 |
|
| 14643 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2409 >> ***** Running training *****
|
| 14644 |
|
| 14645 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2410 >> Num examples = 3,716
|
| 14646 |
|
| 14647 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2411 >> Num Epochs = 3
|
| 14648 |
|
| 14649 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2412 >> Instantaneous batch size per device = 4
|
| 14650 |
|
| 14651 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2415 >> Total train batch size (w. parallel, distributed & accumulation) = 8
|
| 14652 |
|
| 14653 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2416 >> Gradient Accumulation steps = 2
|
| 14654 |
|
| 14655 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2417 >> Total optimization steps = 1,395
|
| 14656 |
|
| 14657 |
+
[INFO|2025-10-27 03:15:22] trainer.py:2418 >> Number of trainable parameters = 32,735,232
|
| 14658 |
|
| 14659 |
+
[WARNING|2025-10-27 03:15:27] logging.py:328 >> `use_cache=True` is incompatible with gradient checkpointing. Setting `use_cache=False`.
|
| 14660 |
|
| 14661 |
+
[INFO|2025-10-27 03:16:26] logging.py:143 >> {'loss': 1.7834, 'learning_rate': 9.9990e-06, 'epoch': 0.02, 'throughput': 677.99}
|
| 14662 |
|
| 14663 |
+
[INFO|2025-10-27 03:16:57] logging.py:143 >> {'loss': 0.7676, 'learning_rate': 9.9954e-06, 'epoch': 0.04, 'throughput': 914.74}
|
| 14664 |
|
| 14665 |
+
[INFO|2025-10-27 03:17:28] logging.py:143 >> {'loss': 0.5817, 'learning_rate': 9.9893e-06, 'epoch': 0.06, 'throughput': 1039.71}
|
| 14666 |
|
| 14667 |
+
[INFO|2025-10-27 03:17:59] logging.py:143 >> {'loss': 0.3531, 'learning_rate': 9.9807e-06, 'epoch': 0.09, 'throughput': 1114.29}
|
| 14668 |
|
| 14669 |
+
[INFO|2025-10-27 03:18:30] logging.py:143 >> {'loss': 0.3352, 'learning_rate': 9.9696e-06, 'epoch': 0.11, 'throughput': 1163.66}
|
| 14670 |
|
| 14671 |
+
[INFO|2025-10-27 03:19:01] logging.py:143 >> {'loss': 0.2298, 'learning_rate': 9.9559e-06, 'epoch': 0.13, 'throughput': 1198.88}
|
| 14672 |
|
| 14673 |
+
[INFO|2025-10-27 03:19:32] logging.py:143 >> {'loss': 0.1981, 'learning_rate': 9.9398e-06, 'epoch': 0.15, 'throughput': 1224.72}
|
| 14674 |
|
| 14675 |
+
[INFO|2025-10-27 03:20:03] logging.py:143 >> {'loss': 0.1755, 'learning_rate': 9.9211e-06, 'epoch': 0.17, 'throughput': 1243.90}
|
| 14676 |
|
| 14677 |
+
[INFO|2025-10-27 03:20:34] logging.py:143 >> {'loss': 0.1791, 'learning_rate': 9.8999e-06, 'epoch': 0.19, 'throughput': 1260.94}
|
| 14678 |
|
| 14679 |
+
[INFO|2025-10-27 03:21:05] logging.py:143 >> {'loss': 0.2051, 'learning_rate': 9.8762e-06, 'epoch': 0.22, 'throughput': 1275.56}
|
| 14680 |
|
| 14681 |
+
[INFO|2025-10-27 03:21:36] logging.py:143 >> {'loss': 0.1912, 'learning_rate': 9.8501e-06, 'epoch': 0.24, 'throughput': 1286.52}
|
| 14682 |
|
| 14683 |
+
[INFO|2025-10-27 03:22:07] logging.py:143 >> {'loss': 0.1637, 'learning_rate': 9.8215e-06, 'epoch': 0.26, 'throughput': 1296.09}
|
| 14684 |
|
| 14685 |
+
[INFO|2025-10-27 03:22:38] logging.py:143 >> {'loss': 0.1537, 'learning_rate': 9.7905e-06, 'epoch': 0.28, 'throughput': 1305.22}
|
| 14686 |
|
| 14687 |
+
[INFO|2025-10-27 03:23:09] logging.py:143 >> {'loss': 0.1846, 'learning_rate': 9.7570e-06, 'epoch': 0.30, 'throughput': 1312.61}
|
| 14688 |
|
| 14689 |
+
[INFO|2025-10-27 03:23:40] logging.py:143 >> {'loss': 0.1872, 'learning_rate': 9.7211e-06, 'epoch': 0.32, 'throughput': 1319.26}
|
| 14690 |
|
| 14691 |
+
[INFO|2025-10-27 03:24:11] logging.py:143 >> {'loss': 0.1372, 'learning_rate': 9.6829e-06, 'epoch': 0.34, 'throughput': 1324.79}
|
| 14692 |
|
| 14693 |
+
[INFO|2025-10-27 03:24:42] logging.py:143 >> {'loss': 0.2028, 'learning_rate': 9.6422e-06, 'epoch': 0.37, 'throughput': 1329.47}
|
| 14694 |
|
| 14695 |
+
[INFO|2025-10-27 03:25:13] logging.py:143 >> {'loss': 0.1765, 'learning_rate': 9.5992e-06, 'epoch': 0.39, 'throughput': 1334.07}
|
| 14696 |
|
| 14697 |
+
[INFO|2025-10-27 03:25:44] logging.py:143 >> {'loss': 0.1882, 'learning_rate': 9.5539e-06, 'epoch': 0.41, 'throughput': 1337.87}
|
| 14698 |
|
| 14699 |
+
[INFO|2025-10-27 03:26:16] logging.py:143 >> {'loss': 0.1336, 'learning_rate': 9.5062e-06, 'epoch': 0.43, 'throughput': 1341.84}
|
| 14700 |
|
| 14701 |
+
[INFO|2025-10-27 03:26:47] logging.py:143 >> {'loss': 0.1521, 'learning_rate': 9.4563e-06, 'epoch': 0.45, 'throughput': 1345.07}
|
| 14702 |
|
| 14703 |
+
[INFO|2025-10-27 03:27:18] logging.py:143 >> {'loss': 0.1864, 'learning_rate': 9.4041e-06, 'epoch': 0.47, 'throughput': 1346.89}
|
| 14704 |
|
| 14705 |
+
[INFO|2025-10-27 03:27:49] logging.py:143 >> {'loss': 0.1625, 'learning_rate': 9.3497e-06, 'epoch': 0.50, 'throughput': 1349.36}
|
| 14706 |
|
| 14707 |
+
[INFO|2025-10-27 03:28:20] logging.py:143 >> {'loss': 0.1456, 'learning_rate': 9.2931e-06, 'epoch': 0.52, 'throughput': 1351.59}
|
| 14708 |
|
| 14709 |
+
[INFO|2025-10-27 03:28:51] logging.py:143 >> {'loss': 0.1650, 'learning_rate': 9.2343e-06, 'epoch': 0.54, 'throughput': 1354.07}
|
| 14710 |
|
| 14711 |
+
[INFO|2025-10-27 03:29:22] logging.py:143 >> {'loss': 0.1487, 'learning_rate': 9.1733e-06, 'epoch': 0.56, 'throughput': 1356.35}
|
| 14712 |
|
| 14713 |
+
[INFO|2025-10-27 03:29:53] logging.py:143 >> {'loss': 0.1687, 'learning_rate': 9.1102e-06, 'epoch': 0.58, 'throughput': 1358.32}
|
| 14714 |
|
| 14715 |
+
[INFO|2025-10-27 03:30:25] logging.py:143 >> {'loss': 0.1511, 'learning_rate': 9.0451e-06, 'epoch': 0.60, 'throughput': 1360.35}
|
| 14716 |
|
| 14717 |
+
[INFO|2025-10-27 03:30:56] logging.py:143 >> {'loss': 0.1840, 'learning_rate': 8.9779e-06, 'epoch': 0.62, 'throughput': 1361.79}
|
| 14718 |
|
| 14719 |
+
[INFO|2025-10-27 03:31:27] logging.py:143 >> {'loss': 0.1305, 'learning_rate': 8.9087e-06, 'epoch': 0.65, 'throughput': 1363.59}
|
| 14720 |
|
| 14721 |
+
[INFO|2025-10-27 03:31:58] logging.py:143 >> {'loss': 0.1405, 'learning_rate': 8.8375e-06, 'epoch': 0.67, 'throughput': 1365.17}
|
| 14722 |
|
| 14723 |
+
[INFO|2025-10-27 03:32:29] logging.py:143 >> {'loss': 0.1651, 'learning_rate': 8.7643e-06, 'epoch': 0.69, 'throughput': 1366.48}
|
| 14724 |
|
| 14725 |
+
[INFO|2025-10-27 03:33:00] logging.py:143 >> {'loss': 0.1519, 'learning_rate': 8.6892e-06, 'epoch': 0.71, 'throughput': 1367.92}
|
| 14726 |
|
| 14727 |
+
[INFO|2025-10-27 03:33:32] logging.py:143 >> {'loss': 0.1574, 'learning_rate': 8.6123e-06, 'epoch': 0.73, 'throughput': 1369.22}
|
| 14728 |
|
| 14729 |
+
[INFO|2025-10-27 03:34:03] logging.py:143 >> {'loss': 0.1587, 'learning_rate': 8.5335e-06, 'epoch': 0.75, 'throughput': 1370.83}
|
| 14730 |
|
| 14731 |
+
[INFO|2025-10-27 03:34:34] logging.py:143 >> {'loss': 0.1513, 'learning_rate': 8.4530e-06, 'epoch': 0.78, 'throughput': 1371.83}
|
| 14732 |
|
| 14733 |
+
[INFO|2025-10-27 03:35:06] logging.py:143 >> {'loss': 0.1401, 'learning_rate': 8.3707e-06, 'epoch': 0.80, 'throughput': 1372.77}
|
| 14734 |
|
| 14735 |
+
[INFO|2025-10-27 03:35:37] logging.py:143 >> {'loss': 0.1135, 'learning_rate': 8.2867e-06, 'epoch': 0.82, 'throughput': 1373.73}
|
| 14736 |
|
| 14737 |
+
[INFO|2025-10-27 03:36:08] logging.py:143 >> {'loss': 0.1645, 'learning_rate': 8.2010e-06, 'epoch': 0.84, 'throughput': 1374.92}
|
| 14738 |
|
| 14739 |
+
[INFO|2025-10-27 03:36:39] logging.py:143 >> {'loss': 0.1129, 'learning_rate': 8.1137e-06, 'epoch': 0.86, 'throughput': 1375.83}
|
| 14740 |
|
| 14741 |
+
[INFO|2025-10-27 03:37:10] logging.py:143 >> {'loss': 0.1333, 'learning_rate': 8.0248e-06, 'epoch': 0.88, 'throughput': 1376.82}
|
| 14742 |
|
| 14743 |
+
[INFO|2025-10-27 03:37:41] logging.py:143 >> {'loss': 0.1311, 'learning_rate': 7.9344e-06, 'epoch': 0.90, 'throughput': 1377.63}
|
| 14744 |
|
| 14745 |
+
[INFO|2025-10-27 03:38:12] logging.py:143 >> {'loss': 0.1395, 'learning_rate': 7.8425e-06, 'epoch': 0.93, 'throughput': 1378.55}
|
| 14746 |
|
| 14747 |
+
[INFO|2025-10-27 03:38:43] logging.py:143 >> {'loss': 0.1175, 'learning_rate': 7.7491e-06, 'epoch': 0.95, 'throughput': 1379.32}
|
| 14748 |
|
| 14749 |
+
[INFO|2025-10-27 03:39:14] logging.py:143 >> {'loss': 0.1154, 'learning_rate': 7.6544e-06, 'epoch': 0.97, 'throughput': 1379.96}
|
| 14750 |
|
| 14751 |
+
[INFO|2025-10-27 03:39:45] logging.py:143 >> {'loss': 0.1408, 'learning_rate': 7.5583e-06, 'epoch': 0.99, 'throughput': 1380.68}
|
| 14752 |
|
| 14753 |
+
[INFO|2025-10-27 03:40:14] logging.py:143 >> {'loss': 0.1126, 'learning_rate': 7.4609e-06, 'epoch': 1.01, 'throughput': 1381.29}
|
| 14754 |
|
| 14755 |
+
[INFO|2025-10-27 03:40:45] logging.py:143 >> {'loss': 0.1329, 'learning_rate': 7.3623e-06, 'epoch': 1.03, 'throughput': 1382.02}
|
| 14756 |
|
| 14757 |
+
[INFO|2025-10-27 03:41:17] logging.py:143 >> {'loss': 0.1110, 'learning_rate': 7.2624e-06, 'epoch': 1.05, 'throughput': 1382.64}
|
| 14758 |
|
| 14759 |
+
[INFO|2025-10-27 03:41:48] logging.py:143 >> {'loss': 0.1130, 'learning_rate': 7.1614e-06, 'epoch': 1.08, 'throughput': 1383.36}
|
| 14760 |
|
| 14761 |
+
[INFO|2025-10-27 03:42:19] logging.py:143 >> {'loss': 0.1303, 'learning_rate': 7.0594e-06, 'epoch': 1.10, 'throughput': 1384.03}
|
| 14762 |
|
| 14763 |
+
[INFO|2025-10-27 03:42:50] logging.py:143 >> {'loss': 0.1404, 'learning_rate': 6.9562e-06, 'epoch': 1.12, 'throughput': 1384.60}
|
| 14764 |
|
| 14765 |
+
[INFO|2025-10-27 03:43:21] logging.py:143 >> {'loss': 0.0972, 'learning_rate': 6.8521e-06, 'epoch': 1.14, 'throughput': 1385.09}
|
| 14766 |
|
| 14767 |
+
[INFO|2025-10-27 03:43:52] logging.py:143 >> {'loss': 0.1092, 'learning_rate': 6.7471e-06, 'epoch': 1.16, 'throughput': 1385.58}
|
| 14768 |
|
| 14769 |
+
[INFO|2025-10-27 03:44:23] logging.py:143 >> {'loss': 0.1186, 'learning_rate': 6.6411e-06, 'epoch': 1.18, 'throughput': 1386.00}
|
| 14770 |
|
| 14771 |
+
[INFO|2025-10-27 03:44:54] logging.py:143 >> {'loss': 0.1332, 'learning_rate': 6.5344e-06, 'epoch': 1.20, 'throughput': 1386.55}
|
| 14772 |
|
| 14773 |
+
[INFO|2025-10-27 03:45:25] logging.py:143 >> {'loss': 0.1481, 'learning_rate': 6.4268e-06, 'epoch': 1.23, 'throughput': 1386.93}
|
| 14774 |
|
| 14775 |
+
[INFO|2025-10-27 03:45:56] logging.py:143 >> {'loss': 0.1332, 'learning_rate': 6.3186e-06, 'epoch': 1.25, 'throughput': 1387.57}
|
| 14776 |
|
| 14777 |
+
[INFO|2025-10-27 03:46:27] logging.py:143 >> {'loss': 0.0978, 'learning_rate': 6.2096e-06, 'epoch': 1.27, 'throughput': 1387.91}
|
| 14778 |
|
| 14779 |
+
[INFO|2025-10-27 03:46:58] logging.py:143 >> {'loss': 0.1176, 'learning_rate': 6.1001e-06, 'epoch': 1.29, 'throughput': 1388.30}
|
| 14780 |
|
| 14781 |
+
[INFO|2025-10-27 03:47:29] logging.py:143 >> {'loss': 0.1279, 'learning_rate': 5.9899e-06, 'epoch': 1.31, 'throughput': 1388.66}
|
| 14782 |
|
| 14783 |
+
[INFO|2025-10-27 03:48:00] logging.py:143 >> {'loss': 0.1407, 'learning_rate': 5.8793e-06, 'epoch': 1.33, 'throughput': 1388.98}
|
| 14784 |
|
| 14785 |
+
[INFO|2025-10-27 03:48:31] logging.py:143 >> {'loss': 0.1168, 'learning_rate': 5.7683e-06, 'epoch': 1.36, 'throughput': 1389.35}
|
| 14786 |
|
| 14787 |
+
[INFO|2025-10-27 03:49:03] logging.py:143 >> {'loss': 0.1188, 'learning_rate': 5.6568e-06, 'epoch': 1.38, 'throughput': 1389.81}
|
| 14788 |
|
| 14789 |
+
[INFO|2025-10-27 03:49:33] logging.py:143 >> {'loss': 0.1326, 'learning_rate': 5.5450e-06, 'epoch': 1.40, 'throughput': 1390.15}
|
| 14790 |
|
| 14791 |
+
[INFO|2025-10-27 03:50:04] logging.py:143 >> {'loss': 0.1331, 'learning_rate': 5.4330e-06, 'epoch': 1.42, 'throughput': 1390.61}
|
| 14792 |
|
| 14793 |
+
[INFO|2025-10-27 03:50:35] logging.py:143 >> {'loss': 0.1082, 'learning_rate': 5.3207e-06, 'epoch': 1.44, 'throughput': 1390.83}
|
| 14794 |
|
| 14795 |
+
[INFO|2025-10-27 03:51:06] logging.py:143 >> {'loss': 0.1184, 'learning_rate': 5.2083e-06, 'epoch': 1.46, 'throughput': 1391.28}
|
| 14796 |
|
| 14797 |
+
[INFO|2025-10-27 03:51:38] logging.py:143 >> {'loss': 0.0942, 'learning_rate': 5.0957e-06, 'epoch': 1.48, 'throughput': 1391.62}
|
| 14798 |
|
| 14799 |
+
[INFO|2025-10-27 03:52:08] logging.py:143 >> {'loss': 0.1204, 'learning_rate': 4.9831e-06, 'epoch': 1.51, 'throughput': 1391.78}
|
| 14800 |
|
| 14801 |
+
[INFO|2025-10-27 03:52:39] logging.py:143 >> {'loss': 0.1358, 'learning_rate': 4.8705e-06, 'epoch': 1.53, 'throughput': 1391.95}
|
| 14802 |
|
| 14803 |
+
[INFO|2025-10-27 03:53:10] logging.py:143 >> {'loss': 0.1313, 'learning_rate': 4.7580e-06, 'epoch': 1.55, 'throughput': 1392.21}
|
| 14804 |
|
| 14805 |
+
[INFO|2025-10-27 03:53:41] logging.py:143 >> {'loss': 0.0879, 'learning_rate': 4.6456e-06, 'epoch': 1.57, 'throughput': 1392.44}
|
| 14806 |
|
| 14807 |
+
[INFO|2025-10-27 03:54:12] logging.py:143 >> {'loss': 0.0977, 'learning_rate': 4.5334e-06, 'epoch': 1.59, 'throughput': 1392.74}
|
| 14808 |
|
| 14809 |
+
[INFO|2025-10-27 03:54:44] logging.py:143 >> {'loss': 0.1483, 'learning_rate': 4.4214e-06, 'epoch': 1.61, 'throughput': 1393.03}
|
| 14810 |
|
| 14811 |
+
[INFO|2025-10-27 03:55:14] logging.py:143 >> {'loss': 0.1285, 'learning_rate': 4.3097e-06, 'epoch': 1.64, 'throughput': 1393.12}
|
| 14812 |
|
| 14813 |
+
[INFO|2025-10-27 03:55:46] logging.py:143 >> {'loss': 0.1475, 'learning_rate': 4.1984e-06, 'epoch': 1.66, 'throughput': 1393.46}
|
| 14814 |
|
| 14815 |
+
[INFO|2025-10-27 03:56:17] logging.py:143 >> {'loss': 0.0904, 'learning_rate': 4.0874e-06, 'epoch': 1.68, 'throughput': 1393.73}
|
| 14816 |
|
| 14817 |
+
[INFO|2025-10-27 03:56:48] logging.py:143 >> {'loss': 0.1199, 'learning_rate': 3.9770e-06, 'epoch': 1.70, 'throughput': 1393.93}
|
| 14818 |
|
| 14819 |
+
[INFO|2025-10-27 03:57:19] logging.py:143 >> {'loss': 0.1020, 'learning_rate': 3.8670e-06, 'epoch': 1.72, 'throughput': 1394.19}
|
| 14820 |
|
| 14821 |
+
[INFO|2025-10-27 03:57:51] logging.py:143 >> {'loss': 0.1194, 'learning_rate': 3.7576e-06, 'epoch': 1.74, 'throughput': 1394.24}
|
| 14822 |
|
| 14823 |
+
[INFO|2025-10-27 03:58:23] logging.py:143 >> {'loss': 0.1507, 'learning_rate': 3.6489e-06, 'epoch': 1.76, 'throughput': 1394.60}
|
| 14824 |
|
| 14825 |
+
[INFO|2025-10-27 03:58:54] logging.py:143 >> {'loss': 0.1015, 'learning_rate': 3.5408e-06, 'epoch': 1.79, 'throughput': 1394.81}
|
| 14826 |
|
| 14827 |
+
[INFO|2025-10-27 03:59:25] logging.py:143 >> {'loss': 0.1165, 'learning_rate': 3.4335e-06, 'epoch': 1.81, 'throughput': 1395.10}
|
| 14828 |
|
| 14829 |
+
[INFO|2025-10-27 03:59:56] logging.py:143 >> {'loss': 0.0958, 'learning_rate': 3.3270e-06, 'epoch': 1.83, 'throughput': 1395.22}
|
| 14830 |
|
| 14831 |
+
[INFO|2025-10-27 04:00:28] logging.py:143 >> {'loss': 0.1505, 'learning_rate': 3.2213e-06, 'epoch': 1.85, 'throughput': 1395.41}
|
| 14832 |
|
| 14833 |
+
[INFO|2025-10-27 04:00:59] logging.py:143 >> {'loss': 0.1003, 'learning_rate': 3.1165e-06, 'epoch': 1.87, 'throughput': 1395.71}
|
| 14834 |
|
| 14835 |
+
[INFO|2025-10-27 04:01:30] logging.py:143 >> {'loss': 0.1483, 'learning_rate': 3.0127e-06, 'epoch': 1.89, 'throughput': 1395.87}
|
| 14836 |
|
| 14837 |
+
[INFO|2025-10-27 04:02:01] logging.py:143 >> {'loss': 0.1170, 'learning_rate': 2.9099e-06, 'epoch': 1.91, 'throughput': 1396.08}
|
| 14838 |
|
| 14839 |
+
[INFO|2025-10-27 04:02:33] logging.py:143 >> {'loss': 0.1303, 'learning_rate': 2.8081e-06, 'epoch': 1.94, 'throughput': 1396.22}
|
| 14840 |
|
| 14841 |
+
[INFO|2025-10-27 04:03:04] logging.py:143 >> {'loss': 0.0971, 'learning_rate': 2.7075e-06, 'epoch': 1.96, 'throughput': 1396.34}
|
| 14842 |
|
| 14843 |
+
[INFO|2025-10-27 04:03:35] logging.py:143 >> {'loss': 0.1320, 'learning_rate': 2.6080e-06, 'epoch': 1.98, 'throughput': 1396.59}
|
| 14844 |
|
| 14845 |
+
[INFO|2025-10-27 04:04:05] logging.py:143 >> {'loss': 0.0930, 'learning_rate': 2.5098e-06, 'epoch': 2.00, 'throughput': 1396.82}
|
| 14846 |
|
| 14847 |
+
[INFO|2025-10-27 04:04:36] logging.py:143 >> {'loss': 0.1324, 'learning_rate': 2.4128e-06, 'epoch': 2.02, 'throughput': 1396.98}
|
| 14848 |
|
| 14849 |
+
[INFO|2025-10-27 04:05:07] logging.py:143 >> {'loss': 0.0841, 'learning_rate': 2.3171e-06, 'epoch': 2.04, 'throughput': 1397.11}
|
| 14850 |
|
| 14851 |
+
[INFO|2025-10-27 04:05:38] logging.py:143 >> {'loss': 0.1138, 'learning_rate': 2.2227e-06, 'epoch': 2.06, 'throughput': 1397.24}
|
| 14852 |
|
| 14853 |
+
[INFO|2025-10-27 04:06:09] logging.py:143 >> {'loss': 0.0892, 'learning_rate': 2.1298e-06, 'epoch': 2.09, 'throughput': 1397.46}
|
| 14854 |
|
| 14855 |
+
[INFO|2025-10-27 04:06:40] logging.py:143 >> {'loss': 0.1277, 'learning_rate': 2.0383e-06, 'epoch': 2.11, 'throughput': 1397.61}
|
| 14856 |
|
| 14857 |
+
[INFO|2025-10-27 04:07:11] logging.py:143 >> {'loss': 0.0968, 'learning_rate': 1.9484e-06, 'epoch': 2.13, 'throughput': 1397.71}
|
| 14858 |
|
| 14859 |
+
[INFO|2025-10-27 04:07:42] logging.py:143 >> {'loss': 0.1226, 'learning_rate': 1.8600e-06, 'epoch': 2.15, 'throughput': 1397.94}
|
| 14860 |
|
| 14861 |
+
[INFO|2025-10-27 04:07:42] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000
|
| 14862 |
|
| 14863 |
+
[INFO|2025-10-27 04:07:44] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/preprocessor_config.json
|
| 14864 |
|
| 14865 |
+
[INFO|2025-10-27 04:07:47] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/chat_template.jinja
|
| 14866 |
|
| 14867 |
+
[INFO|2025-10-27 04:07:49] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1000/processor_config.json
|
| 14868 |
|
| 14869 |
+
[INFO|2025-10-27 04:08:20] logging.py:143 >> {'loss': 0.1201, 'learning_rate': 1.7731e-06, 'epoch': 2.17, 'throughput': 1395.31}
|
| 14870 |
|
| 14871 |
+
[INFO|2025-10-27 04:08:51] logging.py:143 >> {'loss': 0.0966, 'learning_rate': 1.6880e-06, 'epoch': 2.19, 'throughput': 1395.47}
|
| 14872 |
|
| 14873 |
+
[INFO|2025-10-27 04:09:23] logging.py:143 >> {'loss': 0.1143, 'learning_rate': 1.6044e-06, 'epoch': 2.22, 'throughput': 1395.66}
|
| 14874 |
|
| 14875 |
+
[INFO|2025-10-27 04:09:54] logging.py:143 >> {'loss': 0.1114, 'learning_rate': 1.5227e-06, 'epoch': 2.24, 'throughput': 1395.80}
|
| 14876 |
|
| 14877 |
+
[INFO|2025-10-27 04:10:25] logging.py:143 >> {'loss': 0.0981, 'learning_rate': 1.4426e-06, 'epoch': 2.26, 'throughput': 1395.88}
|
| 14878 |
|
| 14879 |
+
[INFO|2025-10-27 04:10:56] logging.py:143 >> {'loss': 0.1135, 'learning_rate': 1.3644e-06, 'epoch': 2.28, 'throughput': 1396.01}
|
| 14880 |
|
| 14881 |
+
[INFO|2025-10-27 04:11:27] logging.py:143 >> {'loss': 0.1081, 'learning_rate': 1.2880e-06, 'epoch': 2.30, 'throughput': 1396.08}
|
| 14882 |
|
| 14883 |
+
[INFO|2025-10-27 04:11:58] logging.py:143 >> {'loss': 0.0685, 'learning_rate': 1.2136e-06, 'epoch': 2.32, 'throughput': 1396.28}
|
| 14884 |
|
| 14885 |
+
[INFO|2025-10-27 04:12:30] logging.py:143 >> {'loss': 0.0857, 'learning_rate': 1.1410e-06, 'epoch': 2.34, 'throughput': 1396.47}
|
| 14886 |
|
| 14887 |
+
[INFO|2025-10-27 04:13:00] logging.py:143 >> {'loss': 0.1008, 'learning_rate': 1.0704e-06, 'epoch': 2.37, 'throughput': 1396.60}
|
| 14888 |
|
| 14889 |
+
[INFO|2025-10-27 04:13:32] logging.py:143 >> {'loss': 0.1137, 'learning_rate': 1.0017e-06, 'epoch': 2.39, 'throughput': 1396.71}
|
| 14890 |
|
| 14891 |
+
[INFO|2025-10-27 04:14:03] logging.py:143 >> {'loss': 0.1038, 'learning_rate': 9.3515e-07, 'epoch': 2.41, 'throughput': 1396.77}
|
| 14892 |
|
| 14893 |
+
[INFO|2025-10-27 04:14:34] logging.py:143 >> {'loss': 0.1194, 'learning_rate': 8.7062e-07, 'epoch': 2.43, 'throughput': 1396.84}
|
| 14894 |
|
| 14895 |
+
[INFO|2025-10-27 04:15:05] logging.py:143 >> {'loss': 0.1161, 'learning_rate': 8.0818e-07, 'epoch': 2.45, 'throughput': 1396.93}
|
| 14896 |
|
| 14897 |
+
[INFO|2025-10-27 04:15:36] logging.py:143 >> {'loss': 0.1000, 'learning_rate': 7.4787e-07, 'epoch': 2.47, 'throughput': 1397.05}
|
| 14898 |
|
| 14899 |
+
[INFO|2025-10-27 04:16:07] logging.py:143 >> {'loss': 0.0996, 'learning_rate': 6.8971e-07, 'epoch': 2.50, 'throughput': 1397.15}
|
| 14900 |
|
| 14901 |
+
[INFO|2025-10-27 04:16:38] logging.py:143 >> {'loss': 0.0944, 'learning_rate': 6.3374e-07, 'epoch': 2.52, 'throughput': 1397.31}
|
| 14902 |
|
| 14903 |
+
[INFO|2025-10-27 04:17:09] logging.py:143 >> {'loss': 0.0800, 'learning_rate': 5.7999e-07, 'epoch': 2.54, 'throughput': 1397.41}
|
| 14904 |
|
| 14905 |
+
[INFO|2025-10-27 04:17:41] logging.py:143 >> {'loss': 0.0962, 'learning_rate': 5.2847e-07, 'epoch': 2.56, 'throughput': 1397.57}
|
| 14906 |
|
| 14907 |
+
[INFO|2025-10-27 04:18:12] logging.py:143 >> {'loss': 0.0940, 'learning_rate': 4.7923e-07, 'epoch': 2.58, 'throughput': 1397.63}
|
| 14908 |
|
| 14909 |
+
[INFO|2025-10-27 04:18:43] logging.py:143 >> {'loss': 0.1005, 'learning_rate': 4.3227e-07, 'epoch': 2.60, 'throughput': 1397.77}
|
| 14910 |
|
| 14911 |
+
[INFO|2025-10-27 04:19:14] logging.py:143 >> {'loss': 0.1167, 'learning_rate': 3.8764e-07, 'epoch': 2.62, 'throughput': 1397.85}
|
| 14912 |
|
| 14913 |
+
[INFO|2025-10-27 04:19:45] logging.py:143 >> {'loss': 0.0907, 'learning_rate': 3.4534e-07, 'epoch': 2.65, 'throughput': 1397.99}
|
| 14914 |
|
| 14915 |
+
[INFO|2025-10-27 04:20:16] logging.py:143 >> {'loss': 0.1074, 'learning_rate': 3.0540e-07, 'epoch': 2.67, 'throughput': 1398.14}
|
| 14916 |
|
| 14917 |
+
[INFO|2025-10-27 04:20:47] logging.py:143 >> {'loss': 0.1128, 'learning_rate': 2.6784e-07, 'epoch': 2.69, 'throughput': 1398.24}
|
| 14918 |
|
| 14919 |
+
[INFO|2025-10-27 04:21:18] logging.py:143 >> {'loss': 0.1016, 'learning_rate': 2.3269e-07, 'epoch': 2.71, 'throughput': 1398.36}
|
| 14920 |
|
| 14921 |
+
[INFO|2025-10-27 04:21:49] logging.py:143 >> {'loss': 0.1052, 'learning_rate': 1.9995e-07, 'epoch': 2.73, 'throughput': 1398.46}
|
| 14922 |
|
| 14923 |
+
[INFO|2025-10-27 04:22:20] logging.py:143 >> {'loss': 0.0918, 'learning_rate': 1.6964e-07, 'epoch': 2.75, 'throughput': 1398.56}
|
| 14924 |
|
| 14925 |
+
[INFO|2025-10-27 04:22:50] logging.py:143 >> {'loss': 0.1090, 'learning_rate': 1.4179e-07, 'epoch': 2.78, 'throughput': 1398.61}
|
| 14926 |
|
| 14927 |
+
[INFO|2025-10-27 04:23:22] logging.py:143 >> {'loss': 0.1224, 'learning_rate': 1.1640e-07, 'epoch': 2.80, 'throughput': 1398.72}
|
| 14928 |
|
| 14929 |
+
[INFO|2025-10-27 04:23:53] logging.py:143 >> {'loss': 0.0992, 'learning_rate': 9.3482e-08, 'epoch': 2.82, 'throughput': 1398.83}
|
| 14930 |
|
| 14931 |
+
[INFO|2025-10-27 04:24:24] logging.py:143 >> {'loss': 0.1070, 'learning_rate': 7.3056e-08, 'epoch': 2.84, 'throughput': 1398.91}
|
| 14932 |
|
| 14933 |
+
[INFO|2025-10-27 04:24:55] logging.py:143 >> {'loss': 0.0944, 'learning_rate': 5.5129e-08, 'epoch': 2.86, 'throughput': 1398.97}
|
| 14934 |
|
| 14935 |
+
[INFO|2025-10-27 04:25:26] logging.py:143 >> {'loss': 0.0867, 'learning_rate': 3.9709e-08, 'epoch': 2.88, 'throughput': 1399.03}
|
| 14936 |
|
| 14937 |
+
[INFO|2025-10-27 04:25:57] logging.py:143 >> {'loss': 0.1075, 'learning_rate': 2.6805e-08, 'epoch': 2.90, 'throughput': 1399.15}
|
| 14938 |
|
| 14939 |
+
[INFO|2025-10-27 04:26:28] logging.py:143 >> {'loss': 0.1042, 'learning_rate': 1.6423e-08, 'epoch': 2.93, 'throughput': 1399.23}
|
| 14940 |
|
| 14941 |
+
[INFO|2025-10-27 04:26:59] logging.py:143 >> {'loss': 0.0964, 'learning_rate': 8.5687e-09, 'epoch': 2.95, 'throughput': 1399.25}
|
| 14942 |
|
| 14943 |
+
[INFO|2025-10-27 04:27:30] logging.py:143 >> {'loss': 0.0922, 'learning_rate': 3.2455e-09, 'epoch': 2.97, 'throughput': 1399.11}
|
| 14944 |
|
| 14945 |
+
[INFO|2025-10-27 04:28:01] logging.py:143 >> {'loss': 0.1150, 'learning_rate': 4.5644e-10, 'epoch': 2.99, 'throughput': 1399.22}
|
| 14946 |
|
| 14947 |
+
[INFO|2025-10-27 04:28:15] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395
|
| 14948 |
|
| 14949 |
+
[INFO|2025-10-27 04:28:17] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/preprocessor_config.json
|
| 14950 |
|
| 14951 |
+
[INFO|2025-10-27 04:28:20] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/chat_template.jinja
|
| 14952 |
|
| 14953 |
+
[INFO|2025-10-27 04:28:22] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/checkpoint-1395/processor_config.json
|
| 14954 |
|
| 14955 |
+
[INFO|2025-10-27 04:28:22] trainer.py:2676 >>
|
| 14956 |
|
| 14957 |
Training completed. Do not forget to share your model on huggingface.co/models =)
|
| 14958 |
|
| 14959 |
|
| 14960 |
|
| 14961 |
+
[INFO|2025-10-27 04:28:22] image_processing_base.py:260 >> Image processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/preprocessor_config.json
|
| 14962 |
|
| 14963 |
+
[INFO|2025-10-27 04:28:24] processing_utils.py:674 >> chat template saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/chat_template.jinja
|
| 14964 |
|
| 14965 |
+
[INFO|2025-10-27 04:28:26] processing_utils.py:709 >> processor saved in saves/Gemma-3-12B-Instruct/lora/gemma-treinado/processor_config.json
|
| 14966 |
|
| 14967 |
+
[INFO|2025-10-27 04:28:26] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-12B-Instruct/lora/gemma-treinado
|
| 14968 |
|
| 14969 |
+
[WARNING|2025-10-27 04:28:27] logging.py:148 >> No metric eval_loss to plot.
|
| 14970 |
|
| 14971 |
+
[WARNING|2025-10-27 04:28:27] logging.py:148 >> No metric eval_accuracy to plot.
|
| 14972 |
|
| 14973 |
+
[INFO|2025-10-27 04:28:27] modelcard.py:450 >> Dropping the following result as it does not have all the necessary fields:
|
| 14974 |
{'task': {'name': 'Causal Language Modeling', 'type': 'text-generation'}}
|
| 14975 |
|
special_tokens_map.json
CHANGED
|
@@ -9,7 +9,7 @@
|
|
| 9 |
},
|
| 10 |
"eoi_token": "<end_of_image>",
|
| 11 |
"eos_token": {
|
| 12 |
-
"content": "<
|
| 13 |
"lstrip": false,
|
| 14 |
"normalized": false,
|
| 15 |
"rstrip": false,
|
|
|
|
| 9 |
},
|
| 10 |
"eoi_token": "<end_of_image>",
|
| 11 |
"eos_token": {
|
| 12 |
+
"content": "<end_of_turn>",
|
| 13 |
"lstrip": false,
|
| 14 |
"normalized": false,
|
| 15 |
"rstrip": false,
|
tokenizer_config.json
CHANGED
|
@@ -51327,7 +51327,7 @@
|
|
| 51327 |
"bos_token": "<bos>",
|
| 51328 |
"clean_up_tokenization_spaces": false,
|
| 51329 |
"eoi_token": "<end_of_image>",
|
| 51330 |
-
"eos_token": "<
|
| 51331 |
"extra_special_tokens": {
|
| 51332 |
"boi_token": "<start_of_image>",
|
| 51333 |
"eoi_token": "<end_of_image>",
|
|
|
|
| 51327 |
"bos_token": "<bos>",
|
| 51328 |
"clean_up_tokenization_spaces": false,
|
| 51329 |
"eoi_token": "<end_of_image>",
|
| 51330 |
+
"eos_token": "<end_of_turn>",
|
| 51331 |
"extra_special_tokens": {
|
| 51332 |
"boi_token": "<start_of_image>",
|
| 51333 |
"eoi_token": "<end_of_image>",
|
train_results.json
CHANGED
|
@@ -1,9 +1,9 @@
|
|
| 1 |
{
|
| 2 |
"epoch": 3.0,
|
| 3 |
-
"num_input_tokens_seen":
|
| 4 |
-
"total_flos":
|
| 5 |
-
"train_loss": 0.
|
| 6 |
-
"train_runtime":
|
| 7 |
-
"train_samples_per_second":
|
| 8 |
-
"train_steps_per_second": 0.
|
| 9 |
}
|
|
|
|
| 1 |
{
|
| 2 |
"epoch": 3.0,
|
| 3 |
+
"num_input_tokens_seen": 6120032,
|
| 4 |
+
"total_flos": 4.115769119160883e+17,
|
| 5 |
+
"train_loss": 0.1491297289889346,
|
| 6 |
+
"train_runtime": 4379.932,
|
| 7 |
+
"train_samples_per_second": 2.545,
|
| 8 |
+
"train_steps_per_second": 0.318
|
| 9 |
}
|
trainer_log.jsonl
CHANGED
|
@@ -1,140 +1,140 @@
|
|
| 1 |
-
{"current_steps": 10, "total_steps": 1395, "loss":
|
| 2 |
-
{"current_steps": 20, "total_steps": 1395, "loss": 0.
|
| 3 |
-
{"current_steps": 30, "total_steps": 1395, "loss": 0.
|
| 4 |
-
{"current_steps": 40, "total_steps": 1395, "loss": 0.
|
| 5 |
-
{"current_steps": 50, "total_steps": 1395, "loss": 0.
|
| 6 |
-
{"current_steps": 60, "total_steps": 1395, "loss": 0.
|
| 7 |
-
{"current_steps": 70, "total_steps": 1395, "loss": 0.
|
| 8 |
-
{"current_steps": 80, "total_steps": 1395, "loss": 0.
|
| 9 |
-
{"current_steps": 90, "total_steps": 1395, "loss": 0.
|
| 10 |
-
{"current_steps": 100, "total_steps": 1395, "loss": 0.
|
| 11 |
-
{"current_steps": 110, "total_steps": 1395, "loss": 0.
|
| 12 |
-
{"current_steps": 120, "total_steps": 1395, "loss": 0.
|
| 13 |
-
{"current_steps": 130, "total_steps": 1395, "loss": 0.
|
| 14 |
-
{"current_steps": 140, "total_steps": 1395, "loss": 0.
|
| 15 |
-
{"current_steps": 150, "total_steps": 1395, "loss": 0.
|
| 16 |
-
{"current_steps": 160, "total_steps": 1395, "loss": 0.
|
| 17 |
-
{"current_steps": 170, "total_steps": 1395, "loss": 0.
|
| 18 |
-
{"current_steps": 180, "total_steps": 1395, "loss": 0.
|
| 19 |
-
{"current_steps": 190, "total_steps": 1395, "loss": 0.
|
| 20 |
-
{"current_steps": 200, "total_steps": 1395, "loss": 0.
|
| 21 |
-
{"current_steps": 210, "total_steps": 1395, "loss": 0.
|
| 22 |
-
{"current_steps": 220, "total_steps": 1395, "loss": 0.
|
| 23 |
-
{"current_steps": 230, "total_steps": 1395, "loss": 0.
|
| 24 |
-
{"current_steps": 240, "total_steps": 1395, "loss": 0.
|
| 25 |
-
{"current_steps": 250, "total_steps": 1395, "loss": 0.
|
| 26 |
-
{"current_steps": 260, "total_steps": 1395, "loss": 0.
|
| 27 |
-
{"current_steps": 270, "total_steps": 1395, "loss": 0.
|
| 28 |
-
{"current_steps": 280, "total_steps": 1395, "loss": 0.
|
| 29 |
-
{"current_steps": 290, "total_steps": 1395, "loss": 0.
|
| 30 |
-
{"current_steps": 300, "total_steps": 1395, "loss": 0.
|
| 31 |
-
{"current_steps": 310, "total_steps": 1395, "loss": 0.
|
| 32 |
-
{"current_steps": 320, "total_steps": 1395, "loss": 0.
|
| 33 |
-
{"current_steps": 330, "total_steps": 1395, "loss": 0.
|
| 34 |
-
{"current_steps": 340, "total_steps": 1395, "loss": 0.
|
| 35 |
-
{"current_steps": 350, "total_steps": 1395, "loss": 0.
|
| 36 |
-
{"current_steps": 360, "total_steps": 1395, "loss": 0.
|
| 37 |
-
{"current_steps": 370, "total_steps": 1395, "loss": 0.
|
| 38 |
-
{"current_steps": 380, "total_steps": 1395, "loss": 0.
|
| 39 |
-
{"current_steps": 390, "total_steps": 1395, "loss": 0.
|
| 40 |
-
{"current_steps": 400, "total_steps": 1395, "loss": 0.
|
| 41 |
-
{"current_steps": 410, "total_steps": 1395, "loss": 0.
|
| 42 |
-
{"current_steps": 420, "total_steps": 1395, "loss": 0.
|
| 43 |
-
{"current_steps": 430, "total_steps": 1395, "loss": 0.
|
| 44 |
-
{"current_steps": 440, "total_steps": 1395, "loss": 0.
|
| 45 |
-
{"current_steps": 450, "total_steps": 1395, "loss": 0.
|
| 46 |
-
{"current_steps": 460, "total_steps": 1395, "loss": 0.
|
| 47 |
-
{"current_steps": 470, "total_steps": 1395, "loss": 0.
|
| 48 |
-
{"current_steps": 480, "total_steps": 1395, "loss": 0.
|
| 49 |
-
{"current_steps": 490, "total_steps": 1395, "loss": 0.
|
| 50 |
-
{"current_steps": 500, "total_steps": 1395, "loss": 0.
|
| 51 |
-
{"current_steps": 510, "total_steps": 1395, "loss": 0.
|
| 52 |
-
{"current_steps": 520, "total_steps": 1395, "loss": 0.
|
| 53 |
-
{"current_steps": 530, "total_steps": 1395, "loss": 0.
|
| 54 |
-
{"current_steps": 540, "total_steps": 1395, "loss": 0.
|
| 55 |
-
{"current_steps": 550, "total_steps": 1395, "loss": 0.
|
| 56 |
-
{"current_steps": 560, "total_steps": 1395, "loss": 0.
|
| 57 |
-
{"current_steps": 570, "total_steps": 1395, "loss": 0.
|
| 58 |
-
{"current_steps": 580, "total_steps": 1395, "loss": 0.
|
| 59 |
-
{"current_steps": 590, "total_steps": 1395, "loss": 0.
|
| 60 |
-
{"current_steps": 600, "total_steps": 1395, "loss": 0.
|
| 61 |
-
{"current_steps": 610, "total_steps": 1395, "loss": 0.
|
| 62 |
-
{"current_steps": 620, "total_steps": 1395, "loss": 0.
|
| 63 |
-
{"current_steps": 630, "total_steps": 1395, "loss": 0.
|
| 64 |
-
{"current_steps": 640, "total_steps": 1395, "loss": 0.
|
| 65 |
-
{"current_steps": 650, "total_steps": 1395, "loss": 0.
|
| 66 |
-
{"current_steps": 660, "total_steps": 1395, "loss": 0.
|
| 67 |
-
{"current_steps": 670, "total_steps": 1395, "loss": 0.
|
| 68 |
-
{"current_steps": 680, "total_steps": 1395, "loss": 0.
|
| 69 |
-
{"current_steps": 690, "total_steps": 1395, "loss": 0.
|
| 70 |
-
{"current_steps": 700, "total_steps": 1395, "loss": 0.
|
| 71 |
-
{"current_steps": 710, "total_steps": 1395, "loss": 0.
|
| 72 |
-
{"current_steps": 720, "total_steps": 1395, "loss": 0.
|
| 73 |
-
{"current_steps": 730, "total_steps": 1395, "loss": 0.
|
| 74 |
-
{"current_steps": 740, "total_steps": 1395, "loss": 0.
|
| 75 |
-
{"current_steps": 750, "total_steps": 1395, "loss": 0.
|
| 76 |
-
{"current_steps": 760, "total_steps": 1395, "loss": 0.
|
| 77 |
-
{"current_steps": 770, "total_steps": 1395, "loss": 0.
|
| 78 |
-
{"current_steps": 780, "total_steps": 1395, "loss": 0.
|
| 79 |
-
{"current_steps": 790, "total_steps": 1395, "loss": 0.
|
| 80 |
-
{"current_steps": 800, "total_steps": 1395, "loss": 0.
|
| 81 |
-
{"current_steps": 810, "total_steps": 1395, "loss": 0.
|
| 82 |
-
{"current_steps": 820, "total_steps": 1395, "loss": 0.
|
| 83 |
-
{"current_steps": 830, "total_steps": 1395, "loss": 0.
|
| 84 |
-
{"current_steps": 840, "total_steps": 1395, "loss": 0.
|
| 85 |
-
{"current_steps": 850, "total_steps": 1395, "loss": 0.
|
| 86 |
-
{"current_steps": 860, "total_steps": 1395, "loss": 0.
|
| 87 |
-
{"current_steps": 870, "total_steps": 1395, "loss": 0.
|
| 88 |
-
{"current_steps": 880, "total_steps": 1395, "loss": 0.
|
| 89 |
-
{"current_steps": 890, "total_steps": 1395, "loss": 0.
|
| 90 |
-
{"current_steps": 900, "total_steps": 1395, "loss": 0.
|
| 91 |
-
{"current_steps": 910, "total_steps": 1395, "loss": 0.
|
| 92 |
-
{"current_steps": 920, "total_steps": 1395, "loss": 0.
|
| 93 |
-
{"current_steps": 930, "total_steps": 1395, "loss": 0.
|
| 94 |
-
{"current_steps": 940, "total_steps": 1395, "loss": 0.
|
| 95 |
-
{"current_steps": 950, "total_steps": 1395, "loss": 0.
|
| 96 |
-
{"current_steps": 960, "total_steps": 1395, "loss": 0.
|
| 97 |
-
{"current_steps": 970, "total_steps": 1395, "loss": 0.
|
| 98 |
-
{"current_steps": 980, "total_steps": 1395, "loss": 0.
|
| 99 |
-
{"current_steps": 990, "total_steps": 1395, "loss": 0.
|
| 100 |
-
{"current_steps": 1000, "total_steps": 1395, "loss": 0.
|
| 101 |
-
{"current_steps": 1010, "total_steps": 1395, "loss": 0.
|
| 102 |
-
{"current_steps": 1020, "total_steps": 1395, "loss": 0.
|
| 103 |
-
{"current_steps": 1030, "total_steps": 1395, "loss": 0.
|
| 104 |
-
{"current_steps": 1040, "total_steps": 1395, "loss": 0.
|
| 105 |
-
{"current_steps": 1050, "total_steps": 1395, "loss": 0.
|
| 106 |
-
{"current_steps": 1060, "total_steps": 1395, "loss": 0.
|
| 107 |
-
{"current_steps": 1070, "total_steps": 1395, "loss": 0.
|
| 108 |
-
{"current_steps": 1080, "total_steps": 1395, "loss": 0.
|
| 109 |
-
{"current_steps": 1090, "total_steps": 1395, "loss": 0.
|
| 110 |
-
{"current_steps": 1100, "total_steps": 1395, "loss": 0.
|
| 111 |
-
{"current_steps": 1110, "total_steps": 1395, "loss": 0.
|
| 112 |
-
{"current_steps": 1120, "total_steps": 1395, "loss": 0.
|
| 113 |
-
{"current_steps": 1130, "total_steps": 1395, "loss": 0.
|
| 114 |
-
{"current_steps": 1140, "total_steps": 1395, "loss": 0.
|
| 115 |
-
{"current_steps": 1150, "total_steps": 1395, "loss": 0.
|
| 116 |
-
{"current_steps": 1160, "total_steps": 1395, "loss": 0.
|
| 117 |
-
{"current_steps": 1170, "total_steps": 1395, "loss": 0.
|
| 118 |
-
{"current_steps": 1180, "total_steps": 1395, "loss": 0.
|
| 119 |
-
{"current_steps": 1190, "total_steps": 1395, "loss": 0.
|
| 120 |
-
{"current_steps": 1200, "total_steps": 1395, "loss": 0.
|
| 121 |
-
{"current_steps": 1210, "total_steps": 1395, "loss": 0.
|
| 122 |
-
{"current_steps": 1220, "total_steps": 1395, "loss": 0.
|
| 123 |
-
{"current_steps": 1230, "total_steps": 1395, "loss": 0.
|
| 124 |
-
{"current_steps": 1240, "total_steps": 1395, "loss": 0.
|
| 125 |
-
{"current_steps": 1250, "total_steps": 1395, "loss": 0.
|
| 126 |
-
{"current_steps": 1260, "total_steps": 1395, "loss": 0.
|
| 127 |
-
{"current_steps": 1270, "total_steps": 1395, "loss": 0.
|
| 128 |
-
{"current_steps": 1280, "total_steps": 1395, "loss": 0.
|
| 129 |
-
{"current_steps": 1290, "total_steps": 1395, "loss": 0.
|
| 130 |
-
{"current_steps": 1300, "total_steps": 1395, "loss": 0.
|
| 131 |
-
{"current_steps": 1310, "total_steps": 1395, "loss": 0.
|
| 132 |
-
{"current_steps": 1320, "total_steps": 1395, "loss": 0.
|
| 133 |
-
{"current_steps": 1330, "total_steps": 1395, "loss": 0.
|
| 134 |
-
{"current_steps": 1340, "total_steps": 1395, "loss": 0.
|
| 135 |
-
{"current_steps": 1350, "total_steps": 1395, "loss": 0.
|
| 136 |
-
{"current_steps": 1360, "total_steps": 1395, "loss": 0.
|
| 137 |
-
{"current_steps": 1370, "total_steps": 1395, "loss": 0.
|
| 138 |
-
{"current_steps": 1380, "total_steps": 1395, "loss": 0.
|
| 139 |
-
{"current_steps": 1390, "total_steps": 1395, "loss": 0.
|
| 140 |
-
{"current_steps": 1395, "total_steps": 1395, "epoch": 3.0, "percentage": 100.0, "elapsed_time": "
|
|
|
|
| 1 |
+
{"current_steps": 10, "total_steps": 1395, "loss": 1.7834, "lr": 9.998973021172564e-06, "epoch": 0.021528525296017224, "percentage": 0.72, "elapsed_time": "0:01:04", "remaining_time": "2:28:36", "throughput": 677.99, "total_tokens": 43648}
|
| 2 |
+
{"current_steps": 20, "total_steps": 1395, "loss": 0.7676, "lr": 9.995423512524277e-06, "epoch": 0.04305705059203445, "percentage": 1.43, "elapsed_time": "0:01:35", "remaining_time": "1:49:04", "throughput": 914.74, "total_tokens": 87072}
|
| 3 |
+
{"current_steps": 30, "total_steps": 1395, "loss": 0.5817, "lr": 9.98934059499448e-06, "epoch": 0.06458557588805167, "percentage": 2.15, "elapsed_time": "0:02:06", "remaining_time": "1:35:55", "throughput": 1039.71, "total_tokens": 131520}
|
| 4 |
+
{"current_steps": 40, "total_steps": 1395, "loss": 0.3531, "lr": 9.980727353510257e-06, "epoch": 0.0861141011840689, "percentage": 2.87, "elapsed_time": "0:02:37", "remaining_time": "1:29:00", "throughput": 1114.29, "total_tokens": 175680}
|
| 5 |
+
{"current_steps": 50, "total_steps": 1395, "loss": 0.3352, "lr": 9.969588156242282e-06, "epoch": 0.10764262648008611, "percentage": 3.58, "elapsed_time": "0:03:08", "remaining_time": "1:24:36", "throughput": 1163.66, "total_tokens": 219584}
|
| 6 |
+
{"current_steps": 60, "total_steps": 1395, "loss": 0.2298, "lr": 9.95592865238951e-06, "epoch": 0.12917115177610333, "percentage": 4.3, "elapsed_time": "0:03:39", "remaining_time": "1:21:28", "throughput": 1198.88, "total_tokens": 263392}
|
| 7 |
+
{"current_steps": 70, "total_steps": 1395, "loss": 0.1981, "lr": 9.939755769314215e-06, "epoch": 0.15069967707212056, "percentage": 5.02, "elapsed_time": "0:04:10", "remaining_time": "1:19:03", "throughput": 1224.72, "total_tokens": 306912}
|
| 8 |
+
{"current_steps": 80, "total_steps": 1395, "loss": 0.1755, "lr": 9.9210777090288e-06, "epoch": 0.1722282023681378, "percentage": 5.73, "elapsed_time": "0:04:41", "remaining_time": "1:17:02", "throughput": 1243.9, "total_tokens": 349824}
|
| 9 |
+
{"current_steps": 90, "total_steps": 1395, "loss": 0.1791, "lr": 9.899903944036185e-06, "epoch": 0.193756727664155, "percentage": 6.45, "elapsed_time": "0:05:12", "remaining_time": "1:15:26", "throughput": 1260.94, "total_tokens": 393664}
|
| 10 |
+
{"current_steps": 100, "total_steps": 1395, "loss": 0.2051, "lr": 9.87624521252587e-06, "epoch": 0.21528525296017223, "percentage": 7.17, "elapsed_time": "0:05:43", "remaining_time": "1:14:06", "throughput": 1275.56, "total_tokens": 437952}
|
| 11 |
+
{"current_steps": 110, "total_steps": 1395, "loss": 0.1912, "lr": 9.850113512928094e-06, "epoch": 0.23681377825618946, "percentage": 7.89, "elapsed_time": "0:06:14", "remaining_time": "1:12:51", "throughput": 1286.52, "total_tokens": 481472}
|
| 12 |
+
{"current_steps": 120, "total_steps": 1395, "loss": 0.1637, "lr": 9.821522097828884e-06, "epoch": 0.25834230355220666, "percentage": 8.6, "elapsed_time": "0:06:45", "remaining_time": "1:11:47", "throughput": 1296.09, "total_tokens": 525472}
|
| 13 |
+
{"current_steps": 130, "total_steps": 1395, "loss": 0.1537, "lr": 9.790485467249065e-06, "epoch": 0.2798708288482239, "percentage": 9.32, "elapsed_time": "0:07:16", "remaining_time": "1:10:47", "throughput": 1305.22, "total_tokens": 569696}
|
| 14 |
+
{"current_steps": 140, "total_steps": 1395, "loss": 0.1846, "lr": 9.757019361290621e-06, "epoch": 0.3013993541442411, "percentage": 10.04, "elapsed_time": "0:07:47", "remaining_time": "1:09:51", "throughput": 1312.61, "total_tokens": 613760}
|
| 15 |
+
{"current_steps": 150, "total_steps": 1395, "loss": 0.1872, "lr": 9.721140752154182e-06, "epoch": 0.32292787944025836, "percentage": 10.75, "elapsed_time": "0:08:18", "remaining_time": "1:08:58", "throughput": 1319.26, "total_tokens": 657824}
|
| 16 |
+
{"current_steps": 160, "total_steps": 1395, "loss": 0.1372, "lr": 9.682867835531624e-06, "epoch": 0.3444564047362756, "percentage": 11.47, "elapsed_time": "0:08:49", "remaining_time": "1:08:08", "throughput": 1324.79, "total_tokens": 701760}
|
| 17 |
+
{"current_steps": 170, "total_steps": 1395, "loss": 0.2028, "lr": 9.642220021378212e-06, "epoch": 0.36598493003229277, "percentage": 12.19, "elapsed_time": "0:09:20", "remaining_time": "1:07:18", "throughput": 1329.47, "total_tokens": 745184}
|
| 18 |
+
{"current_steps": 180, "total_steps": 1395, "loss": 0.1765, "lr": 9.59921792406891e-06, "epoch": 0.38751345532831, "percentage": 12.9, "elapsed_time": "0:09:51", "remaining_time": "1:06:33", "throughput": 1334.07, "total_tokens": 789216}
|
| 19 |
+
{"current_steps": 190, "total_steps": 1395, "loss": 0.1882, "lr": 9.553883351943882e-06, "epoch": 0.40904198062432723, "percentage": 13.62, "elapsed_time": "0:10:22", "remaining_time": "1:05:48", "throughput": 1337.87, "total_tokens": 832960}
|
| 20 |
+
{"current_steps": 200, "total_steps": 1395, "loss": 0.1336, "lr": 9.506239296248497e-06, "epoch": 0.43057050592034446, "percentage": 14.34, "elapsed_time": "0:10:54", "remaining_time": "1:05:08", "throughput": 1341.84, "total_tokens": 877664}
|
| 21 |
+
{"current_steps": 210, "total_steps": 1395, "loss": 0.1521, "lr": 9.456309919473384e-06, "epoch": 0.4520990312163617, "percentage": 15.05, "elapsed_time": "0:11:25", "remaining_time": "1:04:26", "throughput": 1345.07, "total_tokens": 921536}
|
| 22 |
+
{"current_steps": 220, "total_steps": 1395, "loss": 0.1864, "lr": 9.404120543100553e-06, "epoch": 0.4736275565123789, "percentage": 15.77, "elapsed_time": "0:11:56", "remaining_time": "1:03:47", "throughput": 1346.89, "total_tokens": 965344}
|
| 23 |
+
{"current_steps": 230, "total_steps": 1395, "loss": 0.1625, "lr": 9.34969763476168e-06, "epoch": 0.4951560818083961, "percentage": 16.49, "elapsed_time": "0:12:27", "remaining_time": "1:03:06", "throughput": 1349.36, "total_tokens": 1008672}
|
| 24 |
+
{"current_steps": 240, "total_steps": 1395, "loss": 0.1456, "lr": 9.293068794815175e-06, "epoch": 0.5166846071044133, "percentage": 17.2, "elapsed_time": "0:12:58", "remaining_time": "1:02:25", "throughput": 1351.59, "total_tokens": 1051936}
|
| 25 |
+
{"current_steps": 250, "total_steps": 1395, "loss": 0.165, "lr": 9.234262742348764e-06, "epoch": 0.5382131324004306, "percentage": 17.92, "elapsed_time": "0:13:29", "remaining_time": "1:01:46", "throughput": 1354.07, "total_tokens": 1095904}
|
| 26 |
+
{"current_steps": 260, "total_steps": 1395, "loss": 0.1487, "lr": 9.17330930061471e-06, "epoch": 0.5597416576964478, "percentage": 18.64, "elapsed_time": "0:14:00", "remaining_time": "1:01:09", "throughput": 1356.35, "total_tokens": 1140064}
|
| 27 |
+
{"current_steps": 270, "total_steps": 1395, "loss": 0.1687, "lr": 9.11023938190509e-06, "epoch": 0.581270182992465, "percentage": 19.35, "elapsed_time": "0:14:31", "remaining_time": "1:00:31", "throughput": 1358.32, "total_tokens": 1183872}
|
| 28 |
+
{"current_steps": 280, "total_steps": 1395, "loss": 0.1511, "lr": 9.045084971874738e-06, "epoch": 0.6027987082884823, "percentage": 20.07, "elapsed_time": "0:15:03", "remaining_time": "0:59:56", "throughput": 1360.35, "total_tokens": 1228544}
|
| 29 |
+
{"current_steps": 290, "total_steps": 1395, "loss": 0.184, "lr": 8.977879113319847e-06, "epoch": 0.6243272335844995, "percentage": 20.79, "elapsed_time": "0:15:34", "remaining_time": "0:59:19", "throughput": 1361.79, "total_tokens": 1271968}
|
| 30 |
+
{"current_steps": 300, "total_steps": 1395, "loss": 0.1305, "lr": 8.90865588942046e-06, "epoch": 0.6458557588805167, "percentage": 21.51, "elapsed_time": "0:16:05", "remaining_time": "0:58:42", "throughput": 1363.59, "total_tokens": 1316096}
|
| 31 |
+
{"current_steps": 310, "total_steps": 1395, "loss": 0.1405, "lr": 8.83745040645531e-06, "epoch": 0.667384284176534, "percentage": 22.22, "elapsed_time": "0:16:36", "remaining_time": "0:58:07", "throughput": 1365.17, "total_tokens": 1360256}
|
| 32 |
+
{"current_steps": 320, "total_steps": 1395, "loss": 0.1651, "lr": 8.764298775997823e-06, "epoch": 0.6889128094725512, "percentage": 22.94, "elapsed_time": "0:17:07", "remaining_time": "0:57:31", "throughput": 1366.48, "total_tokens": 1404064}
|
| 33 |
+
{"current_steps": 330, "total_steps": 1395, "loss": 0.1519, "lr": 8.68923809660227e-06, "epoch": 0.7104413347685683, "percentage": 23.66, "elapsed_time": "0:17:38", "remaining_time": "0:56:56", "throughput": 1367.92, "total_tokens": 1448256}
|
| 34 |
+
{"current_steps": 340, "total_steps": 1395, "loss": 0.1574, "lr": 8.612306434989395e-06, "epoch": 0.7319698600645855, "percentage": 24.37, "elapsed_time": "0:18:09", "remaining_time": "0:56:22", "throughput": 1369.22, "total_tokens": 1492448}
|
| 35 |
+
{"current_steps": 350, "total_steps": 1395, "loss": 0.1587, "lr": 8.53354280674102e-06, "epoch": 0.7534983853606028, "percentage": 25.09, "elapsed_time": "0:18:41", "remaining_time": "0:55:48", "throughput": 1370.83, "total_tokens": 1537440}
|
| 36 |
+
{"current_steps": 360, "total_steps": 1395, "loss": 0.1513, "lr": 8.452987156513457e-06, "epoch": 0.77502691065662, "percentage": 25.81, "elapsed_time": "0:19:12", "remaining_time": "0:55:13", "throughput": 1371.83, "total_tokens": 1581280}
|
| 37 |
+
{"current_steps": 370, "total_steps": 1395, "loss": 0.1401, "lr": 8.370680337779737e-06, "epoch": 0.7965554359526372, "percentage": 26.52, "elapsed_time": "0:19:44", "remaining_time": "0:54:40", "throughput": 1372.77, "total_tokens": 1625824}
|
| 38 |
+
{"current_steps": 380, "total_steps": 1395, "loss": 0.1135, "lr": 8.286664092110935e-06, "epoch": 0.8180839612486545, "percentage": 27.24, "elapsed_time": "0:20:15", "remaining_time": "0:54:06", "throughput": 1373.73, "total_tokens": 1669472}
|
| 39 |
+
{"current_steps": 390, "total_steps": 1395, "loss": 0.1645, "lr": 8.200981028007095e-06, "epoch": 0.8396124865446717, "percentage": 27.96, "elapsed_time": "0:20:46", "remaining_time": "0:53:31", "throughput": 1374.92, "total_tokens": 1713312}
|
| 40 |
+
{"current_steps": 400, "total_steps": 1395, "loss": 0.1129, "lr": 8.11367459928851e-06, "epoch": 0.8611410118406889, "percentage": 28.67, "elapsed_time": "0:21:17", "remaining_time": "0:52:56", "throughput": 1375.83, "total_tokens": 1757056}
|
| 41 |
+
{"current_steps": 410, "total_steps": 1395, "loss": 0.1333, "lr": 8.024789083058289e-06, "epoch": 0.8826695371367062, "percentage": 29.39, "elapsed_time": "0:21:48", "remaining_time": "0:52:23", "throughput": 1376.82, "total_tokens": 1801632}
|
| 42 |
+
{"current_steps": 420, "total_steps": 1395, "loss": 0.1311, "lr": 7.934369557247397e-06, "epoch": 0.9041980624327234, "percentage": 30.11, "elapsed_time": "0:22:19", "remaining_time": "0:51:49", "throughput": 1377.63, "total_tokens": 1845280}
|
| 43 |
+
{"current_steps": 430, "total_steps": 1395, "loss": 0.1395, "lr": 7.842461877753575e-06, "epoch": 0.9257265877287406, "percentage": 30.82, "elapsed_time": "0:22:50", "remaining_time": "0:51:15", "throughput": 1378.55, "total_tokens": 1889472}
|
| 44 |
+
{"current_steps": 440, "total_steps": 1395, "loss": 0.1175, "lr": 7.7491126551857e-06, "epoch": 0.9472551130247578, "percentage": 31.54, "elapsed_time": "0:23:21", "remaining_time": "0:50:41", "throughput": 1379.32, "total_tokens": 1932832}
|
| 45 |
+
{"current_steps": 450, "total_steps": 1395, "loss": 0.1154, "lr": 7.654369231225398e-06, "epoch": 0.9687836383207751, "percentage": 32.26, "elapsed_time": "0:23:51", "remaining_time": "0:50:07", "throughput": 1379.96, "total_tokens": 1976000}
|
| 46 |
+
{"current_steps": 460, "total_steps": 1395, "loss": 0.1408, "lr": 7.5582796546179125e-06, "epoch": 0.9903121636167922, "percentage": 32.97, "elapsed_time": "0:24:23", "remaining_time": "0:49:33", "throughput": 1380.68, "total_tokens": 2019968}
|
| 47 |
+
{"current_steps": 470, "total_steps": 1395, "loss": 0.1126, "lr": 7.460892656804366e-06, "epoch": 1.0107642626480087, "percentage": 33.69, "elapsed_time": "0:24:52", "remaining_time": "0:48:57", "throughput": 1381.29, "total_tokens": 2061440}
|
| 48 |
+
{"current_steps": 480, "total_steps": 1395, "loss": 0.1329, "lr": 7.362257627207818e-06, "epoch": 1.0322927879440258, "percentage": 34.41, "elapsed_time": "0:25:23", "remaining_time": "0:48:23", "throughput": 1382.02, "total_tokens": 2105216}
|
| 49 |
+
{"current_steps": 490, "total_steps": 1395, "loss": 0.111, "lr": 7.2624245881856094e-06, "epoch": 1.0538213132400431, "percentage": 35.13, "elapsed_time": "0:25:54", "remaining_time": "0:47:51", "throughput": 1382.64, "total_tokens": 2149888}
|
| 50 |
+
{"current_steps": 500, "total_steps": 1395, "loss": 0.113, "lr": 7.161444169660723e-06, "epoch": 1.0753498385360603, "percentage": 35.84, "elapsed_time": "0:26:26", "remaining_time": "0:47:19", "throughput": 1383.36, "total_tokens": 2194304}
|
| 51 |
+
{"current_steps": 510, "total_steps": 1395, "loss": 0.1303, "lr": 7.059367583445034e-06, "epoch": 1.0968783638320776, "percentage": 36.56, "elapsed_time": "0:26:57", "remaining_time": "0:46:46", "throughput": 1384.03, "total_tokens": 2238080}
|
| 52 |
+
{"current_steps": 520, "total_steps": 1395, "loss": 0.1404, "lr": 6.956246597267438e-06, "epoch": 1.1184068891280947, "percentage": 37.28, "elapsed_time": "0:27:28", "remaining_time": "0:46:13", "throughput": 1384.6, "total_tokens": 2282368}
|
| 53 |
+
{"current_steps": 530, "total_steps": 1395, "loss": 0.0972, "lr": 6.852133508520057e-06, "epoch": 1.1399354144241118, "percentage": 37.99, "elapsed_time": "0:27:59", "remaining_time": "0:45:40", "throughput": 1385.09, "total_tokens": 2325984}
|
| 54 |
+
{"current_steps": 540, "total_steps": 1395, "loss": 0.1092, "lr": 6.747081117735829e-06, "epoch": 1.1614639397201292, "percentage": 38.71, "elapsed_time": "0:28:30", "remaining_time": "0:45:07", "throughput": 1385.58, "total_tokens": 2369664}
|
| 55 |
+
{"current_steps": 550, "total_steps": 1395, "loss": 0.1186, "lr": 6.641142701810932e-06, "epoch": 1.1829924650161463, "percentage": 39.43, "elapsed_time": "0:29:01", "remaining_time": "0:44:35", "throughput": 1386.0, "total_tokens": 2413312}
|
| 56 |
+
{"current_steps": 560, "total_steps": 1395, "loss": 0.1332, "lr": 6.534371986985618e-06, "epoch": 1.2045209903121636, "percentage": 40.14, "elapsed_time": "0:29:32", "remaining_time": "0:44:02", "throughput": 1386.55, "total_tokens": 2457120}
|
| 57 |
+
{"current_steps": 570, "total_steps": 1395, "loss": 0.1481, "lr": 6.426823121597169e-06, "epoch": 1.2260495156081808, "percentage": 40.86, "elapsed_time": "0:30:03", "remaining_time": "0:43:29", "throughput": 1386.93, "total_tokens": 2500736}
|
| 58 |
+
{"current_steps": 580, "total_steps": 1395, "loss": 0.1332, "lr": 6.318550648618785e-06, "epoch": 1.247578040904198, "percentage": 41.58, "elapsed_time": "0:30:34", "remaining_time": "0:42:57", "throughput": 1387.57, "total_tokens": 2545056}
|
| 59 |
+
{"current_steps": 590, "total_steps": 1395, "loss": 0.0978, "lr": 6.209609477998339e-06, "epoch": 1.2691065662002152, "percentage": 42.29, "elapsed_time": "0:31:04", "remaining_time": "0:42:24", "throughput": 1387.91, "total_tokens": 2588416}
|
| 60 |
+
{"current_steps": 600, "total_steps": 1395, "loss": 0.1176, "lr": 6.100054858811012e-06, "epoch": 1.2906350914962326, "percentage": 43.01, "elapsed_time": "0:31:36", "remaining_time": "0:41:52", "throughput": 1388.3, "total_tokens": 2632352}
|
| 61 |
+
{"current_steps": 610, "total_steps": 1395, "loss": 0.1279, "lr": 5.989942351239954e-06, "epoch": 1.3121636167922497, "percentage": 43.73, "elapsed_time": "0:32:07", "remaining_time": "0:41:20", "throughput": 1388.66, "total_tokens": 2676640}
|
| 62 |
+
{"current_steps": 620, "total_steps": 1395, "loss": 0.1407, "lr": 5.879327798399155e-06, "epoch": 1.333692142088267, "percentage": 44.44, "elapsed_time": "0:32:38", "remaining_time": "0:40:47", "throughput": 1388.98, "total_tokens": 2719968}
|
| 63 |
+
{"current_steps": 630, "total_steps": 1395, "loss": 0.1168, "lr": 5.768267298012841e-06, "epoch": 1.3552206673842842, "percentage": 45.16, "elapsed_time": "0:33:09", "remaining_time": "0:40:16", "throughput": 1389.35, "total_tokens": 2764352}
|
| 64 |
+
{"current_steps": 640, "total_steps": 1395, "loss": 0.1188, "lr": 5.656817173965733e-06, "epoch": 1.3767491926803013, "percentage": 45.88, "elapsed_time": "0:33:41", "remaining_time": "0:39:44", "throughput": 1389.81, "total_tokens": 2808832}
|
| 65 |
+
{"current_steps": 650, "total_steps": 1395, "loss": 0.1326, "lr": 5.545033947738624e-06, "epoch": 1.3982777179763186, "percentage": 46.59, "elapsed_time": "0:34:11", "remaining_time": "0:39:11", "throughput": 1390.15, "total_tokens": 2852192}
|
| 66 |
+
{"current_steps": 660, "total_steps": 1395, "loss": 0.1331, "lr": 5.4329743097437316e-06, "epoch": 1.419806243272336, "percentage": 47.31, "elapsed_time": "0:34:42", "remaining_time": "0:38:39", "throughput": 1390.61, "total_tokens": 2896256}
|
| 67 |
+
{"current_steps": 670, "total_steps": 1395, "loss": 0.1082, "lr": 5.320695090574386e-06, "epoch": 1.441334768568353, "percentage": 48.03, "elapsed_time": "0:35:13", "remaining_time": "0:38:07", "throughput": 1390.83, "total_tokens": 2939552}
|
| 68 |
+
{"current_steps": 680, "total_steps": 1395, "loss": 0.1184, "lr": 5.208253232183625e-06, "epoch": 1.4628632938643702, "percentage": 48.75, "elapsed_time": "0:35:44", "remaining_time": "0:37:35", "throughput": 1391.28, "total_tokens": 2984000}
|
| 69 |
+
{"current_steps": 690, "total_steps": 1395, "loss": 0.0942, "lr": 5.095705759006311e-06, "epoch": 1.4843918191603875, "percentage": 49.46, "elapsed_time": "0:36:16", "remaining_time": "0:37:03", "throughput": 1391.62, "total_tokens": 3028192}
|
| 70 |
+
{"current_steps": 700, "total_steps": 1395, "loss": 0.1204, "lr": 4.9831097490394195e-06, "epoch": 1.5059203444564049, "percentage": 50.18, "elapsed_time": "0:36:46", "remaining_time": "0:36:31", "throughput": 1391.78, "total_tokens": 3071392}
|
| 71 |
+
{"current_steps": 710, "total_steps": 1395, "loss": 0.1358, "lr": 4.870522304895164e-06, "epoch": 1.527448869752422, "percentage": 50.9, "elapsed_time": "0:37:17", "remaining_time": "0:35:58", "throughput": 1391.95, "total_tokens": 3114496}
|
| 72 |
+
{"current_steps": 720, "total_steps": 1395, "loss": 0.1313, "lr": 4.758000524841632e-06, "epoch": 1.5489773950484391, "percentage": 51.61, "elapsed_time": "0:37:48", "remaining_time": "0:35:26", "throughput": 1392.21, "total_tokens": 3158432}
|
| 73 |
+
{"current_steps": 730, "total_steps": 1395, "loss": 0.0879, "lr": 4.645601473845636e-06, "epoch": 1.5705059203444565, "percentage": 52.33, "elapsed_time": "0:38:19", "remaining_time": "0:34:54", "throughput": 1392.44, "total_tokens": 3201888}
|
| 74 |
+
{"current_steps": 740, "total_steps": 1395, "loss": 0.0977, "lr": 4.533382154632442e-06, "epoch": 1.5920344456404736, "percentage": 53.05, "elapsed_time": "0:38:50", "remaining_time": "0:34:22", "throughput": 1392.74, "total_tokens": 3245856}
|
| 75 |
+
{"current_steps": 750, "total_steps": 1395, "loss": 0.1483, "lr": 4.421399478777064e-06, "epoch": 1.6135629709364907, "percentage": 53.76, "elapsed_time": "0:39:21", "remaining_time": "0:33:51", "throughput": 1393.03, "total_tokens": 3290208}
|
| 76 |
+
{"current_steps": 760, "total_steps": 1395, "loss": 0.1285, "lr": 4.3097102378417985e-06, "epoch": 1.635091496232508, "percentage": 54.48, "elapsed_time": "0:39:52", "remaining_time": "0:33:19", "throughput": 1393.12, "total_tokens": 3333152}
|
| 77 |
+
{"current_steps": 770, "total_steps": 1395, "loss": 0.1475, "lr": 4.198371074574597e-06, "epoch": 1.6566200215285254, "percentage": 55.2, "elapsed_time": "0:40:23", "remaining_time": "0:32:47", "throughput": 1393.46, "total_tokens": 3377664}
|
| 78 |
+
{"current_steps": 780, "total_steps": 1395, "loss": 0.0904, "lr": 4.087438454182942e-06, "epoch": 1.6781485468245425, "percentage": 55.91, "elapsed_time": "0:40:55", "remaining_time": "0:32:16", "throughput": 1393.73, "total_tokens": 3422400}
|
| 79 |
+
{"current_steps": 790, "total_steps": 1395, "loss": 0.1199, "lr": 3.976968635697732e-06, "epoch": 1.6996770721205596, "percentage": 56.63, "elapsed_time": "0:41:26", "remaining_time": "0:31:44", "throughput": 1393.93, "total_tokens": 3465760}
|
| 80 |
+
{"current_steps": 800, "total_steps": 1395, "loss": 0.102, "lr": 3.867017643441746e-06, "epoch": 1.721205597416577, "percentage": 57.35, "elapsed_time": "0:41:57", "remaining_time": "0:31:12", "throughput": 1394.19, "total_tokens": 3509760}
|
| 81 |
+
{"current_steps": 810, "total_steps": 1395, "loss": 0.1194, "lr": 3.757641238617137e-06, "epoch": 1.7427341227125943, "percentage": 58.06, "elapsed_time": "0:42:29", "remaining_time": "0:30:41", "throughput": 1394.24, "total_tokens": 3554560}
|
| 82 |
+
{"current_steps": 820, "total_steps": 1395, "loss": 0.1507, "lr": 3.648894891026358e-06, "epoch": 1.7642626480086114, "percentage": 58.78, "elapsed_time": "0:43:01", "remaining_time": "0:30:09", "throughput": 1394.6, "total_tokens": 3599488}
|
| 83 |
+
{"current_steps": 830, "total_steps": 1395, "loss": 0.1015, "lr": 3.5408337509408764e-06, "epoch": 1.7857911733046286, "percentage": 59.5, "elapsed_time": "0:43:32", "remaining_time": "0:29:38", "throughput": 1394.81, "total_tokens": 3643680}
|
| 84 |
+
{"current_steps": 840, "total_steps": 1395, "loss": 0.1165, "lr": 3.4335126211319412e-06, "epoch": 1.807319698600646, "percentage": 60.22, "elapsed_time": "0:44:03", "remaining_time": "0:29:06", "throughput": 1395.1, "total_tokens": 3688160}
|
| 85 |
+
{"current_steps": 850, "total_steps": 1395, "loss": 0.0958, "lr": 3.32698592907757e-06, "epoch": 1.8288482238966632, "percentage": 60.93, "elapsed_time": "0:44:34", "remaining_time": "0:28:34", "throughput": 1395.22, "total_tokens": 3731392}
|
| 86 |
+
{"current_steps": 860, "total_steps": 1395, "loss": 0.1505, "lr": 3.2213076993598857e-06, "epoch": 1.8503767491926801, "percentage": 61.65, "elapsed_time": "0:45:06", "remaining_time": "0:28:03", "throughput": 1395.41, "total_tokens": 3776128}
|
| 87 |
+
{"current_steps": 870, "total_steps": 1395, "loss": 0.1003, "lr": 3.1165315262667535e-06, "epoch": 1.8719052744886975, "percentage": 62.37, "elapsed_time": "0:45:37", "remaining_time": "0:27:32", "throughput": 1395.71, "total_tokens": 3820896}
|
| 88 |
+
{"current_steps": 880, "total_steps": 1395, "loss": 0.1483, "lr": 3.012710546611659e-06, "epoch": 1.8934337997847148, "percentage": 63.08, "elapsed_time": "0:46:08", "remaining_time": "0:27:00", "throughput": 1395.87, "total_tokens": 3864704}
|
| 89 |
+
{"current_steps": 890, "total_steps": 1395, "loss": 0.117, "lr": 2.9098974127856e-06, "epoch": 1.914962325080732, "percentage": 63.8, "elapsed_time": "0:46:39", "remaining_time": "0:26:28", "throughput": 1396.08, "total_tokens": 3908544}
|
| 90 |
+
{"current_steps": 900, "total_steps": 1395, "loss": 0.1303, "lr": 2.8081442660546126e-06, "epoch": 1.936490850376749, "percentage": 64.52, "elapsed_time": "0:47:10", "remaining_time": "0:25:57", "throughput": 1396.22, "total_tokens": 3952576}
|
| 91 |
+
{"current_steps": 910, "total_steps": 1395, "loss": 0.0971, "lr": 2.7075027101165706e-06, "epoch": 1.9580193756727664, "percentage": 65.23, "elapsed_time": "0:47:42", "remaining_time": "0:25:25", "throughput": 1396.34, "total_tokens": 3996416}
|
| 92 |
+
{"current_steps": 920, "total_steps": 1395, "loss": 0.132, "lr": 2.6080237849305467e-06, "epoch": 1.9795479009687837, "percentage": 65.95, "elapsed_time": "0:48:13", "remaining_time": "0:24:53", "throughput": 1396.59, "total_tokens": 4040736}
|
| 93 |
+
{"current_steps": 930, "total_steps": 1395, "loss": 0.093, "lr": 2.5097579408321264e-06, "epoch": 2.0, "percentage": 66.67, "elapsed_time": "0:48:43", "remaining_time": "0:24:21", "throughput": 1396.82, "total_tokens": 4083200}
|
| 94 |
+
{"current_steps": 940, "total_steps": 1395, "loss": 0.1324, "lr": 2.4127550129477145e-06, "epoch": 2.0215285252960173, "percentage": 67.38, "elapsed_time": "0:49:14", "remaining_time": "0:23:49", "throughput": 1396.98, "total_tokens": 4127040}
|
| 95 |
+
{"current_steps": 950, "total_steps": 1395, "loss": 0.0841, "lr": 2.317064195920852e-06, "epoch": 2.0430570505920342, "percentage": 68.1, "elapsed_time": "0:49:45", "remaining_time": "0:23:18", "throughput": 1397.11, "total_tokens": 4170816}
|
| 96 |
+
{"current_steps": 960, "total_steps": 1395, "loss": 0.1138, "lr": 2.2227340189633508e-06, "epoch": 2.0645855758880516, "percentage": 68.82, "elapsed_time": "0:50:16", "remaining_time": "0:22:46", "throughput": 1397.24, "total_tokens": 4214272}
|
| 97 |
+
{"current_steps": 970, "total_steps": 1395, "loss": 0.0892, "lr": 2.1298123212439028e-06, "epoch": 2.086114101184069, "percentage": 69.53, "elapsed_time": "0:50:47", "remaining_time": "0:22:15", "throughput": 1397.46, "total_tokens": 4258592}
|
| 98 |
+
{"current_steps": 980, "total_steps": 1395, "loss": 0.1277, "lr": 2.0383462276266347e-06, "epoch": 2.1076426264800863, "percentage": 70.25, "elapsed_time": "0:51:18", "remaining_time": "0:21:43", "throughput": 1397.61, "total_tokens": 4302656}
|
| 99 |
+
{"current_steps": 990, "total_steps": 1395, "loss": 0.0968, "lr": 1.948382124771927e-06, "epoch": 2.129171151776103, "percentage": 70.97, "elapsed_time": "0:51:49", "remaining_time": "0:21:11", "throughput": 1397.71, "total_tokens": 4345888}
|
| 100 |
+
{"current_steps": 1000, "total_steps": 1395, "loss": 0.1226, "lr": 1.8599656376116026e-06, "epoch": 2.1506996770721205, "percentage": 71.68, "elapsed_time": "0:52:20", "remaining_time": "0:20:40", "throughput": 1397.94, "total_tokens": 4390528}
|
| 101 |
+
{"current_steps": 1010, "total_steps": 1395, "loss": 0.1201, "lr": 1.773141606210431e-06, "epoch": 2.172228202368138, "percentage": 72.4, "elapsed_time": "0:52:58", "remaining_time": "0:20:11", "throughput": 1395.31, "total_tokens": 4434784}
|
| 102 |
+
{"current_steps": 1020, "total_steps": 1395, "loss": 0.0966, "lr": 1.687954063025663e-06, "epoch": 2.193756727664155, "percentage": 73.12, "elapsed_time": "0:53:29", "remaining_time": "0:19:40", "throughput": 1395.47, "total_tokens": 4478976}
|
| 103 |
+
{"current_steps": 1030, "total_steps": 1395, "loss": 0.1143, "lr": 1.604446210576157e-06, "epoch": 2.215285252960172, "percentage": 73.84, "elapsed_time": "0:54:01", "remaining_time": "0:19:08", "throughput": 1395.66, "total_tokens": 4523616}
|
| 104 |
+
{"current_steps": 1040, "total_steps": 1395, "loss": 0.1114, "lr": 1.5226603995323897e-06, "epoch": 2.2368137782561894, "percentage": 74.55, "elapsed_time": "0:54:32", "remaining_time": "0:18:36", "throughput": 1395.8, "total_tokens": 4567264}
|
| 105 |
+
{"current_steps": 1050, "total_steps": 1395, "loss": 0.0981, "lr": 1.4426381072384866e-06, "epoch": 2.2583423035522068, "percentage": 75.27, "elapsed_time": "0:55:03", "remaining_time": "0:18:05", "throughput": 1395.88, "total_tokens": 4611104}
|
| 106 |
+
{"current_steps": 1060, "total_steps": 1395, "loss": 0.1135, "lr": 1.3644199166771531e-06, "epoch": 2.2798708288482237, "percentage": 75.99, "elapsed_time": "0:55:34", "remaining_time": "0:17:33", "throughput": 1396.01, "total_tokens": 4655040}
|
| 107 |
+
{"current_steps": 1070, "total_steps": 1395, "loss": 0.1081, "lr": 1.2880454958881794e-06, "epoch": 2.301399354144241, "percentage": 76.7, "elapsed_time": "0:56:05", "remaining_time": "0:17:02", "throughput": 1396.08, "total_tokens": 4698432}
|
| 108 |
+
{"current_steps": 1080, "total_steps": 1395, "loss": 0.0685, "lr": 1.2135535778509545e-06, "epoch": 2.3229278794402584, "percentage": 77.42, "elapsed_time": "0:56:36", "remaining_time": "0:16:30", "throughput": 1396.28, "total_tokens": 4742848}
|
| 109 |
+
{"current_steps": 1090, "total_steps": 1395, "loss": 0.0857, "lr": 1.1409819408411898e-06, "epoch": 2.3444564047362757, "percentage": 78.14, "elapsed_time": "0:57:07", "remaining_time": "0:15:59", "throughput": 1396.47, "total_tokens": 4786944}
|
| 110 |
+
{"current_steps": 1100, "total_steps": 1395, "loss": 0.1008, "lr": 1.070367389271823e-06, "epoch": 2.3659849300322926, "percentage": 78.85, "elapsed_time": "0:57:38", "remaining_time": "0:15:27", "throughput": 1396.6, "total_tokens": 4830624}
|
| 111 |
+
{"current_steps": 1110, "total_steps": 1395, "loss": 0.1137, "lr": 1.001745735027801e-06, "epoch": 2.38751345532831, "percentage": 79.57, "elapsed_time": "0:58:10", "remaining_time": "0:14:56", "throughput": 1396.71, "total_tokens": 4874944}
|
| 112 |
+
{"current_steps": 1120, "total_steps": 1395, "loss": 0.1038, "lr": 9.351517793042408e-07, "epoch": 2.4090419806243273, "percentage": 80.29, "elapsed_time": "0:58:41", "remaining_time": "0:14:24", "throughput": 1396.77, "total_tokens": 4918496}
|
| 113 |
+
{"current_steps": 1130, "total_steps": 1395, "loss": 0.1194, "lr": 8.706192949571262e-07, "epoch": 2.4305705059203446, "percentage": 81.0, "elapsed_time": "0:59:12", "remaining_time": "0:13:53", "throughput": 1396.84, "total_tokens": 4961920}
|
| 114 |
+
{"current_steps": 1140, "total_steps": 1395, "loss": 0.1161, "lr": 8.081810093755537e-07, "epoch": 2.4520990312163615, "percentage": 81.72, "elapsed_time": "0:59:43", "remaining_time": "0:13:21", "throughput": 1396.93, "total_tokens": 5005440}
|
| 115 |
+
{"current_steps": 1150, "total_steps": 1395, "loss": 0.1, "lr": 7.478685878841629e-07, "epoch": 2.473627556512379, "percentage": 82.44, "elapsed_time": "1:00:14", "remaining_time": "0:12:50", "throughput": 1397.05, "total_tokens": 5049344}
|
| 116 |
+
{"current_steps": 1160, "total_steps": 1395, "loss": 0.0996, "lr": 6.897126176841978e-07, "epoch": 2.495156081808396, "percentage": 83.15, "elapsed_time": "1:00:45", "remaining_time": "0:12:18", "throughput": 1397.15, "total_tokens": 5092896}
|
| 117 |
+
{"current_steps": 1170, "total_steps": 1395, "loss": 0.0944, "lr": 6.337425923413276e-07, "epoch": 2.5166846071044136, "percentage": 83.87, "elapsed_time": "1:01:16", "remaining_time": "0:11:46", "throughput": 1397.31, "total_tokens": 5136928}
|
| 118 |
+
{"current_steps": 1180, "total_steps": 1395, "loss": 0.08, "lr": 5.799868968281075e-07, "epoch": 2.5382131324004304, "percentage": 84.59, "elapsed_time": "1:01:47", "remaining_time": "0:11:15", "throughput": 1397.41, "total_tokens": 5180960}
|
| 119 |
+
{"current_steps": 1190, "total_steps": 1395, "loss": 0.0962, "lr": 5.284727931286526e-07, "epoch": 2.559741657696448, "percentage": 85.3, "elapsed_time": "1:02:18", "remaining_time": "0:10:44", "throughput": 1397.57, "total_tokens": 5225376}
|
| 120 |
+
{"current_steps": 1200, "total_steps": 1395, "loss": 0.094, "lr": 4.792264064128327e-07, "epoch": 2.581270182992465, "percentage": 86.02, "elapsed_time": "1:02:49", "remaining_time": "0:10:12", "throughput": 1397.63, "total_tokens": 5268992}
|
| 121 |
+
{"current_steps": 1210, "total_steps": 1395, "loss": 0.1005, "lr": 4.322727117869951e-07, "epoch": 2.602798708288482, "percentage": 86.74, "elapsed_time": "1:03:21", "remaining_time": "0:09:41", "throughput": 1397.77, "total_tokens": 5312992}
|
| 122 |
+
{"current_steps": 1220, "total_steps": 1395, "loss": 0.1167, "lr": 3.8763552162794983e-07, "epoch": 2.6243272335844994, "percentage": 87.46, "elapsed_time": "1:03:51", "remaining_time": "0:09:09", "throughput": 1397.85, "total_tokens": 5356448}
|
| 123 |
+
{"current_steps": 1230, "total_steps": 1395, "loss": 0.0907, "lr": 3.453374735066034e-07, "epoch": 2.6458557588805167, "percentage": 88.17, "elapsed_time": "1:04:23", "remaining_time": "0:08:38", "throughput": 1397.99, "total_tokens": 5400672}
|
| 124 |
+
{"current_steps": 1240, "total_steps": 1395, "loss": 0.1074, "lr": 3.054000187074224e-07, "epoch": 2.667384284176534, "percentage": 88.89, "elapsed_time": "1:04:54", "remaining_time": "0:08:06", "throughput": 1398.14, "total_tokens": 5444576}
|
| 125 |
+
{"current_steps": 1250, "total_steps": 1395, "loss": 0.1128, "lr": 2.678434113494882e-07, "epoch": 2.6889128094725514, "percentage": 89.61, "elapsed_time": "1:05:25", "remaining_time": "0:07:35", "throughput": 1398.24, "total_tokens": 5488160}
|
| 126 |
+
{"current_steps": 1260, "total_steps": 1395, "loss": 0.1016, "lr": 2.326866981147091e-07, "epoch": 2.7104413347685683, "percentage": 90.32, "elapsed_time": "1:05:56", "remaining_time": "0:07:03", "throughput": 1398.36, "total_tokens": 5532000}
|
| 127 |
+
{"current_steps": 1270, "total_steps": 1395, "loss": 0.1052, "lr": 1.999477085883711e-07, "epoch": 2.7319698600645856, "percentage": 91.04, "elapsed_time": "1:06:27", "remaining_time": "0:06:32", "throughput": 1398.46, "total_tokens": 5575808}
|
| 128 |
+
{"current_steps": 1280, "total_steps": 1395, "loss": 0.0918, "lr": 1.6964304621693516e-07, "epoch": 2.7534983853606025, "percentage": 91.76, "elapsed_time": "1:06:57", "remaining_time": "0:06:00", "throughput": 1398.56, "total_tokens": 5619200}
|
| 129 |
+
{"current_steps": 1290, "total_steps": 1395, "loss": 0.109, "lr": 1.4178807988766419e-07, "epoch": 2.77502691065662, "percentage": 92.47, "elapsed_time": "1:07:28", "remaining_time": "0:05:29", "throughput": 1398.61, "total_tokens": 5662656}
|
| 130 |
+
{"current_steps": 1300, "total_steps": 1395, "loss": 0.1224, "lr": 1.1639693613435921e-07, "epoch": 2.7965554359526372, "percentage": 93.19, "elapsed_time": "1:07:59", "remaining_time": "0:04:58", "throughput": 1398.72, "total_tokens": 5706656}
|
| 131 |
+
{"current_steps": 1310, "total_steps": 1395, "loss": 0.0992, "lr": 9.348249197313918e-08, "epoch": 2.8180839612486546, "percentage": 93.91, "elapsed_time": "1:08:31", "remaining_time": "0:04:26", "throughput": 1398.83, "total_tokens": 5751232}
|
| 132 |
+
{"current_steps": 1320, "total_steps": 1395, "loss": 0.107, "lr": 7.305636837191876e-08, "epoch": 2.839612486544672, "percentage": 94.62, "elapsed_time": "1:09:02", "remaining_time": "0:03:55", "throughput": 1398.91, "total_tokens": 5794976}
|
| 133 |
+
{"current_steps": 1330, "total_steps": 1395, "loss": 0.0944, "lr": 5.512892435687645e-08, "epoch": 2.861141011840689, "percentage": 95.34, "elapsed_time": "1:09:33", "remaining_time": "0:03:23", "throughput": 1398.97, "total_tokens": 5838368}
|
| 134 |
+
{"current_steps": 1340, "total_steps": 1395, "loss": 0.0867, "lr": 3.970925175892093e-08, "epoch": 2.882669537136706, "percentage": 96.06, "elapsed_time": "1:10:04", "remaining_time": "0:02:52", "throughput": 1399.03, "total_tokens": 5881984}
|
| 135 |
+
{"current_steps": 1350, "total_steps": 1395, "loss": 0.1075, "lr": 2.6805170602803297e-08, "epoch": 2.9041980624327235, "percentage": 96.77, "elapsed_time": "1:10:35", "remaining_time": "0:02:21", "throughput": 1399.15, "total_tokens": 5925664}
|
| 136 |
+
{"current_steps": 1360, "total_steps": 1395, "loss": 0.1042, "lr": 1.6423225141223854e-08, "epoch": 2.9257265877287404, "percentage": 97.49, "elapsed_time": "1:11:06", "remaining_time": "0:01:49", "throughput": 1399.23, "total_tokens": 5969408}
|
| 137 |
+
{"current_steps": 1370, "total_steps": 1395, "loss": 0.0964, "lr": 8.568680535939177e-09, "epoch": 2.9472551130247577, "percentage": 98.21, "elapsed_time": "1:11:37", "remaining_time": "0:01:18", "throughput": 1399.25, "total_tokens": 6012576}
|
| 138 |
+
{"current_steps": 1380, "total_steps": 1395, "loss": 0.0922, "lr": 3.2455201875586372e-09, "epoch": 2.968783638320775, "percentage": 98.92, "elapsed_time": "1:12:08", "remaining_time": "0:00:47", "throughput": 1399.11, "total_tokens": 6056000}
|
| 139 |
+
{"current_steps": 1390, "total_steps": 1395, "loss": 0.115, "lr": 4.5644371537756363e-10, "epoch": 2.9903121636167924, "percentage": 99.64, "elapsed_time": "1:12:39", "remaining_time": "0:00:15", "throughput": 1399.22, "total_tokens": 6100192}
|
| 140 |
+
{"current_steps": 1395, "total_steps": 1395, "epoch": 3.0, "percentage": 100.0, "elapsed_time": "1:12:59", "remaining_time": "0:00:00", "throughput": 1397.29, "total_tokens": 6120032}
|
trainer_state.json
CHANGED
|
@@ -11,1408 +11,1408 @@
|
|
| 11 |
"log_history": [
|
| 12 |
{
|
| 13 |
"epoch": 0.021528525296017224,
|
| 14 |
-
"grad_norm":
|
| 15 |
-
"learning_rate":
|
| 16 |
-
"loss":
|
| 17 |
-
"num_input_tokens_seen":
|
| 18 |
"step": 10,
|
| 19 |
-
"train_runtime":
|
| 20 |
-
"train_tokens_per_second":
|
| 21 |
},
|
| 22 |
{
|
| 23 |
"epoch": 0.04305705059203445,
|
| 24 |
-
"grad_norm":
|
| 25 |
-
"learning_rate":
|
| 26 |
-
"loss": 0.
|
| 27 |
-
"num_input_tokens_seen":
|
| 28 |
"step": 20,
|
| 29 |
-
"train_runtime":
|
| 30 |
-
"train_tokens_per_second":
|
| 31 |
},
|
| 32 |
{
|
| 33 |
"epoch": 0.06458557588805167,
|
| 34 |
-
"grad_norm":
|
| 35 |
-
"learning_rate":
|
| 36 |
-
"loss": 0.
|
| 37 |
-
"num_input_tokens_seen":
|
| 38 |
"step": 30,
|
| 39 |
-
"train_runtime":
|
| 40 |
-
"train_tokens_per_second":
|
| 41 |
},
|
| 42 |
{
|
| 43 |
"epoch": 0.0861141011840689,
|
| 44 |
-
"grad_norm":
|
| 45 |
-
"learning_rate":
|
| 46 |
-
"loss": 0.
|
| 47 |
-
"num_input_tokens_seen":
|
| 48 |
"step": 40,
|
| 49 |
-
"train_runtime":
|
| 50 |
-
"train_tokens_per_second":
|
| 51 |
},
|
| 52 |
{
|
| 53 |
"epoch": 0.10764262648008611,
|
| 54 |
-
"grad_norm":
|
| 55 |
-
"learning_rate":
|
| 56 |
-
"loss": 0.
|
| 57 |
-
"num_input_tokens_seen":
|
| 58 |
"step": 50,
|
| 59 |
-
"train_runtime":
|
| 60 |
-
"train_tokens_per_second":
|
| 61 |
},
|
| 62 |
{
|
| 63 |
"epoch": 0.12917115177610333,
|
| 64 |
-
"grad_norm":
|
| 65 |
-
"learning_rate":
|
| 66 |
-
"loss": 0.
|
| 67 |
-
"num_input_tokens_seen":
|
| 68 |
"step": 60,
|
| 69 |
-
"train_runtime":
|
| 70 |
-
"train_tokens_per_second":
|
| 71 |
},
|
| 72 |
{
|
| 73 |
"epoch": 0.15069967707212056,
|
| 74 |
-
"grad_norm":
|
| 75 |
-
"learning_rate":
|
| 76 |
-
"loss": 0.
|
| 77 |
-
"num_input_tokens_seen":
|
| 78 |
"step": 70,
|
| 79 |
-
"train_runtime":
|
| 80 |
-
"train_tokens_per_second":
|
| 81 |
},
|
| 82 |
{
|
| 83 |
"epoch": 0.1722282023681378,
|
| 84 |
-
"grad_norm":
|
| 85 |
-
"learning_rate":
|
| 86 |
-
"loss": 0.
|
| 87 |
-
"num_input_tokens_seen":
|
| 88 |
"step": 80,
|
| 89 |
-
"train_runtime":
|
| 90 |
-
"train_tokens_per_second":
|
| 91 |
},
|
| 92 |
{
|
| 93 |
"epoch": 0.193756727664155,
|
| 94 |
-
"grad_norm":
|
| 95 |
-
"learning_rate":
|
| 96 |
-
"loss": 0.
|
| 97 |
-
"num_input_tokens_seen":
|
| 98 |
"step": 90,
|
| 99 |
-
"train_runtime":
|
| 100 |
-
"train_tokens_per_second":
|
| 101 |
},
|
| 102 |
{
|
| 103 |
"epoch": 0.21528525296017223,
|
| 104 |
-
"grad_norm":
|
| 105 |
-
"learning_rate":
|
| 106 |
-
"loss": 0.
|
| 107 |
-
"num_input_tokens_seen":
|
| 108 |
"step": 100,
|
| 109 |
-
"train_runtime":
|
| 110 |
-
"train_tokens_per_second":
|
| 111 |
},
|
| 112 |
{
|
| 113 |
"epoch": 0.23681377825618946,
|
| 114 |
-
"grad_norm":
|
| 115 |
-
"learning_rate":
|
| 116 |
-
"loss": 0.
|
| 117 |
-
"num_input_tokens_seen":
|
| 118 |
"step": 110,
|
| 119 |
-
"train_runtime":
|
| 120 |
-
"train_tokens_per_second":
|
| 121 |
},
|
| 122 |
{
|
| 123 |
"epoch": 0.25834230355220666,
|
| 124 |
-
"grad_norm":
|
| 125 |
-
"learning_rate":
|
| 126 |
-
"loss": 0.
|
| 127 |
-
"num_input_tokens_seen":
|
| 128 |
"step": 120,
|
| 129 |
-
"train_runtime":
|
| 130 |
-
"train_tokens_per_second":
|
| 131 |
},
|
| 132 |
{
|
| 133 |
"epoch": 0.2798708288482239,
|
| 134 |
-
"grad_norm":
|
| 135 |
-
"learning_rate":
|
| 136 |
-
"loss": 0.
|
| 137 |
-
"num_input_tokens_seen":
|
| 138 |
"step": 130,
|
| 139 |
-
"train_runtime":
|
| 140 |
-
"train_tokens_per_second":
|
| 141 |
},
|
| 142 |
{
|
| 143 |
"epoch": 0.3013993541442411,
|
| 144 |
-
"grad_norm":
|
| 145 |
-
"learning_rate":
|
| 146 |
-
"loss": 0.
|
| 147 |
-
"num_input_tokens_seen":
|
| 148 |
"step": 140,
|
| 149 |
-
"train_runtime":
|
| 150 |
-
"train_tokens_per_second":
|
| 151 |
},
|
| 152 |
{
|
| 153 |
"epoch": 0.32292787944025836,
|
| 154 |
-
"grad_norm":
|
| 155 |
-
"learning_rate":
|
| 156 |
-
"loss": 0.
|
| 157 |
-
"num_input_tokens_seen":
|
| 158 |
"step": 150,
|
| 159 |
-
"train_runtime":
|
| 160 |
-
"train_tokens_per_second":
|
| 161 |
},
|
| 162 |
{
|
| 163 |
"epoch": 0.3444564047362756,
|
| 164 |
-
"grad_norm":
|
| 165 |
-
"learning_rate":
|
| 166 |
-
"loss": 0.
|
| 167 |
-
"num_input_tokens_seen":
|
| 168 |
"step": 160,
|
| 169 |
-
"train_runtime":
|
| 170 |
-
"train_tokens_per_second":
|
| 171 |
},
|
| 172 |
{
|
| 173 |
"epoch": 0.36598493003229277,
|
| 174 |
-
"grad_norm":
|
| 175 |
-
"learning_rate":
|
| 176 |
-
"loss": 0.
|
| 177 |
-
"num_input_tokens_seen":
|
| 178 |
"step": 170,
|
| 179 |
-
"train_runtime":
|
| 180 |
-
"train_tokens_per_second":
|
| 181 |
},
|
| 182 |
{
|
| 183 |
"epoch": 0.38751345532831,
|
| 184 |
-
"grad_norm":
|
| 185 |
-
"learning_rate":
|
| 186 |
-
"loss": 0.
|
| 187 |
-
"num_input_tokens_seen":
|
| 188 |
"step": 180,
|
| 189 |
-
"train_runtime":
|
| 190 |
-
"train_tokens_per_second":
|
| 191 |
},
|
| 192 |
{
|
| 193 |
"epoch": 0.40904198062432723,
|
| 194 |
-
"grad_norm":
|
| 195 |
-
"learning_rate":
|
| 196 |
-
"loss": 0.
|
| 197 |
-
"num_input_tokens_seen":
|
| 198 |
"step": 190,
|
| 199 |
-
"train_runtime":
|
| 200 |
-
"train_tokens_per_second":
|
| 201 |
},
|
| 202 |
{
|
| 203 |
"epoch": 0.43057050592034446,
|
| 204 |
-
"grad_norm":
|
| 205 |
-
"learning_rate":
|
| 206 |
-
"loss": 0.
|
| 207 |
-
"num_input_tokens_seen":
|
| 208 |
"step": 200,
|
| 209 |
-
"train_runtime":
|
| 210 |
-
"train_tokens_per_second":
|
| 211 |
},
|
| 212 |
{
|
| 213 |
"epoch": 0.4520990312163617,
|
| 214 |
-
"grad_norm":
|
| 215 |
-
"learning_rate":
|
| 216 |
-
"loss": 0.
|
| 217 |
-
"num_input_tokens_seen":
|
| 218 |
"step": 210,
|
| 219 |
-
"train_runtime":
|
| 220 |
-
"train_tokens_per_second":
|
| 221 |
},
|
| 222 |
{
|
| 223 |
"epoch": 0.4736275565123789,
|
| 224 |
-
"grad_norm":
|
| 225 |
-
"learning_rate":
|
| 226 |
-
"loss": 0.
|
| 227 |
-
"num_input_tokens_seen":
|
| 228 |
"step": 220,
|
| 229 |
-
"train_runtime":
|
| 230 |
-
"train_tokens_per_second":
|
| 231 |
},
|
| 232 |
{
|
| 233 |
"epoch": 0.4951560818083961,
|
| 234 |
-
"grad_norm":
|
| 235 |
-
"learning_rate":
|
| 236 |
-
"loss": 0.
|
| 237 |
-
"num_input_tokens_seen":
|
| 238 |
"step": 230,
|
| 239 |
-
"train_runtime":
|
| 240 |
-
"train_tokens_per_second":
|
| 241 |
},
|
| 242 |
{
|
| 243 |
"epoch": 0.5166846071044133,
|
| 244 |
-
"grad_norm":
|
| 245 |
-
"learning_rate":
|
| 246 |
-
"loss": 0.
|
| 247 |
-
"num_input_tokens_seen":
|
| 248 |
"step": 240,
|
| 249 |
-
"train_runtime":
|
| 250 |
-
"train_tokens_per_second":
|
| 251 |
},
|
| 252 |
{
|
| 253 |
"epoch": 0.5382131324004306,
|
| 254 |
-
"grad_norm":
|
| 255 |
-
"learning_rate":
|
| 256 |
-
"loss": 0.
|
| 257 |
-
"num_input_tokens_seen":
|
| 258 |
"step": 250,
|
| 259 |
-
"train_runtime":
|
| 260 |
-
"train_tokens_per_second":
|
| 261 |
},
|
| 262 |
{
|
| 263 |
"epoch": 0.5597416576964478,
|
| 264 |
-
"grad_norm":
|
| 265 |
-
"learning_rate":
|
| 266 |
-
"loss": 0.
|
| 267 |
-
"num_input_tokens_seen":
|
| 268 |
"step": 260,
|
| 269 |
-
"train_runtime":
|
| 270 |
-
"train_tokens_per_second":
|
| 271 |
},
|
| 272 |
{
|
| 273 |
"epoch": 0.581270182992465,
|
| 274 |
-
"grad_norm":
|
| 275 |
-
"learning_rate":
|
| 276 |
-
"loss": 0.
|
| 277 |
-
"num_input_tokens_seen":
|
| 278 |
"step": 270,
|
| 279 |
-
"train_runtime":
|
| 280 |
-
"train_tokens_per_second":
|
| 281 |
},
|
| 282 |
{
|
| 283 |
"epoch": 0.6027987082884823,
|
| 284 |
-
"grad_norm":
|
| 285 |
-
"learning_rate":
|
| 286 |
-
"loss": 0.
|
| 287 |
-
"num_input_tokens_seen":
|
| 288 |
"step": 280,
|
| 289 |
-
"train_runtime":
|
| 290 |
-
"train_tokens_per_second":
|
| 291 |
},
|
| 292 |
{
|
| 293 |
"epoch": 0.6243272335844995,
|
| 294 |
-
"grad_norm":
|
| 295 |
-
"learning_rate":
|
| 296 |
-
"loss": 0.
|
| 297 |
-
"num_input_tokens_seen":
|
| 298 |
"step": 290,
|
| 299 |
-
"train_runtime":
|
| 300 |
-
"train_tokens_per_second":
|
| 301 |
},
|
| 302 |
{
|
| 303 |
"epoch": 0.6458557588805167,
|
| 304 |
-
"grad_norm":
|
| 305 |
-
"learning_rate":
|
| 306 |
-
"loss": 0.
|
| 307 |
-
"num_input_tokens_seen":
|
| 308 |
"step": 300,
|
| 309 |
-
"train_runtime":
|
| 310 |
-
"train_tokens_per_second":
|
| 311 |
},
|
| 312 |
{
|
| 313 |
"epoch": 0.667384284176534,
|
| 314 |
-
"grad_norm":
|
| 315 |
-
"learning_rate":
|
| 316 |
-
"loss": 0.
|
| 317 |
-
"num_input_tokens_seen":
|
| 318 |
"step": 310,
|
| 319 |
-
"train_runtime":
|
| 320 |
-
"train_tokens_per_second":
|
| 321 |
},
|
| 322 |
{
|
| 323 |
"epoch": 0.6889128094725512,
|
| 324 |
-
"grad_norm":
|
| 325 |
-
"learning_rate":
|
| 326 |
-
"loss": 0.
|
| 327 |
-
"num_input_tokens_seen":
|
| 328 |
"step": 320,
|
| 329 |
-
"train_runtime":
|
| 330 |
-
"train_tokens_per_second":
|
| 331 |
},
|
| 332 |
{
|
| 333 |
"epoch": 0.7104413347685683,
|
| 334 |
-
"grad_norm":
|
| 335 |
-
"learning_rate":
|
| 336 |
-
"loss": 0.
|
| 337 |
-
"num_input_tokens_seen":
|
| 338 |
"step": 330,
|
| 339 |
-
"train_runtime":
|
| 340 |
-
"train_tokens_per_second":
|
| 341 |
},
|
| 342 |
{
|
| 343 |
"epoch": 0.7319698600645855,
|
| 344 |
-
"grad_norm":
|
| 345 |
-
"learning_rate":
|
| 346 |
-
"loss": 0.
|
| 347 |
-
"num_input_tokens_seen":
|
| 348 |
"step": 340,
|
| 349 |
-
"train_runtime":
|
| 350 |
-
"train_tokens_per_second":
|
| 351 |
},
|
| 352 |
{
|
| 353 |
"epoch": 0.7534983853606028,
|
| 354 |
-
"grad_norm":
|
| 355 |
-
"learning_rate":
|
| 356 |
-
"loss": 0.
|
| 357 |
-
"num_input_tokens_seen":
|
| 358 |
"step": 350,
|
| 359 |
-
"train_runtime":
|
| 360 |
-
"train_tokens_per_second":
|
| 361 |
},
|
| 362 |
{
|
| 363 |
"epoch": 0.77502691065662,
|
| 364 |
-
"grad_norm":
|
| 365 |
-
"learning_rate":
|
| 366 |
-
"loss": 0.
|
| 367 |
-
"num_input_tokens_seen":
|
| 368 |
"step": 360,
|
| 369 |
-
"train_runtime":
|
| 370 |
-
"train_tokens_per_second":
|
| 371 |
},
|
| 372 |
{
|
| 373 |
"epoch": 0.7965554359526372,
|
| 374 |
-
"grad_norm":
|
| 375 |
-
"learning_rate":
|
| 376 |
-
"loss": 0.
|
| 377 |
-
"num_input_tokens_seen":
|
| 378 |
"step": 370,
|
| 379 |
-
"train_runtime":
|
| 380 |
-
"train_tokens_per_second":
|
| 381 |
},
|
| 382 |
{
|
| 383 |
"epoch": 0.8180839612486545,
|
| 384 |
-
"grad_norm":
|
| 385 |
-
"learning_rate":
|
| 386 |
-
"loss": 0.
|
| 387 |
-
"num_input_tokens_seen":
|
| 388 |
"step": 380,
|
| 389 |
-
"train_runtime":
|
| 390 |
-
"train_tokens_per_second":
|
| 391 |
},
|
| 392 |
{
|
| 393 |
"epoch": 0.8396124865446717,
|
| 394 |
-
"grad_norm":
|
| 395 |
-
"learning_rate":
|
| 396 |
-
"loss": 0.
|
| 397 |
-
"num_input_tokens_seen":
|
| 398 |
"step": 390,
|
| 399 |
-
"train_runtime":
|
| 400 |
-
"train_tokens_per_second":
|
| 401 |
},
|
| 402 |
{
|
| 403 |
"epoch": 0.8611410118406889,
|
| 404 |
-
"grad_norm":
|
| 405 |
-
"learning_rate":
|
| 406 |
-
"loss": 0.
|
| 407 |
-
"num_input_tokens_seen":
|
| 408 |
"step": 400,
|
| 409 |
-
"train_runtime":
|
| 410 |
-
"train_tokens_per_second":
|
| 411 |
},
|
| 412 |
{
|
| 413 |
"epoch": 0.8826695371367062,
|
| 414 |
-
"grad_norm":
|
| 415 |
-
"learning_rate":
|
| 416 |
-
"loss": 0.
|
| 417 |
-
"num_input_tokens_seen":
|
| 418 |
"step": 410,
|
| 419 |
-
"train_runtime":
|
| 420 |
-
"train_tokens_per_second":
|
| 421 |
},
|
| 422 |
{
|
| 423 |
"epoch": 0.9041980624327234,
|
| 424 |
-
"grad_norm":
|
| 425 |
-
"learning_rate":
|
| 426 |
-
"loss": 0.
|
| 427 |
-
"num_input_tokens_seen":
|
| 428 |
"step": 420,
|
| 429 |
-
"train_runtime":
|
| 430 |
-
"train_tokens_per_second":
|
| 431 |
},
|
| 432 |
{
|
| 433 |
"epoch": 0.9257265877287406,
|
| 434 |
-
"grad_norm":
|
| 435 |
-
"learning_rate":
|
| 436 |
-
"loss": 0.
|
| 437 |
-
"num_input_tokens_seen":
|
| 438 |
"step": 430,
|
| 439 |
-
"train_runtime":
|
| 440 |
-
"train_tokens_per_second":
|
| 441 |
},
|
| 442 |
{
|
| 443 |
"epoch": 0.9472551130247578,
|
| 444 |
-
"grad_norm":
|
| 445 |
-
"learning_rate":
|
| 446 |
-
"loss": 0.
|
| 447 |
-
"num_input_tokens_seen":
|
| 448 |
"step": 440,
|
| 449 |
-
"train_runtime":
|
| 450 |
-
"train_tokens_per_second":
|
| 451 |
},
|
| 452 |
{
|
| 453 |
"epoch": 0.9687836383207751,
|
| 454 |
-
"grad_norm":
|
| 455 |
-
"learning_rate":
|
| 456 |
-
"loss": 0.
|
| 457 |
-
"num_input_tokens_seen":
|
| 458 |
"step": 450,
|
| 459 |
-
"train_runtime":
|
| 460 |
-
"train_tokens_per_second":
|
| 461 |
},
|
| 462 |
{
|
| 463 |
"epoch": 0.9903121636167922,
|
| 464 |
-
"grad_norm":
|
| 465 |
-
"learning_rate":
|
| 466 |
-
"loss": 0.
|
| 467 |
-
"num_input_tokens_seen":
|
| 468 |
"step": 460,
|
| 469 |
-
"train_runtime":
|
| 470 |
-
"train_tokens_per_second":
|
| 471 |
},
|
| 472 |
{
|
| 473 |
"epoch": 1.0107642626480087,
|
| 474 |
-
"grad_norm":
|
| 475 |
-
"learning_rate":
|
| 476 |
-
"loss": 0.
|
| 477 |
-
"num_input_tokens_seen":
|
| 478 |
"step": 470,
|
| 479 |
-
"train_runtime":
|
| 480 |
-
"train_tokens_per_second":
|
| 481 |
},
|
| 482 |
{
|
| 483 |
"epoch": 1.0322927879440258,
|
| 484 |
-
"grad_norm":
|
| 485 |
-
"learning_rate":
|
| 486 |
-
"loss": 0.
|
| 487 |
-
"num_input_tokens_seen":
|
| 488 |
"step": 480,
|
| 489 |
-
"train_runtime":
|
| 490 |
-
"train_tokens_per_second":
|
| 491 |
},
|
| 492 |
{
|
| 493 |
"epoch": 1.0538213132400431,
|
| 494 |
-
"grad_norm":
|
| 495 |
-
"learning_rate":
|
| 496 |
-
"loss": 0.
|
| 497 |
-
"num_input_tokens_seen":
|
| 498 |
"step": 490,
|
| 499 |
-
"train_runtime":
|
| 500 |
-
"train_tokens_per_second":
|
| 501 |
},
|
| 502 |
{
|
| 503 |
"epoch": 1.0753498385360603,
|
| 504 |
-
"grad_norm":
|
| 505 |
-
"learning_rate":
|
| 506 |
-
"loss": 0.
|
| 507 |
-
"num_input_tokens_seen":
|
| 508 |
"step": 500,
|
| 509 |
-
"train_runtime":
|
| 510 |
-
"train_tokens_per_second":
|
| 511 |
},
|
| 512 |
{
|
| 513 |
"epoch": 1.0968783638320776,
|
| 514 |
-
"grad_norm":
|
| 515 |
-
"learning_rate":
|
| 516 |
-
"loss": 0.
|
| 517 |
-
"num_input_tokens_seen":
|
| 518 |
"step": 510,
|
| 519 |
-
"train_runtime":
|
| 520 |
-
"train_tokens_per_second":
|
| 521 |
},
|
| 522 |
{
|
| 523 |
"epoch": 1.1184068891280947,
|
| 524 |
-
"grad_norm":
|
| 525 |
-
"learning_rate":
|
| 526 |
-
"loss": 0.
|
| 527 |
-
"num_input_tokens_seen":
|
| 528 |
"step": 520,
|
| 529 |
-
"train_runtime":
|
| 530 |
-
"train_tokens_per_second":
|
| 531 |
},
|
| 532 |
{
|
| 533 |
"epoch": 1.1399354144241118,
|
| 534 |
-
"grad_norm":
|
| 535 |
-
"learning_rate":
|
| 536 |
-
"loss": 0.
|
| 537 |
-
"num_input_tokens_seen":
|
| 538 |
"step": 530,
|
| 539 |
-
"train_runtime":
|
| 540 |
-
"train_tokens_per_second":
|
| 541 |
},
|
| 542 |
{
|
| 543 |
"epoch": 1.1614639397201292,
|
| 544 |
-
"grad_norm":
|
| 545 |
-
"learning_rate":
|
| 546 |
-
"loss": 0.
|
| 547 |
-
"num_input_tokens_seen":
|
| 548 |
"step": 540,
|
| 549 |
-
"train_runtime":
|
| 550 |
-
"train_tokens_per_second":
|
| 551 |
},
|
| 552 |
{
|
| 553 |
"epoch": 1.1829924650161463,
|
| 554 |
-
"grad_norm":
|
| 555 |
-
"learning_rate":
|
| 556 |
-
"loss": 0.
|
| 557 |
-
"num_input_tokens_seen":
|
| 558 |
"step": 550,
|
| 559 |
-
"train_runtime":
|
| 560 |
-
"train_tokens_per_second":
|
| 561 |
},
|
| 562 |
{
|
| 563 |
"epoch": 1.2045209903121636,
|
| 564 |
-
"grad_norm":
|
| 565 |
-
"learning_rate":
|
| 566 |
-
"loss": 0.
|
| 567 |
-
"num_input_tokens_seen":
|
| 568 |
"step": 560,
|
| 569 |
-
"train_runtime":
|
| 570 |
-
"train_tokens_per_second":
|
| 571 |
},
|
| 572 |
{
|
| 573 |
"epoch": 1.2260495156081808,
|
| 574 |
-
"grad_norm":
|
| 575 |
-
"learning_rate":
|
| 576 |
-
"loss": 0.
|
| 577 |
-
"num_input_tokens_seen":
|
| 578 |
"step": 570,
|
| 579 |
-
"train_runtime":
|
| 580 |
-
"train_tokens_per_second":
|
| 581 |
},
|
| 582 |
{
|
| 583 |
"epoch": 1.247578040904198,
|
| 584 |
-
"grad_norm":
|
| 585 |
-
"learning_rate":
|
| 586 |
-
"loss": 0.
|
| 587 |
-
"num_input_tokens_seen":
|
| 588 |
"step": 580,
|
| 589 |
-
"train_runtime":
|
| 590 |
-
"train_tokens_per_second":
|
| 591 |
},
|
| 592 |
{
|
| 593 |
"epoch": 1.2691065662002152,
|
| 594 |
-
"grad_norm":
|
| 595 |
-
"learning_rate":
|
| 596 |
-
"loss": 0.
|
| 597 |
-
"num_input_tokens_seen":
|
| 598 |
"step": 590,
|
| 599 |
-
"train_runtime":
|
| 600 |
-
"train_tokens_per_second":
|
| 601 |
},
|
| 602 |
{
|
| 603 |
"epoch": 1.2906350914962326,
|
| 604 |
-
"grad_norm":
|
| 605 |
-
"learning_rate":
|
| 606 |
-
"loss": 0.
|
| 607 |
-
"num_input_tokens_seen":
|
| 608 |
"step": 600,
|
| 609 |
-
"train_runtime":
|
| 610 |
-
"train_tokens_per_second":
|
| 611 |
},
|
| 612 |
{
|
| 613 |
"epoch": 1.3121636167922497,
|
| 614 |
-
"grad_norm":
|
| 615 |
-
"learning_rate":
|
| 616 |
-
"loss": 0.
|
| 617 |
-
"num_input_tokens_seen":
|
| 618 |
"step": 610,
|
| 619 |
-
"train_runtime":
|
| 620 |
-
"train_tokens_per_second":
|
| 621 |
},
|
| 622 |
{
|
| 623 |
"epoch": 1.333692142088267,
|
| 624 |
-
"grad_norm":
|
| 625 |
-
"learning_rate":
|
| 626 |
-
"loss": 0.
|
| 627 |
-
"num_input_tokens_seen":
|
| 628 |
"step": 620,
|
| 629 |
-
"train_runtime":
|
| 630 |
-
"train_tokens_per_second":
|
| 631 |
},
|
| 632 |
{
|
| 633 |
"epoch": 1.3552206673842842,
|
| 634 |
-
"grad_norm":
|
| 635 |
-
"learning_rate":
|
| 636 |
-
"loss": 0.
|
| 637 |
-
"num_input_tokens_seen":
|
| 638 |
"step": 630,
|
| 639 |
-
"train_runtime":
|
| 640 |
-
"train_tokens_per_second":
|
| 641 |
},
|
| 642 |
{
|
| 643 |
"epoch": 1.3767491926803013,
|
| 644 |
-
"grad_norm":
|
| 645 |
-
"learning_rate":
|
| 646 |
-
"loss": 0.
|
| 647 |
-
"num_input_tokens_seen":
|
| 648 |
"step": 640,
|
| 649 |
-
"train_runtime":
|
| 650 |
-
"train_tokens_per_second":
|
| 651 |
},
|
| 652 |
{
|
| 653 |
"epoch": 1.3982777179763186,
|
| 654 |
-
"grad_norm":
|
| 655 |
-
"learning_rate":
|
| 656 |
-
"loss": 0.
|
| 657 |
-
"num_input_tokens_seen":
|
| 658 |
"step": 650,
|
| 659 |
-
"train_runtime":
|
| 660 |
-
"train_tokens_per_second":
|
| 661 |
},
|
| 662 |
{
|
| 663 |
"epoch": 1.419806243272336,
|
| 664 |
-
"grad_norm":
|
| 665 |
-
"learning_rate":
|
| 666 |
-
"loss": 0.
|
| 667 |
-
"num_input_tokens_seen":
|
| 668 |
"step": 660,
|
| 669 |
-
"train_runtime":
|
| 670 |
-
"train_tokens_per_second":
|
| 671 |
},
|
| 672 |
{
|
| 673 |
"epoch": 1.441334768568353,
|
| 674 |
-
"grad_norm":
|
| 675 |
-
"learning_rate":
|
| 676 |
-
"loss": 0.
|
| 677 |
-
"num_input_tokens_seen":
|
| 678 |
"step": 670,
|
| 679 |
-
"train_runtime":
|
| 680 |
-
"train_tokens_per_second":
|
| 681 |
},
|
| 682 |
{
|
| 683 |
"epoch": 1.4628632938643702,
|
| 684 |
-
"grad_norm":
|
| 685 |
-
"learning_rate":
|
| 686 |
-
"loss": 0.
|
| 687 |
-
"num_input_tokens_seen":
|
| 688 |
"step": 680,
|
| 689 |
-
"train_runtime":
|
| 690 |
-
"train_tokens_per_second":
|
| 691 |
},
|
| 692 |
{
|
| 693 |
"epoch": 1.4843918191603875,
|
| 694 |
-
"grad_norm":
|
| 695 |
-
"learning_rate":
|
| 696 |
-
"loss": 0.
|
| 697 |
-
"num_input_tokens_seen":
|
| 698 |
"step": 690,
|
| 699 |
-
"train_runtime":
|
| 700 |
-
"train_tokens_per_second":
|
| 701 |
},
|
| 702 |
{
|
| 703 |
"epoch": 1.5059203444564049,
|
| 704 |
-
"grad_norm":
|
| 705 |
-
"learning_rate":
|
| 706 |
-
"loss": 0.
|
| 707 |
-
"num_input_tokens_seen":
|
| 708 |
"step": 700,
|
| 709 |
-
"train_runtime":
|
| 710 |
-
"train_tokens_per_second":
|
| 711 |
},
|
| 712 |
{
|
| 713 |
"epoch": 1.527448869752422,
|
| 714 |
-
"grad_norm":
|
| 715 |
-
"learning_rate":
|
| 716 |
-
"loss": 0.
|
| 717 |
-
"num_input_tokens_seen":
|
| 718 |
"step": 710,
|
| 719 |
-
"train_runtime":
|
| 720 |
-
"train_tokens_per_second":
|
| 721 |
},
|
| 722 |
{
|
| 723 |
"epoch": 1.5489773950484391,
|
| 724 |
-
"grad_norm":
|
| 725 |
-
"learning_rate":
|
| 726 |
-
"loss": 0.
|
| 727 |
-
"num_input_tokens_seen":
|
| 728 |
"step": 720,
|
| 729 |
-
"train_runtime":
|
| 730 |
-
"train_tokens_per_second":
|
| 731 |
},
|
| 732 |
{
|
| 733 |
"epoch": 1.5705059203444565,
|
| 734 |
-
"grad_norm":
|
| 735 |
-
"learning_rate":
|
| 736 |
-
"loss": 0.
|
| 737 |
-
"num_input_tokens_seen":
|
| 738 |
"step": 730,
|
| 739 |
-
"train_runtime":
|
| 740 |
-
"train_tokens_per_second":
|
| 741 |
},
|
| 742 |
{
|
| 743 |
"epoch": 1.5920344456404736,
|
| 744 |
-
"grad_norm":
|
| 745 |
-
"learning_rate":
|
| 746 |
-
"loss": 0.
|
| 747 |
-
"num_input_tokens_seen":
|
| 748 |
"step": 740,
|
| 749 |
-
"train_runtime":
|
| 750 |
-
"train_tokens_per_second":
|
| 751 |
},
|
| 752 |
{
|
| 753 |
"epoch": 1.6135629709364907,
|
| 754 |
-
"grad_norm":
|
| 755 |
-
"learning_rate":
|
| 756 |
-
"loss": 0.
|
| 757 |
-
"num_input_tokens_seen":
|
| 758 |
"step": 750,
|
| 759 |
-
"train_runtime":
|
| 760 |
-
"train_tokens_per_second":
|
| 761 |
},
|
| 762 |
{
|
| 763 |
"epoch": 1.635091496232508,
|
| 764 |
-
"grad_norm":
|
| 765 |
-
"learning_rate":
|
| 766 |
-
"loss": 0.
|
| 767 |
-
"num_input_tokens_seen":
|
| 768 |
"step": 760,
|
| 769 |
-
"train_runtime":
|
| 770 |
-
"train_tokens_per_second":
|
| 771 |
},
|
| 772 |
{
|
| 773 |
"epoch": 1.6566200215285254,
|
| 774 |
-
"grad_norm":
|
| 775 |
-
"learning_rate":
|
| 776 |
-
"loss": 0.
|
| 777 |
-
"num_input_tokens_seen":
|
| 778 |
"step": 770,
|
| 779 |
-
"train_runtime":
|
| 780 |
-
"train_tokens_per_second":
|
| 781 |
},
|
| 782 |
{
|
| 783 |
"epoch": 1.6781485468245425,
|
| 784 |
-
"grad_norm":
|
| 785 |
-
"learning_rate":
|
| 786 |
-
"loss": 0.
|
| 787 |
-
"num_input_tokens_seen":
|
| 788 |
"step": 780,
|
| 789 |
-
"train_runtime":
|
| 790 |
-
"train_tokens_per_second":
|
| 791 |
},
|
| 792 |
{
|
| 793 |
"epoch": 1.6996770721205596,
|
| 794 |
-
"grad_norm":
|
| 795 |
-
"learning_rate":
|
| 796 |
-
"loss": 0.
|
| 797 |
-
"num_input_tokens_seen":
|
| 798 |
"step": 790,
|
| 799 |
-
"train_runtime":
|
| 800 |
-
"train_tokens_per_second":
|
| 801 |
},
|
| 802 |
{
|
| 803 |
"epoch": 1.721205597416577,
|
| 804 |
-
"grad_norm":
|
| 805 |
-
"learning_rate":
|
| 806 |
-
"loss": 0.
|
| 807 |
-
"num_input_tokens_seen":
|
| 808 |
"step": 800,
|
| 809 |
-
"train_runtime":
|
| 810 |
-
"train_tokens_per_second":
|
| 811 |
},
|
| 812 |
{
|
| 813 |
"epoch": 1.7427341227125943,
|
| 814 |
-
"grad_norm":
|
| 815 |
-
"learning_rate":
|
| 816 |
-
"loss": 0.
|
| 817 |
-
"num_input_tokens_seen":
|
| 818 |
"step": 810,
|
| 819 |
-
"train_runtime":
|
| 820 |
-
"train_tokens_per_second":
|
| 821 |
},
|
| 822 |
{
|
| 823 |
"epoch": 1.7642626480086114,
|
| 824 |
-
"grad_norm":
|
| 825 |
-
"learning_rate":
|
| 826 |
-
"loss": 0.
|
| 827 |
-
"num_input_tokens_seen":
|
| 828 |
"step": 820,
|
| 829 |
-
"train_runtime":
|
| 830 |
-
"train_tokens_per_second":
|
| 831 |
},
|
| 832 |
{
|
| 833 |
"epoch": 1.7857911733046286,
|
| 834 |
-
"grad_norm":
|
| 835 |
-
"learning_rate":
|
| 836 |
-
"loss": 0.
|
| 837 |
-
"num_input_tokens_seen":
|
| 838 |
"step": 830,
|
| 839 |
-
"train_runtime":
|
| 840 |
-
"train_tokens_per_second":
|
| 841 |
},
|
| 842 |
{
|
| 843 |
"epoch": 1.807319698600646,
|
| 844 |
-
"grad_norm":
|
| 845 |
-
"learning_rate":
|
| 846 |
-
"loss": 0.
|
| 847 |
-
"num_input_tokens_seen":
|
| 848 |
"step": 840,
|
| 849 |
-
"train_runtime":
|
| 850 |
-
"train_tokens_per_second":
|
| 851 |
},
|
| 852 |
{
|
| 853 |
"epoch": 1.8288482238966632,
|
| 854 |
-
"grad_norm":
|
| 855 |
-
"learning_rate":
|
| 856 |
-
"loss": 0.
|
| 857 |
-
"num_input_tokens_seen":
|
| 858 |
"step": 850,
|
| 859 |
-
"train_runtime":
|
| 860 |
-
"train_tokens_per_second":
|
| 861 |
},
|
| 862 |
{
|
| 863 |
"epoch": 1.8503767491926801,
|
| 864 |
-
"grad_norm":
|
| 865 |
-
"learning_rate":
|
| 866 |
-
"loss": 0.
|
| 867 |
-
"num_input_tokens_seen":
|
| 868 |
"step": 860,
|
| 869 |
-
"train_runtime":
|
| 870 |
-
"train_tokens_per_second":
|
| 871 |
},
|
| 872 |
{
|
| 873 |
"epoch": 1.8719052744886975,
|
| 874 |
-
"grad_norm":
|
| 875 |
-
"learning_rate":
|
| 876 |
-
"loss": 0.
|
| 877 |
-
"num_input_tokens_seen":
|
| 878 |
"step": 870,
|
| 879 |
-
"train_runtime":
|
| 880 |
-
"train_tokens_per_second":
|
| 881 |
},
|
| 882 |
{
|
| 883 |
"epoch": 1.8934337997847148,
|
| 884 |
-
"grad_norm":
|
| 885 |
-
"learning_rate":
|
| 886 |
-
"loss": 0.
|
| 887 |
-
"num_input_tokens_seen":
|
| 888 |
"step": 880,
|
| 889 |
-
"train_runtime":
|
| 890 |
-
"train_tokens_per_second":
|
| 891 |
},
|
| 892 |
{
|
| 893 |
"epoch": 1.914962325080732,
|
| 894 |
-
"grad_norm":
|
| 895 |
-
"learning_rate":
|
| 896 |
-
"loss": 0.
|
| 897 |
-
"num_input_tokens_seen":
|
| 898 |
"step": 890,
|
| 899 |
-
"train_runtime":
|
| 900 |
-
"train_tokens_per_second":
|
| 901 |
},
|
| 902 |
{
|
| 903 |
"epoch": 1.936490850376749,
|
| 904 |
-
"grad_norm":
|
| 905 |
-
"learning_rate":
|
| 906 |
-
"loss": 0.
|
| 907 |
-
"num_input_tokens_seen":
|
| 908 |
"step": 900,
|
| 909 |
-
"train_runtime":
|
| 910 |
-
"train_tokens_per_second":
|
| 911 |
},
|
| 912 |
{
|
| 913 |
"epoch": 1.9580193756727664,
|
| 914 |
-
"grad_norm":
|
| 915 |
-
"learning_rate":
|
| 916 |
-
"loss": 0.
|
| 917 |
-
"num_input_tokens_seen":
|
| 918 |
"step": 910,
|
| 919 |
-
"train_runtime":
|
| 920 |
-
"train_tokens_per_second":
|
| 921 |
},
|
| 922 |
{
|
| 923 |
"epoch": 1.9795479009687837,
|
| 924 |
-
"grad_norm":
|
| 925 |
-
"learning_rate":
|
| 926 |
-
"loss": 0.
|
| 927 |
-
"num_input_tokens_seen":
|
| 928 |
"step": 920,
|
| 929 |
-
"train_runtime":
|
| 930 |
-
"train_tokens_per_second":
|
| 931 |
},
|
| 932 |
{
|
| 933 |
"epoch": 2.0,
|
| 934 |
-
"grad_norm":
|
| 935 |
-
"learning_rate":
|
| 936 |
-
"loss": 0.
|
| 937 |
-
"num_input_tokens_seen":
|
| 938 |
"step": 930,
|
| 939 |
-
"train_runtime":
|
| 940 |
-
"train_tokens_per_second":
|
| 941 |
},
|
| 942 |
{
|
| 943 |
"epoch": 2.0215285252960173,
|
| 944 |
-
"grad_norm":
|
| 945 |
-
"learning_rate":
|
| 946 |
-
"loss": 0.
|
| 947 |
-
"num_input_tokens_seen":
|
| 948 |
"step": 940,
|
| 949 |
-
"train_runtime":
|
| 950 |
-
"train_tokens_per_second":
|
| 951 |
},
|
| 952 |
{
|
| 953 |
"epoch": 2.0430570505920342,
|
| 954 |
-
"grad_norm":
|
| 955 |
-
"learning_rate":
|
| 956 |
-
"loss": 0.
|
| 957 |
-
"num_input_tokens_seen":
|
| 958 |
"step": 950,
|
| 959 |
-
"train_runtime":
|
| 960 |
-
"train_tokens_per_second":
|
| 961 |
},
|
| 962 |
{
|
| 963 |
"epoch": 2.0645855758880516,
|
| 964 |
-
"grad_norm":
|
| 965 |
-
"learning_rate":
|
| 966 |
-
"loss": 0.
|
| 967 |
-
"num_input_tokens_seen":
|
| 968 |
"step": 960,
|
| 969 |
-
"train_runtime":
|
| 970 |
-
"train_tokens_per_second":
|
| 971 |
},
|
| 972 |
{
|
| 973 |
"epoch": 2.086114101184069,
|
| 974 |
-
"grad_norm":
|
| 975 |
-
"learning_rate":
|
| 976 |
-
"loss": 0.
|
| 977 |
-
"num_input_tokens_seen":
|
| 978 |
"step": 970,
|
| 979 |
-
"train_runtime":
|
| 980 |
-
"train_tokens_per_second":
|
| 981 |
},
|
| 982 |
{
|
| 983 |
"epoch": 2.1076426264800863,
|
| 984 |
-
"grad_norm":
|
| 985 |
-
"learning_rate":
|
| 986 |
-
"loss": 0.
|
| 987 |
-
"num_input_tokens_seen":
|
| 988 |
"step": 980,
|
| 989 |
-
"train_runtime":
|
| 990 |
-
"train_tokens_per_second":
|
| 991 |
},
|
| 992 |
{
|
| 993 |
"epoch": 2.129171151776103,
|
| 994 |
-
"grad_norm":
|
| 995 |
-
"learning_rate":
|
| 996 |
-
"loss": 0.
|
| 997 |
-
"num_input_tokens_seen":
|
| 998 |
"step": 990,
|
| 999 |
-
"train_runtime":
|
| 1000 |
-
"train_tokens_per_second":
|
| 1001 |
},
|
| 1002 |
{
|
| 1003 |
"epoch": 2.1506996770721205,
|
| 1004 |
-
"grad_norm":
|
| 1005 |
-
"learning_rate":
|
| 1006 |
-
"loss": 0.
|
| 1007 |
-
"num_input_tokens_seen":
|
| 1008 |
"step": 1000,
|
| 1009 |
-
"train_runtime":
|
| 1010 |
-
"train_tokens_per_second":
|
| 1011 |
},
|
| 1012 |
{
|
| 1013 |
"epoch": 2.172228202368138,
|
| 1014 |
-
"grad_norm":
|
| 1015 |
-
"learning_rate":
|
| 1016 |
-
"loss": 0.
|
| 1017 |
-
"num_input_tokens_seen":
|
| 1018 |
"step": 1010,
|
| 1019 |
-
"train_runtime":
|
| 1020 |
-
"train_tokens_per_second":
|
| 1021 |
},
|
| 1022 |
{
|
| 1023 |
"epoch": 2.193756727664155,
|
| 1024 |
-
"grad_norm":
|
| 1025 |
-
"learning_rate":
|
| 1026 |
-
"loss": 0.
|
| 1027 |
-
"num_input_tokens_seen":
|
| 1028 |
"step": 1020,
|
| 1029 |
-
"train_runtime":
|
| 1030 |
-
"train_tokens_per_second":
|
| 1031 |
},
|
| 1032 |
{
|
| 1033 |
"epoch": 2.215285252960172,
|
| 1034 |
-
"grad_norm":
|
| 1035 |
-
"learning_rate":
|
| 1036 |
-
"loss": 0.
|
| 1037 |
-
"num_input_tokens_seen":
|
| 1038 |
"step": 1030,
|
| 1039 |
-
"train_runtime":
|
| 1040 |
-
"train_tokens_per_second":
|
| 1041 |
},
|
| 1042 |
{
|
| 1043 |
"epoch": 2.2368137782561894,
|
| 1044 |
-
"grad_norm":
|
| 1045 |
-
"learning_rate":
|
| 1046 |
-
"loss": 0.
|
| 1047 |
-
"num_input_tokens_seen":
|
| 1048 |
"step": 1040,
|
| 1049 |
-
"train_runtime":
|
| 1050 |
-
"train_tokens_per_second":
|
| 1051 |
},
|
| 1052 |
{
|
| 1053 |
"epoch": 2.2583423035522068,
|
| 1054 |
-
"grad_norm":
|
| 1055 |
-
"learning_rate":
|
| 1056 |
-
"loss": 0.
|
| 1057 |
-
"num_input_tokens_seen":
|
| 1058 |
"step": 1050,
|
| 1059 |
-
"train_runtime":
|
| 1060 |
-
"train_tokens_per_second":
|
| 1061 |
},
|
| 1062 |
{
|
| 1063 |
"epoch": 2.2798708288482237,
|
| 1064 |
-
"grad_norm":
|
| 1065 |
-
"learning_rate":
|
| 1066 |
-
"loss": 0.
|
| 1067 |
-
"num_input_tokens_seen":
|
| 1068 |
"step": 1060,
|
| 1069 |
-
"train_runtime":
|
| 1070 |
-
"train_tokens_per_second":
|
| 1071 |
},
|
| 1072 |
{
|
| 1073 |
"epoch": 2.301399354144241,
|
| 1074 |
-
"grad_norm":
|
| 1075 |
-
"learning_rate":
|
| 1076 |
-
"loss": 0.
|
| 1077 |
-
"num_input_tokens_seen":
|
| 1078 |
"step": 1070,
|
| 1079 |
-
"train_runtime":
|
| 1080 |
-
"train_tokens_per_second":
|
| 1081 |
},
|
| 1082 |
{
|
| 1083 |
"epoch": 2.3229278794402584,
|
| 1084 |
-
"grad_norm":
|
| 1085 |
-
"learning_rate":
|
| 1086 |
-
"loss": 0.
|
| 1087 |
-
"num_input_tokens_seen":
|
| 1088 |
"step": 1080,
|
| 1089 |
-
"train_runtime":
|
| 1090 |
-
"train_tokens_per_second":
|
| 1091 |
},
|
| 1092 |
{
|
| 1093 |
"epoch": 2.3444564047362757,
|
| 1094 |
-
"grad_norm":
|
| 1095 |
-
"learning_rate":
|
| 1096 |
-
"loss": 0.
|
| 1097 |
-
"num_input_tokens_seen":
|
| 1098 |
"step": 1090,
|
| 1099 |
-
"train_runtime":
|
| 1100 |
-
"train_tokens_per_second":
|
| 1101 |
},
|
| 1102 |
{
|
| 1103 |
"epoch": 2.3659849300322926,
|
| 1104 |
-
"grad_norm":
|
| 1105 |
-
"learning_rate":
|
| 1106 |
-
"loss": 0.
|
| 1107 |
-
"num_input_tokens_seen":
|
| 1108 |
"step": 1100,
|
| 1109 |
-
"train_runtime":
|
| 1110 |
-
"train_tokens_per_second":
|
| 1111 |
},
|
| 1112 |
{
|
| 1113 |
"epoch": 2.38751345532831,
|
| 1114 |
-
"grad_norm":
|
| 1115 |
-
"learning_rate":
|
| 1116 |
-
"loss": 0.
|
| 1117 |
-
"num_input_tokens_seen":
|
| 1118 |
"step": 1110,
|
| 1119 |
-
"train_runtime":
|
| 1120 |
-
"train_tokens_per_second":
|
| 1121 |
},
|
| 1122 |
{
|
| 1123 |
"epoch": 2.4090419806243273,
|
| 1124 |
-
"grad_norm":
|
| 1125 |
-
"learning_rate":
|
| 1126 |
-
"loss": 0.
|
| 1127 |
-
"num_input_tokens_seen":
|
| 1128 |
"step": 1120,
|
| 1129 |
-
"train_runtime":
|
| 1130 |
-
"train_tokens_per_second":
|
| 1131 |
},
|
| 1132 |
{
|
| 1133 |
"epoch": 2.4305705059203446,
|
| 1134 |
-
"grad_norm":
|
| 1135 |
-
"learning_rate":
|
| 1136 |
-
"loss": 0.
|
| 1137 |
-
"num_input_tokens_seen":
|
| 1138 |
"step": 1130,
|
| 1139 |
-
"train_runtime":
|
| 1140 |
-
"train_tokens_per_second":
|
| 1141 |
},
|
| 1142 |
{
|
| 1143 |
"epoch": 2.4520990312163615,
|
| 1144 |
-
"grad_norm":
|
| 1145 |
-
"learning_rate":
|
| 1146 |
-
"loss": 0.
|
| 1147 |
-
"num_input_tokens_seen":
|
| 1148 |
"step": 1140,
|
| 1149 |
-
"train_runtime":
|
| 1150 |
-
"train_tokens_per_second":
|
| 1151 |
},
|
| 1152 |
{
|
| 1153 |
"epoch": 2.473627556512379,
|
| 1154 |
-
"grad_norm":
|
| 1155 |
-
"learning_rate":
|
| 1156 |
-
"loss": 0.
|
| 1157 |
-
"num_input_tokens_seen":
|
| 1158 |
"step": 1150,
|
| 1159 |
-
"train_runtime":
|
| 1160 |
-
"train_tokens_per_second":
|
| 1161 |
},
|
| 1162 |
{
|
| 1163 |
"epoch": 2.495156081808396,
|
| 1164 |
-
"grad_norm":
|
| 1165 |
-
"learning_rate":
|
| 1166 |
-
"loss": 0.
|
| 1167 |
-
"num_input_tokens_seen":
|
| 1168 |
"step": 1160,
|
| 1169 |
-
"train_runtime":
|
| 1170 |
-
"train_tokens_per_second":
|
| 1171 |
},
|
| 1172 |
{
|
| 1173 |
"epoch": 2.5166846071044136,
|
| 1174 |
-
"grad_norm":
|
| 1175 |
-
"learning_rate":
|
| 1176 |
-
"loss": 0.
|
| 1177 |
-
"num_input_tokens_seen":
|
| 1178 |
"step": 1170,
|
| 1179 |
-
"train_runtime":
|
| 1180 |
-
"train_tokens_per_second":
|
| 1181 |
},
|
| 1182 |
{
|
| 1183 |
"epoch": 2.5382131324004304,
|
| 1184 |
-
"grad_norm":
|
| 1185 |
-
"learning_rate":
|
| 1186 |
-
"loss": 0.
|
| 1187 |
-
"num_input_tokens_seen":
|
| 1188 |
"step": 1180,
|
| 1189 |
-
"train_runtime":
|
| 1190 |
-
"train_tokens_per_second":
|
| 1191 |
},
|
| 1192 |
{
|
| 1193 |
"epoch": 2.559741657696448,
|
| 1194 |
-
"grad_norm":
|
| 1195 |
-
"learning_rate":
|
| 1196 |
-
"loss": 0.
|
| 1197 |
-
"num_input_tokens_seen":
|
| 1198 |
"step": 1190,
|
| 1199 |
-
"train_runtime":
|
| 1200 |
-
"train_tokens_per_second":
|
| 1201 |
},
|
| 1202 |
{
|
| 1203 |
"epoch": 2.581270182992465,
|
| 1204 |
-
"grad_norm":
|
| 1205 |
-
"learning_rate":
|
| 1206 |
-
"loss": 0.
|
| 1207 |
-
"num_input_tokens_seen":
|
| 1208 |
"step": 1200,
|
| 1209 |
-
"train_runtime":
|
| 1210 |
-
"train_tokens_per_second":
|
| 1211 |
},
|
| 1212 |
{
|
| 1213 |
"epoch": 2.602798708288482,
|
| 1214 |
-
"grad_norm":
|
| 1215 |
-
"learning_rate":
|
| 1216 |
-
"loss": 0.
|
| 1217 |
-
"num_input_tokens_seen":
|
| 1218 |
"step": 1210,
|
| 1219 |
-
"train_runtime":
|
| 1220 |
-
"train_tokens_per_second":
|
| 1221 |
},
|
| 1222 |
{
|
| 1223 |
"epoch": 2.6243272335844994,
|
| 1224 |
-
"grad_norm":
|
| 1225 |
-
"learning_rate":
|
| 1226 |
-
"loss": 0.
|
| 1227 |
-
"num_input_tokens_seen":
|
| 1228 |
"step": 1220,
|
| 1229 |
-
"train_runtime":
|
| 1230 |
-
"train_tokens_per_second":
|
| 1231 |
},
|
| 1232 |
{
|
| 1233 |
"epoch": 2.6458557588805167,
|
| 1234 |
-
"grad_norm":
|
| 1235 |
-
"learning_rate":
|
| 1236 |
-
"loss": 0.
|
| 1237 |
-
"num_input_tokens_seen":
|
| 1238 |
"step": 1230,
|
| 1239 |
-
"train_runtime":
|
| 1240 |
-
"train_tokens_per_second":
|
| 1241 |
},
|
| 1242 |
{
|
| 1243 |
"epoch": 2.667384284176534,
|
| 1244 |
-
"grad_norm":
|
| 1245 |
-
"learning_rate":
|
| 1246 |
-
"loss": 0.
|
| 1247 |
-
"num_input_tokens_seen":
|
| 1248 |
"step": 1240,
|
| 1249 |
-
"train_runtime":
|
| 1250 |
-
"train_tokens_per_second":
|
| 1251 |
},
|
| 1252 |
{
|
| 1253 |
"epoch": 2.6889128094725514,
|
| 1254 |
-
"grad_norm":
|
| 1255 |
-
"learning_rate":
|
| 1256 |
-
"loss": 0.
|
| 1257 |
-
"num_input_tokens_seen":
|
| 1258 |
"step": 1250,
|
| 1259 |
-
"train_runtime":
|
| 1260 |
-
"train_tokens_per_second":
|
| 1261 |
},
|
| 1262 |
{
|
| 1263 |
"epoch": 2.7104413347685683,
|
| 1264 |
-
"grad_norm":
|
| 1265 |
-
"learning_rate":
|
| 1266 |
-
"loss": 0.
|
| 1267 |
-
"num_input_tokens_seen":
|
| 1268 |
"step": 1260,
|
| 1269 |
-
"train_runtime":
|
| 1270 |
-
"train_tokens_per_second":
|
| 1271 |
},
|
| 1272 |
{
|
| 1273 |
"epoch": 2.7319698600645856,
|
| 1274 |
-
"grad_norm":
|
| 1275 |
-
"learning_rate":
|
| 1276 |
-
"loss": 0.
|
| 1277 |
-
"num_input_tokens_seen":
|
| 1278 |
"step": 1270,
|
| 1279 |
-
"train_runtime":
|
| 1280 |
-
"train_tokens_per_second":
|
| 1281 |
},
|
| 1282 |
{
|
| 1283 |
"epoch": 2.7534983853606025,
|
| 1284 |
-
"grad_norm":
|
| 1285 |
-
"learning_rate":
|
| 1286 |
-
"loss": 0.
|
| 1287 |
-
"num_input_tokens_seen":
|
| 1288 |
"step": 1280,
|
| 1289 |
-
"train_runtime":
|
| 1290 |
-
"train_tokens_per_second":
|
| 1291 |
},
|
| 1292 |
{
|
| 1293 |
"epoch": 2.77502691065662,
|
| 1294 |
-
"grad_norm":
|
| 1295 |
-
"learning_rate":
|
| 1296 |
-
"loss": 0.
|
| 1297 |
-
"num_input_tokens_seen":
|
| 1298 |
"step": 1290,
|
| 1299 |
-
"train_runtime":
|
| 1300 |
-
"train_tokens_per_second":
|
| 1301 |
},
|
| 1302 |
{
|
| 1303 |
"epoch": 2.7965554359526372,
|
| 1304 |
-
"grad_norm":
|
| 1305 |
-
"learning_rate":
|
| 1306 |
-
"loss": 0.
|
| 1307 |
-
"num_input_tokens_seen":
|
| 1308 |
"step": 1300,
|
| 1309 |
-
"train_runtime":
|
| 1310 |
-
"train_tokens_per_second":
|
| 1311 |
},
|
| 1312 |
{
|
| 1313 |
"epoch": 2.8180839612486546,
|
| 1314 |
-
"grad_norm":
|
| 1315 |
-
"learning_rate":
|
| 1316 |
-
"loss": 0.
|
| 1317 |
-
"num_input_tokens_seen":
|
| 1318 |
"step": 1310,
|
| 1319 |
-
"train_runtime":
|
| 1320 |
-
"train_tokens_per_second":
|
| 1321 |
},
|
| 1322 |
{
|
| 1323 |
"epoch": 2.839612486544672,
|
| 1324 |
-
"grad_norm":
|
| 1325 |
-
"learning_rate":
|
| 1326 |
-
"loss": 0.
|
| 1327 |
-
"num_input_tokens_seen":
|
| 1328 |
"step": 1320,
|
| 1329 |
-
"train_runtime":
|
| 1330 |
-
"train_tokens_per_second":
|
| 1331 |
},
|
| 1332 |
{
|
| 1333 |
"epoch": 2.861141011840689,
|
| 1334 |
-
"grad_norm":
|
| 1335 |
-
"learning_rate":
|
| 1336 |
-
"loss": 0.
|
| 1337 |
-
"num_input_tokens_seen":
|
| 1338 |
"step": 1330,
|
| 1339 |
-
"train_runtime":
|
| 1340 |
-
"train_tokens_per_second":
|
| 1341 |
},
|
| 1342 |
{
|
| 1343 |
"epoch": 2.882669537136706,
|
| 1344 |
-
"grad_norm":
|
| 1345 |
-
"learning_rate":
|
| 1346 |
-
"loss": 0.
|
| 1347 |
-
"num_input_tokens_seen":
|
| 1348 |
"step": 1340,
|
| 1349 |
-
"train_runtime":
|
| 1350 |
-
"train_tokens_per_second":
|
| 1351 |
},
|
| 1352 |
{
|
| 1353 |
"epoch": 2.9041980624327235,
|
| 1354 |
-
"grad_norm":
|
| 1355 |
-
"learning_rate":
|
| 1356 |
-
"loss": 0.
|
| 1357 |
-
"num_input_tokens_seen":
|
| 1358 |
"step": 1350,
|
| 1359 |
-
"train_runtime":
|
| 1360 |
-
"train_tokens_per_second":
|
| 1361 |
},
|
| 1362 |
{
|
| 1363 |
"epoch": 2.9257265877287404,
|
| 1364 |
-
"grad_norm":
|
| 1365 |
-
"learning_rate":
|
| 1366 |
-
"loss": 0.
|
| 1367 |
-
"num_input_tokens_seen":
|
| 1368 |
"step": 1360,
|
| 1369 |
-
"train_runtime":
|
| 1370 |
-
"train_tokens_per_second":
|
| 1371 |
},
|
| 1372 |
{
|
| 1373 |
"epoch": 2.9472551130247577,
|
| 1374 |
-
"grad_norm":
|
| 1375 |
-
"learning_rate":
|
| 1376 |
-
"loss": 0.
|
| 1377 |
-
"num_input_tokens_seen":
|
| 1378 |
"step": 1370,
|
| 1379 |
-
"train_runtime":
|
| 1380 |
-
"train_tokens_per_second":
|
| 1381 |
},
|
| 1382 |
{
|
| 1383 |
"epoch": 2.968783638320775,
|
| 1384 |
-
"grad_norm":
|
| 1385 |
-
"learning_rate":
|
| 1386 |
-
"loss": 0.
|
| 1387 |
-
"num_input_tokens_seen":
|
| 1388 |
"step": 1380,
|
| 1389 |
-
"train_runtime":
|
| 1390 |
-
"train_tokens_per_second":
|
| 1391 |
},
|
| 1392 |
{
|
| 1393 |
"epoch": 2.9903121636167924,
|
| 1394 |
-
"grad_norm":
|
| 1395 |
-
"learning_rate":
|
| 1396 |
-
"loss": 0.
|
| 1397 |
-
"num_input_tokens_seen":
|
| 1398 |
"step": 1390,
|
| 1399 |
-
"train_runtime":
|
| 1400 |
-
"train_tokens_per_second":
|
| 1401 |
},
|
| 1402 |
{
|
| 1403 |
"epoch": 3.0,
|
| 1404 |
-
"num_input_tokens_seen":
|
| 1405 |
"step": 1395,
|
| 1406 |
-
"total_flos":
|
| 1407 |
-
"train_loss": 0.
|
| 1408 |
-
"train_runtime":
|
| 1409 |
-
"train_samples_per_second":
|
| 1410 |
-
"train_steps_per_second": 0.
|
| 1411 |
}
|
| 1412 |
],
|
| 1413 |
"logging_steps": 10,
|
| 1414 |
"max_steps": 1395,
|
| 1415 |
-
"num_input_tokens_seen":
|
| 1416 |
"num_train_epochs": 3,
|
| 1417 |
"save_steps": 1000,
|
| 1418 |
"stateful_callbacks": {
|
|
@@ -1427,7 +1427,7 @@
|
|
| 1427 |
"attributes": {}
|
| 1428 |
}
|
| 1429 |
},
|
| 1430 |
-
"total_flos":
|
| 1431 |
"train_batch_size": 4,
|
| 1432 |
"trial_name": null,
|
| 1433 |
"trial_params": null
|
|
|
|
| 11 |
"log_history": [
|
| 12 |
{
|
| 13 |
"epoch": 0.021528525296017224,
|
| 14 |
+
"grad_norm": 16.47992515563965,
|
| 15 |
+
"learning_rate": 9.998973021172564e-06,
|
| 16 |
+
"loss": 1.7834,
|
| 17 |
+
"num_input_tokens_seen": 43648,
|
| 18 |
"step": 10,
|
| 19 |
+
"train_runtime": 64.3878,
|
| 20 |
+
"train_tokens_per_second": 677.892
|
| 21 |
},
|
| 22 |
{
|
| 23 |
"epoch": 0.04305705059203445,
|
| 24 |
+
"grad_norm": 16.372161865234375,
|
| 25 |
+
"learning_rate": 9.995423512524277e-06,
|
| 26 |
+
"loss": 0.7676,
|
| 27 |
+
"num_input_tokens_seen": 87072,
|
| 28 |
"step": 20,
|
| 29 |
+
"train_runtime": 95.1979,
|
| 30 |
+
"train_tokens_per_second": 914.642
|
| 31 |
},
|
| 32 |
{
|
| 33 |
"epoch": 0.06458557588805167,
|
| 34 |
+
"grad_norm": 11.686817169189453,
|
| 35 |
+
"learning_rate": 9.98934059499448e-06,
|
| 36 |
+
"loss": 0.5817,
|
| 37 |
+
"num_input_tokens_seen": 131520,
|
| 38 |
"step": 30,
|
| 39 |
+
"train_runtime": 126.5065,
|
| 40 |
+
"train_tokens_per_second": 1039.63
|
| 41 |
},
|
| 42 |
{
|
| 43 |
"epoch": 0.0861141011840689,
|
| 44 |
+
"grad_norm": 3.2975926399230957,
|
| 45 |
+
"learning_rate": 9.980727353510257e-06,
|
| 46 |
+
"loss": 0.3531,
|
| 47 |
+
"num_input_tokens_seen": 175680,
|
| 48 |
"step": 40,
|
| 49 |
+
"train_runtime": 157.6702,
|
| 50 |
+
"train_tokens_per_second": 1114.225
|
| 51 |
},
|
| 52 |
{
|
| 53 |
"epoch": 0.10764262648008611,
|
| 54 |
+
"grad_norm": 3.4886627197265625,
|
| 55 |
+
"learning_rate": 9.969588156242282e-06,
|
| 56 |
+
"loss": 0.3352,
|
| 57 |
+
"num_input_tokens_seen": 219584,
|
| 58 |
"step": 50,
|
| 59 |
+
"train_runtime": 188.7104,
|
| 60 |
+
"train_tokens_per_second": 1163.603
|
| 61 |
},
|
| 62 |
{
|
| 63 |
"epoch": 0.12917115177610333,
|
| 64 |
+
"grad_norm": 3.484487295150757,
|
| 65 |
+
"learning_rate": 9.95592865238951e-06,
|
| 66 |
+
"loss": 0.2298,
|
| 67 |
+
"num_input_tokens_seen": 263392,
|
| 68 |
"step": 60,
|
| 69 |
+
"train_runtime": 219.7077,
|
| 70 |
+
"train_tokens_per_second": 1198.829
|
| 71 |
},
|
| 72 |
{
|
| 73 |
"epoch": 0.15069967707212056,
|
| 74 |
+
"grad_norm": 4.422971725463867,
|
| 75 |
+
"learning_rate": 9.939755769314215e-06,
|
| 76 |
+
"loss": 0.1981,
|
| 77 |
+
"num_input_tokens_seen": 306912,
|
| 78 |
"step": 70,
|
| 79 |
+
"train_runtime": 250.6069,
|
| 80 |
+
"train_tokens_per_second": 1224.675
|
| 81 |
},
|
| 82 |
{
|
| 83 |
"epoch": 0.1722282023681378,
|
| 84 |
+
"grad_norm": 1.4185198545455933,
|
| 85 |
+
"learning_rate": 9.9210777090288e-06,
|
| 86 |
+
"loss": 0.1755,
|
| 87 |
+
"num_input_tokens_seen": 349824,
|
| 88 |
"step": 80,
|
| 89 |
+
"train_runtime": 281.2405,
|
| 90 |
+
"train_tokens_per_second": 1243.86
|
| 91 |
},
|
| 92 |
{
|
| 93 |
"epoch": 0.193756727664155,
|
| 94 |
+
"grad_norm": 1.1935056447982788,
|
| 95 |
+
"learning_rate": 9.899903944036185e-06,
|
| 96 |
+
"loss": 0.1791,
|
| 97 |
+
"num_input_tokens_seen": 393664,
|
| 98 |
"step": 90,
|
| 99 |
+
"train_runtime": 312.2075,
|
| 100 |
+
"train_tokens_per_second": 1260.905
|
| 101 |
},
|
| 102 |
{
|
| 103 |
"epoch": 0.21528525296017223,
|
| 104 |
+
"grad_norm": 2.463397741317749,
|
| 105 |
+
"learning_rate": 9.87624521252587e-06,
|
| 106 |
+
"loss": 0.2051,
|
| 107 |
+
"num_input_tokens_seen": 437952,
|
| 108 |
"step": 100,
|
| 109 |
+
"train_runtime": 343.3508,
|
| 110 |
+
"train_tokens_per_second": 1275.523
|
| 111 |
},
|
| 112 |
{
|
| 113 |
"epoch": 0.23681377825618946,
|
| 114 |
+
"grad_norm": 3.8650355339050293,
|
| 115 |
+
"learning_rate": 9.850113512928094e-06,
|
| 116 |
+
"loss": 0.1912,
|
| 117 |
+
"num_input_tokens_seen": 481472,
|
| 118 |
"step": 110,
|
| 119 |
+
"train_runtime": 374.2539,
|
| 120 |
+
"train_tokens_per_second": 1286.485
|
| 121 |
},
|
| 122 |
{
|
| 123 |
"epoch": 0.25834230355220666,
|
| 124 |
+
"grad_norm": 4.704444885253906,
|
| 125 |
+
"learning_rate": 9.821522097828884e-06,
|
| 126 |
+
"loss": 0.1637,
|
| 127 |
+
"num_input_tokens_seen": 525472,
|
| 128 |
"step": 120,
|
| 129 |
+
"train_runtime": 405.4374,
|
| 130 |
+
"train_tokens_per_second": 1296.062
|
| 131 |
},
|
| 132 |
{
|
| 133 |
"epoch": 0.2798708288482239,
|
| 134 |
+
"grad_norm": 2.7267754077911377,
|
| 135 |
+
"learning_rate": 9.790485467249065e-06,
|
| 136 |
+
"loss": 0.1537,
|
| 137 |
+
"num_input_tokens_seen": 569696,
|
| 138 |
"step": 130,
|
| 139 |
+
"train_runtime": 436.4834,
|
| 140 |
+
"train_tokens_per_second": 1305.195
|
| 141 |
},
|
| 142 |
{
|
| 143 |
"epoch": 0.3013993541442411,
|
| 144 |
+
"grad_norm": 3.512826681137085,
|
| 145 |
+
"learning_rate": 9.757019361290621e-06,
|
| 146 |
+
"loss": 0.1846,
|
| 147 |
+
"num_input_tokens_seen": 613760,
|
| 148 |
"step": 140,
|
| 149 |
+
"train_runtime": 467.5968,
|
| 150 |
+
"train_tokens_per_second": 1312.584
|
| 151 |
},
|
| 152 |
{
|
| 153 |
"epoch": 0.32292787944025836,
|
| 154 |
+
"grad_norm": 2.484517812728882,
|
| 155 |
+
"learning_rate": 9.721140752154182e-06,
|
| 156 |
+
"loss": 0.1872,
|
| 157 |
+
"num_input_tokens_seen": 657824,
|
| 158 |
"step": 150,
|
| 159 |
+
"train_runtime": 498.6389,
|
| 160 |
+
"train_tokens_per_second": 1319.239
|
| 161 |
},
|
| 162 |
{
|
| 163 |
"epoch": 0.3444564047362756,
|
| 164 |
+
"grad_norm": 2.296607255935669,
|
| 165 |
+
"learning_rate": 9.682867835531624e-06,
|
| 166 |
+
"loss": 0.1372,
|
| 167 |
+
"num_input_tokens_seen": 701760,
|
| 168 |
"step": 160,
|
| 169 |
+
"train_runtime": 529.7256,
|
| 170 |
+
"train_tokens_per_second": 1324.761
|
| 171 |
},
|
| 172 |
{
|
| 173 |
"epoch": 0.36598493003229277,
|
| 174 |
+
"grad_norm": 3.887946128845215,
|
| 175 |
+
"learning_rate": 9.642220021378212e-06,
|
| 176 |
+
"loss": 0.2028,
|
| 177 |
+
"num_input_tokens_seen": 745184,
|
| 178 |
"step": 170,
|
| 179 |
+
"train_runtime": 560.5239,
|
| 180 |
+
"train_tokens_per_second": 1329.442
|
| 181 |
},
|
| 182 |
{
|
| 183 |
"epoch": 0.38751345532831,
|
| 184 |
+
"grad_norm": 2.1227307319641113,
|
| 185 |
+
"learning_rate": 9.59921792406891e-06,
|
| 186 |
+
"loss": 0.1765,
|
| 187 |
+
"num_input_tokens_seen": 789216,
|
| 188 |
"step": 180,
|
| 189 |
+
"train_runtime": 591.5958,
|
| 190 |
+
"train_tokens_per_second": 1334.046
|
| 191 |
},
|
| 192 |
{
|
| 193 |
"epoch": 0.40904198062432723,
|
| 194 |
+
"grad_norm": 3.007882595062256,
|
| 195 |
+
"learning_rate": 9.553883351943882e-06,
|
| 196 |
+
"loss": 0.1882,
|
| 197 |
+
"num_input_tokens_seen": 832960,
|
| 198 |
"step": 190,
|
| 199 |
+
"train_runtime": 622.6094,
|
| 200 |
+
"train_tokens_per_second": 1337.853
|
| 201 |
},
|
| 202 |
{
|
| 203 |
"epoch": 0.43057050592034446,
|
| 204 |
+
"grad_norm": 1.8637208938598633,
|
| 205 |
+
"learning_rate": 9.506239296248497e-06,
|
| 206 |
+
"loss": 0.1336,
|
| 207 |
+
"num_input_tokens_seen": 877664,
|
| 208 |
"step": 200,
|
| 209 |
+
"train_runtime": 654.0867,
|
| 210 |
+
"train_tokens_per_second": 1341.816
|
| 211 |
},
|
| 212 |
{
|
| 213 |
"epoch": 0.4520990312163617,
|
| 214 |
+
"grad_norm": 1.1324244737625122,
|
| 215 |
+
"learning_rate": 9.456309919473384e-06,
|
| 216 |
+
"loss": 0.1521,
|
| 217 |
+
"num_input_tokens_seen": 921536,
|
| 218 |
"step": 210,
|
| 219 |
+
"train_runtime": 685.133,
|
| 220 |
+
"train_tokens_per_second": 1345.047
|
| 221 |
},
|
| 222 |
{
|
| 223 |
"epoch": 0.4736275565123789,
|
| 224 |
+
"grad_norm": 3.536208391189575,
|
| 225 |
+
"learning_rate": 9.404120543100553e-06,
|
| 226 |
+
"loss": 0.1864,
|
| 227 |
+
"num_input_tokens_seen": 965344,
|
| 228 |
"step": 220,
|
| 229 |
+
"train_runtime": 716.7323,
|
| 230 |
+
"train_tokens_per_second": 1346.868
|
| 231 |
},
|
| 232 |
{
|
| 233 |
"epoch": 0.4951560818083961,
|
| 234 |
+
"grad_norm": 1.73074209690094,
|
| 235 |
+
"learning_rate": 9.34969763476168e-06,
|
| 236 |
+
"loss": 0.1625,
|
| 237 |
+
"num_input_tokens_seen": 1008672,
|
| 238 |
"step": 230,
|
| 239 |
+
"train_runtime": 747.5266,
|
| 240 |
+
"train_tokens_per_second": 1349.346
|
| 241 |
},
|
| 242 |
{
|
| 243 |
"epoch": 0.5166846071044133,
|
| 244 |
+
"grad_norm": 1.4830386638641357,
|
| 245 |
+
"learning_rate": 9.293068794815175e-06,
|
| 246 |
+
"loss": 0.1456,
|
| 247 |
+
"num_input_tokens_seen": 1051936,
|
| 248 |
"step": 240,
|
| 249 |
+
"train_runtime": 778.3038,
|
| 250 |
+
"train_tokens_per_second": 1351.575
|
| 251 |
},
|
| 252 |
{
|
| 253 |
"epoch": 0.5382131324004306,
|
| 254 |
+
"grad_norm": 2.7361512184143066,
|
| 255 |
+
"learning_rate": 9.234262742348764e-06,
|
| 256 |
+
"loss": 0.165,
|
| 257 |
+
"num_input_tokens_seen": 1095904,
|
| 258 |
"step": 250,
|
| 259 |
+
"train_runtime": 809.3485,
|
| 260 |
+
"train_tokens_per_second": 1354.057
|
| 261 |
},
|
| 262 |
{
|
| 263 |
"epoch": 0.5597416576964478,
|
| 264 |
+
"grad_norm": 1.9473741054534912,
|
| 265 |
+
"learning_rate": 9.17330930061471e-06,
|
| 266 |
+
"loss": 0.1487,
|
| 267 |
+
"num_input_tokens_seen": 1140064,
|
| 268 |
"step": 260,
|
| 269 |
+
"train_runtime": 840.5464,
|
| 270 |
+
"train_tokens_per_second": 1356.337
|
| 271 |
},
|
| 272 |
{
|
| 273 |
"epoch": 0.581270182992465,
|
| 274 |
+
"grad_norm": 2.0610098838806152,
|
| 275 |
+
"learning_rate": 9.11023938190509e-06,
|
| 276 |
+
"loss": 0.1687,
|
| 277 |
+
"num_input_tokens_seen": 1183872,
|
| 278 |
"step": 270,
|
| 279 |
+
"train_runtime": 871.5774,
|
| 280 |
+
"train_tokens_per_second": 1358.31
|
| 281 |
},
|
| 282 |
{
|
| 283 |
"epoch": 0.6027987082884823,
|
| 284 |
+
"grad_norm": 3.2189598083496094,
|
| 285 |
+
"learning_rate": 9.045084971874738e-06,
|
| 286 |
+
"loss": 0.1511,
|
| 287 |
+
"num_input_tokens_seen": 1228544,
|
| 288 |
"step": 280,
|
| 289 |
+
"train_runtime": 903.1191,
|
| 290 |
+
"train_tokens_per_second": 1360.334
|
| 291 |
},
|
| 292 |
{
|
| 293 |
"epoch": 0.6243272335844995,
|
| 294 |
+
"grad_norm": 3.902757406234741,
|
| 295 |
+
"learning_rate": 8.977879113319847e-06,
|
| 296 |
+
"loss": 0.184,
|
| 297 |
+
"num_input_tokens_seen": 1271968,
|
| 298 |
"step": 290,
|
| 299 |
+
"train_runtime": 934.0522,
|
| 300 |
+
"train_tokens_per_second": 1361.774
|
| 301 |
},
|
| 302 |
{
|
| 303 |
"epoch": 0.6458557588805167,
|
| 304 |
+
"grad_norm": 4.2983012199401855,
|
| 305 |
+
"learning_rate": 8.90865588942046e-06,
|
| 306 |
+
"loss": 0.1305,
|
| 307 |
+
"num_input_tokens_seen": 1316096,
|
| 308 |
"step": 300,
|
| 309 |
+
"train_runtime": 965.1778,
|
| 310 |
+
"train_tokens_per_second": 1363.579
|
| 311 |
},
|
| 312 |
{
|
| 313 |
"epoch": 0.667384284176534,
|
| 314 |
+
"grad_norm": 2.6156394481658936,
|
| 315 |
+
"learning_rate": 8.83745040645531e-06,
|
| 316 |
+
"loss": 0.1405,
|
| 317 |
+
"num_input_tokens_seen": 1360256,
|
| 318 |
"step": 310,
|
| 319 |
+
"train_runtime": 996.4077,
|
| 320 |
+
"train_tokens_per_second": 1365.16
|
| 321 |
},
|
| 322 |
{
|
| 323 |
"epoch": 0.6889128094725512,
|
| 324 |
+
"grad_norm": 1.3506444692611694,
|
| 325 |
+
"learning_rate": 8.764298775997823e-06,
|
| 326 |
+
"loss": 0.1651,
|
| 327 |
+
"num_input_tokens_seen": 1404064,
|
| 328 |
"step": 320,
|
| 329 |
+
"train_runtime": 1027.5151,
|
| 330 |
+
"train_tokens_per_second": 1366.466
|
| 331 |
},
|
| 332 |
{
|
| 333 |
"epoch": 0.7104413347685683,
|
| 334 |
+
"grad_norm": 1.5117799043655396,
|
| 335 |
+
"learning_rate": 8.68923809660227e-06,
|
| 336 |
+
"loss": 0.1519,
|
| 337 |
+
"num_input_tokens_seen": 1448256,
|
| 338 |
"step": 330,
|
| 339 |
+
"train_runtime": 1058.74,
|
| 340 |
+
"train_tokens_per_second": 1367.905
|
| 341 |
},
|
| 342 |
{
|
| 343 |
"epoch": 0.7319698600645855,
|
| 344 |
+
"grad_norm": 1.2659231424331665,
|
| 345 |
+
"learning_rate": 8.612306434989395e-06,
|
| 346 |
+
"loss": 0.1574,
|
| 347 |
+
"num_input_tokens_seen": 1492448,
|
| 348 |
"step": 340,
|
| 349 |
+
"train_runtime": 1090.0052,
|
| 350 |
+
"train_tokens_per_second": 1369.212
|
| 351 |
},
|
| 352 |
{
|
| 353 |
"epoch": 0.7534983853606028,
|
| 354 |
+
"grad_norm": 2.6010894775390625,
|
| 355 |
+
"learning_rate": 8.53354280674102e-06,
|
| 356 |
+
"loss": 0.1587,
|
| 357 |
+
"num_input_tokens_seen": 1537440,
|
| 358 |
"step": 350,
|
| 359 |
+
"train_runtime": 1121.55,
|
| 360 |
+
"train_tokens_per_second": 1370.817
|
| 361 |
},
|
| 362 |
{
|
| 363 |
"epoch": 0.77502691065662,
|
| 364 |
+
"grad_norm": 1.6968097686767578,
|
| 365 |
+
"learning_rate": 8.452987156513457e-06,
|
| 366 |
+
"loss": 0.1513,
|
| 367 |
+
"num_input_tokens_seen": 1581280,
|
| 368 |
"step": 360,
|
| 369 |
+
"train_runtime": 1152.6858,
|
| 370 |
+
"train_tokens_per_second": 1371.822
|
| 371 |
},
|
| 372 |
{
|
| 373 |
"epoch": 0.7965554359526372,
|
| 374 |
+
"grad_norm": 2.0298380851745605,
|
| 375 |
+
"learning_rate": 8.370680337779737e-06,
|
| 376 |
+
"loss": 0.1401,
|
| 377 |
+
"num_input_tokens_seen": 1625824,
|
| 378 |
"step": 370,
|
| 379 |
+
"train_runtime": 1184.3507,
|
| 380 |
+
"train_tokens_per_second": 1372.756
|
| 381 |
},
|
| 382 |
{
|
| 383 |
"epoch": 0.8180839612486545,
|
| 384 |
+
"grad_norm": 2.7614028453826904,
|
| 385 |
+
"learning_rate": 8.286664092110935e-06,
|
| 386 |
+
"loss": 0.1135,
|
| 387 |
+
"num_input_tokens_seen": 1669472,
|
| 388 |
"step": 380,
|
| 389 |
+
"train_runtime": 1215.2935,
|
| 390 |
+
"train_tokens_per_second": 1373.719
|
| 391 |
},
|
| 392 |
{
|
| 393 |
"epoch": 0.8396124865446717,
|
| 394 |
+
"grad_norm": 1.6297581195831299,
|
| 395 |
+
"learning_rate": 8.200981028007095e-06,
|
| 396 |
+
"loss": 0.1645,
|
| 397 |
+
"num_input_tokens_seen": 1713312,
|
| 398 |
"step": 390,
|
| 399 |
+
"train_runtime": 1246.1254,
|
| 400 |
+
"train_tokens_per_second": 1374.911
|
| 401 |
},
|
| 402 |
{
|
| 403 |
"epoch": 0.8611410118406889,
|
| 404 |
+
"grad_norm": 2.32612943649292,
|
| 405 |
+
"learning_rate": 8.11367459928851e-06,
|
| 406 |
+
"loss": 0.1129,
|
| 407 |
+
"num_input_tokens_seen": 1757056,
|
| 408 |
"step": 400,
|
| 409 |
+
"train_runtime": 1277.0951,
|
| 410 |
+
"train_tokens_per_second": 1375.822
|
| 411 |
},
|
| 412 |
{
|
| 413 |
"epoch": 0.8826695371367062,
|
| 414 |
+
"grad_norm": 1.5576270818710327,
|
| 415 |
+
"learning_rate": 8.024789083058289e-06,
|
| 416 |
+
"loss": 0.1333,
|
| 417 |
+
"num_input_tokens_seen": 1801632,
|
| 418 |
"step": 410,
|
| 419 |
+
"train_runtime": 1308.5556,
|
| 420 |
+
"train_tokens_per_second": 1376.81
|
| 421 |
},
|
| 422 |
{
|
| 423 |
"epoch": 0.9041980624327234,
|
| 424 |
+
"grad_norm": 8.420344352722168,
|
| 425 |
+
"learning_rate": 7.934369557247397e-06,
|
| 426 |
+
"loss": 0.1311,
|
| 427 |
+
"num_input_tokens_seen": 1845280,
|
| 428 |
"step": 420,
|
| 429 |
+
"train_runtime": 1339.4668,
|
| 430 |
+
"train_tokens_per_second": 1377.623
|
| 431 |
},
|
| 432 |
{
|
| 433 |
"epoch": 0.9257265877287406,
|
| 434 |
+
"grad_norm": 1.7291479110717773,
|
| 435 |
+
"learning_rate": 7.842461877753575e-06,
|
| 436 |
+
"loss": 0.1395,
|
| 437 |
+
"num_input_tokens_seen": 1889472,
|
| 438 |
"step": 430,
|
| 439 |
+
"train_runtime": 1370.6369,
|
| 440 |
+
"train_tokens_per_second": 1378.536
|
| 441 |
},
|
| 442 |
{
|
| 443 |
"epoch": 0.9472551130247578,
|
| 444 |
+
"grad_norm": 2.441693067550659,
|
| 445 |
+
"learning_rate": 7.7491126551857e-06,
|
| 446 |
+
"loss": 0.1175,
|
| 447 |
+
"num_input_tokens_seen": 1932832,
|
| 448 |
"step": 440,
|
| 449 |
+
"train_runtime": 1401.3047,
|
| 450 |
+
"train_tokens_per_second": 1379.309
|
| 451 |
},
|
| 452 |
{
|
| 453 |
"epoch": 0.9687836383207751,
|
| 454 |
+
"grad_norm": 1.3606727123260498,
|
| 455 |
+
"learning_rate": 7.654369231225398e-06,
|
| 456 |
+
"loss": 0.1154,
|
| 457 |
+
"num_input_tokens_seen": 1976000,
|
| 458 |
"step": 450,
|
| 459 |
+
"train_runtime": 1431.9402,
|
| 460 |
+
"train_tokens_per_second": 1379.946
|
| 461 |
},
|
| 462 |
{
|
| 463 |
"epoch": 0.9903121636167922,
|
| 464 |
+
"grad_norm": 2.911600351333618,
|
| 465 |
+
"learning_rate": 7.5582796546179125e-06,
|
| 466 |
+
"loss": 0.1408,
|
| 467 |
+
"num_input_tokens_seen": 2019968,
|
| 468 |
"step": 460,
|
| 469 |
+
"train_runtime": 1463.035,
|
| 470 |
+
"train_tokens_per_second": 1380.67
|
| 471 |
},
|
| 472 |
{
|
| 473 |
"epoch": 1.0107642626480087,
|
| 474 |
+
"grad_norm": 2.967047929763794,
|
| 475 |
+
"learning_rate": 7.460892656804366e-06,
|
| 476 |
+
"loss": 0.1126,
|
| 477 |
+
"num_input_tokens_seen": 2061440,
|
| 478 |
"step": 470,
|
| 479 |
+
"train_runtime": 1492.4083,
|
| 480 |
+
"train_tokens_per_second": 1381.284
|
| 481 |
},
|
| 482 |
{
|
| 483 |
"epoch": 1.0322927879440258,
|
| 484 |
+
"grad_norm": 1.90776789188385,
|
| 485 |
+
"learning_rate": 7.362257627207818e-06,
|
| 486 |
+
"loss": 0.1329,
|
| 487 |
+
"num_input_tokens_seen": 2105216,
|
| 488 |
"step": 480,
|
| 489 |
+
"train_runtime": 1523.2979,
|
| 490 |
+
"train_tokens_per_second": 1382.012
|
| 491 |
},
|
| 492 |
{
|
| 493 |
"epoch": 1.0538213132400431,
|
| 494 |
+
"grad_norm": 2.7770872116088867,
|
| 495 |
+
"learning_rate": 7.2624245881856094e-06,
|
| 496 |
+
"loss": 0.111,
|
| 497 |
+
"num_input_tokens_seen": 2149888,
|
| 498 |
"step": 490,
|
| 499 |
+
"train_runtime": 1554.9287,
|
| 500 |
+
"train_tokens_per_second": 1382.628
|
| 501 |
},
|
| 502 |
{
|
| 503 |
"epoch": 1.0753498385360603,
|
| 504 |
+
"grad_norm": 1.9737987518310547,
|
| 505 |
+
"learning_rate": 7.161444169660723e-06,
|
| 506 |
+
"loss": 0.113,
|
| 507 |
+
"num_input_tokens_seen": 2194304,
|
| 508 |
"step": 500,
|
| 509 |
+
"train_runtime": 1586.2216,
|
| 510 |
+
"train_tokens_per_second": 1383.353
|
| 511 |
},
|
| 512 |
{
|
| 513 |
"epoch": 1.0968783638320776,
|
| 514 |
+
"grad_norm": 1.2335457801818848,
|
| 515 |
+
"learning_rate": 7.059367583445034e-06,
|
| 516 |
+
"loss": 0.1303,
|
| 517 |
+
"num_input_tokens_seen": 2238080,
|
| 518 |
"step": 510,
|
| 519 |
+
"train_runtime": 1617.0801,
|
| 520 |
+
"train_tokens_per_second": 1384.025
|
| 521 |
},
|
| 522 |
{
|
| 523 |
"epoch": 1.1184068891280947,
|
| 524 |
+
"grad_norm": 2.525258779525757,
|
| 525 |
+
"learning_rate": 6.956246597267438e-06,
|
| 526 |
+
"loss": 0.1404,
|
| 527 |
+
"num_input_tokens_seen": 2282368,
|
| 528 |
"step": 520,
|
| 529 |
+
"train_runtime": 1648.4109,
|
| 530 |
+
"train_tokens_per_second": 1384.587
|
| 531 |
},
|
| 532 |
{
|
| 533 |
"epoch": 1.1399354144241118,
|
| 534 |
+
"grad_norm": 4.016520977020264,
|
| 535 |
+
"learning_rate": 6.852133508520057e-06,
|
| 536 |
+
"loss": 0.0972,
|
| 537 |
+
"num_input_tokens_seen": 2325984,
|
| 538 |
"step": 530,
|
| 539 |
+
"train_runtime": 1679.3164,
|
| 540 |
+
"train_tokens_per_second": 1385.078
|
| 541 |
},
|
| 542 |
{
|
| 543 |
"epoch": 1.1614639397201292,
|
| 544 |
+
"grad_norm": 1.405586838722229,
|
| 545 |
+
"learning_rate": 6.747081117735829e-06,
|
| 546 |
+
"loss": 0.1092,
|
| 547 |
+
"num_input_tokens_seen": 2369664,
|
| 548 |
"step": 540,
|
| 549 |
+
"train_runtime": 1710.2475,
|
| 550 |
+
"train_tokens_per_second": 1385.568
|
| 551 |
},
|
| 552 |
{
|
| 553 |
"epoch": 1.1829924650161463,
|
| 554 |
+
"grad_norm": 2.151442766189575,
|
| 555 |
+
"learning_rate": 6.641142701810932e-06,
|
| 556 |
+
"loss": 0.1186,
|
| 557 |
+
"num_input_tokens_seen": 2413312,
|
| 558 |
"step": 550,
|
| 559 |
+
"train_runtime": 1741.213,
|
| 560 |
+
"train_tokens_per_second": 1385.995
|
| 561 |
},
|
| 562 |
{
|
| 563 |
"epoch": 1.2045209903121636,
|
| 564 |
+
"grad_norm": 1.9706578254699707,
|
| 565 |
+
"learning_rate": 6.534371986985618e-06,
|
| 566 |
+
"loss": 0.1332,
|
| 567 |
+
"num_input_tokens_seen": 2457120,
|
| 568 |
"step": 560,
|
| 569 |
+
"train_runtime": 1772.1204,
|
| 570 |
+
"train_tokens_per_second": 1386.542
|
| 571 |
},
|
| 572 |
{
|
| 573 |
"epoch": 1.2260495156081808,
|
| 574 |
+
"grad_norm": 2.3035449981689453,
|
| 575 |
+
"learning_rate": 6.426823121597169e-06,
|
| 576 |
+
"loss": 0.1481,
|
| 577 |
+
"num_input_tokens_seen": 2500736,
|
| 578 |
"step": 570,
|
| 579 |
+
"train_runtime": 1803.0834,
|
| 580 |
+
"train_tokens_per_second": 1386.922
|
| 581 |
},
|
| 582 |
{
|
| 583 |
"epoch": 1.247578040904198,
|
| 584 |
+
"grad_norm": 3.713632106781006,
|
| 585 |
+
"learning_rate": 6.318550648618785e-06,
|
| 586 |
+
"loss": 0.1332,
|
| 587 |
+
"num_input_tokens_seen": 2545056,
|
| 588 |
"step": 580,
|
| 589 |
+
"train_runtime": 1834.1935,
|
| 590 |
+
"train_tokens_per_second": 1387.561
|
| 591 |
},
|
| 592 |
{
|
| 593 |
"epoch": 1.2691065662002152,
|
| 594 |
+
"grad_norm": 1.8667478561401367,
|
| 595 |
+
"learning_rate": 6.209609477998339e-06,
|
| 596 |
+
"loss": 0.0978,
|
| 597 |
+
"num_input_tokens_seen": 2588416,
|
| 598 |
"step": 590,
|
| 599 |
+
"train_runtime": 1864.9784,
|
| 600 |
+
"train_tokens_per_second": 1387.907
|
| 601 |
},
|
| 602 |
{
|
| 603 |
"epoch": 1.2906350914962326,
|
| 604 |
+
"grad_norm": 2.295342445373535,
|
| 605 |
+
"learning_rate": 6.100054858811012e-06,
|
| 606 |
+
"loss": 0.1176,
|
| 607 |
+
"num_input_tokens_seen": 2632352,
|
| 608 |
"step": 600,
|
| 609 |
+
"train_runtime": 1896.108,
|
| 610 |
+
"train_tokens_per_second": 1388.292
|
| 611 |
},
|
| 612 |
{
|
| 613 |
"epoch": 1.3121636167922497,
|
| 614 |
+
"grad_norm": 2.2867720127105713,
|
| 615 |
+
"learning_rate": 5.989942351239954e-06,
|
| 616 |
+
"loss": 0.1279,
|
| 617 |
+
"num_input_tokens_seen": 2676640,
|
| 618 |
"step": 610,
|
| 619 |
+
"train_runtime": 1927.5126,
|
| 620 |
+
"train_tokens_per_second": 1388.65
|
| 621 |
},
|
| 622 |
{
|
| 623 |
"epoch": 1.333692142088267,
|
| 624 |
+
"grad_norm": 2.1158223152160645,
|
| 625 |
+
"learning_rate": 5.879327798399155e-06,
|
| 626 |
+
"loss": 0.1407,
|
| 627 |
+
"num_input_tokens_seen": 2719968,
|
| 628 |
"step": 620,
|
| 629 |
+
"train_runtime": 1958.2576,
|
| 630 |
+
"train_tokens_per_second": 1388.974
|
| 631 |
},
|
| 632 |
{
|
| 633 |
"epoch": 1.3552206673842842,
|
| 634 |
+
"grad_norm": 4.076441287994385,
|
| 635 |
+
"learning_rate": 5.768267298012841e-06,
|
| 636 |
+
"loss": 0.1168,
|
| 637 |
+
"num_input_tokens_seen": 2764352,
|
| 638 |
"step": 630,
|
| 639 |
+
"train_runtime": 1989.6781,
|
| 640 |
+
"train_tokens_per_second": 1389.346
|
| 641 |
},
|
| 642 |
{
|
| 643 |
"epoch": 1.3767491926803013,
|
| 644 |
+
"grad_norm": 4.354236602783203,
|
| 645 |
+
"learning_rate": 5.656817173965733e-06,
|
| 646 |
+
"loss": 0.1188,
|
| 647 |
+
"num_input_tokens_seen": 2808832,
|
| 648 |
"step": 640,
|
| 649 |
+
"train_runtime": 2021.0224,
|
| 650 |
+
"train_tokens_per_second": 1389.807
|
| 651 |
},
|
| 652 |
{
|
| 653 |
"epoch": 1.3982777179763186,
|
| 654 |
+
"grad_norm": 4.40167236328125,
|
| 655 |
+
"learning_rate": 5.545033947738624e-06,
|
| 656 |
+
"loss": 0.1326,
|
| 657 |
+
"num_input_tokens_seen": 2852192,
|
| 658 |
"step": 650,
|
| 659 |
+
"train_runtime": 2051.72,
|
| 660 |
+
"train_tokens_per_second": 1390.147
|
| 661 |
},
|
| 662 |
{
|
| 663 |
"epoch": 1.419806243272336,
|
| 664 |
+
"grad_norm": 2.4845104217529297,
|
| 665 |
+
"learning_rate": 5.4329743097437316e-06,
|
| 666 |
+
"loss": 0.1331,
|
| 667 |
+
"num_input_tokens_seen": 2896256,
|
| 668 |
"step": 660,
|
| 669 |
+
"train_runtime": 2082.7361,
|
| 670 |
+
"train_tokens_per_second": 1390.602
|
| 671 |
},
|
| 672 |
{
|
| 673 |
"epoch": 1.441334768568353,
|
| 674 |
+
"grad_norm": 2.7233705520629883,
|
| 675 |
+
"learning_rate": 5.320695090574386e-06,
|
| 676 |
+
"loss": 0.1082,
|
| 677 |
+
"num_input_tokens_seen": 2939552,
|
| 678 |
"step": 670,
|
| 679 |
+
"train_runtime": 2113.5367,
|
| 680 |
+
"train_tokens_per_second": 1390.821
|
| 681 |
},
|
| 682 |
{
|
| 683 |
"epoch": 1.4628632938643702,
|
| 684 |
+
"grad_norm": 3.289949893951416,
|
| 685 |
+
"learning_rate": 5.208253232183625e-06,
|
| 686 |
+
"loss": 0.1184,
|
| 687 |
+
"num_input_tokens_seen": 2984000,
|
| 688 |
"step": 680,
|
| 689 |
+
"train_runtime": 2144.7931,
|
| 690 |
+
"train_tokens_per_second": 1391.276
|
| 691 |
},
|
| 692 |
{
|
| 693 |
"epoch": 1.4843918191603875,
|
| 694 |
+
"grad_norm": 4.015010833740234,
|
| 695 |
+
"learning_rate": 5.095705759006311e-06,
|
| 696 |
+
"loss": 0.0942,
|
| 697 |
+
"num_input_tokens_seen": 3028192,
|
| 698 |
"step": 690,
|
| 699 |
+
"train_runtime": 2176.0229,
|
| 700 |
+
"train_tokens_per_second": 1391.618
|
| 701 |
},
|
| 702 |
{
|
| 703 |
"epoch": 1.5059203444564049,
|
| 704 |
+
"grad_norm": 5.474874973297119,
|
| 705 |
+
"learning_rate": 4.9831097490394195e-06,
|
| 706 |
+
"loss": 0.1204,
|
| 707 |
+
"num_input_tokens_seen": 3071392,
|
| 708 |
"step": 700,
|
| 709 |
+
"train_runtime": 2206.8218,
|
| 710 |
+
"train_tokens_per_second": 1391.772
|
| 711 |
},
|
| 712 |
{
|
| 713 |
"epoch": 1.527448869752422,
|
| 714 |
+
"grad_norm": 2.4211018085479736,
|
| 715 |
+
"learning_rate": 4.870522304895164e-06,
|
| 716 |
+
"loss": 0.1358,
|
| 717 |
+
"num_input_tokens_seen": 3114496,
|
| 718 |
"step": 710,
|
| 719 |
+
"train_runtime": 2237.5127,
|
| 720 |
+
"train_tokens_per_second": 1391.946
|
| 721 |
},
|
| 722 |
{
|
| 723 |
"epoch": 1.5489773950484391,
|
| 724 |
+
"grad_norm": 2.5446665287017822,
|
| 725 |
+
"learning_rate": 4.758000524841632e-06,
|
| 726 |
+
"loss": 0.1313,
|
| 727 |
+
"num_input_tokens_seen": 3158432,
|
| 728 |
"step": 720,
|
| 729 |
+
"train_runtime": 2268.6496,
|
| 730 |
+
"train_tokens_per_second": 1392.208
|
| 731 |
},
|
| 732 |
{
|
| 733 |
"epoch": 1.5705059203444565,
|
| 734 |
+
"grad_norm": 5.643487453460693,
|
| 735 |
+
"learning_rate": 4.645601473845636e-06,
|
| 736 |
+
"loss": 0.0879,
|
| 737 |
+
"num_input_tokens_seen": 3201888,
|
| 738 |
"step": 730,
|
| 739 |
+
"train_runtime": 2299.4823,
|
| 740 |
+
"train_tokens_per_second": 1392.439
|
| 741 |
},
|
| 742 |
{
|
| 743 |
"epoch": 1.5920344456404736,
|
| 744 |
+
"grad_norm": 1.8654100894927979,
|
| 745 |
+
"learning_rate": 4.533382154632442e-06,
|
| 746 |
+
"loss": 0.0977,
|
| 747 |
+
"num_input_tokens_seen": 3245856,
|
| 748 |
"step": 740,
|
| 749 |
+
"train_runtime": 2330.5679,
|
| 750 |
+
"train_tokens_per_second": 1392.732
|
| 751 |
},
|
| 752 |
{
|
| 753 |
"epoch": 1.6135629709364907,
|
| 754 |
+
"grad_norm": 2.2264926433563232,
|
| 755 |
+
"learning_rate": 4.421399478777064e-06,
|
| 756 |
+
"loss": 0.1483,
|
| 757 |
+
"num_input_tokens_seen": 3290208,
|
| 758 |
"step": 750,
|
| 759 |
+
"train_runtime": 2361.9169,
|
| 760 |
+
"train_tokens_per_second": 1393.024
|
| 761 |
},
|
| 762 |
{
|
| 763 |
"epoch": 1.635091496232508,
|
| 764 |
+
"grad_norm": 2.8280999660491943,
|
| 765 |
+
"learning_rate": 4.3097102378417985e-06,
|
| 766 |
+
"loss": 0.1285,
|
| 767 |
+
"num_input_tokens_seen": 3333152,
|
| 768 |
"step": 760,
|
| 769 |
+
"train_runtime": 2392.5926,
|
| 770 |
+
"train_tokens_per_second": 1393.113
|
| 771 |
},
|
| 772 |
{
|
| 773 |
"epoch": 1.6566200215285254,
|
| 774 |
+
"grad_norm": 3.5213840007781982,
|
| 775 |
+
"learning_rate": 4.198371074574597e-06,
|
| 776 |
+
"loss": 0.1475,
|
| 777 |
+
"num_input_tokens_seen": 3377664,
|
| 778 |
"step": 770,
|
| 779 |
+
"train_runtime": 2423.9491,
|
| 780 |
+
"train_tokens_per_second": 1393.455
|
| 781 |
},
|
| 782 |
{
|
| 783 |
"epoch": 1.6781485468245425,
|
| 784 |
+
"grad_norm": 3.323622226715088,
|
| 785 |
+
"learning_rate": 4.087438454182942e-06,
|
| 786 |
+
"loss": 0.0904,
|
| 787 |
+
"num_input_tokens_seen": 3422400,
|
| 788 |
"step": 780,
|
| 789 |
+
"train_runtime": 2455.5818,
|
| 790 |
+
"train_tokens_per_second": 1393.723
|
| 791 |
},
|
| 792 |
{
|
| 793 |
"epoch": 1.6996770721205596,
|
| 794 |
+
"grad_norm": 4.368185997009277,
|
| 795 |
+
"learning_rate": 3.976968635697732e-06,
|
| 796 |
+
"loss": 0.1199,
|
| 797 |
+
"num_input_tokens_seen": 3465760,
|
| 798 |
"step": 790,
|
| 799 |
+
"train_runtime": 2486.3362,
|
| 800 |
+
"train_tokens_per_second": 1393.922
|
| 801 |
},
|
| 802 |
{
|
| 803 |
"epoch": 1.721205597416577,
|
| 804 |
+
"grad_norm": 3.0081822872161865,
|
| 805 |
+
"learning_rate": 3.867017643441746e-06,
|
| 806 |
+
"loss": 0.102,
|
| 807 |
+
"num_input_tokens_seen": 3509760,
|
| 808 |
"step": 800,
|
| 809 |
+
"train_runtime": 2517.434,
|
| 810 |
+
"train_tokens_per_second": 1394.182
|
| 811 |
},
|
| 812 |
{
|
| 813 |
"epoch": 1.7427341227125943,
|
| 814 |
+
"grad_norm": 3.7257721424102783,
|
| 815 |
+
"learning_rate": 3.757641238617137e-06,
|
| 816 |
+
"loss": 0.1194,
|
| 817 |
+
"num_input_tokens_seen": 3554560,
|
| 818 |
"step": 810,
|
| 819 |
+
"train_runtime": 2549.4732,
|
| 820 |
+
"train_tokens_per_second": 1394.233
|
| 821 |
},
|
| 822 |
{
|
| 823 |
"epoch": 1.7642626480086114,
|
| 824 |
+
"grad_norm": 3.8365535736083984,
|
| 825 |
+
"learning_rate": 3.648894891026358e-06,
|
| 826 |
+
"loss": 0.1507,
|
| 827 |
+
"num_input_tokens_seen": 3599488,
|
| 828 |
"step": 820,
|
| 829 |
+
"train_runtime": 2581.0241,
|
| 830 |
+
"train_tokens_per_second": 1394.597
|
| 831 |
},
|
| 832 |
{
|
| 833 |
"epoch": 1.7857911733046286,
|
| 834 |
+
"grad_norm": 2.1309561729431152,
|
| 835 |
+
"learning_rate": 3.5408337509408764e-06,
|
| 836 |
+
"loss": 0.1015,
|
| 837 |
+
"num_input_tokens_seen": 3643680,
|
| 838 |
"step": 830,
|
| 839 |
+
"train_runtime": 2612.3216,
|
| 840 |
+
"train_tokens_per_second": 1394.805
|
| 841 |
},
|
| 842 |
{
|
| 843 |
"epoch": 1.807319698600646,
|
| 844 |
+
"grad_norm": 2.5082457065582275,
|
| 845 |
+
"learning_rate": 3.4335126211319412e-06,
|
| 846 |
+
"loss": 0.1165,
|
| 847 |
+
"num_input_tokens_seen": 3688160,
|
| 848 |
"step": 840,
|
| 849 |
+
"train_runtime": 2643.6717,
|
| 850 |
+
"train_tokens_per_second": 1395.09
|
| 851 |
},
|
| 852 |
{
|
| 853 |
"epoch": 1.8288482238966632,
|
| 854 |
+
"grad_norm": 1.4419660568237305,
|
| 855 |
+
"learning_rate": 3.32698592907757e-06,
|
| 856 |
+
"loss": 0.0958,
|
| 857 |
+
"num_input_tokens_seen": 3731392,
|
| 858 |
"step": 850,
|
| 859 |
+
"train_runtime": 2674.4286,
|
| 860 |
+
"train_tokens_per_second": 1395.211
|
| 861 |
},
|
| 862 |
{
|
| 863 |
"epoch": 1.8503767491926801,
|
| 864 |
+
"grad_norm": 2.402513027191162,
|
| 865 |
+
"learning_rate": 3.2213076993598857e-06,
|
| 866 |
+
"loss": 0.1505,
|
| 867 |
+
"num_input_tokens_seen": 3776128,
|
| 868 |
"step": 860,
|
| 869 |
+
"train_runtime": 2706.116,
|
| 870 |
+
"train_tokens_per_second": 1395.405
|
| 871 |
},
|
| 872 |
{
|
| 873 |
"epoch": 1.8719052744886975,
|
| 874 |
+
"grad_norm": 0.9779609441757202,
|
| 875 |
+
"learning_rate": 3.1165315262667535e-06,
|
| 876 |
+
"loss": 0.1003,
|
| 877 |
+
"num_input_tokens_seen": 3820896,
|
| 878 |
"step": 870,
|
| 879 |
+
"train_runtime": 2737.6181,
|
| 880 |
+
"train_tokens_per_second": 1395.701
|
| 881 |
},
|
| 882 |
{
|
| 883 |
"epoch": 1.8934337997847148,
|
| 884 |
+
"grad_norm": 3.727255344390869,
|
| 885 |
+
"learning_rate": 3.012710546611659e-06,
|
| 886 |
+
"loss": 0.1483,
|
| 887 |
+
"num_input_tokens_seen": 3864704,
|
| 888 |
"step": 880,
|
| 889 |
+
"train_runtime": 2768.6885,
|
| 890 |
+
"train_tokens_per_second": 1395.861
|
| 891 |
},
|
| 892 |
{
|
| 893 |
"epoch": 1.914962325080732,
|
| 894 |
+
"grad_norm": 1.5679094791412354,
|
| 895 |
+
"learning_rate": 2.9098974127856e-06,
|
| 896 |
+
"loss": 0.117,
|
| 897 |
+
"num_input_tokens_seen": 3908544,
|
| 898 |
"step": 890,
|
| 899 |
+
"train_runtime": 2799.6713,
|
| 900 |
+
"train_tokens_per_second": 1396.072
|
| 901 |
},
|
| 902 |
{
|
| 903 |
"epoch": 1.936490850376749,
|
| 904 |
+
"grad_norm": 2.775408983230591,
|
| 905 |
+
"learning_rate": 2.8081442660546126e-06,
|
| 906 |
+
"loss": 0.1303,
|
| 907 |
+
"num_input_tokens_seen": 3952576,
|
| 908 |
"step": 900,
|
| 909 |
+
"train_runtime": 2830.9247,
|
| 910 |
+
"train_tokens_per_second": 1396.214
|
| 911 |
},
|
| 912 |
{
|
| 913 |
"epoch": 1.9580193756727664,
|
| 914 |
+
"grad_norm": 1.0387197732925415,
|
| 915 |
+
"learning_rate": 2.7075027101165706e-06,
|
| 916 |
+
"loss": 0.0971,
|
| 917 |
+
"num_input_tokens_seen": 3996416,
|
| 918 |
"step": 910,
|
| 919 |
+
"train_runtime": 2862.0695,
|
| 920 |
+
"train_tokens_per_second": 1396.338
|
| 921 |
},
|
| 922 |
{
|
| 923 |
"epoch": 1.9795479009687837,
|
| 924 |
+
"grad_norm": 3.794166326522827,
|
| 925 |
+
"learning_rate": 2.6080237849305467e-06,
|
| 926 |
+
"loss": 0.132,
|
| 927 |
+
"num_input_tokens_seen": 4040736,
|
| 928 |
"step": 920,
|
| 929 |
+
"train_runtime": 2893.2903,
|
| 930 |
+
"train_tokens_per_second": 1396.589
|
| 931 |
},
|
| 932 |
{
|
| 933 |
"epoch": 2.0,
|
| 934 |
+
"grad_norm": 1.547866702079773,
|
| 935 |
+
"learning_rate": 2.5097579408321264e-06,
|
| 936 |
+
"loss": 0.093,
|
| 937 |
+
"num_input_tokens_seen": 4083200,
|
| 938 |
"step": 930,
|
| 939 |
+
"train_runtime": 2923.2158,
|
| 940 |
+
"train_tokens_per_second": 1396.818
|
| 941 |
},
|
| 942 |
{
|
| 943 |
"epoch": 2.0215285252960173,
|
| 944 |
+
"grad_norm": 3.5177085399627686,
|
| 945 |
+
"learning_rate": 2.4127550129477145e-06,
|
| 946 |
+
"loss": 0.1324,
|
| 947 |
+
"num_input_tokens_seen": 4127040,
|
| 948 |
"step": 940,
|
| 949 |
+
"train_runtime": 2954.2784,
|
| 950 |
+
"train_tokens_per_second": 1396.971
|
| 951 |
},
|
| 952 |
{
|
| 953 |
"epoch": 2.0430570505920342,
|
| 954 |
+
"grad_norm": 1.8717275857925415,
|
| 955 |
+
"learning_rate": 2.317064195920852e-06,
|
| 956 |
+
"loss": 0.0841,
|
| 957 |
+
"num_input_tokens_seen": 4170816,
|
| 958 |
"step": 950,
|
| 959 |
+
"train_runtime": 2985.3333,
|
| 960 |
+
"train_tokens_per_second": 1397.102
|
| 961 |
},
|
| 962 |
{
|
| 963 |
"epoch": 2.0645855758880516,
|
| 964 |
+
"grad_norm": 1.233929991722107,
|
| 965 |
+
"learning_rate": 2.2227340189633508e-06,
|
| 966 |
+
"loss": 0.1138,
|
| 967 |
+
"num_input_tokens_seen": 4214272,
|
| 968 |
"step": 960,
|
| 969 |
+
"train_runtime": 3016.1559,
|
| 970 |
+
"train_tokens_per_second": 1397.233
|
| 971 |
},
|
| 972 |
{
|
| 973 |
"epoch": 2.086114101184069,
|
| 974 |
+
"grad_norm": 1.6053682565689087,
|
| 975 |
+
"learning_rate": 2.1298123212439028e-06,
|
| 976 |
+
"loss": 0.0892,
|
| 977 |
+
"num_input_tokens_seen": 4258592,
|
| 978 |
"step": 970,
|
| 979 |
+
"train_runtime": 3047.3824,
|
| 980 |
+
"train_tokens_per_second": 1397.459
|
| 981 |
},
|
| 982 |
{
|
| 983 |
"epoch": 2.1076426264800863,
|
| 984 |
+
"grad_norm": 2.4293172359466553,
|
| 985 |
+
"learning_rate": 2.0383462276266347e-06,
|
| 986 |
+
"loss": 0.1277,
|
| 987 |
+
"num_input_tokens_seen": 4302656,
|
| 988 |
"step": 980,
|
| 989 |
+
"train_runtime": 3078.5923,
|
| 990 |
+
"train_tokens_per_second": 1397.605
|
| 991 |
},
|
| 992 |
{
|
| 993 |
"epoch": 2.129171151776103,
|
| 994 |
+
"grad_norm": 2.0637197494506836,
|
| 995 |
+
"learning_rate": 1.948382124771927e-06,
|
| 996 |
+
"loss": 0.0968,
|
| 997 |
+
"num_input_tokens_seen": 4345888,
|
| 998 |
"step": 990,
|
| 999 |
+
"train_runtime": 3109.3083,
|
| 1000 |
+
"train_tokens_per_second": 1397.703
|
| 1001 |
},
|
| 1002 |
{
|
| 1003 |
"epoch": 2.1506996770721205,
|
| 1004 |
+
"grad_norm": 3.5659446716308594,
|
| 1005 |
+
"learning_rate": 1.8599656376116026e-06,
|
| 1006 |
+
"loss": 0.1226,
|
| 1007 |
+
"num_input_tokens_seen": 4390528,
|
| 1008 |
"step": 1000,
|
| 1009 |
+
"train_runtime": 3140.7259,
|
| 1010 |
+
"train_tokens_per_second": 1397.934
|
| 1011 |
},
|
| 1012 |
{
|
| 1013 |
"epoch": 2.172228202368138,
|
| 1014 |
+
"grad_norm": 3.0801503658294678,
|
| 1015 |
+
"learning_rate": 1.773141606210431e-06,
|
| 1016 |
+
"loss": 0.1201,
|
| 1017 |
+
"num_input_tokens_seen": 4434784,
|
| 1018 |
"step": 1010,
|
| 1019 |
+
"train_runtime": 3178.3674,
|
| 1020 |
+
"train_tokens_per_second": 1395.303
|
| 1021 |
},
|
| 1022 |
{
|
| 1023 |
"epoch": 2.193756727664155,
|
| 1024 |
+
"grad_norm": 2.0641636848449707,
|
| 1025 |
+
"learning_rate": 1.687954063025663e-06,
|
| 1026 |
+
"loss": 0.0966,
|
| 1027 |
+
"num_input_tokens_seen": 4478976,
|
| 1028 |
"step": 1020,
|
| 1029 |
+
"train_runtime": 3209.6721,
|
| 1030 |
+
"train_tokens_per_second": 1395.462
|
| 1031 |
},
|
| 1032 |
{
|
| 1033 |
"epoch": 2.215285252960172,
|
| 1034 |
+
"grad_norm": 2.951422929763794,
|
| 1035 |
+
"learning_rate": 1.604446210576157e-06,
|
| 1036 |
+
"loss": 0.1143,
|
| 1037 |
+
"num_input_tokens_seen": 4523616,
|
| 1038 |
"step": 1030,
|
| 1039 |
+
"train_runtime": 3241.2178,
|
| 1040 |
+
"train_tokens_per_second": 1395.653
|
| 1041 |
},
|
| 1042 |
{
|
| 1043 |
"epoch": 2.2368137782561894,
|
| 1044 |
+
"grad_norm": 5.046944618225098,
|
| 1045 |
+
"learning_rate": 1.5226603995323897e-06,
|
| 1046 |
+
"loss": 0.1114,
|
| 1047 |
+
"num_input_tokens_seen": 4567264,
|
| 1048 |
"step": 1040,
|
| 1049 |
+
"train_runtime": 3272.1686,
|
| 1050 |
+
"train_tokens_per_second": 1395.791
|
| 1051 |
},
|
| 1052 |
{
|
| 1053 |
"epoch": 2.2583423035522068,
|
| 1054 |
+
"grad_norm": 1.3710857629776,
|
| 1055 |
+
"learning_rate": 1.4426381072384866e-06,
|
| 1056 |
+
"loss": 0.0981,
|
| 1057 |
+
"num_input_tokens_seen": 4611104,
|
| 1058 |
"step": 1050,
|
| 1059 |
+
"train_runtime": 3303.3652,
|
| 1060 |
+
"train_tokens_per_second": 1395.881
|
| 1061 |
},
|
| 1062 |
{
|
| 1063 |
"epoch": 2.2798708288482237,
|
| 1064 |
+
"grad_norm": 2.5878543853759766,
|
| 1065 |
+
"learning_rate": 1.3644199166771531e-06,
|
| 1066 |
+
"loss": 0.1135,
|
| 1067 |
+
"num_input_tokens_seen": 4655040,
|
| 1068 |
"step": 1060,
|
| 1069 |
+
"train_runtime": 3334.5323,
|
| 1070 |
+
"train_tokens_per_second": 1396.01
|
| 1071 |
},
|
| 1072 |
{
|
| 1073 |
"epoch": 2.301399354144241,
|
| 1074 |
+
"grad_norm": 2.481158494949341,
|
| 1075 |
+
"learning_rate": 1.2880454958881794e-06,
|
| 1076 |
+
"loss": 0.1081,
|
| 1077 |
+
"num_input_tokens_seen": 4698432,
|
| 1078 |
"step": 1070,
|
| 1079 |
+
"train_runtime": 3365.4557,
|
| 1080 |
+
"train_tokens_per_second": 1396.076
|
| 1081 |
},
|
| 1082 |
{
|
| 1083 |
"epoch": 2.3229278794402584,
|
| 1084 |
+
"grad_norm": 1.2142502069473267,
|
| 1085 |
+
"learning_rate": 1.2135535778509545e-06,
|
| 1086 |
+
"loss": 0.0685,
|
| 1087 |
+
"num_input_tokens_seen": 4742848,
|
| 1088 |
"step": 1080,
|
| 1089 |
+
"train_runtime": 3396.7938,
|
| 1090 |
+
"train_tokens_per_second": 1396.272
|
| 1091 |
},
|
| 1092 |
{
|
| 1093 |
"epoch": 2.3444564047362757,
|
| 1094 |
+
"grad_norm": 3.040208339691162,
|
| 1095 |
+
"learning_rate": 1.1409819408411898e-06,
|
| 1096 |
+
"loss": 0.0857,
|
| 1097 |
+
"num_input_tokens_seen": 4786944,
|
| 1098 |
"step": 1090,
|
| 1099 |
+
"train_runtime": 3427.8943,
|
| 1100 |
+
"train_tokens_per_second": 1396.468
|
| 1101 |
},
|
| 1102 |
{
|
| 1103 |
"epoch": 2.3659849300322926,
|
| 1104 |
+
"grad_norm": 1.4514607191085815,
|
| 1105 |
+
"learning_rate": 1.070367389271823e-06,
|
| 1106 |
+
"loss": 0.1008,
|
| 1107 |
+
"num_input_tokens_seen": 4830624,
|
| 1108 |
"step": 1100,
|
| 1109 |
+
"train_runtime": 3458.8433,
|
| 1110 |
+
"train_tokens_per_second": 1396.601
|
| 1111 |
},
|
| 1112 |
{
|
| 1113 |
"epoch": 2.38751345532831,
|
| 1114 |
+
"grad_norm": 3.533973455429077,
|
| 1115 |
+
"learning_rate": 1.001745735027801e-06,
|
| 1116 |
+
"loss": 0.1137,
|
| 1117 |
+
"num_input_tokens_seen": 4874944,
|
| 1118 |
"step": 1110,
|
| 1119 |
+
"train_runtime": 3490.3116,
|
| 1120 |
+
"train_tokens_per_second": 1396.707
|
| 1121 |
},
|
| 1122 |
{
|
| 1123 |
"epoch": 2.4090419806243273,
|
| 1124 |
+
"grad_norm": 4.195890426635742,
|
| 1125 |
+
"learning_rate": 9.351517793042408e-07,
|
| 1126 |
+
"loss": 0.1038,
|
| 1127 |
+
"num_input_tokens_seen": 4918496,
|
| 1128 |
"step": 1120,
|
| 1129 |
+
"train_runtime": 3521.354,
|
| 1130 |
+
"train_tokens_per_second": 1396.763
|
| 1131 |
},
|
| 1132 |
{
|
| 1133 |
"epoch": 2.4305705059203446,
|
| 1134 |
+
"grad_norm": 4.139116287231445,
|
| 1135 |
+
"learning_rate": 8.706192949571262e-07,
|
| 1136 |
+
"loss": 0.1194,
|
| 1137 |
+
"num_input_tokens_seen": 4961920,
|
| 1138 |
"step": 1130,
|
| 1139 |
+
"train_runtime": 3552.2441,
|
| 1140 |
+
"train_tokens_per_second": 1396.841
|
| 1141 |
},
|
| 1142 |
{
|
| 1143 |
"epoch": 2.4520990312163615,
|
| 1144 |
+
"grad_norm": 3.0998311042785645,
|
| 1145 |
+
"learning_rate": 8.081810093755537e-07,
|
| 1146 |
+
"loss": 0.1161,
|
| 1147 |
+
"num_input_tokens_seen": 5005440,
|
| 1148 |
"step": 1140,
|
| 1149 |
+
"train_runtime": 3583.1755,
|
| 1150 |
+
"train_tokens_per_second": 1396.928
|
| 1151 |
},
|
| 1152 |
{
|
| 1153 |
"epoch": 2.473627556512379,
|
| 1154 |
+
"grad_norm": 2.2539584636688232,
|
| 1155 |
+
"learning_rate": 7.478685878841629e-07,
|
| 1156 |
+
"loss": 0.1,
|
| 1157 |
+
"num_input_tokens_seen": 5049344,
|
| 1158 |
"step": 1150,
|
| 1159 |
+
"train_runtime": 3614.3079,
|
| 1160 |
+
"train_tokens_per_second": 1397.043
|
| 1161 |
},
|
| 1162 |
{
|
| 1163 |
"epoch": 2.495156081808396,
|
| 1164 |
+
"grad_norm": 3.1125545501708984,
|
| 1165 |
+
"learning_rate": 6.897126176841978e-07,
|
| 1166 |
+
"loss": 0.0996,
|
| 1167 |
+
"num_input_tokens_seen": 5092896,
|
| 1168 |
"step": 1160,
|
| 1169 |
+
"train_runtime": 3645.2176,
|
| 1170 |
+
"train_tokens_per_second": 1397.145
|
| 1171 |
},
|
| 1172 |
{
|
| 1173 |
"epoch": 2.5166846071044136,
|
| 1174 |
+
"grad_norm": 3.5130155086517334,
|
| 1175 |
+
"learning_rate": 6.337425923413276e-07,
|
| 1176 |
+
"loss": 0.0944,
|
| 1177 |
+
"num_input_tokens_seen": 5136928,
|
| 1178 |
"step": 1170,
|
| 1179 |
+
"train_runtime": 3676.3104,
|
| 1180 |
+
"train_tokens_per_second": 1397.305
|
| 1181 |
},
|
| 1182 |
{
|
| 1183 |
"epoch": 2.5382131324004304,
|
| 1184 |
+
"grad_norm": 2.059572696685791,
|
| 1185 |
+
"learning_rate": 5.799868968281075e-07,
|
| 1186 |
+
"loss": 0.08,
|
| 1187 |
+
"num_input_tokens_seen": 5180960,
|
| 1188 |
"step": 1180,
|
| 1189 |
+
"train_runtime": 3707.5494,
|
| 1190 |
+
"train_tokens_per_second": 1397.408
|
| 1191 |
},
|
| 1192 |
{
|
| 1193 |
"epoch": 2.559741657696448,
|
| 1194 |
+
"grad_norm": 4.341704845428467,
|
| 1195 |
+
"learning_rate": 5.284727931286526e-07,
|
| 1196 |
+
"loss": 0.0962,
|
| 1197 |
+
"num_input_tokens_seen": 5225376,
|
| 1198 |
"step": 1190,
|
| 1199 |
+
"train_runtime": 3738.9161,
|
| 1200 |
+
"train_tokens_per_second": 1397.564
|
| 1201 |
},
|
| 1202 |
{
|
| 1203 |
"epoch": 2.581270182992465,
|
| 1204 |
+
"grad_norm": 2.8424837589263916,
|
| 1205 |
+
"learning_rate": 4.792264064128327e-07,
|
| 1206 |
+
"loss": 0.094,
|
| 1207 |
+
"num_input_tokens_seen": 5268992,
|
| 1208 |
"step": 1200,
|
| 1209 |
+
"train_runtime": 3769.9587,
|
| 1210 |
+
"train_tokens_per_second": 1397.626
|
| 1211 |
},
|
| 1212 |
{
|
| 1213 |
"epoch": 2.602798708288482,
|
| 1214 |
+
"grad_norm": 3.76309871673584,
|
| 1215 |
+
"learning_rate": 4.322727117869951e-07,
|
| 1216 |
+
"loss": 0.1005,
|
| 1217 |
+
"num_input_tokens_seen": 5312992,
|
| 1218 |
"step": 1210,
|
| 1219 |
+
"train_runtime": 3801.0547,
|
| 1220 |
+
"train_tokens_per_second": 1397.768
|
| 1221 |
},
|
| 1222 |
{
|
| 1223 |
"epoch": 2.6243272335844994,
|
| 1224 |
+
"grad_norm": 2.470759153366089,
|
| 1225 |
+
"learning_rate": 3.8763552162794983e-07,
|
| 1226 |
+
"loss": 0.1167,
|
| 1227 |
+
"num_input_tokens_seen": 5356448,
|
| 1228 |
"step": 1220,
|
| 1229 |
+
"train_runtime": 3831.9201,
|
| 1230 |
+
"train_tokens_per_second": 1397.85
|
| 1231 |
},
|
| 1232 |
{
|
| 1233 |
"epoch": 2.6458557588805167,
|
| 1234 |
+
"grad_norm": 2.948512315750122,
|
| 1235 |
+
"learning_rate": 3.453374735066034e-07,
|
| 1236 |
+
"loss": 0.0907,
|
| 1237 |
+
"num_input_tokens_seen": 5400672,
|
| 1238 |
"step": 1230,
|
| 1239 |
+
"train_runtime": 3863.178,
|
| 1240 |
+
"train_tokens_per_second": 1397.987
|
| 1241 |
},
|
| 1242 |
{
|
| 1243 |
"epoch": 2.667384284176534,
|
| 1244 |
+
"grad_norm": 2.082956552505493,
|
| 1245 |
+
"learning_rate": 3.054000187074224e-07,
|
| 1246 |
+
"loss": 0.1074,
|
| 1247 |
+
"num_input_tokens_seen": 5444576,
|
| 1248 |
"step": 1240,
|
| 1249 |
+
"train_runtime": 3894.1783,
|
| 1250 |
+
"train_tokens_per_second": 1398.132
|
| 1251 |
},
|
| 1252 |
{
|
| 1253 |
"epoch": 2.6889128094725514,
|
| 1254 |
+
"grad_norm": 2.035034656524658,
|
| 1255 |
+
"learning_rate": 2.678434113494882e-07,
|
| 1256 |
+
"loss": 0.1128,
|
| 1257 |
+
"num_input_tokens_seen": 5488160,
|
| 1258 |
"step": 1250,
|
| 1259 |
+
"train_runtime": 3925.0458,
|
| 1260 |
+
"train_tokens_per_second": 1398.241
|
| 1261 |
},
|
| 1262 |
{
|
| 1263 |
"epoch": 2.7104413347685683,
|
| 1264 |
+
"grad_norm": 3.7168209552764893,
|
| 1265 |
+
"learning_rate": 2.326866981147091e-07,
|
| 1266 |
+
"loss": 0.1016,
|
| 1267 |
+
"num_input_tokens_seen": 5532000,
|
| 1268 |
"step": 1260,
|
| 1269 |
+
"train_runtime": 3956.0804,
|
| 1270 |
+
"train_tokens_per_second": 1398.354
|
| 1271 |
},
|
| 1272 |
{
|
| 1273 |
"epoch": 2.7319698600645856,
|
| 1274 |
+
"grad_norm": 4.349425315856934,
|
| 1275 |
+
"learning_rate": 1.999477085883711e-07,
|
| 1276 |
+
"loss": 0.1052,
|
| 1277 |
+
"num_input_tokens_seen": 5575808,
|
| 1278 |
"step": 1270,
|
| 1279 |
+
"train_runtime": 3987.1129,
|
| 1280 |
+
"train_tokens_per_second": 1398.458
|
| 1281 |
},
|
| 1282 |
{
|
| 1283 |
"epoch": 2.7534983853606025,
|
| 1284 |
+
"grad_norm": 1.8204060792922974,
|
| 1285 |
+
"learning_rate": 1.6964304621693516e-07,
|
| 1286 |
+
"loss": 0.0918,
|
| 1287 |
+
"num_input_tokens_seen": 5619200,
|
| 1288 |
"step": 1280,
|
| 1289 |
+
"train_runtime": 4017.8653,
|
| 1290 |
+
"train_tokens_per_second": 1398.554
|
| 1291 |
},
|
| 1292 |
{
|
| 1293 |
"epoch": 2.77502691065662,
|
| 1294 |
+
"grad_norm": 3.752577066421509,
|
| 1295 |
+
"learning_rate": 1.4178807988766419e-07,
|
| 1296 |
+
"loss": 0.109,
|
| 1297 |
+
"num_input_tokens_seen": 5662656,
|
| 1298 |
"step": 1290,
|
| 1299 |
+
"train_runtime": 4048.795,
|
| 1300 |
+
"train_tokens_per_second": 1398.603
|
| 1301 |
},
|
| 1302 |
{
|
| 1303 |
"epoch": 2.7965554359526372,
|
| 1304 |
+
"grad_norm": 3.749866247177124,
|
| 1305 |
+
"learning_rate": 1.1639693613435921e-07,
|
| 1306 |
+
"loss": 0.1224,
|
| 1307 |
+
"num_input_tokens_seen": 5706656,
|
| 1308 |
"step": 1300,
|
| 1309 |
+
"train_runtime": 4079.9279,
|
| 1310 |
+
"train_tokens_per_second": 1398.715
|
| 1311 |
},
|
| 1312 |
{
|
| 1313 |
"epoch": 2.8180839612486546,
|
| 1314 |
+
"grad_norm": 2.628767251968384,
|
| 1315 |
+
"learning_rate": 9.348249197313918e-08,
|
| 1316 |
+
"loss": 0.0992,
|
| 1317 |
+
"num_input_tokens_seen": 5751232,
|
| 1318 |
"step": 1310,
|
| 1319 |
+
"train_runtime": 4111.4798,
|
| 1320 |
+
"train_tokens_per_second": 1398.823
|
| 1321 |
},
|
| 1322 |
{
|
| 1323 |
"epoch": 2.839612486544672,
|
| 1324 |
+
"grad_norm": 0.7992174625396729,
|
| 1325 |
+
"learning_rate": 7.305636837191876e-08,
|
| 1326 |
+
"loss": 0.107,
|
| 1327 |
+
"num_input_tokens_seen": 5794976,
|
| 1328 |
"step": 1320,
|
| 1329 |
+
"train_runtime": 4142.503,
|
| 1330 |
+
"train_tokens_per_second": 1398.907
|
| 1331 |
},
|
| 1332 |
{
|
| 1333 |
"epoch": 2.861141011840689,
|
| 1334 |
+
"grad_norm": 3.0042312145233154,
|
| 1335 |
+
"learning_rate": 5.512892435687645e-08,
|
| 1336 |
+
"loss": 0.0944,
|
| 1337 |
+
"num_input_tokens_seen": 5838368,
|
| 1338 |
"step": 1330,
|
| 1339 |
+
"train_runtime": 4173.35,
|
| 1340 |
+
"train_tokens_per_second": 1398.964
|
| 1341 |
},
|
| 1342 |
{
|
| 1343 |
"epoch": 2.882669537136706,
|
| 1344 |
+
"grad_norm": 3.208315134048462,
|
| 1345 |
+
"learning_rate": 3.970925175892093e-08,
|
| 1346 |
+
"loss": 0.0867,
|
| 1347 |
+
"num_input_tokens_seen": 5881984,
|
| 1348 |
"step": 1340,
|
| 1349 |
+
"train_runtime": 4204.3268,
|
| 1350 |
+
"train_tokens_per_second": 1399.031
|
| 1351 |
},
|
| 1352 |
{
|
| 1353 |
"epoch": 2.9041980624327235,
|
| 1354 |
+
"grad_norm": 3.5772690773010254,
|
| 1355 |
+
"learning_rate": 2.6805170602803297e-08,
|
| 1356 |
+
"loss": 0.1075,
|
| 1357 |
+
"num_input_tokens_seen": 5925664,
|
| 1358 |
"step": 1350,
|
| 1359 |
+
"train_runtime": 4235.1869,
|
| 1360 |
+
"train_tokens_per_second": 1399.151
|
| 1361 |
},
|
| 1362 |
{
|
| 1363 |
"epoch": 2.9257265877287404,
|
| 1364 |
+
"grad_norm": 3.261751413345337,
|
| 1365 |
+
"learning_rate": 1.6423225141223854e-08,
|
| 1366 |
+
"loss": 0.1042,
|
| 1367 |
+
"num_input_tokens_seen": 5969408,
|
| 1368 |
"step": 1360,
|
| 1369 |
+
"train_runtime": 4266.2069,
|
| 1370 |
+
"train_tokens_per_second": 1399.231
|
| 1371 |
},
|
| 1372 |
{
|
| 1373 |
"epoch": 2.9472551130247577,
|
| 1374 |
+
"grad_norm": 4.744147300720215,
|
| 1375 |
+
"learning_rate": 8.568680535939177e-09,
|
| 1376 |
+
"loss": 0.0964,
|
| 1377 |
+
"num_input_tokens_seen": 6012576,
|
| 1378 |
"step": 1370,
|
| 1379 |
+
"train_runtime": 4297.0229,
|
| 1380 |
+
"train_tokens_per_second": 1399.242
|
| 1381 |
},
|
| 1382 |
{
|
| 1383 |
"epoch": 2.968783638320775,
|
| 1384 |
+
"grad_norm": 2.3966517448425293,
|
| 1385 |
+
"learning_rate": 3.2455201875586372e-09,
|
| 1386 |
+
"loss": 0.0922,
|
| 1387 |
+
"num_input_tokens_seen": 6056000,
|
| 1388 |
"step": 1380,
|
| 1389 |
+
"train_runtime": 4328.462,
|
| 1390 |
+
"train_tokens_per_second": 1399.111
|
| 1391 |
},
|
| 1392 |
{
|
| 1393 |
"epoch": 2.9903121636167924,
|
| 1394 |
+
"grad_norm": 1.2950575351715088,
|
| 1395 |
+
"learning_rate": 4.5644371537756363e-10,
|
| 1396 |
+
"loss": 0.115,
|
| 1397 |
+
"num_input_tokens_seen": 6100192,
|
| 1398 |
"step": 1390,
|
| 1399 |
+
"train_runtime": 4359.7222,
|
| 1400 |
+
"train_tokens_per_second": 1399.216
|
| 1401 |
},
|
| 1402 |
{
|
| 1403 |
"epoch": 3.0,
|
| 1404 |
+
"num_input_tokens_seen": 6120032,
|
| 1405 |
"step": 1395,
|
| 1406 |
+
"total_flos": 4.115769119160883e+17,
|
| 1407 |
+
"train_loss": 0.1491297289889346,
|
| 1408 |
+
"train_runtime": 4379.932,
|
| 1409 |
+
"train_samples_per_second": 2.545,
|
| 1410 |
+
"train_steps_per_second": 0.318
|
| 1411 |
}
|
| 1412 |
],
|
| 1413 |
"logging_steps": 10,
|
| 1414 |
"max_steps": 1395,
|
| 1415 |
+
"num_input_tokens_seen": 6120032,
|
| 1416 |
"num_train_epochs": 3,
|
| 1417 |
"save_steps": 1000,
|
| 1418 |
"stateful_callbacks": {
|
|
|
|
| 1427 |
"attributes": {}
|
| 1428 |
}
|
| 1429 |
},
|
| 1430 |
+
"total_flos": 4.115769119160883e+17,
|
| 1431 |
"train_batch_size": 4,
|
| 1432 |
"trial_name": null,
|
| 1433 |
"trial_params": null
|
training_args.bin
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 6161
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:57039f57f730004d2db4291a164c9a267ccb02be9b83d34e8933cba3e52ae325
|
| 3 |
size 6161
|
training_args.yaml
CHANGED
|
@@ -1,3 +1,4 @@
|
|
|
|
|
| 1 |
cutoff_len: 2048
|
| 2 |
dataset: treino_pt_rde3
|
| 3 |
dataset_dir: data
|
|
@@ -7,14 +8,13 @@ double_quantization: true
|
|
| 7 |
enable_thinking: true
|
| 8 |
finetuning_type: lora
|
| 9 |
flash_attn: auto
|
| 10 |
-
fp16: true
|
| 11 |
freeze_multi_modal_projector: true
|
| 12 |
freeze_vision_tower: true
|
| 13 |
gradient_accumulation_steps: 2
|
| 14 |
image_max_pixels: 589824
|
| 15 |
image_min_pixels: 1024
|
| 16 |
include_num_input_tokens_seen: true
|
| 17 |
-
learning_rate:
|
| 18 |
logging_steps: 10
|
| 19 |
lora_alpha: 16
|
| 20 |
lora_dropout: 0
|
|
@@ -36,7 +36,7 @@ quantization_method: bnb
|
|
| 36 |
report_to: none
|
| 37 |
save_steps: 1000
|
| 38 |
stage: sft
|
| 39 |
-
template:
|
| 40 |
trust_remote_code: true
|
| 41 |
use_unsloth: true
|
| 42 |
video_max_pixels: 65536
|
|
|
|
| 1 |
+
bf16: true
|
| 2 |
cutoff_len: 2048
|
| 3 |
dataset: treino_pt_rde3
|
| 4 |
dataset_dir: data
|
|
|
|
| 8 |
enable_thinking: true
|
| 9 |
finetuning_type: lora
|
| 10 |
flash_attn: auto
|
|
|
|
| 11 |
freeze_multi_modal_projector: true
|
| 12 |
freeze_vision_tower: true
|
| 13 |
gradient_accumulation_steps: 2
|
| 14 |
image_max_pixels: 589824
|
| 15 |
image_min_pixels: 1024
|
| 16 |
include_num_input_tokens_seen: true
|
| 17 |
+
learning_rate: 1.0e-05
|
| 18 |
logging_steps: 10
|
| 19 |
lora_alpha: 16
|
| 20 |
lora_dropout: 0
|
|
|
|
| 36 |
report_to: none
|
| 37 |
save_steps: 1000
|
| 38 |
stage: sft
|
| 39 |
+
template: gemma3
|
| 40 |
trust_remote_code: true
|
| 41 |
use_unsloth: true
|
| 42 |
video_max_pixels: 65536
|
training_loss.png
CHANGED
|
|