Auto upload zain 2026-08-12T22:45:12.055248 (part 2)
Browse files- zain/Activation/out/glu-situglu-100L_run/checkpoint-400/trainer_state.json +174 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-400/training_args.bin +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/config.json +36 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/model.safetensors +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/optimizer.pt +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/rng_state.pth +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/scheduler.pt +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/tokenizer.json +0 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/tokenizer_config.json +13 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/trainer_state.json +209 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-500/training_args.bin +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/config.json +36 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/model.safetensors +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/optimizer.pt +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/rng_state.pth +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/scheduler.pt +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/tokenizer.json +0 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/tokenizer_config.json +13 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/trainer_state.json +244 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-600/training_args.bin +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/config.json +36 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/model.safetensors +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/optimizer.pt +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/rng_state.pth +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/scheduler.pt +3 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/tokenizer.json +0 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/tokenizer_config.json +13 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/trainer_state.json +279 -0
- zain/Activation/out/glu-situglu-100L_run/checkpoint-700/training_args.bin +3 -0
- zain/Activation/out/glu-situglu-100L_run/training_log.jsonl +38 -0
zain/Activation/out/glu-situglu-100L_run/checkpoint-400/trainer_state.json
ADDED
|
@@ -0,0 +1,174 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.026963262554769128,
|
| 6 |
+
"eval_steps": 2498,
|
| 7 |
+
"global_step": 400,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.0013481631277384564,
|
| 14 |
+
"grad_norm": 2.078125,
|
| 15 |
+
"learning_rate": 2.66e-05,
|
| 16 |
+
"loss": 8.299653625488281,
|
| 17 |
+
"step": 20
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.002696326255476913,
|
| 21 |
+
"grad_norm": 1.3515625,
|
| 22 |
+
"learning_rate": 5.46e-05,
|
| 23 |
+
"loss": 8.04769058227539,
|
| 24 |
+
"step": 40
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.004044489383215369,
|
| 28 |
+
"grad_norm": 1.2734375,
|
| 29 |
+
"learning_rate": 8.259999999999999e-05,
|
| 30 |
+
"loss": 7.8379150390625,
|
| 31 |
+
"step": 60
|
| 32 |
+
},
|
| 33 |
+
{
|
| 34 |
+
"epoch": 0.005392652510953826,
|
| 35 |
+
"grad_norm": 1.265625,
|
| 36 |
+
"learning_rate": 0.0001106,
|
| 37 |
+
"loss": 7.572837066650391,
|
| 38 |
+
"step": 80
|
| 39 |
+
},
|
| 40 |
+
{
|
| 41 |
+
"epoch": 0.006740815638692282,
|
| 42 |
+
"grad_norm": 1.1953125,
|
| 43 |
+
"learning_rate": 0.0001386,
|
| 44 |
+
"loss": 7.233182525634765,
|
| 45 |
+
"step": 100
|
| 46 |
+
},
|
| 47 |
+
{
|
| 48 |
+
"epoch": 0.008088978766430738,
|
| 49 |
+
"grad_norm": 1.1328125,
|
| 50 |
+
"learning_rate": 0.00016659999999999998,
|
| 51 |
+
"loss": 6.860689544677735,
|
| 52 |
+
"step": 120
|
| 53 |
+
},
|
| 54 |
+
{
|
| 55 |
+
"epoch": 0.009437141894169195,
|
| 56 |
+
"grad_norm": 0.94921875,
|
| 57 |
+
"learning_rate": 0.00019460000000000001,
|
| 58 |
+
"loss": 6.517751312255859,
|
| 59 |
+
"step": 140
|
| 60 |
+
},
|
| 61 |
+
{
|
| 62 |
+
"epoch": 0.010785305021907651,
|
| 63 |
+
"grad_norm": 0.8046875,
|
| 64 |
+
"learning_rate": 0.0002226,
|
| 65 |
+
"loss": 6.239968109130859,
|
| 66 |
+
"step": 160
|
| 67 |
+
},
|
| 68 |
+
{
|
| 69 |
+
"epoch": 0.012133468149646108,
|
| 70 |
+
"grad_norm": 0.6640625,
|
| 71 |
+
"learning_rate": 0.00025059999999999997,
|
| 72 |
+
"loss": 6.041232299804688,
|
| 73 |
+
"step": 180
|
| 74 |
+
},
|
| 75 |
+
{
|
| 76 |
+
"epoch": 0.013481631277384564,
|
| 77 |
+
"grad_norm": 0.5234375,
|
| 78 |
+
"learning_rate": 0.0002786,
|
| 79 |
+
"loss": 5.863973999023438,
|
| 80 |
+
"step": 200
|
| 81 |
+
},
|
| 82 |
+
{
|
| 83 |
+
"epoch": 0.01482979440512302,
|
| 84 |
+
"grad_norm": 1.375,
|
| 85 |
+
"learning_rate": 0.00030659999999999997,
|
| 86 |
+
"loss": 5.692941665649414,
|
| 87 |
+
"step": 220
|
| 88 |
+
},
|
| 89 |
+
{
|
| 90 |
+
"epoch": 0.016177957532861477,
|
| 91 |
+
"grad_norm": 0.875,
|
| 92 |
+
"learning_rate": 0.0003346,
|
| 93 |
+
"loss": 5.484311294555664,
|
| 94 |
+
"step": 240
|
| 95 |
+
},
|
| 96 |
+
{
|
| 97 |
+
"epoch": 0.01752612066059993,
|
| 98 |
+
"grad_norm": 1.25,
|
| 99 |
+
"learning_rate": 0.00036260000000000003,
|
| 100 |
+
"loss": 5.25721549987793,
|
| 101 |
+
"step": 260
|
| 102 |
+
},
|
| 103 |
+
{
|
| 104 |
+
"epoch": 0.01887428378833839,
|
| 105 |
+
"grad_norm": 0.8125,
|
| 106 |
+
"learning_rate": 0.0003906,
|
| 107 |
+
"loss": 5.028667831420899,
|
| 108 |
+
"step": 280
|
| 109 |
+
},
|
| 110 |
+
{
|
| 111 |
+
"epoch": 0.020222446916076844,
|
| 112 |
+
"grad_norm": 0.75390625,
|
| 113 |
+
"learning_rate": 0.0004186,
|
| 114 |
+
"loss": 4.791546249389649,
|
| 115 |
+
"step": 300
|
| 116 |
+
},
|
| 117 |
+
{
|
| 118 |
+
"epoch": 0.021570610043815303,
|
| 119 |
+
"grad_norm": 0.875,
|
| 120 |
+
"learning_rate": 0.0004466,
|
| 121 |
+
"loss": 4.598950958251953,
|
| 122 |
+
"step": 320
|
| 123 |
+
},
|
| 124 |
+
{
|
| 125 |
+
"epoch": 0.022918773171553757,
|
| 126 |
+
"grad_norm": 0.8125,
|
| 127 |
+
"learning_rate": 0.00047460000000000004,
|
| 128 |
+
"loss": 4.41942024230957,
|
| 129 |
+
"step": 340
|
| 130 |
+
},
|
| 131 |
+
{
|
| 132 |
+
"epoch": 0.024266936299292215,
|
| 133 |
+
"grad_norm": 0.890625,
|
| 134 |
+
"learning_rate": 0.0005026,
|
| 135 |
+
"loss": 4.27253303527832,
|
| 136 |
+
"step": 360
|
| 137 |
+
},
|
| 138 |
+
{
|
| 139 |
+
"epoch": 0.02561509942703067,
|
| 140 |
+
"grad_norm": 1.2734375,
|
| 141 |
+
"learning_rate": 0.0005306,
|
| 142 |
+
"loss": 4.1283222198486325,
|
| 143 |
+
"step": 380
|
| 144 |
+
},
|
| 145 |
+
{
|
| 146 |
+
"epoch": 0.026963262554769128,
|
| 147 |
+
"grad_norm": 0.54296875,
|
| 148 |
+
"learning_rate": 0.0005586,
|
| 149 |
+
"loss": 3.9935020446777343,
|
| 150 |
+
"step": 400
|
| 151 |
+
}
|
| 152 |
+
],
|
| 153 |
+
"logging_steps": 20,
|
| 154 |
+
"max_steps": 2500,
|
| 155 |
+
"num_input_tokens_seen": 0,
|
| 156 |
+
"num_train_epochs": 1,
|
| 157 |
+
"save_steps": 100,
|
| 158 |
+
"stateful_callbacks": {
|
| 159 |
+
"TrainerControl": {
|
| 160 |
+
"args": {
|
| 161 |
+
"should_epoch_stop": false,
|
| 162 |
+
"should_evaluate": false,
|
| 163 |
+
"should_log": false,
|
| 164 |
+
"should_save": true,
|
| 165 |
+
"should_training_stop": false
|
| 166 |
+
},
|
| 167 |
+
"attributes": {}
|
| 168 |
+
}
|
| 169 |
+
},
|
| 170 |
+
"total_flos": 1290513521049600.0,
|
| 171 |
+
"train_batch_size": 64,
|
| 172 |
+
"trial_name": null,
|
| 173 |
+
"trial_params": null
|
| 174 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-400/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:26b99898fe48ff0e75b1f0139845f22400023db32e87c8fca3404fda1b772936
|
| 3 |
+
size 4920
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/config.json
ADDED
|
@@ -0,0 +1,36 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"activation": "situglu",
|
| 3 |
+
"architectures": [
|
| 4 |
+
"TinyLlamaForCausalLM"
|
| 5 |
+
],
|
| 6 |
+
"attention_bias": false,
|
| 7 |
+
"attention_dropout": 0.0,
|
| 8 |
+
"bos_token_id": 1,
|
| 9 |
+
"dtype": "bfloat16",
|
| 10 |
+
"eos_token_id": 2,
|
| 11 |
+
"head_dim": 32,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 128,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 256,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"mlp_type": "glu",
|
| 19 |
+
"model_type": "tiny_llama",
|
| 20 |
+
"num_attention_heads": 4,
|
| 21 |
+
"num_hidden_layers": 100,
|
| 22 |
+
"num_key_value_heads": 4,
|
| 23 |
+
"pad_token_id": 0,
|
| 24 |
+
"pretraining_tp": 1,
|
| 25 |
+
"rms_norm_eps": 1e-06,
|
| 26 |
+
"rope_parameters": {
|
| 27 |
+
"rope_theta": 10000.0,
|
| 28 |
+
"rope_type": "default"
|
| 29 |
+
},
|
| 30 |
+
"tie_word_embeddings": true,
|
| 31 |
+
"tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
|
| 32 |
+
"transformers_version": "5.16.0.dev0",
|
| 33 |
+
"use_cache": false,
|
| 34 |
+
"vocab_size": 4096,
|
| 35 |
+
"waleed_beta": 10.0
|
| 36 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c72023f1c9d5c3865d8b75100580803262637a2d476a60bde58ffad870c06dbc
|
| 3 |
+
size 33967272
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f81e6cacb36707fadaa86cd24ef9ed323b600912f2fdc8276612e4cc4caf3861
|
| 3 |
+
size 68504996
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9d9cd6a0487226e5bd30d1846894c82af483733ab4381b75bae9c0745e05d405
|
| 3 |
+
size 14244
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6ad40e275c0c46c262ecd103385af8fb68cf3f382102b4f63937b0dbd1c69cfc
|
| 3 |
+
size 1064
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/tokenizer_config.json
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": false,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<|endoftext|>",
|
| 5 |
+
"eos_token": "<|endoftext|>",
|
| 6 |
+
"errors": "replace",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 1024,
|
| 10 |
+
"pad_token": "<|endoftext|>",
|
| 11 |
+
"tokenizer_class": "GPT2Tokenizer",
|
| 12 |
+
"unk_token": "<|endoftext|>"
|
| 13 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/trainer_state.json
ADDED
|
@@ -0,0 +1,209 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.03370407819346141,
|
| 6 |
+
"eval_steps": 2498,
|
| 7 |
+
"global_step": 500,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.0013481631277384564,
|
| 14 |
+
"grad_norm": 2.078125,
|
| 15 |
+
"learning_rate": 2.66e-05,
|
| 16 |
+
"loss": 8.299653625488281,
|
| 17 |
+
"step": 20
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.002696326255476913,
|
| 21 |
+
"grad_norm": 1.3515625,
|
| 22 |
+
"learning_rate": 5.46e-05,
|
| 23 |
+
"loss": 8.04769058227539,
|
| 24 |
+
"step": 40
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.004044489383215369,
|
| 28 |
+
"grad_norm": 1.2734375,
|
| 29 |
+
"learning_rate": 8.259999999999999e-05,
|
| 30 |
+
"loss": 7.8379150390625,
|
| 31 |
+
"step": 60
|
| 32 |
+
},
|
| 33 |
+
{
|
| 34 |
+
"epoch": 0.005392652510953826,
|
| 35 |
+
"grad_norm": 1.265625,
|
| 36 |
+
"learning_rate": 0.0001106,
|
| 37 |
+
"loss": 7.572837066650391,
|
| 38 |
+
"step": 80
|
| 39 |
+
},
|
| 40 |
+
{
|
| 41 |
+
"epoch": 0.006740815638692282,
|
| 42 |
+
"grad_norm": 1.1953125,
|
| 43 |
+
"learning_rate": 0.0001386,
|
| 44 |
+
"loss": 7.233182525634765,
|
| 45 |
+
"step": 100
|
| 46 |
+
},
|
| 47 |
+
{
|
| 48 |
+
"epoch": 0.008088978766430738,
|
| 49 |
+
"grad_norm": 1.1328125,
|
| 50 |
+
"learning_rate": 0.00016659999999999998,
|
| 51 |
+
"loss": 6.860689544677735,
|
| 52 |
+
"step": 120
|
| 53 |
+
},
|
| 54 |
+
{
|
| 55 |
+
"epoch": 0.009437141894169195,
|
| 56 |
+
"grad_norm": 0.94921875,
|
| 57 |
+
"learning_rate": 0.00019460000000000001,
|
| 58 |
+
"loss": 6.517751312255859,
|
| 59 |
+
"step": 140
|
| 60 |
+
},
|
| 61 |
+
{
|
| 62 |
+
"epoch": 0.010785305021907651,
|
| 63 |
+
"grad_norm": 0.8046875,
|
| 64 |
+
"learning_rate": 0.0002226,
|
| 65 |
+
"loss": 6.239968109130859,
|
| 66 |
+
"step": 160
|
| 67 |
+
},
|
| 68 |
+
{
|
| 69 |
+
"epoch": 0.012133468149646108,
|
| 70 |
+
"grad_norm": 0.6640625,
|
| 71 |
+
"learning_rate": 0.00025059999999999997,
|
| 72 |
+
"loss": 6.041232299804688,
|
| 73 |
+
"step": 180
|
| 74 |
+
},
|
| 75 |
+
{
|
| 76 |
+
"epoch": 0.013481631277384564,
|
| 77 |
+
"grad_norm": 0.5234375,
|
| 78 |
+
"learning_rate": 0.0002786,
|
| 79 |
+
"loss": 5.863973999023438,
|
| 80 |
+
"step": 200
|
| 81 |
+
},
|
| 82 |
+
{
|
| 83 |
+
"epoch": 0.01482979440512302,
|
| 84 |
+
"grad_norm": 1.375,
|
| 85 |
+
"learning_rate": 0.00030659999999999997,
|
| 86 |
+
"loss": 5.692941665649414,
|
| 87 |
+
"step": 220
|
| 88 |
+
},
|
| 89 |
+
{
|
| 90 |
+
"epoch": 0.016177957532861477,
|
| 91 |
+
"grad_norm": 0.875,
|
| 92 |
+
"learning_rate": 0.0003346,
|
| 93 |
+
"loss": 5.484311294555664,
|
| 94 |
+
"step": 240
|
| 95 |
+
},
|
| 96 |
+
{
|
| 97 |
+
"epoch": 0.01752612066059993,
|
| 98 |
+
"grad_norm": 1.25,
|
| 99 |
+
"learning_rate": 0.00036260000000000003,
|
| 100 |
+
"loss": 5.25721549987793,
|
| 101 |
+
"step": 260
|
| 102 |
+
},
|
| 103 |
+
{
|
| 104 |
+
"epoch": 0.01887428378833839,
|
| 105 |
+
"grad_norm": 0.8125,
|
| 106 |
+
"learning_rate": 0.0003906,
|
| 107 |
+
"loss": 5.028667831420899,
|
| 108 |
+
"step": 280
|
| 109 |
+
},
|
| 110 |
+
{
|
| 111 |
+
"epoch": 0.020222446916076844,
|
| 112 |
+
"grad_norm": 0.75390625,
|
| 113 |
+
"learning_rate": 0.0004186,
|
| 114 |
+
"loss": 4.791546249389649,
|
| 115 |
+
"step": 300
|
| 116 |
+
},
|
| 117 |
+
{
|
| 118 |
+
"epoch": 0.021570610043815303,
|
| 119 |
+
"grad_norm": 0.875,
|
| 120 |
+
"learning_rate": 0.0004466,
|
| 121 |
+
"loss": 4.598950958251953,
|
| 122 |
+
"step": 320
|
| 123 |
+
},
|
| 124 |
+
{
|
| 125 |
+
"epoch": 0.022918773171553757,
|
| 126 |
+
"grad_norm": 0.8125,
|
| 127 |
+
"learning_rate": 0.00047460000000000004,
|
| 128 |
+
"loss": 4.41942024230957,
|
| 129 |
+
"step": 340
|
| 130 |
+
},
|
| 131 |
+
{
|
| 132 |
+
"epoch": 0.024266936299292215,
|
| 133 |
+
"grad_norm": 0.890625,
|
| 134 |
+
"learning_rate": 0.0005026,
|
| 135 |
+
"loss": 4.27253303527832,
|
| 136 |
+
"step": 360
|
| 137 |
+
},
|
| 138 |
+
{
|
| 139 |
+
"epoch": 0.02561509942703067,
|
| 140 |
+
"grad_norm": 1.2734375,
|
| 141 |
+
"learning_rate": 0.0005306,
|
| 142 |
+
"loss": 4.1283222198486325,
|
| 143 |
+
"step": 380
|
| 144 |
+
},
|
| 145 |
+
{
|
| 146 |
+
"epoch": 0.026963262554769128,
|
| 147 |
+
"grad_norm": 0.54296875,
|
| 148 |
+
"learning_rate": 0.0005586,
|
| 149 |
+
"loss": 3.9935020446777343,
|
| 150 |
+
"step": 400
|
| 151 |
+
},
|
| 152 |
+
{
|
| 153 |
+
"epoch": 0.028311425682507583,
|
| 154 |
+
"grad_norm": 0.546875,
|
| 155 |
+
"learning_rate": 0.0005866,
|
| 156 |
+
"loss": 3.885255813598633,
|
| 157 |
+
"step": 420
|
| 158 |
+
},
|
| 159 |
+
{
|
| 160 |
+
"epoch": 0.02965958881024604,
|
| 161 |
+
"grad_norm": 0.7890625,
|
| 162 |
+
"learning_rate": 0.0006146,
|
| 163 |
+
"loss": 3.821950912475586,
|
| 164 |
+
"step": 440
|
| 165 |
+
},
|
| 166 |
+
{
|
| 167 |
+
"epoch": 0.031007751937984496,
|
| 168 |
+
"grad_norm": 0.52734375,
|
| 169 |
+
"learning_rate": 0.0006426,
|
| 170 |
+
"loss": 3.7068336486816404,
|
| 171 |
+
"step": 460
|
| 172 |
+
},
|
| 173 |
+
{
|
| 174 |
+
"epoch": 0.032355915065722954,
|
| 175 |
+
"grad_norm": 0.6328125,
|
| 176 |
+
"learning_rate": 0.0006705999999999999,
|
| 177 |
+
"loss": 3.6370723724365233,
|
| 178 |
+
"step": 480
|
| 179 |
+
},
|
| 180 |
+
{
|
| 181 |
+
"epoch": 0.03370407819346141,
|
| 182 |
+
"grad_norm": 0.5625,
|
| 183 |
+
"learning_rate": 0.0006986,
|
| 184 |
+
"loss": 3.5550304412841798,
|
| 185 |
+
"step": 500
|
| 186 |
+
}
|
| 187 |
+
],
|
| 188 |
+
"logging_steps": 20,
|
| 189 |
+
"max_steps": 2500,
|
| 190 |
+
"num_input_tokens_seen": 0,
|
| 191 |
+
"num_train_epochs": 1,
|
| 192 |
+
"save_steps": 100,
|
| 193 |
+
"stateful_callbacks": {
|
| 194 |
+
"TrainerControl": {
|
| 195 |
+
"args": {
|
| 196 |
+
"should_epoch_stop": false,
|
| 197 |
+
"should_evaluate": false,
|
| 198 |
+
"should_log": false,
|
| 199 |
+
"should_save": true,
|
| 200 |
+
"should_training_stop": false
|
| 201 |
+
},
|
| 202 |
+
"attributes": {}
|
| 203 |
+
}
|
| 204 |
+
},
|
| 205 |
+
"total_flos": 1613141901312000.0,
|
| 206 |
+
"train_batch_size": 64,
|
| 207 |
+
"trial_name": null,
|
| 208 |
+
"trial_params": null
|
| 209 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-500/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:26b99898fe48ff0e75b1f0139845f22400023db32e87c8fca3404fda1b772936
|
| 3 |
+
size 4920
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/config.json
ADDED
|
@@ -0,0 +1,36 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"activation": "situglu",
|
| 3 |
+
"architectures": [
|
| 4 |
+
"TinyLlamaForCausalLM"
|
| 5 |
+
],
|
| 6 |
+
"attention_bias": false,
|
| 7 |
+
"attention_dropout": 0.0,
|
| 8 |
+
"bos_token_id": 1,
|
| 9 |
+
"dtype": "bfloat16",
|
| 10 |
+
"eos_token_id": 2,
|
| 11 |
+
"head_dim": 32,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 128,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 256,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"mlp_type": "glu",
|
| 19 |
+
"model_type": "tiny_llama",
|
| 20 |
+
"num_attention_heads": 4,
|
| 21 |
+
"num_hidden_layers": 100,
|
| 22 |
+
"num_key_value_heads": 4,
|
| 23 |
+
"pad_token_id": 0,
|
| 24 |
+
"pretraining_tp": 1,
|
| 25 |
+
"rms_norm_eps": 1e-06,
|
| 26 |
+
"rope_parameters": {
|
| 27 |
+
"rope_theta": 10000.0,
|
| 28 |
+
"rope_type": "default"
|
| 29 |
+
},
|
| 30 |
+
"tie_word_embeddings": true,
|
| 31 |
+
"tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
|
| 32 |
+
"transformers_version": "5.16.0.dev0",
|
| 33 |
+
"use_cache": false,
|
| 34 |
+
"vocab_size": 4096,
|
| 35 |
+
"waleed_beta": 10.0
|
| 36 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:af6a728e4484a52b424b29bb69cbad64e967148c990ee48574300521062c93d8
|
| 3 |
+
size 33967272
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:40695dc8028a8fe6e509c5567380be726596372e62ea7b6f6e4e258da754db5a
|
| 3 |
+
size 68504996
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9d9cd6a0487226e5bd30d1846894c82af483733ab4381b75bae9c0745e05d405
|
| 3 |
+
size 14244
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:43a21235ddd7c8c0020d887652dce105923f094e2bc54766bffa71522037a007
|
| 3 |
+
size 1064
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/tokenizer_config.json
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": false,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<|endoftext|>",
|
| 5 |
+
"eos_token": "<|endoftext|>",
|
| 6 |
+
"errors": "replace",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 1024,
|
| 10 |
+
"pad_token": "<|endoftext|>",
|
| 11 |
+
"tokenizer_class": "GPT2Tokenizer",
|
| 12 |
+
"unk_token": "<|endoftext|>"
|
| 13 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/trainer_state.json
ADDED
|
@@ -0,0 +1,244 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.04044489383215369,
|
| 6 |
+
"eval_steps": 2498,
|
| 7 |
+
"global_step": 600,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.0013481631277384564,
|
| 14 |
+
"grad_norm": 2.078125,
|
| 15 |
+
"learning_rate": 2.66e-05,
|
| 16 |
+
"loss": 8.299653625488281,
|
| 17 |
+
"step": 20
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.002696326255476913,
|
| 21 |
+
"grad_norm": 1.3515625,
|
| 22 |
+
"learning_rate": 5.46e-05,
|
| 23 |
+
"loss": 8.04769058227539,
|
| 24 |
+
"step": 40
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.004044489383215369,
|
| 28 |
+
"grad_norm": 1.2734375,
|
| 29 |
+
"learning_rate": 8.259999999999999e-05,
|
| 30 |
+
"loss": 7.8379150390625,
|
| 31 |
+
"step": 60
|
| 32 |
+
},
|
| 33 |
+
{
|
| 34 |
+
"epoch": 0.005392652510953826,
|
| 35 |
+
"grad_norm": 1.265625,
|
| 36 |
+
"learning_rate": 0.0001106,
|
| 37 |
+
"loss": 7.572837066650391,
|
| 38 |
+
"step": 80
|
| 39 |
+
},
|
| 40 |
+
{
|
| 41 |
+
"epoch": 0.006740815638692282,
|
| 42 |
+
"grad_norm": 1.1953125,
|
| 43 |
+
"learning_rate": 0.0001386,
|
| 44 |
+
"loss": 7.233182525634765,
|
| 45 |
+
"step": 100
|
| 46 |
+
},
|
| 47 |
+
{
|
| 48 |
+
"epoch": 0.008088978766430738,
|
| 49 |
+
"grad_norm": 1.1328125,
|
| 50 |
+
"learning_rate": 0.00016659999999999998,
|
| 51 |
+
"loss": 6.860689544677735,
|
| 52 |
+
"step": 120
|
| 53 |
+
},
|
| 54 |
+
{
|
| 55 |
+
"epoch": 0.009437141894169195,
|
| 56 |
+
"grad_norm": 0.94921875,
|
| 57 |
+
"learning_rate": 0.00019460000000000001,
|
| 58 |
+
"loss": 6.517751312255859,
|
| 59 |
+
"step": 140
|
| 60 |
+
},
|
| 61 |
+
{
|
| 62 |
+
"epoch": 0.010785305021907651,
|
| 63 |
+
"grad_norm": 0.8046875,
|
| 64 |
+
"learning_rate": 0.0002226,
|
| 65 |
+
"loss": 6.239968109130859,
|
| 66 |
+
"step": 160
|
| 67 |
+
},
|
| 68 |
+
{
|
| 69 |
+
"epoch": 0.012133468149646108,
|
| 70 |
+
"grad_norm": 0.6640625,
|
| 71 |
+
"learning_rate": 0.00025059999999999997,
|
| 72 |
+
"loss": 6.041232299804688,
|
| 73 |
+
"step": 180
|
| 74 |
+
},
|
| 75 |
+
{
|
| 76 |
+
"epoch": 0.013481631277384564,
|
| 77 |
+
"grad_norm": 0.5234375,
|
| 78 |
+
"learning_rate": 0.0002786,
|
| 79 |
+
"loss": 5.863973999023438,
|
| 80 |
+
"step": 200
|
| 81 |
+
},
|
| 82 |
+
{
|
| 83 |
+
"epoch": 0.01482979440512302,
|
| 84 |
+
"grad_norm": 1.375,
|
| 85 |
+
"learning_rate": 0.00030659999999999997,
|
| 86 |
+
"loss": 5.692941665649414,
|
| 87 |
+
"step": 220
|
| 88 |
+
},
|
| 89 |
+
{
|
| 90 |
+
"epoch": 0.016177957532861477,
|
| 91 |
+
"grad_norm": 0.875,
|
| 92 |
+
"learning_rate": 0.0003346,
|
| 93 |
+
"loss": 5.484311294555664,
|
| 94 |
+
"step": 240
|
| 95 |
+
},
|
| 96 |
+
{
|
| 97 |
+
"epoch": 0.01752612066059993,
|
| 98 |
+
"grad_norm": 1.25,
|
| 99 |
+
"learning_rate": 0.00036260000000000003,
|
| 100 |
+
"loss": 5.25721549987793,
|
| 101 |
+
"step": 260
|
| 102 |
+
},
|
| 103 |
+
{
|
| 104 |
+
"epoch": 0.01887428378833839,
|
| 105 |
+
"grad_norm": 0.8125,
|
| 106 |
+
"learning_rate": 0.0003906,
|
| 107 |
+
"loss": 5.028667831420899,
|
| 108 |
+
"step": 280
|
| 109 |
+
},
|
| 110 |
+
{
|
| 111 |
+
"epoch": 0.020222446916076844,
|
| 112 |
+
"grad_norm": 0.75390625,
|
| 113 |
+
"learning_rate": 0.0004186,
|
| 114 |
+
"loss": 4.791546249389649,
|
| 115 |
+
"step": 300
|
| 116 |
+
},
|
| 117 |
+
{
|
| 118 |
+
"epoch": 0.021570610043815303,
|
| 119 |
+
"grad_norm": 0.875,
|
| 120 |
+
"learning_rate": 0.0004466,
|
| 121 |
+
"loss": 4.598950958251953,
|
| 122 |
+
"step": 320
|
| 123 |
+
},
|
| 124 |
+
{
|
| 125 |
+
"epoch": 0.022918773171553757,
|
| 126 |
+
"grad_norm": 0.8125,
|
| 127 |
+
"learning_rate": 0.00047460000000000004,
|
| 128 |
+
"loss": 4.41942024230957,
|
| 129 |
+
"step": 340
|
| 130 |
+
},
|
| 131 |
+
{
|
| 132 |
+
"epoch": 0.024266936299292215,
|
| 133 |
+
"grad_norm": 0.890625,
|
| 134 |
+
"learning_rate": 0.0005026,
|
| 135 |
+
"loss": 4.27253303527832,
|
| 136 |
+
"step": 360
|
| 137 |
+
},
|
| 138 |
+
{
|
| 139 |
+
"epoch": 0.02561509942703067,
|
| 140 |
+
"grad_norm": 1.2734375,
|
| 141 |
+
"learning_rate": 0.0005306,
|
| 142 |
+
"loss": 4.1283222198486325,
|
| 143 |
+
"step": 380
|
| 144 |
+
},
|
| 145 |
+
{
|
| 146 |
+
"epoch": 0.026963262554769128,
|
| 147 |
+
"grad_norm": 0.54296875,
|
| 148 |
+
"learning_rate": 0.0005586,
|
| 149 |
+
"loss": 3.9935020446777343,
|
| 150 |
+
"step": 400
|
| 151 |
+
},
|
| 152 |
+
{
|
| 153 |
+
"epoch": 0.028311425682507583,
|
| 154 |
+
"grad_norm": 0.546875,
|
| 155 |
+
"learning_rate": 0.0005866,
|
| 156 |
+
"loss": 3.885255813598633,
|
| 157 |
+
"step": 420
|
| 158 |
+
},
|
| 159 |
+
{
|
| 160 |
+
"epoch": 0.02965958881024604,
|
| 161 |
+
"grad_norm": 0.7890625,
|
| 162 |
+
"learning_rate": 0.0006146,
|
| 163 |
+
"loss": 3.821950912475586,
|
| 164 |
+
"step": 440
|
| 165 |
+
},
|
| 166 |
+
{
|
| 167 |
+
"epoch": 0.031007751937984496,
|
| 168 |
+
"grad_norm": 0.52734375,
|
| 169 |
+
"learning_rate": 0.0006426,
|
| 170 |
+
"loss": 3.7068336486816404,
|
| 171 |
+
"step": 460
|
| 172 |
+
},
|
| 173 |
+
{
|
| 174 |
+
"epoch": 0.032355915065722954,
|
| 175 |
+
"grad_norm": 0.6328125,
|
| 176 |
+
"learning_rate": 0.0006705999999999999,
|
| 177 |
+
"loss": 3.6370723724365233,
|
| 178 |
+
"step": 480
|
| 179 |
+
},
|
| 180 |
+
{
|
| 181 |
+
"epoch": 0.03370407819346141,
|
| 182 |
+
"grad_norm": 0.5625,
|
| 183 |
+
"learning_rate": 0.0006986,
|
| 184 |
+
"loss": 3.5550304412841798,
|
| 185 |
+
"step": 500
|
| 186 |
+
},
|
| 187 |
+
{
|
| 188 |
+
"epoch": 0.03505224132119986,
|
| 189 |
+
"grad_norm": 0.47265625,
|
| 190 |
+
"learning_rate": 0.0007,
|
| 191 |
+
"loss": 3.4874305725097656,
|
| 192 |
+
"step": 520
|
| 193 |
+
},
|
| 194 |
+
{
|
| 195 |
+
"epoch": 0.03640040444893832,
|
| 196 |
+
"grad_norm": 0.6328125,
|
| 197 |
+
"learning_rate": 0.0007,
|
| 198 |
+
"loss": 3.414617919921875,
|
| 199 |
+
"step": 540
|
| 200 |
+
},
|
| 201 |
+
{
|
| 202 |
+
"epoch": 0.03774856757667678,
|
| 203 |
+
"grad_norm": 0.478515625,
|
| 204 |
+
"learning_rate": 0.0007,
|
| 205 |
+
"loss": 3.3621952056884767,
|
| 206 |
+
"step": 560
|
| 207 |
+
},
|
| 208 |
+
{
|
| 209 |
+
"epoch": 0.03909673070441524,
|
| 210 |
+
"grad_norm": 0.478515625,
|
| 211 |
+
"learning_rate": 0.0007,
|
| 212 |
+
"loss": 3.301148223876953,
|
| 213 |
+
"step": 580
|
| 214 |
+
},
|
| 215 |
+
{
|
| 216 |
+
"epoch": 0.04044489383215369,
|
| 217 |
+
"grad_norm": 0.44140625,
|
| 218 |
+
"learning_rate": 0.0007,
|
| 219 |
+
"loss": 3.266124725341797,
|
| 220 |
+
"step": 600
|
| 221 |
+
}
|
| 222 |
+
],
|
| 223 |
+
"logging_steps": 20,
|
| 224 |
+
"max_steps": 2500,
|
| 225 |
+
"num_input_tokens_seen": 0,
|
| 226 |
+
"num_train_epochs": 1,
|
| 227 |
+
"save_steps": 100,
|
| 228 |
+
"stateful_callbacks": {
|
| 229 |
+
"TrainerControl": {
|
| 230 |
+
"args": {
|
| 231 |
+
"should_epoch_stop": false,
|
| 232 |
+
"should_evaluate": false,
|
| 233 |
+
"should_log": false,
|
| 234 |
+
"should_save": true,
|
| 235 |
+
"should_training_stop": false
|
| 236 |
+
},
|
| 237 |
+
"attributes": {}
|
| 238 |
+
}
|
| 239 |
+
},
|
| 240 |
+
"total_flos": 1935770281574400.0,
|
| 241 |
+
"train_batch_size": 64,
|
| 242 |
+
"trial_name": null,
|
| 243 |
+
"trial_params": null
|
| 244 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-600/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:26b99898fe48ff0e75b1f0139845f22400023db32e87c8fca3404fda1b772936
|
| 3 |
+
size 4920
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/config.json
ADDED
|
@@ -0,0 +1,36 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"activation": "situglu",
|
| 3 |
+
"architectures": [
|
| 4 |
+
"TinyLlamaForCausalLM"
|
| 5 |
+
],
|
| 6 |
+
"attention_bias": false,
|
| 7 |
+
"attention_dropout": 0.0,
|
| 8 |
+
"bos_token_id": 1,
|
| 9 |
+
"dtype": "bfloat16",
|
| 10 |
+
"eos_token_id": 2,
|
| 11 |
+
"head_dim": 32,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 128,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 256,
|
| 16 |
+
"max_position_embeddings": 512,
|
| 17 |
+
"mlp_bias": false,
|
| 18 |
+
"mlp_type": "glu",
|
| 19 |
+
"model_type": "tiny_llama",
|
| 20 |
+
"num_attention_heads": 4,
|
| 21 |
+
"num_hidden_layers": 100,
|
| 22 |
+
"num_key_value_heads": 4,
|
| 23 |
+
"pad_token_id": 0,
|
| 24 |
+
"pretraining_tp": 1,
|
| 25 |
+
"rms_norm_eps": 1e-06,
|
| 26 |
+
"rope_parameters": {
|
| 27 |
+
"rope_theta": 10000.0,
|
| 28 |
+
"rope_type": "default"
|
| 29 |
+
},
|
| 30 |
+
"tie_word_embeddings": true,
|
| 31 |
+
"tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
|
| 32 |
+
"transformers_version": "5.16.0.dev0",
|
| 33 |
+
"use_cache": false,
|
| 34 |
+
"vocab_size": 4096,
|
| 35 |
+
"waleed_beta": 10.0
|
| 36 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0b2e6f6ff772ac66fe0662150942d14cef48a594c5c6bdd588e8ba36d3f242bf
|
| 3 |
+
size 33967272
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/optimizer.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d730f3d1537749179427a36a7c0e4cad5d77a0b2f5f5e679f5ac845b3a211bb6
|
| 3 |
+
size 68504996
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/rng_state.pth
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9d9cd6a0487226e5bd30d1846894c82af483733ab4381b75bae9c0745e05d405
|
| 3 |
+
size 14244
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/scheduler.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:8aac662062525611dd137fd05108444d17dfbd69f137e40e8a3651bb69d2ba7e
|
| 3 |
+
size 1064
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/tokenizer_config.json
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"add_prefix_space": false,
|
| 3 |
+
"backend": "tokenizers",
|
| 4 |
+
"bos_token": "<|endoftext|>",
|
| 5 |
+
"eos_token": "<|endoftext|>",
|
| 6 |
+
"errors": "replace",
|
| 7 |
+
"is_local": false,
|
| 8 |
+
"local_files_only": false,
|
| 9 |
+
"model_max_length": 1024,
|
| 10 |
+
"pad_token": "<|endoftext|>",
|
| 11 |
+
"tokenizer_class": "GPT2Tokenizer",
|
| 12 |
+
"unk_token": "<|endoftext|>"
|
| 13 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/trainer_state.json
ADDED
|
@@ -0,0 +1,279 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"best_global_step": null,
|
| 3 |
+
"best_metric": null,
|
| 4 |
+
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.04718570947084597,
|
| 6 |
+
"eval_steps": 2498,
|
| 7 |
+
"global_step": 700,
|
| 8 |
+
"is_hyper_param_search": false,
|
| 9 |
+
"is_local_process_zero": true,
|
| 10 |
+
"is_world_process_zero": true,
|
| 11 |
+
"log_history": [
|
| 12 |
+
{
|
| 13 |
+
"epoch": 0.0013481631277384564,
|
| 14 |
+
"grad_norm": 2.078125,
|
| 15 |
+
"learning_rate": 2.66e-05,
|
| 16 |
+
"loss": 8.299653625488281,
|
| 17 |
+
"step": 20
|
| 18 |
+
},
|
| 19 |
+
{
|
| 20 |
+
"epoch": 0.002696326255476913,
|
| 21 |
+
"grad_norm": 1.3515625,
|
| 22 |
+
"learning_rate": 5.46e-05,
|
| 23 |
+
"loss": 8.04769058227539,
|
| 24 |
+
"step": 40
|
| 25 |
+
},
|
| 26 |
+
{
|
| 27 |
+
"epoch": 0.004044489383215369,
|
| 28 |
+
"grad_norm": 1.2734375,
|
| 29 |
+
"learning_rate": 8.259999999999999e-05,
|
| 30 |
+
"loss": 7.8379150390625,
|
| 31 |
+
"step": 60
|
| 32 |
+
},
|
| 33 |
+
{
|
| 34 |
+
"epoch": 0.005392652510953826,
|
| 35 |
+
"grad_norm": 1.265625,
|
| 36 |
+
"learning_rate": 0.0001106,
|
| 37 |
+
"loss": 7.572837066650391,
|
| 38 |
+
"step": 80
|
| 39 |
+
},
|
| 40 |
+
{
|
| 41 |
+
"epoch": 0.006740815638692282,
|
| 42 |
+
"grad_norm": 1.1953125,
|
| 43 |
+
"learning_rate": 0.0001386,
|
| 44 |
+
"loss": 7.233182525634765,
|
| 45 |
+
"step": 100
|
| 46 |
+
},
|
| 47 |
+
{
|
| 48 |
+
"epoch": 0.008088978766430738,
|
| 49 |
+
"grad_norm": 1.1328125,
|
| 50 |
+
"learning_rate": 0.00016659999999999998,
|
| 51 |
+
"loss": 6.860689544677735,
|
| 52 |
+
"step": 120
|
| 53 |
+
},
|
| 54 |
+
{
|
| 55 |
+
"epoch": 0.009437141894169195,
|
| 56 |
+
"grad_norm": 0.94921875,
|
| 57 |
+
"learning_rate": 0.00019460000000000001,
|
| 58 |
+
"loss": 6.517751312255859,
|
| 59 |
+
"step": 140
|
| 60 |
+
},
|
| 61 |
+
{
|
| 62 |
+
"epoch": 0.010785305021907651,
|
| 63 |
+
"grad_norm": 0.8046875,
|
| 64 |
+
"learning_rate": 0.0002226,
|
| 65 |
+
"loss": 6.239968109130859,
|
| 66 |
+
"step": 160
|
| 67 |
+
},
|
| 68 |
+
{
|
| 69 |
+
"epoch": 0.012133468149646108,
|
| 70 |
+
"grad_norm": 0.6640625,
|
| 71 |
+
"learning_rate": 0.00025059999999999997,
|
| 72 |
+
"loss": 6.041232299804688,
|
| 73 |
+
"step": 180
|
| 74 |
+
},
|
| 75 |
+
{
|
| 76 |
+
"epoch": 0.013481631277384564,
|
| 77 |
+
"grad_norm": 0.5234375,
|
| 78 |
+
"learning_rate": 0.0002786,
|
| 79 |
+
"loss": 5.863973999023438,
|
| 80 |
+
"step": 200
|
| 81 |
+
},
|
| 82 |
+
{
|
| 83 |
+
"epoch": 0.01482979440512302,
|
| 84 |
+
"grad_norm": 1.375,
|
| 85 |
+
"learning_rate": 0.00030659999999999997,
|
| 86 |
+
"loss": 5.692941665649414,
|
| 87 |
+
"step": 220
|
| 88 |
+
},
|
| 89 |
+
{
|
| 90 |
+
"epoch": 0.016177957532861477,
|
| 91 |
+
"grad_norm": 0.875,
|
| 92 |
+
"learning_rate": 0.0003346,
|
| 93 |
+
"loss": 5.484311294555664,
|
| 94 |
+
"step": 240
|
| 95 |
+
},
|
| 96 |
+
{
|
| 97 |
+
"epoch": 0.01752612066059993,
|
| 98 |
+
"grad_norm": 1.25,
|
| 99 |
+
"learning_rate": 0.00036260000000000003,
|
| 100 |
+
"loss": 5.25721549987793,
|
| 101 |
+
"step": 260
|
| 102 |
+
},
|
| 103 |
+
{
|
| 104 |
+
"epoch": 0.01887428378833839,
|
| 105 |
+
"grad_norm": 0.8125,
|
| 106 |
+
"learning_rate": 0.0003906,
|
| 107 |
+
"loss": 5.028667831420899,
|
| 108 |
+
"step": 280
|
| 109 |
+
},
|
| 110 |
+
{
|
| 111 |
+
"epoch": 0.020222446916076844,
|
| 112 |
+
"grad_norm": 0.75390625,
|
| 113 |
+
"learning_rate": 0.0004186,
|
| 114 |
+
"loss": 4.791546249389649,
|
| 115 |
+
"step": 300
|
| 116 |
+
},
|
| 117 |
+
{
|
| 118 |
+
"epoch": 0.021570610043815303,
|
| 119 |
+
"grad_norm": 0.875,
|
| 120 |
+
"learning_rate": 0.0004466,
|
| 121 |
+
"loss": 4.598950958251953,
|
| 122 |
+
"step": 320
|
| 123 |
+
},
|
| 124 |
+
{
|
| 125 |
+
"epoch": 0.022918773171553757,
|
| 126 |
+
"grad_norm": 0.8125,
|
| 127 |
+
"learning_rate": 0.00047460000000000004,
|
| 128 |
+
"loss": 4.41942024230957,
|
| 129 |
+
"step": 340
|
| 130 |
+
},
|
| 131 |
+
{
|
| 132 |
+
"epoch": 0.024266936299292215,
|
| 133 |
+
"grad_norm": 0.890625,
|
| 134 |
+
"learning_rate": 0.0005026,
|
| 135 |
+
"loss": 4.27253303527832,
|
| 136 |
+
"step": 360
|
| 137 |
+
},
|
| 138 |
+
{
|
| 139 |
+
"epoch": 0.02561509942703067,
|
| 140 |
+
"grad_norm": 1.2734375,
|
| 141 |
+
"learning_rate": 0.0005306,
|
| 142 |
+
"loss": 4.1283222198486325,
|
| 143 |
+
"step": 380
|
| 144 |
+
},
|
| 145 |
+
{
|
| 146 |
+
"epoch": 0.026963262554769128,
|
| 147 |
+
"grad_norm": 0.54296875,
|
| 148 |
+
"learning_rate": 0.0005586,
|
| 149 |
+
"loss": 3.9935020446777343,
|
| 150 |
+
"step": 400
|
| 151 |
+
},
|
| 152 |
+
{
|
| 153 |
+
"epoch": 0.028311425682507583,
|
| 154 |
+
"grad_norm": 0.546875,
|
| 155 |
+
"learning_rate": 0.0005866,
|
| 156 |
+
"loss": 3.885255813598633,
|
| 157 |
+
"step": 420
|
| 158 |
+
},
|
| 159 |
+
{
|
| 160 |
+
"epoch": 0.02965958881024604,
|
| 161 |
+
"grad_norm": 0.7890625,
|
| 162 |
+
"learning_rate": 0.0006146,
|
| 163 |
+
"loss": 3.821950912475586,
|
| 164 |
+
"step": 440
|
| 165 |
+
},
|
| 166 |
+
{
|
| 167 |
+
"epoch": 0.031007751937984496,
|
| 168 |
+
"grad_norm": 0.52734375,
|
| 169 |
+
"learning_rate": 0.0006426,
|
| 170 |
+
"loss": 3.7068336486816404,
|
| 171 |
+
"step": 460
|
| 172 |
+
},
|
| 173 |
+
{
|
| 174 |
+
"epoch": 0.032355915065722954,
|
| 175 |
+
"grad_norm": 0.6328125,
|
| 176 |
+
"learning_rate": 0.0006705999999999999,
|
| 177 |
+
"loss": 3.6370723724365233,
|
| 178 |
+
"step": 480
|
| 179 |
+
},
|
| 180 |
+
{
|
| 181 |
+
"epoch": 0.03370407819346141,
|
| 182 |
+
"grad_norm": 0.5625,
|
| 183 |
+
"learning_rate": 0.0006986,
|
| 184 |
+
"loss": 3.5550304412841798,
|
| 185 |
+
"step": 500
|
| 186 |
+
},
|
| 187 |
+
{
|
| 188 |
+
"epoch": 0.03505224132119986,
|
| 189 |
+
"grad_norm": 0.47265625,
|
| 190 |
+
"learning_rate": 0.0007,
|
| 191 |
+
"loss": 3.4874305725097656,
|
| 192 |
+
"step": 520
|
| 193 |
+
},
|
| 194 |
+
{
|
| 195 |
+
"epoch": 0.03640040444893832,
|
| 196 |
+
"grad_norm": 0.6328125,
|
| 197 |
+
"learning_rate": 0.0007,
|
| 198 |
+
"loss": 3.414617919921875,
|
| 199 |
+
"step": 540
|
| 200 |
+
},
|
| 201 |
+
{
|
| 202 |
+
"epoch": 0.03774856757667678,
|
| 203 |
+
"grad_norm": 0.478515625,
|
| 204 |
+
"learning_rate": 0.0007,
|
| 205 |
+
"loss": 3.3621952056884767,
|
| 206 |
+
"step": 560
|
| 207 |
+
},
|
| 208 |
+
{
|
| 209 |
+
"epoch": 0.03909673070441524,
|
| 210 |
+
"grad_norm": 0.478515625,
|
| 211 |
+
"learning_rate": 0.0007,
|
| 212 |
+
"loss": 3.301148223876953,
|
| 213 |
+
"step": 580
|
| 214 |
+
},
|
| 215 |
+
{
|
| 216 |
+
"epoch": 0.04044489383215369,
|
| 217 |
+
"grad_norm": 0.44140625,
|
| 218 |
+
"learning_rate": 0.0007,
|
| 219 |
+
"loss": 3.266124725341797,
|
| 220 |
+
"step": 600
|
| 221 |
+
},
|
| 222 |
+
{
|
| 223 |
+
"epoch": 0.04179305695989215,
|
| 224 |
+
"grad_norm": 0.58203125,
|
| 225 |
+
"learning_rate": 0.0007,
|
| 226 |
+
"loss": 3.1991281509399414,
|
| 227 |
+
"step": 620
|
| 228 |
+
},
|
| 229 |
+
{
|
| 230 |
+
"epoch": 0.043141220087630605,
|
| 231 |
+
"grad_norm": 0.51953125,
|
| 232 |
+
"learning_rate": 0.0007,
|
| 233 |
+
"loss": 3.175183868408203,
|
| 234 |
+
"step": 640
|
| 235 |
+
},
|
| 236 |
+
{
|
| 237 |
+
"epoch": 0.044489383215369056,
|
| 238 |
+
"grad_norm": 0.443359375,
|
| 239 |
+
"learning_rate": 0.0007,
|
| 240 |
+
"loss": 3.1185443878173826,
|
| 241 |
+
"step": 660
|
| 242 |
+
},
|
| 243 |
+
{
|
| 244 |
+
"epoch": 0.045837546343107514,
|
| 245 |
+
"grad_norm": 0.447265625,
|
| 246 |
+
"learning_rate": 0.0007,
|
| 247 |
+
"loss": 3.091288757324219,
|
| 248 |
+
"step": 680
|
| 249 |
+
},
|
| 250 |
+
{
|
| 251 |
+
"epoch": 0.04718570947084597,
|
| 252 |
+
"grad_norm": 0.400390625,
|
| 253 |
+
"learning_rate": 0.0007,
|
| 254 |
+
"loss": 3.0479175567626955,
|
| 255 |
+
"step": 700
|
| 256 |
+
}
|
| 257 |
+
],
|
| 258 |
+
"logging_steps": 20,
|
| 259 |
+
"max_steps": 2500,
|
| 260 |
+
"num_input_tokens_seen": 0,
|
| 261 |
+
"num_train_epochs": 1,
|
| 262 |
+
"save_steps": 100,
|
| 263 |
+
"stateful_callbacks": {
|
| 264 |
+
"TrainerControl": {
|
| 265 |
+
"args": {
|
| 266 |
+
"should_epoch_stop": false,
|
| 267 |
+
"should_evaluate": false,
|
| 268 |
+
"should_log": false,
|
| 269 |
+
"should_save": true,
|
| 270 |
+
"should_training_stop": false
|
| 271 |
+
},
|
| 272 |
+
"attributes": {}
|
| 273 |
+
}
|
| 274 |
+
},
|
| 275 |
+
"total_flos": 2258398661836800.0,
|
| 276 |
+
"train_batch_size": 64,
|
| 277 |
+
"trial_name": null,
|
| 278 |
+
"trial_params": null
|
| 279 |
+
}
|
zain/Activation/out/glu-situglu-100L_run/checkpoint-700/training_args.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:26b99898fe48ff0e75b1f0139845f22400023db32e87c8fca3404fda1b772936
|
| 3 |
+
size 4920
|
zain/Activation/out/glu-situglu-100L_run/training_log.jsonl
ADDED
|
@@ -0,0 +1,38 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"step": 20, "epoch": 0.0013481631277384564, "timestamp": 1786574478.6078393, "loss": 8.299653625488281, "grad_norm": 2.078125, "learning_rate": 2.66e-05, "train/total_time_seconds": 5.533695328980684, "train/time_per_step_avg": 0.2766847664490342, "train/epoch_time_elapsed": 6.577135156840086, "train/estimated_remaining_minutes": 11.436303679893415}
|
| 2 |
+
{"step": 40, "epoch": 0.002696326255476913, "timestamp": 1786574484.8776257, "loss": 8.04769058227539, "grad_norm": 1.3515625, "learning_rate": 5.46e-05, "train/total_time_seconds": 10.852699480950832, "train/time_per_step_avg": 0.2713174870237708, "train/epoch_time_elapsed": 12.846922278404236, "train/estimated_remaining_minutes": 11.124016967974603}
|
| 3 |
+
{"step": 60, "epoch": 0.004044489383215369, "timestamp": 1786574491.1171036, "loss": 7.8379150390625, "grad_norm": 1.2734375, "learning_rate": 8.259999999999999e-05, "train/total_time_seconds": 16.144448928534985, "train/time_per_step_avg": 0.2690741488089164, "train/epoch_time_elapsed": 19.086400248110294, "train/estimated_remaining_minutes": 10.942348718229265}
|
| 4 |
+
{"step": 80, "epoch": 0.005392652510953826, "timestamp": 1786574497.38103, "loss": 7.572837066650391, "grad_norm": 1.265625, "learning_rate": 0.0001106, "train/total_time_seconds": 21.441417019814253, "train/time_per_step_avg": 0.26801771274767816, "train/epoch_time_elapsed": 25.35032656043768, "train/estimated_remaining_minutes": 10.810047747489685}
|
| 5 |
+
{"step": 100, "epoch": 0.006740815638692282, "timestamp": 1786574503.688846, "loss": 7.233182525634765, "grad_norm": 1.1953125, "learning_rate": 0.0001386, "train/total_time_seconds": 26.74744677171111, "train/time_per_step_avg": 0.2674744677171111, "train/epoch_time_elapsed": 31.65814283117652, "train/estimated_remaining_minutes": 10.698978708684443}
|
| 6 |
+
{"step": 120, "epoch": 0.008088978766430738, "timestamp": 1786574510.3158803, "loss": 6.860689544677735, "grad_norm": 1.1328125, "learning_rate": 0.00016659999999999998, "train/total_time_seconds": 32.103225629776716, "train/time_per_step_avg": 0.2656953030079603, "train/epoch_time_elapsed": 38.28517517820001, "train/estimated_remaining_minutes": 10.611899583176191}
|
| 7 |
+
{"step": 140, "epoch": 0.009437141894169195, "timestamp": 1786574516.5818565, "loss": 6.517751312255859, "grad_norm": 0.94921875, "learning_rate": 0.00019460000000000001, "train/total_time_seconds": 37.4054417796433, "train/time_per_step_avg": 0.26552742298692467, "train/epoch_time_elapsed": 44.55115310847759, "train/estimated_remaining_minutes": 10.50914792856645}
|
| 8 |
+
{"step": 160, "epoch": 0.010785305021907651, "timestamp": 1786574522.8408346, "loss": 6.239968109130859, "grad_norm": 0.8046875, "learning_rate": 0.0002226, "train/total_time_seconds": 42.69929559901357, "train/time_per_step_avg": 0.2655484667047858, "train/epoch_time_elapsed": 50.81013148650527, "train/estimated_remaining_minutes": 10.407953302259557}
|
| 9 |
+
{"step": 180, "epoch": 0.012133468149646108, "timestamp": 1786574529.1809292, "loss": 6.041232299804688, "grad_norm": 0.6640625, "learning_rate": 0.00025059999999999997, "train/total_time_seconds": 48.07227246835828, "train/time_per_step_avg": 0.2663085544854403, "train/epoch_time_elapsed": 57.15022452548146, "train/estimated_remaining_minutes": 10.326636308017704}
|
| 10 |
+
{"step": 200, "epoch": 0.013481631277384564, "timestamp": 1786574535.714883, "loss": 5.863973999023438, "grad_norm": 0.5234375, "learning_rate": 0.0002786, "train/total_time_seconds": 53.626166980713606, "train/time_per_step_avg": 0.26878720209002493, "train/epoch_time_elapsed": 63.68417948484421, "train/estimated_remaining_minutes": 10.27834867130344}
|
| 11 |
+
{"step": 220, "epoch": 0.01482979440512302, "timestamp": 1786574542.6790636, "loss": 5.692941665649414, "grad_norm": 1.375, "learning_rate": 0.00030659999999999997, "train/total_time_seconds": 59.30672527849674, "train/time_per_step_avg": 0.27203499648720025, "train/epoch_time_elapsed": 70.64836028963327, "train/estimated_remaining_minutes": 10.243888911740346}
|
| 12 |
+
{"step": 240, "epoch": 0.016177957532861477, "timestamp": 1786574548.9629416, "loss": 5.484311294555664, "grad_norm": 0.875, "learning_rate": 0.0003346, "train/total_time_seconds": 64.62455787137151, "train/time_per_step_avg": 0.2721911609172821, "train/epoch_time_elapsed": 76.93223825097084, "train/estimated_remaining_minutes": 10.142465332590252}
|
| 13 |
+
{"step": 260, "epoch": 0.01752612066059993, "timestamp": 1786574555.2635224, "loss": 5.25721549987793, "grad_norm": 1.25, "learning_rate": 0.00036260000000000003, "train/total_time_seconds": 69.94365423545241, "train/time_per_step_avg": 0.2724435863643885, "train/epoch_time_elapsed": 83.2328185737133, "train/estimated_remaining_minutes": 10.043191377398296}
|
| 14 |
+
{"step": 280, "epoch": 0.01887428378833839, "timestamp": 1786574561.585235, "loss": 5.028667831420899, "grad_norm": 0.8125, "learning_rate": 0.0003906, "train/total_time_seconds": 75.27913975343108, "train/time_per_step_avg": 0.27206867285072805, "train/epoch_time_elapsed": 89.55453195795417, "train/estimated_remaining_minutes": 9.947600610274822}
|
| 15 |
+
{"step": 300, "epoch": 0.020222446916076844, "timestamp": 1786574567.9139166, "loss": 4.791546249389649, "grad_norm": 0.75390625, "learning_rate": 0.0004186, "train/total_time_seconds": 80.60792702436447, "train/time_per_step_avg": 0.26981760043650865, "train/epoch_time_elapsed": 95.88321312144399, "train/estimated_remaining_minutes": 9.852079969644546}
|
| 16 |
+
{"step": 320, "epoch": 0.021570610043815303, "timestamp": 1786574574.5672615, "loss": 4.598950958251953, "grad_norm": 0.875, "learning_rate": 0.0004466, "train/total_time_seconds": 85.9880293123424, "train/time_per_step_avg": 0.26681304033845665, "train/epoch_time_elapsed": 102.53655807301402, "train/estimated_remaining_minutes": 9.763224161505544}
|
| 17 |
+
{"step": 340, "epoch": 0.022918773171553757, "timestamp": 1786574580.8542867, "loss": 4.41942024230957, "grad_norm": 0.8125, "learning_rate": 0.00047460000000000004, "train/total_time_seconds": 91.31005642563105, "train/time_per_step_avg": 0.2668549855425954, "train/epoch_time_elapsed": 108.82358324155211, "train/estimated_remaining_minutes": 9.668123621537404}
|
| 18 |
+
{"step": 360, "epoch": 0.024266936299292215, "timestamp": 1786574587.163612, "loss": 4.27253303527832, "grad_norm": 0.890625, "learning_rate": 0.0005026, "train/total_time_seconds": 96.64731953665614, "train/time_per_step_avg": 0.2670366530120373, "train/epoch_time_elapsed": 115.13290867209435, "train/estimated_remaining_minutes": 9.575243694835375}
|
| 19 |
+
{"step": 380, "epoch": 0.02561509942703067, "timestamp": 1786574593.4437447, "loss": 4.1283222198486325, "grad_norm": 1.2734375, "learning_rate": 0.0005306, "train/total_time_seconds": 101.96216157451272, "train/time_per_step_avg": 0.2668302182108164, "train/epoch_time_elapsed": 121.41304164752364, "train/estimated_remaining_minutes": 9.480692216577498}
|
| 20 |
+
{"step": 400, "epoch": 0.026963262554769128, "timestamp": 1786574600.017392, "loss": 3.9935020446777343, "grad_norm": 0.54296875, "learning_rate": 0.0005586, "train/total_time_seconds": 107.53365701809525, "train/time_per_step_avg": 0.26925729993730785, "train/epoch_time_elapsed": 127.98668835312128, "train/estimated_remaining_minutes": 9.409194989083336}
|
| 21 |
+
{"step": 420, "epoch": 0.028311425682507583, "timestamp": 1786574606.664945, "loss": 3.885255813598633, "grad_norm": 0.546875, "learning_rate": 0.0005866, "train/total_time_seconds": 112.89078459888697, "train/time_per_step_avg": 0.2690275528654456, "train/epoch_time_elapsed": 134.6342415958643, "train/estimated_remaining_minutes": 9.317969522447813}
|
| 22 |
+
{"step": 440, "epoch": 0.02965958881024604, "timestamp": 1786574613.038697, "loss": 3.821950912475586, "grad_norm": 0.7890625, "learning_rate": 0.0006146, "train/total_time_seconds": 118.25393801182508, "train/time_per_step_avg": 0.2694388158619404, "train/epoch_time_elapsed": 141.00799356028438, "train/estimated_remaining_minutes": 9.22739061758938}
|
| 23 |
+
{"step": 460, "epoch": 0.031007751937984496, "timestamp": 1786574619.3816445, "loss": 3.7068336486816404, "grad_norm": 0.52734375, "learning_rate": 0.0006426, "train/total_time_seconds": 123.59944036230445, "train/time_per_step_avg": 0.26952120825648307, "train/epoch_time_elapsed": 147.35094125196338, "train/estimated_remaining_minutes": 9.13561080938772}
|
| 24 |
+
{"step": 480, "epoch": 0.032355915065722954, "timestamp": 1786574625.742511, "loss": 3.6370723724365233, "grad_norm": 0.6328125, "learning_rate": 0.0006705999999999999, "train/total_time_seconds": 128.9706449471414, "train/time_per_step_avg": 0.2700848337262869, "train/epoch_time_elapsed": 153.71180725097656, "train/estimated_remaining_minutes": 9.045857735875892}
|
| 25 |
+
{"step": 500, "epoch": 0.03370407819346141, "timestamp": 1786574632.0688386, "loss": 3.5550304412841798, "grad_norm": 0.5625, "learning_rate": 0.0006986, "train/total_time_seconds": 134.30982853844762, "train/time_per_step_avg": 0.26776171520352365, "train/epoch_time_elapsed": 160.03813540562987, "train/estimated_remaining_minutes": 8.95398856922984}
|
| 26 |
+
{"step": 520, "epoch": 0.03505224132119986, "timestamp": 1786574638.7088253, "loss": 3.4874305725097656, "grad_norm": 0.47265625, "learning_rate": 0.0007, "train/total_time_seconds": 139.67404821142554, "train/time_per_step_avg": 0.26783263612538577, "train/epoch_time_elapsed": 166.67812218144536, "train/estimated_remaining_minutes": 8.863929982648159}
|
| 27 |
+
{"step": 540, "epoch": 0.03640040444893832, "timestamp": 1786574645.0168326, "loss": 3.414617919921875, "grad_norm": 0.6328125, "learning_rate": 0.0007, "train/total_time_seconds": 145.00912476703525, "train/time_per_step_avg": 0.2675518675521016, "train/epoch_time_elapsed": 172.98612849786878, "train/estimated_remaining_minutes": 8.772156930351516}
|
| 28 |
+
{"step": 560, "epoch": 0.03774856757667678, "timestamp": 1786574651.315112, "loss": 3.3621952056884767, "grad_norm": 0.478515625, "learning_rate": 0.0007, "train/total_time_seconds": 150.32971427217126, "train/time_per_step_avg": 0.2673027390986681, "train/epoch_time_elapsed": 179.28440859541297, "train/estimated_remaining_minutes": 8.679751359762268}
|
| 29 |
+
{"step": 580, "epoch": 0.03909673070441524, "timestamp": 1786574657.6687937, "loss": 3.301148223876953, "grad_norm": 0.478515625, "learning_rate": 0.0007, "train/total_time_seconds": 155.6691726744175, "train/time_per_step_avg": 0.2669852772727609, "train/epoch_time_elapsed": 185.63809048756957, "train/estimated_remaining_minutes": 8.588644009623033}
|
| 30 |
+
{"step": 600, "epoch": 0.04044489383215369, "timestamp": 1786574664.274563, "loss": 3.266124725341797, "grad_norm": 0.44140625, "learning_rate": 0.0007, "train/total_time_seconds": 161.24586637690663, "train/time_per_step_avg": 0.26936037838459015, "train/epoch_time_elapsed": 192.2438549697399, "train/estimated_remaining_minutes": 8.510198503225629}
|
| 31 |
+
{"step": 620, "epoch": 0.04179305695989215, "timestamp": 1786574670.9500022, "loss": 3.1991281509399414, "grad_norm": 0.58203125, "learning_rate": 0.0007, "train/total_time_seconds": 166.63569385558367, "train/time_per_step_avg": 0.2696164564415813, "train/epoch_time_elapsed": 198.919298350811, "train/estimated_remaining_minutes": 8.421373775497239}
|
| 32 |
+
{"step": 640, "epoch": 0.043141220087630605, "timestamp": 1786574677.2724392, "loss": 3.175183868408203, "grad_norm": 0.51953125, "learning_rate": 0.0007, "train/total_time_seconds": 171.97098869085312, "train/time_per_step_avg": 0.26961863923817875, "train/epoch_time_elapsed": 205.24173552542925, "train/estimated_remaining_minutes": 8.329844764713197}
|
| 33 |
+
{"step": 660, "epoch": 0.044489383215369056, "timestamp": 1786574683.574097, "loss": 3.1185443878173826, "grad_norm": 0.443359375, "learning_rate": 0.0007, "train/total_time_seconds": 177.30246318131685, "train/time_per_step_avg": 0.26972748909145594, "train/epoch_time_elapsed": 211.54339312389493, "train/estimated_remaining_minutes": 8.238296269030885}
|
| 34 |
+
{"step": 680, "epoch": 0.045837546343107514, "timestamp": 1786574689.957703, "loss": 3.091288757324219, "grad_norm": 0.447265625, "learning_rate": 0.0007, "train/total_time_seconds": 182.6907045468688, "train/time_per_step_avg": 0.27021531872451304, "train/epoch_time_elapsed": 217.92699952423573, "train/estimated_remaining_minutes": 8.149438291061305}
|
| 35 |
+
{"step": 700, "epoch": 0.04718570947084597, "timestamp": 1786574696.3050113, "loss": 3.0479175567626955, "grad_norm": 0.400390625, "learning_rate": 0.0007, "train/total_time_seconds": 188.0292291790247, "train/time_per_step_avg": 0.2678336280211806, "train/epoch_time_elapsed": 224.27430825307965, "train/estimated_remaining_minutes": 8.058395536243916}
|
| 36 |
+
{"step": 720, "epoch": 0.04853387259858443, "timestamp": 1786574702.9306242, "loss": 3.012004280090332, "grad_norm": 0.39453125, "learning_rate": 0.0007, "train/total_time_seconds": 193.37752113491297, "train/time_per_step_avg": 0.267418272793293, "train/epoch_time_elapsed": 230.89992128685117, "train/estimated_remaining_minutes": 7.967870083799655}
|
| 37 |
+
{"step": 740, "epoch": 0.04988203572632288, "timestamp": 1786574709.2385693, "loss": 2.973306655883789, "grad_norm": 0.40625, "learning_rate": 0.0007, "train/total_time_seconds": 198.70704197138548, "train/time_per_step_avg": 0.2673605328053236, "train/epoch_time_elapsed": 237.20786146447062, "train/estimated_remaining_minutes": 7.876675537604469}
|
| 38 |
+
{"step": 760, "epoch": 0.05123019885406134, "timestamp": 1786574715.6162934, "loss": 2.9569366455078123, "grad_norm": 0.41015625, "learning_rate": 0.0007, "train/total_time_seconds": 204.0810208916664, "train/time_per_step_avg": 0.2677855771034956, "train/epoch_time_elapsed": 243.58559001237154, "train/estimated_remaining_minutes": 7.787302112971481}
|