w-ahmad commited on
Commit
cfa223e
·
verified ·
1 Parent(s): 78c4d42

Auto upload zain 2026-08-12T20:43:07.335913

Browse files
Files changed (22) hide show
  1. zain/Activation/out/glu-situglu_low-150L_run/training_log.jsonl +13 -0
  2. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/config.json +36 -0
  3. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/model.safetensors +3 -0
  4. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/optimizer.pt +3 -0
  5. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/rng_state.pth +3 -0
  6. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/scheduler.pt +3 -0
  7. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/tokenizer.json +0 -0
  8. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/tokenizer_config.json +13 -0
  9. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/trainer_state.json +544 -0
  10. zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/training_args.bin +3 -0
  11. zain/Activation/out/glu-waleed-150L_run/config.json +36 -0
  12. zain/Activation/out/glu-waleed-150L_run/model.safetensors +3 -0
  13. zain/Activation/out/glu-waleed-150L_run/tokenizer.json +0 -0
  14. zain/Activation/out/glu-waleed-150L_run/tokenizer_config.json +13 -0
  15. zain/Activation/out/glu-waleed-150L_run/training_args.bin +3 -0
  16. zain/Activation/out/glu-waleed-150L_run/training_log.jsonl +10 -0
  17. zain/Activation/wandb/debug-internal.log +31 -113
  18. zain/Activation/wandb/debug.log +19 -19
  19. zain/Activation/wandb/run-20260812_175304-hrggki9k/logs/debug-core.log +7 -0
  20. zain/Activation/wandb/run-20260812_180713-utqzlg67/logs/debug-core.log +7 -0
  21. zain/Activation/wandb/run-20260812_182126-vyycsg6r/logs/debug-core.log +7 -0
  22. zain/Activation/wandb/run-20260812_183823-qtstmmvv/logs/debug-core.log +7 -0
zain/Activation/out/glu-situglu_low-150L_run/training_log.jsonl ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"step": 20, "epoch": 0.0013481631277384564, "timestamp": 1786567221.345815, "loss": 7.966025543212891, "grad_norm": 1.2578125, "learning_rate": 0.000475, "train/total_time_seconds": 8.265028517693281, "train/time_per_step_avg": 0.41325142588466407, "train/epoch_time_elapsed": 9.324527382850647, "train/estimated_remaining_minutes": 6.749773289449513}
2
+ {"step": 40, "epoch": 0.002696326255476913, "timestamp": 1786567230.1307592, "loss": 6.833889007568359, "grad_norm": 0.875, "learning_rate": 0.0009750000000000001, "train/total_time_seconds": 16.07345186918974, "train/time_per_step_avg": 0.40183629672974347, "train/epoch_time_elapsed": 18.1094719953835, "train/estimated_remaining_minutes": 6.4293807476758955}
3
+ {"step": 50, "epoch": 0.003370407819346141, "timestamp": 1786567257.9135702, "eval_loss": 6.03631067276001, "eval_runtime": 23.3792, "eval_samples_per_second": 407.498, "eval_steps_per_second": 3.208, "train/total_time_seconds": 19.987716674804688, "train/time_per_step_avg": 0.39975433349609374, "train/epoch_time_elapsed": 45.89228297770023, "train/estimated_remaining_minutes": 6.329443613688151}
4
+ {"step": 60, "epoch": 0.004044489383215369, "timestamp": 1786567262.3096724, "loss": 6.078855895996094, "grad_norm": 0.2294921875, "learning_rate": 0.001475, "train/total_time_seconds": 23.895309928804636, "train/time_per_step_avg": 0.3982551654800773, "train/epoch_time_elapsed": 50.28838546574116, "train/estimated_remaining_minutes": 6.239330925854544}
5
+ {"step": 80, "epoch": 0.005392652510953826, "timestamp": 1786567271.1853848, "loss": 6.011817550659179, "grad_norm": 0.1083984375, "learning_rate": 0.001975, "train/total_time_seconds": 31.76482469961047, "train/time_per_step_avg": 0.3970603087451309, "train/epoch_time_elapsed": 59.16409769654274, "train/estimated_remaining_minutes": 6.088258067425341}
6
+ {"step": 100, "epoch": 0.006740815638692282, "timestamp": 1786567280.0055816, "loss": 5.935911178588867, "grad_norm": 0.4296875, "learning_rate": 0.002475, "train/total_time_seconds": 39.60268234461546, "train/time_per_step_avg": 0.3960268234461546, "train/epoch_time_elapsed": 67.98429441824555, "train/estimated_remaining_minutes": 5.940402351692319}
7
+ {"step": 100, "epoch": 0.006740815638692282, "timestamp": 1786567303.5567286, "eval_loss": 5.899170875549316, "eval_runtime": 23.5497, "eval_samples_per_second": 404.548, "eval_steps_per_second": 3.185, "train/total_time_seconds": 39.60268234461546, "train/time_per_step_avg": 0.3960268234461546, "train/epoch_time_elapsed": 91.53544069826603, "train/estimated_remaining_minutes": 5.940402351692319}
8
+ {"step": 120, "epoch": 0.008088978766430738, "timestamp": 1786567312.4366639, "loss": 5.822502899169922, "grad_norm": 0.12109375, "learning_rate": 0.0029749999999999998, "train/total_time_seconds": 47.49337362498045, "train/time_per_step_avg": 0.39228345107287166, "train/epoch_time_elapsed": 100.41537699475884, "train/estimated_remaining_minutes": 5.804745665275389}
9
+ {"step": 140, "epoch": 0.009437141894169195, "timestamp": 1786567321.5841115, "loss": 5.767054748535156, "grad_norm": 0.10498046875, "learning_rate": 0.003475, "train/total_time_seconds": 55.64522836357355, "train/time_per_step_avg": 0.39571776494383815, "train/epoch_time_elapsed": 109.56282414495945, "train/estimated_remaining_minutes": 5.697011475318245}
10
+ {"step": 150, "epoch": 0.010111223458038422, "timestamp": 1786567349.6128392, "eval_loss": 5.759406566619873, "eval_runtime": 23.5831, "eval_samples_per_second": 403.976, "eval_steps_per_second": 3.18, "train/total_time_seconds": 59.594617549329996, "train/time_per_step_avg": 0.3960690087452531, "train/epoch_time_elapsed": 137.59155130013824, "train/estimated_remaining_minutes": 5.628380546325611}
11
+ {"step": 160, "epoch": 0.010785305021907651, "timestamp": 1786567353.9881816, "loss": 5.75561637878418, "grad_norm": 0.2890625, "learning_rate": 0.003975, "train/total_time_seconds": 63.48246446624398, "train/time_per_step_avg": 0.39587154537439345, "train/epoch_time_elapsed": 141.96689390018582, "train/estimated_remaining_minutes": 5.554715640796348}
12
+ {"step": 180, "epoch": 0.012133468149646108, "timestamp": 1786567362.8781247, "loss": 5.753026962280273, "grad_norm": 0.28125, "learning_rate": 0.004475, "train/total_time_seconds": 71.37153596058488, "train/time_per_step_avg": 0.3960671126097441, "train/epoch_time_elapsed": 150.85683799535036, "train/estimated_remaining_minutes": 5.418949952562926}
13
+ {"step": 200, "epoch": 0.013481631277384564, "timestamp": 1786567371.6889467, "loss": 5.755978393554687, "grad_norm": 0.1357421875, "learning_rate": 0.004975, "train/total_time_seconds": 79.2033561617136, "train/time_per_step_avg": 0.3960067381709814, "train/epoch_time_elapsed": 159.6676596365869, "train/estimated_remaining_minutes": 5.28022374411424}
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 150,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.16.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096,
35
+ "waleed_beta": 10.0
36
+ }
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7daa2a6e5c954adc04a1e36d12a099dda23d38b9629460a06d9b4ec03d1e7a16
3
+ size 50427120
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fa63bdbe02b50ea394a17b70ac5fc3ab82848b353fe416b2d649a4c9e4ac609c
3
+ size 101708778
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:645b71843375baf4cc10bc75a2f0f04e91b8e3f8e8929f518a87022898b3bc20
3
+ size 14244
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9db76f238494a413266398860b344c6c4c0f3a045ef78b23af1afac6775a12d1
3
+ size 1064
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/trainer_state.json ADDED
@@ -0,0 +1,544 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.06740815638692282,
6
+ "eval_steps": 50,
7
+ "global_step": 1000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0013481631277384564,
14
+ "grad_norm": 1.2578125,
15
+ "learning_rate": 0.000475,
16
+ "loss": 7.956727600097656,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.002696326255476913,
21
+ "grad_norm": 0.8671875,
22
+ "learning_rate": 0.0009750000000000001,
23
+ "loss": 6.816352844238281,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.003370407819346141,
28
+ "eval_loss": 6.0367817878723145,
29
+ "eval_runtime": 22.7925,
30
+ "eval_samples_per_second": 417.988,
31
+ "eval_steps_per_second": 3.291,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.004044489383215369,
36
+ "grad_norm": 0.2431640625,
37
+ "learning_rate": 0.001475,
38
+ "loss": 6.0750377655029295,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.005392652510953826,
43
+ "grad_norm": 0.68359375,
44
+ "learning_rate": 0.001975,
45
+ "loss": 5.994783401489258,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.006740815638692282,
50
+ "grad_norm": 4.09375,
51
+ "learning_rate": 0.002475,
52
+ "loss": 5.948408126831055,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.006740815638692282,
57
+ "eval_loss": 5.804104804992676,
58
+ "eval_runtime": 22.9432,
59
+ "eval_samples_per_second": 415.243,
60
+ "eval_steps_per_second": 3.269,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.008088978766430738,
65
+ "grad_norm": 0.1318359375,
66
+ "learning_rate": 0.0029749999999999998,
67
+ "loss": 5.760046768188476,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.009437141894169195,
72
+ "grad_norm": 0.294921875,
73
+ "learning_rate": 0.003475,
74
+ "loss": 5.92535171508789,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.010111223458038422,
79
+ "eval_loss": 6.016007423400879,
80
+ "eval_runtime": 22.9277,
81
+ "eval_samples_per_second": 415.523,
82
+ "eval_steps_per_second": 3.271,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.010785305021907651,
87
+ "grad_norm": 0.357421875,
88
+ "learning_rate": 0.003975,
89
+ "loss": 5.983197021484375,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.012133468149646108,
94
+ "grad_norm": 0.546875,
95
+ "learning_rate": 0.004475,
96
+ "loss": 5.803388977050782,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.013481631277384564,
101
+ "grad_norm": 0.1611328125,
102
+ "learning_rate": 0.004975,
103
+ "loss": 5.976637649536133,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.013481631277384564,
108
+ "eval_loss": 5.777098178863525,
109
+ "eval_runtime": 22.7713,
110
+ "eval_samples_per_second": 418.378,
111
+ "eval_steps_per_second": 3.294,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.01482979440512302,
116
+ "grad_norm": 0.125,
117
+ "learning_rate": 0.005,
118
+ "loss": 5.758567428588867,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.016177957532861477,
123
+ "grad_norm": 0.10400390625,
124
+ "learning_rate": 0.005,
125
+ "loss": 5.737454223632812,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.016852039096730706,
130
+ "eval_loss": 5.740303993225098,
131
+ "eval_runtime": 22.9227,
132
+ "eval_samples_per_second": 415.614,
133
+ "eval_steps_per_second": 3.272,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.01752612066059993,
138
+ "grad_norm": 0.11376953125,
139
+ "learning_rate": 0.005,
140
+ "loss": 5.7380321502685545,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.01887428378833839,
145
+ "grad_norm": 0.28515625,
146
+ "learning_rate": 0.005,
147
+ "loss": 5.732847213745117,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.020222446916076844,
152
+ "grad_norm": 0.1318359375,
153
+ "learning_rate": 0.005,
154
+ "loss": 5.721313858032227,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.020222446916076844,
159
+ "eval_loss": 5.722339153289795,
160
+ "eval_runtime": 22.7681,
161
+ "eval_samples_per_second": 418.436,
162
+ "eval_steps_per_second": 3.294,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.021570610043815303,
167
+ "grad_norm": 0.11669921875,
168
+ "learning_rate": 0.005,
169
+ "loss": 5.709003829956055,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.022918773171553757,
174
+ "grad_norm": 0.291015625,
175
+ "learning_rate": 0.005,
176
+ "loss": 5.69885368347168,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.023592854735422986,
181
+ "eval_loss": 5.697268962860107,
182
+ "eval_runtime": 22.6575,
183
+ "eval_samples_per_second": 420.48,
184
+ "eval_steps_per_second": 3.31,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.024266936299292215,
189
+ "grad_norm": 0.458984375,
190
+ "learning_rate": 0.005,
191
+ "loss": 5.698523712158203,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.02561509942703067,
196
+ "grad_norm": 0.2158203125,
197
+ "learning_rate": 0.005,
198
+ "loss": 5.695141220092774,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.026963262554769128,
203
+ "grad_norm": 0.2158203125,
204
+ "learning_rate": 0.005,
205
+ "loss": 5.723342514038086,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.026963262554769128,
210
+ "eval_loss": 5.670405387878418,
211
+ "eval_runtime": 22.6802,
212
+ "eval_samples_per_second": 420.058,
213
+ "eval_steps_per_second": 3.307,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.028311425682507583,
218
+ "grad_norm": 0.154296875,
219
+ "learning_rate": 0.005,
220
+ "loss": 5.595025634765625,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.02965958881024604,
225
+ "grad_norm": 0.2890625,
226
+ "learning_rate": 0.005,
227
+ "loss": 5.667588806152343,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.030333670374115267,
232
+ "eval_loss": 5.761199474334717,
233
+ "eval_runtime": 22.7676,
234
+ "eval_samples_per_second": 418.446,
235
+ "eval_steps_per_second": 3.294,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.031007751937984496,
240
+ "grad_norm": 0.265625,
241
+ "learning_rate": 0.005,
242
+ "loss": 5.7826087951660154,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.032355915065722954,
247
+ "grad_norm": 0.154296875,
248
+ "learning_rate": 0.005,
249
+ "loss": 5.727585220336914,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.03370407819346141,
254
+ "grad_norm": 0.1279296875,
255
+ "learning_rate": 0.005,
256
+ "loss": 5.560035324096679,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.03370407819346141,
261
+ "eval_loss": 5.5210652351379395,
262
+ "eval_runtime": 22.7222,
263
+ "eval_samples_per_second": 419.281,
264
+ "eval_steps_per_second": 3.301,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.03505224132119986,
269
+ "grad_norm": 0.12890625,
270
+ "learning_rate": 0.005,
271
+ "loss": 5.476964950561523,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.03640040444893832,
276
+ "grad_norm": 0.103515625,
277
+ "learning_rate": 0.005,
278
+ "loss": 5.370554351806641,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.03707448601280755,
283
+ "eval_loss": 5.3040289878845215,
284
+ "eval_runtime": 22.7834,
285
+ "eval_samples_per_second": 418.156,
286
+ "eval_steps_per_second": 3.292,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.03774856757667678,
291
+ "grad_norm": 0.2236328125,
292
+ "learning_rate": 0.005,
293
+ "loss": 5.296871566772461,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.03909673070441524,
298
+ "grad_norm": 0.1328125,
299
+ "learning_rate": 0.005,
300
+ "loss": 5.198488998413086,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.04044489383215369,
305
+ "grad_norm": 0.1640625,
306
+ "learning_rate": 0.005,
307
+ "loss": 5.091462326049805,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.04044489383215369,
312
+ "eval_loss": 5.038744926452637,
313
+ "eval_runtime": 22.7461,
314
+ "eval_samples_per_second": 418.841,
315
+ "eval_steps_per_second": 3.297,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.04179305695989215,
320
+ "grad_norm": 0.322265625,
321
+ "learning_rate": 0.005,
322
+ "loss": 4.993017959594726,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.043141220087630605,
327
+ "grad_norm": 0.388671875,
328
+ "learning_rate": 0.005,
329
+ "loss": 5.174721908569336,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.043815301651499834,
334
+ "eval_loss": 5.006783485412598,
335
+ "eval_runtime": 22.8636,
336
+ "eval_samples_per_second": 416.689,
337
+ "eval_steps_per_second": 3.28,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.044489383215369056,
342
+ "grad_norm": 0.1611328125,
343
+ "learning_rate": 0.005,
344
+ "loss": 5.018425369262696,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.045837546343107514,
349
+ "grad_norm": 0.1826171875,
350
+ "learning_rate": 0.005,
351
+ "loss": 4.877096557617188,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.04718570947084597,
356
+ "grad_norm": 0.318359375,
357
+ "learning_rate": 0.005,
358
+ "loss": 4.810688400268555,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.04718570947084597,
363
+ "eval_loss": 4.799203872680664,
364
+ "eval_runtime": 22.7538,
365
+ "eval_samples_per_second": 418.699,
366
+ "eval_steps_per_second": 3.296,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.04853387259858443,
371
+ "grad_norm": 0.48828125,
372
+ "learning_rate": 0.005,
373
+ "loss": 4.784030914306641,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.04988203572632288,
378
+ "grad_norm": 0.357421875,
379
+ "learning_rate": 0.005,
380
+ "loss": 4.752361679077149,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.05055611729019211,
385
+ "eval_loss": 4.716794490814209,
386
+ "eval_runtime": 22.7445,
387
+ "eval_samples_per_second": 418.87,
388
+ "eval_steps_per_second": 3.297,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.05123019885406134,
393
+ "grad_norm": 2.828125,
394
+ "learning_rate": 0.005,
395
+ "loss": 4.814418029785156,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.0525783619817998,
400
+ "grad_norm": 0.392578125,
401
+ "learning_rate": 0.005,
402
+ "loss": 5.026254653930664,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.053926525109538256,
407
+ "grad_norm": 0.49609375,
408
+ "learning_rate": 0.005,
409
+ "loss": 4.906942749023438,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.053926525109538256,
414
+ "eval_loss": 4.8591742515563965,
415
+ "eval_runtime": 22.7281,
416
+ "eval_samples_per_second": 419.174,
417
+ "eval_steps_per_second": 3.3,
418
+ "step": 800
419
+ },
420
+ {
421
+ "epoch": 0.05527468823727671,
422
+ "grad_norm": 1.28125,
423
+ "learning_rate": 0.005,
424
+ "loss": 4.8464813232421875,
425
+ "step": 820
426
+ },
427
+ {
428
+ "epoch": 0.056622851365015166,
429
+ "grad_norm": 0.7734375,
430
+ "learning_rate": 0.005,
431
+ "loss": 4.875528717041016,
432
+ "step": 840
433
+ },
434
+ {
435
+ "epoch": 0.057296932928884395,
436
+ "eval_loss": 4.909781455993652,
437
+ "eval_runtime": 22.7731,
438
+ "eval_samples_per_second": 418.344,
439
+ "eval_steps_per_second": 3.293,
440
+ "step": 850
441
+ },
442
+ {
443
+ "epoch": 0.057971014492753624,
444
+ "grad_norm": 0.443359375,
445
+ "learning_rate": 0.005,
446
+ "loss": 4.93560562133789,
447
+ "step": 860
448
+ },
449
+ {
450
+ "epoch": 0.05931917762049208,
451
+ "grad_norm": 0.37109375,
452
+ "learning_rate": 0.005,
453
+ "loss": 4.791771316528321,
454
+ "step": 880
455
+ },
456
+ {
457
+ "epoch": 0.06066734074823053,
458
+ "grad_norm": 0.361328125,
459
+ "learning_rate": 0.005,
460
+ "loss": 4.794622802734375,
461
+ "step": 900
462
+ },
463
+ {
464
+ "epoch": 0.06066734074823053,
465
+ "eval_loss": 4.761636734008789,
466
+ "eval_runtime": 22.7061,
467
+ "eval_samples_per_second": 419.579,
468
+ "eval_steps_per_second": 3.303,
469
+ "step": 900
470
+ },
471
+ {
472
+ "epoch": 0.06201550387596899,
473
+ "grad_norm": 1.171875,
474
+ "learning_rate": 0.005,
475
+ "loss": 4.8350780487060545,
476
+ "step": 920
477
+ },
478
+ {
479
+ "epoch": 0.06336366700370745,
480
+ "grad_norm": 1.0859375,
481
+ "learning_rate": 0.005,
482
+ "loss": 4.829019546508789,
483
+ "step": 940
484
+ },
485
+ {
486
+ "epoch": 0.06403774856757667,
487
+ "eval_loss": 4.744377136230469,
488
+ "eval_runtime": 22.7753,
489
+ "eval_samples_per_second": 418.304,
490
+ "eval_steps_per_second": 3.293,
491
+ "step": 950
492
+ },
493
+ {
494
+ "epoch": 0.06471183013144591,
495
+ "grad_norm": 0.376953125,
496
+ "learning_rate": 0.005,
497
+ "loss": 4.783835601806641,
498
+ "step": 960
499
+ },
500
+ {
501
+ "epoch": 0.06605999325918437,
502
+ "grad_norm": 0.45703125,
503
+ "learning_rate": 0.005,
504
+ "loss": 4.801270294189453,
505
+ "step": 980
506
+ },
507
+ {
508
+ "epoch": 0.06740815638692282,
509
+ "grad_norm": 0.5234375,
510
+ "learning_rate": 0.005,
511
+ "loss": 4.770906829833985,
512
+ "step": 1000
513
+ },
514
+ {
515
+ "epoch": 0.06740815638692282,
516
+ "eval_loss": 4.7356181144714355,
517
+ "eval_runtime": 22.7534,
518
+ "eval_samples_per_second": 418.707,
519
+ "eval_steps_per_second": 3.296,
520
+ "step": 1000
521
+ }
522
+ ],
523
+ "logging_steps": 20,
524
+ "max_steps": 1000,
525
+ "num_input_tokens_seen": 0,
526
+ "num_train_epochs": 1,
527
+ "save_steps": 1000,
528
+ "stateful_callbacks": {
529
+ "TrainerControl": {
530
+ "args": {
531
+ "should_epoch_stop": false,
532
+ "should_evaluate": false,
533
+ "should_log": false,
534
+ "should_save": true,
535
+ "should_training_stop": true
536
+ },
537
+ "attributes": {}
538
+ }
539
+ },
540
+ "total_flos": 4839413121024000.0,
541
+ "train_batch_size": 64,
542
+ "trial_name": null,
543
+ "trial_params": null
544
+ }
zain/Activation/out/glu-waleed-150L_run/checkpoint-1000/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c3f720c0ee5b4b17ac3e52f157cb3aec6b83424af042dda6be42bac9b55001dc
3
+ size 4920
zain/Activation/out/glu-waleed-150L_run/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 150,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.16.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096,
35
+ "waleed_beta": 10.0
36
+ }
zain/Activation/out/glu-waleed-150L_run/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7daa2a6e5c954adc04a1e36d12a099dda23d38b9629460a06d9b4ec03d1e7a16
3
+ size 50427120
zain/Activation/out/glu-waleed-150L_run/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/glu-waleed-150L_run/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/glu-waleed-150L_run/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c3f720c0ee5b4b17ac3e52f157cb3aec6b83424af042dda6be42bac9b55001dc
3
+ size 4920
zain/Activation/out/glu-waleed-150L_run/training_log.jsonl CHANGED
@@ -60,3 +60,13 @@
60
  {"step": 860, "epoch": 0.057971014492753624, "timestamp": 1786567058.1872954, "loss": 4.93560562133789, "grad_norm": 0.443359375, "learning_rate": 0.005, "train/total_time_seconds": 327.00164096429944, "train/time_per_step_avg": 0.3801424027234316, "train/epoch_time_elapsed": 757.6404234655201, "train/estimated_remaining_minutes": 0.8872137545543007}
61
  {"step": 880, "epoch": 0.05931917762049208, "timestamp": 1786567066.7084653, "loss": 4.791771316528321, "grad_norm": 0.37109375, "learning_rate": 0.005, "train/total_time_seconds": 334.5359353646636, "train/time_per_step_avg": 0.3799582485109568, "train/epoch_time_elapsed": 766.1615929342806, "train/estimated_remaining_minutes": 0.7603089440105991}
62
  {"step": 900, "epoch": 0.06066734074823053, "timestamp": 1786567075.2707405, "loss": 4.794622802734375, "grad_norm": 0.361328125, "learning_rate": 0.005, "train/total_time_seconds": 342.1012469343841, "train/time_per_step_avg": 0.3803894203156233, "train/epoch_time_elapsed": 774.7238683663309, "train/estimated_remaining_minutes": 0.6335208276562668}
 
 
 
 
 
 
 
 
 
 
 
60
  {"step": 860, "epoch": 0.057971014492753624, "timestamp": 1786567058.1872954, "loss": 4.93560562133789, "grad_norm": 0.443359375, "learning_rate": 0.005, "train/total_time_seconds": 327.00164096429944, "train/time_per_step_avg": 0.3801424027234316, "train/epoch_time_elapsed": 757.6404234655201, "train/estimated_remaining_minutes": 0.8872137545543007}
61
  {"step": 880, "epoch": 0.05931917762049208, "timestamp": 1786567066.7084653, "loss": 4.791771316528321, "grad_norm": 0.37109375, "learning_rate": 0.005, "train/total_time_seconds": 334.5359353646636, "train/time_per_step_avg": 0.3799582485109568, "train/epoch_time_elapsed": 766.1615929342806, "train/estimated_remaining_minutes": 0.7603089440105991}
62
  {"step": 900, "epoch": 0.06066734074823053, "timestamp": 1786567075.2707405, "loss": 4.794622802734375, "grad_norm": 0.361328125, "learning_rate": 0.005, "train/total_time_seconds": 342.1012469343841, "train/time_per_step_avg": 0.3803894203156233, "train/epoch_time_elapsed": 774.7238683663309, "train/estimated_remaining_minutes": 0.6335208276562668}
63
+ {"step": 900, "epoch": 0.06066734074823053, "timestamp": 1786567097.9782238, "eval_loss": 4.761636734008789, "eval_runtime": 22.7061, "eval_samples_per_second": 419.579, "eval_steps_per_second": 3.303, "train/total_time_seconds": 342.1012469343841, "train/time_per_step_avg": 0.3803894203156233, "train/epoch_time_elapsed": 797.4313508160412, "train/estimated_remaining_minutes": 0.6335208276562668}
64
+ {"step": 920, "epoch": 0.06201550387596899, "timestamp": 1786567106.4954593, "loss": 4.8350780487060545, "grad_norm": 1.171875, "learning_rate": 0.005, "train/total_time_seconds": 349.62572100386024, "train/time_per_step_avg": 0.3772854841500521, "train/epoch_time_elapsed": 805.9485873766243, "train/estimated_remaining_minutes": 0.5067039434838554}
65
+ {"step": 940, "epoch": 0.06336366700370745, "timestamp": 1786567115.0218663, "loss": 4.829019546508789, "grad_norm": 1.0859375, "learning_rate": 0.005, "train/total_time_seconds": 357.1360790580511, "train/time_per_step_avg": 0.37672117825597523, "train/epoch_time_elapsed": 814.4749939329922, "train/estimated_remaining_minutes": 0.37993199899792673}
66
+ {"step": 950, "epoch": 0.06403774856757667, "timestamp": 1786567142.2422066, "eval_loss": 4.744377136230469, "eval_runtime": 22.7753, "eval_samples_per_second": 418.304, "eval_steps_per_second": 3.293, "train/total_time_seconds": 361.08760372176766, "train/time_per_step_avg": 0.37852513320744036, "train/epoch_time_elapsed": 841.6953341141343, "train/estimated_remaining_minutes": 0.3167435120366383}
67
+ {"step": 960, "epoch": 0.06471183013144591, "timestamp": 1786567146.460256, "loss": 4.783835601806641, "grad_norm": 0.376953125, "learning_rate": 0.005, "train/total_time_seconds": 364.8158797621727, "train/time_per_step_avg": 0.37814238797873256, "train/epoch_time_elapsed": 845.9133841320872, "train/estimated_remaining_minutes": 0.25334436094595325}
68
+ {"step": 980, "epoch": 0.06605999325918437, "timestamp": 1786567154.9615414, "loss": 4.801270294189453, "grad_norm": 0.45703125, "learning_rate": 0.005, "train/total_time_seconds": 372.33375385031104, "train/time_per_step_avg": 0.3779781848564744, "train/epoch_time_elapsed": 854.4146693907678, "train/estimated_remaining_minutes": 0.12664413396269084}
69
+ {"step": 1000, "epoch": 0.06740815638692282, "timestamp": 1786567163.441822, "loss": 4.770906829833985, "grad_norm": 0.5234375, "learning_rate": 0.005, "train/total_time_seconds": 379.8221805691719, "train/time_per_step_avg": 0.37720933634787795, "train/epoch_time_elapsed": 862.8949496857822, "train/estimated_remaining_minutes": 0.0}
70
+ {"step": 1000, "epoch": 0.06740815638692282, "timestamp": 1786567186.196568, "eval_loss": 4.7356181144714355, "eval_runtime": 22.7534, "eval_samples_per_second": 418.707, "eval_steps_per_second": 3.296, "train/total_time_seconds": 379.8221805691719, "train/time_per_step_avg": 0.37720933634787795, "train/epoch_time_elapsed": 885.6496942676604, "train/estimated_remaining_minutes": 0.0}
71
+ {"step": 1000, "epoch": 0.06740815638692282, "timestamp": 1786567186.653717, "train_runtime": 887.0075, "train_samples_per_second": 72.153, "train_steps_per_second": 1.127, "total_flos": 4839413121024000.0, "train_loss": 5.432845520019531, "train/total_time_seconds": 379.8221805691719, "train/time_per_step_avg": 0.37720933634787795, "train/epoch_time_elapsed": 886.1068433448672, "train/estimated_remaining_minutes": 0.0}
72
+ {"step": 1000, "epoch": 0.06740815638692282, "timestamp": 1786567209.366356, "eval_loss": 4.7356181144714355, "eval_runtime": 22.7099, "eval_samples_per_second": 419.51, "eval_steps_per_second": 3.303, "train/total_time_seconds": 379.8221805691719, "train/time_per_step_avg": 0.37720933634787795, "train/epoch_time_elapsed": 908.8194829523563, "train/estimated_remaining_minutes": 0.0}
zain/Activation/wandb/debug-internal.log CHANGED
@@ -1,113 +1,31 @@
1
- {"time":"2026-08-12T20:24:59.716522619Z","level":"INFO","msg":"wandb-core"}
2
- {"time":"2026-08-12T20:24:59.716668506Z","level":"INFO","msg":"stream: starting","core version":"0.28.1"}
3
- {"time":"2026-08-12T20:24:59.978902588Z","level":"INFO","msg":"stream: created new stream","id":"k14eff4o"}
4
- {"time":"2026-08-12T20:24:59.979002733Z","level":"INFO","msg":"handler: started"}
5
- {"time":"2026-08-12T20:24:59.97909183Z","level":"INFO","msg":"stream: started"}
6
- {"time":"2026-08-12T20:24:59.979109732Z","level":"INFO","msg":"writer: started","stream_id":"k14eff4o"}
7
- {"time":"2026-08-12T20:24:59.979127696Z","level":"INFO","msg":"sender: started"}
8
- {"time":"2026-08-12T20:25:01.477268978Z","level":"INFO","msg":"filestream: sending request","total_files":1,"console_offset":0,"console_lines":1}
9
- {"time":"2026-08-12T20:25:01.570884465Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
10
- {"time":"2026-08-12T20:25:16.477745126Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":0,"history_lines":1,"events_offset":0,"events_lines":2,"console_offset":0,"console_lines":2,"uploaded_len":2}
11
- {"time":"2026-08-12T20:25:16.595722633Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
12
- {"time":"2026-08-12T20:25:31.477966084Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1,"history_lines":1,"events_offset":2,"events_lines":2,"console_offset":0,"console_lines":1}
13
- {"time":"2026-08-12T20:25:31.628536652Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
14
- {"time":"2026-08-12T20:25:46.478040478Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2,"history_lines":1,"events_offset":4,"events_lines":2,"console_offset":0,"console_lines":1}
15
- {"time":"2026-08-12T20:25:46.60071818Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
16
- {"time":"2026-08-12T20:26:01.478205323Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":3,"history_lines":2,"events_offset":6,"events_lines":2,"console_offset":0,"console_lines":1}
17
- {"time":"2026-08-12T20:26:01.619749748Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
18
- {"time":"2026-08-12T20:26:16.478436053Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":5,"history_lines":1,"events_offset":8,"events_lines":2,"console_offset":0,"console_lines":1}
19
- {"time":"2026-08-12T20:26:16.638029625Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
20
- {"time":"2026-08-12T20:26:31.478304245Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":6,"history_lines":1,"events_offset":10,"events_lines":2,"console_offset":0,"console_lines":1}
21
- {"time":"2026-08-12T20:26:31.588473215Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
22
- {"time":"2026-08-12T20:26:46.47769931Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":7,"history_lines":1,"events_offset":12,"events_lines":2,"console_offset":0,"console_lines":1}
23
- {"time":"2026-08-12T20:26:46.642698181Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
24
- {"time":"2026-08-12T20:27:01.478376889Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":8,"history_lines":1,"events_offset":14,"events_lines":2,"console_offset":0,"console_lines":1}
25
- {"time":"2026-08-12T20:27:01.614026299Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
26
- {"time":"2026-08-12T20:27:16.478276617Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":9,"history_lines":1,"events_offset":16,"events_lines":2,"console_offset":0,"console_lines":1}
27
- {"time":"2026-08-12T20:27:16.59518949Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
28
- {"time":"2026-08-12T20:27:31.477617651Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":10,"history_lines":2,"events_offset":18,"events_lines":2,"console_offset":0,"console_lines":1}
29
- {"time":"2026-08-12T20:27:31.615253909Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
30
- {"time":"2026-08-12T20:27:46.477671505Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":12,"history_lines":1,"events_offset":20,"events_lines":2,"console_offset":0,"console_lines":1}
31
- {"time":"2026-08-12T20:27:46.615859318Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
32
- {"time":"2026-08-12T20:28:01.478446978Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":13,"history_lines":1,"events_offset":22,"events_lines":2,"console_offset":0,"console_lines":1}
33
- {"time":"2026-08-12T20:28:01.61892806Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
34
- {"time":"2026-08-12T20:28:16.478407517Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":14,"history_lines":2,"events_offset":24,"events_lines":2,"console_offset":0,"console_lines":1}
35
- {"time":"2026-08-12T20:28:16.771822105Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
36
- {"time":"2026-08-12T20:28:31.477603437Z","level":"INFO","msg":"filestream: sending request","total_files":2,"events_offset":26,"events_lines":2,"console_offset":0,"console_lines":1}
37
- {"time":"2026-08-12T20:28:31.659588834Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
38
- {"time":"2026-08-12T20:28:46.477889524Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":16,"history_lines":1,"events_offset":28,"events_lines":2,"console_offset":0,"console_lines":1}
39
- {"time":"2026-08-12T20:28:46.593881346Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
40
- {"time":"2026-08-12T20:29:01.477384447Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":17,"history_lines":2,"events_offset":30,"events_lines":2,"console_offset":0,"console_lines":1}
41
- {"time":"2026-08-12T20:29:01.627184294Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
42
- {"time":"2026-08-12T20:29:16.478376251Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":19,"history_lines":1,"events_offset":32,"events_lines":2,"console_offset":0,"console_lines":1}
43
- {"time":"2026-08-12T20:29:16.628186759Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
44
- {"time":"2026-08-12T20:29:31.477828106Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":20,"history_lines":1,"events_offset":34,"events_lines":2,"console_offset":0,"console_lines":1}
45
- {"time":"2026-08-12T20:29:31.633228709Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
46
- {"time":"2026-08-12T20:29:46.478321003Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":21,"history_lines":2,"events_offset":36,"events_lines":2,"console_offset":0,"console_lines":1}
47
- {"time":"2026-08-12T20:29:46.587404749Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
48
- {"time":"2026-08-12T20:30:01.477608084Z","level":"INFO","msg":"filestream: sending request","total_files":2,"events_offset":38,"events_lines":2,"console_offset":0,"console_lines":1}
49
- {"time":"2026-08-12T20:30:01.699617731Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
50
- {"time":"2026-08-12T20:30:16.477785495Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":23,"history_lines":2,"events_offset":40,"events_lines":2,"console_offset":0,"console_lines":1}
51
- {"time":"2026-08-12T20:30:16.651204551Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
52
- {"time":"2026-08-12T20:30:31.477411246Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":25,"history_lines":1,"events_offset":42,"events_lines":2,"console_offset":0,"console_lines":1}
53
- {"time":"2026-08-12T20:30:31.623291152Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
54
- {"time":"2026-08-12T20:30:46.478047063Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":26,"history_lines":1,"events_offset":44,"events_lines":2,"console_offset":0,"console_lines":1}
55
- {"time":"2026-08-12T20:30:46.613629647Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
56
- {"time":"2026-08-12T20:31:01.477854191Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":27,"history_lines":1,"events_offset":46,"events_lines":2,"console_offset":0,"console_lines":1}
57
- {"time":"2026-08-12T20:31:01.673090914Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
58
- {"time":"2026-08-12T20:31:16.478070836Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":28,"history_lines":2,"events_offset":48,"events_lines":2,"console_offset":0,"console_lines":1}
59
- {"time":"2026-08-12T20:31:16.630851603Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
60
- {"time":"2026-08-12T20:31:31.477513751Z","level":"INFO","msg":"filestream: sending request","total_files":2,"events_offset":50,"events_lines":2,"console_offset":0,"console_lines":1}
61
- {"time":"2026-08-12T20:31:31.617668123Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
62
- {"time":"2026-08-12T20:31:46.478458422Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":30,"history_lines":2,"events_offset":52,"events_lines":2,"console_offset":0,"console_lines":1}
63
- {"time":"2026-08-12T20:31:46.668818452Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
64
- {"time":"2026-08-12T20:32:01.478234241Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":32,"history_lines":2,"events_offset":54,"events_lines":2,"console_offset":2,"console_lines":34}
65
- {"time":"2026-08-12T20:32:01.621549348Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
66
- {"time":"2026-08-12T20:32:16.478149741Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":56,"events_lines":2}
67
- {"time":"2026-08-12T20:32:16.652724371Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
68
- {"time":"2026-08-12T20:32:31.477978239Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":34,"history_lines":1,"events_offset":58,"events_lines":2,"console_offset":36,"console_lines":1}
69
- {"time":"2026-08-12T20:32:31.654493187Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
70
- {"time":"2026-08-12T20:32:46.478298525Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":35,"history_lines":2,"events_offset":60,"events_lines":2,"console_offset":37,"console_lines":2}
71
- {"time":"2026-08-12T20:32:46.586938041Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
72
- {"time":"2026-08-12T20:33:01.477937228Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":62,"events_lines":2}
73
- {"time":"2026-08-12T20:33:01.665177301Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
74
- {"time":"2026-08-12T20:33:16.477782835Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":37,"history_lines":2,"events_offset":64,"events_lines":2,"console_offset":39,"console_lines":2}
75
- {"time":"2026-08-12T20:33:16.617498348Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
76
- {"time":"2026-08-12T20:33:31.477947289Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":39,"history_lines":2,"events_offset":66,"events_lines":2,"console_offset":41,"console_lines":2}
77
- {"time":"2026-08-12T20:33:31.594753594Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
78
- {"time":"2026-08-12T20:33:46.477785444Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":68,"events_lines":2}
79
- {"time":"2026-08-12T20:33:46.610580012Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
80
- {"time":"2026-08-12T20:34:01.478153342Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":41,"history_lines":2,"events_offset":70,"events_lines":2,"console_offset":43,"console_lines":2}
81
- {"time":"2026-08-12T20:34:01.62260483Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
82
- {"time":"2026-08-12T20:34:16.478134716Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":43,"history_lines":1,"events_offset":72,"events_lines":2,"console_offset":45,"console_lines":1}
83
- {"time":"2026-08-12T20:34:16.671613168Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
84
- {"time":"2026-08-12T20:34:31.477575704Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":74,"events_lines":2}
85
- {"time":"2026-08-12T20:34:31.60477662Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
86
- {"time":"2026-08-12T20:34:46.478317545Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":44,"history_lines":2,"events_offset":76,"events_lines":2,"console_offset":46,"console_lines":2}
87
- {"time":"2026-08-12T20:34:46.624171089Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
88
- {"time":"2026-08-12T20:35:01.478332898Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":46,"history_lines":2,"events_offset":78,"events_lines":2,"console_offset":48,"console_lines":2}
89
- {"time":"2026-08-12T20:35:01.6480286Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
90
- {"time":"2026-08-12T20:35:16.477609454Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":80,"events_lines":2}
91
- {"time":"2026-08-12T20:35:16.657810608Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
92
- {"time":"2026-08-12T20:35:31.478270477Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":48,"history_lines":2,"events_offset":82,"events_lines":2,"console_offset":50,"console_lines":2}
93
- {"time":"2026-08-12T20:35:31.621981432Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
94
- {"time":"2026-08-12T20:35:46.478264047Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":50,"history_lines":1,"events_offset":84,"events_lines":2,"console_offset":52,"console_lines":1}
95
- {"time":"2026-08-12T20:35:46.599196186Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
96
- {"time":"2026-08-12T20:36:01.47796994Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":86,"events_lines":2}
97
- {"time":"2026-08-12T20:36:01.642959401Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
98
- {"time":"2026-08-12T20:36:16.47801472Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":51,"history_lines":2,"events_offset":88,"events_lines":2,"console_offset":53,"console_lines":2}
99
- {"time":"2026-08-12T20:36:16.670335544Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
100
- {"time":"2026-08-12T20:36:31.477858647Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":53,"history_lines":2,"events_offset":90,"events_lines":2,"console_offset":55,"console_lines":2}
101
- {"time":"2026-08-12T20:36:31.605976556Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
102
- {"time":"2026-08-12T20:36:46.47826295Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":92,"events_lines":2}
103
- {"time":"2026-08-12T20:36:46.631718531Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
104
- {"time":"2026-08-12T20:37:01.478337626Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":55,"history_lines":2,"events_offset":94,"events_lines":2,"console_offset":57,"console_lines":2}
105
- {"time":"2026-08-12T20:37:01.631915514Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
106
- {"time":"2026-08-12T20:37:16.477872499Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":57,"history_lines":1,"events_offset":96,"events_lines":2,"console_offset":59,"console_lines":1}
107
- {"time":"2026-08-12T20:37:16.63611796Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
108
- {"time":"2026-08-12T20:37:31.478378739Z","level":"INFO","msg":"filestream: sending request","total_files":1,"events_offset":98,"events_lines":2}
109
- {"time":"2026-08-12T20:37:31.603858591Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
110
- {"time":"2026-08-12T20:37:46.478108595Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":58,"history_lines":2,"events_offset":100,"events_lines":2,"console_offset":60,"console_lines":2}
111
- {"time":"2026-08-12T20:37:46.608803655Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
112
- {"time":"2026-08-12T20:38:01.477899938Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":60,"history_lines":2,"events_offset":102,"events_lines":2,"console_offset":62,"console_lines":2}
113
- {"time":"2026-08-12T20:38:01.633420051Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
 
1
+ {"time":"2026-08-12T20:40:11.20928198Z","level":"INFO","msg":"wandb-core"}
2
+ {"time":"2026-08-12T20:40:11.209429284Z","level":"INFO","msg":"stream: starting","core version":"0.28.1"}
3
+ {"time":"2026-08-12T20:40:11.466541599Z","level":"INFO","msg":"stream: created new stream","id":"s3p64ib5"}
4
+ {"time":"2026-08-12T20:40:11.466635737Z","level":"INFO","msg":"handler: started"}
5
+ {"time":"2026-08-12T20:40:11.466762254Z","level":"INFO","msg":"stream: started"}
6
+ {"time":"2026-08-12T20:40:11.466773751Z","level":"INFO","msg":"writer: started","stream_id":"s3p64ib5"}
7
+ {"time":"2026-08-12T20:40:11.466800147Z","level":"INFO","msg":"sender: started"}
8
+ {"time":"2026-08-12T20:40:12.893249539Z","level":"INFO","msg":"filestream: sending request","total_files":1,"console_offset":0,"console_lines":1}
9
+ {"time":"2026-08-12T20:40:13.015213838Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
10
+ {"time":"2026-08-12T20:40:27.893807114Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":0,"history_lines":1,"events_offset":0,"events_lines":2,"console_offset":0,"console_lines":2,"uploaded_len":2}
11
+ {"time":"2026-08-12T20:40:28.029054276Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
12
+ {"time":"2026-08-12T20:40:42.894398202Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1,"history_lines":1,"events_offset":2,"events_lines":2,"console_offset":0,"console_lines":1}
13
+ {"time":"2026-08-12T20:40:43.024942011Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
14
+ {"time":"2026-08-12T20:40:57.894018438Z","level":"INFO","msg":"filestream: sending request","total_files":2,"events_offset":4,"events_lines":2,"console_offset":2,"console_lines":2}
15
+ {"time":"2026-08-12T20:40:58.009665297Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
16
+ {"time":"2026-08-12T20:41:12.894246388Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2,"history_lines":3,"events_offset":6,"events_lines":2,"console_offset":0,"console_lines":1}
17
+ {"time":"2026-08-12T20:41:13.023812019Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
18
+ {"time":"2026-08-12T20:41:27.893650571Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":5,"history_lines":1,"events_offset":8,"events_lines":2,"console_offset":0,"console_lines":1}
19
+ {"time":"2026-08-12T20:41:28.020320435Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
20
+ {"time":"2026-08-12T20:41:42.894068203Z","level":"INFO","msg":"filestream: sending request","total_files":2,"events_offset":10,"events_lines":2,"console_offset":3,"console_lines":5}
21
+ {"time":"2026-08-12T20:41:43.008422223Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
22
+ {"time":"2026-08-12T20:41:57.893798043Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":6,"history_lines":2,"events_offset":12,"events_lines":2,"console_offset":0,"console_lines":1}
23
+ {"time":"2026-08-12T20:41:58.032616957Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
24
+ {"time":"2026-08-12T20:42:12.893594776Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":8,"history_lines":1,"events_offset":14,"events_lines":2,"console_offset":0,"console_lines":1}
25
+ {"time":"2026-08-12T20:42:13.106670908Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
26
+ {"time":"2026-08-12T20:42:27.893594585Z","level":"INFO","msg":"filestream: sending request","total_files":2,"events_offset":16,"events_lines":2,"console_offset":3,"console_lines":1}
27
+ {"time":"2026-08-12T20:42:28.016798016Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
28
+ {"time":"2026-08-12T20:42:42.893833922Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":9,"history_lines":3,"events_offset":18,"events_lines":2,"console_offset":0,"console_lines":1}
29
+ {"time":"2026-08-12T20:42:43.039451597Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
30
+ {"time":"2026-08-12T20:42:57.893662046Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":12,"history_lines":1,"events_offset":20,"events_lines":2,"console_offset":0,"console_lines":1}
31
+ {"time":"2026-08-12T20:42:58.050860591Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
zain/Activation/wandb/debug.log CHANGED
@@ -1,20 +1,20 @@
1
- 2026-08-12 20:24:59,715 INFO MainThread:1371664 [wandb_init.py:setup_run_log_directory():729] Logging user logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260812_202459-k14eff4o/logs/debug.log
2
- 2026-08-12 20:24:59,715 INFO MainThread:1371664 [wandb_init.py:setup_run_log_directory():730] Logging internal logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260812_202459-k14eff4o/logs/debug-internal.log
3
- 2026-08-12 20:24:59,715 INFO MainThread:1371664 [wandb_init.py:init():772] calling init triggers
4
- 2026-08-12 20:24:59,715 INFO MainThread:1371664 [wandb_init.py:init():777] wandb.init called with sweep_config: {}
5
  config: {'_wandb': {}}
6
- 2026-08-12 20:24:59,715 INFO MainThread:1371664 [wandb_init.py:init():820] starting backend
7
- 2026-08-12 20:24:59,715 INFO MainThread:1371664 [wandb_init.py:init():826] Connected to an existing wandb-core service via WANDB_SERVICE
8
- 2026-08-12 20:24:59,715 INFO MainThread:1371664 [wandb_init.py:init():835] sending inform_init request
9
- 2026-08-12 20:24:59,979 INFO MainThread:1371664 [wandb_init.py:init():840] backend started and connected
10
- 2026-08-12 20:24:59,980 INFO MainThread:1371664 [wandb_init.py:init():910] updated telemetry
11
- 2026-08-12 20:24:59,987 INFO MainThread:1371664 [wandb_init.py:init():933] communicating run to backend with 90.0 second timeout
12
- 2026-08-12 20:25:00,444 INFO MainThread:1371664 [wandb_init.py:init():978] starting run threads in backend
13
- 2026-08-12 20:25:00,537 INFO MainThread:1371664 [wandb_run.py:_console_start():2621] atexit reg
14
- 2026-08-12 20:25:00,537 INFO MainThread:1371664 [wandb_run.py:_redirect():2471] redirect: wrap_raw
15
- 2026-08-12 20:25:00,537 INFO MainThread:1371664 [wandb_run.py:_redirect():2540] Wrapping output streams.
16
- 2026-08-12 20:25:00,537 INFO MainThread:1371664 [wandb_run.py:_redirect():2563] Redirects installed.
17
- 2026-08-12 20:25:00,538 INFO MainThread:1371664 [wandb_init.py:init():1016] run started, returning control to user process
18
- 2026-08-12 20:25:00,539 INFO MainThread:1371664 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 150, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'waleed', 'waleed_beta': 10.0, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-waleed-150L_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 1000, 'learning_rate': 0.005, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 200, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 0.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-waleed-150L-25.1M-20260812-202458', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 50, 'eval_delay': 0, 'per_device_eval_batch_size': 128, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 1000, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-waleed-150L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
- 2026-08-12 20:25:00,546 INFO MainThread:1371664 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 25138816 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14c663f22810>>
20
- 2026-08-12 20:25:00,546 INFO MainThread:1371664 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 25138816 None
 
1
+ 2026-08-12 20:40:11,208 INFO MainThread:1371664 [wandb_init.py:setup_run_log_directory():729] Logging user logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260812_204011-s3p64ib5/logs/debug.log
2
+ 2026-08-12 20:40:11,208 INFO MainThread:1371664 [wandb_init.py:setup_run_log_directory():730] Logging internal logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260812_204011-s3p64ib5/logs/debug-internal.log
3
+ 2026-08-12 20:40:11,208 INFO MainThread:1371664 [wandb_init.py:init():772] calling init triggers
4
+ 2026-08-12 20:40:11,208 INFO MainThread:1371664 [wandb_init.py:init():777] wandb.init called with sweep_config: {}
5
  config: {'_wandb': {}}
6
+ 2026-08-12 20:40:11,208 INFO MainThread:1371664 [wandb_init.py:init():820] starting backend
7
+ 2026-08-12 20:40:11,208 INFO MainThread:1371664 [wandb_init.py:init():826] Connected to an existing wandb-core service via WANDB_SERVICE
8
+ 2026-08-12 20:40:11,208 INFO MainThread:1371664 [wandb_init.py:init():835] sending inform_init request
9
+ 2026-08-12 20:40:11,467 INFO MainThread:1371664 [wandb_init.py:init():840] backend started and connected
10
+ 2026-08-12 20:40:11,468 INFO MainThread:1371664 [wandb_init.py:init():910] updated telemetry
11
+ 2026-08-12 20:40:11,474 INFO MainThread:1371664 [wandb_init.py:init():933] communicating run to backend with 90.0 second timeout
12
+ 2026-08-12 20:40:11,934 INFO MainThread:1371664 [wandb_init.py:init():978] starting run threads in backend
13
+ 2026-08-12 20:40:12,012 INFO MainThread:1371664 [wandb_run.py:_console_start():2621] atexit reg
14
+ 2026-08-12 20:40:12,012 INFO MainThread:1371664 [wandb_run.py:_redirect():2471] redirect: wrap_raw
15
+ 2026-08-12 20:40:12,012 INFO MainThread:1371664 [wandb_run.py:_redirect():2540] Wrapping output streams.
16
+ 2026-08-12 20:40:12,012 INFO MainThread:1371664 [wandb_run.py:_redirect():2563] Redirects installed.
17
+ 2026-08-12 20:40:12,013 INFO MainThread:1371664 [wandb_init.py:init():1016] run started, returning control to user process
18
+ 2026-08-12 20:40:12,013 INFO MainThread:1371664 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 150, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'situglu_low', 'waleed_beta': 10.0, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-situglu_low-150L_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 1000, 'learning_rate': 0.005, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 200, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 0.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-situglu_low-150L-25.1M-20260812-204010', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 50, 'eval_delay': 0, 'per_device_eval_batch_size': 128, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 1000, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-situglu_low-150L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
+ 2026-08-12 20:40:12,021 INFO MainThread:1371664 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 25138816 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14c63c76aa50>>
20
+ 2026-08-12 20:40:12,021 INFO MainThread:1371664 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 25138816 None
zain/Activation/wandb/run-20260812_175304-hrggki9k/logs/debug-core.log CHANGED
@@ -88,3 +88,10 @@
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
 
 
 
 
 
 
 
 
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
91
+ {"time":"2026-08-12T20:40:09.492279982Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
92
+ {"time":"2026-08-12T20:40:10.077517899Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
93
+ {"time":"2026-08-12T20:40:10.078905288Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"k14eff4o","id":"3(@)"}
94
+ {"time":"2026-08-12T20:40:10.079907882Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"k14eff4o","id":"3(@)"}
95
+ {"time":"2026-08-12T20:40:11.209134473Z","level":"INFO","msg":"handleInformInit: received","streamId":"s3p64ib5","id":"3(@)"}
96
+ {"time":"2026-08-12T20:40:11.466769275Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"s3p64ib5","id":"3(@)"}
97
+ {"time":"2026-08-12T20:40:17.014131561Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"zkmy7atip4iq"}
zain/Activation/wandb/run-20260812_180713-utqzlg67/logs/debug-core.log CHANGED
@@ -88,3 +88,10 @@
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
 
 
 
 
 
 
 
 
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
91
+ {"time":"2026-08-12T20:40:09.492279982Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
92
+ {"time":"2026-08-12T20:40:10.077517899Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
93
+ {"time":"2026-08-12T20:40:10.078905288Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"k14eff4o","id":"3(@)"}
94
+ {"time":"2026-08-12T20:40:10.079907882Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"k14eff4o","id":"3(@)"}
95
+ {"time":"2026-08-12T20:40:11.209134473Z","level":"INFO","msg":"handleInformInit: received","streamId":"s3p64ib5","id":"3(@)"}
96
+ {"time":"2026-08-12T20:40:11.466769275Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"s3p64ib5","id":"3(@)"}
97
+ {"time":"2026-08-12T20:40:17.014131561Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"zkmy7atip4iq"}
zain/Activation/wandb/run-20260812_182126-vyycsg6r/logs/debug-core.log CHANGED
@@ -88,3 +88,10 @@
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
 
 
 
 
 
 
 
 
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
91
+ {"time":"2026-08-12T20:40:09.492279982Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
92
+ {"time":"2026-08-12T20:40:10.077517899Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
93
+ {"time":"2026-08-12T20:40:10.078905288Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"k14eff4o","id":"3(@)"}
94
+ {"time":"2026-08-12T20:40:10.079907882Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"k14eff4o","id":"3(@)"}
95
+ {"time":"2026-08-12T20:40:11.209134473Z","level":"INFO","msg":"handleInformInit: received","streamId":"s3p64ib5","id":"3(@)"}
96
+ {"time":"2026-08-12T20:40:11.466769275Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"s3p64ib5","id":"3(@)"}
97
+ {"time":"2026-08-12T20:40:17.014131561Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"zkmy7atip4iq"}
zain/Activation/wandb/run-20260812_183823-qtstmmvv/logs/debug-core.log CHANGED
@@ -88,3 +88,10 @@
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
 
 
 
 
 
 
 
 
88
  {"time":"2026-08-12T20:24:59.716360765Z","level":"INFO","msg":"handleInformInit: received","streamId":"k14eff4o","id":"3(@)"}
89
  {"time":"2026-08-12T20:24:59.979099576Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"k14eff4o","id":"3(@)"}
90
  {"time":"2026-08-12T20:25:05.540298401Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
91
+ {"time":"2026-08-12T20:40:09.492279982Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
92
+ {"time":"2026-08-12T20:40:10.077517899Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"dhf762wounvi"}
93
+ {"time":"2026-08-12T20:40:10.078905288Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"k14eff4o","id":"3(@)"}
94
+ {"time":"2026-08-12T20:40:10.079907882Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"k14eff4o","id":"3(@)"}
95
+ {"time":"2026-08-12T20:40:11.209134473Z","level":"INFO","msg":"handleInformInit: received","streamId":"s3p64ib5","id":"3(@)"}
96
+ {"time":"2026-08-12T20:40:11.466769275Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"s3p64ib5","id":"3(@)"}
97
+ {"time":"2026-08-12T20:40:17.014131561Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"zkmy7atip4iq"}