w-ahmad commited on
Commit
c9bf77f
·
verified ·
1 Parent(s): 0d1a6fe

Auto upload 2026-08-08T21:16:26.795996 (part 2)

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. out/mlp-sigmoid-46L_run/checkpoint-400/optimizer.pt +3 -0
  2. out/mlp-sigmoid-46L_run/checkpoint-400/rng_state.pth +3 -0
  3. out/mlp-sigmoid-46L_run/checkpoint-400/scheduler.pt +3 -0
  4. out/mlp-sigmoid-46L_run/checkpoint-400/tokenizer.json +0 -0
  5. out/mlp-sigmoid-46L_run/checkpoint-400/tokenizer_config.json +13 -0
  6. out/mlp-sigmoid-46L_run/checkpoint-400/trainer_state.json +238 -0
  7. out/mlp-sigmoid-46L_run/checkpoint-400/training_args.bin +3 -0
  8. out/mlp-sigmoid-46L_run/checkpoint-500/config.json +35 -0
  9. out/mlp-sigmoid-46L_run/checkpoint-500/model.safetensors +3 -0
  10. out/mlp-sigmoid-46L_run/checkpoint-500/optimizer.pt +3 -0
  11. out/mlp-sigmoid-46L_run/checkpoint-500/rng_state.pth +3 -0
  12. out/mlp-sigmoid-46L_run/checkpoint-500/scheduler.pt +3 -0
  13. out/mlp-sigmoid-46L_run/checkpoint-500/tokenizer.json +0 -0
  14. out/mlp-sigmoid-46L_run/checkpoint-500/tokenizer_config.json +13 -0
  15. out/mlp-sigmoid-46L_run/checkpoint-500/trainer_state.json +289 -0
  16. out/mlp-sigmoid-46L_run/checkpoint-500/training_args.bin +3 -0
  17. out/mlp-sigmoid-46L_run/checkpoint-600/config.json +35 -0
  18. out/mlp-sigmoid-46L_run/checkpoint-600/model.safetensors +3 -0
  19. out/mlp-sigmoid-46L_run/checkpoint-600/optimizer.pt +3 -0
  20. out/mlp-sigmoid-46L_run/checkpoint-600/rng_state.pth +3 -0
  21. out/mlp-sigmoid-46L_run/checkpoint-600/scheduler.pt +3 -0
  22. out/mlp-sigmoid-46L_run/checkpoint-600/tokenizer.json +0 -0
  23. out/mlp-sigmoid-46L_run/checkpoint-600/tokenizer_config.json +13 -0
  24. out/mlp-sigmoid-46L_run/checkpoint-600/trainer_state.json +340 -0
  25. out/mlp-sigmoid-46L_run/checkpoint-600/training_args.bin +3 -0
  26. out/mlp-sigmoid-46L_run/checkpoint-700/config.json +35 -0
  27. out/mlp-sigmoid-46L_run/checkpoint-700/model.safetensors +3 -0
  28. out/mlp-sigmoid-46L_run/checkpoint-700/optimizer.pt +3 -0
  29. out/mlp-sigmoid-46L_run/checkpoint-700/rng_state.pth +3 -0
  30. out/mlp-sigmoid-46L_run/checkpoint-700/scheduler.pt +3 -0
  31. out/mlp-sigmoid-46L_run/checkpoint-700/tokenizer.json +0 -0
  32. out/mlp-sigmoid-46L_run/checkpoint-700/tokenizer_config.json +13 -0
  33. out/mlp-sigmoid-46L_run/checkpoint-700/trainer_state.json +391 -0
  34. out/mlp-sigmoid-46L_run/checkpoint-700/training_args.bin +3 -0
  35. out/mlp-sigmoid-46L_run/checkpoint-800/config.json +35 -0
  36. out/mlp-sigmoid-46L_run/checkpoint-800/model.safetensors +3 -0
  37. out/mlp-sigmoid-46L_run/checkpoint-800/optimizer.pt +3 -0
  38. out/mlp-sigmoid-46L_run/checkpoint-800/rng_state.pth +3 -0
  39. out/mlp-sigmoid-46L_run/checkpoint-800/scheduler.pt +3 -0
  40. out/mlp-sigmoid-46L_run/checkpoint-800/tokenizer.json +0 -0
  41. out/mlp-sigmoid-46L_run/checkpoint-800/tokenizer_config.json +13 -0
  42. out/mlp-sigmoid-46L_run/checkpoint-800/trainer_state.json +442 -0
  43. out/mlp-sigmoid-46L_run/checkpoint-800/training_args.bin +3 -0
  44. out/mlp-sigmoid-46L_run/checkpoint-900/config.json +35 -0
  45. out/mlp-sigmoid-46L_run/checkpoint-900/model.safetensors +3 -0
  46. out/mlp-sigmoid-46L_run/checkpoint-900/optimizer.pt +3 -0
  47. out/mlp-sigmoid-46L_run/checkpoint-900/rng_state.pth +3 -0
  48. out/mlp-sigmoid-46L_run/checkpoint-900/scheduler.pt +3 -0
  49. out/mlp-sigmoid-46L_run/checkpoint-900/tokenizer.json +0 -0
  50. out/mlp-sigmoid-46L_run/checkpoint-900/tokenizer_config.json +13 -0
out/mlp-sigmoid-46L_run/checkpoint-400/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8b1445029ef219af5bc17363d99b153600f9df0dc6e06700c1285a259ceb1493
3
+ size 32605416
out/mlp-sigmoid-46L_run/checkpoint-400/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f9a6944c405a002fce05f295d08ea6650e2e2ad6dbf5d6da1e9053f7bf7f5827
3
+ size 14244
out/mlp-sigmoid-46L_run/checkpoint-400/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:51769a11c87b2b665cbe64c58b934afdb1fa1998bffb4addcc2f852b172d6681
3
+ size 1064
out/mlp-sigmoid-46L_run/checkpoint-400/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-sigmoid-46L_run/checkpoint-400/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-sigmoid-46L_run/checkpoint-400/trainer_state.json ADDED
@@ -0,0 +1,238 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.215633423180593,
6
+ "eval_steps": 50,
7
+ "global_step": 400,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 0.953125,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.132730865478516,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 0.30078125,
22
+ "learning_rate": 0.001,
23
+ "loss": 6.084678268432617,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.9758501052856445,
29
+ "eval_runtime": 11.1232,
30
+ "eval_samples_per_second": 856.498,
31
+ "eval_steps_per_second": 1.708,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.4140625,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.959280776977539,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 0.2333984375,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.698427963256836,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.26953125,
51
+ "learning_rate": 0.001,
52
+ "loss": 5.483244323730469,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 5.370211601257324,
58
+ "eval_runtime": 11.0192,
59
+ "eval_samples_per_second": 864.582,
60
+ "eval_steps_per_second": 1.724,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.33203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 5.284563827514648,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 0.5859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 5.074047470092774,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.84706974029541,
80
+ "eval_runtime": 11.0423,
81
+ "eval_samples_per_second": 862.77,
82
+ "eval_steps_per_second": 1.721,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.578125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.856560516357422,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.76953125,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.646049499511719,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.32421875,
102
+ "learning_rate": 0.001,
103
+ "loss": 4.480390548706055,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 4.395232677459717,
109
+ "eval_runtime": 11.0603,
110
+ "eval_samples_per_second": 861.369,
111
+ "eval_steps_per_second": 1.718,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.57421875,
117
+ "learning_rate": 0.001,
118
+ "loss": 4.35283317565918,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.64453125,
124
+ "learning_rate": 0.001,
125
+ "loss": 4.239774703979492,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 4.130031108856201,
131
+ "eval_runtime": 11.5228,
132
+ "eval_samples_per_second": 826.793,
133
+ "eval_steps_per_second": 1.649,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 1.3046875,
139
+ "learning_rate": 0.001,
140
+ "loss": 4.1399494171142575,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.68359375,
146
+ "learning_rate": 0.001,
147
+ "loss": 4.071997833251953,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 0.6484375,
153
+ "learning_rate": 0.001,
154
+ "loss": 4.0012977600097654,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.970766067504883,
160
+ "eval_runtime": 11.2668,
161
+ "eval_samples_per_second": 845.58,
162
+ "eval_steps_per_second": 1.686,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.494140625,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.9426082611083983,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.3359375,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.884596252441406,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.869180202484131,
182
+ "eval_runtime": 11.0104,
183
+ "eval_samples_per_second": 865.274,
184
+ "eval_steps_per_second": 1.726,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 0.59765625,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.846722412109375,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.3203125,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.7851001739501955,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.423828125,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.758561706542969,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.7298622131347656,
211
+ "eval_runtime": 11.1,
212
+ "eval_samples_per_second": 858.29,
213
+ "eval_steps_per_second": 1.712,
214
+ "step": 400
215
+ }
216
+ ],
217
+ "logging_steps": 20,
218
+ "max_steps": 1000,
219
+ "num_input_tokens_seen": 0,
220
+ "num_train_epochs": 1,
221
+ "save_steps": 100,
222
+ "stateful_callbacks": {
223
+ "TrainerControl": {
224
+ "args": {
225
+ "should_epoch_stop": false,
226
+ "should_evaluate": false,
227
+ "should_log": false,
228
+ "should_save": true,
229
+ "should_training_stop": false
230
+ },
231
+ "attributes": {}
232
+ }
233
+ },
234
+ "total_flos": 4749133244006400.0,
235
+ "train_batch_size": 512,
236
+ "trial_name": null,
237
+ "trial_params": null
238
+ }
out/mlp-sigmoid-46L_run/checkpoint-400/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f497915d25e5adfc7823f2b88d2f779dbbdb1cedd0353e013bfd915138617020
3
+ size 4920
out/mlp-sigmoid-46L_run/checkpoint-500/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "sigmoid",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 46,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-sigmoid-46L_run/checkpoint-500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e34574332a97a093e666133bc052f18ea6521d1391a8ae7961a89ed251b6f444
3
+ size 16186168
out/mlp-sigmoid-46L_run/checkpoint-500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:19b64bac0b981846aaa9bb3dd97db491c7fa5115262022fd77ed043e750438a6
3
+ size 32605416
out/mlp-sigmoid-46L_run/checkpoint-500/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b1a97db8e41139aa1239ba7fb79ddeb0af5998c6305a440c1fe182e6ad02f2f5
3
+ size 14244
out/mlp-sigmoid-46L_run/checkpoint-500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:60a0752f1683b6bad1b285850c7a77f8c14fbcad243554c3a99f6e443a78365e
3
+ size 1064
out/mlp-sigmoid-46L_run/checkpoint-500/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-sigmoid-46L_run/checkpoint-500/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-sigmoid-46L_run/checkpoint-500/trainer_state.json ADDED
@@ -0,0 +1,289 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.2695417789757412,
6
+ "eval_steps": 50,
7
+ "global_step": 500,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 0.953125,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.132730865478516,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 0.30078125,
22
+ "learning_rate": 0.001,
23
+ "loss": 6.084678268432617,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.9758501052856445,
29
+ "eval_runtime": 11.1232,
30
+ "eval_samples_per_second": 856.498,
31
+ "eval_steps_per_second": 1.708,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.4140625,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.959280776977539,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 0.2333984375,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.698427963256836,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.26953125,
51
+ "learning_rate": 0.001,
52
+ "loss": 5.483244323730469,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 5.370211601257324,
58
+ "eval_runtime": 11.0192,
59
+ "eval_samples_per_second": 864.582,
60
+ "eval_steps_per_second": 1.724,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.33203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 5.284563827514648,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 0.5859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 5.074047470092774,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.84706974029541,
80
+ "eval_runtime": 11.0423,
81
+ "eval_samples_per_second": 862.77,
82
+ "eval_steps_per_second": 1.721,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.578125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.856560516357422,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.76953125,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.646049499511719,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.32421875,
102
+ "learning_rate": 0.001,
103
+ "loss": 4.480390548706055,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 4.395232677459717,
109
+ "eval_runtime": 11.0603,
110
+ "eval_samples_per_second": 861.369,
111
+ "eval_steps_per_second": 1.718,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.57421875,
117
+ "learning_rate": 0.001,
118
+ "loss": 4.35283317565918,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.64453125,
124
+ "learning_rate": 0.001,
125
+ "loss": 4.239774703979492,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 4.130031108856201,
131
+ "eval_runtime": 11.5228,
132
+ "eval_samples_per_second": 826.793,
133
+ "eval_steps_per_second": 1.649,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 1.3046875,
139
+ "learning_rate": 0.001,
140
+ "loss": 4.1399494171142575,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.68359375,
146
+ "learning_rate": 0.001,
147
+ "loss": 4.071997833251953,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 0.6484375,
153
+ "learning_rate": 0.001,
154
+ "loss": 4.0012977600097654,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.970766067504883,
160
+ "eval_runtime": 11.2668,
161
+ "eval_samples_per_second": 845.58,
162
+ "eval_steps_per_second": 1.686,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.494140625,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.9426082611083983,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.3359375,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.884596252441406,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.869180202484131,
182
+ "eval_runtime": 11.0104,
183
+ "eval_samples_per_second": 865.274,
184
+ "eval_steps_per_second": 1.726,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 0.59765625,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.846722412109375,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.3203125,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.7851001739501955,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.423828125,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.758561706542969,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.7298622131347656,
211
+ "eval_runtime": 11.1,
212
+ "eval_samples_per_second": 858.29,
213
+ "eval_steps_per_second": 1.712,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.330078125,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.7036609649658203,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.69140625,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.6900096893310548,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.649232864379883,
233
+ "eval_runtime": 11.3447,
234
+ "eval_samples_per_second": 839.777,
235
+ "eval_steps_per_second": 1.675,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 0.42578125,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.65367431640625,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.70703125,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.617287826538086,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.68359375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.580358123779297,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.590764284133911,
262
+ "eval_runtime": 11.1385,
263
+ "eval_samples_per_second": 855.32,
264
+ "eval_steps_per_second": 1.706,
265
+ "step": 500
266
+ }
267
+ ],
268
+ "logging_steps": 20,
269
+ "max_steps": 1000,
270
+ "num_input_tokens_seen": 0,
271
+ "num_train_epochs": 1,
272
+ "save_steps": 100,
273
+ "stateful_callbacks": {
274
+ "TrainerControl": {
275
+ "args": {
276
+ "should_epoch_stop": false,
277
+ "should_evaluate": false,
278
+ "should_log": false,
279
+ "should_save": true,
280
+ "should_training_stop": false
281
+ },
282
+ "attributes": {}
283
+ }
284
+ },
285
+ "total_flos": 5936416555008000.0,
286
+ "train_batch_size": 512,
287
+ "trial_name": null,
288
+ "trial_params": null
289
+ }
out/mlp-sigmoid-46L_run/checkpoint-500/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f497915d25e5adfc7823f2b88d2f779dbbdb1cedd0353e013bfd915138617020
3
+ size 4920
out/mlp-sigmoid-46L_run/checkpoint-600/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "sigmoid",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 46,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-sigmoid-46L_run/checkpoint-600/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9f9585bff5b3044485209e27d07689f2a38fff9f348f79ab82c078cefd86653b
3
+ size 16186168
out/mlp-sigmoid-46L_run/checkpoint-600/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d0f53815c9bc3f4a572864b426f8912c1f7877940347b5e99099cf6057a4024d
3
+ size 32605416
out/mlp-sigmoid-46L_run/checkpoint-600/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b0b8a6e3878f9402461193b241d8f1ee8546c6ad03f43e5b9dab8f4fc8c4d065
3
+ size 14244
out/mlp-sigmoid-46L_run/checkpoint-600/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c5502244c7ba8b61ab0a3b01cdc7e5e2629060a0565d6b782445d6ba31022cee
3
+ size 1064
out/mlp-sigmoid-46L_run/checkpoint-600/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-sigmoid-46L_run/checkpoint-600/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-sigmoid-46L_run/checkpoint-600/trainer_state.json ADDED
@@ -0,0 +1,340 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.32345013477088946,
6
+ "eval_steps": 50,
7
+ "global_step": 600,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 0.953125,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.132730865478516,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 0.30078125,
22
+ "learning_rate": 0.001,
23
+ "loss": 6.084678268432617,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.9758501052856445,
29
+ "eval_runtime": 11.1232,
30
+ "eval_samples_per_second": 856.498,
31
+ "eval_steps_per_second": 1.708,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.4140625,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.959280776977539,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 0.2333984375,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.698427963256836,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.26953125,
51
+ "learning_rate": 0.001,
52
+ "loss": 5.483244323730469,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 5.370211601257324,
58
+ "eval_runtime": 11.0192,
59
+ "eval_samples_per_second": 864.582,
60
+ "eval_steps_per_second": 1.724,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.33203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 5.284563827514648,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 0.5859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 5.074047470092774,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.84706974029541,
80
+ "eval_runtime": 11.0423,
81
+ "eval_samples_per_second": 862.77,
82
+ "eval_steps_per_second": 1.721,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.578125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.856560516357422,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.76953125,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.646049499511719,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.32421875,
102
+ "learning_rate": 0.001,
103
+ "loss": 4.480390548706055,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 4.395232677459717,
109
+ "eval_runtime": 11.0603,
110
+ "eval_samples_per_second": 861.369,
111
+ "eval_steps_per_second": 1.718,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.57421875,
117
+ "learning_rate": 0.001,
118
+ "loss": 4.35283317565918,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.64453125,
124
+ "learning_rate": 0.001,
125
+ "loss": 4.239774703979492,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 4.130031108856201,
131
+ "eval_runtime": 11.5228,
132
+ "eval_samples_per_second": 826.793,
133
+ "eval_steps_per_second": 1.649,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 1.3046875,
139
+ "learning_rate": 0.001,
140
+ "loss": 4.1399494171142575,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.68359375,
146
+ "learning_rate": 0.001,
147
+ "loss": 4.071997833251953,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 0.6484375,
153
+ "learning_rate": 0.001,
154
+ "loss": 4.0012977600097654,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.970766067504883,
160
+ "eval_runtime": 11.2668,
161
+ "eval_samples_per_second": 845.58,
162
+ "eval_steps_per_second": 1.686,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.494140625,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.9426082611083983,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.3359375,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.884596252441406,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.869180202484131,
182
+ "eval_runtime": 11.0104,
183
+ "eval_samples_per_second": 865.274,
184
+ "eval_steps_per_second": 1.726,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 0.59765625,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.846722412109375,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.3203125,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.7851001739501955,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.423828125,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.758561706542969,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.7298622131347656,
211
+ "eval_runtime": 11.1,
212
+ "eval_samples_per_second": 858.29,
213
+ "eval_steps_per_second": 1.712,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.330078125,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.7036609649658203,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.69140625,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.6900096893310548,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.649232864379883,
233
+ "eval_runtime": 11.3447,
234
+ "eval_samples_per_second": 839.777,
235
+ "eval_steps_per_second": 1.675,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 0.42578125,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.65367431640625,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.70703125,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.617287826538086,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.68359375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.580358123779297,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.590764284133911,
262
+ "eval_runtime": 11.1385,
263
+ "eval_samples_per_second": 855.32,
264
+ "eval_steps_per_second": 1.706,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803234501347709,
269
+ "grad_norm": 0.373046875,
270
+ "learning_rate": 0.001,
271
+ "loss": 3.557994079589844,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29110512129380056,
276
+ "grad_norm": 0.671875,
277
+ "learning_rate": 0.001,
278
+ "loss": 3.5252918243408202,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.29649595687331537,
283
+ "eval_loss": 3.510967969894409,
284
+ "eval_runtime": 11.0988,
285
+ "eval_samples_per_second": 858.384,
286
+ "eval_steps_per_second": 1.712,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3018867924528302,
291
+ "grad_norm": 0.34375,
292
+ "learning_rate": 0.001,
293
+ "loss": 3.5099483489990235,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.31266846361185985,
298
+ "grad_norm": 0.77734375,
299
+ "learning_rate": 0.001,
300
+ "loss": 3.471272277832031,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.32345013477088946,
305
+ "grad_norm": 0.62109375,
306
+ "learning_rate": 0.001,
307
+ "loss": 3.477389907836914,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.32345013477088946,
312
+ "eval_loss": 3.446561098098755,
313
+ "eval_runtime": 11.1795,
314
+ "eval_samples_per_second": 852.182,
315
+ "eval_steps_per_second": 1.7,
316
+ "step": 600
317
+ }
318
+ ],
319
+ "logging_steps": 20,
320
+ "max_steps": 1000,
321
+ "num_input_tokens_seen": 0,
322
+ "num_train_epochs": 1,
323
+ "save_steps": 100,
324
+ "stateful_callbacks": {
325
+ "TrainerControl": {
326
+ "args": {
327
+ "should_epoch_stop": false,
328
+ "should_evaluate": false,
329
+ "should_log": false,
330
+ "should_save": true,
331
+ "should_training_stop": false
332
+ },
333
+ "attributes": {}
334
+ }
335
+ },
336
+ "total_flos": 7123699866009600.0,
337
+ "train_batch_size": 512,
338
+ "trial_name": null,
339
+ "trial_params": null
340
+ }
out/mlp-sigmoid-46L_run/checkpoint-600/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f497915d25e5adfc7823f2b88d2f779dbbdb1cedd0353e013bfd915138617020
3
+ size 4920
out/mlp-sigmoid-46L_run/checkpoint-700/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "sigmoid",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 46,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-sigmoid-46L_run/checkpoint-700/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:49db0bc4aff1ff4d42d9fe6df78a4228b70620a1287c09cb4f032d953924ed9b
3
+ size 16186168
out/mlp-sigmoid-46L_run/checkpoint-700/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:76ad7af55a7a589fed4094fd85676d05bff3893a0128086962008b74a20596d0
3
+ size 32605416
out/mlp-sigmoid-46L_run/checkpoint-700/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c07c9483d2aaa0e0aa4859fa05bacc55a60e0f30ff9c95a3b76854e880483a96
3
+ size 14244
out/mlp-sigmoid-46L_run/checkpoint-700/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3173cd6908322b02fdacbfeb79bbb6a1a1a40d218262cceb79ee8c11c4fa07d7
3
+ size 1064
out/mlp-sigmoid-46L_run/checkpoint-700/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-sigmoid-46L_run/checkpoint-700/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-sigmoid-46L_run/checkpoint-700/trainer_state.json ADDED
@@ -0,0 +1,391 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.37735849056603776,
6
+ "eval_steps": 50,
7
+ "global_step": 700,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 0.953125,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.132730865478516,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 0.30078125,
22
+ "learning_rate": 0.001,
23
+ "loss": 6.084678268432617,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.9758501052856445,
29
+ "eval_runtime": 11.1232,
30
+ "eval_samples_per_second": 856.498,
31
+ "eval_steps_per_second": 1.708,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.4140625,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.959280776977539,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 0.2333984375,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.698427963256836,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.26953125,
51
+ "learning_rate": 0.001,
52
+ "loss": 5.483244323730469,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 5.370211601257324,
58
+ "eval_runtime": 11.0192,
59
+ "eval_samples_per_second": 864.582,
60
+ "eval_steps_per_second": 1.724,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.33203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 5.284563827514648,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 0.5859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 5.074047470092774,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.84706974029541,
80
+ "eval_runtime": 11.0423,
81
+ "eval_samples_per_second": 862.77,
82
+ "eval_steps_per_second": 1.721,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.578125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.856560516357422,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.76953125,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.646049499511719,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.32421875,
102
+ "learning_rate": 0.001,
103
+ "loss": 4.480390548706055,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 4.395232677459717,
109
+ "eval_runtime": 11.0603,
110
+ "eval_samples_per_second": 861.369,
111
+ "eval_steps_per_second": 1.718,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.57421875,
117
+ "learning_rate": 0.001,
118
+ "loss": 4.35283317565918,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.64453125,
124
+ "learning_rate": 0.001,
125
+ "loss": 4.239774703979492,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 4.130031108856201,
131
+ "eval_runtime": 11.5228,
132
+ "eval_samples_per_second": 826.793,
133
+ "eval_steps_per_second": 1.649,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 1.3046875,
139
+ "learning_rate": 0.001,
140
+ "loss": 4.1399494171142575,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.68359375,
146
+ "learning_rate": 0.001,
147
+ "loss": 4.071997833251953,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 0.6484375,
153
+ "learning_rate": 0.001,
154
+ "loss": 4.0012977600097654,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.970766067504883,
160
+ "eval_runtime": 11.2668,
161
+ "eval_samples_per_second": 845.58,
162
+ "eval_steps_per_second": 1.686,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.494140625,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.9426082611083983,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.3359375,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.884596252441406,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.869180202484131,
182
+ "eval_runtime": 11.0104,
183
+ "eval_samples_per_second": 865.274,
184
+ "eval_steps_per_second": 1.726,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 0.59765625,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.846722412109375,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.3203125,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.7851001739501955,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.423828125,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.758561706542969,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.7298622131347656,
211
+ "eval_runtime": 11.1,
212
+ "eval_samples_per_second": 858.29,
213
+ "eval_steps_per_second": 1.712,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.330078125,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.7036609649658203,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.69140625,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.6900096893310548,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.649232864379883,
233
+ "eval_runtime": 11.3447,
234
+ "eval_samples_per_second": 839.777,
235
+ "eval_steps_per_second": 1.675,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 0.42578125,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.65367431640625,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.70703125,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.617287826538086,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.68359375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.580358123779297,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.590764284133911,
262
+ "eval_runtime": 11.1385,
263
+ "eval_samples_per_second": 855.32,
264
+ "eval_steps_per_second": 1.706,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803234501347709,
269
+ "grad_norm": 0.373046875,
270
+ "learning_rate": 0.001,
271
+ "loss": 3.557994079589844,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29110512129380056,
276
+ "grad_norm": 0.671875,
277
+ "learning_rate": 0.001,
278
+ "loss": 3.5252918243408202,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.29649595687331537,
283
+ "eval_loss": 3.510967969894409,
284
+ "eval_runtime": 11.0988,
285
+ "eval_samples_per_second": 858.384,
286
+ "eval_steps_per_second": 1.712,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3018867924528302,
291
+ "grad_norm": 0.34375,
292
+ "learning_rate": 0.001,
293
+ "loss": 3.5099483489990235,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.31266846361185985,
298
+ "grad_norm": 0.77734375,
299
+ "learning_rate": 0.001,
300
+ "loss": 3.471272277832031,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.32345013477088946,
305
+ "grad_norm": 0.62109375,
306
+ "learning_rate": 0.001,
307
+ "loss": 3.477389907836914,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.32345013477088946,
312
+ "eval_loss": 3.446561098098755,
313
+ "eval_runtime": 11.1795,
314
+ "eval_samples_per_second": 852.182,
315
+ "eval_steps_per_second": 1.7,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.33423180592991913,
320
+ "grad_norm": 0.453125,
321
+ "learning_rate": 0.001,
322
+ "loss": 3.427866744995117,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.3450134770889488,
327
+ "grad_norm": 0.65234375,
328
+ "learning_rate": 0.001,
329
+ "loss": 3.4235225677490235,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.3504043126684636,
334
+ "eval_loss": 3.397838830947876,
335
+ "eval_runtime": 11.492,
336
+ "eval_samples_per_second": 829.015,
337
+ "eval_steps_per_second": 1.653,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.3557951482479784,
342
+ "grad_norm": 0.4140625,
343
+ "learning_rate": 0.001,
344
+ "loss": 3.4058517456054687,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.3665768194070081,
349
+ "grad_norm": 1.0390625,
350
+ "learning_rate": 0.001,
351
+ "loss": 3.3697017669677733,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37735849056603776,
356
+ "grad_norm": 0.859375,
357
+ "learning_rate": 0.001,
358
+ "loss": 3.3665958404541017,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37735849056603776,
363
+ "eval_loss": 3.3444883823394775,
364
+ "eval_runtime": 11.5463,
365
+ "eval_samples_per_second": 825.113,
366
+ "eval_steps_per_second": 1.646,
367
+ "step": 700
368
+ }
369
+ ],
370
+ "logging_steps": 20,
371
+ "max_steps": 1000,
372
+ "num_input_tokens_seen": 0,
373
+ "num_train_epochs": 1,
374
+ "save_steps": 100,
375
+ "stateful_callbacks": {
376
+ "TrainerControl": {
377
+ "args": {
378
+ "should_epoch_stop": false,
379
+ "should_evaluate": false,
380
+ "should_log": false,
381
+ "should_save": true,
382
+ "should_training_stop": false
383
+ },
384
+ "attributes": {}
385
+ }
386
+ },
387
+ "total_flos": 8310983177011200.0,
388
+ "train_batch_size": 512,
389
+ "trial_name": null,
390
+ "trial_params": null
391
+ }
out/mlp-sigmoid-46L_run/checkpoint-700/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f497915d25e5adfc7823f2b88d2f779dbbdb1cedd0353e013bfd915138617020
3
+ size 4920
out/mlp-sigmoid-46L_run/checkpoint-800/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "sigmoid",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 46,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-sigmoid-46L_run/checkpoint-800/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dbcc7c32910da461d577ec24990c01d3027679fc3fe2ed2121a6d3668d18cb96
3
+ size 16186168
out/mlp-sigmoid-46L_run/checkpoint-800/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fc822863d570a85f697ed14cb15e4628dda71d56b6f4b30918bc9f414c29694e
3
+ size 32605416
out/mlp-sigmoid-46L_run/checkpoint-800/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f83fe17529e572dff2734bb21512b28dd7cf5d20ef0e84688f5068ffbf24e765
3
+ size 14244
out/mlp-sigmoid-46L_run/checkpoint-800/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7334026bbd250befa466dcbe6bec8bfe84c03024263e4dea55e40698f2caa92e
3
+ size 1064
out/mlp-sigmoid-46L_run/checkpoint-800/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-sigmoid-46L_run/checkpoint-800/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-sigmoid-46L_run/checkpoint-800/trainer_state.json ADDED
@@ -0,0 +1,442 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.431266846361186,
6
+ "eval_steps": 50,
7
+ "global_step": 800,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 0.953125,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.132730865478516,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 0.30078125,
22
+ "learning_rate": 0.001,
23
+ "loss": 6.084678268432617,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.9758501052856445,
29
+ "eval_runtime": 11.1232,
30
+ "eval_samples_per_second": 856.498,
31
+ "eval_steps_per_second": 1.708,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.4140625,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.959280776977539,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 0.2333984375,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.698427963256836,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.26953125,
51
+ "learning_rate": 0.001,
52
+ "loss": 5.483244323730469,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 5.370211601257324,
58
+ "eval_runtime": 11.0192,
59
+ "eval_samples_per_second": 864.582,
60
+ "eval_steps_per_second": 1.724,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.33203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 5.284563827514648,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 0.5859375,
73
+ "learning_rate": 0.001,
74
+ "loss": 5.074047470092774,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.84706974029541,
80
+ "eval_runtime": 11.0423,
81
+ "eval_samples_per_second": 862.77,
82
+ "eval_steps_per_second": 1.721,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.578125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.856560516357422,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.76953125,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.646049499511719,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.32421875,
102
+ "learning_rate": 0.001,
103
+ "loss": 4.480390548706055,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 4.395232677459717,
109
+ "eval_runtime": 11.0603,
110
+ "eval_samples_per_second": 861.369,
111
+ "eval_steps_per_second": 1.718,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.57421875,
117
+ "learning_rate": 0.001,
118
+ "loss": 4.35283317565918,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.64453125,
124
+ "learning_rate": 0.001,
125
+ "loss": 4.239774703979492,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 4.130031108856201,
131
+ "eval_runtime": 11.5228,
132
+ "eval_samples_per_second": 826.793,
133
+ "eval_steps_per_second": 1.649,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 1.3046875,
139
+ "learning_rate": 0.001,
140
+ "loss": 4.1399494171142575,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.68359375,
146
+ "learning_rate": 0.001,
147
+ "loss": 4.071997833251953,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 0.6484375,
153
+ "learning_rate": 0.001,
154
+ "loss": 4.0012977600097654,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.970766067504883,
160
+ "eval_runtime": 11.2668,
161
+ "eval_samples_per_second": 845.58,
162
+ "eval_steps_per_second": 1.686,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.494140625,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.9426082611083983,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.3359375,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.884596252441406,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.869180202484131,
182
+ "eval_runtime": 11.0104,
183
+ "eval_samples_per_second": 865.274,
184
+ "eval_steps_per_second": 1.726,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 0.59765625,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.846722412109375,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.3203125,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.7851001739501955,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.423828125,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.758561706542969,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.7298622131347656,
211
+ "eval_runtime": 11.1,
212
+ "eval_samples_per_second": 858.29,
213
+ "eval_steps_per_second": 1.712,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.330078125,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.7036609649658203,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.69140625,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.6900096893310548,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.649232864379883,
233
+ "eval_runtime": 11.3447,
234
+ "eval_samples_per_second": 839.777,
235
+ "eval_steps_per_second": 1.675,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 0.42578125,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.65367431640625,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.70703125,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.617287826538086,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.68359375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.580358123779297,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.590764284133911,
262
+ "eval_runtime": 11.1385,
263
+ "eval_samples_per_second": 855.32,
264
+ "eval_steps_per_second": 1.706,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803234501347709,
269
+ "grad_norm": 0.373046875,
270
+ "learning_rate": 0.001,
271
+ "loss": 3.557994079589844,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29110512129380056,
276
+ "grad_norm": 0.671875,
277
+ "learning_rate": 0.001,
278
+ "loss": 3.5252918243408202,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.29649595687331537,
283
+ "eval_loss": 3.510967969894409,
284
+ "eval_runtime": 11.0988,
285
+ "eval_samples_per_second": 858.384,
286
+ "eval_steps_per_second": 1.712,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3018867924528302,
291
+ "grad_norm": 0.34375,
292
+ "learning_rate": 0.001,
293
+ "loss": 3.5099483489990235,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.31266846361185985,
298
+ "grad_norm": 0.77734375,
299
+ "learning_rate": 0.001,
300
+ "loss": 3.471272277832031,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.32345013477088946,
305
+ "grad_norm": 0.62109375,
306
+ "learning_rate": 0.001,
307
+ "loss": 3.477389907836914,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.32345013477088946,
312
+ "eval_loss": 3.446561098098755,
313
+ "eval_runtime": 11.1795,
314
+ "eval_samples_per_second": 852.182,
315
+ "eval_steps_per_second": 1.7,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.33423180592991913,
320
+ "grad_norm": 0.453125,
321
+ "learning_rate": 0.001,
322
+ "loss": 3.427866744995117,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.3450134770889488,
327
+ "grad_norm": 0.65234375,
328
+ "learning_rate": 0.001,
329
+ "loss": 3.4235225677490235,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.3504043126684636,
334
+ "eval_loss": 3.397838830947876,
335
+ "eval_runtime": 11.492,
336
+ "eval_samples_per_second": 829.015,
337
+ "eval_steps_per_second": 1.653,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.3557951482479784,
342
+ "grad_norm": 0.4140625,
343
+ "learning_rate": 0.001,
344
+ "loss": 3.4058517456054687,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.3665768194070081,
349
+ "grad_norm": 1.0390625,
350
+ "learning_rate": 0.001,
351
+ "loss": 3.3697017669677733,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37735849056603776,
356
+ "grad_norm": 0.859375,
357
+ "learning_rate": 0.001,
358
+ "loss": 3.3665958404541017,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37735849056603776,
363
+ "eval_loss": 3.3444883823394775,
364
+ "eval_runtime": 11.5463,
365
+ "eval_samples_per_second": 825.113,
366
+ "eval_steps_per_second": 1.646,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.3881401617250674,
371
+ "grad_norm": 0.59375,
372
+ "learning_rate": 0.001,
373
+ "loss": 3.3385574340820314,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.39892183288409705,
378
+ "grad_norm": 0.328125,
379
+ "learning_rate": 0.001,
380
+ "loss": 3.312589645385742,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.40431266846361186,
385
+ "eval_loss": 3.295668840408325,
386
+ "eval_runtime": 11.457,
387
+ "eval_samples_per_second": 831.544,
388
+ "eval_steps_per_second": 1.658,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.40970350404312667,
393
+ "grad_norm": 1.015625,
394
+ "learning_rate": 0.001,
395
+ "loss": 3.3023757934570312,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.42048517520215634,
400
+ "grad_norm": 0.515625,
401
+ "learning_rate": 0.001,
402
+ "loss": 3.3048343658447266,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.431266846361186,
407
+ "grad_norm": 0.78125,
408
+ "learning_rate": 0.001,
409
+ "loss": 3.2649677276611326,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.431266846361186,
414
+ "eval_loss": 3.2709333896636963,
415
+ "eval_runtime": 11.2527,
416
+ "eval_samples_per_second": 846.644,
417
+ "eval_steps_per_second": 1.688,
418
+ "step": 800
419
+ }
420
+ ],
421
+ "logging_steps": 20,
422
+ "max_steps": 1000,
423
+ "num_input_tokens_seen": 0,
424
+ "num_train_epochs": 1,
425
+ "save_steps": 100,
426
+ "stateful_callbacks": {
427
+ "TrainerControl": {
428
+ "args": {
429
+ "should_epoch_stop": false,
430
+ "should_evaluate": false,
431
+ "should_log": false,
432
+ "should_save": true,
433
+ "should_training_stop": false
434
+ },
435
+ "attributes": {}
436
+ }
437
+ },
438
+ "total_flos": 9498266488012800.0,
439
+ "train_batch_size": 512,
440
+ "trial_name": null,
441
+ "trial_params": null
442
+ }
out/mlp-sigmoid-46L_run/checkpoint-800/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f497915d25e5adfc7823f2b88d2f779dbbdb1cedd0353e013bfd915138617020
3
+ size 4920
out/mlp-sigmoid-46L_run/checkpoint-900/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "sigmoid",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 46,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-sigmoid-46L_run/checkpoint-900/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:68a551015537011253b4c5d39afde90565582343a162faeeafc880d97a9aa0e7
3
+ size 16186168
out/mlp-sigmoid-46L_run/checkpoint-900/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:17291c3c1fdc1236b18fb25da1e9bb9d52d79c3d1db29e22126afee51792c5d8
3
+ size 32605416
out/mlp-sigmoid-46L_run/checkpoint-900/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:86a2aa7bca84d2b8e7dd4e04a286714ba9169af11c46c739950a52df4c45259f
3
+ size 14244
out/mlp-sigmoid-46L_run/checkpoint-900/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6d48b00fea613f19335b87fb622648d28d7f8900963d07ba43c75df2b4dc3d4e
3
+ size 1064
out/mlp-sigmoid-46L_run/checkpoint-900/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-sigmoid-46L_run/checkpoint-900/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }