w-ahmad commited on
Commit
e95e15d
·
verified ·
1 Parent(s): aed94ee

Auto upload 2026-08-07T22:16:24.957334

Browse files
out/mlp-linear-21L_run/README.md ADDED
@@ -0,0 +1,75 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: transformers
3
+ tags:
4
+ - generated_from_trainer
5
+ model-index:
6
+ - name: A-mlp-linear-21L
7
+ results: []
8
+ ---
9
+
10
+ <!-- This model card has been generated automatically according to the information the Trainer had access to. You
11
+ should probably proofread and complete it, then remove this comment. -->
12
+
13
+ # A-mlp-linear-21L
14
+
15
+ This model is a fine-tuned version of [](https://huggingface.co/) on an unknown dataset.
16
+ It achieves the following results on the evaluation set:
17
+ - Loss: 2.6463
18
+
19
+ ## Model description
20
+
21
+ More information needed
22
+
23
+ ## Intended uses & limitations
24
+
25
+ More information needed
26
+
27
+ ## Training and evaluation data
28
+
29
+ More information needed
30
+
31
+ ## Training procedure
32
+
33
+ ### Training hyperparameters
34
+
35
+ The following hyperparameters were used during training:
36
+ - learning_rate: 0.001
37
+ - train_batch_size: 512
38
+ - eval_batch_size: 512
39
+ - seed: 42
40
+ - optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
41
+ - lr_scheduler_type: constant
42
+ - training_steps: 1000
43
+
44
+ ### Training results
45
+
46
+ | Training Loss | Epoch | Step | Validation Loss |
47
+ |:-------------:|:------:|:----:|:---------------:|
48
+ | 6.0000 | 0.0270 | 50 | 5.5702 |
49
+ | 4.9394 | 0.0539 | 100 | 4.7847 |
50
+ | 4.4303 | 0.0809 | 150 | 4.2523 |
51
+ | 3.9880 | 0.1078 | 200 | 3.9186 |
52
+ | 3.7869 | 0.1348 | 250 | 3.6822 |
53
+ | 3.5519 | 0.1617 | 300 | 3.5238 |
54
+ | 3.4455 | 0.1887 | 350 | 3.4025 |
55
+ | 3.2958 | 0.2156 | 400 | 3.2791 |
56
+ | 3.2150 | 0.2426 | 450 | 3.1811 |
57
+ | 3.1018 | 0.2695 | 500 | 3.1056 |
58
+ | 3.0467 | 0.2965 | 550 | 3.0225 |
59
+ | 2.9589 | 0.3235 | 600 | 2.9538 |
60
+ | 2.9133 | 0.3504 | 650 | 2.9055 |
61
+ | 2.8518 | 0.3774 | 700 | 2.8684 |
62
+ | 2.8155 | 0.4043 | 750 | 2.8133 |
63
+ | 2.7822 | 0.4313 | 800 | 2.7784 |
64
+ | 2.7390 | 0.4582 | 850 | 2.7363 |
65
+ | 2.7122 | 0.4852 | 900 | 2.7042 |
66
+ | 2.6723 | 0.5121 | 950 | 2.6710 |
67
+ | 2.6482 | 0.5391 | 1000 | 2.6463 |
68
+
69
+
70
+ ### Framework versions
71
+
72
+ - Transformers 5.15.0.dev0
73
+ - Pytorch 2.6.0+cu124
74
+ - Datasets 5.0.1
75
+ - Tokenizers 0.22.2
out/mlp-linear-21L_run/checkpoint-1000/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "linear",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 21,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-linear-21L_run/checkpoint-1000/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:557fe9dae966c61e5e4792464d69b2fb04c1188358e0a16700c7d3d5083e7645
3
+ size 7959296
out/mlp-linear-21L_run/checkpoint-1000/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:13fd957fb054f52332a5ab088a5cdebfd41a97e6242d29c697dc932d1b53cf8a
3
+ size 16023738
out/mlp-linear-21L_run/checkpoint-1000/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:645b71843375baf4cc10bc75a2f0f04e91b8e3f8e8929f518a87022898b3bc20
3
+ size 14244
out/mlp-linear-21L_run/checkpoint-1000/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0fc3ca8af69cc9d003a05a139e7997960ab393fe31ae1d898b29038573704b4e
3
+ size 1064
out/mlp-linear-21L_run/checkpoint-1000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-linear-21L_run/checkpoint-1000/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-linear-21L_run/checkpoint-1000/trainer_state.json ADDED
@@ -0,0 +1,544 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.5390835579514824,
6
+ "eval_steps": 50,
7
+ "global_step": 1000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 1.0546875,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.274208068847656,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 1.53125,
22
+ "learning_rate": 0.001,
23
+ "loss": 5.9999839782714846,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.570199966430664,
29
+ "eval_runtime": 8.819,
30
+ "eval_samples_per_second": 1080.281,
31
+ "eval_steps_per_second": 2.154,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.88671875,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.567345046997071,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 1.0546875,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.250301742553711,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.50390625,
51
+ "learning_rate": 0.001,
52
+ "loss": 4.9394378662109375,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 4.784651279449463,
58
+ "eval_runtime": 8.8621,
59
+ "eval_samples_per_second": 1075.032,
60
+ "eval_steps_per_second": 2.144,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.58203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 4.660997772216797,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 1.5546875,
73
+ "learning_rate": 0.001,
74
+ "loss": 4.43031005859375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.252280235290527,
80
+ "eval_runtime": 8.9869,
81
+ "eval_samples_per_second": 1060.1,
82
+ "eval_steps_per_second": 2.114,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.48828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.2591907501220705,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.91015625,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.122463607788086,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.435546875,
102
+ "learning_rate": 0.001,
103
+ "loss": 3.9880271911621095,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 3.9186038970947266,
109
+ "eval_runtime": 8.9327,
110
+ "eval_samples_per_second": 1066.53,
111
+ "eval_steps_per_second": 2.127,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.73828125,
117
+ "learning_rate": 0.001,
118
+ "loss": 3.8731555938720703,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.40234375,
124
+ "learning_rate": 0.001,
125
+ "loss": 3.786928176879883,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 3.682241916656494,
131
+ "eval_runtime": 8.9206,
132
+ "eval_samples_per_second": 1067.975,
133
+ "eval_steps_per_second": 2.13,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 0.84375,
139
+ "learning_rate": 0.001,
140
+ "loss": 3.6825389862060547,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.51171875,
146
+ "learning_rate": 0.001,
147
+ "loss": 3.6361549377441404,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 1.5703125,
153
+ "learning_rate": 0.001,
154
+ "loss": 3.551879119873047,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.5237605571746826,
160
+ "eval_runtime": 9.0532,
161
+ "eval_samples_per_second": 1052.333,
162
+ "eval_steps_per_second": 2.099,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.62109375,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.526197814941406,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.34765625,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.44549446105957,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.4025301933288574,
182
+ "eval_runtime": 9.1498,
183
+ "eval_samples_per_second": 1041.23,
184
+ "eval_steps_per_second": 2.077,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 1.0234375,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.4011425018310546,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.6171875,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.3427574157714846,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.5859375,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.2958106994628906,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.2790729999542236,
211
+ "eval_runtime": 9.1929,
212
+ "eval_samples_per_second": 1036.342,
213
+ "eval_steps_per_second": 2.067,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.5234375,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.2616317749023436,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.5703125,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.2149822235107424,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.181051015853882,
233
+ "eval_runtime": 9.1212,
234
+ "eval_samples_per_second": 1044.485,
235
+ "eval_steps_per_second": 2.083,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 1.0546875,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.1823314666748046,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.5390625,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.1341114044189453,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.9375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.101780128479004,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.1055757999420166,
262
+ "eval_runtime": 9.2225,
263
+ "eval_samples_per_second": 1033.013,
264
+ "eval_steps_per_second": 2.06,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803234501347709,
269
+ "grad_norm": 0.5078125,
270
+ "learning_rate": 0.001,
271
+ "loss": 3.0730880737304687,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29110512129380056,
276
+ "grad_norm": 0.609375,
277
+ "learning_rate": 0.001,
278
+ "loss": 3.0466753005981446,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.29649595687331537,
283
+ "eval_loss": 3.022505283355713,
284
+ "eval_runtime": 9.1838,
285
+ "eval_samples_per_second": 1037.366,
286
+ "eval_steps_per_second": 2.069,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3018867924528302,
291
+ "grad_norm": 0.5,
292
+ "learning_rate": 0.001,
293
+ "loss": 3.0200361251831054,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.31266846361185985,
298
+ "grad_norm": 0.73046875,
299
+ "learning_rate": 0.001,
300
+ "loss": 2.9901798248291014,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.32345013477088946,
305
+ "grad_norm": 0.73046875,
306
+ "learning_rate": 0.001,
307
+ "loss": 2.958896255493164,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.32345013477088946,
312
+ "eval_loss": 2.95377516746521,
313
+ "eval_runtime": 9.1618,
314
+ "eval_samples_per_second": 1039.857,
315
+ "eval_steps_per_second": 2.074,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.33423180592991913,
320
+ "grad_norm": 0.78125,
321
+ "learning_rate": 0.001,
322
+ "loss": 2.952092933654785,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.3450134770889488,
327
+ "grad_norm": 0.44921875,
328
+ "learning_rate": 0.001,
329
+ "loss": 2.9132663726806642,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.3504043126684636,
334
+ "eval_loss": 2.905498504638672,
335
+ "eval_runtime": 9.1525,
336
+ "eval_samples_per_second": 1040.913,
337
+ "eval_steps_per_second": 2.076,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.3557951482479784,
342
+ "grad_norm": 0.98828125,
343
+ "learning_rate": 0.001,
344
+ "loss": 2.900470161437988,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.3665768194070081,
349
+ "grad_norm": 0.56640625,
350
+ "learning_rate": 0.001,
351
+ "loss": 2.8784067153930666,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37735849056603776,
356
+ "grad_norm": 0.92578125,
357
+ "learning_rate": 0.001,
358
+ "loss": 2.8517574310302733,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37735849056603776,
363
+ "eval_loss": 2.868436336517334,
364
+ "eval_runtime": 9.2031,
365
+ "eval_samples_per_second": 1035.193,
366
+ "eval_steps_per_second": 2.065,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.3881401617250674,
371
+ "grad_norm": 0.486328125,
372
+ "learning_rate": 0.001,
373
+ "loss": 2.846698760986328,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.39892183288409705,
378
+ "grad_norm": 0.82421875,
379
+ "learning_rate": 0.001,
380
+ "loss": 2.8154937744140627,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.40431266846361186,
385
+ "eval_loss": 2.813324451446533,
386
+ "eval_runtime": 9.1186,
387
+ "eval_samples_per_second": 1044.786,
388
+ "eval_steps_per_second": 2.084,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.40970350404312667,
393
+ "grad_norm": 0.54296875,
394
+ "learning_rate": 0.001,
395
+ "loss": 2.8071964263916014,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.42048517520215634,
400
+ "grad_norm": 0.69140625,
401
+ "learning_rate": 0.001,
402
+ "loss": 2.7811683654785155,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.431266846361186,
407
+ "grad_norm": 0.73828125,
408
+ "learning_rate": 0.001,
409
+ "loss": 2.782184028625488,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.431266846361186,
414
+ "eval_loss": 2.778449535369873,
415
+ "eval_runtime": 9.2351,
416
+ "eval_samples_per_second": 1031.606,
417
+ "eval_steps_per_second": 2.057,
418
+ "step": 800
419
+ },
420
+ {
421
+ "epoch": 0.4420485175202156,
422
+ "grad_norm": 0.44921875,
423
+ "learning_rate": 0.001,
424
+ "loss": 2.754811668395996,
425
+ "step": 820
426
+ },
427
+ {
428
+ "epoch": 0.4528301886792453,
429
+ "grad_norm": 0.89453125,
430
+ "learning_rate": 0.001,
431
+ "loss": 2.7389667510986326,
432
+ "step": 840
433
+ },
434
+ {
435
+ "epoch": 0.4582210242587601,
436
+ "eval_loss": 2.736283540725708,
437
+ "eval_runtime": 9.2108,
438
+ "eval_samples_per_second": 1034.331,
439
+ "eval_steps_per_second": 2.063,
440
+ "step": 850
441
+ },
442
+ {
443
+ "epoch": 0.4636118598382749,
444
+ "grad_norm": 0.53515625,
445
+ "learning_rate": 0.001,
446
+ "loss": 2.728610801696777,
447
+ "step": 860
448
+ },
449
+ {
450
+ "epoch": 0.4743935309973046,
451
+ "grad_norm": 0.98828125,
452
+ "learning_rate": 0.001,
453
+ "loss": 2.703776550292969,
454
+ "step": 880
455
+ },
456
+ {
457
+ "epoch": 0.48517520215633425,
458
+ "grad_norm": 0.75390625,
459
+ "learning_rate": 0.001,
460
+ "loss": 2.712217330932617,
461
+ "step": 900
462
+ },
463
+ {
464
+ "epoch": 0.48517520215633425,
465
+ "eval_loss": 2.7041544914245605,
466
+ "eval_runtime": 9.4718,
467
+ "eval_samples_per_second": 1005.83,
468
+ "eval_steps_per_second": 2.006,
469
+ "step": 900
470
+ },
471
+ {
472
+ "epoch": 0.49595687331536387,
473
+ "grad_norm": 0.48828125,
474
+ "learning_rate": 0.001,
475
+ "loss": 2.677124786376953,
476
+ "step": 920
477
+ },
478
+ {
479
+ "epoch": 0.5067385444743935,
480
+ "grad_norm": 0.9921875,
481
+ "learning_rate": 0.001,
482
+ "loss": 2.6723052978515627,
483
+ "step": 940
484
+ },
485
+ {
486
+ "epoch": 0.5121293800539084,
487
+ "eval_loss": 2.6709580421447754,
488
+ "eval_runtime": 9.5201,
489
+ "eval_samples_per_second": 1000.726,
490
+ "eval_steps_per_second": 1.996,
491
+ "step": 950
492
+ },
493
+ {
494
+ "epoch": 0.5175202156334232,
495
+ "grad_norm": 0.482421875,
496
+ "learning_rate": 0.001,
497
+ "loss": 2.672710418701172,
498
+ "step": 960
499
+ },
500
+ {
501
+ "epoch": 0.5283018867924528,
502
+ "grad_norm": 0.50390625,
503
+ "learning_rate": 0.001,
504
+ "loss": 2.647985076904297,
505
+ "step": 980
506
+ },
507
+ {
508
+ "epoch": 0.5390835579514824,
509
+ "grad_norm": 0.84375,
510
+ "learning_rate": 0.001,
511
+ "loss": 2.6482110977172852,
512
+ "step": 1000
513
+ },
514
+ {
515
+ "epoch": 0.5390835579514824,
516
+ "eval_loss": 2.646259069442749,
517
+ "eval_runtime": 9.5559,
518
+ "eval_samples_per_second": 996.971,
519
+ "eval_steps_per_second": 1.988,
520
+ "step": 1000
521
+ }
522
+ ],
523
+ "logging_steps": 20,
524
+ "max_steps": 1000,
525
+ "num_input_tokens_seen": 0,
526
+ "num_train_epochs": 1,
527
+ "save_steps": 100,
528
+ "stateful_callbacks": {
529
+ "TrainerControl": {
530
+ "args": {
531
+ "should_epoch_stop": false,
532
+ "should_evaluate": false,
533
+ "should_log": false,
534
+ "should_save": true,
535
+ "should_training_stop": true
536
+ },
537
+ "attributes": {}
538
+ }
539
+ },
540
+ "total_flos": 5420315836416000.0,
541
+ "train_batch_size": 512,
542
+ "trial_name": null,
543
+ "trial_params": null
544
+ }
out/mlp-linear-21L_run/checkpoint-1000/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f710638f98cb9aa723847c3078af1df019ed60911a4c32cfe8698e762841d517
3
+ size 4920
out/mlp-linear-21L_run/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:23ae85e4a038e289ca876dca6ccf4fd8a2a5cc4c9d17dd3a1d0dfe677c6fb506
3
  size 7959296
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:557fe9dae966c61e5e4792464d69b2fb04c1188358e0a16700c7d3d5083e7645
3
  size 7959296
out/mlp-linear-21L_run/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-linear-21L_run/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-linear-21L_run/training_log.jsonl CHANGED
@@ -65,3 +65,8 @@
65
  {"step": 940, "epoch": 0.5067385444743935, "timestamp": 1786140648.6530638, "loss": 2.6723052978515627, "grad_norm": 0.9921875, "learning_rate": 0.001, "train/total_time_seconds": 298.08655486628413, "train/time_per_step_avg": 0.31626581989228725, "train/epoch_time_elapsed": 826.3808276876807, "train/estimated_remaining_minutes": 0.3171133562407278}
66
  {"step": 950, "epoch": 0.5121293800539084, "timestamp": 1786140665.325624, "eval_loss": 2.6709580421447754, "eval_runtime": 9.5201, "eval_samples_per_second": 1000.726, "eval_steps_per_second": 1.996, "train/total_time_seconds": 301.25240771844983, "train/time_per_step_avg": 0.3163437790796161, "train/epoch_time_elapsed": 843.0533857010305, "train/estimated_remaining_minutes": 0.2642564979986402}
67
  {"step": 960, "epoch": 0.5175202156334232, "timestamp": 1786140672.499597, "loss": 2.672710418701172, "grad_norm": 0.482421875, "learning_rate": 0.001, "train/total_time_seconds": 304.4166898280382, "train/time_per_step_avg": 0.3163340176269412, "train/epoch_time_elapsed": 850.2273597568274, "train/estimated_remaining_minutes": 0.21140047904724876}
 
 
 
 
 
 
65
  {"step": 940, "epoch": 0.5067385444743935, "timestamp": 1786140648.6530638, "loss": 2.6723052978515627, "grad_norm": 0.9921875, "learning_rate": 0.001, "train/total_time_seconds": 298.08655486628413, "train/time_per_step_avg": 0.31626581989228725, "train/epoch_time_elapsed": 826.3808276876807, "train/estimated_remaining_minutes": 0.3171133562407278}
66
  {"step": 950, "epoch": 0.5121293800539084, "timestamp": 1786140665.325624, "eval_loss": 2.6709580421447754, "eval_runtime": 9.5201, "eval_samples_per_second": 1000.726, "eval_steps_per_second": 1.996, "train/total_time_seconds": 301.25240771844983, "train/time_per_step_avg": 0.3163437790796161, "train/epoch_time_elapsed": 843.0533857010305, "train/estimated_remaining_minutes": 0.2642564979986402}
67
  {"step": 960, "epoch": 0.5175202156334232, "timestamp": 1786140672.499597, "loss": 2.672710418701172, "grad_norm": 0.482421875, "learning_rate": 0.001, "train/total_time_seconds": 304.4166898280382, "train/time_per_step_avg": 0.3163340176269412, "train/epoch_time_elapsed": 850.2273597568274, "train/estimated_remaining_minutes": 0.21140047904724876}
68
+ {"step": 980, "epoch": 0.5283018867924528, "timestamp": 1786140686.8258102, "loss": 2.647985076904297, "grad_norm": 0.50390625, "learning_rate": 0.001, "train/total_time_seconds": 310.7483237609267, "train/time_per_step_avg": 0.3163422378152609, "train/epoch_time_elapsed": 864.5535742230713, "train/estimated_remaining_minutes": 0.10569670876221998}
69
+ {"step": 1000, "epoch": 0.5390835579514824, "timestamp": 1786140701.2387767, "loss": 2.6482110977172852, "grad_norm": 0.84375, "learning_rate": 0.001, "train/total_time_seconds": 317.07109136506915, "train/time_per_step_avg": 0.3162866896018386, "train/epoch_time_elapsed": 878.9665398783982, "train/estimated_remaining_minutes": 0.0}
70
+ {"step": 1000, "epoch": 0.5390835579514824, "timestamp": 1786140710.7961798, "eval_loss": 2.646259069442749, "eval_runtime": 9.5559, "eval_samples_per_second": 996.971, "eval_steps_per_second": 1.988, "train/total_time_seconds": 317.07109136506915, "train/time_per_step_avg": 0.3162866896018386, "train/epoch_time_elapsed": 888.523941565305, "train/estimated_remaining_minutes": 0.0}
71
+ {"step": 1000, "epoch": 0.5390835579514824, "timestamp": 1786140710.8743045, "train_runtime": 889.3114, "train_samples_per_second": 575.726, "train_steps_per_second": 1.124, "total_flos": 5420315836416000.0, "train_loss": 3.4500698623657224, "train/total_time_seconds": 317.07109136506915, "train/time_per_step_avg": 0.3162866896018386, "train/epoch_time_elapsed": 888.6020677499473, "train/estimated_remaining_minutes": 0.0}
72
+ {"step": 1000, "epoch": 0.5390835579514824, "timestamp": 1786140721.6179974, "eval_loss": 2.646259069442749, "eval_runtime": 9.4294, "eval_samples_per_second": 1010.346, "eval_steps_per_second": 2.015, "train/total_time_seconds": 317.07109136506915, "train/time_per_step_avg": 0.3162866896018386, "train/epoch_time_elapsed": 899.3457590825856, "train/estimated_remaining_minutes": 0.0}