w-ahmad commited on
Commit
2dfc4fd
·
verified ·
1 Parent(s): 9fa38ef

Auto upload 2026-08-07T22:11:20.527314

Browse files
Files changed (29) hide show
  1. out/mlp-linear-21L_run/checkpoint-700/config.json +35 -0
  2. out/mlp-linear-21L_run/checkpoint-700/model.safetensors +3 -0
  3. out/mlp-linear-21L_run/checkpoint-700/optimizer.pt +3 -0
  4. out/mlp-linear-21L_run/checkpoint-700/rng_state.pth +3 -0
  5. out/mlp-linear-21L_run/checkpoint-700/scheduler.pt +3 -0
  6. out/mlp-linear-21L_run/checkpoint-700/tokenizer.json +0 -0
  7. out/mlp-linear-21L_run/checkpoint-700/tokenizer_config.json +13 -0
  8. out/mlp-linear-21L_run/checkpoint-700/trainer_state.json +391 -0
  9. out/mlp-linear-21L_run/checkpoint-700/training_args.bin +3 -0
  10. out/mlp-linear-21L_run/checkpoint-800/config.json +35 -0
  11. out/mlp-linear-21L_run/checkpoint-800/model.safetensors +3 -0
  12. out/mlp-linear-21L_run/checkpoint-800/optimizer.pt +3 -0
  13. out/mlp-linear-21L_run/checkpoint-800/rng_state.pth +3 -0
  14. out/mlp-linear-21L_run/checkpoint-800/scheduler.pt +3 -0
  15. out/mlp-linear-21L_run/checkpoint-800/tokenizer.json +0 -0
  16. out/mlp-linear-21L_run/checkpoint-800/tokenizer_config.json +13 -0
  17. out/mlp-linear-21L_run/checkpoint-800/trainer_state.json +442 -0
  18. out/mlp-linear-21L_run/checkpoint-800/training_args.bin +3 -0
  19. out/mlp-linear-21L_run/checkpoint-900/config.json +35 -0
  20. out/mlp-linear-21L_run/checkpoint-900/model.safetensors +3 -0
  21. out/mlp-linear-21L_run/checkpoint-900/optimizer.pt +3 -0
  22. out/mlp-linear-21L_run/checkpoint-900/rng_state.pth +3 -0
  23. out/mlp-linear-21L_run/checkpoint-900/scheduler.pt +3 -0
  24. out/mlp-linear-21L_run/checkpoint-900/tokenizer.json +0 -0
  25. out/mlp-linear-21L_run/checkpoint-900/tokenizer_config.json +13 -0
  26. out/mlp-linear-21L_run/checkpoint-900/trainer_state.json +493 -0
  27. out/mlp-linear-21L_run/checkpoint-900/training_args.bin +3 -0
  28. out/mlp-linear-21L_run/model.safetensors +1 -1
  29. out/mlp-linear-21L_run/training_log.jsonl +24 -0
out/mlp-linear-21L_run/checkpoint-700/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "linear",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 21,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-linear-21L_run/checkpoint-700/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d967d9c31a1c3b2ffd67a1f530042be8fbc82254b56c3927dabce5e016105977
3
+ size 7959296
out/mlp-linear-21L_run/checkpoint-700/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c93ed69554527aeff58169a5ec39202bc5352eee4da7cd92045445432328a608
3
+ size 16023738
out/mlp-linear-21L_run/checkpoint-700/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c07c9483d2aaa0e0aa4859fa05bacc55a60e0f30ff9c95a3b76854e880483a96
3
+ size 14244
out/mlp-linear-21L_run/checkpoint-700/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3173cd6908322b02fdacbfeb79bbb6a1a1a40d218262cceb79ee8c11c4fa07d7
3
+ size 1064
out/mlp-linear-21L_run/checkpoint-700/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-linear-21L_run/checkpoint-700/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-linear-21L_run/checkpoint-700/trainer_state.json ADDED
@@ -0,0 +1,391 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.37735849056603776,
6
+ "eval_steps": 50,
7
+ "global_step": 700,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 1.0546875,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.274208068847656,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 1.53125,
22
+ "learning_rate": 0.001,
23
+ "loss": 5.9999839782714846,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.570199966430664,
29
+ "eval_runtime": 8.819,
30
+ "eval_samples_per_second": 1080.281,
31
+ "eval_steps_per_second": 2.154,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.88671875,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.567345046997071,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 1.0546875,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.250301742553711,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.50390625,
51
+ "learning_rate": 0.001,
52
+ "loss": 4.9394378662109375,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 4.784651279449463,
58
+ "eval_runtime": 8.8621,
59
+ "eval_samples_per_second": 1075.032,
60
+ "eval_steps_per_second": 2.144,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.58203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 4.660997772216797,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 1.5546875,
73
+ "learning_rate": 0.001,
74
+ "loss": 4.43031005859375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.252280235290527,
80
+ "eval_runtime": 8.9869,
81
+ "eval_samples_per_second": 1060.1,
82
+ "eval_steps_per_second": 2.114,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.48828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.2591907501220705,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.91015625,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.122463607788086,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.435546875,
102
+ "learning_rate": 0.001,
103
+ "loss": 3.9880271911621095,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 3.9186038970947266,
109
+ "eval_runtime": 8.9327,
110
+ "eval_samples_per_second": 1066.53,
111
+ "eval_steps_per_second": 2.127,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.73828125,
117
+ "learning_rate": 0.001,
118
+ "loss": 3.8731555938720703,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.40234375,
124
+ "learning_rate": 0.001,
125
+ "loss": 3.786928176879883,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 3.682241916656494,
131
+ "eval_runtime": 8.9206,
132
+ "eval_samples_per_second": 1067.975,
133
+ "eval_steps_per_second": 2.13,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 0.84375,
139
+ "learning_rate": 0.001,
140
+ "loss": 3.6825389862060547,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.51171875,
146
+ "learning_rate": 0.001,
147
+ "loss": 3.6361549377441404,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 1.5703125,
153
+ "learning_rate": 0.001,
154
+ "loss": 3.551879119873047,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.5237605571746826,
160
+ "eval_runtime": 9.0532,
161
+ "eval_samples_per_second": 1052.333,
162
+ "eval_steps_per_second": 2.099,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.62109375,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.526197814941406,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.34765625,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.44549446105957,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.4025301933288574,
182
+ "eval_runtime": 9.1498,
183
+ "eval_samples_per_second": 1041.23,
184
+ "eval_steps_per_second": 2.077,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 1.0234375,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.4011425018310546,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.6171875,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.3427574157714846,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.5859375,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.2958106994628906,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.2790729999542236,
211
+ "eval_runtime": 9.1929,
212
+ "eval_samples_per_second": 1036.342,
213
+ "eval_steps_per_second": 2.067,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.5234375,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.2616317749023436,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.5703125,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.2149822235107424,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.181051015853882,
233
+ "eval_runtime": 9.1212,
234
+ "eval_samples_per_second": 1044.485,
235
+ "eval_steps_per_second": 2.083,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 1.0546875,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.1823314666748046,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.5390625,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.1341114044189453,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.9375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.101780128479004,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.1055757999420166,
262
+ "eval_runtime": 9.2225,
263
+ "eval_samples_per_second": 1033.013,
264
+ "eval_steps_per_second": 2.06,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803234501347709,
269
+ "grad_norm": 0.5078125,
270
+ "learning_rate": 0.001,
271
+ "loss": 3.0730880737304687,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29110512129380056,
276
+ "grad_norm": 0.609375,
277
+ "learning_rate": 0.001,
278
+ "loss": 3.0466753005981446,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.29649595687331537,
283
+ "eval_loss": 3.022505283355713,
284
+ "eval_runtime": 9.1838,
285
+ "eval_samples_per_second": 1037.366,
286
+ "eval_steps_per_second": 2.069,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3018867924528302,
291
+ "grad_norm": 0.5,
292
+ "learning_rate": 0.001,
293
+ "loss": 3.0200361251831054,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.31266846361185985,
298
+ "grad_norm": 0.73046875,
299
+ "learning_rate": 0.001,
300
+ "loss": 2.9901798248291014,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.32345013477088946,
305
+ "grad_norm": 0.73046875,
306
+ "learning_rate": 0.001,
307
+ "loss": 2.958896255493164,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.32345013477088946,
312
+ "eval_loss": 2.95377516746521,
313
+ "eval_runtime": 9.1618,
314
+ "eval_samples_per_second": 1039.857,
315
+ "eval_steps_per_second": 2.074,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.33423180592991913,
320
+ "grad_norm": 0.78125,
321
+ "learning_rate": 0.001,
322
+ "loss": 2.952092933654785,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.3450134770889488,
327
+ "grad_norm": 0.44921875,
328
+ "learning_rate": 0.001,
329
+ "loss": 2.9132663726806642,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.3504043126684636,
334
+ "eval_loss": 2.905498504638672,
335
+ "eval_runtime": 9.1525,
336
+ "eval_samples_per_second": 1040.913,
337
+ "eval_steps_per_second": 2.076,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.3557951482479784,
342
+ "grad_norm": 0.98828125,
343
+ "learning_rate": 0.001,
344
+ "loss": 2.900470161437988,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.3665768194070081,
349
+ "grad_norm": 0.56640625,
350
+ "learning_rate": 0.001,
351
+ "loss": 2.8784067153930666,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37735849056603776,
356
+ "grad_norm": 0.92578125,
357
+ "learning_rate": 0.001,
358
+ "loss": 2.8517574310302733,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37735849056603776,
363
+ "eval_loss": 2.868436336517334,
364
+ "eval_runtime": 9.2031,
365
+ "eval_samples_per_second": 1035.193,
366
+ "eval_steps_per_second": 2.065,
367
+ "step": 700
368
+ }
369
+ ],
370
+ "logging_steps": 20,
371
+ "max_steps": 1000,
372
+ "num_input_tokens_seen": 0,
373
+ "num_train_epochs": 1,
374
+ "save_steps": 100,
375
+ "stateful_callbacks": {
376
+ "TrainerControl": {
377
+ "args": {
378
+ "should_epoch_stop": false,
379
+ "should_evaluate": false,
380
+ "should_log": false,
381
+ "should_save": true,
382
+ "should_training_stop": false
383
+ },
384
+ "attributes": {}
385
+ }
386
+ },
387
+ "total_flos": 3794221085491200.0,
388
+ "train_batch_size": 512,
389
+ "trial_name": null,
390
+ "trial_params": null
391
+ }
out/mlp-linear-21L_run/checkpoint-700/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f710638f98cb9aa723847c3078af1df019ed60911a4c32cfe8698e762841d517
3
+ size 4920
out/mlp-linear-21L_run/checkpoint-800/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "linear",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 21,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-linear-21L_run/checkpoint-800/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad94815883a041eb8e3936f791ca66615dda183c4d79ebc751778bc6e063a2e2
3
+ size 7959296
out/mlp-linear-21L_run/checkpoint-800/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:62b7c82e614d5572ffa3b2681bcfe45b8a3c61cde3aa0de535f6c20e1537a692
3
+ size 16023738
out/mlp-linear-21L_run/checkpoint-800/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f83fe17529e572dff2734bb21512b28dd7cf5d20ef0e84688f5068ffbf24e765
3
+ size 14244
out/mlp-linear-21L_run/checkpoint-800/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7334026bbd250befa466dcbe6bec8bfe84c03024263e4dea55e40698f2caa92e
3
+ size 1064
out/mlp-linear-21L_run/checkpoint-800/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-linear-21L_run/checkpoint-800/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-linear-21L_run/checkpoint-800/trainer_state.json ADDED
@@ -0,0 +1,442 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.431266846361186,
6
+ "eval_steps": 50,
7
+ "global_step": 800,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 1.0546875,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.274208068847656,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 1.53125,
22
+ "learning_rate": 0.001,
23
+ "loss": 5.9999839782714846,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.570199966430664,
29
+ "eval_runtime": 8.819,
30
+ "eval_samples_per_second": 1080.281,
31
+ "eval_steps_per_second": 2.154,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.88671875,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.567345046997071,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 1.0546875,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.250301742553711,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.50390625,
51
+ "learning_rate": 0.001,
52
+ "loss": 4.9394378662109375,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 4.784651279449463,
58
+ "eval_runtime": 8.8621,
59
+ "eval_samples_per_second": 1075.032,
60
+ "eval_steps_per_second": 2.144,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.58203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 4.660997772216797,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 1.5546875,
73
+ "learning_rate": 0.001,
74
+ "loss": 4.43031005859375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.252280235290527,
80
+ "eval_runtime": 8.9869,
81
+ "eval_samples_per_second": 1060.1,
82
+ "eval_steps_per_second": 2.114,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.48828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.2591907501220705,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.91015625,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.122463607788086,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.435546875,
102
+ "learning_rate": 0.001,
103
+ "loss": 3.9880271911621095,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 3.9186038970947266,
109
+ "eval_runtime": 8.9327,
110
+ "eval_samples_per_second": 1066.53,
111
+ "eval_steps_per_second": 2.127,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.73828125,
117
+ "learning_rate": 0.001,
118
+ "loss": 3.8731555938720703,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.40234375,
124
+ "learning_rate": 0.001,
125
+ "loss": 3.786928176879883,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 3.682241916656494,
131
+ "eval_runtime": 8.9206,
132
+ "eval_samples_per_second": 1067.975,
133
+ "eval_steps_per_second": 2.13,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 0.84375,
139
+ "learning_rate": 0.001,
140
+ "loss": 3.6825389862060547,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.51171875,
146
+ "learning_rate": 0.001,
147
+ "loss": 3.6361549377441404,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 1.5703125,
153
+ "learning_rate": 0.001,
154
+ "loss": 3.551879119873047,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.5237605571746826,
160
+ "eval_runtime": 9.0532,
161
+ "eval_samples_per_second": 1052.333,
162
+ "eval_steps_per_second": 2.099,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.62109375,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.526197814941406,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.34765625,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.44549446105957,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.4025301933288574,
182
+ "eval_runtime": 9.1498,
183
+ "eval_samples_per_second": 1041.23,
184
+ "eval_steps_per_second": 2.077,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 1.0234375,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.4011425018310546,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.6171875,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.3427574157714846,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.5859375,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.2958106994628906,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.2790729999542236,
211
+ "eval_runtime": 9.1929,
212
+ "eval_samples_per_second": 1036.342,
213
+ "eval_steps_per_second": 2.067,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.5234375,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.2616317749023436,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.5703125,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.2149822235107424,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.181051015853882,
233
+ "eval_runtime": 9.1212,
234
+ "eval_samples_per_second": 1044.485,
235
+ "eval_steps_per_second": 2.083,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 1.0546875,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.1823314666748046,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.5390625,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.1341114044189453,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.9375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.101780128479004,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.1055757999420166,
262
+ "eval_runtime": 9.2225,
263
+ "eval_samples_per_second": 1033.013,
264
+ "eval_steps_per_second": 2.06,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803234501347709,
269
+ "grad_norm": 0.5078125,
270
+ "learning_rate": 0.001,
271
+ "loss": 3.0730880737304687,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29110512129380056,
276
+ "grad_norm": 0.609375,
277
+ "learning_rate": 0.001,
278
+ "loss": 3.0466753005981446,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.29649595687331537,
283
+ "eval_loss": 3.022505283355713,
284
+ "eval_runtime": 9.1838,
285
+ "eval_samples_per_second": 1037.366,
286
+ "eval_steps_per_second": 2.069,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3018867924528302,
291
+ "grad_norm": 0.5,
292
+ "learning_rate": 0.001,
293
+ "loss": 3.0200361251831054,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.31266846361185985,
298
+ "grad_norm": 0.73046875,
299
+ "learning_rate": 0.001,
300
+ "loss": 2.9901798248291014,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.32345013477088946,
305
+ "grad_norm": 0.73046875,
306
+ "learning_rate": 0.001,
307
+ "loss": 2.958896255493164,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.32345013477088946,
312
+ "eval_loss": 2.95377516746521,
313
+ "eval_runtime": 9.1618,
314
+ "eval_samples_per_second": 1039.857,
315
+ "eval_steps_per_second": 2.074,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.33423180592991913,
320
+ "grad_norm": 0.78125,
321
+ "learning_rate": 0.001,
322
+ "loss": 2.952092933654785,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.3450134770889488,
327
+ "grad_norm": 0.44921875,
328
+ "learning_rate": 0.001,
329
+ "loss": 2.9132663726806642,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.3504043126684636,
334
+ "eval_loss": 2.905498504638672,
335
+ "eval_runtime": 9.1525,
336
+ "eval_samples_per_second": 1040.913,
337
+ "eval_steps_per_second": 2.076,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.3557951482479784,
342
+ "grad_norm": 0.98828125,
343
+ "learning_rate": 0.001,
344
+ "loss": 2.900470161437988,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.3665768194070081,
349
+ "grad_norm": 0.56640625,
350
+ "learning_rate": 0.001,
351
+ "loss": 2.8784067153930666,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37735849056603776,
356
+ "grad_norm": 0.92578125,
357
+ "learning_rate": 0.001,
358
+ "loss": 2.8517574310302733,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37735849056603776,
363
+ "eval_loss": 2.868436336517334,
364
+ "eval_runtime": 9.2031,
365
+ "eval_samples_per_second": 1035.193,
366
+ "eval_steps_per_second": 2.065,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.3881401617250674,
371
+ "grad_norm": 0.486328125,
372
+ "learning_rate": 0.001,
373
+ "loss": 2.846698760986328,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.39892183288409705,
378
+ "grad_norm": 0.82421875,
379
+ "learning_rate": 0.001,
380
+ "loss": 2.8154937744140627,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.40431266846361186,
385
+ "eval_loss": 2.813324451446533,
386
+ "eval_runtime": 9.1186,
387
+ "eval_samples_per_second": 1044.786,
388
+ "eval_steps_per_second": 2.084,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.40970350404312667,
393
+ "grad_norm": 0.54296875,
394
+ "learning_rate": 0.001,
395
+ "loss": 2.8071964263916014,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.42048517520215634,
400
+ "grad_norm": 0.69140625,
401
+ "learning_rate": 0.001,
402
+ "loss": 2.7811683654785155,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.431266846361186,
407
+ "grad_norm": 0.73828125,
408
+ "learning_rate": 0.001,
409
+ "loss": 2.782184028625488,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.431266846361186,
414
+ "eval_loss": 2.778449535369873,
415
+ "eval_runtime": 9.2351,
416
+ "eval_samples_per_second": 1031.606,
417
+ "eval_steps_per_second": 2.057,
418
+ "step": 800
419
+ }
420
+ ],
421
+ "logging_steps": 20,
422
+ "max_steps": 1000,
423
+ "num_input_tokens_seen": 0,
424
+ "num_train_epochs": 1,
425
+ "save_steps": 100,
426
+ "stateful_callbacks": {
427
+ "TrainerControl": {
428
+ "args": {
429
+ "should_epoch_stop": false,
430
+ "should_evaluate": false,
431
+ "should_log": false,
432
+ "should_save": true,
433
+ "should_training_stop": false
434
+ },
435
+ "attributes": {}
436
+ }
437
+ },
438
+ "total_flos": 4336252669132800.0,
439
+ "train_batch_size": 512,
440
+ "trial_name": null,
441
+ "trial_params": null
442
+ }
out/mlp-linear-21L_run/checkpoint-800/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f710638f98cb9aa723847c3078af1df019ed60911a4c32cfe8698e762841d517
3
+ size 4920
out/mlp-linear-21L_run/checkpoint-900/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "linear",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 21,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-linear-21L_run/checkpoint-900/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:23ae85e4a038e289ca876dca6ccf4fd8a2a5cc4c9d17dd3a1d0dfe677c6fb506
3
+ size 7959296
out/mlp-linear-21L_run/checkpoint-900/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bd6450aae04a04bfe48b421dfd178026112bcd8d5af4497eb791228347c88c01
3
+ size 16023738
out/mlp-linear-21L_run/checkpoint-900/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:86a2aa7bca84d2b8e7dd4e04a286714ba9169af11c46c739950a52df4c45259f
3
+ size 14244
out/mlp-linear-21L_run/checkpoint-900/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6d48b00fea613f19335b87fb622648d28d7f8900963d07ba43c75df2b4dc3d4e
3
+ size 1064
out/mlp-linear-21L_run/checkpoint-900/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-linear-21L_run/checkpoint-900/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-linear-21L_run/checkpoint-900/trainer_state.json ADDED
@@ -0,0 +1,493 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.48517520215633425,
6
+ "eval_steps": 50,
7
+ "global_step": 900,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.01078167115902965,
14
+ "grad_norm": 1.0546875,
15
+ "learning_rate": 0.001,
16
+ "loss": 7.274208068847656,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0215633423180593,
21
+ "grad_norm": 1.53125,
22
+ "learning_rate": 0.001,
23
+ "loss": 5.9999839782714846,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026954177897574125,
28
+ "eval_loss": 5.570199966430664,
29
+ "eval_runtime": 8.819,
30
+ "eval_samples_per_second": 1080.281,
31
+ "eval_steps_per_second": 2.154,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.03234501347708895,
36
+ "grad_norm": 0.88671875,
37
+ "learning_rate": 0.001,
38
+ "loss": 5.567345046997071,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.0431266846361186,
43
+ "grad_norm": 1.0546875,
44
+ "learning_rate": 0.001,
45
+ "loss": 5.250301742553711,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05390835579514825,
50
+ "grad_norm": 0.50390625,
51
+ "learning_rate": 0.001,
52
+ "loss": 4.9394378662109375,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05390835579514825,
57
+ "eval_loss": 4.784651279449463,
58
+ "eval_runtime": 8.8621,
59
+ "eval_samples_per_second": 1075.032,
60
+ "eval_steps_per_second": 2.144,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.0646900269541779,
65
+ "grad_norm": 0.58203125,
66
+ "learning_rate": 0.001,
67
+ "loss": 4.660997772216797,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07547169811320754,
72
+ "grad_norm": 1.5546875,
73
+ "learning_rate": 0.001,
74
+ "loss": 4.43031005859375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08086253369272237,
79
+ "eval_loss": 4.252280235290527,
80
+ "eval_runtime": 8.9869,
81
+ "eval_samples_per_second": 1060.1,
82
+ "eval_steps_per_second": 2.114,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.0862533692722372,
87
+ "grad_norm": 0.48828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 4.2591907501220705,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09703504043126684,
94
+ "grad_norm": 0.91015625,
95
+ "learning_rate": 0.001,
96
+ "loss": 4.122463607788086,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.1078167115902965,
101
+ "grad_norm": 0.435546875,
102
+ "learning_rate": 0.001,
103
+ "loss": 3.9880271911621095,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.1078167115902965,
108
+ "eval_loss": 3.9186038970947266,
109
+ "eval_runtime": 8.9327,
110
+ "eval_samples_per_second": 1066.53,
111
+ "eval_steps_per_second": 2.127,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11859838274932614,
116
+ "grad_norm": 0.73828125,
117
+ "learning_rate": 0.001,
118
+ "loss": 3.8731555938720703,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.1293800539083558,
123
+ "grad_norm": 0.40234375,
124
+ "learning_rate": 0.001,
125
+ "loss": 3.786928176879883,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.1347708894878706,
130
+ "eval_loss": 3.682241916656494,
131
+ "eval_runtime": 8.9206,
132
+ "eval_samples_per_second": 1067.975,
133
+ "eval_steps_per_second": 2.13,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.14016172506738545,
138
+ "grad_norm": 0.84375,
139
+ "learning_rate": 0.001,
140
+ "loss": 3.6825389862060547,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.1509433962264151,
145
+ "grad_norm": 0.51171875,
146
+ "learning_rate": 0.001,
147
+ "loss": 3.6361549377441404,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.16172506738544473,
152
+ "grad_norm": 1.5703125,
153
+ "learning_rate": 0.001,
154
+ "loss": 3.551879119873047,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.16172506738544473,
159
+ "eval_loss": 3.5237605571746826,
160
+ "eval_runtime": 9.0532,
161
+ "eval_samples_per_second": 1052.333,
162
+ "eval_steps_per_second": 2.099,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.1725067385444744,
167
+ "grad_norm": 0.62109375,
168
+ "learning_rate": 0.001,
169
+ "loss": 3.526197814941406,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18328840970350405,
174
+ "grad_norm": 0.34765625,
175
+ "learning_rate": 0.001,
176
+ "loss": 3.44549446105957,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18867924528301888,
181
+ "eval_loss": 3.4025301933288574,
182
+ "eval_runtime": 9.1498,
183
+ "eval_samples_per_second": 1041.23,
184
+ "eval_steps_per_second": 2.077,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1940700808625337,
189
+ "grad_norm": 1.0234375,
190
+ "learning_rate": 0.001,
191
+ "loss": 3.4011425018310546,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20485175202156333,
196
+ "grad_norm": 0.6171875,
197
+ "learning_rate": 0.001,
198
+ "loss": 3.3427574157714846,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.215633423180593,
203
+ "grad_norm": 0.5859375,
204
+ "learning_rate": 0.001,
205
+ "loss": 3.2958106994628906,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.215633423180593,
210
+ "eval_loss": 3.2790729999542236,
211
+ "eval_runtime": 9.1929,
212
+ "eval_samples_per_second": 1036.342,
213
+ "eval_steps_per_second": 2.067,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22641509433962265,
218
+ "grad_norm": 0.5234375,
219
+ "learning_rate": 0.001,
220
+ "loss": 3.2616317749023436,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.2371967654986523,
225
+ "grad_norm": 0.5703125,
226
+ "learning_rate": 0.001,
227
+ "loss": 3.2149822235107424,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.24258760107816713,
232
+ "eval_loss": 3.181051015853882,
233
+ "eval_runtime": 9.1212,
234
+ "eval_samples_per_second": 1044.485,
235
+ "eval_steps_per_second": 2.083,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.24797843665768193,
240
+ "grad_norm": 1.0546875,
241
+ "learning_rate": 0.001,
242
+ "loss": 3.1823314666748046,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2587601078167116,
247
+ "grad_norm": 0.5390625,
248
+ "learning_rate": 0.001,
249
+ "loss": 3.1341114044189453,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.2695417789757412,
254
+ "grad_norm": 0.9375,
255
+ "learning_rate": 0.001,
256
+ "loss": 3.101780128479004,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.2695417789757412,
261
+ "eval_loss": 3.1055757999420166,
262
+ "eval_runtime": 9.2225,
263
+ "eval_samples_per_second": 1033.013,
264
+ "eval_steps_per_second": 2.06,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803234501347709,
269
+ "grad_norm": 0.5078125,
270
+ "learning_rate": 0.001,
271
+ "loss": 3.0730880737304687,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29110512129380056,
276
+ "grad_norm": 0.609375,
277
+ "learning_rate": 0.001,
278
+ "loss": 3.0466753005981446,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.29649595687331537,
283
+ "eval_loss": 3.022505283355713,
284
+ "eval_runtime": 9.1838,
285
+ "eval_samples_per_second": 1037.366,
286
+ "eval_steps_per_second": 2.069,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3018867924528302,
291
+ "grad_norm": 0.5,
292
+ "learning_rate": 0.001,
293
+ "loss": 3.0200361251831054,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.31266846361185985,
298
+ "grad_norm": 0.73046875,
299
+ "learning_rate": 0.001,
300
+ "loss": 2.9901798248291014,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.32345013477088946,
305
+ "grad_norm": 0.73046875,
306
+ "learning_rate": 0.001,
307
+ "loss": 2.958896255493164,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.32345013477088946,
312
+ "eval_loss": 2.95377516746521,
313
+ "eval_runtime": 9.1618,
314
+ "eval_samples_per_second": 1039.857,
315
+ "eval_steps_per_second": 2.074,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.33423180592991913,
320
+ "grad_norm": 0.78125,
321
+ "learning_rate": 0.001,
322
+ "loss": 2.952092933654785,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.3450134770889488,
327
+ "grad_norm": 0.44921875,
328
+ "learning_rate": 0.001,
329
+ "loss": 2.9132663726806642,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.3504043126684636,
334
+ "eval_loss": 2.905498504638672,
335
+ "eval_runtime": 9.1525,
336
+ "eval_samples_per_second": 1040.913,
337
+ "eval_steps_per_second": 2.076,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.3557951482479784,
342
+ "grad_norm": 0.98828125,
343
+ "learning_rate": 0.001,
344
+ "loss": 2.900470161437988,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.3665768194070081,
349
+ "grad_norm": 0.56640625,
350
+ "learning_rate": 0.001,
351
+ "loss": 2.8784067153930666,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37735849056603776,
356
+ "grad_norm": 0.92578125,
357
+ "learning_rate": 0.001,
358
+ "loss": 2.8517574310302733,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37735849056603776,
363
+ "eval_loss": 2.868436336517334,
364
+ "eval_runtime": 9.2031,
365
+ "eval_samples_per_second": 1035.193,
366
+ "eval_steps_per_second": 2.065,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.3881401617250674,
371
+ "grad_norm": 0.486328125,
372
+ "learning_rate": 0.001,
373
+ "loss": 2.846698760986328,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.39892183288409705,
378
+ "grad_norm": 0.82421875,
379
+ "learning_rate": 0.001,
380
+ "loss": 2.8154937744140627,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.40431266846361186,
385
+ "eval_loss": 2.813324451446533,
386
+ "eval_runtime": 9.1186,
387
+ "eval_samples_per_second": 1044.786,
388
+ "eval_steps_per_second": 2.084,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.40970350404312667,
393
+ "grad_norm": 0.54296875,
394
+ "learning_rate": 0.001,
395
+ "loss": 2.8071964263916014,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.42048517520215634,
400
+ "grad_norm": 0.69140625,
401
+ "learning_rate": 0.001,
402
+ "loss": 2.7811683654785155,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.431266846361186,
407
+ "grad_norm": 0.73828125,
408
+ "learning_rate": 0.001,
409
+ "loss": 2.782184028625488,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.431266846361186,
414
+ "eval_loss": 2.778449535369873,
415
+ "eval_runtime": 9.2351,
416
+ "eval_samples_per_second": 1031.606,
417
+ "eval_steps_per_second": 2.057,
418
+ "step": 800
419
+ },
420
+ {
421
+ "epoch": 0.4420485175202156,
422
+ "grad_norm": 0.44921875,
423
+ "learning_rate": 0.001,
424
+ "loss": 2.754811668395996,
425
+ "step": 820
426
+ },
427
+ {
428
+ "epoch": 0.4528301886792453,
429
+ "grad_norm": 0.89453125,
430
+ "learning_rate": 0.001,
431
+ "loss": 2.7389667510986326,
432
+ "step": 840
433
+ },
434
+ {
435
+ "epoch": 0.4582210242587601,
436
+ "eval_loss": 2.736283540725708,
437
+ "eval_runtime": 9.2108,
438
+ "eval_samples_per_second": 1034.331,
439
+ "eval_steps_per_second": 2.063,
440
+ "step": 850
441
+ },
442
+ {
443
+ "epoch": 0.4636118598382749,
444
+ "grad_norm": 0.53515625,
445
+ "learning_rate": 0.001,
446
+ "loss": 2.728610801696777,
447
+ "step": 860
448
+ },
449
+ {
450
+ "epoch": 0.4743935309973046,
451
+ "grad_norm": 0.98828125,
452
+ "learning_rate": 0.001,
453
+ "loss": 2.703776550292969,
454
+ "step": 880
455
+ },
456
+ {
457
+ "epoch": 0.48517520215633425,
458
+ "grad_norm": 0.75390625,
459
+ "learning_rate": 0.001,
460
+ "loss": 2.712217330932617,
461
+ "step": 900
462
+ },
463
+ {
464
+ "epoch": 0.48517520215633425,
465
+ "eval_loss": 2.7041544914245605,
466
+ "eval_runtime": 9.4718,
467
+ "eval_samples_per_second": 1005.83,
468
+ "eval_steps_per_second": 2.006,
469
+ "step": 900
470
+ }
471
+ ],
472
+ "logging_steps": 20,
473
+ "max_steps": 1000,
474
+ "num_input_tokens_seen": 0,
475
+ "num_train_epochs": 1,
476
+ "save_steps": 100,
477
+ "stateful_callbacks": {
478
+ "TrainerControl": {
479
+ "args": {
480
+ "should_epoch_stop": false,
481
+ "should_evaluate": false,
482
+ "should_log": false,
483
+ "should_save": true,
484
+ "should_training_stop": false
485
+ },
486
+ "attributes": {}
487
+ }
488
+ },
489
+ "total_flos": 4878284252774400.0,
490
+ "train_batch_size": 512,
491
+ "trial_name": null,
492
+ "trial_params": null
493
+ }
out/mlp-linear-21L_run/checkpoint-900/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f710638f98cb9aa723847c3078af1df019ed60911a4c32cfe8698e762841d517
3
+ size 4920
out/mlp-linear-21L_run/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2b15e161a272a744aae7cad360136d19ad51101e61b9fb528b8e9935b5dbafd5
3
  size 7959296
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:23ae85e4a038e289ca876dca6ccf4fd8a2a5cc4c9d17dd3a1d0dfe677c6fb506
3
  size 7959296
out/mlp-linear-21L_run/training_log.jsonl CHANGED
@@ -41,3 +41,27 @@
41
  {"step": 600, "epoch": 0.32345013477088946, "timestamp": 1786140343.349682, "loss": 2.958896255493164, "grad_norm": 0.73046875, "learning_rate": 0.001, "train/total_time_seconds": 190.6581477150321, "train/time_per_step_avg": 0.31607903823256495, "train/epoch_time_elapsed": 521.0774472914636, "train/estimated_remaining_minutes": 2.1184238635003565}
42
  {"step": 600, "epoch": 0.32345013477088946, "timestamp": 1786140352.5130959, "eval_loss": 2.95377516746521, "eval_runtime": 9.1618, "eval_samples_per_second": 1039.857, "eval_steps_per_second": 2.074, "train/total_time_seconds": 190.6581477150321, "train/time_per_step_avg": 0.31607903823256495, "train/epoch_time_elapsed": 530.2408594228327, "train/estimated_remaining_minutes": 2.1184238635003565}
43
  {"step": 620, "epoch": 0.33423180592991913, "timestamp": 1786140366.5955102, "loss": 2.952092933654785, "grad_norm": 0.78125, "learning_rate": 0.001, "train/total_time_seconds": 196.97960712760687, "train/time_per_step_avg": 0.31603967782109976, "train/epoch_time_elapsed": 544.323274012655, "train/estimated_remaining_minutes": 2.0121572771099623}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
41
  {"step": 600, "epoch": 0.32345013477088946, "timestamp": 1786140343.349682, "loss": 2.958896255493164, "grad_norm": 0.73046875, "learning_rate": 0.001, "train/total_time_seconds": 190.6581477150321, "train/time_per_step_avg": 0.31607903823256495, "train/epoch_time_elapsed": 521.0774472914636, "train/estimated_remaining_minutes": 2.1184238635003565}
42
  {"step": 600, "epoch": 0.32345013477088946, "timestamp": 1786140352.5130959, "eval_loss": 2.95377516746521, "eval_runtime": 9.1618, "eval_samples_per_second": 1039.857, "eval_steps_per_second": 2.074, "train/total_time_seconds": 190.6581477150321, "train/time_per_step_avg": 0.31607903823256495, "train/epoch_time_elapsed": 530.2408594228327, "train/estimated_remaining_minutes": 2.1184238635003565}
43
  {"step": 620, "epoch": 0.33423180592991913, "timestamp": 1786140366.5955102, "loss": 2.952092933654785, "grad_norm": 0.78125, "learning_rate": 0.001, "train/total_time_seconds": 196.97960712760687, "train/time_per_step_avg": 0.31603967782109976, "train/epoch_time_elapsed": 544.323274012655, "train/estimated_remaining_minutes": 2.0121572771099623}
44
+ {"step": 640, "epoch": 0.3450134770889488, "timestamp": 1786140380.663665, "loss": 2.9132663726806642, "grad_norm": 0.44921875, "learning_rate": 0.001, "train/total_time_seconds": 203.29968735203147, "train/time_per_step_avg": 0.3160211337730289, "train/epoch_time_elapsed": 558.3914296738803, "train/estimated_remaining_minutes": 1.905934568925295}
45
+ {"step": 650, "epoch": 0.3504043126684636, "timestamp": 1786140396.8474813, "eval_loss": 2.905498504638672, "eval_runtime": 9.1525, "eval_samples_per_second": 1040.913, "eval_steps_per_second": 2.076, "train/total_time_seconds": 206.45854242891073, "train/time_per_step_avg": 0.3159821989759803, "train/epoch_time_elapsed": 574.5752436704934, "train/estimated_remaining_minutes": 1.8528330730799683}
46
+ {"step": 660, "epoch": 0.3557951482479784, "timestamp": 1786140403.8380544, "loss": 2.900470161437988, "grad_norm": 0.98828125, "learning_rate": 0.001, "train/total_time_seconds": 209.62075051665306, "train/time_per_step_avg": 0.3160286565870047, "train/epoch_time_elapsed": 581.5658187195659, "train/estimated_remaining_minutes": 1.7997741205975262}
47
+ {"step": 680, "epoch": 0.3665768194070081, "timestamp": 1786140417.9181857, "loss": 2.8784067153930666, "grad_norm": 0.56640625, "learning_rate": 0.001, "train/total_time_seconds": 215.93968116119504, "train/time_per_step_avg": 0.31599062215536833, "train/epoch_time_elapsed": 595.6459505409002, "train/estimated_remaining_minutes": 1.6936445581270196}
48
+ {"step": 700, "epoch": 0.37735849056603776, "timestamp": 1786140431.9665506, "loss": 2.8517574310302733, "grad_norm": 0.92578125, "learning_rate": 0.001, "train/total_time_seconds": 222.25654493644834, "train/time_per_step_avg": 0.31598397221416236, "train/epoch_time_elapsed": 609.6943158768117, "train/estimated_remaining_minutes": 1.5875467495460596}
49
+ {"step": 700, "epoch": 0.37735849056603776, "timestamp": 1786140441.17121, "eval_loss": 2.868436336517334, "eval_runtime": 9.2031, "eval_samples_per_second": 1035.193, "eval_steps_per_second": 2.065, "train/total_time_seconds": 222.25654493644834, "train/time_per_step_avg": 0.31598397221416236, "train/epoch_time_elapsed": 618.898972183466, "train/estimated_remaining_minutes": 1.5875467495460596}
50
+ {"step": 720, "epoch": 0.3881401617250674, "timestamp": 1786140455.3046455, "loss": 2.846698760986328, "grad_norm": 0.486328125, "learning_rate": 0.001, "train/total_time_seconds": 228.57606745883822, "train/time_per_step_avg": 0.3159646033123136, "train/epoch_time_elapsed": 633.0324101299047, "train/estimated_remaining_minutes": 1.481511548344322}
51
+ {"step": 740, "epoch": 0.39892183288409705, "timestamp": 1786140469.2788513, "loss": 2.8154937744140627, "grad_norm": 0.82421875, "learning_rate": 0.001, "train/total_time_seconds": 234.8880673572421, "train/time_per_step_avg": 0.31588380005210637, "train/epoch_time_elapsed": 647.006616409868, "train/estimated_remaining_minutes": 1.375470664704571}
52
+ {"step": 750, "epoch": 0.40431266846361186, "timestamp": 1786140485.4477496, "eval_loss": 2.813324451446533, "eval_runtime": 9.1186, "eval_samples_per_second": 1044.786, "eval_steps_per_second": 2.084, "train/total_time_seconds": 238.04644763469696, "train/time_per_step_avg": 0.31587905205786226, "train/epoch_time_elapsed": 663.1755127944052, "train/estimated_remaining_minutes": 1.3224802646372056}
53
+ {"step": 760, "epoch": 0.40970350404312667, "timestamp": 1786140492.533495, "loss": 2.8071964263916014, "grad_norm": 0.54296875, "learning_rate": 0.001, "train/total_time_seconds": 241.20690286532044, "train/time_per_step_avg": 0.31586152348667385, "train/epoch_time_elapsed": 670.2612607181072, "train/estimated_remaining_minutes": 1.269510015080634}
54
+ {"step": 780, "epoch": 0.42048517520215634, "timestamp": 1786140506.7619843, "loss": 2.7811683654785155, "grad_norm": 0.69140625, "learning_rate": 0.001, "train/total_time_seconds": 247.52511202916503, "train/time_per_step_avg": 0.3158543086796999, "train/epoch_time_elapsed": 684.489748865366, "train/estimated_remaining_minutes": 1.1635795864618868}
55
+ {"step": 800, "epoch": 0.431266846361186, "timestamp": 1786140520.9534838, "loss": 2.782184028625488, "grad_norm": 0.73828125, "learning_rate": 0.001, "train/total_time_seconds": 253.83729097992182, "train/time_per_step_avg": 0.31580746043473484, "train/epoch_time_elapsed": 698.6812483593822, "train/estimated_remaining_minutes": 1.0576553790830077}
56
+ {"step": 800, "epoch": 0.431266846361186, "timestamp": 1786140530.190191, "eval_loss": 2.778449535369873, "eval_runtime": 9.2351, "eval_samples_per_second": 1031.606, "eval_steps_per_second": 2.057, "train/total_time_seconds": 253.83729097992182, "train/time_per_step_avg": 0.31580746043473484, "train/epoch_time_elapsed": 707.9179544597864, "train/estimated_remaining_minutes": 1.0576553790830077}
57
+ {"step": 820, "epoch": 0.4420485175202156, "timestamp": 1786140544.3385065, "loss": 2.754811668395996, "grad_norm": 0.44921875, "learning_rate": 0.001, "train/total_time_seconds": 260.1481362618506, "train/time_per_step_avg": 0.3157206880301237, "train/epoch_time_elapsed": 722.0662711746991, "train/estimated_remaining_minutes": 0.9517614741287217}
58
+ {"step": 840, "epoch": 0.4528301886792453, "timestamp": 1786140558.3534312, "loss": 2.7389667510986326, "grad_norm": 0.89453125, "learning_rate": 0.001, "train/total_time_seconds": 266.4599728770554, "train/time_per_step_avg": 0.315719055198133, "train/epoch_time_elapsed": 736.0811963900924, "train/estimated_remaining_minutes": 0.8459046758001759}
59
+ {"step": 850, "epoch": 0.4582210242587601, "timestamp": 1786140574.6184158, "eval_loss": 2.736283540725708, "eval_runtime": 9.2108, "eval_samples_per_second": 1034.331, "eval_steps_per_second": 2.063, "train/total_time_seconds": 269.6180298104882, "train/time_per_step_avg": 0.31571582175791263, "train/epoch_time_elapsed": 752.3461726717651, "train/estimated_remaining_minutes": 0.7929942053249655}
60
+ {"step": 860, "epoch": 0.4636118598382749, "timestamp": 1786140581.8180475, "loss": 2.728610801696777, "grad_norm": 0.53515625, "learning_rate": 0.001, "train/total_time_seconds": 272.7832880653441, "train/time_per_step_avg": 0.3157638520002365, "train/epoch_time_elapsed": 759.5458110570908, "train/estimated_remaining_minutes": 0.7401096963013212}
61
+ {"step": 880, "epoch": 0.4743935309973046, "timestamp": 1786140596.0643246, "loss": 2.703776550292969, "grad_norm": 0.98828125, "learning_rate": 0.001, "train/total_time_seconds": 279.11409997940063, "train/time_per_step_avg": 0.31588987950235603, "train/epoch_time_elapsed": 773.7920881733298, "train/estimated_remaining_minutes": 0.6343502272259105}
62
+ {"step": 900, "epoch": 0.48517520215633425, "timestamp": 1786140610.5076487, "loss": 2.712217330932617, "grad_norm": 0.75390625, "learning_rate": 0.001, "train/total_time_seconds": 285.4424224048853, "train/time_per_step_avg": 0.31605131424963473, "train/epoch_time_elapsed": 788.2354110814631, "train/estimated_remaining_minutes": 0.5285970785275654}
63
+ {"step": 900, "epoch": 0.48517520215633425, "timestamp": 1786140619.9812293, "eval_loss": 2.7041544914245605, "eval_runtime": 9.4718, "eval_samples_per_second": 1005.83, "eval_steps_per_second": 2.006, "train/total_time_seconds": 285.4424224048853, "train/time_per_step_avg": 0.31605131424963473, "train/epoch_time_elapsed": 797.7089912705123, "train/estimated_remaining_minutes": 0.5285970785275654}
64
+ {"step": 920, "epoch": 0.49595687331536387, "timestamp": 1786140634.3566592, "loss": 2.677124786376953, "grad_norm": 0.48828125, "learning_rate": 0.001, "train/total_time_seconds": 291.7641347832978, "train/time_per_step_avg": 0.3161599852144718, "train/epoch_time_elapsed": 812.0844232290983, "train/estimated_remaining_minutes": 0.42284657214970695}
65
+ {"step": 940, "epoch": 0.5067385444743935, "timestamp": 1786140648.6530638, "loss": 2.6723052978515627, "grad_norm": 0.9921875, "learning_rate": 0.001, "train/total_time_seconds": 298.08655486628413, "train/time_per_step_avg": 0.31626581989228725, "train/epoch_time_elapsed": 826.3808276876807, "train/estimated_remaining_minutes": 0.3171133562407278}
66
+ {"step": 950, "epoch": 0.5121293800539084, "timestamp": 1786140665.325624, "eval_loss": 2.6709580421447754, "eval_runtime": 9.5201, "eval_samples_per_second": 1000.726, "eval_steps_per_second": 1.996, "train/total_time_seconds": 301.25240771844983, "train/time_per_step_avg": 0.3163437790796161, "train/epoch_time_elapsed": 843.0533857010305, "train/estimated_remaining_minutes": 0.2642564979986402}
67
+ {"step": 960, "epoch": 0.5175202156334232, "timestamp": 1786140672.499597, "loss": 2.672710418701172, "grad_norm": 0.482421875, "learning_rate": 0.001, "train/total_time_seconds": 304.4166898280382, "train/time_per_step_avg": 0.3163340176269412, "train/epoch_time_elapsed": 850.2273597568274, "train/estimated_remaining_minutes": 0.21140047904724876}