w-ahmad commited on
Commit
23abea1
·
verified ·
1 Parent(s): 941b20b

Auto upload 2026-08-09T04:40:09.292092

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. .gitattributes +1 -0
  2. __pycache__/exp.cpython-311.pyc +0 -0
  3. out/mlp-s10-94L_run/checkpoint-100/config.json +35 -0
  4. out/mlp-s10-94L_run/checkpoint-100/model.safetensors +3 -0
  5. out/mlp-s10-94L_run/checkpoint-100/optimizer.pt +3 -0
  6. out/mlp-s10-94L_run/checkpoint-100/rng_state.pth +3 -0
  7. out/mlp-s10-94L_run/checkpoint-100/scheduler.pt +3 -0
  8. out/mlp-s10-94L_run/checkpoint-100/tokenizer.json +0 -0
  9. out/mlp-s10-94L_run/checkpoint-100/tokenizer_config.json +13 -0
  10. out/mlp-s10-94L_run/checkpoint-100/trainer_state.json +85 -0
  11. out/mlp-s10-94L_run/checkpoint-100/training_args.bin +3 -0
  12. out/mlp-s10-94L_run/checkpoint-1000/config.json +35 -0
  13. out/mlp-s10-94L_run/checkpoint-1000/model.safetensors +3 -0
  14. out/mlp-s10-94L_run/checkpoint-1000/optimizer.pt +3 -0
  15. out/mlp-s10-94L_run/checkpoint-1000/rng_state.pth +3 -0
  16. out/mlp-s10-94L_run/checkpoint-1000/scheduler.pt +3 -0
  17. out/mlp-s10-94L_run/checkpoint-1000/tokenizer.json +0 -0
  18. out/mlp-s10-94L_run/checkpoint-1000/tokenizer_config.json +13 -0
  19. out/mlp-s10-94L_run/checkpoint-1000/trainer_state.json +544 -0
  20. out/mlp-s10-94L_run/checkpoint-1000/training_args.bin +3 -0
  21. out/mlp-s10-94L_run/checkpoint-200/config.json +35 -0
  22. out/mlp-s10-94L_run/checkpoint-200/model.safetensors +3 -0
  23. out/mlp-s10-94L_run/checkpoint-200/optimizer.pt +3 -0
  24. out/mlp-s10-94L_run/checkpoint-200/rng_state.pth +3 -0
  25. out/mlp-s10-94L_run/checkpoint-200/scheduler.pt +3 -0
  26. out/mlp-s10-94L_run/checkpoint-200/tokenizer.json +0 -0
  27. out/mlp-s10-94L_run/checkpoint-200/tokenizer_config.json +13 -0
  28. out/mlp-s10-94L_run/checkpoint-200/trainer_state.json +136 -0
  29. out/mlp-s10-94L_run/checkpoint-200/training_args.bin +3 -0
  30. out/mlp-s10-94L_run/checkpoint-300/config.json +35 -0
  31. out/mlp-s10-94L_run/checkpoint-300/model.safetensors +3 -0
  32. out/mlp-s10-94L_run/checkpoint-300/optimizer.pt +3 -0
  33. out/mlp-s10-94L_run/checkpoint-300/rng_state.pth +3 -0
  34. out/mlp-s10-94L_run/checkpoint-300/scheduler.pt +3 -0
  35. out/mlp-s10-94L_run/checkpoint-300/tokenizer.json +0 -0
  36. out/mlp-s10-94L_run/checkpoint-300/tokenizer_config.json +13 -0
  37. out/mlp-s10-94L_run/checkpoint-300/trainer_state.json +187 -0
  38. out/mlp-s10-94L_run/checkpoint-300/training_args.bin +3 -0
  39. out/mlp-s10-94L_run/checkpoint-400/config.json +35 -0
  40. out/mlp-s10-94L_run/checkpoint-400/model.safetensors +3 -0
  41. out/mlp-s10-94L_run/checkpoint-400/optimizer.pt +3 -0
  42. out/mlp-s10-94L_run/checkpoint-400/rng_state.pth +3 -0
  43. out/mlp-s10-94L_run/checkpoint-400/scheduler.pt +3 -0
  44. out/mlp-s10-94L_run/checkpoint-400/tokenizer.json +0 -0
  45. out/mlp-s10-94L_run/checkpoint-400/tokenizer_config.json +13 -0
  46. out/mlp-s10-94L_run/checkpoint-400/trainer_state.json +238 -0
  47. out/mlp-s10-94L_run/checkpoint-400/training_args.bin +3 -0
  48. out/mlp-s10-94L_run/checkpoint-500/config.json +35 -0
  49. out/mlp-s10-94L_run/checkpoint-500/model.safetensors +3 -0
  50. out/mlp-s10-94L_run/checkpoint-500/optimizer.pt +3 -0
.gitattributes CHANGED
@@ -82,3 +82,4 @@ wandb/run-20260808_233557-lhpx30l9/run-lhpx30l9.wandb filter=lfs diff=lfs merge=
82
  wandb/run-20260808_235917-9b17953b/run-9b17953b.wandb filter=lfs diff=lfs merge=lfs -text
83
  wandb/run-20260809_002232-gduul5qe/run-gduul5qe.wandb filter=lfs diff=lfs merge=lfs -text
84
  wandb/run-20260809_004653-7146bnsd/run-7146bnsd.wandb filter=lfs diff=lfs merge=lfs -text
 
 
82
  wandb/run-20260808_235917-9b17953b/run-9b17953b.wandb filter=lfs diff=lfs merge=lfs -text
83
  wandb/run-20260809_002232-gduul5qe/run-gduul5qe.wandb filter=lfs diff=lfs merge=lfs -text
84
  wandb/run-20260809_004653-7146bnsd/run-7146bnsd.wandb filter=lfs diff=lfs merge=lfs -text
85
+ wandb/run-20260809_035819-cvzjg5ej/run-cvzjg5ej.wandb filter=lfs diff=lfs merge=lfs -text
__pycache__/exp.cpython-311.pyc CHANGED
Binary files a/__pycache__/exp.cpython-311.pyc and b/__pycache__/exp.cpython-311.pyc differ
 
out/mlp-s10-94L_run/checkpoint-100/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-s10-94L_run/checkpoint-100/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2be26509aa8682be1562cdefdc4fb702fa74f487c6ebeb27a02060b133a0c94a
3
+ size 31981960
out/mlp-s10-94L_run/checkpoint-100/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:de4ee11bbfdf5bd8a135bcd6b03e23684bb89f9318b0733ff65ec4481b31abe2
3
+ size 64439848
out/mlp-s10-94L_run/checkpoint-100/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3cf9097d4513154245c48236b6ec5137b7ee2a21c9f58f2cba798ea275c6026f
3
+ size 14244
out/mlp-s10-94L_run/checkpoint-100/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:906745ab5f61e73e8c1ba850ef3b839e2766eba889b49c843836266988895165
3
+ size 1064
out/mlp-s10-94L_run/checkpoint-100/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-s10-94L_run/checkpoint-100/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-s10-94L_run/checkpoint-100/trainer_state.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.05392289026691831,
6
+ "eval_steps": 50,
7
+ "global_step": 100,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.75,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.570291137695314,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.263671875,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.279835510253907,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.908648490905762,
29
+ "eval_runtime": 16.3836,
30
+ "eval_samples_per_second": 581.495,
31
+ "eval_steps_per_second": 4.578,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 2.03125,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.61173858642578,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 3.9375,
44
+ "learning_rate": 0.001,
45
+ "loss": 22.80414733886719,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 4.5,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.137115478515625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.443320274353027,
58
+ "eval_runtime": 16.3492,
59
+ "eval_samples_per_second": 582.72,
60
+ "eval_steps_per_second": 4.587,
61
+ "step": 100
62
+ }
63
+ ],
64
+ "logging_steps": 20,
65
+ "max_steps": 1500,
66
+ "num_input_tokens_seen": 0,
67
+ "num_train_epochs": 1,
68
+ "save_steps": 100,
69
+ "stateful_callbacks": {
70
+ "TrainerControl": {
71
+ "args": {
72
+ "should_epoch_stop": false,
73
+ "should_evaluate": false,
74
+ "should_log": false,
75
+ "should_save": true,
76
+ "should_training_stop": false
77
+ },
78
+ "attributes": {}
79
+ }
80
+ },
81
+ "total_flos": 2426166627532800.0,
82
+ "train_batch_size": 128,
83
+ "trial_name": null,
84
+ "trial_params": null
85
+ }
out/mlp-s10-94L_run/checkpoint-100/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:873bf272a464f8d4f32a1497a17e4dd88aaf0d116e87d1e95dbff747318696f0
3
+ size 4920
out/mlp-s10-94L_run/checkpoint-1000/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-s10-94L_run/checkpoint-1000/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e024a0695e460a7767d8870e3aab9f1e1ac1c23d1574c25ef36b65f711261df1
3
+ size 31981960
out/mlp-s10-94L_run/checkpoint-1000/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f69330f380b6a898c34ed87209a757d3f977d7f4f9141dddf96d61b05965096e
3
+ size 64439848
out/mlp-s10-94L_run/checkpoint-1000/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:645b71843375baf4cc10bc75a2f0f04e91b8e3f8e8929f518a87022898b3bc20
3
+ size 14244
out/mlp-s10-94L_run/checkpoint-1000/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0fc3ca8af69cc9d003a05a139e7997960ab393fe31ae1d898b29038573704b4e
3
+ size 1064
out/mlp-s10-94L_run/checkpoint-1000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-s10-94L_run/checkpoint-1000/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-s10-94L_run/checkpoint-1000/trainer_state.json ADDED
@@ -0,0 +1,544 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.5392289026691831,
6
+ "eval_steps": 50,
7
+ "global_step": 1000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.75,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.570291137695314,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.263671875,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.279835510253907,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.908648490905762,
29
+ "eval_runtime": 16.3836,
30
+ "eval_samples_per_second": 581.495,
31
+ "eval_steps_per_second": 4.578,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 2.03125,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.61173858642578,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 3.9375,
44
+ "learning_rate": 0.001,
45
+ "loss": 22.80414733886719,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 4.5,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.137115478515625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.443320274353027,
58
+ "eval_runtime": 16.3492,
59
+ "eval_samples_per_second": 582.72,
60
+ "eval_steps_per_second": 4.587,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 9.0625,
66
+ "learning_rate": 0.001,
67
+ "loss": 21.51625213623047,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 8.0625,
73
+ "learning_rate": 0.001,
74
+ "loss": 20.9159912109375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.031351566314697,
80
+ "eval_runtime": 16.3105,
81
+ "eval_samples_per_second": 584.103,
82
+ "eval_steps_per_second": 4.598,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 3.828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 20.133233642578126,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 5.875,
95
+ "learning_rate": 0.001,
96
+ "loss": 19.276626586914062,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 3.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 18.316180419921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 4.4591450691223145,
109
+ "eval_runtime": 16.5273,
110
+ "eval_samples_per_second": 576.441,
111
+ "eval_steps_per_second": 4.538,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11863035858722028,
116
+ "grad_norm": 3.125,
117
+ "learning_rate": 0.001,
118
+ "loss": 17.47910919189453,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.12941493664060394,
123
+ "grad_norm": 3.78125,
124
+ "learning_rate": 0.001,
125
+ "loss": 16.857704162597656,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.13480722566729578,
130
+ "eval_loss": 4.037808418273926,
131
+ "eval_runtime": 16.7437,
132
+ "eval_samples_per_second": 568.991,
133
+ "eval_steps_per_second": 4.479,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.1401995146939876,
138
+ "grad_norm": 4.8125,
139
+ "learning_rate": 0.001,
140
+ "loss": 16.15790710449219,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.15098409274737126,
145
+ "grad_norm": 2.453125,
146
+ "learning_rate": 0.001,
147
+ "loss": 15.610972595214843,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.1617686708007549,
152
+ "grad_norm": 5.03125,
153
+ "learning_rate": 0.001,
154
+ "loss": 15.262626647949219,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.1617686708007549,
159
+ "eval_loss": 3.7790420055389404,
160
+ "eval_runtime": 16.4839,
161
+ "eval_samples_per_second": 577.957,
162
+ "eval_steps_per_second": 4.55,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.17255324885413859,
167
+ "grad_norm": 2.53125,
168
+ "learning_rate": 0.001,
169
+ "loss": 14.862835693359376,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18333782690752223,
174
+ "grad_norm": 1.8828125,
175
+ "learning_rate": 0.001,
176
+ "loss": 14.4195556640625,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18873011593421407,
181
+ "eval_loss": 3.508929491043091,
182
+ "eval_runtime": 16.5096,
183
+ "eval_samples_per_second": 577.059,
184
+ "eval_steps_per_second": 4.543,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1941224049609059,
189
+ "grad_norm": 2.21875,
190
+ "learning_rate": 0.001,
191
+ "loss": 14.034010314941407,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20490698301428956,
196
+ "grad_norm": 1.6171875,
197
+ "learning_rate": 0.001,
198
+ "loss": 13.656217956542969,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.21569156106767323,
203
+ "grad_norm": 1.0859375,
204
+ "learning_rate": 0.001,
205
+ "loss": 13.353656005859374,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.21569156106767323,
210
+ "eval_loss": 3.3230206966400146,
211
+ "eval_runtime": 16.5021,
212
+ "eval_samples_per_second": 577.322,
213
+ "eval_steps_per_second": 4.545,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.22647613912105688,
218
+ "grad_norm": 2.65625,
219
+ "learning_rate": 0.001,
220
+ "loss": 13.050607299804687,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.23726071717444056,
225
+ "grad_norm": 2.046875,
226
+ "learning_rate": 0.001,
227
+ "loss": 12.783986663818359,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.2426530062011324,
232
+ "eval_loss": 3.1205618381500244,
233
+ "eval_runtime": 16.4401,
234
+ "eval_samples_per_second": 579.497,
235
+ "eval_steps_per_second": 4.562,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.2480452952278242,
240
+ "grad_norm": 2.34375,
241
+ "learning_rate": 0.001,
242
+ "loss": 12.455777740478515,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.2588298732812079,
247
+ "grad_norm": 1.734375,
248
+ "learning_rate": 0.001,
249
+ "loss": 12.180888366699218,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.26961445133459155,
254
+ "grad_norm": 1.65625,
255
+ "learning_rate": 0.001,
256
+ "loss": 11.921077728271484,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.26961445133459155,
261
+ "eval_loss": 2.950833797454834,
262
+ "eval_runtime": 16.4185,
263
+ "eval_samples_per_second": 580.259,
264
+ "eval_steps_per_second": 4.568,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.2803990293879752,
269
+ "grad_norm": 1.5234375,
270
+ "learning_rate": 0.001,
271
+ "loss": 11.677184295654296,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.29118360744135885,
276
+ "grad_norm": 2.296875,
277
+ "learning_rate": 0.001,
278
+ "loss": 11.456565856933594,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.2965758964680507,
283
+ "eval_loss": 2.813769817352295,
284
+ "eval_runtime": 16.3503,
285
+ "eval_samples_per_second": 582.681,
286
+ "eval_steps_per_second": 4.587,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.3019681854947425,
291
+ "grad_norm": 1.84375,
292
+ "learning_rate": 0.001,
293
+ "loss": 11.254852294921875,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.3127527635481262,
298
+ "grad_norm": 1.9609375,
299
+ "learning_rate": 0.001,
300
+ "loss": 11.02415771484375,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.3235373416015098,
305
+ "grad_norm": 2.109375,
306
+ "learning_rate": 0.001,
307
+ "loss": 10.82885513305664,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.3235373416015098,
312
+ "eval_loss": 2.6941640377044678,
313
+ "eval_runtime": 16.5123,
314
+ "eval_samples_per_second": 576.964,
315
+ "eval_steps_per_second": 4.542,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.3343219196548935,
320
+ "grad_norm": 1.2578125,
321
+ "learning_rate": 0.001,
322
+ "loss": 10.672529602050782,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.34510649770827717,
327
+ "grad_norm": 1.9375,
328
+ "learning_rate": 0.001,
329
+ "loss": 10.486093139648437,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.350498786734969,
334
+ "eval_loss": 2.5829620361328125,
335
+ "eval_runtime": 16.3847,
336
+ "eval_samples_per_second": 581.459,
337
+ "eval_steps_per_second": 4.577,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.35589107576166085,
342
+ "grad_norm": 1.4765625,
343
+ "learning_rate": 0.001,
344
+ "loss": 10.307514953613282,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.36667565381504447,
349
+ "grad_norm": 1.609375,
350
+ "learning_rate": 0.001,
351
+ "loss": 10.156155395507813,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.37746023186842814,
356
+ "grad_norm": 2.078125,
357
+ "learning_rate": 0.001,
358
+ "loss": 10.004931640625,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.37746023186842814,
363
+ "eval_loss": 2.4850780963897705,
364
+ "eval_runtime": 16.6426,
365
+ "eval_samples_per_second": 572.445,
366
+ "eval_steps_per_second": 4.506,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.3882448099218118,
371
+ "grad_norm": 1.8203125,
372
+ "learning_rate": 0.001,
373
+ "loss": 9.830353546142579,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.3990293879751955,
378
+ "grad_norm": 1.671875,
379
+ "learning_rate": 0.001,
380
+ "loss": 9.726395416259766,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.4044216770018873,
385
+ "eval_loss": 2.3961310386657715,
386
+ "eval_runtime": 16.484,
387
+ "eval_samples_per_second": 577.953,
388
+ "eval_steps_per_second": 4.55,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.4098139660285791,
393
+ "grad_norm": 1.5,
394
+ "learning_rate": 0.001,
395
+ "loss": 9.585889434814453,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.4205985440819628,
400
+ "grad_norm": 1.4921875,
401
+ "learning_rate": 0.001,
402
+ "loss": 9.474940490722656,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.43138312213534646,
407
+ "grad_norm": 1.7890625,
408
+ "learning_rate": 0.001,
409
+ "loss": 9.303884124755859,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.43138312213534646,
414
+ "eval_loss": 2.3192710876464844,
415
+ "eval_runtime": 16.362,
416
+ "eval_samples_per_second": 582.263,
417
+ "eval_steps_per_second": 4.584,
418
+ "step": 800
419
+ },
420
+ {
421
+ "epoch": 0.44216770018873014,
422
+ "grad_norm": 1.96875,
423
+ "learning_rate": 0.001,
424
+ "loss": 9.214578247070312,
425
+ "step": 820
426
+ },
427
+ {
428
+ "epoch": 0.45295227824211376,
429
+ "grad_norm": 1.265625,
430
+ "learning_rate": 0.001,
431
+ "loss": 9.110013580322265,
432
+ "step": 840
433
+ },
434
+ {
435
+ "epoch": 0.4583445672688056,
436
+ "eval_loss": 2.255786895751953,
437
+ "eval_runtime": 16.6344,
438
+ "eval_samples_per_second": 572.728,
439
+ "eval_steps_per_second": 4.509,
440
+ "step": 850
441
+ },
442
+ {
443
+ "epoch": 0.46373685629549743,
444
+ "grad_norm": 1.53125,
445
+ "learning_rate": 0.001,
446
+ "loss": 8.989684295654296,
447
+ "step": 860
448
+ },
449
+ {
450
+ "epoch": 0.4745214343488811,
451
+ "grad_norm": 1.46875,
452
+ "learning_rate": 0.001,
453
+ "loss": 8.903449249267577,
454
+ "step": 880
455
+ },
456
+ {
457
+ "epoch": 0.4853060124022648,
458
+ "grad_norm": 1.5625,
459
+ "learning_rate": 0.001,
460
+ "loss": 8.798023223876953,
461
+ "step": 900
462
+ },
463
+ {
464
+ "epoch": 0.4853060124022648,
465
+ "eval_loss": 2.1990966796875,
466
+ "eval_runtime": 16.4377,
467
+ "eval_samples_per_second": 579.581,
468
+ "eval_steps_per_second": 4.563,
469
+ "step": 900
470
+ },
471
+ {
472
+ "epoch": 0.4960905904556484,
473
+ "grad_norm": 1.3515625,
474
+ "learning_rate": 0.001,
475
+ "loss": 8.711866760253907,
476
+ "step": 920
477
+ },
478
+ {
479
+ "epoch": 0.5068751685090321,
480
+ "grad_norm": 1.375,
481
+ "learning_rate": 0.001,
482
+ "loss": 8.65683822631836,
483
+ "step": 940
484
+ },
485
+ {
486
+ "epoch": 0.5122674575357239,
487
+ "eval_loss": 2.15165638923645,
488
+ "eval_runtime": 16.515,
489
+ "eval_samples_per_second": 576.869,
490
+ "eval_steps_per_second": 4.541,
491
+ "step": 950
492
+ },
493
+ {
494
+ "epoch": 0.5176597465624158,
495
+ "grad_norm": 1.546875,
496
+ "learning_rate": 0.001,
497
+ "loss": 8.596742248535156,
498
+ "step": 960
499
+ },
500
+ {
501
+ "epoch": 0.5284443246157994,
502
+ "grad_norm": 1.3828125,
503
+ "learning_rate": 0.001,
504
+ "loss": 8.528240966796876,
505
+ "step": 980
506
+ },
507
+ {
508
+ "epoch": 0.5392289026691831,
509
+ "grad_norm": 1.390625,
510
+ "learning_rate": 0.001,
511
+ "loss": 8.455123138427734,
512
+ "step": 1000
513
+ },
514
+ {
515
+ "epoch": 0.5392289026691831,
516
+ "eval_loss": 2.1049983501434326,
517
+ "eval_runtime": 16.4683,
518
+ "eval_samples_per_second": 578.506,
519
+ "eval_steps_per_second": 4.554,
520
+ "step": 1000
521
+ }
522
+ ],
523
+ "logging_steps": 20,
524
+ "max_steps": 1500,
525
+ "num_input_tokens_seen": 0,
526
+ "num_train_epochs": 1,
527
+ "save_steps": 100,
528
+ "stateful_callbacks": {
529
+ "TrainerControl": {
530
+ "args": {
531
+ "should_epoch_stop": false,
532
+ "should_evaluate": false,
533
+ "should_log": false,
534
+ "should_save": true,
535
+ "should_training_stop": false
536
+ },
537
+ "attributes": {}
538
+ }
539
+ },
540
+ "total_flos": 2.4261666275328e+16,
541
+ "train_batch_size": 128,
542
+ "trial_name": null,
543
+ "trial_params": null
544
+ }
out/mlp-s10-94L_run/checkpoint-1000/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:873bf272a464f8d4f32a1497a17e4dd88aaf0d116e87d1e95dbff747318696f0
3
+ size 4920
out/mlp-s10-94L_run/checkpoint-200/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-s10-94L_run/checkpoint-200/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:515aaf4623cc4bbdf339385647192c1001d74d42f1127e98e0e13e95ebf8a0c6
3
+ size 31981960
out/mlp-s10-94L_run/checkpoint-200/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:65b74feea8eabc2a019f74d207e54f41128d62e299b263be00a4f00a214f044d
3
+ size 64439848
out/mlp-s10-94L_run/checkpoint-200/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ecefbb3f17bb76b6655eb0157c98b5287c17fa4b4c72a6b9068b0823ce9fd18d
3
+ size 14244
out/mlp-s10-94L_run/checkpoint-200/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2d3b5a970fc92af42664e84ba686059eaaacfaa668691c0cf6d2afddda677461
3
+ size 1064
out/mlp-s10-94L_run/checkpoint-200/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-s10-94L_run/checkpoint-200/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-s10-94L_run/checkpoint-200/trainer_state.json ADDED
@@ -0,0 +1,136 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.10784578053383662,
6
+ "eval_steps": 50,
7
+ "global_step": 200,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.75,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.570291137695314,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.263671875,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.279835510253907,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.908648490905762,
29
+ "eval_runtime": 16.3836,
30
+ "eval_samples_per_second": 581.495,
31
+ "eval_steps_per_second": 4.578,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 2.03125,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.61173858642578,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 3.9375,
44
+ "learning_rate": 0.001,
45
+ "loss": 22.80414733886719,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 4.5,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.137115478515625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.443320274353027,
58
+ "eval_runtime": 16.3492,
59
+ "eval_samples_per_second": 582.72,
60
+ "eval_steps_per_second": 4.587,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 9.0625,
66
+ "learning_rate": 0.001,
67
+ "loss": 21.51625213623047,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 8.0625,
73
+ "learning_rate": 0.001,
74
+ "loss": 20.9159912109375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.031351566314697,
80
+ "eval_runtime": 16.3105,
81
+ "eval_samples_per_second": 584.103,
82
+ "eval_steps_per_second": 4.598,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 3.828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 20.133233642578126,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 5.875,
95
+ "learning_rate": 0.001,
96
+ "loss": 19.276626586914062,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 3.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 18.316180419921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 4.4591450691223145,
109
+ "eval_runtime": 16.5273,
110
+ "eval_samples_per_second": 576.441,
111
+ "eval_steps_per_second": 4.538,
112
+ "step": 200
113
+ }
114
+ ],
115
+ "logging_steps": 20,
116
+ "max_steps": 1500,
117
+ "num_input_tokens_seen": 0,
118
+ "num_train_epochs": 1,
119
+ "save_steps": 100,
120
+ "stateful_callbacks": {
121
+ "TrainerControl": {
122
+ "args": {
123
+ "should_epoch_stop": false,
124
+ "should_evaluate": false,
125
+ "should_log": false,
126
+ "should_save": true,
127
+ "should_training_stop": false
128
+ },
129
+ "attributes": {}
130
+ }
131
+ },
132
+ "total_flos": 4852333255065600.0,
133
+ "train_batch_size": 128,
134
+ "trial_name": null,
135
+ "trial_params": null
136
+ }
out/mlp-s10-94L_run/checkpoint-200/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:873bf272a464f8d4f32a1497a17e4dd88aaf0d116e87d1e95dbff747318696f0
3
+ size 4920
out/mlp-s10-94L_run/checkpoint-300/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-s10-94L_run/checkpoint-300/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cbd6e8decd8bec1226de38af592cce777770c132c904845b0d7a5cb6382009a2
3
+ size 31981960
out/mlp-s10-94L_run/checkpoint-300/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07997fea4a1b6f79f73da03ce515391657690ed21b96dd52031f331daf8109aa
3
+ size 64439848
out/mlp-s10-94L_run/checkpoint-300/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:068fbd993087219c15b8c0baa13fc39644a4dcdfe92d8be3fa6434deece90371
3
+ size 14244
out/mlp-s10-94L_run/checkpoint-300/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:76cd21f32221b90fb8288fd2428595ec8b5039fe2425086d67cacb5c8d814c9e
3
+ size 1064
out/mlp-s10-94L_run/checkpoint-300/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-s10-94L_run/checkpoint-300/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-s10-94L_run/checkpoint-300/trainer_state.json ADDED
@@ -0,0 +1,187 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.1617686708007549,
6
+ "eval_steps": 50,
7
+ "global_step": 300,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.75,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.570291137695314,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.263671875,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.279835510253907,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.908648490905762,
29
+ "eval_runtime": 16.3836,
30
+ "eval_samples_per_second": 581.495,
31
+ "eval_steps_per_second": 4.578,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 2.03125,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.61173858642578,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 3.9375,
44
+ "learning_rate": 0.001,
45
+ "loss": 22.80414733886719,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 4.5,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.137115478515625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.443320274353027,
58
+ "eval_runtime": 16.3492,
59
+ "eval_samples_per_second": 582.72,
60
+ "eval_steps_per_second": 4.587,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 9.0625,
66
+ "learning_rate": 0.001,
67
+ "loss": 21.51625213623047,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 8.0625,
73
+ "learning_rate": 0.001,
74
+ "loss": 20.9159912109375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.031351566314697,
80
+ "eval_runtime": 16.3105,
81
+ "eval_samples_per_second": 584.103,
82
+ "eval_steps_per_second": 4.598,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 3.828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 20.133233642578126,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 5.875,
95
+ "learning_rate": 0.001,
96
+ "loss": 19.276626586914062,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 3.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 18.316180419921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 4.4591450691223145,
109
+ "eval_runtime": 16.5273,
110
+ "eval_samples_per_second": 576.441,
111
+ "eval_steps_per_second": 4.538,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11863035858722028,
116
+ "grad_norm": 3.125,
117
+ "learning_rate": 0.001,
118
+ "loss": 17.47910919189453,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.12941493664060394,
123
+ "grad_norm": 3.78125,
124
+ "learning_rate": 0.001,
125
+ "loss": 16.857704162597656,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.13480722566729578,
130
+ "eval_loss": 4.037808418273926,
131
+ "eval_runtime": 16.7437,
132
+ "eval_samples_per_second": 568.991,
133
+ "eval_steps_per_second": 4.479,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.1401995146939876,
138
+ "grad_norm": 4.8125,
139
+ "learning_rate": 0.001,
140
+ "loss": 16.15790710449219,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.15098409274737126,
145
+ "grad_norm": 2.453125,
146
+ "learning_rate": 0.001,
147
+ "loss": 15.610972595214843,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.1617686708007549,
152
+ "grad_norm": 5.03125,
153
+ "learning_rate": 0.001,
154
+ "loss": 15.262626647949219,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.1617686708007549,
159
+ "eval_loss": 3.7790420055389404,
160
+ "eval_runtime": 16.4839,
161
+ "eval_samples_per_second": 577.957,
162
+ "eval_steps_per_second": 4.55,
163
+ "step": 300
164
+ }
165
+ ],
166
+ "logging_steps": 20,
167
+ "max_steps": 1500,
168
+ "num_input_tokens_seen": 0,
169
+ "num_train_epochs": 1,
170
+ "save_steps": 100,
171
+ "stateful_callbacks": {
172
+ "TrainerControl": {
173
+ "args": {
174
+ "should_epoch_stop": false,
175
+ "should_evaluate": false,
176
+ "should_log": false,
177
+ "should_save": true,
178
+ "should_training_stop": false
179
+ },
180
+ "attributes": {}
181
+ }
182
+ },
183
+ "total_flos": 7278499882598400.0,
184
+ "train_batch_size": 128,
185
+ "trial_name": null,
186
+ "trial_params": null
187
+ }
out/mlp-s10-94L_run/checkpoint-300/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:873bf272a464f8d4f32a1497a17e4dd88aaf0d116e87d1e95dbff747318696f0
3
+ size 4920
out/mlp-s10-94L_run/checkpoint-400/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-s10-94L_run/checkpoint-400/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:180b6bcbb06797e554cbd1a50f57aab6add607691ae1226d8c0cc709764b1e89
3
+ size 31981960
out/mlp-s10-94L_run/checkpoint-400/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4894211c86f3765a001bf6dffa01ad1d7155713482e1e8349bd3ace09b36a634
3
+ size 64439848
out/mlp-s10-94L_run/checkpoint-400/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f9a6944c405a002fce05f295d08ea6650e2e2ad6dbf5d6da1e9053f7bf7f5827
3
+ size 14244
out/mlp-s10-94L_run/checkpoint-400/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:51769a11c87b2b665cbe64c58b934afdb1fa1998bffb4addcc2f852b172d6681
3
+ size 1064
out/mlp-s10-94L_run/checkpoint-400/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
out/mlp-s10-94L_run/checkpoint-400/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
out/mlp-s10-94L_run/checkpoint-400/trainer_state.json ADDED
@@ -0,0 +1,238 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.21569156106767323,
6
+ "eval_steps": 50,
7
+ "global_step": 400,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.010784578053383662,
14
+ "grad_norm": 3.75,
15
+ "learning_rate": 0.001,
16
+ "loss": 28.570291137695314,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.021569156106767323,
21
+ "grad_norm": 0.263671875,
22
+ "learning_rate": 0.001,
23
+ "loss": 24.279835510253907,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.026961445133459154,
28
+ "eval_loss": 5.908648490905762,
29
+ "eval_runtime": 16.3836,
30
+ "eval_samples_per_second": 581.495,
31
+ "eval_steps_per_second": 4.578,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.032353734160150985,
36
+ "grad_norm": 2.03125,
37
+ "learning_rate": 0.001,
38
+ "loss": 23.61173858642578,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.043138312213534646,
43
+ "grad_norm": 3.9375,
44
+ "learning_rate": 0.001,
45
+ "loss": 22.80414733886719,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.05392289026691831,
50
+ "grad_norm": 4.5,
51
+ "learning_rate": 0.001,
52
+ "loss": 22.137115478515625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.05392289026691831,
57
+ "eval_loss": 5.443320274353027,
58
+ "eval_runtime": 16.3492,
59
+ "eval_samples_per_second": 582.72,
60
+ "eval_steps_per_second": 4.587,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.06470746832030197,
65
+ "grad_norm": 9.0625,
66
+ "learning_rate": 0.001,
67
+ "loss": 21.51625213623047,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.07549204637368563,
72
+ "grad_norm": 8.0625,
73
+ "learning_rate": 0.001,
74
+ "loss": 20.9159912109375,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.08088433540037746,
79
+ "eval_loss": 5.031351566314697,
80
+ "eval_runtime": 16.3105,
81
+ "eval_samples_per_second": 584.103,
82
+ "eval_steps_per_second": 4.598,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.08627662442706929,
87
+ "grad_norm": 3.828125,
88
+ "learning_rate": 0.001,
89
+ "loss": 20.133233642578126,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.09706120248045295,
94
+ "grad_norm": 5.875,
95
+ "learning_rate": 0.001,
96
+ "loss": 19.276626586914062,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.10784578053383662,
101
+ "grad_norm": 3.796875,
102
+ "learning_rate": 0.001,
103
+ "loss": 18.316180419921874,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.10784578053383662,
108
+ "eval_loss": 4.4591450691223145,
109
+ "eval_runtime": 16.5273,
110
+ "eval_samples_per_second": 576.441,
111
+ "eval_steps_per_second": 4.538,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.11863035858722028,
116
+ "grad_norm": 3.125,
117
+ "learning_rate": 0.001,
118
+ "loss": 17.47910919189453,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.12941493664060394,
123
+ "grad_norm": 3.78125,
124
+ "learning_rate": 0.001,
125
+ "loss": 16.857704162597656,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.13480722566729578,
130
+ "eval_loss": 4.037808418273926,
131
+ "eval_runtime": 16.7437,
132
+ "eval_samples_per_second": 568.991,
133
+ "eval_steps_per_second": 4.479,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.1401995146939876,
138
+ "grad_norm": 4.8125,
139
+ "learning_rate": 0.001,
140
+ "loss": 16.15790710449219,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.15098409274737126,
145
+ "grad_norm": 2.453125,
146
+ "learning_rate": 0.001,
147
+ "loss": 15.610972595214843,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.1617686708007549,
152
+ "grad_norm": 5.03125,
153
+ "learning_rate": 0.001,
154
+ "loss": 15.262626647949219,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.1617686708007549,
159
+ "eval_loss": 3.7790420055389404,
160
+ "eval_runtime": 16.4839,
161
+ "eval_samples_per_second": 577.957,
162
+ "eval_steps_per_second": 4.55,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.17255324885413859,
167
+ "grad_norm": 2.53125,
168
+ "learning_rate": 0.001,
169
+ "loss": 14.862835693359376,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.18333782690752223,
174
+ "grad_norm": 1.8828125,
175
+ "learning_rate": 0.001,
176
+ "loss": 14.4195556640625,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.18873011593421407,
181
+ "eval_loss": 3.508929491043091,
182
+ "eval_runtime": 16.5096,
183
+ "eval_samples_per_second": 577.059,
184
+ "eval_steps_per_second": 4.543,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.1941224049609059,
189
+ "grad_norm": 2.21875,
190
+ "learning_rate": 0.001,
191
+ "loss": 14.034010314941407,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.20490698301428956,
196
+ "grad_norm": 1.6171875,
197
+ "learning_rate": 0.001,
198
+ "loss": 13.656217956542969,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.21569156106767323,
203
+ "grad_norm": 1.0859375,
204
+ "learning_rate": 0.001,
205
+ "loss": 13.353656005859374,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.21569156106767323,
210
+ "eval_loss": 3.3230206966400146,
211
+ "eval_runtime": 16.5021,
212
+ "eval_samples_per_second": 577.322,
213
+ "eval_steps_per_second": 4.545,
214
+ "step": 400
215
+ }
216
+ ],
217
+ "logging_steps": 20,
218
+ "max_steps": 1500,
219
+ "num_input_tokens_seen": 0,
220
+ "num_train_epochs": 1,
221
+ "save_steps": 100,
222
+ "stateful_callbacks": {
223
+ "TrainerControl": {
224
+ "args": {
225
+ "should_epoch_stop": false,
226
+ "should_evaluate": false,
227
+ "should_log": false,
228
+ "should_save": true,
229
+ "should_training_stop": false
230
+ },
231
+ "attributes": {}
232
+ }
233
+ },
234
+ "total_flos": 9704666510131200.0,
235
+ "train_batch_size": 128,
236
+ "trial_name": null,
237
+ "trial_params": null
238
+ }
out/mlp-s10-94L_run/checkpoint-400/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:873bf272a464f8d4f32a1497a17e4dd88aaf0d116e87d1e95dbff747318696f0
3
+ size 4920
out/mlp-s10-94L_run/checkpoint-500/config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "s10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 94,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.15.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096
35
+ }
out/mlp-s10-94L_run/checkpoint-500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:51ff1419c0e8c13aa7714c95469fdd320a332827401b4671c1cfc4a9cd603ba8
3
+ size 31981960
out/mlp-s10-94L_run/checkpoint-500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:144c410296edb35dd9205691e3ea532b2b4ce216c706996bcb3a7a0df85514f2
3
+ size 64439848