w-ahmad commited on
Commit
fa87090
·
verified ·
1 Parent(s): f78148e

Auto upload zain 2026-08-12T22:04:31.568585

Browse files
Files changed (39) hide show
  1. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/config.json +36 -0
  2. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/model.safetensors +3 -0
  3. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/optimizer.pt +3 -0
  4. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/rng_state.pth +3 -0
  5. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/scheduler.pt +3 -0
  6. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/tokenizer.json +0 -0
  7. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/tokenizer_config.json +13 -0
  8. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/trainer_state.json +1258 -0
  9. zain/Activation/out/glu-silu-100L_run/checkpoint-2400/training_args.bin +3 -0
  10. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/config.json +36 -0
  11. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/model.safetensors +3 -0
  12. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/optimizer.pt +3 -0
  13. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/rng_state.pth +3 -0
  14. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/scheduler.pt +3 -0
  15. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/tokenizer.json +0 -0
  16. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/tokenizer_config.json +13 -0
  17. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/trainer_state.json +1309 -0
  18. zain/Activation/out/glu-silu-100L_run/checkpoint-2500/training_args.bin +3 -0
  19. zain/Activation/out/glu-silu-100L_run/config.json +36 -0
  20. zain/Activation/out/glu-silu-100L_run/model.safetensors +3 -0
  21. zain/Activation/out/glu-silu-100L_run/tokenizer.json +0 -0
  22. zain/Activation/out/glu-silu-100L_run/tokenizer_config.json +13 -0
  23. zain/Activation/out/glu-silu-100L_run/training_args.bin +3 -0
  24. zain/Activation/out/glu-silu-100L_run/training_log.jsonl +14 -0
  25. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/config.json +36 -0
  26. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/model.safetensors +3 -0
  27. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/optimizer.pt +3 -0
  28. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/rng_state.pth +3 -0
  29. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/scheduler.pt +3 -0
  30. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/tokenizer.json +0 -0
  31. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/tokenizer_config.json +13 -0
  32. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/trainer_state.json +85 -0
  33. zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/training_args.bin +3 -0
  34. zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/config.json +36 -0
  35. zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/model.safetensors +3 -0
  36. zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/optimizer.pt +3 -0
  37. zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/rng_state.pth +3 -0
  38. zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/scheduler.pt +3 -0
  39. zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/tokenizer.json +0 -0
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "silu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 100,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.16.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096,
35
+ "waleed_beta": 10.0
36
+ }
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4044bb875bf94c07051f2249e364d546e38e6ec2236445a4743feb0fab43eee5
3
+ size 33967272
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8eeb26579b747d9940ea28668f63001bae9950dd2289f7782ab0a03e676a8814
3
+ size 68504996
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:788fce37b66c4a897887d15a42b82c5e978ffd3ce1892b7282cbebe28b008c9d
3
+ size 14244
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cffe3454608d7821f042822654b62bd9020d78872ebdecde4f22f94320596378
3
+ size 1064
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/trainer_state.json ADDED
@@ -0,0 +1,1258 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.16177957532861476,
6
+ "eval_steps": 50,
7
+ "global_step": 2400,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0013481631277384564,
14
+ "grad_norm": 2.078125,
15
+ "learning_rate": 2.66e-05,
16
+ "loss": 8.29962387084961,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.002696326255476913,
21
+ "grad_norm": 1.3515625,
22
+ "learning_rate": 5.46e-05,
23
+ "loss": 8.047650909423828,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.003370407819346141,
28
+ "eval_loss": 7.835535049438477,
29
+ "eval_runtime": 15.2165,
30
+ "eval_samples_per_second": 626.095,
31
+ "eval_steps_per_second": 0.657,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.004044489383215369,
36
+ "grad_norm": 1.2734375,
37
+ "learning_rate": 8.259999999999999e-05,
38
+ "loss": 7.8378746032714846,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.005392652510953826,
43
+ "grad_norm": 1.265625,
44
+ "learning_rate": 0.0001106,
45
+ "loss": 7.5728271484375,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.006740815638692282,
50
+ "grad_norm": 1.1953125,
51
+ "learning_rate": 0.0001386,
52
+ "loss": 7.2332916259765625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.006740815638692282,
57
+ "eval_loss": 7.039053440093994,
58
+ "eval_runtime": 15.2074,
59
+ "eval_samples_per_second": 626.471,
60
+ "eval_steps_per_second": 0.658,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.008088978766430738,
65
+ "grad_norm": 1.1328125,
66
+ "learning_rate": 0.00016659999999999998,
67
+ "loss": 6.8608039855957035,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.009437141894169195,
72
+ "grad_norm": 0.94921875,
73
+ "learning_rate": 0.00019460000000000001,
74
+ "loss": 6.517842864990234,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.010111223458038422,
79
+ "eval_loss": 6.229617595672607,
80
+ "eval_runtime": 15.1978,
81
+ "eval_samples_per_second": 626.867,
82
+ "eval_steps_per_second": 0.658,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.010785305021907651,
87
+ "grad_norm": 0.80078125,
88
+ "learning_rate": 0.0002226,
89
+ "loss": 6.2399169921875,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.012133468149646108,
94
+ "grad_norm": 0.6640625,
95
+ "learning_rate": 0.00025059999999999997,
96
+ "loss": 6.036548614501953,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.013481631277384564,
101
+ "grad_norm": 0.61328125,
102
+ "learning_rate": 0.0002786,
103
+ "loss": 5.857078552246094,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.013481631277384564,
108
+ "eval_loss": 5.765108585357666,
109
+ "eval_runtime": 15.5271,
110
+ "eval_samples_per_second": 613.574,
111
+ "eval_steps_per_second": 0.644,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.01482979440512302,
116
+ "grad_norm": 0.61328125,
117
+ "learning_rate": 0.00030659999999999997,
118
+ "loss": 5.680564117431641,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.016177957532861477,
123
+ "grad_norm": 2.0625,
124
+ "learning_rate": 0.0003346,
125
+ "loss": 5.472259902954102,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.016852039096730706,
130
+ "eval_loss": 5.240335464477539,
131
+ "eval_runtime": 15.2596,
132
+ "eval_samples_per_second": 624.33,
133
+ "eval_steps_per_second": 0.655,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.01752612066059993,
138
+ "grad_norm": 1.7421875,
139
+ "learning_rate": 0.00036260000000000003,
140
+ "loss": 5.24955940246582,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.01887428378833839,
145
+ "grad_norm": 0.62109375,
146
+ "learning_rate": 0.0003906,
147
+ "loss": 4.995759963989258,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.020222446916076844,
152
+ "grad_norm": 1.390625,
153
+ "learning_rate": 0.0004186,
154
+ "loss": 4.769353866577148,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.020222446916076844,
159
+ "eval_loss": 4.669629096984863,
160
+ "eval_runtime": 15.2595,
161
+ "eval_samples_per_second": 624.332,
162
+ "eval_steps_per_second": 0.655,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.021570610043815303,
167
+ "grad_norm": 0.73828125,
168
+ "learning_rate": 0.0004466,
169
+ "loss": 4.569867324829102,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.022918773171553757,
174
+ "grad_norm": 0.765625,
175
+ "learning_rate": 0.00047460000000000004,
176
+ "loss": 4.389446258544922,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.023592854735422986,
181
+ "eval_loss": 4.231207847595215,
182
+ "eval_runtime": 15.2143,
183
+ "eval_samples_per_second": 626.188,
184
+ "eval_steps_per_second": 0.657,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.024266936299292215,
189
+ "grad_norm": 1.2421875,
190
+ "learning_rate": 0.0005026,
191
+ "loss": 4.243848419189453,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.02561509942703067,
196
+ "grad_norm": 0.7109375,
197
+ "learning_rate": 0.0005306,
198
+ "loss": 4.1090648651123045,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.026963262554769128,
203
+ "grad_norm": 0.484375,
204
+ "learning_rate": 0.0005586,
205
+ "loss": 3.966172790527344,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.026963262554769128,
210
+ "eval_loss": 3.923773765563965,
211
+ "eval_runtime": 15.5308,
212
+ "eval_samples_per_second": 613.426,
213
+ "eval_steps_per_second": 0.644,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.028311425682507583,
218
+ "grad_norm": 0.6640625,
219
+ "learning_rate": 0.0005866,
220
+ "loss": 3.8559597015380858,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.02965958881024604,
225
+ "grad_norm": 0.515625,
226
+ "learning_rate": 0.0006146,
227
+ "loss": 3.7943866729736326,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.030333670374115267,
232
+ "eval_loss": 3.6977553367614746,
233
+ "eval_runtime": 15.2001,
234
+ "eval_samples_per_second": 626.77,
235
+ "eval_steps_per_second": 0.658,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.031007751937984496,
240
+ "grad_norm": 0.51953125,
241
+ "learning_rate": 0.0006426,
242
+ "loss": 3.686443328857422,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.032355915065722954,
247
+ "grad_norm": 0.62109375,
248
+ "learning_rate": 0.0006705999999999999,
249
+ "loss": 3.6123157501220704,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.03370407819346141,
254
+ "grad_norm": 0.70703125,
255
+ "learning_rate": 0.0006986,
256
+ "loss": 3.542654800415039,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.03370407819346141,
261
+ "eval_loss": 3.513820171356201,
262
+ "eval_runtime": 15.2193,
263
+ "eval_samples_per_second": 625.983,
264
+ "eval_steps_per_second": 0.657,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.03505224132119986,
269
+ "grad_norm": 0.48046875,
270
+ "learning_rate": 0.0007,
271
+ "loss": 3.472199249267578,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.03640040444893832,
276
+ "grad_norm": 0.53515625,
277
+ "learning_rate": 0.0007,
278
+ "loss": 3.396291732788086,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.03707448601280755,
283
+ "eval_loss": 3.3581483364105225,
284
+ "eval_runtime": 15.3044,
285
+ "eval_samples_per_second": 622.502,
286
+ "eval_steps_per_second": 0.653,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.03774856757667678,
291
+ "grad_norm": 0.47265625,
292
+ "learning_rate": 0.0007,
293
+ "loss": 3.347300720214844,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.03909673070441524,
298
+ "grad_norm": 0.458984375,
299
+ "learning_rate": 0.0007,
300
+ "loss": 3.2885902404785154,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.04044489383215369,
305
+ "grad_norm": 0.4375,
306
+ "learning_rate": 0.0007,
307
+ "loss": 3.25723876953125,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.04044489383215369,
312
+ "eval_loss": 3.2229573726654053,
313
+ "eval_runtime": 15.2967,
314
+ "eval_samples_per_second": 622.812,
315
+ "eval_steps_per_second": 0.654,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.04179305695989215,
320
+ "grad_norm": 0.458984375,
321
+ "learning_rate": 0.0007,
322
+ "loss": 3.1902334213256838,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.043141220087630605,
327
+ "grad_norm": 0.40625,
328
+ "learning_rate": 0.0007,
329
+ "loss": 3.167861557006836,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.043815301651499834,
334
+ "eval_loss": 3.120636463165283,
335
+ "eval_runtime": 15.3751,
336
+ "eval_samples_per_second": 619.639,
337
+ "eval_steps_per_second": 0.65,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.044489383215369056,
342
+ "grad_norm": 0.494140625,
343
+ "learning_rate": 0.0007,
344
+ "loss": 3.1089324951171875,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.045837546343107514,
349
+ "grad_norm": 0.435546875,
350
+ "learning_rate": 0.0007,
351
+ "loss": 3.0828268051147463,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.04718570947084597,
356
+ "grad_norm": 0.427734375,
357
+ "learning_rate": 0.0007,
358
+ "loss": 3.0396488189697264,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.04718570947084597,
363
+ "eval_loss": 3.0276408195495605,
364
+ "eval_runtime": 15.2735,
365
+ "eval_samples_per_second": 623.761,
366
+ "eval_steps_per_second": 0.655,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.04853387259858443,
371
+ "grad_norm": 0.4375,
372
+ "learning_rate": 0.0007,
373
+ "loss": 3.0034805297851563,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.04988203572632288,
378
+ "grad_norm": 0.52734375,
379
+ "learning_rate": 0.0007,
380
+ "loss": 2.96556396484375,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.05055611729019211,
385
+ "eval_loss": 2.950009346008301,
386
+ "eval_runtime": 15.243,
387
+ "eval_samples_per_second": 625.009,
388
+ "eval_steps_per_second": 0.656,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.05123019885406134,
393
+ "grad_norm": 0.451171875,
394
+ "learning_rate": 0.0007,
395
+ "loss": 2.950779151916504,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.0525783619817998,
400
+ "grad_norm": 0.400390625,
401
+ "learning_rate": 0.0007,
402
+ "loss": 2.956203079223633,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.053926525109538256,
407
+ "grad_norm": 0.40625,
408
+ "learning_rate": 0.0007,
409
+ "loss": 2.9017578125,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.053926525109538256,
414
+ "eval_loss": 2.8844006061553955,
415
+ "eval_runtime": 15.2903,
416
+ "eval_samples_per_second": 623.073,
417
+ "eval_steps_per_second": 0.654,
418
+ "step": 800
419
+ },
420
+ {
421
+ "epoch": 0.05527468823727671,
422
+ "grad_norm": 0.41015625,
423
+ "learning_rate": 0.0007,
424
+ "loss": 2.887515640258789,
425
+ "step": 820
426
+ },
427
+ {
428
+ "epoch": 0.056622851365015166,
429
+ "grad_norm": 0.41796875,
430
+ "learning_rate": 0.0007,
431
+ "loss": 2.8556928634643555,
432
+ "step": 840
433
+ },
434
+ {
435
+ "epoch": 0.057296932928884395,
436
+ "eval_loss": 2.821610450744629,
437
+ "eval_runtime": 15.2253,
438
+ "eval_samples_per_second": 625.733,
439
+ "eval_steps_per_second": 0.657,
440
+ "step": 850
441
+ },
442
+ {
443
+ "epoch": 0.057971014492753624,
444
+ "grad_norm": 0.423828125,
445
+ "learning_rate": 0.0007,
446
+ "loss": 2.8130855560302734,
447
+ "step": 860
448
+ },
449
+ {
450
+ "epoch": 0.05931917762049208,
451
+ "grad_norm": 0.38671875,
452
+ "learning_rate": 0.0007,
453
+ "loss": 2.790329170227051,
454
+ "step": 880
455
+ },
456
+ {
457
+ "epoch": 0.06066734074823053,
458
+ "grad_norm": 0.427734375,
459
+ "learning_rate": 0.0007,
460
+ "loss": 2.7760162353515625,
461
+ "step": 900
462
+ },
463
+ {
464
+ "epoch": 0.06066734074823053,
465
+ "eval_loss": 2.7661373615264893,
466
+ "eval_runtime": 15.2736,
467
+ "eval_samples_per_second": 623.755,
468
+ "eval_steps_per_second": 0.655,
469
+ "step": 900
470
+ },
471
+ {
472
+ "epoch": 0.06201550387596899,
473
+ "grad_norm": 0.435546875,
474
+ "learning_rate": 0.0007,
475
+ "loss": 2.7462047576904296,
476
+ "step": 920
477
+ },
478
+ {
479
+ "epoch": 0.06336366700370745,
480
+ "grad_norm": 0.4140625,
481
+ "learning_rate": 0.0007,
482
+ "loss": 2.732274627685547,
483
+ "step": 940
484
+ },
485
+ {
486
+ "epoch": 0.06403774856757667,
487
+ "eval_loss": 2.713942289352417,
488
+ "eval_runtime": 15.6062,
489
+ "eval_samples_per_second": 610.463,
490
+ "eval_steps_per_second": 0.641,
491
+ "step": 950
492
+ },
493
+ {
494
+ "epoch": 0.06471183013144591,
495
+ "grad_norm": 0.419921875,
496
+ "learning_rate": 0.0007,
497
+ "loss": 2.705318069458008,
498
+ "step": 960
499
+ },
500
+ {
501
+ "epoch": 0.06605999325918437,
502
+ "grad_norm": 0.4296875,
503
+ "learning_rate": 0.0007,
504
+ "loss": 2.6892818450927733,
505
+ "step": 980
506
+ },
507
+ {
508
+ "epoch": 0.06740815638692282,
509
+ "grad_norm": 0.4453125,
510
+ "learning_rate": 0.0007,
511
+ "loss": 2.687115287780762,
512
+ "step": 1000
513
+ },
514
+ {
515
+ "epoch": 0.06740815638692282,
516
+ "eval_loss": 2.668647289276123,
517
+ "eval_runtime": 15.2597,
518
+ "eval_samples_per_second": 624.326,
519
+ "eval_steps_per_second": 0.655,
520
+ "step": 1000
521
+ },
522
+ {
523
+ "epoch": 0.06875631951466127,
524
+ "grad_norm": 0.388671875,
525
+ "learning_rate": 0.0007,
526
+ "loss": 2.6533071517944338,
527
+ "step": 1020
528
+ },
529
+ {
530
+ "epoch": 0.07010448264239973,
531
+ "grad_norm": 0.392578125,
532
+ "learning_rate": 0.0007,
533
+ "loss": 2.6390922546386717,
534
+ "step": 1040
535
+ },
536
+ {
537
+ "epoch": 0.07077856420626896,
538
+ "eval_loss": 2.6291816234588623,
539
+ "eval_runtime": 15.2457,
540
+ "eval_samples_per_second": 624.896,
541
+ "eval_steps_per_second": 0.656,
542
+ "step": 1050
543
+ },
544
+ {
545
+ "epoch": 0.07145264577013818,
546
+ "grad_norm": 0.4375,
547
+ "learning_rate": 0.0007,
548
+ "loss": 2.624461555480957,
549
+ "step": 1060
550
+ },
551
+ {
552
+ "epoch": 0.07280080889787664,
553
+ "grad_norm": 0.396484375,
554
+ "learning_rate": 0.0007,
555
+ "loss": 2.6044427871704103,
556
+ "step": 1080
557
+ },
558
+ {
559
+ "epoch": 0.0741489720256151,
560
+ "grad_norm": 0.423828125,
561
+ "learning_rate": 0.0007,
562
+ "loss": 2.597646713256836,
563
+ "step": 1100
564
+ },
565
+ {
566
+ "epoch": 0.0741489720256151,
567
+ "eval_loss": 2.589696168899536,
568
+ "eval_runtime": 15.3967,
569
+ "eval_samples_per_second": 618.768,
570
+ "eval_steps_per_second": 0.649,
571
+ "step": 1100
572
+ },
573
+ {
574
+ "epoch": 0.07549713515335356,
575
+ "grad_norm": 0.369140625,
576
+ "learning_rate": 0.0007,
577
+ "loss": 2.561947250366211,
578
+ "step": 1120
579
+ },
580
+ {
581
+ "epoch": 0.07684529828109202,
582
+ "grad_norm": 0.390625,
583
+ "learning_rate": 0.0007,
584
+ "loss": 2.54862117767334,
585
+ "step": 1140
586
+ },
587
+ {
588
+ "epoch": 0.07751937984496124,
589
+ "eval_loss": 2.559185743331909,
590
+ "eval_runtime": 15.2877,
591
+ "eval_samples_per_second": 623.181,
592
+ "eval_steps_per_second": 0.654,
593
+ "step": 1150
594
+ },
595
+ {
596
+ "epoch": 0.07819346140883048,
597
+ "grad_norm": 0.37890625,
598
+ "learning_rate": 0.0007,
599
+ "loss": 2.5469717025756835,
600
+ "step": 1160
601
+ },
602
+ {
603
+ "epoch": 0.07954162453656892,
604
+ "grad_norm": 0.400390625,
605
+ "learning_rate": 0.0007,
606
+ "loss": 2.540451240539551,
607
+ "step": 1180
608
+ },
609
+ {
610
+ "epoch": 0.08088978766430738,
611
+ "grad_norm": 0.40625,
612
+ "learning_rate": 0.0007,
613
+ "loss": 2.53134708404541,
614
+ "step": 1200
615
+ },
616
+ {
617
+ "epoch": 0.08088978766430738,
618
+ "eval_loss": 2.521665096282959,
619
+ "eval_runtime": 15.2822,
620
+ "eval_samples_per_second": 623.407,
621
+ "eval_steps_per_second": 0.654,
622
+ "step": 1200
623
+ },
624
+ {
625
+ "epoch": 0.08223795079204584,
626
+ "grad_norm": 0.37109375,
627
+ "learning_rate": 0.0007,
628
+ "loss": 2.513539123535156,
629
+ "step": 1220
630
+ },
631
+ {
632
+ "epoch": 0.0835861139197843,
633
+ "grad_norm": 0.36328125,
634
+ "learning_rate": 0.0007,
635
+ "loss": 2.5009738922119142,
636
+ "step": 1240
637
+ },
638
+ {
639
+ "epoch": 0.08426019548365352,
640
+ "eval_loss": 2.489459753036499,
641
+ "eval_runtime": 15.2493,
642
+ "eval_samples_per_second": 624.749,
643
+ "eval_steps_per_second": 0.656,
644
+ "step": 1250
645
+ },
646
+ {
647
+ "epoch": 0.08493427704752275,
648
+ "grad_norm": 0.388671875,
649
+ "learning_rate": 0.0007,
650
+ "loss": 2.4894077301025392,
651
+ "step": 1260
652
+ },
653
+ {
654
+ "epoch": 0.08628244017526121,
655
+ "grad_norm": 0.369140625,
656
+ "learning_rate": 0.0007,
657
+ "loss": 2.4697439193725588,
658
+ "step": 1280
659
+ },
660
+ {
661
+ "epoch": 0.08763060330299967,
662
+ "grad_norm": 0.423828125,
663
+ "learning_rate": 0.0007,
664
+ "loss": 2.461294174194336,
665
+ "step": 1300
666
+ },
667
+ {
668
+ "epoch": 0.08763060330299967,
669
+ "eval_loss": 2.4627816677093506,
670
+ "eval_runtime": 15.421,
671
+ "eval_samples_per_second": 617.795,
672
+ "eval_steps_per_second": 0.648,
673
+ "step": 1300
674
+ },
675
+ {
676
+ "epoch": 0.08897876643073811,
677
+ "grad_norm": 0.36328125,
678
+ "learning_rate": 0.0007,
679
+ "loss": 2.452680206298828,
680
+ "step": 1320
681
+ },
682
+ {
683
+ "epoch": 0.09032692955847657,
684
+ "grad_norm": 0.404296875,
685
+ "learning_rate": 0.0007,
686
+ "loss": 2.4396684646606444,
687
+ "step": 1340
688
+ },
689
+ {
690
+ "epoch": 0.0910010111223458,
691
+ "eval_loss": 2.437220335006714,
692
+ "eval_runtime": 15.3026,
693
+ "eval_samples_per_second": 622.576,
694
+ "eval_steps_per_second": 0.653,
695
+ "step": 1350
696
+ },
697
+ {
698
+ "epoch": 0.09167509268621503,
699
+ "grad_norm": 0.412109375,
700
+ "learning_rate": 0.0007,
701
+ "loss": 2.4397760391235352,
702
+ "step": 1360
703
+ },
704
+ {
705
+ "epoch": 0.09302325581395349,
706
+ "grad_norm": 0.353515625,
707
+ "learning_rate": 0.0007,
708
+ "loss": 2.4158536911010744,
709
+ "step": 1380
710
+ },
711
+ {
712
+ "epoch": 0.09437141894169195,
713
+ "grad_norm": 0.345703125,
714
+ "learning_rate": 0.0007,
715
+ "loss": 2.406942367553711,
716
+ "step": 1400
717
+ },
718
+ {
719
+ "epoch": 0.09437141894169195,
720
+ "eval_loss": 2.4096601009368896,
721
+ "eval_runtime": 15.357,
722
+ "eval_samples_per_second": 620.368,
723
+ "eval_steps_per_second": 0.651,
724
+ "step": 1400
725
+ },
726
+ {
727
+ "epoch": 0.0957195820694304,
728
+ "grad_norm": 0.36328125,
729
+ "learning_rate": 0.0007,
730
+ "loss": 2.4161144256591798,
731
+ "step": 1420
732
+ },
733
+ {
734
+ "epoch": 0.09706774519716886,
735
+ "grad_norm": 0.36328125,
736
+ "learning_rate": 0.0007,
737
+ "loss": 2.392984390258789,
738
+ "step": 1440
739
+ },
740
+ {
741
+ "epoch": 0.09774182676103808,
742
+ "eval_loss": 2.3937113285064697,
743
+ "eval_runtime": 15.3555,
744
+ "eval_samples_per_second": 620.43,
745
+ "eval_steps_per_second": 0.651,
746
+ "step": 1450
747
+ },
748
+ {
749
+ "epoch": 0.09841590832490732,
750
+ "grad_norm": 0.384765625,
751
+ "learning_rate": 0.0007,
752
+ "loss": 2.3820331573486326,
753
+ "step": 1460
754
+ },
755
+ {
756
+ "epoch": 0.09976407145264576,
757
+ "grad_norm": 0.33984375,
758
+ "learning_rate": 0.0007,
759
+ "loss": 2.3687986373901366,
760
+ "step": 1480
761
+ },
762
+ {
763
+ "epoch": 0.10111223458038422,
764
+ "grad_norm": 0.38671875,
765
+ "learning_rate": 0.0007,
766
+ "loss": 2.355032730102539,
767
+ "step": 1500
768
+ },
769
+ {
770
+ "epoch": 0.10111223458038422,
771
+ "eval_loss": 2.3681657314300537,
772
+ "eval_runtime": 15.3336,
773
+ "eval_samples_per_second": 621.317,
774
+ "eval_steps_per_second": 0.652,
775
+ "step": 1500
776
+ },
777
+ {
778
+ "epoch": 0.10246039770812268,
779
+ "grad_norm": 0.392578125,
780
+ "learning_rate": 0.0007,
781
+ "loss": 2.3572179794311525,
782
+ "step": 1520
783
+ },
784
+ {
785
+ "epoch": 0.10380856083586114,
786
+ "grad_norm": 0.35546875,
787
+ "learning_rate": 0.0007,
788
+ "loss": 2.345840835571289,
789
+ "step": 1540
790
+ },
791
+ {
792
+ "epoch": 0.10448264239973036,
793
+ "eval_loss": 2.3475193977355957,
794
+ "eval_runtime": 15.3453,
795
+ "eval_samples_per_second": 620.842,
796
+ "eval_steps_per_second": 0.652,
797
+ "step": 1550
798
+ },
799
+ {
800
+ "epoch": 0.1051567239635996,
801
+ "grad_norm": 0.388671875,
802
+ "learning_rate": 0.0007,
803
+ "loss": 2.335231971740723,
804
+ "step": 1560
805
+ },
806
+ {
807
+ "epoch": 0.10650488709133805,
808
+ "grad_norm": 0.359375,
809
+ "learning_rate": 0.0007,
810
+ "loss": 2.3543283462524416,
811
+ "step": 1580
812
+ },
813
+ {
814
+ "epoch": 0.10785305021907651,
815
+ "grad_norm": 0.39453125,
816
+ "learning_rate": 0.0007,
817
+ "loss": 2.3237049102783205,
818
+ "step": 1600
819
+ },
820
+ {
821
+ "epoch": 0.10785305021907651,
822
+ "eval_loss": 2.3377676010131836,
823
+ "eval_runtime": 15.2858,
824
+ "eval_samples_per_second": 623.259,
825
+ "eval_steps_per_second": 0.654,
826
+ "step": 1600
827
+ },
828
+ {
829
+ "epoch": 0.10920121334681497,
830
+ "grad_norm": 0.357421875,
831
+ "learning_rate": 0.0007,
832
+ "loss": 2.3196277618408203,
833
+ "step": 1620
834
+ },
835
+ {
836
+ "epoch": 0.11054937647455342,
837
+ "grad_norm": 0.341796875,
838
+ "learning_rate": 0.0007,
839
+ "loss": 2.3308162689208984,
840
+ "step": 1640
841
+ },
842
+ {
843
+ "epoch": 0.11122345803842265,
844
+ "eval_loss": 2.313627004623413,
845
+ "eval_runtime": 15.276,
846
+ "eval_samples_per_second": 623.659,
847
+ "eval_steps_per_second": 0.655,
848
+ "step": 1650
849
+ },
850
+ {
851
+ "epoch": 0.11189753960229187,
852
+ "grad_norm": 0.353515625,
853
+ "learning_rate": 0.0007,
854
+ "loss": 2.3104904174804686,
855
+ "step": 1660
856
+ },
857
+ {
858
+ "epoch": 0.11324570273003033,
859
+ "grad_norm": 0.353515625,
860
+ "learning_rate": 0.0007,
861
+ "loss": 2.2955816268920897,
862
+ "step": 1680
863
+ },
864
+ {
865
+ "epoch": 0.11459386585776879,
866
+ "grad_norm": 0.345703125,
867
+ "learning_rate": 0.0007,
868
+ "loss": 2.3044401168823243,
869
+ "step": 1700
870
+ },
871
+ {
872
+ "epoch": 0.11459386585776879,
873
+ "eval_loss": 2.2976956367492676,
874
+ "eval_runtime": 15.3404,
875
+ "eval_samples_per_second": 621.039,
876
+ "eval_steps_per_second": 0.652,
877
+ "step": 1700
878
+ },
879
+ {
880
+ "epoch": 0.11594202898550725,
881
+ "grad_norm": 0.373046875,
882
+ "learning_rate": 0.0007,
883
+ "loss": 2.280081939697266,
884
+ "step": 1720
885
+ },
886
+ {
887
+ "epoch": 0.1172901921132457,
888
+ "grad_norm": 0.373046875,
889
+ "learning_rate": 0.0007,
890
+ "loss": 2.269576644897461,
891
+ "step": 1740
892
+ },
893
+ {
894
+ "epoch": 0.11796427367711493,
895
+ "eval_loss": 2.28181791305542,
896
+ "eval_runtime": 15.2137,
897
+ "eval_samples_per_second": 626.211,
898
+ "eval_steps_per_second": 0.657,
899
+ "step": 1750
900
+ },
901
+ {
902
+ "epoch": 0.11863835524098416,
903
+ "grad_norm": 0.359375,
904
+ "learning_rate": 0.0007,
905
+ "loss": 2.273081398010254,
906
+ "step": 1760
907
+ },
908
+ {
909
+ "epoch": 0.11998651836872262,
910
+ "grad_norm": 0.345703125,
911
+ "learning_rate": 0.0007,
912
+ "loss": 2.2877025604248047,
913
+ "step": 1780
914
+ },
915
+ {
916
+ "epoch": 0.12133468149646107,
917
+ "grad_norm": 0.3671875,
918
+ "learning_rate": 0.0007,
919
+ "loss": 2.2828989028930664,
920
+ "step": 1800
921
+ },
922
+ {
923
+ "epoch": 0.12133468149646107,
924
+ "eval_loss": 2.2671334743499756,
925
+ "eval_runtime": 15.1615,
926
+ "eval_samples_per_second": 628.369,
927
+ "eval_steps_per_second": 0.66,
928
+ "step": 1800
929
+ },
930
+ {
931
+ "epoch": 0.12268284462419952,
932
+ "grad_norm": 0.388671875,
933
+ "learning_rate": 0.0007,
934
+ "loss": 2.2743486404418944,
935
+ "step": 1820
936
+ },
937
+ {
938
+ "epoch": 0.12403100775193798,
939
+ "grad_norm": 0.3671875,
940
+ "learning_rate": 0.0007,
941
+ "loss": 2.2429489135742187,
942
+ "step": 1840
943
+ },
944
+ {
945
+ "epoch": 0.12470508931580722,
946
+ "eval_loss": 2.252441644668579,
947
+ "eval_runtime": 15.3255,
948
+ "eval_samples_per_second": 621.643,
949
+ "eval_steps_per_second": 0.653,
950
+ "step": 1850
951
+ },
952
+ {
953
+ "epoch": 0.12537917087967643,
954
+ "grad_norm": 0.33984375,
955
+ "learning_rate": 0.0007,
956
+ "loss": 2.242429733276367,
957
+ "step": 1860
958
+ },
959
+ {
960
+ "epoch": 0.1267273340074149,
961
+ "grad_norm": 0.353515625,
962
+ "learning_rate": 0.0007,
963
+ "loss": 2.2348007202148437,
964
+ "step": 1880
965
+ },
966
+ {
967
+ "epoch": 0.12807549713515334,
968
+ "grad_norm": 0.330078125,
969
+ "learning_rate": 0.0007,
970
+ "loss": 2.241002655029297,
971
+ "step": 1900
972
+ },
973
+ {
974
+ "epoch": 0.12807549713515334,
975
+ "eval_loss": 2.2387285232543945,
976
+ "eval_runtime": 15.2942,
977
+ "eval_samples_per_second": 622.915,
978
+ "eval_steps_per_second": 0.654,
979
+ "step": 1900
980
+ },
981
+ {
982
+ "epoch": 0.12942366026289182,
983
+ "grad_norm": 0.34765625,
984
+ "learning_rate": 0.0007,
985
+ "loss": 2.2172693252563476,
986
+ "step": 1920
987
+ },
988
+ {
989
+ "epoch": 0.13077182339063026,
990
+ "grad_norm": 0.357421875,
991
+ "learning_rate": 0.0007,
992
+ "loss": 2.2283090591430663,
993
+ "step": 1940
994
+ },
995
+ {
996
+ "epoch": 0.13144590495449948,
997
+ "eval_loss": 2.225919246673584,
998
+ "eval_runtime": 15.3259,
999
+ "eval_samples_per_second": 621.627,
1000
+ "eval_steps_per_second": 0.652,
1001
+ "step": 1950
1002
+ },
1003
+ {
1004
+ "epoch": 0.13211998651836873,
1005
+ "grad_norm": 0.333984375,
1006
+ "learning_rate": 0.0007,
1007
+ "loss": 2.2027830123901366,
1008
+ "step": 1960
1009
+ },
1010
+ {
1011
+ "epoch": 0.13346814964610718,
1012
+ "grad_norm": 0.359375,
1013
+ "learning_rate": 0.0007,
1014
+ "loss": 2.224252128601074,
1015
+ "step": 1980
1016
+ },
1017
+ {
1018
+ "epoch": 0.13481631277384565,
1019
+ "grad_norm": 0.35546875,
1020
+ "learning_rate": 0.0007,
1021
+ "loss": 2.1990388870239257,
1022
+ "step": 2000
1023
+ },
1024
+ {
1025
+ "epoch": 0.13481631277384565,
1026
+ "eval_loss": 2.215721368789673,
1027
+ "eval_runtime": 15.3022,
1028
+ "eval_samples_per_second": 622.59,
1029
+ "eval_steps_per_second": 0.654,
1030
+ "step": 2000
1031
+ },
1032
+ {
1033
+ "epoch": 0.1361644759015841,
1034
+ "grad_norm": 0.345703125,
1035
+ "learning_rate": 0.0007,
1036
+ "loss": 2.207795524597168,
1037
+ "step": 2020
1038
+ },
1039
+ {
1040
+ "epoch": 0.13751263902932254,
1041
+ "grad_norm": 0.396484375,
1042
+ "learning_rate": 0.0007,
1043
+ "loss": 2.1882051467895507,
1044
+ "step": 2040
1045
+ },
1046
+ {
1047
+ "epoch": 0.1381867205931918,
1048
+ "eval_loss": 2.2054405212402344,
1049
+ "eval_runtime": 15.4183,
1050
+ "eval_samples_per_second": 617.904,
1051
+ "eval_steps_per_second": 0.649,
1052
+ "step": 2050
1053
+ },
1054
+ {
1055
+ "epoch": 0.138860802157061,
1056
+ "grad_norm": 0.365234375,
1057
+ "learning_rate": 0.0007,
1058
+ "loss": 2.206527900695801,
1059
+ "step": 2060
1060
+ },
1061
+ {
1062
+ "epoch": 0.14020896528479945,
1063
+ "grad_norm": 0.361328125,
1064
+ "learning_rate": 0.0007,
1065
+ "loss": 2.1837987899780273,
1066
+ "step": 2080
1067
+ },
1068
+ {
1069
+ "epoch": 0.14155712841253792,
1070
+ "grad_norm": 0.33203125,
1071
+ "learning_rate": 0.0007,
1072
+ "loss": 2.1744739532470705,
1073
+ "step": 2100
1074
+ },
1075
+ {
1076
+ "epoch": 0.14155712841253792,
1077
+ "eval_loss": 2.1948788166046143,
1078
+ "eval_runtime": 15.1797,
1079
+ "eval_samples_per_second": 627.615,
1080
+ "eval_steps_per_second": 0.659,
1081
+ "step": 2100
1082
+ },
1083
+ {
1084
+ "epoch": 0.14290529154027637,
1085
+ "grad_norm": 0.361328125,
1086
+ "learning_rate": 0.0007,
1087
+ "loss": 2.182137298583984,
1088
+ "step": 2120
1089
+ },
1090
+ {
1091
+ "epoch": 0.14425345466801484,
1092
+ "grad_norm": 0.337890625,
1093
+ "learning_rate": 0.0007,
1094
+ "loss": 2.1851844787597656,
1095
+ "step": 2140
1096
+ },
1097
+ {
1098
+ "epoch": 0.14492753623188406,
1099
+ "eval_loss": 2.1849257946014404,
1100
+ "eval_runtime": 15.2467,
1101
+ "eval_samples_per_second": 624.858,
1102
+ "eval_steps_per_second": 0.656,
1103
+ "step": 2150
1104
+ },
1105
+ {
1106
+ "epoch": 0.14560161779575329,
1107
+ "grad_norm": 0.3515625,
1108
+ "learning_rate": 0.0007,
1109
+ "loss": 2.1681228637695313,
1110
+ "step": 2160
1111
+ },
1112
+ {
1113
+ "epoch": 0.14694978092349173,
1114
+ "grad_norm": 0.34375,
1115
+ "learning_rate": 0.0007,
1116
+ "loss": 2.1777414321899413,
1117
+ "step": 2180
1118
+ },
1119
+ {
1120
+ "epoch": 0.1482979440512302,
1121
+ "grad_norm": 0.33203125,
1122
+ "learning_rate": 0.0007,
1123
+ "loss": 2.1520442962646484,
1124
+ "step": 2200
1125
+ },
1126
+ {
1127
+ "epoch": 0.1482979440512302,
1128
+ "eval_loss": 2.1730399131774902,
1129
+ "eval_runtime": 15.3329,
1130
+ "eval_samples_per_second": 621.344,
1131
+ "eval_steps_per_second": 0.652,
1132
+ "step": 2200
1133
+ },
1134
+ {
1135
+ "epoch": 0.14964610717896865,
1136
+ "grad_norm": 0.333984375,
1137
+ "learning_rate": 0.0007,
1138
+ "loss": 2.159272384643555,
1139
+ "step": 2220
1140
+ },
1141
+ {
1142
+ "epoch": 0.15099427030670712,
1143
+ "grad_norm": 0.357421875,
1144
+ "learning_rate": 0.0007,
1145
+ "loss": 2.1691991806030275,
1146
+ "step": 2240
1147
+ },
1148
+ {
1149
+ "epoch": 0.15166835187057634,
1150
+ "eval_loss": 2.1636791229248047,
1151
+ "eval_runtime": 15.4687,
1152
+ "eval_samples_per_second": 615.888,
1153
+ "eval_steps_per_second": 0.646,
1154
+ "step": 2250
1155
+ },
1156
+ {
1157
+ "epoch": 0.15234243343444556,
1158
+ "grad_norm": 0.36328125,
1159
+ "learning_rate": 0.0007,
1160
+ "loss": 2.147579383850098,
1161
+ "step": 2260
1162
+ },
1163
+ {
1164
+ "epoch": 0.15369059656218403,
1165
+ "grad_norm": 0.34765625,
1166
+ "learning_rate": 0.0007,
1167
+ "loss": 2.1597997665405275,
1168
+ "step": 2280
1169
+ },
1170
+ {
1171
+ "epoch": 0.15503875968992248,
1172
+ "grad_norm": 0.333984375,
1173
+ "learning_rate": 0.0007,
1174
+ "loss": 2.1413923263549806,
1175
+ "step": 2300
1176
+ },
1177
+ {
1178
+ "epoch": 0.15503875968992248,
1179
+ "eval_loss": 2.1545023918151855,
1180
+ "eval_runtime": 15.4261,
1181
+ "eval_samples_per_second": 617.588,
1182
+ "eval_steps_per_second": 0.648,
1183
+ "step": 2300
1184
+ },
1185
+ {
1186
+ "epoch": 0.15638692281766095,
1187
+ "grad_norm": 0.33203125,
1188
+ "learning_rate": 0.0007,
1189
+ "loss": 2.1491439819335936,
1190
+ "step": 2320
1191
+ },
1192
+ {
1193
+ "epoch": 0.1577350859453994,
1194
+ "grad_norm": 0.33203125,
1195
+ "learning_rate": 0.0007,
1196
+ "loss": 2.137864112854004,
1197
+ "step": 2340
1198
+ },
1199
+ {
1200
+ "epoch": 0.15840916750926862,
1201
+ "eval_loss": 2.145824432373047,
1202
+ "eval_runtime": 15.654,
1203
+ "eval_samples_per_second": 608.599,
1204
+ "eval_steps_per_second": 0.639,
1205
+ "step": 2350
1206
+ },
1207
+ {
1208
+ "epoch": 0.15908324907313784,
1209
+ "grad_norm": 0.326171875,
1210
+ "learning_rate": 0.0007,
1211
+ "loss": 2.1423198699951174,
1212
+ "step": 2360
1213
+ },
1214
+ {
1215
+ "epoch": 0.1604314122008763,
1216
+ "grad_norm": 0.33203125,
1217
+ "learning_rate": 0.0007,
1218
+ "loss": 2.143879699707031,
1219
+ "step": 2380
1220
+ },
1221
+ {
1222
+ "epoch": 0.16177957532861476,
1223
+ "grad_norm": 0.3671875,
1224
+ "learning_rate": 0.0007,
1225
+ "loss": 2.1223339080810546,
1226
+ "step": 2400
1227
+ },
1228
+ {
1229
+ "epoch": 0.16177957532861476,
1230
+ "eval_loss": 2.142425537109375,
1231
+ "eval_runtime": 15.4359,
1232
+ "eval_samples_per_second": 617.196,
1233
+ "eval_steps_per_second": 0.648,
1234
+ "step": 2400
1235
+ }
1236
+ ],
1237
+ "logging_steps": 20,
1238
+ "max_steps": 2500,
1239
+ "num_input_tokens_seen": 0,
1240
+ "num_train_epochs": 1,
1241
+ "save_steps": 100,
1242
+ "stateful_callbacks": {
1243
+ "TrainerControl": {
1244
+ "args": {
1245
+ "should_epoch_stop": false,
1246
+ "should_evaluate": false,
1247
+ "should_log": false,
1248
+ "should_save": true,
1249
+ "should_training_stop": false
1250
+ },
1251
+ "attributes": {}
1252
+ }
1253
+ },
1254
+ "total_flos": 7743081126297600.0,
1255
+ "train_batch_size": 64,
1256
+ "trial_name": null,
1257
+ "trial_params": null
1258
+ }
zain/Activation/out/glu-silu-100L_run/checkpoint-2400/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fd90512e56f813612dc668676d6f8cab72da110a42f23c61cafebf91064625a1
3
+ size 4920
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "silu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 100,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.16.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096,
35
+ "waleed_beta": 10.0
36
+ }
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f045fa85b5f282452577f935fd9e86fdb9b94b3442e1820631a0c81d9f1f95c6
3
+ size 33967272
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d30ccf9af11823d2d85f7e89da0ed14291a06b4d77d92784611145a5de328539
3
+ size 68504996
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8dccfcc3afceab4d2d2b25fbb67392f946fa9f1c9efbf11612cbcfa90ce2d337
3
+ size 14244
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fae3f7a9f86d9663c06f6e22221bc9e6879cd9691e2b1bba04ee6412e2572f45
3
+ size 1064
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/trainer_state.json ADDED
@@ -0,0 +1,1309 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.16852039096730703,
6
+ "eval_steps": 50,
7
+ "global_step": 2500,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0013481631277384564,
14
+ "grad_norm": 2.078125,
15
+ "learning_rate": 2.66e-05,
16
+ "loss": 8.29962387084961,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.002696326255476913,
21
+ "grad_norm": 1.3515625,
22
+ "learning_rate": 5.46e-05,
23
+ "loss": 8.047650909423828,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.003370407819346141,
28
+ "eval_loss": 7.835535049438477,
29
+ "eval_runtime": 15.2165,
30
+ "eval_samples_per_second": 626.095,
31
+ "eval_steps_per_second": 0.657,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.004044489383215369,
36
+ "grad_norm": 1.2734375,
37
+ "learning_rate": 8.259999999999999e-05,
38
+ "loss": 7.8378746032714846,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.005392652510953826,
43
+ "grad_norm": 1.265625,
44
+ "learning_rate": 0.0001106,
45
+ "loss": 7.5728271484375,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.006740815638692282,
50
+ "grad_norm": 1.1953125,
51
+ "learning_rate": 0.0001386,
52
+ "loss": 7.2332916259765625,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.006740815638692282,
57
+ "eval_loss": 7.039053440093994,
58
+ "eval_runtime": 15.2074,
59
+ "eval_samples_per_second": 626.471,
60
+ "eval_steps_per_second": 0.658,
61
+ "step": 100
62
+ },
63
+ {
64
+ "epoch": 0.008088978766430738,
65
+ "grad_norm": 1.1328125,
66
+ "learning_rate": 0.00016659999999999998,
67
+ "loss": 6.8608039855957035,
68
+ "step": 120
69
+ },
70
+ {
71
+ "epoch": 0.009437141894169195,
72
+ "grad_norm": 0.94921875,
73
+ "learning_rate": 0.00019460000000000001,
74
+ "loss": 6.517842864990234,
75
+ "step": 140
76
+ },
77
+ {
78
+ "epoch": 0.010111223458038422,
79
+ "eval_loss": 6.229617595672607,
80
+ "eval_runtime": 15.1978,
81
+ "eval_samples_per_second": 626.867,
82
+ "eval_steps_per_second": 0.658,
83
+ "step": 150
84
+ },
85
+ {
86
+ "epoch": 0.010785305021907651,
87
+ "grad_norm": 0.80078125,
88
+ "learning_rate": 0.0002226,
89
+ "loss": 6.2399169921875,
90
+ "step": 160
91
+ },
92
+ {
93
+ "epoch": 0.012133468149646108,
94
+ "grad_norm": 0.6640625,
95
+ "learning_rate": 0.00025059999999999997,
96
+ "loss": 6.036548614501953,
97
+ "step": 180
98
+ },
99
+ {
100
+ "epoch": 0.013481631277384564,
101
+ "grad_norm": 0.61328125,
102
+ "learning_rate": 0.0002786,
103
+ "loss": 5.857078552246094,
104
+ "step": 200
105
+ },
106
+ {
107
+ "epoch": 0.013481631277384564,
108
+ "eval_loss": 5.765108585357666,
109
+ "eval_runtime": 15.5271,
110
+ "eval_samples_per_second": 613.574,
111
+ "eval_steps_per_second": 0.644,
112
+ "step": 200
113
+ },
114
+ {
115
+ "epoch": 0.01482979440512302,
116
+ "grad_norm": 0.61328125,
117
+ "learning_rate": 0.00030659999999999997,
118
+ "loss": 5.680564117431641,
119
+ "step": 220
120
+ },
121
+ {
122
+ "epoch": 0.016177957532861477,
123
+ "grad_norm": 2.0625,
124
+ "learning_rate": 0.0003346,
125
+ "loss": 5.472259902954102,
126
+ "step": 240
127
+ },
128
+ {
129
+ "epoch": 0.016852039096730706,
130
+ "eval_loss": 5.240335464477539,
131
+ "eval_runtime": 15.2596,
132
+ "eval_samples_per_second": 624.33,
133
+ "eval_steps_per_second": 0.655,
134
+ "step": 250
135
+ },
136
+ {
137
+ "epoch": 0.01752612066059993,
138
+ "grad_norm": 1.7421875,
139
+ "learning_rate": 0.00036260000000000003,
140
+ "loss": 5.24955940246582,
141
+ "step": 260
142
+ },
143
+ {
144
+ "epoch": 0.01887428378833839,
145
+ "grad_norm": 0.62109375,
146
+ "learning_rate": 0.0003906,
147
+ "loss": 4.995759963989258,
148
+ "step": 280
149
+ },
150
+ {
151
+ "epoch": 0.020222446916076844,
152
+ "grad_norm": 1.390625,
153
+ "learning_rate": 0.0004186,
154
+ "loss": 4.769353866577148,
155
+ "step": 300
156
+ },
157
+ {
158
+ "epoch": 0.020222446916076844,
159
+ "eval_loss": 4.669629096984863,
160
+ "eval_runtime": 15.2595,
161
+ "eval_samples_per_second": 624.332,
162
+ "eval_steps_per_second": 0.655,
163
+ "step": 300
164
+ },
165
+ {
166
+ "epoch": 0.021570610043815303,
167
+ "grad_norm": 0.73828125,
168
+ "learning_rate": 0.0004466,
169
+ "loss": 4.569867324829102,
170
+ "step": 320
171
+ },
172
+ {
173
+ "epoch": 0.022918773171553757,
174
+ "grad_norm": 0.765625,
175
+ "learning_rate": 0.00047460000000000004,
176
+ "loss": 4.389446258544922,
177
+ "step": 340
178
+ },
179
+ {
180
+ "epoch": 0.023592854735422986,
181
+ "eval_loss": 4.231207847595215,
182
+ "eval_runtime": 15.2143,
183
+ "eval_samples_per_second": 626.188,
184
+ "eval_steps_per_second": 0.657,
185
+ "step": 350
186
+ },
187
+ {
188
+ "epoch": 0.024266936299292215,
189
+ "grad_norm": 1.2421875,
190
+ "learning_rate": 0.0005026,
191
+ "loss": 4.243848419189453,
192
+ "step": 360
193
+ },
194
+ {
195
+ "epoch": 0.02561509942703067,
196
+ "grad_norm": 0.7109375,
197
+ "learning_rate": 0.0005306,
198
+ "loss": 4.1090648651123045,
199
+ "step": 380
200
+ },
201
+ {
202
+ "epoch": 0.026963262554769128,
203
+ "grad_norm": 0.484375,
204
+ "learning_rate": 0.0005586,
205
+ "loss": 3.966172790527344,
206
+ "step": 400
207
+ },
208
+ {
209
+ "epoch": 0.026963262554769128,
210
+ "eval_loss": 3.923773765563965,
211
+ "eval_runtime": 15.5308,
212
+ "eval_samples_per_second": 613.426,
213
+ "eval_steps_per_second": 0.644,
214
+ "step": 400
215
+ },
216
+ {
217
+ "epoch": 0.028311425682507583,
218
+ "grad_norm": 0.6640625,
219
+ "learning_rate": 0.0005866,
220
+ "loss": 3.8559597015380858,
221
+ "step": 420
222
+ },
223
+ {
224
+ "epoch": 0.02965958881024604,
225
+ "grad_norm": 0.515625,
226
+ "learning_rate": 0.0006146,
227
+ "loss": 3.7943866729736326,
228
+ "step": 440
229
+ },
230
+ {
231
+ "epoch": 0.030333670374115267,
232
+ "eval_loss": 3.6977553367614746,
233
+ "eval_runtime": 15.2001,
234
+ "eval_samples_per_second": 626.77,
235
+ "eval_steps_per_second": 0.658,
236
+ "step": 450
237
+ },
238
+ {
239
+ "epoch": 0.031007751937984496,
240
+ "grad_norm": 0.51953125,
241
+ "learning_rate": 0.0006426,
242
+ "loss": 3.686443328857422,
243
+ "step": 460
244
+ },
245
+ {
246
+ "epoch": 0.032355915065722954,
247
+ "grad_norm": 0.62109375,
248
+ "learning_rate": 0.0006705999999999999,
249
+ "loss": 3.6123157501220704,
250
+ "step": 480
251
+ },
252
+ {
253
+ "epoch": 0.03370407819346141,
254
+ "grad_norm": 0.70703125,
255
+ "learning_rate": 0.0006986,
256
+ "loss": 3.542654800415039,
257
+ "step": 500
258
+ },
259
+ {
260
+ "epoch": 0.03370407819346141,
261
+ "eval_loss": 3.513820171356201,
262
+ "eval_runtime": 15.2193,
263
+ "eval_samples_per_second": 625.983,
264
+ "eval_steps_per_second": 0.657,
265
+ "step": 500
266
+ },
267
+ {
268
+ "epoch": 0.03505224132119986,
269
+ "grad_norm": 0.48046875,
270
+ "learning_rate": 0.0007,
271
+ "loss": 3.472199249267578,
272
+ "step": 520
273
+ },
274
+ {
275
+ "epoch": 0.03640040444893832,
276
+ "grad_norm": 0.53515625,
277
+ "learning_rate": 0.0007,
278
+ "loss": 3.396291732788086,
279
+ "step": 540
280
+ },
281
+ {
282
+ "epoch": 0.03707448601280755,
283
+ "eval_loss": 3.3581483364105225,
284
+ "eval_runtime": 15.3044,
285
+ "eval_samples_per_second": 622.502,
286
+ "eval_steps_per_second": 0.653,
287
+ "step": 550
288
+ },
289
+ {
290
+ "epoch": 0.03774856757667678,
291
+ "grad_norm": 0.47265625,
292
+ "learning_rate": 0.0007,
293
+ "loss": 3.347300720214844,
294
+ "step": 560
295
+ },
296
+ {
297
+ "epoch": 0.03909673070441524,
298
+ "grad_norm": 0.458984375,
299
+ "learning_rate": 0.0007,
300
+ "loss": 3.2885902404785154,
301
+ "step": 580
302
+ },
303
+ {
304
+ "epoch": 0.04044489383215369,
305
+ "grad_norm": 0.4375,
306
+ "learning_rate": 0.0007,
307
+ "loss": 3.25723876953125,
308
+ "step": 600
309
+ },
310
+ {
311
+ "epoch": 0.04044489383215369,
312
+ "eval_loss": 3.2229573726654053,
313
+ "eval_runtime": 15.2967,
314
+ "eval_samples_per_second": 622.812,
315
+ "eval_steps_per_second": 0.654,
316
+ "step": 600
317
+ },
318
+ {
319
+ "epoch": 0.04179305695989215,
320
+ "grad_norm": 0.458984375,
321
+ "learning_rate": 0.0007,
322
+ "loss": 3.1902334213256838,
323
+ "step": 620
324
+ },
325
+ {
326
+ "epoch": 0.043141220087630605,
327
+ "grad_norm": 0.40625,
328
+ "learning_rate": 0.0007,
329
+ "loss": 3.167861557006836,
330
+ "step": 640
331
+ },
332
+ {
333
+ "epoch": 0.043815301651499834,
334
+ "eval_loss": 3.120636463165283,
335
+ "eval_runtime": 15.3751,
336
+ "eval_samples_per_second": 619.639,
337
+ "eval_steps_per_second": 0.65,
338
+ "step": 650
339
+ },
340
+ {
341
+ "epoch": 0.044489383215369056,
342
+ "grad_norm": 0.494140625,
343
+ "learning_rate": 0.0007,
344
+ "loss": 3.1089324951171875,
345
+ "step": 660
346
+ },
347
+ {
348
+ "epoch": 0.045837546343107514,
349
+ "grad_norm": 0.435546875,
350
+ "learning_rate": 0.0007,
351
+ "loss": 3.0828268051147463,
352
+ "step": 680
353
+ },
354
+ {
355
+ "epoch": 0.04718570947084597,
356
+ "grad_norm": 0.427734375,
357
+ "learning_rate": 0.0007,
358
+ "loss": 3.0396488189697264,
359
+ "step": 700
360
+ },
361
+ {
362
+ "epoch": 0.04718570947084597,
363
+ "eval_loss": 3.0276408195495605,
364
+ "eval_runtime": 15.2735,
365
+ "eval_samples_per_second": 623.761,
366
+ "eval_steps_per_second": 0.655,
367
+ "step": 700
368
+ },
369
+ {
370
+ "epoch": 0.04853387259858443,
371
+ "grad_norm": 0.4375,
372
+ "learning_rate": 0.0007,
373
+ "loss": 3.0034805297851563,
374
+ "step": 720
375
+ },
376
+ {
377
+ "epoch": 0.04988203572632288,
378
+ "grad_norm": 0.52734375,
379
+ "learning_rate": 0.0007,
380
+ "loss": 2.96556396484375,
381
+ "step": 740
382
+ },
383
+ {
384
+ "epoch": 0.05055611729019211,
385
+ "eval_loss": 2.950009346008301,
386
+ "eval_runtime": 15.243,
387
+ "eval_samples_per_second": 625.009,
388
+ "eval_steps_per_second": 0.656,
389
+ "step": 750
390
+ },
391
+ {
392
+ "epoch": 0.05123019885406134,
393
+ "grad_norm": 0.451171875,
394
+ "learning_rate": 0.0007,
395
+ "loss": 2.950779151916504,
396
+ "step": 760
397
+ },
398
+ {
399
+ "epoch": 0.0525783619817998,
400
+ "grad_norm": 0.400390625,
401
+ "learning_rate": 0.0007,
402
+ "loss": 2.956203079223633,
403
+ "step": 780
404
+ },
405
+ {
406
+ "epoch": 0.053926525109538256,
407
+ "grad_norm": 0.40625,
408
+ "learning_rate": 0.0007,
409
+ "loss": 2.9017578125,
410
+ "step": 800
411
+ },
412
+ {
413
+ "epoch": 0.053926525109538256,
414
+ "eval_loss": 2.8844006061553955,
415
+ "eval_runtime": 15.2903,
416
+ "eval_samples_per_second": 623.073,
417
+ "eval_steps_per_second": 0.654,
418
+ "step": 800
419
+ },
420
+ {
421
+ "epoch": 0.05527468823727671,
422
+ "grad_norm": 0.41015625,
423
+ "learning_rate": 0.0007,
424
+ "loss": 2.887515640258789,
425
+ "step": 820
426
+ },
427
+ {
428
+ "epoch": 0.056622851365015166,
429
+ "grad_norm": 0.41796875,
430
+ "learning_rate": 0.0007,
431
+ "loss": 2.8556928634643555,
432
+ "step": 840
433
+ },
434
+ {
435
+ "epoch": 0.057296932928884395,
436
+ "eval_loss": 2.821610450744629,
437
+ "eval_runtime": 15.2253,
438
+ "eval_samples_per_second": 625.733,
439
+ "eval_steps_per_second": 0.657,
440
+ "step": 850
441
+ },
442
+ {
443
+ "epoch": 0.057971014492753624,
444
+ "grad_norm": 0.423828125,
445
+ "learning_rate": 0.0007,
446
+ "loss": 2.8130855560302734,
447
+ "step": 860
448
+ },
449
+ {
450
+ "epoch": 0.05931917762049208,
451
+ "grad_norm": 0.38671875,
452
+ "learning_rate": 0.0007,
453
+ "loss": 2.790329170227051,
454
+ "step": 880
455
+ },
456
+ {
457
+ "epoch": 0.06066734074823053,
458
+ "grad_norm": 0.427734375,
459
+ "learning_rate": 0.0007,
460
+ "loss": 2.7760162353515625,
461
+ "step": 900
462
+ },
463
+ {
464
+ "epoch": 0.06066734074823053,
465
+ "eval_loss": 2.7661373615264893,
466
+ "eval_runtime": 15.2736,
467
+ "eval_samples_per_second": 623.755,
468
+ "eval_steps_per_second": 0.655,
469
+ "step": 900
470
+ },
471
+ {
472
+ "epoch": 0.06201550387596899,
473
+ "grad_norm": 0.435546875,
474
+ "learning_rate": 0.0007,
475
+ "loss": 2.7462047576904296,
476
+ "step": 920
477
+ },
478
+ {
479
+ "epoch": 0.06336366700370745,
480
+ "grad_norm": 0.4140625,
481
+ "learning_rate": 0.0007,
482
+ "loss": 2.732274627685547,
483
+ "step": 940
484
+ },
485
+ {
486
+ "epoch": 0.06403774856757667,
487
+ "eval_loss": 2.713942289352417,
488
+ "eval_runtime": 15.6062,
489
+ "eval_samples_per_second": 610.463,
490
+ "eval_steps_per_second": 0.641,
491
+ "step": 950
492
+ },
493
+ {
494
+ "epoch": 0.06471183013144591,
495
+ "grad_norm": 0.419921875,
496
+ "learning_rate": 0.0007,
497
+ "loss": 2.705318069458008,
498
+ "step": 960
499
+ },
500
+ {
501
+ "epoch": 0.06605999325918437,
502
+ "grad_norm": 0.4296875,
503
+ "learning_rate": 0.0007,
504
+ "loss": 2.6892818450927733,
505
+ "step": 980
506
+ },
507
+ {
508
+ "epoch": 0.06740815638692282,
509
+ "grad_norm": 0.4453125,
510
+ "learning_rate": 0.0007,
511
+ "loss": 2.687115287780762,
512
+ "step": 1000
513
+ },
514
+ {
515
+ "epoch": 0.06740815638692282,
516
+ "eval_loss": 2.668647289276123,
517
+ "eval_runtime": 15.2597,
518
+ "eval_samples_per_second": 624.326,
519
+ "eval_steps_per_second": 0.655,
520
+ "step": 1000
521
+ },
522
+ {
523
+ "epoch": 0.06875631951466127,
524
+ "grad_norm": 0.388671875,
525
+ "learning_rate": 0.0007,
526
+ "loss": 2.6533071517944338,
527
+ "step": 1020
528
+ },
529
+ {
530
+ "epoch": 0.07010448264239973,
531
+ "grad_norm": 0.392578125,
532
+ "learning_rate": 0.0007,
533
+ "loss": 2.6390922546386717,
534
+ "step": 1040
535
+ },
536
+ {
537
+ "epoch": 0.07077856420626896,
538
+ "eval_loss": 2.6291816234588623,
539
+ "eval_runtime": 15.2457,
540
+ "eval_samples_per_second": 624.896,
541
+ "eval_steps_per_second": 0.656,
542
+ "step": 1050
543
+ },
544
+ {
545
+ "epoch": 0.07145264577013818,
546
+ "grad_norm": 0.4375,
547
+ "learning_rate": 0.0007,
548
+ "loss": 2.624461555480957,
549
+ "step": 1060
550
+ },
551
+ {
552
+ "epoch": 0.07280080889787664,
553
+ "grad_norm": 0.396484375,
554
+ "learning_rate": 0.0007,
555
+ "loss": 2.6044427871704103,
556
+ "step": 1080
557
+ },
558
+ {
559
+ "epoch": 0.0741489720256151,
560
+ "grad_norm": 0.423828125,
561
+ "learning_rate": 0.0007,
562
+ "loss": 2.597646713256836,
563
+ "step": 1100
564
+ },
565
+ {
566
+ "epoch": 0.0741489720256151,
567
+ "eval_loss": 2.589696168899536,
568
+ "eval_runtime": 15.3967,
569
+ "eval_samples_per_second": 618.768,
570
+ "eval_steps_per_second": 0.649,
571
+ "step": 1100
572
+ },
573
+ {
574
+ "epoch": 0.07549713515335356,
575
+ "grad_norm": 0.369140625,
576
+ "learning_rate": 0.0007,
577
+ "loss": 2.561947250366211,
578
+ "step": 1120
579
+ },
580
+ {
581
+ "epoch": 0.07684529828109202,
582
+ "grad_norm": 0.390625,
583
+ "learning_rate": 0.0007,
584
+ "loss": 2.54862117767334,
585
+ "step": 1140
586
+ },
587
+ {
588
+ "epoch": 0.07751937984496124,
589
+ "eval_loss": 2.559185743331909,
590
+ "eval_runtime": 15.2877,
591
+ "eval_samples_per_second": 623.181,
592
+ "eval_steps_per_second": 0.654,
593
+ "step": 1150
594
+ },
595
+ {
596
+ "epoch": 0.07819346140883048,
597
+ "grad_norm": 0.37890625,
598
+ "learning_rate": 0.0007,
599
+ "loss": 2.5469717025756835,
600
+ "step": 1160
601
+ },
602
+ {
603
+ "epoch": 0.07954162453656892,
604
+ "grad_norm": 0.400390625,
605
+ "learning_rate": 0.0007,
606
+ "loss": 2.540451240539551,
607
+ "step": 1180
608
+ },
609
+ {
610
+ "epoch": 0.08088978766430738,
611
+ "grad_norm": 0.40625,
612
+ "learning_rate": 0.0007,
613
+ "loss": 2.53134708404541,
614
+ "step": 1200
615
+ },
616
+ {
617
+ "epoch": 0.08088978766430738,
618
+ "eval_loss": 2.521665096282959,
619
+ "eval_runtime": 15.2822,
620
+ "eval_samples_per_second": 623.407,
621
+ "eval_steps_per_second": 0.654,
622
+ "step": 1200
623
+ },
624
+ {
625
+ "epoch": 0.08223795079204584,
626
+ "grad_norm": 0.37109375,
627
+ "learning_rate": 0.0007,
628
+ "loss": 2.513539123535156,
629
+ "step": 1220
630
+ },
631
+ {
632
+ "epoch": 0.0835861139197843,
633
+ "grad_norm": 0.36328125,
634
+ "learning_rate": 0.0007,
635
+ "loss": 2.5009738922119142,
636
+ "step": 1240
637
+ },
638
+ {
639
+ "epoch": 0.08426019548365352,
640
+ "eval_loss": 2.489459753036499,
641
+ "eval_runtime": 15.2493,
642
+ "eval_samples_per_second": 624.749,
643
+ "eval_steps_per_second": 0.656,
644
+ "step": 1250
645
+ },
646
+ {
647
+ "epoch": 0.08493427704752275,
648
+ "grad_norm": 0.388671875,
649
+ "learning_rate": 0.0007,
650
+ "loss": 2.4894077301025392,
651
+ "step": 1260
652
+ },
653
+ {
654
+ "epoch": 0.08628244017526121,
655
+ "grad_norm": 0.369140625,
656
+ "learning_rate": 0.0007,
657
+ "loss": 2.4697439193725588,
658
+ "step": 1280
659
+ },
660
+ {
661
+ "epoch": 0.08763060330299967,
662
+ "grad_norm": 0.423828125,
663
+ "learning_rate": 0.0007,
664
+ "loss": 2.461294174194336,
665
+ "step": 1300
666
+ },
667
+ {
668
+ "epoch": 0.08763060330299967,
669
+ "eval_loss": 2.4627816677093506,
670
+ "eval_runtime": 15.421,
671
+ "eval_samples_per_second": 617.795,
672
+ "eval_steps_per_second": 0.648,
673
+ "step": 1300
674
+ },
675
+ {
676
+ "epoch": 0.08897876643073811,
677
+ "grad_norm": 0.36328125,
678
+ "learning_rate": 0.0007,
679
+ "loss": 2.452680206298828,
680
+ "step": 1320
681
+ },
682
+ {
683
+ "epoch": 0.09032692955847657,
684
+ "grad_norm": 0.404296875,
685
+ "learning_rate": 0.0007,
686
+ "loss": 2.4396684646606444,
687
+ "step": 1340
688
+ },
689
+ {
690
+ "epoch": 0.0910010111223458,
691
+ "eval_loss": 2.437220335006714,
692
+ "eval_runtime": 15.3026,
693
+ "eval_samples_per_second": 622.576,
694
+ "eval_steps_per_second": 0.653,
695
+ "step": 1350
696
+ },
697
+ {
698
+ "epoch": 0.09167509268621503,
699
+ "grad_norm": 0.412109375,
700
+ "learning_rate": 0.0007,
701
+ "loss": 2.4397760391235352,
702
+ "step": 1360
703
+ },
704
+ {
705
+ "epoch": 0.09302325581395349,
706
+ "grad_norm": 0.353515625,
707
+ "learning_rate": 0.0007,
708
+ "loss": 2.4158536911010744,
709
+ "step": 1380
710
+ },
711
+ {
712
+ "epoch": 0.09437141894169195,
713
+ "grad_norm": 0.345703125,
714
+ "learning_rate": 0.0007,
715
+ "loss": 2.406942367553711,
716
+ "step": 1400
717
+ },
718
+ {
719
+ "epoch": 0.09437141894169195,
720
+ "eval_loss": 2.4096601009368896,
721
+ "eval_runtime": 15.357,
722
+ "eval_samples_per_second": 620.368,
723
+ "eval_steps_per_second": 0.651,
724
+ "step": 1400
725
+ },
726
+ {
727
+ "epoch": 0.0957195820694304,
728
+ "grad_norm": 0.36328125,
729
+ "learning_rate": 0.0007,
730
+ "loss": 2.4161144256591798,
731
+ "step": 1420
732
+ },
733
+ {
734
+ "epoch": 0.09706774519716886,
735
+ "grad_norm": 0.36328125,
736
+ "learning_rate": 0.0007,
737
+ "loss": 2.392984390258789,
738
+ "step": 1440
739
+ },
740
+ {
741
+ "epoch": 0.09774182676103808,
742
+ "eval_loss": 2.3937113285064697,
743
+ "eval_runtime": 15.3555,
744
+ "eval_samples_per_second": 620.43,
745
+ "eval_steps_per_second": 0.651,
746
+ "step": 1450
747
+ },
748
+ {
749
+ "epoch": 0.09841590832490732,
750
+ "grad_norm": 0.384765625,
751
+ "learning_rate": 0.0007,
752
+ "loss": 2.3820331573486326,
753
+ "step": 1460
754
+ },
755
+ {
756
+ "epoch": 0.09976407145264576,
757
+ "grad_norm": 0.33984375,
758
+ "learning_rate": 0.0007,
759
+ "loss": 2.3687986373901366,
760
+ "step": 1480
761
+ },
762
+ {
763
+ "epoch": 0.10111223458038422,
764
+ "grad_norm": 0.38671875,
765
+ "learning_rate": 0.0007,
766
+ "loss": 2.355032730102539,
767
+ "step": 1500
768
+ },
769
+ {
770
+ "epoch": 0.10111223458038422,
771
+ "eval_loss": 2.3681657314300537,
772
+ "eval_runtime": 15.3336,
773
+ "eval_samples_per_second": 621.317,
774
+ "eval_steps_per_second": 0.652,
775
+ "step": 1500
776
+ },
777
+ {
778
+ "epoch": 0.10246039770812268,
779
+ "grad_norm": 0.392578125,
780
+ "learning_rate": 0.0007,
781
+ "loss": 2.3572179794311525,
782
+ "step": 1520
783
+ },
784
+ {
785
+ "epoch": 0.10380856083586114,
786
+ "grad_norm": 0.35546875,
787
+ "learning_rate": 0.0007,
788
+ "loss": 2.345840835571289,
789
+ "step": 1540
790
+ },
791
+ {
792
+ "epoch": 0.10448264239973036,
793
+ "eval_loss": 2.3475193977355957,
794
+ "eval_runtime": 15.3453,
795
+ "eval_samples_per_second": 620.842,
796
+ "eval_steps_per_second": 0.652,
797
+ "step": 1550
798
+ },
799
+ {
800
+ "epoch": 0.1051567239635996,
801
+ "grad_norm": 0.388671875,
802
+ "learning_rate": 0.0007,
803
+ "loss": 2.335231971740723,
804
+ "step": 1560
805
+ },
806
+ {
807
+ "epoch": 0.10650488709133805,
808
+ "grad_norm": 0.359375,
809
+ "learning_rate": 0.0007,
810
+ "loss": 2.3543283462524416,
811
+ "step": 1580
812
+ },
813
+ {
814
+ "epoch": 0.10785305021907651,
815
+ "grad_norm": 0.39453125,
816
+ "learning_rate": 0.0007,
817
+ "loss": 2.3237049102783205,
818
+ "step": 1600
819
+ },
820
+ {
821
+ "epoch": 0.10785305021907651,
822
+ "eval_loss": 2.3377676010131836,
823
+ "eval_runtime": 15.2858,
824
+ "eval_samples_per_second": 623.259,
825
+ "eval_steps_per_second": 0.654,
826
+ "step": 1600
827
+ },
828
+ {
829
+ "epoch": 0.10920121334681497,
830
+ "grad_norm": 0.357421875,
831
+ "learning_rate": 0.0007,
832
+ "loss": 2.3196277618408203,
833
+ "step": 1620
834
+ },
835
+ {
836
+ "epoch": 0.11054937647455342,
837
+ "grad_norm": 0.341796875,
838
+ "learning_rate": 0.0007,
839
+ "loss": 2.3308162689208984,
840
+ "step": 1640
841
+ },
842
+ {
843
+ "epoch": 0.11122345803842265,
844
+ "eval_loss": 2.313627004623413,
845
+ "eval_runtime": 15.276,
846
+ "eval_samples_per_second": 623.659,
847
+ "eval_steps_per_second": 0.655,
848
+ "step": 1650
849
+ },
850
+ {
851
+ "epoch": 0.11189753960229187,
852
+ "grad_norm": 0.353515625,
853
+ "learning_rate": 0.0007,
854
+ "loss": 2.3104904174804686,
855
+ "step": 1660
856
+ },
857
+ {
858
+ "epoch": 0.11324570273003033,
859
+ "grad_norm": 0.353515625,
860
+ "learning_rate": 0.0007,
861
+ "loss": 2.2955816268920897,
862
+ "step": 1680
863
+ },
864
+ {
865
+ "epoch": 0.11459386585776879,
866
+ "grad_norm": 0.345703125,
867
+ "learning_rate": 0.0007,
868
+ "loss": 2.3044401168823243,
869
+ "step": 1700
870
+ },
871
+ {
872
+ "epoch": 0.11459386585776879,
873
+ "eval_loss": 2.2976956367492676,
874
+ "eval_runtime": 15.3404,
875
+ "eval_samples_per_second": 621.039,
876
+ "eval_steps_per_second": 0.652,
877
+ "step": 1700
878
+ },
879
+ {
880
+ "epoch": 0.11594202898550725,
881
+ "grad_norm": 0.373046875,
882
+ "learning_rate": 0.0007,
883
+ "loss": 2.280081939697266,
884
+ "step": 1720
885
+ },
886
+ {
887
+ "epoch": 0.1172901921132457,
888
+ "grad_norm": 0.373046875,
889
+ "learning_rate": 0.0007,
890
+ "loss": 2.269576644897461,
891
+ "step": 1740
892
+ },
893
+ {
894
+ "epoch": 0.11796427367711493,
895
+ "eval_loss": 2.28181791305542,
896
+ "eval_runtime": 15.2137,
897
+ "eval_samples_per_second": 626.211,
898
+ "eval_steps_per_second": 0.657,
899
+ "step": 1750
900
+ },
901
+ {
902
+ "epoch": 0.11863835524098416,
903
+ "grad_norm": 0.359375,
904
+ "learning_rate": 0.0007,
905
+ "loss": 2.273081398010254,
906
+ "step": 1760
907
+ },
908
+ {
909
+ "epoch": 0.11998651836872262,
910
+ "grad_norm": 0.345703125,
911
+ "learning_rate": 0.0007,
912
+ "loss": 2.2877025604248047,
913
+ "step": 1780
914
+ },
915
+ {
916
+ "epoch": 0.12133468149646107,
917
+ "grad_norm": 0.3671875,
918
+ "learning_rate": 0.0007,
919
+ "loss": 2.2828989028930664,
920
+ "step": 1800
921
+ },
922
+ {
923
+ "epoch": 0.12133468149646107,
924
+ "eval_loss": 2.2671334743499756,
925
+ "eval_runtime": 15.1615,
926
+ "eval_samples_per_second": 628.369,
927
+ "eval_steps_per_second": 0.66,
928
+ "step": 1800
929
+ },
930
+ {
931
+ "epoch": 0.12268284462419952,
932
+ "grad_norm": 0.388671875,
933
+ "learning_rate": 0.0007,
934
+ "loss": 2.2743486404418944,
935
+ "step": 1820
936
+ },
937
+ {
938
+ "epoch": 0.12403100775193798,
939
+ "grad_norm": 0.3671875,
940
+ "learning_rate": 0.0007,
941
+ "loss": 2.2429489135742187,
942
+ "step": 1840
943
+ },
944
+ {
945
+ "epoch": 0.12470508931580722,
946
+ "eval_loss": 2.252441644668579,
947
+ "eval_runtime": 15.3255,
948
+ "eval_samples_per_second": 621.643,
949
+ "eval_steps_per_second": 0.653,
950
+ "step": 1850
951
+ },
952
+ {
953
+ "epoch": 0.12537917087967643,
954
+ "grad_norm": 0.33984375,
955
+ "learning_rate": 0.0007,
956
+ "loss": 2.242429733276367,
957
+ "step": 1860
958
+ },
959
+ {
960
+ "epoch": 0.1267273340074149,
961
+ "grad_norm": 0.353515625,
962
+ "learning_rate": 0.0007,
963
+ "loss": 2.2348007202148437,
964
+ "step": 1880
965
+ },
966
+ {
967
+ "epoch": 0.12807549713515334,
968
+ "grad_norm": 0.330078125,
969
+ "learning_rate": 0.0007,
970
+ "loss": 2.241002655029297,
971
+ "step": 1900
972
+ },
973
+ {
974
+ "epoch": 0.12807549713515334,
975
+ "eval_loss": 2.2387285232543945,
976
+ "eval_runtime": 15.2942,
977
+ "eval_samples_per_second": 622.915,
978
+ "eval_steps_per_second": 0.654,
979
+ "step": 1900
980
+ },
981
+ {
982
+ "epoch": 0.12942366026289182,
983
+ "grad_norm": 0.34765625,
984
+ "learning_rate": 0.0007,
985
+ "loss": 2.2172693252563476,
986
+ "step": 1920
987
+ },
988
+ {
989
+ "epoch": 0.13077182339063026,
990
+ "grad_norm": 0.357421875,
991
+ "learning_rate": 0.0007,
992
+ "loss": 2.2283090591430663,
993
+ "step": 1940
994
+ },
995
+ {
996
+ "epoch": 0.13144590495449948,
997
+ "eval_loss": 2.225919246673584,
998
+ "eval_runtime": 15.3259,
999
+ "eval_samples_per_second": 621.627,
1000
+ "eval_steps_per_second": 0.652,
1001
+ "step": 1950
1002
+ },
1003
+ {
1004
+ "epoch": 0.13211998651836873,
1005
+ "grad_norm": 0.333984375,
1006
+ "learning_rate": 0.0007,
1007
+ "loss": 2.2027830123901366,
1008
+ "step": 1960
1009
+ },
1010
+ {
1011
+ "epoch": 0.13346814964610718,
1012
+ "grad_norm": 0.359375,
1013
+ "learning_rate": 0.0007,
1014
+ "loss": 2.224252128601074,
1015
+ "step": 1980
1016
+ },
1017
+ {
1018
+ "epoch": 0.13481631277384565,
1019
+ "grad_norm": 0.35546875,
1020
+ "learning_rate": 0.0007,
1021
+ "loss": 2.1990388870239257,
1022
+ "step": 2000
1023
+ },
1024
+ {
1025
+ "epoch": 0.13481631277384565,
1026
+ "eval_loss": 2.215721368789673,
1027
+ "eval_runtime": 15.3022,
1028
+ "eval_samples_per_second": 622.59,
1029
+ "eval_steps_per_second": 0.654,
1030
+ "step": 2000
1031
+ },
1032
+ {
1033
+ "epoch": 0.1361644759015841,
1034
+ "grad_norm": 0.345703125,
1035
+ "learning_rate": 0.0007,
1036
+ "loss": 2.207795524597168,
1037
+ "step": 2020
1038
+ },
1039
+ {
1040
+ "epoch": 0.13751263902932254,
1041
+ "grad_norm": 0.396484375,
1042
+ "learning_rate": 0.0007,
1043
+ "loss": 2.1882051467895507,
1044
+ "step": 2040
1045
+ },
1046
+ {
1047
+ "epoch": 0.1381867205931918,
1048
+ "eval_loss": 2.2054405212402344,
1049
+ "eval_runtime": 15.4183,
1050
+ "eval_samples_per_second": 617.904,
1051
+ "eval_steps_per_second": 0.649,
1052
+ "step": 2050
1053
+ },
1054
+ {
1055
+ "epoch": 0.138860802157061,
1056
+ "grad_norm": 0.365234375,
1057
+ "learning_rate": 0.0007,
1058
+ "loss": 2.206527900695801,
1059
+ "step": 2060
1060
+ },
1061
+ {
1062
+ "epoch": 0.14020896528479945,
1063
+ "grad_norm": 0.361328125,
1064
+ "learning_rate": 0.0007,
1065
+ "loss": 2.1837987899780273,
1066
+ "step": 2080
1067
+ },
1068
+ {
1069
+ "epoch": 0.14155712841253792,
1070
+ "grad_norm": 0.33203125,
1071
+ "learning_rate": 0.0007,
1072
+ "loss": 2.1744739532470705,
1073
+ "step": 2100
1074
+ },
1075
+ {
1076
+ "epoch": 0.14155712841253792,
1077
+ "eval_loss": 2.1948788166046143,
1078
+ "eval_runtime": 15.1797,
1079
+ "eval_samples_per_second": 627.615,
1080
+ "eval_steps_per_second": 0.659,
1081
+ "step": 2100
1082
+ },
1083
+ {
1084
+ "epoch": 0.14290529154027637,
1085
+ "grad_norm": 0.361328125,
1086
+ "learning_rate": 0.0007,
1087
+ "loss": 2.182137298583984,
1088
+ "step": 2120
1089
+ },
1090
+ {
1091
+ "epoch": 0.14425345466801484,
1092
+ "grad_norm": 0.337890625,
1093
+ "learning_rate": 0.0007,
1094
+ "loss": 2.1851844787597656,
1095
+ "step": 2140
1096
+ },
1097
+ {
1098
+ "epoch": 0.14492753623188406,
1099
+ "eval_loss": 2.1849257946014404,
1100
+ "eval_runtime": 15.2467,
1101
+ "eval_samples_per_second": 624.858,
1102
+ "eval_steps_per_second": 0.656,
1103
+ "step": 2150
1104
+ },
1105
+ {
1106
+ "epoch": 0.14560161779575329,
1107
+ "grad_norm": 0.3515625,
1108
+ "learning_rate": 0.0007,
1109
+ "loss": 2.1681228637695313,
1110
+ "step": 2160
1111
+ },
1112
+ {
1113
+ "epoch": 0.14694978092349173,
1114
+ "grad_norm": 0.34375,
1115
+ "learning_rate": 0.0007,
1116
+ "loss": 2.1777414321899413,
1117
+ "step": 2180
1118
+ },
1119
+ {
1120
+ "epoch": 0.1482979440512302,
1121
+ "grad_norm": 0.33203125,
1122
+ "learning_rate": 0.0007,
1123
+ "loss": 2.1520442962646484,
1124
+ "step": 2200
1125
+ },
1126
+ {
1127
+ "epoch": 0.1482979440512302,
1128
+ "eval_loss": 2.1730399131774902,
1129
+ "eval_runtime": 15.3329,
1130
+ "eval_samples_per_second": 621.344,
1131
+ "eval_steps_per_second": 0.652,
1132
+ "step": 2200
1133
+ },
1134
+ {
1135
+ "epoch": 0.14964610717896865,
1136
+ "grad_norm": 0.333984375,
1137
+ "learning_rate": 0.0007,
1138
+ "loss": 2.159272384643555,
1139
+ "step": 2220
1140
+ },
1141
+ {
1142
+ "epoch": 0.15099427030670712,
1143
+ "grad_norm": 0.357421875,
1144
+ "learning_rate": 0.0007,
1145
+ "loss": 2.1691991806030275,
1146
+ "step": 2240
1147
+ },
1148
+ {
1149
+ "epoch": 0.15166835187057634,
1150
+ "eval_loss": 2.1636791229248047,
1151
+ "eval_runtime": 15.4687,
1152
+ "eval_samples_per_second": 615.888,
1153
+ "eval_steps_per_second": 0.646,
1154
+ "step": 2250
1155
+ },
1156
+ {
1157
+ "epoch": 0.15234243343444556,
1158
+ "grad_norm": 0.36328125,
1159
+ "learning_rate": 0.0007,
1160
+ "loss": 2.147579383850098,
1161
+ "step": 2260
1162
+ },
1163
+ {
1164
+ "epoch": 0.15369059656218403,
1165
+ "grad_norm": 0.34765625,
1166
+ "learning_rate": 0.0007,
1167
+ "loss": 2.1597997665405275,
1168
+ "step": 2280
1169
+ },
1170
+ {
1171
+ "epoch": 0.15503875968992248,
1172
+ "grad_norm": 0.333984375,
1173
+ "learning_rate": 0.0007,
1174
+ "loss": 2.1413923263549806,
1175
+ "step": 2300
1176
+ },
1177
+ {
1178
+ "epoch": 0.15503875968992248,
1179
+ "eval_loss": 2.1545023918151855,
1180
+ "eval_runtime": 15.4261,
1181
+ "eval_samples_per_second": 617.588,
1182
+ "eval_steps_per_second": 0.648,
1183
+ "step": 2300
1184
+ },
1185
+ {
1186
+ "epoch": 0.15638692281766095,
1187
+ "grad_norm": 0.33203125,
1188
+ "learning_rate": 0.0007,
1189
+ "loss": 2.1491439819335936,
1190
+ "step": 2320
1191
+ },
1192
+ {
1193
+ "epoch": 0.1577350859453994,
1194
+ "grad_norm": 0.33203125,
1195
+ "learning_rate": 0.0007,
1196
+ "loss": 2.137864112854004,
1197
+ "step": 2340
1198
+ },
1199
+ {
1200
+ "epoch": 0.15840916750926862,
1201
+ "eval_loss": 2.145824432373047,
1202
+ "eval_runtime": 15.654,
1203
+ "eval_samples_per_second": 608.599,
1204
+ "eval_steps_per_second": 0.639,
1205
+ "step": 2350
1206
+ },
1207
+ {
1208
+ "epoch": 0.15908324907313784,
1209
+ "grad_norm": 0.326171875,
1210
+ "learning_rate": 0.0007,
1211
+ "loss": 2.1423198699951174,
1212
+ "step": 2360
1213
+ },
1214
+ {
1215
+ "epoch": 0.1604314122008763,
1216
+ "grad_norm": 0.33203125,
1217
+ "learning_rate": 0.0007,
1218
+ "loss": 2.143879699707031,
1219
+ "step": 2380
1220
+ },
1221
+ {
1222
+ "epoch": 0.16177957532861476,
1223
+ "grad_norm": 0.3671875,
1224
+ "learning_rate": 0.0007,
1225
+ "loss": 2.1223339080810546,
1226
+ "step": 2400
1227
+ },
1228
+ {
1229
+ "epoch": 0.16177957532861476,
1230
+ "eval_loss": 2.142425537109375,
1231
+ "eval_runtime": 15.4359,
1232
+ "eval_samples_per_second": 617.196,
1233
+ "eval_steps_per_second": 0.648,
1234
+ "step": 2400
1235
+ },
1236
+ {
1237
+ "epoch": 0.16312773845635323,
1238
+ "grad_norm": 0.341796875,
1239
+ "learning_rate": 0.0007,
1240
+ "loss": 2.1280586242675783,
1241
+ "step": 2420
1242
+ },
1243
+ {
1244
+ "epoch": 0.16447590158409167,
1245
+ "grad_norm": 0.33984375,
1246
+ "learning_rate": 0.0007,
1247
+ "loss": 2.1163003921508787,
1248
+ "step": 2440
1249
+ },
1250
+ {
1251
+ "epoch": 0.1651499831479609,
1252
+ "eval_loss": 2.130929708480835,
1253
+ "eval_runtime": 15.3525,
1254
+ "eval_samples_per_second": 620.55,
1255
+ "eval_steps_per_second": 0.651,
1256
+ "step": 2450
1257
+ },
1258
+ {
1259
+ "epoch": 0.16582406471183014,
1260
+ "grad_norm": 0.326171875,
1261
+ "learning_rate": 0.0007,
1262
+ "loss": 2.1273950576782226,
1263
+ "step": 2460
1264
+ },
1265
+ {
1266
+ "epoch": 0.1671722278395686,
1267
+ "grad_norm": 0.34375,
1268
+ "learning_rate": 0.0007,
1269
+ "loss": 2.129487419128418,
1270
+ "step": 2480
1271
+ },
1272
+ {
1273
+ "epoch": 0.16852039096730703,
1274
+ "grad_norm": 0.328125,
1275
+ "learning_rate": 0.0007,
1276
+ "loss": 2.109725570678711,
1277
+ "step": 2500
1278
+ },
1279
+ {
1280
+ "epoch": 0.16852039096730703,
1281
+ "eval_loss": 2.1222457885742188,
1282
+ "eval_runtime": 15.3726,
1283
+ "eval_samples_per_second": 619.739,
1284
+ "eval_steps_per_second": 0.651,
1285
+ "step": 2500
1286
+ }
1287
+ ],
1288
+ "logging_steps": 20,
1289
+ "max_steps": 2500,
1290
+ "num_input_tokens_seen": 0,
1291
+ "num_train_epochs": 1,
1292
+ "save_steps": 100,
1293
+ "stateful_callbacks": {
1294
+ "TrainerControl": {
1295
+ "args": {
1296
+ "should_epoch_stop": false,
1297
+ "should_evaluate": false,
1298
+ "should_log": false,
1299
+ "should_save": true,
1300
+ "should_training_stop": true
1301
+ },
1302
+ "attributes": {}
1303
+ }
1304
+ },
1305
+ "total_flos": 8065709506560000.0,
1306
+ "train_batch_size": 64,
1307
+ "trial_name": null,
1308
+ "trial_params": null
1309
+ }
zain/Activation/out/glu-silu-100L_run/checkpoint-2500/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fd90512e56f813612dc668676d6f8cab72da110a42f23c61cafebf91064625a1
3
+ size 4920
zain/Activation/out/glu-silu-100L_run/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "silu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 100,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.16.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096,
35
+ "waleed_beta": 10.0
36
+ }
zain/Activation/out/glu-silu-100L_run/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f045fa85b5f282452577f935fd9e86fdb9b94b3442e1820631a0c81d9f1f95c6
3
+ size 33967272
zain/Activation/out/glu-silu-100L_run/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/glu-silu-100L_run/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/glu-silu-100L_run/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fd90512e56f813612dc668676d6f8cab72da110a42f23c61cafebf91064625a1
3
+ size 4920
zain/Activation/out/glu-silu-100L_run/training_log.jsonl CHANGED
@@ -163,3 +163,17 @@
163
  {"step": 2300, "epoch": 0.15503875968992248, "timestamp": 1786571954.7473707, "eval_loss": 2.1545023918151855, "eval_runtime": 15.4261, "eval_samples_per_second": 617.588, "eval_steps_per_second": 0.648, "train/total_time_seconds": 544.8871062174439, "train/time_per_step_avg": 0.23878501038998365, "train/epoch_time_elapsed": 1369.4057754948735, "train/estimated_remaining_minutes": 0.7896914582861506}
164
  {"step": 2320, "epoch": 0.15638692281766095, "timestamp": 1786571960.8122804, "loss": 2.1491439819335936, "grad_norm": 0.33203125, "learning_rate": 0.0007, "train/total_time_seconds": 549.6645726785064, "train/time_per_step_avg": 0.2389586379006505, "train/epoch_time_elapsed": 1375.4706870652735, "train/estimated_remaining_minutes": 0.7107731543256548}
165
  {"step": 2340, "epoch": 0.1577350859453994, "timestamp": 1786571966.612273, "loss": 2.137864112854004, "grad_norm": 0.33203125, "learning_rate": 0.0007, "train/total_time_seconds": 554.4445280842483, "train/time_per_step_avg": 0.23901270151138307, "train/epoch_time_elapsed": 1381.2706793919206, "train/estimated_remaining_minutes": 0.6318456160504254}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
163
  {"step": 2300, "epoch": 0.15503875968992248, "timestamp": 1786571954.7473707, "eval_loss": 2.1545023918151855, "eval_runtime": 15.4261, "eval_samples_per_second": 617.588, "eval_steps_per_second": 0.648, "train/total_time_seconds": 544.8871062174439, "train/time_per_step_avg": 0.23878501038998365, "train/epoch_time_elapsed": 1369.4057754948735, "train/estimated_remaining_minutes": 0.7896914582861506}
164
  {"step": 2320, "epoch": 0.15638692281766095, "timestamp": 1786571960.8122804, "loss": 2.1491439819335936, "grad_norm": 0.33203125, "learning_rate": 0.0007, "train/total_time_seconds": 549.6645726785064, "train/time_per_step_avg": 0.2389586379006505, "train/epoch_time_elapsed": 1375.4706870652735, "train/estimated_remaining_minutes": 0.7107731543256548}
165
  {"step": 2340, "epoch": 0.1577350859453994, "timestamp": 1786571966.612273, "loss": 2.137864112854004, "grad_norm": 0.33203125, "learning_rate": 0.0007, "train/total_time_seconds": 554.4445280842483, "train/time_per_step_avg": 0.23901270151138307, "train/epoch_time_elapsed": 1381.2706793919206, "train/estimated_remaining_minutes": 0.6318456160504254}
166
+ {"step": 2350, "epoch": 0.15840916750926862, "timestamp": 1786571985.1526456, "eval_loss": 2.145824432373047, "eval_runtime": 15.654, "eval_samples_per_second": 608.599, "eval_steps_per_second": 0.639, "train/total_time_seconds": 556.8283236846328, "train/time_per_step_avg": 0.23877111468464135, "train/epoch_time_elapsed": 1399.8110508657992, "train/estimated_remaining_minutes": 0.5923705571113114}
167
+ {"step": 2360, "epoch": 0.15908324907313784, "timestamp": 1786571988.0664167, "loss": 2.1423198699951174, "grad_norm": 0.326171875, "learning_rate": 0.0007, "train/total_time_seconds": 559.2268124930561, "train/time_per_step_avg": 0.2389866068586707, "train/epoch_time_elapsed": 1402.7248232401907, "train/estimated_remaining_minutes": 0.5529078654592362}
168
+ {"step": 2380, "epoch": 0.1604314122008763, "timestamp": 1786571993.8099024, "loss": 2.143879699707031, "grad_norm": 0.33203125, "learning_rate": 0.0007, "train/total_time_seconds": 563.9822333268821, "train/time_per_step_avg": 0.23892352018505336, "train/epoch_time_elapsed": 1408.468309007585, "train/estimated_remaining_minutes": 0.47393464985452277}
169
+ {"step": 2400, "epoch": 0.16177957532861476, "timestamp": 1786571999.6064997, "loss": 2.1223339080810546, "grad_norm": 0.3671875, "learning_rate": 0.0007, "train/total_time_seconds": 568.7588178738952, "train/time_per_step_avg": 0.23871711656451225, "train/epoch_time_elapsed": 1414.2649062387645, "train/estimated_remaining_minutes": 0.3949714013013161}
170
+ {"step": 2400, "epoch": 0.16177957532861476, "timestamp": 1786572015.044009, "eval_loss": 2.142425537109375, "eval_runtime": 15.4359, "eval_samples_per_second": 617.196, "eval_steps_per_second": 0.648, "train/total_time_seconds": 568.7588178738952, "train/time_per_step_avg": 0.23871711656451225, "train/epoch_time_elapsed": 1429.702413905412, "train/estimated_remaining_minutes": 0.3949714013013161}
171
+ {"step": 2420, "epoch": 0.16312773845635323, "timestamp": 1786572021.136019, "loss": 2.1280586242675783, "grad_norm": 0.341796875, "learning_rate": 0.0007, "train/total_time_seconds": 573.538488149643, "train/time_per_step_avg": 0.2387391547113657, "train/epoch_time_elapsed": 1435.794425956905, "train/estimated_remaining_minutes": 0.31599916702459663}
172
+ {"step": 2440, "epoch": 0.16447590158409167, "timestamp": 1786572026.9621944, "loss": 2.1163003921508787, "grad_norm": 0.33984375, "learning_rate": 0.0007, "train/total_time_seconds": 578.3542434461415, "train/time_per_step_avg": 0.23909715361893177, "train/epoch_time_elapsed": 1441.6206013932824, "train/estimated_remaining_minutes": 0.23703042764186127}
173
+ {"step": 2450, "epoch": 0.1651499831479609, "timestamp": 1786572045.1965752, "eval_loss": 2.130929708480835, "eval_runtime": 15.3525, "eval_samples_per_second": 620.55, "eval_steps_per_second": 0.651, "train/total_time_seconds": 580.7406451590359, "train/time_per_step_avg": 0.23912321474403142, "train/epoch_time_elapsed": 1459.8549805395305, "train/estimated_remaining_minutes": 0.19753083168674693}
174
+ {"step": 2460, "epoch": 0.16582406471183014, "timestamp": 1786572048.1221642, "loss": 2.1273950576782226, "grad_norm": 0.326171875, "learning_rate": 0.0007, "train/total_time_seconds": 583.1407674327493, "train/time_per_step_avg": 0.23913954939693213, "train/epoch_time_elapsed": 1462.780570179224, "train/estimated_remaining_minutes": 0.15803272830155807}
175
+ {"step": 2480, "epoch": 0.1671722278395686, "timestamp": 1786572053.8920004, "loss": 2.129487419128418, "grad_norm": 0.34375, "learning_rate": 0.0007, "train/total_time_seconds": 587.9142602346838, "train/time_per_step_avg": 0.2393202690780163, "train/epoch_time_elapsed": 1468.5504074655473, "train/estimated_remaining_minutes": 0.07902073390251126}
176
+ {"step": 2500, "epoch": 0.16852039096730703, "timestamp": 1786572059.68274, "loss": 2.109725570678711, "grad_norm": 0.328125, "learning_rate": 0.0007, "train/total_time_seconds": 592.685107909143, "train/time_per_step_avg": 0.23926290035247802, "train/epoch_time_elapsed": 1474.3411462754011, "train/estimated_remaining_minutes": 0.0}
177
+ {"step": 2500, "epoch": 0.16852039096730703, "timestamp": 1786572075.0569973, "eval_loss": 2.1222457885742188, "eval_runtime": 15.3726, "eval_samples_per_second": 619.739, "eval_steps_per_second": 0.651, "train/total_time_seconds": 592.685107909143, "train/time_per_step_avg": 0.23926290035247802, "train/epoch_time_elapsed": 1489.7154013849795, "train/estimated_remaining_minutes": 0.0}
178
+ {"step": 2500, "epoch": 0.16852039096730703, "timestamp": 1786572075.3533838, "train_runtime": 1491.0291, "train_samples_per_second": 107.308, "train_steps_per_second": 1.677, "total_flos": 8065709506560000.0, "train_loss": 3.075948629760742, "train/total_time_seconds": 592.685107909143, "train/time_per_step_avg": 0.23926290035247802, "train/epoch_time_elapsed": 1490.0117889344692, "train/estimated_remaining_minutes": 0.0}
179
+ {"step": 2500, "epoch": 0.16852039096730703, "timestamp": 1786572090.6925077, "eval_loss": 2.1222457885742188, "eval_runtime": 15.3355, "eval_samples_per_second": 621.239, "eval_steps_per_second": 0.652, "train/total_time_seconds": 592.685107909143, "train/time_per_step_avg": 0.23926290035247802, "train/epoch_time_elapsed": 1505.3509125448763, "train/estimated_remaining_minutes": 0.0}
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 100,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.16.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096,
35
+ "waleed_beta": 10.0
36
+ }
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e849d2aa9701ac2658fd762e3709646c628759e1c8baa34a1eeb6c00a70e9776
3
+ size 33967272
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e4d18f60303922e49bfed23c274dab4db12c630ef3a23a75a6dfecbe2ac9bb88
3
+ size 68504996
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3cf9097d4513154245c48236b6ec5137b7ee2a21c9f58f2cba798ea275c6026f
3
+ size 14244
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3001486ba00eb51d89ef078fe70e7e37535cd4e2311d7dd589266d045c9fb892
3
+ size 1064
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/trainer_state.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.006740815638692282,
6
+ "eval_steps": 50,
7
+ "global_step": 100,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0013481631277384564,
14
+ "grad_norm": 2.125,
15
+ "learning_rate": 2.66e-05,
16
+ "loss": 8.29942626953125,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.002696326255476913,
21
+ "grad_norm": 1.3046875,
22
+ "learning_rate": 5.46e-05,
23
+ "loss": 8.036360168457032,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.003370407819346141,
28
+ "eval_loss": 7.832070827484131,
29
+ "eval_runtime": 15.4822,
30
+ "eval_samples_per_second": 615.352,
31
+ "eval_steps_per_second": 0.646,
32
+ "step": 50
33
+ },
34
+ {
35
+ "epoch": 0.004044489383215369,
36
+ "grad_norm": 1.2734375,
37
+ "learning_rate": 8.259999999999999e-05,
38
+ "loss": 7.834564208984375,
39
+ "step": 60
40
+ },
41
+ {
42
+ "epoch": 0.005392652510953826,
43
+ "grad_norm": 1.265625,
44
+ "learning_rate": 0.0001106,
45
+ "loss": 7.5718849182128904,
46
+ "step": 80
47
+ },
48
+ {
49
+ "epoch": 0.006740815638692282,
50
+ "grad_norm": 1.1953125,
51
+ "learning_rate": 0.0001386,
52
+ "loss": 7.2372383117675785,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.006740815638692282,
57
+ "eval_loss": 7.0443572998046875,
58
+ "eval_runtime": 15.5098,
59
+ "eval_samples_per_second": 614.257,
60
+ "eval_steps_per_second": 0.645,
61
+ "step": 100
62
+ }
63
+ ],
64
+ "logging_steps": 20,
65
+ "max_steps": 2500,
66
+ "num_input_tokens_seen": 0,
67
+ "num_train_epochs": 1,
68
+ "save_steps": 100,
69
+ "stateful_callbacks": {
70
+ "TrainerControl": {
71
+ "args": {
72
+ "should_epoch_stop": false,
73
+ "should_evaluate": false,
74
+ "should_log": false,
75
+ "should_save": true,
76
+ "should_training_stop": false
77
+ },
78
+ "attributes": {}
79
+ }
80
+ },
81
+ "total_flos": 322628380262400.0,
82
+ "train_batch_size": 64,
83
+ "trial_name": null,
84
+ "trial_params": null
85
+ }
zain/Activation/out/glu-waleed10-100L_run/checkpoint-100/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:95042bce3268a58e39bf6898ae4dc3d7f41ae0258221813fdf6720b6f7599e44
3
+ size 4920
zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "waleed10",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "glu",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 100,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 10000.0,
28
+ "rope_type": "default"
29
+ },
30
+ "tie_word_embeddings": true,
31
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
32
+ "transformers_version": "5.16.0.dev0",
33
+ "use_cache": false,
34
+ "vocab_size": 4096,
35
+ "waleed_beta": 10.0
36
+ }
zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0d1fa8cb579eecffad489fd4cec7e2a3d9d3fe35881a7cc2399dc4ac53186207
3
+ size 33967272
zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c59b0e8734f31cdf307508221b8cd33e3928c5a4fc4e7ec93316f115d367fdc4
3
+ size 68504996
zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ecefbb3f17bb76b6655eb0157c98b5287c17fa4b4c72a6b9068b0823ce9fd18d
3
+ size 14244
zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:28668eba09299968c820a8f82f4368de9f79bd22806c6be52cebe6b8700b6584
3
+ size 1064
zain/Activation/out/glu-waleed10-100L_run/checkpoint-200/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff