w-ahmad commited on
Commit
cd2f632
·
verified ·
1 Parent(s): 234f923

Auto upload zain 2026-08-20T23:29:28.088837 (part 2)

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/model.safetensors +3 -0
  2. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/optimizer.pt +3 -0
  3. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/rng_state.pth +3 -0
  4. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/scheduler.pt +3 -0
  5. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/tokenizer.json +0 -0
  6. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/tokenizer_config.json +13 -0
  7. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/trainer_state.json +894 -0
  8. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/training_args.bin +3 -0
  9. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/config.json +37 -0
  10. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/model.safetensors +3 -0
  11. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/optimizer.pt +3 -0
  12. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/rng_state.pth +3 -0
  13. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/scheduler.pt +3 -0
  14. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/tokenizer.json +0 -0
  15. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/tokenizer_config.json +13 -0
  16. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/trainer_state.json +937 -0
  17. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/training_args.bin +3 -0
  18. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/config.json +37 -0
  19. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/model.safetensors +3 -0
  20. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/optimizer.pt +3 -0
  21. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/rng_state.pth +3 -0
  22. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/scheduler.pt +3 -0
  23. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/tokenizer.json +0 -0
  24. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/tokenizer_config.json +13 -0
  25. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/trainer_state.json +980 -0
  26. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/training_args.bin +3 -0
  27. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/config.json +37 -0
  28. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/model.safetensors +3 -0
  29. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/optimizer.pt +3 -0
  30. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/rng_state.pth +3 -0
  31. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/scheduler.pt +3 -0
  32. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/tokenizer.json +0 -0
  33. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/tokenizer_config.json +13 -0
  34. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/trainer_state.json +1023 -0
  35. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/training_args.bin +3 -0
  36. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/config.json +37 -0
  37. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/model.safetensors +3 -0
  38. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/optimizer.pt +3 -0
  39. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/rng_state.pth +3 -0
  40. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/scheduler.pt +3 -0
  41. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/tokenizer.json +0 -0
  42. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/tokenizer_config.json +13 -0
  43. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/trainer_state.json +1066 -0
  44. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/training_args.bin +3 -0
  45. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/config.json +37 -0
  46. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/model.safetensors +3 -0
  47. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/optimizer.pt +3 -0
  48. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/rng_state.pth +3 -0
  49. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/scheduler.pt +3 -0
  50. zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/tokenizer.json +0 -0
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ebdc3d1268f9aca9cdfcf3b91c4b79ddf61f9eff3403c03bf3235306049bb9e9
3
+ size 4010544
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0f23d734b75fe871a7dda809ea71ae896af619d940f35f6487be7e4c3b3cbada
3
+ size 8068282
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:645b71843375baf4cc10bc75a2f0f04e91b8e3f8e8929f518a87022898b3bc20
3
+ size 14244
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:56cab430bf2883ab08ecdb0930091aaa86b7be034aaf50147f79e0060e5cbc6c
3
+ size 1064
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/trainer_state.json ADDED
@@ -0,0 +1,894 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.06740815638692282,
6
+ "eval_steps": 100,
7
+ "global_step": 2000,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0006740815638692282,
14
+ "grad_norm": 2.71875,
15
+ "learning_rate": 1.14e-05,
16
+ "loss": 8.314944458007812,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0013481631277384564,
21
+ "grad_norm": 1.8515625,
22
+ "learning_rate": 2.34e-05,
23
+ "loss": 8.251383972167968,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.0020222446916076846,
28
+ "grad_norm": 1.3203125,
29
+ "learning_rate": 3.539999999999999e-05,
30
+ "loss": 8.104505920410157,
31
+ "step": 60
32
+ },
33
+ {
34
+ "epoch": 0.002696326255476913,
35
+ "grad_norm": 1.296875,
36
+ "learning_rate": 4.7399999999999993e-05,
37
+ "loss": 7.968361663818359,
38
+ "step": 80
39
+ },
40
+ {
41
+ "epoch": 0.003370407819346141,
42
+ "grad_norm": 1.2578125,
43
+ "learning_rate": 5.94e-05,
44
+ "loss": 7.804827880859375,
45
+ "step": 100
46
+ },
47
+ {
48
+ "epoch": 0.003370407819346141,
49
+ "eval_loss": 7.703802585601807,
50
+ "eval_runtime": 8.0325,
51
+ "eval_samples_per_second": 1186.059,
52
+ "eval_steps_per_second": 0.871,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.004044489383215369,
57
+ "grad_norm": 1.2734375,
58
+ "learning_rate": 7.139999999999999e-05,
59
+ "loss": 7.600141906738282,
60
+ "step": 120
61
+ },
62
+ {
63
+ "epoch": 0.0047185709470845974,
64
+ "grad_norm": 1.265625,
65
+ "learning_rate": 8.34e-05,
66
+ "loss": 7.368203735351562,
67
+ "step": 140
68
+ },
69
+ {
70
+ "epoch": 0.005392652510953826,
71
+ "grad_norm": 1.265625,
72
+ "learning_rate": 9.539999999999999e-05,
73
+ "loss": 7.133045196533203,
74
+ "step": 160
75
+ },
76
+ {
77
+ "epoch": 0.006066734074823054,
78
+ "grad_norm": 1.203125,
79
+ "learning_rate": 0.00010739999999999998,
80
+ "loss": 6.885277557373047,
81
+ "step": 180
82
+ },
83
+ {
84
+ "epoch": 0.006740815638692282,
85
+ "grad_norm": 1.15625,
86
+ "learning_rate": 0.0001194,
87
+ "loss": 6.629558563232422,
88
+ "step": 200
89
+ },
90
+ {
91
+ "epoch": 0.006740815638692282,
92
+ "eval_loss": 6.4997687339782715,
93
+ "eval_runtime": 7.9479,
94
+ "eval_samples_per_second": 1198.683,
95
+ "eval_steps_per_second": 0.881,
96
+ "step": 200
97
+ },
98
+ {
99
+ "epoch": 0.00741489720256151,
100
+ "grad_norm": 1.109375,
101
+ "learning_rate": 0.0001314,
102
+ "loss": 6.391195297241211,
103
+ "step": 220
104
+ },
105
+ {
106
+ "epoch": 0.008088978766430738,
107
+ "grad_norm": 1.21875,
108
+ "learning_rate": 0.0001434,
109
+ "loss": 6.139227676391601,
110
+ "step": 240
111
+ },
112
+ {
113
+ "epoch": 0.008763060330299966,
114
+ "grad_norm": 1.0625,
115
+ "learning_rate": 0.00015539999999999998,
116
+ "loss": 5.917041778564453,
117
+ "step": 260
118
+ },
119
+ {
120
+ "epoch": 0.009437141894169195,
121
+ "grad_norm": 1.1015625,
122
+ "learning_rate": 0.0001674,
123
+ "loss": 5.702054595947265,
124
+ "step": 280
125
+ },
126
+ {
127
+ "epoch": 0.010111223458038422,
128
+ "grad_norm": 0.921875,
129
+ "learning_rate": 0.00017939999999999997,
130
+ "loss": 5.500263214111328,
131
+ "step": 300
132
+ },
133
+ {
134
+ "epoch": 0.010111223458038422,
135
+ "eval_loss": 5.393505573272705,
136
+ "eval_runtime": 8.0449,
137
+ "eval_samples_per_second": 1184.223,
138
+ "eval_steps_per_second": 0.87,
139
+ "step": 300
140
+ },
141
+ {
142
+ "epoch": 0.010785305021907651,
143
+ "grad_norm": 2.5,
144
+ "learning_rate": 0.0001914,
145
+ "loss": 5.319306182861328,
146
+ "step": 320
147
+ },
148
+ {
149
+ "epoch": 0.011459386585776879,
150
+ "grad_norm": 1.078125,
151
+ "learning_rate": 0.00020339999999999998,
152
+ "loss": 5.202053070068359,
153
+ "step": 340
154
+ },
155
+ {
156
+ "epoch": 0.012133468149646108,
157
+ "grad_norm": 1.3203125,
158
+ "learning_rate": 0.00021539999999999998,
159
+ "loss": 5.020883941650391,
160
+ "step": 360
161
+ },
162
+ {
163
+ "epoch": 0.012807549713515335,
164
+ "grad_norm": 1.1171875,
165
+ "learning_rate": 0.00022739999999999997,
166
+ "loss": 4.873059844970703,
167
+ "step": 380
168
+ },
169
+ {
170
+ "epoch": 0.013481631277384564,
171
+ "grad_norm": 1.234375,
172
+ "learning_rate": 0.0002394,
173
+ "loss": 4.741780853271484,
174
+ "step": 400
175
+ },
176
+ {
177
+ "epoch": 0.013481631277384564,
178
+ "eval_loss": 4.676144123077393,
179
+ "eval_runtime": 8.0457,
180
+ "eval_samples_per_second": 1184.113,
181
+ "eval_steps_per_second": 0.87,
182
+ "step": 400
183
+ },
184
+ {
185
+ "epoch": 0.014155712841253791,
186
+ "grad_norm": 1.3046875,
187
+ "learning_rate": 0.0002514,
188
+ "loss": 4.606548690795899,
189
+ "step": 420
190
+ },
191
+ {
192
+ "epoch": 0.01482979440512302,
193
+ "grad_norm": 1.2578125,
194
+ "learning_rate": 0.00026339999999999995,
195
+ "loss": 4.515376281738281,
196
+ "step": 440
197
+ },
198
+ {
199
+ "epoch": 0.015503875968992248,
200
+ "grad_norm": 1.0625,
201
+ "learning_rate": 0.00027539999999999997,
202
+ "loss": 4.416887664794922,
203
+ "step": 460
204
+ },
205
+ {
206
+ "epoch": 0.016177957532861477,
207
+ "grad_norm": 1.3671875,
208
+ "learning_rate": 0.00028739999999999994,
209
+ "loss": 4.3046520233154295,
210
+ "step": 480
211
+ },
212
+ {
213
+ "epoch": 0.016852039096730706,
214
+ "grad_norm": 1.2109375,
215
+ "learning_rate": 0.00029939999999999996,
216
+ "loss": 4.238706970214844,
217
+ "step": 500
218
+ },
219
+ {
220
+ "epoch": 0.016852039096730706,
221
+ "eval_loss": 4.196270942687988,
222
+ "eval_runtime": 7.9301,
223
+ "eval_samples_per_second": 1201.377,
224
+ "eval_steps_per_second": 0.883,
225
+ "step": 500
226
+ },
227
+ {
228
+ "epoch": 0.01752612066059993,
229
+ "grad_norm": 0.97265625,
230
+ "learning_rate": 0.0003,
231
+ "loss": 4.1756237030029295,
232
+ "step": 520
233
+ },
234
+ {
235
+ "epoch": 0.01820020222446916,
236
+ "grad_norm": 0.9140625,
237
+ "learning_rate": 0.0003,
238
+ "loss": 4.0915069580078125,
239
+ "step": 540
240
+ },
241
+ {
242
+ "epoch": 0.01887428378833839,
243
+ "grad_norm": 1.2890625,
244
+ "learning_rate": 0.0003,
245
+ "loss": 4.031630325317383,
246
+ "step": 560
247
+ },
248
+ {
249
+ "epoch": 0.01954836535220762,
250
+ "grad_norm": 1.125,
251
+ "learning_rate": 0.0003,
252
+ "loss": 3.9763336181640625,
253
+ "step": 580
254
+ },
255
+ {
256
+ "epoch": 0.020222446916076844,
257
+ "grad_norm": 1.21875,
258
+ "learning_rate": 0.0003,
259
+ "loss": 3.9347896575927734,
260
+ "step": 600
261
+ },
262
+ {
263
+ "epoch": 0.020222446916076844,
264
+ "eval_loss": 3.9157378673553467,
265
+ "eval_runtime": 8.0606,
266
+ "eval_samples_per_second": 1181.917,
267
+ "eval_steps_per_second": 0.868,
268
+ "step": 600
269
+ },
270
+ {
271
+ "epoch": 0.020896528479946073,
272
+ "grad_norm": 1.1640625,
273
+ "learning_rate": 0.0003,
274
+ "loss": 3.878151702880859,
275
+ "step": 620
276
+ },
277
+ {
278
+ "epoch": 0.021570610043815303,
279
+ "grad_norm": 1.484375,
280
+ "learning_rate": 0.0003,
281
+ "loss": 3.855076217651367,
282
+ "step": 640
283
+ },
284
+ {
285
+ "epoch": 0.022244691607684528,
286
+ "grad_norm": 1.3359375,
287
+ "learning_rate": 0.0003,
288
+ "loss": 3.8232196807861327,
289
+ "step": 660
290
+ },
291
+ {
292
+ "epoch": 0.022918773171553757,
293
+ "grad_norm": 1.1640625,
294
+ "learning_rate": 0.0003,
295
+ "loss": 3.782532501220703,
296
+ "step": 680
297
+ },
298
+ {
299
+ "epoch": 0.023592854735422986,
300
+ "grad_norm": 1.1328125,
301
+ "learning_rate": 0.0003,
302
+ "loss": 3.7758609771728517,
303
+ "step": 700
304
+ },
305
+ {
306
+ "epoch": 0.023592854735422986,
307
+ "eval_loss": 3.7596347332000732,
308
+ "eval_runtime": 7.9743,
309
+ "eval_samples_per_second": 1194.709,
310
+ "eval_steps_per_second": 0.878,
311
+ "step": 700
312
+ },
313
+ {
314
+ "epoch": 0.024266936299292215,
315
+ "grad_norm": 1.25,
316
+ "learning_rate": 0.0003,
317
+ "loss": 3.7433414459228516,
318
+ "step": 720
319
+ },
320
+ {
321
+ "epoch": 0.02494101786316144,
322
+ "grad_norm": 1.3125,
323
+ "learning_rate": 0.0003,
324
+ "loss": 3.732330322265625,
325
+ "step": 740
326
+ },
327
+ {
328
+ "epoch": 0.02561509942703067,
329
+ "grad_norm": 1.265625,
330
+ "learning_rate": 0.0003,
331
+ "loss": 3.6843395233154297,
332
+ "step": 760
333
+ },
334
+ {
335
+ "epoch": 0.0262891809908999,
336
+ "grad_norm": 1.1640625,
337
+ "learning_rate": 0.0003,
338
+ "loss": 3.6463153839111326,
339
+ "step": 780
340
+ },
341
+ {
342
+ "epoch": 0.026963262554769128,
343
+ "grad_norm": 1.1171875,
344
+ "learning_rate": 0.0003,
345
+ "loss": 3.6544403076171874,
346
+ "step": 800
347
+ },
348
+ {
349
+ "epoch": 0.026963262554769128,
350
+ "eval_loss": 3.652294635772705,
351
+ "eval_runtime": 7.9753,
352
+ "eval_samples_per_second": 1194.559,
353
+ "eval_steps_per_second": 0.878,
354
+ "step": 800
355
+ },
356
+ {
357
+ "epoch": 0.027637344118638354,
358
+ "grad_norm": 1.1171875,
359
+ "learning_rate": 0.0003,
360
+ "loss": 3.6159641265869142,
361
+ "step": 820
362
+ },
363
+ {
364
+ "epoch": 0.028311425682507583,
365
+ "grad_norm": 1.078125,
366
+ "learning_rate": 0.0003,
367
+ "loss": 3.6099781036376952,
368
+ "step": 840
369
+ },
370
+ {
371
+ "epoch": 0.028985507246376812,
372
+ "grad_norm": 1.2734375,
373
+ "learning_rate": 0.0003,
374
+ "loss": 3.6344444274902346,
375
+ "step": 860
376
+ },
377
+ {
378
+ "epoch": 0.02965958881024604,
379
+ "grad_norm": 1.140625,
380
+ "learning_rate": 0.0003,
381
+ "loss": 3.5855178833007812,
382
+ "step": 880
383
+ },
384
+ {
385
+ "epoch": 0.030333670374115267,
386
+ "grad_norm": 1.109375,
387
+ "learning_rate": 0.0003,
388
+ "loss": 3.5488441467285154,
389
+ "step": 900
390
+ },
391
+ {
392
+ "epoch": 0.030333670374115267,
393
+ "eval_loss": 3.5648436546325684,
394
+ "eval_runtime": 8.321,
395
+ "eval_samples_per_second": 1144.931,
396
+ "eval_steps_per_second": 0.841,
397
+ "step": 900
398
+ },
399
+ {
400
+ "epoch": 0.031007751937984496,
401
+ "grad_norm": 1.1015625,
402
+ "learning_rate": 0.0003,
403
+ "loss": 3.5646598815917967,
404
+ "step": 920
405
+ },
406
+ {
407
+ "epoch": 0.031681833501853725,
408
+ "grad_norm": 1.25,
409
+ "learning_rate": 0.0003,
410
+ "loss": 3.5480445861816405,
411
+ "step": 940
412
+ },
413
+ {
414
+ "epoch": 0.032355915065722954,
415
+ "grad_norm": 1.140625,
416
+ "learning_rate": 0.0003,
417
+ "loss": 3.5140933990478516,
418
+ "step": 960
419
+ },
420
+ {
421
+ "epoch": 0.03302999662959218,
422
+ "grad_norm": 1.140625,
423
+ "learning_rate": 0.0003,
424
+ "loss": 3.501856231689453,
425
+ "step": 980
426
+ },
427
+ {
428
+ "epoch": 0.03370407819346141,
429
+ "grad_norm": 1.359375,
430
+ "learning_rate": 0.0003,
431
+ "loss": 3.500592803955078,
432
+ "step": 1000
433
+ },
434
+ {
435
+ "epoch": 0.03370407819346141,
436
+ "eval_loss": 3.4981162548065186,
437
+ "eval_runtime": 8.1013,
438
+ "eval_samples_per_second": 1175.987,
439
+ "eval_steps_per_second": 0.864,
440
+ "step": 1000
441
+ },
442
+ {
443
+ "epoch": 0.034378159757330634,
444
+ "grad_norm": 1.1328125,
445
+ "learning_rate": 0.0003,
446
+ "loss": 3.4914066314697267,
447
+ "step": 1020
448
+ },
449
+ {
450
+ "epoch": 0.03505224132119986,
451
+ "grad_norm": 1.1171875,
452
+ "learning_rate": 0.0003,
453
+ "loss": 3.474192810058594,
454
+ "step": 1040
455
+ },
456
+ {
457
+ "epoch": 0.03572632288506909,
458
+ "grad_norm": 1.28125,
459
+ "learning_rate": 0.0003,
460
+ "loss": 3.4552947998046877,
461
+ "step": 1060
462
+ },
463
+ {
464
+ "epoch": 0.03640040444893832,
465
+ "grad_norm": 1.203125,
466
+ "learning_rate": 0.0003,
467
+ "loss": 3.4411731719970704,
468
+ "step": 1080
469
+ },
470
+ {
471
+ "epoch": 0.03707448601280755,
472
+ "grad_norm": 1.2734375,
473
+ "learning_rate": 0.0003,
474
+ "loss": 3.435680389404297,
475
+ "step": 1100
476
+ },
477
+ {
478
+ "epoch": 0.03707448601280755,
479
+ "eval_loss": 3.445117712020874,
480
+ "eval_runtime": 8.1641,
481
+ "eval_samples_per_second": 1166.938,
482
+ "eval_steps_per_second": 0.857,
483
+ "step": 1100
484
+ },
485
+ {
486
+ "epoch": 0.03774856757667678,
487
+ "grad_norm": 1.03125,
488
+ "learning_rate": 0.0003,
489
+ "loss": 3.4368762969970703,
490
+ "step": 1120
491
+ },
492
+ {
493
+ "epoch": 0.03842264914054601,
494
+ "grad_norm": 1.2421875,
495
+ "learning_rate": 0.0003,
496
+ "loss": 3.410645294189453,
497
+ "step": 1140
498
+ },
499
+ {
500
+ "epoch": 0.03909673070441524,
501
+ "grad_norm": 1.0703125,
502
+ "learning_rate": 0.0003,
503
+ "loss": 3.4069515228271485,
504
+ "step": 1160
505
+ },
506
+ {
507
+ "epoch": 0.03977081226828446,
508
+ "grad_norm": 1.03125,
509
+ "learning_rate": 0.0003,
510
+ "loss": 3.4227649688720705,
511
+ "step": 1180
512
+ },
513
+ {
514
+ "epoch": 0.04044489383215369,
515
+ "grad_norm": 1.203125,
516
+ "learning_rate": 0.0003,
517
+ "loss": 3.3914558410644533,
518
+ "step": 1200
519
+ },
520
+ {
521
+ "epoch": 0.04044489383215369,
522
+ "eval_loss": 3.3945467472076416,
523
+ "eval_runtime": 8.0433,
524
+ "eval_samples_per_second": 1184.469,
525
+ "eval_steps_per_second": 0.87,
526
+ "step": 1200
527
+ },
528
+ {
529
+ "epoch": 0.04111897539602292,
530
+ "grad_norm": 1.0546875,
531
+ "learning_rate": 0.0003,
532
+ "loss": 3.3614086151123046,
533
+ "step": 1220
534
+ },
535
+ {
536
+ "epoch": 0.04179305695989215,
537
+ "grad_norm": 1.09375,
538
+ "learning_rate": 0.0003,
539
+ "loss": 3.3790237426757814,
540
+ "step": 1240
541
+ },
542
+ {
543
+ "epoch": 0.042467138523761376,
544
+ "grad_norm": 1.3515625,
545
+ "learning_rate": 0.0003,
546
+ "loss": 3.38794059753418,
547
+ "step": 1260
548
+ },
549
+ {
550
+ "epoch": 0.043141220087630605,
551
+ "grad_norm": 1.28125,
552
+ "learning_rate": 0.0003,
553
+ "loss": 3.3654109954833986,
554
+ "step": 1280
555
+ },
556
+ {
557
+ "epoch": 0.043815301651499834,
558
+ "grad_norm": 1.1796875,
559
+ "learning_rate": 0.0003,
560
+ "loss": 3.3572288513183595,
561
+ "step": 1300
562
+ },
563
+ {
564
+ "epoch": 0.043815301651499834,
565
+ "eval_loss": 3.3501007556915283,
566
+ "eval_runtime": 8.0621,
567
+ "eval_samples_per_second": 1181.702,
568
+ "eval_steps_per_second": 0.868,
569
+ "step": 1300
570
+ },
571
+ {
572
+ "epoch": 0.044489383215369056,
573
+ "grad_norm": 1.2734375,
574
+ "learning_rate": 0.0003,
575
+ "loss": 3.321734619140625,
576
+ "step": 1320
577
+ },
578
+ {
579
+ "epoch": 0.045163464779238285,
580
+ "grad_norm": 1.2890625,
581
+ "learning_rate": 0.0003,
582
+ "loss": 3.3493595123291016,
583
+ "step": 1340
584
+ },
585
+ {
586
+ "epoch": 0.045837546343107514,
587
+ "grad_norm": 1.1875,
588
+ "learning_rate": 0.0003,
589
+ "loss": 3.3272212982177733,
590
+ "step": 1360
591
+ },
592
+ {
593
+ "epoch": 0.046511627906976744,
594
+ "grad_norm": 1.1328125,
595
+ "learning_rate": 0.0003,
596
+ "loss": 3.3202045440673826,
597
+ "step": 1380
598
+ },
599
+ {
600
+ "epoch": 0.04718570947084597,
601
+ "grad_norm": 1.1171875,
602
+ "learning_rate": 0.0003,
603
+ "loss": 3.2998809814453125,
604
+ "step": 1400
605
+ },
606
+ {
607
+ "epoch": 0.04718570947084597,
608
+ "eval_loss": 3.311476707458496,
609
+ "eval_runtime": 8.1361,
610
+ "eval_samples_per_second": 1170.957,
611
+ "eval_steps_per_second": 0.86,
612
+ "step": 1400
613
+ },
614
+ {
615
+ "epoch": 0.0478597910347152,
616
+ "grad_norm": 1.140625,
617
+ "learning_rate": 0.0003,
618
+ "loss": 3.3057735443115233,
619
+ "step": 1420
620
+ },
621
+ {
622
+ "epoch": 0.04853387259858443,
623
+ "grad_norm": 1.109375,
624
+ "learning_rate": 0.0003,
625
+ "loss": 3.2907379150390623,
626
+ "step": 1440
627
+ },
628
+ {
629
+ "epoch": 0.04920795416245366,
630
+ "grad_norm": 1.078125,
631
+ "learning_rate": 0.0003,
632
+ "loss": 3.264795684814453,
633
+ "step": 1460
634
+ },
635
+ {
636
+ "epoch": 0.04988203572632288,
637
+ "grad_norm": 1.3671875,
638
+ "learning_rate": 0.0003,
639
+ "loss": 3.2918243408203125,
640
+ "step": 1480
641
+ },
642
+ {
643
+ "epoch": 0.05055611729019211,
644
+ "grad_norm": 1.2421875,
645
+ "learning_rate": 0.0003,
646
+ "loss": 3.2844181060791016,
647
+ "step": 1500
648
+ },
649
+ {
650
+ "epoch": 0.05055611729019211,
651
+ "eval_loss": 3.277984142303467,
652
+ "eval_runtime": 8.0313,
653
+ "eval_samples_per_second": 1186.24,
654
+ "eval_steps_per_second": 0.872,
655
+ "step": 1500
656
+ },
657
+ {
658
+ "epoch": 0.05123019885406134,
659
+ "grad_norm": 1.265625,
660
+ "learning_rate": 0.0003,
661
+ "loss": 3.2729434967041016,
662
+ "step": 1520
663
+ },
664
+ {
665
+ "epoch": 0.05190428041793057,
666
+ "grad_norm": 1.1015625,
667
+ "learning_rate": 0.0003,
668
+ "loss": 3.279766845703125,
669
+ "step": 1540
670
+ },
671
+ {
672
+ "epoch": 0.0525783619817998,
673
+ "grad_norm": 1.25,
674
+ "learning_rate": 0.0003,
675
+ "loss": 3.281978988647461,
676
+ "step": 1560
677
+ },
678
+ {
679
+ "epoch": 0.05325244354566903,
680
+ "grad_norm": 1.125,
681
+ "learning_rate": 0.0003,
682
+ "loss": 3.2608470916748047,
683
+ "step": 1580
684
+ },
685
+ {
686
+ "epoch": 0.053926525109538256,
687
+ "grad_norm": 1.2265625,
688
+ "learning_rate": 0.0003,
689
+ "loss": 3.2503360748291015,
690
+ "step": 1600
691
+ },
692
+ {
693
+ "epoch": 0.053926525109538256,
694
+ "eval_loss": 3.2511110305786133,
695
+ "eval_runtime": 8.097,
696
+ "eval_samples_per_second": 1176.602,
697
+ "eval_steps_per_second": 0.865,
698
+ "step": 1600
699
+ },
700
+ {
701
+ "epoch": 0.054600606673407485,
702
+ "grad_norm": 1.234375,
703
+ "learning_rate": 0.0003,
704
+ "loss": 3.2713451385498047,
705
+ "step": 1620
706
+ },
707
+ {
708
+ "epoch": 0.05527468823727671,
709
+ "grad_norm": 1.015625,
710
+ "learning_rate": 0.0003,
711
+ "loss": 3.2468338012695312,
712
+ "step": 1640
713
+ },
714
+ {
715
+ "epoch": 0.05594876980114594,
716
+ "grad_norm": 1.15625,
717
+ "learning_rate": 0.0003,
718
+ "loss": 3.255104827880859,
719
+ "step": 1660
720
+ },
721
+ {
722
+ "epoch": 0.056622851365015166,
723
+ "grad_norm": 1.1875,
724
+ "learning_rate": 0.0003,
725
+ "loss": 3.2280048370361327,
726
+ "step": 1680
727
+ },
728
+ {
729
+ "epoch": 0.057296932928884395,
730
+ "grad_norm": 1.265625,
731
+ "learning_rate": 0.0003,
732
+ "loss": 3.216978073120117,
733
+ "step": 1700
734
+ },
735
+ {
736
+ "epoch": 0.057296932928884395,
737
+ "eval_loss": 3.2238714694976807,
738
+ "eval_runtime": 8.059,
739
+ "eval_samples_per_second": 1182.16,
740
+ "eval_steps_per_second": 0.869,
741
+ "step": 1700
742
+ },
743
+ {
744
+ "epoch": 0.057971014492753624,
745
+ "grad_norm": 1.125,
746
+ "learning_rate": 0.0003,
747
+ "loss": 3.213521194458008,
748
+ "step": 1720
749
+ },
750
+ {
751
+ "epoch": 0.05864509605662285,
752
+ "grad_norm": 1.234375,
753
+ "learning_rate": 0.0003,
754
+ "loss": 3.2087985992431642,
755
+ "step": 1740
756
+ },
757
+ {
758
+ "epoch": 0.05931917762049208,
759
+ "grad_norm": 1.2109375,
760
+ "learning_rate": 0.0003,
761
+ "loss": 3.198755645751953,
762
+ "step": 1760
763
+ },
764
+ {
765
+ "epoch": 0.05999325918436131,
766
+ "grad_norm": 1.4453125,
767
+ "learning_rate": 0.0003,
768
+ "loss": 3.2067222595214844,
769
+ "step": 1780
770
+ },
771
+ {
772
+ "epoch": 0.06066734074823053,
773
+ "grad_norm": 1.140625,
774
+ "learning_rate": 0.0003,
775
+ "loss": 3.195578956604004,
776
+ "step": 1800
777
+ },
778
+ {
779
+ "epoch": 0.06066734074823053,
780
+ "eval_loss": 3.1985833644866943,
781
+ "eval_runtime": 8.2334,
782
+ "eval_samples_per_second": 1157.109,
783
+ "eval_steps_per_second": 0.85,
784
+ "step": 1800
785
+ },
786
+ {
787
+ "epoch": 0.06134142231209976,
788
+ "grad_norm": 1.1640625,
789
+ "learning_rate": 0.0003,
790
+ "loss": 3.186159133911133,
791
+ "step": 1820
792
+ },
793
+ {
794
+ "epoch": 0.06201550387596899,
795
+ "grad_norm": 1.21875,
796
+ "learning_rate": 0.0003,
797
+ "loss": 3.1850618362426757,
798
+ "step": 1840
799
+ },
800
+ {
801
+ "epoch": 0.06268958543983821,
802
+ "grad_norm": 1.3515625,
803
+ "learning_rate": 0.0003,
804
+ "loss": 3.1967243194580077,
805
+ "step": 1860
806
+ },
807
+ {
808
+ "epoch": 0.06336366700370745,
809
+ "grad_norm": 1.3125,
810
+ "learning_rate": 0.0003,
811
+ "loss": 3.1668914794921874,
812
+ "step": 1880
813
+ },
814
+ {
815
+ "epoch": 0.06403774856757667,
816
+ "grad_norm": 1.1484375,
817
+ "learning_rate": 0.0003,
818
+ "loss": 3.1733448028564455,
819
+ "step": 1900
820
+ },
821
+ {
822
+ "epoch": 0.06403774856757667,
823
+ "eval_loss": 3.1766083240509033,
824
+ "eval_runtime": 7.9724,
825
+ "eval_samples_per_second": 1194.991,
826
+ "eval_steps_per_second": 0.878,
827
+ "step": 1900
828
+ },
829
+ {
830
+ "epoch": 0.06471183013144591,
831
+ "grad_norm": 1.1953125,
832
+ "learning_rate": 0.0003,
833
+ "loss": 3.1606868743896483,
834
+ "step": 1920
835
+ },
836
+ {
837
+ "epoch": 0.06538591169531513,
838
+ "grad_norm": 1.109375,
839
+ "learning_rate": 0.0003,
840
+ "loss": 3.148599052429199,
841
+ "step": 1940
842
+ },
843
+ {
844
+ "epoch": 0.06605999325918437,
845
+ "grad_norm": 1.2265625,
846
+ "learning_rate": 0.0003,
847
+ "loss": 3.1723419189453126,
848
+ "step": 1960
849
+ },
850
+ {
851
+ "epoch": 0.06673407482305359,
852
+ "grad_norm": 1.234375,
853
+ "learning_rate": 0.0003,
854
+ "loss": 3.184863471984863,
855
+ "step": 1980
856
+ },
857
+ {
858
+ "epoch": 0.06740815638692282,
859
+ "grad_norm": 1.2734375,
860
+ "learning_rate": 0.0003,
861
+ "loss": 3.158551788330078,
862
+ "step": 2000
863
+ },
864
+ {
865
+ "epoch": 0.06740815638692282,
866
+ "eval_loss": 3.154155731201172,
867
+ "eval_runtime": 7.9931,
868
+ "eval_samples_per_second": 1191.905,
869
+ "eval_steps_per_second": 0.876,
870
+ "step": 2000
871
+ }
872
+ ],
873
+ "logging_steps": 20,
874
+ "max_steps": 2500,
875
+ "num_input_tokens_seen": 0,
876
+ "num_train_epochs": 1,
877
+ "save_steps": 100,
878
+ "stateful_callbacks": {
879
+ "TrainerControl": {
880
+ "args": {
881
+ "should_epoch_stop": false,
882
+ "should_evaluate": false,
883
+ "should_log": false,
884
+ "should_save": true,
885
+ "should_training_stop": false
886
+ },
887
+ "attributes": {}
888
+ }
889
+ },
890
+ "total_flos": 290388443136000.0,
891
+ "train_batch_size": 32,
892
+ "trial_name": null,
893
+ "trial_params": null
894
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2000/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a761b578cf2b8c248f28bd1b61a5ec7d0b5d3801c8bd793a6db706df1d3078f6
3
+ size 4920
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/config.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "squared_relu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 9,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "powlu_m": 3.0,
25
+ "pretraining_tp": 1,
26
+ "rms_norm_eps": 1e-06,
27
+ "rope_parameters": {
28
+ "rope_theta": 10000.0,
29
+ "rope_type": "default"
30
+ },
31
+ "tie_word_embeddings": true,
32
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
33
+ "transformers_version": "5.16.0.dev0",
34
+ "use_cache": false,
35
+ "vocab_size": 4096,
36
+ "waleed_beta": 10.0
37
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a1aa62fa362d37769fd67fbb46cdfd4c91936ced9a756612b8a489e0bdb3dd4a
3
+ size 4010544
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:56031c0e76c1bce8e7a0a9a3559707b888a6b9c293101948fad70e9c6b531226
3
+ size 8068282
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f7286dee9a5da5b96232ccd668e3561a460616ec53ea433806da321343af8636
3
+ size 14244
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0a05e9cdb3460a35862aac87a0001b7bc3f41bad95490df18a7b51b4f84deeeb
3
+ size 1064
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/trainer_state.json ADDED
@@ -0,0 +1,937 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.07077856420626896,
6
+ "eval_steps": 100,
7
+ "global_step": 2100,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0006740815638692282,
14
+ "grad_norm": 2.71875,
15
+ "learning_rate": 1.14e-05,
16
+ "loss": 8.314944458007812,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0013481631277384564,
21
+ "grad_norm": 1.8515625,
22
+ "learning_rate": 2.34e-05,
23
+ "loss": 8.251383972167968,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.0020222446916076846,
28
+ "grad_norm": 1.3203125,
29
+ "learning_rate": 3.539999999999999e-05,
30
+ "loss": 8.104505920410157,
31
+ "step": 60
32
+ },
33
+ {
34
+ "epoch": 0.002696326255476913,
35
+ "grad_norm": 1.296875,
36
+ "learning_rate": 4.7399999999999993e-05,
37
+ "loss": 7.968361663818359,
38
+ "step": 80
39
+ },
40
+ {
41
+ "epoch": 0.003370407819346141,
42
+ "grad_norm": 1.2578125,
43
+ "learning_rate": 5.94e-05,
44
+ "loss": 7.804827880859375,
45
+ "step": 100
46
+ },
47
+ {
48
+ "epoch": 0.003370407819346141,
49
+ "eval_loss": 7.703802585601807,
50
+ "eval_runtime": 8.0325,
51
+ "eval_samples_per_second": 1186.059,
52
+ "eval_steps_per_second": 0.871,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.004044489383215369,
57
+ "grad_norm": 1.2734375,
58
+ "learning_rate": 7.139999999999999e-05,
59
+ "loss": 7.600141906738282,
60
+ "step": 120
61
+ },
62
+ {
63
+ "epoch": 0.0047185709470845974,
64
+ "grad_norm": 1.265625,
65
+ "learning_rate": 8.34e-05,
66
+ "loss": 7.368203735351562,
67
+ "step": 140
68
+ },
69
+ {
70
+ "epoch": 0.005392652510953826,
71
+ "grad_norm": 1.265625,
72
+ "learning_rate": 9.539999999999999e-05,
73
+ "loss": 7.133045196533203,
74
+ "step": 160
75
+ },
76
+ {
77
+ "epoch": 0.006066734074823054,
78
+ "grad_norm": 1.203125,
79
+ "learning_rate": 0.00010739999999999998,
80
+ "loss": 6.885277557373047,
81
+ "step": 180
82
+ },
83
+ {
84
+ "epoch": 0.006740815638692282,
85
+ "grad_norm": 1.15625,
86
+ "learning_rate": 0.0001194,
87
+ "loss": 6.629558563232422,
88
+ "step": 200
89
+ },
90
+ {
91
+ "epoch": 0.006740815638692282,
92
+ "eval_loss": 6.4997687339782715,
93
+ "eval_runtime": 7.9479,
94
+ "eval_samples_per_second": 1198.683,
95
+ "eval_steps_per_second": 0.881,
96
+ "step": 200
97
+ },
98
+ {
99
+ "epoch": 0.00741489720256151,
100
+ "grad_norm": 1.109375,
101
+ "learning_rate": 0.0001314,
102
+ "loss": 6.391195297241211,
103
+ "step": 220
104
+ },
105
+ {
106
+ "epoch": 0.008088978766430738,
107
+ "grad_norm": 1.21875,
108
+ "learning_rate": 0.0001434,
109
+ "loss": 6.139227676391601,
110
+ "step": 240
111
+ },
112
+ {
113
+ "epoch": 0.008763060330299966,
114
+ "grad_norm": 1.0625,
115
+ "learning_rate": 0.00015539999999999998,
116
+ "loss": 5.917041778564453,
117
+ "step": 260
118
+ },
119
+ {
120
+ "epoch": 0.009437141894169195,
121
+ "grad_norm": 1.1015625,
122
+ "learning_rate": 0.0001674,
123
+ "loss": 5.702054595947265,
124
+ "step": 280
125
+ },
126
+ {
127
+ "epoch": 0.010111223458038422,
128
+ "grad_norm": 0.921875,
129
+ "learning_rate": 0.00017939999999999997,
130
+ "loss": 5.500263214111328,
131
+ "step": 300
132
+ },
133
+ {
134
+ "epoch": 0.010111223458038422,
135
+ "eval_loss": 5.393505573272705,
136
+ "eval_runtime": 8.0449,
137
+ "eval_samples_per_second": 1184.223,
138
+ "eval_steps_per_second": 0.87,
139
+ "step": 300
140
+ },
141
+ {
142
+ "epoch": 0.010785305021907651,
143
+ "grad_norm": 2.5,
144
+ "learning_rate": 0.0001914,
145
+ "loss": 5.319306182861328,
146
+ "step": 320
147
+ },
148
+ {
149
+ "epoch": 0.011459386585776879,
150
+ "grad_norm": 1.078125,
151
+ "learning_rate": 0.00020339999999999998,
152
+ "loss": 5.202053070068359,
153
+ "step": 340
154
+ },
155
+ {
156
+ "epoch": 0.012133468149646108,
157
+ "grad_norm": 1.3203125,
158
+ "learning_rate": 0.00021539999999999998,
159
+ "loss": 5.020883941650391,
160
+ "step": 360
161
+ },
162
+ {
163
+ "epoch": 0.012807549713515335,
164
+ "grad_norm": 1.1171875,
165
+ "learning_rate": 0.00022739999999999997,
166
+ "loss": 4.873059844970703,
167
+ "step": 380
168
+ },
169
+ {
170
+ "epoch": 0.013481631277384564,
171
+ "grad_norm": 1.234375,
172
+ "learning_rate": 0.0002394,
173
+ "loss": 4.741780853271484,
174
+ "step": 400
175
+ },
176
+ {
177
+ "epoch": 0.013481631277384564,
178
+ "eval_loss": 4.676144123077393,
179
+ "eval_runtime": 8.0457,
180
+ "eval_samples_per_second": 1184.113,
181
+ "eval_steps_per_second": 0.87,
182
+ "step": 400
183
+ },
184
+ {
185
+ "epoch": 0.014155712841253791,
186
+ "grad_norm": 1.3046875,
187
+ "learning_rate": 0.0002514,
188
+ "loss": 4.606548690795899,
189
+ "step": 420
190
+ },
191
+ {
192
+ "epoch": 0.01482979440512302,
193
+ "grad_norm": 1.2578125,
194
+ "learning_rate": 0.00026339999999999995,
195
+ "loss": 4.515376281738281,
196
+ "step": 440
197
+ },
198
+ {
199
+ "epoch": 0.015503875968992248,
200
+ "grad_norm": 1.0625,
201
+ "learning_rate": 0.00027539999999999997,
202
+ "loss": 4.416887664794922,
203
+ "step": 460
204
+ },
205
+ {
206
+ "epoch": 0.016177957532861477,
207
+ "grad_norm": 1.3671875,
208
+ "learning_rate": 0.00028739999999999994,
209
+ "loss": 4.3046520233154295,
210
+ "step": 480
211
+ },
212
+ {
213
+ "epoch": 0.016852039096730706,
214
+ "grad_norm": 1.2109375,
215
+ "learning_rate": 0.00029939999999999996,
216
+ "loss": 4.238706970214844,
217
+ "step": 500
218
+ },
219
+ {
220
+ "epoch": 0.016852039096730706,
221
+ "eval_loss": 4.196270942687988,
222
+ "eval_runtime": 7.9301,
223
+ "eval_samples_per_second": 1201.377,
224
+ "eval_steps_per_second": 0.883,
225
+ "step": 500
226
+ },
227
+ {
228
+ "epoch": 0.01752612066059993,
229
+ "grad_norm": 0.97265625,
230
+ "learning_rate": 0.0003,
231
+ "loss": 4.1756237030029295,
232
+ "step": 520
233
+ },
234
+ {
235
+ "epoch": 0.01820020222446916,
236
+ "grad_norm": 0.9140625,
237
+ "learning_rate": 0.0003,
238
+ "loss": 4.0915069580078125,
239
+ "step": 540
240
+ },
241
+ {
242
+ "epoch": 0.01887428378833839,
243
+ "grad_norm": 1.2890625,
244
+ "learning_rate": 0.0003,
245
+ "loss": 4.031630325317383,
246
+ "step": 560
247
+ },
248
+ {
249
+ "epoch": 0.01954836535220762,
250
+ "grad_norm": 1.125,
251
+ "learning_rate": 0.0003,
252
+ "loss": 3.9763336181640625,
253
+ "step": 580
254
+ },
255
+ {
256
+ "epoch": 0.020222446916076844,
257
+ "grad_norm": 1.21875,
258
+ "learning_rate": 0.0003,
259
+ "loss": 3.9347896575927734,
260
+ "step": 600
261
+ },
262
+ {
263
+ "epoch": 0.020222446916076844,
264
+ "eval_loss": 3.9157378673553467,
265
+ "eval_runtime": 8.0606,
266
+ "eval_samples_per_second": 1181.917,
267
+ "eval_steps_per_second": 0.868,
268
+ "step": 600
269
+ },
270
+ {
271
+ "epoch": 0.020896528479946073,
272
+ "grad_norm": 1.1640625,
273
+ "learning_rate": 0.0003,
274
+ "loss": 3.878151702880859,
275
+ "step": 620
276
+ },
277
+ {
278
+ "epoch": 0.021570610043815303,
279
+ "grad_norm": 1.484375,
280
+ "learning_rate": 0.0003,
281
+ "loss": 3.855076217651367,
282
+ "step": 640
283
+ },
284
+ {
285
+ "epoch": 0.022244691607684528,
286
+ "grad_norm": 1.3359375,
287
+ "learning_rate": 0.0003,
288
+ "loss": 3.8232196807861327,
289
+ "step": 660
290
+ },
291
+ {
292
+ "epoch": 0.022918773171553757,
293
+ "grad_norm": 1.1640625,
294
+ "learning_rate": 0.0003,
295
+ "loss": 3.782532501220703,
296
+ "step": 680
297
+ },
298
+ {
299
+ "epoch": 0.023592854735422986,
300
+ "grad_norm": 1.1328125,
301
+ "learning_rate": 0.0003,
302
+ "loss": 3.7758609771728517,
303
+ "step": 700
304
+ },
305
+ {
306
+ "epoch": 0.023592854735422986,
307
+ "eval_loss": 3.7596347332000732,
308
+ "eval_runtime": 7.9743,
309
+ "eval_samples_per_second": 1194.709,
310
+ "eval_steps_per_second": 0.878,
311
+ "step": 700
312
+ },
313
+ {
314
+ "epoch": 0.024266936299292215,
315
+ "grad_norm": 1.25,
316
+ "learning_rate": 0.0003,
317
+ "loss": 3.7433414459228516,
318
+ "step": 720
319
+ },
320
+ {
321
+ "epoch": 0.02494101786316144,
322
+ "grad_norm": 1.3125,
323
+ "learning_rate": 0.0003,
324
+ "loss": 3.732330322265625,
325
+ "step": 740
326
+ },
327
+ {
328
+ "epoch": 0.02561509942703067,
329
+ "grad_norm": 1.265625,
330
+ "learning_rate": 0.0003,
331
+ "loss": 3.6843395233154297,
332
+ "step": 760
333
+ },
334
+ {
335
+ "epoch": 0.0262891809908999,
336
+ "grad_norm": 1.1640625,
337
+ "learning_rate": 0.0003,
338
+ "loss": 3.6463153839111326,
339
+ "step": 780
340
+ },
341
+ {
342
+ "epoch": 0.026963262554769128,
343
+ "grad_norm": 1.1171875,
344
+ "learning_rate": 0.0003,
345
+ "loss": 3.6544403076171874,
346
+ "step": 800
347
+ },
348
+ {
349
+ "epoch": 0.026963262554769128,
350
+ "eval_loss": 3.652294635772705,
351
+ "eval_runtime": 7.9753,
352
+ "eval_samples_per_second": 1194.559,
353
+ "eval_steps_per_second": 0.878,
354
+ "step": 800
355
+ },
356
+ {
357
+ "epoch": 0.027637344118638354,
358
+ "grad_norm": 1.1171875,
359
+ "learning_rate": 0.0003,
360
+ "loss": 3.6159641265869142,
361
+ "step": 820
362
+ },
363
+ {
364
+ "epoch": 0.028311425682507583,
365
+ "grad_norm": 1.078125,
366
+ "learning_rate": 0.0003,
367
+ "loss": 3.6099781036376952,
368
+ "step": 840
369
+ },
370
+ {
371
+ "epoch": 0.028985507246376812,
372
+ "grad_norm": 1.2734375,
373
+ "learning_rate": 0.0003,
374
+ "loss": 3.6344444274902346,
375
+ "step": 860
376
+ },
377
+ {
378
+ "epoch": 0.02965958881024604,
379
+ "grad_norm": 1.140625,
380
+ "learning_rate": 0.0003,
381
+ "loss": 3.5855178833007812,
382
+ "step": 880
383
+ },
384
+ {
385
+ "epoch": 0.030333670374115267,
386
+ "grad_norm": 1.109375,
387
+ "learning_rate": 0.0003,
388
+ "loss": 3.5488441467285154,
389
+ "step": 900
390
+ },
391
+ {
392
+ "epoch": 0.030333670374115267,
393
+ "eval_loss": 3.5648436546325684,
394
+ "eval_runtime": 8.321,
395
+ "eval_samples_per_second": 1144.931,
396
+ "eval_steps_per_second": 0.841,
397
+ "step": 900
398
+ },
399
+ {
400
+ "epoch": 0.031007751937984496,
401
+ "grad_norm": 1.1015625,
402
+ "learning_rate": 0.0003,
403
+ "loss": 3.5646598815917967,
404
+ "step": 920
405
+ },
406
+ {
407
+ "epoch": 0.031681833501853725,
408
+ "grad_norm": 1.25,
409
+ "learning_rate": 0.0003,
410
+ "loss": 3.5480445861816405,
411
+ "step": 940
412
+ },
413
+ {
414
+ "epoch": 0.032355915065722954,
415
+ "grad_norm": 1.140625,
416
+ "learning_rate": 0.0003,
417
+ "loss": 3.5140933990478516,
418
+ "step": 960
419
+ },
420
+ {
421
+ "epoch": 0.03302999662959218,
422
+ "grad_norm": 1.140625,
423
+ "learning_rate": 0.0003,
424
+ "loss": 3.501856231689453,
425
+ "step": 980
426
+ },
427
+ {
428
+ "epoch": 0.03370407819346141,
429
+ "grad_norm": 1.359375,
430
+ "learning_rate": 0.0003,
431
+ "loss": 3.500592803955078,
432
+ "step": 1000
433
+ },
434
+ {
435
+ "epoch": 0.03370407819346141,
436
+ "eval_loss": 3.4981162548065186,
437
+ "eval_runtime": 8.1013,
438
+ "eval_samples_per_second": 1175.987,
439
+ "eval_steps_per_second": 0.864,
440
+ "step": 1000
441
+ },
442
+ {
443
+ "epoch": 0.034378159757330634,
444
+ "grad_norm": 1.1328125,
445
+ "learning_rate": 0.0003,
446
+ "loss": 3.4914066314697267,
447
+ "step": 1020
448
+ },
449
+ {
450
+ "epoch": 0.03505224132119986,
451
+ "grad_norm": 1.1171875,
452
+ "learning_rate": 0.0003,
453
+ "loss": 3.474192810058594,
454
+ "step": 1040
455
+ },
456
+ {
457
+ "epoch": 0.03572632288506909,
458
+ "grad_norm": 1.28125,
459
+ "learning_rate": 0.0003,
460
+ "loss": 3.4552947998046877,
461
+ "step": 1060
462
+ },
463
+ {
464
+ "epoch": 0.03640040444893832,
465
+ "grad_norm": 1.203125,
466
+ "learning_rate": 0.0003,
467
+ "loss": 3.4411731719970704,
468
+ "step": 1080
469
+ },
470
+ {
471
+ "epoch": 0.03707448601280755,
472
+ "grad_norm": 1.2734375,
473
+ "learning_rate": 0.0003,
474
+ "loss": 3.435680389404297,
475
+ "step": 1100
476
+ },
477
+ {
478
+ "epoch": 0.03707448601280755,
479
+ "eval_loss": 3.445117712020874,
480
+ "eval_runtime": 8.1641,
481
+ "eval_samples_per_second": 1166.938,
482
+ "eval_steps_per_second": 0.857,
483
+ "step": 1100
484
+ },
485
+ {
486
+ "epoch": 0.03774856757667678,
487
+ "grad_norm": 1.03125,
488
+ "learning_rate": 0.0003,
489
+ "loss": 3.4368762969970703,
490
+ "step": 1120
491
+ },
492
+ {
493
+ "epoch": 0.03842264914054601,
494
+ "grad_norm": 1.2421875,
495
+ "learning_rate": 0.0003,
496
+ "loss": 3.410645294189453,
497
+ "step": 1140
498
+ },
499
+ {
500
+ "epoch": 0.03909673070441524,
501
+ "grad_norm": 1.0703125,
502
+ "learning_rate": 0.0003,
503
+ "loss": 3.4069515228271485,
504
+ "step": 1160
505
+ },
506
+ {
507
+ "epoch": 0.03977081226828446,
508
+ "grad_norm": 1.03125,
509
+ "learning_rate": 0.0003,
510
+ "loss": 3.4227649688720705,
511
+ "step": 1180
512
+ },
513
+ {
514
+ "epoch": 0.04044489383215369,
515
+ "grad_norm": 1.203125,
516
+ "learning_rate": 0.0003,
517
+ "loss": 3.3914558410644533,
518
+ "step": 1200
519
+ },
520
+ {
521
+ "epoch": 0.04044489383215369,
522
+ "eval_loss": 3.3945467472076416,
523
+ "eval_runtime": 8.0433,
524
+ "eval_samples_per_second": 1184.469,
525
+ "eval_steps_per_second": 0.87,
526
+ "step": 1200
527
+ },
528
+ {
529
+ "epoch": 0.04111897539602292,
530
+ "grad_norm": 1.0546875,
531
+ "learning_rate": 0.0003,
532
+ "loss": 3.3614086151123046,
533
+ "step": 1220
534
+ },
535
+ {
536
+ "epoch": 0.04179305695989215,
537
+ "grad_norm": 1.09375,
538
+ "learning_rate": 0.0003,
539
+ "loss": 3.3790237426757814,
540
+ "step": 1240
541
+ },
542
+ {
543
+ "epoch": 0.042467138523761376,
544
+ "grad_norm": 1.3515625,
545
+ "learning_rate": 0.0003,
546
+ "loss": 3.38794059753418,
547
+ "step": 1260
548
+ },
549
+ {
550
+ "epoch": 0.043141220087630605,
551
+ "grad_norm": 1.28125,
552
+ "learning_rate": 0.0003,
553
+ "loss": 3.3654109954833986,
554
+ "step": 1280
555
+ },
556
+ {
557
+ "epoch": 0.043815301651499834,
558
+ "grad_norm": 1.1796875,
559
+ "learning_rate": 0.0003,
560
+ "loss": 3.3572288513183595,
561
+ "step": 1300
562
+ },
563
+ {
564
+ "epoch": 0.043815301651499834,
565
+ "eval_loss": 3.3501007556915283,
566
+ "eval_runtime": 8.0621,
567
+ "eval_samples_per_second": 1181.702,
568
+ "eval_steps_per_second": 0.868,
569
+ "step": 1300
570
+ },
571
+ {
572
+ "epoch": 0.044489383215369056,
573
+ "grad_norm": 1.2734375,
574
+ "learning_rate": 0.0003,
575
+ "loss": 3.321734619140625,
576
+ "step": 1320
577
+ },
578
+ {
579
+ "epoch": 0.045163464779238285,
580
+ "grad_norm": 1.2890625,
581
+ "learning_rate": 0.0003,
582
+ "loss": 3.3493595123291016,
583
+ "step": 1340
584
+ },
585
+ {
586
+ "epoch": 0.045837546343107514,
587
+ "grad_norm": 1.1875,
588
+ "learning_rate": 0.0003,
589
+ "loss": 3.3272212982177733,
590
+ "step": 1360
591
+ },
592
+ {
593
+ "epoch": 0.046511627906976744,
594
+ "grad_norm": 1.1328125,
595
+ "learning_rate": 0.0003,
596
+ "loss": 3.3202045440673826,
597
+ "step": 1380
598
+ },
599
+ {
600
+ "epoch": 0.04718570947084597,
601
+ "grad_norm": 1.1171875,
602
+ "learning_rate": 0.0003,
603
+ "loss": 3.2998809814453125,
604
+ "step": 1400
605
+ },
606
+ {
607
+ "epoch": 0.04718570947084597,
608
+ "eval_loss": 3.311476707458496,
609
+ "eval_runtime": 8.1361,
610
+ "eval_samples_per_second": 1170.957,
611
+ "eval_steps_per_second": 0.86,
612
+ "step": 1400
613
+ },
614
+ {
615
+ "epoch": 0.0478597910347152,
616
+ "grad_norm": 1.140625,
617
+ "learning_rate": 0.0003,
618
+ "loss": 3.3057735443115233,
619
+ "step": 1420
620
+ },
621
+ {
622
+ "epoch": 0.04853387259858443,
623
+ "grad_norm": 1.109375,
624
+ "learning_rate": 0.0003,
625
+ "loss": 3.2907379150390623,
626
+ "step": 1440
627
+ },
628
+ {
629
+ "epoch": 0.04920795416245366,
630
+ "grad_norm": 1.078125,
631
+ "learning_rate": 0.0003,
632
+ "loss": 3.264795684814453,
633
+ "step": 1460
634
+ },
635
+ {
636
+ "epoch": 0.04988203572632288,
637
+ "grad_norm": 1.3671875,
638
+ "learning_rate": 0.0003,
639
+ "loss": 3.2918243408203125,
640
+ "step": 1480
641
+ },
642
+ {
643
+ "epoch": 0.05055611729019211,
644
+ "grad_norm": 1.2421875,
645
+ "learning_rate": 0.0003,
646
+ "loss": 3.2844181060791016,
647
+ "step": 1500
648
+ },
649
+ {
650
+ "epoch": 0.05055611729019211,
651
+ "eval_loss": 3.277984142303467,
652
+ "eval_runtime": 8.0313,
653
+ "eval_samples_per_second": 1186.24,
654
+ "eval_steps_per_second": 0.872,
655
+ "step": 1500
656
+ },
657
+ {
658
+ "epoch": 0.05123019885406134,
659
+ "grad_norm": 1.265625,
660
+ "learning_rate": 0.0003,
661
+ "loss": 3.2729434967041016,
662
+ "step": 1520
663
+ },
664
+ {
665
+ "epoch": 0.05190428041793057,
666
+ "grad_norm": 1.1015625,
667
+ "learning_rate": 0.0003,
668
+ "loss": 3.279766845703125,
669
+ "step": 1540
670
+ },
671
+ {
672
+ "epoch": 0.0525783619817998,
673
+ "grad_norm": 1.25,
674
+ "learning_rate": 0.0003,
675
+ "loss": 3.281978988647461,
676
+ "step": 1560
677
+ },
678
+ {
679
+ "epoch": 0.05325244354566903,
680
+ "grad_norm": 1.125,
681
+ "learning_rate": 0.0003,
682
+ "loss": 3.2608470916748047,
683
+ "step": 1580
684
+ },
685
+ {
686
+ "epoch": 0.053926525109538256,
687
+ "grad_norm": 1.2265625,
688
+ "learning_rate": 0.0003,
689
+ "loss": 3.2503360748291015,
690
+ "step": 1600
691
+ },
692
+ {
693
+ "epoch": 0.053926525109538256,
694
+ "eval_loss": 3.2511110305786133,
695
+ "eval_runtime": 8.097,
696
+ "eval_samples_per_second": 1176.602,
697
+ "eval_steps_per_second": 0.865,
698
+ "step": 1600
699
+ },
700
+ {
701
+ "epoch": 0.054600606673407485,
702
+ "grad_norm": 1.234375,
703
+ "learning_rate": 0.0003,
704
+ "loss": 3.2713451385498047,
705
+ "step": 1620
706
+ },
707
+ {
708
+ "epoch": 0.05527468823727671,
709
+ "grad_norm": 1.015625,
710
+ "learning_rate": 0.0003,
711
+ "loss": 3.2468338012695312,
712
+ "step": 1640
713
+ },
714
+ {
715
+ "epoch": 0.05594876980114594,
716
+ "grad_norm": 1.15625,
717
+ "learning_rate": 0.0003,
718
+ "loss": 3.255104827880859,
719
+ "step": 1660
720
+ },
721
+ {
722
+ "epoch": 0.056622851365015166,
723
+ "grad_norm": 1.1875,
724
+ "learning_rate": 0.0003,
725
+ "loss": 3.2280048370361327,
726
+ "step": 1680
727
+ },
728
+ {
729
+ "epoch": 0.057296932928884395,
730
+ "grad_norm": 1.265625,
731
+ "learning_rate": 0.0003,
732
+ "loss": 3.216978073120117,
733
+ "step": 1700
734
+ },
735
+ {
736
+ "epoch": 0.057296932928884395,
737
+ "eval_loss": 3.2238714694976807,
738
+ "eval_runtime": 8.059,
739
+ "eval_samples_per_second": 1182.16,
740
+ "eval_steps_per_second": 0.869,
741
+ "step": 1700
742
+ },
743
+ {
744
+ "epoch": 0.057971014492753624,
745
+ "grad_norm": 1.125,
746
+ "learning_rate": 0.0003,
747
+ "loss": 3.213521194458008,
748
+ "step": 1720
749
+ },
750
+ {
751
+ "epoch": 0.05864509605662285,
752
+ "grad_norm": 1.234375,
753
+ "learning_rate": 0.0003,
754
+ "loss": 3.2087985992431642,
755
+ "step": 1740
756
+ },
757
+ {
758
+ "epoch": 0.05931917762049208,
759
+ "grad_norm": 1.2109375,
760
+ "learning_rate": 0.0003,
761
+ "loss": 3.198755645751953,
762
+ "step": 1760
763
+ },
764
+ {
765
+ "epoch": 0.05999325918436131,
766
+ "grad_norm": 1.4453125,
767
+ "learning_rate": 0.0003,
768
+ "loss": 3.2067222595214844,
769
+ "step": 1780
770
+ },
771
+ {
772
+ "epoch": 0.06066734074823053,
773
+ "grad_norm": 1.140625,
774
+ "learning_rate": 0.0003,
775
+ "loss": 3.195578956604004,
776
+ "step": 1800
777
+ },
778
+ {
779
+ "epoch": 0.06066734074823053,
780
+ "eval_loss": 3.1985833644866943,
781
+ "eval_runtime": 8.2334,
782
+ "eval_samples_per_second": 1157.109,
783
+ "eval_steps_per_second": 0.85,
784
+ "step": 1800
785
+ },
786
+ {
787
+ "epoch": 0.06134142231209976,
788
+ "grad_norm": 1.1640625,
789
+ "learning_rate": 0.0003,
790
+ "loss": 3.186159133911133,
791
+ "step": 1820
792
+ },
793
+ {
794
+ "epoch": 0.06201550387596899,
795
+ "grad_norm": 1.21875,
796
+ "learning_rate": 0.0003,
797
+ "loss": 3.1850618362426757,
798
+ "step": 1840
799
+ },
800
+ {
801
+ "epoch": 0.06268958543983821,
802
+ "grad_norm": 1.3515625,
803
+ "learning_rate": 0.0003,
804
+ "loss": 3.1967243194580077,
805
+ "step": 1860
806
+ },
807
+ {
808
+ "epoch": 0.06336366700370745,
809
+ "grad_norm": 1.3125,
810
+ "learning_rate": 0.0003,
811
+ "loss": 3.1668914794921874,
812
+ "step": 1880
813
+ },
814
+ {
815
+ "epoch": 0.06403774856757667,
816
+ "grad_norm": 1.1484375,
817
+ "learning_rate": 0.0003,
818
+ "loss": 3.1733448028564455,
819
+ "step": 1900
820
+ },
821
+ {
822
+ "epoch": 0.06403774856757667,
823
+ "eval_loss": 3.1766083240509033,
824
+ "eval_runtime": 7.9724,
825
+ "eval_samples_per_second": 1194.991,
826
+ "eval_steps_per_second": 0.878,
827
+ "step": 1900
828
+ },
829
+ {
830
+ "epoch": 0.06471183013144591,
831
+ "grad_norm": 1.1953125,
832
+ "learning_rate": 0.0003,
833
+ "loss": 3.1606868743896483,
834
+ "step": 1920
835
+ },
836
+ {
837
+ "epoch": 0.06538591169531513,
838
+ "grad_norm": 1.109375,
839
+ "learning_rate": 0.0003,
840
+ "loss": 3.148599052429199,
841
+ "step": 1940
842
+ },
843
+ {
844
+ "epoch": 0.06605999325918437,
845
+ "grad_norm": 1.2265625,
846
+ "learning_rate": 0.0003,
847
+ "loss": 3.1723419189453126,
848
+ "step": 1960
849
+ },
850
+ {
851
+ "epoch": 0.06673407482305359,
852
+ "grad_norm": 1.234375,
853
+ "learning_rate": 0.0003,
854
+ "loss": 3.184863471984863,
855
+ "step": 1980
856
+ },
857
+ {
858
+ "epoch": 0.06740815638692282,
859
+ "grad_norm": 1.2734375,
860
+ "learning_rate": 0.0003,
861
+ "loss": 3.158551788330078,
862
+ "step": 2000
863
+ },
864
+ {
865
+ "epoch": 0.06740815638692282,
866
+ "eval_loss": 3.154155731201172,
867
+ "eval_runtime": 7.9931,
868
+ "eval_samples_per_second": 1191.905,
869
+ "eval_steps_per_second": 0.876,
870
+ "step": 2000
871
+ },
872
+ {
873
+ "epoch": 0.06808223795079205,
874
+ "grad_norm": 1.2734375,
875
+ "learning_rate": 0.0003,
876
+ "loss": 3.147844696044922,
877
+ "step": 2020
878
+ },
879
+ {
880
+ "epoch": 0.06875631951466127,
881
+ "grad_norm": 1.1796875,
882
+ "learning_rate": 0.0003,
883
+ "loss": 3.149020957946777,
884
+ "step": 2040
885
+ },
886
+ {
887
+ "epoch": 0.0694304010785305,
888
+ "grad_norm": 1.234375,
889
+ "learning_rate": 0.0003,
890
+ "loss": 3.1382816314697264,
891
+ "step": 2060
892
+ },
893
+ {
894
+ "epoch": 0.07010448264239973,
895
+ "grad_norm": 1.203125,
896
+ "learning_rate": 0.0003,
897
+ "loss": 3.1440708160400392,
898
+ "step": 2080
899
+ },
900
+ {
901
+ "epoch": 0.07077856420626896,
902
+ "grad_norm": 1.1171875,
903
+ "learning_rate": 0.0003,
904
+ "loss": 3.132351875305176,
905
+ "step": 2100
906
+ },
907
+ {
908
+ "epoch": 0.07077856420626896,
909
+ "eval_loss": 3.1331419944763184,
910
+ "eval_runtime": 8.2456,
911
+ "eval_samples_per_second": 1155.405,
912
+ "eval_steps_per_second": 0.849,
913
+ "step": 2100
914
+ }
915
+ ],
916
+ "logging_steps": 20,
917
+ "max_steps": 2500,
918
+ "num_input_tokens_seen": 0,
919
+ "num_train_epochs": 1,
920
+ "save_steps": 100,
921
+ "stateful_callbacks": {
922
+ "TrainerControl": {
923
+ "args": {
924
+ "should_epoch_stop": false,
925
+ "should_evaluate": false,
926
+ "should_log": false,
927
+ "should_save": true,
928
+ "should_training_stop": false
929
+ },
930
+ "attributes": {}
931
+ }
932
+ },
933
+ "total_flos": 304907865292800.0,
934
+ "train_batch_size": 32,
935
+ "trial_name": null,
936
+ "trial_params": null
937
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2100/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a761b578cf2b8c248f28bd1b61a5ec7d0b5d3801c8bd793a6db706df1d3078f6
3
+ size 4920
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/config.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "squared_relu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 9,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "powlu_m": 3.0,
25
+ "pretraining_tp": 1,
26
+ "rms_norm_eps": 1e-06,
27
+ "rope_parameters": {
28
+ "rope_theta": 10000.0,
29
+ "rope_type": "default"
30
+ },
31
+ "tie_word_embeddings": true,
32
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
33
+ "transformers_version": "5.16.0.dev0",
34
+ "use_cache": false,
35
+ "vocab_size": 4096,
36
+ "waleed_beta": 10.0
37
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1922d5c6a57c5d6251629ea17f3a6e37d02614b232e1bcf31294583de754cab6
3
+ size 4010544
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:21fe5755951404a5e1e2d2eecc2b48edc6b7047c7fd478391035983c57ae158e
3
+ size 8068282
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7d7dc5cd1ed4bd6f56fc9ef12090bb8dcd7e4f162336bc05d8c592731dbe5b42
3
+ size 14244
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:95f4343cb1ad65cd3aa916e2c22cfe7d27a8e1e8772a1b42aa25f1b477d39b9e
3
+ size 1064
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/trainer_state.json ADDED
@@ -0,0 +1,980 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.0741489720256151,
6
+ "eval_steps": 100,
7
+ "global_step": 2200,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0006740815638692282,
14
+ "grad_norm": 2.71875,
15
+ "learning_rate": 1.14e-05,
16
+ "loss": 8.314944458007812,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0013481631277384564,
21
+ "grad_norm": 1.8515625,
22
+ "learning_rate": 2.34e-05,
23
+ "loss": 8.251383972167968,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.0020222446916076846,
28
+ "grad_norm": 1.3203125,
29
+ "learning_rate": 3.539999999999999e-05,
30
+ "loss": 8.104505920410157,
31
+ "step": 60
32
+ },
33
+ {
34
+ "epoch": 0.002696326255476913,
35
+ "grad_norm": 1.296875,
36
+ "learning_rate": 4.7399999999999993e-05,
37
+ "loss": 7.968361663818359,
38
+ "step": 80
39
+ },
40
+ {
41
+ "epoch": 0.003370407819346141,
42
+ "grad_norm": 1.2578125,
43
+ "learning_rate": 5.94e-05,
44
+ "loss": 7.804827880859375,
45
+ "step": 100
46
+ },
47
+ {
48
+ "epoch": 0.003370407819346141,
49
+ "eval_loss": 7.703802585601807,
50
+ "eval_runtime": 8.0325,
51
+ "eval_samples_per_second": 1186.059,
52
+ "eval_steps_per_second": 0.871,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.004044489383215369,
57
+ "grad_norm": 1.2734375,
58
+ "learning_rate": 7.139999999999999e-05,
59
+ "loss": 7.600141906738282,
60
+ "step": 120
61
+ },
62
+ {
63
+ "epoch": 0.0047185709470845974,
64
+ "grad_norm": 1.265625,
65
+ "learning_rate": 8.34e-05,
66
+ "loss": 7.368203735351562,
67
+ "step": 140
68
+ },
69
+ {
70
+ "epoch": 0.005392652510953826,
71
+ "grad_norm": 1.265625,
72
+ "learning_rate": 9.539999999999999e-05,
73
+ "loss": 7.133045196533203,
74
+ "step": 160
75
+ },
76
+ {
77
+ "epoch": 0.006066734074823054,
78
+ "grad_norm": 1.203125,
79
+ "learning_rate": 0.00010739999999999998,
80
+ "loss": 6.885277557373047,
81
+ "step": 180
82
+ },
83
+ {
84
+ "epoch": 0.006740815638692282,
85
+ "grad_norm": 1.15625,
86
+ "learning_rate": 0.0001194,
87
+ "loss": 6.629558563232422,
88
+ "step": 200
89
+ },
90
+ {
91
+ "epoch": 0.006740815638692282,
92
+ "eval_loss": 6.4997687339782715,
93
+ "eval_runtime": 7.9479,
94
+ "eval_samples_per_second": 1198.683,
95
+ "eval_steps_per_second": 0.881,
96
+ "step": 200
97
+ },
98
+ {
99
+ "epoch": 0.00741489720256151,
100
+ "grad_norm": 1.109375,
101
+ "learning_rate": 0.0001314,
102
+ "loss": 6.391195297241211,
103
+ "step": 220
104
+ },
105
+ {
106
+ "epoch": 0.008088978766430738,
107
+ "grad_norm": 1.21875,
108
+ "learning_rate": 0.0001434,
109
+ "loss": 6.139227676391601,
110
+ "step": 240
111
+ },
112
+ {
113
+ "epoch": 0.008763060330299966,
114
+ "grad_norm": 1.0625,
115
+ "learning_rate": 0.00015539999999999998,
116
+ "loss": 5.917041778564453,
117
+ "step": 260
118
+ },
119
+ {
120
+ "epoch": 0.009437141894169195,
121
+ "grad_norm": 1.1015625,
122
+ "learning_rate": 0.0001674,
123
+ "loss": 5.702054595947265,
124
+ "step": 280
125
+ },
126
+ {
127
+ "epoch": 0.010111223458038422,
128
+ "grad_norm": 0.921875,
129
+ "learning_rate": 0.00017939999999999997,
130
+ "loss": 5.500263214111328,
131
+ "step": 300
132
+ },
133
+ {
134
+ "epoch": 0.010111223458038422,
135
+ "eval_loss": 5.393505573272705,
136
+ "eval_runtime": 8.0449,
137
+ "eval_samples_per_second": 1184.223,
138
+ "eval_steps_per_second": 0.87,
139
+ "step": 300
140
+ },
141
+ {
142
+ "epoch": 0.010785305021907651,
143
+ "grad_norm": 2.5,
144
+ "learning_rate": 0.0001914,
145
+ "loss": 5.319306182861328,
146
+ "step": 320
147
+ },
148
+ {
149
+ "epoch": 0.011459386585776879,
150
+ "grad_norm": 1.078125,
151
+ "learning_rate": 0.00020339999999999998,
152
+ "loss": 5.202053070068359,
153
+ "step": 340
154
+ },
155
+ {
156
+ "epoch": 0.012133468149646108,
157
+ "grad_norm": 1.3203125,
158
+ "learning_rate": 0.00021539999999999998,
159
+ "loss": 5.020883941650391,
160
+ "step": 360
161
+ },
162
+ {
163
+ "epoch": 0.012807549713515335,
164
+ "grad_norm": 1.1171875,
165
+ "learning_rate": 0.00022739999999999997,
166
+ "loss": 4.873059844970703,
167
+ "step": 380
168
+ },
169
+ {
170
+ "epoch": 0.013481631277384564,
171
+ "grad_norm": 1.234375,
172
+ "learning_rate": 0.0002394,
173
+ "loss": 4.741780853271484,
174
+ "step": 400
175
+ },
176
+ {
177
+ "epoch": 0.013481631277384564,
178
+ "eval_loss": 4.676144123077393,
179
+ "eval_runtime": 8.0457,
180
+ "eval_samples_per_second": 1184.113,
181
+ "eval_steps_per_second": 0.87,
182
+ "step": 400
183
+ },
184
+ {
185
+ "epoch": 0.014155712841253791,
186
+ "grad_norm": 1.3046875,
187
+ "learning_rate": 0.0002514,
188
+ "loss": 4.606548690795899,
189
+ "step": 420
190
+ },
191
+ {
192
+ "epoch": 0.01482979440512302,
193
+ "grad_norm": 1.2578125,
194
+ "learning_rate": 0.00026339999999999995,
195
+ "loss": 4.515376281738281,
196
+ "step": 440
197
+ },
198
+ {
199
+ "epoch": 0.015503875968992248,
200
+ "grad_norm": 1.0625,
201
+ "learning_rate": 0.00027539999999999997,
202
+ "loss": 4.416887664794922,
203
+ "step": 460
204
+ },
205
+ {
206
+ "epoch": 0.016177957532861477,
207
+ "grad_norm": 1.3671875,
208
+ "learning_rate": 0.00028739999999999994,
209
+ "loss": 4.3046520233154295,
210
+ "step": 480
211
+ },
212
+ {
213
+ "epoch": 0.016852039096730706,
214
+ "grad_norm": 1.2109375,
215
+ "learning_rate": 0.00029939999999999996,
216
+ "loss": 4.238706970214844,
217
+ "step": 500
218
+ },
219
+ {
220
+ "epoch": 0.016852039096730706,
221
+ "eval_loss": 4.196270942687988,
222
+ "eval_runtime": 7.9301,
223
+ "eval_samples_per_second": 1201.377,
224
+ "eval_steps_per_second": 0.883,
225
+ "step": 500
226
+ },
227
+ {
228
+ "epoch": 0.01752612066059993,
229
+ "grad_norm": 0.97265625,
230
+ "learning_rate": 0.0003,
231
+ "loss": 4.1756237030029295,
232
+ "step": 520
233
+ },
234
+ {
235
+ "epoch": 0.01820020222446916,
236
+ "grad_norm": 0.9140625,
237
+ "learning_rate": 0.0003,
238
+ "loss": 4.0915069580078125,
239
+ "step": 540
240
+ },
241
+ {
242
+ "epoch": 0.01887428378833839,
243
+ "grad_norm": 1.2890625,
244
+ "learning_rate": 0.0003,
245
+ "loss": 4.031630325317383,
246
+ "step": 560
247
+ },
248
+ {
249
+ "epoch": 0.01954836535220762,
250
+ "grad_norm": 1.125,
251
+ "learning_rate": 0.0003,
252
+ "loss": 3.9763336181640625,
253
+ "step": 580
254
+ },
255
+ {
256
+ "epoch": 0.020222446916076844,
257
+ "grad_norm": 1.21875,
258
+ "learning_rate": 0.0003,
259
+ "loss": 3.9347896575927734,
260
+ "step": 600
261
+ },
262
+ {
263
+ "epoch": 0.020222446916076844,
264
+ "eval_loss": 3.9157378673553467,
265
+ "eval_runtime": 8.0606,
266
+ "eval_samples_per_second": 1181.917,
267
+ "eval_steps_per_second": 0.868,
268
+ "step": 600
269
+ },
270
+ {
271
+ "epoch": 0.020896528479946073,
272
+ "grad_norm": 1.1640625,
273
+ "learning_rate": 0.0003,
274
+ "loss": 3.878151702880859,
275
+ "step": 620
276
+ },
277
+ {
278
+ "epoch": 0.021570610043815303,
279
+ "grad_norm": 1.484375,
280
+ "learning_rate": 0.0003,
281
+ "loss": 3.855076217651367,
282
+ "step": 640
283
+ },
284
+ {
285
+ "epoch": 0.022244691607684528,
286
+ "grad_norm": 1.3359375,
287
+ "learning_rate": 0.0003,
288
+ "loss": 3.8232196807861327,
289
+ "step": 660
290
+ },
291
+ {
292
+ "epoch": 0.022918773171553757,
293
+ "grad_norm": 1.1640625,
294
+ "learning_rate": 0.0003,
295
+ "loss": 3.782532501220703,
296
+ "step": 680
297
+ },
298
+ {
299
+ "epoch": 0.023592854735422986,
300
+ "grad_norm": 1.1328125,
301
+ "learning_rate": 0.0003,
302
+ "loss": 3.7758609771728517,
303
+ "step": 700
304
+ },
305
+ {
306
+ "epoch": 0.023592854735422986,
307
+ "eval_loss": 3.7596347332000732,
308
+ "eval_runtime": 7.9743,
309
+ "eval_samples_per_second": 1194.709,
310
+ "eval_steps_per_second": 0.878,
311
+ "step": 700
312
+ },
313
+ {
314
+ "epoch": 0.024266936299292215,
315
+ "grad_norm": 1.25,
316
+ "learning_rate": 0.0003,
317
+ "loss": 3.7433414459228516,
318
+ "step": 720
319
+ },
320
+ {
321
+ "epoch": 0.02494101786316144,
322
+ "grad_norm": 1.3125,
323
+ "learning_rate": 0.0003,
324
+ "loss": 3.732330322265625,
325
+ "step": 740
326
+ },
327
+ {
328
+ "epoch": 0.02561509942703067,
329
+ "grad_norm": 1.265625,
330
+ "learning_rate": 0.0003,
331
+ "loss": 3.6843395233154297,
332
+ "step": 760
333
+ },
334
+ {
335
+ "epoch": 0.0262891809908999,
336
+ "grad_norm": 1.1640625,
337
+ "learning_rate": 0.0003,
338
+ "loss": 3.6463153839111326,
339
+ "step": 780
340
+ },
341
+ {
342
+ "epoch": 0.026963262554769128,
343
+ "grad_norm": 1.1171875,
344
+ "learning_rate": 0.0003,
345
+ "loss": 3.6544403076171874,
346
+ "step": 800
347
+ },
348
+ {
349
+ "epoch": 0.026963262554769128,
350
+ "eval_loss": 3.652294635772705,
351
+ "eval_runtime": 7.9753,
352
+ "eval_samples_per_second": 1194.559,
353
+ "eval_steps_per_second": 0.878,
354
+ "step": 800
355
+ },
356
+ {
357
+ "epoch": 0.027637344118638354,
358
+ "grad_norm": 1.1171875,
359
+ "learning_rate": 0.0003,
360
+ "loss": 3.6159641265869142,
361
+ "step": 820
362
+ },
363
+ {
364
+ "epoch": 0.028311425682507583,
365
+ "grad_norm": 1.078125,
366
+ "learning_rate": 0.0003,
367
+ "loss": 3.6099781036376952,
368
+ "step": 840
369
+ },
370
+ {
371
+ "epoch": 0.028985507246376812,
372
+ "grad_norm": 1.2734375,
373
+ "learning_rate": 0.0003,
374
+ "loss": 3.6344444274902346,
375
+ "step": 860
376
+ },
377
+ {
378
+ "epoch": 0.02965958881024604,
379
+ "grad_norm": 1.140625,
380
+ "learning_rate": 0.0003,
381
+ "loss": 3.5855178833007812,
382
+ "step": 880
383
+ },
384
+ {
385
+ "epoch": 0.030333670374115267,
386
+ "grad_norm": 1.109375,
387
+ "learning_rate": 0.0003,
388
+ "loss": 3.5488441467285154,
389
+ "step": 900
390
+ },
391
+ {
392
+ "epoch": 0.030333670374115267,
393
+ "eval_loss": 3.5648436546325684,
394
+ "eval_runtime": 8.321,
395
+ "eval_samples_per_second": 1144.931,
396
+ "eval_steps_per_second": 0.841,
397
+ "step": 900
398
+ },
399
+ {
400
+ "epoch": 0.031007751937984496,
401
+ "grad_norm": 1.1015625,
402
+ "learning_rate": 0.0003,
403
+ "loss": 3.5646598815917967,
404
+ "step": 920
405
+ },
406
+ {
407
+ "epoch": 0.031681833501853725,
408
+ "grad_norm": 1.25,
409
+ "learning_rate": 0.0003,
410
+ "loss": 3.5480445861816405,
411
+ "step": 940
412
+ },
413
+ {
414
+ "epoch": 0.032355915065722954,
415
+ "grad_norm": 1.140625,
416
+ "learning_rate": 0.0003,
417
+ "loss": 3.5140933990478516,
418
+ "step": 960
419
+ },
420
+ {
421
+ "epoch": 0.03302999662959218,
422
+ "grad_norm": 1.140625,
423
+ "learning_rate": 0.0003,
424
+ "loss": 3.501856231689453,
425
+ "step": 980
426
+ },
427
+ {
428
+ "epoch": 0.03370407819346141,
429
+ "grad_norm": 1.359375,
430
+ "learning_rate": 0.0003,
431
+ "loss": 3.500592803955078,
432
+ "step": 1000
433
+ },
434
+ {
435
+ "epoch": 0.03370407819346141,
436
+ "eval_loss": 3.4981162548065186,
437
+ "eval_runtime": 8.1013,
438
+ "eval_samples_per_second": 1175.987,
439
+ "eval_steps_per_second": 0.864,
440
+ "step": 1000
441
+ },
442
+ {
443
+ "epoch": 0.034378159757330634,
444
+ "grad_norm": 1.1328125,
445
+ "learning_rate": 0.0003,
446
+ "loss": 3.4914066314697267,
447
+ "step": 1020
448
+ },
449
+ {
450
+ "epoch": 0.03505224132119986,
451
+ "grad_norm": 1.1171875,
452
+ "learning_rate": 0.0003,
453
+ "loss": 3.474192810058594,
454
+ "step": 1040
455
+ },
456
+ {
457
+ "epoch": 0.03572632288506909,
458
+ "grad_norm": 1.28125,
459
+ "learning_rate": 0.0003,
460
+ "loss": 3.4552947998046877,
461
+ "step": 1060
462
+ },
463
+ {
464
+ "epoch": 0.03640040444893832,
465
+ "grad_norm": 1.203125,
466
+ "learning_rate": 0.0003,
467
+ "loss": 3.4411731719970704,
468
+ "step": 1080
469
+ },
470
+ {
471
+ "epoch": 0.03707448601280755,
472
+ "grad_norm": 1.2734375,
473
+ "learning_rate": 0.0003,
474
+ "loss": 3.435680389404297,
475
+ "step": 1100
476
+ },
477
+ {
478
+ "epoch": 0.03707448601280755,
479
+ "eval_loss": 3.445117712020874,
480
+ "eval_runtime": 8.1641,
481
+ "eval_samples_per_second": 1166.938,
482
+ "eval_steps_per_second": 0.857,
483
+ "step": 1100
484
+ },
485
+ {
486
+ "epoch": 0.03774856757667678,
487
+ "grad_norm": 1.03125,
488
+ "learning_rate": 0.0003,
489
+ "loss": 3.4368762969970703,
490
+ "step": 1120
491
+ },
492
+ {
493
+ "epoch": 0.03842264914054601,
494
+ "grad_norm": 1.2421875,
495
+ "learning_rate": 0.0003,
496
+ "loss": 3.410645294189453,
497
+ "step": 1140
498
+ },
499
+ {
500
+ "epoch": 0.03909673070441524,
501
+ "grad_norm": 1.0703125,
502
+ "learning_rate": 0.0003,
503
+ "loss": 3.4069515228271485,
504
+ "step": 1160
505
+ },
506
+ {
507
+ "epoch": 0.03977081226828446,
508
+ "grad_norm": 1.03125,
509
+ "learning_rate": 0.0003,
510
+ "loss": 3.4227649688720705,
511
+ "step": 1180
512
+ },
513
+ {
514
+ "epoch": 0.04044489383215369,
515
+ "grad_norm": 1.203125,
516
+ "learning_rate": 0.0003,
517
+ "loss": 3.3914558410644533,
518
+ "step": 1200
519
+ },
520
+ {
521
+ "epoch": 0.04044489383215369,
522
+ "eval_loss": 3.3945467472076416,
523
+ "eval_runtime": 8.0433,
524
+ "eval_samples_per_second": 1184.469,
525
+ "eval_steps_per_second": 0.87,
526
+ "step": 1200
527
+ },
528
+ {
529
+ "epoch": 0.04111897539602292,
530
+ "grad_norm": 1.0546875,
531
+ "learning_rate": 0.0003,
532
+ "loss": 3.3614086151123046,
533
+ "step": 1220
534
+ },
535
+ {
536
+ "epoch": 0.04179305695989215,
537
+ "grad_norm": 1.09375,
538
+ "learning_rate": 0.0003,
539
+ "loss": 3.3790237426757814,
540
+ "step": 1240
541
+ },
542
+ {
543
+ "epoch": 0.042467138523761376,
544
+ "grad_norm": 1.3515625,
545
+ "learning_rate": 0.0003,
546
+ "loss": 3.38794059753418,
547
+ "step": 1260
548
+ },
549
+ {
550
+ "epoch": 0.043141220087630605,
551
+ "grad_norm": 1.28125,
552
+ "learning_rate": 0.0003,
553
+ "loss": 3.3654109954833986,
554
+ "step": 1280
555
+ },
556
+ {
557
+ "epoch": 0.043815301651499834,
558
+ "grad_norm": 1.1796875,
559
+ "learning_rate": 0.0003,
560
+ "loss": 3.3572288513183595,
561
+ "step": 1300
562
+ },
563
+ {
564
+ "epoch": 0.043815301651499834,
565
+ "eval_loss": 3.3501007556915283,
566
+ "eval_runtime": 8.0621,
567
+ "eval_samples_per_second": 1181.702,
568
+ "eval_steps_per_second": 0.868,
569
+ "step": 1300
570
+ },
571
+ {
572
+ "epoch": 0.044489383215369056,
573
+ "grad_norm": 1.2734375,
574
+ "learning_rate": 0.0003,
575
+ "loss": 3.321734619140625,
576
+ "step": 1320
577
+ },
578
+ {
579
+ "epoch": 0.045163464779238285,
580
+ "grad_norm": 1.2890625,
581
+ "learning_rate": 0.0003,
582
+ "loss": 3.3493595123291016,
583
+ "step": 1340
584
+ },
585
+ {
586
+ "epoch": 0.045837546343107514,
587
+ "grad_norm": 1.1875,
588
+ "learning_rate": 0.0003,
589
+ "loss": 3.3272212982177733,
590
+ "step": 1360
591
+ },
592
+ {
593
+ "epoch": 0.046511627906976744,
594
+ "grad_norm": 1.1328125,
595
+ "learning_rate": 0.0003,
596
+ "loss": 3.3202045440673826,
597
+ "step": 1380
598
+ },
599
+ {
600
+ "epoch": 0.04718570947084597,
601
+ "grad_norm": 1.1171875,
602
+ "learning_rate": 0.0003,
603
+ "loss": 3.2998809814453125,
604
+ "step": 1400
605
+ },
606
+ {
607
+ "epoch": 0.04718570947084597,
608
+ "eval_loss": 3.311476707458496,
609
+ "eval_runtime": 8.1361,
610
+ "eval_samples_per_second": 1170.957,
611
+ "eval_steps_per_second": 0.86,
612
+ "step": 1400
613
+ },
614
+ {
615
+ "epoch": 0.0478597910347152,
616
+ "grad_norm": 1.140625,
617
+ "learning_rate": 0.0003,
618
+ "loss": 3.3057735443115233,
619
+ "step": 1420
620
+ },
621
+ {
622
+ "epoch": 0.04853387259858443,
623
+ "grad_norm": 1.109375,
624
+ "learning_rate": 0.0003,
625
+ "loss": 3.2907379150390623,
626
+ "step": 1440
627
+ },
628
+ {
629
+ "epoch": 0.04920795416245366,
630
+ "grad_norm": 1.078125,
631
+ "learning_rate": 0.0003,
632
+ "loss": 3.264795684814453,
633
+ "step": 1460
634
+ },
635
+ {
636
+ "epoch": 0.04988203572632288,
637
+ "grad_norm": 1.3671875,
638
+ "learning_rate": 0.0003,
639
+ "loss": 3.2918243408203125,
640
+ "step": 1480
641
+ },
642
+ {
643
+ "epoch": 0.05055611729019211,
644
+ "grad_norm": 1.2421875,
645
+ "learning_rate": 0.0003,
646
+ "loss": 3.2844181060791016,
647
+ "step": 1500
648
+ },
649
+ {
650
+ "epoch": 0.05055611729019211,
651
+ "eval_loss": 3.277984142303467,
652
+ "eval_runtime": 8.0313,
653
+ "eval_samples_per_second": 1186.24,
654
+ "eval_steps_per_second": 0.872,
655
+ "step": 1500
656
+ },
657
+ {
658
+ "epoch": 0.05123019885406134,
659
+ "grad_norm": 1.265625,
660
+ "learning_rate": 0.0003,
661
+ "loss": 3.2729434967041016,
662
+ "step": 1520
663
+ },
664
+ {
665
+ "epoch": 0.05190428041793057,
666
+ "grad_norm": 1.1015625,
667
+ "learning_rate": 0.0003,
668
+ "loss": 3.279766845703125,
669
+ "step": 1540
670
+ },
671
+ {
672
+ "epoch": 0.0525783619817998,
673
+ "grad_norm": 1.25,
674
+ "learning_rate": 0.0003,
675
+ "loss": 3.281978988647461,
676
+ "step": 1560
677
+ },
678
+ {
679
+ "epoch": 0.05325244354566903,
680
+ "grad_norm": 1.125,
681
+ "learning_rate": 0.0003,
682
+ "loss": 3.2608470916748047,
683
+ "step": 1580
684
+ },
685
+ {
686
+ "epoch": 0.053926525109538256,
687
+ "grad_norm": 1.2265625,
688
+ "learning_rate": 0.0003,
689
+ "loss": 3.2503360748291015,
690
+ "step": 1600
691
+ },
692
+ {
693
+ "epoch": 0.053926525109538256,
694
+ "eval_loss": 3.2511110305786133,
695
+ "eval_runtime": 8.097,
696
+ "eval_samples_per_second": 1176.602,
697
+ "eval_steps_per_second": 0.865,
698
+ "step": 1600
699
+ },
700
+ {
701
+ "epoch": 0.054600606673407485,
702
+ "grad_norm": 1.234375,
703
+ "learning_rate": 0.0003,
704
+ "loss": 3.2713451385498047,
705
+ "step": 1620
706
+ },
707
+ {
708
+ "epoch": 0.05527468823727671,
709
+ "grad_norm": 1.015625,
710
+ "learning_rate": 0.0003,
711
+ "loss": 3.2468338012695312,
712
+ "step": 1640
713
+ },
714
+ {
715
+ "epoch": 0.05594876980114594,
716
+ "grad_norm": 1.15625,
717
+ "learning_rate": 0.0003,
718
+ "loss": 3.255104827880859,
719
+ "step": 1660
720
+ },
721
+ {
722
+ "epoch": 0.056622851365015166,
723
+ "grad_norm": 1.1875,
724
+ "learning_rate": 0.0003,
725
+ "loss": 3.2280048370361327,
726
+ "step": 1680
727
+ },
728
+ {
729
+ "epoch": 0.057296932928884395,
730
+ "grad_norm": 1.265625,
731
+ "learning_rate": 0.0003,
732
+ "loss": 3.216978073120117,
733
+ "step": 1700
734
+ },
735
+ {
736
+ "epoch": 0.057296932928884395,
737
+ "eval_loss": 3.2238714694976807,
738
+ "eval_runtime": 8.059,
739
+ "eval_samples_per_second": 1182.16,
740
+ "eval_steps_per_second": 0.869,
741
+ "step": 1700
742
+ },
743
+ {
744
+ "epoch": 0.057971014492753624,
745
+ "grad_norm": 1.125,
746
+ "learning_rate": 0.0003,
747
+ "loss": 3.213521194458008,
748
+ "step": 1720
749
+ },
750
+ {
751
+ "epoch": 0.05864509605662285,
752
+ "grad_norm": 1.234375,
753
+ "learning_rate": 0.0003,
754
+ "loss": 3.2087985992431642,
755
+ "step": 1740
756
+ },
757
+ {
758
+ "epoch": 0.05931917762049208,
759
+ "grad_norm": 1.2109375,
760
+ "learning_rate": 0.0003,
761
+ "loss": 3.198755645751953,
762
+ "step": 1760
763
+ },
764
+ {
765
+ "epoch": 0.05999325918436131,
766
+ "grad_norm": 1.4453125,
767
+ "learning_rate": 0.0003,
768
+ "loss": 3.2067222595214844,
769
+ "step": 1780
770
+ },
771
+ {
772
+ "epoch": 0.06066734074823053,
773
+ "grad_norm": 1.140625,
774
+ "learning_rate": 0.0003,
775
+ "loss": 3.195578956604004,
776
+ "step": 1800
777
+ },
778
+ {
779
+ "epoch": 0.06066734074823053,
780
+ "eval_loss": 3.1985833644866943,
781
+ "eval_runtime": 8.2334,
782
+ "eval_samples_per_second": 1157.109,
783
+ "eval_steps_per_second": 0.85,
784
+ "step": 1800
785
+ },
786
+ {
787
+ "epoch": 0.06134142231209976,
788
+ "grad_norm": 1.1640625,
789
+ "learning_rate": 0.0003,
790
+ "loss": 3.186159133911133,
791
+ "step": 1820
792
+ },
793
+ {
794
+ "epoch": 0.06201550387596899,
795
+ "grad_norm": 1.21875,
796
+ "learning_rate": 0.0003,
797
+ "loss": 3.1850618362426757,
798
+ "step": 1840
799
+ },
800
+ {
801
+ "epoch": 0.06268958543983821,
802
+ "grad_norm": 1.3515625,
803
+ "learning_rate": 0.0003,
804
+ "loss": 3.1967243194580077,
805
+ "step": 1860
806
+ },
807
+ {
808
+ "epoch": 0.06336366700370745,
809
+ "grad_norm": 1.3125,
810
+ "learning_rate": 0.0003,
811
+ "loss": 3.1668914794921874,
812
+ "step": 1880
813
+ },
814
+ {
815
+ "epoch": 0.06403774856757667,
816
+ "grad_norm": 1.1484375,
817
+ "learning_rate": 0.0003,
818
+ "loss": 3.1733448028564455,
819
+ "step": 1900
820
+ },
821
+ {
822
+ "epoch": 0.06403774856757667,
823
+ "eval_loss": 3.1766083240509033,
824
+ "eval_runtime": 7.9724,
825
+ "eval_samples_per_second": 1194.991,
826
+ "eval_steps_per_second": 0.878,
827
+ "step": 1900
828
+ },
829
+ {
830
+ "epoch": 0.06471183013144591,
831
+ "grad_norm": 1.1953125,
832
+ "learning_rate": 0.0003,
833
+ "loss": 3.1606868743896483,
834
+ "step": 1920
835
+ },
836
+ {
837
+ "epoch": 0.06538591169531513,
838
+ "grad_norm": 1.109375,
839
+ "learning_rate": 0.0003,
840
+ "loss": 3.148599052429199,
841
+ "step": 1940
842
+ },
843
+ {
844
+ "epoch": 0.06605999325918437,
845
+ "grad_norm": 1.2265625,
846
+ "learning_rate": 0.0003,
847
+ "loss": 3.1723419189453126,
848
+ "step": 1960
849
+ },
850
+ {
851
+ "epoch": 0.06673407482305359,
852
+ "grad_norm": 1.234375,
853
+ "learning_rate": 0.0003,
854
+ "loss": 3.184863471984863,
855
+ "step": 1980
856
+ },
857
+ {
858
+ "epoch": 0.06740815638692282,
859
+ "grad_norm": 1.2734375,
860
+ "learning_rate": 0.0003,
861
+ "loss": 3.158551788330078,
862
+ "step": 2000
863
+ },
864
+ {
865
+ "epoch": 0.06740815638692282,
866
+ "eval_loss": 3.154155731201172,
867
+ "eval_runtime": 7.9931,
868
+ "eval_samples_per_second": 1191.905,
869
+ "eval_steps_per_second": 0.876,
870
+ "step": 2000
871
+ },
872
+ {
873
+ "epoch": 0.06808223795079205,
874
+ "grad_norm": 1.2734375,
875
+ "learning_rate": 0.0003,
876
+ "loss": 3.147844696044922,
877
+ "step": 2020
878
+ },
879
+ {
880
+ "epoch": 0.06875631951466127,
881
+ "grad_norm": 1.1796875,
882
+ "learning_rate": 0.0003,
883
+ "loss": 3.149020957946777,
884
+ "step": 2040
885
+ },
886
+ {
887
+ "epoch": 0.0694304010785305,
888
+ "grad_norm": 1.234375,
889
+ "learning_rate": 0.0003,
890
+ "loss": 3.1382816314697264,
891
+ "step": 2060
892
+ },
893
+ {
894
+ "epoch": 0.07010448264239973,
895
+ "grad_norm": 1.203125,
896
+ "learning_rate": 0.0003,
897
+ "loss": 3.1440708160400392,
898
+ "step": 2080
899
+ },
900
+ {
901
+ "epoch": 0.07077856420626896,
902
+ "grad_norm": 1.1171875,
903
+ "learning_rate": 0.0003,
904
+ "loss": 3.132351875305176,
905
+ "step": 2100
906
+ },
907
+ {
908
+ "epoch": 0.07077856420626896,
909
+ "eval_loss": 3.1331419944763184,
910
+ "eval_runtime": 8.2456,
911
+ "eval_samples_per_second": 1155.405,
912
+ "eval_steps_per_second": 0.849,
913
+ "step": 2100
914
+ },
915
+ {
916
+ "epoch": 0.07145264577013818,
917
+ "grad_norm": 1.109375,
918
+ "learning_rate": 0.0003,
919
+ "loss": 3.1341459274291994,
920
+ "step": 2120
921
+ },
922
+ {
923
+ "epoch": 0.07212672733400742,
924
+ "grad_norm": 1.1640625,
925
+ "learning_rate": 0.0003,
926
+ "loss": 3.1331857681274413,
927
+ "step": 2140
928
+ },
929
+ {
930
+ "epoch": 0.07280080889787664,
931
+ "grad_norm": 1.1796875,
932
+ "learning_rate": 0.0003,
933
+ "loss": 3.1179393768310546,
934
+ "step": 2160
935
+ },
936
+ {
937
+ "epoch": 0.07347489046174586,
938
+ "grad_norm": 1.546875,
939
+ "learning_rate": 0.0003,
940
+ "loss": 3.1271270751953124,
941
+ "step": 2180
942
+ },
943
+ {
944
+ "epoch": 0.0741489720256151,
945
+ "grad_norm": 1.234375,
946
+ "learning_rate": 0.0003,
947
+ "loss": 3.1252058029174803,
948
+ "step": 2200
949
+ },
950
+ {
951
+ "epoch": 0.0741489720256151,
952
+ "eval_loss": 3.1193113327026367,
953
+ "eval_runtime": 8.0852,
954
+ "eval_samples_per_second": 1178.326,
955
+ "eval_steps_per_second": 0.866,
956
+ "step": 2200
957
+ }
958
+ ],
959
+ "logging_steps": 20,
960
+ "max_steps": 2500,
961
+ "num_input_tokens_seen": 0,
962
+ "num_train_epochs": 1,
963
+ "save_steps": 100,
964
+ "stateful_callbacks": {
965
+ "TrainerControl": {
966
+ "args": {
967
+ "should_epoch_stop": false,
968
+ "should_evaluate": false,
969
+ "should_log": false,
970
+ "should_save": true,
971
+ "should_training_stop": false
972
+ },
973
+ "attributes": {}
974
+ }
975
+ },
976
+ "total_flos": 319427287449600.0,
977
+ "train_batch_size": 32,
978
+ "trial_name": null,
979
+ "trial_params": null
980
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2200/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a761b578cf2b8c248f28bd1b61a5ec7d0b5d3801c8bd793a6db706df1d3078f6
3
+ size 4920
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/config.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "squared_relu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 9,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "powlu_m": 3.0,
25
+ "pretraining_tp": 1,
26
+ "rms_norm_eps": 1e-06,
27
+ "rope_parameters": {
28
+ "rope_theta": 10000.0,
29
+ "rope_type": "default"
30
+ },
31
+ "tie_word_embeddings": true,
32
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
33
+ "transformers_version": "5.16.0.dev0",
34
+ "use_cache": false,
35
+ "vocab_size": 4096,
36
+ "waleed_beta": 10.0
37
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e53ea93ef74931e3a08ab9b4c02109ce2ff0565543222e9bde1f1b90d0e12288
3
+ size 4010544
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:56dcf09f0b8195b3b51196279f3ec72e9e7e3fe5a008ca3bc97a6c221907a668
3
+ size 8068282
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ed84324664a63913fe5c29a818cb67e7aa68822c0b51f712812da2a667aa578c
3
+ size 14244
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c15f7cedf7769027fdf6ebd2e8f7385a6ae528697209f7b99f6e4666af50bf85
3
+ size 1064
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/trainer_state.json ADDED
@@ -0,0 +1,1023 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.07751937984496124,
6
+ "eval_steps": 100,
7
+ "global_step": 2300,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0006740815638692282,
14
+ "grad_norm": 2.71875,
15
+ "learning_rate": 1.14e-05,
16
+ "loss": 8.314944458007812,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0013481631277384564,
21
+ "grad_norm": 1.8515625,
22
+ "learning_rate": 2.34e-05,
23
+ "loss": 8.251383972167968,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.0020222446916076846,
28
+ "grad_norm": 1.3203125,
29
+ "learning_rate": 3.539999999999999e-05,
30
+ "loss": 8.104505920410157,
31
+ "step": 60
32
+ },
33
+ {
34
+ "epoch": 0.002696326255476913,
35
+ "grad_norm": 1.296875,
36
+ "learning_rate": 4.7399999999999993e-05,
37
+ "loss": 7.968361663818359,
38
+ "step": 80
39
+ },
40
+ {
41
+ "epoch": 0.003370407819346141,
42
+ "grad_norm": 1.2578125,
43
+ "learning_rate": 5.94e-05,
44
+ "loss": 7.804827880859375,
45
+ "step": 100
46
+ },
47
+ {
48
+ "epoch": 0.003370407819346141,
49
+ "eval_loss": 7.703802585601807,
50
+ "eval_runtime": 8.0325,
51
+ "eval_samples_per_second": 1186.059,
52
+ "eval_steps_per_second": 0.871,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.004044489383215369,
57
+ "grad_norm": 1.2734375,
58
+ "learning_rate": 7.139999999999999e-05,
59
+ "loss": 7.600141906738282,
60
+ "step": 120
61
+ },
62
+ {
63
+ "epoch": 0.0047185709470845974,
64
+ "grad_norm": 1.265625,
65
+ "learning_rate": 8.34e-05,
66
+ "loss": 7.368203735351562,
67
+ "step": 140
68
+ },
69
+ {
70
+ "epoch": 0.005392652510953826,
71
+ "grad_norm": 1.265625,
72
+ "learning_rate": 9.539999999999999e-05,
73
+ "loss": 7.133045196533203,
74
+ "step": 160
75
+ },
76
+ {
77
+ "epoch": 0.006066734074823054,
78
+ "grad_norm": 1.203125,
79
+ "learning_rate": 0.00010739999999999998,
80
+ "loss": 6.885277557373047,
81
+ "step": 180
82
+ },
83
+ {
84
+ "epoch": 0.006740815638692282,
85
+ "grad_norm": 1.15625,
86
+ "learning_rate": 0.0001194,
87
+ "loss": 6.629558563232422,
88
+ "step": 200
89
+ },
90
+ {
91
+ "epoch": 0.006740815638692282,
92
+ "eval_loss": 6.4997687339782715,
93
+ "eval_runtime": 7.9479,
94
+ "eval_samples_per_second": 1198.683,
95
+ "eval_steps_per_second": 0.881,
96
+ "step": 200
97
+ },
98
+ {
99
+ "epoch": 0.00741489720256151,
100
+ "grad_norm": 1.109375,
101
+ "learning_rate": 0.0001314,
102
+ "loss": 6.391195297241211,
103
+ "step": 220
104
+ },
105
+ {
106
+ "epoch": 0.008088978766430738,
107
+ "grad_norm": 1.21875,
108
+ "learning_rate": 0.0001434,
109
+ "loss": 6.139227676391601,
110
+ "step": 240
111
+ },
112
+ {
113
+ "epoch": 0.008763060330299966,
114
+ "grad_norm": 1.0625,
115
+ "learning_rate": 0.00015539999999999998,
116
+ "loss": 5.917041778564453,
117
+ "step": 260
118
+ },
119
+ {
120
+ "epoch": 0.009437141894169195,
121
+ "grad_norm": 1.1015625,
122
+ "learning_rate": 0.0001674,
123
+ "loss": 5.702054595947265,
124
+ "step": 280
125
+ },
126
+ {
127
+ "epoch": 0.010111223458038422,
128
+ "grad_norm": 0.921875,
129
+ "learning_rate": 0.00017939999999999997,
130
+ "loss": 5.500263214111328,
131
+ "step": 300
132
+ },
133
+ {
134
+ "epoch": 0.010111223458038422,
135
+ "eval_loss": 5.393505573272705,
136
+ "eval_runtime": 8.0449,
137
+ "eval_samples_per_second": 1184.223,
138
+ "eval_steps_per_second": 0.87,
139
+ "step": 300
140
+ },
141
+ {
142
+ "epoch": 0.010785305021907651,
143
+ "grad_norm": 2.5,
144
+ "learning_rate": 0.0001914,
145
+ "loss": 5.319306182861328,
146
+ "step": 320
147
+ },
148
+ {
149
+ "epoch": 0.011459386585776879,
150
+ "grad_norm": 1.078125,
151
+ "learning_rate": 0.00020339999999999998,
152
+ "loss": 5.202053070068359,
153
+ "step": 340
154
+ },
155
+ {
156
+ "epoch": 0.012133468149646108,
157
+ "grad_norm": 1.3203125,
158
+ "learning_rate": 0.00021539999999999998,
159
+ "loss": 5.020883941650391,
160
+ "step": 360
161
+ },
162
+ {
163
+ "epoch": 0.012807549713515335,
164
+ "grad_norm": 1.1171875,
165
+ "learning_rate": 0.00022739999999999997,
166
+ "loss": 4.873059844970703,
167
+ "step": 380
168
+ },
169
+ {
170
+ "epoch": 0.013481631277384564,
171
+ "grad_norm": 1.234375,
172
+ "learning_rate": 0.0002394,
173
+ "loss": 4.741780853271484,
174
+ "step": 400
175
+ },
176
+ {
177
+ "epoch": 0.013481631277384564,
178
+ "eval_loss": 4.676144123077393,
179
+ "eval_runtime": 8.0457,
180
+ "eval_samples_per_second": 1184.113,
181
+ "eval_steps_per_second": 0.87,
182
+ "step": 400
183
+ },
184
+ {
185
+ "epoch": 0.014155712841253791,
186
+ "grad_norm": 1.3046875,
187
+ "learning_rate": 0.0002514,
188
+ "loss": 4.606548690795899,
189
+ "step": 420
190
+ },
191
+ {
192
+ "epoch": 0.01482979440512302,
193
+ "grad_norm": 1.2578125,
194
+ "learning_rate": 0.00026339999999999995,
195
+ "loss": 4.515376281738281,
196
+ "step": 440
197
+ },
198
+ {
199
+ "epoch": 0.015503875968992248,
200
+ "grad_norm": 1.0625,
201
+ "learning_rate": 0.00027539999999999997,
202
+ "loss": 4.416887664794922,
203
+ "step": 460
204
+ },
205
+ {
206
+ "epoch": 0.016177957532861477,
207
+ "grad_norm": 1.3671875,
208
+ "learning_rate": 0.00028739999999999994,
209
+ "loss": 4.3046520233154295,
210
+ "step": 480
211
+ },
212
+ {
213
+ "epoch": 0.016852039096730706,
214
+ "grad_norm": 1.2109375,
215
+ "learning_rate": 0.00029939999999999996,
216
+ "loss": 4.238706970214844,
217
+ "step": 500
218
+ },
219
+ {
220
+ "epoch": 0.016852039096730706,
221
+ "eval_loss": 4.196270942687988,
222
+ "eval_runtime": 7.9301,
223
+ "eval_samples_per_second": 1201.377,
224
+ "eval_steps_per_second": 0.883,
225
+ "step": 500
226
+ },
227
+ {
228
+ "epoch": 0.01752612066059993,
229
+ "grad_norm": 0.97265625,
230
+ "learning_rate": 0.0003,
231
+ "loss": 4.1756237030029295,
232
+ "step": 520
233
+ },
234
+ {
235
+ "epoch": 0.01820020222446916,
236
+ "grad_norm": 0.9140625,
237
+ "learning_rate": 0.0003,
238
+ "loss": 4.0915069580078125,
239
+ "step": 540
240
+ },
241
+ {
242
+ "epoch": 0.01887428378833839,
243
+ "grad_norm": 1.2890625,
244
+ "learning_rate": 0.0003,
245
+ "loss": 4.031630325317383,
246
+ "step": 560
247
+ },
248
+ {
249
+ "epoch": 0.01954836535220762,
250
+ "grad_norm": 1.125,
251
+ "learning_rate": 0.0003,
252
+ "loss": 3.9763336181640625,
253
+ "step": 580
254
+ },
255
+ {
256
+ "epoch": 0.020222446916076844,
257
+ "grad_norm": 1.21875,
258
+ "learning_rate": 0.0003,
259
+ "loss": 3.9347896575927734,
260
+ "step": 600
261
+ },
262
+ {
263
+ "epoch": 0.020222446916076844,
264
+ "eval_loss": 3.9157378673553467,
265
+ "eval_runtime": 8.0606,
266
+ "eval_samples_per_second": 1181.917,
267
+ "eval_steps_per_second": 0.868,
268
+ "step": 600
269
+ },
270
+ {
271
+ "epoch": 0.020896528479946073,
272
+ "grad_norm": 1.1640625,
273
+ "learning_rate": 0.0003,
274
+ "loss": 3.878151702880859,
275
+ "step": 620
276
+ },
277
+ {
278
+ "epoch": 0.021570610043815303,
279
+ "grad_norm": 1.484375,
280
+ "learning_rate": 0.0003,
281
+ "loss": 3.855076217651367,
282
+ "step": 640
283
+ },
284
+ {
285
+ "epoch": 0.022244691607684528,
286
+ "grad_norm": 1.3359375,
287
+ "learning_rate": 0.0003,
288
+ "loss": 3.8232196807861327,
289
+ "step": 660
290
+ },
291
+ {
292
+ "epoch": 0.022918773171553757,
293
+ "grad_norm": 1.1640625,
294
+ "learning_rate": 0.0003,
295
+ "loss": 3.782532501220703,
296
+ "step": 680
297
+ },
298
+ {
299
+ "epoch": 0.023592854735422986,
300
+ "grad_norm": 1.1328125,
301
+ "learning_rate": 0.0003,
302
+ "loss": 3.7758609771728517,
303
+ "step": 700
304
+ },
305
+ {
306
+ "epoch": 0.023592854735422986,
307
+ "eval_loss": 3.7596347332000732,
308
+ "eval_runtime": 7.9743,
309
+ "eval_samples_per_second": 1194.709,
310
+ "eval_steps_per_second": 0.878,
311
+ "step": 700
312
+ },
313
+ {
314
+ "epoch": 0.024266936299292215,
315
+ "grad_norm": 1.25,
316
+ "learning_rate": 0.0003,
317
+ "loss": 3.7433414459228516,
318
+ "step": 720
319
+ },
320
+ {
321
+ "epoch": 0.02494101786316144,
322
+ "grad_norm": 1.3125,
323
+ "learning_rate": 0.0003,
324
+ "loss": 3.732330322265625,
325
+ "step": 740
326
+ },
327
+ {
328
+ "epoch": 0.02561509942703067,
329
+ "grad_norm": 1.265625,
330
+ "learning_rate": 0.0003,
331
+ "loss": 3.6843395233154297,
332
+ "step": 760
333
+ },
334
+ {
335
+ "epoch": 0.0262891809908999,
336
+ "grad_norm": 1.1640625,
337
+ "learning_rate": 0.0003,
338
+ "loss": 3.6463153839111326,
339
+ "step": 780
340
+ },
341
+ {
342
+ "epoch": 0.026963262554769128,
343
+ "grad_norm": 1.1171875,
344
+ "learning_rate": 0.0003,
345
+ "loss": 3.6544403076171874,
346
+ "step": 800
347
+ },
348
+ {
349
+ "epoch": 0.026963262554769128,
350
+ "eval_loss": 3.652294635772705,
351
+ "eval_runtime": 7.9753,
352
+ "eval_samples_per_second": 1194.559,
353
+ "eval_steps_per_second": 0.878,
354
+ "step": 800
355
+ },
356
+ {
357
+ "epoch": 0.027637344118638354,
358
+ "grad_norm": 1.1171875,
359
+ "learning_rate": 0.0003,
360
+ "loss": 3.6159641265869142,
361
+ "step": 820
362
+ },
363
+ {
364
+ "epoch": 0.028311425682507583,
365
+ "grad_norm": 1.078125,
366
+ "learning_rate": 0.0003,
367
+ "loss": 3.6099781036376952,
368
+ "step": 840
369
+ },
370
+ {
371
+ "epoch": 0.028985507246376812,
372
+ "grad_norm": 1.2734375,
373
+ "learning_rate": 0.0003,
374
+ "loss": 3.6344444274902346,
375
+ "step": 860
376
+ },
377
+ {
378
+ "epoch": 0.02965958881024604,
379
+ "grad_norm": 1.140625,
380
+ "learning_rate": 0.0003,
381
+ "loss": 3.5855178833007812,
382
+ "step": 880
383
+ },
384
+ {
385
+ "epoch": 0.030333670374115267,
386
+ "grad_norm": 1.109375,
387
+ "learning_rate": 0.0003,
388
+ "loss": 3.5488441467285154,
389
+ "step": 900
390
+ },
391
+ {
392
+ "epoch": 0.030333670374115267,
393
+ "eval_loss": 3.5648436546325684,
394
+ "eval_runtime": 8.321,
395
+ "eval_samples_per_second": 1144.931,
396
+ "eval_steps_per_second": 0.841,
397
+ "step": 900
398
+ },
399
+ {
400
+ "epoch": 0.031007751937984496,
401
+ "grad_norm": 1.1015625,
402
+ "learning_rate": 0.0003,
403
+ "loss": 3.5646598815917967,
404
+ "step": 920
405
+ },
406
+ {
407
+ "epoch": 0.031681833501853725,
408
+ "grad_norm": 1.25,
409
+ "learning_rate": 0.0003,
410
+ "loss": 3.5480445861816405,
411
+ "step": 940
412
+ },
413
+ {
414
+ "epoch": 0.032355915065722954,
415
+ "grad_norm": 1.140625,
416
+ "learning_rate": 0.0003,
417
+ "loss": 3.5140933990478516,
418
+ "step": 960
419
+ },
420
+ {
421
+ "epoch": 0.03302999662959218,
422
+ "grad_norm": 1.140625,
423
+ "learning_rate": 0.0003,
424
+ "loss": 3.501856231689453,
425
+ "step": 980
426
+ },
427
+ {
428
+ "epoch": 0.03370407819346141,
429
+ "grad_norm": 1.359375,
430
+ "learning_rate": 0.0003,
431
+ "loss": 3.500592803955078,
432
+ "step": 1000
433
+ },
434
+ {
435
+ "epoch": 0.03370407819346141,
436
+ "eval_loss": 3.4981162548065186,
437
+ "eval_runtime": 8.1013,
438
+ "eval_samples_per_second": 1175.987,
439
+ "eval_steps_per_second": 0.864,
440
+ "step": 1000
441
+ },
442
+ {
443
+ "epoch": 0.034378159757330634,
444
+ "grad_norm": 1.1328125,
445
+ "learning_rate": 0.0003,
446
+ "loss": 3.4914066314697267,
447
+ "step": 1020
448
+ },
449
+ {
450
+ "epoch": 0.03505224132119986,
451
+ "grad_norm": 1.1171875,
452
+ "learning_rate": 0.0003,
453
+ "loss": 3.474192810058594,
454
+ "step": 1040
455
+ },
456
+ {
457
+ "epoch": 0.03572632288506909,
458
+ "grad_norm": 1.28125,
459
+ "learning_rate": 0.0003,
460
+ "loss": 3.4552947998046877,
461
+ "step": 1060
462
+ },
463
+ {
464
+ "epoch": 0.03640040444893832,
465
+ "grad_norm": 1.203125,
466
+ "learning_rate": 0.0003,
467
+ "loss": 3.4411731719970704,
468
+ "step": 1080
469
+ },
470
+ {
471
+ "epoch": 0.03707448601280755,
472
+ "grad_norm": 1.2734375,
473
+ "learning_rate": 0.0003,
474
+ "loss": 3.435680389404297,
475
+ "step": 1100
476
+ },
477
+ {
478
+ "epoch": 0.03707448601280755,
479
+ "eval_loss": 3.445117712020874,
480
+ "eval_runtime": 8.1641,
481
+ "eval_samples_per_second": 1166.938,
482
+ "eval_steps_per_second": 0.857,
483
+ "step": 1100
484
+ },
485
+ {
486
+ "epoch": 0.03774856757667678,
487
+ "grad_norm": 1.03125,
488
+ "learning_rate": 0.0003,
489
+ "loss": 3.4368762969970703,
490
+ "step": 1120
491
+ },
492
+ {
493
+ "epoch": 0.03842264914054601,
494
+ "grad_norm": 1.2421875,
495
+ "learning_rate": 0.0003,
496
+ "loss": 3.410645294189453,
497
+ "step": 1140
498
+ },
499
+ {
500
+ "epoch": 0.03909673070441524,
501
+ "grad_norm": 1.0703125,
502
+ "learning_rate": 0.0003,
503
+ "loss": 3.4069515228271485,
504
+ "step": 1160
505
+ },
506
+ {
507
+ "epoch": 0.03977081226828446,
508
+ "grad_norm": 1.03125,
509
+ "learning_rate": 0.0003,
510
+ "loss": 3.4227649688720705,
511
+ "step": 1180
512
+ },
513
+ {
514
+ "epoch": 0.04044489383215369,
515
+ "grad_norm": 1.203125,
516
+ "learning_rate": 0.0003,
517
+ "loss": 3.3914558410644533,
518
+ "step": 1200
519
+ },
520
+ {
521
+ "epoch": 0.04044489383215369,
522
+ "eval_loss": 3.3945467472076416,
523
+ "eval_runtime": 8.0433,
524
+ "eval_samples_per_second": 1184.469,
525
+ "eval_steps_per_second": 0.87,
526
+ "step": 1200
527
+ },
528
+ {
529
+ "epoch": 0.04111897539602292,
530
+ "grad_norm": 1.0546875,
531
+ "learning_rate": 0.0003,
532
+ "loss": 3.3614086151123046,
533
+ "step": 1220
534
+ },
535
+ {
536
+ "epoch": 0.04179305695989215,
537
+ "grad_norm": 1.09375,
538
+ "learning_rate": 0.0003,
539
+ "loss": 3.3790237426757814,
540
+ "step": 1240
541
+ },
542
+ {
543
+ "epoch": 0.042467138523761376,
544
+ "grad_norm": 1.3515625,
545
+ "learning_rate": 0.0003,
546
+ "loss": 3.38794059753418,
547
+ "step": 1260
548
+ },
549
+ {
550
+ "epoch": 0.043141220087630605,
551
+ "grad_norm": 1.28125,
552
+ "learning_rate": 0.0003,
553
+ "loss": 3.3654109954833986,
554
+ "step": 1280
555
+ },
556
+ {
557
+ "epoch": 0.043815301651499834,
558
+ "grad_norm": 1.1796875,
559
+ "learning_rate": 0.0003,
560
+ "loss": 3.3572288513183595,
561
+ "step": 1300
562
+ },
563
+ {
564
+ "epoch": 0.043815301651499834,
565
+ "eval_loss": 3.3501007556915283,
566
+ "eval_runtime": 8.0621,
567
+ "eval_samples_per_second": 1181.702,
568
+ "eval_steps_per_second": 0.868,
569
+ "step": 1300
570
+ },
571
+ {
572
+ "epoch": 0.044489383215369056,
573
+ "grad_norm": 1.2734375,
574
+ "learning_rate": 0.0003,
575
+ "loss": 3.321734619140625,
576
+ "step": 1320
577
+ },
578
+ {
579
+ "epoch": 0.045163464779238285,
580
+ "grad_norm": 1.2890625,
581
+ "learning_rate": 0.0003,
582
+ "loss": 3.3493595123291016,
583
+ "step": 1340
584
+ },
585
+ {
586
+ "epoch": 0.045837546343107514,
587
+ "grad_norm": 1.1875,
588
+ "learning_rate": 0.0003,
589
+ "loss": 3.3272212982177733,
590
+ "step": 1360
591
+ },
592
+ {
593
+ "epoch": 0.046511627906976744,
594
+ "grad_norm": 1.1328125,
595
+ "learning_rate": 0.0003,
596
+ "loss": 3.3202045440673826,
597
+ "step": 1380
598
+ },
599
+ {
600
+ "epoch": 0.04718570947084597,
601
+ "grad_norm": 1.1171875,
602
+ "learning_rate": 0.0003,
603
+ "loss": 3.2998809814453125,
604
+ "step": 1400
605
+ },
606
+ {
607
+ "epoch": 0.04718570947084597,
608
+ "eval_loss": 3.311476707458496,
609
+ "eval_runtime": 8.1361,
610
+ "eval_samples_per_second": 1170.957,
611
+ "eval_steps_per_second": 0.86,
612
+ "step": 1400
613
+ },
614
+ {
615
+ "epoch": 0.0478597910347152,
616
+ "grad_norm": 1.140625,
617
+ "learning_rate": 0.0003,
618
+ "loss": 3.3057735443115233,
619
+ "step": 1420
620
+ },
621
+ {
622
+ "epoch": 0.04853387259858443,
623
+ "grad_norm": 1.109375,
624
+ "learning_rate": 0.0003,
625
+ "loss": 3.2907379150390623,
626
+ "step": 1440
627
+ },
628
+ {
629
+ "epoch": 0.04920795416245366,
630
+ "grad_norm": 1.078125,
631
+ "learning_rate": 0.0003,
632
+ "loss": 3.264795684814453,
633
+ "step": 1460
634
+ },
635
+ {
636
+ "epoch": 0.04988203572632288,
637
+ "grad_norm": 1.3671875,
638
+ "learning_rate": 0.0003,
639
+ "loss": 3.2918243408203125,
640
+ "step": 1480
641
+ },
642
+ {
643
+ "epoch": 0.05055611729019211,
644
+ "grad_norm": 1.2421875,
645
+ "learning_rate": 0.0003,
646
+ "loss": 3.2844181060791016,
647
+ "step": 1500
648
+ },
649
+ {
650
+ "epoch": 0.05055611729019211,
651
+ "eval_loss": 3.277984142303467,
652
+ "eval_runtime": 8.0313,
653
+ "eval_samples_per_second": 1186.24,
654
+ "eval_steps_per_second": 0.872,
655
+ "step": 1500
656
+ },
657
+ {
658
+ "epoch": 0.05123019885406134,
659
+ "grad_norm": 1.265625,
660
+ "learning_rate": 0.0003,
661
+ "loss": 3.2729434967041016,
662
+ "step": 1520
663
+ },
664
+ {
665
+ "epoch": 0.05190428041793057,
666
+ "grad_norm": 1.1015625,
667
+ "learning_rate": 0.0003,
668
+ "loss": 3.279766845703125,
669
+ "step": 1540
670
+ },
671
+ {
672
+ "epoch": 0.0525783619817998,
673
+ "grad_norm": 1.25,
674
+ "learning_rate": 0.0003,
675
+ "loss": 3.281978988647461,
676
+ "step": 1560
677
+ },
678
+ {
679
+ "epoch": 0.05325244354566903,
680
+ "grad_norm": 1.125,
681
+ "learning_rate": 0.0003,
682
+ "loss": 3.2608470916748047,
683
+ "step": 1580
684
+ },
685
+ {
686
+ "epoch": 0.053926525109538256,
687
+ "grad_norm": 1.2265625,
688
+ "learning_rate": 0.0003,
689
+ "loss": 3.2503360748291015,
690
+ "step": 1600
691
+ },
692
+ {
693
+ "epoch": 0.053926525109538256,
694
+ "eval_loss": 3.2511110305786133,
695
+ "eval_runtime": 8.097,
696
+ "eval_samples_per_second": 1176.602,
697
+ "eval_steps_per_second": 0.865,
698
+ "step": 1600
699
+ },
700
+ {
701
+ "epoch": 0.054600606673407485,
702
+ "grad_norm": 1.234375,
703
+ "learning_rate": 0.0003,
704
+ "loss": 3.2713451385498047,
705
+ "step": 1620
706
+ },
707
+ {
708
+ "epoch": 0.05527468823727671,
709
+ "grad_norm": 1.015625,
710
+ "learning_rate": 0.0003,
711
+ "loss": 3.2468338012695312,
712
+ "step": 1640
713
+ },
714
+ {
715
+ "epoch": 0.05594876980114594,
716
+ "grad_norm": 1.15625,
717
+ "learning_rate": 0.0003,
718
+ "loss": 3.255104827880859,
719
+ "step": 1660
720
+ },
721
+ {
722
+ "epoch": 0.056622851365015166,
723
+ "grad_norm": 1.1875,
724
+ "learning_rate": 0.0003,
725
+ "loss": 3.2280048370361327,
726
+ "step": 1680
727
+ },
728
+ {
729
+ "epoch": 0.057296932928884395,
730
+ "grad_norm": 1.265625,
731
+ "learning_rate": 0.0003,
732
+ "loss": 3.216978073120117,
733
+ "step": 1700
734
+ },
735
+ {
736
+ "epoch": 0.057296932928884395,
737
+ "eval_loss": 3.2238714694976807,
738
+ "eval_runtime": 8.059,
739
+ "eval_samples_per_second": 1182.16,
740
+ "eval_steps_per_second": 0.869,
741
+ "step": 1700
742
+ },
743
+ {
744
+ "epoch": 0.057971014492753624,
745
+ "grad_norm": 1.125,
746
+ "learning_rate": 0.0003,
747
+ "loss": 3.213521194458008,
748
+ "step": 1720
749
+ },
750
+ {
751
+ "epoch": 0.05864509605662285,
752
+ "grad_norm": 1.234375,
753
+ "learning_rate": 0.0003,
754
+ "loss": 3.2087985992431642,
755
+ "step": 1740
756
+ },
757
+ {
758
+ "epoch": 0.05931917762049208,
759
+ "grad_norm": 1.2109375,
760
+ "learning_rate": 0.0003,
761
+ "loss": 3.198755645751953,
762
+ "step": 1760
763
+ },
764
+ {
765
+ "epoch": 0.05999325918436131,
766
+ "grad_norm": 1.4453125,
767
+ "learning_rate": 0.0003,
768
+ "loss": 3.2067222595214844,
769
+ "step": 1780
770
+ },
771
+ {
772
+ "epoch": 0.06066734074823053,
773
+ "grad_norm": 1.140625,
774
+ "learning_rate": 0.0003,
775
+ "loss": 3.195578956604004,
776
+ "step": 1800
777
+ },
778
+ {
779
+ "epoch": 0.06066734074823053,
780
+ "eval_loss": 3.1985833644866943,
781
+ "eval_runtime": 8.2334,
782
+ "eval_samples_per_second": 1157.109,
783
+ "eval_steps_per_second": 0.85,
784
+ "step": 1800
785
+ },
786
+ {
787
+ "epoch": 0.06134142231209976,
788
+ "grad_norm": 1.1640625,
789
+ "learning_rate": 0.0003,
790
+ "loss": 3.186159133911133,
791
+ "step": 1820
792
+ },
793
+ {
794
+ "epoch": 0.06201550387596899,
795
+ "grad_norm": 1.21875,
796
+ "learning_rate": 0.0003,
797
+ "loss": 3.1850618362426757,
798
+ "step": 1840
799
+ },
800
+ {
801
+ "epoch": 0.06268958543983821,
802
+ "grad_norm": 1.3515625,
803
+ "learning_rate": 0.0003,
804
+ "loss": 3.1967243194580077,
805
+ "step": 1860
806
+ },
807
+ {
808
+ "epoch": 0.06336366700370745,
809
+ "grad_norm": 1.3125,
810
+ "learning_rate": 0.0003,
811
+ "loss": 3.1668914794921874,
812
+ "step": 1880
813
+ },
814
+ {
815
+ "epoch": 0.06403774856757667,
816
+ "grad_norm": 1.1484375,
817
+ "learning_rate": 0.0003,
818
+ "loss": 3.1733448028564455,
819
+ "step": 1900
820
+ },
821
+ {
822
+ "epoch": 0.06403774856757667,
823
+ "eval_loss": 3.1766083240509033,
824
+ "eval_runtime": 7.9724,
825
+ "eval_samples_per_second": 1194.991,
826
+ "eval_steps_per_second": 0.878,
827
+ "step": 1900
828
+ },
829
+ {
830
+ "epoch": 0.06471183013144591,
831
+ "grad_norm": 1.1953125,
832
+ "learning_rate": 0.0003,
833
+ "loss": 3.1606868743896483,
834
+ "step": 1920
835
+ },
836
+ {
837
+ "epoch": 0.06538591169531513,
838
+ "grad_norm": 1.109375,
839
+ "learning_rate": 0.0003,
840
+ "loss": 3.148599052429199,
841
+ "step": 1940
842
+ },
843
+ {
844
+ "epoch": 0.06605999325918437,
845
+ "grad_norm": 1.2265625,
846
+ "learning_rate": 0.0003,
847
+ "loss": 3.1723419189453126,
848
+ "step": 1960
849
+ },
850
+ {
851
+ "epoch": 0.06673407482305359,
852
+ "grad_norm": 1.234375,
853
+ "learning_rate": 0.0003,
854
+ "loss": 3.184863471984863,
855
+ "step": 1980
856
+ },
857
+ {
858
+ "epoch": 0.06740815638692282,
859
+ "grad_norm": 1.2734375,
860
+ "learning_rate": 0.0003,
861
+ "loss": 3.158551788330078,
862
+ "step": 2000
863
+ },
864
+ {
865
+ "epoch": 0.06740815638692282,
866
+ "eval_loss": 3.154155731201172,
867
+ "eval_runtime": 7.9931,
868
+ "eval_samples_per_second": 1191.905,
869
+ "eval_steps_per_second": 0.876,
870
+ "step": 2000
871
+ },
872
+ {
873
+ "epoch": 0.06808223795079205,
874
+ "grad_norm": 1.2734375,
875
+ "learning_rate": 0.0003,
876
+ "loss": 3.147844696044922,
877
+ "step": 2020
878
+ },
879
+ {
880
+ "epoch": 0.06875631951466127,
881
+ "grad_norm": 1.1796875,
882
+ "learning_rate": 0.0003,
883
+ "loss": 3.149020957946777,
884
+ "step": 2040
885
+ },
886
+ {
887
+ "epoch": 0.0694304010785305,
888
+ "grad_norm": 1.234375,
889
+ "learning_rate": 0.0003,
890
+ "loss": 3.1382816314697264,
891
+ "step": 2060
892
+ },
893
+ {
894
+ "epoch": 0.07010448264239973,
895
+ "grad_norm": 1.203125,
896
+ "learning_rate": 0.0003,
897
+ "loss": 3.1440708160400392,
898
+ "step": 2080
899
+ },
900
+ {
901
+ "epoch": 0.07077856420626896,
902
+ "grad_norm": 1.1171875,
903
+ "learning_rate": 0.0003,
904
+ "loss": 3.132351875305176,
905
+ "step": 2100
906
+ },
907
+ {
908
+ "epoch": 0.07077856420626896,
909
+ "eval_loss": 3.1331419944763184,
910
+ "eval_runtime": 8.2456,
911
+ "eval_samples_per_second": 1155.405,
912
+ "eval_steps_per_second": 0.849,
913
+ "step": 2100
914
+ },
915
+ {
916
+ "epoch": 0.07145264577013818,
917
+ "grad_norm": 1.109375,
918
+ "learning_rate": 0.0003,
919
+ "loss": 3.1341459274291994,
920
+ "step": 2120
921
+ },
922
+ {
923
+ "epoch": 0.07212672733400742,
924
+ "grad_norm": 1.1640625,
925
+ "learning_rate": 0.0003,
926
+ "loss": 3.1331857681274413,
927
+ "step": 2140
928
+ },
929
+ {
930
+ "epoch": 0.07280080889787664,
931
+ "grad_norm": 1.1796875,
932
+ "learning_rate": 0.0003,
933
+ "loss": 3.1179393768310546,
934
+ "step": 2160
935
+ },
936
+ {
937
+ "epoch": 0.07347489046174586,
938
+ "grad_norm": 1.546875,
939
+ "learning_rate": 0.0003,
940
+ "loss": 3.1271270751953124,
941
+ "step": 2180
942
+ },
943
+ {
944
+ "epoch": 0.0741489720256151,
945
+ "grad_norm": 1.234375,
946
+ "learning_rate": 0.0003,
947
+ "loss": 3.1252058029174803,
948
+ "step": 2200
949
+ },
950
+ {
951
+ "epoch": 0.0741489720256151,
952
+ "eval_loss": 3.1193113327026367,
953
+ "eval_runtime": 8.0852,
954
+ "eval_samples_per_second": 1178.326,
955
+ "eval_steps_per_second": 0.866,
956
+ "step": 2200
957
+ },
958
+ {
959
+ "epoch": 0.07482305358948432,
960
+ "grad_norm": 1.1015625,
961
+ "learning_rate": 0.0003,
962
+ "loss": 3.0879518508911135,
963
+ "step": 2220
964
+ },
965
+ {
966
+ "epoch": 0.07549713515335356,
967
+ "grad_norm": 1.2109375,
968
+ "learning_rate": 0.0003,
969
+ "loss": 3.1103500366210937,
970
+ "step": 2240
971
+ },
972
+ {
973
+ "epoch": 0.07617121671722278,
974
+ "grad_norm": 1.3828125,
975
+ "learning_rate": 0.0003,
976
+ "loss": 3.08082275390625,
977
+ "step": 2260
978
+ },
979
+ {
980
+ "epoch": 0.07684529828109202,
981
+ "grad_norm": 1.3203125,
982
+ "learning_rate": 0.0003,
983
+ "loss": 3.103218650817871,
984
+ "step": 2280
985
+ },
986
+ {
987
+ "epoch": 0.07751937984496124,
988
+ "grad_norm": 1.1953125,
989
+ "learning_rate": 0.0003,
990
+ "loss": 3.0974100112915037,
991
+ "step": 2300
992
+ },
993
+ {
994
+ "epoch": 0.07751937984496124,
995
+ "eval_loss": 3.098923921585083,
996
+ "eval_runtime": 8.2349,
997
+ "eval_samples_per_second": 1156.908,
998
+ "eval_steps_per_second": 0.85,
999
+ "step": 2300
1000
+ }
1001
+ ],
1002
+ "logging_steps": 20,
1003
+ "max_steps": 2500,
1004
+ "num_input_tokens_seen": 0,
1005
+ "num_train_epochs": 1,
1006
+ "save_steps": 100,
1007
+ "stateful_callbacks": {
1008
+ "TrainerControl": {
1009
+ "args": {
1010
+ "should_epoch_stop": false,
1011
+ "should_evaluate": false,
1012
+ "should_log": false,
1013
+ "should_save": true,
1014
+ "should_training_stop": false
1015
+ },
1016
+ "attributes": {}
1017
+ }
1018
+ },
1019
+ "total_flos": 333946709606400.0,
1020
+ "train_batch_size": 32,
1021
+ "trial_name": null,
1022
+ "trial_params": null
1023
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2300/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a761b578cf2b8c248f28bd1b61a5ec7d0b5d3801c8bd793a6db706df1d3078f6
3
+ size 4920
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/config.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "squared_relu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 9,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "powlu_m": 3.0,
25
+ "pretraining_tp": 1,
26
+ "rms_norm_eps": 1e-06,
27
+ "rope_parameters": {
28
+ "rope_theta": 10000.0,
29
+ "rope_type": "default"
30
+ },
31
+ "tie_word_embeddings": true,
32
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
33
+ "transformers_version": "5.16.0.dev0",
34
+ "use_cache": false,
35
+ "vocab_size": 4096,
36
+ "waleed_beta": 10.0
37
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:68bbb4bd123c0d4c584e6c619cb6108e43e78be1e5fb5253dba2b264e510633d
3
+ size 4010544
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b0f0473810d2aee510ff64151a5c803de3e68f9be9cb19517b0c7541b29a2150
3
+ size 8068282
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9022ea8893d375dc2079ce97b2df7f3286392f4c409461865c91e578acc3ba10
3
+ size 14244
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1127c4973386b20d3418aeecc3a05ef9e4aba4952a23325133bed0d9a3788847
3
+ size 1064
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/tokenizer_config.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "errors": "replace",
7
+ "is_local": false,
8
+ "local_files_only": false,
9
+ "model_max_length": 1024,
10
+ "pad_token": "<|endoftext|>",
11
+ "tokenizer_class": "GPT2Tokenizer",
12
+ "unk_token": "<|endoftext|>"
13
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/trainer_state.json ADDED
@@ -0,0 +1,1066 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.08088978766430738,
6
+ "eval_steps": 100,
7
+ "global_step": 2400,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0006740815638692282,
14
+ "grad_norm": 2.71875,
15
+ "learning_rate": 1.14e-05,
16
+ "loss": 8.314944458007812,
17
+ "step": 20
18
+ },
19
+ {
20
+ "epoch": 0.0013481631277384564,
21
+ "grad_norm": 1.8515625,
22
+ "learning_rate": 2.34e-05,
23
+ "loss": 8.251383972167968,
24
+ "step": 40
25
+ },
26
+ {
27
+ "epoch": 0.0020222446916076846,
28
+ "grad_norm": 1.3203125,
29
+ "learning_rate": 3.539999999999999e-05,
30
+ "loss": 8.104505920410157,
31
+ "step": 60
32
+ },
33
+ {
34
+ "epoch": 0.002696326255476913,
35
+ "grad_norm": 1.296875,
36
+ "learning_rate": 4.7399999999999993e-05,
37
+ "loss": 7.968361663818359,
38
+ "step": 80
39
+ },
40
+ {
41
+ "epoch": 0.003370407819346141,
42
+ "grad_norm": 1.2578125,
43
+ "learning_rate": 5.94e-05,
44
+ "loss": 7.804827880859375,
45
+ "step": 100
46
+ },
47
+ {
48
+ "epoch": 0.003370407819346141,
49
+ "eval_loss": 7.703802585601807,
50
+ "eval_runtime": 8.0325,
51
+ "eval_samples_per_second": 1186.059,
52
+ "eval_steps_per_second": 0.871,
53
+ "step": 100
54
+ },
55
+ {
56
+ "epoch": 0.004044489383215369,
57
+ "grad_norm": 1.2734375,
58
+ "learning_rate": 7.139999999999999e-05,
59
+ "loss": 7.600141906738282,
60
+ "step": 120
61
+ },
62
+ {
63
+ "epoch": 0.0047185709470845974,
64
+ "grad_norm": 1.265625,
65
+ "learning_rate": 8.34e-05,
66
+ "loss": 7.368203735351562,
67
+ "step": 140
68
+ },
69
+ {
70
+ "epoch": 0.005392652510953826,
71
+ "grad_norm": 1.265625,
72
+ "learning_rate": 9.539999999999999e-05,
73
+ "loss": 7.133045196533203,
74
+ "step": 160
75
+ },
76
+ {
77
+ "epoch": 0.006066734074823054,
78
+ "grad_norm": 1.203125,
79
+ "learning_rate": 0.00010739999999999998,
80
+ "loss": 6.885277557373047,
81
+ "step": 180
82
+ },
83
+ {
84
+ "epoch": 0.006740815638692282,
85
+ "grad_norm": 1.15625,
86
+ "learning_rate": 0.0001194,
87
+ "loss": 6.629558563232422,
88
+ "step": 200
89
+ },
90
+ {
91
+ "epoch": 0.006740815638692282,
92
+ "eval_loss": 6.4997687339782715,
93
+ "eval_runtime": 7.9479,
94
+ "eval_samples_per_second": 1198.683,
95
+ "eval_steps_per_second": 0.881,
96
+ "step": 200
97
+ },
98
+ {
99
+ "epoch": 0.00741489720256151,
100
+ "grad_norm": 1.109375,
101
+ "learning_rate": 0.0001314,
102
+ "loss": 6.391195297241211,
103
+ "step": 220
104
+ },
105
+ {
106
+ "epoch": 0.008088978766430738,
107
+ "grad_norm": 1.21875,
108
+ "learning_rate": 0.0001434,
109
+ "loss": 6.139227676391601,
110
+ "step": 240
111
+ },
112
+ {
113
+ "epoch": 0.008763060330299966,
114
+ "grad_norm": 1.0625,
115
+ "learning_rate": 0.00015539999999999998,
116
+ "loss": 5.917041778564453,
117
+ "step": 260
118
+ },
119
+ {
120
+ "epoch": 0.009437141894169195,
121
+ "grad_norm": 1.1015625,
122
+ "learning_rate": 0.0001674,
123
+ "loss": 5.702054595947265,
124
+ "step": 280
125
+ },
126
+ {
127
+ "epoch": 0.010111223458038422,
128
+ "grad_norm": 0.921875,
129
+ "learning_rate": 0.00017939999999999997,
130
+ "loss": 5.500263214111328,
131
+ "step": 300
132
+ },
133
+ {
134
+ "epoch": 0.010111223458038422,
135
+ "eval_loss": 5.393505573272705,
136
+ "eval_runtime": 8.0449,
137
+ "eval_samples_per_second": 1184.223,
138
+ "eval_steps_per_second": 0.87,
139
+ "step": 300
140
+ },
141
+ {
142
+ "epoch": 0.010785305021907651,
143
+ "grad_norm": 2.5,
144
+ "learning_rate": 0.0001914,
145
+ "loss": 5.319306182861328,
146
+ "step": 320
147
+ },
148
+ {
149
+ "epoch": 0.011459386585776879,
150
+ "grad_norm": 1.078125,
151
+ "learning_rate": 0.00020339999999999998,
152
+ "loss": 5.202053070068359,
153
+ "step": 340
154
+ },
155
+ {
156
+ "epoch": 0.012133468149646108,
157
+ "grad_norm": 1.3203125,
158
+ "learning_rate": 0.00021539999999999998,
159
+ "loss": 5.020883941650391,
160
+ "step": 360
161
+ },
162
+ {
163
+ "epoch": 0.012807549713515335,
164
+ "grad_norm": 1.1171875,
165
+ "learning_rate": 0.00022739999999999997,
166
+ "loss": 4.873059844970703,
167
+ "step": 380
168
+ },
169
+ {
170
+ "epoch": 0.013481631277384564,
171
+ "grad_norm": 1.234375,
172
+ "learning_rate": 0.0002394,
173
+ "loss": 4.741780853271484,
174
+ "step": 400
175
+ },
176
+ {
177
+ "epoch": 0.013481631277384564,
178
+ "eval_loss": 4.676144123077393,
179
+ "eval_runtime": 8.0457,
180
+ "eval_samples_per_second": 1184.113,
181
+ "eval_steps_per_second": 0.87,
182
+ "step": 400
183
+ },
184
+ {
185
+ "epoch": 0.014155712841253791,
186
+ "grad_norm": 1.3046875,
187
+ "learning_rate": 0.0002514,
188
+ "loss": 4.606548690795899,
189
+ "step": 420
190
+ },
191
+ {
192
+ "epoch": 0.01482979440512302,
193
+ "grad_norm": 1.2578125,
194
+ "learning_rate": 0.00026339999999999995,
195
+ "loss": 4.515376281738281,
196
+ "step": 440
197
+ },
198
+ {
199
+ "epoch": 0.015503875968992248,
200
+ "grad_norm": 1.0625,
201
+ "learning_rate": 0.00027539999999999997,
202
+ "loss": 4.416887664794922,
203
+ "step": 460
204
+ },
205
+ {
206
+ "epoch": 0.016177957532861477,
207
+ "grad_norm": 1.3671875,
208
+ "learning_rate": 0.00028739999999999994,
209
+ "loss": 4.3046520233154295,
210
+ "step": 480
211
+ },
212
+ {
213
+ "epoch": 0.016852039096730706,
214
+ "grad_norm": 1.2109375,
215
+ "learning_rate": 0.00029939999999999996,
216
+ "loss": 4.238706970214844,
217
+ "step": 500
218
+ },
219
+ {
220
+ "epoch": 0.016852039096730706,
221
+ "eval_loss": 4.196270942687988,
222
+ "eval_runtime": 7.9301,
223
+ "eval_samples_per_second": 1201.377,
224
+ "eval_steps_per_second": 0.883,
225
+ "step": 500
226
+ },
227
+ {
228
+ "epoch": 0.01752612066059993,
229
+ "grad_norm": 0.97265625,
230
+ "learning_rate": 0.0003,
231
+ "loss": 4.1756237030029295,
232
+ "step": 520
233
+ },
234
+ {
235
+ "epoch": 0.01820020222446916,
236
+ "grad_norm": 0.9140625,
237
+ "learning_rate": 0.0003,
238
+ "loss": 4.0915069580078125,
239
+ "step": 540
240
+ },
241
+ {
242
+ "epoch": 0.01887428378833839,
243
+ "grad_norm": 1.2890625,
244
+ "learning_rate": 0.0003,
245
+ "loss": 4.031630325317383,
246
+ "step": 560
247
+ },
248
+ {
249
+ "epoch": 0.01954836535220762,
250
+ "grad_norm": 1.125,
251
+ "learning_rate": 0.0003,
252
+ "loss": 3.9763336181640625,
253
+ "step": 580
254
+ },
255
+ {
256
+ "epoch": 0.020222446916076844,
257
+ "grad_norm": 1.21875,
258
+ "learning_rate": 0.0003,
259
+ "loss": 3.9347896575927734,
260
+ "step": 600
261
+ },
262
+ {
263
+ "epoch": 0.020222446916076844,
264
+ "eval_loss": 3.9157378673553467,
265
+ "eval_runtime": 8.0606,
266
+ "eval_samples_per_second": 1181.917,
267
+ "eval_steps_per_second": 0.868,
268
+ "step": 600
269
+ },
270
+ {
271
+ "epoch": 0.020896528479946073,
272
+ "grad_norm": 1.1640625,
273
+ "learning_rate": 0.0003,
274
+ "loss": 3.878151702880859,
275
+ "step": 620
276
+ },
277
+ {
278
+ "epoch": 0.021570610043815303,
279
+ "grad_norm": 1.484375,
280
+ "learning_rate": 0.0003,
281
+ "loss": 3.855076217651367,
282
+ "step": 640
283
+ },
284
+ {
285
+ "epoch": 0.022244691607684528,
286
+ "grad_norm": 1.3359375,
287
+ "learning_rate": 0.0003,
288
+ "loss": 3.8232196807861327,
289
+ "step": 660
290
+ },
291
+ {
292
+ "epoch": 0.022918773171553757,
293
+ "grad_norm": 1.1640625,
294
+ "learning_rate": 0.0003,
295
+ "loss": 3.782532501220703,
296
+ "step": 680
297
+ },
298
+ {
299
+ "epoch": 0.023592854735422986,
300
+ "grad_norm": 1.1328125,
301
+ "learning_rate": 0.0003,
302
+ "loss": 3.7758609771728517,
303
+ "step": 700
304
+ },
305
+ {
306
+ "epoch": 0.023592854735422986,
307
+ "eval_loss": 3.7596347332000732,
308
+ "eval_runtime": 7.9743,
309
+ "eval_samples_per_second": 1194.709,
310
+ "eval_steps_per_second": 0.878,
311
+ "step": 700
312
+ },
313
+ {
314
+ "epoch": 0.024266936299292215,
315
+ "grad_norm": 1.25,
316
+ "learning_rate": 0.0003,
317
+ "loss": 3.7433414459228516,
318
+ "step": 720
319
+ },
320
+ {
321
+ "epoch": 0.02494101786316144,
322
+ "grad_norm": 1.3125,
323
+ "learning_rate": 0.0003,
324
+ "loss": 3.732330322265625,
325
+ "step": 740
326
+ },
327
+ {
328
+ "epoch": 0.02561509942703067,
329
+ "grad_norm": 1.265625,
330
+ "learning_rate": 0.0003,
331
+ "loss": 3.6843395233154297,
332
+ "step": 760
333
+ },
334
+ {
335
+ "epoch": 0.0262891809908999,
336
+ "grad_norm": 1.1640625,
337
+ "learning_rate": 0.0003,
338
+ "loss": 3.6463153839111326,
339
+ "step": 780
340
+ },
341
+ {
342
+ "epoch": 0.026963262554769128,
343
+ "grad_norm": 1.1171875,
344
+ "learning_rate": 0.0003,
345
+ "loss": 3.6544403076171874,
346
+ "step": 800
347
+ },
348
+ {
349
+ "epoch": 0.026963262554769128,
350
+ "eval_loss": 3.652294635772705,
351
+ "eval_runtime": 7.9753,
352
+ "eval_samples_per_second": 1194.559,
353
+ "eval_steps_per_second": 0.878,
354
+ "step": 800
355
+ },
356
+ {
357
+ "epoch": 0.027637344118638354,
358
+ "grad_norm": 1.1171875,
359
+ "learning_rate": 0.0003,
360
+ "loss": 3.6159641265869142,
361
+ "step": 820
362
+ },
363
+ {
364
+ "epoch": 0.028311425682507583,
365
+ "grad_norm": 1.078125,
366
+ "learning_rate": 0.0003,
367
+ "loss": 3.6099781036376952,
368
+ "step": 840
369
+ },
370
+ {
371
+ "epoch": 0.028985507246376812,
372
+ "grad_norm": 1.2734375,
373
+ "learning_rate": 0.0003,
374
+ "loss": 3.6344444274902346,
375
+ "step": 860
376
+ },
377
+ {
378
+ "epoch": 0.02965958881024604,
379
+ "grad_norm": 1.140625,
380
+ "learning_rate": 0.0003,
381
+ "loss": 3.5855178833007812,
382
+ "step": 880
383
+ },
384
+ {
385
+ "epoch": 0.030333670374115267,
386
+ "grad_norm": 1.109375,
387
+ "learning_rate": 0.0003,
388
+ "loss": 3.5488441467285154,
389
+ "step": 900
390
+ },
391
+ {
392
+ "epoch": 0.030333670374115267,
393
+ "eval_loss": 3.5648436546325684,
394
+ "eval_runtime": 8.321,
395
+ "eval_samples_per_second": 1144.931,
396
+ "eval_steps_per_second": 0.841,
397
+ "step": 900
398
+ },
399
+ {
400
+ "epoch": 0.031007751937984496,
401
+ "grad_norm": 1.1015625,
402
+ "learning_rate": 0.0003,
403
+ "loss": 3.5646598815917967,
404
+ "step": 920
405
+ },
406
+ {
407
+ "epoch": 0.031681833501853725,
408
+ "grad_norm": 1.25,
409
+ "learning_rate": 0.0003,
410
+ "loss": 3.5480445861816405,
411
+ "step": 940
412
+ },
413
+ {
414
+ "epoch": 0.032355915065722954,
415
+ "grad_norm": 1.140625,
416
+ "learning_rate": 0.0003,
417
+ "loss": 3.5140933990478516,
418
+ "step": 960
419
+ },
420
+ {
421
+ "epoch": 0.03302999662959218,
422
+ "grad_norm": 1.140625,
423
+ "learning_rate": 0.0003,
424
+ "loss": 3.501856231689453,
425
+ "step": 980
426
+ },
427
+ {
428
+ "epoch": 0.03370407819346141,
429
+ "grad_norm": 1.359375,
430
+ "learning_rate": 0.0003,
431
+ "loss": 3.500592803955078,
432
+ "step": 1000
433
+ },
434
+ {
435
+ "epoch": 0.03370407819346141,
436
+ "eval_loss": 3.4981162548065186,
437
+ "eval_runtime": 8.1013,
438
+ "eval_samples_per_second": 1175.987,
439
+ "eval_steps_per_second": 0.864,
440
+ "step": 1000
441
+ },
442
+ {
443
+ "epoch": 0.034378159757330634,
444
+ "grad_norm": 1.1328125,
445
+ "learning_rate": 0.0003,
446
+ "loss": 3.4914066314697267,
447
+ "step": 1020
448
+ },
449
+ {
450
+ "epoch": 0.03505224132119986,
451
+ "grad_norm": 1.1171875,
452
+ "learning_rate": 0.0003,
453
+ "loss": 3.474192810058594,
454
+ "step": 1040
455
+ },
456
+ {
457
+ "epoch": 0.03572632288506909,
458
+ "grad_norm": 1.28125,
459
+ "learning_rate": 0.0003,
460
+ "loss": 3.4552947998046877,
461
+ "step": 1060
462
+ },
463
+ {
464
+ "epoch": 0.03640040444893832,
465
+ "grad_norm": 1.203125,
466
+ "learning_rate": 0.0003,
467
+ "loss": 3.4411731719970704,
468
+ "step": 1080
469
+ },
470
+ {
471
+ "epoch": 0.03707448601280755,
472
+ "grad_norm": 1.2734375,
473
+ "learning_rate": 0.0003,
474
+ "loss": 3.435680389404297,
475
+ "step": 1100
476
+ },
477
+ {
478
+ "epoch": 0.03707448601280755,
479
+ "eval_loss": 3.445117712020874,
480
+ "eval_runtime": 8.1641,
481
+ "eval_samples_per_second": 1166.938,
482
+ "eval_steps_per_second": 0.857,
483
+ "step": 1100
484
+ },
485
+ {
486
+ "epoch": 0.03774856757667678,
487
+ "grad_norm": 1.03125,
488
+ "learning_rate": 0.0003,
489
+ "loss": 3.4368762969970703,
490
+ "step": 1120
491
+ },
492
+ {
493
+ "epoch": 0.03842264914054601,
494
+ "grad_norm": 1.2421875,
495
+ "learning_rate": 0.0003,
496
+ "loss": 3.410645294189453,
497
+ "step": 1140
498
+ },
499
+ {
500
+ "epoch": 0.03909673070441524,
501
+ "grad_norm": 1.0703125,
502
+ "learning_rate": 0.0003,
503
+ "loss": 3.4069515228271485,
504
+ "step": 1160
505
+ },
506
+ {
507
+ "epoch": 0.03977081226828446,
508
+ "grad_norm": 1.03125,
509
+ "learning_rate": 0.0003,
510
+ "loss": 3.4227649688720705,
511
+ "step": 1180
512
+ },
513
+ {
514
+ "epoch": 0.04044489383215369,
515
+ "grad_norm": 1.203125,
516
+ "learning_rate": 0.0003,
517
+ "loss": 3.3914558410644533,
518
+ "step": 1200
519
+ },
520
+ {
521
+ "epoch": 0.04044489383215369,
522
+ "eval_loss": 3.3945467472076416,
523
+ "eval_runtime": 8.0433,
524
+ "eval_samples_per_second": 1184.469,
525
+ "eval_steps_per_second": 0.87,
526
+ "step": 1200
527
+ },
528
+ {
529
+ "epoch": 0.04111897539602292,
530
+ "grad_norm": 1.0546875,
531
+ "learning_rate": 0.0003,
532
+ "loss": 3.3614086151123046,
533
+ "step": 1220
534
+ },
535
+ {
536
+ "epoch": 0.04179305695989215,
537
+ "grad_norm": 1.09375,
538
+ "learning_rate": 0.0003,
539
+ "loss": 3.3790237426757814,
540
+ "step": 1240
541
+ },
542
+ {
543
+ "epoch": 0.042467138523761376,
544
+ "grad_norm": 1.3515625,
545
+ "learning_rate": 0.0003,
546
+ "loss": 3.38794059753418,
547
+ "step": 1260
548
+ },
549
+ {
550
+ "epoch": 0.043141220087630605,
551
+ "grad_norm": 1.28125,
552
+ "learning_rate": 0.0003,
553
+ "loss": 3.3654109954833986,
554
+ "step": 1280
555
+ },
556
+ {
557
+ "epoch": 0.043815301651499834,
558
+ "grad_norm": 1.1796875,
559
+ "learning_rate": 0.0003,
560
+ "loss": 3.3572288513183595,
561
+ "step": 1300
562
+ },
563
+ {
564
+ "epoch": 0.043815301651499834,
565
+ "eval_loss": 3.3501007556915283,
566
+ "eval_runtime": 8.0621,
567
+ "eval_samples_per_second": 1181.702,
568
+ "eval_steps_per_second": 0.868,
569
+ "step": 1300
570
+ },
571
+ {
572
+ "epoch": 0.044489383215369056,
573
+ "grad_norm": 1.2734375,
574
+ "learning_rate": 0.0003,
575
+ "loss": 3.321734619140625,
576
+ "step": 1320
577
+ },
578
+ {
579
+ "epoch": 0.045163464779238285,
580
+ "grad_norm": 1.2890625,
581
+ "learning_rate": 0.0003,
582
+ "loss": 3.3493595123291016,
583
+ "step": 1340
584
+ },
585
+ {
586
+ "epoch": 0.045837546343107514,
587
+ "grad_norm": 1.1875,
588
+ "learning_rate": 0.0003,
589
+ "loss": 3.3272212982177733,
590
+ "step": 1360
591
+ },
592
+ {
593
+ "epoch": 0.046511627906976744,
594
+ "grad_norm": 1.1328125,
595
+ "learning_rate": 0.0003,
596
+ "loss": 3.3202045440673826,
597
+ "step": 1380
598
+ },
599
+ {
600
+ "epoch": 0.04718570947084597,
601
+ "grad_norm": 1.1171875,
602
+ "learning_rate": 0.0003,
603
+ "loss": 3.2998809814453125,
604
+ "step": 1400
605
+ },
606
+ {
607
+ "epoch": 0.04718570947084597,
608
+ "eval_loss": 3.311476707458496,
609
+ "eval_runtime": 8.1361,
610
+ "eval_samples_per_second": 1170.957,
611
+ "eval_steps_per_second": 0.86,
612
+ "step": 1400
613
+ },
614
+ {
615
+ "epoch": 0.0478597910347152,
616
+ "grad_norm": 1.140625,
617
+ "learning_rate": 0.0003,
618
+ "loss": 3.3057735443115233,
619
+ "step": 1420
620
+ },
621
+ {
622
+ "epoch": 0.04853387259858443,
623
+ "grad_norm": 1.109375,
624
+ "learning_rate": 0.0003,
625
+ "loss": 3.2907379150390623,
626
+ "step": 1440
627
+ },
628
+ {
629
+ "epoch": 0.04920795416245366,
630
+ "grad_norm": 1.078125,
631
+ "learning_rate": 0.0003,
632
+ "loss": 3.264795684814453,
633
+ "step": 1460
634
+ },
635
+ {
636
+ "epoch": 0.04988203572632288,
637
+ "grad_norm": 1.3671875,
638
+ "learning_rate": 0.0003,
639
+ "loss": 3.2918243408203125,
640
+ "step": 1480
641
+ },
642
+ {
643
+ "epoch": 0.05055611729019211,
644
+ "grad_norm": 1.2421875,
645
+ "learning_rate": 0.0003,
646
+ "loss": 3.2844181060791016,
647
+ "step": 1500
648
+ },
649
+ {
650
+ "epoch": 0.05055611729019211,
651
+ "eval_loss": 3.277984142303467,
652
+ "eval_runtime": 8.0313,
653
+ "eval_samples_per_second": 1186.24,
654
+ "eval_steps_per_second": 0.872,
655
+ "step": 1500
656
+ },
657
+ {
658
+ "epoch": 0.05123019885406134,
659
+ "grad_norm": 1.265625,
660
+ "learning_rate": 0.0003,
661
+ "loss": 3.2729434967041016,
662
+ "step": 1520
663
+ },
664
+ {
665
+ "epoch": 0.05190428041793057,
666
+ "grad_norm": 1.1015625,
667
+ "learning_rate": 0.0003,
668
+ "loss": 3.279766845703125,
669
+ "step": 1540
670
+ },
671
+ {
672
+ "epoch": 0.0525783619817998,
673
+ "grad_norm": 1.25,
674
+ "learning_rate": 0.0003,
675
+ "loss": 3.281978988647461,
676
+ "step": 1560
677
+ },
678
+ {
679
+ "epoch": 0.05325244354566903,
680
+ "grad_norm": 1.125,
681
+ "learning_rate": 0.0003,
682
+ "loss": 3.2608470916748047,
683
+ "step": 1580
684
+ },
685
+ {
686
+ "epoch": 0.053926525109538256,
687
+ "grad_norm": 1.2265625,
688
+ "learning_rate": 0.0003,
689
+ "loss": 3.2503360748291015,
690
+ "step": 1600
691
+ },
692
+ {
693
+ "epoch": 0.053926525109538256,
694
+ "eval_loss": 3.2511110305786133,
695
+ "eval_runtime": 8.097,
696
+ "eval_samples_per_second": 1176.602,
697
+ "eval_steps_per_second": 0.865,
698
+ "step": 1600
699
+ },
700
+ {
701
+ "epoch": 0.054600606673407485,
702
+ "grad_norm": 1.234375,
703
+ "learning_rate": 0.0003,
704
+ "loss": 3.2713451385498047,
705
+ "step": 1620
706
+ },
707
+ {
708
+ "epoch": 0.05527468823727671,
709
+ "grad_norm": 1.015625,
710
+ "learning_rate": 0.0003,
711
+ "loss": 3.2468338012695312,
712
+ "step": 1640
713
+ },
714
+ {
715
+ "epoch": 0.05594876980114594,
716
+ "grad_norm": 1.15625,
717
+ "learning_rate": 0.0003,
718
+ "loss": 3.255104827880859,
719
+ "step": 1660
720
+ },
721
+ {
722
+ "epoch": 0.056622851365015166,
723
+ "grad_norm": 1.1875,
724
+ "learning_rate": 0.0003,
725
+ "loss": 3.2280048370361327,
726
+ "step": 1680
727
+ },
728
+ {
729
+ "epoch": 0.057296932928884395,
730
+ "grad_norm": 1.265625,
731
+ "learning_rate": 0.0003,
732
+ "loss": 3.216978073120117,
733
+ "step": 1700
734
+ },
735
+ {
736
+ "epoch": 0.057296932928884395,
737
+ "eval_loss": 3.2238714694976807,
738
+ "eval_runtime": 8.059,
739
+ "eval_samples_per_second": 1182.16,
740
+ "eval_steps_per_second": 0.869,
741
+ "step": 1700
742
+ },
743
+ {
744
+ "epoch": 0.057971014492753624,
745
+ "grad_norm": 1.125,
746
+ "learning_rate": 0.0003,
747
+ "loss": 3.213521194458008,
748
+ "step": 1720
749
+ },
750
+ {
751
+ "epoch": 0.05864509605662285,
752
+ "grad_norm": 1.234375,
753
+ "learning_rate": 0.0003,
754
+ "loss": 3.2087985992431642,
755
+ "step": 1740
756
+ },
757
+ {
758
+ "epoch": 0.05931917762049208,
759
+ "grad_norm": 1.2109375,
760
+ "learning_rate": 0.0003,
761
+ "loss": 3.198755645751953,
762
+ "step": 1760
763
+ },
764
+ {
765
+ "epoch": 0.05999325918436131,
766
+ "grad_norm": 1.4453125,
767
+ "learning_rate": 0.0003,
768
+ "loss": 3.2067222595214844,
769
+ "step": 1780
770
+ },
771
+ {
772
+ "epoch": 0.06066734074823053,
773
+ "grad_norm": 1.140625,
774
+ "learning_rate": 0.0003,
775
+ "loss": 3.195578956604004,
776
+ "step": 1800
777
+ },
778
+ {
779
+ "epoch": 0.06066734074823053,
780
+ "eval_loss": 3.1985833644866943,
781
+ "eval_runtime": 8.2334,
782
+ "eval_samples_per_second": 1157.109,
783
+ "eval_steps_per_second": 0.85,
784
+ "step": 1800
785
+ },
786
+ {
787
+ "epoch": 0.06134142231209976,
788
+ "grad_norm": 1.1640625,
789
+ "learning_rate": 0.0003,
790
+ "loss": 3.186159133911133,
791
+ "step": 1820
792
+ },
793
+ {
794
+ "epoch": 0.06201550387596899,
795
+ "grad_norm": 1.21875,
796
+ "learning_rate": 0.0003,
797
+ "loss": 3.1850618362426757,
798
+ "step": 1840
799
+ },
800
+ {
801
+ "epoch": 0.06268958543983821,
802
+ "grad_norm": 1.3515625,
803
+ "learning_rate": 0.0003,
804
+ "loss": 3.1967243194580077,
805
+ "step": 1860
806
+ },
807
+ {
808
+ "epoch": 0.06336366700370745,
809
+ "grad_norm": 1.3125,
810
+ "learning_rate": 0.0003,
811
+ "loss": 3.1668914794921874,
812
+ "step": 1880
813
+ },
814
+ {
815
+ "epoch": 0.06403774856757667,
816
+ "grad_norm": 1.1484375,
817
+ "learning_rate": 0.0003,
818
+ "loss": 3.1733448028564455,
819
+ "step": 1900
820
+ },
821
+ {
822
+ "epoch": 0.06403774856757667,
823
+ "eval_loss": 3.1766083240509033,
824
+ "eval_runtime": 7.9724,
825
+ "eval_samples_per_second": 1194.991,
826
+ "eval_steps_per_second": 0.878,
827
+ "step": 1900
828
+ },
829
+ {
830
+ "epoch": 0.06471183013144591,
831
+ "grad_norm": 1.1953125,
832
+ "learning_rate": 0.0003,
833
+ "loss": 3.1606868743896483,
834
+ "step": 1920
835
+ },
836
+ {
837
+ "epoch": 0.06538591169531513,
838
+ "grad_norm": 1.109375,
839
+ "learning_rate": 0.0003,
840
+ "loss": 3.148599052429199,
841
+ "step": 1940
842
+ },
843
+ {
844
+ "epoch": 0.06605999325918437,
845
+ "grad_norm": 1.2265625,
846
+ "learning_rate": 0.0003,
847
+ "loss": 3.1723419189453126,
848
+ "step": 1960
849
+ },
850
+ {
851
+ "epoch": 0.06673407482305359,
852
+ "grad_norm": 1.234375,
853
+ "learning_rate": 0.0003,
854
+ "loss": 3.184863471984863,
855
+ "step": 1980
856
+ },
857
+ {
858
+ "epoch": 0.06740815638692282,
859
+ "grad_norm": 1.2734375,
860
+ "learning_rate": 0.0003,
861
+ "loss": 3.158551788330078,
862
+ "step": 2000
863
+ },
864
+ {
865
+ "epoch": 0.06740815638692282,
866
+ "eval_loss": 3.154155731201172,
867
+ "eval_runtime": 7.9931,
868
+ "eval_samples_per_second": 1191.905,
869
+ "eval_steps_per_second": 0.876,
870
+ "step": 2000
871
+ },
872
+ {
873
+ "epoch": 0.06808223795079205,
874
+ "grad_norm": 1.2734375,
875
+ "learning_rate": 0.0003,
876
+ "loss": 3.147844696044922,
877
+ "step": 2020
878
+ },
879
+ {
880
+ "epoch": 0.06875631951466127,
881
+ "grad_norm": 1.1796875,
882
+ "learning_rate": 0.0003,
883
+ "loss": 3.149020957946777,
884
+ "step": 2040
885
+ },
886
+ {
887
+ "epoch": 0.0694304010785305,
888
+ "grad_norm": 1.234375,
889
+ "learning_rate": 0.0003,
890
+ "loss": 3.1382816314697264,
891
+ "step": 2060
892
+ },
893
+ {
894
+ "epoch": 0.07010448264239973,
895
+ "grad_norm": 1.203125,
896
+ "learning_rate": 0.0003,
897
+ "loss": 3.1440708160400392,
898
+ "step": 2080
899
+ },
900
+ {
901
+ "epoch": 0.07077856420626896,
902
+ "grad_norm": 1.1171875,
903
+ "learning_rate": 0.0003,
904
+ "loss": 3.132351875305176,
905
+ "step": 2100
906
+ },
907
+ {
908
+ "epoch": 0.07077856420626896,
909
+ "eval_loss": 3.1331419944763184,
910
+ "eval_runtime": 8.2456,
911
+ "eval_samples_per_second": 1155.405,
912
+ "eval_steps_per_second": 0.849,
913
+ "step": 2100
914
+ },
915
+ {
916
+ "epoch": 0.07145264577013818,
917
+ "grad_norm": 1.109375,
918
+ "learning_rate": 0.0003,
919
+ "loss": 3.1341459274291994,
920
+ "step": 2120
921
+ },
922
+ {
923
+ "epoch": 0.07212672733400742,
924
+ "grad_norm": 1.1640625,
925
+ "learning_rate": 0.0003,
926
+ "loss": 3.1331857681274413,
927
+ "step": 2140
928
+ },
929
+ {
930
+ "epoch": 0.07280080889787664,
931
+ "grad_norm": 1.1796875,
932
+ "learning_rate": 0.0003,
933
+ "loss": 3.1179393768310546,
934
+ "step": 2160
935
+ },
936
+ {
937
+ "epoch": 0.07347489046174586,
938
+ "grad_norm": 1.546875,
939
+ "learning_rate": 0.0003,
940
+ "loss": 3.1271270751953124,
941
+ "step": 2180
942
+ },
943
+ {
944
+ "epoch": 0.0741489720256151,
945
+ "grad_norm": 1.234375,
946
+ "learning_rate": 0.0003,
947
+ "loss": 3.1252058029174803,
948
+ "step": 2200
949
+ },
950
+ {
951
+ "epoch": 0.0741489720256151,
952
+ "eval_loss": 3.1193113327026367,
953
+ "eval_runtime": 8.0852,
954
+ "eval_samples_per_second": 1178.326,
955
+ "eval_steps_per_second": 0.866,
956
+ "step": 2200
957
+ },
958
+ {
959
+ "epoch": 0.07482305358948432,
960
+ "grad_norm": 1.1015625,
961
+ "learning_rate": 0.0003,
962
+ "loss": 3.0879518508911135,
963
+ "step": 2220
964
+ },
965
+ {
966
+ "epoch": 0.07549713515335356,
967
+ "grad_norm": 1.2109375,
968
+ "learning_rate": 0.0003,
969
+ "loss": 3.1103500366210937,
970
+ "step": 2240
971
+ },
972
+ {
973
+ "epoch": 0.07617121671722278,
974
+ "grad_norm": 1.3828125,
975
+ "learning_rate": 0.0003,
976
+ "loss": 3.08082275390625,
977
+ "step": 2260
978
+ },
979
+ {
980
+ "epoch": 0.07684529828109202,
981
+ "grad_norm": 1.3203125,
982
+ "learning_rate": 0.0003,
983
+ "loss": 3.103218650817871,
984
+ "step": 2280
985
+ },
986
+ {
987
+ "epoch": 0.07751937984496124,
988
+ "grad_norm": 1.1953125,
989
+ "learning_rate": 0.0003,
990
+ "loss": 3.0974100112915037,
991
+ "step": 2300
992
+ },
993
+ {
994
+ "epoch": 0.07751937984496124,
995
+ "eval_loss": 3.098923921585083,
996
+ "eval_runtime": 8.2349,
997
+ "eval_samples_per_second": 1156.908,
998
+ "eval_steps_per_second": 0.85,
999
+ "step": 2300
1000
+ },
1001
+ {
1002
+ "epoch": 0.07819346140883048,
1003
+ "grad_norm": 1.3515625,
1004
+ "learning_rate": 0.0003,
1005
+ "loss": 3.095122718811035,
1006
+ "step": 2320
1007
+ },
1008
+ {
1009
+ "epoch": 0.0788675429726997,
1010
+ "grad_norm": 1.140625,
1011
+ "learning_rate": 0.0003,
1012
+ "loss": 3.084772491455078,
1013
+ "step": 2340
1014
+ },
1015
+ {
1016
+ "epoch": 0.07954162453656892,
1017
+ "grad_norm": 1.34375,
1018
+ "learning_rate": 0.0003,
1019
+ "loss": 3.110363006591797,
1020
+ "step": 2360
1021
+ },
1022
+ {
1023
+ "epoch": 0.08021570610043816,
1024
+ "grad_norm": 1.2734375,
1025
+ "learning_rate": 0.0003,
1026
+ "loss": 3.095768165588379,
1027
+ "step": 2380
1028
+ },
1029
+ {
1030
+ "epoch": 0.08088978766430738,
1031
+ "grad_norm": 1.203125,
1032
+ "learning_rate": 0.0003,
1033
+ "loss": 3.0969696044921875,
1034
+ "step": 2400
1035
+ },
1036
+ {
1037
+ "epoch": 0.08088978766430738,
1038
+ "eval_loss": 3.086376190185547,
1039
+ "eval_runtime": 7.9898,
1040
+ "eval_samples_per_second": 1192.401,
1041
+ "eval_steps_per_second": 0.876,
1042
+ "step": 2400
1043
+ }
1044
+ ],
1045
+ "logging_steps": 20,
1046
+ "max_steps": 2500,
1047
+ "num_input_tokens_seen": 0,
1048
+ "num_train_epochs": 1,
1049
+ "save_steps": 100,
1050
+ "stateful_callbacks": {
1051
+ "TrainerControl": {
1052
+ "args": {
1053
+ "should_epoch_stop": false,
1054
+ "should_evaluate": false,
1055
+ "should_log": false,
1056
+ "should_save": true,
1057
+ "should_training_stop": false
1058
+ },
1059
+ "attributes": {}
1060
+ }
1061
+ },
1062
+ "total_flos": 348466131763200.0,
1063
+ "train_batch_size": 32,
1064
+ "trial_name": null,
1065
+ "trial_params": null
1066
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2400/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a761b578cf2b8c248f28bd1b61a5ec7d0b5d3801c8bd793a6db706df1d3078f6
3
+ size 4920
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/config.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation": "squared_relu",
3
+ "architectures": [
4
+ "TinyLlamaForCausalLM"
5
+ ],
6
+ "attention_bias": false,
7
+ "attention_dropout": 0.0,
8
+ "bos_token_id": 1,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 2,
11
+ "head_dim": 32,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 128,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 256,
16
+ "max_position_embeddings": 512,
17
+ "mlp_bias": false,
18
+ "mlp_type": "mlp",
19
+ "model_type": "tiny_llama",
20
+ "num_attention_heads": 4,
21
+ "num_hidden_layers": 9,
22
+ "num_key_value_heads": 4,
23
+ "pad_token_id": 0,
24
+ "powlu_m": 3.0,
25
+ "pretraining_tp": 1,
26
+ "rms_norm_eps": 1e-06,
27
+ "rope_parameters": {
28
+ "rope_theta": 10000.0,
29
+ "rope_type": "default"
30
+ },
31
+ "tie_word_embeddings": true,
32
+ "tokenizer_name": "w-ahmad/tiny-stories-tokenizer",
33
+ "transformers_version": "5.16.0.dev0",
34
+ "use_cache": false,
35
+ "vocab_size": 4096,
36
+ "waleed_beta": 10.0
37
+ }
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:596c994cea0d2f8807f3f0d68ce17434c600caf3e81579468e68327cf22b2d3f
3
+ size 4010544
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ff4a94c8b8a33b8d91e473f837301b92ff0ef1475360e236aca24f41be92eef9
3
+ size 8068282
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bfcfb0f88b0d9bcf40424586deee61f72e199a42add1edb92a1b9b3c9e5d5ec6
3
+ size 14244
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e149eeb4e00ed73fd6ed80f14daecda1fa4e464fbe9ea4f3c613128f28cf8a55
3
+ size 1064
zain/Activation/out/mlp-squared_relu-9L_run/checkpoint-2500/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff