w-ahmad commited on
Commit
7814c1f
·
verified ·
1 Parent(s): 36bcfef

Auto upload zain 2026-08-19T17:31:52.723720

Browse files
Files changed (22) hide show
  1. zain/Activation/out/mlp-linear-9L_run/checkpoint-100/model.safetensors +1 -1
  2. zain/Activation/out/mlp-linear-9L_run/checkpoint-100/optimizer.pt +1 -1
  3. zain/Activation/out/mlp-linear-9L_run/checkpoint-100/scheduler.pt +1 -1
  4. zain/Activation/out/mlp-linear-9L_run/checkpoint-100/trainer_state.json +29 -29
  5. zain/Activation/out/mlp-linear-9L_run/checkpoint-100/training_args.bin +1 -1
  6. zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/model.safetensors +1 -1
  7. zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/optimizer.pt +1 -1
  8. zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/scheduler.pt +1 -1
  9. zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/trainer_state.json +255 -255
  10. zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/training_args.bin +1 -1
  11. zain/Activation/out/mlp-linear-9L_run/checkpoint-200/model.safetensors +1 -1
  12. zain/Activation/out/mlp-linear-9L_run/checkpoint-200/optimizer.pt +1 -1
  13. zain/Activation/out/mlp-linear-9L_run/checkpoint-200/scheduler.pt +1 -1
  14. zain/Activation/out/mlp-linear-9L_run/checkpoint-200/trainer_state.json +54 -54
  15. zain/Activation/out/mlp-linear-9L_run/checkpoint-200/training_args.bin +1 -1
  16. zain/Activation/out/mlp-linear-9L_run/checkpoint-300/model.safetensors +1 -1
  17. zain/Activation/out/mlp-linear-9L_run/checkpoint-300/optimizer.pt +1 -1
  18. zain/Activation/out/mlp-linear-9L_run/checkpoint-300/scheduler.pt +1 -1
  19. zain/Activation/out/mlp-linear-9L_run/checkpoint-300/trainer_state.json +79 -79
  20. zain/Activation/out/mlp-linear-9L_run/checkpoint-300/training_args.bin +1 -1
  21. zain/Activation/out/mlp-linear-9L_run/checkpoint-400/model.safetensors +1 -1
  22. zain/Activation/out/mlp-linear-9L_run/checkpoint-400/optimizer.pt +1 -1
zain/Activation/out/mlp-linear-9L_run/checkpoint-100/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3205cd2887410b1cdfe08cb74e4769a33196e2a13a43044fe0f59fc69036228d
3
  size 4010544
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ee3150e1d93b5874623c63f0e2ea5b36fb2e65acf8d44077a0e287e12a034a46
3
  size 4010544
zain/Activation/out/mlp-linear-9L_run/checkpoint-100/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a882674dcbcbe9decabd0de3f09bb8588e04c2d7e98fe233ba5ad90cc7eb1b49
3
  size 8068282
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e5025c23ee5dd3f3ad71dfcf508451b402edf9bf8bf3bd75060dc94f0d0b8991
3
  size 8068282
zain/Activation/out/mlp-linear-9L_run/checkpoint-100/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fb46541d572e87fb0d4fda911efea60cde9a6c4b2c0ba1e6a6c081af0a9ab78c
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:467abc10c7d90be39dedcb07aeb5ab431826fa1c3718145ad8ea209f579afd08
3
  size 1064
zain/Activation/out/mlp-linear-9L_run/checkpoint-100/trainer_state.json CHANGED
@@ -2,7 +2,7 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.003370407819346141,
6
  "eval_steps": 100,
7
  "global_step": 100,
8
  "is_hyper_param_search": false,
@@ -10,51 +10,51 @@
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0006740815638692282,
14
- "grad_norm": 1.796875,
15
- "learning_rate": 1.14e-05,
16
- "loss": 8.322640228271485,
17
  "step": 20
18
  },
19
  {
20
- "epoch": 0.0013481631277384564,
21
- "grad_norm": 1.75,
22
- "learning_rate": 2.34e-05,
23
- "loss": 8.267462158203125,
24
  "step": 40
25
  },
26
  {
27
- "epoch": 0.0020222446916076846,
28
- "grad_norm": 1.3046875,
29
- "learning_rate": 3.539999999999999e-05,
30
- "loss": 8.106219482421874,
31
  "step": 60
32
  },
33
  {
34
- "epoch": 0.002696326255476913,
35
- "grad_norm": 1.28125,
36
- "learning_rate": 4.7399999999999993e-05,
37
- "loss": 7.948130798339844,
38
  "step": 80
39
  },
40
  {
41
- "epoch": 0.003370407819346141,
42
- "grad_norm": 1.25,
43
- "learning_rate": 5.94e-05,
44
- "loss": 7.777301788330078,
45
  "step": 100
46
  },
47
  {
48
- "epoch": 0.003370407819346141,
49
- "eval_loss": 7.679966926574707,
50
- "eval_runtime": 8.4901,
51
- "eval_samples_per_second": 1122.134,
52
- "eval_steps_per_second": 0.824,
53
  "step": 100
54
  }
55
  ],
56
  "logging_steps": 20,
57
- "max_steps": 2500,
58
  "num_input_tokens_seen": 0,
59
  "num_train_epochs": 1,
60
  "save_steps": 100,
@@ -70,8 +70,8 @@
70
  "attributes": {}
71
  }
72
  },
73
- "total_flos": 14519422156800.0,
74
- "train_batch_size": 32,
75
  "trial_name": null,
76
  "trial_params": null
77
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.008426019548365353,
6
  "eval_steps": 100,
7
  "global_step": 100,
8
  "is_hyper_param_search": false,
 
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.0016852039096730705,
14
+ "grad_norm": 1.2421875,
15
+ "learning_rate": 9.5e-05,
16
+ "loss": 8.200721740722656,
17
  "step": 20
18
  },
19
  {
20
+ "epoch": 0.003370407819346141,
21
+ "grad_norm": 1.2421875,
22
+ "learning_rate": 0.00019500000000000002,
23
+ "loss": 7.764720153808594,
24
  "step": 40
25
  },
26
  {
27
+ "epoch": 0.005055611729019211,
28
+ "grad_norm": 1.2265625,
29
+ "learning_rate": 0.000295,
30
+ "loss": 7.160160064697266,
31
  "step": 60
32
  },
33
  {
34
+ "epoch": 0.006740815638692282,
35
+ "grad_norm": 1.2109375,
36
+ "learning_rate": 0.000395,
37
+ "loss": 6.480591583251953,
38
  "step": 80
39
  },
40
  {
41
+ "epoch": 0.008426019548365353,
42
+ "grad_norm": 1.0078125,
43
+ "learning_rate": 0.000495,
44
+ "loss": 5.919136428833008,
45
  "step": 100
46
  },
47
  {
48
+ "epoch": 0.008426019548365353,
49
+ "eval_loss": 5.634258270263672,
50
+ "eval_runtime": 7.97,
51
+ "eval_samples_per_second": 1195.356,
52
+ "eval_steps_per_second": 0.878,
53
  "step": 100
54
  }
55
  ],
56
  "logging_steps": 20,
57
+ "max_steps": 1000,
58
  "num_input_tokens_seen": 0,
59
  "num_train_epochs": 1,
60
  "save_steps": 100,
 
70
  "attributes": {}
71
  }
72
  },
73
+ "total_flos": 36298555392000.0,
74
+ "train_batch_size": 80,
75
  "trial_name": null,
76
  "trial_params": null
77
  }
zain/Activation/out/mlp-linear-9L_run/checkpoint-100/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e2150980b46702de80cf5b9c95700c86dedab0889248b4672dd0d83fc71b3aa0
3
  size 4920
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1168ea4bbfb8182db6bef374718cd5e9bd631ffa3eb5aaea5cc2742de1e3c4e5
3
  size 4920
zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:25e6401ca6e833bf33559d76a3dcf9fa3a56c754a0d66fedcc3e509d540d7d6b
3
  size 4010544
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9e9c917aa3b25bdbc40f473e1cf017022bafceb91187441f0ef9ae86b2f5e2e6
3
  size 4010544
zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cff32e52980386695d98d3cfb8388189ece637a31d0a7b7a82292c82f55463d3
3
  size 8068282
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07e2637072ec2fd39d857cefe3a2082774923a5818032efc7dd3a59dde3fa267
3
  size 8068282
zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:43b0add3f094a83e4275a4cab099e7b30afdca210ad5d92ec236fce75cdb93b3
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:caa55e3f57ed08f9a32b207aad2408ead6f5f9323ec1ed27900a7c11e3b8bc31
3
  size 1064
zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/trainer_state.json CHANGED
@@ -2,7 +2,7 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.03370407819346141,
6
  "eval_steps": 100,
7
  "global_step": 1000,
8
  "is_hyper_param_search": false,
@@ -10,438 +10,438 @@
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0006740815638692282,
14
- "grad_norm": 1.796875,
15
- "learning_rate": 1.14e-05,
16
- "loss": 8.322640228271485,
17
  "step": 20
18
  },
19
  {
20
- "epoch": 0.0013481631277384564,
21
- "grad_norm": 1.75,
22
- "learning_rate": 2.34e-05,
23
- "loss": 8.267462158203125,
24
  "step": 40
25
  },
26
  {
27
- "epoch": 0.0020222446916076846,
28
- "grad_norm": 1.3046875,
29
- "learning_rate": 3.539999999999999e-05,
30
- "loss": 8.106219482421874,
31
  "step": 60
32
  },
33
  {
34
- "epoch": 0.002696326255476913,
35
- "grad_norm": 1.28125,
36
- "learning_rate": 4.7399999999999993e-05,
37
- "loss": 7.948130798339844,
38
  "step": 80
39
  },
40
  {
41
- "epoch": 0.003370407819346141,
42
- "grad_norm": 1.25,
43
- "learning_rate": 5.94e-05,
44
- "loss": 7.777301788330078,
45
  "step": 100
46
  },
47
  {
48
- "epoch": 0.003370407819346141,
49
- "eval_loss": 7.679966926574707,
50
- "eval_runtime": 8.4901,
51
- "eval_samples_per_second": 1122.134,
52
- "eval_steps_per_second": 0.824,
53
  "step": 100
54
  },
55
  {
56
- "epoch": 0.004044489383215369,
57
- "grad_norm": 1.2578125,
58
- "learning_rate": 7.139999999999999e-05,
59
- "loss": 7.585383605957031,
60
  "step": 120
61
  },
62
  {
63
- "epoch": 0.0047185709470845974,
64
- "grad_norm": 1.25,
65
- "learning_rate": 8.34e-05,
66
- "loss": 7.3637535095214846,
67
  "step": 140
68
  },
69
  {
70
- "epoch": 0.005392652510953826,
71
- "grad_norm": 1.25,
72
- "learning_rate": 9.539999999999999e-05,
73
- "loss": 7.1375579833984375,
74
  "step": 160
75
  },
76
  {
77
- "epoch": 0.006066734074823054,
78
- "grad_norm": 1.34375,
79
- "learning_rate": 0.00010739999999999998,
80
- "loss": 6.910031127929687,
81
  "step": 180
82
  },
83
  {
84
- "epoch": 0.006740815638692282,
85
- "grad_norm": 1.3359375,
86
- "learning_rate": 0.0001194,
87
- "loss": 6.671029663085937,
88
  "step": 200
89
  },
90
  {
91
- "epoch": 0.006740815638692282,
92
- "eval_loss": 6.548758506774902,
93
- "eval_runtime": 8.6601,
94
- "eval_samples_per_second": 1100.105,
95
- "eval_steps_per_second": 0.808,
96
  "step": 200
97
  },
98
  {
99
- "epoch": 0.00741489720256151,
100
- "grad_norm": 1.578125,
101
- "learning_rate": 0.0001314,
102
- "loss": 6.457804107666016,
103
  "step": 220
104
  },
105
  {
106
- "epoch": 0.008088978766430738,
107
- "grad_norm": 1.4921875,
108
- "learning_rate": 0.0001434,
109
- "loss": 6.254596328735351,
110
  "step": 240
111
  },
112
  {
113
- "epoch": 0.008763060330299966,
114
- "grad_norm": 1.171875,
115
- "learning_rate": 0.00015539999999999998,
116
- "loss": 6.047513961791992,
117
  "step": 260
118
  },
119
  {
120
- "epoch": 0.009437141894169195,
121
- "grad_norm": 1.8828125,
122
- "learning_rate": 0.0001674,
123
- "loss": 5.870236587524414,
124
  "step": 280
125
  },
126
  {
127
- "epoch": 0.010111223458038422,
128
- "grad_norm": 1.359375,
129
- "learning_rate": 0.00017939999999999997,
130
- "loss": 5.72708740234375,
131
  "step": 300
132
  },
133
  {
134
- "epoch": 0.010111223458038422,
135
- "eval_loss": 5.652859687805176,
136
- "eval_runtime": 8.4927,
137
- "eval_samples_per_second": 1121.794,
138
- "eval_steps_per_second": 0.824,
139
  "step": 300
140
  },
141
  {
142
- "epoch": 0.010785305021907651,
143
- "grad_norm": 1.609375,
144
- "learning_rate": 0.0001914,
145
- "loss": 5.585579681396484,
146
  "step": 320
147
  },
148
  {
149
- "epoch": 0.011459386585776879,
150
- "grad_norm": 1.671875,
151
- "learning_rate": 0.00020339999999999998,
152
- "loss": 5.470914077758789,
153
  "step": 340
154
  },
155
  {
156
- "epoch": 0.012133468149646108,
157
- "grad_norm": 1.4140625,
158
- "learning_rate": 0.00021539999999999998,
159
- "loss": 5.318555068969727,
160
  "step": 360
161
  },
162
  {
163
- "epoch": 0.012807549713515335,
164
- "grad_norm": 1.6015625,
165
- "learning_rate": 0.00022739999999999997,
166
- "loss": 5.185982894897461,
167
  "step": 380
168
  },
169
  {
170
- "epoch": 0.013481631277384564,
171
- "grad_norm": 1.2578125,
172
- "learning_rate": 0.0002394,
173
- "loss": 5.065654754638672,
174
  "step": 400
175
  },
176
  {
177
- "epoch": 0.013481631277384564,
178
- "eval_loss": 5.008047103881836,
179
- "eval_runtime": 8.5503,
180
- "eval_samples_per_second": 1114.232,
181
- "eval_steps_per_second": 0.819,
182
  "step": 400
183
  },
184
  {
185
- "epoch": 0.014155712841253791,
186
- "grad_norm": 2.140625,
187
- "learning_rate": 0.0002514,
188
- "loss": 4.935818481445312,
189
  "step": 420
190
  },
191
  {
192
- "epoch": 0.01482979440512302,
193
- "grad_norm": 1.1875,
194
- "learning_rate": 0.00026339999999999995,
195
- "loss": 4.853317642211914,
196
  "step": 440
197
  },
198
  {
199
- "epoch": 0.015503875968992248,
200
- "grad_norm": 1.5390625,
201
- "learning_rate": 0.00027539999999999997,
202
- "loss": 4.7492321014404295,
203
  "step": 460
204
  },
205
  {
206
- "epoch": 0.016177957532861477,
207
- "grad_norm": 1.921875,
208
- "learning_rate": 0.00028739999999999994,
209
- "loss": 4.629489898681641,
210
  "step": 480
211
  },
212
  {
213
- "epoch": 0.016852039096730706,
214
- "grad_norm": 1.7890625,
215
- "learning_rate": 0.00029939999999999996,
216
- "loss": 4.565845108032226,
217
  "step": 500
218
  },
219
  {
220
- "epoch": 0.016852039096730706,
221
- "eval_loss": 4.530772686004639,
222
- "eval_runtime": 8.4284,
223
- "eval_samples_per_second": 1130.345,
224
- "eval_steps_per_second": 0.831,
225
  "step": 500
226
  },
227
  {
228
- "epoch": 0.01752612066059993,
229
- "grad_norm": 1.140625,
230
- "learning_rate": 0.0003,
231
- "loss": 4.50256233215332,
232
  "step": 520
233
  },
234
  {
235
- "epoch": 0.01820020222446916,
236
- "grad_norm": 1.7265625,
237
- "learning_rate": 0.0003,
238
- "loss": 4.419484710693359,
239
  "step": 540
240
  },
241
  {
242
- "epoch": 0.01887428378833839,
243
- "grad_norm": 1.3125,
244
- "learning_rate": 0.0003,
245
- "loss": 4.363323593139649,
246
  "step": 560
247
  },
248
  {
249
- "epoch": 0.01954836535220762,
250
- "grad_norm": 1.5,
251
- "learning_rate": 0.0003,
252
- "loss": 4.3072765350341795,
253
  "step": 580
254
  },
255
  {
256
- "epoch": 0.020222446916076844,
257
- "grad_norm": 1.9765625,
258
- "learning_rate": 0.0003,
259
- "loss": 4.263522338867188,
260
  "step": 600
261
  },
262
  {
263
- "epoch": 0.020222446916076844,
264
- "eval_loss": 4.239859580993652,
265
- "eval_runtime": 8.5836,
266
- "eval_samples_per_second": 1109.908,
267
- "eval_steps_per_second": 0.816,
268
  "step": 600
269
  },
270
  {
271
- "epoch": 0.020896528479946073,
272
- "grad_norm": 1.2265625,
273
- "learning_rate": 0.0003,
274
- "loss": 4.207575988769531,
275
  "step": 620
276
  },
277
  {
278
- "epoch": 0.021570610043815303,
279
- "grad_norm": 1.3359375,
280
- "learning_rate": 0.0003,
281
- "loss": 4.179453659057617,
282
  "step": 640
283
  },
284
  {
285
- "epoch": 0.022244691607684528,
286
- "grad_norm": 1.09375,
287
- "learning_rate": 0.0003,
288
- "loss": 4.13963508605957,
289
  "step": 660
290
  },
291
  {
292
- "epoch": 0.022918773171553757,
293
- "grad_norm": 1.328125,
294
- "learning_rate": 0.0003,
295
- "loss": 4.0913646697998045,
296
  "step": 680
297
  },
298
  {
299
- "epoch": 0.023592854735422986,
300
- "grad_norm": 1.609375,
301
- "learning_rate": 0.0003,
302
- "loss": 4.082810974121093,
303
  "step": 700
304
  },
305
  {
306
- "epoch": 0.023592854735422986,
307
- "eval_loss": 4.061285495758057,
308
- "eval_runtime": 8.3862,
309
- "eval_samples_per_second": 1136.028,
310
- "eval_steps_per_second": 0.835,
311
  "step": 700
312
  },
313
  {
314
- "epoch": 0.024266936299292215,
315
- "grad_norm": 1.453125,
316
- "learning_rate": 0.0003,
317
- "loss": 4.052593612670899,
318
  "step": 720
319
  },
320
  {
321
- "epoch": 0.02494101786316144,
322
- "grad_norm": 1.46875,
323
- "learning_rate": 0.0003,
324
- "loss": 4.038698196411133,
325
  "step": 740
326
  },
327
  {
328
- "epoch": 0.02561509942703067,
329
- "grad_norm": 1.671875,
330
- "learning_rate": 0.0003,
331
- "loss": 3.99466552734375,
332
  "step": 760
333
  },
334
  {
335
- "epoch": 0.0262891809908999,
336
- "grad_norm": 1.3671875,
337
- "learning_rate": 0.0003,
338
- "loss": 3.9530941009521485,
339
  "step": 780
340
  },
341
  {
342
- "epoch": 0.026963262554769128,
343
- "grad_norm": 1.4375,
344
- "learning_rate": 0.0003,
345
- "loss": 3.95872802734375,
346
  "step": 800
347
  },
348
  {
349
- "epoch": 0.026963262554769128,
350
- "eval_loss": 3.9487836360931396,
351
- "eval_runtime": 8.7643,
352
- "eval_samples_per_second": 1087.026,
353
- "eval_steps_per_second": 0.799,
354
  "step": 800
355
  },
356
  {
357
- "epoch": 0.027637344118638354,
358
- "grad_norm": 1.2734375,
359
- "learning_rate": 0.0003,
360
- "loss": 3.917556381225586,
361
  "step": 820
362
  },
363
  {
364
- "epoch": 0.028311425682507583,
365
- "grad_norm": 1.390625,
366
- "learning_rate": 0.0003,
367
- "loss": 3.913285827636719,
368
  "step": 840
369
  },
370
  {
371
- "epoch": 0.028985507246376812,
372
- "grad_norm": 1.453125,
373
- "learning_rate": 0.0003,
374
- "loss": 3.9367324829101564,
375
  "step": 860
376
  },
377
  {
378
- "epoch": 0.02965958881024604,
379
- "grad_norm": 1.328125,
380
- "learning_rate": 0.0003,
381
- "loss": 3.8899993896484375,
382
  "step": 880
383
  },
384
  {
385
- "epoch": 0.030333670374115267,
386
- "grad_norm": 1.6875,
387
- "learning_rate": 0.0003,
388
- "loss": 3.8575370788574217,
389
  "step": 900
390
  },
391
  {
392
- "epoch": 0.030333670374115267,
393
- "eval_loss": 3.871619701385498,
394
- "eval_runtime": 8.7624,
395
- "eval_samples_per_second": 1087.263,
396
- "eval_steps_per_second": 0.799,
397
  "step": 900
398
  },
399
  {
400
- "epoch": 0.031007751937984496,
401
- "grad_norm": 1.1875,
402
- "learning_rate": 0.0003,
403
- "loss": 3.870378112792969,
404
  "step": 920
405
  },
406
  {
407
- "epoch": 0.031681833501853725,
408
- "grad_norm": 1.234375,
409
- "learning_rate": 0.0003,
410
- "loss": 3.852782440185547,
411
  "step": 940
412
  },
413
  {
414
- "epoch": 0.032355915065722954,
415
- "grad_norm": 1.515625,
416
- "learning_rate": 0.0003,
417
- "loss": 3.821004867553711,
418
  "step": 960
419
  },
420
  {
421
- "epoch": 0.03302999662959218,
422
- "grad_norm": 1.4921875,
423
- "learning_rate": 0.0003,
424
- "loss": 3.8098331451416017,
425
  "step": 980
426
  },
427
  {
428
- "epoch": 0.03370407819346141,
429
- "grad_norm": 1.4453125,
430
- "learning_rate": 0.0003,
431
- "loss": 3.806192398071289,
432
  "step": 1000
433
  },
434
  {
435
- "epoch": 0.03370407819346141,
436
- "eval_loss": 3.805492401123047,
437
- "eval_runtime": 8.55,
438
- "eval_samples_per_second": 1114.265,
439
- "eval_steps_per_second": 0.819,
440
  "step": 1000
441
  }
442
  ],
443
  "logging_steps": 20,
444
- "max_steps": 2500,
445
  "num_input_tokens_seen": 0,
446
  "num_train_epochs": 1,
447
  "save_steps": 100,
@@ -452,13 +452,13 @@
452
  "should_evaluate": false,
453
  "should_log": false,
454
  "should_save": true,
455
- "should_training_stop": false
456
  },
457
  "attributes": {}
458
  }
459
  },
460
- "total_flos": 145194221568000.0,
461
- "train_batch_size": 32,
462
  "trial_name": null,
463
  "trial_params": null
464
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.08426019548365352,
6
  "eval_steps": 100,
7
  "global_step": 1000,
8
  "is_hyper_param_search": false,
 
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.0016852039096730705,
14
+ "grad_norm": 1.2421875,
15
+ "learning_rate": 9.5e-05,
16
+ "loss": 8.200721740722656,
17
  "step": 20
18
  },
19
  {
20
+ "epoch": 0.003370407819346141,
21
+ "grad_norm": 1.2421875,
22
+ "learning_rate": 0.00019500000000000002,
23
+ "loss": 7.764720153808594,
24
  "step": 40
25
  },
26
  {
27
+ "epoch": 0.005055611729019211,
28
+ "grad_norm": 1.2265625,
29
+ "learning_rate": 0.000295,
30
+ "loss": 7.160160064697266,
31
  "step": 60
32
  },
33
  {
34
+ "epoch": 0.006740815638692282,
35
+ "grad_norm": 1.2109375,
36
+ "learning_rate": 0.000395,
37
+ "loss": 6.480591583251953,
38
  "step": 80
39
  },
40
  {
41
+ "epoch": 0.008426019548365353,
42
+ "grad_norm": 1.0078125,
43
+ "learning_rate": 0.000495,
44
+ "loss": 5.919136428833008,
45
  "step": 100
46
  },
47
  {
48
+ "epoch": 0.008426019548365353,
49
+ "eval_loss": 5.634258270263672,
50
+ "eval_runtime": 7.97,
51
+ "eval_samples_per_second": 1195.356,
52
+ "eval_steps_per_second": 0.878,
53
  "step": 100
54
  },
55
  {
56
+ "epoch": 0.010111223458038422,
57
+ "grad_norm": 1.171875,
58
+ "learning_rate": 0.0005949999999999999,
59
+ "loss": 5.412916946411133,
60
  "step": 120
61
  },
62
  {
63
+ "epoch": 0.011796427367711493,
64
+ "grad_norm": 1.515625,
65
+ "learning_rate": 0.000695,
66
+ "loss": 5.0327880859375,
67
  "step": 140
68
  },
69
  {
70
+ "epoch": 0.013481631277384564,
71
+ "grad_norm": 0.9765625,
72
+ "learning_rate": 0.000795,
73
+ "loss": 4.69476089477539,
74
  "step": 160
75
  },
76
  {
77
+ "epoch": 0.015166835187057633,
78
+ "grad_norm": 0.8828125,
79
+ "learning_rate": 0.0008950000000000001,
80
+ "loss": 4.4246673583984375,
81
  "step": 180
82
  },
83
  {
84
+ "epoch": 0.016852039096730706,
85
+ "grad_norm": 0.87890625,
86
+ "learning_rate": 0.000995,
87
+ "loss": 4.204695129394532,
88
  "step": 200
89
  },
90
  {
91
+ "epoch": 0.016852039096730706,
92
+ "eval_loss": 4.133424282073975,
93
+ "eval_runtime": 7.9329,
94
+ "eval_samples_per_second": 1200.942,
95
+ "eval_steps_per_second": 0.882,
96
  "step": 200
97
  },
98
  {
99
+ "epoch": 0.018537243006403775,
100
+ "grad_norm": 0.6875,
101
+ "learning_rate": 0.001,
102
+ "loss": 4.048733520507812,
103
  "step": 220
104
  },
105
  {
106
+ "epoch": 0.020222446916076844,
107
+ "grad_norm": 0.73828125,
108
+ "learning_rate": 0.001,
109
+ "loss": 3.9190834045410154,
110
  "step": 240
111
  },
112
  {
113
+ "epoch": 0.021907650825749917,
114
+ "grad_norm": 0.68359375,
115
+ "learning_rate": 0.001,
116
+ "loss": 3.7833847045898437,
117
  "step": 260
118
  },
119
  {
120
+ "epoch": 0.023592854735422986,
121
+ "grad_norm": 0.82421875,
122
+ "learning_rate": 0.001,
123
+ "loss": 3.700960159301758,
124
  "step": 280
125
  },
126
  {
127
+ "epoch": 0.025278058645096056,
128
+ "grad_norm": 0.984375,
129
+ "learning_rate": 0.001,
130
+ "loss": 3.6359439849853517,
131
  "step": 300
132
  },
133
  {
134
+ "epoch": 0.025278058645096056,
135
+ "eval_loss": 3.5975606441497803,
136
+ "eval_runtime": 7.973,
137
+ "eval_samples_per_second": 1194.91,
138
+ "eval_steps_per_second": 0.878,
139
  "step": 300
140
  },
141
  {
142
+ "epoch": 0.026963262554769128,
143
+ "grad_norm": 0.80859375,
144
+ "learning_rate": 0.001,
145
+ "loss": 3.5393722534179686,
146
  "step": 320
147
  },
148
  {
149
+ "epoch": 0.028648466464442197,
150
+ "grad_norm": 0.72265625,
151
+ "learning_rate": 0.001,
152
+ "loss": 3.492219924926758,
153
  "step": 340
154
  },
155
  {
156
+ "epoch": 0.030333670374115267,
157
+ "grad_norm": 0.8203125,
158
+ "learning_rate": 0.001,
159
+ "loss": 3.4430694580078125,
160
  "step": 360
161
  },
162
  {
163
+ "epoch": 0.032018874283788336,
164
+ "grad_norm": 0.8203125,
165
+ "learning_rate": 0.001,
166
+ "loss": 3.3989883422851563,
167
  "step": 380
168
  },
169
  {
170
+ "epoch": 0.03370407819346141,
171
+ "grad_norm": 0.6484375,
172
+ "learning_rate": 0.001,
173
+ "loss": 3.341664123535156,
174
  "step": 400
175
  },
176
  {
177
+ "epoch": 0.03370407819346141,
178
+ "eval_loss": 3.3295202255249023,
179
+ "eval_runtime": 8.1687,
180
+ "eval_samples_per_second": 1166.287,
181
+ "eval_steps_per_second": 0.857,
182
  "step": 400
183
  },
184
  {
185
+ "epoch": 0.03538928210313448,
186
+ "grad_norm": 0.7109375,
187
+ "learning_rate": 0.001,
188
+ "loss": 3.3047794342041015,
189
  "step": 420
190
  },
191
  {
192
+ "epoch": 0.03707448601280755,
193
+ "grad_norm": 0.71875,
194
+ "learning_rate": 0.001,
195
+ "loss": 3.258700942993164,
196
  "step": 440
197
  },
198
  {
199
+ "epoch": 0.03875968992248062,
200
+ "grad_norm": 0.73046875,
201
+ "learning_rate": 0.001,
202
+ "loss": 3.229313278198242,
203
  "step": 460
204
  },
205
  {
206
+ "epoch": 0.04044489383215369,
207
+ "grad_norm": 0.703125,
208
+ "learning_rate": 0.001,
209
+ "loss": 3.202067565917969,
210
  "step": 480
211
  },
212
  {
213
+ "epoch": 0.04213009774182676,
214
+ "grad_norm": 0.7265625,
215
+ "learning_rate": 0.001,
216
+ "loss": 3.163772201538086,
217
  "step": 500
218
  },
219
  {
220
+ "epoch": 0.04213009774182676,
221
+ "eval_loss": 3.157355308532715,
222
+ "eval_runtime": 7.9503,
223
+ "eval_samples_per_second": 1198.315,
224
+ "eval_steps_per_second": 0.88,
225
  "step": 500
226
  },
227
  {
228
+ "epoch": 0.043815301651499834,
229
+ "grad_norm": 0.6953125,
230
+ "learning_rate": 0.001,
231
+ "loss": 3.1448848724365233,
232
  "step": 520
233
  },
234
  {
235
+ "epoch": 0.0455005055611729,
236
+ "grad_norm": 0.828125,
237
+ "learning_rate": 0.001,
238
+ "loss": 3.103527069091797,
239
  "step": 540
240
  },
241
  {
242
+ "epoch": 0.04718570947084597,
243
+ "grad_norm": 0.7578125,
244
+ "learning_rate": 0.001,
245
+ "loss": 3.08404541015625,
246
  "step": 560
247
  },
248
  {
249
+ "epoch": 0.04887091338051904,
250
+ "grad_norm": 0.76953125,
251
+ "learning_rate": 0.001,
252
+ "loss": 3.0501741409301757,
253
  "step": 580
254
  },
255
  {
256
+ "epoch": 0.05055611729019211,
257
+ "grad_norm": 0.96875,
258
+ "learning_rate": 0.001,
259
+ "loss": 3.0376760482788088,
260
  "step": 600
261
  },
262
  {
263
+ "epoch": 0.05055611729019211,
264
+ "eval_loss": 3.0310890674591064,
265
+ "eval_runtime": 8.1195,
266
+ "eval_samples_per_second": 1173.346,
267
+ "eval_steps_per_second": 0.862,
268
  "step": 600
269
  },
270
  {
271
+ "epoch": 0.05224132119986518,
272
+ "grad_norm": 0.82421875,
273
+ "learning_rate": 0.001,
274
+ "loss": 3.0314205169677733,
275
  "step": 620
276
  },
277
  {
278
+ "epoch": 0.053926525109538256,
279
+ "grad_norm": 0.640625,
280
+ "learning_rate": 0.001,
281
+ "loss": 3.0014928817749023,
282
  "step": 640
283
  },
284
  {
285
+ "epoch": 0.055611729019211326,
286
+ "grad_norm": 0.70703125,
287
+ "learning_rate": 0.001,
288
+ "loss": 2.9963293075561523,
289
  "step": 660
290
  },
291
  {
292
+ "epoch": 0.057296932928884395,
293
+ "grad_norm": 0.7109375,
294
+ "learning_rate": 0.001,
295
+ "loss": 2.9568761825561523,
296
  "step": 680
297
  },
298
  {
299
+ "epoch": 0.058982136838557464,
300
+ "grad_norm": 0.69921875,
301
+ "learning_rate": 0.001,
302
+ "loss": 2.9395275115966797,
303
  "step": 700
304
  },
305
  {
306
+ "epoch": 0.058982136838557464,
307
+ "eval_loss": 2.939429759979248,
308
+ "eval_runtime": 7.975,
309
+ "eval_samples_per_second": 1194.602,
310
+ "eval_steps_per_second": 0.878,
311
  "step": 700
312
  },
313
  {
314
+ "epoch": 0.06066734074823053,
315
+ "grad_norm": 0.6484375,
316
+ "learning_rate": 0.001,
317
+ "loss": 2.922671890258789,
318
  "step": 720
319
  },
320
  {
321
+ "epoch": 0.06235254465790361,
322
+ "grad_norm": 0.95703125,
323
+ "learning_rate": 0.001,
324
+ "loss": 2.9145633697509767,
325
  "step": 740
326
  },
327
  {
328
+ "epoch": 0.06403774856757667,
329
+ "grad_norm": 0.7109375,
330
+ "learning_rate": 0.001,
331
+ "loss": 2.8876668930053713,
332
  "step": 760
333
  },
334
  {
335
+ "epoch": 0.06572295247724974,
336
+ "grad_norm": 0.69140625,
337
+ "learning_rate": 0.001,
338
+ "loss": 2.8692466735839846,
339
  "step": 780
340
  },
341
  {
342
+ "epoch": 0.06740815638692282,
343
+ "grad_norm": 0.68359375,
344
+ "learning_rate": 0.001,
345
+ "loss": 2.8788633346557617,
346
  "step": 800
347
  },
348
  {
349
+ "epoch": 0.06740815638692282,
350
+ "eval_loss": 2.8632190227508545,
351
+ "eval_runtime": 8.2773,
352
+ "eval_samples_per_second": 1150.973,
353
+ "eval_steps_per_second": 0.846,
354
  "step": 800
355
  },
356
  {
357
+ "epoch": 0.0690933602965959,
358
+ "grad_norm": 0.6796875,
359
+ "learning_rate": 0.001,
360
+ "loss": 2.8496471405029298,
361
  "step": 820
362
  },
363
  {
364
+ "epoch": 0.07077856420626896,
365
+ "grad_norm": 0.62109375,
366
+ "learning_rate": 0.001,
367
+ "loss": 2.847636604309082,
368
  "step": 840
369
  },
370
  {
371
+ "epoch": 0.07246376811594203,
372
+ "grad_norm": 0.73046875,
373
+ "learning_rate": 0.001,
374
+ "loss": 2.8339916229248048,
375
  "step": 860
376
  },
377
  {
378
+ "epoch": 0.0741489720256151,
379
+ "grad_norm": 0.69921875,
380
+ "learning_rate": 0.001,
381
+ "loss": 2.8253028869628904,
382
  "step": 880
383
  },
384
  {
385
+ "epoch": 0.07583417593528817,
386
+ "grad_norm": 0.6875,
387
+ "learning_rate": 0.001,
388
+ "loss": 2.7853120803833007,
389
  "step": 900
390
  },
391
  {
392
+ "epoch": 0.07583417593528817,
393
+ "eval_loss": 2.8034849166870117,
394
+ "eval_runtime": 7.9593,
395
+ "eval_samples_per_second": 1196.967,
396
+ "eval_steps_per_second": 0.879,
397
  "step": 900
398
  },
399
  {
400
+ "epoch": 0.07751937984496124,
401
+ "grad_norm": 0.609375,
402
+ "learning_rate": 0.001,
403
+ "loss": 2.794095993041992,
404
  "step": 920
405
  },
406
  {
407
+ "epoch": 0.07920458375463431,
408
+ "grad_norm": 0.671875,
409
+ "learning_rate": 0.001,
410
+ "loss": 2.7890634536743164,
411
  "step": 940
412
  },
413
  {
414
+ "epoch": 0.08088978766430738,
415
+ "grad_norm": 0.58203125,
416
+ "learning_rate": 0.001,
417
+ "loss": 2.784823989868164,
418
  "step": 960
419
  },
420
  {
421
+ "epoch": 0.08257499157398045,
422
+ "grad_norm": 0.60546875,
423
+ "learning_rate": 0.001,
424
+ "loss": 2.775278663635254,
425
  "step": 980
426
  },
427
  {
428
+ "epoch": 0.08426019548365352,
429
+ "grad_norm": 0.78125,
430
+ "learning_rate": 0.001,
431
+ "loss": 2.753749656677246,
432
  "step": 1000
433
  },
434
  {
435
+ "epoch": 0.08426019548365352,
436
+ "eval_loss": 2.7597591876983643,
437
+ "eval_runtime": 7.9273,
438
+ "eval_samples_per_second": 1201.797,
439
+ "eval_steps_per_second": 0.883,
440
  "step": 1000
441
  }
442
  ],
443
  "logging_steps": 20,
444
+ "max_steps": 1000,
445
  "num_input_tokens_seen": 0,
446
  "num_train_epochs": 1,
447
  "save_steps": 100,
 
452
  "should_evaluate": false,
453
  "should_log": false,
454
  "should_save": true,
455
+ "should_training_stop": true
456
  },
457
  "attributes": {}
458
  }
459
  },
460
+ "total_flos": 362985553920000.0,
461
+ "train_batch_size": 80,
462
  "trial_name": null,
463
  "trial_params": null
464
  }
zain/Activation/out/mlp-linear-9L_run/checkpoint-1000/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e2150980b46702de80cf5b9c95700c86dedab0889248b4672dd0d83fc71b3aa0
3
  size 4920
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1168ea4bbfb8182db6bef374718cd5e9bd631ffa3eb5aaea5cc2742de1e3c4e5
3
  size 4920
zain/Activation/out/mlp-linear-9L_run/checkpoint-200/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:dabdab62649a48b7e0719e987e21b5a8de4f75a2f5ce3a06bc1a965d554d2e35
3
  size 4010544
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:762656e814c7e30cb1d1201812e18f80bb82acb680371d50ce8a4d48aad63d22
3
  size 4010544
zain/Activation/out/mlp-linear-9L_run/checkpoint-200/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6deb9eaefae8a5323312dff49adc7d3484cf9c4e17c0a1e2428e7085ed21c689
3
  size 8068282
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:989b134329aeb289210a3d241dd378c16f615ba0122bd4c864664949d7649488
3
  size 8068282
zain/Activation/out/mlp-linear-9L_run/checkpoint-200/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b8135ef28e3a46ab54526e011bfc69abed48145f3d54b2d14293e0383798411e
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7fcf92cd525e966db7d3124c96530397441749e7c16eb0c37e304bcf4507a234
3
  size 1064
zain/Activation/out/mlp-linear-9L_run/checkpoint-200/trainer_state.json CHANGED
@@ -2,7 +2,7 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.006740815638692282,
6
  "eval_steps": 100,
7
  "global_step": 200,
8
  "is_hyper_param_search": false,
@@ -10,94 +10,94 @@
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0006740815638692282,
14
- "grad_norm": 1.796875,
15
- "learning_rate": 1.14e-05,
16
- "loss": 8.322640228271485,
17
  "step": 20
18
  },
19
  {
20
- "epoch": 0.0013481631277384564,
21
- "grad_norm": 1.75,
22
- "learning_rate": 2.34e-05,
23
- "loss": 8.267462158203125,
24
  "step": 40
25
  },
26
  {
27
- "epoch": 0.0020222446916076846,
28
- "grad_norm": 1.3046875,
29
- "learning_rate": 3.539999999999999e-05,
30
- "loss": 8.106219482421874,
31
  "step": 60
32
  },
33
  {
34
- "epoch": 0.002696326255476913,
35
- "grad_norm": 1.28125,
36
- "learning_rate": 4.7399999999999993e-05,
37
- "loss": 7.948130798339844,
38
  "step": 80
39
  },
40
  {
41
- "epoch": 0.003370407819346141,
42
- "grad_norm": 1.25,
43
- "learning_rate": 5.94e-05,
44
- "loss": 7.777301788330078,
45
  "step": 100
46
  },
47
  {
48
- "epoch": 0.003370407819346141,
49
- "eval_loss": 7.679966926574707,
50
- "eval_runtime": 8.4901,
51
- "eval_samples_per_second": 1122.134,
52
- "eval_steps_per_second": 0.824,
53
  "step": 100
54
  },
55
  {
56
- "epoch": 0.004044489383215369,
57
- "grad_norm": 1.2578125,
58
- "learning_rate": 7.139999999999999e-05,
59
- "loss": 7.585383605957031,
60
  "step": 120
61
  },
62
  {
63
- "epoch": 0.0047185709470845974,
64
- "grad_norm": 1.25,
65
- "learning_rate": 8.34e-05,
66
- "loss": 7.3637535095214846,
67
  "step": 140
68
  },
69
  {
70
- "epoch": 0.005392652510953826,
71
- "grad_norm": 1.25,
72
- "learning_rate": 9.539999999999999e-05,
73
- "loss": 7.1375579833984375,
74
  "step": 160
75
  },
76
  {
77
- "epoch": 0.006066734074823054,
78
- "grad_norm": 1.34375,
79
- "learning_rate": 0.00010739999999999998,
80
- "loss": 6.910031127929687,
81
  "step": 180
82
  },
83
  {
84
- "epoch": 0.006740815638692282,
85
- "grad_norm": 1.3359375,
86
- "learning_rate": 0.0001194,
87
- "loss": 6.671029663085937,
88
  "step": 200
89
  },
90
  {
91
- "epoch": 0.006740815638692282,
92
- "eval_loss": 6.548758506774902,
93
- "eval_runtime": 8.6601,
94
- "eval_samples_per_second": 1100.105,
95
- "eval_steps_per_second": 0.808,
96
  "step": 200
97
  }
98
  ],
99
  "logging_steps": 20,
100
- "max_steps": 2500,
101
  "num_input_tokens_seen": 0,
102
  "num_train_epochs": 1,
103
  "save_steps": 100,
@@ -113,8 +113,8 @@
113
  "attributes": {}
114
  }
115
  },
116
- "total_flos": 29038844313600.0,
117
- "train_batch_size": 32,
118
  "trial_name": null,
119
  "trial_params": null
120
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.016852039096730706,
6
  "eval_steps": 100,
7
  "global_step": 200,
8
  "is_hyper_param_search": false,
 
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.0016852039096730705,
14
+ "grad_norm": 1.2421875,
15
+ "learning_rate": 9.5e-05,
16
+ "loss": 8.200721740722656,
17
  "step": 20
18
  },
19
  {
20
+ "epoch": 0.003370407819346141,
21
+ "grad_norm": 1.2421875,
22
+ "learning_rate": 0.00019500000000000002,
23
+ "loss": 7.764720153808594,
24
  "step": 40
25
  },
26
  {
27
+ "epoch": 0.005055611729019211,
28
+ "grad_norm": 1.2265625,
29
+ "learning_rate": 0.000295,
30
+ "loss": 7.160160064697266,
31
  "step": 60
32
  },
33
  {
34
+ "epoch": 0.006740815638692282,
35
+ "grad_norm": 1.2109375,
36
+ "learning_rate": 0.000395,
37
+ "loss": 6.480591583251953,
38
  "step": 80
39
  },
40
  {
41
+ "epoch": 0.008426019548365353,
42
+ "grad_norm": 1.0078125,
43
+ "learning_rate": 0.000495,
44
+ "loss": 5.919136428833008,
45
  "step": 100
46
  },
47
  {
48
+ "epoch": 0.008426019548365353,
49
+ "eval_loss": 5.634258270263672,
50
+ "eval_runtime": 7.97,
51
+ "eval_samples_per_second": 1195.356,
52
+ "eval_steps_per_second": 0.878,
53
  "step": 100
54
  },
55
  {
56
+ "epoch": 0.010111223458038422,
57
+ "grad_norm": 1.171875,
58
+ "learning_rate": 0.0005949999999999999,
59
+ "loss": 5.412916946411133,
60
  "step": 120
61
  },
62
  {
63
+ "epoch": 0.011796427367711493,
64
+ "grad_norm": 1.515625,
65
+ "learning_rate": 0.000695,
66
+ "loss": 5.0327880859375,
67
  "step": 140
68
  },
69
  {
70
+ "epoch": 0.013481631277384564,
71
+ "grad_norm": 0.9765625,
72
+ "learning_rate": 0.000795,
73
+ "loss": 4.69476089477539,
74
  "step": 160
75
  },
76
  {
77
+ "epoch": 0.015166835187057633,
78
+ "grad_norm": 0.8828125,
79
+ "learning_rate": 0.0008950000000000001,
80
+ "loss": 4.4246673583984375,
81
  "step": 180
82
  },
83
  {
84
+ "epoch": 0.016852039096730706,
85
+ "grad_norm": 0.87890625,
86
+ "learning_rate": 0.000995,
87
+ "loss": 4.204695129394532,
88
  "step": 200
89
  },
90
  {
91
+ "epoch": 0.016852039096730706,
92
+ "eval_loss": 4.133424282073975,
93
+ "eval_runtime": 7.9329,
94
+ "eval_samples_per_second": 1200.942,
95
+ "eval_steps_per_second": 0.882,
96
  "step": 200
97
  }
98
  ],
99
  "logging_steps": 20,
100
+ "max_steps": 1000,
101
  "num_input_tokens_seen": 0,
102
  "num_train_epochs": 1,
103
  "save_steps": 100,
 
113
  "attributes": {}
114
  }
115
  },
116
+ "total_flos": 72597110784000.0,
117
+ "train_batch_size": 80,
118
  "trial_name": null,
119
  "trial_params": null
120
  }
zain/Activation/out/mlp-linear-9L_run/checkpoint-200/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e2150980b46702de80cf5b9c95700c86dedab0889248b4672dd0d83fc71b3aa0
3
  size 4920
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1168ea4bbfb8182db6bef374718cd5e9bd631ffa3eb5aaea5cc2742de1e3c4e5
3
  size 4920
zain/Activation/out/mlp-linear-9L_run/checkpoint-300/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bb990e0914241d4792cac924c1bd1c5df31d8be53363d93f8974a9fb0dec2538
3
  size 4010544
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b2e42aa29a0e4239b16970142301875769ce1b268e295391a75ea811c5a746ee
3
  size 4010544
zain/Activation/out/mlp-linear-9L_run/checkpoint-300/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b94a0ae890ae65285e885b159c1fc16b34f98fedb60ba41ed1d76b33f9b25bd6
3
  size 8068282
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:966c63057f1db063d6121bec616b0b7e30bbd6e5ca64d4995afcd3ea5b56c684
3
  size 8068282
zain/Activation/out/mlp-linear-9L_run/checkpoint-300/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:58882af6bc66e44afb6aa7c1675e12212a966de0b9a2fc23de850f993cbc78d3
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:41f2c5ea16f05cf86f93aaafaefd9dff965c2a78f38db3e537fd39e07a540ff4
3
  size 1064
zain/Activation/out/mlp-linear-9L_run/checkpoint-300/trainer_state.json CHANGED
@@ -2,7 +2,7 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.010111223458038422,
6
  "eval_steps": 100,
7
  "global_step": 300,
8
  "is_hyper_param_search": false,
@@ -10,137 +10,137 @@
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0006740815638692282,
14
- "grad_norm": 1.796875,
15
- "learning_rate": 1.14e-05,
16
- "loss": 8.322640228271485,
17
  "step": 20
18
  },
19
  {
20
- "epoch": 0.0013481631277384564,
21
- "grad_norm": 1.75,
22
- "learning_rate": 2.34e-05,
23
- "loss": 8.267462158203125,
24
  "step": 40
25
  },
26
  {
27
- "epoch": 0.0020222446916076846,
28
- "grad_norm": 1.3046875,
29
- "learning_rate": 3.539999999999999e-05,
30
- "loss": 8.106219482421874,
31
  "step": 60
32
  },
33
  {
34
- "epoch": 0.002696326255476913,
35
- "grad_norm": 1.28125,
36
- "learning_rate": 4.7399999999999993e-05,
37
- "loss": 7.948130798339844,
38
  "step": 80
39
  },
40
  {
41
- "epoch": 0.003370407819346141,
42
- "grad_norm": 1.25,
43
- "learning_rate": 5.94e-05,
44
- "loss": 7.777301788330078,
45
  "step": 100
46
  },
47
  {
48
- "epoch": 0.003370407819346141,
49
- "eval_loss": 7.679966926574707,
50
- "eval_runtime": 8.4901,
51
- "eval_samples_per_second": 1122.134,
52
- "eval_steps_per_second": 0.824,
53
  "step": 100
54
  },
55
  {
56
- "epoch": 0.004044489383215369,
57
- "grad_norm": 1.2578125,
58
- "learning_rate": 7.139999999999999e-05,
59
- "loss": 7.585383605957031,
60
  "step": 120
61
  },
62
  {
63
- "epoch": 0.0047185709470845974,
64
- "grad_norm": 1.25,
65
- "learning_rate": 8.34e-05,
66
- "loss": 7.3637535095214846,
67
  "step": 140
68
  },
69
  {
70
- "epoch": 0.005392652510953826,
71
- "grad_norm": 1.25,
72
- "learning_rate": 9.539999999999999e-05,
73
- "loss": 7.1375579833984375,
74
  "step": 160
75
  },
76
  {
77
- "epoch": 0.006066734074823054,
78
- "grad_norm": 1.34375,
79
- "learning_rate": 0.00010739999999999998,
80
- "loss": 6.910031127929687,
81
  "step": 180
82
  },
83
  {
84
- "epoch": 0.006740815638692282,
85
- "grad_norm": 1.3359375,
86
- "learning_rate": 0.0001194,
87
- "loss": 6.671029663085937,
88
  "step": 200
89
  },
90
  {
91
- "epoch": 0.006740815638692282,
92
- "eval_loss": 6.548758506774902,
93
- "eval_runtime": 8.6601,
94
- "eval_samples_per_second": 1100.105,
95
- "eval_steps_per_second": 0.808,
96
  "step": 200
97
  },
98
  {
99
- "epoch": 0.00741489720256151,
100
- "grad_norm": 1.578125,
101
- "learning_rate": 0.0001314,
102
- "loss": 6.457804107666016,
103
  "step": 220
104
  },
105
  {
106
- "epoch": 0.008088978766430738,
107
- "grad_norm": 1.4921875,
108
- "learning_rate": 0.0001434,
109
- "loss": 6.254596328735351,
110
  "step": 240
111
  },
112
  {
113
- "epoch": 0.008763060330299966,
114
- "grad_norm": 1.171875,
115
- "learning_rate": 0.00015539999999999998,
116
- "loss": 6.047513961791992,
117
  "step": 260
118
  },
119
  {
120
- "epoch": 0.009437141894169195,
121
- "grad_norm": 1.8828125,
122
- "learning_rate": 0.0001674,
123
- "loss": 5.870236587524414,
124
  "step": 280
125
  },
126
  {
127
- "epoch": 0.010111223458038422,
128
- "grad_norm": 1.359375,
129
- "learning_rate": 0.00017939999999999997,
130
- "loss": 5.72708740234375,
131
  "step": 300
132
  },
133
  {
134
- "epoch": 0.010111223458038422,
135
- "eval_loss": 5.652859687805176,
136
- "eval_runtime": 8.4927,
137
- "eval_samples_per_second": 1121.794,
138
- "eval_steps_per_second": 0.824,
139
  "step": 300
140
  }
141
  ],
142
  "logging_steps": 20,
143
- "max_steps": 2500,
144
  "num_input_tokens_seen": 0,
145
  "num_train_epochs": 1,
146
  "save_steps": 100,
@@ -156,8 +156,8 @@
156
  "attributes": {}
157
  }
158
  },
159
- "total_flos": 43558266470400.0,
160
- "train_batch_size": 32,
161
  "trial_name": null,
162
  "trial_params": null
163
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.025278058645096056,
6
  "eval_steps": 100,
7
  "global_step": 300,
8
  "is_hyper_param_search": false,
 
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.0016852039096730705,
14
+ "grad_norm": 1.2421875,
15
+ "learning_rate": 9.5e-05,
16
+ "loss": 8.200721740722656,
17
  "step": 20
18
  },
19
  {
20
+ "epoch": 0.003370407819346141,
21
+ "grad_norm": 1.2421875,
22
+ "learning_rate": 0.00019500000000000002,
23
+ "loss": 7.764720153808594,
24
  "step": 40
25
  },
26
  {
27
+ "epoch": 0.005055611729019211,
28
+ "grad_norm": 1.2265625,
29
+ "learning_rate": 0.000295,
30
+ "loss": 7.160160064697266,
31
  "step": 60
32
  },
33
  {
34
+ "epoch": 0.006740815638692282,
35
+ "grad_norm": 1.2109375,
36
+ "learning_rate": 0.000395,
37
+ "loss": 6.480591583251953,
38
  "step": 80
39
  },
40
  {
41
+ "epoch": 0.008426019548365353,
42
+ "grad_norm": 1.0078125,
43
+ "learning_rate": 0.000495,
44
+ "loss": 5.919136428833008,
45
  "step": 100
46
  },
47
  {
48
+ "epoch": 0.008426019548365353,
49
+ "eval_loss": 5.634258270263672,
50
+ "eval_runtime": 7.97,
51
+ "eval_samples_per_second": 1195.356,
52
+ "eval_steps_per_second": 0.878,
53
  "step": 100
54
  },
55
  {
56
+ "epoch": 0.010111223458038422,
57
+ "grad_norm": 1.171875,
58
+ "learning_rate": 0.0005949999999999999,
59
+ "loss": 5.412916946411133,
60
  "step": 120
61
  },
62
  {
63
+ "epoch": 0.011796427367711493,
64
+ "grad_norm": 1.515625,
65
+ "learning_rate": 0.000695,
66
+ "loss": 5.0327880859375,
67
  "step": 140
68
  },
69
  {
70
+ "epoch": 0.013481631277384564,
71
+ "grad_norm": 0.9765625,
72
+ "learning_rate": 0.000795,
73
+ "loss": 4.69476089477539,
74
  "step": 160
75
  },
76
  {
77
+ "epoch": 0.015166835187057633,
78
+ "grad_norm": 0.8828125,
79
+ "learning_rate": 0.0008950000000000001,
80
+ "loss": 4.4246673583984375,
81
  "step": 180
82
  },
83
  {
84
+ "epoch": 0.016852039096730706,
85
+ "grad_norm": 0.87890625,
86
+ "learning_rate": 0.000995,
87
+ "loss": 4.204695129394532,
88
  "step": 200
89
  },
90
  {
91
+ "epoch": 0.016852039096730706,
92
+ "eval_loss": 4.133424282073975,
93
+ "eval_runtime": 7.9329,
94
+ "eval_samples_per_second": 1200.942,
95
+ "eval_steps_per_second": 0.882,
96
  "step": 200
97
  },
98
  {
99
+ "epoch": 0.018537243006403775,
100
+ "grad_norm": 0.6875,
101
+ "learning_rate": 0.001,
102
+ "loss": 4.048733520507812,
103
  "step": 220
104
  },
105
  {
106
+ "epoch": 0.020222446916076844,
107
+ "grad_norm": 0.73828125,
108
+ "learning_rate": 0.001,
109
+ "loss": 3.9190834045410154,
110
  "step": 240
111
  },
112
  {
113
+ "epoch": 0.021907650825749917,
114
+ "grad_norm": 0.68359375,
115
+ "learning_rate": 0.001,
116
+ "loss": 3.7833847045898437,
117
  "step": 260
118
  },
119
  {
120
+ "epoch": 0.023592854735422986,
121
+ "grad_norm": 0.82421875,
122
+ "learning_rate": 0.001,
123
+ "loss": 3.700960159301758,
124
  "step": 280
125
  },
126
  {
127
+ "epoch": 0.025278058645096056,
128
+ "grad_norm": 0.984375,
129
+ "learning_rate": 0.001,
130
+ "loss": 3.6359439849853517,
131
  "step": 300
132
  },
133
  {
134
+ "epoch": 0.025278058645096056,
135
+ "eval_loss": 3.5975606441497803,
136
+ "eval_runtime": 7.973,
137
+ "eval_samples_per_second": 1194.91,
138
+ "eval_steps_per_second": 0.878,
139
  "step": 300
140
  }
141
  ],
142
  "logging_steps": 20,
143
+ "max_steps": 1000,
144
  "num_input_tokens_seen": 0,
145
  "num_train_epochs": 1,
146
  "save_steps": 100,
 
156
  "attributes": {}
157
  }
158
  },
159
+ "total_flos": 108895666176000.0,
160
+ "train_batch_size": 80,
161
  "trial_name": null,
162
  "trial_params": null
163
  }
zain/Activation/out/mlp-linear-9L_run/checkpoint-300/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e2150980b46702de80cf5b9c95700c86dedab0889248b4672dd0d83fc71b3aa0
3
  size 4920
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1168ea4bbfb8182db6bef374718cd5e9bd631ffa3eb5aaea5cc2742de1e3c4e5
3
  size 4920
zain/Activation/out/mlp-linear-9L_run/checkpoint-400/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:049537c1549b054350ff7c805931cdcbf686fe62e058a92106c3333654a38cf5
3
  size 4010544
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2d0ff1e1088550403d6e0b8fef9452fd5b3227af8fe86abe61830ee7d0bf370c
3
  size 4010544
zain/Activation/out/mlp-linear-9L_run/checkpoint-400/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2227c0e51f5fb74e817c276b3e8e52e1cbc463a8d31e8ce74c3f10d5f02f9bf3
3
  size 8068282
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:09d9c4167051eebf1c452b742773d843470782702987d8ad0f8f7e4b3f7e037c
3
  size 8068282