PRATYUSH-BHARDWAJ commited on
Commit
05d458e
·
verified ·
1 Parent(s): a47cfc1

SFT checkpoint step 56

Browse files
checkpoints/checkpoint-56/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c4e59670f29a88b1e81acd62c1ea373718dd7f79abd8374f5473537c04cdc6d8
3
  size 204500912
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9d248f8b3bd52bc0dc89d6247740852d8a46d8c46ea51910b7a17a117a5e16e4
3
  size 204500912
checkpoints/checkpoint-56/mtp_head.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4596cd452e7430fcbb46b6be680fc27b050513f20b4211b381fbdc6c4a951488
3
- size 40912203
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f293bb634d6dfe02eb83f0be38ee50a559118344add09a5875a34c252af49c7f
3
+ size 81817931
checkpoints/checkpoint-56/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8c4e32f654ec44c2f1b485b0531f7d7600ea7b28a0e8536aa5f339e79401fab4
3
- size 104062795
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:01ee19dd37cad207f2d867f0b0d52474223cfad156126adec90c6d9237b9db08
3
+ size 620569547
checkpoints/checkpoint-56/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d5d252120eeaf53d83655e0916a96e2c5c17beaf30dc55b6538ff812997184b7
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:76c6043b585044b82630a007cf0251383edab269a11ea9bc2faff0a208c2ae9b
3
  size 1383
checkpoints/checkpoint-56/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1d1edd317ce747eb9079c943a6ceb17cef973c0a9b5b581f0ff08ad95163e7a8
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e2bcb2b08f993bcefadf008113eb4b996a15539067d98b0fa5cdc9bdef938a7f
3
  size 1465
checkpoints/checkpoint-56/time_state.json CHANGED
@@ -1 +1 @@
1
- {"consumed_seconds": 364.6822929382324, "global_step": 56}
 
1
+ {"consumed_seconds": 479.686425447464, "global_step": 56}
checkpoints/checkpoint-56/trainer_state.json CHANGED
@@ -13,205 +13,205 @@
13
  "epoch": 0.017391304347826087,
14
  "grad_norm": NaN,
15
  "learning_rate": 0.0,
16
- "loss": 2.3871500492095947,
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
- "train_runtime": 18.9586,
21
- "train_tokens_per_second": 78.803
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
- "eval_loss": 5.106939315795898,
26
  "eval_num_tokens": 4980.0,
27
- "eval_runtime": 13.7855,
28
- "eval_samples_per_second": 2.176,
29
- "eval_steps_per_second": 0.58,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
32
  },
33
  {
34
  "epoch": 0.1391304347826087,
35
- "eval_loss": 5.106939315795898,
36
  "eval_num_tokens": 9004.0,
37
- "eval_runtime": 2.0516,
38
- "eval_samples_per_second": 14.623,
39
- "eval_steps_per_second": 3.899,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
- "grad_norm": 22.719650268554688,
46
- "learning_rate": 7.5e-05,
47
- "loss": 2.455470191107856,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
- "train_runtime": 96.6319,
52
- "train_tokens_per_second": 115.335
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
- "eval_loss": 1.0586106777191162,
57
  "eval_num_tokens": 13293.0,
58
- "eval_runtime": 2.0908,
59
- "eval_samples_per_second": 14.349,
60
- "eval_steps_per_second": 3.826,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
- "eval_loss": 0.4196360409259796,
67
  "eval_num_tokens": 17742.0,
68
- "eval_runtime": 2.1417,
69
- "eval_samples_per_second": 14.008,
70
- "eval_steps_per_second": 3.735,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
- "grad_norm": 3.528010606765747,
77
  "learning_rate": 0.0001425726650926814,
78
- "loss": 0.5043737411499023,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
- "train_runtime": 166.3694,
83
- "train_tokens_per_second": 121.801
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
- "eval_loss": 0.33024391531944275,
88
  "eval_num_tokens": 20264.0,
89
- "eval_runtime": 2.0878,
90
- "eval_samples_per_second": 14.369,
91
- "eval_steps_per_second": 3.832,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
- "eval_loss": 0.26133954524993896,
98
  "eval_num_tokens": 24990.0,
99
- "eval_runtime": 2.1109,
100
- "eval_samples_per_second": 14.212,
101
- "eval_steps_per_second": 3.79,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
- "eval_loss": 0.2881294786930084,
108
  "eval_num_tokens": 28628.0,
109
- "eval_runtime": 2.1211,
110
- "eval_samples_per_second": 14.143,
111
- "eval_steps_per_second": 3.772,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
- "grad_norm": 6.022609233856201,
118
  "learning_rate": 0.00011490240573865023,
119
- "loss": 0.14516949653625488,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
- "train_runtime": 233.5004,
124
- "train_tokens_per_second": 131.066
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
- "eval_loss": 0.22245244681835175,
129
  "eval_num_tokens": 33017.0,
130
- "eval_runtime": 2.0997,
131
- "eval_samples_per_second": 14.288,
132
- "eval_steps_per_second": 3.81,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  },
136
  {
137
  "epoch": 0.6260869565217392,
138
- "eval_loss": 0.1709093600511551,
139
  "eval_num_tokens": 37556.0,
140
- "eval_runtime": 2.1061,
141
- "eval_samples_per_second": 14.244,
142
- "eval_steps_per_second": 3.798,
143
  "num_input_tokens_seen": 37556,
144
  "step": 36
145
  },
146
  {
147
  "epoch": 0.6956521739130435,
148
- "grad_norm": 1.5943447351455688,
149
  "learning_rate": 7.5e-05,
150
- "loss": 0.09838705658912658,
151
  "num_input_tokens_seen": 43339,
152
  "num_tokens": 43339.0,
153
  "step": 40,
154
- "train_runtime": 282.5787,
155
- "train_tokens_per_second": 153.37
156
  },
157
  {
158
  "epoch": 0.6956521739130435,
159
- "eval_loss": 0.17494265735149384,
160
  "eval_num_tokens": 43339.0,
161
- "eval_runtime": 2.1383,
162
- "eval_samples_per_second": 14.03,
163
- "eval_steps_per_second": 3.741,
164
  "num_input_tokens_seen": 43339,
165
  "step": 40
166
  },
167
  {
168
  "epoch": 0.7652173913043478,
169
- "eval_loss": 0.1449701488018036,
170
  "eval_num_tokens": 51343.0,
171
- "eval_runtime": 2.1082,
172
- "eval_samples_per_second": 14.23,
173
- "eval_steps_per_second": 3.795,
174
  "num_input_tokens_seen": 51343,
175
  "step": 44
176
  },
177
  {
178
  "epoch": 0.8347826086956521,
179
- "eval_loss": 0.12524840235710144,
180
  "eval_num_tokens": 55787.0,
181
- "eval_runtime": 2.1038,
182
- "eval_samples_per_second": 14.26,
183
- "eval_steps_per_second": 3.803,
184
  "num_input_tokens_seen": 55787,
185
  "step": 48
186
  },
187
  {
188
  "epoch": 0.8695652173913043,
189
- "grad_norm": 1.0154601335525513,
190
  "learning_rate": 3.5097594261349764e-05,
191
- "loss": 0.07467616200447083,
192
  "num_input_tokens_seen": 56637,
193
  "num_tokens": 56637.0,
194
  "step": 50,
195
- "train_runtime": 341.3231,
196
- "train_tokens_per_second": 165.934
197
  },
198
  {
199
  "epoch": 0.9043478260869565,
200
- "eval_loss": 0.11500633507966995,
201
  "eval_num_tokens": 60640.0,
202
- "eval_runtime": 2.0996,
203
- "eval_samples_per_second": 14.288,
204
- "eval_steps_per_second": 3.81,
205
  "num_input_tokens_seen": 60640,
206
  "step": 52
207
  },
208
  {
209
  "epoch": 0.9739130434782609,
210
- "eval_loss": 0.10254310816526413,
211
  "eval_num_tokens": 66252.0,
212
- "eval_runtime": 2.1287,
213
- "eval_samples_per_second": 14.093,
214
- "eval_steps_per_second": 3.758,
215
  "num_input_tokens_seen": 66252,
216
  "step": 56
217
  }
@@ -233,7 +233,7 @@
233
  "attributes": {}
234
  }
235
  },
236
- "total_flos": 265739839209472.0,
237
  "train_batch_size": 1,
238
  "trial_name": null,
239
  "trial_params": null
 
13
  "epoch": 0.017391304347826087,
14
  "grad_norm": NaN,
15
  "learning_rate": 0.0,
16
+ "loss": 2.5696372985839844,
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
+ "train_runtime": 36.3516,
21
+ "train_tokens_per_second": 41.099
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
+ "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
+ "eval_runtime": 28.3903,
28
+ "eval_samples_per_second": 1.057,
29
+ "eval_steps_per_second": 0.282,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
32
  },
33
  {
34
  "epoch": 0.1391304347826087,
35
+ "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
+ "eval_runtime": 3.1825,
38
+ "eval_samples_per_second": 9.427,
39
+ "eval_steps_per_second": 2.514,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
+ "grad_norm": 28.139263153076172,
46
+ "learning_rate": 0.0,
47
+ "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
+ "train_runtime": 137.8118,
52
+ "train_tokens_per_second": 80.871
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
+ "eval_loss": 1.8169835805892944,
57
  "eval_num_tokens": 13293.0,
58
+ "eval_runtime": 3.1498,
59
+ "eval_samples_per_second": 9.525,
60
+ "eval_steps_per_second": 2.54,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
+ "eval_loss": 0.6515728831291199,
67
  "eval_num_tokens": 17742.0,
68
+ "eval_runtime": 3.1545,
69
+ "eval_samples_per_second": 9.51,
70
+ "eval_steps_per_second": 2.536,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
+ "grad_norm": 20.463083267211914,
77
  "learning_rate": 0.0001425726650926814,
78
+ "loss": 0.7741940021514893,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
+ "train_runtime": 223.0367,
83
+ "train_tokens_per_second": 90.855
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
+ "eval_loss": 0.3478561341762543,
88
  "eval_num_tokens": 20264.0,
89
+ "eval_runtime": 3.1698,
90
+ "eval_samples_per_second": 9.464,
91
+ "eval_steps_per_second": 2.524,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
+ "eval_loss": 0.3752416670322418,
98
  "eval_num_tokens": 24990.0,
99
+ "eval_runtime": 3.1322,
100
+ "eval_samples_per_second": 9.578,
101
+ "eval_steps_per_second": 2.554,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
+ "eval_loss": 0.3061341643333435,
108
  "eval_num_tokens": 28628.0,
109
+ "eval_runtime": 3.1408,
110
+ "eval_samples_per_second": 9.552,
111
+ "eval_steps_per_second": 2.547,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
+ "grad_norm": 3.9868009090423584,
118
  "learning_rate": 0.00011490240573865023,
119
+ "loss": 0.19884855747222902,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
+ "train_runtime": 304.1359,
124
+ "train_tokens_per_second": 100.626
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
+ "eval_loss": 0.25844958424568176,
129
  "eval_num_tokens": 33017.0,
130
+ "eval_runtime": 3.1661,
131
+ "eval_samples_per_second": 9.475,
132
+ "eval_steps_per_second": 2.527,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  },
136
  {
137
  "epoch": 0.6260869565217392,
138
+ "eval_loss": 0.21466659009456635,
139
  "eval_num_tokens": 37556.0,
140
+ "eval_runtime": 3.2027,
141
+ "eval_samples_per_second": 9.367,
142
+ "eval_steps_per_second": 2.498,
143
  "num_input_tokens_seen": 37556,
144
  "step": 36
145
  },
146
  {
147
  "epoch": 0.6956521739130435,
148
+ "grad_norm": 2.9145026206970215,
149
  "learning_rate": 7.5e-05,
150
+ "loss": 0.11073940992355347,
151
  "num_input_tokens_seen": 43339,
152
  "num_tokens": 43339.0,
153
  "step": 40,
154
+ "train_runtime": 370.1019,
155
+ "train_tokens_per_second": 117.1
156
  },
157
  {
158
  "epoch": 0.6956521739130435,
159
+ "eval_loss": 0.20814543962478638,
160
  "eval_num_tokens": 43339.0,
161
+ "eval_runtime": 3.2117,
162
+ "eval_samples_per_second": 9.341,
163
+ "eval_steps_per_second": 2.491,
164
  "num_input_tokens_seen": 43339,
165
  "step": 40
166
  },
167
  {
168
  "epoch": 0.7652173913043478,
169
+ "eval_loss": 0.13490967452526093,
170
  "eval_num_tokens": 51343.0,
171
+ "eval_runtime": 3.1593,
172
+ "eval_samples_per_second": 9.496,
173
+ "eval_steps_per_second": 2.532,
174
  "num_input_tokens_seen": 51343,
175
  "step": 44
176
  },
177
  {
178
  "epoch": 0.8347826086956521,
179
+ "eval_loss": 0.11187396198511124,
180
  "eval_num_tokens": 55787.0,
181
+ "eval_runtime": 3.1694,
182
+ "eval_samples_per_second": 9.465,
183
+ "eval_steps_per_second": 2.524,
184
  "num_input_tokens_seen": 55787,
185
  "step": 48
186
  },
187
  {
188
  "epoch": 0.8695652173913043,
189
+ "grad_norm": 1.7305588722229004,
190
  "learning_rate": 3.5097594261349764e-05,
191
+ "loss": 0.10026404857635499,
192
  "num_input_tokens_seen": 56637,
193
  "num_tokens": 56637.0,
194
  "step": 50,
195
+ "train_runtime": 448.4165,
196
+ "train_tokens_per_second": 126.304
197
  },
198
  {
199
  "epoch": 0.9043478260869565,
200
+ "eval_loss": 0.11084464192390442,
201
  "eval_num_tokens": 60640.0,
202
+ "eval_runtime": 3.1284,
203
+ "eval_samples_per_second": 9.589,
204
+ "eval_steps_per_second": 2.557,
205
  "num_input_tokens_seen": 60640,
206
  "step": 52
207
  },
208
  {
209
  "epoch": 0.9739130434782609,
210
+ "eval_loss": 0.10104832798242569,
211
  "eval_num_tokens": 66252.0,
212
+ "eval_runtime": 3.1587,
213
+ "eval_samples_per_second": 9.498,
214
+ "eval_steps_per_second": 2.533,
215
  "num_input_tokens_seen": 66252,
216
  "step": 56
217
  }
 
233
  "attributes": {}
234
  }
235
  },
236
+ "total_flos": 366819065987072.0,
237
  "train_batch_size": 1,
238
  "trial_name": null,
239
  "trial_params": null