PRATYUSH-BHARDWAJ commited on
Commit
39d701c
·
verified ·
1 Parent(s): 3e6f1f6

SFT checkpoint step 58

Browse files
checkpoints/checkpoint-58/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:634907b87fad29c41e1d4d85097416b68624027cd97eb45bc31006a260832795
3
  size 204500912
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fc857bcd5904c962a3383bf98b0b0e2dbdb8205d4292258e7ab24adedcd170b7
3
  size 204500912
checkpoints/checkpoint-58/mtp_head.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4596cd452e7430fcbb46b6be680fc27b050513f20b4211b381fbdc6c4a951488
3
- size 40912203
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f293bb634d6dfe02eb83f0be38ee50a559118344add09a5875a34c252af49c7f
3
+ size 81817931
checkpoints/checkpoint-58/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4eb50e46b8936a621fde73105836e718f934d55c1a76fee76f3c39e6451052e3
3
- size 104062795
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4e13095a45e7433c53c172add8a9d597f38278b60b51dc4a6fc1b3d90174ed09
3
+ size 620569547
checkpoints/checkpoint-58/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8adfb47887974e29804b6fe7fb969b1afa8105838a60d173990ae3c0be86b6f0
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:72b216d080578100bd57ee7cdb48421e348ca42dd3c8025e9877a55f62e8737f
3
  size 1383
checkpoints/checkpoint-58/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a5e9a21fee0ed695b918359d73521fd31afdc5745d9a5621dafc5600643d2c22
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:645097abd69992527144f761706f73c4c082ca049e8ce9eff30ed02004535f77
3
  size 1465
checkpoints/checkpoint-58/time_state.json CHANGED
@@ -1 +1 @@
1
- {"consumed_seconds": 381.40962314605713, "global_step": 58}
 
1
+ {"consumed_seconds": 510.2071752548218, "global_step": 58}
checkpoints/checkpoint-58/trainer_state.json CHANGED
@@ -13,215 +13,215 @@
13
  "epoch": 0.017391304347826087,
14
  "grad_norm": NaN,
15
  "learning_rate": 0.0,
16
- "loss": 2.3871500492095947,
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
- "train_runtime": 18.9586,
21
- "train_tokens_per_second": 78.803
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
- "eval_loss": 5.106939315795898,
26
  "eval_num_tokens": 4980.0,
27
- "eval_runtime": 13.7855,
28
- "eval_samples_per_second": 2.176,
29
- "eval_steps_per_second": 0.58,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
32
  },
33
  {
34
  "epoch": 0.1391304347826087,
35
- "eval_loss": 5.106939315795898,
36
  "eval_num_tokens": 9004.0,
37
- "eval_runtime": 2.0516,
38
- "eval_samples_per_second": 14.623,
39
- "eval_steps_per_second": 3.899,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
- "grad_norm": 22.719650268554688,
46
- "learning_rate": 7.5e-05,
47
- "loss": 2.455470191107856,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
- "train_runtime": 96.6319,
52
- "train_tokens_per_second": 115.335
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
- "eval_loss": 1.0586106777191162,
57
  "eval_num_tokens": 13293.0,
58
- "eval_runtime": 2.0908,
59
- "eval_samples_per_second": 14.349,
60
- "eval_steps_per_second": 3.826,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
- "eval_loss": 0.4196360409259796,
67
  "eval_num_tokens": 17742.0,
68
- "eval_runtime": 2.1417,
69
- "eval_samples_per_second": 14.008,
70
- "eval_steps_per_second": 3.735,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
- "grad_norm": 3.528010606765747,
77
  "learning_rate": 0.0001425726650926814,
78
- "loss": 0.5043737411499023,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
- "train_runtime": 166.3694,
83
- "train_tokens_per_second": 121.801
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
- "eval_loss": 0.33024391531944275,
88
  "eval_num_tokens": 20264.0,
89
- "eval_runtime": 2.0878,
90
- "eval_samples_per_second": 14.369,
91
- "eval_steps_per_second": 3.832,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
- "eval_loss": 0.26133954524993896,
98
  "eval_num_tokens": 24990.0,
99
- "eval_runtime": 2.1109,
100
- "eval_samples_per_second": 14.212,
101
- "eval_steps_per_second": 3.79,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
- "eval_loss": 0.2881294786930084,
108
  "eval_num_tokens": 28628.0,
109
- "eval_runtime": 2.1211,
110
- "eval_samples_per_second": 14.143,
111
- "eval_steps_per_second": 3.772,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
- "grad_norm": 6.022609233856201,
118
  "learning_rate": 0.00011490240573865023,
119
- "loss": 0.14516949653625488,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
- "train_runtime": 233.5004,
124
- "train_tokens_per_second": 131.066
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
- "eval_loss": 0.22245244681835175,
129
  "eval_num_tokens": 33017.0,
130
- "eval_runtime": 2.0997,
131
- "eval_samples_per_second": 14.288,
132
- "eval_steps_per_second": 3.81,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  },
136
  {
137
  "epoch": 0.6260869565217392,
138
- "eval_loss": 0.1709093600511551,
139
  "eval_num_tokens": 37556.0,
140
- "eval_runtime": 2.1061,
141
- "eval_samples_per_second": 14.244,
142
- "eval_steps_per_second": 3.798,
143
  "num_input_tokens_seen": 37556,
144
  "step": 36
145
  },
146
  {
147
  "epoch": 0.6956521739130435,
148
- "grad_norm": 1.5943447351455688,
149
  "learning_rate": 7.5e-05,
150
- "loss": 0.09838705658912658,
151
  "num_input_tokens_seen": 43339,
152
  "num_tokens": 43339.0,
153
  "step": 40,
154
- "train_runtime": 282.5787,
155
- "train_tokens_per_second": 153.37
156
  },
157
  {
158
  "epoch": 0.6956521739130435,
159
- "eval_loss": 0.17494265735149384,
160
  "eval_num_tokens": 43339.0,
161
- "eval_runtime": 2.1383,
162
- "eval_samples_per_second": 14.03,
163
- "eval_steps_per_second": 3.741,
164
  "num_input_tokens_seen": 43339,
165
  "step": 40
166
  },
167
  {
168
  "epoch": 0.7652173913043478,
169
- "eval_loss": 0.1449701488018036,
170
  "eval_num_tokens": 51343.0,
171
- "eval_runtime": 2.1082,
172
- "eval_samples_per_second": 14.23,
173
- "eval_steps_per_second": 3.795,
174
  "num_input_tokens_seen": 51343,
175
  "step": 44
176
  },
177
  {
178
  "epoch": 0.8347826086956521,
179
- "eval_loss": 0.12524840235710144,
180
  "eval_num_tokens": 55787.0,
181
- "eval_runtime": 2.1038,
182
- "eval_samples_per_second": 14.26,
183
- "eval_steps_per_second": 3.803,
184
  "num_input_tokens_seen": 55787,
185
  "step": 48
186
  },
187
  {
188
  "epoch": 0.8695652173913043,
189
- "grad_norm": 1.0154601335525513,
190
  "learning_rate": 3.5097594261349764e-05,
191
- "loss": 0.07467616200447083,
192
  "num_input_tokens_seen": 56637,
193
  "num_tokens": 56637.0,
194
  "step": 50,
195
- "train_runtime": 341.3231,
196
- "train_tokens_per_second": 165.934
197
  },
198
  {
199
  "epoch": 0.9043478260869565,
200
- "eval_loss": 0.11500633507966995,
201
  "eval_num_tokens": 60640.0,
202
- "eval_runtime": 2.0996,
203
- "eval_samples_per_second": 14.288,
204
- "eval_steps_per_second": 3.81,
205
  "num_input_tokens_seen": 60640,
206
  "step": 52
207
  },
208
  {
209
  "epoch": 0.9739130434782609,
210
- "eval_loss": 0.10254310816526413,
211
  "eval_num_tokens": 66252.0,
212
- "eval_runtime": 2.1287,
213
- "eval_samples_per_second": 14.093,
214
- "eval_steps_per_second": 3.758,
215
  "num_input_tokens_seen": 66252,
216
  "step": 56
217
  },
218
  {
219
  "epoch": 1.0,
220
- "eval_loss": 0.09790374338626862,
221
  "eval_num_tokens": 67398.0,
222
- "eval_runtime": 2.0904,
223
- "eval_samples_per_second": 14.351,
224
- "eval_steps_per_second": 3.827,
225
  "num_input_tokens_seen": 67398,
226
  "step": 58
227
  }
@@ -243,7 +243,7 @@
243
  "attributes": {}
244
  }
245
  },
246
- "total_flos": 270336498597888.0,
247
  "train_batch_size": 1,
248
  "trial_name": null,
249
  "trial_params": null
 
13
  "epoch": 0.017391304347826087,
14
  "grad_norm": NaN,
15
  "learning_rate": 0.0,
16
+ "loss": 2.5696372985839844,
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
+ "train_runtime": 36.3516,
21
+ "train_tokens_per_second": 41.099
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
+ "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
+ "eval_runtime": 28.3903,
28
+ "eval_samples_per_second": 1.057,
29
+ "eval_steps_per_second": 0.282,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
32
  },
33
  {
34
  "epoch": 0.1391304347826087,
35
+ "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
+ "eval_runtime": 3.1825,
38
+ "eval_samples_per_second": 9.427,
39
+ "eval_steps_per_second": 2.514,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
+ "grad_norm": 28.139263153076172,
46
+ "learning_rate": 0.0,
47
+ "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
+ "train_runtime": 137.8118,
52
+ "train_tokens_per_second": 80.871
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
+ "eval_loss": 1.8169835805892944,
57
  "eval_num_tokens": 13293.0,
58
+ "eval_runtime": 3.1498,
59
+ "eval_samples_per_second": 9.525,
60
+ "eval_steps_per_second": 2.54,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
+ "eval_loss": 0.6515728831291199,
67
  "eval_num_tokens": 17742.0,
68
+ "eval_runtime": 3.1545,
69
+ "eval_samples_per_second": 9.51,
70
+ "eval_steps_per_second": 2.536,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
+ "grad_norm": 20.463083267211914,
77
  "learning_rate": 0.0001425726650926814,
78
+ "loss": 0.7741940021514893,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
+ "train_runtime": 223.0367,
83
+ "train_tokens_per_second": 90.855
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
+ "eval_loss": 0.3478561341762543,
88
  "eval_num_tokens": 20264.0,
89
+ "eval_runtime": 3.1698,
90
+ "eval_samples_per_second": 9.464,
91
+ "eval_steps_per_second": 2.524,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
+ "eval_loss": 0.3752416670322418,
98
  "eval_num_tokens": 24990.0,
99
+ "eval_runtime": 3.1322,
100
+ "eval_samples_per_second": 9.578,
101
+ "eval_steps_per_second": 2.554,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
+ "eval_loss": 0.3061341643333435,
108
  "eval_num_tokens": 28628.0,
109
+ "eval_runtime": 3.1408,
110
+ "eval_samples_per_second": 9.552,
111
+ "eval_steps_per_second": 2.547,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
+ "grad_norm": 3.9868009090423584,
118
  "learning_rate": 0.00011490240573865023,
119
+ "loss": 0.19884855747222902,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
+ "train_runtime": 304.1359,
124
+ "train_tokens_per_second": 100.626
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
+ "eval_loss": 0.25844958424568176,
129
  "eval_num_tokens": 33017.0,
130
+ "eval_runtime": 3.1661,
131
+ "eval_samples_per_second": 9.475,
132
+ "eval_steps_per_second": 2.527,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  },
136
  {
137
  "epoch": 0.6260869565217392,
138
+ "eval_loss": 0.21466659009456635,
139
  "eval_num_tokens": 37556.0,
140
+ "eval_runtime": 3.2027,
141
+ "eval_samples_per_second": 9.367,
142
+ "eval_steps_per_second": 2.498,
143
  "num_input_tokens_seen": 37556,
144
  "step": 36
145
  },
146
  {
147
  "epoch": 0.6956521739130435,
148
+ "grad_norm": 2.9145026206970215,
149
  "learning_rate": 7.5e-05,
150
+ "loss": 0.11073940992355347,
151
  "num_input_tokens_seen": 43339,
152
  "num_tokens": 43339.0,
153
  "step": 40,
154
+ "train_runtime": 370.1019,
155
+ "train_tokens_per_second": 117.1
156
  },
157
  {
158
  "epoch": 0.6956521739130435,
159
+ "eval_loss": 0.20814543962478638,
160
  "eval_num_tokens": 43339.0,
161
+ "eval_runtime": 3.2117,
162
+ "eval_samples_per_second": 9.341,
163
+ "eval_steps_per_second": 2.491,
164
  "num_input_tokens_seen": 43339,
165
  "step": 40
166
  },
167
  {
168
  "epoch": 0.7652173913043478,
169
+ "eval_loss": 0.13490967452526093,
170
  "eval_num_tokens": 51343.0,
171
+ "eval_runtime": 3.1593,
172
+ "eval_samples_per_second": 9.496,
173
+ "eval_steps_per_second": 2.532,
174
  "num_input_tokens_seen": 51343,
175
  "step": 44
176
  },
177
  {
178
  "epoch": 0.8347826086956521,
179
+ "eval_loss": 0.11187396198511124,
180
  "eval_num_tokens": 55787.0,
181
+ "eval_runtime": 3.1694,
182
+ "eval_samples_per_second": 9.465,
183
+ "eval_steps_per_second": 2.524,
184
  "num_input_tokens_seen": 55787,
185
  "step": 48
186
  },
187
  {
188
  "epoch": 0.8695652173913043,
189
+ "grad_norm": 1.7305588722229004,
190
  "learning_rate": 3.5097594261349764e-05,
191
+ "loss": 0.10026404857635499,
192
  "num_input_tokens_seen": 56637,
193
  "num_tokens": 56637.0,
194
  "step": 50,
195
+ "train_runtime": 448.4165,
196
+ "train_tokens_per_second": 126.304
197
  },
198
  {
199
  "epoch": 0.9043478260869565,
200
+ "eval_loss": 0.11084464192390442,
201
  "eval_num_tokens": 60640.0,
202
+ "eval_runtime": 3.1284,
203
+ "eval_samples_per_second": 9.589,
204
+ "eval_steps_per_second": 2.557,
205
  "num_input_tokens_seen": 60640,
206
  "step": 52
207
  },
208
  {
209
  "epoch": 0.9739130434782609,
210
+ "eval_loss": 0.10104832798242569,
211
  "eval_num_tokens": 66252.0,
212
+ "eval_runtime": 3.1587,
213
+ "eval_samples_per_second": 9.498,
214
+ "eval_steps_per_second": 2.533,
215
  "num_input_tokens_seen": 66252,
216
  "step": 56
217
  },
218
  {
219
  "epoch": 1.0,
220
+ "eval_loss": 0.09292192757129669,
221
  "eval_num_tokens": 67398.0,
222
+ "eval_runtime": 3.1225,
223
+ "eval_samples_per_second": 9.608,
224
+ "eval_steps_per_second": 2.562,
225
  "num_input_tokens_seen": 67398,
226
  "step": 58
227
  }
 
243
  "attributes": {}
244
  }
245
  },
246
+ "total_flos": 373164151930880.0,
247
  "train_batch_size": 1,
248
  "trial_name": null,
249
  "trial_params": null